{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 32607, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.0667284838855267, "epoch": 9.20063714412223e-05, "grad_norm": 15.893442153930664, "learning_rate": 0.0001, "loss": 1.3744, "mean_token_accuracy": 0.6716951392591, "num_tokens": 32043.0, "step": 1 }, { "entropy": 2.8813244104385376, "epoch": 0.0001840127428824446, "grad_norm": 7.945219993591309, "learning_rate": 9.999693317385837e-05, "loss": 3.2837, "mean_token_accuracy": 0.45890693739056587, "num_tokens": 64000.0, "step": 2 }, { "entropy": 1.9456694647669792, "epoch": 0.0002760191143236669, "grad_norm": 1.9805350303649902, "learning_rate": 9.999386634771675e-05, "loss": 2.225, "mean_token_accuracy": 0.5570643804967403, "num_tokens": 96394.0, "step": 3 }, { "entropy": 1.491881251335144, "epoch": 0.0003680254857648892, "grad_norm": 0.6315288543701172, "learning_rate": 9.999079952157514e-05, "loss": 1.6004, "mean_token_accuracy": 0.6262646466493607, "num_tokens": 128843.0, "step": 4 }, { "entropy": 1.204836416989565, "epoch": 0.0004600318572061115, "grad_norm": 0.5164754390716553, "learning_rate": 9.99877326954335e-05, "loss": 1.4138, "mean_token_accuracy": 0.6705983318388462, "num_tokens": 161036.0, "step": 5 }, { "entropy": 1.1962174996733665, "epoch": 0.0005520382286473338, "grad_norm": 2.0098628997802734, "learning_rate": 9.998466586929187e-05, "loss": 1.6444, "mean_token_accuracy": 0.639203991740942, "num_tokens": 192703.0, "step": 6 }, { "entropy": 1.1457996368408203, "epoch": 0.0006440446000885561, "grad_norm": 0.3965838849544525, "learning_rate": 9.998159904315025e-05, "loss": 1.3046, "mean_token_accuracy": 0.6767523474991322, "num_tokens": 224101.0, "step": 7 }, { "entropy": 1.1448344737291336, "epoch": 0.0007360509715297784, "grad_norm": 1.4503222703933716, "learning_rate": 9.997853221700862e-05, "loss": 1.3455, "mean_token_accuracy": 0.6773927994072437, "num_tokens": 255025.0, "step": 8 }, { "entropy": 1.2764364778995514, "epoch": 0.0008280573429710008, "grad_norm": 0.35333123803138733, "learning_rate": 9.9975465390867e-05, "loss": 1.3044, "mean_token_accuracy": 0.6737880185246468, "num_tokens": 286786.0, "step": 9 }, { "entropy": 1.2712209224700928, "epoch": 0.000920063714412223, "grad_norm": 0.26453709602355957, "learning_rate": 9.997239856472537e-05, "loss": 1.2955, "mean_token_accuracy": 0.6700094677507877, "num_tokens": 318609.0, "step": 10 }, { "entropy": 1.1138665080070496, "epoch": 0.0010120700858534453, "grad_norm": 0.27728816866874695, "learning_rate": 9.996933173858375e-05, "loss": 1.1502, "mean_token_accuracy": 0.7026896476745605, "num_tokens": 350295.0, "step": 11 }, { "entropy": 1.1433785781264305, "epoch": 0.0011040764572946677, "grad_norm": 0.22404825687408447, "learning_rate": 9.996626491244212e-05, "loss": 1.2029, "mean_token_accuracy": 0.6917385309934616, "num_tokens": 382004.0, "step": 12 }, { "entropy": 1.1485241651535034, "epoch": 0.00119608282873589, "grad_norm": 0.21652007102966309, "learning_rate": 9.996319808630049e-05, "loss": 1.2024, "mean_token_accuracy": 0.6947129927575588, "num_tokens": 414590.0, "step": 13 }, { "entropy": 1.1348076686263084, "epoch": 0.0012880892001771122, "grad_norm": 0.2439424693584442, "learning_rate": 9.996013126015887e-05, "loss": 1.121, "mean_token_accuracy": 0.7054240368306637, "num_tokens": 447045.0, "step": 14 }, { "entropy": 1.0515992045402527, "epoch": 0.0013800955716183345, "grad_norm": 0.24095486104488373, "learning_rate": 9.995706443401725e-05, "loss": 1.0491, "mean_token_accuracy": 0.7255404032766819, "num_tokens": 478415.0, "step": 15 }, { "entropy": 1.1961029656231403, "epoch": 0.0014721019430595568, "grad_norm": 0.23444510996341705, "learning_rate": 9.995399760787562e-05, "loss": 1.2147, "mean_token_accuracy": 0.6856391355395317, "num_tokens": 510753.0, "step": 16 }, { "entropy": 1.0586777180433273, "epoch": 0.0015641083145007792, "grad_norm": 0.21574203670024872, "learning_rate": 9.995093078173399e-05, "loss": 1.0934, "mean_token_accuracy": 0.7118845842778683, "num_tokens": 542882.0, "step": 17 }, { "entropy": 1.2174208275973797, "epoch": 0.0016561146859420015, "grad_norm": 0.23548097908496857, "learning_rate": 9.994786395559235e-05, "loss": 1.2737, "mean_token_accuracy": 0.6743902489542961, "num_tokens": 574353.0, "step": 18 }, { "entropy": 1.1256860978901386, "epoch": 0.0017481210573832239, "grad_norm": 0.2055496722459793, "learning_rate": 9.994479712945073e-05, "loss": 1.1642, "mean_token_accuracy": 0.6958713382482529, "num_tokens": 606581.0, "step": 19 }, { "entropy": 1.0308941081166267, "epoch": 0.001840127428824446, "grad_norm": 0.20362018048763275, "learning_rate": 9.994173030330912e-05, "loss": 1.0365, "mean_token_accuracy": 0.7224165089428425, "num_tokens": 638668.0, "step": 20 }, { "entropy": 1.2041791826486588, "epoch": 0.0019321338002656683, "grad_norm": 0.31872403621673584, "learning_rate": 9.993866347716748e-05, "loss": 1.2492, "mean_token_accuracy": 0.685604389756918, "num_tokens": 670104.0, "step": 21 }, { "entropy": 1.1800084374845028, "epoch": 0.0020241401717068907, "grad_norm": 0.2158932238817215, "learning_rate": 9.993559665102585e-05, "loss": 1.1974, "mean_token_accuracy": 0.6903716772794724, "num_tokens": 702052.0, "step": 22 }, { "entropy": 1.1455806605517864, "epoch": 0.002116146543148113, "grad_norm": 0.2111409455537796, "learning_rate": 9.993252982488423e-05, "loss": 1.1461, "mean_token_accuracy": 0.6971441358327866, "num_tokens": 733600.0, "step": 23 }, { "entropy": 1.0466794520616531, "epoch": 0.0022081529145893354, "grad_norm": 0.27453601360321045, "learning_rate": 9.99294629987426e-05, "loss": 1.0335, "mean_token_accuracy": 0.7275227941572666, "num_tokens": 765408.0, "step": 24 }, { "entropy": 1.120854638516903, "epoch": 0.0023001592860305577, "grad_norm": 0.20742784440517426, "learning_rate": 9.992639617260098e-05, "loss": 1.096, "mean_token_accuracy": 0.7104541622102261, "num_tokens": 797954.0, "step": 25 }, { "entropy": 1.1934521719813347, "epoch": 0.00239216565747178, "grad_norm": 0.2353135347366333, "learning_rate": 9.992332934645935e-05, "loss": 1.1969, "mean_token_accuracy": 0.6894397512078285, "num_tokens": 830357.0, "step": 26 }, { "entropy": 1.0816687010228634, "epoch": 0.0024841720289130024, "grad_norm": 0.20302598178386688, "learning_rate": 9.992026252031773e-05, "loss": 1.0882, "mean_token_accuracy": 0.7138861753046513, "num_tokens": 862657.0, "step": 27 }, { "entropy": 1.1710936054587364, "epoch": 0.0025761784003542243, "grad_norm": 0.2950412929058075, "learning_rate": 9.99171956941761e-05, "loss": 1.2213, "mean_token_accuracy": 0.6872150637209415, "num_tokens": 894761.0, "step": 28 }, { "entropy": 1.0848508141934872, "epoch": 0.0026681847717954467, "grad_norm": 0.22355246543884277, "learning_rate": 9.991412886803447e-05, "loss": 1.1243, "mean_token_accuracy": 0.7048648484051228, "num_tokens": 925967.0, "step": 29 }, { "entropy": 1.2089909054338932, "epoch": 0.002760191143236669, "grad_norm": 0.2289072871208191, "learning_rate": 9.991106204189285e-05, "loss": 1.2091, "mean_token_accuracy": 0.6832928396761417, "num_tokens": 957524.0, "step": 30 }, { "entropy": 1.2757915444672108, "epoch": 0.0028521975146778913, "grad_norm": 0.2619670629501343, "learning_rate": 9.990799521575123e-05, "loss": 1.312, "mean_token_accuracy": 0.6680754534900188, "num_tokens": 988738.0, "step": 31 }, { "entropy": 1.1263886131346226, "epoch": 0.0029442038861191137, "grad_norm": 0.42301061749458313, "learning_rate": 9.99049283896096e-05, "loss": 1.1402, "mean_token_accuracy": 0.7081449925899506, "num_tokens": 1019851.0, "step": 32 }, { "entropy": 1.1219137981534004, "epoch": 0.003036210257560336, "grad_norm": 0.22893165051937103, "learning_rate": 9.990186156346797e-05, "loss": 1.1133, "mean_token_accuracy": 0.7073247544467449, "num_tokens": 1051554.0, "step": 33 }, { "entropy": 1.0775936767458916, "epoch": 0.0031282166290015584, "grad_norm": 0.1935524195432663, "learning_rate": 9.989879473732635e-05, "loss": 1.0592, "mean_token_accuracy": 0.7178852446377277, "num_tokens": 1084107.0, "step": 34 }, { "entropy": 1.088371992111206, "epoch": 0.0032202230004427807, "grad_norm": 0.21425174176692963, "learning_rate": 9.989572791118472e-05, "loss": 1.1229, "mean_token_accuracy": 0.7036660052835941, "num_tokens": 1115946.0, "step": 35 }, { "entropy": 1.1267016679048538, "epoch": 0.003312229371884003, "grad_norm": 0.21512165665626526, "learning_rate": 9.98926610850431e-05, "loss": 1.1506, "mean_token_accuracy": 0.6959264352917671, "num_tokens": 1147753.0, "step": 36 }, { "entropy": 0.9860531277954578, "epoch": 0.0034042357433252254, "grad_norm": 0.20237453281879425, "learning_rate": 9.988959425890146e-05, "loss": 1.0075, "mean_token_accuracy": 0.7293110303580761, "num_tokens": 1179873.0, "step": 37 }, { "entropy": 1.2115809097886086, "epoch": 0.0034962421147664477, "grad_norm": 0.21071083843708038, "learning_rate": 9.988652743275985e-05, "loss": 1.2138, "mean_token_accuracy": 0.687472153455019, "num_tokens": 1211906.0, "step": 38 }, { "entropy": 1.0664190016686916, "epoch": 0.00358824848620767, "grad_norm": 0.19886374473571777, "learning_rate": 9.988346060661821e-05, "loss": 1.058, "mean_token_accuracy": 0.71553760394454, "num_tokens": 1244426.0, "step": 39 }, { "entropy": 1.1510485298931599, "epoch": 0.003680254857648892, "grad_norm": 0.19857457280158997, "learning_rate": 9.988039378047658e-05, "loss": 1.1691, "mean_token_accuracy": 0.6979049108922482, "num_tokens": 1276002.0, "step": 40 }, { "entropy": 1.165607638657093, "epoch": 0.0037722612290901143, "grad_norm": 0.19593724608421326, "learning_rate": 9.987732695433496e-05, "loss": 1.1344, "mean_token_accuracy": 0.6992177776992321, "num_tokens": 1307262.0, "step": 41 }, { "entropy": 1.1791815012693405, "epoch": 0.0038642676005313367, "grad_norm": 0.20384101569652557, "learning_rate": 9.987426012819335e-05, "loss": 1.1838, "mean_token_accuracy": 0.6937372386455536, "num_tokens": 1339221.0, "step": 42 }, { "entropy": 1.172286819666624, "epoch": 0.0039562739719725595, "grad_norm": 0.19468903541564941, "learning_rate": 9.987119330205171e-05, "loss": 1.1751, "mean_token_accuracy": 0.6908092014491558, "num_tokens": 1370441.0, "step": 43 }, { "entropy": 1.081815343350172, "epoch": 0.004048280343413781, "grad_norm": 0.2200634777545929, "learning_rate": 9.986812647591008e-05, "loss": 1.0664, "mean_token_accuracy": 0.7244240567088127, "num_tokens": 1401754.0, "step": 44 }, { "entropy": 1.2078289203345776, "epoch": 0.004140286714855003, "grad_norm": 0.19776010513305664, "learning_rate": 9.986505964976846e-05, "loss": 1.2207, "mean_token_accuracy": 0.6822244971990585, "num_tokens": 1433814.0, "step": 45 }, { "entropy": 1.1718518324196339, "epoch": 0.004232293086296226, "grad_norm": 0.1949436366558075, "learning_rate": 9.986199282362684e-05, "loss": 1.1766, "mean_token_accuracy": 0.689038347452879, "num_tokens": 1466150.0, "step": 46 }, { "entropy": 1.1159547194838524, "epoch": 0.004324299457737448, "grad_norm": 0.18857932090759277, "learning_rate": 9.985892599748521e-05, "loss": 1.1349, "mean_token_accuracy": 0.694551058113575, "num_tokens": 1498097.0, "step": 47 }, { "entropy": 1.0545888021588326, "epoch": 0.004416305829178671, "grad_norm": 0.17756043374538422, "learning_rate": 9.985585917134358e-05, "loss": 1.0355, "mean_token_accuracy": 0.7207311727106571, "num_tokens": 1529768.0, "step": 48 }, { "entropy": 1.2191857025027275, "epoch": 0.004508312200619893, "grad_norm": 0.1978643387556076, "learning_rate": 9.985279234520195e-05, "loss": 1.2319, "mean_token_accuracy": 0.6804237402975559, "num_tokens": 1561641.0, "step": 49 }, { "entropy": 1.067577201873064, "epoch": 0.0046003185720611154, "grad_norm": 0.18102110922336578, "learning_rate": 9.984972551906033e-05, "loss": 1.0732, "mean_token_accuracy": 0.7154321148991585, "num_tokens": 1594025.0, "step": 50 }, { "entropy": 1.082532148808241, "epoch": 0.004692324943502337, "grad_norm": 0.1834568977355957, "learning_rate": 9.984665869291871e-05, "loss": 1.0925, "mean_token_accuracy": 0.7136896662414074, "num_tokens": 1625865.0, "step": 51 }, { "entropy": 1.1882275715470314, "epoch": 0.00478433131494356, "grad_norm": 0.19145984947681427, "learning_rate": 9.984359186677708e-05, "loss": 1.1896, "mean_token_accuracy": 0.6846486479043961, "num_tokens": 1657728.0, "step": 52 }, { "entropy": 0.9871219620108604, "epoch": 0.004876337686384782, "grad_norm": 0.18753796815872192, "learning_rate": 9.984052504063545e-05, "loss": 1.0052, "mean_token_accuracy": 0.7346924133598804, "num_tokens": 1690329.0, "step": 53 }, { "entropy": 1.049861989915371, "epoch": 0.004968344057826005, "grad_norm": 0.19207102060317993, "learning_rate": 9.983745821449383e-05, "loss": 1.0752, "mean_token_accuracy": 0.7105509489774704, "num_tokens": 1722832.0, "step": 54 }, { "entropy": 1.0746104791760445, "epoch": 0.005060350429267227, "grad_norm": 0.4220045506954193, "learning_rate": 9.98343913883522e-05, "loss": 1.1222, "mean_token_accuracy": 0.7099413871765137, "num_tokens": 1755600.0, "step": 55 }, { "entropy": 1.190536953508854, "epoch": 0.005152356800708449, "grad_norm": 0.19676953554153442, "learning_rate": 9.983132456221058e-05, "loss": 1.1398, "mean_token_accuracy": 0.6977646127343178, "num_tokens": 1787337.0, "step": 56 }, { "entropy": 1.326043676584959, "epoch": 0.005244363172149671, "grad_norm": 0.39878496527671814, "learning_rate": 9.982825773606894e-05, "loss": 1.2605, "mean_token_accuracy": 0.6741001829504967, "num_tokens": 1819095.0, "step": 57 }, { "entropy": 1.07636122033, "epoch": 0.005336369543590893, "grad_norm": 0.1924779862165451, "learning_rate": 9.982519090992733e-05, "loss": 1.0969, "mean_token_accuracy": 0.706939484924078, "num_tokens": 1850593.0, "step": 58 }, { "entropy": 1.0179176963865757, "epoch": 0.005428375915032116, "grad_norm": 0.20269745588302612, "learning_rate": 9.98221240837857e-05, "loss": 1.0597, "mean_token_accuracy": 0.7214597202837467, "num_tokens": 1882091.0, "step": 59 }, { "entropy": 0.987612746655941, "epoch": 0.005520382286473338, "grad_norm": 0.20211850106716156, "learning_rate": 9.981905725764406e-05, "loss": 1.0485, "mean_token_accuracy": 0.7169143334031105, "num_tokens": 1913474.0, "step": 60 }, { "entropy": 0.9966298453509808, "epoch": 0.005612388657914561, "grad_norm": 0.19133584201335907, "learning_rate": 9.981599043150244e-05, "loss": 1.0422, "mean_token_accuracy": 0.7224424257874489, "num_tokens": 1945522.0, "step": 61 }, { "entropy": 1.1048134565353394, "epoch": 0.005704395029355783, "grad_norm": 0.19354288280010223, "learning_rate": 9.981292360536082e-05, "loss": 1.1547, "mean_token_accuracy": 0.6927171051502228, "num_tokens": 1978033.0, "step": 62 }, { "entropy": 1.1163930743932724, "epoch": 0.0057964014007970055, "grad_norm": 0.20973046123981476, "learning_rate": 9.980985677921919e-05, "loss": 1.1142, "mean_token_accuracy": 0.7007377371191978, "num_tokens": 2008721.0, "step": 63 }, { "entropy": 1.11024309694767, "epoch": 0.005888407772238227, "grad_norm": 0.18586821854114532, "learning_rate": 9.980678995307756e-05, "loss": 1.1115, "mean_token_accuracy": 0.7096363380551338, "num_tokens": 2039797.0, "step": 64 }, { "entropy": 1.1026447750627995, "epoch": 0.00598041414367945, "grad_norm": 0.2010764479637146, "learning_rate": 9.980372312693594e-05, "loss": 1.0939, "mean_token_accuracy": 0.709170650690794, "num_tokens": 2071326.0, "step": 65 }, { "entropy": 1.0555282533168793, "epoch": 0.006072420515120672, "grad_norm": 0.1917371153831482, "learning_rate": 9.980065630079431e-05, "loss": 1.0527, "mean_token_accuracy": 0.7188236601650715, "num_tokens": 2104026.0, "step": 66 }, { "entropy": 1.1160909458994865, "epoch": 0.006164426886561895, "grad_norm": 0.21426288783550262, "learning_rate": 9.979758947465269e-05, "loss": 1.1107, "mean_token_accuracy": 0.7048729918897152, "num_tokens": 2136794.0, "step": 67 }, { "entropy": 1.006285447627306, "epoch": 0.006256433258003117, "grad_norm": 0.17311859130859375, "learning_rate": 9.979452264851106e-05, "loss": 0.9998, "mean_token_accuracy": 0.7299099713563919, "num_tokens": 2169462.0, "step": 68 }, { "entropy": 1.23557785525918, "epoch": 0.006348439629444339, "grad_norm": 0.19895704090595245, "learning_rate": 9.979145582236944e-05, "loss": 1.252, "mean_token_accuracy": 0.6738821007311344, "num_tokens": 2200877.0, "step": 69 }, { "entropy": 1.1019893176853657, "epoch": 0.0064404460008855614, "grad_norm": 0.18910272419452667, "learning_rate": 9.978838899622781e-05, "loss": 1.1202, "mean_token_accuracy": 0.6998571455478668, "num_tokens": 2231588.0, "step": 70 }, { "entropy": 1.0300692841410637, "epoch": 0.006532452372326783, "grad_norm": 0.18493330478668213, "learning_rate": 9.978532217008618e-05, "loss": 1.0702, "mean_token_accuracy": 0.7154638580977917, "num_tokens": 2263883.0, "step": 71 }, { "entropy": 1.1393884010612965, "epoch": 0.006624458743768006, "grad_norm": 0.19347243010997772, "learning_rate": 9.978225534394456e-05, "loss": 1.1797, "mean_token_accuracy": 0.6906083673238754, "num_tokens": 2296288.0, "step": 72 }, { "entropy": 1.0748408548533916, "epoch": 0.006716465115209228, "grad_norm": 0.18773241341114044, "learning_rate": 9.977918851780294e-05, "loss": 1.1091, "mean_token_accuracy": 0.7066237106919289, "num_tokens": 2327450.0, "step": 73 }, { "entropy": 1.0307633616030216, "epoch": 0.006808471486650451, "grad_norm": 0.1866629272699356, "learning_rate": 9.97761216916613e-05, "loss": 1.0411, "mean_token_accuracy": 0.7207498736679554, "num_tokens": 2359015.0, "step": 74 }, { "entropy": 1.045896802097559, "epoch": 0.006900477858091673, "grad_norm": 0.18500326573848724, "learning_rate": 9.977305486551967e-05, "loss": 1.0629, "mean_token_accuracy": 0.7127506658434868, "num_tokens": 2390830.0, "step": 75 }, { "entropy": 1.0593245476484299, "epoch": 0.0069924842295328955, "grad_norm": 0.17050045728683472, "learning_rate": 9.976998803937804e-05, "loss": 1.047, "mean_token_accuracy": 0.7208504602313042, "num_tokens": 2422785.0, "step": 76 }, { "entropy": 1.1434853821992874, "epoch": 0.007084490600974117, "grad_norm": 0.18553388118743896, "learning_rate": 9.976692121323644e-05, "loss": 1.1318, "mean_token_accuracy": 0.7010665126144886, "num_tokens": 2454468.0, "step": 77 }, { "entropy": 1.1408165097236633, "epoch": 0.00717649697241534, "grad_norm": 0.18438254296779633, "learning_rate": 9.97638543870948e-05, "loss": 1.118, "mean_token_accuracy": 0.6995579488575459, "num_tokens": 2485845.0, "step": 78 }, { "entropy": 1.0247646942734718, "epoch": 0.007268503343856562, "grad_norm": 0.17853163182735443, "learning_rate": 9.976078756095317e-05, "loss": 1.04, "mean_token_accuracy": 0.7206488102674484, "num_tokens": 2518370.0, "step": 79 }, { "entropy": 1.0868795104324818, "epoch": 0.007360509715297784, "grad_norm": 0.18062998354434967, "learning_rate": 9.975772073481154e-05, "loss": 1.0893, "mean_token_accuracy": 0.7098815627396107, "num_tokens": 2549367.0, "step": 80 }, { "entropy": 1.0856024138629436, "epoch": 0.007452516086739007, "grad_norm": 0.17523346841335297, "learning_rate": 9.975465390866992e-05, "loss": 1.087, "mean_token_accuracy": 0.7058769091963768, "num_tokens": 2581719.0, "step": 81 }, { "entropy": 1.0571518577635288, "epoch": 0.007544522458180229, "grad_norm": 0.18031632900238037, "learning_rate": 9.97515870825283e-05, "loss": 1.0688, "mean_token_accuracy": 0.71573830768466, "num_tokens": 2613770.0, "step": 82 }, { "entropy": 1.0958705246448517, "epoch": 0.0076365288296214515, "grad_norm": 0.18454986810684204, "learning_rate": 9.974852025638667e-05, "loss": 1.1103, "mean_token_accuracy": 0.70598429068923, "num_tokens": 2645771.0, "step": 83 }, { "entropy": 1.1435690522193909, "epoch": 0.007728535201062673, "grad_norm": 0.19003550708293915, "learning_rate": 9.974545343024504e-05, "loss": 1.1678, "mean_token_accuracy": 0.6923130080103874, "num_tokens": 2677562.0, "step": 84 }, { "entropy": 1.0437137372791767, "epoch": 0.007820541572503895, "grad_norm": 0.18445762991905212, "learning_rate": 9.974238660410342e-05, "loss": 1.0637, "mean_token_accuracy": 0.7191505506634712, "num_tokens": 2709465.0, "step": 85 }, { "entropy": 1.033041786402464, "epoch": 0.007912547943945119, "grad_norm": 0.18696832656860352, "learning_rate": 9.973931977796179e-05, "loss": 1.0749, "mean_token_accuracy": 0.7103376239538193, "num_tokens": 2741052.0, "step": 86 }, { "entropy": 1.1052805744111538, "epoch": 0.00800455431538634, "grad_norm": 0.18216514587402344, "learning_rate": 9.973625295182017e-05, "loss": 1.15, "mean_token_accuracy": 0.6966203674674034, "num_tokens": 2773631.0, "step": 87 }, { "entropy": 1.1706587970256805, "epoch": 0.008096560686827563, "grad_norm": 0.1851716786623001, "learning_rate": 9.973318612567854e-05, "loss": 1.1871, "mean_token_accuracy": 0.6885181404650211, "num_tokens": 2806328.0, "step": 88 }, { "entropy": 1.0726494491100311, "epoch": 0.008188567058268785, "grad_norm": 0.18485216796398163, "learning_rate": 9.973011929953692e-05, "loss": 1.0773, "mean_token_accuracy": 0.7048849239945412, "num_tokens": 2837765.0, "step": 89 }, { "entropy": 1.2616961225867271, "epoch": 0.008280573429710007, "grad_norm": 0.2037215232849121, "learning_rate": 9.972705247339529e-05, "loss": 1.2269, "mean_token_accuracy": 0.6795659698545933, "num_tokens": 2869965.0, "step": 90 }, { "entropy": 1.121584478765726, "epoch": 0.00837257980115123, "grad_norm": 0.17375269532203674, "learning_rate": 9.972398564725366e-05, "loss": 1.1206, "mean_token_accuracy": 0.7035504058003426, "num_tokens": 2902732.0, "step": 91 }, { "entropy": 1.0537205636501312, "epoch": 0.008464586172592452, "grad_norm": 0.18438859283924103, "learning_rate": 9.972091882111204e-05, "loss": 1.0591, "mean_token_accuracy": 0.7204208634793758, "num_tokens": 2934394.0, "step": 92 }, { "entropy": 1.0765618160367012, "epoch": 0.008556592544033674, "grad_norm": 0.18548394739627838, "learning_rate": 9.971785199497042e-05, "loss": 1.0946, "mean_token_accuracy": 0.7067177481949329, "num_tokens": 2966269.0, "step": 93 }, { "entropy": 1.1326740346848965, "epoch": 0.008648598915474896, "grad_norm": 0.18695706129074097, "learning_rate": 9.971478516882879e-05, "loss": 1.1364, "mean_token_accuracy": 0.7007706575095654, "num_tokens": 2998336.0, "step": 94 }, { "entropy": 1.1041999869048595, "epoch": 0.00874060528691612, "grad_norm": 0.17914101481437683, "learning_rate": 9.971171834268715e-05, "loss": 1.1128, "mean_token_accuracy": 0.7018284164369106, "num_tokens": 3030835.0, "step": 95 }, { "entropy": 1.0158977136015892, "epoch": 0.008832611658357341, "grad_norm": 0.1744915097951889, "learning_rate": 9.970865151654554e-05, "loss": 1.0195, "mean_token_accuracy": 0.7307408563792706, "num_tokens": 3062030.0, "step": 96 }, { "entropy": 1.110980585217476, "epoch": 0.008924618029798563, "grad_norm": 0.18282753229141235, "learning_rate": 9.97055846904039e-05, "loss": 1.1197, "mean_token_accuracy": 0.702539723366499, "num_tokens": 3094141.0, "step": 97 }, { "entropy": 1.0316043384373188, "epoch": 0.009016624401239785, "grad_norm": 0.18121623992919922, "learning_rate": 9.970251786426228e-05, "loss": 1.0654, "mean_token_accuracy": 0.7126892581582069, "num_tokens": 3126612.0, "step": 98 }, { "entropy": 1.0957234241068363, "epoch": 0.009108630772681009, "grad_norm": 0.18234795331954956, "learning_rate": 9.969945103812065e-05, "loss": 1.1237, "mean_token_accuracy": 0.698351114988327, "num_tokens": 3157958.0, "step": 99 }, { "entropy": 1.083721086382866, "epoch": 0.009200637144122231, "grad_norm": 0.17708368599414825, "learning_rate": 9.969638421197903e-05, "loss": 1.0797, "mean_token_accuracy": 0.7101627215743065, "num_tokens": 3190140.0, "step": 100 }, { "entropy": 1.0303197726607323, "epoch": 0.009292643515563453, "grad_norm": 0.17580947279930115, "learning_rate": 9.96933173858374e-05, "loss": 1.0418, "mean_token_accuracy": 0.722861647605896, "num_tokens": 3222104.0, "step": 101 }, { "entropy": 1.0852229669690132, "epoch": 0.009384649887004675, "grad_norm": 0.1876814216375351, "learning_rate": 9.969025055969577e-05, "loss": 1.0762, "mean_token_accuracy": 0.7111622951924801, "num_tokens": 3253985.0, "step": 102 }, { "entropy": 1.0656349509954453, "epoch": 0.009476656258445897, "grad_norm": 0.17324751615524292, "learning_rate": 9.968718373355415e-05, "loss": 1.0748, "mean_token_accuracy": 0.7125000432133675, "num_tokens": 3286359.0, "step": 103 }, { "entropy": 1.133026022464037, "epoch": 0.00956866262988712, "grad_norm": 0.19071149826049805, "learning_rate": 9.968411690741253e-05, "loss": 1.1509, "mean_token_accuracy": 0.6924744583666325, "num_tokens": 3318294.0, "step": 104 }, { "entropy": 1.0567429475486279, "epoch": 0.009660669001328342, "grad_norm": 0.184308722615242, "learning_rate": 9.96810500812709e-05, "loss": 1.071, "mean_token_accuracy": 0.7111519351601601, "num_tokens": 3349857.0, "step": 105 }, { "entropy": 1.1476225852966309, "epoch": 0.009752675372769564, "grad_norm": 0.17656715214252472, "learning_rate": 9.967798325512927e-05, "loss": 1.12, "mean_token_accuracy": 0.7016064189374447, "num_tokens": 3381786.0, "step": 106 }, { "entropy": 0.9738841466605663, "epoch": 0.009844681744210786, "grad_norm": 0.18338768184185028, "learning_rate": 9.967491642898764e-05, "loss": 0.9896, "mean_token_accuracy": 0.7332197390496731, "num_tokens": 3413128.0, "step": 107 }, { "entropy": 1.1190122663974762, "epoch": 0.00993668811565201, "grad_norm": 0.1801600456237793, "learning_rate": 9.967184960284602e-05, "loss": 1.1207, "mean_token_accuracy": 0.7012488469481468, "num_tokens": 3445319.0, "step": 108 }, { "entropy": 1.0729020908474922, "epoch": 0.010028694487093232, "grad_norm": 0.17818088829517365, "learning_rate": 9.96687827767044e-05, "loss": 1.0996, "mean_token_accuracy": 0.7114726230502129, "num_tokens": 3477870.0, "step": 109 }, { "entropy": 0.9894374907016754, "epoch": 0.010120700858534453, "grad_norm": 0.1673220843076706, "learning_rate": 9.966571595056277e-05, "loss": 1.0296, "mean_token_accuracy": 0.7245632782578468, "num_tokens": 3510356.0, "step": 110 }, { "entropy": 1.0988226309418678, "epoch": 0.010212707229975675, "grad_norm": 0.17366047203540802, "learning_rate": 9.966264912442113e-05, "loss": 1.1232, "mean_token_accuracy": 0.707622442394495, "num_tokens": 3542667.0, "step": 111 }, { "entropy": 1.023915782570839, "epoch": 0.010304713601416897, "grad_norm": 0.17236974835395813, "learning_rate": 9.965958229827952e-05, "loss": 1.0401, "mean_token_accuracy": 0.7258173190057278, "num_tokens": 3574433.0, "step": 112 }, { "entropy": 1.0756308734416962, "epoch": 0.010396719972858121, "grad_norm": 0.1818331927061081, "learning_rate": 9.965651547213788e-05, "loss": 1.0958, "mean_token_accuracy": 0.704191118478775, "num_tokens": 3606327.0, "step": 113 }, { "entropy": 1.0850714892148972, "epoch": 0.010488726344299343, "grad_norm": 0.17513324320316315, "learning_rate": 9.965344864599627e-05, "loss": 1.0801, "mean_token_accuracy": 0.7091819941997528, "num_tokens": 3638129.0, "step": 114 }, { "entropy": 1.2840271592140198, "epoch": 0.010580732715740565, "grad_norm": 0.19304576516151428, "learning_rate": 9.965038181985463e-05, "loss": 1.3104, "mean_token_accuracy": 0.6577373184263706, "num_tokens": 3670330.0, "step": 115 }, { "entropy": 1.070245523005724, "epoch": 0.010672739087181787, "grad_norm": 0.17702911794185638, "learning_rate": 9.964731499371301e-05, "loss": 1.0614, "mean_token_accuracy": 0.7105001769959927, "num_tokens": 3701810.0, "step": 116 }, { "entropy": 1.1323248483240604, "epoch": 0.01076474545862301, "grad_norm": 0.17637357115745544, "learning_rate": 9.964424816757138e-05, "loss": 1.1118, "mean_token_accuracy": 0.7014639340341091, "num_tokens": 3733961.0, "step": 117 }, { "entropy": 0.9435235187411308, "epoch": 0.010856751830064232, "grad_norm": 0.1700422763824463, "learning_rate": 9.964118134142975e-05, "loss": 0.912, "mean_token_accuracy": 0.7540346011519432, "num_tokens": 3766324.0, "step": 118 }, { "entropy": 1.0387593246996403, "epoch": 0.010948758201505454, "grad_norm": 0.17679983377456665, "learning_rate": 9.963811451528813e-05, "loss": 1.043, "mean_token_accuracy": 0.7226700335741043, "num_tokens": 3798399.0, "step": 119 }, { "entropy": 1.0451080091297626, "epoch": 0.011040764572946676, "grad_norm": 0.1833013892173767, "learning_rate": 9.963504768914651e-05, "loss": 1.0827, "mean_token_accuracy": 0.7135558277368546, "num_tokens": 3830949.0, "step": 120 }, { "entropy": 1.0882374159991741, "epoch": 0.0111327709443879, "grad_norm": 0.1769454926252365, "learning_rate": 9.963198086300488e-05, "loss": 1.1276, "mean_token_accuracy": 0.7030789442360401, "num_tokens": 3862243.0, "step": 121 }, { "entropy": 0.9281687214970589, "epoch": 0.011224777315829122, "grad_norm": 0.17013674974441528, "learning_rate": 9.962891403686325e-05, "loss": 0.9444, "mean_token_accuracy": 0.742885272949934, "num_tokens": 3894386.0, "step": 122 }, { "entropy": 1.033750969916582, "epoch": 0.011316783687270343, "grad_norm": 0.1758384257555008, "learning_rate": 9.962584721072162e-05, "loss": 1.0568, "mean_token_accuracy": 0.7223353795707226, "num_tokens": 3926782.0, "step": 123 }, { "entropy": 1.136779386550188, "epoch": 0.011408790058711565, "grad_norm": 0.18879708647727966, "learning_rate": 9.962278038458001e-05, "loss": 1.1352, "mean_token_accuracy": 0.6941037364304066, "num_tokens": 3958414.0, "step": 124 }, { "entropy": 1.105912957340479, "epoch": 0.011500796430152787, "grad_norm": 0.1762920320034027, "learning_rate": 9.961971355843838e-05, "loss": 1.1068, "mean_token_accuracy": 0.703526221215725, "num_tokens": 3990819.0, "step": 125 }, { "entropy": 1.0447328872978687, "epoch": 0.011592802801594011, "grad_norm": 0.19029872119426727, "learning_rate": 9.961664673229675e-05, "loss": 1.0377, "mean_token_accuracy": 0.721235129982233, "num_tokens": 4023295.0, "step": 126 }, { "entropy": 1.0258752293884754, "epoch": 0.011684809173035233, "grad_norm": 0.17486336827278137, "learning_rate": 9.961357990615513e-05, "loss": 1.043, "mean_token_accuracy": 0.7114723920822144, "num_tokens": 4055792.0, "step": 127 }, { "entropy": 1.1351664178073406, "epoch": 0.011776815544476455, "grad_norm": 0.1835290491580963, "learning_rate": 9.96105130800135e-05, "loss": 1.1606, "mean_token_accuracy": 0.6948552615940571, "num_tokens": 4087323.0, "step": 128 }, { "entropy": 1.0432838648557663, "epoch": 0.011868821915917677, "grad_norm": 0.18978850543498993, "learning_rate": 9.960744625387188e-05, "loss": 1.0704, "mean_token_accuracy": 0.7125457674264908, "num_tokens": 4119998.0, "step": 129 }, { "entropy": 1.0382169298827648, "epoch": 0.0119608282873589, "grad_norm": 0.17402221262454987, "learning_rate": 9.960437942773025e-05, "loss": 1.0428, "mean_token_accuracy": 0.7186609581112862, "num_tokens": 4151785.0, "step": 130 }, { "entropy": 0.9941658936440945, "epoch": 0.012052834658800122, "grad_norm": 0.17558282613754272, "learning_rate": 9.960131260158863e-05, "loss": 1.0007, "mean_token_accuracy": 0.7280302010476589, "num_tokens": 4183830.0, "step": 131 }, { "entropy": 1.0216947868466377, "epoch": 0.012144841030241344, "grad_norm": 0.1805516481399536, "learning_rate": 9.9598245775447e-05, "loss": 1.0407, "mean_token_accuracy": 0.7166652455925941, "num_tokens": 4215451.0, "step": 132 }, { "entropy": 1.0451236963272095, "epoch": 0.012236847401682566, "grad_norm": 0.18230095505714417, "learning_rate": 9.959517894930536e-05, "loss": 1.0667, "mean_token_accuracy": 0.7071390524506569, "num_tokens": 4247721.0, "step": 133 }, { "entropy": 0.9948875792324543, "epoch": 0.01232885377312379, "grad_norm": 0.18703404068946838, "learning_rate": 9.959211212316374e-05, "loss": 1.0102, "mean_token_accuracy": 0.729287151247263, "num_tokens": 4280102.0, "step": 134 }, { "entropy": 1.0634112022817135, "epoch": 0.012420860144565012, "grad_norm": 0.18192103505134583, "learning_rate": 9.958904529702213e-05, "loss": 1.0809, "mean_token_accuracy": 0.7082584127783775, "num_tokens": 4311981.0, "step": 135 }, { "entropy": 1.1690315753221512, "epoch": 0.012512866516006233, "grad_norm": 0.1822914481163025, "learning_rate": 9.95859784708805e-05, "loss": 1.1624, "mean_token_accuracy": 0.6938770450651646, "num_tokens": 4343337.0, "step": 136 }, { "entropy": 1.0696013569831848, "epoch": 0.012604872887447455, "grad_norm": 0.17731152474880219, "learning_rate": 9.958291164473886e-05, "loss": 1.0644, "mean_token_accuracy": 0.7144139632582664, "num_tokens": 4375251.0, "step": 137 }, { "entropy": 1.056776750832796, "epoch": 0.012696879258888677, "grad_norm": 0.17421656847000122, "learning_rate": 9.957984481859723e-05, "loss": 1.0549, "mean_token_accuracy": 0.7194741331040859, "num_tokens": 4407573.0, "step": 138 }, { "entropy": 0.9020832404494286, "epoch": 0.012788885630329901, "grad_norm": 0.1633674055337906, "learning_rate": 9.957677799245561e-05, "loss": 0.9044, "mean_token_accuracy": 0.7556024454534054, "num_tokens": 4439825.0, "step": 139 }, { "entropy": 1.0089088529348373, "epoch": 0.012880892001771123, "grad_norm": 0.18037532269954681, "learning_rate": 9.957371116631399e-05, "loss": 1.0301, "mean_token_accuracy": 0.7221655361354351, "num_tokens": 4470894.0, "step": 140 }, { "entropy": 1.033136684447527, "epoch": 0.012972898373212345, "grad_norm": 0.1732766330242157, "learning_rate": 9.957064434017236e-05, "loss": 1.068, "mean_token_accuracy": 0.7135338932275772, "num_tokens": 4503398.0, "step": 141 }, { "entropy": 0.9998885989189148, "epoch": 0.013064904744653567, "grad_norm": 0.17721126973628998, "learning_rate": 9.956757751403073e-05, "loss": 1.0133, "mean_token_accuracy": 0.7290425077080727, "num_tokens": 4534741.0, "step": 142 }, { "entropy": 0.9691000506281853, "epoch": 0.01315691111609479, "grad_norm": 0.18603132665157318, "learning_rate": 9.956451068788911e-05, "loss": 0.9715, "mean_token_accuracy": 0.7310564815998077, "num_tokens": 4567267.0, "step": 143 }, { "entropy": 1.1178338378667831, "epoch": 0.013248917487536012, "grad_norm": 0.18301568925380707, "learning_rate": 9.956144386174748e-05, "loss": 1.1393, "mean_token_accuracy": 0.6937997974455357, "num_tokens": 4599399.0, "step": 144 }, { "entropy": 1.012466624379158, "epoch": 0.013340923858977234, "grad_norm": 0.17691315710544586, "learning_rate": 9.955837703560586e-05, "loss": 1.0239, "mean_token_accuracy": 0.7204160578548908, "num_tokens": 4630289.0, "step": 145 }, { "entropy": 1.0570966117084026, "epoch": 0.013432930230418456, "grad_norm": 0.17416663467884064, "learning_rate": 9.955531020946423e-05, "loss": 1.0422, "mean_token_accuracy": 0.7184420041739941, "num_tokens": 4661510.0, "step": 146 }, { "entropy": 1.0585036389529705, "epoch": 0.013524936601859678, "grad_norm": 0.17640922963619232, "learning_rate": 9.955224338332261e-05, "loss": 1.0724, "mean_token_accuracy": 0.7158324383199215, "num_tokens": 4693678.0, "step": 147 }, { "entropy": 1.0154268220067024, "epoch": 0.013616942973300902, "grad_norm": 0.17352929711341858, "learning_rate": 9.954917655718098e-05, "loss": 1.0253, "mean_token_accuracy": 0.7224516868591309, "num_tokens": 4725627.0, "step": 148 }, { "entropy": 1.034794270992279, "epoch": 0.013708949344742124, "grad_norm": 0.17139284312725067, "learning_rate": 9.954610973103934e-05, "loss": 1.04, "mean_token_accuracy": 0.7241168990731239, "num_tokens": 4757512.0, "step": 149 }, { "entropy": 1.1209576539695263, "epoch": 0.013800955716183345, "grad_norm": 0.18446780741214752, "learning_rate": 9.954304290489773e-05, "loss": 1.1365, "mean_token_accuracy": 0.6923755146563053, "num_tokens": 4788745.0, "step": 150 }, { "entropy": 1.0725781880319118, "epoch": 0.013892962087624567, "grad_norm": 0.189184308052063, "learning_rate": 9.953997607875611e-05, "loss": 1.0938, "mean_token_accuracy": 0.7101431675255299, "num_tokens": 4819699.0, "step": 151 }, { "entropy": 1.0915080159902573, "epoch": 0.013984968459065791, "grad_norm": 0.18500500917434692, "learning_rate": 9.953690925261447e-05, "loss": 1.1154, "mean_token_accuracy": 0.7026957459747791, "num_tokens": 4850393.0, "step": 152 }, { "entropy": 0.937639731913805, "epoch": 0.014076974830507013, "grad_norm": 0.1730193942785263, "learning_rate": 9.953384242647284e-05, "loss": 0.9263, "mean_token_accuracy": 0.7394020035862923, "num_tokens": 4882557.0, "step": 153 }, { "entropy": 1.1863786354660988, "epoch": 0.014168981201948235, "grad_norm": 0.1915581077337265, "learning_rate": 9.953077560033122e-05, "loss": 1.1604, "mean_token_accuracy": 0.6907501555979252, "num_tokens": 4914020.0, "step": 154 }, { "entropy": 1.0118658803403378, "epoch": 0.014260987573389457, "grad_norm": 0.16420020163059235, "learning_rate": 9.952770877418959e-05, "loss": 1.0315, "mean_token_accuracy": 0.7209053263068199, "num_tokens": 4946504.0, "step": 155 }, { "entropy": 1.1827064417302608, "epoch": 0.01435299394483068, "grad_norm": 0.19992844760417938, "learning_rate": 9.952464194804797e-05, "loss": 1.2142, "mean_token_accuracy": 0.6828213706612587, "num_tokens": 4978513.0, "step": 156 }, { "entropy": 1.1684614419937134, "epoch": 0.014445000316271902, "grad_norm": 0.1951766461133957, "learning_rate": 9.952157512190634e-05, "loss": 1.2079, "mean_token_accuracy": 0.6831134855747223, "num_tokens": 5010828.0, "step": 157 }, { "entropy": 1.0371404737234116, "epoch": 0.014537006687713124, "grad_norm": 0.1801554560661316, "learning_rate": 9.951850829576472e-05, "loss": 1.0702, "mean_token_accuracy": 0.7141414321959019, "num_tokens": 5042103.0, "step": 158 }, { "entropy": 1.1546086817979813, "epoch": 0.014629013059154346, "grad_norm": 0.1825013905763626, "learning_rate": 9.951544146962309e-05, "loss": 1.167, "mean_token_accuracy": 0.6934010982513428, "num_tokens": 5073180.0, "step": 159 }, { "entropy": 1.0603557638823986, "epoch": 0.014721019430595568, "grad_norm": 0.17046773433685303, "learning_rate": 9.951237464348146e-05, "loss": 1.0773, "mean_token_accuracy": 0.7160672694444656, "num_tokens": 5105608.0, "step": 160 }, { "entropy": 0.9954036884009838, "epoch": 0.014813025802036792, "grad_norm": 0.17080140113830566, "learning_rate": 9.950930781733984e-05, "loss": 1.0012, "mean_token_accuracy": 0.7265287451446056, "num_tokens": 5137311.0, "step": 161 }, { "entropy": 0.9965865425765514, "epoch": 0.014905032173478014, "grad_norm": 0.182280033826828, "learning_rate": 9.950624099119822e-05, "loss": 1.0291, "mean_token_accuracy": 0.7281336486339569, "num_tokens": 5169735.0, "step": 162 }, { "entropy": 1.0358598940074444, "epoch": 0.014997038544919235, "grad_norm": 0.17245079576969147, "learning_rate": 9.950317416505659e-05, "loss": 1.0606, "mean_token_accuracy": 0.719555176794529, "num_tokens": 5201620.0, "step": 163 }, { "entropy": 1.1126755364239216, "epoch": 0.015089044916360457, "grad_norm": 0.17259301245212555, "learning_rate": 9.950010733891496e-05, "loss": 1.1028, "mean_token_accuracy": 0.7077676318585873, "num_tokens": 5233795.0, "step": 164 }, { "entropy": 1.1025396808981895, "epoch": 0.015181051287801681, "grad_norm": 0.16939501464366913, "learning_rate": 9.949704051277334e-05, "loss": 1.0794, "mean_token_accuracy": 0.7139687314629555, "num_tokens": 5264977.0, "step": 165 }, { "entropy": 1.0551231913268566, "epoch": 0.015273057659242903, "grad_norm": 0.17037580907344818, "learning_rate": 9.949397368663172e-05, "loss": 1.0413, "mean_token_accuracy": 0.7213192842900753, "num_tokens": 5296111.0, "step": 166 }, { "entropy": 1.123452853411436, "epoch": 0.015365064030684125, "grad_norm": 0.1779470592737198, "learning_rate": 9.949090686049009e-05, "loss": 1.1234, "mean_token_accuracy": 0.7065025307238102, "num_tokens": 5327243.0, "step": 167 }, { "entropy": 1.04978758841753, "epoch": 0.015457070402125347, "grad_norm": 0.1631164401769638, "learning_rate": 9.948784003434846e-05, "loss": 1.037, "mean_token_accuracy": 0.7182903625071049, "num_tokens": 5359642.0, "step": 168 }, { "entropy": 1.0534667447209358, "epoch": 0.015549076773566569, "grad_norm": 0.1729961782693863, "learning_rate": 9.948477320820682e-05, "loss": 1.0537, "mean_token_accuracy": 0.7168702408671379, "num_tokens": 5390436.0, "step": 169 }, { "entropy": 1.0613337643444538, "epoch": 0.01564108314500779, "grad_norm": 0.17368227243423462, "learning_rate": 9.94817063820652e-05, "loss": 1.1085, "mean_token_accuracy": 0.709616132080555, "num_tokens": 5423093.0, "step": 170 }, { "entropy": 0.9376764446496964, "epoch": 0.015733089516449014, "grad_norm": 0.15980516374111176, "learning_rate": 9.947863955592359e-05, "loss": 0.9481, "mean_token_accuracy": 0.7427655793726444, "num_tokens": 5455365.0, "step": 171 }, { "entropy": 1.0727378018200397, "epoch": 0.015825095887890238, "grad_norm": 0.17579393088817596, "learning_rate": 9.947557272978195e-05, "loss": 1.0873, "mean_token_accuracy": 0.7099951170384884, "num_tokens": 5487414.0, "step": 172 }, { "entropy": 1.042777244001627, "epoch": 0.015917102259331458, "grad_norm": 0.17277003824710846, "learning_rate": 9.947250590364032e-05, "loss": 1.0302, "mean_token_accuracy": 0.71774647757411, "num_tokens": 5519135.0, "step": 173 }, { "entropy": 1.0699250139296055, "epoch": 0.01600910863077268, "grad_norm": 0.18426410853862762, "learning_rate": 9.94694390774987e-05, "loss": 1.0659, "mean_token_accuracy": 0.7109970711171627, "num_tokens": 5550857.0, "step": 174 }, { "entropy": 1.0907160378992558, "epoch": 0.016101115002213902, "grad_norm": 0.17302244901657104, "learning_rate": 9.946637225135707e-05, "loss": 1.0969, "mean_token_accuracy": 0.7070281803607941, "num_tokens": 5582652.0, "step": 175 }, { "entropy": 1.0843562595546246, "epoch": 0.016193121373655125, "grad_norm": 0.1732192039489746, "learning_rate": 9.946330542521545e-05, "loss": 1.0937, "mean_token_accuracy": 0.7056828290224075, "num_tokens": 5614761.0, "step": 176 }, { "entropy": 1.0434652902185917, "epoch": 0.01628512774509635, "grad_norm": 0.17828090488910675, "learning_rate": 9.946023859907382e-05, "loss": 1.0766, "mean_token_accuracy": 0.7133230268955231, "num_tokens": 5647528.0, "step": 177 }, { "entropy": 1.0202577151358128, "epoch": 0.01637713411653757, "grad_norm": 0.18082240223884583, "learning_rate": 9.94571717729322e-05, "loss": 1.044, "mean_token_accuracy": 0.7185595631599426, "num_tokens": 5679999.0, "step": 178 }, { "entropy": 0.9970671012997627, "epoch": 0.016469140487978793, "grad_norm": 0.1666569709777832, "learning_rate": 9.945410494679057e-05, "loss": 1.0018, "mean_token_accuracy": 0.7270110733807087, "num_tokens": 5712313.0, "step": 179 }, { "entropy": 1.006702933460474, "epoch": 0.016561146859420013, "grad_norm": 0.16732476651668549, "learning_rate": 9.945103812064894e-05, "loss": 1.0299, "mean_token_accuracy": 0.717566329985857, "num_tokens": 5744643.0, "step": 180 }, { "entropy": 1.0571333318948746, "epoch": 0.016653153230861237, "grad_norm": 0.1745980978012085, "learning_rate": 9.944797129450732e-05, "loss": 1.061, "mean_token_accuracy": 0.7116348259150982, "num_tokens": 5776647.0, "step": 181 }, { "entropy": 0.9314371161162853, "epoch": 0.01674515960230246, "grad_norm": 0.16854697465896606, "learning_rate": 9.94449044683657e-05, "loss": 0.9454, "mean_token_accuracy": 0.7435161843895912, "num_tokens": 5808550.0, "step": 182 }, { "entropy": 1.026913408190012, "epoch": 0.01683716597374368, "grad_norm": 0.1700485348701477, "learning_rate": 9.944183764222407e-05, "loss": 1.0513, "mean_token_accuracy": 0.7180965468287468, "num_tokens": 5840629.0, "step": 183 }, { "entropy": 1.0966105721890926, "epoch": 0.016929172345184904, "grad_norm": 0.17706620693206787, "learning_rate": 9.943877081608244e-05, "loss": 1.126, "mean_token_accuracy": 0.6992902867496014, "num_tokens": 5872691.0, "step": 184 }, { "entropy": 1.0974591076374054, "epoch": 0.017021178716626128, "grad_norm": 0.18316107988357544, "learning_rate": 9.943570398994082e-05, "loss": 1.115, "mean_token_accuracy": 0.6996882744133472, "num_tokens": 5904599.0, "step": 185 }, { "entropy": 1.0567415244877338, "epoch": 0.017113185088067348, "grad_norm": 0.17517054080963135, "learning_rate": 9.943263716379919e-05, "loss": 1.074, "mean_token_accuracy": 0.7146077081561089, "num_tokens": 5936624.0, "step": 186 }, { "entropy": 1.0514247193932533, "epoch": 0.01720519145950857, "grad_norm": 0.19081106781959534, "learning_rate": 9.942957033765757e-05, "loss": 1.0542, "mean_token_accuracy": 0.7200583145022392, "num_tokens": 5968252.0, "step": 187 }, { "entropy": 1.1320592164993286, "epoch": 0.017297197830949792, "grad_norm": 0.17685173451900482, "learning_rate": 9.942650351151594e-05, "loss": 1.1212, "mean_token_accuracy": 0.698618657886982, "num_tokens": 6000105.0, "step": 188 }, { "entropy": 1.06346470490098, "epoch": 0.017389204202391016, "grad_norm": 0.17193131148815155, "learning_rate": 9.942343668537432e-05, "loss": 1.0708, "mean_token_accuracy": 0.7091571725904942, "num_tokens": 6032033.0, "step": 189 }, { "entropy": 1.041716579347849, "epoch": 0.01748121057383224, "grad_norm": 0.17374545335769653, "learning_rate": 9.942036985923268e-05, "loss": 1.0562, "mean_token_accuracy": 0.7153358533978462, "num_tokens": 6064049.0, "step": 190 }, { "entropy": 1.0139716528356075, "epoch": 0.01757321694527346, "grad_norm": 0.17219294607639313, "learning_rate": 9.941730303309105e-05, "loss": 1.0272, "mean_token_accuracy": 0.722566194832325, "num_tokens": 6095045.0, "step": 191 }, { "entropy": 0.9830888733267784, "epoch": 0.017665223316714683, "grad_norm": 0.17141008377075195, "learning_rate": 9.941423620694943e-05, "loss": 0.9854, "mean_token_accuracy": 0.7306378521025181, "num_tokens": 6127211.0, "step": 192 }, { "entropy": 1.0846739821135998, "epoch": 0.017757229688155903, "grad_norm": 0.1723085641860962, "learning_rate": 9.941116938080782e-05, "loss": 1.0821, "mean_token_accuracy": 0.7097069770097733, "num_tokens": 6159231.0, "step": 193 }, { "entropy": 0.937518822029233, "epoch": 0.017849236059597127, "grad_norm": 0.18954673409461975, "learning_rate": 9.940810255466618e-05, "loss": 0.936, "mean_token_accuracy": 0.7467454820871353, "num_tokens": 6191745.0, "step": 194 }, { "entropy": 1.0816699527204037, "epoch": 0.01794124243103835, "grad_norm": 0.18237680196762085, "learning_rate": 9.940503572852455e-05, "loss": 1.0907, "mean_token_accuracy": 0.7099614441394806, "num_tokens": 6223665.0, "step": 195 }, { "entropy": 1.0073212906718254, "epoch": 0.01803324880247957, "grad_norm": 0.17136633396148682, "learning_rate": 9.940196890238292e-05, "loss": 1.0353, "mean_token_accuracy": 0.7224341034889221, "num_tokens": 6255146.0, "step": 196 }, { "entropy": 1.0104856751859188, "epoch": 0.018125255173920794, "grad_norm": 0.1720370203256607, "learning_rate": 9.939890207624131e-05, "loss": 1.0442, "mean_token_accuracy": 0.7195315323770046, "num_tokens": 6287341.0, "step": 197 }, { "entropy": 0.9401248022913933, "epoch": 0.018217261545362018, "grad_norm": 0.1726427525281906, "learning_rate": 9.939583525009968e-05, "loss": 0.9578, "mean_token_accuracy": 0.736522663384676, "num_tokens": 6318967.0, "step": 198 }, { "entropy": 0.9967475347220898, "epoch": 0.018309267916803238, "grad_norm": 0.17046281695365906, "learning_rate": 9.939276842395805e-05, "loss": 1.0109, "mean_token_accuracy": 0.7263761423528194, "num_tokens": 6351358.0, "step": 199 }, { "entropy": 1.0387144275009632, "epoch": 0.018401274288244462, "grad_norm": 0.1755915731191635, "learning_rate": 9.938970159781642e-05, "loss": 1.0394, "mean_token_accuracy": 0.7176682725548744, "num_tokens": 6382909.0, "step": 200 }, { "entropy": 1.0051369480788708, "epoch": 0.018493280659685682, "grad_norm": 0.1623706817626953, "learning_rate": 9.93866347716748e-05, "loss": 0.9926, "mean_token_accuracy": 0.7339497320353985, "num_tokens": 6415624.0, "step": 201 }, { "entropy": 0.952204056084156, "epoch": 0.018585287031126906, "grad_norm": 0.17320609092712402, "learning_rate": 9.938356794553318e-05, "loss": 0.9504, "mean_token_accuracy": 0.7400987520813942, "num_tokens": 6446550.0, "step": 202 }, { "entropy": 1.0588614493608475, "epoch": 0.01867729340256813, "grad_norm": 0.17322760820388794, "learning_rate": 9.938050111939155e-05, "loss": 1.0573, "mean_token_accuracy": 0.7115290686488152, "num_tokens": 6479318.0, "step": 203 }, { "entropy": 1.0380604639649391, "epoch": 0.01876929977400935, "grad_norm": 0.17777806520462036, "learning_rate": 9.937743429324992e-05, "loss": 1.0591, "mean_token_accuracy": 0.7090704552829266, "num_tokens": 6510442.0, "step": 204 }, { "entropy": 0.99451944231987, "epoch": 0.018861306145450573, "grad_norm": 0.16736510396003723, "learning_rate": 9.93743674671083e-05, "loss": 0.9963, "mean_token_accuracy": 0.7252599634230137, "num_tokens": 6542415.0, "step": 205 }, { "entropy": 0.9844184592366219, "epoch": 0.018953312516891793, "grad_norm": 0.18517622351646423, "learning_rate": 9.937130064096667e-05, "loss": 1.0066, "mean_token_accuracy": 0.7265032194554806, "num_tokens": 6574502.0, "step": 206 }, { "entropy": 1.035576917231083, "epoch": 0.019045318888333017, "grad_norm": 0.1741742640733719, "learning_rate": 9.936823381482505e-05, "loss": 1.0491, "mean_token_accuracy": 0.7159487903118134, "num_tokens": 6606430.0, "step": 207 }, { "entropy": 0.9525736570358276, "epoch": 0.01913732525977424, "grad_norm": 0.16638284921646118, "learning_rate": 9.936516698868341e-05, "loss": 0.9748, "mean_token_accuracy": 0.7349927350878716, "num_tokens": 6638183.0, "step": 208 }, { "entropy": 1.1414592079818249, "epoch": 0.01922933163121546, "grad_norm": 0.17697302997112274, "learning_rate": 9.93621001625418e-05, "loss": 1.1442, "mean_token_accuracy": 0.6937038414180279, "num_tokens": 6669724.0, "step": 209 }, { "entropy": 1.0954368561506271, "epoch": 0.019321338002656684, "grad_norm": 0.1847495436668396, "learning_rate": 9.935903333640016e-05, "loss": 1.0898, "mean_token_accuracy": 0.703035693615675, "num_tokens": 6700961.0, "step": 210 }, { "entropy": 1.0242870301008224, "epoch": 0.019413344374097908, "grad_norm": 0.16485972702503204, "learning_rate": 9.935596651025853e-05, "loss": 1.0118, "mean_token_accuracy": 0.7284379340708256, "num_tokens": 6733540.0, "step": 211 }, { "entropy": 1.0484031476080418, "epoch": 0.019505350745539128, "grad_norm": 0.17411889135837555, "learning_rate": 9.935289968411691e-05, "loss": 1.0673, "mean_token_accuracy": 0.7132063210010529, "num_tokens": 6765886.0, "step": 212 }, { "entropy": 0.9708690419793129, "epoch": 0.019597357116980352, "grad_norm": 0.16723890602588654, "learning_rate": 9.93498328579753e-05, "loss": 0.9725, "mean_token_accuracy": 0.7321078032255173, "num_tokens": 6797605.0, "step": 213 }, { "entropy": 1.0366210862994194, "epoch": 0.019689363488421572, "grad_norm": 0.17233191430568695, "learning_rate": 9.934676603183366e-05, "loss": 1.0492, "mean_token_accuracy": 0.7130952589213848, "num_tokens": 6830167.0, "step": 214 }, { "entropy": 0.9746213294565678, "epoch": 0.019781369859862796, "grad_norm": 0.16717267036437988, "learning_rate": 9.934369920569203e-05, "loss": 0.9903, "mean_token_accuracy": 0.7313282191753387, "num_tokens": 6862028.0, "step": 215 }, { "entropy": 0.9781723245978355, "epoch": 0.01987337623130402, "grad_norm": 0.17425300180912018, "learning_rate": 9.934063237955041e-05, "loss": 1.0007, "mean_token_accuracy": 0.7261261530220509, "num_tokens": 6893433.0, "step": 216 }, { "entropy": 1.0848586782813072, "epoch": 0.01996538260274524, "grad_norm": 0.17312081158161163, "learning_rate": 9.933756555340878e-05, "loss": 1.0906, "mean_token_accuracy": 0.7051990665495396, "num_tokens": 6925307.0, "step": 217 }, { "entropy": 1.0657422728836536, "epoch": 0.020057388974186463, "grad_norm": 0.17260460555553436, "learning_rate": 9.933449872726716e-05, "loss": 1.0512, "mean_token_accuracy": 0.7107369191944599, "num_tokens": 6957480.0, "step": 218 }, { "entropy": 0.9927574396133423, "epoch": 0.020149395345627683, "grad_norm": 0.18328817188739777, "learning_rate": 9.933143190112553e-05, "loss": 1.0321, "mean_token_accuracy": 0.7282743565738201, "num_tokens": 6989781.0, "step": 219 }, { "entropy": 1.0282342210412025, "epoch": 0.020241401717068907, "grad_norm": 0.17313358187675476, "learning_rate": 9.932836507498391e-05, "loss": 1.0487, "mean_token_accuracy": 0.7234283275902271, "num_tokens": 7021039.0, "step": 220 }, { "entropy": 0.9458490014076233, "epoch": 0.02033340808851013, "grad_norm": 0.16703543066978455, "learning_rate": 9.932529824884228e-05, "loss": 0.9491, "mean_token_accuracy": 0.734752707183361, "num_tokens": 7053406.0, "step": 221 }, { "entropy": 0.8986207470297813, "epoch": 0.02042541445995135, "grad_norm": 0.15605689585208893, "learning_rate": 9.932223142270065e-05, "loss": 0.8957, "mean_token_accuracy": 0.751799687743187, "num_tokens": 7086042.0, "step": 222 }, { "entropy": 1.0543724969029427, "epoch": 0.020517420831392574, "grad_norm": 0.17028896510601044, "learning_rate": 9.931916459655903e-05, "loss": 1.0599, "mean_token_accuracy": 0.7119736634194851, "num_tokens": 7118196.0, "step": 223 }, { "entropy": 1.041070356965065, "epoch": 0.020609427202833795, "grad_norm": 0.16802090406417847, "learning_rate": 9.931609777041741e-05, "loss": 1.0373, "mean_token_accuracy": 0.722816102206707, "num_tokens": 7149702.0, "step": 224 }, { "entropy": 0.9995945934206247, "epoch": 0.020701433574275018, "grad_norm": 0.17345477640628815, "learning_rate": 9.931303094427578e-05, "loss": 1.0295, "mean_token_accuracy": 0.7267900444567204, "num_tokens": 7180887.0, "step": 225 }, { "entropy": 1.0745280124247074, "epoch": 0.020793439945716242, "grad_norm": 0.1859765499830246, "learning_rate": 9.930996411813414e-05, "loss": 1.098, "mean_token_accuracy": 0.704229149967432, "num_tokens": 7211903.0, "step": 226 }, { "entropy": 1.1080476678907871, "epoch": 0.020885446317157462, "grad_norm": 0.17670086026191711, "learning_rate": 9.930689729199251e-05, "loss": 1.1084, "mean_token_accuracy": 0.6990596875548363, "num_tokens": 7244198.0, "step": 227 }, { "entropy": 0.8533573169261217, "epoch": 0.020977452688598686, "grad_norm": 0.1631222814321518, "learning_rate": 9.93038304658509e-05, "loss": 0.8657, "mean_token_accuracy": 0.7622958980500698, "num_tokens": 7276229.0, "step": 228 }, { "entropy": 1.0012922808527946, "epoch": 0.02106945906003991, "grad_norm": 0.16546288132667542, "learning_rate": 9.930076363970928e-05, "loss": 1.0117, "mean_token_accuracy": 0.7259608060121536, "num_tokens": 7308048.0, "step": 229 }, { "entropy": 1.1597312614321709, "epoch": 0.02116146543148113, "grad_norm": 0.19198071956634521, "learning_rate": 9.929769681356764e-05, "loss": 1.2095, "mean_token_accuracy": 0.6846582293510437, "num_tokens": 7339030.0, "step": 230 }, { "entropy": 0.9319143630564213, "epoch": 0.021253471802922353, "grad_norm": 0.16337594389915466, "learning_rate": 9.929462998742601e-05, "loss": 0.9414, "mean_token_accuracy": 0.742465440183878, "num_tokens": 7371606.0, "step": 231 }, { "entropy": 1.1574942097067833, "epoch": 0.021345478174363573, "grad_norm": 0.1782786101102829, "learning_rate": 9.929156316128439e-05, "loss": 1.1667, "mean_token_accuracy": 0.6903795711696148, "num_tokens": 7404004.0, "step": 232 }, { "entropy": 0.9820975102484226, "epoch": 0.021437484545804797, "grad_norm": 0.16371804475784302, "learning_rate": 9.928849633514276e-05, "loss": 0.9925, "mean_token_accuracy": 0.7278564684092999, "num_tokens": 7436024.0, "step": 233 }, { "entropy": 1.1143397502601147, "epoch": 0.02152949091724602, "grad_norm": 0.1745738834142685, "learning_rate": 9.928542950900114e-05, "loss": 1.0993, "mean_token_accuracy": 0.7055794410407543, "num_tokens": 7467730.0, "step": 234 }, { "entropy": 1.0289190784096718, "epoch": 0.02162149728868724, "grad_norm": 0.1755571812391281, "learning_rate": 9.928236268285951e-05, "loss": 1.0331, "mean_token_accuracy": 0.7184229083359241, "num_tokens": 7499693.0, "step": 235 }, { "entropy": 1.0330001264810562, "epoch": 0.021713503660128464, "grad_norm": 0.16859924793243408, "learning_rate": 9.927929585671789e-05, "loss": 1.0286, "mean_token_accuracy": 0.7246302105486393, "num_tokens": 7531898.0, "step": 236 }, { "entropy": 1.0337454117834568, "epoch": 0.021805510031569685, "grad_norm": 0.16738027334213257, "learning_rate": 9.927622903057626e-05, "loss": 1.0294, "mean_token_accuracy": 0.7227383069694042, "num_tokens": 7564291.0, "step": 237 }, { "entropy": 1.147235494107008, "epoch": 0.021897516403010908, "grad_norm": 0.1868073046207428, "learning_rate": 9.927316220443463e-05, "loss": 1.1635, "mean_token_accuracy": 0.6888069398701191, "num_tokens": 7596172.0, "step": 238 }, { "entropy": 1.0232941769063473, "epoch": 0.021989522774452132, "grad_norm": 0.17438723146915436, "learning_rate": 9.927009537829301e-05, "loss": 1.0459, "mean_token_accuracy": 0.7175581082701683, "num_tokens": 7628213.0, "step": 239 }, { "entropy": 0.9586729891598225, "epoch": 0.022081529145893352, "grad_norm": 0.17714299261569977, "learning_rate": 9.926702855215139e-05, "loss": 0.9893, "mean_token_accuracy": 0.7272261045873165, "num_tokens": 7660119.0, "step": 240 }, { "entropy": 0.9716028645634651, "epoch": 0.022173535517334576, "grad_norm": 0.16684122383594513, "learning_rate": 9.926396172600976e-05, "loss": 0.9562, "mean_token_accuracy": 0.7407666072249413, "num_tokens": 7691405.0, "step": 241 }, { "entropy": 0.9912166967988014, "epoch": 0.0222655418887758, "grad_norm": 0.16787931323051453, "learning_rate": 9.926089489986813e-05, "loss": 1.001, "mean_token_accuracy": 0.7326581627130508, "num_tokens": 7723103.0, "step": 242 }, { "entropy": 1.0880173332989216, "epoch": 0.02235754826021702, "grad_norm": 0.1724301427602768, "learning_rate": 9.92578280737265e-05, "loss": 1.1175, "mean_token_accuracy": 0.7024666741490364, "num_tokens": 7754934.0, "step": 243 }, { "entropy": 1.103767417371273, "epoch": 0.022449554631658243, "grad_norm": 0.18482881784439087, "learning_rate": 9.925476124758489e-05, "loss": 1.1171, "mean_token_accuracy": 0.7053827308118343, "num_tokens": 7786846.0, "step": 244 }, { "entropy": 1.1106660179793835, "epoch": 0.022541561003099463, "grad_norm": 0.1809864044189453, "learning_rate": 9.925169442144326e-05, "loss": 1.145, "mean_token_accuracy": 0.6927794851362705, "num_tokens": 7818471.0, "step": 245 }, { "entropy": 1.0490600168704987, "epoch": 0.022633567374540687, "grad_norm": 0.17510442435741425, "learning_rate": 9.924862759530162e-05, "loss": 1.0377, "mean_token_accuracy": 0.714185319840908, "num_tokens": 7850985.0, "step": 246 }, { "entropy": 0.9827646017074585, "epoch": 0.02272557374598191, "grad_norm": 0.16269072890281677, "learning_rate": 9.924556076916e-05, "loss": 0.9903, "mean_token_accuracy": 0.7312794104218483, "num_tokens": 7883736.0, "step": 247 }, { "entropy": 0.950873289257288, "epoch": 0.02281758011742313, "grad_norm": 0.1698489636182785, "learning_rate": 9.924249394301837e-05, "loss": 0.9561, "mean_token_accuracy": 0.740793701261282, "num_tokens": 7915107.0, "step": 248 }, { "entropy": 1.0899472013115883, "epoch": 0.022909586488864354, "grad_norm": 0.17524008452892303, "learning_rate": 9.923942711687675e-05, "loss": 1.0865, "mean_token_accuracy": 0.707052443176508, "num_tokens": 7946704.0, "step": 249 }, { "entropy": 1.0490071326494217, "epoch": 0.023001592860305575, "grad_norm": 0.1749829202890396, "learning_rate": 9.923636029073512e-05, "loss": 1.0472, "mean_token_accuracy": 0.7164794690907001, "num_tokens": 7978206.0, "step": 250 }, { "entropy": 1.0940250530838966, "epoch": 0.023093599231746798, "grad_norm": 0.17316441237926483, "learning_rate": 9.92332934645935e-05, "loss": 1.1086, "mean_token_accuracy": 0.7035567164421082, "num_tokens": 8010569.0, "step": 251 }, { "entropy": 0.9831471145153046, "epoch": 0.023185605603188022, "grad_norm": 0.17159403860569, "learning_rate": 9.923022663845187e-05, "loss": 0.9737, "mean_token_accuracy": 0.7336002290248871, "num_tokens": 8042545.0, "step": 252 }, { "entropy": 1.0237773321568966, "epoch": 0.023277611974629242, "grad_norm": 0.17272478342056274, "learning_rate": 9.922715981231024e-05, "loss": 1.0399, "mean_token_accuracy": 0.7164369411766529, "num_tokens": 8074756.0, "step": 253 }, { "entropy": 0.9993202462792397, "epoch": 0.023369618346070466, "grad_norm": 0.16742482781410217, "learning_rate": 9.922409298616862e-05, "loss": 1.0292, "mean_token_accuracy": 0.7237544730305672, "num_tokens": 8106878.0, "step": 254 }, { "entropy": 1.0520861260592937, "epoch": 0.02346162471751169, "grad_norm": 0.1790105253458023, "learning_rate": 9.9221026160027e-05, "loss": 1.0857, "mean_token_accuracy": 0.7121801152825356, "num_tokens": 8138578.0, "step": 255 }, { "entropy": 1.0587811097502708, "epoch": 0.02355363108895291, "grad_norm": 0.1684771478176117, "learning_rate": 9.921795933388537e-05, "loss": 1.0777, "mean_token_accuracy": 0.7124390602111816, "num_tokens": 8170435.0, "step": 256 }, { "entropy": 0.9994714818894863, "epoch": 0.023645637460394133, "grad_norm": 0.162997767329216, "learning_rate": 9.921489250774374e-05, "loss": 1.0174, "mean_token_accuracy": 0.7226156555116177, "num_tokens": 8202719.0, "step": 257 }, { "entropy": 1.0775707848370075, "epoch": 0.023737643831835353, "grad_norm": 0.17524001002311707, "learning_rate": 9.92118256816021e-05, "loss": 1.0715, "mean_token_accuracy": 0.7084484696388245, "num_tokens": 8234194.0, "step": 258 }, { "entropy": 0.9745459966361523, "epoch": 0.023829650203276577, "grad_norm": 0.17161127924919128, "learning_rate": 9.920875885546049e-05, "loss": 0.9872, "mean_token_accuracy": 0.7289598882198334, "num_tokens": 8266441.0, "step": 259 }, { "entropy": 1.037320762872696, "epoch": 0.0239216565747178, "grad_norm": 0.17044520378112793, "learning_rate": 9.920569202931887e-05, "loss": 1.0413, "mean_token_accuracy": 0.7180324047803879, "num_tokens": 8298867.0, "step": 260 }, { "entropy": 0.9870064221322536, "epoch": 0.02401366294615902, "grad_norm": 0.16930106282234192, "learning_rate": 9.920262520317724e-05, "loss": 0.9938, "mean_token_accuracy": 0.7334766872227192, "num_tokens": 8330670.0, "step": 261 }, { "entropy": 1.0553007870912552, "epoch": 0.024105669317600244, "grad_norm": 0.17598919570446014, "learning_rate": 9.91995583770356e-05, "loss": 1.0727, "mean_token_accuracy": 0.7125541009008884, "num_tokens": 8362592.0, "step": 262 }, { "entropy": 0.9725649319589138, "epoch": 0.024197675689041465, "grad_norm": 0.1814746856689453, "learning_rate": 9.919649155089399e-05, "loss": 0.9655, "mean_token_accuracy": 0.734922245144844, "num_tokens": 8395258.0, "step": 263 }, { "entropy": 1.10891717299819, "epoch": 0.024289682060482688, "grad_norm": 0.1690898835659027, "learning_rate": 9.919342472475235e-05, "loss": 1.0987, "mean_token_accuracy": 0.7040084637701511, "num_tokens": 8426905.0, "step": 264 }, { "entropy": 1.072560764849186, "epoch": 0.024381688431923912, "grad_norm": 0.17726925015449524, "learning_rate": 9.919035789861074e-05, "loss": 1.0731, "mean_token_accuracy": 0.7107347324490547, "num_tokens": 8458525.0, "step": 265 }, { "entropy": 0.9354403205215931, "epoch": 0.024473694803365132, "grad_norm": 0.1571246087551117, "learning_rate": 9.91872910724691e-05, "loss": 0.949, "mean_token_accuracy": 0.7437668591737747, "num_tokens": 8490779.0, "step": 266 }, { "entropy": 0.9857550449669361, "epoch": 0.024565701174806356, "grad_norm": 0.17514096200466156, "learning_rate": 9.918422424632748e-05, "loss": 1.0015, "mean_token_accuracy": 0.7249152995646, "num_tokens": 8522916.0, "step": 267 }, { "entropy": 1.0511173941195011, "epoch": 0.02465770754624758, "grad_norm": 0.17077544331550598, "learning_rate": 9.918115742018585e-05, "loss": 1.0863, "mean_token_accuracy": 0.7092981413006783, "num_tokens": 8554639.0, "step": 268 }, { "entropy": 0.9296869300305843, "epoch": 0.0247497139176888, "grad_norm": 0.15971146523952484, "learning_rate": 9.917809059404422e-05, "loss": 0.9405, "mean_token_accuracy": 0.7404145710170269, "num_tokens": 8586912.0, "step": 269 }, { "entropy": 1.0132721588015556, "epoch": 0.024841720289130023, "grad_norm": 0.16618159413337708, "learning_rate": 9.91750237679026e-05, "loss": 1.0335, "mean_token_accuracy": 0.7160226330161095, "num_tokens": 8618305.0, "step": 270 }, { "entropy": 1.042600091546774, "epoch": 0.024933726660571243, "grad_norm": 0.17565205693244934, "learning_rate": 9.917195694176098e-05, "loss": 1.06, "mean_token_accuracy": 0.7123121619224548, "num_tokens": 8649405.0, "step": 271 }, { "entropy": 0.9981344006955624, "epoch": 0.025025733032012467, "grad_norm": 0.17246222496032715, "learning_rate": 9.916889011561935e-05, "loss": 1.0024, "mean_token_accuracy": 0.7237122468650341, "num_tokens": 8681294.0, "step": 272 }, { "entropy": 1.0209496840834618, "epoch": 0.02511773940345369, "grad_norm": 0.16784678399562836, "learning_rate": 9.916582328947772e-05, "loss": 1.0036, "mean_token_accuracy": 0.7270780764520168, "num_tokens": 8713661.0, "step": 273 }, { "entropy": 0.9887788705527782, "epoch": 0.02520974577489491, "grad_norm": 0.1617519110441208, "learning_rate": 9.916275646333609e-05, "loss": 0.99, "mean_token_accuracy": 0.7291125245392323, "num_tokens": 8746074.0, "step": 274 }, { "entropy": 1.0359355509281158, "epoch": 0.025301752146336134, "grad_norm": 0.16999831795692444, "learning_rate": 9.915968963719447e-05, "loss": 1.0335, "mean_token_accuracy": 0.7175508104264736, "num_tokens": 8778046.0, "step": 275 }, { "entropy": 1.0637561157345772, "epoch": 0.025393758517777355, "grad_norm": 0.17285063862800598, "learning_rate": 9.915662281105285e-05, "loss": 1.0669, "mean_token_accuracy": 0.712538868188858, "num_tokens": 8810719.0, "step": 276 }, { "entropy": 1.1193933859467506, "epoch": 0.02548576488921858, "grad_norm": 0.1822524517774582, "learning_rate": 9.915355598491122e-05, "loss": 1.1189, "mean_token_accuracy": 0.6996394693851471, "num_tokens": 8842553.0, "step": 277 }, { "entropy": 1.01952401176095, "epoch": 0.025577771260659802, "grad_norm": 0.1692618429660797, "learning_rate": 9.91504891587696e-05, "loss": 1.0436, "mean_token_accuracy": 0.7193587422370911, "num_tokens": 8874183.0, "step": 278 }, { "entropy": 1.023792751133442, "epoch": 0.025669777632101022, "grad_norm": 0.16517235338687897, "learning_rate": 9.914742233262797e-05, "loss": 1.0305, "mean_token_accuracy": 0.7161813750863075, "num_tokens": 8906386.0, "step": 279 }, { "entropy": 1.0364782847464085, "epoch": 0.025761784003542246, "grad_norm": 0.17772650718688965, "learning_rate": 9.914435550648633e-05, "loss": 1.0604, "mean_token_accuracy": 0.7158019207417965, "num_tokens": 8938098.0, "step": 280 }, { "entropy": 1.0896171107888222, "epoch": 0.025853790374983466, "grad_norm": 0.1809283047914505, "learning_rate": 9.914128868034472e-05, "loss": 1.1138, "mean_token_accuracy": 0.7009692788124084, "num_tokens": 8970207.0, "step": 281 }, { "entropy": 1.0545813851058483, "epoch": 0.02594579674642469, "grad_norm": 0.17223653197288513, "learning_rate": 9.91382218542031e-05, "loss": 1.0585, "mean_token_accuracy": 0.717927597463131, "num_tokens": 9002756.0, "step": 282 }, { "entropy": 1.0567163042724133, "epoch": 0.026037803117865913, "grad_norm": 0.1732850819826126, "learning_rate": 9.913515502806147e-05, "loss": 1.0529, "mean_token_accuracy": 0.7167305201292038, "num_tokens": 9035051.0, "step": 283 }, { "entropy": 1.0590565912425518, "epoch": 0.026129809489307133, "grad_norm": 0.1697113811969757, "learning_rate": 9.913208820191983e-05, "loss": 1.072, "mean_token_accuracy": 0.7100552208721638, "num_tokens": 9066738.0, "step": 284 }, { "entropy": 1.0653780922293663, "epoch": 0.026221815860748357, "grad_norm": 0.1827525943517685, "learning_rate": 9.912902137577821e-05, "loss": 1.1067, "mean_token_accuracy": 0.7032938525080681, "num_tokens": 9098032.0, "step": 285 }, { "entropy": 1.0552263334393501, "epoch": 0.02631382223218958, "grad_norm": 0.17574644088745117, "learning_rate": 9.91259545496366e-05, "loss": 1.0687, "mean_token_accuracy": 0.7146542407572269, "num_tokens": 9130477.0, "step": 286 }, { "entropy": 1.138304192572832, "epoch": 0.0264058286036308, "grad_norm": 0.17941315472126007, "learning_rate": 9.912288772349496e-05, "loss": 1.1307, "mean_token_accuracy": 0.6898724101483822, "num_tokens": 9162249.0, "step": 287 }, { "entropy": 1.0071697924286127, "epoch": 0.026497834975072024, "grad_norm": 0.1770455241203308, "learning_rate": 9.911982089735333e-05, "loss": 1.0195, "mean_token_accuracy": 0.7261302918195724, "num_tokens": 9193869.0, "step": 288 }, { "entropy": 1.06841379404068, "epoch": 0.026589841346513245, "grad_norm": 0.17001360654830933, "learning_rate": 9.91167540712117e-05, "loss": 1.0827, "mean_token_accuracy": 0.7073499746620655, "num_tokens": 9225603.0, "step": 289 }, { "entropy": 1.0507192350924015, "epoch": 0.02668184771795447, "grad_norm": 0.16357386112213135, "learning_rate": 9.911368724507008e-05, "loss": 1.0614, "mean_token_accuracy": 0.7118343971669674, "num_tokens": 9258371.0, "step": 290 }, { "entropy": 1.0142629072070122, "epoch": 0.026773854089395692, "grad_norm": 0.16867002844810486, "learning_rate": 9.911062041892846e-05, "loss": 1.0252, "mean_token_accuracy": 0.7260223962366581, "num_tokens": 9289788.0, "step": 291 }, { "entropy": 1.0012767743319273, "epoch": 0.026865860460836912, "grad_norm": 0.17086906731128693, "learning_rate": 9.910755359278683e-05, "loss": 1.0076, "mean_token_accuracy": 0.7254475429654121, "num_tokens": 9321586.0, "step": 292 }, { "entropy": 1.079236552119255, "epoch": 0.026957866832278136, "grad_norm": 0.17184540629386902, "learning_rate": 9.91044867666452e-05, "loss": 1.0926, "mean_token_accuracy": 0.7041040547192097, "num_tokens": 9354146.0, "step": 293 }, { "entropy": 0.9915536604821682, "epoch": 0.027049873203719356, "grad_norm": 0.1680537909269333, "learning_rate": 9.910141994050358e-05, "loss": 1.0015, "mean_token_accuracy": 0.725428719073534, "num_tokens": 9386302.0, "step": 294 }, { "entropy": 1.0315271653234959, "epoch": 0.02714187957516058, "grad_norm": 0.17213064432144165, "learning_rate": 9.909835311436195e-05, "loss": 1.0478, "mean_token_accuracy": 0.7170222699642181, "num_tokens": 9418582.0, "step": 295 }, { "entropy": 1.0609200932085514, "epoch": 0.027233885946601803, "grad_norm": 0.17062462866306305, "learning_rate": 9.909528628822033e-05, "loss": 1.061, "mean_token_accuracy": 0.7154916524887085, "num_tokens": 9450630.0, "step": 296 }, { "entropy": 1.0197396203875542, "epoch": 0.027325892318043023, "grad_norm": 0.16153572499752045, "learning_rate": 9.90922194620787e-05, "loss": 1.012, "mean_token_accuracy": 0.722888607531786, "num_tokens": 9482509.0, "step": 297 }, { "entropy": 1.0288560949265957, "epoch": 0.027417898689484247, "grad_norm": 0.16769398748874664, "learning_rate": 9.908915263593708e-05, "loss": 1.0286, "mean_token_accuracy": 0.7228196486830711, "num_tokens": 9514677.0, "step": 298 }, { "entropy": 1.0114391669631004, "epoch": 0.02750990506092547, "grad_norm": 0.1745382398366928, "learning_rate": 9.908608580979545e-05, "loss": 1.0268, "mean_token_accuracy": 0.7244320549070835, "num_tokens": 9546815.0, "step": 299 }, { "entropy": 1.046730425208807, "epoch": 0.02760191143236669, "grad_norm": 0.17665036022663116, "learning_rate": 9.908301898365381e-05, "loss": 1.057, "mean_token_accuracy": 0.7112526260316372, "num_tokens": 9579056.0, "step": 300 }, { "entropy": 1.0406011492013931, "epoch": 0.027693917803807915, "grad_norm": 0.16710369288921356, "learning_rate": 9.90799521575122e-05, "loss": 1.0296, "mean_token_accuracy": 0.7178775668144226, "num_tokens": 9611561.0, "step": 301 }, { "entropy": 1.0182667076587677, "epoch": 0.027785924175249135, "grad_norm": 0.172878235578537, "learning_rate": 9.907688533137058e-05, "loss": 1.0276, "mean_token_accuracy": 0.7248609066009521, "num_tokens": 9643126.0, "step": 302 }, { "entropy": 0.9999312683939934, "epoch": 0.02787793054669036, "grad_norm": 0.170984148979187, "learning_rate": 9.907381850522895e-05, "loss": 1.0095, "mean_token_accuracy": 0.7265542894601822, "num_tokens": 9675352.0, "step": 303 }, { "entropy": 1.063875325024128, "epoch": 0.027969936918131582, "grad_norm": 0.16845428943634033, "learning_rate": 9.907075167908731e-05, "loss": 1.058, "mean_token_accuracy": 0.7120595499873161, "num_tokens": 9707663.0, "step": 304 }, { "entropy": 1.007687259465456, "epoch": 0.028061943289572802, "grad_norm": 0.16646651923656464, "learning_rate": 9.906768485294568e-05, "loss": 1.0245, "mean_token_accuracy": 0.7184119075536728, "num_tokens": 9739133.0, "step": 305 }, { "entropy": 1.0903705582022667, "epoch": 0.028153949661014026, "grad_norm": 0.16926497220993042, "learning_rate": 9.906461802680406e-05, "loss": 1.1003, "mean_token_accuracy": 0.7001234889030457, "num_tokens": 9771504.0, "step": 306 }, { "entropy": 0.9451657794415951, "epoch": 0.028245956032455246, "grad_norm": 0.1617155224084854, "learning_rate": 9.906155120066244e-05, "loss": 0.9663, "mean_token_accuracy": 0.7369178421795368, "num_tokens": 9803686.0, "step": 307 }, { "entropy": 1.040549948811531, "epoch": 0.02833796240389647, "grad_norm": 0.1738441288471222, "learning_rate": 9.905848437452081e-05, "loss": 1.0805, "mean_token_accuracy": 0.7120287865400314, "num_tokens": 9835487.0, "step": 308 }, { "entropy": 1.0481392070651054, "epoch": 0.028429968775337693, "grad_norm": 0.16806606948375702, "learning_rate": 9.905541754837919e-05, "loss": 1.0478, "mean_token_accuracy": 0.714185394346714, "num_tokens": 9868255.0, "step": 309 }, { "entropy": 1.0710994862020016, "epoch": 0.028521975146778913, "grad_norm": 0.16525167226791382, "learning_rate": 9.905235072223756e-05, "loss": 1.0628, "mean_token_accuracy": 0.7152832001447678, "num_tokens": 9900598.0, "step": 310 }, { "entropy": 1.021608266979456, "epoch": 0.028613981518220137, "grad_norm": 0.17442676424980164, "learning_rate": 9.904928389609593e-05, "loss": 1.0374, "mean_token_accuracy": 0.7184325978159904, "num_tokens": 9933282.0, "step": 311 }, { "entropy": 0.9169892519712448, "epoch": 0.02870598788966136, "grad_norm": 0.1616387814283371, "learning_rate": 9.904621706995431e-05, "loss": 0.9081, "mean_token_accuracy": 0.7482005804777145, "num_tokens": 9964747.0, "step": 312 }, { "entropy": 1.005317285656929, "epoch": 0.02879799426110258, "grad_norm": 0.16239547729492188, "learning_rate": 9.904315024381269e-05, "loss": 1.0069, "mean_token_accuracy": 0.7258857823908329, "num_tokens": 9996951.0, "step": 313 }, { "entropy": 0.9987409636378288, "epoch": 0.028890000632543805, "grad_norm": 0.16818250715732574, "learning_rate": 9.904008341767106e-05, "loss": 1.0247, "mean_token_accuracy": 0.7210480906069279, "num_tokens": 10029242.0, "step": 314 }, { "entropy": 0.964073896408081, "epoch": 0.028982007003985025, "grad_norm": 0.16994626820087433, "learning_rate": 9.903701659152943e-05, "loss": 0.982, "mean_token_accuracy": 0.7298190332949162, "num_tokens": 10060991.0, "step": 315 }, { "entropy": 0.9543931856751442, "epoch": 0.02907401337542625, "grad_norm": 0.16848395764827728, "learning_rate": 9.90339497653878e-05, "loss": 0.9554, "mean_token_accuracy": 0.7392972037196159, "num_tokens": 10092197.0, "step": 316 }, { "entropy": 1.09754778444767, "epoch": 0.029166019746867472, "grad_norm": 0.1701204478740692, "learning_rate": 9.903088293924619e-05, "loss": 1.1101, "mean_token_accuracy": 0.7063821814954281, "num_tokens": 10124316.0, "step": 317 }, { "entropy": 1.04968723654747, "epoch": 0.029258026118308692, "grad_norm": 0.16718478500843048, "learning_rate": 9.902781611310456e-05, "loss": 1.0484, "mean_token_accuracy": 0.7153932489454746, "num_tokens": 10156969.0, "step": 318 }, { "entropy": 1.0543867610394955, "epoch": 0.029350032489749916, "grad_norm": 0.1761874258518219, "learning_rate": 9.902474928696293e-05, "loss": 1.0653, "mean_token_accuracy": 0.7080084159970284, "num_tokens": 10188671.0, "step": 319 }, { "entropy": 0.9748063422739506, "epoch": 0.029442038861191136, "grad_norm": 0.16548579931259155, "learning_rate": 9.90216824608213e-05, "loss": 0.9972, "mean_token_accuracy": 0.7286731041967869, "num_tokens": 10220771.0, "step": 320 }, { "entropy": 0.9415609240531921, "epoch": 0.02953404523263236, "grad_norm": 0.16453656554222107, "learning_rate": 9.901861563467968e-05, "loss": 0.9522, "mean_token_accuracy": 0.7377289608120918, "num_tokens": 10253379.0, "step": 321 }, { "entropy": 1.0831911489367485, "epoch": 0.029626051604073583, "grad_norm": 0.16672056913375854, "learning_rate": 9.901554880853806e-05, "loss": 1.1081, "mean_token_accuracy": 0.7069454789161682, "num_tokens": 10285118.0, "step": 322 }, { "entropy": 0.940744161605835, "epoch": 0.029718057975514803, "grad_norm": 0.16158607602119446, "learning_rate": 9.901248198239642e-05, "loss": 0.9307, "mean_token_accuracy": 0.7433595806360245, "num_tokens": 10316942.0, "step": 323 }, { "entropy": 1.037747297435999, "epoch": 0.029810064346956027, "grad_norm": 0.16587531566619873, "learning_rate": 9.900941515625479e-05, "loss": 1.0514, "mean_token_accuracy": 0.7119894027709961, "num_tokens": 10348879.0, "step": 324 }, { "entropy": 1.1704398952424526, "epoch": 0.029902070718397247, "grad_norm": 0.18025659024715424, "learning_rate": 9.900634833011317e-05, "loss": 1.1702, "mean_token_accuracy": 0.6833353005349636, "num_tokens": 10380799.0, "step": 325 }, { "entropy": 1.003839686512947, "epoch": 0.02999407708983847, "grad_norm": 0.16270101070404053, "learning_rate": 9.900328150397154e-05, "loss": 0.9927, "mean_token_accuracy": 0.72690499573946, "num_tokens": 10412441.0, "step": 326 }, { "entropy": 1.124996893107891, "epoch": 0.030086083461279695, "grad_norm": 0.17676809430122375, "learning_rate": 9.900021467782992e-05, "loss": 1.113, "mean_token_accuracy": 0.6959314085543156, "num_tokens": 10443653.0, "step": 327 }, { "entropy": 1.0923333875834942, "epoch": 0.030178089832720915, "grad_norm": 0.17544600367546082, "learning_rate": 9.899714785168829e-05, "loss": 1.0823, "mean_token_accuracy": 0.706365168094635, "num_tokens": 10475689.0, "step": 328 }, { "entropy": 1.0189785361289978, "epoch": 0.03027009620416214, "grad_norm": 0.17241306602954865, "learning_rate": 9.899408102554667e-05, "loss": 1.0328, "mean_token_accuracy": 0.7179580628871918, "num_tokens": 10507652.0, "step": 329 }, { "entropy": 1.0077387765049934, "epoch": 0.030362102575603362, "grad_norm": 0.16874080896377563, "learning_rate": 9.899101419940504e-05, "loss": 1.016, "mean_token_accuracy": 0.723788995295763, "num_tokens": 10539961.0, "step": 330 }, { "entropy": 1.0799332521855831, "epoch": 0.030454108947044582, "grad_norm": 0.17733213305473328, "learning_rate": 9.898794737326341e-05, "loss": 1.0997, "mean_token_accuracy": 0.7020038515329361, "num_tokens": 10572018.0, "step": 331 }, { "entropy": 0.9794340506196022, "epoch": 0.030546115318485806, "grad_norm": 0.17030216753482819, "learning_rate": 9.898488054712179e-05, "loss": 0.9891, "mean_token_accuracy": 0.7313051484525204, "num_tokens": 10603519.0, "step": 332 }, { "entropy": 1.0041477158665657, "epoch": 0.030638121689927026, "grad_norm": 0.16841651499271393, "learning_rate": 9.898181372098017e-05, "loss": 1.0202, "mean_token_accuracy": 0.7223141491413116, "num_tokens": 10635784.0, "step": 333 }, { "entropy": 0.959893062710762, "epoch": 0.03073012806136825, "grad_norm": 0.5746650695800781, "learning_rate": 9.897874689483854e-05, "loss": 0.9843, "mean_token_accuracy": 0.7305244393646717, "num_tokens": 10667797.0, "step": 334 }, { "entropy": 1.000692903995514, "epoch": 0.030822134432809473, "grad_norm": 0.1638183742761612, "learning_rate": 9.89756800686969e-05, "loss": 1.0132, "mean_token_accuracy": 0.7241126894950867, "num_tokens": 10700031.0, "step": 335 }, { "entropy": 0.9820724241435528, "epoch": 0.030914140804250693, "grad_norm": 0.16778138279914856, "learning_rate": 9.897261324255527e-05, "loss": 0.9854, "mean_token_accuracy": 0.731487549841404, "num_tokens": 10731655.0, "step": 336 }, { "entropy": 0.9605408236384392, "epoch": 0.031006147175691917, "grad_norm": 0.16641676425933838, "learning_rate": 9.896954641641366e-05, "loss": 0.9656, "mean_token_accuracy": 0.7369475848972797, "num_tokens": 10762923.0, "step": 337 }, { "entropy": 0.9578608199954033, "epoch": 0.031098153547133137, "grad_norm": 0.16755624115467072, "learning_rate": 9.896647959027204e-05, "loss": 0.9675, "mean_token_accuracy": 0.7369200922548771, "num_tokens": 10795679.0, "step": 338 }, { "entropy": 0.9871492795646191, "epoch": 0.03119015991857436, "grad_norm": 0.16907480359077454, "learning_rate": 9.89634127641304e-05, "loss": 1.0065, "mean_token_accuracy": 0.7239247746765614, "num_tokens": 10827842.0, "step": 339 }, { "entropy": 0.9234685860574245, "epoch": 0.03128216629001558, "grad_norm": 0.1675400733947754, "learning_rate": 9.896034593798879e-05, "loss": 0.9124, "mean_token_accuracy": 0.7448959350585938, "num_tokens": 10858112.0, "step": 340 }, { "entropy": 0.9544042199850082, "epoch": 0.031374172661456805, "grad_norm": 0.17795246839523315, "learning_rate": 9.895727911184715e-05, "loss": 0.9408, "mean_token_accuracy": 0.7383503653109074, "num_tokens": 10889947.0, "step": 341 }, { "entropy": 1.0911731496453285, "epoch": 0.03146617903289803, "grad_norm": 0.1762719303369522, "learning_rate": 9.895421228570552e-05, "loss": 1.0983, "mean_token_accuracy": 0.70502058416605, "num_tokens": 10921061.0, "step": 342 }, { "entropy": 0.996724471449852, "epoch": 0.03155818540433925, "grad_norm": 0.6094722151756287, "learning_rate": 9.89511454595639e-05, "loss": 0.9862, "mean_token_accuracy": 0.7317587547004223, "num_tokens": 10952779.0, "step": 343 }, { "entropy": 0.9543893337249756, "epoch": 0.031650191775780476, "grad_norm": 0.16950005292892456, "learning_rate": 9.894807863342229e-05, "loss": 0.9869, "mean_token_accuracy": 0.7318556904792786, "num_tokens": 10984672.0, "step": 344 }, { "entropy": 0.9094912111759186, "epoch": 0.03174219814722169, "grad_norm": 0.16138726472854614, "learning_rate": 9.894501180728065e-05, "loss": 0.9011, "mean_token_accuracy": 0.7496962770819664, "num_tokens": 11016694.0, "step": 345 }, { "entropy": 0.9806951321661472, "epoch": 0.031834204518662916, "grad_norm": 0.17097319662570953, "learning_rate": 9.894194498113902e-05, "loss": 0.9908, "mean_token_accuracy": 0.7286317944526672, "num_tokens": 11047913.0, "step": 346 }, { "entropy": 0.9940336756408215, "epoch": 0.03192621089010414, "grad_norm": 0.16413697600364685, "learning_rate": 9.893887815499739e-05, "loss": 0.9996, "mean_token_accuracy": 0.7252663858234882, "num_tokens": 11080672.0, "step": 347 }, { "entropy": 0.9757176823914051, "epoch": 0.03201821726154536, "grad_norm": 0.16703853011131287, "learning_rate": 9.893581132885577e-05, "loss": 1.0129, "mean_token_accuracy": 0.7229591645300388, "num_tokens": 11112994.0, "step": 348 }, { "entropy": 1.0398691222071648, "epoch": 0.03211022363298659, "grad_norm": 0.17201068997383118, "learning_rate": 9.893274450271415e-05, "loss": 1.0487, "mean_token_accuracy": 0.7168041057884693, "num_tokens": 11144588.0, "step": 349 }, { "entropy": 0.988932553678751, "epoch": 0.032202230004427804, "grad_norm": 0.18128854036331177, "learning_rate": 9.892967767657252e-05, "loss": 1.0086, "mean_token_accuracy": 0.7216555811464787, "num_tokens": 11176346.0, "step": 350 }, { "entropy": 0.9840069264173508, "epoch": 0.03229423637586903, "grad_norm": 0.1725808084011078, "learning_rate": 9.892661085043089e-05, "loss": 0.9899, "mean_token_accuracy": 0.7303399927914143, "num_tokens": 11208714.0, "step": 351 }, { "entropy": 0.9876339249312878, "epoch": 0.03238624274731025, "grad_norm": 0.16013628244400024, "learning_rate": 9.892354402428927e-05, "loss": 0.9757, "mean_token_accuracy": 0.7265531346201897, "num_tokens": 11240982.0, "step": 352 }, { "entropy": 0.989908829331398, "epoch": 0.032478249118751475, "grad_norm": 0.16509833931922913, "learning_rate": 9.892047719814764e-05, "loss": 0.975, "mean_token_accuracy": 0.7294861748814583, "num_tokens": 11272566.0, "step": 353 }, { "entropy": 0.9569560680538416, "epoch": 0.0325702554901927, "grad_norm": 0.15770207345485687, "learning_rate": 9.891741037200602e-05, "loss": 0.9456, "mean_token_accuracy": 0.7373073622584343, "num_tokens": 11304426.0, "step": 354 }, { "entropy": 1.0845520347356796, "epoch": 0.032662261861633915, "grad_norm": 0.16966894268989563, "learning_rate": 9.891434354586439e-05, "loss": 1.0896, "mean_token_accuracy": 0.7080894820392132, "num_tokens": 11336514.0, "step": 355 }, { "entropy": 0.9902093820273876, "epoch": 0.03275426823307514, "grad_norm": 0.18424855172634125, "learning_rate": 9.891127671972277e-05, "loss": 0.9918, "mean_token_accuracy": 0.7236075885593891, "num_tokens": 11368580.0, "step": 356 }, { "entropy": 1.1136357635259628, "epoch": 0.03284627460451636, "grad_norm": 0.17254707217216492, "learning_rate": 9.890820989358114e-05, "loss": 1.1236, "mean_token_accuracy": 0.7045253440737724, "num_tokens": 11400835.0, "step": 357 }, { "entropy": 0.9630032256245613, "epoch": 0.032938280975957586, "grad_norm": 0.1826625019311905, "learning_rate": 9.89051430674395e-05, "loss": 0.9559, "mean_token_accuracy": 0.7342922613024712, "num_tokens": 11431769.0, "step": 358 }, { "entropy": 0.9532694295048714, "epoch": 0.03303028734739881, "grad_norm": 0.1662711501121521, "learning_rate": 9.890207624129788e-05, "loss": 0.9534, "mean_token_accuracy": 0.7346100136637688, "num_tokens": 11463296.0, "step": 359 }, { "entropy": 0.9254776574671268, "epoch": 0.033122293718840026, "grad_norm": 0.1689961701631546, "learning_rate": 9.889900941515627e-05, "loss": 0.9396, "mean_token_accuracy": 0.7428248673677444, "num_tokens": 11496064.0, "step": 360 }, { "entropy": 0.9055741056799889, "epoch": 0.03321430009028125, "grad_norm": 0.1550629734992981, "learning_rate": 9.889594258901463e-05, "loss": 0.915, "mean_token_accuracy": 0.7497055381536484, "num_tokens": 11527366.0, "step": 361 }, { "entropy": 1.0096909366548061, "epoch": 0.033306306461722474, "grad_norm": 0.16857384145259857, "learning_rate": 9.8892875762873e-05, "loss": 1.0191, "mean_token_accuracy": 0.7246541567146778, "num_tokens": 11559845.0, "step": 362 }, { "entropy": 0.9251548163592815, "epoch": 0.0333983128331637, "grad_norm": 0.1722024530172348, "learning_rate": 9.888980893673137e-05, "loss": 0.9505, "mean_token_accuracy": 0.7423433810472488, "num_tokens": 11592188.0, "step": 363 }, { "entropy": 1.0308907218277454, "epoch": 0.03349031920460492, "grad_norm": 0.17410510778427124, "learning_rate": 9.888674211058976e-05, "loss": 1.0403, "mean_token_accuracy": 0.7180306762456894, "num_tokens": 11623350.0, "step": 364 }, { "entropy": 1.007260225713253, "epoch": 0.033582325576046144, "grad_norm": 0.16690702736377716, "learning_rate": 9.888367528444813e-05, "loss": 1.009, "mean_token_accuracy": 0.7210812196135521, "num_tokens": 11654689.0, "step": 365 }, { "entropy": 1.061899933964014, "epoch": 0.03367433194748736, "grad_norm": 0.16727423667907715, "learning_rate": 9.88806084583065e-05, "loss": 1.0664, "mean_token_accuracy": 0.7090633101761341, "num_tokens": 11686702.0, "step": 366 }, { "entropy": 0.9429048523306847, "epoch": 0.033766338318928585, "grad_norm": 0.17015305161476135, "learning_rate": 9.887754163216487e-05, "loss": 0.9443, "mean_token_accuracy": 0.7376565635204315, "num_tokens": 11717811.0, "step": 367 }, { "entropy": 0.8862669691443443, "epoch": 0.03385834469036981, "grad_norm": 0.16411320865154266, "learning_rate": 9.887447480602325e-05, "loss": 0.8929, "mean_token_accuracy": 0.7531328350305557, "num_tokens": 11749909.0, "step": 368 }, { "entropy": 0.913277804851532, "epoch": 0.03395035106181103, "grad_norm": 0.16492368280887604, "learning_rate": 9.887140797988163e-05, "loss": 0.9184, "mean_token_accuracy": 0.7473931983113289, "num_tokens": 11782223.0, "step": 369 }, { "entropy": 1.0298655815422535, "epoch": 0.034042357433252256, "grad_norm": 0.16377604007720947, "learning_rate": 9.886834115374e-05, "loss": 1.0157, "mean_token_accuracy": 0.7220143675804138, "num_tokens": 11814336.0, "step": 370 }, { "entropy": 1.0704091377556324, "epoch": 0.03413436380469347, "grad_norm": 0.16085398197174072, "learning_rate": 9.886527432759838e-05, "loss": 1.0914, "mean_token_accuracy": 0.7112949825823307, "num_tokens": 11846901.0, "step": 371 }, { "entropy": 0.9985511340200901, "epoch": 0.034226370176134696, "grad_norm": 0.1590549647808075, "learning_rate": 9.886220750145675e-05, "loss": 0.9953, "mean_token_accuracy": 0.7257275655865669, "num_tokens": 11879614.0, "step": 372 }, { "entropy": 1.055351547896862, "epoch": 0.03431837654757592, "grad_norm": 0.16869869828224182, "learning_rate": 9.885914067531512e-05, "loss": 1.0589, "mean_token_accuracy": 0.7152610644698143, "num_tokens": 11910902.0, "step": 373 }, { "entropy": 0.8921605572104454, "epoch": 0.03441038291901714, "grad_norm": 0.16095079481601715, "learning_rate": 9.88560738491735e-05, "loss": 0.9155, "mean_token_accuracy": 0.748100932687521, "num_tokens": 11942929.0, "step": 374 }, { "entropy": 0.9579007774591446, "epoch": 0.03450238929045837, "grad_norm": 0.16929422318935394, "learning_rate": 9.885300702303188e-05, "loss": 0.9662, "mean_token_accuracy": 0.7306705750524998, "num_tokens": 11974875.0, "step": 375 }, { "entropy": 0.9048180021345615, "epoch": 0.034594395661899584, "grad_norm": 0.16311734914779663, "learning_rate": 9.884994019689025e-05, "loss": 0.9266, "mean_token_accuracy": 0.7411008439958096, "num_tokens": 12006861.0, "step": 376 }, { "entropy": 1.0420637503266335, "epoch": 0.03468640203334081, "grad_norm": 0.1754646599292755, "learning_rate": 9.884687337074861e-05, "loss": 1.0571, "mean_token_accuracy": 0.7111155167222023, "num_tokens": 12038885.0, "step": 377 }, { "entropy": 0.9592690393328667, "epoch": 0.03477840840478203, "grad_norm": 0.1727132797241211, "learning_rate": 9.884380654460698e-05, "loss": 0.9812, "mean_token_accuracy": 0.7319749407470226, "num_tokens": 12071132.0, "step": 378 }, { "entropy": 1.054789762943983, "epoch": 0.034870414776223255, "grad_norm": 0.1689300239086151, "learning_rate": 9.884073971846536e-05, "loss": 1.073, "mean_token_accuracy": 0.7101123034954071, "num_tokens": 12103591.0, "step": 379 }, { "entropy": 1.0424779579043388, "epoch": 0.03496242114766448, "grad_norm": 0.16431975364685059, "learning_rate": 9.883767289232375e-05, "loss": 1.0377, "mean_token_accuracy": 0.718727245926857, "num_tokens": 12135896.0, "step": 380 }, { "entropy": 1.1518799401819706, "epoch": 0.035054427519105695, "grad_norm": 0.1767517626285553, "learning_rate": 9.883460606618211e-05, "loss": 1.1547, "mean_token_accuracy": 0.6907789967954159, "num_tokens": 12168424.0, "step": 381 }, { "entropy": 1.0508774667978287, "epoch": 0.03514643389054692, "grad_norm": 0.1719999462366104, "learning_rate": 9.883153924004048e-05, "loss": 1.0452, "mean_token_accuracy": 0.7188280262053013, "num_tokens": 12199723.0, "step": 382 }, { "entropy": 1.0620715208351612, "epoch": 0.03523844026198814, "grad_norm": 0.17118346691131592, "learning_rate": 9.882847241389886e-05, "loss": 1.0438, "mean_token_accuracy": 0.7135345675051212, "num_tokens": 12231269.0, "step": 383 }, { "entropy": 0.9520346149802208, "epoch": 0.035330446633429366, "grad_norm": 0.15975673496723175, "learning_rate": 9.882540558775723e-05, "loss": 0.9222, "mean_token_accuracy": 0.7415171004831791, "num_tokens": 12262710.0, "step": 384 }, { "entropy": 1.0256397128105164, "epoch": 0.03542245300487059, "grad_norm": 0.1609017252922058, "learning_rate": 9.882233876161561e-05, "loss": 1.0294, "mean_token_accuracy": 0.720424871891737, "num_tokens": 12295019.0, "step": 385 }, { "entropy": 1.0355511009693146, "epoch": 0.035514459376311806, "grad_norm": 0.16495536267757416, "learning_rate": 9.881927193547398e-05, "loss": 1.0571, "mean_token_accuracy": 0.7152581363916397, "num_tokens": 12327088.0, "step": 386 }, { "entropy": 0.9235962964594364, "epoch": 0.03560646574775303, "grad_norm": 0.16323792934417725, "learning_rate": 9.881620510933236e-05, "loss": 0.9316, "mean_token_accuracy": 0.7438319884240627, "num_tokens": 12359154.0, "step": 387 }, { "entropy": 0.8861152045428753, "epoch": 0.035698472119194254, "grad_norm": 0.1591137945652008, "learning_rate": 9.881313828319073e-05, "loss": 0.92, "mean_token_accuracy": 0.7447265721857548, "num_tokens": 12391851.0, "step": 388 }, { "entropy": 0.9790819771587849, "epoch": 0.03579047849063548, "grad_norm": 0.17388558387756348, "learning_rate": 9.88100714570491e-05, "loss": 0.9991, "mean_token_accuracy": 0.7259571775794029, "num_tokens": 12424254.0, "step": 389 }, { "entropy": 0.9728363789618015, "epoch": 0.0358824848620767, "grad_norm": 0.16432583332061768, "learning_rate": 9.880700463090748e-05, "loss": 0.9872, "mean_token_accuracy": 0.7257611304521561, "num_tokens": 12456704.0, "step": 390 }, { "entropy": 1.0038979351520538, "epoch": 0.035974491233517925, "grad_norm": 0.16394533216953278, "learning_rate": 9.880393780476586e-05, "loss": 1.0351, "mean_token_accuracy": 0.722713477909565, "num_tokens": 12488357.0, "step": 391 }, { "entropy": 1.0411340072751045, "epoch": 0.03606649760495914, "grad_norm": 0.17753370106220245, "learning_rate": 9.880087097862423e-05, "loss": 1.0566, "mean_token_accuracy": 0.7073158174753189, "num_tokens": 12520055.0, "step": 392 }, { "entropy": 1.0669416636228561, "epoch": 0.036158503976400365, "grad_norm": 0.17230726778507233, "learning_rate": 9.87978041524826e-05, "loss": 1.0845, "mean_token_accuracy": 0.7072788029909134, "num_tokens": 12551800.0, "step": 393 }, { "entropy": 1.1152261942625046, "epoch": 0.03625051034784159, "grad_norm": 0.17747318744659424, "learning_rate": 9.879473732634096e-05, "loss": 1.1358, "mean_token_accuracy": 0.6900845691561699, "num_tokens": 12584321.0, "step": 394 }, { "entropy": 0.983378030359745, "epoch": 0.03634251671928281, "grad_norm": 0.16044682264328003, "learning_rate": 9.879167050019934e-05, "loss": 0.9855, "mean_token_accuracy": 0.7247141003608704, "num_tokens": 12615438.0, "step": 395 }, { "entropy": 0.9914127290248871, "epoch": 0.036434523090724036, "grad_norm": 0.1740035116672516, "learning_rate": 9.878860367405773e-05, "loss": 0.9869, "mean_token_accuracy": 0.7332474254071712, "num_tokens": 12647357.0, "step": 396 }, { "entropy": 1.0712041072547436, "epoch": 0.03652652946216525, "grad_norm": 0.17429697513580322, "learning_rate": 9.87855368479161e-05, "loss": 1.0497, "mean_token_accuracy": 0.7074903659522533, "num_tokens": 12679607.0, "step": 397 }, { "entropy": 1.044678132981062, "epoch": 0.036618535833606476, "grad_norm": 0.17273195087909698, "learning_rate": 9.878247002177448e-05, "loss": 1.0424, "mean_token_accuracy": 0.7187317945063114, "num_tokens": 12711499.0, "step": 398 }, { "entropy": 0.9989720210433006, "epoch": 0.0367105422050477, "grad_norm": 0.16758893430233002, "learning_rate": 9.877940319563284e-05, "loss": 0.988, "mean_token_accuracy": 0.7266386933624744, "num_tokens": 12742815.0, "step": 399 }, { "entropy": 1.083141215145588, "epoch": 0.036802548576488923, "grad_norm": 0.17270106077194214, "learning_rate": 9.877633636949121e-05, "loss": 1.0855, "mean_token_accuracy": 0.7046500369906425, "num_tokens": 12774717.0, "step": 400 }, { "entropy": 0.9950155466794968, "epoch": 0.03689455494793015, "grad_norm": 0.16009636223316193, "learning_rate": 9.877326954334959e-05, "loss": 0.9901, "mean_token_accuracy": 0.7269642017781734, "num_tokens": 12806646.0, "step": 401 }, { "entropy": 1.0237273834645748, "epoch": 0.036986561319371364, "grad_norm": 0.16479110717773438, "learning_rate": 9.877020271720797e-05, "loss": 1.0326, "mean_token_accuracy": 0.7236855439841747, "num_tokens": 12838327.0, "step": 402 }, { "entropy": 1.007001630961895, "epoch": 0.03707856769081259, "grad_norm": 0.16550607979297638, "learning_rate": 9.876713589106634e-05, "loss": 1.0116, "mean_token_accuracy": 0.7222214266657829, "num_tokens": 12869628.0, "step": 403 }, { "entropy": 0.8934124559164047, "epoch": 0.03717057406225381, "grad_norm": 0.17071421444416046, "learning_rate": 9.876406906492471e-05, "loss": 0.8859, "mean_token_accuracy": 0.7562615610659122, "num_tokens": 12901987.0, "step": 404 }, { "entropy": 1.0114603377878666, "epoch": 0.037262580433695035, "grad_norm": 0.17034700512886047, "learning_rate": 9.876100223878309e-05, "loss": 1.0192, "mean_token_accuracy": 0.7229459024965763, "num_tokens": 12933987.0, "step": 405 }, { "entropy": 1.0978050529956818, "epoch": 0.03735458680513626, "grad_norm": 0.17636926472187042, "learning_rate": 9.875793541264147e-05, "loss": 1.112, "mean_token_accuracy": 0.698073074221611, "num_tokens": 12965520.0, "step": 406 }, { "entropy": 1.0788080766797066, "epoch": 0.037446593176577475, "grad_norm": 0.17143350839614868, "learning_rate": 9.875486858649984e-05, "loss": 1.0943, "mean_token_accuracy": 0.7021720893681049, "num_tokens": 12997010.0, "step": 407 }, { "entropy": 1.0392850413918495, "epoch": 0.0375385995480187, "grad_norm": 0.17000417411327362, "learning_rate": 9.875180176035821e-05, "loss": 1.0581, "mean_token_accuracy": 0.7103569321334362, "num_tokens": 13029326.0, "step": 408 }, { "entropy": 1.004322987049818, "epoch": 0.03763060591945992, "grad_norm": 0.166298970580101, "learning_rate": 9.874873493421658e-05, "loss": 1.0134, "mean_token_accuracy": 0.7229413129389286, "num_tokens": 13060953.0, "step": 409 }, { "entropy": 0.9710695706307888, "epoch": 0.037722612290901146, "grad_norm": 0.1652998924255371, "learning_rate": 9.874566810807496e-05, "loss": 0.989, "mean_token_accuracy": 0.7285130433738232, "num_tokens": 13092530.0, "step": 410 }, { "entropy": 0.9180749878287315, "epoch": 0.03781461866234237, "grad_norm": 0.17449809610843658, "learning_rate": 9.874260128193334e-05, "loss": 0.9364, "mean_token_accuracy": 0.7407023012638092, "num_tokens": 13124442.0, "step": 411 }, { "entropy": 1.11996004357934, "epoch": 0.037906625033783586, "grad_norm": 0.17418552935123444, "learning_rate": 9.873953445579171e-05, "loss": 1.1248, "mean_token_accuracy": 0.6937156431376934, "num_tokens": 13156173.0, "step": 412 }, { "entropy": 1.053414773195982, "epoch": 0.03799863140522481, "grad_norm": 0.16683727502822876, "learning_rate": 9.873646762965007e-05, "loss": 1.0614, "mean_token_accuracy": 0.7129155397415161, "num_tokens": 13188083.0, "step": 413 }, { "entropy": 1.0056521221995354, "epoch": 0.038090637776666034, "grad_norm": 0.16785532236099243, "learning_rate": 9.873340080350846e-05, "loss": 1.0149, "mean_token_accuracy": 0.7221137546002865, "num_tokens": 13220595.0, "step": 414 }, { "entropy": 1.0297675020992756, "epoch": 0.03818264414810726, "grad_norm": 0.17071309685707092, "learning_rate": 9.873033397736682e-05, "loss": 1.0386, "mean_token_accuracy": 0.7179465256631374, "num_tokens": 13252387.0, "step": 415 }, { "entropy": 0.9606161341071129, "epoch": 0.03827465051954848, "grad_norm": 0.16314919292926788, "learning_rate": 9.87272671512252e-05, "loss": 0.9785, "mean_token_accuracy": 0.7281481437385082, "num_tokens": 13283850.0, "step": 416 }, { "entropy": 0.9838493391871452, "epoch": 0.0383666568909897, "grad_norm": 0.16217157244682312, "learning_rate": 9.872420032508357e-05, "loss": 0.9807, "mean_token_accuracy": 0.7286479398608208, "num_tokens": 13315672.0, "step": 417 }, { "entropy": 0.9159945547580719, "epoch": 0.03845866326243092, "grad_norm": 0.15739157795906067, "learning_rate": 9.872113349894196e-05, "loss": 0.8987, "mean_token_accuracy": 0.7468747198581696, "num_tokens": 13347850.0, "step": 418 }, { "entropy": 1.0316320173442364, "epoch": 0.038550669633872145, "grad_norm": 0.17621657252311707, "learning_rate": 9.871806667280032e-05, "loss": 1.0524, "mean_token_accuracy": 0.7118074521422386, "num_tokens": 13379244.0, "step": 419 }, { "entropy": 0.9849085547029972, "epoch": 0.03864267600531337, "grad_norm": 0.16847988963127136, "learning_rate": 9.871499984665869e-05, "loss": 1.006, "mean_token_accuracy": 0.7315991632640362, "num_tokens": 13411613.0, "step": 420 }, { "entropy": 1.0356707982718945, "epoch": 0.03873468237675459, "grad_norm": 0.16560828685760498, "learning_rate": 9.871193302051707e-05, "loss": 1.0535, "mean_token_accuracy": 0.7156078405678272, "num_tokens": 13443656.0, "step": 421 }, { "entropy": 0.9872327260673046, "epoch": 0.038826688748195816, "grad_norm": 0.17459335923194885, "learning_rate": 9.870886619437545e-05, "loss": 1.0031, "mean_token_accuracy": 0.7265473678708076, "num_tokens": 13475255.0, "step": 422 }, { "entropy": 1.0325854793190956, "epoch": 0.03891869511963703, "grad_norm": 0.16438168287277222, "learning_rate": 9.870579936823382e-05, "loss": 1.0241, "mean_token_accuracy": 0.7219798676669598, "num_tokens": 13507733.0, "step": 423 }, { "entropy": 1.006734848022461, "epoch": 0.039010701491078256, "grad_norm": 0.1691765934228897, "learning_rate": 9.870273254209219e-05, "loss": 0.9863, "mean_token_accuracy": 0.7285861372947693, "num_tokens": 13539348.0, "step": 424 }, { "entropy": 1.002249352633953, "epoch": 0.03910270786251948, "grad_norm": 0.16368570923805237, "learning_rate": 9.869966571595056e-05, "loss": 0.9871, "mean_token_accuracy": 0.7271999455988407, "num_tokens": 13571405.0, "step": 425 }, { "entropy": 1.0048393718898296, "epoch": 0.039194714233960704, "grad_norm": 0.27615973353385925, "learning_rate": 9.869659888980894e-05, "loss": 1.0087, "mean_token_accuracy": 0.7247118502855301, "num_tokens": 13602797.0, "step": 426 }, { "entropy": 0.9325462207198143, "epoch": 0.03928672060540193, "grad_norm": 0.16752378642559052, "learning_rate": 9.869353206366732e-05, "loss": 0.9377, "mean_token_accuracy": 0.745978232473135, "num_tokens": 13634546.0, "step": 427 }, { "entropy": 0.9929099604487419, "epoch": 0.039378726976843144, "grad_norm": 0.17789685726165771, "learning_rate": 9.869046523752569e-05, "loss": 1.0047, "mean_token_accuracy": 0.7219155803322792, "num_tokens": 13666314.0, "step": 428 }, { "entropy": 0.9159045815467834, "epoch": 0.03947073334828437, "grad_norm": 0.1598764806985855, "learning_rate": 9.868739841138407e-05, "loss": 0.9291, "mean_token_accuracy": 0.7393090985715389, "num_tokens": 13698160.0, "step": 429 }, { "entropy": 1.0404502265155315, "epoch": 0.03956273971972559, "grad_norm": 0.1731593757867813, "learning_rate": 9.868433158524244e-05, "loss": 1.0645, "mean_token_accuracy": 0.7102674506604671, "num_tokens": 13730033.0, "step": 430 }, { "entropy": 1.114392176270485, "epoch": 0.039654746091166815, "grad_norm": 0.17988698184490204, "learning_rate": 9.86812647591008e-05, "loss": 1.1273, "mean_token_accuracy": 0.7005251944065094, "num_tokens": 13761711.0, "step": 431 }, { "entropy": 0.9822462163865566, "epoch": 0.03974675246260804, "grad_norm": 0.1688549816608429, "learning_rate": 9.867819793295919e-05, "loss": 0.9881, "mean_token_accuracy": 0.7253421731293201, "num_tokens": 13793848.0, "step": 432 }, { "entropy": 0.9594956189393997, "epoch": 0.039838758834049255, "grad_norm": 0.162195086479187, "learning_rate": 9.867513110681757e-05, "loss": 0.9381, "mean_token_accuracy": 0.7382728308439255, "num_tokens": 13825858.0, "step": 433 }, { "entropy": 0.9629478938877583, "epoch": 0.03993076520549048, "grad_norm": 0.1678634136915207, "learning_rate": 9.867206428067594e-05, "loss": 0.9364, "mean_token_accuracy": 0.7352337725460529, "num_tokens": 13856521.0, "step": 434 }, { "entropy": 0.9395595081150532, "epoch": 0.0400227715769317, "grad_norm": 0.1596844494342804, "learning_rate": 9.86689974545343e-05, "loss": 0.9413, "mean_token_accuracy": 0.7388866692781448, "num_tokens": 13888613.0, "step": 435 }, { "entropy": 1.0746241621673107, "epoch": 0.040114777948372926, "grad_norm": 0.17097659409046173, "learning_rate": 9.866593062839267e-05, "loss": 1.0859, "mean_token_accuracy": 0.6997541300952435, "num_tokens": 13920209.0, "step": 436 }, { "entropy": 0.9571687839925289, "epoch": 0.04020678431981415, "grad_norm": 0.16474372148513794, "learning_rate": 9.866286380225107e-05, "loss": 0.9739, "mean_token_accuracy": 0.7354234457015991, "num_tokens": 13952483.0, "step": 437 }, { "entropy": 0.8903435505926609, "epoch": 0.040298790691255366, "grad_norm": 0.162520632147789, "learning_rate": 9.865979697610943e-05, "loss": 0.8897, "mean_token_accuracy": 0.7485632933676243, "num_tokens": 13983339.0, "step": 438 }, { "entropy": 1.0988422967493534, "epoch": 0.04039079706269659, "grad_norm": 0.1772916615009308, "learning_rate": 9.86567301499678e-05, "loss": 1.1463, "mean_token_accuracy": 0.6962193101644516, "num_tokens": 14015302.0, "step": 439 }, { "entropy": 1.0508275460451841, "epoch": 0.040482803434137814, "grad_norm": 0.16714204847812653, "learning_rate": 9.865366332382617e-05, "loss": 1.0611, "mean_token_accuracy": 0.7144768461585045, "num_tokens": 14047693.0, "step": 440 }, { "entropy": 1.053979579359293, "epoch": 0.04057480980557904, "grad_norm": 0.16524246335029602, "learning_rate": 9.865059649768455e-05, "loss": 1.0647, "mean_token_accuracy": 0.707475584000349, "num_tokens": 14079607.0, "step": 441 }, { "entropy": 0.9862862415611744, "epoch": 0.04066681617702026, "grad_norm": 0.16560500860214233, "learning_rate": 9.864752967154293e-05, "loss": 1.0034, "mean_token_accuracy": 0.7281387448310852, "num_tokens": 14112375.0, "step": 442 }, { "entropy": 1.0791384130716324, "epoch": 0.04075882254846148, "grad_norm": 0.17855489253997803, "learning_rate": 9.86444628454013e-05, "loss": 1.0705, "mean_token_accuracy": 0.7084731496870518, "num_tokens": 14143777.0, "step": 443 }, { "entropy": 1.0406125336885452, "epoch": 0.0408508289199027, "grad_norm": 0.1689472496509552, "learning_rate": 9.864139601925967e-05, "loss": 1.0206, "mean_token_accuracy": 0.7244569584727287, "num_tokens": 14176256.0, "step": 444 }, { "entropy": 1.0324552282691002, "epoch": 0.040942835291343925, "grad_norm": 0.16691230237483978, "learning_rate": 9.863832919311805e-05, "loss": 0.9982, "mean_token_accuracy": 0.7252889536321163, "num_tokens": 14208118.0, "step": 445 }, { "entropy": 0.9507054463028908, "epoch": 0.04103484166278515, "grad_norm": 0.17725025117397308, "learning_rate": 9.863526236697642e-05, "loss": 0.9394, "mean_token_accuracy": 0.7385678701102734, "num_tokens": 14239863.0, "step": 446 }, { "entropy": 0.9064260274171829, "epoch": 0.04112684803422637, "grad_norm": 0.16163617372512817, "learning_rate": 9.86321955408348e-05, "loss": 0.9039, "mean_token_accuracy": 0.7509748563170433, "num_tokens": 14272369.0, "step": 447 }, { "entropy": 1.1047485694289207, "epoch": 0.04121885440566759, "grad_norm": 0.17077849805355072, "learning_rate": 9.862912871469317e-05, "loss": 1.1291, "mean_token_accuracy": 0.6987112313508987, "num_tokens": 14304949.0, "step": 448 }, { "entropy": 0.9774901755154133, "epoch": 0.04131086077710881, "grad_norm": 0.1709381490945816, "learning_rate": 9.862606188855155e-05, "loss": 1.0215, "mean_token_accuracy": 0.7202001512050629, "num_tokens": 14337132.0, "step": 449 }, { "entropy": 0.9640143178403378, "epoch": 0.041402867148550036, "grad_norm": 0.1706177443265915, "learning_rate": 9.862299506240992e-05, "loss": 1.0043, "mean_token_accuracy": 0.7218887060880661, "num_tokens": 14369274.0, "step": 450 }, { "entropy": 0.9488422982394695, "epoch": 0.04149487351999126, "grad_norm": 0.1612362116575241, "learning_rate": 9.861992823626828e-05, "loss": 0.9503, "mean_token_accuracy": 0.7361940965056419, "num_tokens": 14401497.0, "step": 451 }, { "entropy": 1.0639336369931698, "epoch": 0.041586879891432484, "grad_norm": 0.17198891937732697, "learning_rate": 9.861686141012667e-05, "loss": 1.0742, "mean_token_accuracy": 0.7064671106636524, "num_tokens": 14433160.0, "step": 452 }, { "entropy": 0.9131907224655151, "epoch": 0.04167888626287371, "grad_norm": 0.15841710567474365, "learning_rate": 9.861379458398505e-05, "loss": 0.9032, "mean_token_accuracy": 0.7455384209752083, "num_tokens": 14465155.0, "step": 453 }, { "entropy": 1.005853183567524, "epoch": 0.041770892634314924, "grad_norm": 0.1667892187833786, "learning_rate": 9.861072775784342e-05, "loss": 1.0081, "mean_token_accuracy": 0.7247069738805294, "num_tokens": 14496056.0, "step": 454 }, { "entropy": 0.9747581593692303, "epoch": 0.04186289900575615, "grad_norm": 0.1641293466091156, "learning_rate": 9.860766093170178e-05, "loss": 0.9754, "mean_token_accuracy": 0.7309782467782497, "num_tokens": 14528432.0, "step": 455 }, { "entropy": 0.9135883450508118, "epoch": 0.04195490537719737, "grad_norm": 0.1626873016357422, "learning_rate": 9.860459410556015e-05, "loss": 0.9142, "mean_token_accuracy": 0.7430468536913395, "num_tokens": 14560104.0, "step": 456 }, { "entropy": 1.0127588957548141, "epoch": 0.042046911748638595, "grad_norm": 0.17270705103874207, "learning_rate": 9.860152727941853e-05, "loss": 1.021, "mean_token_accuracy": 0.7224766612052917, "num_tokens": 14591753.0, "step": 457 }, { "entropy": 0.9827232696115971, "epoch": 0.04213891812007982, "grad_norm": 0.18595170974731445, "learning_rate": 9.859846045327691e-05, "loss": 0.9864, "mean_token_accuracy": 0.729983314871788, "num_tokens": 14623459.0, "step": 458 }, { "entropy": 1.028811253607273, "epoch": 0.042230924491521035, "grad_norm": 0.1726570576429367, "learning_rate": 9.859539362713528e-05, "loss": 1.0439, "mean_token_accuracy": 0.7178481444716454, "num_tokens": 14655035.0, "step": 459 }, { "entropy": 1.0910115167498589, "epoch": 0.04232293086296226, "grad_norm": 0.17036913335323334, "learning_rate": 9.859232680099366e-05, "loss": 1.101, "mean_token_accuracy": 0.7012305520474911, "num_tokens": 14686749.0, "step": 460 }, { "entropy": 1.0199798494577408, "epoch": 0.04241493723440348, "grad_norm": 0.16065360605716705, "learning_rate": 9.858925997485203e-05, "loss": 1.0138, "mean_token_accuracy": 0.7204526774585247, "num_tokens": 14718454.0, "step": 461 }, { "entropy": 0.9938953183591366, "epoch": 0.042506943605844706, "grad_norm": 0.16792386770248413, "learning_rate": 9.85861931487104e-05, "loss": 0.9841, "mean_token_accuracy": 0.7303761541843414, "num_tokens": 14749963.0, "step": 462 }, { "entropy": 1.0054540112614632, "epoch": 0.04259894997728593, "grad_norm": 0.16829322278499603, "learning_rate": 9.858312632256878e-05, "loss": 1.0004, "mean_token_accuracy": 0.7285681366920471, "num_tokens": 14782141.0, "step": 463 }, { "entropy": 1.0681659132242203, "epoch": 0.042690956348727147, "grad_norm": 0.17712776362895966, "learning_rate": 9.858005949642716e-05, "loss": 1.0851, "mean_token_accuracy": 0.7081322111189365, "num_tokens": 14813717.0, "step": 464 }, { "entropy": 1.0289651975035667, "epoch": 0.04278296272016837, "grad_norm": 0.16890780627727509, "learning_rate": 9.857699267028553e-05, "loss": 1.0278, "mean_token_accuracy": 0.7198490500450134, "num_tokens": 14845695.0, "step": 465 }, { "entropy": 0.9659386463463306, "epoch": 0.042874969091609594, "grad_norm": 0.1655670404434204, "learning_rate": 9.85739258441439e-05, "loss": 0.948, "mean_token_accuracy": 0.7323296628892422, "num_tokens": 14876542.0, "step": 466 }, { "entropy": 1.082155641168356, "epoch": 0.04296697546305082, "grad_norm": 0.1711169332265854, "learning_rate": 9.857085901800227e-05, "loss": 1.0844, "mean_token_accuracy": 0.7022744417190552, "num_tokens": 14908336.0, "step": 467 }, { "entropy": 1.0541718192398548, "epoch": 0.04305898183449204, "grad_norm": 0.16499820351600647, "learning_rate": 9.856779219186065e-05, "loss": 1.0626, "mean_token_accuracy": 0.7141343988478184, "num_tokens": 14941049.0, "step": 468 }, { "entropy": 0.990358866751194, "epoch": 0.04315098820593326, "grad_norm": 0.1699855923652649, "learning_rate": 9.856472536571903e-05, "loss": 0.9717, "mean_token_accuracy": 0.7303466461598873, "num_tokens": 14971931.0, "step": 469 }, { "entropy": 1.0079026594758034, "epoch": 0.04324299457737448, "grad_norm": 0.18114951252937317, "learning_rate": 9.85616585395774e-05, "loss": 1.0553, "mean_token_accuracy": 0.7136130630970001, "num_tokens": 15003359.0, "step": 470 }, { "entropy": 1.044851902872324, "epoch": 0.043335000948815705, "grad_norm": 0.179159477353096, "learning_rate": 9.855859171343576e-05, "loss": 1.0798, "mean_token_accuracy": 0.709804143756628, "num_tokens": 15035784.0, "step": 471 }, { "entropy": 0.8731819577515125, "epoch": 0.04342700732025693, "grad_norm": 0.1596076339483261, "learning_rate": 9.855552488729415e-05, "loss": 0.8797, "mean_token_accuracy": 0.7525278553366661, "num_tokens": 15067234.0, "step": 472 }, { "entropy": 1.005760069936514, "epoch": 0.04351901369169815, "grad_norm": 0.16880400478839874, "learning_rate": 9.855245806115251e-05, "loss": 1.0111, "mean_token_accuracy": 0.7245165891945362, "num_tokens": 15099527.0, "step": 473 }, { "entropy": 1.0048915781080723, "epoch": 0.04361102006313937, "grad_norm": 0.16019918024539948, "learning_rate": 9.85493912350109e-05, "loss": 1.0068, "mean_token_accuracy": 0.7270114235579967, "num_tokens": 15131948.0, "step": 474 }, { "entropy": 1.0810152143239975, "epoch": 0.04370302643458059, "grad_norm": 0.1750817745923996, "learning_rate": 9.854632440886926e-05, "loss": 1.0713, "mean_token_accuracy": 0.7154526896774769, "num_tokens": 15163943.0, "step": 475 }, { "entropy": 0.8974347617477179, "epoch": 0.043795032806021816, "grad_norm": 0.14788956940174103, "learning_rate": 9.854325758272764e-05, "loss": 0.8466, "mean_token_accuracy": 0.7642371952533722, "num_tokens": 15195645.0, "step": 476 }, { "entropy": 0.9626926407217979, "epoch": 0.04388703917746304, "grad_norm": 0.16394424438476562, "learning_rate": 9.854019075658601e-05, "loss": 0.9659, "mean_token_accuracy": 0.735569316893816, "num_tokens": 15228042.0, "step": 477 }, { "entropy": 1.0828361846506596, "epoch": 0.043979045548904264, "grad_norm": 0.18153053522109985, "learning_rate": 9.853712393044438e-05, "loss": 1.1257, "mean_token_accuracy": 0.6984194666147232, "num_tokens": 15259780.0, "step": 478 }, { "entropy": 0.990173913538456, "epoch": 0.04407105192034549, "grad_norm": 0.16425317525863647, "learning_rate": 9.853405710430276e-05, "loss": 0.9918, "mean_token_accuracy": 0.7264580465853214, "num_tokens": 15292094.0, "step": 479 }, { "entropy": 0.9448204785585403, "epoch": 0.044163058291786704, "grad_norm": 0.16387133300304413, "learning_rate": 9.853099027816114e-05, "loss": 0.9468, "mean_token_accuracy": 0.7394870258867741, "num_tokens": 15323733.0, "step": 480 }, { "entropy": 1.0291991084814072, "epoch": 0.04425506466322793, "grad_norm": 0.1707683503627777, "learning_rate": 9.852792345201951e-05, "loss": 1.0745, "mean_token_accuracy": 0.7095636986196041, "num_tokens": 15356438.0, "step": 481 }, { "entropy": 1.0038556605577469, "epoch": 0.04434707103466915, "grad_norm": 0.1699240803718567, "learning_rate": 9.852485662587788e-05, "loss": 1.0219, "mean_token_accuracy": 0.7195817418396473, "num_tokens": 15387811.0, "step": 482 }, { "entropy": 1.0137430615723133, "epoch": 0.044439077406110375, "grad_norm": 0.17154064774513245, "learning_rate": 9.852178979973625e-05, "loss": 1.0437, "mean_token_accuracy": 0.7150721289217472, "num_tokens": 15419270.0, "step": 483 }, { "entropy": 0.8973237853497267, "epoch": 0.0445310837775516, "grad_norm": 0.1608092188835144, "learning_rate": 9.851872297359464e-05, "loss": 0.8974, "mean_token_accuracy": 0.7489767372608185, "num_tokens": 15451102.0, "step": 484 }, { "entropy": 0.9676474370062351, "epoch": 0.044623090148992815, "grad_norm": 0.1591765433549881, "learning_rate": 9.851565614745301e-05, "loss": 0.9604, "mean_token_accuracy": 0.738324161618948, "num_tokens": 15483530.0, "step": 485 }, { "entropy": 0.9637531265616417, "epoch": 0.04471509652043404, "grad_norm": 0.15718592703342438, "learning_rate": 9.851258932131138e-05, "loss": 0.9645, "mean_token_accuracy": 0.7379612438380718, "num_tokens": 15515934.0, "step": 486 }, { "entropy": 1.046225119382143, "epoch": 0.04480710289187526, "grad_norm": 0.1642787605524063, "learning_rate": 9.850952249516974e-05, "loss": 1.0441, "mean_token_accuracy": 0.7204109765589237, "num_tokens": 15548279.0, "step": 487 }, { "entropy": 1.160289503633976, "epoch": 0.044899109263316486, "grad_norm": 0.18160724639892578, "learning_rate": 9.850645566902813e-05, "loss": 1.1412, "mean_token_accuracy": 0.6901385225355625, "num_tokens": 15580358.0, "step": 488 }, { "entropy": 0.9516584761440754, "epoch": 0.04499111563475771, "grad_norm": 0.16449078917503357, "learning_rate": 9.850338884288651e-05, "loss": 0.9357, "mean_token_accuracy": 0.7386973090469837, "num_tokens": 15612380.0, "step": 489 }, { "entropy": 1.0169189162552357, "epoch": 0.04508312200619893, "grad_norm": 2.589756965637207, "learning_rate": 9.850032201674488e-05, "loss": 1.0007, "mean_token_accuracy": 0.7259696684777737, "num_tokens": 15644546.0, "step": 490 }, { "entropy": 0.9180504865944386, "epoch": 0.04517512837764015, "grad_norm": 0.1614355593919754, "learning_rate": 9.849725519060326e-05, "loss": 0.9257, "mean_token_accuracy": 0.7417123541235924, "num_tokens": 15677072.0, "step": 491 }, { "entropy": 1.02853412181139, "epoch": 0.045267134749081374, "grad_norm": 0.32491713762283325, "learning_rate": 9.849418836446162e-05, "loss": 1.0385, "mean_token_accuracy": 0.7164977677166462, "num_tokens": 15708767.0, "step": 492 }, { "entropy": 1.0291013531386852, "epoch": 0.0453591411205226, "grad_norm": 0.17130427062511444, "learning_rate": 9.849112153831999e-05, "loss": 1.0284, "mean_token_accuracy": 0.7171813435852528, "num_tokens": 15740996.0, "step": 493 }, { "entropy": 0.9812391102313995, "epoch": 0.04545114749196382, "grad_norm": 0.16899001598358154, "learning_rate": 9.848805471217837e-05, "loss": 0.9823, "mean_token_accuracy": 0.7301101200282574, "num_tokens": 15773315.0, "step": 494 }, { "entropy": 0.9653379768133163, "epoch": 0.04554315386340504, "grad_norm": 0.1684325486421585, "learning_rate": 9.848498788603676e-05, "loss": 0.9779, "mean_token_accuracy": 0.72777896001935, "num_tokens": 15805366.0, "step": 495 }, { "entropy": 0.9256263040006161, "epoch": 0.04563516023484626, "grad_norm": 0.17400746047496796, "learning_rate": 9.848192105989512e-05, "loss": 0.9318, "mean_token_accuracy": 0.7422780506312847, "num_tokens": 15836787.0, "step": 496 }, { "entropy": 0.9993999637663364, "epoch": 0.045727166606287485, "grad_norm": 0.17800436913967133, "learning_rate": 9.847885423375349e-05, "loss": 1.0107, "mean_token_accuracy": 0.7217923253774643, "num_tokens": 15868379.0, "step": 497 }, { "entropy": 1.0723948143422604, "epoch": 0.04581917297772871, "grad_norm": 0.17987535893917084, "learning_rate": 9.847578740761186e-05, "loss": 1.1054, "mean_token_accuracy": 0.7003863900899887, "num_tokens": 15899644.0, "step": 498 }, { "entropy": 0.9887304380536079, "epoch": 0.04591117934916993, "grad_norm": 0.17515528202056885, "learning_rate": 9.847272058147024e-05, "loss": 1.0131, "mean_token_accuracy": 0.7256871573626995, "num_tokens": 15930404.0, "step": 499 }, { "entropy": 1.0227028280496597, "epoch": 0.04600318572061115, "grad_norm": 0.17213261127471924, "learning_rate": 9.846965375532862e-05, "loss": 1.0259, "mean_token_accuracy": 0.7217556983232498, "num_tokens": 15963017.0, "step": 500 }, { "entropy": 0.9503715112805367, "epoch": 0.04609519209205237, "grad_norm": 0.16630369424819946, "learning_rate": 9.846658692918699e-05, "loss": 0.9486, "mean_token_accuracy": 0.738661877810955, "num_tokens": 15994718.0, "step": 501 }, { "entropy": 0.9515565820038319, "epoch": 0.046187198463493596, "grad_norm": 0.15728501975536346, "learning_rate": 9.846352010304536e-05, "loss": 0.9327, "mean_token_accuracy": 0.7443478964269161, "num_tokens": 16026921.0, "step": 502 }, { "entropy": 0.9882955569773912, "epoch": 0.04627920483493482, "grad_norm": 0.16177190840244293, "learning_rate": 9.846045327690374e-05, "loss": 0.982, "mean_token_accuracy": 0.7290174178779125, "num_tokens": 16059334.0, "step": 503 }, { "entropy": 0.9713782593607903, "epoch": 0.046371211206376044, "grad_norm": 0.17542076110839844, "learning_rate": 9.845738645076211e-05, "loss": 0.9608, "mean_token_accuracy": 0.7331028394401073, "num_tokens": 16089982.0, "step": 504 }, { "entropy": 1.1129347868263721, "epoch": 0.04646321757781726, "grad_norm": 0.1756894290447235, "learning_rate": 9.845431962462049e-05, "loss": 1.1011, "mean_token_accuracy": 0.696821041405201, "num_tokens": 16121407.0, "step": 505 }, { "entropy": 0.9673193357884884, "epoch": 0.046555223949258484, "grad_norm": 0.1794266402721405, "learning_rate": 9.845125279847886e-05, "loss": 0.9899, "mean_token_accuracy": 0.7275874689221382, "num_tokens": 16153246.0, "step": 506 }, { "entropy": 0.9888970255851746, "epoch": 0.04664723032069971, "grad_norm": 0.1732143610715866, "learning_rate": 9.844818597233724e-05, "loss": 0.9943, "mean_token_accuracy": 0.7196294888854027, "num_tokens": 16185560.0, "step": 507 }, { "entropy": 1.0084959976375103, "epoch": 0.04673923669214093, "grad_norm": 0.16477088630199432, "learning_rate": 9.84451191461956e-05, "loss": 1.0178, "mean_token_accuracy": 0.7248051688075066, "num_tokens": 16217723.0, "step": 508 }, { "entropy": 1.0579893682152033, "epoch": 0.046831243063582155, "grad_norm": 0.1757245808839798, "learning_rate": 9.844205232005397e-05, "loss": 1.0792, "mean_token_accuracy": 0.7037666104733944, "num_tokens": 16248816.0, "step": 509 }, { "entropy": 0.9246227145195007, "epoch": 0.04692324943502338, "grad_norm": 0.16566230356693268, "learning_rate": 9.843898549391235e-05, "loss": 0.9683, "mean_token_accuracy": 0.7360695637762547, "num_tokens": 16281008.0, "step": 510 }, { "entropy": 1.0756047256290913, "epoch": 0.047015255806464595, "grad_norm": 0.17584773898124695, "learning_rate": 9.843591866777074e-05, "loss": 1.0733, "mean_token_accuracy": 0.7046601213514805, "num_tokens": 16312613.0, "step": 511 }, { "entropy": 1.0292916856706142, "epoch": 0.04710726217790582, "grad_norm": 0.16579344868659973, "learning_rate": 9.84328518416291e-05, "loss": 1.0205, "mean_token_accuracy": 0.7179612033069134, "num_tokens": 16344471.0, "step": 512 }, { "entropy": 0.9672829136252403, "epoch": 0.04719926854934704, "grad_norm": 0.16674520075321198, "learning_rate": 9.842978501548747e-05, "loss": 0.956, "mean_token_accuracy": 0.7386903539299965, "num_tokens": 16376025.0, "step": 513 }, { "entropy": 0.951029684394598, "epoch": 0.047291274920788266, "grad_norm": 0.16606657207012177, "learning_rate": 9.842671818934584e-05, "loss": 0.9282, "mean_token_accuracy": 0.7439240366220474, "num_tokens": 16408793.0, "step": 514 }, { "entropy": 1.0138020440936089, "epoch": 0.04738328129222949, "grad_norm": 0.16918045282363892, "learning_rate": 9.842365136320422e-05, "loss": 0.9916, "mean_token_accuracy": 0.7240328527987003, "num_tokens": 16440081.0, "step": 515 }, { "entropy": 0.9985101297497749, "epoch": 0.04747528766367071, "grad_norm": 0.16846980154514313, "learning_rate": 9.84205845370626e-05, "loss": 1.0057, "mean_token_accuracy": 0.7223841436207294, "num_tokens": 16472231.0, "step": 516 }, { "entropy": 1.029073879122734, "epoch": 0.04756729403511193, "grad_norm": 0.16698753833770752, "learning_rate": 9.841751771092097e-05, "loss": 1.0091, "mean_token_accuracy": 0.7174799740314484, "num_tokens": 16504535.0, "step": 517 }, { "entropy": 1.0676442086696625, "epoch": 0.047659300406553154, "grad_norm": 0.17522063851356506, "learning_rate": 9.841445088477934e-05, "loss": 1.0884, "mean_token_accuracy": 0.7038857564330101, "num_tokens": 16536450.0, "step": 518 }, { "entropy": 0.9670837223529816, "epoch": 0.04775130677799438, "grad_norm": 0.167304128408432, "learning_rate": 9.841138405863772e-05, "loss": 0.9748, "mean_token_accuracy": 0.729322899132967, "num_tokens": 16567837.0, "step": 519 }, { "entropy": 0.9472971484065056, "epoch": 0.0478433131494356, "grad_norm": 0.16083310544490814, "learning_rate": 9.840831723249609e-05, "loss": 0.9645, "mean_token_accuracy": 0.7310571931302547, "num_tokens": 16599657.0, "step": 520 }, { "entropy": 1.050604097545147, "epoch": 0.04793531952087682, "grad_norm": 0.17711392045021057, "learning_rate": 9.840525040635447e-05, "loss": 1.0855, "mean_token_accuracy": 0.7092321552336216, "num_tokens": 16630704.0, "step": 521 }, { "entropy": 1.014123309403658, "epoch": 0.04802732589231804, "grad_norm": 0.17138954997062683, "learning_rate": 9.840218358021285e-05, "loss": 1.0393, "mean_token_accuracy": 0.7118928618729115, "num_tokens": 16662594.0, "step": 522 }, { "entropy": 1.0701517760753632, "epoch": 0.048119332263759265, "grad_norm": 0.173891082406044, "learning_rate": 9.839911675407122e-05, "loss": 1.0983, "mean_token_accuracy": 0.7016746997833252, "num_tokens": 16694245.0, "step": 523 }, { "entropy": 1.0471469946205616, "epoch": 0.04821133863520049, "grad_norm": 0.1749057173728943, "learning_rate": 9.839604992792959e-05, "loss": 1.0247, "mean_token_accuracy": 0.7195007130503654, "num_tokens": 16726548.0, "step": 524 }, { "entropy": 0.9441933836787939, "epoch": 0.04830334500664171, "grad_norm": 0.1559460461139679, "learning_rate": 9.839298310178797e-05, "loss": 0.9394, "mean_token_accuracy": 0.7386441603302956, "num_tokens": 16758437.0, "step": 525 }, { "entropy": 0.9703962281346321, "epoch": 0.04839535137808293, "grad_norm": 0.16279587149620056, "learning_rate": 9.838991627564635e-05, "loss": 0.9476, "mean_token_accuracy": 0.7357053533196449, "num_tokens": 16789658.0, "step": 526 }, { "entropy": 1.0778263621032238, "epoch": 0.04848735774952415, "grad_norm": 0.1774022877216339, "learning_rate": 9.838684944950472e-05, "loss": 1.0648, "mean_token_accuracy": 0.70652761682868, "num_tokens": 16821415.0, "step": 527 }, { "entropy": 1.0894627943634987, "epoch": 0.048579364120965376, "grad_norm": 0.17032833397388458, "learning_rate": 9.838378262336308e-05, "loss": 1.0661, "mean_token_accuracy": 0.708966538310051, "num_tokens": 16853750.0, "step": 528 }, { "entropy": 0.9477349556982517, "epoch": 0.0486713704924066, "grad_norm": 0.1650213748216629, "learning_rate": 9.838071579722145e-05, "loss": 0.9719, "mean_token_accuracy": 0.7361862733960152, "num_tokens": 16885712.0, "step": 529 }, { "entropy": 1.0294384360313416, "epoch": 0.048763376863847824, "grad_norm": 0.1641075164079666, "learning_rate": 9.837764897107983e-05, "loss": 1.0118, "mean_token_accuracy": 0.7239221557974815, "num_tokens": 16917687.0, "step": 530 }, { "entropy": 1.008217878639698, "epoch": 0.04885538323528904, "grad_norm": 0.16842016577720642, "learning_rate": 9.837458214493822e-05, "loss": 1.0344, "mean_token_accuracy": 0.7140330150723457, "num_tokens": 16949029.0, "step": 531 }, { "entropy": 1.0954037606716156, "epoch": 0.048947389606730264, "grad_norm": 0.1698404848575592, "learning_rate": 9.837151531879658e-05, "loss": 1.1082, "mean_token_accuracy": 0.6955718025565147, "num_tokens": 16980918.0, "step": 532 }, { "entropy": 0.9094005711376667, "epoch": 0.04903939597817149, "grad_norm": 0.16477352380752563, "learning_rate": 9.836844849265495e-05, "loss": 0.931, "mean_token_accuracy": 0.739186592400074, "num_tokens": 17011627.0, "step": 533 }, { "entropy": 1.0502020604908466, "epoch": 0.04913140234961271, "grad_norm": 0.17290066182613373, "learning_rate": 9.836538166651333e-05, "loss": 1.064, "mean_token_accuracy": 0.7079633697867393, "num_tokens": 17044181.0, "step": 534 }, { "entropy": 0.9552319645881653, "epoch": 0.049223408721053935, "grad_norm": 0.1622290164232254, "learning_rate": 9.83623148403717e-05, "loss": 0.956, "mean_token_accuracy": 0.7367539927363396, "num_tokens": 17076248.0, "step": 535 }, { "entropy": 0.9200166612863541, "epoch": 0.04931541509249516, "grad_norm": 0.1618937999010086, "learning_rate": 9.835924801423008e-05, "loss": 0.9399, "mean_token_accuracy": 0.7418420985341072, "num_tokens": 17108734.0, "step": 536 }, { "entropy": 0.9201037250459194, "epoch": 0.049407421463936375, "grad_norm": 0.15908339619636536, "learning_rate": 9.835618118808845e-05, "loss": 0.9168, "mean_token_accuracy": 0.7472463771700859, "num_tokens": 17140694.0, "step": 537 }, { "entropy": 1.0076869651675224, "epoch": 0.0494994278353776, "grad_norm": 0.16837343573570251, "learning_rate": 9.835311436194683e-05, "loss": 1.0012, "mean_token_accuracy": 0.7212460935115814, "num_tokens": 17172544.0, "step": 538 }, { "entropy": 1.0293160416185856, "epoch": 0.04959143420681882, "grad_norm": 0.172407329082489, "learning_rate": 9.83500475358052e-05, "loss": 1.0324, "mean_token_accuracy": 0.7161697596311569, "num_tokens": 17204918.0, "step": 539 }, { "entropy": 1.011706616729498, "epoch": 0.049683440578260046, "grad_norm": 0.1620049625635147, "learning_rate": 9.834698070966357e-05, "loss": 0.9896, "mean_token_accuracy": 0.7315260767936707, "num_tokens": 17236934.0, "step": 540 }, { "entropy": 1.0055107064545155, "epoch": 0.04977544694970127, "grad_norm": 0.16998472809791565, "learning_rate": 9.834391388352195e-05, "loss": 1.0082, "mean_token_accuracy": 0.7236494198441505, "num_tokens": 17267766.0, "step": 541 }, { "entropy": 0.9763946197926998, "epoch": 0.04986745332114249, "grad_norm": 0.16132113337516785, "learning_rate": 9.834084705738033e-05, "loss": 0.9743, "mean_token_accuracy": 0.7367479205131531, "num_tokens": 17299798.0, "step": 542 }, { "entropy": 1.0388979576528072, "epoch": 0.04995945969258371, "grad_norm": 0.17427237331867218, "learning_rate": 9.83377802312387e-05, "loss": 1.0635, "mean_token_accuracy": 0.7076380364596844, "num_tokens": 17331596.0, "step": 543 }, { "entropy": 0.9870390817523003, "epoch": 0.050051466064024934, "grad_norm": 0.16441281139850616, "learning_rate": 9.833471340509707e-05, "loss": 0.9615, "mean_token_accuracy": 0.7325824201107025, "num_tokens": 17363308.0, "step": 544 }, { "entropy": 0.9407383874058723, "epoch": 0.05014347243546616, "grad_norm": 0.1604689359664917, "learning_rate": 9.833164657895543e-05, "loss": 0.943, "mean_token_accuracy": 0.7365087680518627, "num_tokens": 17395091.0, "step": 545 }, { "entropy": 1.0013816580176353, "epoch": 0.05023547880690738, "grad_norm": 0.1669689565896988, "learning_rate": 9.832857975281382e-05, "loss": 1.0139, "mean_token_accuracy": 0.7213457152247429, "num_tokens": 17426381.0, "step": 546 }, { "entropy": 0.9162729755043983, "epoch": 0.0503274851783486, "grad_norm": 0.15749605000019073, "learning_rate": 9.83255129266722e-05, "loss": 0.9231, "mean_token_accuracy": 0.7459959164261818, "num_tokens": 17458873.0, "step": 547 }, { "entropy": 1.0329615660011768, "epoch": 0.05041949154978982, "grad_norm": 0.17582499980926514, "learning_rate": 9.832244610053056e-05, "loss": 1.0477, "mean_token_accuracy": 0.710836473852396, "num_tokens": 17491280.0, "step": 548 }, { "entropy": 0.8994362950325012, "epoch": 0.050511497921231045, "grad_norm": 0.16417865455150604, "learning_rate": 9.831937927438893e-05, "loss": 0.923, "mean_token_accuracy": 0.740050058811903, "num_tokens": 17523000.0, "step": 549 }, { "entropy": 1.0479478985071182, "epoch": 0.05060350429267227, "grad_norm": 0.1678975224494934, "learning_rate": 9.831631244824731e-05, "loss": 1.0577, "mean_token_accuracy": 0.7132011875510216, "num_tokens": 17555460.0, "step": 550 }, { "entropy": 1.0371168218553066, "epoch": 0.05069551066411349, "grad_norm": 0.17465507984161377, "learning_rate": 9.831324562210568e-05, "loss": 1.0347, "mean_token_accuracy": 0.715814758092165, "num_tokens": 17587010.0, "step": 551 }, { "entropy": 0.9364320486783981, "epoch": 0.05078751703555471, "grad_norm": 0.1658712774515152, "learning_rate": 9.831017879596406e-05, "loss": 0.9437, "mean_token_accuracy": 0.735924705862999, "num_tokens": 17619179.0, "step": 552 }, { "entropy": 0.912044133991003, "epoch": 0.05087952340699593, "grad_norm": 0.15669046342372894, "learning_rate": 9.830711196982244e-05, "loss": 0.914, "mean_token_accuracy": 0.74590864777565, "num_tokens": 17651947.0, "step": 553 }, { "entropy": 1.0051476322114468, "epoch": 0.05097152977843716, "grad_norm": 0.1639261096715927, "learning_rate": 9.830404514368081e-05, "loss": 1.0048, "mean_token_accuracy": 0.7183269262313843, "num_tokens": 17684073.0, "step": 554 }, { "entropy": 1.007434420287609, "epoch": 0.05106353614987838, "grad_norm": 0.16628429293632507, "learning_rate": 9.830097831753918e-05, "loss": 1.0178, "mean_token_accuracy": 0.7237194627523422, "num_tokens": 17716329.0, "step": 555 }, { "entropy": 0.9027214385569096, "epoch": 0.051155542521319604, "grad_norm": 0.16451740264892578, "learning_rate": 9.829791149139755e-05, "loss": 0.9169, "mean_token_accuracy": 0.7412130460143089, "num_tokens": 17748237.0, "step": 556 }, { "entropy": 0.9756428450345993, "epoch": 0.05124754889276082, "grad_norm": 0.16507889330387115, "learning_rate": 9.829484466525594e-05, "loss": 0.9721, "mean_token_accuracy": 0.7340170815587044, "num_tokens": 17780645.0, "step": 557 }, { "entropy": 0.970120832324028, "epoch": 0.051339555264202044, "grad_norm": 0.16375243663787842, "learning_rate": 9.829177783911431e-05, "loss": 0.9585, "mean_token_accuracy": 0.7333049513399601, "num_tokens": 17812773.0, "step": 558 }, { "entropy": 0.9633282534778118, "epoch": 0.05143156163564327, "grad_norm": 0.1719096601009369, "learning_rate": 9.828871101297268e-05, "loss": 0.9813, "mean_token_accuracy": 0.7322728931903839, "num_tokens": 17844376.0, "step": 559 }, { "entropy": 1.0544274300336838, "epoch": 0.05152356800708449, "grad_norm": 0.172214537858963, "learning_rate": 9.828564418683105e-05, "loss": 1.0719, "mean_token_accuracy": 0.708241768181324, "num_tokens": 17875893.0, "step": 560 }, { "entropy": 0.9789530634880066, "epoch": 0.051615574378525715, "grad_norm": 0.16846075654029846, "learning_rate": 9.828257736068943e-05, "loss": 0.9937, "mean_token_accuracy": 0.7256319187581539, "num_tokens": 17907521.0, "step": 561 }, { "entropy": 0.9505788125097752, "epoch": 0.05170758074996693, "grad_norm": 0.16983327269554138, "learning_rate": 9.827951053454781e-05, "loss": 0.9656, "mean_token_accuracy": 0.7319183200597763, "num_tokens": 17939316.0, "step": 562 }, { "entropy": 0.9364796727895737, "epoch": 0.051799587121408155, "grad_norm": 0.16691994667053223, "learning_rate": 9.827644370840618e-05, "loss": 0.954, "mean_token_accuracy": 0.733334057033062, "num_tokens": 17971562.0, "step": 563 }, { "entropy": 1.093628104776144, "epoch": 0.05189159349284938, "grad_norm": 0.17215657234191895, "learning_rate": 9.827337688226455e-05, "loss": 1.1, "mean_token_accuracy": 0.700460460036993, "num_tokens": 18003552.0, "step": 564 }, { "entropy": 1.0223537348210812, "epoch": 0.0519835998642906, "grad_norm": 0.16822141408920288, "learning_rate": 9.827031005612293e-05, "loss": 1.0358, "mean_token_accuracy": 0.7176885083317757, "num_tokens": 18035588.0, "step": 565 }, { "entropy": 0.9041565731167793, "epoch": 0.052075606235731826, "grad_norm": 0.16017886996269226, "learning_rate": 9.82672432299813e-05, "loss": 0.8889, "mean_token_accuracy": 0.7488632276654243, "num_tokens": 18067353.0, "step": 566 }, { "entropy": 1.0327695086598396, "epoch": 0.05216761260717305, "grad_norm": 0.16594529151916504, "learning_rate": 9.826417640383968e-05, "loss": 1.025, "mean_token_accuracy": 0.7211896292865276, "num_tokens": 18099113.0, "step": 567 }, { "entropy": 0.9946831949055195, "epoch": 0.05225961897861427, "grad_norm": 0.1627434939146042, "learning_rate": 9.826110957769804e-05, "loss": 1.0086, "mean_token_accuracy": 0.7295725010335445, "num_tokens": 18131160.0, "step": 568 }, { "entropy": 0.9707537852227688, "epoch": 0.05235162535005549, "grad_norm": 0.16237430274486542, "learning_rate": 9.825804275155643e-05, "loss": 0.9552, "mean_token_accuracy": 0.7393050342798233, "num_tokens": 18162855.0, "step": 569 }, { "entropy": 0.9826064929366112, "epoch": 0.052443631721496714, "grad_norm": 0.16453254222869873, "learning_rate": 9.825497592541479e-05, "loss": 0.9786, "mean_token_accuracy": 0.7294545508921146, "num_tokens": 18194300.0, "step": 570 }, { "entropy": 0.9876124411821365, "epoch": 0.05253563809293794, "grad_norm": 0.16435474157333374, "learning_rate": 9.825190909927316e-05, "loss": 0.9753, "mean_token_accuracy": 0.7324376478791237, "num_tokens": 18225521.0, "step": 571 }, { "entropy": 0.8610127381980419, "epoch": 0.05262764446437916, "grad_norm": 0.15473127365112305, "learning_rate": 9.824884227313154e-05, "loss": 0.8549, "mean_token_accuracy": 0.7599730007350445, "num_tokens": 18257791.0, "step": 572 }, { "entropy": 0.8465031944215298, "epoch": 0.05271965083582038, "grad_norm": 0.15734876692295074, "learning_rate": 9.824577544698992e-05, "loss": 0.8582, "mean_token_accuracy": 0.7577155008912086, "num_tokens": 18289719.0, "step": 573 }, { "entropy": 0.9973167181015015, "epoch": 0.0528116572072616, "grad_norm": 0.16978318989276886, "learning_rate": 9.824270862084829e-05, "loss": 1.0121, "mean_token_accuracy": 0.7228571400046349, "num_tokens": 18321434.0, "step": 574 }, { "entropy": 0.87562489323318, "epoch": 0.052903663578702825, "grad_norm": 0.158506378531456, "learning_rate": 9.823964179470666e-05, "loss": 0.8895, "mean_token_accuracy": 0.7497245036065578, "num_tokens": 18353794.0, "step": 575 }, { "entropy": 0.9533016718924046, "epoch": 0.05299566995014405, "grad_norm": 0.16541872918605804, "learning_rate": 9.823657496856503e-05, "loss": 0.9454, "mean_token_accuracy": 0.7388780787587166, "num_tokens": 18385555.0, "step": 576 }, { "entropy": 0.9944054484367371, "epoch": 0.05308767632158527, "grad_norm": 0.16287018358707428, "learning_rate": 9.823350814242341e-05, "loss": 0.9957, "mean_token_accuracy": 0.7251812964677811, "num_tokens": 18418031.0, "step": 577 }, { "entropy": 0.9897592887282372, "epoch": 0.05317968269302649, "grad_norm": 0.1654137820005417, "learning_rate": 9.823044131628179e-05, "loss": 0.972, "mean_token_accuracy": 0.7269420549273491, "num_tokens": 18449867.0, "step": 578 }, { "entropy": 1.0996099598705769, "epoch": 0.05327168906446771, "grad_norm": 0.17410515248775482, "learning_rate": 9.822737449014016e-05, "loss": 1.112, "mean_token_accuracy": 0.7021746337413788, "num_tokens": 18481309.0, "step": 579 }, { "entropy": 0.9526960216462612, "epoch": 0.05336369543590894, "grad_norm": 0.1659986823797226, "learning_rate": 9.822430766399853e-05, "loss": 0.966, "mean_token_accuracy": 0.7339910306036472, "num_tokens": 18512907.0, "step": 580 }, { "entropy": 1.0467368625104427, "epoch": 0.05345570180735016, "grad_norm": 0.17283470928668976, "learning_rate": 9.822124083785691e-05, "loss": 1.0499, "mean_token_accuracy": 0.7104004435241222, "num_tokens": 18543923.0, "step": 581 }, { "entropy": 1.0006827861070633, "epoch": 0.053547708178791384, "grad_norm": 0.16461893916130066, "learning_rate": 9.821817401171528e-05, "loss": 1.0159, "mean_token_accuracy": 0.7240800522267818, "num_tokens": 18576062.0, "step": 582 }, { "entropy": 0.9019467569887638, "epoch": 0.0536397145502326, "grad_norm": 0.16039246320724487, "learning_rate": 9.821510718557366e-05, "loss": 0.9083, "mean_token_accuracy": 0.743061650544405, "num_tokens": 18607134.0, "step": 583 }, { "entropy": 0.9684820659458637, "epoch": 0.053731720921673824, "grad_norm": 0.16630397737026215, "learning_rate": 9.821204035943204e-05, "loss": 0.9933, "mean_token_accuracy": 0.7307913824915886, "num_tokens": 18639079.0, "step": 584 }, { "entropy": 0.962744913995266, "epoch": 0.05382372729311505, "grad_norm": 0.16911311447620392, "learning_rate": 9.82089735332904e-05, "loss": 0.9789, "mean_token_accuracy": 0.7290943525731564, "num_tokens": 18670621.0, "step": 585 }, { "entropy": 0.9364055283367634, "epoch": 0.05391573366455627, "grad_norm": 0.16078977286815643, "learning_rate": 9.820590670714877e-05, "loss": 0.9252, "mean_token_accuracy": 0.7425668202340603, "num_tokens": 18702112.0, "step": 586 }, { "entropy": 0.9418363124132156, "epoch": 0.054007740035997495, "grad_norm": 0.16166391968727112, "learning_rate": 9.820283988100714e-05, "loss": 0.9429, "mean_token_accuracy": 0.7364592291414738, "num_tokens": 18734141.0, "step": 587 }, { "entropy": 1.0757093168795109, "epoch": 0.05409974640743871, "grad_norm": 0.16913855075836182, "learning_rate": 9.819977305486552e-05, "loss": 1.0768, "mean_token_accuracy": 0.7042913101613522, "num_tokens": 18766542.0, "step": 588 }, { "entropy": 0.9823492988944054, "epoch": 0.054191752778879936, "grad_norm": 0.16311554610729218, "learning_rate": 9.81967062287239e-05, "loss": 0.975, "mean_token_accuracy": 0.731862660497427, "num_tokens": 18798699.0, "step": 589 }, { "entropy": 0.9856898225843906, "epoch": 0.05428375915032116, "grad_norm": 0.162748321890831, "learning_rate": 9.819363940258227e-05, "loss": 0.9882, "mean_token_accuracy": 0.7264587134122849, "num_tokens": 18831094.0, "step": 590 }, { "entropy": 0.9645604155957699, "epoch": 0.05437576552176238, "grad_norm": 0.16255250573158264, "learning_rate": 9.819057257644064e-05, "loss": 0.9594, "mean_token_accuracy": 0.7331061474978924, "num_tokens": 18863564.0, "step": 591 }, { "entropy": 0.9556578919291496, "epoch": 0.054467771893203606, "grad_norm": 0.16019552946090698, "learning_rate": 9.818750575029902e-05, "loss": 0.9554, "mean_token_accuracy": 0.7303911596536636, "num_tokens": 18895284.0, "step": 592 }, { "entropy": 1.029592514038086, "epoch": 0.05455977826464483, "grad_norm": 0.16847193241119385, "learning_rate": 9.818443892415739e-05, "loss": 1.0226, "mean_token_accuracy": 0.7190484926104546, "num_tokens": 18927640.0, "step": 593 }, { "entropy": 0.9549121893942356, "epoch": 0.05465178463608605, "grad_norm": 0.1589156687259674, "learning_rate": 9.818137209801577e-05, "loss": 0.9563, "mean_token_accuracy": 0.7374194748699665, "num_tokens": 18959648.0, "step": 594 }, { "entropy": 0.9448903910815716, "epoch": 0.05474379100752727, "grad_norm": 0.16188326478004456, "learning_rate": 9.817830527187414e-05, "loss": 0.9391, "mean_token_accuracy": 0.7418914958834648, "num_tokens": 18990902.0, "step": 595 }, { "entropy": 0.9302772954106331, "epoch": 0.054835797378968494, "grad_norm": 0.17251761257648468, "learning_rate": 9.817523844573252e-05, "loss": 0.9393, "mean_token_accuracy": 0.7366911098361015, "num_tokens": 19022741.0, "step": 596 }, { "entropy": 0.8710775151848793, "epoch": 0.05492780375040972, "grad_norm": 0.16116918623447418, "learning_rate": 9.817217161959089e-05, "loss": 0.8936, "mean_token_accuracy": 0.7474441565573215, "num_tokens": 19054346.0, "step": 597 }, { "entropy": 0.9943357296288013, "epoch": 0.05501981012185094, "grad_norm": 0.16670559346675873, "learning_rate": 9.816910479344926e-05, "loss": 1.0106, "mean_token_accuracy": 0.7208894491195679, "num_tokens": 19086890.0, "step": 598 }, { "entropy": 0.9530030973255634, "epoch": 0.05511181649329216, "grad_norm": 0.16489286720752716, "learning_rate": 9.816603796730764e-05, "loss": 0.9588, "mean_token_accuracy": 0.7296338677406311, "num_tokens": 19118142.0, "step": 599 }, { "entropy": 0.8646176792681217, "epoch": 0.05520382286473338, "grad_norm": 0.16042181849479675, "learning_rate": 9.816297114116602e-05, "loss": 0.8834, "mean_token_accuracy": 0.7538492642343044, "num_tokens": 19150555.0, "step": 600 }, { "entropy": 0.9691968113183975, "epoch": 0.055295829236174605, "grad_norm": 0.16191726922988892, "learning_rate": 9.815990431502439e-05, "loss": 0.9762, "mean_token_accuracy": 0.730664562433958, "num_tokens": 19182543.0, "step": 601 }, { "entropy": 0.9071401357650757, "epoch": 0.05538783560761583, "grad_norm": 0.1626460999250412, "learning_rate": 9.815683748888275e-05, "loss": 0.9264, "mean_token_accuracy": 0.7449319437146187, "num_tokens": 19215060.0, "step": 602 }, { "entropy": 0.968286719173193, "epoch": 0.05547984197905705, "grad_norm": 0.1695675104856491, "learning_rate": 9.815377066274112e-05, "loss": 0.9747, "mean_token_accuracy": 0.7253856211900711, "num_tokens": 19246779.0, "step": 603 }, { "entropy": 0.9944621175527573, "epoch": 0.05557184835049827, "grad_norm": 0.1652134507894516, "learning_rate": 9.815070383659952e-05, "loss": 0.9995, "mean_token_accuracy": 0.7228061333298683, "num_tokens": 19279225.0, "step": 604 }, { "entropy": 0.9213341325521469, "epoch": 0.05566385472193949, "grad_norm": 0.17412346601486206, "learning_rate": 9.814763701045789e-05, "loss": 0.932, "mean_token_accuracy": 0.7381015047430992, "num_tokens": 19310793.0, "step": 605 }, { "entropy": 0.9655103795230389, "epoch": 0.05575586109338072, "grad_norm": 0.169269859790802, "learning_rate": 9.814457018431625e-05, "loss": 0.9626, "mean_token_accuracy": 0.7287351712584496, "num_tokens": 19341538.0, "step": 606 }, { "entropy": 0.9082975052297115, "epoch": 0.05584786746482194, "grad_norm": 0.16562685370445251, "learning_rate": 9.814150335817462e-05, "loss": 0.8921, "mean_token_accuracy": 0.7557516805827618, "num_tokens": 19373131.0, "step": 607 }, { "entropy": 0.9801355004310608, "epoch": 0.055939873836263164, "grad_norm": 0.17090274393558502, "learning_rate": 9.8138436532033e-05, "loss": 0.9943, "mean_token_accuracy": 0.7248963490128517, "num_tokens": 19404428.0, "step": 608 }, { "entropy": 1.0464669652283192, "epoch": 0.05603188020770438, "grad_norm": 0.16184228658676147, "learning_rate": 9.813536970589138e-05, "loss": 1.0378, "mean_token_accuracy": 0.7186429165303707, "num_tokens": 19436419.0, "step": 609 }, { "entropy": 1.0447305738925934, "epoch": 0.056123886579145604, "grad_norm": 0.16772888600826263, "learning_rate": 9.813230287974975e-05, "loss": 1.051, "mean_token_accuracy": 0.7093856781721115, "num_tokens": 19468448.0, "step": 610 }, { "entropy": 0.9712334387004375, "epoch": 0.05621589295058683, "grad_norm": 0.16332221031188965, "learning_rate": 9.812923605360812e-05, "loss": 0.9666, "mean_token_accuracy": 0.7356022410094738, "num_tokens": 19500444.0, "step": 611 }, { "entropy": 0.9937260150909424, "epoch": 0.05630789932202805, "grad_norm": 0.17043672502040863, "learning_rate": 9.81261692274665e-05, "loss": 0.9982, "mean_token_accuracy": 0.7271057181060314, "num_tokens": 19532443.0, "step": 612 }, { "entropy": 1.074421912431717, "epoch": 0.056399905693469275, "grad_norm": 0.17714686691761017, "learning_rate": 9.812310240132487e-05, "loss": 1.0956, "mean_token_accuracy": 0.7010564096271992, "num_tokens": 19563968.0, "step": 613 }, { "entropy": 0.8630592413246632, "epoch": 0.05649191206491049, "grad_norm": 0.16226260364055634, "learning_rate": 9.812003557518325e-05, "loss": 0.8873, "mean_token_accuracy": 0.7529776021838188, "num_tokens": 19596197.0, "step": 614 }, { "entropy": 0.9494337886571884, "epoch": 0.056583918436351716, "grad_norm": 0.1683243066072464, "learning_rate": 9.811696874904163e-05, "loss": 0.9583, "mean_token_accuracy": 0.7314475849270821, "num_tokens": 19628453.0, "step": 615 }, { "entropy": 0.9498128183186054, "epoch": 0.05667592480779294, "grad_norm": 0.1673831194639206, "learning_rate": 9.81139019229e-05, "loss": 0.9615, "mean_token_accuracy": 0.7353732399642467, "num_tokens": 19661123.0, "step": 616 }, { "entropy": 0.9863654561340809, "epoch": 0.05676793117923416, "grad_norm": 0.16342179477214813, "learning_rate": 9.811083509675837e-05, "loss": 0.9677, "mean_token_accuracy": 0.7291566766798496, "num_tokens": 19693161.0, "step": 617 }, { "entropy": 1.048695120960474, "epoch": 0.056859937550675387, "grad_norm": 0.16500575840473175, "learning_rate": 9.810776827061674e-05, "loss": 1.0384, "mean_token_accuracy": 0.7136950083076954, "num_tokens": 19725846.0, "step": 618 }, { "entropy": 0.8852150216698647, "epoch": 0.0569519439221166, "grad_norm": 0.1556621938943863, "learning_rate": 9.810470144447512e-05, "loss": 0.8488, "mean_token_accuracy": 0.760561365634203, "num_tokens": 19757634.0, "step": 619 }, { "entropy": 1.0031042732298374, "epoch": 0.05704395029355783, "grad_norm": 0.17492416501045227, "learning_rate": 9.81016346183335e-05, "loss": 1.0059, "mean_token_accuracy": 0.7231873422861099, "num_tokens": 19789873.0, "step": 620 }, { "entropy": 0.9483481906354427, "epoch": 0.05713595666499905, "grad_norm": 0.1657971441745758, "learning_rate": 9.809856779219187e-05, "loss": 0.9279, "mean_token_accuracy": 0.7393903471529484, "num_tokens": 19821539.0, "step": 621 }, { "entropy": 0.9609033651649952, "epoch": 0.057227963036440274, "grad_norm": 0.16380846500396729, "learning_rate": 9.809550096605023e-05, "loss": 0.9426, "mean_token_accuracy": 0.7385537661612034, "num_tokens": 19852712.0, "step": 622 }, { "entropy": 0.9985687658190727, "epoch": 0.0573199694078815, "grad_norm": 0.1723949909210205, "learning_rate": 9.809243413990862e-05, "loss": 1.0237, "mean_token_accuracy": 0.7171773463487625, "num_tokens": 19884992.0, "step": 623 }, { "entropy": 0.9404069483280182, "epoch": 0.05741197577932272, "grad_norm": 0.16850896179676056, "learning_rate": 9.808936731376698e-05, "loss": 0.9524, "mean_token_accuracy": 0.7279058285057545, "num_tokens": 19917236.0, "step": 624 }, { "entropy": 0.9506558645516634, "epoch": 0.05750398215076394, "grad_norm": 0.16849637031555176, "learning_rate": 9.808630048762536e-05, "loss": 0.9653, "mean_token_accuracy": 0.7319151535630226, "num_tokens": 19949583.0, "step": 625 }, { "entropy": 0.9219024889171124, "epoch": 0.05759598852220516, "grad_norm": 0.16453535854816437, "learning_rate": 9.808323366148373e-05, "loss": 0.9215, "mean_token_accuracy": 0.7456205748021603, "num_tokens": 19981623.0, "step": 626 }, { "entropy": 1.013407040387392, "epoch": 0.057687994893646385, "grad_norm": 0.17392785847187042, "learning_rate": 9.808016683534211e-05, "loss": 1.0485, "mean_token_accuracy": 0.7131614647805691, "num_tokens": 20013224.0, "step": 627 }, { "entropy": 0.9801394529640675, "epoch": 0.05778000126508761, "grad_norm": 0.1665116846561432, "learning_rate": 9.807710000920048e-05, "loss": 0.9839, "mean_token_accuracy": 0.7241210155189037, "num_tokens": 20045761.0, "step": 628 }, { "entropy": 0.9025226980447769, "epoch": 0.05787200763652883, "grad_norm": 0.1585804522037506, "learning_rate": 9.807403318305885e-05, "loss": 0.9077, "mean_token_accuracy": 0.7458856888115406, "num_tokens": 20078143.0, "step": 629 }, { "entropy": 0.9686283729970455, "epoch": 0.05796401400797005, "grad_norm": 0.16333197057247162, "learning_rate": 9.807096635691723e-05, "loss": 0.9665, "mean_token_accuracy": 0.7290001772344112, "num_tokens": 20110479.0, "step": 630 }, { "entropy": 0.9154176339507103, "epoch": 0.05805602037941127, "grad_norm": 0.16539502143859863, "learning_rate": 9.806789953077561e-05, "loss": 0.9424, "mean_token_accuracy": 0.7402860037982464, "num_tokens": 20142214.0, "step": 631 }, { "entropy": 0.9714864902198315, "epoch": 0.0581480267508525, "grad_norm": 0.16718418896198273, "learning_rate": 9.806483270463398e-05, "loss": 0.9718, "mean_token_accuracy": 0.7289915159344673, "num_tokens": 20173331.0, "step": 632 }, { "entropy": 0.8834399022161961, "epoch": 0.05824003312229372, "grad_norm": 0.16289383172988892, "learning_rate": 9.806176587849235e-05, "loss": 0.8866, "mean_token_accuracy": 0.7500693127512932, "num_tokens": 20205091.0, "step": 633 }, { "entropy": 0.9796353541314602, "epoch": 0.058332039493734944, "grad_norm": 0.16527166962623596, "learning_rate": 9.805869905235072e-05, "loss": 1.0043, "mean_token_accuracy": 0.7237598747014999, "num_tokens": 20236994.0, "step": 634 }, { "entropy": 0.909358948469162, "epoch": 0.05842404586517616, "grad_norm": 0.15741148591041565, "learning_rate": 9.80556322262091e-05, "loss": 0.9055, "mean_token_accuracy": 0.7489256225526333, "num_tokens": 20269097.0, "step": 635 }, { "entropy": 1.0318338200449944, "epoch": 0.058516052236617384, "grad_norm": 0.16267406940460205, "learning_rate": 9.805256540006748e-05, "loss": 1.0238, "mean_token_accuracy": 0.7141961343586445, "num_tokens": 20301196.0, "step": 636 }, { "entropy": 1.040244996547699, "epoch": 0.05860805860805861, "grad_norm": 0.17041735351085663, "learning_rate": 9.804949857392585e-05, "loss": 1.0522, "mean_token_accuracy": 0.7122577428817749, "num_tokens": 20333326.0, "step": 637 }, { "entropy": 0.8750684708356857, "epoch": 0.05870006497949983, "grad_norm": 0.1510256975889206, "learning_rate": 9.804643174778421e-05, "loss": 0.8608, "mean_token_accuracy": 0.7590311542153358, "num_tokens": 20365251.0, "step": 638 }, { "entropy": 0.9018204025924206, "epoch": 0.058792071350941055, "grad_norm": 0.16271653771400452, "learning_rate": 9.80433649216426e-05, "loss": 0.9062, "mean_token_accuracy": 0.7503054365515709, "num_tokens": 20396798.0, "step": 639 }, { "entropy": 1.0158135928213596, "epoch": 0.05888407772238227, "grad_norm": 0.1715613305568695, "learning_rate": 9.804029809550096e-05, "loss": 1.0386, "mean_token_accuracy": 0.7216349169611931, "num_tokens": 20428488.0, "step": 640 }, { "entropy": 1.0293894298374653, "epoch": 0.058976084093823496, "grad_norm": 0.16205903887748718, "learning_rate": 9.803723126935935e-05, "loss": 1.0273, "mean_token_accuracy": 0.7176331728696823, "num_tokens": 20460364.0, "step": 641 }, { "entropy": 0.9762745574116707, "epoch": 0.05906809046526472, "grad_norm": 0.16408756375312805, "learning_rate": 9.803416444321773e-05, "loss": 0.9721, "mean_token_accuracy": 0.7313985861837864, "num_tokens": 20493105.0, "step": 642 }, { "entropy": 1.039294358342886, "epoch": 0.05916009683670594, "grad_norm": 0.1625339537858963, "learning_rate": 9.80310976170761e-05, "loss": 1.0087, "mean_token_accuracy": 0.7228131368756294, "num_tokens": 20524742.0, "step": 643 }, { "entropy": 0.9685094505548477, "epoch": 0.05925210320814717, "grad_norm": 0.1643614023923874, "learning_rate": 9.802803079093446e-05, "loss": 0.9516, "mean_token_accuracy": 0.7309996075928211, "num_tokens": 20556870.0, "step": 644 }, { "entropy": 0.9781741611659527, "epoch": 0.05934410957958838, "grad_norm": 0.17166036367416382, "learning_rate": 9.802496396479284e-05, "loss": 0.9816, "mean_token_accuracy": 0.7277286499738693, "num_tokens": 20587590.0, "step": 645 }, { "entropy": 0.9321715421974659, "epoch": 0.05943611595102961, "grad_norm": 0.15926851332187653, "learning_rate": 9.802189713865123e-05, "loss": 0.9296, "mean_token_accuracy": 0.739145640283823, "num_tokens": 20619987.0, "step": 646 }, { "entropy": 0.8368671890348196, "epoch": 0.05952812232247083, "grad_norm": 0.15730631351470947, "learning_rate": 9.80188303125096e-05, "loss": 0.8331, "mean_token_accuracy": 0.761964064091444, "num_tokens": 20651859.0, "step": 647 }, { "entropy": 0.8395576402544975, "epoch": 0.059620128693912054, "grad_norm": 0.15268109738826752, "learning_rate": 9.801576348636796e-05, "loss": 0.8089, "mean_token_accuracy": 0.768634881824255, "num_tokens": 20683616.0, "step": 648 }, { "entropy": 1.0215886235237122, "epoch": 0.05971213506535328, "grad_norm": 0.17276978492736816, "learning_rate": 9.801269666022633e-05, "loss": 1.0533, "mean_token_accuracy": 0.7140671759843826, "num_tokens": 20714915.0, "step": 649 }, { "entropy": 0.8608022443950176, "epoch": 0.059804141436794495, "grad_norm": 0.16115765273571014, "learning_rate": 9.800962983408471e-05, "loss": 0.9137, "mean_token_accuracy": 0.7497973553836346, "num_tokens": 20746818.0, "step": 650 }, { "entropy": 0.9612746220082045, "epoch": 0.05989614780823572, "grad_norm": 0.16959808766841888, "learning_rate": 9.800656300794309e-05, "loss": 0.9726, "mean_token_accuracy": 0.7311719208955765, "num_tokens": 20778602.0, "step": 651 }, { "entropy": 0.9875885434448719, "epoch": 0.05998815417967694, "grad_norm": 0.16284504532814026, "learning_rate": 9.800349618180146e-05, "loss": 0.9966, "mean_token_accuracy": 0.7249477878212929, "num_tokens": 20810961.0, "step": 652 }, { "entropy": 0.9503909014165401, "epoch": 0.060080160551118166, "grad_norm": 0.16453111171722412, "learning_rate": 9.800042935565983e-05, "loss": 0.957, "mean_token_accuracy": 0.7324551977217197, "num_tokens": 20843389.0, "step": 653 }, { "entropy": 1.0258820429444313, "epoch": 0.06017216692255939, "grad_norm": 0.1692570596933365, "learning_rate": 9.799736252951821e-05, "loss": 1.0428, "mean_token_accuracy": 0.7197996079921722, "num_tokens": 20875637.0, "step": 654 }, { "entropy": 0.9980999454855919, "epoch": 0.06026417329400061, "grad_norm": 0.16594214737415314, "learning_rate": 9.799429570337658e-05, "loss": 1.0001, "mean_token_accuracy": 0.7217110693454742, "num_tokens": 20907585.0, "step": 655 }, { "entropy": 1.05484539270401, "epoch": 0.06035617966544183, "grad_norm": 0.17190194129943848, "learning_rate": 9.799122887723496e-05, "loss": 1.0513, "mean_token_accuracy": 0.7128286510705948, "num_tokens": 20938690.0, "step": 656 }, { "entropy": 0.9426363259553909, "epoch": 0.06044818603688305, "grad_norm": 0.168714702129364, "learning_rate": 9.798816205109333e-05, "loss": 0.9587, "mean_token_accuracy": 0.7298561073839664, "num_tokens": 20970885.0, "step": 657 }, { "entropy": 0.8432633951306343, "epoch": 0.06054019240832428, "grad_norm": 0.15879929065704346, "learning_rate": 9.798509522495171e-05, "loss": 0.8637, "mean_token_accuracy": 0.758915726095438, "num_tokens": 21002897.0, "step": 658 }, { "entropy": 0.9566614702343941, "epoch": 0.0606321987797655, "grad_norm": 0.16445676982402802, "learning_rate": 9.798202839881008e-05, "loss": 0.9573, "mean_token_accuracy": 0.7340426258742809, "num_tokens": 21034574.0, "step": 659 }, { "entropy": 1.0204659141600132, "epoch": 0.060724205151206724, "grad_norm": 0.16645212471485138, "learning_rate": 9.797896157266844e-05, "loss": 1.0242, "mean_token_accuracy": 0.7199134491384029, "num_tokens": 21066688.0, "step": 660 }, { "entropy": 1.0958493538200855, "epoch": 0.06081621152264794, "grad_norm": 0.17646637558937073, "learning_rate": 9.797589474652682e-05, "loss": 1.1094, "mean_token_accuracy": 0.6997278966009617, "num_tokens": 21099014.0, "step": 661 }, { "entropy": 1.0627868585288525, "epoch": 0.060908217894089164, "grad_norm": 0.16993241012096405, "learning_rate": 9.79728279203852e-05, "loss": 1.0459, "mean_token_accuracy": 0.7173599191009998, "num_tokens": 21131271.0, "step": 662 }, { "entropy": 1.0007079876959324, "epoch": 0.06100022426553039, "grad_norm": 0.1617305874824524, "learning_rate": 9.796976109424357e-05, "loss": 0.9693, "mean_token_accuracy": 0.7304843105375767, "num_tokens": 21163033.0, "step": 663 }, { "entropy": 0.9579825848340988, "epoch": 0.06109223063697161, "grad_norm": 0.16417573392391205, "learning_rate": 9.796669426810194e-05, "loss": 0.9545, "mean_token_accuracy": 0.735863633453846, "num_tokens": 21194433.0, "step": 664 }, { "entropy": 0.9619919620454311, "epoch": 0.061184237008412835, "grad_norm": 0.163755863904953, "learning_rate": 9.796362744196031e-05, "loss": 0.9563, "mean_token_accuracy": 0.7320655733346939, "num_tokens": 21225835.0, "step": 665 }, { "entropy": 0.929864663630724, "epoch": 0.06127624337985405, "grad_norm": 0.16609299182891846, "learning_rate": 9.796056061581869e-05, "loss": 0.9473, "mean_token_accuracy": 0.7374901138246059, "num_tokens": 21257647.0, "step": 666 }, { "entropy": 0.8059710673987865, "epoch": 0.061368249751295276, "grad_norm": 0.15594281256198883, "learning_rate": 9.795749378967707e-05, "loss": 0.8209, "mean_token_accuracy": 0.7718138620257378, "num_tokens": 21290287.0, "step": 667 }, { "entropy": 0.9865346737205982, "epoch": 0.0614602561227365, "grad_norm": 0.16683848202228546, "learning_rate": 9.795442696353544e-05, "loss": 0.9886, "mean_token_accuracy": 0.7253305949270725, "num_tokens": 21322298.0, "step": 668 }, { "entropy": 0.9109359867870808, "epoch": 0.06155226249417772, "grad_norm": 0.16543343663215637, "learning_rate": 9.795136013739381e-05, "loss": 0.9057, "mean_token_accuracy": 0.7455473244190216, "num_tokens": 21354325.0, "step": 669 }, { "entropy": 0.9279623962938786, "epoch": 0.06164426886561895, "grad_norm": 0.1550312638282776, "learning_rate": 9.794829331125219e-05, "loss": 0.9208, "mean_token_accuracy": 0.7456959709525108, "num_tokens": 21386876.0, "step": 670 }, { "entropy": 0.9169107973575592, "epoch": 0.06173627523706016, "grad_norm": 0.15861962735652924, "learning_rate": 9.794522648511056e-05, "loss": 0.9222, "mean_token_accuracy": 0.7412844784557819, "num_tokens": 21419111.0, "step": 671 }, { "entropy": 0.9637071453034878, "epoch": 0.06182828160850139, "grad_norm": 0.16707174479961395, "learning_rate": 9.794215965896894e-05, "loss": 0.9628, "mean_token_accuracy": 0.7339217066764832, "num_tokens": 21451138.0, "step": 672 }, { "entropy": 1.060596663504839, "epoch": 0.06192028797994261, "grad_norm": 0.1684867888689041, "learning_rate": 9.793909283282732e-05, "loss": 1.0696, "mean_token_accuracy": 0.7061467282474041, "num_tokens": 21482995.0, "step": 673 }, { "entropy": 0.9379373602569103, "epoch": 0.062012294351383834, "grad_norm": 0.16227133572101593, "learning_rate": 9.793602600668569e-05, "loss": 0.9503, "mean_token_accuracy": 0.7331300526857376, "num_tokens": 21514573.0, "step": 674 }, { "entropy": 0.9449528157711029, "epoch": 0.06210430072282506, "grad_norm": 0.16113756597042084, "learning_rate": 9.793295918054406e-05, "loss": 0.9573, "mean_token_accuracy": 0.7376067005097866, "num_tokens": 21547028.0, "step": 675 }, { "entropy": 0.8376788571476936, "epoch": 0.062196307094266275, "grad_norm": 0.1625738888978958, "learning_rate": 9.792989235440242e-05, "loss": 0.8365, "mean_token_accuracy": 0.7637463100254536, "num_tokens": 21578925.0, "step": 676 }, { "entropy": 0.9880265146493912, "epoch": 0.0622883134657075, "grad_norm": 0.16655480861663818, "learning_rate": 9.792682552826082e-05, "loss": 0.9893, "mean_token_accuracy": 0.7207247093319893, "num_tokens": 21610214.0, "step": 677 }, { "entropy": 0.9505514353513718, "epoch": 0.06238031983714872, "grad_norm": 0.1738533228635788, "learning_rate": 9.792375870211919e-05, "loss": 0.9372, "mean_token_accuracy": 0.7403922118246555, "num_tokens": 21641181.0, "step": 678 }, { "entropy": 1.0301849208772182, "epoch": 0.062472326208589946, "grad_norm": 0.1642848551273346, "learning_rate": 9.792069187597756e-05, "loss": 1.037, "mean_token_accuracy": 0.7126371003687382, "num_tokens": 21673222.0, "step": 679 }, { "entropy": 1.006374005228281, "epoch": 0.06256433258003116, "grad_norm": 0.16483119130134583, "learning_rate": 9.791762504983592e-05, "loss": 1.0097, "mean_token_accuracy": 0.7190174385905266, "num_tokens": 21705297.0, "step": 680 }, { "entropy": 0.9991269782185555, "epoch": 0.06265633895147239, "grad_norm": 0.16770169138908386, "learning_rate": 9.79145582236943e-05, "loss": 1.0231, "mean_token_accuracy": 0.7178670018911362, "num_tokens": 21737521.0, "step": 681 }, { "entropy": 0.9773536287248135, "epoch": 0.06274834532291361, "grad_norm": 0.16942104697227478, "learning_rate": 9.791149139755269e-05, "loss": 0.9747, "mean_token_accuracy": 0.7256374433636665, "num_tokens": 21769768.0, "step": 682 }, { "entropy": 1.002865333110094, "epoch": 0.06284035169435484, "grad_norm": 0.1735992431640625, "learning_rate": 9.790842457141105e-05, "loss": 1.0143, "mean_token_accuracy": 0.7216566205024719, "num_tokens": 21801639.0, "step": 683 }, { "entropy": 0.9517209865152836, "epoch": 0.06293235806579606, "grad_norm": 0.15748152136802673, "learning_rate": 9.790535774526942e-05, "loss": 0.9502, "mean_token_accuracy": 0.7377259433269501, "num_tokens": 21834407.0, "step": 684 }, { "entropy": 0.9664385803043842, "epoch": 0.06302436443723727, "grad_norm": 0.1655987650156021, "learning_rate": 9.79022909191278e-05, "loss": 0.9764, "mean_token_accuracy": 0.7306914515793324, "num_tokens": 21866476.0, "step": 685 }, { "entropy": 0.9957532845437527, "epoch": 0.0631163708086785, "grad_norm": 0.16823437809944153, "learning_rate": 9.789922409298617e-05, "loss": 0.9942, "mean_token_accuracy": 0.725135650485754, "num_tokens": 21897458.0, "step": 686 }, { "entropy": 0.972180750221014, "epoch": 0.06320837718011972, "grad_norm": 0.16990965604782104, "learning_rate": 9.789615726684455e-05, "loss": 1.0008, "mean_token_accuracy": 0.7290299013257027, "num_tokens": 21928749.0, "step": 687 }, { "entropy": 1.0729428641498089, "epoch": 0.06330038355156095, "grad_norm": 0.16951923072338104, "learning_rate": 9.789309044070292e-05, "loss": 1.0653, "mean_token_accuracy": 0.7079884931445122, "num_tokens": 21960656.0, "step": 688 }, { "entropy": 0.9752461276948452, "epoch": 0.06339238992300217, "grad_norm": 0.16529016196727753, "learning_rate": 9.78900236145613e-05, "loss": 0.9413, "mean_token_accuracy": 0.735041294246912, "num_tokens": 21992222.0, "step": 689 }, { "entropy": 0.9720484800636768, "epoch": 0.06348439629444338, "grad_norm": 0.1628667712211609, "learning_rate": 9.788695678841967e-05, "loss": 0.9595, "mean_token_accuracy": 0.7347554862499237, "num_tokens": 22024570.0, "step": 690 }, { "entropy": 0.9574784226715565, "epoch": 0.06357640266588462, "grad_norm": 0.16064247488975525, "learning_rate": 9.788388996227804e-05, "loss": 0.9627, "mean_token_accuracy": 0.7343390956521034, "num_tokens": 22057154.0, "step": 691 }, { "entropy": 0.9737029746174812, "epoch": 0.06366840903732583, "grad_norm": 0.16917623579502106, "learning_rate": 9.788082313613642e-05, "loss": 0.982, "mean_token_accuracy": 0.7244335189461708, "num_tokens": 22088396.0, "step": 692 }, { "entropy": 0.8450344726443291, "epoch": 0.06376041540876706, "grad_norm": 0.1518240123987198, "learning_rate": 9.78777563099948e-05, "loss": 0.8658, "mean_token_accuracy": 0.7551683560013771, "num_tokens": 22120920.0, "step": 693 }, { "entropy": 1.0285722315311432, "epoch": 0.06385242178020828, "grad_norm": 0.17033198475837708, "learning_rate": 9.787468948385317e-05, "loss": 1.0254, "mean_token_accuracy": 0.7211484871804714, "num_tokens": 22152721.0, "step": 694 }, { "entropy": 1.0109255872666836, "epoch": 0.0639444281516495, "grad_norm": 0.16604195535182953, "learning_rate": 9.787162265771154e-05, "loss": 1.0217, "mean_token_accuracy": 0.7168786190450191, "num_tokens": 22185159.0, "step": 695 }, { "entropy": 0.9595106393098831, "epoch": 0.06403643452309073, "grad_norm": 0.16640381515026093, "learning_rate": 9.78685558315699e-05, "loss": 0.9702, "mean_token_accuracy": 0.7288764454424381, "num_tokens": 22217298.0, "step": 696 }, { "entropy": 1.016012068837881, "epoch": 0.06412844089453194, "grad_norm": 0.16934356093406677, "learning_rate": 9.786548900542829e-05, "loss": 1.0243, "mean_token_accuracy": 0.712494395673275, "num_tokens": 22249149.0, "step": 697 }, { "entropy": 0.9197441339492798, "epoch": 0.06422044726597317, "grad_norm": 0.1601523607969284, "learning_rate": 9.786242217928667e-05, "loss": 0.9343, "mean_token_accuracy": 0.740419827401638, "num_tokens": 22281293.0, "step": 698 }, { "entropy": 0.9875156804919243, "epoch": 0.06431245363741439, "grad_norm": 0.17086534202098846, "learning_rate": 9.785935535314503e-05, "loss": 0.9692, "mean_token_accuracy": 0.7260996103286743, "num_tokens": 22312358.0, "step": 699 }, { "entropy": 0.9348448477685452, "epoch": 0.06440446000885561, "grad_norm": 0.16300342977046967, "learning_rate": 9.78562885270034e-05, "loss": 0.9197, "mean_token_accuracy": 0.7400068640708923, "num_tokens": 22344790.0, "step": 700 }, { "entropy": 0.9701763093471527, "epoch": 0.06449646638029684, "grad_norm": 0.16712148487567902, "learning_rate": 9.785322170086178e-05, "loss": 0.9917, "mean_token_accuracy": 0.7253463603556156, "num_tokens": 22376996.0, "step": 701 }, { "entropy": 0.8692387416958809, "epoch": 0.06458847275173805, "grad_norm": 0.1571662575006485, "learning_rate": 9.785015487472015e-05, "loss": 0.8697, "mean_token_accuracy": 0.7569755800068378, "num_tokens": 22409346.0, "step": 702 }, { "entropy": 0.9658809565007687, "epoch": 0.06468047912317929, "grad_norm": 0.16465206444263458, "learning_rate": 9.784708804857853e-05, "loss": 0.9717, "mean_token_accuracy": 0.7279982939362526, "num_tokens": 22441219.0, "step": 703 }, { "entropy": 0.9933779127895832, "epoch": 0.0647724854946205, "grad_norm": 0.16633573174476624, "learning_rate": 9.784402122243691e-05, "loss": 1.0104, "mean_token_accuracy": 0.7267393246293068, "num_tokens": 22473434.0, "step": 704 }, { "entropy": 0.9351341016590595, "epoch": 0.06486449186606172, "grad_norm": 0.16399052739143372, "learning_rate": 9.784095439629528e-05, "loss": 0.932, "mean_token_accuracy": 0.7443361170589924, "num_tokens": 22504731.0, "step": 705 }, { "entropy": 1.0217381305992603, "epoch": 0.06495649823750295, "grad_norm": 0.1639397293329239, "learning_rate": 9.783788757015365e-05, "loss": 1.0123, "mean_token_accuracy": 0.7212101444602013, "num_tokens": 22536556.0, "step": 706 }, { "entropy": 1.0639294534921646, "epoch": 0.06504850460894417, "grad_norm": 0.17265541851520538, "learning_rate": 9.783482074401202e-05, "loss": 1.0568, "mean_token_accuracy": 0.7043555565178394, "num_tokens": 22568306.0, "step": 707 }, { "entropy": 0.8266307599842548, "epoch": 0.0651405109803854, "grad_norm": 0.15222366154193878, "learning_rate": 9.78317539178704e-05, "loss": 0.8199, "mean_token_accuracy": 0.7694737762212753, "num_tokens": 22600890.0, "step": 708 }, { "entropy": 0.8785643726587296, "epoch": 0.06523251735182661, "grad_norm": 0.1603255420923233, "learning_rate": 9.782868709172878e-05, "loss": 0.8674, "mean_token_accuracy": 0.7533312663435936, "num_tokens": 22632668.0, "step": 709 }, { "entropy": 0.9772775769233704, "epoch": 0.06532452372326783, "grad_norm": 0.16208812594413757, "learning_rate": 9.782562026558715e-05, "loss": 0.9682, "mean_token_accuracy": 0.7358207292854786, "num_tokens": 22663928.0, "step": 710 }, { "entropy": 0.9169563576579094, "epoch": 0.06541653009470906, "grad_norm": 0.16006122529506683, "learning_rate": 9.782255343944552e-05, "loss": 0.9112, "mean_token_accuracy": 0.7430835999548435, "num_tokens": 22696082.0, "step": 711 }, { "entropy": 0.9908410981297493, "epoch": 0.06550853646615028, "grad_norm": 0.1732882261276245, "learning_rate": 9.78194866133039e-05, "loss": 1.0063, "mean_token_accuracy": 0.7236398309469223, "num_tokens": 22727854.0, "step": 712 }, { "entropy": 1.027011003345251, "epoch": 0.06560054283759151, "grad_norm": 0.16827496886253357, "learning_rate": 9.781641978716227e-05, "loss": 1.0199, "mean_token_accuracy": 0.7127940803766251, "num_tokens": 22759919.0, "step": 713 }, { "entropy": 0.9439230598509312, "epoch": 0.06569254920903272, "grad_norm": 0.1674676239490509, "learning_rate": 9.781335296102065e-05, "loss": 0.9612, "mean_token_accuracy": 0.7319885641336441, "num_tokens": 22791554.0, "step": 714 }, { "entropy": 0.952055312693119, "epoch": 0.06578455558047394, "grad_norm": 0.1640789806842804, "learning_rate": 9.781028613487902e-05, "loss": 0.9714, "mean_token_accuracy": 0.7325408682227135, "num_tokens": 22823959.0, "step": 715 }, { "entropy": 0.9567240849137306, "epoch": 0.06587656195191517, "grad_norm": 0.16402341425418854, "learning_rate": 9.78072193087374e-05, "loss": 0.9638, "mean_token_accuracy": 0.732719574123621, "num_tokens": 22855853.0, "step": 716 }, { "entropy": 0.9778101556003094, "epoch": 0.06596856832335639, "grad_norm": 0.16831116378307343, "learning_rate": 9.780415248259576e-05, "loss": 0.9808, "mean_token_accuracy": 0.7261964827775955, "num_tokens": 22886943.0, "step": 717 }, { "entropy": 1.0320146083831787, "epoch": 0.06606057469479762, "grad_norm": 0.16433413326740265, "learning_rate": 9.780108565645413e-05, "loss": 1.0498, "mean_token_accuracy": 0.7127593494951725, "num_tokens": 22918589.0, "step": 718 }, { "entropy": 1.0451893992722034, "epoch": 0.06615258106623884, "grad_norm": 0.16586624085903168, "learning_rate": 9.779801883031251e-05, "loss": 1.0403, "mean_token_accuracy": 0.7101616859436035, "num_tokens": 22950549.0, "step": 719 }, { "entropy": 1.0089669600129128, "epoch": 0.06624458743768005, "grad_norm": 0.16412770748138428, "learning_rate": 9.77949520041709e-05, "loss": 1.0175, "mean_token_accuracy": 0.7171782068908215, "num_tokens": 22982525.0, "step": 720 }, { "entropy": 0.9115235470235348, "epoch": 0.06633659380912128, "grad_norm": 0.1757228672504425, "learning_rate": 9.779188517802926e-05, "loss": 0.9025, "mean_token_accuracy": 0.7461497895419598, "num_tokens": 23015078.0, "step": 721 }, { "entropy": 0.956471286714077, "epoch": 0.0664286001805625, "grad_norm": 0.15770560503005981, "learning_rate": 9.778881835188763e-05, "loss": 0.9436, "mean_token_accuracy": 0.7347383312880993, "num_tokens": 23046758.0, "step": 722 }, { "entropy": 0.8515592478215694, "epoch": 0.06652060655200373, "grad_norm": 0.15324951708316803, "learning_rate": 9.7785751525746e-05, "loss": 0.8435, "mean_token_accuracy": 0.7604524195194244, "num_tokens": 23078838.0, "step": 723 }, { "entropy": 1.0155523493885994, "epoch": 0.06661261292344495, "grad_norm": 0.16911432147026062, "learning_rate": 9.77826846996044e-05, "loss": 1.0325, "mean_token_accuracy": 0.7149862349033356, "num_tokens": 23110895.0, "step": 724 }, { "entropy": 1.0014025121927261, "epoch": 0.06670461929488618, "grad_norm": 0.16532562673091888, "learning_rate": 9.777961787346276e-05, "loss": 1.0086, "mean_token_accuracy": 0.7236623056232929, "num_tokens": 23142033.0, "step": 725 }, { "entropy": 0.9258328080177307, "epoch": 0.0667966256663274, "grad_norm": 0.1567230522632599, "learning_rate": 9.777655104732113e-05, "loss": 0.9368, "mean_token_accuracy": 0.739589300006628, "num_tokens": 23174203.0, "step": 726 }, { "entropy": 1.056148249655962, "epoch": 0.06688863203776861, "grad_norm": 0.17096057534217834, "learning_rate": 9.77734842211795e-05, "loss": 1.0844, "mean_token_accuracy": 0.7052101269364357, "num_tokens": 23206749.0, "step": 727 }, { "entropy": 0.9294457361102104, "epoch": 0.06698063840920984, "grad_norm": 0.15669047832489014, "learning_rate": 9.777041739503788e-05, "loss": 0.9125, "mean_token_accuracy": 0.7409942634403706, "num_tokens": 23238825.0, "step": 728 }, { "entropy": 0.9112744592130184, "epoch": 0.06707264478065106, "grad_norm": 0.16031840443611145, "learning_rate": 9.776735056889626e-05, "loss": 0.9211, "mean_token_accuracy": 0.7456766106188297, "num_tokens": 23270934.0, "step": 729 }, { "entropy": 0.8610086254775524, "epoch": 0.06716465115209229, "grad_norm": 0.16114585101604462, "learning_rate": 9.776428374275463e-05, "loss": 0.8759, "mean_token_accuracy": 0.7515043914318085, "num_tokens": 23303164.0, "step": 730 }, { "entropy": 0.9923807885497808, "epoch": 0.0672566575235335, "grad_norm": 0.17049486935138702, "learning_rate": 9.7761216916613e-05, "loss": 1.0091, "mean_token_accuracy": 0.7261724770069122, "num_tokens": 23335126.0, "step": 731 }, { "entropy": 1.0289140231907368, "epoch": 0.06734866389497472, "grad_norm": 0.17657940089702606, "learning_rate": 9.775815009047138e-05, "loss": 1.0175, "mean_token_accuracy": 0.7188629806041718, "num_tokens": 23365955.0, "step": 732 }, { "entropy": 0.9260178916156292, "epoch": 0.06744067026641595, "grad_norm": 0.16398519277572632, "learning_rate": 9.775508326432975e-05, "loss": 0.9394, "mean_token_accuracy": 0.740141972899437, "num_tokens": 23397892.0, "step": 733 }, { "entropy": 0.9722410663962364, "epoch": 0.06753267663785717, "grad_norm": 0.1668296903371811, "learning_rate": 9.775201643818813e-05, "loss": 0.9908, "mean_token_accuracy": 0.731209821999073, "num_tokens": 23429804.0, "step": 734 }, { "entropy": 0.9129518233239651, "epoch": 0.0676246830092984, "grad_norm": 0.16129791736602783, "learning_rate": 9.774894961204651e-05, "loss": 0.9065, "mean_token_accuracy": 0.7429094351828098, "num_tokens": 23461042.0, "step": 735 }, { "entropy": 1.0367199257016182, "epoch": 0.06771668938073962, "grad_norm": 0.15939047932624817, "learning_rate": 9.774588278590488e-05, "loss": 1.0261, "mean_token_accuracy": 0.7220759354531765, "num_tokens": 23492865.0, "step": 736 }, { "entropy": 0.9758146665990353, "epoch": 0.06780869575218083, "grad_norm": 0.16275274753570557, "learning_rate": 9.774281595976324e-05, "loss": 0.9657, "mean_token_accuracy": 0.730737242847681, "num_tokens": 23524670.0, "step": 737 }, { "entropy": 0.9374345373362303, "epoch": 0.06790070212362206, "grad_norm": 0.16051124036312103, "learning_rate": 9.773974913362161e-05, "loss": 0.9341, "mean_token_accuracy": 0.7444140948355198, "num_tokens": 23557259.0, "step": 738 }, { "entropy": 1.0072547420859337, "epoch": 0.06799270849506328, "grad_norm": 0.16542603075504303, "learning_rate": 9.773668230748e-05, "loss": 1.0278, "mean_token_accuracy": 0.7148850113153458, "num_tokens": 23587987.0, "step": 739 }, { "entropy": 1.0053394995629787, "epoch": 0.06808471486650451, "grad_norm": 0.17000436782836914, "learning_rate": 9.773361548133837e-05, "loss": 1.0117, "mean_token_accuracy": 0.7174012921750546, "num_tokens": 23619095.0, "step": 740 }, { "entropy": 0.9260540809482336, "epoch": 0.06817672123794573, "grad_norm": 0.15828430652618408, "learning_rate": 9.773054865519674e-05, "loss": 0.9349, "mean_token_accuracy": 0.7401717789471149, "num_tokens": 23650640.0, "step": 741 }, { "entropy": 0.9547841921448708, "epoch": 0.06826872760938694, "grad_norm": 0.1632172018289566, "learning_rate": 9.772748182905511e-05, "loss": 0.9439, "mean_token_accuracy": 0.7397718019783497, "num_tokens": 23683159.0, "step": 742 }, { "entropy": 0.9822579361498356, "epoch": 0.06836073398082818, "grad_norm": 0.1617399901151657, "learning_rate": 9.772441500291349e-05, "loss": 0.9715, "mean_token_accuracy": 0.7286654934287071, "num_tokens": 23715371.0, "step": 743 }, { "entropy": 0.9397387616336346, "epoch": 0.06845274035226939, "grad_norm": 0.16105400025844574, "learning_rate": 9.772134817677186e-05, "loss": 0.9313, "mean_token_accuracy": 0.7390888780355453, "num_tokens": 23746734.0, "step": 744 }, { "entropy": 1.0103630274534225, "epoch": 0.06854474672371062, "grad_norm": 0.16748052835464478, "learning_rate": 9.771828135063024e-05, "loss": 1.0123, "mean_token_accuracy": 0.720540527254343, "num_tokens": 23778568.0, "step": 745 }, { "entropy": 0.8300569839775562, "epoch": 0.06863675309515184, "grad_norm": 0.1525866687297821, "learning_rate": 9.771521452448861e-05, "loss": 0.8154, "mean_token_accuracy": 0.7673349007964134, "num_tokens": 23810087.0, "step": 746 }, { "entropy": 0.9432720765471458, "epoch": 0.06872875946659306, "grad_norm": 0.15817712247371674, "learning_rate": 9.771214769834699e-05, "loss": 0.9445, "mean_token_accuracy": 0.7349588461220264, "num_tokens": 23842181.0, "step": 747 }, { "entropy": 0.9867074005305767, "epoch": 0.06882076583803429, "grad_norm": 0.17190751433372498, "learning_rate": 9.770908087220536e-05, "loss": 1.0277, "mean_token_accuracy": 0.7208070978522301, "num_tokens": 23873738.0, "step": 748 }, { "entropy": 0.9327075630426407, "epoch": 0.0689127722094755, "grad_norm": 0.17223809659481049, "learning_rate": 9.770601404606373e-05, "loss": 0.9525, "mean_token_accuracy": 0.7346966341137886, "num_tokens": 23905432.0, "step": 749 }, { "entropy": 0.9508248716592789, "epoch": 0.06900477858091673, "grad_norm": 0.18050900101661682, "learning_rate": 9.770294721992211e-05, "loss": 0.9502, "mean_token_accuracy": 0.7313392050564289, "num_tokens": 23936465.0, "step": 750 }, { "entropy": 1.0264729671180248, "epoch": 0.06909678495235795, "grad_norm": 0.1730281561613083, "learning_rate": 9.769988039378049e-05, "loss": 1.0622, "mean_token_accuracy": 0.7115480825304985, "num_tokens": 23968162.0, "step": 751 }, { "entropy": 0.9294424448162317, "epoch": 0.06918879132379917, "grad_norm": 0.159836545586586, "learning_rate": 9.769681356763886e-05, "loss": 0.9337, "mean_token_accuracy": 0.7404293045401573, "num_tokens": 24000250.0, "step": 752 }, { "entropy": 0.9844078049063683, "epoch": 0.0692807976952404, "grad_norm": 0.1691402941942215, "learning_rate": 9.769374674149722e-05, "loss": 0.9953, "mean_token_accuracy": 0.7197633534669876, "num_tokens": 24031949.0, "step": 753 }, { "entropy": 0.9914673715829849, "epoch": 0.06937280406668161, "grad_norm": 0.1598096340894699, "learning_rate": 9.769067991535559e-05, "loss": 0.9812, "mean_token_accuracy": 0.7298092544078827, "num_tokens": 24063321.0, "step": 754 }, { "entropy": 0.9517121911048889, "epoch": 0.06946481043812285, "grad_norm": 0.16180214285850525, "learning_rate": 9.768761308921397e-05, "loss": 0.9351, "mean_token_accuracy": 0.735908892005682, "num_tokens": 24095220.0, "step": 755 }, { "entropy": 1.0087159909307957, "epoch": 0.06955681680956406, "grad_norm": 0.1683640480041504, "learning_rate": 9.768454626307236e-05, "loss": 1.0, "mean_token_accuracy": 0.7229274809360504, "num_tokens": 24127139.0, "step": 756 }, { "entropy": 0.8741592951118946, "epoch": 0.06964882318100528, "grad_norm": 0.15390855073928833, "learning_rate": 9.768147943693072e-05, "loss": 0.8724, "mean_token_accuracy": 0.7545308023691177, "num_tokens": 24159776.0, "step": 757 }, { "entropy": 0.9977220296859741, "epoch": 0.06974082955244651, "grad_norm": 0.16438770294189453, "learning_rate": 9.767841261078909e-05, "loss": 1.0023, "mean_token_accuracy": 0.7199131026864052, "num_tokens": 24191352.0, "step": 758 }, { "entropy": 0.9235007651150227, "epoch": 0.06983283592388773, "grad_norm": 0.2680729925632477, "learning_rate": 9.767534578464747e-05, "loss": 0.922, "mean_token_accuracy": 0.7445998787879944, "num_tokens": 24222978.0, "step": 759 }, { "entropy": 0.9299619011580944, "epoch": 0.06992484229532896, "grad_norm": 0.16164758801460266, "learning_rate": 9.767227895850585e-05, "loss": 0.9483, "mean_token_accuracy": 0.7354999706149101, "num_tokens": 24255342.0, "step": 760 }, { "entropy": 0.917940890416503, "epoch": 0.07001684866677017, "grad_norm": 0.1616727113723755, "learning_rate": 9.766921213236422e-05, "loss": 0.9179, "mean_token_accuracy": 0.7413064204156399, "num_tokens": 24287900.0, "step": 761 }, { "entropy": 1.053685488179326, "epoch": 0.07010885503821139, "grad_norm": 0.1635410040616989, "learning_rate": 9.766614530622259e-05, "loss": 1.0446, "mean_token_accuracy": 0.7076585590839386, "num_tokens": 24320219.0, "step": 762 }, { "entropy": 0.8969144448637962, "epoch": 0.07020086140965262, "grad_norm": 0.15589921176433563, "learning_rate": 9.766307848008097e-05, "loss": 0.8934, "mean_token_accuracy": 0.7494642175734043, "num_tokens": 24352930.0, "step": 763 }, { "entropy": 0.9762221947312355, "epoch": 0.07029286778109384, "grad_norm": 0.17016766965389252, "learning_rate": 9.766001165393934e-05, "loss": 0.9911, "mean_token_accuracy": 0.7291914746165276, "num_tokens": 24384128.0, "step": 764 }, { "entropy": 0.9689153954386711, "epoch": 0.07038487415253507, "grad_norm": 0.16347086429595947, "learning_rate": 9.765694482779772e-05, "loss": 0.9538, "mean_token_accuracy": 0.7400826029479504, "num_tokens": 24414983.0, "step": 765 }, { "entropy": 0.9211628139019012, "epoch": 0.07047688052397628, "grad_norm": 0.16349484026432037, "learning_rate": 9.76538780016561e-05, "loss": 0.9221, "mean_token_accuracy": 0.7421093508601189, "num_tokens": 24447312.0, "step": 766 }, { "entropy": 0.9753438048064709, "epoch": 0.0705688868954175, "grad_norm": 0.16988539695739746, "learning_rate": 9.765081117551447e-05, "loss": 1.0007, "mean_token_accuracy": 0.7239793911576271, "num_tokens": 24479148.0, "step": 767 }, { "entropy": 1.002135954797268, "epoch": 0.07066089326685873, "grad_norm": 0.1716102957725525, "learning_rate": 9.764774434937284e-05, "loss": 1.0209, "mean_token_accuracy": 0.715527381747961, "num_tokens": 24510263.0, "step": 768 }, { "entropy": 0.9307844415307045, "epoch": 0.07075289963829995, "grad_norm": 0.16261951625347137, "learning_rate": 9.76446775232312e-05, "loss": 0.9392, "mean_token_accuracy": 0.7415165230631828, "num_tokens": 24542841.0, "step": 769 }, { "entropy": 1.0119842812418938, "epoch": 0.07084490600974118, "grad_norm": 0.16798041760921478, "learning_rate": 9.764161069708959e-05, "loss": 1.0295, "mean_token_accuracy": 0.7190869897603989, "num_tokens": 24573839.0, "step": 770 }, { "entropy": 0.8963761664927006, "epoch": 0.0709369123811824, "grad_norm": 0.16296271979808807, "learning_rate": 9.763854387094797e-05, "loss": 0.8813, "mean_token_accuracy": 0.75478770211339, "num_tokens": 24606174.0, "step": 771 }, { "entropy": 0.9868187941610813, "epoch": 0.07102891875262361, "grad_norm": 0.16351190209388733, "learning_rate": 9.763547704480634e-05, "loss": 0.9873, "mean_token_accuracy": 0.723734874278307, "num_tokens": 24637787.0, "step": 772 }, { "entropy": 0.973717924207449, "epoch": 0.07112092512406484, "grad_norm": 0.16125066578388214, "learning_rate": 9.76324102186647e-05, "loss": 0.9658, "mean_token_accuracy": 0.7296981699764729, "num_tokens": 24669449.0, "step": 773 }, { "entropy": 0.9297757185995579, "epoch": 0.07121293149550606, "grad_norm": 0.16825729608535767, "learning_rate": 9.762934339252309e-05, "loss": 0.9549, "mean_token_accuracy": 0.7393349185585976, "num_tokens": 24701453.0, "step": 774 }, { "entropy": 0.9122928343713284, "epoch": 0.07130493786694729, "grad_norm": 0.15279382467269897, "learning_rate": 9.762627656638145e-05, "loss": 0.9132, "mean_token_accuracy": 0.744269885122776, "num_tokens": 24733802.0, "step": 775 }, { "entropy": 0.9462030939757824, "epoch": 0.07139694423838851, "grad_norm": 0.16476961970329285, "learning_rate": 9.762320974023983e-05, "loss": 0.9397, "mean_token_accuracy": 0.7325603887438774, "num_tokens": 24765705.0, "step": 776 }, { "entropy": 0.9936528950929642, "epoch": 0.07148895060982972, "grad_norm": 0.16848473250865936, "learning_rate": 9.76201429140982e-05, "loss": 1.0133, "mean_token_accuracy": 0.7192382104694843, "num_tokens": 24796858.0, "step": 777 }, { "entropy": 0.9840080440044403, "epoch": 0.07158095698127095, "grad_norm": 0.16142773628234863, "learning_rate": 9.761707608795658e-05, "loss": 1.0047, "mean_token_accuracy": 0.7264664433896542, "num_tokens": 24829090.0, "step": 778 }, { "entropy": 0.8958589006215334, "epoch": 0.07167296335271217, "grad_norm": 0.1665801852941513, "learning_rate": 9.761400926181495e-05, "loss": 0.9098, "mean_token_accuracy": 0.7445541583001614, "num_tokens": 24860926.0, "step": 779 }, { "entropy": 0.891968484967947, "epoch": 0.0717649697241534, "grad_norm": 0.15826746821403503, "learning_rate": 9.761094243567332e-05, "loss": 0.8884, "mean_token_accuracy": 0.7500179074704647, "num_tokens": 24893343.0, "step": 780 }, { "entropy": 0.9690477028489113, "epoch": 0.07185697609559462, "grad_norm": 0.167481929063797, "learning_rate": 9.76078756095317e-05, "loss": 0.9725, "mean_token_accuracy": 0.7298942096531391, "num_tokens": 24925334.0, "step": 781 }, { "entropy": 0.938049141317606, "epoch": 0.07194898246703585, "grad_norm": 0.16644228994846344, "learning_rate": 9.760480878339008e-05, "loss": 0.9341, "mean_token_accuracy": 0.7358887791633606, "num_tokens": 24956938.0, "step": 782 }, { "entropy": 0.9837486334145069, "epoch": 0.07204098883847707, "grad_norm": 0.16411328315734863, "learning_rate": 9.760174195724845e-05, "loss": 0.97, "mean_token_accuracy": 0.7262499928474426, "num_tokens": 24988783.0, "step": 783 }, { "entropy": 1.0175521448254585, "epoch": 0.07213299520991828, "grad_norm": 0.1714836210012436, "learning_rate": 9.759867513110682e-05, "loss": 1.0069, "mean_token_accuracy": 0.7224933691322803, "num_tokens": 25018786.0, "step": 784 }, { "entropy": 1.0210258662700653, "epoch": 0.07222500158135951, "grad_norm": 0.17129401862621307, "learning_rate": 9.759560830496519e-05, "loss": 1.0408, "mean_token_accuracy": 0.7160746045410633, "num_tokens": 25051181.0, "step": 785 }, { "entropy": 0.8809431008994579, "epoch": 0.07231700795280073, "grad_norm": 0.15995007753372192, "learning_rate": 9.759254147882357e-05, "loss": 0.8921, "mean_token_accuracy": 0.7458332069218159, "num_tokens": 25082231.0, "step": 786 }, { "entropy": 0.8314573392271996, "epoch": 0.07240901432424196, "grad_norm": 0.15146297216415405, "learning_rate": 9.758947465268195e-05, "loss": 0.821, "mean_token_accuracy": 0.7656078785657883, "num_tokens": 25114469.0, "step": 787 }, { "entropy": 0.9689861610531807, "epoch": 0.07250102069568318, "grad_norm": 0.16891618072986603, "learning_rate": 9.758640782654032e-05, "loss": 0.9748, "mean_token_accuracy": 0.7321065627038479, "num_tokens": 25145649.0, "step": 788 }, { "entropy": 0.929735329002142, "epoch": 0.0725930270671244, "grad_norm": 0.15692980587482452, "learning_rate": 9.758334100039868e-05, "loss": 0.9344, "mean_token_accuracy": 0.7373642511665821, "num_tokens": 25177567.0, "step": 789 }, { "entropy": 0.9218393638730049, "epoch": 0.07268503343856562, "grad_norm": 0.15871797502040863, "learning_rate": 9.758027417425707e-05, "loss": 0.9307, "mean_token_accuracy": 0.7394563555717468, "num_tokens": 25209745.0, "step": 790 }, { "entropy": 0.9620450288057327, "epoch": 0.07277703981000684, "grad_norm": 0.15939058363437653, "learning_rate": 9.757720734811543e-05, "loss": 0.9808, "mean_token_accuracy": 0.7276261821389198, "num_tokens": 25242051.0, "step": 791 }, { "entropy": 0.8812330979853868, "epoch": 0.07286904618144807, "grad_norm": 0.16241149604320526, "learning_rate": 9.757414052197382e-05, "loss": 0.9099, "mean_token_accuracy": 0.746483813971281, "num_tokens": 25274482.0, "step": 792 }, { "entropy": 0.9856306165456772, "epoch": 0.07296105255288929, "grad_norm": 0.16723030805587769, "learning_rate": 9.757107369583218e-05, "loss": 0.9668, "mean_token_accuracy": 0.729243416339159, "num_tokens": 25306128.0, "step": 793 }, { "entropy": 0.9258338510990143, "epoch": 0.0730530589243305, "grad_norm": 0.1538238823413849, "learning_rate": 9.756800686969056e-05, "loss": 0.9007, "mean_token_accuracy": 0.7487154603004456, "num_tokens": 25337734.0, "step": 794 }, { "entropy": 0.9189766198396683, "epoch": 0.07314506529577174, "grad_norm": 0.15357853472232819, "learning_rate": 9.756494004354893e-05, "loss": 0.922, "mean_token_accuracy": 0.7440185956656933, "num_tokens": 25370143.0, "step": 795 }, { "entropy": 1.0439080595970154, "epoch": 0.07323707166721295, "grad_norm": 0.16735073924064636, "learning_rate": 9.75618732174073e-05, "loss": 1.0449, "mean_token_accuracy": 0.7094504870474339, "num_tokens": 25402041.0, "step": 796 }, { "entropy": 0.9542340748012066, "epoch": 0.07332907803865418, "grad_norm": 0.1582360565662384, "learning_rate": 9.75588063912657e-05, "loss": 0.9347, "mean_token_accuracy": 0.7360214106738567, "num_tokens": 25434049.0, "step": 797 }, { "entropy": 0.9874455407261848, "epoch": 0.0734210844100954, "grad_norm": 0.16485659778118134, "learning_rate": 9.755573956512406e-05, "loss": 1.0005, "mean_token_accuracy": 0.7200411334633827, "num_tokens": 25464641.0, "step": 798 }, { "entropy": 1.003897998481989, "epoch": 0.07351309078153662, "grad_norm": 0.17197616398334503, "learning_rate": 9.755267273898243e-05, "loss": 1.006, "mean_token_accuracy": 0.7257940694689751, "num_tokens": 25496483.0, "step": 799 }, { "entropy": 0.879679124802351, "epoch": 0.07360509715297785, "grad_norm": 0.15795229375362396, "learning_rate": 9.75496059128408e-05, "loss": 0.8622, "mean_token_accuracy": 0.7517740428447723, "num_tokens": 25528055.0, "step": 800 }, { "entropy": 1.046953234821558, "epoch": 0.07369710352441906, "grad_norm": 0.1727726310491562, "learning_rate": 9.754653908669918e-05, "loss": 1.0626, "mean_token_accuracy": 0.7050612010061741, "num_tokens": 25560089.0, "step": 801 }, { "entropy": 0.9426787309348583, "epoch": 0.0737891098958603, "grad_norm": 0.163871631026268, "learning_rate": 9.754347226055756e-05, "loss": 0.9619, "mean_token_accuracy": 0.7296958267688751, "num_tokens": 25592304.0, "step": 802 }, { "entropy": 0.8039157781749964, "epoch": 0.07388111626730151, "grad_norm": 0.15506954491138458, "learning_rate": 9.754040543441593e-05, "loss": 0.8373, "mean_token_accuracy": 0.7683628164231777, "num_tokens": 25624182.0, "step": 803 }, { "entropy": 1.0090614184737206, "epoch": 0.07397312263874273, "grad_norm": 0.16896405816078186, "learning_rate": 9.75373386082743e-05, "loss": 1.0282, "mean_token_accuracy": 0.7205565087497234, "num_tokens": 25655860.0, "step": 804 }, { "entropy": 0.9871361739933491, "epoch": 0.07406512901018396, "grad_norm": 0.1660793572664261, "learning_rate": 9.753427178213268e-05, "loss": 0.9809, "mean_token_accuracy": 0.719932209700346, "num_tokens": 25687256.0, "step": 805 }, { "entropy": 0.8788506984710693, "epoch": 0.07415713538162517, "grad_norm": 0.15512098371982574, "learning_rate": 9.753120495599105e-05, "loss": 0.8932, "mean_token_accuracy": 0.7470815107226372, "num_tokens": 25719872.0, "step": 806 }, { "entropy": 0.9695808105170727, "epoch": 0.0742491417530664, "grad_norm": 0.17574496567249298, "learning_rate": 9.752813812984943e-05, "loss": 0.9827, "mean_token_accuracy": 0.7296533323824406, "num_tokens": 25751797.0, "step": 807 }, { "entropy": 1.0101498495787382, "epoch": 0.07434114812450762, "grad_norm": 0.16445888578891754, "learning_rate": 9.75250713037078e-05, "loss": 1.0148, "mean_token_accuracy": 0.7191212624311447, "num_tokens": 25783625.0, "step": 808 }, { "entropy": 1.1196264550089836, "epoch": 0.07443315449594884, "grad_norm": 0.17525547742843628, "learning_rate": 9.752200447756618e-05, "loss": 1.103, "mean_token_accuracy": 0.6990806236863136, "num_tokens": 25814980.0, "step": 809 }, { "entropy": 0.9786029830574989, "epoch": 0.07452516086739007, "grad_norm": 0.16183589398860931, "learning_rate": 9.751893765142455e-05, "loss": 0.9504, "mean_token_accuracy": 0.731063287705183, "num_tokens": 25846662.0, "step": 810 }, { "entropy": 0.8960175663232803, "epoch": 0.07461716723883129, "grad_norm": 0.15868550539016724, "learning_rate": 9.751587082528291e-05, "loss": 0.871, "mean_token_accuracy": 0.754888791590929, "num_tokens": 25878019.0, "step": 811 }, { "entropy": 1.0339534543454647, "epoch": 0.07470917361027252, "grad_norm": 0.17218108475208282, "learning_rate": 9.75128039991413e-05, "loss": 1.0332, "mean_token_accuracy": 0.7134471423923969, "num_tokens": 25910136.0, "step": 812 }, { "entropy": 0.8484597615897655, "epoch": 0.07480117998171373, "grad_norm": 0.1623019427061081, "learning_rate": 9.750973717299968e-05, "loss": 0.8753, "mean_token_accuracy": 0.7547342143952847, "num_tokens": 25942064.0, "step": 813 }, { "entropy": 1.0285358019173145, "epoch": 0.07489318635315495, "grad_norm": 0.16945849359035492, "learning_rate": 9.750667034685804e-05, "loss": 1.0369, "mean_token_accuracy": 0.7142699807882309, "num_tokens": 25973691.0, "step": 814 }, { "entropy": 0.8631247319281101, "epoch": 0.07498519272459618, "grad_norm": 0.15859360992908478, "learning_rate": 9.750360352071641e-05, "loss": 0.8623, "mean_token_accuracy": 0.755243431776762, "num_tokens": 26005745.0, "step": 815 }, { "entropy": 0.897196713835001, "epoch": 0.0750771990960374, "grad_norm": 0.1596507728099823, "learning_rate": 9.750053669457478e-05, "loss": 0.9157, "mean_token_accuracy": 0.7448350861668587, "num_tokens": 26037786.0, "step": 816 }, { "entropy": 0.9098497070372105, "epoch": 0.07516920546747863, "grad_norm": 0.16219158470630646, "learning_rate": 9.749746986843316e-05, "loss": 0.9153, "mean_token_accuracy": 0.7434411533176899, "num_tokens": 26068966.0, "step": 817 }, { "entropy": 0.9070624820888042, "epoch": 0.07526121183891984, "grad_norm": 0.1559060662984848, "learning_rate": 9.749440304229154e-05, "loss": 0.9053, "mean_token_accuracy": 0.7430212162435055, "num_tokens": 26101312.0, "step": 818 }, { "entropy": 0.9519104026257992, "epoch": 0.07535321821036106, "grad_norm": 0.1593141108751297, "learning_rate": 9.749133621614991e-05, "loss": 0.9508, "mean_token_accuracy": 0.7314362488687038, "num_tokens": 26134080.0, "step": 819 }, { "entropy": 0.9597192704677582, "epoch": 0.07544522458180229, "grad_norm": 0.16427716612815857, "learning_rate": 9.748826939000828e-05, "loss": 0.9715, "mean_token_accuracy": 0.7315452955663204, "num_tokens": 26165992.0, "step": 820 }, { "entropy": 0.9430848769843578, "epoch": 0.07553723095324351, "grad_norm": 0.1697760671377182, "learning_rate": 9.748520256386666e-05, "loss": 0.9578, "mean_token_accuracy": 0.7328658252954483, "num_tokens": 26197742.0, "step": 821 }, { "entropy": 1.0156432874500751, "epoch": 0.07562923732468474, "grad_norm": 0.16890943050384521, "learning_rate": 9.748213573772503e-05, "loss": 1.035, "mean_token_accuracy": 0.7160553000867367, "num_tokens": 26229654.0, "step": 822 }, { "entropy": 0.9517482109367847, "epoch": 0.07572124369612596, "grad_norm": 0.15917159616947174, "learning_rate": 9.747906891158341e-05, "loss": 0.9505, "mean_token_accuracy": 0.7384414523839951, "num_tokens": 26262173.0, "step": 823 }, { "entropy": 0.8981260899454355, "epoch": 0.07581325006756717, "grad_norm": 0.15398278832435608, "learning_rate": 9.747600208544178e-05, "loss": 0.8786, "mean_token_accuracy": 0.7535396926105022, "num_tokens": 26294574.0, "step": 824 }, { "entropy": 1.0011459030210972, "epoch": 0.0759052564390084, "grad_norm": 0.1741645783185959, "learning_rate": 9.747293525930016e-05, "loss": 0.9999, "mean_token_accuracy": 0.7213692516088486, "num_tokens": 26326084.0, "step": 825 }, { "entropy": 0.9742907732725143, "epoch": 0.07599726281044962, "grad_norm": 0.17058828473091125, "learning_rate": 9.746986843315853e-05, "loss": 0.9806, "mean_token_accuracy": 0.726009164005518, "num_tokens": 26357870.0, "step": 826 }, { "entropy": 0.9268339164555073, "epoch": 0.07608926918189085, "grad_norm": 0.1637573540210724, "learning_rate": 9.74668016070169e-05, "loss": 0.9429, "mean_token_accuracy": 0.7373054288327694, "num_tokens": 26390107.0, "step": 827 }, { "entropy": 0.9235973954200745, "epoch": 0.07618127555333207, "grad_norm": 0.16202713549137115, "learning_rate": 9.746373478087528e-05, "loss": 0.9293, "mean_token_accuracy": 0.7402238510549068, "num_tokens": 26422607.0, "step": 828 }, { "entropy": 0.9813753589987755, "epoch": 0.07627328192477328, "grad_norm": 0.16816136240959167, "learning_rate": 9.746066795473366e-05, "loss": 0.9832, "mean_token_accuracy": 0.7284796349704266, "num_tokens": 26454534.0, "step": 829 }, { "entropy": 0.9882197715342045, "epoch": 0.07636528829621451, "grad_norm": 0.17259398102760315, "learning_rate": 9.745760112859203e-05, "loss": 0.9988, "mean_token_accuracy": 0.7289420776069164, "num_tokens": 26486028.0, "step": 830 }, { "entropy": 1.0355807766318321, "epoch": 0.07645729466765573, "grad_norm": 0.15970394015312195, "learning_rate": 9.745453430245039e-05, "loss": 1.012, "mean_token_accuracy": 0.7242952808737755, "num_tokens": 26518792.0, "step": 831 }, { "entropy": 0.925754964351654, "epoch": 0.07654930103909696, "grad_norm": 0.1539068967103958, "learning_rate": 9.745146747630877e-05, "loss": 0.916, "mean_token_accuracy": 0.739347230643034, "num_tokens": 26551167.0, "step": 832 }, { "entropy": 0.9974164552986622, "epoch": 0.07664130741053818, "grad_norm": 0.16784407198429108, "learning_rate": 9.744840065016714e-05, "loss": 0.9832, "mean_token_accuracy": 0.7245735190808773, "num_tokens": 26582089.0, "step": 833 }, { "entropy": 0.8255923576653004, "epoch": 0.0767333137819794, "grad_norm": 0.14990749955177307, "learning_rate": 9.744533382402552e-05, "loss": 0.8194, "mean_token_accuracy": 0.7655452415347099, "num_tokens": 26613878.0, "step": 834 }, { "entropy": 0.8874995224177837, "epoch": 0.07682532015342063, "grad_norm": 0.15795740485191345, "learning_rate": 9.744226699788389e-05, "loss": 0.8883, "mean_token_accuracy": 0.7470597922801971, "num_tokens": 26645711.0, "step": 835 }, { "entropy": 0.9171003624796867, "epoch": 0.07691732652486184, "grad_norm": 0.1662931889295578, "learning_rate": 9.743920017174227e-05, "loss": 0.9362, "mean_token_accuracy": 0.7387787289917469, "num_tokens": 26676664.0, "step": 836 }, { "entropy": 0.8538406230509281, "epoch": 0.07700933289630307, "grad_norm": 0.16301359236240387, "learning_rate": 9.743613334560064e-05, "loss": 0.8727, "mean_token_accuracy": 0.7524186931550503, "num_tokens": 26709191.0, "step": 837 }, { "entropy": 1.0009033530950546, "epoch": 0.07710133926774429, "grad_norm": 0.16412551701068878, "learning_rate": 9.743306651945901e-05, "loss": 1.0242, "mean_token_accuracy": 0.7177151963114738, "num_tokens": 26741069.0, "step": 838 }, { "entropy": 0.9472977332770824, "epoch": 0.07719334563918552, "grad_norm": 0.16523784399032593, "learning_rate": 9.742999969331739e-05, "loss": 0.9536, "mean_token_accuracy": 0.733122780919075, "num_tokens": 26773204.0, "step": 839 }, { "entropy": 0.9989877268671989, "epoch": 0.07728535201062674, "grad_norm": 0.1683507263660431, "learning_rate": 9.742693286717577e-05, "loss": 1.0079, "mean_token_accuracy": 0.7174751572310925, "num_tokens": 26805585.0, "step": 840 }, { "entropy": 0.9562830775976181, "epoch": 0.07737735838206795, "grad_norm": 0.1637813150882721, "learning_rate": 9.742386604103414e-05, "loss": 0.9494, "mean_token_accuracy": 0.7355855666100979, "num_tokens": 26837863.0, "step": 841 }, { "entropy": 0.9378573261201382, "epoch": 0.07746936475350918, "grad_norm": 0.16462884843349457, "learning_rate": 9.742079921489251e-05, "loss": 0.9525, "mean_token_accuracy": 0.7417920753359795, "num_tokens": 26870159.0, "step": 842 }, { "entropy": 0.9731441214680672, "epoch": 0.0775613711249504, "grad_norm": 0.16435545682907104, "learning_rate": 9.741773238875088e-05, "loss": 0.9729, "mean_token_accuracy": 0.7314001396298409, "num_tokens": 26901919.0, "step": 843 }, { "entropy": 0.9813031405210495, "epoch": 0.07765337749639163, "grad_norm": 0.16944929957389832, "learning_rate": 9.741466556260927e-05, "loss": 0.9854, "mean_token_accuracy": 0.7247452922165394, "num_tokens": 26933876.0, "step": 844 }, { "entropy": 0.9196974337100983, "epoch": 0.07774538386783285, "grad_norm": 0.15995725989341736, "learning_rate": 9.741159873646764e-05, "loss": 0.9142, "mean_token_accuracy": 0.7426532916724682, "num_tokens": 26964778.0, "step": 845 }, { "entropy": 0.8704250119626522, "epoch": 0.07783739023927407, "grad_norm": 0.15568718314170837, "learning_rate": 9.7408531910326e-05, "loss": 0.8867, "mean_token_accuracy": 0.7550181336700916, "num_tokens": 26996849.0, "step": 846 }, { "entropy": 0.9554555602371693, "epoch": 0.0779293966107153, "grad_norm": 0.16840651631355286, "learning_rate": 9.740546508418437e-05, "loss": 0.9552, "mean_token_accuracy": 0.734230637550354, "num_tokens": 27029158.0, "step": 847 }, { "entropy": 0.8672808967530727, "epoch": 0.07802140298215651, "grad_norm": 0.15096792578697205, "learning_rate": 9.740239825804276e-05, "loss": 0.8502, "mean_token_accuracy": 0.7600157968699932, "num_tokens": 27061561.0, "step": 848 }, { "entropy": 0.9291978813707829, "epoch": 0.07811340935359774, "grad_norm": 0.16496247053146362, "learning_rate": 9.739933143190114e-05, "loss": 0.9508, "mean_token_accuracy": 0.7339499704539776, "num_tokens": 27093223.0, "step": 849 }, { "entropy": 0.9408350810408592, "epoch": 0.07820541572503896, "grad_norm": 0.1602609008550644, "learning_rate": 9.73962646057595e-05, "loss": 0.9514, "mean_token_accuracy": 0.7350383996963501, "num_tokens": 27125344.0, "step": 850 }, { "entropy": 0.9225513786077499, "epoch": 0.07829742209648018, "grad_norm": 0.16747024655342102, "learning_rate": 9.739319777961787e-05, "loss": 0.9324, "mean_token_accuracy": 0.7374814115464687, "num_tokens": 27156802.0, "step": 851 }, { "entropy": 0.968829870223999, "epoch": 0.07838942846792141, "grad_norm": 0.15946544706821442, "learning_rate": 9.739013095347625e-05, "loss": 0.9685, "mean_token_accuracy": 0.7297152131795883, "num_tokens": 27188752.0, "step": 852 }, { "entropy": 0.971568375825882, "epoch": 0.07848143483936262, "grad_norm": 0.16191044449806213, "learning_rate": 9.738706412733462e-05, "loss": 0.9591, "mean_token_accuracy": 0.7315336354076862, "num_tokens": 27221032.0, "step": 853 }, { "entropy": 0.9695960693061352, "epoch": 0.07857344121080385, "grad_norm": 0.15656960010528564, "learning_rate": 9.7383997301193e-05, "loss": 0.9573, "mean_token_accuracy": 0.729323472827673, "num_tokens": 27253481.0, "step": 854 }, { "entropy": 0.9361900966614485, "epoch": 0.07866544758224507, "grad_norm": 0.1591096818447113, "learning_rate": 9.738093047505137e-05, "loss": 0.935, "mean_token_accuracy": 0.736208476126194, "num_tokens": 27285879.0, "step": 855 }, { "entropy": 1.002680692821741, "epoch": 0.07875745395368629, "grad_norm": 0.16537711024284363, "learning_rate": 9.737786364890975e-05, "loss": 0.9762, "mean_token_accuracy": 0.7292106449604034, "num_tokens": 27317240.0, "step": 856 }, { "entropy": 0.9484521243721247, "epoch": 0.07884946032512752, "grad_norm": 0.1627333015203476, "learning_rate": 9.737479682276812e-05, "loss": 0.966, "mean_token_accuracy": 0.7320380657911301, "num_tokens": 27349278.0, "step": 857 }, { "entropy": 0.9685053564608097, "epoch": 0.07894146669656874, "grad_norm": 0.15924955904483795, "learning_rate": 9.737172999662649e-05, "loss": 0.9756, "mean_token_accuracy": 0.7344861850142479, "num_tokens": 27381223.0, "step": 858 }, { "entropy": 0.9423946104943752, "epoch": 0.07903347306800997, "grad_norm": 0.15639211237430573, "learning_rate": 9.736866317048487e-05, "loss": 0.9296, "mean_token_accuracy": 0.7374790124595165, "num_tokens": 27413553.0, "step": 859 }, { "entropy": 0.9082550667226315, "epoch": 0.07912547943945118, "grad_norm": 0.16244761645793915, "learning_rate": 9.736559634434325e-05, "loss": 0.9402, "mean_token_accuracy": 0.7383254840970039, "num_tokens": 27445911.0, "step": 860 }, { "entropy": 0.9876478649675846, "epoch": 0.0792174858108924, "grad_norm": 0.16642430424690247, "learning_rate": 9.736252951820162e-05, "loss": 1.0224, "mean_token_accuracy": 0.7194645293056965, "num_tokens": 27478431.0, "step": 861 }, { "entropy": 0.9400400072336197, "epoch": 0.07930949218233363, "grad_norm": 0.1696026623249054, "learning_rate": 9.735946269205999e-05, "loss": 0.9594, "mean_token_accuracy": 0.7286202944815159, "num_tokens": 27510623.0, "step": 862 }, { "entropy": 0.9244946613907814, "epoch": 0.07940149855377485, "grad_norm": 0.16291528940200806, "learning_rate": 9.735639586591837e-05, "loss": 0.9584, "mean_token_accuracy": 0.7340520657598972, "num_tokens": 27543118.0, "step": 863 }, { "entropy": 0.8927987217903137, "epoch": 0.07949350492521608, "grad_norm": 0.1594545841217041, "learning_rate": 9.735332903977674e-05, "loss": 0.9016, "mean_token_accuracy": 0.7476598992943764, "num_tokens": 27575643.0, "step": 864 }, { "entropy": 1.0563612878322601, "epoch": 0.0795855112966573, "grad_norm": 0.16871725022792816, "learning_rate": 9.735026221363512e-05, "loss": 1.0397, "mean_token_accuracy": 0.7152613364160061, "num_tokens": 27607725.0, "step": 865 }, { "entropy": 0.9597365148365498, "epoch": 0.07967751766809851, "grad_norm": 0.16241663694381714, "learning_rate": 9.734719538749349e-05, "loss": 0.9544, "mean_token_accuracy": 0.735468003898859, "num_tokens": 27639503.0, "step": 866 }, { "entropy": 0.8980777077376842, "epoch": 0.07976952403953974, "grad_norm": 0.15998417139053345, "learning_rate": 9.734412856135187e-05, "loss": 0.8943, "mean_token_accuracy": 0.7470311857759953, "num_tokens": 27671208.0, "step": 867 }, { "entropy": 0.8800961971282959, "epoch": 0.07986153041098096, "grad_norm": 0.1601392924785614, "learning_rate": 9.734106173521023e-05, "loss": 0.8691, "mean_token_accuracy": 0.7504118531942368, "num_tokens": 27702278.0, "step": 868 }, { "entropy": 0.9181556589901447, "epoch": 0.07995353678242219, "grad_norm": 0.15945619344711304, "learning_rate": 9.73379949090686e-05, "loss": 0.9146, "mean_token_accuracy": 0.7429975792765617, "num_tokens": 27734046.0, "step": 869 }, { "entropy": 0.9215871319174767, "epoch": 0.0800455431538634, "grad_norm": 0.16096268594264984, "learning_rate": 9.733492808292698e-05, "loss": 0.9301, "mean_token_accuracy": 0.7395832352340221, "num_tokens": 27765853.0, "step": 870 }, { "entropy": 0.9064399190247059, "epoch": 0.08013754952530462, "grad_norm": 0.15812036395072937, "learning_rate": 9.733186125678537e-05, "loss": 0.9259, "mean_token_accuracy": 0.7397037670016289, "num_tokens": 27796898.0, "step": 871 }, { "entropy": 0.9026679843664169, "epoch": 0.08022955589674585, "grad_norm": 0.1564193069934845, "learning_rate": 9.732879443064373e-05, "loss": 0.904, "mean_token_accuracy": 0.7462964579463005, "num_tokens": 27828862.0, "step": 872 }, { "entropy": 0.9240762330591679, "epoch": 0.08032156226818707, "grad_norm": 0.15576978027820587, "learning_rate": 9.73257276045021e-05, "loss": 0.911, "mean_token_accuracy": 0.7446960024535656, "num_tokens": 27860984.0, "step": 873 }, { "entropy": 0.8864658661186695, "epoch": 0.0804135686396283, "grad_norm": 0.15587686002254486, "learning_rate": 9.732266077836047e-05, "loss": 0.9003, "mean_token_accuracy": 0.74685113504529, "num_tokens": 27893579.0, "step": 874 }, { "entropy": 0.9486214481294155, "epoch": 0.08050557501106952, "grad_norm": 0.1666061282157898, "learning_rate": 9.731959395221885e-05, "loss": 0.9427, "mean_token_accuracy": 0.7366765663027763, "num_tokens": 27924502.0, "step": 875 }, { "entropy": 1.0246227085590363, "epoch": 0.08059758138251073, "grad_norm": 0.1655074506998062, "learning_rate": 9.731652712607723e-05, "loss": 1.0152, "mean_token_accuracy": 0.722616620361805, "num_tokens": 27957046.0, "step": 876 }, { "entropy": 0.9945472665131092, "epoch": 0.08068958775395196, "grad_norm": 0.1661675125360489, "learning_rate": 9.73134602999356e-05, "loss": 0.9804, "mean_token_accuracy": 0.7284702956676483, "num_tokens": 27988917.0, "step": 877 }, { "entropy": 0.8925548940896988, "epoch": 0.08078159412539318, "grad_norm": 0.163802370429039, "learning_rate": 9.731039347379397e-05, "loss": 0.9195, "mean_token_accuracy": 0.7428703345358372, "num_tokens": 28020501.0, "step": 878 }, { "entropy": 0.9524826221168041, "epoch": 0.08087360049683441, "grad_norm": 0.16367146372795105, "learning_rate": 9.730732664765235e-05, "loss": 0.9533, "mean_token_accuracy": 0.7341503724455833, "num_tokens": 28051512.0, "step": 879 }, { "entropy": 0.9492873661220074, "epoch": 0.08096560686827563, "grad_norm": 0.15978164970874786, "learning_rate": 9.730425982151073e-05, "loss": 0.9426, "mean_token_accuracy": 0.7328274585306644, "num_tokens": 28083463.0, "step": 880 }, { "entropy": 0.9374285116791725, "epoch": 0.08105761323971684, "grad_norm": 0.1634908765554428, "learning_rate": 9.73011929953691e-05, "loss": 0.9418, "mean_token_accuracy": 0.73641112819314, "num_tokens": 28114357.0, "step": 881 }, { "entropy": 0.9979594834148884, "epoch": 0.08114961961115807, "grad_norm": 0.1572573184967041, "learning_rate": 9.729812616922747e-05, "loss": 0.9851, "mean_token_accuracy": 0.7266973666846752, "num_tokens": 28146784.0, "step": 882 }, { "entropy": 0.9088423773646355, "epoch": 0.08124162598259929, "grad_norm": 0.16149698197841644, "learning_rate": 9.729505934308585e-05, "loss": 0.9075, "mean_token_accuracy": 0.7481547631323338, "num_tokens": 28178476.0, "step": 883 }, { "entropy": 0.9582634121179581, "epoch": 0.08133363235404052, "grad_norm": 0.16516552865505219, "learning_rate": 9.729199251694422e-05, "loss": 0.9432, "mean_token_accuracy": 0.737374272197485, "num_tokens": 28210964.0, "step": 884 }, { "entropy": 0.9771178923547268, "epoch": 0.08142563872548174, "grad_norm": 0.1658152937889099, "learning_rate": 9.72889256908026e-05, "loss": 0.9563, "mean_token_accuracy": 0.7355898842215538, "num_tokens": 28243180.0, "step": 885 }, { "entropy": 0.9357305876910686, "epoch": 0.08151764509692296, "grad_norm": 0.15437202155590057, "learning_rate": 9.728585886466098e-05, "loss": 0.9313, "mean_token_accuracy": 0.7362537570297718, "num_tokens": 28275219.0, "step": 886 }, { "entropy": 1.030756052583456, "epoch": 0.08160965146836419, "grad_norm": 0.17871473729610443, "learning_rate": 9.728279203851935e-05, "loss": 1.0493, "mean_token_accuracy": 0.717909686267376, "num_tokens": 28306359.0, "step": 887 }, { "entropy": 1.0051693692803383, "epoch": 0.0817016578398054, "grad_norm": 0.16931192576885223, "learning_rate": 9.727972521237771e-05, "loss": 1.0198, "mean_token_accuracy": 0.7161805108189583, "num_tokens": 28338062.0, "step": 888 }, { "entropy": 0.8886675722897053, "epoch": 0.08179366421124663, "grad_norm": 0.1541573703289032, "learning_rate": 9.727665838623608e-05, "loss": 0.8986, "mean_token_accuracy": 0.747088111937046, "num_tokens": 28369979.0, "step": 889 }, { "entropy": 1.011715266853571, "epoch": 0.08188567058268785, "grad_norm": 0.16964338719844818, "learning_rate": 9.727359156009446e-05, "loss": 1.042, "mean_token_accuracy": 0.7169215492904186, "num_tokens": 28401897.0, "step": 890 }, { "entropy": 0.9651166312396526, "epoch": 0.08197767695412907, "grad_norm": 0.16081279516220093, "learning_rate": 9.727052473395284e-05, "loss": 0.977, "mean_token_accuracy": 0.7289307303726673, "num_tokens": 28433657.0, "step": 891 }, { "entropy": 1.0382549222558737, "epoch": 0.0820696833255703, "grad_norm": 0.16813810169696808, "learning_rate": 9.726745790781121e-05, "loss": 1.059, "mean_token_accuracy": 0.7075018435716629, "num_tokens": 28465203.0, "step": 892 }, { "entropy": 0.9477774538099766, "epoch": 0.08216168969701151, "grad_norm": 0.15902648866176605, "learning_rate": 9.726439108166958e-05, "loss": 0.9546, "mean_token_accuracy": 0.7347676791250706, "num_tokens": 28497521.0, "step": 893 }, { "entropy": 1.0245006084442139, "epoch": 0.08225369606845274, "grad_norm": 0.1653822660446167, "learning_rate": 9.726132425552796e-05, "loss": 1.0291, "mean_token_accuracy": 0.7162531726062298, "num_tokens": 28529556.0, "step": 894 }, { "entropy": 0.9168008118867874, "epoch": 0.08234570243989396, "grad_norm": 0.15906579792499542, "learning_rate": 9.725825742938633e-05, "loss": 0.9139, "mean_token_accuracy": 0.7480812519788742, "num_tokens": 28560914.0, "step": 895 }, { "entropy": 0.9632975794374943, "epoch": 0.08243770881133518, "grad_norm": 0.16391408443450928, "learning_rate": 9.725519060324471e-05, "loss": 0.9654, "mean_token_accuracy": 0.7307506985962391, "num_tokens": 28592992.0, "step": 896 }, { "entropy": 1.0200887471437454, "epoch": 0.08252971518277641, "grad_norm": 0.16870862245559692, "learning_rate": 9.725212377710308e-05, "loss": 1.029, "mean_token_accuracy": 0.7160102762281895, "num_tokens": 28624823.0, "step": 897 }, { "entropy": 1.033143013715744, "epoch": 0.08262172155421763, "grad_norm": 0.1692463457584381, "learning_rate": 9.724905695096146e-05, "loss": 1.0334, "mean_token_accuracy": 0.7121374420821667, "num_tokens": 28657377.0, "step": 898 }, { "entropy": 0.992195125669241, "epoch": 0.08271372792565886, "grad_norm": 0.17153699696063995, "learning_rate": 9.724599012481983e-05, "loss": 0.9913, "mean_token_accuracy": 0.7304934673011303, "num_tokens": 28688854.0, "step": 899 }, { "entropy": 0.7990805227309465, "epoch": 0.08280573429710007, "grad_norm": 0.1482461392879486, "learning_rate": 9.72429232986782e-05, "loss": 0.7767, "mean_token_accuracy": 0.7740639187395573, "num_tokens": 28720636.0, "step": 900 }, { "entropy": 0.9079835526645184, "epoch": 0.0828977406685413, "grad_norm": 0.16627106070518494, "learning_rate": 9.723985647253658e-05, "loss": 0.8968, "mean_token_accuracy": 0.753268089145422, "num_tokens": 28752199.0, "step": 901 }, { "entropy": 0.8319191001355648, "epoch": 0.08298974703998252, "grad_norm": 0.15427318215370178, "learning_rate": 9.723678964639496e-05, "loss": 0.8339, "mean_token_accuracy": 0.7580270878970623, "num_tokens": 28784431.0, "step": 902 }, { "entropy": 0.9139825850725174, "epoch": 0.08308175341142374, "grad_norm": 0.16638121008872986, "learning_rate": 9.723372282025333e-05, "loss": 0.9387, "mean_token_accuracy": 0.735026840120554, "num_tokens": 28815597.0, "step": 903 }, { "entropy": 0.8832446783781052, "epoch": 0.08317375978286497, "grad_norm": 0.16459091007709503, "learning_rate": 9.72306559941117e-05, "loss": 0.8846, "mean_token_accuracy": 0.7492220662534237, "num_tokens": 28847441.0, "step": 904 }, { "entropy": 0.9302517957985401, "epoch": 0.08326576615430618, "grad_norm": 0.16204756498336792, "learning_rate": 9.722758916797006e-05, "loss": 0.9304, "mean_token_accuracy": 0.7373491860926151, "num_tokens": 28879377.0, "step": 905 }, { "entropy": 0.9527584686875343, "epoch": 0.08335777252574741, "grad_norm": 0.1586255133152008, "learning_rate": 9.722452234182844e-05, "loss": 0.9572, "mean_token_accuracy": 0.7334199920296669, "num_tokens": 28911622.0, "step": 906 }, { "entropy": 0.8616615459322929, "epoch": 0.08344977889718863, "grad_norm": 0.161000058054924, "learning_rate": 9.722145551568683e-05, "loss": 0.8689, "mean_token_accuracy": 0.7534597851336002, "num_tokens": 28943577.0, "step": 907 }, { "entropy": 0.9634058512747288, "epoch": 0.08354178526862985, "grad_norm": 0.1671752780675888, "learning_rate": 9.72183886895452e-05, "loss": 0.9649, "mean_token_accuracy": 0.7340079918503761, "num_tokens": 28975360.0, "step": 908 }, { "entropy": 1.0335550345480442, "epoch": 0.08363379164007108, "grad_norm": 0.16297176480293274, "learning_rate": 9.721532186340356e-05, "loss": 1.0182, "mean_token_accuracy": 0.7176880799233913, "num_tokens": 29007510.0, "step": 909 }, { "entropy": 1.0312865935266018, "epoch": 0.0837257980115123, "grad_norm": 0.17152875661849976, "learning_rate": 9.721225503726194e-05, "loss": 0.9976, "mean_token_accuracy": 0.7250109612941742, "num_tokens": 29040083.0, "step": 910 }, { "entropy": 0.9341313913464546, "epoch": 0.08381780438295353, "grad_norm": 0.161838561296463, "learning_rate": 9.720918821112031e-05, "loss": 0.933, "mean_token_accuracy": 0.7396265156567097, "num_tokens": 29071586.0, "step": 911 }, { "entropy": 0.9120601788163185, "epoch": 0.08390981075439474, "grad_norm": 0.15900327265262604, "learning_rate": 9.720612138497869e-05, "loss": 0.905, "mean_token_accuracy": 0.742607057094574, "num_tokens": 29103477.0, "step": 912 }, { "entropy": 0.9376872777938843, "epoch": 0.08400181712583596, "grad_norm": 0.15983904898166656, "learning_rate": 9.720305455883706e-05, "loss": 0.9429, "mean_token_accuracy": 0.7407850995659828, "num_tokens": 29135221.0, "step": 913 }, { "entropy": 0.9235844798386097, "epoch": 0.08409382349727719, "grad_norm": 0.163807675242424, "learning_rate": 9.719998773269544e-05, "loss": 0.9457, "mean_token_accuracy": 0.7377686202526093, "num_tokens": 29167554.0, "step": 914 }, { "entropy": 1.0049229823052883, "epoch": 0.0841858298687184, "grad_norm": 0.16817159950733185, "learning_rate": 9.719692090655381e-05, "loss": 1.0417, "mean_token_accuracy": 0.7223370149731636, "num_tokens": 29199156.0, "step": 915 }, { "entropy": 0.9806271158158779, "epoch": 0.08427783624015964, "grad_norm": 0.16544672846794128, "learning_rate": 9.719385408041218e-05, "loss": 0.9976, "mean_token_accuracy": 0.7249796949326992, "num_tokens": 29231224.0, "step": 916 }, { "entropy": 0.9456051588058472, "epoch": 0.08436984261160085, "grad_norm": 0.16046495735645294, "learning_rate": 9.719078725427057e-05, "loss": 0.9611, "mean_token_accuracy": 0.7322219461202621, "num_tokens": 29263583.0, "step": 917 }, { "entropy": 0.8887595124542713, "epoch": 0.08446184898304207, "grad_norm": 0.15719042718410492, "learning_rate": 9.718772042812894e-05, "loss": 0.9045, "mean_token_accuracy": 0.7454048916697502, "num_tokens": 29295970.0, "step": 918 }, { "entropy": 0.9542812034487724, "epoch": 0.0845538553544833, "grad_norm": 0.15589575469493866, "learning_rate": 9.718465360198731e-05, "loss": 0.9575, "mean_token_accuracy": 0.73128217831254, "num_tokens": 29328571.0, "step": 919 }, { "entropy": 0.9638505727052689, "epoch": 0.08464586172592452, "grad_norm": 0.1626119166612625, "learning_rate": 9.718158677584568e-05, "loss": 0.9587, "mean_token_accuracy": 0.7316138707101345, "num_tokens": 29360282.0, "step": 920 }, { "entropy": 0.9536610208451748, "epoch": 0.08473786809736575, "grad_norm": 0.16201965510845184, "learning_rate": 9.717851994970406e-05, "loss": 0.9595, "mean_token_accuracy": 0.7355928458273411, "num_tokens": 29392190.0, "step": 921 }, { "entropy": 0.9360164199024439, "epoch": 0.08482987446880697, "grad_norm": 0.15674394369125366, "learning_rate": 9.717545312356244e-05, "loss": 0.8839, "mean_token_accuracy": 0.7519618459045887, "num_tokens": 29423861.0, "step": 922 }, { "entropy": 1.0307834781706333, "epoch": 0.08492188084024818, "grad_norm": 0.16153934597969055, "learning_rate": 9.71723862974208e-05, "loss": 1.0185, "mean_token_accuracy": 0.7177651040256023, "num_tokens": 29455990.0, "step": 923 }, { "entropy": 0.9291120283305645, "epoch": 0.08501388721168941, "grad_norm": 0.16381607949733734, "learning_rate": 9.716931947127917e-05, "loss": 0.9162, "mean_token_accuracy": 0.743769109249115, "num_tokens": 29487296.0, "step": 924 }, { "entropy": 0.9701007567346096, "epoch": 0.08510589358313063, "grad_norm": 0.1646110713481903, "learning_rate": 9.716625264513756e-05, "loss": 0.9608, "mean_token_accuracy": 0.7276989035308361, "num_tokens": 29519663.0, "step": 925 }, { "entropy": 0.9279647544026375, "epoch": 0.08519789995457186, "grad_norm": 0.15385520458221436, "learning_rate": 9.716318581899592e-05, "loss": 0.9357, "mean_token_accuracy": 0.7402789257466793, "num_tokens": 29552178.0, "step": 926 }, { "entropy": 0.8788296394050121, "epoch": 0.08528990632601308, "grad_norm": 0.15612773597240448, "learning_rate": 9.71601189928543e-05, "loss": 0.8831, "mean_token_accuracy": 0.7533745802938938, "num_tokens": 29583821.0, "step": 927 }, { "entropy": 0.9935759231448174, "epoch": 0.08538191269745429, "grad_norm": 0.1681300401687622, "learning_rate": 9.715705216671267e-05, "loss": 1.0094, "mean_token_accuracy": 0.7206141501665115, "num_tokens": 29615976.0, "step": 928 }, { "entropy": 0.970613107085228, "epoch": 0.08547391906889552, "grad_norm": 0.16945363581180573, "learning_rate": 9.715398534057105e-05, "loss": 1.0021, "mean_token_accuracy": 0.728080615401268, "num_tokens": 29647492.0, "step": 929 }, { "entropy": 0.966818779706955, "epoch": 0.08556592544033674, "grad_norm": 0.1615465134382248, "learning_rate": 9.715091851442942e-05, "loss": 0.9924, "mean_token_accuracy": 0.7278959788382053, "num_tokens": 29679928.0, "step": 930 }, { "entropy": 0.9005981758236885, "epoch": 0.08565793181177797, "grad_norm": 0.1578885018825531, "learning_rate": 9.714785168828779e-05, "loss": 0.9369, "mean_token_accuracy": 0.7381422705948353, "num_tokens": 29712603.0, "step": 931 }, { "entropy": 1.052727472037077, "epoch": 0.08574993818321919, "grad_norm": 0.1807403564453125, "learning_rate": 9.714478486214617e-05, "loss": 1.0473, "mean_token_accuracy": 0.7114957869052887, "num_tokens": 29743642.0, "step": 932 }, { "entropy": 0.976007804274559, "epoch": 0.0858419445546604, "grad_norm": 0.15990310907363892, "learning_rate": 9.714171803600455e-05, "loss": 0.9699, "mean_token_accuracy": 0.7286074087023735, "num_tokens": 29774794.0, "step": 933 }, { "entropy": 1.0614879056811333, "epoch": 0.08593395092610163, "grad_norm": 0.16741439700126648, "learning_rate": 9.713865120986292e-05, "loss": 1.0598, "mean_token_accuracy": 0.7112355940043926, "num_tokens": 29806128.0, "step": 934 }, { "entropy": 1.0479108653962612, "epoch": 0.08602595729754285, "grad_norm": 0.16534516215324402, "learning_rate": 9.713558438372129e-05, "loss": 1.0307, "mean_token_accuracy": 0.7147114090621471, "num_tokens": 29838752.0, "step": 935 }, { "entropy": 0.9310126714408398, "epoch": 0.08611796366898408, "grad_norm": 0.15779109299182892, "learning_rate": 9.713251755757966e-05, "loss": 0.9212, "mean_token_accuracy": 0.7420204244554043, "num_tokens": 29870953.0, "step": 936 }, { "entropy": 0.8316780142486095, "epoch": 0.0862099700404253, "grad_norm": 0.15946152806282043, "learning_rate": 9.712945073143804e-05, "loss": 0.8048, "mean_token_accuracy": 0.7661098130047321, "num_tokens": 29902218.0, "step": 937 }, { "entropy": 0.9058275409042835, "epoch": 0.08630197641186652, "grad_norm": 0.15455356240272522, "learning_rate": 9.712638390529642e-05, "loss": 0.8719, "mean_token_accuracy": 0.754690807312727, "num_tokens": 29934942.0, "step": 938 }, { "entropy": 0.9955501146614552, "epoch": 0.08639398278330775, "grad_norm": 0.16655628383159637, "learning_rate": 9.712331707915479e-05, "loss": 0.9878, "mean_token_accuracy": 0.724040474742651, "num_tokens": 29966489.0, "step": 939 }, { "entropy": 0.9390711151063442, "epoch": 0.08648598915474896, "grad_norm": 0.16280466318130493, "learning_rate": 9.712025025301316e-05, "loss": 0.9315, "mean_token_accuracy": 0.7416763491928577, "num_tokens": 29998770.0, "step": 940 }, { "entropy": 0.7573208399116993, "epoch": 0.0865779955261902, "grad_norm": 0.14976248145103455, "learning_rate": 9.711718342687154e-05, "loss": 0.764, "mean_token_accuracy": 0.7827834263443947, "num_tokens": 30030935.0, "step": 941 }, { "entropy": 0.9194397516548634, "epoch": 0.08667000189763141, "grad_norm": 0.16441328823566437, "learning_rate": 9.71141166007299e-05, "loss": 0.9405, "mean_token_accuracy": 0.7399983778595924, "num_tokens": 30063414.0, "step": 942 }, { "entropy": 0.9308536238968372, "epoch": 0.08676200826907263, "grad_norm": 0.17267094552516937, "learning_rate": 9.711104977458829e-05, "loss": 0.9488, "mean_token_accuracy": 0.7382223382592201, "num_tokens": 30095947.0, "step": 943 }, { "entropy": 1.0473821051418781, "epoch": 0.08685401464051386, "grad_norm": 0.18497617542743683, "learning_rate": 9.710798294844665e-05, "loss": 1.0757, "mean_token_accuracy": 0.7023703455924988, "num_tokens": 30126915.0, "step": 944 }, { "entropy": 0.9788549281656742, "epoch": 0.08694602101195507, "grad_norm": 0.1653570979833603, "learning_rate": 9.710491612230504e-05, "loss": 1.0098, "mean_token_accuracy": 0.7249509617686272, "num_tokens": 30158787.0, "step": 945 }, { "entropy": 0.8788519687950611, "epoch": 0.0870380273833963, "grad_norm": 0.15479259192943573, "learning_rate": 9.71018492961634e-05, "loss": 0.9045, "mean_token_accuracy": 0.7480422705411911, "num_tokens": 30191078.0, "step": 946 }, { "entropy": 0.9450247101485729, "epoch": 0.08713003375483752, "grad_norm": 0.16010959446430206, "learning_rate": 9.709878247002177e-05, "loss": 0.955, "mean_token_accuracy": 0.7302958145737648, "num_tokens": 30222685.0, "step": 947 }, { "entropy": 0.890707204118371, "epoch": 0.08722204012627874, "grad_norm": 0.15926292538642883, "learning_rate": 9.709571564388015e-05, "loss": 0.8939, "mean_token_accuracy": 0.7437068559229374, "num_tokens": 30254738.0, "step": 948 }, { "entropy": 0.9819902554154396, "epoch": 0.08731404649771997, "grad_norm": 0.16164140403270721, "learning_rate": 9.709264881773853e-05, "loss": 0.9714, "mean_token_accuracy": 0.7303546518087387, "num_tokens": 30286992.0, "step": 949 }, { "entropy": 1.0133906826376915, "epoch": 0.08740605286916119, "grad_norm": 0.16301406919956207, "learning_rate": 9.70895819915969e-05, "loss": 1.0064, "mean_token_accuracy": 0.7252141684293747, "num_tokens": 30317711.0, "step": 950 }, { "entropy": 0.9229645505547523, "epoch": 0.08749805924060242, "grad_norm": 0.15729881823062897, "learning_rate": 9.708651516545527e-05, "loss": 0.9047, "mean_token_accuracy": 0.7399939298629761, "num_tokens": 30349749.0, "step": 951 }, { "entropy": 0.9705100767314434, "epoch": 0.08759006561204363, "grad_norm": 0.16773590445518494, "learning_rate": 9.708344833931365e-05, "loss": 0.9779, "mean_token_accuracy": 0.7285280711948872, "num_tokens": 30382081.0, "step": 952 }, { "entropy": 1.0154315792024136, "epoch": 0.08768207198348485, "grad_norm": 0.1626855432987213, "learning_rate": 9.708038151317202e-05, "loss": 0.9727, "mean_token_accuracy": 0.7255200147628784, "num_tokens": 30413813.0, "step": 953 }, { "entropy": 0.9858567733317614, "epoch": 0.08777407835492608, "grad_norm": 0.16285663843154907, "learning_rate": 9.70773146870304e-05, "loss": 0.9911, "mean_token_accuracy": 0.724607028067112, "num_tokens": 30446059.0, "step": 954 }, { "entropy": 0.9113628417253494, "epoch": 0.0878660847263673, "grad_norm": 0.16188208758831024, "learning_rate": 9.707424786088877e-05, "loss": 0.9158, "mean_token_accuracy": 0.7436315082013607, "num_tokens": 30478312.0, "step": 955 }, { "entropy": 0.9495079331099987, "epoch": 0.08795809109780853, "grad_norm": 0.16167901456356049, "learning_rate": 9.707118103474715e-05, "loss": 0.958, "mean_token_accuracy": 0.7363086566329002, "num_tokens": 30510177.0, "step": 956 }, { "entropy": 0.898770909756422, "epoch": 0.08805009746924974, "grad_norm": 0.1584126353263855, "learning_rate": 9.706811420860552e-05, "loss": 0.9153, "mean_token_accuracy": 0.743336521089077, "num_tokens": 30541279.0, "step": 957 }, { "entropy": 0.8961479924619198, "epoch": 0.08814210384069097, "grad_norm": 0.15940997004508972, "learning_rate": 9.706504738246389e-05, "loss": 0.9344, "mean_token_accuracy": 0.742788091301918, "num_tokens": 30573349.0, "step": 958 }, { "entropy": 1.0329826027154922, "epoch": 0.08823411021213219, "grad_norm": 0.1674753576517105, "learning_rate": 9.706198055632227e-05, "loss": 1.0348, "mean_token_accuracy": 0.711038064211607, "num_tokens": 30605561.0, "step": 959 }, { "entropy": 0.9822486266493797, "epoch": 0.08832611658357341, "grad_norm": 0.16457316279411316, "learning_rate": 9.705891373018065e-05, "loss": 0.9985, "mean_token_accuracy": 0.7178325690329075, "num_tokens": 30637849.0, "step": 960 }, { "entropy": 0.9190222397446632, "epoch": 0.08841812295501464, "grad_norm": 0.16368675231933594, "learning_rate": 9.705584690403902e-05, "loss": 0.918, "mean_token_accuracy": 0.7449268810451031, "num_tokens": 30669136.0, "step": 961 }, { "entropy": 0.965740017592907, "epoch": 0.08851012932645586, "grad_norm": 0.16236372292041779, "learning_rate": 9.705278007789738e-05, "loss": 0.954, "mean_token_accuracy": 0.7334070317447186, "num_tokens": 30700943.0, "step": 962 }, { "entropy": 1.0067159943282604, "epoch": 0.08860213569789709, "grad_norm": 0.16343580186367035, "learning_rate": 9.704971325175575e-05, "loss": 1.0182, "mean_token_accuracy": 0.7169825956225395, "num_tokens": 30732881.0, "step": 963 }, { "entropy": 0.9352018758654594, "epoch": 0.0886941420693383, "grad_norm": 0.1546681970357895, "learning_rate": 9.704664642561415e-05, "loss": 0.9387, "mean_token_accuracy": 0.7408855333924294, "num_tokens": 30765418.0, "step": 964 }, { "entropy": 0.9172436706721783, "epoch": 0.08878614844077952, "grad_norm": 0.1559939980506897, "learning_rate": 9.704357959947251e-05, "loss": 0.9108, "mean_token_accuracy": 0.7435907423496246, "num_tokens": 30797656.0, "step": 965 }, { "entropy": 1.014381468296051, "epoch": 0.08887815481222075, "grad_norm": 0.16157332062721252, "learning_rate": 9.704051277333088e-05, "loss": 1.0231, "mean_token_accuracy": 0.7173183783888817, "num_tokens": 30829707.0, "step": 966 }, { "entropy": 1.0633132681250572, "epoch": 0.08897016118366197, "grad_norm": 0.16106529533863068, "learning_rate": 9.703744594718925e-05, "loss": 1.0288, "mean_token_accuracy": 0.714535303413868, "num_tokens": 30861270.0, "step": 967 }, { "entropy": 0.9028850793838501, "epoch": 0.0890621675551032, "grad_norm": 0.15666131675243378, "learning_rate": 9.703437912104763e-05, "loss": 0.891, "mean_token_accuracy": 0.7529587112367153, "num_tokens": 30893414.0, "step": 968 }, { "entropy": 0.901664711534977, "epoch": 0.08915417392654441, "grad_norm": 0.1575678586959839, "learning_rate": 9.703131229490601e-05, "loss": 0.887, "mean_token_accuracy": 0.7463204972445965, "num_tokens": 30924595.0, "step": 969 }, { "entropy": 0.8727289512753487, "epoch": 0.08924618029798563, "grad_norm": 0.15660585463047028, "learning_rate": 9.702824546876438e-05, "loss": 0.8836, "mean_token_accuracy": 0.7513514570891857, "num_tokens": 30956483.0, "step": 970 }, { "entropy": 0.9171620942652225, "epoch": 0.08933818666942686, "grad_norm": 0.17053432762622833, "learning_rate": 9.702517864262275e-05, "loss": 0.9262, "mean_token_accuracy": 0.7398470938205719, "num_tokens": 30988480.0, "step": 971 }, { "entropy": 0.9093360602855682, "epoch": 0.08943019304086808, "grad_norm": 0.16148212552070618, "learning_rate": 9.702211181648113e-05, "loss": 0.9246, "mean_token_accuracy": 0.7400834634900093, "num_tokens": 31019856.0, "step": 972 }, { "entropy": 0.8862450309097767, "epoch": 0.08952219941230931, "grad_norm": 0.16030707955360413, "learning_rate": 9.70190449903395e-05, "loss": 0.8896, "mean_token_accuracy": 0.7453945688903332, "num_tokens": 31052045.0, "step": 973 }, { "entropy": 0.9758000336587429, "epoch": 0.08961420578375053, "grad_norm": 0.15898574888706207, "learning_rate": 9.701597816419788e-05, "loss": 0.9842, "mean_token_accuracy": 0.7304329834878445, "num_tokens": 31083941.0, "step": 974 }, { "entropy": 0.9716283865272999, "epoch": 0.08970621215519174, "grad_norm": 0.15825632214546204, "learning_rate": 9.701291133805625e-05, "loss": 0.97, "mean_token_accuracy": 0.7302758395671844, "num_tokens": 31116068.0, "step": 975 }, { "entropy": 0.9637182056903839, "epoch": 0.08979821852663297, "grad_norm": 0.16271869838237762, "learning_rate": 9.700984451191463e-05, "loss": 0.9474, "mean_token_accuracy": 0.737514078617096, "num_tokens": 31147660.0, "step": 976 }, { "entropy": 0.9852610863745213, "epoch": 0.08989022489807419, "grad_norm": 0.16070248186588287, "learning_rate": 9.7006777685773e-05, "loss": 0.9931, "mean_token_accuracy": 0.7235134318470955, "num_tokens": 31179226.0, "step": 977 }, { "entropy": 0.9003812521696091, "epoch": 0.08998223126951542, "grad_norm": 0.1594938486814499, "learning_rate": 9.700371085963136e-05, "loss": 0.9194, "mean_token_accuracy": 0.7465169504284859, "num_tokens": 31211573.0, "step": 978 }, { "entropy": 0.9566617347300053, "epoch": 0.09007423764095664, "grad_norm": 0.16396847367286682, "learning_rate": 9.700064403348975e-05, "loss": 0.9447, "mean_token_accuracy": 0.7320454865694046, "num_tokens": 31242392.0, "step": 979 }, { "entropy": 0.936132188886404, "epoch": 0.09016624401239785, "grad_norm": 0.16580185294151306, "learning_rate": 9.699757720734813e-05, "loss": 0.9535, "mean_token_accuracy": 0.7372171021997929, "num_tokens": 31274115.0, "step": 980 }, { "entropy": 0.9733963198959827, "epoch": 0.09025825038383908, "grad_norm": 0.15742434561252594, "learning_rate": 9.69945103812065e-05, "loss": 0.9695, "mean_token_accuracy": 0.7304288670420647, "num_tokens": 31306634.0, "step": 981 }, { "entropy": 0.9539418555796146, "epoch": 0.0903502567552803, "grad_norm": 0.16396547853946686, "learning_rate": 9.699144355506486e-05, "loss": 0.9788, "mean_token_accuracy": 0.7302551195025444, "num_tokens": 31338210.0, "step": 982 }, { "entropy": 0.9622322767972946, "epoch": 0.09044226312672153, "grad_norm": 0.16082173585891724, "learning_rate": 9.698837672892324e-05, "loss": 0.9607, "mean_token_accuracy": 0.7372207976877689, "num_tokens": 31370348.0, "step": 983 }, { "entropy": 0.8344350997358561, "epoch": 0.09053426949816275, "grad_norm": 0.1532052904367447, "learning_rate": 9.698530990278161e-05, "loss": 0.8519, "mean_token_accuracy": 0.7534242309629917, "num_tokens": 31402803.0, "step": 984 }, { "entropy": 0.9055809564888477, "epoch": 0.09062627586960396, "grad_norm": 0.1572045087814331, "learning_rate": 9.698224307664e-05, "loss": 0.8988, "mean_token_accuracy": 0.7476417310535908, "num_tokens": 31435068.0, "step": 985 }, { "entropy": 0.912225678563118, "epoch": 0.0907182822410452, "grad_norm": 0.1611575037240982, "learning_rate": 9.697917625049836e-05, "loss": 0.9346, "mean_token_accuracy": 0.7391578741371632, "num_tokens": 31466455.0, "step": 986 }, { "entropy": 0.9728972613811493, "epoch": 0.09081028861248641, "grad_norm": 0.16346091032028198, "learning_rate": 9.697610942435674e-05, "loss": 0.9742, "mean_token_accuracy": 0.7236883230507374, "num_tokens": 31498083.0, "step": 987 }, { "entropy": 0.9775727540254593, "epoch": 0.09090229498392764, "grad_norm": 0.16748863458633423, "learning_rate": 9.697304259821511e-05, "loss": 0.983, "mean_token_accuracy": 0.7276958897709846, "num_tokens": 31529416.0, "step": 988 }, { "entropy": 0.9349136538803577, "epoch": 0.09099430135536886, "grad_norm": 0.15753895044326782, "learning_rate": 9.696997577207348e-05, "loss": 0.9253, "mean_token_accuracy": 0.7442970164120197, "num_tokens": 31561610.0, "step": 989 }, { "entropy": 0.9907169118523598, "epoch": 0.09108630772681008, "grad_norm": 0.1604354977607727, "learning_rate": 9.696690894593186e-05, "loss": 0.9783, "mean_token_accuracy": 0.7261944971978664, "num_tokens": 31593021.0, "step": 990 }, { "entropy": 0.919900968670845, "epoch": 0.0911783140982513, "grad_norm": 0.15658411383628845, "learning_rate": 9.696384211979024e-05, "loss": 0.9246, "mean_token_accuracy": 0.7386965937912464, "num_tokens": 31625019.0, "step": 991 }, { "entropy": 0.935480635613203, "epoch": 0.09127032046969252, "grad_norm": 0.16053679585456848, "learning_rate": 9.696077529364861e-05, "loss": 0.9399, "mean_token_accuracy": 0.734456479549408, "num_tokens": 31657015.0, "step": 992 }, { "entropy": 0.9686630330979824, "epoch": 0.09136232684113375, "grad_norm": 0.1582288295030594, "learning_rate": 9.695770846750698e-05, "loss": 0.9613, "mean_token_accuracy": 0.7333079725503922, "num_tokens": 31688965.0, "step": 993 }, { "entropy": 0.8596264086663723, "epoch": 0.09145433321257497, "grad_norm": 0.15340855717658997, "learning_rate": 9.695464164136535e-05, "loss": 0.8612, "mean_token_accuracy": 0.7520762085914612, "num_tokens": 31721733.0, "step": 994 }, { "entropy": 1.0097669586539268, "epoch": 0.09154633958401619, "grad_norm": 0.16293388605117798, "learning_rate": 9.695157481522373e-05, "loss": 1.0103, "mean_token_accuracy": 0.719074472784996, "num_tokens": 31753606.0, "step": 995 }, { "entropy": 1.0406215749680996, "epoch": 0.09163834595545742, "grad_norm": 0.16303348541259766, "learning_rate": 9.694850798908211e-05, "loss": 1.0257, "mean_token_accuracy": 0.7151807248592377, "num_tokens": 31785190.0, "step": 996 }, { "entropy": 0.9660936444997787, "epoch": 0.09173035232689863, "grad_norm": 0.16666698455810547, "learning_rate": 9.694544116294048e-05, "loss": 0.9795, "mean_token_accuracy": 0.7266343012452126, "num_tokens": 31816318.0, "step": 997 }, { "entropy": 0.9574544876813889, "epoch": 0.09182235869833986, "grad_norm": 0.16571584343910217, "learning_rate": 9.694237433679884e-05, "loss": 0.9616, "mean_token_accuracy": 0.7317477092146873, "num_tokens": 31848369.0, "step": 998 }, { "entropy": 0.9956452772021294, "epoch": 0.09191436506978108, "grad_norm": 0.16728518903255463, "learning_rate": 9.693930751065723e-05, "loss": 0.9785, "mean_token_accuracy": 0.7275924384593964, "num_tokens": 31879808.0, "step": 999 }, { "entropy": 0.9244445860385895, "epoch": 0.0920063714412223, "grad_norm": 0.16287016868591309, "learning_rate": 9.693624068451561e-05, "loss": 0.9218, "mean_token_accuracy": 0.7368968240916729, "num_tokens": 31912088.0, "step": 1000 }, { "entropy": 0.8629881627857685, "epoch": 0.09209837781266353, "grad_norm": 0.15344002842903137, "learning_rate": 9.693317385837397e-05, "loss": 0.875, "mean_token_accuracy": 0.7488552555441856, "num_tokens": 31944216.0, "step": 1001 }, { "entropy": 0.8888028115034103, "epoch": 0.09219038418410475, "grad_norm": 0.15599994361400604, "learning_rate": 9.693010703223234e-05, "loss": 0.8912, "mean_token_accuracy": 0.7515064738690853, "num_tokens": 31976447.0, "step": 1002 }, { "entropy": 0.8835399970412254, "epoch": 0.09228239055554598, "grad_norm": 0.15850293636322021, "learning_rate": 9.692704020609072e-05, "loss": 0.9004, "mean_token_accuracy": 0.7478994764387608, "num_tokens": 32008215.0, "step": 1003 }, { "entropy": 0.860474169254303, "epoch": 0.09237439692698719, "grad_norm": 0.16349774599075317, "learning_rate": 9.692397337994909e-05, "loss": 0.8884, "mean_token_accuracy": 0.7479382380843163, "num_tokens": 32040790.0, "step": 1004 }, { "entropy": 0.8956769034266472, "epoch": 0.09246640329842841, "grad_norm": 0.1614445000886917, "learning_rate": 9.692090655380747e-05, "loss": 0.8965, "mean_token_accuracy": 0.7496082931756973, "num_tokens": 32071954.0, "step": 1005 }, { "entropy": 0.9629922471940517, "epoch": 0.09255840966986964, "grad_norm": 0.1616009920835495, "learning_rate": 9.691783972766584e-05, "loss": 0.9762, "mean_token_accuracy": 0.7235319204628468, "num_tokens": 32104034.0, "step": 1006 }, { "entropy": 0.8950593881309032, "epoch": 0.09265041604131086, "grad_norm": 0.15602898597717285, "learning_rate": 9.691477290152422e-05, "loss": 0.8863, "mean_token_accuracy": 0.7516770213842392, "num_tokens": 32135981.0, "step": 1007 }, { "entropy": 0.9091406762599945, "epoch": 0.09274242241275209, "grad_norm": 0.1596544235944748, "learning_rate": 9.691170607538259e-05, "loss": 0.9087, "mean_token_accuracy": 0.7438617385923862, "num_tokens": 32167523.0, "step": 1008 }, { "entropy": 0.9169737324118614, "epoch": 0.0928344287841933, "grad_norm": 0.17722569406032562, "learning_rate": 9.690863924924096e-05, "loss": 0.9197, "mean_token_accuracy": 0.7474200092256069, "num_tokens": 32198797.0, "step": 1009 }, { "entropy": 1.0030145812779665, "epoch": 0.09292643515563452, "grad_norm": 0.16721847653388977, "learning_rate": 9.690557242309934e-05, "loss": 1.0277, "mean_token_accuracy": 0.7241777032613754, "num_tokens": 32231306.0, "step": 1010 }, { "entropy": 0.882943008095026, "epoch": 0.09301844152707575, "grad_norm": 0.15226633846759796, "learning_rate": 9.690250559695772e-05, "loss": 0.8888, "mean_token_accuracy": 0.7468382380902767, "num_tokens": 32263754.0, "step": 1011 }, { "entropy": 0.9571144878864288, "epoch": 0.09311044789851697, "grad_norm": 0.16107352077960968, "learning_rate": 9.689943877081609e-05, "loss": 0.976, "mean_token_accuracy": 0.7320382297039032, "num_tokens": 32295547.0, "step": 1012 }, { "entropy": 0.9551483504474163, "epoch": 0.0932024542699582, "grad_norm": 0.15751492977142334, "learning_rate": 9.689637194467446e-05, "loss": 0.9249, "mean_token_accuracy": 0.7424855157732964, "num_tokens": 32327522.0, "step": 1013 }, { "entropy": 0.9662023484706879, "epoch": 0.09329446064139942, "grad_norm": 0.16114582121372223, "learning_rate": 9.689330511853284e-05, "loss": 0.9503, "mean_token_accuracy": 0.7355744950473309, "num_tokens": 32359437.0, "step": 1014 }, { "entropy": 0.9885205440223217, "epoch": 0.09338646701284065, "grad_norm": 0.16707557439804077, "learning_rate": 9.68902382923912e-05, "loss": 1.0038, "mean_token_accuracy": 0.7238613702356815, "num_tokens": 32391868.0, "step": 1015 }, { "entropy": 0.936811089515686, "epoch": 0.09347847338428186, "grad_norm": 0.1547304093837738, "learning_rate": 9.688717146624959e-05, "loss": 0.9431, "mean_token_accuracy": 0.735978327691555, "num_tokens": 32424294.0, "step": 1016 }, { "entropy": 0.8488725870847702, "epoch": 0.09357047975572308, "grad_norm": 0.15775495767593384, "learning_rate": 9.688410464010796e-05, "loss": 0.8355, "mean_token_accuracy": 0.7626862078905106, "num_tokens": 32455830.0, "step": 1017 }, { "entropy": 0.9438190348446369, "epoch": 0.09366248612716431, "grad_norm": 0.1681807041168213, "learning_rate": 9.688103781396634e-05, "loss": 0.964, "mean_token_accuracy": 0.73463549092412, "num_tokens": 32487831.0, "step": 1018 }, { "entropy": 0.9804133027791977, "epoch": 0.09375449249860553, "grad_norm": 0.16500993072986603, "learning_rate": 9.68779709878247e-05, "loss": 0.9948, "mean_token_accuracy": 0.7251145020127296, "num_tokens": 32520015.0, "step": 1019 }, { "entropy": 0.9319795221090317, "epoch": 0.09384649887004676, "grad_norm": 0.1867542564868927, "learning_rate": 9.687490416168307e-05, "loss": 0.9181, "mean_token_accuracy": 0.7421147972345352, "num_tokens": 32551269.0, "step": 1020 }, { "entropy": 0.9278343692421913, "epoch": 0.09393850524148797, "grad_norm": 0.1569521576166153, "learning_rate": 9.687183733554145e-05, "loss": 0.925, "mean_token_accuracy": 0.7419033385813236, "num_tokens": 32583414.0, "step": 1021 }, { "entropy": 0.972417987883091, "epoch": 0.09403051161292919, "grad_norm": 0.16502360999584198, "learning_rate": 9.686877050939984e-05, "loss": 0.952, "mean_token_accuracy": 0.7339511848986149, "num_tokens": 32615651.0, "step": 1022 }, { "entropy": 1.0116845145821571, "epoch": 0.09412251798437042, "grad_norm": 0.1652497500181198, "learning_rate": 9.68657036832582e-05, "loss": 1.008, "mean_token_accuracy": 0.7223413996398449, "num_tokens": 32648077.0, "step": 1023 }, { "entropy": 0.9818507730960846, "epoch": 0.09421452435581164, "grad_norm": 0.16716963052749634, "learning_rate": 9.686263685711657e-05, "loss": 0.9874, "mean_token_accuracy": 0.7258833236992359, "num_tokens": 32680365.0, "step": 1024 }, { "entropy": 0.8803936950862408, "epoch": 0.09430653072725287, "grad_norm": 0.1573384404182434, "learning_rate": 9.685957003097494e-05, "loss": 0.8766, "mean_token_accuracy": 0.7523023635149002, "num_tokens": 32712321.0, "step": 1025 }, { "entropy": 0.9271412063390017, "epoch": 0.09439853709869409, "grad_norm": 0.16411113739013672, "learning_rate": 9.685650320483332e-05, "loss": 0.9248, "mean_token_accuracy": 0.7422735467553139, "num_tokens": 32743387.0, "step": 1026 }, { "entropy": 0.9524050913751125, "epoch": 0.0944905434701353, "grad_norm": 0.22662502527236938, "learning_rate": 9.68534363786917e-05, "loss": 0.953, "mean_token_accuracy": 0.7313084416091442, "num_tokens": 32775722.0, "step": 1027 }, { "entropy": 0.9947683997452259, "epoch": 0.09458254984157653, "grad_norm": 0.1656235307455063, "learning_rate": 9.685036955255007e-05, "loss": 0.9845, "mean_token_accuracy": 0.7281756065785885, "num_tokens": 32807527.0, "step": 1028 }, { "entropy": 0.9173492938280106, "epoch": 0.09467455621301775, "grad_norm": 0.16093690693378448, "learning_rate": 9.684730272640844e-05, "loss": 0.9235, "mean_token_accuracy": 0.7405849806964397, "num_tokens": 32839590.0, "step": 1029 }, { "entropy": 0.9861542209982872, "epoch": 0.09476656258445898, "grad_norm": 0.1708606779575348, "learning_rate": 9.684423590026682e-05, "loss": 1.0125, "mean_token_accuracy": 0.7231595553457737, "num_tokens": 32870792.0, "step": 1030 }, { "entropy": 1.0397276245057583, "epoch": 0.0948585689559002, "grad_norm": 0.17119857668876648, "learning_rate": 9.684116907412519e-05, "loss": 1.0524, "mean_token_accuracy": 0.7068664059042931, "num_tokens": 32902997.0, "step": 1031 }, { "entropy": 0.9507414177060127, "epoch": 0.09495057532734141, "grad_norm": 0.1637730598449707, "learning_rate": 9.683810224798357e-05, "loss": 0.9428, "mean_token_accuracy": 0.739409901201725, "num_tokens": 32935279.0, "step": 1032 }, { "entropy": 0.8370507471263409, "epoch": 0.09504258169878264, "grad_norm": 0.17573779821395874, "learning_rate": 9.683503542184194e-05, "loss": 0.8315, "mean_token_accuracy": 0.7615006566047668, "num_tokens": 32968022.0, "step": 1033 }, { "entropy": 0.8869328573346138, "epoch": 0.09513458807022386, "grad_norm": 0.17310485243797302, "learning_rate": 9.683196859570032e-05, "loss": 0.887, "mean_token_accuracy": 0.7481881231069565, "num_tokens": 32999935.0, "step": 1034 }, { "entropy": 0.9130650032311678, "epoch": 0.09522659444166509, "grad_norm": 0.15953503549098969, "learning_rate": 9.682890176955869e-05, "loss": 0.8967, "mean_token_accuracy": 0.7464870139956474, "num_tokens": 33031262.0, "step": 1035 }, { "entropy": 0.9816085286438465, "epoch": 0.09531860081310631, "grad_norm": 0.1664724349975586, "learning_rate": 9.682583494341705e-05, "loss": 0.9645, "mean_token_accuracy": 0.7292580828070641, "num_tokens": 33063018.0, "step": 1036 }, { "entropy": 0.8484234064817429, "epoch": 0.09541060718454752, "grad_norm": 0.16271883249282837, "learning_rate": 9.682276811727543e-05, "loss": 0.8514, "mean_token_accuracy": 0.7581972815096378, "num_tokens": 33094982.0, "step": 1037 }, { "entropy": 0.8872726447880268, "epoch": 0.09550261355598876, "grad_norm": 0.15918877720832825, "learning_rate": 9.681970129113382e-05, "loss": 0.9017, "mean_token_accuracy": 0.7498243227601051, "num_tokens": 33126769.0, "step": 1038 }, { "entropy": 0.9097235277295113, "epoch": 0.09559461992742997, "grad_norm": 0.1634138971567154, "learning_rate": 9.681663446499218e-05, "loss": 0.9208, "mean_token_accuracy": 0.7413439862430096, "num_tokens": 33158201.0, "step": 1039 }, { "entropy": 0.8990794476121664, "epoch": 0.0956866262988712, "grad_norm": 0.1598498672246933, "learning_rate": 9.681356763885055e-05, "loss": 0.8955, "mean_token_accuracy": 0.7434409782290459, "num_tokens": 33190317.0, "step": 1040 }, { "entropy": 0.8658686876296997, "epoch": 0.09577863267031242, "grad_norm": 0.15954849123954773, "learning_rate": 9.681050081270893e-05, "loss": 0.8835, "mean_token_accuracy": 0.7540551163256168, "num_tokens": 33222715.0, "step": 1041 }, { "entropy": 0.8142774850130081, "epoch": 0.09587063904175364, "grad_norm": 0.15088464319705963, "learning_rate": 9.680743398656731e-05, "loss": 0.8036, "mean_token_accuracy": 0.7712161093950272, "num_tokens": 33254947.0, "step": 1042 }, { "entropy": 0.9317591525614262, "epoch": 0.09596264541319487, "grad_norm": 0.16430522501468658, "learning_rate": 9.680436716042568e-05, "loss": 0.9276, "mean_token_accuracy": 0.74178671464324, "num_tokens": 33286816.0, "step": 1043 }, { "entropy": 0.922197887673974, "epoch": 0.09605465178463608, "grad_norm": 0.16266439855098724, "learning_rate": 9.680130033428405e-05, "loss": 0.9209, "mean_token_accuracy": 0.7399053052067757, "num_tokens": 33319191.0, "step": 1044 }, { "entropy": 0.8657081201672554, "epoch": 0.09614665815607731, "grad_norm": 0.16114577651023865, "learning_rate": 9.679823350814243e-05, "loss": 0.8626, "mean_token_accuracy": 0.755803506821394, "num_tokens": 33351336.0, "step": 1045 }, { "entropy": 1.0185527689754963, "epoch": 0.09623866452751853, "grad_norm": 0.1669594943523407, "learning_rate": 9.67951666820008e-05, "loss": 1.042, "mean_token_accuracy": 0.7172301560640335, "num_tokens": 33383101.0, "step": 1046 }, { "entropy": 0.8908280953764915, "epoch": 0.09633067089895975, "grad_norm": 0.15896745026111603, "learning_rate": 9.679209985585918e-05, "loss": 0.9002, "mean_token_accuracy": 0.7485417276620865, "num_tokens": 33414846.0, "step": 1047 }, { "entropy": 0.9098036773502827, "epoch": 0.09642267727040098, "grad_norm": 0.1624700129032135, "learning_rate": 9.678903302971755e-05, "loss": 0.9191, "mean_token_accuracy": 0.7450025863945484, "num_tokens": 33445968.0, "step": 1048 }, { "entropy": 0.8776053879410028, "epoch": 0.0965146836418422, "grad_norm": 0.157759428024292, "learning_rate": 9.678596620357593e-05, "loss": 0.8716, "mean_token_accuracy": 0.7503661215305328, "num_tokens": 33477663.0, "step": 1049 }, { "entropy": 0.9139085151255131, "epoch": 0.09660669001328342, "grad_norm": 0.1621224284172058, "learning_rate": 9.67828993774343e-05, "loss": 0.9135, "mean_token_accuracy": 0.7473532110452652, "num_tokens": 33509405.0, "step": 1050 }, { "entropy": 0.9733624868094921, "epoch": 0.09669869638472464, "grad_norm": 0.1676139384508133, "learning_rate": 9.677983255129267e-05, "loss": 0.9793, "mean_token_accuracy": 0.7292316779494286, "num_tokens": 33541217.0, "step": 1051 }, { "entropy": 0.8864538930356503, "epoch": 0.09679070275616586, "grad_norm": 0.15317882597446442, "learning_rate": 9.677676572515105e-05, "loss": 0.8746, "mean_token_accuracy": 0.7549472898244858, "num_tokens": 33573693.0, "step": 1052 }, { "entropy": 1.0338486805558205, "epoch": 0.09688270912760709, "grad_norm": 0.16735602915287018, "learning_rate": 9.677369889900943e-05, "loss": 1.0699, "mean_token_accuracy": 0.7064846158027649, "num_tokens": 33606121.0, "step": 1053 }, { "entropy": 0.8866732828319073, "epoch": 0.0969747154990483, "grad_norm": 0.1557445079088211, "learning_rate": 9.67706320728678e-05, "loss": 0.88, "mean_token_accuracy": 0.7527556009590626, "num_tokens": 33637879.0, "step": 1054 }, { "entropy": 0.8826326318085194, "epoch": 0.09706672187048954, "grad_norm": 0.1545235514640808, "learning_rate": 9.676756524672617e-05, "loss": 0.8658, "mean_token_accuracy": 0.7500460743904114, "num_tokens": 33669781.0, "step": 1055 }, { "entropy": 0.9689504578709602, "epoch": 0.09715872824193075, "grad_norm": 0.16593037545681, "learning_rate": 9.676449842058453e-05, "loss": 0.9747, "mean_token_accuracy": 0.7251571975648403, "num_tokens": 33701308.0, "step": 1056 }, { "entropy": 0.9733709320425987, "epoch": 0.09725073461337197, "grad_norm": 0.1710357367992401, "learning_rate": 9.676143159444291e-05, "loss": 0.9774, "mean_token_accuracy": 0.7302632331848145, "num_tokens": 33732847.0, "step": 1057 }, { "entropy": 0.9180822595953941, "epoch": 0.0973427409848132, "grad_norm": 0.1564447581768036, "learning_rate": 9.67583647683013e-05, "loss": 0.8982, "mean_token_accuracy": 0.7466649785637856, "num_tokens": 33764874.0, "step": 1058 }, { "entropy": 0.9152316823601723, "epoch": 0.09743474735625442, "grad_norm": 0.1574152261018753, "learning_rate": 9.675529794215966e-05, "loss": 0.9271, "mean_token_accuracy": 0.7390196546912193, "num_tokens": 33797307.0, "step": 1059 }, { "entropy": 0.9296806827187538, "epoch": 0.09752675372769565, "grad_norm": 0.16534656286239624, "learning_rate": 9.675223111601803e-05, "loss": 0.9528, "mean_token_accuracy": 0.7388513460755348, "num_tokens": 33829520.0, "step": 1060 }, { "entropy": 1.0560470670461655, "epoch": 0.09761876009913686, "grad_norm": 0.16798868775367737, "learning_rate": 9.674916428987641e-05, "loss": 1.0695, "mean_token_accuracy": 0.7047516629099846, "num_tokens": 33861514.0, "step": 1061 }, { "entropy": 0.8678808100521564, "epoch": 0.09771076647057808, "grad_norm": 0.15756385028362274, "learning_rate": 9.674609746373478e-05, "loss": 0.8599, "mean_token_accuracy": 0.7545629553496838, "num_tokens": 33893253.0, "step": 1062 }, { "entropy": 0.9519164338707924, "epoch": 0.09780277284201931, "grad_norm": 0.15441997349262238, "learning_rate": 9.674303063759316e-05, "loss": 0.9283, "mean_token_accuracy": 0.7379158958792686, "num_tokens": 33925567.0, "step": 1063 }, { "entropy": 0.9062401410192251, "epoch": 0.09789477921346053, "grad_norm": 0.15285854041576385, "learning_rate": 9.673996381145153e-05, "loss": 0.9016, "mean_token_accuracy": 0.7511668279767036, "num_tokens": 33957095.0, "step": 1064 }, { "entropy": 0.8826639018952847, "epoch": 0.09798678558490176, "grad_norm": 0.1611899733543396, "learning_rate": 9.673689698530991e-05, "loss": 0.8893, "mean_token_accuracy": 0.7482551038265228, "num_tokens": 33988960.0, "step": 1065 }, { "entropy": 1.0272873491048813, "epoch": 0.09807879195634298, "grad_norm": 0.17073515057563782, "learning_rate": 9.673383015916828e-05, "loss": 1.0306, "mean_token_accuracy": 0.714377149939537, "num_tokens": 34021185.0, "step": 1066 }, { "entropy": 0.9972330816090107, "epoch": 0.09817079832778419, "grad_norm": 0.1619044542312622, "learning_rate": 9.673076333302665e-05, "loss": 0.9857, "mean_token_accuracy": 0.7264757268130779, "num_tokens": 34052951.0, "step": 1067 }, { "entropy": 0.8821131717413664, "epoch": 0.09826280469922542, "grad_norm": 0.15990856289863586, "learning_rate": 9.672769650688503e-05, "loss": 0.8875, "mean_token_accuracy": 0.7503055110573769, "num_tokens": 34084016.0, "step": 1068 }, { "entropy": 0.9054156877100468, "epoch": 0.09835481107066664, "grad_norm": 0.15616628527641296, "learning_rate": 9.672462968074341e-05, "loss": 0.9124, "mean_token_accuracy": 0.7486260384321213, "num_tokens": 34116784.0, "step": 1069 }, { "entropy": 0.976450253278017, "epoch": 0.09844681744210787, "grad_norm": 0.15976481139659882, "learning_rate": 9.672156285460178e-05, "loss": 0.9535, "mean_token_accuracy": 0.7336842603981495, "num_tokens": 34149033.0, "step": 1070 }, { "entropy": 0.8957774676382542, "epoch": 0.09853882381354909, "grad_norm": 0.1565529704093933, "learning_rate": 9.671849602846015e-05, "loss": 0.887, "mean_token_accuracy": 0.7503524050116539, "num_tokens": 34180688.0, "step": 1071 }, { "entropy": 0.8924312628805637, "epoch": 0.09863083018499032, "grad_norm": 0.16206608712673187, "learning_rate": 9.671542920231853e-05, "loss": 0.8949, "mean_token_accuracy": 0.7436465509235859, "num_tokens": 34212407.0, "step": 1072 }, { "entropy": 0.8703174404799938, "epoch": 0.09872283655643153, "grad_norm": 0.15224649012088776, "learning_rate": 9.67123623761769e-05, "loss": 0.8667, "mean_token_accuracy": 0.7529569268226624, "num_tokens": 34243775.0, "step": 1073 }, { "entropy": 0.817875262349844, "epoch": 0.09881484292787275, "grad_norm": 0.165665864944458, "learning_rate": 9.670929555003528e-05, "loss": 0.8115, "mean_token_accuracy": 0.7664502784609795, "num_tokens": 34275426.0, "step": 1074 }, { "entropy": 1.0160892121493816, "epoch": 0.09890684929931398, "grad_norm": 0.16657552123069763, "learning_rate": 9.670622872389364e-05, "loss": 1.031, "mean_token_accuracy": 0.7158407270908356, "num_tokens": 34307552.0, "step": 1075 }, { "entropy": 0.9705043807625771, "epoch": 0.0989988556707552, "grad_norm": 0.1613999903202057, "learning_rate": 9.670316189775203e-05, "loss": 0.9713, "mean_token_accuracy": 0.7268971800804138, "num_tokens": 34339041.0, "step": 1076 }, { "entropy": 0.8460965864360332, "epoch": 0.09909086204219643, "grad_norm": 0.15994155406951904, "learning_rate": 9.67000950716104e-05, "loss": 0.8633, "mean_token_accuracy": 0.755526214838028, "num_tokens": 34371474.0, "step": 1077 }, { "entropy": 0.9997069947421551, "epoch": 0.09918286841363765, "grad_norm": 0.16577109694480896, "learning_rate": 9.669702824546876e-05, "loss": 1.0158, "mean_token_accuracy": 0.7151198834180832, "num_tokens": 34403139.0, "step": 1078 }, { "entropy": 0.8220634870231152, "epoch": 0.09927487478507886, "grad_norm": 0.15536828339099884, "learning_rate": 9.669396141932714e-05, "loss": 0.8613, "mean_token_accuracy": 0.7651693262159824, "num_tokens": 34435635.0, "step": 1079 }, { "entropy": 0.9301723409444094, "epoch": 0.09936688115652009, "grad_norm": 0.15812771022319794, "learning_rate": 9.669089459318552e-05, "loss": 0.9312, "mean_token_accuracy": 0.7425216287374496, "num_tokens": 34467666.0, "step": 1080 }, { "entropy": 0.8817839231342077, "epoch": 0.09945888752796131, "grad_norm": 0.15515027940273285, "learning_rate": 9.668782776704389e-05, "loss": 0.8887, "mean_token_accuracy": 0.7482687644660473, "num_tokens": 34499544.0, "step": 1081 }, { "entropy": 0.9201575219631195, "epoch": 0.09955089389940254, "grad_norm": 0.1571827083826065, "learning_rate": 9.668476094090226e-05, "loss": 0.9073, "mean_token_accuracy": 0.7487991563975811, "num_tokens": 34531369.0, "step": 1082 }, { "entropy": 0.9239728301763535, "epoch": 0.09964290027084376, "grad_norm": 0.15828335285186768, "learning_rate": 9.668169411476063e-05, "loss": 0.9118, "mean_token_accuracy": 0.7416358850896358, "num_tokens": 34563212.0, "step": 1083 }, { "entropy": 0.9013906978070736, "epoch": 0.09973490664228497, "grad_norm": 0.1541551798582077, "learning_rate": 9.667862728861902e-05, "loss": 0.8786, "mean_token_accuracy": 0.7491864114999771, "num_tokens": 34595265.0, "step": 1084 }, { "entropy": 1.0174082405865192, "epoch": 0.0998269130137262, "grad_norm": 0.16384847462177277, "learning_rate": 9.667556046247739e-05, "loss": 1.0052, "mean_token_accuracy": 0.7226257584989071, "num_tokens": 34627456.0, "step": 1085 }, { "entropy": 1.0035100504755974, "epoch": 0.09991891938516742, "grad_norm": 0.16659247875213623, "learning_rate": 9.667249363633576e-05, "loss": 1.0145, "mean_token_accuracy": 0.7195708006620407, "num_tokens": 34659294.0, "step": 1086 }, { "entropy": 0.8904071226716042, "epoch": 0.10001092575660865, "grad_norm": 0.1593467742204666, "learning_rate": 9.666942681019413e-05, "loss": 0.8984, "mean_token_accuracy": 0.7446462102234364, "num_tokens": 34690983.0, "step": 1087 }, { "entropy": 0.9790074042975903, "epoch": 0.10010293212804987, "grad_norm": 0.1585438996553421, "learning_rate": 9.666635998405251e-05, "loss": 0.992, "mean_token_accuracy": 0.7231258042156696, "num_tokens": 34722864.0, "step": 1088 }, { "entropy": 0.9666843581944704, "epoch": 0.10019493849949108, "grad_norm": 0.16131551563739777, "learning_rate": 9.666329315791089e-05, "loss": 0.955, "mean_token_accuracy": 0.7351276576519012, "num_tokens": 34754897.0, "step": 1089 }, { "entropy": 0.8937724698334932, "epoch": 0.10028694487093232, "grad_norm": 0.15138773620128632, "learning_rate": 9.666022633176926e-05, "loss": 0.8664, "mean_token_accuracy": 0.753471415489912, "num_tokens": 34786436.0, "step": 1090 }, { "entropy": 0.9003929756581783, "epoch": 0.10037895124237353, "grad_norm": 0.15860742330551147, "learning_rate": 9.665715950562763e-05, "loss": 0.8983, "mean_token_accuracy": 0.7465070001780987, "num_tokens": 34817508.0, "step": 1091 }, { "entropy": 0.9523097351193428, "epoch": 0.10047095761381476, "grad_norm": 0.16087223589420319, "learning_rate": 9.6654092679486e-05, "loss": 0.9588, "mean_token_accuracy": 0.7335548102855682, "num_tokens": 34849829.0, "step": 1092 }, { "entropy": 0.9897637516260147, "epoch": 0.10056296398525598, "grad_norm": 0.1690727174282074, "learning_rate": 9.665102585334437e-05, "loss": 1.0142, "mean_token_accuracy": 0.7204057015478611, "num_tokens": 34881166.0, "step": 1093 }, { "entropy": 0.959464754909277, "epoch": 0.1006549703566972, "grad_norm": 0.1661749929189682, "learning_rate": 9.664795902720276e-05, "loss": 0.9709, "mean_token_accuracy": 0.7302238345146179, "num_tokens": 34912777.0, "step": 1094 }, { "entropy": 0.9007907155901194, "epoch": 0.10074697672813843, "grad_norm": 0.17002630233764648, "learning_rate": 9.664489220106112e-05, "loss": 0.8841, "mean_token_accuracy": 0.7535837031900883, "num_tokens": 34945307.0, "step": 1095 }, { "entropy": 0.9063800685107708, "epoch": 0.10083898309957964, "grad_norm": 0.15781642496585846, "learning_rate": 9.66418253749195e-05, "loss": 0.9032, "mean_token_accuracy": 0.749104131013155, "num_tokens": 34977263.0, "step": 1096 }, { "entropy": 0.908812876790762, "epoch": 0.10093098947102087, "grad_norm": 0.16161276400089264, "learning_rate": 9.663875854877787e-05, "loss": 0.9303, "mean_token_accuracy": 0.7401559688150883, "num_tokens": 35009319.0, "step": 1097 }, { "entropy": 0.9026827737689018, "epoch": 0.10102299584246209, "grad_norm": 0.15920984745025635, "learning_rate": 9.663569172263624e-05, "loss": 0.916, "mean_token_accuracy": 0.7485790550708771, "num_tokens": 35041570.0, "step": 1098 }, { "entropy": 0.956053651869297, "epoch": 0.10111500221390331, "grad_norm": 0.16887539625167847, "learning_rate": 9.663262489649462e-05, "loss": 0.977, "mean_token_accuracy": 0.7279412932693958, "num_tokens": 35073557.0, "step": 1099 }, { "entropy": 0.8551238477230072, "epoch": 0.10120700858534454, "grad_norm": 0.15822964906692505, "learning_rate": 9.6629558070353e-05, "loss": 0.8387, "mean_token_accuracy": 0.7585063502192497, "num_tokens": 35105422.0, "step": 1100 }, { "entropy": 0.8338537495583296, "epoch": 0.10129901495678575, "grad_norm": 0.15613920986652374, "learning_rate": 9.662649124421137e-05, "loss": 0.8587, "mean_token_accuracy": 0.7573117949068546, "num_tokens": 35137190.0, "step": 1101 }, { "entropy": 0.9067161530256271, "epoch": 0.10139102132822699, "grad_norm": 0.16520637273788452, "learning_rate": 9.662342441806974e-05, "loss": 0.9306, "mean_token_accuracy": 0.7347854487597942, "num_tokens": 35169174.0, "step": 1102 }, { "entropy": 0.9459751918911934, "epoch": 0.1014830276996682, "grad_norm": 0.16897724568843842, "learning_rate": 9.662035759192812e-05, "loss": 0.9673, "mean_token_accuracy": 0.7290536165237427, "num_tokens": 35200896.0, "step": 1103 }, { "entropy": 0.8430897425860167, "epoch": 0.10157503407110942, "grad_norm": 0.1533231884241104, "learning_rate": 9.661729076578649e-05, "loss": 0.8463, "mean_token_accuracy": 0.7605555765330791, "num_tokens": 35233362.0, "step": 1104 }, { "entropy": 0.9403893984854221, "epoch": 0.10166704044255065, "grad_norm": 0.15612873435020447, "learning_rate": 9.661422393964487e-05, "loss": 0.9547, "mean_token_accuracy": 0.7400345988571644, "num_tokens": 35265812.0, "step": 1105 }, { "entropy": 1.0277419053018093, "epoch": 0.10175904681399187, "grad_norm": 0.17066191136837006, "learning_rate": 9.661115711350324e-05, "loss": 1.0418, "mean_token_accuracy": 0.7106143981218338, "num_tokens": 35297444.0, "step": 1106 }, { "entropy": 0.9457535222172737, "epoch": 0.1018510531854331, "grad_norm": 0.15654437243938446, "learning_rate": 9.660809028736162e-05, "loss": 0.9239, "mean_token_accuracy": 0.7407226487994194, "num_tokens": 35330015.0, "step": 1107 }, { "entropy": 0.9294662438333035, "epoch": 0.10194305955687431, "grad_norm": 0.1531471461057663, "learning_rate": 9.660502346121999e-05, "loss": 0.8924, "mean_token_accuracy": 0.7504142187535763, "num_tokens": 35361049.0, "step": 1108 }, { "entropy": 0.9033985212445259, "epoch": 0.10203506592831553, "grad_norm": 0.15580113232135773, "learning_rate": 9.660195663507836e-05, "loss": 0.8816, "mean_token_accuracy": 0.7505446337163448, "num_tokens": 35393274.0, "step": 1109 }, { "entropy": 0.9048357978463173, "epoch": 0.10212707229975676, "grad_norm": 0.1531599909067154, "learning_rate": 9.659888980893674e-05, "loss": 0.8848, "mean_token_accuracy": 0.7556491568684578, "num_tokens": 35424654.0, "step": 1110 }, { "entropy": 0.9034750461578369, "epoch": 0.10221907867119798, "grad_norm": 0.15479497611522675, "learning_rate": 9.659582298279512e-05, "loss": 0.881, "mean_token_accuracy": 0.7480965480208397, "num_tokens": 35456567.0, "step": 1111 }, { "entropy": 0.8956337310373783, "epoch": 0.10231108504263921, "grad_norm": 0.15655048191547394, "learning_rate": 9.659275615665349e-05, "loss": 0.9083, "mean_token_accuracy": 0.7485470101237297, "num_tokens": 35489103.0, "step": 1112 }, { "entropy": 0.9457507394254208, "epoch": 0.10240309141408042, "grad_norm": 0.1576923429965973, "learning_rate": 9.658968933051185e-05, "loss": 0.9557, "mean_token_accuracy": 0.735408890992403, "num_tokens": 35521030.0, "step": 1113 }, { "entropy": 0.9384334124624729, "epoch": 0.10249509778552164, "grad_norm": 0.16467717289924622, "learning_rate": 9.658662250437022e-05, "loss": 0.9568, "mean_token_accuracy": 0.7333705574274063, "num_tokens": 35552232.0, "step": 1114 }, { "entropy": 0.82656304910779, "epoch": 0.10258710415696287, "grad_norm": 0.15733087062835693, "learning_rate": 9.65835556782286e-05, "loss": 0.8247, "mean_token_accuracy": 0.7590740993618965, "num_tokens": 35583698.0, "step": 1115 }, { "entropy": 0.9833521023392677, "epoch": 0.10267911052840409, "grad_norm": 0.1641973853111267, "learning_rate": 9.658048885208698e-05, "loss": 1.0147, "mean_token_accuracy": 0.7188589200377464, "num_tokens": 35614878.0, "step": 1116 }, { "entropy": 0.8835620544850826, "epoch": 0.10277111689984532, "grad_norm": 0.15869088470935822, "learning_rate": 9.657742202594535e-05, "loss": 0.8875, "mean_token_accuracy": 0.7516782358288765, "num_tokens": 35647207.0, "step": 1117 }, { "entropy": 0.9517400711774826, "epoch": 0.10286312327128654, "grad_norm": 0.1626524031162262, "learning_rate": 9.657435519980372e-05, "loss": 0.9685, "mean_token_accuracy": 0.7301286123692989, "num_tokens": 35679324.0, "step": 1118 }, { "entropy": 0.9061287343502045, "epoch": 0.10295512964272775, "grad_norm": 0.16136522591114044, "learning_rate": 9.65712883736621e-05, "loss": 0.9052, "mean_token_accuracy": 0.7399870231747627, "num_tokens": 35709638.0, "step": 1119 }, { "entropy": 0.9113659039139748, "epoch": 0.10304713601416898, "grad_norm": 0.15852506458759308, "learning_rate": 9.656822154752048e-05, "loss": 0.9191, "mean_token_accuracy": 0.742094062268734, "num_tokens": 35741210.0, "step": 1120 }, { "entropy": 1.0113764591515064, "epoch": 0.1031391423856102, "grad_norm": 0.16707167029380798, "learning_rate": 9.656515472137885e-05, "loss": 1.0138, "mean_token_accuracy": 0.7160374745726585, "num_tokens": 35772957.0, "step": 1121 }, { "entropy": 0.9776623621582985, "epoch": 0.10323114875705143, "grad_norm": 0.24139249324798584, "learning_rate": 9.656208789523722e-05, "loss": 0.9722, "mean_token_accuracy": 0.7255499921739101, "num_tokens": 35804624.0, "step": 1122 }, { "entropy": 0.8269810415804386, "epoch": 0.10332315512849265, "grad_norm": 0.15414750576019287, "learning_rate": 9.65590210690956e-05, "loss": 0.8327, "mean_token_accuracy": 0.765818364918232, "num_tokens": 35836744.0, "step": 1123 }, { "entropy": 0.7696375567466021, "epoch": 0.10341516149993386, "grad_norm": 0.1514318585395813, "learning_rate": 9.655595424295397e-05, "loss": 0.7736, "mean_token_accuracy": 0.7792934477329254, "num_tokens": 35868888.0, "step": 1124 }, { "entropy": 0.9165477007627487, "epoch": 0.1035071678713751, "grad_norm": 0.1574585735797882, "learning_rate": 9.655288741681235e-05, "loss": 0.8817, "mean_token_accuracy": 0.7515552639961243, "num_tokens": 35900505.0, "step": 1125 }, { "entropy": 0.93998783826828, "epoch": 0.10359917424281631, "grad_norm": 0.16181664168834686, "learning_rate": 9.654982059067072e-05, "loss": 0.9158, "mean_token_accuracy": 0.7416956163942814, "num_tokens": 35933020.0, "step": 1126 }, { "entropy": 0.8888120427727699, "epoch": 0.10369118061425754, "grad_norm": 0.15146636962890625, "learning_rate": 9.65467537645291e-05, "loss": 0.8702, "mean_token_accuracy": 0.7530062273144722, "num_tokens": 35965251.0, "step": 1127 }, { "entropy": 0.9545511826872826, "epoch": 0.10378318698569876, "grad_norm": 0.16361840069293976, "learning_rate": 9.654368693838747e-05, "loss": 0.9426, "mean_token_accuracy": 0.7365666106343269, "num_tokens": 35996389.0, "step": 1128 }, { "entropy": 0.8557638861238956, "epoch": 0.10387519335713999, "grad_norm": 0.16363433003425598, "learning_rate": 9.654062011224583e-05, "loss": 0.8516, "mean_token_accuracy": 0.7548157721757889, "num_tokens": 36027510.0, "step": 1129 }, { "entropy": 0.8681304268538952, "epoch": 0.1039671997285812, "grad_norm": 0.16204281151294708, "learning_rate": 9.653755328610422e-05, "loss": 0.8938, "mean_token_accuracy": 0.7480642050504684, "num_tokens": 36058249.0, "step": 1130 }, { "entropy": 0.9061204828321934, "epoch": 0.10405920610002242, "grad_norm": 0.16870051622390747, "learning_rate": 9.65344864599626e-05, "loss": 0.9272, "mean_token_accuracy": 0.7406693212687969, "num_tokens": 36089904.0, "step": 1131 }, { "entropy": 0.8978628180921078, "epoch": 0.10415121247146365, "grad_norm": 0.2717898190021515, "learning_rate": 9.653141963382097e-05, "loss": 0.9002, "mean_token_accuracy": 0.7447415627539158, "num_tokens": 36121509.0, "step": 1132 }, { "entropy": 0.9479461200535297, "epoch": 0.10424321884290487, "grad_norm": 0.16139201819896698, "learning_rate": 9.652835280767933e-05, "loss": 0.9532, "mean_token_accuracy": 0.7297844812273979, "num_tokens": 36152996.0, "step": 1133 }, { "entropy": 0.8584220185875893, "epoch": 0.1043352252143461, "grad_norm": 0.15595276653766632, "learning_rate": 9.652528598153771e-05, "loss": 0.8545, "mean_token_accuracy": 0.757264468818903, "num_tokens": 36185554.0, "step": 1134 }, { "entropy": 0.8959417846053839, "epoch": 0.10442723158578732, "grad_norm": 0.16639848053455353, "learning_rate": 9.652221915539608e-05, "loss": 0.8955, "mean_token_accuracy": 0.7450969852507114, "num_tokens": 36217117.0, "step": 1135 }, { "entropy": 0.8949821796268225, "epoch": 0.10451923795722853, "grad_norm": 0.16121737658977509, "learning_rate": 9.651915232925446e-05, "loss": 0.9081, "mean_token_accuracy": 0.7438309378921986, "num_tokens": 36249429.0, "step": 1136 }, { "entropy": 0.8880996480584145, "epoch": 0.10461124432866976, "grad_norm": 0.1555497944355011, "learning_rate": 9.651608550311283e-05, "loss": 0.8868, "mean_token_accuracy": 0.7501143775880337, "num_tokens": 36281270.0, "step": 1137 }, { "entropy": 0.8846673518419266, "epoch": 0.10470325070011098, "grad_norm": 0.16152282059192657, "learning_rate": 9.651301867697121e-05, "loss": 0.8851, "mean_token_accuracy": 0.7479728311300278, "num_tokens": 36313014.0, "step": 1138 }, { "entropy": 0.9909635446965694, "epoch": 0.10479525707155221, "grad_norm": 0.18244989216327667, "learning_rate": 9.650995185082958e-05, "loss": 0.9985, "mean_token_accuracy": 0.7193295061588287, "num_tokens": 36344775.0, "step": 1139 }, { "entropy": 0.8116722833365202, "epoch": 0.10488726344299343, "grad_norm": 0.1561717987060547, "learning_rate": 9.650688502468795e-05, "loss": 0.8232, "mean_token_accuracy": 0.7624444738030434, "num_tokens": 36377368.0, "step": 1140 }, { "entropy": 0.962451845407486, "epoch": 0.10497926981443464, "grad_norm": 0.16757145524024963, "learning_rate": 9.650381819854633e-05, "loss": 0.9895, "mean_token_accuracy": 0.7306251116096973, "num_tokens": 36409033.0, "step": 1141 }, { "entropy": 0.8374790716916323, "epoch": 0.10507127618587588, "grad_norm": 0.15268345177173615, "learning_rate": 9.650075137240471e-05, "loss": 0.8403, "mean_token_accuracy": 0.7610041983425617, "num_tokens": 36441629.0, "step": 1142 }, { "entropy": 0.8009271528571844, "epoch": 0.10516328255731709, "grad_norm": 0.15544068813323975, "learning_rate": 9.649768454626308e-05, "loss": 0.8178, "mean_token_accuracy": 0.7638004496693611, "num_tokens": 36473992.0, "step": 1143 }, { "entropy": 0.918566320091486, "epoch": 0.10525528892875832, "grad_norm": 0.16062887012958527, "learning_rate": 9.649461772012145e-05, "loss": 0.9113, "mean_token_accuracy": 0.7453842647373676, "num_tokens": 36505679.0, "step": 1144 }, { "entropy": 0.8723691739141941, "epoch": 0.10534729530019954, "grad_norm": 0.16232752799987793, "learning_rate": 9.649155089397982e-05, "loss": 0.8595, "mean_token_accuracy": 0.7579716853797436, "num_tokens": 36537351.0, "step": 1145 }, { "entropy": 0.9807293154299259, "epoch": 0.10543930167164076, "grad_norm": 0.17774683237075806, "learning_rate": 9.64884840678382e-05, "loss": 0.9835, "mean_token_accuracy": 0.7251734808087349, "num_tokens": 36568764.0, "step": 1146 }, { "entropy": 0.9323286805301905, "epoch": 0.10553130804308199, "grad_norm": 0.1614963263273239, "learning_rate": 9.648541724169658e-05, "loss": 0.9247, "mean_token_accuracy": 0.7368593029677868, "num_tokens": 36600905.0, "step": 1147 }, { "entropy": 0.8306343927979469, "epoch": 0.1056233144145232, "grad_norm": 0.15686990320682526, "learning_rate": 9.648235041555495e-05, "loss": 0.8187, "mean_token_accuracy": 0.7701854668557644, "num_tokens": 36632643.0, "step": 1148 }, { "entropy": 0.8811053596436977, "epoch": 0.10571532078596443, "grad_norm": 0.1646854132413864, "learning_rate": 9.647928358941331e-05, "loss": 0.8994, "mean_token_accuracy": 0.7448853179812431, "num_tokens": 36664486.0, "step": 1149 }, { "entropy": 0.8647363968193531, "epoch": 0.10580732715740565, "grad_norm": 0.15757900476455688, "learning_rate": 9.64762167632717e-05, "loss": 0.8676, "mean_token_accuracy": 0.7621036171913147, "num_tokens": 36696515.0, "step": 1150 }, { "entropy": 0.992485873401165, "epoch": 0.10589933352884687, "grad_norm": 0.16723927855491638, "learning_rate": 9.647314993713006e-05, "loss": 0.9842, "mean_token_accuracy": 0.7219220995903015, "num_tokens": 36728221.0, "step": 1151 }, { "entropy": 0.9119985029101372, "epoch": 0.1059913399002881, "grad_norm": 0.15609526634216309, "learning_rate": 9.647008311098844e-05, "loss": 0.8892, "mean_token_accuracy": 0.7492692843079567, "num_tokens": 36760176.0, "step": 1152 }, { "entropy": 0.9725981503725052, "epoch": 0.10608334627172931, "grad_norm": 0.1750059425830841, "learning_rate": 9.646701628484681e-05, "loss": 0.9895, "mean_token_accuracy": 0.7284197695553303, "num_tokens": 36792372.0, "step": 1153 }, { "entropy": 0.8699761964380741, "epoch": 0.10617535264317055, "grad_norm": 0.16103379428386688, "learning_rate": 9.64639494587052e-05, "loss": 0.8832, "mean_token_accuracy": 0.7475852482020855, "num_tokens": 36824450.0, "step": 1154 }, { "entropy": 0.9101373143494129, "epoch": 0.10626735901461176, "grad_norm": 0.1653328537940979, "learning_rate": 9.646088263256356e-05, "loss": 0.9156, "mean_token_accuracy": 0.7380640543997288, "num_tokens": 36856695.0, "step": 1155 }, { "entropy": 0.8482017517089844, "epoch": 0.10635936538605298, "grad_norm": 0.1592244803905487, "learning_rate": 9.645781580642193e-05, "loss": 0.8425, "mean_token_accuracy": 0.7571935392916203, "num_tokens": 36888373.0, "step": 1156 }, { "entropy": 0.9492213726043701, "epoch": 0.10645137175749421, "grad_norm": 0.16343535482883453, "learning_rate": 9.645474898028031e-05, "loss": 0.9502, "mean_token_accuracy": 0.7316171824932098, "num_tokens": 36919868.0, "step": 1157 }, { "entropy": 0.9440405517816544, "epoch": 0.10654337812893543, "grad_norm": 0.16608335077762604, "learning_rate": 9.645168215413869e-05, "loss": 0.9754, "mean_token_accuracy": 0.7324131540954113, "num_tokens": 36951911.0, "step": 1158 }, { "entropy": 0.9583054333925247, "epoch": 0.10663538450037666, "grad_norm": 0.1622367799282074, "learning_rate": 9.644861532799706e-05, "loss": 0.9587, "mean_token_accuracy": 0.7319944314658642, "num_tokens": 36984530.0, "step": 1159 }, { "entropy": 0.868174958974123, "epoch": 0.10672739087181787, "grad_norm": 0.157622829079628, "learning_rate": 9.644554850185543e-05, "loss": 0.8731, "mean_token_accuracy": 0.7521060034632683, "num_tokens": 37017181.0, "step": 1160 }, { "entropy": 0.9422637708485126, "epoch": 0.10681939724325909, "grad_norm": 0.16432589292526245, "learning_rate": 9.644248167571381e-05, "loss": 0.9224, "mean_token_accuracy": 0.7373744137585163, "num_tokens": 37048535.0, "step": 1161 }, { "entropy": 0.9234974272549152, "epoch": 0.10691140361470032, "grad_norm": 0.16373319923877716, "learning_rate": 9.643941484957219e-05, "loss": 0.9346, "mean_token_accuracy": 0.7404068410396576, "num_tokens": 37079810.0, "step": 1162 }, { "entropy": 0.9439622424542904, "epoch": 0.10700340998614154, "grad_norm": 0.163079634308815, "learning_rate": 9.643634802343056e-05, "loss": 0.9431, "mean_token_accuracy": 0.7391014732420444, "num_tokens": 37112039.0, "step": 1163 }, { "entropy": 0.8304878268390894, "epoch": 0.10709541635758277, "grad_norm": 0.15716643631458282, "learning_rate": 9.643328119728893e-05, "loss": 0.8298, "mean_token_accuracy": 0.7615072317421436, "num_tokens": 37143681.0, "step": 1164 }, { "entropy": 0.9277613312005997, "epoch": 0.10718742272902398, "grad_norm": 0.16060766577720642, "learning_rate": 9.643021437114731e-05, "loss": 0.9065, "mean_token_accuracy": 0.7429410293698311, "num_tokens": 37174208.0, "step": 1165 }, { "entropy": 0.9364616386592388, "epoch": 0.1072794291004652, "grad_norm": 0.16461218893527985, "learning_rate": 9.642714754500568e-05, "loss": 0.9367, "mean_token_accuracy": 0.7390764616429806, "num_tokens": 37206827.0, "step": 1166 }, { "entropy": 0.9196576457470655, "epoch": 0.10737143547190643, "grad_norm": 0.16141366958618164, "learning_rate": 9.642408071886406e-05, "loss": 0.9205, "mean_token_accuracy": 0.7377213537693024, "num_tokens": 37238894.0, "step": 1167 }, { "entropy": 1.0235708802938461, "epoch": 0.10746344184334765, "grad_norm": 0.1670745611190796, "learning_rate": 9.642101389272243e-05, "loss": 1.0262, "mean_token_accuracy": 0.7184600159525871, "num_tokens": 37271310.0, "step": 1168 }, { "entropy": 0.7872585002332926, "epoch": 0.10755544821478888, "grad_norm": 0.15099723637104034, "learning_rate": 9.641794706658081e-05, "loss": 0.8028, "mean_token_accuracy": 0.7691438607871532, "num_tokens": 37304078.0, "step": 1169 }, { "entropy": 0.9138952381908894, "epoch": 0.1076474545862301, "grad_norm": 0.15415091812610626, "learning_rate": 9.641488024043917e-05, "loss": 0.9013, "mean_token_accuracy": 0.7451988831162453, "num_tokens": 37336432.0, "step": 1170 }, { "entropy": 0.9151985794305801, "epoch": 0.10773946095767131, "grad_norm": 0.15855877101421356, "learning_rate": 9.641181341429754e-05, "loss": 0.9046, "mean_token_accuracy": 0.7472184859216213, "num_tokens": 37368392.0, "step": 1171 }, { "entropy": 0.8853078465908766, "epoch": 0.10783146732911254, "grad_norm": 0.16170835494995117, "learning_rate": 9.640874658815592e-05, "loss": 0.9041, "mean_token_accuracy": 0.7445632927119732, "num_tokens": 37400677.0, "step": 1172 }, { "entropy": 0.8597267027944326, "epoch": 0.10792347370055376, "grad_norm": 0.166159525513649, "learning_rate": 9.64056797620143e-05, "loss": 0.8734, "mean_token_accuracy": 0.7534822970628738, "num_tokens": 37432620.0, "step": 1173 }, { "entropy": 0.9492680914700031, "epoch": 0.10801548007199499, "grad_norm": 0.16760988533496857, "learning_rate": 9.640261293587267e-05, "loss": 0.9736, "mean_token_accuracy": 0.7311322875320911, "num_tokens": 37464018.0, "step": 1174 }, { "entropy": 0.8578727580606937, "epoch": 0.10810748644343621, "grad_norm": 0.16266760230064392, "learning_rate": 9.639954610973104e-05, "loss": 0.8571, "mean_token_accuracy": 0.758011557161808, "num_tokens": 37495672.0, "step": 1175 }, { "entropy": 0.8890331462025642, "epoch": 0.10819949281487742, "grad_norm": 0.16001437604427338, "learning_rate": 9.639647928358941e-05, "loss": 0.8901, "mean_token_accuracy": 0.7485282197594643, "num_tokens": 37527105.0, "step": 1176 }, { "entropy": 0.9647010564804077, "epoch": 0.10829149918631865, "grad_norm": 0.16460822522640228, "learning_rate": 9.639341245744779e-05, "loss": 0.9489, "mean_token_accuracy": 0.7372633032500744, "num_tokens": 37558924.0, "step": 1177 }, { "entropy": 1.033889513462782, "epoch": 0.10838350555775987, "grad_norm": 0.16659210622310638, "learning_rate": 9.639034563130617e-05, "loss": 1.025, "mean_token_accuracy": 0.7165649831295013, "num_tokens": 37590682.0, "step": 1178 }, { "entropy": 1.024806346744299, "epoch": 0.1084755119292011, "grad_norm": 0.1633300483226776, "learning_rate": 9.638727880516454e-05, "loss": 1.0264, "mean_token_accuracy": 0.7159375883638859, "num_tokens": 37622737.0, "step": 1179 }, { "entropy": 0.9304421618580818, "epoch": 0.10856751830064232, "grad_norm": 0.15979604423046112, "learning_rate": 9.638421197902291e-05, "loss": 0.9211, "mean_token_accuracy": 0.7414129972457886, "num_tokens": 37654693.0, "step": 1180 }, { "entropy": 0.9538629502058029, "epoch": 0.10865952467208354, "grad_norm": 0.15762676298618317, "learning_rate": 9.638114515288129e-05, "loss": 0.9313, "mean_token_accuracy": 0.7405924797058105, "num_tokens": 37687044.0, "step": 1181 }, { "entropy": 0.8385770544409752, "epoch": 0.10875153104352477, "grad_norm": 0.15908768773078918, "learning_rate": 9.637807832673966e-05, "loss": 0.8366, "mean_token_accuracy": 0.7593835964798927, "num_tokens": 37717953.0, "step": 1182 }, { "entropy": 0.8700844012200832, "epoch": 0.10884353741496598, "grad_norm": 0.16258792579174042, "learning_rate": 9.637501150059804e-05, "loss": 0.8872, "mean_token_accuracy": 0.7474203854799271, "num_tokens": 37749844.0, "step": 1183 }, { "entropy": 0.9191421903669834, "epoch": 0.10893554378640721, "grad_norm": 0.1625436693429947, "learning_rate": 9.63719446744564e-05, "loss": 0.9557, "mean_token_accuracy": 0.7369426377117634, "num_tokens": 37781798.0, "step": 1184 }, { "entropy": 0.8815950453281403, "epoch": 0.10902755015784843, "grad_norm": 0.15976464748382568, "learning_rate": 9.636887784831479e-05, "loss": 0.8858, "mean_token_accuracy": 0.7485115937888622, "num_tokens": 37813935.0, "step": 1185 }, { "entropy": 0.9487125314772129, "epoch": 0.10911955652928966, "grad_norm": 0.16349990665912628, "learning_rate": 9.636581102217316e-05, "loss": 0.9678, "mean_token_accuracy": 0.7307746522128582, "num_tokens": 37846422.0, "step": 1186 }, { "entropy": 0.9389483779668808, "epoch": 0.10921156290073088, "grad_norm": 0.16426877677440643, "learning_rate": 9.636274419603152e-05, "loss": 0.9484, "mean_token_accuracy": 0.7360130548477173, "num_tokens": 37878200.0, "step": 1187 }, { "entropy": 0.8950897268950939, "epoch": 0.1093035692721721, "grad_norm": 0.16332906484603882, "learning_rate": 9.63596773698899e-05, "loss": 0.8917, "mean_token_accuracy": 0.7537476047873497, "num_tokens": 37910448.0, "step": 1188 }, { "entropy": 0.8959545940160751, "epoch": 0.10939557564361332, "grad_norm": 0.17104771733283997, "learning_rate": 9.635661054374829e-05, "loss": 0.8937, "mean_token_accuracy": 0.7442556731402874, "num_tokens": 37942282.0, "step": 1189 }, { "entropy": 0.9303874671459198, "epoch": 0.10948758201505454, "grad_norm": 0.16186782717704773, "learning_rate": 9.635354371760665e-05, "loss": 0.9164, "mean_token_accuracy": 0.7406597584486008, "num_tokens": 37973958.0, "step": 1190 }, { "entropy": 0.924135372042656, "epoch": 0.10957958838649577, "grad_norm": 0.15974308550357819, "learning_rate": 9.635047689146502e-05, "loss": 0.9065, "mean_token_accuracy": 0.7446037232875824, "num_tokens": 38005708.0, "step": 1191 }, { "entropy": 0.8299891129136086, "epoch": 0.10967159475793699, "grad_norm": 0.15791286528110504, "learning_rate": 9.63474100653234e-05, "loss": 0.8321, "mean_token_accuracy": 0.7613086141645908, "num_tokens": 38038396.0, "step": 1192 }, { "entropy": 0.8359809089452028, "epoch": 0.1097636011293782, "grad_norm": 0.15945649147033691, "learning_rate": 9.634434323918177e-05, "loss": 0.8415, "mean_token_accuracy": 0.7634959109127522, "num_tokens": 38070026.0, "step": 1193 }, { "entropy": 0.9454305730760098, "epoch": 0.10985560750081944, "grad_norm": 0.16911645233631134, "learning_rate": 9.634127641304015e-05, "loss": 0.9543, "mean_token_accuracy": 0.7351836785674095, "num_tokens": 38102014.0, "step": 1194 }, { "entropy": 0.8455300014466047, "epoch": 0.10994761387226065, "grad_norm": 0.15199436247348785, "learning_rate": 9.633820958689852e-05, "loss": 0.8417, "mean_token_accuracy": 0.7604790925979614, "num_tokens": 38133884.0, "step": 1195 }, { "entropy": 0.8646016959100962, "epoch": 0.11003962024370188, "grad_norm": 0.1596190184354782, "learning_rate": 9.63351427607569e-05, "loss": 0.8474, "mean_token_accuracy": 0.760076604783535, "num_tokens": 38165787.0, "step": 1196 }, { "entropy": 0.9365963451564312, "epoch": 0.1101316266151431, "grad_norm": 0.1643386334180832, "learning_rate": 9.633207593461527e-05, "loss": 0.934, "mean_token_accuracy": 0.7342923209071159, "num_tokens": 38197596.0, "step": 1197 }, { "entropy": 1.0257736630737782, "epoch": 0.11022363298658432, "grad_norm": 0.17303325235843658, "learning_rate": 9.632900910847364e-05, "loss": 1.0658, "mean_token_accuracy": 0.7098408564925194, "num_tokens": 38230098.0, "step": 1198 }, { "entropy": 1.0279016233980656, "epoch": 0.11031563935802555, "grad_norm": 0.1734132170677185, "learning_rate": 9.632594228233202e-05, "loss": 1.0374, "mean_token_accuracy": 0.710333913564682, "num_tokens": 38260742.0, "step": 1199 }, { "entropy": 0.988643130287528, "epoch": 0.11040764572946676, "grad_norm": 0.16288378834724426, "learning_rate": 9.63228754561904e-05, "loss": 0.9841, "mean_token_accuracy": 0.7274706810712814, "num_tokens": 38293322.0, "step": 1200 }, { "entropy": 0.9842981025576591, "epoch": 0.110499652100908, "grad_norm": 0.1583864539861679, "learning_rate": 9.631980863004877e-05, "loss": 0.9591, "mean_token_accuracy": 0.7328468821942806, "num_tokens": 38325707.0, "step": 1201 }, { "entropy": 0.9645696990191936, "epoch": 0.11059165847234921, "grad_norm": 0.15911807119846344, "learning_rate": 9.631674180390714e-05, "loss": 0.9437, "mean_token_accuracy": 0.7354324497282505, "num_tokens": 38357351.0, "step": 1202 }, { "entropy": 0.9264683276414871, "epoch": 0.11068366484379043, "grad_norm": 0.16384205222129822, "learning_rate": 9.63136749777655e-05, "loss": 0.9363, "mean_token_accuracy": 0.7381680496037006, "num_tokens": 38389933.0, "step": 1203 }, { "entropy": 0.9327795393764973, "epoch": 0.11077567121523166, "grad_norm": 0.1632637083530426, "learning_rate": 9.63106081516239e-05, "loss": 0.9215, "mean_token_accuracy": 0.7395609430968761, "num_tokens": 38421928.0, "step": 1204 }, { "entropy": 0.8881975449621677, "epoch": 0.11086767758667287, "grad_norm": 0.16038884222507477, "learning_rate": 9.630754132548227e-05, "loss": 0.8809, "mean_token_accuracy": 0.7521721497178078, "num_tokens": 38453863.0, "step": 1205 }, { "entropy": 0.8493070900440216, "epoch": 0.1109596839581141, "grad_norm": 0.16059279441833496, "learning_rate": 9.630447449934064e-05, "loss": 0.8581, "mean_token_accuracy": 0.7503038309514523, "num_tokens": 38485924.0, "step": 1206 }, { "entropy": 0.848507534712553, "epoch": 0.11105169032955532, "grad_norm": 0.15460970997810364, "learning_rate": 9.6301407673199e-05, "loss": 0.8599, "mean_token_accuracy": 0.7540242336690426, "num_tokens": 38517608.0, "step": 1207 }, { "entropy": 1.0172521360218525, "epoch": 0.11114369670099654, "grad_norm": 0.1650722771883011, "learning_rate": 9.629834084705738e-05, "loss": 1.0239, "mean_token_accuracy": 0.7180158123373985, "num_tokens": 38549788.0, "step": 1208 }, { "entropy": 0.9597753770649433, "epoch": 0.11123570307243777, "grad_norm": 0.16278965771198273, "learning_rate": 9.629527402091577e-05, "loss": 0.9551, "mean_token_accuracy": 0.731382705271244, "num_tokens": 38582101.0, "step": 1209 }, { "entropy": 0.9449393004179001, "epoch": 0.11132770944387899, "grad_norm": 0.16609980165958405, "learning_rate": 9.629220719477413e-05, "loss": 0.9441, "mean_token_accuracy": 0.7326384335756302, "num_tokens": 38613484.0, "step": 1210 }, { "entropy": 0.9704713299870491, "epoch": 0.11141971581532022, "grad_norm": 0.16518573462963104, "learning_rate": 9.62891403686325e-05, "loss": 0.9762, "mean_token_accuracy": 0.7278703674674034, "num_tokens": 38644771.0, "step": 1211 }, { "entropy": 0.9279946126043797, "epoch": 0.11151172218676143, "grad_norm": 0.16806304454803467, "learning_rate": 9.628607354249088e-05, "loss": 0.9362, "mean_token_accuracy": 0.734474454075098, "num_tokens": 38677020.0, "step": 1212 }, { "entropy": 0.8255847655236721, "epoch": 0.11160372855820265, "grad_norm": 0.15495117008686066, "learning_rate": 9.628300671634925e-05, "loss": 0.8265, "mean_token_accuracy": 0.7633616365492344, "num_tokens": 38708178.0, "step": 1213 }, { "entropy": 0.8723923414945602, "epoch": 0.11169573492964388, "grad_norm": 0.16134938597679138, "learning_rate": 9.627993989020763e-05, "loss": 0.851, "mean_token_accuracy": 0.7510189339518547, "num_tokens": 38739773.0, "step": 1214 }, { "entropy": 0.8964626677334309, "epoch": 0.1117877413010851, "grad_norm": 0.16615474224090576, "learning_rate": 9.6276873064066e-05, "loss": 0.9066, "mean_token_accuracy": 0.7433793321251869, "num_tokens": 38771738.0, "step": 1215 }, { "entropy": 0.9249050095677376, "epoch": 0.11187974767252633, "grad_norm": 0.16456910967826843, "learning_rate": 9.627380623792438e-05, "loss": 0.9332, "mean_token_accuracy": 0.7363257557153702, "num_tokens": 38803097.0, "step": 1216 }, { "entropy": 0.918994415551424, "epoch": 0.11197175404396754, "grad_norm": 0.16103795170783997, "learning_rate": 9.627073941178275e-05, "loss": 0.9282, "mean_token_accuracy": 0.7439801022410393, "num_tokens": 38835056.0, "step": 1217 }, { "entropy": 0.9190790541470051, "epoch": 0.11206376041540876, "grad_norm": 0.16347742080688477, "learning_rate": 9.626767258564112e-05, "loss": 0.9368, "mean_token_accuracy": 0.7371826469898224, "num_tokens": 38867074.0, "step": 1218 }, { "entropy": 0.8763457387685776, "epoch": 0.11215576678684999, "grad_norm": 0.15757107734680176, "learning_rate": 9.62646057594995e-05, "loss": 0.8705, "mean_token_accuracy": 0.752184446901083, "num_tokens": 38899315.0, "step": 1219 }, { "entropy": 0.8639146462082863, "epoch": 0.11224777315829121, "grad_norm": 0.15921445190906525, "learning_rate": 9.626153893335788e-05, "loss": 0.8377, "mean_token_accuracy": 0.7558577954769135, "num_tokens": 38930092.0, "step": 1220 }, { "entropy": 1.0135957710444927, "epoch": 0.11233977952973244, "grad_norm": 0.16591723263263702, "learning_rate": 9.625847210721625e-05, "loss": 1.0247, "mean_token_accuracy": 0.7142692767083645, "num_tokens": 38961755.0, "step": 1221 }, { "entropy": 0.9697911143302917, "epoch": 0.11243178590117366, "grad_norm": 0.15928500890731812, "learning_rate": 9.625540528107462e-05, "loss": 0.9569, "mean_token_accuracy": 0.7309919185936451, "num_tokens": 38993739.0, "step": 1222 }, { "entropy": 0.8771725594997406, "epoch": 0.11252379227261487, "grad_norm": 0.15610209107398987, "learning_rate": 9.6252338454933e-05, "loss": 0.8577, "mean_token_accuracy": 0.7529030852019787, "num_tokens": 39025075.0, "step": 1223 }, { "entropy": 0.825790349394083, "epoch": 0.1126157986440561, "grad_norm": 0.154636949300766, "learning_rate": 9.624927162879137e-05, "loss": 0.8387, "mean_token_accuracy": 0.7595239467918873, "num_tokens": 39057485.0, "step": 1224 }, { "entropy": 0.8548086732625961, "epoch": 0.11270780501549732, "grad_norm": 0.15643763542175293, "learning_rate": 9.624620480264975e-05, "loss": 0.8565, "mean_token_accuracy": 0.748670969158411, "num_tokens": 39089670.0, "step": 1225 }, { "entropy": 0.8604331947863102, "epoch": 0.11279981138693855, "grad_norm": 0.15389719605445862, "learning_rate": 9.624313797650811e-05, "loss": 0.8716, "mean_token_accuracy": 0.7539368383586407, "num_tokens": 39121159.0, "step": 1226 }, { "entropy": 0.8740938268601894, "epoch": 0.11289181775837977, "grad_norm": 0.16768302023410797, "learning_rate": 9.62400711503665e-05, "loss": 0.9015, "mean_token_accuracy": 0.7455953173339367, "num_tokens": 39153290.0, "step": 1227 }, { "entropy": 0.8753143921494484, "epoch": 0.11298382412982098, "grad_norm": 0.1602894365787506, "learning_rate": 9.623700432422486e-05, "loss": 0.8792, "mean_token_accuracy": 0.7519412450492382, "num_tokens": 39185073.0, "step": 1228 }, { "entropy": 0.9621951431035995, "epoch": 0.11307583050126221, "grad_norm": 0.17920830845832825, "learning_rate": 9.623393749808323e-05, "loss": 0.981, "mean_token_accuracy": 0.7270716913044453, "num_tokens": 39215803.0, "step": 1229 }, { "entropy": 0.95667290315032, "epoch": 0.11316783687270343, "grad_norm": 0.1612055003643036, "learning_rate": 9.623087067194161e-05, "loss": 0.9651, "mean_token_accuracy": 0.7321768999099731, "num_tokens": 39247716.0, "step": 1230 }, { "entropy": 0.8866273295134306, "epoch": 0.11325984324414466, "grad_norm": 0.16174910962581635, "learning_rate": 9.62278038458e-05, "loss": 0.8813, "mean_token_accuracy": 0.7499629780650139, "num_tokens": 39279558.0, "step": 1231 }, { "entropy": 0.9229472950100899, "epoch": 0.11335184961558588, "grad_norm": 0.1614387035369873, "learning_rate": 9.622473701965836e-05, "loss": 0.9411, "mean_token_accuracy": 0.7425826601684093, "num_tokens": 39311970.0, "step": 1232 }, { "entropy": 0.9434081166982651, "epoch": 0.1134438559870271, "grad_norm": 0.16200323402881622, "learning_rate": 9.622167019351673e-05, "loss": 0.9342, "mean_token_accuracy": 0.738484013825655, "num_tokens": 39343624.0, "step": 1233 }, { "entropy": 0.9549262374639511, "epoch": 0.11353586235846833, "grad_norm": 0.1632819026708603, "learning_rate": 9.62186033673751e-05, "loss": 0.952, "mean_token_accuracy": 0.7290073409676552, "num_tokens": 39375888.0, "step": 1234 }, { "entropy": 0.8881600592285395, "epoch": 0.11362786872990954, "grad_norm": 0.16566340625286102, "learning_rate": 9.621553654123348e-05, "loss": 0.8993, "mean_token_accuracy": 0.7481296434998512, "num_tokens": 39407285.0, "step": 1235 }, { "entropy": 0.871746014803648, "epoch": 0.11371987510135077, "grad_norm": 0.15194818377494812, "learning_rate": 9.621246971509186e-05, "loss": 0.8383, "mean_token_accuracy": 0.7641799114644527, "num_tokens": 39439167.0, "step": 1236 }, { "entropy": 0.9456565119326115, "epoch": 0.11381188147279199, "grad_norm": 0.16021110117435455, "learning_rate": 9.620940288895023e-05, "loss": 0.9454, "mean_token_accuracy": 0.7346018217504025, "num_tokens": 39471680.0, "step": 1237 }, { "entropy": 0.9114279672503471, "epoch": 0.1139038878442332, "grad_norm": 0.15624144673347473, "learning_rate": 9.62063360628086e-05, "loss": 0.9113, "mean_token_accuracy": 0.741263385862112, "num_tokens": 39503424.0, "step": 1238 }, { "entropy": 0.8248308431357145, "epoch": 0.11399589421567444, "grad_norm": 0.15364912152290344, "learning_rate": 9.620326923666698e-05, "loss": 0.8172, "mean_token_accuracy": 0.7631268091499805, "num_tokens": 39535084.0, "step": 1239 }, { "entropy": 0.9492751248180866, "epoch": 0.11408790058711565, "grad_norm": 0.16309025883674622, "learning_rate": 9.620020241052536e-05, "loss": 0.9656, "mean_token_accuracy": 0.7299348637461662, "num_tokens": 39566638.0, "step": 1240 }, { "entropy": 0.9135283194482327, "epoch": 0.11417990695855688, "grad_norm": 0.1669679433107376, "learning_rate": 9.619713558438373e-05, "loss": 0.9347, "mean_token_accuracy": 0.7380702719092369, "num_tokens": 39598552.0, "step": 1241 }, { "entropy": 0.8984729759395123, "epoch": 0.1142719133299981, "grad_norm": 0.15988226234912872, "learning_rate": 9.61940687582421e-05, "loss": 0.8949, "mean_token_accuracy": 0.7479907236993313, "num_tokens": 39629386.0, "step": 1242 }, { "entropy": 1.0124025158584118, "epoch": 0.11436391970143933, "grad_norm": 0.1736791580915451, "learning_rate": 9.619100193210048e-05, "loss": 1.0516, "mean_token_accuracy": 0.7104871943593025, "num_tokens": 39661583.0, "step": 1243 }, { "entropy": 0.8712000399827957, "epoch": 0.11445592607288055, "grad_norm": 0.15194231271743774, "learning_rate": 9.618793510595884e-05, "loss": 0.8454, "mean_token_accuracy": 0.760894950479269, "num_tokens": 39694028.0, "step": 1244 }, { "entropy": 0.9235191307961941, "epoch": 0.11454793244432177, "grad_norm": 0.16357599198818207, "learning_rate": 9.618486827981723e-05, "loss": 0.927, "mean_token_accuracy": 0.7381685860455036, "num_tokens": 39726391.0, "step": 1245 }, { "entropy": 0.987502921372652, "epoch": 0.114639938815763, "grad_norm": 0.16443833708763123, "learning_rate": 9.61818014536756e-05, "loss": 0.9856, "mean_token_accuracy": 0.7266838662326336, "num_tokens": 39758801.0, "step": 1246 }, { "entropy": 0.9411337189376354, "epoch": 0.11473194518720421, "grad_norm": 0.15912885963916779, "learning_rate": 9.617873462753398e-05, "loss": 0.9447, "mean_token_accuracy": 0.7357535995543003, "num_tokens": 39790931.0, "step": 1247 }, { "entropy": 0.8603390119969845, "epoch": 0.11482395155864544, "grad_norm": 0.159799724817276, "learning_rate": 9.617566780139234e-05, "loss": 0.8542, "mean_token_accuracy": 0.7572375386953354, "num_tokens": 39823298.0, "step": 1248 }, { "entropy": 1.0349065996706486, "epoch": 0.11491595793008666, "grad_norm": 0.16297271847724915, "learning_rate": 9.617260097525071e-05, "loss": 1.0412, "mean_token_accuracy": 0.7150174602866173, "num_tokens": 39855468.0, "step": 1249 }, { "entropy": 0.9715097993612289, "epoch": 0.11500796430152788, "grad_norm": 0.16377684473991394, "learning_rate": 9.616953414910909e-05, "loss": 0.9676, "mean_token_accuracy": 0.7303238995373249, "num_tokens": 39887506.0, "step": 1250 }, { "entropy": 0.9331888128072023, "epoch": 0.1150999706729691, "grad_norm": 0.15661361813545227, "learning_rate": 9.616646732296747e-05, "loss": 0.9508, "mean_token_accuracy": 0.7338228896260262, "num_tokens": 39918763.0, "step": 1251 }, { "entropy": 0.9242482483386993, "epoch": 0.11519197704441032, "grad_norm": 0.15961304306983948, "learning_rate": 9.616340049682584e-05, "loss": 0.9359, "mean_token_accuracy": 0.7375055626034737, "num_tokens": 39950347.0, "step": 1252 }, { "entropy": 0.794408243149519, "epoch": 0.11528398341585155, "grad_norm": 0.1502804160118103, "learning_rate": 9.616033367068421e-05, "loss": 0.7885, "mean_token_accuracy": 0.7726824283599854, "num_tokens": 39981713.0, "step": 1253 }, { "entropy": 0.8597808182239532, "epoch": 0.11537598978729277, "grad_norm": 0.1505114585161209, "learning_rate": 9.615726684454259e-05, "loss": 0.8415, "mean_token_accuracy": 0.7574262320995331, "num_tokens": 40013292.0, "step": 1254 }, { "entropy": 0.8962214607745409, "epoch": 0.11546799615873399, "grad_norm": 0.16228564083576202, "learning_rate": 9.615420001840096e-05, "loss": 0.9059, "mean_token_accuracy": 0.7461973503232002, "num_tokens": 40043801.0, "step": 1255 }, { "entropy": 0.9787055291235447, "epoch": 0.11556000253017522, "grad_norm": 0.16328176856040955, "learning_rate": 9.615113319225934e-05, "loss": 0.9716, "mean_token_accuracy": 0.7294313348829746, "num_tokens": 40075473.0, "step": 1256 }, { "entropy": 0.941753227263689, "epoch": 0.11565200890161643, "grad_norm": 0.1578305959701538, "learning_rate": 9.614806636611771e-05, "loss": 0.9356, "mean_token_accuracy": 0.7382269948720932, "num_tokens": 40107421.0, "step": 1257 }, { "entropy": 0.9922678060829639, "epoch": 0.11574401527305767, "grad_norm": 0.16627971827983856, "learning_rate": 9.614499953997609e-05, "loss": 0.9886, "mean_token_accuracy": 0.7248015590012074, "num_tokens": 40139420.0, "step": 1258 }, { "entropy": 0.9118014425039291, "epoch": 0.11583602164449888, "grad_norm": 0.16349591314792633, "learning_rate": 9.614193271383446e-05, "loss": 0.9499, "mean_token_accuracy": 0.7369318641722202, "num_tokens": 40171487.0, "step": 1259 }, { "entropy": 0.8469453938305378, "epoch": 0.1159280280159401, "grad_norm": 0.15751893818378448, "learning_rate": 9.613886588769283e-05, "loss": 0.8674, "mean_token_accuracy": 0.7554065398871899, "num_tokens": 40203466.0, "step": 1260 }, { "entropy": 0.9490509815514088, "epoch": 0.11602003438738133, "grad_norm": 0.1600155383348465, "learning_rate": 9.613579906155121e-05, "loss": 0.9643, "mean_token_accuracy": 0.734326284378767, "num_tokens": 40235607.0, "step": 1261 }, { "entropy": 0.9248876925557852, "epoch": 0.11611204075882255, "grad_norm": 0.16124874353408813, "learning_rate": 9.613273223540959e-05, "loss": 0.9275, "mean_token_accuracy": 0.7398980371654034, "num_tokens": 40267601.0, "step": 1262 }, { "entropy": 0.9632008746266365, "epoch": 0.11620404713026378, "grad_norm": 0.15711267292499542, "learning_rate": 9.612966540926796e-05, "loss": 0.9363, "mean_token_accuracy": 0.7372532747685909, "num_tokens": 40299802.0, "step": 1263 }, { "entropy": 0.9267589189112186, "epoch": 0.116296053501705, "grad_norm": 0.16260387003421783, "learning_rate": 9.612659858312632e-05, "loss": 0.9283, "mean_token_accuracy": 0.73813172057271, "num_tokens": 40331546.0, "step": 1264 }, { "entropy": 1.013652851805091, "epoch": 0.11638805987314621, "grad_norm": 0.1654907613992691, "learning_rate": 9.612353175698469e-05, "loss": 1.0023, "mean_token_accuracy": 0.7146297432482243, "num_tokens": 40363659.0, "step": 1265 }, { "entropy": 0.9678255245089531, "epoch": 0.11648006624458744, "grad_norm": 0.1616593450307846, "learning_rate": 9.612046493084307e-05, "loss": 0.9467, "mean_token_accuracy": 0.7359376661479473, "num_tokens": 40395123.0, "step": 1266 }, { "entropy": 1.0728706941008568, "epoch": 0.11657207261602866, "grad_norm": 0.16114768385887146, "learning_rate": 9.611739810470145e-05, "loss": 1.0705, "mean_token_accuracy": 0.7078097350895405, "num_tokens": 40427194.0, "step": 1267 }, { "entropy": 0.9485188946127892, "epoch": 0.11666407898746989, "grad_norm": 0.16422154009342194, "learning_rate": 9.611433127855982e-05, "loss": 0.9543, "mean_token_accuracy": 0.7288158871233463, "num_tokens": 40459108.0, "step": 1268 }, { "entropy": 0.9691872745752335, "epoch": 0.1167560853589111, "grad_norm": 0.1650066077709198, "learning_rate": 9.611126445241819e-05, "loss": 0.9736, "mean_token_accuracy": 0.7273393124341965, "num_tokens": 40491164.0, "step": 1269 }, { "entropy": 0.8388831131160259, "epoch": 0.11684809173035232, "grad_norm": 0.1474425196647644, "learning_rate": 9.610819762627657e-05, "loss": 0.8015, "mean_token_accuracy": 0.7715040296316147, "num_tokens": 40523076.0, "step": 1270 }, { "entropy": 0.8737820871174335, "epoch": 0.11694009810179355, "grad_norm": 0.15791308879852295, "learning_rate": 9.610513080013494e-05, "loss": 0.8688, "mean_token_accuracy": 0.7504031881690025, "num_tokens": 40554759.0, "step": 1271 }, { "entropy": 0.9471858963370323, "epoch": 0.11703210447323477, "grad_norm": 0.1593601405620575, "learning_rate": 9.610206397399332e-05, "loss": 0.9522, "mean_token_accuracy": 0.7352076917886734, "num_tokens": 40587290.0, "step": 1272 }, { "entropy": 0.8698337860405445, "epoch": 0.117124110844676, "grad_norm": 0.15851740539073944, "learning_rate": 9.609899714785169e-05, "loss": 0.8806, "mean_token_accuracy": 0.7459563165903091, "num_tokens": 40618369.0, "step": 1273 }, { "entropy": 0.8455539979040623, "epoch": 0.11721611721611722, "grad_norm": 0.15500161051750183, "learning_rate": 9.609593032171007e-05, "loss": 0.8518, "mean_token_accuracy": 0.7552744783461094, "num_tokens": 40650623.0, "step": 1274 }, { "entropy": 0.9396741762757301, "epoch": 0.11730812358755843, "grad_norm": 0.16230222582817078, "learning_rate": 9.609286349556844e-05, "loss": 0.9398, "mean_token_accuracy": 0.7304256968200207, "num_tokens": 40681877.0, "step": 1275 }, { "entropy": 0.9025632776319981, "epoch": 0.11740012995899966, "grad_norm": 0.16150829195976257, "learning_rate": 9.60897966694268e-05, "loss": 0.932, "mean_token_accuracy": 0.7390985749661922, "num_tokens": 40714105.0, "step": 1276 }, { "entropy": 0.8881730511784554, "epoch": 0.11749213633044088, "grad_norm": 0.15971910953521729, "learning_rate": 9.608672984328519e-05, "loss": 0.9214, "mean_token_accuracy": 0.7416803315281868, "num_tokens": 40745946.0, "step": 1277 }, { "entropy": 0.8691030815243721, "epoch": 0.11758414270188211, "grad_norm": 0.1657966822385788, "learning_rate": 9.608366301714357e-05, "loss": 0.8982, "mean_token_accuracy": 0.7390356659889221, "num_tokens": 40777794.0, "step": 1278 }, { "entropy": 0.9578011557459831, "epoch": 0.11767614907332333, "grad_norm": 0.16132250428199768, "learning_rate": 9.608059619100194e-05, "loss": 0.9568, "mean_token_accuracy": 0.731116134673357, "num_tokens": 40809362.0, "step": 1279 }, { "entropy": 0.8265602830797434, "epoch": 0.11776815544476454, "grad_norm": 0.15483814477920532, "learning_rate": 9.60775293648603e-05, "loss": 0.8246, "mean_token_accuracy": 0.7657246440649033, "num_tokens": 40841879.0, "step": 1280 }, { "entropy": 0.8498229719698429, "epoch": 0.11786016181620577, "grad_norm": 0.16051693260669708, "learning_rate": 9.607446253871867e-05, "loss": 0.8458, "mean_token_accuracy": 0.7561776153743267, "num_tokens": 40873793.0, "step": 1281 }, { "entropy": 0.8779421057552099, "epoch": 0.11795216818764699, "grad_norm": 0.15922938287258148, "learning_rate": 9.607139571257707e-05, "loss": 0.863, "mean_token_accuracy": 0.7531022801995277, "num_tokens": 40905840.0, "step": 1282 }, { "entropy": 0.9131678827106953, "epoch": 0.11804417455908822, "grad_norm": 0.15531784296035767, "learning_rate": 9.606832888643544e-05, "loss": 0.9046, "mean_token_accuracy": 0.7454161271452904, "num_tokens": 40938294.0, "step": 1283 }, { "entropy": 0.9142397008836269, "epoch": 0.11813618093052944, "grad_norm": 0.16224299371242523, "learning_rate": 9.60652620602938e-05, "loss": 0.9021, "mean_token_accuracy": 0.7436867207288742, "num_tokens": 40969805.0, "step": 1284 }, { "entropy": 0.8809251487255096, "epoch": 0.11822818730197066, "grad_norm": 0.1542155146598816, "learning_rate": 9.606219523415218e-05, "loss": 0.8736, "mean_token_accuracy": 0.7532003335654736, "num_tokens": 41002092.0, "step": 1285 }, { "entropy": 0.9415201731026173, "epoch": 0.11832019367341189, "grad_norm": 0.15238253772258759, "learning_rate": 9.605912840801055e-05, "loss": 0.921, "mean_token_accuracy": 0.7392208613455296, "num_tokens": 41034637.0, "step": 1286 }, { "entropy": 0.8537130504846573, "epoch": 0.1184122000448531, "grad_norm": 0.1576310694217682, "learning_rate": 9.605606158186893e-05, "loss": 0.8663, "mean_token_accuracy": 0.7504206262528896, "num_tokens": 41066236.0, "step": 1287 }, { "entropy": 0.8941641449928284, "epoch": 0.11850420641629433, "grad_norm": 0.15747779607772827, "learning_rate": 9.60529947557273e-05, "loss": 0.8969, "mean_token_accuracy": 0.7481241710484028, "num_tokens": 41098354.0, "step": 1288 }, { "entropy": 0.9433057494461536, "epoch": 0.11859621278773555, "grad_norm": 0.15869227051734924, "learning_rate": 9.604992792958568e-05, "loss": 0.9369, "mean_token_accuracy": 0.734813317656517, "num_tokens": 41130356.0, "step": 1289 }, { "entropy": 0.8895032368600368, "epoch": 0.11868821915917677, "grad_norm": 0.16359210014343262, "learning_rate": 9.604686110344405e-05, "loss": 0.889, "mean_token_accuracy": 0.7488925568759441, "num_tokens": 41161739.0, "step": 1290 }, { "entropy": 0.8882927969098091, "epoch": 0.118780225530618, "grad_norm": 0.15495671331882477, "learning_rate": 9.604379427730242e-05, "loss": 0.8726, "mean_token_accuracy": 0.7462094239890575, "num_tokens": 41193827.0, "step": 1291 }, { "entropy": 0.8922304287552834, "epoch": 0.11887223190205921, "grad_norm": 0.16136017441749573, "learning_rate": 9.60407274511608e-05, "loss": 0.923, "mean_token_accuracy": 0.7413236014544964, "num_tokens": 41226090.0, "step": 1292 }, { "entropy": 1.0411744825541973, "epoch": 0.11896423827350044, "grad_norm": 0.16743867099285126, "learning_rate": 9.603766062501918e-05, "loss": 1.0629, "mean_token_accuracy": 0.7125931233167648, "num_tokens": 41258355.0, "step": 1293 }, { "entropy": 0.9646545648574829, "epoch": 0.11905624464494166, "grad_norm": 0.16477781534194946, "learning_rate": 9.603459379887755e-05, "loss": 0.9878, "mean_token_accuracy": 0.7236351259052753, "num_tokens": 41290449.0, "step": 1294 }, { "entropy": 0.8724432066082954, "epoch": 0.11914825101638288, "grad_norm": 0.15520206093788147, "learning_rate": 9.603152697273592e-05, "loss": 0.8854, "mean_token_accuracy": 0.7512686215341091, "num_tokens": 41322472.0, "step": 1295 }, { "entropy": 1.0334160886704922, "epoch": 0.11924025738782411, "grad_norm": 0.17018243670463562, "learning_rate": 9.602846014659429e-05, "loss": 1.0578, "mean_token_accuracy": 0.7093744091689587, "num_tokens": 41354631.0, "step": 1296 }, { "entropy": 0.8692147396504879, "epoch": 0.11933226375926533, "grad_norm": 0.15482290089130402, "learning_rate": 9.602539332045267e-05, "loss": 0.8507, "mean_token_accuracy": 0.75397614762187, "num_tokens": 41386676.0, "step": 1297 }, { "entropy": 0.870785865932703, "epoch": 0.11942427013070656, "grad_norm": 0.15196461975574493, "learning_rate": 9.602232649431105e-05, "loss": 0.8613, "mean_token_accuracy": 0.755605436861515, "num_tokens": 41418720.0, "step": 1298 }, { "entropy": 1.0388873219490051, "epoch": 0.11951627650214777, "grad_norm": 0.1653686761856079, "learning_rate": 9.601925966816942e-05, "loss": 1.0266, "mean_token_accuracy": 0.7155215814709663, "num_tokens": 41449563.0, "step": 1299 }, { "entropy": 1.0249877907335758, "epoch": 0.11960828287358899, "grad_norm": 0.16697122156620026, "learning_rate": 9.601619284202778e-05, "loss": 1.0187, "mean_token_accuracy": 0.7147185653448105, "num_tokens": 41480552.0, "step": 1300 }, { "entropy": 0.8812817446887493, "epoch": 0.11970028924503022, "grad_norm": 0.1539660394191742, "learning_rate": 9.601312601588617e-05, "loss": 0.8602, "mean_token_accuracy": 0.7542939521372318, "num_tokens": 41512666.0, "step": 1301 }, { "entropy": 0.9086950607597828, "epoch": 0.11979229561647144, "grad_norm": 0.15985901653766632, "learning_rate": 9.601005918974453e-05, "loss": 0.9122, "mean_token_accuracy": 0.7423644848167896, "num_tokens": 41544291.0, "step": 1302 }, { "entropy": 0.9174596555531025, "epoch": 0.11988430198791267, "grad_norm": 0.1565527617931366, "learning_rate": 9.600699236360292e-05, "loss": 0.9132, "mean_token_accuracy": 0.7424374893307686, "num_tokens": 41576656.0, "step": 1303 }, { "entropy": 0.8075642287731171, "epoch": 0.11997630835935388, "grad_norm": 0.16462011635303497, "learning_rate": 9.600392553746128e-05, "loss": 0.8091, "mean_token_accuracy": 0.7658773101866245, "num_tokens": 41608802.0, "step": 1304 }, { "entropy": 0.8962103370577097, "epoch": 0.12006831473079511, "grad_norm": 0.15050943195819855, "learning_rate": 9.600085871131966e-05, "loss": 0.8791, "mean_token_accuracy": 0.7527477517724037, "num_tokens": 41641307.0, "step": 1305 }, { "entropy": 0.8839820213615894, "epoch": 0.12016032110223633, "grad_norm": 0.157679945230484, "learning_rate": 9.599779188517803e-05, "loss": 0.9193, "mean_token_accuracy": 0.7409001365303993, "num_tokens": 41673942.0, "step": 1306 }, { "entropy": 0.9388176463544369, "epoch": 0.12025232747367755, "grad_norm": 0.15649941563606262, "learning_rate": 9.59947250590364e-05, "loss": 0.949, "mean_token_accuracy": 0.7278507873415947, "num_tokens": 41706191.0, "step": 1307 }, { "entropy": 0.925638634711504, "epoch": 0.12034433384511878, "grad_norm": 0.1594221442937851, "learning_rate": 9.599165823289478e-05, "loss": 0.9365, "mean_token_accuracy": 0.7373437881469727, "num_tokens": 41738211.0, "step": 1308 }, { "entropy": 0.9623091034591198, "epoch": 0.12043634021656, "grad_norm": 0.1614353060722351, "learning_rate": 9.598859140675316e-05, "loss": 0.9611, "mean_token_accuracy": 0.7300198599696159, "num_tokens": 41769243.0, "step": 1309 }, { "entropy": 0.87416772544384, "epoch": 0.12052834658800123, "grad_norm": 0.16179439425468445, "learning_rate": 9.598552458061153e-05, "loss": 0.8911, "mean_token_accuracy": 0.7521978691220284, "num_tokens": 41801341.0, "step": 1310 }, { "entropy": 0.903215266764164, "epoch": 0.12062035295944244, "grad_norm": 0.15914539992809296, "learning_rate": 9.59824577544699e-05, "loss": 0.9154, "mean_token_accuracy": 0.7424189038574696, "num_tokens": 41833642.0, "step": 1311 }, { "entropy": 0.9014825485646725, "epoch": 0.12071235933088366, "grad_norm": 0.15694665908813477, "learning_rate": 9.597939092832827e-05, "loss": 0.9205, "mean_token_accuracy": 0.7389534637331963, "num_tokens": 41865892.0, "step": 1312 }, { "entropy": 0.8975206315517426, "epoch": 0.12080436570232489, "grad_norm": 0.15848146378993988, "learning_rate": 9.597632410218665e-05, "loss": 0.8642, "mean_token_accuracy": 0.7452213801443577, "num_tokens": 41897204.0, "step": 1313 }, { "entropy": 0.8691624291241169, "epoch": 0.1208963720737661, "grad_norm": 0.15127311646938324, "learning_rate": 9.597325727604503e-05, "loss": 0.852, "mean_token_accuracy": 0.7555100135505199, "num_tokens": 41928757.0, "step": 1314 }, { "entropy": 0.9531728215515614, "epoch": 0.12098837844520734, "grad_norm": 0.16214917600154877, "learning_rate": 9.59701904499034e-05, "loss": 0.9487, "mean_token_accuracy": 0.7345303632318974, "num_tokens": 41960214.0, "step": 1315 }, { "entropy": 0.8498926572501659, "epoch": 0.12108038481664855, "grad_norm": 0.162801593542099, "learning_rate": 9.596712362376178e-05, "loss": 0.854, "mean_token_accuracy": 0.7585731036961079, "num_tokens": 41992230.0, "step": 1316 }, { "entropy": 0.9361480586230755, "epoch": 0.12117239118808977, "grad_norm": 0.158907949924469, "learning_rate": 9.596405679762015e-05, "loss": 0.9382, "mean_token_accuracy": 0.7340890765190125, "num_tokens": 42024506.0, "step": 1317 }, { "entropy": 0.8803095314651728, "epoch": 0.121264397559531, "grad_norm": 0.15394945442676544, "learning_rate": 9.596098997147851e-05, "loss": 0.8862, "mean_token_accuracy": 0.7493113130331039, "num_tokens": 42057116.0, "step": 1318 }, { "entropy": 0.981334213167429, "epoch": 0.12135640393097222, "grad_norm": 0.1622510701417923, "learning_rate": 9.59579231453369e-05, "loss": 0.9775, "mean_token_accuracy": 0.7281354516744614, "num_tokens": 42088545.0, "step": 1319 }, { "entropy": 0.8302001766860485, "epoch": 0.12144841030241345, "grad_norm": 0.1583346724510193, "learning_rate": 9.595485631919528e-05, "loss": 0.834, "mean_token_accuracy": 0.7623110041022301, "num_tokens": 42121007.0, "step": 1320 }, { "entropy": 0.9328108727931976, "epoch": 0.12154041667385466, "grad_norm": 0.15617331862449646, "learning_rate": 9.595178949305365e-05, "loss": 0.9201, "mean_token_accuracy": 0.7406449504196644, "num_tokens": 42152533.0, "step": 1321 }, { "entropy": 0.8520091995596886, "epoch": 0.12163242304529588, "grad_norm": 0.15073151886463165, "learning_rate": 9.594872266691201e-05, "loss": 0.8365, "mean_token_accuracy": 0.7635049447417259, "num_tokens": 42184999.0, "step": 1322 }, { "entropy": 0.8666563853621483, "epoch": 0.12172442941673711, "grad_norm": 0.1630660742521286, "learning_rate": 9.594565584077038e-05, "loss": 0.8554, "mean_token_accuracy": 0.7574391067028046, "num_tokens": 42216563.0, "step": 1323 }, { "entropy": 0.9101729765534401, "epoch": 0.12181643578817833, "grad_norm": 0.1543581336736679, "learning_rate": 9.594258901462878e-05, "loss": 0.895, "mean_token_accuracy": 0.7461829036474228, "num_tokens": 42248663.0, "step": 1324 }, { "entropy": 0.9893680065870285, "epoch": 0.12190844215961956, "grad_norm": 0.1749403476715088, "learning_rate": 9.593952218848714e-05, "loss": 0.9708, "mean_token_accuracy": 0.7252227105200291, "num_tokens": 42280538.0, "step": 1325 }, { "entropy": 0.892228826880455, "epoch": 0.12200044853106078, "grad_norm": 0.1589728593826294, "learning_rate": 9.593645536234551e-05, "loss": 0.896, "mean_token_accuracy": 0.7447525262832642, "num_tokens": 42312509.0, "step": 1326 }, { "entropy": 0.8364868648350239, "epoch": 0.12209245490250199, "grad_norm": 0.1602228432893753, "learning_rate": 9.593338853620388e-05, "loss": 0.8508, "mean_token_accuracy": 0.756545003503561, "num_tokens": 42344396.0, "step": 1327 }, { "entropy": 0.8401671275496483, "epoch": 0.12218446127394322, "grad_norm": 0.1565535068511963, "learning_rate": 9.593032171006226e-05, "loss": 0.8598, "mean_token_accuracy": 0.7501671090722084, "num_tokens": 42376729.0, "step": 1328 }, { "entropy": 0.92406390234828, "epoch": 0.12227646764538444, "grad_norm": 0.16469357907772064, "learning_rate": 9.592725488392064e-05, "loss": 0.9626, "mean_token_accuracy": 0.7325879819691181, "num_tokens": 42408380.0, "step": 1329 }, { "entropy": 0.84736836142838, "epoch": 0.12236847401682567, "grad_norm": 0.15513655543327332, "learning_rate": 9.592418805777901e-05, "loss": 0.8431, "mean_token_accuracy": 0.7582830339670181, "num_tokens": 42440932.0, "step": 1330 }, { "entropy": 0.9204532355070114, "epoch": 0.12246048038826689, "grad_norm": 0.16738682985305786, "learning_rate": 9.592112123163738e-05, "loss": 0.9343, "mean_token_accuracy": 0.7366954833269119, "num_tokens": 42473397.0, "step": 1331 }, { "entropy": 0.8773025572299957, "epoch": 0.1225524867597081, "grad_norm": 0.16079069674015045, "learning_rate": 9.591805440549576e-05, "loss": 0.8766, "mean_token_accuracy": 0.7528524920344353, "num_tokens": 42505979.0, "step": 1332 }, { "entropy": 0.89029336348176, "epoch": 0.12264449313114933, "grad_norm": 0.1592784821987152, "learning_rate": 9.591498757935413e-05, "loss": 0.8902, "mean_token_accuracy": 0.744793176651001, "num_tokens": 42537535.0, "step": 1333 }, { "entropy": 0.9126544371247292, "epoch": 0.12273649950259055, "grad_norm": 0.16223393380641937, "learning_rate": 9.591192075321251e-05, "loss": 0.9135, "mean_token_accuracy": 0.7423229739069939, "num_tokens": 42569594.0, "step": 1334 }, { "entropy": 0.9771235771477222, "epoch": 0.12282850587403178, "grad_norm": 0.17410695552825928, "learning_rate": 9.590885392707088e-05, "loss": 0.9688, "mean_token_accuracy": 0.7271896004676819, "num_tokens": 42600994.0, "step": 1335 }, { "entropy": 1.003642249852419, "epoch": 0.122920512245473, "grad_norm": 0.16569291055202484, "learning_rate": 9.590578710092926e-05, "loss": 1.0222, "mean_token_accuracy": 0.7134799920022488, "num_tokens": 42633278.0, "step": 1336 }, { "entropy": 0.9009298980236053, "epoch": 0.12301251861691422, "grad_norm": 0.15926679968833923, "learning_rate": 9.590272027478763e-05, "loss": 0.9084, "mean_token_accuracy": 0.7428008280694485, "num_tokens": 42665214.0, "step": 1337 }, { "entropy": 0.9603922367095947, "epoch": 0.12310452498835545, "grad_norm": 0.16201116144657135, "learning_rate": 9.5899653448646e-05, "loss": 0.9543, "mean_token_accuracy": 0.7354647144675255, "num_tokens": 42696794.0, "step": 1338 }, { "entropy": 0.9607611708343029, "epoch": 0.12319653135979666, "grad_norm": 0.15695728361606598, "learning_rate": 9.589658662250438e-05, "loss": 0.9433, "mean_token_accuracy": 0.732390783727169, "num_tokens": 42729118.0, "step": 1339 }, { "entropy": 0.937091987580061, "epoch": 0.1232885377312379, "grad_norm": 0.16493549942970276, "learning_rate": 9.589351979636276e-05, "loss": 0.9248, "mean_token_accuracy": 0.7373012453317642, "num_tokens": 42760580.0, "step": 1340 }, { "entropy": 0.9200702998787165, "epoch": 0.12338054410267911, "grad_norm": 0.1624705046415329, "learning_rate": 9.589045297022112e-05, "loss": 0.9154, "mean_token_accuracy": 0.7398549802601337, "num_tokens": 42792354.0, "step": 1341 }, { "entropy": 0.8025525808334351, "epoch": 0.12347255047412033, "grad_norm": 0.15369336307048798, "learning_rate": 9.588738614407949e-05, "loss": 0.8256, "mean_token_accuracy": 0.7677078992128372, "num_tokens": 42824999.0, "step": 1342 }, { "entropy": 0.8614583425223827, "epoch": 0.12356455684556156, "grad_norm": 0.15983784198760986, "learning_rate": 9.588431931793786e-05, "loss": 0.8705, "mean_token_accuracy": 0.7562061212956905, "num_tokens": 42855960.0, "step": 1343 }, { "entropy": 0.881206326186657, "epoch": 0.12365656321700277, "grad_norm": 0.1611868143081665, "learning_rate": 9.588125249179624e-05, "loss": 0.8973, "mean_token_accuracy": 0.7474408335983753, "num_tokens": 42888256.0, "step": 1344 }, { "entropy": 0.9357227012515068, "epoch": 0.123748569588444, "grad_norm": 0.16418229043483734, "learning_rate": 9.587818566565462e-05, "loss": 0.9376, "mean_token_accuracy": 0.7395183816552162, "num_tokens": 42918977.0, "step": 1345 }, { "entropy": 0.8898397963494062, "epoch": 0.12384057595988522, "grad_norm": 0.15771222114562988, "learning_rate": 9.587511883951299e-05, "loss": 0.892, "mean_token_accuracy": 0.7475471459329128, "num_tokens": 42951240.0, "step": 1346 }, { "entropy": 0.9032508302479982, "epoch": 0.12393258233132644, "grad_norm": 0.1650296151638031, "learning_rate": 9.587205201337137e-05, "loss": 0.9051, "mean_token_accuracy": 0.7468995042145252, "num_tokens": 42982705.0, "step": 1347 }, { "entropy": 0.9133551232516766, "epoch": 0.12402458870276767, "grad_norm": 0.1615152209997177, "learning_rate": 9.586898518722974e-05, "loss": 0.9192, "mean_token_accuracy": 0.7387451305985451, "num_tokens": 43014513.0, "step": 1348 }, { "entropy": 1.0035524629056454, "epoch": 0.12411659507420889, "grad_norm": 0.18631993234157562, "learning_rate": 9.586591836108811e-05, "loss": 1.0202, "mean_token_accuracy": 0.7165511026978493, "num_tokens": 43047035.0, "step": 1349 }, { "entropy": 0.8903112858533859, "epoch": 0.12420860144565012, "grad_norm": 0.15951476991176605, "learning_rate": 9.586285153494649e-05, "loss": 0.8995, "mean_token_accuracy": 0.7450625076889992, "num_tokens": 43079192.0, "step": 1350 }, { "entropy": 0.8962217308580875, "epoch": 0.12430060781709133, "grad_norm": 0.15349577367305756, "learning_rate": 9.585978470880487e-05, "loss": 0.8913, "mean_token_accuracy": 0.7459709905087948, "num_tokens": 43111336.0, "step": 1351 }, { "entropy": 0.9824104551225901, "epoch": 0.12439261418853255, "grad_norm": 0.1629566103219986, "learning_rate": 9.585671788266324e-05, "loss": 0.9779, "mean_token_accuracy": 0.7294751591980457, "num_tokens": 43143210.0, "step": 1352 }, { "entropy": 0.8909053448587656, "epoch": 0.12448462055997378, "grad_norm": 0.1611369550228119, "learning_rate": 9.58536510565216e-05, "loss": 0.8928, "mean_token_accuracy": 0.7482354044914246, "num_tokens": 43175574.0, "step": 1353 }, { "entropy": 0.9078603200614452, "epoch": 0.124576626931415, "grad_norm": 0.16770216822624207, "learning_rate": 9.585058423037997e-05, "loss": 0.9219, "mean_token_accuracy": 0.7385167479515076, "num_tokens": 43207563.0, "step": 1354 }, { "entropy": 0.9457318540662527, "epoch": 0.12466863330285623, "grad_norm": 0.16901403665542603, "learning_rate": 9.584751740423836e-05, "loss": 0.9789, "mean_token_accuracy": 0.7298157438635826, "num_tokens": 43239727.0, "step": 1355 }, { "entropy": 0.7926583401858807, "epoch": 0.12476063967429744, "grad_norm": 0.1529662013053894, "learning_rate": 9.584445057809674e-05, "loss": 0.7791, "mean_token_accuracy": 0.772360410541296, "num_tokens": 43270755.0, "step": 1356 }, { "entropy": 0.886942557990551, "epoch": 0.12485264604573866, "grad_norm": 0.15925097465515137, "learning_rate": 9.58413837519551e-05, "loss": 0.8695, "mean_token_accuracy": 0.7511759772896767, "num_tokens": 43302637.0, "step": 1357 }, { "entropy": 0.9399158507585526, "epoch": 0.12494465241717989, "grad_norm": 0.15796351432800293, "learning_rate": 9.583831692581347e-05, "loss": 0.9322, "mean_token_accuracy": 0.7384955734014511, "num_tokens": 43335143.0, "step": 1358 }, { "entropy": 0.9325386770069599, "epoch": 0.1250366587886211, "grad_norm": 0.1641385406255722, "learning_rate": 9.583525009967185e-05, "loss": 0.9126, "mean_token_accuracy": 0.7446613125503063, "num_tokens": 43366262.0, "step": 1359 }, { "entropy": 0.7758619263768196, "epoch": 0.12512866516006232, "grad_norm": 0.14610634744167328, "learning_rate": 9.583218327353024e-05, "loss": 0.752, "mean_token_accuracy": 0.7798018008470535, "num_tokens": 43398136.0, "step": 1360 }, { "entropy": 0.9312492199242115, "epoch": 0.12522067153150357, "grad_norm": 0.15372642874717712, "learning_rate": 9.58291164473886e-05, "loss": 0.9312, "mean_token_accuracy": 0.7378669194877148, "num_tokens": 43430564.0, "step": 1361 }, { "entropy": 0.9555746503174305, "epoch": 0.12531267790294479, "grad_norm": 0.16121193766593933, "learning_rate": 9.582604962124697e-05, "loss": 0.955, "mean_token_accuracy": 0.7344971969723701, "num_tokens": 43462310.0, "step": 1362 }, { "entropy": 0.8892284110188484, "epoch": 0.125404684274386, "grad_norm": 0.15434499084949493, "learning_rate": 9.582298279510535e-05, "loss": 0.8908, "mean_token_accuracy": 0.7497995942831039, "num_tokens": 43494606.0, "step": 1363 }, { "entropy": 0.9992723986506462, "epoch": 0.12549669064582722, "grad_norm": 0.16130992770195007, "learning_rate": 9.581991596896372e-05, "loss": 1.0102, "mean_token_accuracy": 0.7208214811980724, "num_tokens": 43526699.0, "step": 1364 }, { "entropy": 0.9079805351793766, "epoch": 0.12558869701726844, "grad_norm": 0.15785521268844604, "learning_rate": 9.58168491428221e-05, "loss": 0.9193, "mean_token_accuracy": 0.7422300651669502, "num_tokens": 43559188.0, "step": 1365 }, { "entropy": 0.8955215811729431, "epoch": 0.12568070338870968, "grad_norm": 0.15921910107135773, "learning_rate": 9.581378231668047e-05, "loss": 0.9107, "mean_token_accuracy": 0.7461718767881393, "num_tokens": 43590383.0, "step": 1366 }, { "entropy": 0.9458691142499447, "epoch": 0.1257727097601509, "grad_norm": 0.16171136498451233, "learning_rate": 9.581071549053885e-05, "loss": 0.9556, "mean_token_accuracy": 0.7290371023118496, "num_tokens": 43621959.0, "step": 1367 }, { "entropy": 0.9895393438637257, "epoch": 0.1258647161315921, "grad_norm": 0.16478824615478516, "learning_rate": 9.580764866439722e-05, "loss": 0.9921, "mean_token_accuracy": 0.7248892262578011, "num_tokens": 43654468.0, "step": 1368 }, { "entropy": 0.9287047646939754, "epoch": 0.12595672250303333, "grad_norm": 0.160200297832489, "learning_rate": 9.580458183825559e-05, "loss": 0.9195, "mean_token_accuracy": 0.7397038154304028, "num_tokens": 43686735.0, "step": 1369 }, { "entropy": 0.8816953413188457, "epoch": 0.12604872887447455, "grad_norm": 0.16115164756774902, "learning_rate": 9.580151501211397e-05, "loss": 0.8794, "mean_token_accuracy": 0.7526337429881096, "num_tokens": 43718170.0, "step": 1370 }, { "entropy": 0.9544548876583576, "epoch": 0.1261407352459158, "grad_norm": 0.16148696839809418, "learning_rate": 9.579844818597235e-05, "loss": 0.9515, "mean_token_accuracy": 0.7347146458923817, "num_tokens": 43750632.0, "step": 1371 }, { "entropy": 1.0148214735090733, "epoch": 0.126232741617357, "grad_norm": 0.16944923996925354, "learning_rate": 9.579538135983072e-05, "loss": 1.0164, "mean_token_accuracy": 0.7153962999582291, "num_tokens": 43781681.0, "step": 1372 }, { "entropy": 0.8881180249154568, "epoch": 0.12632474798879822, "grad_norm": 0.15640972554683685, "learning_rate": 9.579231453368909e-05, "loss": 0.8982, "mean_token_accuracy": 0.7436126992106438, "num_tokens": 43813855.0, "step": 1373 }, { "entropy": 0.93473981320858, "epoch": 0.12641675436023944, "grad_norm": 0.15791121125221252, "learning_rate": 9.578924770754747e-05, "loss": 0.9356, "mean_token_accuracy": 0.742297176271677, "num_tokens": 43846517.0, "step": 1374 }, { "entropy": 0.8538608811795712, "epoch": 0.12650876073168066, "grad_norm": 0.15636909008026123, "learning_rate": 9.578618088140584e-05, "loss": 0.8411, "mean_token_accuracy": 0.7586209625005722, "num_tokens": 43878338.0, "step": 1375 }, { "entropy": 0.825945045799017, "epoch": 0.1266007671031219, "grad_norm": 0.1545090228319168, "learning_rate": 9.578311405526422e-05, "loss": 0.8191, "mean_token_accuracy": 0.7658201716840267, "num_tokens": 43910222.0, "step": 1376 }, { "entropy": 0.8869588673114777, "epoch": 0.12669277347456312, "grad_norm": 0.15499937534332275, "learning_rate": 9.578004722912258e-05, "loss": 0.9031, "mean_token_accuracy": 0.7419997341930866, "num_tokens": 43942758.0, "step": 1377 }, { "entropy": 0.91963130235672, "epoch": 0.12678477984600434, "grad_norm": 0.1623668074607849, "learning_rate": 9.577698040298097e-05, "loss": 0.9329, "mean_token_accuracy": 0.7402029670774937, "num_tokens": 43973772.0, "step": 1378 }, { "entropy": 0.8775487281382084, "epoch": 0.12687678621744555, "grad_norm": 0.1552736759185791, "learning_rate": 9.577391357683933e-05, "loss": 0.8879, "mean_token_accuracy": 0.7492555752396584, "num_tokens": 44005705.0, "step": 1379 }, { "entropy": 0.927038948982954, "epoch": 0.12696879258888677, "grad_norm": 0.15983612835407257, "learning_rate": 9.57708467506977e-05, "loss": 0.928, "mean_token_accuracy": 0.7426281794905663, "num_tokens": 44037590.0, "step": 1380 }, { "entropy": 0.8520211782306433, "epoch": 0.12706079896032801, "grad_norm": 0.1526368409395218, "learning_rate": 9.576777992455608e-05, "loss": 0.8339, "mean_token_accuracy": 0.7652990408241749, "num_tokens": 44069649.0, "step": 1381 }, { "entropy": 0.9200831651687622, "epoch": 0.12715280533176923, "grad_norm": 0.1639328896999359, "learning_rate": 9.576471309841446e-05, "loss": 0.9257, "mean_token_accuracy": 0.7412961311638355, "num_tokens": 44101416.0, "step": 1382 }, { "entropy": 0.8470993041992188, "epoch": 0.12724481170321045, "grad_norm": 0.1600313037633896, "learning_rate": 9.576164627227283e-05, "loss": 0.8499, "mean_token_accuracy": 0.7564584910869598, "num_tokens": 44132927.0, "step": 1383 }, { "entropy": 0.9344243407249451, "epoch": 0.12733681807465166, "grad_norm": 0.15922343730926514, "learning_rate": 9.57585794461312e-05, "loss": 0.9252, "mean_token_accuracy": 0.7399983033537865, "num_tokens": 44165158.0, "step": 1384 }, { "entropy": 0.8967868983745575, "epoch": 0.12742882444609288, "grad_norm": 0.15718422830104828, "learning_rate": 9.575551261998957e-05, "loss": 0.8862, "mean_token_accuracy": 0.7437204085290432, "num_tokens": 44196753.0, "step": 1385 }, { "entropy": 0.8965760283172131, "epoch": 0.12752083081753413, "grad_norm": 0.16037434339523315, "learning_rate": 9.575244579384795e-05, "loss": 0.9118, "mean_token_accuracy": 0.7457964047789574, "num_tokens": 44227949.0, "step": 1386 }, { "entropy": 0.9602333530783653, "epoch": 0.12761283718897534, "grad_norm": 0.16215936839580536, "learning_rate": 9.574937896770633e-05, "loss": 0.9509, "mean_token_accuracy": 0.7275675125420094, "num_tokens": 44260270.0, "step": 1387 }, { "entropy": 0.9736673645675182, "epoch": 0.12770484356041656, "grad_norm": 0.15929417312145233, "learning_rate": 9.57463121415647e-05, "loss": 0.9809, "mean_token_accuracy": 0.7328590862452984, "num_tokens": 44292345.0, "step": 1388 }, { "entropy": 0.9236449562013149, "epoch": 0.12779684993185778, "grad_norm": 0.15642336010932922, "learning_rate": 9.574324531542307e-05, "loss": 0.9332, "mean_token_accuracy": 0.7394499257206917, "num_tokens": 44324279.0, "step": 1389 }, { "entropy": 0.8794885501265526, "epoch": 0.127888856303299, "grad_norm": 0.150704488158226, "learning_rate": 9.574017848928145e-05, "loss": 0.8524, "mean_token_accuracy": 0.7605950981378555, "num_tokens": 44356371.0, "step": 1390 }, { "entropy": 1.0406970605254173, "epoch": 0.12798086267474024, "grad_norm": 0.16482026875019073, "learning_rate": 9.573711166313982e-05, "loss": 1.038, "mean_token_accuracy": 0.7079443000257015, "num_tokens": 44388133.0, "step": 1391 }, { "entropy": 0.751538960263133, "epoch": 0.12807286904618145, "grad_norm": 0.1450197398662567, "learning_rate": 9.57340448369982e-05, "loss": 0.7323, "mean_token_accuracy": 0.7856653071939945, "num_tokens": 44420568.0, "step": 1392 }, { "entropy": 0.90673753246665, "epoch": 0.12816487541762267, "grad_norm": 0.15802042186260223, "learning_rate": 9.573097801085657e-05, "loss": 0.8959, "mean_token_accuracy": 0.7491278238594532, "num_tokens": 44452478.0, "step": 1393 }, { "entropy": 0.9203658103942871, "epoch": 0.1282568817890639, "grad_norm": 0.16187678277492523, "learning_rate": 9.572791118471495e-05, "loss": 0.943, "mean_token_accuracy": 0.7378385253250599, "num_tokens": 44484924.0, "step": 1394 }, { "entropy": 0.813607320189476, "epoch": 0.1283488881605051, "grad_norm": 0.15430891513824463, "learning_rate": 9.572484435857331e-05, "loss": 0.7966, "mean_token_accuracy": 0.7726012878119946, "num_tokens": 44517112.0, "step": 1395 }, { "entropy": 0.993693646043539, "epoch": 0.12844089453194635, "grad_norm": 0.16756080090999603, "learning_rate": 9.572177753243168e-05, "loss": 1.0035, "mean_token_accuracy": 0.720903679728508, "num_tokens": 44549304.0, "step": 1396 }, { "entropy": 0.8364639040082693, "epoch": 0.12853290090338756, "grad_norm": 0.15957613289356232, "learning_rate": 9.571871070629006e-05, "loss": 0.8479, "mean_token_accuracy": 0.7598730958998203, "num_tokens": 44581454.0, "step": 1397 }, { "entropy": 0.8466631025075912, "epoch": 0.12862490727482878, "grad_norm": 0.15988339483737946, "learning_rate": 9.571564388014845e-05, "loss": 0.8775, "mean_token_accuracy": 0.748354397714138, "num_tokens": 44613151.0, "step": 1398 }, { "entropy": 0.904773224145174, "epoch": 0.12871691364627, "grad_norm": 0.16558140516281128, "learning_rate": 9.571257705400681e-05, "loss": 0.9161, "mean_token_accuracy": 0.7479781620204449, "num_tokens": 44645257.0, "step": 1399 }, { "entropy": 0.9671018701046705, "epoch": 0.12880892001771121, "grad_norm": 0.1613721400499344, "learning_rate": 9.570951022786518e-05, "loss": 0.9679, "mean_token_accuracy": 0.7287022992968559, "num_tokens": 44677511.0, "step": 1400 }, { "entropy": 0.8655254878103733, "epoch": 0.12890092638915246, "grad_norm": 0.16883884370326996, "learning_rate": 9.570644340172355e-05, "loss": 0.8948, "mean_token_accuracy": 0.7485690638422966, "num_tokens": 44708779.0, "step": 1401 }, { "entropy": 0.9527161046862602, "epoch": 0.12899293276059368, "grad_norm": 0.17072026431560516, "learning_rate": 9.570337657558194e-05, "loss": 0.9447, "mean_token_accuracy": 0.730373527854681, "num_tokens": 44740716.0, "step": 1402 }, { "entropy": 0.8556098453700542, "epoch": 0.1290849391320349, "grad_norm": 0.15850068628787994, "learning_rate": 9.570030974944031e-05, "loss": 0.8613, "mean_token_accuracy": 0.7535067461431026, "num_tokens": 44772427.0, "step": 1403 }, { "entropy": 0.8870825320482254, "epoch": 0.1291769455034761, "grad_norm": 0.15278637409210205, "learning_rate": 9.569724292329868e-05, "loss": 0.8709, "mean_token_accuracy": 0.7515799291431904, "num_tokens": 44805064.0, "step": 1404 }, { "entropy": 0.8493108432739973, "epoch": 0.12926895187491733, "grad_norm": 0.14963141083717346, "learning_rate": 9.569417609715706e-05, "loss": 0.8281, "mean_token_accuracy": 0.7599457427859306, "num_tokens": 44837654.0, "step": 1405 }, { "entropy": 0.8674461226910353, "epoch": 0.12936095824635857, "grad_norm": 0.15199655294418335, "learning_rate": 9.569110927101543e-05, "loss": 0.8571, "mean_token_accuracy": 0.7571729980409145, "num_tokens": 44870215.0, "step": 1406 }, { "entropy": 0.9104496315121651, "epoch": 0.1294529646177998, "grad_norm": 0.15655122697353363, "learning_rate": 9.568804244487381e-05, "loss": 0.8933, "mean_token_accuracy": 0.747913122177124, "num_tokens": 44902098.0, "step": 1407 }, { "entropy": 0.8995660915970802, "epoch": 0.129544970989241, "grad_norm": 0.16437354683876038, "learning_rate": 9.568497561873218e-05, "loss": 0.891, "mean_token_accuracy": 0.7484185509383678, "num_tokens": 44934140.0, "step": 1408 }, { "entropy": 0.8376863431185484, "epoch": 0.12963697736068222, "grad_norm": 0.15102721750736237, "learning_rate": 9.568190879259056e-05, "loss": 0.8232, "mean_token_accuracy": 0.764384750276804, "num_tokens": 44966364.0, "step": 1409 }, { "entropy": 0.8983563557267189, "epoch": 0.12972898373212344, "grad_norm": 0.1639176458120346, "learning_rate": 9.567884196644893e-05, "loss": 0.8875, "mean_token_accuracy": 0.7487972751259804, "num_tokens": 44998373.0, "step": 1410 }, { "entropy": 0.8669734224677086, "epoch": 0.12982099010356468, "grad_norm": 0.15847107768058777, "learning_rate": 9.56757751403073e-05, "loss": 0.8695, "mean_token_accuracy": 0.7527007162570953, "num_tokens": 45029878.0, "step": 1411 }, { "entropy": 0.8699670396745205, "epoch": 0.1299129964750059, "grad_norm": 0.15936405956745148, "learning_rate": 9.567270831416568e-05, "loss": 0.8754, "mean_token_accuracy": 0.7521078325808048, "num_tokens": 45061832.0, "step": 1412 }, { "entropy": 0.8051696121692657, "epoch": 0.13000500284644712, "grad_norm": 0.15526987612247467, "learning_rate": 9.566964148802406e-05, "loss": 0.8063, "mean_token_accuracy": 0.7685359306633472, "num_tokens": 45093749.0, "step": 1413 }, { "entropy": 0.8304604254662991, "epoch": 0.13009700921788833, "grad_norm": 0.1628667712211609, "learning_rate": 9.566657466188243e-05, "loss": 0.8571, "mean_token_accuracy": 0.7583776526153088, "num_tokens": 45125833.0, "step": 1414 }, { "entropy": 0.8962295353412628, "epoch": 0.13018901558932955, "grad_norm": 0.15798132121562958, "learning_rate": 9.56635078357408e-05, "loss": 0.9252, "mean_token_accuracy": 0.7397789061069489, "num_tokens": 45158024.0, "step": 1415 }, { "entropy": 0.9412603136152029, "epoch": 0.1302810219607708, "grad_norm": 0.16267749667167664, "learning_rate": 9.566044100959916e-05, "loss": 0.9491, "mean_token_accuracy": 0.7322576493024826, "num_tokens": 45189322.0, "step": 1416 }, { "entropy": 0.8350544311106205, "epoch": 0.130373028332212, "grad_norm": 0.15579266846179962, "learning_rate": 9.565737418345754e-05, "loss": 0.8475, "mean_token_accuracy": 0.7550486177206039, "num_tokens": 45221525.0, "step": 1417 }, { "entropy": 0.7900904975831509, "epoch": 0.13046503470365323, "grad_norm": 0.15703168511390686, "learning_rate": 9.565430735731592e-05, "loss": 0.808, "mean_token_accuracy": 0.7669675126671791, "num_tokens": 45253331.0, "step": 1418 }, { "entropy": 0.8832404986023903, "epoch": 0.13055704107509444, "grad_norm": 0.1606397181749344, "learning_rate": 9.565124053117429e-05, "loss": 0.8835, "mean_token_accuracy": 0.7473745383322239, "num_tokens": 45285653.0, "step": 1419 }, { "entropy": 0.884585052728653, "epoch": 0.13064904744653566, "grad_norm": 0.15162524580955505, "learning_rate": 9.564817370503266e-05, "loss": 0.8717, "mean_token_accuracy": 0.7572435364127159, "num_tokens": 45317926.0, "step": 1420 }, { "entropy": 0.8618516884744167, "epoch": 0.1307410538179769, "grad_norm": 0.14983543753623962, "learning_rate": 9.564510687889104e-05, "loss": 0.8602, "mean_token_accuracy": 0.7534883841872215, "num_tokens": 45350301.0, "step": 1421 }, { "entropy": 0.8881712406873703, "epoch": 0.13083306018941812, "grad_norm": 0.15896674990653992, "learning_rate": 9.564204005274941e-05, "loss": 0.89, "mean_token_accuracy": 0.7489947788417339, "num_tokens": 45382194.0, "step": 1422 }, { "entropy": 1.0374965369701385, "epoch": 0.13092506656085934, "grad_norm": 0.16714240610599518, "learning_rate": 9.563897322660779e-05, "loss": 1.0217, "mean_token_accuracy": 0.7151946127414703, "num_tokens": 45414413.0, "step": 1423 }, { "entropy": 0.991882685571909, "epoch": 0.13101707293230055, "grad_norm": 0.16575656831264496, "learning_rate": 9.563590640046616e-05, "loss": 0.9945, "mean_token_accuracy": 0.718562126159668, "num_tokens": 45445484.0, "step": 1424 }, { "entropy": 0.9294509626924992, "epoch": 0.13110907930374177, "grad_norm": 0.15846474468708038, "learning_rate": 9.563283957432454e-05, "loss": 0.9117, "mean_token_accuracy": 0.7415791526436806, "num_tokens": 45477790.0, "step": 1425 }, { "entropy": 0.9414418786764145, "epoch": 0.13120108567518302, "grad_norm": 0.15932688117027283, "learning_rate": 9.562977274818291e-05, "loss": 0.9425, "mean_token_accuracy": 0.7337660267949104, "num_tokens": 45509966.0, "step": 1426 }, { "entropy": 0.899724468588829, "epoch": 0.13129309204662423, "grad_norm": 0.15942607820034027, "learning_rate": 9.562670592204128e-05, "loss": 0.9143, "mean_token_accuracy": 0.7456745393574238, "num_tokens": 45542145.0, "step": 1427 }, { "entropy": 0.8454543855041265, "epoch": 0.13138509841806545, "grad_norm": 0.16145804524421692, "learning_rate": 9.562363909589966e-05, "loss": 0.8399, "mean_token_accuracy": 0.7555093877017498, "num_tokens": 45573540.0, "step": 1428 }, { "entropy": 0.830769807100296, "epoch": 0.13147710478950667, "grad_norm": 0.15599028766155243, "learning_rate": 9.562057226975804e-05, "loss": 0.8504, "mean_token_accuracy": 0.756127867847681, "num_tokens": 45606059.0, "step": 1429 }, { "entropy": 0.8958615437150002, "epoch": 0.13156911116094788, "grad_norm": 0.15909335017204285, "learning_rate": 9.561750544361641e-05, "loss": 0.9109, "mean_token_accuracy": 0.7405203878879547, "num_tokens": 45638336.0, "step": 1430 }, { "entropy": 0.8807841539382935, "epoch": 0.13166111753238913, "grad_norm": 0.1510554701089859, "learning_rate": 9.561443861747478e-05, "loss": 0.8624, "mean_token_accuracy": 0.7528376281261444, "num_tokens": 45670330.0, "step": 1431 }, { "entropy": 1.0259534195065498, "epoch": 0.13175312390383034, "grad_norm": 0.16470204293727875, "learning_rate": 9.561137179133314e-05, "loss": 1.0252, "mean_token_accuracy": 0.7134462296962738, "num_tokens": 45701936.0, "step": 1432 }, { "entropy": 0.9712209701538086, "epoch": 0.13184513027527156, "grad_norm": 0.15517905354499817, "learning_rate": 9.560830496519152e-05, "loss": 0.9503, "mean_token_accuracy": 0.7307788021862507, "num_tokens": 45734261.0, "step": 1433 }, { "entropy": 1.0422740504145622, "epoch": 0.13193713664671278, "grad_norm": 0.16536995768547058, "learning_rate": 9.56052381390499e-05, "loss": 1.0218, "mean_token_accuracy": 0.7202978283166885, "num_tokens": 45765717.0, "step": 1434 }, { "entropy": 0.8892856333404779, "epoch": 0.132029143018154, "grad_norm": 0.15771764516830444, "learning_rate": 9.560217131290827e-05, "loss": 0.8981, "mean_token_accuracy": 0.7388820014894009, "num_tokens": 45797884.0, "step": 1435 }, { "entropy": 0.8051073830574751, "epoch": 0.13212114938959524, "grad_norm": 0.15174847841262817, "learning_rate": 9.559910448676666e-05, "loss": 0.8152, "mean_token_accuracy": 0.763037633150816, "num_tokens": 45830191.0, "step": 1436 }, { "entropy": 0.9558395482599735, "epoch": 0.13221315576103645, "grad_norm": 0.16841810941696167, "learning_rate": 9.559603766062502e-05, "loss": 0.965, "mean_token_accuracy": 0.7280736938118935, "num_tokens": 45862439.0, "step": 1437 }, { "entropy": 0.9421539343893528, "epoch": 0.13230516213247767, "grad_norm": 0.16177257895469666, "learning_rate": 9.559297083448339e-05, "loss": 0.9412, "mean_token_accuracy": 0.7356430999934673, "num_tokens": 45894635.0, "step": 1438 }, { "entropy": 0.957996055483818, "epoch": 0.1323971685039189, "grad_norm": 0.1660410612821579, "learning_rate": 9.558990400834177e-05, "loss": 0.9481, "mean_token_accuracy": 0.7355706579983234, "num_tokens": 45926189.0, "step": 1439 }, { "entropy": 0.8232878874987364, "epoch": 0.1324891748753601, "grad_norm": 0.15279632806777954, "learning_rate": 9.558683718220015e-05, "loss": 0.8207, "mean_token_accuracy": 0.7650743238627911, "num_tokens": 45957619.0, "step": 1440 }, { "entropy": 0.8591838888823986, "epoch": 0.13258118124680135, "grad_norm": 0.153257817029953, "learning_rate": 9.558377035605852e-05, "loss": 0.8848, "mean_token_accuracy": 0.7529977038502693, "num_tokens": 45989559.0, "step": 1441 }, { "entropy": 0.8238626755774021, "epoch": 0.13267318761824257, "grad_norm": 0.1557403802871704, "learning_rate": 9.558070352991689e-05, "loss": 0.8382, "mean_token_accuracy": 0.7654239237308502, "num_tokens": 46021306.0, "step": 1442 }, { "entropy": 0.984395120292902, "epoch": 0.13276519398968378, "grad_norm": 0.1676916778087616, "learning_rate": 9.557763670377526e-05, "loss": 0.9805, "mean_token_accuracy": 0.7303400635719299, "num_tokens": 46053086.0, "step": 1443 }, { "entropy": 0.8886575177311897, "epoch": 0.132857200361125, "grad_norm": 0.15613077580928802, "learning_rate": 9.557456987763365e-05, "loss": 0.8919, "mean_token_accuracy": 0.7450644709169865, "num_tokens": 46085399.0, "step": 1444 }, { "entropy": 0.9149897582828999, "epoch": 0.13294920673256622, "grad_norm": 0.1613151729106903, "learning_rate": 9.557150305149202e-05, "loss": 0.9141, "mean_token_accuracy": 0.7407809644937515, "num_tokens": 46116288.0, "step": 1445 }, { "entropy": 0.8291662000119686, "epoch": 0.13304121310400746, "grad_norm": 0.1582048386335373, "learning_rate": 9.556843622535039e-05, "loss": 0.8268, "mean_token_accuracy": 0.7661645747721195, "num_tokens": 46148607.0, "step": 1446 }, { "entropy": 0.951840054243803, "epoch": 0.13313321947544868, "grad_norm": 0.16414111852645874, "learning_rate": 9.556536939920876e-05, "loss": 0.9642, "mean_token_accuracy": 0.7255589812994003, "num_tokens": 46180393.0, "step": 1447 }, { "entropy": 0.9651191756129265, "epoch": 0.1332252258468899, "grad_norm": 0.1618623286485672, "learning_rate": 9.556230257306714e-05, "loss": 0.9807, "mean_token_accuracy": 0.7258917205035686, "num_tokens": 46212271.0, "step": 1448 }, { "entropy": 1.0434480756521225, "epoch": 0.1333172322183311, "grad_norm": 0.16256369650363922, "learning_rate": 9.555923574692552e-05, "loss": 1.0313, "mean_token_accuracy": 0.7154682017862797, "num_tokens": 46244359.0, "step": 1449 }, { "entropy": 0.8898940347135067, "epoch": 0.13340923858977236, "grad_norm": 0.15305295586585999, "learning_rate": 9.555616892078389e-05, "loss": 0.8708, "mean_token_accuracy": 0.7529643960297108, "num_tokens": 46275908.0, "step": 1450 }, { "entropy": 0.8457957338541746, "epoch": 0.13350124496121357, "grad_norm": 0.15215720236301422, "learning_rate": 9.555310209464225e-05, "loss": 0.8461, "mean_token_accuracy": 0.7600013390183449, "num_tokens": 46308148.0, "step": 1451 }, { "entropy": 0.8477643057703972, "epoch": 0.1335932513326548, "grad_norm": 0.15866334736347198, "learning_rate": 9.555003526850064e-05, "loss": 0.8166, "mean_token_accuracy": 0.7661799043416977, "num_tokens": 46338730.0, "step": 1452 }, { "entropy": 0.8573301117867231, "epoch": 0.133685257704096, "grad_norm": 0.15068146586418152, "learning_rate": 9.5546968442359e-05, "loss": 0.8414, "mean_token_accuracy": 0.7616315670311451, "num_tokens": 46371147.0, "step": 1453 }, { "entropy": 0.8572186846286058, "epoch": 0.13377726407553722, "grad_norm": 0.15416494011878967, "learning_rate": 9.554390161621739e-05, "loss": 0.8502, "mean_token_accuracy": 0.7541092596948147, "num_tokens": 46403377.0, "step": 1454 }, { "entropy": 0.9415202960371971, "epoch": 0.13386927044697847, "grad_norm": 0.1650015413761139, "learning_rate": 9.554083479007575e-05, "loss": 0.9504, "mean_token_accuracy": 0.7292389497160912, "num_tokens": 46434624.0, "step": 1455 }, { "entropy": 1.0338180717080832, "epoch": 0.13396127681841968, "grad_norm": 0.1708630621433258, "learning_rate": 9.553776796393413e-05, "loss": 1.0459, "mean_token_accuracy": 0.710181187838316, "num_tokens": 46466625.0, "step": 1456 }, { "entropy": 0.890923760831356, "epoch": 0.1340532831898609, "grad_norm": 0.1639585942029953, "learning_rate": 9.55347011377925e-05, "loss": 0.9174, "mean_token_accuracy": 0.7409874685108662, "num_tokens": 46498859.0, "step": 1457 }, { "entropy": 0.7902647480368614, "epoch": 0.13414528956130212, "grad_norm": 0.15480412542819977, "learning_rate": 9.553163431165087e-05, "loss": 0.7869, "mean_token_accuracy": 0.7682091109454632, "num_tokens": 46530861.0, "step": 1458 }, { "entropy": 0.9016091823577881, "epoch": 0.13423729593274333, "grad_norm": 0.167546346783638, "learning_rate": 9.552856748550925e-05, "loss": 0.9042, "mean_token_accuracy": 0.7400625944137573, "num_tokens": 46561437.0, "step": 1459 }, { "entropy": 0.9803922958672047, "epoch": 0.13432930230418458, "grad_norm": 0.16903378069400787, "learning_rate": 9.552550065936763e-05, "loss": 1.0007, "mean_token_accuracy": 0.7213688008487225, "num_tokens": 46592797.0, "step": 1460 }, { "entropy": 0.9514728561043739, "epoch": 0.1344213086756258, "grad_norm": 0.16266781091690063, "learning_rate": 9.5522433833226e-05, "loss": 0.9538, "mean_token_accuracy": 0.7330202981829643, "num_tokens": 46624232.0, "step": 1461 }, { "entropy": 0.8207721151411533, "epoch": 0.134513315047067, "grad_norm": 0.15729418396949768, "learning_rate": 9.551936700708437e-05, "loss": 0.8232, "mean_token_accuracy": 0.7674405314028263, "num_tokens": 46656125.0, "step": 1462 }, { "entropy": 0.9634261578321457, "epoch": 0.13460532141850823, "grad_norm": 0.17248524725437164, "learning_rate": 9.551630018094274e-05, "loss": 0.9809, "mean_token_accuracy": 0.7236034795641899, "num_tokens": 46686896.0, "step": 1463 }, { "entropy": 0.9230004139244556, "epoch": 0.13469732778994944, "grad_norm": 0.15707097947597504, "learning_rate": 9.551323335480112e-05, "loss": 0.9109, "mean_token_accuracy": 0.7411488257348537, "num_tokens": 46718927.0, "step": 1464 }, { "entropy": 0.8120103217661381, "epoch": 0.1347893341613907, "grad_norm": 0.14958244562149048, "learning_rate": 9.55101665286595e-05, "loss": 0.7927, "mean_token_accuracy": 0.7734591253101826, "num_tokens": 46751046.0, "step": 1465 }, { "entropy": 0.9720970839262009, "epoch": 0.1348813405328319, "grad_norm": 0.16194313764572144, "learning_rate": 9.550709970251787e-05, "loss": 0.9734, "mean_token_accuracy": 0.7252835631370544, "num_tokens": 46783194.0, "step": 1466 }, { "entropy": 0.8762975186109543, "epoch": 0.13497334690427312, "grad_norm": 0.1605098992586136, "learning_rate": 9.550403287637625e-05, "loss": 0.8747, "mean_token_accuracy": 0.7494844533503056, "num_tokens": 46814558.0, "step": 1467 }, { "entropy": 1.0193149112164974, "epoch": 0.13506535327571434, "grad_norm": 0.16349397599697113, "learning_rate": 9.550096605023462e-05, "loss": 1.0085, "mean_token_accuracy": 0.7192102633416653, "num_tokens": 46846872.0, "step": 1468 }, { "entropy": 0.8644775934517384, "epoch": 0.13515735964715556, "grad_norm": 0.15632364153862, "learning_rate": 9.549789922409298e-05, "loss": 0.8657, "mean_token_accuracy": 0.758609127253294, "num_tokens": 46878288.0, "step": 1469 }, { "entropy": 0.9141164738684893, "epoch": 0.1352493660185968, "grad_norm": 0.16748885810375214, "learning_rate": 9.549483239795137e-05, "loss": 0.9252, "mean_token_accuracy": 0.737995482981205, "num_tokens": 46910152.0, "step": 1470 }, { "entropy": 0.8981011733412743, "epoch": 0.13534137239003802, "grad_norm": 0.15873192250728607, "learning_rate": 9.549176557180975e-05, "loss": 0.9334, "mean_token_accuracy": 0.741527620702982, "num_tokens": 46942594.0, "step": 1471 }, { "entropy": 0.8247240036725998, "epoch": 0.13543337876147923, "grad_norm": 0.15040016174316406, "learning_rate": 9.548869874566812e-05, "loss": 0.8162, "mean_token_accuracy": 0.7664057724177837, "num_tokens": 46974892.0, "step": 1472 }, { "entropy": 0.7996957898139954, "epoch": 0.13552538513292045, "grad_norm": 0.15322554111480713, "learning_rate": 9.548563191952648e-05, "loss": 0.7901, "mean_token_accuracy": 0.7710999585688114, "num_tokens": 47005454.0, "step": 1473 }, { "entropy": 0.8677499089390039, "epoch": 0.13561739150436167, "grad_norm": 0.15616901218891144, "learning_rate": 9.548256509338485e-05, "loss": 0.8612, "mean_token_accuracy": 0.7536361999809742, "num_tokens": 47037199.0, "step": 1474 }, { "entropy": 0.9226998798549175, "epoch": 0.1357093978758029, "grad_norm": 0.16280454397201538, "learning_rate": 9.547949826724325e-05, "loss": 0.9352, "mean_token_accuracy": 0.7386032938957214, "num_tokens": 47068972.0, "step": 1475 }, { "entropy": 0.8511421792209148, "epoch": 0.13580140424724413, "grad_norm": 0.15268120169639587, "learning_rate": 9.547643144110161e-05, "loss": 0.8197, "mean_token_accuracy": 0.7648099288344383, "num_tokens": 47100795.0, "step": 1476 }, { "entropy": 0.991644598543644, "epoch": 0.13589341061868535, "grad_norm": 0.16335169970989227, "learning_rate": 9.547336461495998e-05, "loss": 0.9976, "mean_token_accuracy": 0.7279123477637768, "num_tokens": 47132512.0, "step": 1477 }, { "entropy": 0.9475472010672092, "epoch": 0.13598541699012656, "grad_norm": 0.1582222878932953, "learning_rate": 9.547029778881835e-05, "loss": 0.9246, "mean_token_accuracy": 0.7349614687263966, "num_tokens": 47164785.0, "step": 1478 }, { "entropy": 0.8885447606444359, "epoch": 0.13607742336156778, "grad_norm": 0.1621338278055191, "learning_rate": 9.546723096267673e-05, "loss": 0.893, "mean_token_accuracy": 0.7510957531630993, "num_tokens": 47196582.0, "step": 1479 }, { "entropy": 0.9588793590664864, "epoch": 0.13616942973300902, "grad_norm": 0.16168516874313354, "learning_rate": 9.546416413653511e-05, "loss": 0.9617, "mean_token_accuracy": 0.7329396195709705, "num_tokens": 47228827.0, "step": 1480 }, { "entropy": 0.8150004111230373, "epoch": 0.13626143610445024, "grad_norm": 0.15117791295051575, "learning_rate": 9.546109731039348e-05, "loss": 0.8132, "mean_token_accuracy": 0.7682842388749123, "num_tokens": 47260496.0, "step": 1481 }, { "entropy": 0.9063622020184994, "epoch": 0.13635344247589146, "grad_norm": 0.16281457245349884, "learning_rate": 9.545803048425185e-05, "loss": 0.9158, "mean_token_accuracy": 0.7445373684167862, "num_tokens": 47291856.0, "step": 1482 }, { "entropy": 0.8509590812027454, "epoch": 0.13644544884733267, "grad_norm": 0.1577964723110199, "learning_rate": 9.545496365811023e-05, "loss": 0.8518, "mean_token_accuracy": 0.76293920353055, "num_tokens": 47323829.0, "step": 1483 }, { "entropy": 0.869157712906599, "epoch": 0.1365374552187739, "grad_norm": 0.15847274661064148, "learning_rate": 9.54518968319686e-05, "loss": 0.8949, "mean_token_accuracy": 0.7520448453724384, "num_tokens": 47356024.0, "step": 1484 }, { "entropy": 0.8899447582662106, "epoch": 0.13662946159021513, "grad_norm": 0.15856720507144928, "learning_rate": 9.544883000582698e-05, "loss": 0.8927, "mean_token_accuracy": 0.7470324896275997, "num_tokens": 47387872.0, "step": 1485 }, { "entropy": 0.8399642929434776, "epoch": 0.13672146796165635, "grad_norm": 0.15805940330028534, "learning_rate": 9.544576317968535e-05, "loss": 0.8435, "mean_token_accuracy": 0.7591837681829929, "num_tokens": 47419440.0, "step": 1486 }, { "entropy": 0.862132953479886, "epoch": 0.13681347433309757, "grad_norm": 0.15930739045143127, "learning_rate": 9.544269635354373e-05, "loss": 0.8506, "mean_token_accuracy": 0.7596270404756069, "num_tokens": 47450738.0, "step": 1487 }, { "entropy": 0.9156553968787193, "epoch": 0.13690548070453878, "grad_norm": 0.16053490340709686, "learning_rate": 9.54396295274021e-05, "loss": 0.9215, "mean_token_accuracy": 0.7399528473615646, "num_tokens": 47482652.0, "step": 1488 }, { "entropy": 0.8765908479690552, "epoch": 0.13699748707598, "grad_norm": 0.15102703869342804, "learning_rate": 9.543656270126046e-05, "loss": 0.8642, "mean_token_accuracy": 0.7519312389194965, "num_tokens": 47515203.0, "step": 1489 }, { "entropy": 0.929722972214222, "epoch": 0.13708949344742125, "grad_norm": 0.16479045152664185, "learning_rate": 9.543349587511885e-05, "loss": 0.934, "mean_token_accuracy": 0.7361554466187954, "num_tokens": 47545946.0, "step": 1490 }, { "entropy": 0.8781662285327911, "epoch": 0.13718149981886246, "grad_norm": 0.15641742944717407, "learning_rate": 9.543042904897723e-05, "loss": 0.871, "mean_token_accuracy": 0.7544177807867527, "num_tokens": 47578279.0, "step": 1491 }, { "entropy": 0.9010445736348629, "epoch": 0.13727350619030368, "grad_norm": 0.15929129719734192, "learning_rate": 9.54273622228356e-05, "loss": 0.8675, "mean_token_accuracy": 0.7536949478089809, "num_tokens": 47609756.0, "step": 1492 }, { "entropy": 0.8101601470261812, "epoch": 0.1373655125617449, "grad_norm": 0.15118253231048584, "learning_rate": 9.542429539669396e-05, "loss": 0.8021, "mean_token_accuracy": 0.769440121948719, "num_tokens": 47641689.0, "step": 1493 }, { "entropy": 0.9826366417109966, "epoch": 0.1374575189331861, "grad_norm": 0.17489178478717804, "learning_rate": 9.542122857055233e-05, "loss": 0.9801, "mean_token_accuracy": 0.7230763360857964, "num_tokens": 47673512.0, "step": 1494 }, { "entropy": 0.9948286898434162, "epoch": 0.13754952530462736, "grad_norm": 0.16823458671569824, "learning_rate": 9.541816174441071e-05, "loss": 1.0026, "mean_token_accuracy": 0.7178121320903301, "num_tokens": 47705429.0, "step": 1495 }, { "entropy": 0.903372161090374, "epoch": 0.13764153167606857, "grad_norm": 0.1602449119091034, "learning_rate": 9.54150949182691e-05, "loss": 0.9228, "mean_token_accuracy": 0.7376360595226288, "num_tokens": 47737783.0, "step": 1496 }, { "entropy": 0.8364967592060566, "epoch": 0.1377335380475098, "grad_norm": 0.15546752512454987, "learning_rate": 9.541202809212746e-05, "loss": 0.8458, "mean_token_accuracy": 0.7578377984464169, "num_tokens": 47770370.0, "step": 1497 }, { "entropy": 0.9463928639888763, "epoch": 0.137825544418951, "grad_norm": 0.16655172407627106, "learning_rate": 9.540896126598584e-05, "loss": 0.9558, "mean_token_accuracy": 0.7322683446109295, "num_tokens": 47802731.0, "step": 1498 }, { "entropy": 0.9242000319063663, "epoch": 0.13791755079039222, "grad_norm": 0.1686069816350937, "learning_rate": 9.540589443984421e-05, "loss": 0.9812, "mean_token_accuracy": 0.7295314557850361, "num_tokens": 47834965.0, "step": 1499 }, { "entropy": 0.8720885049551725, "epoch": 0.13800955716183347, "grad_norm": 0.15979434549808502, "learning_rate": 9.540282761370258e-05, "loss": 0.8728, "mean_token_accuracy": 0.7521369494497776, "num_tokens": 47866879.0, "step": 1500 }, { "entropy": 0.9144723750650883, "epoch": 0.13810156353327468, "grad_norm": 0.16163739562034607, "learning_rate": 9.539976078756096e-05, "loss": 0.9218, "mean_token_accuracy": 0.7431746833026409, "num_tokens": 47899104.0, "step": 1501 }, { "entropy": 0.9037791453301907, "epoch": 0.1381935699047159, "grad_norm": 0.16473473608493805, "learning_rate": 9.539669396141934e-05, "loss": 0.8989, "mean_token_accuracy": 0.7471611127257347, "num_tokens": 47929641.0, "step": 1502 }, { "entropy": 0.873839758336544, "epoch": 0.13828557627615712, "grad_norm": 0.15165023505687714, "learning_rate": 9.539362713527771e-05, "loss": 0.8597, "mean_token_accuracy": 0.7544801756739616, "num_tokens": 47962107.0, "step": 1503 }, { "entropy": 0.9012771509587765, "epoch": 0.13837758264759834, "grad_norm": 0.15976887941360474, "learning_rate": 9.539056030913608e-05, "loss": 0.8758, "mean_token_accuracy": 0.7531430572271347, "num_tokens": 47994049.0, "step": 1504 }, { "entropy": 0.9222031719982624, "epoch": 0.13846958901903958, "grad_norm": 0.15270550549030304, "learning_rate": 9.538749348299444e-05, "loss": 0.8901, "mean_token_accuracy": 0.7466108947992325, "num_tokens": 48026817.0, "step": 1505 }, { "entropy": 0.8834109716117382, "epoch": 0.1385615953904808, "grad_norm": 0.1656990349292755, "learning_rate": 9.538442665685283e-05, "loss": 0.8857, "mean_token_accuracy": 0.7494886107742786, "num_tokens": 48057884.0, "step": 1506 }, { "entropy": 0.8789761662483215, "epoch": 0.138653601761922, "grad_norm": 0.15314273536205292, "learning_rate": 9.538135983071121e-05, "loss": 0.8744, "mean_token_accuracy": 0.7524401769042015, "num_tokens": 48090408.0, "step": 1507 }, { "entropy": 0.860306516289711, "epoch": 0.13874560813336323, "grad_norm": 0.1534280776977539, "learning_rate": 9.537829300456958e-05, "loss": 0.851, "mean_token_accuracy": 0.7576924115419388, "num_tokens": 48122294.0, "step": 1508 }, { "entropy": 0.933868020772934, "epoch": 0.13883761450480445, "grad_norm": 0.15948344767093658, "learning_rate": 9.537522617842794e-05, "loss": 0.9322, "mean_token_accuracy": 0.7369281835854053, "num_tokens": 48154367.0, "step": 1509 }, { "entropy": 0.9980332925915718, "epoch": 0.1389296208762457, "grad_norm": 0.1685190349817276, "learning_rate": 9.537215935228632e-05, "loss": 1.0021, "mean_token_accuracy": 0.7187242805957794, "num_tokens": 48185814.0, "step": 1510 }, { "entropy": 0.8835068270564079, "epoch": 0.1390216272476869, "grad_norm": 0.1598827838897705, "learning_rate": 9.536909252614469e-05, "loss": 0.8939, "mean_token_accuracy": 0.746815487742424, "num_tokens": 48217618.0, "step": 1511 }, { "entropy": 0.8843892924487591, "epoch": 0.13911363361912812, "grad_norm": 0.16501133143901825, "learning_rate": 9.536602570000307e-05, "loss": 0.8891, "mean_token_accuracy": 0.74925871565938, "num_tokens": 48249118.0, "step": 1512 }, { "entropy": 0.9995120503008366, "epoch": 0.13920563999056934, "grad_norm": 0.17007550597190857, "learning_rate": 9.536295887386144e-05, "loss": 1.015, "mean_token_accuracy": 0.7165202684700489, "num_tokens": 48280919.0, "step": 1513 }, { "entropy": 0.9234212972223759, "epoch": 0.13929764636201056, "grad_norm": 0.16136333346366882, "learning_rate": 9.535989204771982e-05, "loss": 0.9346, "mean_token_accuracy": 0.7414928078651428, "num_tokens": 48312907.0, "step": 1514 }, { "entropy": 0.785212080925703, "epoch": 0.1393896527334518, "grad_norm": 0.1573466956615448, "learning_rate": 9.535682522157819e-05, "loss": 0.7782, "mean_token_accuracy": 0.7797213345766068, "num_tokens": 48344096.0, "step": 1515 }, { "entropy": 0.872599221765995, "epoch": 0.13948165910489302, "grad_norm": 0.15678797662258148, "learning_rate": 9.535375839543656e-05, "loss": 0.8743, "mean_token_accuracy": 0.7531127072870731, "num_tokens": 48375872.0, "step": 1516 }, { "entropy": 0.93693882599473, "epoch": 0.13957366547633424, "grad_norm": 0.1591949164867401, "learning_rate": 9.535069156929494e-05, "loss": 0.9506, "mean_token_accuracy": 0.7316819168627262, "num_tokens": 48408547.0, "step": 1517 }, { "entropy": 0.9289727360010147, "epoch": 0.13966567184777545, "grad_norm": 0.16631434857845306, "learning_rate": 9.534762474315332e-05, "loss": 0.9378, "mean_token_accuracy": 0.7328994087874889, "num_tokens": 48440266.0, "step": 1518 }, { "entropy": 0.8922602757811546, "epoch": 0.13975767821921667, "grad_norm": 0.1614350825548172, "learning_rate": 9.534455791701169e-05, "loss": 0.8898, "mean_token_accuracy": 0.7465514466166496, "num_tokens": 48470750.0, "step": 1519 }, { "entropy": 0.8415650241076946, "epoch": 0.1398496845906579, "grad_norm": 0.15855540335178375, "learning_rate": 9.534149109087006e-05, "loss": 0.8539, "mean_token_accuracy": 0.7541022598743439, "num_tokens": 48501446.0, "step": 1520 }, { "entropy": 0.8369389250874519, "epoch": 0.13994169096209913, "grad_norm": 0.15269261598587036, "learning_rate": 9.533842426472843e-05, "loss": 0.8317, "mean_token_accuracy": 0.761881809681654, "num_tokens": 48533915.0, "step": 1521 }, { "entropy": 0.9087646678090096, "epoch": 0.14003369733354035, "grad_norm": 0.17284798622131348, "learning_rate": 9.533535743858682e-05, "loss": 0.9193, "mean_token_accuracy": 0.7405981458723545, "num_tokens": 48565896.0, "step": 1522 }, { "entropy": 0.920044731348753, "epoch": 0.14012570370498156, "grad_norm": 0.1634625345468521, "learning_rate": 9.533229061244519e-05, "loss": 0.9436, "mean_token_accuracy": 0.7330580167472363, "num_tokens": 48598362.0, "step": 1523 }, { "entropy": 0.9196216017007828, "epoch": 0.14021771007642278, "grad_norm": 0.16235344111919403, "learning_rate": 9.532922378630356e-05, "loss": 0.8987, "mean_token_accuracy": 0.7421354539692402, "num_tokens": 48629908.0, "step": 1524 }, { "entropy": 0.9084957912564278, "epoch": 0.14030971644786402, "grad_norm": 0.16361317038536072, "learning_rate": 9.532615696016192e-05, "loss": 0.8956, "mean_token_accuracy": 0.7468879707157612, "num_tokens": 48661682.0, "step": 1525 }, { "entropy": 0.9380924291908741, "epoch": 0.14040172281930524, "grad_norm": 0.16031771898269653, "learning_rate": 9.53230901340203e-05, "loss": 0.944, "mean_token_accuracy": 0.7310221381485462, "num_tokens": 48693758.0, "step": 1526 }, { "entropy": 0.8924711793661118, "epoch": 0.14049372919074646, "grad_norm": 0.15422584116458893, "learning_rate": 9.532002330787869e-05, "loss": 0.8683, "mean_token_accuracy": 0.7507140003144741, "num_tokens": 48725666.0, "step": 1527 }, { "entropy": 0.9133307598531246, "epoch": 0.14058573556218767, "grad_norm": 0.16041408479213715, "learning_rate": 9.531695648173705e-05, "loss": 0.9084, "mean_token_accuracy": 0.7393610663712025, "num_tokens": 48757335.0, "step": 1528 }, { "entropy": 0.935918066650629, "epoch": 0.1406777419336289, "grad_norm": 0.162759929895401, "learning_rate": 9.531388965559544e-05, "loss": 0.9205, "mean_token_accuracy": 0.7380355782806873, "num_tokens": 48789253.0, "step": 1529 }, { "entropy": 0.8984809126704931, "epoch": 0.14076974830507014, "grad_norm": 0.15972734987735748, "learning_rate": 9.53108228294538e-05, "loss": 0.9031, "mean_token_accuracy": 0.7473898828029633, "num_tokens": 48821227.0, "step": 1530 }, { "entropy": 0.9905790127813816, "epoch": 0.14086175467651135, "grad_norm": 0.16385893523693085, "learning_rate": 9.530775600331217e-05, "loss": 0.9924, "mean_token_accuracy": 0.7238439582288265, "num_tokens": 48853699.0, "step": 1531 }, { "entropy": 0.8665602579712868, "epoch": 0.14095376104795257, "grad_norm": 0.1583719104528427, "learning_rate": 9.530468917717055e-05, "loss": 0.8892, "mean_token_accuracy": 0.7493539080023766, "num_tokens": 48885328.0, "step": 1532 }, { "entropy": 0.7871650364249945, "epoch": 0.14104576741939379, "grad_norm": 0.1514895260334015, "learning_rate": 9.530162235102893e-05, "loss": 0.7903, "mean_token_accuracy": 0.7727830708026886, "num_tokens": 48917072.0, "step": 1533 }, { "entropy": 0.9596593640744686, "epoch": 0.141137773790835, "grad_norm": 0.16787609457969666, "learning_rate": 9.52985555248873e-05, "loss": 0.9763, "mean_token_accuracy": 0.7321631051599979, "num_tokens": 48948940.0, "step": 1534 }, { "entropy": 0.7926683686673641, "epoch": 0.14122978016227625, "grad_norm": 0.1529580056667328, "learning_rate": 9.529548869874567e-05, "loss": 0.7771, "mean_token_accuracy": 0.7764681428670883, "num_tokens": 48980773.0, "step": 1535 }, { "entropy": 0.9480520263314247, "epoch": 0.14132178653371746, "grad_norm": 0.16902871429920197, "learning_rate": 9.529242187260404e-05, "loss": 0.9544, "mean_token_accuracy": 0.7349111922085285, "num_tokens": 49012472.0, "step": 1536 }, { "entropy": 0.9515025764703751, "epoch": 0.14141379290515868, "grad_norm": 0.16660866141319275, "learning_rate": 9.528935504646242e-05, "loss": 0.9646, "mean_token_accuracy": 0.7285832278430462, "num_tokens": 49044155.0, "step": 1537 }, { "entropy": 0.9830679893493652, "epoch": 0.1415057992765999, "grad_norm": 0.1669303923845291, "learning_rate": 9.52862882203208e-05, "loss": 0.9926, "mean_token_accuracy": 0.7214728817343712, "num_tokens": 49075698.0, "step": 1538 }, { "entropy": 0.9938245601952076, "epoch": 0.14159780564804111, "grad_norm": 0.1661204695701599, "learning_rate": 9.528322139417917e-05, "loss": 0.9988, "mean_token_accuracy": 0.7248219549655914, "num_tokens": 49106781.0, "step": 1539 }, { "entropy": 0.9125274457037449, "epoch": 0.14168981201948236, "grad_norm": 0.15893520414829254, "learning_rate": 9.528015456803754e-05, "loss": 0.889, "mean_token_accuracy": 0.7503414042294025, "num_tokens": 49138895.0, "step": 1540 }, { "entropy": 0.8700472079217434, "epoch": 0.14178181839092358, "grad_norm": 0.1545281857252121, "learning_rate": 9.527708774189592e-05, "loss": 0.8607, "mean_token_accuracy": 0.7518544606864452, "num_tokens": 49171080.0, "step": 1541 }, { "entropy": 0.9424622878432274, "epoch": 0.1418738247623648, "grad_norm": 0.16081099212169647, "learning_rate": 9.527402091575429e-05, "loss": 0.9429, "mean_token_accuracy": 0.738890890032053, "num_tokens": 49203435.0, "step": 1542 }, { "entropy": 0.9055228345096111, "epoch": 0.141965831133806, "grad_norm": 0.15805533528327942, "learning_rate": 9.527095408961267e-05, "loss": 0.903, "mean_token_accuracy": 0.7435910925269127, "num_tokens": 49235070.0, "step": 1543 }, { "entropy": 1.024103932082653, "epoch": 0.14205783750524723, "grad_norm": 0.17289242148399353, "learning_rate": 9.526788726347104e-05, "loss": 1.0322, "mean_token_accuracy": 0.7105959802865982, "num_tokens": 49266629.0, "step": 1544 }, { "entropy": 0.9870683625340462, "epoch": 0.14214984387668847, "grad_norm": 0.1672264039516449, "learning_rate": 9.526482043732942e-05, "loss": 0.9879, "mean_token_accuracy": 0.7192868515849113, "num_tokens": 49298827.0, "step": 1545 }, { "entropy": 0.8665574379265308, "epoch": 0.1422418502481297, "grad_norm": 0.16494561731815338, "learning_rate": 9.526175361118778e-05, "loss": 0.8826, "mean_token_accuracy": 0.7542853578925133, "num_tokens": 49331036.0, "step": 1546 }, { "entropy": 0.9165347069501877, "epoch": 0.1423338566195709, "grad_norm": 0.16177764534950256, "learning_rate": 9.525868678504615e-05, "loss": 0.9363, "mean_token_accuracy": 0.7352379523217678, "num_tokens": 49362332.0, "step": 1547 }, { "entropy": 1.0385689958930016, "epoch": 0.14242586299101212, "grad_norm": 0.1670178472995758, "learning_rate": 9.525561995890453e-05, "loss": 1.0408, "mean_token_accuracy": 0.7058207131922245, "num_tokens": 49394656.0, "step": 1548 }, { "entropy": 0.9335563387721777, "epoch": 0.14251786936245334, "grad_norm": 0.16502214968204498, "learning_rate": 9.525255313276292e-05, "loss": 0.9268, "mean_token_accuracy": 0.7365954034030437, "num_tokens": 49426241.0, "step": 1549 }, { "entropy": 0.8997564129531384, "epoch": 0.14260987573389458, "grad_norm": 0.15600638091564178, "learning_rate": 9.524948630662128e-05, "loss": 0.9005, "mean_token_accuracy": 0.7421587593853474, "num_tokens": 49458019.0, "step": 1550 }, { "entropy": 0.9630580693483353, "epoch": 0.1427018821053358, "grad_norm": 0.1570965051651001, "learning_rate": 9.524641948047965e-05, "loss": 0.9537, "mean_token_accuracy": 0.7331337705254555, "num_tokens": 49490724.0, "step": 1551 }, { "entropy": 0.8782177157700062, "epoch": 0.14279388847677701, "grad_norm": 0.15707643330097198, "learning_rate": 9.524335265433802e-05, "loss": 0.8689, "mean_token_accuracy": 0.7549863681197166, "num_tokens": 49523358.0, "step": 1552 }, { "entropy": 0.9765381813049316, "epoch": 0.14288589484821823, "grad_norm": 0.16169218719005585, "learning_rate": 9.52402858281964e-05, "loss": 0.9891, "mean_token_accuracy": 0.7207485735416412, "num_tokens": 49555207.0, "step": 1553 }, { "entropy": 0.8779881037771702, "epoch": 0.14297790121965945, "grad_norm": 0.15375083684921265, "learning_rate": 9.523721900205478e-05, "loss": 0.8582, "mean_token_accuracy": 0.7555305399000645, "num_tokens": 49587012.0, "step": 1554 }, { "entropy": 0.970871202647686, "epoch": 0.1430699075911007, "grad_norm": 0.16862569749355316, "learning_rate": 9.523415217591315e-05, "loss": 0.9559, "mean_token_accuracy": 0.7329207547008991, "num_tokens": 49618509.0, "step": 1555 }, { "entropy": 0.9228195361793041, "epoch": 0.1431619139625419, "grad_norm": 0.1545485556125641, "learning_rate": 9.523108534977152e-05, "loss": 0.892, "mean_token_accuracy": 0.747595239430666, "num_tokens": 49650944.0, "step": 1556 }, { "entropy": 1.0221968218684196, "epoch": 0.14325392033398313, "grad_norm": 0.16275210678577423, "learning_rate": 9.52280185236299e-05, "loss": 1.0181, "mean_token_accuracy": 0.7139876931905746, "num_tokens": 49682425.0, "step": 1557 }, { "entropy": 0.8230613321065903, "epoch": 0.14334592670542434, "grad_norm": 0.1514221876859665, "learning_rate": 9.522495169748827e-05, "loss": 0.8292, "mean_token_accuracy": 0.7596264705061913, "num_tokens": 49714801.0, "step": 1558 }, { "entropy": 0.830515656620264, "epoch": 0.14343793307686556, "grad_norm": 0.14815635979175568, "learning_rate": 9.522188487134665e-05, "loss": 0.8202, "mean_token_accuracy": 0.7649087533354759, "num_tokens": 49746272.0, "step": 1559 }, { "entropy": 0.8281339034438133, "epoch": 0.1435299394483068, "grad_norm": 0.15298017859458923, "learning_rate": 9.521881804520503e-05, "loss": 0.8104, "mean_token_accuracy": 0.7703306190669537, "num_tokens": 49777762.0, "step": 1560 }, { "entropy": 0.9009035006165504, "epoch": 0.14362194581974802, "grad_norm": 0.15961822867393494, "learning_rate": 9.52157512190634e-05, "loss": 0.8866, "mean_token_accuracy": 0.748963724821806, "num_tokens": 49810102.0, "step": 1561 }, { "entropy": 1.000514842569828, "epoch": 0.14371395219118924, "grad_norm": 0.1680361032485962, "learning_rate": 9.521268439292177e-05, "loss": 1.0284, "mean_token_accuracy": 0.7126848436892033, "num_tokens": 49842213.0, "step": 1562 }, { "entropy": 0.8935029655694962, "epoch": 0.14380595856263045, "grad_norm": 0.15975192189216614, "learning_rate": 9.520961756678015e-05, "loss": 0.9051, "mean_token_accuracy": 0.7460601069033146, "num_tokens": 49873433.0, "step": 1563 }, { "entropy": 0.7654416114091873, "epoch": 0.1438979649340717, "grad_norm": 0.15598370134830475, "learning_rate": 9.520655074063853e-05, "loss": 0.7936, "mean_token_accuracy": 0.7714344710111618, "num_tokens": 49905852.0, "step": 1564 }, { "entropy": 0.8499294575303793, "epoch": 0.14398997130551291, "grad_norm": 0.1578521579504013, "learning_rate": 9.52034839144969e-05, "loss": 0.8671, "mean_token_accuracy": 0.7553885504603386, "num_tokens": 49938458.0, "step": 1565 }, { "entropy": 0.9480381943285465, "epoch": 0.14408197767695413, "grad_norm": 0.16868247091770172, "learning_rate": 9.520041708835526e-05, "loss": 0.9801, "mean_token_accuracy": 0.7241949401795864, "num_tokens": 49970725.0, "step": 1566 }, { "entropy": 0.9170596860349178, "epoch": 0.14417398404839535, "grad_norm": 23.895511627197266, "learning_rate": 9.519735026221363e-05, "loss": 1.2885, "mean_token_accuracy": 0.7296508736908436, "num_tokens": 50001669.0, "step": 1567 }, { "entropy": 0.9274100437760353, "epoch": 0.14426599041983657, "grad_norm": 0.411363810300827, "learning_rate": 9.519428343607201e-05, "loss": 0.9537, "mean_token_accuracy": 0.7330594472587109, "num_tokens": 50033113.0, "step": 1568 }, { "entropy": 0.9212099947035313, "epoch": 0.1443579967912778, "grad_norm": 0.31847384572029114, "learning_rate": 9.51912166099304e-05, "loss": 0.9445, "mean_token_accuracy": 0.7430686056613922, "num_tokens": 50064945.0, "step": 1569 }, { "entropy": 0.9685227833688259, "epoch": 0.14445000316271903, "grad_norm": 0.16561812162399292, "learning_rate": 9.518814978378876e-05, "loss": 0.9431, "mean_token_accuracy": 0.7352004684507847, "num_tokens": 50097321.0, "step": 1570 }, { "entropy": 0.8279615417122841, "epoch": 0.14454200953416024, "grad_norm": 0.1530257761478424, "learning_rate": 9.518508295764713e-05, "loss": 0.8058, "mean_token_accuracy": 0.7686503194272518, "num_tokens": 50129738.0, "step": 1571 }, { "entropy": 0.9095079228281975, "epoch": 0.14463401590560146, "grad_norm": 0.15791893005371094, "learning_rate": 9.518201613150551e-05, "loss": 0.8872, "mean_token_accuracy": 0.7457893788814545, "num_tokens": 50161868.0, "step": 1572 }, { "entropy": 0.9339880868792534, "epoch": 0.14472602227704268, "grad_norm": 0.15989340841770172, "learning_rate": 9.517894930536388e-05, "loss": 0.9266, "mean_token_accuracy": 0.7377822324633598, "num_tokens": 50194036.0, "step": 1573 }, { "entropy": 0.9374928586184978, "epoch": 0.14481802864848392, "grad_norm": 0.157978355884552, "learning_rate": 9.517588247922226e-05, "loss": 0.9421, "mean_token_accuracy": 0.7380478791892529, "num_tokens": 50226786.0, "step": 1574 }, { "entropy": 0.9742381852120161, "epoch": 0.14491003501992514, "grad_norm": 0.16245165467262268, "learning_rate": 9.517281565308063e-05, "loss": 0.9753, "mean_token_accuracy": 0.7247503586113453, "num_tokens": 50258978.0, "step": 1575 }, { "entropy": 0.9068496227264404, "epoch": 0.14500204139136635, "grad_norm": 0.1590886265039444, "learning_rate": 9.516974882693901e-05, "loss": 0.9077, "mean_token_accuracy": 0.7483755275607109, "num_tokens": 50291218.0, "step": 1576 }, { "entropy": 0.8540623169392347, "epoch": 0.14509404776280757, "grad_norm": 0.15828856825828552, "learning_rate": 9.516668200079738e-05, "loss": 0.8409, "mean_token_accuracy": 0.7592857554554939, "num_tokens": 50322114.0, "step": 1577 }, { "entropy": 0.9355777502059937, "epoch": 0.1451860541342488, "grad_norm": 0.15918008983135223, "learning_rate": 9.516361517465575e-05, "loss": 0.928, "mean_token_accuracy": 0.7335886768996716, "num_tokens": 50353989.0, "step": 1578 }, { "entropy": 0.95644561201334, "epoch": 0.14527806050569003, "grad_norm": 0.16408760845661163, "learning_rate": 9.516054834851413e-05, "loss": 0.947, "mean_token_accuracy": 0.7324465103447437, "num_tokens": 50384827.0, "step": 1579 }, { "entropy": 0.8444613199681044, "epoch": 0.14537006687713125, "grad_norm": 0.15476804971694946, "learning_rate": 9.515748152237251e-05, "loss": 0.8316, "mean_token_accuracy": 0.7628643475472927, "num_tokens": 50417149.0, "step": 1580 }, { "entropy": 0.9362065382301807, "epoch": 0.14546207324857247, "grad_norm": 0.1665036529302597, "learning_rate": 9.515441469623088e-05, "loss": 0.9321, "mean_token_accuracy": 0.7332706153392792, "num_tokens": 50448440.0, "step": 1581 }, { "entropy": 0.9548250734806061, "epoch": 0.14555407962001368, "grad_norm": 0.16666781902313232, "learning_rate": 9.515134787008925e-05, "loss": 0.9711, "mean_token_accuracy": 0.7277650907635689, "num_tokens": 50479944.0, "step": 1582 }, { "entropy": 0.8269635140895844, "epoch": 0.1456460859914549, "grad_norm": 0.1511041820049286, "learning_rate": 9.514828104394761e-05, "loss": 0.8327, "mean_token_accuracy": 0.764365091919899, "num_tokens": 50512052.0, "step": 1583 }, { "entropy": 0.9229615107178688, "epoch": 0.14573809236289614, "grad_norm": 0.16137047111988068, "learning_rate": 9.5145214217806e-05, "loss": 0.9213, "mean_token_accuracy": 0.7383043356239796, "num_tokens": 50544253.0, "step": 1584 }, { "entropy": 0.8085582070052624, "epoch": 0.14583009873433736, "grad_norm": 0.1549147665500641, "learning_rate": 9.514214739166438e-05, "loss": 0.8169, "mean_token_accuracy": 0.7654806636273861, "num_tokens": 50576272.0, "step": 1585 }, { "entropy": 0.8763374015688896, "epoch": 0.14592210510577858, "grad_norm": 0.16401927173137665, "learning_rate": 9.513908056552274e-05, "loss": 0.8922, "mean_token_accuracy": 0.748044803738594, "num_tokens": 50607401.0, "step": 1586 }, { "entropy": 0.9314355067908764, "epoch": 0.1460141114772198, "grad_norm": 0.16168606281280518, "learning_rate": 9.513601373938111e-05, "loss": 0.9374, "mean_token_accuracy": 0.7302105724811554, "num_tokens": 50639428.0, "step": 1587 }, { "entropy": 0.9708931967616081, "epoch": 0.146106117848661, "grad_norm": 0.1647098958492279, "learning_rate": 9.513294691323949e-05, "loss": 0.9592, "mean_token_accuracy": 0.7255076915025711, "num_tokens": 50670938.0, "step": 1588 }, { "entropy": 1.0324012711644173, "epoch": 0.14619812422010225, "grad_norm": 0.1731657236814499, "learning_rate": 9.512988008709786e-05, "loss": 1.043, "mean_token_accuracy": 0.7068525590002537, "num_tokens": 50702194.0, "step": 1589 }, { "entropy": 0.9194666184484959, "epoch": 0.14629013059154347, "grad_norm": 0.15946748852729797, "learning_rate": 9.512681326095624e-05, "loss": 0.9289, "mean_token_accuracy": 0.7358950562775135, "num_tokens": 50734315.0, "step": 1590 }, { "entropy": 0.7473869267851114, "epoch": 0.1463821369629847, "grad_norm": 0.14720673859119415, "learning_rate": 9.512374643481462e-05, "loss": 0.7244, "mean_token_accuracy": 0.7865483909845352, "num_tokens": 50766102.0, "step": 1591 }, { "entropy": 0.8850968182086945, "epoch": 0.1464741433344259, "grad_norm": 0.15959887206554413, "learning_rate": 9.512067960867299e-05, "loss": 0.9036, "mean_token_accuracy": 0.7517639100551605, "num_tokens": 50798226.0, "step": 1592 }, { "entropy": 0.8950379714369774, "epoch": 0.14656614970586712, "grad_norm": 0.16577966511249542, "learning_rate": 9.511761278253136e-05, "loss": 0.9139, "mean_token_accuracy": 0.7478294894099236, "num_tokens": 50829370.0, "step": 1593 }, { "entropy": 0.9149220306426287, "epoch": 0.14665815607730837, "grad_norm": 0.15883855521678925, "learning_rate": 9.511454595638973e-05, "loss": 0.902, "mean_token_accuracy": 0.7472071722149849, "num_tokens": 50861552.0, "step": 1594 }, { "entropy": 0.9705828800797462, "epoch": 0.14675016244874958, "grad_norm": 0.15756767988204956, "learning_rate": 9.511147913024812e-05, "loss": 0.9596, "mean_token_accuracy": 0.7337660379707813, "num_tokens": 50893640.0, "step": 1595 }, { "entropy": 0.8951478563249111, "epoch": 0.1468421688201908, "grad_norm": 0.1565169245004654, "learning_rate": 9.510841230410649e-05, "loss": 0.8799, "mean_token_accuracy": 0.748848631978035, "num_tokens": 50925277.0, "step": 1596 }, { "entropy": 0.9125607758760452, "epoch": 0.14693417519163202, "grad_norm": 0.1660483330488205, "learning_rate": 9.510534547796486e-05, "loss": 0.9332, "mean_token_accuracy": 0.7422141805291176, "num_tokens": 50957177.0, "step": 1597 }, { "entropy": 0.9766602162271738, "epoch": 0.14702618156307323, "grad_norm": 0.16096630692481995, "learning_rate": 9.510227865182323e-05, "loss": 0.9665, "mean_token_accuracy": 0.7305490337312222, "num_tokens": 50988784.0, "step": 1598 }, { "entropy": 0.8283349201083183, "epoch": 0.14711818793451448, "grad_norm": 0.1592991203069687, "learning_rate": 9.509921182568161e-05, "loss": 0.8315, "mean_token_accuracy": 0.7597574442625046, "num_tokens": 51020490.0, "step": 1599 }, { "entropy": 0.9024342969059944, "epoch": 0.1472101943059557, "grad_norm": 0.15830719470977783, "learning_rate": 9.509614499953999e-05, "loss": 0.9086, "mean_token_accuracy": 0.7421135604381561, "num_tokens": 51052536.0, "step": 1600 }, { "entropy": 0.9151125848293304, "epoch": 0.1473022006773969, "grad_norm": 0.1568811982870102, "learning_rate": 9.509307817339836e-05, "loss": 0.8982, "mean_token_accuracy": 0.7489960603415966, "num_tokens": 51084474.0, "step": 1601 }, { "entropy": 0.9008803144097328, "epoch": 0.14739420704883813, "grad_norm": 0.15986542403697968, "learning_rate": 9.509001134725672e-05, "loss": 0.8719, "mean_token_accuracy": 0.7530812472105026, "num_tokens": 51116683.0, "step": 1602 }, { "entropy": 0.8322046250104904, "epoch": 0.14748621342027934, "grad_norm": 0.1528061181306839, "learning_rate": 9.50869445211151e-05, "loss": 0.8259, "mean_token_accuracy": 0.7639396339654922, "num_tokens": 51148448.0, "step": 1603 }, { "entropy": 0.9749828763306141, "epoch": 0.1475782197917206, "grad_norm": 0.1644148975610733, "learning_rate": 9.508387769497347e-05, "loss": 0.9968, "mean_token_accuracy": 0.7195788957178593, "num_tokens": 51180859.0, "step": 1604 }, { "entropy": 0.8427757658064365, "epoch": 0.1476702261631618, "grad_norm": 0.1584179699420929, "learning_rate": 9.508081086883186e-05, "loss": 0.8656, "mean_token_accuracy": 0.7566654123365879, "num_tokens": 51212962.0, "step": 1605 }, { "entropy": 0.9580745249986649, "epoch": 0.14776223253460302, "grad_norm": 0.17220841348171234, "learning_rate": 9.507774404269022e-05, "loss": 0.9966, "mean_token_accuracy": 0.720277339220047, "num_tokens": 51244644.0, "step": 1606 }, { "entropy": 0.7457785978913307, "epoch": 0.14785423890604424, "grad_norm": 0.14772135019302368, "learning_rate": 9.50746772165486e-05, "loss": 0.7376, "mean_token_accuracy": 0.7854622229933739, "num_tokens": 51276335.0, "step": 1607 }, { "entropy": 1.0144655648618937, "epoch": 0.14794624527748546, "grad_norm": 0.16768665611743927, "learning_rate": 9.507161039040697e-05, "loss": 1.0158, "mean_token_accuracy": 0.7216131202876568, "num_tokens": 51308674.0, "step": 1608 }, { "entropy": 0.8372501917183399, "epoch": 0.1480382516489267, "grad_norm": 0.17383073270320892, "learning_rate": 9.506854356426534e-05, "loss": 0.8438, "mean_token_accuracy": 0.757979366928339, "num_tokens": 51340677.0, "step": 1609 }, { "entropy": 0.9049365930259228, "epoch": 0.14813025802036792, "grad_norm": 0.16453367471694946, "learning_rate": 9.506547673812372e-05, "loss": 0.9123, "mean_token_accuracy": 0.744102381169796, "num_tokens": 51372231.0, "step": 1610 }, { "entropy": 0.8901003040373325, "epoch": 0.14822226439180913, "grad_norm": 0.15820017457008362, "learning_rate": 9.50624099119821e-05, "loss": 0.8929, "mean_token_accuracy": 0.7500216439366341, "num_tokens": 51403657.0, "step": 1611 }, { "entropy": 1.0162953436374664, "epoch": 0.14831427076325035, "grad_norm": 0.1622859686613083, "learning_rate": 9.505934308584047e-05, "loss": 1.0068, "mean_token_accuracy": 0.7181491032242775, "num_tokens": 51435273.0, "step": 1612 }, { "entropy": 0.9441129676997662, "epoch": 0.14840627713469157, "grad_norm": 0.15788370370864868, "learning_rate": 9.505627625969884e-05, "loss": 0.9267, "mean_token_accuracy": 0.7424830570816994, "num_tokens": 51467509.0, "step": 1613 }, { "entropy": 0.9139817301183939, "epoch": 0.1484982835061328, "grad_norm": 0.15706057846546173, "learning_rate": 9.505320943355721e-05, "loss": 0.907, "mean_token_accuracy": 0.7465889565646648, "num_tokens": 51499553.0, "step": 1614 }, { "entropy": 0.8888718262314796, "epoch": 0.14859028987757403, "grad_norm": 0.15246433019638062, "learning_rate": 9.505014260741559e-05, "loss": 0.8713, "mean_token_accuracy": 0.7511124052107334, "num_tokens": 51531831.0, "step": 1615 }, { "entropy": 0.9300766065716743, "epoch": 0.14868229624901524, "grad_norm": 0.16273950040340424, "learning_rate": 9.504707578127397e-05, "loss": 0.929, "mean_token_accuracy": 0.7376671209931374, "num_tokens": 51564065.0, "step": 1616 }, { "entropy": 0.8716898243874311, "epoch": 0.14877430262045646, "grad_norm": 0.15254119038581848, "learning_rate": 9.504400895513234e-05, "loss": 0.8454, "mean_token_accuracy": 0.7593253031373024, "num_tokens": 51596444.0, "step": 1617 }, { "entropy": 0.9185812976211309, "epoch": 0.14886630899189768, "grad_norm": 0.1590704470872879, "learning_rate": 9.504094212899072e-05, "loss": 0.9215, "mean_token_accuracy": 0.739941593259573, "num_tokens": 51628469.0, "step": 1618 }, { "entropy": 0.9598508812487125, "epoch": 0.14895831536333892, "grad_norm": 0.17196008563041687, "learning_rate": 9.503787530284909e-05, "loss": 0.9762, "mean_token_accuracy": 0.7267376519739628, "num_tokens": 51659274.0, "step": 1619 }, { "entropy": 0.8701883684843779, "epoch": 0.14905032173478014, "grad_norm": 0.16367904841899872, "learning_rate": 9.503480847670745e-05, "loss": 0.8835, "mean_token_accuracy": 0.7545709908008575, "num_tokens": 51691489.0, "step": 1620 }, { "entropy": 0.937255248427391, "epoch": 0.14914232810622136, "grad_norm": 0.16556379199028015, "learning_rate": 9.503174165056584e-05, "loss": 0.9446, "mean_token_accuracy": 0.7369784973561764, "num_tokens": 51722997.0, "step": 1621 }, { "entropy": 0.9459223821759224, "epoch": 0.14923433447766257, "grad_norm": 0.15829089283943176, "learning_rate": 9.502867482442422e-05, "loss": 0.9454, "mean_token_accuracy": 0.7368673421442509, "num_tokens": 51754866.0, "step": 1622 }, { "entropy": 0.8856813870370388, "epoch": 0.1493263408491038, "grad_norm": 0.15842947363853455, "learning_rate": 9.502560799828259e-05, "loss": 0.8979, "mean_token_accuracy": 0.7480881065130234, "num_tokens": 51786692.0, "step": 1623 }, { "entropy": 0.9174236468970776, "epoch": 0.14941834722054503, "grad_norm": 0.16238179802894592, "learning_rate": 9.502254117214095e-05, "loss": 0.9222, "mean_token_accuracy": 0.740988839417696, "num_tokens": 51819025.0, "step": 1624 }, { "entropy": 0.9222218878567219, "epoch": 0.14951035359198625, "grad_norm": 0.16102536022663116, "learning_rate": 9.501947434599932e-05, "loss": 0.9144, "mean_token_accuracy": 0.7343608476221561, "num_tokens": 51851341.0, "step": 1625 }, { "entropy": 0.9440353214740753, "epoch": 0.14960235996342747, "grad_norm": 0.16402681171894073, "learning_rate": 9.50164075198577e-05, "loss": 0.95, "mean_token_accuracy": 0.7281482107937336, "num_tokens": 51882700.0, "step": 1626 }, { "entropy": 0.9396484531462193, "epoch": 0.14969436633486868, "grad_norm": 0.1618112325668335, "learning_rate": 9.501334069371608e-05, "loss": 0.9507, "mean_token_accuracy": 0.7343941554427147, "num_tokens": 51915124.0, "step": 1627 }, { "entropy": 0.9482117705047131, "epoch": 0.1497863727063099, "grad_norm": 0.16965095698833466, "learning_rate": 9.501027386757445e-05, "loss": 0.9789, "mean_token_accuracy": 0.7258496694266796, "num_tokens": 51947089.0, "step": 1628 }, { "entropy": 0.9070003405213356, "epoch": 0.14987837907775114, "grad_norm": 0.15995164215564728, "learning_rate": 9.500720704143282e-05, "loss": 0.9187, "mean_token_accuracy": 0.7418252304196358, "num_tokens": 51979395.0, "step": 1629 }, { "entropy": 0.8971259109675884, "epoch": 0.14997038544919236, "grad_norm": 0.1557328850030899, "learning_rate": 9.50041402152912e-05, "loss": 0.9105, "mean_token_accuracy": 0.743866816163063, "num_tokens": 52011267.0, "step": 1630 }, { "entropy": 0.9155143424868584, "epoch": 0.15006239182063358, "grad_norm": 0.15526001155376434, "learning_rate": 9.500107338914957e-05, "loss": 0.9081, "mean_token_accuracy": 0.7454564422369003, "num_tokens": 52043454.0, "step": 1631 }, { "entropy": 0.8047334589064121, "epoch": 0.1501543981920748, "grad_norm": 0.15748849511146545, "learning_rate": 9.499800656300795e-05, "loss": 0.7867, "mean_token_accuracy": 0.778761051595211, "num_tokens": 52075313.0, "step": 1632 }, { "entropy": 1.039855144917965, "epoch": 0.150246404563516, "grad_norm": 0.16922444105148315, "learning_rate": 9.499493973686632e-05, "loss": 1.0292, "mean_token_accuracy": 0.7172029055655003, "num_tokens": 52107610.0, "step": 1633 }, { "entropy": 0.8415661714971066, "epoch": 0.15033841093495726, "grad_norm": 0.15803636610507965, "learning_rate": 9.49918729107247e-05, "loss": 0.8224, "mean_token_accuracy": 0.7655546069145203, "num_tokens": 52139711.0, "step": 1634 }, { "entropy": 0.8486452475190163, "epoch": 0.15043041730639847, "grad_norm": 0.15710069239139557, "learning_rate": 9.498880608458307e-05, "loss": 0.8437, "mean_token_accuracy": 0.7613230831921101, "num_tokens": 52171558.0, "step": 1635 }, { "entropy": 0.9922747574746609, "epoch": 0.1505224236778397, "grad_norm": 0.16343528032302856, "learning_rate": 9.498573925844144e-05, "loss": 1.0109, "mean_token_accuracy": 0.7208983823657036, "num_tokens": 52203794.0, "step": 1636 }, { "entropy": 0.9449852779507637, "epoch": 0.1506144300492809, "grad_norm": 0.1622820943593979, "learning_rate": 9.498267243229982e-05, "loss": 0.9575, "mean_token_accuracy": 0.7337242364883423, "num_tokens": 52235726.0, "step": 1637 }, { "entropy": 0.8581573590636253, "epoch": 0.15070643642072212, "grad_norm": 0.16376474499702454, "learning_rate": 9.49796056061582e-05, "loss": 0.8848, "mean_token_accuracy": 0.7479197978973389, "num_tokens": 52267204.0, "step": 1638 }, { "entropy": 0.9218185395002365, "epoch": 0.15079844279216337, "grad_norm": 0.158268004655838, "learning_rate": 9.497653878001657e-05, "loss": 0.9178, "mean_token_accuracy": 0.7391237653791904, "num_tokens": 52299185.0, "step": 1639 }, { "entropy": 0.8835579361766577, "epoch": 0.15089044916360458, "grad_norm": 0.15415672957897186, "learning_rate": 9.497347195387493e-05, "loss": 0.861, "mean_token_accuracy": 0.7504927590489388, "num_tokens": 52331194.0, "step": 1640 }, { "entropy": 0.8204936571419239, "epoch": 0.1509824555350458, "grad_norm": 0.1545938402414322, "learning_rate": 9.49704051277333e-05, "loss": 0.8242, "mean_token_accuracy": 0.7596048302948475, "num_tokens": 52363335.0, "step": 1641 }, { "entropy": 0.8901687487959862, "epoch": 0.15107446190648702, "grad_norm": 0.15599650144577026, "learning_rate": 9.49673383015917e-05, "loss": 0.8796, "mean_token_accuracy": 0.75063756108284, "num_tokens": 52395417.0, "step": 1642 }, { "entropy": 0.8809293136000633, "epoch": 0.15116646827792823, "grad_norm": 0.15762925148010254, "learning_rate": 9.496427147545006e-05, "loss": 0.8778, "mean_token_accuracy": 0.7492437995970249, "num_tokens": 52428119.0, "step": 1643 }, { "entropy": 0.8918488249182701, "epoch": 0.15125847464936948, "grad_norm": 0.1594894379377365, "learning_rate": 9.496120464930843e-05, "loss": 0.9085, "mean_token_accuracy": 0.7405115179717541, "num_tokens": 52459248.0, "step": 1644 }, { "entropy": 0.9354335218667984, "epoch": 0.1513504810208107, "grad_norm": 0.1632739007472992, "learning_rate": 9.49581378231668e-05, "loss": 0.9173, "mean_token_accuracy": 0.7434283494949341, "num_tokens": 52490965.0, "step": 1645 }, { "entropy": 0.9619724005460739, "epoch": 0.1514424873922519, "grad_norm": 0.165689155459404, "learning_rate": 9.495507099702518e-05, "loss": 0.9635, "mean_token_accuracy": 0.7333577275276184, "num_tokens": 52522463.0, "step": 1646 }, { "entropy": 0.8529836051166058, "epoch": 0.15153449376369313, "grad_norm": 0.1498270481824875, "learning_rate": 9.495200417088356e-05, "loss": 0.8224, "mean_token_accuracy": 0.7644657455384731, "num_tokens": 52554227.0, "step": 1647 }, { "entropy": 0.7959712594747543, "epoch": 0.15162650013513435, "grad_norm": 0.15403427183628082, "learning_rate": 9.494893734474193e-05, "loss": 0.7847, "mean_token_accuracy": 0.7762076631188393, "num_tokens": 52586658.0, "step": 1648 }, { "entropy": 0.8755505420267582, "epoch": 0.1517185065065756, "grad_norm": 0.17974773049354553, "learning_rate": 9.494587051860031e-05, "loss": 0.8671, "mean_token_accuracy": 0.7540891207754612, "num_tokens": 52618143.0, "step": 1649 }, { "entropy": 0.8522152528166771, "epoch": 0.1518105128780168, "grad_norm": 0.15996713936328888, "learning_rate": 9.494280369245868e-05, "loss": 0.8376, "mean_token_accuracy": 0.7645979337394238, "num_tokens": 52649143.0, "step": 1650 }, { "entropy": 0.9097826182842255, "epoch": 0.15190251924945802, "grad_norm": 0.16049756109714508, "learning_rate": 9.493973686631705e-05, "loss": 0.9008, "mean_token_accuracy": 0.7420790232717991, "num_tokens": 52681282.0, "step": 1651 }, { "entropy": 0.8929805681109428, "epoch": 0.15199452562089924, "grad_norm": 0.16685135662555695, "learning_rate": 9.493667004017543e-05, "loss": 0.9063, "mean_token_accuracy": 0.7408395633101463, "num_tokens": 52711970.0, "step": 1652 }, { "entropy": 0.9144176207482815, "epoch": 0.15208653199234046, "grad_norm": 0.1620255559682846, "learning_rate": 9.493360321403381e-05, "loss": 0.9437, "mean_token_accuracy": 0.7365058809518814, "num_tokens": 52744358.0, "step": 1653 }, { "entropy": 0.9382633678615093, "epoch": 0.1521785383637817, "grad_norm": 0.1609598696231842, "learning_rate": 9.493053638789218e-05, "loss": 0.9411, "mean_token_accuracy": 0.7369315847754478, "num_tokens": 52776211.0, "step": 1654 }, { "entropy": 0.8694864884018898, "epoch": 0.15227054473522292, "grad_norm": 0.15863408148288727, "learning_rate": 9.492746956175055e-05, "loss": 0.8794, "mean_token_accuracy": 0.7579607553780079, "num_tokens": 52808889.0, "step": 1655 }, { "entropy": 0.8612206224352121, "epoch": 0.15236255110666413, "grad_norm": 0.17168854176998138, "learning_rate": 9.492440273560891e-05, "loss": 0.881, "mean_token_accuracy": 0.7515956498682499, "num_tokens": 52840161.0, "step": 1656 }, { "entropy": 0.8907250948250294, "epoch": 0.15245455747810535, "grad_norm": 0.15931160748004913, "learning_rate": 9.49213359094673e-05, "loss": 0.8952, "mean_token_accuracy": 0.7495500147342682, "num_tokens": 52872333.0, "step": 1657 }, { "entropy": 0.8718052245676517, "epoch": 0.15254656384954657, "grad_norm": 0.15084831416606903, "learning_rate": 9.491826908332568e-05, "loss": 0.8428, "mean_token_accuracy": 0.7588514536619186, "num_tokens": 52905030.0, "step": 1658 }, { "entropy": 1.0191697403788567, "epoch": 0.1526385702209878, "grad_norm": 0.16582950949668884, "learning_rate": 9.491520225718405e-05, "loss": 0.9942, "mean_token_accuracy": 0.7198337092995644, "num_tokens": 52936460.0, "step": 1659 }, { "entropy": 0.7939396910369396, "epoch": 0.15273057659242903, "grad_norm": 0.149077907204628, "learning_rate": 9.491213543104241e-05, "loss": 0.7821, "mean_token_accuracy": 0.7755911909043789, "num_tokens": 52968539.0, "step": 1660 }, { "entropy": 0.8676322288811207, "epoch": 0.15282258296387025, "grad_norm": 0.15120075643062592, "learning_rate": 9.49090686049008e-05, "loss": 0.8448, "mean_token_accuracy": 0.7550942711532116, "num_tokens": 53000579.0, "step": 1661 }, { "entropy": 0.8399743940681219, "epoch": 0.15291458933531146, "grad_norm": 0.15518411993980408, "learning_rate": 9.490600177875916e-05, "loss": 0.8408, "mean_token_accuracy": 0.7580276504158974, "num_tokens": 53031962.0, "step": 1662 }, { "entropy": 0.8637074064463377, "epoch": 0.15300659570675268, "grad_norm": 0.15760450065135956, "learning_rate": 9.490293495261754e-05, "loss": 0.8502, "mean_token_accuracy": 0.7583245672285557, "num_tokens": 53062831.0, "step": 1663 }, { "entropy": 0.8890084810554981, "epoch": 0.15309860207819392, "grad_norm": 0.161193385720253, "learning_rate": 9.489986812647591e-05, "loss": 0.9005, "mean_token_accuracy": 0.7455227673053741, "num_tokens": 53094330.0, "step": 1664 }, { "entropy": 0.9590332098305225, "epoch": 0.15319060844963514, "grad_norm": 0.1679432988166809, "learning_rate": 9.48968013003343e-05, "loss": 0.975, "mean_token_accuracy": 0.7301226817071438, "num_tokens": 53126446.0, "step": 1665 }, { "entropy": 0.8744850568473339, "epoch": 0.15328261482107636, "grad_norm": 0.15566346049308777, "learning_rate": 9.489373447419266e-05, "loss": 0.8762, "mean_token_accuracy": 0.7518120110034943, "num_tokens": 53158252.0, "step": 1666 }, { "entropy": 0.8664066232740879, "epoch": 0.15337462119251757, "grad_norm": 0.15962710976600647, "learning_rate": 9.489066764805103e-05, "loss": 0.9012, "mean_token_accuracy": 0.7430575080215931, "num_tokens": 53190677.0, "step": 1667 }, { "entropy": 0.8496988452970982, "epoch": 0.1534666275639588, "grad_norm": 0.16696470975875854, "learning_rate": 9.488760082190941e-05, "loss": 0.8883, "mean_token_accuracy": 0.7505216896533966, "num_tokens": 53222384.0, "step": 1668 }, { "entropy": 0.9118777886033058, "epoch": 0.15355863393540004, "grad_norm": 0.16979368031024933, "learning_rate": 9.488453399576779e-05, "loss": 0.9126, "mean_token_accuracy": 0.74341681599617, "num_tokens": 53253638.0, "step": 1669 }, { "entropy": 0.9640098884701729, "epoch": 0.15365064030684125, "grad_norm": 0.16880130767822266, "learning_rate": 9.488146716962616e-05, "loss": 0.9791, "mean_token_accuracy": 0.7237409800291061, "num_tokens": 53285827.0, "step": 1670 }, { "entropy": 0.9875710643827915, "epoch": 0.15374264667828247, "grad_norm": 0.16397635638713837, "learning_rate": 9.487840034348453e-05, "loss": 0.9531, "mean_token_accuracy": 0.7307684496045113, "num_tokens": 53317059.0, "step": 1671 }, { "entropy": 0.8687214441597462, "epoch": 0.15383465304972369, "grad_norm": 0.16013942658901215, "learning_rate": 9.48753335173429e-05, "loss": 0.8639, "mean_token_accuracy": 0.7535696551203728, "num_tokens": 53349438.0, "step": 1672 }, { "entropy": 0.8929279148578644, "epoch": 0.1539266594211649, "grad_norm": 0.15438346564769745, "learning_rate": 9.487226669120128e-05, "loss": 0.8748, "mean_token_accuracy": 0.7507476694881916, "num_tokens": 53380945.0, "step": 1673 }, { "entropy": 0.9531895443797112, "epoch": 0.15401866579260615, "grad_norm": 0.16354206204414368, "learning_rate": 9.486919986505966e-05, "loss": 0.9536, "mean_token_accuracy": 0.7283436134457588, "num_tokens": 53413238.0, "step": 1674 }, { "entropy": 0.9441161006689072, "epoch": 0.15411067216404736, "grad_norm": 0.15975528955459595, "learning_rate": 9.486613303891803e-05, "loss": 0.9442, "mean_token_accuracy": 0.7342549152672291, "num_tokens": 53445633.0, "step": 1675 }, { "entropy": 0.9476718939840794, "epoch": 0.15420267853548858, "grad_norm": 0.16097865998744965, "learning_rate": 9.48630662127764e-05, "loss": 0.9558, "mean_token_accuracy": 0.7322823256254196, "num_tokens": 53477696.0, "step": 1676 }, { "entropy": 0.9025196582078934, "epoch": 0.1542946849069298, "grad_norm": 0.16239745914936066, "learning_rate": 9.485999938663478e-05, "loss": 0.9005, "mean_token_accuracy": 0.7389497086405754, "num_tokens": 53509230.0, "step": 1677 }, { "entropy": 0.8449400253593922, "epoch": 0.15438669127837104, "grad_norm": 0.15214960277080536, "learning_rate": 9.485693256049314e-05, "loss": 0.8461, "mean_token_accuracy": 0.7549704201519489, "num_tokens": 53541527.0, "step": 1678 }, { "entropy": 0.9128388278186321, "epoch": 0.15447869764981226, "grad_norm": 0.14962369203567505, "learning_rate": 9.485386573435152e-05, "loss": 0.8979, "mean_token_accuracy": 0.7470507025718689, "num_tokens": 53573844.0, "step": 1679 }, { "entropy": 0.9056573286652565, "epoch": 0.15457070402125347, "grad_norm": 0.1597958356142044, "learning_rate": 9.48507989082099e-05, "loss": 0.8967, "mean_token_accuracy": 0.7463571988046169, "num_tokens": 53605904.0, "step": 1680 }, { "entropy": 0.8708511292934418, "epoch": 0.1546627103926947, "grad_norm": 0.15483857691287994, "learning_rate": 9.484773208206827e-05, "loss": 0.8749, "mean_token_accuracy": 0.7523781917989254, "num_tokens": 53638185.0, "step": 1681 }, { "entropy": 0.917914479970932, "epoch": 0.1547547167641359, "grad_norm": 0.15941733121871948, "learning_rate": 9.484466525592664e-05, "loss": 0.9064, "mean_token_accuracy": 0.7437374778091908, "num_tokens": 53670507.0, "step": 1682 }, { "entropy": 0.886337973177433, "epoch": 0.15484672313557715, "grad_norm": 0.15965482592582703, "learning_rate": 9.484159842978502e-05, "loss": 0.8893, "mean_token_accuracy": 0.7522208616137505, "num_tokens": 53702779.0, "step": 1683 }, { "entropy": 0.8622843474149704, "epoch": 0.15493872950701837, "grad_norm": 0.15925782918930054, "learning_rate": 9.48385316036434e-05, "loss": 0.8518, "mean_token_accuracy": 0.7463275194168091, "num_tokens": 53733993.0, "step": 1684 }, { "entropy": 0.823455385863781, "epoch": 0.15503073587845959, "grad_norm": 0.15244053304195404, "learning_rate": 9.483546477750177e-05, "loss": 0.8186, "mean_token_accuracy": 0.767518799751997, "num_tokens": 53766076.0, "step": 1685 }, { "entropy": 0.8463437557220459, "epoch": 0.1551227422499008, "grad_norm": 0.15847264230251312, "learning_rate": 9.483239795136014e-05, "loss": 0.8388, "mean_token_accuracy": 0.7582208067178726, "num_tokens": 53798192.0, "step": 1686 }, { "entropy": 0.902086790651083, "epoch": 0.15521474862134202, "grad_norm": 0.16070100665092468, "learning_rate": 9.482933112521851e-05, "loss": 0.9254, "mean_token_accuracy": 0.7412216104567051, "num_tokens": 53830249.0, "step": 1687 }, { "entropy": 0.9523467421531677, "epoch": 0.15530675499278326, "grad_norm": 0.15972301363945007, "learning_rate": 9.482626429907689e-05, "loss": 0.9442, "mean_token_accuracy": 0.7311886921525002, "num_tokens": 53862059.0, "step": 1688 }, { "entropy": 0.8706722110509872, "epoch": 0.15539876136422448, "grad_norm": 0.16081814467906952, "learning_rate": 9.482319747293527e-05, "loss": 0.8745, "mean_token_accuracy": 0.7482874393463135, "num_tokens": 53894355.0, "step": 1689 }, { "entropy": 0.7717008851468563, "epoch": 0.1554907677356657, "grad_norm": 0.15584036707878113, "learning_rate": 9.482013064679364e-05, "loss": 0.7715, "mean_token_accuracy": 0.7790940143167973, "num_tokens": 53926166.0, "step": 1690 }, { "entropy": 0.862653486430645, "epoch": 0.1555827741071069, "grad_norm": 0.16037125885486603, "learning_rate": 9.481706382065201e-05, "loss": 0.8682, "mean_token_accuracy": 0.7545990012586117, "num_tokens": 53957634.0, "step": 1691 }, { "entropy": 0.8897218629717827, "epoch": 0.15567478047854813, "grad_norm": 0.1623382568359375, "learning_rate": 9.481399699451039e-05, "loss": 0.902, "mean_token_accuracy": 0.7461304813623428, "num_tokens": 53989190.0, "step": 1692 }, { "entropy": 0.9146887063980103, "epoch": 0.15576678684998937, "grad_norm": 0.1723165512084961, "learning_rate": 9.481093016836876e-05, "loss": 0.9181, "mean_token_accuracy": 0.7455864064395428, "num_tokens": 54021257.0, "step": 1693 }, { "entropy": 0.7838038373738527, "epoch": 0.1558587932214306, "grad_norm": 0.16362956166267395, "learning_rate": 9.480786334222714e-05, "loss": 0.806, "mean_token_accuracy": 0.7706562504172325, "num_tokens": 54052555.0, "step": 1694 }, { "entropy": 0.9310091473162174, "epoch": 0.1559507995928718, "grad_norm": 0.16300317645072937, "learning_rate": 9.48047965160855e-05, "loss": 0.9447, "mean_token_accuracy": 0.7334553487598896, "num_tokens": 54084668.0, "step": 1695 }, { "entropy": 0.8971166908740997, "epoch": 0.15604280596431302, "grad_norm": 0.15724237263202667, "learning_rate": 9.480172968994389e-05, "loss": 0.8885, "mean_token_accuracy": 0.7470222786068916, "num_tokens": 54115968.0, "step": 1696 }, { "entropy": 0.8418847545981407, "epoch": 0.15613481233575424, "grad_norm": 0.15366658568382263, "learning_rate": 9.479866286380226e-05, "loss": 0.8582, "mean_token_accuracy": 0.7534540891647339, "num_tokens": 54147725.0, "step": 1697 }, { "entropy": 0.811025470495224, "epoch": 0.1562268187071955, "grad_norm": 0.14820407330989838, "learning_rate": 9.479559603766062e-05, "loss": 0.7872, "mean_token_accuracy": 0.7764305435121059, "num_tokens": 54179885.0, "step": 1698 }, { "entropy": 0.9349726289510727, "epoch": 0.1563188250786367, "grad_norm": 0.15831083059310913, "learning_rate": 9.4792529211519e-05, "loss": 0.9219, "mean_token_accuracy": 0.7413631565868855, "num_tokens": 54212250.0, "step": 1699 }, { "entropy": 0.9500974379479885, "epoch": 0.15641083145007792, "grad_norm": 0.16674832999706268, "learning_rate": 9.478946238537739e-05, "loss": 0.9505, "mean_token_accuracy": 0.734423391520977, "num_tokens": 54243528.0, "step": 1700 }, { "entropy": 0.9455444179475307, "epoch": 0.15650283782151914, "grad_norm": 0.17008273303508759, "learning_rate": 9.478639555923575e-05, "loss": 0.9212, "mean_token_accuracy": 0.7416010238230228, "num_tokens": 54274752.0, "step": 1701 }, { "entropy": 0.9908579103648663, "epoch": 0.15659484419296035, "grad_norm": 0.16920419037342072, "learning_rate": 9.478332873309412e-05, "loss": 0.9836, "mean_token_accuracy": 0.7259894125163555, "num_tokens": 54306892.0, "step": 1702 }, { "entropy": 0.9702217988669872, "epoch": 0.1566868505644016, "grad_norm": 0.16528670489788055, "learning_rate": 9.478026190695249e-05, "loss": 0.9837, "mean_token_accuracy": 0.7259367853403091, "num_tokens": 54339107.0, "step": 1703 }, { "entropy": 0.9183321706950665, "epoch": 0.15677885693584281, "grad_norm": 0.16281481087207794, "learning_rate": 9.477719508081087e-05, "loss": 0.9213, "mean_token_accuracy": 0.7377865985035896, "num_tokens": 54370647.0, "step": 1704 }, { "entropy": 0.9342836998403072, "epoch": 0.15687086330728403, "grad_norm": 0.15916863083839417, "learning_rate": 9.477412825466925e-05, "loss": 0.9351, "mean_token_accuracy": 0.7422629743814468, "num_tokens": 54402832.0, "step": 1705 }, { "entropy": 0.9554618373513222, "epoch": 0.15696286967872525, "grad_norm": 0.15732289850711823, "learning_rate": 9.477106142852762e-05, "loss": 0.9386, "mean_token_accuracy": 0.7365233488380909, "num_tokens": 54435062.0, "step": 1706 }, { "entropy": 0.8860854264348745, "epoch": 0.15705487605016646, "grad_norm": 0.1528858095407486, "learning_rate": 9.476799460238599e-05, "loss": 0.8731, "mean_token_accuracy": 0.7499328218400478, "num_tokens": 54467253.0, "step": 1707 }, { "entropy": 0.8063505329191685, "epoch": 0.1571468824216077, "grad_norm": 0.15440621972084045, "learning_rate": 9.476492777624437e-05, "loss": 0.7931, "mean_token_accuracy": 0.7704049423336983, "num_tokens": 54499154.0, "step": 1708 }, { "entropy": 0.8728880137205124, "epoch": 0.15723888879304893, "grad_norm": 0.15466676652431488, "learning_rate": 9.476186095010274e-05, "loss": 0.8648, "mean_token_accuracy": 0.7545252218842506, "num_tokens": 54531459.0, "step": 1709 }, { "entropy": 0.9096110761165619, "epoch": 0.15733089516449014, "grad_norm": 0.16493366658687592, "learning_rate": 9.475879412396112e-05, "loss": 0.9189, "mean_token_accuracy": 0.7390969879925251, "num_tokens": 54563307.0, "step": 1710 }, { "entropy": 0.987253475934267, "epoch": 0.15742290153593136, "grad_norm": 0.16845540702342987, "learning_rate": 9.47557272978195e-05, "loss": 0.9979, "mean_token_accuracy": 0.7209025919437408, "num_tokens": 54595452.0, "step": 1711 }, { "entropy": 0.8169391378760338, "epoch": 0.15751490790737258, "grad_norm": 0.1545519232749939, "learning_rate": 9.475266047167787e-05, "loss": 0.8119, "mean_token_accuracy": 0.7663094475865364, "num_tokens": 54627370.0, "step": 1712 }, { "entropy": 0.9229889288544655, "epoch": 0.15760691427881382, "grad_norm": 0.16811498999595642, "learning_rate": 9.474959364553624e-05, "loss": 0.9486, "mean_token_accuracy": 0.7300241254270077, "num_tokens": 54658659.0, "step": 1713 }, { "entropy": 0.8482905868440866, "epoch": 0.15769892065025504, "grad_norm": 0.15875771641731262, "learning_rate": 9.47465268193946e-05, "loss": 0.872, "mean_token_accuracy": 0.7514349035918713, "num_tokens": 54691151.0, "step": 1714 }, { "entropy": 0.8890507891774178, "epoch": 0.15779092702169625, "grad_norm": 0.15801656246185303, "learning_rate": 9.4743459993253e-05, "loss": 0.8864, "mean_token_accuracy": 0.7439468502998352, "num_tokens": 54723719.0, "step": 1715 }, { "entropy": 0.8801919780671597, "epoch": 0.15788293339313747, "grad_norm": 0.160419762134552, "learning_rate": 9.474039316711137e-05, "loss": 0.8898, "mean_token_accuracy": 0.7471887245774269, "num_tokens": 54755920.0, "step": 1716 }, { "entropy": 0.9148578569293022, "epoch": 0.1579749397645787, "grad_norm": 0.16441474854946136, "learning_rate": 9.473732634096973e-05, "loss": 0.9181, "mean_token_accuracy": 0.7420166656374931, "num_tokens": 54787052.0, "step": 1717 }, { "entropy": 0.8919218704104424, "epoch": 0.15806694613601993, "grad_norm": 0.15505415201187134, "learning_rate": 9.47342595148281e-05, "loss": 0.9049, "mean_token_accuracy": 0.7442884705960751, "num_tokens": 54819413.0, "step": 1718 }, { "entropy": 0.9873096197843552, "epoch": 0.15815895250746115, "grad_norm": 0.16581912338733673, "learning_rate": 9.473119268868648e-05, "loss": 0.9712, "mean_token_accuracy": 0.7265113368630409, "num_tokens": 54851101.0, "step": 1719 }, { "entropy": 0.8947155028581619, "epoch": 0.15825095887890236, "grad_norm": 0.15772901475429535, "learning_rate": 9.472812586254487e-05, "loss": 0.8806, "mean_token_accuracy": 0.7487349845468998, "num_tokens": 54883466.0, "step": 1720 }, { "entropy": 0.7966335341334343, "epoch": 0.15834296525034358, "grad_norm": 0.15847474336624146, "learning_rate": 9.472505903640323e-05, "loss": 0.7927, "mean_token_accuracy": 0.772607509046793, "num_tokens": 54916061.0, "step": 1721 }, { "entropy": 0.9063409864902496, "epoch": 0.1584349716217848, "grad_norm": 0.16203106939792633, "learning_rate": 9.47219922102616e-05, "loss": 0.8889, "mean_token_accuracy": 0.7440407648682594, "num_tokens": 54948000.0, "step": 1722 }, { "entropy": 0.8444563671946526, "epoch": 0.15852697799322604, "grad_norm": 0.15534907579421997, "learning_rate": 9.471892538411998e-05, "loss": 0.823, "mean_token_accuracy": 0.7644043453037739, "num_tokens": 54979550.0, "step": 1723 }, { "entropy": 0.9037407338619232, "epoch": 0.15861898436466726, "grad_norm": 0.15733015537261963, "learning_rate": 9.471585855797835e-05, "loss": 0.8888, "mean_token_accuracy": 0.7466606646776199, "num_tokens": 55011393.0, "step": 1724 }, { "entropy": 0.8407981544733047, "epoch": 0.15871099073610848, "grad_norm": 0.15854699909687042, "learning_rate": 9.471279173183673e-05, "loss": 0.8648, "mean_token_accuracy": 0.7527385503053665, "num_tokens": 55042793.0, "step": 1725 }, { "entropy": 0.8450030721724033, "epoch": 0.1588029971075497, "grad_norm": 0.1563250720500946, "learning_rate": 9.47097249056951e-05, "loss": 0.8262, "mean_token_accuracy": 0.7662789635360241, "num_tokens": 55075019.0, "step": 1726 }, { "entropy": 0.8880973272025585, "epoch": 0.1588950034789909, "grad_norm": 0.1669611930847168, "learning_rate": 9.470665807955348e-05, "loss": 0.9191, "mean_token_accuracy": 0.7397681996226311, "num_tokens": 55106710.0, "step": 1727 }, { "entropy": 0.8997660670429468, "epoch": 0.15898700985043215, "grad_norm": 0.16458453238010406, "learning_rate": 9.470359125341185e-05, "loss": 0.9074, "mean_token_accuracy": 0.7468083016574383, "num_tokens": 55138955.0, "step": 1728 }, { "entropy": 0.868724636733532, "epoch": 0.15907901622187337, "grad_norm": 0.15582101047039032, "learning_rate": 9.470052442727022e-05, "loss": 0.8533, "mean_token_accuracy": 0.7572338879108429, "num_tokens": 55170623.0, "step": 1729 }, { "entropy": 0.8749800883233547, "epoch": 0.1591710225933146, "grad_norm": 0.1657828688621521, "learning_rate": 9.46974576011286e-05, "loss": 0.8639, "mean_token_accuracy": 0.752534557133913, "num_tokens": 55202591.0, "step": 1730 }, { "entropy": 0.9054227471351624, "epoch": 0.1592630289647558, "grad_norm": 0.15695258975028992, "learning_rate": 9.469439077498698e-05, "loss": 0.8784, "mean_token_accuracy": 0.74924461171031, "num_tokens": 55233868.0, "step": 1731 }, { "entropy": 0.9592415764927864, "epoch": 0.15935503533619702, "grad_norm": 0.16555941104888916, "learning_rate": 9.469132394884535e-05, "loss": 0.9454, "mean_token_accuracy": 0.7300211787223816, "num_tokens": 55265919.0, "step": 1732 }, { "entropy": 1.0271290801465511, "epoch": 0.15944704170763827, "grad_norm": 0.17038317024707794, "learning_rate": 9.468825712270372e-05, "loss": 1.0137, "mean_token_accuracy": 0.7169928103685379, "num_tokens": 55298003.0, "step": 1733 }, { "entropy": 0.9904250241816044, "epoch": 0.15953904807907948, "grad_norm": 0.1647581309080124, "learning_rate": 9.468519029656208e-05, "loss": 0.994, "mean_token_accuracy": 0.7199724428355694, "num_tokens": 55329836.0, "step": 1734 }, { "entropy": 0.8312585912644863, "epoch": 0.1596310544505207, "grad_norm": 0.15537254512310028, "learning_rate": 9.468212347042046e-05, "loss": 0.8397, "mean_token_accuracy": 0.7610099799931049, "num_tokens": 55362272.0, "step": 1735 }, { "entropy": 0.7786161825060844, "epoch": 0.15972306082196192, "grad_norm": 0.15685470402240753, "learning_rate": 9.467905664427885e-05, "loss": 0.7759, "mean_token_accuracy": 0.773269783705473, "num_tokens": 55393817.0, "step": 1736 }, { "entropy": 0.8771466538310051, "epoch": 0.15981506719340313, "grad_norm": 0.16725194454193115, "learning_rate": 9.467598981813721e-05, "loss": 0.8991, "mean_token_accuracy": 0.7454415708780289, "num_tokens": 55425499.0, "step": 1737 }, { "entropy": 0.7983042448759079, "epoch": 0.15990707356484438, "grad_norm": 0.159865602850914, "learning_rate": 9.467292299199558e-05, "loss": 0.8273, "mean_token_accuracy": 0.7678916156291962, "num_tokens": 55457699.0, "step": 1738 }, { "entropy": 0.865582350641489, "epoch": 0.1599990799362856, "grad_norm": 0.16646823287010193, "learning_rate": 9.466985616585396e-05, "loss": 0.8879, "mean_token_accuracy": 0.7530284151434898, "num_tokens": 55490225.0, "step": 1739 }, { "entropy": 0.9023640714585781, "epoch": 0.1600910863077268, "grad_norm": 0.16383902728557587, "learning_rate": 9.466678933971233e-05, "loss": 0.9048, "mean_token_accuracy": 0.7460097074508667, "num_tokens": 55522774.0, "step": 1740 }, { "entropy": 0.8834324218332767, "epoch": 0.16018309267916803, "grad_norm": 0.15716809034347534, "learning_rate": 9.466372251357071e-05, "loss": 0.8841, "mean_token_accuracy": 0.7473073527216911, "num_tokens": 55554842.0, "step": 1741 }, { "entropy": 0.8234524670988321, "epoch": 0.16027509905060924, "grad_norm": 0.15976832807064056, "learning_rate": 9.46606556874291e-05, "loss": 0.811, "mean_token_accuracy": 0.7651534415781498, "num_tokens": 55585496.0, "step": 1742 }, { "entropy": 0.9703383073210716, "epoch": 0.1603671054220505, "grad_norm": 0.16275815665721893, "learning_rate": 9.465758886128746e-05, "loss": 0.9701, "mean_token_accuracy": 0.7283554673194885, "num_tokens": 55616925.0, "step": 1743 }, { "entropy": 0.9022040776908398, "epoch": 0.1604591117934917, "grad_norm": 0.1629457175731659, "learning_rate": 9.465452203514583e-05, "loss": 0.9065, "mean_token_accuracy": 0.7455358617007732, "num_tokens": 55647958.0, "step": 1744 }, { "entropy": 0.9282336980104446, "epoch": 0.16055111816493292, "grad_norm": 0.16090373694896698, "learning_rate": 9.46514552090042e-05, "loss": 0.8978, "mean_token_accuracy": 0.7430650927126408, "num_tokens": 55679420.0, "step": 1745 }, { "entropy": 0.9594156555831432, "epoch": 0.16064312453637414, "grad_norm": 0.16427485644817352, "learning_rate": 9.464838838286258e-05, "loss": 0.9474, "mean_token_accuracy": 0.73216113448143, "num_tokens": 55711077.0, "step": 1746 }, { "entropy": 0.9214438199996948, "epoch": 0.16073513090781535, "grad_norm": 0.1624341905117035, "learning_rate": 9.464532155672096e-05, "loss": 0.9244, "mean_token_accuracy": 0.7433156706392765, "num_tokens": 55742802.0, "step": 1747 }, { "entropy": 0.844107486307621, "epoch": 0.1608271372792566, "grad_norm": 0.15857581794261932, "learning_rate": 9.464225473057933e-05, "loss": 0.8434, "mean_token_accuracy": 0.7593778781592846, "num_tokens": 55775387.0, "step": 1748 }, { "entropy": 0.8997818976640701, "epoch": 0.16091914365069782, "grad_norm": 0.15934298932552338, "learning_rate": 9.46391879044377e-05, "loss": 0.9087, "mean_token_accuracy": 0.7421522997319698, "num_tokens": 55807765.0, "step": 1749 }, { "entropy": 0.8983301296830177, "epoch": 0.16101115002213903, "grad_norm": 0.1656133532524109, "learning_rate": 9.463612107829608e-05, "loss": 0.9159, "mean_token_accuracy": 0.7403369024395943, "num_tokens": 55839791.0, "step": 1750 }, { "entropy": 0.9200187772512436, "epoch": 0.16110315639358025, "grad_norm": 0.16497880220413208, "learning_rate": 9.463305425215445e-05, "loss": 0.929, "mean_token_accuracy": 0.7368572689592838, "num_tokens": 55870160.0, "step": 1751 }, { "entropy": 0.8285903967916965, "epoch": 0.16119516276502147, "grad_norm": 0.16666880249977112, "learning_rate": 9.462998742601283e-05, "loss": 0.8521, "mean_token_accuracy": 0.7571747116744518, "num_tokens": 55901909.0, "step": 1752 }, { "entropy": 1.012224555015564, "epoch": 0.1612871691364627, "grad_norm": 0.1608617752790451, "learning_rate": 9.46269205998712e-05, "loss": 1.0228, "mean_token_accuracy": 0.7143578082323074, "num_tokens": 55933919.0, "step": 1753 }, { "entropy": 0.994809728115797, "epoch": 0.16137917550790393, "grad_norm": 0.1732369363307953, "learning_rate": 9.462385377372958e-05, "loss": 1.0156, "mean_token_accuracy": 0.7177874594926834, "num_tokens": 55966220.0, "step": 1754 }, { "entropy": 0.9800427034497261, "epoch": 0.16147118187934514, "grad_norm": 0.16336874663829803, "learning_rate": 9.462078694758794e-05, "loss": 0.9661, "mean_token_accuracy": 0.7283734194934368, "num_tokens": 55998591.0, "step": 1755 }, { "entropy": 0.9412521384656429, "epoch": 0.16156318825078636, "grad_norm": 0.1608155518770218, "learning_rate": 9.461772012144631e-05, "loss": 0.9115, "mean_token_accuracy": 0.7445107027888298, "num_tokens": 56030939.0, "step": 1756 }, { "entropy": 0.8990996517241001, "epoch": 0.16165519462222758, "grad_norm": 0.15456418693065643, "learning_rate": 9.46146532953047e-05, "loss": 0.8781, "mean_token_accuracy": 0.7530279569327831, "num_tokens": 56062781.0, "step": 1757 }, { "entropy": 0.9321890398859978, "epoch": 0.16174720099366882, "grad_norm": 0.1617853045463562, "learning_rate": 9.461158646916307e-05, "loss": 0.9149, "mean_token_accuracy": 0.7408480830490589, "num_tokens": 56095305.0, "step": 1758 }, { "entropy": 0.8277414031326771, "epoch": 0.16183920736511004, "grad_norm": 0.1555449366569519, "learning_rate": 9.460851964302144e-05, "loss": 0.8245, "mean_token_accuracy": 0.764634445309639, "num_tokens": 56127546.0, "step": 1759 }, { "entropy": 0.9614381939172745, "epoch": 0.16193121373655125, "grad_norm": 0.16077855229377747, "learning_rate": 9.460545281687981e-05, "loss": 0.9522, "mean_token_accuracy": 0.7331216596066952, "num_tokens": 56159622.0, "step": 1760 }, { "entropy": 0.9039736315608025, "epoch": 0.16202322010799247, "grad_norm": 0.160927414894104, "learning_rate": 9.460238599073818e-05, "loss": 0.9219, "mean_token_accuracy": 0.7412565797567368, "num_tokens": 56191827.0, "step": 1761 }, { "entropy": 0.9086353853344917, "epoch": 0.1621152264794337, "grad_norm": 0.157014399766922, "learning_rate": 9.459931916459657e-05, "loss": 0.9025, "mean_token_accuracy": 0.7405021451413631, "num_tokens": 56223630.0, "step": 1762 }, { "entropy": 0.8508599549531937, "epoch": 0.16220723285087493, "grad_norm": 0.15543513000011444, "learning_rate": 9.459625233845494e-05, "loss": 0.8677, "mean_token_accuracy": 0.7482740134000778, "num_tokens": 56255018.0, "step": 1763 }, { "entropy": 0.8361765667796135, "epoch": 0.16229923922231615, "grad_norm": 0.15574875473976135, "learning_rate": 9.459318551231331e-05, "loss": 0.8272, "mean_token_accuracy": 0.7634220272302628, "num_tokens": 56286744.0, "step": 1764 }, { "entropy": 0.861007260158658, "epoch": 0.16239124559375737, "grad_norm": 0.1528848260641098, "learning_rate": 9.459011868617168e-05, "loss": 0.8596, "mean_token_accuracy": 0.7511874288320541, "num_tokens": 56318645.0, "step": 1765 }, { "entropy": 0.8888132087886333, "epoch": 0.16248325196519858, "grad_norm": 0.15893776714801788, "learning_rate": 9.458705186003006e-05, "loss": 0.8876, "mean_token_accuracy": 0.747937086969614, "num_tokens": 56350575.0, "step": 1766 }, { "entropy": 0.9418562352657318, "epoch": 0.1625752583366398, "grad_norm": 0.16961203515529633, "learning_rate": 9.458398503388844e-05, "loss": 0.9567, "mean_token_accuracy": 0.7308631576597691, "num_tokens": 56382531.0, "step": 1767 }, { "entropy": 0.8901054635643959, "epoch": 0.16266726470808104, "grad_norm": 0.17205610871315002, "learning_rate": 9.458091820774681e-05, "loss": 0.8831, "mean_token_accuracy": 0.7497150525450706, "num_tokens": 56414998.0, "step": 1768 }, { "entropy": 0.855336032807827, "epoch": 0.16275927107952226, "grad_norm": 0.16010114550590515, "learning_rate": 9.457785138160518e-05, "loss": 0.8746, "mean_token_accuracy": 0.7516513615846634, "num_tokens": 56446523.0, "step": 1769 }, { "entropy": 0.8605861179530621, "epoch": 0.16285127745096348, "grad_norm": 0.15431128442287445, "learning_rate": 9.457478455546356e-05, "loss": 0.8343, "mean_token_accuracy": 0.7618341483175755, "num_tokens": 56478772.0, "step": 1770 }, { "entropy": 0.9252845570445061, "epoch": 0.1629432838224047, "grad_norm": 0.16140660643577576, "learning_rate": 9.457171772932192e-05, "loss": 0.9298, "mean_token_accuracy": 0.7377407178282738, "num_tokens": 56511530.0, "step": 1771 }, { "entropy": 0.9086951315402985, "epoch": 0.1630352901938459, "grad_norm": 0.15055805444717407, "learning_rate": 9.45686509031803e-05, "loss": 0.873, "mean_token_accuracy": 0.7459032200276852, "num_tokens": 56543628.0, "step": 1772 }, { "entropy": 0.9088000282645226, "epoch": 0.16312729656528716, "grad_norm": 0.16467337310314178, "learning_rate": 9.456558407703869e-05, "loss": 0.8933, "mean_token_accuracy": 0.7491044253110886, "num_tokens": 56575551.0, "step": 1773 }, { "entropy": 0.922598272562027, "epoch": 0.16321930293672837, "grad_norm": 0.16504676640033722, "learning_rate": 9.456251725089706e-05, "loss": 0.9091, "mean_token_accuracy": 0.7419484034180641, "num_tokens": 56607609.0, "step": 1774 }, { "entropy": 0.9443248175084591, "epoch": 0.1633113093081696, "grad_norm": 0.16118492186069489, "learning_rate": 9.455945042475542e-05, "loss": 0.9578, "mean_token_accuracy": 0.7299931831657887, "num_tokens": 56639739.0, "step": 1775 }, { "entropy": 0.8760691024363041, "epoch": 0.1634033156796108, "grad_norm": 0.16077694296836853, "learning_rate": 9.455638359861379e-05, "loss": 0.8901, "mean_token_accuracy": 0.7448839545249939, "num_tokens": 56671737.0, "step": 1776 }, { "entropy": 0.9142513684928417, "epoch": 0.16349532205105202, "grad_norm": 0.16895584762096405, "learning_rate": 9.455331677247217e-05, "loss": 0.9446, "mean_token_accuracy": 0.7319508232176304, "num_tokens": 56703203.0, "step": 1777 }, { "entropy": 0.927996676415205, "epoch": 0.16358732842249327, "grad_norm": 0.16760072112083435, "learning_rate": 9.455024994633055e-05, "loss": 0.9537, "mean_token_accuracy": 0.72987986728549, "num_tokens": 56734893.0, "step": 1778 }, { "entropy": 0.9208510965108871, "epoch": 0.16367933479393448, "grad_norm": 0.16630584001541138, "learning_rate": 9.454718312018892e-05, "loss": 0.9413, "mean_token_accuracy": 0.7387723363935947, "num_tokens": 56765574.0, "step": 1779 }, { "entropy": 0.932685412466526, "epoch": 0.1637713411653757, "grad_norm": 0.15871945023536682, "learning_rate": 9.454411629404729e-05, "loss": 0.9262, "mean_token_accuracy": 0.7364226020872593, "num_tokens": 56798323.0, "step": 1780 }, { "entropy": 1.0062441863119602, "epoch": 0.16386334753681692, "grad_norm": 0.1644701063632965, "learning_rate": 9.454104946790567e-05, "loss": 0.9913, "mean_token_accuracy": 0.7196023017168045, "num_tokens": 56830211.0, "step": 1781 }, { "entropy": 0.8387195058166981, "epoch": 0.16395535390825813, "grad_norm": 0.15080101788043976, "learning_rate": 9.453798264176404e-05, "loss": 0.816, "mean_token_accuracy": 0.7627396583557129, "num_tokens": 56862308.0, "step": 1782 }, { "entropy": 0.9452171511948109, "epoch": 0.16404736027969938, "grad_norm": 0.1582026183605194, "learning_rate": 9.453491581562242e-05, "loss": 0.9501, "mean_token_accuracy": 0.7398050241172314, "num_tokens": 56894690.0, "step": 1783 }, { "entropy": 0.9867070578038692, "epoch": 0.1641393666511406, "grad_norm": 0.1728513538837433, "learning_rate": 9.453184898948079e-05, "loss": 0.9744, "mean_token_accuracy": 0.7249099910259247, "num_tokens": 56925609.0, "step": 1784 }, { "entropy": 0.8673921562731266, "epoch": 0.1642313730225818, "grad_norm": 0.1749183088541031, "learning_rate": 9.452878216333917e-05, "loss": 0.8608, "mean_token_accuracy": 0.7569119147956371, "num_tokens": 56957595.0, "step": 1785 }, { "entropy": 0.8007127642631531, "epoch": 0.16432337939402303, "grad_norm": 0.15025275945663452, "learning_rate": 9.452571533719754e-05, "loss": 0.7923, "mean_token_accuracy": 0.7708672694861889, "num_tokens": 56988920.0, "step": 1786 }, { "entropy": 0.922088373452425, "epoch": 0.16441538576546424, "grad_norm": 0.15726657211780548, "learning_rate": 9.45226485110559e-05, "loss": 0.9123, "mean_token_accuracy": 0.7417571544647217, "num_tokens": 57021472.0, "step": 1787 }, { "entropy": 0.9163676761090755, "epoch": 0.1645073921369055, "grad_norm": 0.16552789509296417, "learning_rate": 9.451958168491429e-05, "loss": 0.9578, "mean_token_accuracy": 0.7277688384056091, "num_tokens": 57052634.0, "step": 1788 }, { "entropy": 0.8649253733456135, "epoch": 0.1645993985083467, "grad_norm": 0.15514369308948517, "learning_rate": 9.451651485877267e-05, "loss": 0.8698, "mean_token_accuracy": 0.7529787011444569, "num_tokens": 57085330.0, "step": 1789 }, { "entropy": 0.9113885294646025, "epoch": 0.16469140487978792, "grad_norm": 0.16266684234142303, "learning_rate": 9.451344803263104e-05, "loss": 0.9172, "mean_token_accuracy": 0.7455113753676414, "num_tokens": 57117203.0, "step": 1790 }, { "entropy": 0.8250732347369194, "epoch": 0.16478341125122914, "grad_norm": 0.15113677084445953, "learning_rate": 9.45103812064894e-05, "loss": 0.8247, "mean_token_accuracy": 0.7608569040894508, "num_tokens": 57149011.0, "step": 1791 }, { "entropy": 0.8691405653953552, "epoch": 0.16487541762267036, "grad_norm": 0.15609388053417206, "learning_rate": 9.450731438034777e-05, "loss": 0.8508, "mean_token_accuracy": 0.7568701282143593, "num_tokens": 57180787.0, "step": 1792 }, { "entropy": 0.8784987758845091, "epoch": 0.1649674239941116, "grad_norm": 0.15780064463615417, "learning_rate": 9.450424755420615e-05, "loss": 0.8786, "mean_token_accuracy": 0.749070018529892, "num_tokens": 57212441.0, "step": 1793 }, { "entropy": 0.8403750397264957, "epoch": 0.16505943036555282, "grad_norm": 0.155840203166008, "learning_rate": 9.450118072806453e-05, "loss": 0.8497, "mean_token_accuracy": 0.7601048983633518, "num_tokens": 57244365.0, "step": 1794 }, { "entropy": 0.838858000934124, "epoch": 0.16515143673699403, "grad_norm": 0.15987055003643036, "learning_rate": 9.44981139019229e-05, "loss": 0.8329, "mean_token_accuracy": 0.7612287476658821, "num_tokens": 57276154.0, "step": 1795 }, { "entropy": 0.7599440813064575, "epoch": 0.16524344310843525, "grad_norm": 0.15457147359848022, "learning_rate": 9.449504707578127e-05, "loss": 0.766, "mean_token_accuracy": 0.776075541973114, "num_tokens": 57308175.0, "step": 1796 }, { "entropy": 0.8075404651463032, "epoch": 0.1653354494798765, "grad_norm": 0.1509494036436081, "learning_rate": 9.449198024963965e-05, "loss": 0.7999, "mean_token_accuracy": 0.7686601802706718, "num_tokens": 57339984.0, "step": 1797 }, { "entropy": 0.9947471916675568, "epoch": 0.1654274558513177, "grad_norm": 0.16688406467437744, "learning_rate": 9.448891342349802e-05, "loss": 0.9795, "mean_token_accuracy": 0.7283100448548794, "num_tokens": 57371098.0, "step": 1798 }, { "entropy": 0.9369434304535389, "epoch": 0.16551946222275893, "grad_norm": 0.16810213029384613, "learning_rate": 9.44858465973564e-05, "loss": 0.9538, "mean_token_accuracy": 0.73018803820014, "num_tokens": 57402882.0, "step": 1799 }, { "entropy": 0.8812098540365696, "epoch": 0.16561146859420015, "grad_norm": 0.1688583940267563, "learning_rate": 9.448277977121477e-05, "loss": 0.9082, "mean_token_accuracy": 0.7456429451704025, "num_tokens": 57434595.0, "step": 1800 }, { "entropy": 0.8906464502215385, "epoch": 0.16570347496564136, "grad_norm": 0.16459906101226807, "learning_rate": 9.447971294507315e-05, "loss": 0.9028, "mean_token_accuracy": 0.7469335086643696, "num_tokens": 57466901.0, "step": 1801 }, { "entropy": 0.9337184261530638, "epoch": 0.1657954813370826, "grad_norm": 0.1629372090101242, "learning_rate": 9.447664611893152e-05, "loss": 0.9363, "mean_token_accuracy": 0.734474990516901, "num_tokens": 57498673.0, "step": 1802 }, { "entropy": 0.8730062209069729, "epoch": 0.16588748770852382, "grad_norm": 0.15843915939331055, "learning_rate": 9.44735792927899e-05, "loss": 0.8887, "mean_token_accuracy": 0.7526570595800877, "num_tokens": 57530721.0, "step": 1803 }, { "entropy": 0.8847571611404419, "epoch": 0.16597949407996504, "grad_norm": 0.1584598422050476, "learning_rate": 9.447051246664828e-05, "loss": 0.8606, "mean_token_accuracy": 0.7584680840373039, "num_tokens": 57563217.0, "step": 1804 }, { "entropy": 0.9700459931045771, "epoch": 0.16607150045140626, "grad_norm": 0.16291660070419312, "learning_rate": 9.446744564050665e-05, "loss": 0.9613, "mean_token_accuracy": 0.7355053387582302, "num_tokens": 57595478.0, "step": 1805 }, { "entropy": 0.9375690799206495, "epoch": 0.16616350682284747, "grad_norm": 0.1539071798324585, "learning_rate": 9.446437881436502e-05, "loss": 0.8817, "mean_token_accuracy": 0.7521509900689125, "num_tokens": 57627893.0, "step": 1806 }, { "entropy": 0.9058787152171135, "epoch": 0.16625551319428872, "grad_norm": 0.15624967217445374, "learning_rate": 9.446131198822339e-05, "loss": 0.8793, "mean_token_accuracy": 0.7508661113679409, "num_tokens": 57659607.0, "step": 1807 }, { "entropy": 0.9439679458737373, "epoch": 0.16634751956572993, "grad_norm": 0.15770089626312256, "learning_rate": 9.445824516208177e-05, "loss": 0.947, "mean_token_accuracy": 0.7352209985256195, "num_tokens": 57691702.0, "step": 1808 }, { "entropy": 0.9460605271160603, "epoch": 0.16643952593717115, "grad_norm": 0.15990819036960602, "learning_rate": 9.445517833594015e-05, "loss": 0.953, "mean_token_accuracy": 0.731384065002203, "num_tokens": 57723542.0, "step": 1809 }, { "entropy": 0.8863812424242496, "epoch": 0.16653153230861237, "grad_norm": 0.16009779274463654, "learning_rate": 9.445211150979852e-05, "loss": 0.8835, "mean_token_accuracy": 0.7530708834528923, "num_tokens": 57756057.0, "step": 1810 }, { "entropy": 0.9464438445866108, "epoch": 0.16662353868005358, "grad_norm": 0.16117577254772186, "learning_rate": 9.444904468365688e-05, "loss": 0.9531, "mean_token_accuracy": 0.7309932634234428, "num_tokens": 57787926.0, "step": 1811 }, { "entropy": 0.9742291569709778, "epoch": 0.16671554505149483, "grad_norm": 0.16853958368301392, "learning_rate": 9.444597785751527e-05, "loss": 0.9821, "mean_token_accuracy": 0.7299029007554054, "num_tokens": 57819326.0, "step": 1812 }, { "entropy": 1.0114005357027054, "epoch": 0.16680755142293605, "grad_norm": 0.16757190227508545, "learning_rate": 9.444291103137363e-05, "loss": 1.0376, "mean_token_accuracy": 0.7090245075523853, "num_tokens": 57850826.0, "step": 1813 }, { "entropy": 0.9165155664086342, "epoch": 0.16689955779437726, "grad_norm": 0.1611187905073166, "learning_rate": 9.443984420523201e-05, "loss": 0.9209, "mean_token_accuracy": 0.7389795556664467, "num_tokens": 57883274.0, "step": 1814 }, { "entropy": 0.8793531209230423, "epoch": 0.16699156416581848, "grad_norm": 0.15698812901973724, "learning_rate": 9.443677737909038e-05, "loss": 0.8744, "mean_token_accuracy": 0.7513559907674789, "num_tokens": 57915909.0, "step": 1815 }, { "entropy": 1.0087986439466476, "epoch": 0.1670835705372597, "grad_norm": 0.1689801663160324, "learning_rate": 9.443371055294876e-05, "loss": 1.0108, "mean_token_accuracy": 0.7207426652312279, "num_tokens": 57946399.0, "step": 1816 }, { "entropy": 0.9170082397758961, "epoch": 0.16717557690870094, "grad_norm": 0.16203944385051727, "learning_rate": 9.443064372680713e-05, "loss": 0.9345, "mean_token_accuracy": 0.7348842956125736, "num_tokens": 57978328.0, "step": 1817 }, { "entropy": 0.861324604600668, "epoch": 0.16726758328014216, "grad_norm": 0.15819591283798218, "learning_rate": 9.44275769006655e-05, "loss": 0.8763, "mean_token_accuracy": 0.7510399147868156, "num_tokens": 58010752.0, "step": 1818 }, { "entropy": 0.9799933917820454, "epoch": 0.16735958965158337, "grad_norm": 0.16706959903240204, "learning_rate": 9.442451007452388e-05, "loss": 0.9858, "mean_token_accuracy": 0.7285223975777626, "num_tokens": 58042292.0, "step": 1819 }, { "entropy": 0.9507187269628048, "epoch": 0.1674515960230246, "grad_norm": 0.1628035604953766, "learning_rate": 9.442144324838226e-05, "loss": 0.9357, "mean_token_accuracy": 0.7324147261679173, "num_tokens": 58074107.0, "step": 1820 }, { "entropy": 0.964561752974987, "epoch": 0.1675436023944658, "grad_norm": 0.16119347512722015, "learning_rate": 9.441837642224063e-05, "loss": 0.9615, "mean_token_accuracy": 0.7303733937442303, "num_tokens": 58105868.0, "step": 1821 }, { "entropy": 0.9015658274292946, "epoch": 0.16763560876590705, "grad_norm": 0.1629556268453598, "learning_rate": 9.4415309596099e-05, "loss": 0.9007, "mean_token_accuracy": 0.7462888173758984, "num_tokens": 58138169.0, "step": 1822 }, { "entropy": 0.8483394980430603, "epoch": 0.16772761513734827, "grad_norm": 0.15847481787204742, "learning_rate": 9.441224276995737e-05, "loss": 0.8383, "mean_token_accuracy": 0.7653291411697865, "num_tokens": 58170608.0, "step": 1823 }, { "entropy": 0.8451830819249153, "epoch": 0.16781962150878948, "grad_norm": 0.1520046591758728, "learning_rate": 9.440917594381575e-05, "loss": 0.8311, "mean_token_accuracy": 0.7609617039561272, "num_tokens": 58202210.0, "step": 1824 }, { "entropy": 0.9427127167582512, "epoch": 0.1679116278802307, "grad_norm": 0.16389355063438416, "learning_rate": 9.440610911767413e-05, "loss": 0.9324, "mean_token_accuracy": 0.7387063913047314, "num_tokens": 58234360.0, "step": 1825 }, { "entropy": 0.8891644217073917, "epoch": 0.16800363425167192, "grad_norm": 0.1667487770318985, "learning_rate": 9.44030422915325e-05, "loss": 0.9046, "mean_token_accuracy": 0.7443866729736328, "num_tokens": 58265291.0, "step": 1826 }, { "entropy": 0.8799921870231628, "epoch": 0.16809564062311316, "grad_norm": 0.16341419517993927, "learning_rate": 9.439997546539086e-05, "loss": 0.9067, "mean_token_accuracy": 0.7409439831972122, "num_tokens": 58297813.0, "step": 1827 }, { "entropy": 0.8428296744823456, "epoch": 0.16818764699455438, "grad_norm": 0.15748274326324463, "learning_rate": 9.439690863924925e-05, "loss": 0.8329, "mean_token_accuracy": 0.7597299888730049, "num_tokens": 58328535.0, "step": 1828 }, { "entropy": 0.8273894861340523, "epoch": 0.1682796533659956, "grad_norm": 0.15217240154743195, "learning_rate": 9.439384181310761e-05, "loss": 0.819, "mean_token_accuracy": 0.7627876736223698, "num_tokens": 58361122.0, "step": 1829 }, { "entropy": 0.9610063135623932, "epoch": 0.1683716597374368, "grad_norm": 0.16728657484054565, "learning_rate": 9.4390774986966e-05, "loss": 0.9591, "mean_token_accuracy": 0.7264038920402527, "num_tokens": 58392852.0, "step": 1830 }, { "entropy": 0.9310832601040602, "epoch": 0.16846366610887803, "grad_norm": 0.15612289309501648, "learning_rate": 9.438770816082436e-05, "loss": 0.9228, "mean_token_accuracy": 0.7391585856676102, "num_tokens": 58425184.0, "step": 1831 }, { "entropy": 0.7883002031594515, "epoch": 0.16855567248031927, "grad_norm": 0.15211637318134308, "learning_rate": 9.438464133468274e-05, "loss": 0.7902, "mean_token_accuracy": 0.7738193050026894, "num_tokens": 58457159.0, "step": 1832 }, { "entropy": 0.9498493075370789, "epoch": 0.1686476788517605, "grad_norm": 0.15690286457538605, "learning_rate": 9.438157450854111e-05, "loss": 0.9328, "mean_token_accuracy": 0.734191682189703, "num_tokens": 58489235.0, "step": 1833 }, { "entropy": 0.9377902150154114, "epoch": 0.1687396852232017, "grad_norm": 0.15876504778862, "learning_rate": 9.437850768239948e-05, "loss": 0.921, "mean_token_accuracy": 0.7422527074813843, "num_tokens": 58521841.0, "step": 1834 }, { "entropy": 0.8864666670560837, "epoch": 0.16883169159464292, "grad_norm": 0.15714214742183685, "learning_rate": 9.437544085625788e-05, "loss": 0.8724, "mean_token_accuracy": 0.7530332393944263, "num_tokens": 58554170.0, "step": 1835 }, { "entropy": 0.8813110329210758, "epoch": 0.16892369796608414, "grad_norm": 0.1594560146331787, "learning_rate": 9.437237403011624e-05, "loss": 0.8887, "mean_token_accuracy": 0.7488854713737965, "num_tokens": 58585353.0, "step": 1836 }, { "entropy": 0.9039559848606586, "epoch": 0.16901570433752539, "grad_norm": 0.1625613123178482, "learning_rate": 9.436930720397461e-05, "loss": 0.9307, "mean_token_accuracy": 0.7355100885033607, "num_tokens": 58617214.0, "step": 1837 }, { "entropy": 0.857202772051096, "epoch": 0.1691077107089666, "grad_norm": 0.1541692465543747, "learning_rate": 9.436624037783298e-05, "loss": 0.8648, "mean_token_accuracy": 0.7526212744414806, "num_tokens": 58648907.0, "step": 1838 }, { "entropy": 0.7868402227759361, "epoch": 0.16919971708040782, "grad_norm": 0.15645843744277954, "learning_rate": 9.436317355169136e-05, "loss": 0.8029, "mean_token_accuracy": 0.7684844247996807, "num_tokens": 58680533.0, "step": 1839 }, { "entropy": 0.7920204848051071, "epoch": 0.16929172345184904, "grad_norm": 0.1585509330034256, "learning_rate": 9.436010672554974e-05, "loss": 0.8039, "mean_token_accuracy": 0.7680395990610123, "num_tokens": 58711877.0, "step": 1840 }, { "entropy": 0.9269446805119514, "epoch": 0.16938372982329025, "grad_norm": 0.1614672988653183, "learning_rate": 9.435703989940811e-05, "loss": 0.9386, "mean_token_accuracy": 0.7387395948171616, "num_tokens": 58743657.0, "step": 1841 }, { "entropy": 0.9241079576313496, "epoch": 0.1694757361947315, "grad_norm": 0.15631060302257538, "learning_rate": 9.435397307326648e-05, "loss": 0.9131, "mean_token_accuracy": 0.74215392395854, "num_tokens": 58775336.0, "step": 1842 }, { "entropy": 0.9517180733382702, "epoch": 0.1695677425661727, "grad_norm": 0.15634024143218994, "learning_rate": 9.435090624712486e-05, "loss": 0.9174, "mean_token_accuracy": 0.7396046333014965, "num_tokens": 58806961.0, "step": 1843 }, { "entropy": 0.9258603788912296, "epoch": 0.16965974893761393, "grad_norm": 0.15717947483062744, "learning_rate": 9.434783942098323e-05, "loss": 0.9215, "mean_token_accuracy": 0.7375474758446217, "num_tokens": 58839513.0, "step": 1844 }, { "entropy": 0.9045845046639442, "epoch": 0.16975175530905515, "grad_norm": 0.15425685048103333, "learning_rate": 9.434477259484161e-05, "loss": 0.879, "mean_token_accuracy": 0.7501320019364357, "num_tokens": 58872164.0, "step": 1845 }, { "entropy": 0.9177219197154045, "epoch": 0.16984376168049636, "grad_norm": 0.15842808783054352, "learning_rate": 9.434170576869998e-05, "loss": 0.9236, "mean_token_accuracy": 0.7388772144913673, "num_tokens": 58903405.0, "step": 1846 }, { "entropy": 0.8883706144988537, "epoch": 0.1699357680519376, "grad_norm": 0.15935038030147552, "learning_rate": 9.433863894255836e-05, "loss": 0.9031, "mean_token_accuracy": 0.7455946169793606, "num_tokens": 58935244.0, "step": 1847 }, { "entropy": 0.8977056592702866, "epoch": 0.17002777442337882, "grad_norm": 0.1567680388689041, "learning_rate": 9.433557211641673e-05, "loss": 0.899, "mean_token_accuracy": 0.7477743178606033, "num_tokens": 58966904.0, "step": 1848 }, { "entropy": 0.8123586624860764, "epoch": 0.17011978079482004, "grad_norm": 0.15393827855587006, "learning_rate": 9.433250529027509e-05, "loss": 0.8089, "mean_token_accuracy": 0.7651770859956741, "num_tokens": 58998425.0, "step": 1849 }, { "entropy": 0.8685755357146263, "epoch": 0.17021178716626126, "grad_norm": 0.15230123698711395, "learning_rate": 9.432943846413347e-05, "loss": 0.8633, "mean_token_accuracy": 0.7513212189078331, "num_tokens": 59030991.0, "step": 1850 }, { "entropy": 0.996167179197073, "epoch": 0.17030379353770247, "grad_norm": 0.16995355486869812, "learning_rate": 9.432637163799186e-05, "loss": 0.9957, "mean_token_accuracy": 0.718870609998703, "num_tokens": 59063281.0, "step": 1851 }, { "entropy": 0.9604267254471779, "epoch": 0.17039579990914372, "grad_norm": 0.16216331720352173, "learning_rate": 9.432330481185022e-05, "loss": 0.9593, "mean_token_accuracy": 0.7290573716163635, "num_tokens": 59095922.0, "step": 1852 }, { "entropy": 0.885973397642374, "epoch": 0.17048780628058494, "grad_norm": 0.15408769249916077, "learning_rate": 9.432023798570859e-05, "loss": 0.8855, "mean_token_accuracy": 0.7510918751358986, "num_tokens": 59128246.0, "step": 1853 }, { "entropy": 0.8039834406226873, "epoch": 0.17057981265202615, "grad_norm": 0.15309977531433105, "learning_rate": 9.431717115956696e-05, "loss": 0.8007, "mean_token_accuracy": 0.7673305794596672, "num_tokens": 59160231.0, "step": 1854 }, { "entropy": 0.9160208106040955, "epoch": 0.17067181902346737, "grad_norm": 0.16488729417324066, "learning_rate": 9.431410433342534e-05, "loss": 0.941, "mean_token_accuracy": 0.7335659489035606, "num_tokens": 59192492.0, "step": 1855 }, { "entropy": 0.7917605899274349, "epoch": 0.17076382539490859, "grad_norm": 0.16340278089046478, "learning_rate": 9.431103750728372e-05, "loss": 0.8225, "mean_token_accuracy": 0.7655744291841984, "num_tokens": 59224016.0, "step": 1856 }, { "entropy": 0.8084781393408775, "epoch": 0.17085583176634983, "grad_norm": 0.15780781209468842, "learning_rate": 9.430797068114209e-05, "loss": 0.8266, "mean_token_accuracy": 0.7568622156977654, "num_tokens": 59256426.0, "step": 1857 }, { "entropy": 0.8871316742151976, "epoch": 0.17094783813779105, "grad_norm": 0.1542637199163437, "learning_rate": 9.430490385500046e-05, "loss": 0.8757, "mean_token_accuracy": 0.7519547455012798, "num_tokens": 59288713.0, "step": 1858 }, { "entropy": 0.9869510233402252, "epoch": 0.17103984450923226, "grad_norm": 0.16224883496761322, "learning_rate": 9.430183702885884e-05, "loss": 0.9614, "mean_token_accuracy": 0.7330340966582298, "num_tokens": 59321367.0, "step": 1859 }, { "entropy": 1.0379321537911892, "epoch": 0.17113185088067348, "grad_norm": 0.16850978136062622, "learning_rate": 9.429877020271721e-05, "loss": 1.0353, "mean_token_accuracy": 0.7148441299796104, "num_tokens": 59352644.0, "step": 1860 }, { "entropy": 0.8512087445706129, "epoch": 0.1712238572521147, "grad_norm": 0.15685105323791504, "learning_rate": 9.429570337657559e-05, "loss": 0.8253, "mean_token_accuracy": 0.7593910396099091, "num_tokens": 59384604.0, "step": 1861 }, { "entropy": 0.9197734668850899, "epoch": 0.17131586362355594, "grad_norm": 0.1591319739818573, "learning_rate": 9.429263655043397e-05, "loss": 0.8984, "mean_token_accuracy": 0.7394395656883717, "num_tokens": 59416322.0, "step": 1862 }, { "entropy": 0.83257388882339, "epoch": 0.17140786999499716, "grad_norm": 0.1549418717622757, "learning_rate": 9.428956972429234e-05, "loss": 0.8346, "mean_token_accuracy": 0.7629285864531994, "num_tokens": 59448943.0, "step": 1863 }, { "entropy": 0.9548040069639683, "epoch": 0.17149987636643838, "grad_norm": 0.1675068885087967, "learning_rate": 9.42865028981507e-05, "loss": 0.9551, "mean_token_accuracy": 0.7319391667842865, "num_tokens": 59481363.0, "step": 1864 }, { "entropy": 0.8938488233834505, "epoch": 0.1715918827378796, "grad_norm": 0.15862978994846344, "learning_rate": 9.428343607200907e-05, "loss": 0.9038, "mean_token_accuracy": 0.7440845817327499, "num_tokens": 59513516.0, "step": 1865 }, { "entropy": 0.9240580834448338, "epoch": 0.1716838891093208, "grad_norm": 0.162907212972641, "learning_rate": 9.428036924586746e-05, "loss": 0.9194, "mean_token_accuracy": 0.7435371279716492, "num_tokens": 59545301.0, "step": 1866 }, { "entropy": 0.8283825144171715, "epoch": 0.17177589548076205, "grad_norm": 0.1529933214187622, "learning_rate": 9.427730241972584e-05, "loss": 0.8092, "mean_token_accuracy": 0.7666553258895874, "num_tokens": 59577319.0, "step": 1867 }, { "entropy": 0.9682305194437504, "epoch": 0.17186790185220327, "grad_norm": 0.1727389544248581, "learning_rate": 9.42742355935842e-05, "loss": 0.9685, "mean_token_accuracy": 0.726842425763607, "num_tokens": 59608538.0, "step": 1868 }, { "entropy": 0.8739567399024963, "epoch": 0.1719599082236445, "grad_norm": 0.15527045726776123, "learning_rate": 9.427116876744257e-05, "loss": 0.8725, "mean_token_accuracy": 0.7530970685184002, "num_tokens": 59641016.0, "step": 1869 }, { "entropy": 0.9649168588221073, "epoch": 0.1720519145950857, "grad_norm": 0.16884897649288177, "learning_rate": 9.426810194130095e-05, "loss": 0.97, "mean_token_accuracy": 0.7300683669745922, "num_tokens": 59672789.0, "step": 1870 }, { "entropy": 0.8569833412766457, "epoch": 0.17214392096652692, "grad_norm": 0.16047517955303192, "learning_rate": 9.426503511515932e-05, "loss": 0.8698, "mean_token_accuracy": 0.7477751262485981, "num_tokens": 59704541.0, "step": 1871 }, { "entropy": 0.8406945317983627, "epoch": 0.17223592733796816, "grad_norm": 0.1621973067522049, "learning_rate": 9.42619682890177e-05, "loss": 0.8492, "mean_token_accuracy": 0.7573677487671375, "num_tokens": 59736305.0, "step": 1872 }, { "entropy": 0.8772669285535812, "epoch": 0.17232793370940938, "grad_norm": 0.15862306952476501, "learning_rate": 9.425890146287607e-05, "loss": 0.8743, "mean_token_accuracy": 0.751763604581356, "num_tokens": 59768621.0, "step": 1873 }, { "entropy": 0.8772459179162979, "epoch": 0.1724199400808506, "grad_norm": 0.16818562150001526, "learning_rate": 9.425583463673445e-05, "loss": 0.9206, "mean_token_accuracy": 0.7448192238807678, "num_tokens": 59800540.0, "step": 1874 }, { "entropy": 0.8375705778598785, "epoch": 0.17251194645229181, "grad_norm": 0.1598014086484909, "learning_rate": 9.425276781059282e-05, "loss": 0.8534, "mean_token_accuracy": 0.7576014995574951, "num_tokens": 59832585.0, "step": 1875 }, { "entropy": 0.9514926746487617, "epoch": 0.17260395282373303, "grad_norm": 0.15755562484264374, "learning_rate": 9.424970098445119e-05, "loss": 0.9445, "mean_token_accuracy": 0.7323351576924324, "num_tokens": 59864720.0, "step": 1876 }, { "entropy": 0.8084214963018894, "epoch": 0.17269595919517428, "grad_norm": 0.15232513844966888, "learning_rate": 9.424663415830957e-05, "loss": 0.8002, "mean_token_accuracy": 0.7686799764633179, "num_tokens": 59897361.0, "step": 1877 }, { "entropy": 0.941080778837204, "epoch": 0.1727879655666155, "grad_norm": 0.162842258810997, "learning_rate": 9.424356733216795e-05, "loss": 0.9321, "mean_token_accuracy": 0.7354013286530972, "num_tokens": 59929405.0, "step": 1878 }, { "entropy": 0.9692078158259392, "epoch": 0.1728799719380567, "grad_norm": 0.1627609133720398, "learning_rate": 9.424050050602632e-05, "loss": 0.9393, "mean_token_accuracy": 0.7363405264914036, "num_tokens": 59960778.0, "step": 1879 }, { "entropy": 0.9325489066541195, "epoch": 0.17297197830949793, "grad_norm": 0.15714102983474731, "learning_rate": 9.423743367988469e-05, "loss": 0.9233, "mean_token_accuracy": 0.7390247248113155, "num_tokens": 59993064.0, "step": 1880 }, { "entropy": 0.9120017848908901, "epoch": 0.17306398468093914, "grad_norm": 0.16190214455127716, "learning_rate": 9.423436685374305e-05, "loss": 0.9045, "mean_token_accuracy": 0.7406519912183285, "num_tokens": 60024629.0, "step": 1881 }, { "entropy": 0.9417525641620159, "epoch": 0.1731559910523804, "grad_norm": 0.15931543707847595, "learning_rate": 9.423130002760145e-05, "loss": 0.9233, "mean_token_accuracy": 0.7374418713152409, "num_tokens": 60056606.0, "step": 1882 }, { "entropy": 0.8955351933836937, "epoch": 0.1732479974238216, "grad_norm": 0.15810322761535645, "learning_rate": 9.422823320145982e-05, "loss": 0.9119, "mean_token_accuracy": 0.740511491894722, "num_tokens": 60089113.0, "step": 1883 }, { "entropy": 0.9876630119979382, "epoch": 0.17334000379526282, "grad_norm": 0.165706604719162, "learning_rate": 9.422516637531819e-05, "loss": 0.9892, "mean_token_accuracy": 0.7245639860630035, "num_tokens": 60119962.0, "step": 1884 }, { "entropy": 0.8956912364810705, "epoch": 0.17343201016670404, "grad_norm": 0.16372308135032654, "learning_rate": 9.422209954917655e-05, "loss": 0.9045, "mean_token_accuracy": 0.7458113171160221, "num_tokens": 60151801.0, "step": 1885 }, { "entropy": 0.8040297999978065, "epoch": 0.17352401653814525, "grad_norm": 0.15230725705623627, "learning_rate": 9.421903272303493e-05, "loss": 0.8001, "mean_token_accuracy": 0.7688378877937794, "num_tokens": 60182971.0, "step": 1886 }, { "entropy": 0.9118799418210983, "epoch": 0.1736160229095865, "grad_norm": 0.1633504182100296, "learning_rate": 9.421596589689332e-05, "loss": 0.8856, "mean_token_accuracy": 0.7484063655138016, "num_tokens": 60214750.0, "step": 1887 }, { "entropy": 0.8926295302808285, "epoch": 0.17370802928102771, "grad_norm": 0.15819217264652252, "learning_rate": 9.421289907075168e-05, "loss": 0.88, "mean_token_accuracy": 0.7453234866261482, "num_tokens": 60247202.0, "step": 1888 }, { "entropy": 0.8760696277022362, "epoch": 0.17380003565246893, "grad_norm": 0.15865299105644226, "learning_rate": 9.420983224461005e-05, "loss": 0.9058, "mean_token_accuracy": 0.7442635595798492, "num_tokens": 60279723.0, "step": 1889 }, { "entropy": 0.8700458966195583, "epoch": 0.17389204202391015, "grad_norm": 0.1593678891658783, "learning_rate": 9.420676541846843e-05, "loss": 0.8925, "mean_token_accuracy": 0.7463311813771725, "num_tokens": 60312216.0, "step": 1890 }, { "entropy": 0.9081114921718836, "epoch": 0.17398404839535137, "grad_norm": 0.1627340018749237, "learning_rate": 9.42036985923268e-05, "loss": 0.9172, "mean_token_accuracy": 0.7409970425069332, "num_tokens": 60343658.0, "step": 1891 }, { "entropy": 0.9439083747565746, "epoch": 0.1740760547667926, "grad_norm": 0.16297918558120728, "learning_rate": 9.420063176618518e-05, "loss": 0.9489, "mean_token_accuracy": 0.7335664182901382, "num_tokens": 60375761.0, "step": 1892 }, { "entropy": 0.866368655115366, "epoch": 0.17416806113823383, "grad_norm": 0.15370438992977142, "learning_rate": 9.419756494004356e-05, "loss": 0.8533, "mean_token_accuracy": 0.7553115338087082, "num_tokens": 60407299.0, "step": 1893 }, { "entropy": 0.8385331127792597, "epoch": 0.17426006750967504, "grad_norm": 0.1528184413909912, "learning_rate": 9.419449811390193e-05, "loss": 0.8341, "mean_token_accuracy": 0.7628591507673264, "num_tokens": 60439515.0, "step": 1894 }, { "entropy": 0.958952110260725, "epoch": 0.17435207388111626, "grad_norm": 0.16451141238212585, "learning_rate": 9.41914312877603e-05, "loss": 0.9643, "mean_token_accuracy": 0.7299320884048939, "num_tokens": 60471421.0, "step": 1895 }, { "entropy": 0.9270216189324856, "epoch": 0.17444408025255748, "grad_norm": 0.16445523500442505, "learning_rate": 9.418836446161867e-05, "loss": 0.9503, "mean_token_accuracy": 0.7359288483858109, "num_tokens": 60503548.0, "step": 1896 }, { "entropy": 0.846885584294796, "epoch": 0.17453608662399872, "grad_norm": 0.1647835373878479, "learning_rate": 9.418529763547705e-05, "loss": 0.8577, "mean_token_accuracy": 0.7575631700456142, "num_tokens": 60535181.0, "step": 1897 }, { "entropy": 0.8832699693739414, "epoch": 0.17462809299543994, "grad_norm": 0.15676485002040863, "learning_rate": 9.418223080933543e-05, "loss": 0.8922, "mean_token_accuracy": 0.746915016323328, "num_tokens": 60567499.0, "step": 1898 }, { "entropy": 0.8710623979568481, "epoch": 0.17472009936688115, "grad_norm": 0.15335582196712494, "learning_rate": 9.41791639831938e-05, "loss": 0.8643, "mean_token_accuracy": 0.7527070604264736, "num_tokens": 60599713.0, "step": 1899 }, { "entropy": 0.8578383438289165, "epoch": 0.17481210573832237, "grad_norm": 0.1570405513048172, "learning_rate": 9.417609715705217e-05, "loss": 0.8444, "mean_token_accuracy": 0.7536755613982677, "num_tokens": 60631095.0, "step": 1900 }, { "entropy": 0.8966676965355873, "epoch": 0.1749041121097636, "grad_norm": 0.16427390277385712, "learning_rate": 9.417303033091055e-05, "loss": 0.9043, "mean_token_accuracy": 0.7457891143858433, "num_tokens": 60662702.0, "step": 1901 }, { "entropy": 0.9051119722425938, "epoch": 0.17499611848120483, "grad_norm": 0.15830010175704956, "learning_rate": 9.416996350476892e-05, "loss": 0.8816, "mean_token_accuracy": 0.7485939674079418, "num_tokens": 60695143.0, "step": 1902 }, { "entropy": 0.8896239250898361, "epoch": 0.17508812485264605, "grad_norm": 0.15849563479423523, "learning_rate": 9.41668966786273e-05, "loss": 0.8813, "mean_token_accuracy": 0.7472447268664837, "num_tokens": 60727449.0, "step": 1903 }, { "entropy": 0.9845099411904812, "epoch": 0.17518013122408727, "grad_norm": 0.16663126647472382, "learning_rate": 9.416382985248566e-05, "loss": 0.9788, "mean_token_accuracy": 0.7253895811736584, "num_tokens": 60758539.0, "step": 1904 }, { "entropy": 0.8367153108119965, "epoch": 0.17527213759552848, "grad_norm": 0.1567063331604004, "learning_rate": 9.416076302634405e-05, "loss": 0.8276, "mean_token_accuracy": 0.7577414326369762, "num_tokens": 60790383.0, "step": 1905 }, { "entropy": 0.8066691048443317, "epoch": 0.1753641439669697, "grad_norm": 0.15768389403820038, "learning_rate": 9.415769620020241e-05, "loss": 0.7903, "mean_token_accuracy": 0.7732889391481876, "num_tokens": 60821777.0, "step": 1906 }, { "entropy": 0.8438106011599302, "epoch": 0.17545615033841094, "grad_norm": 0.154905766248703, "learning_rate": 9.415462937406078e-05, "loss": 0.8202, "mean_token_accuracy": 0.7615134976804256, "num_tokens": 60853067.0, "step": 1907 }, { "entropy": 0.8664483912289143, "epoch": 0.17554815670985216, "grad_norm": 0.16080358624458313, "learning_rate": 9.415156254791916e-05, "loss": 0.8759, "mean_token_accuracy": 0.752622690051794, "num_tokens": 60885306.0, "step": 1908 }, { "entropy": 0.8651197906583548, "epoch": 0.17564016308129338, "grad_norm": 0.15626160800457, "learning_rate": 9.414849572177754e-05, "loss": 0.8839, "mean_token_accuracy": 0.745987094938755, "num_tokens": 60917652.0, "step": 1909 }, { "entropy": 0.8212180305272341, "epoch": 0.1757321694527346, "grad_norm": 0.15831954777240753, "learning_rate": 9.414542889563591e-05, "loss": 0.8405, "mean_token_accuracy": 0.7584434375166893, "num_tokens": 60949746.0, "step": 1910 }, { "entropy": 0.8278720322996378, "epoch": 0.17582417582417584, "grad_norm": 0.16028863191604614, "learning_rate": 9.414236206949428e-05, "loss": 0.8255, "mean_token_accuracy": 0.7625668682157993, "num_tokens": 60980967.0, "step": 1911 }, { "entropy": 0.9243301004171371, "epoch": 0.17591618219561705, "grad_norm": 0.1606753170490265, "learning_rate": 9.413929524335265e-05, "loss": 0.9073, "mean_token_accuracy": 0.7430240288376808, "num_tokens": 61012937.0, "step": 1912 }, { "entropy": 0.875252265483141, "epoch": 0.17600818856705827, "grad_norm": 0.1650233119726181, "learning_rate": 9.413622841721103e-05, "loss": 0.8786, "mean_token_accuracy": 0.7480699643492699, "num_tokens": 61045226.0, "step": 1913 }, { "entropy": 0.8323456011712551, "epoch": 0.1761001949384995, "grad_norm": 0.15924206376075745, "learning_rate": 9.413316159106941e-05, "loss": 0.8414, "mean_token_accuracy": 0.7571388334035873, "num_tokens": 61077399.0, "step": 1914 }, { "entropy": 0.8103114906698465, "epoch": 0.1761922013099407, "grad_norm": 0.15570461750030518, "learning_rate": 9.413009476492778e-05, "loss": 0.7824, "mean_token_accuracy": 0.7727453000843525, "num_tokens": 61109115.0, "step": 1915 }, { "entropy": 0.8294900190085173, "epoch": 0.17628420768138195, "grad_norm": 0.16319166123867035, "learning_rate": 9.412702793878615e-05, "loss": 0.8302, "mean_token_accuracy": 0.7586394585669041, "num_tokens": 61140368.0, "step": 1916 }, { "entropy": 0.9500578865408897, "epoch": 0.17637621405282317, "grad_norm": 0.16365797817707062, "learning_rate": 9.412396111264453e-05, "loss": 0.9468, "mean_token_accuracy": 0.7268388345837593, "num_tokens": 61172180.0, "step": 1917 }, { "entropy": 0.9131770320236683, "epoch": 0.17646822042426438, "grad_norm": 0.15897084772586823, "learning_rate": 9.41208942865029e-05, "loss": 0.9019, "mean_token_accuracy": 0.7448991909623146, "num_tokens": 61203652.0, "step": 1918 }, { "entropy": 0.8933025561273098, "epoch": 0.1765602267957056, "grad_norm": 0.156026229262352, "learning_rate": 9.411782746036128e-05, "loss": 0.8772, "mean_token_accuracy": 0.7492431998252869, "num_tokens": 61234705.0, "step": 1919 }, { "entropy": 0.9026918932795525, "epoch": 0.17665223316714682, "grad_norm": 0.1661609262228012, "learning_rate": 9.411476063421965e-05, "loss": 0.9121, "mean_token_accuracy": 0.7400776334106922, "num_tokens": 61265932.0, "step": 1920 }, { "entropy": 0.8438852876424789, "epoch": 0.17674423953858806, "grad_norm": 0.15465471148490906, "learning_rate": 9.411169380807803e-05, "loss": 0.837, "mean_token_accuracy": 0.7550399228930473, "num_tokens": 61298068.0, "step": 1921 }, { "entropy": 0.9316592924296856, "epoch": 0.17683624591002928, "grad_norm": 0.16610406339168549, "learning_rate": 9.41086269819364e-05, "loss": 0.9497, "mean_token_accuracy": 0.7349800132215023, "num_tokens": 61329958.0, "step": 1922 }, { "entropy": 0.8953296281397343, "epoch": 0.1769282522814705, "grad_norm": 0.1639757603406906, "learning_rate": 9.410556015579478e-05, "loss": 0.9198, "mean_token_accuracy": 0.7405243739485741, "num_tokens": 61362276.0, "step": 1923 }, { "entropy": 0.8736464381217957, "epoch": 0.1770202586529117, "grad_norm": 0.16952674090862274, "learning_rate": 9.410249332965316e-05, "loss": 0.8829, "mean_token_accuracy": 0.7433557249605656, "num_tokens": 61393645.0, "step": 1924 }, { "entropy": 0.802812235429883, "epoch": 0.17711226502435293, "grad_norm": 0.15684747695922852, "learning_rate": 9.409942650351153e-05, "loss": 0.8132, "mean_token_accuracy": 0.7672380842268467, "num_tokens": 61425927.0, "step": 1925 }, { "entropy": 0.9181756488978863, "epoch": 0.17720427139579417, "grad_norm": 0.1554405242204666, "learning_rate": 9.40963596773699e-05, "loss": 0.9147, "mean_token_accuracy": 0.7380742691457272, "num_tokens": 61457762.0, "step": 1926 }, { "entropy": 0.9950628988444805, "epoch": 0.1772962777672354, "grad_norm": 0.16184380650520325, "learning_rate": 9.409329285122826e-05, "loss": 0.9775, "mean_token_accuracy": 0.7249091789126396, "num_tokens": 61490018.0, "step": 1927 }, { "entropy": 0.9058981128036976, "epoch": 0.1773882841386766, "grad_norm": 0.16267764568328857, "learning_rate": 9.409022602508664e-05, "loss": 0.9041, "mean_token_accuracy": 0.737959947437048, "num_tokens": 61521500.0, "step": 1928 }, { "entropy": 0.8950675036758184, "epoch": 0.17748029051011782, "grad_norm": 0.1572149693965912, "learning_rate": 9.408715919894502e-05, "loss": 0.8991, "mean_token_accuracy": 0.7412764392793179, "num_tokens": 61552535.0, "step": 1929 }, { "entropy": 0.8722300231456757, "epoch": 0.17757229688155904, "grad_norm": 0.15969207882881165, "learning_rate": 9.408409237280339e-05, "loss": 0.8753, "mean_token_accuracy": 0.7523846551775932, "num_tokens": 61584629.0, "step": 1930 }, { "entropy": 0.8401013910770416, "epoch": 0.17766430325300028, "grad_norm": 0.15525026619434357, "learning_rate": 9.408102554666176e-05, "loss": 0.83, "mean_token_accuracy": 0.7585150972008705, "num_tokens": 61616563.0, "step": 1931 }, { "entropy": 0.9182925298810005, "epoch": 0.1777563096244415, "grad_norm": 0.16628873348236084, "learning_rate": 9.407795872052014e-05, "loss": 0.9264, "mean_token_accuracy": 0.7425150536000729, "num_tokens": 61648681.0, "step": 1932 }, { "entropy": 0.9674626514315605, "epoch": 0.17784831599588272, "grad_norm": 0.1649910807609558, "learning_rate": 9.407489189437851e-05, "loss": 0.9563, "mean_token_accuracy": 0.7306757904589176, "num_tokens": 61680109.0, "step": 1933 }, { "entropy": 0.883151214569807, "epoch": 0.17794032236732393, "grad_norm": 0.16164125502109528, "learning_rate": 9.407182506823689e-05, "loss": 0.8791, "mean_token_accuracy": 0.748978815972805, "num_tokens": 61712739.0, "step": 1934 }, { "entropy": 0.8568417485803366, "epoch": 0.17803232873876515, "grad_norm": 0.15556243062019348, "learning_rate": 9.406875824209526e-05, "loss": 0.8456, "mean_token_accuracy": 0.7571213878691196, "num_tokens": 61745052.0, "step": 1935 }, { "entropy": 0.7681448012590408, "epoch": 0.1781243351102064, "grad_norm": 0.15426810085773468, "learning_rate": 9.406569141595364e-05, "loss": 0.749, "mean_token_accuracy": 0.7827073112130165, "num_tokens": 61777132.0, "step": 1936 }, { "entropy": 0.8204676918685436, "epoch": 0.1782163414816476, "grad_norm": 0.1503227800130844, "learning_rate": 9.406262458981201e-05, "loss": 0.7951, "mean_token_accuracy": 0.7690162435173988, "num_tokens": 61809578.0, "step": 1937 }, { "entropy": 0.8179285116493702, "epoch": 0.17830834785308883, "grad_norm": 0.15755023062229156, "learning_rate": 9.405955776367038e-05, "loss": 0.8263, "mean_token_accuracy": 0.7617741972208023, "num_tokens": 61842085.0, "step": 1938 }, { "entropy": 0.8645897079259157, "epoch": 0.17840035422453004, "grad_norm": 0.15597712993621826, "learning_rate": 9.405649093752876e-05, "loss": 0.8647, "mean_token_accuracy": 0.7521870099008083, "num_tokens": 61873907.0, "step": 1939 }, { "entropy": 0.9659742340445518, "epoch": 0.17849236059597126, "grad_norm": 0.16275624930858612, "learning_rate": 9.405342411138714e-05, "loss": 0.9879, "mean_token_accuracy": 0.7224089317023754, "num_tokens": 61906491.0, "step": 1940 }, { "entropy": 0.8824424482882023, "epoch": 0.1785843669674125, "grad_norm": 0.16074663400650024, "learning_rate": 9.40503572852455e-05, "loss": 0.8624, "mean_token_accuracy": 0.7484971359372139, "num_tokens": 61938772.0, "step": 1941 }, { "entropy": 0.8316727019846439, "epoch": 0.17867637333885372, "grad_norm": 0.15254919230937958, "learning_rate": 9.404729045910387e-05, "loss": 0.8091, "mean_token_accuracy": 0.7678681574761868, "num_tokens": 61970845.0, "step": 1942 }, { "entropy": 0.8521139826625586, "epoch": 0.17876837971029494, "grad_norm": 0.1611201912164688, "learning_rate": 9.404422363296224e-05, "loss": 0.8412, "mean_token_accuracy": 0.761069193482399, "num_tokens": 62002875.0, "step": 1943 }, { "entropy": 0.848340617492795, "epoch": 0.17886038608173616, "grad_norm": 0.15629222989082336, "learning_rate": 9.404115680682062e-05, "loss": 0.8492, "mean_token_accuracy": 0.7606053091585636, "num_tokens": 62035351.0, "step": 1944 }, { "entropy": 0.8376112412661314, "epoch": 0.17895239245317737, "grad_norm": 0.16578906774520874, "learning_rate": 9.4038089980679e-05, "loss": 0.8564, "mean_token_accuracy": 0.7559154778718948, "num_tokens": 62067194.0, "step": 1945 }, { "entropy": 0.9160560555756092, "epoch": 0.17904439882461862, "grad_norm": 0.1683865338563919, "learning_rate": 9.403502315453737e-05, "loss": 0.9205, "mean_token_accuracy": 0.7384261265397072, "num_tokens": 62098528.0, "step": 1946 }, { "entropy": 0.8885866664350033, "epoch": 0.17913640519605983, "grad_norm": 0.16348950564861298, "learning_rate": 9.403195632839574e-05, "loss": 0.8796, "mean_token_accuracy": 0.7515899911522865, "num_tokens": 62130030.0, "step": 1947 }, { "entropy": 0.9445893652737141, "epoch": 0.17922841156750105, "grad_norm": 0.16221517324447632, "learning_rate": 9.402888950225412e-05, "loss": 0.9557, "mean_token_accuracy": 0.7316840030252934, "num_tokens": 62162156.0, "step": 1948 }, { "entropy": 0.8256821744143963, "epoch": 0.17932041793894227, "grad_norm": 0.16154508292675018, "learning_rate": 9.402582267611249e-05, "loss": 0.8302, "mean_token_accuracy": 0.7654169648885727, "num_tokens": 62194229.0, "step": 1949 }, { "entropy": 0.8002823200076818, "epoch": 0.17941242431038348, "grad_norm": 0.16087652742862701, "learning_rate": 9.402275584997087e-05, "loss": 0.8115, "mean_token_accuracy": 0.7657873369753361, "num_tokens": 62225406.0, "step": 1950 }, { "entropy": 0.8366348538547754, "epoch": 0.17950443068182473, "grad_norm": 0.1604553908109665, "learning_rate": 9.401968902382924e-05, "loss": 0.8341, "mean_token_accuracy": 0.7619588673114777, "num_tokens": 62257195.0, "step": 1951 }, { "entropy": 0.9393236972391605, "epoch": 0.17959643705326594, "grad_norm": 0.16409383714199066, "learning_rate": 9.401662219768762e-05, "loss": 0.9159, "mean_token_accuracy": 0.7402084767818451, "num_tokens": 62289490.0, "step": 1952 }, { "entropy": 0.8731848355382681, "epoch": 0.17968844342470716, "grad_norm": 0.15401241183280945, "learning_rate": 9.401355537154599e-05, "loss": 0.8713, "mean_token_accuracy": 0.7510554194450378, "num_tokens": 62321514.0, "step": 1953 }, { "entropy": 0.8477256558835506, "epoch": 0.17978044979614838, "grad_norm": 0.1566876620054245, "learning_rate": 9.401048854540436e-05, "loss": 0.8381, "mean_token_accuracy": 0.7641479410231113, "num_tokens": 62353283.0, "step": 1954 }, { "entropy": 0.953221982344985, "epoch": 0.1798724561675896, "grad_norm": 0.16360488533973694, "learning_rate": 9.400742171926275e-05, "loss": 0.9294, "mean_token_accuracy": 0.7360645607113838, "num_tokens": 62384867.0, "step": 1955 }, { "entropy": 0.9862979240715504, "epoch": 0.17996446253903084, "grad_norm": 0.17085519433021545, "learning_rate": 9.400435489312112e-05, "loss": 0.9875, "mean_token_accuracy": 0.7191058546304703, "num_tokens": 62416123.0, "step": 1956 }, { "entropy": 0.8249899782240391, "epoch": 0.18005646891047206, "grad_norm": 0.15461786091327667, "learning_rate": 9.400128806697949e-05, "loss": 0.8243, "mean_token_accuracy": 0.7621666416525841, "num_tokens": 62448753.0, "step": 1957 }, { "entropy": 0.8629487045109272, "epoch": 0.18014847528191327, "grad_norm": 0.15502046048641205, "learning_rate": 9.399822124083786e-05, "loss": 0.8588, "mean_token_accuracy": 0.757506225258112, "num_tokens": 62481003.0, "step": 1958 }, { "entropy": 0.8199736587703228, "epoch": 0.1802404816533545, "grad_norm": 0.16673530638217926, "learning_rate": 9.399515441469624e-05, "loss": 0.8343, "mean_token_accuracy": 0.7647030875086784, "num_tokens": 62512866.0, "step": 1959 }, { "entropy": 0.9487345237284899, "epoch": 0.1803324880247957, "grad_norm": 0.17352715134620667, "learning_rate": 9.399208758855462e-05, "loss": 0.9911, "mean_token_accuracy": 0.7245938181877136, "num_tokens": 62544707.0, "step": 1960 }, { "entropy": 0.9104325380176306, "epoch": 0.18042449439623695, "grad_norm": 0.16445976495742798, "learning_rate": 9.398902076241299e-05, "loss": 0.9318, "mean_token_accuracy": 0.7354235388338566, "num_tokens": 62577100.0, "step": 1961 }, { "entropy": 0.8994204178452492, "epoch": 0.18051650076767817, "grad_norm": 0.16265100240707397, "learning_rate": 9.398595393627135e-05, "loss": 0.8981, "mean_token_accuracy": 0.7433972097933292, "num_tokens": 62609302.0, "step": 1962 }, { "entropy": 0.92415926232934, "epoch": 0.18060850713911938, "grad_norm": 0.15947270393371582, "learning_rate": 9.398288711012974e-05, "loss": 0.9281, "mean_token_accuracy": 0.7294612862169743, "num_tokens": 62641268.0, "step": 1963 }, { "entropy": 0.9489542972296476, "epoch": 0.1807005135105606, "grad_norm": 0.1628192514181137, "learning_rate": 9.39798202839881e-05, "loss": 0.9529, "mean_token_accuracy": 0.7311035767197609, "num_tokens": 62672737.0, "step": 1964 }, { "entropy": 0.9142560213804245, "epoch": 0.18079251988200182, "grad_norm": 0.16272202134132385, "learning_rate": 9.397675345784648e-05, "loss": 0.8838, "mean_token_accuracy": 0.7449588216841221, "num_tokens": 62703883.0, "step": 1965 }, { "entropy": 0.9141163378953934, "epoch": 0.18088452625344306, "grad_norm": 0.15744638442993164, "learning_rate": 9.397368663170485e-05, "loss": 0.8942, "mean_token_accuracy": 0.7445085272192955, "num_tokens": 62735528.0, "step": 1966 }, { "entropy": 0.84230612590909, "epoch": 0.18097653262488428, "grad_norm": 0.1555042713880539, "learning_rate": 9.397061980556323e-05, "loss": 0.8246, "mean_token_accuracy": 0.7620725929737091, "num_tokens": 62767243.0, "step": 1967 }, { "entropy": 0.8740823641419411, "epoch": 0.1810685389963255, "grad_norm": 0.15724396705627441, "learning_rate": 9.39675529794216e-05, "loss": 0.8701, "mean_token_accuracy": 0.747488297522068, "num_tokens": 62799970.0, "step": 1968 }, { "entropy": 0.9185877647250891, "epoch": 0.1811605453677667, "grad_norm": 0.16185419261455536, "learning_rate": 9.396448615327997e-05, "loss": 0.9282, "mean_token_accuracy": 0.7406797222793102, "num_tokens": 62831989.0, "step": 1969 }, { "entropy": 0.9178366959095001, "epoch": 0.18125255173920793, "grad_norm": 0.1610131561756134, "learning_rate": 9.396141932713835e-05, "loss": 0.9274, "mean_token_accuracy": 0.7371709644794464, "num_tokens": 62863623.0, "step": 1970 }, { "entropy": 0.8601364158093929, "epoch": 0.18134455811064917, "grad_norm": 0.16155873239040375, "learning_rate": 9.395835250099673e-05, "loss": 0.8555, "mean_token_accuracy": 0.7587932161986828, "num_tokens": 62894881.0, "step": 1971 }, { "entropy": 0.8727019280195236, "epoch": 0.1814365644820904, "grad_norm": 0.15873903036117554, "learning_rate": 9.39552856748551e-05, "loss": 0.8513, "mean_token_accuracy": 0.7576525211334229, "num_tokens": 62927006.0, "step": 1972 }, { "entropy": 0.7951199021190405, "epoch": 0.1815285708535316, "grad_norm": 0.16684651374816895, "learning_rate": 9.395221884871347e-05, "loss": 0.7748, "mean_token_accuracy": 0.7764547653496265, "num_tokens": 62959195.0, "step": 1973 }, { "entropy": 0.8584694042801857, "epoch": 0.18162057722497282, "grad_norm": 0.15548956394195557, "learning_rate": 9.394915202257184e-05, "loss": 0.8638, "mean_token_accuracy": 0.7531874440610409, "num_tokens": 62990617.0, "step": 1974 }, { "entropy": 0.7681335564702749, "epoch": 0.18171258359641404, "grad_norm": 0.15133829414844513, "learning_rate": 9.394608519643022e-05, "loss": 0.7651, "mean_token_accuracy": 0.7752537503838539, "num_tokens": 63023001.0, "step": 1975 }, { "entropy": 0.8975860178470612, "epoch": 0.18180458996785528, "grad_norm": 0.1556512415409088, "learning_rate": 9.39430183702886e-05, "loss": 0.8956, "mean_token_accuracy": 0.7440182268619537, "num_tokens": 63055389.0, "step": 1976 }, { "entropy": 0.86626011505723, "epoch": 0.1818965963392965, "grad_norm": 0.16330760717391968, "learning_rate": 9.393995154414697e-05, "loss": 0.9035, "mean_token_accuracy": 0.7453521937131882, "num_tokens": 63087662.0, "step": 1977 }, { "entropy": 0.8465371988713741, "epoch": 0.18198860271073772, "grad_norm": 0.15979325771331787, "learning_rate": 9.393688471800533e-05, "loss": 0.8631, "mean_token_accuracy": 0.7496358975768089, "num_tokens": 63119080.0, "step": 1978 }, { "entropy": 0.7927393540740013, "epoch": 0.18208060908217893, "grad_norm": 0.15314452350139618, "learning_rate": 9.393381789186372e-05, "loss": 0.7972, "mean_token_accuracy": 0.7687264382839203, "num_tokens": 63150610.0, "step": 1979 }, { "entropy": 0.802070289850235, "epoch": 0.18217261545362015, "grad_norm": 0.15278708934783936, "learning_rate": 9.393075106572208e-05, "loss": 0.8192, "mean_token_accuracy": 0.7721150778234005, "num_tokens": 63182989.0, "step": 1980 }, { "entropy": 0.9702539928257465, "epoch": 0.1822646218250614, "grad_norm": 0.16206657886505127, "learning_rate": 9.392768423958047e-05, "loss": 0.9796, "mean_token_accuracy": 0.7228400334715843, "num_tokens": 63214901.0, "step": 1981 }, { "entropy": 0.7839300334453583, "epoch": 0.1823566281965026, "grad_norm": 0.1466144621372223, "learning_rate": 9.392461741343883e-05, "loss": 0.763, "mean_token_accuracy": 0.7762608975172043, "num_tokens": 63246976.0, "step": 1982 }, { "entropy": 0.7909334190189838, "epoch": 0.18244863456794383, "grad_norm": 0.14542445540428162, "learning_rate": 9.392155058729721e-05, "loss": 0.7808, "mean_token_accuracy": 0.7757250480353832, "num_tokens": 63279619.0, "step": 1983 }, { "entropy": 0.9851250760257244, "epoch": 0.18254064093938505, "grad_norm": 0.1624215692281723, "learning_rate": 9.391848376115558e-05, "loss": 0.9643, "mean_token_accuracy": 0.7262255065143108, "num_tokens": 63311159.0, "step": 1984 }, { "entropy": 0.8264614325016737, "epoch": 0.18263264731082626, "grad_norm": 0.15101690590381622, "learning_rate": 9.391541693501395e-05, "loss": 0.7999, "mean_token_accuracy": 0.7653401903808117, "num_tokens": 63342747.0, "step": 1985 }, { "entropy": 0.9237053617835045, "epoch": 0.1827246536822675, "grad_norm": 0.1684730350971222, "learning_rate": 9.391235010887233e-05, "loss": 0.9342, "mean_token_accuracy": 0.7342002280056477, "num_tokens": 63374678.0, "step": 1986 }, { "entropy": 0.868966493755579, "epoch": 0.18281666005370872, "grad_norm": 0.15601295232772827, "learning_rate": 9.390928328273071e-05, "loss": 0.8764, "mean_token_accuracy": 0.7515330202877522, "num_tokens": 63407049.0, "step": 1987 }, { "entropy": 0.819223340600729, "epoch": 0.18290866642514994, "grad_norm": 0.14965568482875824, "learning_rate": 9.390621645658908e-05, "loss": 0.8112, "mean_token_accuracy": 0.7661146633327007, "num_tokens": 63439259.0, "step": 1988 }, { "entropy": 0.7846616264432669, "epoch": 0.18300067279659116, "grad_norm": 0.1548296958208084, "learning_rate": 9.390314963044745e-05, "loss": 0.7909, "mean_token_accuracy": 0.7720412723720074, "num_tokens": 63471431.0, "step": 1989 }, { "entropy": 0.8260967396199703, "epoch": 0.18309267916803237, "grad_norm": 0.16107745468616486, "learning_rate": 9.390008280430583e-05, "loss": 0.8054, "mean_token_accuracy": 0.7688294462859631, "num_tokens": 63503717.0, "step": 1990 }, { "entropy": 0.834751795977354, "epoch": 0.18318468553947362, "grad_norm": 0.15310858190059662, "learning_rate": 9.38970159781642e-05, "loss": 0.8287, "mean_token_accuracy": 0.7624571397900581, "num_tokens": 63535664.0, "step": 1991 }, { "entropy": 0.9050851464271545, "epoch": 0.18327669191091484, "grad_norm": 0.15908728539943695, "learning_rate": 9.389394915202258e-05, "loss": 0.8852, "mean_token_accuracy": 0.7468139603734016, "num_tokens": 63567527.0, "step": 1992 }, { "entropy": 0.9065479021519423, "epoch": 0.18336869828235605, "grad_norm": 0.15439389646053314, "learning_rate": 9.389088232588095e-05, "loss": 0.8946, "mean_token_accuracy": 0.7443993464112282, "num_tokens": 63600070.0, "step": 1993 }, { "entropy": 0.9310688227415085, "epoch": 0.18346070465379727, "grad_norm": 0.1685931235551834, "learning_rate": 9.388781549973933e-05, "loss": 0.9321, "mean_token_accuracy": 0.7354470491409302, "num_tokens": 63630583.0, "step": 1994 }, { "entropy": 0.8912995792925358, "epoch": 0.18355271102523849, "grad_norm": 0.22048255801200867, "learning_rate": 9.38847486735977e-05, "loss": 0.8999, "mean_token_accuracy": 0.7403712943196297, "num_tokens": 63662610.0, "step": 1995 }, { "entropy": 0.9158200062811375, "epoch": 0.18364471739667973, "grad_norm": 0.16192208230495453, "learning_rate": 9.388168184745606e-05, "loss": 0.9381, "mean_token_accuracy": 0.7375936694443226, "num_tokens": 63695028.0, "step": 1996 }, { "entropy": 0.8296115919947624, "epoch": 0.18373672376812095, "grad_norm": 0.1535319685935974, "learning_rate": 9.387861502131445e-05, "loss": 0.8274, "mean_token_accuracy": 0.7615524679422379, "num_tokens": 63727738.0, "step": 1997 }, { "entropy": 0.8706228844821453, "epoch": 0.18382873013956216, "grad_norm": 0.15712161362171173, "learning_rate": 9.387554819517283e-05, "loss": 0.8708, "mean_token_accuracy": 0.7500491812825203, "num_tokens": 63759036.0, "step": 1998 }, { "entropy": 0.8559218496084213, "epoch": 0.18392073651100338, "grad_norm": 0.15609563887119293, "learning_rate": 9.38724813690312e-05, "loss": 0.8553, "mean_token_accuracy": 0.7534160315990448, "num_tokens": 63791226.0, "step": 1999 }, { "entropy": 0.8668279834091663, "epoch": 0.1840127428824446, "grad_norm": 0.15756767988204956, "learning_rate": 9.386941454288956e-05, "loss": 0.8549, "mean_token_accuracy": 0.751496221870184, "num_tokens": 63822639.0, "step": 2000 }, { "entropy": 0.9212057013064623, "epoch": 0.18410474925388584, "grad_norm": 0.16219118237495422, "learning_rate": 9.386634771674793e-05, "loss": 0.92, "mean_token_accuracy": 0.7382799237966537, "num_tokens": 63853556.0, "step": 2001 }, { "entropy": 0.7749503999948502, "epoch": 0.18419675562532706, "grad_norm": 0.15189917385578156, "learning_rate": 9.386328089060633e-05, "loss": 0.7728, "mean_token_accuracy": 0.7693426348268986, "num_tokens": 63885584.0, "step": 2002 }, { "entropy": 0.7660795710980892, "epoch": 0.18428876199676827, "grad_norm": 0.15474411845207214, "learning_rate": 9.38602140644647e-05, "loss": 0.7498, "mean_token_accuracy": 0.7790898159146309, "num_tokens": 63917944.0, "step": 2003 }, { "entropy": 0.8617585264146328, "epoch": 0.1843807683682095, "grad_norm": 0.16178357601165771, "learning_rate": 9.385714723832306e-05, "loss": 0.8691, "mean_token_accuracy": 0.7499283477663994, "num_tokens": 63949828.0, "step": 2004 }, { "entropy": 0.9263352155685425, "epoch": 0.1844727747396507, "grad_norm": 0.1602795422077179, "learning_rate": 9.385408041218143e-05, "loss": 0.9171, "mean_token_accuracy": 0.737714622169733, "num_tokens": 63981775.0, "step": 2005 }, { "entropy": 0.8505771532654762, "epoch": 0.18456478111109195, "grad_norm": 0.15818481147289276, "learning_rate": 9.385101358603981e-05, "loss": 0.8638, "mean_token_accuracy": 0.7530789375305176, "num_tokens": 64013962.0, "step": 2006 }, { "entropy": 0.9102665297687054, "epoch": 0.18465678748253317, "grad_norm": 0.16169792413711548, "learning_rate": 9.384794675989819e-05, "loss": 0.9135, "mean_token_accuracy": 0.7367063835263252, "num_tokens": 64045703.0, "step": 2007 }, { "entropy": 0.841713935136795, "epoch": 0.18474879385397439, "grad_norm": 0.15355545282363892, "learning_rate": 9.384487993375656e-05, "loss": 0.8317, "mean_token_accuracy": 0.75917012616992, "num_tokens": 64077171.0, "step": 2008 }, { "entropy": 0.926487859338522, "epoch": 0.1848408002254156, "grad_norm": 0.15862159430980682, "learning_rate": 9.384181310761493e-05, "loss": 0.9289, "mean_token_accuracy": 0.7370729744434357, "num_tokens": 64108900.0, "step": 2009 }, { "entropy": 0.889353197067976, "epoch": 0.18493280659685682, "grad_norm": 0.16286253929138184, "learning_rate": 9.383874628147331e-05, "loss": 0.9187, "mean_token_accuracy": 0.7435460090637207, "num_tokens": 64141547.0, "step": 2010 }, { "entropy": 0.8953009396791458, "epoch": 0.18502481296829806, "grad_norm": 0.15893928706645966, "learning_rate": 9.383567945533168e-05, "loss": 0.8839, "mean_token_accuracy": 0.7446173205971718, "num_tokens": 64172941.0, "step": 2011 }, { "entropy": 0.8864428587257862, "epoch": 0.18511681933973928, "grad_norm": 0.1566944420337677, "learning_rate": 9.383261262919006e-05, "loss": 0.8762, "mean_token_accuracy": 0.7484751604497433, "num_tokens": 64204959.0, "step": 2012 }, { "entropy": 0.804668266326189, "epoch": 0.1852088257111805, "grad_norm": 0.1523744910955429, "learning_rate": 9.382954580304843e-05, "loss": 0.797, "mean_token_accuracy": 0.7658344246447086, "num_tokens": 64237067.0, "step": 2013 }, { "entropy": 0.7890373449772596, "epoch": 0.1853008320826217, "grad_norm": 0.15298423171043396, "learning_rate": 9.382647897690681e-05, "loss": 0.7738, "mean_token_accuracy": 0.779646098613739, "num_tokens": 64269076.0, "step": 2014 }, { "entropy": 0.8391816355288029, "epoch": 0.18539283845406293, "grad_norm": 0.156507208943367, "learning_rate": 9.382341215076518e-05, "loss": 0.8507, "mean_token_accuracy": 0.7547506541013718, "num_tokens": 64301240.0, "step": 2015 }, { "entropy": 0.7176179699599743, "epoch": 0.18548484482550417, "grad_norm": 0.14936517179012299, "learning_rate": 9.382034532462354e-05, "loss": 0.6999, "mean_token_accuracy": 0.7936183474957943, "num_tokens": 64333834.0, "step": 2016 }, { "entropy": 0.9070466496050358, "epoch": 0.1855768511969454, "grad_norm": 0.16041108965873718, "learning_rate": 9.381727849848193e-05, "loss": 0.8996, "mean_token_accuracy": 0.7438365668058395, "num_tokens": 64365959.0, "step": 2017 }, { "entropy": 0.8404087126255035, "epoch": 0.1856688575683866, "grad_norm": 0.16266557574272156, "learning_rate": 9.381421167234031e-05, "loss": 0.8547, "mean_token_accuracy": 0.7599496878683567, "num_tokens": 64398497.0, "step": 2018 }, { "entropy": 0.8685179185122252, "epoch": 0.18576086393982782, "grad_norm": 0.15677061676979065, "learning_rate": 9.381114484619867e-05, "loss": 0.8476, "mean_token_accuracy": 0.7601738162338734, "num_tokens": 64430302.0, "step": 2019 }, { "entropy": 0.8801700137555599, "epoch": 0.18585287031126904, "grad_norm": 0.1587846726179123, "learning_rate": 9.380807802005704e-05, "loss": 0.8738, "mean_token_accuracy": 0.7542241215705872, "num_tokens": 64461727.0, "step": 2020 }, { "entropy": 0.8801525477319956, "epoch": 0.1859448766827103, "grad_norm": 0.16184459626674652, "learning_rate": 9.380501119391542e-05, "loss": 0.8692, "mean_token_accuracy": 0.7533211074769497, "num_tokens": 64494136.0, "step": 2021 }, { "entropy": 0.8940998762845993, "epoch": 0.1860368830541515, "grad_norm": 0.16499122977256775, "learning_rate": 9.380194436777379e-05, "loss": 0.8993, "mean_token_accuracy": 0.7386087365448475, "num_tokens": 64525163.0, "step": 2022 }, { "entropy": 0.8294282592833042, "epoch": 0.18612888942559272, "grad_norm": 0.15808042883872986, "learning_rate": 9.379887754163217e-05, "loss": 0.8307, "mean_token_accuracy": 0.7567545399069786, "num_tokens": 64557009.0, "step": 2023 }, { "entropy": 0.7610705997794867, "epoch": 0.18622089579703394, "grad_norm": 0.15707454085350037, "learning_rate": 9.379581071549054e-05, "loss": 0.7777, "mean_token_accuracy": 0.7748976908624172, "num_tokens": 64589221.0, "step": 2024 }, { "entropy": 0.771922692656517, "epoch": 0.18631290216847518, "grad_norm": 0.15798892080783844, "learning_rate": 9.379274388934892e-05, "loss": 0.7958, "mean_token_accuracy": 0.7745271436870098, "num_tokens": 64621443.0, "step": 2025 }, { "entropy": 0.8313932530581951, "epoch": 0.1864049085399164, "grad_norm": 0.16411079466342926, "learning_rate": 9.378967706320729e-05, "loss": 0.8104, "mean_token_accuracy": 0.7729224562644958, "num_tokens": 64653792.0, "step": 2026 }, { "entropy": 0.8748119957745075, "epoch": 0.18649691491135761, "grad_norm": 0.15752798318862915, "learning_rate": 9.378661023706566e-05, "loss": 0.8492, "mean_token_accuracy": 0.758167389780283, "num_tokens": 64685363.0, "step": 2027 }, { "entropy": 0.9634877406060696, "epoch": 0.18658892128279883, "grad_norm": 0.1569027304649353, "learning_rate": 9.378354341092404e-05, "loss": 0.947, "mean_token_accuracy": 0.7322870679199696, "num_tokens": 64717788.0, "step": 2028 }, { "entropy": 0.8881736323237419, "epoch": 0.18668092765424005, "grad_norm": 0.15792250633239746, "learning_rate": 9.378047658478242e-05, "loss": 0.8775, "mean_token_accuracy": 0.7494480460882187, "num_tokens": 64749228.0, "step": 2029 }, { "entropy": 0.953178521245718, "epoch": 0.1867729340256813, "grad_norm": 0.1602461338043213, "learning_rate": 9.377740975864079e-05, "loss": 0.9203, "mean_token_accuracy": 0.7399674914777279, "num_tokens": 64781497.0, "step": 2030 }, { "entropy": 0.9327591173350811, "epoch": 0.1868649403971225, "grad_norm": 0.1633158028125763, "learning_rate": 9.377434293249916e-05, "loss": 0.9441, "mean_token_accuracy": 0.7319155223667622, "num_tokens": 64812619.0, "step": 2031 }, { "entropy": 0.8882357068359852, "epoch": 0.18695694676856373, "grad_norm": 0.1570863574743271, "learning_rate": 9.377127610635752e-05, "loss": 0.8708, "mean_token_accuracy": 0.7506612278521061, "num_tokens": 64845060.0, "step": 2032 }, { "entropy": 0.8624433614313602, "epoch": 0.18704895314000494, "grad_norm": 0.1596759408712387, "learning_rate": 9.37682092802159e-05, "loss": 0.869, "mean_token_accuracy": 0.7522710748016834, "num_tokens": 64876329.0, "step": 2033 }, { "entropy": 0.9025580398738384, "epoch": 0.18714095951144616, "grad_norm": 0.15871481597423553, "learning_rate": 9.376514245407429e-05, "loss": 0.8883, "mean_token_accuracy": 0.7478687763214111, "num_tokens": 64907958.0, "step": 2034 }, { "entropy": 0.8581497929990292, "epoch": 0.1872329658828874, "grad_norm": 0.157855823636055, "learning_rate": 9.376207562793266e-05, "loss": 0.8731, "mean_token_accuracy": 0.7531143128871918, "num_tokens": 64940726.0, "step": 2035 }, { "entropy": 0.9045156873762608, "epoch": 0.18732497225432862, "grad_norm": 0.16071809828281403, "learning_rate": 9.375900880179102e-05, "loss": 0.9337, "mean_token_accuracy": 0.7386736422777176, "num_tokens": 64972580.0, "step": 2036 }, { "entropy": 0.9036298952996731, "epoch": 0.18741697862576984, "grad_norm": 0.16352811455726624, "learning_rate": 9.37559419756494e-05, "loss": 0.9348, "mean_token_accuracy": 0.7315878421068192, "num_tokens": 65004524.0, "step": 2037 }, { "entropy": 0.8559081815183163, "epoch": 0.18750898499721105, "grad_norm": 0.16810262203216553, "learning_rate": 9.375287514950777e-05, "loss": 0.8889, "mean_token_accuracy": 0.7461729347705841, "num_tokens": 65036454.0, "step": 2038 }, { "entropy": 0.9171912744641304, "epoch": 0.18760099136865227, "grad_norm": 0.16522151231765747, "learning_rate": 9.374980832336615e-05, "loss": 0.9429, "mean_token_accuracy": 0.7354200817644596, "num_tokens": 65069000.0, "step": 2039 }, { "entropy": 0.8885633610188961, "epoch": 0.18769299774009351, "grad_norm": 0.16042226552963257, "learning_rate": 9.374674149722452e-05, "loss": 0.8715, "mean_token_accuracy": 0.7541116811335087, "num_tokens": 65101290.0, "step": 2040 }, { "entropy": 0.8812004756182432, "epoch": 0.18778500411153473, "grad_norm": 0.15915481746196747, "learning_rate": 9.37436746710829e-05, "loss": 0.8804, "mean_token_accuracy": 0.7449415810406208, "num_tokens": 65133413.0, "step": 2041 }, { "entropy": 0.9142667725682259, "epoch": 0.18787701048297595, "grad_norm": 0.16686473786830902, "learning_rate": 9.374060784494127e-05, "loss": 0.8904, "mean_token_accuracy": 0.7472209744155407, "num_tokens": 65164773.0, "step": 2042 }, { "entropy": 0.8553497269749641, "epoch": 0.18796901685441716, "grad_norm": 0.15235202014446259, "learning_rate": 9.373754101879965e-05, "loss": 0.8345, "mean_token_accuracy": 0.7613614685833454, "num_tokens": 65197342.0, "step": 2043 }, { "entropy": 0.9114524945616722, "epoch": 0.18806102322585838, "grad_norm": 0.15685681998729706, "learning_rate": 9.373447419265802e-05, "loss": 0.9143, "mean_token_accuracy": 0.7399330735206604, "num_tokens": 65229364.0, "step": 2044 }, { "entropy": 0.893359798938036, "epoch": 0.18815302959729963, "grad_norm": 0.16052910685539246, "learning_rate": 9.37314073665164e-05, "loss": 0.9065, "mean_token_accuracy": 0.7452050186693668, "num_tokens": 65261563.0, "step": 2045 }, { "entropy": 0.9454722385853529, "epoch": 0.18824503596874084, "grad_norm": 0.16674014925956726, "learning_rate": 9.372834054037477e-05, "loss": 0.9533, "mean_token_accuracy": 0.7334141582250595, "num_tokens": 65292981.0, "step": 2046 }, { "entropy": 0.8630388602614403, "epoch": 0.18833704234018206, "grad_norm": 0.15543870627880096, "learning_rate": 9.372527371423314e-05, "loss": 0.8663, "mean_token_accuracy": 0.754218615591526, "num_tokens": 65325233.0, "step": 2047 }, { "entropy": 0.8885634876787663, "epoch": 0.18842904871162328, "grad_norm": 0.15675462782382965, "learning_rate": 9.372220688809152e-05, "loss": 0.8899, "mean_token_accuracy": 0.7503672540187836, "num_tokens": 65357635.0, "step": 2048 }, { "entropy": 0.9084977805614471, "epoch": 0.1885210550830645, "grad_norm": 0.15942583978176117, "learning_rate": 9.37191400619499e-05, "loss": 0.915, "mean_token_accuracy": 0.7430415004491806, "num_tokens": 65389581.0, "step": 2049 }, { "entropy": 0.8415555544197559, "epoch": 0.18861306145450574, "grad_norm": 0.15190312266349792, "learning_rate": 9.371607323580827e-05, "loss": 0.8312, "mean_token_accuracy": 0.7616266831755638, "num_tokens": 65421699.0, "step": 2050 }, { "entropy": 0.7941470611840487, "epoch": 0.18870506782594695, "grad_norm": 0.15160848200321198, "learning_rate": 9.371300640966664e-05, "loss": 0.7695, "mean_token_accuracy": 0.7729646824300289, "num_tokens": 65453061.0, "step": 2051 }, { "entropy": 0.8557648323476315, "epoch": 0.18879707419738817, "grad_norm": 0.1504427194595337, "learning_rate": 9.370993958352502e-05, "loss": 0.8381, "mean_token_accuracy": 0.7609410546720028, "num_tokens": 65485194.0, "step": 2052 }, { "entropy": 0.891657717525959, "epoch": 0.1888890805688294, "grad_norm": 0.1631632000207901, "learning_rate": 9.370687275738339e-05, "loss": 0.8755, "mean_token_accuracy": 0.7546772211790085, "num_tokens": 65515973.0, "step": 2053 }, { "entropy": 0.8462304472923279, "epoch": 0.1889810869402706, "grad_norm": 0.15299326181411743, "learning_rate": 9.370380593124177e-05, "loss": 0.8333, "mean_token_accuracy": 0.7614996656775475, "num_tokens": 65547531.0, "step": 2054 }, { "entropy": 0.8240957818925381, "epoch": 0.18907309331171185, "grad_norm": 0.14741098880767822, "learning_rate": 9.370073910510013e-05, "loss": 0.8186, "mean_token_accuracy": 0.7635062858462334, "num_tokens": 65579853.0, "step": 2055 }, { "entropy": 0.8090843558311462, "epoch": 0.18916509968315307, "grad_norm": 0.15631279349327087, "learning_rate": 9.369767227895852e-05, "loss": 0.8146, "mean_token_accuracy": 0.7656925283372402, "num_tokens": 65612208.0, "step": 2056 }, { "entropy": 0.7881220206618309, "epoch": 0.18925710605459428, "grad_norm": 0.16245120763778687, "learning_rate": 9.369460545281688e-05, "loss": 0.8054, "mean_token_accuracy": 0.767612311989069, "num_tokens": 65644181.0, "step": 2057 }, { "entropy": 0.9310653619468212, "epoch": 0.1893491124260355, "grad_norm": 0.16227516531944275, "learning_rate": 9.369153862667525e-05, "loss": 0.9252, "mean_token_accuracy": 0.7376483865082264, "num_tokens": 65676166.0, "step": 2058 }, { "entropy": 0.90697106346488, "epoch": 0.18944111879747672, "grad_norm": 0.16005201637744904, "learning_rate": 9.368847180053363e-05, "loss": 0.8929, "mean_token_accuracy": 0.7444347888231277, "num_tokens": 65707727.0, "step": 2059 }, { "entropy": 0.83125857450068, "epoch": 0.18953312516891796, "grad_norm": 0.15063901245594025, "learning_rate": 9.368540497439202e-05, "loss": 0.8353, "mean_token_accuracy": 0.7557453885674477, "num_tokens": 65740071.0, "step": 2060 }, { "entropy": 0.9123864956200123, "epoch": 0.18962513154035918, "grad_norm": 0.1682862490415573, "learning_rate": 9.368233814825038e-05, "loss": 0.922, "mean_token_accuracy": 0.7390746884047985, "num_tokens": 65772177.0, "step": 2061 }, { "entropy": 0.8019394800066948, "epoch": 0.1897171379118004, "grad_norm": 0.15979711711406708, "learning_rate": 9.367927132210875e-05, "loss": 0.8201, "mean_token_accuracy": 0.7626630812883377, "num_tokens": 65804576.0, "step": 2062 }, { "entropy": 0.9125566072762012, "epoch": 0.1898091442832416, "grad_norm": 0.16224896907806396, "learning_rate": 9.367620449596712e-05, "loss": 0.9098, "mean_token_accuracy": 0.7389998286962509, "num_tokens": 65836514.0, "step": 2063 }, { "entropy": 0.9041921626776457, "epoch": 0.18990115065468283, "grad_norm": 0.1619517207145691, "learning_rate": 9.36731376698255e-05, "loss": 0.8964, "mean_token_accuracy": 0.7419093325734138, "num_tokens": 65867852.0, "step": 2064 }, { "entropy": 0.8438561335206032, "epoch": 0.18999315702612407, "grad_norm": 0.1557321846485138, "learning_rate": 9.367007084368388e-05, "loss": 0.8432, "mean_token_accuracy": 0.7606022581458092, "num_tokens": 65899536.0, "step": 2065 }, { "entropy": 0.7718838583678007, "epoch": 0.1900851633975653, "grad_norm": 0.1508084237575531, "learning_rate": 9.366700401754225e-05, "loss": 0.7561, "mean_token_accuracy": 0.7831364944577217, "num_tokens": 65931457.0, "step": 2066 }, { "entropy": 0.903154619038105, "epoch": 0.1901771697690065, "grad_norm": 0.16352686285972595, "learning_rate": 9.366393719140062e-05, "loss": 0.8826, "mean_token_accuracy": 0.749750267714262, "num_tokens": 65963647.0, "step": 2067 }, { "entropy": 0.8343342915177345, "epoch": 0.19026917614044772, "grad_norm": 0.1577976942062378, "learning_rate": 9.3660870365259e-05, "loss": 0.848, "mean_token_accuracy": 0.7582064867019653, "num_tokens": 65995798.0, "step": 2068 }, { "entropy": 0.8333789817988873, "epoch": 0.19036118251188894, "grad_norm": 0.1567251980304718, "learning_rate": 9.365780353911737e-05, "loss": 0.8383, "mean_token_accuracy": 0.7609939053654671, "num_tokens": 66028039.0, "step": 2069 }, { "entropy": 0.8925304748117924, "epoch": 0.19045318888333018, "grad_norm": 0.16208332777023315, "learning_rate": 9.365473671297575e-05, "loss": 0.8964, "mean_token_accuracy": 0.7444371208548546, "num_tokens": 66059910.0, "step": 2070 }, { "entropy": 0.9667200781404972, "epoch": 0.1905451952547714, "grad_norm": 0.16504539549350739, "learning_rate": 9.365166988683412e-05, "loss": 0.9628, "mean_token_accuracy": 0.729257021099329, "num_tokens": 66091502.0, "step": 2071 }, { "entropy": 0.9035168662667274, "epoch": 0.19063720162621262, "grad_norm": 0.16108198463916779, "learning_rate": 9.36486030606925e-05, "loss": 0.8965, "mean_token_accuracy": 0.7464965023100376, "num_tokens": 66123242.0, "step": 2072 }, { "entropy": 0.8675672821700573, "epoch": 0.19072920799765383, "grad_norm": 0.16194505989551544, "learning_rate": 9.364553623455087e-05, "loss": 0.8745, "mean_token_accuracy": 0.7500729374587536, "num_tokens": 66154205.0, "step": 2073 }, { "entropy": 0.9420213140547276, "epoch": 0.19082121436909505, "grad_norm": 0.1630868911743164, "learning_rate": 9.364246940840923e-05, "loss": 0.9398, "mean_token_accuracy": 0.7348047271370888, "num_tokens": 66186523.0, "step": 2074 }, { "entropy": 0.9270667694509029, "epoch": 0.1909132207405363, "grad_norm": 0.16062036156654358, "learning_rate": 9.363940258226761e-05, "loss": 0.9097, "mean_token_accuracy": 0.7415963970124722, "num_tokens": 66218573.0, "step": 2075 }, { "entropy": 0.8215692602097988, "epoch": 0.1910052271119775, "grad_norm": 0.1590689718723297, "learning_rate": 9.3636335756126e-05, "loss": 0.8232, "mean_token_accuracy": 0.7622773535549641, "num_tokens": 66251275.0, "step": 2076 }, { "entropy": 0.795189144089818, "epoch": 0.19109723348341873, "grad_norm": 0.16071492433547974, "learning_rate": 9.363326892998436e-05, "loss": 0.7856, "mean_token_accuracy": 0.7736237049102783, "num_tokens": 66283173.0, "step": 2077 }, { "entropy": 0.9944587536156178, "epoch": 0.19118923985485994, "grad_norm": 0.16564224660396576, "learning_rate": 9.363020210384273e-05, "loss": 1.0009, "mean_token_accuracy": 0.7175012454390526, "num_tokens": 66314753.0, "step": 2078 }, { "entropy": 0.7731790505349636, "epoch": 0.19128124622630116, "grad_norm": 0.15580476820468903, "learning_rate": 9.362713527770111e-05, "loss": 0.7721, "mean_token_accuracy": 0.7750517874956131, "num_tokens": 66347090.0, "step": 2079 }, { "entropy": 0.9598245583474636, "epoch": 0.1913732525977424, "grad_norm": 0.16624146699905396, "learning_rate": 9.36240684515595e-05, "loss": 0.9777, "mean_token_accuracy": 0.7278884015977383, "num_tokens": 66378364.0, "step": 2080 }, { "entropy": 0.9357683062553406, "epoch": 0.19146525896918362, "grad_norm": 0.1717107743024826, "learning_rate": 9.362100162541786e-05, "loss": 0.954, "mean_token_accuracy": 0.734722763299942, "num_tokens": 66409963.0, "step": 2081 }, { "entropy": 0.9204175174236298, "epoch": 0.19155726534062484, "grad_norm": 0.17001405358314514, "learning_rate": 9.361793479927623e-05, "loss": 0.9321, "mean_token_accuracy": 0.7355771027505398, "num_tokens": 66441139.0, "step": 2082 }, { "entropy": 0.9573743641376495, "epoch": 0.19164927171206605, "grad_norm": 0.16127470135688782, "learning_rate": 9.361486797313461e-05, "loss": 0.9234, "mean_token_accuracy": 0.7395357266068459, "num_tokens": 66472796.0, "step": 2083 }, { "entropy": 0.8810067437589169, "epoch": 0.19174127808350727, "grad_norm": 0.15842416882514954, "learning_rate": 9.361180114699298e-05, "loss": 0.8777, "mean_token_accuracy": 0.7571773789823055, "num_tokens": 66505345.0, "step": 2084 }, { "entropy": 0.8114758655428886, "epoch": 0.19183328445494852, "grad_norm": 0.15940213203430176, "learning_rate": 9.360873432085136e-05, "loss": 0.8071, "mean_token_accuracy": 0.7702943459153175, "num_tokens": 66537348.0, "step": 2085 }, { "entropy": 0.836161045357585, "epoch": 0.19192529082638973, "grad_norm": 0.15598586201667786, "learning_rate": 9.360566749470973e-05, "loss": 0.8142, "mean_token_accuracy": 0.7635610811412334, "num_tokens": 66569438.0, "step": 2086 }, { "entropy": 0.9076887965202332, "epoch": 0.19201729719783095, "grad_norm": 0.16632279753684998, "learning_rate": 9.360260066856811e-05, "loss": 0.9201, "mean_token_accuracy": 0.7434936538338661, "num_tokens": 66601333.0, "step": 2087 }, { "entropy": 0.8718653135001659, "epoch": 0.19210930356927217, "grad_norm": 0.159499853849411, "learning_rate": 9.359953384242648e-05, "loss": 0.87, "mean_token_accuracy": 0.7501581162214279, "num_tokens": 66633897.0, "step": 2088 }, { "entropy": 0.9583968780934811, "epoch": 0.19220130994071338, "grad_norm": 0.1619790494441986, "learning_rate": 9.359646701628485e-05, "loss": 0.9459, "mean_token_accuracy": 0.7350086122751236, "num_tokens": 66665979.0, "step": 2089 }, { "entropy": 0.8190605416893959, "epoch": 0.19229331631215463, "grad_norm": 0.1640845239162445, "learning_rate": 9.359340019014323e-05, "loss": 0.837, "mean_token_accuracy": 0.764364704489708, "num_tokens": 66698366.0, "step": 2090 }, { "entropy": 0.9851617068052292, "epoch": 0.19238532268359584, "grad_norm": 0.16278637945652008, "learning_rate": 9.359033336400161e-05, "loss": 0.971, "mean_token_accuracy": 0.7255047112703323, "num_tokens": 66730192.0, "step": 2091 }, { "entropy": 0.8907298073172569, "epoch": 0.19247732905503706, "grad_norm": 0.1589939147233963, "learning_rate": 9.358726653785998e-05, "loss": 0.8985, "mean_token_accuracy": 0.7452288381755352, "num_tokens": 66762923.0, "step": 2092 }, { "entropy": 0.9049146734178066, "epoch": 0.19256933542647828, "grad_norm": 0.16110602021217346, "learning_rate": 9.358419971171834e-05, "loss": 0.8795, "mean_token_accuracy": 0.7505999431014061, "num_tokens": 66794831.0, "step": 2093 }, { "entropy": 0.9162530191242695, "epoch": 0.1926613417979195, "grad_norm": 0.1666681319475174, "learning_rate": 9.358113288557671e-05, "loss": 0.924, "mean_token_accuracy": 0.7432136125862598, "num_tokens": 66826975.0, "step": 2094 }, { "entropy": 0.8475251868367195, "epoch": 0.19275334816936074, "grad_norm": 0.1590445339679718, "learning_rate": 9.35780660594351e-05, "loss": 0.8501, "mean_token_accuracy": 0.7619863264262676, "num_tokens": 66859274.0, "step": 2095 }, { "entropy": 0.875318119302392, "epoch": 0.19284535454080196, "grad_norm": 0.15862704813480377, "learning_rate": 9.357499923329348e-05, "loss": 0.8645, "mean_token_accuracy": 0.7572305388748646, "num_tokens": 66891080.0, "step": 2096 }, { "entropy": 0.9236644580960274, "epoch": 0.19293736091224317, "grad_norm": 0.16466963291168213, "learning_rate": 9.357193240715184e-05, "loss": 0.9361, "mean_token_accuracy": 0.7440771274268627, "num_tokens": 66923076.0, "step": 2097 }, { "entropy": 0.9217009991407394, "epoch": 0.1930293672836844, "grad_norm": 0.1642724871635437, "learning_rate": 9.356886558101021e-05, "loss": 0.9196, "mean_token_accuracy": 0.7399358674883842, "num_tokens": 66955575.0, "step": 2098 }, { "entropy": 0.9660653062164783, "epoch": 0.1931213736551256, "grad_norm": 0.17173923552036285, "learning_rate": 9.356579875486859e-05, "loss": 0.9663, "mean_token_accuracy": 0.7269208692014217, "num_tokens": 66986621.0, "step": 2099 }, { "entropy": 0.9254742749035358, "epoch": 0.19321338002656685, "grad_norm": 0.16811595857143402, "learning_rate": 9.356273192872696e-05, "loss": 0.9219, "mean_token_accuracy": 0.7349818795919418, "num_tokens": 67017736.0, "step": 2100 }, { "entropy": 0.9177574031054974, "epoch": 0.19330538639800807, "grad_norm": 0.16194204986095428, "learning_rate": 9.355966510258534e-05, "loss": 0.9118, "mean_token_accuracy": 0.740734938532114, "num_tokens": 67049272.0, "step": 2101 }, { "entropy": 0.9066963605582714, "epoch": 0.19339739276944928, "grad_norm": 0.15565623342990875, "learning_rate": 9.355659827644371e-05, "loss": 0.8792, "mean_token_accuracy": 0.7500106282532215, "num_tokens": 67081372.0, "step": 2102 }, { "entropy": 0.8991094473749399, "epoch": 0.1934893991408905, "grad_norm": 0.15841829776763916, "learning_rate": 9.355353145030209e-05, "loss": 0.9068, "mean_token_accuracy": 0.7467436641454697, "num_tokens": 67113784.0, "step": 2103 }, { "entropy": 0.8435263633728027, "epoch": 0.19358140551233172, "grad_norm": 0.1569119542837143, "learning_rate": 9.355046462416046e-05, "loss": 0.8432, "mean_token_accuracy": 0.7595317475497723, "num_tokens": 67144935.0, "step": 2104 }, { "entropy": 0.8339877147227526, "epoch": 0.19367341188377296, "grad_norm": 0.16009721159934998, "learning_rate": 9.354739779801883e-05, "loss": 0.8514, "mean_token_accuracy": 0.7586171142756939, "num_tokens": 67177082.0, "step": 2105 }, { "entropy": 0.9030448161065578, "epoch": 0.19376541825521418, "grad_norm": 0.15736226737499237, "learning_rate": 9.354433097187721e-05, "loss": 0.9073, "mean_token_accuracy": 0.7431066073477268, "num_tokens": 67208906.0, "step": 2106 }, { "entropy": 0.9498293995857239, "epoch": 0.1938574246266554, "grad_norm": 0.160381481051445, "learning_rate": 9.354126414573559e-05, "loss": 0.9601, "mean_token_accuracy": 0.7307383604347706, "num_tokens": 67240893.0, "step": 2107 }, { "entropy": 0.8450409136712551, "epoch": 0.1939494309980966, "grad_norm": 0.1544397920370102, "learning_rate": 9.353819731959396e-05, "loss": 0.8478, "mean_token_accuracy": 0.7589408382773399, "num_tokens": 67272560.0, "step": 2108 }, { "entropy": 0.7735142298042774, "epoch": 0.19404143736953783, "grad_norm": 0.15260325372219086, "learning_rate": 9.353513049345233e-05, "loss": 0.7582, "mean_token_accuracy": 0.7797415517270565, "num_tokens": 67304506.0, "step": 2109 }, { "entropy": 0.8527704812586308, "epoch": 0.19413344374097907, "grad_norm": 0.1555686593055725, "learning_rate": 9.35320636673107e-05, "loss": 0.8342, "mean_token_accuracy": 0.7609553374350071, "num_tokens": 67336470.0, "step": 2110 }, { "entropy": 0.9466509278863668, "epoch": 0.1942254501124203, "grad_norm": 0.1694634109735489, "learning_rate": 9.352899684116907e-05, "loss": 0.9701, "mean_token_accuracy": 0.730896707624197, "num_tokens": 67368782.0, "step": 2111 }, { "entropy": 0.9233518056571484, "epoch": 0.1943174564838615, "grad_norm": 0.16074050962924957, "learning_rate": 9.352593001502746e-05, "loss": 0.9199, "mean_token_accuracy": 0.7435019165277481, "num_tokens": 67400104.0, "step": 2112 }, { "entropy": 0.888766223564744, "epoch": 0.19440946285530272, "grad_norm": 0.16560155153274536, "learning_rate": 9.352286318888582e-05, "loss": 0.8934, "mean_token_accuracy": 0.7464515268802643, "num_tokens": 67432392.0, "step": 2113 }, { "entropy": 0.9413719289004803, "epoch": 0.19450146922674394, "grad_norm": 0.16608722507953644, "learning_rate": 9.35197963627442e-05, "loss": 0.9378, "mean_token_accuracy": 0.732838574796915, "num_tokens": 67463850.0, "step": 2114 }, { "entropy": 1.0279192365705967, "epoch": 0.19459347559818518, "grad_norm": 0.17054377496242523, "learning_rate": 9.351672953660257e-05, "loss": 1.0286, "mean_token_accuracy": 0.7088443785905838, "num_tokens": 67496365.0, "step": 2115 }, { "entropy": 0.9449400827288628, "epoch": 0.1946854819696264, "grad_norm": 0.16602954268455505, "learning_rate": 9.351366271046094e-05, "loss": 0.9539, "mean_token_accuracy": 0.732362899929285, "num_tokens": 67527700.0, "step": 2116 }, { "entropy": 0.9624862261116505, "epoch": 0.19477748834106762, "grad_norm": 0.16469870507717133, "learning_rate": 9.351059588431932e-05, "loss": 0.9757, "mean_token_accuracy": 0.7340248599648476, "num_tokens": 67560102.0, "step": 2117 }, { "entropy": 0.9186250232160091, "epoch": 0.19486949471250883, "grad_norm": 0.15537488460540771, "learning_rate": 9.35075290581777e-05, "loss": 0.899, "mean_token_accuracy": 0.741860531270504, "num_tokens": 67592305.0, "step": 2118 }, { "entropy": 0.8950015567243099, "epoch": 0.19496150108395005, "grad_norm": 0.1594477742910385, "learning_rate": 9.350446223203607e-05, "loss": 0.8931, "mean_token_accuracy": 0.745855625718832, "num_tokens": 67624467.0, "step": 2119 }, { "entropy": 0.9548966847360134, "epoch": 0.1950535074553913, "grad_norm": 0.16676531732082367, "learning_rate": 9.350139540589444e-05, "loss": 0.9589, "mean_token_accuracy": 0.7338507138192654, "num_tokens": 67657002.0, "step": 2120 }, { "entropy": 0.8476665187627077, "epoch": 0.1951455138268325, "grad_norm": 0.16230550408363342, "learning_rate": 9.349832857975281e-05, "loss": 0.8519, "mean_token_accuracy": 0.7569580152630806, "num_tokens": 67689004.0, "step": 2121 }, { "entropy": 0.930550042539835, "epoch": 0.19523752019827373, "grad_norm": 0.15949797630310059, "learning_rate": 9.34952617536112e-05, "loss": 0.9011, "mean_token_accuracy": 0.7426630705595016, "num_tokens": 67720904.0, "step": 2122 }, { "entropy": 0.9896409176290035, "epoch": 0.19532952656971495, "grad_norm": 0.1635100394487381, "learning_rate": 9.349219492746957e-05, "loss": 0.9785, "mean_token_accuracy": 0.7250706627964973, "num_tokens": 67753170.0, "step": 2123 }, { "entropy": 0.840200137346983, "epoch": 0.19542153294115616, "grad_norm": 0.16582147777080536, "learning_rate": 9.348912810132794e-05, "loss": 0.8608, "mean_token_accuracy": 0.7507183030247688, "num_tokens": 67785266.0, "step": 2124 }, { "entropy": 0.8174498938024044, "epoch": 0.1955135393125974, "grad_norm": 0.16237811744213104, "learning_rate": 9.34860612751863e-05, "loss": 0.8424, "mean_token_accuracy": 0.7645053565502167, "num_tokens": 67816554.0, "step": 2125 }, { "entropy": 0.8248377479612827, "epoch": 0.19560554568403862, "grad_norm": 0.1612454205751419, "learning_rate": 9.348299444904469e-05, "loss": 0.8337, "mean_token_accuracy": 0.7661922611296177, "num_tokens": 67848157.0, "step": 2126 }, { "entropy": 0.8328925501555204, "epoch": 0.19569755205547984, "grad_norm": 0.15930548310279846, "learning_rate": 9.347992762290307e-05, "loss": 0.8412, "mean_token_accuracy": 0.7637028507888317, "num_tokens": 67880113.0, "step": 2127 }, { "entropy": 0.9146295748651028, "epoch": 0.19578955842692106, "grad_norm": 0.16118566691875458, "learning_rate": 9.347686079676144e-05, "loss": 0.9079, "mean_token_accuracy": 0.7403504587709904, "num_tokens": 67912035.0, "step": 2128 }, { "entropy": 0.9130019657313824, "epoch": 0.19588156479836227, "grad_norm": 0.1665070354938507, "learning_rate": 9.34737939706198e-05, "loss": 0.9281, "mean_token_accuracy": 0.7367870546877384, "num_tokens": 67944028.0, "step": 2129 }, { "entropy": 0.9007689990103245, "epoch": 0.19597357116980352, "grad_norm": 0.16633763909339905, "learning_rate": 9.347072714447819e-05, "loss": 0.8951, "mean_token_accuracy": 0.7467646636068821, "num_tokens": 67976368.0, "step": 2130 }, { "entropy": 0.9687911011278629, "epoch": 0.19606557754124473, "grad_norm": 0.15961508452892303, "learning_rate": 9.346766031833655e-05, "loss": 0.9519, "mean_token_accuracy": 0.732357207685709, "num_tokens": 68008657.0, "step": 2131 }, { "entropy": 0.9267431627959013, "epoch": 0.19615758391268595, "grad_norm": 0.15613701939582825, "learning_rate": 9.346459349219494e-05, "loss": 0.9124, "mean_token_accuracy": 0.7423344701528549, "num_tokens": 68040965.0, "step": 2132 }, { "entropy": 0.9432807043194771, "epoch": 0.19624959028412717, "grad_norm": 0.161041721701622, "learning_rate": 9.34615266660533e-05, "loss": 0.9383, "mean_token_accuracy": 0.7340038456022739, "num_tokens": 68071808.0, "step": 2133 }, { "entropy": 0.9378496669232845, "epoch": 0.19634159665556838, "grad_norm": 0.1623469740152359, "learning_rate": 9.345845983991168e-05, "loss": 0.9378, "mean_token_accuracy": 0.7317124232649803, "num_tokens": 68102660.0, "step": 2134 }, { "entropy": 0.8744136579334736, "epoch": 0.19643360302700963, "grad_norm": 0.1597345471382141, "learning_rate": 9.345539301377005e-05, "loss": 0.893, "mean_token_accuracy": 0.7470070458948612, "num_tokens": 68134663.0, "step": 2135 }, { "entropy": 0.9130709134042263, "epoch": 0.19652560939845085, "grad_norm": 0.16366080939769745, "learning_rate": 9.345232618762842e-05, "loss": 0.938, "mean_token_accuracy": 0.7319407500326633, "num_tokens": 68166285.0, "step": 2136 }, { "entropy": 0.9083885960280895, "epoch": 0.19661761576989206, "grad_norm": 0.16435208916664124, "learning_rate": 9.34492593614868e-05, "loss": 0.9145, "mean_token_accuracy": 0.7442589700222015, "num_tokens": 68198047.0, "step": 2137 }, { "entropy": 0.9266248941421509, "epoch": 0.19670962214133328, "grad_norm": 0.16171085834503174, "learning_rate": 9.344619253534518e-05, "loss": 0.934, "mean_token_accuracy": 0.7327006570994854, "num_tokens": 68229655.0, "step": 2138 }, { "entropy": 0.8541943151503801, "epoch": 0.1968016285127745, "grad_norm": 0.15876218676567078, "learning_rate": 9.344312570920355e-05, "loss": 0.8455, "mean_token_accuracy": 0.758536271750927, "num_tokens": 68262341.0, "step": 2139 }, { "entropy": 0.7640830762684345, "epoch": 0.19689363488421574, "grad_norm": 0.1471771001815796, "learning_rate": 9.344005888306192e-05, "loss": 0.7368, "mean_token_accuracy": 0.787493884563446, "num_tokens": 68295109.0, "step": 2140 }, { "entropy": 0.7940677963197231, "epoch": 0.19698564125565696, "grad_norm": 0.1550474613904953, "learning_rate": 9.34369920569203e-05, "loss": 0.7876, "mean_token_accuracy": 0.7706819027662277, "num_tokens": 68326953.0, "step": 2141 }, { "entropy": 0.9011071883141994, "epoch": 0.19707764762709817, "grad_norm": 0.1608584076166153, "learning_rate": 9.343392523077867e-05, "loss": 0.9159, "mean_token_accuracy": 0.7381557896733284, "num_tokens": 68358967.0, "step": 2142 }, { "entropy": 0.8745359685271978, "epoch": 0.1971696539985394, "grad_norm": 0.1543223261833191, "learning_rate": 9.343085840463705e-05, "loss": 0.8401, "mean_token_accuracy": 0.7590012811124325, "num_tokens": 68390813.0, "step": 2143 }, { "entropy": 0.922530110925436, "epoch": 0.19726166036998063, "grad_norm": 0.1647340953350067, "learning_rate": 9.342779157849542e-05, "loss": 0.9291, "mean_token_accuracy": 0.7365592271089554, "num_tokens": 68423070.0, "step": 2144 }, { "entropy": 0.9111796729266644, "epoch": 0.19735366674142185, "grad_norm": 0.1610458791255951, "learning_rate": 9.34247247523538e-05, "loss": 0.9152, "mean_token_accuracy": 0.7449517361819744, "num_tokens": 68455345.0, "step": 2145 }, { "entropy": 0.7103486321866512, "epoch": 0.19744567311286307, "grad_norm": 0.1555427461862564, "learning_rate": 9.342165792621217e-05, "loss": 0.6936, "mean_token_accuracy": 0.7970850877463818, "num_tokens": 68487310.0, "step": 2146 }, { "entropy": 0.9145626500248909, "epoch": 0.19753767948430428, "grad_norm": 0.15671616792678833, "learning_rate": 9.341859110007053e-05, "loss": 0.9028, "mean_token_accuracy": 0.7442108914256096, "num_tokens": 68519473.0, "step": 2147 }, { "entropy": 0.9443887583911419, "epoch": 0.1976296858557455, "grad_norm": 0.16379334032535553, "learning_rate": 9.341552427392892e-05, "loss": 0.9619, "mean_token_accuracy": 0.725195188075304, "num_tokens": 68552168.0, "step": 2148 }, { "entropy": 0.8554215934127569, "epoch": 0.19772169222718675, "grad_norm": 0.16314350068569183, "learning_rate": 9.34124574477873e-05, "loss": 0.8678, "mean_token_accuracy": 0.7591111958026886, "num_tokens": 68584780.0, "step": 2149 }, { "entropy": 0.9231494348496199, "epoch": 0.19781369859862796, "grad_norm": 0.15925024449825287, "learning_rate": 9.340939062164567e-05, "loss": 0.9266, "mean_token_accuracy": 0.736957885324955, "num_tokens": 68616934.0, "step": 2150 }, { "entropy": 0.856573298573494, "epoch": 0.19790570497006918, "grad_norm": 0.1621844470500946, "learning_rate": 9.340632379550403e-05, "loss": 0.8449, "mean_token_accuracy": 0.761481236666441, "num_tokens": 68648619.0, "step": 2151 }, { "entropy": 0.9310447964817286, "epoch": 0.1979977113415104, "grad_norm": 0.1645403355360031, "learning_rate": 9.34032569693624e-05, "loss": 0.9274, "mean_token_accuracy": 0.7367376387119293, "num_tokens": 68680752.0, "step": 2152 }, { "entropy": 0.8028207886964083, "epoch": 0.1980897177129516, "grad_norm": 0.15988674759864807, "learning_rate": 9.340019014322078e-05, "loss": 0.8112, "mean_token_accuracy": 0.7647760286927223, "num_tokens": 68712478.0, "step": 2153 }, { "entropy": 0.9550810474902391, "epoch": 0.19818172408439286, "grad_norm": 0.17101852595806122, "learning_rate": 9.339712331707916e-05, "loss": 0.9796, "mean_token_accuracy": 0.7284754142165184, "num_tokens": 68744924.0, "step": 2154 }, { "entropy": 0.9150787778198719, "epoch": 0.19827373045583407, "grad_norm": 0.1661899834871292, "learning_rate": 9.339405649093753e-05, "loss": 0.8791, "mean_token_accuracy": 0.7455488108098507, "num_tokens": 68774856.0, "step": 2155 }, { "entropy": 0.8780384138226509, "epoch": 0.1983657368272753, "grad_norm": 0.15516163408756256, "learning_rate": 9.33909896647959e-05, "loss": 0.8707, "mean_token_accuracy": 0.7496176920831203, "num_tokens": 68807066.0, "step": 2156 }, { "entropy": 0.8043510671705008, "epoch": 0.1984577431987165, "grad_norm": 0.15869726240634918, "learning_rate": 9.338792283865428e-05, "loss": 0.8052, "mean_token_accuracy": 0.7651760093867779, "num_tokens": 68837882.0, "step": 2157 }, { "entropy": 0.8685892857611179, "epoch": 0.19854974957015772, "grad_norm": 0.15946121513843536, "learning_rate": 9.338485601251265e-05, "loss": 0.8807, "mean_token_accuracy": 0.7513917721807957, "num_tokens": 68870436.0, "step": 2158 }, { "entropy": 0.8051081895828247, "epoch": 0.19864175594159897, "grad_norm": 0.15095248818397522, "learning_rate": 9.338178918637103e-05, "loss": 0.795, "mean_token_accuracy": 0.769863449037075, "num_tokens": 68902683.0, "step": 2159 }, { "entropy": 0.8500205148011446, "epoch": 0.19873376231304019, "grad_norm": 0.15605954825878143, "learning_rate": 9.33787223602294e-05, "loss": 0.8405, "mean_token_accuracy": 0.7572056613862514, "num_tokens": 68934875.0, "step": 2160 }, { "entropy": 0.8687045499682426, "epoch": 0.1988257686844814, "grad_norm": 0.15447843074798584, "learning_rate": 9.337565553408778e-05, "loss": 0.8438, "mean_token_accuracy": 0.7601562477648258, "num_tokens": 68966974.0, "step": 2161 }, { "entropy": 0.9325909893959761, "epoch": 0.19891777505592262, "grad_norm": 0.16031193733215332, "learning_rate": 9.337258870794615e-05, "loss": 0.9235, "mean_token_accuracy": 0.7391127869486809, "num_tokens": 68998671.0, "step": 2162 }, { "entropy": 0.9575784560292959, "epoch": 0.19900978142736384, "grad_norm": 0.16326804459095, "learning_rate": 9.336952188180453e-05, "loss": 0.9586, "mean_token_accuracy": 0.7266486249864101, "num_tokens": 69030721.0, "step": 2163 }, { "entropy": 0.8920419216156006, "epoch": 0.19910178779880508, "grad_norm": 0.16042904555797577, "learning_rate": 9.33664550556629e-05, "loss": 0.8949, "mean_token_accuracy": 0.7449088171124458, "num_tokens": 69062122.0, "step": 2164 }, { "entropy": 0.9506238624453545, "epoch": 0.1991937941702463, "grad_norm": 0.16223110258579254, "learning_rate": 9.336338822952128e-05, "loss": 0.9398, "mean_token_accuracy": 0.7357291392982006, "num_tokens": 69094483.0, "step": 2165 }, { "entropy": 0.913567716255784, "epoch": 0.1992858005416875, "grad_norm": 0.1567869484424591, "learning_rate": 9.336032140337965e-05, "loss": 0.9039, "mean_token_accuracy": 0.738114133477211, "num_tokens": 69126998.0, "step": 2166 }, { "entropy": 0.840234437957406, "epoch": 0.19937780691312873, "grad_norm": 0.15466199815273285, "learning_rate": 9.335725457723801e-05, "loss": 0.8326, "mean_token_accuracy": 0.7622020877897739, "num_tokens": 69159153.0, "step": 2167 }, { "entropy": 1.0835785642266273, "epoch": 0.19946981328456995, "grad_norm": 0.17085401713848114, "learning_rate": 9.33541877510964e-05, "loss": 1.0994, "mean_token_accuracy": 0.6930282264947891, "num_tokens": 69190751.0, "step": 2168 }, { "entropy": 0.882443169131875, "epoch": 0.1995618196560112, "grad_norm": 0.15839269757270813, "learning_rate": 9.335112092495478e-05, "loss": 0.8794, "mean_token_accuracy": 0.7450637482106686, "num_tokens": 69223258.0, "step": 2169 }, { "entropy": 0.8651303760707378, "epoch": 0.1996538260274524, "grad_norm": 0.16337448358535767, "learning_rate": 9.334805409881314e-05, "loss": 0.8839, "mean_token_accuracy": 0.7500738985836506, "num_tokens": 69255365.0, "step": 2170 }, { "entropy": 0.9112938940525055, "epoch": 0.19974583239889362, "grad_norm": 0.16801586747169495, "learning_rate": 9.334498727267151e-05, "loss": 0.9236, "mean_token_accuracy": 0.7388861775398254, "num_tokens": 69288133.0, "step": 2171 }, { "entropy": 0.8369556702673435, "epoch": 0.19983783877033484, "grad_norm": 0.1597340703010559, "learning_rate": 9.33419204465299e-05, "loss": 0.8545, "mean_token_accuracy": 0.7557508200407028, "num_tokens": 69320183.0, "step": 2172 }, { "entropy": 0.8907689284533262, "epoch": 0.19992984514177606, "grad_norm": 0.1650434136390686, "learning_rate": 9.333885362038826e-05, "loss": 0.8837, "mean_token_accuracy": 0.7495999112725258, "num_tokens": 69352864.0, "step": 2173 }, { "entropy": 1.0019940454512835, "epoch": 0.2000218515132173, "grad_norm": 0.16670800745487213, "learning_rate": 9.333578679424664e-05, "loss": 0.9979, "mean_token_accuracy": 0.7168303392827511, "num_tokens": 69384817.0, "step": 2174 }, { "entropy": 0.9252850078046322, "epoch": 0.20011385788465852, "grad_norm": 0.1596802920103073, "learning_rate": 9.333271996810501e-05, "loss": 0.9258, "mean_token_accuracy": 0.7425597161054611, "num_tokens": 69417365.0, "step": 2175 }, { "entropy": 0.9893336333334446, "epoch": 0.20020586425609974, "grad_norm": 0.17222565412521362, "learning_rate": 9.332965314196339e-05, "loss": 0.987, "mean_token_accuracy": 0.7197200767695904, "num_tokens": 69448995.0, "step": 2176 }, { "entropy": 0.8060479164123535, "epoch": 0.20029787062754095, "grad_norm": 0.15398778021335602, "learning_rate": 9.332658631582176e-05, "loss": 0.7987, "mean_token_accuracy": 0.7676365748047829, "num_tokens": 69481130.0, "step": 2177 }, { "entropy": 0.792138647288084, "epoch": 0.20038987699898217, "grad_norm": 0.15124332904815674, "learning_rate": 9.332351948968013e-05, "loss": 0.788, "mean_token_accuracy": 0.7721965499222279, "num_tokens": 69513498.0, "step": 2178 }, { "entropy": 0.8736269772052765, "epoch": 0.2004818833704234, "grad_norm": 0.1592663675546646, "learning_rate": 9.332045266353851e-05, "loss": 0.868, "mean_token_accuracy": 0.7570287883281708, "num_tokens": 69546258.0, "step": 2179 }, { "entropy": 0.896639421582222, "epoch": 0.20057388974186463, "grad_norm": 0.1653127372264862, "learning_rate": 9.331738583739689e-05, "loss": 0.8923, "mean_token_accuracy": 0.7461023926734924, "num_tokens": 69577216.0, "step": 2180 }, { "entropy": 0.8784413896501064, "epoch": 0.20066589611330585, "grad_norm": 0.15927815437316895, "learning_rate": 9.331431901125526e-05, "loss": 0.8641, "mean_token_accuracy": 0.754275482147932, "num_tokens": 69609588.0, "step": 2181 }, { "entropy": 0.9449828043580055, "epoch": 0.20075790248474706, "grad_norm": 0.15984024107456207, "learning_rate": 9.331125218511363e-05, "loss": 0.9373, "mean_token_accuracy": 0.7373170740902424, "num_tokens": 69640897.0, "step": 2182 }, { "entropy": 0.9587430469691753, "epoch": 0.20084990885618828, "grad_norm": 0.16778352856636047, "learning_rate": 9.3308185358972e-05, "loss": 0.9671, "mean_token_accuracy": 0.7292763106524944, "num_tokens": 69672948.0, "step": 2183 }, { "entropy": 0.9872140549123287, "epoch": 0.20094191522762953, "grad_norm": 0.17245371639728546, "learning_rate": 9.330511853283038e-05, "loss": 0.9868, "mean_token_accuracy": 0.7216991111636162, "num_tokens": 69704728.0, "step": 2184 }, { "entropy": 0.9505719132721424, "epoch": 0.20103392159907074, "grad_norm": 0.16392174363136292, "learning_rate": 9.330205170668876e-05, "loss": 0.9544, "mean_token_accuracy": 0.7252263575792313, "num_tokens": 69736225.0, "step": 2185 }, { "entropy": 0.8538291342556477, "epoch": 0.20112592797051196, "grad_norm": 0.1608898937702179, "learning_rate": 9.329898488054713e-05, "loss": 0.8732, "mean_token_accuracy": 0.7523510046303272, "num_tokens": 69768993.0, "step": 2186 }, { "entropy": 0.9307313039898872, "epoch": 0.20121793434195318, "grad_norm": 0.1597103625535965, "learning_rate": 9.32959180544055e-05, "loss": 0.9155, "mean_token_accuracy": 0.7391259223222733, "num_tokens": 69801103.0, "step": 2187 }, { "entropy": 0.8700545746833086, "epoch": 0.2013099407133944, "grad_norm": 0.15828531980514526, "learning_rate": 9.329285122826388e-05, "loss": 0.8428, "mean_token_accuracy": 0.7596983499825001, "num_tokens": 69833796.0, "step": 2188 }, { "entropy": 0.8197246417403221, "epoch": 0.20140194708483564, "grad_norm": 0.14586876332759857, "learning_rate": 9.328978440212224e-05, "loss": 0.7993, "mean_token_accuracy": 0.7656061537563801, "num_tokens": 69866177.0, "step": 2189 }, { "entropy": 0.8133249562233686, "epoch": 0.20149395345627685, "grad_norm": 0.15228766202926636, "learning_rate": 9.328671757598062e-05, "loss": 0.804, "mean_token_accuracy": 0.7688422501087189, "num_tokens": 69898551.0, "step": 2190 }, { "entropy": 0.8948649019002914, "epoch": 0.20158595982771807, "grad_norm": 0.15482689440250397, "learning_rate": 9.328365074983899e-05, "loss": 0.8796, "mean_token_accuracy": 0.7462757751345634, "num_tokens": 69930101.0, "step": 2191 }, { "entropy": 0.9370650835335255, "epoch": 0.2016779661991593, "grad_norm": 0.15942099690437317, "learning_rate": 9.328058392369737e-05, "loss": 0.9488, "mean_token_accuracy": 0.7291441224515438, "num_tokens": 69961700.0, "step": 2192 }, { "entropy": 0.7694588731974363, "epoch": 0.2017699725706005, "grad_norm": 0.15336187183856964, "learning_rate": 9.327751709755574e-05, "loss": 0.7804, "mean_token_accuracy": 0.7781623601913452, "num_tokens": 69993465.0, "step": 2193 }, { "entropy": 0.9570678174495697, "epoch": 0.20186197894204175, "grad_norm": 0.16695457696914673, "learning_rate": 9.327445027141411e-05, "loss": 0.9636, "mean_token_accuracy": 0.7288404926657677, "num_tokens": 70025375.0, "step": 2194 }, { "entropy": 0.8693357035517693, "epoch": 0.20195398531348296, "grad_norm": 0.15825155377388, "learning_rate": 9.327138344527249e-05, "loss": 0.8613, "mean_token_accuracy": 0.7554026320576668, "num_tokens": 70057465.0, "step": 2195 }, { "entropy": 0.964122112840414, "epoch": 0.20204599168492418, "grad_norm": 0.16600635647773743, "learning_rate": 9.326831661913087e-05, "loss": 0.9522, "mean_token_accuracy": 0.7324707247316837, "num_tokens": 70088934.0, "step": 2196 }, { "entropy": 0.871784832328558, "epoch": 0.2021379980563654, "grad_norm": 0.15988291800022125, "learning_rate": 9.326524979298924e-05, "loss": 0.8701, "mean_token_accuracy": 0.7508639022707939, "num_tokens": 70120984.0, "step": 2197 }, { "entropy": 1.0142599046230316, "epoch": 0.20223000442780661, "grad_norm": 0.17139887809753418, "learning_rate": 9.326218296684761e-05, "loss": 1.0144, "mean_token_accuracy": 0.7137387879192829, "num_tokens": 70152761.0, "step": 2198 }, { "entropy": 0.9462217539548874, "epoch": 0.20232201079924786, "grad_norm": 0.16658520698547363, "learning_rate": 9.325911614070599e-05, "loss": 0.9263, "mean_token_accuracy": 0.7401720359921455, "num_tokens": 70184611.0, "step": 2199 }, { "entropy": 0.778026457875967, "epoch": 0.20241401717068908, "grad_norm": 0.16702984273433685, "learning_rate": 9.325604931456437e-05, "loss": 0.826, "mean_token_accuracy": 0.7669633738696575, "num_tokens": 70216818.0, "step": 2200 }, { "entropy": 0.8951413594186306, "epoch": 0.2025060235421303, "grad_norm": 0.1673172563314438, "learning_rate": 9.325298248842274e-05, "loss": 0.8803, "mean_token_accuracy": 0.7503014281392097, "num_tokens": 70247870.0, "step": 2201 }, { "entropy": 0.8826032392680645, "epoch": 0.2025980299135715, "grad_norm": 0.1592205911874771, "learning_rate": 9.32499156622811e-05, "loss": 0.8882, "mean_token_accuracy": 0.7465986683964729, "num_tokens": 70279373.0, "step": 2202 }, { "entropy": 0.8762294761836529, "epoch": 0.20269003628501273, "grad_norm": 0.1632188856601715, "learning_rate": 9.324684883613949e-05, "loss": 0.8716, "mean_token_accuracy": 0.7506240978837013, "num_tokens": 70311589.0, "step": 2203 }, { "entropy": 0.9174760244786739, "epoch": 0.20278204265645397, "grad_norm": 0.16115644574165344, "learning_rate": 9.324378200999786e-05, "loss": 0.9191, "mean_token_accuracy": 0.7368734739720821, "num_tokens": 70343511.0, "step": 2204 }, { "entropy": 0.8106661178171635, "epoch": 0.2028740490278952, "grad_norm": 0.15165027976036072, "learning_rate": 9.324071518385624e-05, "loss": 0.7957, "mean_token_accuracy": 0.7712200731039047, "num_tokens": 70376279.0, "step": 2205 }, { "entropy": 0.8986492082476616, "epoch": 0.2029660553993364, "grad_norm": 0.16154593229293823, "learning_rate": 9.32376483577146e-05, "loss": 0.8951, "mean_token_accuracy": 0.7456168755888939, "num_tokens": 70407618.0, "step": 2206 }, { "entropy": 0.7975661344826221, "epoch": 0.20305806177077762, "grad_norm": 0.1589781641960144, "learning_rate": 9.323458153157299e-05, "loss": 0.8031, "mean_token_accuracy": 0.7701114602386951, "num_tokens": 70440311.0, "step": 2207 }, { "entropy": 0.957557201385498, "epoch": 0.20315006814221884, "grad_norm": 0.1652262955904007, "learning_rate": 9.323151470543135e-05, "loss": 0.9684, "mean_token_accuracy": 0.731676310300827, "num_tokens": 70471655.0, "step": 2208 }, { "entropy": 0.7807961888611317, "epoch": 0.20324207451366008, "grad_norm": 0.15728799998760223, "learning_rate": 9.322844787928972e-05, "loss": 0.7898, "mean_token_accuracy": 0.7723208330571651, "num_tokens": 70504058.0, "step": 2209 }, { "entropy": 0.8233674541115761, "epoch": 0.2033340808851013, "grad_norm": 0.15396136045455933, "learning_rate": 9.32253810531481e-05, "loss": 0.8025, "mean_token_accuracy": 0.768945436924696, "num_tokens": 70535978.0, "step": 2210 }, { "entropy": 0.8871812038123608, "epoch": 0.20342608725654251, "grad_norm": 0.15909843146800995, "learning_rate": 9.322231422700649e-05, "loss": 0.87, "mean_token_accuracy": 0.75572819262743, "num_tokens": 70568358.0, "step": 2211 }, { "entropy": 0.8215491957962513, "epoch": 0.20351809362798373, "grad_norm": 0.1542416661977768, "learning_rate": 9.321924740086485e-05, "loss": 0.8279, "mean_token_accuracy": 0.7594820410013199, "num_tokens": 70600899.0, "step": 2212 }, { "entropy": 0.8794572614133358, "epoch": 0.20361009999942495, "grad_norm": 0.15601420402526855, "learning_rate": 9.321618057472322e-05, "loss": 0.8735, "mean_token_accuracy": 0.7527399845421314, "num_tokens": 70633092.0, "step": 2213 }, { "entropy": 0.9591118954122066, "epoch": 0.2037021063708662, "grad_norm": 0.16647869348526, "learning_rate": 9.321311374858159e-05, "loss": 0.9649, "mean_token_accuracy": 0.728139653801918, "num_tokens": 70665063.0, "step": 2214 }, { "entropy": 0.9139295145869255, "epoch": 0.2037941127423074, "grad_norm": 0.16323556005954742, "learning_rate": 9.321004692243997e-05, "loss": 0.9074, "mean_token_accuracy": 0.7435410544276237, "num_tokens": 70697295.0, "step": 2215 }, { "entropy": 0.8877883665263653, "epoch": 0.20388611911374863, "grad_norm": 0.15870517492294312, "learning_rate": 9.320698009629835e-05, "loss": 0.8932, "mean_token_accuracy": 0.7432291954755783, "num_tokens": 70729416.0, "step": 2216 }, { "entropy": 1.0039665326476097, "epoch": 0.20397812548518984, "grad_norm": 0.16851668059825897, "learning_rate": 9.320391327015672e-05, "loss": 1.0297, "mean_token_accuracy": 0.7148955538868904, "num_tokens": 70761956.0, "step": 2217 }, { "entropy": 0.8628738764673471, "epoch": 0.20407013185663106, "grad_norm": 0.1573517769575119, "learning_rate": 9.320084644401509e-05, "loss": 0.86, "mean_token_accuracy": 0.7489518858492374, "num_tokens": 70793572.0, "step": 2218 }, { "entropy": 0.8954880312085152, "epoch": 0.2041621382280723, "grad_norm": 0.16203667223453522, "learning_rate": 9.319777961787347e-05, "loss": 0.9163, "mean_token_accuracy": 0.7381542026996613, "num_tokens": 70825000.0, "step": 2219 }, { "entropy": 0.8768757879734039, "epoch": 0.20425414459951352, "grad_norm": 0.1567380130290985, "learning_rate": 9.319471279173184e-05, "loss": 0.8761, "mean_token_accuracy": 0.7476382367312908, "num_tokens": 70857203.0, "step": 2220 }, { "entropy": 0.9052177164703608, "epoch": 0.20434615097095474, "grad_norm": 0.1660914272069931, "learning_rate": 9.319164596559022e-05, "loss": 0.9015, "mean_token_accuracy": 0.7455748319625854, "num_tokens": 70888261.0, "step": 2221 }, { "entropy": 0.888258121907711, "epoch": 0.20443815734239595, "grad_norm": 0.1576509177684784, "learning_rate": 9.318857913944859e-05, "loss": 0.869, "mean_token_accuracy": 0.7503309175372124, "num_tokens": 70920133.0, "step": 2222 }, { "entropy": 1.005892638117075, "epoch": 0.20453016371383717, "grad_norm": 0.16423732042312622, "learning_rate": 9.318551231330697e-05, "loss": 1.0109, "mean_token_accuracy": 0.7182988561689854, "num_tokens": 70952169.0, "step": 2223 }, { "entropy": 1.0240471214056015, "epoch": 0.20462217008527842, "grad_norm": 0.16790643334388733, "learning_rate": 9.318244548716534e-05, "loss": 1.0153, "mean_token_accuracy": 0.7193193435668945, "num_tokens": 70983324.0, "step": 2224 }, { "entropy": 0.888104448094964, "epoch": 0.20471417645671963, "grad_norm": 0.16220274567604065, "learning_rate": 9.31793786610237e-05, "loss": 0.8974, "mean_token_accuracy": 0.7479278296232224, "num_tokens": 71015021.0, "step": 2225 }, { "entropy": 0.8313149120658636, "epoch": 0.20480618282816085, "grad_norm": 0.1571405977010727, "learning_rate": 9.317631183488208e-05, "loss": 0.8079, "mean_token_accuracy": 0.7616389691829681, "num_tokens": 71046675.0, "step": 2226 }, { "entropy": 0.8566624037921429, "epoch": 0.20489818919960207, "grad_norm": 0.1541277915239334, "learning_rate": 9.317324500874047e-05, "loss": 0.832, "mean_token_accuracy": 0.7621605359017849, "num_tokens": 71079001.0, "step": 2227 }, { "entropy": 0.8309692051261663, "epoch": 0.20499019557104328, "grad_norm": 0.1532411277294159, "learning_rate": 9.317017818259883e-05, "loss": 0.8238, "mean_token_accuracy": 0.7626949213445187, "num_tokens": 71111649.0, "step": 2228 }, { "entropy": 0.8722108080983162, "epoch": 0.20508220194248453, "grad_norm": 0.1641416847705841, "learning_rate": 9.31671113564572e-05, "loss": 0.8808, "mean_token_accuracy": 0.7490550726652145, "num_tokens": 71143298.0, "step": 2229 }, { "entropy": 0.792917100712657, "epoch": 0.20517420831392574, "grad_norm": 0.1514943540096283, "learning_rate": 9.316404453031558e-05, "loss": 0.7799, "mean_token_accuracy": 0.7773265764117241, "num_tokens": 71176066.0, "step": 2230 }, { "entropy": 0.9234464429318905, "epoch": 0.20526621468536696, "grad_norm": 0.16224011778831482, "learning_rate": 9.316097770417395e-05, "loss": 0.9275, "mean_token_accuracy": 0.7358816377818584, "num_tokens": 71208262.0, "step": 2231 }, { "entropy": 0.9031125567853451, "epoch": 0.20535822105680818, "grad_norm": 0.16288326680660248, "learning_rate": 9.315791087803233e-05, "loss": 0.9073, "mean_token_accuracy": 0.740313895046711, "num_tokens": 71240120.0, "step": 2232 }, { "entropy": 0.8620570674538612, "epoch": 0.2054502274282494, "grad_norm": 0.1624261736869812, "learning_rate": 9.31548440518907e-05, "loss": 0.8648, "mean_token_accuracy": 0.751829732209444, "num_tokens": 71271996.0, "step": 2233 }, { "entropy": 0.9377483390271664, "epoch": 0.20554223379969064, "grad_norm": 0.1629192978143692, "learning_rate": 9.315177722574908e-05, "loss": 0.9414, "mean_token_accuracy": 0.7359229177236557, "num_tokens": 71304514.0, "step": 2234 }, { "entropy": 0.9029636196792126, "epoch": 0.20563424017113185, "grad_norm": 0.1612558364868164, "learning_rate": 9.314871039960745e-05, "loss": 0.9059, "mean_token_accuracy": 0.7382849045097828, "num_tokens": 71336219.0, "step": 2235 }, { "entropy": 0.8020689897239208, "epoch": 0.20572624654257307, "grad_norm": 0.15994879603385925, "learning_rate": 9.314564357346582e-05, "loss": 0.8116, "mean_token_accuracy": 0.7646960467100143, "num_tokens": 71367058.0, "step": 2236 }, { "entropy": 0.7777710407972336, "epoch": 0.2058182529140143, "grad_norm": 0.1571982502937317, "learning_rate": 9.31425767473242e-05, "loss": 0.777, "mean_token_accuracy": 0.7706207893788815, "num_tokens": 71399256.0, "step": 2237 }, { "entropy": 0.8423745967447758, "epoch": 0.2059102592854555, "grad_norm": 0.1598420888185501, "learning_rate": 9.313950992118258e-05, "loss": 0.861, "mean_token_accuracy": 0.749571718275547, "num_tokens": 71431342.0, "step": 2238 }, { "entropy": 0.9289471209049225, "epoch": 0.20600226565689675, "grad_norm": 0.16045215725898743, "learning_rate": 9.313644309504095e-05, "loss": 0.9496, "mean_token_accuracy": 0.7349057793617249, "num_tokens": 71463427.0, "step": 2239 }, { "entropy": 0.8277268670499325, "epoch": 0.20609427202833797, "grad_norm": 0.15554259717464447, "learning_rate": 9.313337626889932e-05, "loss": 0.8149, "mean_token_accuracy": 0.7654939852654934, "num_tokens": 71494702.0, "step": 2240 }, { "entropy": 0.8088647369295359, "epoch": 0.20618627839977918, "grad_norm": 0.1524478793144226, "learning_rate": 9.313030944275768e-05, "loss": 0.8007, "mean_token_accuracy": 0.7661332301795483, "num_tokens": 71526573.0, "step": 2241 }, { "entropy": 0.9212133027613163, "epoch": 0.2062782847712204, "grad_norm": 0.15735897421836853, "learning_rate": 9.312724261661608e-05, "loss": 0.906, "mean_token_accuracy": 0.742999579757452, "num_tokens": 71558207.0, "step": 2242 }, { "entropy": 0.8286278918385506, "epoch": 0.20637029114266162, "grad_norm": 0.15218910574913025, "learning_rate": 9.312417579047445e-05, "loss": 0.8006, "mean_token_accuracy": 0.764683086425066, "num_tokens": 71590404.0, "step": 2243 }, { "entropy": 0.767413817346096, "epoch": 0.20646229751410286, "grad_norm": 0.14473795890808105, "learning_rate": 9.312110896433281e-05, "loss": 0.7429, "mean_token_accuracy": 0.7815295867621899, "num_tokens": 71622641.0, "step": 2244 }, { "entropy": 0.8499306626617908, "epoch": 0.20655430388554408, "grad_norm": 0.14879648387432098, "learning_rate": 9.311804213819118e-05, "loss": 0.8185, "mean_token_accuracy": 0.7597612328827381, "num_tokens": 71655293.0, "step": 2245 }, { "entropy": 0.9770399704575539, "epoch": 0.2066463102569853, "grad_norm": 0.17101188004016876, "learning_rate": 9.311497531204956e-05, "loss": 0.9529, "mean_token_accuracy": 0.7336248680949211, "num_tokens": 71687348.0, "step": 2246 }, { "entropy": 0.9782465323805809, "epoch": 0.2067383166284265, "grad_norm": 0.1673109084367752, "learning_rate": 9.311190848590795e-05, "loss": 0.9806, "mean_token_accuracy": 0.725510872900486, "num_tokens": 71718869.0, "step": 2247 }, { "entropy": 0.772248474881053, "epoch": 0.20683032299986773, "grad_norm": 0.15195660293102264, "learning_rate": 9.310884165976631e-05, "loss": 0.7703, "mean_token_accuracy": 0.7755439542233944, "num_tokens": 71750581.0, "step": 2248 }, { "entropy": 0.8573681581765413, "epoch": 0.20692232937130897, "grad_norm": 0.1610807180404663, "learning_rate": 9.310577483362468e-05, "loss": 0.84, "mean_token_accuracy": 0.7638273537158966, "num_tokens": 71783227.0, "step": 2249 }, { "entropy": 0.8789233788847923, "epoch": 0.2070143357427502, "grad_norm": 0.1596616804599762, "learning_rate": 9.310270800748306e-05, "loss": 0.8927, "mean_token_accuracy": 0.7488917447626591, "num_tokens": 71814523.0, "step": 2250 }, { "entropy": 0.86962079256773, "epoch": 0.2071063421141914, "grad_norm": 0.16223444044589996, "learning_rate": 9.309964118134143e-05, "loss": 0.8801, "mean_token_accuracy": 0.7479296550154686, "num_tokens": 71846858.0, "step": 2251 }, { "entropy": 0.8553214110434055, "epoch": 0.20719834848563262, "grad_norm": 0.15519845485687256, "learning_rate": 9.309657435519981e-05, "loss": 0.8186, "mean_token_accuracy": 0.7620874978601933, "num_tokens": 71879040.0, "step": 2252 }, { "entropy": 0.8920175693929195, "epoch": 0.20729035485707384, "grad_norm": 0.1649276316165924, "learning_rate": 9.309350752905818e-05, "loss": 0.9036, "mean_token_accuracy": 0.7448780536651611, "num_tokens": 71909372.0, "step": 2253 }, { "entropy": 0.8747664242982864, "epoch": 0.20738236122851508, "grad_norm": 0.160324826836586, "learning_rate": 9.309044070291656e-05, "loss": 0.8879, "mean_token_accuracy": 0.7416230738162994, "num_tokens": 71941069.0, "step": 2254 }, { "entropy": 0.8352093640714884, "epoch": 0.2074743675999563, "grad_norm": 0.16103175282478333, "learning_rate": 9.308737387677493e-05, "loss": 0.8455, "mean_token_accuracy": 0.7612131349742413, "num_tokens": 71972639.0, "step": 2255 }, { "entropy": 0.9325528144836426, "epoch": 0.20756637397139752, "grad_norm": 0.1638745665550232, "learning_rate": 9.30843070506333e-05, "loss": 0.9293, "mean_token_accuracy": 0.7368008457124233, "num_tokens": 72004536.0, "step": 2256 }, { "entropy": 0.8350464589893818, "epoch": 0.20765838034283873, "grad_norm": 0.15912780165672302, "learning_rate": 9.308124022449168e-05, "loss": 0.8479, "mean_token_accuracy": 0.7581521719694138, "num_tokens": 72037304.0, "step": 2257 }, { "entropy": 0.8925025351345539, "epoch": 0.20775038671427998, "grad_norm": 0.15235424041748047, "learning_rate": 9.307817339835006e-05, "loss": 0.8969, "mean_token_accuracy": 0.7427675537765026, "num_tokens": 72070044.0, "step": 2258 }, { "entropy": 0.8922431841492653, "epoch": 0.2078423930857212, "grad_norm": 0.16025975346565247, "learning_rate": 9.307510657220843e-05, "loss": 0.8991, "mean_token_accuracy": 0.7435870468616486, "num_tokens": 72101615.0, "step": 2259 }, { "entropy": 0.9367494266480207, "epoch": 0.2079343994571624, "grad_norm": 0.166617289185524, "learning_rate": 9.30720397460668e-05, "loss": 0.9368, "mean_token_accuracy": 0.7334547564387321, "num_tokens": 72133576.0, "step": 2260 }, { "entropy": 0.8854510430246592, "epoch": 0.20802640582860363, "grad_norm": 0.15313147008419037, "learning_rate": 9.306897291992518e-05, "loss": 0.8799, "mean_token_accuracy": 0.7545266933739185, "num_tokens": 72166309.0, "step": 2261 }, { "entropy": 0.9368469603359699, "epoch": 0.20811841220004484, "grad_norm": 0.15872061252593994, "learning_rate": 9.306590609378354e-05, "loss": 0.9126, "mean_token_accuracy": 0.7365365065634251, "num_tokens": 72197234.0, "step": 2262 }, { "entropy": 0.8913379423320293, "epoch": 0.2082104185714861, "grad_norm": 0.1670869141817093, "learning_rate": 9.306283926764193e-05, "loss": 0.8894, "mean_token_accuracy": 0.7491629645228386, "num_tokens": 72228804.0, "step": 2263 }, { "entropy": 0.9516397789120674, "epoch": 0.2083024249429273, "grad_norm": 0.16078302264213562, "learning_rate": 9.30597724415003e-05, "loss": 0.9558, "mean_token_accuracy": 0.7303243204951286, "num_tokens": 72260739.0, "step": 2264 }, { "entropy": 0.9317420907318592, "epoch": 0.20839443131436852, "grad_norm": 0.16126899421215057, "learning_rate": 9.305670561535868e-05, "loss": 0.9081, "mean_token_accuracy": 0.7433539219200611, "num_tokens": 72292862.0, "step": 2265 }, { "entropy": 0.9710980243980885, "epoch": 0.20848643768580974, "grad_norm": 0.17002113163471222, "learning_rate": 9.305363878921704e-05, "loss": 0.9886, "mean_token_accuracy": 0.7233421914279461, "num_tokens": 72324138.0, "step": 2266 }, { "entropy": 0.8377634603530169, "epoch": 0.20857844405725096, "grad_norm": 0.15324081480503082, "learning_rate": 9.305057196307541e-05, "loss": 0.8294, "mean_token_accuracy": 0.7573648579418659, "num_tokens": 72356310.0, "step": 2267 }, { "entropy": 0.9120050743222237, "epoch": 0.2086704504286922, "grad_norm": 0.16222664713859558, "learning_rate": 9.304750513693379e-05, "loss": 0.8971, "mean_token_accuracy": 0.7498729303479195, "num_tokens": 72388488.0, "step": 2268 }, { "entropy": 0.8644157573580742, "epoch": 0.20876245680013342, "grad_norm": 0.15668171644210815, "learning_rate": 9.304443831079217e-05, "loss": 0.8417, "mean_token_accuracy": 0.7566785216331482, "num_tokens": 72420143.0, "step": 2269 }, { "entropy": 0.781281266361475, "epoch": 0.20885446317157463, "grad_norm": 0.15086975693702698, "learning_rate": 9.304137148465054e-05, "loss": 0.8069, "mean_token_accuracy": 0.7666926644742489, "num_tokens": 72452582.0, "step": 2270 }, { "entropy": 0.9027824606746435, "epoch": 0.20894646954301585, "grad_norm": 0.16109751164913177, "learning_rate": 9.303830465850891e-05, "loss": 0.904, "mean_token_accuracy": 0.7460171282291412, "num_tokens": 72484321.0, "step": 2271 }, { "entropy": 0.8155895974487066, "epoch": 0.20903847591445707, "grad_norm": 0.15224795043468475, "learning_rate": 9.303523783236728e-05, "loss": 0.7951, "mean_token_accuracy": 0.7695300467312336, "num_tokens": 72516459.0, "step": 2272 }, { "entropy": 0.8761390671133995, "epoch": 0.2091304822858983, "grad_norm": 0.16741062700748444, "learning_rate": 9.303217100622566e-05, "loss": 0.8874, "mean_token_accuracy": 0.7487536258995533, "num_tokens": 72548342.0, "step": 2273 }, { "entropy": 0.8773033432662487, "epoch": 0.20922248865733953, "grad_norm": 0.15922823548316956, "learning_rate": 9.302910418008404e-05, "loss": 0.8893, "mean_token_accuracy": 0.752545677125454, "num_tokens": 72580183.0, "step": 2274 }, { "entropy": 0.8742824718356133, "epoch": 0.20931449502878074, "grad_norm": 0.16291575133800507, "learning_rate": 9.302603735394241e-05, "loss": 0.8785, "mean_token_accuracy": 0.7491361945867538, "num_tokens": 72612656.0, "step": 2275 }, { "entropy": 0.9169346243143082, "epoch": 0.20940650140022196, "grad_norm": 0.1646944135427475, "learning_rate": 9.302297052780078e-05, "loss": 0.9211, "mean_token_accuracy": 0.7414053231477737, "num_tokens": 72643937.0, "step": 2276 }, { "entropy": 0.8519726824015379, "epoch": 0.20949850777166318, "grad_norm": 0.15469864010810852, "learning_rate": 9.301990370165916e-05, "loss": 0.8582, "mean_token_accuracy": 0.7548933997750282, "num_tokens": 72676349.0, "step": 2277 }, { "entropy": 0.8380433060228825, "epoch": 0.20959051414310442, "grad_norm": 0.1525021344423294, "learning_rate": 9.301683687551754e-05, "loss": 0.848, "mean_token_accuracy": 0.7557270415127277, "num_tokens": 72708525.0, "step": 2278 }, { "entropy": 0.8926225416362286, "epoch": 0.20968252051454564, "grad_norm": 0.15022622048854828, "learning_rate": 9.301377004937591e-05, "loss": 0.8716, "mean_token_accuracy": 0.7522858828306198, "num_tokens": 72740871.0, "step": 2279 }, { "entropy": 0.8470750600099564, "epoch": 0.20977452688598686, "grad_norm": 0.15597392618656158, "learning_rate": 9.301070322323427e-05, "loss": 0.849, "mean_token_accuracy": 0.759568840265274, "num_tokens": 72773008.0, "step": 2280 }, { "entropy": 0.9882756508886814, "epoch": 0.20986653325742807, "grad_norm": 0.16542378067970276, "learning_rate": 9.300763639709266e-05, "loss": 0.9775, "mean_token_accuracy": 0.7228252813220024, "num_tokens": 72804480.0, "step": 2281 }, { "entropy": 0.93464151956141, "epoch": 0.2099585396288693, "grad_norm": 0.15854597091674805, "learning_rate": 9.300456957095102e-05, "loss": 0.931, "mean_token_accuracy": 0.7351988777518272, "num_tokens": 72836307.0, "step": 2282 }, { "entropy": 0.8390575088560581, "epoch": 0.21005054600031053, "grad_norm": 0.15083849430084229, "learning_rate": 9.30015027448094e-05, "loss": 0.8259, "mean_token_accuracy": 0.7617522925138474, "num_tokens": 72868295.0, "step": 2283 }, { "entropy": 0.8471817430108786, "epoch": 0.21014255237175175, "grad_norm": 0.1499129980802536, "learning_rate": 9.299843591866777e-05, "loss": 0.8322, "mean_token_accuracy": 0.7625635303556919, "num_tokens": 72900440.0, "step": 2284 }, { "entropy": 0.8549118041992188, "epoch": 0.21023455874319297, "grad_norm": 0.15557771921157837, "learning_rate": 9.299536909252615e-05, "loss": 0.8702, "mean_token_accuracy": 0.7528311014175415, "num_tokens": 72932502.0, "step": 2285 }, { "entropy": 0.8649424687027931, "epoch": 0.21032656511463418, "grad_norm": 0.15368221700191498, "learning_rate": 9.299230226638452e-05, "loss": 0.8499, "mean_token_accuracy": 0.7546233087778091, "num_tokens": 72964860.0, "step": 2286 }, { "entropy": 0.8734093382954597, "epoch": 0.2104185714860754, "grad_norm": 0.1616574376821518, "learning_rate": 9.298923544024289e-05, "loss": 0.8894, "mean_token_accuracy": 0.7474319748580456, "num_tokens": 72996730.0, "step": 2287 }, { "entropy": 0.7782254759222269, "epoch": 0.21051057785751665, "grad_norm": 0.15870293974876404, "learning_rate": 9.298616861410127e-05, "loss": 0.7732, "mean_token_accuracy": 0.772123996168375, "num_tokens": 73028728.0, "step": 2288 }, { "entropy": 0.8326247707009315, "epoch": 0.21060258422895786, "grad_norm": 0.16166287660598755, "learning_rate": 9.298310178795965e-05, "loss": 0.841, "mean_token_accuracy": 0.7570547163486481, "num_tokens": 73061124.0, "step": 2289 }, { "entropy": 0.8742987290024757, "epoch": 0.21069459060039908, "grad_norm": 0.16501806676387787, "learning_rate": 9.298003496181802e-05, "loss": 0.8592, "mean_token_accuracy": 0.7546672336757183, "num_tokens": 73093062.0, "step": 2290 }, { "entropy": 0.8095121756196022, "epoch": 0.2107865969718403, "grad_norm": 0.16070586442947388, "learning_rate": 9.297696813567639e-05, "loss": 0.8176, "mean_token_accuracy": 0.7627358548343182, "num_tokens": 73125014.0, "step": 2291 }, { "entropy": 0.8649747185409069, "epoch": 0.2108786033432815, "grad_norm": 0.15434929728507996, "learning_rate": 9.297390130953477e-05, "loss": 0.8608, "mean_token_accuracy": 0.7530300579965115, "num_tokens": 73157677.0, "step": 2292 }, { "entropy": 0.842358898371458, "epoch": 0.21097060971472276, "grad_norm": 0.1575389951467514, "learning_rate": 9.297083448339314e-05, "loss": 0.8322, "mean_token_accuracy": 0.7612573653459549, "num_tokens": 73188954.0, "step": 2293 }, { "entropy": 0.8657597675919533, "epoch": 0.21106261608616397, "grad_norm": 0.1545700877904892, "learning_rate": 9.296776765725152e-05, "loss": 0.8701, "mean_token_accuracy": 0.7497542388737202, "num_tokens": 73220926.0, "step": 2294 }, { "entropy": 0.8375305347144604, "epoch": 0.2111546224576052, "grad_norm": 0.15892831981182098, "learning_rate": 9.296470083110989e-05, "loss": 0.8474, "mean_token_accuracy": 0.7611798197031021, "num_tokens": 73253300.0, "step": 2295 }, { "entropy": 0.8946369141340256, "epoch": 0.2112466288290464, "grad_norm": 0.1711026132106781, "learning_rate": 9.296163400496827e-05, "loss": 0.9175, "mean_token_accuracy": 0.7415480017662048, "num_tokens": 73284946.0, "step": 2296 }, { "entropy": 0.8042214475572109, "epoch": 0.21133863520048762, "grad_norm": 0.15280771255493164, "learning_rate": 9.295856717882664e-05, "loss": 0.792, "mean_token_accuracy": 0.7685409113764763, "num_tokens": 73316638.0, "step": 2297 }, { "entropy": 0.7593127936124802, "epoch": 0.21143064157192887, "grad_norm": 0.15070487558841705, "learning_rate": 9.2955500352685e-05, "loss": 0.768, "mean_token_accuracy": 0.7812102846801281, "num_tokens": 73348759.0, "step": 2298 }, { "entropy": 0.7899413146078587, "epoch": 0.21152264794337008, "grad_norm": 0.15733014047145844, "learning_rate": 9.295243352654339e-05, "loss": 0.779, "mean_token_accuracy": 0.7734876573085785, "num_tokens": 73380889.0, "step": 2299 }, { "entropy": 0.8632377721369267, "epoch": 0.2116146543148113, "grad_norm": 0.16262930631637573, "learning_rate": 9.294936670040177e-05, "loss": 0.8576, "mean_token_accuracy": 0.7527768313884735, "num_tokens": 73412654.0, "step": 2300 }, { "entropy": 0.9495619386434555, "epoch": 0.21170666068625252, "grad_norm": 0.16623176634311676, "learning_rate": 9.294629987426014e-05, "loss": 0.9475, "mean_token_accuracy": 0.7298998758196831, "num_tokens": 73445234.0, "step": 2301 }, { "entropy": 0.8101659417152405, "epoch": 0.21179866705769373, "grad_norm": 0.15964554250240326, "learning_rate": 9.29432330481185e-05, "loss": 0.825, "mean_token_accuracy": 0.7656626999378204, "num_tokens": 73477714.0, "step": 2302 }, { "entropy": 0.8644240833818913, "epoch": 0.21189067342913498, "grad_norm": 0.15561071038246155, "learning_rate": 9.294016622197687e-05, "loss": 0.8357, "mean_token_accuracy": 0.7615216374397278, "num_tokens": 73510164.0, "step": 2303 }, { "entropy": 0.8193222731351852, "epoch": 0.2119826798005762, "grad_norm": 0.1511794924736023, "learning_rate": 9.293709939583525e-05, "loss": 0.7889, "mean_token_accuracy": 0.7722503058612347, "num_tokens": 73542158.0, "step": 2304 }, { "entropy": 0.9018499404191971, "epoch": 0.2120746861720174, "grad_norm": 0.1594957411289215, "learning_rate": 9.293403256969363e-05, "loss": 0.8728, "mean_token_accuracy": 0.7469648867845535, "num_tokens": 73573589.0, "step": 2305 }, { "entropy": 0.8220512084662914, "epoch": 0.21216669254345863, "grad_norm": 0.1603728085756302, "learning_rate": 9.2930965743552e-05, "loss": 0.8124, "mean_token_accuracy": 0.7637932151556015, "num_tokens": 73605323.0, "step": 2306 }, { "entropy": 0.8679672721773386, "epoch": 0.21225869891489985, "grad_norm": 0.16267962753772736, "learning_rate": 9.292789891741037e-05, "loss": 0.8783, "mean_token_accuracy": 0.7501159161329269, "num_tokens": 73636547.0, "step": 2307 }, { "entropy": 0.8786847665905952, "epoch": 0.2123507052863411, "grad_norm": 0.16042248904705048, "learning_rate": 9.292483209126875e-05, "loss": 0.8874, "mean_token_accuracy": 0.7459948137402534, "num_tokens": 73668141.0, "step": 2308 }, { "entropy": 0.8194758594036102, "epoch": 0.2124427116577823, "grad_norm": 0.16400262713432312, "learning_rate": 9.292176526512712e-05, "loss": 0.8422, "mean_token_accuracy": 0.7582703903317451, "num_tokens": 73699835.0, "step": 2309 }, { "entropy": 0.7984047047793865, "epoch": 0.21253471802922352, "grad_norm": 0.15341556072235107, "learning_rate": 9.29186984389855e-05, "loss": 0.7955, "mean_token_accuracy": 0.765237107872963, "num_tokens": 73731684.0, "step": 2310 }, { "entropy": 0.8519179932773113, "epoch": 0.21262672440066474, "grad_norm": 0.15963229537010193, "learning_rate": 9.291563161284387e-05, "loss": 0.8656, "mean_token_accuracy": 0.7528999224305153, "num_tokens": 73763388.0, "step": 2311 }, { "entropy": 0.8162442464381456, "epoch": 0.21271873077210596, "grad_norm": 0.15015247464179993, "learning_rate": 9.291256478670225e-05, "loss": 0.8058, "mean_token_accuracy": 0.7635101526975632, "num_tokens": 73795412.0, "step": 2312 }, { "entropy": 0.8530397266149521, "epoch": 0.2128107371435472, "grad_norm": 0.15462297201156616, "learning_rate": 9.290949796056062e-05, "loss": 0.8454, "mean_token_accuracy": 0.7592302151024342, "num_tokens": 73827598.0, "step": 2313 }, { "entropy": 0.8685322217643261, "epoch": 0.21290274351498842, "grad_norm": 0.1597013920545578, "learning_rate": 9.290643113441899e-05, "loss": 0.8376, "mean_token_accuracy": 0.7622593753039837, "num_tokens": 73859136.0, "step": 2314 }, { "entropy": 0.7380099222064018, "epoch": 0.21299474988642964, "grad_norm": 0.1455698311328888, "learning_rate": 9.290336430827737e-05, "loss": 0.7036, "mean_token_accuracy": 0.7940162383019924, "num_tokens": 73891495.0, "step": 2315 }, { "entropy": 0.8977028522640467, "epoch": 0.21308675625787085, "grad_norm": 0.1637427657842636, "learning_rate": 9.290029748213575e-05, "loss": 0.9074, "mean_token_accuracy": 0.7449595183134079, "num_tokens": 73923166.0, "step": 2316 }, { "entropy": 0.8406349718570709, "epoch": 0.21317876262931207, "grad_norm": 0.16535893082618713, "learning_rate": 9.289723065599412e-05, "loss": 0.8519, "mean_token_accuracy": 0.7539288587868214, "num_tokens": 73953835.0, "step": 2317 }, { "entropy": 0.8481707274913788, "epoch": 0.2132707690007533, "grad_norm": 0.15947511792182922, "learning_rate": 9.289416382985248e-05, "loss": 0.852, "mean_token_accuracy": 0.7579649947583675, "num_tokens": 73985238.0, "step": 2318 }, { "entropy": 0.9580808281898499, "epoch": 0.21336277537219453, "grad_norm": 0.16335488855838776, "learning_rate": 9.289109700371085e-05, "loss": 0.9511, "mean_token_accuracy": 0.7323847934603691, "num_tokens": 74017436.0, "step": 2319 }, { "entropy": 0.9189779311418533, "epoch": 0.21345478174363575, "grad_norm": 0.16445888578891754, "learning_rate": 9.288803017756925e-05, "loss": 0.935, "mean_token_accuracy": 0.7369248531758785, "num_tokens": 74049574.0, "step": 2320 }, { "entropy": 0.8613135479390621, "epoch": 0.21354678811507696, "grad_norm": 0.15711162984371185, "learning_rate": 9.288496335142762e-05, "loss": 0.8583, "mean_token_accuracy": 0.7517976872622967, "num_tokens": 74080706.0, "step": 2321 }, { "entropy": 0.9118535481393337, "epoch": 0.21363879448651818, "grad_norm": 0.16483868658542633, "learning_rate": 9.288189652528598e-05, "loss": 0.9364, "mean_token_accuracy": 0.7352632023394108, "num_tokens": 74112438.0, "step": 2322 }, { "entropy": 0.8229013569653034, "epoch": 0.21373080085795942, "grad_norm": 0.15979285538196564, "learning_rate": 9.287882969914436e-05, "loss": 0.8267, "mean_token_accuracy": 0.7661837078630924, "num_tokens": 74144585.0, "step": 2323 }, { "entropy": 0.7569926884025335, "epoch": 0.21382280722940064, "grad_norm": 0.1473347693681717, "learning_rate": 9.287576287300273e-05, "loss": 0.7442, "mean_token_accuracy": 0.7849711775779724, "num_tokens": 74177028.0, "step": 2324 }, { "entropy": 0.8404094390571117, "epoch": 0.21391481360084186, "grad_norm": 0.15971264243125916, "learning_rate": 9.287269604686111e-05, "loss": 0.8493, "mean_token_accuracy": 0.7552695386111736, "num_tokens": 74208864.0, "step": 2325 }, { "entropy": 0.8926186412572861, "epoch": 0.21400681997228307, "grad_norm": 0.16540151834487915, "learning_rate": 9.286962922071948e-05, "loss": 0.8802, "mean_token_accuracy": 0.7493114471435547, "num_tokens": 74240403.0, "step": 2326 }, { "entropy": 0.7373359240591526, "epoch": 0.2140988263437243, "grad_norm": 0.14905647933483124, "learning_rate": 9.286656239457786e-05, "loss": 0.7283, "mean_token_accuracy": 0.7870700471103191, "num_tokens": 74272259.0, "step": 2327 }, { "entropy": 0.8801760859787464, "epoch": 0.21419083271516554, "grad_norm": 0.15390077233314514, "learning_rate": 9.286349556843623e-05, "loss": 0.8536, "mean_token_accuracy": 0.7569510787725449, "num_tokens": 74304433.0, "step": 2328 }, { "entropy": 0.9202699735760689, "epoch": 0.21428283908660675, "grad_norm": 0.16361750662326813, "learning_rate": 9.28604287422946e-05, "loss": 0.8915, "mean_token_accuracy": 0.7435425333678722, "num_tokens": 74336750.0, "step": 2329 }, { "entropy": 0.9361569508910179, "epoch": 0.21437484545804797, "grad_norm": 0.1674267053604126, "learning_rate": 9.285736191615298e-05, "loss": 0.9318, "mean_token_accuracy": 0.7335952706634998, "num_tokens": 74368579.0, "step": 2330 }, { "entropy": 0.888928234577179, "epoch": 0.21446685182948919, "grad_norm": 0.15682590007781982, "learning_rate": 9.285429509001136e-05, "loss": 0.8822, "mean_token_accuracy": 0.7466441057622433, "num_tokens": 74400507.0, "step": 2331 }, { "entropy": 0.9294977150857449, "epoch": 0.2145588582009304, "grad_norm": 0.16409148275852203, "learning_rate": 9.285122826386973e-05, "loss": 0.9231, "mean_token_accuracy": 0.7371314279735088, "num_tokens": 74432296.0, "step": 2332 }, { "entropy": 0.8925334792584181, "epoch": 0.21465086457237165, "grad_norm": 0.15958143770694733, "learning_rate": 9.28481614377281e-05, "loss": 0.8759, "mean_token_accuracy": 0.7475364282727242, "num_tokens": 74463468.0, "step": 2333 }, { "entropy": 0.9574099369347095, "epoch": 0.21474287094381286, "grad_norm": 0.16768424212932587, "learning_rate": 9.284509461158647e-05, "loss": 0.9739, "mean_token_accuracy": 0.7254521921277046, "num_tokens": 74495697.0, "step": 2334 }, { "entropy": 0.8997032791376114, "epoch": 0.21483487731525408, "grad_norm": 0.1698794960975647, "learning_rate": 9.284202778544485e-05, "loss": 0.9067, "mean_token_accuracy": 0.7409320212900639, "num_tokens": 74527352.0, "step": 2335 }, { "entropy": 0.8077906928956509, "epoch": 0.2149268836866953, "grad_norm": 0.16342999041080475, "learning_rate": 9.283896095930323e-05, "loss": 0.8289, "mean_token_accuracy": 0.7630523443222046, "num_tokens": 74560026.0, "step": 2336 }, { "entropy": 0.9348451122641563, "epoch": 0.2150188900581365, "grad_norm": 0.1619235724210739, "learning_rate": 9.28358941331616e-05, "loss": 0.9429, "mean_token_accuracy": 0.7320568636059761, "num_tokens": 74591763.0, "step": 2337 }, { "entropy": 0.8356334138661623, "epoch": 0.21511089642957776, "grad_norm": 0.15647444128990173, "learning_rate": 9.283282730701996e-05, "loss": 0.8435, "mean_token_accuracy": 0.7583103813230991, "num_tokens": 74623598.0, "step": 2338 }, { "entropy": 0.8339238446205854, "epoch": 0.21520290280101897, "grad_norm": 0.16077212989330292, "learning_rate": 9.282976048087835e-05, "loss": 0.8345, "mean_token_accuracy": 0.7600149549543858, "num_tokens": 74655563.0, "step": 2339 }, { "entropy": 0.8778735399246216, "epoch": 0.2152949091724602, "grad_norm": 0.15700973570346832, "learning_rate": 9.282669365473671e-05, "loss": 0.833, "mean_token_accuracy": 0.7605788297951221, "num_tokens": 74687651.0, "step": 2340 }, { "entropy": 0.9297196641564369, "epoch": 0.2153869155439014, "grad_norm": 0.15686491131782532, "learning_rate": 9.28236268285951e-05, "loss": 0.9173, "mean_token_accuracy": 0.7417204901576042, "num_tokens": 74719457.0, "step": 2341 }, { "entropy": 0.8720533959567547, "epoch": 0.21547892191534262, "grad_norm": 0.1595546305179596, "learning_rate": 9.282056000245346e-05, "loss": 0.8623, "mean_token_accuracy": 0.7479305639863014, "num_tokens": 74751484.0, "step": 2342 }, { "entropy": 0.8389994129538536, "epoch": 0.21557092828678387, "grad_norm": 0.15346363186836243, "learning_rate": 9.281749317631184e-05, "loss": 0.8305, "mean_token_accuracy": 0.758939802646637, "num_tokens": 74783868.0, "step": 2343 }, { "entropy": 0.9312886856496334, "epoch": 0.2156629346582251, "grad_norm": 0.16573521494865417, "learning_rate": 9.281442635017021e-05, "loss": 0.9295, "mean_token_accuracy": 0.7392262890934944, "num_tokens": 74816071.0, "step": 2344 }, { "entropy": 0.9091213829815388, "epoch": 0.2157549410296663, "grad_norm": 0.15877792239189148, "learning_rate": 9.281135952402858e-05, "loss": 0.8818, "mean_token_accuracy": 0.7479448355734348, "num_tokens": 74848227.0, "step": 2345 }, { "entropy": 0.8529758080840111, "epoch": 0.21584694740110752, "grad_norm": 0.15783029794692993, "learning_rate": 9.280829269788696e-05, "loss": 0.8357, "mean_token_accuracy": 0.758288387209177, "num_tokens": 74879920.0, "step": 2346 }, { "entropy": 0.8285192921757698, "epoch": 0.21593895377254874, "grad_norm": 0.158837229013443, "learning_rate": 9.280522587174534e-05, "loss": 0.8375, "mean_token_accuracy": 0.7608655840158463, "num_tokens": 74912300.0, "step": 2347 }, { "entropy": 0.8837095201015472, "epoch": 0.21603096014398998, "grad_norm": 0.16371788084506989, "learning_rate": 9.280215904560371e-05, "loss": 0.901, "mean_token_accuracy": 0.7441506832838058, "num_tokens": 74944138.0, "step": 2348 }, { "entropy": 0.8959066495299339, "epoch": 0.2161229665154312, "grad_norm": 0.16035102307796478, "learning_rate": 9.279909221946208e-05, "loss": 0.9126, "mean_token_accuracy": 0.7381299212574959, "num_tokens": 74976578.0, "step": 2349 }, { "entropy": 0.8476665876805782, "epoch": 0.21621497288687241, "grad_norm": 0.15813155472278595, "learning_rate": 9.279602539332046e-05, "loss": 0.8709, "mean_token_accuracy": 0.7531716749072075, "num_tokens": 75008507.0, "step": 2350 }, { "entropy": 0.8305793777108192, "epoch": 0.21630697925831363, "grad_norm": 0.1581171452999115, "learning_rate": 9.279295856717883e-05, "loss": 0.8218, "mean_token_accuracy": 0.7596693150699139, "num_tokens": 75039476.0, "step": 2351 }, { "entropy": 0.9214646555483341, "epoch": 0.21639898562975485, "grad_norm": 0.15791237354278564, "learning_rate": 9.278989174103721e-05, "loss": 0.9353, "mean_token_accuracy": 0.7329492978751659, "num_tokens": 75070929.0, "step": 2352 }, { "entropy": 0.785088799893856, "epoch": 0.2164909920011961, "grad_norm": 0.159236341714859, "learning_rate": 9.278682491489558e-05, "loss": 0.8017, "mean_token_accuracy": 0.7744565196335316, "num_tokens": 75103697.0, "step": 2353 }, { "entropy": 0.8934606835246086, "epoch": 0.2165829983726373, "grad_norm": 0.1600653976202011, "learning_rate": 9.278375808875396e-05, "loss": 0.8874, "mean_token_accuracy": 0.7499939389526844, "num_tokens": 75135945.0, "step": 2354 }, { "entropy": 0.8991423435509205, "epoch": 0.21667500474407853, "grad_norm": 0.16743279993534088, "learning_rate": 9.278069126261233e-05, "loss": 0.898, "mean_token_accuracy": 0.7448224611580372, "num_tokens": 75167490.0, "step": 2355 }, { "entropy": 0.9201076962053776, "epoch": 0.21676701111551974, "grad_norm": 0.16606201231479645, "learning_rate": 9.27776244364707e-05, "loss": 0.9541, "mean_token_accuracy": 0.7341414354741573, "num_tokens": 75199313.0, "step": 2356 }, { "entropy": 0.9680018480867147, "epoch": 0.21685901748696096, "grad_norm": 0.1589997112751007, "learning_rate": 9.277455761032908e-05, "loss": 0.9533, "mean_token_accuracy": 0.7317590825259686, "num_tokens": 75231759.0, "step": 2357 }, { "entropy": 0.8960989713668823, "epoch": 0.2169510238584022, "grad_norm": 0.15569919347763062, "learning_rate": 9.277149078418746e-05, "loss": 0.8886, "mean_token_accuracy": 0.7453737258911133, "num_tokens": 75263606.0, "step": 2358 }, { "entropy": 0.9482849277555943, "epoch": 0.21704303022984342, "grad_norm": 0.15724118053913116, "learning_rate": 9.276842395804582e-05, "loss": 0.9256, "mean_token_accuracy": 0.736133761703968, "num_tokens": 75295807.0, "step": 2359 }, { "entropy": 1.024195782840252, "epoch": 0.21713503660128464, "grad_norm": 0.16403645277023315, "learning_rate": 9.276535713190419e-05, "loss": 1.0137, "mean_token_accuracy": 0.7117209136486053, "num_tokens": 75327731.0, "step": 2360 }, { "entropy": 0.9239401072263718, "epoch": 0.21722704297272585, "grad_norm": 0.16181538999080658, "learning_rate": 9.276229030576256e-05, "loss": 0.93, "mean_token_accuracy": 0.7377127967774868, "num_tokens": 75360173.0, "step": 2361 }, { "entropy": 0.8845912162214518, "epoch": 0.21731904934416707, "grad_norm": 0.15625187754631042, "learning_rate": 9.275922347962096e-05, "loss": 0.8607, "mean_token_accuracy": 0.7501765973865986, "num_tokens": 75391747.0, "step": 2362 }, { "entropy": 0.8475316539406776, "epoch": 0.21741105571560831, "grad_norm": 0.1548399180173874, "learning_rate": 9.275615665347932e-05, "loss": 0.8407, "mean_token_accuracy": 0.760573036968708, "num_tokens": 75423842.0, "step": 2363 }, { "entropy": 0.8303390741348267, "epoch": 0.21750306208704953, "grad_norm": 0.15964899957180023, "learning_rate": 9.275308982733769e-05, "loss": 0.8039, "mean_token_accuracy": 0.7697515487670898, "num_tokens": 75456004.0, "step": 2364 }, { "entropy": 0.8924689441919327, "epoch": 0.21759506845849075, "grad_norm": 0.16586615145206451, "learning_rate": 9.275002300119606e-05, "loss": 0.9201, "mean_token_accuracy": 0.7366299442946911, "num_tokens": 75488432.0, "step": 2365 }, { "entropy": 0.891871515661478, "epoch": 0.21768707482993196, "grad_norm": 0.15239176154136658, "learning_rate": 9.274695617505444e-05, "loss": 0.8565, "mean_token_accuracy": 0.7589692138135433, "num_tokens": 75520614.0, "step": 2366 }, { "entropy": 0.8693595491349697, "epoch": 0.21777908120137318, "grad_norm": 0.15834809839725494, "learning_rate": 9.274388934891282e-05, "loss": 0.8673, "mean_token_accuracy": 0.7509845718741417, "num_tokens": 75552933.0, "step": 2367 }, { "entropy": 0.9256998375058174, "epoch": 0.21787108757281443, "grad_norm": 0.16354398429393768, "learning_rate": 9.274082252277119e-05, "loss": 0.9154, "mean_token_accuracy": 0.7432111985981464, "num_tokens": 75584888.0, "step": 2368 }, { "entropy": 0.8945051468908787, "epoch": 0.21796309394425564, "grad_norm": 0.16683915257453918, "learning_rate": 9.273775569662956e-05, "loss": 0.8942, "mean_token_accuracy": 0.7481366842985153, "num_tokens": 75616177.0, "step": 2369 }, { "entropy": 0.7913928367197514, "epoch": 0.21805510031569686, "grad_norm": 0.15472346544265747, "learning_rate": 9.273468887048794e-05, "loss": 0.8021, "mean_token_accuracy": 0.7681840658187866, "num_tokens": 75647743.0, "step": 2370 }, { "entropy": 0.9697216413915157, "epoch": 0.21814710668713808, "grad_norm": 0.16356663405895233, "learning_rate": 9.273162204434631e-05, "loss": 0.9502, "mean_token_accuracy": 0.7296673133969307, "num_tokens": 75679604.0, "step": 2371 }, { "entropy": 0.8124455139040947, "epoch": 0.21823911305857932, "grad_norm": 0.15782524645328522, "learning_rate": 9.272855521820469e-05, "loss": 0.8105, "mean_token_accuracy": 0.7699906527996063, "num_tokens": 75712198.0, "step": 2372 }, { "entropy": 0.877621166408062, "epoch": 0.21833111943002054, "grad_norm": 0.16561342775821686, "learning_rate": 9.272548839206306e-05, "loss": 0.8674, "mean_token_accuracy": 0.7490702718496323, "num_tokens": 75744211.0, "step": 2373 }, { "entropy": 0.8295040968805552, "epoch": 0.21842312580146175, "grad_norm": 0.16530773043632507, "learning_rate": 9.272242156592144e-05, "loss": 0.8433, "mean_token_accuracy": 0.7572709769010544, "num_tokens": 75775605.0, "step": 2374 }, { "entropy": 0.8505012206733227, "epoch": 0.21851513217290297, "grad_norm": 0.15716202557086945, "learning_rate": 9.27193547397798e-05, "loss": 0.8407, "mean_token_accuracy": 0.7608695663511753, "num_tokens": 75808373.0, "step": 2375 }, { "entropy": 0.8264030143618584, "epoch": 0.2186071385443442, "grad_norm": 0.16426382958889008, "learning_rate": 9.271628791363817e-05, "loss": 0.8271, "mean_token_accuracy": 0.7618039399385452, "num_tokens": 75839529.0, "step": 2376 }, { "entropy": 0.8500331602990627, "epoch": 0.21869914491578543, "grad_norm": 0.15977241098880768, "learning_rate": 9.271322108749655e-05, "loss": 0.8317, "mean_token_accuracy": 0.7604336328804493, "num_tokens": 75870779.0, "step": 2377 }, { "entropy": 0.8669287972152233, "epoch": 0.21879115128722665, "grad_norm": 0.16070467233657837, "learning_rate": 9.271015426135494e-05, "loss": 0.8693, "mean_token_accuracy": 0.7538273520767689, "num_tokens": 75902487.0, "step": 2378 }, { "entropy": 0.8837708123028278, "epoch": 0.21888315765866787, "grad_norm": 0.15836681425571442, "learning_rate": 9.27070874352133e-05, "loss": 0.8707, "mean_token_accuracy": 0.7574727237224579, "num_tokens": 75934107.0, "step": 2379 }, { "entropy": 0.8982877023518085, "epoch": 0.21897516403010908, "grad_norm": 0.1636568307876587, "learning_rate": 9.270402060907167e-05, "loss": 0.893, "mean_token_accuracy": 0.7458903677761555, "num_tokens": 75965502.0, "step": 2380 }, { "entropy": 0.7785019725561142, "epoch": 0.2190671704015503, "grad_norm": 0.15349778532981873, "learning_rate": 9.270095378293005e-05, "loss": 0.7784, "mean_token_accuracy": 0.7725294530391693, "num_tokens": 75996895.0, "step": 2381 }, { "entropy": 0.8959601409733295, "epoch": 0.21915917677299154, "grad_norm": 0.16255168616771698, "learning_rate": 9.269788695678842e-05, "loss": 0.8959, "mean_token_accuracy": 0.7454547770321369, "num_tokens": 76028648.0, "step": 2382 }, { "entropy": 0.8093692101538181, "epoch": 0.21925118314443276, "grad_norm": 0.15968404710292816, "learning_rate": 9.26948201306468e-05, "loss": 0.8335, "mean_token_accuracy": 0.7609451897442341, "num_tokens": 76061162.0, "step": 2383 }, { "entropy": 0.7668165154755116, "epoch": 0.21934318951587398, "grad_norm": 0.15506219863891602, "learning_rate": 9.269175330450517e-05, "loss": 0.7775, "mean_token_accuracy": 0.7728948183357716, "num_tokens": 76092886.0, "step": 2384 }, { "entropy": 0.7196921799331903, "epoch": 0.2194351958873152, "grad_norm": 0.15224286913871765, "learning_rate": 9.268868647836355e-05, "loss": 0.7127, "mean_token_accuracy": 0.7899365983903408, "num_tokens": 76124763.0, "step": 2385 }, { "entropy": 0.9621920473873615, "epoch": 0.2195272022587564, "grad_norm": 0.16576825082302094, "learning_rate": 9.268561965222192e-05, "loss": 0.9783, "mean_token_accuracy": 0.7252373807132244, "num_tokens": 76156770.0, "step": 2386 }, { "entropy": 0.9017544910311699, "epoch": 0.21961920863019765, "grad_norm": 0.15667423605918884, "learning_rate": 9.268255282608029e-05, "loss": 0.897, "mean_token_accuracy": 0.743223499506712, "num_tokens": 76188949.0, "step": 2387 }, { "entropy": 0.8645553756505251, "epoch": 0.21971121500163887, "grad_norm": 0.1545802503824234, "learning_rate": 9.267948599993867e-05, "loss": 0.8434, "mean_token_accuracy": 0.7597783878445625, "num_tokens": 76221003.0, "step": 2388 }, { "entropy": 0.8304884228855371, "epoch": 0.2198032213730801, "grad_norm": 0.15363381803035736, "learning_rate": 9.267641917379705e-05, "loss": 0.8263, "mean_token_accuracy": 0.7591828480362892, "num_tokens": 76252490.0, "step": 2389 }, { "entropy": 0.8207105826586485, "epoch": 0.2198952277445213, "grad_norm": 0.16062292456626892, "learning_rate": 9.267335234765542e-05, "loss": 0.8325, "mean_token_accuracy": 0.7621244452893734, "num_tokens": 76284991.0, "step": 2390 }, { "entropy": 0.8254145383834839, "epoch": 0.21998723411596252, "grad_norm": 0.1548829972743988, "learning_rate": 9.267028552151379e-05, "loss": 0.8092, "mean_token_accuracy": 0.7646306343376637, "num_tokens": 76316853.0, "step": 2391 }, { "entropy": 0.8714759461581707, "epoch": 0.22007924048740377, "grad_norm": 0.158981055021286, "learning_rate": 9.266721869537215e-05, "loss": 0.8641, "mean_token_accuracy": 0.7506410293281078, "num_tokens": 76347992.0, "step": 2392 }, { "entropy": 0.9102405179291964, "epoch": 0.22017124685884498, "grad_norm": 0.16308613121509552, "learning_rate": 9.266415186923054e-05, "loss": 0.9005, "mean_token_accuracy": 0.7455661222338676, "num_tokens": 76379983.0, "step": 2393 }, { "entropy": 0.8415393512696028, "epoch": 0.2202632532302862, "grad_norm": 0.15297505259513855, "learning_rate": 9.266108504308892e-05, "loss": 0.8254, "mean_token_accuracy": 0.7634361609816551, "num_tokens": 76412733.0, "step": 2394 }, { "entropy": 0.8242152854800224, "epoch": 0.22035525960172742, "grad_norm": 0.16453465819358826, "learning_rate": 9.265801821694728e-05, "loss": 0.8515, "mean_token_accuracy": 0.7549100369215012, "num_tokens": 76445181.0, "step": 2395 }, { "entropy": 0.8393812011927366, "epoch": 0.22044726597316863, "grad_norm": 0.29978421330451965, "learning_rate": 9.265495139080565e-05, "loss": 0.8273, "mean_token_accuracy": 0.7587360702455044, "num_tokens": 76475415.0, "step": 2396 }, { "entropy": 0.7825194150209427, "epoch": 0.22053927234460988, "grad_norm": 0.1561039835214615, "learning_rate": 9.265188456466403e-05, "loss": 0.7642, "mean_token_accuracy": 0.7783934213221073, "num_tokens": 76506859.0, "step": 2397 }, { "entropy": 0.9893200322985649, "epoch": 0.2206312787160511, "grad_norm": 0.16954182088375092, "learning_rate": 9.264881773852242e-05, "loss": 0.989, "mean_token_accuracy": 0.7232375107705593, "num_tokens": 76538538.0, "step": 2398 }, { "entropy": 0.9432032592594624, "epoch": 0.2207232850874923, "grad_norm": 0.1635211557149887, "learning_rate": 9.264575091238078e-05, "loss": 0.9333, "mean_token_accuracy": 0.7327356748282909, "num_tokens": 76569810.0, "step": 2399 }, { "entropy": 0.8307926431298256, "epoch": 0.22081529145893353, "grad_norm": 0.16534583270549774, "learning_rate": 9.264268408623915e-05, "loss": 0.8211, "mean_token_accuracy": 0.763165008276701, "num_tokens": 76600067.0, "step": 2400 }, { "entropy": 0.7885468527674675, "epoch": 0.22090729783037474, "grad_norm": 0.16105757653713226, "learning_rate": 9.263961726009753e-05, "loss": 0.7618, "mean_token_accuracy": 0.7815434262156487, "num_tokens": 76632200.0, "step": 2401 }, { "entropy": 0.911312647163868, "epoch": 0.220999304201816, "grad_norm": 0.16344329714775085, "learning_rate": 9.26365504339559e-05, "loss": 0.9257, "mean_token_accuracy": 0.7434613108634949, "num_tokens": 76663902.0, "step": 2402 }, { "entropy": 0.911921963095665, "epoch": 0.2210913105732572, "grad_norm": 0.22251935303211212, "learning_rate": 9.263348360781428e-05, "loss": 0.9317, "mean_token_accuracy": 0.7408071756362915, "num_tokens": 76695984.0, "step": 2403 }, { "entropy": 0.9112119600176811, "epoch": 0.22118331694469842, "grad_norm": 0.15777891874313354, "learning_rate": 9.263041678167265e-05, "loss": 0.9001, "mean_token_accuracy": 0.7424022667109966, "num_tokens": 76728060.0, "step": 2404 }, { "entropy": 0.7776431851089001, "epoch": 0.22127532331613964, "grad_norm": 0.15547235310077667, "learning_rate": 9.262734995553103e-05, "loss": 0.802, "mean_token_accuracy": 0.7701295167207718, "num_tokens": 76759860.0, "step": 2405 }, { "entropy": 0.7890602611005306, "epoch": 0.22136732968758085, "grad_norm": 0.15356017649173737, "learning_rate": 9.26242831293894e-05, "loss": 0.8132, "mean_token_accuracy": 0.7622497864067554, "num_tokens": 76791792.0, "step": 2406 }, { "entropy": 0.9493694566190243, "epoch": 0.2214593360590221, "grad_norm": 0.1628301739692688, "learning_rate": 9.262121630324777e-05, "loss": 0.9592, "mean_token_accuracy": 0.7309982180595398, "num_tokens": 76824351.0, "step": 2407 }, { "entropy": 0.7940101716667414, "epoch": 0.22155134243046332, "grad_norm": 0.1532294899225235, "learning_rate": 9.261814947710615e-05, "loss": 0.7924, "mean_token_accuracy": 0.7743231505155563, "num_tokens": 76855740.0, "step": 2408 }, { "entropy": 0.8962213099002838, "epoch": 0.22164334880190453, "grad_norm": 0.1641906201839447, "learning_rate": 9.261508265096453e-05, "loss": 0.9058, "mean_token_accuracy": 0.7448272183537483, "num_tokens": 76887358.0, "step": 2409 }, { "entropy": 0.8290924802422523, "epoch": 0.22173535517334575, "grad_norm": 0.15507254004478455, "learning_rate": 9.26120158248229e-05, "loss": 0.8163, "mean_token_accuracy": 0.7676545009016991, "num_tokens": 76919109.0, "step": 2410 }, { "entropy": 0.942939281463623, "epoch": 0.22182736154478697, "grad_norm": 0.1585475653409958, "learning_rate": 9.260894899868127e-05, "loss": 0.9197, "mean_token_accuracy": 0.735062912106514, "num_tokens": 76950923.0, "step": 2411 }, { "entropy": 0.9165598545223475, "epoch": 0.2219193679162282, "grad_norm": 0.16037026047706604, "learning_rate": 9.260588217253965e-05, "loss": 0.9187, "mean_token_accuracy": 0.7410679310560226, "num_tokens": 76983046.0, "step": 2412 }, { "entropy": 0.9298561438918114, "epoch": 0.22201137428766943, "grad_norm": 0.16303080320358276, "learning_rate": 9.260281534639801e-05, "loss": 0.8993, "mean_token_accuracy": 0.744863398373127, "num_tokens": 77015243.0, "step": 2413 }, { "entropy": 0.9026986621320248, "epoch": 0.22210338065911064, "grad_norm": 0.16461068391799927, "learning_rate": 9.25997485202564e-05, "loss": 0.8901, "mean_token_accuracy": 0.7470667101442814, "num_tokens": 77047413.0, "step": 2414 }, { "entropy": 0.8482456654310226, "epoch": 0.22219538703055186, "grad_norm": 0.15539486706256866, "learning_rate": 9.259668169411476e-05, "loss": 0.8226, "mean_token_accuracy": 0.7664720341563225, "num_tokens": 77079735.0, "step": 2415 }, { "entropy": 0.8858373872935772, "epoch": 0.22228739340199308, "grad_norm": 0.164635568857193, "learning_rate": 9.259361486797315e-05, "loss": 0.8755, "mean_token_accuracy": 0.7483071498572826, "num_tokens": 77110753.0, "step": 2416 }, { "entropy": 0.8632417060434818, "epoch": 0.22237939977343432, "grad_norm": 0.16256655752658844, "learning_rate": 9.259054804183151e-05, "loss": 0.8537, "mean_token_accuracy": 0.7513967789709568, "num_tokens": 77142431.0, "step": 2417 }, { "entropy": 0.843621127307415, "epoch": 0.22247140614487554, "grad_norm": 0.1585281640291214, "learning_rate": 9.258748121568988e-05, "loss": 0.8364, "mean_token_accuracy": 0.7543556876480579, "num_tokens": 77174161.0, "step": 2418 }, { "entropy": 0.9568715989589691, "epoch": 0.22256341251631676, "grad_norm": 0.1773958057165146, "learning_rate": 9.258441438954826e-05, "loss": 0.9605, "mean_token_accuracy": 0.7264894172549248, "num_tokens": 77204426.0, "step": 2419 }, { "entropy": 0.781513961032033, "epoch": 0.22265541888775797, "grad_norm": 0.15730610489845276, "learning_rate": 9.258134756340664e-05, "loss": 0.7691, "mean_token_accuracy": 0.7756846249103546, "num_tokens": 77236136.0, "step": 2420 }, { "entropy": 0.8705812357366085, "epoch": 0.2227474252591992, "grad_norm": 0.16577307879924774, "learning_rate": 9.257828073726501e-05, "loss": 0.8677, "mean_token_accuracy": 0.7493188418447971, "num_tokens": 77268415.0, "step": 2421 }, { "entropy": 0.8054774161428213, "epoch": 0.22283943163064043, "grad_norm": 0.1753743439912796, "learning_rate": 9.257521391112338e-05, "loss": 0.8094, "mean_token_accuracy": 0.7669086866080761, "num_tokens": 77300069.0, "step": 2422 }, { "entropy": 0.7800725363194942, "epoch": 0.22293143800208165, "grad_norm": 0.16658997535705566, "learning_rate": 9.257214708498175e-05, "loss": 0.8066, "mean_token_accuracy": 0.7699519209563732, "num_tokens": 77332670.0, "step": 2423 }, { "entropy": 0.8597707152366638, "epoch": 0.22302344437352287, "grad_norm": 0.1628721058368683, "learning_rate": 9.256908025884013e-05, "loss": 0.8745, "mean_token_accuracy": 0.7497112825512886, "num_tokens": 77364845.0, "step": 2424 }, { "entropy": 0.8321843110024929, "epoch": 0.22311545074496408, "grad_norm": 0.16255098581314087, "learning_rate": 9.256601343269851e-05, "loss": 0.8526, "mean_token_accuracy": 0.7545066028833389, "num_tokens": 77396415.0, "step": 2425 }, { "entropy": 0.8522726856172085, "epoch": 0.2232074571164053, "grad_norm": 0.15373045206069946, "learning_rate": 9.256294660655688e-05, "loss": 0.8265, "mean_token_accuracy": 0.7595599293708801, "num_tokens": 77428920.0, "step": 2426 }, { "entropy": 0.8900353945791721, "epoch": 0.22329946348784654, "grad_norm": 0.15893279016017914, "learning_rate": 9.255987978041525e-05, "loss": 0.893, "mean_token_accuracy": 0.7455858252942562, "num_tokens": 77460816.0, "step": 2427 }, { "entropy": 0.9393269494175911, "epoch": 0.22339146985928776, "grad_norm": 0.1608554571866989, "learning_rate": 9.255681295427363e-05, "loss": 0.9272, "mean_token_accuracy": 0.738957304507494, "num_tokens": 77492751.0, "step": 2428 }, { "entropy": 0.8629439491778612, "epoch": 0.22348347623072898, "grad_norm": 0.15529221296310425, "learning_rate": 9.2553746128132e-05, "loss": 0.8564, "mean_token_accuracy": 0.7540825977921486, "num_tokens": 77524799.0, "step": 2429 }, { "entropy": 0.8922556843608618, "epoch": 0.2235754826021702, "grad_norm": 0.16392524540424347, "learning_rate": 9.255067930199038e-05, "loss": 0.8724, "mean_token_accuracy": 0.7535968795418739, "num_tokens": 77555791.0, "step": 2430 }, { "entropy": 0.8145883567631245, "epoch": 0.2236674889736114, "grad_norm": 0.16306248307228088, "learning_rate": 9.254761247584874e-05, "loss": 0.7997, "mean_token_accuracy": 0.7688535898923874, "num_tokens": 77587263.0, "step": 2431 }, { "entropy": 0.8463025651872158, "epoch": 0.22375949534505266, "grad_norm": 0.1577865034341812, "learning_rate": 9.254454564970713e-05, "loss": 0.8406, "mean_token_accuracy": 0.7589344307780266, "num_tokens": 77618796.0, "step": 2432 }, { "entropy": 0.7921186871826649, "epoch": 0.22385150171649387, "grad_norm": 0.1579602062702179, "learning_rate": 9.25414788235655e-05, "loss": 0.811, "mean_token_accuracy": 0.7654600888490677, "num_tokens": 77650371.0, "step": 2433 }, { "entropy": 0.9051210563629866, "epoch": 0.2239435080879351, "grad_norm": 0.1605272740125656, "learning_rate": 9.253841199742386e-05, "loss": 0.9165, "mean_token_accuracy": 0.7402685470879078, "num_tokens": 77682700.0, "step": 2434 }, { "entropy": 0.7928264662623405, "epoch": 0.2240355144593763, "grad_norm": 0.15692757070064545, "learning_rate": 9.253534517128224e-05, "loss": 0.7775, "mean_token_accuracy": 0.7737283334136009, "num_tokens": 77714938.0, "step": 2435 }, { "entropy": 0.8577410690486431, "epoch": 0.22412752083081752, "grad_norm": 0.16076110303401947, "learning_rate": 9.253227834514062e-05, "loss": 0.8516, "mean_token_accuracy": 0.7559146955609322, "num_tokens": 77746761.0, "step": 2436 }, { "entropy": 0.909280925989151, "epoch": 0.22421952720225877, "grad_norm": 0.16244357824325562, "learning_rate": 9.252921151899899e-05, "loss": 0.9028, "mean_token_accuracy": 0.7423637919127941, "num_tokens": 77778751.0, "step": 2437 }, { "entropy": 0.8586148098111153, "epoch": 0.22431153357369998, "grad_norm": 0.1640169769525528, "learning_rate": 9.252614469285736e-05, "loss": 0.8577, "mean_token_accuracy": 0.7535280324518681, "num_tokens": 77810125.0, "step": 2438 }, { "entropy": 0.8394592553377151, "epoch": 0.2244035399451412, "grad_norm": 0.1634720265865326, "learning_rate": 9.252307786671573e-05, "loss": 0.8555, "mean_token_accuracy": 0.7559535950422287, "num_tokens": 77841720.0, "step": 2439 }, { "entropy": 0.832049660384655, "epoch": 0.22449554631658242, "grad_norm": 0.15731443464756012, "learning_rate": 9.252001104057412e-05, "loss": 0.8244, "mean_token_accuracy": 0.7612277865409851, "num_tokens": 77872917.0, "step": 2440 }, { "entropy": 0.8788662552833557, "epoch": 0.22458755268802363, "grad_norm": 0.1670287549495697, "learning_rate": 9.251694421443249e-05, "loss": 0.8933, "mean_token_accuracy": 0.7500119619071484, "num_tokens": 77904058.0, "step": 2441 }, { "entropy": 0.8365580625832081, "epoch": 0.22467955905946488, "grad_norm": 0.16152448952198029, "learning_rate": 9.251387738829086e-05, "loss": 0.8353, "mean_token_accuracy": 0.75727778673172, "num_tokens": 77935611.0, "step": 2442 }, { "entropy": 0.8847270049154758, "epoch": 0.2247715654309061, "grad_norm": 0.15259428322315216, "learning_rate": 9.251081056214924e-05, "loss": 0.8595, "mean_token_accuracy": 0.7464080639183521, "num_tokens": 77967550.0, "step": 2443 }, { "entropy": 0.9056771844625473, "epoch": 0.2248635718023473, "grad_norm": 0.16158853471279144, "learning_rate": 9.250774373600761e-05, "loss": 0.902, "mean_token_accuracy": 0.741930466145277, "num_tokens": 77998382.0, "step": 2444 }, { "entropy": 0.9118116088211536, "epoch": 0.22495557817378853, "grad_norm": 0.16490763425827026, "learning_rate": 9.250467690986599e-05, "loss": 0.9093, "mean_token_accuracy": 0.7444416992366314, "num_tokens": 78030788.0, "step": 2445 }, { "entropy": 0.8060839623212814, "epoch": 0.22504758454522975, "grad_norm": 0.1540549099445343, "learning_rate": 9.250161008372436e-05, "loss": 0.7995, "mean_token_accuracy": 0.7692074738442898, "num_tokens": 78062247.0, "step": 2446 }, { "entropy": 0.9242357388138771, "epoch": 0.225139590916671, "grad_norm": 0.16591130197048187, "learning_rate": 9.249854325758274e-05, "loss": 0.9194, "mean_token_accuracy": 0.7422970943152905, "num_tokens": 78094123.0, "step": 2447 }, { "entropy": 0.8401551768183708, "epoch": 0.2252315972881122, "grad_norm": 0.15783396363258362, "learning_rate": 9.249547643144111e-05, "loss": 0.8284, "mean_token_accuracy": 0.7632195167243481, "num_tokens": 78125511.0, "step": 2448 }, { "entropy": 0.8382232375442982, "epoch": 0.22532360365955342, "grad_norm": 0.1595248132944107, "learning_rate": 9.249240960529948e-05, "loss": 0.8209, "mean_token_accuracy": 0.75899513438344, "num_tokens": 78156576.0, "step": 2449 }, { "entropy": 0.866189980879426, "epoch": 0.22541561003099464, "grad_norm": 0.15594273805618286, "learning_rate": 9.248934277915786e-05, "loss": 0.8564, "mean_token_accuracy": 0.7557939291000366, "num_tokens": 78188655.0, "step": 2450 }, { "entropy": 0.8278778847306967, "epoch": 0.22550761640243586, "grad_norm": 0.15583886206150055, "learning_rate": 9.248627595301624e-05, "loss": 0.8286, "mean_token_accuracy": 0.7639510966837406, "num_tokens": 78221139.0, "step": 2451 }, { "entropy": 0.7921338379383087, "epoch": 0.2255996227738771, "grad_norm": 0.17282500863075256, "learning_rate": 9.24832091268746e-05, "loss": 0.7886, "mean_token_accuracy": 0.7755043432116508, "num_tokens": 78253058.0, "step": 2452 }, { "entropy": 0.8750727027654648, "epoch": 0.22569162914531832, "grad_norm": 0.16083507239818573, "learning_rate": 9.248014230073297e-05, "loss": 0.8622, "mean_token_accuracy": 0.7477783150970936, "num_tokens": 78284959.0, "step": 2453 }, { "entropy": 0.8606866784393787, "epoch": 0.22578363551675953, "grad_norm": 0.1617298424243927, "learning_rate": 9.247707547459134e-05, "loss": 0.8514, "mean_token_accuracy": 0.755724623799324, "num_tokens": 78316204.0, "step": 2454 }, { "entropy": 0.8241336867213249, "epoch": 0.22587564188820075, "grad_norm": 0.1632377803325653, "learning_rate": 9.247400864844972e-05, "loss": 0.8382, "mean_token_accuracy": 0.7600356824696064, "num_tokens": 78348828.0, "step": 2455 }, { "entropy": 0.8431034311652184, "epoch": 0.22596764825964197, "grad_norm": 0.16564667224884033, "learning_rate": 9.24709418223081e-05, "loss": 0.8436, "mean_token_accuracy": 0.7573892809450626, "num_tokens": 78380777.0, "step": 2456 }, { "entropy": 0.7939852811396122, "epoch": 0.2260596546310832, "grad_norm": 0.17228050529956818, "learning_rate": 9.246787499616647e-05, "loss": 0.8182, "mean_token_accuracy": 0.7668692469596863, "num_tokens": 78412211.0, "step": 2457 }, { "entropy": 0.810934241861105, "epoch": 0.22615166100252443, "grad_norm": 0.1561870276927948, "learning_rate": 9.246480817002484e-05, "loss": 0.8041, "mean_token_accuracy": 0.7616858631372452, "num_tokens": 78443779.0, "step": 2458 }, { "entropy": 0.9104740023612976, "epoch": 0.22624366737396565, "grad_norm": 0.15638893842697144, "learning_rate": 9.246174134388322e-05, "loss": 0.8923, "mean_token_accuracy": 0.7439194172620773, "num_tokens": 78475720.0, "step": 2459 }, { "entropy": 0.9017694909125566, "epoch": 0.22633567374540686, "grad_norm": 0.1610424667596817, "learning_rate": 9.245867451774159e-05, "loss": 0.8927, "mean_token_accuracy": 0.7458363771438599, "num_tokens": 78507533.0, "step": 2460 }, { "entropy": 0.8449519742280245, "epoch": 0.22642768011684808, "grad_norm": 0.15164564549922943, "learning_rate": 9.245560769159997e-05, "loss": 0.8023, "mean_token_accuracy": 0.764660470187664, "num_tokens": 78538704.0, "step": 2461 }, { "entropy": 0.894967719912529, "epoch": 0.22651968648828932, "grad_norm": 0.16110679507255554, "learning_rate": 9.245254086545834e-05, "loss": 0.8899, "mean_token_accuracy": 0.7483405396342278, "num_tokens": 78570254.0, "step": 2462 }, { "entropy": 0.9032144881784916, "epoch": 0.22661169285973054, "grad_norm": 0.1580689251422882, "learning_rate": 9.244947403931672e-05, "loss": 0.9123, "mean_token_accuracy": 0.7412020415067673, "num_tokens": 78602565.0, "step": 2463 }, { "entropy": 0.8070832937955856, "epoch": 0.22670369923117176, "grad_norm": 0.1578044593334198, "learning_rate": 9.244640721317509e-05, "loss": 0.8092, "mean_token_accuracy": 0.7657571919262409, "num_tokens": 78634520.0, "step": 2464 }, { "entropy": 0.8746586441993713, "epoch": 0.22679570560261297, "grad_norm": 0.15881843864917755, "learning_rate": 9.244334038703346e-05, "loss": 0.8868, "mean_token_accuracy": 0.7502185218036175, "num_tokens": 78667158.0, "step": 2465 }, { "entropy": 0.9664230234920979, "epoch": 0.2268877119740542, "grad_norm": 0.16260910034179688, "learning_rate": 9.244027356089184e-05, "loss": 0.9659, "mean_token_accuracy": 0.729084737598896, "num_tokens": 78698459.0, "step": 2466 }, { "entropy": 0.905882254242897, "epoch": 0.22697971834549543, "grad_norm": 0.15757645666599274, "learning_rate": 9.243720673475022e-05, "loss": 0.8916, "mean_token_accuracy": 0.7458305507898331, "num_tokens": 78729492.0, "step": 2467 }, { "entropy": 0.9068819880485535, "epoch": 0.22707172471693665, "grad_norm": 0.15952467918395996, "learning_rate": 9.243413990860859e-05, "loss": 0.9058, "mean_token_accuracy": 0.7448797337710857, "num_tokens": 78761035.0, "step": 2468 }, { "entropy": 0.8652681820094585, "epoch": 0.22716373108837787, "grad_norm": 0.1550253927707672, "learning_rate": 9.243107308246695e-05, "loss": 0.8412, "mean_token_accuracy": 0.7564604356884956, "num_tokens": 78792274.0, "step": 2469 }, { "entropy": 0.7865561619400978, "epoch": 0.22725573745981908, "grad_norm": 0.1493394523859024, "learning_rate": 9.242800625632532e-05, "loss": 0.7794, "mean_token_accuracy": 0.7772038020193577, "num_tokens": 78824661.0, "step": 2470 }, { "entropy": 0.8972028810530901, "epoch": 0.2273477438312603, "grad_norm": 0.16011594235897064, "learning_rate": 9.24249394301837e-05, "loss": 0.8896, "mean_token_accuracy": 0.7418696284294128, "num_tokens": 78856461.0, "step": 2471 }, { "entropy": 0.9128634110093117, "epoch": 0.22743975020270155, "grad_norm": 0.16525974869728088, "learning_rate": 9.242187260404209e-05, "loss": 0.9069, "mean_token_accuracy": 0.7362042888998985, "num_tokens": 78887496.0, "step": 2472 }, { "entropy": 0.8340515121817589, "epoch": 0.22753175657414276, "grad_norm": 0.15634284913539886, "learning_rate": 9.241880577790045e-05, "loss": 0.8536, "mean_token_accuracy": 0.7561912760138512, "num_tokens": 78920017.0, "step": 2473 }, { "entropy": 0.8489092029631138, "epoch": 0.22762376294558398, "grad_norm": 0.16486378014087677, "learning_rate": 9.241573895175883e-05, "loss": 0.864, "mean_token_accuracy": 0.756095115095377, "num_tokens": 78951794.0, "step": 2474 }, { "entropy": 0.8770532496273518, "epoch": 0.2277157693170252, "grad_norm": 0.1694047898054123, "learning_rate": 9.24126721256172e-05, "loss": 0.9075, "mean_token_accuracy": 0.744628768414259, "num_tokens": 78983740.0, "step": 2475 }, { "entropy": 0.803309004753828, "epoch": 0.2278077756884664, "grad_norm": 0.15158061683177948, "learning_rate": 9.240960529947557e-05, "loss": 0.7867, "mean_token_accuracy": 0.7692741863429546, "num_tokens": 79015576.0, "step": 2476 }, { "entropy": 0.90396523848176, "epoch": 0.22789978205990766, "grad_norm": 0.16083337366580963, "learning_rate": 9.240653847333395e-05, "loss": 0.9069, "mean_token_accuracy": 0.7445638254284859, "num_tokens": 79047425.0, "step": 2477 }, { "entropy": 0.8284633606672287, "epoch": 0.22799178843134887, "grad_norm": 0.15636740624904633, "learning_rate": 9.240347164719233e-05, "loss": 0.8248, "mean_token_accuracy": 0.7598037160933018, "num_tokens": 79079105.0, "step": 2478 }, { "entropy": 0.9754172451794147, "epoch": 0.2280837948027901, "grad_norm": 0.162236750125885, "learning_rate": 9.24004048210507e-05, "loss": 0.9703, "mean_token_accuracy": 0.7263271249830723, "num_tokens": 79110929.0, "step": 2479 }, { "entropy": 0.8830737844109535, "epoch": 0.2281758011742313, "grad_norm": 0.15795715153217316, "learning_rate": 9.239733799490907e-05, "loss": 0.8847, "mean_token_accuracy": 0.7462239935994148, "num_tokens": 79142481.0, "step": 2480 }, { "entropy": 0.7978446967899799, "epoch": 0.22826780754567252, "grad_norm": 0.1544060856103897, "learning_rate": 9.239427116876744e-05, "loss": 0.7808, "mean_token_accuracy": 0.7706020884215832, "num_tokens": 79174093.0, "step": 2481 }, { "entropy": 0.8742479588836432, "epoch": 0.22835981391711377, "grad_norm": 0.1600320041179657, "learning_rate": 9.239120434262583e-05, "loss": 0.8816, "mean_token_accuracy": 0.7478441186249256, "num_tokens": 79206326.0, "step": 2482 }, { "entropy": 0.8318744078278542, "epoch": 0.22845182028855499, "grad_norm": 0.15514682233333588, "learning_rate": 9.23881375164842e-05, "loss": 0.8251, "mean_token_accuracy": 0.7598628960549831, "num_tokens": 79238651.0, "step": 2483 }, { "entropy": 0.8361840508878231, "epoch": 0.2285438266599962, "grad_norm": 0.1559528261423111, "learning_rate": 9.238507069034257e-05, "loss": 0.8412, "mean_token_accuracy": 0.7646263167262077, "num_tokens": 79270857.0, "step": 2484 }, { "entropy": 0.8149983789771795, "epoch": 0.22863583303143742, "grad_norm": 0.1584150344133377, "learning_rate": 9.238200386420094e-05, "loss": 0.8136, "mean_token_accuracy": 0.7631149366497993, "num_tokens": 79302999.0, "step": 2485 }, { "entropy": 0.7527251671999693, "epoch": 0.22872783940287866, "grad_norm": 0.15379489958286285, "learning_rate": 9.237893703805932e-05, "loss": 0.7367, "mean_token_accuracy": 0.7819862738251686, "num_tokens": 79335013.0, "step": 2486 }, { "entropy": 0.7787428051233292, "epoch": 0.22881984577431988, "grad_norm": 0.15137594938278198, "learning_rate": 9.23758702119177e-05, "loss": 0.7838, "mean_token_accuracy": 0.7732568792998791, "num_tokens": 79367451.0, "step": 2487 }, { "entropy": 0.7821936253458261, "epoch": 0.2289118521457611, "grad_norm": 0.1501394510269165, "learning_rate": 9.237280338577607e-05, "loss": 0.7804, "mean_token_accuracy": 0.776105273514986, "num_tokens": 79400219.0, "step": 2488 }, { "entropy": 0.8999012522399426, "epoch": 0.2290038585172023, "grad_norm": 0.15447062253952026, "learning_rate": 9.236973655963443e-05, "loss": 0.8979, "mean_token_accuracy": 0.7430298142135143, "num_tokens": 79431959.0, "step": 2489 }, { "entropy": 0.6989663504064083, "epoch": 0.22909586488864353, "grad_norm": 0.15910224616527557, "learning_rate": 9.236666973349282e-05, "loss": 0.7178, "mean_token_accuracy": 0.7912697903811932, "num_tokens": 79463770.0, "step": 2490 }, { "entropy": 0.8400491774082184, "epoch": 0.22918787126008477, "grad_norm": 0.1551157534122467, "learning_rate": 9.236360290735118e-05, "loss": 0.8357, "mean_token_accuracy": 0.7566493302583694, "num_tokens": 79495283.0, "step": 2491 }, { "entropy": 0.7601612824946642, "epoch": 0.229279877631526, "grad_norm": 0.16099302470684052, "learning_rate": 9.236053608120956e-05, "loss": 0.7667, "mean_token_accuracy": 0.7821105308830738, "num_tokens": 79526713.0, "step": 2492 }, { "entropy": 0.8660247027873993, "epoch": 0.2293718840029672, "grad_norm": 0.1597335934638977, "learning_rate": 9.235746925506793e-05, "loss": 0.8654, "mean_token_accuracy": 0.7495826557278633, "num_tokens": 79557610.0, "step": 2493 }, { "entropy": 0.7299485690891743, "epoch": 0.22946389037440842, "grad_norm": 0.14454710483551025, "learning_rate": 9.235440242892631e-05, "loss": 0.7172, "mean_token_accuracy": 0.7882722690701485, "num_tokens": 79590237.0, "step": 2494 }, { "entropy": 0.8973509669303894, "epoch": 0.22955589674584964, "grad_norm": 0.15999411046504974, "learning_rate": 9.235133560278468e-05, "loss": 0.8687, "mean_token_accuracy": 0.7505846209824085, "num_tokens": 79621797.0, "step": 2495 }, { "entropy": 0.8143093269318342, "epoch": 0.22964790311729089, "grad_norm": 0.15850117802619934, "learning_rate": 9.234826877664305e-05, "loss": 0.8136, "mean_token_accuracy": 0.7664641477167606, "num_tokens": 79653187.0, "step": 2496 }, { "entropy": 0.8050228506326675, "epoch": 0.2297399094887321, "grad_norm": 0.15886326134204865, "learning_rate": 9.234520195050143e-05, "loss": 0.804, "mean_token_accuracy": 0.7693191803991795, "num_tokens": 79684833.0, "step": 2497 }, { "entropy": 0.80837925337255, "epoch": 0.22983191586017332, "grad_norm": 0.1535378098487854, "learning_rate": 9.234213512435981e-05, "loss": 0.7974, "mean_token_accuracy": 0.7678496167063713, "num_tokens": 79716080.0, "step": 2498 }, { "entropy": 0.9095266684889793, "epoch": 0.22992392223161454, "grad_norm": 0.15854083001613617, "learning_rate": 9.233906829821818e-05, "loss": 0.9052, "mean_token_accuracy": 0.7428521439433098, "num_tokens": 79748342.0, "step": 2499 }, { "entropy": 0.9581333994865417, "epoch": 0.23001592860305575, "grad_norm": 0.16949696838855743, "learning_rate": 9.233600147207655e-05, "loss": 0.9494, "mean_token_accuracy": 0.7323674149811268, "num_tokens": 79780019.0, "step": 2500 }, { "entropy": 0.8045859560370445, "epoch": 0.230107934974497, "grad_norm": 0.15763889253139496, "learning_rate": 9.233293464593492e-05, "loss": 0.8236, "mean_token_accuracy": 0.760025542229414, "num_tokens": 79812211.0, "step": 2501 }, { "entropy": 0.8573220185935497, "epoch": 0.2301999413459382, "grad_norm": 0.16080912947654724, "learning_rate": 9.23298678197933e-05, "loss": 0.8673, "mean_token_accuracy": 0.7516346983611584, "num_tokens": 79844339.0, "step": 2502 }, { "entropy": 0.9637106880545616, "epoch": 0.23029194771737943, "grad_norm": 0.16696980595588684, "learning_rate": 9.232680099365168e-05, "loss": 0.9785, "mean_token_accuracy": 0.7224063202738762, "num_tokens": 79875547.0, "step": 2503 }, { "entropy": 0.811622865498066, "epoch": 0.23038395408882065, "grad_norm": 0.16427794098854065, "learning_rate": 9.232373416751005e-05, "loss": 0.8138, "mean_token_accuracy": 0.7666120603680611, "num_tokens": 79906147.0, "step": 2504 }, { "entropy": 0.9101489596068859, "epoch": 0.23047596046026186, "grad_norm": 0.1709432154893875, "learning_rate": 9.232066734136843e-05, "loss": 0.9466, "mean_token_accuracy": 0.7294044233858585, "num_tokens": 79937569.0, "step": 2505 }, { "entropy": 0.7943923510611057, "epoch": 0.2305679668317031, "grad_norm": 0.14858651161193848, "learning_rate": 9.23176005152268e-05, "loss": 0.7764, "mean_token_accuracy": 0.7753700651228428, "num_tokens": 79969454.0, "step": 2506 }, { "entropy": 0.7729433737695217, "epoch": 0.23065997320314433, "grad_norm": 0.1531657576560974, "learning_rate": 9.231453368908516e-05, "loss": 0.7757, "mean_token_accuracy": 0.7733856774866581, "num_tokens": 80001640.0, "step": 2507 }, { "entropy": 0.7956862337887287, "epoch": 0.23075197957458554, "grad_norm": 0.15449833869934082, "learning_rate": 9.231146686294355e-05, "loss": 0.7943, "mean_token_accuracy": 0.7683672457933426, "num_tokens": 80033919.0, "step": 2508 }, { "entropy": 0.9615556672215462, "epoch": 0.23084398594602676, "grad_norm": 0.1633494645357132, "learning_rate": 9.230840003680193e-05, "loss": 0.9569, "mean_token_accuracy": 0.7262942269444466, "num_tokens": 80064906.0, "step": 2509 }, { "entropy": 0.9393433406949043, "epoch": 0.23093599231746798, "grad_norm": 0.16427870094776154, "learning_rate": 9.23053332106603e-05, "loss": 0.9211, "mean_token_accuracy": 0.738980770111084, "num_tokens": 80096292.0, "step": 2510 }, { "entropy": 0.8870411552488804, "epoch": 0.23102799868890922, "grad_norm": 0.1578657180070877, "learning_rate": 9.230226638451866e-05, "loss": 0.8542, "mean_token_accuracy": 0.7595647983253002, "num_tokens": 80128055.0, "step": 2511 }, { "entropy": 0.8638876006007195, "epoch": 0.23112000506035044, "grad_norm": 0.15666009485721588, "learning_rate": 9.229919955837703e-05, "loss": 0.8367, "mean_token_accuracy": 0.7591000124812126, "num_tokens": 80159705.0, "step": 2512 }, { "entropy": 0.8222678378224373, "epoch": 0.23121201143179165, "grad_norm": 0.15821228921413422, "learning_rate": 9.229613273223541e-05, "loss": 0.8111, "mean_token_accuracy": 0.7667393311858177, "num_tokens": 80192018.0, "step": 2513 }, { "entropy": 0.8936253190040588, "epoch": 0.23130401780323287, "grad_norm": 0.15716640651226044, "learning_rate": 9.22930659060938e-05, "loss": 0.8852, "mean_token_accuracy": 0.7489055246114731, "num_tokens": 80224677.0, "step": 2514 }, { "entropy": 0.7486544344574213, "epoch": 0.2313960241746741, "grad_norm": 0.1482313871383667, "learning_rate": 9.228999907995216e-05, "loss": 0.7439, "mean_token_accuracy": 0.7806867994368076, "num_tokens": 80257075.0, "step": 2515 }, { "entropy": 0.8682393841445446, "epoch": 0.23148803054611533, "grad_norm": 0.1623973250389099, "learning_rate": 9.228693225381053e-05, "loss": 0.8814, "mean_token_accuracy": 0.7479457445442677, "num_tokens": 80289653.0, "step": 2516 }, { "entropy": 0.8468379843980074, "epoch": 0.23158003691755655, "grad_norm": 0.1609487533569336, "learning_rate": 9.228386542766891e-05, "loss": 0.8595, "mean_token_accuracy": 0.7513856440782547, "num_tokens": 80321558.0, "step": 2517 }, { "entropy": 0.8939787559211254, "epoch": 0.23167204328899776, "grad_norm": 0.16471311450004578, "learning_rate": 9.228079860152729e-05, "loss": 0.9076, "mean_token_accuracy": 0.7450399287045002, "num_tokens": 80353986.0, "step": 2518 }, { "entropy": 0.8743475489318371, "epoch": 0.23176404966043898, "grad_norm": 0.196462020277977, "learning_rate": 9.227773177538566e-05, "loss": 0.8905, "mean_token_accuracy": 0.7494424320757389, "num_tokens": 80385871.0, "step": 2519 }, { "entropy": 0.9456807188689709, "epoch": 0.2318560560318802, "grad_norm": 0.16722087562084198, "learning_rate": 9.227466494924403e-05, "loss": 0.9627, "mean_token_accuracy": 0.7264143973588943, "num_tokens": 80417960.0, "step": 2520 }, { "entropy": 0.7453686948865652, "epoch": 0.23194806240332144, "grad_norm": 0.15357938408851624, "learning_rate": 9.227159812310241e-05, "loss": 0.7209, "mean_token_accuracy": 0.7960108853876591, "num_tokens": 80449853.0, "step": 2521 }, { "entropy": 0.8061575628817081, "epoch": 0.23204006877476266, "grad_norm": 0.1558542251586914, "learning_rate": 9.226853129696078e-05, "loss": 0.7994, "mean_token_accuracy": 0.7679300829768181, "num_tokens": 80481749.0, "step": 2522 }, { "entropy": 0.8440524339675903, "epoch": 0.23213207514620388, "grad_norm": 0.15763160586357117, "learning_rate": 9.226546447081916e-05, "loss": 0.8427, "mean_token_accuracy": 0.7584258764982224, "num_tokens": 80513433.0, "step": 2523 }, { "entropy": 0.7367973085492849, "epoch": 0.2322240815176451, "grad_norm": 0.16486576199531555, "learning_rate": 9.226239764467753e-05, "loss": 0.7298, "mean_token_accuracy": 0.7872848436236382, "num_tokens": 80545959.0, "step": 2524 }, { "entropy": 0.8292071986943483, "epoch": 0.2323160878890863, "grad_norm": 0.16341114044189453, "learning_rate": 9.225933081853591e-05, "loss": 0.8392, "mean_token_accuracy": 0.7631802335381508, "num_tokens": 80578350.0, "step": 2525 }, { "entropy": 0.8869740031659603, "epoch": 0.23240809426052755, "grad_norm": 0.16194956004619598, "learning_rate": 9.225626399239428e-05, "loss": 0.8752, "mean_token_accuracy": 0.7448191121220589, "num_tokens": 80609423.0, "step": 2526 }, { "entropy": 0.7774564307183027, "epoch": 0.23250010063196877, "grad_norm": 0.1541629582643509, "learning_rate": 9.225319716625264e-05, "loss": 0.7444, "mean_token_accuracy": 0.7826799228787422, "num_tokens": 80640458.0, "step": 2527 }, { "entropy": 0.8622760400176048, "epoch": 0.23259210700341, "grad_norm": 0.15932323038578033, "learning_rate": 9.225013034011102e-05, "loss": 0.8577, "mean_token_accuracy": 0.7569322325289249, "num_tokens": 80672704.0, "step": 2528 }, { "entropy": 0.7451208382844925, "epoch": 0.2326841133748512, "grad_norm": 0.15801464021205902, "learning_rate": 9.22470635139694e-05, "loss": 0.7431, "mean_token_accuracy": 0.7878801114857197, "num_tokens": 80704324.0, "step": 2529 }, { "entropy": 0.8890659436583519, "epoch": 0.23277611974629242, "grad_norm": 0.1617988646030426, "learning_rate": 9.224399668782777e-05, "loss": 0.8699, "mean_token_accuracy": 0.7458738535642624, "num_tokens": 80735628.0, "step": 2530 }, { "entropy": 0.8315621688961983, "epoch": 0.23286812611773366, "grad_norm": 0.15676869451999664, "learning_rate": 9.224092986168614e-05, "loss": 0.8286, "mean_token_accuracy": 0.7664830647408962, "num_tokens": 80767842.0, "step": 2531 }, { "entropy": 0.815943107008934, "epoch": 0.23296013248917488, "grad_norm": 0.15587301552295685, "learning_rate": 9.223786303554451e-05, "loss": 0.8397, "mean_token_accuracy": 0.7605793997645378, "num_tokens": 80800226.0, "step": 2532 }, { "entropy": 0.9080995880067348, "epoch": 0.2330521388606161, "grad_norm": 0.16237564384937286, "learning_rate": 9.223479620940289e-05, "loss": 0.905, "mean_token_accuracy": 0.7415450885891914, "num_tokens": 80831981.0, "step": 2533 }, { "entropy": 0.8357831444591284, "epoch": 0.23314414523205731, "grad_norm": 0.15790802240371704, "learning_rate": 9.223172938326127e-05, "loss": 0.8341, "mean_token_accuracy": 0.7609615251421928, "num_tokens": 80864258.0, "step": 2534 }, { "entropy": 0.8913528807461262, "epoch": 0.23323615160349853, "grad_norm": 0.16180554032325745, "learning_rate": 9.222866255711964e-05, "loss": 0.8751, "mean_token_accuracy": 0.7479887343943119, "num_tokens": 80895472.0, "step": 2535 }, { "entropy": 0.9673323556780815, "epoch": 0.23332815797493978, "grad_norm": 0.16437603533267975, "learning_rate": 9.222559573097802e-05, "loss": 0.9568, "mean_token_accuracy": 0.7330957390367985, "num_tokens": 80927081.0, "step": 2536 }, { "entropy": 0.8932473044842482, "epoch": 0.233420164346381, "grad_norm": 0.1582300364971161, "learning_rate": 9.222252890483639e-05, "loss": 0.8738, "mean_token_accuracy": 0.7499231658875942, "num_tokens": 80959254.0, "step": 2537 }, { "entropy": 0.7520085498690605, "epoch": 0.2335121707178222, "grad_norm": 0.15005959570407867, "learning_rate": 9.221946207869476e-05, "loss": 0.7511, "mean_token_accuracy": 0.7800732217729092, "num_tokens": 80991236.0, "step": 2538 }, { "entropy": 0.8357239179313183, "epoch": 0.23360417708926343, "grad_norm": 0.15609849989414215, "learning_rate": 9.221639525255314e-05, "loss": 0.8377, "mean_token_accuracy": 0.7572665959596634, "num_tokens": 81023621.0, "step": 2539 }, { "entropy": 0.8552778214216232, "epoch": 0.23369618346070464, "grad_norm": 0.1668003797531128, "learning_rate": 9.221332842641152e-05, "loss": 0.8706, "mean_token_accuracy": 0.7516941577196121, "num_tokens": 81054471.0, "step": 2540 }, { "entropy": 0.9160723946988583, "epoch": 0.2337881898321459, "grad_norm": 0.1661621630191803, "learning_rate": 9.221026160026989e-05, "loss": 0.907, "mean_token_accuracy": 0.740305420011282, "num_tokens": 81085585.0, "step": 2541 }, { "entropy": 0.8386390395462513, "epoch": 0.2338801962035871, "grad_norm": 0.16242480278015137, "learning_rate": 9.220719477412826e-05, "loss": 0.8089, "mean_token_accuracy": 0.7696345522999763, "num_tokens": 81116793.0, "step": 2542 }, { "entropy": 0.87186080776155, "epoch": 0.23397220257502832, "grad_norm": 0.16557569801807404, "learning_rate": 9.220412794798662e-05, "loss": 0.8617, "mean_token_accuracy": 0.7498132102191448, "num_tokens": 81148130.0, "step": 2543 }, { "entropy": 0.919548075646162, "epoch": 0.23406420894646954, "grad_norm": 0.16033175587654114, "learning_rate": 9.2201061121845e-05, "loss": 0.9288, "mean_token_accuracy": 0.7381046637892723, "num_tokens": 81180370.0, "step": 2544 }, { "entropy": 0.8280935920774937, "epoch": 0.23415621531791075, "grad_norm": 0.1578686535358429, "learning_rate": 9.219799429570339e-05, "loss": 0.8062, "mean_token_accuracy": 0.7656646408140659, "num_tokens": 81212160.0, "step": 2545 }, { "entropy": 0.7869646642357111, "epoch": 0.234248221689352, "grad_norm": 0.15341590344905853, "learning_rate": 9.219492746956175e-05, "loss": 0.7698, "mean_token_accuracy": 0.7751461490988731, "num_tokens": 81244552.0, "step": 2546 }, { "entropy": 0.8872454576194286, "epoch": 0.23434022806079322, "grad_norm": 0.15666957199573517, "learning_rate": 9.219186064342012e-05, "loss": 0.8933, "mean_token_accuracy": 0.7392182908952236, "num_tokens": 81276392.0, "step": 2547 }, { "entropy": 0.8826479315757751, "epoch": 0.23443223443223443, "grad_norm": 0.16041693091392517, "learning_rate": 9.21887938172785e-05, "loss": 0.8964, "mean_token_accuracy": 0.7451517283916473, "num_tokens": 81308627.0, "step": 2548 }, { "entropy": 0.8716130517423153, "epoch": 0.23452424080367565, "grad_norm": 0.16297611594200134, "learning_rate": 9.218572699113687e-05, "loss": 0.8824, "mean_token_accuracy": 0.7461328767240047, "num_tokens": 81340635.0, "step": 2549 }, { "entropy": 0.9350419417023659, "epoch": 0.23461624717511687, "grad_norm": 0.16306786239147186, "learning_rate": 9.218266016499525e-05, "loss": 0.9446, "mean_token_accuracy": 0.7289000004529953, "num_tokens": 81372692.0, "step": 2550 }, { "entropy": 0.7892696559429169, "epoch": 0.2347082535465581, "grad_norm": 0.15358473360538483, "learning_rate": 9.217959333885362e-05, "loss": 0.7878, "mean_token_accuracy": 0.7731362506747246, "num_tokens": 81404585.0, "step": 2551 }, { "entropy": 0.970940787345171, "epoch": 0.23480025991799933, "grad_norm": 0.15692253410816193, "learning_rate": 9.2176526512712e-05, "loss": 0.976, "mean_token_accuracy": 0.7214858792722225, "num_tokens": 81437136.0, "step": 2552 }, { "entropy": 0.9183036759495735, "epoch": 0.23489226628944054, "grad_norm": 0.15874366462230682, "learning_rate": 9.217345968657037e-05, "loss": 0.9011, "mean_token_accuracy": 0.7414589375257492, "num_tokens": 81469423.0, "step": 2553 }, { "entropy": 0.8160550743341446, "epoch": 0.23498427266088176, "grad_norm": 0.15266053378582, "learning_rate": 9.217039286042874e-05, "loss": 0.7689, "mean_token_accuracy": 0.7788615375757217, "num_tokens": 81501287.0, "step": 2554 }, { "entropy": 0.9356784634292126, "epoch": 0.23507627903232298, "grad_norm": 0.16570092737674713, "learning_rate": 9.216732603428712e-05, "loss": 0.9288, "mean_token_accuracy": 0.733412854373455, "num_tokens": 81532206.0, "step": 2555 }, { "entropy": 0.7410243358463049, "epoch": 0.23516828540376422, "grad_norm": 0.1479833573102951, "learning_rate": 9.21642592081455e-05, "loss": 0.7201, "mean_token_accuracy": 0.7879518754780293, "num_tokens": 81564974.0, "step": 2556 }, { "entropy": 0.947943814098835, "epoch": 0.23526029177520544, "grad_norm": 0.1581486612558365, "learning_rate": 9.216119238200387e-05, "loss": 0.9275, "mean_token_accuracy": 0.7373316399753094, "num_tokens": 81597111.0, "step": 2557 }, { "entropy": 0.8724577724933624, "epoch": 0.23535229814664665, "grad_norm": 0.15897764265537262, "learning_rate": 9.215812555586224e-05, "loss": 0.8761, "mean_token_accuracy": 0.7483564466238022, "num_tokens": 81629006.0, "step": 2558 }, { "entropy": 0.9332837536931038, "epoch": 0.23544430451808787, "grad_norm": 0.1694025844335556, "learning_rate": 9.21550587297206e-05, "loss": 0.9502, "mean_token_accuracy": 0.734094500541687, "num_tokens": 81661178.0, "step": 2559 }, { "entropy": 0.8224003836512566, "epoch": 0.2355363108895291, "grad_norm": 0.1574006825685501, "learning_rate": 9.2151991903579e-05, "loss": 0.815, "mean_token_accuracy": 0.7603223137557507, "num_tokens": 81692854.0, "step": 2560 }, { "entropy": 0.852325577288866, "epoch": 0.23562831726097033, "grad_norm": 0.16053256392478943, "learning_rate": 9.214892507743737e-05, "loss": 0.857, "mean_token_accuracy": 0.7526869662106037, "num_tokens": 81724837.0, "step": 2561 }, { "entropy": 0.8927282057702541, "epoch": 0.23572032363241155, "grad_norm": 0.17112049460411072, "learning_rate": 9.214585825129574e-05, "loss": 0.8998, "mean_token_accuracy": 0.747310109436512, "num_tokens": 81755583.0, "step": 2562 }, { "entropy": 0.9129526577889919, "epoch": 0.23581233000385277, "grad_norm": 0.16457533836364746, "learning_rate": 9.21427914251541e-05, "loss": 0.9135, "mean_token_accuracy": 0.7380050681531429, "num_tokens": 81787850.0, "step": 2563 }, { "entropy": 0.805546959862113, "epoch": 0.23590433637529398, "grad_norm": 0.1590842753648758, "learning_rate": 9.213972459901249e-05, "loss": 0.8048, "mean_token_accuracy": 0.7718872167170048, "num_tokens": 81819977.0, "step": 2564 }, { "entropy": 0.8548023030161858, "epoch": 0.2359963427467352, "grad_norm": 0.1820479929447174, "learning_rate": 9.213665777287087e-05, "loss": 0.9078, "mean_token_accuracy": 0.749085821211338, "num_tokens": 81851428.0, "step": 2565 }, { "entropy": 0.8179223611950874, "epoch": 0.23608834911817644, "grad_norm": 0.16495129466056824, "learning_rate": 9.213359094672923e-05, "loss": 0.8191, "mean_token_accuracy": 0.7651279419660568, "num_tokens": 81883258.0, "step": 2566 }, { "entropy": 0.9383137710392475, "epoch": 0.23618035548961766, "grad_norm": 0.16602875292301178, "learning_rate": 9.213052412058762e-05, "loss": 0.9703, "mean_token_accuracy": 0.72605886682868, "num_tokens": 81915384.0, "step": 2567 }, { "entropy": 0.8610228858888149, "epoch": 0.23627236186105888, "grad_norm": 0.1534270942211151, "learning_rate": 9.212745729444598e-05, "loss": 0.8373, "mean_token_accuracy": 0.7573888599872589, "num_tokens": 81948152.0, "step": 2568 }, { "entropy": 0.8139781281352043, "epoch": 0.2363643682325001, "grad_norm": 0.15549415349960327, "learning_rate": 9.212439046830435e-05, "loss": 0.8038, "mean_token_accuracy": 0.771694865077734, "num_tokens": 81980149.0, "step": 2569 }, { "entropy": 0.8569931909441948, "epoch": 0.2364563746039413, "grad_norm": 0.16208238899707794, "learning_rate": 9.212132364216273e-05, "loss": 0.8288, "mean_token_accuracy": 0.7669320553541183, "num_tokens": 82011646.0, "step": 2570 }, { "entropy": 0.9148797579109669, "epoch": 0.23654838097538256, "grad_norm": 0.16228866577148438, "learning_rate": 9.211825681602111e-05, "loss": 0.8842, "mean_token_accuracy": 0.7461399398744106, "num_tokens": 82043787.0, "step": 2571 }, { "entropy": 0.9074675999581814, "epoch": 0.23664038734682377, "grad_norm": 0.1614610254764557, "learning_rate": 9.211518998987948e-05, "loss": 0.8845, "mean_token_accuracy": 0.7449966222047806, "num_tokens": 82074095.0, "step": 2572 }, { "entropy": 0.8896848931908607, "epoch": 0.236732393718265, "grad_norm": 0.16316324472427368, "learning_rate": 9.211212316373785e-05, "loss": 0.8743, "mean_token_accuracy": 0.7568037584424019, "num_tokens": 82106285.0, "step": 2573 }, { "entropy": 0.8505956493318081, "epoch": 0.2368244000897062, "grad_norm": 0.15263493359088898, "learning_rate": 9.210905633759622e-05, "loss": 0.8526, "mean_token_accuracy": 0.7493925057351589, "num_tokens": 82137884.0, "step": 2574 }, { "entropy": 0.8491203337907791, "epoch": 0.23691640646114742, "grad_norm": 0.16360679268836975, "learning_rate": 9.21059895114546e-05, "loss": 0.8503, "mean_token_accuracy": 0.7544326186180115, "num_tokens": 82170428.0, "step": 2575 }, { "entropy": 0.8997663520276546, "epoch": 0.23700841283258867, "grad_norm": 0.16809675097465515, "learning_rate": 9.210292268531298e-05, "loss": 0.8893, "mean_token_accuracy": 0.745012391358614, "num_tokens": 82201988.0, "step": 2576 }, { "entropy": 0.7367682419717312, "epoch": 0.23710041920402988, "grad_norm": 0.16096584498882294, "learning_rate": 9.209985585917135e-05, "loss": 0.7524, "mean_token_accuracy": 0.7816621884703636, "num_tokens": 82234756.0, "step": 2577 }, { "entropy": 0.932623352855444, "epoch": 0.2371924255754711, "grad_norm": 0.16637244820594788, "learning_rate": 9.209678903302972e-05, "loss": 0.9362, "mean_token_accuracy": 0.7314806766808033, "num_tokens": 82265461.0, "step": 2578 }, { "entropy": 0.7842476572841406, "epoch": 0.23728443194691232, "grad_norm": 0.16584260761737823, "learning_rate": 9.20937222068881e-05, "loss": 0.7983, "mean_token_accuracy": 0.7735977880656719, "num_tokens": 82297510.0, "step": 2579 }, { "entropy": 0.8925691936165094, "epoch": 0.23737643831835353, "grad_norm": 0.16861438751220703, "learning_rate": 9.209065538074647e-05, "loss": 0.8947, "mean_token_accuracy": 0.7467829175293446, "num_tokens": 82328877.0, "step": 2580 }, { "entropy": 0.7898526359349489, "epoch": 0.23746844468979478, "grad_norm": 0.15126992762088776, "learning_rate": 9.208758855460485e-05, "loss": 0.7654, "mean_token_accuracy": 0.776801835745573, "num_tokens": 82360204.0, "step": 2581 }, { "entropy": 0.8951155059039593, "epoch": 0.237560451061236, "grad_norm": 0.1577247530221939, "learning_rate": 9.208452172846322e-05, "loss": 0.8759, "mean_token_accuracy": 0.747950479388237, "num_tokens": 82392224.0, "step": 2582 }, { "entropy": 0.773871161043644, "epoch": 0.2376524574326772, "grad_norm": 0.15025973320007324, "learning_rate": 9.20814549023216e-05, "loss": 0.7613, "mean_token_accuracy": 0.7803023681044579, "num_tokens": 82424501.0, "step": 2583 }, { "entropy": 0.8289970904588699, "epoch": 0.23774446380411843, "grad_norm": 0.15839435160160065, "learning_rate": 9.207838807617996e-05, "loss": 0.8487, "mean_token_accuracy": 0.7609178349375725, "num_tokens": 82456287.0, "step": 2584 }, { "entropy": 0.8128178790211678, "epoch": 0.23783647017555964, "grad_norm": 0.15599201619625092, "learning_rate": 9.207532125003833e-05, "loss": 0.8145, "mean_token_accuracy": 0.7643807418644428, "num_tokens": 82488032.0, "step": 2585 }, { "entropy": 0.7721768952906132, "epoch": 0.2379284765470009, "grad_norm": 0.15190310776233673, "learning_rate": 9.207225442389671e-05, "loss": 0.7587, "mean_token_accuracy": 0.7803276404738426, "num_tokens": 82520215.0, "step": 2586 }, { "entropy": 0.8277981504797935, "epoch": 0.2380204829184421, "grad_norm": 0.15725043416023254, "learning_rate": 9.20691875977551e-05, "loss": 0.8232, "mean_token_accuracy": 0.763704463839531, "num_tokens": 82552248.0, "step": 2587 }, { "entropy": 0.9363185465335846, "epoch": 0.23811248928988332, "grad_norm": 0.16090142726898193, "learning_rate": 9.206612077161346e-05, "loss": 0.9481, "mean_token_accuracy": 0.7324553467333317, "num_tokens": 82584464.0, "step": 2588 }, { "entropy": 0.8762231264263391, "epoch": 0.23820449566132454, "grad_norm": 0.15529441833496094, "learning_rate": 9.206305394547183e-05, "loss": 0.8843, "mean_token_accuracy": 0.7425314970314503, "num_tokens": 82615614.0, "step": 2589 }, { "entropy": 0.8855576477944851, "epoch": 0.23829650203276576, "grad_norm": 0.15841518342494965, "learning_rate": 9.20599871193302e-05, "loss": 0.8907, "mean_token_accuracy": 0.74138443171978, "num_tokens": 82647220.0, "step": 2590 }, { "entropy": 0.8239800482988358, "epoch": 0.238388508404207, "grad_norm": 0.15593115985393524, "learning_rate": 9.205692029318858e-05, "loss": 0.8139, "mean_token_accuracy": 0.7625427469611168, "num_tokens": 82679644.0, "step": 2591 }, { "entropy": 0.8964928910136223, "epoch": 0.23848051477564822, "grad_norm": 0.15964682400226593, "learning_rate": 9.205385346704696e-05, "loss": 0.8927, "mean_token_accuracy": 0.7472539842128754, "num_tokens": 82712208.0, "step": 2592 }, { "entropy": 0.9038722440600395, "epoch": 0.23857252114708943, "grad_norm": 0.1596638709306717, "learning_rate": 9.205078664090533e-05, "loss": 0.8964, "mean_token_accuracy": 0.751713864505291, "num_tokens": 82744118.0, "step": 2593 }, { "entropy": 0.9071976915001869, "epoch": 0.23866452751853065, "grad_norm": 0.15747584402561188, "learning_rate": 9.204771981476371e-05, "loss": 0.891, "mean_token_accuracy": 0.7439255230128765, "num_tokens": 82776142.0, "step": 2594 }, { "entropy": 0.8433008193969727, "epoch": 0.23875653388997187, "grad_norm": 0.15473048388957977, "learning_rate": 9.204465298862208e-05, "loss": 0.8263, "mean_token_accuracy": 0.7658606506884098, "num_tokens": 82807770.0, "step": 2595 }, { "entropy": 0.863341148942709, "epoch": 0.2388485402614131, "grad_norm": 0.16441629827022552, "learning_rate": 9.204158616248045e-05, "loss": 0.8523, "mean_token_accuracy": 0.7584327273070812, "num_tokens": 82839713.0, "step": 2596 }, { "entropy": 0.7978395354002714, "epoch": 0.23894054663285433, "grad_norm": 0.15780846774578094, "learning_rate": 9.203851933633883e-05, "loss": 0.7875, "mean_token_accuracy": 0.7738268673419952, "num_tokens": 82872152.0, "step": 2597 }, { "entropy": 0.8866297453641891, "epoch": 0.23903255300429554, "grad_norm": 0.15875214338302612, "learning_rate": 9.203545251019721e-05, "loss": 0.8871, "mean_token_accuracy": 0.746501337736845, "num_tokens": 82903483.0, "step": 2598 }, { "entropy": 0.8927215989679098, "epoch": 0.23912455937573676, "grad_norm": 0.15952229499816895, "learning_rate": 9.203238568405558e-05, "loss": 0.9062, "mean_token_accuracy": 0.7440187446773052, "num_tokens": 82935338.0, "step": 2599 }, { "entropy": 0.916540153324604, "epoch": 0.23921656574717798, "grad_norm": 0.16096587479114532, "learning_rate": 9.202931885791395e-05, "loss": 0.9103, "mean_token_accuracy": 0.7415629252791405, "num_tokens": 82966394.0, "step": 2600 }, { "entropy": 0.9564827792346478, "epoch": 0.23930857211861922, "grad_norm": 0.1726701557636261, "learning_rate": 9.202625203177231e-05, "loss": 0.9624, "mean_token_accuracy": 0.7274199016392231, "num_tokens": 82998724.0, "step": 2601 }, { "entropy": 0.8868421614170074, "epoch": 0.23940057849006044, "grad_norm": 0.15924468636512756, "learning_rate": 9.202318520563071e-05, "loss": 0.8755, "mean_token_accuracy": 0.7485526874661446, "num_tokens": 83030381.0, "step": 2602 }, { "entropy": 0.8591272067278624, "epoch": 0.23949258486150166, "grad_norm": 0.1602860540151596, "learning_rate": 9.202011837948908e-05, "loss": 0.8572, "mean_token_accuracy": 0.755849078297615, "num_tokens": 83062356.0, "step": 2603 }, { "entropy": 0.7795567288994789, "epoch": 0.23958459123294287, "grad_norm": 0.15206968784332275, "learning_rate": 9.201705155334744e-05, "loss": 0.7886, "mean_token_accuracy": 0.7734497338533401, "num_tokens": 83094255.0, "step": 2604 }, { "entropy": 0.8585075736045837, "epoch": 0.23967659760438412, "grad_norm": 0.16777963936328888, "learning_rate": 9.201398472720581e-05, "loss": 0.8888, "mean_token_accuracy": 0.7429855316877365, "num_tokens": 83125823.0, "step": 2605 }, { "entropy": 0.8301791995763779, "epoch": 0.23976860397582533, "grad_norm": 0.16642363369464874, "learning_rate": 9.201091790106419e-05, "loss": 0.8426, "mean_token_accuracy": 0.7573317922651768, "num_tokens": 83157752.0, "step": 2606 }, { "entropy": 0.8126261327415705, "epoch": 0.23986061034726655, "grad_norm": 0.15265722572803497, "learning_rate": 9.200785107492257e-05, "loss": 0.8093, "mean_token_accuracy": 0.7658283673226833, "num_tokens": 83190357.0, "step": 2607 }, { "entropy": 0.8466899078339338, "epoch": 0.23995261671870777, "grad_norm": 0.15767191350460052, "learning_rate": 9.200478424878094e-05, "loss": 0.8652, "mean_token_accuracy": 0.7502413056790829, "num_tokens": 83222736.0, "step": 2608 }, { "entropy": 0.8593747317790985, "epoch": 0.24004462309014898, "grad_norm": 0.15638549625873566, "learning_rate": 9.200171742263931e-05, "loss": 0.8276, "mean_token_accuracy": 0.7605813257396221, "num_tokens": 83253962.0, "step": 2609 }, { "entropy": 0.8759680725634098, "epoch": 0.24013662946159023, "grad_norm": 0.15610621869564056, "learning_rate": 9.199865059649769e-05, "loss": 0.87, "mean_token_accuracy": 0.7533559687435627, "num_tokens": 83285365.0, "step": 2610 }, { "entropy": 0.8550430163741112, "epoch": 0.24022863583303145, "grad_norm": 0.15408548712730408, "learning_rate": 9.199558377035606e-05, "loss": 0.8358, "mean_token_accuracy": 0.7593735866248608, "num_tokens": 83317088.0, "step": 2611 }, { "entropy": 0.8566286116838455, "epoch": 0.24032064220447266, "grad_norm": 0.15875552594661713, "learning_rate": 9.199251694421444e-05, "loss": 0.8365, "mean_token_accuracy": 0.7593943551182747, "num_tokens": 83348565.0, "step": 2612 }, { "entropy": 0.8715252727270126, "epoch": 0.24041264857591388, "grad_norm": 0.15688177943229675, "learning_rate": 9.198945011807281e-05, "loss": 0.8596, "mean_token_accuracy": 0.7547856643795967, "num_tokens": 83380388.0, "step": 2613 }, { "entropy": 0.7947793640196323, "epoch": 0.2405046549473551, "grad_norm": 0.15236447751522064, "learning_rate": 9.198638329193119e-05, "loss": 0.7808, "mean_token_accuracy": 0.7689564675092697, "num_tokens": 83412866.0, "step": 2614 }, { "entropy": 0.8756981119513512, "epoch": 0.24059666131879634, "grad_norm": 0.1606808602809906, "learning_rate": 9.198331646578956e-05, "loss": 0.8887, "mean_token_accuracy": 0.7483172044157982, "num_tokens": 83445023.0, "step": 2615 }, { "entropy": 0.7876863349229097, "epoch": 0.24068866769023756, "grad_norm": 0.15449967980384827, "learning_rate": 9.198024963964793e-05, "loss": 0.7756, "mean_token_accuracy": 0.772075679153204, "num_tokens": 83476743.0, "step": 2616 }, { "entropy": 0.820978781208396, "epoch": 0.24078067406167877, "grad_norm": 0.15552756190299988, "learning_rate": 9.197718281350631e-05, "loss": 0.8361, "mean_token_accuracy": 0.7619118988513947, "num_tokens": 83509011.0, "step": 2617 }, { "entropy": 0.886098101735115, "epoch": 0.24087268043312, "grad_norm": 0.1572766751050949, "learning_rate": 9.197411598736469e-05, "loss": 0.8783, "mean_token_accuracy": 0.7465294003486633, "num_tokens": 83540633.0, "step": 2618 }, { "entropy": 0.890236135572195, "epoch": 0.2409646868045612, "grad_norm": 0.15602342784404755, "learning_rate": 9.197104916122306e-05, "loss": 0.8864, "mean_token_accuracy": 0.7426219657063484, "num_tokens": 83573174.0, "step": 2619 }, { "entropy": 0.8652410339564085, "epoch": 0.24105669317600245, "grad_norm": 0.15635810792446136, "learning_rate": 9.196798233508142e-05, "loss": 0.8551, "mean_token_accuracy": 0.7552597634494305, "num_tokens": 83605527.0, "step": 2620 }, { "entropy": 0.9144003298133612, "epoch": 0.24114869954744367, "grad_norm": 0.16452771425247192, "learning_rate": 9.196491550893979e-05, "loss": 0.916, "mean_token_accuracy": 0.7344015017151833, "num_tokens": 83636086.0, "step": 2621 }, { "entropy": 0.8384215757250786, "epoch": 0.24124070591888488, "grad_norm": 0.15686078369617462, "learning_rate": 9.196184868279817e-05, "loss": 0.8452, "mean_token_accuracy": 0.7584632374346256, "num_tokens": 83667763.0, "step": 2622 }, { "entropy": 0.8894981704652309, "epoch": 0.2413327122903261, "grad_norm": 0.1682279109954834, "learning_rate": 9.195878185665656e-05, "loss": 0.9143, "mean_token_accuracy": 0.7388463541865349, "num_tokens": 83699157.0, "step": 2623 }, { "entropy": 0.7924075946211815, "epoch": 0.24142471866176732, "grad_norm": 0.16573230922222137, "learning_rate": 9.195571503051492e-05, "loss": 0.7927, "mean_token_accuracy": 0.769513163715601, "num_tokens": 83731605.0, "step": 2624 }, { "entropy": 0.886124424636364, "epoch": 0.24151672503320856, "grad_norm": 0.16257694363594055, "learning_rate": 9.19526482043733e-05, "loss": 0.8837, "mean_token_accuracy": 0.7484662346541882, "num_tokens": 83763623.0, "step": 2625 }, { "entropy": 0.7490490674972534, "epoch": 0.24160873140464978, "grad_norm": 0.15446971356868744, "learning_rate": 9.194958137823167e-05, "loss": 0.7194, "mean_token_accuracy": 0.7878251112997532, "num_tokens": 83794907.0, "step": 2626 }, { "entropy": 0.8329783119261265, "epoch": 0.241700737776091, "grad_norm": 0.157354474067688, "learning_rate": 9.194651455209004e-05, "loss": 0.8399, "mean_token_accuracy": 0.7608885243535042, "num_tokens": 83827157.0, "step": 2627 }, { "entropy": 0.8635793663561344, "epoch": 0.2417927441475322, "grad_norm": 0.1505056470632553, "learning_rate": 9.194344772594842e-05, "loss": 0.8504, "mean_token_accuracy": 0.7575216144323349, "num_tokens": 83859264.0, "step": 2628 }, { "entropy": 0.8226618655025959, "epoch": 0.24188475051897343, "grad_norm": 0.15357916057109833, "learning_rate": 9.19403808998068e-05, "loss": 0.8113, "mean_token_accuracy": 0.7639116980135441, "num_tokens": 83891362.0, "step": 2629 }, { "entropy": 0.7985224332660437, "epoch": 0.24197675689041467, "grad_norm": 0.15304464101791382, "learning_rate": 9.193731407366517e-05, "loss": 0.7773, "mean_token_accuracy": 0.7748107723891735, "num_tokens": 83924037.0, "step": 2630 }, { "entropy": 0.8947369679808617, "epoch": 0.2420687632618559, "grad_norm": 0.15743331611156464, "learning_rate": 9.193424724752354e-05, "loss": 0.8879, "mean_token_accuracy": 0.7442633658647537, "num_tokens": 83956611.0, "step": 2631 }, { "entropy": 0.9805807694792747, "epoch": 0.2421607696332971, "grad_norm": 0.16460411250591278, "learning_rate": 9.193118042138191e-05, "loss": 0.9964, "mean_token_accuracy": 0.7210050635039806, "num_tokens": 83988339.0, "step": 2632 }, { "entropy": 0.8933026194572449, "epoch": 0.24225277600473832, "grad_norm": 0.16105754673480988, "learning_rate": 9.192811359524029e-05, "loss": 0.881, "mean_token_accuracy": 0.7452365085482597, "num_tokens": 84020021.0, "step": 2633 }, { "entropy": 0.7299044094979763, "epoch": 0.24234478237617954, "grad_norm": 0.15028993785381317, "learning_rate": 9.192504676909867e-05, "loss": 0.7228, "mean_token_accuracy": 0.7889002077281475, "num_tokens": 84051860.0, "step": 2634 }, { "entropy": 0.8793946988880634, "epoch": 0.24243678874762079, "grad_norm": 0.15434150397777557, "learning_rate": 9.192197994295704e-05, "loss": 0.8738, "mean_token_accuracy": 0.7490848749876022, "num_tokens": 84083666.0, "step": 2635 }, { "entropy": 0.8807572089135647, "epoch": 0.242528795119062, "grad_norm": 0.16311722993850708, "learning_rate": 9.19189131168154e-05, "loss": 0.9015, "mean_token_accuracy": 0.7450370416045189, "num_tokens": 84115538.0, "step": 2636 }, { "entropy": 0.8927312400192022, "epoch": 0.24262080149050322, "grad_norm": 0.16344571113586426, "learning_rate": 9.191584629067379e-05, "loss": 0.8941, "mean_token_accuracy": 0.7414200603961945, "num_tokens": 84146747.0, "step": 2637 }, { "entropy": 0.8171936497092247, "epoch": 0.24271280786194444, "grad_norm": 0.15994304418563843, "learning_rate": 9.191277946453217e-05, "loss": 0.8354, "mean_token_accuracy": 0.7618621848523617, "num_tokens": 84179047.0, "step": 2638 }, { "entropy": 0.865275664255023, "epoch": 0.24280481423338565, "grad_norm": 0.1583852618932724, "learning_rate": 9.190971263839054e-05, "loss": 0.8557, "mean_token_accuracy": 0.7538484781980515, "num_tokens": 84211620.0, "step": 2639 }, { "entropy": 0.8012575134634972, "epoch": 0.2428968206048269, "grad_norm": 0.15329203009605408, "learning_rate": 9.19066458122489e-05, "loss": 0.7942, "mean_token_accuracy": 0.7706322707235813, "num_tokens": 84243999.0, "step": 2640 }, { "entropy": 0.8636590801179409, "epoch": 0.2429888269762681, "grad_norm": 0.16565915942192078, "learning_rate": 9.190357898610729e-05, "loss": 0.8675, "mean_token_accuracy": 0.7586712315678596, "num_tokens": 84276767.0, "step": 2641 }, { "entropy": 0.8549296520650387, "epoch": 0.24308083334770933, "grad_norm": 0.15834064781665802, "learning_rate": 9.190051215996565e-05, "loss": 0.855, "mean_token_accuracy": 0.7535001114010811, "num_tokens": 84308903.0, "step": 2642 }, { "entropy": 0.8865865804255009, "epoch": 0.24317283971915055, "grad_norm": 0.16084182262420654, "learning_rate": 9.189744533382403e-05, "loss": 0.8803, "mean_token_accuracy": 0.7461336590349674, "num_tokens": 84340211.0, "step": 2643 }, { "entropy": 0.9162241593003273, "epoch": 0.24326484609059176, "grad_norm": 0.16639840602874756, "learning_rate": 9.18943785076824e-05, "loss": 0.9025, "mean_token_accuracy": 0.7407877035439014, "num_tokens": 84371890.0, "step": 2644 }, { "entropy": 0.9462048560380936, "epoch": 0.243356852462033, "grad_norm": 0.16633178293704987, "learning_rate": 9.189131168154078e-05, "loss": 0.9524, "mean_token_accuracy": 0.7309900298714638, "num_tokens": 84404164.0, "step": 2645 }, { "entropy": 0.9063115231692791, "epoch": 0.24344885883347422, "grad_norm": 0.15918679535388947, "learning_rate": 9.188824485539915e-05, "loss": 0.8938, "mean_token_accuracy": 0.7438768744468689, "num_tokens": 84435801.0, "step": 2646 }, { "entropy": 0.9691201839596033, "epoch": 0.24354086520491544, "grad_norm": 0.16625137627124786, "learning_rate": 9.188517802925752e-05, "loss": 0.956, "mean_token_accuracy": 0.7303054220974445, "num_tokens": 84467645.0, "step": 2647 }, { "entropy": 0.9383071009069681, "epoch": 0.24363287157635666, "grad_norm": 0.16714230179786682, "learning_rate": 9.18821112031159e-05, "loss": 0.9549, "mean_token_accuracy": 0.7278607599437237, "num_tokens": 84499996.0, "step": 2648 }, { "entropy": 0.8844608552753925, "epoch": 0.24372487794779787, "grad_norm": 0.15624892711639404, "learning_rate": 9.187904437697428e-05, "loss": 0.8658, "mean_token_accuracy": 0.7515738792717457, "num_tokens": 84532268.0, "step": 2649 }, { "entropy": 0.8463068790733814, "epoch": 0.24381688431923912, "grad_norm": 0.16070342063903809, "learning_rate": 9.187597755083265e-05, "loss": 0.8443, "mean_token_accuracy": 0.7610120140016079, "num_tokens": 84564612.0, "step": 2650 }, { "entropy": 0.7967936377972364, "epoch": 0.24390889069068034, "grad_norm": 0.15075263381004333, "learning_rate": 9.187291072469102e-05, "loss": 0.7572, "mean_token_accuracy": 0.7795910462737083, "num_tokens": 84596153.0, "step": 2651 }, { "entropy": 0.8193823955953121, "epoch": 0.24400089706212155, "grad_norm": 0.1579352170228958, "learning_rate": 9.186984389854939e-05, "loss": 0.8095, "mean_token_accuracy": 0.7679202929139137, "num_tokens": 84627981.0, "step": 2652 }, { "entropy": 0.8315005972981453, "epoch": 0.24409290343356277, "grad_norm": 0.1610858142375946, "learning_rate": 9.186677707240777e-05, "loss": 0.8385, "mean_token_accuracy": 0.7590147145092487, "num_tokens": 84659711.0, "step": 2653 }, { "entropy": 0.9023727886378765, "epoch": 0.24418490980500399, "grad_norm": 0.16392652690410614, "learning_rate": 9.186371024626615e-05, "loss": 0.905, "mean_token_accuracy": 0.7444100975990295, "num_tokens": 84690847.0, "step": 2654 }, { "entropy": 0.904676515609026, "epoch": 0.24427691617644523, "grad_norm": 0.16366037726402283, "learning_rate": 9.186064342012452e-05, "loss": 0.9134, "mean_token_accuracy": 0.741337887942791, "num_tokens": 84722791.0, "step": 2655 }, { "entropy": 0.7539961952716112, "epoch": 0.24436892254788645, "grad_norm": 0.15588703751564026, "learning_rate": 9.18575765939829e-05, "loss": 0.7501, "mean_token_accuracy": 0.7780167311429977, "num_tokens": 84754413.0, "step": 2656 }, { "entropy": 0.9193182960152626, "epoch": 0.24446092891932766, "grad_norm": 0.16715286672115326, "learning_rate": 9.185450976784127e-05, "loss": 0.9504, "mean_token_accuracy": 0.7373606488108635, "num_tokens": 84786908.0, "step": 2657 }, { "entropy": 0.7816291432827711, "epoch": 0.24455293529076888, "grad_norm": 0.163258895277977, "learning_rate": 9.185144294169963e-05, "loss": 0.8092, "mean_token_accuracy": 0.7688065059483051, "num_tokens": 84818327.0, "step": 2658 }, { "entropy": 0.8555907532572746, "epoch": 0.2446449416622101, "grad_norm": 0.15940916538238525, "learning_rate": 9.184837611555802e-05, "loss": 0.857, "mean_token_accuracy": 0.7498989216983318, "num_tokens": 84850513.0, "step": 2659 }, { "entropy": 0.8879393730312586, "epoch": 0.24473694803365134, "grad_norm": 0.16076746582984924, "learning_rate": 9.18453092894164e-05, "loss": 0.8866, "mean_token_accuracy": 0.7499151080846786, "num_tokens": 84882466.0, "step": 2660 }, { "entropy": 0.8220582772046328, "epoch": 0.24482895440509256, "grad_norm": 0.15430106222629547, "learning_rate": 9.184224246327476e-05, "loss": 0.8273, "mean_token_accuracy": 0.7593517377972603, "num_tokens": 84914291.0, "step": 2661 }, { "entropy": 0.8259285278618336, "epoch": 0.24492096077653377, "grad_norm": 0.17020905017852783, "learning_rate": 9.183917563713313e-05, "loss": 0.8434, "mean_token_accuracy": 0.7559743858873844, "num_tokens": 84945186.0, "step": 2662 }, { "entropy": 0.939699862152338, "epoch": 0.245012967147975, "grad_norm": 0.16163496673107147, "learning_rate": 9.18361088109915e-05, "loss": 0.9331, "mean_token_accuracy": 0.7366358153522015, "num_tokens": 84977528.0, "step": 2663 }, { "entropy": 0.9474322013556957, "epoch": 0.2451049735194162, "grad_norm": 0.16548722982406616, "learning_rate": 9.183304198484988e-05, "loss": 0.9361, "mean_token_accuracy": 0.737343467772007, "num_tokens": 85009208.0, "step": 2664 }, { "entropy": 0.8048810958862305, "epoch": 0.24519697989085745, "grad_norm": 0.1537661850452423, "learning_rate": 9.182997515870826e-05, "loss": 0.7864, "mean_token_accuracy": 0.7665089927613735, "num_tokens": 85041388.0, "step": 2665 }, { "entropy": 0.8987341336905956, "epoch": 0.24528898626229867, "grad_norm": 0.16110607981681824, "learning_rate": 9.182690833256663e-05, "loss": 0.9011, "mean_token_accuracy": 0.7383300289511681, "num_tokens": 85073063.0, "step": 2666 }, { "entropy": 0.7819987926632166, "epoch": 0.24538099263373989, "grad_norm": 0.15321919322013855, "learning_rate": 9.1823841506425e-05, "loss": 0.7756, "mean_token_accuracy": 0.7751513719558716, "num_tokens": 85105799.0, "step": 2667 }, { "entropy": 0.8375424910336733, "epoch": 0.2454729990051811, "grad_norm": 0.15949204564094543, "learning_rate": 9.182077468028338e-05, "loss": 0.8321, "mean_token_accuracy": 0.7604721635580063, "num_tokens": 85138116.0, "step": 2668 }, { "entropy": 0.8406574353575706, "epoch": 0.24556500537662232, "grad_norm": 0.15258368849754333, "learning_rate": 9.181770785414175e-05, "loss": 0.8299, "mean_token_accuracy": 0.7615390904247761, "num_tokens": 85170096.0, "step": 2669 }, { "entropy": 0.9376026522368193, "epoch": 0.24565701174806356, "grad_norm": 0.16982507705688477, "learning_rate": 9.181464102800013e-05, "loss": 0.9705, "mean_token_accuracy": 0.7290478125214577, "num_tokens": 85202261.0, "step": 2670 }, { "entropy": 0.7535418216139078, "epoch": 0.24574901811950478, "grad_norm": 0.1490194946527481, "learning_rate": 9.18115742018585e-05, "loss": 0.7343, "mean_token_accuracy": 0.7836470864713192, "num_tokens": 85233625.0, "step": 2671 }, { "entropy": 0.7677188292145729, "epoch": 0.245841024490946, "grad_norm": 0.15155711770057678, "learning_rate": 9.180850737571688e-05, "loss": 0.73, "mean_token_accuracy": 0.7867910414934158, "num_tokens": 85264415.0, "step": 2672 }, { "entropy": 0.7836126461625099, "epoch": 0.24593303086238721, "grad_norm": 0.14986424148082733, "learning_rate": 9.180544054957525e-05, "loss": 0.7615, "mean_token_accuracy": 0.7782730758190155, "num_tokens": 85297183.0, "step": 2673 }, { "entropy": 0.86301539093256, "epoch": 0.24602503723382843, "grad_norm": 0.15502800047397614, "learning_rate": 9.180237372343361e-05, "loss": 0.836, "mean_token_accuracy": 0.756617333739996, "num_tokens": 85329331.0, "step": 2674 }, { "entropy": 0.8400121983140707, "epoch": 0.24611704360526968, "grad_norm": 0.15983988344669342, "learning_rate": 9.1799306897292e-05, "loss": 0.8227, "mean_token_accuracy": 0.7603403367102146, "num_tokens": 85361436.0, "step": 2675 }, { "entropy": 0.8375260978937149, "epoch": 0.2462090499767109, "grad_norm": 0.1663489043712616, "learning_rate": 9.179624007115038e-05, "loss": 0.8639, "mean_token_accuracy": 0.7545162625610828, "num_tokens": 85392917.0, "step": 2676 }, { "entropy": 0.8764353096485138, "epoch": 0.2463010563481521, "grad_norm": 0.16168470680713654, "learning_rate": 9.179317324500875e-05, "loss": 0.8632, "mean_token_accuracy": 0.7571360245347023, "num_tokens": 85424849.0, "step": 2677 }, { "entropy": 0.8300259746611118, "epoch": 0.24639306271959333, "grad_norm": 0.15731461346149445, "learning_rate": 9.179010641886711e-05, "loss": 0.8269, "mean_token_accuracy": 0.7601824775338173, "num_tokens": 85456402.0, "step": 2678 }, { "entropy": 0.8908086344599724, "epoch": 0.24648506909103454, "grad_norm": 0.16460981965065002, "learning_rate": 9.178703959272548e-05, "loss": 0.8767, "mean_token_accuracy": 0.7521955110132694, "num_tokens": 85487355.0, "step": 2679 }, { "entropy": 0.8082699552178383, "epoch": 0.2465770754624758, "grad_norm": 0.15998505055904388, "learning_rate": 9.178397276658388e-05, "loss": 0.8081, "mean_token_accuracy": 0.7673908397555351, "num_tokens": 85519212.0, "step": 2680 }, { "entropy": 0.8146677520126104, "epoch": 0.246669081833917, "grad_norm": 0.16086260974407196, "learning_rate": 9.178090594044224e-05, "loss": 0.8041, "mean_token_accuracy": 0.7676817029714584, "num_tokens": 85551048.0, "step": 2681 }, { "entropy": 0.9513622373342514, "epoch": 0.24676108820535822, "grad_norm": 0.1660260260105133, "learning_rate": 9.177783911430061e-05, "loss": 0.9405, "mean_token_accuracy": 0.7350008338689804, "num_tokens": 85582757.0, "step": 2682 }, { "entropy": 0.8167126923799515, "epoch": 0.24685309457679944, "grad_norm": 0.160313680768013, "learning_rate": 9.177477228815898e-05, "loss": 0.8148, "mean_token_accuracy": 0.7635754607617855, "num_tokens": 85614080.0, "step": 2683 }, { "entropy": 0.8851228170096874, "epoch": 0.24694510094824065, "grad_norm": 0.16047237813472748, "learning_rate": 9.177170546201736e-05, "loss": 0.8664, "mean_token_accuracy": 0.7538099028170109, "num_tokens": 85646237.0, "step": 2684 }, { "entropy": 0.9340087380260229, "epoch": 0.2470371073196819, "grad_norm": 0.19659104943275452, "learning_rate": 9.176863863587574e-05, "loss": 0.9246, "mean_token_accuracy": 0.7381389103829861, "num_tokens": 85678354.0, "step": 2685 }, { "entropy": 0.8314972892403603, "epoch": 0.24712911369112311, "grad_norm": 0.15527598559856415, "learning_rate": 9.176557180973411e-05, "loss": 0.8055, "mean_token_accuracy": 0.7687579542398453, "num_tokens": 85711053.0, "step": 2686 }, { "entropy": 0.8430221900343895, "epoch": 0.24722112006256433, "grad_norm": 0.15596242249011993, "learning_rate": 9.176250498359249e-05, "loss": 0.8394, "mean_token_accuracy": 0.7579434104263783, "num_tokens": 85743109.0, "step": 2687 }, { "entropy": 0.8469304256141186, "epoch": 0.24731312643400555, "grad_norm": 0.15543736517429352, "learning_rate": 9.175943815745086e-05, "loss": 0.8535, "mean_token_accuracy": 0.7554105930030346, "num_tokens": 85775299.0, "step": 2688 }, { "entropy": 0.8556807320564985, "epoch": 0.24740513280544676, "grad_norm": 0.167496457695961, "learning_rate": 9.175637133130923e-05, "loss": 0.8722, "mean_token_accuracy": 0.7528364174067974, "num_tokens": 85807589.0, "step": 2689 }, { "entropy": 0.8343632966279984, "epoch": 0.247497139176888, "grad_norm": 0.16537676751613617, "learning_rate": 9.175330450516761e-05, "loss": 0.8639, "mean_token_accuracy": 0.748880248516798, "num_tokens": 85839036.0, "step": 2690 }, { "entropy": 0.8901041727513075, "epoch": 0.24758914554832923, "grad_norm": 0.16190777719020844, "learning_rate": 9.175023767902599e-05, "loss": 0.901, "mean_token_accuracy": 0.7467170841991901, "num_tokens": 85871692.0, "step": 2691 }, { "entropy": 0.9419623985886574, "epoch": 0.24768115191977044, "grad_norm": 0.17066030204296112, "learning_rate": 9.174717085288436e-05, "loss": 0.9671, "mean_token_accuracy": 0.73309026658535, "num_tokens": 85903431.0, "step": 2692 }, { "entropy": 0.808463666588068, "epoch": 0.24777315829121166, "grad_norm": 0.15087269246578217, "learning_rate": 9.174410402674273e-05, "loss": 0.7967, "mean_token_accuracy": 0.7655615918338299, "num_tokens": 85935477.0, "step": 2693 }, { "entropy": 0.8564595691859722, "epoch": 0.24786516466265288, "grad_norm": 0.1576930284500122, "learning_rate": 9.17410372006011e-05, "loss": 0.8725, "mean_token_accuracy": 0.7529133185744286, "num_tokens": 85967629.0, "step": 2694 }, { "entropy": 0.8498693853616714, "epoch": 0.24795717103409412, "grad_norm": 0.15180064737796783, "learning_rate": 9.173797037445948e-05, "loss": 0.8, "mean_token_accuracy": 0.7682793289422989, "num_tokens": 85998856.0, "step": 2695 }, { "entropy": 0.8483615983277559, "epoch": 0.24804917740553534, "grad_norm": 0.15737025439739227, "learning_rate": 9.173490354831786e-05, "loss": 0.8329, "mean_token_accuracy": 0.7662335820496082, "num_tokens": 86031532.0, "step": 2696 }, { "entropy": 0.8939174152910709, "epoch": 0.24814118377697655, "grad_norm": 0.15788894891738892, "learning_rate": 9.173183672217623e-05, "loss": 0.8853, "mean_token_accuracy": 0.7463724762201309, "num_tokens": 86064072.0, "step": 2697 }, { "entropy": 0.788768082857132, "epoch": 0.24823319014841777, "grad_norm": 0.1507626622915268, "learning_rate": 9.172876989603459e-05, "loss": 0.771, "mean_token_accuracy": 0.7781832478940487, "num_tokens": 86096184.0, "step": 2698 }, { "entropy": 0.8372474499046803, "epoch": 0.248325196519859, "grad_norm": 0.15911045670509338, "learning_rate": 9.172570306989297e-05, "loss": 0.8317, "mean_token_accuracy": 0.7566252425312996, "num_tokens": 86126761.0, "step": 2699 }, { "entropy": 0.8818000182509422, "epoch": 0.24841720289130023, "grad_norm": 0.16109924018383026, "learning_rate": 9.172263624375134e-05, "loss": 0.8838, "mean_token_accuracy": 0.7476418167352676, "num_tokens": 86159249.0, "step": 2700 }, { "entropy": 0.9387632925063372, "epoch": 0.24850920926274145, "grad_norm": 0.1576528549194336, "learning_rate": 9.171956941760972e-05, "loss": 0.9146, "mean_token_accuracy": 0.7395677678287029, "num_tokens": 86191248.0, "step": 2701 }, { "entropy": 0.7937057130038738, "epoch": 0.24860121563418267, "grad_norm": 0.15407772362232208, "learning_rate": 9.171650259146809e-05, "loss": 0.7834, "mean_token_accuracy": 0.7748444937169552, "num_tokens": 86222909.0, "step": 2702 }, { "entropy": 0.7688965331763029, "epoch": 0.24869322200562388, "grad_norm": 0.15468192100524902, "learning_rate": 9.171343576532647e-05, "loss": 0.766, "mean_token_accuracy": 0.7780809216201305, "num_tokens": 86255114.0, "step": 2703 }, { "entropy": 0.8287820257246494, "epoch": 0.2487852283770651, "grad_norm": 0.15825626254081726, "learning_rate": 9.171036893918484e-05, "loss": 0.8464, "mean_token_accuracy": 0.7547273337841034, "num_tokens": 86287148.0, "step": 2704 }, { "entropy": 0.9749469496309757, "epoch": 0.24887723474850634, "grad_norm": 0.17305155098438263, "learning_rate": 9.170730211304321e-05, "loss": 0.9996, "mean_token_accuracy": 0.721424475312233, "num_tokens": 86318326.0, "step": 2705 }, { "entropy": 0.9338030628859997, "epoch": 0.24896924111994756, "grad_norm": 0.1631115972995758, "learning_rate": 9.170423528690159e-05, "loss": 0.9485, "mean_token_accuracy": 0.7307279594242573, "num_tokens": 86349695.0, "step": 2706 }, { "entropy": 0.9039729163050652, "epoch": 0.24906124749138878, "grad_norm": 0.17244620621204376, "learning_rate": 9.170116846075997e-05, "loss": 0.9467, "mean_token_accuracy": 0.7364336811006069, "num_tokens": 86381605.0, "step": 2707 }, { "entropy": 0.84784154035151, "epoch": 0.24915325386283, "grad_norm": 0.15662112832069397, "learning_rate": 9.169810163461834e-05, "loss": 0.8423, "mean_token_accuracy": 0.756760623306036, "num_tokens": 86413296.0, "step": 2708 }, { "entropy": 0.9118702076375484, "epoch": 0.2492452602342712, "grad_norm": 0.15864692628383636, "learning_rate": 9.169503480847671e-05, "loss": 0.9073, "mean_token_accuracy": 0.7409906648099422, "num_tokens": 86445469.0, "step": 2709 }, { "entropy": 0.8619605824351311, "epoch": 0.24933726660571245, "grad_norm": 0.15798723697662354, "learning_rate": 9.169196798233508e-05, "loss": 0.855, "mean_token_accuracy": 0.7568154409527779, "num_tokens": 86477202.0, "step": 2710 }, { "entropy": 0.8519086167216301, "epoch": 0.24942927297715367, "grad_norm": 0.1524599939584732, "learning_rate": 9.168890115619346e-05, "loss": 0.8237, "mean_token_accuracy": 0.7607614360749722, "num_tokens": 86509471.0, "step": 2711 }, { "entropy": 0.837684839963913, "epoch": 0.2495212793485949, "grad_norm": 0.15446096658706665, "learning_rate": 9.168583433005184e-05, "loss": 0.8274, "mean_token_accuracy": 0.7607531994581223, "num_tokens": 86541173.0, "step": 2712 }, { "entropy": 0.7872753255069256, "epoch": 0.2496132857200361, "grad_norm": 0.1569407433271408, "learning_rate": 9.16827675039102e-05, "loss": 0.7812, "mean_token_accuracy": 0.7752517983317375, "num_tokens": 86572748.0, "step": 2713 }, { "entropy": 0.8225241117179394, "epoch": 0.24970529209147732, "grad_norm": 0.15181763470172882, "learning_rate": 9.167970067776857e-05, "loss": 0.8005, "mean_token_accuracy": 0.7660845927894115, "num_tokens": 86604256.0, "step": 2714 }, { "entropy": 0.7733361534774303, "epoch": 0.24979729846291857, "grad_norm": 0.1469232141971588, "learning_rate": 9.167663385162696e-05, "loss": 0.7602, "mean_token_accuracy": 0.7729604281485081, "num_tokens": 86637024.0, "step": 2715 }, { "entropy": 0.914367388933897, "epoch": 0.24988930483435978, "grad_norm": 0.1622610241174698, "learning_rate": 9.167356702548532e-05, "loss": 0.9208, "mean_token_accuracy": 0.7436262592673302, "num_tokens": 86668742.0, "step": 2716 }, { "entropy": 0.8514330480247736, "epoch": 0.249981311205801, "grad_norm": 0.1581651121377945, "learning_rate": 9.16705001993437e-05, "loss": 0.8268, "mean_token_accuracy": 0.7594861201941967, "num_tokens": 86700155.0, "step": 2717 }, { "entropy": 0.923823282122612, "epoch": 0.2500733175772422, "grad_norm": 0.16166554391384125, "learning_rate": 9.166743337320209e-05, "loss": 0.9343, "mean_token_accuracy": 0.7373642288148403, "num_tokens": 86732750.0, "step": 2718 }, { "entropy": 0.9314404018223286, "epoch": 0.25016532394868346, "grad_norm": 0.15572430193424225, "learning_rate": 9.166436654706045e-05, "loss": 0.9279, "mean_token_accuracy": 0.7322697043418884, "num_tokens": 86765149.0, "step": 2719 }, { "entropy": 0.8539245277643204, "epoch": 0.25025733032012465, "grad_norm": 0.15266185998916626, "learning_rate": 9.166129972091882e-05, "loss": 0.8325, "mean_token_accuracy": 0.7567691169679165, "num_tokens": 86796184.0, "step": 2720 }, { "entropy": 0.6611195225268602, "epoch": 0.2503493366915659, "grad_norm": 0.14738062024116516, "learning_rate": 9.165823289477719e-05, "loss": 0.6738, "mean_token_accuracy": 0.8000773601233959, "num_tokens": 86828339.0, "step": 2721 }, { "entropy": 0.876882754266262, "epoch": 0.25044134306300714, "grad_norm": 0.17342521250247955, "learning_rate": 9.165516606863558e-05, "loss": 0.9216, "mean_token_accuracy": 0.7442650124430656, "num_tokens": 86860580.0, "step": 2722 }, { "entropy": 0.9918787181377411, "epoch": 0.2505333494344483, "grad_norm": 0.16901317238807678, "learning_rate": 9.165209924249395e-05, "loss": 0.9885, "mean_token_accuracy": 0.7218355387449265, "num_tokens": 86892016.0, "step": 2723 }, { "entropy": 0.8815042413771152, "epoch": 0.25062535580588957, "grad_norm": 0.17050857841968536, "learning_rate": 9.164903241635232e-05, "loss": 0.9072, "mean_token_accuracy": 0.7487012483179569, "num_tokens": 86924273.0, "step": 2724 }, { "entropy": 0.8073317855596542, "epoch": 0.25071736217733076, "grad_norm": 0.15635287761688232, "learning_rate": 9.164596559021069e-05, "loss": 0.8058, "mean_token_accuracy": 0.7733117192983627, "num_tokens": 86956293.0, "step": 2725 }, { "entropy": 0.7888832315802574, "epoch": 0.250809368548772, "grad_norm": 0.1522299200296402, "learning_rate": 9.164289876406907e-05, "loss": 0.7767, "mean_token_accuracy": 0.774725154042244, "num_tokens": 86987994.0, "step": 2726 }, { "entropy": 0.7929352559149265, "epoch": 0.25090137492021325, "grad_norm": 0.16323943436145782, "learning_rate": 9.163983193792745e-05, "loss": 0.7695, "mean_token_accuracy": 0.774309515953064, "num_tokens": 87019823.0, "step": 2727 }, { "entropy": 0.8605271484702826, "epoch": 0.25099338129165444, "grad_norm": 0.15876956284046173, "learning_rate": 9.163676511178582e-05, "loss": 0.8437, "mean_token_accuracy": 0.7572069205343723, "num_tokens": 87052005.0, "step": 2728 }, { "entropy": 0.8819307181984186, "epoch": 0.2510853876630957, "grad_norm": 0.1648988276720047, "learning_rate": 9.163369828564419e-05, "loss": 0.8864, "mean_token_accuracy": 0.7448540218174458, "num_tokens": 87083085.0, "step": 2729 }, { "entropy": 0.8360131848603487, "epoch": 0.25117739403453687, "grad_norm": 0.1561766415834427, "learning_rate": 9.163063145950257e-05, "loss": 0.8186, "mean_token_accuracy": 0.7697000205516815, "num_tokens": 87115681.0, "step": 2730 }, { "entropy": 0.8303769044578075, "epoch": 0.2512694004059781, "grad_norm": 0.1593429446220398, "learning_rate": 9.162756463336094e-05, "loss": 0.8189, "mean_token_accuracy": 0.7611366398632526, "num_tokens": 87146868.0, "step": 2731 }, { "entropy": 0.8575064688920975, "epoch": 0.25136140677741936, "grad_norm": 0.15678897500038147, "learning_rate": 9.162449780721932e-05, "loss": 0.8593, "mean_token_accuracy": 0.7579894997179508, "num_tokens": 87178352.0, "step": 2732 }, { "entropy": 0.8398393522948027, "epoch": 0.25145341314886055, "grad_norm": 0.15339389443397522, "learning_rate": 9.162143098107769e-05, "loss": 0.8436, "mean_token_accuracy": 0.7556849829852581, "num_tokens": 87210638.0, "step": 2733 }, { "entropy": 0.9134417176246643, "epoch": 0.2515454195203018, "grad_norm": 0.1616877168416977, "learning_rate": 9.161836415493607e-05, "loss": 0.9324, "mean_token_accuracy": 0.7390838600695133, "num_tokens": 87242266.0, "step": 2734 }, { "entropy": 0.8396364524960518, "epoch": 0.251637425891743, "grad_norm": 0.15837344527244568, "learning_rate": 9.161529732879443e-05, "loss": 0.8421, "mean_token_accuracy": 0.7594959661364555, "num_tokens": 87274311.0, "step": 2735 }, { "entropy": 0.9051467478275299, "epoch": 0.2517294322631842, "grad_norm": 0.16184209287166595, "learning_rate": 9.16122305026528e-05, "loss": 0.9088, "mean_token_accuracy": 0.7353894077241421, "num_tokens": 87306087.0, "step": 2736 }, { "entropy": 0.9203876070678234, "epoch": 0.25182143863462547, "grad_norm": 0.16413213312625885, "learning_rate": 9.160916367651118e-05, "loss": 0.9073, "mean_token_accuracy": 0.7399497702717781, "num_tokens": 87338107.0, "step": 2737 }, { "entropy": 0.8142125271260738, "epoch": 0.25191344500606666, "grad_norm": 0.1528116762638092, "learning_rate": 9.160609685036957e-05, "loss": 0.8064, "mean_token_accuracy": 0.7665814310312271, "num_tokens": 87369259.0, "step": 2738 }, { "entropy": 0.9017786495387554, "epoch": 0.2520054513775079, "grad_norm": 0.15591572225093842, "learning_rate": 9.160303002422793e-05, "loss": 0.8811, "mean_token_accuracy": 0.7506509199738503, "num_tokens": 87401480.0, "step": 2739 }, { "entropy": 0.9262615777552128, "epoch": 0.2520974577489491, "grad_norm": 0.16294030845165253, "learning_rate": 9.15999631980863e-05, "loss": 0.9215, "mean_token_accuracy": 0.7320987358689308, "num_tokens": 87433072.0, "step": 2740 }, { "entropy": 0.839453112334013, "epoch": 0.25218946412039034, "grad_norm": 0.16228698194026947, "learning_rate": 9.159689637194467e-05, "loss": 0.8498, "mean_token_accuracy": 0.7522500567138195, "num_tokens": 87464906.0, "step": 2741 }, { "entropy": 0.7926503606140614, "epoch": 0.2522814704918316, "grad_norm": 0.1545933037996292, "learning_rate": 9.159382954580305e-05, "loss": 0.7777, "mean_token_accuracy": 0.7721719704568386, "num_tokens": 87496753.0, "step": 2742 }, { "entropy": 0.9514006860554218, "epoch": 0.25237347686327277, "grad_norm": 0.16393670439720154, "learning_rate": 9.159076271966143e-05, "loss": 0.9565, "mean_token_accuracy": 0.7313220538198948, "num_tokens": 87528785.0, "step": 2743 }, { "entropy": 0.7859730739146471, "epoch": 0.252465483234714, "grad_norm": 0.1506839543581009, "learning_rate": 9.15876958935198e-05, "loss": 0.7688, "mean_token_accuracy": 0.7761476598680019, "num_tokens": 87560514.0, "step": 2744 }, { "entropy": 0.8212261758744717, "epoch": 0.2525574896061552, "grad_norm": 0.15564662218093872, "learning_rate": 9.158462906737817e-05, "loss": 0.8056, "mean_token_accuracy": 0.76956931874156, "num_tokens": 87593246.0, "step": 2745 }, { "entropy": 0.8865234367549419, "epoch": 0.25264949597759645, "grad_norm": 0.16233384609222412, "learning_rate": 9.158156224123655e-05, "loss": 0.8805, "mean_token_accuracy": 0.7494681067764759, "num_tokens": 87624222.0, "step": 2746 }, { "entropy": 0.8251829110085964, "epoch": 0.2527415023490377, "grad_norm": 0.15811094641685486, "learning_rate": 9.157849541509492e-05, "loss": 0.8337, "mean_token_accuracy": 0.7609645500779152, "num_tokens": 87656300.0, "step": 2747 }, { "entropy": 0.8639294356107712, "epoch": 0.2528335087204789, "grad_norm": 0.16417552530765533, "learning_rate": 9.15754285889533e-05, "loss": 0.8618, "mean_token_accuracy": 0.7520268931984901, "num_tokens": 87687892.0, "step": 2748 }, { "entropy": 0.8229252621531487, "epoch": 0.25292551509192013, "grad_norm": 0.14978885650634766, "learning_rate": 9.157236176281168e-05, "loss": 0.7912, "mean_token_accuracy": 0.770048625767231, "num_tokens": 87719551.0, "step": 2749 }, { "entropy": 0.8497893530875444, "epoch": 0.2530175214633613, "grad_norm": 0.1640884280204773, "learning_rate": 9.156929493667005e-05, "loss": 0.8434, "mean_token_accuracy": 0.7600831910967827, "num_tokens": 87751558.0, "step": 2750 }, { "entropy": 0.9011817872524261, "epoch": 0.25310952783480256, "grad_norm": 0.16266858577728271, "learning_rate": 9.156622811052842e-05, "loss": 0.8981, "mean_token_accuracy": 0.7486536726355553, "num_tokens": 87783161.0, "step": 2751 }, { "entropy": 0.8641266711056232, "epoch": 0.2532015342062438, "grad_norm": 0.15604686737060547, "learning_rate": 9.156316128438678e-05, "loss": 0.8593, "mean_token_accuracy": 0.7518543601036072, "num_tokens": 87815298.0, "step": 2752 }, { "entropy": 0.8162213657051325, "epoch": 0.253293540577685, "grad_norm": 0.1598665565252304, "learning_rate": 9.156009445824516e-05, "loss": 0.815, "mean_token_accuracy": 0.7613694071769714, "num_tokens": 87847382.0, "step": 2753 }, { "entropy": 0.7797237131744623, "epoch": 0.25338554694912624, "grad_norm": 0.15749722719192505, "learning_rate": 9.155702763210355e-05, "loss": 0.7883, "mean_token_accuracy": 0.7670754678547382, "num_tokens": 87879387.0, "step": 2754 }, { "entropy": 0.8318130113184452, "epoch": 0.25347755332056743, "grad_norm": 0.16052283346652985, "learning_rate": 9.155396080596191e-05, "loss": 0.824, "mean_token_accuracy": 0.7646526545286179, "num_tokens": 87911608.0, "step": 2755 }, { "entropy": 0.7953128647059202, "epoch": 0.2535695596920087, "grad_norm": 0.16091987490653992, "learning_rate": 9.155089397982028e-05, "loss": 0.7995, "mean_token_accuracy": 0.7682630345225334, "num_tokens": 87943657.0, "step": 2756 }, { "entropy": 0.9314861632883549, "epoch": 0.2536615660634499, "grad_norm": 0.16475637257099152, "learning_rate": 9.154782715367866e-05, "loss": 0.9101, "mean_token_accuracy": 0.7399981431663036, "num_tokens": 87975979.0, "step": 2757 }, { "entropy": 0.850920557975769, "epoch": 0.2537535724348911, "grad_norm": 0.1563671976327896, "learning_rate": 9.154476032753704e-05, "loss": 0.8348, "mean_token_accuracy": 0.7597026042640209, "num_tokens": 88007923.0, "step": 2758 }, { "entropy": 0.8264209982007742, "epoch": 0.25384557880633235, "grad_norm": 0.15912050008773804, "learning_rate": 9.154169350139541e-05, "loss": 0.843, "mean_token_accuracy": 0.7628272362053394, "num_tokens": 88040388.0, "step": 2759 }, { "entropy": 0.8695603534579277, "epoch": 0.25393758517777354, "grad_norm": 0.1659490317106247, "learning_rate": 9.153862667525378e-05, "loss": 0.897, "mean_token_accuracy": 0.7512540221214294, "num_tokens": 88072083.0, "step": 2760 }, { "entropy": 0.8654303438961506, "epoch": 0.2540295915492148, "grad_norm": 0.16553208231925964, "learning_rate": 9.153555984911216e-05, "loss": 0.863, "mean_token_accuracy": 0.7508539892733097, "num_tokens": 88103928.0, "step": 2761 }, { "entropy": 0.8731610588729382, "epoch": 0.25412159792065603, "grad_norm": 0.15208066999912262, "learning_rate": 9.153249302297053e-05, "loss": 0.8486, "mean_token_accuracy": 0.7523898929357529, "num_tokens": 88136088.0, "step": 2762 }, { "entropy": 0.8120050728321075, "epoch": 0.2542136042920972, "grad_norm": 0.15259264409542084, "learning_rate": 9.152942619682891e-05, "loss": 0.7935, "mean_token_accuracy": 0.7698288634419441, "num_tokens": 88168002.0, "step": 2763 }, { "entropy": 0.8315807059407234, "epoch": 0.25430561066353846, "grad_norm": 0.14969809353351593, "learning_rate": 9.152635937068728e-05, "loss": 0.8281, "mean_token_accuracy": 0.7619085051119328, "num_tokens": 88200194.0, "step": 2764 }, { "entropy": 0.9077835064381361, "epoch": 0.25439761703497965, "grad_norm": 0.16208165884017944, "learning_rate": 9.152329254454566e-05, "loss": 0.9078, "mean_token_accuracy": 0.7441100254654884, "num_tokens": 88231902.0, "step": 2765 }, { "entropy": 0.8087678924202919, "epoch": 0.2544896234064209, "grad_norm": 0.15620604157447815, "learning_rate": 9.152022571840403e-05, "loss": 0.81, "mean_token_accuracy": 0.768579438328743, "num_tokens": 88263541.0, "step": 2766 }, { "entropy": 0.923043992370367, "epoch": 0.25458162977786214, "grad_norm": 0.16424353420734406, "learning_rate": 9.15171588922624e-05, "loss": 0.9163, "mean_token_accuracy": 0.7369749471545219, "num_tokens": 88294967.0, "step": 2767 }, { "entropy": 0.7623236998915672, "epoch": 0.25467363614930333, "grad_norm": 0.1529853641986847, "learning_rate": 9.151409206612078e-05, "loss": 0.7751, "mean_token_accuracy": 0.7781967483460903, "num_tokens": 88326766.0, "step": 2768 }, { "entropy": 0.8622432239353657, "epoch": 0.2547656425207446, "grad_norm": 0.15968473255634308, "learning_rate": 9.151102523997916e-05, "loss": 0.8355, "mean_token_accuracy": 0.7600646130740643, "num_tokens": 88357972.0, "step": 2769 }, { "entropy": 0.7820812333375216, "epoch": 0.25485764889218576, "grad_norm": 0.1589575856924057, "learning_rate": 9.150795841383753e-05, "loss": 0.7955, "mean_token_accuracy": 0.7730214968323708, "num_tokens": 88390740.0, "step": 2770 }, { "entropy": 0.9787991680204868, "epoch": 0.254949655263627, "grad_norm": 0.16957052052021027, "learning_rate": 9.15048915876959e-05, "loss": 0.9796, "mean_token_accuracy": 0.7220709472894669, "num_tokens": 88422812.0, "step": 2771 }, { "entropy": 0.9253401085734367, "epoch": 0.25504166163506825, "grad_norm": 0.16506490111351013, "learning_rate": 9.150182476155426e-05, "loss": 0.9265, "mean_token_accuracy": 0.73729657381773, "num_tokens": 88454165.0, "step": 2772 }, { "entropy": 0.8337426073849201, "epoch": 0.25513366800650944, "grad_norm": 0.15838368237018585, "learning_rate": 9.149875793541264e-05, "loss": 0.8421, "mean_token_accuracy": 0.7561553418636322, "num_tokens": 88486238.0, "step": 2773 }, { "entropy": 0.8948820754885674, "epoch": 0.2552256743779507, "grad_norm": 0.15800051391124725, "learning_rate": 9.149569110927103e-05, "loss": 0.894, "mean_token_accuracy": 0.7466093897819519, "num_tokens": 88518588.0, "step": 2774 }, { "entropy": 0.758627712726593, "epoch": 0.2553176807493919, "grad_norm": 0.14706432819366455, "learning_rate": 9.14926242831294e-05, "loss": 0.7322, "mean_token_accuracy": 0.7816632241010666, "num_tokens": 88550394.0, "step": 2775 }, { "entropy": 0.83804015442729, "epoch": 0.2554096871208331, "grad_norm": 0.1542797088623047, "learning_rate": 9.148955745698776e-05, "loss": 0.8478, "mean_token_accuracy": 0.7611195370554924, "num_tokens": 88582582.0, "step": 2776 }, { "entropy": 0.7838310785591602, "epoch": 0.25550169349227436, "grad_norm": 0.14777468144893646, "learning_rate": 9.148649063084614e-05, "loss": 0.7616, "mean_token_accuracy": 0.7784951776266098, "num_tokens": 88615064.0, "step": 2777 }, { "entropy": 0.9210391268134117, "epoch": 0.25559369986371555, "grad_norm": 0.15871484577655792, "learning_rate": 9.148342380470451e-05, "loss": 0.9074, "mean_token_accuracy": 0.7398480325937271, "num_tokens": 88647071.0, "step": 2778 }, { "entropy": 0.8769982177764177, "epoch": 0.2556857062351568, "grad_norm": 0.1582174450159073, "learning_rate": 9.148035697856289e-05, "loss": 0.8692, "mean_token_accuracy": 0.7533495537936687, "num_tokens": 88679568.0, "step": 2779 }, { "entropy": 0.8068108335137367, "epoch": 0.255777712606598, "grad_norm": 0.15174080431461334, "learning_rate": 9.147729015242127e-05, "loss": 0.7979, "mean_token_accuracy": 0.7714055180549622, "num_tokens": 88711732.0, "step": 2780 }, { "entropy": 0.930365540087223, "epoch": 0.25586971897803923, "grad_norm": 0.16415907442569733, "learning_rate": 9.147422332627964e-05, "loss": 0.9321, "mean_token_accuracy": 0.7386149913072586, "num_tokens": 88743955.0, "step": 2781 }, { "entropy": 0.9443697743117809, "epoch": 0.2559617253494805, "grad_norm": 0.16549700498580933, "learning_rate": 9.147115650013801e-05, "loss": 0.9469, "mean_token_accuracy": 0.732539489865303, "num_tokens": 88776081.0, "step": 2782 }, { "entropy": 0.8253733851015568, "epoch": 0.25605373172092166, "grad_norm": 0.16491864621639252, "learning_rate": 9.146808967399638e-05, "loss": 0.8502, "mean_token_accuracy": 0.7564817517995834, "num_tokens": 88807859.0, "step": 2783 }, { "entropy": 0.9824087023735046, "epoch": 0.2561457380923629, "grad_norm": 0.16532652080059052, "learning_rate": 9.146502284785476e-05, "loss": 0.9821, "mean_token_accuracy": 0.725590780377388, "num_tokens": 88840241.0, "step": 2784 }, { "entropy": 0.8922462798655033, "epoch": 0.2562377444638041, "grad_norm": 0.16553762555122375, "learning_rate": 9.146195602171314e-05, "loss": 0.8844, "mean_token_accuracy": 0.7482584826648235, "num_tokens": 88872359.0, "step": 2785 }, { "entropy": 0.8375036381185055, "epoch": 0.25632975083524534, "grad_norm": 0.15326903760433197, "learning_rate": 9.145888919557151e-05, "loss": 0.8218, "mean_token_accuracy": 0.7603331170976162, "num_tokens": 88905045.0, "step": 2786 }, { "entropy": 1.0006334595382214, "epoch": 0.2564217572066866, "grad_norm": 0.16587746143341064, "learning_rate": 9.145582236942988e-05, "loss": 0.9981, "mean_token_accuracy": 0.7177365086972713, "num_tokens": 88937190.0, "step": 2787 }, { "entropy": 0.884265024214983, "epoch": 0.2565137635781278, "grad_norm": 0.16339056193828583, "learning_rate": 9.145275554328826e-05, "loss": 0.8784, "mean_token_accuracy": 0.7538694143295288, "num_tokens": 88969617.0, "step": 2788 }, { "entropy": 0.8126080632209778, "epoch": 0.256605769949569, "grad_norm": 0.15208764374256134, "learning_rate": 9.144968871714662e-05, "loss": 0.7898, "mean_token_accuracy": 0.7675426974892616, "num_tokens": 89001593.0, "step": 2789 }, { "entropy": 0.8458507135510445, "epoch": 0.2566977763210102, "grad_norm": 0.1636621057987213, "learning_rate": 9.1446621891005e-05, "loss": 0.8516, "mean_token_accuracy": 0.7577724903821945, "num_tokens": 89033060.0, "step": 2790 }, { "entropy": 0.9247744046151638, "epoch": 0.25678978269245145, "grad_norm": 0.17925265431404114, "learning_rate": 9.144355506486337e-05, "loss": 0.9719, "mean_token_accuracy": 0.7280360944569111, "num_tokens": 89065283.0, "step": 2791 }, { "entropy": 0.7767251897603273, "epoch": 0.2568817890638927, "grad_norm": 0.1604960709810257, "learning_rate": 9.144048823872176e-05, "loss": 0.7849, "mean_token_accuracy": 0.7776144929230213, "num_tokens": 89096817.0, "step": 2792 }, { "entropy": 0.8979231901466846, "epoch": 0.2569737954353339, "grad_norm": 0.16305844485759735, "learning_rate": 9.143742141258012e-05, "loss": 0.8813, "mean_token_accuracy": 0.7517409287393093, "num_tokens": 89128922.0, "step": 2793 }, { "entropy": 0.8591989316046238, "epoch": 0.25706580180677513, "grad_norm": 0.17030738294124603, "learning_rate": 9.143435458643849e-05, "loss": 0.8765, "mean_token_accuracy": 0.7542348392307758, "num_tokens": 89161269.0, "step": 2794 }, { "entropy": 0.9160422347486019, "epoch": 0.2571578081782163, "grad_norm": 0.16399841010570526, "learning_rate": 9.143128776029687e-05, "loss": 0.9256, "mean_token_accuracy": 0.7359187453985214, "num_tokens": 89192337.0, "step": 2795 }, { "entropy": 0.8598131239414215, "epoch": 0.25724981454965756, "grad_norm": 0.1574128121137619, "learning_rate": 9.142822093415525e-05, "loss": 0.8301, "mean_token_accuracy": 0.7646610140800476, "num_tokens": 89224314.0, "step": 2796 }, { "entropy": 0.8575816638767719, "epoch": 0.2573418209210988, "grad_norm": 0.15365314483642578, "learning_rate": 9.142515410801362e-05, "loss": 0.828, "mean_token_accuracy": 0.7632404938340187, "num_tokens": 89256333.0, "step": 2797 }, { "entropy": 0.8619565069675446, "epoch": 0.25743382729254, "grad_norm": 0.15385395288467407, "learning_rate": 9.142208728187199e-05, "loss": 0.8528, "mean_token_accuracy": 0.7576416060328484, "num_tokens": 89288952.0, "step": 2798 }, { "entropy": 0.8496936745941639, "epoch": 0.25752583366398124, "grad_norm": 0.1593405306339264, "learning_rate": 9.141902045573036e-05, "loss": 0.8401, "mean_token_accuracy": 0.7569091878831387, "num_tokens": 89320999.0, "step": 2799 }, { "entropy": 0.7744437362998724, "epoch": 0.25761784003542243, "grad_norm": 0.15686284005641937, "learning_rate": 9.141595362958875e-05, "loss": 0.7677, "mean_token_accuracy": 0.7791652791202068, "num_tokens": 89353757.0, "step": 2800 }, { "entropy": 0.8682740293443203, "epoch": 0.2577098464068637, "grad_norm": 0.1574684977531433, "learning_rate": 9.141288680344712e-05, "loss": 0.8647, "mean_token_accuracy": 0.7575385347008705, "num_tokens": 89385455.0, "step": 2801 }, { "entropy": 0.8405726402997971, "epoch": 0.2578018527783049, "grad_norm": 0.16005155444145203, "learning_rate": 9.140981997730549e-05, "loss": 0.8504, "mean_token_accuracy": 0.7543057426810265, "num_tokens": 89416983.0, "step": 2802 }, { "entropy": 0.8528567012399435, "epoch": 0.2578938591497461, "grad_norm": 0.165125772356987, "learning_rate": 9.140675315116386e-05, "loss": 0.8644, "mean_token_accuracy": 0.7572858333587646, "num_tokens": 89448558.0, "step": 2803 }, { "entropy": 0.8738709706813097, "epoch": 0.25798586552118735, "grad_norm": 0.16953903436660767, "learning_rate": 9.140368632502224e-05, "loss": 0.8956, "mean_token_accuracy": 0.7446806617081165, "num_tokens": 89480412.0, "step": 2804 }, { "entropy": 0.9119055541232228, "epoch": 0.25807787189262854, "grad_norm": 0.16405169665813446, "learning_rate": 9.140061949888062e-05, "loss": 0.9166, "mean_token_accuracy": 0.7436589784920216, "num_tokens": 89512419.0, "step": 2805 }, { "entropy": 0.827830420807004, "epoch": 0.2581698782640698, "grad_norm": 0.15960438549518585, "learning_rate": 9.139755267273899e-05, "loss": 0.8264, "mean_token_accuracy": 0.7627162449061871, "num_tokens": 89544378.0, "step": 2806 }, { "entropy": 0.875212762504816, "epoch": 0.25826188463551103, "grad_norm": 0.16282302141189575, "learning_rate": 9.139448584659735e-05, "loss": 0.8772, "mean_token_accuracy": 0.7505728341639042, "num_tokens": 89575776.0, "step": 2807 }, { "entropy": 0.8670352809131145, "epoch": 0.2583538910069522, "grad_norm": 0.15919779241085052, "learning_rate": 9.139141902045574e-05, "loss": 0.8541, "mean_token_accuracy": 0.7526722960174084, "num_tokens": 89607561.0, "step": 2808 }, { "entropy": 0.8465863354504108, "epoch": 0.25844589737839346, "grad_norm": 0.1605643332004547, "learning_rate": 9.13883521943141e-05, "loss": 0.8453, "mean_token_accuracy": 0.7550167255103588, "num_tokens": 89638118.0, "step": 2809 }, { "entropy": 0.8307596147060394, "epoch": 0.25853790374983465, "grad_norm": 0.1578579545021057, "learning_rate": 9.138528536817249e-05, "loss": 0.8374, "mean_token_accuracy": 0.7645382210612297, "num_tokens": 89669260.0, "step": 2810 }, { "entropy": 0.8379404544830322, "epoch": 0.2586299101212759, "grad_norm": 0.15032045543193817, "learning_rate": 9.138221854203087e-05, "loss": 0.8149, "mean_token_accuracy": 0.764054823666811, "num_tokens": 89701647.0, "step": 2811 }, { "entropy": 0.8520856983959675, "epoch": 0.25872191649271714, "grad_norm": 0.1553380787372589, "learning_rate": 9.137915171588923e-05, "loss": 0.841, "mean_token_accuracy": 0.7565230652689934, "num_tokens": 89734393.0, "step": 2812 }, { "entropy": 0.825719028711319, "epoch": 0.25881392286415833, "grad_norm": 0.15387941896915436, "learning_rate": 9.13760848897476e-05, "loss": 0.813, "mean_token_accuracy": 0.7640046775341034, "num_tokens": 89766787.0, "step": 2813 }, { "entropy": 0.9063511025160551, "epoch": 0.2589059292355996, "grad_norm": 0.16124024987220764, "learning_rate": 9.137301806360597e-05, "loss": 0.9101, "mean_token_accuracy": 0.7403098084032536, "num_tokens": 89798988.0, "step": 2814 }, { "entropy": 0.8480651006102562, "epoch": 0.25899793560704076, "grad_norm": 0.155999094247818, "learning_rate": 9.136995123746435e-05, "loss": 0.8503, "mean_token_accuracy": 0.7546104043722153, "num_tokens": 89831756.0, "step": 2815 }, { "entropy": 0.9275361075997353, "epoch": 0.259089941978482, "grad_norm": 0.15827515721321106, "learning_rate": 9.136688441132273e-05, "loss": 0.9038, "mean_token_accuracy": 0.7390910945832729, "num_tokens": 89863952.0, "step": 2816 }, { "entropy": 0.7832501847296953, "epoch": 0.25918194834992325, "grad_norm": 0.14867666363716125, "learning_rate": 9.13638175851811e-05, "loss": 0.7451, "mean_token_accuracy": 0.7844700329005718, "num_tokens": 89895939.0, "step": 2817 }, { "entropy": 0.8502877876162529, "epoch": 0.25927395472136444, "grad_norm": 0.16363820433616638, "learning_rate": 9.136075075903947e-05, "loss": 0.8552, "mean_token_accuracy": 0.7544577419757843, "num_tokens": 89928707.0, "step": 2818 }, { "entropy": 0.9521913155913353, "epoch": 0.2593659610928057, "grad_norm": 0.1613747626543045, "learning_rate": 9.135768393289785e-05, "loss": 0.9529, "mean_token_accuracy": 0.7349535524845123, "num_tokens": 89961093.0, "step": 2819 }, { "entropy": 1.0222590006887913, "epoch": 0.2594579674642469, "grad_norm": 0.1705067902803421, "learning_rate": 9.135461710675622e-05, "loss": 1.0366, "mean_token_accuracy": 0.7106485925614834, "num_tokens": 89993677.0, "step": 2820 }, { "entropy": 0.8609245866537094, "epoch": 0.2595499738356881, "grad_norm": 0.16584503650665283, "learning_rate": 9.13515502806146e-05, "loss": 0.8708, "mean_token_accuracy": 0.7524748183786869, "num_tokens": 90024883.0, "step": 2821 }, { "entropy": 0.7869315836578608, "epoch": 0.25964198020712936, "grad_norm": 0.15979622304439545, "learning_rate": 9.134848345447297e-05, "loss": 0.792, "mean_token_accuracy": 0.7729918174445629, "num_tokens": 90056717.0, "step": 2822 }, { "entropy": 0.8447292745113373, "epoch": 0.25973398657857055, "grad_norm": 0.16518838703632355, "learning_rate": 9.134541662833135e-05, "loss": 0.8249, "mean_token_accuracy": 0.7591153681278229, "num_tokens": 90087681.0, "step": 2823 }, { "entropy": 0.8453956712037325, "epoch": 0.2598259929500118, "grad_norm": 0.17094330489635468, "learning_rate": 9.134234980218972e-05, "loss": 0.8656, "mean_token_accuracy": 0.7600379884243011, "num_tokens": 90119155.0, "step": 2824 }, { "entropy": 0.9652759544551373, "epoch": 0.259917999321453, "grad_norm": 0.169732466340065, "learning_rate": 9.133928297604809e-05, "loss": 0.9845, "mean_token_accuracy": 0.7246212437748909, "num_tokens": 90150489.0, "step": 2825 }, { "entropy": 0.7368095740675926, "epoch": 0.26001000569289423, "grad_norm": 0.16340185701847076, "learning_rate": 9.133621614990647e-05, "loss": 0.7579, "mean_token_accuracy": 0.7799007222056389, "num_tokens": 90183220.0, "step": 2826 }, { "entropy": 0.8660338763147593, "epoch": 0.2601020120643355, "grad_norm": 0.1599806249141693, "learning_rate": 9.133314932376485e-05, "loss": 0.8748, "mean_token_accuracy": 0.7478078491985798, "num_tokens": 90214376.0, "step": 2827 }, { "entropy": 0.881524994969368, "epoch": 0.26019401843577666, "grad_norm": 0.1620558202266693, "learning_rate": 9.133008249762322e-05, "loss": 0.885, "mean_token_accuracy": 0.7476818300783634, "num_tokens": 90247006.0, "step": 2828 }, { "entropy": 0.9129325225949287, "epoch": 0.2602860248072179, "grad_norm": 0.16515423357486725, "learning_rate": 9.132701567148158e-05, "loss": 0.9333, "mean_token_accuracy": 0.738802719861269, "num_tokens": 90279261.0, "step": 2829 }, { "entropy": 0.8334056921303272, "epoch": 0.2603780311786591, "grad_norm": 0.15752603113651276, "learning_rate": 9.132394884533995e-05, "loss": 0.827, "mean_token_accuracy": 0.7596079520881176, "num_tokens": 90311271.0, "step": 2830 }, { "entropy": 0.8350309766829014, "epoch": 0.26047003755010034, "grad_norm": 0.149174764752388, "learning_rate": 9.132088201919833e-05, "loss": 0.8027, "mean_token_accuracy": 0.769335750490427, "num_tokens": 90343648.0, "step": 2831 }, { "entropy": 0.8916435390710831, "epoch": 0.2605620439215416, "grad_norm": 0.15926620364189148, "learning_rate": 9.131781519305671e-05, "loss": 0.8466, "mean_token_accuracy": 0.7529180906713009, "num_tokens": 90375001.0, "step": 2832 }, { "entropy": 0.8382735662162304, "epoch": 0.2606540502929828, "grad_norm": 0.15188710391521454, "learning_rate": 9.131474836691508e-05, "loss": 0.8116, "mean_token_accuracy": 0.7645600251853466, "num_tokens": 90407683.0, "step": 2833 }, { "entropy": 1.0099739655852318, "epoch": 0.260746056664424, "grad_norm": 0.161537304520607, "learning_rate": 9.131168154077345e-05, "loss": 0.9965, "mean_token_accuracy": 0.7219971977174282, "num_tokens": 90439635.0, "step": 2834 }, { "entropy": 0.8736461102962494, "epoch": 0.2608380630358652, "grad_norm": 0.15905554592609406, "learning_rate": 9.130861471463183e-05, "loss": 0.86, "mean_token_accuracy": 0.7550927214324474, "num_tokens": 90470940.0, "step": 2835 }, { "entropy": 0.8264850005507469, "epoch": 0.26093006940730645, "grad_norm": 0.15622183680534363, "learning_rate": 9.13055478884902e-05, "loss": 0.828, "mean_token_accuracy": 0.7633023373782635, "num_tokens": 90502972.0, "step": 2836 }, { "entropy": 0.889338593930006, "epoch": 0.2610220757787477, "grad_norm": 0.16298504173755646, "learning_rate": 9.130248106234858e-05, "loss": 0.9079, "mean_token_accuracy": 0.745250154286623, "num_tokens": 90535197.0, "step": 2837 }, { "entropy": 0.8423227425664663, "epoch": 0.2611140821501889, "grad_norm": 0.16186237335205078, "learning_rate": 9.129941423620696e-05, "loss": 0.8446, "mean_token_accuracy": 0.7541607320308685, "num_tokens": 90567250.0, "step": 2838 }, { "entropy": 0.771701704710722, "epoch": 0.26120608852163013, "grad_norm": 0.154720738530159, "learning_rate": 9.129634741006533e-05, "loss": 0.7702, "mean_token_accuracy": 0.7786836922168732, "num_tokens": 90599231.0, "step": 2839 }, { "entropy": 0.8576270490884781, "epoch": 0.2612980948930713, "grad_norm": 0.15544119477272034, "learning_rate": 9.12932805839237e-05, "loss": 0.841, "mean_token_accuracy": 0.7576870173215866, "num_tokens": 90631456.0, "step": 2840 }, { "entropy": 0.8823127709329128, "epoch": 0.26139010126451256, "grad_norm": 0.1564403921365738, "learning_rate": 9.129021375778207e-05, "loss": 0.8673, "mean_token_accuracy": 0.7499171607196331, "num_tokens": 90663969.0, "step": 2841 }, { "entropy": 0.8288220949470997, "epoch": 0.2614821076359538, "grad_norm": 0.15910476446151733, "learning_rate": 9.128714693164046e-05, "loss": 0.8333, "mean_token_accuracy": 0.7599842473864555, "num_tokens": 90695703.0, "step": 2842 }, { "entropy": 0.8123975992202759, "epoch": 0.261574114007395, "grad_norm": 0.16509585082530975, "learning_rate": 9.128408010549883e-05, "loss": 0.8283, "mean_token_accuracy": 0.7604980543255806, "num_tokens": 90727904.0, "step": 2843 }, { "entropy": 0.7716659530997276, "epoch": 0.26166612037883624, "grad_norm": 0.16245560348033905, "learning_rate": 9.12810132793572e-05, "loss": 0.7987, "mean_token_accuracy": 0.7716722004115582, "num_tokens": 90759828.0, "step": 2844 }, { "entropy": 0.9030359536409378, "epoch": 0.26175812675027743, "grad_norm": 0.16291511058807373, "learning_rate": 9.127794645321556e-05, "loss": 0.9219, "mean_token_accuracy": 0.7368749380111694, "num_tokens": 90791883.0, "step": 2845 }, { "entropy": 0.8616113364696503, "epoch": 0.2618501331217187, "grad_norm": 0.15755385160446167, "learning_rate": 9.127487962707395e-05, "loss": 0.8494, "mean_token_accuracy": 0.7552045248448849, "num_tokens": 90823497.0, "step": 2846 }, { "entropy": 0.7095162216573954, "epoch": 0.2619421394931599, "grad_norm": 0.15499377250671387, "learning_rate": 9.127181280093233e-05, "loss": 0.7135, "mean_token_accuracy": 0.7911393120884895, "num_tokens": 90854812.0, "step": 2847 }, { "entropy": 0.8810529857873917, "epoch": 0.2620341458646011, "grad_norm": 0.1614808291196823, "learning_rate": 9.12687459747907e-05, "loss": 0.8451, "mean_token_accuracy": 0.7525723315775394, "num_tokens": 90885927.0, "step": 2848 }, { "entropy": 0.9191434979438782, "epoch": 0.26212615223604235, "grad_norm": 0.16453303396701813, "learning_rate": 9.126567914864906e-05, "loss": 0.9383, "mean_token_accuracy": 0.7399155758321285, "num_tokens": 90918129.0, "step": 2849 }, { "entropy": 0.8701786287128925, "epoch": 0.26221815860748354, "grad_norm": 0.16060461103916168, "learning_rate": 9.126261232250744e-05, "loss": 0.8793, "mean_token_accuracy": 0.7525698356330395, "num_tokens": 90950224.0, "step": 2850 }, { "entropy": 0.8752622045576572, "epoch": 0.2623101649789248, "grad_norm": 0.15830542147159576, "learning_rate": 9.125954549636581e-05, "loss": 0.8575, "mean_token_accuracy": 0.7541468217968941, "num_tokens": 90982413.0, "step": 2851 }, { "entropy": 0.8845952488481998, "epoch": 0.26240217135036603, "grad_norm": 0.16241692006587982, "learning_rate": 9.12564786702242e-05, "loss": 0.885, "mean_token_accuracy": 0.7453330457210541, "num_tokens": 91014340.0, "step": 2852 }, { "entropy": 0.9421564135700464, "epoch": 0.2624941777218072, "grad_norm": 0.15729211270809174, "learning_rate": 9.125341184408256e-05, "loss": 0.9332, "mean_token_accuracy": 0.7361602894961834, "num_tokens": 91046826.0, "step": 2853 }, { "entropy": 0.7698660269379616, "epoch": 0.26258618409324846, "grad_norm": 0.15412960946559906, "learning_rate": 9.125034501794094e-05, "loss": 0.768, "mean_token_accuracy": 0.7758978568017483, "num_tokens": 91078643.0, "step": 2854 }, { "entropy": 0.8216989003121853, "epoch": 0.26267819046468965, "grad_norm": 0.15156646072864532, "learning_rate": 9.124727819179931e-05, "loss": 0.805, "mean_token_accuracy": 0.7688013762235641, "num_tokens": 91110842.0, "step": 2855 }, { "entropy": 0.6979290321469307, "epoch": 0.2627701968361309, "grad_norm": 0.15467458963394165, "learning_rate": 9.124421136565768e-05, "loss": 0.7106, "mean_token_accuracy": 0.7901562228798866, "num_tokens": 91142585.0, "step": 2856 }, { "entropy": 0.9317745268344879, "epoch": 0.26286220320757214, "grad_norm": 0.16127899289131165, "learning_rate": 9.124114453951606e-05, "loss": 0.935, "mean_token_accuracy": 0.7366209700703621, "num_tokens": 91174741.0, "step": 2857 }, { "entropy": 0.8280125856399536, "epoch": 0.26295420957901333, "grad_norm": 0.1560603827238083, "learning_rate": 9.123807771337444e-05, "loss": 0.8045, "mean_token_accuracy": 0.766029242426157, "num_tokens": 91206888.0, "step": 2858 }, { "entropy": 0.8049558624625206, "epoch": 0.2630462159504546, "grad_norm": 0.15992172062397003, "learning_rate": 9.123501088723281e-05, "loss": 0.8128, "mean_token_accuracy": 0.7615224979817867, "num_tokens": 91238435.0, "step": 2859 }, { "entropy": 0.8293513804674149, "epoch": 0.26313822232189576, "grad_norm": 0.15440335869789124, "learning_rate": 9.123194406109118e-05, "loss": 0.8158, "mean_token_accuracy": 0.7605469450354576, "num_tokens": 91270659.0, "step": 2860 }, { "entropy": 0.9127984158694744, "epoch": 0.263230228693337, "grad_norm": 0.1617114096879959, "learning_rate": 9.122887723494955e-05, "loss": 0.9231, "mean_token_accuracy": 0.7382904104888439, "num_tokens": 91302414.0, "step": 2861 }, { "entropy": 0.8535359762609005, "epoch": 0.26332223506477825, "grad_norm": 0.15709994733333588, "learning_rate": 9.122581040880793e-05, "loss": 0.8376, "mean_token_accuracy": 0.7590136080980301, "num_tokens": 91333701.0, "step": 2862 }, { "entropy": 0.7941982317715883, "epoch": 0.26341424143621944, "grad_norm": 0.14809665083885193, "learning_rate": 9.122274358266631e-05, "loss": 0.7822, "mean_token_accuracy": 0.7742205001413822, "num_tokens": 91366092.0, "step": 2863 }, { "entropy": 0.8632979542016983, "epoch": 0.2635062478076607, "grad_norm": 0.15998363494873047, "learning_rate": 9.121967675652468e-05, "loss": 0.8276, "mean_token_accuracy": 0.7572339400649071, "num_tokens": 91396767.0, "step": 2864 }, { "entropy": 0.824711337685585, "epoch": 0.2635982541791019, "grad_norm": 0.15612611174583435, "learning_rate": 9.121660993038304e-05, "loss": 0.8021, "mean_token_accuracy": 0.7675869278609753, "num_tokens": 91428414.0, "step": 2865 }, { "entropy": 0.7608620505779982, "epoch": 0.2636902605505431, "grad_norm": 0.15361621975898743, "learning_rate": 9.121354310424143e-05, "loss": 0.7362, "mean_token_accuracy": 0.7831396125257015, "num_tokens": 91459325.0, "step": 2866 }, { "entropy": 0.7393491100519896, "epoch": 0.26378226692198437, "grad_norm": 0.15768975019454956, "learning_rate": 9.121047627809979e-05, "loss": 0.7437, "mean_token_accuracy": 0.7856949120759964, "num_tokens": 91491218.0, "step": 2867 }, { "entropy": 0.8564013615250587, "epoch": 0.26387427329342555, "grad_norm": 0.1622854620218277, "learning_rate": 9.120740945195817e-05, "loss": 0.8606, "mean_token_accuracy": 0.7504638582468033, "num_tokens": 91522857.0, "step": 2868 }, { "entropy": 0.7640153151005507, "epoch": 0.2639662796648668, "grad_norm": 0.1526128351688385, "learning_rate": 9.120434262581656e-05, "loss": 0.7614, "mean_token_accuracy": 0.7821603566408157, "num_tokens": 91555225.0, "step": 2869 }, { "entropy": 0.8451892659068108, "epoch": 0.264058286036308, "grad_norm": 0.15567843616008759, "learning_rate": 9.120127579967492e-05, "loss": 0.8434, "mean_token_accuracy": 0.7570932656526566, "num_tokens": 91587585.0, "step": 2870 }, { "entropy": 0.8831662386655807, "epoch": 0.26415029240774923, "grad_norm": 0.16364054381847382, "learning_rate": 9.119820897353329e-05, "loss": 0.8989, "mean_token_accuracy": 0.7451615929603577, "num_tokens": 91618649.0, "step": 2871 }, { "entropy": 0.8390093110501766, "epoch": 0.2642422987791905, "grad_norm": 0.16145792603492737, "learning_rate": 9.119514214739166e-05, "loss": 0.8523, "mean_token_accuracy": 0.7550773471593857, "num_tokens": 91650349.0, "step": 2872 }, { "entropy": 0.785961028188467, "epoch": 0.26433430515063167, "grad_norm": 0.15803658962249756, "learning_rate": 9.119207532125005e-05, "loss": 0.7759, "mean_token_accuracy": 0.774452917277813, "num_tokens": 91681555.0, "step": 2873 }, { "entropy": 0.7837657332420349, "epoch": 0.2644263115220729, "grad_norm": 0.15829838812351227, "learning_rate": 9.118900849510842e-05, "loss": 0.7933, "mean_token_accuracy": 0.7660886906087399, "num_tokens": 91713576.0, "step": 2874 }, { "entropy": 0.7725546509027481, "epoch": 0.2645183178935141, "grad_norm": 0.15627934038639069, "learning_rate": 9.118594166896679e-05, "loss": 0.7782, "mean_token_accuracy": 0.77275275811553, "num_tokens": 91744707.0, "step": 2875 }, { "entropy": 0.7898869682103395, "epoch": 0.26461032426495534, "grad_norm": 0.1603213995695114, "learning_rate": 9.118287484282516e-05, "loss": 0.7803, "mean_token_accuracy": 0.7797432765364647, "num_tokens": 91776712.0, "step": 2876 }, { "entropy": 0.9071152396500111, "epoch": 0.2647023306363966, "grad_norm": 0.15741148591041565, "learning_rate": 9.117980801668354e-05, "loss": 0.8936, "mean_token_accuracy": 0.7469187155365944, "num_tokens": 91808131.0, "step": 2877 }, { "entropy": 0.8437071479856968, "epoch": 0.2647943370078378, "grad_norm": 0.15946362912654877, "learning_rate": 9.117674119054192e-05, "loss": 0.8342, "mean_token_accuracy": 0.7586522698402405, "num_tokens": 91840340.0, "step": 2878 }, { "entropy": 0.7043415140360594, "epoch": 0.264886343379279, "grad_norm": 0.1533012092113495, "learning_rate": 9.117367436440029e-05, "loss": 0.697, "mean_token_accuracy": 0.7923924773931503, "num_tokens": 91871891.0, "step": 2879 }, { "entropy": 0.9167690686881542, "epoch": 0.2649783497507202, "grad_norm": 0.1651921272277832, "learning_rate": 9.117060753825866e-05, "loss": 0.9198, "mean_token_accuracy": 0.7363271266222, "num_tokens": 91903117.0, "step": 2880 }, { "entropy": 0.8919342905282974, "epoch": 0.26507035612216145, "grad_norm": 0.17178937792778015, "learning_rate": 9.116754071211704e-05, "loss": 0.8956, "mean_token_accuracy": 0.7447965256869793, "num_tokens": 91934716.0, "step": 2881 }, { "entropy": 0.8044457715004683, "epoch": 0.2651623624936027, "grad_norm": 0.16217562556266785, "learning_rate": 9.11644738859754e-05, "loss": 0.7923, "mean_token_accuracy": 0.7724172174930573, "num_tokens": 91966084.0, "step": 2882 }, { "entropy": 0.8430944606661797, "epoch": 0.2652543688650439, "grad_norm": 0.16241076588630676, "learning_rate": 9.116140705983379e-05, "loss": 0.8501, "mean_token_accuracy": 0.7550608702003956, "num_tokens": 91998704.0, "step": 2883 }, { "entropy": 0.9000072609633207, "epoch": 0.26534637523648513, "grad_norm": 0.16053444147109985, "learning_rate": 9.115834023369216e-05, "loss": 0.8824, "mean_token_accuracy": 0.750158466398716, "num_tokens": 92030954.0, "step": 2884 }, { "entropy": 0.823117857798934, "epoch": 0.2654383816079263, "grad_norm": 0.16174916923046112, "learning_rate": 9.115527340755054e-05, "loss": 0.8031, "mean_token_accuracy": 0.7711536437273026, "num_tokens": 92063026.0, "step": 2885 }, { "entropy": 0.8553418666124344, "epoch": 0.26553038797936757, "grad_norm": 0.16697604954242706, "learning_rate": 9.11522065814089e-05, "loss": 0.8709, "mean_token_accuracy": 0.7581527307629585, "num_tokens": 92093889.0, "step": 2886 }, { "entropy": 0.7681650277227163, "epoch": 0.2656223943508088, "grad_norm": 0.15844261646270752, "learning_rate": 9.114913975526727e-05, "loss": 0.7636, "mean_token_accuracy": 0.7791492380201817, "num_tokens": 92124839.0, "step": 2887 }, { "entropy": 0.8991984277963638, "epoch": 0.26571440072225, "grad_norm": 0.15928877890110016, "learning_rate": 9.114607292912565e-05, "loss": 0.8806, "mean_token_accuracy": 0.7502195201814175, "num_tokens": 92156031.0, "step": 2888 }, { "entropy": 0.8594846297055483, "epoch": 0.26580640709369124, "grad_norm": 0.16337630152702332, "learning_rate": 9.114300610298404e-05, "loss": 0.8592, "mean_token_accuracy": 0.7551096454262733, "num_tokens": 92187991.0, "step": 2889 }, { "entropy": 0.7958955056965351, "epoch": 0.26589841346513243, "grad_norm": 0.15973924100399017, "learning_rate": 9.11399392768424e-05, "loss": 0.7898, "mean_token_accuracy": 0.7729382999241352, "num_tokens": 92219315.0, "step": 2890 }, { "entropy": 0.90886639803648, "epoch": 0.2659904198365737, "grad_norm": 0.17257468402385712, "learning_rate": 9.113687245070077e-05, "loss": 0.9397, "mean_token_accuracy": 0.7339711040258408, "num_tokens": 92250846.0, "step": 2891 }, { "entropy": 0.8154808077961206, "epoch": 0.2660824262080149, "grad_norm": 0.15756358206272125, "learning_rate": 9.113380562455914e-05, "loss": 0.8086, "mean_token_accuracy": 0.7690202631056309, "num_tokens": 92282916.0, "step": 2892 }, { "entropy": 0.8200621511787176, "epoch": 0.2661744325794561, "grad_norm": 0.1587061583995819, "learning_rate": 9.113073879841752e-05, "loss": 0.8145, "mean_token_accuracy": 0.7684450931847095, "num_tokens": 92314731.0, "step": 2893 }, { "entropy": 0.849332869052887, "epoch": 0.26626643895089736, "grad_norm": 0.15811751782894135, "learning_rate": 9.11276719722759e-05, "loss": 0.8649, "mean_token_accuracy": 0.7503369934856892, "num_tokens": 92346809.0, "step": 2894 }, { "entropy": 0.8367020674049854, "epoch": 0.2663584453223386, "grad_norm": 0.1598115712404251, "learning_rate": 9.112460514613427e-05, "loss": 0.8535, "mean_token_accuracy": 0.7557095736265182, "num_tokens": 92379577.0, "step": 2895 }, { "entropy": 0.8189818188548088, "epoch": 0.2664504516937798, "grad_norm": 0.1513410061597824, "learning_rate": 9.112153831999264e-05, "loss": 0.7936, "mean_token_accuracy": 0.7660753056406975, "num_tokens": 92411369.0, "step": 2896 }, { "entropy": 0.8996575586497784, "epoch": 0.26654245806522103, "grad_norm": 0.15559642016887665, "learning_rate": 9.111847149385102e-05, "loss": 0.8901, "mean_token_accuracy": 0.7500637471675873, "num_tokens": 92443987.0, "step": 2897 }, { "entropy": 0.8338337130844593, "epoch": 0.2666344644366622, "grad_norm": 0.15110206604003906, "learning_rate": 9.111540466770939e-05, "loss": 0.8041, "mean_token_accuracy": 0.7675247602164745, "num_tokens": 92475801.0, "step": 2898 }, { "entropy": 0.8955620750784874, "epoch": 0.26672647080810347, "grad_norm": 0.16235193610191345, "learning_rate": 9.111233784156777e-05, "loss": 0.9014, "mean_token_accuracy": 0.7497307769954205, "num_tokens": 92507474.0, "step": 2899 }, { "entropy": 0.7747979369014502, "epoch": 0.2668184771795447, "grad_norm": 0.15141193568706512, "learning_rate": 9.110927101542615e-05, "loss": 0.7558, "mean_token_accuracy": 0.7786397077143192, "num_tokens": 92539698.0, "step": 2900 }, { "entropy": 0.8788194358348846, "epoch": 0.2669104835509859, "grad_norm": 0.15956534445285797, "learning_rate": 9.110620418928452e-05, "loss": 0.8697, "mean_token_accuracy": 0.7506467700004578, "num_tokens": 92571283.0, "step": 2901 }, { "entropy": 0.9128432534635067, "epoch": 0.26700248992242714, "grad_norm": 0.16231492161750793, "learning_rate": 9.110313736314289e-05, "loss": 0.9085, "mean_token_accuracy": 0.7441803254187107, "num_tokens": 92602349.0, "step": 2902 }, { "entropy": 0.8829511888325214, "epoch": 0.26709449629386833, "grad_norm": 0.15609730780124664, "learning_rate": 9.110007053700125e-05, "loss": 0.8773, "mean_token_accuracy": 0.7453111037611961, "num_tokens": 92634058.0, "step": 2903 }, { "entropy": 0.7983574941754341, "epoch": 0.2671865026653096, "grad_norm": 0.1558784544467926, "learning_rate": 9.109700371085963e-05, "loss": 0.8079, "mean_token_accuracy": 0.7669933512806892, "num_tokens": 92665572.0, "step": 2904 }, { "entropy": 0.7800601720809937, "epoch": 0.2672785090367508, "grad_norm": 0.15805236995220184, "learning_rate": 9.109393688471802e-05, "loss": 0.7808, "mean_token_accuracy": 0.7773460820317268, "num_tokens": 92697710.0, "step": 2905 }, { "entropy": 0.8505289610475302, "epoch": 0.267370515408192, "grad_norm": 0.1594640612602234, "learning_rate": 9.109087005857638e-05, "loss": 0.8392, "mean_token_accuracy": 0.7597367987036705, "num_tokens": 92729589.0, "step": 2906 }, { "entropy": 0.8507708162069321, "epoch": 0.26746252177963326, "grad_norm": 0.16113723814487457, "learning_rate": 9.108780323243475e-05, "loss": 0.8554, "mean_token_accuracy": 0.7566158138215542, "num_tokens": 92761875.0, "step": 2907 }, { "entropy": 0.8846883438527584, "epoch": 0.26755452815107444, "grad_norm": 0.16272105276584625, "learning_rate": 9.108473640629313e-05, "loss": 0.9047, "mean_token_accuracy": 0.743500791490078, "num_tokens": 92793426.0, "step": 2908 }, { "entropy": 0.6752659492194653, "epoch": 0.2676465345225157, "grad_norm": 0.1510891169309616, "learning_rate": 9.10816695801515e-05, "loss": 0.6671, "mean_token_accuracy": 0.8087419047951698, "num_tokens": 92825724.0, "step": 2909 }, { "entropy": 0.7795830480754375, "epoch": 0.26773854089395693, "grad_norm": 0.15684324502944946, "learning_rate": 9.107860275400988e-05, "loss": 0.7892, "mean_token_accuracy": 0.771674145013094, "num_tokens": 92857908.0, "step": 2910 }, { "entropy": 0.9761320091784, "epoch": 0.2678305472653981, "grad_norm": 0.16719605028629303, "learning_rate": 9.107553592786825e-05, "loss": 0.9619, "mean_token_accuracy": 0.7293858714401722, "num_tokens": 92889308.0, "step": 2911 }, { "entropy": 0.823435228317976, "epoch": 0.26792255363683937, "grad_norm": 0.1571776121854782, "learning_rate": 9.107246910172663e-05, "loss": 0.8294, "mean_token_accuracy": 0.7579174488782883, "num_tokens": 92920854.0, "step": 2912 }, { "entropy": 0.8957953471690416, "epoch": 0.26801456000828056, "grad_norm": 0.15853585302829742, "learning_rate": 9.1069402275585e-05, "loss": 0.8778, "mean_token_accuracy": 0.744007583707571, "num_tokens": 92952962.0, "step": 2913 }, { "entropy": 0.8084371648728848, "epoch": 0.2681065663797218, "grad_norm": 0.16267196834087372, "learning_rate": 9.106633544944337e-05, "loss": 0.8122, "mean_token_accuracy": 0.7675983980298042, "num_tokens": 92984400.0, "step": 2914 }, { "entropy": 0.9018083699047565, "epoch": 0.26819857275116304, "grad_norm": 0.16544367372989655, "learning_rate": 9.106326862330175e-05, "loss": 0.9078, "mean_token_accuracy": 0.742401834577322, "num_tokens": 93015908.0, "step": 2915 }, { "entropy": 0.879142738878727, "epoch": 0.26829057912260423, "grad_norm": 0.16020554304122925, "learning_rate": 9.106020179716013e-05, "loss": 0.8804, "mean_token_accuracy": 0.7469329871237278, "num_tokens": 93048321.0, "step": 2916 }, { "entropy": 0.859269879758358, "epoch": 0.2683825854940455, "grad_norm": 0.1559152901172638, "learning_rate": 9.10571349710185e-05, "loss": 0.8115, "mean_token_accuracy": 0.7651441097259521, "num_tokens": 93081089.0, "step": 2917 }, { "entropy": 0.8639744613319635, "epoch": 0.26847459186548667, "grad_norm": 0.1674472540616989, "learning_rate": 9.105406814487687e-05, "loss": 0.8427, "mean_token_accuracy": 0.7580380998551846, "num_tokens": 93112451.0, "step": 2918 }, { "entropy": 0.8322537131607533, "epoch": 0.2685665982369279, "grad_norm": 0.17146269977092743, "learning_rate": 9.105100131873523e-05, "loss": 0.8722, "mean_token_accuracy": 0.7552945762872696, "num_tokens": 93143763.0, "step": 2919 }, { "entropy": 0.7947008460760117, "epoch": 0.26865860460836916, "grad_norm": 0.15613186359405518, "learning_rate": 9.104793449259363e-05, "loss": 0.7873, "mean_token_accuracy": 0.7650721669197083, "num_tokens": 93174816.0, "step": 2920 }, { "entropy": 0.8995070029050112, "epoch": 0.26875061097981034, "grad_norm": 0.1625315099954605, "learning_rate": 9.1044867666452e-05, "loss": 0.8832, "mean_token_accuracy": 0.7479518763720989, "num_tokens": 93206158.0, "step": 2921 }, { "entropy": 0.8300111182034016, "epoch": 0.2688426173512516, "grad_norm": 0.1622701734304428, "learning_rate": 9.104180084031036e-05, "loss": 0.8244, "mean_token_accuracy": 0.7584727369248867, "num_tokens": 93238054.0, "step": 2922 }, { "entropy": 0.9338752888143063, "epoch": 0.2689346237226928, "grad_norm": 0.16942273080348969, "learning_rate": 9.103873401416873e-05, "loss": 0.9434, "mean_token_accuracy": 0.7347329258918762, "num_tokens": 93270044.0, "step": 2923 }, { "entropy": 0.8232596069574356, "epoch": 0.269026630094134, "grad_norm": 0.16149885952472687, "learning_rate": 9.103566718802711e-05, "loss": 0.8124, "mean_token_accuracy": 0.7658885605633259, "num_tokens": 93302047.0, "step": 2924 }, { "entropy": 0.754951748996973, "epoch": 0.26911863646557527, "grad_norm": 0.15347999334335327, "learning_rate": 9.10326003618855e-05, "loss": 0.7433, "mean_token_accuracy": 0.7825439125299454, "num_tokens": 93334438.0, "step": 2925 }, { "entropy": 0.7951746806502342, "epoch": 0.26921064283701646, "grad_norm": 0.15804728865623474, "learning_rate": 9.102953353574386e-05, "loss": 0.773, "mean_token_accuracy": 0.7748000472784042, "num_tokens": 93365996.0, "step": 2926 }, { "entropy": 0.8213299568742514, "epoch": 0.2693026492084577, "grad_norm": 0.15574048459529877, "learning_rate": 9.102646670960223e-05, "loss": 0.8194, "mean_token_accuracy": 0.7599941231310368, "num_tokens": 93398185.0, "step": 2927 }, { "entropy": 0.7681305482983589, "epoch": 0.2693946555798989, "grad_norm": 0.16501381993293762, "learning_rate": 9.102339988346061e-05, "loss": 0.7837, "mean_token_accuracy": 0.7771062403917313, "num_tokens": 93430577.0, "step": 2928 }, { "entropy": 0.8234260417521, "epoch": 0.26948666195134013, "grad_norm": 0.16909779608249664, "learning_rate": 9.102033305731898e-05, "loss": 0.8409, "mean_token_accuracy": 0.7594892494380474, "num_tokens": 93462344.0, "step": 2929 }, { "entropy": 0.8062184769660234, "epoch": 0.2695786683227814, "grad_norm": 0.1601000875234604, "learning_rate": 9.101726623117736e-05, "loss": 0.8077, "mean_token_accuracy": 0.7674770206212997, "num_tokens": 93494457.0, "step": 2930 }, { "entropy": 0.8409732431173325, "epoch": 0.26967067469422257, "grad_norm": 0.16319899260997772, "learning_rate": 9.101419940503574e-05, "loss": 0.8725, "mean_token_accuracy": 0.751792136579752, "num_tokens": 93526280.0, "step": 2931 }, { "entropy": 0.9390648119151592, "epoch": 0.2697626810656638, "grad_norm": 0.17106667160987854, "learning_rate": 9.101113257889411e-05, "loss": 0.9398, "mean_token_accuracy": 0.7320763543248177, "num_tokens": 93557434.0, "step": 2932 }, { "entropy": 0.8833139576017857, "epoch": 0.269854687437105, "grad_norm": 0.17753319442272186, "learning_rate": 9.100806575275248e-05, "loss": 0.8603, "mean_token_accuracy": 0.7535444386303425, "num_tokens": 93589609.0, "step": 2933 }, { "entropy": 0.7969068903476, "epoch": 0.26994669380854625, "grad_norm": 0.15432360768318176, "learning_rate": 9.100499892661085e-05, "loss": 0.7808, "mean_token_accuracy": 0.772589173167944, "num_tokens": 93622012.0, "step": 2934 }, { "entropy": 0.8587327469140291, "epoch": 0.2700387001799875, "grad_norm": 0.15856295824050903, "learning_rate": 9.100193210046923e-05, "loss": 0.8264, "mean_token_accuracy": 0.7618689090013504, "num_tokens": 93654050.0, "step": 2935 }, { "entropy": 0.708247160539031, "epoch": 0.2701307065514287, "grad_norm": 0.1483694314956665, "learning_rate": 9.099886527432761e-05, "loss": 0.6861, "mean_token_accuracy": 0.7980261296033859, "num_tokens": 93685526.0, "step": 2936 }, { "entropy": 0.7031150795519352, "epoch": 0.2702227129228699, "grad_norm": 0.142785906791687, "learning_rate": 9.099579844818598e-05, "loss": 0.6696, "mean_token_accuracy": 0.798668883740902, "num_tokens": 93717977.0, "step": 2937 }, { "entropy": 0.74162114597857, "epoch": 0.2703147192943111, "grad_norm": 0.14787058532238007, "learning_rate": 9.099273162204435e-05, "loss": 0.71, "mean_token_accuracy": 0.7896817810833454, "num_tokens": 93750294.0, "step": 2938 }, { "entropy": 0.788647098466754, "epoch": 0.27040672566575236, "grad_norm": 0.15811526775360107, "learning_rate": 9.098966479590273e-05, "loss": 0.7685, "mean_token_accuracy": 0.7755924426019192, "num_tokens": 93782450.0, "step": 2939 }, { "entropy": 0.8642611242830753, "epoch": 0.2704987320371936, "grad_norm": 0.1679096817970276, "learning_rate": 9.09865979697611e-05, "loss": 0.8838, "mean_token_accuracy": 0.7484699599444866, "num_tokens": 93814362.0, "step": 2940 }, { "entropy": 0.7897633705288172, "epoch": 0.2705907384086348, "grad_norm": 0.1521085798740387, "learning_rate": 9.098353114361948e-05, "loss": 0.779, "mean_token_accuracy": 0.7745413258671761, "num_tokens": 93846662.0, "step": 2941 }, { "entropy": 0.8136439248919487, "epoch": 0.27068274478007603, "grad_norm": 0.15939153730869293, "learning_rate": 9.098046431747784e-05, "loss": 0.8047, "mean_token_accuracy": 0.767129547894001, "num_tokens": 93878885.0, "step": 2942 }, { "entropy": 0.7881902754306793, "epoch": 0.2707747511515172, "grad_norm": 0.16863900423049927, "learning_rate": 9.097739749133623e-05, "loss": 0.7945, "mean_token_accuracy": 0.7710217796266079, "num_tokens": 93911130.0, "step": 2943 }, { "entropy": 0.8621927984058857, "epoch": 0.27086675752295847, "grad_norm": 0.16594620048999786, "learning_rate": 9.09743306651946e-05, "loss": 0.8853, "mean_token_accuracy": 0.7476134225726128, "num_tokens": 93942586.0, "step": 2944 }, { "entropy": 0.782697232440114, "epoch": 0.2709587638943997, "grad_norm": 0.15686047077178955, "learning_rate": 9.097126383905296e-05, "loss": 0.8043, "mean_token_accuracy": 0.7662477903068066, "num_tokens": 93974821.0, "step": 2945 }, { "entropy": 0.7212401553988457, "epoch": 0.2710507702658409, "grad_norm": 0.14853939414024353, "learning_rate": 9.096819701291134e-05, "loss": 0.7138, "mean_token_accuracy": 0.7913515493273735, "num_tokens": 94007336.0, "step": 2946 }, { "entropy": 0.7666271422058344, "epoch": 0.27114277663728215, "grad_norm": 0.15881362557411194, "learning_rate": 9.096513018676972e-05, "loss": 0.773, "mean_token_accuracy": 0.7732622623443604, "num_tokens": 94039504.0, "step": 2947 }, { "entropy": 0.9152071960270405, "epoch": 0.27123478300872333, "grad_norm": 0.16532039642333984, "learning_rate": 9.096206336062809e-05, "loss": 0.92, "mean_token_accuracy": 0.7424666732549667, "num_tokens": 94070964.0, "step": 2948 }, { "entropy": 0.916716668754816, "epoch": 0.2713267893801646, "grad_norm": 0.16701439023017883, "learning_rate": 9.095899653448646e-05, "loss": 0.9091, "mean_token_accuracy": 0.743901114910841, "num_tokens": 94102363.0, "step": 2949 }, { "entropy": 0.8728654514998198, "epoch": 0.2714187957516058, "grad_norm": 0.15661324560642242, "learning_rate": 9.095592970834483e-05, "loss": 0.8514, "mean_token_accuracy": 0.757886178791523, "num_tokens": 94134676.0, "step": 2950 }, { "entropy": 0.8328176867216825, "epoch": 0.271510802123047, "grad_norm": 0.1591370850801468, "learning_rate": 9.095286288220321e-05, "loss": 0.8199, "mean_token_accuracy": 0.7636412084102631, "num_tokens": 94165761.0, "step": 2951 }, { "entropy": 0.8107479028403759, "epoch": 0.27160280849448826, "grad_norm": 0.15338759124279022, "learning_rate": 9.094979605606159e-05, "loss": 0.8044, "mean_token_accuracy": 0.7673875987529755, "num_tokens": 94197842.0, "step": 2952 }, { "entropy": 0.8862663507461548, "epoch": 0.27169481486592945, "grad_norm": 0.16415540874004364, "learning_rate": 9.094672922991996e-05, "loss": 0.8867, "mean_token_accuracy": 0.7505876943469048, "num_tokens": 94229622.0, "step": 2953 }, { "entropy": 0.8763725962489843, "epoch": 0.2717868212373707, "grad_norm": 0.16790227591991425, "learning_rate": 9.094366240377833e-05, "loss": 0.8621, "mean_token_accuracy": 0.7538400143384933, "num_tokens": 94261997.0, "step": 2954 }, { "entropy": 0.884623434394598, "epoch": 0.27187882760881193, "grad_norm": 0.15819025039672852, "learning_rate": 9.094059557763671e-05, "loss": 0.8772, "mean_token_accuracy": 0.7479198016226292, "num_tokens": 94294294.0, "step": 2955 }, { "entropy": 0.8282515369355679, "epoch": 0.2719708339802531, "grad_norm": 0.16125279664993286, "learning_rate": 9.093752875149508e-05, "loss": 0.8273, "mean_token_accuracy": 0.7549436241388321, "num_tokens": 94325637.0, "step": 2956 }, { "entropy": 0.8680758066475391, "epoch": 0.27206284035169437, "grad_norm": 0.1641145646572113, "learning_rate": 9.093446192535346e-05, "loss": 0.8718, "mean_token_accuracy": 0.744707252830267, "num_tokens": 94357289.0, "step": 2957 }, { "entropy": 0.7880359161645174, "epoch": 0.27215484672313556, "grad_norm": 0.1616339534521103, "learning_rate": 9.093139509921183e-05, "loss": 0.7846, "mean_token_accuracy": 0.7716490402817726, "num_tokens": 94389155.0, "step": 2958 }, { "entropy": 0.9108173027634621, "epoch": 0.2722468530945768, "grad_norm": 0.1686721295118332, "learning_rate": 9.09283282730702e-05, "loss": 0.9142, "mean_token_accuracy": 0.7414024248719215, "num_tokens": 94420543.0, "step": 2959 }, { "entropy": 0.78360809199512, "epoch": 0.27233885946601805, "grad_norm": 0.15779073536396027, "learning_rate": 9.092526144692857e-05, "loss": 0.7713, "mean_token_accuracy": 0.7777864933013916, "num_tokens": 94452159.0, "step": 2960 }, { "entropy": 0.8400637730956078, "epoch": 0.27243086583745924, "grad_norm": 0.15700452029705048, "learning_rate": 9.092219462078696e-05, "loss": 0.8397, "mean_token_accuracy": 0.7588993087410927, "num_tokens": 94484159.0, "step": 2961 }, { "entropy": 0.7915164530277252, "epoch": 0.2725228722089005, "grad_norm": 0.15352746844291687, "learning_rate": 9.091912779464534e-05, "loss": 0.7864, "mean_token_accuracy": 0.7751951143145561, "num_tokens": 94516175.0, "step": 2962 }, { "entropy": 0.8328734748065472, "epoch": 0.27261487858034167, "grad_norm": 0.1576293259859085, "learning_rate": 9.09160609685037e-05, "loss": 0.8261, "mean_token_accuracy": 0.7598410397768021, "num_tokens": 94548095.0, "step": 2963 }, { "entropy": 0.8622080404311419, "epoch": 0.2727068849517829, "grad_norm": 0.1584637314081192, "learning_rate": 9.091299414236207e-05, "loss": 0.8308, "mean_token_accuracy": 0.7570712193846703, "num_tokens": 94579536.0, "step": 2964 }, { "entropy": 0.8583197500556707, "epoch": 0.27279889132322416, "grad_norm": 0.15359093248844147, "learning_rate": 9.090992731622044e-05, "loss": 0.8507, "mean_token_accuracy": 0.7597511447966099, "num_tokens": 94612002.0, "step": 2965 }, { "entropy": 0.772807827219367, "epoch": 0.27289089769466535, "grad_norm": 0.160162091255188, "learning_rate": 9.090686049007882e-05, "loss": 0.7881, "mean_token_accuracy": 0.7743915058672428, "num_tokens": 94643756.0, "step": 2966 }, { "entropy": 0.8693925552070141, "epoch": 0.2729829040661066, "grad_norm": 0.16301539540290833, "learning_rate": 9.09037936639372e-05, "loss": 0.8823, "mean_token_accuracy": 0.7461791448295116, "num_tokens": 94675115.0, "step": 2967 }, { "entropy": 0.8348445501178503, "epoch": 0.2730749104375478, "grad_norm": 0.15176229178905487, "learning_rate": 9.090072683779557e-05, "loss": 0.8239, "mean_token_accuracy": 0.7610224559903145, "num_tokens": 94706977.0, "step": 2968 }, { "entropy": 0.7776477113366127, "epoch": 0.273166916808989, "grad_norm": 0.1524350643157959, "learning_rate": 9.089766001165394e-05, "loss": 0.7787, "mean_token_accuracy": 0.7749852202832699, "num_tokens": 94739125.0, "step": 2969 }, { "entropy": 0.9166034385561943, "epoch": 0.27325892318043027, "grad_norm": 0.16388548910617828, "learning_rate": 9.089459318551232e-05, "loss": 0.9199, "mean_token_accuracy": 0.7411688752472401, "num_tokens": 94770736.0, "step": 2970 }, { "entropy": 0.8267360404133797, "epoch": 0.27335092955187146, "grad_norm": 0.16447369754314423, "learning_rate": 9.089152635937069e-05, "loss": 0.8417, "mean_token_accuracy": 0.7599836103618145, "num_tokens": 94802979.0, "step": 2971 }, { "entropy": 0.8375822231173515, "epoch": 0.2734429359233127, "grad_norm": 0.15226303040981293, "learning_rate": 9.088845953322907e-05, "loss": 0.8131, "mean_token_accuracy": 0.7628697380423546, "num_tokens": 94835711.0, "step": 2972 }, { "entropy": 0.8423245623707771, "epoch": 0.2735349422947539, "grad_norm": 0.1605745106935501, "learning_rate": 9.088539270708744e-05, "loss": 0.8116, "mean_token_accuracy": 0.7631172426044941, "num_tokens": 94867889.0, "step": 2973 }, { "entropy": 0.8679430782794952, "epoch": 0.27362694866619514, "grad_norm": 0.16649280488491058, "learning_rate": 9.088232588094582e-05, "loss": 0.8791, "mean_token_accuracy": 0.7484576813876629, "num_tokens": 94900297.0, "step": 2974 }, { "entropy": 0.9263138938695192, "epoch": 0.2737189550376364, "grad_norm": 0.16073080897331238, "learning_rate": 9.087925905480419e-05, "loss": 0.9172, "mean_token_accuracy": 0.7392488159239292, "num_tokens": 94932049.0, "step": 2975 }, { "entropy": 0.827193096280098, "epoch": 0.27381096140907757, "grad_norm": 0.16261929273605347, "learning_rate": 9.087619222866256e-05, "loss": 0.81, "mean_token_accuracy": 0.7655958086252213, "num_tokens": 94963836.0, "step": 2976 }, { "entropy": 0.8339664973318577, "epoch": 0.2739029677805188, "grad_norm": 0.18173347413539886, "learning_rate": 9.087312540252094e-05, "loss": 0.8137, "mean_token_accuracy": 0.7635317668318748, "num_tokens": 94995582.0, "step": 2977 }, { "entropy": 1.0048192217946053, "epoch": 0.27399497415196, "grad_norm": 0.16850464046001434, "learning_rate": 9.087005857637932e-05, "loss": 0.9898, "mean_token_accuracy": 0.7236749157309532, "num_tokens": 95027728.0, "step": 2978 }, { "entropy": 0.972122248262167, "epoch": 0.27408698052340125, "grad_norm": 0.17038923501968384, "learning_rate": 9.086699175023769e-05, "loss": 0.9576, "mean_token_accuracy": 0.7278411760926247, "num_tokens": 95059789.0, "step": 2979 }, { "entropy": 0.8699118886142969, "epoch": 0.2741789868948425, "grad_norm": 0.16425879299640656, "learning_rate": 9.086392492409605e-05, "loss": 0.8812, "mean_token_accuracy": 0.7451834864914417, "num_tokens": 95090763.0, "step": 2980 }, { "entropy": 0.8208758495748043, "epoch": 0.2742709932662837, "grad_norm": 0.15566222369670868, "learning_rate": 9.086085809795442e-05, "loss": 0.8041, "mean_token_accuracy": 0.7663186825811863, "num_tokens": 95121696.0, "step": 2981 }, { "entropy": 0.849691204726696, "epoch": 0.2743629996377249, "grad_norm": 0.1611594259738922, "learning_rate": 9.08577912718128e-05, "loss": 0.8578, "mean_token_accuracy": 0.7535506673157215, "num_tokens": 95153936.0, "step": 2982 }, { "entropy": 0.7956834398210049, "epoch": 0.2744550060091661, "grad_norm": 0.15793266892433167, "learning_rate": 9.085472444567118e-05, "loss": 0.7757, "mean_token_accuracy": 0.7756148315966129, "num_tokens": 95185547.0, "step": 2983 }, { "entropy": 0.8239380456507206, "epoch": 0.27454701238060736, "grad_norm": 0.1584516167640686, "learning_rate": 9.085165761952955e-05, "loss": 0.85, "mean_token_accuracy": 0.7543034441769123, "num_tokens": 95217162.0, "step": 2984 }, { "entropy": 0.8835084550082684, "epoch": 0.2746390187520486, "grad_norm": 0.16623002290725708, "learning_rate": 9.084859079338792e-05, "loss": 0.8925, "mean_token_accuracy": 0.7468123622238636, "num_tokens": 95248737.0, "step": 2985 }, { "entropy": 0.7768028266727924, "epoch": 0.2747310251234898, "grad_norm": 0.15412400662899017, "learning_rate": 9.08455239672463e-05, "loss": 0.7761, "mean_token_accuracy": 0.7758184373378754, "num_tokens": 95281158.0, "step": 2986 }, { "entropy": 0.8305335007607937, "epoch": 0.27482303149493104, "grad_norm": 0.1570277363061905, "learning_rate": 9.084245714110467e-05, "loss": 0.8062, "mean_token_accuracy": 0.7686524279415607, "num_tokens": 95312994.0, "step": 2987 }, { "entropy": 0.9706510528922081, "epoch": 0.2749150378663722, "grad_norm": 0.16239024698734283, "learning_rate": 9.083939031496305e-05, "loss": 0.9644, "mean_token_accuracy": 0.7262749038636684, "num_tokens": 95344817.0, "step": 2988 }, { "entropy": 0.8781954552978277, "epoch": 0.27500704423781347, "grad_norm": 0.15656183660030365, "learning_rate": 9.083632348882142e-05, "loss": 0.8761, "mean_token_accuracy": 0.7491669654846191, "num_tokens": 95376114.0, "step": 2989 }, { "entropy": 0.8731825575232506, "epoch": 0.2750990506092547, "grad_norm": 0.157260462641716, "learning_rate": 9.08332566626798e-05, "loss": 0.8535, "mean_token_accuracy": 0.7532857693731785, "num_tokens": 95408646.0, "step": 2990 }, { "entropy": 0.8857558965682983, "epoch": 0.2751910569806959, "grad_norm": 0.16027893126010895, "learning_rate": 9.083018983653817e-05, "loss": 0.8779, "mean_token_accuracy": 0.7472330816090107, "num_tokens": 95440773.0, "step": 2991 }, { "entropy": 0.9255579076707363, "epoch": 0.27528306335213715, "grad_norm": 0.1640411615371704, "learning_rate": 9.082712301039654e-05, "loss": 0.9313, "mean_token_accuracy": 0.7356943488121033, "num_tokens": 95472810.0, "step": 2992 }, { "entropy": 0.9703857898712158, "epoch": 0.27537506972357834, "grad_norm": 0.16848722100257874, "learning_rate": 9.082405618425493e-05, "loss": 0.9862, "mean_token_accuracy": 0.7236948944628239, "num_tokens": 95505014.0, "step": 2993 }, { "entropy": 0.9352265205234289, "epoch": 0.2754670760950196, "grad_norm": 0.164889857172966, "learning_rate": 9.08209893581133e-05, "loss": 0.9474, "mean_token_accuracy": 0.7310321778059006, "num_tokens": 95535632.0, "step": 2994 }, { "entropy": 0.7133045196533203, "epoch": 0.2755590824664608, "grad_norm": 0.15168532729148865, "learning_rate": 9.081792253197167e-05, "loss": 0.6987, "mean_token_accuracy": 0.7955734096467495, "num_tokens": 95567726.0, "step": 2995 }, { "entropy": 0.8008441478013992, "epoch": 0.275651088837902, "grad_norm": 0.1496473252773285, "learning_rate": 9.081485570583003e-05, "loss": 0.7892, "mean_token_accuracy": 0.7716951742768288, "num_tokens": 95600049.0, "step": 2996 }, { "entropy": 0.8313410133123398, "epoch": 0.27574309520934326, "grad_norm": 0.16158482432365417, "learning_rate": 9.081178887968842e-05, "loss": 0.8374, "mean_token_accuracy": 0.7552817352116108, "num_tokens": 95632380.0, "step": 2997 }, { "entropy": 0.7395443581044674, "epoch": 0.27583510158078445, "grad_norm": 0.15348933637142181, "learning_rate": 9.08087220535468e-05, "loss": 0.7413, "mean_token_accuracy": 0.7850919403135777, "num_tokens": 95664885.0, "step": 2998 }, { "entropy": 0.8483192902058363, "epoch": 0.2759271079522257, "grad_norm": 0.1603902280330658, "learning_rate": 9.080565522740517e-05, "loss": 0.8638, "mean_token_accuracy": 0.7512321062386036, "num_tokens": 95697242.0, "step": 2999 }, { "entropy": 0.8169868588447571, "epoch": 0.27601911432366694, "grad_norm": 0.16765935719013214, "learning_rate": 9.080258840126353e-05, "loss": 0.8414, "mean_token_accuracy": 0.7566691935062408, "num_tokens": 95729269.0, "step": 3000 }, { "entropy": 0.8693693690001965, "epoch": 0.2761111206951081, "grad_norm": 0.1639304757118225, "learning_rate": 9.079952157512191e-05, "loss": 0.8652, "mean_token_accuracy": 0.7511313483119011, "num_tokens": 95761172.0, "step": 3001 }, { "entropy": 0.8800292164087296, "epoch": 0.27620312706654937, "grad_norm": 0.1628619283437729, "learning_rate": 9.079645474898028e-05, "loss": 0.8764, "mean_token_accuracy": 0.748461801558733, "num_tokens": 95793369.0, "step": 3002 }, { "entropy": 0.8230822794139385, "epoch": 0.27629513343799056, "grad_norm": 0.1606339067220688, "learning_rate": 9.079338792283866e-05, "loss": 0.8047, "mean_token_accuracy": 0.76668830960989, "num_tokens": 95825065.0, "step": 3003 }, { "entropy": 0.8763422165066004, "epoch": 0.2763871398094318, "grad_norm": 0.15909306704998016, "learning_rate": 9.079032109669703e-05, "loss": 0.8644, "mean_token_accuracy": 0.7526733800768852, "num_tokens": 95857430.0, "step": 3004 }, { "entropy": 0.8709813579916954, "epoch": 0.27647914618087305, "grad_norm": 0.16085666418075562, "learning_rate": 9.078725427055541e-05, "loss": 0.8673, "mean_token_accuracy": 0.7520282082259655, "num_tokens": 95889812.0, "step": 3005 }, { "entropy": 0.8156521767377853, "epoch": 0.27657115255231424, "grad_norm": 0.1562260240316391, "learning_rate": 9.078418744441378e-05, "loss": 0.801, "mean_token_accuracy": 0.7634498700499535, "num_tokens": 95920754.0, "step": 3006 }, { "entropy": 0.8744444735348225, "epoch": 0.2766631589237555, "grad_norm": 0.16485761106014252, "learning_rate": 9.078112061827215e-05, "loss": 0.8779, "mean_token_accuracy": 0.7486506588757038, "num_tokens": 95952618.0, "step": 3007 }, { "entropy": 0.8764996509999037, "epoch": 0.27675516529519667, "grad_norm": 0.15946827828884125, "learning_rate": 9.077805379213053e-05, "loss": 0.8578, "mean_token_accuracy": 0.7561634182929993, "num_tokens": 95984934.0, "step": 3008 }, { "entropy": 0.8214257098734379, "epoch": 0.2768471716666379, "grad_norm": 0.15322959423065186, "learning_rate": 9.077498696598891e-05, "loss": 0.7879, "mean_token_accuracy": 0.7733931690454483, "num_tokens": 96017012.0, "step": 3009 }, { "entropy": 0.7694719340652227, "epoch": 0.27693917803807916, "grad_norm": 0.15115885436534882, "learning_rate": 9.077192013984728e-05, "loss": 0.7501, "mean_token_accuracy": 0.7830321080982685, "num_tokens": 96049137.0, "step": 3010 }, { "entropy": 0.7702351287007332, "epoch": 0.27703118440952035, "grad_norm": 0.15306374430656433, "learning_rate": 9.076885331370565e-05, "loss": 0.7515, "mean_token_accuracy": 0.779937133193016, "num_tokens": 96080694.0, "step": 3011 }, { "entropy": 0.8132718652486801, "epoch": 0.2771231907809616, "grad_norm": 0.15643073618412018, "learning_rate": 9.076578648756402e-05, "loss": 0.8238, "mean_token_accuracy": 0.7605291269719601, "num_tokens": 96112615.0, "step": 3012 }, { "entropy": 0.809041814878583, "epoch": 0.2772151971524028, "grad_norm": 0.15925423800945282, "learning_rate": 9.07627196614224e-05, "loss": 0.8176, "mean_token_accuracy": 0.7614431530237198, "num_tokens": 96144276.0, "step": 3013 }, { "entropy": 0.8340934030711651, "epoch": 0.277307203523844, "grad_norm": 0.1632581204175949, "learning_rate": 9.075965283528078e-05, "loss": 0.83, "mean_token_accuracy": 0.7579736672341824, "num_tokens": 96175532.0, "step": 3014 }, { "entropy": 0.8343224413692951, "epoch": 0.27739920989528527, "grad_norm": 0.15912485122680664, "learning_rate": 9.075658600913915e-05, "loss": 0.8399, "mean_token_accuracy": 0.7596706598997116, "num_tokens": 96208197.0, "step": 3015 }, { "entropy": 0.8033910486847162, "epoch": 0.27749121626672646, "grad_norm": 0.15847407281398773, "learning_rate": 9.075351918299751e-05, "loss": 0.7928, "mean_token_accuracy": 0.7677336372435093, "num_tokens": 96239988.0, "step": 3016 }, { "entropy": 0.80944231338799, "epoch": 0.2775832226381677, "grad_norm": 0.16358715295791626, "learning_rate": 9.07504523568559e-05, "loss": 0.8023, "mean_token_accuracy": 0.7688773572444916, "num_tokens": 96271670.0, "step": 3017 }, { "entropy": 0.8125239014625549, "epoch": 0.2776752290096089, "grad_norm": 0.15767213702201843, "learning_rate": 9.074738553071426e-05, "loss": 0.7968, "mean_token_accuracy": 0.7673500031232834, "num_tokens": 96303581.0, "step": 3018 }, { "entropy": 0.7828193064779043, "epoch": 0.27776723538105014, "grad_norm": 0.1558314561843872, "learning_rate": 9.074431870457264e-05, "loss": 0.7975, "mean_token_accuracy": 0.7695734240114689, "num_tokens": 96335978.0, "step": 3019 }, { "entropy": 0.9847223199903965, "epoch": 0.2778592417524914, "grad_norm": 0.17096324265003204, "learning_rate": 9.074125187843101e-05, "loss": 0.9865, "mean_token_accuracy": 0.722423754632473, "num_tokens": 96367788.0, "step": 3020 }, { "entropy": 0.8184599839150906, "epoch": 0.27795124812393257, "grad_norm": 0.15131962299346924, "learning_rate": 9.07381850522894e-05, "loss": 0.8203, "mean_token_accuracy": 0.7622746899724007, "num_tokens": 96400436.0, "step": 3021 }, { "entropy": 0.835424954071641, "epoch": 0.2780432544953738, "grad_norm": 0.16169176995754242, "learning_rate": 9.073511822614776e-05, "loss": 0.8073, "mean_token_accuracy": 0.766181580722332, "num_tokens": 96432150.0, "step": 3022 }, { "entropy": 0.8430908862501383, "epoch": 0.278135260866815, "grad_norm": 0.1576007753610611, "learning_rate": 9.073205140000613e-05, "loss": 0.8274, "mean_token_accuracy": 0.7616921812295914, "num_tokens": 96464588.0, "step": 3023 }, { "entropy": 0.9960003159940243, "epoch": 0.27822726723825625, "grad_norm": 0.170658677816391, "learning_rate": 9.072898457386451e-05, "loss": 1.0038, "mean_token_accuracy": 0.7194048874080181, "num_tokens": 96496449.0, "step": 3024 }, { "entropy": 0.9057288207113743, "epoch": 0.2783192736096975, "grad_norm": 0.1563260406255722, "learning_rate": 9.072591774772289e-05, "loss": 0.8911, "mean_token_accuracy": 0.7481472454965115, "num_tokens": 96528644.0, "step": 3025 }, { "entropy": 0.8190557882189751, "epoch": 0.2784112799811387, "grad_norm": 0.15884803235530853, "learning_rate": 9.072285092158126e-05, "loss": 0.8293, "mean_token_accuracy": 0.7597166784107685, "num_tokens": 96560295.0, "step": 3026 }, { "entropy": 0.8881460875272751, "epoch": 0.2785032863525799, "grad_norm": 0.15954580903053284, "learning_rate": 9.071978409543963e-05, "loss": 0.879, "mean_token_accuracy": 0.7495601177215576, "num_tokens": 96592206.0, "step": 3027 }, { "entropy": 0.7762919329106808, "epoch": 0.2785952927240211, "grad_norm": 0.1603749692440033, "learning_rate": 9.071671726929801e-05, "loss": 0.7737, "mean_token_accuracy": 0.7778223156929016, "num_tokens": 96624077.0, "step": 3028 }, { "entropy": 0.9041752405464649, "epoch": 0.27868729909546236, "grad_norm": 0.1616906374692917, "learning_rate": 9.071365044315638e-05, "loss": 0.9061, "mean_token_accuracy": 0.7449831888079643, "num_tokens": 96656327.0, "step": 3029 }, { "entropy": 0.8395270928740501, "epoch": 0.2787793054669036, "grad_norm": 0.1572946012020111, "learning_rate": 9.071058361701476e-05, "loss": 0.8253, "mean_token_accuracy": 0.7624619826674461, "num_tokens": 96688730.0, "step": 3030 }, { "entropy": 0.9404210057109594, "epoch": 0.2788713118383448, "grad_norm": 0.16468746960163116, "learning_rate": 9.070751679087313e-05, "loss": 0.9472, "mean_token_accuracy": 0.7325521782040596, "num_tokens": 96720694.0, "step": 3031 }, { "entropy": 0.8453200533986092, "epoch": 0.27896331820978604, "grad_norm": 0.15862196683883667, "learning_rate": 9.070444996473151e-05, "loss": 0.8425, "mean_token_accuracy": 0.7599583938717842, "num_tokens": 96752851.0, "step": 3032 }, { "entropy": 0.9402693547308445, "epoch": 0.2790553245812272, "grad_norm": 0.16938772797584534, "learning_rate": 9.070138313858988e-05, "loss": 0.946, "mean_token_accuracy": 0.7348719388246536, "num_tokens": 96784744.0, "step": 3033 }, { "entropy": 0.8861788269132376, "epoch": 0.27914733095266847, "grad_norm": 0.16145122051239014, "learning_rate": 9.069831631244824e-05, "loss": 0.8833, "mean_token_accuracy": 0.7482912875711918, "num_tokens": 96816940.0, "step": 3034 }, { "entropy": 0.8151098862290382, "epoch": 0.2792393373241097, "grad_norm": 0.1536400318145752, "learning_rate": 9.069524948630663e-05, "loss": 0.8215, "mean_token_accuracy": 0.7623922787606716, "num_tokens": 96849156.0, "step": 3035 }, { "entropy": 0.798476368188858, "epoch": 0.2793313436955509, "grad_norm": 0.1630336046218872, "learning_rate": 9.069218266016501e-05, "loss": 0.8238, "mean_token_accuracy": 0.7663250789046288, "num_tokens": 96880701.0, "step": 3036 }, { "entropy": 0.8838012348860502, "epoch": 0.27942335006699215, "grad_norm": 0.167633518576622, "learning_rate": 9.068911583402337e-05, "loss": 0.8865, "mean_token_accuracy": 0.7489401549100876, "num_tokens": 96912675.0, "step": 3037 }, { "entropy": 0.8552806749939919, "epoch": 0.27951535643843334, "grad_norm": 0.16118790209293365, "learning_rate": 9.068604900788174e-05, "loss": 0.8533, "mean_token_accuracy": 0.7546300143003464, "num_tokens": 96944602.0, "step": 3038 }, { "entropy": 0.818317661061883, "epoch": 0.2796073628098746, "grad_norm": 0.15386563539505005, "learning_rate": 9.068298218174011e-05, "loss": 0.8036, "mean_token_accuracy": 0.7656272016465664, "num_tokens": 96976155.0, "step": 3039 }, { "entropy": 0.8429694045335054, "epoch": 0.2796993691813158, "grad_norm": 0.16196073591709137, "learning_rate": 9.06799153555985e-05, "loss": 0.8482, "mean_token_accuracy": 0.756141223013401, "num_tokens": 97007825.0, "step": 3040 }, { "entropy": 0.9398678317666054, "epoch": 0.279791375552757, "grad_norm": 0.16179198026657104, "learning_rate": 9.067684852945687e-05, "loss": 0.9357, "mean_token_accuracy": 0.7334702424705029, "num_tokens": 97040003.0, "step": 3041 }, { "entropy": 0.8921387400478125, "epoch": 0.27988338192419826, "grad_norm": 0.16059865057468414, "learning_rate": 9.067378170331524e-05, "loss": 0.8662, "mean_token_accuracy": 0.7533046007156372, "num_tokens": 97071574.0, "step": 3042 }, { "entropy": 0.7835614439100027, "epoch": 0.27997538829563945, "grad_norm": 0.15247178077697754, "learning_rate": 9.067071487717361e-05, "loss": 0.7748, "mean_token_accuracy": 0.7723787650465965, "num_tokens": 97103588.0, "step": 3043 }, { "entropy": 0.7534362487494946, "epoch": 0.2800673946670807, "grad_norm": 0.15129807591438293, "learning_rate": 9.066764805103199e-05, "loss": 0.7212, "mean_token_accuracy": 0.7908092476427555, "num_tokens": 97135374.0, "step": 3044 }, { "entropy": 0.8090875055640936, "epoch": 0.28015940103852194, "grad_norm": 0.15282028913497925, "learning_rate": 9.066458122489037e-05, "loss": 0.7916, "mean_token_accuracy": 0.7709947191178799, "num_tokens": 97167961.0, "step": 3045 }, { "entropy": 0.8359926640987396, "epoch": 0.2802514074099631, "grad_norm": 0.15902599692344666, "learning_rate": 9.066151439874874e-05, "loss": 0.8219, "mean_token_accuracy": 0.7627169527113438, "num_tokens": 97200600.0, "step": 3046 }, { "entropy": 0.8003830555826426, "epoch": 0.28034341378140437, "grad_norm": 0.16334044933319092, "learning_rate": 9.065844757260711e-05, "loss": 0.7936, "mean_token_accuracy": 0.7708536833524704, "num_tokens": 97233368.0, "step": 3047 }, { "entropy": 0.7821346186101437, "epoch": 0.28043542015284556, "grad_norm": 0.15913254022598267, "learning_rate": 9.065538074646549e-05, "loss": 0.7749, "mean_token_accuracy": 0.7756946943700314, "num_tokens": 97264889.0, "step": 3048 }, { "entropy": 0.805832352489233, "epoch": 0.2805274265242868, "grad_norm": 0.16600418090820312, "learning_rate": 9.065231392032386e-05, "loss": 0.8469, "mean_token_accuracy": 0.7600515447556973, "num_tokens": 97296756.0, "step": 3049 }, { "entropy": 0.8462393563240767, "epoch": 0.28061943289572805, "grad_norm": 0.15984047949314117, "learning_rate": 9.064924709418224e-05, "loss": 0.8445, "mean_token_accuracy": 0.7557237260043621, "num_tokens": 97328666.0, "step": 3050 }, { "entropy": 0.8026137910783291, "epoch": 0.28071143926716924, "grad_norm": 0.15483611822128296, "learning_rate": 9.06461802680406e-05, "loss": 0.7951, "mean_token_accuracy": 0.7683999054133892, "num_tokens": 97360986.0, "step": 3051 }, { "entropy": 0.8257872983813286, "epoch": 0.2808034456386105, "grad_norm": 0.15431053936481476, "learning_rate": 9.064311344189899e-05, "loss": 0.8256, "mean_token_accuracy": 0.7610511183738708, "num_tokens": 97393084.0, "step": 3052 }, { "entropy": 0.7798477001488209, "epoch": 0.28089545201005167, "grad_norm": 0.16909031569957733, "learning_rate": 9.064004661575736e-05, "loss": 0.779, "mean_token_accuracy": 0.7751521952450275, "num_tokens": 97424491.0, "step": 3053 }, { "entropy": 0.9191584587097168, "epoch": 0.2809874583814929, "grad_norm": 0.16286154091358185, "learning_rate": 9.063697978961572e-05, "loss": 0.9228, "mean_token_accuracy": 0.736426517367363, "num_tokens": 97456431.0, "step": 3054 }, { "entropy": 0.8285694122314453, "epoch": 0.28107946475293416, "grad_norm": 0.1614476442337036, "learning_rate": 9.06339129634741e-05, "loss": 0.8291, "mean_token_accuracy": 0.7660128250718117, "num_tokens": 97488083.0, "step": 3055 }, { "entropy": 0.8523181714117527, "epoch": 0.28117147112437535, "grad_norm": 0.15937291085720062, "learning_rate": 9.063084613733249e-05, "loss": 0.8568, "mean_token_accuracy": 0.7619453556835651, "num_tokens": 97519872.0, "step": 3056 }, { "entropy": 0.7502105161547661, "epoch": 0.2812634774958166, "grad_norm": 0.14728102087974548, "learning_rate": 9.062777931119085e-05, "loss": 0.7266, "mean_token_accuracy": 0.7874207384884357, "num_tokens": 97552433.0, "step": 3057 }, { "entropy": 0.8058000989258289, "epoch": 0.2813554838672578, "grad_norm": 0.16382227838039398, "learning_rate": 9.062471248504922e-05, "loss": 0.7947, "mean_token_accuracy": 0.774554904550314, "num_tokens": 97583795.0, "step": 3058 }, { "entropy": 0.8055105842649937, "epoch": 0.281447490238699, "grad_norm": 0.15083789825439453, "learning_rate": 9.06216456589076e-05, "loss": 0.7987, "mean_token_accuracy": 0.7666711732745171, "num_tokens": 97616522.0, "step": 3059 }, { "entropy": 0.8919007368385792, "epoch": 0.28153949661014027, "grad_norm": 0.1586141139268875, "learning_rate": 9.061857883276597e-05, "loss": 0.891, "mean_token_accuracy": 0.7464226670563221, "num_tokens": 97648412.0, "step": 3060 }, { "entropy": 0.8744392860680819, "epoch": 0.28163150298158146, "grad_norm": 0.16142630577087402, "learning_rate": 9.061551200662435e-05, "loss": 0.8421, "mean_token_accuracy": 0.7628076300024986, "num_tokens": 97680318.0, "step": 3061 }, { "entropy": 0.895501621067524, "epoch": 0.2817235093530227, "grad_norm": 0.16055206954479218, "learning_rate": 9.061244518048272e-05, "loss": 0.9073, "mean_token_accuracy": 0.7470449060201645, "num_tokens": 97712767.0, "step": 3062 }, { "entropy": 0.8257643133401871, "epoch": 0.2818155157244639, "grad_norm": 0.1566387414932251, "learning_rate": 9.06093783543411e-05, "loss": 0.8303, "mean_token_accuracy": 0.7620800398290157, "num_tokens": 97745220.0, "step": 3063 }, { "entropy": 0.7799400016665459, "epoch": 0.28190752209590514, "grad_norm": 0.15435372292995453, "learning_rate": 9.060631152819947e-05, "loss": 0.7895, "mean_token_accuracy": 0.7704638950526714, "num_tokens": 97777634.0, "step": 3064 }, { "entropy": 0.7662400212138891, "epoch": 0.2819995284673464, "grad_norm": 0.15818148851394653, "learning_rate": 9.060324470205784e-05, "loss": 0.7867, "mean_token_accuracy": 0.7753710113465786, "num_tokens": 97809691.0, "step": 3065 }, { "entropy": 0.8174676727503538, "epoch": 0.28209153483878757, "grad_norm": 0.15302205085754395, "learning_rate": 9.060017787591622e-05, "loss": 0.798, "mean_token_accuracy": 0.7655254118144512, "num_tokens": 97841987.0, "step": 3066 }, { "entropy": 0.9534072820097208, "epoch": 0.2821835412102288, "grad_norm": 0.16089847683906555, "learning_rate": 9.05971110497746e-05, "loss": 0.9536, "mean_token_accuracy": 0.7315220758318901, "num_tokens": 97874530.0, "step": 3067 }, { "entropy": 0.8149995841085911, "epoch": 0.28227554758167, "grad_norm": 0.16063201427459717, "learning_rate": 9.059404422363297e-05, "loss": 0.8177, "mean_token_accuracy": 0.7629222795367241, "num_tokens": 97906517.0, "step": 3068 }, { "entropy": 0.8324655145406723, "epoch": 0.28236755395311125, "grad_norm": 0.16079318523406982, "learning_rate": 9.059097739749134e-05, "loss": 0.839, "mean_token_accuracy": 0.7547195442020893, "num_tokens": 97937548.0, "step": 3069 }, { "entropy": 0.8642386943101883, "epoch": 0.2824595603245525, "grad_norm": 0.1580801159143448, "learning_rate": 9.05879105713497e-05, "loss": 0.8412, "mean_token_accuracy": 0.7550255581736565, "num_tokens": 97969143.0, "step": 3070 }, { "entropy": 0.8299300596117973, "epoch": 0.2825515666959937, "grad_norm": 0.16148485243320465, "learning_rate": 9.058484374520809e-05, "loss": 0.8098, "mean_token_accuracy": 0.7669722102582455, "num_tokens": 98000965.0, "step": 3071 }, { "entropy": 0.9005648866295815, "epoch": 0.28264357306743493, "grad_norm": 0.16422882676124573, "learning_rate": 9.058177691906647e-05, "loss": 0.8902, "mean_token_accuracy": 0.7457572259008884, "num_tokens": 98033260.0, "step": 3072 }, { "entropy": 0.8796969074755907, "epoch": 0.2827355794388761, "grad_norm": 0.16038139164447784, "learning_rate": 9.057871009292484e-05, "loss": 0.8418, "mean_token_accuracy": 0.7581736892461777, "num_tokens": 98064984.0, "step": 3073 }, { "entropy": 0.8651132434606552, "epoch": 0.28282758581031736, "grad_norm": 0.16356372833251953, "learning_rate": 9.05756432667832e-05, "loss": 0.8717, "mean_token_accuracy": 0.7478417754173279, "num_tokens": 98095868.0, "step": 3074 }, { "entropy": 0.7930840700864792, "epoch": 0.2829195921817586, "grad_norm": 0.1515609174966812, "learning_rate": 9.057257644064158e-05, "loss": 0.7778, "mean_token_accuracy": 0.7674641124904156, "num_tokens": 98127444.0, "step": 3075 }, { "entropy": 0.8619761653244495, "epoch": 0.2830115985531998, "grad_norm": 0.15919014811515808, "learning_rate": 9.056950961449995e-05, "loss": 0.8613, "mean_token_accuracy": 0.7554102391004562, "num_tokens": 98159740.0, "step": 3076 }, { "entropy": 0.8028708919882774, "epoch": 0.28310360492464104, "grad_norm": 0.15689590573310852, "learning_rate": 9.056644278835833e-05, "loss": 0.8064, "mean_token_accuracy": 0.7698930278420448, "num_tokens": 98192491.0, "step": 3077 }, { "entropy": 0.9225743003189564, "epoch": 0.28319561129608223, "grad_norm": 0.16179214417934418, "learning_rate": 9.05633759622167e-05, "loss": 0.9223, "mean_token_accuracy": 0.7406904250383377, "num_tokens": 98224647.0, "step": 3078 }, { "entropy": 0.7647452671080828, "epoch": 0.2832876176675235, "grad_norm": 0.15198369324207306, "learning_rate": 9.056030913607508e-05, "loss": 0.7501, "mean_token_accuracy": 0.7847459651529789, "num_tokens": 98257415.0, "step": 3079 }, { "entropy": 0.9177891463041306, "epoch": 0.2833796240389647, "grad_norm": 0.16940373182296753, "learning_rate": 9.055724230993345e-05, "loss": 0.9363, "mean_token_accuracy": 0.7325453124940395, "num_tokens": 98288948.0, "step": 3080 }, { "entropy": 0.7609867490828037, "epoch": 0.2834716304104059, "grad_norm": 0.16112639009952545, "learning_rate": 9.055417548379183e-05, "loss": 0.7942, "mean_token_accuracy": 0.7682326473295689, "num_tokens": 98321475.0, "step": 3081 }, { "entropy": 0.836707029491663, "epoch": 0.28356363678184715, "grad_norm": 0.16386058926582336, "learning_rate": 9.055110865765021e-05, "loss": 0.8269, "mean_token_accuracy": 0.7591743320226669, "num_tokens": 98352572.0, "step": 3082 }, { "entropy": 0.8032928518950939, "epoch": 0.28365564315328834, "grad_norm": 0.15402673184871674, "learning_rate": 9.054804183150858e-05, "loss": 0.7981, "mean_token_accuracy": 0.7737603895366192, "num_tokens": 98384812.0, "step": 3083 }, { "entropy": 0.8499354403465986, "epoch": 0.2837476495247296, "grad_norm": 0.15929797291755676, "learning_rate": 9.054497500536695e-05, "loss": 0.8609, "mean_token_accuracy": 0.7508604116737843, "num_tokens": 98417297.0, "step": 3084 }, { "entropy": 0.810573399066925, "epoch": 0.28383965589617083, "grad_norm": 0.15518584847450256, "learning_rate": 9.054190817922532e-05, "loss": 0.7833, "mean_token_accuracy": 0.7707192599773407, "num_tokens": 98449583.0, "step": 3085 }, { "entropy": 0.7879952937364578, "epoch": 0.283931662267612, "grad_norm": 0.15002979338169098, "learning_rate": 9.05388413530837e-05, "loss": 0.7678, "mean_token_accuracy": 0.7791833467781544, "num_tokens": 98481880.0, "step": 3086 }, { "entropy": 0.7806288655847311, "epoch": 0.28402366863905326, "grad_norm": 0.14743085205554962, "learning_rate": 9.053577452694208e-05, "loss": 0.7323, "mean_token_accuracy": 0.7849676348268986, "num_tokens": 98513224.0, "step": 3087 }, { "entropy": 0.8469027169048786, "epoch": 0.28411567501049445, "grad_norm": 0.15564970672130585, "learning_rate": 9.053270770080045e-05, "loss": 0.8235, "mean_token_accuracy": 0.7540691643953323, "num_tokens": 98545214.0, "step": 3088 }, { "entropy": 0.8932507634162903, "epoch": 0.2842076813819357, "grad_norm": 0.1692371517419815, "learning_rate": 9.052964087465882e-05, "loss": 0.9027, "mean_token_accuracy": 0.7469326891005039, "num_tokens": 98576557.0, "step": 3089 }, { "entropy": 0.8761426098644733, "epoch": 0.28429968775337694, "grad_norm": 0.15378201007843018, "learning_rate": 9.05265740485172e-05, "loss": 0.8704, "mean_token_accuracy": 0.7483561374247074, "num_tokens": 98608677.0, "step": 3090 }, { "entropy": 0.8269048593938351, "epoch": 0.28439169412481813, "grad_norm": 0.1552077978849411, "learning_rate": 9.052350722237557e-05, "loss": 0.8306, "mean_token_accuracy": 0.757621992379427, "num_tokens": 98640232.0, "step": 3091 }, { "entropy": 0.8117869514971972, "epoch": 0.2844837004962594, "grad_norm": 0.1597934365272522, "learning_rate": 9.052044039623395e-05, "loss": 0.8182, "mean_token_accuracy": 0.7677733525633812, "num_tokens": 98670894.0, "step": 3092 }, { "entropy": 0.802549721673131, "epoch": 0.28457570686770056, "grad_norm": 0.15804684162139893, "learning_rate": 9.051737357009231e-05, "loss": 0.7812, "mean_token_accuracy": 0.7715202569961548, "num_tokens": 98703300.0, "step": 3093 }, { "entropy": 0.8448434248566628, "epoch": 0.2846677132391418, "grad_norm": 0.1557283103466034, "learning_rate": 9.05143067439507e-05, "loss": 0.8498, "mean_token_accuracy": 0.7547202594578266, "num_tokens": 98735346.0, "step": 3094 }, { "entropy": 0.8748458810150623, "epoch": 0.28475971961058305, "grad_norm": 0.15854433178901672, "learning_rate": 9.051123991780906e-05, "loss": 0.8819, "mean_token_accuracy": 0.7493801862001419, "num_tokens": 98767853.0, "step": 3095 }, { "entropy": 0.7921118885278702, "epoch": 0.28485172598202424, "grad_norm": 0.16472604870796204, "learning_rate": 9.050817309166743e-05, "loss": 0.8245, "mean_token_accuracy": 0.7597777023911476, "num_tokens": 98799964.0, "step": 3096 }, { "entropy": 0.8888745531439781, "epoch": 0.2849437323534655, "grad_norm": 0.17468230426311493, "learning_rate": 9.050510626552581e-05, "loss": 0.9044, "mean_token_accuracy": 0.7406248860061169, "num_tokens": 98830925.0, "step": 3097 }, { "entropy": 0.7907113265246153, "epoch": 0.2850357387249067, "grad_norm": 0.16478045284748077, "learning_rate": 9.05020394393842e-05, "loss": 0.8123, "mean_token_accuracy": 0.7664304450154305, "num_tokens": 98863175.0, "step": 3098 }, { "entropy": 0.8957884609699249, "epoch": 0.2851277450963479, "grad_norm": 0.16203847527503967, "learning_rate": 9.049897261324256e-05, "loss": 0.9008, "mean_token_accuracy": 0.7383261807262897, "num_tokens": 98894360.0, "step": 3099 }, { "entropy": 0.934861347079277, "epoch": 0.28521975146778916, "grad_norm": 0.16158874332904816, "learning_rate": 9.049590578710093e-05, "loss": 0.9106, "mean_token_accuracy": 0.7407253086566925, "num_tokens": 98926089.0, "step": 3100 }, { "entropy": 0.8484886288642883, "epoch": 0.28531175783923035, "grad_norm": 0.17152518033981323, "learning_rate": 9.04928389609593e-05, "loss": 0.8603, "mean_token_accuracy": 0.7599891647696495, "num_tokens": 98958227.0, "step": 3101 }, { "entropy": 0.8504353277385235, "epoch": 0.2854037642106716, "grad_norm": 0.15867352485656738, "learning_rate": 9.048977213481768e-05, "loss": 0.823, "mean_token_accuracy": 0.7667888849973679, "num_tokens": 98989572.0, "step": 3102 }, { "entropy": 0.7980418540537357, "epoch": 0.2854957705821128, "grad_norm": 0.15400411188602448, "learning_rate": 9.048670530867606e-05, "loss": 0.7783, "mean_token_accuracy": 0.7748725637793541, "num_tokens": 99021186.0, "step": 3103 }, { "entropy": 0.8563730400055647, "epoch": 0.28558777695355403, "grad_norm": 0.15698377788066864, "learning_rate": 9.048363848253443e-05, "loss": 0.8549, "mean_token_accuracy": 0.752392441034317, "num_tokens": 99052942.0, "step": 3104 }, { "entropy": 0.8982325363904238, "epoch": 0.2856797833249953, "grad_norm": 0.16315749287605286, "learning_rate": 9.04805716563928e-05, "loss": 0.883, "mean_token_accuracy": 0.7439652718603611, "num_tokens": 99083816.0, "step": 3105 }, { "entropy": 0.9067273437976837, "epoch": 0.28577178969643646, "grad_norm": 0.1668548285961151, "learning_rate": 9.047750483025118e-05, "loss": 0.9069, "mean_token_accuracy": 0.743856891989708, "num_tokens": 99115222.0, "step": 3106 }, { "entropy": 0.8302781768143177, "epoch": 0.2858637960678777, "grad_norm": 0.1559470146894455, "learning_rate": 9.047443800410955e-05, "loss": 0.8076, "mean_token_accuracy": 0.7674002721905708, "num_tokens": 99147572.0, "step": 3107 }, { "entropy": 0.8517344072461128, "epoch": 0.2859558024393189, "grad_norm": 0.1592833548784256, "learning_rate": 9.047137117796793e-05, "loss": 0.85, "mean_token_accuracy": 0.7574571371078491, "num_tokens": 99178955.0, "step": 3108 }, { "entropy": 0.8412882499396801, "epoch": 0.28604780881076014, "grad_norm": 0.16000409424304962, "learning_rate": 9.04683043518263e-05, "loss": 0.8605, "mean_token_accuracy": 0.755398653447628, "num_tokens": 99211019.0, "step": 3109 }, { "entropy": 0.811328299343586, "epoch": 0.2861398151822014, "grad_norm": 0.14923787117004395, "learning_rate": 9.046523752568468e-05, "loss": 0.8138, "mean_token_accuracy": 0.7661323547363281, "num_tokens": 99243154.0, "step": 3110 }, { "entropy": 0.7492274511605501, "epoch": 0.2862318215536426, "grad_norm": 0.1505098044872284, "learning_rate": 9.046217069954304e-05, "loss": 0.7332, "mean_token_accuracy": 0.7887174002826214, "num_tokens": 99275104.0, "step": 3111 }, { "entropy": 0.798794336616993, "epoch": 0.2863238279250838, "grad_norm": 0.15642811357975006, "learning_rate": 9.045910387340141e-05, "loss": 0.7792, "mean_token_accuracy": 0.7716614343225956, "num_tokens": 99307869.0, "step": 3112 }, { "entropy": 0.9306384548544884, "epoch": 0.286415834296525, "grad_norm": 0.16430804133415222, "learning_rate": 9.045603704725981e-05, "loss": 0.9171, "mean_token_accuracy": 0.7424902096390724, "num_tokens": 99340173.0, "step": 3113 }, { "entropy": 0.8533012494444847, "epoch": 0.28650784066796625, "grad_norm": 0.15815667808055878, "learning_rate": 9.045297022111818e-05, "loss": 0.8576, "mean_token_accuracy": 0.7527770921587944, "num_tokens": 99372770.0, "step": 3114 }, { "entropy": 0.742487357929349, "epoch": 0.2865998470394075, "grad_norm": 0.15554167330265045, "learning_rate": 9.044990339497654e-05, "loss": 0.739, "mean_token_accuracy": 0.7815855629742146, "num_tokens": 99405355.0, "step": 3115 }, { "entropy": 0.9041680805385113, "epoch": 0.2866918534108487, "grad_norm": 0.16381394863128662, "learning_rate": 9.044683656883491e-05, "loss": 0.9097, "mean_token_accuracy": 0.7415843792259693, "num_tokens": 99436881.0, "step": 3116 }, { "entropy": 0.8046462014317513, "epoch": 0.28678385978228993, "grad_norm": 0.16447478532791138, "learning_rate": 9.044376974269329e-05, "loss": 0.8135, "mean_token_accuracy": 0.7638048529624939, "num_tokens": 99468699.0, "step": 3117 }, { "entropy": 0.7955575007945299, "epoch": 0.2868758661537311, "grad_norm": 0.1626521497964859, "learning_rate": 9.044070291655167e-05, "loss": 0.8267, "mean_token_accuracy": 0.7605165429413319, "num_tokens": 99500495.0, "step": 3118 }, { "entropy": 0.7750002276152372, "epoch": 0.28696787252517236, "grad_norm": 0.1642167568206787, "learning_rate": 9.043763609041004e-05, "loss": 0.7792, "mean_token_accuracy": 0.770627286285162, "num_tokens": 99532239.0, "step": 3119 }, { "entropy": 0.9051864929497242, "epoch": 0.2870598788966136, "grad_norm": 0.1631658375263214, "learning_rate": 9.043456926426841e-05, "loss": 0.9229, "mean_token_accuracy": 0.742281436920166, "num_tokens": 99564586.0, "step": 3120 }, { "entropy": 0.7148022688925266, "epoch": 0.2871518852680548, "grad_norm": 0.15899744629859924, "learning_rate": 9.043150243812679e-05, "loss": 0.725, "mean_token_accuracy": 0.7893040999770164, "num_tokens": 99596415.0, "step": 3121 }, { "entropy": 0.8738234303891659, "epoch": 0.28724389163949604, "grad_norm": 0.1575319766998291, "learning_rate": 9.042843561198516e-05, "loss": 0.8632, "mean_token_accuracy": 0.7496169731020927, "num_tokens": 99628689.0, "step": 3122 }, { "entropy": 0.8299461472779512, "epoch": 0.2873358980109373, "grad_norm": 0.15894727408885956, "learning_rate": 9.042536878584354e-05, "loss": 0.839, "mean_token_accuracy": 0.7582399100065231, "num_tokens": 99660230.0, "step": 3123 }, { "entropy": 0.902844401076436, "epoch": 0.2874279043823785, "grad_norm": 0.15762177109718323, "learning_rate": 9.042230195970191e-05, "loss": 0.8959, "mean_token_accuracy": 0.7449857071042061, "num_tokens": 99692163.0, "step": 3124 }, { "entropy": 0.8745828047394753, "epoch": 0.2875199107538197, "grad_norm": 0.15690195560455322, "learning_rate": 9.041923513356029e-05, "loss": 0.8675, "mean_token_accuracy": 0.750403918325901, "num_tokens": 99724072.0, "step": 3125 }, { "entropy": 0.7982974387705326, "epoch": 0.2876119171252609, "grad_norm": 0.1557229906320572, "learning_rate": 9.041616830741866e-05, "loss": 0.7942, "mean_token_accuracy": 0.7672330401837826, "num_tokens": 99756341.0, "step": 3126 }, { "entropy": 0.8323658034205437, "epoch": 0.28770392349670215, "grad_norm": 0.15505655109882355, "learning_rate": 9.041310148127703e-05, "loss": 0.7972, "mean_token_accuracy": 0.7691407725214958, "num_tokens": 99788273.0, "step": 3127 }, { "entropy": 0.7219066843390465, "epoch": 0.2877959298681434, "grad_norm": 0.15033182501792908, "learning_rate": 9.04100346551354e-05, "loss": 0.7086, "mean_token_accuracy": 0.7939893193542957, "num_tokens": 99820488.0, "step": 3128 }, { "entropy": 0.9335199818015099, "epoch": 0.2878879362395846, "grad_norm": 0.16144677996635437, "learning_rate": 9.040696782899379e-05, "loss": 0.93, "mean_token_accuracy": 0.7353764399886131, "num_tokens": 99852238.0, "step": 3129 }, { "entropy": 0.818684671074152, "epoch": 0.28797994261102583, "grad_norm": 0.1506928950548172, "learning_rate": 9.040390100285216e-05, "loss": 0.7931, "mean_token_accuracy": 0.771225243806839, "num_tokens": 99884405.0, "step": 3130 }, { "entropy": 0.8554952591657639, "epoch": 0.288071948982467, "grad_norm": 0.15345104038715363, "learning_rate": 9.040083417671052e-05, "loss": 0.8403, "mean_token_accuracy": 0.7608412466943264, "num_tokens": 99916444.0, "step": 3131 }, { "entropy": 0.8562560528516769, "epoch": 0.28816395535390826, "grad_norm": 0.16667422652244568, "learning_rate": 9.039776735056889e-05, "loss": 0.8952, "mean_token_accuracy": 0.7496655993163586, "num_tokens": 99948896.0, "step": 3132 }, { "entropy": 0.8484035655856133, "epoch": 0.2882559617253495, "grad_norm": 0.15848588943481445, "learning_rate": 9.039470052442727e-05, "loss": 0.8445, "mean_token_accuracy": 0.7608196809887886, "num_tokens": 99980729.0, "step": 3133 }, { "entropy": 0.7678321339190006, "epoch": 0.2883479680967907, "grad_norm": 0.15099336206912994, "learning_rate": 9.039163369828565e-05, "loss": 0.7562, "mean_token_accuracy": 0.7754376418888569, "num_tokens": 100012877.0, "step": 3134 }, { "entropy": 0.8506795130670071, "epoch": 0.28843997446823194, "grad_norm": 0.16113726794719696, "learning_rate": 9.038856687214402e-05, "loss": 0.8325, "mean_token_accuracy": 0.7597404643893242, "num_tokens": 100044568.0, "step": 3135 }, { "entropy": 0.812988517805934, "epoch": 0.28853198083967313, "grad_norm": 0.15608970820903778, "learning_rate": 9.038550004600239e-05, "loss": 0.7891, "mean_token_accuracy": 0.7712794169783592, "num_tokens": 100076323.0, "step": 3136 }, { "entropy": 0.9145891591906548, "epoch": 0.2886239872111144, "grad_norm": 0.16039247810840607, "learning_rate": 9.038243321986077e-05, "loss": 0.9037, "mean_token_accuracy": 0.7427836582064629, "num_tokens": 100108558.0, "step": 3137 }, { "entropy": 0.8768434785306454, "epoch": 0.2887159935825556, "grad_norm": 0.16368046402931213, "learning_rate": 9.037936639371914e-05, "loss": 0.8797, "mean_token_accuracy": 0.7511985041201115, "num_tokens": 100140090.0, "step": 3138 }, { "entropy": 0.8976588435471058, "epoch": 0.2888079999539968, "grad_norm": 0.1664142906665802, "learning_rate": 9.037629956757752e-05, "loss": 0.9243, "mean_token_accuracy": 0.7401230186223984, "num_tokens": 100171801.0, "step": 3139 }, { "entropy": 0.7624607719480991, "epoch": 0.28890000632543805, "grad_norm": 0.15687142312526703, "learning_rate": 9.037323274143589e-05, "loss": 0.735, "mean_token_accuracy": 0.7891881018877029, "num_tokens": 100204565.0, "step": 3140 }, { "entropy": 0.9070580918341875, "epoch": 0.28899201269687924, "grad_norm": 0.16549333930015564, "learning_rate": 9.037016591529427e-05, "loss": 0.925, "mean_token_accuracy": 0.7363887317478657, "num_tokens": 100235869.0, "step": 3141 }, { "entropy": 0.811367467045784, "epoch": 0.2890840190683205, "grad_norm": 0.15387707948684692, "learning_rate": 9.036709908915264e-05, "loss": 0.8077, "mean_token_accuracy": 0.7617871575057507, "num_tokens": 100267640.0, "step": 3142 }, { "entropy": 0.7766444925218821, "epoch": 0.28917602543976173, "grad_norm": 0.15814250707626343, "learning_rate": 9.0364032263011e-05, "loss": 0.7795, "mean_token_accuracy": 0.775529507547617, "num_tokens": 100299818.0, "step": 3143 }, { "entropy": 0.8421365190297365, "epoch": 0.2892680318112029, "grad_norm": 0.15728148818016052, "learning_rate": 9.036096543686939e-05, "loss": 0.8478, "mean_token_accuracy": 0.7602249793708324, "num_tokens": 100332200.0, "step": 3144 }, { "entropy": 0.910310871899128, "epoch": 0.28936003818264416, "grad_norm": 0.16006198525428772, "learning_rate": 9.035789861072777e-05, "loss": 0.9137, "mean_token_accuracy": 0.7394065633416176, "num_tokens": 100364583.0, "step": 3145 }, { "entropy": 0.8640425130724907, "epoch": 0.28945204455408535, "grad_norm": 0.16084501147270203, "learning_rate": 9.035483178458614e-05, "loss": 0.8579, "mean_token_accuracy": 0.7512971237301826, "num_tokens": 100396122.0, "step": 3146 }, { "entropy": 0.782263170927763, "epoch": 0.2895440509255266, "grad_norm": 0.15656329691410065, "learning_rate": 9.03517649584445e-05, "loss": 0.7556, "mean_token_accuracy": 0.7768679037690163, "num_tokens": 100427824.0, "step": 3147 }, { "entropy": 0.8281490355730057, "epoch": 0.28963605729696784, "grad_norm": 0.15862619876861572, "learning_rate": 9.034869813230289e-05, "loss": 0.8044, "mean_token_accuracy": 0.7640481293201447, "num_tokens": 100459580.0, "step": 3148 }, { "entropy": 0.721054220572114, "epoch": 0.28972806366840903, "grad_norm": 0.1540256291627884, "learning_rate": 9.034563130616125e-05, "loss": 0.7245, "mean_token_accuracy": 0.7868707738816738, "num_tokens": 100491559.0, "step": 3149 }, { "entropy": 0.8296151086688042, "epoch": 0.2898200700398503, "grad_norm": 0.1717168390750885, "learning_rate": 9.034256448001964e-05, "loss": 0.8483, "mean_token_accuracy": 0.7627076655626297, "num_tokens": 100523595.0, "step": 3150 }, { "entropy": 0.8158803656697273, "epoch": 0.28991207641129146, "grad_norm": 0.1532531976699829, "learning_rate": 9.0339497653878e-05, "loss": 0.8001, "mean_token_accuracy": 0.7673046439886093, "num_tokens": 100556017.0, "step": 3151 }, { "entropy": 0.8360585309565067, "epoch": 0.2900040827827327, "grad_norm": 0.15269051492214203, "learning_rate": 9.033643082773638e-05, "loss": 0.8035, "mean_token_accuracy": 0.7627291195094585, "num_tokens": 100587575.0, "step": 3152 }, { "entropy": 0.8702558595687151, "epoch": 0.29009608915417395, "grad_norm": 0.15740007162094116, "learning_rate": 9.033336400159475e-05, "loss": 0.8343, "mean_token_accuracy": 0.7569335848093033, "num_tokens": 100619694.0, "step": 3153 }, { "entropy": 0.7989114299416542, "epoch": 0.29018809552561514, "grad_norm": 0.1598055362701416, "learning_rate": 9.033029717545312e-05, "loss": 0.7955, "mean_token_accuracy": 0.7701336927711964, "num_tokens": 100651304.0, "step": 3154 }, { "entropy": 0.8284060247242451, "epoch": 0.2902801018970564, "grad_norm": 0.15269698202610016, "learning_rate": 9.03272303493115e-05, "loss": 0.8352, "mean_token_accuracy": 0.7624961100518703, "num_tokens": 100683360.0, "step": 3155 }, { "entropy": 0.7458656132221222, "epoch": 0.2903721082684976, "grad_norm": 0.15668541193008423, "learning_rate": 9.032416352316988e-05, "loss": 0.7614, "mean_token_accuracy": 0.7805015929043293, "num_tokens": 100714675.0, "step": 3156 }, { "entropy": 0.7555865067988634, "epoch": 0.2904641146399388, "grad_norm": 0.15557244420051575, "learning_rate": 9.032109669702825e-05, "loss": 0.7405, "mean_token_accuracy": 0.7833556234836578, "num_tokens": 100746488.0, "step": 3157 }, { "entropy": 0.7710688766092062, "epoch": 0.29055612101138006, "grad_norm": 0.1564849615097046, "learning_rate": 9.031802987088662e-05, "loss": 0.7742, "mean_token_accuracy": 0.7772331908345222, "num_tokens": 100779056.0, "step": 3158 }, { "entropy": 0.8386783562600613, "epoch": 0.29064812738282125, "grad_norm": 0.16236209869384766, "learning_rate": 9.031496304474499e-05, "loss": 0.8389, "mean_token_accuracy": 0.761837150901556, "num_tokens": 100810594.0, "step": 3159 }, { "entropy": 0.8218664303421974, "epoch": 0.2907401337542625, "grad_norm": 0.15634682774543762, "learning_rate": 9.031189621860338e-05, "loss": 0.8091, "mean_token_accuracy": 0.7645307630300522, "num_tokens": 100842893.0, "step": 3160 }, { "entropy": 0.8912910260260105, "epoch": 0.2908321401257037, "grad_norm": 0.16268974542617798, "learning_rate": 9.030882939246175e-05, "loss": 0.8876, "mean_token_accuracy": 0.7446510829031467, "num_tokens": 100874917.0, "step": 3161 }, { "entropy": 0.7330492604523897, "epoch": 0.29092414649714493, "grad_norm": 0.15575917065143585, "learning_rate": 9.030576256632012e-05, "loss": 0.7427, "mean_token_accuracy": 0.7834632061421871, "num_tokens": 100907268.0, "step": 3162 }, { "entropy": 0.8264786750078201, "epoch": 0.2910161528685862, "grad_norm": 0.1558249592781067, "learning_rate": 9.030269574017849e-05, "loss": 0.8243, "mean_token_accuracy": 0.7627252340316772, "num_tokens": 100939116.0, "step": 3163 }, { "entropy": 0.8212195970118046, "epoch": 0.29110815924002736, "grad_norm": 0.15763980150222778, "learning_rate": 9.029962891403687e-05, "loss": 0.805, "mean_token_accuracy": 0.7695707604289055, "num_tokens": 100971523.0, "step": 3164 }, { "entropy": 0.9046418331563473, "epoch": 0.2912001656114686, "grad_norm": 0.15962903201580048, "learning_rate": 9.029656208789525e-05, "loss": 0.8955, "mean_token_accuracy": 0.7437741085886955, "num_tokens": 101003621.0, "step": 3165 }, { "entropy": 0.923548512160778, "epoch": 0.2912921719829098, "grad_norm": 0.15732011198997498, "learning_rate": 9.029349526175362e-05, "loss": 0.9152, "mean_token_accuracy": 0.7369136065244675, "num_tokens": 101035347.0, "step": 3166 }, { "entropy": 0.8744808994233608, "epoch": 0.29138417835435104, "grad_norm": 0.15867945551872253, "learning_rate": 9.029042843561198e-05, "loss": 0.8685, "mean_token_accuracy": 0.7499292604625225, "num_tokens": 101067417.0, "step": 3167 }, { "entropy": 0.9350709542632103, "epoch": 0.2914761847257923, "grad_norm": 0.15822337567806244, "learning_rate": 9.028736160947037e-05, "loss": 0.9177, "mean_token_accuracy": 0.7406025230884552, "num_tokens": 101099286.0, "step": 3168 }, { "entropy": 0.8968679755926132, "epoch": 0.2915681910972335, "grad_norm": 0.15883475542068481, "learning_rate": 9.028429478332873e-05, "loss": 0.9028, "mean_token_accuracy": 0.7410541959106922, "num_tokens": 101131430.0, "step": 3169 }, { "entropy": 0.8244980126619339, "epoch": 0.2916601974686747, "grad_norm": 0.16238760948181152, "learning_rate": 9.028122795718711e-05, "loss": 0.8263, "mean_token_accuracy": 0.7644683197140694, "num_tokens": 101163920.0, "step": 3170 }, { "entropy": 0.9581815600395203, "epoch": 0.2917522038401159, "grad_norm": 0.1676633656024933, "learning_rate": 9.027816113104548e-05, "loss": 0.984, "mean_token_accuracy": 0.7196622900664806, "num_tokens": 101195755.0, "step": 3171 }, { "entropy": 0.9230419769883156, "epoch": 0.29184421021155715, "grad_norm": 0.15758293867111206, "learning_rate": 9.027509430490386e-05, "loss": 0.94, "mean_token_accuracy": 0.7371174618601799, "num_tokens": 101228323.0, "step": 3172 }, { "entropy": 0.7674350906163454, "epoch": 0.2919362165829984, "grad_norm": 0.152325838804245, "learning_rate": 9.027202747876223e-05, "loss": 0.7463, "mean_token_accuracy": 0.7821067869663239, "num_tokens": 101259955.0, "step": 3173 }, { "entropy": 0.8236006014049053, "epoch": 0.2920282229544396, "grad_norm": 0.1567000448703766, "learning_rate": 9.02689606526206e-05, "loss": 0.8186, "mean_token_accuracy": 0.7614258453249931, "num_tokens": 101290366.0, "step": 3174 }, { "entropy": 0.9573616608977318, "epoch": 0.29212022932588083, "grad_norm": 0.15783348679542542, "learning_rate": 9.026589382647898e-05, "loss": 0.9463, "mean_token_accuracy": 0.7332042567431927, "num_tokens": 101322709.0, "step": 3175 }, { "entropy": 0.7762656304985285, "epoch": 0.292212235697322, "grad_norm": 0.1583714783191681, "learning_rate": 9.026282700033736e-05, "loss": 0.7658, "mean_token_accuracy": 0.7765906043350697, "num_tokens": 101354528.0, "step": 3176 }, { "entropy": 0.8411923963576555, "epoch": 0.29230424206876326, "grad_norm": 0.15639646351337433, "learning_rate": 9.025976017419573e-05, "loss": 0.8191, "mean_token_accuracy": 0.761646531522274, "num_tokens": 101386628.0, "step": 3177 }, { "entropy": 0.8583645783364773, "epoch": 0.2923962484402045, "grad_norm": 0.1621035784482956, "learning_rate": 9.02566933480541e-05, "loss": 0.8612, "mean_token_accuracy": 0.7497067227959633, "num_tokens": 101418760.0, "step": 3178 }, { "entropy": 0.8904569037258625, "epoch": 0.2924882548116457, "grad_norm": 0.15978878736495972, "learning_rate": 9.025362652191248e-05, "loss": 0.8917, "mean_token_accuracy": 0.7445063628256321, "num_tokens": 101451163.0, "step": 3179 }, { "entropy": 0.8493010457605124, "epoch": 0.29258026118308694, "grad_norm": 0.15679512917995453, "learning_rate": 9.025055969577085e-05, "loss": 0.831, "mean_token_accuracy": 0.7618917338550091, "num_tokens": 101483761.0, "step": 3180 }, { "entropy": 0.8157441765069962, "epoch": 0.29267226755452813, "grad_norm": 0.15882784128189087, "learning_rate": 9.024749286962923e-05, "loss": 0.8259, "mean_token_accuracy": 0.7590639181435108, "num_tokens": 101515598.0, "step": 3181 }, { "entropy": 0.8992273658514023, "epoch": 0.2927642739259694, "grad_norm": 0.1623137891292572, "learning_rate": 9.02444260434876e-05, "loss": 0.8931, "mean_token_accuracy": 0.7444291077554226, "num_tokens": 101547985.0, "step": 3182 }, { "entropy": 0.8004123959690332, "epoch": 0.2928562802974106, "grad_norm": 0.15461677312850952, "learning_rate": 9.024135921734598e-05, "loss": 0.7981, "mean_token_accuracy": 0.7681717798113823, "num_tokens": 101580072.0, "step": 3183 }, { "entropy": 0.9203095436096191, "epoch": 0.2929482866688518, "grad_norm": 0.16571903228759766, "learning_rate": 9.023829239120435e-05, "loss": 0.9279, "mean_token_accuracy": 0.7338174767792225, "num_tokens": 101611755.0, "step": 3184 }, { "entropy": 0.8256703801453114, "epoch": 0.29304029304029305, "grad_norm": 0.15596750378608704, "learning_rate": 9.023522556506271e-05, "loss": 0.835, "mean_token_accuracy": 0.7611192874610424, "num_tokens": 101644395.0, "step": 3185 }, { "entropy": 0.796425387263298, "epoch": 0.29313229941173424, "grad_norm": 0.16226376593112946, "learning_rate": 9.02321587389211e-05, "loss": 0.7959, "mean_token_accuracy": 0.7684643119573593, "num_tokens": 101676282.0, "step": 3186 }, { "entropy": 0.8502112217247486, "epoch": 0.2932243057831755, "grad_norm": 0.15837891399860382, "learning_rate": 9.022909191277948e-05, "loss": 0.8423, "mean_token_accuracy": 0.757843978703022, "num_tokens": 101707993.0, "step": 3187 }, { "entropy": 0.8603754565119743, "epoch": 0.29331631215461673, "grad_norm": 0.15633974969387054, "learning_rate": 9.022602508663784e-05, "loss": 0.8447, "mean_token_accuracy": 0.759591206908226, "num_tokens": 101739114.0, "step": 3188 }, { "entropy": 0.8135569915175438, "epoch": 0.2934083185260579, "grad_norm": 0.15791133046150208, "learning_rate": 9.022295826049621e-05, "loss": 0.8018, "mean_token_accuracy": 0.7678660489618778, "num_tokens": 101770845.0, "step": 3189 }, { "entropy": 0.7692399229854345, "epoch": 0.29350032489749917, "grad_norm": 0.15273478627204895, "learning_rate": 9.021989143435458e-05, "loss": 0.7319, "mean_token_accuracy": 0.7896382436156273, "num_tokens": 101802011.0, "step": 3190 }, { "entropy": 0.8852591793984175, "epoch": 0.29359233126894035, "grad_norm": 0.15941964089870453, "learning_rate": 9.021682460821296e-05, "loss": 0.8623, "mean_token_accuracy": 0.7500354461371899, "num_tokens": 101833103.0, "step": 3191 }, { "entropy": 0.7618223074823618, "epoch": 0.2936843376403816, "grad_norm": 0.15870916843414307, "learning_rate": 9.021375778207134e-05, "loss": 0.7544, "mean_token_accuracy": 0.7763308882713318, "num_tokens": 101864513.0, "step": 3192 }, { "entropy": 0.790227148681879, "epoch": 0.29377634401182284, "grad_norm": 0.1569926142692566, "learning_rate": 9.021069095592971e-05, "loss": 0.7764, "mean_token_accuracy": 0.775145635008812, "num_tokens": 101896846.0, "step": 3193 }, { "entropy": 0.7326594367623329, "epoch": 0.29386835038326403, "grad_norm": 0.1598464995622635, "learning_rate": 9.020762412978808e-05, "loss": 0.7491, "mean_token_accuracy": 0.7835141941905022, "num_tokens": 101928808.0, "step": 3194 }, { "entropy": 0.8004922028630972, "epoch": 0.2939603567547053, "grad_norm": 0.14781293272972107, "learning_rate": 9.020455730364646e-05, "loss": 0.7889, "mean_token_accuracy": 0.7698757201433182, "num_tokens": 101961019.0, "step": 3195 }, { "entropy": 0.8491642493754625, "epoch": 0.29405236312614647, "grad_norm": 0.1701159030199051, "learning_rate": 9.020149047750483e-05, "loss": 0.8935, "mean_token_accuracy": 0.751355841755867, "num_tokens": 101993240.0, "step": 3196 }, { "entropy": 0.7565793059766293, "epoch": 0.2941443694975877, "grad_norm": 0.1574869602918625, "learning_rate": 9.019842365136321e-05, "loss": 0.7402, "mean_token_accuracy": 0.78076047077775, "num_tokens": 102025161.0, "step": 3197 }, { "entropy": 0.8273208439350128, "epoch": 0.29423637586902895, "grad_norm": 0.15284475684165955, "learning_rate": 9.019535682522158e-05, "loss": 0.8135, "mean_token_accuracy": 0.7646205611526966, "num_tokens": 102056947.0, "step": 3198 }, { "entropy": 0.7627965211868286, "epoch": 0.29432838224047014, "grad_norm": 0.15596170723438263, "learning_rate": 9.019228999907996e-05, "loss": 0.7563, "mean_token_accuracy": 0.7792799882590771, "num_tokens": 102089150.0, "step": 3199 }, { "entropy": 0.9121864065527916, "epoch": 0.2944203886119114, "grad_norm": 0.15551190078258514, "learning_rate": 9.018922317293833e-05, "loss": 0.9059, "mean_token_accuracy": 0.738679300993681, "num_tokens": 102121145.0, "step": 3200 }, { "entropy": 0.7961977049708366, "epoch": 0.2945123949833526, "grad_norm": 0.15908531844615936, "learning_rate": 9.018615634679671e-05, "loss": 0.7856, "mean_token_accuracy": 0.7710445411503315, "num_tokens": 102153118.0, "step": 3201 }, { "entropy": 0.8160314466804266, "epoch": 0.2946044013547938, "grad_norm": 0.1605740487575531, "learning_rate": 9.018308952065508e-05, "loss": 0.8235, "mean_token_accuracy": 0.761083547025919, "num_tokens": 102185319.0, "step": 3202 }, { "entropy": 0.7755609210580587, "epoch": 0.29469640772623507, "grad_norm": 0.15232640504837036, "learning_rate": 9.018002269451346e-05, "loss": 0.7536, "mean_token_accuracy": 0.78056875243783, "num_tokens": 102216576.0, "step": 3203 }, { "entropy": 0.886900432407856, "epoch": 0.29478841409767625, "grad_norm": 0.16412122547626495, "learning_rate": 9.017695586837183e-05, "loss": 0.8757, "mean_token_accuracy": 0.7495241351425648, "num_tokens": 102248540.0, "step": 3204 }, { "entropy": 0.7630243320018053, "epoch": 0.2948804204691175, "grad_norm": 0.1493261158466339, "learning_rate": 9.01738890422302e-05, "loss": 0.7423, "mean_token_accuracy": 0.7818890362977982, "num_tokens": 102281194.0, "step": 3205 }, { "entropy": 0.8741129636764526, "epoch": 0.2949724268405587, "grad_norm": 0.1720954030752182, "learning_rate": 9.017082221608858e-05, "loss": 0.9023, "mean_token_accuracy": 0.7533496953547001, "num_tokens": 102313052.0, "step": 3206 }, { "entropy": 0.8634685911238194, "epoch": 0.29506443321199993, "grad_norm": 0.16125012934207916, "learning_rate": 9.016775538994696e-05, "loss": 0.8375, "mean_token_accuracy": 0.7569495067000389, "num_tokens": 102344902.0, "step": 3207 }, { "entropy": 0.756110118702054, "epoch": 0.2951564395834412, "grad_norm": 0.15109305083751678, "learning_rate": 9.016468856380532e-05, "loss": 0.7457, "mean_token_accuracy": 0.7840436510741711, "num_tokens": 102377120.0, "step": 3208 }, { "entropy": 0.8631251789629459, "epoch": 0.29524844595488237, "grad_norm": 0.16220353543758392, "learning_rate": 9.016162173766369e-05, "loss": 0.8614, "mean_token_accuracy": 0.7536821439862251, "num_tokens": 102408815.0, "step": 3209 }, { "entropy": 0.7337331175804138, "epoch": 0.2953404523263236, "grad_norm": 0.15066653490066528, "learning_rate": 9.015855491152207e-05, "loss": 0.7173, "mean_token_accuracy": 0.7897795215249062, "num_tokens": 102440895.0, "step": 3210 }, { "entropy": 0.8524109628051519, "epoch": 0.2954324586977648, "grad_norm": 0.16262073814868927, "learning_rate": 9.015548808538044e-05, "loss": 0.8585, "mean_token_accuracy": 0.7527904510498047, "num_tokens": 102472809.0, "step": 3211 }, { "entropy": 0.8847377244383097, "epoch": 0.29552446506920604, "grad_norm": 0.16650919616222382, "learning_rate": 9.015242125923882e-05, "loss": 0.8892, "mean_token_accuracy": 0.7451476156711578, "num_tokens": 102504345.0, "step": 3212 }, { "entropy": 0.8598622307181358, "epoch": 0.2956164714406473, "grad_norm": 0.1609732061624527, "learning_rate": 9.014935443309719e-05, "loss": 0.8704, "mean_token_accuracy": 0.7526582144200802, "num_tokens": 102536389.0, "step": 3213 }, { "entropy": 0.7665574196726084, "epoch": 0.2957084778120885, "grad_norm": 0.1511075794696808, "learning_rate": 9.014628760695557e-05, "loss": 0.7671, "mean_token_accuracy": 0.7745878249406815, "num_tokens": 102568856.0, "step": 3214 }, { "entropy": 0.827289629727602, "epoch": 0.2958004841835297, "grad_norm": 0.16121956706047058, "learning_rate": 9.014322078081394e-05, "loss": 0.8011, "mean_token_accuracy": 0.7696695402264595, "num_tokens": 102601063.0, "step": 3215 }, { "entropy": 0.8316291570663452, "epoch": 0.2958924905549709, "grad_norm": 0.15940843522548676, "learning_rate": 9.014015395467231e-05, "loss": 0.8472, "mean_token_accuracy": 0.7566188611090183, "num_tokens": 102632334.0, "step": 3216 }, { "entropy": 0.8681637272238731, "epoch": 0.29598449692641216, "grad_norm": 0.1594361513853073, "learning_rate": 9.013708712853069e-05, "loss": 0.8778, "mean_token_accuracy": 0.7511197328567505, "num_tokens": 102664576.0, "step": 3217 }, { "entropy": 0.864403922110796, "epoch": 0.2960765032978534, "grad_norm": 0.15853577852249146, "learning_rate": 9.013402030238907e-05, "loss": 0.8461, "mean_token_accuracy": 0.753927867859602, "num_tokens": 102696217.0, "step": 3218 }, { "entropy": 0.8864081986248493, "epoch": 0.2961685096692946, "grad_norm": 0.26794782280921936, "learning_rate": 9.013095347624744e-05, "loss": 0.9104, "mean_token_accuracy": 0.7467159293591976, "num_tokens": 102728656.0, "step": 3219 }, { "entropy": 0.9669194929301739, "epoch": 0.29626051604073583, "grad_norm": 0.16423971951007843, "learning_rate": 9.01278866501058e-05, "loss": 0.9515, "mean_token_accuracy": 0.7314387038350105, "num_tokens": 102760728.0, "step": 3220 }, { "entropy": 0.8133777976036072, "epoch": 0.296352522412177, "grad_norm": 0.15917067229747772, "learning_rate": 9.012481982396417e-05, "loss": 0.8178, "mean_token_accuracy": 0.7681770361959934, "num_tokens": 102792318.0, "step": 3221 }, { "entropy": 0.866450846195221, "epoch": 0.29644452878361827, "grad_norm": 0.15675264596939087, "learning_rate": 9.012175299782256e-05, "loss": 0.8361, "mean_token_accuracy": 0.7607604898512363, "num_tokens": 102824862.0, "step": 3222 }, { "entropy": 0.8351584374904633, "epoch": 0.2965365351550595, "grad_norm": 0.15654917061328888, "learning_rate": 9.011868617168094e-05, "loss": 0.818, "mean_token_accuracy": 0.7649959996342659, "num_tokens": 102856599.0, "step": 3223 }, { "entropy": 0.7767375856637955, "epoch": 0.2966285415265007, "grad_norm": 0.15343037247657776, "learning_rate": 9.01156193455393e-05, "loss": 0.7736, "mean_token_accuracy": 0.7735678255558014, "num_tokens": 102888328.0, "step": 3224 }, { "entropy": 1.0024364590644836, "epoch": 0.29672054789794194, "grad_norm": 0.16720770299434662, "learning_rate": 9.011255251939767e-05, "loss": 0.9935, "mean_token_accuracy": 0.7193026691675186, "num_tokens": 102920029.0, "step": 3225 }, { "entropy": 0.7231214288622141, "epoch": 0.29681255426938313, "grad_norm": 0.15231072902679443, "learning_rate": 9.010948569325605e-05, "loss": 0.729, "mean_token_accuracy": 0.7829267345368862, "num_tokens": 102951839.0, "step": 3226 }, { "entropy": 0.7469484582543373, "epoch": 0.2969045606408244, "grad_norm": 0.16748405992984772, "learning_rate": 9.010641886711442e-05, "loss": 0.7611, "mean_token_accuracy": 0.7796236276626587, "num_tokens": 102983877.0, "step": 3227 }, { "entropy": 0.9165331497788429, "epoch": 0.2969965670122656, "grad_norm": 0.16665633022785187, "learning_rate": 9.01033520409728e-05, "loss": 0.9219, "mean_token_accuracy": 0.739287830889225, "num_tokens": 103015768.0, "step": 3228 }, { "entropy": 0.8059225287288427, "epoch": 0.2970885733837068, "grad_norm": 0.1589854508638382, "learning_rate": 9.010028521483117e-05, "loss": 0.8, "mean_token_accuracy": 0.7714627273380756, "num_tokens": 103047848.0, "step": 3229 }, { "entropy": 0.7455614730715752, "epoch": 0.29718057975514806, "grad_norm": 0.15252874791622162, "learning_rate": 9.009721838868955e-05, "loss": 0.7558, "mean_token_accuracy": 0.7799040004611015, "num_tokens": 103080029.0, "step": 3230 }, { "entropy": 0.8161697797477245, "epoch": 0.29727258612658924, "grad_norm": 0.15496276319026947, "learning_rate": 9.009415156254792e-05, "loss": 0.7981, "mean_token_accuracy": 0.7746829465031624, "num_tokens": 103111793.0, "step": 3231 }, { "entropy": 0.873393353074789, "epoch": 0.2973645924980305, "grad_norm": 0.15981364250183105, "learning_rate": 9.009108473640629e-05, "loss": 0.8564, "mean_token_accuracy": 0.7516282387077808, "num_tokens": 103143846.0, "step": 3232 }, { "entropy": 0.8967332802712917, "epoch": 0.29745659886947173, "grad_norm": 0.16450969874858856, "learning_rate": 9.008801791026467e-05, "loss": 0.8841, "mean_token_accuracy": 0.7510557547211647, "num_tokens": 103176195.0, "step": 3233 }, { "entropy": 0.7989018131047487, "epoch": 0.2975486052409129, "grad_norm": 0.15022067725658417, "learning_rate": 9.008495108412305e-05, "loss": 0.7817, "mean_token_accuracy": 0.7755111753940582, "num_tokens": 103207371.0, "step": 3234 }, { "entropy": 0.8476388491690159, "epoch": 0.29764061161235417, "grad_norm": 0.15629485249519348, "learning_rate": 9.008188425798142e-05, "loss": 0.8169, "mean_token_accuracy": 0.7614673934876919, "num_tokens": 103239172.0, "step": 3235 }, { "entropy": 0.8458954375237226, "epoch": 0.29773261798379536, "grad_norm": 0.15858782827854156, "learning_rate": 9.007881743183979e-05, "loss": 0.8192, "mean_token_accuracy": 0.7638715282082558, "num_tokens": 103271087.0, "step": 3236 }, { "entropy": 0.8923626653850079, "epoch": 0.2978246243552366, "grad_norm": 0.16321134567260742, "learning_rate": 9.007575060569817e-05, "loss": 0.8709, "mean_token_accuracy": 0.7477518804371357, "num_tokens": 103302330.0, "step": 3237 }, { "entropy": 0.7708925027400255, "epoch": 0.29791663072667784, "grad_norm": 0.1533215492963791, "learning_rate": 9.007268377955655e-05, "loss": 0.7588, "mean_token_accuracy": 0.7757132835686207, "num_tokens": 103334043.0, "step": 3238 }, { "entropy": 0.8961350172758102, "epoch": 0.29800863709811903, "grad_norm": 0.16175471246242523, "learning_rate": 9.006961695341492e-05, "loss": 0.8834, "mean_token_accuracy": 0.7501011155545712, "num_tokens": 103366338.0, "step": 3239 }, { "entropy": 0.7792738862335682, "epoch": 0.2981006434695603, "grad_norm": 0.15869633853435516, "learning_rate": 9.006655012727329e-05, "loss": 0.7918, "mean_token_accuracy": 0.7669379413127899, "num_tokens": 103397392.0, "step": 3240 }, { "entropy": 0.9605378359556198, "epoch": 0.29819264984100147, "grad_norm": 0.16249077022075653, "learning_rate": 9.006348330113167e-05, "loss": 0.9424, "mean_token_accuracy": 0.7302799448370934, "num_tokens": 103429845.0, "step": 3241 }, { "entropy": 0.7939936481416225, "epoch": 0.2982846562124427, "grad_norm": 0.15594905614852905, "learning_rate": 9.006041647499004e-05, "loss": 0.8002, "mean_token_accuracy": 0.7700883150100708, "num_tokens": 103461589.0, "step": 3242 }, { "entropy": 0.8614338338375092, "epoch": 0.29837666258388396, "grad_norm": 0.17068451642990112, "learning_rate": 9.005734964884842e-05, "loss": 0.8916, "mean_token_accuracy": 0.7457436993718147, "num_tokens": 103492820.0, "step": 3243 }, { "entropy": 0.9309524521231651, "epoch": 0.29846866895532514, "grad_norm": 0.17922911047935486, "learning_rate": 9.005428282270678e-05, "loss": 0.9832, "mean_token_accuracy": 0.7208291254937649, "num_tokens": 103525029.0, "step": 3244 }, { "entropy": 0.8712481632828712, "epoch": 0.2985606753267664, "grad_norm": 0.16579996049404144, "learning_rate": 9.005121599656517e-05, "loss": 0.8696, "mean_token_accuracy": 0.7552333362400532, "num_tokens": 103556660.0, "step": 3245 }, { "entropy": 0.802677646279335, "epoch": 0.2986526816982076, "grad_norm": 0.15707947313785553, "learning_rate": 9.004814917042353e-05, "loss": 0.7871, "mean_token_accuracy": 0.772093154489994, "num_tokens": 103588081.0, "step": 3246 }, { "entropy": 0.7899724282324314, "epoch": 0.2987446880696488, "grad_norm": 0.1583571434020996, "learning_rate": 9.00450823442819e-05, "loss": 0.8022, "mean_token_accuracy": 0.7658146806061268, "num_tokens": 103620617.0, "step": 3247 }, { "entropy": 0.8739928435534239, "epoch": 0.29883669444109007, "grad_norm": 0.15742501616477966, "learning_rate": 9.004201551814028e-05, "loss": 0.8538, "mean_token_accuracy": 0.7511718012392521, "num_tokens": 103651998.0, "step": 3248 }, { "entropy": 0.8284780085086823, "epoch": 0.29892870081253126, "grad_norm": 0.1617986112833023, "learning_rate": 9.003894869199866e-05, "loss": 0.8241, "mean_token_accuracy": 0.7647288702428341, "num_tokens": 103684052.0, "step": 3249 }, { "entropy": 0.6868641935288906, "epoch": 0.2990207071839725, "grad_norm": 0.14628863334655762, "learning_rate": 9.003588186585703e-05, "loss": 0.6508, "mean_token_accuracy": 0.8099590204656124, "num_tokens": 103715893.0, "step": 3250 }, { "entropy": 0.7928532026708126, "epoch": 0.2991127135554137, "grad_norm": 0.15125024318695068, "learning_rate": 9.00328150397154e-05, "loss": 0.7799, "mean_token_accuracy": 0.7759184390306473, "num_tokens": 103747535.0, "step": 3251 }, { "entropy": 0.8342645354568958, "epoch": 0.29920471992685493, "grad_norm": 0.154594287276268, "learning_rate": 9.002974821357377e-05, "loss": 0.8155, "mean_token_accuracy": 0.7633600421249866, "num_tokens": 103778687.0, "step": 3252 }, { "entropy": 0.782740430906415, "epoch": 0.2992967262982962, "grad_norm": 0.1500733494758606, "learning_rate": 9.002668138743215e-05, "loss": 0.7703, "mean_token_accuracy": 0.7757139392197132, "num_tokens": 103810206.0, "step": 3253 }, { "entropy": 0.8063284046947956, "epoch": 0.29938873266973737, "grad_norm": 0.1605575531721115, "learning_rate": 9.002361456129053e-05, "loss": 0.7922, "mean_token_accuracy": 0.7727717086672783, "num_tokens": 103841743.0, "step": 3254 }, { "entropy": 0.8755191117525101, "epoch": 0.2994807390411786, "grad_norm": 0.15651896595954895, "learning_rate": 9.00205477351489e-05, "loss": 0.8523, "mean_token_accuracy": 0.750374473631382, "num_tokens": 103873952.0, "step": 3255 }, { "entropy": 0.947271253913641, "epoch": 0.2995727454126198, "grad_norm": 0.16496525704860687, "learning_rate": 9.001748090900727e-05, "loss": 0.9655, "mean_token_accuracy": 0.7281784228980541, "num_tokens": 103906532.0, "step": 3256 }, { "entropy": 0.817999791353941, "epoch": 0.29966475178406105, "grad_norm": 0.1644277721643448, "learning_rate": 9.001441408286565e-05, "loss": 0.8534, "mean_token_accuracy": 0.7581680230796337, "num_tokens": 103938595.0, "step": 3257 }, { "entropy": 0.8273706845939159, "epoch": 0.2997567581555023, "grad_norm": 0.161917582154274, "learning_rate": 9.001134725672402e-05, "loss": 0.8206, "mean_token_accuracy": 0.7648443430662155, "num_tokens": 103970772.0, "step": 3258 }, { "entropy": 0.788858350366354, "epoch": 0.2998487645269435, "grad_norm": 0.15367211401462555, "learning_rate": 9.00082804305824e-05, "loss": 0.7852, "mean_token_accuracy": 0.7717203870415688, "num_tokens": 104003232.0, "step": 3259 }, { "entropy": 0.8062245659530163, "epoch": 0.2999407708983847, "grad_norm": 0.15244629979133606, "learning_rate": 9.000521360444077e-05, "loss": 0.7818, "mean_token_accuracy": 0.7775199860334396, "num_tokens": 104035239.0, "step": 3260 }, { "entropy": 0.8418078422546387, "epoch": 0.3000327772698259, "grad_norm": 0.15364786982536316, "learning_rate": 9.000214677829915e-05, "loss": 0.8327, "mean_token_accuracy": 0.7601509317755699, "num_tokens": 104067957.0, "step": 3261 }, { "entropy": 0.8187732361257076, "epoch": 0.30012478364126716, "grad_norm": 0.16093984246253967, "learning_rate": 8.999907995215751e-05, "loss": 0.8115, "mean_token_accuracy": 0.7645589895546436, "num_tokens": 104099722.0, "step": 3262 }, { "entropy": 0.8378640115261078, "epoch": 0.3002167900127084, "grad_norm": 0.1594831645488739, "learning_rate": 8.999601312601588e-05, "loss": 0.8374, "mean_token_accuracy": 0.7590962573885918, "num_tokens": 104132049.0, "step": 3263 }, { "entropy": 0.8633908107876778, "epoch": 0.3003087963841496, "grad_norm": 0.16856248676776886, "learning_rate": 8.999294629987426e-05, "loss": 0.8662, "mean_token_accuracy": 0.7548037022352219, "num_tokens": 104163972.0, "step": 3264 }, { "entropy": 0.7685533501207829, "epoch": 0.30040080275559083, "grad_norm": 0.16134634613990784, "learning_rate": 8.998987947373265e-05, "loss": 0.7878, "mean_token_accuracy": 0.7701773457229137, "num_tokens": 104196410.0, "step": 3265 }, { "entropy": 0.8683384396135807, "epoch": 0.300492809127032, "grad_norm": 0.16159674525260925, "learning_rate": 8.998681264759101e-05, "loss": 0.8618, "mean_token_accuracy": 0.749833457171917, "num_tokens": 104227871.0, "step": 3266 }, { "entropy": 0.846487246453762, "epoch": 0.30058481549847327, "grad_norm": 0.15977823734283447, "learning_rate": 8.998374582144938e-05, "loss": 0.8433, "mean_token_accuracy": 0.753989364951849, "num_tokens": 104259526.0, "step": 3267 }, { "entropy": 0.7987638935446739, "epoch": 0.3006768218699145, "grad_norm": 0.1621474176645279, "learning_rate": 8.998067899530776e-05, "loss": 0.8015, "mean_token_accuracy": 0.7690377943217754, "num_tokens": 104290858.0, "step": 3268 }, { "entropy": 0.9683430157601833, "epoch": 0.3007688282413557, "grad_norm": 0.1642398089170456, "learning_rate": 8.997761216916613e-05, "loss": 0.9483, "mean_token_accuracy": 0.7298828549683094, "num_tokens": 104321311.0, "step": 3269 }, { "entropy": 0.9350246898829937, "epoch": 0.30086083461279695, "grad_norm": 0.1613132804632187, "learning_rate": 8.997454534302451e-05, "loss": 0.9359, "mean_token_accuracy": 0.7328732721507549, "num_tokens": 104352924.0, "step": 3270 }, { "entropy": 0.9168709814548492, "epoch": 0.30095284098423813, "grad_norm": 0.1685355007648468, "learning_rate": 8.997147851688288e-05, "loss": 0.923, "mean_token_accuracy": 0.7411812767386436, "num_tokens": 104384870.0, "step": 3271 }, { "entropy": 0.8733504302799702, "epoch": 0.3010448473556794, "grad_norm": 0.16202107071876526, "learning_rate": 8.996841169074126e-05, "loss": 0.8493, "mean_token_accuracy": 0.75492849573493, "num_tokens": 104416023.0, "step": 3272 }, { "entropy": 0.8365091811865568, "epoch": 0.3011368537271206, "grad_norm": 0.15835338830947876, "learning_rate": 8.996534486459963e-05, "loss": 0.8286, "mean_token_accuracy": 0.7623091451823711, "num_tokens": 104447738.0, "step": 3273 }, { "entropy": 0.8803280927240849, "epoch": 0.3012288600985618, "grad_norm": 0.15852141380310059, "learning_rate": 8.9962278038458e-05, "loss": 0.8893, "mean_token_accuracy": 0.7468942105770111, "num_tokens": 104480423.0, "step": 3274 }, { "entropy": 0.8215044885873795, "epoch": 0.30132086647000306, "grad_norm": 0.151464581489563, "learning_rate": 8.995921121231638e-05, "loss": 0.8001, "mean_token_accuracy": 0.7666247002780437, "num_tokens": 104512608.0, "step": 3275 }, { "entropy": 0.8443125355988741, "epoch": 0.30141287284144425, "grad_norm": 0.1614406555891037, "learning_rate": 8.995614438617476e-05, "loss": 0.8351, "mean_token_accuracy": 0.758204348385334, "num_tokens": 104544281.0, "step": 3276 }, { "entropy": 0.7865425888448954, "epoch": 0.3015048792128855, "grad_norm": 0.16066083312034607, "learning_rate": 8.995307756003313e-05, "loss": 0.7874, "mean_token_accuracy": 0.771501936018467, "num_tokens": 104575544.0, "step": 3277 }, { "entropy": 0.8384427390992641, "epoch": 0.30159688558432673, "grad_norm": 0.15942394733428955, "learning_rate": 8.99500107338915e-05, "loss": 0.8358, "mean_token_accuracy": 0.7591462694108486, "num_tokens": 104606458.0, "step": 3278 }, { "entropy": 0.9054288417100906, "epoch": 0.3016888919557679, "grad_norm": 0.15813034772872925, "learning_rate": 8.994694390774986e-05, "loss": 0.8934, "mean_token_accuracy": 0.7426137514412403, "num_tokens": 104637557.0, "step": 3279 }, { "entropy": 0.7607414610683918, "epoch": 0.30178089832720917, "grad_norm": 0.14906376600265503, "learning_rate": 8.994387708160826e-05, "loss": 0.7281, "mean_token_accuracy": 0.7850393243134022, "num_tokens": 104668919.0, "step": 3280 }, { "entropy": 0.8519710376858711, "epoch": 0.30187290469865036, "grad_norm": 0.15631885826587677, "learning_rate": 8.994081025546663e-05, "loss": 0.863, "mean_token_accuracy": 0.7527400441467762, "num_tokens": 104701655.0, "step": 3281 }, { "entropy": 0.8114689886569977, "epoch": 0.3019649110700916, "grad_norm": 0.15576130151748657, "learning_rate": 8.9937743429325e-05, "loss": 0.8063, "mean_token_accuracy": 0.7691286876797676, "num_tokens": 104734206.0, "step": 3282 }, { "entropy": 0.7976368572562933, "epoch": 0.30205691744153285, "grad_norm": 0.1560947597026825, "learning_rate": 8.993467660318336e-05, "loss": 0.8004, "mean_token_accuracy": 0.7684306725859642, "num_tokens": 104766188.0, "step": 3283 }, { "entropy": 0.7875513788312674, "epoch": 0.30214892381297404, "grad_norm": 0.16151869297027588, "learning_rate": 8.993160977704174e-05, "loss": 0.7771, "mean_token_accuracy": 0.7791718728840351, "num_tokens": 104798414.0, "step": 3284 }, { "entropy": 0.8232519142329693, "epoch": 0.3022409301844153, "grad_norm": 0.16634659469127655, "learning_rate": 8.992854295090012e-05, "loss": 0.8405, "mean_token_accuracy": 0.7605712227523327, "num_tokens": 104830697.0, "step": 3285 }, { "entropy": 0.835929898545146, "epoch": 0.30233293655585647, "grad_norm": 0.1599072515964508, "learning_rate": 8.992547612475849e-05, "loss": 0.8207, "mean_token_accuracy": 0.7602669596672058, "num_tokens": 104862562.0, "step": 3286 }, { "entropy": 0.8086448535323143, "epoch": 0.3024249429272977, "grad_norm": 0.162196084856987, "learning_rate": 8.992240929861686e-05, "loss": 0.8029, "mean_token_accuracy": 0.7627005912363529, "num_tokens": 104893947.0, "step": 3287 }, { "entropy": 0.7711968813091516, "epoch": 0.30251694929873896, "grad_norm": 0.15262001752853394, "learning_rate": 8.991934247247524e-05, "loss": 0.7652, "mean_token_accuracy": 0.7768972106277943, "num_tokens": 104925827.0, "step": 3288 }, { "entropy": 0.7577444668859243, "epoch": 0.30260895567018015, "grad_norm": 0.15439055860042572, "learning_rate": 8.991627564633361e-05, "loss": 0.753, "mean_token_accuracy": 0.7858549393713474, "num_tokens": 104958124.0, "step": 3289 }, { "entropy": 0.9049224965274334, "epoch": 0.3027009620416214, "grad_norm": 0.16681306064128876, "learning_rate": 8.991320882019199e-05, "loss": 0.9078, "mean_token_accuracy": 0.7460558265447617, "num_tokens": 104990189.0, "step": 3290 }, { "entropy": 0.7750443089753389, "epoch": 0.3027929684130626, "grad_norm": 0.15733176469802856, "learning_rate": 8.991014199405036e-05, "loss": 0.7684, "mean_token_accuracy": 0.7762825153768063, "num_tokens": 105022348.0, "step": 3291 }, { "entropy": 0.9550650827586651, "epoch": 0.3028849747845038, "grad_norm": 0.16315561532974243, "learning_rate": 8.990707516790874e-05, "loss": 0.9478, "mean_token_accuracy": 0.7287241034209728, "num_tokens": 105054885.0, "step": 3292 }, { "entropy": 0.9031356237828732, "epoch": 0.30297698115594507, "grad_norm": 0.1623692363500595, "learning_rate": 8.990400834176711e-05, "loss": 0.9013, "mean_token_accuracy": 0.7411410510540009, "num_tokens": 105087024.0, "step": 3293 }, { "entropy": 0.9123191609978676, "epoch": 0.30306898752738626, "grad_norm": 0.1640353500843048, "learning_rate": 8.990094151562548e-05, "loss": 0.9174, "mean_token_accuracy": 0.7345234416425228, "num_tokens": 105118965.0, "step": 3294 }, { "entropy": 0.7764587961137295, "epoch": 0.3031609938988275, "grad_norm": 0.15043382346630096, "learning_rate": 8.989787468948386e-05, "loss": 0.7863, "mean_token_accuracy": 0.7733436226844788, "num_tokens": 105150905.0, "step": 3295 }, { "entropy": 0.7245520725846291, "epoch": 0.3032530002702687, "grad_norm": 0.14699965715408325, "learning_rate": 8.989480786334224e-05, "loss": 0.7061, "mean_token_accuracy": 0.7925604283809662, "num_tokens": 105183522.0, "step": 3296 }, { "entropy": 0.8781691323965788, "epoch": 0.30334500664170994, "grad_norm": 0.1613631397485733, "learning_rate": 8.989174103720061e-05, "loss": 0.8785, "mean_token_accuracy": 0.7492958977818489, "num_tokens": 105215544.0, "step": 3297 }, { "entropy": 0.7716808971017599, "epoch": 0.3034370130131512, "grad_norm": 0.15590186417102814, "learning_rate": 8.988867421105897e-05, "loss": 0.7699, "mean_token_accuracy": 0.7764951586723328, "num_tokens": 105247026.0, "step": 3298 }, { "entropy": 0.9221753589808941, "epoch": 0.30352901938459237, "grad_norm": 0.1586785465478897, "learning_rate": 8.988560738491736e-05, "loss": 0.9083, "mean_token_accuracy": 0.7405655793845654, "num_tokens": 105279177.0, "step": 3299 }, { "entropy": 0.7996969297528267, "epoch": 0.3036210257560336, "grad_norm": 0.15162025392055511, "learning_rate": 8.988254055877572e-05, "loss": 0.7897, "mean_token_accuracy": 0.7700985707342625, "num_tokens": 105311215.0, "step": 3300 }, { "entropy": 0.8502285815775394, "epoch": 0.3037130321274748, "grad_norm": 0.16252130270004272, "learning_rate": 8.98794737326341e-05, "loss": 0.8373, "mean_token_accuracy": 0.7606907598674297, "num_tokens": 105343258.0, "step": 3301 }, { "entropy": 0.8440442532300949, "epoch": 0.30380503849891605, "grad_norm": 0.16510072350502014, "learning_rate": 8.987640690649247e-05, "loss": 0.8188, "mean_token_accuracy": 0.7636057585477829, "num_tokens": 105375090.0, "step": 3302 }, { "entropy": 0.8962010480463505, "epoch": 0.3038970448703573, "grad_norm": 0.15951000154018402, "learning_rate": 8.987334008035085e-05, "loss": 0.8818, "mean_token_accuracy": 0.7452445812523365, "num_tokens": 105407819.0, "step": 3303 }, { "entropy": 0.9074329137802124, "epoch": 0.3039890512417985, "grad_norm": 0.16500933468341827, "learning_rate": 8.987027325420922e-05, "loss": 0.8856, "mean_token_accuracy": 0.7465296946465969, "num_tokens": 105439615.0, "step": 3304 }, { "entropy": 0.6833754424005747, "epoch": 0.3040810576132397, "grad_norm": 0.1534537822008133, "learning_rate": 8.986720642806759e-05, "loss": 0.6698, "mean_token_accuracy": 0.8015486225485802, "num_tokens": 105471659.0, "step": 3305 }, { "entropy": 0.7984276637434959, "epoch": 0.3041730639846809, "grad_norm": 0.159820556640625, "learning_rate": 8.986413960192597e-05, "loss": 0.8059, "mean_token_accuracy": 0.7688219845294952, "num_tokens": 105503751.0, "step": 3306 }, { "entropy": 0.8274598345160484, "epoch": 0.30426507035612216, "grad_norm": 0.15676307678222656, "learning_rate": 8.986107277578435e-05, "loss": 0.8248, "mean_token_accuracy": 0.761259950697422, "num_tokens": 105535513.0, "step": 3307 }, { "entropy": 0.7732108980417252, "epoch": 0.3043570767275634, "grad_norm": 0.16581346094608307, "learning_rate": 8.985800594964272e-05, "loss": 0.7847, "mean_token_accuracy": 0.7757288031280041, "num_tokens": 105568147.0, "step": 3308 }, { "entropy": 0.8576384261250496, "epoch": 0.3044490830990046, "grad_norm": 0.15907779335975647, "learning_rate": 8.985493912350109e-05, "loss": 0.8618, "mean_token_accuracy": 0.7537677325308323, "num_tokens": 105599858.0, "step": 3309 }, { "entropy": 0.8255168981850147, "epoch": 0.30454108947044584, "grad_norm": 0.16256462037563324, "learning_rate": 8.985187229735946e-05, "loss": 0.8375, "mean_token_accuracy": 0.7583555802702904, "num_tokens": 105631613.0, "step": 3310 }, { "entropy": 0.8038213066756725, "epoch": 0.304633095841887, "grad_norm": 0.164347842335701, "learning_rate": 8.984880547121784e-05, "loss": 0.813, "mean_token_accuracy": 0.7636975757777691, "num_tokens": 105664087.0, "step": 3311 }, { "entropy": 0.8426744043827057, "epoch": 0.30472510221332827, "grad_norm": 0.15932713449001312, "learning_rate": 8.984573864507622e-05, "loss": 0.8257, "mean_token_accuracy": 0.7636202238500118, "num_tokens": 105695770.0, "step": 3312 }, { "entropy": 0.8294839784502983, "epoch": 0.3048171085847695, "grad_norm": 0.1553800255060196, "learning_rate": 8.984267181893459e-05, "loss": 0.809, "mean_token_accuracy": 0.769551333039999, "num_tokens": 105727924.0, "step": 3313 }, { "entropy": 0.8986268546432257, "epoch": 0.3049091149562107, "grad_norm": 0.16098618507385254, "learning_rate": 8.983960499279296e-05, "loss": 0.8671, "mean_token_accuracy": 0.7564220763742924, "num_tokens": 105760114.0, "step": 3314 }, { "entropy": 0.8436742760241032, "epoch": 0.30500112132765195, "grad_norm": 0.1690879464149475, "learning_rate": 8.983653816665134e-05, "loss": 0.8515, "mean_token_accuracy": 0.7549375891685486, "num_tokens": 105791865.0, "step": 3315 }, { "entropy": 0.8454981185495853, "epoch": 0.30509312769909314, "grad_norm": 0.16441774368286133, "learning_rate": 8.98334713405097e-05, "loss": 0.8501, "mean_token_accuracy": 0.7569825872778893, "num_tokens": 105823394.0, "step": 3316 }, { "entropy": 0.8073604591190815, "epoch": 0.3051851340705344, "grad_norm": 0.1652093082666397, "learning_rate": 8.983040451436809e-05, "loss": 0.8281, "mean_token_accuracy": 0.7651664577424526, "num_tokens": 105855428.0, "step": 3317 }, { "entropy": 0.7817899733781815, "epoch": 0.3052771404419756, "grad_norm": 0.1541690230369568, "learning_rate": 8.982733768822645e-05, "loss": 0.7726, "mean_token_accuracy": 0.7757956422865391, "num_tokens": 105887548.0, "step": 3318 }, { "entropy": 0.7542545199394226, "epoch": 0.3053691468134168, "grad_norm": 0.1585613191127777, "learning_rate": 8.982427086208484e-05, "loss": 0.7595, "mean_token_accuracy": 0.7744403779506683, "num_tokens": 105919729.0, "step": 3319 }, { "entropy": 0.7945720311254263, "epoch": 0.30546115318485806, "grad_norm": 0.14960896968841553, "learning_rate": 8.98212040359432e-05, "loss": 0.7847, "mean_token_accuracy": 0.7692020013928413, "num_tokens": 105952100.0, "step": 3320 }, { "entropy": 0.8481711223721504, "epoch": 0.30555315955629925, "grad_norm": 0.15867899358272552, "learning_rate": 8.981813720980158e-05, "loss": 0.8391, "mean_token_accuracy": 0.7576230764389038, "num_tokens": 105983718.0, "step": 3321 }, { "entropy": 0.73432806879282, "epoch": 0.3056451659277405, "grad_norm": 0.1511050909757614, "learning_rate": 8.981507038365995e-05, "loss": 0.7228, "mean_token_accuracy": 0.7931059114634991, "num_tokens": 106015090.0, "step": 3322 }, { "entropy": 0.8498538285493851, "epoch": 0.30573717229918174, "grad_norm": 0.15675461292266846, "learning_rate": 8.981200355751833e-05, "loss": 0.8378, "mean_token_accuracy": 0.7559861354529858, "num_tokens": 106047161.0, "step": 3323 }, { "entropy": 0.8771975375711918, "epoch": 0.3058291786706229, "grad_norm": 0.1592167168855667, "learning_rate": 8.98089367313767e-05, "loss": 0.8819, "mean_token_accuracy": 0.7462339773774147, "num_tokens": 106078936.0, "step": 3324 }, { "entropy": 0.8097424507141113, "epoch": 0.30592118504206417, "grad_norm": 0.16221049427986145, "learning_rate": 8.980586990523507e-05, "loss": 0.8179, "mean_token_accuracy": 0.7635729014873505, "num_tokens": 106110577.0, "step": 3325 }, { "entropy": 0.829821765422821, "epoch": 0.30601319141350536, "grad_norm": 0.16331863403320312, "learning_rate": 8.980280307909345e-05, "loss": 0.8239, "mean_token_accuracy": 0.7648102715611458, "num_tokens": 106141365.0, "step": 3326 }, { "entropy": 0.8956534564495087, "epoch": 0.3061051977849466, "grad_norm": 0.162184938788414, "learning_rate": 8.979973625295183e-05, "loss": 0.8926, "mean_token_accuracy": 0.7476503364741802, "num_tokens": 106173400.0, "step": 3327 }, { "entropy": 0.8383217975497246, "epoch": 0.30619720415638785, "grad_norm": 0.1588013768196106, "learning_rate": 8.97966694268102e-05, "loss": 0.8311, "mean_token_accuracy": 0.7612211406230927, "num_tokens": 106205034.0, "step": 3328 }, { "entropy": 0.8862363826483488, "epoch": 0.30628921052782904, "grad_norm": 0.17446106672286987, "learning_rate": 8.979360260066857e-05, "loss": 0.9114, "mean_token_accuracy": 0.7449915036559105, "num_tokens": 106236353.0, "step": 3329 }, { "entropy": 0.8446763232350349, "epoch": 0.3063812168992703, "grad_norm": 0.16113048791885376, "learning_rate": 8.979053577452695e-05, "loss": 0.842, "mean_token_accuracy": 0.7623230889439583, "num_tokens": 106268275.0, "step": 3330 }, { "entropy": 0.7043800875544548, "epoch": 0.30647322327071147, "grad_norm": 0.14937055110931396, "learning_rate": 8.978746894838532e-05, "loss": 0.6726, "mean_token_accuracy": 0.8059864901006222, "num_tokens": 106299876.0, "step": 3331 }, { "entropy": 0.8158455733209848, "epoch": 0.3065652296421527, "grad_norm": 0.1580374538898468, "learning_rate": 8.97844021222437e-05, "loss": 0.7844, "mean_token_accuracy": 0.7756520546972752, "num_tokens": 106330673.0, "step": 3332 }, { "entropy": 0.7675344198942184, "epoch": 0.30665723601359396, "grad_norm": 0.15294520556926727, "learning_rate": 8.978133529610207e-05, "loss": 0.7504, "mean_token_accuracy": 0.7812991514801979, "num_tokens": 106362062.0, "step": 3333 }, { "entropy": 0.8845080770552158, "epoch": 0.30674924238503515, "grad_norm": 0.15565115213394165, "learning_rate": 8.977826846996045e-05, "loss": 0.8823, "mean_token_accuracy": 0.745218213647604, "num_tokens": 106393897.0, "step": 3334 }, { "entropy": 0.9474118612706661, "epoch": 0.3068412487564764, "grad_norm": 0.1660860776901245, "learning_rate": 8.977520164381882e-05, "loss": 0.9515, "mean_token_accuracy": 0.732705395668745, "num_tokens": 106424731.0, "step": 3335 }, { "entropy": 0.8411702234297991, "epoch": 0.3069332551279176, "grad_norm": 0.16285820305347443, "learning_rate": 8.977213481767718e-05, "loss": 0.8452, "mean_token_accuracy": 0.7572759613394737, "num_tokens": 106456487.0, "step": 3336 }, { "entropy": 0.7549398392438889, "epoch": 0.3070252614993588, "grad_norm": 0.16553448140621185, "learning_rate": 8.976906799153557e-05, "loss": 0.737, "mean_token_accuracy": 0.7847160659730434, "num_tokens": 106488223.0, "step": 3337 }, { "entropy": 0.7920087538659573, "epoch": 0.30711726787080007, "grad_norm": 0.16820314526557922, "learning_rate": 8.976600116539395e-05, "loss": 0.7914, "mean_token_accuracy": 0.7708416096866131, "num_tokens": 106520456.0, "step": 3338 }, { "entropy": 0.7634782716631889, "epoch": 0.30720927424224126, "grad_norm": 0.1590406447649002, "learning_rate": 8.976293433925232e-05, "loss": 0.7716, "mean_token_accuracy": 0.7753103524446487, "num_tokens": 106552699.0, "step": 3339 }, { "entropy": 0.8210577815771103, "epoch": 0.3073012806136825, "grad_norm": 0.16458940505981445, "learning_rate": 8.975986751311068e-05, "loss": 0.8193, "mean_token_accuracy": 0.7632529586553574, "num_tokens": 106584265.0, "step": 3340 }, { "entropy": 0.8422010466456413, "epoch": 0.3073932869851237, "grad_norm": 0.15678757429122925, "learning_rate": 8.975680068696905e-05, "loss": 0.8309, "mean_token_accuracy": 0.7565379999577999, "num_tokens": 106616371.0, "step": 3341 }, { "entropy": 0.789811035618186, "epoch": 0.30748529335656494, "grad_norm": 0.1548515409231186, "learning_rate": 8.975373386082743e-05, "loss": 0.7771, "mean_token_accuracy": 0.7731887884438038, "num_tokens": 106648738.0, "step": 3342 }, { "entropy": 0.9151780344545841, "epoch": 0.3075772997280062, "grad_norm": 0.1640041470527649, "learning_rate": 8.975066703468581e-05, "loss": 0.9117, "mean_token_accuracy": 0.7416977249085903, "num_tokens": 106681124.0, "step": 3343 }, { "entropy": 0.9039301872253418, "epoch": 0.30766930609944737, "grad_norm": 0.16260842978954315, "learning_rate": 8.974760020854418e-05, "loss": 0.9089, "mean_token_accuracy": 0.7424873895943165, "num_tokens": 106713021.0, "step": 3344 }, { "entropy": 0.7645845711231232, "epoch": 0.3077613124708886, "grad_norm": 0.15416578948497772, "learning_rate": 8.974453338240255e-05, "loss": 0.7609, "mean_token_accuracy": 0.776732299476862, "num_tokens": 106745129.0, "step": 3345 }, { "entropy": 0.8956094495952129, "epoch": 0.3078533188423298, "grad_norm": 0.16266463696956635, "learning_rate": 8.974146655626093e-05, "loss": 0.8859, "mean_token_accuracy": 0.7439479492604733, "num_tokens": 106777012.0, "step": 3346 }, { "entropy": 0.9455668944865465, "epoch": 0.30794532521377105, "grad_norm": 0.16309280693531036, "learning_rate": 8.97383997301193e-05, "loss": 0.9356, "mean_token_accuracy": 0.7327968738973141, "num_tokens": 106809404.0, "step": 3347 }, { "entropy": 0.9186445437371731, "epoch": 0.3080373315852123, "grad_norm": 0.15165959298610687, "learning_rate": 8.973533290397768e-05, "loss": 0.8972, "mean_token_accuracy": 0.742682695388794, "num_tokens": 106841767.0, "step": 3348 }, { "entropy": 0.9152895957231522, "epoch": 0.3081293379566535, "grad_norm": 0.15749751031398773, "learning_rate": 8.973226607783605e-05, "loss": 0.9171, "mean_token_accuracy": 0.7377259321510792, "num_tokens": 106874273.0, "step": 3349 }, { "entropy": 0.8876442909240723, "epoch": 0.3082213443280947, "grad_norm": 0.16297698020935059, "learning_rate": 8.972919925169443e-05, "loss": 0.8887, "mean_token_accuracy": 0.7481345348060131, "num_tokens": 106906367.0, "step": 3350 }, { "entropy": 0.8780762143433094, "epoch": 0.3083133506995359, "grad_norm": 0.16475142538547516, "learning_rate": 8.97261324255528e-05, "loss": 0.8786, "mean_token_accuracy": 0.7440071068704128, "num_tokens": 106937417.0, "step": 3351 }, { "entropy": 0.8727890364825726, "epoch": 0.30840535707097716, "grad_norm": 0.1611245572566986, "learning_rate": 8.972306559941117e-05, "loss": 0.8938, "mean_token_accuracy": 0.7447970025241375, "num_tokens": 106968851.0, "step": 3352 }, { "entropy": 0.7861177083104849, "epoch": 0.3084973634424184, "grad_norm": 0.1571521908044815, "learning_rate": 8.971999877326955e-05, "loss": 0.7753, "mean_token_accuracy": 0.7739078663289547, "num_tokens": 107000710.0, "step": 3353 }, { "entropy": 0.7040581107139587, "epoch": 0.3085893698138596, "grad_norm": 0.15606698393821716, "learning_rate": 8.971693194712793e-05, "loss": 0.7012, "mean_token_accuracy": 0.7910261079668999, "num_tokens": 107032569.0, "step": 3354 }, { "entropy": 0.8301891945302486, "epoch": 0.30868137618530084, "grad_norm": 0.17488594353199005, "learning_rate": 8.97138651209863e-05, "loss": 0.8609, "mean_token_accuracy": 0.757118783891201, "num_tokens": 107064846.0, "step": 3355 }, { "entropy": 0.8114203121513128, "epoch": 0.3087733825567421, "grad_norm": 0.16149668395519257, "learning_rate": 8.971079829484466e-05, "loss": 0.8116, "mean_token_accuracy": 0.769741602241993, "num_tokens": 107096512.0, "step": 3356 }, { "entropy": 0.8135862872004509, "epoch": 0.30886538892818327, "grad_norm": 0.15547241270542145, "learning_rate": 8.970773146870305e-05, "loss": 0.8204, "mean_token_accuracy": 0.7613033726811409, "num_tokens": 107128743.0, "step": 3357 }, { "entropy": 0.9450870268046856, "epoch": 0.3089573952996245, "grad_norm": 0.1613178700208664, "learning_rate": 8.970466464256143e-05, "loss": 0.9335, "mean_token_accuracy": 0.7328628338873386, "num_tokens": 107160793.0, "step": 3358 }, { "entropy": 0.7558762524276972, "epoch": 0.3090494016710657, "grad_norm": 0.15947629511356354, "learning_rate": 8.97015978164198e-05, "loss": 0.7581, "mean_token_accuracy": 0.7809092849493027, "num_tokens": 107192843.0, "step": 3359 }, { "entropy": 0.874690368771553, "epoch": 0.30914140804250695, "grad_norm": 0.1612749993801117, "learning_rate": 8.969853099027816e-05, "loss": 0.8714, "mean_token_accuracy": 0.74614367634058, "num_tokens": 107224375.0, "step": 3360 }, { "entropy": 0.8191475626081228, "epoch": 0.3092334144139482, "grad_norm": 0.1571519523859024, "learning_rate": 8.969546416413654e-05, "loss": 0.8057, "mean_token_accuracy": 0.7693458683788776, "num_tokens": 107256421.0, "step": 3361 }, { "entropy": 0.916392320767045, "epoch": 0.3093254207853894, "grad_norm": 0.16228047013282776, "learning_rate": 8.969239733799491e-05, "loss": 0.9165, "mean_token_accuracy": 0.7416674941778183, "num_tokens": 107288895.0, "step": 3362 }, { "entropy": 0.8933110572397709, "epoch": 0.3094174271568306, "grad_norm": 0.15446734428405762, "learning_rate": 8.968933051185329e-05, "loss": 0.8795, "mean_token_accuracy": 0.7469246350228786, "num_tokens": 107321521.0, "step": 3363 }, { "entropy": 0.8813019767403603, "epoch": 0.3095094335282718, "grad_norm": 0.16771674156188965, "learning_rate": 8.968626368571166e-05, "loss": 0.8756, "mean_token_accuracy": 0.7533271200954914, "num_tokens": 107352071.0, "step": 3364 }, { "entropy": 0.9212164767086506, "epoch": 0.30960143989971306, "grad_norm": 0.16714149713516235, "learning_rate": 8.968319685957004e-05, "loss": 0.907, "mean_token_accuracy": 0.7390821017324924, "num_tokens": 107383196.0, "step": 3365 }, { "entropy": 0.8212806023657322, "epoch": 0.3096934462711543, "grad_norm": 0.15265826880931854, "learning_rate": 8.968013003342841e-05, "loss": 0.8083, "mean_token_accuracy": 0.7634923309087753, "num_tokens": 107415261.0, "step": 3366 }, { "entropy": 0.9264769703149796, "epoch": 0.3097854526425955, "grad_norm": 0.16587881743907928, "learning_rate": 8.967706320728678e-05, "loss": 0.9247, "mean_token_accuracy": 0.7352628074586391, "num_tokens": 107446861.0, "step": 3367 }, { "entropy": 0.9255437925457954, "epoch": 0.30987745901403674, "grad_norm": 0.16572177410125732, "learning_rate": 8.967399638114516e-05, "loss": 0.926, "mean_token_accuracy": 0.735027190297842, "num_tokens": 107478657.0, "step": 3368 }, { "entropy": 0.6772649940103292, "epoch": 0.3099694653854779, "grad_norm": 0.14789026975631714, "learning_rate": 8.967092955500354e-05, "loss": 0.6594, "mean_token_accuracy": 0.8099015206098557, "num_tokens": 107511179.0, "step": 3369 }, { "entropy": 0.8865250870585442, "epoch": 0.31006147175691917, "grad_norm": 0.16351258754730225, "learning_rate": 8.966786272886191e-05, "loss": 0.8762, "mean_token_accuracy": 0.745740819722414, "num_tokens": 107542324.0, "step": 3370 }, { "entropy": 0.8729602210223675, "epoch": 0.3101534781283604, "grad_norm": 0.1611730456352234, "learning_rate": 8.966479590272028e-05, "loss": 0.8871, "mean_token_accuracy": 0.7484557814896107, "num_tokens": 107574530.0, "step": 3371 }, { "entropy": 0.9120924957096577, "epoch": 0.3102454844998016, "grad_norm": 0.16307108104228973, "learning_rate": 8.966172907657864e-05, "loss": 0.9041, "mean_token_accuracy": 0.7389633171260357, "num_tokens": 107606235.0, "step": 3372 }, { "entropy": 0.8155715521425009, "epoch": 0.31033749087124285, "grad_norm": 0.15640553832054138, "learning_rate": 8.965866225043703e-05, "loss": 0.8085, "mean_token_accuracy": 0.7675619050860405, "num_tokens": 107638389.0, "step": 3373 }, { "entropy": 0.8114733807742596, "epoch": 0.31042949724268404, "grad_norm": 0.16036543250083923, "learning_rate": 8.965559542429541e-05, "loss": 0.8197, "mean_token_accuracy": 0.7647829875349998, "num_tokens": 107670776.0, "step": 3374 }, { "entropy": 0.8628039713948965, "epoch": 0.3105215036141253, "grad_norm": 0.1548987329006195, "learning_rate": 8.965252859815378e-05, "loss": 0.8529, "mean_token_accuracy": 0.7598339356482029, "num_tokens": 107703305.0, "step": 3375 }, { "entropy": 0.8002487942576408, "epoch": 0.3106135099855665, "grad_norm": 0.15298177301883698, "learning_rate": 8.964946177201214e-05, "loss": 0.7843, "mean_token_accuracy": 0.7678748928010464, "num_tokens": 107735468.0, "step": 3376 }, { "entropy": 0.8673310242593288, "epoch": 0.3107055163570077, "grad_norm": 0.158192440867424, "learning_rate": 8.964639494587052e-05, "loss": 0.8577, "mean_token_accuracy": 0.7484673410654068, "num_tokens": 107766588.0, "step": 3377 }, { "entropy": 0.9051303900778294, "epoch": 0.31079752272844896, "grad_norm": 0.1605863869190216, "learning_rate": 8.964332811972889e-05, "loss": 0.9021, "mean_token_accuracy": 0.7446774244308472, "num_tokens": 107799151.0, "step": 3378 }, { "entropy": 0.761414485052228, "epoch": 0.31088952909989015, "grad_norm": 0.15178439021110535, "learning_rate": 8.964026129358727e-05, "loss": 0.7433, "mean_token_accuracy": 0.7865045443177223, "num_tokens": 107831405.0, "step": 3379 }, { "entropy": 0.724536344408989, "epoch": 0.3109815354713314, "grad_norm": 0.15169699490070343, "learning_rate": 8.963719446744564e-05, "loss": 0.7212, "mean_token_accuracy": 0.7915614955127239, "num_tokens": 107862889.0, "step": 3380 }, { "entropy": 0.9335004575550556, "epoch": 0.31107354184277264, "grad_norm": 0.16302767395973206, "learning_rate": 8.963412764130402e-05, "loss": 0.9239, "mean_token_accuracy": 0.7339739128947258, "num_tokens": 107893993.0, "step": 3381 }, { "entropy": 0.8746923618018627, "epoch": 0.3111655482142138, "grad_norm": 0.1629883348941803, "learning_rate": 8.963106081516239e-05, "loss": 0.8764, "mean_token_accuracy": 0.747954323887825, "num_tokens": 107926761.0, "step": 3382 }, { "entropy": 0.8743528239428997, "epoch": 0.31125755458565507, "grad_norm": 0.16261225938796997, "learning_rate": 8.962799398902076e-05, "loss": 0.8613, "mean_token_accuracy": 0.7521673105657101, "num_tokens": 107958810.0, "step": 3383 }, { "entropy": 0.8095735721290112, "epoch": 0.31134956095709626, "grad_norm": 0.1655687689781189, "learning_rate": 8.962492716287914e-05, "loss": 0.8165, "mean_token_accuracy": 0.765890333801508, "num_tokens": 107989736.0, "step": 3384 }, { "entropy": 0.8671386782079935, "epoch": 0.3114415673285375, "grad_norm": 0.16548436880111694, "learning_rate": 8.962186033673752e-05, "loss": 0.8556, "mean_token_accuracy": 0.7548238039016724, "num_tokens": 108022032.0, "step": 3385 }, { "entropy": 0.8222415596246719, "epoch": 0.31153357369997875, "grad_norm": 0.160286083817482, "learning_rate": 8.961879351059589e-05, "loss": 0.8153, "mean_token_accuracy": 0.760834563523531, "num_tokens": 108053502.0, "step": 3386 }, { "entropy": 0.8557467591017485, "epoch": 0.31162558007141994, "grad_norm": 0.16087114810943604, "learning_rate": 8.961572668445426e-05, "loss": 0.8414, "mean_token_accuracy": 0.7577027343213558, "num_tokens": 108085546.0, "step": 3387 }, { "entropy": 0.8516761548817158, "epoch": 0.3117175864428612, "grad_norm": 0.1561094969511032, "learning_rate": 8.961265985831264e-05, "loss": 0.8435, "mean_token_accuracy": 0.7559720575809479, "num_tokens": 108118090.0, "step": 3388 }, { "entropy": 0.7668294813483953, "epoch": 0.31180959281430237, "grad_norm": 0.15800561010837555, "learning_rate": 8.960959303217101e-05, "loss": 0.7683, "mean_token_accuracy": 0.7804623581469059, "num_tokens": 108149626.0, "step": 3389 }, { "entropy": 0.8711364343762398, "epoch": 0.3119015991857436, "grad_norm": 0.16084899008274078, "learning_rate": 8.960652620602939e-05, "loss": 0.8811, "mean_token_accuracy": 0.7477589920163155, "num_tokens": 108181627.0, "step": 3390 }, { "entropy": 0.8789335638284683, "epoch": 0.31199360555718486, "grad_norm": 0.16048380732536316, "learning_rate": 8.960345937988776e-05, "loss": 0.869, "mean_token_accuracy": 0.7501428350806236, "num_tokens": 108213515.0, "step": 3391 }, { "entropy": 0.8345394767820835, "epoch": 0.31208561192862605, "grad_norm": 0.1597360223531723, "learning_rate": 8.960039255374614e-05, "loss": 0.8409, "mean_token_accuracy": 0.7559681497514248, "num_tokens": 108245437.0, "step": 3392 }, { "entropy": 0.8228997774422169, "epoch": 0.3121776183000673, "grad_norm": 0.15864379703998566, "learning_rate": 8.95973257276045e-05, "loss": 0.8287, "mean_token_accuracy": 0.7638945803046227, "num_tokens": 108278027.0, "step": 3393 }, { "entropy": 0.8292393758893013, "epoch": 0.3122696246715085, "grad_norm": 0.15327489376068115, "learning_rate": 8.959425890146287e-05, "loss": 0.8118, "mean_token_accuracy": 0.7641171775758266, "num_tokens": 108310610.0, "step": 3394 }, { "entropy": 0.8673300929367542, "epoch": 0.31236163104294973, "grad_norm": 0.16689468920230865, "learning_rate": 8.959119207532125e-05, "loss": 0.8579, "mean_token_accuracy": 0.7529419288039207, "num_tokens": 108342449.0, "step": 3395 }, { "entropy": 0.8545701242983341, "epoch": 0.312453637414391, "grad_norm": 0.15719272196292877, "learning_rate": 8.958812524917964e-05, "loss": 0.841, "mean_token_accuracy": 0.7602478265762329, "num_tokens": 108373785.0, "step": 3396 }, { "entropy": 0.7741125803440809, "epoch": 0.31254564378583216, "grad_norm": 0.1587003469467163, "learning_rate": 8.9585058423038e-05, "loss": 0.7606, "mean_token_accuracy": 0.776952039450407, "num_tokens": 108406087.0, "step": 3397 }, { "entropy": 0.8209522627294064, "epoch": 0.3126376501572734, "grad_norm": 0.16815149784088135, "learning_rate": 8.958199159689637e-05, "loss": 0.8068, "mean_token_accuracy": 0.7657389119267464, "num_tokens": 108437343.0, "step": 3398 }, { "entropy": 0.8399774860590696, "epoch": 0.3127296565287146, "grad_norm": 0.16077417135238647, "learning_rate": 8.957892477075474e-05, "loss": 0.8516, "mean_token_accuracy": 0.7590476498007774, "num_tokens": 108469587.0, "step": 3399 }, { "entropy": 0.7874167989939451, "epoch": 0.31282166290015584, "grad_norm": 0.15489107370376587, "learning_rate": 8.957585794461313e-05, "loss": 0.7498, "mean_token_accuracy": 0.7814004495739937, "num_tokens": 108501440.0, "step": 3400 }, { "entropy": 0.7249480038881302, "epoch": 0.3129136692715971, "grad_norm": 0.14852961897850037, "learning_rate": 8.95727911184715e-05, "loss": 0.7113, "mean_token_accuracy": 0.7877282202243805, "num_tokens": 108533754.0, "step": 3401 }, { "entropy": 0.8292773254215717, "epoch": 0.3130056756430383, "grad_norm": 0.16443556547164917, "learning_rate": 8.956972429232987e-05, "loss": 0.8341, "mean_token_accuracy": 0.7582583054900169, "num_tokens": 108565300.0, "step": 3402 }, { "entropy": 0.8174557536840439, "epoch": 0.3130976820144795, "grad_norm": 0.17231027781963348, "learning_rate": 8.956665746618824e-05, "loss": 0.835, "mean_token_accuracy": 0.7617228738963604, "num_tokens": 108595529.0, "step": 3403 }, { "entropy": 0.9089966677129269, "epoch": 0.3131896883859207, "grad_norm": 0.16000422835350037, "learning_rate": 8.956359064004662e-05, "loss": 0.899, "mean_token_accuracy": 0.7424996346235275, "num_tokens": 108627359.0, "step": 3404 }, { "entropy": 0.7492682915180922, "epoch": 0.31328169475736195, "grad_norm": 0.15666493773460388, "learning_rate": 8.9560523813905e-05, "loss": 0.7399, "mean_token_accuracy": 0.7813226282596588, "num_tokens": 108659205.0, "step": 3405 }, { "entropy": 0.7816653475165367, "epoch": 0.3133737011288032, "grad_norm": 0.15676085650920868, "learning_rate": 8.955745698776337e-05, "loss": 0.7744, "mean_token_accuracy": 0.776084840297699, "num_tokens": 108690820.0, "step": 3406 }, { "entropy": 0.8218459617346525, "epoch": 0.3134657075002444, "grad_norm": 0.15737900137901306, "learning_rate": 8.955439016162174e-05, "loss": 0.8199, "mean_token_accuracy": 0.7669998444616795, "num_tokens": 108723380.0, "step": 3407 }, { "entropy": 0.774602685123682, "epoch": 0.31355771387168563, "grad_norm": 0.156219944357872, "learning_rate": 8.955132333548012e-05, "loss": 0.7567, "mean_token_accuracy": 0.773693036288023, "num_tokens": 108754305.0, "step": 3408 }, { "entropy": 0.8769824802875519, "epoch": 0.3136497202431268, "grad_norm": 0.16475169360637665, "learning_rate": 8.954825650933849e-05, "loss": 0.8583, "mean_token_accuracy": 0.7550069615244865, "num_tokens": 108785750.0, "step": 3409 }, { "entropy": 0.7020296547561884, "epoch": 0.31374172661456806, "grad_norm": 0.15911468863487244, "learning_rate": 8.954518968319687e-05, "loss": 0.7012, "mean_token_accuracy": 0.7991133071482182, "num_tokens": 108817806.0, "step": 3410 }, { "entropy": 0.885748652741313, "epoch": 0.3138337329860093, "grad_norm": 0.16307953000068665, "learning_rate": 8.954212285705524e-05, "loss": 0.8794, "mean_token_accuracy": 0.7499202415347099, "num_tokens": 108850071.0, "step": 3411 }, { "entropy": 0.9413866214454174, "epoch": 0.3139257393574505, "grad_norm": 0.1667211502790451, "learning_rate": 8.953905603091362e-05, "loss": 0.9406, "mean_token_accuracy": 0.7375316135585308, "num_tokens": 108882091.0, "step": 3412 }, { "entropy": 0.7985147498548031, "epoch": 0.31401774572889174, "grad_norm": 0.15284083783626556, "learning_rate": 8.953598920477198e-05, "loss": 0.7967, "mean_token_accuracy": 0.7665813155472279, "num_tokens": 108914284.0, "step": 3413 }, { "entropy": 0.7827238384634256, "epoch": 0.31410975210033293, "grad_norm": 0.161714568734169, "learning_rate": 8.953292237863035e-05, "loss": 0.7675, "mean_token_accuracy": 0.7779492922127247, "num_tokens": 108946514.0, "step": 3414 }, { "entropy": 0.79734867811203, "epoch": 0.3142017584717742, "grad_norm": 0.15360012650489807, "learning_rate": 8.952985555248873e-05, "loss": 0.7806, "mean_token_accuracy": 0.7711176313459873, "num_tokens": 108977942.0, "step": 3415 }, { "entropy": 0.8050581105053425, "epoch": 0.3142937648432154, "grad_norm": 0.16392603516578674, "learning_rate": 8.952678872634712e-05, "loss": 0.7967, "mean_token_accuracy": 0.7643947154283524, "num_tokens": 109009876.0, "step": 3416 }, { "entropy": 0.8860770743340254, "epoch": 0.3143857712146566, "grad_norm": 0.15949280560016632, "learning_rate": 8.952372190020548e-05, "loss": 0.8733, "mean_token_accuracy": 0.7473620660603046, "num_tokens": 109042403.0, "step": 3417 }, { "entropy": 0.8013679161667824, "epoch": 0.31447777758609785, "grad_norm": 0.15772996842861176, "learning_rate": 8.952065507406385e-05, "loss": 0.7906, "mean_token_accuracy": 0.7677351757884026, "num_tokens": 109074018.0, "step": 3418 }, { "entropy": 0.8261696547269821, "epoch": 0.31456978395753904, "grad_norm": 0.15970836579799652, "learning_rate": 8.951758824792223e-05, "loss": 0.8085, "mean_token_accuracy": 0.7622645050287247, "num_tokens": 109105537.0, "step": 3419 }, { "entropy": 0.9710891451686621, "epoch": 0.3146617903289803, "grad_norm": 0.16195394098758698, "learning_rate": 8.95145214217806e-05, "loss": 0.9702, "mean_token_accuracy": 0.7267987355589867, "num_tokens": 109137858.0, "step": 3420 }, { "entropy": 0.7899205461144447, "epoch": 0.31475379670042153, "grad_norm": 0.16411779820919037, "learning_rate": 8.951145459563898e-05, "loss": 0.7969, "mean_token_accuracy": 0.7686477825045586, "num_tokens": 109169496.0, "step": 3421 }, { "entropy": 0.7515205442905426, "epoch": 0.3148458030718627, "grad_norm": 0.15749630331993103, "learning_rate": 8.950838776949735e-05, "loss": 0.7441, "mean_token_accuracy": 0.7807129956781864, "num_tokens": 109200908.0, "step": 3422 }, { "entropy": 0.7766888216137886, "epoch": 0.31493780944330396, "grad_norm": 0.15730245411396027, "learning_rate": 8.950532094335573e-05, "loss": 0.7885, "mean_token_accuracy": 0.7683335468173027, "num_tokens": 109233009.0, "step": 3423 }, { "entropy": 0.8106716051697731, "epoch": 0.31502981581474515, "grad_norm": 0.16227684915065765, "learning_rate": 8.95022541172141e-05, "loss": 0.7942, "mean_token_accuracy": 0.7692654058337212, "num_tokens": 109264616.0, "step": 3424 }, { "entropy": 0.8341722171753645, "epoch": 0.3151218221861864, "grad_norm": 0.15843293070793152, "learning_rate": 8.949918729107247e-05, "loss": 0.8495, "mean_token_accuracy": 0.7554115131497383, "num_tokens": 109297360.0, "step": 3425 }, { "entropy": 0.7868106588721275, "epoch": 0.31521382855762764, "grad_norm": 0.16203047335147858, "learning_rate": 8.949612046493085e-05, "loss": 0.7876, "mean_token_accuracy": 0.7723313830792904, "num_tokens": 109328396.0, "step": 3426 }, { "entropy": 0.7971117328852415, "epoch": 0.31530583492906883, "grad_norm": 0.16363993287086487, "learning_rate": 8.949305363878923e-05, "loss": 0.7896, "mean_token_accuracy": 0.7721246965229511, "num_tokens": 109360153.0, "step": 3427 }, { "entropy": 0.7811590675264597, "epoch": 0.3153978413005101, "grad_norm": 0.16658936440944672, "learning_rate": 8.94899868126476e-05, "loss": 0.7854, "mean_token_accuracy": 0.7749624513089657, "num_tokens": 109391896.0, "step": 3428 }, { "entropy": 0.7023147456347942, "epoch": 0.31548984767195126, "grad_norm": 0.15011928975582123, "learning_rate": 8.948691998650597e-05, "loss": 0.6886, "mean_token_accuracy": 0.7978311739861965, "num_tokens": 109423152.0, "step": 3429 }, { "entropy": 0.8084341306239367, "epoch": 0.3155818540433925, "grad_norm": 0.1531917154788971, "learning_rate": 8.948385316036433e-05, "loss": 0.8004, "mean_token_accuracy": 0.7677325420081615, "num_tokens": 109455065.0, "step": 3430 }, { "entropy": 0.9036215152591467, "epoch": 0.31567386041483375, "grad_norm": 0.16358636319637299, "learning_rate": 8.948078633422271e-05, "loss": 0.8802, "mean_token_accuracy": 0.7472815290093422, "num_tokens": 109486170.0, "step": 3431 }, { "entropy": 0.8911346234381199, "epoch": 0.31576586678627494, "grad_norm": 0.16302113234996796, "learning_rate": 8.94777195080811e-05, "loss": 0.8951, "mean_token_accuracy": 0.7453261017799377, "num_tokens": 109517229.0, "step": 3432 }, { "entropy": 0.8314700517803431, "epoch": 0.3158578731577162, "grad_norm": 0.15679825842380524, "learning_rate": 8.947465268193946e-05, "loss": 0.8138, "mean_token_accuracy": 0.7630833238363266, "num_tokens": 109549370.0, "step": 3433 }, { "entropy": 0.8138379380106926, "epoch": 0.3159498795291574, "grad_norm": 0.15530484914779663, "learning_rate": 8.947158585579783e-05, "loss": 0.8217, "mean_token_accuracy": 0.7628655731678009, "num_tokens": 109581171.0, "step": 3434 }, { "entropy": 0.8425354920327663, "epoch": 0.3160418859005986, "grad_norm": 0.1537533700466156, "learning_rate": 8.946851902965621e-05, "loss": 0.8405, "mean_token_accuracy": 0.7589230947196484, "num_tokens": 109613504.0, "step": 3435 }, { "entropy": 0.8536132611334324, "epoch": 0.31613389227203986, "grad_norm": 0.1595718413591385, "learning_rate": 8.946545220351458e-05, "loss": 0.8703, "mean_token_accuracy": 0.7467762492597103, "num_tokens": 109646035.0, "step": 3436 }, { "entropy": 0.8575638718903065, "epoch": 0.31622589864348105, "grad_norm": 0.148703932762146, "learning_rate": 8.946238537737296e-05, "loss": 0.8521, "mean_token_accuracy": 0.7513237930834293, "num_tokens": 109677948.0, "step": 3437 }, { "entropy": 0.7438035290688276, "epoch": 0.3163179050149223, "grad_norm": 0.14720644056797028, "learning_rate": 8.945931855123133e-05, "loss": 0.7296, "mean_token_accuracy": 0.7877347208559513, "num_tokens": 109709940.0, "step": 3438 }, { "entropy": 0.7959811296314001, "epoch": 0.3164099113863635, "grad_norm": 0.15656942129135132, "learning_rate": 8.945625172508971e-05, "loss": 0.7882, "mean_token_accuracy": 0.7710674107074738, "num_tokens": 109742708.0, "step": 3439 }, { "entropy": 0.8903893232345581, "epoch": 0.31650191775780473, "grad_norm": 0.16482454538345337, "learning_rate": 8.945318489894808e-05, "loss": 0.8739, "mean_token_accuracy": 0.7485821358859539, "num_tokens": 109773673.0, "step": 3440 }, { "entropy": 0.7849636003375053, "epoch": 0.316593924129246, "grad_norm": 0.15752696990966797, "learning_rate": 8.945011807280646e-05, "loss": 0.7602, "mean_token_accuracy": 0.7742185704410076, "num_tokens": 109804842.0, "step": 3441 }, { "entropy": 0.754973292350769, "epoch": 0.31668593050068716, "grad_norm": 0.15343701839447021, "learning_rate": 8.944705124666483e-05, "loss": 0.7311, "mean_token_accuracy": 0.7819373346865177, "num_tokens": 109836368.0, "step": 3442 }, { "entropy": 0.850654061883688, "epoch": 0.3167779368721284, "grad_norm": 0.16695885360240936, "learning_rate": 8.944398442052321e-05, "loss": 0.8481, "mean_token_accuracy": 0.7580230347812176, "num_tokens": 109868112.0, "step": 3443 }, { "entropy": 0.7854941710829735, "epoch": 0.3168699432435696, "grad_norm": 0.15840871632099152, "learning_rate": 8.944091759438158e-05, "loss": 0.7759, "mean_token_accuracy": 0.7762467972934246, "num_tokens": 109900025.0, "step": 3444 }, { "entropy": 0.8972769118845463, "epoch": 0.31696194961501084, "grad_norm": 0.1634475737810135, "learning_rate": 8.943785076823995e-05, "loss": 0.9094, "mean_token_accuracy": 0.7431809529662132, "num_tokens": 109931903.0, "step": 3445 }, { "entropy": 0.7820693664252758, "epoch": 0.3170539559864521, "grad_norm": 0.15861153602600098, "learning_rate": 8.943478394209833e-05, "loss": 0.8021, "mean_token_accuracy": 0.768190149217844, "num_tokens": 109963893.0, "step": 3446 }, { "entropy": 0.7859980911016464, "epoch": 0.3171459623578933, "grad_norm": 0.1600302755832672, "learning_rate": 8.943171711595671e-05, "loss": 0.7814, "mean_token_accuracy": 0.7759186439216137, "num_tokens": 109996508.0, "step": 3447 }, { "entropy": 0.7639955468475819, "epoch": 0.3172379687293345, "grad_norm": 0.1620306521654129, "learning_rate": 8.942865028981508e-05, "loss": 0.7759, "mean_token_accuracy": 0.7763983085751534, "num_tokens": 110028350.0, "step": 3448 }, { "entropy": 0.89695655554533, "epoch": 0.3173299751007757, "grad_norm": 0.15601515769958496, "learning_rate": 8.942558346367345e-05, "loss": 0.8828, "mean_token_accuracy": 0.743054922670126, "num_tokens": 110060546.0, "step": 3449 }, { "entropy": 0.8009643964469433, "epoch": 0.31742198147221695, "grad_norm": 0.1575240194797516, "learning_rate": 8.942251663753183e-05, "loss": 0.7951, "mean_token_accuracy": 0.7678246945142746, "num_tokens": 110092575.0, "step": 3450 }, { "entropy": 0.8117531165480614, "epoch": 0.3175139878436582, "grad_norm": 0.1526649445295334, "learning_rate": 8.94194498113902e-05, "loss": 0.8124, "mean_token_accuracy": 0.7645686119794846, "num_tokens": 110124985.0, "step": 3451 }, { "entropy": 0.8540495838969946, "epoch": 0.3176059942150994, "grad_norm": 0.15577557682991028, "learning_rate": 8.941638298524858e-05, "loss": 0.8407, "mean_token_accuracy": 0.7578328773379326, "num_tokens": 110157000.0, "step": 3452 }, { "entropy": 0.8964856266975403, "epoch": 0.31769800058654063, "grad_norm": 0.1592482179403305, "learning_rate": 8.941331615910694e-05, "loss": 0.8936, "mean_token_accuracy": 0.7450084909796715, "num_tokens": 110189038.0, "step": 3453 }, { "entropy": 0.771185178309679, "epoch": 0.3177900069579818, "grad_norm": 0.15692219138145447, "learning_rate": 8.941024933296533e-05, "loss": 0.7639, "mean_token_accuracy": 0.776179626584053, "num_tokens": 110219982.0, "step": 3454 }, { "entropy": 0.8270531259477139, "epoch": 0.31788201332942306, "grad_norm": 0.15755802392959595, "learning_rate": 8.940718250682369e-05, "loss": 0.8247, "mean_token_accuracy": 0.7578254379332066, "num_tokens": 110252170.0, "step": 3455 }, { "entropy": 0.8467460498213768, "epoch": 0.3179740197008643, "grad_norm": 0.1594618409872055, "learning_rate": 8.940411568068206e-05, "loss": 0.8459, "mean_token_accuracy": 0.7530449517071247, "num_tokens": 110283798.0, "step": 3456 }, { "entropy": 0.7305431459099054, "epoch": 0.3180660260723055, "grad_norm": 0.1463945358991623, "learning_rate": 8.940104885454044e-05, "loss": 0.7016, "mean_token_accuracy": 0.793040819466114, "num_tokens": 110315813.0, "step": 3457 }, { "entropy": 0.9113414920866489, "epoch": 0.31815803244374674, "grad_norm": 0.16249766945838928, "learning_rate": 8.939798202839882e-05, "loss": 0.9153, "mean_token_accuracy": 0.742634691298008, "num_tokens": 110347286.0, "step": 3458 }, { "entropy": 0.9176751039922237, "epoch": 0.31825003881518793, "grad_norm": 0.1625015288591385, "learning_rate": 8.939491520225719e-05, "loss": 0.9226, "mean_token_accuracy": 0.7373808845877647, "num_tokens": 110378303.0, "step": 3459 }, { "entropy": 0.6770880706608295, "epoch": 0.3183420451866292, "grad_norm": 0.14814499020576477, "learning_rate": 8.939184837611556e-05, "loss": 0.6582, "mean_token_accuracy": 0.8077810183167458, "num_tokens": 110410308.0, "step": 3460 }, { "entropy": 0.9036635607481003, "epoch": 0.3184340515580704, "grad_norm": 0.16205953061580658, "learning_rate": 8.938878154997393e-05, "loss": 0.9194, "mean_token_accuracy": 0.7385397180914879, "num_tokens": 110442674.0, "step": 3461 }, { "entropy": 0.8653042055666447, "epoch": 0.3185260579295116, "grad_norm": 0.15921372175216675, "learning_rate": 8.938571472383231e-05, "loss": 0.8467, "mean_token_accuracy": 0.7554636783897877, "num_tokens": 110474911.0, "step": 3462 }, { "entropy": 0.7399308662861586, "epoch": 0.31861806430095285, "grad_norm": 0.15623636543750763, "learning_rate": 8.938264789769069e-05, "loss": 0.7217, "mean_token_accuracy": 0.7849855087697506, "num_tokens": 110507316.0, "step": 3463 }, { "entropy": 0.8639474343508482, "epoch": 0.31871007067239404, "grad_norm": 0.16977128386497498, "learning_rate": 8.937958107154906e-05, "loss": 0.8782, "mean_token_accuracy": 0.7500095851719379, "num_tokens": 110539855.0, "step": 3464 }, { "entropy": 0.7351997848600149, "epoch": 0.3188020770438353, "grad_norm": 0.157207652926445, "learning_rate": 8.937651424540743e-05, "loss": 0.7295, "mean_token_accuracy": 0.7833399474620819, "num_tokens": 110571474.0, "step": 3465 }, { "entropy": 0.912595372647047, "epoch": 0.31889408341527653, "grad_norm": 0.1673603057861328, "learning_rate": 8.937344741926581e-05, "loss": 0.9347, "mean_token_accuracy": 0.7377117834985256, "num_tokens": 110604097.0, "step": 3466 }, { "entropy": 0.8298111706972122, "epoch": 0.3189860897867177, "grad_norm": 0.15111568570137024, "learning_rate": 8.937038059312418e-05, "loss": 0.7933, "mean_token_accuracy": 0.7706094235181808, "num_tokens": 110636865.0, "step": 3467 }, { "entropy": 0.7930690050125122, "epoch": 0.31907809615815896, "grad_norm": 0.15420673787593842, "learning_rate": 8.936731376698256e-05, "loss": 0.7756, "mean_token_accuracy": 0.7751842215657234, "num_tokens": 110669080.0, "step": 3468 }, { "entropy": 0.838044686242938, "epoch": 0.31917010252960015, "grad_norm": 0.15985435247421265, "learning_rate": 8.936424694084092e-05, "loss": 0.8099, "mean_token_accuracy": 0.7662044130265713, "num_tokens": 110701489.0, "step": 3469 }, { "entropy": 0.7858495488762856, "epoch": 0.3192621089010414, "grad_norm": 0.1545124650001526, "learning_rate": 8.93611801146993e-05, "loss": 0.7705, "mean_token_accuracy": 0.7765480019152164, "num_tokens": 110733636.0, "step": 3470 }, { "entropy": 0.8793566785752773, "epoch": 0.31935411527248264, "grad_norm": 0.15899978578090668, "learning_rate": 8.935811328855767e-05, "loss": 0.893, "mean_token_accuracy": 0.7393013276159763, "num_tokens": 110765667.0, "step": 3471 }, { "entropy": 0.7493473067879677, "epoch": 0.31944612164392383, "grad_norm": 0.15404105186462402, "learning_rate": 8.935504646241604e-05, "loss": 0.7255, "mean_token_accuracy": 0.7856524996459484, "num_tokens": 110797293.0, "step": 3472 }, { "entropy": 0.9172775913029909, "epoch": 0.3195381280153651, "grad_norm": 0.16059572994709015, "learning_rate": 8.935197963627442e-05, "loss": 0.9134, "mean_token_accuracy": 0.7425948083400726, "num_tokens": 110829096.0, "step": 3473 }, { "entropy": 0.8422709237784147, "epoch": 0.31963013438680626, "grad_norm": 0.16786612570285797, "learning_rate": 8.93489128101328e-05, "loss": 0.8339, "mean_token_accuracy": 0.7546804435551167, "num_tokens": 110859754.0, "step": 3474 }, { "entropy": 0.8867340832948685, "epoch": 0.3197221407582475, "grad_norm": 0.15802140533924103, "learning_rate": 8.934584598399117e-05, "loss": 0.8771, "mean_token_accuracy": 0.7485387660562992, "num_tokens": 110892179.0, "step": 3475 }, { "entropy": 0.8563601039350033, "epoch": 0.31981414712968875, "grad_norm": 0.1600835770368576, "learning_rate": 8.934277915784954e-05, "loss": 0.8535, "mean_token_accuracy": 0.7549396641552448, "num_tokens": 110924357.0, "step": 3476 }, { "entropy": 0.8324606735259295, "epoch": 0.31990615350112994, "grad_norm": 0.1601134091615677, "learning_rate": 8.933971233170791e-05, "loss": 0.8366, "mean_token_accuracy": 0.759260967373848, "num_tokens": 110955666.0, "step": 3477 }, { "entropy": 0.7992579881101847, "epoch": 0.3199981598725712, "grad_norm": 0.15123245120048523, "learning_rate": 8.93366455055663e-05, "loss": 0.7973, "mean_token_accuracy": 0.7695608474314213, "num_tokens": 110987899.0, "step": 3478 }, { "entropy": 0.8116626888513565, "epoch": 0.3200901662440124, "grad_norm": 0.15879400074481964, "learning_rate": 8.933357867942467e-05, "loss": 0.8062, "mean_token_accuracy": 0.7640635073184967, "num_tokens": 111019442.0, "step": 3479 }, { "entropy": 0.815089039504528, "epoch": 0.3201821726154536, "grad_norm": 0.15871118009090424, "learning_rate": 8.933051185328304e-05, "loss": 0.8125, "mean_token_accuracy": 0.7650168091058731, "num_tokens": 111051702.0, "step": 3480 }, { "entropy": 0.8192152716219425, "epoch": 0.32027417898689486, "grad_norm": 0.14853739738464355, "learning_rate": 8.932744502714142e-05, "loss": 0.8127, "mean_token_accuracy": 0.766155794262886, "num_tokens": 111083752.0, "step": 3481 }, { "entropy": 0.8583752140402794, "epoch": 0.32036618535833605, "grad_norm": 0.16112826764583588, "learning_rate": 8.932437820099979e-05, "loss": 0.8403, "mean_token_accuracy": 0.7576774209737778, "num_tokens": 111115129.0, "step": 3482 }, { "entropy": 0.8250080049037933, "epoch": 0.3204581917297773, "grad_norm": 0.15579645335674286, "learning_rate": 8.932131137485817e-05, "loss": 0.7908, "mean_token_accuracy": 0.7734724916517735, "num_tokens": 111147335.0, "step": 3483 }, { "entropy": 0.8525599353015423, "epoch": 0.3205501981012185, "grad_norm": 0.15474143624305725, "learning_rate": 8.931824454871654e-05, "loss": 0.8387, "mean_token_accuracy": 0.7567358165979385, "num_tokens": 111179002.0, "step": 3484 }, { "entropy": 0.7751132249832153, "epoch": 0.32064220447265973, "grad_norm": 0.15190677344799042, "learning_rate": 8.931517772257492e-05, "loss": 0.759, "mean_token_accuracy": 0.7825722768902779, "num_tokens": 111210687.0, "step": 3485 }, { "entropy": 0.9125880636274815, "epoch": 0.320734210844101, "grad_norm": 0.16443994641304016, "learning_rate": 8.931211089643329e-05, "loss": 0.9096, "mean_token_accuracy": 0.7385830767452717, "num_tokens": 111242373.0, "step": 3486 }, { "entropy": 0.7925374712795019, "epoch": 0.32082621721554216, "grad_norm": 0.16025413572788239, "learning_rate": 8.930904407029165e-05, "loss": 0.7974, "mean_token_accuracy": 0.7744494155049324, "num_tokens": 111274974.0, "step": 3487 }, { "entropy": 0.8816979937255383, "epoch": 0.3209182235869834, "grad_norm": 0.16906802356243134, "learning_rate": 8.930597724415004e-05, "loss": 0.888, "mean_token_accuracy": 0.7486885711550713, "num_tokens": 111306190.0, "step": 3488 }, { "entropy": 0.7651477418839931, "epoch": 0.3210102299584246, "grad_norm": 0.16292248666286469, "learning_rate": 8.930291041800842e-05, "loss": 0.7828, "mean_token_accuracy": 0.7700636237859726, "num_tokens": 111338046.0, "step": 3489 }, { "entropy": 0.8288666047155857, "epoch": 0.32110223632986584, "grad_norm": 0.15535566210746765, "learning_rate": 8.929984359186679e-05, "loss": 0.8166, "mean_token_accuracy": 0.7632523365318775, "num_tokens": 111370526.0, "step": 3490 }, { "entropy": 0.7950088009238243, "epoch": 0.3211942427013071, "grad_norm": 0.15817055106163025, "learning_rate": 8.929677676572515e-05, "loss": 0.7921, "mean_token_accuracy": 0.7670589871704578, "num_tokens": 111402003.0, "step": 3491 }, { "entropy": 0.7908246032893658, "epoch": 0.3212862490727483, "grad_norm": 0.15442492067813873, "learning_rate": 8.929370993958352e-05, "loss": 0.795, "mean_token_accuracy": 0.7671869024634361, "num_tokens": 111434076.0, "step": 3492 }, { "entropy": 0.7186293508857489, "epoch": 0.3213782554441895, "grad_norm": 0.14667977392673492, "learning_rate": 8.92906431134419e-05, "loss": 0.729, "mean_token_accuracy": 0.7868706695735455, "num_tokens": 111466275.0, "step": 3493 }, { "entropy": 0.816513067111373, "epoch": 0.3214702618156307, "grad_norm": 0.15883442759513855, "learning_rate": 8.928757628730028e-05, "loss": 0.7946, "mean_token_accuracy": 0.7670467905700207, "num_tokens": 111496705.0, "step": 3494 }, { "entropy": 0.8788306880742311, "epoch": 0.32156226818707195, "grad_norm": 0.15579599142074585, "learning_rate": 8.928450946115865e-05, "loss": 0.8605, "mean_token_accuracy": 0.751182995736599, "num_tokens": 111529099.0, "step": 3495 }, { "entropy": 0.9049365520477295, "epoch": 0.3216542745585132, "grad_norm": 0.15226545929908752, "learning_rate": 8.928144263501702e-05, "loss": 0.879, "mean_token_accuracy": 0.7461988776922226, "num_tokens": 111561556.0, "step": 3496 }, { "entropy": 0.817472942173481, "epoch": 0.3217462809299544, "grad_norm": 0.1591382473707199, "learning_rate": 8.92783758088754e-05, "loss": 0.807, "mean_token_accuracy": 0.7643363811075687, "num_tokens": 111593392.0, "step": 3497 }, { "entropy": 0.8467215709388256, "epoch": 0.32183828730139563, "grad_norm": 0.1576875001192093, "learning_rate": 8.927530898273377e-05, "loss": 0.8362, "mean_token_accuracy": 0.7580426521599293, "num_tokens": 111625496.0, "step": 3498 }, { "entropy": 0.8946081697940826, "epoch": 0.3219302936728368, "grad_norm": 0.16749341785907745, "learning_rate": 8.927224215659215e-05, "loss": 0.891, "mean_token_accuracy": 0.7452874183654785, "num_tokens": 111657386.0, "step": 3499 }, { "entropy": 0.8084470666944981, "epoch": 0.32202230004427806, "grad_norm": 0.16346006095409393, "learning_rate": 8.926917533045052e-05, "loss": 0.8125, "mean_token_accuracy": 0.7639738097786903, "num_tokens": 111689531.0, "step": 3500 }, { "entropy": 0.799791282042861, "epoch": 0.3221143064157193, "grad_norm": 0.15397360920906067, "learning_rate": 8.92661085043089e-05, "loss": 0.7914, "mean_token_accuracy": 0.7676098756492138, "num_tokens": 111720915.0, "step": 3501 }, { "entropy": 0.7592886127531528, "epoch": 0.3222063127871605, "grad_norm": 0.15480400621891022, "learning_rate": 8.926304167816727e-05, "loss": 0.7333, "mean_token_accuracy": 0.7846937440335751, "num_tokens": 111752269.0, "step": 3502 }, { "entropy": 0.8349922448396683, "epoch": 0.32229831915860174, "grad_norm": 0.16307829320430756, "learning_rate": 8.925997485202564e-05, "loss": 0.8191, "mean_token_accuracy": 0.7641830630600452, "num_tokens": 111784621.0, "step": 3503 }, { "entropy": 0.8465308099985123, "epoch": 0.32239032553004293, "grad_norm": 0.1633448302745819, "learning_rate": 8.925690802588402e-05, "loss": 0.8555, "mean_token_accuracy": 0.7556760087609291, "num_tokens": 111816828.0, "step": 3504 }, { "entropy": 0.8387850373983383, "epoch": 0.3224823319014842, "grad_norm": 0.1602678745985031, "learning_rate": 8.92538411997424e-05, "loss": 0.8541, "mean_token_accuracy": 0.7550873458385468, "num_tokens": 111849170.0, "step": 3505 }, { "entropy": 0.768605325371027, "epoch": 0.3225743382729254, "grad_norm": 0.1608756184577942, "learning_rate": 8.925077437360077e-05, "loss": 0.7761, "mean_token_accuracy": 0.7756050117313862, "num_tokens": 111881470.0, "step": 3506 }, { "entropy": 0.9586869180202484, "epoch": 0.3226663446443666, "grad_norm": 0.16286087036132812, "learning_rate": 8.924770754745913e-05, "loss": 0.9717, "mean_token_accuracy": 0.7216954007744789, "num_tokens": 111913729.0, "step": 3507 }, { "entropy": 0.8235187102109194, "epoch": 0.32275835101580785, "grad_norm": 0.15379507839679718, "learning_rate": 8.92446407213175e-05, "loss": 0.8168, "mean_token_accuracy": 0.7663878388702869, "num_tokens": 111945757.0, "step": 3508 }, { "entropy": 0.8328001722693443, "epoch": 0.32285035738724904, "grad_norm": 0.15337993204593658, "learning_rate": 8.924157389517588e-05, "loss": 0.8116, "mean_token_accuracy": 0.7663005292415619, "num_tokens": 111977587.0, "step": 3509 }, { "entropy": 0.9084444344043732, "epoch": 0.3229423637586903, "grad_norm": 0.164095938205719, "learning_rate": 8.923850706903426e-05, "loss": 0.9008, "mean_token_accuracy": 0.7431821785867214, "num_tokens": 112009990.0, "step": 3510 }, { "entropy": 0.8985680546611547, "epoch": 0.32303437013013153, "grad_norm": 0.16000202298164368, "learning_rate": 8.923544024289263e-05, "loss": 0.8687, "mean_token_accuracy": 0.7556611560285091, "num_tokens": 112042201.0, "step": 3511 }, { "entropy": 0.7515249755233526, "epoch": 0.3231263765015727, "grad_norm": 0.15700507164001465, "learning_rate": 8.923237341675101e-05, "loss": 0.7336, "mean_token_accuracy": 0.7887502014636993, "num_tokens": 112074794.0, "step": 3512 }, { "entropy": 0.7538326028734446, "epoch": 0.32321838287301397, "grad_norm": 0.15205712616443634, "learning_rate": 8.922930659060938e-05, "loss": 0.7432, "mean_token_accuracy": 0.7784696035087109, "num_tokens": 112106445.0, "step": 3513 }, { "entropy": 0.7234333027154207, "epoch": 0.32331038924445515, "grad_norm": 0.15145999193191528, "learning_rate": 8.922623976446775e-05, "loss": 0.7331, "mean_token_accuracy": 0.7828084155917168, "num_tokens": 112138771.0, "step": 3514 }, { "entropy": 0.7778209578245878, "epoch": 0.3234023956158964, "grad_norm": 0.15707336366176605, "learning_rate": 8.922317293832613e-05, "loss": 0.7658, "mean_token_accuracy": 0.772449117153883, "num_tokens": 112170411.0, "step": 3515 }, { "entropy": 0.8654674328863621, "epoch": 0.32349440198733764, "grad_norm": 0.15499001741409302, "learning_rate": 8.922010611218451e-05, "loss": 0.8593, "mean_token_accuracy": 0.7483084164559841, "num_tokens": 112202381.0, "step": 3516 }, { "entropy": 0.7742456719279289, "epoch": 0.32358640835877883, "grad_norm": 0.16468708217144012, "learning_rate": 8.921703928604288e-05, "loss": 0.7878, "mean_token_accuracy": 0.7727333419024944, "num_tokens": 112234672.0, "step": 3517 }, { "entropy": 0.8356336914002895, "epoch": 0.3236784147302201, "grad_norm": 0.16786564886569977, "learning_rate": 8.921397245990125e-05, "loss": 0.8562, "mean_token_accuracy": 0.7618610896170139, "num_tokens": 112266866.0, "step": 3518 }, { "entropy": 0.7466015908867121, "epoch": 0.32377042110166127, "grad_norm": 0.16766873002052307, "learning_rate": 8.921090563375962e-05, "loss": 0.7689, "mean_token_accuracy": 0.7753879316151142, "num_tokens": 112298048.0, "step": 3519 }, { "entropy": 0.8910118490457535, "epoch": 0.3238624274731025, "grad_norm": 0.17390671372413635, "learning_rate": 8.920783880761801e-05, "loss": 0.8941, "mean_token_accuracy": 0.7430459000170231, "num_tokens": 112330133.0, "step": 3520 }, { "entropy": 0.8590236641466618, "epoch": 0.32395443384454375, "grad_norm": 0.1568404585123062, "learning_rate": 8.920477198147638e-05, "loss": 0.8593, "mean_token_accuracy": 0.7566804885864258, "num_tokens": 112362745.0, "step": 3521 }, { "entropy": 0.79797069914639, "epoch": 0.32404644021598494, "grad_norm": 0.15595680475234985, "learning_rate": 8.920170515533475e-05, "loss": 0.7803, "mean_token_accuracy": 0.7742975391447544, "num_tokens": 112394954.0, "step": 3522 }, { "entropy": 0.9912864379584789, "epoch": 0.3241384465874262, "grad_norm": 0.16705849766731262, "learning_rate": 8.919863832919311e-05, "loss": 0.9796, "mean_token_accuracy": 0.7240222990512848, "num_tokens": 112426996.0, "step": 3523 }, { "entropy": 0.8841212224215269, "epoch": 0.3242304529588674, "grad_norm": 0.16192105412483215, "learning_rate": 8.91955715030515e-05, "loss": 0.8658, "mean_token_accuracy": 0.7552276067435741, "num_tokens": 112459202.0, "step": 3524 }, { "entropy": 0.8577829916030169, "epoch": 0.3243224593303086, "grad_norm": 0.1575586348772049, "learning_rate": 8.919250467690988e-05, "loss": 0.8384, "mean_token_accuracy": 0.7587824277579784, "num_tokens": 112491334.0, "step": 3525 }, { "entropy": 0.8967768251895905, "epoch": 0.32441446570174987, "grad_norm": 0.15570402145385742, "learning_rate": 8.918943785076825e-05, "loss": 0.8785, "mean_token_accuracy": 0.7474039271473885, "num_tokens": 112523596.0, "step": 3526 }, { "entropy": 0.8728480581194162, "epoch": 0.32450647207319105, "grad_norm": 0.15966250002384186, "learning_rate": 8.918637102462661e-05, "loss": 0.8518, "mean_token_accuracy": 0.7563502043485641, "num_tokens": 112554982.0, "step": 3527 }, { "entropy": 0.7137563265860081, "epoch": 0.3245984784446323, "grad_norm": 0.14698055386543274, "learning_rate": 8.9183304198485e-05, "loss": 0.7086, "mean_token_accuracy": 0.7924289926886559, "num_tokens": 112587355.0, "step": 3528 }, { "entropy": 0.8325293138623238, "epoch": 0.3246904848160735, "grad_norm": 0.1586577147245407, "learning_rate": 8.918023737234336e-05, "loss": 0.8126, "mean_token_accuracy": 0.7621361128985882, "num_tokens": 112619706.0, "step": 3529 }, { "entropy": 0.7534335367381573, "epoch": 0.32478249118751473, "grad_norm": 0.15479594469070435, "learning_rate": 8.917717054620174e-05, "loss": 0.7409, "mean_token_accuracy": 0.7827999591827393, "num_tokens": 112650577.0, "step": 3530 }, { "entropy": 0.8307875357568264, "epoch": 0.324874497558956, "grad_norm": 0.1595810055732727, "learning_rate": 8.917410372006011e-05, "loss": 0.8322, "mean_token_accuracy": 0.7587959840893745, "num_tokens": 112682508.0, "step": 3531 }, { "entropy": 0.7566315103322268, "epoch": 0.32496650393039717, "grad_norm": 0.15443359315395355, "learning_rate": 8.91710368939185e-05, "loss": 0.7391, "mean_token_accuracy": 0.7899300530552864, "num_tokens": 112714251.0, "step": 3532 }, { "entropy": 0.8317952565848827, "epoch": 0.3250585103018384, "grad_norm": 0.16431604325771332, "learning_rate": 8.916797006777686e-05, "loss": 0.8217, "mean_token_accuracy": 0.7693342231214046, "num_tokens": 112746129.0, "step": 3533 }, { "entropy": 0.8670476265251637, "epoch": 0.3251505166732796, "grad_norm": 0.16507373750209808, "learning_rate": 8.916490324163523e-05, "loss": 0.8813, "mean_token_accuracy": 0.7459238618612289, "num_tokens": 112778165.0, "step": 3534 }, { "entropy": 0.8264820910990238, "epoch": 0.32524252304472084, "grad_norm": 0.15872600674629211, "learning_rate": 8.916183641549361e-05, "loss": 0.8328, "mean_token_accuracy": 0.7564338743686676, "num_tokens": 112810001.0, "step": 3535 }, { "entropy": 0.7799114724621177, "epoch": 0.3253345294161621, "grad_norm": 0.15547290444374084, "learning_rate": 8.915876958935199e-05, "loss": 0.7819, "mean_token_accuracy": 0.7712539434432983, "num_tokens": 112842077.0, "step": 3536 }, { "entropy": 0.7806409597396851, "epoch": 0.3254265357876033, "grad_norm": 0.1589875966310501, "learning_rate": 8.915570276321036e-05, "loss": 0.7979, "mean_token_accuracy": 0.7728253044188023, "num_tokens": 112874113.0, "step": 3537 }, { "entropy": 0.8154195994138718, "epoch": 0.3255185421590445, "grad_norm": 0.1644035279750824, "learning_rate": 8.915263593706873e-05, "loss": 0.818, "mean_token_accuracy": 0.7612890712916851, "num_tokens": 112905771.0, "step": 3538 }, { "entropy": 0.8208198118954897, "epoch": 0.3256105485304857, "grad_norm": 0.15620583295822144, "learning_rate": 8.91495691109271e-05, "loss": 0.801, "mean_token_accuracy": 0.7692325785756111, "num_tokens": 112937381.0, "step": 3539 }, { "entropy": 0.9078818894922733, "epoch": 0.32570255490192696, "grad_norm": 0.16435173153877258, "learning_rate": 8.914650228478548e-05, "loss": 0.9085, "mean_token_accuracy": 0.7413159050047398, "num_tokens": 112969631.0, "step": 3540 }, { "entropy": 0.7629182226955891, "epoch": 0.3257945612733682, "grad_norm": 0.16151109337806702, "learning_rate": 8.914343545864386e-05, "loss": 0.7644, "mean_token_accuracy": 0.7763059847056866, "num_tokens": 113001877.0, "step": 3541 }, { "entropy": 0.8164016157388687, "epoch": 0.3258865676448094, "grad_norm": 0.16197903454303741, "learning_rate": 8.914036863250223e-05, "loss": 0.8168, "mean_token_accuracy": 0.7637383826076984, "num_tokens": 113034429.0, "step": 3542 }, { "entropy": 0.8725016843527555, "epoch": 0.32597857401625063, "grad_norm": 0.16132739186286926, "learning_rate": 8.913730180636061e-05, "loss": 0.872, "mean_token_accuracy": 0.7490272372961044, "num_tokens": 113065668.0, "step": 3543 }, { "entropy": 0.7546561975032091, "epoch": 0.3260705803876918, "grad_norm": 0.15967683494091034, "learning_rate": 8.913423498021898e-05, "loss": 0.734, "mean_token_accuracy": 0.7878193147480488, "num_tokens": 113098189.0, "step": 3544 }, { "entropy": 0.8953891638666391, "epoch": 0.32616258675913307, "grad_norm": 0.16531096398830414, "learning_rate": 8.913116815407734e-05, "loss": 0.8805, "mean_token_accuracy": 0.7517305463552475, "num_tokens": 113130686.0, "step": 3545 }, { "entropy": 0.8721664287149906, "epoch": 0.3262545931305743, "grad_norm": 0.16372916102409363, "learning_rate": 8.912810132793572e-05, "loss": 0.8557, "mean_token_accuracy": 0.7556580044329166, "num_tokens": 113162599.0, "step": 3546 }, { "entropy": 0.8287416324019432, "epoch": 0.3263465995020155, "grad_norm": 0.1624942570924759, "learning_rate": 8.91250345017941e-05, "loss": 0.8272, "mean_token_accuracy": 0.7634267359972, "num_tokens": 113194321.0, "step": 3547 }, { "entropy": 0.8132980167865753, "epoch": 0.32643860587345674, "grad_norm": 0.15723322331905365, "learning_rate": 8.912196767565247e-05, "loss": 0.8059, "mean_token_accuracy": 0.7698186300694942, "num_tokens": 113226120.0, "step": 3548 }, { "entropy": 0.8703325651586056, "epoch": 0.32653061224489793, "grad_norm": 0.1609811782836914, "learning_rate": 8.911890084951084e-05, "loss": 0.8474, "mean_token_accuracy": 0.748808678239584, "num_tokens": 113257204.0, "step": 3549 }, { "entropy": 0.8273969013243914, "epoch": 0.3266226186163392, "grad_norm": 0.15259526669979095, "learning_rate": 8.911583402336921e-05, "loss": 0.8165, "mean_token_accuracy": 0.7636073641479015, "num_tokens": 113288943.0, "step": 3550 }, { "entropy": 0.8341647144407034, "epoch": 0.3267146249877804, "grad_norm": 0.1599828004837036, "learning_rate": 8.911276719722759e-05, "loss": 0.8184, "mean_token_accuracy": 0.7662413492798805, "num_tokens": 113320947.0, "step": 3551 }, { "entropy": 0.820491585880518, "epoch": 0.3268066313592216, "grad_norm": 0.16254858672618866, "learning_rate": 8.910970037108597e-05, "loss": 0.8306, "mean_token_accuracy": 0.7629505433142185, "num_tokens": 113353391.0, "step": 3552 }, { "entropy": 0.8428402431309223, "epoch": 0.32689863773066286, "grad_norm": 0.1617119312286377, "learning_rate": 8.910663354494434e-05, "loss": 0.85, "mean_token_accuracy": 0.7559737041592598, "num_tokens": 113385617.0, "step": 3553 }, { "entropy": 0.8835074827075005, "epoch": 0.32699064410210404, "grad_norm": 0.1695723831653595, "learning_rate": 8.910356671880271e-05, "loss": 0.9011, "mean_token_accuracy": 0.7410794869065285, "num_tokens": 113417977.0, "step": 3554 }, { "entropy": 0.7775358464568853, "epoch": 0.3270826504735453, "grad_norm": 0.14951877295970917, "learning_rate": 8.910049989266109e-05, "loss": 0.7691, "mean_token_accuracy": 0.7722590006887913, "num_tokens": 113450039.0, "step": 3555 }, { "entropy": 0.838826522231102, "epoch": 0.32717465684498653, "grad_norm": 0.1645222306251526, "learning_rate": 8.909743306651946e-05, "loss": 0.842, "mean_token_accuracy": 0.7585185430943966, "num_tokens": 113481874.0, "step": 3556 }, { "entropy": 0.785923546180129, "epoch": 0.3272666632164277, "grad_norm": 0.14948385953903198, "learning_rate": 8.909436624037784e-05, "loss": 0.7845, "mean_token_accuracy": 0.7750485092401505, "num_tokens": 113514629.0, "step": 3557 }, { "entropy": 0.7786267250776291, "epoch": 0.32735866958786897, "grad_norm": 0.16133369505405426, "learning_rate": 8.909129941423621e-05, "loss": 0.7737, "mean_token_accuracy": 0.7739647403359413, "num_tokens": 113546842.0, "step": 3558 }, { "entropy": 0.8628189750015736, "epoch": 0.32745067595931016, "grad_norm": 0.1634611338376999, "learning_rate": 8.908823258809459e-05, "loss": 0.847, "mean_token_accuracy": 0.7572952173650265, "num_tokens": 113577723.0, "step": 3559 }, { "entropy": 0.8892375193536282, "epoch": 0.3275426823307514, "grad_norm": 0.15835101902484894, "learning_rate": 8.908516576195296e-05, "loss": 0.86, "mean_token_accuracy": 0.7573098875582218, "num_tokens": 113610257.0, "step": 3560 }, { "entropy": 0.8624659813940525, "epoch": 0.32763468870219264, "grad_norm": 0.16422800719738007, "learning_rate": 8.908209893581134e-05, "loss": 0.8693, "mean_token_accuracy": 0.7504704967141151, "num_tokens": 113642156.0, "step": 3561 }, { "entropy": 0.7905363515019417, "epoch": 0.32772669507363383, "grad_norm": 0.15282107889652252, "learning_rate": 8.90790321096697e-05, "loss": 0.7884, "mean_token_accuracy": 0.7761432118713856, "num_tokens": 113673694.0, "step": 3562 }, { "entropy": 0.9458177946507931, "epoch": 0.3278187014450751, "grad_norm": 0.164636492729187, "learning_rate": 8.907596528352809e-05, "loss": 0.9374, "mean_token_accuracy": 0.7321090772747993, "num_tokens": 113705255.0, "step": 3563 }, { "entropy": 0.8458957672119141, "epoch": 0.32791070781651627, "grad_norm": 0.1638212651014328, "learning_rate": 8.907289845738645e-05, "loss": 0.8377, "mean_token_accuracy": 0.7598610520362854, "num_tokens": 113737125.0, "step": 3564 }, { "entropy": 0.9331359639763832, "epoch": 0.3280027141879575, "grad_norm": 0.15972955524921417, "learning_rate": 8.906983163124482e-05, "loss": 0.9265, "mean_token_accuracy": 0.7373395785689354, "num_tokens": 113769752.0, "step": 3565 }, { "entropy": 0.7610961087048054, "epoch": 0.32809472055939876, "grad_norm": 0.16100288927555084, "learning_rate": 8.90667648051032e-05, "loss": 0.7753, "mean_token_accuracy": 0.775166928768158, "num_tokens": 113802219.0, "step": 3566 }, { "entropy": 0.8443037420511246, "epoch": 0.32818672693083994, "grad_norm": 0.15648706257343292, "learning_rate": 8.906369797896159e-05, "loss": 0.8454, "mean_token_accuracy": 0.7555993236601353, "num_tokens": 113834284.0, "step": 3567 }, { "entropy": 0.7570295743644238, "epoch": 0.3282787333022812, "grad_norm": 0.15555135905742645, "learning_rate": 8.906063115281995e-05, "loss": 0.7443, "mean_token_accuracy": 0.7834891565144062, "num_tokens": 113866938.0, "step": 3568 }, { "entropy": 0.8487836010754108, "epoch": 0.3283707396737224, "grad_norm": 0.16768993437290192, "learning_rate": 8.905756432667832e-05, "loss": 0.8522, "mean_token_accuracy": 0.7549125514924526, "num_tokens": 113898630.0, "step": 3569 }, { "entropy": 0.8674600664526224, "epoch": 0.3284627460451636, "grad_norm": 0.15564127266407013, "learning_rate": 8.90544975005367e-05, "loss": 0.8593, "mean_token_accuracy": 0.7496063709259033, "num_tokens": 113930541.0, "step": 3570 }, { "entropy": 0.9221852570772171, "epoch": 0.32855475241660487, "grad_norm": 0.1600762903690338, "learning_rate": 8.905143067439507e-05, "loss": 0.9086, "mean_token_accuracy": 0.739445049315691, "num_tokens": 113962882.0, "step": 3571 }, { "entropy": 0.7250676583498716, "epoch": 0.32864675878804606, "grad_norm": 0.15269091725349426, "learning_rate": 8.904836384825345e-05, "loss": 0.7084, "mean_token_accuracy": 0.7935532331466675, "num_tokens": 113994628.0, "step": 3572 }, { "entropy": 0.8389720786362886, "epoch": 0.3287387651594873, "grad_norm": 0.15709611773490906, "learning_rate": 8.904529702211182e-05, "loss": 0.832, "mean_token_accuracy": 0.7573861703276634, "num_tokens": 114025615.0, "step": 3573 }, { "entropy": 0.8733219243586063, "epoch": 0.3288307715309285, "grad_norm": 0.16201867163181305, "learning_rate": 8.90422301959702e-05, "loss": 0.8657, "mean_token_accuracy": 0.7476733699440956, "num_tokens": 114057883.0, "step": 3574 }, { "entropy": 0.853231031447649, "epoch": 0.32892277790236973, "grad_norm": 0.16007669270038605, "learning_rate": 8.903916336982857e-05, "loss": 0.8344, "mean_token_accuracy": 0.7592031136155128, "num_tokens": 114089632.0, "step": 3575 }, { "entropy": 0.8145501185208559, "epoch": 0.329014784273811, "grad_norm": 0.15804795920848846, "learning_rate": 8.903609654368694e-05, "loss": 0.8061, "mean_token_accuracy": 0.7648584842681885, "num_tokens": 114121610.0, "step": 3576 }, { "entropy": 0.6325392071157694, "epoch": 0.32910679064525217, "grad_norm": 0.1474388986825943, "learning_rate": 8.903302971754532e-05, "loss": 0.6398, "mean_token_accuracy": 0.8096894472837448, "num_tokens": 114154292.0, "step": 3577 }, { "entropy": 0.8600517455488443, "epoch": 0.3291987970166934, "grad_norm": 0.15634629130363464, "learning_rate": 8.90299628914037e-05, "loss": 0.8396, "mean_token_accuracy": 0.7595234327018261, "num_tokens": 114186940.0, "step": 3578 }, { "entropy": 0.9162767138332129, "epoch": 0.3292908033881346, "grad_norm": 0.16744458675384521, "learning_rate": 8.902689606526207e-05, "loss": 0.92, "mean_token_accuracy": 0.7395855747163296, "num_tokens": 114218608.0, "step": 3579 }, { "entropy": 0.8600432090461254, "epoch": 0.32938280975957585, "grad_norm": 0.1700349599123001, "learning_rate": 8.902382923912044e-05, "loss": 0.862, "mean_token_accuracy": 0.7489110343158245, "num_tokens": 114250214.0, "step": 3580 }, { "entropy": 0.8371495828032494, "epoch": 0.3294748161310171, "grad_norm": 0.15677180886268616, "learning_rate": 8.90207624129788e-05, "loss": 0.8251, "mean_token_accuracy": 0.7632488943636417, "num_tokens": 114281961.0, "step": 3581 }, { "entropy": 0.9180954955518246, "epoch": 0.3295668225024583, "grad_norm": 0.17211078107357025, "learning_rate": 8.901769558683719e-05, "loss": 0.9174, "mean_token_accuracy": 0.7445228174328804, "num_tokens": 114312672.0, "step": 3582 }, { "entropy": 0.8097448665648699, "epoch": 0.3296588288738995, "grad_norm": 0.15775388479232788, "learning_rate": 8.901462876069557e-05, "loss": 0.7915, "mean_token_accuracy": 0.7704235315322876, "num_tokens": 114344006.0, "step": 3583 }, { "entropy": 0.8507932834327221, "epoch": 0.3297508352453407, "grad_norm": 0.1576824188232422, "learning_rate": 8.901156193455393e-05, "loss": 0.833, "mean_token_accuracy": 0.757336188107729, "num_tokens": 114376149.0, "step": 3584 }, { "entropy": 0.779567513614893, "epoch": 0.32984284161678196, "grad_norm": 0.15537048876285553, "learning_rate": 8.90084951084123e-05, "loss": 0.7794, "mean_token_accuracy": 0.772665236145258, "num_tokens": 114408467.0, "step": 3585 }, { "entropy": 0.9026730991899967, "epoch": 0.3299348479882232, "grad_norm": 0.16472385823726654, "learning_rate": 8.900542828227068e-05, "loss": 0.8843, "mean_token_accuracy": 0.747175257652998, "num_tokens": 114440093.0, "step": 3586 }, { "entropy": 0.912804052233696, "epoch": 0.3300268543596644, "grad_norm": 0.16617894172668457, "learning_rate": 8.900236145612905e-05, "loss": 0.9073, "mean_token_accuracy": 0.7404039949178696, "num_tokens": 114471856.0, "step": 3587 }, { "entropy": 0.8459425456821918, "epoch": 0.33011886073110563, "grad_norm": 0.15891116857528687, "learning_rate": 8.899929462998743e-05, "loss": 0.8554, "mean_token_accuracy": 0.7533785291016102, "num_tokens": 114503881.0, "step": 3588 }, { "entropy": 0.7839451283216476, "epoch": 0.3302108671025469, "grad_norm": 0.1545349359512329, "learning_rate": 8.89962278038458e-05, "loss": 0.7726, "mean_token_accuracy": 0.7738772071897984, "num_tokens": 114535315.0, "step": 3589 }, { "entropy": 0.9241359271109104, "epoch": 0.33030287347398807, "grad_norm": 0.1594114601612091, "learning_rate": 8.899316097770418e-05, "loss": 0.909, "mean_token_accuracy": 0.7403079159557819, "num_tokens": 114567214.0, "step": 3590 }, { "entropy": 0.8929330017417669, "epoch": 0.3303948798454293, "grad_norm": 0.16146181523799896, "learning_rate": 8.899009415156255e-05, "loss": 0.8849, "mean_token_accuracy": 0.7452980019152164, "num_tokens": 114599982.0, "step": 3591 }, { "entropy": 0.8109452091157436, "epoch": 0.3304868862168705, "grad_norm": 0.15568256378173828, "learning_rate": 8.898702732542092e-05, "loss": 0.7889, "mean_token_accuracy": 0.7699626237154007, "num_tokens": 114631914.0, "step": 3592 }, { "entropy": 0.799917409196496, "epoch": 0.33057889258831175, "grad_norm": 0.16394449770450592, "learning_rate": 8.89839604992793e-05, "loss": 0.791, "mean_token_accuracy": 0.7750341296195984, "num_tokens": 114663073.0, "step": 3593 }, { "entropy": 0.7866846229881048, "epoch": 0.330670898959753, "grad_norm": 0.15336431562900543, "learning_rate": 8.898089367313768e-05, "loss": 0.77, "mean_token_accuracy": 0.7767357304692268, "num_tokens": 114695284.0, "step": 3594 }, { "entropy": 0.8895826525986195, "epoch": 0.3307629053311942, "grad_norm": 0.16475242376327515, "learning_rate": 8.897782684699605e-05, "loss": 0.8826, "mean_token_accuracy": 0.7471694611012936, "num_tokens": 114726789.0, "step": 3595 }, { "entropy": 0.9030837416648865, "epoch": 0.3308549117026354, "grad_norm": 0.162688747048378, "learning_rate": 8.897476002085442e-05, "loss": 0.8895, "mean_token_accuracy": 0.7419816479086876, "num_tokens": 114758342.0, "step": 3596 }, { "entropy": 0.7327923458069563, "epoch": 0.3309469180740766, "grad_norm": 0.16635191440582275, "learning_rate": 8.897169319471278e-05, "loss": 0.7657, "mean_token_accuracy": 0.778367705643177, "num_tokens": 114789754.0, "step": 3597 }, { "entropy": 0.8199177235364914, "epoch": 0.33103892444551786, "grad_norm": 0.15996363759040833, "learning_rate": 8.896862636857118e-05, "loss": 0.8194, "mean_token_accuracy": 0.7628922201693058, "num_tokens": 114821979.0, "step": 3598 }, { "entropy": 0.8251524642109871, "epoch": 0.3311309308169591, "grad_norm": 0.1591489613056183, "learning_rate": 8.896555954242955e-05, "loss": 0.8302, "mean_token_accuracy": 0.7589161545038223, "num_tokens": 114854610.0, "step": 3599 }, { "entropy": 0.9381790906190872, "epoch": 0.3312229371884003, "grad_norm": 0.1649271696805954, "learning_rate": 8.896249271628792e-05, "loss": 0.9532, "mean_token_accuracy": 0.7337306179106236, "num_tokens": 114886999.0, "step": 3600 }, { "entropy": 0.8716475367546082, "epoch": 0.33131494355984153, "grad_norm": 0.16641946136951447, "learning_rate": 8.89594258901463e-05, "loss": 0.8675, "mean_token_accuracy": 0.7484105825424194, "num_tokens": 114919310.0, "step": 3601 }, { "entropy": 0.7869132533669472, "epoch": 0.3314069499312827, "grad_norm": 0.16145667433738708, "learning_rate": 8.895635906400466e-05, "loss": 0.787, "mean_token_accuracy": 0.777467779815197, "num_tokens": 114951815.0, "step": 3602 }, { "entropy": 0.8463872373104095, "epoch": 0.33149895630272397, "grad_norm": 0.16601453721523285, "learning_rate": 8.895329223786305e-05, "loss": 0.856, "mean_token_accuracy": 0.753614965826273, "num_tokens": 114983655.0, "step": 3603 }, { "entropy": 0.8107794895768166, "epoch": 0.3315909626741652, "grad_norm": 0.15225301682949066, "learning_rate": 8.895022541172141e-05, "loss": 0.8167, "mean_token_accuracy": 0.7627292983233929, "num_tokens": 115015932.0, "step": 3604 }, { "entropy": 0.7167086713016033, "epoch": 0.3316829690456064, "grad_norm": 0.15528762340545654, "learning_rate": 8.89471585855798e-05, "loss": 0.7158, "mean_token_accuracy": 0.7908207811415195, "num_tokens": 115048461.0, "step": 3605 }, { "entropy": 0.804124291986227, "epoch": 0.33177497541704765, "grad_norm": 0.15502788126468658, "learning_rate": 8.894409175943816e-05, "loss": 0.7901, "mean_token_accuracy": 0.7709712535142899, "num_tokens": 115080760.0, "step": 3606 }, { "entropy": 0.8811458274722099, "epoch": 0.33186698178848884, "grad_norm": 0.16447661817073822, "learning_rate": 8.894102493329653e-05, "loss": 0.8724, "mean_token_accuracy": 0.7513988986611366, "num_tokens": 115111669.0, "step": 3607 }, { "entropy": 0.8510777726769447, "epoch": 0.3319589881599301, "grad_norm": 0.16196595132350922, "learning_rate": 8.893795810715491e-05, "loss": 0.829, "mean_token_accuracy": 0.7608736306428909, "num_tokens": 115143361.0, "step": 3608 }, { "entropy": 0.8625008836388588, "epoch": 0.3320509945313713, "grad_norm": 0.16040565073490143, "learning_rate": 8.89348912810133e-05, "loss": 0.8678, "mean_token_accuracy": 0.749535083770752, "num_tokens": 115175107.0, "step": 3609 }, { "entropy": 0.8160389997065067, "epoch": 0.3321430009028125, "grad_norm": 0.16039665043354034, "learning_rate": 8.893182445487166e-05, "loss": 0.8095, "mean_token_accuracy": 0.7668877430260181, "num_tokens": 115206975.0, "step": 3610 }, { "entropy": 0.8754699677228928, "epoch": 0.33223500727425376, "grad_norm": 0.15433968603610992, "learning_rate": 8.892875762873003e-05, "loss": 0.8562, "mean_token_accuracy": 0.7540491670370102, "num_tokens": 115238860.0, "step": 3611 }, { "entropy": 0.8209942188113928, "epoch": 0.33232701364569495, "grad_norm": 0.1554667204618454, "learning_rate": 8.89256908025884e-05, "loss": 0.8083, "mean_token_accuracy": 0.7691846899688244, "num_tokens": 115271210.0, "step": 3612 }, { "entropy": 0.735757265239954, "epoch": 0.3324190200171362, "grad_norm": 0.1488027423620224, "learning_rate": 8.892262397644678e-05, "loss": 0.7157, "mean_token_accuracy": 0.7894121445715427, "num_tokens": 115303202.0, "step": 3613 }, { "entropy": 0.7885707840323448, "epoch": 0.33251102638857744, "grad_norm": 0.16013674437999725, "learning_rate": 8.891955715030516e-05, "loss": 0.7695, "mean_token_accuracy": 0.7755643874406815, "num_tokens": 115334566.0, "step": 3614 }, { "entropy": 0.9095710888504982, "epoch": 0.3326030327600186, "grad_norm": 0.16038651764392853, "learning_rate": 8.891649032416353e-05, "loss": 0.9148, "mean_token_accuracy": 0.7393782325088978, "num_tokens": 115367020.0, "step": 3615 }, { "entropy": 0.7996747493743896, "epoch": 0.33269503913145987, "grad_norm": 0.15485355257987976, "learning_rate": 8.89134234980219e-05, "loss": 0.7846, "mean_token_accuracy": 0.770352341234684, "num_tokens": 115399174.0, "step": 3616 }, { "entropy": 0.815029202029109, "epoch": 0.33278704550290106, "grad_norm": 0.1572398692369461, "learning_rate": 8.891035667188028e-05, "loss": 0.8159, "mean_token_accuracy": 0.7632438465952873, "num_tokens": 115431504.0, "step": 3617 }, { "entropy": 0.8200552687048912, "epoch": 0.3328790518743423, "grad_norm": 0.16495904326438904, "learning_rate": 8.890728984573865e-05, "loss": 0.8218, "mean_token_accuracy": 0.7635450959205627, "num_tokens": 115463463.0, "step": 3618 }, { "entropy": 0.7632487062364817, "epoch": 0.33297105824578355, "grad_norm": 0.16388553380966187, "learning_rate": 8.890422301959703e-05, "loss": 0.7588, "mean_token_accuracy": 0.7748204618692398, "num_tokens": 115495498.0, "step": 3619 }, { "entropy": 0.789536215364933, "epoch": 0.33306306461722474, "grad_norm": 0.1638256162405014, "learning_rate": 8.89011561934554e-05, "loss": 0.7933, "mean_token_accuracy": 0.7691398598253727, "num_tokens": 115527710.0, "step": 3620 }, { "entropy": 0.8147595971822739, "epoch": 0.333155070988666, "grad_norm": 0.1569482386112213, "learning_rate": 8.889808936731378e-05, "loss": 0.808, "mean_token_accuracy": 0.7663806416094303, "num_tokens": 115558447.0, "step": 3621 }, { "entropy": 0.8059687651693821, "epoch": 0.33324707736010717, "grad_norm": 0.16552405059337616, "learning_rate": 8.889502254117214e-05, "loss": 0.814, "mean_token_accuracy": 0.7676874585449696, "num_tokens": 115589246.0, "step": 3622 }, { "entropy": 0.686234500259161, "epoch": 0.3333390837315484, "grad_norm": 0.1551610380411148, "learning_rate": 8.889195571503051e-05, "loss": 0.6699, "mean_token_accuracy": 0.8033677414059639, "num_tokens": 115620763.0, "step": 3623 }, { "entropy": 0.8165770806372166, "epoch": 0.33343109010298966, "grad_norm": 0.15596449375152588, "learning_rate": 8.888888888888889e-05, "loss": 0.7934, "mean_token_accuracy": 0.7694069258868694, "num_tokens": 115652576.0, "step": 3624 }, { "entropy": 0.713382177054882, "epoch": 0.33352309647443085, "grad_norm": 0.15949313342571259, "learning_rate": 8.888582206274727e-05, "loss": 0.7048, "mean_token_accuracy": 0.7907537557184696, "num_tokens": 115684727.0, "step": 3625 }, { "entropy": 0.8603894151747227, "epoch": 0.3336151028458721, "grad_norm": 0.16378435492515564, "learning_rate": 8.888275523660564e-05, "loss": 0.869, "mean_token_accuracy": 0.7471421547234058, "num_tokens": 115716403.0, "step": 3626 }, { "entropy": 0.7439581509679556, "epoch": 0.3337071092173133, "grad_norm": 0.15038296580314636, "learning_rate": 8.887968841046401e-05, "loss": 0.7325, "mean_token_accuracy": 0.7888507023453712, "num_tokens": 115748089.0, "step": 3627 }, { "entropy": 0.8052119482308626, "epoch": 0.3337991155887545, "grad_norm": 0.15734940767288208, "learning_rate": 8.887662158432238e-05, "loss": 0.7752, "mean_token_accuracy": 0.7757416628301144, "num_tokens": 115780012.0, "step": 3628 }, { "entropy": 0.7635125108063221, "epoch": 0.33389112196019577, "grad_norm": 0.1494060903787613, "learning_rate": 8.887355475818076e-05, "loss": 0.7512, "mean_token_accuracy": 0.7756372913718224, "num_tokens": 115811683.0, "step": 3629 }, { "entropy": 0.8296754285693169, "epoch": 0.33398312833163696, "grad_norm": 0.16079352796077728, "learning_rate": 8.887048793203914e-05, "loss": 0.8154, "mean_token_accuracy": 0.7604441605508327, "num_tokens": 115843460.0, "step": 3630 }, { "entropy": 0.883204584941268, "epoch": 0.3340751347030782, "grad_norm": 0.16717183589935303, "learning_rate": 8.886742110589751e-05, "loss": 0.8728, "mean_token_accuracy": 0.7563805729150772, "num_tokens": 115874330.0, "step": 3631 }, { "entropy": 0.7770205978304148, "epoch": 0.3341671410745194, "grad_norm": 0.15396027266979218, "learning_rate": 8.886435427975589e-05, "loss": 0.7675, "mean_token_accuracy": 0.7754591144621372, "num_tokens": 115906749.0, "step": 3632 }, { "entropy": 0.7597681414335966, "epoch": 0.33425914744596064, "grad_norm": 0.15559104084968567, "learning_rate": 8.886128745361426e-05, "loss": 0.7688, "mean_token_accuracy": 0.77598812058568, "num_tokens": 115939246.0, "step": 3633 }, { "entropy": 0.7265193667262793, "epoch": 0.3343511538174019, "grad_norm": 0.15766224265098572, "learning_rate": 8.885822062747263e-05, "loss": 0.7397, "mean_token_accuracy": 0.7814281471073627, "num_tokens": 115971375.0, "step": 3634 }, { "entropy": 0.823904063552618, "epoch": 0.33444316018884307, "grad_norm": 0.1595362424850464, "learning_rate": 8.885515380133101e-05, "loss": 0.8366, "mean_token_accuracy": 0.7565645761787891, "num_tokens": 116002635.0, "step": 3635 }, { "entropy": 0.8116504587233067, "epoch": 0.3345351665602843, "grad_norm": 0.16941915452480316, "learning_rate": 8.885208697518939e-05, "loss": 0.8411, "mean_token_accuracy": 0.7581542544066906, "num_tokens": 116034535.0, "step": 3636 }, { "entropy": 0.8121430985629559, "epoch": 0.3346271729317255, "grad_norm": 0.15128302574157715, "learning_rate": 8.884902014904776e-05, "loss": 0.8164, "mean_token_accuracy": 0.7611706219613552, "num_tokens": 116067067.0, "step": 3637 }, { "entropy": 0.7618887759745121, "epoch": 0.33471917930316675, "grad_norm": 0.15282335877418518, "learning_rate": 8.884595332290612e-05, "loss": 0.7229, "mean_token_accuracy": 0.7903376892209053, "num_tokens": 116099234.0, "step": 3638 }, { "entropy": 0.8003894705325365, "epoch": 0.334811185674608, "grad_norm": 0.1570078283548355, "learning_rate": 8.884288649676449e-05, "loss": 0.7872, "mean_token_accuracy": 0.7701768837869167, "num_tokens": 116130838.0, "step": 3639 }, { "entropy": 0.7909752726554871, "epoch": 0.3349031920460492, "grad_norm": 0.16156211495399475, "learning_rate": 8.883981967062289e-05, "loss": 0.7824, "mean_token_accuracy": 0.7713269516825676, "num_tokens": 116161781.0, "step": 3640 }, { "entropy": 0.8605387713760138, "epoch": 0.3349951984174904, "grad_norm": 0.1603011190891266, "learning_rate": 8.883675284448126e-05, "loss": 0.8411, "mean_token_accuracy": 0.757586769759655, "num_tokens": 116194086.0, "step": 3641 }, { "entropy": 0.8223765790462494, "epoch": 0.3350872047889316, "grad_norm": 0.15769994258880615, "learning_rate": 8.883368601833962e-05, "loss": 0.803, "mean_token_accuracy": 0.7642200514674187, "num_tokens": 116225832.0, "step": 3642 }, { "entropy": 0.8542160503566265, "epoch": 0.33517921116037286, "grad_norm": 0.1579298973083496, "learning_rate": 8.883061919219799e-05, "loss": 0.842, "mean_token_accuracy": 0.7585493512451649, "num_tokens": 116258343.0, "step": 3643 }, { "entropy": 0.7841754704713821, "epoch": 0.3352712175318141, "grad_norm": 0.15193511545658112, "learning_rate": 8.882755236605637e-05, "loss": 0.7646, "mean_token_accuracy": 0.7717516906559467, "num_tokens": 116289682.0, "step": 3644 }, { "entropy": 0.8506742939352989, "epoch": 0.3353632239032553, "grad_norm": 0.16299085319042206, "learning_rate": 8.882448553991475e-05, "loss": 0.8394, "mean_token_accuracy": 0.7581215500831604, "num_tokens": 116321679.0, "step": 3645 }, { "entropy": 0.8661758825182915, "epoch": 0.33545523027469654, "grad_norm": 0.1545385718345642, "learning_rate": 8.882141871377312e-05, "loss": 0.8659, "mean_token_accuracy": 0.7464869432151318, "num_tokens": 116353607.0, "step": 3646 }, { "entropy": 0.7757053375244141, "epoch": 0.3355472366461377, "grad_norm": 0.16197070479393005, "learning_rate": 8.881835188763149e-05, "loss": 0.7895, "mean_token_accuracy": 0.7744596637785435, "num_tokens": 116385519.0, "step": 3647 }, { "entropy": 0.8351331688463688, "epoch": 0.33563924301757897, "grad_norm": 0.17365828156471252, "learning_rate": 8.881528506148987e-05, "loss": 0.858, "mean_token_accuracy": 0.7545035630464554, "num_tokens": 116416750.0, "step": 3648 }, { "entropy": 0.8064558673650026, "epoch": 0.3357312493890202, "grad_norm": 0.15767648816108704, "learning_rate": 8.881221823534824e-05, "loss": 0.7854, "mean_token_accuracy": 0.7716449312865734, "num_tokens": 116448748.0, "step": 3649 }, { "entropy": 0.7940638735890388, "epoch": 0.3358232557604614, "grad_norm": 0.16072049736976624, "learning_rate": 8.880915140920662e-05, "loss": 0.7939, "mean_token_accuracy": 0.7647316791117191, "num_tokens": 116480477.0, "step": 3650 }, { "entropy": 0.8334903717041016, "epoch": 0.33591526213190265, "grad_norm": 0.17076003551483154, "learning_rate": 8.880608458306499e-05, "loss": 0.8627, "mean_token_accuracy": 0.7560299262404442, "num_tokens": 116512990.0, "step": 3651 }, { "entropy": 0.7847942523658276, "epoch": 0.33600726850334384, "grad_norm": 0.15663374960422516, "learning_rate": 8.880301775692337e-05, "loss": 0.754, "mean_token_accuracy": 0.7803404740989208, "num_tokens": 116544220.0, "step": 3652 }, { "entropy": 0.830343084409833, "epoch": 0.3360992748747851, "grad_norm": 0.16040533781051636, "learning_rate": 8.879995093078174e-05, "loss": 0.8135, "mean_token_accuracy": 0.767262015491724, "num_tokens": 116575788.0, "step": 3653 }, { "entropy": 0.8874675445258617, "epoch": 0.3361912812462263, "grad_norm": 0.16346627473831177, "learning_rate": 8.87968841046401e-05, "loss": 0.8807, "mean_token_accuracy": 0.7464034929871559, "num_tokens": 116607087.0, "step": 3654 }, { "entropy": 0.7744895126670599, "epoch": 0.3362832876176675, "grad_norm": 0.16275112330913544, "learning_rate": 8.879381727849849e-05, "loss": 0.7657, "mean_token_accuracy": 0.7825987488031387, "num_tokens": 116639502.0, "step": 3655 }, { "entropy": 0.8713775221258402, "epoch": 0.33637529398910876, "grad_norm": 0.1708855926990509, "learning_rate": 8.879075045235687e-05, "loss": 0.8679, "mean_token_accuracy": 0.7495811469852924, "num_tokens": 116670956.0, "step": 3656 }, { "entropy": 0.8958065435290337, "epoch": 0.33646730036054995, "grad_norm": 0.15959987044334412, "learning_rate": 8.878768362621524e-05, "loss": 0.8752, "mean_token_accuracy": 0.751251831650734, "num_tokens": 116703724.0, "step": 3657 }, { "entropy": 0.8154958300292492, "epoch": 0.3365593067319912, "grad_norm": 0.1482742577791214, "learning_rate": 8.87846168000736e-05, "loss": 0.7817, "mean_token_accuracy": 0.7681431993842125, "num_tokens": 116736011.0, "step": 3658 }, { "entropy": 0.8066625036299229, "epoch": 0.33665131310343244, "grad_norm": 0.15257874131202698, "learning_rate": 8.878154997393197e-05, "loss": 0.7887, "mean_token_accuracy": 0.7676409259438515, "num_tokens": 116767483.0, "step": 3659 }, { "entropy": 0.88212014362216, "epoch": 0.3367433194748736, "grad_norm": 0.15867763757705688, "learning_rate": 8.877848314779035e-05, "loss": 0.867, "mean_token_accuracy": 0.7490551434457302, "num_tokens": 116799356.0, "step": 3660 }, { "entropy": 0.7136856466531754, "epoch": 0.33683532584631487, "grad_norm": 0.1536937803030014, "learning_rate": 8.877541632164873e-05, "loss": 0.729, "mean_token_accuracy": 0.7822437733411789, "num_tokens": 116831003.0, "step": 3661 }, { "entropy": 0.7921467293053865, "epoch": 0.33692733221775606, "grad_norm": 0.15576539933681488, "learning_rate": 8.87723494955071e-05, "loss": 0.8016, "mean_token_accuracy": 0.7680702172219753, "num_tokens": 116863005.0, "step": 3662 }, { "entropy": 0.8578747417777777, "epoch": 0.3370193385891973, "grad_norm": 0.15569129586219788, "learning_rate": 8.876928266936548e-05, "loss": 0.8606, "mean_token_accuracy": 0.7532249167561531, "num_tokens": 116894722.0, "step": 3663 }, { "entropy": 0.7921356242150068, "epoch": 0.33711134496063855, "grad_norm": 0.16004441678524017, "learning_rate": 8.876621584322385e-05, "loss": 0.7929, "mean_token_accuracy": 0.7708720229566097, "num_tokens": 116926620.0, "step": 3664 }, { "entropy": 0.7752866856753826, "epoch": 0.33720335133207974, "grad_norm": 0.15228639543056488, "learning_rate": 8.876314901708222e-05, "loss": 0.7752, "mean_token_accuracy": 0.7743471227586269, "num_tokens": 116959232.0, "step": 3665 }, { "entropy": 0.8905178159475327, "epoch": 0.337295357703521, "grad_norm": 0.16030436754226685, "learning_rate": 8.87600821909406e-05, "loss": 0.881, "mean_token_accuracy": 0.745611596852541, "num_tokens": 116991215.0, "step": 3666 }, { "entropy": 0.8775111436843872, "epoch": 0.33738736407496217, "grad_norm": 0.16572625935077667, "learning_rate": 8.875701536479898e-05, "loss": 0.8734, "mean_token_accuracy": 0.7511332593858242, "num_tokens": 117023042.0, "step": 3667 }, { "entropy": 0.8814806453883648, "epoch": 0.3374793704464034, "grad_norm": 0.17149776220321655, "learning_rate": 8.875394853865735e-05, "loss": 0.9061, "mean_token_accuracy": 0.7410387955605984, "num_tokens": 117055219.0, "step": 3668 }, { "entropy": 0.8330910131335258, "epoch": 0.33757137681784466, "grad_norm": 0.1566135585308075, "learning_rate": 8.875088171251572e-05, "loss": 0.8066, "mean_token_accuracy": 0.7661771029233932, "num_tokens": 117087263.0, "step": 3669 }, { "entropy": 0.7134779337793589, "epoch": 0.33766338318928585, "grad_norm": 0.14967162907123566, "learning_rate": 8.874781488637409e-05, "loss": 0.6704, "mean_token_accuracy": 0.805096797645092, "num_tokens": 117119144.0, "step": 3670 }, { "entropy": 0.909952636808157, "epoch": 0.3377553895607271, "grad_norm": 0.16171784698963165, "learning_rate": 8.874474806023247e-05, "loss": 0.8929, "mean_token_accuracy": 0.742050014436245, "num_tokens": 117151536.0, "step": 3671 }, { "entropy": 0.826678778976202, "epoch": 0.3378473959321683, "grad_norm": 0.15655003488063812, "learning_rate": 8.874168123409085e-05, "loss": 0.8147, "mean_token_accuracy": 0.7604783289134502, "num_tokens": 117182264.0, "step": 3672 }, { "entropy": 0.7862184662371874, "epoch": 0.3379394023036095, "grad_norm": 0.1561945229768753, "learning_rate": 8.873861440794922e-05, "loss": 0.762, "mean_token_accuracy": 0.7792872153222561, "num_tokens": 117214331.0, "step": 3673 }, { "entropy": 0.874307245016098, "epoch": 0.33803140867505077, "grad_norm": 0.16299164295196533, "learning_rate": 8.873554758180758e-05, "loss": 0.8725, "mean_token_accuracy": 0.7515481300652027, "num_tokens": 117245751.0, "step": 3674 }, { "entropy": 0.700889153406024, "epoch": 0.33812341504649196, "grad_norm": 0.1487797498703003, "learning_rate": 8.873248075566597e-05, "loss": 0.6862, "mean_token_accuracy": 0.7942554093897343, "num_tokens": 117278158.0, "step": 3675 }, { "entropy": 0.8977634534239769, "epoch": 0.3382154214179332, "grad_norm": 0.16320493817329407, "learning_rate": 8.872941392952435e-05, "loss": 0.8939, "mean_token_accuracy": 0.7468542940914631, "num_tokens": 117309983.0, "step": 3676 }, { "entropy": 0.7923063766211271, "epoch": 0.3383074277893744, "grad_norm": 0.1535583734512329, "learning_rate": 8.872634710338272e-05, "loss": 0.7755, "mean_token_accuracy": 0.7719611264765263, "num_tokens": 117342055.0, "step": 3677 }, { "entropy": 0.8221751414239407, "epoch": 0.33839943416081564, "grad_norm": 0.161599799990654, "learning_rate": 8.872328027724108e-05, "loss": 0.8341, "mean_token_accuracy": 0.7606333866715431, "num_tokens": 117374229.0, "step": 3678 }, { "entropy": 0.7745476104319096, "epoch": 0.3384914405322569, "grad_norm": 0.15252746641635895, "learning_rate": 8.872021345109946e-05, "loss": 0.7667, "mean_token_accuracy": 0.7754529230296612, "num_tokens": 117406610.0, "step": 3679 }, { "entropy": 0.8654115535318851, "epoch": 0.33858344690369807, "grad_norm": 0.15777841210365295, "learning_rate": 8.871714662495783e-05, "loss": 0.8681, "mean_token_accuracy": 0.7465464733541012, "num_tokens": 117438836.0, "step": 3680 }, { "entropy": 0.8312840089201927, "epoch": 0.3386754532751393, "grad_norm": 0.1638922542333603, "learning_rate": 8.871407979881621e-05, "loss": 0.8452, "mean_token_accuracy": 0.7581473626196384, "num_tokens": 117470720.0, "step": 3681 }, { "entropy": 0.6733292415738106, "epoch": 0.3387674596465805, "grad_norm": 0.15174655616283417, "learning_rate": 8.871101297267458e-05, "loss": 0.6784, "mean_token_accuracy": 0.8034169785678387, "num_tokens": 117502760.0, "step": 3682 }, { "entropy": 0.8665666282176971, "epoch": 0.33885946601802175, "grad_norm": 0.15787923336029053, "learning_rate": 8.870794614653296e-05, "loss": 0.8562, "mean_token_accuracy": 0.7535654231905937, "num_tokens": 117534604.0, "step": 3683 }, { "entropy": 0.9273284897208214, "epoch": 0.338951472389463, "grad_norm": 0.1670336127281189, "learning_rate": 8.870487932039133e-05, "loss": 0.9107, "mean_token_accuracy": 0.74199004098773, "num_tokens": 117566828.0, "step": 3684 }, { "entropy": 0.7546845283359289, "epoch": 0.3390434787609042, "grad_norm": 0.15495595335960388, "learning_rate": 8.87018124942497e-05, "loss": 0.7548, "mean_token_accuracy": 0.7755203880369663, "num_tokens": 117599010.0, "step": 3685 }, { "entropy": 0.7731052860617638, "epoch": 0.3391354851323454, "grad_norm": 0.1596841663122177, "learning_rate": 8.869874566810808e-05, "loss": 0.7868, "mean_token_accuracy": 0.7701879143714905, "num_tokens": 117631321.0, "step": 3686 }, { "entropy": 0.7496383264660835, "epoch": 0.3392274915037866, "grad_norm": 0.16150377690792084, "learning_rate": 8.869567884196646e-05, "loss": 0.7247, "mean_token_accuracy": 0.7845935821533203, "num_tokens": 117662202.0, "step": 3687 }, { "entropy": 0.7468512617051601, "epoch": 0.33931949787522786, "grad_norm": 0.16161344945430756, "learning_rate": 8.869261201582483e-05, "loss": 0.7361, "mean_token_accuracy": 0.7821064479649067, "num_tokens": 117693389.0, "step": 3688 }, { "entropy": 0.8006163500249386, "epoch": 0.3394115042466691, "grad_norm": 0.15974213182926178, "learning_rate": 8.86895451896832e-05, "loss": 0.7837, "mean_token_accuracy": 0.7740936055779457, "num_tokens": 117725702.0, "step": 3689 }, { "entropy": 0.7021926436573267, "epoch": 0.3395035106181103, "grad_norm": 0.1482010781764984, "learning_rate": 8.868647836354157e-05, "loss": 0.6849, "mean_token_accuracy": 0.7978414669632912, "num_tokens": 117758096.0, "step": 3690 }, { "entropy": 0.8278223015367985, "epoch": 0.33959551698955154, "grad_norm": 0.14988671243190765, "learning_rate": 8.868341153739995e-05, "loss": 0.8171, "mean_token_accuracy": 0.7613799311220646, "num_tokens": 117790293.0, "step": 3691 }, { "entropy": 0.9387873783707619, "epoch": 0.3396875233609927, "grad_norm": 0.16463173925876617, "learning_rate": 8.868034471125833e-05, "loss": 0.9263, "mean_token_accuracy": 0.7348545640707016, "num_tokens": 117822322.0, "step": 3692 }, { "entropy": 0.8639038391411304, "epoch": 0.33977952973243397, "grad_norm": 0.15945254266262054, "learning_rate": 8.86772778851167e-05, "loss": 0.874, "mean_token_accuracy": 0.7496752366423607, "num_tokens": 117854788.0, "step": 3693 }, { "entropy": 0.7606076449155807, "epoch": 0.3398715361038752, "grad_norm": 0.15076787769794464, "learning_rate": 8.867421105897508e-05, "loss": 0.7386, "mean_token_accuracy": 0.7830086834728718, "num_tokens": 117887322.0, "step": 3694 }, { "entropy": 0.8467345125973225, "epoch": 0.3399635424753164, "grad_norm": 0.1598215401172638, "learning_rate": 8.867114423283345e-05, "loss": 0.8512, "mean_token_accuracy": 0.7536008879542351, "num_tokens": 117919272.0, "step": 3695 }, { "entropy": 0.9232820477336645, "epoch": 0.34005554884675765, "grad_norm": 0.16981424391269684, "learning_rate": 8.866807740669181e-05, "loss": 0.9371, "mean_token_accuracy": 0.7337960563600063, "num_tokens": 117950752.0, "step": 3696 }, { "entropy": 0.905631847679615, "epoch": 0.34014755521819884, "grad_norm": 0.15749426186084747, "learning_rate": 8.86650105805502e-05, "loss": 0.8901, "mean_token_accuracy": 0.7460664175450802, "num_tokens": 117983087.0, "step": 3697 }, { "entropy": 0.8553846329450607, "epoch": 0.3402395615896401, "grad_norm": 0.16589222848415375, "learning_rate": 8.866194375440858e-05, "loss": 0.8372, "mean_token_accuracy": 0.7556845061480999, "num_tokens": 118014979.0, "step": 3698 }, { "entropy": 0.7258607223629951, "epoch": 0.3403315679610813, "grad_norm": 0.14893867075443268, "learning_rate": 8.865887692826694e-05, "loss": 0.7104, "mean_token_accuracy": 0.7932132892310619, "num_tokens": 118047210.0, "step": 3699 }, { "entropy": 0.7842186614871025, "epoch": 0.3404235743325225, "grad_norm": 0.159607395529747, "learning_rate": 8.865581010212531e-05, "loss": 0.7777, "mean_token_accuracy": 0.7716917842626572, "num_tokens": 118079563.0, "step": 3700 }, { "entropy": 0.9354798421263695, "epoch": 0.34051558070396376, "grad_norm": 0.16963587701320648, "learning_rate": 8.865274327598368e-05, "loss": 0.9392, "mean_token_accuracy": 0.730739526450634, "num_tokens": 118109799.0, "step": 3701 }, { "entropy": 0.9464934282004833, "epoch": 0.34060758707540495, "grad_norm": 0.16352087259292603, "learning_rate": 8.864967644984206e-05, "loss": 0.9503, "mean_token_accuracy": 0.7305676527321339, "num_tokens": 118141476.0, "step": 3702 }, { "entropy": 0.7594627905637026, "epoch": 0.3406995934468462, "grad_norm": 0.15201662480831146, "learning_rate": 8.864660962370044e-05, "loss": 0.7423, "mean_token_accuracy": 0.7831352204084396, "num_tokens": 118173791.0, "step": 3703 }, { "entropy": 0.7795003280043602, "epoch": 0.34079159981828744, "grad_norm": 0.15459637343883514, "learning_rate": 8.864354279755881e-05, "loss": 0.7769, "mean_token_accuracy": 0.7757538892328739, "num_tokens": 118206355.0, "step": 3704 }, { "entropy": 0.8717618584632874, "epoch": 0.3408836061897286, "grad_norm": 0.16742613911628723, "learning_rate": 8.864047597141718e-05, "loss": 0.8702, "mean_token_accuracy": 0.7534622736275196, "num_tokens": 118238166.0, "step": 3705 }, { "entropy": 0.8845714628696442, "epoch": 0.34097561256116987, "grad_norm": 0.16011746227741241, "learning_rate": 8.863740914527556e-05, "loss": 0.8978, "mean_token_accuracy": 0.7447999753057957, "num_tokens": 118270769.0, "step": 3706 }, { "entropy": 0.9194144401699305, "epoch": 0.34106761893261106, "grad_norm": 0.1600901037454605, "learning_rate": 8.863434231913393e-05, "loss": 0.9215, "mean_token_accuracy": 0.7357224337756634, "num_tokens": 118302904.0, "step": 3707 }, { "entropy": 0.8001449629664421, "epoch": 0.3411596253040523, "grad_norm": 0.16112641990184784, "learning_rate": 8.863127549299231e-05, "loss": 0.7964, "mean_token_accuracy": 0.767424400895834, "num_tokens": 118335218.0, "step": 3708 }, { "entropy": 0.841883921995759, "epoch": 0.34125163167549355, "grad_norm": 0.1622907519340515, "learning_rate": 8.862820866685068e-05, "loss": 0.8175, "mean_token_accuracy": 0.7635161690413952, "num_tokens": 118366737.0, "step": 3709 }, { "entropy": 0.876302357763052, "epoch": 0.34134363804693474, "grad_norm": 0.15373189747333527, "learning_rate": 8.862514184070906e-05, "loss": 0.8401, "mean_token_accuracy": 0.7561798356473446, "num_tokens": 118398430.0, "step": 3710 }, { "entropy": 0.8893446121364832, "epoch": 0.341435644418376, "grad_norm": 0.16385892033576965, "learning_rate": 8.862207501456743e-05, "loss": 0.8668, "mean_token_accuracy": 0.752390667796135, "num_tokens": 118430478.0, "step": 3711 }, { "entropy": 0.8816887829452753, "epoch": 0.34152765078981717, "grad_norm": 0.15924251079559326, "learning_rate": 8.86190081884258e-05, "loss": 0.8794, "mean_token_accuracy": 0.7472030259668827, "num_tokens": 118463172.0, "step": 3712 }, { "entropy": 0.8651000875979662, "epoch": 0.3416196571612584, "grad_norm": 0.16222727298736572, "learning_rate": 8.861594136228418e-05, "loss": 0.8619, "mean_token_accuracy": 0.7501156888902187, "num_tokens": 118494773.0, "step": 3713 }, { "entropy": 0.7411332316696644, "epoch": 0.34171166353269966, "grad_norm": 0.1661740094423294, "learning_rate": 8.861287453614256e-05, "loss": 0.7702, "mean_token_accuracy": 0.7777126356959343, "num_tokens": 118526520.0, "step": 3714 }, { "entropy": 0.891741719096899, "epoch": 0.34180366990414085, "grad_norm": 0.1674247831106186, "learning_rate": 8.860980771000093e-05, "loss": 0.8758, "mean_token_accuracy": 0.7437697537243366, "num_tokens": 118558430.0, "step": 3715 }, { "entropy": 0.8315691910684109, "epoch": 0.3418956762755821, "grad_norm": 0.15780077874660492, "learning_rate": 8.860674088385929e-05, "loss": 0.8308, "mean_token_accuracy": 0.7605084739625454, "num_tokens": 118590417.0, "step": 3716 }, { "entropy": 0.84157470241189, "epoch": 0.3419876826470233, "grad_norm": 0.1541234701871872, "learning_rate": 8.860367405771766e-05, "loss": 0.8301, "mean_token_accuracy": 0.757339108735323, "num_tokens": 118622980.0, "step": 3717 }, { "entropy": 0.8389298021793365, "epoch": 0.34207968901846453, "grad_norm": 0.1552625298500061, "learning_rate": 8.860060723157606e-05, "loss": 0.8543, "mean_token_accuracy": 0.7544471733272076, "num_tokens": 118655103.0, "step": 3718 }, { "entropy": 0.7533008437603712, "epoch": 0.3421716953899058, "grad_norm": 0.15825116634368896, "learning_rate": 8.859754040543442e-05, "loss": 0.7198, "mean_token_accuracy": 0.7923881858587265, "num_tokens": 118687485.0, "step": 3719 }, { "entropy": 0.7737366054207087, "epoch": 0.34226370176134696, "grad_norm": 0.1660526990890503, "learning_rate": 8.859447357929279e-05, "loss": 0.7765, "mean_token_accuracy": 0.7746818922460079, "num_tokens": 118719323.0, "step": 3720 }, { "entropy": 0.8127138763666153, "epoch": 0.3423557081327882, "grad_norm": 0.15834467113018036, "learning_rate": 8.859140675315116e-05, "loss": 0.821, "mean_token_accuracy": 0.7602910622954369, "num_tokens": 118751008.0, "step": 3721 }, { "entropy": 0.8320991545915604, "epoch": 0.3424477145042294, "grad_norm": 0.1546429842710495, "learning_rate": 8.858833992700954e-05, "loss": 0.8176, "mean_token_accuracy": 0.7600317597389221, "num_tokens": 118783058.0, "step": 3722 }, { "entropy": 0.9133446216583252, "epoch": 0.34253972087567064, "grad_norm": 0.15908969938755035, "learning_rate": 8.858527310086792e-05, "loss": 0.9052, "mean_token_accuracy": 0.7412885017693043, "num_tokens": 118814853.0, "step": 3723 }, { "entropy": 0.842214573174715, "epoch": 0.3426317272471119, "grad_norm": 0.15964275598526, "learning_rate": 8.858220627472629e-05, "loss": 0.839, "mean_token_accuracy": 0.7534457668662071, "num_tokens": 118846325.0, "step": 3724 }, { "entropy": 0.8598306141793728, "epoch": 0.3427237336185531, "grad_norm": 0.15833033621311188, "learning_rate": 8.857913944858467e-05, "loss": 0.8419, "mean_token_accuracy": 0.7549173831939697, "num_tokens": 118878207.0, "step": 3725 }, { "entropy": 0.8039496801793575, "epoch": 0.3428157399899943, "grad_norm": 0.15657667815685272, "learning_rate": 8.857607262244304e-05, "loss": 0.7863, "mean_token_accuracy": 0.7717664651572704, "num_tokens": 118910173.0, "step": 3726 }, { "entropy": 0.8667401075363159, "epoch": 0.3429077463614355, "grad_norm": 0.16042287647724152, "learning_rate": 8.857300579630141e-05, "loss": 0.874, "mean_token_accuracy": 0.7459614388644695, "num_tokens": 118942593.0, "step": 3727 }, { "entropy": 0.8220714125782251, "epoch": 0.34299975273287675, "grad_norm": 0.16127879917621613, "learning_rate": 8.856993897015979e-05, "loss": 0.8328, "mean_token_accuracy": 0.7599578388035297, "num_tokens": 118974974.0, "step": 3728 }, { "entropy": 0.8267379365861416, "epoch": 0.343091759104318, "grad_norm": 0.1541992872953415, "learning_rate": 8.856687214401817e-05, "loss": 0.8175, "mean_token_accuracy": 0.764610543847084, "num_tokens": 119007306.0, "step": 3729 }, { "entropy": 0.8897053375840187, "epoch": 0.3431837654757592, "grad_norm": 0.1666519194841385, "learning_rate": 8.856380531787654e-05, "loss": 0.8933, "mean_token_accuracy": 0.7457625940442085, "num_tokens": 119038185.0, "step": 3730 }, { "entropy": 0.9171824343502522, "epoch": 0.34327577184720043, "grad_norm": 0.15954819321632385, "learning_rate": 8.85607384917349e-05, "loss": 0.9003, "mean_token_accuracy": 0.7429808229207993, "num_tokens": 119070434.0, "step": 3731 }, { "entropy": 0.8549441378563643, "epoch": 0.3433677782186416, "grad_norm": 0.16388298571109772, "learning_rate": 8.855767166559327e-05, "loss": 0.8698, "mean_token_accuracy": 0.7500322386622429, "num_tokens": 119103020.0, "step": 3732 }, { "entropy": 0.9060702845454216, "epoch": 0.34345978459008286, "grad_norm": 0.16265486180782318, "learning_rate": 8.855460483945166e-05, "loss": 0.9116, "mean_token_accuracy": 0.7359498888254166, "num_tokens": 119133535.0, "step": 3733 }, { "entropy": 0.7444387692958117, "epoch": 0.3435517909615241, "grad_norm": 0.1556912362575531, "learning_rate": 8.855153801331004e-05, "loss": 0.7338, "mean_token_accuracy": 0.7858595922589302, "num_tokens": 119165495.0, "step": 3734 }, { "entropy": 0.8029676489531994, "epoch": 0.3436437973329653, "grad_norm": 0.1566811501979828, "learning_rate": 8.85484711871684e-05, "loss": 0.7801, "mean_token_accuracy": 0.7707334719598293, "num_tokens": 119197539.0, "step": 3735 }, { "entropy": 0.831120491027832, "epoch": 0.34373580370440654, "grad_norm": 0.16096343100070953, "learning_rate": 8.854540436102677e-05, "loss": 0.8155, "mean_token_accuracy": 0.7647062987089157, "num_tokens": 119229617.0, "step": 3736 }, { "entropy": 0.8321743197739124, "epoch": 0.34382781007584773, "grad_norm": 0.15893633663654327, "learning_rate": 8.854233753488515e-05, "loss": 0.8238, "mean_token_accuracy": 0.7573788538575172, "num_tokens": 119261848.0, "step": 3737 }, { "entropy": 0.911261148750782, "epoch": 0.343919816447289, "grad_norm": 0.16171090304851532, "learning_rate": 8.853927070874352e-05, "loss": 0.8933, "mean_token_accuracy": 0.7424199879169464, "num_tokens": 119293706.0, "step": 3738 }, { "entropy": 0.844773955643177, "epoch": 0.3440118228187302, "grad_norm": 0.1561574935913086, "learning_rate": 8.85362038826019e-05, "loss": 0.8311, "mean_token_accuracy": 0.7574186027050018, "num_tokens": 119325179.0, "step": 3739 }, { "entropy": 0.784180223941803, "epoch": 0.3441038291901714, "grad_norm": 0.1520143449306488, "learning_rate": 8.853313705646027e-05, "loss": 0.7566, "mean_token_accuracy": 0.7799860648810863, "num_tokens": 119356776.0, "step": 3740 }, { "entropy": 0.8523888625204563, "epoch": 0.34419583556161265, "grad_norm": 0.1556396782398224, "learning_rate": 8.853007023031865e-05, "loss": 0.8575, "mean_token_accuracy": 0.7518056407570839, "num_tokens": 119388479.0, "step": 3741 }, { "entropy": 0.8911075331270695, "epoch": 0.34428784193305384, "grad_norm": 0.16601233184337616, "learning_rate": 8.852700340417702e-05, "loss": 0.8863, "mean_token_accuracy": 0.7446825057268143, "num_tokens": 119421180.0, "step": 3742 }, { "entropy": 0.834352470934391, "epoch": 0.3443798483044951, "grad_norm": 0.15574300289154053, "learning_rate": 8.852393657803539e-05, "loss": 0.8386, "mean_token_accuracy": 0.7550987936556339, "num_tokens": 119453485.0, "step": 3743 }, { "entropy": 0.8214633259922266, "epoch": 0.34447185467593633, "grad_norm": 0.15685395896434784, "learning_rate": 8.852086975189377e-05, "loss": 0.8467, "mean_token_accuracy": 0.757653072476387, "num_tokens": 119485975.0, "step": 3744 }, { "entropy": 0.8120367974042892, "epoch": 0.3445638610473775, "grad_norm": 0.15783628821372986, "learning_rate": 8.851780292575215e-05, "loss": 0.8382, "mean_token_accuracy": 0.7634787335991859, "num_tokens": 119517696.0, "step": 3745 }, { "entropy": 0.8628420624881983, "epoch": 0.34465586741881876, "grad_norm": 0.15668772161006927, "learning_rate": 8.851473609961052e-05, "loss": 0.8642, "mean_token_accuracy": 0.7524092718958855, "num_tokens": 119549886.0, "step": 3746 }, { "entropy": 0.8682076577097178, "epoch": 0.34474787379025995, "grad_norm": 0.166350319981575, "learning_rate": 8.851166927346889e-05, "loss": 0.8626, "mean_token_accuracy": 0.7560263238847256, "num_tokens": 119581372.0, "step": 3747 }, { "entropy": 0.7474403753876686, "epoch": 0.3448398801617012, "grad_norm": 0.15186481177806854, "learning_rate": 8.850860244732725e-05, "loss": 0.7217, "mean_token_accuracy": 0.7856578379869461, "num_tokens": 119613547.0, "step": 3748 }, { "entropy": 0.8332053050398827, "epoch": 0.34493188653314244, "grad_norm": 0.1625697761774063, "learning_rate": 8.850553562118564e-05, "loss": 0.8281, "mean_token_accuracy": 0.7623979710042477, "num_tokens": 119646061.0, "step": 3749 }, { "entropy": 0.825550539419055, "epoch": 0.34502389290458363, "grad_norm": 0.16239915788173676, "learning_rate": 8.850246879504402e-05, "loss": 0.8106, "mean_token_accuracy": 0.7711258791387081, "num_tokens": 119677174.0, "step": 3750 }, { "entropy": 0.948045264929533, "epoch": 0.3451158992760249, "grad_norm": 0.16361881792545319, "learning_rate": 8.849940196890239e-05, "loss": 0.9444, "mean_token_accuracy": 0.7352516204118729, "num_tokens": 119709641.0, "step": 3751 }, { "entropy": 0.8236925341188908, "epoch": 0.34520790564746606, "grad_norm": 0.15780960023403168, "learning_rate": 8.849633514276075e-05, "loss": 0.8112, "mean_token_accuracy": 0.7655597552657127, "num_tokens": 119742033.0, "step": 3752 }, { "entropy": 0.9009114131331444, "epoch": 0.3452999120189073, "grad_norm": 0.16553598642349243, "learning_rate": 8.849326831661913e-05, "loss": 0.8739, "mean_token_accuracy": 0.7494820989668369, "num_tokens": 119773308.0, "step": 3753 }, { "entropy": 0.7686095181852579, "epoch": 0.34539191839034855, "grad_norm": 0.14496877789497375, "learning_rate": 8.84902014904775e-05, "loss": 0.7399, "mean_token_accuracy": 0.7880070582032204, "num_tokens": 119805517.0, "step": 3754 }, { "entropy": 0.8982774820178747, "epoch": 0.34548392476178974, "grad_norm": 0.15853466093540192, "learning_rate": 8.848713466433588e-05, "loss": 0.9055, "mean_token_accuracy": 0.7445856519043446, "num_tokens": 119838090.0, "step": 3755 }, { "entropy": 0.6721353512257338, "epoch": 0.345575931133231, "grad_norm": 0.1502189338207245, "learning_rate": 8.848406783819427e-05, "loss": 0.651, "mean_token_accuracy": 0.806375939399004, "num_tokens": 119870457.0, "step": 3756 }, { "entropy": 0.8785920813679695, "epoch": 0.3456679375046722, "grad_norm": 0.16576386988162994, "learning_rate": 8.848100101205263e-05, "loss": 0.8989, "mean_token_accuracy": 0.7427621744573116, "num_tokens": 119902426.0, "step": 3757 }, { "entropy": 0.8163319602608681, "epoch": 0.3457599438761134, "grad_norm": 0.16899247467517853, "learning_rate": 8.8477934185911e-05, "loss": 0.8393, "mean_token_accuracy": 0.760418251156807, "num_tokens": 119934387.0, "step": 3758 }, { "entropy": 0.8886992279440165, "epoch": 0.34585195024755466, "grad_norm": 0.17395682632923126, "learning_rate": 8.847486735976937e-05, "loss": 0.9121, "mean_token_accuracy": 0.7410960346460342, "num_tokens": 119967149.0, "step": 3759 }, { "entropy": 0.7635833472013474, "epoch": 0.34594395661899585, "grad_norm": 0.16510646045207977, "learning_rate": 8.847180053362776e-05, "loss": 0.7714, "mean_token_accuracy": 0.7766184322535992, "num_tokens": 119999528.0, "step": 3760 }, { "entropy": 0.869922574609518, "epoch": 0.3460359629904371, "grad_norm": 0.1642490029335022, "learning_rate": 8.846873370748613e-05, "loss": 0.8486, "mean_token_accuracy": 0.7600690573453903, "num_tokens": 120031090.0, "step": 3761 }, { "entropy": 0.8930163271725178, "epoch": 0.3461279693618783, "grad_norm": 0.157710999250412, "learning_rate": 8.84656668813445e-05, "loss": 0.8956, "mean_token_accuracy": 0.7424335554242134, "num_tokens": 120063169.0, "step": 3762 }, { "entropy": 0.8254711236804724, "epoch": 0.34621997573331953, "grad_norm": 0.154154434800148, "learning_rate": 8.846260005520287e-05, "loss": 0.8042, "mean_token_accuracy": 0.7686141692101955, "num_tokens": 120095531.0, "step": 3763 }, { "entropy": 0.8259627223014832, "epoch": 0.3463119821047608, "grad_norm": 0.15411938726902008, "learning_rate": 8.845953322906125e-05, "loss": 0.805, "mean_token_accuracy": 0.7685264982283115, "num_tokens": 120128205.0, "step": 3764 }, { "entropy": 0.8197680991142988, "epoch": 0.34640398847620196, "grad_norm": 0.15063221752643585, "learning_rate": 8.845646640291963e-05, "loss": 0.8031, "mean_token_accuracy": 0.7685605064034462, "num_tokens": 120160023.0, "step": 3765 }, { "entropy": 0.800836306065321, "epoch": 0.3464959948476432, "grad_norm": 0.15559294819831848, "learning_rate": 8.8453399576778e-05, "loss": 0.7876, "mean_token_accuracy": 0.7690862119197845, "num_tokens": 120191337.0, "step": 3766 }, { "entropy": 0.8540994934737682, "epoch": 0.3465880012190844, "grad_norm": 0.16338646411895752, "learning_rate": 8.845033275063637e-05, "loss": 0.8436, "mean_token_accuracy": 0.7573985233902931, "num_tokens": 120223213.0, "step": 3767 }, { "entropy": 0.8612070381641388, "epoch": 0.34668000759052564, "grad_norm": 0.15954744815826416, "learning_rate": 8.844726592449475e-05, "loss": 0.8312, "mean_token_accuracy": 0.7589932307600975, "num_tokens": 120254686.0, "step": 3768 }, { "entropy": 0.7959731034934521, "epoch": 0.3467720139619669, "grad_norm": 0.15368808805942535, "learning_rate": 8.844419909835312e-05, "loss": 0.7775, "mean_token_accuracy": 0.7701177038252354, "num_tokens": 120286555.0, "step": 3769 }, { "entropy": 0.8628717139363289, "epoch": 0.3468640203334081, "grad_norm": 0.16074331104755402, "learning_rate": 8.84411322722115e-05, "loss": 0.8665, "mean_token_accuracy": 0.7494498528540134, "num_tokens": 120318196.0, "step": 3770 }, { "entropy": 0.8907548636198044, "epoch": 0.3469560267048493, "grad_norm": 0.16904211044311523, "learning_rate": 8.843806544606986e-05, "loss": 0.8771, "mean_token_accuracy": 0.7499096691608429, "num_tokens": 120349157.0, "step": 3771 }, { "entropy": 0.9293929599225521, "epoch": 0.3470480330762905, "grad_norm": 0.17182472348213196, "learning_rate": 8.843499861992825e-05, "loss": 0.9596, "mean_token_accuracy": 0.7327613607048988, "num_tokens": 120380977.0, "step": 3772 }, { "entropy": 0.8088716734200716, "epoch": 0.34714003944773175, "grad_norm": 0.15974104404449463, "learning_rate": 8.843193179378661e-05, "loss": 0.8037, "mean_token_accuracy": 0.765363022685051, "num_tokens": 120413252.0, "step": 3773 }, { "entropy": 0.8099780157208443, "epoch": 0.347232045819173, "grad_norm": 0.16105832159519196, "learning_rate": 8.842886496764498e-05, "loss": 0.8271, "mean_token_accuracy": 0.7653442844748497, "num_tokens": 120445029.0, "step": 3774 }, { "entropy": 0.8192146420478821, "epoch": 0.3473240521906142, "grad_norm": 0.16290916502475739, "learning_rate": 8.842579814150336e-05, "loss": 0.8188, "mean_token_accuracy": 0.7618572600185871, "num_tokens": 120477159.0, "step": 3775 }, { "entropy": 0.7573690358549356, "epoch": 0.34741605856205543, "grad_norm": 0.15212994813919067, "learning_rate": 8.842273131536174e-05, "loss": 0.7343, "mean_token_accuracy": 0.7854475863277912, "num_tokens": 120509282.0, "step": 3776 }, { "entropy": 0.9038415960967541, "epoch": 0.3475080649334966, "grad_norm": 0.15961048007011414, "learning_rate": 8.841966448922011e-05, "loss": 0.9016, "mean_token_accuracy": 0.7447250969707966, "num_tokens": 120541185.0, "step": 3777 }, { "entropy": 0.8827890865504742, "epoch": 0.34760007130493786, "grad_norm": 0.15730538964271545, "learning_rate": 8.841659766307848e-05, "loss": 0.8622, "mean_token_accuracy": 0.7533799931406975, "num_tokens": 120573732.0, "step": 3778 }, { "entropy": 0.7959932908415794, "epoch": 0.3476920776763791, "grad_norm": 0.15313290059566498, "learning_rate": 8.841353083693685e-05, "loss": 0.7793, "mean_token_accuracy": 0.7766465917229652, "num_tokens": 120605825.0, "step": 3779 }, { "entropy": 0.8593918941915035, "epoch": 0.3477840840478203, "grad_norm": 0.1587131917476654, "learning_rate": 8.841046401079523e-05, "loss": 0.8352, "mean_token_accuracy": 0.7578673735260963, "num_tokens": 120638297.0, "step": 3780 }, { "entropy": 0.7576248534023762, "epoch": 0.34787609041926154, "grad_norm": 0.15267202258110046, "learning_rate": 8.840739718465361e-05, "loss": 0.7215, "mean_token_accuracy": 0.7895100191235542, "num_tokens": 120669867.0, "step": 3781 }, { "entropy": 0.8344754688441753, "epoch": 0.34796809679070273, "grad_norm": 0.16018937528133392, "learning_rate": 8.840433035851198e-05, "loss": 0.8208, "mean_token_accuracy": 0.762143649160862, "num_tokens": 120701102.0, "step": 3782 }, { "entropy": 0.7512946473434567, "epoch": 0.348060103162144, "grad_norm": 0.1509130895137787, "learning_rate": 8.840126353237035e-05, "loss": 0.743, "mean_token_accuracy": 0.7821798101067543, "num_tokens": 120733561.0, "step": 3783 }, { "entropy": 0.855661615729332, "epoch": 0.3481521095335852, "grad_norm": 0.1672372967004776, "learning_rate": 8.839819670622873e-05, "loss": 0.8659, "mean_token_accuracy": 0.7571824677288532, "num_tokens": 120765447.0, "step": 3784 }, { "entropy": 0.7309505622833967, "epoch": 0.3482441159050264, "grad_norm": 0.1552681177854538, "learning_rate": 8.83951298800871e-05, "loss": 0.7373, "mean_token_accuracy": 0.7844927795231342, "num_tokens": 120797992.0, "step": 3785 }, { "entropy": 0.7808074932545424, "epoch": 0.34833612227646765, "grad_norm": 0.15462271869182587, "learning_rate": 8.839206305394548e-05, "loss": 0.7773, "mean_token_accuracy": 0.773887999355793, "num_tokens": 120830167.0, "step": 3786 }, { "entropy": 0.8600835539400578, "epoch": 0.34842812864790884, "grad_norm": 0.16238686442375183, "learning_rate": 8.838899622780386e-05, "loss": 0.8783, "mean_token_accuracy": 0.7487959004938602, "num_tokens": 120861918.0, "step": 3787 }, { "entropy": 0.8208338208496571, "epoch": 0.3485201350193501, "grad_norm": 0.16467203199863434, "learning_rate": 8.838592940166223e-05, "loss": 0.8444, "mean_token_accuracy": 0.7562086284160614, "num_tokens": 120894306.0, "step": 3788 }, { "entropy": 0.7702032849192619, "epoch": 0.34861214139079133, "grad_norm": 0.15921542048454285, "learning_rate": 8.83828625755206e-05, "loss": 0.7864, "mean_token_accuracy": 0.7693427875638008, "num_tokens": 120926313.0, "step": 3789 }, { "entropy": 0.8684881329536438, "epoch": 0.3487041477622325, "grad_norm": 0.1604766547679901, "learning_rate": 8.837979574937896e-05, "loss": 0.8625, "mean_token_accuracy": 0.7531568855047226, "num_tokens": 120958632.0, "step": 3790 }, { "entropy": 0.807744087651372, "epoch": 0.34879615413367376, "grad_norm": 0.16447189450263977, "learning_rate": 8.837672892323734e-05, "loss": 0.7942, "mean_token_accuracy": 0.7721187360584736, "num_tokens": 120990072.0, "step": 3791 }, { "entropy": 0.7503185141831636, "epoch": 0.34888816050511495, "grad_norm": 0.15391848981380463, "learning_rate": 8.837366209709573e-05, "loss": 0.7288, "mean_token_accuracy": 0.7851504683494568, "num_tokens": 121022201.0, "step": 3792 }, { "entropy": 0.8460014723241329, "epoch": 0.3489801668765562, "grad_norm": 0.1594490110874176, "learning_rate": 8.83705952709541e-05, "loss": 0.8278, "mean_token_accuracy": 0.7578670121729374, "num_tokens": 121054601.0, "step": 3793 }, { "entropy": 0.8863828256726265, "epoch": 0.34907217324799744, "grad_norm": 0.16350792348384857, "learning_rate": 8.836752844481246e-05, "loss": 0.8778, "mean_token_accuracy": 0.7501875571906567, "num_tokens": 121086687.0, "step": 3794 }, { "entropy": 0.9087334871292114, "epoch": 0.34916417961943863, "grad_norm": 0.15923047065734863, "learning_rate": 8.836446161867084e-05, "loss": 0.8773, "mean_token_accuracy": 0.7490927949547768, "num_tokens": 121118952.0, "step": 3795 }, { "entropy": 0.8727920632809401, "epoch": 0.3492561859908799, "grad_norm": 0.15596643090248108, "learning_rate": 8.836139479252922e-05, "loss": 0.8724, "mean_token_accuracy": 0.7515299208462238, "num_tokens": 121150862.0, "step": 3796 }, { "entropy": 0.8969176150858402, "epoch": 0.34934819236232106, "grad_norm": 0.1582353711128235, "learning_rate": 8.835832796638759e-05, "loss": 0.8813, "mean_token_accuracy": 0.7474814653396606, "num_tokens": 121183285.0, "step": 3797 }, { "entropy": 0.9163975678384304, "epoch": 0.3494401987337623, "grad_norm": 0.16705971956253052, "learning_rate": 8.835526114024596e-05, "loss": 0.9029, "mean_token_accuracy": 0.742749709635973, "num_tokens": 121214910.0, "step": 3798 }, { "entropy": 0.7214012145996094, "epoch": 0.34953220510520355, "grad_norm": 0.15191897749900818, "learning_rate": 8.835219431410434e-05, "loss": 0.719, "mean_token_accuracy": 0.7912633307278156, "num_tokens": 121246817.0, "step": 3799 }, { "entropy": 0.9089645333588123, "epoch": 0.34962421147664474, "grad_norm": 0.16077820956707, "learning_rate": 8.834912748796271e-05, "loss": 0.9325, "mean_token_accuracy": 0.7304529994726181, "num_tokens": 121279323.0, "step": 3800 }, { "entropy": 0.9179159291088581, "epoch": 0.349716217848086, "grad_norm": 0.16571374237537384, "learning_rate": 8.834606066182109e-05, "loss": 0.9107, "mean_token_accuracy": 0.7401226945221424, "num_tokens": 121311754.0, "step": 3801 }, { "entropy": 0.9194784238934517, "epoch": 0.3498082242195272, "grad_norm": 0.15678083896636963, "learning_rate": 8.834299383567946e-05, "loss": 0.9129, "mean_token_accuracy": 0.7389914393424988, "num_tokens": 121343378.0, "step": 3802 }, { "entropy": 0.7819661758840084, "epoch": 0.3499002305909684, "grad_norm": 0.16026699542999268, "learning_rate": 8.833992700953784e-05, "loss": 0.7977, "mean_token_accuracy": 0.7694789320230484, "num_tokens": 121375688.0, "step": 3803 }, { "entropy": 0.8505206853151321, "epoch": 0.34999223696240966, "grad_norm": 0.17495007812976837, "learning_rate": 8.833686018339621e-05, "loss": 0.8629, "mean_token_accuracy": 0.7496790401637554, "num_tokens": 121408034.0, "step": 3804 }, { "entropy": 0.8036221768707037, "epoch": 0.35008424333385085, "grad_norm": 0.15931063890457153, "learning_rate": 8.833379335725458e-05, "loss": 0.8027, "mean_token_accuracy": 0.772084679454565, "num_tokens": 121440090.0, "step": 3805 }, { "entropy": 0.9043404422700405, "epoch": 0.3501762497052921, "grad_norm": 0.15718883275985718, "learning_rate": 8.833072653111296e-05, "loss": 0.9059, "mean_token_accuracy": 0.7422502785921097, "num_tokens": 121472429.0, "step": 3806 }, { "entropy": 0.7461367975920439, "epoch": 0.3502682560767333, "grad_norm": 0.15172743797302246, "learning_rate": 8.832765970497134e-05, "loss": 0.738, "mean_token_accuracy": 0.7830536663532257, "num_tokens": 121504709.0, "step": 3807 }, { "entropy": 0.8562102783471346, "epoch": 0.35036026244817453, "grad_norm": 0.1554148942232132, "learning_rate": 8.83245928788297e-05, "loss": 0.8448, "mean_token_accuracy": 0.7566382996737957, "num_tokens": 121536509.0, "step": 3808 }, { "entropy": 0.6564690433442593, "epoch": 0.3504522688196158, "grad_norm": 0.14341983199119568, "learning_rate": 8.832152605268807e-05, "loss": 0.6289, "mean_token_accuracy": 0.8125, "num_tokens": 121569277.0, "step": 3809 }, { "entropy": 0.7488473411649466, "epoch": 0.35054427519105696, "grad_norm": 0.15279901027679443, "learning_rate": 8.831845922654644e-05, "loss": 0.7093, "mean_token_accuracy": 0.7924327105283737, "num_tokens": 121601476.0, "step": 3810 }, { "entropy": 0.7706202641129494, "epoch": 0.3506362815624982, "grad_norm": 0.14755985140800476, "learning_rate": 8.831539240040482e-05, "loss": 0.7592, "mean_token_accuracy": 0.7795416861772537, "num_tokens": 121633700.0, "step": 3811 }, { "entropy": 0.9353910367935896, "epoch": 0.3507282879339394, "grad_norm": 0.16320650279521942, "learning_rate": 8.83123255742632e-05, "loss": 0.9147, "mean_token_accuracy": 0.7432449571788311, "num_tokens": 121665911.0, "step": 3812 }, { "entropy": 0.8447041548788548, "epoch": 0.35082029430538064, "grad_norm": 0.16096341609954834, "learning_rate": 8.830925874812157e-05, "loss": 0.8401, "mean_token_accuracy": 0.7569751925766468, "num_tokens": 121697803.0, "step": 3813 }, { "entropy": 0.8196309600025415, "epoch": 0.3509123006768219, "grad_norm": 0.16276951134204865, "learning_rate": 8.830619192197995e-05, "loss": 0.8152, "mean_token_accuracy": 0.7634732387959957, "num_tokens": 121729192.0, "step": 3814 }, { "entropy": 0.9480710439383984, "epoch": 0.3510043070482631, "grad_norm": 0.17037439346313477, "learning_rate": 8.830312509583832e-05, "loss": 0.9635, "mean_token_accuracy": 0.7302686125040054, "num_tokens": 121761412.0, "step": 3815 }, { "entropy": 0.875516664236784, "epoch": 0.3510963134197043, "grad_norm": 0.17799502611160278, "learning_rate": 8.830005826969669e-05, "loss": 0.9059, "mean_token_accuracy": 0.7403752617537975, "num_tokens": 121792513.0, "step": 3816 }, { "entropy": 0.7959139719605446, "epoch": 0.35118831979114556, "grad_norm": 0.1629268079996109, "learning_rate": 8.829699144355507e-05, "loss": 0.8054, "mean_token_accuracy": 0.7710596211254597, "num_tokens": 121824691.0, "step": 3817 }, { "entropy": 0.8259482327848673, "epoch": 0.35128032616258675, "grad_norm": 0.1591295748949051, "learning_rate": 8.829392461741345e-05, "loss": 0.8153, "mean_token_accuracy": 0.764889270067215, "num_tokens": 121855920.0, "step": 3818 }, { "entropy": 0.88987672701478, "epoch": 0.351372332534028, "grad_norm": 0.16491180658340454, "learning_rate": 8.829085779127182e-05, "loss": 0.8918, "mean_token_accuracy": 0.7427677027881145, "num_tokens": 121887524.0, "step": 3819 }, { "entropy": 0.874864848330617, "epoch": 0.3514643389054692, "grad_norm": 0.16357478499412537, "learning_rate": 8.828779096513019e-05, "loss": 0.8743, "mean_token_accuracy": 0.7484281547367573, "num_tokens": 121919180.0, "step": 3820 }, { "entropy": 0.7600622475147247, "epoch": 0.35155634527691043, "grad_norm": 0.15744197368621826, "learning_rate": 8.828472413898856e-05, "loss": 0.7557, "mean_token_accuracy": 0.7795375213027, "num_tokens": 121950833.0, "step": 3821 }, { "entropy": 0.8302732352167368, "epoch": 0.3516483516483517, "grad_norm": 0.15557779371738434, "learning_rate": 8.828165731284694e-05, "loss": 0.8259, "mean_token_accuracy": 0.76119564473629, "num_tokens": 121982481.0, "step": 3822 }, { "entropy": 0.8397612608969212, "epoch": 0.35174035801979286, "grad_norm": 0.16073249280452728, "learning_rate": 8.827859048670532e-05, "loss": 0.8408, "mean_token_accuracy": 0.7554504722356796, "num_tokens": 122015010.0, "step": 3823 }, { "entropy": 0.8164195884019136, "epoch": 0.3518323643912341, "grad_norm": 0.16060827672481537, "learning_rate": 8.827552366056369e-05, "loss": 0.7887, "mean_token_accuracy": 0.7712399773299694, "num_tokens": 122046890.0, "step": 3824 }, { "entropy": 0.7743039652705193, "epoch": 0.3519243707626753, "grad_norm": 0.15449605882167816, "learning_rate": 8.827245683442206e-05, "loss": 0.7631, "mean_token_accuracy": 0.7814563997089863, "num_tokens": 122079017.0, "step": 3825 }, { "entropy": 0.8188587035983801, "epoch": 0.35201637713411654, "grad_norm": 0.1573369950056076, "learning_rate": 8.826939000828044e-05, "loss": 0.8159, "mean_token_accuracy": 0.7645903825759888, "num_tokens": 122110946.0, "step": 3826 }, { "entropy": 0.8627975285053253, "epoch": 0.3521083835055578, "grad_norm": 0.15811602771282196, "learning_rate": 8.82663231821388e-05, "loss": 0.8425, "mean_token_accuracy": 0.7563510276377201, "num_tokens": 122143051.0, "step": 3827 }, { "entropy": 1.0821545831859112, "epoch": 0.352200389876999, "grad_norm": 0.17075486481189728, "learning_rate": 8.826325635599719e-05, "loss": 1.0594, "mean_token_accuracy": 0.7032840810716152, "num_tokens": 122175195.0, "step": 3828 }, { "entropy": 0.8051436506211758, "epoch": 0.3522923962484402, "grad_norm": 0.1567111760377884, "learning_rate": 8.826018952985555e-05, "loss": 0.7811, "mean_token_accuracy": 0.774740856140852, "num_tokens": 122207118.0, "step": 3829 }, { "entropy": 0.8385220132768154, "epoch": 0.3523844026198814, "grad_norm": 0.15761420130729675, "learning_rate": 8.825712270371394e-05, "loss": 0.8278, "mean_token_accuracy": 0.7542272657155991, "num_tokens": 122239210.0, "step": 3830 }, { "entropy": 0.8328091837465763, "epoch": 0.35247640899132265, "grad_norm": 0.16675327718257904, "learning_rate": 8.82540558775723e-05, "loss": 0.8342, "mean_token_accuracy": 0.7618678510189056, "num_tokens": 122271141.0, "step": 3831 }, { "entropy": 0.8425095286220312, "epoch": 0.3525684153627639, "grad_norm": 0.1652573198080063, "learning_rate": 8.825098905143067e-05, "loss": 0.8494, "mean_token_accuracy": 0.7551990896463394, "num_tokens": 122303157.0, "step": 3832 }, { "entropy": 0.8279029037803411, "epoch": 0.3526604217342051, "grad_norm": 0.16322585940361023, "learning_rate": 8.824792222528905e-05, "loss": 0.8199, "mean_token_accuracy": 0.7626885883510113, "num_tokens": 122334204.0, "step": 3833 }, { "entropy": 0.8830248359590769, "epoch": 0.35275242810564633, "grad_norm": 0.16810938715934753, "learning_rate": 8.824485539914743e-05, "loss": 0.8726, "mean_token_accuracy": 0.7491313070058823, "num_tokens": 122365765.0, "step": 3834 }, { "entropy": 0.7702563591301441, "epoch": 0.3528444344770875, "grad_norm": 0.1581006944179535, "learning_rate": 8.82417885730058e-05, "loss": 0.7741, "mean_token_accuracy": 0.7729658782482147, "num_tokens": 122397695.0, "step": 3835 }, { "entropy": 0.8075187727808952, "epoch": 0.35293644084852877, "grad_norm": 0.1620257943868637, "learning_rate": 8.823872174686417e-05, "loss": 0.8082, "mean_token_accuracy": 0.7631422579288483, "num_tokens": 122428785.0, "step": 3836 }, { "entropy": 0.7897501513361931, "epoch": 0.35302844721997, "grad_norm": 0.15705513954162598, "learning_rate": 8.823565492072254e-05, "loss": 0.7869, "mean_token_accuracy": 0.7673697993159294, "num_tokens": 122460000.0, "step": 3837 }, { "entropy": 0.8912017233669758, "epoch": 0.3531204535914112, "grad_norm": 0.16089780628681183, "learning_rate": 8.823258809458093e-05, "loss": 0.8863, "mean_token_accuracy": 0.7509891092777252, "num_tokens": 122492439.0, "step": 3838 }, { "entropy": 0.8066176995635033, "epoch": 0.35321245996285244, "grad_norm": 0.1527390480041504, "learning_rate": 8.82295212684393e-05, "loss": 0.8052, "mean_token_accuracy": 0.7694367207586765, "num_tokens": 122524707.0, "step": 3839 }, { "entropy": 0.8893731161952019, "epoch": 0.35330446633429363, "grad_norm": 0.16149450838565826, "learning_rate": 8.822645444229767e-05, "loss": 0.8964, "mean_token_accuracy": 0.7384008839726448, "num_tokens": 122556170.0, "step": 3840 }, { "entropy": 0.7831693235784769, "epoch": 0.3533964727057349, "grad_norm": 0.1529574990272522, "learning_rate": 8.822338761615604e-05, "loss": 0.7465, "mean_token_accuracy": 0.7821817770600319, "num_tokens": 122587730.0, "step": 3841 }, { "entropy": 0.8369538523256779, "epoch": 0.3534884790771761, "grad_norm": 0.15401659905910492, "learning_rate": 8.822032079001442e-05, "loss": 0.8286, "mean_token_accuracy": 0.7553616277873516, "num_tokens": 122619128.0, "step": 3842 }, { "entropy": 0.8492603972554207, "epoch": 0.3535804854486173, "grad_norm": 0.15758611261844635, "learning_rate": 8.82172539638728e-05, "loss": 0.8529, "mean_token_accuracy": 0.7506515979766846, "num_tokens": 122651039.0, "step": 3843 }, { "entropy": 0.7711849268525839, "epoch": 0.35367249182005855, "grad_norm": 0.15675005316734314, "learning_rate": 8.821418713773117e-05, "loss": 0.7737, "mean_token_accuracy": 0.7778422795236111, "num_tokens": 122682918.0, "step": 3844 }, { "entropy": 0.8688315860927105, "epoch": 0.35376449819149974, "grad_norm": 0.1648833006620407, "learning_rate": 8.821112031158955e-05, "loss": 0.8608, "mean_token_accuracy": 0.7552086375653744, "num_tokens": 122714097.0, "step": 3845 }, { "entropy": 0.8567625191062689, "epoch": 0.353856504562941, "grad_norm": 0.15732401609420776, "learning_rate": 8.820805348544792e-05, "loss": 0.8385, "mean_token_accuracy": 0.7538790851831436, "num_tokens": 122746391.0, "step": 3846 }, { "entropy": 0.8448572624474764, "epoch": 0.35394851093438223, "grad_norm": 0.15853460133075714, "learning_rate": 8.820498665930628e-05, "loss": 0.8305, "mean_token_accuracy": 0.7594806179404259, "num_tokens": 122779093.0, "step": 3847 }, { "entropy": 0.8263257928192616, "epoch": 0.3540405173058234, "grad_norm": 0.16415563225746155, "learning_rate": 8.820191983316467e-05, "loss": 0.8207, "mean_token_accuracy": 0.7561747431755066, "num_tokens": 122810440.0, "step": 3848 }, { "entropy": 0.8424420468509197, "epoch": 0.35413252367726467, "grad_norm": 0.17686134576797485, "learning_rate": 8.819885300702305e-05, "loss": 0.8448, "mean_token_accuracy": 0.7550505883991718, "num_tokens": 122842353.0, "step": 3849 }, { "entropy": 0.8057922217994928, "epoch": 0.35422453004870585, "grad_norm": 0.16463807225227356, "learning_rate": 8.819578618088141e-05, "loss": 0.8283, "mean_token_accuracy": 0.7633196860551834, "num_tokens": 122874782.0, "step": 3850 }, { "entropy": 0.7900019697844982, "epoch": 0.3543165364201471, "grad_norm": 0.15891534090042114, "learning_rate": 8.819271935473978e-05, "loss": 0.7923, "mean_token_accuracy": 0.7711809761822224, "num_tokens": 122907110.0, "step": 3851 }, { "entropy": 0.9383850134909153, "epoch": 0.35440854279158834, "grad_norm": 0.17464902997016907, "learning_rate": 8.818965252859815e-05, "loss": 0.9589, "mean_token_accuracy": 0.7292192690074444, "num_tokens": 122938307.0, "step": 3852 }, { "entropy": 0.762123566120863, "epoch": 0.35450054916302953, "grad_norm": 0.15573818981647491, "learning_rate": 8.818658570245653e-05, "loss": 0.7407, "mean_token_accuracy": 0.7855227217078209, "num_tokens": 122970687.0, "step": 3853 }, { "entropy": 0.8000229820609093, "epoch": 0.3545925555344708, "grad_norm": 0.15551333129405975, "learning_rate": 8.818351887631491e-05, "loss": 0.7874, "mean_token_accuracy": 0.7688067071139812, "num_tokens": 123003298.0, "step": 3854 }, { "entropy": 0.7684974893927574, "epoch": 0.35468456190591197, "grad_norm": 0.15342703461647034, "learning_rate": 8.818045205017328e-05, "loss": 0.7457, "mean_token_accuracy": 0.7840672135353088, "num_tokens": 123034937.0, "step": 3855 }, { "entropy": 0.8323111236095428, "epoch": 0.3547765682773532, "grad_norm": 0.15924830734729767, "learning_rate": 8.817738522403165e-05, "loss": 0.7957, "mean_token_accuracy": 0.7730872668325901, "num_tokens": 123066840.0, "step": 3856 }, { "entropy": 0.8601456582546234, "epoch": 0.35486857464879445, "grad_norm": 0.15665236115455627, "learning_rate": 8.817431839789003e-05, "loss": 0.8528, "mean_token_accuracy": 0.7530954480171204, "num_tokens": 123098401.0, "step": 3857 }, { "entropy": 0.8202933073043823, "epoch": 0.35496058102023564, "grad_norm": 0.1641482710838318, "learning_rate": 8.81712515717484e-05, "loss": 0.8201, "mean_token_accuracy": 0.7698766589164734, "num_tokens": 123130251.0, "step": 3858 }, { "entropy": 0.753490399569273, "epoch": 0.3550525873916769, "grad_norm": 0.15789639949798584, "learning_rate": 8.816818474560678e-05, "loss": 0.747, "mean_token_accuracy": 0.7909980602562428, "num_tokens": 123162356.0, "step": 3859 }, { "entropy": 0.8231643810868263, "epoch": 0.3551445937631181, "grad_norm": 0.1605677604675293, "learning_rate": 8.816511791946515e-05, "loss": 0.8077, "mean_token_accuracy": 0.7685207389295101, "num_tokens": 123193299.0, "step": 3860 }, { "entropy": 0.8217325210571289, "epoch": 0.3552366001345593, "grad_norm": 0.15912602841854095, "learning_rate": 8.816205109332353e-05, "loss": 0.8261, "mean_token_accuracy": 0.7666271142661572, "num_tokens": 123225394.0, "step": 3861 }, { "entropy": 0.8839656822383404, "epoch": 0.35532860650600057, "grad_norm": 0.1575368493795395, "learning_rate": 8.81589842671819e-05, "loss": 0.8784, "mean_token_accuracy": 0.7431202977895737, "num_tokens": 123256934.0, "step": 3862 }, { "entropy": 0.7363398112356663, "epoch": 0.35542061287744176, "grad_norm": 0.16147452592849731, "learning_rate": 8.815591744104026e-05, "loss": 0.7504, "mean_token_accuracy": 0.7833988666534424, "num_tokens": 123288646.0, "step": 3863 }, { "entropy": 0.8046110030263662, "epoch": 0.355512619248883, "grad_norm": 0.17090420424938202, "learning_rate": 8.815285061489865e-05, "loss": 0.8261, "mean_token_accuracy": 0.7635264359414577, "num_tokens": 123320169.0, "step": 3864 }, { "entropy": 0.7578581757843494, "epoch": 0.3556046256203242, "grad_norm": 0.1523044854402542, "learning_rate": 8.814978378875703e-05, "loss": 0.7507, "mean_token_accuracy": 0.7794568948447704, "num_tokens": 123351846.0, "step": 3865 }, { "entropy": 0.8991098701953888, "epoch": 0.35569663199176543, "grad_norm": 0.16565953195095062, "learning_rate": 8.81467169626154e-05, "loss": 0.9113, "mean_token_accuracy": 0.7422010563313961, "num_tokens": 123383091.0, "step": 3866 }, { "entropy": 0.7952282018959522, "epoch": 0.3557886383632067, "grad_norm": 0.15644925832748413, "learning_rate": 8.814365013647376e-05, "loss": 0.7705, "mean_token_accuracy": 0.7758955471217632, "num_tokens": 123415358.0, "step": 3867 }, { "entropy": 0.7681563328951597, "epoch": 0.35588064473464787, "grad_norm": 0.152495339512825, "learning_rate": 8.814058331033213e-05, "loss": 0.7655, "mean_token_accuracy": 0.7797845304012299, "num_tokens": 123447705.0, "step": 3868 }, { "entropy": 0.98968605697155, "epoch": 0.3559726511060891, "grad_norm": 0.17021581530570984, "learning_rate": 8.813751648419051e-05, "loss": 0.9859, "mean_token_accuracy": 0.7240044362843037, "num_tokens": 123479552.0, "step": 3869 }, { "entropy": 0.8605850487947464, "epoch": 0.3560646574775303, "grad_norm": 0.16424888372421265, "learning_rate": 8.81344496580489e-05, "loss": 0.8594, "mean_token_accuracy": 0.7494294606149197, "num_tokens": 123511020.0, "step": 3870 }, { "entropy": 0.7652826737612486, "epoch": 0.35615666384897154, "grad_norm": 0.14982885122299194, "learning_rate": 8.813138283190726e-05, "loss": 0.7399, "mean_token_accuracy": 0.7799660861492157, "num_tokens": 123543271.0, "step": 3871 }, { "entropy": 0.780370470136404, "epoch": 0.3562486702204128, "grad_norm": 0.14901946485042572, "learning_rate": 8.812831600576563e-05, "loss": 0.7684, "mean_token_accuracy": 0.7744050212204456, "num_tokens": 123575396.0, "step": 3872 }, { "entropy": 0.7886612601578236, "epoch": 0.356340676591854, "grad_norm": 0.1585397571325302, "learning_rate": 8.812524917962401e-05, "loss": 0.8154, "mean_token_accuracy": 0.7665118426084518, "num_tokens": 123606221.0, "step": 3873 }, { "entropy": 0.8079205118119717, "epoch": 0.3564326829632952, "grad_norm": 0.15542809665203094, "learning_rate": 8.812218235348238e-05, "loss": 0.8041, "mean_token_accuracy": 0.7665212340652943, "num_tokens": 123637514.0, "step": 3874 }, { "entropy": 0.8762025497853756, "epoch": 0.3565246893347364, "grad_norm": 0.15812699496746063, "learning_rate": 8.811911552734076e-05, "loss": 0.8867, "mean_token_accuracy": 0.7449298650026321, "num_tokens": 123669324.0, "step": 3875 }, { "entropy": 0.7565794810652733, "epoch": 0.35661669570617766, "grad_norm": 0.15625078976154327, "learning_rate": 8.811604870119914e-05, "loss": 0.7571, "mean_token_accuracy": 0.7785244695842266, "num_tokens": 123700850.0, "step": 3876 }, { "entropy": 0.8177671786397696, "epoch": 0.3567087020776189, "grad_norm": 0.1610877960920334, "learning_rate": 8.811298187505751e-05, "loss": 0.8147, "mean_token_accuracy": 0.7650122717022896, "num_tokens": 123732610.0, "step": 3877 }, { "entropy": 0.8457952737808228, "epoch": 0.3568007084490601, "grad_norm": 0.15711858868598938, "learning_rate": 8.810991504891588e-05, "loss": 0.829, "mean_token_accuracy": 0.7612704336643219, "num_tokens": 123764377.0, "step": 3878 }, { "entropy": 0.7525805532932281, "epoch": 0.35689271482050133, "grad_norm": 0.1481260061264038, "learning_rate": 8.810684822277425e-05, "loss": 0.7166, "mean_token_accuracy": 0.7934305816888809, "num_tokens": 123796200.0, "step": 3879 }, { "entropy": 0.8027665577828884, "epoch": 0.3569847211919425, "grad_norm": 0.1611669361591339, "learning_rate": 8.810378139663264e-05, "loss": 0.7852, "mean_token_accuracy": 0.7702967077493668, "num_tokens": 123827815.0, "step": 3880 }, { "entropy": 0.7924179658293724, "epoch": 0.35707672756338377, "grad_norm": 0.16211912035942078, "learning_rate": 8.810071457049101e-05, "loss": 0.7705, "mean_token_accuracy": 0.7757881432771683, "num_tokens": 123860338.0, "step": 3881 }, { "entropy": 0.8279090654104948, "epoch": 0.357168733934825, "grad_norm": 0.16137219965457916, "learning_rate": 8.809764774434938e-05, "loss": 0.8329, "mean_token_accuracy": 0.7599588297307491, "num_tokens": 123891404.0, "step": 3882 }, { "entropy": 0.7953283116221428, "epoch": 0.3572607403062662, "grad_norm": 0.15649986267089844, "learning_rate": 8.809458091820774e-05, "loss": 0.7787, "mean_token_accuracy": 0.7774722687900066, "num_tokens": 123923400.0, "step": 3883 }, { "entropy": 0.8056732006371021, "epoch": 0.35735274667770744, "grad_norm": 0.15557630360126495, "learning_rate": 8.809151409206613e-05, "loss": 0.791, "mean_token_accuracy": 0.7687728554010391, "num_tokens": 123955441.0, "step": 3884 }, { "entropy": 0.8117903433740139, "epoch": 0.35744475304914863, "grad_norm": 0.16056019067764282, "learning_rate": 8.80884472659245e-05, "loss": 0.7963, "mean_token_accuracy": 0.768803533166647, "num_tokens": 123986805.0, "step": 3885 }, { "entropy": 0.9249139949679375, "epoch": 0.3575367594205899, "grad_norm": 0.17148295044898987, "learning_rate": 8.808538043978287e-05, "loss": 0.9372, "mean_token_accuracy": 0.7280000746250153, "num_tokens": 124018612.0, "step": 3886 }, { "entropy": 0.7964979894459248, "epoch": 0.3576287657920311, "grad_norm": 0.16349273920059204, "learning_rate": 8.808231361364124e-05, "loss": 0.8081, "mean_token_accuracy": 0.7727683857083321, "num_tokens": 124051273.0, "step": 3887 }, { "entropy": 0.796128373593092, "epoch": 0.3577207721634723, "grad_norm": 0.15822678804397583, "learning_rate": 8.807924678749962e-05, "loss": 0.811, "mean_token_accuracy": 0.7639848366379738, "num_tokens": 124082442.0, "step": 3888 }, { "entropy": 0.7782258950173855, "epoch": 0.35781277853491356, "grad_norm": 0.15417996048927307, "learning_rate": 8.807617996135799e-05, "loss": 0.7559, "mean_token_accuracy": 0.7748013138771057, "num_tokens": 124114362.0, "step": 3889 }, { "entropy": 0.8669955376535654, "epoch": 0.35790478490635474, "grad_norm": 0.16038070619106293, "learning_rate": 8.807311313521637e-05, "loss": 0.855, "mean_token_accuracy": 0.7517752014100552, "num_tokens": 124146281.0, "step": 3890 }, { "entropy": 0.7577128857374191, "epoch": 0.357996791277796, "grad_norm": 0.17040887475013733, "learning_rate": 8.807004630907474e-05, "loss": 0.7998, "mean_token_accuracy": 0.7744840122759342, "num_tokens": 124177762.0, "step": 3891 }, { "entropy": 0.8198418319225311, "epoch": 0.35808879764923723, "grad_norm": 0.16359855234622955, "learning_rate": 8.806697948293312e-05, "loss": 0.8245, "mean_token_accuracy": 0.76328269764781, "num_tokens": 124210167.0, "step": 3892 }, { "entropy": 0.86313746124506, "epoch": 0.3581808040206784, "grad_norm": 0.1609724909067154, "learning_rate": 8.806391265679149e-05, "loss": 0.8447, "mean_token_accuracy": 0.7559772469103336, "num_tokens": 124242324.0, "step": 3893 }, { "entropy": 0.7952889911830425, "epoch": 0.35827281039211967, "grad_norm": 0.15515241026878357, "learning_rate": 8.806084583064986e-05, "loss": 0.8028, "mean_token_accuracy": 0.7700570374727249, "num_tokens": 124273940.0, "step": 3894 }, { "entropy": 0.940202422440052, "epoch": 0.35836481676356086, "grad_norm": 0.16045069694519043, "learning_rate": 8.805777900450824e-05, "loss": 0.9076, "mean_token_accuracy": 0.7395432963967323, "num_tokens": 124305789.0, "step": 3895 }, { "entropy": 0.8102720454335213, "epoch": 0.3584568231350021, "grad_norm": 0.1565655618906021, "learning_rate": 8.805471217836662e-05, "loss": 0.7943, "mean_token_accuracy": 0.7699993923306465, "num_tokens": 124337794.0, "step": 3896 }, { "entropy": 0.7866607028990984, "epoch": 0.35854882950644335, "grad_norm": 0.151796355843544, "learning_rate": 8.805164535222499e-05, "loss": 0.7759, "mean_token_accuracy": 0.7778375521302223, "num_tokens": 124370175.0, "step": 3897 }, { "entropy": 0.801344882696867, "epoch": 0.35864083587788453, "grad_norm": 0.15756016969680786, "learning_rate": 8.804857852608336e-05, "loss": 0.7836, "mean_token_accuracy": 0.7658494152128696, "num_tokens": 124401377.0, "step": 3898 }, { "entropy": 0.8224347587674856, "epoch": 0.3587328422493258, "grad_norm": 0.15886300802230835, "learning_rate": 8.804551169994172e-05, "loss": 0.8198, "mean_token_accuracy": 0.7680549398064613, "num_tokens": 124433353.0, "step": 3899 }, { "entropy": 0.8984981868416071, "epoch": 0.35882484862076697, "grad_norm": 0.15991607308387756, "learning_rate": 8.80424448738001e-05, "loss": 0.8956, "mean_token_accuracy": 0.7433252744376659, "num_tokens": 124465256.0, "step": 3900 }, { "entropy": 0.7627375181764364, "epoch": 0.3589168549922082, "grad_norm": 0.15654291212558746, "learning_rate": 8.803937804765849e-05, "loss": 0.7695, "mean_token_accuracy": 0.7747605852782726, "num_tokens": 124497419.0, "step": 3901 }, { "entropy": 0.7430278845131397, "epoch": 0.35900886136364946, "grad_norm": 0.15730933845043182, "learning_rate": 8.803631122151686e-05, "loss": 0.755, "mean_token_accuracy": 0.78126260638237, "num_tokens": 124528769.0, "step": 3902 }, { "entropy": 0.8074232116341591, "epoch": 0.35910086773509065, "grad_norm": 0.15854749083518982, "learning_rate": 8.803324439537522e-05, "loss": 0.8018, "mean_token_accuracy": 0.7708847932517529, "num_tokens": 124561307.0, "step": 3903 }, { "entropy": 0.8033623434603214, "epoch": 0.3591928741065319, "grad_norm": 0.15735717117786407, "learning_rate": 8.80301775692336e-05, "loss": 0.8017, "mean_token_accuracy": 0.7675640843808651, "num_tokens": 124592157.0, "step": 3904 }, { "entropy": 0.8066165074706078, "epoch": 0.3592848804779731, "grad_norm": 0.16374117136001587, "learning_rate": 8.802711074309197e-05, "loss": 0.8116, "mean_token_accuracy": 0.7675763368606567, "num_tokens": 124622971.0, "step": 3905 }, { "entropy": 0.9393394850194454, "epoch": 0.3593768868494143, "grad_norm": 0.16438381373882294, "learning_rate": 8.802404391695035e-05, "loss": 0.9208, "mean_token_accuracy": 0.7313060648739338, "num_tokens": 124653666.0, "step": 3906 }, { "entropy": 0.7653329968452454, "epoch": 0.35946889322085557, "grad_norm": 0.16432248055934906, "learning_rate": 8.802097709080874e-05, "loss": 0.7749, "mean_token_accuracy": 0.7779832072556019, "num_tokens": 124685469.0, "step": 3907 }, { "entropy": 0.8396038506180048, "epoch": 0.35956089959229676, "grad_norm": 0.16249480843544006, "learning_rate": 8.80179102646671e-05, "loss": 0.8398, "mean_token_accuracy": 0.7613067664206028, "num_tokens": 124717883.0, "step": 3908 }, { "entropy": 0.7555494364351034, "epoch": 0.359652905963738, "grad_norm": 0.16898347437381744, "learning_rate": 8.801484343852547e-05, "loss": 0.7368, "mean_token_accuracy": 0.788006916642189, "num_tokens": 124750111.0, "step": 3909 }, { "entropy": 0.8156967554241419, "epoch": 0.3597449123351792, "grad_norm": 0.15486498177051544, "learning_rate": 8.801177661238384e-05, "loss": 0.8174, "mean_token_accuracy": 0.7583503127098083, "num_tokens": 124782306.0, "step": 3910 }, { "entropy": 0.9148455001413822, "epoch": 0.35983691870662043, "grad_norm": 0.16240434348583221, "learning_rate": 8.800870978624222e-05, "loss": 0.9198, "mean_token_accuracy": 0.7346030212938786, "num_tokens": 124814314.0, "step": 3911 }, { "entropy": 0.9388261139392853, "epoch": 0.3599289250780617, "grad_norm": 0.16559064388275146, "learning_rate": 8.80056429601006e-05, "loss": 0.9354, "mean_token_accuracy": 0.7375219129025936, "num_tokens": 124846811.0, "step": 3912 }, { "entropy": 0.7667678259313107, "epoch": 0.36002093144950287, "grad_norm": 0.15229028463363647, "learning_rate": 8.800257613395897e-05, "loss": 0.7445, "mean_token_accuracy": 0.7842138111591339, "num_tokens": 124879173.0, "step": 3913 }, { "entropy": 0.8321407083421946, "epoch": 0.3601129378209441, "grad_norm": 0.15666262805461884, "learning_rate": 8.799950930781734e-05, "loss": 0.8269, "mean_token_accuracy": 0.761312622576952, "num_tokens": 124910689.0, "step": 3914 }, { "entropy": 0.780284620821476, "epoch": 0.3602049441923853, "grad_norm": 0.1554214209318161, "learning_rate": 8.799644248167572e-05, "loss": 0.7777, "mean_token_accuracy": 0.7717700116336346, "num_tokens": 124942732.0, "step": 3915 }, { "entropy": 0.8708509281277657, "epoch": 0.36029695056382655, "grad_norm": 0.1620628982782364, "learning_rate": 8.79933756555341e-05, "loss": 0.8584, "mean_token_accuracy": 0.754249669611454, "num_tokens": 124974619.0, "step": 3916 }, { "entropy": 0.7729030977934599, "epoch": 0.3603889569352678, "grad_norm": 0.15657636523246765, "learning_rate": 8.799030882939247e-05, "loss": 0.7458, "mean_token_accuracy": 0.7769762426614761, "num_tokens": 125006406.0, "step": 3917 }, { "entropy": 0.8477798067033291, "epoch": 0.360480963306709, "grad_norm": 0.16162627935409546, "learning_rate": 8.798724200325084e-05, "loss": 0.8458, "mean_token_accuracy": 0.7513680122792721, "num_tokens": 125038542.0, "step": 3918 }, { "entropy": 0.7371966652572155, "epoch": 0.3605729696781502, "grad_norm": 0.1564147174358368, "learning_rate": 8.798417517710922e-05, "loss": 0.7367, "mean_token_accuracy": 0.7833664864301682, "num_tokens": 125070421.0, "step": 3919 }, { "entropy": 0.8346356470137835, "epoch": 0.3606649760495914, "grad_norm": 0.1642010509967804, "learning_rate": 8.798110835096759e-05, "loss": 0.8358, "mean_token_accuracy": 0.7585852891206741, "num_tokens": 125102183.0, "step": 3920 }, { "entropy": 0.8888987563550472, "epoch": 0.36075698242103266, "grad_norm": 0.16706115007400513, "learning_rate": 8.797804152482597e-05, "loss": 0.8763, "mean_token_accuracy": 0.7465973943471909, "num_tokens": 125134094.0, "step": 3921 }, { "entropy": 0.9197887722402811, "epoch": 0.3608489887924739, "grad_norm": 0.1648307889699936, "learning_rate": 8.797497469868433e-05, "loss": 0.9441, "mean_token_accuracy": 0.7328496798872948, "num_tokens": 125166251.0, "step": 3922 }, { "entropy": 0.8836282007396221, "epoch": 0.3609409951639151, "grad_norm": 0.1686035692691803, "learning_rate": 8.797190787254272e-05, "loss": 0.9052, "mean_token_accuracy": 0.7436863221228123, "num_tokens": 125198335.0, "step": 3923 }, { "entropy": 0.8349615186452866, "epoch": 0.36103300153535633, "grad_norm": 0.16657571494579315, "learning_rate": 8.796884104640108e-05, "loss": 0.8446, "mean_token_accuracy": 0.7593650966882706, "num_tokens": 125230139.0, "step": 3924 }, { "entropy": 0.8277018461376429, "epoch": 0.3611250079067975, "grad_norm": 0.16189897060394287, "learning_rate": 8.796577422025945e-05, "loss": 0.8236, "mean_token_accuracy": 0.7625271864235401, "num_tokens": 125262768.0, "step": 3925 }, { "entropy": 0.8756210319697857, "epoch": 0.36121701427823877, "grad_norm": 0.15879683196544647, "learning_rate": 8.796270739411783e-05, "loss": 0.8579, "mean_token_accuracy": 0.7462161593139172, "num_tokens": 125294643.0, "step": 3926 }, { "entropy": 0.9656876921653748, "epoch": 0.36130902064968, "grad_norm": 0.16486388444900513, "learning_rate": 8.795964056797621e-05, "loss": 0.9699, "mean_token_accuracy": 0.7253120057284832, "num_tokens": 125326840.0, "step": 3927 }, { "entropy": 0.7841836679726839, "epoch": 0.3614010270211212, "grad_norm": 0.15575851500034332, "learning_rate": 8.795657374183458e-05, "loss": 0.7454, "mean_token_accuracy": 0.7858451344072819, "num_tokens": 125359608.0, "step": 3928 }, { "entropy": 0.8185913413763046, "epoch": 0.36149303339256245, "grad_norm": 0.15726853907108307, "learning_rate": 8.795350691569295e-05, "loss": 0.8027, "mean_token_accuracy": 0.768819946795702, "num_tokens": 125391571.0, "step": 3929 }, { "entropy": 0.7729168515652418, "epoch": 0.36158503976400364, "grad_norm": 0.1511806845664978, "learning_rate": 8.795044008955132e-05, "loss": 0.7349, "mean_token_accuracy": 0.7809696346521378, "num_tokens": 125423060.0, "step": 3930 }, { "entropy": 0.8200077526271343, "epoch": 0.3616770461354449, "grad_norm": 0.1585727035999298, "learning_rate": 8.79473732634097e-05, "loss": 0.8081, "mean_token_accuracy": 0.7627638094127178, "num_tokens": 125454612.0, "step": 3931 }, { "entropy": 0.7184287458658218, "epoch": 0.3617690525068861, "grad_norm": 0.14674459397792816, "learning_rate": 8.794430643726808e-05, "loss": 0.702, "mean_token_accuracy": 0.7920012101531029, "num_tokens": 125486775.0, "step": 3932 }, { "entropy": 0.8477559015154839, "epoch": 0.3618610588783273, "grad_norm": 0.16182146966457367, "learning_rate": 8.794123961112645e-05, "loss": 0.8177, "mean_token_accuracy": 0.7663889527320862, "num_tokens": 125518723.0, "step": 3933 }, { "entropy": 0.8465719986706972, "epoch": 0.36195306524976856, "grad_norm": 0.16571323573589325, "learning_rate": 8.793817278498482e-05, "loss": 0.8556, "mean_token_accuracy": 0.7529676929116249, "num_tokens": 125549456.0, "step": 3934 }, { "entropy": 0.7466309480369091, "epoch": 0.36204507162120975, "grad_norm": 0.150594100356102, "learning_rate": 8.79351059588432e-05, "loss": 0.7284, "mean_token_accuracy": 0.7877485118806362, "num_tokens": 125582143.0, "step": 3935 }, { "entropy": 0.8676666375249624, "epoch": 0.362137077992651, "grad_norm": 0.16373896598815918, "learning_rate": 8.793203913270157e-05, "loss": 0.8734, "mean_token_accuracy": 0.7454674988985062, "num_tokens": 125613750.0, "step": 3936 }, { "entropy": 0.9189652651548386, "epoch": 0.36222908436409224, "grad_norm": 0.16698110103607178, "learning_rate": 8.792897230655995e-05, "loss": 0.9151, "mean_token_accuracy": 0.7379536181688309, "num_tokens": 125645553.0, "step": 3937 }, { "entropy": 0.7178536970168352, "epoch": 0.3623210907355334, "grad_norm": 0.167508065700531, "learning_rate": 8.792590548041833e-05, "loss": 0.7409, "mean_token_accuracy": 0.7878397069871426, "num_tokens": 125677254.0, "step": 3938 }, { "entropy": 0.8730999324470758, "epoch": 0.36241309710697467, "grad_norm": 0.16966745257377625, "learning_rate": 8.79228386542767e-05, "loss": 0.8889, "mean_token_accuracy": 0.7526889853179455, "num_tokens": 125708894.0, "step": 3939 }, { "entropy": 0.8305307254195213, "epoch": 0.36250510347841586, "grad_norm": 0.159025639295578, "learning_rate": 8.791977182813506e-05, "loss": 0.81, "mean_token_accuracy": 0.769099909812212, "num_tokens": 125740978.0, "step": 3940 }, { "entropy": 0.8325799237936735, "epoch": 0.3625971098498571, "grad_norm": 0.16129015386104584, "learning_rate": 8.791670500199343e-05, "loss": 0.8121, "mean_token_accuracy": 0.7699800878763199, "num_tokens": 125773383.0, "step": 3941 }, { "entropy": 0.9553064852952957, "epoch": 0.36268911622129835, "grad_norm": 0.17063377797603607, "learning_rate": 8.791363817585181e-05, "loss": 0.9643, "mean_token_accuracy": 0.7318258956074715, "num_tokens": 125804558.0, "step": 3942 }, { "entropy": 0.8225627057254314, "epoch": 0.36278112259273954, "grad_norm": 0.1564221829175949, "learning_rate": 8.79105713497102e-05, "loss": 0.8056, "mean_token_accuracy": 0.7677732706069946, "num_tokens": 125836794.0, "step": 3943 }, { "entropy": 0.7901673689484596, "epoch": 0.3628731289641808, "grad_norm": 0.15048852562904358, "learning_rate": 8.790750452356856e-05, "loss": 0.7853, "mean_token_accuracy": 0.7678054869174957, "num_tokens": 125868898.0, "step": 3944 }, { "entropy": 0.8572925068438053, "epoch": 0.36296513533562197, "grad_norm": 0.16412808001041412, "learning_rate": 8.790443769742693e-05, "loss": 0.8439, "mean_token_accuracy": 0.757486741989851, "num_tokens": 125900491.0, "step": 3945 }, { "entropy": 0.7537161912769079, "epoch": 0.3630571417070632, "grad_norm": 0.15849816799163818, "learning_rate": 8.790137087128531e-05, "loss": 0.7301, "mean_token_accuracy": 0.7860838137567043, "num_tokens": 125932702.0, "step": 3946 }, { "entropy": 0.9456305727362633, "epoch": 0.36314914807850446, "grad_norm": 0.1698368936777115, "learning_rate": 8.789830404514368e-05, "loss": 0.9381, "mean_token_accuracy": 0.7337273880839348, "num_tokens": 125965020.0, "step": 3947 }, { "entropy": 0.8197853267192841, "epoch": 0.36324115444994565, "grad_norm": 0.16335085034370422, "learning_rate": 8.789523721900206e-05, "loss": 0.8146, "mean_token_accuracy": 0.759614210575819, "num_tokens": 125997344.0, "step": 3948 }, { "entropy": 0.8169116992503405, "epoch": 0.3633331608213869, "grad_norm": 0.16037850081920624, "learning_rate": 8.789217039286043e-05, "loss": 0.7995, "mean_token_accuracy": 0.7629402875900269, "num_tokens": 126028927.0, "step": 3949 }, { "entropy": 0.8202864974737167, "epoch": 0.3634251671928281, "grad_norm": 0.15603046119213104, "learning_rate": 8.788910356671881e-05, "loss": 0.7842, "mean_token_accuracy": 0.773261521011591, "num_tokens": 126061370.0, "step": 3950 }, { "entropy": 0.8240732736885548, "epoch": 0.3635171735642693, "grad_norm": 0.1645958572626114, "learning_rate": 8.788603674057718e-05, "loss": 0.8335, "mean_token_accuracy": 0.7601423002779484, "num_tokens": 126092818.0, "step": 3951 }, { "entropy": 0.8019191082566977, "epoch": 0.36360917993571057, "grad_norm": 0.16038531064987183, "learning_rate": 8.788296991443555e-05, "loss": 0.7995, "mean_token_accuracy": 0.7665547505021095, "num_tokens": 126124289.0, "step": 3952 }, { "entropy": 0.7882400881499052, "epoch": 0.36370118630715176, "grad_norm": 0.16171714663505554, "learning_rate": 8.787990308829393e-05, "loss": 0.783, "mean_token_accuracy": 0.7690963633358479, "num_tokens": 126155923.0, "step": 3953 }, { "entropy": 0.8058025501668453, "epoch": 0.363793192678593, "grad_norm": 0.16676580905914307, "learning_rate": 8.787683626215231e-05, "loss": 0.808, "mean_token_accuracy": 0.7621057629585266, "num_tokens": 126187428.0, "step": 3954 }, { "entropy": 0.8515272736549377, "epoch": 0.3638851990500342, "grad_norm": 0.15875963866710663, "learning_rate": 8.787376943601068e-05, "loss": 0.8405, "mean_token_accuracy": 0.7587184645235538, "num_tokens": 126218977.0, "step": 3955 }, { "entropy": 0.8993930593132973, "epoch": 0.36397720542147544, "grad_norm": 0.16499730944633484, "learning_rate": 8.787070260986905e-05, "loss": 0.9121, "mean_token_accuracy": 0.7398312650620937, "num_tokens": 126250850.0, "step": 3956 }, { "entropy": 0.7586094569414854, "epoch": 0.3640692117929167, "grad_norm": 0.15172486007213593, "learning_rate": 8.786763578372741e-05, "loss": 0.7267, "mean_token_accuracy": 0.7871798798441887, "num_tokens": 126282869.0, "step": 3957 }, { "entropy": 0.7427377291023731, "epoch": 0.36416121816435787, "grad_norm": 0.14413316547870636, "learning_rate": 8.786456895758581e-05, "loss": 0.7007, "mean_token_accuracy": 0.7948445379734039, "num_tokens": 126315548.0, "step": 3958 }, { "entropy": 0.8012926578521729, "epoch": 0.3642532245357991, "grad_norm": 0.15583916008472443, "learning_rate": 8.786150213144418e-05, "loss": 0.7905, "mean_token_accuracy": 0.7709271162748337, "num_tokens": 126347545.0, "step": 3959 }, { "entropy": 0.8470191173255444, "epoch": 0.3643452309072403, "grad_norm": 0.16612376272678375, "learning_rate": 8.785843530530254e-05, "loss": 0.8501, "mean_token_accuracy": 0.755960077047348, "num_tokens": 126379241.0, "step": 3960 }, { "entropy": 0.7395764514803886, "epoch": 0.36443723727868155, "grad_norm": 0.15470241010189056, "learning_rate": 8.785536847916091e-05, "loss": 0.7253, "mean_token_accuracy": 0.7868499495089054, "num_tokens": 126411472.0, "step": 3961 }, { "entropy": 0.809343047440052, "epoch": 0.3645292436501228, "grad_norm": 0.15722091495990753, "learning_rate": 8.78523016530193e-05, "loss": 0.8171, "mean_token_accuracy": 0.7633778229355812, "num_tokens": 126443427.0, "step": 3962 }, { "entropy": 0.8436812609434128, "epoch": 0.364621250021564, "grad_norm": 0.16498376429080963, "learning_rate": 8.784923482687768e-05, "loss": 0.8499, "mean_token_accuracy": 0.7517563626170158, "num_tokens": 126474651.0, "step": 3963 }, { "entropy": 0.9015608504414558, "epoch": 0.3647132563930052, "grad_norm": 0.17126184701919556, "learning_rate": 8.784616800073604e-05, "loss": 0.9344, "mean_token_accuracy": 0.7349385879933834, "num_tokens": 126506396.0, "step": 3964 }, { "entropy": 0.7757081352174282, "epoch": 0.3648052627644464, "grad_norm": 0.1657913327217102, "learning_rate": 8.784310117459441e-05, "loss": 0.7953, "mean_token_accuracy": 0.7697840556502342, "num_tokens": 126538769.0, "step": 3965 }, { "entropy": 0.7408387679606676, "epoch": 0.36489726913588766, "grad_norm": 0.15644589066505432, "learning_rate": 8.784003434845279e-05, "loss": 0.76, "mean_token_accuracy": 0.7812956683337688, "num_tokens": 126570321.0, "step": 3966 }, { "entropy": 0.823700338602066, "epoch": 0.3649892755073289, "grad_norm": 0.16799326241016388, "learning_rate": 8.783696752231116e-05, "loss": 0.8351, "mean_token_accuracy": 0.7561098225414753, "num_tokens": 126601834.0, "step": 3967 }, { "entropy": 0.7160749975591898, "epoch": 0.3650812818787701, "grad_norm": 0.15595506131649017, "learning_rate": 8.783390069616954e-05, "loss": 0.7048, "mean_token_accuracy": 0.7934368662536144, "num_tokens": 126634090.0, "step": 3968 }, { "entropy": 0.8422998264431953, "epoch": 0.36517328825021134, "grad_norm": 0.15621601045131683, "learning_rate": 8.783083387002792e-05, "loss": 0.8249, "mean_token_accuracy": 0.7626119032502174, "num_tokens": 126665980.0, "step": 3969 }, { "entropy": 0.878008397296071, "epoch": 0.3652652946216525, "grad_norm": 0.16343845427036285, "learning_rate": 8.782776704388629e-05, "loss": 0.8551, "mean_token_accuracy": 0.7508497163653374, "num_tokens": 126697776.0, "step": 3970 }, { "entropy": 0.9104081317782402, "epoch": 0.36535730099309377, "grad_norm": 0.16033856570720673, "learning_rate": 8.782470021774466e-05, "loss": 0.8971, "mean_token_accuracy": 0.7445614337921143, "num_tokens": 126729802.0, "step": 3971 }, { "entropy": 0.8272992968559265, "epoch": 0.365449307364535, "grad_norm": 0.155325785279274, "learning_rate": 8.782163339160303e-05, "loss": 0.7941, "mean_token_accuracy": 0.7666210010647774, "num_tokens": 126762440.0, "step": 3972 }, { "entropy": 0.7247307449579239, "epoch": 0.3655413137359762, "grad_norm": 0.1501549780368805, "learning_rate": 8.781856656546141e-05, "loss": 0.696, "mean_token_accuracy": 0.7925325185060501, "num_tokens": 126794861.0, "step": 3973 }, { "entropy": 0.7979334183037281, "epoch": 0.36563332010741745, "grad_norm": 0.15051423013210297, "learning_rate": 8.781549973931979e-05, "loss": 0.7793, "mean_token_accuracy": 0.7690415419638157, "num_tokens": 126826604.0, "step": 3974 }, { "entropy": 0.7382467985153198, "epoch": 0.36572532647885864, "grad_norm": 0.15750713646411896, "learning_rate": 8.781243291317816e-05, "loss": 0.7169, "mean_token_accuracy": 0.7872474640607834, "num_tokens": 126858529.0, "step": 3975 }, { "entropy": 0.7818368002772331, "epoch": 0.3658173328502999, "grad_norm": 0.16557520627975464, "learning_rate": 8.780936608703653e-05, "loss": 0.8038, "mean_token_accuracy": 0.7699749544262886, "num_tokens": 126890646.0, "step": 3976 }, { "entropy": 0.8099629506468773, "epoch": 0.3659093392217411, "grad_norm": 0.15552173554897308, "learning_rate": 8.78062992608949e-05, "loss": 0.808, "mean_token_accuracy": 0.764776561409235, "num_tokens": 126922944.0, "step": 3977 }, { "entropy": 0.8389763571321964, "epoch": 0.3660013455931823, "grad_norm": 0.15744782984256744, "learning_rate": 8.780323243475327e-05, "loss": 0.8621, "mean_token_accuracy": 0.7532774657011032, "num_tokens": 126954828.0, "step": 3978 }, { "entropy": 0.8193764463067055, "epoch": 0.36609335196462356, "grad_norm": 0.15994690358638763, "learning_rate": 8.780016560861166e-05, "loss": 0.8192, "mean_token_accuracy": 0.7667301334440708, "num_tokens": 126986460.0, "step": 3979 }, { "entropy": 0.8306416347622871, "epoch": 0.36618535833606475, "grad_norm": 0.16626794636249542, "learning_rate": 8.779709878247002e-05, "loss": 0.8176, "mean_token_accuracy": 0.7676108665764332, "num_tokens": 127018125.0, "step": 3980 }, { "entropy": 0.718898693099618, "epoch": 0.366277364707506, "grad_norm": 0.15648889541625977, "learning_rate": 8.77940319563284e-05, "loss": 0.7225, "mean_token_accuracy": 0.7873343080282211, "num_tokens": 127050600.0, "step": 3981 }, { "entropy": 0.869388910010457, "epoch": 0.36636937107894724, "grad_norm": 0.16109953820705414, "learning_rate": 8.779096513018677e-05, "loss": 0.8832, "mean_token_accuracy": 0.7451267875730991, "num_tokens": 127082711.0, "step": 3982 }, { "entropy": 0.8967003263533115, "epoch": 0.3664613774503884, "grad_norm": 0.16389314830303192, "learning_rate": 8.778789830404514e-05, "loss": 0.9057, "mean_token_accuracy": 0.7395916543900967, "num_tokens": 127114932.0, "step": 3983 }, { "entropy": 0.8233585972338915, "epoch": 0.36655338382182967, "grad_norm": 0.15947499871253967, "learning_rate": 8.778483147790352e-05, "loss": 0.8254, "mean_token_accuracy": 0.7592307440936565, "num_tokens": 127146555.0, "step": 3984 }, { "entropy": 0.7994773034006357, "epoch": 0.36664539019327086, "grad_norm": 0.15546394884586334, "learning_rate": 8.77817646517619e-05, "loss": 0.7905, "mean_token_accuracy": 0.7716978900134563, "num_tokens": 127178469.0, "step": 3985 }, { "entropy": 0.9335198998451233, "epoch": 0.3667373965647121, "grad_norm": 0.17434845864772797, "learning_rate": 8.777869782562027e-05, "loss": 0.9371, "mean_token_accuracy": 0.7312613315880299, "num_tokens": 127210279.0, "step": 3986 }, { "entropy": 0.7934442572295666, "epoch": 0.36682940293615335, "grad_norm": 0.15891015529632568, "learning_rate": 8.777563099947864e-05, "loss": 0.7809, "mean_token_accuracy": 0.7739532068371773, "num_tokens": 127242107.0, "step": 3987 }, { "entropy": 0.7143493182957172, "epoch": 0.36692140930759454, "grad_norm": 0.15759994089603424, "learning_rate": 8.777256417333701e-05, "loss": 0.7157, "mean_token_accuracy": 0.7911524772644043, "num_tokens": 127274641.0, "step": 3988 }, { "entropy": 0.9847908318042755, "epoch": 0.3670134156790358, "grad_norm": 0.16522352397441864, "learning_rate": 8.776949734719539e-05, "loss": 0.9801, "mean_token_accuracy": 0.7210739701986313, "num_tokens": 127306222.0, "step": 3989 }, { "entropy": 0.9107610248029232, "epoch": 0.36710542205047697, "grad_norm": 0.1608375608921051, "learning_rate": 8.776643052105377e-05, "loss": 0.8852, "mean_token_accuracy": 0.7426093928515911, "num_tokens": 127337701.0, "step": 3990 }, { "entropy": 0.7996920589357615, "epoch": 0.3671974284219182, "grad_norm": 0.15838110446929932, "learning_rate": 8.776336369491214e-05, "loss": 0.7875, "mean_token_accuracy": 0.7726570926606655, "num_tokens": 127369039.0, "step": 3991 }, { "entropy": 0.8674283102154732, "epoch": 0.36728943479335946, "grad_norm": 0.1606183499097824, "learning_rate": 8.77602968687705e-05, "loss": 0.8405, "mean_token_accuracy": 0.7546040713787079, "num_tokens": 127400843.0, "step": 3992 }, { "entropy": 0.8670284189283848, "epoch": 0.36738144116480065, "grad_norm": 0.15672333538532257, "learning_rate": 8.775723004262889e-05, "loss": 0.8523, "mean_token_accuracy": 0.7539434768259525, "num_tokens": 127432932.0, "step": 3993 }, { "entropy": 0.7564631029963493, "epoch": 0.3674734475362419, "grad_norm": 0.15088997781276703, "learning_rate": 8.775416321648726e-05, "loss": 0.7455, "mean_token_accuracy": 0.7808534018695354, "num_tokens": 127465000.0, "step": 3994 }, { "entropy": 0.8203088920563459, "epoch": 0.3675654539076831, "grad_norm": 0.16415101289749146, "learning_rate": 8.775109639034564e-05, "loss": 0.7948, "mean_token_accuracy": 0.7714958898723125, "num_tokens": 127497242.0, "step": 3995 }, { "entropy": 0.7931037582457066, "epoch": 0.3676574602791243, "grad_norm": 0.15285944938659668, "learning_rate": 8.7748029564204e-05, "loss": 0.7765, "mean_token_accuracy": 0.7756114676594734, "num_tokens": 127529318.0, "step": 3996 }, { "entropy": 0.8569008558988571, "epoch": 0.36774946665056557, "grad_norm": 0.16136768460273743, "learning_rate": 8.774496273806239e-05, "loss": 0.8375, "mean_token_accuracy": 0.7565362527966499, "num_tokens": 127561303.0, "step": 3997 }, { "entropy": 0.7986241858452559, "epoch": 0.36784147302200676, "grad_norm": 0.1587868183851242, "learning_rate": 8.774189591192075e-05, "loss": 0.7913, "mean_token_accuracy": 0.7689219899475574, "num_tokens": 127593097.0, "step": 3998 }, { "entropy": 0.7245506383478642, "epoch": 0.367933479393448, "grad_norm": 0.15149961411952972, "learning_rate": 8.773882908577912e-05, "loss": 0.7239, "mean_token_accuracy": 0.788293082267046, "num_tokens": 127625798.0, "step": 3999 }, { "entropy": 0.8654173016548157, "epoch": 0.3680254857648892, "grad_norm": 0.15878471732139587, "learning_rate": 8.773576225963752e-05, "loss": 0.8551, "mean_token_accuracy": 0.7552462667226791, "num_tokens": 127658194.0, "step": 4000 }, { "entropy": 0.7779717836529016, "epoch": 0.36811749213633044, "grad_norm": 0.1533113718032837, "learning_rate": 8.773269543349588e-05, "loss": 0.7801, "mean_token_accuracy": 0.7666694782674313, "num_tokens": 127690644.0, "step": 4001 }, { "entropy": 0.7450078669935465, "epoch": 0.3682094985077717, "grad_norm": 0.15874242782592773, "learning_rate": 8.772962860735425e-05, "loss": 0.7569, "mean_token_accuracy": 0.7733174934983253, "num_tokens": 127722383.0, "step": 4002 }, { "entropy": 0.6911590807139874, "epoch": 0.36830150487921287, "grad_norm": 0.15282335877418518, "learning_rate": 8.772656178121262e-05, "loss": 0.6841, "mean_token_accuracy": 0.7981752380728722, "num_tokens": 127753886.0, "step": 4003 }, { "entropy": 0.8482338935136795, "epoch": 0.3683935112506541, "grad_norm": 0.16023407876491547, "learning_rate": 8.7723494955071e-05, "loss": 0.8472, "mean_token_accuracy": 0.755078986287117, "num_tokens": 127785918.0, "step": 4004 }, { "entropy": 0.8032221049070358, "epoch": 0.3684855176220953, "grad_norm": 0.15738379955291748, "learning_rate": 8.772042812892938e-05, "loss": 0.8047, "mean_token_accuracy": 0.7723706886172295, "num_tokens": 127818366.0, "step": 4005 }, { "entropy": 0.8651530556380749, "epoch": 0.36857752399353655, "grad_norm": 0.15708884596824646, "learning_rate": 8.771736130278775e-05, "loss": 0.8632, "mean_token_accuracy": 0.7486366629600525, "num_tokens": 127850486.0, "step": 4006 }, { "entropy": 0.8502090573310852, "epoch": 0.3686695303649778, "grad_norm": 0.16579410433769226, "learning_rate": 8.771429447664612e-05, "loss": 0.8598, "mean_token_accuracy": 0.7554258592426777, "num_tokens": 127882393.0, "step": 4007 }, { "entropy": 0.7623420301824808, "epoch": 0.368761536736419, "grad_norm": 0.15064069628715515, "learning_rate": 8.77112276505045e-05, "loss": 0.7571, "mean_token_accuracy": 0.7771819941699505, "num_tokens": 127914420.0, "step": 4008 }, { "entropy": 0.8391737416386604, "epoch": 0.3688535431078602, "grad_norm": 0.16334427893161774, "learning_rate": 8.770816082436287e-05, "loss": 0.8239, "mean_token_accuracy": 0.7609596252441406, "num_tokens": 127945892.0, "step": 4009 }, { "entropy": 0.8878744626417756, "epoch": 0.3689455494793014, "grad_norm": 0.1660335808992386, "learning_rate": 8.770509399822125e-05, "loss": 0.9009, "mean_token_accuracy": 0.7421878166496754, "num_tokens": 127977653.0, "step": 4010 }, { "entropy": 0.7658708207309246, "epoch": 0.36903755585074266, "grad_norm": 0.16228044033050537, "learning_rate": 8.770202717207962e-05, "loss": 0.7656, "mean_token_accuracy": 0.7790641784667969, "num_tokens": 128009022.0, "step": 4011 }, { "entropy": 0.7853386066854, "epoch": 0.3691295622221839, "grad_norm": 0.15931721031665802, "learning_rate": 8.7698960345938e-05, "loss": 0.7884, "mean_token_accuracy": 0.7741252481937408, "num_tokens": 128041616.0, "step": 4012 }, { "entropy": 0.7896102704107761, "epoch": 0.3692215685936251, "grad_norm": 0.15250766277313232, "learning_rate": 8.769589351979637e-05, "loss": 0.7671, "mean_token_accuracy": 0.7794551067054272, "num_tokens": 128074164.0, "step": 4013 }, { "entropy": 0.7469721138477325, "epoch": 0.36931357496506634, "grad_norm": 0.1566646695137024, "learning_rate": 8.769282669365473e-05, "loss": 0.7453, "mean_token_accuracy": 0.7817753031849861, "num_tokens": 128106079.0, "step": 4014 }, { "entropy": 0.8360635489225388, "epoch": 0.3694055813365075, "grad_norm": 0.16115272045135498, "learning_rate": 8.768975986751312e-05, "loss": 0.8414, "mean_token_accuracy": 0.7564277201890945, "num_tokens": 128137997.0, "step": 4015 }, { "entropy": 0.7539717853069305, "epoch": 0.36949758770794877, "grad_norm": 0.1532340794801712, "learning_rate": 8.76866930413715e-05, "loss": 0.7451, "mean_token_accuracy": 0.7813410125672817, "num_tokens": 128170254.0, "step": 4016 }, { "entropy": 0.9055490382015705, "epoch": 0.36958959407939, "grad_norm": 0.16207289695739746, "learning_rate": 8.768362621522987e-05, "loss": 0.8968, "mean_token_accuracy": 0.7437637560069561, "num_tokens": 128202485.0, "step": 4017 }, { "entropy": 0.8353424854576588, "epoch": 0.3696816004508312, "grad_norm": 0.149844691157341, "learning_rate": 8.768055938908823e-05, "loss": 0.8274, "mean_token_accuracy": 0.7595871984958649, "num_tokens": 128235253.0, "step": 4018 }, { "entropy": 0.8888925313949585, "epoch": 0.36977360682227245, "grad_norm": 0.15933437645435333, "learning_rate": 8.76774925629466e-05, "loss": 0.8864, "mean_token_accuracy": 0.7479917407035828, "num_tokens": 128267834.0, "step": 4019 }, { "entropy": 0.7563181798905134, "epoch": 0.36986561319371364, "grad_norm": 0.15307094156742096, "learning_rate": 8.767442573680498e-05, "loss": 0.7473, "mean_token_accuracy": 0.7790490761399269, "num_tokens": 128299732.0, "step": 4020 }, { "entropy": 0.8869237434118986, "epoch": 0.3699576195651549, "grad_norm": 0.15517838299274445, "learning_rate": 8.767135891066336e-05, "loss": 0.8707, "mean_token_accuracy": 0.748052142560482, "num_tokens": 128331732.0, "step": 4021 }, { "entropy": 0.8880502562969923, "epoch": 0.3700496259365961, "grad_norm": 0.15705333650112152, "learning_rate": 8.766829208452173e-05, "loss": 0.8742, "mean_token_accuracy": 0.7486115619540215, "num_tokens": 128363700.0, "step": 4022 }, { "entropy": 0.8855895027518272, "epoch": 0.3701416323080373, "grad_norm": 0.16336467862129211, "learning_rate": 8.76652252583801e-05, "loss": 0.8584, "mean_token_accuracy": 0.7511954307556152, "num_tokens": 128395430.0, "step": 4023 }, { "entropy": 0.8445280641317368, "epoch": 0.37023363867947856, "grad_norm": 0.1615702211856842, "learning_rate": 8.766215843223848e-05, "loss": 0.8474, "mean_token_accuracy": 0.7495435066521168, "num_tokens": 128427698.0, "step": 4024 }, { "entropy": 0.9193143676966429, "epoch": 0.37032564505091975, "grad_norm": 0.15725642442703247, "learning_rate": 8.765909160609685e-05, "loss": 0.8861, "mean_token_accuracy": 0.7464327961206436, "num_tokens": 128459496.0, "step": 4025 }, { "entropy": 0.8091272823512554, "epoch": 0.370417651422361, "grad_norm": 0.15597863495349884, "learning_rate": 8.765602477995523e-05, "loss": 0.7801, "mean_token_accuracy": 0.7759860940277576, "num_tokens": 128491819.0, "step": 4026 }, { "entropy": 0.8476017266511917, "epoch": 0.37050965779380224, "grad_norm": 0.15518225729465485, "learning_rate": 8.76529579538136e-05, "loss": 0.8391, "mean_token_accuracy": 0.7567649781703949, "num_tokens": 128523932.0, "step": 4027 }, { "entropy": 0.7648209035396576, "epoch": 0.3706016641652434, "grad_norm": 0.16384844481945038, "learning_rate": 8.764989112767198e-05, "loss": 0.7787, "mean_token_accuracy": 0.7793871238827705, "num_tokens": 128555479.0, "step": 4028 }, { "entropy": 0.9359458573162556, "epoch": 0.37069367053668467, "grad_norm": 0.16910851001739502, "learning_rate": 8.764682430153035e-05, "loss": 0.9556, "mean_token_accuracy": 0.7247043922543526, "num_tokens": 128587309.0, "step": 4029 }, { "entropy": 0.7990800589323044, "epoch": 0.37078567690812586, "grad_norm": 0.15622714161872864, "learning_rate": 8.764375747538872e-05, "loss": 0.8078, "mean_token_accuracy": 0.7672034092247486, "num_tokens": 128619796.0, "step": 4030 }, { "entropy": 0.7223476376384497, "epoch": 0.3708776832795671, "grad_norm": 0.16829322278499603, "learning_rate": 8.76406906492471e-05, "loss": 0.7651, "mean_token_accuracy": 0.7796723172068596, "num_tokens": 128651508.0, "step": 4031 }, { "entropy": 0.7760967016220093, "epoch": 0.37096968965100835, "grad_norm": 0.16441710293293, "learning_rate": 8.763762382310548e-05, "loss": 0.7747, "mean_token_accuracy": 0.7797593213617802, "num_tokens": 128683821.0, "step": 4032 }, { "entropy": 0.7991883810609579, "epoch": 0.37106169602244954, "grad_norm": 0.15618565678596497, "learning_rate": 8.763455699696385e-05, "loss": 0.8029, "mean_token_accuracy": 0.7616725340485573, "num_tokens": 128715925.0, "step": 4033 }, { "entropy": 0.9622782878577709, "epoch": 0.3711537023938908, "grad_norm": 0.16306471824645996, "learning_rate": 8.763149017082221e-05, "loss": 0.9652, "mean_token_accuracy": 0.7311449497938156, "num_tokens": 128748672.0, "step": 4034 }, { "entropy": 0.8192069604992867, "epoch": 0.37124570876533197, "grad_norm": 0.1609363555908203, "learning_rate": 8.76284233446806e-05, "loss": 0.8274, "mean_token_accuracy": 0.7647753059864044, "num_tokens": 128781120.0, "step": 4035 }, { "entropy": 0.8471022918820381, "epoch": 0.3713377151367732, "grad_norm": 0.1613018810749054, "learning_rate": 8.762535651853898e-05, "loss": 0.8313, "mean_token_accuracy": 0.7602397464215755, "num_tokens": 128813401.0, "step": 4036 }, { "entropy": 0.7957539483904839, "epoch": 0.37142972150821446, "grad_norm": 0.16099482774734497, "learning_rate": 8.762228969239734e-05, "loss": 0.7833, "mean_token_accuracy": 0.7741830721497536, "num_tokens": 128845967.0, "step": 4037 }, { "entropy": 0.9150597043335438, "epoch": 0.37152172787965565, "grad_norm": 0.16377022862434387, "learning_rate": 8.761922286625571e-05, "loss": 0.9085, "mean_token_accuracy": 0.7403393052518368, "num_tokens": 128878248.0, "step": 4038 }, { "entropy": 0.790180642157793, "epoch": 0.3716137342510969, "grad_norm": 0.1547834873199463, "learning_rate": 8.76161560401141e-05, "loss": 0.7597, "mean_token_accuracy": 0.7792324088513851, "num_tokens": 128910046.0, "step": 4039 }, { "entropy": 0.9106619320809841, "epoch": 0.3717057406225381, "grad_norm": 0.15736722946166992, "learning_rate": 8.761308921397246e-05, "loss": 0.8997, "mean_token_accuracy": 0.7398835495114326, "num_tokens": 128942074.0, "step": 4040 }, { "entropy": 0.8467965796589851, "epoch": 0.37179774699397933, "grad_norm": 0.1559259444475174, "learning_rate": 8.761002238783084e-05, "loss": 0.8283, "mean_token_accuracy": 0.7607864290475845, "num_tokens": 128974162.0, "step": 4041 }, { "entropy": 0.8675916939973831, "epoch": 0.3718897533654206, "grad_norm": 0.15791144967079163, "learning_rate": 8.760695556168921e-05, "loss": 0.8659, "mean_token_accuracy": 0.7543719224631786, "num_tokens": 129006504.0, "step": 4042 }, { "entropy": 0.7775794602930546, "epoch": 0.37198175973686176, "grad_norm": 0.15330635011196136, "learning_rate": 8.760388873554759e-05, "loss": 0.7686, "mean_token_accuracy": 0.7757636941969395, "num_tokens": 129039151.0, "step": 4043 }, { "entropy": 0.8813570849597454, "epoch": 0.372073766108303, "grad_norm": 0.16003143787384033, "learning_rate": 8.760082190940596e-05, "loss": 0.8516, "mean_token_accuracy": 0.7550823129713535, "num_tokens": 129070276.0, "step": 4044 }, { "entropy": 0.8972842860966921, "epoch": 0.3721657724797442, "grad_norm": 0.16518156230449677, "learning_rate": 8.759775508326433e-05, "loss": 0.8962, "mean_token_accuracy": 0.7465511150658131, "num_tokens": 129102809.0, "step": 4045 }, { "entropy": 0.7625183276832104, "epoch": 0.37225777885118544, "grad_norm": 0.1548251062631607, "learning_rate": 8.759468825712271e-05, "loss": 0.7517, "mean_token_accuracy": 0.7774330303072929, "num_tokens": 129134453.0, "step": 4046 }, { "entropy": 0.7880821712315083, "epoch": 0.3723497852226267, "grad_norm": 0.16042819619178772, "learning_rate": 8.759162143098109e-05, "loss": 0.7721, "mean_token_accuracy": 0.7738635800778866, "num_tokens": 129165879.0, "step": 4047 }, { "entropy": 0.7492539808154106, "epoch": 0.3724417915940679, "grad_norm": 0.16722649335861206, "learning_rate": 8.758855460483946e-05, "loss": 0.7716, "mean_token_accuracy": 0.7807111106812954, "num_tokens": 129197905.0, "step": 4048 }, { "entropy": 0.8774124756455421, "epoch": 0.3725337979655091, "grad_norm": 0.15700660645961761, "learning_rate": 8.758548777869783e-05, "loss": 0.8822, "mean_token_accuracy": 0.7454073391854763, "num_tokens": 129230217.0, "step": 4049 }, { "entropy": 0.8027145750820637, "epoch": 0.37262580433695036, "grad_norm": 0.15138351917266846, "learning_rate": 8.75824209525562e-05, "loss": 0.8094, "mean_token_accuracy": 0.7588956840336323, "num_tokens": 129262802.0, "step": 4050 }, { "entropy": 0.7893565129488707, "epoch": 0.37271781070839155, "grad_norm": 0.1602085381746292, "learning_rate": 8.757935412641458e-05, "loss": 0.7785, "mean_token_accuracy": 0.7745846696197987, "num_tokens": 129295567.0, "step": 4051 }, { "entropy": 0.8350004088133574, "epoch": 0.3728098170798328, "grad_norm": 0.1655891090631485, "learning_rate": 8.757628730027296e-05, "loss": 0.8589, "mean_token_accuracy": 0.7530957423150539, "num_tokens": 129327807.0, "step": 4052 }, { "entropy": 0.8259093780070543, "epoch": 0.372901823451274, "grad_norm": 0.16318650543689728, "learning_rate": 8.757322047413133e-05, "loss": 0.8142, "mean_token_accuracy": 0.764505922794342, "num_tokens": 129360007.0, "step": 4053 }, { "entropy": 0.8945176340639591, "epoch": 0.37299382982271523, "grad_norm": 0.16525422036647797, "learning_rate": 8.75701536479897e-05, "loss": 0.905, "mean_token_accuracy": 0.7429056577384472, "num_tokens": 129391985.0, "step": 4054 }, { "entropy": 0.7505261488258839, "epoch": 0.3730858361941565, "grad_norm": 0.16096238791942596, "learning_rate": 8.756708682184807e-05, "loss": 0.7489, "mean_token_accuracy": 0.7848134599626064, "num_tokens": 129424187.0, "step": 4055 }, { "entropy": 0.8470068201422691, "epoch": 0.37317784256559766, "grad_norm": 0.1587616205215454, "learning_rate": 8.756401999570644e-05, "loss": 0.8423, "mean_token_accuracy": 0.7597469314932823, "num_tokens": 129455913.0, "step": 4056 }, { "entropy": 0.7282635737210512, "epoch": 0.3732698489370389, "grad_norm": 0.15393796563148499, "learning_rate": 8.756095316956482e-05, "loss": 0.7162, "mean_token_accuracy": 0.7877933345735073, "num_tokens": 129488453.0, "step": 4057 }, { "entropy": 0.7363642081618309, "epoch": 0.3733618553084801, "grad_norm": 0.15905441343784332, "learning_rate": 8.75578863434232e-05, "loss": 0.6844, "mean_token_accuracy": 0.7976165600121021, "num_tokens": 129520398.0, "step": 4058 }, { "entropy": 0.7302055843174458, "epoch": 0.37345386167992134, "grad_norm": 0.15870577096939087, "learning_rate": 8.755481951728157e-05, "loss": 0.7131, "mean_token_accuracy": 0.7894841656088829, "num_tokens": 129552242.0, "step": 4059 }, { "entropy": 0.9103264342993498, "epoch": 0.3735458680513626, "grad_norm": 0.15969295799732208, "learning_rate": 8.755175269113994e-05, "loss": 0.8817, "mean_token_accuracy": 0.7507480531930923, "num_tokens": 129584083.0, "step": 4060 }, { "entropy": 0.7411982771009207, "epoch": 0.3736378744228038, "grad_norm": 0.1514059603214264, "learning_rate": 8.754868586499831e-05, "loss": 0.7092, "mean_token_accuracy": 0.7924705818295479, "num_tokens": 129616369.0, "step": 4061 }, { "entropy": 0.7967141177505255, "epoch": 0.373729880794245, "grad_norm": 0.16127313673496246, "learning_rate": 8.754561903885669e-05, "loss": 0.7959, "mean_token_accuracy": 0.7705704681575298, "num_tokens": 129648679.0, "step": 4062 }, { "entropy": 0.8048204500228167, "epoch": 0.3738218871656862, "grad_norm": 0.14940133690834045, "learning_rate": 8.754255221271507e-05, "loss": 0.791, "mean_token_accuracy": 0.7697445265948772, "num_tokens": 129680929.0, "step": 4063 }, { "entropy": 0.7946144975721836, "epoch": 0.37391389353712745, "grad_norm": 0.16125668585300446, "learning_rate": 8.753948538657344e-05, "loss": 0.7954, "mean_token_accuracy": 0.7688831649720669, "num_tokens": 129712055.0, "step": 4064 }, { "entropy": 0.7706652022898197, "epoch": 0.3740058999085687, "grad_norm": 0.15872368216514587, "learning_rate": 8.753641856043181e-05, "loss": 0.764, "mean_token_accuracy": 0.7789484858512878, "num_tokens": 129744153.0, "step": 4065 }, { "entropy": 0.7404598630964756, "epoch": 0.3740979062800099, "grad_norm": 0.16774213314056396, "learning_rate": 8.753335173429019e-05, "loss": 0.7524, "mean_token_accuracy": 0.7815217263996601, "num_tokens": 129776520.0, "step": 4066 }, { "entropy": 0.8747317586094141, "epoch": 0.37418991265145113, "grad_norm": 0.15980879962444305, "learning_rate": 8.753028490814856e-05, "loss": 0.8781, "mean_token_accuracy": 0.747841116040945, "num_tokens": 129807940.0, "step": 4067 }, { "entropy": 0.8335717562586069, "epoch": 0.3742819190228923, "grad_norm": 0.15513189136981964, "learning_rate": 8.752721808200694e-05, "loss": 0.853, "mean_token_accuracy": 0.7550608068704605, "num_tokens": 129840662.0, "step": 4068 }, { "entropy": 0.8145300298929214, "epoch": 0.37437392539433356, "grad_norm": 0.16231988370418549, "learning_rate": 8.75241512558653e-05, "loss": 0.8233, "mean_token_accuracy": 0.7579226046800613, "num_tokens": 129872006.0, "step": 4069 }, { "entropy": 0.8082912191748619, "epoch": 0.3744659317657748, "grad_norm": 0.16119495034217834, "learning_rate": 8.752108442972369e-05, "loss": 0.8183, "mean_token_accuracy": 0.7613702304661274, "num_tokens": 129902976.0, "step": 4070 }, { "entropy": 0.8024329300969839, "epoch": 0.374557938137216, "grad_norm": 0.15898005664348602, "learning_rate": 8.751801760358206e-05, "loss": 0.8, "mean_token_accuracy": 0.7685107290744781, "num_tokens": 129934919.0, "step": 4071 }, { "entropy": 0.8704750724136829, "epoch": 0.37464994450865724, "grad_norm": 0.16519534587860107, "learning_rate": 8.751495077744042e-05, "loss": 0.8611, "mean_token_accuracy": 0.7537200264632702, "num_tokens": 129966771.0, "step": 4072 }, { "entropy": 0.8093382008373737, "epoch": 0.37474195088009843, "grad_norm": 0.16282886266708374, "learning_rate": 8.75118839512988e-05, "loss": 0.7958, "mean_token_accuracy": 0.7669232971966267, "num_tokens": 129999097.0, "step": 4073 }, { "entropy": 0.7768543362617493, "epoch": 0.3748339572515397, "grad_norm": 0.15813620388507843, "learning_rate": 8.750881712515719e-05, "loss": 0.7647, "mean_token_accuracy": 0.7797915376722813, "num_tokens": 130030474.0, "step": 4074 }, { "entropy": 0.7748862598091364, "epoch": 0.3749259636229809, "grad_norm": 0.16296915709972382, "learning_rate": 8.750575029901555e-05, "loss": 0.7521, "mean_token_accuracy": 0.7797392792999744, "num_tokens": 130062546.0, "step": 4075 }, { "entropy": 0.7884459607303143, "epoch": 0.3750179699944221, "grad_norm": 0.15664036571979523, "learning_rate": 8.750268347287392e-05, "loss": 0.7719, "mean_token_accuracy": 0.7714450508356094, "num_tokens": 130093811.0, "step": 4076 }, { "entropy": 0.8191147223114967, "epoch": 0.37510997636586335, "grad_norm": 0.1540190875530243, "learning_rate": 8.749961664673229e-05, "loss": 0.8044, "mean_token_accuracy": 0.7618381008505821, "num_tokens": 130125831.0, "step": 4077 }, { "entropy": 0.7616619635373354, "epoch": 0.37520198273730454, "grad_norm": 0.15280002355575562, "learning_rate": 8.749654982059068e-05, "loss": 0.7552, "mean_token_accuracy": 0.7791516147553921, "num_tokens": 130157752.0, "step": 4078 }, { "entropy": 0.8310909681022167, "epoch": 0.3752939891087458, "grad_norm": 0.16477175056934357, "learning_rate": 8.749348299444905e-05, "loss": 0.8174, "mean_token_accuracy": 0.7618382759392262, "num_tokens": 130190034.0, "step": 4079 }, { "entropy": 0.8722731210291386, "epoch": 0.37538599548018703, "grad_norm": 0.15813778340816498, "learning_rate": 8.749041616830742e-05, "loss": 0.8724, "mean_token_accuracy": 0.7494565397500992, "num_tokens": 130221971.0, "step": 4080 }, { "entropy": 0.779531717300415, "epoch": 0.3754780018516282, "grad_norm": 0.16346488893032074, "learning_rate": 8.748734934216579e-05, "loss": 0.7869, "mean_token_accuracy": 0.7727317363023758, "num_tokens": 130253487.0, "step": 4081 }, { "entropy": 0.8307377435266972, "epoch": 0.37557000822306946, "grad_norm": 0.15875351428985596, "learning_rate": 8.748428251602417e-05, "loss": 0.8234, "mean_token_accuracy": 0.7608270347118378, "num_tokens": 130285934.0, "step": 4082 }, { "entropy": 0.7421064414083958, "epoch": 0.37566201459451065, "grad_norm": 0.1532420516014099, "learning_rate": 8.748121568988255e-05, "loss": 0.7324, "mean_token_accuracy": 0.7851414568722248, "num_tokens": 130317466.0, "step": 4083 }, { "entropy": 0.8471705559641123, "epoch": 0.3757540209659519, "grad_norm": 0.16140751540660858, "learning_rate": 8.747814886374092e-05, "loss": 0.8468, "mean_token_accuracy": 0.7471309304237366, "num_tokens": 130349688.0, "step": 4084 }, { "entropy": 0.9260601215064526, "epoch": 0.37584602733739314, "grad_norm": 0.16088037192821503, "learning_rate": 8.747508203759929e-05, "loss": 0.9173, "mean_token_accuracy": 0.7380798310041428, "num_tokens": 130381491.0, "step": 4085 }, { "entropy": 0.7290041074156761, "epoch": 0.37593803370883433, "grad_norm": 0.15418820083141327, "learning_rate": 8.747201521145767e-05, "loss": 0.7302, "mean_token_accuracy": 0.7839409485459328, "num_tokens": 130413419.0, "step": 4086 }, { "entropy": 0.7705075647681952, "epoch": 0.3760300400802756, "grad_norm": 0.16282916069030762, "learning_rate": 8.746894838531604e-05, "loss": 0.7783, "mean_token_accuracy": 0.7732329368591309, "num_tokens": 130444448.0, "step": 4087 }, { "entropy": 0.8085124716162682, "epoch": 0.37612204645171676, "grad_norm": 0.16146279871463776, "learning_rate": 8.746588155917442e-05, "loss": 0.795, "mean_token_accuracy": 0.7661039531230927, "num_tokens": 130475638.0, "step": 4088 }, { "entropy": 0.8927824720740318, "epoch": 0.376214052823158, "grad_norm": 0.15700224041938782, "learning_rate": 8.74628147330328e-05, "loss": 0.8876, "mean_token_accuracy": 0.7466563768684864, "num_tokens": 130508191.0, "step": 4089 }, { "entropy": 0.8471049219369888, "epoch": 0.37630605919459925, "grad_norm": 0.17450976371765137, "learning_rate": 8.745974790689117e-05, "loss": 0.8437, "mean_token_accuracy": 0.7590622045099735, "num_tokens": 130539907.0, "step": 4090 }, { "entropy": 0.8682767637073994, "epoch": 0.37639806556604044, "grad_norm": 0.16888317465782166, "learning_rate": 8.745668108074954e-05, "loss": 0.8502, "mean_token_accuracy": 0.7584325596690178, "num_tokens": 130571692.0, "step": 4091 }, { "entropy": 0.7743223123252392, "epoch": 0.3764900719374817, "grad_norm": 0.15394112467765808, "learning_rate": 8.74536142546079e-05, "loss": 0.7642, "mean_token_accuracy": 0.7766902968287468, "num_tokens": 130603633.0, "step": 4092 }, { "entropy": 0.8647866453975439, "epoch": 0.3765820783089229, "grad_norm": 0.16298164427280426, "learning_rate": 8.745054742846628e-05, "loss": 0.8424, "mean_token_accuracy": 0.7574441656470299, "num_tokens": 130635072.0, "step": 4093 }, { "entropy": 0.7816735431551933, "epoch": 0.3766740846803641, "grad_norm": 0.15835200250148773, "learning_rate": 8.744748060232467e-05, "loss": 0.7777, "mean_token_accuracy": 0.7734944336116314, "num_tokens": 130667585.0, "step": 4094 }, { "entropy": 0.7584736179560423, "epoch": 0.37676609105180536, "grad_norm": 0.15218304097652435, "learning_rate": 8.744441377618303e-05, "loss": 0.7433, "mean_token_accuracy": 0.7788853906095028, "num_tokens": 130699952.0, "step": 4095 }, { "entropy": 0.7723041009157896, "epoch": 0.37685809742324655, "grad_norm": 0.16570191085338593, "learning_rate": 8.74413469500414e-05, "loss": 0.7971, "mean_token_accuracy": 0.7707731164991856, "num_tokens": 130731021.0, "step": 4096 }, { "entropy": 0.7806574441492558, "epoch": 0.3769501037946878, "grad_norm": 0.1601337492465973, "learning_rate": 8.743828012389978e-05, "loss": 0.7871, "mean_token_accuracy": 0.7727965414524078, "num_tokens": 130762287.0, "step": 4097 }, { "entropy": 0.8342874199151993, "epoch": 0.377042110166129, "grad_norm": 0.15651856362819672, "learning_rate": 8.743521329775815e-05, "loss": 0.8403, "mean_token_accuracy": 0.754624355584383, "num_tokens": 130794779.0, "step": 4098 }, { "entropy": 0.856488760560751, "epoch": 0.37713411653757023, "grad_norm": 0.1603168547153473, "learning_rate": 8.743214647161653e-05, "loss": 0.8493, "mean_token_accuracy": 0.7536776922643185, "num_tokens": 130827046.0, "step": 4099 }, { "entropy": 0.9053232707083225, "epoch": 0.3772261229090115, "grad_norm": 0.1598374992609024, "learning_rate": 8.74290796454749e-05, "loss": 0.8755, "mean_token_accuracy": 0.7502192966639996, "num_tokens": 130859187.0, "step": 4100 }, { "entropy": 0.7434868915006518, "epoch": 0.37731812928045266, "grad_norm": 0.1514042615890503, "learning_rate": 8.742601281933328e-05, "loss": 0.7262, "mean_token_accuracy": 0.7874855473637581, "num_tokens": 130891826.0, "step": 4101 }, { "entropy": 0.7872999217361212, "epoch": 0.3774101356518939, "grad_norm": 0.15198375284671783, "learning_rate": 8.742294599319165e-05, "loss": 0.7935, "mean_token_accuracy": 0.7658762149512768, "num_tokens": 130923589.0, "step": 4102 }, { "entropy": 0.8784041814506054, "epoch": 0.3775021420233351, "grad_norm": 0.17920370399951935, "learning_rate": 8.741987916705002e-05, "loss": 0.92, "mean_token_accuracy": 0.7437056973576546, "num_tokens": 130955550.0, "step": 4103 }, { "entropy": 0.8522918224334717, "epoch": 0.37759414839477634, "grad_norm": 0.16588614881038666, "learning_rate": 8.74168123409084e-05, "loss": 0.8504, "mean_token_accuracy": 0.7559499740600586, "num_tokens": 130987046.0, "step": 4104 }, { "entropy": 0.8293980024755001, "epoch": 0.3776861547662176, "grad_norm": 0.1556546539068222, "learning_rate": 8.741374551476678e-05, "loss": 0.7989, "mean_token_accuracy": 0.770696971565485, "num_tokens": 131019271.0, "step": 4105 }, { "entropy": 0.722433939576149, "epoch": 0.3777781611376588, "grad_norm": 0.15722379088401794, "learning_rate": 8.741067868862515e-05, "loss": 0.6965, "mean_token_accuracy": 0.7937810495495796, "num_tokens": 131051097.0, "step": 4106 }, { "entropy": 0.7864106316119432, "epoch": 0.3778701675091, "grad_norm": 0.15509875118732452, "learning_rate": 8.740761186248352e-05, "loss": 0.757, "mean_token_accuracy": 0.7723527364432812, "num_tokens": 131083182.0, "step": 4107 }, { "entropy": 0.8425085805356503, "epoch": 0.3779621738805412, "grad_norm": 0.15373443067073822, "learning_rate": 8.740454503634188e-05, "loss": 0.8324, "mean_token_accuracy": 0.7556495629251003, "num_tokens": 131115295.0, "step": 4108 }, { "entropy": 0.7058810722082853, "epoch": 0.37805418025198245, "grad_norm": 0.14839696884155273, "learning_rate": 8.740147821020027e-05, "loss": 0.689, "mean_token_accuracy": 0.795116625726223, "num_tokens": 131147473.0, "step": 4109 }, { "entropy": 0.8314052112400532, "epoch": 0.3781461866234237, "grad_norm": 0.16211660206317902, "learning_rate": 8.739841138405865e-05, "loss": 0.8186, "mean_token_accuracy": 0.7649254463613033, "num_tokens": 131179532.0, "step": 4110 }, { "entropy": 0.8366539943963289, "epoch": 0.3782381929948649, "grad_norm": 0.16195206344127655, "learning_rate": 8.739534455791701e-05, "loss": 0.8393, "mean_token_accuracy": 0.7534327246248722, "num_tokens": 131210061.0, "step": 4111 }, { "entropy": 0.7023038323968649, "epoch": 0.37833019936630613, "grad_norm": 0.16786795854568481, "learning_rate": 8.739227773177538e-05, "loss": 0.7133, "mean_token_accuracy": 0.7892522253096104, "num_tokens": 131241610.0, "step": 4112 }, { "entropy": 0.8322776015847921, "epoch": 0.3784222057377473, "grad_norm": 0.1598309874534607, "learning_rate": 8.738921090563376e-05, "loss": 0.8396, "mean_token_accuracy": 0.7554603070020676, "num_tokens": 131274085.0, "step": 4113 }, { "entropy": 0.8342767022550106, "epoch": 0.37851421210918856, "grad_norm": 0.16540953516960144, "learning_rate": 8.738614407949213e-05, "loss": 0.8432, "mean_token_accuracy": 0.7570647224783897, "num_tokens": 131306003.0, "step": 4114 }, { "entropy": 0.8650121614336967, "epoch": 0.3786062184806298, "grad_norm": 0.16598913073539734, "learning_rate": 8.738307725335051e-05, "loss": 0.8455, "mean_token_accuracy": 0.7583511993288994, "num_tokens": 131338122.0, "step": 4115 }, { "entropy": 0.7809188067913055, "epoch": 0.378698224852071, "grad_norm": 0.1524384468793869, "learning_rate": 8.738001042720888e-05, "loss": 0.7599, "mean_token_accuracy": 0.7775154635310173, "num_tokens": 131370342.0, "step": 4116 }, { "entropy": 0.9356481358408928, "epoch": 0.37879023122351224, "grad_norm": 0.16167990863323212, "learning_rate": 8.737694360106726e-05, "loss": 0.9275, "mean_token_accuracy": 0.7358379811048508, "num_tokens": 131402234.0, "step": 4117 }, { "entropy": 0.8367277402430773, "epoch": 0.37888223759495343, "grad_norm": 0.15693219006061554, "learning_rate": 8.737387677492563e-05, "loss": 0.8211, "mean_token_accuracy": 0.7628904171288013, "num_tokens": 131434484.0, "step": 4118 }, { "entropy": 0.7327806763350964, "epoch": 0.3789742439663947, "grad_norm": 0.15792328119277954, "learning_rate": 8.7370809948784e-05, "loss": 0.7233, "mean_token_accuracy": 0.7841850072145462, "num_tokens": 131466178.0, "step": 4119 }, { "entropy": 0.7994197346270084, "epoch": 0.3790662503378359, "grad_norm": 0.15808866918087006, "learning_rate": 8.736774312264239e-05, "loss": 0.8031, "mean_token_accuracy": 0.7622867226600647, "num_tokens": 131497161.0, "step": 4120 }, { "entropy": 0.6789668146520853, "epoch": 0.3791582567092771, "grad_norm": 0.1588565856218338, "learning_rate": 8.736467629650076e-05, "loss": 0.6704, "mean_token_accuracy": 0.8008765690028667, "num_tokens": 131529241.0, "step": 4121 }, { "entropy": 0.7208697088062763, "epoch": 0.37925026308071835, "grad_norm": 0.15108740329742432, "learning_rate": 8.736160947035913e-05, "loss": 0.7238, "mean_token_accuracy": 0.7898131720721722, "num_tokens": 131560941.0, "step": 4122 }, { "entropy": 0.8742173425853252, "epoch": 0.37934226945215954, "grad_norm": 0.159368634223938, "learning_rate": 8.73585426442175e-05, "loss": 0.8713, "mean_token_accuracy": 0.7482022941112518, "num_tokens": 131592149.0, "step": 4123 }, { "entropy": 0.7938090097159147, "epoch": 0.3794342758236008, "grad_norm": 0.16456268727779388, "learning_rate": 8.735547581807588e-05, "loss": 0.8084, "mean_token_accuracy": 0.7679577544331551, "num_tokens": 131624464.0, "step": 4124 }, { "entropy": 0.8315666187554598, "epoch": 0.37952628219504203, "grad_norm": 0.16005152463912964, "learning_rate": 8.735240899193426e-05, "loss": 0.8227, "mean_token_accuracy": 0.7579706385731697, "num_tokens": 131656031.0, "step": 4125 }, { "entropy": 0.7733435351401567, "epoch": 0.3796182885664832, "grad_norm": 0.15128354728221893, "learning_rate": 8.734934216579263e-05, "loss": 0.7573, "mean_token_accuracy": 0.775660190731287, "num_tokens": 131687578.0, "step": 4126 }, { "entropy": 0.8420027866959572, "epoch": 0.37971029493792446, "grad_norm": 0.15558390319347382, "learning_rate": 8.7346275339651e-05, "loss": 0.8349, "mean_token_accuracy": 0.7579685561358929, "num_tokens": 131720082.0, "step": 4127 }, { "entropy": 0.7162178102880716, "epoch": 0.37980230130936565, "grad_norm": 0.1485842615365982, "learning_rate": 8.734320851350938e-05, "loss": 0.6972, "mean_token_accuracy": 0.7935210280120373, "num_tokens": 131752522.0, "step": 4128 }, { "entropy": 0.7365765869617462, "epoch": 0.3798943076808069, "grad_norm": 0.15274202823638916, "learning_rate": 8.734014168736774e-05, "loss": 0.716, "mean_token_accuracy": 0.789227794855833, "num_tokens": 131784631.0, "step": 4129 }, { "entropy": 0.7751382496207952, "epoch": 0.37998631405224814, "grad_norm": 0.1555785834789276, "learning_rate": 8.733707486122613e-05, "loss": 0.7771, "mean_token_accuracy": 0.7732851877808571, "num_tokens": 131816274.0, "step": 4130 }, { "entropy": 0.7928182948380709, "epoch": 0.38007832042368933, "grad_norm": 0.15829837322235107, "learning_rate": 8.73340080350845e-05, "loss": 0.7808, "mean_token_accuracy": 0.7697306089103222, "num_tokens": 131847966.0, "step": 4131 }, { "entropy": 0.8094328492879868, "epoch": 0.3801703267951306, "grad_norm": 0.15658582746982574, "learning_rate": 8.733094120894288e-05, "loss": 0.8086, "mean_token_accuracy": 0.7645165920257568, "num_tokens": 131880515.0, "step": 4132 }, { "entropy": 0.8359375391155481, "epoch": 0.38026233316657176, "grad_norm": 0.15940798819065094, "learning_rate": 8.732787438280124e-05, "loss": 0.8374, "mean_token_accuracy": 0.7576212175190449, "num_tokens": 131912427.0, "step": 4133 }, { "entropy": 0.8925373665988445, "epoch": 0.380354339538013, "grad_norm": 0.15960022807121277, "learning_rate": 8.732480755665961e-05, "loss": 0.8853, "mean_token_accuracy": 0.7506990842521191, "num_tokens": 131944965.0, "step": 4134 }, { "entropy": 0.8384615890681744, "epoch": 0.38044634590945425, "grad_norm": 0.1664103865623474, "learning_rate": 8.732174073051799e-05, "loss": 0.8472, "mean_token_accuracy": 0.7566993050277233, "num_tokens": 131976810.0, "step": 4135 }, { "entropy": 0.8054969385266304, "epoch": 0.38053835228089544, "grad_norm": 0.1603134423494339, "learning_rate": 8.731867390437637e-05, "loss": 0.7989, "mean_token_accuracy": 0.7680752314627171, "num_tokens": 132009578.0, "step": 4136 }, { "entropy": 0.8264594934880733, "epoch": 0.3806303586523367, "grad_norm": 0.15449967980384827, "learning_rate": 8.731560707823474e-05, "loss": 0.8129, "mean_token_accuracy": 0.7628625370562077, "num_tokens": 132041721.0, "step": 4137 }, { "entropy": 0.7545406706631184, "epoch": 0.3807223650237779, "grad_norm": 0.16117171943187714, "learning_rate": 8.731254025209311e-05, "loss": 0.7407, "mean_token_accuracy": 0.7841242477297783, "num_tokens": 132073488.0, "step": 4138 }, { "entropy": 0.9526731111109257, "epoch": 0.3808143713952191, "grad_norm": 0.16234929859638214, "learning_rate": 8.730947342595148e-05, "loss": 0.935, "mean_token_accuracy": 0.7343675494194031, "num_tokens": 132105883.0, "step": 4139 }, { "entropy": 0.8932273220270872, "epoch": 0.38090637776666036, "grad_norm": 0.16533347964286804, "learning_rate": 8.730640659980986e-05, "loss": 0.8865, "mean_token_accuracy": 0.746624119579792, "num_tokens": 132137664.0, "step": 4140 }, { "entropy": 0.79215775616467, "epoch": 0.38099838413810155, "grad_norm": 0.16269204020500183, "learning_rate": 8.730333977366824e-05, "loss": 0.7784, "mean_token_accuracy": 0.7718823365867138, "num_tokens": 132169713.0, "step": 4141 }, { "entropy": 0.774992972612381, "epoch": 0.3810903905095428, "grad_norm": 0.15812771022319794, "learning_rate": 8.730027294752661e-05, "loss": 0.7806, "mean_token_accuracy": 0.7724192589521408, "num_tokens": 132201227.0, "step": 4142 }, { "entropy": 0.9274743683636189, "epoch": 0.381182396880984, "grad_norm": 0.16166022419929504, "learning_rate": 8.729720612138498e-05, "loss": 0.9373, "mean_token_accuracy": 0.7321321666240692, "num_tokens": 132233241.0, "step": 4143 }, { "entropy": 0.9127565287053585, "epoch": 0.38127440325242523, "grad_norm": 0.1686488837003708, "learning_rate": 8.729413929524336e-05, "loss": 0.9194, "mean_token_accuracy": 0.7379963733255863, "num_tokens": 132265656.0, "step": 4144 }, { "entropy": 0.9322084318846464, "epoch": 0.3813664096238665, "grad_norm": 0.16754263639450073, "learning_rate": 8.729107246910173e-05, "loss": 0.9442, "mean_token_accuracy": 0.7333414107561111, "num_tokens": 132298069.0, "step": 4145 }, { "entropy": 0.8430956322699785, "epoch": 0.38145841599530766, "grad_norm": 0.1616491824388504, "learning_rate": 8.728800564296011e-05, "loss": 0.8238, "mean_token_accuracy": 0.7610622569918633, "num_tokens": 132330186.0, "step": 4146 }, { "entropy": 0.8317676223814487, "epoch": 0.3815504223667489, "grad_norm": 0.16662909090518951, "learning_rate": 8.728493881681847e-05, "loss": 0.8363, "mean_token_accuracy": 0.7577822990715504, "num_tokens": 132361593.0, "step": 4147 }, { "entropy": 0.772182259708643, "epoch": 0.3816424287381901, "grad_norm": 0.15605215728282928, "learning_rate": 8.728187199067686e-05, "loss": 0.7435, "mean_token_accuracy": 0.7831004858016968, "num_tokens": 132392933.0, "step": 4148 }, { "entropy": 0.7948896400630474, "epoch": 0.38173443510963134, "grad_norm": 0.14800789952278137, "learning_rate": 8.727880516453522e-05, "loss": 0.7608, "mean_token_accuracy": 0.778449110686779, "num_tokens": 132425090.0, "step": 4149 }, { "entropy": 0.8528195936232805, "epoch": 0.3818264414810726, "grad_norm": 0.1587211638689041, "learning_rate": 8.727573833839359e-05, "loss": 0.8183, "mean_token_accuracy": 0.7604418210685253, "num_tokens": 132456984.0, "step": 4150 }, { "entropy": 0.7968871407210827, "epoch": 0.3819184478525138, "grad_norm": 0.16234296560287476, "learning_rate": 8.727267151225197e-05, "loss": 0.7759, "mean_token_accuracy": 0.7780869789421558, "num_tokens": 132488797.0, "step": 4151 }, { "entropy": 0.8053414858877659, "epoch": 0.382010454223955, "grad_norm": 0.161317840218544, "learning_rate": 8.726960468611035e-05, "loss": 0.7886, "mean_token_accuracy": 0.7689677029848099, "num_tokens": 132520640.0, "step": 4152 }, { "entropy": 0.7724286131560802, "epoch": 0.3821024605953962, "grad_norm": 0.16549046337604523, "learning_rate": 8.726653785996872e-05, "loss": 0.7631, "mean_token_accuracy": 0.7779057696461678, "num_tokens": 132552066.0, "step": 4153 }, { "entropy": 0.7536732461303473, "epoch": 0.38219446696683745, "grad_norm": 0.15608333051204681, "learning_rate": 8.726347103382709e-05, "loss": 0.7359, "mean_token_accuracy": 0.7830021567642689, "num_tokens": 132584147.0, "step": 4154 }, { "entropy": 0.7125535421073437, "epoch": 0.3822864733382787, "grad_norm": 0.16355609893798828, "learning_rate": 8.726040420768547e-05, "loss": 0.7021, "mean_token_accuracy": 0.7903895042836666, "num_tokens": 132616129.0, "step": 4155 }, { "entropy": 0.8814709167927504, "epoch": 0.3823784797097199, "grad_norm": 0.15736223757266998, "learning_rate": 8.725733738154385e-05, "loss": 0.8604, "mean_token_accuracy": 0.7498734444379807, "num_tokens": 132648060.0, "step": 4156 }, { "entropy": 0.7723355144262314, "epoch": 0.38247048608116113, "grad_norm": 0.159956157207489, "learning_rate": 8.725427055540222e-05, "loss": 0.7839, "mean_token_accuracy": 0.7703192234039307, "num_tokens": 132680468.0, "step": 4157 }, { "entropy": 0.7797469981014729, "epoch": 0.3825624924526023, "grad_norm": 0.16021586954593658, "learning_rate": 8.725120372926059e-05, "loss": 0.7861, "mean_token_accuracy": 0.7706373110413551, "num_tokens": 132712646.0, "step": 4158 }, { "entropy": 0.8370532747358084, "epoch": 0.38265449882404357, "grad_norm": 0.15802547335624695, "learning_rate": 8.724813690311897e-05, "loss": 0.831, "mean_token_accuracy": 0.759765014052391, "num_tokens": 132745195.0, "step": 4159 }, { "entropy": 0.8180717304348946, "epoch": 0.3827465051954848, "grad_norm": 0.15887928009033203, "learning_rate": 8.724507007697734e-05, "loss": 0.8137, "mean_token_accuracy": 0.7726306021213531, "num_tokens": 132777374.0, "step": 4160 }, { "entropy": 0.8574179112911224, "epoch": 0.382838511566926, "grad_norm": 0.15849226713180542, "learning_rate": 8.724200325083572e-05, "loss": 0.8452, "mean_token_accuracy": 0.7567791454494, "num_tokens": 132809902.0, "step": 4161 }, { "entropy": 0.8491595275700092, "epoch": 0.38293051793836724, "grad_norm": 0.1582030951976776, "learning_rate": 8.723893642469409e-05, "loss": 0.8444, "mean_token_accuracy": 0.7545684017241001, "num_tokens": 132841987.0, "step": 4162 }, { "entropy": 0.7679115831851959, "epoch": 0.38302252430980843, "grad_norm": 0.16203658282756805, "learning_rate": 8.723586959855247e-05, "loss": 0.7593, "mean_token_accuracy": 0.7766945324838161, "num_tokens": 132873215.0, "step": 4163 }, { "entropy": 0.8694840222597122, "epoch": 0.3831145306812497, "grad_norm": 0.15923887491226196, "learning_rate": 8.723280277241084e-05, "loss": 0.8547, "mean_token_accuracy": 0.7525530755519867, "num_tokens": 132905176.0, "step": 4164 }, { "entropy": 0.8753567039966583, "epoch": 0.3832065370526909, "grad_norm": 0.15510301291942596, "learning_rate": 8.72297359462692e-05, "loss": 0.87, "mean_token_accuracy": 0.7478569708764553, "num_tokens": 132937133.0, "step": 4165 }, { "entropy": 0.8058976922184229, "epoch": 0.3832985434241321, "grad_norm": 0.15937575697898865, "learning_rate": 8.722666912012759e-05, "loss": 0.8218, "mean_token_accuracy": 0.7617925554513931, "num_tokens": 132969572.0, "step": 4166 }, { "entropy": 0.8335188031196594, "epoch": 0.38339054979557335, "grad_norm": 0.16086150705814362, "learning_rate": 8.722360229398597e-05, "loss": 0.8181, "mean_token_accuracy": 0.7647471949458122, "num_tokens": 133002340.0, "step": 4167 }, { "entropy": 0.7191280722618103, "epoch": 0.38348255616701454, "grad_norm": 0.14876678586006165, "learning_rate": 8.722053546784434e-05, "loss": 0.706, "mean_token_accuracy": 0.7914744168519974, "num_tokens": 133033625.0, "step": 4168 }, { "entropy": 0.8077774122357368, "epoch": 0.3835745625384558, "grad_norm": 0.15351617336273193, "learning_rate": 8.72174686417027e-05, "loss": 0.7993, "mean_token_accuracy": 0.7709279283881187, "num_tokens": 133065256.0, "step": 4169 }, { "entropy": 0.8632537759840488, "epoch": 0.38366656890989703, "grad_norm": 0.1708492785692215, "learning_rate": 8.721440181556107e-05, "loss": 0.8543, "mean_token_accuracy": 0.7542585916817188, "num_tokens": 133097350.0, "step": 4170 }, { "entropy": 0.7806493416428566, "epoch": 0.3837585752813382, "grad_norm": 0.159913569688797, "learning_rate": 8.721133498941945e-05, "loss": 0.7608, "mean_token_accuracy": 0.7800504975020885, "num_tokens": 133129302.0, "step": 4171 }, { "entropy": 0.8996094614267349, "epoch": 0.38385058165277947, "grad_norm": 0.16581954061985016, "learning_rate": 8.720826816327783e-05, "loss": 0.8976, "mean_token_accuracy": 0.7396076358854771, "num_tokens": 133161330.0, "step": 4172 }, { "entropy": 0.8007803354412317, "epoch": 0.38394258802422065, "grad_norm": 0.1646149456501007, "learning_rate": 8.72052013371362e-05, "loss": 0.8014, "mean_token_accuracy": 0.7737562172114849, "num_tokens": 133192004.0, "step": 4173 }, { "entropy": 0.771102687343955, "epoch": 0.3840345943956619, "grad_norm": 0.14791448414325714, "learning_rate": 8.720213451099457e-05, "loss": 0.7638, "mean_token_accuracy": 0.776521984487772, "num_tokens": 133224509.0, "step": 4174 }, { "entropy": 0.7271171193569899, "epoch": 0.38412660076710314, "grad_norm": 0.15652260184288025, "learning_rate": 8.719906768485295e-05, "loss": 0.7167, "mean_token_accuracy": 0.7882281094789505, "num_tokens": 133256381.0, "step": 4175 }, { "entropy": 0.8229997791349888, "epoch": 0.38421860713854433, "grad_norm": 0.16440297663211823, "learning_rate": 8.719600085871132e-05, "loss": 0.8398, "mean_token_accuracy": 0.7601414658129215, "num_tokens": 133288078.0, "step": 4176 }, { "entropy": 0.8403734639286995, "epoch": 0.3843106135099856, "grad_norm": 0.1602124273777008, "learning_rate": 8.71929340325697e-05, "loss": 0.8432, "mean_token_accuracy": 0.7574491240084171, "num_tokens": 133319149.0, "step": 4177 }, { "entropy": 0.7893737833946943, "epoch": 0.38440261988142677, "grad_norm": 0.1642305552959442, "learning_rate": 8.718986720642807e-05, "loss": 0.8116, "mean_token_accuracy": 0.7656954117119312, "num_tokens": 133351066.0, "step": 4178 }, { "entropy": 0.8066931031644344, "epoch": 0.384494626252868, "grad_norm": 0.15673337876796722, "learning_rate": 8.718680038028645e-05, "loss": 0.7966, "mean_token_accuracy": 0.7729683294892311, "num_tokens": 133382325.0, "step": 4179 }, { "entropy": 0.8560374546796083, "epoch": 0.38458663262430925, "grad_norm": 0.15161894261837006, "learning_rate": 8.718373355414482e-05, "loss": 0.8333, "mean_token_accuracy": 0.754586972296238, "num_tokens": 133414463.0, "step": 4180 }, { "entropy": 0.8318451754748821, "epoch": 0.38467863899575044, "grad_norm": 0.15894195437431335, "learning_rate": 8.718066672800319e-05, "loss": 0.8083, "mean_token_accuracy": 0.765265453606844, "num_tokens": 133446187.0, "step": 4181 }, { "entropy": 0.7837329618632793, "epoch": 0.3847706453671917, "grad_norm": 0.15321305394172668, "learning_rate": 8.717759990186157e-05, "loss": 0.7597, "mean_token_accuracy": 0.779250118881464, "num_tokens": 133478955.0, "step": 4182 }, { "entropy": 0.7930565625429153, "epoch": 0.3848626517386329, "grad_norm": 0.15311159193515778, "learning_rate": 8.717453307571995e-05, "loss": 0.7742, "mean_token_accuracy": 0.7722283154726028, "num_tokens": 133511074.0, "step": 4183 }, { "entropy": 0.756275612860918, "epoch": 0.3849546581100741, "grad_norm": 0.1531313806772232, "learning_rate": 8.717146624957832e-05, "loss": 0.752, "mean_token_accuracy": 0.7799185998737812, "num_tokens": 133542583.0, "step": 4184 }, { "entropy": 0.8041997253894806, "epoch": 0.38504666448151537, "grad_norm": 0.1492578089237213, "learning_rate": 8.716839942343668e-05, "loss": 0.777, "mean_token_accuracy": 0.7715765684843063, "num_tokens": 133574603.0, "step": 4185 }, { "entropy": 0.7764155007898808, "epoch": 0.38513867085295656, "grad_norm": 0.16519571840763092, "learning_rate": 8.716533259729507e-05, "loss": 0.7761, "mean_token_accuracy": 0.7725546061992645, "num_tokens": 133606266.0, "step": 4186 }, { "entropy": 0.9361011125147343, "epoch": 0.3852306772243978, "grad_norm": 0.16318535804748535, "learning_rate": 8.716226577115343e-05, "loss": 0.9313, "mean_token_accuracy": 0.7313161008059978, "num_tokens": 133637253.0, "step": 4187 }, { "entropy": 0.8292119055986404, "epoch": 0.385322683595839, "grad_norm": 0.15760721266269684, "learning_rate": 8.715919894501181e-05, "loss": 0.8359, "mean_token_accuracy": 0.7593198046088219, "num_tokens": 133669894.0, "step": 4188 }, { "entropy": 0.9470454677939415, "epoch": 0.38541468996728023, "grad_norm": 0.16229559481143951, "learning_rate": 8.715613211887018e-05, "loss": 0.9537, "mean_token_accuracy": 0.7292276807129383, "num_tokens": 133701230.0, "step": 4189 }, { "entropy": 0.8191677685827017, "epoch": 0.3855066963387215, "grad_norm": 0.16095027327537537, "learning_rate": 8.715306529272856e-05, "loss": 0.8263, "mean_token_accuracy": 0.7593926750123501, "num_tokens": 133733146.0, "step": 4190 }, { "entropy": 0.8708713538944721, "epoch": 0.38559870271016267, "grad_norm": 0.16134944558143616, "learning_rate": 8.714999846658693e-05, "loss": 0.8474, "mean_token_accuracy": 0.7556372284889221, "num_tokens": 133764794.0, "step": 4191 }, { "entropy": 0.8958757929503918, "epoch": 0.3856907090816039, "grad_norm": 0.1613050103187561, "learning_rate": 8.71469316404453e-05, "loss": 0.8909, "mean_token_accuracy": 0.7433039098978043, "num_tokens": 133796529.0, "step": 4192 }, { "entropy": 0.8576117418706417, "epoch": 0.3857827154530451, "grad_norm": 0.1609002649784088, "learning_rate": 8.714386481430368e-05, "loss": 0.8385, "mean_token_accuracy": 0.7608901597559452, "num_tokens": 133828414.0, "step": 4193 }, { "entropy": 0.7335216384381056, "epoch": 0.38587472182448634, "grad_norm": 0.1527215540409088, "learning_rate": 8.714079798816206e-05, "loss": 0.7151, "mean_token_accuracy": 0.7870680652558804, "num_tokens": 133861021.0, "step": 4194 }, { "entropy": 0.8775808624923229, "epoch": 0.3859667281959276, "grad_norm": 0.16030284762382507, "learning_rate": 8.713773116202043e-05, "loss": 0.8821, "mean_token_accuracy": 0.7464111261069775, "num_tokens": 133893185.0, "step": 4195 }, { "entropy": 0.8554101772606373, "epoch": 0.3860587345673688, "grad_norm": 0.15841154754161835, "learning_rate": 8.71346643358788e-05, "loss": 0.845, "mean_token_accuracy": 0.7548527345061302, "num_tokens": 133924555.0, "step": 4196 }, { "entropy": 0.8316023517400026, "epoch": 0.38615074093881, "grad_norm": 0.15814627707004547, "learning_rate": 8.713159750973717e-05, "loss": 0.8369, "mean_token_accuracy": 0.755095649510622, "num_tokens": 133956945.0, "step": 4197 }, { "entropy": 0.7204942740499973, "epoch": 0.3862427473102512, "grad_norm": 0.15711098909378052, "learning_rate": 8.712853068359556e-05, "loss": 0.7153, "mean_token_accuracy": 0.7887427024543285, "num_tokens": 133989344.0, "step": 4198 }, { "entropy": 0.7697148099541664, "epoch": 0.38633475368169246, "grad_norm": 0.15278293192386627, "learning_rate": 8.712546385745393e-05, "loss": 0.7593, "mean_token_accuracy": 0.7804526649415493, "num_tokens": 134021828.0, "step": 4199 }, { "entropy": 0.6813086252659559, "epoch": 0.3864267600531337, "grad_norm": 0.15416164696216583, "learning_rate": 8.71223970313123e-05, "loss": 0.6936, "mean_token_accuracy": 0.7990364544093609, "num_tokens": 134053441.0, "step": 4200 }, { "entropy": 0.7935023605823517, "epoch": 0.3865187664245749, "grad_norm": 0.15562550723552704, "learning_rate": 8.711933020517066e-05, "loss": 0.7795, "mean_token_accuracy": 0.7743678502738476, "num_tokens": 134085110.0, "step": 4201 }, { "entropy": 0.7979561369866133, "epoch": 0.38661077279601613, "grad_norm": 0.16511832177639008, "learning_rate": 8.711626337902905e-05, "loss": 0.801, "mean_token_accuracy": 0.7701157331466675, "num_tokens": 134117111.0, "step": 4202 }, { "entropy": 0.6937302574515343, "epoch": 0.3867027791674573, "grad_norm": 0.1549079567193985, "learning_rate": 8.711319655288743e-05, "loss": 0.6892, "mean_token_accuracy": 0.7975854426622391, "num_tokens": 134149677.0, "step": 4203 }, { "entropy": 0.7984633184969425, "epoch": 0.38679478553889857, "grad_norm": 0.15964850783348083, "learning_rate": 8.71101297267458e-05, "loss": 0.8029, "mean_token_accuracy": 0.7672463357448578, "num_tokens": 134182041.0, "step": 4204 }, { "entropy": 0.7696676105260849, "epoch": 0.3868867919103398, "grad_norm": 0.15972919762134552, "learning_rate": 8.710706290060416e-05, "loss": 0.7728, "mean_token_accuracy": 0.7753067091107368, "num_tokens": 134214413.0, "step": 4205 }, { "entropy": 0.8014027662575245, "epoch": 0.386978798281781, "grad_norm": 0.15655213594436646, "learning_rate": 8.710399607446255e-05, "loss": 0.7878, "mean_token_accuracy": 0.7748489081859589, "num_tokens": 134246380.0, "step": 4206 }, { "entropy": 0.8616602793335915, "epoch": 0.38707080465322224, "grad_norm": 0.17280034720897675, "learning_rate": 8.710092924832091e-05, "loss": 0.8864, "mean_token_accuracy": 0.7538504488766193, "num_tokens": 134278535.0, "step": 4207 }, { "entropy": 0.7511812876909971, "epoch": 0.38716281102466343, "grad_norm": 0.15573735535144806, "learning_rate": 8.70978624221793e-05, "loss": 0.732, "mean_token_accuracy": 0.7839108295738697, "num_tokens": 134310873.0, "step": 4208 }, { "entropy": 0.9528402052819729, "epoch": 0.3872548173961047, "grad_norm": 0.1644151210784912, "learning_rate": 8.709479559603766e-05, "loss": 0.9455, "mean_token_accuracy": 0.7285618931055069, "num_tokens": 134343216.0, "step": 4209 }, { "entropy": 0.8425240777432919, "epoch": 0.3873468237675459, "grad_norm": 0.16851243376731873, "learning_rate": 8.709172876989604e-05, "loss": 0.8464, "mean_token_accuracy": 0.758952334523201, "num_tokens": 134375772.0, "step": 4210 }, { "entropy": 0.8359720408916473, "epoch": 0.3874388301389871, "grad_norm": 0.16088487207889557, "learning_rate": 8.708866194375441e-05, "loss": 0.8215, "mean_token_accuracy": 0.7593883536756039, "num_tokens": 134408138.0, "step": 4211 }, { "entropy": 0.8019145876169205, "epoch": 0.38753083651042836, "grad_norm": 0.15221558511257172, "learning_rate": 8.708559511761278e-05, "loss": 0.7716, "mean_token_accuracy": 0.774916123598814, "num_tokens": 134439957.0, "step": 4212 }, { "entropy": 0.8435503970831633, "epoch": 0.38762284288186954, "grad_norm": 0.15350355207920074, "learning_rate": 8.708252829147116e-05, "loss": 0.8274, "mean_token_accuracy": 0.7638750895857811, "num_tokens": 134472685.0, "step": 4213 }, { "entropy": 0.788871631026268, "epoch": 0.3877148492533108, "grad_norm": 0.158906951546669, "learning_rate": 8.707946146532954e-05, "loss": 0.7766, "mean_token_accuracy": 0.7702260911464691, "num_tokens": 134504008.0, "step": 4214 }, { "entropy": 0.7112585213035345, "epoch": 0.38780685562475203, "grad_norm": 0.15209490060806274, "learning_rate": 8.707639463918791e-05, "loss": 0.6941, "mean_token_accuracy": 0.7990138903260231, "num_tokens": 134535980.0, "step": 4215 }, { "entropy": 0.8328629322350025, "epoch": 0.3878988619961932, "grad_norm": 0.1673279106616974, "learning_rate": 8.707332781304628e-05, "loss": 0.8312, "mean_token_accuracy": 0.7628801353275776, "num_tokens": 134568230.0, "step": 4216 }, { "entropy": 0.8737826719880104, "epoch": 0.38799086836763447, "grad_norm": 0.1561863124370575, "learning_rate": 8.707026098690466e-05, "loss": 0.8518, "mean_token_accuracy": 0.7539734244346619, "num_tokens": 134600532.0, "step": 4217 }, { "entropy": 0.7237005848437548, "epoch": 0.38808287473907566, "grad_norm": 0.1551409661769867, "learning_rate": 8.706719416076303e-05, "loss": 0.7228, "mean_token_accuracy": 0.7873458750545979, "num_tokens": 134632503.0, "step": 4218 }, { "entropy": 0.8341682404279709, "epoch": 0.3881748811105169, "grad_norm": 0.16514167189598083, "learning_rate": 8.706412733462141e-05, "loss": 0.8442, "mean_token_accuracy": 0.7564951665699482, "num_tokens": 134664814.0, "step": 4219 }, { "entropy": 0.8619032017886639, "epoch": 0.38826688748195815, "grad_norm": 0.1630931794643402, "learning_rate": 8.706106050847978e-05, "loss": 0.8675, "mean_token_accuracy": 0.7489371336996555, "num_tokens": 134696456.0, "step": 4220 }, { "entropy": 0.9019888192415237, "epoch": 0.38835889385339933, "grad_norm": 0.15872278809547424, "learning_rate": 8.705799368233816e-05, "loss": 0.9141, "mean_token_accuracy": 0.7393311262130737, "num_tokens": 134728454.0, "step": 4221 }, { "entropy": 0.7539839446544647, "epoch": 0.3884509002248406, "grad_norm": 0.15352632105350494, "learning_rate": 8.705492685619653e-05, "loss": 0.7546, "mean_token_accuracy": 0.7800309620797634, "num_tokens": 134760069.0, "step": 4222 }, { "entropy": 0.8500512726604939, "epoch": 0.38854290659628177, "grad_norm": 0.16004939377307892, "learning_rate": 8.70518600300549e-05, "loss": 0.8446, "mean_token_accuracy": 0.7574321068823338, "num_tokens": 134792397.0, "step": 4223 }, { "entropy": 0.844186196103692, "epoch": 0.388634912967723, "grad_norm": 0.17345677316188812, "learning_rate": 8.704879320391328e-05, "loss": 0.8441, "mean_token_accuracy": 0.760069228708744, "num_tokens": 134824392.0, "step": 4224 }, { "entropy": 0.7186835035681725, "epoch": 0.38872691933916426, "grad_norm": 0.15049639344215393, "learning_rate": 8.704572637777166e-05, "loss": 0.6799, "mean_token_accuracy": 0.7980187386274338, "num_tokens": 134856190.0, "step": 4225 }, { "entropy": 0.7883167490363121, "epoch": 0.38881892571060545, "grad_norm": 0.15599362552165985, "learning_rate": 8.704265955163002e-05, "loss": 0.7596, "mean_token_accuracy": 0.7773712426424026, "num_tokens": 134888507.0, "step": 4226 }, { "entropy": 0.8072188794612885, "epoch": 0.3889109320820467, "grad_norm": 0.15790718793869019, "learning_rate": 8.703959272548839e-05, "loss": 0.7887, "mean_token_accuracy": 0.7685910761356354, "num_tokens": 134919577.0, "step": 4227 }, { "entropy": 0.8350319005548954, "epoch": 0.3890029384534879, "grad_norm": 0.16331906616687775, "learning_rate": 8.703652589934676e-05, "loss": 0.8459, "mean_token_accuracy": 0.7563123404979706, "num_tokens": 134950472.0, "step": 4228 }, { "entropy": 0.7090620063245296, "epoch": 0.3890949448249291, "grad_norm": 0.1547655463218689, "learning_rate": 8.703345907320514e-05, "loss": 0.7006, "mean_token_accuracy": 0.7906766124069691, "num_tokens": 134982207.0, "step": 4229 }, { "entropy": 0.6968223545700312, "epoch": 0.38918695119637037, "grad_norm": 0.1543329358100891, "learning_rate": 8.703039224706352e-05, "loss": 0.6781, "mean_token_accuracy": 0.7975941747426987, "num_tokens": 135013830.0, "step": 4230 }, { "entropy": 0.8722751513123512, "epoch": 0.38927895756781156, "grad_norm": 0.16849082708358765, "learning_rate": 8.702732542092189e-05, "loss": 0.8701, "mean_token_accuracy": 0.7547032833099365, "num_tokens": 135044247.0, "step": 4231 }, { "entropy": 0.6744404323399067, "epoch": 0.3893709639392528, "grad_norm": 0.15574614703655243, "learning_rate": 8.702425859478026e-05, "loss": 0.674, "mean_token_accuracy": 0.7998658791184425, "num_tokens": 135076507.0, "step": 4232 }, { "entropy": 0.6893910281360149, "epoch": 0.389462970310694, "grad_norm": 0.15297769010066986, "learning_rate": 8.702119176863864e-05, "loss": 0.6758, "mean_token_accuracy": 0.799257967621088, "num_tokens": 135108437.0, "step": 4233 }, { "entropy": 0.7742252424359322, "epoch": 0.38955497668213523, "grad_norm": 0.16956380009651184, "learning_rate": 8.701812494249701e-05, "loss": 0.7876, "mean_token_accuracy": 0.7735006436705589, "num_tokens": 135140599.0, "step": 4234 }, { "entropy": 0.8807965721935034, "epoch": 0.3896469830535765, "grad_norm": 0.1647479236125946, "learning_rate": 8.701505811635539e-05, "loss": 0.882, "mean_token_accuracy": 0.7443690225481987, "num_tokens": 135173264.0, "step": 4235 }, { "entropy": 0.72123758867383, "epoch": 0.38973898942501767, "grad_norm": 0.1532202661037445, "learning_rate": 8.701199129021376e-05, "loss": 0.7158, "mean_token_accuracy": 0.7881754785776138, "num_tokens": 135205090.0, "step": 4236 }, { "entropy": 0.7169564235955477, "epoch": 0.3898309957964589, "grad_norm": 0.15502481162548065, "learning_rate": 8.700892446407214e-05, "loss": 0.7125, "mean_token_accuracy": 0.7953151874244213, "num_tokens": 135236394.0, "step": 4237 }, { "entropy": 0.9326854236423969, "epoch": 0.3899230021679001, "grad_norm": 0.16728663444519043, "learning_rate": 8.70058576379305e-05, "loss": 0.9067, "mean_token_accuracy": 0.7416993714869022, "num_tokens": 135268675.0, "step": 4238 }, { "entropy": 0.7945006601512432, "epoch": 0.39001500853934135, "grad_norm": 0.16337938606739044, "learning_rate": 8.700279081178887e-05, "loss": 0.7823, "mean_token_accuracy": 0.7731934785842896, "num_tokens": 135300337.0, "step": 4239 }, { "entropy": 0.8091100268065929, "epoch": 0.3901070149107826, "grad_norm": 0.15602712333202362, "learning_rate": 8.699972398564726e-05, "loss": 0.7923, "mean_token_accuracy": 0.7680522687733173, "num_tokens": 135332602.0, "step": 4240 }, { "entropy": 0.7889046054333448, "epoch": 0.3901990212822238, "grad_norm": 0.15201322734355927, "learning_rate": 8.699665715950564e-05, "loss": 0.7693, "mean_token_accuracy": 0.7768738605082035, "num_tokens": 135364521.0, "step": 4241 }, { "entropy": 0.7764573730528355, "epoch": 0.390291027653665, "grad_norm": 0.15514345467090607, "learning_rate": 8.6993590333364e-05, "loss": 0.776, "mean_token_accuracy": 0.7737414389848709, "num_tokens": 135396997.0, "step": 4242 }, { "entropy": 0.9031853601336479, "epoch": 0.3903830340251062, "grad_norm": 0.16435615718364716, "learning_rate": 8.699052350722237e-05, "loss": 0.8924, "mean_token_accuracy": 0.7460091523826122, "num_tokens": 135428979.0, "step": 4243 }, { "entropy": 0.7554326169192791, "epoch": 0.39047504039654746, "grad_norm": 0.1573941856622696, "learning_rate": 8.698745668108075e-05, "loss": 0.7468, "mean_token_accuracy": 0.7834243625402451, "num_tokens": 135461203.0, "step": 4244 }, { "entropy": 0.7951471656560898, "epoch": 0.3905670467679887, "grad_norm": 0.15188875794410706, "learning_rate": 8.698438985493914e-05, "loss": 0.7897, "mean_token_accuracy": 0.7691411823034286, "num_tokens": 135493177.0, "step": 4245 }, { "entropy": 0.7393810134381056, "epoch": 0.3906590531394299, "grad_norm": 0.15031833946704865, "learning_rate": 8.69813230287975e-05, "loss": 0.7328, "mean_token_accuracy": 0.78482611104846, "num_tokens": 135525442.0, "step": 4246 }, { "entropy": 0.9201915860176086, "epoch": 0.39075105951087113, "grad_norm": 0.1618070900440216, "learning_rate": 8.697825620265587e-05, "loss": 0.8931, "mean_token_accuracy": 0.7400780506432056, "num_tokens": 135557460.0, "step": 4247 }, { "entropy": 0.8050581961870193, "epoch": 0.3908430658823123, "grad_norm": 0.159433051943779, "learning_rate": 8.697518937651425e-05, "loss": 0.7785, "mean_token_accuracy": 0.775267980992794, "num_tokens": 135589226.0, "step": 4248 }, { "entropy": 0.8434535823762417, "epoch": 0.39093507225375357, "grad_norm": 0.15734606981277466, "learning_rate": 8.697212255037262e-05, "loss": 0.8154, "mean_token_accuracy": 0.7648815251886845, "num_tokens": 135621098.0, "step": 4249 }, { "entropy": 0.8726262971758842, "epoch": 0.3910270786251948, "grad_norm": 0.16172336041927338, "learning_rate": 8.6969055724231e-05, "loss": 0.8717, "mean_token_accuracy": 0.7471059560775757, "num_tokens": 135653325.0, "step": 4250 }, { "entropy": 0.7538423966616392, "epoch": 0.391119084996636, "grad_norm": 0.1652820110321045, "learning_rate": 8.696598889808937e-05, "loss": 0.7891, "mean_token_accuracy": 0.7716167457401752, "num_tokens": 135685796.0, "step": 4251 }, { "entropy": 0.8261342085897923, "epoch": 0.39121109136807725, "grad_norm": 0.1696327030658722, "learning_rate": 8.696292207194775e-05, "loss": 0.8451, "mean_token_accuracy": 0.7563733607530594, "num_tokens": 135717904.0, "step": 4252 }, { "entropy": 0.8632139395922422, "epoch": 0.39130309773951844, "grad_norm": 0.16471731662750244, "learning_rate": 8.695985524580612e-05, "loss": 0.875, "mean_token_accuracy": 0.7469199262559414, "num_tokens": 135749616.0, "step": 4253 }, { "entropy": 0.807172367349267, "epoch": 0.3913951041109597, "grad_norm": 0.15884307026863098, "learning_rate": 8.695678841966449e-05, "loss": 0.8065, "mean_token_accuracy": 0.7703887373209, "num_tokens": 135781930.0, "step": 4254 }, { "entropy": 0.8398078698664904, "epoch": 0.3914871104824009, "grad_norm": 0.15707585215568542, "learning_rate": 8.695372159352287e-05, "loss": 0.8286, "mean_token_accuracy": 0.7569966651499271, "num_tokens": 135813167.0, "step": 4255 }, { "entropy": 0.7881499528884888, "epoch": 0.3915791168538421, "grad_norm": 0.15740911662578583, "learning_rate": 8.695065476738125e-05, "loss": 0.7795, "mean_token_accuracy": 0.7707737535238266, "num_tokens": 135845454.0, "step": 4256 }, { "entropy": 0.7546611130237579, "epoch": 0.39167112322528336, "grad_norm": 0.15941055119037628, "learning_rate": 8.694758794123962e-05, "loss": 0.7412, "mean_token_accuracy": 0.782977219671011, "num_tokens": 135877962.0, "step": 4257 }, { "entropy": 0.7950153239071369, "epoch": 0.39176312959672455, "grad_norm": 0.15787342190742493, "learning_rate": 8.694452111509799e-05, "loss": 0.799, "mean_token_accuracy": 0.7688364051282406, "num_tokens": 135909315.0, "step": 4258 }, { "entropy": 0.8668531365692616, "epoch": 0.3918551359681658, "grad_norm": 0.16240952908992767, "learning_rate": 8.694145428895635e-05, "loss": 0.8491, "mean_token_accuracy": 0.7509497664868832, "num_tokens": 135940355.0, "step": 4259 }, { "entropy": 0.8437719494104385, "epoch": 0.39194714233960704, "grad_norm": 0.1675802767276764, "learning_rate": 8.693838746281474e-05, "loss": 0.8642, "mean_token_accuracy": 0.7551863230764866, "num_tokens": 135971550.0, "step": 4260 }, { "entropy": 0.9080169722437859, "epoch": 0.3920391487110482, "grad_norm": 0.16223080456256866, "learning_rate": 8.693532063667312e-05, "loss": 0.9004, "mean_token_accuracy": 0.741890512406826, "num_tokens": 136001356.0, "step": 4261 }, { "entropy": 0.805962735787034, "epoch": 0.39213115508248947, "grad_norm": 0.16258211433887482, "learning_rate": 8.693225381053148e-05, "loss": 0.7836, "mean_token_accuracy": 0.7722995840013027, "num_tokens": 136032132.0, "step": 4262 }, { "entropy": 0.7431719992309809, "epoch": 0.39222316145393066, "grad_norm": 0.15347407758235931, "learning_rate": 8.692918698438985e-05, "loss": 0.719, "mean_token_accuracy": 0.7942002974450588, "num_tokens": 136063480.0, "step": 4263 }, { "entropy": 0.7477964982390404, "epoch": 0.3923151678253719, "grad_norm": 0.15796522796154022, "learning_rate": 8.692612015824823e-05, "loss": 0.7399, "mean_token_accuracy": 0.7820676788687706, "num_tokens": 136095591.0, "step": 4264 }, { "entropy": 0.8695437591522932, "epoch": 0.39240717419681315, "grad_norm": 0.1583152860403061, "learning_rate": 8.69230533321066e-05, "loss": 0.8651, "mean_token_accuracy": 0.7492977567017078, "num_tokens": 136128359.0, "step": 4265 }, { "entropy": 0.783818980678916, "epoch": 0.39249918056825434, "grad_norm": 0.16042211651802063, "learning_rate": 8.691998650596498e-05, "loss": 0.7611, "mean_token_accuracy": 0.77845149487257, "num_tokens": 136159781.0, "step": 4266 }, { "entropy": 0.7877401243895292, "epoch": 0.3925911869396956, "grad_norm": 0.16819101572036743, "learning_rate": 8.691691967982335e-05, "loss": 0.8, "mean_token_accuracy": 0.7744305208325386, "num_tokens": 136191234.0, "step": 4267 }, { "entropy": 0.8319972977042198, "epoch": 0.39268319331113677, "grad_norm": 0.16077058017253876, "learning_rate": 8.691385285368173e-05, "loss": 0.8163, "mean_token_accuracy": 0.7644079588353634, "num_tokens": 136223491.0, "step": 4268 }, { "entropy": 0.8760599363595247, "epoch": 0.392775199682578, "grad_norm": 0.15950432419776917, "learning_rate": 8.69107860275401e-05, "loss": 0.8713, "mean_token_accuracy": 0.7499559931457043, "num_tokens": 136255148.0, "step": 4269 }, { "entropy": 0.8729541264474392, "epoch": 0.39286720605401926, "grad_norm": 0.16192279756069183, "learning_rate": 8.690771920139847e-05, "loss": 0.8802, "mean_token_accuracy": 0.7461378425359726, "num_tokens": 136286731.0, "step": 4270 }, { "entropy": 0.8163797110319138, "epoch": 0.39295921242546045, "grad_norm": 0.16267050802707672, "learning_rate": 8.690465237525685e-05, "loss": 0.8156, "mean_token_accuracy": 0.768214039504528, "num_tokens": 136318831.0, "step": 4271 }, { "entropy": 0.7846856042742729, "epoch": 0.3930512187969017, "grad_norm": 0.15733559429645538, "learning_rate": 8.690158554911523e-05, "loss": 0.7822, "mean_token_accuracy": 0.7727215215563774, "num_tokens": 136351480.0, "step": 4272 }, { "entropy": 0.7652441691607237, "epoch": 0.3931432251683429, "grad_norm": 0.16149640083312988, "learning_rate": 8.68985187229736e-05, "loss": 0.7584, "mean_token_accuracy": 0.7765516340732574, "num_tokens": 136383042.0, "step": 4273 }, { "entropy": 0.7398889735341072, "epoch": 0.3932352315397841, "grad_norm": 0.1670493185520172, "learning_rate": 8.689545189683197e-05, "loss": 0.73, "mean_token_accuracy": 0.7817765884101391, "num_tokens": 136414822.0, "step": 4274 }, { "entropy": 0.7900633383542299, "epoch": 0.39332723791122537, "grad_norm": 0.1714436411857605, "learning_rate": 8.689238507069035e-05, "loss": 0.8136, "mean_token_accuracy": 0.7675349563360214, "num_tokens": 136446619.0, "step": 4275 }, { "entropy": 0.7011450156569481, "epoch": 0.39341924428266656, "grad_norm": 0.15032297372817993, "learning_rate": 8.688931824454873e-05, "loss": 0.6977, "mean_token_accuracy": 0.791289072483778, "num_tokens": 136478991.0, "step": 4276 }, { "entropy": 0.8527170699089766, "epoch": 0.3935112506541078, "grad_norm": 0.15444126725196838, "learning_rate": 8.68862514184071e-05, "loss": 0.8293, "mean_token_accuracy": 0.7543445117771626, "num_tokens": 136510226.0, "step": 4277 }, { "entropy": 0.8368568681180477, "epoch": 0.393603257025549, "grad_norm": 0.1593276858329773, "learning_rate": 8.688318459226547e-05, "loss": 0.8056, "mean_token_accuracy": 0.7639561183750629, "num_tokens": 136541571.0, "step": 4278 }, { "entropy": 0.8088554311543703, "epoch": 0.39369526339699024, "grad_norm": 0.15476170182228088, "learning_rate": 8.688011776612385e-05, "loss": 0.7923, "mean_token_accuracy": 0.771268505603075, "num_tokens": 136573398.0, "step": 4279 }, { "entropy": 0.7582065667957067, "epoch": 0.3937872697684315, "grad_norm": 0.15158085525035858, "learning_rate": 8.687705093998221e-05, "loss": 0.743, "mean_token_accuracy": 0.7769364193081856, "num_tokens": 136604760.0, "step": 4280 }, { "entropy": 0.8048241846263409, "epoch": 0.39387927613987267, "grad_norm": 0.15986472368240356, "learning_rate": 8.68739841138406e-05, "loss": 0.7715, "mean_token_accuracy": 0.7742272578179836, "num_tokens": 136637370.0, "step": 4281 }, { "entropy": 0.7341096103191376, "epoch": 0.3939712825113139, "grad_norm": 0.165479376912117, "learning_rate": 8.687091728769896e-05, "loss": 0.7303, "mean_token_accuracy": 0.7843291647732258, "num_tokens": 136668735.0, "step": 4282 }, { "entropy": 0.7234653905034065, "epoch": 0.39406328888275516, "grad_norm": 0.14720401167869568, "learning_rate": 8.686785046155735e-05, "loss": 0.7152, "mean_token_accuracy": 0.7899783402681351, "num_tokens": 136701323.0, "step": 4283 }, { "entropy": 0.7249206099659204, "epoch": 0.39415529525419635, "grad_norm": 0.14828458428382874, "learning_rate": 8.686478363541571e-05, "loss": 0.6987, "mean_token_accuracy": 0.7909929603338242, "num_tokens": 136733133.0, "step": 4284 }, { "entropy": 0.6868159528821707, "epoch": 0.3942473016256376, "grad_norm": 0.15236587822437286, "learning_rate": 8.686171680927408e-05, "loss": 0.7031, "mean_token_accuracy": 0.7894863039255142, "num_tokens": 136765351.0, "step": 4285 }, { "entropy": 0.6704693287611008, "epoch": 0.3943393079970788, "grad_norm": 0.16215863823890686, "learning_rate": 8.685864998313246e-05, "loss": 0.6858, "mean_token_accuracy": 0.7942287735641003, "num_tokens": 136797200.0, "step": 4286 }, { "entropy": 0.7387065887451172, "epoch": 0.39443131436852, "grad_norm": 0.1537497639656067, "learning_rate": 8.685558315699084e-05, "loss": 0.7361, "mean_token_accuracy": 0.7873684801161289, "num_tokens": 136829161.0, "step": 4287 }, { "entropy": 0.9072910137474537, "epoch": 0.39452332073996127, "grad_norm": 0.17608384788036346, "learning_rate": 8.685251633084921e-05, "loss": 0.946, "mean_token_accuracy": 0.7311474904417992, "num_tokens": 136861045.0, "step": 4288 }, { "entropy": 0.7872186508029699, "epoch": 0.39461532711140246, "grad_norm": 0.1784304976463318, "learning_rate": 8.684944950470758e-05, "loss": 0.813, "mean_token_accuracy": 0.769575472921133, "num_tokens": 136892542.0, "step": 4289 }, { "entropy": 0.684319069609046, "epoch": 0.3947073334828437, "grad_norm": 0.15635959804058075, "learning_rate": 8.684638267856595e-05, "loss": 0.6807, "mean_token_accuracy": 0.7998765744268894, "num_tokens": 136923989.0, "step": 4290 }, { "entropy": 0.7899093423038721, "epoch": 0.3947993398542849, "grad_norm": 0.1724378913640976, "learning_rate": 8.684331585242433e-05, "loss": 0.7908, "mean_token_accuracy": 0.771404180675745, "num_tokens": 136956557.0, "step": 4291 }, { "entropy": 0.7566580157727003, "epoch": 0.39489134622572614, "grad_norm": 0.1563936471939087, "learning_rate": 8.684024902628271e-05, "loss": 0.7471, "mean_token_accuracy": 0.780902124941349, "num_tokens": 136988634.0, "step": 4292 }, { "entropy": 0.8042337726801634, "epoch": 0.3949833525971674, "grad_norm": 0.16008716821670532, "learning_rate": 8.683718220014108e-05, "loss": 0.796, "mean_token_accuracy": 0.767993874847889, "num_tokens": 137021385.0, "step": 4293 }, { "entropy": 0.77345060557127, "epoch": 0.39507535896860857, "grad_norm": 0.14618268609046936, "learning_rate": 8.683411537399945e-05, "loss": 0.7497, "mean_token_accuracy": 0.7838089652359486, "num_tokens": 137052873.0, "step": 4294 }, { "entropy": 0.7985240500420332, "epoch": 0.3951673653400498, "grad_norm": 0.15207110345363617, "learning_rate": 8.683104854785783e-05, "loss": 0.8017, "mean_token_accuracy": 0.7672784924507141, "num_tokens": 137084794.0, "step": 4295 }, { "entropy": 0.937651090323925, "epoch": 0.395259371711491, "grad_norm": 0.16123130917549133, "learning_rate": 8.68279817217162e-05, "loss": 0.9136, "mean_token_accuracy": 0.7391834929585457, "num_tokens": 137116598.0, "step": 4296 }, { "entropy": 0.7977062333375216, "epoch": 0.39535137808293225, "grad_norm": 0.1509864777326584, "learning_rate": 8.682491489557458e-05, "loss": 0.7906, "mean_token_accuracy": 0.771388117223978, "num_tokens": 137148665.0, "step": 4297 }, { "entropy": 0.8245925344526768, "epoch": 0.3954433844543735, "grad_norm": 0.15272919833660126, "learning_rate": 8.682184806943294e-05, "loss": 0.7901, "mean_token_accuracy": 0.7726667374372482, "num_tokens": 137181255.0, "step": 4298 }, { "entropy": 0.8287330232560635, "epoch": 0.3955353908258147, "grad_norm": 0.15585428476333618, "learning_rate": 8.681878124329133e-05, "loss": 0.7988, "mean_token_accuracy": 0.7664231695234776, "num_tokens": 137212924.0, "step": 4299 }, { "entropy": 0.8473609127104282, "epoch": 0.3956273971972559, "grad_norm": 0.15894542634487152, "learning_rate": 8.68157144171497e-05, "loss": 0.83, "mean_token_accuracy": 0.7594563700258732, "num_tokens": 137244845.0, "step": 4300 }, { "entropy": 0.7810115776956081, "epoch": 0.3957194035686971, "grad_norm": 0.1618606001138687, "learning_rate": 8.681264759100806e-05, "loss": 0.7702, "mean_token_accuracy": 0.7758715488016605, "num_tokens": 137276824.0, "step": 4301 }, { "entropy": 0.8447426930069923, "epoch": 0.39581140994013836, "grad_norm": 0.15919001400470734, "learning_rate": 8.680958076486644e-05, "loss": 0.8469, "mean_token_accuracy": 0.7559487149119377, "num_tokens": 137308161.0, "step": 4302 }, { "entropy": 0.8000420778989792, "epoch": 0.3959034163115796, "grad_norm": 0.1614128053188324, "learning_rate": 8.680651393872482e-05, "loss": 0.7808, "mean_token_accuracy": 0.7753312401473522, "num_tokens": 137339822.0, "step": 4303 }, { "entropy": 0.8622737731784582, "epoch": 0.3959954226830208, "grad_norm": 0.16831503808498383, "learning_rate": 8.680344711258319e-05, "loss": 0.8613, "mean_token_accuracy": 0.7474303208291531, "num_tokens": 137370746.0, "step": 4304 }, { "entropy": 0.820012154057622, "epoch": 0.39608742905446204, "grad_norm": 0.16459505259990692, "learning_rate": 8.680038028644156e-05, "loss": 0.8215, "mean_token_accuracy": 0.7650977186858654, "num_tokens": 137401755.0, "step": 4305 }, { "entropy": 0.8205808475613594, "epoch": 0.3961794354259032, "grad_norm": 0.16316480934619904, "learning_rate": 8.679731346029994e-05, "loss": 0.8112, "mean_token_accuracy": 0.7645847611129284, "num_tokens": 137433290.0, "step": 4306 }, { "entropy": 0.7468543220311403, "epoch": 0.39627144179734447, "grad_norm": 0.15221144258975983, "learning_rate": 8.679424663415831e-05, "loss": 0.7395, "mean_token_accuracy": 0.7862758226692677, "num_tokens": 137465177.0, "step": 4307 }, { "entropy": 0.7493326682597399, "epoch": 0.3963634481687857, "grad_norm": 0.15214569866657257, "learning_rate": 8.679117980801669e-05, "loss": 0.7443, "mean_token_accuracy": 0.7795054204761982, "num_tokens": 137497466.0, "step": 4308 }, { "entropy": 0.7695858031511307, "epoch": 0.3964554545402269, "grad_norm": 0.15855616331100464, "learning_rate": 8.678811298187506e-05, "loss": 0.7658, "mean_token_accuracy": 0.7750889882445335, "num_tokens": 137529136.0, "step": 4309 }, { "entropy": 0.7066148780286312, "epoch": 0.39654746091166815, "grad_norm": 0.1577744334936142, "learning_rate": 8.678504615573344e-05, "loss": 0.7209, "mean_token_accuracy": 0.789254929870367, "num_tokens": 137561049.0, "step": 4310 }, { "entropy": 0.8105504773557186, "epoch": 0.39663946728310934, "grad_norm": 0.1580822914838791, "learning_rate": 8.678197932959181e-05, "loss": 0.8053, "mean_token_accuracy": 0.767706710845232, "num_tokens": 137593150.0, "step": 4311 }, { "entropy": 0.7754011638462543, "epoch": 0.3967314736545506, "grad_norm": 0.15686580538749695, "learning_rate": 8.677891250345018e-05, "loss": 0.7774, "mean_token_accuracy": 0.7751853466033936, "num_tokens": 137625751.0, "step": 4312 }, { "entropy": 0.754264336079359, "epoch": 0.3968234800259918, "grad_norm": 0.160162553191185, "learning_rate": 8.677584567730856e-05, "loss": 0.7424, "mean_token_accuracy": 0.7868561781942844, "num_tokens": 137657690.0, "step": 4313 }, { "entropy": 0.8559787590056658, "epoch": 0.396915486397433, "grad_norm": 0.1588020771741867, "learning_rate": 8.677277885116694e-05, "loss": 0.8561, "mean_token_accuracy": 0.7505843974649906, "num_tokens": 137689872.0, "step": 4314 }, { "entropy": 0.8546167500317097, "epoch": 0.39700749276887426, "grad_norm": 0.15839356184005737, "learning_rate": 8.676971202502531e-05, "loss": 0.8336, "mean_token_accuracy": 0.7555923834443092, "num_tokens": 137721259.0, "step": 4315 }, { "entropy": 0.7859054952859879, "epoch": 0.39709949914031545, "grad_norm": 0.16015814244747162, "learning_rate": 8.676664519888367e-05, "loss": 0.7713, "mean_token_accuracy": 0.7730723023414612, "num_tokens": 137752217.0, "step": 4316 }, { "entropy": 0.9331096261739731, "epoch": 0.3971915055117567, "grad_norm": 0.1636391580104828, "learning_rate": 8.676357837274204e-05, "loss": 0.9224, "mean_token_accuracy": 0.7360465787351131, "num_tokens": 137784331.0, "step": 4317 }, { "entropy": 0.8093492407351732, "epoch": 0.39728351188319794, "grad_norm": 0.15774591267108917, "learning_rate": 8.676051154660044e-05, "loss": 0.7868, "mean_token_accuracy": 0.7688788995146751, "num_tokens": 137815917.0, "step": 4318 }, { "entropy": 0.8006084896624088, "epoch": 0.3973755182546391, "grad_norm": 0.16358770430088043, "learning_rate": 8.67574447204588e-05, "loss": 0.7896, "mean_token_accuracy": 0.7703625224530697, "num_tokens": 137847458.0, "step": 4319 }, { "entropy": 0.8266694936901331, "epoch": 0.39746752462608037, "grad_norm": 0.1625903993844986, "learning_rate": 8.675437789431717e-05, "loss": 0.8288, "mean_token_accuracy": 0.7596943713724613, "num_tokens": 137879273.0, "step": 4320 }, { "entropy": 0.7928211949765682, "epoch": 0.39755953099752156, "grad_norm": 0.1588454693555832, "learning_rate": 8.675131106817554e-05, "loss": 0.7898, "mean_token_accuracy": 0.7695720046758652, "num_tokens": 137911378.0, "step": 4321 }, { "entropy": 0.7297004200518131, "epoch": 0.3976515373689628, "grad_norm": 0.157255619764328, "learning_rate": 8.674824424203392e-05, "loss": 0.7353, "mean_token_accuracy": 0.7844336591660976, "num_tokens": 137943323.0, "step": 4322 }, { "entropy": 0.8143177945166826, "epoch": 0.39774354374040405, "grad_norm": 0.16035771369934082, "learning_rate": 8.67451774158923e-05, "loss": 0.7984, "mean_token_accuracy": 0.7683944590389729, "num_tokens": 137974958.0, "step": 4323 }, { "entropy": 0.8592742905020714, "epoch": 0.39783555011184524, "grad_norm": 0.16616401076316833, "learning_rate": 8.674211058975067e-05, "loss": 0.839, "mean_token_accuracy": 0.7563778348267078, "num_tokens": 138007105.0, "step": 4324 }, { "entropy": 0.8701001964509487, "epoch": 0.3979275564832865, "grad_norm": 0.17079131305217743, "learning_rate": 8.673904376360904e-05, "loss": 0.8825, "mean_token_accuracy": 0.751967042684555, "num_tokens": 138038289.0, "step": 4325 }, { "entropy": 0.7534818202257156, "epoch": 0.39801956285472767, "grad_norm": 0.1567857712507248, "learning_rate": 8.673597693746742e-05, "loss": 0.7289, "mean_token_accuracy": 0.7845746502280235, "num_tokens": 138069749.0, "step": 4326 }, { "entropy": 0.770831873640418, "epoch": 0.3981115692261689, "grad_norm": 0.15538786351680756, "learning_rate": 8.673291011132579e-05, "loss": 0.7557, "mean_token_accuracy": 0.7827656641602516, "num_tokens": 138102209.0, "step": 4327 }, { "entropy": 0.8461679965257645, "epoch": 0.39820357559761016, "grad_norm": 0.1614655703306198, "learning_rate": 8.672984328518417e-05, "loss": 0.8384, "mean_token_accuracy": 0.7592774741351604, "num_tokens": 138132764.0, "step": 4328 }, { "entropy": 0.7551915813237429, "epoch": 0.39829558196905135, "grad_norm": 0.15248925983905792, "learning_rate": 8.672677645904254e-05, "loss": 0.7443, "mean_token_accuracy": 0.7850985825061798, "num_tokens": 138165392.0, "step": 4329 }, { "entropy": 0.8505535200238228, "epoch": 0.3983875883404926, "grad_norm": 0.16108348965644836, "learning_rate": 8.672370963290092e-05, "loss": 0.8524, "mean_token_accuracy": 0.752531997859478, "num_tokens": 138197036.0, "step": 4330 }, { "entropy": 0.7483100425451994, "epoch": 0.3984795947119338, "grad_norm": 0.1522454470396042, "learning_rate": 8.672064280675929e-05, "loss": 0.7392, "mean_token_accuracy": 0.785241074860096, "num_tokens": 138229521.0, "step": 4331 }, { "entropy": 0.7946486659348011, "epoch": 0.398571601083375, "grad_norm": 0.15325070917606354, "learning_rate": 8.671757598061766e-05, "loss": 0.7745, "mean_token_accuracy": 0.7760598808526993, "num_tokens": 138261681.0, "step": 4332 }, { "entropy": 0.7220129184424877, "epoch": 0.39866360745481627, "grad_norm": 0.14982889592647552, "learning_rate": 8.671450915447604e-05, "loss": 0.7212, "mean_token_accuracy": 0.7879708893597126, "num_tokens": 138293875.0, "step": 4333 }, { "entropy": 0.7530864644795656, "epoch": 0.39875561382625746, "grad_norm": 0.151821106672287, "learning_rate": 8.671144232833442e-05, "loss": 0.7565, "mean_token_accuracy": 0.7731948047876358, "num_tokens": 138326224.0, "step": 4334 }, { "entropy": 0.7817614804953337, "epoch": 0.3988476201976987, "grad_norm": 0.16419586539268494, "learning_rate": 8.670837550219279e-05, "loss": 0.7946, "mean_token_accuracy": 0.768190298229456, "num_tokens": 138357449.0, "step": 4335 }, { "entropy": 0.7034357935190201, "epoch": 0.3989396265691399, "grad_norm": 0.16165870428085327, "learning_rate": 8.670530867605115e-05, "loss": 0.6863, "mean_token_accuracy": 0.8008225671947002, "num_tokens": 138389783.0, "step": 4336 }, { "entropy": 0.8368466980755329, "epoch": 0.39903163294058114, "grad_norm": 0.16751877963542938, "learning_rate": 8.670224184990954e-05, "loss": 0.8205, "mean_token_accuracy": 0.7670840099453926, "num_tokens": 138420920.0, "step": 4337 }, { "entropy": 0.7278641182929277, "epoch": 0.3991236393120224, "grad_norm": 0.14888767898082733, "learning_rate": 8.66991750237679e-05, "loss": 0.7144, "mean_token_accuracy": 0.7880249805748463, "num_tokens": 138452709.0, "step": 4338 }, { "entropy": 0.8111402746289968, "epoch": 0.39921564568346357, "grad_norm": 0.15661753714084625, "learning_rate": 8.669610819762629e-05, "loss": 0.7911, "mean_token_accuracy": 0.7730852514505386, "num_tokens": 138484540.0, "step": 4339 }, { "entropy": 0.8350012861192226, "epoch": 0.3993076520549048, "grad_norm": 0.1669192910194397, "learning_rate": 8.669304137148465e-05, "loss": 0.8223, "mean_token_accuracy": 0.7658633068203926, "num_tokens": 138516567.0, "step": 4340 }, { "entropy": 0.8203798588365316, "epoch": 0.399399658426346, "grad_norm": 0.16246037185192108, "learning_rate": 8.668997454534303e-05, "loss": 0.8139, "mean_token_accuracy": 0.7564629353582859, "num_tokens": 138547967.0, "step": 4341 }, { "entropy": 0.8222418241202831, "epoch": 0.39949166479778725, "grad_norm": 0.14983804523944855, "learning_rate": 8.66869077192014e-05, "loss": 0.8249, "mean_token_accuracy": 0.7636446543037891, "num_tokens": 138580006.0, "step": 4342 }, { "entropy": 0.7522838991135359, "epoch": 0.3995836711692285, "grad_norm": 0.1591769903898239, "learning_rate": 8.668384089305977e-05, "loss": 0.7664, "mean_token_accuracy": 0.773526132106781, "num_tokens": 138611875.0, "step": 4343 }, { "entropy": 0.8121912702918053, "epoch": 0.3996756775406697, "grad_norm": 0.15853485465049744, "learning_rate": 8.668077406691815e-05, "loss": 0.8252, "mean_token_accuracy": 0.7632131651043892, "num_tokens": 138644196.0, "step": 4344 }, { "entropy": 0.8113891836255789, "epoch": 0.3997676839121109, "grad_norm": 0.15861161053180695, "learning_rate": 8.667770724077653e-05, "loss": 0.8039, "mean_token_accuracy": 0.7616065517067909, "num_tokens": 138676404.0, "step": 4345 }, { "entropy": 0.7169296145439148, "epoch": 0.3998596902835521, "grad_norm": 0.15718917548656464, "learning_rate": 8.66746404146349e-05, "loss": 0.737, "mean_token_accuracy": 0.7828649990260601, "num_tokens": 138709106.0, "step": 4346 }, { "entropy": 0.734160402789712, "epoch": 0.39995169665499336, "grad_norm": 0.1600690633058548, "learning_rate": 8.667157358849327e-05, "loss": 0.7356, "mean_token_accuracy": 0.7876906543970108, "num_tokens": 138740953.0, "step": 4347 }, { "entropy": 0.7680148780345917, "epoch": 0.4000437030264346, "grad_norm": 0.15159720182418823, "learning_rate": 8.666850676235164e-05, "loss": 0.74, "mean_token_accuracy": 0.7796390876173973, "num_tokens": 138772576.0, "step": 4348 }, { "entropy": 0.8035288937389851, "epoch": 0.4001357093978758, "grad_norm": 0.15289051830768585, "learning_rate": 8.666543993621002e-05, "loss": 0.7726, "mean_token_accuracy": 0.7722129039466381, "num_tokens": 138803684.0, "step": 4349 }, { "entropy": 0.7351873833686113, "epoch": 0.40022771576931704, "grad_norm": 0.15200111269950867, "learning_rate": 8.66623731100684e-05, "loss": 0.7178, "mean_token_accuracy": 0.7889161519706249, "num_tokens": 138835837.0, "step": 4350 }, { "entropy": 0.8093269243836403, "epoch": 0.4003197221407582, "grad_norm": 0.16740332543849945, "learning_rate": 8.665930628392677e-05, "loss": 0.7901, "mean_token_accuracy": 0.769905298948288, "num_tokens": 138868097.0, "step": 4351 }, { "entropy": 0.7818273957818747, "epoch": 0.40041172851219947, "grad_norm": 0.14954563975334167, "learning_rate": 8.665623945778514e-05, "loss": 0.7804, "mean_token_accuracy": 0.7757586017251015, "num_tokens": 138900751.0, "step": 4352 }, { "entropy": 0.8011466711759567, "epoch": 0.4005037348836407, "grad_norm": 0.15709596872329712, "learning_rate": 8.665317263164352e-05, "loss": 0.7915, "mean_token_accuracy": 0.7707890272140503, "num_tokens": 138933101.0, "step": 4353 }, { "entropy": 0.7234791070222855, "epoch": 0.4005957412550819, "grad_norm": 0.15680277347564697, "learning_rate": 8.665010580550188e-05, "loss": 0.694, "mean_token_accuracy": 0.7997357398271561, "num_tokens": 138964099.0, "step": 4354 }, { "entropy": 0.7901899572461843, "epoch": 0.40068774762652315, "grad_norm": 0.14949503540992737, "learning_rate": 8.664703897936027e-05, "loss": 0.7797, "mean_token_accuracy": 0.7754409089684486, "num_tokens": 138996405.0, "step": 4355 }, { "entropy": 0.8166088368743658, "epoch": 0.40077975399796434, "grad_norm": 0.15932045876979828, "learning_rate": 8.664397215321863e-05, "loss": 0.7967, "mean_token_accuracy": 0.7657454647123814, "num_tokens": 139028357.0, "step": 4356 }, { "entropy": 0.7152461688965559, "epoch": 0.4008717603694056, "grad_norm": 0.1614648848772049, "learning_rate": 8.664090532707702e-05, "loss": 0.701, "mean_token_accuracy": 0.7940308749675751, "num_tokens": 139060095.0, "step": 4357 }, { "entropy": 0.7782885786145926, "epoch": 0.4009637667408468, "grad_norm": 0.1671127825975418, "learning_rate": 8.663783850093538e-05, "loss": 0.7848, "mean_token_accuracy": 0.7726522460579872, "num_tokens": 139092095.0, "step": 4358 }, { "entropy": 0.898818988353014, "epoch": 0.401055773112288, "grad_norm": 0.1624075472354889, "learning_rate": 8.663477167479375e-05, "loss": 0.9155, "mean_token_accuracy": 0.737066775560379, "num_tokens": 139124475.0, "step": 4359 }, { "entropy": 0.856828112155199, "epoch": 0.40114777948372926, "grad_norm": 0.1574203222990036, "learning_rate": 8.663170484865213e-05, "loss": 0.8422, "mean_token_accuracy": 0.7536935247480869, "num_tokens": 139155822.0, "step": 4360 }, { "entropy": 0.8152277041226625, "epoch": 0.40123978585517045, "grad_norm": 0.1566011756658554, "learning_rate": 8.662863802251051e-05, "loss": 0.8225, "mean_token_accuracy": 0.7585791945457458, "num_tokens": 139187371.0, "step": 4361 }, { "entropy": 0.823297169059515, "epoch": 0.4013317922266117, "grad_norm": 0.15950189530849457, "learning_rate": 8.662557119636888e-05, "loss": 0.8298, "mean_token_accuracy": 0.7632873877882957, "num_tokens": 139219502.0, "step": 4362 }, { "entropy": 0.9366223216056824, "epoch": 0.40142379859805294, "grad_norm": 0.17130129039287567, "learning_rate": 8.662250437022725e-05, "loss": 0.9342, "mean_token_accuracy": 0.7291664034128189, "num_tokens": 139250256.0, "step": 4363 }, { "entropy": 0.8843834362924099, "epoch": 0.40151580496949413, "grad_norm": 0.16095633804798126, "learning_rate": 8.661943754408563e-05, "loss": 0.8929, "mean_token_accuracy": 0.7426904924213886, "num_tokens": 139281990.0, "step": 4364 }, { "entropy": 0.8356434013694525, "epoch": 0.4016078113409354, "grad_norm": 0.15358003973960876, "learning_rate": 8.661637071794401e-05, "loss": 0.8058, "mean_token_accuracy": 0.7667003460228443, "num_tokens": 139314261.0, "step": 4365 }, { "entropy": 0.8377423249185085, "epoch": 0.40169981771237656, "grad_norm": 0.15498553216457367, "learning_rate": 8.661330389180238e-05, "loss": 0.8306, "mean_token_accuracy": 0.7625199258327484, "num_tokens": 139346923.0, "step": 4366 }, { "entropy": 0.6710847076028585, "epoch": 0.4017918240838178, "grad_norm": 0.15641725063323975, "learning_rate": 8.661023706566075e-05, "loss": 0.656, "mean_token_accuracy": 0.806025180965662, "num_tokens": 139379488.0, "step": 4367 }, { "entropy": 0.7980338409543037, "epoch": 0.40188383045525905, "grad_norm": 0.15308572351932526, "learning_rate": 8.660717023951913e-05, "loss": 0.7839, "mean_token_accuracy": 0.7716925702989101, "num_tokens": 139411549.0, "step": 4368 }, { "entropy": 0.8410529643297195, "epoch": 0.40197583682670024, "grad_norm": 0.1620626449584961, "learning_rate": 8.66041034133775e-05, "loss": 0.8173, "mean_token_accuracy": 0.7642960585653782, "num_tokens": 139443055.0, "step": 4369 }, { "entropy": 0.8511195350438356, "epoch": 0.4020678431981415, "grad_norm": 0.1533229947090149, "learning_rate": 8.660103658723588e-05, "loss": 0.8262, "mean_token_accuracy": 0.7589772045612335, "num_tokens": 139474675.0, "step": 4370 }, { "entropy": 0.7632060684263706, "epoch": 0.4021598495695827, "grad_norm": 0.1501828283071518, "learning_rate": 8.659796976109425e-05, "loss": 0.7306, "mean_token_accuracy": 0.7851455770432949, "num_tokens": 139507434.0, "step": 4371 }, { "entropy": 0.7548919897526503, "epoch": 0.4022518559410239, "grad_norm": 0.15556472539901733, "learning_rate": 8.659490293495263e-05, "loss": 0.733, "mean_token_accuracy": 0.7884932719171047, "num_tokens": 139539464.0, "step": 4372 }, { "entropy": 0.7639422863721848, "epoch": 0.40234386231246516, "grad_norm": 0.16604238748550415, "learning_rate": 8.6591836108811e-05, "loss": 0.7806, "mean_token_accuracy": 0.7796287871897221, "num_tokens": 139571503.0, "step": 4373 }, { "entropy": 0.8212047293782234, "epoch": 0.40243586868390635, "grad_norm": 0.16611728072166443, "learning_rate": 8.658876928266936e-05, "loss": 0.8379, "mean_token_accuracy": 0.7611560299992561, "num_tokens": 139603577.0, "step": 4374 }, { "entropy": 0.7269526608288288, "epoch": 0.4025278750553476, "grad_norm": 0.16269703209400177, "learning_rate": 8.658570245652775e-05, "loss": 0.738, "mean_token_accuracy": 0.7864685878157616, "num_tokens": 139636122.0, "step": 4375 }, { "entropy": 0.7711403258144855, "epoch": 0.4026198814267888, "grad_norm": 0.1556607037782669, "learning_rate": 8.658263563038613e-05, "loss": 0.7789, "mean_token_accuracy": 0.7728221789002419, "num_tokens": 139667336.0, "step": 4376 }, { "entropy": 0.8380633220076561, "epoch": 0.40271188779823003, "grad_norm": 0.1631087362766266, "learning_rate": 8.65795688042445e-05, "loss": 0.8537, "mean_token_accuracy": 0.7554492801427841, "num_tokens": 139699293.0, "step": 4377 }, { "entropy": 0.7276904974132776, "epoch": 0.4028038941696713, "grad_norm": 0.15230897068977356, "learning_rate": 8.657650197810286e-05, "loss": 0.7195, "mean_token_accuracy": 0.7878586314618587, "num_tokens": 139731212.0, "step": 4378 }, { "entropy": 0.8463601693511009, "epoch": 0.40289590054111246, "grad_norm": 0.16354668140411377, "learning_rate": 8.657343515196123e-05, "loss": 0.84, "mean_token_accuracy": 0.7537868209183216, "num_tokens": 139763439.0, "step": 4379 }, { "entropy": 0.8674339726567268, "epoch": 0.4029879069125537, "grad_norm": 0.1607319414615631, "learning_rate": 8.657036832581961e-05, "loss": 0.854, "mean_token_accuracy": 0.754186425358057, "num_tokens": 139794530.0, "step": 4380 }, { "entropy": 0.874748582020402, "epoch": 0.4030799132839949, "grad_norm": 0.15621648728847504, "learning_rate": 8.656730149967799e-05, "loss": 0.8384, "mean_token_accuracy": 0.7574009224772453, "num_tokens": 139826587.0, "step": 4381 }, { "entropy": 0.7991771008819342, "epoch": 0.40317191965543614, "grad_norm": 0.154558926820755, "learning_rate": 8.656423467353636e-05, "loss": 0.7814, "mean_token_accuracy": 0.7703753225505352, "num_tokens": 139858899.0, "step": 4382 }, { "entropy": 0.7530431412160397, "epoch": 0.4032639260268774, "grad_norm": 0.15306991338729858, "learning_rate": 8.656116784739473e-05, "loss": 0.741, "mean_token_accuracy": 0.782896164804697, "num_tokens": 139890923.0, "step": 4383 }, { "entropy": 0.7990904599428177, "epoch": 0.4033559323983186, "grad_norm": 0.15840773284435272, "learning_rate": 8.655810102125311e-05, "loss": 0.7775, "mean_token_accuracy": 0.775368720293045, "num_tokens": 139923536.0, "step": 4384 }, { "entropy": 0.8068835251033306, "epoch": 0.4034479387697598, "grad_norm": 0.16360025107860565, "learning_rate": 8.655503419511148e-05, "loss": 0.7807, "mean_token_accuracy": 0.7728019952774048, "num_tokens": 139954054.0, "step": 4385 }, { "entropy": 0.7142554558813572, "epoch": 0.403539945141201, "grad_norm": 0.15966735780239105, "learning_rate": 8.655196736896986e-05, "loss": 0.719, "mean_token_accuracy": 0.7924164421856403, "num_tokens": 139986466.0, "step": 4386 }, { "entropy": 0.7812010534107685, "epoch": 0.40363195151264225, "grad_norm": 0.1539911925792694, "learning_rate": 8.654890054282823e-05, "loss": 0.7581, "mean_token_accuracy": 0.7777816094458103, "num_tokens": 140018757.0, "step": 4387 }, { "entropy": 0.7832820136100054, "epoch": 0.4037239578840835, "grad_norm": 0.16208499670028687, "learning_rate": 8.654583371668661e-05, "loss": 0.7933, "mean_token_accuracy": 0.7677854746580124, "num_tokens": 140051229.0, "step": 4388 }, { "entropy": 0.8392529226839542, "epoch": 0.4038159642555247, "grad_norm": 0.1629580855369568, "learning_rate": 8.654276689054498e-05, "loss": 0.8463, "mean_token_accuracy": 0.7555507831275463, "num_tokens": 140083055.0, "step": 4389 }, { "entropy": 0.8610566146671772, "epoch": 0.40390797062696593, "grad_norm": 0.16852208971977234, "learning_rate": 8.653970006440334e-05, "loss": 0.8751, "mean_token_accuracy": 0.7478588446974754, "num_tokens": 140114323.0, "step": 4390 }, { "entropy": 0.8258617594838142, "epoch": 0.4039999769984071, "grad_norm": 0.1572355031967163, "learning_rate": 8.653663323826173e-05, "loss": 0.8065, "mean_token_accuracy": 0.7665948644280434, "num_tokens": 140146514.0, "step": 4391 }, { "entropy": 0.8448238484561443, "epoch": 0.40409198336984836, "grad_norm": 0.15524406731128693, "learning_rate": 8.653356641212011e-05, "loss": 0.8214, "mean_token_accuracy": 0.7622006013989449, "num_tokens": 140178820.0, "step": 4392 }, { "entropy": 0.7447648253291845, "epoch": 0.4041839897412896, "grad_norm": 0.15681302547454834, "learning_rate": 8.653049958597848e-05, "loss": 0.7081, "mean_token_accuracy": 0.7899158671498299, "num_tokens": 140210336.0, "step": 4393 }, { "entropy": 0.8720273859798908, "epoch": 0.4042759961127308, "grad_norm": 0.16244713962078094, "learning_rate": 8.652743275983684e-05, "loss": 0.8817, "mean_token_accuracy": 0.7403237372636795, "num_tokens": 140242820.0, "step": 4394 }, { "entropy": 0.8931030556559563, "epoch": 0.40436800248417204, "grad_norm": 0.15651057660579681, "learning_rate": 8.652436593369522e-05, "loss": 0.868, "mean_token_accuracy": 0.7480721473693848, "num_tokens": 140274087.0, "step": 4395 }, { "entropy": 0.8616100549697876, "epoch": 0.40446000885561323, "grad_norm": 0.15598443150520325, "learning_rate": 8.65212991075536e-05, "loss": 0.8472, "mean_token_accuracy": 0.7566724345088005, "num_tokens": 140305391.0, "step": 4396 }, { "entropy": 0.8557443954050541, "epoch": 0.4045520152270545, "grad_norm": 0.16841615736484528, "learning_rate": 8.651823228141197e-05, "loss": 0.852, "mean_token_accuracy": 0.7599308714270592, "num_tokens": 140337456.0, "step": 4397 }, { "entropy": 0.8096117936074734, "epoch": 0.4046440215984957, "grad_norm": 0.1635141372680664, "learning_rate": 8.651516545527034e-05, "loss": 0.8073, "mean_token_accuracy": 0.767000712454319, "num_tokens": 140368839.0, "step": 4398 }, { "entropy": 0.7693778425455093, "epoch": 0.4047360279699369, "grad_norm": 0.16135410964488983, "learning_rate": 8.651209862912872e-05, "loss": 0.7605, "mean_token_accuracy": 0.7752859182655811, "num_tokens": 140399639.0, "step": 4399 }, { "entropy": 0.799664419144392, "epoch": 0.40482803434137815, "grad_norm": 0.1578240990638733, "learning_rate": 8.650903180298709e-05, "loss": 0.8087, "mean_token_accuracy": 0.7661591097712517, "num_tokens": 140432346.0, "step": 4400 }, { "entropy": 0.7535984646528959, "epoch": 0.40492004071281934, "grad_norm": 0.15361344814300537, "learning_rate": 8.650596497684547e-05, "loss": 0.7441, "mean_token_accuracy": 0.7805181406438351, "num_tokens": 140463906.0, "step": 4401 }, { "entropy": 0.8459362555295229, "epoch": 0.4050120470842606, "grad_norm": 0.16780316829681396, "learning_rate": 8.650289815070384e-05, "loss": 0.8449, "mean_token_accuracy": 0.7589607797563076, "num_tokens": 140495386.0, "step": 4402 }, { "entropy": 0.7918718364089727, "epoch": 0.40510405345570183, "grad_norm": 0.1662161499261856, "learning_rate": 8.649983132456222e-05, "loss": 0.7838, "mean_token_accuracy": 0.7718579657375813, "num_tokens": 140526714.0, "step": 4403 }, { "entropy": 0.7667257878929377, "epoch": 0.405196059827143, "grad_norm": 0.15810644626617432, "learning_rate": 8.649676449842059e-05, "loss": 0.7324, "mean_token_accuracy": 0.7862285822629929, "num_tokens": 140558435.0, "step": 4404 }, { "entropy": 0.7377495765686035, "epoch": 0.40528806619858426, "grad_norm": 0.15324118733406067, "learning_rate": 8.649369767227896e-05, "loss": 0.7326, "mean_token_accuracy": 0.7865590341389179, "num_tokens": 140590914.0, "step": 4405 }, { "entropy": 0.7309749200940132, "epoch": 0.40538007257002545, "grad_norm": 0.153891459107399, "learning_rate": 8.649063084613734e-05, "loss": 0.7066, "mean_token_accuracy": 0.7905550599098206, "num_tokens": 140622549.0, "step": 4406 }, { "entropy": 0.8043077792972326, "epoch": 0.4054720789414667, "grad_norm": 0.15959028899669647, "learning_rate": 8.648756401999572e-05, "loss": 0.8028, "mean_token_accuracy": 0.7678774110972881, "num_tokens": 140653791.0, "step": 4407 }, { "entropy": 0.6953172907233238, "epoch": 0.40556408531290794, "grad_norm": 0.15356136858463287, "learning_rate": 8.648449719385409e-05, "loss": 0.6764, "mean_token_accuracy": 0.7992066331207752, "num_tokens": 140685933.0, "step": 4408 }, { "entropy": 0.8016958180814981, "epoch": 0.40565609168434913, "grad_norm": 0.1597042977809906, "learning_rate": 8.648143036771246e-05, "loss": 0.8183, "mean_token_accuracy": 0.7641748376190662, "num_tokens": 140718473.0, "step": 4409 }, { "entropy": 0.702772244811058, "epoch": 0.4057480980557904, "grad_norm": 0.1660853773355484, "learning_rate": 8.647836354157082e-05, "loss": 0.721, "mean_token_accuracy": 0.7909088432788849, "num_tokens": 140750967.0, "step": 4410 }, { "entropy": 0.8495804965496063, "epoch": 0.40584010442723156, "grad_norm": 0.15766669809818268, "learning_rate": 8.64752967154292e-05, "loss": 0.8481, "mean_token_accuracy": 0.7529854439198971, "num_tokens": 140783596.0, "step": 4411 }, { "entropy": 0.7856400441378355, "epoch": 0.4059321107986728, "grad_norm": 0.15926417708396912, "learning_rate": 8.647222988928759e-05, "loss": 0.7781, "mean_token_accuracy": 0.773051880300045, "num_tokens": 140815464.0, "step": 4412 }, { "entropy": 0.8292854055762291, "epoch": 0.40602411717011405, "grad_norm": 0.16010980308055878, "learning_rate": 8.646916306314595e-05, "loss": 0.8308, "mean_token_accuracy": 0.7566285394132137, "num_tokens": 140846860.0, "step": 4413 }, { "entropy": 0.7906942293047905, "epoch": 0.40611612354155524, "grad_norm": 0.16458505392074585, "learning_rate": 8.646609623700432e-05, "loss": 0.7887, "mean_token_accuracy": 0.7710746452212334, "num_tokens": 140878690.0, "step": 4414 }, { "entropy": 0.7755707073956728, "epoch": 0.4062081299129965, "grad_norm": 0.15910686552524567, "learning_rate": 8.64630294108627e-05, "loss": 0.777, "mean_token_accuracy": 0.7752445228397846, "num_tokens": 140910747.0, "step": 4415 }, { "entropy": 0.8846572302281857, "epoch": 0.4063001362844377, "grad_norm": 0.16207630932331085, "learning_rate": 8.645996258472107e-05, "loss": 0.8993, "mean_token_accuracy": 0.7408503852784634, "num_tokens": 140943036.0, "step": 4416 }, { "entropy": 0.8487497866153717, "epoch": 0.4063921426558789, "grad_norm": 0.16231302917003632, "learning_rate": 8.645689575857945e-05, "loss": 0.839, "mean_token_accuracy": 0.7565212175250053, "num_tokens": 140974592.0, "step": 4417 }, { "entropy": 0.81348673440516, "epoch": 0.40648414902732016, "grad_norm": 0.1637900173664093, "learning_rate": 8.645382893243782e-05, "loss": 0.8181, "mean_token_accuracy": 0.7659032456576824, "num_tokens": 141006514.0, "step": 4418 }, { "entropy": 0.8530094493180513, "epoch": 0.40657615539876135, "grad_norm": 0.1574660837650299, "learning_rate": 8.64507621062962e-05, "loss": 0.8181, "mean_token_accuracy": 0.7609489448368549, "num_tokens": 141037357.0, "step": 4419 }, { "entropy": 0.8112359046936035, "epoch": 0.4066681617702026, "grad_norm": 0.15547984838485718, "learning_rate": 8.644769528015457e-05, "loss": 0.8002, "mean_token_accuracy": 0.7652879916131496, "num_tokens": 141069297.0, "step": 4420 }, { "entropy": 0.814957071095705, "epoch": 0.4067601681416438, "grad_norm": 0.15996059775352478, "learning_rate": 8.644462845401294e-05, "loss": 0.7878, "mean_token_accuracy": 0.767077375203371, "num_tokens": 141100877.0, "step": 4421 }, { "entropy": 0.8584911096841097, "epoch": 0.40685217451308503, "grad_norm": 0.1557500958442688, "learning_rate": 8.644156162787132e-05, "loss": 0.8324, "mean_token_accuracy": 0.764381255954504, "num_tokens": 141132394.0, "step": 4422 }, { "entropy": 0.7907221205532551, "epoch": 0.4069441808845263, "grad_norm": 0.1539715975522995, "learning_rate": 8.64384948017297e-05, "loss": 0.7757, "mean_token_accuracy": 0.7714317068457603, "num_tokens": 141164845.0, "step": 4423 }, { "entropy": 0.798371834680438, "epoch": 0.40703618725596746, "grad_norm": 0.15604925155639648, "learning_rate": 8.643542797558807e-05, "loss": 0.7696, "mean_token_accuracy": 0.7783607468008995, "num_tokens": 141197453.0, "step": 4424 }, { "entropy": 0.8110921010375023, "epoch": 0.4071281936274087, "grad_norm": 0.16168037056922913, "learning_rate": 8.643236114944644e-05, "loss": 0.8162, "mean_token_accuracy": 0.76149046048522, "num_tokens": 141229987.0, "step": 4425 }, { "entropy": 0.8156020194292068, "epoch": 0.4072201999988499, "grad_norm": 0.16232316195964813, "learning_rate": 8.642929432330482e-05, "loss": 0.8246, "mean_token_accuracy": 0.762397114187479, "num_tokens": 141262159.0, "step": 4426 }, { "entropy": 0.7790936883538961, "epoch": 0.40731220637029114, "grad_norm": 0.160179004073143, "learning_rate": 8.642622749716319e-05, "loss": 0.7657, "mean_token_accuracy": 0.7771575339138508, "num_tokens": 141293935.0, "step": 4427 }, { "entropy": 0.7660750858485699, "epoch": 0.4074042127417324, "grad_norm": 0.1555587500333786, "learning_rate": 8.642316067102157e-05, "loss": 0.7526, "mean_token_accuracy": 0.77826377004385, "num_tokens": 141325719.0, "step": 4428 }, { "entropy": 0.7566420994699001, "epoch": 0.4074962191131736, "grad_norm": 0.15105167031288147, "learning_rate": 8.642009384487994e-05, "loss": 0.7496, "mean_token_accuracy": 0.7799227237701416, "num_tokens": 141357617.0, "step": 4429 }, { "entropy": 0.7919972352683544, "epoch": 0.4075882254846148, "grad_norm": 0.16174845397472382, "learning_rate": 8.641702701873832e-05, "loss": 0.8051, "mean_token_accuracy": 0.7682539783418179, "num_tokens": 141390157.0, "step": 4430 }, { "entropy": 0.7196703441441059, "epoch": 0.407680231856056, "grad_norm": 0.1548367440700531, "learning_rate": 8.641396019259668e-05, "loss": 0.709, "mean_token_accuracy": 0.788318607956171, "num_tokens": 141421525.0, "step": 4431 }, { "entropy": 0.810057956725359, "epoch": 0.40777223822749725, "grad_norm": 0.1695951372385025, "learning_rate": 8.641089336645505e-05, "loss": 0.8002, "mean_token_accuracy": 0.7691741995513439, "num_tokens": 141453070.0, "step": 4432 }, { "entropy": 0.7625819928944111, "epoch": 0.4078642445989385, "grad_norm": 0.15615350008010864, "learning_rate": 8.640782654031343e-05, "loss": 0.7474, "mean_token_accuracy": 0.7791758738458157, "num_tokens": 141485489.0, "step": 4433 }, { "entropy": 0.7726743742823601, "epoch": 0.4079562509703797, "grad_norm": 0.16402466595172882, "learning_rate": 8.640475971417182e-05, "loss": 0.7989, "mean_token_accuracy": 0.7669868655502796, "num_tokens": 141517033.0, "step": 4434 }, { "entropy": 0.7887890134006739, "epoch": 0.40804825734182093, "grad_norm": 0.15921424329280853, "learning_rate": 8.640169288803018e-05, "loss": 0.7702, "mean_token_accuracy": 0.7757945694029331, "num_tokens": 141548409.0, "step": 4435 }, { "entropy": 0.9329372271895409, "epoch": 0.4081402637132621, "grad_norm": 0.16700181365013123, "learning_rate": 8.639862606188855e-05, "loss": 0.9567, "mean_token_accuracy": 0.7301460392773151, "num_tokens": 141580862.0, "step": 4436 }, { "entropy": 0.6948123220354319, "epoch": 0.40823227008470336, "grad_norm": 0.15304003655910492, "learning_rate": 8.639555923574692e-05, "loss": 0.6786, "mean_token_accuracy": 0.8021107725799084, "num_tokens": 141613085.0, "step": 4437 }, { "entropy": 0.8161844778805971, "epoch": 0.4083242764561446, "grad_norm": 0.15728680789470673, "learning_rate": 8.639249240960531e-05, "loss": 0.7895, "mean_token_accuracy": 0.7682610228657722, "num_tokens": 141643808.0, "step": 4438 }, { "entropy": 0.8301820047199726, "epoch": 0.4084162828275858, "grad_norm": 0.15470553934574127, "learning_rate": 8.638942558346368e-05, "loss": 0.8201, "mean_token_accuracy": 0.7643483802676201, "num_tokens": 141676157.0, "step": 4439 }, { "entropy": 0.7751942370086908, "epoch": 0.40850828919902704, "grad_norm": 0.15568998456001282, "learning_rate": 8.638635875732205e-05, "loss": 0.7637, "mean_token_accuracy": 0.7822869941592216, "num_tokens": 141708606.0, "step": 4440 }, { "entropy": 0.7915365658700466, "epoch": 0.40860029557046823, "grad_norm": 0.16705860197544098, "learning_rate": 8.638329193118042e-05, "loss": 0.8064, "mean_token_accuracy": 0.7688088715076447, "num_tokens": 141739206.0, "step": 4441 }, { "entropy": 0.865421686321497, "epoch": 0.4086923019419095, "grad_norm": 0.1614251285791397, "learning_rate": 8.63802251050388e-05, "loss": 0.8571, "mean_token_accuracy": 0.7511120177805424, "num_tokens": 141770978.0, "step": 4442 }, { "entropy": 0.7717647161334753, "epoch": 0.4087843083133507, "grad_norm": 0.15876436233520508, "learning_rate": 8.637715827889718e-05, "loss": 0.746, "mean_token_accuracy": 0.7820917665958405, "num_tokens": 141801692.0, "step": 4443 }, { "entropy": 0.8512538466602564, "epoch": 0.4088763146847919, "grad_norm": 0.15755128860473633, "learning_rate": 8.637409145275555e-05, "loss": 0.8286, "mean_token_accuracy": 0.7579855173826218, "num_tokens": 141833621.0, "step": 4444 }, { "entropy": 0.9346518963575363, "epoch": 0.40896832105623315, "grad_norm": 0.16812890768051147, "learning_rate": 8.637102462661392e-05, "loss": 0.9452, "mean_token_accuracy": 0.732193510979414, "num_tokens": 141864629.0, "step": 4445 }, { "entropy": 0.7931847050786018, "epoch": 0.40906032742767434, "grad_norm": 0.1558278352022171, "learning_rate": 8.63679578004723e-05, "loss": 0.7642, "mean_token_accuracy": 0.7759575694799423, "num_tokens": 141895955.0, "step": 4446 }, { "entropy": 0.7662760373204947, "epoch": 0.4091523337991156, "grad_norm": 0.1502440869808197, "learning_rate": 8.636489097433067e-05, "loss": 0.768, "mean_token_accuracy": 0.7751294448971748, "num_tokens": 141928326.0, "step": 4447 }, { "entropy": 0.8639170415699482, "epoch": 0.40924434017055683, "grad_norm": 0.16111339628696442, "learning_rate": 8.636182414818905e-05, "loss": 0.8737, "mean_token_accuracy": 0.7456318736076355, "num_tokens": 141960291.0, "step": 4448 }, { "entropy": 0.841278214007616, "epoch": 0.409336346541998, "grad_norm": 0.16120018064975739, "learning_rate": 8.635875732204741e-05, "loss": 0.8449, "mean_token_accuracy": 0.756111066788435, "num_tokens": 141992400.0, "step": 4449 }, { "entropy": 0.8230916727334261, "epoch": 0.40942835291343926, "grad_norm": 0.16274812817573547, "learning_rate": 8.63556904959058e-05, "loss": 0.8259, "mean_token_accuracy": 0.7600231841206551, "num_tokens": 142024297.0, "step": 4450 }, { "entropy": 0.7310503367334604, "epoch": 0.40952035928488045, "grad_norm": 0.1569739431142807, "learning_rate": 8.635262366976416e-05, "loss": 0.7285, "mean_token_accuracy": 0.7884849384427071, "num_tokens": 142056662.0, "step": 4451 }, { "entropy": 0.8406836800277233, "epoch": 0.4096123656563217, "grad_norm": 0.15605272352695465, "learning_rate": 8.634955684362253e-05, "loss": 0.8343, "mean_token_accuracy": 0.7578239478170872, "num_tokens": 142089303.0, "step": 4452 }, { "entropy": 0.6994310673326254, "epoch": 0.40970437202776294, "grad_norm": 0.15623538196086884, "learning_rate": 8.634649001748091e-05, "loss": 0.6998, "mean_token_accuracy": 0.7943422794342041, "num_tokens": 142120972.0, "step": 4453 }, { "entropy": 0.7687908485531807, "epoch": 0.40979637839920413, "grad_norm": 0.15554869174957275, "learning_rate": 8.63434231913393e-05, "loss": 0.7659, "mean_token_accuracy": 0.7805722877383232, "num_tokens": 142153041.0, "step": 4454 }, { "entropy": 0.7145817615091801, "epoch": 0.4098883847706454, "grad_norm": 0.16439685225486755, "learning_rate": 8.634035636519766e-05, "loss": 0.7235, "mean_token_accuracy": 0.7925615310668945, "num_tokens": 142185663.0, "step": 4455 }, { "entropy": 0.8337932247668505, "epoch": 0.40998039114208656, "grad_norm": 0.1622476875782013, "learning_rate": 8.633728953905603e-05, "loss": 0.8101, "mean_token_accuracy": 0.7659592442214489, "num_tokens": 142216926.0, "step": 4456 }, { "entropy": 0.9399528801441193, "epoch": 0.4100723975135278, "grad_norm": 0.16711848974227905, "learning_rate": 8.633422271291441e-05, "loss": 0.9199, "mean_token_accuracy": 0.7328242510557175, "num_tokens": 142248984.0, "step": 4457 }, { "entropy": 0.7629917785525322, "epoch": 0.41016440388496905, "grad_norm": 0.15555231273174286, "learning_rate": 8.633115588677278e-05, "loss": 0.7509, "mean_token_accuracy": 0.7861757166683674, "num_tokens": 142280810.0, "step": 4458 }, { "entropy": 0.7829546481370926, "epoch": 0.41025641025641024, "grad_norm": 0.1643492728471756, "learning_rate": 8.632808906063116e-05, "loss": 0.7806, "mean_token_accuracy": 0.77272704616189, "num_tokens": 142311857.0, "step": 4459 }, { "entropy": 0.8448965847492218, "epoch": 0.4103484166278515, "grad_norm": 0.15490096807479858, "learning_rate": 8.632502223448953e-05, "loss": 0.819, "mean_token_accuracy": 0.7602185644209385, "num_tokens": 142343841.0, "step": 4460 }, { "entropy": 0.8499212004244328, "epoch": 0.4104404229992927, "grad_norm": 0.16372014582157135, "learning_rate": 8.632195540834791e-05, "loss": 0.8594, "mean_token_accuracy": 0.7490151524543762, "num_tokens": 142375146.0, "step": 4461 }, { "entropy": 0.7642384711652994, "epoch": 0.4105324293707339, "grad_norm": 0.15880227088928223, "learning_rate": 8.631888858220628e-05, "loss": 0.7612, "mean_token_accuracy": 0.7778050191700459, "num_tokens": 142407551.0, "step": 4462 }, { "entropy": 0.7772066071629524, "epoch": 0.41062443574217516, "grad_norm": 0.1589951515197754, "learning_rate": 8.631582175606465e-05, "loss": 0.7653, "mean_token_accuracy": 0.7732919342815876, "num_tokens": 142438823.0, "step": 4463 }, { "entropy": 0.7889354079961777, "epoch": 0.41071644211361635, "grad_norm": 0.15745997428894043, "learning_rate": 8.631275492992303e-05, "loss": 0.7541, "mean_token_accuracy": 0.778324194252491, "num_tokens": 142470458.0, "step": 4464 }, { "entropy": 0.8007081858813763, "epoch": 0.4108084484850576, "grad_norm": 0.16317686438560486, "learning_rate": 8.630968810378141e-05, "loss": 0.8051, "mean_token_accuracy": 0.7674171887338161, "num_tokens": 142501913.0, "step": 4465 }, { "entropy": 0.7459885701537132, "epoch": 0.4109004548564988, "grad_norm": 0.16091863811016083, "learning_rate": 8.630662127763978e-05, "loss": 0.7488, "mean_token_accuracy": 0.7804193794727325, "num_tokens": 142533497.0, "step": 4466 }, { "entropy": 0.8627739250659943, "epoch": 0.41099246122794003, "grad_norm": 0.16289503872394562, "learning_rate": 8.630355445149815e-05, "loss": 0.869, "mean_token_accuracy": 0.7490286603569984, "num_tokens": 142565384.0, "step": 4467 }, { "entropy": 0.7930417116731405, "epoch": 0.4110844675993813, "grad_norm": 0.15654434263706207, "learning_rate": 8.630048762535651e-05, "loss": 0.7969, "mean_token_accuracy": 0.764485452324152, "num_tokens": 142597316.0, "step": 4468 }, { "entropy": 0.8274433929473162, "epoch": 0.41117647397082246, "grad_norm": 0.15868796408176422, "learning_rate": 8.62974207992149e-05, "loss": 0.818, "mean_token_accuracy": 0.7668826654553413, "num_tokens": 142629168.0, "step": 4469 }, { "entropy": 0.7188860010355711, "epoch": 0.4112684803422637, "grad_norm": 0.15261772274971008, "learning_rate": 8.629435397307328e-05, "loss": 0.6944, "mean_token_accuracy": 0.7935265153646469, "num_tokens": 142661634.0, "step": 4470 }, { "entropy": 0.854890676215291, "epoch": 0.4113604867137049, "grad_norm": 0.1672695428133011, "learning_rate": 8.629128714693164e-05, "loss": 0.8614, "mean_token_accuracy": 0.7527778595685959, "num_tokens": 142693648.0, "step": 4471 }, { "entropy": 0.878272533416748, "epoch": 0.41145249308514614, "grad_norm": 0.16192686557769775, "learning_rate": 8.628822032079001e-05, "loss": 0.8524, "mean_token_accuracy": 0.7535299062728882, "num_tokens": 142725265.0, "step": 4472 }, { "entropy": 0.7458092048764229, "epoch": 0.4115444994565874, "grad_norm": 0.14748883247375488, "learning_rate": 8.628515349464839e-05, "loss": 0.7335, "mean_token_accuracy": 0.7827360816299915, "num_tokens": 142757000.0, "step": 4473 }, { "entropy": 0.7747982535511255, "epoch": 0.4116365058280286, "grad_norm": 0.15746422111988068, "learning_rate": 8.628208666850676e-05, "loss": 0.7811, "mean_token_accuracy": 0.7764881886541843, "num_tokens": 142788758.0, "step": 4474 }, { "entropy": 0.7062945328652859, "epoch": 0.4117285121994698, "grad_norm": 0.14630766212940216, "learning_rate": 8.627901984236514e-05, "loss": 0.6772, "mean_token_accuracy": 0.7976622954010963, "num_tokens": 142821075.0, "step": 4475 }, { "entropy": 0.7564222253859043, "epoch": 0.411820518570911, "grad_norm": 0.15327119827270508, "learning_rate": 8.627595301622351e-05, "loss": 0.7294, "mean_token_accuracy": 0.784772977232933, "num_tokens": 142852421.0, "step": 4476 }, { "entropy": 0.7790822144597769, "epoch": 0.41191252494235225, "grad_norm": 0.16707418859004974, "learning_rate": 8.627288619008189e-05, "loss": 0.7648, "mean_token_accuracy": 0.7772913165390491, "num_tokens": 142884183.0, "step": 4477 }, { "entropy": 0.8511574026197195, "epoch": 0.4120045313137935, "grad_norm": 0.1737680584192276, "learning_rate": 8.626981936394026e-05, "loss": 0.8758, "mean_token_accuracy": 0.7526406645774841, "num_tokens": 142916369.0, "step": 4478 }, { "entropy": 0.8328302353620529, "epoch": 0.4120965376852347, "grad_norm": 0.15970250964164734, "learning_rate": 8.626675253779864e-05, "loss": 0.8346, "mean_token_accuracy": 0.7587746530771255, "num_tokens": 142948823.0, "step": 4479 }, { "entropy": 0.7236127369105816, "epoch": 0.41218854405667593, "grad_norm": 0.1568552553653717, "learning_rate": 8.626368571165701e-05, "loss": 0.7313, "mean_token_accuracy": 0.7794477865099907, "num_tokens": 142980637.0, "step": 4480 }, { "entropy": 0.8552698995918036, "epoch": 0.4122805504281171, "grad_norm": 0.16580688953399658, "learning_rate": 8.626061888551539e-05, "loss": 0.8565, "mean_token_accuracy": 0.7544540241360664, "num_tokens": 143011363.0, "step": 4481 }, { "entropy": 0.852189339697361, "epoch": 0.41237255679955837, "grad_norm": 0.16307270526885986, "learning_rate": 8.625755205937376e-05, "loss": 0.8357, "mean_token_accuracy": 0.7587158307433128, "num_tokens": 143042638.0, "step": 4482 }, { "entropy": 0.8167440257966518, "epoch": 0.4124645631709996, "grad_norm": 0.15553699433803558, "learning_rate": 8.625448523323213e-05, "loss": 0.8167, "mean_token_accuracy": 0.7622505836188793, "num_tokens": 143074522.0, "step": 4483 }, { "entropy": 0.7384087014943361, "epoch": 0.4125565695424408, "grad_norm": 0.15857434272766113, "learning_rate": 8.625141840709051e-05, "loss": 0.7225, "mean_token_accuracy": 0.7872103899717331, "num_tokens": 143106793.0, "step": 4484 }, { "entropy": 0.7382897306233644, "epoch": 0.41264857591388204, "grad_norm": 0.1553286612033844, "learning_rate": 8.624835158094889e-05, "loss": 0.7176, "mean_token_accuracy": 0.7924973182380199, "num_tokens": 143138426.0, "step": 4485 }, { "entropy": 0.8515257630497217, "epoch": 0.41274058228532323, "grad_norm": 0.159807026386261, "learning_rate": 8.624528475480726e-05, "loss": 0.8622, "mean_token_accuracy": 0.7584990561008453, "num_tokens": 143170941.0, "step": 4486 }, { "entropy": 0.8342829793691635, "epoch": 0.4128325886567645, "grad_norm": 0.159601092338562, "learning_rate": 8.624221792866562e-05, "loss": 0.8136, "mean_token_accuracy": 0.7672271206974983, "num_tokens": 143202762.0, "step": 4487 }, { "entropy": 0.8449788987636566, "epoch": 0.4129245950282057, "grad_norm": 0.16580863296985626, "learning_rate": 8.6239151102524e-05, "loss": 0.8287, "mean_token_accuracy": 0.7591719217598438, "num_tokens": 143234118.0, "step": 4488 }, { "entropy": 0.8111384641379118, "epoch": 0.4130166013996469, "grad_norm": 0.15646781027317047, "learning_rate": 8.623608427638237e-05, "loss": 0.8173, "mean_token_accuracy": 0.7626026049256325, "num_tokens": 143265762.0, "step": 4489 }, { "entropy": 0.7839017100632191, "epoch": 0.41310860777108815, "grad_norm": 0.15555121004581451, "learning_rate": 8.623301745024076e-05, "loss": 0.7669, "mean_token_accuracy": 0.776103425770998, "num_tokens": 143297529.0, "step": 4490 }, { "entropy": 0.9295414686203003, "epoch": 0.41320061414252934, "grad_norm": 0.16158102452754974, "learning_rate": 8.622995062409912e-05, "loss": 0.9085, "mean_token_accuracy": 0.7382762506604195, "num_tokens": 143329246.0, "step": 4491 }, { "entropy": 0.8373202793300152, "epoch": 0.4132926205139706, "grad_norm": 0.16207043826580048, "learning_rate": 8.62268837979575e-05, "loss": 0.8248, "mean_token_accuracy": 0.7603593990206718, "num_tokens": 143360714.0, "step": 4492 }, { "entropy": 0.7937959562987089, "epoch": 0.41338462688541183, "grad_norm": 0.1623910516500473, "learning_rate": 8.622381697181587e-05, "loss": 0.7879, "mean_token_accuracy": 0.7690782472491264, "num_tokens": 143392818.0, "step": 4493 }, { "entropy": 0.8386279363185167, "epoch": 0.413476633256853, "grad_norm": 0.15878570079803467, "learning_rate": 8.622075014567424e-05, "loss": 0.8322, "mean_token_accuracy": 0.7591912224888802, "num_tokens": 143424781.0, "step": 4494 }, { "entropy": 0.81102329865098, "epoch": 0.41356863962829427, "grad_norm": 0.16784195601940155, "learning_rate": 8.621768331953262e-05, "loss": 0.8082, "mean_token_accuracy": 0.7653237469494343, "num_tokens": 143457233.0, "step": 4495 }, { "entropy": 0.8917455077171326, "epoch": 0.41366064599973545, "grad_norm": 0.16201429069042206, "learning_rate": 8.6214616493391e-05, "loss": 0.8838, "mean_token_accuracy": 0.7514631487429142, "num_tokens": 143488915.0, "step": 4496 }, { "entropy": 0.8485833611339331, "epoch": 0.4137526523711767, "grad_norm": 0.1615356206893921, "learning_rate": 8.621154966724937e-05, "loss": 0.8422, "mean_token_accuracy": 0.7511593662202358, "num_tokens": 143520828.0, "step": 4497 }, { "entropy": 0.8395666684955359, "epoch": 0.41384465874261794, "grad_norm": 0.16144776344299316, "learning_rate": 8.620848284110774e-05, "loss": 0.8411, "mean_token_accuracy": 0.7572939731180668, "num_tokens": 143552446.0, "step": 4498 }, { "entropy": 0.8123929630964994, "epoch": 0.41393666511405913, "grad_norm": 0.1597829908132553, "learning_rate": 8.62054160149661e-05, "loss": 0.7996, "mean_token_accuracy": 0.7689096070826054, "num_tokens": 143585033.0, "step": 4499 }, { "entropy": 0.8419951759278774, "epoch": 0.4140286714855004, "grad_norm": 0.16439473628997803, "learning_rate": 8.620234918882449e-05, "loss": 0.8364, "mean_token_accuracy": 0.7572947293519974, "num_tokens": 143615931.0, "step": 4500 }, { "entropy": 1.0097515024244785, "epoch": 0.41412067785694157, "grad_norm": 0.1709626466035843, "learning_rate": 8.619928236268287e-05, "loss": 1.0012, "mean_token_accuracy": 0.7187640853226185, "num_tokens": 143647966.0, "step": 4501 }, { "entropy": 0.7984908521175385, "epoch": 0.4142126842283828, "grad_norm": 0.162941575050354, "learning_rate": 8.619621553654124e-05, "loss": 0.7841, "mean_token_accuracy": 0.7726999334990978, "num_tokens": 143679324.0, "step": 4502 }, { "entropy": 0.8631959911435843, "epoch": 0.41430469059982405, "grad_norm": 0.15573735535144806, "learning_rate": 8.61931487103996e-05, "loss": 0.8574, "mean_token_accuracy": 0.7514755912125111, "num_tokens": 143711785.0, "step": 4503 }, { "entropy": 0.8887576498091221, "epoch": 0.41439669697126524, "grad_norm": 0.16424015164375305, "learning_rate": 8.619008188425799e-05, "loss": 0.8951, "mean_token_accuracy": 0.7431492023169994, "num_tokens": 143743975.0, "step": 4504 }, { "entropy": 0.8071123957633972, "epoch": 0.4144887033427065, "grad_norm": 0.16102947294712067, "learning_rate": 8.618701505811635e-05, "loss": 0.802, "mean_token_accuracy": 0.7655475251376629, "num_tokens": 143776047.0, "step": 4505 }, { "entropy": 0.8156405128538609, "epoch": 0.4145807097141477, "grad_norm": 0.1658691018819809, "learning_rate": 8.618394823197474e-05, "loss": 0.82, "mean_token_accuracy": 0.7663696967065334, "num_tokens": 143808309.0, "step": 4506 }, { "entropy": 0.7904166709631681, "epoch": 0.4146727160855889, "grad_norm": 0.16226786375045776, "learning_rate": 8.61808814058331e-05, "loss": 0.7983, "mean_token_accuracy": 0.772817425429821, "num_tokens": 143840210.0, "step": 4507 }, { "entropy": 0.9053803756833076, "epoch": 0.41476472245703017, "grad_norm": 0.16709619760513306, "learning_rate": 8.617781457969149e-05, "loss": 0.9014, "mean_token_accuracy": 0.7450561746954918, "num_tokens": 143871944.0, "step": 4508 }, { "entropy": 0.8557576239109039, "epoch": 0.41485672882847136, "grad_norm": 0.16033786535263062, "learning_rate": 8.617474775354985e-05, "loss": 0.8589, "mean_token_accuracy": 0.7548679262399673, "num_tokens": 143903979.0, "step": 4509 }, { "entropy": 0.738355340436101, "epoch": 0.4149487351999126, "grad_norm": 0.15662580728530884, "learning_rate": 8.617168092740822e-05, "loss": 0.7123, "mean_token_accuracy": 0.7898793183267117, "num_tokens": 143936013.0, "step": 4510 }, { "entropy": 0.7305729389190674, "epoch": 0.41504074157135384, "grad_norm": 0.15143997967243195, "learning_rate": 8.61686141012666e-05, "loss": 0.695, "mean_token_accuracy": 0.7937044203281403, "num_tokens": 143967797.0, "step": 4511 }, { "entropy": 0.7617721986025572, "epoch": 0.41513274794279503, "grad_norm": 0.16395175457000732, "learning_rate": 8.616554727512498e-05, "loss": 0.7524, "mean_token_accuracy": 0.781597200781107, "num_tokens": 143999658.0, "step": 4512 }, { "entropy": 0.7931550070643425, "epoch": 0.4152247543142363, "grad_norm": 0.158483624458313, "learning_rate": 8.616248044898335e-05, "loss": 0.7592, "mean_token_accuracy": 0.7798235230147839, "num_tokens": 144031732.0, "step": 4513 }, { "entropy": 0.7768251746892929, "epoch": 0.41531676068567747, "grad_norm": 0.16294491291046143, "learning_rate": 8.615941362284172e-05, "loss": 0.7582, "mean_token_accuracy": 0.7802399508655071, "num_tokens": 144063960.0, "step": 4514 }, { "entropy": 0.9042362626641989, "epoch": 0.4154087670571187, "grad_norm": 0.16017252206802368, "learning_rate": 8.615634679670009e-05, "loss": 0.8925, "mean_token_accuracy": 0.7405245676636696, "num_tokens": 144096292.0, "step": 4515 }, { "entropy": 0.8998206127434969, "epoch": 0.41550077342855996, "grad_norm": 0.16232304275035858, "learning_rate": 8.615327997055848e-05, "loss": 0.9048, "mean_token_accuracy": 0.7395599037408829, "num_tokens": 144128818.0, "step": 4516 }, { "entropy": 0.8306217007339001, "epoch": 0.41559277980000114, "grad_norm": 0.1589776873588562, "learning_rate": 8.615021314441685e-05, "loss": 0.8194, "mean_token_accuracy": 0.7641562297940254, "num_tokens": 144160875.0, "step": 4517 }, { "entropy": 0.7502652574330568, "epoch": 0.4156847861714424, "grad_norm": 0.1631874293088913, "learning_rate": 8.614714631827522e-05, "loss": 0.7449, "mean_token_accuracy": 0.7803785391151905, "num_tokens": 144192663.0, "step": 4518 }, { "entropy": 0.7109964918345213, "epoch": 0.4157767925428836, "grad_norm": 0.1630563884973526, "learning_rate": 8.61440794921336e-05, "loss": 0.6993, "mean_token_accuracy": 0.7982547245919704, "num_tokens": 144224734.0, "step": 4519 }, { "entropy": 0.8094420395791531, "epoch": 0.4158687989143248, "grad_norm": 0.1642209142446518, "learning_rate": 8.614101266599197e-05, "loss": 0.7927, "mean_token_accuracy": 0.7671141251921654, "num_tokens": 144255909.0, "step": 4520 }, { "entropy": 0.9098432809114456, "epoch": 0.41596080528576607, "grad_norm": 0.16872932016849518, "learning_rate": 8.613794583985035e-05, "loss": 0.9126, "mean_token_accuracy": 0.7406991347670555, "num_tokens": 144288274.0, "step": 4521 }, { "entropy": 0.769041096791625, "epoch": 0.41605281165720726, "grad_norm": 0.15959005057811737, "learning_rate": 8.613487901370872e-05, "loss": 0.7536, "mean_token_accuracy": 0.7832488566637039, "num_tokens": 144320717.0, "step": 4522 }, { "entropy": 0.8012737669050694, "epoch": 0.4161448180286485, "grad_norm": 0.16060680150985718, "learning_rate": 8.61318121875671e-05, "loss": 0.8061, "mean_token_accuracy": 0.7614594958722591, "num_tokens": 144352677.0, "step": 4523 }, { "entropy": 0.6935494672507048, "epoch": 0.4162368244000897, "grad_norm": 0.156570702791214, "learning_rate": 8.612874536142547e-05, "loss": 0.6661, "mean_token_accuracy": 0.8025020696222782, "num_tokens": 144384273.0, "step": 4524 }, { "entropy": 0.7270583268254995, "epoch": 0.41632883077153093, "grad_norm": 0.154010608792305, "learning_rate": 8.612567853528383e-05, "loss": 0.732, "mean_token_accuracy": 0.7828461267054081, "num_tokens": 144416640.0, "step": 4525 }, { "entropy": 0.7875452823936939, "epoch": 0.4164208371429722, "grad_norm": 0.15570209920406342, "learning_rate": 8.612261170914222e-05, "loss": 0.7612, "mean_token_accuracy": 0.7811396606266499, "num_tokens": 144449171.0, "step": 4526 }, { "entropy": 0.7737717665731907, "epoch": 0.41651284351441337, "grad_norm": 0.1569824516773224, "learning_rate": 8.61195448830006e-05, "loss": 0.7692, "mean_token_accuracy": 0.7778169177472591, "num_tokens": 144480871.0, "step": 4527 }, { "entropy": 0.8244694396853447, "epoch": 0.4166048498858546, "grad_norm": 0.15718339383602142, "learning_rate": 8.611647805685896e-05, "loss": 0.8241, "mean_token_accuracy": 0.7618833892047405, "num_tokens": 144513171.0, "step": 4528 }, { "entropy": 0.6618942860513926, "epoch": 0.4166968562572958, "grad_norm": 0.15114694833755493, "learning_rate": 8.611341123071733e-05, "loss": 0.645, "mean_token_accuracy": 0.8112078756093979, "num_tokens": 144545391.0, "step": 4529 }, { "entropy": 0.8036180213093758, "epoch": 0.41678886262873704, "grad_norm": 0.16020254790782928, "learning_rate": 8.61103444045757e-05, "loss": 0.7981, "mean_token_accuracy": 0.7665360942482948, "num_tokens": 144577511.0, "step": 4530 }, { "entropy": 0.8657460249960423, "epoch": 0.4168808690001783, "grad_norm": 0.16278044879436493, "learning_rate": 8.610727757843408e-05, "loss": 0.862, "mean_token_accuracy": 0.7496981211006641, "num_tokens": 144609397.0, "step": 4531 }, { "entropy": 0.7543759532272816, "epoch": 0.4169728753716195, "grad_norm": 0.1511809080839157, "learning_rate": 8.610421075229246e-05, "loss": 0.7386, "mean_token_accuracy": 0.7819755971431732, "num_tokens": 144641649.0, "step": 4532 }, { "entropy": 0.8243298269808292, "epoch": 0.4170648817430607, "grad_norm": 0.15642566978931427, "learning_rate": 8.610114392615083e-05, "loss": 0.8188, "mean_token_accuracy": 0.7629193924367428, "num_tokens": 144673498.0, "step": 4533 }, { "entropy": 0.7835861053317785, "epoch": 0.4171568881145019, "grad_norm": 0.15588463842868805, "learning_rate": 8.60980771000092e-05, "loss": 0.7782, "mean_token_accuracy": 0.774412713944912, "num_tokens": 144705627.0, "step": 4534 }, { "entropy": 0.8346582818776369, "epoch": 0.41724889448594316, "grad_norm": 0.16522647440433502, "learning_rate": 8.609501027386758e-05, "loss": 0.8261, "mean_token_accuracy": 0.7636561542749405, "num_tokens": 144737539.0, "step": 4535 }, { "entropy": 0.7929035145789385, "epoch": 0.4173409008573844, "grad_norm": 0.16527460515499115, "learning_rate": 8.609194344772595e-05, "loss": 0.8088, "mean_token_accuracy": 0.7660935074090958, "num_tokens": 144769540.0, "step": 4536 }, { "entropy": 0.7421628106385469, "epoch": 0.4174329072288256, "grad_norm": 0.15511679649353027, "learning_rate": 8.608887662158433e-05, "loss": 0.7106, "mean_token_accuracy": 0.7888552136719227, "num_tokens": 144801113.0, "step": 4537 }, { "entropy": 0.86304578371346, "epoch": 0.41752491360026683, "grad_norm": 0.162871316075325, "learning_rate": 8.60858097954427e-05, "loss": 0.8631, "mean_token_accuracy": 0.7484033033251762, "num_tokens": 144832481.0, "step": 4538 }, { "entropy": 0.8668824750930071, "epoch": 0.417616919971708, "grad_norm": 0.15830406546592712, "learning_rate": 8.608274296930108e-05, "loss": 0.8532, "mean_token_accuracy": 0.7538893781602383, "num_tokens": 144864705.0, "step": 4539 }, { "entropy": 0.8107856996357441, "epoch": 0.41770892634314927, "grad_norm": 0.16174452006816864, "learning_rate": 8.607967614315945e-05, "loss": 0.7891, "mean_token_accuracy": 0.7666014470160007, "num_tokens": 144896095.0, "step": 4540 }, { "entropy": 0.7459104843437672, "epoch": 0.4178009327145905, "grad_norm": 0.1629287749528885, "learning_rate": 8.607660931701781e-05, "loss": 0.7486, "mean_token_accuracy": 0.7754403613507748, "num_tokens": 144928067.0, "step": 4541 }, { "entropy": 0.89670030772686, "epoch": 0.4178929390860317, "grad_norm": 0.15871508419513702, "learning_rate": 8.60735424908762e-05, "loss": 0.8944, "mean_token_accuracy": 0.7424206882715225, "num_tokens": 144960605.0, "step": 4542 }, { "entropy": 0.7221546322107315, "epoch": 0.41798494545747295, "grad_norm": 0.1663232296705246, "learning_rate": 8.607047566473458e-05, "loss": 0.7293, "mean_token_accuracy": 0.7870559468865395, "num_tokens": 144993128.0, "step": 4543 }, { "entropy": 0.7570828627794981, "epoch": 0.41807695182891413, "grad_norm": 0.15465998649597168, "learning_rate": 8.606740883859295e-05, "loss": 0.7387, "mean_token_accuracy": 0.7846238315105438, "num_tokens": 145025896.0, "step": 4544 }, { "entropy": 0.7791625969111919, "epoch": 0.4181689582003554, "grad_norm": 0.15877221524715424, "learning_rate": 8.606434201245131e-05, "loss": 0.7693, "mean_token_accuracy": 0.7734597437083721, "num_tokens": 145056895.0, "step": 4545 }, { "entropy": 0.8962718639522791, "epoch": 0.4182609645717966, "grad_norm": 0.16469255089759827, "learning_rate": 8.60612751863097e-05, "loss": 0.8769, "mean_token_accuracy": 0.7464188300073147, "num_tokens": 145088588.0, "step": 4546 }, { "entropy": 0.9129232279956341, "epoch": 0.4183529709432378, "grad_norm": 0.16449591517448425, "learning_rate": 8.605820836016806e-05, "loss": 0.9188, "mean_token_accuracy": 0.7396076433360577, "num_tokens": 145120523.0, "step": 4547 }, { "entropy": 0.772522110491991, "epoch": 0.41844497731467906, "grad_norm": 0.15302924811840057, "learning_rate": 8.605514153402644e-05, "loss": 0.7434, "mean_token_accuracy": 0.7840568087995052, "num_tokens": 145152929.0, "step": 4548 }, { "entropy": 0.7632583193480968, "epoch": 0.41853698368612025, "grad_norm": 0.15166132152080536, "learning_rate": 8.605207470788481e-05, "loss": 0.7531, "mean_token_accuracy": 0.786506824195385, "num_tokens": 145185695.0, "step": 4549 }, { "entropy": 0.7220206093043089, "epoch": 0.4186289900575615, "grad_norm": 0.1549224555492401, "learning_rate": 8.60490078817432e-05, "loss": 0.7154, "mean_token_accuracy": 0.7883147113025188, "num_tokens": 145217611.0, "step": 4550 }, { "entropy": 0.8025738559663296, "epoch": 0.41872099642900273, "grad_norm": 0.16210800409317017, "learning_rate": 8.604594105560156e-05, "loss": 0.8143, "mean_token_accuracy": 0.7626190148293972, "num_tokens": 145249022.0, "step": 4551 }, { "entropy": 0.8407811541110277, "epoch": 0.4188130028004439, "grad_norm": 0.15261705219745636, "learning_rate": 8.604287422945993e-05, "loss": 0.8249, "mean_token_accuracy": 0.7616807594895363, "num_tokens": 145280998.0, "step": 4552 }, { "entropy": 0.7695520222187042, "epoch": 0.41890500917188517, "grad_norm": 0.15632832050323486, "learning_rate": 8.603980740331831e-05, "loss": 0.7635, "mean_token_accuracy": 0.7732005901634693, "num_tokens": 145313741.0, "step": 4553 }, { "entropy": 0.8493876922875643, "epoch": 0.41899701554332636, "grad_norm": 0.16051173210144043, "learning_rate": 8.603674057717669e-05, "loss": 0.8745, "mean_token_accuracy": 0.754030879586935, "num_tokens": 145346310.0, "step": 4554 }, { "entropy": 0.8957344107329845, "epoch": 0.4190890219147676, "grad_norm": 0.1706491857767105, "learning_rate": 8.603367375103506e-05, "loss": 0.9076, "mean_token_accuracy": 0.741692166775465, "num_tokens": 145377737.0, "step": 4555 }, { "entropy": 0.759348077699542, "epoch": 0.41918102828620885, "grad_norm": 0.1669037789106369, "learning_rate": 8.603060692489343e-05, "loss": 0.7423, "mean_token_accuracy": 0.7830957174301147, "num_tokens": 145409819.0, "step": 4556 }, { "entropy": 0.9060728810727596, "epoch": 0.41927303465765003, "grad_norm": 0.16334396600723267, "learning_rate": 8.60275400987518e-05, "loss": 0.9085, "mean_token_accuracy": 0.7380963116884232, "num_tokens": 145442328.0, "step": 4557 }, { "entropy": 0.8253596406430006, "epoch": 0.4193650410290913, "grad_norm": 0.15739575028419495, "learning_rate": 8.602447327261019e-05, "loss": 0.8029, "mean_token_accuracy": 0.7669550180435181, "num_tokens": 145474334.0, "step": 4558 }, { "entropy": 0.8775247260928154, "epoch": 0.41945704740053247, "grad_norm": 0.16090230643749237, "learning_rate": 8.602140644646856e-05, "loss": 0.8535, "mean_token_accuracy": 0.7496736943721771, "num_tokens": 145505783.0, "step": 4559 }, { "entropy": 0.8548111971467733, "epoch": 0.4195490537719737, "grad_norm": 0.15457266569137573, "learning_rate": 8.601833962032693e-05, "loss": 0.8566, "mean_token_accuracy": 0.7514009363949299, "num_tokens": 145537987.0, "step": 4560 }, { "entropy": 0.8343433812260628, "epoch": 0.41964106014341496, "grad_norm": 0.1598043292760849, "learning_rate": 8.60152727941853e-05, "loss": 0.8243, "mean_token_accuracy": 0.7587715871632099, "num_tokens": 145570144.0, "step": 4561 }, { "entropy": 0.8947041183710098, "epoch": 0.41973306651485615, "grad_norm": 0.3732788860797882, "learning_rate": 8.601220596804368e-05, "loss": 0.876, "mean_token_accuracy": 0.7527636922895908, "num_tokens": 145602261.0, "step": 4562 }, { "entropy": 0.802547924220562, "epoch": 0.4198250728862974, "grad_norm": 0.15301138162612915, "learning_rate": 8.600913914190206e-05, "loss": 0.8104, "mean_token_accuracy": 0.765023872256279, "num_tokens": 145634723.0, "step": 4563 }, { "entropy": 0.8678766470402479, "epoch": 0.4199170792577386, "grad_norm": 0.16276900470256805, "learning_rate": 8.600607231576042e-05, "loss": 0.8773, "mean_token_accuracy": 0.7489379607141018, "num_tokens": 145667105.0, "step": 4564 }, { "entropy": 0.8827195577323437, "epoch": 0.4200090856291798, "grad_norm": 0.157405823469162, "learning_rate": 8.600300548961879e-05, "loss": 0.8636, "mean_token_accuracy": 0.7523163370788097, "num_tokens": 145699530.0, "step": 4565 }, { "entropy": 0.7445742171257734, "epoch": 0.42010109200062107, "grad_norm": 0.15601381659507751, "learning_rate": 8.599993866347717e-05, "loss": 0.7365, "mean_token_accuracy": 0.7800416573882103, "num_tokens": 145731520.0, "step": 4566 }, { "entropy": 0.8754270896315575, "epoch": 0.42019309837206226, "grad_norm": 0.1704360544681549, "learning_rate": 8.599687183733554e-05, "loss": 0.8696, "mean_token_accuracy": 0.7472438998520374, "num_tokens": 145763951.0, "step": 4567 }, { "entropy": 0.8988167252391577, "epoch": 0.4202851047435035, "grad_norm": 0.16590768098831177, "learning_rate": 8.599380501119392e-05, "loss": 0.9036, "mean_token_accuracy": 0.7437917403876781, "num_tokens": 145796230.0, "step": 4568 }, { "entropy": 0.7939202897250652, "epoch": 0.4203771111149447, "grad_norm": 0.15913666784763336, "learning_rate": 8.599073818505229e-05, "loss": 0.7806, "mean_token_accuracy": 0.7761568129062653, "num_tokens": 145828214.0, "step": 4569 }, { "entropy": 0.7721442673355341, "epoch": 0.42046911748638593, "grad_norm": 0.16158299148082733, "learning_rate": 8.598767135891067e-05, "loss": 0.7603, "mean_token_accuracy": 0.7767036706209183, "num_tokens": 145860323.0, "step": 4570 }, { "entropy": 0.8092829547822475, "epoch": 0.4205611238578272, "grad_norm": 0.16427403688430786, "learning_rate": 8.598460453276904e-05, "loss": 0.8007, "mean_token_accuracy": 0.7737971805036068, "num_tokens": 145892793.0, "step": 4571 }, { "entropy": 0.7533850334584713, "epoch": 0.42065313022926837, "grad_norm": 0.15690869092941284, "learning_rate": 8.598153770662741e-05, "loss": 0.7399, "mean_token_accuracy": 0.7811124958097935, "num_tokens": 145924667.0, "step": 4572 }, { "entropy": 0.7132236901670694, "epoch": 0.4207451366007096, "grad_norm": 0.14741215109825134, "learning_rate": 8.597847088048579e-05, "loss": 0.6788, "mean_token_accuracy": 0.7985172607004642, "num_tokens": 145957002.0, "step": 4573 }, { "entropy": 0.8207326736301184, "epoch": 0.4208371429721508, "grad_norm": 0.1580919474363327, "learning_rate": 8.597540405434417e-05, "loss": 0.8078, "mean_token_accuracy": 0.7644231207668781, "num_tokens": 145988501.0, "step": 4574 }, { "entropy": 0.8459073910489678, "epoch": 0.42092914934359205, "grad_norm": 0.16118136048316956, "learning_rate": 8.597233722820254e-05, "loss": 0.8478, "mean_token_accuracy": 0.7616735361516476, "num_tokens": 146020446.0, "step": 4575 }, { "entropy": 0.6958336066454649, "epoch": 0.4210211557150333, "grad_norm": 0.16549701988697052, "learning_rate": 8.596927040206091e-05, "loss": 0.6789, "mean_token_accuracy": 0.8016561567783356, "num_tokens": 146052344.0, "step": 4576 }, { "entropy": 0.7792667876929045, "epoch": 0.4211131620864745, "grad_norm": 0.17580147087574005, "learning_rate": 8.596620357591929e-05, "loss": 0.7685, "mean_token_accuracy": 0.7767567038536072, "num_tokens": 146084787.0, "step": 4577 }, { "entropy": 0.8031229712069035, "epoch": 0.4212051684579157, "grad_norm": 0.16030214726924896, "learning_rate": 8.596313674977766e-05, "loss": 0.7955, "mean_token_accuracy": 0.7707584761083126, "num_tokens": 146117391.0, "step": 4578 }, { "entropy": 0.7864808011800051, "epoch": 0.4212971748293569, "grad_norm": 0.1532261073589325, "learning_rate": 8.596006992363604e-05, "loss": 0.7661, "mean_token_accuracy": 0.7768229730427265, "num_tokens": 146149470.0, "step": 4579 }, { "entropy": 0.8507726304233074, "epoch": 0.42138918120079816, "grad_norm": 0.16311869025230408, "learning_rate": 8.59570030974944e-05, "loss": 0.8239, "mean_token_accuracy": 0.7581100091338158, "num_tokens": 146181160.0, "step": 4580 }, { "entropy": 0.8729174360632896, "epoch": 0.4214811875722394, "grad_norm": 0.1688160002231598, "learning_rate": 8.595393627135279e-05, "loss": 0.8822, "mean_token_accuracy": 0.7497265227138996, "num_tokens": 146212273.0, "step": 4581 }, { "entropy": 0.7768956888467073, "epoch": 0.4215731939436806, "grad_norm": 0.16243866086006165, "learning_rate": 8.595086944521115e-05, "loss": 0.7693, "mean_token_accuracy": 0.7730605117976665, "num_tokens": 146243856.0, "step": 4582 }, { "entropy": 0.7503443229943514, "epoch": 0.42166520031512184, "grad_norm": 0.15790176391601562, "learning_rate": 8.594780261906952e-05, "loss": 0.7482, "mean_token_accuracy": 0.7851225398480892, "num_tokens": 146275893.0, "step": 4583 }, { "entropy": 0.827079389244318, "epoch": 0.421757206686563, "grad_norm": 0.1637110412120819, "learning_rate": 8.59447357929279e-05, "loss": 0.8221, "mean_token_accuracy": 0.7603440433740616, "num_tokens": 146307485.0, "step": 4584 }, { "entropy": 0.8225524686276913, "epoch": 0.42184921305800427, "grad_norm": 0.1597427874803543, "learning_rate": 8.594166896678629e-05, "loss": 0.8323, "mean_token_accuracy": 0.7623053230345249, "num_tokens": 146339540.0, "step": 4585 }, { "entropy": 0.754946019500494, "epoch": 0.4219412194294455, "grad_norm": 0.16408030688762665, "learning_rate": 8.593860214064465e-05, "loss": 0.7481, "mean_token_accuracy": 0.7820260152220726, "num_tokens": 146370866.0, "step": 4586 }, { "entropy": 0.8852417282760143, "epoch": 0.4220332258008867, "grad_norm": 0.16907674074172974, "learning_rate": 8.593553531450302e-05, "loss": 0.8745, "mean_token_accuracy": 0.7480325102806091, "num_tokens": 146402622.0, "step": 4587 }, { "entropy": 0.7553645018488169, "epoch": 0.42212523217232795, "grad_norm": 0.16264121234416962, "learning_rate": 8.593246848836139e-05, "loss": 0.7311, "mean_token_accuracy": 0.786100372672081, "num_tokens": 146433798.0, "step": 4588 }, { "entropy": 0.7370216995477676, "epoch": 0.42221723854376914, "grad_norm": 0.16025198996067047, "learning_rate": 8.592940166221977e-05, "loss": 0.7134, "mean_token_accuracy": 0.7892382703721523, "num_tokens": 146465035.0, "step": 4589 }, { "entropy": 0.8346895687282085, "epoch": 0.4223092449152104, "grad_norm": 0.1560012847185135, "learning_rate": 8.592633483607815e-05, "loss": 0.815, "mean_token_accuracy": 0.7643697969615459, "num_tokens": 146496542.0, "step": 4590 }, { "entropy": 0.8215970043092966, "epoch": 0.4224012512866516, "grad_norm": 0.14962022006511688, "learning_rate": 8.592326800993652e-05, "loss": 0.8142, "mean_token_accuracy": 0.7604928500950336, "num_tokens": 146529164.0, "step": 4591 }, { "entropy": 0.9242461621761322, "epoch": 0.4224932576580928, "grad_norm": 0.16236403584480286, "learning_rate": 8.592020118379489e-05, "loss": 0.9187, "mean_token_accuracy": 0.737382810562849, "num_tokens": 146561642.0, "step": 4592 }, { "entropy": 0.7443161923438311, "epoch": 0.42258526402953406, "grad_norm": 0.14938580989837646, "learning_rate": 8.591713435765327e-05, "loss": 0.7252, "mean_token_accuracy": 0.788528323173523, "num_tokens": 146594155.0, "step": 4593 }, { "entropy": 0.9029577635228634, "epoch": 0.42267727040097525, "grad_norm": 0.16229337453842163, "learning_rate": 8.591406753151164e-05, "loss": 0.8855, "mean_token_accuracy": 0.7462423369288445, "num_tokens": 146625504.0, "step": 4594 }, { "entropy": 0.7504708841443062, "epoch": 0.4227692767724165, "grad_norm": 0.15676549077033997, "learning_rate": 8.591100070537002e-05, "loss": 0.7352, "mean_token_accuracy": 0.7805223688483238, "num_tokens": 146656498.0, "step": 4595 }, { "entropy": 0.8486317228525877, "epoch": 0.42286128314385774, "grad_norm": 0.16365309059619904, "learning_rate": 8.590793387922839e-05, "loss": 0.8401, "mean_token_accuracy": 0.7579367011785507, "num_tokens": 146689262.0, "step": 4596 }, { "entropy": 0.8185579851269722, "epoch": 0.4229532895152989, "grad_norm": 0.1649971455335617, "learning_rate": 8.590486705308677e-05, "loss": 0.8137, "mean_token_accuracy": 0.7648798190057278, "num_tokens": 146721663.0, "step": 4597 }, { "entropy": 0.7321564666926861, "epoch": 0.42304529588674017, "grad_norm": 0.1517937183380127, "learning_rate": 8.590180022694514e-05, "loss": 0.7246, "mean_token_accuracy": 0.7859645113348961, "num_tokens": 146753776.0, "step": 4598 }, { "entropy": 0.8141267634928226, "epoch": 0.42313730225818136, "grad_norm": 0.1604725569486618, "learning_rate": 8.589873340080352e-05, "loss": 0.8075, "mean_token_accuracy": 0.7650229185819626, "num_tokens": 146785917.0, "step": 4599 }, { "entropy": 0.8870825208723545, "epoch": 0.4232293086296226, "grad_norm": 0.17333662509918213, "learning_rate": 8.589566657466189e-05, "loss": 0.9031, "mean_token_accuracy": 0.7439095303416252, "num_tokens": 146817581.0, "step": 4600 }, { "entropy": 0.8688332196325064, "epoch": 0.42332131500106385, "grad_norm": 0.17321234941482544, "learning_rate": 8.589259974852027e-05, "loss": 0.8899, "mean_token_accuracy": 0.7457477562129498, "num_tokens": 146849858.0, "step": 4601 }, { "entropy": 0.7977531775832176, "epoch": 0.42341332137250504, "grad_norm": 0.1636018007993698, "learning_rate": 8.588953292237863e-05, "loss": 0.7777, "mean_token_accuracy": 0.7770504988729954, "num_tokens": 146881844.0, "step": 4602 }, { "entropy": 0.8689647354185581, "epoch": 0.4235053277439463, "grad_norm": 0.1621980369091034, "learning_rate": 8.5886466096237e-05, "loss": 0.8557, "mean_token_accuracy": 0.7521816454827785, "num_tokens": 146914057.0, "step": 4603 }, { "entropy": 0.9099737778306007, "epoch": 0.42359733411538747, "grad_norm": 0.186752587556839, "learning_rate": 8.588339927009538e-05, "loss": 0.9188, "mean_token_accuracy": 0.7406060472130775, "num_tokens": 146945499.0, "step": 4604 }, { "entropy": 0.8282085247337818, "epoch": 0.4236893404868287, "grad_norm": 0.16053955256938934, "learning_rate": 8.588033244395377e-05, "loss": 0.8257, "mean_token_accuracy": 0.7623341642320156, "num_tokens": 146977719.0, "step": 4605 }, { "entropy": 0.7956900894641876, "epoch": 0.42378134685826996, "grad_norm": 0.16096076369285583, "learning_rate": 8.587726561781213e-05, "loss": 0.7598, "mean_token_accuracy": 0.7793000601232052, "num_tokens": 147010081.0, "step": 4606 }, { "entropy": 0.8362796679139137, "epoch": 0.42387335322971115, "grad_norm": 0.15440835058689117, "learning_rate": 8.58741987916705e-05, "loss": 0.8031, "mean_token_accuracy": 0.7673660963773727, "num_tokens": 147041960.0, "step": 4607 }, { "entropy": 0.7985561452805996, "epoch": 0.4239653596011524, "grad_norm": 0.154652401804924, "learning_rate": 8.587113196552888e-05, "loss": 0.7852, "mean_token_accuracy": 0.7702245190739632, "num_tokens": 147073446.0, "step": 4608 }, { "entropy": 0.7740116193890572, "epoch": 0.4240573659725936, "grad_norm": 0.15769924223423004, "learning_rate": 8.586806513938725e-05, "loss": 0.7493, "mean_token_accuracy": 0.7826761342585087, "num_tokens": 147105783.0, "step": 4609 }, { "entropy": 0.6527638901025057, "epoch": 0.4241493723440348, "grad_norm": 0.14409498870372772, "learning_rate": 8.586499831324563e-05, "loss": 0.6167, "mean_token_accuracy": 0.8105736933648586, "num_tokens": 147137390.0, "step": 4610 }, { "entropy": 0.8632991053164005, "epoch": 0.42424137871547607, "grad_norm": 0.16945143043994904, "learning_rate": 8.5861931487104e-05, "loss": 0.8393, "mean_token_accuracy": 0.7583488933742046, "num_tokens": 147168962.0, "step": 4611 }, { "entropy": 0.7813392616808414, "epoch": 0.42433338508691726, "grad_norm": 0.16051052510738373, "learning_rate": 8.585886466096238e-05, "loss": 0.7617, "mean_token_accuracy": 0.7804623991250992, "num_tokens": 147200602.0, "step": 4612 }, { "entropy": 0.674537681043148, "epoch": 0.4244253914583585, "grad_norm": 0.1570131480693817, "learning_rate": 8.585579783482075e-05, "loss": 0.6404, "mean_token_accuracy": 0.809480682015419, "num_tokens": 147232955.0, "step": 4613 }, { "entropy": 0.7665836736559868, "epoch": 0.4245173978297997, "grad_norm": 0.17355789244174957, "learning_rate": 8.585273100867912e-05, "loss": 0.7585, "mean_token_accuracy": 0.7749401219189167, "num_tokens": 147264436.0, "step": 4614 }, { "entropy": 0.7571151927113533, "epoch": 0.42460940420124094, "grad_norm": 0.1618274450302124, "learning_rate": 8.58496641825375e-05, "loss": 0.7518, "mean_token_accuracy": 0.7764874435961246, "num_tokens": 147295466.0, "step": 4615 }, { "entropy": 0.763299684971571, "epoch": 0.4247014105726822, "grad_norm": 0.15720979869365692, "learning_rate": 8.584659735639588e-05, "loss": 0.7553, "mean_token_accuracy": 0.7746320143342018, "num_tokens": 147327382.0, "step": 4616 }, { "entropy": 0.7637761551886797, "epoch": 0.42479341694412337, "grad_norm": 0.16678154468536377, "learning_rate": 8.584353053025425e-05, "loss": 0.7637, "mean_token_accuracy": 0.7792493365705013, "num_tokens": 147359723.0, "step": 4617 }, { "entropy": 0.7705184109508991, "epoch": 0.4248854233155646, "grad_norm": 0.16910067200660706, "learning_rate": 8.584046370411262e-05, "loss": 0.7916, "mean_token_accuracy": 0.7755454480648041, "num_tokens": 147391738.0, "step": 4618 }, { "entropy": 0.7558711152523756, "epoch": 0.4249774296870058, "grad_norm": 0.16342554986476898, "learning_rate": 8.583739687797098e-05, "loss": 0.7571, "mean_token_accuracy": 0.7791360728442669, "num_tokens": 147422792.0, "step": 4619 }, { "entropy": 0.8463205751031637, "epoch": 0.42506943605844705, "grad_norm": 0.16216330230236053, "learning_rate": 8.583433005182936e-05, "loss": 0.8527, "mean_token_accuracy": 0.758190106600523, "num_tokens": 147455142.0, "step": 4620 }, { "entropy": 0.8014037050306797, "epoch": 0.4251614424298883, "grad_norm": 0.169124573469162, "learning_rate": 8.583126322568775e-05, "loss": 0.7993, "mean_token_accuracy": 0.7659743055701256, "num_tokens": 147485743.0, "step": 4621 }, { "entropy": 0.8713971972465515, "epoch": 0.4252534488013295, "grad_norm": 0.16011381149291992, "learning_rate": 8.582819639954611e-05, "loss": 0.8602, "mean_token_accuracy": 0.7551388293504715, "num_tokens": 147517200.0, "step": 4622 }, { "entropy": 0.7241974268108606, "epoch": 0.4253454551727707, "grad_norm": 0.15819472074508667, "learning_rate": 8.582512957340448e-05, "loss": 0.7378, "mean_token_accuracy": 0.7868640683591366, "num_tokens": 147549634.0, "step": 4623 }, { "entropy": 0.8299671225249767, "epoch": 0.4254374615442119, "grad_norm": 0.16693611443042755, "learning_rate": 8.582206274726286e-05, "loss": 0.8287, "mean_token_accuracy": 0.7624267227947712, "num_tokens": 147582402.0, "step": 4624 }, { "entropy": 0.8488089572638273, "epoch": 0.42552946791565316, "grad_norm": 0.15589052438735962, "learning_rate": 8.581899592112123e-05, "loss": 0.8302, "mean_token_accuracy": 0.757773045450449, "num_tokens": 147614649.0, "step": 4625 }, { "entropy": 0.8596734292805195, "epoch": 0.4256214742870944, "grad_norm": 0.1586950272321701, "learning_rate": 8.581592909497961e-05, "loss": 0.8431, "mean_token_accuracy": 0.756834264844656, "num_tokens": 147646852.0, "step": 4626 }, { "entropy": 0.796437868848443, "epoch": 0.4257134806585356, "grad_norm": 0.1579326093196869, "learning_rate": 8.581286226883798e-05, "loss": 0.7795, "mean_token_accuracy": 0.7714277654886246, "num_tokens": 147678831.0, "step": 4627 }, { "entropy": 0.7353752292692661, "epoch": 0.42580548702997684, "grad_norm": 0.1520933359861374, "learning_rate": 8.580979544269636e-05, "loss": 0.7161, "mean_token_accuracy": 0.7868848331272602, "num_tokens": 147710529.0, "step": 4628 }, { "entropy": 0.8970924913883209, "epoch": 0.425897493401418, "grad_norm": 0.1580749750137329, "learning_rate": 8.580672861655473e-05, "loss": 0.8773, "mean_token_accuracy": 0.7448320277035236, "num_tokens": 147742743.0, "step": 4629 }, { "entropy": 0.9056255221366882, "epoch": 0.42598949977285927, "grad_norm": 0.15416285395622253, "learning_rate": 8.58036617904131e-05, "loss": 0.8839, "mean_token_accuracy": 0.7499679699540138, "num_tokens": 147774989.0, "step": 4630 }, { "entropy": 0.7314015738666058, "epoch": 0.4260815061443005, "grad_norm": 0.15937337279319763, "learning_rate": 8.580059496427148e-05, "loss": 0.72, "mean_token_accuracy": 0.7853183783590794, "num_tokens": 147806909.0, "step": 4631 }, { "entropy": 0.8560720942914486, "epoch": 0.4261735125157417, "grad_norm": 0.16234341263771057, "learning_rate": 8.579752813812986e-05, "loss": 0.8259, "mean_token_accuracy": 0.7575594745576382, "num_tokens": 147839009.0, "step": 4632 }, { "entropy": 0.8501491844654083, "epoch": 0.42626551888718295, "grad_norm": 0.15691418945789337, "learning_rate": 8.579446131198823e-05, "loss": 0.8378, "mean_token_accuracy": 0.7570584081113338, "num_tokens": 147870442.0, "step": 4633 }, { "entropy": 0.790016982704401, "epoch": 0.42635752525862414, "grad_norm": 0.15450997650623322, "learning_rate": 8.57913944858466e-05, "loss": 0.766, "mean_token_accuracy": 0.7813923172652721, "num_tokens": 147901360.0, "step": 4634 }, { "entropy": 0.8079939130693674, "epoch": 0.4264495316300654, "grad_norm": 0.1593797504901886, "learning_rate": 8.578832765970496e-05, "loss": 0.7846, "mean_token_accuracy": 0.7671005688607693, "num_tokens": 147932189.0, "step": 4635 }, { "entropy": 0.6736984439194202, "epoch": 0.4265415380015066, "grad_norm": 0.16153088212013245, "learning_rate": 8.578526083356336e-05, "loss": 0.6541, "mean_token_accuracy": 0.8061646036803722, "num_tokens": 147964215.0, "step": 4636 }, { "entropy": 0.8529234547168016, "epoch": 0.4266335443729478, "grad_norm": 0.16200190782546997, "learning_rate": 8.578219400742173e-05, "loss": 0.8574, "mean_token_accuracy": 0.7538869194686413, "num_tokens": 147996749.0, "step": 4637 }, { "entropy": 0.7433046437799931, "epoch": 0.42672555074438906, "grad_norm": 0.1579662710428238, "learning_rate": 8.57791271812801e-05, "loss": 0.7506, "mean_token_accuracy": 0.7804654613137245, "num_tokens": 148028972.0, "step": 4638 }, { "entropy": 0.8794772103428841, "epoch": 0.42681755711583025, "grad_norm": 0.17348234355449677, "learning_rate": 8.577606035513848e-05, "loss": 0.9065, "mean_token_accuracy": 0.7435971610248089, "num_tokens": 148060644.0, "step": 4639 }, { "entropy": 0.7210108377039433, "epoch": 0.4269095634872715, "grad_norm": 0.15141186118125916, "learning_rate": 8.577299352899684e-05, "loss": 0.7198, "mean_token_accuracy": 0.789498221129179, "num_tokens": 148092549.0, "step": 4640 }, { "entropy": 0.7006548922508955, "epoch": 0.42700156985871274, "grad_norm": 0.16246777772903442, "learning_rate": 8.576992670285523e-05, "loss": 0.6937, "mean_token_accuracy": 0.794311162084341, "num_tokens": 148124122.0, "step": 4641 }, { "entropy": 0.864555686712265, "epoch": 0.4270935762301539, "grad_norm": 0.1623639315366745, "learning_rate": 8.576685987671359e-05, "loss": 0.8559, "mean_token_accuracy": 0.7492375634610653, "num_tokens": 148156682.0, "step": 4642 }, { "entropy": 0.7734821122139692, "epoch": 0.42718558260159517, "grad_norm": 0.1608583629131317, "learning_rate": 8.576379305057197e-05, "loss": 0.7771, "mean_token_accuracy": 0.7685230076313019, "num_tokens": 148188746.0, "step": 4643 }, { "entropy": 0.7568129561841488, "epoch": 0.42727758897303636, "grad_norm": 0.15591523051261902, "learning_rate": 8.576072622443034e-05, "loss": 0.7435, "mean_token_accuracy": 0.7838151603937149, "num_tokens": 148220769.0, "step": 4644 }, { "entropy": 0.7581351287662983, "epoch": 0.4273695953444776, "grad_norm": 0.15677997469902039, "learning_rate": 8.575765939828871e-05, "loss": 0.7446, "mean_token_accuracy": 0.7806229963898659, "num_tokens": 148252716.0, "step": 4645 }, { "entropy": 0.7966628577560186, "epoch": 0.42746160171591885, "grad_norm": 0.1568538248538971, "learning_rate": 8.575459257214709e-05, "loss": 0.7801, "mean_token_accuracy": 0.7686630040407181, "num_tokens": 148283915.0, "step": 4646 }, { "entropy": 0.7955265920609236, "epoch": 0.42755360808736004, "grad_norm": 0.15458939969539642, "learning_rate": 8.575152574600547e-05, "loss": 0.7816, "mean_token_accuracy": 0.7693360261619091, "num_tokens": 148316381.0, "step": 4647 }, { "entropy": 0.7614725586026907, "epoch": 0.4276456144588013, "grad_norm": 0.1511397808790207, "learning_rate": 8.574845891986384e-05, "loss": 0.7421, "mean_token_accuracy": 0.7843933738768101, "num_tokens": 148348191.0, "step": 4648 }, { "entropy": 0.7948442231863737, "epoch": 0.42773762083024247, "grad_norm": 0.1624593436717987, "learning_rate": 8.574539209372221e-05, "loss": 0.7795, "mean_token_accuracy": 0.7740098387002945, "num_tokens": 148380426.0, "step": 4649 }, { "entropy": 0.6832427782937884, "epoch": 0.4278296272016837, "grad_norm": 0.1473504602909088, "learning_rate": 8.574232526758058e-05, "loss": 0.6465, "mean_token_accuracy": 0.8078856579959393, "num_tokens": 148412231.0, "step": 4650 }, { "entropy": 0.6993076112121344, "epoch": 0.42792163357312496, "grad_norm": 0.1530528962612152, "learning_rate": 8.573925844143896e-05, "loss": 0.6845, "mean_token_accuracy": 0.8020318485796452, "num_tokens": 148443810.0, "step": 4651 }, { "entropy": 0.8160107955336571, "epoch": 0.42801363994456615, "grad_norm": 0.16912797093391418, "learning_rate": 8.573619161529734e-05, "loss": 0.8322, "mean_token_accuracy": 0.7615578509867191, "num_tokens": 148475119.0, "step": 4652 }, { "entropy": 0.8919027801603079, "epoch": 0.4281056463160074, "grad_norm": 0.16659031808376312, "learning_rate": 8.573312478915571e-05, "loss": 0.9157, "mean_token_accuracy": 0.7390161752700806, "num_tokens": 148507878.0, "step": 4653 }, { "entropy": 0.7689816355705261, "epoch": 0.4281976526874486, "grad_norm": 0.16652674973011017, "learning_rate": 8.573005796301408e-05, "loss": 0.8087, "mean_token_accuracy": 0.7708467990159988, "num_tokens": 148540054.0, "step": 4654 }, { "entropy": 0.8197981584817171, "epoch": 0.4282896590588898, "grad_norm": 0.16226164996623993, "learning_rate": 8.572699113687246e-05, "loss": 0.8203, "mean_token_accuracy": 0.7620999440550804, "num_tokens": 148572247.0, "step": 4655 }, { "entropy": 0.7783125452697277, "epoch": 0.42838166543033107, "grad_norm": 0.16882121562957764, "learning_rate": 8.572392431073082e-05, "loss": 0.7658, "mean_token_accuracy": 0.7721019461750984, "num_tokens": 148604190.0, "step": 4656 }, { "entropy": 0.7673468887805939, "epoch": 0.42847367180177226, "grad_norm": 0.15153905749320984, "learning_rate": 8.57208574845892e-05, "loss": 0.7438, "mean_token_accuracy": 0.7774068042635918, "num_tokens": 148635535.0, "step": 4657 }, { "entropy": 0.8608374204486609, "epoch": 0.4285656781732135, "grad_norm": 0.15700213611125946, "learning_rate": 8.571779065844757e-05, "loss": 0.8488, "mean_token_accuracy": 0.7557462975382805, "num_tokens": 148667745.0, "step": 4658 }, { "entropy": 0.8797313198447227, "epoch": 0.4286576845446547, "grad_norm": 0.15872950851917267, "learning_rate": 8.571472383230596e-05, "loss": 0.8752, "mean_token_accuracy": 0.7503047734498978, "num_tokens": 148699498.0, "step": 4659 }, { "entropy": 0.8813257776200771, "epoch": 0.42874969091609594, "grad_norm": 0.15805450081825256, "learning_rate": 8.571165700616432e-05, "loss": 0.8629, "mean_token_accuracy": 0.7508545629680157, "num_tokens": 148731612.0, "step": 4660 }, { "entropy": 0.8960307016968727, "epoch": 0.4288416972875372, "grad_norm": 0.16184832155704498, "learning_rate": 8.570859018002269e-05, "loss": 0.8627, "mean_token_accuracy": 0.7487686835229397, "num_tokens": 148763299.0, "step": 4661 }, { "entropy": 0.767580471932888, "epoch": 0.42893370365897837, "grad_norm": 0.15531283617019653, "learning_rate": 8.570552335388107e-05, "loss": 0.7526, "mean_token_accuracy": 0.7822843641042709, "num_tokens": 148795861.0, "step": 4662 }, { "entropy": 0.9275734163820744, "epoch": 0.4290257100304196, "grad_norm": 0.16419555246829987, "learning_rate": 8.570245652773945e-05, "loss": 0.9223, "mean_token_accuracy": 0.7343013994395733, "num_tokens": 148828074.0, "step": 4663 }, { "entropy": 0.8748325183987617, "epoch": 0.4291177164018608, "grad_norm": 0.16466861963272095, "learning_rate": 8.569938970159782e-05, "loss": 0.8829, "mean_token_accuracy": 0.7459830492734909, "num_tokens": 148860298.0, "step": 4664 }, { "entropy": 0.8054137043654919, "epoch": 0.42920972277330205, "grad_norm": 0.1603316068649292, "learning_rate": 8.569632287545619e-05, "loss": 0.8158, "mean_token_accuracy": 0.7701255418360233, "num_tokens": 148892128.0, "step": 4665 }, { "entropy": 0.8207780122756958, "epoch": 0.4293017291447433, "grad_norm": 0.15869870781898499, "learning_rate": 8.569325604931456e-05, "loss": 0.819, "mean_token_accuracy": 0.7614870592951775, "num_tokens": 148924543.0, "step": 4666 }, { "entropy": 0.9153033532202244, "epoch": 0.4293937355161845, "grad_norm": 0.16945548355579376, "learning_rate": 8.569018922317294e-05, "loss": 0.932, "mean_token_accuracy": 0.7346658669412136, "num_tokens": 148956654.0, "step": 4667 }, { "entropy": 0.8417079374194145, "epoch": 0.4294857418876257, "grad_norm": 0.1542143076658249, "learning_rate": 8.568712239703132e-05, "loss": 0.8337, "mean_token_accuracy": 0.7604818046092987, "num_tokens": 148988419.0, "step": 4668 }, { "entropy": 0.8327589016407728, "epoch": 0.4295777482590669, "grad_norm": 0.15841051936149597, "learning_rate": 8.568405557088969e-05, "loss": 0.8137, "mean_token_accuracy": 0.7665178254246712, "num_tokens": 149021183.0, "step": 4669 }, { "entropy": 0.829756261780858, "epoch": 0.42966975463050816, "grad_norm": 0.15715663135051727, "learning_rate": 8.568098874474807e-05, "loss": 0.8204, "mean_token_accuracy": 0.7636994272470474, "num_tokens": 149053230.0, "step": 4670 }, { "entropy": 0.8022433426231146, "epoch": 0.4297617610019494, "grad_norm": 0.15193212032318115, "learning_rate": 8.567792191860644e-05, "loss": 0.7735, "mean_token_accuracy": 0.7746239453554153, "num_tokens": 149085560.0, "step": 4671 }, { "entropy": 0.7933313436806202, "epoch": 0.4298537673733906, "grad_norm": 0.15679767727851868, "learning_rate": 8.56748550924648e-05, "loss": 0.771, "mean_token_accuracy": 0.7743867337703705, "num_tokens": 149117262.0, "step": 4672 }, { "entropy": 0.7440774887800217, "epoch": 0.42994577374483184, "grad_norm": 0.15412816405296326, "learning_rate": 8.567178826632319e-05, "loss": 0.7234, "mean_token_accuracy": 0.7876635529100895, "num_tokens": 149149325.0, "step": 4673 }, { "entropy": 0.8150984980165958, "epoch": 0.430037780116273, "grad_norm": 0.16799621284008026, "learning_rate": 8.566872144018157e-05, "loss": 0.8381, "mean_token_accuracy": 0.7565007135272026, "num_tokens": 149181389.0, "step": 4674 }, { "entropy": 0.8659826964139938, "epoch": 0.43012978648771427, "grad_norm": 0.15676386654376984, "learning_rate": 8.566565461403994e-05, "loss": 0.8574, "mean_token_accuracy": 0.7593124099075794, "num_tokens": 149214157.0, "step": 4675 }, { "entropy": 0.8996595200151205, "epoch": 0.4302217928591555, "grad_norm": 0.15889915823936462, "learning_rate": 8.56625877878983e-05, "loss": 0.8849, "mean_token_accuracy": 0.7455117516219616, "num_tokens": 149245064.0, "step": 4676 }, { "entropy": 0.8075528591871262, "epoch": 0.4303137992305967, "grad_norm": 0.5708184242248535, "learning_rate": 8.565952096175667e-05, "loss": 0.7839, "mean_token_accuracy": 0.7728626057505608, "num_tokens": 149277261.0, "step": 4677 }, { "entropy": 0.8302259277552366, "epoch": 0.43040580560203795, "grad_norm": 0.1743858903646469, "learning_rate": 8.565645413561507e-05, "loss": 0.8481, "mean_token_accuracy": 0.756588526070118, "num_tokens": 149309537.0, "step": 4678 }, { "entropy": 0.8359114155173302, "epoch": 0.43049781197347914, "grad_norm": 0.15659821033477783, "learning_rate": 8.565338730947343e-05, "loss": 0.8356, "mean_token_accuracy": 0.7582040317356586, "num_tokens": 149342018.0, "step": 4679 }, { "entropy": 0.8314057998359203, "epoch": 0.4305898183449204, "grad_norm": 0.16471658647060394, "learning_rate": 8.56503204833318e-05, "loss": 0.8184, "mean_token_accuracy": 0.7571682445704937, "num_tokens": 149374092.0, "step": 4680 }, { "entropy": 0.6771348547190428, "epoch": 0.4306818247163616, "grad_norm": 0.1696586310863495, "learning_rate": 8.564725365719017e-05, "loss": 0.67, "mean_token_accuracy": 0.8013429567217827, "num_tokens": 149406476.0, "step": 4681 }, { "entropy": 0.6836149860173464, "epoch": 0.4307738310878028, "grad_norm": 0.14521819353103638, "learning_rate": 8.564418683104855e-05, "loss": 0.6756, "mean_token_accuracy": 0.7989351116120815, "num_tokens": 149438757.0, "step": 4682 }, { "entropy": 0.7101553231477737, "epoch": 0.43086583745924406, "grad_norm": 0.16063115000724792, "learning_rate": 8.564112000490693e-05, "loss": 0.6935, "mean_token_accuracy": 0.7916360534727573, "num_tokens": 149470042.0, "step": 4683 }, { "entropy": 0.8413604944944382, "epoch": 0.43095784383068525, "grad_norm": 0.17201068997383118, "learning_rate": 8.56380531787653e-05, "loss": 0.87, "mean_token_accuracy": 0.7559412643313408, "num_tokens": 149502682.0, "step": 4684 }, { "entropy": 0.8052816409617662, "epoch": 0.4310498502021265, "grad_norm": 0.17124561965465546, "learning_rate": 8.563498635262367e-05, "loss": 0.7881, "mean_token_accuracy": 0.7714412696659565, "num_tokens": 149534353.0, "step": 4685 }, { "entropy": 0.8808044698089361, "epoch": 0.43114185657356774, "grad_norm": 0.1582329422235489, "learning_rate": 8.563191952648205e-05, "loss": 0.8828, "mean_token_accuracy": 0.746374350041151, "num_tokens": 149566864.0, "step": 4686 }, { "entropy": 0.7647868786007166, "epoch": 0.43123386294500893, "grad_norm": 0.15566079318523407, "learning_rate": 8.562885270034042e-05, "loss": 0.7602, "mean_token_accuracy": 0.7781843692064285, "num_tokens": 149598989.0, "step": 4687 }, { "entropy": 0.8109480738639832, "epoch": 0.4313258693164502, "grad_norm": 0.15668648481369019, "learning_rate": 8.56257858741988e-05, "loss": 0.8119, "mean_token_accuracy": 0.7627065554261208, "num_tokens": 149631193.0, "step": 4688 }, { "entropy": 0.7557604480534792, "epoch": 0.43141787568789136, "grad_norm": 0.1543303281068802, "learning_rate": 8.562271904805717e-05, "loss": 0.752, "mean_token_accuracy": 0.7749083563685417, "num_tokens": 149662727.0, "step": 4689 }, { "entropy": 0.7809812277555466, "epoch": 0.4315098820593326, "grad_norm": 0.1488116979598999, "learning_rate": 8.561965222191555e-05, "loss": 0.7749, "mean_token_accuracy": 0.7762957289814949, "num_tokens": 149695108.0, "step": 4690 }, { "entropy": 0.7836719155311584, "epoch": 0.43160188843077385, "grad_norm": 0.15261292457580566, "learning_rate": 8.561658539577392e-05, "loss": 0.758, "mean_token_accuracy": 0.7793101519346237, "num_tokens": 149726781.0, "step": 4691 }, { "entropy": 0.7687590289860964, "epoch": 0.43169389480221504, "grad_norm": 0.1536664515733719, "learning_rate": 8.561351856963228e-05, "loss": 0.7292, "mean_token_accuracy": 0.788710705935955, "num_tokens": 149758977.0, "step": 4692 }, { "entropy": 0.8875763118267059, "epoch": 0.4317859011736563, "grad_norm": 0.15894676744937897, "learning_rate": 8.561045174349067e-05, "loss": 0.8749, "mean_token_accuracy": 0.7482263147830963, "num_tokens": 149790534.0, "step": 4693 }, { "entropy": 0.8394260071218014, "epoch": 0.4318779075450975, "grad_norm": 0.16099049150943756, "learning_rate": 8.560738491734905e-05, "loss": 0.8352, "mean_token_accuracy": 0.7609627544879913, "num_tokens": 149822956.0, "step": 4694 }, { "entropy": 0.8911239188164473, "epoch": 0.4319699139165387, "grad_norm": 0.16837310791015625, "learning_rate": 8.560431809120742e-05, "loss": 0.8788, "mean_token_accuracy": 0.7469450980424881, "num_tokens": 149854012.0, "step": 4695 }, { "entropy": 0.7764223739504814, "epoch": 0.43206192028797996, "grad_norm": 0.16536866128444672, "learning_rate": 8.560125126506578e-05, "loss": 0.7668, "mean_token_accuracy": 0.7773840576410294, "num_tokens": 149885867.0, "step": 4696 }, { "entropy": 0.7501247599720955, "epoch": 0.43215392665942115, "grad_norm": 0.16054317355155945, "learning_rate": 8.559818443892415e-05, "loss": 0.735, "mean_token_accuracy": 0.7856106720864773, "num_tokens": 149917424.0, "step": 4697 }, { "entropy": 0.8092388957738876, "epoch": 0.4322459330308624, "grad_norm": 0.15862822532653809, "learning_rate": 8.559511761278253e-05, "loss": 0.8226, "mean_token_accuracy": 0.7631352208554745, "num_tokens": 149949523.0, "step": 4698 }, { "entropy": 0.8412404544651508, "epoch": 0.4323379394023036, "grad_norm": 0.16467128694057465, "learning_rate": 8.559205078664091e-05, "loss": 0.8307, "mean_token_accuracy": 0.7626721747219563, "num_tokens": 149981504.0, "step": 4699 }, { "entropy": 0.7238278388977051, "epoch": 0.43242994577374483, "grad_norm": 0.16265246272087097, "learning_rate": 8.558898396049928e-05, "loss": 0.7182, "mean_token_accuracy": 0.79255535826087, "num_tokens": 150013703.0, "step": 4700 }, { "entropy": 0.7189370542764664, "epoch": 0.4325219521451861, "grad_norm": 0.16005480289459229, "learning_rate": 8.558591713435766e-05, "loss": 0.7235, "mean_token_accuracy": 0.785461850464344, "num_tokens": 150045238.0, "step": 4701 }, { "entropy": 0.8666659295558929, "epoch": 0.43261395851662726, "grad_norm": 0.15947146713733673, "learning_rate": 8.558285030821603e-05, "loss": 0.8506, "mean_token_accuracy": 0.7491436526179314, "num_tokens": 150076578.0, "step": 4702 }, { "entropy": 0.8473078981041908, "epoch": 0.4327059648880685, "grad_norm": 0.15863639116287231, "learning_rate": 8.55797834820744e-05, "loss": 0.8621, "mean_token_accuracy": 0.7505077496170998, "num_tokens": 150108473.0, "step": 4703 }, { "entropy": 0.6974059287458658, "epoch": 0.4327979712595097, "grad_norm": 0.16399797797203064, "learning_rate": 8.557671665593278e-05, "loss": 0.693, "mean_token_accuracy": 0.7972534485161304, "num_tokens": 150140853.0, "step": 4704 }, { "entropy": 0.8172098398208618, "epoch": 0.43288997763095094, "grad_norm": 0.15929129719734192, "learning_rate": 8.557364982979116e-05, "loss": 0.8007, "mean_token_accuracy": 0.7659633941948414, "num_tokens": 150172897.0, "step": 4705 }, { "entropy": 0.8716510646045208, "epoch": 0.4329819840023922, "grad_norm": 0.1725178360939026, "learning_rate": 8.557058300364953e-05, "loss": 0.8646, "mean_token_accuracy": 0.7588584534823895, "num_tokens": 150204834.0, "step": 4706 }, { "entropy": 0.7693596314638853, "epoch": 0.4330739903738334, "grad_norm": 0.15682809054851532, "learning_rate": 8.55675161775079e-05, "loss": 0.7849, "mean_token_accuracy": 0.7706845477223396, "num_tokens": 150236154.0, "step": 4707 }, { "entropy": 0.6986318714916706, "epoch": 0.4331659967452746, "grad_norm": 0.15159638226032257, "learning_rate": 8.556444935136627e-05, "loss": 0.6791, "mean_token_accuracy": 0.7948814146220684, "num_tokens": 150267996.0, "step": 4708 }, { "entropy": 0.7980844508856535, "epoch": 0.4332580031167158, "grad_norm": 0.16267181932926178, "learning_rate": 8.556138252522465e-05, "loss": 0.8077, "mean_token_accuracy": 0.7642902918159962, "num_tokens": 150299781.0, "step": 4709 }, { "entropy": 0.7623817529529333, "epoch": 0.43335000948815705, "grad_norm": 0.162998229265213, "learning_rate": 8.555831569908303e-05, "loss": 0.7378, "mean_token_accuracy": 0.7841429077088833, "num_tokens": 150331959.0, "step": 4710 }, { "entropy": 0.8343127518892288, "epoch": 0.4334420158595983, "grad_norm": 0.16318976879119873, "learning_rate": 8.55552488729414e-05, "loss": 0.8276, "mean_token_accuracy": 0.7603723704814911, "num_tokens": 150363171.0, "step": 4711 }, { "entropy": 0.8071335759013891, "epoch": 0.4335340222310395, "grad_norm": 0.1523260474205017, "learning_rate": 8.555218204679976e-05, "loss": 0.794, "mean_token_accuracy": 0.7686784975230694, "num_tokens": 150395115.0, "step": 4712 }, { "entropy": 0.7951165772974491, "epoch": 0.43362602860248073, "grad_norm": 0.15072591602802277, "learning_rate": 8.554911522065815e-05, "loss": 0.781, "mean_token_accuracy": 0.7701710127294064, "num_tokens": 150427435.0, "step": 4713 }, { "entropy": 0.8092553541064262, "epoch": 0.4337180349739219, "grad_norm": 0.1590370237827301, "learning_rate": 8.554604839451651e-05, "loss": 0.7984, "mean_token_accuracy": 0.7650387957692146, "num_tokens": 150459855.0, "step": 4714 }, { "entropy": 0.875880990177393, "epoch": 0.43381004134536316, "grad_norm": 0.15786035358905792, "learning_rate": 8.55429815683749e-05, "loss": 0.8631, "mean_token_accuracy": 0.7515531927347183, "num_tokens": 150490979.0, "step": 4715 }, { "entropy": 0.8424091748893261, "epoch": 0.4339020477168044, "grad_norm": 0.1619425266981125, "learning_rate": 8.553991474223326e-05, "loss": 0.8409, "mean_token_accuracy": 0.7569734267890453, "num_tokens": 150523065.0, "step": 4716 }, { "entropy": 0.8644343465566635, "epoch": 0.4339940540882456, "grad_norm": 0.16668856143951416, "learning_rate": 8.553684791609164e-05, "loss": 0.8549, "mean_token_accuracy": 0.7514769770205021, "num_tokens": 150554467.0, "step": 4717 }, { "entropy": 0.8935752175748348, "epoch": 0.43408606045968684, "grad_norm": 0.1650361567735672, "learning_rate": 8.553378108995001e-05, "loss": 0.8838, "mean_token_accuracy": 0.7479878291487694, "num_tokens": 150586788.0, "step": 4718 }, { "entropy": 0.9369134232401848, "epoch": 0.43417806683112803, "grad_norm": 0.16090576350688934, "learning_rate": 8.55307142638084e-05, "loss": 0.9133, "mean_token_accuracy": 0.7387399300932884, "num_tokens": 150618752.0, "step": 4719 }, { "entropy": 0.7373160682618618, "epoch": 0.4342700732025693, "grad_norm": 0.15626633167266846, "learning_rate": 8.552764743766676e-05, "loss": 0.7131, "mean_token_accuracy": 0.7910356558859348, "num_tokens": 150651520.0, "step": 4720 }, { "entropy": 0.8741193562746048, "epoch": 0.4343620795740105, "grad_norm": 0.15491756796836853, "learning_rate": 8.552458061152514e-05, "loss": 0.8747, "mean_token_accuracy": 0.7485405132174492, "num_tokens": 150683687.0, "step": 4721 }, { "entropy": 0.7261905651539564, "epoch": 0.4344540859454517, "grad_norm": 0.1493799090385437, "learning_rate": 8.552151378538351e-05, "loss": 0.714, "mean_token_accuracy": 0.7899894341826439, "num_tokens": 150715810.0, "step": 4722 }, { "entropy": 0.7515033222734928, "epoch": 0.43454609231689295, "grad_norm": 0.14950476586818695, "learning_rate": 8.551844695924188e-05, "loss": 0.7429, "mean_token_accuracy": 0.7803672850131989, "num_tokens": 150748154.0, "step": 4723 }, { "entropy": 0.8241373021155596, "epoch": 0.43463809868833414, "grad_norm": 0.1634214222431183, "learning_rate": 8.551538013310026e-05, "loss": 0.8203, "mean_token_accuracy": 0.762108575552702, "num_tokens": 150780387.0, "step": 4724 }, { "entropy": 0.7501262072473764, "epoch": 0.4347301050597754, "grad_norm": 0.15816329419612885, "learning_rate": 8.551231330695864e-05, "loss": 0.762, "mean_token_accuracy": 0.7749011404812336, "num_tokens": 150811883.0, "step": 4725 }, { "entropy": 0.7763395365327597, "epoch": 0.43482211143121663, "grad_norm": 0.15731342136859894, "learning_rate": 8.550924648081701e-05, "loss": 0.7878, "mean_token_accuracy": 0.7759186662733555, "num_tokens": 150843841.0, "step": 4726 }, { "entropy": 0.7499911841005087, "epoch": 0.4349141178026578, "grad_norm": 0.15760089457035065, "learning_rate": 8.550617965467538e-05, "loss": 0.7528, "mean_token_accuracy": 0.7778587676584721, "num_tokens": 150875721.0, "step": 4727 }, { "entropy": 0.7814024835824966, "epoch": 0.43500612417409906, "grad_norm": 0.16215713322162628, "learning_rate": 8.550311282853375e-05, "loss": 0.7715, "mean_token_accuracy": 0.7755322605371475, "num_tokens": 150906863.0, "step": 4728 }, { "entropy": 0.8015024289488792, "epoch": 0.43509813054554025, "grad_norm": 0.16746953129768372, "learning_rate": 8.550004600239213e-05, "loss": 0.8108, "mean_token_accuracy": 0.7679606080055237, "num_tokens": 150938454.0, "step": 4729 }, { "entropy": 0.820079093798995, "epoch": 0.4351901369169815, "grad_norm": 0.1614924967288971, "learning_rate": 8.549697917625051e-05, "loss": 0.8231, "mean_token_accuracy": 0.7601314336061478, "num_tokens": 150970893.0, "step": 4730 }, { "entropy": 0.7493061348795891, "epoch": 0.43528214328842274, "grad_norm": 0.16535025835037231, "learning_rate": 8.549391235010888e-05, "loss": 0.7603, "mean_token_accuracy": 0.7811987660825253, "num_tokens": 151003025.0, "step": 4731 }, { "entropy": 0.7720494996756315, "epoch": 0.43537414965986393, "grad_norm": 0.15942054986953735, "learning_rate": 8.549084552396726e-05, "loss": 0.7457, "mean_token_accuracy": 0.7799035273492336, "num_tokens": 151035129.0, "step": 4732 }, { "entropy": 0.7238975688815117, "epoch": 0.4354661560313052, "grad_norm": 0.1594621241092682, "learning_rate": 8.548777869782563e-05, "loss": 0.7168, "mean_token_accuracy": 0.7831969484686852, "num_tokens": 151067341.0, "step": 4733 }, { "entropy": 0.813464317470789, "epoch": 0.43555816240274636, "grad_norm": 0.1562364250421524, "learning_rate": 8.548471187168399e-05, "loss": 0.792, "mean_token_accuracy": 0.7702169977128506, "num_tokens": 151099294.0, "step": 4734 }, { "entropy": 0.7381563633680344, "epoch": 0.4356501687741876, "grad_norm": 0.1566087007522583, "learning_rate": 8.548164504554237e-05, "loss": 0.7307, "mean_token_accuracy": 0.7879578210413456, "num_tokens": 151130898.0, "step": 4735 }, { "entropy": 0.7959471344947815, "epoch": 0.43574217514562885, "grad_norm": 0.15512970089912415, "learning_rate": 8.547857821940076e-05, "loss": 0.7804, "mean_token_accuracy": 0.7789716832339764, "num_tokens": 151163081.0, "step": 4736 }, { "entropy": 0.7835030574351549, "epoch": 0.43583418151707004, "grad_norm": 0.16127976775169373, "learning_rate": 8.547551139325912e-05, "loss": 0.7582, "mean_token_accuracy": 0.7777202352881432, "num_tokens": 151194952.0, "step": 4737 }, { "entropy": 0.8112133536487818, "epoch": 0.4359261878885113, "grad_norm": 0.15452940762043, "learning_rate": 8.547244456711749e-05, "loss": 0.8009, "mean_token_accuracy": 0.7654952183365822, "num_tokens": 151226944.0, "step": 4738 }, { "entropy": 0.861429825425148, "epoch": 0.4360181942599525, "grad_norm": 0.16686268150806427, "learning_rate": 8.546937774097586e-05, "loss": 0.8436, "mean_token_accuracy": 0.7558138184249401, "num_tokens": 151259479.0, "step": 4739 }, { "entropy": 0.7244261261075735, "epoch": 0.4361102006313937, "grad_norm": 0.1548422873020172, "learning_rate": 8.546631091483424e-05, "loss": 0.7178, "mean_token_accuracy": 0.7959474734961987, "num_tokens": 151290877.0, "step": 4740 }, { "entropy": 0.8548797313123941, "epoch": 0.43620220700283496, "grad_norm": 0.15863099694252014, "learning_rate": 8.546324408869262e-05, "loss": 0.8562, "mean_token_accuracy": 0.750369492918253, "num_tokens": 151322917.0, "step": 4741 }, { "entropy": 0.7791571691632271, "epoch": 0.43629421337427615, "grad_norm": 0.15428714454174042, "learning_rate": 8.546017726255099e-05, "loss": 0.7638, "mean_token_accuracy": 0.7723629921674728, "num_tokens": 151355040.0, "step": 4742 }, { "entropy": 0.7898006904870272, "epoch": 0.4363862197457174, "grad_norm": 0.15450982749462128, "learning_rate": 8.545711043640936e-05, "loss": 0.7735, "mean_token_accuracy": 0.7748834826052189, "num_tokens": 151386760.0, "step": 4743 }, { "entropy": 0.6891493797302246, "epoch": 0.43647822611715864, "grad_norm": 0.15753257274627686, "learning_rate": 8.545404361026774e-05, "loss": 0.6696, "mean_token_accuracy": 0.8030851744115353, "num_tokens": 151419037.0, "step": 4744 }, { "entropy": 0.7723507359623909, "epoch": 0.43657023248859983, "grad_norm": 0.15320102870464325, "learning_rate": 8.545097678412611e-05, "loss": 0.7773, "mean_token_accuracy": 0.7732631638646126, "num_tokens": 151451609.0, "step": 4745 }, { "entropy": 0.6957397721707821, "epoch": 0.4366622388600411, "grad_norm": 0.14998342096805573, "learning_rate": 8.544790995798449e-05, "loss": 0.6803, "mean_token_accuracy": 0.7989898286759853, "num_tokens": 151483749.0, "step": 4746 }, { "entropy": 0.7721174769103527, "epoch": 0.43675424523148226, "grad_norm": 0.15847167372703552, "learning_rate": 8.544484313184286e-05, "loss": 0.7742, "mean_token_accuracy": 0.7717486396431923, "num_tokens": 151515888.0, "step": 4747 }, { "entropy": 0.7962457314133644, "epoch": 0.4368462516029235, "grad_norm": 0.1562553346157074, "learning_rate": 8.544177630570124e-05, "loss": 0.7967, "mean_token_accuracy": 0.7646395154297352, "num_tokens": 151547330.0, "step": 4748 }, { "entropy": 0.734290175139904, "epoch": 0.43693825797436475, "grad_norm": 0.16224025189876556, "learning_rate": 8.54387094795596e-05, "loss": 0.7402, "mean_token_accuracy": 0.7825392819941044, "num_tokens": 151579278.0, "step": 4749 }, { "entropy": 0.8370578270405531, "epoch": 0.43703026434580594, "grad_norm": 0.15599176287651062, "learning_rate": 8.543564265341797e-05, "loss": 0.8429, "mean_token_accuracy": 0.7572980113327503, "num_tokens": 151610987.0, "step": 4750 }, { "entropy": 0.796088358387351, "epoch": 0.4371222707172472, "grad_norm": 0.1607772707939148, "learning_rate": 8.543257582727636e-05, "loss": 0.8045, "mean_token_accuracy": 0.7677928693592548, "num_tokens": 151642862.0, "step": 4751 }, { "entropy": 0.8880335167050362, "epoch": 0.4372142770886884, "grad_norm": 0.16782091557979584, "learning_rate": 8.542950900113474e-05, "loss": 0.9108, "mean_token_accuracy": 0.74068358913064, "num_tokens": 151674955.0, "step": 4752 }, { "entropy": 0.7118587270379066, "epoch": 0.4373062834601296, "grad_norm": 0.14450190961360931, "learning_rate": 8.54264421749931e-05, "loss": 0.685, "mean_token_accuracy": 0.7973864153027534, "num_tokens": 151707723.0, "step": 4753 }, { "entropy": 0.8263829201459885, "epoch": 0.43739828983157086, "grad_norm": 0.15710324048995972, "learning_rate": 8.542337534885147e-05, "loss": 0.8135, "mean_token_accuracy": 0.7598453499376774, "num_tokens": 151739447.0, "step": 4754 }, { "entropy": 0.8764786124229431, "epoch": 0.43749029620301205, "grad_norm": 0.16961397230625153, "learning_rate": 8.542030852270984e-05, "loss": 0.8815, "mean_token_accuracy": 0.7506719306111336, "num_tokens": 151771137.0, "step": 4755 }, { "entropy": 0.7924650516360998, "epoch": 0.4375823025744533, "grad_norm": 0.15813428163528442, "learning_rate": 8.541724169656824e-05, "loss": 0.7756, "mean_token_accuracy": 0.7760673388838768, "num_tokens": 151803121.0, "step": 4756 }, { "entropy": 0.7913246769458055, "epoch": 0.4376743089458945, "grad_norm": 0.1600050926208496, "learning_rate": 8.54141748704266e-05, "loss": 0.7597, "mean_token_accuracy": 0.7773286364972591, "num_tokens": 151835602.0, "step": 4757 }, { "entropy": 0.9466858617961407, "epoch": 0.43776631531733573, "grad_norm": 0.16863282024860382, "learning_rate": 8.541110804428497e-05, "loss": 0.9319, "mean_token_accuracy": 0.7318245656788349, "num_tokens": 151867386.0, "step": 4758 }, { "entropy": 0.7729724626988173, "epoch": 0.437858321688777, "grad_norm": 0.16267797350883484, "learning_rate": 8.540804121814334e-05, "loss": 0.7672, "mean_token_accuracy": 0.7768966518342495, "num_tokens": 151899432.0, "step": 4759 }, { "entropy": 0.8050575964152813, "epoch": 0.43795032806021816, "grad_norm": 0.16061995923519135, "learning_rate": 8.540497439200172e-05, "loss": 0.8074, "mean_token_accuracy": 0.7666183486580849, "num_tokens": 151931776.0, "step": 4760 }, { "entropy": 0.7562859170138836, "epoch": 0.4380423344316594, "grad_norm": 0.15496082603931427, "learning_rate": 8.54019075658601e-05, "loss": 0.7248, "mean_token_accuracy": 0.7888966649770737, "num_tokens": 151964229.0, "step": 4761 }, { "entropy": 0.7822975125163794, "epoch": 0.4381343408031006, "grad_norm": 0.1546972543001175, "learning_rate": 8.539884073971847e-05, "loss": 0.7662, "mean_token_accuracy": 0.7751418277621269, "num_tokens": 151996449.0, "step": 4762 }, { "entropy": 0.8116856478154659, "epoch": 0.43822634717454184, "grad_norm": 0.15661627054214478, "learning_rate": 8.539577391357685e-05, "loss": 0.8069, "mean_token_accuracy": 0.7684183903038502, "num_tokens": 152028640.0, "step": 4763 }, { "entropy": 0.7306651398539543, "epoch": 0.4383183535459831, "grad_norm": 0.1537189483642578, "learning_rate": 8.539270708743522e-05, "loss": 0.7199, "mean_token_accuracy": 0.7879774123430252, "num_tokens": 152060189.0, "step": 4764 }, { "entropy": 0.7610232979059219, "epoch": 0.4384103599174243, "grad_norm": 0.1554393321275711, "learning_rate": 8.538964026129359e-05, "loss": 0.7526, "mean_token_accuracy": 0.7793011665344238, "num_tokens": 152091972.0, "step": 4765 }, { "entropy": 0.8267065398395061, "epoch": 0.4385023662888655, "grad_norm": 0.1648242175579071, "learning_rate": 8.538657343515197e-05, "loss": 0.8486, "mean_token_accuracy": 0.755374476313591, "num_tokens": 152123624.0, "step": 4766 }, { "entropy": 0.8233845718204975, "epoch": 0.4385943726603067, "grad_norm": 0.1624373197555542, "learning_rate": 8.538350660901035e-05, "loss": 0.8364, "mean_token_accuracy": 0.7596427015960217, "num_tokens": 152155296.0, "step": 4767 }, { "entropy": 0.5895988140255213, "epoch": 0.43868637903174795, "grad_norm": 0.1544891744852066, "learning_rate": 8.538043978286872e-05, "loss": 0.5657, "mean_token_accuracy": 0.834157470613718, "num_tokens": 152187532.0, "step": 4768 }, { "entropy": 0.7061627823859453, "epoch": 0.4387783854031892, "grad_norm": 0.14680983126163483, "learning_rate": 8.537737295672709e-05, "loss": 0.6996, "mean_token_accuracy": 0.790699802339077, "num_tokens": 152220300.0, "step": 4769 }, { "entropy": 0.9066670760512352, "epoch": 0.4388703917746304, "grad_norm": 0.16805610060691833, "learning_rate": 8.537430613058545e-05, "loss": 0.907, "mean_token_accuracy": 0.7421443164348602, "num_tokens": 152250850.0, "step": 4770 }, { "entropy": 0.782124899327755, "epoch": 0.43896239814607163, "grad_norm": 0.15229229629039764, "learning_rate": 8.537123930444383e-05, "loss": 0.7757, "mean_token_accuracy": 0.7741700112819672, "num_tokens": 152282930.0, "step": 4771 }, { "entropy": 0.7585091777145863, "epoch": 0.4390544045175128, "grad_norm": 0.15767216682434082, "learning_rate": 8.536817247830222e-05, "loss": 0.7402, "mean_token_accuracy": 0.7815235629677773, "num_tokens": 152314701.0, "step": 4772 }, { "entropy": 0.8989594429731369, "epoch": 0.43914641088895406, "grad_norm": 0.16780716180801392, "learning_rate": 8.536510565216058e-05, "loss": 0.9019, "mean_token_accuracy": 0.7382672131061554, "num_tokens": 152347111.0, "step": 4773 }, { "entropy": 0.819849805906415, "epoch": 0.4392384172603953, "grad_norm": 0.16227132081985474, "learning_rate": 8.536203882601895e-05, "loss": 0.8265, "mean_token_accuracy": 0.7587190493941307, "num_tokens": 152379030.0, "step": 4774 }, { "entropy": 0.6876540258526802, "epoch": 0.4393304236318365, "grad_norm": 0.16583429276943207, "learning_rate": 8.535897199987733e-05, "loss": 0.662, "mean_token_accuracy": 0.8047928959131241, "num_tokens": 152411134.0, "step": 4775 }, { "entropy": 0.9311277084052563, "epoch": 0.43942243000327774, "grad_norm": 0.16684646904468536, "learning_rate": 8.53559051737357e-05, "loss": 0.9241, "mean_token_accuracy": 0.7346858121454716, "num_tokens": 152442700.0, "step": 4776 }, { "entropy": 0.744076581671834, "epoch": 0.43951443637471893, "grad_norm": 0.1595582813024521, "learning_rate": 8.535283834759408e-05, "loss": 0.7545, "mean_token_accuracy": 0.7831289395689964, "num_tokens": 152474538.0, "step": 4777 }, { "entropy": 0.894266290590167, "epoch": 0.4396064427461602, "grad_norm": 0.1583837866783142, "learning_rate": 8.534977152145245e-05, "loss": 0.8623, "mean_token_accuracy": 0.7518083639442921, "num_tokens": 152505605.0, "step": 4778 }, { "entropy": 0.7174028418958187, "epoch": 0.4396984491176014, "grad_norm": 0.15987354516983032, "learning_rate": 8.534670469531083e-05, "loss": 0.6994, "mean_token_accuracy": 0.7943818084895611, "num_tokens": 152537582.0, "step": 4779 }, { "entropy": 0.8412028029561043, "epoch": 0.4397904554890426, "grad_norm": 0.15928657352924347, "learning_rate": 8.53436378691692e-05, "loss": 0.8357, "mean_token_accuracy": 0.7594193778932095, "num_tokens": 152569692.0, "step": 4780 }, { "entropy": 0.9015024583786726, "epoch": 0.43988246186048385, "grad_norm": 0.16087566316127777, "learning_rate": 8.534057104302757e-05, "loss": 0.8939, "mean_token_accuracy": 0.7404895834624767, "num_tokens": 152601950.0, "step": 4781 }, { "entropy": 0.817371316254139, "epoch": 0.43997446823192504, "grad_norm": 0.15927821397781372, "learning_rate": 8.533750421688595e-05, "loss": 0.8254, "mean_token_accuracy": 0.7593819238245487, "num_tokens": 152634056.0, "step": 4782 }, { "entropy": 0.7467988897114992, "epoch": 0.4400664746033663, "grad_norm": 0.15280425548553467, "learning_rate": 8.533443739074433e-05, "loss": 0.7313, "mean_token_accuracy": 0.7812128774821758, "num_tokens": 152666571.0, "step": 4783 }, { "entropy": 0.7353355381637812, "epoch": 0.44015848097480753, "grad_norm": 0.1543206125497818, "learning_rate": 8.53313705646027e-05, "loss": 0.7125, "mean_token_accuracy": 0.7876325733959675, "num_tokens": 152698309.0, "step": 4784 }, { "entropy": 0.7685670405626297, "epoch": 0.4402504873462487, "grad_norm": 0.16929492354393005, "learning_rate": 8.532830373846107e-05, "loss": 0.759, "mean_token_accuracy": 0.7803909406065941, "num_tokens": 152730427.0, "step": 4785 }, { "entropy": 0.8975858744233847, "epoch": 0.44034249371768996, "grad_norm": 0.16315285861492157, "learning_rate": 8.532523691231943e-05, "loss": 0.8728, "mean_token_accuracy": 0.7469593584537506, "num_tokens": 152762531.0, "step": 4786 }, { "entropy": 0.7851618155837059, "epoch": 0.44043450008913115, "grad_norm": 0.15663422644138336, "learning_rate": 8.532217008617782e-05, "loss": 0.7904, "mean_token_accuracy": 0.7655009552836418, "num_tokens": 152794100.0, "step": 4787 }, { "entropy": 0.8710892461240292, "epoch": 0.4405265064605724, "grad_norm": 0.15682177245616913, "learning_rate": 8.53191032600362e-05, "loss": 0.8362, "mean_token_accuracy": 0.7583495788276196, "num_tokens": 152826778.0, "step": 4788 }, { "entropy": 0.7671521231532097, "epoch": 0.44061851283201364, "grad_norm": 0.16404008865356445, "learning_rate": 8.531603643389456e-05, "loss": 0.7805, "mean_token_accuracy": 0.7708914950489998, "num_tokens": 152858905.0, "step": 4789 }, { "entropy": 0.7773335240781307, "epoch": 0.44071051920345483, "grad_norm": 0.16303327679634094, "learning_rate": 8.531296960775295e-05, "loss": 0.7761, "mean_token_accuracy": 0.7693393900990486, "num_tokens": 152890889.0, "step": 4790 }, { "entropy": 0.8330507837235928, "epoch": 0.4408025255748961, "grad_norm": 0.16568523645401, "learning_rate": 8.530990278161131e-05, "loss": 0.8301, "mean_token_accuracy": 0.7616485096514225, "num_tokens": 152922855.0, "step": 4791 }, { "entropy": 0.7540663909167051, "epoch": 0.44089453194633726, "grad_norm": 0.16551201045513153, "learning_rate": 8.530683595546968e-05, "loss": 0.7689, "mean_token_accuracy": 0.7801748365163803, "num_tokens": 152955351.0, "step": 4792 }, { "entropy": 0.839316613972187, "epoch": 0.4409865383177785, "grad_norm": 0.16450689733028412, "learning_rate": 8.530376912932806e-05, "loss": 0.8429, "mean_token_accuracy": 0.760881420224905, "num_tokens": 152986761.0, "step": 4793 }, { "entropy": 0.7739088572561741, "epoch": 0.44107854468921975, "grad_norm": 0.1590813398361206, "learning_rate": 8.530070230318644e-05, "loss": 0.7729, "mean_token_accuracy": 0.7782654091715813, "num_tokens": 153019397.0, "step": 4794 }, { "entropy": 0.9111968986690044, "epoch": 0.44117055106066094, "grad_norm": 0.16821008920669556, "learning_rate": 8.529763547704481e-05, "loss": 0.906, "mean_token_accuracy": 0.740599162876606, "num_tokens": 153050580.0, "step": 4795 }, { "entropy": 0.6953868009150028, "epoch": 0.4412625574321022, "grad_norm": 0.139336958527565, "learning_rate": 8.529456865090318e-05, "loss": 0.6623, "mean_token_accuracy": 0.8026014640927315, "num_tokens": 153083201.0, "step": 4796 }, { "entropy": 0.732545044273138, "epoch": 0.4413545638035434, "grad_norm": 0.1535327285528183, "learning_rate": 8.529150182476155e-05, "loss": 0.7163, "mean_token_accuracy": 0.7888853251934052, "num_tokens": 153115387.0, "step": 4797 }, { "entropy": 0.7579482831060886, "epoch": 0.4414465701749846, "grad_norm": 0.15806682407855988, "learning_rate": 8.528843499861994e-05, "loss": 0.7713, "mean_token_accuracy": 0.7787821255624294, "num_tokens": 153147150.0, "step": 4798 }, { "entropy": 0.867162674665451, "epoch": 0.44153857654642586, "grad_norm": 0.15959234535694122, "learning_rate": 8.528536817247831e-05, "loss": 0.8489, "mean_token_accuracy": 0.7572667375206947, "num_tokens": 153179918.0, "step": 4799 }, { "entropy": 0.8269202318042517, "epoch": 0.44163058291786705, "grad_norm": 0.16405434906482697, "learning_rate": 8.528230134633668e-05, "loss": 0.8282, "mean_token_accuracy": 0.7626763582229614, "num_tokens": 153210163.0, "step": 4800 }, { "entropy": 0.9352712724357843, "epoch": 0.4417225892893083, "grad_norm": 0.1632317155599594, "learning_rate": 8.527923452019505e-05, "loss": 0.9272, "mean_token_accuracy": 0.7346980236470699, "num_tokens": 153242711.0, "step": 4801 }, { "entropy": 0.8103016559034586, "epoch": 0.4418145956607495, "grad_norm": 0.15515807271003723, "learning_rate": 8.527616769405343e-05, "loss": 0.7953, "mean_token_accuracy": 0.7709603905677795, "num_tokens": 153274189.0, "step": 4802 }, { "entropy": 0.6749774478375912, "epoch": 0.44190660203219073, "grad_norm": 0.14617526531219482, "learning_rate": 8.527310086791181e-05, "loss": 0.6461, "mean_token_accuracy": 0.8032250739634037, "num_tokens": 153306472.0, "step": 4803 }, { "entropy": 0.7998899780213833, "epoch": 0.441998608403632, "grad_norm": 0.1535605490207672, "learning_rate": 8.527003404177018e-05, "loss": 0.7531, "mean_token_accuracy": 0.7781371586024761, "num_tokens": 153337933.0, "step": 4804 }, { "entropy": 0.8150355480611324, "epoch": 0.44209061477507317, "grad_norm": 0.15442347526550293, "learning_rate": 8.526696721562855e-05, "loss": 0.7837, "mean_token_accuracy": 0.7746189311146736, "num_tokens": 153369760.0, "step": 4805 }, { "entropy": 0.8036406952887774, "epoch": 0.4421826211465144, "grad_norm": 0.1706598699092865, "learning_rate": 8.526390038948693e-05, "loss": 0.8086, "mean_token_accuracy": 0.7665969058871269, "num_tokens": 153400599.0, "step": 4806 }, { "entropy": 0.8397210985422134, "epoch": 0.4422746275179556, "grad_norm": 0.17091789841651917, "learning_rate": 8.52608335633453e-05, "loss": 0.8662, "mean_token_accuracy": 0.7510612271726131, "num_tokens": 153432179.0, "step": 4807 }, { "entropy": 0.7434779964387417, "epoch": 0.44236663388939684, "grad_norm": 0.15019308030605316, "learning_rate": 8.525776673720368e-05, "loss": 0.7356, "mean_token_accuracy": 0.7825622782111168, "num_tokens": 153464533.0, "step": 4808 }, { "entropy": 0.8030031435191631, "epoch": 0.4424586402608381, "grad_norm": 0.1622098833322525, "learning_rate": 8.525469991106204e-05, "loss": 0.8145, "mean_token_accuracy": 0.764342911541462, "num_tokens": 153496005.0, "step": 4809 }, { "entropy": 0.7088978849351406, "epoch": 0.4425506466322793, "grad_norm": 0.15482394397258759, "learning_rate": 8.525163308492043e-05, "loss": 0.695, "mean_token_accuracy": 0.790329597890377, "num_tokens": 153528355.0, "step": 4810 }, { "entropy": 0.7876562289893627, "epoch": 0.4426426530037205, "grad_norm": 0.1536676585674286, "learning_rate": 8.52485662587788e-05, "loss": 0.7745, "mean_token_accuracy": 0.7722665295004845, "num_tokens": 153560343.0, "step": 4811 }, { "entropy": 0.7820138167589903, "epoch": 0.4427346593751617, "grad_norm": 0.15709665417671204, "learning_rate": 8.524549943263716e-05, "loss": 0.7758, "mean_token_accuracy": 0.7721086628735065, "num_tokens": 153592308.0, "step": 4812 }, { "entropy": 0.7945087626576424, "epoch": 0.44282666574660295, "grad_norm": 0.15640568733215332, "learning_rate": 8.524243260649554e-05, "loss": 0.7759, "mean_token_accuracy": 0.7761771827936172, "num_tokens": 153624861.0, "step": 4813 }, { "entropy": 0.7891770135611296, "epoch": 0.4429186721180442, "grad_norm": 0.1646808385848999, "learning_rate": 8.523936578035392e-05, "loss": 0.789, "mean_token_accuracy": 0.7730864956974983, "num_tokens": 153656372.0, "step": 4814 }, { "entropy": 0.8187442570924759, "epoch": 0.4430106784894854, "grad_norm": 0.17163655161857605, "learning_rate": 8.523629895421229e-05, "loss": 0.7987, "mean_token_accuracy": 0.7684795819222927, "num_tokens": 153687410.0, "step": 4815 }, { "entropy": 0.8084456212818623, "epoch": 0.44310268486092663, "grad_norm": 0.16712243854999542, "learning_rate": 8.523323212807066e-05, "loss": 0.8077, "mean_token_accuracy": 0.7672344036400318, "num_tokens": 153719241.0, "step": 4816 }, { "entropy": 0.8988374900072813, "epoch": 0.4431946912323678, "grad_norm": 0.1655033528804779, "learning_rate": 8.523016530192903e-05, "loss": 0.8831, "mean_token_accuracy": 0.7461752071976662, "num_tokens": 153751277.0, "step": 4817 }, { "entropy": 0.8332402221858501, "epoch": 0.44328669760380907, "grad_norm": 0.15598562359809875, "learning_rate": 8.522709847578741e-05, "loss": 0.8204, "mean_token_accuracy": 0.7584976851940155, "num_tokens": 153783048.0, "step": 4818 }, { "entropy": 0.809260094538331, "epoch": 0.4433787039752503, "grad_norm": 0.15253928303718567, "learning_rate": 8.522403164964579e-05, "loss": 0.8024, "mean_token_accuracy": 0.7701079435646534, "num_tokens": 153815797.0, "step": 4819 }, { "entropy": 0.7805536277592182, "epoch": 0.4434707103466915, "grad_norm": 0.1857926845550537, "learning_rate": 8.522096482350416e-05, "loss": 0.7872, "mean_token_accuracy": 0.7727089859545231, "num_tokens": 153848337.0, "step": 4820 }, { "entropy": 0.7551811300218105, "epoch": 0.44356271671813274, "grad_norm": 0.1534833163022995, "learning_rate": 8.521789799736254e-05, "loss": 0.7281, "mean_token_accuracy": 0.7849056720733643, "num_tokens": 153880940.0, "step": 4821 }, { "entropy": 0.6951780840754509, "epoch": 0.44365472308957393, "grad_norm": 0.15299995243549347, "learning_rate": 8.521483117122091e-05, "loss": 0.6827, "mean_token_accuracy": 0.802257988601923, "num_tokens": 153913048.0, "step": 4822 }, { "entropy": 0.7750381920486689, "epoch": 0.4437467294610152, "grad_norm": 0.16016678512096405, "learning_rate": 8.521176434507928e-05, "loss": 0.7596, "mean_token_accuracy": 0.7760134898126125, "num_tokens": 153944521.0, "step": 4823 }, { "entropy": 0.795615928247571, "epoch": 0.4438387358324564, "grad_norm": 0.16253800690174103, "learning_rate": 8.520869751893766e-05, "loss": 0.7945, "mean_token_accuracy": 0.7685829550027847, "num_tokens": 153976858.0, "step": 4824 }, { "entropy": 0.8138229921460152, "epoch": 0.4439307422038976, "grad_norm": 0.15738600492477417, "learning_rate": 8.520563069279604e-05, "loss": 0.807, "mean_token_accuracy": 0.7632174752652645, "num_tokens": 154007587.0, "step": 4825 }, { "entropy": 0.8133902065455914, "epoch": 0.44402274857533885, "grad_norm": 0.16464722156524658, "learning_rate": 8.52025638666544e-05, "loss": 0.8393, "mean_token_accuracy": 0.7587261982262135, "num_tokens": 154039716.0, "step": 4826 }, { "entropy": 0.8841881025582552, "epoch": 0.44411475494678004, "grad_norm": 0.1696052849292755, "learning_rate": 8.519949704051277e-05, "loss": 0.8967, "mean_token_accuracy": 0.7445732578635216, "num_tokens": 154071477.0, "step": 4827 }, { "entropy": 0.8757783621549606, "epoch": 0.4442067613182213, "grad_norm": 0.1613132506608963, "learning_rate": 8.519643021437114e-05, "loss": 0.8663, "mean_token_accuracy": 0.7496816366910934, "num_tokens": 154103907.0, "step": 4828 }, { "entropy": 0.816790921613574, "epoch": 0.44429876768966253, "grad_norm": 0.15802700817584991, "learning_rate": 8.519336338822952e-05, "loss": 0.7768, "mean_token_accuracy": 0.7692062184214592, "num_tokens": 154134896.0, "step": 4829 }, { "entropy": 0.8157556150108576, "epoch": 0.4443907740611037, "grad_norm": 0.15295107662677765, "learning_rate": 8.51902965620879e-05, "loss": 0.782, "mean_token_accuracy": 0.7730098143219948, "num_tokens": 154166831.0, "step": 4830 }, { "entropy": 0.7901348639279604, "epoch": 0.44448278043254497, "grad_norm": 0.15862926840782166, "learning_rate": 8.518722973594627e-05, "loss": 0.7817, "mean_token_accuracy": 0.7726348824799061, "num_tokens": 154198524.0, "step": 4831 }, { "entropy": 0.7571733854711056, "epoch": 0.44457478680398616, "grad_norm": 0.15488962829113007, "learning_rate": 8.518416290980464e-05, "loss": 0.7375, "mean_token_accuracy": 0.7862406186759472, "num_tokens": 154230791.0, "step": 4832 }, { "entropy": 0.7881640270352364, "epoch": 0.4446667931754274, "grad_norm": 0.15704327821731567, "learning_rate": 8.518109608366302e-05, "loss": 0.762, "mean_token_accuracy": 0.7832503989338875, "num_tokens": 154263271.0, "step": 4833 }, { "entropy": 0.727181926369667, "epoch": 0.44475879954686864, "grad_norm": 0.15162864327430725, "learning_rate": 8.517802925752139e-05, "loss": 0.7117, "mean_token_accuracy": 0.7925432696938515, "num_tokens": 154295710.0, "step": 4834 }, { "entropy": 0.6952607836574316, "epoch": 0.44485080591830983, "grad_norm": 0.15990214049816132, "learning_rate": 8.517496243137977e-05, "loss": 0.6972, "mean_token_accuracy": 0.7933963239192963, "num_tokens": 154327424.0, "step": 4835 }, { "entropy": 0.7439710441976786, "epoch": 0.4449428122897511, "grad_norm": 0.15159298479557037, "learning_rate": 8.517189560523814e-05, "loss": 0.7388, "mean_token_accuracy": 0.7838140167295933, "num_tokens": 154359332.0, "step": 4836 }, { "entropy": 0.9150807112455368, "epoch": 0.44503481866119227, "grad_norm": 0.16906742751598358, "learning_rate": 8.516882877909652e-05, "loss": 0.9231, "mean_token_accuracy": 0.7363668158650398, "num_tokens": 154391070.0, "step": 4837 }, { "entropy": 0.8270695153623819, "epoch": 0.4451268250326335, "grad_norm": 0.16364797949790955, "learning_rate": 8.516576195295489e-05, "loss": 0.8269, "mean_token_accuracy": 0.7605484835803509, "num_tokens": 154422344.0, "step": 4838 }, { "entropy": 0.6518621183931828, "epoch": 0.44521883140407476, "grad_norm": 0.1542326807975769, "learning_rate": 8.516269512681327e-05, "loss": 0.6457, "mean_token_accuracy": 0.8071621507406235, "num_tokens": 154454316.0, "step": 4839 }, { "entropy": 0.8840353991836309, "epoch": 0.44531083777551594, "grad_norm": 0.16026388108730316, "learning_rate": 8.515962830067164e-05, "loss": 0.8873, "mean_token_accuracy": 0.7446371056139469, "num_tokens": 154485796.0, "step": 4840 }, { "entropy": 0.8468518685549498, "epoch": 0.4454028441469572, "grad_norm": 0.16614042222499847, "learning_rate": 8.515656147453002e-05, "loss": 0.8427, "mean_token_accuracy": 0.7535727135837078, "num_tokens": 154517263.0, "step": 4841 }, { "entropy": 0.7923102956265211, "epoch": 0.4454948505183984, "grad_norm": 0.1602209061384201, "learning_rate": 8.515349464838839e-05, "loss": 0.7865, "mean_token_accuracy": 0.774559061974287, "num_tokens": 154549641.0, "step": 4842 }, { "entropy": 0.8517488501966, "epoch": 0.4455868568898396, "grad_norm": 0.1642685979604721, "learning_rate": 8.515042782224676e-05, "loss": 0.8212, "mean_token_accuracy": 0.766651913523674, "num_tokens": 154581690.0, "step": 4843 }, { "entropy": 0.7104556653648615, "epoch": 0.44567886326128087, "grad_norm": 0.15920601785182953, "learning_rate": 8.514736099610514e-05, "loss": 0.704, "mean_token_accuracy": 0.7950877100229263, "num_tokens": 154614403.0, "step": 4844 }, { "entropy": 0.7918240129947662, "epoch": 0.44577086963272206, "grad_norm": 0.16036047041416168, "learning_rate": 8.514429416996352e-05, "loss": 0.7709, "mean_token_accuracy": 0.7785198614001274, "num_tokens": 154646893.0, "step": 4845 }, { "entropy": 0.6797931101173162, "epoch": 0.4458628760041633, "grad_norm": 0.15266665816307068, "learning_rate": 8.514122734382189e-05, "loss": 0.667, "mean_token_accuracy": 0.8034554272890091, "num_tokens": 154679352.0, "step": 4846 }, { "entropy": 0.8460178039968014, "epoch": 0.4459548823756045, "grad_norm": 0.16952532529830933, "learning_rate": 8.513816051768025e-05, "loss": 0.835, "mean_token_accuracy": 0.7573955804109573, "num_tokens": 154711240.0, "step": 4847 }, { "entropy": 0.8105768207460642, "epoch": 0.44604688874704573, "grad_norm": 0.159785196185112, "learning_rate": 8.513509369153862e-05, "loss": 0.8027, "mean_token_accuracy": 0.7618148438632488, "num_tokens": 154742580.0, "step": 4848 }, { "entropy": 0.7980357129126787, "epoch": 0.446138895118487, "grad_norm": 0.16381607949733734, "learning_rate": 8.5132026865397e-05, "loss": 0.784, "mean_token_accuracy": 0.7703238762915134, "num_tokens": 154774101.0, "step": 4849 }, { "entropy": 0.7102155387401581, "epoch": 0.44623090148992817, "grad_norm": 0.1569165587425232, "learning_rate": 8.512896003925538e-05, "loss": 0.7149, "mean_token_accuracy": 0.7875937260687351, "num_tokens": 154806228.0, "step": 4850 }, { "entropy": 0.8772140108048916, "epoch": 0.4463229078613694, "grad_norm": 0.16110923886299133, "learning_rate": 8.512589321311375e-05, "loss": 0.8694, "mean_token_accuracy": 0.7504971511662006, "num_tokens": 154838071.0, "step": 4851 }, { "entropy": 0.7623647972941399, "epoch": 0.4464149142328106, "grad_norm": 0.15623056888580322, "learning_rate": 8.512282638697213e-05, "loss": 0.7543, "mean_token_accuracy": 0.7804408892989159, "num_tokens": 154870839.0, "step": 4852 }, { "entropy": 0.6420317720621824, "epoch": 0.44650692060425184, "grad_norm": 0.15438906848430634, "learning_rate": 8.51197595608305e-05, "loss": 0.6482, "mean_token_accuracy": 0.8088855482637882, "num_tokens": 154903320.0, "step": 4853 }, { "entropy": 0.7969608418643475, "epoch": 0.4465989269756931, "grad_norm": 0.16013763844966888, "learning_rate": 8.511669273468887e-05, "loss": 0.7997, "mean_token_accuracy": 0.767334595322609, "num_tokens": 154935406.0, "step": 4854 }, { "entropy": 0.7915902137756348, "epoch": 0.4466909333471343, "grad_norm": 0.15210317075252533, "learning_rate": 8.511362590854725e-05, "loss": 0.7655, "mean_token_accuracy": 0.7778829485177994, "num_tokens": 154966247.0, "step": 4855 }, { "entropy": 0.8273196686059237, "epoch": 0.4467829397185755, "grad_norm": 0.15457554161548615, "learning_rate": 8.511055908240563e-05, "loss": 0.8238, "mean_token_accuracy": 0.7606394551694393, "num_tokens": 154998260.0, "step": 4856 }, { "entropy": 0.7849187050014734, "epoch": 0.4468749460900167, "grad_norm": 0.16263355314731598, "learning_rate": 8.5107492256264e-05, "loss": 0.7869, "mean_token_accuracy": 0.7740636132657528, "num_tokens": 155030406.0, "step": 4857 }, { "entropy": 0.8042354322969913, "epoch": 0.44696695246145796, "grad_norm": 0.157380148768425, "learning_rate": 8.510442543012237e-05, "loss": 0.7879, "mean_token_accuracy": 0.7694254331290722, "num_tokens": 155062102.0, "step": 4858 }, { "entropy": 0.8158824071288109, "epoch": 0.4470589588328992, "grad_norm": 0.1568228155374527, "learning_rate": 8.510135860398074e-05, "loss": 0.7933, "mean_token_accuracy": 0.7703485377132893, "num_tokens": 155093892.0, "step": 4859 }, { "entropy": 0.6760909035801888, "epoch": 0.4471509652043404, "grad_norm": 0.14594106376171112, "learning_rate": 8.509829177783912e-05, "loss": 0.6462, "mean_token_accuracy": 0.8050715439021587, "num_tokens": 155125710.0, "step": 4860 }, { "entropy": 0.734922943636775, "epoch": 0.44724297157578163, "grad_norm": 0.15435729920864105, "learning_rate": 8.50952249516975e-05, "loss": 0.7241, "mean_token_accuracy": 0.789524506777525, "num_tokens": 155158402.0, "step": 4861 }, { "entropy": 0.7771373670548201, "epoch": 0.4473349779472228, "grad_norm": 0.14880378544330597, "learning_rate": 8.509215812555587e-05, "loss": 0.7575, "mean_token_accuracy": 0.778119407594204, "num_tokens": 155190768.0, "step": 4862 }, { "entropy": 0.85196996293962, "epoch": 0.44742698431866407, "grad_norm": 0.16494189202785492, "learning_rate": 8.508909129941423e-05, "loss": 0.8478, "mean_token_accuracy": 0.7573219873011112, "num_tokens": 155222655.0, "step": 4863 }, { "entropy": 0.7911323420703411, "epoch": 0.4475189906901053, "grad_norm": 0.15604722499847412, "learning_rate": 8.508602447327262e-05, "loss": 0.7772, "mean_token_accuracy": 0.7652524672448635, "num_tokens": 155254111.0, "step": 4864 }, { "entropy": 0.8664130792021751, "epoch": 0.4476109970615465, "grad_norm": 0.1673228144645691, "learning_rate": 8.508295764713098e-05, "loss": 0.8747, "mean_token_accuracy": 0.7477344051003456, "num_tokens": 155285715.0, "step": 4865 }, { "entropy": 0.8173853773623705, "epoch": 0.44770300343298775, "grad_norm": 0.15645544230937958, "learning_rate": 8.507989082098937e-05, "loss": 0.8097, "mean_token_accuracy": 0.7669736780226231, "num_tokens": 155318381.0, "step": 4866 }, { "entropy": 0.6629424151033163, "epoch": 0.44779500980442893, "grad_norm": 0.1579284518957138, "learning_rate": 8.507682399484773e-05, "loss": 0.6746, "mean_token_accuracy": 0.8061664327979088, "num_tokens": 155350849.0, "step": 4867 }, { "entropy": 0.7657013032585382, "epoch": 0.4478870161758702, "grad_norm": 0.15650005638599396, "learning_rate": 8.507375716870611e-05, "loss": 0.7526, "mean_token_accuracy": 0.7816522754728794, "num_tokens": 155383520.0, "step": 4868 }, { "entropy": 0.7669861931353807, "epoch": 0.4479790225473114, "grad_norm": 0.1619252860546112, "learning_rate": 8.507069034256448e-05, "loss": 0.7777, "mean_token_accuracy": 0.7737644501030445, "num_tokens": 155415789.0, "step": 4869 }, { "entropy": 0.7797046285122633, "epoch": 0.4480710289187526, "grad_norm": 0.16412998735904694, "learning_rate": 8.506762351642285e-05, "loss": 0.8036, "mean_token_accuracy": 0.7646700106561184, "num_tokens": 155447362.0, "step": 4870 }, { "entropy": 0.7928271759301424, "epoch": 0.44816303529019386, "grad_norm": 0.15356405079364777, "learning_rate": 8.506455669028123e-05, "loss": 0.7895, "mean_token_accuracy": 0.7720334939658642, "num_tokens": 155479318.0, "step": 4871 }, { "entropy": 0.7455516420304775, "epoch": 0.44825504166163505, "grad_norm": 0.15991194546222687, "learning_rate": 8.506148986413961e-05, "loss": 0.7499, "mean_token_accuracy": 0.7798930108547211, "num_tokens": 155510991.0, "step": 4872 }, { "entropy": 0.768953999504447, "epoch": 0.4483470480330763, "grad_norm": 0.1549295037984848, "learning_rate": 8.505842303799798e-05, "loss": 0.7289, "mean_token_accuracy": 0.7821979783475399, "num_tokens": 155543064.0, "step": 4873 }, { "entropy": 0.8156191986054182, "epoch": 0.44843905440451753, "grad_norm": 0.15766188502311707, "learning_rate": 8.505535621185635e-05, "loss": 0.7971, "mean_token_accuracy": 0.7667980864644051, "num_tokens": 155575001.0, "step": 4874 }, { "entropy": 0.826321717351675, "epoch": 0.4485310607759587, "grad_norm": 0.15598444640636444, "learning_rate": 8.505228938571472e-05, "loss": 0.8044, "mean_token_accuracy": 0.7614794299006462, "num_tokens": 155606651.0, "step": 4875 }, { "entropy": 0.7541118608787656, "epoch": 0.44862306714739997, "grad_norm": 0.15436437726020813, "learning_rate": 8.504922255957311e-05, "loss": 0.7309, "mean_token_accuracy": 0.7829996272921562, "num_tokens": 155638130.0, "step": 4876 }, { "entropy": 0.7098454423248768, "epoch": 0.44871507351884116, "grad_norm": 0.14475159347057343, "learning_rate": 8.504615573343148e-05, "loss": 0.6946, "mean_token_accuracy": 0.7966405861079693, "num_tokens": 155670699.0, "step": 4877 }, { "entropy": 0.7488485872745514, "epoch": 0.4488070798902824, "grad_norm": 0.1481117159128189, "learning_rate": 8.504308890728985e-05, "loss": 0.73, "mean_token_accuracy": 0.7859379202127457, "num_tokens": 155702447.0, "step": 4878 }, { "entropy": 0.8189300186932087, "epoch": 0.44889908626172365, "grad_norm": 0.17654047906398773, "learning_rate": 8.504002208114822e-05, "loss": 0.8268, "mean_token_accuracy": 0.7585215643048286, "num_tokens": 155734211.0, "step": 4879 }, { "entropy": 0.7314107194542885, "epoch": 0.44899109263316483, "grad_norm": 0.16159935295581818, "learning_rate": 8.50369552550066e-05, "loss": 0.744, "mean_token_accuracy": 0.7830612286925316, "num_tokens": 155765744.0, "step": 4880 }, { "entropy": 0.7607586421072483, "epoch": 0.4490830990046061, "grad_norm": 0.15782220661640167, "learning_rate": 8.503388842886498e-05, "loss": 0.7648, "mean_token_accuracy": 0.7827454470098019, "num_tokens": 155797945.0, "step": 4881 }, { "entropy": 0.7367046196013689, "epoch": 0.44917510537604727, "grad_norm": 0.17219842970371246, "learning_rate": 8.503082160272335e-05, "loss": 0.7488, "mean_token_accuracy": 0.7837351784110069, "num_tokens": 155830202.0, "step": 4882 }, { "entropy": 0.7623578514903784, "epoch": 0.4492671117474885, "grad_norm": 0.15690980851650238, "learning_rate": 8.502775477658173e-05, "loss": 0.7591, "mean_token_accuracy": 0.7771518342196941, "num_tokens": 155862472.0, "step": 4883 }, { "entropy": 0.92664560303092, "epoch": 0.44935911811892976, "grad_norm": 0.16047240793704987, "learning_rate": 8.50246879504401e-05, "loss": 0.8846, "mean_token_accuracy": 0.7454448901116848, "num_tokens": 155893924.0, "step": 4884 }, { "entropy": 0.8647530004382133, "epoch": 0.44945112449037095, "grad_norm": 0.16004012525081635, "learning_rate": 8.502162112429846e-05, "loss": 0.8452, "mean_token_accuracy": 0.7586942873895168, "num_tokens": 155926008.0, "step": 4885 }, { "entropy": 0.752610856667161, "epoch": 0.4495431308618122, "grad_norm": 0.16145627200603485, "learning_rate": 8.501855429815684e-05, "loss": 0.7319, "mean_token_accuracy": 0.7872746884822845, "num_tokens": 155957831.0, "step": 4886 }, { "entropy": 0.6804722361266613, "epoch": 0.4496351372332534, "grad_norm": 0.14870552718639374, "learning_rate": 8.501548747201523e-05, "loss": 0.6637, "mean_token_accuracy": 0.8022947162389755, "num_tokens": 155990032.0, "step": 4887 }, { "entropy": 0.8845971245318651, "epoch": 0.4497271436046946, "grad_norm": 0.15914149582386017, "learning_rate": 8.50124206458736e-05, "loss": 0.8804, "mean_token_accuracy": 0.7457185573875904, "num_tokens": 156021362.0, "step": 4888 }, { "entropy": 0.7859588526189327, "epoch": 0.44981914997613587, "grad_norm": 0.160914346575737, "learning_rate": 8.500935381973196e-05, "loss": 0.7779, "mean_token_accuracy": 0.7754861675202847, "num_tokens": 156052013.0, "step": 4889 }, { "entropy": 0.7296443898230791, "epoch": 0.44991115634757706, "grad_norm": 0.15243567526340485, "learning_rate": 8.500628699359033e-05, "loss": 0.7257, "mean_token_accuracy": 0.7858364321291447, "num_tokens": 156084333.0, "step": 4890 }, { "entropy": 0.7555712107568979, "epoch": 0.4500031627190183, "grad_norm": 0.15457119047641754, "learning_rate": 8.500322016744871e-05, "loss": 0.7334, "mean_token_accuracy": 0.7797279097139835, "num_tokens": 156116145.0, "step": 4891 }, { "entropy": 0.7276248000562191, "epoch": 0.4500951690904595, "grad_norm": 0.16081400215625763, "learning_rate": 8.500015334130709e-05, "loss": 0.7229, "mean_token_accuracy": 0.7863832525908947, "num_tokens": 156147712.0, "step": 4892 }, { "entropy": 0.7676946260035038, "epoch": 0.45018717546190073, "grad_norm": 0.16093038022518158, "learning_rate": 8.499708651516546e-05, "loss": 0.7731, "mean_token_accuracy": 0.7737197428941727, "num_tokens": 156180157.0, "step": 4893 }, { "entropy": 0.789346257224679, "epoch": 0.450279181833342, "grad_norm": 0.15983736515045166, "learning_rate": 8.499401968902383e-05, "loss": 0.8166, "mean_token_accuracy": 0.7641306221485138, "num_tokens": 156212634.0, "step": 4894 }, { "entropy": 0.8895988930016756, "epoch": 0.45037118820478317, "grad_norm": 0.16520899534225464, "learning_rate": 8.499095286288221e-05, "loss": 0.8902, "mean_token_accuracy": 0.746096383780241, "num_tokens": 156244567.0, "step": 4895 }, { "entropy": 0.8156241234391928, "epoch": 0.4504631945762244, "grad_norm": 0.16546542942523956, "learning_rate": 8.498788603674058e-05, "loss": 0.8327, "mean_token_accuracy": 0.7573663406074047, "num_tokens": 156276945.0, "step": 4896 }, { "entropy": 0.8687437474727631, "epoch": 0.4505552009476656, "grad_norm": 0.17036612331867218, "learning_rate": 8.498481921059896e-05, "loss": 0.873, "mean_token_accuracy": 0.7489736638963223, "num_tokens": 156307206.0, "step": 4897 }, { "entropy": 0.7693162597715855, "epoch": 0.45064720731910685, "grad_norm": 0.16129259765148163, "learning_rate": 8.498175238445733e-05, "loss": 0.7652, "mean_token_accuracy": 0.7774639651179314, "num_tokens": 156338444.0, "step": 4898 }, { "entropy": 0.8498350884765387, "epoch": 0.4507392136905481, "grad_norm": 0.1626051813364029, "learning_rate": 8.497868555831571e-05, "loss": 0.8365, "mean_token_accuracy": 0.7545686773955822, "num_tokens": 156370474.0, "step": 4899 }, { "entropy": 0.8449336923658848, "epoch": 0.4508312200619893, "grad_norm": 0.1699608862400055, "learning_rate": 8.497561873217408e-05, "loss": 0.842, "mean_token_accuracy": 0.7533034607768059, "num_tokens": 156402663.0, "step": 4900 }, { "entropy": 0.8696624413132668, "epoch": 0.4509232264334305, "grad_norm": 0.1711505949497223, "learning_rate": 8.497255190603244e-05, "loss": 0.8769, "mean_token_accuracy": 0.7507443390786648, "num_tokens": 156434304.0, "step": 4901 }, { "entropy": 0.9508023001253605, "epoch": 0.4510152328048717, "grad_norm": 0.16503740847110748, "learning_rate": 8.496948507989083e-05, "loss": 0.9523, "mean_token_accuracy": 0.7314354367554188, "num_tokens": 156466725.0, "step": 4902 }, { "entropy": 0.7872964404523373, "epoch": 0.45110723917631296, "grad_norm": 0.15788625180721283, "learning_rate": 8.496641825374921e-05, "loss": 0.7659, "mean_token_accuracy": 0.7734062895178795, "num_tokens": 156498522.0, "step": 4903 }, { "entropy": 0.7724616602063179, "epoch": 0.4511992455477542, "grad_norm": 0.14386731386184692, "learning_rate": 8.496335142760757e-05, "loss": 0.7383, "mean_token_accuracy": 0.7847315073013306, "num_tokens": 156531040.0, "step": 4904 }, { "entropy": 0.891039103269577, "epoch": 0.4512912519191954, "grad_norm": 0.2051355242729187, "learning_rate": 8.496028460146594e-05, "loss": 0.8836, "mean_token_accuracy": 0.7485418803989887, "num_tokens": 156563030.0, "step": 4905 }, { "entropy": 0.7822888679802418, "epoch": 0.45138325829063664, "grad_norm": 0.1542302668094635, "learning_rate": 8.495721777532431e-05, "loss": 0.7507, "mean_token_accuracy": 0.7799147479236126, "num_tokens": 156594711.0, "step": 4906 }, { "entropy": 0.7839927226305008, "epoch": 0.4514752646620778, "grad_norm": 0.15807369351387024, "learning_rate": 8.495415094918269e-05, "loss": 0.778, "mean_token_accuracy": 0.7767650298774242, "num_tokens": 156626654.0, "step": 4907 }, { "entropy": 0.6946792993694544, "epoch": 0.45156727103351907, "grad_norm": 0.1486385017633438, "learning_rate": 8.495108412304107e-05, "loss": 0.6883, "mean_token_accuracy": 0.794497549533844, "num_tokens": 156658899.0, "step": 4908 }, { "entropy": 0.8562528528273106, "epoch": 0.4516592774049603, "grad_norm": 0.15857680141925812, "learning_rate": 8.494801729689944e-05, "loss": 0.8571, "mean_token_accuracy": 0.7496035546064377, "num_tokens": 156691397.0, "step": 4909 }, { "entropy": 0.8166457675397396, "epoch": 0.4517512837764015, "grad_norm": 0.15739218890666962, "learning_rate": 8.494495047075781e-05, "loss": 0.8029, "mean_token_accuracy": 0.765981949865818, "num_tokens": 156723559.0, "step": 4910 }, { "entropy": 0.8153786193579435, "epoch": 0.45184329014784275, "grad_norm": 0.15839733183383942, "learning_rate": 8.494188364461619e-05, "loss": 0.811, "mean_token_accuracy": 0.7640904486179352, "num_tokens": 156755605.0, "step": 4911 }, { "entropy": 0.7247861959040165, "epoch": 0.45193529651928394, "grad_norm": 0.15151222050189972, "learning_rate": 8.493881681847456e-05, "loss": 0.7207, "mean_token_accuracy": 0.7882841192185879, "num_tokens": 156788330.0, "step": 4912 }, { "entropy": 0.7544763088226318, "epoch": 0.4520273028907252, "grad_norm": 0.15322192013263702, "learning_rate": 8.493574999233294e-05, "loss": 0.7357, "mean_token_accuracy": 0.783578522503376, "num_tokens": 156820840.0, "step": 4913 }, { "entropy": 0.7745220810174942, "epoch": 0.4521193092621664, "grad_norm": 0.15180513262748718, "learning_rate": 8.493268316619132e-05, "loss": 0.767, "mean_token_accuracy": 0.7723800577223301, "num_tokens": 156852200.0, "step": 4914 }, { "entropy": 0.765038637444377, "epoch": 0.4522113156336076, "grad_norm": 0.15860500931739807, "learning_rate": 8.492961634004969e-05, "loss": 0.7386, "mean_token_accuracy": 0.7801927849650383, "num_tokens": 156883512.0, "step": 4915 }, { "entropy": 0.7761003319174051, "epoch": 0.45230332200504886, "grad_norm": 0.14756500720977783, "learning_rate": 8.492654951390806e-05, "loss": 0.7587, "mean_token_accuracy": 0.7772273868322372, "num_tokens": 156915263.0, "step": 4916 }, { "entropy": 0.8133154064416885, "epoch": 0.45239532837649005, "grad_norm": 0.15990076959133148, "learning_rate": 8.492348268776642e-05, "loss": 0.7945, "mean_token_accuracy": 0.7673600055277348, "num_tokens": 156947602.0, "step": 4917 }, { "entropy": 0.8985932637006044, "epoch": 0.4524873347479313, "grad_norm": 0.16162239015102386, "learning_rate": 8.492041586162482e-05, "loss": 0.9105, "mean_token_accuracy": 0.7414383105933666, "num_tokens": 156979652.0, "step": 4918 }, { "entropy": 0.7049762401729822, "epoch": 0.45257934111937254, "grad_norm": 0.16227681934833527, "learning_rate": 8.491734903548319e-05, "loss": 0.6909, "mean_token_accuracy": 0.7934020459651947, "num_tokens": 157011206.0, "step": 4919 }, { "entropy": 0.8394502084702253, "epoch": 0.4526713474908137, "grad_norm": 0.16198977828025818, "learning_rate": 8.491428220934156e-05, "loss": 0.8466, "mean_token_accuracy": 0.7575390934944153, "num_tokens": 157042991.0, "step": 4920 }, { "entropy": 0.9357144460082054, "epoch": 0.45276335386225497, "grad_norm": 0.16070564091205597, "learning_rate": 8.491121538319992e-05, "loss": 0.9213, "mean_token_accuracy": 0.7340216040611267, "num_tokens": 157075376.0, "step": 4921 }, { "entropy": 0.7556687481701374, "epoch": 0.45285536023369616, "grad_norm": 0.15993590652942657, "learning_rate": 8.49081485570583e-05, "loss": 0.7425, "mean_token_accuracy": 0.7772657461464405, "num_tokens": 157107375.0, "step": 4922 }, { "entropy": 0.857011865824461, "epoch": 0.4529473666051374, "grad_norm": 0.15581227838993073, "learning_rate": 8.490508173091669e-05, "loss": 0.8346, "mean_token_accuracy": 0.7667944356799126, "num_tokens": 157140044.0, "step": 4923 }, { "entropy": 0.81588539108634, "epoch": 0.45303937297657865, "grad_norm": 0.1648908108472824, "learning_rate": 8.490201490477505e-05, "loss": 0.7966, "mean_token_accuracy": 0.7708098143339157, "num_tokens": 157172099.0, "step": 4924 }, { "entropy": 0.8084226064383984, "epoch": 0.45313137934801984, "grad_norm": 0.1569342166185379, "learning_rate": 8.489894807863342e-05, "loss": 0.7977, "mean_token_accuracy": 0.7695537395775318, "num_tokens": 157204612.0, "step": 4925 }, { "entropy": 0.6781633701175451, "epoch": 0.4532233857194611, "grad_norm": 0.1585545688867569, "learning_rate": 8.48958812524918e-05, "loss": 0.6561, "mean_token_accuracy": 0.8033174946904182, "num_tokens": 157236902.0, "step": 4926 }, { "entropy": 0.8724102936685085, "epoch": 0.45331539209090227, "grad_norm": 0.17343389987945557, "learning_rate": 8.489281442635017e-05, "loss": 0.8982, "mean_token_accuracy": 0.7457942105829716, "num_tokens": 157269432.0, "step": 4927 }, { "entropy": 0.7988063152879477, "epoch": 0.4534073984623435, "grad_norm": 0.16237451136112213, "learning_rate": 8.488974760020855e-05, "loss": 0.8004, "mean_token_accuracy": 0.7651961520314217, "num_tokens": 157300900.0, "step": 4928 }, { "entropy": 0.7917265444993973, "epoch": 0.45349940483378476, "grad_norm": 0.16913743317127228, "learning_rate": 8.488668077406692e-05, "loss": 0.7945, "mean_token_accuracy": 0.76840515807271, "num_tokens": 157331596.0, "step": 4929 }, { "entropy": 0.7186240274459124, "epoch": 0.45359141120522595, "grad_norm": 0.1496771275997162, "learning_rate": 8.48836139479253e-05, "loss": 0.7044, "mean_token_accuracy": 0.7885562777519226, "num_tokens": 157363218.0, "step": 4930 }, { "entropy": 0.8401139415800571, "epoch": 0.4536834175766672, "grad_norm": 0.1526770293712616, "learning_rate": 8.488054712178367e-05, "loss": 0.8289, "mean_token_accuracy": 0.7558215670287609, "num_tokens": 157395303.0, "step": 4931 }, { "entropy": 0.919913537800312, "epoch": 0.4537754239481084, "grad_norm": 0.16504880785942078, "learning_rate": 8.487748029564204e-05, "loss": 0.8916, "mean_token_accuracy": 0.7452968135476112, "num_tokens": 157427168.0, "step": 4932 }, { "entropy": 0.8632475808262825, "epoch": 0.4538674303195496, "grad_norm": 0.16186662018299103, "learning_rate": 8.487441346950042e-05, "loss": 0.8633, "mean_token_accuracy": 0.7493872158229351, "num_tokens": 157458011.0, "step": 4933 }, { "entropy": 0.8022543750703335, "epoch": 0.45395943669099087, "grad_norm": 0.15886840224266052, "learning_rate": 8.48713466433588e-05, "loss": 0.7832, "mean_token_accuracy": 0.773474209010601, "num_tokens": 157490270.0, "step": 4934 }, { "entropy": 0.8227585628628731, "epoch": 0.45405144306243206, "grad_norm": 0.16079047322273254, "learning_rate": 8.486827981721717e-05, "loss": 0.8323, "mean_token_accuracy": 0.7558220289647579, "num_tokens": 157522157.0, "step": 4935 }, { "entropy": 0.7932940684258938, "epoch": 0.4541434494338733, "grad_norm": 0.15648671984672546, "learning_rate": 8.486521299107554e-05, "loss": 0.7824, "mean_token_accuracy": 0.7677512466907501, "num_tokens": 157553709.0, "step": 4936 }, { "entropy": 0.7609754707664251, "epoch": 0.4542354558053145, "grad_norm": 0.1577099710702896, "learning_rate": 8.48621461649339e-05, "loss": 0.7539, "mean_token_accuracy": 0.7739433757960796, "num_tokens": 157585326.0, "step": 4937 }, { "entropy": 0.8143345508724451, "epoch": 0.45432746217675574, "grad_norm": 0.15805917978286743, "learning_rate": 8.485907933879229e-05, "loss": 0.7931, "mean_token_accuracy": 0.7668934762477875, "num_tokens": 157617489.0, "step": 4938 }, { "entropy": 0.828116474673152, "epoch": 0.454419468548197, "grad_norm": 0.1620628386735916, "learning_rate": 8.485601251265067e-05, "loss": 0.8083, "mean_token_accuracy": 0.7650489546358585, "num_tokens": 157649673.0, "step": 4939 }, { "entropy": 0.7476275488734245, "epoch": 0.45451147491963817, "grad_norm": 0.15749111771583557, "learning_rate": 8.485294568650903e-05, "loss": 0.7378, "mean_token_accuracy": 0.7832685820758343, "num_tokens": 157681556.0, "step": 4940 }, { "entropy": 0.7288476768881083, "epoch": 0.4546034812910794, "grad_norm": 0.1589738130569458, "learning_rate": 8.48498788603674e-05, "loss": 0.7284, "mean_token_accuracy": 0.7848289757966995, "num_tokens": 157712533.0, "step": 4941 }, { "entropy": 0.7447115816175938, "epoch": 0.4546954876625206, "grad_norm": 0.15665730834007263, "learning_rate": 8.484681203422578e-05, "loss": 0.7196, "mean_token_accuracy": 0.785344984382391, "num_tokens": 157744275.0, "step": 4942 }, { "entropy": 0.7620610725134611, "epoch": 0.45478749403396185, "grad_norm": 0.1551925092935562, "learning_rate": 8.484374520808415e-05, "loss": 0.7434, "mean_token_accuracy": 0.7841373756527901, "num_tokens": 157776561.0, "step": 4943 }, { "entropy": 0.7629343550652266, "epoch": 0.4548795004054031, "grad_norm": 0.14882449805736542, "learning_rate": 8.484067838194253e-05, "loss": 0.7461, "mean_token_accuracy": 0.7836392857134342, "num_tokens": 157808841.0, "step": 4944 }, { "entropy": 0.9237363375723362, "epoch": 0.4549715067768443, "grad_norm": 0.1665066033601761, "learning_rate": 8.483761155580091e-05, "loss": 0.9194, "mean_token_accuracy": 0.736446987837553, "num_tokens": 157840592.0, "step": 4945 }, { "entropy": 0.7243937905877829, "epoch": 0.4550635131482855, "grad_norm": 0.15970967710018158, "learning_rate": 8.483454472965928e-05, "loss": 0.732, "mean_token_accuracy": 0.7815693691372871, "num_tokens": 157872498.0, "step": 4946 }, { "entropy": 0.8355274926871061, "epoch": 0.4551555195197267, "grad_norm": 0.1705227494239807, "learning_rate": 8.483147790351765e-05, "loss": 0.8671, "mean_token_accuracy": 0.7472508028149605, "num_tokens": 157904204.0, "step": 4947 }, { "entropy": 0.8463669633492827, "epoch": 0.45524752589116796, "grad_norm": 0.1645912528038025, "learning_rate": 8.482841107737602e-05, "loss": 0.8615, "mean_token_accuracy": 0.7527628317475319, "num_tokens": 157935625.0, "step": 4948 }, { "entropy": 0.8433198444545269, "epoch": 0.4553395322626092, "grad_norm": 0.1755211055278778, "learning_rate": 8.48253442512344e-05, "loss": 0.8659, "mean_token_accuracy": 0.7511949837207794, "num_tokens": 157966933.0, "step": 4949 }, { "entropy": 0.7826541885733604, "epoch": 0.4554315386340504, "grad_norm": 0.15580059587955475, "learning_rate": 8.482227742509278e-05, "loss": 0.7854, "mean_token_accuracy": 0.7694987431168556, "num_tokens": 157999464.0, "step": 4950 }, { "entropy": 0.7577575203031301, "epoch": 0.45552354500549164, "grad_norm": 0.15584686398506165, "learning_rate": 8.481921059895115e-05, "loss": 0.7341, "mean_token_accuracy": 0.7861675657331944, "num_tokens": 158030858.0, "step": 4951 }, { "entropy": 0.7469234243035316, "epoch": 0.4556155513769328, "grad_norm": 0.15596377849578857, "learning_rate": 8.481614377280952e-05, "loss": 0.7185, "mean_token_accuracy": 0.7863660864531994, "num_tokens": 158063315.0, "step": 4952 }, { "entropy": 0.7341910935938358, "epoch": 0.45570755774837407, "grad_norm": 0.15007731318473816, "learning_rate": 8.48130769466679e-05, "loss": 0.7129, "mean_token_accuracy": 0.7906660251319408, "num_tokens": 158095592.0, "step": 4953 }, { "entropy": 0.8013153411448002, "epoch": 0.4557995641198153, "grad_norm": 0.1604943573474884, "learning_rate": 8.481001012052627e-05, "loss": 0.7918, "mean_token_accuracy": 0.77103116735816, "num_tokens": 158127618.0, "step": 4954 }, { "entropy": 0.8691930156201124, "epoch": 0.4558915704912565, "grad_norm": 0.17321860790252686, "learning_rate": 8.480694329438465e-05, "loss": 0.8493, "mean_token_accuracy": 0.7542638294398785, "num_tokens": 158158308.0, "step": 4955 }, { "entropy": 0.7408685758709908, "epoch": 0.45598357686269775, "grad_norm": 0.15224312245845795, "learning_rate": 8.480387646824302e-05, "loss": 0.7296, "mean_token_accuracy": 0.7859476432204247, "num_tokens": 158190556.0, "step": 4956 }, { "entropy": 0.8845944777131081, "epoch": 0.45607558323413894, "grad_norm": 0.16155152022838593, "learning_rate": 8.48008096421014e-05, "loss": 0.8776, "mean_token_accuracy": 0.7456442676484585, "num_tokens": 158222838.0, "step": 4957 }, { "entropy": 0.9239476937800646, "epoch": 0.4561675896055802, "grad_norm": 0.17286419868469238, "learning_rate": 8.479774281595976e-05, "loss": 0.9262, "mean_token_accuracy": 0.7390604875981808, "num_tokens": 158254179.0, "step": 4958 }, { "entropy": 0.7662383355200291, "epoch": 0.4562595959770214, "grad_norm": 0.15579643845558167, "learning_rate": 8.479467598981815e-05, "loss": 0.7465, "mean_token_accuracy": 0.7801336161792278, "num_tokens": 158286237.0, "step": 4959 }, { "entropy": 0.7533433344215155, "epoch": 0.4563516023484626, "grad_norm": 0.1531396359205246, "learning_rate": 8.479160916367651e-05, "loss": 0.744, "mean_token_accuracy": 0.7793834656476974, "num_tokens": 158318265.0, "step": 4960 }, { "entropy": 0.8610907755792141, "epoch": 0.45644360871990386, "grad_norm": 0.1623634546995163, "learning_rate": 8.47885423375349e-05, "loss": 0.8477, "mean_token_accuracy": 0.7592988982796669, "num_tokens": 158350070.0, "step": 4961 }, { "entropy": 0.7440295740962029, "epoch": 0.45653561509134505, "grad_norm": 0.16241194307804108, "learning_rate": 8.478547551139326e-05, "loss": 0.7538, "mean_token_accuracy": 0.7789885513484478, "num_tokens": 158382658.0, "step": 4962 }, { "entropy": 0.7356470432132483, "epoch": 0.4566276214627863, "grad_norm": 0.14906199276447296, "learning_rate": 8.478240868525163e-05, "loss": 0.7223, "mean_token_accuracy": 0.7856465540826321, "num_tokens": 158414941.0, "step": 4963 }, { "entropy": 0.8217952605336905, "epoch": 0.45671962783422754, "grad_norm": 0.16376474499702454, "learning_rate": 8.477934185911001e-05, "loss": 0.8176, "mean_token_accuracy": 0.7633491903543472, "num_tokens": 158447069.0, "step": 4964 }, { "entropy": 0.6384461484849453, "epoch": 0.4568116342056687, "grad_norm": 0.170317605137825, "learning_rate": 8.47762750329684e-05, "loss": 0.6509, "mean_token_accuracy": 0.8092977963387966, "num_tokens": 158478818.0, "step": 4965 }, { "entropy": 0.7379900142550468, "epoch": 0.45690364057710997, "grad_norm": 0.16735272109508514, "learning_rate": 8.477320820682676e-05, "loss": 0.7609, "mean_token_accuracy": 0.7757553718984127, "num_tokens": 158510369.0, "step": 4966 }, { "entropy": 0.8146024905145168, "epoch": 0.45699564694855116, "grad_norm": 0.16836252808570862, "learning_rate": 8.477014138068513e-05, "loss": 0.843, "mean_token_accuracy": 0.7607084661722183, "num_tokens": 158542553.0, "step": 4967 }, { "entropy": 0.751719418913126, "epoch": 0.4570876533199924, "grad_norm": 0.15320123732089996, "learning_rate": 8.47670745545435e-05, "loss": 0.7313, "mean_token_accuracy": 0.7825224474072456, "num_tokens": 158574316.0, "step": 4968 }, { "entropy": 0.7685645092278719, "epoch": 0.45717965969143365, "grad_norm": 0.1591079831123352, "learning_rate": 8.476400772840188e-05, "loss": 0.7466, "mean_token_accuracy": 0.7814823389053345, "num_tokens": 158606691.0, "step": 4969 }, { "entropy": 0.8197613880038261, "epoch": 0.45727166606287484, "grad_norm": 0.1517079919576645, "learning_rate": 8.476094090226026e-05, "loss": 0.8112, "mean_token_accuracy": 0.7700914926826954, "num_tokens": 158638886.0, "step": 4970 }, { "entropy": 0.8741231579333544, "epoch": 0.4573636724343161, "grad_norm": 0.1566043645143509, "learning_rate": 8.475787407611863e-05, "loss": 0.8469, "mean_token_accuracy": 0.7522480264306068, "num_tokens": 158671062.0, "step": 4971 }, { "entropy": 0.749415997415781, "epoch": 0.4574556788057573, "grad_norm": 0.14971202611923218, "learning_rate": 8.4754807249977e-05, "loss": 0.7097, "mean_token_accuracy": 0.7921625673770905, "num_tokens": 158702437.0, "step": 4972 }, { "entropy": 0.6980646755546331, "epoch": 0.4575476851771985, "grad_norm": 0.1478198766708374, "learning_rate": 8.475174042383538e-05, "loss": 0.6832, "mean_token_accuracy": 0.7955244742333889, "num_tokens": 158734246.0, "step": 4973 }, { "entropy": 0.9279488697648048, "epoch": 0.45763969154863976, "grad_norm": 0.16335900127887726, "learning_rate": 8.474867359769375e-05, "loss": 0.9242, "mean_token_accuracy": 0.7333844117820263, "num_tokens": 158766992.0, "step": 4974 }, { "entropy": 0.886914137750864, "epoch": 0.45773169792008095, "grad_norm": 0.1619744449853897, "learning_rate": 8.474560677155213e-05, "loss": 0.8783, "mean_token_accuracy": 0.7513157315552235, "num_tokens": 158799306.0, "step": 4975 }, { "entropy": 0.835733599960804, "epoch": 0.4578237042915222, "grad_norm": 0.16880559921264648, "learning_rate": 8.474253994541051e-05, "loss": 0.8349, "mean_token_accuracy": 0.7581713758409023, "num_tokens": 158830840.0, "step": 4976 }, { "entropy": 0.8531117979437113, "epoch": 0.45791571066296344, "grad_norm": 0.16628335416316986, "learning_rate": 8.473947311926888e-05, "loss": 0.86, "mean_token_accuracy": 0.7552536092698574, "num_tokens": 158862566.0, "step": 4977 }, { "entropy": 0.7892355211079121, "epoch": 0.4580077170344046, "grad_norm": 0.16317719221115112, "learning_rate": 8.473640629312724e-05, "loss": 0.7845, "mean_token_accuracy": 0.7753724902868271, "num_tokens": 158895334.0, "step": 4978 }, { "entropy": 0.7021135296672583, "epoch": 0.45809972340584587, "grad_norm": 0.15323224663734436, "learning_rate": 8.473333946698561e-05, "loss": 0.7054, "mean_token_accuracy": 0.799522053450346, "num_tokens": 158927561.0, "step": 4979 }, { "entropy": 0.8838718049228191, "epoch": 0.45819172977728706, "grad_norm": 0.15914617478847504, "learning_rate": 8.4730272640844e-05, "loss": 0.8826, "mean_token_accuracy": 0.7447794526815414, "num_tokens": 158959523.0, "step": 4980 }, { "entropy": 0.8052560426294804, "epoch": 0.4582837361487283, "grad_norm": 0.15678222477436066, "learning_rate": 8.472720581470238e-05, "loss": 0.7692, "mean_token_accuracy": 0.7698153108358383, "num_tokens": 158991204.0, "step": 4981 }, { "entropy": 0.7459018230438232, "epoch": 0.45837574252016955, "grad_norm": 0.15334481000900269, "learning_rate": 8.472413898856074e-05, "loss": 0.7204, "mean_token_accuracy": 0.7883375659584999, "num_tokens": 159023475.0, "step": 4982 }, { "entropy": 0.8280870951712132, "epoch": 0.45846774889161074, "grad_norm": 0.1710437536239624, "learning_rate": 8.472107216241911e-05, "loss": 0.8419, "mean_token_accuracy": 0.7563602700829506, "num_tokens": 159054955.0, "step": 4983 }, { "entropy": 0.7946829423308372, "epoch": 0.458559755263052, "grad_norm": 0.1655464470386505, "learning_rate": 8.471800533627749e-05, "loss": 0.8104, "mean_token_accuracy": 0.7644962333142757, "num_tokens": 159086963.0, "step": 4984 }, { "entropy": 0.9218880273401737, "epoch": 0.45865176163449317, "grad_norm": 0.16637694835662842, "learning_rate": 8.471493851013586e-05, "loss": 0.9254, "mean_token_accuracy": 0.7383156679570675, "num_tokens": 159118461.0, "step": 4985 }, { "entropy": 0.8164418451488018, "epoch": 0.4587437680059344, "grad_norm": 0.16028036177158356, "learning_rate": 8.471187168399424e-05, "loss": 0.7889, "mean_token_accuracy": 0.7717165760695934, "num_tokens": 159151206.0, "step": 4986 }, { "entropy": 0.7809179360046983, "epoch": 0.45883577437737566, "grad_norm": 0.1499899923801422, "learning_rate": 8.470880485785261e-05, "loss": 0.7553, "mean_token_accuracy": 0.7809395492076874, "num_tokens": 159183363.0, "step": 4987 }, { "entropy": 0.787173219025135, "epoch": 0.45892778074881685, "grad_norm": 0.15698009729385376, "learning_rate": 8.470573803171099e-05, "loss": 0.7735, "mean_token_accuracy": 0.7719193883240223, "num_tokens": 159214701.0, "step": 4988 }, { "entropy": 0.8697910867631435, "epoch": 0.4590197871202581, "grad_norm": 0.152859628200531, "learning_rate": 8.470267120556936e-05, "loss": 0.8634, "mean_token_accuracy": 0.7489760145545006, "num_tokens": 159246597.0, "step": 4989 }, { "entropy": 0.7986658932641149, "epoch": 0.4591117934916993, "grad_norm": 0.15286745131015778, "learning_rate": 8.469960437942773e-05, "loss": 0.789, "mean_token_accuracy": 0.7686457708477974, "num_tokens": 159278426.0, "step": 4990 }, { "entropy": 0.8591982759535313, "epoch": 0.4592037998631405, "grad_norm": 0.15621401369571686, "learning_rate": 8.469653755328611e-05, "loss": 0.8506, "mean_token_accuracy": 0.7523065842688084, "num_tokens": 159310902.0, "step": 4991 }, { "entropy": 0.7922393698245287, "epoch": 0.45929580623458177, "grad_norm": 0.1575496643781662, "learning_rate": 8.469347072714449e-05, "loss": 0.7751, "mean_token_accuracy": 0.769306093454361, "num_tokens": 159342324.0, "step": 4992 }, { "entropy": 0.8131189718842506, "epoch": 0.45938781260602296, "grad_norm": 0.1608714908361435, "learning_rate": 8.469040390100286e-05, "loss": 0.7946, "mean_token_accuracy": 0.7686200402677059, "num_tokens": 159374454.0, "step": 4993 }, { "entropy": 0.8277446441352367, "epoch": 0.4594798189774642, "grad_norm": 0.1575716882944107, "learning_rate": 8.468733707486123e-05, "loss": 0.8131, "mean_token_accuracy": 0.763876635581255, "num_tokens": 159406568.0, "step": 4994 }, { "entropy": 0.7842000126838684, "epoch": 0.4595718253489054, "grad_norm": 0.15984775125980377, "learning_rate": 8.468427024871959e-05, "loss": 0.7726, "mean_token_accuracy": 0.7750547602772713, "num_tokens": 159438622.0, "step": 4995 }, { "entropy": 0.7688613701611757, "epoch": 0.45966383172034664, "grad_norm": 0.15735682845115662, "learning_rate": 8.468120342257799e-05, "loss": 0.757, "mean_token_accuracy": 0.780013233423233, "num_tokens": 159470903.0, "step": 4996 }, { "entropy": 0.7903661970049143, "epoch": 0.4597558380917879, "grad_norm": 0.15785834193229675, "learning_rate": 8.467813659643636e-05, "loss": 0.7872, "mean_token_accuracy": 0.7753605246543884, "num_tokens": 159502173.0, "step": 4997 }, { "entropy": 0.6719992980360985, "epoch": 0.45984784446322907, "grad_norm": 0.15274180471897125, "learning_rate": 8.467506977029472e-05, "loss": 0.68, "mean_token_accuracy": 0.796235229820013, "num_tokens": 159534524.0, "step": 4998 }, { "entropy": 0.7826402969658375, "epoch": 0.4599398508346703, "grad_norm": 0.16303636133670807, "learning_rate": 8.467200294415309e-05, "loss": 0.7864, "mean_token_accuracy": 0.7690371237695217, "num_tokens": 159566076.0, "step": 4999 }, { "entropy": 0.7008463405072689, "epoch": 0.4600318572061115, "grad_norm": 0.15118035674095154, "learning_rate": 8.466893611801147e-05, "loss": 0.7054, "mean_token_accuracy": 0.7908666916191578, "num_tokens": 159597966.0, "step": 5000 }, { "entropy": 0.739465368911624, "epoch": 0.46012386357755275, "grad_norm": 0.16657303273677826, "learning_rate": 8.466586929186985e-05, "loss": 0.722, "mean_token_accuracy": 0.7915695011615753, "num_tokens": 159630543.0, "step": 5001 }, { "entropy": 0.7908969894051552, "epoch": 0.460215869948994, "grad_norm": 0.17229142785072327, "learning_rate": 8.466280246572822e-05, "loss": 0.7987, "mean_token_accuracy": 0.7734578661620617, "num_tokens": 159662419.0, "step": 5002 }, { "entropy": 0.7487604208290577, "epoch": 0.4603078763204352, "grad_norm": 0.16499359905719757, "learning_rate": 8.465973563958659e-05, "loss": 0.7452, "mean_token_accuracy": 0.7857366092503071, "num_tokens": 159695016.0, "step": 5003 }, { "entropy": 0.8081641588360071, "epoch": 0.4603998826918764, "grad_norm": 0.16752035915851593, "learning_rate": 8.465666881344497e-05, "loss": 0.805, "mean_token_accuracy": 0.7662557475268841, "num_tokens": 159726793.0, "step": 5004 }, { "entropy": 0.8523219097405672, "epoch": 0.4604918890633176, "grad_norm": 0.15513528883457184, "learning_rate": 8.465360198730334e-05, "loss": 0.8321, "mean_token_accuracy": 0.7607531696557999, "num_tokens": 159759335.0, "step": 5005 }, { "entropy": 0.695832546800375, "epoch": 0.46058389543475886, "grad_norm": 0.14557528495788574, "learning_rate": 8.465053516116172e-05, "loss": 0.6651, "mean_token_accuracy": 0.8012549132108688, "num_tokens": 159791669.0, "step": 5006 }, { "entropy": 0.8306816555559635, "epoch": 0.4606759018062001, "grad_norm": 0.15949071943759918, "learning_rate": 8.46474683350201e-05, "loss": 0.8226, "mean_token_accuracy": 0.762861680239439, "num_tokens": 159824112.0, "step": 5007 }, { "entropy": 0.8763149101287127, "epoch": 0.4607679081776413, "grad_norm": 0.1645764261484146, "learning_rate": 8.464440150887847e-05, "loss": 0.8578, "mean_token_accuracy": 0.7500432804226875, "num_tokens": 159855774.0, "step": 5008 }, { "entropy": 0.755445521324873, "epoch": 0.46085991454908254, "grad_norm": 0.16032259166240692, "learning_rate": 8.464133468273684e-05, "loss": 0.7282, "mean_token_accuracy": 0.7884494736790657, "num_tokens": 159886796.0, "step": 5009 }, { "entropy": 0.8614304848015308, "epoch": 0.46095192092052373, "grad_norm": 0.1615578979253769, "learning_rate": 8.46382678565952e-05, "loss": 0.8649, "mean_token_accuracy": 0.7469385489821434, "num_tokens": 159918251.0, "step": 5010 }, { "entropy": 0.9040755890309811, "epoch": 0.461043927291965, "grad_norm": 0.16120243072509766, "learning_rate": 8.463520103045359e-05, "loss": 0.8907, "mean_token_accuracy": 0.7436652779579163, "num_tokens": 159950617.0, "step": 5011 }, { "entropy": 0.9057325944304466, "epoch": 0.4611359336634062, "grad_norm": 0.17213569581508636, "learning_rate": 8.463213420431197e-05, "loss": 0.9331, "mean_token_accuracy": 0.7348585389554501, "num_tokens": 159981109.0, "step": 5012 }, { "entropy": 0.7609034944325686, "epoch": 0.4612279400348474, "grad_norm": 0.1504848748445511, "learning_rate": 8.462906737817034e-05, "loss": 0.746, "mean_token_accuracy": 0.7779707796871662, "num_tokens": 160013025.0, "step": 5013 }, { "entropy": 0.7804981945082545, "epoch": 0.46131994640628865, "grad_norm": 0.1573440581560135, "learning_rate": 8.46260005520287e-05, "loss": 0.7453, "mean_token_accuracy": 0.7820841558277607, "num_tokens": 160044829.0, "step": 5014 }, { "entropy": 0.7373662125319242, "epoch": 0.46141195277772984, "grad_norm": 0.16035370528697968, "learning_rate": 8.462293372588709e-05, "loss": 0.7238, "mean_token_accuracy": 0.7889597974717617, "num_tokens": 160075244.0, "step": 5015 }, { "entropy": 0.8745708521455526, "epoch": 0.4615039591491711, "grad_norm": 0.1637427806854248, "learning_rate": 8.461986689974545e-05, "loss": 0.8894, "mean_token_accuracy": 0.7454567290842533, "num_tokens": 160107249.0, "step": 5016 }, { "entropy": 0.8154531316831708, "epoch": 0.46159596552061233, "grad_norm": 0.1550368368625641, "learning_rate": 8.461680007360384e-05, "loss": 0.7961, "mean_token_accuracy": 0.7711509838700294, "num_tokens": 160139527.0, "step": 5017 }, { "entropy": 0.7557669673115015, "epoch": 0.4616879718920535, "grad_norm": 0.15059620141983032, "learning_rate": 8.46137332474622e-05, "loss": 0.7428, "mean_token_accuracy": 0.7795593403279781, "num_tokens": 160171238.0, "step": 5018 }, { "entropy": 0.7723291888833046, "epoch": 0.46177997826349476, "grad_norm": 0.159902885556221, "learning_rate": 8.461066642132058e-05, "loss": 0.7699, "mean_token_accuracy": 0.7789671123027802, "num_tokens": 160202935.0, "step": 5019 }, { "entropy": 0.8009373359382153, "epoch": 0.46187198463493595, "grad_norm": 0.15756110846996307, "learning_rate": 8.460759959517895e-05, "loss": 0.8001, "mean_token_accuracy": 0.7690596468746662, "num_tokens": 160234362.0, "step": 5020 }, { "entropy": 0.7910097911953926, "epoch": 0.4619639910063772, "grad_norm": 0.16344544291496277, "learning_rate": 8.460453276903732e-05, "loss": 0.795, "mean_token_accuracy": 0.7706142775714397, "num_tokens": 160266196.0, "step": 5021 }, { "entropy": 0.712792195379734, "epoch": 0.46205599737781844, "grad_norm": 0.16067279875278473, "learning_rate": 8.46014659428957e-05, "loss": 0.688, "mean_token_accuracy": 0.7941073440015316, "num_tokens": 160298294.0, "step": 5022 }, { "entropy": 0.8253338485956192, "epoch": 0.46214800374925963, "grad_norm": 0.16087722778320312, "learning_rate": 8.459839911675408e-05, "loss": 0.8345, "mean_token_accuracy": 0.7605328895151615, "num_tokens": 160330457.0, "step": 5023 }, { "entropy": 0.7650652043521404, "epoch": 0.4622400101207009, "grad_norm": 0.15154843032360077, "learning_rate": 8.459533229061245e-05, "loss": 0.7583, "mean_token_accuracy": 0.7802869901061058, "num_tokens": 160362076.0, "step": 5024 }, { "entropy": 0.744088577106595, "epoch": 0.46233201649214206, "grad_norm": 0.15022985637187958, "learning_rate": 8.459226546447082e-05, "loss": 0.7327, "mean_token_accuracy": 0.7830910086631775, "num_tokens": 160393730.0, "step": 5025 }, { "entropy": 0.752527391538024, "epoch": 0.4624240228635833, "grad_norm": 0.15335425734519958, "learning_rate": 8.458919863832919e-05, "loss": 0.7389, "mean_token_accuracy": 0.7833410501480103, "num_tokens": 160426295.0, "step": 5026 }, { "entropy": 0.7968931272625923, "epoch": 0.46251602923502455, "grad_norm": 0.15337516367435455, "learning_rate": 8.458613181218757e-05, "loss": 0.7984, "mean_token_accuracy": 0.7622955031692982, "num_tokens": 160457798.0, "step": 5027 }, { "entropy": 0.7746553644537926, "epoch": 0.46260803560646574, "grad_norm": 0.15719915926456451, "learning_rate": 8.458306498604595e-05, "loss": 0.7717, "mean_token_accuracy": 0.7730823568999767, "num_tokens": 160489707.0, "step": 5028 }, { "entropy": 0.7631080467253923, "epoch": 0.462700041977907, "grad_norm": 0.1607808917760849, "learning_rate": 8.457999815990432e-05, "loss": 0.7572, "mean_token_accuracy": 0.7845116443932056, "num_tokens": 160522264.0, "step": 5029 }, { "entropy": 0.8325823694467545, "epoch": 0.4627920483493482, "grad_norm": 0.15355457365512848, "learning_rate": 8.457693133376269e-05, "loss": 0.8223, "mean_token_accuracy": 0.7630874402821064, "num_tokens": 160554591.0, "step": 5030 }, { "entropy": 0.8791149873286486, "epoch": 0.4628840547207894, "grad_norm": 0.16308540105819702, "learning_rate": 8.457386450762107e-05, "loss": 0.8488, "mean_token_accuracy": 0.7521821819245815, "num_tokens": 160585775.0, "step": 5031 }, { "entropy": 0.7605756912380457, "epoch": 0.46297606109223066, "grad_norm": 0.163997083902359, "learning_rate": 8.457079768147943e-05, "loss": 0.7717, "mean_token_accuracy": 0.7745246961712837, "num_tokens": 160617893.0, "step": 5032 }, { "entropy": 0.8529201988130808, "epoch": 0.46306806746367185, "grad_norm": 0.163122296333313, "learning_rate": 8.456773085533782e-05, "loss": 0.8394, "mean_token_accuracy": 0.7552995532751083, "num_tokens": 160649383.0, "step": 5033 }, { "entropy": 0.8562459666281939, "epoch": 0.4631600738351131, "grad_norm": 0.16897337138652802, "learning_rate": 8.45646640291962e-05, "loss": 0.8596, "mean_token_accuracy": 0.756764505058527, "num_tokens": 160680897.0, "step": 5034 }, { "entropy": 0.7273796088993549, "epoch": 0.4632520802065543, "grad_norm": 0.15887516736984253, "learning_rate": 8.456159720305457e-05, "loss": 0.7015, "mean_token_accuracy": 0.795278862118721, "num_tokens": 160712580.0, "step": 5035 }, { "entropy": 0.9323499016463757, "epoch": 0.46334408657799553, "grad_norm": 0.15859580039978027, "learning_rate": 8.455853037691293e-05, "loss": 0.8978, "mean_token_accuracy": 0.741994708776474, "num_tokens": 160744215.0, "step": 5036 }, { "entropy": 0.8817060627043247, "epoch": 0.4634360929494368, "grad_norm": 0.164163738489151, "learning_rate": 8.45554635507713e-05, "loss": 0.878, "mean_token_accuracy": 0.7443877495825291, "num_tokens": 160775543.0, "step": 5037 }, { "entropy": 0.8863855414092541, "epoch": 0.46352809932087796, "grad_norm": 0.16779300570487976, "learning_rate": 8.45523967246297e-05, "loss": 0.8719, "mean_token_accuracy": 0.7450345605611801, "num_tokens": 160806811.0, "step": 5038 }, { "entropy": 0.7863592561334372, "epoch": 0.4636201056923192, "grad_norm": 0.15563054382801056, "learning_rate": 8.454932989848806e-05, "loss": 0.7753, "mean_token_accuracy": 0.7673834711313248, "num_tokens": 160838518.0, "step": 5039 }, { "entropy": 0.8201106004416943, "epoch": 0.4637121120637604, "grad_norm": 0.15841446816921234, "learning_rate": 8.454626307234643e-05, "loss": 0.8155, "mean_token_accuracy": 0.7632531151175499, "num_tokens": 160870130.0, "step": 5040 }, { "entropy": 0.7934239860624075, "epoch": 0.46380411843520164, "grad_norm": 0.1587304174900055, "learning_rate": 8.45431962462048e-05, "loss": 0.7924, "mean_token_accuracy": 0.7663294225931168, "num_tokens": 160902328.0, "step": 5041 }, { "entropy": 0.8437720406800508, "epoch": 0.4638961248066429, "grad_norm": 0.15671658515930176, "learning_rate": 8.454012942006318e-05, "loss": 0.8315, "mean_token_accuracy": 0.7524590343236923, "num_tokens": 160934225.0, "step": 5042 }, { "entropy": 0.7910181879997253, "epoch": 0.4639881311780841, "grad_norm": 0.16718682646751404, "learning_rate": 8.453706259392156e-05, "loss": 0.803, "mean_token_accuracy": 0.7679471746087074, "num_tokens": 160966507.0, "step": 5043 }, { "entropy": 0.7671894561499357, "epoch": 0.4640801375495253, "grad_norm": 0.16005240380764008, "learning_rate": 8.453399576777993e-05, "loss": 0.7643, "mean_token_accuracy": 0.7717457599937916, "num_tokens": 160997604.0, "step": 5044 }, { "entropy": 0.7402691021561623, "epoch": 0.4641721439209665, "grad_norm": 0.15029050409793854, "learning_rate": 8.45309289416383e-05, "loss": 0.7355, "mean_token_accuracy": 0.782118272036314, "num_tokens": 161029222.0, "step": 5045 }, { "entropy": 0.7824805751442909, "epoch": 0.46426415029240775, "grad_norm": 0.15556032955646515, "learning_rate": 8.452786211549668e-05, "loss": 0.774, "mean_token_accuracy": 0.7716459780931473, "num_tokens": 161061631.0, "step": 5046 }, { "entropy": 0.87641785107553, "epoch": 0.464356156663849, "grad_norm": 0.15664108097553253, "learning_rate": 8.452479528935505e-05, "loss": 0.8652, "mean_token_accuracy": 0.7544499449431896, "num_tokens": 161093080.0, "step": 5047 }, { "entropy": 0.6944600380957127, "epoch": 0.4644481630352902, "grad_norm": 0.1528160721063614, "learning_rate": 8.452172846321343e-05, "loss": 0.6789, "mean_token_accuracy": 0.7991579882800579, "num_tokens": 161125095.0, "step": 5048 }, { "entropy": 0.7954096235334873, "epoch": 0.46454016940673143, "grad_norm": 0.15709035098552704, "learning_rate": 8.45186616370718e-05, "loss": 0.7888, "mean_token_accuracy": 0.7696265168488026, "num_tokens": 161157448.0, "step": 5049 }, { "entropy": 0.7263982836157084, "epoch": 0.4646321757781726, "grad_norm": 0.15453946590423584, "learning_rate": 8.451559481093018e-05, "loss": 0.6993, "mean_token_accuracy": 0.7922462895512581, "num_tokens": 161189898.0, "step": 5050 }, { "entropy": 0.8543830756098032, "epoch": 0.46472418214961386, "grad_norm": 0.16219748556613922, "learning_rate": 8.451252798478855e-05, "loss": 0.8397, "mean_token_accuracy": 0.7570863142609596, "num_tokens": 161220896.0, "step": 5051 }, { "entropy": 0.8166995830833912, "epoch": 0.4648161885210551, "grad_norm": 0.15854328870773315, "learning_rate": 8.450946115864691e-05, "loss": 0.7935, "mean_token_accuracy": 0.770126786082983, "num_tokens": 161251915.0, "step": 5052 }, { "entropy": 0.8696986362338066, "epoch": 0.4649081948924963, "grad_norm": 0.16403073072433472, "learning_rate": 8.45063943325053e-05, "loss": 0.8457, "mean_token_accuracy": 0.757647629827261, "num_tokens": 161283659.0, "step": 5053 }, { "entropy": 0.8649376779794693, "epoch": 0.46500020126393754, "grad_norm": 0.16504338383674622, "learning_rate": 8.450332750636368e-05, "loss": 0.8688, "mean_token_accuracy": 0.7542852535843849, "num_tokens": 161315989.0, "step": 5054 }, { "entropy": 0.6854433435946703, "epoch": 0.46509220763537873, "grad_norm": 0.14882387220859528, "learning_rate": 8.450026068022204e-05, "loss": 0.67, "mean_token_accuracy": 0.8026445433497429, "num_tokens": 161348269.0, "step": 5055 }, { "entropy": 0.7460649702697992, "epoch": 0.46518421400682, "grad_norm": 0.1651267558336258, "learning_rate": 8.449719385408041e-05, "loss": 0.743, "mean_token_accuracy": 0.7825619839131832, "num_tokens": 161380651.0, "step": 5056 }, { "entropy": 0.8191963322460651, "epoch": 0.4652762203782612, "grad_norm": 0.15682126581668854, "learning_rate": 8.449412702793878e-05, "loss": 0.8007, "mean_token_accuracy": 0.7669363357126713, "num_tokens": 161412479.0, "step": 5057 }, { "entropy": 0.8125718627125025, "epoch": 0.4653682267497024, "grad_norm": 0.16396218538284302, "learning_rate": 8.449106020179716e-05, "loss": 0.8136, "mean_token_accuracy": 0.7651096843183041, "num_tokens": 161444442.0, "step": 5058 }, { "entropy": 0.7050856277346611, "epoch": 0.46546023312114365, "grad_norm": 0.15926367044448853, "learning_rate": 8.448799337565554e-05, "loss": 0.7041, "mean_token_accuracy": 0.7950782738626003, "num_tokens": 161477140.0, "step": 5059 }, { "entropy": 0.8309361506253481, "epoch": 0.46555223949258484, "grad_norm": 0.16195176541805267, "learning_rate": 8.448492654951391e-05, "loss": 0.8138, "mean_token_accuracy": 0.7637379691004753, "num_tokens": 161508082.0, "step": 5060 }, { "entropy": 0.8478915505111217, "epoch": 0.4656442458640261, "grad_norm": 0.17002321779727936, "learning_rate": 8.448185972337228e-05, "loss": 0.8491, "mean_token_accuracy": 0.7531306855380535, "num_tokens": 161540426.0, "step": 5061 }, { "entropy": 0.7300110515207052, "epoch": 0.46573625223546733, "grad_norm": 0.184764564037323, "learning_rate": 8.447879289723066e-05, "loss": 0.733, "mean_token_accuracy": 0.7867409363389015, "num_tokens": 161572369.0, "step": 5062 }, { "entropy": 0.7423068881034851, "epoch": 0.4658282586069085, "grad_norm": 0.16041815280914307, "learning_rate": 8.447572607108903e-05, "loss": 0.7502, "mean_token_accuracy": 0.7800585739314556, "num_tokens": 161603255.0, "step": 5063 }, { "entropy": 0.6960385739803314, "epoch": 0.46592026497834976, "grad_norm": 0.15815313160419464, "learning_rate": 8.447265924494741e-05, "loss": 0.684, "mean_token_accuracy": 0.7943488694727421, "num_tokens": 161634485.0, "step": 5064 }, { "entropy": 0.7278556395322084, "epoch": 0.46601227134979095, "grad_norm": 0.1549481600522995, "learning_rate": 8.446959241880579e-05, "loss": 0.7106, "mean_token_accuracy": 0.7874641045928001, "num_tokens": 161666895.0, "step": 5065 }, { "entropy": 0.7588498592376709, "epoch": 0.4661042777212322, "grad_norm": 0.16073711216449738, "learning_rate": 8.446652559266416e-05, "loss": 0.753, "mean_token_accuracy": 0.7785639017820358, "num_tokens": 161698961.0, "step": 5066 }, { "entropy": 0.8026615427806973, "epoch": 0.46619628409267344, "grad_norm": 0.16757701337337494, "learning_rate": 8.446345876652253e-05, "loss": 0.8109, "mean_token_accuracy": 0.7689132019877434, "num_tokens": 161730570.0, "step": 5067 }, { "entropy": 0.8004765994846821, "epoch": 0.46628829046411463, "grad_norm": 0.1595907211303711, "learning_rate": 8.44603919403809e-05, "loss": 0.8053, "mean_token_accuracy": 0.7708982229232788, "num_tokens": 161762195.0, "step": 5068 }, { "entropy": 0.7903331574052572, "epoch": 0.4663802968355559, "grad_norm": 0.15254689753055573, "learning_rate": 8.445732511423928e-05, "loss": 0.7692, "mean_token_accuracy": 0.7766623869538307, "num_tokens": 161794523.0, "step": 5069 }, { "entropy": 0.8946295380592346, "epoch": 0.46647230320699706, "grad_norm": 0.15978294610977173, "learning_rate": 8.445425828809766e-05, "loss": 0.8902, "mean_token_accuracy": 0.7435061559081078, "num_tokens": 161827250.0, "step": 5070 }, { "entropy": 0.7569933068007231, "epoch": 0.4665643095784383, "grad_norm": 0.1501714289188385, "learning_rate": 8.445119146195603e-05, "loss": 0.7421, "mean_token_accuracy": 0.7804436944425106, "num_tokens": 161859240.0, "step": 5071 }, { "entropy": 0.7937517985701561, "epoch": 0.46665631594987955, "grad_norm": 0.15777145326137543, "learning_rate": 8.44481246358144e-05, "loss": 0.7712, "mean_token_accuracy": 0.7744518555700779, "num_tokens": 161891506.0, "step": 5072 }, { "entropy": 0.7873483784496784, "epoch": 0.46674832232132074, "grad_norm": 0.15736189484596252, "learning_rate": 8.444505780967277e-05, "loss": 0.7798, "mean_token_accuracy": 0.7706999517977238, "num_tokens": 161923968.0, "step": 5073 }, { "entropy": 0.8645448759198189, "epoch": 0.466840328692762, "grad_norm": 0.15921159088611603, "learning_rate": 8.444199098353116e-05, "loss": 0.8308, "mean_token_accuracy": 0.7642213553190231, "num_tokens": 161955844.0, "step": 5074 }, { "entropy": 0.8656888455152512, "epoch": 0.4669323350642032, "grad_norm": 0.15402851998806, "learning_rate": 8.443892415738952e-05, "loss": 0.8468, "mean_token_accuracy": 0.7523282393813133, "num_tokens": 161988253.0, "step": 5075 }, { "entropy": 0.7576217409223318, "epoch": 0.4670243414356444, "grad_norm": 0.1502183973789215, "learning_rate": 8.443585733124789e-05, "loss": 0.7435, "mean_token_accuracy": 0.7797163277864456, "num_tokens": 162020123.0, "step": 5076 }, { "entropy": 0.8505578842014074, "epoch": 0.46711634780708566, "grad_norm": 0.16080515086650848, "learning_rate": 8.443279050510627e-05, "loss": 0.8337, "mean_token_accuracy": 0.7622686959803104, "num_tokens": 162052442.0, "step": 5077 }, { "entropy": 0.8296422548592091, "epoch": 0.46720835417852685, "grad_norm": 0.1587674766778946, "learning_rate": 8.442972367896464e-05, "loss": 0.8137, "mean_token_accuracy": 0.7642454765737057, "num_tokens": 162084557.0, "step": 5078 }, { "entropy": 0.6598470341414213, "epoch": 0.4673003605499681, "grad_norm": 0.1531548947095871, "learning_rate": 8.442665685282302e-05, "loss": 0.6385, "mean_token_accuracy": 0.8097478076815605, "num_tokens": 162116242.0, "step": 5079 }, { "entropy": 0.8580582812428474, "epoch": 0.4673923669214093, "grad_norm": 0.17188270390033722, "learning_rate": 8.442359002668139e-05, "loss": 0.8791, "mean_token_accuracy": 0.751896895468235, "num_tokens": 162148552.0, "step": 5080 }, { "entropy": 0.776639349758625, "epoch": 0.46748437329285053, "grad_norm": 0.1554788500070572, "learning_rate": 8.442052320053977e-05, "loss": 0.7665, "mean_token_accuracy": 0.7756278924643993, "num_tokens": 162180571.0, "step": 5081 }, { "entropy": 0.8275728933513165, "epoch": 0.4675763796642918, "grad_norm": 0.16730491816997528, "learning_rate": 8.441745637439814e-05, "loss": 0.8374, "mean_token_accuracy": 0.7586451582610607, "num_tokens": 162212531.0, "step": 5082 }, { "entropy": 0.7876517362892628, "epoch": 0.46766838603573296, "grad_norm": 0.16049638390541077, "learning_rate": 8.441438954825651e-05, "loss": 0.7776, "mean_token_accuracy": 0.7749780155718327, "num_tokens": 162244499.0, "step": 5083 }, { "entropy": 0.7168771028518677, "epoch": 0.4677603924071742, "grad_norm": 0.1620548814535141, "learning_rate": 8.441132272211489e-05, "loss": 0.7093, "mean_token_accuracy": 0.792482890188694, "num_tokens": 162276614.0, "step": 5084 }, { "entropy": 0.6342466324567795, "epoch": 0.4678523987786154, "grad_norm": 0.15715546905994415, "learning_rate": 8.440825589597327e-05, "loss": 0.612, "mean_token_accuracy": 0.8195695020258427, "num_tokens": 162308069.0, "step": 5085 }, { "entropy": 0.7389107178896666, "epoch": 0.46794440515005664, "grad_norm": 0.16185656189918518, "learning_rate": 8.440518906983164e-05, "loss": 0.7167, "mean_token_accuracy": 0.785258088260889, "num_tokens": 162338997.0, "step": 5086 }, { "entropy": 0.6843371614813805, "epoch": 0.4680364115214979, "grad_norm": 0.15772201120853424, "learning_rate": 8.440212224369e-05, "loss": 0.6824, "mean_token_accuracy": 0.79690932482481, "num_tokens": 162371705.0, "step": 5087 }, { "entropy": 0.808480478823185, "epoch": 0.4681284178929391, "grad_norm": 0.16113406419754028, "learning_rate": 8.439905541754837e-05, "loss": 0.8126, "mean_token_accuracy": 0.7635851316154003, "num_tokens": 162404041.0, "step": 5088 }, { "entropy": 0.8566452525556087, "epoch": 0.4682204242643803, "grad_norm": 0.1560635268688202, "learning_rate": 8.439598859140676e-05, "loss": 0.8459, "mean_token_accuracy": 0.7565485760569572, "num_tokens": 162436611.0, "step": 5089 }, { "entropy": 0.7234358694404364, "epoch": 0.4683124306358215, "grad_norm": 0.15065594017505646, "learning_rate": 8.439292176526514e-05, "loss": 0.7103, "mean_token_accuracy": 0.7921523861587048, "num_tokens": 162468676.0, "step": 5090 }, { "entropy": 0.7159870527684689, "epoch": 0.46840443700726275, "grad_norm": 0.15306779742240906, "learning_rate": 8.43898549391235e-05, "loss": 0.7205, "mean_token_accuracy": 0.7852265797555447, "num_tokens": 162500968.0, "step": 5091 }, { "entropy": 0.8000919632613659, "epoch": 0.468496443378704, "grad_norm": 0.16727635264396667, "learning_rate": 8.438678811298187e-05, "loss": 0.7828, "mean_token_accuracy": 0.7749819122254848, "num_tokens": 162531977.0, "step": 5092 }, { "entropy": 0.7782155722379684, "epoch": 0.4685884497501452, "grad_norm": 0.1669309139251709, "learning_rate": 8.438372128684025e-05, "loss": 0.7836, "mean_token_accuracy": 0.7678747363388538, "num_tokens": 162563735.0, "step": 5093 }, { "entropy": 0.8788433894515038, "epoch": 0.46868045612158643, "grad_norm": 0.16553540527820587, "learning_rate": 8.438065446069862e-05, "loss": 0.8704, "mean_token_accuracy": 0.751151580363512, "num_tokens": 162595327.0, "step": 5094 }, { "entropy": 0.6940530687570572, "epoch": 0.4687724624930276, "grad_norm": 0.14830735325813293, "learning_rate": 8.4377587634557e-05, "loss": 0.6621, "mean_token_accuracy": 0.8035543337464333, "num_tokens": 162627924.0, "step": 5095 }, { "entropy": 0.8866175040602684, "epoch": 0.46886446886446886, "grad_norm": 0.16345511376857758, "learning_rate": 8.437452080841539e-05, "loss": 0.877, "mean_token_accuracy": 0.7503594160079956, "num_tokens": 162659962.0, "step": 5096 }, { "entropy": 0.8630284313112497, "epoch": 0.4689564752359101, "grad_norm": 0.16132450103759766, "learning_rate": 8.437145398227375e-05, "loss": 0.8782, "mean_token_accuracy": 0.7456680834293365, "num_tokens": 162691166.0, "step": 5097 }, { "entropy": 0.7531932778656483, "epoch": 0.4690484816073513, "grad_norm": 0.15542426705360413, "learning_rate": 8.436838715613212e-05, "loss": 0.7309, "mean_token_accuracy": 0.7924000471830368, "num_tokens": 162722711.0, "step": 5098 }, { "entropy": 0.797323590144515, "epoch": 0.46914048797879254, "grad_norm": 0.16265109181404114, "learning_rate": 8.436532032999049e-05, "loss": 0.791, "mean_token_accuracy": 0.7683176957070827, "num_tokens": 162755026.0, "step": 5099 }, { "entropy": 0.6291262358427048, "epoch": 0.46923249435023373, "grad_norm": 0.1579522341489792, "learning_rate": 8.436225350384887e-05, "loss": 0.6198, "mean_token_accuracy": 0.8128615580499172, "num_tokens": 162786488.0, "step": 5100 }, { "entropy": 0.8017503656446934, "epoch": 0.469324500721675, "grad_norm": 0.15622247755527496, "learning_rate": 8.435918667770725e-05, "loss": 0.8064, "mean_token_accuracy": 0.765576209872961, "num_tokens": 162818045.0, "step": 5101 }, { "entropy": 0.7100887726992369, "epoch": 0.4694165070931162, "grad_norm": 0.15721169114112854, "learning_rate": 8.435611985156562e-05, "loss": 0.7009, "mean_token_accuracy": 0.7933211363852024, "num_tokens": 162849414.0, "step": 5102 }, { "entropy": 0.6853756885975599, "epoch": 0.4695085134645574, "grad_norm": 0.16406817734241486, "learning_rate": 8.435305302542399e-05, "loss": 0.6778, "mean_token_accuracy": 0.7973126024007797, "num_tokens": 162881804.0, "step": 5103 }, { "entropy": 0.8263371586799622, "epoch": 0.46960051983599865, "grad_norm": 0.16099749505519867, "learning_rate": 8.434998619928237e-05, "loss": 0.8119, "mean_token_accuracy": 0.7674429081380367, "num_tokens": 162913272.0, "step": 5104 }, { "entropy": 0.757466021925211, "epoch": 0.46969252620743984, "grad_norm": 0.16136032342910767, "learning_rate": 8.434691937314074e-05, "loss": 0.7365, "mean_token_accuracy": 0.7845272235572338, "num_tokens": 162944881.0, "step": 5105 }, { "entropy": 0.8134964033961296, "epoch": 0.4697845325788811, "grad_norm": 0.1645130217075348, "learning_rate": 8.434385254699912e-05, "loss": 0.8072, "mean_token_accuracy": 0.766050785779953, "num_tokens": 162976372.0, "step": 5106 }, { "entropy": 0.8226194679737091, "epoch": 0.46987653895032233, "grad_norm": 0.15732118487358093, "learning_rate": 8.434078572085749e-05, "loss": 0.8018, "mean_token_accuracy": 0.7669225931167603, "num_tokens": 163007831.0, "step": 5107 }, { "entropy": 0.8219072222709656, "epoch": 0.4699685453217635, "grad_norm": 0.1596364825963974, "learning_rate": 8.433771889471587e-05, "loss": 0.826, "mean_token_accuracy": 0.759927049279213, "num_tokens": 163039467.0, "step": 5108 }, { "entropy": 0.7832695432007313, "epoch": 0.47006055169320476, "grad_norm": 0.1681356132030487, "learning_rate": 8.433465206857424e-05, "loss": 0.7834, "mean_token_accuracy": 0.7749642543494701, "num_tokens": 163071049.0, "step": 5109 }, { "entropy": 0.8436054699122906, "epoch": 0.47015255806464595, "grad_norm": 0.17082107067108154, "learning_rate": 8.43315852424326e-05, "loss": 0.8528, "mean_token_accuracy": 0.7528316825628281, "num_tokens": 163103620.0, "step": 5110 }, { "entropy": 0.7007008194923401, "epoch": 0.4702445644360872, "grad_norm": 0.15040522813796997, "learning_rate": 8.432851841629098e-05, "loss": 0.6654, "mean_token_accuracy": 0.8034613281488419, "num_tokens": 163135909.0, "step": 5111 }, { "entropy": 0.8438929934054613, "epoch": 0.47033657080752844, "grad_norm": 0.16711637377738953, "learning_rate": 8.432545159014937e-05, "loss": 0.8365, "mean_token_accuracy": 0.7609852366149426, "num_tokens": 163167280.0, "step": 5112 }, { "entropy": 0.9005765020847321, "epoch": 0.47042857717896963, "grad_norm": 0.16726639866828918, "learning_rate": 8.432238476400773e-05, "loss": 0.8844, "mean_token_accuracy": 0.738565381616354, "num_tokens": 163197698.0, "step": 5113 }, { "entropy": 0.8548414893448353, "epoch": 0.4705205835504109, "grad_norm": 0.15877525508403778, "learning_rate": 8.43193179378661e-05, "loss": 0.8431, "mean_token_accuracy": 0.7564977258443832, "num_tokens": 163229862.0, "step": 5114 }, { "entropy": 0.7224305961281061, "epoch": 0.47061258992185206, "grad_norm": 0.15541839599609375, "learning_rate": 8.431625111172447e-05, "loss": 0.7007, "mean_token_accuracy": 0.7978767417371273, "num_tokens": 163261411.0, "step": 5115 }, { "entropy": 0.8591271676123142, "epoch": 0.4707045962932933, "grad_norm": 0.15814900398254395, "learning_rate": 8.431318428558286e-05, "loss": 0.8614, "mean_token_accuracy": 0.7491197772324085, "num_tokens": 163293335.0, "step": 5116 }, { "entropy": 0.7517964392900467, "epoch": 0.47079660266473455, "grad_norm": 0.15690384805202484, "learning_rate": 8.431011745944123e-05, "loss": 0.7655, "mean_token_accuracy": 0.7754490189254284, "num_tokens": 163325604.0, "step": 5117 }, { "entropy": 0.6958468779921532, "epoch": 0.47088860903617574, "grad_norm": 0.16445787250995636, "learning_rate": 8.43070506332996e-05, "loss": 0.682, "mean_token_accuracy": 0.7978048473596573, "num_tokens": 163357374.0, "step": 5118 }, { "entropy": 0.8328113611787558, "epoch": 0.470980615407617, "grad_norm": 0.16162541508674622, "learning_rate": 8.430398380715797e-05, "loss": 0.8444, "mean_token_accuracy": 0.756453949958086, "num_tokens": 163389210.0, "step": 5119 }, { "entropy": 0.8167297802865505, "epoch": 0.4710726217790582, "grad_norm": 0.1545013040304184, "learning_rate": 8.430091698101635e-05, "loss": 0.8151, "mean_token_accuracy": 0.7667788080871105, "num_tokens": 163421271.0, "step": 5120 }, { "entropy": 0.8157068826258183, "epoch": 0.4711646281504994, "grad_norm": 0.15805213153362274, "learning_rate": 8.429785015487473e-05, "loss": 0.8208, "mean_token_accuracy": 0.7626765929162502, "num_tokens": 163453917.0, "step": 5121 }, { "entropy": 0.7248799819499254, "epoch": 0.47125663452194066, "grad_norm": 0.15965767204761505, "learning_rate": 8.42947833287331e-05, "loss": 0.7078, "mean_token_accuracy": 0.7930687889456749, "num_tokens": 163486009.0, "step": 5122 }, { "entropy": 0.7411667536944151, "epoch": 0.47134864089338185, "grad_norm": 0.16252177953720093, "learning_rate": 8.429171650259147e-05, "loss": 0.7249, "mean_token_accuracy": 0.7865158803761005, "num_tokens": 163517610.0, "step": 5123 }, { "entropy": 0.7396797854453325, "epoch": 0.4714406472648231, "grad_norm": 0.15131886303424835, "learning_rate": 8.428864967644985e-05, "loss": 0.7145, "mean_token_accuracy": 0.7893323004245758, "num_tokens": 163549811.0, "step": 5124 }, { "entropy": 0.7995414715260267, "epoch": 0.4715326536362643, "grad_norm": 0.16474758088588715, "learning_rate": 8.428558285030822e-05, "loss": 0.7771, "mean_token_accuracy": 0.771687675267458, "num_tokens": 163580980.0, "step": 5125 }, { "entropy": 0.879821989685297, "epoch": 0.47162466000770553, "grad_norm": 0.1597052663564682, "learning_rate": 8.42825160241666e-05, "loss": 0.8573, "mean_token_accuracy": 0.7520024217665195, "num_tokens": 163612273.0, "step": 5126 }, { "entropy": 0.7675926126539707, "epoch": 0.4717166663791468, "grad_norm": 0.16118408739566803, "learning_rate": 8.427944919802498e-05, "loss": 0.77, "mean_token_accuracy": 0.7788213305175304, "num_tokens": 163644988.0, "step": 5127 }, { "entropy": 0.772876437753439, "epoch": 0.47180867275058797, "grad_norm": 0.16167204082012177, "learning_rate": 8.427638237188335e-05, "loss": 0.7646, "mean_token_accuracy": 0.7790738269686699, "num_tokens": 163677278.0, "step": 5128 }, { "entropy": 0.8704407718032598, "epoch": 0.4719006791220292, "grad_norm": 0.167560875415802, "learning_rate": 8.427331554574171e-05, "loss": 0.8622, "mean_token_accuracy": 0.7534092292189598, "num_tokens": 163707813.0, "step": 5129 }, { "entropy": 0.8373424261808395, "epoch": 0.4719926854934704, "grad_norm": 0.1625479757785797, "learning_rate": 8.427024871960008e-05, "loss": 0.8494, "mean_token_accuracy": 0.7505929209291935, "num_tokens": 163740052.0, "step": 5130 }, { "entropy": 0.851405143737793, "epoch": 0.47208469186491164, "grad_norm": 0.1646070033311844, "learning_rate": 8.426718189345846e-05, "loss": 0.8281, "mean_token_accuracy": 0.7590467035770416, "num_tokens": 163771909.0, "step": 5131 }, { "entropy": 0.7346804551780224, "epoch": 0.4721766982363529, "grad_norm": 0.15519508719444275, "learning_rate": 8.426411506731685e-05, "loss": 0.7016, "mean_token_accuracy": 0.7963188141584396, "num_tokens": 163804215.0, "step": 5132 }, { "entropy": 0.752505823969841, "epoch": 0.4722687046077941, "grad_norm": 0.15187543630599976, "learning_rate": 8.426104824117521e-05, "loss": 0.7164, "mean_token_accuracy": 0.7903633005917072, "num_tokens": 163836458.0, "step": 5133 }, { "entropy": 0.8531786240637302, "epoch": 0.4723607109792353, "grad_norm": 0.15973873436450958, "learning_rate": 8.425798141503358e-05, "loss": 0.8335, "mean_token_accuracy": 0.7569948881864548, "num_tokens": 163868478.0, "step": 5134 }, { "entropy": 0.7369353696703911, "epoch": 0.4724527173506765, "grad_norm": 0.16890230774879456, "learning_rate": 8.425491458889196e-05, "loss": 0.7485, "mean_token_accuracy": 0.7888448648154736, "num_tokens": 163900283.0, "step": 5135 }, { "entropy": 0.7885284163057804, "epoch": 0.47254472372211775, "grad_norm": 0.1591619998216629, "learning_rate": 8.425184776275033e-05, "loss": 0.7708, "mean_token_accuracy": 0.7784798629581928, "num_tokens": 163932416.0, "step": 5136 }, { "entropy": 0.7777881845831871, "epoch": 0.472636730093559, "grad_norm": 0.16280797123908997, "learning_rate": 8.424878093660871e-05, "loss": 0.765, "mean_token_accuracy": 0.7737102098762989, "num_tokens": 163963955.0, "step": 5137 }, { "entropy": 0.7714197374880314, "epoch": 0.4727287364650002, "grad_norm": 0.15690013766288757, "learning_rate": 8.424571411046708e-05, "loss": 0.7759, "mean_token_accuracy": 0.7761208973824978, "num_tokens": 163995596.0, "step": 5138 }, { "entropy": 0.8697222508490086, "epoch": 0.47282074283644143, "grad_norm": 0.1625160574913025, "learning_rate": 8.424264728432546e-05, "loss": 0.8741, "mean_token_accuracy": 0.7462718822062016, "num_tokens": 164027551.0, "step": 5139 }, { "entropy": 0.7837327998131514, "epoch": 0.4729127492078826, "grad_norm": 0.15998995304107666, "learning_rate": 8.423958045818383e-05, "loss": 0.7864, "mean_token_accuracy": 0.7742840237915516, "num_tokens": 164059388.0, "step": 5140 }, { "entropy": 0.8262041844427586, "epoch": 0.47300475557932387, "grad_norm": 0.16394217312335968, "learning_rate": 8.42365136320422e-05, "loss": 0.8199, "mean_token_accuracy": 0.7604608424007893, "num_tokens": 164091282.0, "step": 5141 }, { "entropy": 0.7050326149910688, "epoch": 0.4730967619507651, "grad_norm": 0.15041328966617584, "learning_rate": 8.423344680590058e-05, "loss": 0.6881, "mean_token_accuracy": 0.7935977838933468, "num_tokens": 164123179.0, "step": 5142 }, { "entropy": 0.9351494610309601, "epoch": 0.4731887683222063, "grad_norm": 0.16334101557731628, "learning_rate": 8.423037997975896e-05, "loss": 0.9369, "mean_token_accuracy": 0.7336917817592621, "num_tokens": 164155615.0, "step": 5143 }, { "entropy": 0.8163490332663059, "epoch": 0.47328077469364754, "grad_norm": 0.1537867933511734, "learning_rate": 8.422731315361733e-05, "loss": 0.7997, "mean_token_accuracy": 0.767871793359518, "num_tokens": 164188118.0, "step": 5144 }, { "entropy": 0.8433966524899006, "epoch": 0.47337278106508873, "grad_norm": 0.1513570249080658, "learning_rate": 8.42242463274757e-05, "loss": 0.8289, "mean_token_accuracy": 0.75904655829072, "num_tokens": 164220567.0, "step": 5145 }, { "entropy": 0.816118648275733, "epoch": 0.47346478743653, "grad_norm": 0.1676976978778839, "learning_rate": 8.422117950133406e-05, "loss": 0.7917, "mean_token_accuracy": 0.7737191915512085, "num_tokens": 164252344.0, "step": 5146 }, { "entropy": 0.7849381770938635, "epoch": 0.4735567938079712, "grad_norm": 0.15803959965705872, "learning_rate": 8.421811267519244e-05, "loss": 0.7577, "mean_token_accuracy": 0.7767266444861889, "num_tokens": 164284217.0, "step": 5147 }, { "entropy": 0.8025322929024696, "epoch": 0.4736488001794124, "grad_norm": 0.16279709339141846, "learning_rate": 8.421504584905083e-05, "loss": 0.8113, "mean_token_accuracy": 0.764786284416914, "num_tokens": 164316485.0, "step": 5148 }, { "entropy": 0.790952954441309, "epoch": 0.47374080655085365, "grad_norm": 0.16059556603431702, "learning_rate": 8.42119790229092e-05, "loss": 0.7698, "mean_token_accuracy": 0.7759455442428589, "num_tokens": 164348314.0, "step": 5149 }, { "entropy": 0.8047340009361506, "epoch": 0.47383281292229484, "grad_norm": 0.16464723646640778, "learning_rate": 8.420891219676756e-05, "loss": 0.8085, "mean_token_accuracy": 0.7652494572103024, "num_tokens": 164380184.0, "step": 5150 }, { "entropy": 0.8413729015737772, "epoch": 0.4739248192937361, "grad_norm": 0.16501320898532867, "learning_rate": 8.420584537062594e-05, "loss": 0.8473, "mean_token_accuracy": 0.7566986717283726, "num_tokens": 164412206.0, "step": 5151 }, { "entropy": 0.7286456264555454, "epoch": 0.47401682566517733, "grad_norm": 0.16662999987602234, "learning_rate": 8.420277854448431e-05, "loss": 0.736, "mean_token_accuracy": 0.7855833992362022, "num_tokens": 164443915.0, "step": 5152 }, { "entropy": 0.9453593324869871, "epoch": 0.4741088320366185, "grad_norm": 0.16937294602394104, "learning_rate": 8.419971171834269e-05, "loss": 0.9405, "mean_token_accuracy": 0.7288645915687084, "num_tokens": 164475870.0, "step": 5153 }, { "entropy": 0.8248483445495367, "epoch": 0.47420083840805977, "grad_norm": 0.16152800619602203, "learning_rate": 8.419664489220106e-05, "loss": 0.8188, "mean_token_accuracy": 0.7640186175704002, "num_tokens": 164507785.0, "step": 5154 }, { "entropy": 0.7795240730047226, "epoch": 0.47429284477950095, "grad_norm": 0.1596006155014038, "learning_rate": 8.419357806605944e-05, "loss": 0.78, "mean_token_accuracy": 0.770627211779356, "num_tokens": 164540375.0, "step": 5155 }, { "entropy": 0.7347411755472422, "epoch": 0.4743848511509422, "grad_norm": 0.15406954288482666, "learning_rate": 8.419051123991781e-05, "loss": 0.7078, "mean_token_accuracy": 0.7831668332219124, "num_tokens": 164572417.0, "step": 5156 }, { "entropy": 0.87384332716465, "epoch": 0.47447685752238344, "grad_norm": 0.16053293645381927, "learning_rate": 8.418744441377618e-05, "loss": 0.8343, "mean_token_accuracy": 0.7554101869463921, "num_tokens": 164603964.0, "step": 5157 }, { "entropy": 0.8271229807287455, "epoch": 0.47456886389382463, "grad_norm": 0.15651504695415497, "learning_rate": 8.418437758763457e-05, "loss": 0.8172, "mean_token_accuracy": 0.7621587514877319, "num_tokens": 164636158.0, "step": 5158 }, { "entropy": 0.8567314557731152, "epoch": 0.4746608702652659, "grad_norm": 0.1760365068912506, "learning_rate": 8.418131076149294e-05, "loss": 0.8774, "mean_token_accuracy": 0.7500869818031788, "num_tokens": 164666681.0, "step": 5159 }, { "entropy": 0.9005201607942581, "epoch": 0.47475287663670707, "grad_norm": 0.17269085347652435, "learning_rate": 8.417824393535131e-05, "loss": 0.931, "mean_token_accuracy": 0.736955925822258, "num_tokens": 164699120.0, "step": 5160 }, { "entropy": 0.9000576436519623, "epoch": 0.4748448830081483, "grad_norm": 0.1688125729560852, "learning_rate": 8.417517710920968e-05, "loss": 0.9179, "mean_token_accuracy": 0.7423493638634682, "num_tokens": 164731122.0, "step": 5161 }, { "entropy": 0.7612063251435757, "epoch": 0.47493688937958956, "grad_norm": 0.14985805749893188, "learning_rate": 8.417211028306806e-05, "loss": 0.7385, "mean_token_accuracy": 0.7804300673305988, "num_tokens": 164762349.0, "step": 5162 }, { "entropy": 0.7814712841063738, "epoch": 0.47502889575103074, "grad_norm": 0.15255466103553772, "learning_rate": 8.416904345692644e-05, "loss": 0.7382, "mean_token_accuracy": 0.7827499955892563, "num_tokens": 164794122.0, "step": 5163 }, { "entropy": 0.8280153144150972, "epoch": 0.475120902122472, "grad_norm": 0.15799066424369812, "learning_rate": 8.416597663078481e-05, "loss": 0.8087, "mean_token_accuracy": 0.7636596709489822, "num_tokens": 164826776.0, "step": 5164 }, { "entropy": 0.7485704440623522, "epoch": 0.4752129084939132, "grad_norm": 0.15493471920490265, "learning_rate": 8.416290980464317e-05, "loss": 0.7336, "mean_token_accuracy": 0.7821888141334057, "num_tokens": 164858537.0, "step": 5165 }, { "entropy": 0.7316532451659441, "epoch": 0.4753049148653544, "grad_norm": 0.14977332949638367, "learning_rate": 8.415984297850156e-05, "loss": 0.711, "mean_token_accuracy": 0.7837161011993885, "num_tokens": 164890280.0, "step": 5166 }, { "entropy": 0.7838761191815138, "epoch": 0.47539692123679567, "grad_norm": 0.16312702000141144, "learning_rate": 8.415677615235992e-05, "loss": 0.769, "mean_token_accuracy": 0.7727215401828289, "num_tokens": 164921789.0, "step": 5167 }, { "entropy": 0.8170854616910219, "epoch": 0.47548892760823686, "grad_norm": 0.16045400500297546, "learning_rate": 8.41537093262183e-05, "loss": 0.8076, "mean_token_accuracy": 0.7662179842591286, "num_tokens": 164954417.0, "step": 5168 }, { "entropy": 0.8512692395597696, "epoch": 0.4755809339796781, "grad_norm": 0.1627604216337204, "learning_rate": 8.415064250007667e-05, "loss": 0.8605, "mean_token_accuracy": 0.7481606043875217, "num_tokens": 164985785.0, "step": 5169 }, { "entropy": 0.7794848717749119, "epoch": 0.4756729403511193, "grad_norm": 0.1683390885591507, "learning_rate": 8.414757567393505e-05, "loss": 0.8012, "mean_token_accuracy": 0.7686905078589916, "num_tokens": 165017112.0, "step": 5170 }, { "entropy": 0.7092011142522097, "epoch": 0.47576494672256053, "grad_norm": 0.15805582702159882, "learning_rate": 8.414450884779342e-05, "loss": 0.7096, "mean_token_accuracy": 0.7879418805241585, "num_tokens": 165048617.0, "step": 5171 }, { "entropy": 0.6161089949309826, "epoch": 0.4758569530940018, "grad_norm": 0.15880484879016876, "learning_rate": 8.414144202165179e-05, "loss": 0.6005, "mean_token_accuracy": 0.8181555978953838, "num_tokens": 165080692.0, "step": 5172 }, { "entropy": 0.8725826628506184, "epoch": 0.47594895946544297, "grad_norm": 0.16248266398906708, "learning_rate": 8.413837519551017e-05, "loss": 0.8551, "mean_token_accuracy": 0.7498167902231216, "num_tokens": 165112123.0, "step": 5173 }, { "entropy": 0.8787448070943356, "epoch": 0.4760409658368842, "grad_norm": 0.1656971573829651, "learning_rate": 8.413530836936855e-05, "loss": 0.8819, "mean_token_accuracy": 0.7467323131859303, "num_tokens": 165144044.0, "step": 5174 }, { "entropy": 0.7597235608845949, "epoch": 0.4761329722083254, "grad_norm": 0.1580447405576706, "learning_rate": 8.413224154322692e-05, "loss": 0.737, "mean_token_accuracy": 0.7860735394060612, "num_tokens": 165176396.0, "step": 5175 }, { "entropy": 0.6933110356330872, "epoch": 0.47622497857976664, "grad_norm": 0.1485605090856552, "learning_rate": 8.412917471708529e-05, "loss": 0.6815, "mean_token_accuracy": 0.7977470122277737, "num_tokens": 165208927.0, "step": 5176 }, { "entropy": 0.7888491787016392, "epoch": 0.4763169849512079, "grad_norm": 0.16265161335468292, "learning_rate": 8.412610789094366e-05, "loss": 0.7978, "mean_token_accuracy": 0.7667700685560703, "num_tokens": 165240151.0, "step": 5177 }, { "entropy": 0.7166433166712523, "epoch": 0.4764089913226491, "grad_norm": 0.1507086157798767, "learning_rate": 8.412304106480204e-05, "loss": 0.699, "mean_token_accuracy": 0.7940157279372215, "num_tokens": 165272499.0, "step": 5178 }, { "entropy": 0.8007474131882191, "epoch": 0.4765009976940903, "grad_norm": 0.1685057282447815, "learning_rate": 8.411997423866042e-05, "loss": 0.8105, "mean_token_accuracy": 0.7624577544629574, "num_tokens": 165304699.0, "step": 5179 }, { "entropy": 0.7361320555210114, "epoch": 0.4765930040655315, "grad_norm": 0.14657635986804962, "learning_rate": 8.411690741251879e-05, "loss": 0.7088, "mean_token_accuracy": 0.7892447263002396, "num_tokens": 165336992.0, "step": 5180 }, { "entropy": 0.8062324021011591, "epoch": 0.47668501043697276, "grad_norm": 0.15435662865638733, "learning_rate": 8.411384058637716e-05, "loss": 0.7754, "mean_token_accuracy": 0.7721446268260479, "num_tokens": 165369309.0, "step": 5181 }, { "entropy": 0.913729228079319, "epoch": 0.476777016808414, "grad_norm": 0.1641283482313156, "learning_rate": 8.411077376023554e-05, "loss": 0.9132, "mean_token_accuracy": 0.7391794621944427, "num_tokens": 165401452.0, "step": 5182 }, { "entropy": 0.7880869358778, "epoch": 0.4768690231798552, "grad_norm": 0.1663503348827362, "learning_rate": 8.41077069340939e-05, "loss": 0.7723, "mean_token_accuracy": 0.7792351879179478, "num_tokens": 165434085.0, "step": 5183 }, { "entropy": 0.695388738065958, "epoch": 0.47696102955129643, "grad_norm": 0.1592782884836197, "learning_rate": 8.410464010795229e-05, "loss": 0.6823, "mean_token_accuracy": 0.8005071766674519, "num_tokens": 165466147.0, "step": 5184 }, { "entropy": 0.9131723418831825, "epoch": 0.4770530359227376, "grad_norm": 0.16474930942058563, "learning_rate": 8.410157328181065e-05, "loss": 0.8971, "mean_token_accuracy": 0.7469351775944233, "num_tokens": 165497192.0, "step": 5185 }, { "entropy": 0.6647975463420153, "epoch": 0.47714504229417887, "grad_norm": 0.14652462303638458, "learning_rate": 8.409850645566904e-05, "loss": 0.6603, "mean_token_accuracy": 0.8080727905035019, "num_tokens": 165529960.0, "step": 5186 }, { "entropy": 0.6845179554075003, "epoch": 0.4772370486656201, "grad_norm": 0.16309674084186554, "learning_rate": 8.40954396295274e-05, "loss": 0.6854, "mean_token_accuracy": 0.7983250766992569, "num_tokens": 165561856.0, "step": 5187 }, { "entropy": 0.7287795413285494, "epoch": 0.4773290550370613, "grad_norm": 0.15810081362724304, "learning_rate": 8.409237280338577e-05, "loss": 0.729, "mean_token_accuracy": 0.7857123129069805, "num_tokens": 165594040.0, "step": 5188 }, { "entropy": 0.7643451783806086, "epoch": 0.47742106140850255, "grad_norm": 0.15535081923007965, "learning_rate": 8.408930597724415e-05, "loss": 0.7692, "mean_token_accuracy": 0.7779422849416733, "num_tokens": 165625377.0, "step": 5189 }, { "entropy": 0.6599569823592901, "epoch": 0.47751306777994373, "grad_norm": 0.16118305921554565, "learning_rate": 8.408623915110253e-05, "loss": 0.6569, "mean_token_accuracy": 0.8063151985406876, "num_tokens": 165656922.0, "step": 5190 }, { "entropy": 0.7884930968284607, "epoch": 0.477605074151385, "grad_norm": 0.16401562094688416, "learning_rate": 8.40831723249609e-05, "loss": 0.7956, "mean_token_accuracy": 0.767137348651886, "num_tokens": 165688551.0, "step": 5191 }, { "entropy": 0.7846729643642902, "epoch": 0.4776970805228262, "grad_norm": 0.16285641491413116, "learning_rate": 8.408010549881927e-05, "loss": 0.7784, "mean_token_accuracy": 0.772902961820364, "num_tokens": 165720557.0, "step": 5192 }, { "entropy": 0.6552283130586147, "epoch": 0.4777890868942674, "grad_norm": 0.15023231506347656, "learning_rate": 8.407703867267765e-05, "loss": 0.63, "mean_token_accuracy": 0.8102524429559708, "num_tokens": 165752918.0, "step": 5193 }, { "entropy": 0.6953130988404155, "epoch": 0.47788109326570866, "grad_norm": 0.1531752198934555, "learning_rate": 8.407397184653603e-05, "loss": 0.6867, "mean_token_accuracy": 0.801024317741394, "num_tokens": 165785393.0, "step": 5194 }, { "entropy": 0.7560567799955606, "epoch": 0.47797309963714985, "grad_norm": 0.15910053253173828, "learning_rate": 8.40709050203944e-05, "loss": 0.7492, "mean_token_accuracy": 0.7873763404786587, "num_tokens": 165817982.0, "step": 5195 }, { "entropy": 0.7561619020998478, "epoch": 0.4780651060085911, "grad_norm": 0.1577204316854477, "learning_rate": 8.406783819425277e-05, "loss": 0.7379, "mean_token_accuracy": 0.7841232307255268, "num_tokens": 165849894.0, "step": 5196 }, { "entropy": 0.7823984920978546, "epoch": 0.47815711238003233, "grad_norm": 0.15557356178760529, "learning_rate": 8.406477136811115e-05, "loss": 0.7719, "mean_token_accuracy": 0.7741900645196438, "num_tokens": 165882237.0, "step": 5197 }, { "entropy": 0.8886288665235043, "epoch": 0.4782491187514735, "grad_norm": 0.1773010492324829, "learning_rate": 8.406170454196952e-05, "loss": 0.8826, "mean_token_accuracy": 0.7463788278400898, "num_tokens": 165912968.0, "step": 5198 }, { "entropy": 0.7923057079315186, "epoch": 0.47834112512291477, "grad_norm": 0.16153579950332642, "learning_rate": 8.40586377158279e-05, "loss": 0.7861, "mean_token_accuracy": 0.7734267003834248, "num_tokens": 165945630.0, "step": 5199 }, { "entropy": 0.7887945510447025, "epoch": 0.47843313149435596, "grad_norm": 0.15586668252944946, "learning_rate": 8.405557088968627e-05, "loss": 0.7876, "mean_token_accuracy": 0.7709155417978764, "num_tokens": 165977640.0, "step": 5200 }, { "entropy": 0.7490629069507122, "epoch": 0.4785251378657972, "grad_norm": 0.1520090401172638, "learning_rate": 8.405250406354465e-05, "loss": 0.7393, "mean_token_accuracy": 0.7813426777720451, "num_tokens": 166010177.0, "step": 5201 }, { "entropy": 0.7798090595752001, "epoch": 0.47861714423723845, "grad_norm": 0.16572289168834686, "learning_rate": 8.404943723740302e-05, "loss": 0.7682, "mean_token_accuracy": 0.7776888832449913, "num_tokens": 166042198.0, "step": 5202 }, { "entropy": 0.839749488979578, "epoch": 0.47870915060867963, "grad_norm": 0.15713703632354736, "learning_rate": 8.404637041126138e-05, "loss": 0.8375, "mean_token_accuracy": 0.7568858079612255, "num_tokens": 166074480.0, "step": 5203 }, { "entropy": 0.7719357125461102, "epoch": 0.4788011569801209, "grad_norm": 0.15542197227478027, "learning_rate": 8.404330358511977e-05, "loss": 0.7629, "mean_token_accuracy": 0.7743195071816444, "num_tokens": 166107004.0, "step": 5204 }, { "entropy": 0.7482200749218464, "epoch": 0.4788931633515621, "grad_norm": 0.1548205018043518, "learning_rate": 8.404023675897815e-05, "loss": 0.7288, "mean_token_accuracy": 0.7803924307227135, "num_tokens": 166138410.0, "step": 5205 }, { "entropy": 0.8423316348344088, "epoch": 0.4789851697230033, "grad_norm": 0.1668292135000229, "learning_rate": 8.403716993283651e-05, "loss": 0.8487, "mean_token_accuracy": 0.7562650851905346, "num_tokens": 166170662.0, "step": 5206 }, { "entropy": 0.710219407454133, "epoch": 0.47907717609444456, "grad_norm": 0.155366450548172, "learning_rate": 8.403410310669488e-05, "loss": 0.6796, "mean_token_accuracy": 0.7988442592322826, "num_tokens": 166202374.0, "step": 5207 }, { "entropy": 0.8125598300248384, "epoch": 0.47916918246588575, "grad_norm": 0.16128143668174744, "learning_rate": 8.403103628055325e-05, "loss": 0.8089, "mean_token_accuracy": 0.7672162428498268, "num_tokens": 166235049.0, "step": 5208 }, { "entropy": 0.7864994071424007, "epoch": 0.479261188837327, "grad_norm": 0.16857819259166718, "learning_rate": 8.402796945441163e-05, "loss": 0.7942, "mean_token_accuracy": 0.7720288299024105, "num_tokens": 166267305.0, "step": 5209 }, { "entropy": 0.7633724268525839, "epoch": 0.47935319520876823, "grad_norm": 0.1657439023256302, "learning_rate": 8.402490262827001e-05, "loss": 0.7332, "mean_token_accuracy": 0.7903573885560036, "num_tokens": 166298078.0, "step": 5210 }, { "entropy": 0.9285253621637821, "epoch": 0.4794452015802094, "grad_norm": 0.16453133523464203, "learning_rate": 8.402183580212838e-05, "loss": 0.9218, "mean_token_accuracy": 0.7368473298847675, "num_tokens": 166330079.0, "step": 5211 }, { "entropy": 0.7992825135588646, "epoch": 0.47953720795165067, "grad_norm": 0.16103699803352356, "learning_rate": 8.401876897598675e-05, "loss": 0.7924, "mean_token_accuracy": 0.7685747854411602, "num_tokens": 166362060.0, "step": 5212 }, { "entropy": 0.8144254144281149, "epoch": 0.47962921432309186, "grad_norm": 0.16080686450004578, "learning_rate": 8.401570214984513e-05, "loss": 0.8015, "mean_token_accuracy": 0.7676109671592712, "num_tokens": 166394026.0, "step": 5213 }, { "entropy": 0.7308588568121195, "epoch": 0.4797212206945331, "grad_norm": 0.15397866070270538, "learning_rate": 8.40126353237035e-05, "loss": 0.7155, "mean_token_accuracy": 0.7919535934925079, "num_tokens": 166425351.0, "step": 5214 }, { "entropy": 0.9178040865808725, "epoch": 0.47981322706597435, "grad_norm": 0.16059650480747223, "learning_rate": 8.400956849756188e-05, "loss": 0.9032, "mean_token_accuracy": 0.7396084330976009, "num_tokens": 166457118.0, "step": 5215 }, { "entropy": 0.8147932030260563, "epoch": 0.47990523343741553, "grad_norm": 0.15835446119308472, "learning_rate": 8.400650167142025e-05, "loss": 0.7976, "mean_token_accuracy": 0.7692598812282085, "num_tokens": 166488890.0, "step": 5216 }, { "entropy": 0.8789936006069183, "epoch": 0.4799972398088568, "grad_norm": 0.15857011079788208, "learning_rate": 8.400343484527863e-05, "loss": 0.8748, "mean_token_accuracy": 0.7473781295120716, "num_tokens": 166521038.0, "step": 5217 }, { "entropy": 0.8335211500525475, "epoch": 0.48008924618029797, "grad_norm": 0.17185120284557343, "learning_rate": 8.4000368019137e-05, "loss": 0.8564, "mean_token_accuracy": 0.7517082057893276, "num_tokens": 166552536.0, "step": 5218 }, { "entropy": 0.7287058681249619, "epoch": 0.4801812525517392, "grad_norm": 0.15316429734230042, "learning_rate": 8.399730119299537e-05, "loss": 0.7249, "mean_token_accuracy": 0.7885411269962788, "num_tokens": 166585095.0, "step": 5219 }, { "entropy": 0.9605265371501446, "epoch": 0.48027325892318046, "grad_norm": 0.15757620334625244, "learning_rate": 8.399423436685375e-05, "loss": 0.9518, "mean_token_accuracy": 0.7258778996765614, "num_tokens": 166617120.0, "step": 5220 }, { "entropy": 0.7738384678959846, "epoch": 0.48036526529462165, "grad_norm": 0.15380239486694336, "learning_rate": 8.399116754071213e-05, "loss": 0.758, "mean_token_accuracy": 0.7777248993515968, "num_tokens": 166648741.0, "step": 5221 }, { "entropy": 0.8127052206546068, "epoch": 0.4804572716660629, "grad_norm": 0.1570986956357956, "learning_rate": 8.39881007145705e-05, "loss": 0.8074, "mean_token_accuracy": 0.7641115076839924, "num_tokens": 166680630.0, "step": 5222 }, { "entropy": 0.6785797066986561, "epoch": 0.4805492780375041, "grad_norm": 0.15366777777671814, "learning_rate": 8.398503388842886e-05, "loss": 0.6776, "mean_token_accuracy": 0.7962942346930504, "num_tokens": 166712528.0, "step": 5223 }, { "entropy": 0.7533758170902729, "epoch": 0.4806412844089453, "grad_norm": 0.16717413067817688, "learning_rate": 8.398196706228725e-05, "loss": 0.7648, "mean_token_accuracy": 0.7762302383780479, "num_tokens": 166744152.0, "step": 5224 }, { "entropy": 0.7703113965690136, "epoch": 0.48073329078038657, "grad_norm": 0.15529121458530426, "learning_rate": 8.397890023614561e-05, "loss": 0.7567, "mean_token_accuracy": 0.7770662866532803, "num_tokens": 166775670.0, "step": 5225 }, { "entropy": 0.817438617348671, "epoch": 0.48082529715182776, "grad_norm": 0.15737801790237427, "learning_rate": 8.3975833410004e-05, "loss": 0.8121, "mean_token_accuracy": 0.7636530660092831, "num_tokens": 166807412.0, "step": 5226 }, { "entropy": 0.6860779542475939, "epoch": 0.480917303523269, "grad_norm": 0.1466493308544159, "learning_rate": 8.397276658386236e-05, "loss": 0.6548, "mean_token_accuracy": 0.8061686009168625, "num_tokens": 166839038.0, "step": 5227 }, { "entropy": 0.7151614408940077, "epoch": 0.4810093098947102, "grad_norm": 0.15497565269470215, "learning_rate": 8.396969975772074e-05, "loss": 0.7057, "mean_token_accuracy": 0.790836114436388, "num_tokens": 166870247.0, "step": 5228 }, { "entropy": 0.7009749989956617, "epoch": 0.48110131626615144, "grad_norm": 0.15243779122829437, "learning_rate": 8.396663293157911e-05, "loss": 0.6899, "mean_token_accuracy": 0.794426042586565, "num_tokens": 166901586.0, "step": 5229 }, { "entropy": 0.7841147650033236, "epoch": 0.4811933226375927, "grad_norm": 0.15437094867229462, "learning_rate": 8.396356610543748e-05, "loss": 0.7518, "mean_token_accuracy": 0.7754592709243298, "num_tokens": 166933117.0, "step": 5230 }, { "entropy": 0.6418750379234552, "epoch": 0.48128532900903387, "grad_norm": 0.17460261285305023, "learning_rate": 8.396049927929586e-05, "loss": 0.6511, "mean_token_accuracy": 0.8084491044282913, "num_tokens": 166965500.0, "step": 5231 }, { "entropy": 0.9004889652132988, "epoch": 0.4813773353804751, "grad_norm": 0.15922404825687408, "learning_rate": 8.395743245315424e-05, "loss": 0.8837, "mean_token_accuracy": 0.7456017471849918, "num_tokens": 166997618.0, "step": 5232 }, { "entropy": 0.8107548011466861, "epoch": 0.4814693417519163, "grad_norm": 0.1590633988380432, "learning_rate": 8.395436562701261e-05, "loss": 0.8021, "mean_token_accuracy": 0.7634168341755867, "num_tokens": 167028302.0, "step": 5233 }, { "entropy": 0.7335665635764599, "epoch": 0.48156134812335755, "grad_norm": 0.15417975187301636, "learning_rate": 8.395129880087098e-05, "loss": 0.7106, "mean_token_accuracy": 0.7954946681857109, "num_tokens": 167060181.0, "step": 5234 }, { "entropy": 0.7492597457021475, "epoch": 0.4816533544947988, "grad_norm": 0.1553354263305664, "learning_rate": 8.394823197472935e-05, "loss": 0.753, "mean_token_accuracy": 0.783217042684555, "num_tokens": 167092366.0, "step": 5235 }, { "entropy": 0.8121619448065758, "epoch": 0.48174536086624, "grad_norm": 0.16081497073173523, "learning_rate": 8.394516514858774e-05, "loss": 0.8029, "mean_token_accuracy": 0.7669978179037571, "num_tokens": 167123839.0, "step": 5236 }, { "entropy": 0.787126375362277, "epoch": 0.4818373672376812, "grad_norm": 0.15852895379066467, "learning_rate": 8.394209832244611e-05, "loss": 0.7806, "mean_token_accuracy": 0.782749842852354, "num_tokens": 167155235.0, "step": 5237 }, { "entropy": 0.7457259241491556, "epoch": 0.4819293736091224, "grad_norm": 0.15617115795612335, "learning_rate": 8.393903149630448e-05, "loss": 0.7375, "mean_token_accuracy": 0.785408541560173, "num_tokens": 167187633.0, "step": 5238 }, { "entropy": 0.8020030446350574, "epoch": 0.48202137998056366, "grad_norm": 0.15182462334632874, "learning_rate": 8.393596467016284e-05, "loss": 0.786, "mean_token_accuracy": 0.7641374357044697, "num_tokens": 167219599.0, "step": 5239 }, { "entropy": 0.7289098799228668, "epoch": 0.4821133863520049, "grad_norm": 0.1607024371623993, "learning_rate": 8.393289784402123e-05, "loss": 0.727, "mean_token_accuracy": 0.7881591133773327, "num_tokens": 167251574.0, "step": 5240 }, { "entropy": 0.8949531614780426, "epoch": 0.4822053927234461, "grad_norm": 0.15943796932697296, "learning_rate": 8.392983101787961e-05, "loss": 0.8774, "mean_token_accuracy": 0.7440531328320503, "num_tokens": 167283456.0, "step": 5241 }, { "entropy": 0.7811092622578144, "epoch": 0.48229739909488734, "grad_norm": 0.15647752583026886, "learning_rate": 8.392676419173798e-05, "loss": 0.7803, "mean_token_accuracy": 0.771081730723381, "num_tokens": 167315841.0, "step": 5242 }, { "entropy": 0.5919939707964659, "epoch": 0.4823894054663285, "grad_norm": 0.14797861874103546, "learning_rate": 8.392369736559634e-05, "loss": 0.5728, "mean_token_accuracy": 0.8275830373167992, "num_tokens": 167348609.0, "step": 5243 }, { "entropy": 0.789119279012084, "epoch": 0.48248141183776977, "grad_norm": 0.16360007226467133, "learning_rate": 8.392063053945472e-05, "loss": 0.8024, "mean_token_accuracy": 0.7670775763690472, "num_tokens": 167379873.0, "step": 5244 }, { "entropy": 0.7908155731856823, "epoch": 0.482573418209211, "grad_norm": 0.16016699373722076, "learning_rate": 8.391756371331309e-05, "loss": 0.7785, "mean_token_accuracy": 0.7764917761087418, "num_tokens": 167411716.0, "step": 5245 }, { "entropy": 0.8874424397945404, "epoch": 0.4826654245806522, "grad_norm": 0.1659286767244339, "learning_rate": 8.391449688717147e-05, "loss": 0.8852, "mean_token_accuracy": 0.7436511591076851, "num_tokens": 167443427.0, "step": 5246 }, { "entropy": 0.762246310710907, "epoch": 0.48275743095209345, "grad_norm": 0.15461896359920502, "learning_rate": 8.391143006102984e-05, "loss": 0.7634, "mean_token_accuracy": 0.7749888896942139, "num_tokens": 167474625.0, "step": 5247 }, { "entropy": 0.7282298412173986, "epoch": 0.48284943732353464, "grad_norm": 0.1693304181098938, "learning_rate": 8.390836323488822e-05, "loss": 0.7213, "mean_token_accuracy": 0.7874235101044178, "num_tokens": 167506339.0, "step": 5248 }, { "entropy": 0.8465447872877121, "epoch": 0.4829414436949759, "grad_norm": 0.17562691867351532, "learning_rate": 8.390529640874659e-05, "loss": 0.8597, "mean_token_accuracy": 0.7518867589533329, "num_tokens": 167536572.0, "step": 5249 }, { "entropy": 0.7610751166939735, "epoch": 0.4830334500664171, "grad_norm": 0.15573570132255554, "learning_rate": 8.390222958260496e-05, "loss": 0.736, "mean_token_accuracy": 0.7869646064937115, "num_tokens": 167568978.0, "step": 5250 }, { "entropy": 0.7336054444313049, "epoch": 0.4831254564378583, "grad_norm": 0.1518692970275879, "learning_rate": 8.389916275646334e-05, "loss": 0.7272, "mean_token_accuracy": 0.7817497849464417, "num_tokens": 167600947.0, "step": 5251 }, { "entropy": 0.7490066420286894, "epoch": 0.48321746280929956, "grad_norm": 0.15595075488090515, "learning_rate": 8.389609593032172e-05, "loss": 0.7362, "mean_token_accuracy": 0.7890356257557869, "num_tokens": 167633414.0, "step": 5252 }, { "entropy": 0.7371593900024891, "epoch": 0.48330946918074075, "grad_norm": 0.1640031337738037, "learning_rate": 8.389302910418009e-05, "loss": 0.735, "mean_token_accuracy": 0.7867949493229389, "num_tokens": 167665999.0, "step": 5253 }, { "entropy": 0.6132667511701584, "epoch": 0.483401475552182, "grad_norm": 0.16526922583580017, "learning_rate": 8.388996227803846e-05, "loss": 0.6178, "mean_token_accuracy": 0.8149363659322262, "num_tokens": 167698492.0, "step": 5254 }, { "entropy": 0.72002137824893, "epoch": 0.48349348192362324, "grad_norm": 0.14845527708530426, "learning_rate": 8.388689545189684e-05, "loss": 0.6933, "mean_token_accuracy": 0.7956993319094181, "num_tokens": 167730602.0, "step": 5255 }, { "entropy": 0.7480526939034462, "epoch": 0.4835854882950644, "grad_norm": 0.1570023000240326, "learning_rate": 8.38838286257552e-05, "loss": 0.7391, "mean_token_accuracy": 0.7815625295042992, "num_tokens": 167762852.0, "step": 5256 }, { "entropy": 0.7955609634518623, "epoch": 0.48367749466650567, "grad_norm": 0.15646754205226898, "learning_rate": 8.388076179961359e-05, "loss": 0.7705, "mean_token_accuracy": 0.7764603570103645, "num_tokens": 167795179.0, "step": 5257 }, { "entropy": 0.7876689974218607, "epoch": 0.48376950103794686, "grad_norm": 0.1620609015226364, "learning_rate": 8.387769497347196e-05, "loss": 0.7855, "mean_token_accuracy": 0.7694186605513096, "num_tokens": 167827947.0, "step": 5258 }, { "entropy": 0.7587589137256145, "epoch": 0.4838615074093881, "grad_norm": 0.1527715027332306, "learning_rate": 8.387462814733034e-05, "loss": 0.7479, "mean_token_accuracy": 0.7806435786187649, "num_tokens": 167860193.0, "step": 5259 }, { "entropy": 0.7746089175343513, "epoch": 0.48395351378082935, "grad_norm": 0.16166149079799652, "learning_rate": 8.38715613211887e-05, "loss": 0.7757, "mean_token_accuracy": 0.7743276469409466, "num_tokens": 167891460.0, "step": 5260 }, { "entropy": 0.7353371828794479, "epoch": 0.48404552015227054, "grad_norm": 0.15472234785556793, "learning_rate": 8.386849449504707e-05, "loss": 0.7268, "mean_token_accuracy": 0.7858091369271278, "num_tokens": 167923623.0, "step": 5261 }, { "entropy": 0.8182930871844292, "epoch": 0.4841375265237118, "grad_norm": 0.16275431215763092, "learning_rate": 8.386542766890545e-05, "loss": 0.8098, "mean_token_accuracy": 0.7654200531542301, "num_tokens": 167956233.0, "step": 5262 }, { "entropy": 0.755168816074729, "epoch": 0.48422953289515297, "grad_norm": 0.16220754384994507, "learning_rate": 8.386236084276384e-05, "loss": 0.7593, "mean_token_accuracy": 0.7823838219046593, "num_tokens": 167988197.0, "step": 5263 }, { "entropy": 0.7437452934682369, "epoch": 0.4843215392665942, "grad_norm": 0.15614238381385803, "learning_rate": 8.38592940166222e-05, "loss": 0.705, "mean_token_accuracy": 0.7942300736904144, "num_tokens": 168020836.0, "step": 5264 }, { "entropy": 0.8206591811031103, "epoch": 0.48441354563803546, "grad_norm": 0.1591477245092392, "learning_rate": 8.385622719048057e-05, "loss": 0.8047, "mean_token_accuracy": 0.7643876299262047, "num_tokens": 168052107.0, "step": 5265 }, { "entropy": 0.7948750276118517, "epoch": 0.48450555200947665, "grad_norm": 0.16878165304660797, "learning_rate": 8.385316036433894e-05, "loss": 0.7859, "mean_token_accuracy": 0.7745554558932781, "num_tokens": 168084362.0, "step": 5266 }, { "entropy": 0.8400347884744406, "epoch": 0.4845975583809179, "grad_norm": 0.15655472874641418, "learning_rate": 8.385009353819732e-05, "loss": 0.8241, "mean_token_accuracy": 0.7621246501803398, "num_tokens": 168116833.0, "step": 5267 }, { "entropy": 0.7473954213783145, "epoch": 0.4846895647523591, "grad_norm": 0.15724386274814606, "learning_rate": 8.38470267120557e-05, "loss": 0.7258, "mean_token_accuracy": 0.7902371622622013, "num_tokens": 168148849.0, "step": 5268 }, { "entropy": 0.6220828350633383, "epoch": 0.4847815711238003, "grad_norm": 0.14897732436656952, "learning_rate": 8.384395988591407e-05, "loss": 0.6193, "mean_token_accuracy": 0.8188070431351662, "num_tokens": 168180920.0, "step": 5269 }, { "entropy": 0.8614533469080925, "epoch": 0.48487357749524157, "grad_norm": 0.1643335074186325, "learning_rate": 8.384089305977244e-05, "loss": 0.8504, "mean_token_accuracy": 0.7544571943581104, "num_tokens": 168212917.0, "step": 5270 }, { "entropy": 0.7913817465305328, "epoch": 0.48496558386668276, "grad_norm": 0.15639027953147888, "learning_rate": 8.383782623363082e-05, "loss": 0.79, "mean_token_accuracy": 0.7677251137793064, "num_tokens": 168245280.0, "step": 5271 }, { "entropy": 0.8033524360507727, "epoch": 0.485057590238124, "grad_norm": 0.1558280736207962, "learning_rate": 8.383475940748919e-05, "loss": 0.797, "mean_token_accuracy": 0.7664866298437119, "num_tokens": 168277687.0, "step": 5272 }, { "entropy": 0.7709119506180286, "epoch": 0.4851495966095652, "grad_norm": 0.15893147885799408, "learning_rate": 8.383169258134757e-05, "loss": 0.7566, "mean_token_accuracy": 0.775879979133606, "num_tokens": 168308188.0, "step": 5273 }, { "entropy": 0.7468138812109828, "epoch": 0.48524160298100644, "grad_norm": 0.15799476206302643, "learning_rate": 8.382862575520594e-05, "loss": 0.718, "mean_token_accuracy": 0.7915283069014549, "num_tokens": 168340482.0, "step": 5274 }, { "entropy": 0.765857569873333, "epoch": 0.4853336093524477, "grad_norm": 0.15909279882907867, "learning_rate": 8.382555892906432e-05, "loss": 0.7709, "mean_token_accuracy": 0.7790596447885036, "num_tokens": 168372901.0, "step": 5275 }, { "entropy": 0.794036477804184, "epoch": 0.48542561572388887, "grad_norm": 0.15433980524539948, "learning_rate": 8.382249210292269e-05, "loss": 0.8005, "mean_token_accuracy": 0.769396897405386, "num_tokens": 168405611.0, "step": 5276 }, { "entropy": 0.7326240856200457, "epoch": 0.4855176220953301, "grad_norm": 0.1558351069688797, "learning_rate": 8.381942527678105e-05, "loss": 0.7334, "mean_token_accuracy": 0.7827485166490078, "num_tokens": 168437209.0, "step": 5277 }, { "entropy": 0.7284587118774652, "epoch": 0.4856096284667713, "grad_norm": 0.1703798472881317, "learning_rate": 8.381635845063945e-05, "loss": 0.7243, "mean_token_accuracy": 0.786476731300354, "num_tokens": 168468896.0, "step": 5278 }, { "entropy": 0.7461251970380545, "epoch": 0.48570163483821255, "grad_norm": 0.16644561290740967, "learning_rate": 8.381329162449782e-05, "loss": 0.7447, "mean_token_accuracy": 0.782730296254158, "num_tokens": 168500404.0, "step": 5279 }, { "entropy": 0.7385731600224972, "epoch": 0.4857936412096538, "grad_norm": 0.16877306997776031, "learning_rate": 8.381022479835618e-05, "loss": 0.7367, "mean_token_accuracy": 0.7801456786692142, "num_tokens": 168531916.0, "step": 5280 }, { "entropy": 0.8467577956616879, "epoch": 0.485885647581095, "grad_norm": 0.16069605946540833, "learning_rate": 8.380715797221455e-05, "loss": 0.8472, "mean_token_accuracy": 0.7562742754817009, "num_tokens": 168563959.0, "step": 5281 }, { "entropy": 0.8272961135953665, "epoch": 0.4859776539525362, "grad_norm": 0.1529092639684677, "learning_rate": 8.380409114607293e-05, "loss": 0.8043, "mean_token_accuracy": 0.7676254287362099, "num_tokens": 168595920.0, "step": 5282 }, { "entropy": 0.7120839841663837, "epoch": 0.4860696603239774, "grad_norm": 0.15097039937973022, "learning_rate": 8.380102431993132e-05, "loss": 0.6812, "mean_token_accuracy": 0.7968635261058807, "num_tokens": 168627285.0, "step": 5283 }, { "entropy": 0.9186556003987789, "epoch": 0.48616166669541866, "grad_norm": 0.16695107519626617, "learning_rate": 8.379795749378968e-05, "loss": 0.89, "mean_token_accuracy": 0.7485988847911358, "num_tokens": 168658928.0, "step": 5284 }, { "entropy": 0.7840875647962093, "epoch": 0.4862536730668599, "grad_norm": 0.15783576667308807, "learning_rate": 8.379489066764805e-05, "loss": 0.7734, "mean_token_accuracy": 0.7769701257348061, "num_tokens": 168690230.0, "step": 5285 }, { "entropy": 0.7499577924609184, "epoch": 0.4863456794383011, "grad_norm": 0.15485651791095734, "learning_rate": 8.379182384150643e-05, "loss": 0.7256, "mean_token_accuracy": 0.7864547073841095, "num_tokens": 168722238.0, "step": 5286 }, { "entropy": 0.7360309716314077, "epoch": 0.48643768580974234, "grad_norm": 0.1574356108903885, "learning_rate": 8.37887570153648e-05, "loss": 0.7194, "mean_token_accuracy": 0.7873851098120213, "num_tokens": 168754728.0, "step": 5287 }, { "entropy": 0.7805514466017485, "epoch": 0.4865296921811835, "grad_norm": 0.16024157404899597, "learning_rate": 8.378569018922318e-05, "loss": 0.7838, "mean_token_accuracy": 0.7737994603812695, "num_tokens": 168787077.0, "step": 5288 }, { "entropy": 0.7734700981527567, "epoch": 0.48662169855262477, "grad_norm": 0.15774419903755188, "learning_rate": 8.378262336308155e-05, "loss": 0.7516, "mean_token_accuracy": 0.7794651016592979, "num_tokens": 168819388.0, "step": 5289 }, { "entropy": 0.7379067242145538, "epoch": 0.486713704924066, "grad_norm": 0.1612413227558136, "learning_rate": 8.377955653693993e-05, "loss": 0.7138, "mean_token_accuracy": 0.7897556349635124, "num_tokens": 168850194.0, "step": 5290 }, { "entropy": 0.6549988947808743, "epoch": 0.4868057112955072, "grad_norm": 0.15943776071071625, "learning_rate": 8.37764897107983e-05, "loss": 0.6602, "mean_token_accuracy": 0.8066932037472725, "num_tokens": 168881573.0, "step": 5291 }, { "entropy": 0.7337059173732996, "epoch": 0.48689771766694845, "grad_norm": 0.14983701705932617, "learning_rate": 8.377342288465667e-05, "loss": 0.7128, "mean_token_accuracy": 0.7889367938041687, "num_tokens": 168914264.0, "step": 5292 }, { "entropy": 0.844605278223753, "epoch": 0.48698972403838964, "grad_norm": 0.16566304862499237, "learning_rate": 8.377035605851505e-05, "loss": 0.8307, "mean_token_accuracy": 0.7604597508907318, "num_tokens": 168946358.0, "step": 5293 }, { "entropy": 0.7201855331659317, "epoch": 0.4870817304098309, "grad_norm": 0.15863245725631714, "learning_rate": 8.376728923237343e-05, "loss": 0.7345, "mean_token_accuracy": 0.7819554917514324, "num_tokens": 168977389.0, "step": 5294 }, { "entropy": 0.8196323197335005, "epoch": 0.4871737367812721, "grad_norm": 0.16080327332019806, "learning_rate": 8.37642224062318e-05, "loss": 0.8145, "mean_token_accuracy": 0.7665210887789726, "num_tokens": 169010050.0, "step": 5295 }, { "entropy": 0.7937330435961485, "epoch": 0.4872657431527133, "grad_norm": 0.16950613260269165, "learning_rate": 8.376115558009017e-05, "loss": 0.8015, "mean_token_accuracy": 0.766660001128912, "num_tokens": 169042137.0, "step": 5296 }, { "entropy": 0.7386066764593124, "epoch": 0.48735774952415456, "grad_norm": 0.16542845964431763, "learning_rate": 8.375808875394853e-05, "loss": 0.7461, "mean_token_accuracy": 0.783776018768549, "num_tokens": 169074612.0, "step": 5297 }, { "entropy": 0.8246335424482822, "epoch": 0.48744975589559575, "grad_norm": 0.1569824069738388, "learning_rate": 8.375502192780691e-05, "loss": 0.7929, "mean_token_accuracy": 0.7683084085583687, "num_tokens": 169106045.0, "step": 5298 }, { "entropy": 0.7358281649649143, "epoch": 0.487541762267037, "grad_norm": 0.15619471669197083, "learning_rate": 8.37519551016653e-05, "loss": 0.7235, "mean_token_accuracy": 0.7873042337596416, "num_tokens": 169138370.0, "step": 5299 }, { "entropy": 0.8247027695178986, "epoch": 0.48763376863847824, "grad_norm": 0.16313207149505615, "learning_rate": 8.374888827552366e-05, "loss": 0.8098, "mean_token_accuracy": 0.7676379978656769, "num_tokens": 169169748.0, "step": 5300 }, { "entropy": 0.7582145035266876, "epoch": 0.4877257750099194, "grad_norm": 0.15540950000286102, "learning_rate": 8.374582144938203e-05, "loss": 0.7509, "mean_token_accuracy": 0.7808375358581543, "num_tokens": 169201896.0, "step": 5301 }, { "entropy": 0.6735804937779903, "epoch": 0.48781778138136067, "grad_norm": 0.15288351476192474, "learning_rate": 8.374275462324041e-05, "loss": 0.6628, "mean_token_accuracy": 0.8006622269749641, "num_tokens": 169233673.0, "step": 5302 }, { "entropy": 0.7497870270162821, "epoch": 0.48790978775280186, "grad_norm": 0.1555968075990677, "learning_rate": 8.373968779709878e-05, "loss": 0.7452, "mean_token_accuracy": 0.7821176201105118, "num_tokens": 169265739.0, "step": 5303 }, { "entropy": 0.6872782465070486, "epoch": 0.4880017941242431, "grad_norm": 0.15121780335903168, "learning_rate": 8.373662097095716e-05, "loss": 0.6553, "mean_token_accuracy": 0.8048043511807919, "num_tokens": 169297599.0, "step": 5304 }, { "entropy": 0.7742238529026508, "epoch": 0.48809380049568435, "grad_norm": 0.1531965434551239, "learning_rate": 8.373355414481553e-05, "loss": 0.7504, "mean_token_accuracy": 0.7785509303212166, "num_tokens": 169328947.0, "step": 5305 }, { "entropy": 0.8074370250105858, "epoch": 0.48818580686712554, "grad_norm": 0.16804486513137817, "learning_rate": 8.373048731867391e-05, "loss": 0.7918, "mean_token_accuracy": 0.7728623300790787, "num_tokens": 169359876.0, "step": 5306 }, { "entropy": 0.6962380614131689, "epoch": 0.4882778132385668, "grad_norm": 0.15348432958126068, "learning_rate": 8.372742049253228e-05, "loss": 0.6827, "mean_token_accuracy": 0.7991633452475071, "num_tokens": 169391092.0, "step": 5307 }, { "entropy": 0.7099263872951269, "epoch": 0.48836981961000797, "grad_norm": 0.15462391078472137, "learning_rate": 8.372435366639065e-05, "loss": 0.7021, "mean_token_accuracy": 0.7939573489129543, "num_tokens": 169423416.0, "step": 5308 }, { "entropy": 0.789932819083333, "epoch": 0.4884618259814492, "grad_norm": 0.16334903240203857, "learning_rate": 8.372128684024903e-05, "loss": 0.8005, "mean_token_accuracy": 0.7662065178155899, "num_tokens": 169455700.0, "step": 5309 }, { "entropy": 0.8152282871305943, "epoch": 0.48855383235289046, "grad_norm": 0.16214345395565033, "learning_rate": 8.371822001410741e-05, "loss": 0.8344, "mean_token_accuracy": 0.7530752792954445, "num_tokens": 169487523.0, "step": 5310 }, { "entropy": 0.6866544429212809, "epoch": 0.48864583872433165, "grad_norm": 0.1518355756998062, "learning_rate": 8.371515318796578e-05, "loss": 0.6901, "mean_token_accuracy": 0.7955197021365166, "num_tokens": 169519646.0, "step": 5311 }, { "entropy": 0.7507355455309153, "epoch": 0.4887378450957729, "grad_norm": 0.15958857536315918, "learning_rate": 8.371208636182415e-05, "loss": 0.7832, "mean_token_accuracy": 0.7727410532534122, "num_tokens": 169551226.0, "step": 5312 }, { "entropy": 0.7657914236187935, "epoch": 0.4888298514672141, "grad_norm": 0.15884065628051758, "learning_rate": 8.370901953568253e-05, "loss": 0.7516, "mean_token_accuracy": 0.7817381285130978, "num_tokens": 169583194.0, "step": 5313 }, { "entropy": 0.86006173864007, "epoch": 0.4889218578386553, "grad_norm": 0.16038258373737335, "learning_rate": 8.370595270954091e-05, "loss": 0.8258, "mean_token_accuracy": 0.7602813430130482, "num_tokens": 169615496.0, "step": 5314 }, { "entropy": 0.7403207048773766, "epoch": 0.48901386421009657, "grad_norm": 0.14470939338207245, "learning_rate": 8.370288588339928e-05, "loss": 0.7111, "mean_token_accuracy": 0.7905456088483334, "num_tokens": 169647922.0, "step": 5315 }, { "entropy": 0.812068484723568, "epoch": 0.48910587058153776, "grad_norm": 0.16960978507995605, "learning_rate": 8.369981905725764e-05, "loss": 0.8101, "mean_token_accuracy": 0.7597853019833565, "num_tokens": 169680186.0, "step": 5316 }, { "entropy": 0.7695570737123489, "epoch": 0.489197876952979, "grad_norm": 0.15346820652484894, "learning_rate": 8.369675223111603e-05, "loss": 0.7366, "mean_token_accuracy": 0.786888562142849, "num_tokens": 169712241.0, "step": 5317 }, { "entropy": 0.8264571074396372, "epoch": 0.4892898833244202, "grad_norm": 0.1706530749797821, "learning_rate": 8.36936854049744e-05, "loss": 0.823, "mean_token_accuracy": 0.7578515261411667, "num_tokens": 169743671.0, "step": 5318 }, { "entropy": 0.8738158773630857, "epoch": 0.48938188969586144, "grad_norm": 0.1591642051935196, "learning_rate": 8.369061857883278e-05, "loss": 0.8734, "mean_token_accuracy": 0.7474250644445419, "num_tokens": 169776103.0, "step": 5319 }, { "entropy": 0.844796952791512, "epoch": 0.4894738960673027, "grad_norm": 0.1597045361995697, "learning_rate": 8.368755175269114e-05, "loss": 0.845, "mean_token_accuracy": 0.7545814700424671, "num_tokens": 169808620.0, "step": 5320 }, { "entropy": 0.7762376312166452, "epoch": 0.48956590243874387, "grad_norm": 0.1571209877729416, "learning_rate": 8.368448492654952e-05, "loss": 0.7522, "mean_token_accuracy": 0.7817677892744541, "num_tokens": 169840833.0, "step": 5321 }, { "entropy": 0.6707482766360044, "epoch": 0.4896579088101851, "grad_norm": 0.15030018985271454, "learning_rate": 8.368141810040789e-05, "loss": 0.647, "mean_token_accuracy": 0.8089657761156559, "num_tokens": 169872859.0, "step": 5322 }, { "entropy": 0.76469986140728, "epoch": 0.4897499151816263, "grad_norm": 0.15592366456985474, "learning_rate": 8.367835127426626e-05, "loss": 0.7359, "mean_token_accuracy": 0.786103006452322, "num_tokens": 169904910.0, "step": 5323 }, { "entropy": 0.7736034970730543, "epoch": 0.48984192155306755, "grad_norm": 0.1705489307641983, "learning_rate": 8.367528444812464e-05, "loss": 0.7653, "mean_token_accuracy": 0.7801216244697571, "num_tokens": 169937094.0, "step": 5324 }, { "entropy": 0.7195946201682091, "epoch": 0.4899339279245088, "grad_norm": 0.15894073247909546, "learning_rate": 8.367221762198302e-05, "loss": 0.7032, "mean_token_accuracy": 0.793419923633337, "num_tokens": 169969111.0, "step": 5325 }, { "entropy": 0.7228182936087251, "epoch": 0.49002593429595, "grad_norm": 0.16348357498645782, "learning_rate": 8.366915079584139e-05, "loss": 0.6984, "mean_token_accuracy": 0.7956139743328094, "num_tokens": 170001109.0, "step": 5326 }, { "entropy": 0.789200821891427, "epoch": 0.4901179406673912, "grad_norm": 0.15927055478096008, "learning_rate": 8.366608396969976e-05, "loss": 0.7957, "mean_token_accuracy": 0.7659727670252323, "num_tokens": 170032824.0, "step": 5327 }, { "entropy": 0.6839047782123089, "epoch": 0.4902099470388324, "grad_norm": 0.16793055832386017, "learning_rate": 8.366301714355813e-05, "loss": 0.6747, "mean_token_accuracy": 0.7994929812848568, "num_tokens": 170065087.0, "step": 5328 }, { "entropy": 0.7993769347667694, "epoch": 0.49030195341027366, "grad_norm": 0.16473019123077393, "learning_rate": 8.365995031741651e-05, "loss": 0.8085, "mean_token_accuracy": 0.7599109522998333, "num_tokens": 170096789.0, "step": 5329 }, { "entropy": 0.7389365620911121, "epoch": 0.4903939597817149, "grad_norm": 0.1516316533088684, "learning_rate": 8.365688349127489e-05, "loss": 0.7337, "mean_token_accuracy": 0.7826805338263512, "num_tokens": 170128427.0, "step": 5330 }, { "entropy": 0.8011597860604525, "epoch": 0.4904859661531561, "grad_norm": 0.15314991772174835, "learning_rate": 8.365381666513326e-05, "loss": 0.786, "mean_token_accuracy": 0.7750254943966866, "num_tokens": 170159374.0, "step": 5331 }, { "entropy": 0.8319506645202637, "epoch": 0.49057797252459734, "grad_norm": 0.16320641338825226, "learning_rate": 8.365074983899163e-05, "loss": 0.8235, "mean_token_accuracy": 0.7664245404303074, "num_tokens": 170190539.0, "step": 5332 }, { "entropy": 0.7923352718353271, "epoch": 0.49066997889603853, "grad_norm": 0.16299836337566376, "learning_rate": 8.364768301285001e-05, "loss": 0.8113, "mean_token_accuracy": 0.7635616585612297, "num_tokens": 170222672.0, "step": 5333 }, { "entropy": 0.7411518841981888, "epoch": 0.49076198526747977, "grad_norm": 0.15562936663627625, "learning_rate": 8.364461618670837e-05, "loss": 0.7227, "mean_token_accuracy": 0.7908164672553539, "num_tokens": 170254448.0, "step": 5334 }, { "entropy": 0.7299806792289019, "epoch": 0.490853991638921, "grad_norm": 0.14832840859889984, "learning_rate": 8.364154936056676e-05, "loss": 0.7157, "mean_token_accuracy": 0.7884033657610416, "num_tokens": 170286824.0, "step": 5335 }, { "entropy": 0.7818520087748766, "epoch": 0.4909459980103622, "grad_norm": 0.1580251008272171, "learning_rate": 8.363848253442512e-05, "loss": 0.7828, "mean_token_accuracy": 0.7717399671673775, "num_tokens": 170318554.0, "step": 5336 }, { "entropy": 0.7332432605326176, "epoch": 0.49103800438180345, "grad_norm": 0.15030716359615326, "learning_rate": 8.36354157082835e-05, "loss": 0.7279, "mean_token_accuracy": 0.7825294882059097, "num_tokens": 170350517.0, "step": 5337 }, { "entropy": 0.9258831776678562, "epoch": 0.49113001075324464, "grad_norm": 0.16450072824954987, "learning_rate": 8.363234888214187e-05, "loss": 0.926, "mean_token_accuracy": 0.7369812838733196, "num_tokens": 170382502.0, "step": 5338 }, { "entropy": 0.7290662843734026, "epoch": 0.4912220171246859, "grad_norm": 0.1571861058473587, "learning_rate": 8.362928205600024e-05, "loss": 0.7147, "mean_token_accuracy": 0.7904851399362087, "num_tokens": 170414645.0, "step": 5339 }, { "entropy": 0.7581061404198408, "epoch": 0.49131402349612713, "grad_norm": 0.16303549706935883, "learning_rate": 8.362621522985862e-05, "loss": 0.7424, "mean_token_accuracy": 0.7826077155768871, "num_tokens": 170446220.0, "step": 5340 }, { "entropy": 0.8072613067924976, "epoch": 0.4914060298675683, "grad_norm": 0.15728162229061127, "learning_rate": 8.3623148403717e-05, "loss": 0.7985, "mean_token_accuracy": 0.77291439473629, "num_tokens": 170478318.0, "step": 5341 }, { "entropy": 0.7869525291025639, "epoch": 0.49149803623900956, "grad_norm": 0.15549041330814362, "learning_rate": 8.362008157757537e-05, "loss": 0.7807, "mean_token_accuracy": 0.7734658680856228, "num_tokens": 170510364.0, "step": 5342 }, { "entropy": 0.8162193447351456, "epoch": 0.49159004261045075, "grad_norm": 0.16021792590618134, "learning_rate": 8.361701475143374e-05, "loss": 0.8244, "mean_token_accuracy": 0.7645485885441303, "num_tokens": 170542562.0, "step": 5343 }, { "entropy": 0.7243175953626633, "epoch": 0.491682048981892, "grad_norm": 0.15131469070911407, "learning_rate": 8.361394792529212e-05, "loss": 0.7146, "mean_token_accuracy": 0.7874338328838348, "num_tokens": 170574587.0, "step": 5344 }, { "entropy": 0.714677007868886, "epoch": 0.49177405535333324, "grad_norm": 0.16157418489456177, "learning_rate": 8.361088109915049e-05, "loss": 0.7024, "mean_token_accuracy": 0.7936412766575813, "num_tokens": 170606022.0, "step": 5345 }, { "entropy": 0.7487196680158377, "epoch": 0.49186606172477443, "grad_norm": 0.16138139367103577, "learning_rate": 8.360781427300887e-05, "loss": 0.7392, "mean_token_accuracy": 0.7847678735852242, "num_tokens": 170638711.0, "step": 5346 }, { "entropy": 0.8109553903341293, "epoch": 0.4919580680962157, "grad_norm": 0.16558264195919037, "learning_rate": 8.360474744686724e-05, "loss": 0.8279, "mean_token_accuracy": 0.760994341224432, "num_tokens": 170670410.0, "step": 5347 }, { "entropy": 0.7934878692030907, "epoch": 0.49205007446765686, "grad_norm": 0.15727227926254272, "learning_rate": 8.360168062072562e-05, "loss": 0.7921, "mean_token_accuracy": 0.770040974020958, "num_tokens": 170702354.0, "step": 5348 }, { "entropy": 0.7492975126951933, "epoch": 0.4921420808390981, "grad_norm": 0.15374375879764557, "learning_rate": 8.359861379458399e-05, "loss": 0.7378, "mean_token_accuracy": 0.7857960313558578, "num_tokens": 170734361.0, "step": 5349 }, { "entropy": 0.7299806084483862, "epoch": 0.49223408721053935, "grad_norm": 0.15844367444515228, "learning_rate": 8.359554696844236e-05, "loss": 0.7387, "mean_token_accuracy": 0.7805391848087311, "num_tokens": 170766611.0, "step": 5350 }, { "entropy": 0.785131586715579, "epoch": 0.49232609358198054, "grad_norm": 0.15909206867218018, "learning_rate": 8.359248014230074e-05, "loss": 0.7894, "mean_token_accuracy": 0.768325112760067, "num_tokens": 170798890.0, "step": 5351 }, { "entropy": 0.7684484273195267, "epoch": 0.4924180999534218, "grad_norm": 0.16294951736927032, "learning_rate": 8.358941331615912e-05, "loss": 0.7558, "mean_token_accuracy": 0.7811664491891861, "num_tokens": 170830696.0, "step": 5352 }, { "entropy": 0.8317146580666304, "epoch": 0.492510106324863, "grad_norm": 0.16160865128040314, "learning_rate": 8.358634649001749e-05, "loss": 0.8246, "mean_token_accuracy": 0.7579181157052517, "num_tokens": 170863119.0, "step": 5353 }, { "entropy": 0.8187718074768782, "epoch": 0.4926021126963042, "grad_norm": 0.16124962270259857, "learning_rate": 8.358327966387585e-05, "loss": 0.7938, "mean_token_accuracy": 0.7641281485557556, "num_tokens": 170894832.0, "step": 5354 }, { "entropy": 0.8172686640173197, "epoch": 0.49269411906774546, "grad_norm": 0.1560146063566208, "learning_rate": 8.358021283773422e-05, "loss": 0.8093, "mean_token_accuracy": 0.7671939693391323, "num_tokens": 170926763.0, "step": 5355 }, { "entropy": 0.7173682916909456, "epoch": 0.49278612543918665, "grad_norm": 0.1677677482366562, "learning_rate": 8.357714601159262e-05, "loss": 0.7027, "mean_token_accuracy": 0.7966635785996914, "num_tokens": 170958458.0, "step": 5356 }, { "entropy": 0.8057412505149841, "epoch": 0.4928781318106279, "grad_norm": 0.1602148413658142, "learning_rate": 8.357407918545099e-05, "loss": 0.7862, "mean_token_accuracy": 0.7696907334029675, "num_tokens": 170990040.0, "step": 5357 }, { "entropy": 0.8227789960801601, "epoch": 0.4929701381820691, "grad_norm": 0.1584843248128891, "learning_rate": 8.357101235930935e-05, "loss": 0.8094, "mean_token_accuracy": 0.7617321982979774, "num_tokens": 171022328.0, "step": 5358 }, { "entropy": 0.8012432958930731, "epoch": 0.49306214455351033, "grad_norm": 0.15553541481494904, "learning_rate": 8.356794553316772e-05, "loss": 0.7775, "mean_token_accuracy": 0.771734070032835, "num_tokens": 171054443.0, "step": 5359 }, { "entropy": 0.7871726900339127, "epoch": 0.4931541509249516, "grad_norm": 0.15671464800834656, "learning_rate": 8.35648787070261e-05, "loss": 0.7723, "mean_token_accuracy": 0.771652489900589, "num_tokens": 171086331.0, "step": 5360 }, { "entropy": 0.8555128276348114, "epoch": 0.49324615729639276, "grad_norm": 0.15918618440628052, "learning_rate": 8.356181188088448e-05, "loss": 0.8308, "mean_token_accuracy": 0.7615698873996735, "num_tokens": 171118767.0, "step": 5361 }, { "entropy": 0.6796811167150736, "epoch": 0.493338163667834, "grad_norm": 0.15324363112449646, "learning_rate": 8.355874505474285e-05, "loss": 0.6555, "mean_token_accuracy": 0.8070594482123852, "num_tokens": 171150889.0, "step": 5362 }, { "entropy": 0.8044796958565712, "epoch": 0.4934301700392752, "grad_norm": 0.1522854119539261, "learning_rate": 8.355567822860122e-05, "loss": 0.7706, "mean_token_accuracy": 0.7725230827927589, "num_tokens": 171182361.0, "step": 5363 }, { "entropy": 0.8131247609853745, "epoch": 0.49352217641071644, "grad_norm": 0.15971961617469788, "learning_rate": 8.35526114024596e-05, "loss": 0.8234, "mean_token_accuracy": 0.7596108764410019, "num_tokens": 171214315.0, "step": 5364 }, { "entropy": 0.8448972348123789, "epoch": 0.4936141827821577, "grad_norm": 0.16306236386299133, "learning_rate": 8.354954457631797e-05, "loss": 0.8526, "mean_token_accuracy": 0.7508204840123653, "num_tokens": 171245870.0, "step": 5365 }, { "entropy": 0.6509686950594187, "epoch": 0.4937061891535989, "grad_norm": 0.1543567180633545, "learning_rate": 8.354647775017635e-05, "loss": 0.6516, "mean_token_accuracy": 0.8064000308513641, "num_tokens": 171278160.0, "step": 5366 }, { "entropy": 0.7360285185277462, "epoch": 0.4937981955250401, "grad_norm": 0.1575927436351776, "learning_rate": 8.354341092403472e-05, "loss": 0.7326, "mean_token_accuracy": 0.7836422584950924, "num_tokens": 171309761.0, "step": 5367 }, { "entropy": 0.7725596781820059, "epoch": 0.4938902018964813, "grad_norm": 0.16348469257354736, "learning_rate": 8.35403440978931e-05, "loss": 0.7815, "mean_token_accuracy": 0.772874753922224, "num_tokens": 171342128.0, "step": 5368 }, { "entropy": 0.8566589653491974, "epoch": 0.49398220826792255, "grad_norm": 0.16245239973068237, "learning_rate": 8.353727727175147e-05, "loss": 0.8469, "mean_token_accuracy": 0.7528105564415455, "num_tokens": 171373703.0, "step": 5369 }, { "entropy": 0.7645774967968464, "epoch": 0.4940742146393638, "grad_norm": 0.16097748279571533, "learning_rate": 8.353421044560984e-05, "loss": 0.7583, "mean_token_accuracy": 0.7764722034335136, "num_tokens": 171405457.0, "step": 5370 }, { "entropy": 0.7626279983669519, "epoch": 0.494166221010805, "grad_norm": 0.16256771981716156, "learning_rate": 8.353114361946822e-05, "loss": 0.7636, "mean_token_accuracy": 0.7757686525583267, "num_tokens": 171437349.0, "step": 5371 }, { "entropy": 0.817586038261652, "epoch": 0.49425822738224623, "grad_norm": 0.1603650599718094, "learning_rate": 8.35280767933266e-05, "loss": 0.8034, "mean_token_accuracy": 0.7649774216115475, "num_tokens": 171469263.0, "step": 5372 }, { "entropy": 0.7335409559309483, "epoch": 0.4943502337536874, "grad_norm": 0.15520086884498596, "learning_rate": 8.352500996718497e-05, "loss": 0.7052, "mean_token_accuracy": 0.7938736006617546, "num_tokens": 171501546.0, "step": 5373 }, { "entropy": 0.9644126463681459, "epoch": 0.49444224012512866, "grad_norm": 0.19047871232032776, "learning_rate": 8.352194314104333e-05, "loss": 0.9582, "mean_token_accuracy": 0.7319890074431896, "num_tokens": 171533892.0, "step": 5374 }, { "entropy": 0.7419181056320667, "epoch": 0.4945342464965699, "grad_norm": 0.15243399143218994, "learning_rate": 8.351887631490172e-05, "loss": 0.7038, "mean_token_accuracy": 0.7902919501066208, "num_tokens": 171565477.0, "step": 5375 }, { "entropy": 0.7293214686214924, "epoch": 0.4946262528680111, "grad_norm": 0.1615508496761322, "learning_rate": 8.351580948876008e-05, "loss": 0.728, "mean_token_accuracy": 0.7896228469908237, "num_tokens": 171597406.0, "step": 5376 }, { "entropy": 0.8058056533336639, "epoch": 0.49471825923945234, "grad_norm": 0.16120825707912445, "learning_rate": 8.351274266261846e-05, "loss": 0.784, "mean_token_accuracy": 0.7706853784620762, "num_tokens": 171629441.0, "step": 5377 }, { "entropy": 0.7814044635742903, "epoch": 0.49481026561089353, "grad_norm": 0.1584048718214035, "learning_rate": 8.350967583647683e-05, "loss": 0.7746, "mean_token_accuracy": 0.7754523567855358, "num_tokens": 171661208.0, "step": 5378 }, { "entropy": 0.7007419355213642, "epoch": 0.4949022719823348, "grad_norm": 0.14645954966545105, "learning_rate": 8.350660901033521e-05, "loss": 0.6907, "mean_token_accuracy": 0.7919119149446487, "num_tokens": 171693481.0, "step": 5379 }, { "entropy": 0.7744574621319771, "epoch": 0.494994278353776, "grad_norm": 0.16595372557640076, "learning_rate": 8.350354218419358e-05, "loss": 0.7801, "mean_token_accuracy": 0.7716067768633366, "num_tokens": 171724882.0, "step": 5380 }, { "entropy": 0.7201150376349688, "epoch": 0.4950862847252172, "grad_norm": 0.16340568661689758, "learning_rate": 8.350047535805195e-05, "loss": 0.729, "mean_token_accuracy": 0.7888047024607658, "num_tokens": 171756761.0, "step": 5381 }, { "entropy": 0.761959858238697, "epoch": 0.49517829109665845, "grad_norm": 0.16312260925769806, "learning_rate": 8.349740853191033e-05, "loss": 0.7675, "mean_token_accuracy": 0.7791012898087502, "num_tokens": 171788793.0, "step": 5382 }, { "entropy": 0.7072806153446436, "epoch": 0.49527029746809964, "grad_norm": 0.15895570814609528, "learning_rate": 8.349434170576871e-05, "loss": 0.6803, "mean_token_accuracy": 0.7985725551843643, "num_tokens": 171820087.0, "step": 5383 }, { "entropy": 0.7879549209028482, "epoch": 0.4953623038395409, "grad_norm": 0.15966059267520905, "learning_rate": 8.349127487962708e-05, "loss": 0.7912, "mean_token_accuracy": 0.7723772674798965, "num_tokens": 171852721.0, "step": 5384 }, { "entropy": 0.7745067607611418, "epoch": 0.49545431021098213, "grad_norm": 0.1549137979745865, "learning_rate": 8.348820805348545e-05, "loss": 0.7491, "mean_token_accuracy": 0.7799713760614395, "num_tokens": 171884813.0, "step": 5385 }, { "entropy": 0.7865660600364208, "epoch": 0.4955463165824233, "grad_norm": 0.16075140237808228, "learning_rate": 8.348514122734382e-05, "loss": 0.7785, "mean_token_accuracy": 0.7733888924121857, "num_tokens": 171915983.0, "step": 5386 }, { "entropy": 0.8098998609930277, "epoch": 0.49563832295386456, "grad_norm": 0.1613669991493225, "learning_rate": 8.34820744012022e-05, "loss": 0.7887, "mean_token_accuracy": 0.7742649018764496, "num_tokens": 171948446.0, "step": 5387 }, { "entropy": 0.7188575994223356, "epoch": 0.49573032932530575, "grad_norm": 0.14650674164295197, "learning_rate": 8.347900757506058e-05, "loss": 0.6964, "mean_token_accuracy": 0.7893833927810192, "num_tokens": 171980334.0, "step": 5388 }, { "entropy": 0.7375257518142462, "epoch": 0.495822335696747, "grad_norm": 0.1581810861825943, "learning_rate": 8.347594074891895e-05, "loss": 0.7267, "mean_token_accuracy": 0.7860930413007736, "num_tokens": 172012177.0, "step": 5389 }, { "entropy": 0.7323577962815762, "epoch": 0.49591434206818824, "grad_norm": 0.15700648725032806, "learning_rate": 8.347287392277731e-05, "loss": 0.7445, "mean_token_accuracy": 0.7813149653375149, "num_tokens": 172043675.0, "step": 5390 }, { "entropy": 0.7281894981861115, "epoch": 0.49600634843962943, "grad_norm": 0.16019320487976074, "learning_rate": 8.34698070966357e-05, "loss": 0.7387, "mean_token_accuracy": 0.7840186506509781, "num_tokens": 172074759.0, "step": 5391 }, { "entropy": 0.753687534481287, "epoch": 0.4960983548110707, "grad_norm": 0.16137902438640594, "learning_rate": 8.346674027049406e-05, "loss": 0.7548, "mean_token_accuracy": 0.7749973647296429, "num_tokens": 172106755.0, "step": 5392 }, { "entropy": 0.8238194826990366, "epoch": 0.49619036118251186, "grad_norm": 0.16655398905277252, "learning_rate": 8.346367344435245e-05, "loss": 0.8184, "mean_token_accuracy": 0.764345608651638, "num_tokens": 172139338.0, "step": 5393 }, { "entropy": 0.763019097968936, "epoch": 0.4962823675539531, "grad_norm": 0.16410624980926514, "learning_rate": 8.346060661821081e-05, "loss": 0.7716, "mean_token_accuracy": 0.7798589691519737, "num_tokens": 172171595.0, "step": 5394 }, { "entropy": 0.8207440748810768, "epoch": 0.49637437392539435, "grad_norm": 0.1531534641981125, "learning_rate": 8.34575397920692e-05, "loss": 0.79, "mean_token_accuracy": 0.766737949103117, "num_tokens": 172202660.0, "step": 5395 }, { "entropy": 0.7773783560842276, "epoch": 0.49646638029683554, "grad_norm": 0.16023550927639008, "learning_rate": 8.345447296592756e-05, "loss": 0.764, "mean_token_accuracy": 0.77473034709692, "num_tokens": 172234488.0, "step": 5396 }, { "entropy": 0.8350295312702656, "epoch": 0.4965583866682768, "grad_norm": 0.15937772393226624, "learning_rate": 8.345140613978593e-05, "loss": 0.8277, "mean_token_accuracy": 0.7658395729959011, "num_tokens": 172267157.0, "step": 5397 }, { "entropy": 0.7861018404364586, "epoch": 0.496650393039718, "grad_norm": 0.16195246577262878, "learning_rate": 8.344833931364431e-05, "loss": 0.7935, "mean_token_accuracy": 0.7721988186240196, "num_tokens": 172299021.0, "step": 5398 }, { "entropy": 0.7763461377471685, "epoch": 0.4967423994111592, "grad_norm": 0.16263467073440552, "learning_rate": 8.344527248750269e-05, "loss": 0.7683, "mean_token_accuracy": 0.7754193507134914, "num_tokens": 172331475.0, "step": 5399 }, { "entropy": 0.7207995913922787, "epoch": 0.49683440578260046, "grad_norm": 0.14975948631763458, "learning_rate": 8.344220566136106e-05, "loss": 0.6963, "mean_token_accuracy": 0.7945947051048279, "num_tokens": 172363877.0, "step": 5400 }, { "entropy": 0.7256605383008718, "epoch": 0.49692641215404165, "grad_norm": 0.1543005406856537, "learning_rate": 8.343913883521943e-05, "loss": 0.6833, "mean_token_accuracy": 0.7969504967331886, "num_tokens": 172396384.0, "step": 5401 }, { "entropy": 0.71750583127141, "epoch": 0.4970184185254829, "grad_norm": 0.15180343389511108, "learning_rate": 8.343607200907781e-05, "loss": 0.6861, "mean_token_accuracy": 0.8034474849700928, "num_tokens": 172428063.0, "step": 5402 }, { "entropy": 0.7514093983918428, "epoch": 0.4971104248969241, "grad_norm": 0.16980807483196259, "learning_rate": 8.343300518293619e-05, "loss": 0.7624, "mean_token_accuracy": 0.7768721543252468, "num_tokens": 172458637.0, "step": 5403 }, { "entropy": 0.7915403638035059, "epoch": 0.49720243126836533, "grad_norm": 0.1665991246700287, "learning_rate": 8.342993835679456e-05, "loss": 0.8177, "mean_token_accuracy": 0.7653665542602539, "num_tokens": 172490809.0, "step": 5404 }, { "entropy": 0.768559530377388, "epoch": 0.4972944376398066, "grad_norm": 0.1577337086200714, "learning_rate": 8.342687153065293e-05, "loss": 0.7802, "mean_token_accuracy": 0.7698793672025204, "num_tokens": 172523024.0, "step": 5405 }, { "entropy": 0.7885108282789588, "epoch": 0.49738644401124776, "grad_norm": 0.15705914795398712, "learning_rate": 8.342380470451131e-05, "loss": 0.7825, "mean_token_accuracy": 0.7710266523063183, "num_tokens": 172554648.0, "step": 5406 }, { "entropy": 0.750606544315815, "epoch": 0.497478450382689, "grad_norm": 0.15456226468086243, "learning_rate": 8.342073787836968e-05, "loss": 0.7413, "mean_token_accuracy": 0.7849370241165161, "num_tokens": 172586828.0, "step": 5407 }, { "entropy": 0.8338965512812138, "epoch": 0.4975704567541302, "grad_norm": 0.15957340598106384, "learning_rate": 8.341767105222806e-05, "loss": 0.7957, "mean_token_accuracy": 0.7687089182436466, "num_tokens": 172618236.0, "step": 5408 }, { "entropy": 0.6804021876305342, "epoch": 0.49766246312557144, "grad_norm": 0.16183984279632568, "learning_rate": 8.341460422608643e-05, "loss": 0.6577, "mean_token_accuracy": 0.8023249953985214, "num_tokens": 172650019.0, "step": 5409 }, { "entropy": 0.7590230591595173, "epoch": 0.4977544694970127, "grad_norm": 0.1660926342010498, "learning_rate": 8.341153739994481e-05, "loss": 0.755, "mean_token_accuracy": 0.7795537784695625, "num_tokens": 172681979.0, "step": 5410 }, { "entropy": 0.6825865767896175, "epoch": 0.4978464758684539, "grad_norm": 0.16134583950042725, "learning_rate": 8.340847057380318e-05, "loss": 0.6928, "mean_token_accuracy": 0.79880141466856, "num_tokens": 172714119.0, "step": 5411 }, { "entropy": 0.7243633158504963, "epoch": 0.4979384822398951, "grad_norm": 0.15393084287643433, "learning_rate": 8.340540374766154e-05, "loss": 0.696, "mean_token_accuracy": 0.7958606071770191, "num_tokens": 172746151.0, "step": 5412 }, { "entropy": 0.7677938174456358, "epoch": 0.4980304886113363, "grad_norm": 0.14916303753852844, "learning_rate": 8.340233692151992e-05, "loss": 0.7557, "mean_token_accuracy": 0.7786747924983501, "num_tokens": 172778525.0, "step": 5413 }, { "entropy": 0.74062036909163, "epoch": 0.49812249498277755, "grad_norm": 0.14797736704349518, "learning_rate": 8.33992700953783e-05, "loss": 0.7238, "mean_token_accuracy": 0.7830693200230598, "num_tokens": 172810892.0, "step": 5414 }, { "entropy": 0.6605751905590296, "epoch": 0.4982145013542188, "grad_norm": 0.1462940126657486, "learning_rate": 8.339620326923667e-05, "loss": 0.6734, "mean_token_accuracy": 0.802493616938591, "num_tokens": 172843072.0, "step": 5415 }, { "entropy": 0.7517594955861568, "epoch": 0.49830650772566, "grad_norm": 0.1554582417011261, "learning_rate": 8.339313644309504e-05, "loss": 0.7362, "mean_token_accuracy": 0.7836536429822445, "num_tokens": 172875213.0, "step": 5416 }, { "entropy": 0.8592077791690826, "epoch": 0.49839851409710123, "grad_norm": 0.16940149664878845, "learning_rate": 8.339006961695341e-05, "loss": 0.8666, "mean_token_accuracy": 0.7567649595439434, "num_tokens": 172907366.0, "step": 5417 }, { "entropy": 0.6859346125274897, "epoch": 0.4984905204685424, "grad_norm": 0.1490919142961502, "learning_rate": 8.338700279081179e-05, "loss": 0.6599, "mean_token_accuracy": 0.8086614646017551, "num_tokens": 172939469.0, "step": 5418 }, { "entropy": 0.8711606822907925, "epoch": 0.49858252683998366, "grad_norm": 0.16334599256515503, "learning_rate": 8.338393596467017e-05, "loss": 0.8735, "mean_token_accuracy": 0.7453362718224525, "num_tokens": 172970881.0, "step": 5419 }, { "entropy": 0.771410383284092, "epoch": 0.4986745332114249, "grad_norm": 0.16147834062576294, "learning_rate": 8.338086913852854e-05, "loss": 0.7634, "mean_token_accuracy": 0.7761236913502216, "num_tokens": 173001857.0, "step": 5420 }, { "entropy": 0.791310952976346, "epoch": 0.4987665395828661, "grad_norm": 0.15745756030082703, "learning_rate": 8.337780231238691e-05, "loss": 0.7898, "mean_token_accuracy": 0.7681823298335075, "num_tokens": 173033546.0, "step": 5421 }, { "entropy": 0.703075934201479, "epoch": 0.49885854595430734, "grad_norm": 0.16616831719875336, "learning_rate": 8.337473548624529e-05, "loss": 0.6985, "mean_token_accuracy": 0.7942847684025764, "num_tokens": 173066253.0, "step": 5422 }, { "entropy": 0.7809673622250557, "epoch": 0.49895055232574853, "grad_norm": 0.16361859440803528, "learning_rate": 8.337166866010366e-05, "loss": 0.7758, "mean_token_accuracy": 0.7704659029841423, "num_tokens": 173097919.0, "step": 5423 }, { "entropy": 0.8386838026344776, "epoch": 0.4990425586971898, "grad_norm": 0.16567979753017426, "learning_rate": 8.336860183396204e-05, "loss": 0.8336, "mean_token_accuracy": 0.7558126375079155, "num_tokens": 173129896.0, "step": 5424 }, { "entropy": 0.8547528106719255, "epoch": 0.499134565068631, "grad_norm": 0.16359993815422058, "learning_rate": 8.336553500782041e-05, "loss": 0.8292, "mean_token_accuracy": 0.7607197389006615, "num_tokens": 173161546.0, "step": 5425 }, { "entropy": 0.8487483859062195, "epoch": 0.4992265714400722, "grad_norm": 0.18711784482002258, "learning_rate": 8.336246818167879e-05, "loss": 0.854, "mean_token_accuracy": 0.7532676495611668, "num_tokens": 173192965.0, "step": 5426 }, { "entropy": 0.75078559294343, "epoch": 0.49931857781151345, "grad_norm": 0.16480225324630737, "learning_rate": 8.335940135553716e-05, "loss": 0.7523, "mean_token_accuracy": 0.7829437181353569, "num_tokens": 173224407.0, "step": 5427 }, { "entropy": 0.7175601553171873, "epoch": 0.49941058418295464, "grad_norm": 0.15829740464687347, "learning_rate": 8.335633452939552e-05, "loss": 0.7044, "mean_token_accuracy": 0.7952868677675724, "num_tokens": 173256601.0, "step": 5428 }, { "entropy": 0.6934023536741734, "epoch": 0.4995025905543959, "grad_norm": 0.15341022610664368, "learning_rate": 8.33532677032539e-05, "loss": 0.6758, "mean_token_accuracy": 0.7967083528637886, "num_tokens": 173288067.0, "step": 5429 }, { "entropy": 0.7797111375257373, "epoch": 0.49959459692583713, "grad_norm": 0.1558935046195984, "learning_rate": 8.335020087711229e-05, "loss": 0.7673, "mean_token_accuracy": 0.7771652191877365, "num_tokens": 173319740.0, "step": 5430 }, { "entropy": 0.8359079360961914, "epoch": 0.4996866032972783, "grad_norm": 0.1605812907218933, "learning_rate": 8.334713405097065e-05, "loss": 0.8008, "mean_token_accuracy": 0.768160916864872, "num_tokens": 173351631.0, "step": 5431 }, { "entropy": 0.8369604106992483, "epoch": 0.49977860966871956, "grad_norm": 0.15950432419776917, "learning_rate": 8.334406722482902e-05, "loss": 0.8235, "mean_token_accuracy": 0.7620037011802197, "num_tokens": 173383650.0, "step": 5432 }, { "entropy": 0.7693653516471386, "epoch": 0.49987061604016075, "grad_norm": 0.15215753018856049, "learning_rate": 8.33410003986874e-05, "loss": 0.7499, "mean_token_accuracy": 0.7836516499519348, "num_tokens": 173415498.0, "step": 5433 }, { "entropy": 0.7965945266187191, "epoch": 0.499962622411602, "grad_norm": 0.15906798839569092, "learning_rate": 8.333793357254579e-05, "loss": 0.7914, "mean_token_accuracy": 0.7677048295736313, "num_tokens": 173447948.0, "step": 5434 }, { "entropy": 0.8321841917932034, "epoch": 0.5000546287830432, "grad_norm": 0.17167828977108002, "learning_rate": 8.333486674640415e-05, "loss": 0.8432, "mean_token_accuracy": 0.7605916894972324, "num_tokens": 173479391.0, "step": 5435 }, { "entropy": 0.8165316469967365, "epoch": 0.5001466351544844, "grad_norm": 0.17919710278511047, "learning_rate": 8.333179992026252e-05, "loss": 0.8225, "mean_token_accuracy": 0.7625509537756443, "num_tokens": 173510424.0, "step": 5436 }, { "entropy": 0.783446529880166, "epoch": 0.5002386415259257, "grad_norm": 0.1580132246017456, "learning_rate": 8.33287330941209e-05, "loss": 0.7678, "mean_token_accuracy": 0.7797777205705643, "num_tokens": 173542603.0, "step": 5437 }, { "entropy": 0.827321657910943, "epoch": 0.5003306478973669, "grad_norm": 0.16230791807174683, "learning_rate": 8.332566626797927e-05, "loss": 0.8209, "mean_token_accuracy": 0.7597803436219692, "num_tokens": 173574615.0, "step": 5438 }, { "entropy": 0.7708566728979349, "epoch": 0.5004226542688082, "grad_norm": 0.1564946174621582, "learning_rate": 8.332259944183765e-05, "loss": 0.7362, "mean_token_accuracy": 0.7879243344068527, "num_tokens": 173606905.0, "step": 5439 }, { "entropy": 0.8045233711600304, "epoch": 0.5005146606402493, "grad_norm": 0.15192078053951263, "learning_rate": 8.331953261569602e-05, "loss": 0.7882, "mean_token_accuracy": 0.7687460146844387, "num_tokens": 173638912.0, "step": 5440 }, { "entropy": 0.8032363392412663, "epoch": 0.5006066670116905, "grad_norm": 0.15296930074691772, "learning_rate": 8.33164657895544e-05, "loss": 0.7854, "mean_token_accuracy": 0.7697148770093918, "num_tokens": 173671436.0, "step": 5441 }, { "entropy": 0.7655646670609713, "epoch": 0.5006986733831318, "grad_norm": 0.16380882263183594, "learning_rate": 8.331339896341277e-05, "loss": 0.7611, "mean_token_accuracy": 0.7799613662064075, "num_tokens": 173703657.0, "step": 5442 }, { "entropy": 0.7249550744891167, "epoch": 0.500790679754573, "grad_norm": 0.1578320860862732, "learning_rate": 8.331033213727114e-05, "loss": 0.6966, "mean_token_accuracy": 0.7913169749081135, "num_tokens": 173735497.0, "step": 5443 }, { "entropy": 0.8537628650665283, "epoch": 0.5008826861260143, "grad_norm": 0.16705453395843506, "learning_rate": 8.330726531112952e-05, "loss": 0.8446, "mean_token_accuracy": 0.7569867372512817, "num_tokens": 173768201.0, "step": 5444 }, { "entropy": 0.714986439794302, "epoch": 0.5009746924974554, "grad_norm": 0.15698587894439697, "learning_rate": 8.33041984849879e-05, "loss": 0.6988, "mean_token_accuracy": 0.7955541461706161, "num_tokens": 173800627.0, "step": 5445 }, { "entropy": 0.8453456424176693, "epoch": 0.5010666988688967, "grad_norm": 0.15917101502418518, "learning_rate": 8.330113165884627e-05, "loss": 0.8274, "mean_token_accuracy": 0.7602743022143841, "num_tokens": 173832841.0, "step": 5446 }, { "entropy": 0.731022547930479, "epoch": 0.5011587052403379, "grad_norm": 0.14856143295764923, "learning_rate": 8.329806483270464e-05, "loss": 0.7188, "mean_token_accuracy": 0.7893058955669403, "num_tokens": 173864713.0, "step": 5447 }, { "entropy": 0.723038200289011, "epoch": 0.5012507116117791, "grad_norm": 0.15102088451385498, "learning_rate": 8.3294998006563e-05, "loss": 0.7132, "mean_token_accuracy": 0.7902619168162346, "num_tokens": 173896914.0, "step": 5448 }, { "entropy": 0.7693786881864071, "epoch": 0.5013427179832204, "grad_norm": 0.15411004424095154, "learning_rate": 8.329193118042138e-05, "loss": 0.7844, "mean_token_accuracy": 0.768676646053791, "num_tokens": 173928815.0, "step": 5449 }, { "entropy": 0.7019230239093304, "epoch": 0.5014347243546615, "grad_norm": 0.1578516811132431, "learning_rate": 8.328886435427977e-05, "loss": 0.7115, "mean_token_accuracy": 0.7899069860577583, "num_tokens": 173961165.0, "step": 5450 }, { "entropy": 0.7533403113484383, "epoch": 0.5015267307261028, "grad_norm": 0.16825105249881744, "learning_rate": 8.328579752813813e-05, "loss": 0.7577, "mean_token_accuracy": 0.7798524498939514, "num_tokens": 173992801.0, "step": 5451 }, { "entropy": 0.7329448685050011, "epoch": 0.501618737097544, "grad_norm": 0.1568758338689804, "learning_rate": 8.32827307019965e-05, "loss": 0.7101, "mean_token_accuracy": 0.7916787303984165, "num_tokens": 174023758.0, "step": 5452 }, { "entropy": 0.748884386382997, "epoch": 0.5017107434689853, "grad_norm": 0.1609378308057785, "learning_rate": 8.327966387585488e-05, "loss": 0.7289, "mean_token_accuracy": 0.7862621732056141, "num_tokens": 174055270.0, "step": 5453 }, { "entropy": 0.8652287255972624, "epoch": 0.5018027498404265, "grad_norm": 0.16038835048675537, "learning_rate": 8.327659704971325e-05, "loss": 0.8711, "mean_token_accuracy": 0.7475010380148888, "num_tokens": 174086513.0, "step": 5454 }, { "entropy": 0.792159017175436, "epoch": 0.5018947562118676, "grad_norm": 0.16817092895507812, "learning_rate": 8.327353022357163e-05, "loss": 0.7968, "mean_token_accuracy": 0.7681858576834202, "num_tokens": 174118723.0, "step": 5455 }, { "entropy": 0.7931517623364925, "epoch": 0.5019867625833089, "grad_norm": 0.15109317004680634, "learning_rate": 8.327046339743e-05, "loss": 0.7776, "mean_token_accuracy": 0.7711290381848812, "num_tokens": 174151097.0, "step": 5456 }, { "entropy": 0.7876989245414734, "epoch": 0.5020787689547501, "grad_norm": 0.1588999629020691, "learning_rate": 8.326739657128838e-05, "loss": 0.7714, "mean_token_accuracy": 0.7725328132510185, "num_tokens": 174182793.0, "step": 5457 }, { "entropy": 0.8066707383841276, "epoch": 0.5021707753261914, "grad_norm": 0.1558055579662323, "learning_rate": 8.326432974514675e-05, "loss": 0.7912, "mean_token_accuracy": 0.77005984634161, "num_tokens": 174215561.0, "step": 5458 }, { "entropy": 0.8668371625244617, "epoch": 0.5022627816976326, "grad_norm": 0.17107869684696198, "learning_rate": 8.326126291900512e-05, "loss": 0.8543, "mean_token_accuracy": 0.7572713010013103, "num_tokens": 174247327.0, "step": 5459 }, { "entropy": 0.7310237158089876, "epoch": 0.5023547880690737, "grad_norm": 0.15770605206489563, "learning_rate": 8.32581960928635e-05, "loss": 0.7116, "mean_token_accuracy": 0.7911750599741936, "num_tokens": 174279650.0, "step": 5460 }, { "entropy": 0.8546728231012821, "epoch": 0.502446794440515, "grad_norm": 0.15958642959594727, "learning_rate": 8.325512926672188e-05, "loss": 0.8347, "mean_token_accuracy": 0.755575992166996, "num_tokens": 174311440.0, "step": 5461 }, { "entropy": 0.8476290125399828, "epoch": 0.5025388008119562, "grad_norm": 0.15710870921611786, "learning_rate": 8.325206244058025e-05, "loss": 0.8564, "mean_token_accuracy": 0.7551259882748127, "num_tokens": 174343946.0, "step": 5462 }, { "entropy": 0.6886413358151913, "epoch": 0.5026308071833975, "grad_norm": 0.1527508795261383, "learning_rate": 8.324899561443862e-05, "loss": 0.6651, "mean_token_accuracy": 0.8057761117815971, "num_tokens": 174375566.0, "step": 5463 }, { "entropy": 0.7198618315160275, "epoch": 0.5027228135548387, "grad_norm": 0.16014787554740906, "learning_rate": 8.3245928788297e-05, "loss": 0.7125, "mean_token_accuracy": 0.7849789261817932, "num_tokens": 174408152.0, "step": 5464 }, { "entropy": 0.8484123609960079, "epoch": 0.5028148199262799, "grad_norm": 0.1637634038925171, "learning_rate": 8.324286196215537e-05, "loss": 0.8533, "mean_token_accuracy": 0.7504561208188534, "num_tokens": 174440415.0, "step": 5465 }, { "entropy": 0.7623932138085365, "epoch": 0.5029068262977211, "grad_norm": 0.15930840373039246, "learning_rate": 8.323979513601375e-05, "loss": 0.7558, "mean_token_accuracy": 0.7783086486160755, "num_tokens": 174472497.0, "step": 5466 }, { "entropy": 0.8460042718797922, "epoch": 0.5029988326691623, "grad_norm": 0.16827435791492462, "learning_rate": 8.323672830987212e-05, "loss": 0.8449, "mean_token_accuracy": 0.7524569556117058, "num_tokens": 174503699.0, "step": 5467 }, { "entropy": 0.6993048638105392, "epoch": 0.5030908390406036, "grad_norm": 0.1634429693222046, "learning_rate": 8.32336614837305e-05, "loss": 0.6766, "mean_token_accuracy": 0.8002345189452171, "num_tokens": 174535592.0, "step": 5468 }, { "entropy": 0.8685693964362144, "epoch": 0.5031828454120448, "grad_norm": 0.16333332657814026, "learning_rate": 8.323059465758886e-05, "loss": 0.85, "mean_token_accuracy": 0.752197228372097, "num_tokens": 174567893.0, "step": 5469 }, { "entropy": 0.6913311798125505, "epoch": 0.503274851783486, "grad_norm": 0.1508670151233673, "learning_rate": 8.322752783144723e-05, "loss": 0.6801, "mean_token_accuracy": 0.7944161705672741, "num_tokens": 174600048.0, "step": 5470 }, { "entropy": 0.7733440808951855, "epoch": 0.5033668581549272, "grad_norm": 0.16022346913814545, "learning_rate": 8.322446100530561e-05, "loss": 0.7721, "mean_token_accuracy": 0.77123898640275, "num_tokens": 174632103.0, "step": 5471 }, { "entropy": 0.6205370165407658, "epoch": 0.5034588645263685, "grad_norm": 0.1527452915906906, "learning_rate": 8.3221394179164e-05, "loss": 0.5967, "mean_token_accuracy": 0.8224657289683819, "num_tokens": 174663586.0, "step": 5472 }, { "entropy": 0.712224131450057, "epoch": 0.5035508708978097, "grad_norm": 0.1549619734287262, "learning_rate": 8.321832735302236e-05, "loss": 0.7084, "mean_token_accuracy": 0.7917978577315807, "num_tokens": 174696172.0, "step": 5473 }, { "entropy": 0.8061850350350142, "epoch": 0.5036428772692509, "grad_norm": 0.16314160823822021, "learning_rate": 8.321526052688073e-05, "loss": 0.7806, "mean_token_accuracy": 0.7719548307359219, "num_tokens": 174728042.0, "step": 5474 }, { "entropy": 0.7275212984532118, "epoch": 0.5037348836406921, "grad_norm": 0.16687346994876862, "learning_rate": 8.32121937007391e-05, "loss": 0.7257, "mean_token_accuracy": 0.7892970144748688, "num_tokens": 174759885.0, "step": 5475 }, { "entropy": 0.7252771779894829, "epoch": 0.5038268900121333, "grad_norm": 0.14994624257087708, "learning_rate": 8.32091268745975e-05, "loss": 0.6893, "mean_token_accuracy": 0.7890426255762577, "num_tokens": 174790707.0, "step": 5476 }, { "entropy": 0.8684570603072643, "epoch": 0.5039188963835746, "grad_norm": 0.16880621016025543, "learning_rate": 8.320606004845586e-05, "loss": 0.8653, "mean_token_accuracy": 0.7509827017784119, "num_tokens": 174822736.0, "step": 5477 }, { "entropy": 0.7341880779713392, "epoch": 0.5040109027550158, "grad_norm": 0.15764853358268738, "learning_rate": 8.320299322231423e-05, "loss": 0.714, "mean_token_accuracy": 0.7891422174870968, "num_tokens": 174854436.0, "step": 5478 }, { "entropy": 0.8223336655646563, "epoch": 0.504102909126457, "grad_norm": 0.16335438191890717, "learning_rate": 8.31999263961726e-05, "loss": 0.8091, "mean_token_accuracy": 0.7622214891016483, "num_tokens": 174886965.0, "step": 5479 }, { "entropy": 0.6825045011937618, "epoch": 0.5041949154978982, "grad_norm": 0.15394768118858337, "learning_rate": 8.319685957003098e-05, "loss": 0.6584, "mean_token_accuracy": 0.8082954324781895, "num_tokens": 174919234.0, "step": 5480 }, { "entropy": 0.7519105058163404, "epoch": 0.5042869218693394, "grad_norm": 0.14855188131332397, "learning_rate": 8.319379274388936e-05, "loss": 0.7448, "mean_token_accuracy": 0.782484881579876, "num_tokens": 174951244.0, "step": 5481 }, { "entropy": 0.9033338241279125, "epoch": 0.5043789282407807, "grad_norm": 0.16802158951759338, "learning_rate": 8.319072591774773e-05, "loss": 0.9037, "mean_token_accuracy": 0.7424999475479126, "num_tokens": 174983521.0, "step": 5482 }, { "entropy": 0.8157029561698437, "epoch": 0.5044709346122219, "grad_norm": 0.15882770717144012, "learning_rate": 8.31876590916061e-05, "loss": 0.8072, "mean_token_accuracy": 0.7630610354244709, "num_tokens": 175014672.0, "step": 5483 }, { "entropy": 0.7260832097381353, "epoch": 0.5045629409836632, "grad_norm": 0.15120424330234528, "learning_rate": 8.318459226546448e-05, "loss": 0.7145, "mean_token_accuracy": 0.7914022989571095, "num_tokens": 175046666.0, "step": 5484 }, { "entropy": 0.7913651838898659, "epoch": 0.5046549473551043, "grad_norm": 0.16018453240394592, "learning_rate": 8.318152543932285e-05, "loss": 0.7958, "mean_token_accuracy": 0.7690196856856346, "num_tokens": 175078032.0, "step": 5485 }, { "entropy": 0.6706576589494944, "epoch": 0.5047469537265455, "grad_norm": 0.15442179143428802, "learning_rate": 8.317845861318123e-05, "loss": 0.6527, "mean_token_accuracy": 0.8050585575401783, "num_tokens": 175110771.0, "step": 5486 }, { "entropy": 0.659272987395525, "epoch": 0.5048389600979868, "grad_norm": 0.15473723411560059, "learning_rate": 8.31753917870396e-05, "loss": 0.6558, "mean_token_accuracy": 0.8056056387722492, "num_tokens": 175143027.0, "step": 5487 }, { "entropy": 0.7209903001785278, "epoch": 0.504930966469428, "grad_norm": 0.16235700249671936, "learning_rate": 8.317232496089798e-05, "loss": 0.6993, "mean_token_accuracy": 0.7925171442329884, "num_tokens": 175175044.0, "step": 5488 }, { "entropy": 0.9283970519900322, "epoch": 0.5050229728408693, "grad_norm": 0.1702759712934494, "learning_rate": 8.316925813475634e-05, "loss": 0.9323, "mean_token_accuracy": 0.7376643009483814, "num_tokens": 175206397.0, "step": 5489 }, { "entropy": 0.8011667691171169, "epoch": 0.5051149792123104, "grad_norm": 0.1624530851840973, "learning_rate": 8.316619130861471e-05, "loss": 0.7866, "mean_token_accuracy": 0.7704578079283237, "num_tokens": 175238191.0, "step": 5490 }, { "entropy": 0.8218264970928431, "epoch": 0.5052069855837517, "grad_norm": 0.15165385603904724, "learning_rate": 8.316312448247309e-05, "loss": 0.7848, "mean_token_accuracy": 0.7754538357257843, "num_tokens": 175270345.0, "step": 5491 }, { "entropy": 0.7173209246248007, "epoch": 0.5052989919551929, "grad_norm": 0.15687821805477142, "learning_rate": 8.316005765633147e-05, "loss": 0.7107, "mean_token_accuracy": 0.7917746156454086, "num_tokens": 175302733.0, "step": 5492 }, { "entropy": 0.8604523688554764, "epoch": 0.5053909983266341, "grad_norm": 0.16326165199279785, "learning_rate": 8.315699083018984e-05, "loss": 0.8539, "mean_token_accuracy": 0.7515549696981907, "num_tokens": 175333555.0, "step": 5493 }, { "entropy": 0.8896865993738174, "epoch": 0.5054830046980754, "grad_norm": 0.1661350578069687, "learning_rate": 8.315392400404821e-05, "loss": 0.8877, "mean_token_accuracy": 0.744792990386486, "num_tokens": 175363948.0, "step": 5494 }, { "entropy": 0.8506352603435516, "epoch": 0.5055750110695165, "grad_norm": 0.15729448199272156, "learning_rate": 8.315085717790659e-05, "loss": 0.8314, "mean_token_accuracy": 0.759013470262289, "num_tokens": 175396359.0, "step": 5495 }, { "entropy": 0.829635314643383, "epoch": 0.5056670174409578, "grad_norm": 0.15934287011623383, "learning_rate": 8.314779035176496e-05, "loss": 0.8257, "mean_token_accuracy": 0.7608772106468678, "num_tokens": 175428860.0, "step": 5496 }, { "entropy": 0.8254042454063892, "epoch": 0.505759023812399, "grad_norm": 0.16357320547103882, "learning_rate": 8.314472352562334e-05, "loss": 0.8377, "mean_token_accuracy": 0.7558125592768192, "num_tokens": 175459526.0, "step": 5497 }, { "entropy": 0.8497141040861607, "epoch": 0.5058510301838403, "grad_norm": 0.1592991054058075, "learning_rate": 8.314165669948171e-05, "loss": 0.8414, "mean_token_accuracy": 0.7509512826800346, "num_tokens": 175491965.0, "step": 5498 }, { "entropy": 0.8233323059976101, "epoch": 0.5059430365552815, "grad_norm": 0.15654486417770386, "learning_rate": 8.313858987334009e-05, "loss": 0.8231, "mean_token_accuracy": 0.7624205946922302, "num_tokens": 175523144.0, "step": 5499 }, { "entropy": 0.7174621121957898, "epoch": 0.5060350429267226, "grad_norm": 0.15525180101394653, "learning_rate": 8.313552304719846e-05, "loss": 0.7265, "mean_token_accuracy": 0.787843719124794, "num_tokens": 175555365.0, "step": 5500 }, { "entropy": 0.7978239990770817, "epoch": 0.5061270492981639, "grad_norm": 0.16789203882217407, "learning_rate": 8.313245622105683e-05, "loss": 0.8106, "mean_token_accuracy": 0.7679928615689278, "num_tokens": 175587660.0, "step": 5501 }, { "entropy": 0.789627630263567, "epoch": 0.5062190556696051, "grad_norm": 0.16265805065631866, "learning_rate": 8.312938939491521e-05, "loss": 0.7855, "mean_token_accuracy": 0.7731609866023064, "num_tokens": 175620117.0, "step": 5502 }, { "entropy": 0.7870524767786264, "epoch": 0.5063110620410464, "grad_norm": 0.15362109243869781, "learning_rate": 8.312632256877359e-05, "loss": 0.7725, "mean_token_accuracy": 0.7721034549176693, "num_tokens": 175652048.0, "step": 5503 }, { "entropy": 0.7079046256840229, "epoch": 0.5064030684124876, "grad_norm": 0.14617502689361572, "learning_rate": 8.312325574263196e-05, "loss": 0.672, "mean_token_accuracy": 0.8002140074968338, "num_tokens": 175684351.0, "step": 5504 }, { "entropy": 0.6972979158163071, "epoch": 0.5064950747839287, "grad_norm": 0.15595321357250214, "learning_rate": 8.312018891649032e-05, "loss": 0.6863, "mean_token_accuracy": 0.8003223463892937, "num_tokens": 175716398.0, "step": 5505 }, { "entropy": 0.7678371770307422, "epoch": 0.50658708115537, "grad_norm": 0.1591530740261078, "learning_rate": 8.311712209034869e-05, "loss": 0.7336, "mean_token_accuracy": 0.782371561974287, "num_tokens": 175747958.0, "step": 5506 }, { "entropy": 0.8163204994052649, "epoch": 0.5066790875268112, "grad_norm": 0.1659257709980011, "learning_rate": 8.311405526420707e-05, "loss": 0.8228, "mean_token_accuracy": 0.761160958558321, "num_tokens": 175779651.0, "step": 5507 }, { "entropy": 0.8071562740951777, "epoch": 0.5067710938982525, "grad_norm": 0.15572895109653473, "learning_rate": 8.311098843806546e-05, "loss": 0.7843, "mean_token_accuracy": 0.7700122371315956, "num_tokens": 175810951.0, "step": 5508 }, { "entropy": 0.8382457233965397, "epoch": 0.5068631002696937, "grad_norm": 0.15699738264083862, "learning_rate": 8.310792161192382e-05, "loss": 0.8432, "mean_token_accuracy": 0.7531238980591297, "num_tokens": 175843417.0, "step": 5509 }, { "entropy": 0.6933073550462723, "epoch": 0.5069551066411349, "grad_norm": 0.14830955862998962, "learning_rate": 8.310485478578219e-05, "loss": 0.6732, "mean_token_accuracy": 0.7971892133355141, "num_tokens": 175875547.0, "step": 5510 }, { "entropy": 0.7201114483177662, "epoch": 0.5070471130125761, "grad_norm": 0.16632261872291565, "learning_rate": 8.310178795964057e-05, "loss": 0.715, "mean_token_accuracy": 0.7933923751115799, "num_tokens": 175907514.0, "step": 5511 }, { "entropy": 0.7813945021480322, "epoch": 0.5071391193840173, "grad_norm": 0.1530279517173767, "learning_rate": 8.309872113349894e-05, "loss": 0.776, "mean_token_accuracy": 0.7739329040050507, "num_tokens": 175939598.0, "step": 5512 }, { "entropy": 0.6786966938525438, "epoch": 0.5072311257554586, "grad_norm": 0.15147055685520172, "learning_rate": 8.309565430735732e-05, "loss": 0.6708, "mean_token_accuracy": 0.7970148921012878, "num_tokens": 175971626.0, "step": 5513 }, { "entropy": 0.8485359214246273, "epoch": 0.5073231321268998, "grad_norm": 0.15953569114208221, "learning_rate": 8.309258748121569e-05, "loss": 0.8456, "mean_token_accuracy": 0.7545517906546593, "num_tokens": 176004101.0, "step": 5514 }, { "entropy": 0.7949788942933083, "epoch": 0.507415138498341, "grad_norm": 0.16350263357162476, "learning_rate": 8.308952065507407e-05, "loss": 0.7937, "mean_token_accuracy": 0.771148469299078, "num_tokens": 176036127.0, "step": 5515 }, { "entropy": 0.7973892856389284, "epoch": 0.5075071448697822, "grad_norm": 0.16603946685791016, "learning_rate": 8.308645382893244e-05, "loss": 0.7882, "mean_token_accuracy": 0.770672932267189, "num_tokens": 176067852.0, "step": 5516 }, { "entropy": 0.8583617620170116, "epoch": 0.5075991512412235, "grad_norm": 0.16477489471435547, "learning_rate": 8.30833870027908e-05, "loss": 0.8477, "mean_token_accuracy": 0.7572463415563107, "num_tokens": 176100616.0, "step": 5517 }, { "entropy": 0.7776118330657482, "epoch": 0.5076911576126647, "grad_norm": 0.1527763158082962, "learning_rate": 8.308032017664919e-05, "loss": 0.7845, "mean_token_accuracy": 0.7681157290935516, "num_tokens": 176132792.0, "step": 5518 }, { "entropy": 0.7247757278382778, "epoch": 0.507783163984106, "grad_norm": 0.15946267545223236, "learning_rate": 8.307725335050757e-05, "loss": 0.7095, "mean_token_accuracy": 0.7921487614512444, "num_tokens": 176164985.0, "step": 5519 }, { "entropy": 0.8771599940955639, "epoch": 0.5078751703555471, "grad_norm": 0.16367687284946442, "learning_rate": 8.307418652436594e-05, "loss": 0.8762, "mean_token_accuracy": 0.7480034604668617, "num_tokens": 176197606.0, "step": 5520 }, { "entropy": 0.7251776531338692, "epoch": 0.5079671767269883, "grad_norm": 0.15520718693733215, "learning_rate": 8.30711196982243e-05, "loss": 0.6954, "mean_token_accuracy": 0.7998888678848743, "num_tokens": 176229341.0, "step": 5521 }, { "entropy": 0.649249317124486, "epoch": 0.5080591830984296, "grad_norm": 0.16396181285381317, "learning_rate": 8.306805287208269e-05, "loss": 0.6417, "mean_token_accuracy": 0.8104956857860088, "num_tokens": 176261427.0, "step": 5522 }, { "entropy": 0.8459358792752028, "epoch": 0.5081511894698708, "grad_norm": 0.15811583399772644, "learning_rate": 8.306498604594107e-05, "loss": 0.8339, "mean_token_accuracy": 0.7572004422545433, "num_tokens": 176293703.0, "step": 5523 }, { "entropy": 0.7392279580235481, "epoch": 0.5082431958413121, "grad_norm": 0.15880708396434784, "learning_rate": 8.306191921979944e-05, "loss": 0.7132, "mean_token_accuracy": 0.7897025719285011, "num_tokens": 176325835.0, "step": 5524 }, { "entropy": 0.8143600802868605, "epoch": 0.5083352022127532, "grad_norm": 0.1635875254869461, "learning_rate": 8.30588523936578e-05, "loss": 0.8155, "mean_token_accuracy": 0.7650389038026333, "num_tokens": 176357713.0, "step": 5525 }, { "entropy": 0.8350079394876957, "epoch": 0.5084272085841944, "grad_norm": 0.16685576736927032, "learning_rate": 8.305578556751619e-05, "loss": 0.8316, "mean_token_accuracy": 0.7599197998642921, "num_tokens": 176389058.0, "step": 5526 }, { "entropy": 0.7092581149190664, "epoch": 0.5085192149556357, "grad_norm": 0.15565289556980133, "learning_rate": 8.305271874137455e-05, "loss": 0.703, "mean_token_accuracy": 0.7932594642043114, "num_tokens": 176420692.0, "step": 5527 }, { "entropy": 0.7565216962248087, "epoch": 0.5086112213270769, "grad_norm": 0.15996073186397552, "learning_rate": 8.304965191523293e-05, "loss": 0.7377, "mean_token_accuracy": 0.7830419279634953, "num_tokens": 176451477.0, "step": 5528 }, { "entropy": 0.7763148043304682, "epoch": 0.5087032276985182, "grad_norm": 0.16250579059123993, "learning_rate": 8.30465850890913e-05, "loss": 0.7369, "mean_token_accuracy": 0.7838722765445709, "num_tokens": 176483573.0, "step": 5529 }, { "entropy": 0.7382165491580963, "epoch": 0.5087952340699593, "grad_norm": 0.15387144684791565, "learning_rate": 8.304351826294968e-05, "loss": 0.7264, "mean_token_accuracy": 0.7853610292077065, "num_tokens": 176515722.0, "step": 5530 }, { "entropy": 0.7636826001107693, "epoch": 0.5088872404414005, "grad_norm": 0.15445475280284882, "learning_rate": 8.304045143680805e-05, "loss": 0.7591, "mean_token_accuracy": 0.7762582786381245, "num_tokens": 176548467.0, "step": 5531 }, { "entropy": 0.8285907711833715, "epoch": 0.5089792468128418, "grad_norm": 0.1682598888874054, "learning_rate": 8.303738461066642e-05, "loss": 0.8087, "mean_token_accuracy": 0.7652899362146854, "num_tokens": 176579459.0, "step": 5532 }, { "entropy": 0.8641696497797966, "epoch": 0.509071253184283, "grad_norm": 0.15965542197227478, "learning_rate": 8.30343177845248e-05, "loss": 0.8448, "mean_token_accuracy": 0.7518090195953846, "num_tokens": 176611408.0, "step": 5533 }, { "entropy": 0.6827845126390457, "epoch": 0.5091632595557243, "grad_norm": 0.1561804562807083, "learning_rate": 8.303125095838318e-05, "loss": 0.6842, "mean_token_accuracy": 0.8003296852111816, "num_tokens": 176643029.0, "step": 5534 }, { "entropy": 0.8176420349627733, "epoch": 0.5092552659271654, "grad_norm": 0.15994824469089508, "learning_rate": 8.302818413224155e-05, "loss": 0.8185, "mean_token_accuracy": 0.7648954391479492, "num_tokens": 176675230.0, "step": 5535 }, { "entropy": 0.8838024083524942, "epoch": 0.5093472722986067, "grad_norm": 0.16821491718292236, "learning_rate": 8.302511730609992e-05, "loss": 0.8692, "mean_token_accuracy": 0.7531268671154976, "num_tokens": 176706287.0, "step": 5536 }, { "entropy": 0.7119543291628361, "epoch": 0.5094392786700479, "grad_norm": 0.15352053940296173, "learning_rate": 8.302205047995829e-05, "loss": 0.702, "mean_token_accuracy": 0.7956056110560894, "num_tokens": 176737970.0, "step": 5537 }, { "entropy": 0.9047817662358284, "epoch": 0.5095312850414891, "grad_norm": 0.16015635430812836, "learning_rate": 8.301898365381667e-05, "loss": 0.9024, "mean_token_accuracy": 0.7417936995625496, "num_tokens": 176770505.0, "step": 5538 }, { "entropy": 0.7850410230457783, "epoch": 0.5096232914129304, "grad_norm": 0.1675969660282135, "learning_rate": 8.301591682767505e-05, "loss": 0.7791, "mean_token_accuracy": 0.7742532789707184, "num_tokens": 176802484.0, "step": 5539 }, { "entropy": 0.9063535146415234, "epoch": 0.5097152977843715, "grad_norm": 0.16024494171142578, "learning_rate": 8.301285000153342e-05, "loss": 0.893, "mean_token_accuracy": 0.741123616695404, "num_tokens": 176834510.0, "step": 5540 }, { "entropy": 0.8090183828026056, "epoch": 0.5098073041558128, "grad_norm": 0.16785728931427002, "learning_rate": 8.300978317539178e-05, "loss": 0.8085, "mean_token_accuracy": 0.7652606777846813, "num_tokens": 176866365.0, "step": 5541 }, { "entropy": 0.7362632323056459, "epoch": 0.509899310527254, "grad_norm": 0.1466924101114273, "learning_rate": 8.300671634925017e-05, "loss": 0.7167, "mean_token_accuracy": 0.7852442488074303, "num_tokens": 176898446.0, "step": 5542 }, { "entropy": 0.9371532835066319, "epoch": 0.5099913168986953, "grad_norm": 0.16720086336135864, "learning_rate": 8.300364952310853e-05, "loss": 0.9265, "mean_token_accuracy": 0.7347133420407772, "num_tokens": 176930362.0, "step": 5543 }, { "entropy": 0.6827549040317535, "epoch": 0.5100833232701365, "grad_norm": 0.1618349254131317, "learning_rate": 8.300058269696692e-05, "loss": 0.6642, "mean_token_accuracy": 0.800431240350008, "num_tokens": 176962269.0, "step": 5544 }, { "entropy": 0.7027998585253954, "epoch": 0.5101753296415776, "grad_norm": 0.15820544958114624, "learning_rate": 8.299751587082528e-05, "loss": 0.6938, "mean_token_accuracy": 0.7953569814562798, "num_tokens": 176993929.0, "step": 5545 }, { "entropy": 0.731325825676322, "epoch": 0.5102673360130189, "grad_norm": 0.15065163373947144, "learning_rate": 8.299444904468366e-05, "loss": 0.7081, "mean_token_accuracy": 0.7916214428842068, "num_tokens": 177026588.0, "step": 5546 }, { "entropy": 0.6671143863350153, "epoch": 0.5103593423844601, "grad_norm": 0.1547168642282486, "learning_rate": 8.299138221854203e-05, "loss": 0.6656, "mean_token_accuracy": 0.8049458600580692, "num_tokens": 177058380.0, "step": 5547 }, { "entropy": 0.8802124932408333, "epoch": 0.5104513487559014, "grad_norm": 0.16162732243537903, "learning_rate": 8.29883153924004e-05, "loss": 0.8552, "mean_token_accuracy": 0.7567197978496552, "num_tokens": 177090577.0, "step": 5548 }, { "entropy": 0.7440163195133209, "epoch": 0.5105433551273426, "grad_norm": 0.15546099841594696, "learning_rate": 8.298524856625878e-05, "loss": 0.7299, "mean_token_accuracy": 0.7861608974635601, "num_tokens": 177121949.0, "step": 5549 }, { "entropy": 0.8086006678640842, "epoch": 0.5106353614987837, "grad_norm": 0.16184239089488983, "learning_rate": 8.298218174011716e-05, "loss": 0.7851, "mean_token_accuracy": 0.7712105326354504, "num_tokens": 177154131.0, "step": 5550 }, { "entropy": 0.7903521843254566, "epoch": 0.510727367870225, "grad_norm": 0.16253960132598877, "learning_rate": 8.297911491397553e-05, "loss": 0.7681, "mean_token_accuracy": 0.7774410285055637, "num_tokens": 177186153.0, "step": 5551 }, { "entropy": 0.7394989263266325, "epoch": 0.5108193742416662, "grad_norm": 0.1589343547821045, "learning_rate": 8.29760480878339e-05, "loss": 0.7287, "mean_token_accuracy": 0.7859515137970448, "num_tokens": 177217534.0, "step": 5552 }, { "entropy": 0.7481295671314001, "epoch": 0.5109113806131075, "grad_norm": 0.1498357355594635, "learning_rate": 8.297298126169228e-05, "loss": 0.7347, "mean_token_accuracy": 0.7848804593086243, "num_tokens": 177249430.0, "step": 5553 }, { "entropy": 0.7883544079959393, "epoch": 0.5110033869845487, "grad_norm": 0.15654593706130981, "learning_rate": 8.296991443555066e-05, "loss": 0.7782, "mean_token_accuracy": 0.7710218764841557, "num_tokens": 177281647.0, "step": 5554 }, { "entropy": 0.7791575994342566, "epoch": 0.5110953933559899, "grad_norm": 0.15643994510173798, "learning_rate": 8.296684760940903e-05, "loss": 0.7735, "mean_token_accuracy": 0.7727659344673157, "num_tokens": 177314044.0, "step": 5555 }, { "entropy": 0.776557588018477, "epoch": 0.5111873997274311, "grad_norm": 0.16437825560569763, "learning_rate": 8.29637807832674e-05, "loss": 0.7721, "mean_token_accuracy": 0.7795406505465508, "num_tokens": 177346125.0, "step": 5556 }, { "entropy": 0.7091040629893541, "epoch": 0.5112794060988723, "grad_norm": 0.1639096587896347, "learning_rate": 8.296071395712578e-05, "loss": 0.7202, "mean_token_accuracy": 0.7873759493231773, "num_tokens": 177378117.0, "step": 5557 }, { "entropy": 0.7194349057972431, "epoch": 0.5113714124703136, "grad_norm": 0.1610925942659378, "learning_rate": 8.295764713098415e-05, "loss": 0.7181, "mean_token_accuracy": 0.7890763655304909, "num_tokens": 177410794.0, "step": 5558 }, { "entropy": 0.7043355498462915, "epoch": 0.5114634188417548, "grad_norm": 0.1628619134426117, "learning_rate": 8.295458030484253e-05, "loss": 0.7006, "mean_token_accuracy": 0.7978890128433704, "num_tokens": 177442052.0, "step": 5559 }, { "entropy": 0.7825636845082045, "epoch": 0.511555425213196, "grad_norm": 0.1836622953414917, "learning_rate": 8.29515134787009e-05, "loss": 0.7986, "mean_token_accuracy": 0.7679179608821869, "num_tokens": 177472973.0, "step": 5560 }, { "entropy": 0.7737556714564562, "epoch": 0.5116474315846372, "grad_norm": 0.15530718863010406, "learning_rate": 8.294844665255928e-05, "loss": 0.7542, "mean_token_accuracy": 0.780400063842535, "num_tokens": 177504931.0, "step": 5561 }, { "entropy": 0.7786627374589443, "epoch": 0.5117394379560785, "grad_norm": 0.16296736896038055, "learning_rate": 8.294537982641765e-05, "loss": 0.7722, "mean_token_accuracy": 0.7754708491265774, "num_tokens": 177535573.0, "step": 5562 }, { "entropy": 0.7252042964100838, "epoch": 0.5118314443275197, "grad_norm": 0.16052228212356567, "learning_rate": 8.294231300027601e-05, "loss": 0.6912, "mean_token_accuracy": 0.7934496402740479, "num_tokens": 177566993.0, "step": 5563 }, { "entropy": 0.8092333786189556, "epoch": 0.511923450698961, "grad_norm": 0.1567164808511734, "learning_rate": 8.29392461741344e-05, "loss": 0.8105, "mean_token_accuracy": 0.7618262320756912, "num_tokens": 177599123.0, "step": 5564 }, { "entropy": 0.7739488389343023, "epoch": 0.5120154570704021, "grad_norm": 0.16455404460430145, "learning_rate": 8.293617934799278e-05, "loss": 0.7833, "mean_token_accuracy": 0.7708249539136887, "num_tokens": 177631241.0, "step": 5565 }, { "entropy": 0.8040903322398663, "epoch": 0.5121074634418433, "grad_norm": 0.16365380585193634, "learning_rate": 8.293311252185114e-05, "loss": 0.7744, "mean_token_accuracy": 0.7730717286467552, "num_tokens": 177662746.0, "step": 5566 }, { "entropy": 0.7572248391807079, "epoch": 0.5121994698132846, "grad_norm": 0.1535940021276474, "learning_rate": 8.293004569570951e-05, "loss": 0.745, "mean_token_accuracy": 0.777117021381855, "num_tokens": 177694857.0, "step": 5567 }, { "entropy": 0.6850102227181196, "epoch": 0.5122914761847258, "grad_norm": 0.14632059633731842, "learning_rate": 8.292697886956788e-05, "loss": 0.663, "mean_token_accuracy": 0.8017014861106873, "num_tokens": 177726207.0, "step": 5568 }, { "entropy": 0.7620980739593506, "epoch": 0.5123834825561671, "grad_norm": 0.16246621310710907, "learning_rate": 8.292391204342626e-05, "loss": 0.7584, "mean_token_accuracy": 0.7774077542126179, "num_tokens": 177757497.0, "step": 5569 }, { "entropy": 0.7720983289182186, "epoch": 0.5124754889276082, "grad_norm": 0.14979298412799835, "learning_rate": 8.292084521728464e-05, "loss": 0.7544, "mean_token_accuracy": 0.7789630405604839, "num_tokens": 177789720.0, "step": 5570 }, { "entropy": 0.857785239815712, "epoch": 0.5125674952990494, "grad_norm": 0.16321483254432678, "learning_rate": 8.291777839114301e-05, "loss": 0.8587, "mean_token_accuracy": 0.750673696398735, "num_tokens": 177821721.0, "step": 5571 }, { "entropy": 0.7526744231581688, "epoch": 0.5126595016704907, "grad_norm": 0.16043740510940552, "learning_rate": 8.291471156500138e-05, "loss": 0.7428, "mean_token_accuracy": 0.7765586599707603, "num_tokens": 177853304.0, "step": 5572 }, { "entropy": 0.7225708533078432, "epoch": 0.5127515080419319, "grad_norm": 0.15786625444889069, "learning_rate": 8.291164473885976e-05, "loss": 0.722, "mean_token_accuracy": 0.7880221717059612, "num_tokens": 177885204.0, "step": 5573 }, { "entropy": 0.8323086593300104, "epoch": 0.5128435144133732, "grad_norm": 0.1601814180612564, "learning_rate": 8.290857791271813e-05, "loss": 0.8252, "mean_token_accuracy": 0.7609341107308865, "num_tokens": 177917544.0, "step": 5574 }, { "entropy": 0.7358943689614534, "epoch": 0.5129355207848143, "grad_norm": 0.16314977407455444, "learning_rate": 8.290551108657651e-05, "loss": 0.728, "mean_token_accuracy": 0.7905942611396313, "num_tokens": 177949427.0, "step": 5575 }, { "entropy": 0.7640921212732792, "epoch": 0.5130275271562555, "grad_norm": 0.15641044080257416, "learning_rate": 8.290244426043488e-05, "loss": 0.7474, "mean_token_accuracy": 0.7806496880948544, "num_tokens": 177981158.0, "step": 5576 }, { "entropy": 0.7594138160347939, "epoch": 0.5131195335276968, "grad_norm": 0.1587541401386261, "learning_rate": 8.289937743429326e-05, "loss": 0.7432, "mean_token_accuracy": 0.7839196808636189, "num_tokens": 178013246.0, "step": 5577 }, { "entropy": 0.7717094272375107, "epoch": 0.513211539899138, "grad_norm": 0.16266405582427979, "learning_rate": 8.289631060815163e-05, "loss": 0.7485, "mean_token_accuracy": 0.7804820463061333, "num_tokens": 178044679.0, "step": 5578 }, { "entropy": 0.7552562691271305, "epoch": 0.5133035462705793, "grad_norm": 0.1577078253030777, "learning_rate": 8.289324378201e-05, "loss": 0.7309, "mean_token_accuracy": 0.7822343334555626, "num_tokens": 178076490.0, "step": 5579 }, { "entropy": 0.7264198306947947, "epoch": 0.5133955526420204, "grad_norm": 0.1498204469680786, "learning_rate": 8.289017695586838e-05, "loss": 0.7003, "mean_token_accuracy": 0.7957865856587887, "num_tokens": 178108248.0, "step": 5580 }, { "entropy": 0.8030541036278009, "epoch": 0.5134875590134617, "grad_norm": 0.15614937245845795, "learning_rate": 8.288711012972676e-05, "loss": 0.7905, "mean_token_accuracy": 0.7664929181337357, "num_tokens": 178140263.0, "step": 5581 }, { "entropy": 0.8291088286787271, "epoch": 0.5135795653849029, "grad_norm": 0.1667584329843521, "learning_rate": 8.288404330358512e-05, "loss": 0.8448, "mean_token_accuracy": 0.756864458322525, "num_tokens": 178172172.0, "step": 5582 }, { "entropy": 0.7987677995115519, "epoch": 0.5136715717563441, "grad_norm": 0.1654706597328186, "learning_rate": 8.288097647744349e-05, "loss": 0.8082, "mean_token_accuracy": 0.7619786784052849, "num_tokens": 178203714.0, "step": 5583 }, { "entropy": 0.8312299000099301, "epoch": 0.5137635781277854, "grad_norm": 0.16484178602695465, "learning_rate": 8.287790965130187e-05, "loss": 0.8417, "mean_token_accuracy": 0.7596008591353893, "num_tokens": 178236041.0, "step": 5584 }, { "entropy": 0.8788485582917929, "epoch": 0.5138555844992265, "grad_norm": 0.17587406933307648, "learning_rate": 8.287484282516024e-05, "loss": 0.8942, "mean_token_accuracy": 0.7456468753516674, "num_tokens": 178268304.0, "step": 5585 }, { "entropy": 0.715834753587842, "epoch": 0.5139475908706678, "grad_norm": 0.16288234293460846, "learning_rate": 8.287177599901862e-05, "loss": 0.725, "mean_token_accuracy": 0.7920199111104012, "num_tokens": 178300608.0, "step": 5586 }, { "entropy": 0.7440790925174952, "epoch": 0.514039597242109, "grad_norm": 0.1506858468055725, "learning_rate": 8.286870917287699e-05, "loss": 0.7291, "mean_token_accuracy": 0.7820029892027378, "num_tokens": 178332847.0, "step": 5587 }, { "entropy": 0.7636577747762203, "epoch": 0.5141316036135503, "grad_norm": 0.15260744094848633, "learning_rate": 8.286564234673537e-05, "loss": 0.7477, "mean_token_accuracy": 0.778972115367651, "num_tokens": 178365031.0, "step": 5588 }, { "entropy": 0.7450150419026613, "epoch": 0.5142236099849915, "grad_norm": 0.15142494440078735, "learning_rate": 8.286257552059374e-05, "loss": 0.7256, "mean_token_accuracy": 0.7859993390738964, "num_tokens": 178397100.0, "step": 5589 }, { "entropy": 0.7902210364118218, "epoch": 0.5143156163564326, "grad_norm": 0.15804021060466766, "learning_rate": 8.285950869445211e-05, "loss": 0.7724, "mean_token_accuracy": 0.7736189775168896, "num_tokens": 178428675.0, "step": 5590 }, { "entropy": 0.7685850318521261, "epoch": 0.5144076227278739, "grad_norm": 0.14909324049949646, "learning_rate": 8.285644186831049e-05, "loss": 0.7448, "mean_token_accuracy": 0.7820509411394596, "num_tokens": 178461249.0, "step": 5591 }, { "entropy": 0.776036823168397, "epoch": 0.5144996290993151, "grad_norm": 0.1571199744939804, "learning_rate": 8.285337504216887e-05, "loss": 0.7475, "mean_token_accuracy": 0.7806911319494247, "num_tokens": 178493787.0, "step": 5592 }, { "entropy": 0.7620203588157892, "epoch": 0.5145916354707564, "grad_norm": 0.15456201136112213, "learning_rate": 8.285030821602724e-05, "loss": 0.732, "mean_token_accuracy": 0.7847346812486649, "num_tokens": 178525873.0, "step": 5593 }, { "entropy": 0.9185096696019173, "epoch": 0.5146836418421976, "grad_norm": 0.15717710554599762, "learning_rate": 8.284724138988561e-05, "loss": 0.8968, "mean_token_accuracy": 0.7410906590521336, "num_tokens": 178557251.0, "step": 5594 }, { "entropy": 0.7221684474498034, "epoch": 0.5147756482136387, "grad_norm": 0.1606985628604889, "learning_rate": 8.284417456374398e-05, "loss": 0.7264, "mean_token_accuracy": 0.7889560386538506, "num_tokens": 178589122.0, "step": 5595 }, { "entropy": 0.7130689425393939, "epoch": 0.51486765458508, "grad_norm": 0.15460146963596344, "learning_rate": 8.284110773760237e-05, "loss": 0.6958, "mean_token_accuracy": 0.7960742935538292, "num_tokens": 178620977.0, "step": 5596 }, { "entropy": 0.8710994757711887, "epoch": 0.5149596609565212, "grad_norm": 0.16297082602977753, "learning_rate": 8.283804091146074e-05, "loss": 0.8669, "mean_token_accuracy": 0.7452164031565189, "num_tokens": 178652492.0, "step": 5597 }, { "entropy": 0.7987136729061604, "epoch": 0.5150516673279625, "grad_norm": 0.15566574037075043, "learning_rate": 8.28349740853191e-05, "loss": 0.7685, "mean_token_accuracy": 0.776330292224884, "num_tokens": 178684482.0, "step": 5598 }, { "entropy": 0.7020883429795504, "epoch": 0.5151436736994037, "grad_norm": 0.15635594725608826, "learning_rate": 8.283190725917747e-05, "loss": 0.6893, "mean_token_accuracy": 0.7954985275864601, "num_tokens": 178715902.0, "step": 5599 }, { "entropy": 0.7004642263054848, "epoch": 0.5152356800708449, "grad_norm": 0.15661366283893585, "learning_rate": 8.282884043303586e-05, "loss": 0.6999, "mean_token_accuracy": 0.797734335064888, "num_tokens": 178747814.0, "step": 5600 }, { "entropy": 0.7170673599466681, "epoch": 0.5153276864422861, "grad_norm": 0.15318408608436584, "learning_rate": 8.282577360689424e-05, "loss": 0.7313, "mean_token_accuracy": 0.7850479781627655, "num_tokens": 178779657.0, "step": 5601 }, { "entropy": 0.8155318014323711, "epoch": 0.5154196928137273, "grad_norm": 0.15939867496490479, "learning_rate": 8.28227067807526e-05, "loss": 0.804, "mean_token_accuracy": 0.7625459432601929, "num_tokens": 178811936.0, "step": 5602 }, { "entropy": 0.726182371377945, "epoch": 0.5155116991851686, "grad_norm": 0.1622529774904251, "learning_rate": 8.281963995461097e-05, "loss": 0.7407, "mean_token_accuracy": 0.7809689380228519, "num_tokens": 178843642.0, "step": 5603 }, { "entropy": 0.8067097431048751, "epoch": 0.5156037055566098, "grad_norm": 0.16237229108810425, "learning_rate": 8.281657312846935e-05, "loss": 0.8102, "mean_token_accuracy": 0.7629373259842396, "num_tokens": 178875398.0, "step": 5604 }, { "entropy": 0.7525291405618191, "epoch": 0.515695711928051, "grad_norm": 0.15189476311206818, "learning_rate": 8.281350630232772e-05, "loss": 0.7513, "mean_token_accuracy": 0.7808424681425095, "num_tokens": 178907914.0, "step": 5605 }, { "entropy": 0.7409445960074663, "epoch": 0.5157877182994922, "grad_norm": 0.15956507623195648, "learning_rate": 8.28104394761861e-05, "loss": 0.7276, "mean_token_accuracy": 0.7821437455713749, "num_tokens": 178940219.0, "step": 5606 }, { "entropy": 0.74495661072433, "epoch": 0.5158797246709335, "grad_norm": 0.16048841178417206, "learning_rate": 8.280737265004447e-05, "loss": 0.7297, "mean_token_accuracy": 0.7874671965837479, "num_tokens": 178972214.0, "step": 5607 }, { "entropy": 0.8022854961454868, "epoch": 0.5159717310423747, "grad_norm": 0.15940147638320923, "learning_rate": 8.280430582390285e-05, "loss": 0.7722, "mean_token_accuracy": 0.7828244380652905, "num_tokens": 179004464.0, "step": 5608 }, { "entropy": 0.6624792385846376, "epoch": 0.516063737413816, "grad_norm": 0.14399422705173492, "learning_rate": 8.280123899776122e-05, "loss": 0.6421, "mean_token_accuracy": 0.8049290552735329, "num_tokens": 179036568.0, "step": 5609 }, { "entropy": 0.8407721817493439, "epoch": 0.5161557437852571, "grad_norm": 0.15696172416210175, "learning_rate": 8.279817217161959e-05, "loss": 0.8069, "mean_token_accuracy": 0.7648395895957947, "num_tokens": 179069223.0, "step": 5610 }, { "entropy": 0.7472903206944466, "epoch": 0.5162477501566983, "grad_norm": 0.15890230238437653, "learning_rate": 8.279510534547797e-05, "loss": 0.7294, "mean_token_accuracy": 0.7849084660410881, "num_tokens": 179100986.0, "step": 5611 }, { "entropy": 0.7762463204562664, "epoch": 0.5163397565281396, "grad_norm": 0.15745417773723602, "learning_rate": 8.279203851933635e-05, "loss": 0.7882, "mean_token_accuracy": 0.7688025012612343, "num_tokens": 179132075.0, "step": 5612 }, { "entropy": 0.7025297321379185, "epoch": 0.5164317628995808, "grad_norm": 0.15459878742694855, "learning_rate": 8.278897169319472e-05, "loss": 0.7028, "mean_token_accuracy": 0.7946708090603352, "num_tokens": 179163758.0, "step": 5613 }, { "entropy": 0.8000152930617332, "epoch": 0.5165237692710221, "grad_norm": 0.14827142655849457, "learning_rate": 8.278590486705309e-05, "loss": 0.7856, "mean_token_accuracy": 0.7675283960998058, "num_tokens": 179196348.0, "step": 5614 }, { "entropy": 0.7777385730296373, "epoch": 0.5166157756424632, "grad_norm": 0.15975840389728546, "learning_rate": 8.278283804091147e-05, "loss": 0.764, "mean_token_accuracy": 0.7751429788768291, "num_tokens": 179227690.0, "step": 5615 }, { "entropy": 0.7847190164029598, "epoch": 0.5167077820139044, "grad_norm": 0.1598164439201355, "learning_rate": 8.277977121476984e-05, "loss": 0.7772, "mean_token_accuracy": 0.7776173315942287, "num_tokens": 179259847.0, "step": 5616 }, { "entropy": 0.8337332792580128, "epoch": 0.5167997883853457, "grad_norm": 0.1584751158952713, "learning_rate": 8.277670438862822e-05, "loss": 0.8188, "mean_token_accuracy": 0.7626777365803719, "num_tokens": 179291280.0, "step": 5617 }, { "entropy": 0.7840922120958567, "epoch": 0.5168917947567869, "grad_norm": 0.16838425397872925, "learning_rate": 8.277363756248659e-05, "loss": 0.7989, "mean_token_accuracy": 0.7662032283842564, "num_tokens": 179323405.0, "step": 5618 }, { "entropy": 0.746511947363615, "epoch": 0.5169838011282282, "grad_norm": 0.14899839460849762, "learning_rate": 8.277057073634497e-05, "loss": 0.7246, "mean_token_accuracy": 0.7847266681492329, "num_tokens": 179356002.0, "step": 5619 }, { "entropy": 0.8141305521130562, "epoch": 0.5170758074996693, "grad_norm": 0.1625165194272995, "learning_rate": 8.276750391020333e-05, "loss": 0.8072, "mean_token_accuracy": 0.7661194540560246, "num_tokens": 179387896.0, "step": 5620 }, { "entropy": 0.7145630177110434, "epoch": 0.5171678138711105, "grad_norm": 0.15786652266979218, "learning_rate": 8.27644370840617e-05, "loss": 0.7234, "mean_token_accuracy": 0.7869623675942421, "num_tokens": 179420363.0, "step": 5621 }, { "entropy": 0.6377898715436459, "epoch": 0.5172598202425518, "grad_norm": 0.1465887725353241, "learning_rate": 8.276137025792008e-05, "loss": 0.6227, "mean_token_accuracy": 0.8146916627883911, "num_tokens": 179452535.0, "step": 5622 }, { "entropy": 0.8678732886910439, "epoch": 0.517351826613993, "grad_norm": 0.15533800423145294, "learning_rate": 8.275830343177847e-05, "loss": 0.8537, "mean_token_accuracy": 0.7501406148076057, "num_tokens": 179484560.0, "step": 5623 }, { "entropy": 0.7350630946457386, "epoch": 0.5174438329854343, "grad_norm": 0.15170548856258392, "learning_rate": 8.275523660563683e-05, "loss": 0.7233, "mean_token_accuracy": 0.7870054356753826, "num_tokens": 179516283.0, "step": 5624 }, { "entropy": 0.810594417154789, "epoch": 0.5175358393568754, "grad_norm": 0.16272224485874176, "learning_rate": 8.27521697794952e-05, "loss": 0.8177, "mean_token_accuracy": 0.7620367221534252, "num_tokens": 179548134.0, "step": 5625 }, { "entropy": 0.8137489948421717, "epoch": 0.5176278457283167, "grad_norm": 0.171220064163208, "learning_rate": 8.274910295335357e-05, "loss": 0.8183, "mean_token_accuracy": 0.7626495063304901, "num_tokens": 179580147.0, "step": 5626 }, { "entropy": 0.7179593238979578, "epoch": 0.5177198520997579, "grad_norm": 0.15387381613254547, "learning_rate": 8.274603612721195e-05, "loss": 0.7276, "mean_token_accuracy": 0.7838428914546967, "num_tokens": 179612038.0, "step": 5627 }, { "entropy": 0.7900035865604877, "epoch": 0.5178118584711991, "grad_norm": 0.1579780876636505, "learning_rate": 8.274296930107033e-05, "loss": 0.7564, "mean_token_accuracy": 0.7786357812583447, "num_tokens": 179644214.0, "step": 5628 }, { "entropy": 0.8166593573987484, "epoch": 0.5179038648426404, "grad_norm": 0.1647643744945526, "learning_rate": 8.27399024749287e-05, "loss": 0.8081, "mean_token_accuracy": 0.7648350484669209, "num_tokens": 179675242.0, "step": 5629 }, { "entropy": 0.7898218519985676, "epoch": 0.5179958712140815, "grad_norm": 0.15826672315597534, "learning_rate": 8.273683564878707e-05, "loss": 0.7724, "mean_token_accuracy": 0.7727367728948593, "num_tokens": 179707115.0, "step": 5630 }, { "entropy": 0.7605730928480625, "epoch": 0.5180878775855228, "grad_norm": 0.15039391815662384, "learning_rate": 8.273376882264545e-05, "loss": 0.7423, "mean_token_accuracy": 0.7833795286715031, "num_tokens": 179739095.0, "step": 5631 }, { "entropy": 0.8429079465568066, "epoch": 0.518179883956964, "grad_norm": 0.1565682739019394, "learning_rate": 8.273070199650382e-05, "loss": 0.8193, "mean_token_accuracy": 0.7606905102729797, "num_tokens": 179770638.0, "step": 5632 }, { "entropy": 0.7971814405173063, "epoch": 0.5182718903284053, "grad_norm": 0.15564623475074768, "learning_rate": 8.27276351703622e-05, "loss": 0.7745, "mean_token_accuracy": 0.7743802890181541, "num_tokens": 179802412.0, "step": 5633 }, { "entropy": 0.8952645473182201, "epoch": 0.5183638966998465, "grad_norm": 0.1587388664484024, "learning_rate": 8.272456834422057e-05, "loss": 0.8907, "mean_token_accuracy": 0.7420218996703625, "num_tokens": 179833904.0, "step": 5634 }, { "entropy": 0.8558731935918331, "epoch": 0.5184559030712876, "grad_norm": 0.15782083570957184, "learning_rate": 8.272150151807895e-05, "loss": 0.8504, "mean_token_accuracy": 0.7496363893151283, "num_tokens": 179866235.0, "step": 5635 }, { "entropy": 0.7999930651858449, "epoch": 0.5185479094427289, "grad_norm": 0.15308870375156403, "learning_rate": 8.271843469193732e-05, "loss": 0.7877, "mean_token_accuracy": 0.767062459141016, "num_tokens": 179898508.0, "step": 5636 }, { "entropy": 0.6725904047489166, "epoch": 0.5186399158141701, "grad_norm": 0.15313467383384705, "learning_rate": 8.271536786579568e-05, "loss": 0.6653, "mean_token_accuracy": 0.8056252636015415, "num_tokens": 179929971.0, "step": 5637 }, { "entropy": 0.8427846059203148, "epoch": 0.5187319221856114, "grad_norm": 0.1676439642906189, "learning_rate": 8.271230103965406e-05, "loss": 0.8485, "mean_token_accuracy": 0.7532826289534569, "num_tokens": 179962026.0, "step": 5638 }, { "entropy": 0.8391323480755091, "epoch": 0.5188239285570526, "grad_norm": 0.15774141252040863, "learning_rate": 8.270923421351245e-05, "loss": 0.8495, "mean_token_accuracy": 0.7543689720332623, "num_tokens": 179994025.0, "step": 5639 }, { "entropy": 0.8124000336974859, "epoch": 0.5189159349284937, "grad_norm": 0.1657446324825287, "learning_rate": 8.270616738737081e-05, "loss": 0.804, "mean_token_accuracy": 0.7666653729975224, "num_tokens": 180025903.0, "step": 5640 }, { "entropy": 0.7513125296682119, "epoch": 0.519007941299935, "grad_norm": 0.16657403111457825, "learning_rate": 8.270310056122918e-05, "loss": 0.7551, "mean_token_accuracy": 0.7791264094412327, "num_tokens": 180057745.0, "step": 5641 }, { "entropy": 0.7260773461312056, "epoch": 0.5190999476713762, "grad_norm": 0.1637420803308487, "learning_rate": 8.270003373508756e-05, "loss": 0.7321, "mean_token_accuracy": 0.7836794778704643, "num_tokens": 180089821.0, "step": 5642 }, { "entropy": 0.8216852601617575, "epoch": 0.5191919540428175, "grad_norm": 0.16604897379875183, "learning_rate": 8.269696690894594e-05, "loss": 0.8157, "mean_token_accuracy": 0.7581232264637947, "num_tokens": 180121381.0, "step": 5643 }, { "entropy": 0.7539273854345083, "epoch": 0.5192839604142587, "grad_norm": 0.16628219187259674, "learning_rate": 8.269390008280431e-05, "loss": 0.7504, "mean_token_accuracy": 0.7806656807661057, "num_tokens": 180152199.0, "step": 5644 }, { "entropy": 0.7662339899688959, "epoch": 0.5193759667856999, "grad_norm": 0.1597549319267273, "learning_rate": 8.269083325666268e-05, "loss": 0.7621, "mean_token_accuracy": 0.7799523696303368, "num_tokens": 180184967.0, "step": 5645 }, { "entropy": 0.845312524586916, "epoch": 0.5194679731571411, "grad_norm": 0.162149578332901, "learning_rate": 8.268776643052106e-05, "loss": 0.8222, "mean_token_accuracy": 0.7613573111593723, "num_tokens": 180216741.0, "step": 5646 }, { "entropy": 0.8035998065024614, "epoch": 0.5195599795285823, "grad_norm": 0.1575022041797638, "learning_rate": 8.268469960437943e-05, "loss": 0.7888, "mean_token_accuracy": 0.7712521553039551, "num_tokens": 180248478.0, "step": 5647 }, { "entropy": 0.786101090721786, "epoch": 0.5196519859000236, "grad_norm": 0.1512508988380432, "learning_rate": 8.268163277823781e-05, "loss": 0.765, "mean_token_accuracy": 0.7814750522375107, "num_tokens": 180280961.0, "step": 5648 }, { "entropy": 0.8210403677076101, "epoch": 0.5197439922714648, "grad_norm": 0.16417557001113892, "learning_rate": 8.267856595209618e-05, "loss": 0.8127, "mean_token_accuracy": 0.7633024379611015, "num_tokens": 180312613.0, "step": 5649 }, { "entropy": 0.8788082525134087, "epoch": 0.519835998642906, "grad_norm": 0.1629500538110733, "learning_rate": 8.267549912595456e-05, "loss": 0.8793, "mean_token_accuracy": 0.7471968978643417, "num_tokens": 180344197.0, "step": 5650 }, { "entropy": 0.7833117209374905, "epoch": 0.5199280050143472, "grad_norm": 0.15587082505226135, "learning_rate": 8.267243229981293e-05, "loss": 0.76, "mean_token_accuracy": 0.7796783074736595, "num_tokens": 180376368.0, "step": 5651 }, { "entropy": 0.7783274613320827, "epoch": 0.5200200113857885, "grad_norm": 0.15250414609909058, "learning_rate": 8.26693654736713e-05, "loss": 0.7603, "mean_token_accuracy": 0.7779425121843815, "num_tokens": 180408646.0, "step": 5652 }, { "entropy": 0.7666708249598742, "epoch": 0.5201120177572297, "grad_norm": 0.16201132535934448, "learning_rate": 8.266629864752968e-05, "loss": 0.7499, "mean_token_accuracy": 0.7739836201071739, "num_tokens": 180440302.0, "step": 5653 }, { "entropy": 0.7555548660457134, "epoch": 0.520204024128671, "grad_norm": 0.15427671372890472, "learning_rate": 8.266323182138806e-05, "loss": 0.7435, "mean_token_accuracy": 0.7843424752354622, "num_tokens": 180472464.0, "step": 5654 }, { "entropy": 0.7343436665832996, "epoch": 0.5202960305001121, "grad_norm": 0.15747348964214325, "learning_rate": 8.266016499524643e-05, "loss": 0.7289, "mean_token_accuracy": 0.7879518792033195, "num_tokens": 180505232.0, "step": 5655 }, { "entropy": 0.762737799435854, "epoch": 0.5203880368715533, "grad_norm": 0.1654900759458542, "learning_rate": 8.26570981691048e-05, "loss": 0.7604, "mean_token_accuracy": 0.7736629657447338, "num_tokens": 180537064.0, "step": 5656 }, { "entropy": 0.7946772947907448, "epoch": 0.5204800432429946, "grad_norm": 0.1665303111076355, "learning_rate": 8.265403134296316e-05, "loss": 0.8076, "mean_token_accuracy": 0.7659123949706554, "num_tokens": 180568764.0, "step": 5657 }, { "entropy": 0.8188362866640091, "epoch": 0.5205720496144358, "grad_norm": 0.16205623745918274, "learning_rate": 8.265096451682154e-05, "loss": 0.8057, "mean_token_accuracy": 0.7686231583356857, "num_tokens": 180600723.0, "step": 5658 }, { "entropy": 0.7536797076463699, "epoch": 0.5206640559858771, "grad_norm": 0.1575290560722351, "learning_rate": 8.264789769067993e-05, "loss": 0.756, "mean_token_accuracy": 0.7797265946865082, "num_tokens": 180632971.0, "step": 5659 }, { "entropy": 0.6432328727096319, "epoch": 0.5207560623573182, "grad_norm": 0.1465015411376953, "learning_rate": 8.26448308645383e-05, "loss": 0.6232, "mean_token_accuracy": 0.8126221261918545, "num_tokens": 180665739.0, "step": 5660 }, { "entropy": 0.8719392754137516, "epoch": 0.5208480687287594, "grad_norm": 0.17105872929096222, "learning_rate": 8.264176403839666e-05, "loss": 0.8755, "mean_token_accuracy": 0.7549887746572495, "num_tokens": 180698093.0, "step": 5661 }, { "entropy": 0.7288300488144159, "epoch": 0.5209400751002007, "grad_norm": 0.15698279440402985, "learning_rate": 8.263869721225504e-05, "loss": 0.6915, "mean_token_accuracy": 0.8010087721049786, "num_tokens": 180730659.0, "step": 5662 }, { "entropy": 0.7285200301557779, "epoch": 0.5210320814716419, "grad_norm": 0.15476995706558228, "learning_rate": 8.263563038611341e-05, "loss": 0.7055, "mean_token_accuracy": 0.794529166072607, "num_tokens": 180762758.0, "step": 5663 }, { "entropy": 0.7220368701964617, "epoch": 0.5211240878430832, "grad_norm": 0.1515016257762909, "learning_rate": 8.263256355997179e-05, "loss": 0.7215, "mean_token_accuracy": 0.7857054732739925, "num_tokens": 180794560.0, "step": 5664 }, { "entropy": 0.7539980411529541, "epoch": 0.5212160942145243, "grad_norm": 0.14796452224254608, "learning_rate": 8.262949673383016e-05, "loss": 0.7333, "mean_token_accuracy": 0.7902855090796947, "num_tokens": 180826353.0, "step": 5665 }, { "entropy": 0.7458801846951246, "epoch": 0.5213081005859656, "grad_norm": 0.153997004032135, "learning_rate": 8.262642990768854e-05, "loss": 0.7206, "mean_token_accuracy": 0.7871546223759651, "num_tokens": 180857761.0, "step": 5666 }, { "entropy": 0.6665875855833292, "epoch": 0.5214001069574068, "grad_norm": 0.1500423699617386, "learning_rate": 8.262336308154691e-05, "loss": 0.6389, "mean_token_accuracy": 0.8110428489744663, "num_tokens": 180889706.0, "step": 5667 }, { "entropy": 0.8604093790054321, "epoch": 0.521492113328848, "grad_norm": 0.16227003931999207, "learning_rate": 8.262029625540528e-05, "loss": 0.8512, "mean_token_accuracy": 0.7513170838356018, "num_tokens": 180921102.0, "step": 5668 }, { "entropy": 0.7949501406401396, "epoch": 0.5215841197002893, "grad_norm": 0.16124482452869415, "learning_rate": 8.261722942926366e-05, "loss": 0.7886, "mean_token_accuracy": 0.7753051333129406, "num_tokens": 180952359.0, "step": 5669 }, { "entropy": 0.7667530719190836, "epoch": 0.5216761260717304, "grad_norm": 0.1551930159330368, "learning_rate": 8.261416260312204e-05, "loss": 0.7762, "mean_token_accuracy": 0.7743146046996117, "num_tokens": 180984578.0, "step": 5670 }, { "entropy": 0.6788841541856527, "epoch": 0.5217681324431717, "grad_norm": 0.16602317988872528, "learning_rate": 8.261109577698041e-05, "loss": 0.6838, "mean_token_accuracy": 0.7961423546075821, "num_tokens": 181016996.0, "step": 5671 }, { "entropy": 0.908289585262537, "epoch": 0.5218601388146129, "grad_norm": 0.16856810450553894, "learning_rate": 8.260802895083878e-05, "loss": 0.9112, "mean_token_accuracy": 0.7379319034516811, "num_tokens": 181049335.0, "step": 5672 }, { "entropy": 0.7336226869374514, "epoch": 0.5219521451860542, "grad_norm": 0.15026211738586426, "learning_rate": 8.260496212469714e-05, "loss": 0.717, "mean_token_accuracy": 0.7926338203251362, "num_tokens": 181080754.0, "step": 5673 }, { "entropy": 0.962308507412672, "epoch": 0.5220441515574954, "grad_norm": 0.16141235828399658, "learning_rate": 8.260189529855554e-05, "loss": 0.9558, "mean_token_accuracy": 0.727350939065218, "num_tokens": 181113384.0, "step": 5674 }, { "entropy": 0.7263786531984806, "epoch": 0.5221361579289365, "grad_norm": 0.15994307398796082, "learning_rate": 8.25988284724139e-05, "loss": 0.7165, "mean_token_accuracy": 0.7899485640227795, "num_tokens": 181145872.0, "step": 5675 }, { "entropy": 0.8656177073717117, "epoch": 0.5222281643003778, "grad_norm": 0.17597834765911102, "learning_rate": 8.259576164627227e-05, "loss": 0.878, "mean_token_accuracy": 0.757008608430624, "num_tokens": 181177623.0, "step": 5676 }, { "entropy": 0.6402064952999353, "epoch": 0.522320170671819, "grad_norm": 0.1400018036365509, "learning_rate": 8.259269482013066e-05, "loss": 0.6146, "mean_token_accuracy": 0.8152494691312313, "num_tokens": 181209792.0, "step": 5677 }, { "entropy": 0.7754597030580044, "epoch": 0.5224121770432603, "grad_norm": 0.15421535074710846, "learning_rate": 8.258962799398902e-05, "loss": 0.7783, "mean_token_accuracy": 0.7730530276894569, "num_tokens": 181242225.0, "step": 5678 }, { "entropy": 0.8405924700200558, "epoch": 0.5225041834147015, "grad_norm": 0.15755626559257507, "learning_rate": 8.25865611678474e-05, "loss": 0.803, "mean_token_accuracy": 0.7683230973780155, "num_tokens": 181274433.0, "step": 5679 }, { "entropy": 0.8202827833592892, "epoch": 0.5225961897861426, "grad_norm": 0.16715143620967865, "learning_rate": 8.258349434170577e-05, "loss": 0.8211, "mean_token_accuracy": 0.7614513002336025, "num_tokens": 181306685.0, "step": 5680 }, { "entropy": 0.8367418507114053, "epoch": 0.5226881961575839, "grad_norm": 0.1577163189649582, "learning_rate": 8.258042751556415e-05, "loss": 0.8092, "mean_token_accuracy": 0.7614225782454014, "num_tokens": 181338952.0, "step": 5681 }, { "entropy": 0.8194203265011311, "epoch": 0.5227802025290251, "grad_norm": 0.1631816178560257, "learning_rate": 8.257736068942252e-05, "loss": 0.8268, "mean_token_accuracy": 0.7639862783253193, "num_tokens": 181370874.0, "step": 5682 }, { "entropy": 0.6863573379814625, "epoch": 0.5228722089004664, "grad_norm": 0.15100312232971191, "learning_rate": 8.257429386328089e-05, "loss": 0.6633, "mean_token_accuracy": 0.8039701879024506, "num_tokens": 181403077.0, "step": 5683 }, { "entropy": 0.7782385721802711, "epoch": 0.5229642152719076, "grad_norm": 0.15932892262935638, "learning_rate": 8.257122703713927e-05, "loss": 0.7809, "mean_token_accuracy": 0.7685554325580597, "num_tokens": 181433996.0, "step": 5684 }, { "entropy": 0.7581074945628643, "epoch": 0.5230562216433488, "grad_norm": 0.15356872975826263, "learning_rate": 8.256816021099765e-05, "loss": 0.7463, "mean_token_accuracy": 0.7829085364937782, "num_tokens": 181466227.0, "step": 5685 }, { "entropy": 0.8769489079713821, "epoch": 0.52314822801479, "grad_norm": 0.15597963333129883, "learning_rate": 8.256509338485602e-05, "loss": 0.8749, "mean_token_accuracy": 0.7481356002390385, "num_tokens": 181498287.0, "step": 5686 }, { "entropy": 0.7250389140099287, "epoch": 0.5232402343862312, "grad_norm": 0.14781154692173004, "learning_rate": 8.256202655871439e-05, "loss": 0.7051, "mean_token_accuracy": 0.7970584146678448, "num_tokens": 181530211.0, "step": 5687 }, { "entropy": 0.6713395472615957, "epoch": 0.5233322407576725, "grad_norm": 0.16719132661819458, "learning_rate": 8.255895973257276e-05, "loss": 0.6892, "mean_token_accuracy": 0.7990577295422554, "num_tokens": 181561578.0, "step": 5688 }, { "entropy": 0.795326529070735, "epoch": 0.5234242471291137, "grad_norm": 0.1602139174938202, "learning_rate": 8.255589290643114e-05, "loss": 0.7886, "mean_token_accuracy": 0.7673952430486679, "num_tokens": 181593896.0, "step": 5689 }, { "entropy": 0.8119101990014315, "epoch": 0.5235162535005549, "grad_norm": 0.1534675508737564, "learning_rate": 8.255282608028952e-05, "loss": 0.8014, "mean_token_accuracy": 0.7683606706559658, "num_tokens": 181625767.0, "step": 5690 }, { "entropy": 0.9277946520596743, "epoch": 0.5236082598719961, "grad_norm": 0.1636352837085724, "learning_rate": 8.254975925414789e-05, "loss": 0.9189, "mean_token_accuracy": 0.7339668199419975, "num_tokens": 181657968.0, "step": 5691 }, { "entropy": 0.6610449114814401, "epoch": 0.5237002662434374, "grad_norm": 0.16134560108184814, "learning_rate": 8.254669242800625e-05, "loss": 0.6482, "mean_token_accuracy": 0.8108754679560661, "num_tokens": 181689844.0, "step": 5692 }, { "entropy": 0.8070376813411713, "epoch": 0.5237922726148786, "grad_norm": 0.1664857268333435, "learning_rate": 8.254362560186464e-05, "loss": 0.7775, "mean_token_accuracy": 0.7777979001402855, "num_tokens": 181721710.0, "step": 5693 }, { "entropy": 0.7152484068647027, "epoch": 0.5238842789863198, "grad_norm": 0.15665829181671143, "learning_rate": 8.2540558775723e-05, "loss": 0.6903, "mean_token_accuracy": 0.7929143235087395, "num_tokens": 181753874.0, "step": 5694 }, { "entropy": 0.7498865891247988, "epoch": 0.523976285357761, "grad_norm": 0.1566300392150879, "learning_rate": 8.253749194958139e-05, "loss": 0.7384, "mean_token_accuracy": 0.7793780602514744, "num_tokens": 181785604.0, "step": 5695 }, { "entropy": 0.8400232065469027, "epoch": 0.5240682917292022, "grad_norm": 0.15991832315921783, "learning_rate": 8.253442512343975e-05, "loss": 0.8393, "mean_token_accuracy": 0.7539766579866409, "num_tokens": 181817115.0, "step": 5696 }, { "entropy": 0.8598899506032467, "epoch": 0.5241602981006435, "grad_norm": 0.1551598608493805, "learning_rate": 8.253135829729813e-05, "loss": 0.8531, "mean_token_accuracy": 0.7492453940212727, "num_tokens": 181848838.0, "step": 5697 }, { "entropy": 0.834418248385191, "epoch": 0.5242523044720847, "grad_norm": 0.16028057038784027, "learning_rate": 8.25282914711565e-05, "loss": 0.8293, "mean_token_accuracy": 0.7580354809761047, "num_tokens": 181881055.0, "step": 5698 }, { "entropy": 0.6252011395990849, "epoch": 0.524344310843526, "grad_norm": 0.14717936515808105, "learning_rate": 8.252522464501487e-05, "loss": 0.6184, "mean_token_accuracy": 0.817102987319231, "num_tokens": 181913387.0, "step": 5699 }, { "entropy": 0.7159011550247669, "epoch": 0.5244363172149671, "grad_norm": 0.16100554168224335, "learning_rate": 8.252215781887325e-05, "loss": 0.7086, "mean_token_accuracy": 0.7906609401106834, "num_tokens": 181945722.0, "step": 5700 }, { "entropy": 0.7985095754265785, "epoch": 0.5245283235864083, "grad_norm": 0.16078974306583405, "learning_rate": 8.251909099273163e-05, "loss": 0.796, "mean_token_accuracy": 0.7650462798774242, "num_tokens": 181976494.0, "step": 5701 }, { "entropy": 0.7626328505575657, "epoch": 0.5246203299578496, "grad_norm": 0.15445570647716522, "learning_rate": 8.251602416659e-05, "loss": 0.7529, "mean_token_accuracy": 0.7754763625562191, "num_tokens": 182008471.0, "step": 5702 }, { "entropy": 0.723204342648387, "epoch": 0.5247123363292908, "grad_norm": 0.15623316168785095, "learning_rate": 8.251295734044837e-05, "loss": 0.7116, "mean_token_accuracy": 0.7902159057557583, "num_tokens": 182040215.0, "step": 5703 }, { "entropy": 0.8225897178053856, "epoch": 0.5248043427007321, "grad_norm": 0.15413391590118408, "learning_rate": 8.250989051430674e-05, "loss": 0.8255, "mean_token_accuracy": 0.7599826417863369, "num_tokens": 182072192.0, "step": 5704 }, { "entropy": 0.6702075265347958, "epoch": 0.5248963490721732, "grad_norm": 0.15023797750473022, "learning_rate": 8.250682368816512e-05, "loss": 0.6415, "mean_token_accuracy": 0.8110703863203526, "num_tokens": 182104350.0, "step": 5705 }, { "entropy": 0.809866838157177, "epoch": 0.5249883554436144, "grad_norm": 0.1649506837129593, "learning_rate": 8.25037568620235e-05, "loss": 0.8031, "mean_token_accuracy": 0.7671602740883827, "num_tokens": 182136340.0, "step": 5706 }, { "entropy": 0.8423809558153152, "epoch": 0.5250803618150557, "grad_norm": 0.15741288661956787, "learning_rate": 8.250069003588187e-05, "loss": 0.8308, "mean_token_accuracy": 0.7579983584582806, "num_tokens": 182168440.0, "step": 5707 }, { "entropy": 0.7710105180740356, "epoch": 0.5251723681864969, "grad_norm": 0.15932422876358032, "learning_rate": 8.249762320974025e-05, "loss": 0.7744, "mean_token_accuracy": 0.7747807390987873, "num_tokens": 182199229.0, "step": 5708 }, { "entropy": 0.8394430670887232, "epoch": 0.5252643745579382, "grad_norm": 0.1701849102973938, "learning_rate": 8.249455638359862e-05, "loss": 0.8307, "mean_token_accuracy": 0.7598147727549076, "num_tokens": 182230584.0, "step": 5709 }, { "entropy": 0.735550856217742, "epoch": 0.5253563809293793, "grad_norm": 0.1541828066110611, "learning_rate": 8.249148955745698e-05, "loss": 0.7197, "mean_token_accuracy": 0.7880874238908291, "num_tokens": 182262570.0, "step": 5710 }, { "entropy": 0.9245553500950336, "epoch": 0.5254483873008206, "grad_norm": 0.17173629999160767, "learning_rate": 8.248842273131537e-05, "loss": 0.9276, "mean_token_accuracy": 0.7335830815136433, "num_tokens": 182294411.0, "step": 5711 }, { "entropy": 0.6971088256686926, "epoch": 0.5255403936722618, "grad_norm": 0.15432144701480865, "learning_rate": 8.248535590517375e-05, "loss": 0.6864, "mean_token_accuracy": 0.7982094436883926, "num_tokens": 182326328.0, "step": 5712 }, { "entropy": 0.73395936191082, "epoch": 0.525632400043703, "grad_norm": 0.14944760501384735, "learning_rate": 8.248228907903212e-05, "loss": 0.7069, "mean_token_accuracy": 0.7892688140273094, "num_tokens": 182358157.0, "step": 5713 }, { "entropy": 0.7861816138029099, "epoch": 0.5257244064151443, "grad_norm": 0.16272170841693878, "learning_rate": 8.247922225289048e-05, "loss": 0.7688, "mean_token_accuracy": 0.7763378843665123, "num_tokens": 182390702.0, "step": 5714 }, { "entropy": 0.82231055945158, "epoch": 0.5258164127865854, "grad_norm": 0.16891993582248688, "learning_rate": 8.247615542674885e-05, "loss": 0.7947, "mean_token_accuracy": 0.7695972993969917, "num_tokens": 182422866.0, "step": 5715 }, { "entropy": 0.821586855687201, "epoch": 0.5259084191580267, "grad_norm": 0.15709219872951508, "learning_rate": 8.247308860060725e-05, "loss": 0.8029, "mean_token_accuracy": 0.766217902302742, "num_tokens": 182454599.0, "step": 5716 }, { "entropy": 0.830235043540597, "epoch": 0.5260004255294679, "grad_norm": 0.15420588850975037, "learning_rate": 8.247002177446561e-05, "loss": 0.8083, "mean_token_accuracy": 0.7652647756040096, "num_tokens": 182486411.0, "step": 5717 }, { "entropy": 0.7560066636651754, "epoch": 0.5260924319009092, "grad_norm": 0.15243610739707947, "learning_rate": 8.246695494832398e-05, "loss": 0.75, "mean_token_accuracy": 0.7794961854815483, "num_tokens": 182518969.0, "step": 5718 }, { "entropy": 0.7962136883288622, "epoch": 0.5261844382723504, "grad_norm": 0.16382592916488647, "learning_rate": 8.246388812218235e-05, "loss": 0.8134, "mean_token_accuracy": 0.7691357620060444, "num_tokens": 182550903.0, "step": 5719 }, { "entropy": 0.7530078869313002, "epoch": 0.5262764446437915, "grad_norm": 0.15735898911952972, "learning_rate": 8.246082129604073e-05, "loss": 0.743, "mean_token_accuracy": 0.7821897640824318, "num_tokens": 182583602.0, "step": 5720 }, { "entropy": 0.8360087163746357, "epoch": 0.5263684510152328, "grad_norm": 0.15538042783737183, "learning_rate": 8.245775446989911e-05, "loss": 0.8344, "mean_token_accuracy": 0.7580294385552406, "num_tokens": 182615658.0, "step": 5721 }, { "entropy": 0.8306032717227936, "epoch": 0.526460457386674, "grad_norm": 0.1585732400417328, "learning_rate": 8.245468764375748e-05, "loss": 0.8158, "mean_token_accuracy": 0.761614978313446, "num_tokens": 182648186.0, "step": 5722 }, { "entropy": 0.6927885040640831, "epoch": 0.5265524637581153, "grad_norm": 0.14936934411525726, "learning_rate": 8.245162081761585e-05, "loss": 0.6807, "mean_token_accuracy": 0.795088566839695, "num_tokens": 182680378.0, "step": 5723 }, { "entropy": 0.7420559749007225, "epoch": 0.5266444701295565, "grad_norm": 0.15661664307117462, "learning_rate": 8.244855399147423e-05, "loss": 0.7446, "mean_token_accuracy": 0.7841933034360409, "num_tokens": 182712887.0, "step": 5724 }, { "entropy": 0.782404787838459, "epoch": 0.5267364765009976, "grad_norm": 0.15601414442062378, "learning_rate": 8.24454871653326e-05, "loss": 0.7695, "mean_token_accuracy": 0.7713127173483372, "num_tokens": 182744335.0, "step": 5725 }, { "entropy": 0.8145607933402061, "epoch": 0.5268284828724389, "grad_norm": 0.1591038852930069, "learning_rate": 8.244242033919098e-05, "loss": 0.8149, "mean_token_accuracy": 0.7601856701076031, "num_tokens": 182776130.0, "step": 5726 }, { "entropy": 0.6626110374927521, "epoch": 0.5269204892438801, "grad_norm": 0.15519241988658905, "learning_rate": 8.243935351304935e-05, "loss": 0.6337, "mean_token_accuracy": 0.811586320400238, "num_tokens": 182808654.0, "step": 5727 }, { "entropy": 0.7217606045305729, "epoch": 0.5270124956153214, "grad_norm": 0.16336527466773987, "learning_rate": 8.243628668690773e-05, "loss": 0.7031, "mean_token_accuracy": 0.793929073959589, "num_tokens": 182839626.0, "step": 5728 }, { "entropy": 0.8039039056748152, "epoch": 0.5271045019867626, "grad_norm": 0.17218926548957825, "learning_rate": 8.24332198607661e-05, "loss": 0.8187, "mean_token_accuracy": 0.7618633396923542, "num_tokens": 182871327.0, "step": 5729 }, { "entropy": 0.8211076334118843, "epoch": 0.5271965083582038, "grad_norm": 0.16556361317634583, "learning_rate": 8.243015303462446e-05, "loss": 0.8119, "mean_token_accuracy": 0.765903826802969, "num_tokens": 182903634.0, "step": 5730 }, { "entropy": 0.7255365550518036, "epoch": 0.527288514729645, "grad_norm": 0.15029233694076538, "learning_rate": 8.242708620848285e-05, "loss": 0.7188, "mean_token_accuracy": 0.7911786213517189, "num_tokens": 182936243.0, "step": 5731 }, { "entropy": 0.8284462466835976, "epoch": 0.5273805211010862, "grad_norm": 0.15908509492874146, "learning_rate": 8.242401938234123e-05, "loss": 0.8037, "mean_token_accuracy": 0.7634780183434486, "num_tokens": 182968233.0, "step": 5732 }, { "entropy": 0.742130083963275, "epoch": 0.5274725274725275, "grad_norm": 0.16566365957260132, "learning_rate": 8.24209525561996e-05, "loss": 0.7351, "mean_token_accuracy": 0.7849501371383667, "num_tokens": 183000256.0, "step": 5733 }, { "entropy": 0.7902638651430607, "epoch": 0.5275645338439687, "grad_norm": 0.15300574898719788, "learning_rate": 8.241788573005796e-05, "loss": 0.7842, "mean_token_accuracy": 0.7691583707928658, "num_tokens": 183032041.0, "step": 5734 }, { "entropy": 0.7230034042149782, "epoch": 0.5276565402154099, "grad_norm": 0.1523195207118988, "learning_rate": 8.241481890391633e-05, "loss": 0.7119, "mean_token_accuracy": 0.7909955233335495, "num_tokens": 183064020.0, "step": 5735 }, { "entropy": 0.8178257755935192, "epoch": 0.5277485465868511, "grad_norm": 0.14907971024513245, "learning_rate": 8.241175207777471e-05, "loss": 0.7986, "mean_token_accuracy": 0.7648104056715965, "num_tokens": 183095548.0, "step": 5736 }, { "entropy": 0.7906857114285231, "epoch": 0.5278405529582924, "grad_norm": 0.16101369261741638, "learning_rate": 8.24086852516331e-05, "loss": 0.7685, "mean_token_accuracy": 0.778038065880537, "num_tokens": 183128075.0, "step": 5737 }, { "entropy": 0.8855379372835159, "epoch": 0.5279325593297336, "grad_norm": 0.1652843952178955, "learning_rate": 8.240561842549146e-05, "loss": 0.8673, "mean_token_accuracy": 0.7505023777484894, "num_tokens": 183159154.0, "step": 5738 }, { "entropy": 0.8676322530955076, "epoch": 0.5280245657011748, "grad_norm": 0.15849988162517548, "learning_rate": 8.240255159934984e-05, "loss": 0.8337, "mean_token_accuracy": 0.756847407668829, "num_tokens": 183190893.0, "step": 5739 }, { "entropy": 0.7476626951247454, "epoch": 0.528116572072616, "grad_norm": 0.15748678147792816, "learning_rate": 8.239948477320821e-05, "loss": 0.7373, "mean_token_accuracy": 0.7869727313518524, "num_tokens": 183223510.0, "step": 5740 }, { "entropy": 0.8088985178619623, "epoch": 0.5282085784440572, "grad_norm": 0.1641015261411667, "learning_rate": 8.239641794706658e-05, "loss": 0.8121, "mean_token_accuracy": 0.7662320993840694, "num_tokens": 183255393.0, "step": 5741 }, { "entropy": 0.7855808697640896, "epoch": 0.5283005848154985, "grad_norm": 0.1767074316740036, "learning_rate": 8.239335112092496e-05, "loss": 0.7739, "mean_token_accuracy": 0.7720897831022739, "num_tokens": 183287081.0, "step": 5742 }, { "entropy": 0.8394513726234436, "epoch": 0.5283925911869397, "grad_norm": 0.16654066741466522, "learning_rate": 8.239028429478334e-05, "loss": 0.8277, "mean_token_accuracy": 0.7588892579078674, "num_tokens": 183318802.0, "step": 5743 }, { "entropy": 0.8208817429840565, "epoch": 0.528484597558381, "grad_norm": 0.15234500169754028, "learning_rate": 8.238721746864171e-05, "loss": 0.8156, "mean_token_accuracy": 0.7586034424602985, "num_tokens": 183351257.0, "step": 5744 }, { "entropy": 0.7331023681908846, "epoch": 0.5285766039298221, "grad_norm": 0.15342238545417786, "learning_rate": 8.238415064250008e-05, "loss": 0.739, "mean_token_accuracy": 0.7853436209261417, "num_tokens": 183383708.0, "step": 5745 }, { "entropy": 0.754357224330306, "epoch": 0.5286686103012633, "grad_norm": 0.16057002544403076, "learning_rate": 8.238108381635845e-05, "loss": 0.7501, "mean_token_accuracy": 0.7781421393156052, "num_tokens": 183415494.0, "step": 5746 }, { "entropy": 0.8313983082771301, "epoch": 0.5287606166727046, "grad_norm": 0.16394264996051788, "learning_rate": 8.237801699021683e-05, "loss": 0.8288, "mean_token_accuracy": 0.7584977932274342, "num_tokens": 183447932.0, "step": 5747 }, { "entropy": 0.7889021504670382, "epoch": 0.5288526230441458, "grad_norm": 0.17030376195907593, "learning_rate": 8.237495016407521e-05, "loss": 0.7914, "mean_token_accuracy": 0.770620983093977, "num_tokens": 183479735.0, "step": 5748 }, { "entropy": 0.7926440238952637, "epoch": 0.5289446294155871, "grad_norm": 0.15700161457061768, "learning_rate": 8.237188333793358e-05, "loss": 0.7818, "mean_token_accuracy": 0.7675088681280613, "num_tokens": 183512098.0, "step": 5749 }, { "entropy": 0.7907434124499559, "epoch": 0.5290366357870282, "grad_norm": 0.15644119679927826, "learning_rate": 8.236881651179194e-05, "loss": 0.7916, "mean_token_accuracy": 0.7724574655294418, "num_tokens": 183543516.0, "step": 5750 }, { "entropy": 0.8219442907720804, "epoch": 0.5291286421584694, "grad_norm": 0.1553800255060196, "learning_rate": 8.236574968565033e-05, "loss": 0.8143, "mean_token_accuracy": 0.7605745755136013, "num_tokens": 183576037.0, "step": 5751 }, { "entropy": 0.7025743052363396, "epoch": 0.5292206485299107, "grad_norm": 0.15745799243450165, "learning_rate": 8.236268285950869e-05, "loss": 0.7014, "mean_token_accuracy": 0.7917101867496967, "num_tokens": 183607580.0, "step": 5752 }, { "entropy": 0.7756704716011882, "epoch": 0.5293126549013519, "grad_norm": 0.1589961051940918, "learning_rate": 8.235961603336707e-05, "loss": 0.7758, "mean_token_accuracy": 0.7750231400132179, "num_tokens": 183639604.0, "step": 5753 }, { "entropy": 0.7633599676191807, "epoch": 0.5294046612727932, "grad_norm": 0.1569579690694809, "learning_rate": 8.235654920722544e-05, "loss": 0.7549, "mean_token_accuracy": 0.777688667178154, "num_tokens": 183672190.0, "step": 5754 }, { "entropy": 0.7945439517498016, "epoch": 0.5294966676442343, "grad_norm": 0.16057761013507843, "learning_rate": 8.235348238108382e-05, "loss": 0.7947, "mean_token_accuracy": 0.7727872580289841, "num_tokens": 183704050.0, "step": 5755 }, { "entropy": 0.9294890556484461, "epoch": 0.5295886740156756, "grad_norm": 0.16348707675933838, "learning_rate": 8.235041555494219e-05, "loss": 0.9282, "mean_token_accuracy": 0.7386168353259563, "num_tokens": 183735323.0, "step": 5756 }, { "entropy": 0.7445607408881187, "epoch": 0.5296806803871168, "grad_norm": 0.16169732809066772, "learning_rate": 8.234734872880056e-05, "loss": 0.7303, "mean_token_accuracy": 0.7829773165285587, "num_tokens": 183767175.0, "step": 5757 }, { "entropy": 0.7506187651306391, "epoch": 0.529772686758558, "grad_norm": 0.15704864263534546, "learning_rate": 8.234428190265894e-05, "loss": 0.7468, "mean_token_accuracy": 0.7801072299480438, "num_tokens": 183799457.0, "step": 5758 }, { "entropy": 0.77003313601017, "epoch": 0.5298646931299993, "grad_norm": 0.15118369460105896, "learning_rate": 8.234121507651732e-05, "loss": 0.7538, "mean_token_accuracy": 0.7799408435821533, "num_tokens": 183831782.0, "step": 5759 }, { "entropy": 0.8416907321661711, "epoch": 0.5299566995014404, "grad_norm": 0.16593335568904877, "learning_rate": 8.233814825037569e-05, "loss": 0.8231, "mean_token_accuracy": 0.7641150169074535, "num_tokens": 183863820.0, "step": 5760 }, { "entropy": 0.7721207607537508, "epoch": 0.5300487058728817, "grad_norm": 0.1577068567276001, "learning_rate": 8.233508142423406e-05, "loss": 0.7821, "mean_token_accuracy": 0.7767854109406471, "num_tokens": 183896123.0, "step": 5761 }, { "entropy": 0.7244638372212648, "epoch": 0.5301407122443229, "grad_norm": 0.15772496163845062, "learning_rate": 8.233201459809244e-05, "loss": 0.7161, "mean_token_accuracy": 0.7937364913523197, "num_tokens": 183927831.0, "step": 5762 }, { "entropy": 0.8151576370000839, "epoch": 0.5302327186157642, "grad_norm": 0.16199104487895966, "learning_rate": 8.232894777195082e-05, "loss": 0.8016, "mean_token_accuracy": 0.7653236538171768, "num_tokens": 183960057.0, "step": 5763 }, { "entropy": 0.8882621638476849, "epoch": 0.5303247249872054, "grad_norm": 0.16495414078235626, "learning_rate": 8.232588094580919e-05, "loss": 0.8759, "mean_token_accuracy": 0.7516795359551907, "num_tokens": 183991694.0, "step": 5764 }, { "entropy": 0.8355507757514715, "epoch": 0.5304167313586465, "grad_norm": 0.15572811663150787, "learning_rate": 8.232281411966756e-05, "loss": 0.821, "mean_token_accuracy": 0.760875653475523, "num_tokens": 184023494.0, "step": 5765 }, { "entropy": 0.7863075397908688, "epoch": 0.5305087377300878, "grad_norm": 0.1589597463607788, "learning_rate": 8.231974729352594e-05, "loss": 0.7546, "mean_token_accuracy": 0.7810706235468388, "num_tokens": 184054929.0, "step": 5766 }, { "entropy": 0.8621300384402275, "epoch": 0.530600744101529, "grad_norm": 0.16335228085517883, "learning_rate": 8.23166804673843e-05, "loss": 0.845, "mean_token_accuracy": 0.7541193589568138, "num_tokens": 184087665.0, "step": 5767 }, { "entropy": 0.8615759126842022, "epoch": 0.5306927504729703, "grad_norm": 0.15992988646030426, "learning_rate": 8.231361364124269e-05, "loss": 0.8528, "mean_token_accuracy": 0.7479202374815941, "num_tokens": 184119964.0, "step": 5768 }, { "entropy": 0.7079428043216467, "epoch": 0.5307847568444115, "grad_norm": 0.16247794032096863, "learning_rate": 8.231054681510106e-05, "loss": 0.702, "mean_token_accuracy": 0.7906114906072617, "num_tokens": 184152341.0, "step": 5769 }, { "entropy": 0.761485343798995, "epoch": 0.5308767632158526, "grad_norm": 0.162199467420578, "learning_rate": 8.230747998895944e-05, "loss": 0.7404, "mean_token_accuracy": 0.7832524366676807, "num_tokens": 184183953.0, "step": 5770 }, { "entropy": 0.7647136822342873, "epoch": 0.5309687695872939, "grad_norm": 0.1608894318342209, "learning_rate": 8.23044131628178e-05, "loss": 0.7641, "mean_token_accuracy": 0.7777692675590515, "num_tokens": 184216250.0, "step": 5771 }, { "entropy": 0.9096379242837429, "epoch": 0.5310607759587351, "grad_norm": 0.17049966752529144, "learning_rate": 8.230134633667617e-05, "loss": 0.9334, "mean_token_accuracy": 0.7309801653027534, "num_tokens": 184247754.0, "step": 5772 }, { "entropy": 0.839814092963934, "epoch": 0.5311527823301764, "grad_norm": 0.15631791949272156, "learning_rate": 8.229827951053455e-05, "loss": 0.825, "mean_token_accuracy": 0.7597974836826324, "num_tokens": 184279932.0, "step": 5773 }, { "entropy": 0.7756560407578945, "epoch": 0.5312447887016176, "grad_norm": 0.1558852344751358, "learning_rate": 8.229521268439294e-05, "loss": 0.7743, "mean_token_accuracy": 0.7734073549509048, "num_tokens": 184311750.0, "step": 5774 }, { "entropy": 0.6385166980326176, "epoch": 0.5313367950730588, "grad_norm": 0.15699374675750732, "learning_rate": 8.22921458582513e-05, "loss": 0.6251, "mean_token_accuracy": 0.8156054466962814, "num_tokens": 184343880.0, "step": 5775 }, { "entropy": 0.8113266509026289, "epoch": 0.5314288014445, "grad_norm": 0.1620723456144333, "learning_rate": 8.228907903210967e-05, "loss": 0.7923, "mean_token_accuracy": 0.7750827670097351, "num_tokens": 184375266.0, "step": 5776 }, { "entropy": 0.7881266120821238, "epoch": 0.5315208078159412, "grad_norm": 0.16766314208507538, "learning_rate": 8.228601220596804e-05, "loss": 0.775, "mean_token_accuracy": 0.7711650654673576, "num_tokens": 184407315.0, "step": 5777 }, { "entropy": 0.754855876788497, "epoch": 0.5316128141873825, "grad_norm": 0.1558908224105835, "learning_rate": 8.228294537982642e-05, "loss": 0.7262, "mean_token_accuracy": 0.7876794002950191, "num_tokens": 184438388.0, "step": 5778 }, { "entropy": 0.7058474496006966, "epoch": 0.5317048205588237, "grad_norm": 0.1510286182165146, "learning_rate": 8.22798785536848e-05, "loss": 0.6894, "mean_token_accuracy": 0.7993376553058624, "num_tokens": 184470548.0, "step": 5779 }, { "entropy": 0.8889129683375359, "epoch": 0.5317968269302649, "grad_norm": 0.1614735871553421, "learning_rate": 8.227681172754317e-05, "loss": 0.8832, "mean_token_accuracy": 0.7462363913655281, "num_tokens": 184502460.0, "step": 5780 }, { "entropy": 0.692703727632761, "epoch": 0.5318888333017061, "grad_norm": 0.14695018529891968, "learning_rate": 8.227374490140154e-05, "loss": 0.6761, "mean_token_accuracy": 0.8015376850962639, "num_tokens": 184533967.0, "step": 5781 }, { "entropy": 0.7383866738528013, "epoch": 0.5319808396731474, "grad_norm": 0.1576484888792038, "learning_rate": 8.227067807525992e-05, "loss": 0.7227, "mean_token_accuracy": 0.7881373874843121, "num_tokens": 184565715.0, "step": 5782 }, { "entropy": 0.7011283542960882, "epoch": 0.5320728460445886, "grad_norm": 0.17187091708183289, "learning_rate": 8.226761124911829e-05, "loss": 0.714, "mean_token_accuracy": 0.7922206223011017, "num_tokens": 184597215.0, "step": 5783 }, { "entropy": 0.7228797972202301, "epoch": 0.5321648524160298, "grad_norm": 0.14683955907821655, "learning_rate": 8.226454442297667e-05, "loss": 0.7037, "mean_token_accuracy": 0.7905731163918972, "num_tokens": 184629237.0, "step": 5784 }, { "entropy": 0.7101657725870609, "epoch": 0.5322568587874711, "grad_norm": 0.14938773214817047, "learning_rate": 8.226147759683504e-05, "loss": 0.6992, "mean_token_accuracy": 0.7944744825363159, "num_tokens": 184661159.0, "step": 5785 }, { "entropy": 0.7750175520777702, "epoch": 0.5323488651589122, "grad_norm": 0.15773066878318787, "learning_rate": 8.225841077069342e-05, "loss": 0.7593, "mean_token_accuracy": 0.779582004994154, "num_tokens": 184693195.0, "step": 5786 }, { "entropy": 0.7994931973516941, "epoch": 0.5324408715303535, "grad_norm": 0.16756078600883484, "learning_rate": 8.225534394455179e-05, "loss": 0.7777, "mean_token_accuracy": 0.7763411849737167, "num_tokens": 184725531.0, "step": 5787 }, { "entropy": 0.6484025772660971, "epoch": 0.5325328779017947, "grad_norm": 0.15101197361946106, "learning_rate": 8.225227711841015e-05, "loss": 0.6256, "mean_token_accuracy": 0.8189463056623936, "num_tokens": 184757761.0, "step": 5788 }, { "entropy": 0.8021127972751856, "epoch": 0.532624884273236, "grad_norm": 0.15812204778194427, "learning_rate": 8.224921029226853e-05, "loss": 0.8021, "mean_token_accuracy": 0.7670551538467407, "num_tokens": 184789007.0, "step": 5789 }, { "entropy": 0.7287911800667644, "epoch": 0.5327168906446772, "grad_norm": 0.157647505402565, "learning_rate": 8.224614346612692e-05, "loss": 0.7272, "mean_token_accuracy": 0.7875673174858093, "num_tokens": 184821592.0, "step": 5790 }, { "entropy": 0.6243465952575207, "epoch": 0.5328088970161183, "grad_norm": 0.15202929079532623, "learning_rate": 8.224307663998528e-05, "loss": 0.6246, "mean_token_accuracy": 0.8159869015216827, "num_tokens": 184853416.0, "step": 5791 }, { "entropy": 0.7661978676915169, "epoch": 0.5329009033875596, "grad_norm": 0.154068723320961, "learning_rate": 8.224000981384365e-05, "loss": 0.7491, "mean_token_accuracy": 0.7763287089765072, "num_tokens": 184884705.0, "step": 5792 }, { "entropy": 0.8576608709990978, "epoch": 0.5329929097590008, "grad_norm": 0.15632180869579315, "learning_rate": 8.223694298770202e-05, "loss": 0.8567, "mean_token_accuracy": 0.7456969134509563, "num_tokens": 184916670.0, "step": 5793 }, { "entropy": 0.9565602913498878, "epoch": 0.5330849161304421, "grad_norm": 0.16451406478881836, "learning_rate": 8.223387616156041e-05, "loss": 0.964, "mean_token_accuracy": 0.7249942570924759, "num_tokens": 184948659.0, "step": 5794 }, { "entropy": 0.7953718584030867, "epoch": 0.5331769225018833, "grad_norm": 0.16317245364189148, "learning_rate": 8.223080933541878e-05, "loss": 0.7786, "mean_token_accuracy": 0.7734069786965847, "num_tokens": 184980739.0, "step": 5795 }, { "entropy": 0.7744242306798697, "epoch": 0.5332689288733244, "grad_norm": 0.16108928620815277, "learning_rate": 8.222774250927715e-05, "loss": 0.7656, "mean_token_accuracy": 0.7770788297057152, "num_tokens": 185012999.0, "step": 5796 }, { "entropy": 0.7925224434584379, "epoch": 0.5333609352447657, "grad_norm": 0.15753114223480225, "learning_rate": 8.222467568313553e-05, "loss": 0.787, "mean_token_accuracy": 0.7695040851831436, "num_tokens": 185044991.0, "step": 5797 }, { "entropy": 0.8012562468647957, "epoch": 0.5334529416162069, "grad_norm": 0.1656530797481537, "learning_rate": 8.22216088569939e-05, "loss": 0.8102, "mean_token_accuracy": 0.766283392906189, "num_tokens": 185077233.0, "step": 5798 }, { "entropy": 0.8891956117004156, "epoch": 0.5335449479876482, "grad_norm": 0.16409164667129517, "learning_rate": 8.221854203085228e-05, "loss": 0.8899, "mean_token_accuracy": 0.7442319914698601, "num_tokens": 185109639.0, "step": 5799 }, { "entropy": 0.7759798392653465, "epoch": 0.5336369543590894, "grad_norm": 0.15283527970314026, "learning_rate": 8.221547520471065e-05, "loss": 0.7535, "mean_token_accuracy": 0.7812405116856098, "num_tokens": 185141646.0, "step": 5800 }, { "entropy": 0.8558791168034077, "epoch": 0.5337289607305306, "grad_norm": 0.15812109410762787, "learning_rate": 8.221240837856903e-05, "loss": 0.8429, "mean_token_accuracy": 0.7541017271578312, "num_tokens": 185173406.0, "step": 5801 }, { "entropy": 0.8747222758829594, "epoch": 0.5338209671019718, "grad_norm": 0.15602602064609528, "learning_rate": 8.22093415524274e-05, "loss": 0.8529, "mean_token_accuracy": 0.7501098401844501, "num_tokens": 185205505.0, "step": 5802 }, { "entropy": 0.7581949289888144, "epoch": 0.533912973473413, "grad_norm": 0.15642602741718292, "learning_rate": 8.220627472628577e-05, "loss": 0.7488, "mean_token_accuracy": 0.777774665504694, "num_tokens": 185237343.0, "step": 5803 }, { "entropy": 0.788281999528408, "epoch": 0.5340049798448543, "grad_norm": 0.16833774745464325, "learning_rate": 8.220320790014415e-05, "loss": 0.8, "mean_token_accuracy": 0.7678908780217171, "num_tokens": 185269327.0, "step": 5804 }, { "entropy": 0.8446223363280296, "epoch": 0.5340969862162955, "grad_norm": 0.1631384938955307, "learning_rate": 8.220014107400253e-05, "loss": 0.8358, "mean_token_accuracy": 0.755794420838356, "num_tokens": 185300974.0, "step": 5805 }, { "entropy": 0.7713281232863665, "epoch": 0.5341889925877367, "grad_norm": 0.15960997343063354, "learning_rate": 8.21970742478609e-05, "loss": 0.7427, "mean_token_accuracy": 0.7828894481062889, "num_tokens": 185332493.0, "step": 5806 }, { "entropy": 0.8207415286451578, "epoch": 0.5342809989591779, "grad_norm": 0.16311292350292206, "learning_rate": 8.219400742171926e-05, "loss": 0.8082, "mean_token_accuracy": 0.7644265294075012, "num_tokens": 185363993.0, "step": 5807 }, { "entropy": 0.7605978883802891, "epoch": 0.5343730053306192, "grad_norm": 0.15698279440402985, "learning_rate": 8.219094059557763e-05, "loss": 0.765, "mean_token_accuracy": 0.7729236893355846, "num_tokens": 185396330.0, "step": 5808 }, { "entropy": 0.7481817342340946, "epoch": 0.5344650117020604, "grad_norm": 0.15782663226127625, "learning_rate": 8.218787376943601e-05, "loss": 0.7459, "mean_token_accuracy": 0.7809555791318417, "num_tokens": 185428327.0, "step": 5809 }, { "entropy": 0.8196348771452904, "epoch": 0.5345570180735016, "grad_norm": 0.16724160313606262, "learning_rate": 8.21848069432944e-05, "loss": 0.8197, "mean_token_accuracy": 0.758535772562027, "num_tokens": 185459868.0, "step": 5810 }, { "entropy": 0.7224076967686415, "epoch": 0.5346490244449428, "grad_norm": 0.1539294719696045, "learning_rate": 8.218174011715276e-05, "loss": 0.7027, "mean_token_accuracy": 0.7938341088593006, "num_tokens": 185491615.0, "step": 5811 }, { "entropy": 0.7721347659826279, "epoch": 0.534741030816384, "grad_norm": 0.16000866889953613, "learning_rate": 8.217867329101113e-05, "loss": 0.7701, "mean_token_accuracy": 0.7739432230591774, "num_tokens": 185523798.0, "step": 5812 }, { "entropy": 0.7123412392102182, "epoch": 0.5348330371878253, "grad_norm": 0.15873681008815765, "learning_rate": 8.217560646486951e-05, "loss": 0.7198, "mean_token_accuracy": 0.7869804985821247, "num_tokens": 185555774.0, "step": 5813 }, { "entropy": 0.7439512684941292, "epoch": 0.5349250435592665, "grad_norm": 0.15809549391269684, "learning_rate": 8.217253963872788e-05, "loss": 0.7519, "mean_token_accuracy": 0.7806971035897732, "num_tokens": 185587925.0, "step": 5814 }, { "entropy": 0.712457787245512, "epoch": 0.5350170499307078, "grad_norm": 0.15401558578014374, "learning_rate": 8.216947281258626e-05, "loss": 0.6903, "mean_token_accuracy": 0.7936535961925983, "num_tokens": 185620246.0, "step": 5815 }, { "entropy": 0.7476136442273855, "epoch": 0.5351090563021489, "grad_norm": 0.16071617603302002, "learning_rate": 8.216640598644463e-05, "loss": 0.7366, "mean_token_accuracy": 0.7824256494641304, "num_tokens": 185652617.0, "step": 5816 }, { "entropy": 0.7219822518527508, "epoch": 0.5352010626735901, "grad_norm": 0.15627896785736084, "learning_rate": 8.216333916030301e-05, "loss": 0.7153, "mean_token_accuracy": 0.7927773967385292, "num_tokens": 185685324.0, "step": 5817 }, { "entropy": 0.6895804200321436, "epoch": 0.5352930690450314, "grad_norm": 0.15463320910930634, "learning_rate": 8.216027233416138e-05, "loss": 0.6755, "mean_token_accuracy": 0.8021435104310513, "num_tokens": 185717214.0, "step": 5818 }, { "entropy": 0.7275930941104889, "epoch": 0.5353850754164726, "grad_norm": 0.15874317288398743, "learning_rate": 8.215720550801975e-05, "loss": 0.709, "mean_token_accuracy": 0.7917944714426994, "num_tokens": 185749431.0, "step": 5819 }, { "entropy": 0.7945543993264437, "epoch": 0.5354770817879139, "grad_norm": 0.16608723998069763, "learning_rate": 8.215413868187813e-05, "loss": 0.7984, "mean_token_accuracy": 0.770495243370533, "num_tokens": 185781602.0, "step": 5820 }, { "entropy": 0.8622832093387842, "epoch": 0.535569088159355, "grad_norm": 0.1567726880311966, "learning_rate": 8.215107185573651e-05, "loss": 0.8462, "mean_token_accuracy": 0.7503764256834984, "num_tokens": 185813671.0, "step": 5821 }, { "entropy": 0.7596089374274015, "epoch": 0.5356610945307962, "grad_norm": 0.15828540921211243, "learning_rate": 8.214800502959488e-05, "loss": 0.7346, "mean_token_accuracy": 0.7875235863029957, "num_tokens": 185846210.0, "step": 5822 }, { "entropy": 0.8197419513016939, "epoch": 0.5357531009022375, "grad_norm": 0.1564648449420929, "learning_rate": 8.214493820345325e-05, "loss": 0.8099, "mean_token_accuracy": 0.7623622082173824, "num_tokens": 185878207.0, "step": 5823 }, { "entropy": 0.7712088469415903, "epoch": 0.5358451072736787, "grad_norm": 0.1649211198091507, "learning_rate": 8.214187137731161e-05, "loss": 0.741, "mean_token_accuracy": 0.7819048389792442, "num_tokens": 185910197.0, "step": 5824 }, { "entropy": 0.7264259122312069, "epoch": 0.53593711364512, "grad_norm": 0.16039322316646576, "learning_rate": 8.213880455117e-05, "loss": 0.7369, "mean_token_accuracy": 0.7826430127024651, "num_tokens": 185942546.0, "step": 5825 }, { "entropy": 0.8666879646480083, "epoch": 0.5360291200165611, "grad_norm": 0.16505859792232513, "learning_rate": 8.213573772502838e-05, "loss": 0.8682, "mean_token_accuracy": 0.7508969567716122, "num_tokens": 185975234.0, "step": 5826 }, { "entropy": 0.733958438038826, "epoch": 0.5361211263880024, "grad_norm": 0.1577727198600769, "learning_rate": 8.213267089888674e-05, "loss": 0.7088, "mean_token_accuracy": 0.7912325859069824, "num_tokens": 186006756.0, "step": 5827 }, { "entropy": 0.747377747669816, "epoch": 0.5362131327594436, "grad_norm": 0.1511530727148056, "learning_rate": 8.212960407274513e-05, "loss": 0.7235, "mean_token_accuracy": 0.7868692241609097, "num_tokens": 186039467.0, "step": 5828 }, { "entropy": 0.7768059931695461, "epoch": 0.5363051391308848, "grad_norm": 0.1615045815706253, "learning_rate": 8.21265372466035e-05, "loss": 0.7615, "mean_token_accuracy": 0.7761957868933678, "num_tokens": 186071254.0, "step": 5829 }, { "entropy": 0.7747312281280756, "epoch": 0.5363971455023261, "grad_norm": 0.15529121458530426, "learning_rate": 8.212347042046186e-05, "loss": 0.7566, "mean_token_accuracy": 0.7809642516076565, "num_tokens": 186103692.0, "step": 5830 }, { "entropy": 0.7500335313379765, "epoch": 0.5364891518737672, "grad_norm": 0.1652008295059204, "learning_rate": 8.212040359432024e-05, "loss": 0.7599, "mean_token_accuracy": 0.7743450999259949, "num_tokens": 186135668.0, "step": 5831 }, { "entropy": 0.7558564115315676, "epoch": 0.5365811582452085, "grad_norm": 0.1578039675951004, "learning_rate": 8.211733676817862e-05, "loss": 0.7512, "mean_token_accuracy": 0.7793004736304283, "num_tokens": 186166993.0, "step": 5832 }, { "entropy": 0.7058660984039307, "epoch": 0.5366731646166497, "grad_norm": 0.15869933366775513, "learning_rate": 8.211426994203699e-05, "loss": 0.7136, "mean_token_accuracy": 0.7898683063685894, "num_tokens": 186198165.0, "step": 5833 }, { "entropy": 0.7051579747349024, "epoch": 0.536765170988091, "grad_norm": 0.1491931974887848, "learning_rate": 8.211120311589536e-05, "loss": 0.6869, "mean_token_accuracy": 0.8002192415297031, "num_tokens": 186230395.0, "step": 5834 }, { "entropy": 0.8138199746608734, "epoch": 0.5368571773595322, "grad_norm": 0.16188111901283264, "learning_rate": 8.210813628975373e-05, "loss": 0.8087, "mean_token_accuracy": 0.7627164758741856, "num_tokens": 186261615.0, "step": 5835 }, { "entropy": 0.7136205323040485, "epoch": 0.5369491837309733, "grad_norm": 0.15461748838424683, "learning_rate": 8.210506946361212e-05, "loss": 0.6917, "mean_token_accuracy": 0.7934921607375145, "num_tokens": 186293261.0, "step": 5836 }, { "entropy": 0.8933968227356672, "epoch": 0.5370411901024146, "grad_norm": 0.15976552665233612, "learning_rate": 8.210200263747049e-05, "loss": 0.8918, "mean_token_accuracy": 0.7404701858758926, "num_tokens": 186325548.0, "step": 5837 }, { "entropy": 0.6722179111093283, "epoch": 0.5371331964738558, "grad_norm": 0.15226596593856812, "learning_rate": 8.209893581132886e-05, "loss": 0.6564, "mean_token_accuracy": 0.798347145318985, "num_tokens": 186357388.0, "step": 5838 }, { "entropy": 0.7201992496848106, "epoch": 0.5372252028452971, "grad_norm": 0.1588502824306488, "learning_rate": 8.209586898518723e-05, "loss": 0.7131, "mean_token_accuracy": 0.7895253747701645, "num_tokens": 186389772.0, "step": 5839 }, { "entropy": 0.8920835461467505, "epoch": 0.5373172092167383, "grad_norm": 0.16072072088718414, "learning_rate": 8.209280215904561e-05, "loss": 0.8818, "mean_token_accuracy": 0.7430052272975445, "num_tokens": 186421782.0, "step": 5840 }, { "entropy": 0.8426052257418633, "epoch": 0.5374092155881794, "grad_norm": 0.16033776104450226, "learning_rate": 8.208973533290399e-05, "loss": 0.8419, "mean_token_accuracy": 0.7545470595359802, "num_tokens": 186453703.0, "step": 5841 }, { "entropy": 0.6156984930858016, "epoch": 0.5375012219596207, "grad_norm": 0.14481262862682343, "learning_rate": 8.208666850676236e-05, "loss": 0.6087, "mean_token_accuracy": 0.8191554918885231, "num_tokens": 186486208.0, "step": 5842 }, { "entropy": 0.7553789652884007, "epoch": 0.5375932283310619, "grad_norm": 0.15636220574378967, "learning_rate": 8.208360168062072e-05, "loss": 0.7587, "mean_token_accuracy": 0.7766820341348648, "num_tokens": 186518218.0, "step": 5843 }, { "entropy": 0.7869174163788557, "epoch": 0.5376852347025032, "grad_norm": 0.16337697207927704, "learning_rate": 8.20805348544791e-05, "loss": 0.8067, "mean_token_accuracy": 0.7667366527020931, "num_tokens": 186549793.0, "step": 5844 }, { "entropy": 0.7396007534116507, "epoch": 0.5377772410739444, "grad_norm": 0.1515296846628189, "learning_rate": 8.207746802833747e-05, "loss": 0.7389, "mean_token_accuracy": 0.7812394760549068, "num_tokens": 186581515.0, "step": 5845 }, { "entropy": 0.8286797218024731, "epoch": 0.5378692474453856, "grad_norm": 0.1595921516418457, "learning_rate": 8.207440120219586e-05, "loss": 0.8107, "mean_token_accuracy": 0.759458277374506, "num_tokens": 186613533.0, "step": 5846 }, { "entropy": 0.726499555632472, "epoch": 0.5379612538168268, "grad_norm": 0.15632034838199615, "learning_rate": 8.207133437605422e-05, "loss": 0.7108, "mean_token_accuracy": 0.7854499667882919, "num_tokens": 186645756.0, "step": 5847 }, { "entropy": 0.7470642309635878, "epoch": 0.538053260188268, "grad_norm": 0.1487291306257248, "learning_rate": 8.20682675499126e-05, "loss": 0.7414, "mean_token_accuracy": 0.7802420817315578, "num_tokens": 186678380.0, "step": 5848 }, { "entropy": 0.767560413107276, "epoch": 0.5381452665597093, "grad_norm": 0.15363140404224396, "learning_rate": 8.206520072377097e-05, "loss": 0.7392, "mean_token_accuracy": 0.7873119786381721, "num_tokens": 186710308.0, "step": 5849 }, { "entropy": 0.9020460546016693, "epoch": 0.5382372729311505, "grad_norm": 0.1696753352880478, "learning_rate": 8.206213389762934e-05, "loss": 0.9086, "mean_token_accuracy": 0.739350076764822, "num_tokens": 186742111.0, "step": 5850 }, { "entropy": 0.8374765180051327, "epoch": 0.5383292793025917, "grad_norm": 0.17332322895526886, "learning_rate": 8.205906707148772e-05, "loss": 0.8322, "mean_token_accuracy": 0.7558544687926769, "num_tokens": 186773944.0, "step": 5851 }, { "entropy": 0.8413414880633354, "epoch": 0.5384212856740329, "grad_norm": 0.15802694857120514, "learning_rate": 8.20560002453461e-05, "loss": 0.8294, "mean_token_accuracy": 0.7608566582202911, "num_tokens": 186805300.0, "step": 5852 }, { "entropy": 0.747914019972086, "epoch": 0.5385132920454742, "grad_norm": 0.14644400775432587, "learning_rate": 8.205293341920447e-05, "loss": 0.7178, "mean_token_accuracy": 0.7872147634625435, "num_tokens": 186837636.0, "step": 5853 }, { "entropy": 0.8528961259871721, "epoch": 0.5386052984169154, "grad_norm": 0.15719470381736755, "learning_rate": 8.204986659306284e-05, "loss": 0.8355, "mean_token_accuracy": 0.7570614069700241, "num_tokens": 186869322.0, "step": 5854 }, { "entropy": 0.8252154476940632, "epoch": 0.5386973047883566, "grad_norm": 0.16003841161727905, "learning_rate": 8.204679976692121e-05, "loss": 0.8225, "mean_token_accuracy": 0.7637854367494583, "num_tokens": 186901660.0, "step": 5855 }, { "entropy": 0.7645006030797958, "epoch": 0.5387893111597978, "grad_norm": 0.16269372403621674, "learning_rate": 8.204373294077959e-05, "loss": 0.7462, "mean_token_accuracy": 0.7851902693510056, "num_tokens": 186933039.0, "step": 5856 }, { "entropy": 0.8265482038259506, "epoch": 0.538881317531239, "grad_norm": 0.1586083024740219, "learning_rate": 8.204066611463797e-05, "loss": 0.8165, "mean_token_accuracy": 0.7624561749398708, "num_tokens": 186965042.0, "step": 5857 }, { "entropy": 0.8122107237577438, "epoch": 0.5389733239026803, "grad_norm": 0.15972082316875458, "learning_rate": 8.203759928849634e-05, "loss": 0.7923, "mean_token_accuracy": 0.7701973468065262, "num_tokens": 186996326.0, "step": 5858 }, { "entropy": 0.7466899082064629, "epoch": 0.5390653302741215, "grad_norm": 0.15750065445899963, "learning_rate": 8.203453246235472e-05, "loss": 0.7364, "mean_token_accuracy": 0.7812473066151142, "num_tokens": 187027869.0, "step": 5859 }, { "entropy": 0.8188632093369961, "epoch": 0.5391573366455628, "grad_norm": 0.16655106842517853, "learning_rate": 8.203146563621309e-05, "loss": 0.8256, "mean_token_accuracy": 0.760823018848896, "num_tokens": 187059995.0, "step": 5860 }, { "entropy": 0.6913590505719185, "epoch": 0.5392493430170039, "grad_norm": 0.15425269305706024, "learning_rate": 8.202839881007146e-05, "loss": 0.671, "mean_token_accuracy": 0.801261406391859, "num_tokens": 187091858.0, "step": 5861 }, { "entropy": 0.707593047991395, "epoch": 0.5393413493884451, "grad_norm": 0.1650356948375702, "learning_rate": 8.202533198392984e-05, "loss": 0.7028, "mean_token_accuracy": 0.7959205731749535, "num_tokens": 187123468.0, "step": 5862 }, { "entropy": 0.7966682724654675, "epoch": 0.5394333557598864, "grad_norm": 0.15156815946102142, "learning_rate": 8.202226515778822e-05, "loss": 0.7867, "mean_token_accuracy": 0.7672342918813229, "num_tokens": 187155397.0, "step": 5863 }, { "entropy": 0.6713064294308424, "epoch": 0.5395253621313276, "grad_norm": 0.15347035229206085, "learning_rate": 8.201919833164659e-05, "loss": 0.6706, "mean_token_accuracy": 0.7995862849056721, "num_tokens": 187186981.0, "step": 5864 }, { "entropy": 0.7118583489209414, "epoch": 0.5396173685027689, "grad_norm": 0.14986930787563324, "learning_rate": 8.201613150550495e-05, "loss": 0.695, "mean_token_accuracy": 0.7950960136950016, "num_tokens": 187219435.0, "step": 5865 }, { "entropy": 0.6935636028647423, "epoch": 0.53970937487421, "grad_norm": 0.15623502433300018, "learning_rate": 8.201306467936332e-05, "loss": 0.6963, "mean_token_accuracy": 0.7934549488127232, "num_tokens": 187251704.0, "step": 5866 }, { "entropy": 0.8328514881432056, "epoch": 0.5398013812456512, "grad_norm": 0.16100424528121948, "learning_rate": 8.20099978532217e-05, "loss": 0.8258, "mean_token_accuracy": 0.7538568526506424, "num_tokens": 187282938.0, "step": 5867 }, { "entropy": 0.694631764665246, "epoch": 0.5398933876170925, "grad_norm": 0.15304143726825714, "learning_rate": 8.200693102708008e-05, "loss": 0.6679, "mean_token_accuracy": 0.800274420529604, "num_tokens": 187315132.0, "step": 5868 }, { "entropy": 0.7723137158900499, "epoch": 0.5399853939885337, "grad_norm": 0.16311044991016388, "learning_rate": 8.200386420093845e-05, "loss": 0.7727, "mean_token_accuracy": 0.7768317423760891, "num_tokens": 187347196.0, "step": 5869 }, { "entropy": 0.770512642338872, "epoch": 0.540077400359975, "grad_norm": 0.16118472814559937, "learning_rate": 8.200079737479682e-05, "loss": 0.7591, "mean_token_accuracy": 0.7762195989489555, "num_tokens": 187378503.0, "step": 5870 }, { "entropy": 0.7380022015422583, "epoch": 0.5401694067314161, "grad_norm": 0.14892563223838806, "learning_rate": 8.19977305486552e-05, "loss": 0.7367, "mean_token_accuracy": 0.7867210358381271, "num_tokens": 187410575.0, "step": 5871 }, { "entropy": 0.785915507003665, "epoch": 0.5402614131028574, "grad_norm": 0.15104743838310242, "learning_rate": 8.199466372251357e-05, "loss": 0.7694, "mean_token_accuracy": 0.7717872858047485, "num_tokens": 187442888.0, "step": 5872 }, { "entropy": 0.7735243812203407, "epoch": 0.5403534194742986, "grad_norm": 0.15911535918712616, "learning_rate": 8.199159689637195e-05, "loss": 0.761, "mean_token_accuracy": 0.7751880697906017, "num_tokens": 187474828.0, "step": 5873 }, { "entropy": 0.8536039050668478, "epoch": 0.5404454258457398, "grad_norm": 0.16479827463626862, "learning_rate": 8.198853007023032e-05, "loss": 0.8332, "mean_token_accuracy": 0.7584900893270969, "num_tokens": 187505894.0, "step": 5874 }, { "entropy": 0.7854172345250845, "epoch": 0.5405374322171811, "grad_norm": 0.16125966608524323, "learning_rate": 8.19854632440887e-05, "loss": 0.7837, "mean_token_accuracy": 0.7744393795728683, "num_tokens": 187537906.0, "step": 5875 }, { "entropy": 0.7825795356184244, "epoch": 0.5406294385886222, "grad_norm": 0.15767519176006317, "learning_rate": 8.198239641794707e-05, "loss": 0.7453, "mean_token_accuracy": 0.784321703016758, "num_tokens": 187570482.0, "step": 5876 }, { "entropy": 0.8421256113797426, "epoch": 0.5407214449600635, "grad_norm": 0.1625872552394867, "learning_rate": 8.197932959180545e-05, "loss": 0.834, "mean_token_accuracy": 0.7600085996091366, "num_tokens": 187602540.0, "step": 5877 }, { "entropy": 0.7419758308678865, "epoch": 0.5408134513315047, "grad_norm": 0.14451298117637634, "learning_rate": 8.197626276566382e-05, "loss": 0.7197, "mean_token_accuracy": 0.7870784848928452, "num_tokens": 187634860.0, "step": 5878 }, { "entropy": 0.7857984285801649, "epoch": 0.540905457702946, "grad_norm": 0.16802562773227692, "learning_rate": 8.19731959395222e-05, "loss": 0.7993, "mean_token_accuracy": 0.7723062075674534, "num_tokens": 187667036.0, "step": 5879 }, { "entropy": 0.7289801295846701, "epoch": 0.5409974640743872, "grad_norm": 0.15692025423049927, "learning_rate": 8.197012911338057e-05, "loss": 0.7199, "mean_token_accuracy": 0.791054017841816, "num_tokens": 187698875.0, "step": 5880 }, { "entropy": 0.7041099537163973, "epoch": 0.5410894704458283, "grad_norm": 0.15416887402534485, "learning_rate": 8.196706228723893e-05, "loss": 0.6981, "mean_token_accuracy": 0.7969805561006069, "num_tokens": 187730071.0, "step": 5881 }, { "entropy": 0.8432863764464855, "epoch": 0.5411814768172696, "grad_norm": 0.16081881523132324, "learning_rate": 8.196399546109732e-05, "loss": 0.8478, "mean_token_accuracy": 0.7563696652650833, "num_tokens": 187761138.0, "step": 5882 }, { "entropy": 0.8001229949295521, "epoch": 0.5412734831887108, "grad_norm": 0.16103018820285797, "learning_rate": 8.19609286349557e-05, "loss": 0.8156, "mean_token_accuracy": 0.7647743746638298, "num_tokens": 187792895.0, "step": 5883 }, { "entropy": 0.8786112889647484, "epoch": 0.5413654895601521, "grad_norm": 0.16319607198238373, "learning_rate": 8.195786180881407e-05, "loss": 0.8953, "mean_token_accuracy": 0.7427688986063004, "num_tokens": 187824705.0, "step": 5884 }, { "entropy": 0.7098510377109051, "epoch": 0.5414574959315933, "grad_norm": 0.15314920246601105, "learning_rate": 8.195479498267243e-05, "loss": 0.7102, "mean_token_accuracy": 0.7935142889618874, "num_tokens": 187856898.0, "step": 5885 }, { "entropy": 0.8759337235242128, "epoch": 0.5415495023030344, "grad_norm": 0.16363245248794556, "learning_rate": 8.19517281565308e-05, "loss": 0.8739, "mean_token_accuracy": 0.7472553625702858, "num_tokens": 187889087.0, "step": 5886 }, { "entropy": 0.7964016459882259, "epoch": 0.5416415086744757, "grad_norm": 0.16741923987865448, "learning_rate": 8.194866133038918e-05, "loss": 0.8002, "mean_token_accuracy": 0.7689053453505039, "num_tokens": 187921111.0, "step": 5887 }, { "entropy": 0.7641935050487518, "epoch": 0.5417335150459169, "grad_norm": 0.15689386427402496, "learning_rate": 8.194559450424756e-05, "loss": 0.7569, "mean_token_accuracy": 0.7784020006656647, "num_tokens": 187952749.0, "step": 5888 }, { "entropy": 0.8202106095850468, "epoch": 0.5418255214173582, "grad_norm": 0.1583252251148224, "learning_rate": 8.194252767810593e-05, "loss": 0.7982, "mean_token_accuracy": 0.7712692804634571, "num_tokens": 187984783.0, "step": 5889 }, { "entropy": 0.7575062364339828, "epoch": 0.5419175277887994, "grad_norm": 0.1476619839668274, "learning_rate": 8.193946085196431e-05, "loss": 0.7371, "mean_token_accuracy": 0.7801621109247208, "num_tokens": 188016029.0, "step": 5890 }, { "entropy": 0.8780279736965895, "epoch": 0.5420095341602406, "grad_norm": 0.17466923594474792, "learning_rate": 8.193639402582268e-05, "loss": 0.8713, "mean_token_accuracy": 0.7525031752884388, "num_tokens": 188047998.0, "step": 5891 }, { "entropy": 0.831896897405386, "epoch": 0.5421015405316818, "grad_norm": 0.1603645384311676, "learning_rate": 8.193332719968105e-05, "loss": 0.8337, "mean_token_accuracy": 0.7639331668615341, "num_tokens": 188079626.0, "step": 5892 }, { "entropy": 0.9563190042972565, "epoch": 0.542193546903123, "grad_norm": 0.16998320817947388, "learning_rate": 8.193026037353943e-05, "loss": 0.9432, "mean_token_accuracy": 0.7351330295205116, "num_tokens": 188111624.0, "step": 5893 }, { "entropy": 0.813875362277031, "epoch": 0.5422855532745643, "grad_norm": 0.15689437091350555, "learning_rate": 8.192719354739781e-05, "loss": 0.7949, "mean_token_accuracy": 0.7679758369922638, "num_tokens": 188142588.0, "step": 5894 }, { "entropy": 0.811417106539011, "epoch": 0.5423775596460055, "grad_norm": 0.1595936417579651, "learning_rate": 8.192412672125618e-05, "loss": 0.8048, "mean_token_accuracy": 0.7639999985694885, "num_tokens": 188174692.0, "step": 5895 }, { "entropy": 0.7436172403395176, "epoch": 0.5424695660174467, "grad_norm": 0.15250065922737122, "learning_rate": 8.192105989511455e-05, "loss": 0.7181, "mean_token_accuracy": 0.7847483865916729, "num_tokens": 188207030.0, "step": 5896 }, { "entropy": 0.7611798103898764, "epoch": 0.5425615723888879, "grad_norm": 0.1578163206577301, "learning_rate": 8.191799306897292e-05, "loss": 0.7458, "mean_token_accuracy": 0.7789605483412743, "num_tokens": 188239119.0, "step": 5897 }, { "entropy": 0.7894473019987345, "epoch": 0.5426535787603292, "grad_norm": 0.15988454222679138, "learning_rate": 8.19149262428313e-05, "loss": 0.7913, "mean_token_accuracy": 0.7720785290002823, "num_tokens": 188271091.0, "step": 5898 }, { "entropy": 0.7239998187869787, "epoch": 0.5427455851317704, "grad_norm": 0.15587802231311798, "learning_rate": 8.191185941668968e-05, "loss": 0.7328, "mean_token_accuracy": 0.7840808779001236, "num_tokens": 188303254.0, "step": 5899 }, { "entropy": 0.6737504620105028, "epoch": 0.5428375915032116, "grad_norm": 0.15539634227752686, "learning_rate": 8.190879259054805e-05, "loss": 0.671, "mean_token_accuracy": 0.7996317893266678, "num_tokens": 188335992.0, "step": 5900 }, { "entropy": 0.7803961932659149, "epoch": 0.5429295978746528, "grad_norm": 0.1641237586736679, "learning_rate": 8.190572576440641e-05, "loss": 0.789, "mean_token_accuracy": 0.7716703005135059, "num_tokens": 188367751.0, "step": 5901 }, { "entropy": 0.7827111799269915, "epoch": 0.543021604246094, "grad_norm": 0.16071830689907074, "learning_rate": 8.19026589382648e-05, "loss": 0.7854, "mean_token_accuracy": 0.7667513750493526, "num_tokens": 188399897.0, "step": 5902 }, { "entropy": 0.7843384705483913, "epoch": 0.5431136106175353, "grad_norm": 0.16073404252529144, "learning_rate": 8.189959211212316e-05, "loss": 0.7693, "mean_token_accuracy": 0.777114674448967, "num_tokens": 188431459.0, "step": 5903 }, { "entropy": 0.7371756695210934, "epoch": 0.5432056169889765, "grad_norm": 0.15568803250789642, "learning_rate": 8.189652528598154e-05, "loss": 0.7117, "mean_token_accuracy": 0.7895600385963917, "num_tokens": 188462442.0, "step": 5904 }, { "entropy": 0.6826624218374491, "epoch": 0.5432976233604178, "grad_norm": 0.15375441312789917, "learning_rate": 8.189345845983991e-05, "loss": 0.6514, "mean_token_accuracy": 0.8082660771906376, "num_tokens": 188494975.0, "step": 5905 }, { "entropy": 0.8226679004728794, "epoch": 0.5433896297318589, "grad_norm": 0.15510085225105286, "learning_rate": 8.18903916336983e-05, "loss": 0.796, "mean_token_accuracy": 0.7682816758751869, "num_tokens": 188526434.0, "step": 5906 }, { "entropy": 0.8487202040851116, "epoch": 0.5434816361033001, "grad_norm": 0.1589908003807068, "learning_rate": 8.188732480755666e-05, "loss": 0.8118, "mean_token_accuracy": 0.761968731880188, "num_tokens": 188559202.0, "step": 5907 }, { "entropy": 0.7577794771641493, "epoch": 0.5435736424747414, "grad_norm": 0.16000071167945862, "learning_rate": 8.188425798141503e-05, "loss": 0.7594, "mean_token_accuracy": 0.77576994150877, "num_tokens": 188591412.0, "step": 5908 }, { "entropy": 0.8353705182671547, "epoch": 0.5436656488461826, "grad_norm": 0.1569991558790207, "learning_rate": 8.188119115527341e-05, "loss": 0.8206, "mean_token_accuracy": 0.7608648464083672, "num_tokens": 188622951.0, "step": 5909 }, { "entropy": 0.7489158939570189, "epoch": 0.5437576552176239, "grad_norm": 0.1490589827299118, "learning_rate": 8.187812432913179e-05, "loss": 0.7263, "mean_token_accuracy": 0.78627809882164, "num_tokens": 188655314.0, "step": 5910 }, { "entropy": 0.8013288956135511, "epoch": 0.543849661589065, "grad_norm": 0.16687358915805817, "learning_rate": 8.187505750299016e-05, "loss": 0.7807, "mean_token_accuracy": 0.7739051580429077, "num_tokens": 188687292.0, "step": 5911 }, { "entropy": 0.771411806344986, "epoch": 0.5439416679605062, "grad_norm": 0.15679164230823517, "learning_rate": 8.187199067684853e-05, "loss": 0.7689, "mean_token_accuracy": 0.7733996622264385, "num_tokens": 188719797.0, "step": 5912 }, { "entropy": 0.7000000681728125, "epoch": 0.5440336743319475, "grad_norm": 0.16559827327728271, "learning_rate": 8.18689238507069e-05, "loss": 0.6977, "mean_token_accuracy": 0.7969379387795925, "num_tokens": 188752281.0, "step": 5913 }, { "entropy": 0.7741272058337927, "epoch": 0.5441256807033887, "grad_norm": 0.15757760405540466, "learning_rate": 8.186585702456529e-05, "loss": 0.7699, "mean_token_accuracy": 0.7767226062715054, "num_tokens": 188784596.0, "step": 5914 }, { "entropy": 0.747570339590311, "epoch": 0.54421768707483, "grad_norm": 0.16452902555465698, "learning_rate": 8.186279019842366e-05, "loss": 0.7337, "mean_token_accuracy": 0.7827056907117367, "num_tokens": 188815564.0, "step": 5915 }, { "entropy": 0.8234516344964504, "epoch": 0.5443096934462711, "grad_norm": 0.17261259257793427, "learning_rate": 8.185972337228203e-05, "loss": 0.8112, "mean_token_accuracy": 0.7684747092425823, "num_tokens": 188847334.0, "step": 5916 }, { "entropy": 0.8607780672609806, "epoch": 0.5444016998177124, "grad_norm": 0.16004350781440735, "learning_rate": 8.18566565461404e-05, "loss": 0.8579, "mean_token_accuracy": 0.7482473142445087, "num_tokens": 188878938.0, "step": 5917 }, { "entropy": 0.826213177293539, "epoch": 0.5444937061891536, "grad_norm": 0.15926475822925568, "learning_rate": 8.185358971999878e-05, "loss": 0.8271, "mean_token_accuracy": 0.7602788098156452, "num_tokens": 188911122.0, "step": 5918 }, { "entropy": 0.7459573373198509, "epoch": 0.5445857125605948, "grad_norm": 0.1667264699935913, "learning_rate": 8.185052289385716e-05, "loss": 0.7456, "mean_token_accuracy": 0.7835785187780857, "num_tokens": 188942613.0, "step": 5919 }, { "entropy": 0.7287417035549879, "epoch": 0.5446777189320361, "grad_norm": 0.16512829065322876, "learning_rate": 8.184745606771553e-05, "loss": 0.7274, "mean_token_accuracy": 0.7858911976218224, "num_tokens": 188974977.0, "step": 5920 }, { "entropy": 0.7054292242974043, "epoch": 0.5447697253034772, "grad_norm": 0.159592866897583, "learning_rate": 8.184438924157391e-05, "loss": 0.6879, "mean_token_accuracy": 0.7961764819920063, "num_tokens": 189007182.0, "step": 5921 }, { "entropy": 0.7231014259159565, "epoch": 0.5448617316749185, "grad_norm": 0.151780903339386, "learning_rate": 8.184132241543227e-05, "loss": 0.6796, "mean_token_accuracy": 0.7994843050837517, "num_tokens": 189039504.0, "step": 5922 }, { "entropy": 0.7166458256542683, "epoch": 0.5449537380463597, "grad_norm": 0.156014546751976, "learning_rate": 8.183825558929064e-05, "loss": 0.7184, "mean_token_accuracy": 0.7900278940796852, "num_tokens": 189070721.0, "step": 5923 }, { "entropy": 0.6785057075321674, "epoch": 0.545045744417801, "grad_norm": 0.15458762645721436, "learning_rate": 8.183518876314902e-05, "loss": 0.6714, "mean_token_accuracy": 0.8043172769248486, "num_tokens": 189103064.0, "step": 5924 }, { "entropy": 0.7915324196219444, "epoch": 0.5451377507892422, "grad_norm": 0.1516140252351761, "learning_rate": 8.18321219370074e-05, "loss": 0.7848, "mean_token_accuracy": 0.7664353288710117, "num_tokens": 189135240.0, "step": 5925 }, { "entropy": 0.7799247447401285, "epoch": 0.5452297571606833, "grad_norm": 0.15659765899181366, "learning_rate": 8.182905511086577e-05, "loss": 0.7844, "mean_token_accuracy": 0.7699661515653133, "num_tokens": 189167741.0, "step": 5926 }, { "entropy": 0.7206703200936317, "epoch": 0.5453217635321246, "grad_norm": 0.15322043001651764, "learning_rate": 8.182598828472414e-05, "loss": 0.7166, "mean_token_accuracy": 0.7900163196027279, "num_tokens": 189200021.0, "step": 5927 }, { "entropy": 0.7147715678438544, "epoch": 0.5454137699035658, "grad_norm": 0.1598958820104599, "learning_rate": 8.182292145858251e-05, "loss": 0.7067, "mean_token_accuracy": 0.796906378120184, "num_tokens": 189232306.0, "step": 5928 }, { "entropy": 0.8964174315333366, "epoch": 0.5455057762750071, "grad_norm": 0.16555264592170715, "learning_rate": 8.181985463244089e-05, "loss": 0.8967, "mean_token_accuracy": 0.7421503439545631, "num_tokens": 189263565.0, "step": 5929 }, { "entropy": 0.7223835587501526, "epoch": 0.5455977826464483, "grad_norm": 0.15395823121070862, "learning_rate": 8.181678780629927e-05, "loss": 0.7089, "mean_token_accuracy": 0.7951339334249496, "num_tokens": 189295819.0, "step": 5930 }, { "entropy": 0.7396577131003141, "epoch": 0.5456897890178894, "grad_norm": 0.16273778676986694, "learning_rate": 8.181372098015764e-05, "loss": 0.7304, "mean_token_accuracy": 0.7903311811387539, "num_tokens": 189327431.0, "step": 5931 }, { "entropy": 0.7338634124025702, "epoch": 0.5457817953893307, "grad_norm": 0.17111089825630188, "learning_rate": 8.181065415401601e-05, "loss": 0.7387, "mean_token_accuracy": 0.7881190031766891, "num_tokens": 189359900.0, "step": 5932 }, { "entropy": 0.799620721489191, "epoch": 0.5458738017607719, "grad_norm": 0.16098205745220184, "learning_rate": 8.180758732787439e-05, "loss": 0.7991, "mean_token_accuracy": 0.7695279233157635, "num_tokens": 189391651.0, "step": 5933 }, { "entropy": 0.8324064500629902, "epoch": 0.5459658081322132, "grad_norm": 0.16574826836585999, "learning_rate": 8.180452050173276e-05, "loss": 0.8118, "mean_token_accuracy": 0.7670904248952866, "num_tokens": 189423459.0, "step": 5934 }, { "entropy": 0.783847002312541, "epoch": 0.5460578145036544, "grad_norm": 0.15079179406166077, "learning_rate": 8.180145367559114e-05, "loss": 0.7648, "mean_token_accuracy": 0.7740569412708282, "num_tokens": 189455519.0, "step": 5935 }, { "entropy": 0.7552102357149124, "epoch": 0.5461498208750956, "grad_norm": 0.1573300063610077, "learning_rate": 8.17983868494495e-05, "loss": 0.7439, "mean_token_accuracy": 0.7831345722079277, "num_tokens": 189487735.0, "step": 5936 }, { "entropy": 0.6264612637460232, "epoch": 0.5462418272465368, "grad_norm": 0.1484707146883011, "learning_rate": 8.179532002330789e-05, "loss": 0.6077, "mean_token_accuracy": 0.816211149096489, "num_tokens": 189519451.0, "step": 5937 }, { "entropy": 0.8330480381846428, "epoch": 0.546333833617978, "grad_norm": 0.16059932112693787, "learning_rate": 8.179225319716626e-05, "loss": 0.8381, "mean_token_accuracy": 0.7595575302839279, "num_tokens": 189550731.0, "step": 5938 }, { "entropy": 0.7569078728556633, "epoch": 0.5464258399894193, "grad_norm": 0.1631501317024231, "learning_rate": 8.178918637102462e-05, "loss": 0.7609, "mean_token_accuracy": 0.7765948213636875, "num_tokens": 189582616.0, "step": 5939 }, { "entropy": 0.7061306163668633, "epoch": 0.5465178463608605, "grad_norm": 0.15236112475395203, "learning_rate": 8.1786119544883e-05, "loss": 0.6904, "mean_token_accuracy": 0.7943682558834553, "num_tokens": 189615050.0, "step": 5940 }, { "entropy": 0.6648759841918945, "epoch": 0.5466098527323017, "grad_norm": 0.1481602042913437, "learning_rate": 8.178305271874139e-05, "loss": 0.6512, "mean_token_accuracy": 0.8070805333554745, "num_tokens": 189647399.0, "step": 5941 }, { "entropy": 0.7537821866571903, "epoch": 0.5467018591037429, "grad_norm": 0.15628133714199066, "learning_rate": 8.177998589259975e-05, "loss": 0.7382, "mean_token_accuracy": 0.7850614823400974, "num_tokens": 189679122.0, "step": 5942 }, { "entropy": 0.7334588058292866, "epoch": 0.5467938654751842, "grad_norm": 0.1558654010295868, "learning_rate": 8.177691906645812e-05, "loss": 0.7087, "mean_token_accuracy": 0.7898502685129642, "num_tokens": 189710645.0, "step": 5943 }, { "entropy": 0.790848683565855, "epoch": 0.5468858718466254, "grad_norm": 0.1553385704755783, "learning_rate": 8.177385224031649e-05, "loss": 0.7719, "mean_token_accuracy": 0.7784430049359798, "num_tokens": 189742418.0, "step": 5944 }, { "entropy": 0.7136029954999685, "epoch": 0.5469778782180666, "grad_norm": 0.16431604325771332, "learning_rate": 8.177078541417487e-05, "loss": 0.6874, "mean_token_accuracy": 0.7938651107251644, "num_tokens": 189774291.0, "step": 5945 }, { "entropy": 0.736778249964118, "epoch": 0.5470698845895078, "grad_norm": 0.15942849218845367, "learning_rate": 8.176771858803325e-05, "loss": 0.7436, "mean_token_accuracy": 0.7861796133220196, "num_tokens": 189806737.0, "step": 5946 }, { "entropy": 0.6865629218518734, "epoch": 0.547161890960949, "grad_norm": 0.14884160459041595, "learning_rate": 8.176465176189162e-05, "loss": 0.6656, "mean_token_accuracy": 0.803143922239542, "num_tokens": 189838824.0, "step": 5947 }, { "entropy": 0.6863450277596712, "epoch": 0.5472538973323903, "grad_norm": 0.1511482447385788, "learning_rate": 8.176158493574999e-05, "loss": 0.675, "mean_token_accuracy": 0.7961273416876793, "num_tokens": 189871296.0, "step": 5948 }, { "entropy": 0.8125578798353672, "epoch": 0.5473459037038315, "grad_norm": 0.16279666125774384, "learning_rate": 8.175851810960837e-05, "loss": 0.8211, "mean_token_accuracy": 0.7608473524451256, "num_tokens": 189903068.0, "step": 5949 }, { "entropy": 0.6833231169730425, "epoch": 0.5474379100752728, "grad_norm": 0.163343608379364, "learning_rate": 8.175545128346674e-05, "loss": 0.6793, "mean_token_accuracy": 0.7997404038906097, "num_tokens": 189935121.0, "step": 5950 }, { "entropy": 0.7700577862560749, "epoch": 0.5475299164467139, "grad_norm": 0.16466020047664642, "learning_rate": 8.175238445732512e-05, "loss": 0.773, "mean_token_accuracy": 0.7741696909070015, "num_tokens": 189966119.0, "step": 5951 }, { "entropy": 0.8340642116963863, "epoch": 0.5476219228181551, "grad_norm": 0.15206298232078552, "learning_rate": 8.17493176311835e-05, "loss": 0.8366, "mean_token_accuracy": 0.7600961253046989, "num_tokens": 189998377.0, "step": 5952 }, { "entropy": 0.800065852701664, "epoch": 0.5477139291895964, "grad_norm": 0.17626942694187164, "learning_rate": 8.174625080504187e-05, "loss": 0.8295, "mean_token_accuracy": 0.7611846104264259, "num_tokens": 190029841.0, "step": 5953 }, { "entropy": 0.7243795469403267, "epoch": 0.5478059355610376, "grad_norm": 0.15090879797935486, "learning_rate": 8.174318397890024e-05, "loss": 0.715, "mean_token_accuracy": 0.7906467840075493, "num_tokens": 190061514.0, "step": 5954 }, { "entropy": 0.7380406372249126, "epoch": 0.5478979419324789, "grad_norm": 0.1544695496559143, "learning_rate": 8.17401171527586e-05, "loss": 0.7261, "mean_token_accuracy": 0.7893823496997356, "num_tokens": 190093816.0, "step": 5955 }, { "entropy": 0.876972483471036, "epoch": 0.54798994830392, "grad_norm": 0.16142427921295166, "learning_rate": 8.1737050326617e-05, "loss": 0.8674, "mean_token_accuracy": 0.7467220351099968, "num_tokens": 190126329.0, "step": 5956 }, { "entropy": 0.7489898111671209, "epoch": 0.5480819546753612, "grad_norm": 0.15326781570911407, "learning_rate": 8.173398350047537e-05, "loss": 0.7285, "mean_token_accuracy": 0.7890992201864719, "num_tokens": 190159056.0, "step": 5957 }, { "entropy": 0.8465461302548647, "epoch": 0.5481739610468025, "grad_norm": 0.159610778093338, "learning_rate": 8.173091667433373e-05, "loss": 0.842, "mean_token_accuracy": 0.7538911774754524, "num_tokens": 190191399.0, "step": 5958 }, { "entropy": 0.6975799165666103, "epoch": 0.5482659674182437, "grad_norm": 0.14913909137248993, "learning_rate": 8.17278498481921e-05, "loss": 0.6831, "mean_token_accuracy": 0.7986496426165104, "num_tokens": 190224061.0, "step": 5959 }, { "entropy": 0.8778853118419647, "epoch": 0.548357973789685, "grad_norm": 0.16104376316070557, "learning_rate": 8.172478302205048e-05, "loss": 0.8452, "mean_token_accuracy": 0.7531905919313431, "num_tokens": 190255741.0, "step": 5960 }, { "entropy": 0.8323763124644756, "epoch": 0.5484499801611261, "grad_norm": 0.1552756279706955, "learning_rate": 8.172171619590887e-05, "loss": 0.809, "mean_token_accuracy": 0.7628321759402752, "num_tokens": 190287382.0, "step": 5961 }, { "entropy": 0.8368029780685902, "epoch": 0.5485419865325674, "grad_norm": 0.16225722432136536, "learning_rate": 8.171864936976723e-05, "loss": 0.8156, "mean_token_accuracy": 0.7588170729577541, "num_tokens": 190318954.0, "step": 5962 }, { "entropy": 0.8904872201383114, "epoch": 0.5486339929040086, "grad_norm": 0.16282087564468384, "learning_rate": 8.17155825436256e-05, "loss": 0.8733, "mean_token_accuracy": 0.7466446273028851, "num_tokens": 190350197.0, "step": 5963 }, { "entropy": 0.7524302285164595, "epoch": 0.5487259992754498, "grad_norm": 0.14911939203739166, "learning_rate": 8.171251571748398e-05, "loss": 0.7379, "mean_token_accuracy": 0.7864252515137196, "num_tokens": 190382965.0, "step": 5964 }, { "entropy": 0.7523713950067759, "epoch": 0.5488180056468911, "grad_norm": 0.1702347993850708, "learning_rate": 8.170944889134235e-05, "loss": 0.7483, "mean_token_accuracy": 0.7823081277310848, "num_tokens": 190413804.0, "step": 5965 }, { "entropy": 0.6707523446530104, "epoch": 0.5489100120183322, "grad_norm": 0.14974647760391235, "learning_rate": 8.170638206520073e-05, "loss": 0.6492, "mean_token_accuracy": 0.8047818914055824, "num_tokens": 190445983.0, "step": 5966 }, { "entropy": 0.6782028563320637, "epoch": 0.5490020183897735, "grad_norm": 0.1605050414800644, "learning_rate": 8.17033152390591e-05, "loss": 0.6587, "mean_token_accuracy": 0.8097090609371662, "num_tokens": 190477952.0, "step": 5967 }, { "entropy": 0.6639335732907057, "epoch": 0.5490940247612147, "grad_norm": 0.1554328054189682, "learning_rate": 8.170024841291748e-05, "loss": 0.6569, "mean_token_accuracy": 0.804432787001133, "num_tokens": 190510694.0, "step": 5968 }, { "entropy": 0.8310938589274883, "epoch": 0.549186031132656, "grad_norm": 0.16171905398368835, "learning_rate": 8.169718158677585e-05, "loss": 0.8193, "mean_token_accuracy": 0.7589053362607956, "num_tokens": 190542505.0, "step": 5969 }, { "entropy": 0.774412602186203, "epoch": 0.5492780375040972, "grad_norm": 0.15266726911067963, "learning_rate": 8.169411476063422e-05, "loss": 0.7795, "mean_token_accuracy": 0.7744964696466923, "num_tokens": 190575029.0, "step": 5970 }, { "entropy": 0.789188627153635, "epoch": 0.5493700438755383, "grad_norm": 0.16331847012043, "learning_rate": 8.16910479344926e-05, "loss": 0.7887, "mean_token_accuracy": 0.7721030525863171, "num_tokens": 190606843.0, "step": 5971 }, { "entropy": 0.8801970444619656, "epoch": 0.5494620502469796, "grad_norm": 0.1640438735485077, "learning_rate": 8.168798110835098e-05, "loss": 0.8863, "mean_token_accuracy": 0.7420910485088825, "num_tokens": 190638213.0, "step": 5972 }, { "entropy": 0.7599710635840893, "epoch": 0.5495540566184208, "grad_norm": 0.1692570447921753, "learning_rate": 8.168491428220935e-05, "loss": 0.7748, "mean_token_accuracy": 0.7696486860513687, "num_tokens": 190669909.0, "step": 5973 }, { "entropy": 0.8596623726189137, "epoch": 0.5496460629898621, "grad_norm": 0.15719108283519745, "learning_rate": 8.168184745606772e-05, "loss": 0.8504, "mean_token_accuracy": 0.7539977468550205, "num_tokens": 190702179.0, "step": 5974 }, { "entropy": 0.7222054917365313, "epoch": 0.5497380693613033, "grad_norm": 0.15574540197849274, "learning_rate": 8.167878062992608e-05, "loss": 0.7329, "mean_token_accuracy": 0.7852960750460625, "num_tokens": 190734908.0, "step": 5975 }, { "entropy": 0.7740677744150162, "epoch": 0.5498300757327444, "grad_norm": 0.15925899147987366, "learning_rate": 8.167571380378447e-05, "loss": 0.7683, "mean_token_accuracy": 0.7768105678260326, "num_tokens": 190767234.0, "step": 5976 }, { "entropy": 0.7972619011998177, "epoch": 0.5499220821041857, "grad_norm": 0.155472531914711, "learning_rate": 8.167264697764285e-05, "loss": 0.7908, "mean_token_accuracy": 0.7683476619422436, "num_tokens": 190799534.0, "step": 5977 }, { "entropy": 0.7257073437795043, "epoch": 0.5500140884756269, "grad_norm": 0.14671020209789276, "learning_rate": 8.166958015150121e-05, "loss": 0.7147, "mean_token_accuracy": 0.7921796329319477, "num_tokens": 190832106.0, "step": 5978 }, { "entropy": 0.7165238987654448, "epoch": 0.5501060948470682, "grad_norm": 0.1534561812877655, "learning_rate": 8.166651332535958e-05, "loss": 0.6983, "mean_token_accuracy": 0.7955245338380337, "num_tokens": 190864563.0, "step": 5979 }, { "entropy": 0.7445898596197367, "epoch": 0.5501981012185094, "grad_norm": 0.1474943310022354, "learning_rate": 8.166344649921796e-05, "loss": 0.7218, "mean_token_accuracy": 0.7847502157092094, "num_tokens": 190896433.0, "step": 5980 }, { "entropy": 0.7592648211866617, "epoch": 0.5502901075899506, "grad_norm": 0.15504078567028046, "learning_rate": 8.166037967307633e-05, "loss": 0.7499, "mean_token_accuracy": 0.7832855395972729, "num_tokens": 190927530.0, "step": 5981 }, { "entropy": 0.7179149799048901, "epoch": 0.5503821139613918, "grad_norm": 0.1504850536584854, "learning_rate": 8.165731284693471e-05, "loss": 0.7054, "mean_token_accuracy": 0.7960471622645855, "num_tokens": 190959152.0, "step": 5982 }, { "entropy": 0.7716169897466898, "epoch": 0.550474120332833, "grad_norm": 0.15910422801971436, "learning_rate": 8.16542460207931e-05, "loss": 0.7656, "mean_token_accuracy": 0.777254942804575, "num_tokens": 190990506.0, "step": 5983 }, { "entropy": 0.9168150946497917, "epoch": 0.5505661267042743, "grad_norm": 0.16871169209480286, "learning_rate": 8.165117919465146e-05, "loss": 0.932, "mean_token_accuracy": 0.7349510826170444, "num_tokens": 191022851.0, "step": 5984 }, { "entropy": 0.8260986674576998, "epoch": 0.5506581330757155, "grad_norm": 0.16138248145580292, "learning_rate": 8.164811236850983e-05, "loss": 0.8238, "mean_token_accuracy": 0.7588727883994579, "num_tokens": 191054441.0, "step": 5985 }, { "entropy": 0.7338607683777809, "epoch": 0.5507501394471567, "grad_norm": 0.15588732063770294, "learning_rate": 8.16450455423682e-05, "loss": 0.7437, "mean_token_accuracy": 0.7809581123292446, "num_tokens": 191086446.0, "step": 5986 }, { "entropy": 0.7654548157006502, "epoch": 0.5508421458185979, "grad_norm": 0.1687469184398651, "learning_rate": 8.164197871622658e-05, "loss": 0.7577, "mean_token_accuracy": 0.7777836956083775, "num_tokens": 191118697.0, "step": 5987 }, { "entropy": 0.6191585035994649, "epoch": 0.5509341521900392, "grad_norm": 0.1552172303199768, "learning_rate": 8.163891189008496e-05, "loss": 0.613, "mean_token_accuracy": 0.8167121484875679, "num_tokens": 191151070.0, "step": 5988 }, { "entropy": 0.7283826656639576, "epoch": 0.5510261585614804, "grad_norm": 0.1582939773797989, "learning_rate": 8.163584506394333e-05, "loss": 0.6893, "mean_token_accuracy": 0.7968426309525967, "num_tokens": 191183556.0, "step": 5989 }, { "entropy": 0.784462746232748, "epoch": 0.5511181649329217, "grad_norm": 0.15464681386947632, "learning_rate": 8.16327782378017e-05, "loss": 0.751, "mean_token_accuracy": 0.7803607545793056, "num_tokens": 191215334.0, "step": 5990 }, { "entropy": 0.7864212393760681, "epoch": 0.5512101713043628, "grad_norm": 0.16656818985939026, "learning_rate": 8.162971141166008e-05, "loss": 0.7705, "mean_token_accuracy": 0.7753107137978077, "num_tokens": 191246880.0, "step": 5991 }, { "entropy": 0.8305101580917835, "epoch": 0.551302177675804, "grad_norm": 0.15914209187030792, "learning_rate": 8.162664458551845e-05, "loss": 0.816, "mean_token_accuracy": 0.7657095193862915, "num_tokens": 191278493.0, "step": 5992 }, { "entropy": 0.7413014397025108, "epoch": 0.5513941840472453, "grad_norm": 0.1564912647008896, "learning_rate": 8.162357775937683e-05, "loss": 0.7121, "mean_token_accuracy": 0.787505242973566, "num_tokens": 191310217.0, "step": 5993 }, { "entropy": 0.8313757330179214, "epoch": 0.5514861904186865, "grad_norm": 0.16416552662849426, "learning_rate": 8.16205109332352e-05, "loss": 0.8336, "mean_token_accuracy": 0.7576211579144001, "num_tokens": 191342175.0, "step": 5994 }, { "entropy": 0.8442597221583128, "epoch": 0.5515781967901278, "grad_norm": 0.17158855497837067, "learning_rate": 8.161744410709358e-05, "loss": 0.8485, "mean_token_accuracy": 0.755003783851862, "num_tokens": 191374368.0, "step": 5995 }, { "entropy": 0.8091115206480026, "epoch": 0.5516702031615689, "grad_norm": 0.16732440888881683, "learning_rate": 8.161437728095194e-05, "loss": 0.8167, "mean_token_accuracy": 0.7653408236801624, "num_tokens": 191407002.0, "step": 5996 }, { "entropy": 0.7015152052044868, "epoch": 0.5517622095330101, "grad_norm": 0.15845352411270142, "learning_rate": 8.161131045481033e-05, "loss": 0.6734, "mean_token_accuracy": 0.7995651811361313, "num_tokens": 191439037.0, "step": 5997 }, { "entropy": 0.8498093299567699, "epoch": 0.5518542159044514, "grad_norm": 0.1552589237689972, "learning_rate": 8.16082436286687e-05, "loss": 0.8352, "mean_token_accuracy": 0.7569010630249977, "num_tokens": 191471182.0, "step": 5998 }, { "entropy": 0.7970709148794413, "epoch": 0.5519462222758926, "grad_norm": 0.1659885197877884, "learning_rate": 8.160517680252708e-05, "loss": 0.8099, "mean_token_accuracy": 0.7657053582370281, "num_tokens": 191503555.0, "step": 5999 }, { "entropy": 0.7965427450835705, "epoch": 0.5520382286473339, "grad_norm": 0.16310161352157593, "learning_rate": 8.160210997638544e-05, "loss": 0.7784, "mean_token_accuracy": 0.7684974633157253, "num_tokens": 191534763.0, "step": 6000 }, { "entropy": 0.7706787437200546, "epoch": 0.552130235018775, "grad_norm": 0.15562576055526733, "learning_rate": 8.159904315024381e-05, "loss": 0.7385, "mean_token_accuracy": 0.7833890169858932, "num_tokens": 191567259.0, "step": 6001 }, { "entropy": 0.8564785588532686, "epoch": 0.5522222413902163, "grad_norm": 0.1650467813014984, "learning_rate": 8.159597632410219e-05, "loss": 0.8404, "mean_token_accuracy": 0.7567550130188465, "num_tokens": 191597976.0, "step": 6002 }, { "entropy": 0.8336704932153225, "epoch": 0.5523142477616575, "grad_norm": 0.16959384083747864, "learning_rate": 8.159290949796057e-05, "loss": 0.8366, "mean_token_accuracy": 0.7610478885471821, "num_tokens": 191629494.0, "step": 6003 }, { "entropy": 0.8957505021244287, "epoch": 0.5524062541330987, "grad_norm": 0.1650269329547882, "learning_rate": 8.158984267181894e-05, "loss": 0.8832, "mean_token_accuracy": 0.7473922073841095, "num_tokens": 191660388.0, "step": 6004 }, { "entropy": 0.7259356360882521, "epoch": 0.55249826050454, "grad_norm": 0.1571079045534134, "learning_rate": 8.158677584567731e-05, "loss": 0.7119, "mean_token_accuracy": 0.7895214892923832, "num_tokens": 191692736.0, "step": 6005 }, { "entropy": 0.739856731146574, "epoch": 0.5525902668759811, "grad_norm": 0.15249207615852356, "learning_rate": 8.158370901953568e-05, "loss": 0.7145, "mean_token_accuracy": 0.7917918004095554, "num_tokens": 191724465.0, "step": 6006 }, { "entropy": 0.8330467566847801, "epoch": 0.5526822732474224, "grad_norm": 0.15783803164958954, "learning_rate": 8.158064219339406e-05, "loss": 0.8102, "mean_token_accuracy": 0.7623555846512318, "num_tokens": 191756663.0, "step": 6007 }, { "entropy": 0.7143422681838274, "epoch": 0.5527742796188636, "grad_norm": 0.15776567161083221, "learning_rate": 8.157757536725244e-05, "loss": 0.6895, "mean_token_accuracy": 0.7990431413054466, "num_tokens": 191788769.0, "step": 6008 }, { "entropy": 0.7926603611558676, "epoch": 0.5528662859903049, "grad_norm": 0.15281923115253448, "learning_rate": 8.157450854111081e-05, "loss": 0.7906, "mean_token_accuracy": 0.7720540463924408, "num_tokens": 191820731.0, "step": 6009 }, { "entropy": 0.8669855333864689, "epoch": 0.5529582923617461, "grad_norm": 0.1653076559305191, "learning_rate": 8.157144171496919e-05, "loss": 0.8804, "mean_token_accuracy": 0.7433367408812046, "num_tokens": 191851947.0, "step": 6010 }, { "entropy": 0.8002363406121731, "epoch": 0.5530502987331872, "grad_norm": 0.17021411657333374, "learning_rate": 8.156837488882756e-05, "loss": 0.8085, "mean_token_accuracy": 0.7677657529711723, "num_tokens": 191883996.0, "step": 6011 }, { "entropy": 0.8670820891857147, "epoch": 0.5531423051046285, "grad_norm": 0.15995609760284424, "learning_rate": 8.156530806268593e-05, "loss": 0.8585, "mean_token_accuracy": 0.7551304623484612, "num_tokens": 191916251.0, "step": 6012 }, { "entropy": 0.7834235690534115, "epoch": 0.5532343114760697, "grad_norm": 0.16000738739967346, "learning_rate": 8.15622412365443e-05, "loss": 0.7831, "mean_token_accuracy": 0.76929085329175, "num_tokens": 191948887.0, "step": 6013 }, { "entropy": 0.7350541241466999, "epoch": 0.553326317847511, "grad_norm": 0.15425541996955872, "learning_rate": 8.155917441040269e-05, "loss": 0.7316, "mean_token_accuracy": 0.7877219878137112, "num_tokens": 191981263.0, "step": 6014 }, { "entropy": 0.860594816505909, "epoch": 0.5534183242189522, "grad_norm": 0.15892741084098816, "learning_rate": 8.155610758426106e-05, "loss": 0.8476, "mean_token_accuracy": 0.7574911825358868, "num_tokens": 192012484.0, "step": 6015 }, { "entropy": 0.7508128182962537, "epoch": 0.5535103305903933, "grad_norm": 0.1581711769104004, "learning_rate": 8.155304075811942e-05, "loss": 0.7215, "mean_token_accuracy": 0.7928740195930004, "num_tokens": 192044297.0, "step": 6016 }, { "entropy": 0.7154111918061972, "epoch": 0.5536023369618346, "grad_norm": 0.1592387855052948, "learning_rate": 8.154997393197779e-05, "loss": 0.7082, "mean_token_accuracy": 0.7955047711730003, "num_tokens": 192077010.0, "step": 6017 }, { "entropy": 0.7269014222547412, "epoch": 0.5536943433332758, "grad_norm": 0.15175572037696838, "learning_rate": 8.154690710583617e-05, "loss": 0.6987, "mean_token_accuracy": 0.7933903373777866, "num_tokens": 192109024.0, "step": 6018 }, { "entropy": 0.746125690639019, "epoch": 0.5537863497047171, "grad_norm": 0.16021691262722015, "learning_rate": 8.154384027969455e-05, "loss": 0.7388, "mean_token_accuracy": 0.7843107059597969, "num_tokens": 192139227.0, "step": 6019 }, { "entropy": 0.8648782018572092, "epoch": 0.5538783560761583, "grad_norm": 0.16696161031723022, "learning_rate": 8.154077345355292e-05, "loss": 0.8576, "mean_token_accuracy": 0.7544964924454689, "num_tokens": 192170868.0, "step": 6020 }, { "entropy": 0.6894812770187855, "epoch": 0.5539703624475995, "grad_norm": 0.15177986025810242, "learning_rate": 8.153770662741129e-05, "loss": 0.6809, "mean_token_accuracy": 0.7959825806319714, "num_tokens": 192203417.0, "step": 6021 }, { "entropy": 0.7893353421241045, "epoch": 0.5540623688190407, "grad_norm": 0.16263845562934875, "learning_rate": 8.153463980126967e-05, "loss": 0.7867, "mean_token_accuracy": 0.7726844996213913, "num_tokens": 192235967.0, "step": 6022 }, { "entropy": 0.810412060469389, "epoch": 0.5541543751904819, "grad_norm": 0.16554486751556396, "learning_rate": 8.153157297512804e-05, "loss": 0.8301, "mean_token_accuracy": 0.7590293139219284, "num_tokens": 192267126.0, "step": 6023 }, { "entropy": 0.7957448363304138, "epoch": 0.5542463815619232, "grad_norm": 0.18386197090148926, "learning_rate": 8.152850614898642e-05, "loss": 0.8177, "mean_token_accuracy": 0.7706861458718777, "num_tokens": 192299111.0, "step": 6024 }, { "entropy": 0.7195996344089508, "epoch": 0.5543383879333644, "grad_norm": 0.15169855952262878, "learning_rate": 8.152543932284479e-05, "loss": 0.6937, "mean_token_accuracy": 0.7911792770028114, "num_tokens": 192330966.0, "step": 6025 }, { "entropy": 0.7095565646886826, "epoch": 0.5544303943048056, "grad_norm": 0.14465606212615967, "learning_rate": 8.152237249670317e-05, "loss": 0.7046, "mean_token_accuracy": 0.7882008031010628, "num_tokens": 192363640.0, "step": 6026 }, { "entropy": 0.7250357652083039, "epoch": 0.5545224006762468, "grad_norm": 0.15593747794628143, "learning_rate": 8.151930567056154e-05, "loss": 0.7082, "mean_token_accuracy": 0.7878669761121273, "num_tokens": 192395817.0, "step": 6027 }, { "entropy": 0.7934261150658131, "epoch": 0.554614407047688, "grad_norm": 0.16062304377555847, "learning_rate": 8.15162388444199e-05, "loss": 0.7839, "mean_token_accuracy": 0.7674033045768738, "num_tokens": 192428236.0, "step": 6028 }, { "entropy": 0.8054333012551069, "epoch": 0.5547064134191293, "grad_norm": 0.15277118980884552, "learning_rate": 8.151317201827829e-05, "loss": 0.775, "mean_token_accuracy": 0.7710592932999134, "num_tokens": 192460231.0, "step": 6029 }, { "entropy": 0.9132533892989159, "epoch": 0.5547984197905705, "grad_norm": 0.1635074019432068, "learning_rate": 8.151010519213667e-05, "loss": 0.9137, "mean_token_accuracy": 0.7374852299690247, "num_tokens": 192491595.0, "step": 6030 }, { "entropy": 0.7676389440894127, "epoch": 0.5548904261620117, "grad_norm": 0.1618419885635376, "learning_rate": 8.150703836599504e-05, "loss": 0.7457, "mean_token_accuracy": 0.7828066162765026, "num_tokens": 192522794.0, "step": 6031 }, { "entropy": 0.6918323133140802, "epoch": 0.5549824325334529, "grad_norm": 0.16495268046855927, "learning_rate": 8.15039715398534e-05, "loss": 0.682, "mean_token_accuracy": 0.8011768721044064, "num_tokens": 192554600.0, "step": 6032 }, { "entropy": 0.6737655261531472, "epoch": 0.5550744389048942, "grad_norm": 0.15140675008296967, "learning_rate": 8.150090471371177e-05, "loss": 0.6476, "mean_token_accuracy": 0.8064912632107735, "num_tokens": 192586591.0, "step": 6033 }, { "entropy": 0.7868568822741508, "epoch": 0.5551664452763354, "grad_norm": 0.1545213907957077, "learning_rate": 8.149783788757017e-05, "loss": 0.7785, "mean_token_accuracy": 0.7697130851447582, "num_tokens": 192619161.0, "step": 6034 }, { "entropy": 0.7533650267869234, "epoch": 0.5552584516477767, "grad_norm": 0.15891723334789276, "learning_rate": 8.149477106142854e-05, "loss": 0.7392, "mean_token_accuracy": 0.782652672380209, "num_tokens": 192651029.0, "step": 6035 }, { "entropy": 0.7167189456522465, "epoch": 0.5553504580192178, "grad_norm": 0.14931468665599823, "learning_rate": 8.14917042352869e-05, "loss": 0.6929, "mean_token_accuracy": 0.7925790287554264, "num_tokens": 192683254.0, "step": 6036 }, { "entropy": 0.7868742290884256, "epoch": 0.555442464390659, "grad_norm": 0.15820583701133728, "learning_rate": 8.148863740914527e-05, "loss": 0.7838, "mean_token_accuracy": 0.7751549780368805, "num_tokens": 192715097.0, "step": 6037 }, { "entropy": 0.8288993276655674, "epoch": 0.5555344707621003, "grad_norm": 0.1632251739501953, "learning_rate": 8.148557058300365e-05, "loss": 0.8245, "mean_token_accuracy": 0.7565753273665905, "num_tokens": 192746453.0, "step": 6038 }, { "entropy": 0.8013939969241619, "epoch": 0.5556264771335415, "grad_norm": 0.16061708331108093, "learning_rate": 8.148250375686203e-05, "loss": 0.7873, "mean_token_accuracy": 0.7647797577083111, "num_tokens": 192777759.0, "step": 6039 }, { "entropy": 0.7201927118003368, "epoch": 0.5557184835049828, "grad_norm": 0.1563645303249359, "learning_rate": 8.14794369307204e-05, "loss": 0.7091, "mean_token_accuracy": 0.7943665906786919, "num_tokens": 192808679.0, "step": 6040 }, { "entropy": 0.7707992177456617, "epoch": 0.5558104898764239, "grad_norm": 0.16381540894508362, "learning_rate": 8.147637010457878e-05, "loss": 0.7773, "mean_token_accuracy": 0.7706890068948269, "num_tokens": 192840593.0, "step": 6041 }, { "entropy": 0.7585370019078255, "epoch": 0.5559024962478651, "grad_norm": 0.1659216582775116, "learning_rate": 8.147330327843715e-05, "loss": 0.7464, "mean_token_accuracy": 0.7788841165602207, "num_tokens": 192872280.0, "step": 6042 }, { "entropy": 0.6856523975729942, "epoch": 0.5559945026193064, "grad_norm": 0.1508409082889557, "learning_rate": 8.147023645229552e-05, "loss": 0.6683, "mean_token_accuracy": 0.8001473769545555, "num_tokens": 192904544.0, "step": 6043 }, { "entropy": 0.7405461082234979, "epoch": 0.5560865089907476, "grad_norm": 0.16830721497535706, "learning_rate": 8.14671696261539e-05, "loss": 0.7414, "mean_token_accuracy": 0.783707819879055, "num_tokens": 192936612.0, "step": 6044 }, { "entropy": 0.7261424474418163, "epoch": 0.5561785153621889, "grad_norm": 0.15182429552078247, "learning_rate": 8.146410280001228e-05, "loss": 0.7205, "mean_token_accuracy": 0.7876883894205093, "num_tokens": 192968501.0, "step": 6045 }, { "entropy": 0.7994981249794364, "epoch": 0.55627052173363, "grad_norm": 0.1578603833913803, "learning_rate": 8.146103597387065e-05, "loss": 0.7845, "mean_token_accuracy": 0.7720818258821964, "num_tokens": 193000645.0, "step": 6046 }, { "entropy": 0.8054140135645866, "epoch": 0.5563625281050713, "grad_norm": 0.15709611773490906, "learning_rate": 8.145796914772902e-05, "loss": 0.7849, "mean_token_accuracy": 0.7700771577656269, "num_tokens": 193032052.0, "step": 6047 }, { "entropy": 0.7401599790900946, "epoch": 0.5564545344765125, "grad_norm": 0.16071166098117828, "learning_rate": 8.145490232158739e-05, "loss": 0.7311, "mean_token_accuracy": 0.7796068713068962, "num_tokens": 193063875.0, "step": 6048 }, { "entropy": 0.761769313365221, "epoch": 0.5565465408479537, "grad_norm": 0.16225092113018036, "learning_rate": 8.145183549544577e-05, "loss": 0.7348, "mean_token_accuracy": 0.7857695370912552, "num_tokens": 193096376.0, "step": 6049 }, { "entropy": 0.820658378303051, "epoch": 0.556638547219395, "grad_norm": 0.15760204195976257, "learning_rate": 8.144876866930415e-05, "loss": 0.8012, "mean_token_accuracy": 0.764300636947155, "num_tokens": 193127258.0, "step": 6050 }, { "entropy": 0.7687272727489471, "epoch": 0.5567305535908361, "grad_norm": 0.16069215536117554, "learning_rate": 8.144570184316252e-05, "loss": 0.7464, "mean_token_accuracy": 0.7790776714682579, "num_tokens": 193159067.0, "step": 6051 }, { "entropy": 0.6728891860693693, "epoch": 0.5568225599622774, "grad_norm": 0.1568991094827652, "learning_rate": 8.144263501702088e-05, "loss": 0.6678, "mean_token_accuracy": 0.8043879047036171, "num_tokens": 193190497.0, "step": 6052 }, { "entropy": 0.8590189758688211, "epoch": 0.5569145663337186, "grad_norm": 0.15771913528442383, "learning_rate": 8.143956819087927e-05, "loss": 0.837, "mean_token_accuracy": 0.7562801353633404, "num_tokens": 193221423.0, "step": 6053 }, { "entropy": 0.7716104164719582, "epoch": 0.5570065727051599, "grad_norm": 0.15243470668792725, "learning_rate": 8.143650136473763e-05, "loss": 0.7565, "mean_token_accuracy": 0.7778572328388691, "num_tokens": 193253067.0, "step": 6054 }, { "entropy": 0.770961906760931, "epoch": 0.5570985790766011, "grad_norm": 0.15163572132587433, "learning_rate": 8.143343453859601e-05, "loss": 0.7448, "mean_token_accuracy": 0.7815127968788147, "num_tokens": 193285185.0, "step": 6055 }, { "entropy": 0.6892071831971407, "epoch": 0.5571905854480422, "grad_norm": 0.15875332057476044, "learning_rate": 8.143036771245438e-05, "loss": 0.6867, "mean_token_accuracy": 0.8008329421281815, "num_tokens": 193317497.0, "step": 6056 }, { "entropy": 0.7086705416440964, "epoch": 0.5572825918194835, "grad_norm": 0.15463882684707642, "learning_rate": 8.142730088631276e-05, "loss": 0.6941, "mean_token_accuracy": 0.7926849536597729, "num_tokens": 193349377.0, "step": 6057 }, { "entropy": 0.7738120164722204, "epoch": 0.5573745981909247, "grad_norm": 0.15718628466129303, "learning_rate": 8.142423406017113e-05, "loss": 0.7829, "mean_token_accuracy": 0.7677246741950512, "num_tokens": 193381964.0, "step": 6058 }, { "entropy": 0.8273743204772472, "epoch": 0.557466604562366, "grad_norm": 0.1571321189403534, "learning_rate": 8.14211672340295e-05, "loss": 0.8246, "mean_token_accuracy": 0.7584010735154152, "num_tokens": 193413839.0, "step": 6059 }, { "entropy": 0.8418916780501604, "epoch": 0.5575586109338072, "grad_norm": 0.16087044775485992, "learning_rate": 8.141810040788788e-05, "loss": 0.8389, "mean_token_accuracy": 0.7545315697789192, "num_tokens": 193446285.0, "step": 6060 }, { "entropy": 0.7391447946429253, "epoch": 0.5576506173052483, "grad_norm": 0.1579708456993103, "learning_rate": 8.141503358174626e-05, "loss": 0.7387, "mean_token_accuracy": 0.7812765203416348, "num_tokens": 193478189.0, "step": 6061 }, { "entropy": 0.7614217661321163, "epoch": 0.5577426236766896, "grad_norm": 0.15669314563274384, "learning_rate": 8.141196675560463e-05, "loss": 0.7559, "mean_token_accuracy": 0.7809196747839451, "num_tokens": 193510211.0, "step": 6062 }, { "entropy": 0.7186033148318529, "epoch": 0.5578346300481308, "grad_norm": 0.1554379165172577, "learning_rate": 8.1408899929463e-05, "loss": 0.7098, "mean_token_accuracy": 0.7925673387944698, "num_tokens": 193542515.0, "step": 6063 }, { "entropy": 0.7733528390526772, "epoch": 0.5579266364195721, "grad_norm": 0.1541675180196762, "learning_rate": 8.140583310332137e-05, "loss": 0.7549, "mean_token_accuracy": 0.7775937207043171, "num_tokens": 193574095.0, "step": 6064 }, { "entropy": 0.7765134368091822, "epoch": 0.5580186427910133, "grad_norm": 0.16174091398715973, "learning_rate": 8.140276627717975e-05, "loss": 0.7545, "mean_token_accuracy": 0.7748664170503616, "num_tokens": 193606067.0, "step": 6065 }, { "entropy": 0.717482591047883, "epoch": 0.5581106491624545, "grad_norm": 0.15444409847259521, "learning_rate": 8.139969945103813e-05, "loss": 0.7068, "mean_token_accuracy": 0.794789832085371, "num_tokens": 193638386.0, "step": 6066 }, { "entropy": 0.7763950023800135, "epoch": 0.5582026555338957, "grad_norm": 0.1629830151796341, "learning_rate": 8.13966326248965e-05, "loss": 0.7727, "mean_token_accuracy": 0.7730504386126995, "num_tokens": 193669385.0, "step": 6067 }, { "entropy": 0.7793804947286844, "epoch": 0.5582946619053369, "grad_norm": 0.15742641687393188, "learning_rate": 8.139356579875486e-05, "loss": 0.7701, "mean_token_accuracy": 0.7737812921404839, "num_tokens": 193701671.0, "step": 6068 }, { "entropy": 0.8005569130182266, "epoch": 0.5583866682767782, "grad_norm": 0.16777004301548004, "learning_rate": 8.139049897261325e-05, "loss": 0.7851, "mean_token_accuracy": 0.77051692456007, "num_tokens": 193733228.0, "step": 6069 }, { "entropy": 0.7552869198843837, "epoch": 0.5584786746482194, "grad_norm": 0.1584707796573639, "learning_rate": 8.138743214647161e-05, "loss": 0.7611, "mean_token_accuracy": 0.7776471599936485, "num_tokens": 193765734.0, "step": 6070 }, { "entropy": 0.760448906570673, "epoch": 0.5585706810196606, "grad_norm": 0.15794475376605988, "learning_rate": 8.138436532033e-05, "loss": 0.7619, "mean_token_accuracy": 0.7775208540260792, "num_tokens": 193797750.0, "step": 6071 }, { "entropy": 0.8069232106208801, "epoch": 0.5586626873911018, "grad_norm": 0.1689303070306778, "learning_rate": 8.138129849418838e-05, "loss": 0.8358, "mean_token_accuracy": 0.7626712322235107, "num_tokens": 193830125.0, "step": 6072 }, { "entropy": 0.7783085573464632, "epoch": 0.558754693762543, "grad_norm": 0.15558648109436035, "learning_rate": 8.137823166804674e-05, "loss": 0.7795, "mean_token_accuracy": 0.77311896905303, "num_tokens": 193861867.0, "step": 6073 }, { "entropy": 0.8830032125115395, "epoch": 0.5588467001339843, "grad_norm": 0.16073694825172424, "learning_rate": 8.137516484190511e-05, "loss": 0.8703, "mean_token_accuracy": 0.7507479079067707, "num_tokens": 193893624.0, "step": 6074 }, { "entropy": 0.7273001223802567, "epoch": 0.5589387065054255, "grad_norm": 0.1466771513223648, "learning_rate": 8.137209801576348e-05, "loss": 0.7075, "mean_token_accuracy": 0.7915177829563618, "num_tokens": 193926108.0, "step": 6075 }, { "entropy": 0.7955648992210627, "epoch": 0.5590307128768667, "grad_norm": 0.15161876380443573, "learning_rate": 8.136903118962188e-05, "loss": 0.7725, "mean_token_accuracy": 0.773093681782484, "num_tokens": 193957795.0, "step": 6076 }, { "entropy": 0.7958554960787296, "epoch": 0.5591227192483079, "grad_norm": 0.15988466143608093, "learning_rate": 8.136596436348024e-05, "loss": 0.7726, "mean_token_accuracy": 0.7739408612251282, "num_tokens": 193990532.0, "step": 6077 }, { "entropy": 0.8251246400177479, "epoch": 0.5592147256197492, "grad_norm": 0.16133373975753784, "learning_rate": 8.136289753733861e-05, "loss": 0.8067, "mean_token_accuracy": 0.7661683186888695, "num_tokens": 194023152.0, "step": 6078 }, { "entropy": 0.8004872854799032, "epoch": 0.5593067319911904, "grad_norm": 0.15964026749134064, "learning_rate": 8.135983071119698e-05, "loss": 0.7582, "mean_token_accuracy": 0.7764024250209332, "num_tokens": 194054468.0, "step": 6079 }, { "entropy": 0.8390591889619827, "epoch": 0.5593987383626317, "grad_norm": 0.16184179484844208, "learning_rate": 8.135676388505536e-05, "loss": 0.8428, "mean_token_accuracy": 0.756284773349762, "num_tokens": 194086108.0, "step": 6080 }, { "entropy": 0.7504545785486698, "epoch": 0.5594907447340728, "grad_norm": 0.17079655826091766, "learning_rate": 8.135369705891374e-05, "loss": 0.7518, "mean_token_accuracy": 0.7847156934440136, "num_tokens": 194118503.0, "step": 6081 }, { "entropy": 0.7952451165765524, "epoch": 0.559582751105514, "grad_norm": 0.1585853099822998, "learning_rate": 8.135063023277211e-05, "loss": 0.7668, "mean_token_accuracy": 0.776585403829813, "num_tokens": 194149894.0, "step": 6082 }, { "entropy": 0.7174165323376656, "epoch": 0.5596747574769553, "grad_norm": 0.16724087297916412, "learning_rate": 8.134756340663048e-05, "loss": 0.7061, "mean_token_accuracy": 0.7918421775102615, "num_tokens": 194180872.0, "step": 6083 }, { "entropy": 0.7597122676670551, "epoch": 0.5597667638483965, "grad_norm": 0.15820325911045074, "learning_rate": 8.134449658048886e-05, "loss": 0.7512, "mean_token_accuracy": 0.775394145399332, "num_tokens": 194212421.0, "step": 6084 }, { "entropy": 0.7825785800814629, "epoch": 0.5598587702198378, "grad_norm": 0.15800397098064423, "learning_rate": 8.134142975434723e-05, "loss": 0.791, "mean_token_accuracy": 0.7705358862876892, "num_tokens": 194244300.0, "step": 6085 }, { "entropy": 0.7351433448493481, "epoch": 0.5599507765912789, "grad_norm": 0.1540946513414383, "learning_rate": 8.133836292820561e-05, "loss": 0.7357, "mean_token_accuracy": 0.7847430668771267, "num_tokens": 194276684.0, "step": 6086 }, { "entropy": 0.725321339443326, "epoch": 0.5600427829627201, "grad_norm": 0.16692623496055603, "learning_rate": 8.133529610206398e-05, "loss": 0.733, "mean_token_accuracy": 0.7867682576179504, "num_tokens": 194308266.0, "step": 6087 }, { "entropy": 0.8335498906672001, "epoch": 0.5601347893341614, "grad_norm": 0.1632673591375351, "learning_rate": 8.133222927592236e-05, "loss": 0.8138, "mean_token_accuracy": 0.7629985176026821, "num_tokens": 194339649.0, "step": 6088 }, { "entropy": 0.6618251884356141, "epoch": 0.5602267957056026, "grad_norm": 0.15041187405586243, "learning_rate": 8.132916244978073e-05, "loss": 0.6555, "mean_token_accuracy": 0.8010103367269039, "num_tokens": 194371659.0, "step": 6089 }, { "entropy": 0.7782188206911087, "epoch": 0.5603188020770439, "grad_norm": 0.14945530891418457, "learning_rate": 8.13260956236391e-05, "loss": 0.7655, "mean_token_accuracy": 0.778135534375906, "num_tokens": 194403613.0, "step": 6090 }, { "entropy": 0.757145032286644, "epoch": 0.560410808448485, "grad_norm": 0.15921446681022644, "learning_rate": 8.132302879749747e-05, "loss": 0.7408, "mean_token_accuracy": 0.7832129076123238, "num_tokens": 194434770.0, "step": 6091 }, { "entropy": 0.6920980978757143, "epoch": 0.5605028148199263, "grad_norm": 0.1512448638677597, "learning_rate": 8.131996197135586e-05, "loss": 0.6882, "mean_token_accuracy": 0.7951634861528873, "num_tokens": 194466855.0, "step": 6092 }, { "entropy": 0.7823742255568504, "epoch": 0.5605948211913675, "grad_norm": 0.15238213539123535, "learning_rate": 8.131689514521422e-05, "loss": 0.7809, "mean_token_accuracy": 0.7728685215115547, "num_tokens": 194498964.0, "step": 6093 }, { "entropy": 0.7769000455737114, "epoch": 0.5606868275628087, "grad_norm": 0.16768601536750793, "learning_rate": 8.131382831907259e-05, "loss": 0.7782, "mean_token_accuracy": 0.7740562595427036, "num_tokens": 194530011.0, "step": 6094 }, { "entropy": 0.6390567254275084, "epoch": 0.56077883393425, "grad_norm": 0.155293807387352, "learning_rate": 8.131076149293096e-05, "loss": 0.6364, "mean_token_accuracy": 0.8107830584049225, "num_tokens": 194562452.0, "step": 6095 }, { "entropy": 0.7069685803726315, "epoch": 0.5608708403056911, "grad_norm": 0.15363280475139618, "learning_rate": 8.130769466678934e-05, "loss": 0.6915, "mean_token_accuracy": 0.8028281889855862, "num_tokens": 194594492.0, "step": 6096 }, { "entropy": 0.8511045668274164, "epoch": 0.5609628466771324, "grad_norm": 0.1620863527059555, "learning_rate": 8.130462784064772e-05, "loss": 0.8566, "mean_token_accuracy": 0.7509987615048885, "num_tokens": 194626349.0, "step": 6097 }, { "entropy": 0.8021703772246838, "epoch": 0.5610548530485736, "grad_norm": 0.16097944974899292, "learning_rate": 8.130156101450609e-05, "loss": 0.7863, "mean_token_accuracy": 0.7705454304814339, "num_tokens": 194658513.0, "step": 6098 }, { "entropy": 0.7856633272022009, "epoch": 0.5611468594200149, "grad_norm": 0.16191501915454865, "learning_rate": 8.129849418836446e-05, "loss": 0.7618, "mean_token_accuracy": 0.7739258706569672, "num_tokens": 194689535.0, "step": 6099 }, { "entropy": 0.6865562293678522, "epoch": 0.5612388657914561, "grad_norm": 0.16336694359779358, "learning_rate": 8.129542736222284e-05, "loss": 0.6671, "mean_token_accuracy": 0.8052382580935955, "num_tokens": 194721543.0, "step": 6100 }, { "entropy": 0.7571423090994358, "epoch": 0.5613308721628972, "grad_norm": 0.16382035613059998, "learning_rate": 8.129236053608121e-05, "loss": 0.754, "mean_token_accuracy": 0.775886058807373, "num_tokens": 194753296.0, "step": 6101 }, { "entropy": 0.7820588517934084, "epoch": 0.5614228785343385, "grad_norm": 0.16012068092823029, "learning_rate": 8.128929370993959e-05, "loss": 0.778, "mean_token_accuracy": 0.7749639749526978, "num_tokens": 194785637.0, "step": 6102 }, { "entropy": 0.7286719297990203, "epoch": 0.5615148849057797, "grad_norm": 0.15041829645633698, "learning_rate": 8.128622688379797e-05, "loss": 0.6972, "mean_token_accuracy": 0.7892908677458763, "num_tokens": 194817186.0, "step": 6103 }, { "entropy": 0.6936855968087912, "epoch": 0.561606891277221, "grad_norm": 0.24346917867660522, "learning_rate": 8.128316005765634e-05, "loss": 0.6721, "mean_token_accuracy": 0.7980751916766167, "num_tokens": 194849424.0, "step": 6104 }, { "entropy": 0.7203829195350409, "epoch": 0.5616988976486622, "grad_norm": 0.15328355133533478, "learning_rate": 8.12800932315147e-05, "loss": 0.7129, "mean_token_accuracy": 0.7853897400200367, "num_tokens": 194880999.0, "step": 6105 }, { "entropy": 0.7144788829609752, "epoch": 0.5617909040201033, "grad_norm": 0.15113526582717896, "learning_rate": 8.127702640537307e-05, "loss": 0.6956, "mean_token_accuracy": 0.7952021025121212, "num_tokens": 194913261.0, "step": 6106 }, { "entropy": 0.7675737217068672, "epoch": 0.5618829103915446, "grad_norm": 0.152833491563797, "learning_rate": 8.127395957923146e-05, "loss": 0.7498, "mean_token_accuracy": 0.7768226489424706, "num_tokens": 194944757.0, "step": 6107 }, { "entropy": 0.8459290526807308, "epoch": 0.5619749167629858, "grad_norm": 0.15823055803775787, "learning_rate": 8.127089275308984e-05, "loss": 0.8417, "mean_token_accuracy": 0.7560755088925362, "num_tokens": 194977166.0, "step": 6108 }, { "entropy": 0.6897333785891533, "epoch": 0.5620669231344271, "grad_norm": 0.15835346281528473, "learning_rate": 8.12678259269482e-05, "loss": 0.6736, "mean_token_accuracy": 0.8037987314164639, "num_tokens": 195009414.0, "step": 6109 }, { "entropy": 0.7118687871843576, "epoch": 0.5621589295058683, "grad_norm": 0.160564124584198, "learning_rate": 8.126475910080657e-05, "loss": 0.7048, "mean_token_accuracy": 0.7956867627799511, "num_tokens": 195040623.0, "step": 6110 }, { "entropy": 0.7350160628557205, "epoch": 0.5622509358773095, "grad_norm": 0.2017514705657959, "learning_rate": 8.126169227466495e-05, "loss": 0.7255, "mean_token_accuracy": 0.7936176471412182, "num_tokens": 195072822.0, "step": 6111 }, { "entropy": 0.7425192967057228, "epoch": 0.5623429422487507, "grad_norm": 0.1591499298810959, "learning_rate": 8.125862544852332e-05, "loss": 0.7431, "mean_token_accuracy": 0.7791178710758686, "num_tokens": 195105270.0, "step": 6112 }, { "entropy": 0.7911757752299309, "epoch": 0.5624349486201919, "grad_norm": 0.15779735147953033, "learning_rate": 8.12555586223817e-05, "loss": 0.793, "mean_token_accuracy": 0.7651618011295795, "num_tokens": 195137674.0, "step": 6113 }, { "entropy": 0.7213008720427752, "epoch": 0.5625269549916332, "grad_norm": 0.16051360964775085, "learning_rate": 8.125249179624007e-05, "loss": 0.7387, "mean_token_accuracy": 0.7836836390197277, "num_tokens": 195169523.0, "step": 6114 }, { "entropy": 0.7668345365673304, "epoch": 0.5626189613630744, "grad_norm": 0.16195765137672424, "learning_rate": 8.124942497009845e-05, "loss": 0.7538, "mean_token_accuracy": 0.7769808769226074, "num_tokens": 195201122.0, "step": 6115 }, { "entropy": 0.7566584125161171, "epoch": 0.5627109677345156, "grad_norm": 0.16141736507415771, "learning_rate": 8.124635814395682e-05, "loss": 0.7315, "mean_token_accuracy": 0.7870250083506107, "num_tokens": 195232421.0, "step": 6116 }, { "entropy": 0.7927650958299637, "epoch": 0.5628029741059568, "grad_norm": 0.15335889160633087, "learning_rate": 8.12432913178152e-05, "loss": 0.7823, "mean_token_accuracy": 0.7658455111086369, "num_tokens": 195264648.0, "step": 6117 }, { "entropy": 0.7746234368532896, "epoch": 0.562894980477398, "grad_norm": 0.15500664710998535, "learning_rate": 8.124022449167357e-05, "loss": 0.7568, "mean_token_accuracy": 0.7786053195595741, "num_tokens": 195296982.0, "step": 6118 }, { "entropy": 0.7485659997910261, "epoch": 0.5629869868488393, "grad_norm": 0.16710670292377472, "learning_rate": 8.123715766553195e-05, "loss": 0.757, "mean_token_accuracy": 0.7778853476047516, "num_tokens": 195328776.0, "step": 6119 }, { "entropy": 0.8094190061092377, "epoch": 0.5630789932202805, "grad_norm": 0.15617284178733826, "learning_rate": 8.123409083939032e-05, "loss": 0.7962, "mean_token_accuracy": 0.7689793296158314, "num_tokens": 195361144.0, "step": 6120 }, { "entropy": 0.7547434903681278, "epoch": 0.5631709995917217, "grad_norm": 0.15395492315292358, "learning_rate": 8.123102401324869e-05, "loss": 0.7186, "mean_token_accuracy": 0.7870777808129787, "num_tokens": 195392482.0, "step": 6121 }, { "entropy": 0.6476460956037045, "epoch": 0.5632630059631629, "grad_norm": 0.14416851103305817, "learning_rate": 8.122795718710707e-05, "loss": 0.621, "mean_token_accuracy": 0.8144351802766323, "num_tokens": 195424751.0, "step": 6122 }, { "entropy": 0.8315981850028038, "epoch": 0.5633550123346042, "grad_norm": 0.15703003108501434, "learning_rate": 8.122489036096545e-05, "loss": 0.845, "mean_token_accuracy": 0.7573337219655514, "num_tokens": 195456311.0, "step": 6123 }, { "entropy": 0.773392241448164, "epoch": 0.5634470187060454, "grad_norm": 0.15961217880249023, "learning_rate": 8.122182353482382e-05, "loss": 0.7701, "mean_token_accuracy": 0.774012628942728, "num_tokens": 195488547.0, "step": 6124 }, { "entropy": 0.7701145112514496, "epoch": 0.5635390250774867, "grad_norm": 0.15141716599464417, "learning_rate": 8.121875670868219e-05, "loss": 0.7797, "mean_token_accuracy": 0.7686381414532661, "num_tokens": 195520526.0, "step": 6125 }, { "entropy": 0.8518513962626457, "epoch": 0.5636310314489278, "grad_norm": 0.15724773705005646, "learning_rate": 8.121568988254055e-05, "loss": 0.8525, "mean_token_accuracy": 0.7524928711354733, "num_tokens": 195553112.0, "step": 6126 }, { "entropy": 0.7912594322115183, "epoch": 0.563723037820369, "grad_norm": 0.15272276103496552, "learning_rate": 8.121262305639894e-05, "loss": 0.7818, "mean_token_accuracy": 0.7702792026102543, "num_tokens": 195585195.0, "step": 6127 }, { "entropy": 0.7622837461531162, "epoch": 0.5638150441918103, "grad_norm": 0.1554490625858307, "learning_rate": 8.120955623025732e-05, "loss": 0.7677, "mean_token_accuracy": 0.7748788073658943, "num_tokens": 195617515.0, "step": 6128 }, { "entropy": 0.8142075520008802, "epoch": 0.5639070505632515, "grad_norm": 0.1666015088558197, "learning_rate": 8.120648940411568e-05, "loss": 0.8018, "mean_token_accuracy": 0.7649122104048729, "num_tokens": 195648355.0, "step": 6129 }, { "entropy": 0.664508618414402, "epoch": 0.5639990569346928, "grad_norm": 0.15708576142787933, "learning_rate": 8.120342257797405e-05, "loss": 0.6502, "mean_token_accuracy": 0.8045610710978508, "num_tokens": 195680278.0, "step": 6130 }, { "entropy": 0.802734263241291, "epoch": 0.5640910633061339, "grad_norm": 0.15389998257160187, "learning_rate": 8.120035575183243e-05, "loss": 0.7949, "mean_token_accuracy": 0.7690716572105885, "num_tokens": 195711905.0, "step": 6131 }, { "entropy": 0.8230801224708557, "epoch": 0.5641830696775751, "grad_norm": 0.16071496903896332, "learning_rate": 8.11972889256908e-05, "loss": 0.8097, "mean_token_accuracy": 0.7673789635300636, "num_tokens": 195743249.0, "step": 6132 }, { "entropy": 0.8152808994054794, "epoch": 0.5642750760490164, "grad_norm": 0.16399963200092316, "learning_rate": 8.119422209954918e-05, "loss": 0.8255, "mean_token_accuracy": 0.7599371112883091, "num_tokens": 195775626.0, "step": 6133 }, { "entropy": 0.7127881590276957, "epoch": 0.5643670824204576, "grad_norm": 0.16005297005176544, "learning_rate": 8.119115527340756e-05, "loss": 0.6901, "mean_token_accuracy": 0.8012487255036831, "num_tokens": 195808117.0, "step": 6134 }, { "entropy": 0.6655048802495003, "epoch": 0.5644590887918989, "grad_norm": 0.14947667717933655, "learning_rate": 8.118808844726593e-05, "loss": 0.6523, "mean_token_accuracy": 0.805728804320097, "num_tokens": 195840450.0, "step": 6135 }, { "entropy": 0.8004254177212715, "epoch": 0.56455109516334, "grad_norm": 0.15829092264175415, "learning_rate": 8.11850216211243e-05, "loss": 0.7724, "mean_token_accuracy": 0.7731947265565395, "num_tokens": 195872119.0, "step": 6136 }, { "entropy": 0.791045100428164, "epoch": 0.5646431015347813, "grad_norm": 0.17074038088321686, "learning_rate": 8.118195479498267e-05, "loss": 0.7912, "mean_token_accuracy": 0.7718060053884983, "num_tokens": 195904228.0, "step": 6137 }, { "entropy": 0.7398163340985775, "epoch": 0.5647351079062225, "grad_norm": 0.14989621937274933, "learning_rate": 8.117888796884105e-05, "loss": 0.7365, "mean_token_accuracy": 0.778534971177578, "num_tokens": 195935386.0, "step": 6138 }, { "entropy": 0.8365665785968304, "epoch": 0.5648271142776637, "grad_norm": 0.1594756692647934, "learning_rate": 8.117582114269943e-05, "loss": 0.824, "mean_token_accuracy": 0.7674847431480885, "num_tokens": 195966527.0, "step": 6139 }, { "entropy": 0.8208596967160702, "epoch": 0.564919120649105, "grad_norm": 0.16180427372455597, "learning_rate": 8.11727543165578e-05, "loss": 0.7999, "mean_token_accuracy": 0.7673744596540928, "num_tokens": 195998389.0, "step": 6140 }, { "entropy": 0.7930564470589161, "epoch": 0.5650111270205461, "grad_norm": 0.16200894117355347, "learning_rate": 8.116968749041617e-05, "loss": 0.7811, "mean_token_accuracy": 0.772907480597496, "num_tokens": 196030837.0, "step": 6141 }, { "entropy": 0.7573768999427557, "epoch": 0.5651031333919874, "grad_norm": 0.15805624425411224, "learning_rate": 8.116662066427455e-05, "loss": 0.7376, "mean_token_accuracy": 0.7847044616937637, "num_tokens": 196062228.0, "step": 6142 }, { "entropy": 0.7109242975711823, "epoch": 0.5651951397634286, "grad_norm": 0.15726032853126526, "learning_rate": 8.116355383813292e-05, "loss": 0.7028, "mean_token_accuracy": 0.7931651435792446, "num_tokens": 196094384.0, "step": 6143 }, { "entropy": 0.7857402358204126, "epoch": 0.5652871461348699, "grad_norm": 0.16847224533557892, "learning_rate": 8.11604870119913e-05, "loss": 0.7891, "mean_token_accuracy": 0.7690515145659447, "num_tokens": 196126530.0, "step": 6144 }, { "entropy": 0.768998121842742, "epoch": 0.5653791525063111, "grad_norm": 0.15335261821746826, "learning_rate": 8.115742018584967e-05, "loss": 0.7527, "mean_token_accuracy": 0.7813721261918545, "num_tokens": 196158769.0, "step": 6145 }, { "entropy": 0.7325848154723644, "epoch": 0.5654711588777522, "grad_norm": 0.15636910498142242, "learning_rate": 8.115435335970805e-05, "loss": 0.7309, "mean_token_accuracy": 0.7857678011059761, "num_tokens": 196191164.0, "step": 6146 }, { "entropy": 0.8123513571918011, "epoch": 0.5655631652491935, "grad_norm": 0.1604480743408203, "learning_rate": 8.115128653356641e-05, "loss": 0.8189, "mean_token_accuracy": 0.7608227767050266, "num_tokens": 196223043.0, "step": 6147 }, { "entropy": 0.7324050441384315, "epoch": 0.5656551716206347, "grad_norm": 0.15382537245750427, "learning_rate": 8.114821970742478e-05, "loss": 0.7173, "mean_token_accuracy": 0.7896891012787819, "num_tokens": 196255263.0, "step": 6148 }, { "entropy": 0.7262407392263412, "epoch": 0.565747177992076, "grad_norm": 0.15299135446548462, "learning_rate": 8.114515288128316e-05, "loss": 0.7075, "mean_token_accuracy": 0.7901319786906242, "num_tokens": 196287767.0, "step": 6149 }, { "entropy": 0.7712275739759207, "epoch": 0.5658391843635172, "grad_norm": 0.16408874094486237, "learning_rate": 8.114208605514155e-05, "loss": 0.7518, "mean_token_accuracy": 0.7812177427113056, "num_tokens": 196319606.0, "step": 6150 }, { "entropy": 0.6844668071717024, "epoch": 0.5659311907349583, "grad_norm": 0.14928807318210602, "learning_rate": 8.113901922899991e-05, "loss": 0.6659, "mean_token_accuracy": 0.8055904060602188, "num_tokens": 196351421.0, "step": 6151 }, { "entropy": 0.8078666068613529, "epoch": 0.5660231971063996, "grad_norm": 0.17269165813922882, "learning_rate": 8.113595240285828e-05, "loss": 0.7974, "mean_token_accuracy": 0.7649477832019329, "num_tokens": 196383334.0, "step": 6152 }, { "entropy": 0.8169114775955677, "epoch": 0.5661152034778408, "grad_norm": 0.15457792580127716, "learning_rate": 8.113288557671665e-05, "loss": 0.8126, "mean_token_accuracy": 0.7590147852897644, "num_tokens": 196415365.0, "step": 6153 }, { "entropy": 0.8264964856207371, "epoch": 0.5662072098492821, "grad_norm": 0.1545470505952835, "learning_rate": 8.112981875057504e-05, "loss": 0.8076, "mean_token_accuracy": 0.7652953192591667, "num_tokens": 196447955.0, "step": 6154 }, { "entropy": 0.7642250824719667, "epoch": 0.5662992162207233, "grad_norm": 0.15807469189167023, "learning_rate": 8.112675192443341e-05, "loss": 0.7572, "mean_token_accuracy": 0.7753033973276615, "num_tokens": 196479885.0, "step": 6155 }, { "entropy": 0.7719323742203414, "epoch": 0.5663912225921645, "grad_norm": 0.15365390479564667, "learning_rate": 8.112368509829178e-05, "loss": 0.7639, "mean_token_accuracy": 0.78037004545331, "num_tokens": 196510979.0, "step": 6156 }, { "entropy": 0.8303781636059284, "epoch": 0.5664832289636057, "grad_norm": 0.1575808972120285, "learning_rate": 8.112061827215015e-05, "loss": 0.8326, "mean_token_accuracy": 0.7560634985566139, "num_tokens": 196542934.0, "step": 6157 }, { "entropy": 0.8315360564738512, "epoch": 0.566575235335047, "grad_norm": 0.16332711279392242, "learning_rate": 8.111755144600853e-05, "loss": 0.8325, "mean_token_accuracy": 0.7570298574864864, "num_tokens": 196575010.0, "step": 6158 }, { "entropy": 0.7758260369300842, "epoch": 0.5666672417064882, "grad_norm": 0.15531091392040253, "learning_rate": 8.111448461986691e-05, "loss": 0.7737, "mean_token_accuracy": 0.7708043642342091, "num_tokens": 196606709.0, "step": 6159 }, { "entropy": 0.6930471230298281, "epoch": 0.5667592480779294, "grad_norm": 0.15918143093585968, "learning_rate": 8.111141779372528e-05, "loss": 0.6924, "mean_token_accuracy": 0.7974916212260723, "num_tokens": 196638608.0, "step": 6160 }, { "entropy": 0.7711673490703106, "epoch": 0.5668512544493706, "grad_norm": 0.16319622099399567, "learning_rate": 8.110835096758365e-05, "loss": 0.7727, "mean_token_accuracy": 0.7750249803066254, "num_tokens": 196670678.0, "step": 6161 }, { "entropy": 0.7396946586668491, "epoch": 0.5669432608208118, "grad_norm": 0.14308281242847443, "learning_rate": 8.110528414144203e-05, "loss": 0.7313, "mean_token_accuracy": 0.7805506065487862, "num_tokens": 196703257.0, "step": 6162 }, { "entropy": 0.7905214931815863, "epoch": 0.5670352671922531, "grad_norm": 0.16229990124702454, "learning_rate": 8.11022173153004e-05, "loss": 0.7873, "mean_token_accuracy": 0.7704115249216557, "num_tokens": 196735782.0, "step": 6163 }, { "entropy": 0.6672728154808283, "epoch": 0.5671272735636943, "grad_norm": 0.1484958827495575, "learning_rate": 8.109915048915878e-05, "loss": 0.647, "mean_token_accuracy": 0.805192481726408, "num_tokens": 196767493.0, "step": 6164 }, { "entropy": 0.6905970051884651, "epoch": 0.5672192799351355, "grad_norm": 0.17181789875030518, "learning_rate": 8.109608366301716e-05, "loss": 0.6784, "mean_token_accuracy": 0.800811056047678, "num_tokens": 196798961.0, "step": 6165 }, { "entropy": 0.7037334218621254, "epoch": 0.5673112863065767, "grad_norm": 0.15447209775447845, "learning_rate": 8.109301683687553e-05, "loss": 0.6779, "mean_token_accuracy": 0.8004451617598534, "num_tokens": 196830068.0, "step": 6166 }, { "entropy": 0.7755861338227987, "epoch": 0.5674032926780179, "grad_norm": 0.15935882925987244, "learning_rate": 8.10899500107339e-05, "loss": 0.7515, "mean_token_accuracy": 0.7771556824445724, "num_tokens": 196861523.0, "step": 6167 }, { "entropy": 0.7684818115085363, "epoch": 0.5674952990494592, "grad_norm": 0.15518653392791748, "learning_rate": 8.108688318459226e-05, "loss": 0.7496, "mean_token_accuracy": 0.777970939874649, "num_tokens": 196893380.0, "step": 6168 }, { "entropy": 0.8566951900720596, "epoch": 0.5675873054209004, "grad_norm": 0.162309467792511, "learning_rate": 8.108381635845064e-05, "loss": 0.8541, "mean_token_accuracy": 0.7546774558722973, "num_tokens": 196925500.0, "step": 6169 }, { "entropy": 0.6807738281786442, "epoch": 0.5676793117923417, "grad_norm": 0.14741188287734985, "learning_rate": 8.108074953230902e-05, "loss": 0.6551, "mean_token_accuracy": 0.8102722056210041, "num_tokens": 196958202.0, "step": 6170 }, { "entropy": 0.7160360049456358, "epoch": 0.5677713181637828, "grad_norm": 0.16452574729919434, "learning_rate": 8.107768270616739e-05, "loss": 0.7118, "mean_token_accuracy": 0.7907982096076012, "num_tokens": 196989337.0, "step": 6171 }, { "entropy": 0.7993422020226717, "epoch": 0.567863324535224, "grad_norm": 0.1538527011871338, "learning_rate": 8.107461588002576e-05, "loss": 0.7838, "mean_token_accuracy": 0.7752147018909454, "num_tokens": 197021778.0, "step": 6172 }, { "entropy": 0.6992855500429869, "epoch": 0.5679553309066653, "grad_norm": 0.1557975709438324, "learning_rate": 8.107154905388414e-05, "loss": 0.6968, "mean_token_accuracy": 0.7975872084498405, "num_tokens": 197054465.0, "step": 6173 }, { "entropy": 0.7260349206626415, "epoch": 0.5680473372781065, "grad_norm": 0.15975819528102875, "learning_rate": 8.106848222774251e-05, "loss": 0.7253, "mean_token_accuracy": 0.7862066179513931, "num_tokens": 197086835.0, "step": 6174 }, { "entropy": 0.8396004531532526, "epoch": 0.5681393436495478, "grad_norm": 0.16089491546154022, "learning_rate": 8.106541540160089e-05, "loss": 0.8463, "mean_token_accuracy": 0.7555175721645355, "num_tokens": 197118356.0, "step": 6175 }, { "entropy": 0.7853314578533173, "epoch": 0.5682313500209889, "grad_norm": 0.17223531007766724, "learning_rate": 8.106234857545926e-05, "loss": 0.7877, "mean_token_accuracy": 0.7695168107748032, "num_tokens": 197149808.0, "step": 6176 }, { "entropy": 0.7925128415226936, "epoch": 0.5683233563924301, "grad_norm": 0.15103602409362793, "learning_rate": 8.105928174931764e-05, "loss": 0.7843, "mean_token_accuracy": 0.7670269906520844, "num_tokens": 197181517.0, "step": 6177 }, { "entropy": 0.7623697705566883, "epoch": 0.5684153627638714, "grad_norm": 0.1669042855501175, "learning_rate": 8.105621492317601e-05, "loss": 0.7688, "mean_token_accuracy": 0.7763974107801914, "num_tokens": 197213470.0, "step": 6178 }, { "entropy": 0.8445915803313255, "epoch": 0.5685073691353126, "grad_norm": 0.15992748737335205, "learning_rate": 8.105314809703438e-05, "loss": 0.8423, "mean_token_accuracy": 0.7566696777939796, "num_tokens": 197244553.0, "step": 6179 }, { "entropy": 0.8577238824218512, "epoch": 0.5685993755067539, "grad_norm": 0.1553870290517807, "learning_rate": 8.105008127089276e-05, "loss": 0.8273, "mean_token_accuracy": 0.7624795325100422, "num_tokens": 197276497.0, "step": 6180 }, { "entropy": 0.7570530418306589, "epoch": 0.568691381878195, "grad_norm": 0.1537483036518097, "learning_rate": 8.104701444475114e-05, "loss": 0.7303, "mean_token_accuracy": 0.7856259159743786, "num_tokens": 197308073.0, "step": 6181 }, { "entropy": 0.8243155311793089, "epoch": 0.5687833882496363, "grad_norm": 0.15339849889278412, "learning_rate": 8.104394761860951e-05, "loss": 0.8174, "mean_token_accuracy": 0.7635397911071777, "num_tokens": 197339180.0, "step": 6182 }, { "entropy": 0.7051878534257412, "epoch": 0.5688753946210775, "grad_norm": 0.1502407342195511, "learning_rate": 8.104088079246787e-05, "loss": 0.6839, "mean_token_accuracy": 0.7973216101527214, "num_tokens": 197371311.0, "step": 6183 }, { "entropy": 0.6502017993479967, "epoch": 0.5689674009925187, "grad_norm": 0.15851067006587982, "learning_rate": 8.103781396632624e-05, "loss": 0.6269, "mean_token_accuracy": 0.8183737583458424, "num_tokens": 197403996.0, "step": 6184 }, { "entropy": 0.7957365158945322, "epoch": 0.56905940736396, "grad_norm": 0.16907623410224915, "learning_rate": 8.103474714018462e-05, "loss": 0.7609, "mean_token_accuracy": 0.7774110324680805, "num_tokens": 197435186.0, "step": 6185 }, { "entropy": 0.8238000199198723, "epoch": 0.5691514137354011, "grad_norm": 0.15342099964618683, "learning_rate": 8.1031680314043e-05, "loss": 0.8073, "mean_token_accuracy": 0.7619861140847206, "num_tokens": 197467334.0, "step": 6186 }, { "entropy": 0.8050150033086538, "epoch": 0.5692434201068424, "grad_norm": 0.17338941991329193, "learning_rate": 8.102861348790137e-05, "loss": 0.8069, "mean_token_accuracy": 0.7668003216385841, "num_tokens": 197498154.0, "step": 6187 }, { "entropy": 0.6624724827706814, "epoch": 0.5693354264782836, "grad_norm": 0.15020178258419037, "learning_rate": 8.102554666175974e-05, "loss": 0.6627, "mean_token_accuracy": 0.8036194406449795, "num_tokens": 197529998.0, "step": 6188 }, { "entropy": 0.7789017595350742, "epoch": 0.5694274328497249, "grad_norm": 0.16006781160831451, "learning_rate": 8.102247983561812e-05, "loss": 0.7672, "mean_token_accuracy": 0.7727647535502911, "num_tokens": 197561274.0, "step": 6189 }, { "entropy": 0.8419913332909346, "epoch": 0.5695194392211661, "grad_norm": 0.16737529635429382, "learning_rate": 8.101941300947649e-05, "loss": 0.8571, "mean_token_accuracy": 0.7527636252343655, "num_tokens": 197593272.0, "step": 6190 }, { "entropy": 0.7439729981124401, "epoch": 0.5696114455926072, "grad_norm": 0.15263953804969788, "learning_rate": 8.101634618333487e-05, "loss": 0.7346, "mean_token_accuracy": 0.7850265502929688, "num_tokens": 197625940.0, "step": 6191 }, { "entropy": 0.8986934423446655, "epoch": 0.5697034519640485, "grad_norm": 0.16691042482852936, "learning_rate": 8.101327935719324e-05, "loss": 0.8995, "mean_token_accuracy": 0.7432137355208397, "num_tokens": 197657286.0, "step": 6192 }, { "entropy": 0.7607014216482639, "epoch": 0.5697954583354897, "grad_norm": 0.1567021608352661, "learning_rate": 8.101021253105162e-05, "loss": 0.7439, "mean_token_accuracy": 0.7874576821923256, "num_tokens": 197689164.0, "step": 6193 }, { "entropy": 0.6582626216113567, "epoch": 0.569887464706931, "grad_norm": 0.14691008627414703, "learning_rate": 8.100714570490999e-05, "loss": 0.6282, "mean_token_accuracy": 0.8135863244533539, "num_tokens": 197720963.0, "step": 6194 }, { "entropy": 0.7956168241798878, "epoch": 0.5699794710783722, "grad_norm": 0.16702446341514587, "learning_rate": 8.100407887876836e-05, "loss": 0.8041, "mean_token_accuracy": 0.7623897716403008, "num_tokens": 197752210.0, "step": 6195 }, { "entropy": 0.6484141442924738, "epoch": 0.5700714774498133, "grad_norm": 0.1497763842344284, "learning_rate": 8.100101205262675e-05, "loss": 0.6273, "mean_token_accuracy": 0.8148314505815506, "num_tokens": 197784582.0, "step": 6196 }, { "entropy": 0.7808452155441046, "epoch": 0.5701634838212546, "grad_norm": 0.15586259961128235, "learning_rate": 8.099794522648512e-05, "loss": 0.7685, "mean_token_accuracy": 0.7753037884831429, "num_tokens": 197816889.0, "step": 6197 }, { "entropy": 0.7790293619036674, "epoch": 0.5702554901926958, "grad_norm": 0.1523497849702835, "learning_rate": 8.099487840034349e-05, "loss": 0.765, "mean_token_accuracy": 0.7791965566575527, "num_tokens": 197848959.0, "step": 6198 }, { "entropy": 0.6646057441830635, "epoch": 0.5703474965641371, "grad_norm": 0.16700167953968048, "learning_rate": 8.099181157420186e-05, "loss": 0.6563, "mean_token_accuracy": 0.8024658709764481, "num_tokens": 197881025.0, "step": 6199 }, { "entropy": 0.7275566309690475, "epoch": 0.5704395029355783, "grad_norm": 0.15294766426086426, "learning_rate": 8.098874474806024e-05, "loss": 0.7195, "mean_token_accuracy": 0.7877686880528927, "num_tokens": 197913793.0, "step": 6200 }, { "entropy": 0.6875928975641727, "epoch": 0.5705315093070195, "grad_norm": 0.1507503241300583, "learning_rate": 8.098567792191862e-05, "loss": 0.6772, "mean_token_accuracy": 0.7976404242217541, "num_tokens": 197946556.0, "step": 6201 }, { "entropy": 0.6837386935949326, "epoch": 0.5706235156784607, "grad_norm": 0.15485689043998718, "learning_rate": 8.098261109577699e-05, "loss": 0.6721, "mean_token_accuracy": 0.8040144257247448, "num_tokens": 197978913.0, "step": 6202 }, { "entropy": 0.7222643317654729, "epoch": 0.570715522049902, "grad_norm": 0.15804944932460785, "learning_rate": 8.097954426963535e-05, "loss": 0.6924, "mean_token_accuracy": 0.7996182702481747, "num_tokens": 198011019.0, "step": 6203 }, { "entropy": 0.7542238840833306, "epoch": 0.5708075284213432, "grad_norm": 0.16466142237186432, "learning_rate": 8.097647744349374e-05, "loss": 0.7514, "mean_token_accuracy": 0.7767388671636581, "num_tokens": 198041299.0, "step": 6204 }, { "entropy": 0.6970021408051252, "epoch": 0.5708995347927844, "grad_norm": 0.16383104026317596, "learning_rate": 8.09734106173521e-05, "loss": 0.6905, "mean_token_accuracy": 0.796870231628418, "num_tokens": 198073807.0, "step": 6205 }, { "entropy": 0.802641874179244, "epoch": 0.5709915411642256, "grad_norm": 0.15970644354820251, "learning_rate": 8.097034379121048e-05, "loss": 0.7759, "mean_token_accuracy": 0.773629367351532, "num_tokens": 198105528.0, "step": 6206 }, { "entropy": 0.770581029355526, "epoch": 0.5710835475356668, "grad_norm": 0.16254067420959473, "learning_rate": 8.096727696506885e-05, "loss": 0.7504, "mean_token_accuracy": 0.7814521603286266, "num_tokens": 198137156.0, "step": 6207 }, { "entropy": 0.6271659880876541, "epoch": 0.5711755539071081, "grad_norm": 0.15341006219387054, "learning_rate": 8.096421013892723e-05, "loss": 0.6146, "mean_token_accuracy": 0.8198251612484455, "num_tokens": 198169177.0, "step": 6208 }, { "entropy": 0.8267356157302856, "epoch": 0.5712675602785493, "grad_norm": 0.15903159976005554, "learning_rate": 8.09611433127856e-05, "loss": 0.8095, "mean_token_accuracy": 0.7603858299553394, "num_tokens": 198201307.0, "step": 6209 }, { "entropy": 0.8074181471019983, "epoch": 0.5713595666499905, "grad_norm": 0.15600036084651947, "learning_rate": 8.095807648664397e-05, "loss": 0.7956, "mean_token_accuracy": 0.7657137960195541, "num_tokens": 198232995.0, "step": 6210 }, { "entropy": 0.6643227264285088, "epoch": 0.5714515730214317, "grad_norm": 0.14710359275341034, "learning_rate": 8.095500966050235e-05, "loss": 0.6504, "mean_token_accuracy": 0.8034306019544601, "num_tokens": 198264548.0, "step": 6211 }, { "entropy": 0.8369471915066242, "epoch": 0.5715435793928729, "grad_norm": 0.17524977028369904, "learning_rate": 8.095194283436073e-05, "loss": 0.8321, "mean_token_accuracy": 0.7631350979208946, "num_tokens": 198296943.0, "step": 6212 }, { "entropy": 0.7134013958275318, "epoch": 0.5716355857643142, "grad_norm": 0.1606544852256775, "learning_rate": 8.09488760082191e-05, "loss": 0.6972, "mean_token_accuracy": 0.7913184091448784, "num_tokens": 198327760.0, "step": 6213 }, { "entropy": 0.7649447033181787, "epoch": 0.5717275921357554, "grad_norm": 0.15175214409828186, "learning_rate": 8.094580918207747e-05, "loss": 0.7353, "mean_token_accuracy": 0.787051398307085, "num_tokens": 198359612.0, "step": 6214 }, { "entropy": 0.7173961289227009, "epoch": 0.5718195985071967, "grad_norm": 0.15355461835861206, "learning_rate": 8.094274235593584e-05, "loss": 0.6955, "mean_token_accuracy": 0.7894110158085823, "num_tokens": 198392145.0, "step": 6215 }, { "entropy": 0.7497940175235271, "epoch": 0.5719116048786378, "grad_norm": 0.15270863473415375, "learning_rate": 8.093967552979422e-05, "loss": 0.7295, "mean_token_accuracy": 0.7809534445405006, "num_tokens": 198424079.0, "step": 6216 }, { "entropy": 0.8851457964628935, "epoch": 0.572003611250079, "grad_norm": 0.1582627147436142, "learning_rate": 8.09366087036526e-05, "loss": 0.8776, "mean_token_accuracy": 0.7464221902191639, "num_tokens": 198456247.0, "step": 6217 }, { "entropy": 0.8530375827103853, "epoch": 0.5720956176215203, "grad_norm": 0.1583968698978424, "learning_rate": 8.093354187751097e-05, "loss": 0.8355, "mean_token_accuracy": 0.7587568536400795, "num_tokens": 198488390.0, "step": 6218 }, { "entropy": 0.7185436654835939, "epoch": 0.5721876239929615, "grad_norm": 0.15789027512073517, "learning_rate": 8.093047505136933e-05, "loss": 0.7267, "mean_token_accuracy": 0.7878854684531689, "num_tokens": 198520778.0, "step": 6219 }, { "entropy": 0.7585103958845139, "epoch": 0.5722796303644028, "grad_norm": 0.16389408707618713, "learning_rate": 8.092740822522772e-05, "loss": 0.7468, "mean_token_accuracy": 0.7808569818735123, "num_tokens": 198552643.0, "step": 6220 }, { "entropy": 0.7793201692402363, "epoch": 0.5723716367358439, "grad_norm": 0.17141634225845337, "learning_rate": 8.092434139908608e-05, "loss": 0.7537, "mean_token_accuracy": 0.778145357966423, "num_tokens": 198583992.0, "step": 6221 }, { "entropy": 0.7885103989392519, "epoch": 0.5724636431072851, "grad_norm": 0.155290424823761, "learning_rate": 8.092127457294447e-05, "loss": 0.7806, "mean_token_accuracy": 0.7717696614563465, "num_tokens": 198616760.0, "step": 6222 }, { "entropy": 0.9061334617435932, "epoch": 0.5725556494787264, "grad_norm": 0.16027185320854187, "learning_rate": 8.091820774680283e-05, "loss": 0.9009, "mean_token_accuracy": 0.7403997220098972, "num_tokens": 198649117.0, "step": 6223 }, { "entropy": 0.7770516835153103, "epoch": 0.5726476558501676, "grad_norm": 0.1559436321258545, "learning_rate": 8.091514092066121e-05, "loss": 0.7529, "mean_token_accuracy": 0.7775509767234325, "num_tokens": 198681580.0, "step": 6224 }, { "entropy": 0.8140580803155899, "epoch": 0.5727396622216089, "grad_norm": 0.15455497801303864, "learning_rate": 8.091207409451958e-05, "loss": 0.8115, "mean_token_accuracy": 0.76488022133708, "num_tokens": 198713211.0, "step": 6225 }, { "entropy": 0.7667206395417452, "epoch": 0.57283166859305, "grad_norm": 0.15765783190727234, "learning_rate": 8.090900726837795e-05, "loss": 0.7675, "mean_token_accuracy": 0.7767193801701069, "num_tokens": 198744970.0, "step": 6226 }, { "entropy": 0.7060567028820515, "epoch": 0.5729236749644913, "grad_norm": 0.1540021002292633, "learning_rate": 8.090594044223633e-05, "loss": 0.6862, "mean_token_accuracy": 0.7956785336136818, "num_tokens": 198777108.0, "step": 6227 }, { "entropy": 0.8524210881441832, "epoch": 0.5730156813359325, "grad_norm": 0.16292454302310944, "learning_rate": 8.090287361609471e-05, "loss": 0.8396, "mean_token_accuracy": 0.7589609250426292, "num_tokens": 198808552.0, "step": 6228 }, { "entropy": 0.6729143830016255, "epoch": 0.5731076877073737, "grad_norm": 0.15998893976211548, "learning_rate": 8.089980678995308e-05, "loss": 0.6578, "mean_token_accuracy": 0.8012032844126225, "num_tokens": 198840560.0, "step": 6229 }, { "entropy": 0.783919271081686, "epoch": 0.573199694078815, "grad_norm": 0.15653446316719055, "learning_rate": 8.089673996381145e-05, "loss": 0.7959, "mean_token_accuracy": 0.7697239816188812, "num_tokens": 198873328.0, "step": 6230 }, { "entropy": 0.7464323192834854, "epoch": 0.5732917004502561, "grad_norm": 0.16626109182834625, "learning_rate": 8.089367313766983e-05, "loss": 0.7411, "mean_token_accuracy": 0.7789025232195854, "num_tokens": 198904148.0, "step": 6231 }, { "entropy": 0.7274770140647888, "epoch": 0.5733837068216974, "grad_norm": 0.15386395156383514, "learning_rate": 8.08906063115282e-05, "loss": 0.727, "mean_token_accuracy": 0.7847911305725574, "num_tokens": 198936559.0, "step": 6232 }, { "entropy": 0.6563061624765396, "epoch": 0.5734757131931386, "grad_norm": 0.16083309054374695, "learning_rate": 8.088753948538658e-05, "loss": 0.645, "mean_token_accuracy": 0.8080474585294724, "num_tokens": 198968702.0, "step": 6233 }, { "entropy": 0.7628333643078804, "epoch": 0.5735677195645799, "grad_norm": 0.157570019364357, "learning_rate": 8.088447265924495e-05, "loss": 0.7554, "mean_token_accuracy": 0.7772993259131908, "num_tokens": 199000651.0, "step": 6234 }, { "entropy": 0.7644247487187386, "epoch": 0.5736597259360211, "grad_norm": 0.15128572285175323, "learning_rate": 8.088140583310333e-05, "loss": 0.7376, "mean_token_accuracy": 0.7818257994949818, "num_tokens": 199032397.0, "step": 6235 }, { "entropy": 0.8237657845020294, "epoch": 0.5737517323074622, "grad_norm": 0.15344345569610596, "learning_rate": 8.08783390069617e-05, "loss": 0.803, "mean_token_accuracy": 0.7676897905766964, "num_tokens": 199065133.0, "step": 6236 }, { "entropy": 0.7129977494478226, "epoch": 0.5738437386789035, "grad_norm": 0.1528964340686798, "learning_rate": 8.087527218082008e-05, "loss": 0.6968, "mean_token_accuracy": 0.7889960184693336, "num_tokens": 199097642.0, "step": 6237 }, { "entropy": 0.8824027255177498, "epoch": 0.5739357450503447, "grad_norm": 0.16749075055122375, "learning_rate": 8.087220535467845e-05, "loss": 0.8649, "mean_token_accuracy": 0.7490801364183426, "num_tokens": 199128664.0, "step": 6238 }, { "entropy": 0.6857462236657739, "epoch": 0.574027751421786, "grad_norm": 0.15057803690433502, "learning_rate": 8.086913852853683e-05, "loss": 0.6633, "mean_token_accuracy": 0.8048806637525558, "num_tokens": 199160869.0, "step": 6239 }, { "entropy": 0.7811956889927387, "epoch": 0.5741197577932272, "grad_norm": 0.15137752890586853, "learning_rate": 8.08660717023952e-05, "loss": 0.7645, "mean_token_accuracy": 0.7702753134071827, "num_tokens": 199192284.0, "step": 6240 }, { "entropy": 0.7460326291620731, "epoch": 0.5742117641646683, "grad_norm": 0.16718575358390808, "learning_rate": 8.086300487625356e-05, "loss": 0.7293, "mean_token_accuracy": 0.7882943488657475, "num_tokens": 199223781.0, "step": 6241 }, { "entropy": 0.8988511227071285, "epoch": 0.5743037705361096, "grad_norm": 0.1644546389579773, "learning_rate": 8.085993805011195e-05, "loss": 0.9115, "mean_token_accuracy": 0.735262107104063, "num_tokens": 199254639.0, "step": 6242 }, { "entropy": 0.8371548857539892, "epoch": 0.5743957769075508, "grad_norm": 0.15682707726955414, "learning_rate": 8.085687122397033e-05, "loss": 0.8484, "mean_token_accuracy": 0.7512327618896961, "num_tokens": 199286450.0, "step": 6243 }, { "entropy": 0.8172141909599304, "epoch": 0.5744877832789921, "grad_norm": 0.15649136900901794, "learning_rate": 8.08538043978287e-05, "loss": 0.8156, "mean_token_accuracy": 0.7650195769965649, "num_tokens": 199317621.0, "step": 6244 }, { "entropy": 0.7647748794406652, "epoch": 0.5745797896504333, "grad_norm": 0.16243413090705872, "learning_rate": 8.085073757168706e-05, "loss": 0.7687, "mean_token_accuracy": 0.7743542455136776, "num_tokens": 199349760.0, "step": 6245 }, { "entropy": 0.6866677738726139, "epoch": 0.5746717960218746, "grad_norm": 0.15089498460292816, "learning_rate": 8.084767074554543e-05, "loss": 0.6723, "mean_token_accuracy": 0.7983603030443192, "num_tokens": 199381388.0, "step": 6246 }, { "entropy": 0.7971693053841591, "epoch": 0.5747638023933157, "grad_norm": 0.16512492299079895, "learning_rate": 8.084460391940381e-05, "loss": 0.7905, "mean_token_accuracy": 0.7668520994484425, "num_tokens": 199412853.0, "step": 6247 }, { "entropy": 0.7705144733190536, "epoch": 0.574855808764757, "grad_norm": 0.17310816049575806, "learning_rate": 8.084153709326219e-05, "loss": 0.7584, "mean_token_accuracy": 0.7777280397713184, "num_tokens": 199443710.0, "step": 6248 }, { "entropy": 0.8104498349130154, "epoch": 0.5749478151361982, "grad_norm": 0.15700627863407135, "learning_rate": 8.083847026712056e-05, "loss": 0.8031, "mean_token_accuracy": 0.7668367810547352, "num_tokens": 199475317.0, "step": 6249 }, { "entropy": 0.7702053599059582, "epoch": 0.5750398215076394, "grad_norm": 0.15558089315891266, "learning_rate": 8.083540344097893e-05, "loss": 0.7721, "mean_token_accuracy": 0.7722570896148682, "num_tokens": 199507302.0, "step": 6250 }, { "entropy": 0.8306268192827702, "epoch": 0.5751318278790807, "grad_norm": 0.1598258763551712, "learning_rate": 8.083233661483731e-05, "loss": 0.8092, "mean_token_accuracy": 0.7627677880227566, "num_tokens": 199539276.0, "step": 6251 }, { "entropy": 0.8169474769383669, "epoch": 0.5752238342505218, "grad_norm": 0.15492399036884308, "learning_rate": 8.082926978869568e-05, "loss": 0.7996, "mean_token_accuracy": 0.7648691385984421, "num_tokens": 199571957.0, "step": 6252 }, { "entropy": 0.7245679926127195, "epoch": 0.5753158406219631, "grad_norm": 0.16374364495277405, "learning_rate": 8.082620296255406e-05, "loss": 0.7121, "mean_token_accuracy": 0.7892801389098167, "num_tokens": 199603520.0, "step": 6253 }, { "entropy": 0.7771807797253132, "epoch": 0.5754078469934043, "grad_norm": 0.14942139387130737, "learning_rate": 8.082313613641244e-05, "loss": 0.7548, "mean_token_accuracy": 0.7773909978568554, "num_tokens": 199635829.0, "step": 6254 }, { "entropy": 0.7479421645402908, "epoch": 0.5754998533648455, "grad_norm": 0.16987542808055878, "learning_rate": 8.082006931027081e-05, "loss": 0.7538, "mean_token_accuracy": 0.782465361058712, "num_tokens": 199667768.0, "step": 6255 }, { "entropy": 0.7988296607509255, "epoch": 0.5755918597362868, "grad_norm": 0.1660088449716568, "learning_rate": 8.081700248412918e-05, "loss": 0.7903, "mean_token_accuracy": 0.7731588669121265, "num_tokens": 199698312.0, "step": 6256 }, { "entropy": 0.6389548163861036, "epoch": 0.5756838661077279, "grad_norm": 0.16295701265335083, "learning_rate": 8.081393565798754e-05, "loss": 0.6237, "mean_token_accuracy": 0.8134323619306087, "num_tokens": 199729978.0, "step": 6257 }, { "entropy": 0.6478856466710567, "epoch": 0.5757758724791692, "grad_norm": 0.14736109972000122, "learning_rate": 8.081086883184593e-05, "loss": 0.6277, "mean_token_accuracy": 0.8156049735844135, "num_tokens": 199762205.0, "step": 6258 }, { "entropy": 0.7816128265112638, "epoch": 0.5758678788506104, "grad_norm": 0.15775717794895172, "learning_rate": 8.080780200570431e-05, "loss": 0.7682, "mean_token_accuracy": 0.7776088006794453, "num_tokens": 199793273.0, "step": 6259 }, { "entropy": 0.7053835839033127, "epoch": 0.5759598852220517, "grad_norm": 0.1524328589439392, "learning_rate": 8.080473517956268e-05, "loss": 0.7064, "mean_token_accuracy": 0.7927264831960201, "num_tokens": 199825915.0, "step": 6260 }, { "entropy": 0.8594235852360725, "epoch": 0.5760518915934929, "grad_norm": 0.16342085599899292, "learning_rate": 8.080166835342104e-05, "loss": 0.8436, "mean_token_accuracy": 0.7571351453661919, "num_tokens": 199857412.0, "step": 6261 }, { "entropy": 0.706976380199194, "epoch": 0.576143897964934, "grad_norm": 0.16467995941638947, "learning_rate": 8.079860152727942e-05, "loss": 0.6874, "mean_token_accuracy": 0.7986434772610664, "num_tokens": 199889118.0, "step": 6262 }, { "entropy": 0.6753663513809443, "epoch": 0.5762359043363753, "grad_norm": 0.15004122257232666, "learning_rate": 8.079553470113779e-05, "loss": 0.6525, "mean_token_accuracy": 0.8112446069717407, "num_tokens": 199920761.0, "step": 6263 }, { "entropy": 0.7758138291537762, "epoch": 0.5763279107078165, "grad_norm": 0.1565736085176468, "learning_rate": 8.079246787499617e-05, "loss": 0.7496, "mean_token_accuracy": 0.781252097338438, "num_tokens": 199951485.0, "step": 6264 }, { "entropy": 0.7535859160125256, "epoch": 0.5764199170792578, "grad_norm": 0.16182349622249603, "learning_rate": 8.078940104885454e-05, "loss": 0.7329, "mean_token_accuracy": 0.7852434031665325, "num_tokens": 199983390.0, "step": 6265 }, { "entropy": 0.7597635425627232, "epoch": 0.576511923450699, "grad_norm": 0.1602918803691864, "learning_rate": 8.078633422271292e-05, "loss": 0.7517, "mean_token_accuracy": 0.7775381207466125, "num_tokens": 200015226.0, "step": 6266 }, { "entropy": 0.736896762624383, "epoch": 0.5766039298221401, "grad_norm": 0.15868572890758514, "learning_rate": 8.078326739657129e-05, "loss": 0.7333, "mean_token_accuracy": 0.7858630418777466, "num_tokens": 200047109.0, "step": 6267 }, { "entropy": 0.798507371917367, "epoch": 0.5766959361935814, "grad_norm": 0.15632201731204987, "learning_rate": 8.078020057042966e-05, "loss": 0.7857, "mean_token_accuracy": 0.7678864486515522, "num_tokens": 200078482.0, "step": 6268 }, { "entropy": 0.7783847693353891, "epoch": 0.5767879425650226, "grad_norm": 0.16824515163898468, "learning_rate": 8.077713374428804e-05, "loss": 0.7698, "mean_token_accuracy": 0.7800754606723785, "num_tokens": 200110232.0, "step": 6269 }, { "entropy": 0.7546468870714307, "epoch": 0.5768799489364639, "grad_norm": 0.1617763489484787, "learning_rate": 8.077406691814642e-05, "loss": 0.7445, "mean_token_accuracy": 0.7820006348192692, "num_tokens": 200142458.0, "step": 6270 }, { "entropy": 0.7753540873527527, "epoch": 0.5769719553079051, "grad_norm": 0.15921179950237274, "learning_rate": 8.077100009200479e-05, "loss": 0.7648, "mean_token_accuracy": 0.7768374234437943, "num_tokens": 200174305.0, "step": 6271 }, { "entropy": 0.7191921314224601, "epoch": 0.5770639616793463, "grad_norm": 0.15235769748687744, "learning_rate": 8.076793326586316e-05, "loss": 0.7196, "mean_token_accuracy": 0.793431181460619, "num_tokens": 200205721.0, "step": 6272 }, { "entropy": 0.7635479914024472, "epoch": 0.5771559680507875, "grad_norm": 0.15391786396503448, "learning_rate": 8.076486643972153e-05, "loss": 0.7528, "mean_token_accuracy": 0.7801074832677841, "num_tokens": 200238178.0, "step": 6273 }, { "entropy": 0.8130598776042461, "epoch": 0.5772479744222287, "grad_norm": 0.16078191995620728, "learning_rate": 8.076179961357992e-05, "loss": 0.8056, "mean_token_accuracy": 0.7682462595403194, "num_tokens": 200269505.0, "step": 6274 }, { "entropy": 0.8972436040639877, "epoch": 0.57733998079367, "grad_norm": 0.16670973598957062, "learning_rate": 8.075873278743829e-05, "loss": 0.8888, "mean_token_accuracy": 0.744352500885725, "num_tokens": 200301445.0, "step": 6275 }, { "entropy": 0.7927631288766861, "epoch": 0.5774319871651112, "grad_norm": 0.16565723717212677, "learning_rate": 8.075566596129666e-05, "loss": 0.7816, "mean_token_accuracy": 0.7704471051692963, "num_tokens": 200333611.0, "step": 6276 }, { "entropy": 0.6953124552965164, "epoch": 0.5775239935365524, "grad_norm": 0.17032477259635925, "learning_rate": 8.075259913515502e-05, "loss": 0.6905, "mean_token_accuracy": 0.8005638271570206, "num_tokens": 200364639.0, "step": 6277 }, { "entropy": 0.7317427024245262, "epoch": 0.5776159999079936, "grad_norm": 0.1567559391260147, "learning_rate": 8.07495323090134e-05, "loss": 0.7046, "mean_token_accuracy": 0.7928881235420704, "num_tokens": 200396171.0, "step": 6278 }, { "entropy": 0.7859720103442669, "epoch": 0.5777080062794349, "grad_norm": 0.1623605489730835, "learning_rate": 8.074646548287179e-05, "loss": 0.7863, "mean_token_accuracy": 0.7702104859054089, "num_tokens": 200428361.0, "step": 6279 }, { "entropy": 0.8877792675048113, "epoch": 0.5778000126508761, "grad_norm": 0.15888014435768127, "learning_rate": 8.074339865673015e-05, "loss": 0.8853, "mean_token_accuracy": 0.7471574880182743, "num_tokens": 200460666.0, "step": 6280 }, { "entropy": 0.7569710407406092, "epoch": 0.5778920190223173, "grad_norm": 0.15582050383090973, "learning_rate": 8.074033183058852e-05, "loss": 0.7589, "mean_token_accuracy": 0.7775972820818424, "num_tokens": 200492816.0, "step": 6281 }, { "entropy": 0.8132050447165966, "epoch": 0.5779840253937585, "grad_norm": 0.15627801418304443, "learning_rate": 8.07372650044469e-05, "loss": 0.8176, "mean_token_accuracy": 0.7634390294551849, "num_tokens": 200525410.0, "step": 6282 }, { "entropy": 0.7583678252995014, "epoch": 0.5780760317651997, "grad_norm": 0.1570052057504654, "learning_rate": 8.073419817830527e-05, "loss": 0.748, "mean_token_accuracy": 0.7785113342106342, "num_tokens": 200557522.0, "step": 6283 }, { "entropy": 0.7631046678870916, "epoch": 0.578168038136641, "grad_norm": 0.15746019780635834, "learning_rate": 8.073113135216365e-05, "loss": 0.762, "mean_token_accuracy": 0.7783019281923771, "num_tokens": 200589719.0, "step": 6284 }, { "entropy": 0.7816500142216682, "epoch": 0.5782600445080822, "grad_norm": 0.16315355896949768, "learning_rate": 8.072806452602203e-05, "loss": 0.7835, "mean_token_accuracy": 0.7704741135239601, "num_tokens": 200621800.0, "step": 6285 }, { "entropy": 0.7770050968974829, "epoch": 0.5783520508795235, "grad_norm": 0.1652444452047348, "learning_rate": 8.07249976998804e-05, "loss": 0.7952, "mean_token_accuracy": 0.7676160708069801, "num_tokens": 200653463.0, "step": 6286 }, { "entropy": 0.8888699933886528, "epoch": 0.5784440572509646, "grad_norm": 0.16502490639686584, "learning_rate": 8.072193087373877e-05, "loss": 0.8858, "mean_token_accuracy": 0.7468933388590813, "num_tokens": 200685362.0, "step": 6287 }, { "entropy": 0.7972737364470959, "epoch": 0.5785360636224058, "grad_norm": 0.16355226933956146, "learning_rate": 8.071886404759714e-05, "loss": 0.7893, "mean_token_accuracy": 0.7700091116130352, "num_tokens": 200717593.0, "step": 6288 }, { "entropy": 0.7796119339764118, "epoch": 0.5786280699938471, "grad_norm": 0.15401561558246613, "learning_rate": 8.071579722145552e-05, "loss": 0.7628, "mean_token_accuracy": 0.777599386870861, "num_tokens": 200749280.0, "step": 6289 }, { "entropy": 0.8845874909311533, "epoch": 0.5787200763652883, "grad_norm": 0.16354681551456451, "learning_rate": 8.07127303953139e-05, "loss": 0.8424, "mean_token_accuracy": 0.7559351846575737, "num_tokens": 200780799.0, "step": 6290 }, { "entropy": 0.8468320723623037, "epoch": 0.5788120827367296, "grad_norm": 0.1604946255683899, "learning_rate": 8.070966356917227e-05, "loss": 0.8202, "mean_token_accuracy": 0.7621542774140835, "num_tokens": 200812229.0, "step": 6291 }, { "entropy": 0.8042459487915039, "epoch": 0.5789040891081707, "grad_norm": 0.15312406420707703, "learning_rate": 8.070659674303064e-05, "loss": 0.785, "mean_token_accuracy": 0.7734493762254715, "num_tokens": 200843993.0, "step": 6292 }, { "entropy": 0.8520974237471819, "epoch": 0.578996095479612, "grad_norm": 0.15955348312854767, "learning_rate": 8.070352991688902e-05, "loss": 0.8427, "mean_token_accuracy": 0.7540944889187813, "num_tokens": 200876239.0, "step": 6293 }, { "entropy": 0.7804214805364609, "epoch": 0.5790881018510532, "grad_norm": 0.16528089344501495, "learning_rate": 8.070046309074739e-05, "loss": 0.7818, "mean_token_accuracy": 0.7721461318433285, "num_tokens": 200907644.0, "step": 6294 }, { "entropy": 0.6066843327134848, "epoch": 0.5791801082224944, "grad_norm": 0.14624769985675812, "learning_rate": 8.069739626460577e-05, "loss": 0.5867, "mean_token_accuracy": 0.825780563056469, "num_tokens": 200939780.0, "step": 6295 }, { "entropy": 0.7197702396661043, "epoch": 0.5792721145939357, "grad_norm": 0.153267502784729, "learning_rate": 8.069432943846414e-05, "loss": 0.6924, "mean_token_accuracy": 0.7932593263685703, "num_tokens": 200971185.0, "step": 6296 }, { "entropy": 0.6499939672648907, "epoch": 0.5793641209653768, "grad_norm": 0.1522831916809082, "learning_rate": 8.069126261232252e-05, "loss": 0.6286, "mean_token_accuracy": 0.8139964155852795, "num_tokens": 201003199.0, "step": 6297 }, { "entropy": 0.7514182664453983, "epoch": 0.5794561273368181, "grad_norm": 0.1641286164522171, "learning_rate": 8.068819578618088e-05, "loss": 0.7388, "mean_token_accuracy": 0.778253298252821, "num_tokens": 201035021.0, "step": 6298 }, { "entropy": 0.8678616210818291, "epoch": 0.5795481337082593, "grad_norm": 0.16442568600177765, "learning_rate": 8.068512896003925e-05, "loss": 0.8634, "mean_token_accuracy": 0.7499817423522472, "num_tokens": 201067106.0, "step": 6299 }, { "entropy": 0.7467313800007105, "epoch": 0.5796401400797005, "grad_norm": 0.1566130816936493, "learning_rate": 8.068206213389763e-05, "loss": 0.7581, "mean_token_accuracy": 0.777968168258667, "num_tokens": 201099739.0, "step": 6300 }, { "entropy": 0.6662234645336866, "epoch": 0.5797321464511418, "grad_norm": 0.15311498939990997, "learning_rate": 8.067899530775602e-05, "loss": 0.6511, "mean_token_accuracy": 0.809533029794693, "num_tokens": 201131358.0, "step": 6301 }, { "entropy": 0.7457143813371658, "epoch": 0.5798241528225829, "grad_norm": 0.15723876655101776, "learning_rate": 8.067592848161438e-05, "loss": 0.7375, "mean_token_accuracy": 0.7803190276026726, "num_tokens": 201163090.0, "step": 6302 }, { "entropy": 0.7041789777576923, "epoch": 0.5799161591940242, "grad_norm": 0.17103150486946106, "learning_rate": 8.067286165547275e-05, "loss": 0.712, "mean_token_accuracy": 0.7885116450488567, "num_tokens": 201195338.0, "step": 6303 }, { "entropy": 0.6171780070289969, "epoch": 0.5800081655654654, "grad_norm": 0.15399011969566345, "learning_rate": 8.066979482933112e-05, "loss": 0.6063, "mean_token_accuracy": 0.8205934762954712, "num_tokens": 201227226.0, "step": 6304 }, { "entropy": 0.736755320802331, "epoch": 0.5801001719369067, "grad_norm": 0.15683552622795105, "learning_rate": 8.06667280031895e-05, "loss": 0.7223, "mean_token_accuracy": 0.7941903285682201, "num_tokens": 201259146.0, "step": 6305 }, { "entropy": 0.7841922156512737, "epoch": 0.5801921783083479, "grad_norm": 0.15986362099647522, "learning_rate": 8.066366117704788e-05, "loss": 0.7815, "mean_token_accuracy": 0.7699039094150066, "num_tokens": 201290568.0, "step": 6306 }, { "entropy": 0.7852820176631212, "epoch": 0.580284184679789, "grad_norm": 0.15699562430381775, "learning_rate": 8.066059435090625e-05, "loss": 0.7674, "mean_token_accuracy": 0.7744249701499939, "num_tokens": 201322438.0, "step": 6307 }, { "entropy": 0.7944781687110662, "epoch": 0.5803761910512303, "grad_norm": 0.15848669409751892, "learning_rate": 8.065752752476462e-05, "loss": 0.7781, "mean_token_accuracy": 0.773652445524931, "num_tokens": 201354728.0, "step": 6308 }, { "entropy": 0.8279907032847404, "epoch": 0.5804681974226715, "grad_norm": 0.1658608764410019, "learning_rate": 8.0654460698623e-05, "loss": 0.8279, "mean_token_accuracy": 0.7600633203983307, "num_tokens": 201386286.0, "step": 6309 }, { "entropy": 0.7419232502579689, "epoch": 0.5805602037941128, "grad_norm": 0.15257273614406586, "learning_rate": 8.065139387248137e-05, "loss": 0.7297, "mean_token_accuracy": 0.7802859880030155, "num_tokens": 201417108.0, "step": 6310 }, { "entropy": 0.741171196103096, "epoch": 0.580652210165554, "grad_norm": 0.16178913414478302, "learning_rate": 8.064832704633975e-05, "loss": 0.7339, "mean_token_accuracy": 0.7878806889057159, "num_tokens": 201448763.0, "step": 6311 }, { "entropy": 0.7838182188570499, "epoch": 0.5807442165369952, "grad_norm": 0.1563577502965927, "learning_rate": 8.064526022019812e-05, "loss": 0.7625, "mean_token_accuracy": 0.7746467292308807, "num_tokens": 201480744.0, "step": 6312 }, { "entropy": 0.7743762787431479, "epoch": 0.5808362229084364, "grad_norm": 0.16363857686519623, "learning_rate": 8.06421933940565e-05, "loss": 0.7558, "mean_token_accuracy": 0.776181772351265, "num_tokens": 201512336.0, "step": 6313 }, { "entropy": 0.75204012170434, "epoch": 0.5809282292798776, "grad_norm": 0.1579774022102356, "learning_rate": 8.063912656791487e-05, "loss": 0.7364, "mean_token_accuracy": 0.7798038721084595, "num_tokens": 201543821.0, "step": 6314 }, { "entropy": 0.7822910724207759, "epoch": 0.5810202356513189, "grad_norm": 0.16129764914512634, "learning_rate": 8.063605974177323e-05, "loss": 0.7811, "mean_token_accuracy": 0.7714543677866459, "num_tokens": 201576078.0, "step": 6315 }, { "entropy": 0.7639681920409203, "epoch": 0.5811122420227601, "grad_norm": 0.16104336082935333, "learning_rate": 8.063299291563163e-05, "loss": 0.7438, "mean_token_accuracy": 0.7819480486214161, "num_tokens": 201608221.0, "step": 6316 }, { "entropy": 0.7768698818981647, "epoch": 0.5812042483942013, "grad_norm": 0.15105968713760376, "learning_rate": 8.062992608949e-05, "loss": 0.7699, "mean_token_accuracy": 0.7744005955755711, "num_tokens": 201640983.0, "step": 6317 }, { "entropy": 0.7412724606692791, "epoch": 0.5812962547656425, "grad_norm": 0.15405476093292236, "learning_rate": 8.062685926334836e-05, "loss": 0.7455, "mean_token_accuracy": 0.7817461118102074, "num_tokens": 201672769.0, "step": 6318 }, { "entropy": 0.7500210348516703, "epoch": 0.5813882611370838, "grad_norm": 0.16205640137195587, "learning_rate": 8.062379243720673e-05, "loss": 0.7434, "mean_token_accuracy": 0.7774663865566254, "num_tokens": 201704955.0, "step": 6319 }, { "entropy": 0.8835061937570572, "epoch": 0.581480267508525, "grad_norm": 0.16959893703460693, "learning_rate": 8.062072561106511e-05, "loss": 0.8846, "mean_token_accuracy": 0.7440359517931938, "num_tokens": 201736497.0, "step": 6320 }, { "entropy": 0.7107734996825457, "epoch": 0.5815722738799662, "grad_norm": 0.15486393868923187, "learning_rate": 8.06176587849235e-05, "loss": 0.6949, "mean_token_accuracy": 0.7955043911933899, "num_tokens": 201768620.0, "step": 6321 }, { "entropy": 0.7030289443209767, "epoch": 0.5816642802514074, "grad_norm": 0.15442399680614471, "learning_rate": 8.061459195878186e-05, "loss": 0.6879, "mean_token_accuracy": 0.7976690046489239, "num_tokens": 201800624.0, "step": 6322 }, { "entropy": 0.8252401277422905, "epoch": 0.5817562866228486, "grad_norm": 0.16181346774101257, "learning_rate": 8.061152513264023e-05, "loss": 0.82, "mean_token_accuracy": 0.7604249753057957, "num_tokens": 201832246.0, "step": 6323 }, { "entropy": 0.7778275422751904, "epoch": 0.5818482929942899, "grad_norm": 0.15997865796089172, "learning_rate": 8.060845830649861e-05, "loss": 0.7541, "mean_token_accuracy": 0.774393979460001, "num_tokens": 201863832.0, "step": 6324 }, { "entropy": 0.7013303618878126, "epoch": 0.5819402993657311, "grad_norm": 0.15281438827514648, "learning_rate": 8.060539148035698e-05, "loss": 0.6868, "mean_token_accuracy": 0.7972174286842346, "num_tokens": 201895685.0, "step": 6325 }, { "entropy": 0.739263353869319, "epoch": 0.5820323057371724, "grad_norm": 0.1638054996728897, "learning_rate": 8.060232465421536e-05, "loss": 0.7272, "mean_token_accuracy": 0.7870798408985138, "num_tokens": 201927221.0, "step": 6326 }, { "entropy": 0.7923410907387733, "epoch": 0.5821243121086135, "grad_norm": 0.16328993439674377, "learning_rate": 8.059925782807373e-05, "loss": 0.8155, "mean_token_accuracy": 0.7636413872241974, "num_tokens": 201959405.0, "step": 6327 }, { "entropy": 0.8175417892634869, "epoch": 0.5822163184800547, "grad_norm": 0.16284319758415222, "learning_rate": 8.059619100193211e-05, "loss": 0.8141, "mean_token_accuracy": 0.7627188786864281, "num_tokens": 201991966.0, "step": 6328 }, { "entropy": 0.7379454039037228, "epoch": 0.582308324851496, "grad_norm": 0.15973059833049774, "learning_rate": 8.059312417579048e-05, "loss": 0.7115, "mean_token_accuracy": 0.7903411835432053, "num_tokens": 202024332.0, "step": 6329 }, { "entropy": 0.7785872016102076, "epoch": 0.5824003312229372, "grad_norm": 0.15696199238300323, "learning_rate": 8.059005734964885e-05, "loss": 0.7525, "mean_token_accuracy": 0.7813113331794739, "num_tokens": 202056723.0, "step": 6330 }, { "entropy": 0.7142103482037783, "epoch": 0.5824923375943785, "grad_norm": 0.1538364142179489, "learning_rate": 8.058699052350723e-05, "loss": 0.6892, "mean_token_accuracy": 0.7976019233465195, "num_tokens": 202088971.0, "step": 6331 }, { "entropy": 0.7651181500405073, "epoch": 0.5825843439658196, "grad_norm": 0.15773583948612213, "learning_rate": 8.058392369736561e-05, "loss": 0.7483, "mean_token_accuracy": 0.7767143212258816, "num_tokens": 202120503.0, "step": 6332 }, { "entropy": 0.6831620540469885, "epoch": 0.5826763503372608, "grad_norm": 0.15898539125919342, "learning_rate": 8.058085687122398e-05, "loss": 0.6591, "mean_token_accuracy": 0.8021279238164425, "num_tokens": 202151604.0, "step": 6333 }, { "entropy": 0.8299389090389013, "epoch": 0.5827683567087021, "grad_norm": 0.16599726676940918, "learning_rate": 8.057779004508234e-05, "loss": 0.8367, "mean_token_accuracy": 0.7528194151818752, "num_tokens": 202183846.0, "step": 6334 }, { "entropy": 0.6999797709286213, "epoch": 0.5828603630801433, "grad_norm": 0.149987131357193, "learning_rate": 8.057472321894071e-05, "loss": 0.6943, "mean_token_accuracy": 0.7946860827505589, "num_tokens": 202216368.0, "step": 6335 }, { "entropy": 0.8266239836812019, "epoch": 0.5829523694515846, "grad_norm": 0.1553816795349121, "learning_rate": 8.05716563927991e-05, "loss": 0.8279, "mean_token_accuracy": 0.7566586658358574, "num_tokens": 202248375.0, "step": 6336 }, { "entropy": 0.7897210288792849, "epoch": 0.5830443758230257, "grad_norm": 0.16443262994289398, "learning_rate": 8.056858956665748e-05, "loss": 0.7842, "mean_token_accuracy": 0.7707095891237259, "num_tokens": 202280347.0, "step": 6337 }, { "entropy": 0.8375037275254726, "epoch": 0.583136382194467, "grad_norm": 0.15919806063175201, "learning_rate": 8.056552274051584e-05, "loss": 0.8241, "mean_token_accuracy": 0.7626102454960346, "num_tokens": 202311045.0, "step": 6338 }, { "entropy": 0.870623491704464, "epoch": 0.5832283885659082, "grad_norm": 0.15767817199230194, "learning_rate": 8.056245591437421e-05, "loss": 0.8813, "mean_token_accuracy": 0.7450994327664375, "num_tokens": 202342726.0, "step": 6339 }, { "entropy": 0.6870536655187607, "epoch": 0.5833203949373494, "grad_norm": 0.15310555696487427, "learning_rate": 8.055938908823259e-05, "loss": 0.677, "mean_token_accuracy": 0.7991863377392292, "num_tokens": 202374133.0, "step": 6340 }, { "entropy": 0.6762062441557646, "epoch": 0.5834124013087907, "grad_norm": 0.15550066530704498, "learning_rate": 8.055632226209096e-05, "loss": 0.6548, "mean_token_accuracy": 0.8045507110655308, "num_tokens": 202405851.0, "step": 6341 }, { "entropy": 0.821690184995532, "epoch": 0.5835044076802318, "grad_norm": 0.16740159690380096, "learning_rate": 8.055325543594934e-05, "loss": 0.8168, "mean_token_accuracy": 0.7610343135893345, "num_tokens": 202438115.0, "step": 6342 }, { "entropy": 0.5365053927525878, "epoch": 0.5835964140516731, "grad_norm": 0.16305531561374664, "learning_rate": 8.055018860980771e-05, "loss": 0.5303, "mean_token_accuracy": 0.8422117382287979, "num_tokens": 202469653.0, "step": 6343 }, { "entropy": 0.6908400990068913, "epoch": 0.5836884204231143, "grad_norm": 0.15588171780109406, "learning_rate": 8.054712178366609e-05, "loss": 0.6563, "mean_token_accuracy": 0.8058049716055393, "num_tokens": 202501655.0, "step": 6344 }, { "entropy": 0.8861616179347038, "epoch": 0.5837804267945556, "grad_norm": 0.16098451614379883, "learning_rate": 8.054405495752446e-05, "loss": 0.8687, "mean_token_accuracy": 0.7446994036436081, "num_tokens": 202533022.0, "step": 6345 }, { "entropy": 0.7419846169650555, "epoch": 0.5838724331659968, "grad_norm": 0.15696260333061218, "learning_rate": 8.054098813138283e-05, "loss": 0.7381, "mean_token_accuracy": 0.7814257070422173, "num_tokens": 202563975.0, "step": 6346 }, { "entropy": 0.8773860763758421, "epoch": 0.5839644395374379, "grad_norm": 0.1633908897638321, "learning_rate": 8.053792130524121e-05, "loss": 0.8779, "mean_token_accuracy": 0.7505197860300541, "num_tokens": 202595844.0, "step": 6347 }, { "entropy": 0.7388794701546431, "epoch": 0.5840564459088792, "grad_norm": 0.15466415882110596, "learning_rate": 8.053485447909959e-05, "loss": 0.7076, "mean_token_accuracy": 0.7901565581560135, "num_tokens": 202628075.0, "step": 6348 }, { "entropy": 0.7846502438187599, "epoch": 0.5841484522803204, "grad_norm": 0.16298574209213257, "learning_rate": 8.053178765295796e-05, "loss": 0.7814, "mean_token_accuracy": 0.7737542726099491, "num_tokens": 202660843.0, "step": 6349 }, { "entropy": 0.7384048812091351, "epoch": 0.5842404586517617, "grad_norm": 0.1500582993030548, "learning_rate": 8.052872082681633e-05, "loss": 0.7152, "mean_token_accuracy": 0.7902737110853195, "num_tokens": 202692509.0, "step": 6350 }, { "entropy": 0.7467363923788071, "epoch": 0.5843324650232029, "grad_norm": 0.15592637658119202, "learning_rate": 8.052565400067471e-05, "loss": 0.7412, "mean_token_accuracy": 0.7830436155200005, "num_tokens": 202724912.0, "step": 6351 }, { "entropy": 0.6637331219390035, "epoch": 0.584424471394644, "grad_norm": 0.15059129893779755, "learning_rate": 8.052258717453308e-05, "loss": 0.6447, "mean_token_accuracy": 0.8108443357050419, "num_tokens": 202756998.0, "step": 6352 }, { "entropy": 0.7915660347789526, "epoch": 0.5845164777660853, "grad_norm": 0.16551904380321503, "learning_rate": 8.051952034839146e-05, "loss": 0.7937, "mean_token_accuracy": 0.7708525434136391, "num_tokens": 202788381.0, "step": 6353 }, { "entropy": 0.7635294329375029, "epoch": 0.5846084841375265, "grad_norm": 0.15326827764511108, "learning_rate": 8.051645352224982e-05, "loss": 0.7573, "mean_token_accuracy": 0.7775497697293758, "num_tokens": 202820424.0, "step": 6354 }, { "entropy": 0.8262108024209738, "epoch": 0.5847004905089678, "grad_norm": 0.1609928160905838, "learning_rate": 8.05133866961082e-05, "loss": 0.8188, "mean_token_accuracy": 0.7620029002428055, "num_tokens": 202851722.0, "step": 6355 }, { "entropy": 0.7839486207813025, "epoch": 0.584792496880409, "grad_norm": 0.15905141830444336, "learning_rate": 8.051031986996657e-05, "loss": 0.7763, "mean_token_accuracy": 0.7778489217162132, "num_tokens": 202883854.0, "step": 6356 }, { "entropy": 0.6824868712574244, "epoch": 0.5848845032518502, "grad_norm": 0.15173740684986115, "learning_rate": 8.050725304382496e-05, "loss": 0.666, "mean_token_accuracy": 0.7980569675564766, "num_tokens": 202915908.0, "step": 6357 }, { "entropy": 0.8612017426639795, "epoch": 0.5849765096232914, "grad_norm": 0.1608838587999344, "learning_rate": 8.050418621768332e-05, "loss": 0.8431, "mean_token_accuracy": 0.7557514682412148, "num_tokens": 202947930.0, "step": 6358 }, { "entropy": 0.6405814066529274, "epoch": 0.5850685159947326, "grad_norm": 0.15502455830574036, "learning_rate": 8.05011193915417e-05, "loss": 0.6262, "mean_token_accuracy": 0.8079899214208126, "num_tokens": 202979140.0, "step": 6359 }, { "entropy": 0.7590779401361942, "epoch": 0.5851605223661739, "grad_norm": 0.152239590883255, "learning_rate": 8.049805256540007e-05, "loss": 0.7429, "mean_token_accuracy": 0.7800830751657486, "num_tokens": 203011158.0, "step": 6360 }, { "entropy": 0.6894998271018267, "epoch": 0.5852525287376151, "grad_norm": 0.15608155727386475, "learning_rate": 8.049498573925844e-05, "loss": 0.6609, "mean_token_accuracy": 0.8025123327970505, "num_tokens": 203043039.0, "step": 6361 }, { "entropy": 0.906234860420227, "epoch": 0.5853445351090563, "grad_norm": 0.16420932114124298, "learning_rate": 8.049191891311682e-05, "loss": 0.9233, "mean_token_accuracy": 0.7367675267159939, "num_tokens": 203075362.0, "step": 6362 }, { "entropy": 0.7392745111137629, "epoch": 0.5854365414804975, "grad_norm": 0.157680943608284, "learning_rate": 8.04888520869752e-05, "loss": 0.7351, "mean_token_accuracy": 0.7823094427585602, "num_tokens": 203107156.0, "step": 6363 }, { "entropy": 0.7138961981981993, "epoch": 0.5855285478519388, "grad_norm": 0.1503383368253708, "learning_rate": 8.048578526083357e-05, "loss": 0.7091, "mean_token_accuracy": 0.7900563105940819, "num_tokens": 203139344.0, "step": 6364 }, { "entropy": 0.7888676207512617, "epoch": 0.58562055422338, "grad_norm": 0.15872137248516083, "learning_rate": 8.048271843469194e-05, "loss": 0.7949, "mean_token_accuracy": 0.7704670503735542, "num_tokens": 203171639.0, "step": 6365 }, { "entropy": 0.7635250296443701, "epoch": 0.5857125605948212, "grad_norm": 0.16044297814369202, "learning_rate": 8.04796516085503e-05, "loss": 0.7683, "mean_token_accuracy": 0.778932448476553, "num_tokens": 203203126.0, "step": 6366 }, { "entropy": 0.7693639490753412, "epoch": 0.5858045669662624, "grad_norm": 0.15360097587108612, "learning_rate": 8.047658478240869e-05, "loss": 0.7575, "mean_token_accuracy": 0.7755149342119694, "num_tokens": 203234596.0, "step": 6367 }, { "entropy": 0.7743924763053656, "epoch": 0.5858965733377036, "grad_norm": 0.16602282226085663, "learning_rate": 8.047351795626707e-05, "loss": 0.7811, "mean_token_accuracy": 0.7722534723579884, "num_tokens": 203267139.0, "step": 6368 }, { "entropy": 0.6295870933681726, "epoch": 0.5859885797091449, "grad_norm": 0.1539800763130188, "learning_rate": 8.047045113012544e-05, "loss": 0.6113, "mean_token_accuracy": 0.8188748024404049, "num_tokens": 203298874.0, "step": 6369 }, { "entropy": 0.7165049742907286, "epoch": 0.5860805860805861, "grad_norm": 0.15197239816188812, "learning_rate": 8.04673843039838e-05, "loss": 0.696, "mean_token_accuracy": 0.7971337102353573, "num_tokens": 203330632.0, "step": 6370 }, { "entropy": 0.7625807486474514, "epoch": 0.5861725924520274, "grad_norm": 0.15311196446418762, "learning_rate": 8.046431747784219e-05, "loss": 0.751, "mean_token_accuracy": 0.7799668200314045, "num_tokens": 203362880.0, "step": 6371 }, { "entropy": 0.73433942720294, "epoch": 0.5862645988234685, "grad_norm": 0.1531653255224228, "learning_rate": 8.046125065170055e-05, "loss": 0.7208, "mean_token_accuracy": 0.7870123200118542, "num_tokens": 203394947.0, "step": 6372 }, { "entropy": 0.7444760743528605, "epoch": 0.5863566051949097, "grad_norm": 0.15218816697597504, "learning_rate": 8.045818382555894e-05, "loss": 0.7365, "mean_token_accuracy": 0.7847565077245235, "num_tokens": 203426347.0, "step": 6373 }, { "entropy": 0.8236728068441153, "epoch": 0.586448611566351, "grad_norm": 0.17060819268226624, "learning_rate": 8.04551169994173e-05, "loss": 0.8146, "mean_token_accuracy": 0.7641733810305595, "num_tokens": 203455925.0, "step": 6374 }, { "entropy": 0.7628369480371475, "epoch": 0.5865406179377922, "grad_norm": 0.1512911319732666, "learning_rate": 8.045205017327569e-05, "loss": 0.7561, "mean_token_accuracy": 0.7808767482638359, "num_tokens": 203488003.0, "step": 6375 }, { "entropy": 0.7747984081506729, "epoch": 0.5866326243092335, "grad_norm": 0.15370261669158936, "learning_rate": 8.044898334713405e-05, "loss": 0.7407, "mean_token_accuracy": 0.7767431363463402, "num_tokens": 203520120.0, "step": 6376 }, { "entropy": 0.7341177128255367, "epoch": 0.5867246306806746, "grad_norm": 0.15519611537456512, "learning_rate": 8.044591652099242e-05, "loss": 0.7191, "mean_token_accuracy": 0.7889431305229664, "num_tokens": 203551922.0, "step": 6377 }, { "entropy": 0.7919953390955925, "epoch": 0.5868166370521158, "grad_norm": 0.15688063204288483, "learning_rate": 8.04428496948508e-05, "loss": 0.7991, "mean_token_accuracy": 0.7708109579980373, "num_tokens": 203583810.0, "step": 6378 }, { "entropy": 0.7032122407108545, "epoch": 0.5869086434235571, "grad_norm": 0.1605205088853836, "learning_rate": 8.043978286870918e-05, "loss": 0.7089, "mean_token_accuracy": 0.7939116954803467, "num_tokens": 203616241.0, "step": 6379 }, { "entropy": 0.6745331063866615, "epoch": 0.5870006497949983, "grad_norm": 0.15584196150302887, "learning_rate": 8.043671604256755e-05, "loss": 0.6851, "mean_token_accuracy": 0.7991606406867504, "num_tokens": 203647915.0, "step": 6380 }, { "entropy": 0.7150711975991726, "epoch": 0.5870926561664396, "grad_norm": 0.15606476366519928, "learning_rate": 8.043364921642592e-05, "loss": 0.7021, "mean_token_accuracy": 0.7895516455173492, "num_tokens": 203679582.0, "step": 6381 }, { "entropy": 0.7812303490936756, "epoch": 0.5871846625378807, "grad_norm": 0.15351295471191406, "learning_rate": 8.04305823902843e-05, "loss": 0.7734, "mean_token_accuracy": 0.7748121693730354, "num_tokens": 203711120.0, "step": 6382 }, { "entropy": 0.805045835673809, "epoch": 0.587276668909322, "grad_norm": 0.160233274102211, "learning_rate": 8.042751556414267e-05, "loss": 0.7871, "mean_token_accuracy": 0.7678750343620777, "num_tokens": 203742326.0, "step": 6383 }, { "entropy": 0.7879580315202475, "epoch": 0.5873686752807632, "grad_norm": 0.17010660469532013, "learning_rate": 8.042444873800105e-05, "loss": 0.7866, "mean_token_accuracy": 0.7747322842478752, "num_tokens": 203772270.0, "step": 6384 }, { "entropy": 0.8195597697049379, "epoch": 0.5874606816522044, "grad_norm": 0.1639655977487564, "learning_rate": 8.042138191185942e-05, "loss": 0.7837, "mean_token_accuracy": 0.7649114318192005, "num_tokens": 203802967.0, "step": 6385 }, { "entropy": 0.616126636043191, "epoch": 0.5875526880236457, "grad_norm": 0.14149540662765503, "learning_rate": 8.04183150857178e-05, "loss": 0.5752, "mean_token_accuracy": 0.8278421461582184, "num_tokens": 203835056.0, "step": 6386 }, { "entropy": 0.8600650746375322, "epoch": 0.5876446943950868, "grad_norm": 0.1535901576280594, "learning_rate": 8.041524825957617e-05, "loss": 0.8407, "mean_token_accuracy": 0.7520343661308289, "num_tokens": 203866619.0, "step": 6387 }, { "entropy": 0.7358041685074568, "epoch": 0.5877367007665281, "grad_norm": 0.15822476148605347, "learning_rate": 8.041218143343454e-05, "loss": 0.7192, "mean_token_accuracy": 0.7874877154827118, "num_tokens": 203898869.0, "step": 6388 }, { "entropy": 0.751721566542983, "epoch": 0.5878287071379693, "grad_norm": 0.1526876986026764, "learning_rate": 8.040911460729292e-05, "loss": 0.7388, "mean_token_accuracy": 0.7812034040689468, "num_tokens": 203931318.0, "step": 6389 }, { "entropy": 0.7054018545895815, "epoch": 0.5879207135094106, "grad_norm": 0.15154127776622772, "learning_rate": 8.04060477811513e-05, "loss": 0.6885, "mean_token_accuracy": 0.800794929265976, "num_tokens": 203962858.0, "step": 6390 }, { "entropy": 0.7364398371428251, "epoch": 0.5880127198808518, "grad_norm": 0.17091438174247742, "learning_rate": 8.040298095500967e-05, "loss": 0.7437, "mean_token_accuracy": 0.7798398807644844, "num_tokens": 203994648.0, "step": 6391 }, { "entropy": 0.8139308709651232, "epoch": 0.5881047262522929, "grad_norm": 0.15972401201725006, "learning_rate": 8.039991412886803e-05, "loss": 0.8145, "mean_token_accuracy": 0.7606289051473141, "num_tokens": 204026699.0, "step": 6392 }, { "entropy": 0.8426349982619286, "epoch": 0.5881967326237342, "grad_norm": 0.16399815678596497, "learning_rate": 8.03968473027264e-05, "loss": 0.8324, "mean_token_accuracy": 0.7603425160050392, "num_tokens": 204058579.0, "step": 6393 }, { "entropy": 0.7175447307527065, "epoch": 0.5882887389951754, "grad_norm": 0.16015063226222992, "learning_rate": 8.03937804765848e-05, "loss": 0.7052, "mean_token_accuracy": 0.7927054539322853, "num_tokens": 204090406.0, "step": 6394 }, { "entropy": 0.7817765194922686, "epoch": 0.5883807453666167, "grad_norm": 0.15788307785987854, "learning_rate": 8.039071365044316e-05, "loss": 0.7702, "mean_token_accuracy": 0.7757765091955662, "num_tokens": 204122441.0, "step": 6395 }, { "entropy": 0.851882541552186, "epoch": 0.5884727517380579, "grad_norm": 0.15883177518844604, "learning_rate": 8.038764682430153e-05, "loss": 0.8374, "mean_token_accuracy": 0.756239227950573, "num_tokens": 204154165.0, "step": 6396 }, { "entropy": 0.7329238504171371, "epoch": 0.588564758109499, "grad_norm": 0.16448181867599487, "learning_rate": 8.03845799981599e-05, "loss": 0.7256, "mean_token_accuracy": 0.7839644998311996, "num_tokens": 204184623.0, "step": 6397 }, { "entropy": 0.7314279358834028, "epoch": 0.5886567644809403, "grad_norm": 0.15512707829475403, "learning_rate": 8.038151317201828e-05, "loss": 0.714, "mean_token_accuracy": 0.7890373915433884, "num_tokens": 204217005.0, "step": 6398 }, { "entropy": 0.7598677836358547, "epoch": 0.5887487708523815, "grad_norm": 0.15165774524211884, "learning_rate": 8.037844634587666e-05, "loss": 0.7425, "mean_token_accuracy": 0.7812540605664253, "num_tokens": 204249033.0, "step": 6399 }, { "entropy": 0.8364827074110508, "epoch": 0.5888407772238228, "grad_norm": 0.1580135077238083, "learning_rate": 8.037537951973503e-05, "loss": 0.8125, "mean_token_accuracy": 0.7661026492714882, "num_tokens": 204280875.0, "step": 6400 }, { "entropy": 0.8443365897983313, "epoch": 0.588932783595264, "grad_norm": 0.15570776164531708, "learning_rate": 8.03723126935934e-05, "loss": 0.8314, "mean_token_accuracy": 0.7542585767805576, "num_tokens": 204312409.0, "step": 6401 }, { "entropy": 0.7378081530332565, "epoch": 0.5890247899667052, "grad_norm": 0.1603211611509323, "learning_rate": 8.036924586745178e-05, "loss": 0.7391, "mean_token_accuracy": 0.7827631272375584, "num_tokens": 204344519.0, "step": 6402 }, { "entropy": 0.7074817214161158, "epoch": 0.5891167963381464, "grad_norm": 0.16061441600322723, "learning_rate": 8.036617904131015e-05, "loss": 0.6942, "mean_token_accuracy": 0.79604846611619, "num_tokens": 204376423.0, "step": 6403 }, { "entropy": 0.7288549989461899, "epoch": 0.5892088027095876, "grad_norm": 0.1525062918663025, "learning_rate": 8.036311221516853e-05, "loss": 0.7078, "mean_token_accuracy": 0.7958903312683105, "num_tokens": 204409191.0, "step": 6404 }, { "entropy": 0.7547742389142513, "epoch": 0.5893008090810289, "grad_norm": 0.15777218341827393, "learning_rate": 8.03600453890269e-05, "loss": 0.7452, "mean_token_accuracy": 0.7810758352279663, "num_tokens": 204441034.0, "step": 6405 }, { "entropy": 0.7528418619185686, "epoch": 0.5893928154524701, "grad_norm": 0.15047712624073029, "learning_rate": 8.035697856288528e-05, "loss": 0.7333, "mean_token_accuracy": 0.7875479832291603, "num_tokens": 204473488.0, "step": 6406 }, { "entropy": 0.8352436497807503, "epoch": 0.5894848218239113, "grad_norm": 0.16027213633060455, "learning_rate": 8.035391173674365e-05, "loss": 0.8371, "mean_token_accuracy": 0.7593034878373146, "num_tokens": 204504704.0, "step": 6407 }, { "entropy": 0.7725705746561289, "epoch": 0.5895768281953525, "grad_norm": 0.15587875247001648, "learning_rate": 8.035084491060201e-05, "loss": 0.7468, "mean_token_accuracy": 0.7819182649254799, "num_tokens": 204535844.0, "step": 6408 }, { "entropy": 0.7913107015192509, "epoch": 0.5896688345667938, "grad_norm": 0.16046059131622314, "learning_rate": 8.03477780844604e-05, "loss": 0.7832, "mean_token_accuracy": 0.770763672888279, "num_tokens": 204567804.0, "step": 6409 }, { "entropy": 0.6442548707127571, "epoch": 0.589760840938235, "grad_norm": 0.1459970772266388, "learning_rate": 8.034471125831878e-05, "loss": 0.6187, "mean_token_accuracy": 0.8110596686601639, "num_tokens": 204598918.0, "step": 6410 }, { "entropy": 0.7625538688153028, "epoch": 0.5898528473096762, "grad_norm": 0.16120202839374542, "learning_rate": 8.034164443217715e-05, "loss": 0.77, "mean_token_accuracy": 0.7714480310678482, "num_tokens": 204630773.0, "step": 6411 }, { "entropy": 0.707021052017808, "epoch": 0.5899448536811174, "grad_norm": 0.16600696742534637, "learning_rate": 8.033857760603551e-05, "loss": 0.7272, "mean_token_accuracy": 0.789479672908783, "num_tokens": 204662153.0, "step": 6412 }, { "entropy": 0.76875707693398, "epoch": 0.5900368600525586, "grad_norm": 0.16380411386489868, "learning_rate": 8.03355107798939e-05, "loss": 0.7768, "mean_token_accuracy": 0.7704000174999237, "num_tokens": 204693634.0, "step": 6413 }, { "entropy": 0.7384569495916367, "epoch": 0.5901288664239999, "grad_norm": 0.1616789549589157, "learning_rate": 8.033244395375226e-05, "loss": 0.732, "mean_token_accuracy": 0.7846400924026966, "num_tokens": 204725004.0, "step": 6414 }, { "entropy": 0.7130808867514133, "epoch": 0.5902208727954411, "grad_norm": 0.15990842878818512, "learning_rate": 8.032937712761064e-05, "loss": 0.6788, "mean_token_accuracy": 0.8032352514564991, "num_tokens": 204756752.0, "step": 6415 }, { "entropy": 0.8804079107940197, "epoch": 0.5903128791668824, "grad_norm": 0.17252370715141296, "learning_rate": 8.032631030146901e-05, "loss": 0.8776, "mean_token_accuracy": 0.74616714194417, "num_tokens": 204787313.0, "step": 6416 }, { "entropy": 0.7448329012840986, "epoch": 0.5904048855383235, "grad_norm": 0.15691223740577698, "learning_rate": 8.03232434753274e-05, "loss": 0.7405, "mean_token_accuracy": 0.7834462858736515, "num_tokens": 204818761.0, "step": 6417 }, { "entropy": 0.9225790128111839, "epoch": 0.5904968919097647, "grad_norm": 0.16171899437904358, "learning_rate": 8.032017664918576e-05, "loss": 0.92, "mean_token_accuracy": 0.7306326553225517, "num_tokens": 204850978.0, "step": 6418 }, { "entropy": 0.8325988091528416, "epoch": 0.590588898281206, "grad_norm": 0.15790510177612305, "learning_rate": 8.031710982304413e-05, "loss": 0.8015, "mean_token_accuracy": 0.7700189985334873, "num_tokens": 204883335.0, "step": 6419 }, { "entropy": 0.7138184383511543, "epoch": 0.5906809046526472, "grad_norm": 0.15031220018863678, "learning_rate": 8.031404299690251e-05, "loss": 0.676, "mean_token_accuracy": 0.7991909235715866, "num_tokens": 204915326.0, "step": 6420 }, { "entropy": 0.8201861176639795, "epoch": 0.5907729110240885, "grad_norm": 0.15882647037506104, "learning_rate": 8.031097617076089e-05, "loss": 0.8026, "mean_token_accuracy": 0.7660219520330429, "num_tokens": 204947177.0, "step": 6421 }, { "entropy": 0.8233970105648041, "epoch": 0.5908649173955296, "grad_norm": 0.1553497165441513, "learning_rate": 8.030790934461926e-05, "loss": 0.8012, "mean_token_accuracy": 0.7682563848793507, "num_tokens": 204979094.0, "step": 6422 }, { "entropy": 0.7394640073180199, "epoch": 0.5909569237669708, "grad_norm": 0.16526657342910767, "learning_rate": 8.030484251847763e-05, "loss": 0.7293, "mean_token_accuracy": 0.7829725369811058, "num_tokens": 205010805.0, "step": 6423 }, { "entropy": 0.7503649201244116, "epoch": 0.5910489301384121, "grad_norm": 0.15507331490516663, "learning_rate": 8.0301775692336e-05, "loss": 0.7426, "mean_token_accuracy": 0.7835765592753887, "num_tokens": 205043363.0, "step": 6424 }, { "entropy": 0.7980811186134815, "epoch": 0.5911409365098533, "grad_norm": 0.15940827131271362, "learning_rate": 8.029870886619438e-05, "loss": 0.7896, "mean_token_accuracy": 0.7723812349140644, "num_tokens": 205075630.0, "step": 6425 }, { "entropy": 0.7251358404755592, "epoch": 0.5912329428812946, "grad_norm": 0.15874603390693665, "learning_rate": 8.029564204005276e-05, "loss": 0.7313, "mean_token_accuracy": 0.786423496901989, "num_tokens": 205108141.0, "step": 6426 }, { "entropy": 0.785711606964469, "epoch": 0.5913249492527357, "grad_norm": 0.16150999069213867, "learning_rate": 8.029257521391113e-05, "loss": 0.7667, "mean_token_accuracy": 0.7704710848629475, "num_tokens": 205139846.0, "step": 6427 }, { "entropy": 0.7223213911056519, "epoch": 0.591416955624177, "grad_norm": 0.15136899054050446, "learning_rate": 8.02895083877695e-05, "loss": 0.7154, "mean_token_accuracy": 0.7912070713937283, "num_tokens": 205172427.0, "step": 6428 }, { "entropy": 0.6839336678385735, "epoch": 0.5915089619956182, "grad_norm": 0.15855400264263153, "learning_rate": 8.028644156162788e-05, "loss": 0.6764, "mean_token_accuracy": 0.8026933707296848, "num_tokens": 205203920.0, "step": 6429 }, { "entropy": 0.7386108711361885, "epoch": 0.5916009683670594, "grad_norm": 0.151234433054924, "learning_rate": 8.028337473548624e-05, "loss": 0.7234, "mean_token_accuracy": 0.7834854312241077, "num_tokens": 205236161.0, "step": 6430 }, { "entropy": 0.8460969924926758, "epoch": 0.5916929747385007, "grad_norm": 0.15446896851062775, "learning_rate": 8.028030790934462e-05, "loss": 0.8504, "mean_token_accuracy": 0.7510744631290436, "num_tokens": 205268114.0, "step": 6431 }, { "entropy": 0.7104700393974781, "epoch": 0.5917849811099418, "grad_norm": 0.15183159708976746, "learning_rate": 8.027724108320299e-05, "loss": 0.7073, "mean_token_accuracy": 0.7895939387381077, "num_tokens": 205300079.0, "step": 6432 }, { "entropy": 0.8104813415557146, "epoch": 0.5918769874813831, "grad_norm": 0.153885617852211, "learning_rate": 8.027417425706137e-05, "loss": 0.8108, "mean_token_accuracy": 0.7570861168205738, "num_tokens": 205332536.0, "step": 6433 }, { "entropy": 0.8034578487277031, "epoch": 0.5919689938528243, "grad_norm": 0.1600767970085144, "learning_rate": 8.027110743091974e-05, "loss": 0.7995, "mean_token_accuracy": 0.7706472724676132, "num_tokens": 205364933.0, "step": 6434 }, { "entropy": 0.7732834294438362, "epoch": 0.5920610002242656, "grad_norm": 0.16329196095466614, "learning_rate": 8.026804060477811e-05, "loss": 0.773, "mean_token_accuracy": 0.7728634625673294, "num_tokens": 205397103.0, "step": 6435 }, { "entropy": 0.732304286211729, "epoch": 0.5921530065957068, "grad_norm": 0.16454380750656128, "learning_rate": 8.026497377863649e-05, "loss": 0.7434, "mean_token_accuracy": 0.7843661867082119, "num_tokens": 205429394.0, "step": 6436 }, { "entropy": 0.7339537870138884, "epoch": 0.5922450129671479, "grad_norm": 0.1708439290523529, "learning_rate": 8.026190695249487e-05, "loss": 0.7542, "mean_token_accuracy": 0.7789102494716644, "num_tokens": 205461460.0, "step": 6437 }, { "entropy": 0.7894754931330681, "epoch": 0.5923370193385892, "grad_norm": 0.1593955159187317, "learning_rate": 8.025884012635324e-05, "loss": 0.7707, "mean_token_accuracy": 0.7719837538897991, "num_tokens": 205493465.0, "step": 6438 }, { "entropy": 0.8040923997759819, "epoch": 0.5924290257100304, "grad_norm": 0.15896755456924438, "learning_rate": 8.025577330021161e-05, "loss": 0.766, "mean_token_accuracy": 0.7723164483904839, "num_tokens": 205524916.0, "step": 6439 }, { "entropy": 0.7599755423143506, "epoch": 0.5925210320814717, "grad_norm": 0.15846295654773712, "learning_rate": 8.025270647406999e-05, "loss": 0.7478, "mean_token_accuracy": 0.77960454672575, "num_tokens": 205557262.0, "step": 6440 }, { "entropy": 0.839160792529583, "epoch": 0.5926130384529129, "grad_norm": 0.15881659090518951, "learning_rate": 8.024963964792837e-05, "loss": 0.828, "mean_token_accuracy": 0.7554154396057129, "num_tokens": 205589931.0, "step": 6441 }, { "entropy": 0.678018232807517, "epoch": 0.592705044824354, "grad_norm": 0.15597133338451385, "learning_rate": 8.024657282178674e-05, "loss": 0.6728, "mean_token_accuracy": 0.8003105893731117, "num_tokens": 205622047.0, "step": 6442 }, { "entropy": 0.733624529093504, "epoch": 0.5927970511957953, "grad_norm": 0.16245269775390625, "learning_rate": 8.024350599564511e-05, "loss": 0.7275, "mean_token_accuracy": 0.786513913422823, "num_tokens": 205653248.0, "step": 6443 }, { "entropy": 0.6857230989262462, "epoch": 0.5928890575672365, "grad_norm": 0.1549699604511261, "learning_rate": 8.024043916950349e-05, "loss": 0.6716, "mean_token_accuracy": 0.8069267272949219, "num_tokens": 205684649.0, "step": 6444 }, { "entropy": 0.8541279435157776, "epoch": 0.5929810639386778, "grad_norm": 0.1590873897075653, "learning_rate": 8.023737234336186e-05, "loss": 0.8534, "mean_token_accuracy": 0.7507393732666969, "num_tokens": 205716443.0, "step": 6445 }, { "entropy": 0.6891656089574099, "epoch": 0.593073070310119, "grad_norm": 0.14362852275371552, "learning_rate": 8.023430551722024e-05, "loss": 0.6619, "mean_token_accuracy": 0.8026380836963654, "num_tokens": 205749086.0, "step": 6446 }, { "entropy": 0.7688812855631113, "epoch": 0.5931650766815602, "grad_norm": 0.15627062320709229, "learning_rate": 8.02312386910786e-05, "loss": 0.7526, "mean_token_accuracy": 0.7812754325568676, "num_tokens": 205781433.0, "step": 6447 }, { "entropy": 0.8092678859829903, "epoch": 0.5932570830530014, "grad_norm": 0.1584494560956955, "learning_rate": 8.022817186493699e-05, "loss": 0.7822, "mean_token_accuracy": 0.7658618651330471, "num_tokens": 205813233.0, "step": 6448 }, { "entropy": 0.7793342731893063, "epoch": 0.5933490894244426, "grad_norm": 0.15603691339492798, "learning_rate": 8.022510503879535e-05, "loss": 0.7675, "mean_token_accuracy": 0.7766341306269169, "num_tokens": 205845052.0, "step": 6449 }, { "entropy": 0.7485304698348045, "epoch": 0.5934410957958839, "grad_norm": 0.1587413251399994, "learning_rate": 8.022203821265372e-05, "loss": 0.737, "mean_token_accuracy": 0.7876352146267891, "num_tokens": 205876690.0, "step": 6450 }, { "entropy": 0.7446821685880423, "epoch": 0.5935331021673251, "grad_norm": 0.1588190197944641, "learning_rate": 8.02189713865121e-05, "loss": 0.7442, "mean_token_accuracy": 0.781039547175169, "num_tokens": 205908441.0, "step": 6451 }, { "entropy": 0.8378266543149948, "epoch": 0.5936251085387663, "grad_norm": 0.16117030382156372, "learning_rate": 8.021590456037049e-05, "loss": 0.8255, "mean_token_accuracy": 0.7643117606639862, "num_tokens": 205940469.0, "step": 6452 }, { "entropy": 0.7739326301962137, "epoch": 0.5937171149102075, "grad_norm": 0.15677396953105927, "learning_rate": 8.021283773422885e-05, "loss": 0.7683, "mean_token_accuracy": 0.7732589729130268, "num_tokens": 205972237.0, "step": 6453 }, { "entropy": 0.8071573786437511, "epoch": 0.5938091212816488, "grad_norm": 0.16322170197963715, "learning_rate": 8.020977090808722e-05, "loss": 0.7968, "mean_token_accuracy": 0.7742795012891293, "num_tokens": 206004097.0, "step": 6454 }, { "entropy": 0.8033352755010128, "epoch": 0.59390112765309, "grad_norm": 0.16521520912647247, "learning_rate": 8.020670408194559e-05, "loss": 0.8015, "mean_token_accuracy": 0.7749248519539833, "num_tokens": 206036613.0, "step": 6455 }, { "entropy": 0.7921232655644417, "epoch": 0.5939931340245312, "grad_norm": 0.1650679111480713, "learning_rate": 8.020363725580397e-05, "loss": 0.8015, "mean_token_accuracy": 0.7640129625797272, "num_tokens": 206068601.0, "step": 6456 }, { "entropy": 0.8793608751147985, "epoch": 0.5940851403959724, "grad_norm": 0.16414442658424377, "learning_rate": 8.020057042966235e-05, "loss": 0.8627, "mean_token_accuracy": 0.7463245056569576, "num_tokens": 206100055.0, "step": 6457 }, { "entropy": 0.8282900582998991, "epoch": 0.5941771467674136, "grad_norm": 0.17184162139892578, "learning_rate": 8.019750360352072e-05, "loss": 0.8254, "mean_token_accuracy": 0.7634611949324608, "num_tokens": 206131384.0, "step": 6458 }, { "entropy": 0.8741166777908802, "epoch": 0.5942691531388549, "grad_norm": 0.16681066155433655, "learning_rate": 8.019443677737909e-05, "loss": 0.87, "mean_token_accuracy": 0.7491681054234505, "num_tokens": 206163259.0, "step": 6459 }, { "entropy": 0.686090137809515, "epoch": 0.5943611595102961, "grad_norm": 0.1585303544998169, "learning_rate": 8.019136995123747e-05, "loss": 0.6635, "mean_token_accuracy": 0.8042276427149773, "num_tokens": 206195320.0, "step": 6460 }, { "entropy": 0.7561408504843712, "epoch": 0.5944531658817374, "grad_norm": 0.15510870516300201, "learning_rate": 8.018830312509584e-05, "loss": 0.753, "mean_token_accuracy": 0.7756185680627823, "num_tokens": 206227493.0, "step": 6461 }, { "entropy": 0.7573105357587337, "epoch": 0.5945451722531785, "grad_norm": 0.1507454365491867, "learning_rate": 8.018523629895422e-05, "loss": 0.7413, "mean_token_accuracy": 0.7811438180506229, "num_tokens": 206259384.0, "step": 6462 }, { "entropy": 0.7145005390048027, "epoch": 0.5946371786246197, "grad_norm": 0.14745336771011353, "learning_rate": 8.018216947281259e-05, "loss": 0.7049, "mean_token_accuracy": 0.7950799763202667, "num_tokens": 206291983.0, "step": 6463 }, { "entropy": 0.7815783564001322, "epoch": 0.594729184996061, "grad_norm": 0.15834683179855347, "learning_rate": 8.017910264667097e-05, "loss": 0.7722, "mean_token_accuracy": 0.7729985006153584, "num_tokens": 206324737.0, "step": 6464 }, { "entropy": 0.7953859902918339, "epoch": 0.5948211913675022, "grad_norm": 0.15077731013298035, "learning_rate": 8.017603582052934e-05, "loss": 0.7954, "mean_token_accuracy": 0.7683024927973747, "num_tokens": 206356706.0, "step": 6465 }, { "entropy": 0.7177160102874041, "epoch": 0.5949131977389435, "grad_norm": 0.15009845793247223, "learning_rate": 8.01729689943877e-05, "loss": 0.7053, "mean_token_accuracy": 0.7938613221049309, "num_tokens": 206389213.0, "step": 6466 }, { "entropy": 0.7058996446430683, "epoch": 0.5950052041103846, "grad_norm": 0.15857446193695068, "learning_rate": 8.016990216824608e-05, "loss": 0.7066, "mean_token_accuracy": 0.789520837366581, "num_tokens": 206420901.0, "step": 6467 }, { "entropy": 0.8687541410326958, "epoch": 0.5950972104818258, "grad_norm": 0.15851044654846191, "learning_rate": 8.016683534210447e-05, "loss": 0.8809, "mean_token_accuracy": 0.7446808740496635, "num_tokens": 206453372.0, "step": 6468 }, { "entropy": 0.9248711578547955, "epoch": 0.5951892168532671, "grad_norm": 0.16492363810539246, "learning_rate": 8.016376851596283e-05, "loss": 0.923, "mean_token_accuracy": 0.7329346016049385, "num_tokens": 206484752.0, "step": 6469 }, { "entropy": 0.7729863626882434, "epoch": 0.5952812232247083, "grad_norm": 0.16324837505817413, "learning_rate": 8.01607016898212e-05, "loss": 0.7698, "mean_token_accuracy": 0.7768435329198837, "num_tokens": 206516937.0, "step": 6470 }, { "entropy": 0.6484729796648026, "epoch": 0.5953732295961496, "grad_norm": 0.14830641448497772, "learning_rate": 8.015763486367958e-05, "loss": 0.6434, "mean_token_accuracy": 0.8041426092386246, "num_tokens": 206548864.0, "step": 6471 }, { "entropy": 0.7331998459994793, "epoch": 0.5954652359675907, "grad_norm": 0.15013593435287476, "learning_rate": 8.015456803753795e-05, "loss": 0.7093, "mean_token_accuracy": 0.7920070216059685, "num_tokens": 206581160.0, "step": 6472 }, { "entropy": 0.6928688902407885, "epoch": 0.595557242339032, "grad_norm": 0.15729312598705292, "learning_rate": 8.015150121139633e-05, "loss": 0.6747, "mean_token_accuracy": 0.7987152449786663, "num_tokens": 206613049.0, "step": 6473 }, { "entropy": 0.7294027004390955, "epoch": 0.5956492487104732, "grad_norm": 0.15603138506412506, "learning_rate": 8.01484343852547e-05, "loss": 0.7214, "mean_token_accuracy": 0.7897666804492474, "num_tokens": 206644910.0, "step": 6474 }, { "entropy": 0.81579883210361, "epoch": 0.5957412550819144, "grad_norm": 0.1530342400074005, "learning_rate": 8.014536755911308e-05, "loss": 0.8161, "mean_token_accuracy": 0.7641807049512863, "num_tokens": 206677405.0, "step": 6475 }, { "entropy": 0.67379380017519, "epoch": 0.5958332614533557, "grad_norm": 0.15065889060497284, "learning_rate": 8.014230073297145e-05, "loss": 0.6581, "mean_token_accuracy": 0.8074614256620407, "num_tokens": 206709582.0, "step": 6476 }, { "entropy": 0.7350539704784751, "epoch": 0.5959252678247968, "grad_norm": 0.1592596471309662, "learning_rate": 8.013923390682983e-05, "loss": 0.7092, "mean_token_accuracy": 0.7894832864403725, "num_tokens": 206742218.0, "step": 6477 }, { "entropy": 0.8554549403488636, "epoch": 0.5960172741962381, "grad_norm": 0.16293002665042877, "learning_rate": 8.01361670806882e-05, "loss": 0.8094, "mean_token_accuracy": 0.7614176720380783, "num_tokens": 206773530.0, "step": 6478 }, { "entropy": 0.6945176515728235, "epoch": 0.5961092805676793, "grad_norm": 0.14399118721485138, "learning_rate": 8.013310025454658e-05, "loss": 0.6654, "mean_token_accuracy": 0.8009990118443966, "num_tokens": 206806093.0, "step": 6479 }, { "entropy": 0.7480811551213264, "epoch": 0.5962012869391206, "grad_norm": 0.16127833724021912, "learning_rate": 8.013003342840495e-05, "loss": 0.7282, "mean_token_accuracy": 0.7843916937708855, "num_tokens": 206837586.0, "step": 6480 }, { "entropy": 0.692300334572792, "epoch": 0.5962932933105618, "grad_norm": 0.1515669971704483, "learning_rate": 8.012696660226332e-05, "loss": 0.6842, "mean_token_accuracy": 0.7999985851347446, "num_tokens": 206869223.0, "step": 6481 }, { "entropy": 0.8406537659466267, "epoch": 0.5963852996820029, "grad_norm": 0.16202636063098907, "learning_rate": 8.01238997761217e-05, "loss": 0.8415, "mean_token_accuracy": 0.7549130581319332, "num_tokens": 206900981.0, "step": 6482 }, { "entropy": 0.7394605241715908, "epoch": 0.5964773060534442, "grad_norm": 0.1596049666404724, "learning_rate": 8.012083294998008e-05, "loss": 0.741, "mean_token_accuracy": 0.7807878479361534, "num_tokens": 206933212.0, "step": 6483 }, { "entropy": 0.7352135572582483, "epoch": 0.5965693124248854, "grad_norm": 0.15973606705665588, "learning_rate": 8.011776612383845e-05, "loss": 0.7356, "mean_token_accuracy": 0.7828998379409313, "num_tokens": 206964443.0, "step": 6484 }, { "entropy": 0.7526090424507856, "epoch": 0.5966613187963267, "grad_norm": 0.15842664241790771, "learning_rate": 8.011469929769682e-05, "loss": 0.7556, "mean_token_accuracy": 0.7813078053295612, "num_tokens": 206996737.0, "step": 6485 }, { "entropy": 0.8538091517984867, "epoch": 0.5967533251677679, "grad_norm": 0.16166779398918152, "learning_rate": 8.011163247155518e-05, "loss": 0.8605, "mean_token_accuracy": 0.7512096725404263, "num_tokens": 207028772.0, "step": 6486 }, { "entropy": 0.734092578291893, "epoch": 0.596845331539209, "grad_norm": 0.1567302644252777, "learning_rate": 8.010856564541356e-05, "loss": 0.7246, "mean_token_accuracy": 0.7872543409466743, "num_tokens": 207061257.0, "step": 6487 }, { "entropy": 0.765211395919323, "epoch": 0.5969373379106503, "grad_norm": 0.15138205885887146, "learning_rate": 8.010549881927195e-05, "loss": 0.7577, "mean_token_accuracy": 0.7784016281366348, "num_tokens": 207092957.0, "step": 6488 }, { "entropy": 0.6274166405200958, "epoch": 0.5970293442820915, "grad_norm": 0.15672339498996735, "learning_rate": 8.010243199313031e-05, "loss": 0.6045, "mean_token_accuracy": 0.8157878443598747, "num_tokens": 207124790.0, "step": 6489 }, { "entropy": 0.8043479789048433, "epoch": 0.5971213506535328, "grad_norm": 0.15982453525066376, "learning_rate": 8.009936516698868e-05, "loss": 0.7806, "mean_token_accuracy": 0.7697338312864304, "num_tokens": 207156186.0, "step": 6490 }, { "entropy": 0.795964571647346, "epoch": 0.597213357024974, "grad_norm": 0.15761825442314148, "learning_rate": 8.009629834084706e-05, "loss": 0.776, "mean_token_accuracy": 0.7722980082035065, "num_tokens": 207188160.0, "step": 6491 }, { "entropy": 0.8558950275182724, "epoch": 0.5973053633964152, "grad_norm": 0.15556150674819946, "learning_rate": 8.009323151470543e-05, "loss": 0.8209, "mean_token_accuracy": 0.7613931968808174, "num_tokens": 207219381.0, "step": 6492 }, { "entropy": 0.7691142968833447, "epoch": 0.5973973697678564, "grad_norm": 0.1532619148492813, "learning_rate": 8.009016468856381e-05, "loss": 0.7539, "mean_token_accuracy": 0.772418238222599, "num_tokens": 207250022.0, "step": 6493 }, { "entropy": 0.7726809997111559, "epoch": 0.5974893761392976, "grad_norm": 0.16363465785980225, "learning_rate": 8.008709786242218e-05, "loss": 0.7661, "mean_token_accuracy": 0.7791938371956348, "num_tokens": 207282525.0, "step": 6494 }, { "entropy": 0.8841302022337914, "epoch": 0.5975813825107389, "grad_norm": 0.17669934034347534, "learning_rate": 8.008403103628056e-05, "loss": 0.8985, "mean_token_accuracy": 0.7462850511074066, "num_tokens": 207314665.0, "step": 6495 }, { "entropy": 0.7799374274909496, "epoch": 0.5976733888821801, "grad_norm": 0.16811153292655945, "learning_rate": 8.008096421013893e-05, "loss": 0.7604, "mean_token_accuracy": 0.7803197018802166, "num_tokens": 207346254.0, "step": 6496 }, { "entropy": 0.8111791536211967, "epoch": 0.5977653952536213, "grad_norm": 0.1616886854171753, "learning_rate": 8.00778973839973e-05, "loss": 0.8052, "mean_token_accuracy": 0.7667524069547653, "num_tokens": 207378884.0, "step": 6497 }, { "entropy": 0.8498926069587469, "epoch": 0.5978574016250625, "grad_norm": 0.15712971985340118, "learning_rate": 8.007483055785568e-05, "loss": 0.8353, "mean_token_accuracy": 0.7483085542917252, "num_tokens": 207410392.0, "step": 6498 }, { "entropy": 0.7078499291092157, "epoch": 0.5979494079965038, "grad_norm": 0.15936043858528137, "learning_rate": 8.007176373171406e-05, "loss": 0.695, "mean_token_accuracy": 0.7946310080587864, "num_tokens": 207441297.0, "step": 6499 }, { "entropy": 0.7039105612784624, "epoch": 0.598041414367945, "grad_norm": 0.15257161855697632, "learning_rate": 8.006869690557243e-05, "loss": 0.693, "mean_token_accuracy": 0.7945197708904743, "num_tokens": 207472051.0, "step": 6500 }, { "entropy": 0.8592873644083738, "epoch": 0.5981334207393862, "grad_norm": 0.15524490177631378, "learning_rate": 8.00656300794308e-05, "loss": 0.8512, "mean_token_accuracy": 0.7550871409475803, "num_tokens": 207504074.0, "step": 6501 }, { "entropy": 0.5241929590702057, "epoch": 0.5982254271108274, "grad_norm": 0.14207103848457336, "learning_rate": 8.006256325328918e-05, "loss": 0.5036, "mean_token_accuracy": 0.8505542017519474, "num_tokens": 207535978.0, "step": 6502 }, { "entropy": 0.8054650630801916, "epoch": 0.5983174334822686, "grad_norm": 0.16788744926452637, "learning_rate": 8.005949642714755e-05, "loss": 0.7961, "mean_token_accuracy": 0.7715342715382576, "num_tokens": 207568003.0, "step": 6503 }, { "entropy": 0.7379892775788903, "epoch": 0.5984094398537099, "grad_norm": 0.15534688532352448, "learning_rate": 8.005642960100593e-05, "loss": 0.7266, "mean_token_accuracy": 0.7848309576511383, "num_tokens": 207599528.0, "step": 6504 }, { "entropy": 0.8020251244306564, "epoch": 0.5985014462251511, "grad_norm": 0.15531183779239655, "learning_rate": 8.00533627748643e-05, "loss": 0.8099, "mean_token_accuracy": 0.7612819187343121, "num_tokens": 207632181.0, "step": 6505 }, { "entropy": 0.754550845362246, "epoch": 0.5985934525965924, "grad_norm": 0.15638132393360138, "learning_rate": 8.005029594872268e-05, "loss": 0.7626, "mean_token_accuracy": 0.7792627699673176, "num_tokens": 207664444.0, "step": 6506 }, { "entropy": 0.7656289162114263, "epoch": 0.5986854589680335, "grad_norm": 0.15273159742355347, "learning_rate": 8.004722912258104e-05, "loss": 0.7467, "mean_token_accuracy": 0.7817647010087967, "num_tokens": 207696734.0, "step": 6507 }, { "entropy": 0.7410564869642258, "epoch": 0.5987774653394747, "grad_norm": 0.16536611318588257, "learning_rate": 8.004416229643941e-05, "loss": 0.7425, "mean_token_accuracy": 0.7818102762103081, "num_tokens": 207728203.0, "step": 6508 }, { "entropy": 0.7252880670130253, "epoch": 0.598869471710916, "grad_norm": 0.14986376464366913, "learning_rate": 8.004109547029779e-05, "loss": 0.7267, "mean_token_accuracy": 0.7800938338041306, "num_tokens": 207760390.0, "step": 6509 }, { "entropy": 0.7285486068576574, "epoch": 0.5989614780823572, "grad_norm": 0.16146208345890045, "learning_rate": 8.003802864415617e-05, "loss": 0.7276, "mean_token_accuracy": 0.7855895273387432, "num_tokens": 207792159.0, "step": 6510 }, { "entropy": 0.6989921238273382, "epoch": 0.5990534844537985, "grad_norm": 0.1575048267841339, "learning_rate": 8.003496181801454e-05, "loss": 0.6926, "mean_token_accuracy": 0.7970220670104027, "num_tokens": 207824234.0, "step": 6511 }, { "entropy": 0.8235620409250259, "epoch": 0.5991454908252396, "grad_norm": 0.15838590264320374, "learning_rate": 8.003189499187291e-05, "loss": 0.8223, "mean_token_accuracy": 0.761557012796402, "num_tokens": 207855754.0, "step": 6512 }, { "entropy": 0.8864719588309526, "epoch": 0.5992374971966808, "grad_norm": 0.15910327434539795, "learning_rate": 8.002882816573128e-05, "loss": 0.852, "mean_token_accuracy": 0.7525430731475353, "num_tokens": 207887266.0, "step": 6513 }, { "entropy": 0.7700284700840712, "epoch": 0.5993295035681221, "grad_norm": 0.17114853858947754, "learning_rate": 8.002576133958967e-05, "loss": 0.764, "mean_token_accuracy": 0.7813663855195045, "num_tokens": 207919081.0, "step": 6514 }, { "entropy": 0.6806915812194347, "epoch": 0.5994215099395633, "grad_norm": 0.1449906975030899, "learning_rate": 8.002269451344804e-05, "loss": 0.6561, "mean_token_accuracy": 0.8046813495457172, "num_tokens": 207951767.0, "step": 6515 }, { "entropy": 0.7461773995310068, "epoch": 0.5995135163110046, "grad_norm": 0.15247860550880432, "learning_rate": 8.001962768730641e-05, "loss": 0.7149, "mean_token_accuracy": 0.7905261069536209, "num_tokens": 207984070.0, "step": 6516 }, { "entropy": 0.7595107778906822, "epoch": 0.5996055226824457, "grad_norm": 0.15661612153053284, "learning_rate": 8.001656086116478e-05, "loss": 0.7372, "mean_token_accuracy": 0.7782615832984447, "num_tokens": 208016117.0, "step": 6517 }, { "entropy": 0.711479127407074, "epoch": 0.599697529053887, "grad_norm": 0.16032689809799194, "learning_rate": 8.001349403502316e-05, "loss": 0.6887, "mean_token_accuracy": 0.8002009801566601, "num_tokens": 208048135.0, "step": 6518 }, { "entropy": 0.8069780524820089, "epoch": 0.5997895354253282, "grad_norm": 0.15994541347026825, "learning_rate": 8.001042720888154e-05, "loss": 0.7994, "mean_token_accuracy": 0.76594003662467, "num_tokens": 208080572.0, "step": 6519 }, { "entropy": 0.7988325357437134, "epoch": 0.5998815417967694, "grad_norm": 0.15919171273708344, "learning_rate": 8.000736038273991e-05, "loss": 0.7932, "mean_token_accuracy": 0.7671983875334263, "num_tokens": 208112502.0, "step": 6520 }, { "entropy": 0.7726119179278612, "epoch": 0.5999735481682107, "grad_norm": 0.16263021528720856, "learning_rate": 8.000429355659828e-05, "loss": 0.7704, "mean_token_accuracy": 0.7732923589646816, "num_tokens": 208143869.0, "step": 6521 }, { "entropy": 0.6723619941622019, "epoch": 0.6000655545396518, "grad_norm": 0.1568424552679062, "learning_rate": 8.000122673045666e-05, "loss": 0.6487, "mean_token_accuracy": 0.8019725903868675, "num_tokens": 208175839.0, "step": 6522 }, { "entropy": 0.7276597954332829, "epoch": 0.6001575609110931, "grad_norm": 0.16762708127498627, "learning_rate": 7.999815990431502e-05, "loss": 0.7393, "mean_token_accuracy": 0.7822263836860657, "num_tokens": 208207830.0, "step": 6523 }, { "entropy": 0.6401676256209612, "epoch": 0.6002495672825343, "grad_norm": 0.15398135781288147, "learning_rate": 7.99950930781734e-05, "loss": 0.6401, "mean_token_accuracy": 0.8106694482266903, "num_tokens": 208239675.0, "step": 6524 }, { "entropy": 0.7679308019578457, "epoch": 0.6003415736539756, "grad_norm": 0.16490720212459564, "learning_rate": 7.999202625203177e-05, "loss": 0.7629, "mean_token_accuracy": 0.7799038030207157, "num_tokens": 208271653.0, "step": 6525 }, { "entropy": 0.7475208314135671, "epoch": 0.6004335800254168, "grad_norm": 0.1591360718011856, "learning_rate": 7.998895942589016e-05, "loss": 0.7428, "mean_token_accuracy": 0.7813245765864849, "num_tokens": 208303857.0, "step": 6526 }, { "entropy": 0.7701478768140078, "epoch": 0.6005255863968579, "grad_norm": 0.16947530210018158, "learning_rate": 7.998589259974852e-05, "loss": 0.7691, "mean_token_accuracy": 0.77600022777915, "num_tokens": 208335824.0, "step": 6527 }, { "entropy": 0.6849273219704628, "epoch": 0.6006175927682992, "grad_norm": 0.14898930490016937, "learning_rate": 7.998282577360689e-05, "loss": 0.6804, "mean_token_accuracy": 0.7975329756736755, "num_tokens": 208368057.0, "step": 6528 }, { "entropy": 0.652855547145009, "epoch": 0.6007095991397404, "grad_norm": 0.15667785704135895, "learning_rate": 7.997975894746527e-05, "loss": 0.6412, "mean_token_accuracy": 0.8087801225483418, "num_tokens": 208400405.0, "step": 6529 }, { "entropy": 0.732154494151473, "epoch": 0.6008016055111817, "grad_norm": 0.16122844815254211, "learning_rate": 7.997669212132365e-05, "loss": 0.712, "mean_token_accuracy": 0.7900843657553196, "num_tokens": 208432281.0, "step": 6530 }, { "entropy": 0.7963873688131571, "epoch": 0.6008936118826229, "grad_norm": 0.16405391693115234, "learning_rate": 7.997362529518202e-05, "loss": 0.7982, "mean_token_accuracy": 0.7684102021157742, "num_tokens": 208464616.0, "step": 6531 }, { "entropy": 0.6842956524342299, "epoch": 0.600985618254064, "grad_norm": 0.1501532644033432, "learning_rate": 7.997055846904039e-05, "loss": 0.6572, "mean_token_accuracy": 0.8003557734191418, "num_tokens": 208496575.0, "step": 6532 }, { "entropy": 0.7394830454140902, "epoch": 0.6010776246255053, "grad_norm": 0.16090528666973114, "learning_rate": 7.996749164289877e-05, "loss": 0.7336, "mean_token_accuracy": 0.7828326411545277, "num_tokens": 208528206.0, "step": 6533 }, { "entropy": 0.7899285778403282, "epoch": 0.6011696309969465, "grad_norm": 0.15661770105361938, "learning_rate": 7.996442481675714e-05, "loss": 0.7771, "mean_token_accuracy": 0.7706447057425976, "num_tokens": 208560502.0, "step": 6534 }, { "entropy": 0.7384083569049835, "epoch": 0.6012616373683878, "grad_norm": 0.14638780057430267, "learning_rate": 7.996135799061552e-05, "loss": 0.7061, "mean_token_accuracy": 0.7930985987186432, "num_tokens": 208592438.0, "step": 6535 }, { "entropy": 0.7083486896008253, "epoch": 0.601353643739829, "grad_norm": 0.15165138244628906, "learning_rate": 7.995829116447389e-05, "loss": 0.6945, "mean_token_accuracy": 0.796220675110817, "num_tokens": 208623836.0, "step": 6536 }, { "entropy": 0.8007223885506392, "epoch": 0.6014456501112702, "grad_norm": 0.15729112923145294, "learning_rate": 7.995522433833227e-05, "loss": 0.7812, "mean_token_accuracy": 0.7693633362650871, "num_tokens": 208655347.0, "step": 6537 }, { "entropy": 0.7703756839036942, "epoch": 0.6015376564827114, "grad_norm": 0.1580106019973755, "learning_rate": 7.995215751219064e-05, "loss": 0.7552, "mean_token_accuracy": 0.7767476178705692, "num_tokens": 208686893.0, "step": 6538 }, { "entropy": 0.7953444868326187, "epoch": 0.6016296628541526, "grad_norm": 0.16319894790649414, "learning_rate": 7.9949090686049e-05, "loss": 0.788, "mean_token_accuracy": 0.7752577848732471, "num_tokens": 208718388.0, "step": 6539 }, { "entropy": 0.7920876611024141, "epoch": 0.6017216692255939, "grad_norm": 0.16992564499378204, "learning_rate": 7.994602385990739e-05, "loss": 0.8031, "mean_token_accuracy": 0.7662144862115383, "num_tokens": 208750604.0, "step": 6540 }, { "entropy": 0.7869543805718422, "epoch": 0.6018136755970351, "grad_norm": 0.15088659524917603, "learning_rate": 7.994295703376577e-05, "loss": 0.7704, "mean_token_accuracy": 0.7708792164921761, "num_tokens": 208783029.0, "step": 6541 }, { "entropy": 0.7942906953394413, "epoch": 0.6019056819684763, "grad_norm": 0.15826645493507385, "learning_rate": 7.993989020762414e-05, "loss": 0.7967, "mean_token_accuracy": 0.7669575177133083, "num_tokens": 208815518.0, "step": 6542 }, { "entropy": 0.7023842185735703, "epoch": 0.6019976883399175, "grad_norm": 0.1449616253376007, "learning_rate": 7.99368233814825e-05, "loss": 0.6912, "mean_token_accuracy": 0.7946152500808239, "num_tokens": 208846769.0, "step": 6543 }, { "entropy": 0.7290205452591181, "epoch": 0.6020896947113588, "grad_norm": 0.15150055289268494, "learning_rate": 7.993375655534087e-05, "loss": 0.7203, "mean_token_accuracy": 0.7895846106112003, "num_tokens": 208878260.0, "step": 6544 }, { "entropy": 0.7711016740649939, "epoch": 0.6021817010828, "grad_norm": 0.15790529549121857, "learning_rate": 7.993068972919925e-05, "loss": 0.7668, "mean_token_accuracy": 0.7758297249674797, "num_tokens": 208909872.0, "step": 6545 }, { "entropy": 0.7453717272728682, "epoch": 0.6022737074542412, "grad_norm": 0.1471903920173645, "learning_rate": 7.992762290305763e-05, "loss": 0.7396, "mean_token_accuracy": 0.7779952771961689, "num_tokens": 208941367.0, "step": 6546 }, { "entropy": 0.8035736083984375, "epoch": 0.6023657138256824, "grad_norm": 0.16212083399295807, "learning_rate": 7.9924556076916e-05, "loss": 0.7912, "mean_token_accuracy": 0.7693401612341404, "num_tokens": 208973755.0, "step": 6547 }, { "entropy": 0.7555980794131756, "epoch": 0.6024577201971236, "grad_norm": 0.15873612463474274, "learning_rate": 7.992148925077437e-05, "loss": 0.7308, "mean_token_accuracy": 0.7797049097716808, "num_tokens": 209005349.0, "step": 6548 }, { "entropy": 0.6920330226421356, "epoch": 0.6025497265685649, "grad_norm": 0.15456484258174896, "learning_rate": 7.991842242463275e-05, "loss": 0.6795, "mean_token_accuracy": 0.7982978448271751, "num_tokens": 209038100.0, "step": 6549 }, { "entropy": 0.7000065557658672, "epoch": 0.6026417329400061, "grad_norm": 0.15978345274925232, "learning_rate": 7.991535559849112e-05, "loss": 0.7036, "mean_token_accuracy": 0.7948522157967091, "num_tokens": 209070868.0, "step": 6550 }, { "entropy": 0.8319433443248272, "epoch": 0.6027337393114474, "grad_norm": 0.15069535374641418, "learning_rate": 7.99122887723495e-05, "loss": 0.8208, "mean_token_accuracy": 0.7559921182692051, "num_tokens": 209102862.0, "step": 6551 }, { "entropy": 0.8474741540849209, "epoch": 0.6028257456828885, "grad_norm": 0.16358792781829834, "learning_rate": 7.990922194620787e-05, "loss": 0.8342, "mean_token_accuracy": 0.7580398395657539, "num_tokens": 209134833.0, "step": 6552 }, { "entropy": 0.7261071326211095, "epoch": 0.6029177520543297, "grad_norm": 0.14692673087120056, "learning_rate": 7.990615512006625e-05, "loss": 0.7091, "mean_token_accuracy": 0.790307842195034, "num_tokens": 209167068.0, "step": 6553 }, { "entropy": 0.8246330507099628, "epoch": 0.603009758425771, "grad_norm": 0.14882971346378326, "learning_rate": 7.990308829392462e-05, "loss": 0.8065, "mean_token_accuracy": 0.7633235491812229, "num_tokens": 209198852.0, "step": 6554 }, { "entropy": 0.80736268684268, "epoch": 0.6031017647972122, "grad_norm": 0.15595325827598572, "learning_rate": 7.990002146778299e-05, "loss": 0.7627, "mean_token_accuracy": 0.7787143178284168, "num_tokens": 209229935.0, "step": 6555 }, { "entropy": 0.7833071053028107, "epoch": 0.6031937711686535, "grad_norm": 0.16186264157295227, "learning_rate": 7.989695464164137e-05, "loss": 0.769, "mean_token_accuracy": 0.7737236246466637, "num_tokens": 209260849.0, "step": 6556 }, { "entropy": 0.8083824478089809, "epoch": 0.6032857775400946, "grad_norm": 0.159035786986351, "learning_rate": 7.989388781549975e-05, "loss": 0.8089, "mean_token_accuracy": 0.7637511044740677, "num_tokens": 209292936.0, "step": 6557 }, { "entropy": 0.767772413790226, "epoch": 0.6033777839115358, "grad_norm": 0.1527358442544937, "learning_rate": 7.989082098935812e-05, "loss": 0.7765, "mean_token_accuracy": 0.7725660763680935, "num_tokens": 209325001.0, "step": 6558 }, { "entropy": 0.7963237352669239, "epoch": 0.6034697902829771, "grad_norm": 0.17589490115642548, "learning_rate": 7.988775416321648e-05, "loss": 0.8088, "mean_token_accuracy": 0.76608806848526, "num_tokens": 209357231.0, "step": 6559 }, { "entropy": 0.8199936710298061, "epoch": 0.6035617966544183, "grad_norm": 0.1718231439590454, "learning_rate": 7.988468733707487e-05, "loss": 0.8158, "mean_token_accuracy": 0.7602086998522282, "num_tokens": 209388168.0, "step": 6560 }, { "entropy": 0.7515507787466049, "epoch": 0.6036538030258596, "grad_norm": 0.1553138643503189, "learning_rate": 7.988162051093325e-05, "loss": 0.7479, "mean_token_accuracy": 0.7762538380920887, "num_tokens": 209420693.0, "step": 6561 }, { "entropy": 0.7911493945866823, "epoch": 0.6037458093973007, "grad_norm": 0.17194153368473053, "learning_rate": 7.987855368479162e-05, "loss": 0.797, "mean_token_accuracy": 0.7702800184488297, "num_tokens": 209452949.0, "step": 6562 }, { "entropy": 0.7690427973866463, "epoch": 0.603837815768742, "grad_norm": 0.15877549350261688, "learning_rate": 7.987548685864998e-05, "loss": 0.7507, "mean_token_accuracy": 0.7811181582510471, "num_tokens": 209484068.0, "step": 6563 }, { "entropy": 0.7800704557448626, "epoch": 0.6039298221401832, "grad_norm": 0.15914031863212585, "learning_rate": 7.987242003250836e-05, "loss": 0.7771, "mean_token_accuracy": 0.7775832787156105, "num_tokens": 209516140.0, "step": 6564 }, { "entropy": 0.7687541898339987, "epoch": 0.6040218285116244, "grad_norm": 0.15189766883850098, "learning_rate": 7.986935320636673e-05, "loss": 0.7633, "mean_token_accuracy": 0.7798665352165699, "num_tokens": 209547744.0, "step": 6565 }, { "entropy": 0.6467344909906387, "epoch": 0.6041138348830657, "grad_norm": 0.15135617554187775, "learning_rate": 7.986628638022511e-05, "loss": 0.6197, "mean_token_accuracy": 0.8123287409543991, "num_tokens": 209579423.0, "step": 6566 }, { "entropy": 0.799315819516778, "epoch": 0.6042058412545068, "grad_norm": 0.1661297231912613, "learning_rate": 7.986321955408348e-05, "loss": 0.8011, "mean_token_accuracy": 0.7652314454317093, "num_tokens": 209611219.0, "step": 6567 }, { "entropy": 0.8238492049276829, "epoch": 0.6042978476259481, "grad_norm": 0.16145013272762299, "learning_rate": 7.986015272794186e-05, "loss": 0.8306, "mean_token_accuracy": 0.7579727061092854, "num_tokens": 209643360.0, "step": 6568 }, { "entropy": 0.7450622040778399, "epoch": 0.6043898539973893, "grad_norm": 0.15075799822807312, "learning_rate": 7.985708590180023e-05, "loss": 0.7145, "mean_token_accuracy": 0.7881363742053509, "num_tokens": 209675167.0, "step": 6569 }, { "entropy": 0.8160505816340446, "epoch": 0.6044818603688306, "grad_norm": 0.15104889869689941, "learning_rate": 7.98540190756586e-05, "loss": 0.7932, "mean_token_accuracy": 0.7683801054954529, "num_tokens": 209707059.0, "step": 6570 }, { "entropy": 0.6034088283777237, "epoch": 0.6045738667402718, "grad_norm": 0.15436023473739624, "learning_rate": 7.985095224951698e-05, "loss": 0.573, "mean_token_accuracy": 0.8258890509605408, "num_tokens": 209739053.0, "step": 6571 }, { "entropy": 0.8816453069448471, "epoch": 0.6046658731117129, "grad_norm": 0.16121132671833038, "learning_rate": 7.984788542337536e-05, "loss": 0.8739, "mean_token_accuracy": 0.74450958147645, "num_tokens": 209770622.0, "step": 6572 }, { "entropy": 0.8748078383505344, "epoch": 0.6047578794831542, "grad_norm": 0.16073639690876007, "learning_rate": 7.984481859723373e-05, "loss": 0.8782, "mean_token_accuracy": 0.7499445229768753, "num_tokens": 209802949.0, "step": 6573 }, { "entropy": 0.7309481259435415, "epoch": 0.6048498858545954, "grad_norm": 0.15880316495895386, "learning_rate": 7.98417517710921e-05, "loss": 0.7195, "mean_token_accuracy": 0.7940706498920918, "num_tokens": 209833553.0, "step": 6574 }, { "entropy": 0.7991013452410698, "epoch": 0.6049418922260367, "grad_norm": 0.16137157380580902, "learning_rate": 7.983868494495047e-05, "loss": 0.8063, "mean_token_accuracy": 0.7630074173212051, "num_tokens": 209866031.0, "step": 6575 }, { "entropy": 0.7924935966730118, "epoch": 0.6050338985974779, "grad_norm": 0.1531510055065155, "learning_rate": 7.983561811880885e-05, "loss": 0.7842, "mean_token_accuracy": 0.7686602920293808, "num_tokens": 209898445.0, "step": 6576 }, { "entropy": 0.7136400081217289, "epoch": 0.605125904968919, "grad_norm": 0.17016638815402985, "learning_rate": 7.983255129266723e-05, "loss": 0.7208, "mean_token_accuracy": 0.7875397130846977, "num_tokens": 209929983.0, "step": 6577 }, { "entropy": 0.6916261352598667, "epoch": 0.6052179113403603, "grad_norm": 0.15910348296165466, "learning_rate": 7.98294844665256e-05, "loss": 0.677, "mean_token_accuracy": 0.7978952825069427, "num_tokens": 209961989.0, "step": 6578 }, { "entropy": 0.8545396365225315, "epoch": 0.6053099177118015, "grad_norm": 0.16502618789672852, "learning_rate": 7.982641764038396e-05, "loss": 0.8537, "mean_token_accuracy": 0.7536961175501347, "num_tokens": 209994185.0, "step": 6579 }, { "entropy": 0.7960409764200449, "epoch": 0.6054019240832428, "grad_norm": 0.15946035087108612, "learning_rate": 7.982335081424235e-05, "loss": 0.7823, "mean_token_accuracy": 0.7754721455276012, "num_tokens": 210025385.0, "step": 6580 }, { "entropy": 0.7195939626544714, "epoch": 0.605493930454684, "grad_norm": 0.16873058676719666, "learning_rate": 7.982028398810071e-05, "loss": 0.7383, "mean_token_accuracy": 0.783303651958704, "num_tokens": 210057334.0, "step": 6581 }, { "entropy": 0.8134278329089284, "epoch": 0.6055859368261252, "grad_norm": 0.16449128091335297, "learning_rate": 7.98172171619591e-05, "loss": 0.7977, "mean_token_accuracy": 0.7582212723791599, "num_tokens": 210089256.0, "step": 6582 }, { "entropy": 0.7313144393265247, "epoch": 0.6056779431975664, "grad_norm": 0.1528351604938507, "learning_rate": 7.981415033581746e-05, "loss": 0.7339, "mean_token_accuracy": 0.7857807502150536, "num_tokens": 210121567.0, "step": 6583 }, { "entropy": 0.7307920046150684, "epoch": 0.6057699495690076, "grad_norm": 0.14961038529872894, "learning_rate": 7.981108350967584e-05, "loss": 0.7163, "mean_token_accuracy": 0.7887022159993649, "num_tokens": 210154231.0, "step": 6584 }, { "entropy": 0.8276907093822956, "epoch": 0.6058619559404489, "grad_norm": 0.15803076326847076, "learning_rate": 7.980801668353421e-05, "loss": 0.7983, "mean_token_accuracy": 0.7672717496752739, "num_tokens": 210185938.0, "step": 6585 }, { "entropy": 0.7541860155761242, "epoch": 0.6059539623118901, "grad_norm": 0.15463203191757202, "learning_rate": 7.980494985739258e-05, "loss": 0.7263, "mean_token_accuracy": 0.7855614647269249, "num_tokens": 210217331.0, "step": 6586 }, { "entropy": 0.7483357824385166, "epoch": 0.6060459686833313, "grad_norm": 0.15693438053131104, "learning_rate": 7.980188303125096e-05, "loss": 0.725, "mean_token_accuracy": 0.7884011715650558, "num_tokens": 210248826.0, "step": 6587 }, { "entropy": 0.648467680439353, "epoch": 0.6061379750547725, "grad_norm": 0.1536979228258133, "learning_rate": 7.979881620510934e-05, "loss": 0.6064, "mean_token_accuracy": 0.8235781081020832, "num_tokens": 210280693.0, "step": 6588 }, { "entropy": 0.9935454949736595, "epoch": 0.6062299814262138, "grad_norm": 0.16495104134082794, "learning_rate": 7.979574937896771e-05, "loss": 0.9901, "mean_token_accuracy": 0.7140422947704792, "num_tokens": 210312184.0, "step": 6589 }, { "entropy": 0.7695052735507488, "epoch": 0.606321987797655, "grad_norm": 0.15708249807357788, "learning_rate": 7.979268255282608e-05, "loss": 0.7584, "mean_token_accuracy": 0.7799543850123882, "num_tokens": 210343868.0, "step": 6590 }, { "entropy": 0.7566957734525204, "epoch": 0.6064139941690962, "grad_norm": 0.16267789900302887, "learning_rate": 7.978961572668446e-05, "loss": 0.7575, "mean_token_accuracy": 0.7764419615268707, "num_tokens": 210374876.0, "step": 6591 }, { "entropy": 0.8630033284425735, "epoch": 0.6065060005405374, "grad_norm": 0.16665709018707275, "learning_rate": 7.978654890054284e-05, "loss": 0.864, "mean_token_accuracy": 0.750651378184557, "num_tokens": 210407103.0, "step": 6592 }, { "entropy": 0.8305176068097353, "epoch": 0.6065980069119786, "grad_norm": 0.16194674372673035, "learning_rate": 7.978348207440121e-05, "loss": 0.834, "mean_token_accuracy": 0.7584124058485031, "num_tokens": 210439139.0, "step": 6593 }, { "entropy": 0.6215958567336202, "epoch": 0.6066900132834199, "grad_norm": 0.1539551168680191, "learning_rate": 7.978041524825958e-05, "loss": 0.615, "mean_token_accuracy": 0.8170161359012127, "num_tokens": 210471287.0, "step": 6594 }, { "entropy": 0.7322047809138894, "epoch": 0.6067820196548611, "grad_norm": 0.16111448407173157, "learning_rate": 7.977734842211796e-05, "loss": 0.7472, "mean_token_accuracy": 0.7842026464641094, "num_tokens": 210503847.0, "step": 6595 }, { "entropy": 0.7706270217895508, "epoch": 0.6068740260263024, "grad_norm": 0.15339678525924683, "learning_rate": 7.977428159597633e-05, "loss": 0.7475, "mean_token_accuracy": 0.7804178968071938, "num_tokens": 210536015.0, "step": 6596 }, { "entropy": 0.7801286298781633, "epoch": 0.6069660323977435, "grad_norm": 0.15024489164352417, "learning_rate": 7.977121476983471e-05, "loss": 0.7722, "mean_token_accuracy": 0.7684030048549175, "num_tokens": 210567648.0, "step": 6597 }, { "entropy": 0.7636658437550068, "epoch": 0.6070580387691847, "grad_norm": 0.16011592745780945, "learning_rate": 7.976814794369308e-05, "loss": 0.7678, "mean_token_accuracy": 0.7752377428114414, "num_tokens": 210599515.0, "step": 6598 }, { "entropy": 0.7189522981643677, "epoch": 0.607150045140626, "grad_norm": 0.15910989046096802, "learning_rate": 7.976508111755146e-05, "loss": 0.7176, "mean_token_accuracy": 0.7852495163679123, "num_tokens": 210630662.0, "step": 6599 }, { "entropy": 0.7190588554367423, "epoch": 0.6072420515120672, "grad_norm": 0.16316023468971252, "learning_rate": 7.976201429140982e-05, "loss": 0.7101, "mean_token_accuracy": 0.7897082604467869, "num_tokens": 210662851.0, "step": 6600 }, { "entropy": 0.785878948867321, "epoch": 0.6073340578835085, "grad_norm": 0.1580585241317749, "learning_rate": 7.975894746526819e-05, "loss": 0.7708, "mean_token_accuracy": 0.7725542783737183, "num_tokens": 210695132.0, "step": 6601 }, { "entropy": 0.7976447883993387, "epoch": 0.6074260642549496, "grad_norm": 0.1546858698129654, "learning_rate": 7.975588063912657e-05, "loss": 0.7709, "mean_token_accuracy": 0.7693204656243324, "num_tokens": 210727504.0, "step": 6602 }, { "entropy": 0.7257482055574656, "epoch": 0.6075180706263908, "grad_norm": 0.16131651401519775, "learning_rate": 7.975281381298496e-05, "loss": 0.7118, "mean_token_accuracy": 0.7915220968425274, "num_tokens": 210759866.0, "step": 6603 }, { "entropy": 0.8481794856488705, "epoch": 0.6076100769978321, "grad_norm": 0.16166168451309204, "learning_rate": 7.974974698684332e-05, "loss": 0.825, "mean_token_accuracy": 0.7579395733773708, "num_tokens": 210791172.0, "step": 6604 }, { "entropy": 0.749772809445858, "epoch": 0.6077020833692733, "grad_norm": 0.15904855728149414, "learning_rate": 7.974668016070169e-05, "loss": 0.7353, "mean_token_accuracy": 0.7805076166987419, "num_tokens": 210822961.0, "step": 6605 }, { "entropy": 0.8271678313612938, "epoch": 0.6077940897407146, "grad_norm": 0.16505098342895508, "learning_rate": 7.974361333456006e-05, "loss": 0.8197, "mean_token_accuracy": 0.7639963515102863, "num_tokens": 210855166.0, "step": 6606 }, { "entropy": 0.783656282350421, "epoch": 0.6078860961121557, "grad_norm": 0.15656785666942596, "learning_rate": 7.974054650841844e-05, "loss": 0.7621, "mean_token_accuracy": 0.7784202210605145, "num_tokens": 210885311.0, "step": 6607 }, { "entropy": 0.7863801829516888, "epoch": 0.607978102483597, "grad_norm": 0.15652650594711304, "learning_rate": 7.973747968227682e-05, "loss": 0.7968, "mean_token_accuracy": 0.7675429806113243, "num_tokens": 210917387.0, "step": 6608 }, { "entropy": 0.779412304982543, "epoch": 0.6080701088550382, "grad_norm": 0.15526188910007477, "learning_rate": 7.973441285613519e-05, "loss": 0.7685, "mean_token_accuracy": 0.772335659712553, "num_tokens": 210949152.0, "step": 6609 }, { "entropy": 0.7853844538331032, "epoch": 0.6081621152264794, "grad_norm": 0.15987880527973175, "learning_rate": 7.973134602999356e-05, "loss": 0.7775, "mean_token_accuracy": 0.7697658315300941, "num_tokens": 210981403.0, "step": 6610 }, { "entropy": 0.8023937176913023, "epoch": 0.6082541215979207, "grad_norm": 0.1517046093940735, "learning_rate": 7.972827920385194e-05, "loss": 0.7998, "mean_token_accuracy": 0.7672928273677826, "num_tokens": 211013675.0, "step": 6611 }, { "entropy": 0.7625174578279257, "epoch": 0.6083461279693618, "grad_norm": 0.16047334671020508, "learning_rate": 7.972521237771031e-05, "loss": 0.7647, "mean_token_accuracy": 0.7714215964078903, "num_tokens": 211043790.0, "step": 6612 }, { "entropy": 0.8347377851605415, "epoch": 0.6084381343408031, "grad_norm": 0.16077767312526703, "learning_rate": 7.972214555156869e-05, "loss": 0.8191, "mean_token_accuracy": 0.76403384283185, "num_tokens": 211075380.0, "step": 6613 }, { "entropy": 0.7236975282430649, "epoch": 0.6085301407122443, "grad_norm": 0.1595371514558792, "learning_rate": 7.971907872542706e-05, "loss": 0.7181, "mean_token_accuracy": 0.7909240238368511, "num_tokens": 211107084.0, "step": 6614 }, { "entropy": 0.7390807420015335, "epoch": 0.6086221470836856, "grad_norm": 0.18780814111232758, "learning_rate": 7.971601189928544e-05, "loss": 0.7594, "mean_token_accuracy": 0.7792432382702827, "num_tokens": 211139245.0, "step": 6615 }, { "entropy": 0.6694026347249746, "epoch": 0.6087141534551268, "grad_norm": 0.1537383496761322, "learning_rate": 7.97129450731438e-05, "loss": 0.658, "mean_token_accuracy": 0.8036625534296036, "num_tokens": 211171262.0, "step": 6616 }, { "entropy": 0.8196073696017265, "epoch": 0.6088061598265679, "grad_norm": 0.17078201472759247, "learning_rate": 7.970987824700217e-05, "loss": 0.7871, "mean_token_accuracy": 0.7710178308188915, "num_tokens": 211203624.0, "step": 6617 }, { "entropy": 0.6513512367382646, "epoch": 0.6088981661980092, "grad_norm": 0.14339017868041992, "learning_rate": 7.970681142086056e-05, "loss": 0.6201, "mean_token_accuracy": 0.8136495985090733, "num_tokens": 211235963.0, "step": 6618 }, { "entropy": 0.7762915194034576, "epoch": 0.6089901725694504, "grad_norm": 0.1527511030435562, "learning_rate": 7.970374459471894e-05, "loss": 0.7577, "mean_token_accuracy": 0.7786231189966202, "num_tokens": 211268137.0, "step": 6619 }, { "entropy": 0.6614007614552975, "epoch": 0.6090821789408917, "grad_norm": 0.1640542596578598, "learning_rate": 7.97006777685773e-05, "loss": 0.6399, "mean_token_accuracy": 0.8107142671942711, "num_tokens": 211300003.0, "step": 6620 }, { "entropy": 0.8088312409818172, "epoch": 0.6091741853123329, "grad_norm": 0.1562281996011734, "learning_rate": 7.969761094243567e-05, "loss": 0.7873, "mean_token_accuracy": 0.767872080206871, "num_tokens": 211331833.0, "step": 6621 }, { "entropy": 0.7271502036601305, "epoch": 0.609266191683774, "grad_norm": 0.15009111166000366, "learning_rate": 7.969454411629405e-05, "loss": 0.7064, "mean_token_accuracy": 0.7914947010576725, "num_tokens": 211364091.0, "step": 6622 }, { "entropy": 0.7459986601024866, "epoch": 0.6093581980552153, "grad_norm": 0.16261646151542664, "learning_rate": 7.969147729015242e-05, "loss": 0.7293, "mean_token_accuracy": 0.7829660810530186, "num_tokens": 211395962.0, "step": 6623 }, { "entropy": 0.7554231937974691, "epoch": 0.6094502044266565, "grad_norm": 0.15104639530181885, "learning_rate": 7.96884104640108e-05, "loss": 0.7363, "mean_token_accuracy": 0.7805481068789959, "num_tokens": 211428036.0, "step": 6624 }, { "entropy": 0.7729437090456486, "epoch": 0.6095422107980978, "grad_norm": 0.16430875658988953, "learning_rate": 7.968534363786917e-05, "loss": 0.7639, "mean_token_accuracy": 0.7774238772690296, "num_tokens": 211459536.0, "step": 6625 }, { "entropy": 0.7495695762336254, "epoch": 0.609634217169539, "grad_norm": 0.15760618448257446, "learning_rate": 7.968227681172755e-05, "loss": 0.7515, "mean_token_accuracy": 0.777808915823698, "num_tokens": 211490149.0, "step": 6626 }, { "entropy": 0.7304324293509126, "epoch": 0.6097262235409802, "grad_norm": 0.1557258814573288, "learning_rate": 7.967920998558592e-05, "loss": 0.7252, "mean_token_accuracy": 0.7892836853861809, "num_tokens": 211521704.0, "step": 6627 }, { "entropy": 0.6953580984845757, "epoch": 0.6098182299124214, "grad_norm": 0.1574198454618454, "learning_rate": 7.967614315944429e-05, "loss": 0.6836, "mean_token_accuracy": 0.8019516989588737, "num_tokens": 211553708.0, "step": 6628 }, { "entropy": 0.7454677280038595, "epoch": 0.6099102362838627, "grad_norm": 0.15452569723129272, "learning_rate": 7.967307633330267e-05, "loss": 0.7472, "mean_token_accuracy": 0.7771567516028881, "num_tokens": 211586272.0, "step": 6629 }, { "entropy": 0.6520652286708355, "epoch": 0.6100022426553039, "grad_norm": 0.15671966969966888, "learning_rate": 7.967000950716105e-05, "loss": 0.6524, "mean_token_accuracy": 0.8085168153047562, "num_tokens": 211618467.0, "step": 6630 }, { "entropy": 0.7755056824535131, "epoch": 0.6100942490267451, "grad_norm": 0.1639256626367569, "learning_rate": 7.966694268101942e-05, "loss": 0.7641, "mean_token_accuracy": 0.777957409620285, "num_tokens": 211650326.0, "step": 6631 }, { "entropy": 0.7169619556516409, "epoch": 0.6101862553981863, "grad_norm": 0.15627935528755188, "learning_rate": 7.966387585487779e-05, "loss": 0.7114, "mean_token_accuracy": 0.7921593710780144, "num_tokens": 211681921.0, "step": 6632 }, { "entropy": 0.769679881632328, "epoch": 0.6102782617696275, "grad_norm": 0.15452654659748077, "learning_rate": 7.966080902873615e-05, "loss": 0.7801, "mean_token_accuracy": 0.7721533477306366, "num_tokens": 211713610.0, "step": 6633 }, { "entropy": 0.8633562289178371, "epoch": 0.6103702681410688, "grad_norm": 0.17279057204723358, "learning_rate": 7.965774220259455e-05, "loss": 0.8758, "mean_token_accuracy": 0.748928751796484, "num_tokens": 211744017.0, "step": 6634 }, { "entropy": 0.7830563988536596, "epoch": 0.61046227451251, "grad_norm": 0.15531402826309204, "learning_rate": 7.965467537645292e-05, "loss": 0.7646, "mean_token_accuracy": 0.7752265632152557, "num_tokens": 211776057.0, "step": 6635 }, { "entropy": 0.7385657504200935, "epoch": 0.6105542808839513, "grad_norm": 0.1529969722032547, "learning_rate": 7.965160855031129e-05, "loss": 0.7144, "mean_token_accuracy": 0.7915769256651402, "num_tokens": 211807034.0, "step": 6636 }, { "entropy": 0.8132250159978867, "epoch": 0.6106462872553924, "grad_norm": 0.1591726690530777, "learning_rate": 7.964854172416965e-05, "loss": 0.8221, "mean_token_accuracy": 0.7642566226422787, "num_tokens": 211838946.0, "step": 6637 }, { "entropy": 0.6804377818480134, "epoch": 0.6107382936268336, "grad_norm": 0.1447530835866928, "learning_rate": 7.964547489802803e-05, "loss": 0.6645, "mean_token_accuracy": 0.8001934476196766, "num_tokens": 211871506.0, "step": 6638 }, { "entropy": 0.649226650595665, "epoch": 0.6108302999982749, "grad_norm": 0.14411744475364685, "learning_rate": 7.964240807188642e-05, "loss": 0.6295, "mean_token_accuracy": 0.8123362809419632, "num_tokens": 211903168.0, "step": 6639 }, { "entropy": 0.7938334830105305, "epoch": 0.6109223063697161, "grad_norm": 0.1632513850927353, "learning_rate": 7.963934124574478e-05, "loss": 0.8069, "mean_token_accuracy": 0.762355774641037, "num_tokens": 211935451.0, "step": 6640 }, { "entropy": 0.8145322296768427, "epoch": 0.6110143127411574, "grad_norm": 0.164145365357399, "learning_rate": 7.963627441960315e-05, "loss": 0.8039, "mean_token_accuracy": 0.7642817497253418, "num_tokens": 211966894.0, "step": 6641 }, { "entropy": 0.7050241213291883, "epoch": 0.6111063191125985, "grad_norm": 0.15375614166259766, "learning_rate": 7.963320759346153e-05, "loss": 0.7009, "mean_token_accuracy": 0.7912631332874298, "num_tokens": 211998401.0, "step": 6642 }, { "entropy": 0.8269395977258682, "epoch": 0.6111983254840397, "grad_norm": 0.16130326688289642, "learning_rate": 7.96301407673199e-05, "loss": 0.8125, "mean_token_accuracy": 0.7592475898563862, "num_tokens": 212029135.0, "step": 6643 }, { "entropy": 0.6851309668272734, "epoch": 0.611290331855481, "grad_norm": 0.14882177114486694, "learning_rate": 7.962707394117828e-05, "loss": 0.6593, "mean_token_accuracy": 0.8075400367379189, "num_tokens": 212060765.0, "step": 6644 }, { "entropy": 0.760255379602313, "epoch": 0.6113823382269222, "grad_norm": 0.15952490270137787, "learning_rate": 7.962400711503665e-05, "loss": 0.7481, "mean_token_accuracy": 0.7803831249475479, "num_tokens": 212093191.0, "step": 6645 }, { "entropy": 0.7954575959593058, "epoch": 0.6114743445983635, "grad_norm": 0.16364724934101105, "learning_rate": 7.962094028889503e-05, "loss": 0.7662, "mean_token_accuracy": 0.775992713868618, "num_tokens": 212124516.0, "step": 6646 }, { "entropy": 0.7328708805143833, "epoch": 0.6115663509698046, "grad_norm": 0.1567360758781433, "learning_rate": 7.96178734627534e-05, "loss": 0.7221, "mean_token_accuracy": 0.787740346044302, "num_tokens": 212156835.0, "step": 6647 }, { "entropy": 0.6800538552924991, "epoch": 0.6116583573412459, "grad_norm": 0.15419915318489075, "learning_rate": 7.961480663661177e-05, "loss": 0.6686, "mean_token_accuracy": 0.8018447868525982, "num_tokens": 212189073.0, "step": 6648 }, { "entropy": 0.8660410940647125, "epoch": 0.6117503637126871, "grad_norm": 0.1648206263780594, "learning_rate": 7.961173981047015e-05, "loss": 0.8491, "mean_token_accuracy": 0.7545182779431343, "num_tokens": 212220178.0, "step": 6649 }, { "entropy": 0.5847712084650993, "epoch": 0.6118423700841283, "grad_norm": 0.161371648311615, "learning_rate": 7.960867298432853e-05, "loss": 0.596, "mean_token_accuracy": 0.823094766587019, "num_tokens": 212252946.0, "step": 6650 }, { "entropy": 0.7672773152589798, "epoch": 0.6119343764555696, "grad_norm": 0.15938608348369598, "learning_rate": 7.96056061581869e-05, "loss": 0.7657, "mean_token_accuracy": 0.7804109789431095, "num_tokens": 212284711.0, "step": 6651 }, { "entropy": 0.8194014988839626, "epoch": 0.6120263828270107, "grad_norm": 0.16147950291633606, "learning_rate": 7.960253933204527e-05, "loss": 0.7749, "mean_token_accuracy": 0.7744439840316772, "num_tokens": 212316064.0, "step": 6652 }, { "entropy": 0.7776915170252323, "epoch": 0.612118389198452, "grad_norm": 0.15687604248523712, "learning_rate": 7.959947250590365e-05, "loss": 0.765, "mean_token_accuracy": 0.7762802243232727, "num_tokens": 212348720.0, "step": 6653 }, { "entropy": 0.7921652868390083, "epoch": 0.6122103955698932, "grad_norm": 0.16418609023094177, "learning_rate": 7.959640567976202e-05, "loss": 0.8121, "mean_token_accuracy": 0.7621974647045135, "num_tokens": 212381304.0, "step": 6654 }, { "entropy": 0.7257687691599131, "epoch": 0.6123024019413345, "grad_norm": 0.1561390906572342, "learning_rate": 7.95933388536204e-05, "loss": 0.7158, "mean_token_accuracy": 0.7880750223994255, "num_tokens": 212413534.0, "step": 6655 }, { "entropy": 0.9156952537596226, "epoch": 0.6123944083127757, "grad_norm": 0.1660735309123993, "learning_rate": 7.959027202747876e-05, "loss": 0.9021, "mean_token_accuracy": 0.7402945905923843, "num_tokens": 212444871.0, "step": 6656 }, { "entropy": 0.7840570621192455, "epoch": 0.6124864146842168, "grad_norm": 0.15284180641174316, "learning_rate": 7.958720520133715e-05, "loss": 0.7816, "mean_token_accuracy": 0.7694744095206261, "num_tokens": 212477324.0, "step": 6657 }, { "entropy": 0.723306629806757, "epoch": 0.6125784210556581, "grad_norm": 0.15021628141403198, "learning_rate": 7.958413837519551e-05, "loss": 0.7111, "mean_token_accuracy": 0.7915221527218819, "num_tokens": 212509819.0, "step": 6658 }, { "entropy": 0.793012723326683, "epoch": 0.6126704274270993, "grad_norm": 0.1640978902578354, "learning_rate": 7.958107154905388e-05, "loss": 0.7959, "mean_token_accuracy": 0.7666523791849613, "num_tokens": 212541503.0, "step": 6659 }, { "entropy": 0.7863712012767792, "epoch": 0.6127624337985406, "grad_norm": 0.16174615919589996, "learning_rate": 7.957800472291226e-05, "loss": 0.7695, "mean_token_accuracy": 0.7796160690486431, "num_tokens": 212573610.0, "step": 6660 }, { "entropy": 0.7861715573817492, "epoch": 0.6128544401699818, "grad_norm": 0.15364255011081696, "learning_rate": 7.957493789677064e-05, "loss": 0.7786, "mean_token_accuracy": 0.77163016051054, "num_tokens": 212605168.0, "step": 6661 }, { "entropy": 0.7250403705984354, "epoch": 0.6129464465414229, "grad_norm": 0.160390704870224, "learning_rate": 7.957187107062901e-05, "loss": 0.7354, "mean_token_accuracy": 0.7803471237421036, "num_tokens": 212636523.0, "step": 6662 }, { "entropy": 0.7669453397393227, "epoch": 0.6130384529128642, "grad_norm": 0.15723715722560883, "learning_rate": 7.956880424448738e-05, "loss": 0.7548, "mean_token_accuracy": 0.7770597748458385, "num_tokens": 212667721.0, "step": 6663 }, { "entropy": 0.7054450530558825, "epoch": 0.6131304592843054, "grad_norm": 0.16165335476398468, "learning_rate": 7.956573741834575e-05, "loss": 0.7142, "mean_token_accuracy": 0.7949486151337624, "num_tokens": 212699495.0, "step": 6664 }, { "entropy": 0.7374550104141235, "epoch": 0.6132224656557467, "grad_norm": 0.1605551540851593, "learning_rate": 7.956267059220413e-05, "loss": 0.7364, "mean_token_accuracy": 0.7837115414440632, "num_tokens": 212731159.0, "step": 6665 }, { "entropy": 0.6429927051067352, "epoch": 0.6133144720271879, "grad_norm": 0.147960364818573, "learning_rate": 7.955960376606251e-05, "loss": 0.6179, "mean_token_accuracy": 0.8155076615512371, "num_tokens": 212763140.0, "step": 6666 }, { "entropy": 0.8386082071810961, "epoch": 0.613406478398629, "grad_norm": 0.16985975205898285, "learning_rate": 7.955653693992088e-05, "loss": 0.8459, "mean_token_accuracy": 0.7526288740336895, "num_tokens": 212794774.0, "step": 6667 }, { "entropy": 0.7906545922160149, "epoch": 0.6134984847700703, "grad_norm": 0.15552859008312225, "learning_rate": 7.955347011377925e-05, "loss": 0.784, "mean_token_accuracy": 0.7689914889633656, "num_tokens": 212827240.0, "step": 6668 }, { "entropy": 0.7791570983827114, "epoch": 0.6135904911415115, "grad_norm": 0.15880948305130005, "learning_rate": 7.955040328763763e-05, "loss": 0.7783, "mean_token_accuracy": 0.7733309008181095, "num_tokens": 212859668.0, "step": 6669 }, { "entropy": 0.7832208685576916, "epoch": 0.6136824975129528, "grad_norm": 0.16190147399902344, "learning_rate": 7.9547336461496e-05, "loss": 0.7769, "mean_token_accuracy": 0.7737848088145256, "num_tokens": 212892436.0, "step": 6670 }, { "entropy": 0.7396881468594074, "epoch": 0.613774503884394, "grad_norm": 0.1567920744419098, "learning_rate": 7.954426963535438e-05, "loss": 0.7332, "mean_token_accuracy": 0.783530980348587, "num_tokens": 212925169.0, "step": 6671 }, { "entropy": 0.8518978077918291, "epoch": 0.6138665102558352, "grad_norm": 0.16225937008857727, "learning_rate": 7.954120280921275e-05, "loss": 0.828, "mean_token_accuracy": 0.7586348801851273, "num_tokens": 212957096.0, "step": 6672 }, { "entropy": 0.8447510488331318, "epoch": 0.6139585166272764, "grad_norm": 0.15840625762939453, "learning_rate": 7.953813598307113e-05, "loss": 0.8312, "mean_token_accuracy": 0.7543718479573727, "num_tokens": 212988049.0, "step": 6673 }, { "entropy": 0.6874769944697618, "epoch": 0.6140505229987177, "grad_norm": 0.15873205661773682, "learning_rate": 7.95350691569295e-05, "loss": 0.6803, "mean_token_accuracy": 0.8002268224954605, "num_tokens": 213019217.0, "step": 6674 }, { "entropy": 0.843929335474968, "epoch": 0.6141425293701589, "grad_norm": 0.15694262087345123, "learning_rate": 7.953200233078786e-05, "loss": 0.8279, "mean_token_accuracy": 0.7575494684278965, "num_tokens": 213050810.0, "step": 6675 }, { "entropy": 0.7572820708155632, "epoch": 0.6142345357416001, "grad_norm": 0.15708081424236298, "learning_rate": 7.952893550464624e-05, "loss": 0.7502, "mean_token_accuracy": 0.7764142118394375, "num_tokens": 213081798.0, "step": 6676 }, { "entropy": 0.8281751293689013, "epoch": 0.6143265421130413, "grad_norm": 0.1675480306148529, "learning_rate": 7.952586867850463e-05, "loss": 0.8135, "mean_token_accuracy": 0.7639302536845207, "num_tokens": 213113267.0, "step": 6677 }, { "entropy": 0.8072092458605766, "epoch": 0.6144185484844825, "grad_norm": 0.16220667958259583, "learning_rate": 7.9522801852363e-05, "loss": 0.8232, "mean_token_accuracy": 0.7629742473363876, "num_tokens": 213145321.0, "step": 6678 }, { "entropy": 0.8377286158502102, "epoch": 0.6145105548559238, "grad_norm": 0.15433530509471893, "learning_rate": 7.951973502622136e-05, "loss": 0.8183, "mean_token_accuracy": 0.7566869296133518, "num_tokens": 213177446.0, "step": 6679 }, { "entropy": 0.7631161399185658, "epoch": 0.614602561227365, "grad_norm": 0.15426382422447205, "learning_rate": 7.951666820007974e-05, "loss": 0.7351, "mean_token_accuracy": 0.7815495170652866, "num_tokens": 213208726.0, "step": 6680 }, { "entropy": 0.7846670318394899, "epoch": 0.6146945675988063, "grad_norm": 0.15723967552185059, "learning_rate": 7.951360137393812e-05, "loss": 0.7709, "mean_token_accuracy": 0.7736463807523251, "num_tokens": 213241003.0, "step": 6681 }, { "entropy": 0.7181870695203543, "epoch": 0.6147865739702474, "grad_norm": 0.15284429490566254, "learning_rate": 7.951053454779649e-05, "loss": 0.7204, "mean_token_accuracy": 0.7873183973133564, "num_tokens": 213273555.0, "step": 6682 }, { "entropy": 0.8903865404427052, "epoch": 0.6148785803416886, "grad_norm": 0.16499221324920654, "learning_rate": 7.950746772165486e-05, "loss": 0.8839, "mean_token_accuracy": 0.744561068713665, "num_tokens": 213305394.0, "step": 6683 }, { "entropy": 0.8554773721843958, "epoch": 0.6149705867131299, "grad_norm": 0.16370102763175964, "learning_rate": 7.950440089551324e-05, "loss": 0.8358, "mean_token_accuracy": 0.7544255256652832, "num_tokens": 213337374.0, "step": 6684 }, { "entropy": 0.8110974840819836, "epoch": 0.6150625930845711, "grad_norm": 0.1649705022573471, "learning_rate": 7.950133406937161e-05, "loss": 0.7952, "mean_token_accuracy": 0.7710266672074795, "num_tokens": 213368833.0, "step": 6685 }, { "entropy": 0.695953119546175, "epoch": 0.6151545994560124, "grad_norm": 0.1548963338136673, "learning_rate": 7.949826724322999e-05, "loss": 0.6681, "mean_token_accuracy": 0.8007498905062675, "num_tokens": 213401416.0, "step": 6686 }, { "entropy": 0.6630786471068859, "epoch": 0.6152466058274535, "grad_norm": 0.15383850038051605, "learning_rate": 7.949520041708836e-05, "loss": 0.6485, "mean_token_accuracy": 0.8027797676622868, "num_tokens": 213433084.0, "step": 6687 }, { "entropy": 0.7375473603606224, "epoch": 0.6153386121988947, "grad_norm": 0.15622557699680328, "learning_rate": 7.949213359094674e-05, "loss": 0.7189, "mean_token_accuracy": 0.7903090454638004, "num_tokens": 213465537.0, "step": 6688 }, { "entropy": 0.809115007519722, "epoch": 0.615430618570336, "grad_norm": 0.16155385971069336, "learning_rate": 7.948906676480511e-05, "loss": 0.8165, "mean_token_accuracy": 0.7655225470662117, "num_tokens": 213497062.0, "step": 6689 }, { "entropy": 0.7216853126883507, "epoch": 0.6155226249417772, "grad_norm": 0.15770000219345093, "learning_rate": 7.948599993866348e-05, "loss": 0.7123, "mean_token_accuracy": 0.7844072617590427, "num_tokens": 213528920.0, "step": 6690 }, { "entropy": 0.805900314822793, "epoch": 0.6156146313132185, "grad_norm": 0.1637885570526123, "learning_rate": 7.948293311252186e-05, "loss": 0.8134, "mean_token_accuracy": 0.7633961923420429, "num_tokens": 213560477.0, "step": 6691 }, { "entropy": 0.6967924982309341, "epoch": 0.6157066376846596, "grad_norm": 0.15344934165477753, "learning_rate": 7.947986628638024e-05, "loss": 0.6799, "mean_token_accuracy": 0.7987430393695831, "num_tokens": 213591965.0, "step": 6692 }, { "entropy": 0.7206979300826788, "epoch": 0.6157986440561009, "grad_norm": 0.15963315963745117, "learning_rate": 7.94767994602386e-05, "loss": 0.7064, "mean_token_accuracy": 0.792344756424427, "num_tokens": 213623869.0, "step": 6693 }, { "entropy": 0.7227212283760309, "epoch": 0.6158906504275421, "grad_norm": 0.16821858286857605, "learning_rate": 7.947373263409697e-05, "loss": 0.7216, "mean_token_accuracy": 0.7940166145563126, "num_tokens": 213655579.0, "step": 6694 }, { "entropy": 0.7848414722830057, "epoch": 0.6159826567989833, "grad_norm": 0.16077552735805511, "learning_rate": 7.947066580795534e-05, "loss": 0.7661, "mean_token_accuracy": 0.7741433382034302, "num_tokens": 213687618.0, "step": 6695 }, { "entropy": 0.8260849863290787, "epoch": 0.6160746631704246, "grad_norm": 0.1560659110546112, "learning_rate": 7.946759898181372e-05, "loss": 0.8267, "mean_token_accuracy": 0.7596490271389484, "num_tokens": 213719067.0, "step": 6696 }, { "entropy": 0.7098764274269342, "epoch": 0.6161666695418657, "grad_norm": 0.1519925743341446, "learning_rate": 7.94645321556721e-05, "loss": 0.6994, "mean_token_accuracy": 0.7905419431626797, "num_tokens": 213750495.0, "step": 6697 }, { "entropy": 0.6637931130826473, "epoch": 0.616258675913307, "grad_norm": 0.1436561793088913, "learning_rate": 7.946146532953047e-05, "loss": 0.6518, "mean_token_accuracy": 0.8053735196590424, "num_tokens": 213782898.0, "step": 6698 }, { "entropy": 0.6287126056849957, "epoch": 0.6163506822847482, "grad_norm": 0.1506662368774414, "learning_rate": 7.945839850338884e-05, "loss": 0.6173, "mean_token_accuracy": 0.8148605041205883, "num_tokens": 213815043.0, "step": 6699 }, { "entropy": 0.7495789509266615, "epoch": 0.6164426886561895, "grad_norm": 0.1631496697664261, "learning_rate": 7.945533167724722e-05, "loss": 0.7455, "mean_token_accuracy": 0.7836047112941742, "num_tokens": 213846564.0, "step": 6700 }, { "entropy": 0.7329547945410013, "epoch": 0.6165346950276307, "grad_norm": 0.16513626277446747, "learning_rate": 7.945226485110559e-05, "loss": 0.7499, "mean_token_accuracy": 0.7799383290112019, "num_tokens": 213878611.0, "step": 6701 }, { "entropy": 0.7501567918807268, "epoch": 0.6166267013990718, "grad_norm": 0.15389791131019592, "learning_rate": 7.944919802496397e-05, "loss": 0.739, "mean_token_accuracy": 0.7811522856354713, "num_tokens": 213910693.0, "step": 6702 }, { "entropy": 0.8840440530329943, "epoch": 0.6167187077705131, "grad_norm": 0.1656116098165512, "learning_rate": 7.944613119882234e-05, "loss": 0.8804, "mean_token_accuracy": 0.7519614659249783, "num_tokens": 213942658.0, "step": 6703 }, { "entropy": 0.7811522874981165, "epoch": 0.6168107141419543, "grad_norm": 0.16462330520153046, "learning_rate": 7.944306437268072e-05, "loss": 0.7812, "mean_token_accuracy": 0.7719383202493191, "num_tokens": 213974784.0, "step": 6704 }, { "entropy": 0.8219312131404877, "epoch": 0.6169027205133956, "grad_norm": 0.1584533005952835, "learning_rate": 7.943999754653909e-05, "loss": 0.8231, "mean_token_accuracy": 0.7596194297075272, "num_tokens": 214006342.0, "step": 6705 }, { "entropy": 0.7447625692002475, "epoch": 0.6169947268848368, "grad_norm": 0.15236474573612213, "learning_rate": 7.943693072039746e-05, "loss": 0.7043, "mean_token_accuracy": 0.788930419832468, "num_tokens": 214037928.0, "step": 6706 }, { "entropy": 0.766594223678112, "epoch": 0.617086733256278, "grad_norm": 0.15700729191303253, "learning_rate": 7.943386389425584e-05, "loss": 0.7434, "mean_token_accuracy": 0.7784983292222023, "num_tokens": 214070030.0, "step": 6707 }, { "entropy": 0.8637153636664152, "epoch": 0.6171787396277192, "grad_norm": 0.17324534058570862, "learning_rate": 7.943079706811422e-05, "loss": 0.8466, "mean_token_accuracy": 0.756608173251152, "num_tokens": 214100445.0, "step": 6708 }, { "entropy": 0.7123164003714919, "epoch": 0.6172707459991604, "grad_norm": 0.1634848266839981, "learning_rate": 7.942773024197259e-05, "loss": 0.6874, "mean_token_accuracy": 0.7985459677875042, "num_tokens": 214132325.0, "step": 6709 }, { "entropy": 0.6442468278110027, "epoch": 0.6173627523706017, "grad_norm": 0.15998108685016632, "learning_rate": 7.942466341583095e-05, "loss": 0.6206, "mean_token_accuracy": 0.8197076730430126, "num_tokens": 214165083.0, "step": 6710 }, { "entropy": 0.7139595858752728, "epoch": 0.6174547587420429, "grad_norm": 0.16014178097248077, "learning_rate": 7.942159658968932e-05, "loss": 0.6953, "mean_token_accuracy": 0.7940150760114193, "num_tokens": 214196818.0, "step": 6711 }, { "entropy": 0.7301435172557831, "epoch": 0.6175467651134842, "grad_norm": 0.15928678214550018, "learning_rate": 7.941852976354772e-05, "loss": 0.7151, "mean_token_accuracy": 0.7922415211796761, "num_tokens": 214229150.0, "step": 6712 }, { "entropy": 0.8504659794270992, "epoch": 0.6176387714849253, "grad_norm": 0.16543731093406677, "learning_rate": 7.941546293740609e-05, "loss": 0.8433, "mean_token_accuracy": 0.7567204795777798, "num_tokens": 214260673.0, "step": 6713 }, { "entropy": 0.6974145155400038, "epoch": 0.6177307778563665, "grad_norm": 0.15512768924236298, "learning_rate": 7.941239611126445e-05, "loss": 0.6924, "mean_token_accuracy": 0.7959916442632675, "num_tokens": 214293313.0, "step": 6714 }, { "entropy": 0.7234057355672121, "epoch": 0.6178227842278078, "grad_norm": 0.15369302034378052, "learning_rate": 7.940932928512283e-05, "loss": 0.7305, "mean_token_accuracy": 0.7848366536200047, "num_tokens": 214325460.0, "step": 6715 }, { "entropy": 0.7263442724943161, "epoch": 0.617914790599249, "grad_norm": 0.15960194170475006, "learning_rate": 7.94062624589812e-05, "loss": 0.7135, "mean_token_accuracy": 0.7905375324189663, "num_tokens": 214357586.0, "step": 6716 }, { "entropy": 0.728422062471509, "epoch": 0.6180067969706903, "grad_norm": 0.15352429449558258, "learning_rate": 7.940319563283958e-05, "loss": 0.7258, "mean_token_accuracy": 0.7833450548350811, "num_tokens": 214389766.0, "step": 6717 }, { "entropy": 0.6801940575242043, "epoch": 0.6180988033421314, "grad_norm": 0.14927871525287628, "learning_rate": 7.940012880669795e-05, "loss": 0.6543, "mean_token_accuracy": 0.8064284063875675, "num_tokens": 214422347.0, "step": 6718 }, { "entropy": 0.7854325901716948, "epoch": 0.6181908097135727, "grad_norm": 0.1509893834590912, "learning_rate": 7.939706198055633e-05, "loss": 0.7622, "mean_token_accuracy": 0.774943120777607, "num_tokens": 214454703.0, "step": 6719 }, { "entropy": 0.5866229049861431, "epoch": 0.6182828160850139, "grad_norm": 0.14780539274215698, "learning_rate": 7.93939951544147e-05, "loss": 0.5651, "mean_token_accuracy": 0.828710712492466, "num_tokens": 214486537.0, "step": 6720 }, { "entropy": 0.7499909270554781, "epoch": 0.6183748224564551, "grad_norm": 0.15203291177749634, "learning_rate": 7.939092832827307e-05, "loss": 0.7336, "mean_token_accuracy": 0.7833393178880215, "num_tokens": 214518618.0, "step": 6721 }, { "entropy": 0.7636207491159439, "epoch": 0.6184668288278964, "grad_norm": 0.16210748255252838, "learning_rate": 7.938786150213145e-05, "loss": 0.7752, "mean_token_accuracy": 0.7688848040997982, "num_tokens": 214549843.0, "step": 6722 }, { "entropy": 0.7248553857207298, "epoch": 0.6185588351993375, "grad_norm": 0.15208932757377625, "learning_rate": 7.938479467598983e-05, "loss": 0.7199, "mean_token_accuracy": 0.7879243865609169, "num_tokens": 214582031.0, "step": 6723 }, { "entropy": 0.7467272058129311, "epoch": 0.6186508415707788, "grad_norm": 0.15441957116127014, "learning_rate": 7.93817278498482e-05, "loss": 0.7412, "mean_token_accuracy": 0.7828057669103146, "num_tokens": 214614395.0, "step": 6724 }, { "entropy": 0.8399667646735907, "epoch": 0.61874284794222, "grad_norm": 0.16618867218494415, "learning_rate": 7.937866102370657e-05, "loss": 0.8651, "mean_token_accuracy": 0.7485596351325512, "num_tokens": 214645854.0, "step": 6725 }, { "entropy": 0.8154331967234612, "epoch": 0.6188348543136613, "grad_norm": 0.16737845540046692, "learning_rate": 7.937559419756494e-05, "loss": 0.8157, "mean_token_accuracy": 0.761285588145256, "num_tokens": 214677162.0, "step": 6726 }, { "entropy": 0.7380770165473223, "epoch": 0.6189268606851025, "grad_norm": 0.16386739909648895, "learning_rate": 7.937252737142332e-05, "loss": 0.7067, "mean_token_accuracy": 0.7968107536435127, "num_tokens": 214708406.0, "step": 6727 }, { "entropy": 0.8599573206156492, "epoch": 0.6190188670565436, "grad_norm": 0.16392114758491516, "learning_rate": 7.93694605452817e-05, "loss": 0.8639, "mean_token_accuracy": 0.753508448600769, "num_tokens": 214740306.0, "step": 6728 }, { "entropy": 0.7544430010020733, "epoch": 0.6191108734279849, "grad_norm": 0.16276100277900696, "learning_rate": 7.936639371914007e-05, "loss": 0.7278, "mean_token_accuracy": 0.7864058837294579, "num_tokens": 214772163.0, "step": 6729 }, { "entropy": 0.8282833360135555, "epoch": 0.6192028797994261, "grad_norm": 0.16268663108348846, "learning_rate": 7.936332689299843e-05, "loss": 0.8267, "mean_token_accuracy": 0.7565673775970936, "num_tokens": 214803806.0, "step": 6730 }, { "entropy": 0.8758626598864794, "epoch": 0.6192948861708674, "grad_norm": 0.16480042040348053, "learning_rate": 7.936026006685682e-05, "loss": 0.8766, "mean_token_accuracy": 0.7488462403416634, "num_tokens": 214835753.0, "step": 6731 }, { "entropy": 0.7346856910735369, "epoch": 0.6193868925423086, "grad_norm": 0.17141617834568024, "learning_rate": 7.935719324071518e-05, "loss": 0.7042, "mean_token_accuracy": 0.7899126634001732, "num_tokens": 214867389.0, "step": 6732 }, { "entropy": 0.7739698495715857, "epoch": 0.6194788989137497, "grad_norm": 0.15612143278121948, "learning_rate": 7.935412641457357e-05, "loss": 0.7393, "mean_token_accuracy": 0.7784240245819092, "num_tokens": 214899036.0, "step": 6733 }, { "entropy": 0.7639559935778379, "epoch": 0.619570905285191, "grad_norm": 0.15187835693359375, "learning_rate": 7.935105958843193e-05, "loss": 0.7401, "mean_token_accuracy": 0.789454385638237, "num_tokens": 214931724.0, "step": 6734 }, { "entropy": 0.7359940651804209, "epoch": 0.6196629116566322, "grad_norm": 0.15330474078655243, "learning_rate": 7.934799276229031e-05, "loss": 0.6985, "mean_token_accuracy": 0.7952711135149002, "num_tokens": 214964342.0, "step": 6735 }, { "entropy": 0.7706716414541006, "epoch": 0.6197549180280735, "grad_norm": 0.1610095053911209, "learning_rate": 7.934492593614868e-05, "loss": 0.7558, "mean_token_accuracy": 0.7807918637990952, "num_tokens": 214995919.0, "step": 6736 }, { "entropy": 0.7308923397213221, "epoch": 0.6198469243995147, "grad_norm": 0.15977239608764648, "learning_rate": 7.934185911000705e-05, "loss": 0.7133, "mean_token_accuracy": 0.7927614599466324, "num_tokens": 215027909.0, "step": 6737 }, { "entropy": 0.8325748760253191, "epoch": 0.6199389307709559, "grad_norm": 0.16555453836917877, "learning_rate": 7.933879228386543e-05, "loss": 0.8449, "mean_token_accuracy": 0.7589770741760731, "num_tokens": 215059692.0, "step": 6738 }, { "entropy": 0.733066389337182, "epoch": 0.6200309371423971, "grad_norm": 0.14875823259353638, "learning_rate": 7.933572545772381e-05, "loss": 0.7406, "mean_token_accuracy": 0.7842312715947628, "num_tokens": 215092030.0, "step": 6739 }, { "entropy": 0.7746361326426268, "epoch": 0.6201229435138383, "grad_norm": 0.16020643711090088, "learning_rate": 7.933265863158218e-05, "loss": 0.7616, "mean_token_accuracy": 0.777302872389555, "num_tokens": 215123860.0, "step": 6740 }, { "entropy": 0.6669119019061327, "epoch": 0.6202149498852796, "grad_norm": 0.1550193727016449, "learning_rate": 7.932959180544055e-05, "loss": 0.6593, "mean_token_accuracy": 0.8025464415550232, "num_tokens": 215155860.0, "step": 6741 }, { "entropy": 0.7029689941555262, "epoch": 0.6203069562567208, "grad_norm": 0.15483775734901428, "learning_rate": 7.932652497929892e-05, "loss": 0.6777, "mean_token_accuracy": 0.7994899936020374, "num_tokens": 215187902.0, "step": 6742 }, { "entropy": 0.7680914085358381, "epoch": 0.620398962628162, "grad_norm": 0.1619875282049179, "learning_rate": 7.93234581531573e-05, "loss": 0.7639, "mean_token_accuracy": 0.7799112424254417, "num_tokens": 215219966.0, "step": 6743 }, { "entropy": 0.7040614988654852, "epoch": 0.6204909689996032, "grad_norm": 0.1626894623041153, "learning_rate": 7.932039132701568e-05, "loss": 0.7119, "mean_token_accuracy": 0.7879198007285595, "num_tokens": 215252562.0, "step": 6744 }, { "entropy": 0.8621592372655869, "epoch": 0.6205829753710445, "grad_norm": 0.16349738836288452, "learning_rate": 7.931732450087405e-05, "loss": 0.8755, "mean_token_accuracy": 0.7498246692121029, "num_tokens": 215284529.0, "step": 6745 }, { "entropy": 0.7614856641739607, "epoch": 0.6206749817424857, "grad_norm": 0.16177237033843994, "learning_rate": 7.931425767473243e-05, "loss": 0.789, "mean_token_accuracy": 0.770759079605341, "num_tokens": 215316655.0, "step": 6746 }, { "entropy": 0.8119928613305092, "epoch": 0.6207669881139269, "grad_norm": 0.15764383971691132, "learning_rate": 7.93111908485908e-05, "loss": 0.8014, "mean_token_accuracy": 0.766489140689373, "num_tokens": 215348512.0, "step": 6747 }, { "entropy": 0.8166375029832125, "epoch": 0.6208589944853681, "grad_norm": 0.16113634407520294, "learning_rate": 7.930812402244916e-05, "loss": 0.8123, "mean_token_accuracy": 0.7649001777172089, "num_tokens": 215380715.0, "step": 6748 }, { "entropy": 0.7794091608375311, "epoch": 0.6209510008568093, "grad_norm": 0.15605181455612183, "learning_rate": 7.930505719630755e-05, "loss": 0.7614, "mean_token_accuracy": 0.7754446528851986, "num_tokens": 215412513.0, "step": 6749 }, { "entropy": 0.8341744430363178, "epoch": 0.6210430072282506, "grad_norm": 0.15999920666217804, "learning_rate": 7.930199037016593e-05, "loss": 0.8241, "mean_token_accuracy": 0.7546057216823101, "num_tokens": 215443788.0, "step": 6750 }, { "entropy": 0.8022352326661348, "epoch": 0.6211350135996918, "grad_norm": 0.1583276093006134, "learning_rate": 7.92989235440243e-05, "loss": 0.7907, "mean_token_accuracy": 0.7699604369699955, "num_tokens": 215475652.0, "step": 6751 }, { "entropy": 0.6870643179863691, "epoch": 0.621227019971133, "grad_norm": 0.1608155220746994, "learning_rate": 7.929585671788266e-05, "loss": 0.6843, "mean_token_accuracy": 0.7946553379297256, "num_tokens": 215507477.0, "step": 6752 }, { "entropy": 0.7289262376725674, "epoch": 0.6213190263425742, "grad_norm": 0.15069471299648285, "learning_rate": 7.929278989174103e-05, "loss": 0.7045, "mean_token_accuracy": 0.7938489653170109, "num_tokens": 215539558.0, "step": 6753 }, { "entropy": 0.8418463692069054, "epoch": 0.6214110327140154, "grad_norm": 0.16787347197532654, "learning_rate": 7.928972306559943e-05, "loss": 0.8436, "mean_token_accuracy": 0.7530935406684875, "num_tokens": 215571690.0, "step": 6754 }, { "entropy": 0.8410144690424204, "epoch": 0.6215030390854567, "grad_norm": 0.15951718389987946, "learning_rate": 7.92866562394578e-05, "loss": 0.8278, "mean_token_accuracy": 0.7587366290390491, "num_tokens": 215603618.0, "step": 6755 }, { "entropy": 0.7827683184295893, "epoch": 0.6215950454568979, "grad_norm": 0.15764962136745453, "learning_rate": 7.928358941331616e-05, "loss": 0.7663, "mean_token_accuracy": 0.7765426561236382, "num_tokens": 215635813.0, "step": 6756 }, { "entropy": 0.7340504880994558, "epoch": 0.6216870518283392, "grad_norm": 0.15399989485740662, "learning_rate": 7.928052258717453e-05, "loss": 0.7163, "mean_token_accuracy": 0.7819871976971626, "num_tokens": 215666970.0, "step": 6757 }, { "entropy": 0.6991034634411335, "epoch": 0.6217790581997803, "grad_norm": 0.15240360796451569, "learning_rate": 7.927745576103291e-05, "loss": 0.6916, "mean_token_accuracy": 0.7939918711781502, "num_tokens": 215698972.0, "step": 6758 }, { "entropy": 0.7273062132298946, "epoch": 0.6218710645712215, "grad_norm": 0.15145254135131836, "learning_rate": 7.927438893489129e-05, "loss": 0.7148, "mean_token_accuracy": 0.7904459536075592, "num_tokens": 215731353.0, "step": 6759 }, { "entropy": 0.8560688812285662, "epoch": 0.6219630709426628, "grad_norm": 0.16980017721652985, "learning_rate": 7.927132210874966e-05, "loss": 0.8384, "mean_token_accuracy": 0.7537276819348335, "num_tokens": 215761936.0, "step": 6760 }, { "entropy": 0.768471222370863, "epoch": 0.622055077314104, "grad_norm": 0.15603050589561462, "learning_rate": 7.926825528260803e-05, "loss": 0.7706, "mean_token_accuracy": 0.7728297635912895, "num_tokens": 215794178.0, "step": 6761 }, { "entropy": 0.7437111400067806, "epoch": 0.6221470836855453, "grad_norm": 0.16461385786533356, "learning_rate": 7.926518845646641e-05, "loss": 0.7297, "mean_token_accuracy": 0.7809272930026054, "num_tokens": 215826106.0, "step": 6762 }, { "entropy": 0.8479232639074326, "epoch": 0.6222390900569864, "grad_norm": 0.15566486120224, "learning_rate": 7.926212163032478e-05, "loss": 0.8447, "mean_token_accuracy": 0.758796114474535, "num_tokens": 215858450.0, "step": 6763 }, { "entropy": 0.8511785808950663, "epoch": 0.6223310964284277, "grad_norm": 0.16404849290847778, "learning_rate": 7.925905480418316e-05, "loss": 0.8624, "mean_token_accuracy": 0.7485533505678177, "num_tokens": 215890660.0, "step": 6764 }, { "entropy": 0.7507437039166689, "epoch": 0.6224231027998689, "grad_norm": 0.15571902692317963, "learning_rate": 7.925598797804153e-05, "loss": 0.735, "mean_token_accuracy": 0.7806402035057545, "num_tokens": 215922618.0, "step": 6765 }, { "entropy": 0.900667816400528, "epoch": 0.6225151091713101, "grad_norm": 0.15668095648288727, "learning_rate": 7.925292115189991e-05, "loss": 0.8753, "mean_token_accuracy": 0.7424122765660286, "num_tokens": 215954544.0, "step": 6766 }, { "entropy": 0.757878364995122, "epoch": 0.6226071155427514, "grad_norm": 0.15232200920581818, "learning_rate": 7.924985432575828e-05, "loss": 0.7227, "mean_token_accuracy": 0.7854220196604729, "num_tokens": 215986205.0, "step": 6767 }, { "entropy": 0.7610921822488308, "epoch": 0.6226991219141925, "grad_norm": 0.154471293091774, "learning_rate": 7.924678749961664e-05, "loss": 0.7488, "mean_token_accuracy": 0.7755735032260418, "num_tokens": 216017767.0, "step": 6768 }, { "entropy": 0.8493087366223335, "epoch": 0.6227911282856338, "grad_norm": 0.16567689180374146, "learning_rate": 7.924372067347503e-05, "loss": 0.829, "mean_token_accuracy": 0.7559348531067371, "num_tokens": 216049538.0, "step": 6769 }, { "entropy": 0.7359444200992584, "epoch": 0.622883134657075, "grad_norm": 0.16701947152614594, "learning_rate": 7.92406538473334e-05, "loss": 0.7293, "mean_token_accuracy": 0.7925218380987644, "num_tokens": 216082047.0, "step": 6770 }, { "entropy": 0.7458947226405144, "epoch": 0.6229751410285163, "grad_norm": 0.15825822949409485, "learning_rate": 7.923758702119177e-05, "loss": 0.7342, "mean_token_accuracy": 0.7826673537492752, "num_tokens": 216114009.0, "step": 6771 }, { "entropy": 0.7519962266087532, "epoch": 0.6230671473999575, "grad_norm": 0.15698567032814026, "learning_rate": 7.923452019505014e-05, "loss": 0.7448, "mean_token_accuracy": 0.7802510559558868, "num_tokens": 216146090.0, "step": 6772 }, { "entropy": 0.6741875223815441, "epoch": 0.6231591537713986, "grad_norm": 0.1585148721933365, "learning_rate": 7.923145336890852e-05, "loss": 0.6732, "mean_token_accuracy": 0.7993123009800911, "num_tokens": 216178167.0, "step": 6773 }, { "entropy": 0.7290232963860035, "epoch": 0.6232511601428399, "grad_norm": 0.15242509543895721, "learning_rate": 7.922838654276689e-05, "loss": 0.722, "mean_token_accuracy": 0.7827555313706398, "num_tokens": 216210340.0, "step": 6774 }, { "entropy": 0.8048685397952795, "epoch": 0.6233431665142811, "grad_norm": 0.165812149643898, "learning_rate": 7.922531971662527e-05, "loss": 0.8099, "mean_token_accuracy": 0.7663775086402893, "num_tokens": 216242438.0, "step": 6775 }, { "entropy": 0.815949697047472, "epoch": 0.6234351728857224, "grad_norm": 0.16318587958812714, "learning_rate": 7.922225289048364e-05, "loss": 0.8019, "mean_token_accuracy": 0.7687718905508518, "num_tokens": 216274538.0, "step": 6776 }, { "entropy": 0.6879681898280978, "epoch": 0.6235271792571636, "grad_norm": 0.15095527470111847, "learning_rate": 7.921918606434202e-05, "loss": 0.6641, "mean_token_accuracy": 0.8015441931784153, "num_tokens": 216306838.0, "step": 6777 }, { "entropy": 0.8062553387135267, "epoch": 0.6236191856286047, "grad_norm": 0.16492879390716553, "learning_rate": 7.921611923820039e-05, "loss": 0.8134, "mean_token_accuracy": 0.7674841918051243, "num_tokens": 216338691.0, "step": 6778 }, { "entropy": 0.7469684053212404, "epoch": 0.623711192000046, "grad_norm": 0.16101548075675964, "learning_rate": 7.921305241205876e-05, "loss": 0.7408, "mean_token_accuracy": 0.7790977358818054, "num_tokens": 216369809.0, "step": 6779 }, { "entropy": 0.7081315964460373, "epoch": 0.6238031983714872, "grad_norm": 0.17062845826148987, "learning_rate": 7.920998558591714e-05, "loss": 0.7001, "mean_token_accuracy": 0.7941737547516823, "num_tokens": 216401922.0, "step": 6780 }, { "entropy": 0.7321723215281963, "epoch": 0.6238952047429285, "grad_norm": 0.1679207980632782, "learning_rate": 7.920691875977552e-05, "loss": 0.7281, "mean_token_accuracy": 0.7900229394435883, "num_tokens": 216434023.0, "step": 6781 }, { "entropy": 0.6677673235535622, "epoch": 0.6239872111143697, "grad_norm": 0.1644304096698761, "learning_rate": 7.920385193363389e-05, "loss": 0.6849, "mean_token_accuracy": 0.7998153232038021, "num_tokens": 216465734.0, "step": 6782 }, { "entropy": 0.7502274494618177, "epoch": 0.6240792174858109, "grad_norm": 0.15578198432922363, "learning_rate": 7.920078510749226e-05, "loss": 0.7497, "mean_token_accuracy": 0.7836160399019718, "num_tokens": 216497723.0, "step": 6783 }, { "entropy": 0.7417934341356158, "epoch": 0.6241712238572521, "grad_norm": 0.15463289618492126, "learning_rate": 7.919771828135062e-05, "loss": 0.7271, "mean_token_accuracy": 0.7892079576849937, "num_tokens": 216529645.0, "step": 6784 }, { "entropy": 0.6994147878140211, "epoch": 0.6242632302286933, "grad_norm": 0.15036335587501526, "learning_rate": 7.9194651455209e-05, "loss": 0.6546, "mean_token_accuracy": 0.7993792966008186, "num_tokens": 216561097.0, "step": 6785 }, { "entropy": 0.7217270713299513, "epoch": 0.6243552366001346, "grad_norm": 0.15878333151340485, "learning_rate": 7.919158462906739e-05, "loss": 0.6912, "mean_token_accuracy": 0.7951253950595856, "num_tokens": 216592793.0, "step": 6786 }, { "entropy": 0.7276176642626524, "epoch": 0.6244472429715758, "grad_norm": 0.14991648495197296, "learning_rate": 7.918851780292576e-05, "loss": 0.711, "mean_token_accuracy": 0.7878313548862934, "num_tokens": 216624558.0, "step": 6787 }, { "entropy": 0.7211491651833057, "epoch": 0.624539249343017, "grad_norm": 0.1579214334487915, "learning_rate": 7.918545097678412e-05, "loss": 0.6942, "mean_token_accuracy": 0.7944667860865593, "num_tokens": 216655880.0, "step": 6788 }, { "entropy": 0.7903389651328325, "epoch": 0.6246312557144582, "grad_norm": 0.16445203125476837, "learning_rate": 7.91823841506425e-05, "loss": 0.7642, "mean_token_accuracy": 0.7738910727202892, "num_tokens": 216687643.0, "step": 6789 }, { "entropy": 0.8529907502233982, "epoch": 0.6247232620858995, "grad_norm": 0.165459543466568, "learning_rate": 7.917931732450087e-05, "loss": 0.8491, "mean_token_accuracy": 0.7620854116976261, "num_tokens": 216719832.0, "step": 6790 }, { "entropy": 0.7955469284206629, "epoch": 0.6248152684573407, "grad_norm": 0.161915123462677, "learning_rate": 7.917625049835925e-05, "loss": 0.7935, "mean_token_accuracy": 0.7717696614563465, "num_tokens": 216752600.0, "step": 6791 }, { "entropy": 0.841705746948719, "epoch": 0.624907274828782, "grad_norm": 0.16632582247257233, "learning_rate": 7.917318367221762e-05, "loss": 0.8446, "mean_token_accuracy": 0.7487368285655975, "num_tokens": 216783251.0, "step": 6792 }, { "entropy": 0.7894716449081898, "epoch": 0.6249992812002231, "grad_norm": 0.16795331239700317, "learning_rate": 7.9170116846076e-05, "loss": 0.7955, "mean_token_accuracy": 0.7663572318851948, "num_tokens": 216814847.0, "step": 6793 }, { "entropy": 0.8296987824141979, "epoch": 0.6250912875716643, "grad_norm": 0.15142075717449188, "learning_rate": 7.916705001993437e-05, "loss": 0.8173, "mean_token_accuracy": 0.7611150220036507, "num_tokens": 216846864.0, "step": 6794 }, { "entropy": 0.7650800440460443, "epoch": 0.6251832939431056, "grad_norm": 0.1654403656721115, "learning_rate": 7.916398319379274e-05, "loss": 0.7548, "mean_token_accuracy": 0.7747060060501099, "num_tokens": 216877779.0, "step": 6795 }, { "entropy": 0.7189792711287737, "epoch": 0.6252753003145468, "grad_norm": 0.15077261626720428, "learning_rate": 7.916091636765112e-05, "loss": 0.7079, "mean_token_accuracy": 0.7914016470313072, "num_tokens": 216909830.0, "step": 6796 }, { "entropy": 0.8146858550608158, "epoch": 0.6253673066859881, "grad_norm": 0.15654398500919342, "learning_rate": 7.91578495415095e-05, "loss": 0.7922, "mean_token_accuracy": 0.769200723618269, "num_tokens": 216942069.0, "step": 6797 }, { "entropy": 0.7513052355498075, "epoch": 0.6254593130574292, "grad_norm": 0.15517500042915344, "learning_rate": 7.915478271536787e-05, "loss": 0.7288, "mean_token_accuracy": 0.7860465385019779, "num_tokens": 216973631.0, "step": 6798 }, { "entropy": 0.7871745154261589, "epoch": 0.6255513194288704, "grad_norm": 0.15914158523082733, "learning_rate": 7.915171588922624e-05, "loss": 0.7681, "mean_token_accuracy": 0.7780463807284832, "num_tokens": 217006192.0, "step": 6799 }, { "entropy": 0.7305289655923843, "epoch": 0.6256433258003117, "grad_norm": 0.1507120281457901, "learning_rate": 7.914864906308462e-05, "loss": 0.715, "mean_token_accuracy": 0.788003608584404, "num_tokens": 217037904.0, "step": 6800 }, { "entropy": 0.7408063225448132, "epoch": 0.6257353321717529, "grad_norm": 0.15471401810646057, "learning_rate": 7.9145582236943e-05, "loss": 0.73, "mean_token_accuracy": 0.779632568359375, "num_tokens": 217069413.0, "step": 6801 }, { "entropy": 0.9204970262944698, "epoch": 0.6258273385431942, "grad_norm": 0.18115924298763275, "learning_rate": 7.914251541080137e-05, "loss": 0.9274, "mean_token_accuracy": 0.7329103872179985, "num_tokens": 217100663.0, "step": 6802 }, { "entropy": 0.7298220545053482, "epoch": 0.6259193449146353, "grad_norm": 0.1613893061876297, "learning_rate": 7.913944858465974e-05, "loss": 0.7028, "mean_token_accuracy": 0.7888923026621342, "num_tokens": 217132094.0, "step": 6803 }, { "entropy": 0.7790422085672617, "epoch": 0.6260113512860765, "grad_norm": 0.16577018797397614, "learning_rate": 7.913638175851812e-05, "loss": 0.7909, "mean_token_accuracy": 0.7707245722413063, "num_tokens": 217164011.0, "step": 6804 }, { "entropy": 0.6506985127925873, "epoch": 0.6261033576575178, "grad_norm": 0.15459588170051575, "learning_rate": 7.913331493237649e-05, "loss": 0.6538, "mean_token_accuracy": 0.8059298247098923, "num_tokens": 217195334.0, "step": 6805 }, { "entropy": 0.7628348264843225, "epoch": 0.626195364028959, "grad_norm": 0.16382087767124176, "learning_rate": 7.913024810623487e-05, "loss": 0.7707, "mean_token_accuracy": 0.7758900672197342, "num_tokens": 217226718.0, "step": 6806 }, { "entropy": 0.7917848154902458, "epoch": 0.6262873704004003, "grad_norm": 0.15672647953033447, "learning_rate": 7.912718128009323e-05, "loss": 0.783, "mean_token_accuracy": 0.7749223932623863, "num_tokens": 217257933.0, "step": 6807 }, { "entropy": 0.718776598572731, "epoch": 0.6263793767718414, "grad_norm": 0.16079722344875336, "learning_rate": 7.912411445395162e-05, "loss": 0.717, "mean_token_accuracy": 0.788719467818737, "num_tokens": 217289259.0, "step": 6808 }, { "entropy": 0.7844743058085442, "epoch": 0.6264713831432827, "grad_norm": 0.1588796079158783, "learning_rate": 7.912104762780998e-05, "loss": 0.7585, "mean_token_accuracy": 0.7767906226217747, "num_tokens": 217321444.0, "step": 6809 }, { "entropy": 0.6078992709517479, "epoch": 0.6265633895147239, "grad_norm": 0.14387331902980804, "learning_rate": 7.911798080166835e-05, "loss": 0.5859, "mean_token_accuracy": 0.8216252252459526, "num_tokens": 217353204.0, "step": 6810 }, { "entropy": 0.7999612856656313, "epoch": 0.6266553958861651, "grad_norm": 0.15916189551353455, "learning_rate": 7.911491397552673e-05, "loss": 0.7823, "mean_token_accuracy": 0.7695694677531719, "num_tokens": 217384448.0, "step": 6811 }, { "entropy": 0.7436028923839331, "epoch": 0.6267474022576064, "grad_norm": 0.1641596108675003, "learning_rate": 7.911184714938511e-05, "loss": 0.7348, "mean_token_accuracy": 0.7857553139328957, "num_tokens": 217416748.0, "step": 6812 }, { "entropy": 0.7308945395052433, "epoch": 0.6268394086290475, "grad_norm": 0.1633182168006897, "learning_rate": 7.910878032324348e-05, "loss": 0.7153, "mean_token_accuracy": 0.7894206680357456, "num_tokens": 217448425.0, "step": 6813 }, { "entropy": 0.6952079758048058, "epoch": 0.6269314150004888, "grad_norm": 0.1505056470632553, "learning_rate": 7.910571349710185e-05, "loss": 0.6746, "mean_token_accuracy": 0.7966642156243324, "num_tokens": 217480411.0, "step": 6814 }, { "entropy": 0.8412358984351158, "epoch": 0.62702342137193, "grad_norm": 0.16115662455558777, "learning_rate": 7.910264667096022e-05, "loss": 0.8475, "mean_token_accuracy": 0.7538891583681107, "num_tokens": 217512734.0, "step": 6815 }, { "entropy": 0.7000873442739248, "epoch": 0.6271154277433713, "grad_norm": 0.1486492156982422, "learning_rate": 7.90995798448186e-05, "loss": 0.6867, "mean_token_accuracy": 0.7972451560199261, "num_tokens": 217544674.0, "step": 6816 }, { "entropy": 0.7547997646033764, "epoch": 0.6272074341148125, "grad_norm": 0.1567060500383377, "learning_rate": 7.909651301867698e-05, "loss": 0.7499, "mean_token_accuracy": 0.7802022285759449, "num_tokens": 217576721.0, "step": 6817 }, { "entropy": 0.8410606849938631, "epoch": 0.6272994404862536, "grad_norm": 0.15369021892547607, "learning_rate": 7.909344619253535e-05, "loss": 0.8253, "mean_token_accuracy": 0.7601376883685589, "num_tokens": 217608912.0, "step": 6818 }, { "entropy": 0.8698541168123484, "epoch": 0.6273914468576949, "grad_norm": 0.16305553913116455, "learning_rate": 7.909037936639372e-05, "loss": 0.8457, "mean_token_accuracy": 0.7591158896684647, "num_tokens": 217641266.0, "step": 6819 }, { "entropy": 0.7007640991359949, "epoch": 0.6274834532291361, "grad_norm": 0.14975759387016296, "learning_rate": 7.90873125402521e-05, "loss": 0.7026, "mean_token_accuracy": 0.7920554205775261, "num_tokens": 217673297.0, "step": 6820 }, { "entropy": 0.7700629774481058, "epoch": 0.6275754596005774, "grad_norm": 0.14894677698612213, "learning_rate": 7.908424571411047e-05, "loss": 0.7544, "mean_token_accuracy": 0.7757166363298893, "num_tokens": 217704569.0, "step": 6821 }, { "entropy": 0.597959715873003, "epoch": 0.6276674659720186, "grad_norm": 0.1555832475423813, "learning_rate": 7.908117888796885e-05, "loss": 0.5834, "mean_token_accuracy": 0.821891687810421, "num_tokens": 217736630.0, "step": 6822 }, { "entropy": 0.7467452492564917, "epoch": 0.6277594723434597, "grad_norm": 0.1544766128063202, "learning_rate": 7.907811206182722e-05, "loss": 0.726, "mean_token_accuracy": 0.7832550629973412, "num_tokens": 217768532.0, "step": 6823 }, { "entropy": 0.7202938888221979, "epoch": 0.627851478714901, "grad_norm": 0.14746391773223877, "learning_rate": 7.90750452356856e-05, "loss": 0.6838, "mean_token_accuracy": 0.7998668737709522, "num_tokens": 217801249.0, "step": 6824 }, { "entropy": 0.8528883941471577, "epoch": 0.6279434850863422, "grad_norm": 0.16646473109722137, "learning_rate": 7.907197840954396e-05, "loss": 0.862, "mean_token_accuracy": 0.7483476661145687, "num_tokens": 217833049.0, "step": 6825 }, { "entropy": 0.7985125426203012, "epoch": 0.6280354914577835, "grad_norm": 0.1564498096704483, "learning_rate": 7.906891158340233e-05, "loss": 0.7872, "mean_token_accuracy": 0.7687594704329967, "num_tokens": 217865500.0, "step": 6826 }, { "entropy": 0.626744874753058, "epoch": 0.6281274978292247, "grad_norm": 0.1621852070093155, "learning_rate": 7.906584475726071e-05, "loss": 0.6253, "mean_token_accuracy": 0.8161138668656349, "num_tokens": 217898155.0, "step": 6827 }, { "entropy": 0.7434835694730282, "epoch": 0.6282195042006659, "grad_norm": 0.1637037843465805, "learning_rate": 7.90627779311191e-05, "loss": 0.7473, "mean_token_accuracy": 0.7808829993009567, "num_tokens": 217930501.0, "step": 6828 }, { "entropy": 0.8433907041326165, "epoch": 0.6283115105721071, "grad_norm": 0.16378933191299438, "learning_rate": 7.905971110497746e-05, "loss": 0.8367, "mean_token_accuracy": 0.7559948936104774, "num_tokens": 217962416.0, "step": 6829 }, { "entropy": 0.6484341975301504, "epoch": 0.6284035169435483, "grad_norm": 0.1571919173002243, "learning_rate": 7.905664427883583e-05, "loss": 0.6461, "mean_token_accuracy": 0.8007880486547947, "num_tokens": 217994561.0, "step": 6830 }, { "entropy": 0.7759687751531601, "epoch": 0.6284955233149896, "grad_norm": 0.16274134814739227, "learning_rate": 7.90535774526942e-05, "loss": 0.7651, "mean_token_accuracy": 0.7778013944625854, "num_tokens": 218026490.0, "step": 6831 }, { "entropy": 0.6445892713963985, "epoch": 0.6285875296864308, "grad_norm": 0.15866823494434357, "learning_rate": 7.90505106265526e-05, "loss": 0.633, "mean_token_accuracy": 0.8145731277763844, "num_tokens": 218059056.0, "step": 6832 }, { "entropy": 0.7827423438429832, "epoch": 0.628679536057872, "grad_norm": 0.15436352789402008, "learning_rate": 7.904744380041096e-05, "loss": 0.7584, "mean_token_accuracy": 0.7757160887122154, "num_tokens": 218091243.0, "step": 6833 }, { "entropy": 0.8432838656008244, "epoch": 0.6287715424293132, "grad_norm": 0.16385851800441742, "learning_rate": 7.904437697426933e-05, "loss": 0.8288, "mean_token_accuracy": 0.7540723085403442, "num_tokens": 218123429.0, "step": 6834 }, { "entropy": 0.754454730078578, "epoch": 0.6288635488007545, "grad_norm": 0.1590820997953415, "learning_rate": 7.904131014812771e-05, "loss": 0.7411, "mean_token_accuracy": 0.7838918901979923, "num_tokens": 218155631.0, "step": 6835 }, { "entropy": 0.7973548173904419, "epoch": 0.6289555551721957, "grad_norm": 0.16178680956363678, "learning_rate": 7.903824332198608e-05, "loss": 0.8031, "mean_token_accuracy": 0.7671519890427589, "num_tokens": 218187805.0, "step": 6836 }, { "entropy": 0.7836390100419521, "epoch": 0.629047561543637, "grad_norm": 0.15806341171264648, "learning_rate": 7.903517649584446e-05, "loss": 0.7675, "mean_token_accuracy": 0.7758978009223938, "num_tokens": 218219142.0, "step": 6837 }, { "entropy": 0.8752648010849953, "epoch": 0.6291395679150781, "grad_norm": 0.16525588929653168, "learning_rate": 7.903210966970283e-05, "loss": 0.8566, "mean_token_accuracy": 0.7486743927001953, "num_tokens": 218250808.0, "step": 6838 }, { "entropy": 0.7539007645100355, "epoch": 0.6292315742865193, "grad_norm": 0.15580390393733978, "learning_rate": 7.902904284356121e-05, "loss": 0.7359, "mean_token_accuracy": 0.783685214817524, "num_tokens": 218281939.0, "step": 6839 }, { "entropy": 0.6400251686573029, "epoch": 0.6293235806579606, "grad_norm": 0.14696282148361206, "learning_rate": 7.902597601741958e-05, "loss": 0.6081, "mean_token_accuracy": 0.8175961039960384, "num_tokens": 218314295.0, "step": 6840 }, { "entropy": 0.78320736810565, "epoch": 0.6294155870294018, "grad_norm": 0.167501300573349, "learning_rate": 7.902290919127795e-05, "loss": 0.7691, "mean_token_accuracy": 0.774752888828516, "num_tokens": 218345953.0, "step": 6841 }, { "entropy": 0.7910546995699406, "epoch": 0.6295075934008431, "grad_norm": 0.15890119969844818, "learning_rate": 7.901984236513633e-05, "loss": 0.7779, "mean_token_accuracy": 0.7720214873552322, "num_tokens": 218378461.0, "step": 6842 }, { "entropy": 0.7603123914450407, "epoch": 0.6295995997722842, "grad_norm": 0.15796591341495514, "learning_rate": 7.901677553899471e-05, "loss": 0.7605, "mean_token_accuracy": 0.7767181545495987, "num_tokens": 218410151.0, "step": 6843 }, { "entropy": 0.8226458206772804, "epoch": 0.6296916061437254, "grad_norm": 0.17515899240970612, "learning_rate": 7.901370871285308e-05, "loss": 0.8361, "mean_token_accuracy": 0.7612378410995007, "num_tokens": 218442120.0, "step": 6844 }, { "entropy": 0.784871868789196, "epoch": 0.6297836125151667, "grad_norm": 0.15517963469028473, "learning_rate": 7.901064188671144e-05, "loss": 0.7964, "mean_token_accuracy": 0.7674767971038818, "num_tokens": 218474713.0, "step": 6845 }, { "entropy": 0.752686619758606, "epoch": 0.6298756188866079, "grad_norm": 0.16173917055130005, "learning_rate": 7.900757506056981e-05, "loss": 0.7377, "mean_token_accuracy": 0.7814323343336582, "num_tokens": 218505943.0, "step": 6846 }, { "entropy": 0.8601666633039713, "epoch": 0.6299676252580492, "grad_norm": 0.16972991824150085, "learning_rate": 7.90045082344282e-05, "loss": 0.8801, "mean_token_accuracy": 0.7426922656595707, "num_tokens": 218538292.0, "step": 6847 }, { "entropy": 0.7626979779452085, "epoch": 0.6300596316294903, "grad_norm": 0.15815889835357666, "learning_rate": 7.900144140828657e-05, "loss": 0.7693, "mean_token_accuracy": 0.7712207846343517, "num_tokens": 218570572.0, "step": 6848 }, { "entropy": 0.650795528665185, "epoch": 0.6301516380009315, "grad_norm": 0.15809403359889984, "learning_rate": 7.899837458214494e-05, "loss": 0.6434, "mean_token_accuracy": 0.8113416954874992, "num_tokens": 218602804.0, "step": 6849 }, { "entropy": 0.8018024731427431, "epoch": 0.6302436443723728, "grad_norm": 0.16238464415073395, "learning_rate": 7.899530775600331e-05, "loss": 0.805, "mean_token_accuracy": 0.7676852494478226, "num_tokens": 218634655.0, "step": 6850 }, { "entropy": 0.6764072310179472, "epoch": 0.630335650743814, "grad_norm": 0.15016017854213715, "learning_rate": 7.899224092986169e-05, "loss": 0.6533, "mean_token_accuracy": 0.8073914498090744, "num_tokens": 218667149.0, "step": 6851 }, { "entropy": 0.7165358234196901, "epoch": 0.6304276571152553, "grad_norm": 0.15035295486450195, "learning_rate": 7.898917410372006e-05, "loss": 0.7016, "mean_token_accuracy": 0.7940278425812721, "num_tokens": 218699733.0, "step": 6852 }, { "entropy": 0.5984758194535971, "epoch": 0.6305196634866964, "grad_norm": 0.14560063183307648, "learning_rate": 7.898610727757844e-05, "loss": 0.5822, "mean_token_accuracy": 0.8264394551515579, "num_tokens": 218732331.0, "step": 6853 }, { "entropy": 0.6276362231001258, "epoch": 0.6306116698581377, "grad_norm": 0.1614423245191574, "learning_rate": 7.898304045143681e-05, "loss": 0.6151, "mean_token_accuracy": 0.8157286271452904, "num_tokens": 218765041.0, "step": 6854 }, { "entropy": 0.730513259768486, "epoch": 0.6307036762295789, "grad_norm": 0.1567246913909912, "learning_rate": 7.897997362529519e-05, "loss": 0.7144, "mean_token_accuracy": 0.78877829387784, "num_tokens": 218797398.0, "step": 6855 }, { "entropy": 0.7758416887372732, "epoch": 0.6307956826010201, "grad_norm": 0.15309035778045654, "learning_rate": 7.897690679915356e-05, "loss": 0.7486, "mean_token_accuracy": 0.7813841924071312, "num_tokens": 218829429.0, "step": 6856 }, { "entropy": 0.711481976788491, "epoch": 0.6308876889724614, "grad_norm": 0.1503920555114746, "learning_rate": 7.897383997301193e-05, "loss": 0.689, "mean_token_accuracy": 0.7956329733133316, "num_tokens": 218860643.0, "step": 6857 }, { "entropy": 0.7894313400611281, "epoch": 0.6309796953439025, "grad_norm": 0.15467482805252075, "learning_rate": 7.897077314687031e-05, "loss": 0.7544, "mean_token_accuracy": 0.7753642685711384, "num_tokens": 218892131.0, "step": 6858 }, { "entropy": 0.7058479264378548, "epoch": 0.6310717017153438, "grad_norm": 0.15322549641132355, "learning_rate": 7.896770632072869e-05, "loss": 0.6819, "mean_token_accuracy": 0.7979259341955185, "num_tokens": 218923818.0, "step": 6859 }, { "entropy": 0.807581352069974, "epoch": 0.631163708086785, "grad_norm": 0.17349445819854736, "learning_rate": 7.896463949458706e-05, "loss": 0.8226, "mean_token_accuracy": 0.763271376490593, "num_tokens": 218955915.0, "step": 6860 }, { "entropy": 0.763004332780838, "epoch": 0.6312557144582263, "grad_norm": 0.1530408412218094, "learning_rate": 7.896157266844543e-05, "loss": 0.7528, "mean_token_accuracy": 0.7780436724424362, "num_tokens": 218988150.0, "step": 6861 }, { "entropy": 0.7093115355819464, "epoch": 0.6313477208296675, "grad_norm": 0.16528967022895813, "learning_rate": 7.895850584230379e-05, "loss": 0.7104, "mean_token_accuracy": 0.7943553626537323, "num_tokens": 219020084.0, "step": 6862 }, { "entropy": 0.7651770375669003, "epoch": 0.6314397272011086, "grad_norm": 0.16754727065563202, "learning_rate": 7.895543901616217e-05, "loss": 0.7499, "mean_token_accuracy": 0.7790952697396278, "num_tokens": 219051099.0, "step": 6863 }, { "entropy": 0.6031515169888735, "epoch": 0.6315317335725499, "grad_norm": 0.15793846547603607, "learning_rate": 7.895237219002056e-05, "loss": 0.5826, "mean_token_accuracy": 0.8288630768656731, "num_tokens": 219083615.0, "step": 6864 }, { "entropy": 0.777523186057806, "epoch": 0.6316237399439911, "grad_norm": 0.1603538691997528, "learning_rate": 7.894930536387892e-05, "loss": 0.7568, "mean_token_accuracy": 0.7788731455802917, "num_tokens": 219116015.0, "step": 6865 }, { "entropy": 0.7567935241386294, "epoch": 0.6317157463154324, "grad_norm": 0.1436605304479599, "learning_rate": 7.89462385377373e-05, "loss": 0.7336, "mean_token_accuracy": 0.7841677628457546, "num_tokens": 219148557.0, "step": 6866 }, { "entropy": 0.7585240807384253, "epoch": 0.6318077526868736, "grad_norm": 0.15620064735412598, "learning_rate": 7.894317171159567e-05, "loss": 0.7348, "mean_token_accuracy": 0.7816766761243343, "num_tokens": 219180882.0, "step": 6867 }, { "entropy": 0.7566265016794205, "epoch": 0.6318997590583147, "grad_norm": 0.15792877972126007, "learning_rate": 7.894010488545404e-05, "loss": 0.7257, "mean_token_accuracy": 0.7830765843391418, "num_tokens": 219212064.0, "step": 6868 }, { "entropy": 0.7926495671272278, "epoch": 0.631991765429756, "grad_norm": 0.15216009318828583, "learning_rate": 7.893703805931242e-05, "loss": 0.7934, "mean_token_accuracy": 0.7698236890137196, "num_tokens": 219244575.0, "step": 6869 }, { "entropy": 0.7504438497126102, "epoch": 0.6320837718011972, "grad_norm": 0.14170676469802856, "learning_rate": 7.89339712331708e-05, "loss": 0.7211, "mean_token_accuracy": 0.7866550423204899, "num_tokens": 219277268.0, "step": 6870 }, { "entropy": 0.6848162338137627, "epoch": 0.6321757781726385, "grad_norm": 0.1524059921503067, "learning_rate": 7.893090440702917e-05, "loss": 0.6852, "mean_token_accuracy": 0.7993138618767262, "num_tokens": 219308165.0, "step": 6871 }, { "entropy": 0.8672268502414227, "epoch": 0.6322677845440797, "grad_norm": 0.16447299718856812, "learning_rate": 7.892783758088754e-05, "loss": 0.8695, "mean_token_accuracy": 0.7438171096146107, "num_tokens": 219339256.0, "step": 6872 }, { "entropy": 0.706127742305398, "epoch": 0.6323597909155209, "grad_norm": 0.15461266040802002, "learning_rate": 7.892477075474591e-05, "loss": 0.7034, "mean_token_accuracy": 0.7962778583168983, "num_tokens": 219371241.0, "step": 6873 }, { "entropy": 0.8098400942981243, "epoch": 0.6324517972869621, "grad_norm": 0.17031319439411163, "learning_rate": 7.89217039286043e-05, "loss": 0.8094, "mean_token_accuracy": 0.7635058127343655, "num_tokens": 219402915.0, "step": 6874 }, { "entropy": 0.6876364629715681, "epoch": 0.6325438036584033, "grad_norm": 0.15097521245479584, "learning_rate": 7.891863710246267e-05, "loss": 0.6996, "mean_token_accuracy": 0.791767843067646, "num_tokens": 219434845.0, "step": 6875 }, { "entropy": 0.6914844606071711, "epoch": 0.6326358100298446, "grad_norm": 0.1577075868844986, "learning_rate": 7.891557027632104e-05, "loss": 0.6697, "mean_token_accuracy": 0.7997679598629475, "num_tokens": 219466591.0, "step": 6876 }, { "entropy": 0.7687974851578474, "epoch": 0.6327278164012858, "grad_norm": 0.16553539037704468, "learning_rate": 7.89125034501794e-05, "loss": 0.7825, "mean_token_accuracy": 0.7728806212544441, "num_tokens": 219498877.0, "step": 6877 }, { "entropy": 0.647903598845005, "epoch": 0.632819822772727, "grad_norm": 0.14612559974193573, "learning_rate": 7.890943662403779e-05, "loss": 0.6291, "mean_token_accuracy": 0.8138858005404472, "num_tokens": 219531030.0, "step": 6878 }, { "entropy": 0.7009576931595802, "epoch": 0.6329118291441682, "grad_norm": 0.1548846960067749, "learning_rate": 7.890636979789617e-05, "loss": 0.6845, "mean_token_accuracy": 0.7955183312296867, "num_tokens": 219563011.0, "step": 6879 }, { "entropy": 0.6400025235489011, "epoch": 0.6330038355156095, "grad_norm": 0.14393669366836548, "learning_rate": 7.890330297175454e-05, "loss": 0.6095, "mean_token_accuracy": 0.8201652355492115, "num_tokens": 219595215.0, "step": 6880 }, { "entropy": 0.7246956834569573, "epoch": 0.6330958418870507, "grad_norm": 0.15411576628684998, "learning_rate": 7.89002361456129e-05, "loss": 0.7136, "mean_token_accuracy": 0.7890480235219002, "num_tokens": 219626876.0, "step": 6881 }, { "entropy": 0.8542935065925121, "epoch": 0.633187848258492, "grad_norm": 0.16094587743282318, "learning_rate": 7.889716931947129e-05, "loss": 0.8363, "mean_token_accuracy": 0.7578501142561436, "num_tokens": 219658077.0, "step": 6882 }, { "entropy": 0.8830975834280252, "epoch": 0.6332798546299331, "grad_norm": 0.16134829819202423, "learning_rate": 7.889410249332965e-05, "loss": 0.8728, "mean_token_accuracy": 0.7446320690214634, "num_tokens": 219690504.0, "step": 6883 }, { "entropy": 0.7369049983099103, "epoch": 0.6333718610013743, "grad_norm": 0.1492011696100235, "learning_rate": 7.889103566718804e-05, "loss": 0.7267, "mean_token_accuracy": 0.7867975607514381, "num_tokens": 219722581.0, "step": 6884 }, { "entropy": 0.7690662890672684, "epoch": 0.6334638673728156, "grad_norm": 0.15343309938907623, "learning_rate": 7.88879688410464e-05, "loss": 0.7558, "mean_token_accuracy": 0.7762762978672981, "num_tokens": 219754010.0, "step": 6885 }, { "entropy": 0.6959979627281427, "epoch": 0.6335558737442568, "grad_norm": 0.15820489823818207, "learning_rate": 7.888490201490478e-05, "loss": 0.689, "mean_token_accuracy": 0.7933076992630959, "num_tokens": 219785509.0, "step": 6886 }, { "entropy": 0.6995438579469919, "epoch": 0.6336478801156981, "grad_norm": 0.15785536170005798, "learning_rate": 7.888183518876315e-05, "loss": 0.6959, "mean_token_accuracy": 0.7934532426297665, "num_tokens": 219817228.0, "step": 6887 }, { "entropy": 0.842024203389883, "epoch": 0.6337398864871392, "grad_norm": 0.16808946430683136, "learning_rate": 7.887876836262152e-05, "loss": 0.8447, "mean_token_accuracy": 0.7533891052007675, "num_tokens": 219849996.0, "step": 6888 }, { "entropy": 0.6365965977311134, "epoch": 0.6338318928585804, "grad_norm": 0.16134296357631683, "learning_rate": 7.88757015364799e-05, "loss": 0.6362, "mean_token_accuracy": 0.8088445849716663, "num_tokens": 219881471.0, "step": 6889 }, { "entropy": 0.7535643242299557, "epoch": 0.6339238992300217, "grad_norm": 0.16724799573421478, "learning_rate": 7.887263471033828e-05, "loss": 0.768, "mean_token_accuracy": 0.7769832350313663, "num_tokens": 219913694.0, "step": 6890 }, { "entropy": 0.7155507206916809, "epoch": 0.6340159056014629, "grad_norm": 0.1497797966003418, "learning_rate": 7.886956788419665e-05, "loss": 0.7009, "mean_token_accuracy": 0.7904127687215805, "num_tokens": 219946153.0, "step": 6891 }, { "entropy": 0.7289273254573345, "epoch": 0.6341079119729042, "grad_norm": 0.15925821661949158, "learning_rate": 7.886650105805502e-05, "loss": 0.7227, "mean_token_accuracy": 0.7861085422337055, "num_tokens": 219977857.0, "step": 6892 }, { "entropy": 0.7606760635972023, "epoch": 0.6341999183443453, "grad_norm": 0.14937244355678558, "learning_rate": 7.886343423191339e-05, "loss": 0.7354, "mean_token_accuracy": 0.7849611155688763, "num_tokens": 220010021.0, "step": 6893 }, { "entropy": 0.7056446466594934, "epoch": 0.6342919247157865, "grad_norm": 0.15720370411872864, "learning_rate": 7.886036740577177e-05, "loss": 0.6931, "mean_token_accuracy": 0.7940652184188366, "num_tokens": 220041530.0, "step": 6894 }, { "entropy": 0.7483748104423285, "epoch": 0.6343839310872278, "grad_norm": 0.15946544706821442, "learning_rate": 7.885730057963015e-05, "loss": 0.722, "mean_token_accuracy": 0.7928668931126595, "num_tokens": 220074063.0, "step": 6895 }, { "entropy": 0.7201498113572598, "epoch": 0.634475937458669, "grad_norm": 0.14722144603729248, "learning_rate": 7.885423375348852e-05, "loss": 0.6805, "mean_token_accuracy": 0.7994227446615696, "num_tokens": 220106247.0, "step": 6896 }, { "entropy": 0.8181928563863039, "epoch": 0.6345679438301103, "grad_norm": 0.15910127758979797, "learning_rate": 7.88511669273469e-05, "loss": 0.8035, "mean_token_accuracy": 0.7674312442541122, "num_tokens": 220137168.0, "step": 6897 }, { "entropy": 0.7863948121666908, "epoch": 0.6346599502015514, "grad_norm": 0.15939854085445404, "learning_rate": 7.884810010120527e-05, "loss": 0.7903, "mean_token_accuracy": 0.76661242172122, "num_tokens": 220169654.0, "step": 6898 }, { "entropy": 0.7124992497265339, "epoch": 0.6347519565729927, "grad_norm": 0.16192249953746796, "learning_rate": 7.884503327506363e-05, "loss": 0.7105, "mean_token_accuracy": 0.790167510509491, "num_tokens": 220202253.0, "step": 6899 }, { "entropy": 0.7630895804613829, "epoch": 0.6348439629444339, "grad_norm": 0.15378238260746002, "learning_rate": 7.884196644892202e-05, "loss": 0.7675, "mean_token_accuracy": 0.7720111422240734, "num_tokens": 220234525.0, "step": 6900 }, { "entropy": 0.7489477945491672, "epoch": 0.6349359693158751, "grad_norm": 0.17037475109100342, "learning_rate": 7.88388996227804e-05, "loss": 0.7454, "mean_token_accuracy": 0.7808733955025673, "num_tokens": 220266179.0, "step": 6901 }, { "entropy": 0.7576781418174505, "epoch": 0.6350279756873164, "grad_norm": 0.16227898001670837, "learning_rate": 7.883583279663877e-05, "loss": 0.7732, "mean_token_accuracy": 0.7722276411950588, "num_tokens": 220298506.0, "step": 6902 }, { "entropy": 0.6916989833116531, "epoch": 0.6351199820587575, "grad_norm": 0.15824340283870697, "learning_rate": 7.883276597049713e-05, "loss": 0.6859, "mean_token_accuracy": 0.7973580472171307, "num_tokens": 220330749.0, "step": 6903 }, { "entropy": 0.7783776931464672, "epoch": 0.6352119884301988, "grad_norm": 0.15735553205013275, "learning_rate": 7.88296991443555e-05, "loss": 0.7663, "mean_token_accuracy": 0.7793160825967789, "num_tokens": 220363433.0, "step": 6904 }, { "entropy": 0.7449226174503565, "epoch": 0.63530399480164, "grad_norm": 0.155316561460495, "learning_rate": 7.882663231821388e-05, "loss": 0.7295, "mean_token_accuracy": 0.7877831794321537, "num_tokens": 220395601.0, "step": 6905 }, { "entropy": 0.7989328354597092, "epoch": 0.6353960011730813, "grad_norm": 0.1553983837366104, "learning_rate": 7.882356549207226e-05, "loss": 0.7641, "mean_token_accuracy": 0.7741676643490791, "num_tokens": 220428017.0, "step": 6906 }, { "entropy": 0.7869943305850029, "epoch": 0.6354880075445225, "grad_norm": 0.16666008532047272, "learning_rate": 7.882049866593063e-05, "loss": 0.7747, "mean_token_accuracy": 0.7685129009187222, "num_tokens": 220459910.0, "step": 6907 }, { "entropy": 0.6044191587716341, "epoch": 0.6355800139159636, "grad_norm": 0.14952507615089417, "learning_rate": 7.8817431839789e-05, "loss": 0.5736, "mean_token_accuracy": 0.8229855857789516, "num_tokens": 220491355.0, "step": 6908 }, { "entropy": 0.7890926245599985, "epoch": 0.6356720202874049, "grad_norm": 0.16430102288722992, "learning_rate": 7.881436501364738e-05, "loss": 0.7787, "mean_token_accuracy": 0.771955594420433, "num_tokens": 220523756.0, "step": 6909 }, { "entropy": 0.6198111455887556, "epoch": 0.6357640266588461, "grad_norm": 0.15202540159225464, "learning_rate": 7.881129818750575e-05, "loss": 0.6068, "mean_token_accuracy": 0.817258533090353, "num_tokens": 220555967.0, "step": 6910 }, { "entropy": 0.7839644812047482, "epoch": 0.6358560330302874, "grad_norm": 0.15533941984176636, "learning_rate": 7.880823136136413e-05, "loss": 0.7585, "mean_token_accuracy": 0.7738964408636093, "num_tokens": 220587447.0, "step": 6911 }, { "entropy": 0.7597628682851791, "epoch": 0.6359480394017286, "grad_norm": 0.16218988597393036, "learning_rate": 7.88051645352225e-05, "loss": 0.7562, "mean_token_accuracy": 0.7810676880180836, "num_tokens": 220618483.0, "step": 6912 }, { "entropy": 0.7581516318023205, "epoch": 0.6360400457731697, "grad_norm": 0.15725722908973694, "learning_rate": 7.880209770908088e-05, "loss": 0.7388, "mean_token_accuracy": 0.781148586422205, "num_tokens": 220649648.0, "step": 6913 }, { "entropy": 0.8058434017002583, "epoch": 0.636132052144611, "grad_norm": 0.16305983066558838, "learning_rate": 7.879903088293925e-05, "loss": 0.8036, "mean_token_accuracy": 0.7701302319765091, "num_tokens": 220681460.0, "step": 6914 }, { "entropy": 0.6640015691518784, "epoch": 0.6362240585160522, "grad_norm": 0.14963920414447784, "learning_rate": 7.879596405679762e-05, "loss": 0.6377, "mean_token_accuracy": 0.8045287765562534, "num_tokens": 220713950.0, "step": 6915 }, { "entropy": 0.8547518812119961, "epoch": 0.6363160648874935, "grad_norm": 0.15522746741771698, "learning_rate": 7.8792897230656e-05, "loss": 0.8408, "mean_token_accuracy": 0.7520415708422661, "num_tokens": 220746150.0, "step": 6916 }, { "entropy": 0.7502295896410942, "epoch": 0.6364080712589347, "grad_norm": 0.15908190608024597, "learning_rate": 7.878983040451438e-05, "loss": 0.7292, "mean_token_accuracy": 0.7867097072303295, "num_tokens": 220778167.0, "step": 6917 }, { "entropy": 0.6475034076720476, "epoch": 0.6365000776303759, "grad_norm": 0.14975711703300476, "learning_rate": 7.878676357837275e-05, "loss": 0.638, "mean_token_accuracy": 0.8108189776539803, "num_tokens": 220810215.0, "step": 6918 }, { "entropy": 0.7320692390203476, "epoch": 0.6365920840018171, "grad_norm": 0.1596670299768448, "learning_rate": 7.878369675223111e-05, "loss": 0.7396, "mean_token_accuracy": 0.7825630828738213, "num_tokens": 220842746.0, "step": 6919 }, { "entropy": 0.7282084096223116, "epoch": 0.6366840903732583, "grad_norm": 0.15729855000972748, "learning_rate": 7.87806299260895e-05, "loss": 0.7161, "mean_token_accuracy": 0.7874595820903778, "num_tokens": 220873975.0, "step": 6920 }, { "entropy": 0.7019317634403706, "epoch": 0.6367760967446996, "grad_norm": 0.15092310309410095, "learning_rate": 7.877756309994788e-05, "loss": 0.6996, "mean_token_accuracy": 0.7950171530246735, "num_tokens": 220906184.0, "step": 6921 }, { "entropy": 0.7185094300657511, "epoch": 0.6368681031161408, "grad_norm": 0.16186295449733734, "learning_rate": 7.877449627380624e-05, "loss": 0.7165, "mean_token_accuracy": 0.7894270122051239, "num_tokens": 220937505.0, "step": 6922 }, { "entropy": 0.8011875506490469, "epoch": 0.636960109487582, "grad_norm": 0.16271448135375977, "learning_rate": 7.877142944766461e-05, "loss": 0.8075, "mean_token_accuracy": 0.7630279920995235, "num_tokens": 220968342.0, "step": 6923 }, { "entropy": 0.8592997640371323, "epoch": 0.6370521158590232, "grad_norm": 0.16435152292251587, "learning_rate": 7.876836262152298e-05, "loss": 0.8478, "mean_token_accuracy": 0.7527000270783901, "num_tokens": 221000042.0, "step": 6924 }, { "entropy": 0.7696901261806488, "epoch": 0.6371441222304645, "grad_norm": 0.16929267346858978, "learning_rate": 7.876529579538136e-05, "loss": 0.7737, "mean_token_accuracy": 0.7742915563285351, "num_tokens": 221032010.0, "step": 6925 }, { "entropy": 0.7291579004377127, "epoch": 0.6372361286019057, "grad_norm": 0.16437077522277832, "learning_rate": 7.876222896923974e-05, "loss": 0.7092, "mean_token_accuracy": 0.786116998642683, "num_tokens": 221064128.0, "step": 6926 }, { "entropy": 0.7003750130534172, "epoch": 0.637328134973347, "grad_norm": 0.15857945382595062, "learning_rate": 7.875916214309811e-05, "loss": 0.7099, "mean_token_accuracy": 0.7931471616029739, "num_tokens": 221096156.0, "step": 6927 }, { "entropy": 0.7965775765478611, "epoch": 0.6374201413447881, "grad_norm": 0.15748770534992218, "learning_rate": 7.875609531695649e-05, "loss": 0.7778, "mean_token_accuracy": 0.7742580287158489, "num_tokens": 221128145.0, "step": 6928 }, { "entropy": 0.7164390534162521, "epoch": 0.6375121477162293, "grad_norm": 0.1647290587425232, "learning_rate": 7.875302849081486e-05, "loss": 0.7197, "mean_token_accuracy": 0.7878861092031002, "num_tokens": 221159980.0, "step": 6929 }, { "entropy": 0.749900771304965, "epoch": 0.6376041540876706, "grad_norm": 0.16067934036254883, "learning_rate": 7.874996166467323e-05, "loss": 0.7336, "mean_token_accuracy": 0.779102586209774, "num_tokens": 221191535.0, "step": 6930 }, { "entropy": 0.7528647445142269, "epoch": 0.6376961604591118, "grad_norm": 0.15382139384746552, "learning_rate": 7.874689483853161e-05, "loss": 0.7314, "mean_token_accuracy": 0.7839807197451591, "num_tokens": 221223728.0, "step": 6931 }, { "entropy": 0.7213712427765131, "epoch": 0.6377881668305531, "grad_norm": 0.16305390000343323, "learning_rate": 7.874382801238999e-05, "loss": 0.7135, "mean_token_accuracy": 0.7923485487699509, "num_tokens": 221256496.0, "step": 6932 }, { "entropy": 0.707587193697691, "epoch": 0.6378801732019942, "grad_norm": 0.15158496797084808, "learning_rate": 7.874076118624836e-05, "loss": 0.6781, "mean_token_accuracy": 0.8017660863697529, "num_tokens": 221288139.0, "step": 6933 }, { "entropy": 0.6838178746402264, "epoch": 0.6379721795734354, "grad_norm": 0.1562667042016983, "learning_rate": 7.873769436010673e-05, "loss": 0.673, "mean_token_accuracy": 0.7962257191538811, "num_tokens": 221320630.0, "step": 6934 }, { "entropy": 0.6883549690246582, "epoch": 0.6380641859448767, "grad_norm": 0.16248096525669098, "learning_rate": 7.87346275339651e-05, "loss": 0.6646, "mean_token_accuracy": 0.8020828887820244, "num_tokens": 221352974.0, "step": 6935 }, { "entropy": 0.8717504180967808, "epoch": 0.6381561923163179, "grad_norm": 0.1659393459558487, "learning_rate": 7.873156070782348e-05, "loss": 0.8449, "mean_token_accuracy": 0.7571968138217926, "num_tokens": 221385126.0, "step": 6936 }, { "entropy": 0.7857749573886395, "epoch": 0.6382481986877592, "grad_norm": 0.1600053906440735, "learning_rate": 7.872849388168186e-05, "loss": 0.7848, "mean_token_accuracy": 0.766365259885788, "num_tokens": 221417263.0, "step": 6937 }, { "entropy": 0.7336103338748217, "epoch": 0.6383402050592003, "grad_norm": 0.14641864597797394, "learning_rate": 7.872542705554023e-05, "loss": 0.7202, "mean_token_accuracy": 0.7900140732526779, "num_tokens": 221449275.0, "step": 6938 }, { "entropy": 0.7350007332861423, "epoch": 0.6384322114306415, "grad_norm": 0.16301490366458893, "learning_rate": 7.87223602293986e-05, "loss": 0.7253, "mean_token_accuracy": 0.7882105298340321, "num_tokens": 221479760.0, "step": 6939 }, { "entropy": 0.732866358011961, "epoch": 0.6385242178020828, "grad_norm": 0.1690296232700348, "learning_rate": 7.871929340325697e-05, "loss": 0.7358, "mean_token_accuracy": 0.787705522030592, "num_tokens": 221511568.0, "step": 6940 }, { "entropy": 0.6378811579197645, "epoch": 0.638616224173524, "grad_norm": 0.15386812388896942, "learning_rate": 7.871622657711534e-05, "loss": 0.6305, "mean_token_accuracy": 0.8138011172413826, "num_tokens": 221543791.0, "step": 6941 }, { "entropy": 0.7490948531776667, "epoch": 0.6387082305449653, "grad_norm": 0.15550273656845093, "learning_rate": 7.871315975097372e-05, "loss": 0.7458, "mean_token_accuracy": 0.7799200601875782, "num_tokens": 221576313.0, "step": 6942 }, { "entropy": 0.6614210242405534, "epoch": 0.6388002369164064, "grad_norm": 0.15067635476589203, "learning_rate": 7.871009292483209e-05, "loss": 0.6393, "mean_token_accuracy": 0.8155992291867733, "num_tokens": 221608461.0, "step": 6943 }, { "entropy": 0.7185911685228348, "epoch": 0.6388922432878477, "grad_norm": 0.15482744574546814, "learning_rate": 7.870702609869047e-05, "loss": 0.7196, "mean_token_accuracy": 0.7862989902496338, "num_tokens": 221640635.0, "step": 6944 }, { "entropy": 0.8105077054351568, "epoch": 0.6389842496592889, "grad_norm": 0.15946754813194275, "learning_rate": 7.870395927254884e-05, "loss": 0.8091, "mean_token_accuracy": 0.7720139212906361, "num_tokens": 221673403.0, "step": 6945 }, { "entropy": 0.6958283763378859, "epoch": 0.6390762560307301, "grad_norm": 0.15772676467895508, "learning_rate": 7.870089244640721e-05, "loss": 0.6889, "mean_token_accuracy": 0.796492975205183, "num_tokens": 221705478.0, "step": 6946 }, { "entropy": 0.7459588032215834, "epoch": 0.6391682624021714, "grad_norm": 0.15366461873054504, "learning_rate": 7.869782562026559e-05, "loss": 0.7356, "mean_token_accuracy": 0.7801820300519466, "num_tokens": 221736622.0, "step": 6947 }, { "entropy": 0.7495031580328941, "epoch": 0.6392602687736125, "grad_norm": 0.15919840335845947, "learning_rate": 7.869475879412397e-05, "loss": 0.726, "mean_token_accuracy": 0.7853528223931789, "num_tokens": 221767982.0, "step": 6948 }, { "entropy": 0.6911295875906944, "epoch": 0.6393522751450538, "grad_norm": 0.15555141866207123, "learning_rate": 7.869169196798234e-05, "loss": 0.6548, "mean_token_accuracy": 0.807557687163353, "num_tokens": 221799377.0, "step": 6949 }, { "entropy": 0.6885363422334194, "epoch": 0.639444281516495, "grad_norm": 0.15002135932445526, "learning_rate": 7.868862514184071e-05, "loss": 0.6573, "mean_token_accuracy": 0.8050536289811134, "num_tokens": 221831476.0, "step": 6950 }, { "entropy": 0.7415374480187893, "epoch": 0.6395362878879363, "grad_norm": 0.15510840713977814, "learning_rate": 7.868555831569908e-05, "loss": 0.7327, "mean_token_accuracy": 0.7891831248998642, "num_tokens": 221863032.0, "step": 6951 }, { "entropy": 0.772614911198616, "epoch": 0.6396282942593775, "grad_norm": 0.16669751703739166, "learning_rate": 7.868249148955747e-05, "loss": 0.7673, "mean_token_accuracy": 0.7786742299795151, "num_tokens": 221895086.0, "step": 6952 }, { "entropy": 0.6795344613492489, "epoch": 0.6397203006308186, "grad_norm": 0.15866181254386902, "learning_rate": 7.867942466341584e-05, "loss": 0.6622, "mean_token_accuracy": 0.804789274930954, "num_tokens": 221926976.0, "step": 6953 }, { "entropy": 0.8312845788896084, "epoch": 0.6398123070022599, "grad_norm": 0.17144352197647095, "learning_rate": 7.86763578372742e-05, "loss": 0.835, "mean_token_accuracy": 0.754698108881712, "num_tokens": 221958620.0, "step": 6954 }, { "entropy": 0.7354001142084599, "epoch": 0.6399043133737011, "grad_norm": 0.16103647649288177, "learning_rate": 7.867329101113257e-05, "loss": 0.712, "mean_token_accuracy": 0.7875090688467026, "num_tokens": 221989838.0, "step": 6955 }, { "entropy": 0.8360791634768248, "epoch": 0.6399963197451424, "grad_norm": 0.15507563948631287, "learning_rate": 7.867022418499096e-05, "loss": 0.8071, "mean_token_accuracy": 0.7629932016134262, "num_tokens": 222021306.0, "step": 6956 }, { "entropy": 0.687332097440958, "epoch": 0.6400883261165836, "grad_norm": 0.150267094373703, "learning_rate": 7.866715735884934e-05, "loss": 0.6711, "mean_token_accuracy": 0.8006677515804768, "num_tokens": 222052261.0, "step": 6957 }, { "entropy": 0.7457604669034481, "epoch": 0.6401803324880248, "grad_norm": 0.1456674486398697, "learning_rate": 7.86640905327077e-05, "loss": 0.7276, "mean_token_accuracy": 0.7849526852369308, "num_tokens": 222084709.0, "step": 6958 }, { "entropy": 0.7927187643945217, "epoch": 0.640272338859466, "grad_norm": 0.15930810570716858, "learning_rate": 7.866102370656609e-05, "loss": 0.7835, "mean_token_accuracy": 0.7692633122205734, "num_tokens": 222116703.0, "step": 6959 }, { "entropy": 0.7339248470962048, "epoch": 0.6403643452309072, "grad_norm": 0.14879298210144043, "learning_rate": 7.865795688042445e-05, "loss": 0.7249, "mean_token_accuracy": 0.7836687862873077, "num_tokens": 222149031.0, "step": 6960 }, { "entropy": 0.6392824426293373, "epoch": 0.6404563516023485, "grad_norm": 0.15990878641605377, "learning_rate": 7.865489005428282e-05, "loss": 0.6504, "mean_token_accuracy": 0.8066058978438377, "num_tokens": 222181453.0, "step": 6961 }, { "entropy": 0.7492011748254299, "epoch": 0.6405483579737897, "grad_norm": 0.1632310152053833, "learning_rate": 7.86518232281412e-05, "loss": 0.7323, "mean_token_accuracy": 0.785941619426012, "num_tokens": 222213770.0, "step": 6962 }, { "entropy": 0.7727239765226841, "epoch": 0.6406403643452309, "grad_norm": 0.16280412673950195, "learning_rate": 7.864875640199958e-05, "loss": 0.7865, "mean_token_accuracy": 0.7720236070454121, "num_tokens": 222245318.0, "step": 6963 }, { "entropy": 0.6552695091813803, "epoch": 0.6407323707166721, "grad_norm": 0.1512708216905594, "learning_rate": 7.864568957585795e-05, "loss": 0.6304, "mean_token_accuracy": 0.811233002692461, "num_tokens": 222276715.0, "step": 6964 }, { "entropy": 0.7738239001482725, "epoch": 0.6408243770881134, "grad_norm": 0.16418792307376862, "learning_rate": 7.864262274971632e-05, "loss": 0.7691, "mean_token_accuracy": 0.7748025953769684, "num_tokens": 222308786.0, "step": 6965 }, { "entropy": 0.6872703023254871, "epoch": 0.6409163834595546, "grad_norm": 0.1540777087211609, "learning_rate": 7.863955592357469e-05, "loss": 0.6785, "mean_token_accuracy": 0.7967204786837101, "num_tokens": 222340832.0, "step": 6966 }, { "entropy": 0.7793655712157488, "epoch": 0.6410083898309958, "grad_norm": 0.15857237577438354, "learning_rate": 7.863648909743307e-05, "loss": 0.7823, "mean_token_accuracy": 0.773353349417448, "num_tokens": 222373146.0, "step": 6967 }, { "entropy": 0.7762088868767023, "epoch": 0.641100396202437, "grad_norm": 0.15695245563983917, "learning_rate": 7.863342227129145e-05, "loss": 0.7547, "mean_token_accuracy": 0.7766533009707928, "num_tokens": 222404776.0, "step": 6968 }, { "entropy": 0.647113611921668, "epoch": 0.6411924025738782, "grad_norm": 0.15493173897266388, "learning_rate": 7.863035544514982e-05, "loss": 0.6296, "mean_token_accuracy": 0.8125514760613441, "num_tokens": 222437068.0, "step": 6969 }, { "entropy": 0.8345769867300987, "epoch": 0.6412844089453195, "grad_norm": 0.1572309285402298, "learning_rate": 7.862728861900819e-05, "loss": 0.8085, "mean_token_accuracy": 0.7653841860592365, "num_tokens": 222469117.0, "step": 6970 }, { "entropy": 0.7175351716578007, "epoch": 0.6413764153167607, "grad_norm": 0.15733103454113007, "learning_rate": 7.862422179286657e-05, "loss": 0.7032, "mean_token_accuracy": 0.7920929342508316, "num_tokens": 222501451.0, "step": 6971 }, { "entropy": 0.7942229211330414, "epoch": 0.641468421688202, "grad_norm": 0.1532370001077652, "learning_rate": 7.862115496672494e-05, "loss": 0.7839, "mean_token_accuracy": 0.7694723792374134, "num_tokens": 222533058.0, "step": 6972 }, { "entropy": 0.7139307390898466, "epoch": 0.6415604280596431, "grad_norm": 0.1547260880470276, "learning_rate": 7.861808814058332e-05, "loss": 0.6971, "mean_token_accuracy": 0.7940657734870911, "num_tokens": 222565308.0, "step": 6973 }, { "entropy": 0.7965372260659933, "epoch": 0.6416524344310843, "grad_norm": 0.15389075875282288, "learning_rate": 7.861502131444169e-05, "loss": 0.7843, "mean_token_accuracy": 0.7753463238477707, "num_tokens": 222597507.0, "step": 6974 }, { "entropy": 0.8037285041064024, "epoch": 0.6417444408025256, "grad_norm": 0.15977290272712708, "learning_rate": 7.861195448830007e-05, "loss": 0.7908, "mean_token_accuracy": 0.7744931951165199, "num_tokens": 222629207.0, "step": 6975 }, { "entropy": 0.7958782557398081, "epoch": 0.6418364471739668, "grad_norm": 0.15818752348423004, "learning_rate": 7.860888766215843e-05, "loss": 0.7801, "mean_token_accuracy": 0.7691551707684994, "num_tokens": 222661467.0, "step": 6976 }, { "entropy": 0.7439003102481365, "epoch": 0.6419284535454081, "grad_norm": 0.15825903415679932, "learning_rate": 7.86058208360168e-05, "loss": 0.7257, "mean_token_accuracy": 0.784990206360817, "num_tokens": 222693519.0, "step": 6977 }, { "entropy": 0.6731985304504633, "epoch": 0.6420204599168492, "grad_norm": 0.1532893180847168, "learning_rate": 7.860275400987518e-05, "loss": 0.6562, "mean_token_accuracy": 0.8075496405363083, "num_tokens": 222725851.0, "step": 6978 }, { "entropy": 0.7621798645704985, "epoch": 0.6421124662882904, "grad_norm": 0.15318959951400757, "learning_rate": 7.859968718373357e-05, "loss": 0.7417, "mean_token_accuracy": 0.7850859649479389, "num_tokens": 222757937.0, "step": 6979 }, { "entropy": 0.6357100512832403, "epoch": 0.6422044726597317, "grad_norm": 0.15389390289783478, "learning_rate": 7.859662035759193e-05, "loss": 0.6344, "mean_token_accuracy": 0.8108495697379112, "num_tokens": 222789912.0, "step": 6980 }, { "entropy": 0.7247553188353777, "epoch": 0.6422964790311729, "grad_norm": 0.16087166965007782, "learning_rate": 7.85935535314503e-05, "loss": 0.6981, "mean_token_accuracy": 0.7895753011107445, "num_tokens": 222821306.0, "step": 6981 }, { "entropy": 0.8516242727637291, "epoch": 0.6423884854026142, "grad_norm": 0.16525718569755554, "learning_rate": 7.859048670530867e-05, "loss": 0.8598, "mean_token_accuracy": 0.7495944797992706, "num_tokens": 222852761.0, "step": 6982 }, { "entropy": 0.719877764582634, "epoch": 0.6424804917740553, "grad_norm": 0.1557914912700653, "learning_rate": 7.858741987916705e-05, "loss": 0.7113, "mean_token_accuracy": 0.7903487011790276, "num_tokens": 222884946.0, "step": 6983 }, { "entropy": 0.6846062242984772, "epoch": 0.6425724981454966, "grad_norm": 0.1535934954881668, "learning_rate": 7.858435305302543e-05, "loss": 0.6815, "mean_token_accuracy": 0.7947444915771484, "num_tokens": 222916689.0, "step": 6984 }, { "entropy": 0.7103770114481449, "epoch": 0.6426645045169378, "grad_norm": 0.15120014548301697, "learning_rate": 7.85812862268838e-05, "loss": 0.7063, "mean_token_accuracy": 0.7892937287688255, "num_tokens": 222949007.0, "step": 6985 }, { "entropy": 0.6969670038670301, "epoch": 0.642756510888379, "grad_norm": 0.1718427687883377, "learning_rate": 7.857821940074217e-05, "loss": 0.709, "mean_token_accuracy": 0.7921602129936218, "num_tokens": 222981036.0, "step": 6986 }, { "entropy": 0.7065334990620613, "epoch": 0.6428485172598203, "grad_norm": 0.17499487102031708, "learning_rate": 7.857515257460055e-05, "loss": 0.701, "mean_token_accuracy": 0.787717655301094, "num_tokens": 223012215.0, "step": 6987 }, { "entropy": 0.7533202134072781, "epoch": 0.6429405236312614, "grad_norm": 0.15356722474098206, "learning_rate": 7.857208574845892e-05, "loss": 0.7326, "mean_token_accuracy": 0.7873737774789333, "num_tokens": 223044114.0, "step": 6988 }, { "entropy": 0.7719446383416653, "epoch": 0.6430325300027027, "grad_norm": 0.15759645402431488, "learning_rate": 7.85690189223173e-05, "loss": 0.7593, "mean_token_accuracy": 0.7827654667198658, "num_tokens": 223075680.0, "step": 6989 }, { "entropy": 0.8331038132309914, "epoch": 0.6431245363741439, "grad_norm": 0.15807290375232697, "learning_rate": 7.856595209617568e-05, "loss": 0.8098, "mean_token_accuracy": 0.7674301899969578, "num_tokens": 223107574.0, "step": 6990 }, { "entropy": 0.7592663504183292, "epoch": 0.6432165427455852, "grad_norm": 0.15590573847293854, "learning_rate": 7.856288527003405e-05, "loss": 0.7408, "mean_token_accuracy": 0.7804142571985722, "num_tokens": 223139874.0, "step": 6991 }, { "entropy": 0.7451607473194599, "epoch": 0.6433085491170264, "grad_norm": 0.15617635846138, "learning_rate": 7.855981844389242e-05, "loss": 0.7113, "mean_token_accuracy": 0.7901097610592842, "num_tokens": 223171429.0, "step": 6992 }, { "entropy": 0.8518300727009773, "epoch": 0.6434005554884675, "grad_norm": 0.1581299901008606, "learning_rate": 7.855675161775078e-05, "loss": 0.8249, "mean_token_accuracy": 0.7588352896273136, "num_tokens": 223203062.0, "step": 6993 }, { "entropy": 0.8336306698620319, "epoch": 0.6434925618599088, "grad_norm": 0.1553668975830078, "learning_rate": 7.855368479160918e-05, "loss": 0.8164, "mean_token_accuracy": 0.7603516317903996, "num_tokens": 223234944.0, "step": 6994 }, { "entropy": 0.8216424584388733, "epoch": 0.64358456823135, "grad_norm": 0.1589539796113968, "learning_rate": 7.855061796546755e-05, "loss": 0.8362, "mean_token_accuracy": 0.7535314559936523, "num_tokens": 223267147.0, "step": 6995 }, { "entropy": 0.6913234740495682, "epoch": 0.6436765746027913, "grad_norm": 0.15525004267692566, "learning_rate": 7.854755113932591e-05, "loss": 0.6571, "mean_token_accuracy": 0.8058821074664593, "num_tokens": 223299366.0, "step": 6996 }, { "entropy": 0.7263008821755648, "epoch": 0.6437685809742325, "grad_norm": 0.14647334814071655, "learning_rate": 7.854448431318428e-05, "loss": 0.728, "mean_token_accuracy": 0.7829576656222343, "num_tokens": 223331835.0, "step": 6997 }, { "entropy": 0.7870141062885523, "epoch": 0.6438605873456736, "grad_norm": 0.15660057961940765, "learning_rate": 7.854141748704266e-05, "loss": 0.7795, "mean_token_accuracy": 0.774809505790472, "num_tokens": 223363781.0, "step": 6998 }, { "entropy": 0.7767510525882244, "epoch": 0.6439525937171149, "grad_norm": 0.16112786531448364, "learning_rate": 7.853835066090105e-05, "loss": 0.772, "mean_token_accuracy": 0.7787124700844288, "num_tokens": 223396025.0, "step": 6999 }, { "entropy": 0.8967073187232018, "epoch": 0.6440446000885561, "grad_norm": 0.16050510108470917, "learning_rate": 7.853528383475941e-05, "loss": 0.8987, "mean_token_accuracy": 0.740609522908926, "num_tokens": 223428225.0, "step": 7000 }, { "entropy": 0.8308091312646866, "epoch": 0.6441366064599974, "grad_norm": 0.16400142014026642, "learning_rate": 7.853221700861778e-05, "loss": 0.812, "mean_token_accuracy": 0.7660635411739349, "num_tokens": 223460299.0, "step": 7001 }, { "entropy": 0.8260846715420485, "epoch": 0.6442286128314386, "grad_norm": 0.16439177095890045, "learning_rate": 7.852915018247616e-05, "loss": 0.8171, "mean_token_accuracy": 0.7633972950279713, "num_tokens": 223492335.0, "step": 7002 }, { "entropy": 0.7950864359736443, "epoch": 0.6443206192028798, "grad_norm": 0.15909570455551147, "learning_rate": 7.852608335633453e-05, "loss": 0.8014, "mean_token_accuracy": 0.7621428035199642, "num_tokens": 223524756.0, "step": 7003 }, { "entropy": 0.7818479835987091, "epoch": 0.644412625574321, "grad_norm": 0.16049790382385254, "learning_rate": 7.852301653019291e-05, "loss": 0.7562, "mean_token_accuracy": 0.7798853740096092, "num_tokens": 223556736.0, "step": 7004 }, { "entropy": 0.7815417293459177, "epoch": 0.6445046319457622, "grad_norm": 0.16948312520980835, "learning_rate": 7.851994970405128e-05, "loss": 0.7842, "mean_token_accuracy": 0.7708058916032314, "num_tokens": 223588961.0, "step": 7005 }, { "entropy": 0.8369145616889, "epoch": 0.6445966383172035, "grad_norm": 0.16389793157577515, "learning_rate": 7.851688287790966e-05, "loss": 0.8274, "mean_token_accuracy": 0.7620183862745762, "num_tokens": 223620892.0, "step": 7006 }, { "entropy": 0.8038438335061073, "epoch": 0.6446886446886447, "grad_norm": 0.16933207213878632, "learning_rate": 7.851381605176803e-05, "loss": 0.7973, "mean_token_accuracy": 0.7649762853980064, "num_tokens": 223652262.0, "step": 7007 }, { "entropy": 0.7376859877258539, "epoch": 0.6447806510600859, "grad_norm": 0.1517903357744217, "learning_rate": 7.85107492256264e-05, "loss": 0.7291, "mean_token_accuracy": 0.783548466861248, "num_tokens": 223684513.0, "step": 7008 }, { "entropy": 0.7690382059663534, "epoch": 0.6448726574315271, "grad_norm": 0.15151222050189972, "learning_rate": 7.850768239948478e-05, "loss": 0.7664, "mean_token_accuracy": 0.7739690132439137, "num_tokens": 223715608.0, "step": 7009 }, { "entropy": 0.6898020375519991, "epoch": 0.6449646638029684, "grad_norm": 0.16039547324180603, "learning_rate": 7.850461557334316e-05, "loss": 0.6781, "mean_token_accuracy": 0.7983189821243286, "num_tokens": 223747842.0, "step": 7010 }, { "entropy": 0.7854726891964674, "epoch": 0.6450566701744096, "grad_norm": 0.15733622014522552, "learning_rate": 7.850154874720153e-05, "loss": 0.7826, "mean_token_accuracy": 0.770992960780859, "num_tokens": 223780045.0, "step": 7011 }, { "entropy": 0.7768614757806063, "epoch": 0.6451486765458508, "grad_norm": 0.16505606472492218, "learning_rate": 7.84984819210599e-05, "loss": 0.7709, "mean_token_accuracy": 0.773954700678587, "num_tokens": 223811993.0, "step": 7012 }, { "entropy": 0.7114319344982505, "epoch": 0.645240682917292, "grad_norm": 0.15300971269607544, "learning_rate": 7.849541509491826e-05, "loss": 0.6852, "mean_token_accuracy": 0.7968831546604633, "num_tokens": 223844185.0, "step": 7013 }, { "entropy": 0.7102359663695097, "epoch": 0.6453326892887332, "grad_norm": 0.1549244076013565, "learning_rate": 7.849234826877664e-05, "loss": 0.7004, "mean_token_accuracy": 0.791448287665844, "num_tokens": 223876155.0, "step": 7014 }, { "entropy": 0.8142467085272074, "epoch": 0.6454246956601745, "grad_norm": 0.15792810916900635, "learning_rate": 7.848928144263503e-05, "loss": 0.7866, "mean_token_accuracy": 0.7675737217068672, "num_tokens": 223907141.0, "step": 7015 }, { "entropy": 0.8202043753117323, "epoch": 0.6455167020316157, "grad_norm": 0.153945192694664, "learning_rate": 7.84862146164934e-05, "loss": 0.8024, "mean_token_accuracy": 0.7670767866075039, "num_tokens": 223938970.0, "step": 7016 }, { "entropy": 0.7377364039421082, "epoch": 0.645608708403057, "grad_norm": 0.16242384910583496, "learning_rate": 7.848314779035178e-05, "loss": 0.7366, "mean_token_accuracy": 0.7870790399610996, "num_tokens": 223970739.0, "step": 7017 }, { "entropy": 0.7534980792552233, "epoch": 0.6457007147744981, "grad_norm": 0.16097456216812134, "learning_rate": 7.848008096421014e-05, "loss": 0.749, "mean_token_accuracy": 0.7810821607708931, "num_tokens": 224002828.0, "step": 7018 }, { "entropy": 0.8382720910012722, "epoch": 0.6457927211459393, "grad_norm": 0.16667617857456207, "learning_rate": 7.847701413806851e-05, "loss": 0.8436, "mean_token_accuracy": 0.7598011903464794, "num_tokens": 224035069.0, "step": 7019 }, { "entropy": 0.8098375760018826, "epoch": 0.6458847275173806, "grad_norm": 0.15933576226234436, "learning_rate": 7.847394731192689e-05, "loss": 0.7982, "mean_token_accuracy": 0.7639972753822803, "num_tokens": 224066838.0, "step": 7020 }, { "entropy": 0.8150272108614445, "epoch": 0.6459767338888218, "grad_norm": 0.1604910045862198, "learning_rate": 7.847088048578527e-05, "loss": 0.8071, "mean_token_accuracy": 0.7645313069224358, "num_tokens": 224098524.0, "step": 7021 }, { "entropy": 0.7874063067138195, "epoch": 0.6460687402602631, "grad_norm": 0.16045254468917847, "learning_rate": 7.846781365964364e-05, "loss": 0.7829, "mean_token_accuracy": 0.7672378905117512, "num_tokens": 224130863.0, "step": 7022 }, { "entropy": 0.7409669253975153, "epoch": 0.6461607466317042, "grad_norm": 0.15618133544921875, "learning_rate": 7.846474683350201e-05, "loss": 0.724, "mean_token_accuracy": 0.7890619449317455, "num_tokens": 224163381.0, "step": 7023 }, { "entropy": 0.7398055717349052, "epoch": 0.6462527530031454, "grad_norm": 0.1661335974931717, "learning_rate": 7.846168000736038e-05, "loss": 0.7102, "mean_token_accuracy": 0.7945688664913177, "num_tokens": 224195420.0, "step": 7024 }, { "entropy": 0.6882862783968449, "epoch": 0.6463447593745867, "grad_norm": 0.15367881953716278, "learning_rate": 7.845861318121876e-05, "loss": 0.6809, "mean_token_accuracy": 0.7984783947467804, "num_tokens": 224227041.0, "step": 7025 }, { "entropy": 0.7503610970452428, "epoch": 0.6464367657460279, "grad_norm": 0.15369729697704315, "learning_rate": 7.845554635507714e-05, "loss": 0.7364, "mean_token_accuracy": 0.7821775935590267, "num_tokens": 224258275.0, "step": 7026 }, { "entropy": 0.8044120371341705, "epoch": 0.6465287721174692, "grad_norm": 0.16137804090976715, "learning_rate": 7.845247952893551e-05, "loss": 0.8211, "mean_token_accuracy": 0.7653166353702545, "num_tokens": 224289613.0, "step": 7027 }, { "entropy": 0.7855161372572184, "epoch": 0.6466207784889103, "grad_norm": 0.16347208619117737, "learning_rate": 7.844941270279388e-05, "loss": 0.8044, "mean_token_accuracy": 0.76554049924016, "num_tokens": 224321993.0, "step": 7028 }, { "entropy": 0.8544645942747593, "epoch": 0.6467127848603516, "grad_norm": 0.16179513931274414, "learning_rate": 7.844634587665226e-05, "loss": 0.8609, "mean_token_accuracy": 0.748654305934906, "num_tokens": 224353155.0, "step": 7029 }, { "entropy": 0.8192231860011816, "epoch": 0.6468047912317928, "grad_norm": 0.16610221564769745, "learning_rate": 7.844327905051063e-05, "loss": 0.8051, "mean_token_accuracy": 0.7649747431278229, "num_tokens": 224384631.0, "step": 7030 }, { "entropy": 0.6485357219353318, "epoch": 0.646896797603234, "grad_norm": 0.14379265904426575, "learning_rate": 7.8440212224369e-05, "loss": 0.6239, "mean_token_accuracy": 0.8130840137600899, "num_tokens": 224416734.0, "step": 7031 }, { "entropy": 0.7893319390714169, "epoch": 0.6469888039746753, "grad_norm": 0.16190986335277557, "learning_rate": 7.843714539822737e-05, "loss": 0.7629, "mean_token_accuracy": 0.7734259366989136, "num_tokens": 224448729.0, "step": 7032 }, { "entropy": 0.7863367609679699, "epoch": 0.6470808103461164, "grad_norm": 0.15810243785381317, "learning_rate": 7.843407857208576e-05, "loss": 0.7744, "mean_token_accuracy": 0.7716306410729885, "num_tokens": 224480856.0, "step": 7033 }, { "entropy": 0.830646850168705, "epoch": 0.6471728167175577, "grad_norm": 0.1595454066991806, "learning_rate": 7.843101174594412e-05, "loss": 0.809, "mean_token_accuracy": 0.7641596570611, "num_tokens": 224512976.0, "step": 7034 }, { "entropy": 0.7034146003425121, "epoch": 0.6472648230889989, "grad_norm": 0.1543247401714325, "learning_rate": 7.842794491980249e-05, "loss": 0.6677, "mean_token_accuracy": 0.8031925559043884, "num_tokens": 224544413.0, "step": 7035 }, { "entropy": 0.6929711252450943, "epoch": 0.6473568294604402, "grad_norm": 0.162679061293602, "learning_rate": 7.842487809366087e-05, "loss": 0.695, "mean_token_accuracy": 0.7929810062050819, "num_tokens": 224577003.0, "step": 7036 }, { "entropy": 0.6633480116724968, "epoch": 0.6474488358318814, "grad_norm": 0.16138708591461182, "learning_rate": 7.842181126751925e-05, "loss": 0.6559, "mean_token_accuracy": 0.8051009215414524, "num_tokens": 224609097.0, "step": 7037 }, { "entropy": 0.6918485574424267, "epoch": 0.6475408422033225, "grad_norm": 0.15208441019058228, "learning_rate": 7.841874444137762e-05, "loss": 0.6856, "mean_token_accuracy": 0.7947488240897655, "num_tokens": 224641478.0, "step": 7038 }, { "entropy": 0.7106715077534318, "epoch": 0.6476328485747638, "grad_norm": 0.16619913280010223, "learning_rate": 7.841567761523599e-05, "loss": 0.7156, "mean_token_accuracy": 0.7882184349000454, "num_tokens": 224672170.0, "step": 7039 }, { "entropy": 0.8245738130062819, "epoch": 0.647724854946205, "grad_norm": 0.16561740636825562, "learning_rate": 7.841261078909437e-05, "loss": 0.82, "mean_token_accuracy": 0.7640877962112427, "num_tokens": 224704753.0, "step": 7040 }, { "entropy": 0.8366010878235102, "epoch": 0.6478168613176463, "grad_norm": 0.16241921484470367, "learning_rate": 7.840954396295275e-05, "loss": 0.829, "mean_token_accuracy": 0.7554929330945015, "num_tokens": 224735627.0, "step": 7041 }, { "entropy": 0.629624355584383, "epoch": 0.6479088676890875, "grad_norm": 0.14902172982692719, "learning_rate": 7.840647713681112e-05, "loss": 0.6186, "mean_token_accuracy": 0.8152554854750633, "num_tokens": 224768012.0, "step": 7042 }, { "entropy": 0.6820451896637678, "epoch": 0.6480008740605286, "grad_norm": 0.14793610572814941, "learning_rate": 7.840341031066949e-05, "loss": 0.6695, "mean_token_accuracy": 0.7965960837900639, "num_tokens": 224800027.0, "step": 7043 }, { "entropy": 0.7285981420427561, "epoch": 0.6480928804319699, "grad_norm": 0.16306476294994354, "learning_rate": 7.840034348452786e-05, "loss": 0.6992, "mean_token_accuracy": 0.7907245419919491, "num_tokens": 224832505.0, "step": 7044 }, { "entropy": 0.6208251174539328, "epoch": 0.6481848868034111, "grad_norm": 0.1453896313905716, "learning_rate": 7.839727665838624e-05, "loss": 0.5855, "mean_token_accuracy": 0.8259277492761612, "num_tokens": 224863643.0, "step": 7045 }, { "entropy": 0.6938970871269703, "epoch": 0.6482768931748524, "grad_norm": 0.15591667592525482, "learning_rate": 7.839420983224462e-05, "loss": 0.6838, "mean_token_accuracy": 0.7955549880862236, "num_tokens": 224895467.0, "step": 7046 }, { "entropy": 0.7088063806295395, "epoch": 0.6483688995462936, "grad_norm": 0.15757714211940765, "learning_rate": 7.839114300610299e-05, "loss": 0.703, "mean_token_accuracy": 0.7928457446396351, "num_tokens": 224927776.0, "step": 7047 }, { "entropy": 0.8180240858346224, "epoch": 0.6484609059177348, "grad_norm": 0.16017897427082062, "learning_rate": 7.838807617996137e-05, "loss": 0.8063, "mean_token_accuracy": 0.7577881366014481, "num_tokens": 224959427.0, "step": 7048 }, { "entropy": 0.7268592547625303, "epoch": 0.648552912289176, "grad_norm": 0.1593882143497467, "learning_rate": 7.838500935381974e-05, "loss": 0.7122, "mean_token_accuracy": 0.788813591003418, "num_tokens": 224991511.0, "step": 7049 }, { "entropy": 0.8182171657681465, "epoch": 0.6486449186606172, "grad_norm": 0.16388137638568878, "learning_rate": 7.83819425276781e-05, "loss": 0.8281, "mean_token_accuracy": 0.7615449316799641, "num_tokens": 225023194.0, "step": 7050 }, { "entropy": 0.6155620329082012, "epoch": 0.6487369250320585, "grad_norm": 0.14957188069820404, "learning_rate": 7.837887570153649e-05, "loss": 0.605, "mean_token_accuracy": 0.8205740712583065, "num_tokens": 225055213.0, "step": 7051 }, { "entropy": 0.7764961589127779, "epoch": 0.6488289314034997, "grad_norm": 0.16244736313819885, "learning_rate": 7.837580887539487e-05, "loss": 0.7695, "mean_token_accuracy": 0.7767932713031769, "num_tokens": 225086827.0, "step": 7052 }, { "entropy": 0.8186197858303785, "epoch": 0.6489209377749409, "grad_norm": 0.16264373064041138, "learning_rate": 7.837274204925324e-05, "loss": 0.8066, "mean_token_accuracy": 0.7643033266067505, "num_tokens": 225118176.0, "step": 7053 }, { "entropy": 0.791192676872015, "epoch": 0.6490129441463821, "grad_norm": 0.1637670397758484, "learning_rate": 7.83696752231116e-05, "loss": 0.7914, "mean_token_accuracy": 0.7625746987760067, "num_tokens": 225149116.0, "step": 7054 }, { "entropy": 0.791076272726059, "epoch": 0.6491049505178234, "grad_norm": 0.16043800115585327, "learning_rate": 7.836660839696997e-05, "loss": 0.7869, "mean_token_accuracy": 0.7670504674315453, "num_tokens": 225181497.0, "step": 7055 }, { "entropy": 0.7719947062432766, "epoch": 0.6491969568892646, "grad_norm": 0.16315023601055145, "learning_rate": 7.836354157082835e-05, "loss": 0.7657, "mean_token_accuracy": 0.7718561105430126, "num_tokens": 225212646.0, "step": 7056 }, { "entropy": 0.6356240045279264, "epoch": 0.6492889632607058, "grad_norm": 0.15018752217292786, "learning_rate": 7.836047474468673e-05, "loss": 0.6138, "mean_token_accuracy": 0.8190382979810238, "num_tokens": 225244943.0, "step": 7057 }, { "entropy": 0.7676794826984406, "epoch": 0.649380969632147, "grad_norm": 0.15665677189826965, "learning_rate": 7.83574079185451e-05, "loss": 0.7501, "mean_token_accuracy": 0.7841073721647263, "num_tokens": 225277148.0, "step": 7058 }, { "entropy": 0.8835291527211666, "epoch": 0.6494729760035882, "grad_norm": 0.16000792384147644, "learning_rate": 7.835434109240347e-05, "loss": 0.8633, "mean_token_accuracy": 0.7450621500611305, "num_tokens": 225308676.0, "step": 7059 }, { "entropy": 0.850252777338028, "epoch": 0.6495649823750295, "grad_norm": 0.1561698466539383, "learning_rate": 7.835127426626185e-05, "loss": 0.8393, "mean_token_accuracy": 0.7552613876760006, "num_tokens": 225340423.0, "step": 7060 }, { "entropy": 0.9002683982253075, "epoch": 0.6496569887464707, "grad_norm": 0.1639838069677353, "learning_rate": 7.834820744012022e-05, "loss": 0.909, "mean_token_accuracy": 0.7386104986071587, "num_tokens": 225372727.0, "step": 7061 }, { "entropy": 0.8928390517830849, "epoch": 0.649748995117912, "grad_norm": 0.16494756937026978, "learning_rate": 7.83451406139786e-05, "loss": 0.899, "mean_token_accuracy": 0.7445872910320759, "num_tokens": 225405285.0, "step": 7062 }, { "entropy": 0.6896291449666023, "epoch": 0.6498410014893531, "grad_norm": 0.1660977154970169, "learning_rate": 7.834207378783697e-05, "loss": 0.6936, "mean_token_accuracy": 0.7969843447208405, "num_tokens": 225437797.0, "step": 7063 }, { "entropy": 0.9013302437961102, "epoch": 0.6499330078607943, "grad_norm": 0.15838123857975006, "learning_rate": 7.833900696169535e-05, "loss": 0.8923, "mean_token_accuracy": 0.7450406327843666, "num_tokens": 225470500.0, "step": 7064 }, { "entropy": 0.8362146746367216, "epoch": 0.6500250142322356, "grad_norm": 0.16335108876228333, "learning_rate": 7.833594013555372e-05, "loss": 0.8325, "mean_token_accuracy": 0.7571384385228157, "num_tokens": 225501900.0, "step": 7065 }, { "entropy": 0.5252052368596196, "epoch": 0.6501170206036768, "grad_norm": 0.14809775352478027, "learning_rate": 7.833287330941209e-05, "loss": 0.5075, "mean_token_accuracy": 0.846546046435833, "num_tokens": 225534496.0, "step": 7066 }, { "entropy": 0.7827712167054415, "epoch": 0.6502090269751181, "grad_norm": 0.15060476958751678, "learning_rate": 7.832980648327047e-05, "loss": 0.7492, "mean_token_accuracy": 0.7766511961817741, "num_tokens": 225565436.0, "step": 7067 }, { "entropy": 0.7452480234205723, "epoch": 0.6503010333465592, "grad_norm": 0.15516942739486694, "learning_rate": 7.832673965712885e-05, "loss": 0.7376, "mean_token_accuracy": 0.7830190062522888, "num_tokens": 225597946.0, "step": 7068 }, { "entropy": 0.6994322594255209, "epoch": 0.6503930397180004, "grad_norm": 0.14167505502700806, "learning_rate": 7.832367283098722e-05, "loss": 0.6741, "mean_token_accuracy": 0.8013881370425224, "num_tokens": 225629993.0, "step": 7069 }, { "entropy": 0.8138234987854958, "epoch": 0.6504850460894417, "grad_norm": 0.1660451740026474, "learning_rate": 7.832060600484558e-05, "loss": 0.8132, "mean_token_accuracy": 0.7651695646345615, "num_tokens": 225660842.0, "step": 7070 }, { "entropy": 0.80012680683285, "epoch": 0.6505770524608829, "grad_norm": 0.15463247895240784, "learning_rate": 7.831753917870395e-05, "loss": 0.7883, "mean_token_accuracy": 0.769807480275631, "num_tokens": 225693130.0, "step": 7071 }, { "entropy": 0.6080197375267744, "epoch": 0.6506690588323242, "grad_norm": 0.15143421292304993, "learning_rate": 7.831447235256235e-05, "loss": 0.5837, "mean_token_accuracy": 0.8262443244457245, "num_tokens": 225724673.0, "step": 7072 }, { "entropy": 0.6860790885984898, "epoch": 0.6507610652037653, "grad_norm": 0.15604457259178162, "learning_rate": 7.831140552642071e-05, "loss": 0.6874, "mean_token_accuracy": 0.7978916317224503, "num_tokens": 225756790.0, "step": 7073 }, { "entropy": 0.7180101033300161, "epoch": 0.6508530715752066, "grad_norm": 0.15824978053569794, "learning_rate": 7.830833870027908e-05, "loss": 0.6949, "mean_token_accuracy": 0.7972591519355774, "num_tokens": 225789325.0, "step": 7074 }, { "entropy": 0.7864622613415122, "epoch": 0.6509450779466478, "grad_norm": 0.1578536182641983, "learning_rate": 7.830527187413745e-05, "loss": 0.7716, "mean_token_accuracy": 0.7716756388545036, "num_tokens": 225821122.0, "step": 7075 }, { "entropy": 0.6746358703821898, "epoch": 0.651037084318089, "grad_norm": 0.15360479056835175, "learning_rate": 7.830220504799583e-05, "loss": 0.6701, "mean_token_accuracy": 0.8018503896892071, "num_tokens": 225853148.0, "step": 7076 }, { "entropy": 0.7843972034752369, "epoch": 0.6511290906895303, "grad_norm": 0.16458819806575775, "learning_rate": 7.829913822185421e-05, "loss": 0.7888, "mean_token_accuracy": 0.7646307609975338, "num_tokens": 225884463.0, "step": 7077 }, { "entropy": 0.6657775714993477, "epoch": 0.6512210970609714, "grad_norm": 0.16557736694812775, "learning_rate": 7.829607139571258e-05, "loss": 0.6643, "mean_token_accuracy": 0.7988160848617554, "num_tokens": 225916612.0, "step": 7078 }, { "entropy": 0.7380835562944412, "epoch": 0.6513131034324127, "grad_norm": 0.15999022126197815, "learning_rate": 7.829300456957096e-05, "loss": 0.7411, "mean_token_accuracy": 0.7822708301246166, "num_tokens": 225949156.0, "step": 7079 }, { "entropy": 0.7809624634683132, "epoch": 0.6514051098038539, "grad_norm": 0.15731902420520782, "learning_rate": 7.828993774342933e-05, "loss": 0.7732, "mean_token_accuracy": 0.7786605954170227, "num_tokens": 225980669.0, "step": 7080 }, { "entropy": 0.7022479325532913, "epoch": 0.6514971161752952, "grad_norm": 0.15897925198078156, "learning_rate": 7.82868709172877e-05, "loss": 0.6909, "mean_token_accuracy": 0.7995466217398643, "num_tokens": 226012469.0, "step": 7081 }, { "entropy": 0.7149181813001633, "epoch": 0.6515891225467364, "grad_norm": 0.16231432557106018, "learning_rate": 7.828380409114608e-05, "loss": 0.6955, "mean_token_accuracy": 0.796647384762764, "num_tokens": 226044080.0, "step": 7082 }, { "entropy": 0.815986467525363, "epoch": 0.6516811289181775, "grad_norm": 0.15654291212558746, "learning_rate": 7.828073726500446e-05, "loss": 0.7943, "mean_token_accuracy": 0.7679411061108112, "num_tokens": 226076325.0, "step": 7083 }, { "entropy": 0.7582853250205517, "epoch": 0.6517731352896188, "grad_norm": 0.1538000851869583, "learning_rate": 7.827767043886283e-05, "loss": 0.7228, "mean_token_accuracy": 0.787578821182251, "num_tokens": 226108473.0, "step": 7084 }, { "entropy": 0.8102413937449455, "epoch": 0.65186514166106, "grad_norm": 0.1705787181854248, "learning_rate": 7.82746036127212e-05, "loss": 0.8133, "mean_token_accuracy": 0.7634129896759987, "num_tokens": 226140561.0, "step": 7085 }, { "entropy": 0.7243900112807751, "epoch": 0.6519571480325013, "grad_norm": 0.15364818274974823, "learning_rate": 7.827153678657956e-05, "loss": 0.7187, "mean_token_accuracy": 0.7872127220034599, "num_tokens": 226171786.0, "step": 7086 }, { "entropy": 0.7850555945187807, "epoch": 0.6520491544039425, "grad_norm": 0.15606580674648285, "learning_rate": 7.826846996043795e-05, "loss": 0.7741, "mean_token_accuracy": 0.7690297402441502, "num_tokens": 226203762.0, "step": 7087 }, { "entropy": 0.7594273686408997, "epoch": 0.6521411607753836, "grad_norm": 0.15241415798664093, "learning_rate": 7.826540313429633e-05, "loss": 0.752, "mean_token_accuracy": 0.7737353481352329, "num_tokens": 226235607.0, "step": 7088 }, { "entropy": 0.7207489348948002, "epoch": 0.6522331671468249, "grad_norm": 0.14771567285060883, "learning_rate": 7.82623363081547e-05, "loss": 0.7102, "mean_token_accuracy": 0.7929535433650017, "num_tokens": 226267985.0, "step": 7089 }, { "entropy": 0.7239457201212645, "epoch": 0.6523251735182661, "grad_norm": 0.1516944020986557, "learning_rate": 7.825926948201306e-05, "loss": 0.7107, "mean_token_accuracy": 0.7883891128003597, "num_tokens": 226299922.0, "step": 7090 }, { "entropy": 0.8303029760718346, "epoch": 0.6524171798897074, "grad_norm": 0.1606813371181488, "learning_rate": 7.825620265587144e-05, "loss": 0.8338, "mean_token_accuracy": 0.7592242285609245, "num_tokens": 226331925.0, "step": 7091 }, { "entropy": 0.6991548333317041, "epoch": 0.6525091862611486, "grad_norm": 0.1503029614686966, "learning_rate": 7.825313582972981e-05, "loss": 0.6751, "mean_token_accuracy": 0.7997346743941307, "num_tokens": 226363463.0, "step": 7092 }, { "entropy": 0.7964683566242456, "epoch": 0.6526011926325898, "grad_norm": 0.16790121793746948, "learning_rate": 7.82500690035882e-05, "loss": 0.7896, "mean_token_accuracy": 0.7689277976751328, "num_tokens": 226395533.0, "step": 7093 }, { "entropy": 0.7461064215749502, "epoch": 0.652693199004031, "grad_norm": 0.153537780046463, "learning_rate": 7.824700217744656e-05, "loss": 0.7454, "mean_token_accuracy": 0.7819192260503769, "num_tokens": 226427286.0, "step": 7094 }, { "entropy": 0.7893575318157673, "epoch": 0.6527852053754722, "grad_norm": 0.16389746963977814, "learning_rate": 7.824393535130494e-05, "loss": 0.7848, "mean_token_accuracy": 0.772771380841732, "num_tokens": 226459009.0, "step": 7095 }, { "entropy": 0.7598089314997196, "epoch": 0.6528772117469135, "grad_norm": 0.1606905311346054, "learning_rate": 7.824086852516331e-05, "loss": 0.769, "mean_token_accuracy": 0.7777285650372505, "num_tokens": 226491053.0, "step": 7096 }, { "entropy": 0.806871498003602, "epoch": 0.6529692181183547, "grad_norm": 0.16327302157878876, "learning_rate": 7.823780169902168e-05, "loss": 0.8026, "mean_token_accuracy": 0.7690490037202835, "num_tokens": 226522485.0, "step": 7097 }, { "entropy": 0.8813015297055244, "epoch": 0.6530612244897959, "grad_norm": 0.17195051908493042, "learning_rate": 7.823473487288006e-05, "loss": 0.8827, "mean_token_accuracy": 0.7448143437504768, "num_tokens": 226553674.0, "step": 7098 }, { "entropy": 0.7509406097233295, "epoch": 0.6531532308612371, "grad_norm": 0.15672223269939423, "learning_rate": 7.823166804673844e-05, "loss": 0.7482, "mean_token_accuracy": 0.7823903001844883, "num_tokens": 226584980.0, "step": 7099 }, { "entropy": 0.7126494795084, "epoch": 0.6532452372326784, "grad_norm": 0.15457753837108612, "learning_rate": 7.822860122059681e-05, "loss": 0.7091, "mean_token_accuracy": 0.7904754467308521, "num_tokens": 226617114.0, "step": 7100 }, { "entropy": 0.9065434522926807, "epoch": 0.6533372436041196, "grad_norm": 0.1556113064289093, "learning_rate": 7.822553439445518e-05, "loss": 0.9057, "mean_token_accuracy": 0.7389012686908245, "num_tokens": 226649692.0, "step": 7101 }, { "entropy": 0.7694163080304861, "epoch": 0.6534292499755608, "grad_norm": 0.1532258242368698, "learning_rate": 7.822246756831355e-05, "loss": 0.7454, "mean_token_accuracy": 0.7817245721817017, "num_tokens": 226681665.0, "step": 7102 }, { "entropy": 0.8536334373056889, "epoch": 0.653521256347002, "grad_norm": 0.16060929000377655, "learning_rate": 7.821940074217193e-05, "loss": 0.8386, "mean_token_accuracy": 0.7537635192275047, "num_tokens": 226713962.0, "step": 7103 }, { "entropy": 0.7036446984857321, "epoch": 0.6536132627184432, "grad_norm": 0.15057499706745148, "learning_rate": 7.821633391603031e-05, "loss": 0.6578, "mean_token_accuracy": 0.79886220023036, "num_tokens": 226745884.0, "step": 7104 }, { "entropy": 0.7841194290667772, "epoch": 0.6537052690898845, "grad_norm": 0.15599322319030762, "learning_rate": 7.821326708988868e-05, "loss": 0.7667, "mean_token_accuracy": 0.7747890911996365, "num_tokens": 226777985.0, "step": 7105 }, { "entropy": 0.7623072750866413, "epoch": 0.6537972754613257, "grad_norm": 0.14844994246959686, "learning_rate": 7.821020026374704e-05, "loss": 0.7435, "mean_token_accuracy": 0.7830826491117477, "num_tokens": 226810229.0, "step": 7106 }, { "entropy": 0.750044509768486, "epoch": 0.653889281832767, "grad_norm": 0.16266915202140808, "learning_rate": 7.820713343760543e-05, "loss": 0.7525, "mean_token_accuracy": 0.7792252190411091, "num_tokens": 226842386.0, "step": 7107 }, { "entropy": 0.8363044429570436, "epoch": 0.6539812882042081, "grad_norm": 0.15744349360466003, "learning_rate": 7.82040666114638e-05, "loss": 0.821, "mean_token_accuracy": 0.7602660395205021, "num_tokens": 226874224.0, "step": 7108 }, { "entropy": 0.747431606054306, "epoch": 0.6540732945756493, "grad_norm": 0.1589849442243576, "learning_rate": 7.820099978532218e-05, "loss": 0.7554, "mean_token_accuracy": 0.779946606606245, "num_tokens": 226906347.0, "step": 7109 }, { "entropy": 0.7376139983534813, "epoch": 0.6541653009470906, "grad_norm": 0.16852344572544098, "learning_rate": 7.819793295918056e-05, "loss": 0.7345, "mean_token_accuracy": 0.7824297063052654, "num_tokens": 226938505.0, "step": 7110 }, { "entropy": 0.7866084631532431, "epoch": 0.6542573073185318, "grad_norm": 0.15043769776821136, "learning_rate": 7.819486613303892e-05, "loss": 0.7726, "mean_token_accuracy": 0.7695916146039963, "num_tokens": 226969912.0, "step": 7111 }, { "entropy": 0.6986659523099661, "epoch": 0.6543493136899731, "grad_norm": 0.16074837744235992, "learning_rate": 7.819179930689729e-05, "loss": 0.6685, "mean_token_accuracy": 0.7992380075156689, "num_tokens": 227000587.0, "step": 7112 }, { "entropy": 0.6779438238590956, "epoch": 0.6544413200614142, "grad_norm": 0.1619243025779724, "learning_rate": 7.818873248075566e-05, "loss": 0.6666, "mean_token_accuracy": 0.803513415157795, "num_tokens": 227032312.0, "step": 7113 }, { "entropy": 0.838173596188426, "epoch": 0.6545333264328554, "grad_norm": 0.15816262364387512, "learning_rate": 7.818566565461406e-05, "loss": 0.8132, "mean_token_accuracy": 0.7636142820119858, "num_tokens": 227064807.0, "step": 7114 }, { "entropy": 0.6487151645123959, "epoch": 0.6546253328042967, "grad_norm": 0.16073887050151825, "learning_rate": 7.818259882847242e-05, "loss": 0.6386, "mean_token_accuracy": 0.810065183788538, "num_tokens": 227096776.0, "step": 7115 }, { "entropy": 0.7658461071550846, "epoch": 0.6547173391757379, "grad_norm": 0.1529790759086609, "learning_rate": 7.817953200233079e-05, "loss": 0.7463, "mean_token_accuracy": 0.7791707217693329, "num_tokens": 227128809.0, "step": 7116 }, { "entropy": 0.6975050717592239, "epoch": 0.6548093455471792, "grad_norm": 0.14952513575553894, "learning_rate": 7.817646517618916e-05, "loss": 0.685, "mean_token_accuracy": 0.7962159514427185, "num_tokens": 227160221.0, "step": 7117 }, { "entropy": 0.7342338748276234, "epoch": 0.6549013519186203, "grad_norm": 0.1654050052165985, "learning_rate": 7.817339835004754e-05, "loss": 0.735, "mean_token_accuracy": 0.7833146080374718, "num_tokens": 227191465.0, "step": 7118 }, { "entropy": 0.8267523311078548, "epoch": 0.6549933582900616, "grad_norm": 0.1696312129497528, "learning_rate": 7.817033152390592e-05, "loss": 0.8503, "mean_token_accuracy": 0.7583919540047646, "num_tokens": 227222111.0, "step": 7119 }, { "entropy": 0.8061349093914032, "epoch": 0.6550853646615028, "grad_norm": 0.16036270558834076, "learning_rate": 7.816726469776429e-05, "loss": 0.8092, "mean_token_accuracy": 0.7660045400261879, "num_tokens": 227253969.0, "step": 7120 }, { "entropy": 0.7092596367001534, "epoch": 0.655177371032944, "grad_norm": 0.15257269144058228, "learning_rate": 7.816419787162266e-05, "loss": 0.717, "mean_token_accuracy": 0.7864191085100174, "num_tokens": 227286015.0, "step": 7121 }, { "entropy": 0.8200550740584731, "epoch": 0.6552693774043853, "grad_norm": 0.16646024584770203, "learning_rate": 7.816113104548104e-05, "loss": 0.8253, "mean_token_accuracy": 0.758919931948185, "num_tokens": 227316978.0, "step": 7122 }, { "entropy": 0.793373316526413, "epoch": 0.6553613837758264, "grad_norm": 0.15891849994659424, "learning_rate": 7.81580642193394e-05, "loss": 0.7903, "mean_token_accuracy": 0.7695494554936886, "num_tokens": 227348249.0, "step": 7123 }, { "entropy": 0.6979718748480082, "epoch": 0.6554533901472677, "grad_norm": 0.15178626775741577, "learning_rate": 7.815499739319779e-05, "loss": 0.6739, "mean_token_accuracy": 0.8027043715119362, "num_tokens": 227380063.0, "step": 7124 }, { "entropy": 0.8111903350800276, "epoch": 0.6555453965187089, "grad_norm": 0.15992188453674316, "learning_rate": 7.815193056705616e-05, "loss": 0.81, "mean_token_accuracy": 0.7628663964569569, "num_tokens": 227412593.0, "step": 7125 }, { "entropy": 0.7737731337547302, "epoch": 0.6556374028901502, "grad_norm": 0.16401678323745728, "learning_rate": 7.814886374091454e-05, "loss": 0.7757, "mean_token_accuracy": 0.7719688378274441, "num_tokens": 227445044.0, "step": 7126 }, { "entropy": 0.6715676952153444, "epoch": 0.6557294092615914, "grad_norm": 0.16235674917697906, "learning_rate": 7.81457969147729e-05, "loss": 0.6468, "mean_token_accuracy": 0.8069807663559914, "num_tokens": 227475955.0, "step": 7127 }, { "entropy": 0.8393130898475647, "epoch": 0.6558214156330325, "grad_norm": 0.16243021190166473, "learning_rate": 7.814273008863127e-05, "loss": 0.8044, "mean_token_accuracy": 0.7679686136543751, "num_tokens": 227507531.0, "step": 7128 }, { "entropy": 0.7822301834821701, "epoch": 0.6559134220044738, "grad_norm": 0.14876475930213928, "learning_rate": 7.813966326248965e-05, "loss": 0.7584, "mean_token_accuracy": 0.7815239392220974, "num_tokens": 227540000.0, "step": 7129 }, { "entropy": 0.7515278235077858, "epoch": 0.656005428375915, "grad_norm": 0.16253501176834106, "learning_rate": 7.813659643634804e-05, "loss": 0.7303, "mean_token_accuracy": 0.7843698412179947, "num_tokens": 227570902.0, "step": 7130 }, { "entropy": 0.7657082192599773, "epoch": 0.6560974347473563, "grad_norm": 0.1677108258008957, "learning_rate": 7.81335296102064e-05, "loss": 0.7669, "mean_token_accuracy": 0.7755605652928352, "num_tokens": 227602729.0, "step": 7131 }, { "entropy": 0.8700656294822693, "epoch": 0.6561894411187975, "grad_norm": 0.16143253445625305, "learning_rate": 7.813046278406477e-05, "loss": 0.8554, "mean_token_accuracy": 0.7526623904705048, "num_tokens": 227635067.0, "step": 7132 }, { "entropy": 0.7202649973332882, "epoch": 0.6562814474902386, "grad_norm": 0.15129722654819489, "learning_rate": 7.812739595792314e-05, "loss": 0.6909, "mean_token_accuracy": 0.7971073724329472, "num_tokens": 227666684.0, "step": 7133 }, { "entropy": 0.8303488381206989, "epoch": 0.6563734538616799, "grad_norm": 0.1650961935520172, "learning_rate": 7.812432913178152e-05, "loss": 0.829, "mean_token_accuracy": 0.759656872600317, "num_tokens": 227697639.0, "step": 7134 }, { "entropy": 0.7962758839130402, "epoch": 0.6564654602331211, "grad_norm": 0.1480431705713272, "learning_rate": 7.81212623056399e-05, "loss": 0.7893, "mean_token_accuracy": 0.7653258927166462, "num_tokens": 227729815.0, "step": 7135 }, { "entropy": 0.7903717067092657, "epoch": 0.6565574666045624, "grad_norm": 0.1613781899213791, "learning_rate": 7.811819547949827e-05, "loss": 0.7856, "mean_token_accuracy": 0.7696868851780891, "num_tokens": 227761834.0, "step": 7136 }, { "entropy": 0.7617421727627516, "epoch": 0.6566494729760036, "grad_norm": 0.14869464933872223, "learning_rate": 7.811512865335664e-05, "loss": 0.761, "mean_token_accuracy": 0.7741854190826416, "num_tokens": 227794050.0, "step": 7137 }, { "entropy": 0.7615968734025955, "epoch": 0.6567414793474448, "grad_norm": 0.16221199929714203, "learning_rate": 7.811206182721502e-05, "loss": 0.7481, "mean_token_accuracy": 0.7839077152311802, "num_tokens": 227825900.0, "step": 7138 }, { "entropy": 0.8148882016539574, "epoch": 0.656833485718886, "grad_norm": 0.1592821329832077, "learning_rate": 7.810899500107339e-05, "loss": 0.8076, "mean_token_accuracy": 0.766542699187994, "num_tokens": 227857438.0, "step": 7139 }, { "entropy": 0.8364590778946877, "epoch": 0.6569254920903272, "grad_norm": 0.16915088891983032, "learning_rate": 7.810592817493177e-05, "loss": 0.8418, "mean_token_accuracy": 0.757356446236372, "num_tokens": 227889388.0, "step": 7140 }, { "entropy": 0.8487864155322313, "epoch": 0.6570174984617685, "grad_norm": 0.16548284888267517, "learning_rate": 7.810286134879015e-05, "loss": 0.8311, "mean_token_accuracy": 0.7540905363857746, "num_tokens": 227921707.0, "step": 7141 }, { "entropy": 0.7111711716279387, "epoch": 0.6571095048332097, "grad_norm": 0.15191160142421722, "learning_rate": 7.809979452264852e-05, "loss": 0.7053, "mean_token_accuracy": 0.7944554500281811, "num_tokens": 227954409.0, "step": 7142 }, { "entropy": 0.7963609825819731, "epoch": 0.6572015112046509, "grad_norm": 0.15742270648479462, "learning_rate": 7.809672769650689e-05, "loss": 0.8012, "mean_token_accuracy": 0.7700439430773258, "num_tokens": 227985929.0, "step": 7143 }, { "entropy": 0.8064995780587196, "epoch": 0.6572935175760921, "grad_norm": 0.16558301448822021, "learning_rate": 7.809366087036525e-05, "loss": 0.7874, "mean_token_accuracy": 0.7690151147544384, "num_tokens": 228016978.0, "step": 7144 }, { "entropy": 0.7271794639527798, "epoch": 0.6573855239475334, "grad_norm": 0.1698399782180786, "learning_rate": 7.809059404422364e-05, "loss": 0.7407, "mean_token_accuracy": 0.7836697548627853, "num_tokens": 228048612.0, "step": 7145 }, { "entropy": 0.8329573757946491, "epoch": 0.6574775303189746, "grad_norm": 0.16049626469612122, "learning_rate": 7.808752721808202e-05, "loss": 0.831, "mean_token_accuracy": 0.7603574693202972, "num_tokens": 228080524.0, "step": 7146 }, { "entropy": 0.7392350435256958, "epoch": 0.6575695366904158, "grad_norm": 0.15846939384937286, "learning_rate": 7.808446039194038e-05, "loss": 0.7373, "mean_token_accuracy": 0.7785789556801319, "num_tokens": 228112299.0, "step": 7147 }, { "entropy": 0.7997567262500525, "epoch": 0.657661543061857, "grad_norm": 0.1523139625787735, "learning_rate": 7.808139356579875e-05, "loss": 0.7818, "mean_token_accuracy": 0.7687104977667332, "num_tokens": 228143869.0, "step": 7148 }, { "entropy": 0.8810387067496777, "epoch": 0.6577535494332982, "grad_norm": 0.1655472368001938, "learning_rate": 7.807832673965713e-05, "loss": 0.8763, "mean_token_accuracy": 0.7441558986902237, "num_tokens": 228175832.0, "step": 7149 }, { "entropy": 0.6920310147106647, "epoch": 0.6578455558047395, "grad_norm": 0.16436001658439636, "learning_rate": 7.80752599135155e-05, "loss": 0.6755, "mean_token_accuracy": 0.8005007915198803, "num_tokens": 228207840.0, "step": 7150 }, { "entropy": 0.7942385412752628, "epoch": 0.6579375621761807, "grad_norm": 0.15671896934509277, "learning_rate": 7.807219308737388e-05, "loss": 0.7795, "mean_token_accuracy": 0.7723085768520832, "num_tokens": 228240122.0, "step": 7151 }, { "entropy": 0.7055822089314461, "epoch": 0.658029568547622, "grad_norm": 0.16099046170711517, "learning_rate": 7.806912626123225e-05, "loss": 0.6774, "mean_token_accuracy": 0.7954660803079605, "num_tokens": 228271513.0, "step": 7152 }, { "entropy": 0.7721216715872288, "epoch": 0.6581215749190631, "grad_norm": 0.153142511844635, "learning_rate": 7.806605943509063e-05, "loss": 0.7456, "mean_token_accuracy": 0.7818183861672878, "num_tokens": 228304244.0, "step": 7153 }, { "entropy": 0.6634752713143826, "epoch": 0.6582135812905043, "grad_norm": 0.15521030128002167, "learning_rate": 7.8062992608949e-05, "loss": 0.6428, "mean_token_accuracy": 0.8121464103460312, "num_tokens": 228335669.0, "step": 7154 }, { "entropy": 0.8342861793935299, "epoch": 0.6583055876619456, "grad_norm": 0.15964846312999725, "learning_rate": 7.805992578280737e-05, "loss": 0.8075, "mean_token_accuracy": 0.7658800520002842, "num_tokens": 228367717.0, "step": 7155 }, { "entropy": 0.7678426820784807, "epoch": 0.6583975940333868, "grad_norm": 0.15764451026916504, "learning_rate": 7.805685895666575e-05, "loss": 0.7649, "mean_token_accuracy": 0.7800779901444912, "num_tokens": 228399661.0, "step": 7156 }, { "entropy": 0.8951945547014475, "epoch": 0.6584896004048281, "grad_norm": 0.16122445464134216, "learning_rate": 7.805379213052413e-05, "loss": 0.8827, "mean_token_accuracy": 0.7477765940129757, "num_tokens": 228431784.0, "step": 7157 }, { "entropy": 0.7791591547429562, "epoch": 0.6585816067762692, "grad_norm": 0.15376083552837372, "learning_rate": 7.80507253043825e-05, "loss": 0.7593, "mean_token_accuracy": 0.775182943791151, "num_tokens": 228464291.0, "step": 7158 }, { "entropy": 0.8684931546449661, "epoch": 0.6586736131477104, "grad_norm": 0.16561710834503174, "learning_rate": 7.804765847824087e-05, "loss": 0.8728, "mean_token_accuracy": 0.74667838960886, "num_tokens": 228496040.0, "step": 7159 }, { "entropy": 0.7728478964418173, "epoch": 0.6587656195191517, "grad_norm": 0.15508869290351868, "learning_rate": 7.804459165209925e-05, "loss": 0.7581, "mean_token_accuracy": 0.7794061750173569, "num_tokens": 228527826.0, "step": 7160 }, { "entropy": 0.6663760859519243, "epoch": 0.6588576258905929, "grad_norm": 0.16530868411064148, "learning_rate": 7.804152482595763e-05, "loss": 0.6716, "mean_token_accuracy": 0.8000775501132011, "num_tokens": 228559577.0, "step": 7161 }, { "entropy": 0.6962447576224804, "epoch": 0.6589496322620342, "grad_norm": 0.15064620971679688, "learning_rate": 7.8038457999816e-05, "loss": 0.6876, "mean_token_accuracy": 0.7952400334179401, "num_tokens": 228592159.0, "step": 7162 }, { "entropy": 0.7101002912968397, "epoch": 0.6590416386334753, "grad_norm": 0.15734833478927612, "learning_rate": 7.803539117367437e-05, "loss": 0.7134, "mean_token_accuracy": 0.788399413228035, "num_tokens": 228624088.0, "step": 7163 }, { "entropy": 0.6936115566641092, "epoch": 0.6591336450049166, "grad_norm": 0.15692710876464844, "learning_rate": 7.803232434753273e-05, "loss": 0.6795, "mean_token_accuracy": 0.7943127043545246, "num_tokens": 228654733.0, "step": 7164 }, { "entropy": 0.7586859464645386, "epoch": 0.6592256513763578, "grad_norm": 0.15639515221118927, "learning_rate": 7.802925752139111e-05, "loss": 0.7569, "mean_token_accuracy": 0.7766646556556225, "num_tokens": 228686971.0, "step": 7165 }, { "entropy": 0.6668936163187027, "epoch": 0.659317657747799, "grad_norm": 0.15758101642131805, "learning_rate": 7.80261906952495e-05, "loss": 0.6759, "mean_token_accuracy": 0.8008822351694107, "num_tokens": 228719574.0, "step": 7166 }, { "entropy": 0.8015042571350932, "epoch": 0.6594096641192403, "grad_norm": 0.16113179922103882, "learning_rate": 7.802312386910786e-05, "loss": 0.7774, "mean_token_accuracy": 0.7735409550368786, "num_tokens": 228751469.0, "step": 7167 }, { "entropy": 0.6989155001938343, "epoch": 0.6595016704906814, "grad_norm": 0.15595147013664246, "learning_rate": 7.802005704296623e-05, "loss": 0.6776, "mean_token_accuracy": 0.7983729243278503, "num_tokens": 228782944.0, "step": 7168 }, { "entropy": 0.7910958435386419, "epoch": 0.6595936768621227, "grad_norm": 0.15749290585517883, "learning_rate": 7.801699021682461e-05, "loss": 0.7751, "mean_token_accuracy": 0.7736129872500896, "num_tokens": 228814157.0, "step": 7169 }, { "entropy": 0.7561138477176428, "epoch": 0.6596856832335639, "grad_norm": 0.16328124701976776, "learning_rate": 7.801392339068298e-05, "loss": 0.7504, "mean_token_accuracy": 0.7810018211603165, "num_tokens": 228845848.0, "step": 7170 }, { "entropy": 0.6389339156448841, "epoch": 0.6597776896050052, "grad_norm": 0.15751448273658752, "learning_rate": 7.801085656454136e-05, "loss": 0.6221, "mean_token_accuracy": 0.812812514603138, "num_tokens": 228877532.0, "step": 7171 }, { "entropy": 0.7899944148957729, "epoch": 0.6598696959764464, "grad_norm": 0.15759725868701935, "learning_rate": 7.800778973839974e-05, "loss": 0.7613, "mean_token_accuracy": 0.7769978530704975, "num_tokens": 228908393.0, "step": 7172 }, { "entropy": 0.7635229267179966, "epoch": 0.6599617023478876, "grad_norm": 0.15689760446548462, "learning_rate": 7.800472291225811e-05, "loss": 0.747, "mean_token_accuracy": 0.7828491292893887, "num_tokens": 228940994.0, "step": 7173 }, { "entropy": 0.7556841839104891, "epoch": 0.6600537087193288, "grad_norm": 0.16698777675628662, "learning_rate": 7.800165608611648e-05, "loss": 0.7457, "mean_token_accuracy": 0.7864118218421936, "num_tokens": 228972566.0, "step": 7174 }, { "entropy": 0.8504532426595688, "epoch": 0.66014571509077, "grad_norm": 0.16312670707702637, "learning_rate": 7.799858925997485e-05, "loss": 0.849, "mean_token_accuracy": 0.7524514272809029, "num_tokens": 229003700.0, "step": 7175 }, { "entropy": 0.7309967949986458, "epoch": 0.6602377214622113, "grad_norm": 0.16285699605941772, "learning_rate": 7.799552243383323e-05, "loss": 0.7024, "mean_token_accuracy": 0.7909126430749893, "num_tokens": 229035137.0, "step": 7176 }, { "entropy": 0.7568534966558218, "epoch": 0.6603297278336525, "grad_norm": 0.15399937331676483, "learning_rate": 7.799245560769161e-05, "loss": 0.7497, "mean_token_accuracy": 0.7806278616189957, "num_tokens": 229066831.0, "step": 7177 }, { "entropy": 0.8422721084207296, "epoch": 0.6604217342050938, "grad_norm": 0.16169176995754242, "learning_rate": 7.798938878154998e-05, "loss": 0.8547, "mean_token_accuracy": 0.7514215148985386, "num_tokens": 229098774.0, "step": 7178 }, { "entropy": 0.6586514282971621, "epoch": 0.6605137405765349, "grad_norm": 0.146050825715065, "learning_rate": 7.798632195540835e-05, "loss": 0.633, "mean_token_accuracy": 0.8097788989543915, "num_tokens": 229130768.0, "step": 7179 }, { "entropy": 0.8131730034947395, "epoch": 0.6606057469479761, "grad_norm": 0.1617434173822403, "learning_rate": 7.798325512926673e-05, "loss": 0.791, "mean_token_accuracy": 0.7697820626199245, "num_tokens": 229161863.0, "step": 7180 }, { "entropy": 0.8482160810381174, "epoch": 0.6606977533194174, "grad_norm": 0.15285755693912506, "learning_rate": 7.79801883031251e-05, "loss": 0.8171, "mean_token_accuracy": 0.7609328664839268, "num_tokens": 229193940.0, "step": 7181 }, { "entropy": 0.7678125239908695, "epoch": 0.6607897596908586, "grad_norm": 0.16296260058879852, "learning_rate": 7.797712147698348e-05, "loss": 0.7565, "mean_token_accuracy": 0.7764059714972973, "num_tokens": 229226123.0, "step": 7182 }, { "entropy": 0.7532285042107105, "epoch": 0.6608817660622999, "grad_norm": 0.15228091180324554, "learning_rate": 7.797405465084184e-05, "loss": 0.7459, "mean_token_accuracy": 0.7801134809851646, "num_tokens": 229258584.0, "step": 7183 }, { "entropy": 0.7734611770138144, "epoch": 0.660973772433741, "grad_norm": 0.1754855066537857, "learning_rate": 7.797098782470023e-05, "loss": 0.785, "mean_token_accuracy": 0.7693200819194317, "num_tokens": 229289549.0, "step": 7184 }, { "entropy": 0.7587405741214752, "epoch": 0.6610657788051822, "grad_norm": 0.15901802480220795, "learning_rate": 7.79679209985586e-05, "loss": 0.7668, "mean_token_accuracy": 0.7755454555153847, "num_tokens": 229322288.0, "step": 7185 }, { "entropy": 0.8187964390963316, "epoch": 0.6611577851766235, "grad_norm": 0.15612541139125824, "learning_rate": 7.796485417241696e-05, "loss": 0.8172, "mean_token_accuracy": 0.7622045278549194, "num_tokens": 229353497.0, "step": 7186 }, { "entropy": 0.7688071131706238, "epoch": 0.6612497915480647, "grad_norm": 0.15318948030471802, "learning_rate": 7.796178734627534e-05, "loss": 0.7625, "mean_token_accuracy": 0.772628914564848, "num_tokens": 229385605.0, "step": 7187 }, { "entropy": 0.7519329935312271, "epoch": 0.661341797919506, "grad_norm": 0.1640777438879013, "learning_rate": 7.795872052013372e-05, "loss": 0.7559, "mean_token_accuracy": 0.7830728888511658, "num_tokens": 229418186.0, "step": 7188 }, { "entropy": 0.8755257148295641, "epoch": 0.6614338042909471, "grad_norm": 0.16782121360301971, "learning_rate": 7.795565369399209e-05, "loss": 0.867, "mean_token_accuracy": 0.7503605633974075, "num_tokens": 229450278.0, "step": 7189 }, { "entropy": 0.6857521533966064, "epoch": 0.6615258106623884, "grad_norm": 0.14600016176700592, "learning_rate": 7.795258686785046e-05, "loss": 0.6787, "mean_token_accuracy": 0.8026338405907154, "num_tokens": 229482847.0, "step": 7190 }, { "entropy": 0.7698119860142469, "epoch": 0.6616178170338296, "grad_norm": 0.1587170958518982, "learning_rate": 7.794952004170883e-05, "loss": 0.7586, "mean_token_accuracy": 0.7790152691304684, "num_tokens": 229514914.0, "step": 7191 }, { "entropy": 0.7597177214920521, "epoch": 0.6617098234052708, "grad_norm": 0.15318241715431213, "learning_rate": 7.794645321556722e-05, "loss": 0.7498, "mean_token_accuracy": 0.782429963350296, "num_tokens": 229547054.0, "step": 7192 }, { "entropy": 0.6977422088384628, "epoch": 0.6618018297767121, "grad_norm": 0.15084198117256165, "learning_rate": 7.794338638942559e-05, "loss": 0.6843, "mean_token_accuracy": 0.8025103881955147, "num_tokens": 229579425.0, "step": 7193 }, { "entropy": 0.8097188249230385, "epoch": 0.6618938361481532, "grad_norm": 0.16632461547851562, "learning_rate": 7.794031956328396e-05, "loss": 0.7908, "mean_token_accuracy": 0.7720521688461304, "num_tokens": 229610961.0, "step": 7194 }, { "entropy": 0.8257662318646908, "epoch": 0.6619858425195945, "grad_norm": 0.17185279726982117, "learning_rate": 7.793725273714233e-05, "loss": 0.8335, "mean_token_accuracy": 0.7610980644822121, "num_tokens": 229643398.0, "step": 7195 }, { "entropy": 0.8637250568717718, "epoch": 0.6620778488910357, "grad_norm": 0.16018979251384735, "learning_rate": 7.793418591100071e-05, "loss": 0.8543, "mean_token_accuracy": 0.752851665019989, "num_tokens": 229675854.0, "step": 7196 }, { "entropy": 0.6332386247813702, "epoch": 0.662169855262477, "grad_norm": 0.14771336317062378, "learning_rate": 7.793111908485909e-05, "loss": 0.6136, "mean_token_accuracy": 0.8155813962221146, "num_tokens": 229708000.0, "step": 7197 }, { "entropy": 0.7217374444007874, "epoch": 0.6622618616339182, "grad_norm": 0.16745643317699432, "learning_rate": 7.792805225871746e-05, "loss": 0.7309, "mean_token_accuracy": 0.7855882421135902, "num_tokens": 229739677.0, "step": 7198 }, { "entropy": 0.7565439250320196, "epoch": 0.6623538680053593, "grad_norm": 0.1612696647644043, "learning_rate": 7.792498543257583e-05, "loss": 0.7364, "mean_token_accuracy": 0.7805099450051785, "num_tokens": 229771985.0, "step": 7199 }, { "entropy": 0.687608472071588, "epoch": 0.6624458743768006, "grad_norm": 0.1619928926229477, "learning_rate": 7.792191860643421e-05, "loss": 0.6695, "mean_token_accuracy": 0.8019772469997406, "num_tokens": 229804463.0, "step": 7200 }, { "entropy": 0.765262559056282, "epoch": 0.6625378807482418, "grad_norm": 0.15256145596504211, "learning_rate": 7.791885178029257e-05, "loss": 0.7501, "mean_token_accuracy": 0.7798644341528416, "num_tokens": 229836915.0, "step": 7201 }, { "entropy": 0.785696055740118, "epoch": 0.6626298871196831, "grad_norm": 0.15584443509578705, "learning_rate": 7.791578495415096e-05, "loss": 0.7669, "mean_token_accuracy": 0.7734165042638779, "num_tokens": 229868491.0, "step": 7202 }, { "entropy": 0.6436558607965708, "epoch": 0.6627218934911243, "grad_norm": 0.1528477519750595, "learning_rate": 7.791271812800934e-05, "loss": 0.6174, "mean_token_accuracy": 0.8128049001097679, "num_tokens": 229900314.0, "step": 7203 }, { "entropy": 0.7378689926117659, "epoch": 0.6628138998625654, "grad_norm": 0.1630687266588211, "learning_rate": 7.79096513018677e-05, "loss": 0.7372, "mean_token_accuracy": 0.7838071994483471, "num_tokens": 229931889.0, "step": 7204 }, { "entropy": 0.7272914927452803, "epoch": 0.6629059062340067, "grad_norm": 0.15297739207744598, "learning_rate": 7.790658447572607e-05, "loss": 0.7273, "mean_token_accuracy": 0.7843968607485294, "num_tokens": 229963449.0, "step": 7205 }, { "entropy": 0.7010822147130966, "epoch": 0.6629979126054479, "grad_norm": 0.14901895821094513, "learning_rate": 7.790351764958444e-05, "loss": 0.6932, "mean_token_accuracy": 0.7950911223888397, "num_tokens": 229995544.0, "step": 7206 }, { "entropy": 0.9184204395860434, "epoch": 0.6630899189768892, "grad_norm": 0.16302217543125153, "learning_rate": 7.790045082344282e-05, "loss": 0.9246, "mean_token_accuracy": 0.7339715212583542, "num_tokens": 230027916.0, "step": 7207 }, { "entropy": 0.782778499647975, "epoch": 0.6631819253483304, "grad_norm": 0.16153500974178314, "learning_rate": 7.78973839973012e-05, "loss": 0.7834, "mean_token_accuracy": 0.7748010605573654, "num_tokens": 230060092.0, "step": 7208 }, { "entropy": 0.7497196458280087, "epoch": 0.6632739317197716, "grad_norm": 0.15458109974861145, "learning_rate": 7.789431717115957e-05, "loss": 0.7398, "mean_token_accuracy": 0.7788632363080978, "num_tokens": 230091745.0, "step": 7209 }, { "entropy": 0.7108439709991217, "epoch": 0.6633659380912128, "grad_norm": 0.15555335581302643, "learning_rate": 7.789125034501794e-05, "loss": 0.6868, "mean_token_accuracy": 0.7960537299513817, "num_tokens": 230122808.0, "step": 7210 }, { "entropy": 0.8568577487021685, "epoch": 0.663457944462654, "grad_norm": 0.16400636732578278, "learning_rate": 7.788818351887632e-05, "loss": 0.8646, "mean_token_accuracy": 0.7507740780711174, "num_tokens": 230153719.0, "step": 7211 }, { "entropy": 0.8009299114346504, "epoch": 0.6635499508340953, "grad_norm": 0.1686132848262787, "learning_rate": 7.788511669273469e-05, "loss": 0.7964, "mean_token_accuracy": 0.7675279453396797, "num_tokens": 230184871.0, "step": 7212 }, { "entropy": 0.7229946926236153, "epoch": 0.6636419572055365, "grad_norm": 0.14792470633983612, "learning_rate": 7.788204986659307e-05, "loss": 0.7232, "mean_token_accuracy": 0.7845156714320183, "num_tokens": 230217253.0, "step": 7213 }, { "entropy": 0.6339634135365486, "epoch": 0.6637339635769777, "grad_norm": 0.15855824947357178, "learning_rate": 7.787898304045144e-05, "loss": 0.6199, "mean_token_accuracy": 0.8171676993370056, "num_tokens": 230249815.0, "step": 7214 }, { "entropy": 0.7585415150970221, "epoch": 0.6638259699484189, "grad_norm": 0.16394172608852386, "learning_rate": 7.787591621430982e-05, "loss": 0.7531, "mean_token_accuracy": 0.7804777733981609, "num_tokens": 230282068.0, "step": 7215 }, { "entropy": 0.767007140442729, "epoch": 0.6639179763198602, "grad_norm": 0.16636043787002563, "learning_rate": 7.787284938816819e-05, "loss": 0.7521, "mean_token_accuracy": 0.7795507647097111, "num_tokens": 230313877.0, "step": 7216 }, { "entropy": 0.7378750592470169, "epoch": 0.6640099826913014, "grad_norm": 0.1638476401567459, "learning_rate": 7.786978256202656e-05, "loss": 0.7381, "mean_token_accuracy": 0.7783005423843861, "num_tokens": 230345058.0, "step": 7217 }, { "entropy": 0.8114488162100315, "epoch": 0.6641019890627426, "grad_norm": 0.17333778738975525, "learning_rate": 7.786671573588494e-05, "loss": 0.8223, "mean_token_accuracy": 0.7569247670471668, "num_tokens": 230376281.0, "step": 7218 }, { "entropy": 0.792849238961935, "epoch": 0.6641939954341838, "grad_norm": 0.14968828856945038, "learning_rate": 7.786364890974332e-05, "loss": 0.7727, "mean_token_accuracy": 0.770256768912077, "num_tokens": 230408179.0, "step": 7219 }, { "entropy": 0.7686274088919163, "epoch": 0.664286001805625, "grad_norm": 0.15407994389533997, "learning_rate": 7.786058208360169e-05, "loss": 0.7427, "mean_token_accuracy": 0.7792148664593697, "num_tokens": 230439100.0, "step": 7220 }, { "entropy": 0.8619262725114822, "epoch": 0.6643780081770663, "grad_norm": 0.15729765594005585, "learning_rate": 7.785751525746005e-05, "loss": 0.84, "mean_token_accuracy": 0.7489509657025337, "num_tokens": 230470411.0, "step": 7221 }, { "entropy": 0.8669664710760117, "epoch": 0.6644700145485075, "grad_norm": 0.16317719221115112, "learning_rate": 7.785444843131842e-05, "loss": 0.8651, "mean_token_accuracy": 0.7514809034764767, "num_tokens": 230501396.0, "step": 7222 }, { "entropy": 0.7070004008710384, "epoch": 0.6645620209199488, "grad_norm": 0.148972749710083, "learning_rate": 7.78513816051768e-05, "loss": 0.6898, "mean_token_accuracy": 0.7967566065490246, "num_tokens": 230533281.0, "step": 7223 }, { "entropy": 0.7767420634627342, "epoch": 0.6646540272913899, "grad_norm": 0.15554732084274292, "learning_rate": 7.784831477903518e-05, "loss": 0.7564, "mean_token_accuracy": 0.7761899046599865, "num_tokens": 230564327.0, "step": 7224 }, { "entropy": 0.7570941932499409, "epoch": 0.6647460336628311, "grad_norm": 0.1591244488954544, "learning_rate": 7.784524795289355e-05, "loss": 0.7378, "mean_token_accuracy": 0.7804356254637241, "num_tokens": 230596155.0, "step": 7225 }, { "entropy": 0.7202113829553127, "epoch": 0.6648380400342724, "grad_norm": 0.16432209312915802, "learning_rate": 7.784218112675192e-05, "loss": 0.7045, "mean_token_accuracy": 0.7915908433496952, "num_tokens": 230628057.0, "step": 7226 }, { "entropy": 0.7448302991688251, "epoch": 0.6649300464057136, "grad_norm": 0.15480899810791016, "learning_rate": 7.78391143006103e-05, "loss": 0.7302, "mean_token_accuracy": 0.7820852287113667, "num_tokens": 230660270.0, "step": 7227 }, { "entropy": 0.7547538876533508, "epoch": 0.6650220527771549, "grad_norm": 0.15015776455402374, "learning_rate": 7.783604747446867e-05, "loss": 0.7195, "mean_token_accuracy": 0.7857321836054325, "num_tokens": 230692094.0, "step": 7228 }, { "entropy": 0.7435498889535666, "epoch": 0.665114059148596, "grad_norm": 0.1629895716905594, "learning_rate": 7.783298064832705e-05, "loss": 0.7288, "mean_token_accuracy": 0.7878827787935734, "num_tokens": 230724113.0, "step": 7229 }, { "entropy": 0.6922519635409117, "epoch": 0.6652060655200372, "grad_norm": 0.14989057183265686, "learning_rate": 7.782991382218542e-05, "loss": 0.6778, "mean_token_accuracy": 0.8016266040503979, "num_tokens": 230756425.0, "step": 7230 }, { "entropy": 0.6067942073568702, "epoch": 0.6652980718914785, "grad_norm": 0.1525450497865677, "learning_rate": 7.78268469960438e-05, "loss": 0.5893, "mean_token_accuracy": 0.8213554099202156, "num_tokens": 230788827.0, "step": 7231 }, { "entropy": 0.8218413032591343, "epoch": 0.6653900782629197, "grad_norm": 0.1471240073442459, "learning_rate": 7.782378016990217e-05, "loss": 0.8208, "mean_token_accuracy": 0.759485449641943, "num_tokens": 230820767.0, "step": 7232 }, { "entropy": 0.7039004731923342, "epoch": 0.665482084634361, "grad_norm": 0.15769435465335846, "learning_rate": 7.782071334376054e-05, "loss": 0.6907, "mean_token_accuracy": 0.7986172996461391, "num_tokens": 230853173.0, "step": 7233 }, { "entropy": 0.6972402827814221, "epoch": 0.6655740910058021, "grad_norm": 0.16075727343559265, "learning_rate": 7.781764651761893e-05, "loss": 0.6968, "mean_token_accuracy": 0.792697723954916, "num_tokens": 230885381.0, "step": 7234 }, { "entropy": 0.7655957341194153, "epoch": 0.6656660973772434, "grad_norm": 0.1555275022983551, "learning_rate": 7.78145796914773e-05, "loss": 0.7591, "mean_token_accuracy": 0.7754972130060196, "num_tokens": 230916141.0, "step": 7235 }, { "entropy": 0.8468116242438555, "epoch": 0.6657581037486846, "grad_norm": 0.15967808663845062, "learning_rate": 7.781151286533567e-05, "loss": 0.835, "mean_token_accuracy": 0.7583351843059063, "num_tokens": 230948798.0, "step": 7236 }, { "entropy": 0.7673567347228527, "epoch": 0.6658501101201258, "grad_norm": 0.15242692828178406, "learning_rate": 7.780844603919404e-05, "loss": 0.7466, "mean_token_accuracy": 0.7798983566462994, "num_tokens": 230980403.0, "step": 7237 }, { "entropy": 0.7245159335434437, "epoch": 0.6659421164915671, "grad_norm": 0.15395782887935638, "learning_rate": 7.780537921305242e-05, "loss": 0.7055, "mean_token_accuracy": 0.7868083715438843, "num_tokens": 231011831.0, "step": 7238 }, { "entropy": 0.6851564552634954, "epoch": 0.6660341228630082, "grad_norm": 0.1556026190519333, "learning_rate": 7.78023123869108e-05, "loss": 0.6913, "mean_token_accuracy": 0.7971775084733963, "num_tokens": 231043979.0, "step": 7239 }, { "entropy": 0.7445642845705152, "epoch": 0.6661261292344495, "grad_norm": 0.15672510862350464, "learning_rate": 7.779924556076917e-05, "loss": 0.7431, "mean_token_accuracy": 0.781959991902113, "num_tokens": 231076331.0, "step": 7240 }, { "entropy": 0.7675095535814762, "epoch": 0.6662181356058907, "grad_norm": 0.15259268879890442, "learning_rate": 7.779617873462753e-05, "loss": 0.7496, "mean_token_accuracy": 0.7745702676475048, "num_tokens": 231108690.0, "step": 7241 }, { "entropy": 0.7669889908283949, "epoch": 0.666310141977332, "grad_norm": 0.15139742195606232, "learning_rate": 7.779311190848592e-05, "loss": 0.7459, "mean_token_accuracy": 0.7817570641636848, "num_tokens": 231140976.0, "step": 7242 }, { "entropy": 0.6540810726583004, "epoch": 0.6664021483487732, "grad_norm": 0.1583012044429779, "learning_rate": 7.779004508234428e-05, "loss": 0.6416, "mean_token_accuracy": 0.811349656432867, "num_tokens": 231173181.0, "step": 7243 }, { "entropy": 0.7260481892153621, "epoch": 0.6664941547202143, "grad_norm": 0.15663181245326996, "learning_rate": 7.778697825620266e-05, "loss": 0.7038, "mean_token_accuracy": 0.7892933301627636, "num_tokens": 231204821.0, "step": 7244 }, { "entropy": 0.6510884333401918, "epoch": 0.6665861610916556, "grad_norm": 0.1622650921344757, "learning_rate": 7.778391143006103e-05, "loss": 0.6577, "mean_token_accuracy": 0.8016504943370819, "num_tokens": 231237157.0, "step": 7245 }, { "entropy": 0.7531710360199213, "epoch": 0.6666781674630968, "grad_norm": 0.1651827096939087, "learning_rate": 7.778084460391941e-05, "loss": 0.7595, "mean_token_accuracy": 0.7767657861113548, "num_tokens": 231268477.0, "step": 7246 }, { "entropy": 0.7959143836051226, "epoch": 0.6667701738345381, "grad_norm": 0.16628850996494293, "learning_rate": 7.777777777777778e-05, "loss": 0.7985, "mean_token_accuracy": 0.7650587894022465, "num_tokens": 231299802.0, "step": 7247 }, { "entropy": 0.9703712686896324, "epoch": 0.6668621802059793, "grad_norm": 0.1660739779472351, "learning_rate": 7.777471095163615e-05, "loss": 0.9668, "mean_token_accuracy": 0.7305312603712082, "num_tokens": 231331855.0, "step": 7248 }, { "entropy": 0.756624273955822, "epoch": 0.6669541865774204, "grad_norm": 0.1574835479259491, "learning_rate": 7.777164412549453e-05, "loss": 0.7427, "mean_token_accuracy": 0.7860460840165615, "num_tokens": 231364216.0, "step": 7249 }, { "entropy": 0.7411985285580158, "epoch": 0.6670461929488617, "grad_norm": 0.14998140931129456, "learning_rate": 7.776857729935291e-05, "loss": 0.7204, "mean_token_accuracy": 0.7866833582520485, "num_tokens": 231395862.0, "step": 7250 }, { "entropy": 0.7895010877400637, "epoch": 0.6671381993203029, "grad_norm": 0.15076889097690582, "learning_rate": 7.776551047321128e-05, "loss": 0.7825, "mean_token_accuracy": 0.7661961354315281, "num_tokens": 231427168.0, "step": 7251 }, { "entropy": 0.7408136054873466, "epoch": 0.6672302056917442, "grad_norm": 0.156294584274292, "learning_rate": 7.776244364706965e-05, "loss": 0.7059, "mean_token_accuracy": 0.7922790497541428, "num_tokens": 231459394.0, "step": 7252 }, { "entropy": 0.7724322006106377, "epoch": 0.6673222120631854, "grad_norm": 0.15439550578594208, "learning_rate": 7.775937682092802e-05, "loss": 0.7649, "mean_token_accuracy": 0.7772329859435558, "num_tokens": 231491401.0, "step": 7253 }, { "entropy": 0.801052276045084, "epoch": 0.6674142184346266, "grad_norm": 0.15492068231105804, "learning_rate": 7.77563099947864e-05, "loss": 0.7956, "mean_token_accuracy": 0.7704662978649139, "num_tokens": 231523125.0, "step": 7254 }, { "entropy": 0.7652567084878683, "epoch": 0.6675062248060678, "grad_norm": 0.16172677278518677, "learning_rate": 7.775324316864478e-05, "loss": 0.7568, "mean_token_accuracy": 0.7861545160412788, "num_tokens": 231554201.0, "step": 7255 }, { "entropy": 0.8538478650152683, "epoch": 0.667598231177509, "grad_norm": 0.17005343735218048, "learning_rate": 7.775017634250315e-05, "loss": 0.8385, "mean_token_accuracy": 0.7563003189861774, "num_tokens": 231585270.0, "step": 7256 }, { "entropy": 0.7900725472718477, "epoch": 0.6676902375489503, "grad_norm": 0.16013045608997345, "learning_rate": 7.774710951636151e-05, "loss": 0.7756, "mean_token_accuracy": 0.7709344513714314, "num_tokens": 231616688.0, "step": 7257 }, { "entropy": 0.709467800334096, "epoch": 0.6677822439203915, "grad_norm": 0.1559496372938156, "learning_rate": 7.77440426902199e-05, "loss": 0.6838, "mean_token_accuracy": 0.797319695353508, "num_tokens": 231648996.0, "step": 7258 }, { "entropy": 0.753263033926487, "epoch": 0.6678742502918327, "grad_norm": 0.15340104699134827, "learning_rate": 7.774097586407826e-05, "loss": 0.7385, "mean_token_accuracy": 0.7812292724847794, "num_tokens": 231681064.0, "step": 7259 }, { "entropy": 0.6586194131523371, "epoch": 0.6679662566632739, "grad_norm": 0.15376117825508118, "learning_rate": 7.773790903793665e-05, "loss": 0.639, "mean_token_accuracy": 0.8085504956543446, "num_tokens": 231712706.0, "step": 7260 }, { "entropy": 0.7540621794760227, "epoch": 0.6680582630347152, "grad_norm": 0.16874273121356964, "learning_rate": 7.773484221179503e-05, "loss": 0.7373, "mean_token_accuracy": 0.7819127701222897, "num_tokens": 231744091.0, "step": 7261 }, { "entropy": 0.7254529390484095, "epoch": 0.6681502694061564, "grad_norm": 0.16007472574710846, "learning_rate": 7.77317753856534e-05, "loss": 0.7129, "mean_token_accuracy": 0.7873449809849262, "num_tokens": 231775910.0, "step": 7262 }, { "entropy": 0.729896318167448, "epoch": 0.6682422757775976, "grad_norm": 0.16253864765167236, "learning_rate": 7.772870855951176e-05, "loss": 0.7312, "mean_token_accuracy": 0.7798079028725624, "num_tokens": 231807748.0, "step": 7263 }, { "entropy": 0.7525919014587998, "epoch": 0.6683342821490388, "grad_norm": 0.15485605597496033, "learning_rate": 7.772564173337013e-05, "loss": 0.7509, "mean_token_accuracy": 0.7812438830733299, "num_tokens": 231839698.0, "step": 7264 }, { "entropy": 0.7367272283881903, "epoch": 0.66842628852048, "grad_norm": 0.1737295389175415, "learning_rate": 7.772257490722851e-05, "loss": 0.7258, "mean_token_accuracy": 0.7821048982441425, "num_tokens": 231870996.0, "step": 7265 }, { "entropy": 0.7164717838168144, "epoch": 0.6685182948919213, "grad_norm": 0.15275603532791138, "learning_rate": 7.771950808108689e-05, "loss": 0.7257, "mean_token_accuracy": 0.7813126593828201, "num_tokens": 231903527.0, "step": 7266 }, { "entropy": 0.7405095305293798, "epoch": 0.6686103012633625, "grad_norm": 0.15390346944332123, "learning_rate": 7.771644125494526e-05, "loss": 0.7317, "mean_token_accuracy": 0.78241853043437, "num_tokens": 231936147.0, "step": 7267 }, { "entropy": 0.8274130281060934, "epoch": 0.6687023076348038, "grad_norm": 0.14870071411132812, "learning_rate": 7.771337442880363e-05, "loss": 0.8194, "mean_token_accuracy": 0.7565251179039478, "num_tokens": 231968046.0, "step": 7268 }, { "entropy": 0.8527082204818726, "epoch": 0.6687943140062449, "grad_norm": 0.16197599470615387, "learning_rate": 7.771030760266201e-05, "loss": 0.8397, "mean_token_accuracy": 0.7522659935057163, "num_tokens": 231999414.0, "step": 7269 }, { "entropy": 0.7781840432435274, "epoch": 0.6688863203776861, "grad_norm": 0.15549057722091675, "learning_rate": 7.770724077652038e-05, "loss": 0.7719, "mean_token_accuracy": 0.770779587328434, "num_tokens": 232031827.0, "step": 7270 }, { "entropy": 0.8175007048994303, "epoch": 0.6689783267491274, "grad_norm": 0.15912765264511108, "learning_rate": 7.770417395037876e-05, "loss": 0.8109, "mean_token_accuracy": 0.7656826004385948, "num_tokens": 232063921.0, "step": 7271 }, { "entropy": 0.8588179498910904, "epoch": 0.6690703331205686, "grad_norm": 0.1693842113018036, "learning_rate": 7.770110712423713e-05, "loss": 0.8531, "mean_token_accuracy": 0.7585954181849957, "num_tokens": 232094763.0, "step": 7272 }, { "entropy": 0.7388372384011745, "epoch": 0.6691623394920099, "grad_norm": 0.15534831583499908, "learning_rate": 7.769804029809551e-05, "loss": 0.7297, "mean_token_accuracy": 0.7844401970505714, "num_tokens": 232126661.0, "step": 7273 }, { "entropy": 0.7230708561837673, "epoch": 0.669254345863451, "grad_norm": 0.16624729335308075, "learning_rate": 7.769497347195388e-05, "loss": 0.704, "mean_token_accuracy": 0.794043131172657, "num_tokens": 232158795.0, "step": 7274 }, { "entropy": 0.7357456907629967, "epoch": 0.6693463522348923, "grad_norm": 0.16089074313640594, "learning_rate": 7.769190664581226e-05, "loss": 0.7224, "mean_token_accuracy": 0.7911581546068192, "num_tokens": 232190933.0, "step": 7275 }, { "entropy": 0.8205534480512142, "epoch": 0.6694383586063335, "grad_norm": 0.16480417549610138, "learning_rate": 7.768883981967063e-05, "loss": 0.8096, "mean_token_accuracy": 0.7643824368715286, "num_tokens": 232222092.0, "step": 7276 }, { "entropy": 0.7591274045407772, "epoch": 0.6695303649777747, "grad_norm": 0.15514419972896576, "learning_rate": 7.768577299352901e-05, "loss": 0.7428, "mean_token_accuracy": 0.7807882651686668, "num_tokens": 232254249.0, "step": 7277 }, { "entropy": 0.770433759316802, "epoch": 0.669622371349216, "grad_norm": 0.1576274186372757, "learning_rate": 7.768270616738738e-05, "loss": 0.7629, "mean_token_accuracy": 0.7791608534753323, "num_tokens": 232285975.0, "step": 7278 }, { "entropy": 0.7200944554060698, "epoch": 0.6697143777206571, "grad_norm": 0.15370804071426392, "learning_rate": 7.767963934124574e-05, "loss": 0.722, "mean_token_accuracy": 0.7930160723626614, "num_tokens": 232317592.0, "step": 7279 }, { "entropy": 0.6505838204175234, "epoch": 0.6698063840920984, "grad_norm": 0.1540200561285019, "learning_rate": 7.767657251510412e-05, "loss": 0.6184, "mean_token_accuracy": 0.811643410474062, "num_tokens": 232348654.0, "step": 7280 }, { "entropy": 0.9034317396581173, "epoch": 0.6698983904635396, "grad_norm": 0.16569779813289642, "learning_rate": 7.76735056889625e-05, "loss": 0.8743, "mean_token_accuracy": 0.7481204755604267, "num_tokens": 232379648.0, "step": 7281 }, { "entropy": 0.7662601172924042, "epoch": 0.6699903968349809, "grad_norm": 0.15486879646778107, "learning_rate": 7.767043886282087e-05, "loss": 0.7577, "mean_token_accuracy": 0.7798598520457745, "num_tokens": 232411356.0, "step": 7282 }, { "entropy": 0.7969679497182369, "epoch": 0.6700824032064221, "grad_norm": 0.15850776433944702, "learning_rate": 7.766737203667924e-05, "loss": 0.7855, "mean_token_accuracy": 0.7689728885889053, "num_tokens": 232443395.0, "step": 7283 }, { "entropy": 0.8295304859057069, "epoch": 0.6701744095778632, "grad_norm": 0.16234460473060608, "learning_rate": 7.766430521053761e-05, "loss": 0.8205, "mean_token_accuracy": 0.7664772905409336, "num_tokens": 232476022.0, "step": 7284 }, { "entropy": 0.7408042503520846, "epoch": 0.6702664159493045, "grad_norm": 0.16939599812030792, "learning_rate": 7.766123838439599e-05, "loss": 0.7251, "mean_token_accuracy": 0.7844846732914448, "num_tokens": 232507100.0, "step": 7285 }, { "entropy": 0.789796981960535, "epoch": 0.6703584223207457, "grad_norm": 0.17612802982330322, "learning_rate": 7.765817155825437e-05, "loss": 0.7857, "mean_token_accuracy": 0.7665531747043133, "num_tokens": 232539262.0, "step": 7286 }, { "entropy": 0.7131473235785961, "epoch": 0.670450428692187, "grad_norm": 0.17039760947227478, "learning_rate": 7.765510473211274e-05, "loss": 0.7113, "mean_token_accuracy": 0.7898493371903896, "num_tokens": 232570690.0, "step": 7287 }, { "entropy": 0.7258702907711267, "epoch": 0.6705424350636282, "grad_norm": 0.14657074213027954, "learning_rate": 7.765203790597111e-05, "loss": 0.6923, "mean_token_accuracy": 0.7945442199707031, "num_tokens": 232602354.0, "step": 7288 }, { "entropy": 0.6553861517459154, "epoch": 0.6706344414350693, "grad_norm": 0.14749933779239655, "learning_rate": 7.764897107982949e-05, "loss": 0.6214, "mean_token_accuracy": 0.8122338615357876, "num_tokens": 232634007.0, "step": 7289 }, { "entropy": 0.7940464001148939, "epoch": 0.6707264478065106, "grad_norm": 0.16539432108402252, "learning_rate": 7.764590425368786e-05, "loss": 0.7981, "mean_token_accuracy": 0.7660678997635841, "num_tokens": 232666328.0, "step": 7290 }, { "entropy": 0.8126280177384615, "epoch": 0.6708184541779518, "grad_norm": 0.15779581665992737, "learning_rate": 7.764283742754624e-05, "loss": 0.8006, "mean_token_accuracy": 0.7704895362257957, "num_tokens": 232698397.0, "step": 7291 }, { "entropy": 0.7809961251914501, "epoch": 0.6709104605493931, "grad_norm": 0.15438701212406158, "learning_rate": 7.763977060140462e-05, "loss": 0.7723, "mean_token_accuracy": 0.7715564705431461, "num_tokens": 232730518.0, "step": 7292 }, { "entropy": 0.7444243524223566, "epoch": 0.6710024669208343, "grad_norm": 0.15219172835350037, "learning_rate": 7.763670377526299e-05, "loss": 0.7441, "mean_token_accuracy": 0.7819833122193813, "num_tokens": 232762391.0, "step": 7293 }, { "entropy": 0.7519662622362375, "epoch": 0.6710944732922755, "grad_norm": 0.16198135912418365, "learning_rate": 7.763363694912136e-05, "loss": 0.7305, "mean_token_accuracy": 0.7830474115908146, "num_tokens": 232794561.0, "step": 7294 }, { "entropy": 0.787167239934206, "epoch": 0.6711864796637167, "grad_norm": 0.1500452607870102, "learning_rate": 7.763057012297972e-05, "loss": 0.7815, "mean_token_accuracy": 0.7681902311742306, "num_tokens": 232826704.0, "step": 7295 }, { "entropy": 0.7691180109977722, "epoch": 0.6712784860351579, "grad_norm": 0.15791429579257965, "learning_rate": 7.76275032968381e-05, "loss": 0.756, "mean_token_accuracy": 0.7805138751864433, "num_tokens": 232858698.0, "step": 7296 }, { "entropy": 0.6910213679075241, "epoch": 0.6713704924065992, "grad_norm": 0.16142602264881134, "learning_rate": 7.762443647069649e-05, "loss": 0.676, "mean_token_accuracy": 0.7984922677278519, "num_tokens": 232890482.0, "step": 7297 }, { "entropy": 0.7946796268224716, "epoch": 0.6714624987780404, "grad_norm": 0.16403332352638245, "learning_rate": 7.762136964455485e-05, "loss": 0.8058, "mean_token_accuracy": 0.7669268138706684, "num_tokens": 232922181.0, "step": 7298 }, { "entropy": 0.7242791056632996, "epoch": 0.6715545051494816, "grad_norm": 0.1643524467945099, "learning_rate": 7.761830281841322e-05, "loss": 0.7237, "mean_token_accuracy": 0.7894994392991066, "num_tokens": 232954124.0, "step": 7299 }, { "entropy": 0.7184069529175758, "epoch": 0.6716465115209228, "grad_norm": 0.1661616861820221, "learning_rate": 7.76152359922716e-05, "loss": 0.6818, "mean_token_accuracy": 0.7933006137609482, "num_tokens": 232985548.0, "step": 7300 }, { "entropy": 0.8254362158477306, "epoch": 0.671738517892364, "grad_norm": 0.16149672865867615, "learning_rate": 7.761216916612997e-05, "loss": 0.8189, "mean_token_accuracy": 0.7614533565938473, "num_tokens": 233017035.0, "step": 7301 }, { "entropy": 0.7790338639169931, "epoch": 0.6718305242638053, "grad_norm": 0.16101597249507904, "learning_rate": 7.760910233998835e-05, "loss": 0.7876, "mean_token_accuracy": 0.7710938900709152, "num_tokens": 233049380.0, "step": 7302 }, { "entropy": 0.8246599286794662, "epoch": 0.6719225306352465, "grad_norm": 0.16056320071220398, "learning_rate": 7.760603551384672e-05, "loss": 0.8248, "mean_token_accuracy": 0.7565088495612144, "num_tokens": 233081210.0, "step": 7303 }, { "entropy": 0.7745017409324646, "epoch": 0.6720145370066877, "grad_norm": 0.1651545912027359, "learning_rate": 7.76029686877051e-05, "loss": 0.7719, "mean_token_accuracy": 0.7752514779567719, "num_tokens": 233113418.0, "step": 7304 }, { "entropy": 0.7006810754537582, "epoch": 0.6721065433781289, "grad_norm": 0.16423113644123077, "learning_rate": 7.759990186156347e-05, "loss": 0.6983, "mean_token_accuracy": 0.7969676181674004, "num_tokens": 233145965.0, "step": 7305 }, { "entropy": 0.7475933246314526, "epoch": 0.6721985497495702, "grad_norm": 0.15504081547260284, "learning_rate": 7.759683503542184e-05, "loss": 0.7368, "mean_token_accuracy": 0.7851454839110374, "num_tokens": 233178200.0, "step": 7306 }, { "entropy": 0.7681633308529854, "epoch": 0.6722905561210114, "grad_norm": 0.15190941095352173, "learning_rate": 7.759376820928022e-05, "loss": 0.7569, "mean_token_accuracy": 0.7787247598171234, "num_tokens": 233210586.0, "step": 7307 }, { "entropy": 0.7870308756828308, "epoch": 0.6723825624924527, "grad_norm": 0.15954312682151794, "learning_rate": 7.75907013831386e-05, "loss": 0.8066, "mean_token_accuracy": 0.765832494944334, "num_tokens": 233242223.0, "step": 7308 }, { "entropy": 0.7393241375684738, "epoch": 0.6724745688638938, "grad_norm": 0.1582375019788742, "learning_rate": 7.758763455699697e-05, "loss": 0.7261, "mean_token_accuracy": 0.7837041653692722, "num_tokens": 233273859.0, "step": 7309 }, { "entropy": 0.8885337486863136, "epoch": 0.672566575235335, "grad_norm": 0.1617864966392517, "learning_rate": 7.758456773085534e-05, "loss": 0.8701, "mean_token_accuracy": 0.7481271103024483, "num_tokens": 233305106.0, "step": 7310 }, { "entropy": 0.9024527706205845, "epoch": 0.6726585816067763, "grad_norm": 0.15655925869941711, "learning_rate": 7.75815009047137e-05, "loss": 0.8935, "mean_token_accuracy": 0.7409311793744564, "num_tokens": 233337061.0, "step": 7311 }, { "entropy": 0.780497346073389, "epoch": 0.6727505879782175, "grad_norm": 0.1597587615251541, "learning_rate": 7.75784340785721e-05, "loss": 0.7581, "mean_token_accuracy": 0.7754996679723263, "num_tokens": 233369431.0, "step": 7312 }, { "entropy": 0.6709317583590746, "epoch": 0.6728425943496588, "grad_norm": 0.1514456868171692, "learning_rate": 7.757536725243047e-05, "loss": 0.6372, "mean_token_accuracy": 0.8079072423279285, "num_tokens": 233400887.0, "step": 7313 }, { "entropy": 0.7948476057499647, "epoch": 0.6729346007210999, "grad_norm": 0.1620945781469345, "learning_rate": 7.757230042628884e-05, "loss": 0.7643, "mean_token_accuracy": 0.7804357558488846, "num_tokens": 233432503.0, "step": 7314 }, { "entropy": 0.7471798351034522, "epoch": 0.6730266070925411, "grad_norm": 0.15536236763000488, "learning_rate": 7.75692336001472e-05, "loss": 0.7263, "mean_token_accuracy": 0.7864012233912945, "num_tokens": 233464494.0, "step": 7315 }, { "entropy": 0.7459684275090694, "epoch": 0.6731186134639824, "grad_norm": 0.16447016596794128, "learning_rate": 7.756616677400558e-05, "loss": 0.7338, "mean_token_accuracy": 0.7845535576343536, "num_tokens": 233496718.0, "step": 7316 }, { "entropy": 0.7242030501365662, "epoch": 0.6732106198354236, "grad_norm": 0.1545388400554657, "learning_rate": 7.756309994786397e-05, "loss": 0.7092, "mean_token_accuracy": 0.7924113683402538, "num_tokens": 233528621.0, "step": 7317 }, { "entropy": 0.7565589807927608, "epoch": 0.6733026262068649, "grad_norm": 0.1619139462709427, "learning_rate": 7.756003312172233e-05, "loss": 0.7654, "mean_token_accuracy": 0.7739979512989521, "num_tokens": 233561235.0, "step": 7318 }, { "entropy": 0.7542889788746834, "epoch": 0.673394632578306, "grad_norm": 0.15813805162906647, "learning_rate": 7.75569662955807e-05, "loss": 0.7379, "mean_token_accuracy": 0.7827187590301037, "num_tokens": 233593671.0, "step": 7319 }, { "entropy": 0.8347251359373331, "epoch": 0.6734866389497473, "grad_norm": 0.15935246646404266, "learning_rate": 7.755389946943908e-05, "loss": 0.8245, "mean_token_accuracy": 0.7580458000302315, "num_tokens": 233625532.0, "step": 7320 }, { "entropy": 0.6262325011193752, "epoch": 0.6735786453211885, "grad_norm": 0.16029663383960724, "learning_rate": 7.755083264329745e-05, "loss": 0.6151, "mean_token_accuracy": 0.8174208663403988, "num_tokens": 233657050.0, "step": 7321 }, { "entropy": 0.7095934972167015, "epoch": 0.6736706516926297, "grad_norm": 0.16892899572849274, "learning_rate": 7.754776581715583e-05, "loss": 0.7134, "mean_token_accuracy": 0.790358129888773, "num_tokens": 233689335.0, "step": 7322 }, { "entropy": 0.7022652104496956, "epoch": 0.673762658064071, "grad_norm": 0.15540790557861328, "learning_rate": 7.754469899101421e-05, "loss": 0.6888, "mean_token_accuracy": 0.7960202433168888, "num_tokens": 233721436.0, "step": 7323 }, { "entropy": 0.6592752281576395, "epoch": 0.6738546644355121, "grad_norm": 0.1642361432313919, "learning_rate": 7.754163216487258e-05, "loss": 0.6457, "mean_token_accuracy": 0.8107647337019444, "num_tokens": 233753367.0, "step": 7324 }, { "entropy": 0.7589376848191023, "epoch": 0.6739466708069534, "grad_norm": 0.17393146455287933, "learning_rate": 7.753856533873095e-05, "loss": 0.7777, "mean_token_accuracy": 0.7711551897227764, "num_tokens": 233785691.0, "step": 7325 }, { "entropy": 0.8542578332126141, "epoch": 0.6740386771783946, "grad_norm": 0.15906842052936554, "learning_rate": 7.753549851258932e-05, "loss": 0.8574, "mean_token_accuracy": 0.7518262043595314, "num_tokens": 233817109.0, "step": 7326 }, { "entropy": 0.8454954698681831, "epoch": 0.6741306835498359, "grad_norm": 0.16477827727794647, "learning_rate": 7.75324316864477e-05, "loss": 0.8379, "mean_token_accuracy": 0.7587021142244339, "num_tokens": 233849116.0, "step": 7327 }, { "entropy": 0.7006620764732361, "epoch": 0.6742226899212771, "grad_norm": 0.1546269804239273, "learning_rate": 7.752936486030608e-05, "loss": 0.6836, "mean_token_accuracy": 0.8029907718300819, "num_tokens": 233881708.0, "step": 7328 }, { "entropy": 0.7417717780917883, "epoch": 0.6743146962927182, "grad_norm": 0.1542491912841797, "learning_rate": 7.752629803416445e-05, "loss": 0.7224, "mean_token_accuracy": 0.7890417389571667, "num_tokens": 233913194.0, "step": 7329 }, { "entropy": 0.7937721908092499, "epoch": 0.6744067026641595, "grad_norm": 0.15191398561000824, "learning_rate": 7.752323120802282e-05, "loss": 0.7896, "mean_token_accuracy": 0.7680932022631168, "num_tokens": 233945481.0, "step": 7330 }, { "entropy": 0.7105566551908851, "epoch": 0.6744987090356007, "grad_norm": 0.14469093084335327, "learning_rate": 7.75201643818812e-05, "loss": 0.7012, "mean_token_accuracy": 0.7915611378848553, "num_tokens": 233977407.0, "step": 7331 }, { "entropy": 0.7399148195981979, "epoch": 0.674590715407042, "grad_norm": 0.15764349699020386, "learning_rate": 7.751709755573957e-05, "loss": 0.7253, "mean_token_accuracy": 0.787391897290945, "num_tokens": 234009608.0, "step": 7332 }, { "entropy": 0.695987006649375, "epoch": 0.6746827217784832, "grad_norm": 0.15157905220985413, "learning_rate": 7.751403072959795e-05, "loss": 0.6776, "mean_token_accuracy": 0.7995686531066895, "num_tokens": 234041303.0, "step": 7333 }, { "entropy": 0.7774870432913303, "epoch": 0.6747747281499243, "grad_norm": 0.16255372762680054, "learning_rate": 7.751096390345631e-05, "loss": 0.7801, "mean_token_accuracy": 0.7744915187358856, "num_tokens": 234072779.0, "step": 7334 }, { "entropy": 0.7469492480158806, "epoch": 0.6748667345213656, "grad_norm": 0.15168879926204681, "learning_rate": 7.75078970773147e-05, "loss": 0.7387, "mean_token_accuracy": 0.7755423448979855, "num_tokens": 234104201.0, "step": 7335 }, { "entropy": 0.7728137634694576, "epoch": 0.6749587408928068, "grad_norm": 0.16534842550754547, "learning_rate": 7.750483025117306e-05, "loss": 0.7635, "mean_token_accuracy": 0.7779363542795181, "num_tokens": 234134694.0, "step": 7336 }, { "entropy": 0.6825873721390963, "epoch": 0.6750507472642481, "grad_norm": 0.1499457061290741, "learning_rate": 7.750176342503143e-05, "loss": 0.6453, "mean_token_accuracy": 0.8053931929171085, "num_tokens": 234166896.0, "step": 7337 }, { "entropy": 0.7278263419866562, "epoch": 0.6751427536356893, "grad_norm": 0.1452217698097229, "learning_rate": 7.749869659888981e-05, "loss": 0.7054, "mean_token_accuracy": 0.7886778637766838, "num_tokens": 234199231.0, "step": 7338 }, { "entropy": 0.6503347475081682, "epoch": 0.6752347600071305, "grad_norm": 0.1501016765832901, "learning_rate": 7.74956297727482e-05, "loss": 0.6265, "mean_token_accuracy": 0.809617668390274, "num_tokens": 234230784.0, "step": 7339 }, { "entropy": 0.7445249557495117, "epoch": 0.6753267663785717, "grad_norm": 0.16659149527549744, "learning_rate": 7.749256294660656e-05, "loss": 0.7416, "mean_token_accuracy": 0.7833022475242615, "num_tokens": 234262749.0, "step": 7340 }, { "entropy": 0.8911267928779125, "epoch": 0.6754187727500129, "grad_norm": 0.15881893038749695, "learning_rate": 7.748949612046493e-05, "loss": 0.8811, "mean_token_accuracy": 0.7459121532738209, "num_tokens": 234294417.0, "step": 7341 }, { "entropy": 0.7276895046234131, "epoch": 0.6755107791214542, "grad_norm": 0.15152974426746368, "learning_rate": 7.74864292943233e-05, "loss": 0.7244, "mean_token_accuracy": 0.7848358154296875, "num_tokens": 234326935.0, "step": 7342 }, { "entropy": 0.9092724360525608, "epoch": 0.6756027854928954, "grad_norm": 0.16690486669540405, "learning_rate": 7.748336246818168e-05, "loss": 0.9065, "mean_token_accuracy": 0.7413832768797874, "num_tokens": 234359265.0, "step": 7343 }, { "entropy": 0.6926062125712633, "epoch": 0.6756947918643366, "grad_norm": 0.15047413110733032, "learning_rate": 7.748029564204006e-05, "loss": 0.6869, "mean_token_accuracy": 0.7946112304925919, "num_tokens": 234391162.0, "step": 7344 }, { "entropy": 0.6418612617999315, "epoch": 0.6757867982357778, "grad_norm": 0.15505586564540863, "learning_rate": 7.747722881589843e-05, "loss": 0.6195, "mean_token_accuracy": 0.8165277056396008, "num_tokens": 234423453.0, "step": 7345 }, { "entropy": 0.7666782438755035, "epoch": 0.675878804607219, "grad_norm": 0.15124613046646118, "learning_rate": 7.74741619897568e-05, "loss": 0.7654, "mean_token_accuracy": 0.7746237963438034, "num_tokens": 234455528.0, "step": 7346 }, { "entropy": 0.7443847712129354, "epoch": 0.6759708109786603, "grad_norm": 0.15459635853767395, "learning_rate": 7.747109516361518e-05, "loss": 0.7255, "mean_token_accuracy": 0.7872141450643539, "num_tokens": 234488001.0, "step": 7347 }, { "entropy": 0.7299632281064987, "epoch": 0.6760628173501015, "grad_norm": 0.1517024040222168, "learning_rate": 7.746802833747355e-05, "loss": 0.7295, "mean_token_accuracy": 0.7840221673250198, "num_tokens": 234519531.0, "step": 7348 }, { "entropy": 0.7200689939782023, "epoch": 0.6761548237215427, "grad_norm": 0.15484964847564697, "learning_rate": 7.746496151133193e-05, "loss": 0.7092, "mean_token_accuracy": 0.7893388234078884, "num_tokens": 234551563.0, "step": 7349 }, { "entropy": 0.6974947033450007, "epoch": 0.6762468300929839, "grad_norm": 0.17469030618667603, "learning_rate": 7.74618946851903e-05, "loss": 0.7009, "mean_token_accuracy": 0.7877567000687122, "num_tokens": 234583979.0, "step": 7350 }, { "entropy": 0.7674193233251572, "epoch": 0.6763388364644252, "grad_norm": 0.15580187737941742, "learning_rate": 7.745882785904868e-05, "loss": 0.7537, "mean_token_accuracy": 0.7773704454302788, "num_tokens": 234615523.0, "step": 7351 }, { "entropy": 0.786311587318778, "epoch": 0.6764308428358664, "grad_norm": 0.1600351184606552, "learning_rate": 7.745576103290704e-05, "loss": 0.7866, "mean_token_accuracy": 0.7688491642475128, "num_tokens": 234647186.0, "step": 7352 }, { "entropy": 0.7500151451677084, "epoch": 0.6765228492073077, "grad_norm": 0.15044352412223816, "learning_rate": 7.745269420676541e-05, "loss": 0.7337, "mean_token_accuracy": 0.7849756292998791, "num_tokens": 234679599.0, "step": 7353 }, { "entropy": 0.6053790990263224, "epoch": 0.6766148555787488, "grad_norm": 0.15317362546920776, "learning_rate": 7.744962738062381e-05, "loss": 0.5804, "mean_token_accuracy": 0.8274618983268738, "num_tokens": 234712218.0, "step": 7354 }, { "entropy": 0.764061763882637, "epoch": 0.67670686195019, "grad_norm": 0.15360121428966522, "learning_rate": 7.744656055448218e-05, "loss": 0.7418, "mean_token_accuracy": 0.7790607549250126, "num_tokens": 234744565.0, "step": 7355 }, { "entropy": 0.7120874617248774, "epoch": 0.6767988683216313, "grad_norm": 0.1623067557811737, "learning_rate": 7.744349372834054e-05, "loss": 0.7111, "mean_token_accuracy": 0.7900125980377197, "num_tokens": 234776301.0, "step": 7356 }, { "entropy": 0.7327252645045519, "epoch": 0.6768908746930725, "grad_norm": 0.16525514423847198, "learning_rate": 7.744042690219891e-05, "loss": 0.7257, "mean_token_accuracy": 0.7848835065960884, "num_tokens": 234807575.0, "step": 7357 }, { "entropy": 0.7936296705156565, "epoch": 0.6769828810645138, "grad_norm": 0.1650097370147705, "learning_rate": 7.743736007605729e-05, "loss": 0.7805, "mean_token_accuracy": 0.7738691568374634, "num_tokens": 234838840.0, "step": 7358 }, { "entropy": 0.6720875650644302, "epoch": 0.6770748874359549, "grad_norm": 0.148561030626297, "learning_rate": 7.743429324991567e-05, "loss": 0.6591, "mean_token_accuracy": 0.8040415085852146, "num_tokens": 234870990.0, "step": 7359 }, { "entropy": 0.818424366414547, "epoch": 0.6771668938073961, "grad_norm": 0.15591692924499512, "learning_rate": 7.743122642377404e-05, "loss": 0.8073, "mean_token_accuracy": 0.7626658193767071, "num_tokens": 234903076.0, "step": 7360 }, { "entropy": 0.7846440114080906, "epoch": 0.6772589001788374, "grad_norm": 0.15490517020225525, "learning_rate": 7.742815959763241e-05, "loss": 0.765, "mean_token_accuracy": 0.7750608958303928, "num_tokens": 234935552.0, "step": 7361 }, { "entropy": 0.7632138323970139, "epoch": 0.6773509065502786, "grad_norm": 0.1628345549106598, "learning_rate": 7.742509277149079e-05, "loss": 0.75, "mean_token_accuracy": 0.7810094505548477, "num_tokens": 234966948.0, "step": 7362 }, { "entropy": 0.7259329315274954, "epoch": 0.6774429129217199, "grad_norm": 0.1587395817041397, "learning_rate": 7.742202594534916e-05, "loss": 0.7132, "mean_token_accuracy": 0.788999866694212, "num_tokens": 234999017.0, "step": 7363 }, { "entropy": 0.7437162455171347, "epoch": 0.677534919293161, "grad_norm": 0.16720286011695862, "learning_rate": 7.741895911920754e-05, "loss": 0.7202, "mean_token_accuracy": 0.7864535674452782, "num_tokens": 235031420.0, "step": 7364 }, { "entropy": 0.7222743574529886, "epoch": 0.6776269256646023, "grad_norm": 0.15129750967025757, "learning_rate": 7.741589229306591e-05, "loss": 0.7156, "mean_token_accuracy": 0.7881825044751167, "num_tokens": 235062988.0, "step": 7365 }, { "entropy": 0.7101829387247562, "epoch": 0.6777189320360435, "grad_norm": 0.16149188578128815, "learning_rate": 7.741282546692429e-05, "loss": 0.6992, "mean_token_accuracy": 0.7929912582039833, "num_tokens": 235094728.0, "step": 7366 }, { "entropy": 0.8223206494003534, "epoch": 0.6778109384074847, "grad_norm": 0.16254597902297974, "learning_rate": 7.740975864078266e-05, "loss": 0.8115, "mean_token_accuracy": 0.7622009739279747, "num_tokens": 235126443.0, "step": 7367 }, { "entropy": 0.7745052948594093, "epoch": 0.677902944778926, "grad_norm": 0.1657203733921051, "learning_rate": 7.740669181464103e-05, "loss": 0.7738, "mean_token_accuracy": 0.775004904717207, "num_tokens": 235158978.0, "step": 7368 }, { "entropy": 0.7373640164732933, "epoch": 0.6779949511503671, "grad_norm": 0.15877671539783478, "learning_rate": 7.740362498849941e-05, "loss": 0.7084, "mean_token_accuracy": 0.7906962558627129, "num_tokens": 235190163.0, "step": 7369 }, { "entropy": 0.7404811549931765, "epoch": 0.6780869575218084, "grad_norm": 0.16041944921016693, "learning_rate": 7.740055816235779e-05, "loss": 0.7158, "mean_token_accuracy": 0.7833210043609142, "num_tokens": 235220961.0, "step": 7370 }, { "entropy": 0.8122723679989576, "epoch": 0.6781789638932496, "grad_norm": 0.15437331795692444, "learning_rate": 7.739749133621616e-05, "loss": 0.8311, "mean_token_accuracy": 0.7532959282398224, "num_tokens": 235253333.0, "step": 7371 }, { "entropy": 0.7822709502652287, "epoch": 0.6782709702646909, "grad_norm": 0.15718981623649597, "learning_rate": 7.739442451007452e-05, "loss": 0.7863, "mean_token_accuracy": 0.7692623622715473, "num_tokens": 235285383.0, "step": 7372 }, { "entropy": 0.7150296531617641, "epoch": 0.6783629766361321, "grad_norm": 0.15663668513298035, "learning_rate": 7.739135768393289e-05, "loss": 0.7051, "mean_token_accuracy": 0.7918086498975754, "num_tokens": 235317629.0, "step": 7373 }, { "entropy": 0.7110081128776073, "epoch": 0.6784549830075732, "grad_norm": 0.15520666539669037, "learning_rate": 7.738829085779127e-05, "loss": 0.7033, "mean_token_accuracy": 0.7945964857935905, "num_tokens": 235349667.0, "step": 7374 }, { "entropy": 0.8246515765786171, "epoch": 0.6785469893790145, "grad_norm": 0.1488068848848343, "learning_rate": 7.738522403164966e-05, "loss": 0.8335, "mean_token_accuracy": 0.7549607530236244, "num_tokens": 235381116.0, "step": 7375 }, { "entropy": 0.642595935612917, "epoch": 0.6786389957504557, "grad_norm": 0.15483611822128296, "learning_rate": 7.738215720550802e-05, "loss": 0.6354, "mean_token_accuracy": 0.8108202926814556, "num_tokens": 235413672.0, "step": 7376 }, { "entropy": 0.7914865501224995, "epoch": 0.678731002121897, "grad_norm": 0.15242330729961395, "learning_rate": 7.737909037936639e-05, "loss": 0.7816, "mean_token_accuracy": 0.7714317440986633, "num_tokens": 235446224.0, "step": 7377 }, { "entropy": 0.6818441599607468, "epoch": 0.6788230084933382, "grad_norm": 0.15817490220069885, "learning_rate": 7.737602355322477e-05, "loss": 0.659, "mean_token_accuracy": 0.8017994537949562, "num_tokens": 235477985.0, "step": 7378 }, { "entropy": 0.7212690748274326, "epoch": 0.6789150148647793, "grad_norm": 0.1585027575492859, "learning_rate": 7.737295672708314e-05, "loss": 0.7308, "mean_token_accuracy": 0.7823378071188927, "num_tokens": 235510701.0, "step": 7379 }, { "entropy": 0.7681048959493637, "epoch": 0.6790070212362206, "grad_norm": 0.1648036688566208, "learning_rate": 7.736988990094152e-05, "loss": 0.7525, "mean_token_accuracy": 0.779227364808321, "num_tokens": 235541850.0, "step": 7380 }, { "entropy": 0.7719811238348484, "epoch": 0.6790990276076618, "grad_norm": 0.15684059262275696, "learning_rate": 7.736682307479989e-05, "loss": 0.737, "mean_token_accuracy": 0.7852162830531597, "num_tokens": 235573056.0, "step": 7381 }, { "entropy": 0.875713549554348, "epoch": 0.6791910339791031, "grad_norm": 0.16381128132343292, "learning_rate": 7.736375624865827e-05, "loss": 0.8604, "mean_token_accuracy": 0.7539408914744854, "num_tokens": 235605534.0, "step": 7382 }, { "entropy": 0.6171670090407133, "epoch": 0.6792830403505443, "grad_norm": 0.15169212222099304, "learning_rate": 7.736068942251664e-05, "loss": 0.61, "mean_token_accuracy": 0.8162909895181656, "num_tokens": 235637885.0, "step": 7383 }, { "entropy": 0.7256463225930929, "epoch": 0.6793750467219855, "grad_norm": 0.16893388330936432, "learning_rate": 7.7357622596375e-05, "loss": 0.7146, "mean_token_accuracy": 0.7895727530121803, "num_tokens": 235670471.0, "step": 7384 }, { "entropy": 0.823699465021491, "epoch": 0.6794670530934267, "grad_norm": 0.15953756868839264, "learning_rate": 7.735455577023339e-05, "loss": 0.804, "mean_token_accuracy": 0.7680992223322392, "num_tokens": 235702361.0, "step": 7385 }, { "entropy": 0.7268590796738863, "epoch": 0.6795590594648679, "grad_norm": 0.1624906361103058, "learning_rate": 7.735148894409177e-05, "loss": 0.6987, "mean_token_accuracy": 0.7940700203180313, "num_tokens": 235733941.0, "step": 7386 }, { "entropy": 0.766047952696681, "epoch": 0.6796510658363092, "grad_norm": 0.16432468593120575, "learning_rate": 7.734842211795014e-05, "loss": 0.743, "mean_token_accuracy": 0.77813371270895, "num_tokens": 235766045.0, "step": 7387 }, { "entropy": 0.7712325798347592, "epoch": 0.6797430722077504, "grad_norm": 0.16628652811050415, "learning_rate": 7.73453552918085e-05, "loss": 0.7426, "mean_token_accuracy": 0.7843572646379471, "num_tokens": 235797910.0, "step": 7388 }, { "entropy": 0.6798674063757062, "epoch": 0.6798350785791916, "grad_norm": 0.15020619332790375, "learning_rate": 7.734228846566689e-05, "loss": 0.6552, "mean_token_accuracy": 0.804684616625309, "num_tokens": 235829227.0, "step": 7389 }, { "entropy": 0.6828232202678919, "epoch": 0.6799270849506328, "grad_norm": 0.1659419685602188, "learning_rate": 7.733922163952525e-05, "loss": 0.6784, "mean_token_accuracy": 0.8035678490996361, "num_tokens": 235861163.0, "step": 7390 }, { "entropy": 0.6995331533253193, "epoch": 0.680019091322074, "grad_norm": 0.15544739365577698, "learning_rate": 7.733615481338364e-05, "loss": 0.6677, "mean_token_accuracy": 0.801600743085146, "num_tokens": 235891940.0, "step": 7391 }, { "entropy": 0.8392040319740772, "epoch": 0.6801110976935153, "grad_norm": 0.17398576438426971, "learning_rate": 7.7333087987242e-05, "loss": 0.83, "mean_token_accuracy": 0.76132707670331, "num_tokens": 235924036.0, "step": 7392 }, { "entropy": 0.7760454900562763, "epoch": 0.6802031040649565, "grad_norm": 0.159798264503479, "learning_rate": 7.733002116110039e-05, "loss": 0.7631, "mean_token_accuracy": 0.7747703976929188, "num_tokens": 235955524.0, "step": 7393 }, { "entropy": 0.7062018942087889, "epoch": 0.6802951104363977, "grad_norm": 0.14948631823062897, "learning_rate": 7.732695433495875e-05, "loss": 0.697, "mean_token_accuracy": 0.7931702360510826, "num_tokens": 235987625.0, "step": 7394 }, { "entropy": 0.6638649608939886, "epoch": 0.6803871168078389, "grad_norm": 0.15372896194458008, "learning_rate": 7.732388750881713e-05, "loss": 0.6632, "mean_token_accuracy": 0.8074601106345654, "num_tokens": 236019506.0, "step": 7395 }, { "entropy": 0.635661518201232, "epoch": 0.6804791231792802, "grad_norm": 0.14886021614074707, "learning_rate": 7.73208206826755e-05, "loss": 0.6187, "mean_token_accuracy": 0.8137947209179401, "num_tokens": 236051787.0, "step": 7396 }, { "entropy": 0.6119104288518429, "epoch": 0.6805711295507214, "grad_norm": 0.16049449145793915, "learning_rate": 7.731775385653388e-05, "loss": 0.6084, "mean_token_accuracy": 0.8205111995339394, "num_tokens": 236083778.0, "step": 7397 }, { "entropy": 0.7971672639250755, "epoch": 0.6806631359221627, "grad_norm": 0.15742094814777374, "learning_rate": 7.731468703039225e-05, "loss": 0.7762, "mean_token_accuracy": 0.772256538271904, "num_tokens": 236116072.0, "step": 7398 }, { "entropy": 0.6678461786359549, "epoch": 0.6807551422936038, "grad_norm": 0.16092033684253693, "learning_rate": 7.731162020425062e-05, "loss": 0.6488, "mean_token_accuracy": 0.8057238832116127, "num_tokens": 236146714.0, "step": 7399 }, { "entropy": 0.6959844380617142, "epoch": 0.680847148665045, "grad_norm": 0.15299130976200104, "learning_rate": 7.7308553378109e-05, "loss": 0.6805, "mean_token_accuracy": 0.7999005578458309, "num_tokens": 236178782.0, "step": 7400 }, { "entropy": 0.6016603838652372, "epoch": 0.6809391550364863, "grad_norm": 0.14420616626739502, "learning_rate": 7.730548655196738e-05, "loss": 0.5867, "mean_token_accuracy": 0.8224248997867107, "num_tokens": 236210286.0, "step": 7401 }, { "entropy": 0.7560275513678789, "epoch": 0.6810311614079275, "grad_norm": 0.18273521959781647, "learning_rate": 7.730241972582575e-05, "loss": 0.7873, "mean_token_accuracy": 0.7722882218658924, "num_tokens": 236241555.0, "step": 7402 }, { "entropy": 0.6690878123044968, "epoch": 0.6811231677793688, "grad_norm": 0.15039797127246857, "learning_rate": 7.729935289968412e-05, "loss": 0.6468, "mean_token_accuracy": 0.8096030503511429, "num_tokens": 236274066.0, "step": 7403 }, { "entropy": 0.8529013060033321, "epoch": 0.6812151741508099, "grad_norm": 0.1619715690612793, "learning_rate": 7.729628607354249e-05, "loss": 0.849, "mean_token_accuracy": 0.7575186155736446, "num_tokens": 236306373.0, "step": 7404 }, { "entropy": 0.7696916908025742, "epoch": 0.6813071805222511, "grad_norm": 0.15448977053165436, "learning_rate": 7.729321924740087e-05, "loss": 0.7757, "mean_token_accuracy": 0.7674227505922318, "num_tokens": 236337767.0, "step": 7405 }, { "entropy": 0.7396837025880814, "epoch": 0.6813991868936924, "grad_norm": 0.15564779937267303, "learning_rate": 7.729015242125925e-05, "loss": 0.7317, "mean_token_accuracy": 0.7854445800185204, "num_tokens": 236369134.0, "step": 7406 }, { "entropy": 0.7737117586657405, "epoch": 0.6814911932651336, "grad_norm": 0.15901023149490356, "learning_rate": 7.728708559511762e-05, "loss": 0.7462, "mean_token_accuracy": 0.7778505943715572, "num_tokens": 236400351.0, "step": 7407 }, { "entropy": 0.843220129609108, "epoch": 0.6815831996365749, "grad_norm": 0.15162770450115204, "learning_rate": 7.728401876897598e-05, "loss": 0.8206, "mean_token_accuracy": 0.7597316056489944, "num_tokens": 236432546.0, "step": 7408 }, { "entropy": 0.6831870079040527, "epoch": 0.681675206008016, "grad_norm": 0.1614047735929489, "learning_rate": 7.728095194283437e-05, "loss": 0.6704, "mean_token_accuracy": 0.8023987673223019, "num_tokens": 236464975.0, "step": 7409 }, { "entropy": 0.7233686670660973, "epoch": 0.6817672123794573, "grad_norm": 0.15500709414482117, "learning_rate": 7.727788511669273e-05, "loss": 0.704, "mean_token_accuracy": 0.7906909883022308, "num_tokens": 236496013.0, "step": 7410 }, { "entropy": 0.6380361337214708, "epoch": 0.6818592187508985, "grad_norm": 0.14802676439285278, "learning_rate": 7.727481829055112e-05, "loss": 0.6116, "mean_token_accuracy": 0.8167826272547245, "num_tokens": 236528308.0, "step": 7411 }, { "entropy": 0.7743168147280812, "epoch": 0.6819512251223397, "grad_norm": 0.1636095494031906, "learning_rate": 7.727175146440948e-05, "loss": 0.7601, "mean_token_accuracy": 0.7783494032919407, "num_tokens": 236560121.0, "step": 7412 }, { "entropy": 0.660091632977128, "epoch": 0.682043231493781, "grad_norm": 0.15833014249801636, "learning_rate": 7.726868463826786e-05, "loss": 0.6498, "mean_token_accuracy": 0.804757334291935, "num_tokens": 236592123.0, "step": 7413 }, { "entropy": 0.8927335180342197, "epoch": 0.6821352378652221, "grad_norm": 0.16460241377353668, "learning_rate": 7.726561781212623e-05, "loss": 0.8852, "mean_token_accuracy": 0.7455509267747402, "num_tokens": 236624518.0, "step": 7414 }, { "entropy": 0.810508731752634, "epoch": 0.6822272442366634, "grad_norm": 0.16621184349060059, "learning_rate": 7.72625509859846e-05, "loss": 0.8154, "mean_token_accuracy": 0.7633696272969246, "num_tokens": 236656707.0, "step": 7415 }, { "entropy": 0.7233202699571848, "epoch": 0.6823192506081046, "grad_norm": 0.15641160309314728, "learning_rate": 7.725948415984298e-05, "loss": 0.7029, "mean_token_accuracy": 0.7911736816167831, "num_tokens": 236688125.0, "step": 7416 }, { "entropy": 0.689668889157474, "epoch": 0.6824112569795459, "grad_norm": 0.145370215177536, "learning_rate": 7.725641733370136e-05, "loss": 0.6715, "mean_token_accuracy": 0.8011535443365574, "num_tokens": 236720280.0, "step": 7417 }, { "entropy": 0.6536412835121155, "epoch": 0.6825032633509871, "grad_norm": 0.14593450725078583, "learning_rate": 7.725335050755973e-05, "loss": 0.6267, "mean_token_accuracy": 0.8153686635196209, "num_tokens": 236752660.0, "step": 7418 }, { "entropy": 0.6818542815744877, "epoch": 0.6825952697224282, "grad_norm": 0.15293274819850922, "learning_rate": 7.72502836814181e-05, "loss": 0.6621, "mean_token_accuracy": 0.8011180609464645, "num_tokens": 236784462.0, "step": 7419 }, { "entropy": 0.7371944412589073, "epoch": 0.6826872760938695, "grad_norm": 0.15659622848033905, "learning_rate": 7.724721685527648e-05, "loss": 0.7305, "mean_token_accuracy": 0.7859303876757622, "num_tokens": 236816222.0, "step": 7420 }, { "entropy": 0.7761557325720787, "epoch": 0.6827792824653107, "grad_norm": 0.152645543217659, "learning_rate": 7.724415002913485e-05, "loss": 0.7738, "mean_token_accuracy": 0.7713887766003609, "num_tokens": 236848416.0, "step": 7421 }, { "entropy": 0.7194861173629761, "epoch": 0.682871288836752, "grad_norm": 0.1548376828432083, "learning_rate": 7.724108320299323e-05, "loss": 0.7069, "mean_token_accuracy": 0.787356648594141, "num_tokens": 236879887.0, "step": 7422 }, { "entropy": 0.7844161111861467, "epoch": 0.6829632952081932, "grad_norm": 0.16212278604507446, "learning_rate": 7.72380163768516e-05, "loss": 0.7581, "mean_token_accuracy": 0.7803203538060188, "num_tokens": 236911671.0, "step": 7423 }, { "entropy": 0.7387944273650646, "epoch": 0.6830553015796343, "grad_norm": 0.15842972695827484, "learning_rate": 7.723494955070998e-05, "loss": 0.7231, "mean_token_accuracy": 0.7883609756827354, "num_tokens": 236944015.0, "step": 7424 }, { "entropy": 0.8135396763682365, "epoch": 0.6831473079510756, "grad_norm": 0.16929569840431213, "learning_rate": 7.723188272456835e-05, "loss": 0.8065, "mean_token_accuracy": 0.7703985124826431, "num_tokens": 236975772.0, "step": 7425 }, { "entropy": 0.8376027271151543, "epoch": 0.6832393143225168, "grad_norm": 0.16157400608062744, "learning_rate": 7.722881589842671e-05, "loss": 0.8216, "mean_token_accuracy": 0.7618759609758854, "num_tokens": 237007779.0, "step": 7426 }, { "entropy": 0.681392015889287, "epoch": 0.6833313206939581, "grad_norm": 0.1580905169248581, "learning_rate": 7.72257490722851e-05, "loss": 0.6804, "mean_token_accuracy": 0.7997824586927891, "num_tokens": 237039269.0, "step": 7427 }, { "entropy": 0.7521419767290354, "epoch": 0.6834233270653993, "grad_norm": 0.15025755763053894, "learning_rate": 7.722268224614348e-05, "loss": 0.7509, "mean_token_accuracy": 0.7816542088985443, "num_tokens": 237071954.0, "step": 7428 }, { "entropy": 0.7604071628302336, "epoch": 0.6835153334368405, "grad_norm": 0.15519359707832336, "learning_rate": 7.721961542000185e-05, "loss": 0.7519, "mean_token_accuracy": 0.7756365053355694, "num_tokens": 237103813.0, "step": 7429 }, { "entropy": 0.7712708432227373, "epoch": 0.6836073398082817, "grad_norm": 0.1621960550546646, "learning_rate": 7.721654859386021e-05, "loss": 0.7664, "mean_token_accuracy": 0.7773892544209957, "num_tokens": 237135583.0, "step": 7430 }, { "entropy": 0.8782080840319395, "epoch": 0.6836993461797229, "grad_norm": 0.15484175086021423, "learning_rate": 7.721348176771858e-05, "loss": 0.872, "mean_token_accuracy": 0.7452356480062008, "num_tokens": 237167639.0, "step": 7431 }, { "entropy": 0.613685006275773, "epoch": 0.6837913525511642, "grad_norm": 0.15602408349514008, "learning_rate": 7.721041494157698e-05, "loss": 0.6008, "mean_token_accuracy": 0.8173104822635651, "num_tokens": 237199295.0, "step": 7432 }, { "entropy": 0.8362313807010651, "epoch": 0.6838833589226054, "grad_norm": 0.1590464860200882, "learning_rate": 7.720734811543534e-05, "loss": 0.83, "mean_token_accuracy": 0.7574935555458069, "num_tokens": 237229889.0, "step": 7433 }, { "entropy": 0.8630011156201363, "epoch": 0.6839753652940466, "grad_norm": 0.15885773301124573, "learning_rate": 7.720428128929371e-05, "loss": 0.8401, "mean_token_accuracy": 0.7537279576063156, "num_tokens": 237261573.0, "step": 7434 }, { "entropy": 0.7086672317236662, "epoch": 0.6840673716654878, "grad_norm": 0.15366820991039276, "learning_rate": 7.720121446315208e-05, "loss": 0.6861, "mean_token_accuracy": 0.7990264818072319, "num_tokens": 237293991.0, "step": 7435 }, { "entropy": 0.8015408143401146, "epoch": 0.6841593780369291, "grad_norm": 0.15421231091022491, "learning_rate": 7.719814763701046e-05, "loss": 0.7818, "mean_token_accuracy": 0.7677721455693245, "num_tokens": 237325599.0, "step": 7436 }, { "entropy": 0.7562645226716995, "epoch": 0.6842513844083703, "grad_norm": 0.15480005741119385, "learning_rate": 7.719508081086884e-05, "loss": 0.7398, "mean_token_accuracy": 0.7831414043903351, "num_tokens": 237357741.0, "step": 7437 }, { "entropy": 0.8288449142128229, "epoch": 0.6843433907798115, "grad_norm": 0.16900677978992462, "learning_rate": 7.719201398472721e-05, "loss": 0.8238, "mean_token_accuracy": 0.7623017132282257, "num_tokens": 237389364.0, "step": 7438 }, { "entropy": 0.7487089913338423, "epoch": 0.6844353971512527, "grad_norm": 0.1614963710308075, "learning_rate": 7.718894715858558e-05, "loss": 0.747, "mean_token_accuracy": 0.7840968556702137, "num_tokens": 237421197.0, "step": 7439 }, { "entropy": 0.7398779429495335, "epoch": 0.6845274035226939, "grad_norm": 0.16063272953033447, "learning_rate": 7.718588033244396e-05, "loss": 0.7289, "mean_token_accuracy": 0.7814731486141682, "num_tokens": 237453021.0, "step": 7440 }, { "entropy": 0.6963288392871618, "epoch": 0.6846194098941352, "grad_norm": 0.14929643273353577, "learning_rate": 7.718281350630233e-05, "loss": 0.6775, "mean_token_accuracy": 0.7991269007325172, "num_tokens": 237485340.0, "step": 7441 }, { "entropy": 0.614171639084816, "epoch": 0.6847114162655764, "grad_norm": 0.14689968526363373, "learning_rate": 7.717974668016071e-05, "loss": 0.5955, "mean_token_accuracy": 0.8198962733149529, "num_tokens": 237517582.0, "step": 7442 }, { "entropy": 0.8461778312921524, "epoch": 0.6848034226370177, "grad_norm": 0.15996411442756653, "learning_rate": 7.717667985401908e-05, "loss": 0.8475, "mean_token_accuracy": 0.7552186101675034, "num_tokens": 237549742.0, "step": 7443 }, { "entropy": 0.7215804755687714, "epoch": 0.6848954290084588, "grad_norm": 0.15759599208831787, "learning_rate": 7.717361302787746e-05, "loss": 0.7057, "mean_token_accuracy": 0.7874757796525955, "num_tokens": 237581618.0, "step": 7444 }, { "entropy": 0.7372153904289007, "epoch": 0.6849874353799, "grad_norm": 0.15593519806861877, "learning_rate": 7.717054620173583e-05, "loss": 0.7182, "mean_token_accuracy": 0.7862986139953136, "num_tokens": 237613534.0, "step": 7445 }, { "entropy": 0.7750965766608715, "epoch": 0.6850794417513413, "grad_norm": 0.16167408227920532, "learning_rate": 7.71674793755942e-05, "loss": 0.7656, "mean_token_accuracy": 0.772830180823803, "num_tokens": 237645730.0, "step": 7446 }, { "entropy": 0.662138850428164, "epoch": 0.6851714481227825, "grad_norm": 0.1439901739358902, "learning_rate": 7.716441254945258e-05, "loss": 0.6411, "mean_token_accuracy": 0.8039028346538544, "num_tokens": 237678255.0, "step": 7447 }, { "entropy": 0.7756048962473869, "epoch": 0.6852634544942238, "grad_norm": 0.15135405957698822, "learning_rate": 7.716134572331096e-05, "loss": 0.7807, "mean_token_accuracy": 0.7723841592669487, "num_tokens": 237710330.0, "step": 7448 }, { "entropy": 0.6921468386426568, "epoch": 0.6853554608656649, "grad_norm": 0.15394657850265503, "learning_rate": 7.715827889716932e-05, "loss": 0.6761, "mean_token_accuracy": 0.8006779626011848, "num_tokens": 237741931.0, "step": 7449 }, { "entropy": 0.7217855658382177, "epoch": 0.6854474672371061, "grad_norm": 0.16900531947612762, "learning_rate": 7.715521207102769e-05, "loss": 0.7169, "mean_token_accuracy": 0.7852700874209404, "num_tokens": 237773201.0, "step": 7450 }, { "entropy": 0.8128489460796118, "epoch": 0.6855394736085474, "grad_norm": 0.16201399266719818, "learning_rate": 7.715214524488607e-05, "loss": 0.8073, "mean_token_accuracy": 0.7629707045853138, "num_tokens": 237804874.0, "step": 7451 }, { "entropy": 0.7621209193021059, "epoch": 0.6856314799799886, "grad_norm": 0.17131945490837097, "learning_rate": 7.714907841874444e-05, "loss": 0.7805, "mean_token_accuracy": 0.7762468047440052, "num_tokens": 237836613.0, "step": 7452 }, { "entropy": 0.7351378817111254, "epoch": 0.6857234863514299, "grad_norm": 0.15765134990215302, "learning_rate": 7.714601159260282e-05, "loss": 0.7285, "mean_token_accuracy": 0.7876616418361664, "num_tokens": 237868314.0, "step": 7453 }, { "entropy": 0.6485138479620218, "epoch": 0.685815492722871, "grad_norm": 0.16378600895404816, "learning_rate": 7.714294476646119e-05, "loss": 0.6361, "mean_token_accuracy": 0.8133002072572708, "num_tokens": 237900367.0, "step": 7454 }, { "entropy": 0.7004106380045414, "epoch": 0.6859074990943123, "grad_norm": 0.15493617951869965, "learning_rate": 7.713987794031957e-05, "loss": 0.6818, "mean_token_accuracy": 0.7952115349471569, "num_tokens": 237932230.0, "step": 7455 }, { "entropy": 0.7676855400204659, "epoch": 0.6859995054657535, "grad_norm": 0.1603376269340515, "learning_rate": 7.713681111417794e-05, "loss": 0.7727, "mean_token_accuracy": 0.7751727029681206, "num_tokens": 237963818.0, "step": 7456 }, { "entropy": 0.6664930693805218, "epoch": 0.6860915118371947, "grad_norm": 0.1579933762550354, "learning_rate": 7.713374428803631e-05, "loss": 0.6419, "mean_token_accuracy": 0.8065777234733105, "num_tokens": 237995096.0, "step": 7457 }, { "entropy": 0.8157100975513458, "epoch": 0.686183518208636, "grad_norm": 0.164572075009346, "learning_rate": 7.713067746189469e-05, "loss": 0.7909, "mean_token_accuracy": 0.7692999020218849, "num_tokens": 238026777.0, "step": 7458 }, { "entropy": 0.7048759311437607, "epoch": 0.6862755245800771, "grad_norm": 0.16180042922496796, "learning_rate": 7.712761063575307e-05, "loss": 0.6838, "mean_token_accuracy": 0.7980211228132248, "num_tokens": 238058589.0, "step": 7459 }, { "entropy": 0.653591038659215, "epoch": 0.6863675309515184, "grad_norm": 0.15072211623191833, "learning_rate": 7.712454380961144e-05, "loss": 0.6423, "mean_token_accuracy": 0.8070961721241474, "num_tokens": 238090355.0, "step": 7460 }, { "entropy": 0.7329590953886509, "epoch": 0.6864595373229596, "grad_norm": 0.15462926030158997, "learning_rate": 7.712147698346981e-05, "loss": 0.7288, "mean_token_accuracy": 0.7882757224142551, "num_tokens": 238121004.0, "step": 7461 }, { "entropy": 0.7456008084118366, "epoch": 0.6865515436944009, "grad_norm": 0.15181034803390503, "learning_rate": 7.711841015732817e-05, "loss": 0.7195, "mean_token_accuracy": 0.7877502143383026, "num_tokens": 238153245.0, "step": 7462 }, { "entropy": 0.7540139015763998, "epoch": 0.6866435500658421, "grad_norm": 0.16011552512645721, "learning_rate": 7.711534333118656e-05, "loss": 0.7287, "mean_token_accuracy": 0.7846946939826012, "num_tokens": 238185046.0, "step": 7463 }, { "entropy": 0.6886442452669144, "epoch": 0.6867355564372832, "grad_norm": 0.15527787804603577, "learning_rate": 7.711227650504494e-05, "loss": 0.6494, "mean_token_accuracy": 0.8106651455163956, "num_tokens": 238217162.0, "step": 7464 }, { "entropy": 0.8278342336416245, "epoch": 0.6868275628087245, "grad_norm": 0.15133216977119446, "learning_rate": 7.71092096789033e-05, "loss": 0.8167, "mean_token_accuracy": 0.7618331797420979, "num_tokens": 238248623.0, "step": 7465 }, { "entropy": 0.7815176453441381, "epoch": 0.6869195691801657, "grad_norm": 0.14934538304805756, "learning_rate": 7.710614285276167e-05, "loss": 0.7606, "mean_token_accuracy": 0.7773117274045944, "num_tokens": 238281220.0, "step": 7466 }, { "entropy": 0.7725886888802052, "epoch": 0.687011575551607, "grad_norm": 0.16574878990650177, "learning_rate": 7.710307602662005e-05, "loss": 0.7708, "mean_token_accuracy": 0.7741411328315735, "num_tokens": 238313047.0, "step": 7467 }, { "entropy": 0.6681375280022621, "epoch": 0.6871035819230482, "grad_norm": 0.15152010321617126, "learning_rate": 7.710000920047842e-05, "loss": 0.6548, "mean_token_accuracy": 0.80411396920681, "num_tokens": 238345117.0, "step": 7468 }, { "entropy": 0.7411149609833956, "epoch": 0.6871955882944893, "grad_norm": 0.16032637655735016, "learning_rate": 7.70969423743368e-05, "loss": 0.7369, "mean_token_accuracy": 0.7857363820075989, "num_tokens": 238377245.0, "step": 7469 }, { "entropy": 0.7217102255672216, "epoch": 0.6872875946659306, "grad_norm": 0.1679292619228363, "learning_rate": 7.709387554819517e-05, "loss": 0.7345, "mean_token_accuracy": 0.7837369553744793, "num_tokens": 238407837.0, "step": 7470 }, { "entropy": 0.7006789986044168, "epoch": 0.6873796010373718, "grad_norm": 0.15919755399227142, "learning_rate": 7.709080872205355e-05, "loss": 0.682, "mean_token_accuracy": 0.7975373901426792, "num_tokens": 238439755.0, "step": 7471 }, { "entropy": 0.8291097022593021, "epoch": 0.6874716074088131, "grad_norm": 0.15397202968597412, "learning_rate": 7.708774189591192e-05, "loss": 0.8148, "mean_token_accuracy": 0.7562205530703068, "num_tokens": 238471856.0, "step": 7472 }, { "entropy": 0.771112434566021, "epoch": 0.6875636137802543, "grad_norm": 0.1489265263080597, "learning_rate": 7.708467506977029e-05, "loss": 0.7608, "mean_token_accuracy": 0.7730992585420609, "num_tokens": 238504347.0, "step": 7473 }, { "entropy": 0.7641617450863123, "epoch": 0.6876556201516955, "grad_norm": 0.1521620899438858, "learning_rate": 7.708160824362867e-05, "loss": 0.7406, "mean_token_accuracy": 0.7781996130943298, "num_tokens": 238536101.0, "step": 7474 }, { "entropy": 0.839030722156167, "epoch": 0.6877476265231367, "grad_norm": 0.1656017154455185, "learning_rate": 7.707854141748705e-05, "loss": 0.8506, "mean_token_accuracy": 0.7556817047297955, "num_tokens": 238567873.0, "step": 7475 }, { "entropy": 0.7492193542420864, "epoch": 0.687839632894578, "grad_norm": 0.14777421951293945, "learning_rate": 7.707547459134542e-05, "loss": 0.728, "mean_token_accuracy": 0.7839635349810123, "num_tokens": 238600312.0, "step": 7476 }, { "entropy": 0.8094575069844723, "epoch": 0.6879316392660192, "grad_norm": 0.16447025537490845, "learning_rate": 7.707240776520379e-05, "loss": 0.8141, "mean_token_accuracy": 0.7648382261395454, "num_tokens": 238631293.0, "step": 7477 }, { "entropy": 0.718489520251751, "epoch": 0.6880236456374604, "grad_norm": 0.16492860019207, "learning_rate": 7.706934093906217e-05, "loss": 0.7078, "mean_token_accuracy": 0.7918291874229908, "num_tokens": 238662425.0, "step": 7478 }, { "entropy": 0.7185233756899834, "epoch": 0.6881156520089016, "grad_norm": 0.15475422143936157, "learning_rate": 7.706627411292055e-05, "loss": 0.7039, "mean_token_accuracy": 0.7957345545291901, "num_tokens": 238694381.0, "step": 7479 }, { "entropy": 0.5973514290526509, "epoch": 0.6882076583803428, "grad_norm": 0.14847750961780548, "learning_rate": 7.706320728677892e-05, "loss": 0.5545, "mean_token_accuracy": 0.8376959078013897, "num_tokens": 238726617.0, "step": 7480 }, { "entropy": 0.6065159942954779, "epoch": 0.6882996647517841, "grad_norm": 0.14357946813106537, "learning_rate": 7.706014046063729e-05, "loss": 0.5989, "mean_token_accuracy": 0.8260867893695831, "num_tokens": 238758535.0, "step": 7481 }, { "entropy": 0.6056333389133215, "epoch": 0.6883916711232253, "grad_norm": 0.1484781950712204, "learning_rate": 7.705707363449567e-05, "loss": 0.5928, "mean_token_accuracy": 0.8211191296577454, "num_tokens": 238790330.0, "step": 7482 }, { "entropy": 0.7077449876815081, "epoch": 0.6884836774946665, "grad_norm": 0.15414772927761078, "learning_rate": 7.705400680835404e-05, "loss": 0.7011, "mean_token_accuracy": 0.7922239191830158, "num_tokens": 238821558.0, "step": 7483 }, { "entropy": 0.6826113946735859, "epoch": 0.6885756838661077, "grad_norm": 0.1556154042482376, "learning_rate": 7.705093998221242e-05, "loss": 0.6691, "mean_token_accuracy": 0.8005435205996037, "num_tokens": 238854071.0, "step": 7484 }, { "entropy": 0.7046669442206621, "epoch": 0.6886676902375489, "grad_norm": 0.16468991339206696, "learning_rate": 7.704787315607078e-05, "loss": 0.6856, "mean_token_accuracy": 0.7978657186031342, "num_tokens": 238885695.0, "step": 7485 }, { "entropy": 0.7590370960533619, "epoch": 0.6887596966089902, "grad_norm": 0.16399110853672028, "learning_rate": 7.704480632992917e-05, "loss": 0.7547, "mean_token_accuracy": 0.7787040136754513, "num_tokens": 238917346.0, "step": 7486 }, { "entropy": 0.7317015212029219, "epoch": 0.6888517029804314, "grad_norm": 0.1545829176902771, "learning_rate": 7.704173950378753e-05, "loss": 0.6994, "mean_token_accuracy": 0.7895872667431831, "num_tokens": 238949635.0, "step": 7487 }, { "entropy": 0.7005993165075779, "epoch": 0.6889437093518727, "grad_norm": 0.15294994413852692, "learning_rate": 7.70386726776459e-05, "loss": 0.6877, "mean_token_accuracy": 0.795720137655735, "num_tokens": 238981695.0, "step": 7488 }, { "entropy": 0.7138608619570732, "epoch": 0.6890357157233138, "grad_norm": 0.1591971218585968, "learning_rate": 7.703560585150428e-05, "loss": 0.7082, "mean_token_accuracy": 0.7913409881293774, "num_tokens": 239014463.0, "step": 7489 }, { "entropy": 0.6229658424854279, "epoch": 0.689127722094755, "grad_norm": 0.14771485328674316, "learning_rate": 7.703253902536267e-05, "loss": 0.5984, "mean_token_accuracy": 0.8202571868896484, "num_tokens": 239047111.0, "step": 7490 }, { "entropy": 0.6341155739501119, "epoch": 0.6892197284661963, "grad_norm": 0.15780678391456604, "learning_rate": 7.702947219922103e-05, "loss": 0.6065, "mean_token_accuracy": 0.8172766081988811, "num_tokens": 239077919.0, "step": 7491 }, { "entropy": 0.8044809587299824, "epoch": 0.6893117348376375, "grad_norm": 0.1688428372144699, "learning_rate": 7.70264053730794e-05, "loss": 0.8195, "mean_token_accuracy": 0.7586627006530762, "num_tokens": 239109282.0, "step": 7492 }, { "entropy": 0.8008085135370493, "epoch": 0.6894037412090788, "grad_norm": 0.1586918979883194, "learning_rate": 7.702333854693777e-05, "loss": 0.8084, "mean_token_accuracy": 0.7622111476957798, "num_tokens": 239140708.0, "step": 7493 }, { "entropy": 0.6131381839513779, "epoch": 0.6894957475805199, "grad_norm": 0.16708096861839294, "learning_rate": 7.702027172079615e-05, "loss": 0.6054, "mean_token_accuracy": 0.8225168064236641, "num_tokens": 239172892.0, "step": 7494 }, { "entropy": 0.6587367691099644, "epoch": 0.6895877539519611, "grad_norm": 0.15705080330371857, "learning_rate": 7.701720489465453e-05, "loss": 0.6464, "mean_token_accuracy": 0.8067270293831825, "num_tokens": 239203888.0, "step": 7495 }, { "entropy": 0.8460985850542784, "epoch": 0.6896797603234024, "grad_norm": 0.1828412264585495, "learning_rate": 7.70141380685129e-05, "loss": 0.8726, "mean_token_accuracy": 0.752550520002842, "num_tokens": 239234768.0, "step": 7496 }, { "entropy": 0.8009899966418743, "epoch": 0.6897717666948436, "grad_norm": 0.1607704907655716, "learning_rate": 7.701107124237127e-05, "loss": 0.7861, "mean_token_accuracy": 0.7679641172289848, "num_tokens": 239266251.0, "step": 7497 }, { "entropy": 0.713421642780304, "epoch": 0.6898637730662849, "grad_norm": 0.15544578433036804, "learning_rate": 7.700800441622965e-05, "loss": 0.6976, "mean_token_accuracy": 0.7939934208989143, "num_tokens": 239298611.0, "step": 7498 }, { "entropy": 0.7696054354310036, "epoch": 0.689955779437726, "grad_norm": 0.16657161712646484, "learning_rate": 7.700493759008802e-05, "loss": 0.7555, "mean_token_accuracy": 0.7789471000432968, "num_tokens": 239330542.0, "step": 7499 }, { "entropy": 0.7042547911405563, "epoch": 0.6900477858091673, "grad_norm": 0.15580616891384125, "learning_rate": 7.70018707639464e-05, "loss": 0.6882, "mean_token_accuracy": 0.795498926192522, "num_tokens": 239362602.0, "step": 7500 }, { "entropy": 0.5392262395471334, "epoch": 0.6901397921806085, "grad_norm": 0.13985863327980042, "learning_rate": 7.699880393780477e-05, "loss": 0.5206, "mean_token_accuracy": 0.8438648469746113, "num_tokens": 239395091.0, "step": 7501 }, { "entropy": 0.6945722615346313, "epoch": 0.6902317985520497, "grad_norm": 0.16417311131954193, "learning_rate": 7.699573711166315e-05, "loss": 0.6893, "mean_token_accuracy": 0.8020884208381176, "num_tokens": 239427859.0, "step": 7502 }, { "entropy": 0.7865596953779459, "epoch": 0.690323804923491, "grad_norm": 0.15723706781864166, "learning_rate": 7.699267028552152e-05, "loss": 0.7775, "mean_token_accuracy": 0.7725660502910614, "num_tokens": 239459334.0, "step": 7503 }, { "entropy": 0.6482004076242447, "epoch": 0.6904158112949321, "grad_norm": 0.15044528245925903, "learning_rate": 7.698960345937988e-05, "loss": 0.6339, "mean_token_accuracy": 0.8165746033191681, "num_tokens": 239491485.0, "step": 7504 }, { "entropy": 0.7062843013554811, "epoch": 0.6905078176663734, "grad_norm": 0.16156208515167236, "learning_rate": 7.698653663323826e-05, "loss": 0.6931, "mean_token_accuracy": 0.7947399504482746, "num_tokens": 239523785.0, "step": 7505 }, { "entropy": 0.6634152932092547, "epoch": 0.6905998240378146, "grad_norm": 0.15001702308654785, "learning_rate": 7.698346980709665e-05, "loss": 0.6357, "mean_token_accuracy": 0.8136476464569569, "num_tokens": 239556273.0, "step": 7506 }, { "entropy": 0.7142920978367329, "epoch": 0.6906918304092559, "grad_norm": 0.15689122676849365, "learning_rate": 7.698040298095501e-05, "loss": 0.6973, "mean_token_accuracy": 0.7930347435176373, "num_tokens": 239587726.0, "step": 7507 }, { "entropy": 0.7935129534453154, "epoch": 0.6907838367806971, "grad_norm": 0.15480057895183563, "learning_rate": 7.697733615481338e-05, "loss": 0.7801, "mean_token_accuracy": 0.7697254568338394, "num_tokens": 239619697.0, "step": 7508 }, { "entropy": 0.7107953820377588, "epoch": 0.6908758431521382, "grad_norm": 0.14943666756153107, "learning_rate": 7.697426932867176e-05, "loss": 0.69, "mean_token_accuracy": 0.7949233911931515, "num_tokens": 239651920.0, "step": 7509 }, { "entropy": 0.7927297540009022, "epoch": 0.6909678495235795, "grad_norm": 0.15560214221477509, "learning_rate": 7.697120250253013e-05, "loss": 0.7802, "mean_token_accuracy": 0.7712098471820354, "num_tokens": 239683246.0, "step": 7510 }, { "entropy": 0.6849836856126785, "epoch": 0.6910598558950207, "grad_norm": 0.15472926199436188, "learning_rate": 7.696813567638851e-05, "loss": 0.6772, "mean_token_accuracy": 0.7982728965580463, "num_tokens": 239715856.0, "step": 7511 }, { "entropy": 0.7203149888664484, "epoch": 0.691151862266462, "grad_norm": 0.16690997779369354, "learning_rate": 7.696506885024688e-05, "loss": 0.7176, "mean_token_accuracy": 0.7932063937187195, "num_tokens": 239748194.0, "step": 7512 }, { "entropy": 0.7451728126034141, "epoch": 0.6912438686379032, "grad_norm": 0.164011150598526, "learning_rate": 7.696200202410526e-05, "loss": 0.725, "mean_token_accuracy": 0.7854197137057781, "num_tokens": 239780688.0, "step": 7513 }, { "entropy": 0.7592190112918615, "epoch": 0.6913358750093443, "grad_norm": 0.16486801207065582, "learning_rate": 7.695893519796363e-05, "loss": 0.7513, "mean_token_accuracy": 0.7753321006894112, "num_tokens": 239811525.0, "step": 7514 }, { "entropy": 0.7901181951165199, "epoch": 0.6914278813807856, "grad_norm": 0.15245702862739563, "learning_rate": 7.695586837182201e-05, "loss": 0.7782, "mean_token_accuracy": 0.7743986994028091, "num_tokens": 239843836.0, "step": 7515 }, { "entropy": 0.7630588579922915, "epoch": 0.6915198877522268, "grad_norm": 0.1520344763994217, "learning_rate": 7.695280154568038e-05, "loss": 0.7582, "mean_token_accuracy": 0.7754198312759399, "num_tokens": 239875729.0, "step": 7516 }, { "entropy": 0.7234228923916817, "epoch": 0.6916118941236681, "grad_norm": 0.1472955048084259, "learning_rate": 7.694973471953876e-05, "loss": 0.7133, "mean_token_accuracy": 0.7880950570106506, "num_tokens": 239908392.0, "step": 7517 }, { "entropy": 0.6243173871189356, "epoch": 0.6917039004951093, "grad_norm": 0.15186038613319397, "learning_rate": 7.694666789339713e-05, "loss": 0.608, "mean_token_accuracy": 0.8218021243810654, "num_tokens": 239941150.0, "step": 7518 }, { "entropy": 0.5928329704329371, "epoch": 0.6917959068665505, "grad_norm": 0.15478144586086273, "learning_rate": 7.69436010672555e-05, "loss": 0.5932, "mean_token_accuracy": 0.8207711651921272, "num_tokens": 239973568.0, "step": 7519 }, { "entropy": 0.724655469879508, "epoch": 0.6918879132379917, "grad_norm": 0.1604958027601242, "learning_rate": 7.694053424111388e-05, "loss": 0.7331, "mean_token_accuracy": 0.7871913127601147, "num_tokens": 240006113.0, "step": 7520 }, { "entropy": 0.6605938682332635, "epoch": 0.691979919609433, "grad_norm": 0.165904238820076, "learning_rate": 7.693746741497226e-05, "loss": 0.6608, "mean_token_accuracy": 0.8050528131425381, "num_tokens": 240038449.0, "step": 7521 }, { "entropy": 0.7121169250458479, "epoch": 0.6920719259808742, "grad_norm": 0.16052009165287018, "learning_rate": 7.693440058883063e-05, "loss": 0.6986, "mean_token_accuracy": 0.7932977080345154, "num_tokens": 240070531.0, "step": 7522 }, { "entropy": 0.675326582044363, "epoch": 0.6921639323523154, "grad_norm": 0.16103030741214752, "learning_rate": 7.6931333762689e-05, "loss": 0.6677, "mean_token_accuracy": 0.7980044893920422, "num_tokens": 240102805.0, "step": 7523 }, { "entropy": 0.7213351549580693, "epoch": 0.6922559387237566, "grad_norm": 0.15647290647029877, "learning_rate": 7.692826693654736e-05, "loss": 0.6981, "mean_token_accuracy": 0.7923853471875191, "num_tokens": 240134459.0, "step": 7524 }, { "entropy": 0.7662236150354147, "epoch": 0.6923479450951978, "grad_norm": 0.15225306153297424, "learning_rate": 7.692520011040574e-05, "loss": 0.7385, "mean_token_accuracy": 0.7792158201336861, "num_tokens": 240166128.0, "step": 7525 }, { "entropy": 0.6405912861227989, "epoch": 0.6924399514666391, "grad_norm": 0.14661268889904022, "learning_rate": 7.692213328426413e-05, "loss": 0.6205, "mean_token_accuracy": 0.813658632338047, "num_tokens": 240198411.0, "step": 7526 }, { "entropy": 0.7095953784883022, "epoch": 0.6925319578380803, "grad_norm": 0.14897051453590393, "learning_rate": 7.691906645812249e-05, "loss": 0.6966, "mean_token_accuracy": 0.790154080837965, "num_tokens": 240230106.0, "step": 7527 }, { "entropy": 0.8020265363156796, "epoch": 0.6926239642095215, "grad_norm": 0.15196482837200165, "learning_rate": 7.691599963198086e-05, "loss": 0.7733, "mean_token_accuracy": 0.7740650475025177, "num_tokens": 240261616.0, "step": 7528 }, { "entropy": 0.6532169980928302, "epoch": 0.6927159705809627, "grad_norm": 0.1484462022781372, "learning_rate": 7.691293280583924e-05, "loss": 0.633, "mean_token_accuracy": 0.811723493039608, "num_tokens": 240293800.0, "step": 7529 }, { "entropy": 0.8197371698915958, "epoch": 0.6928079769524039, "grad_norm": 0.15931940078735352, "learning_rate": 7.690986597969761e-05, "loss": 0.8007, "mean_token_accuracy": 0.7682602442800999, "num_tokens": 240326237.0, "step": 7530 }, { "entropy": 0.7719225455075502, "epoch": 0.6928999833238452, "grad_norm": 0.15927593410015106, "learning_rate": 7.690679915355599e-05, "loss": 0.7471, "mean_token_accuracy": 0.7789826989173889, "num_tokens": 240358120.0, "step": 7531 }, { "entropy": 0.7349131628870964, "epoch": 0.6929919896952864, "grad_norm": 0.15869101881980896, "learning_rate": 7.690373232741436e-05, "loss": 0.719, "mean_token_accuracy": 0.7924159504473209, "num_tokens": 240390221.0, "step": 7532 }, { "entropy": 0.7274132538586855, "epoch": 0.6930839960667277, "grad_norm": 0.15190888941287994, "learning_rate": 7.690066550127274e-05, "loss": 0.714, "mean_token_accuracy": 0.7925065122544765, "num_tokens": 240422102.0, "step": 7533 }, { "entropy": 0.7322409488260746, "epoch": 0.6931760024381688, "grad_norm": 0.1600644737482071, "learning_rate": 7.689759867513111e-05, "loss": 0.73, "mean_token_accuracy": 0.7833596542477608, "num_tokens": 240454118.0, "step": 7534 }, { "entropy": 0.8652691654860973, "epoch": 0.69326800880961, "grad_norm": 0.16280117630958557, "learning_rate": 7.689453184898948e-05, "loss": 0.8799, "mean_token_accuracy": 0.7457996308803558, "num_tokens": 240486014.0, "step": 7535 }, { "entropy": 0.8264477197080851, "epoch": 0.6933600151810513, "grad_norm": 0.15992456674575806, "learning_rate": 7.689146502284786e-05, "loss": 0.8309, "mean_token_accuracy": 0.7571189031004906, "num_tokens": 240518592.0, "step": 7536 }, { "entropy": 0.7614348530769348, "epoch": 0.6934520215524925, "grad_norm": 0.16926692426204681, "learning_rate": 7.688839819670624e-05, "loss": 0.7815, "mean_token_accuracy": 0.7685856036841869, "num_tokens": 240550572.0, "step": 7537 }, { "entropy": 0.7551673706620932, "epoch": 0.6935440279239338, "grad_norm": 0.1641397476196289, "learning_rate": 7.688533137056461e-05, "loss": 0.7711, "mean_token_accuracy": 0.772520586848259, "num_tokens": 240582736.0, "step": 7538 }, { "entropy": 0.7120810952037573, "epoch": 0.6936360342953749, "grad_norm": 0.15579865872859955, "learning_rate": 7.688226454442298e-05, "loss": 0.6989, "mean_token_accuracy": 0.791780237108469, "num_tokens": 240615074.0, "step": 7539 }, { "entropy": 0.7548304628580809, "epoch": 0.6937280406668161, "grad_norm": 0.1538027822971344, "learning_rate": 7.687919771828136e-05, "loss": 0.7403, "mean_token_accuracy": 0.7803789116442204, "num_tokens": 240647686.0, "step": 7540 }, { "entropy": 0.6946017956361175, "epoch": 0.6938200470382574, "grad_norm": 0.15522214770317078, "learning_rate": 7.687613089213972e-05, "loss": 0.6752, "mean_token_accuracy": 0.8029736429452896, "num_tokens": 240679392.0, "step": 7541 }, { "entropy": 0.6970695685595274, "epoch": 0.6939120534096986, "grad_norm": 0.16968370974063873, "learning_rate": 7.68730640659981e-05, "loss": 0.6794, "mean_token_accuracy": 0.7954268530011177, "num_tokens": 240710858.0, "step": 7542 }, { "entropy": 0.6588600305840373, "epoch": 0.6940040597811399, "grad_norm": 0.15241603553295135, "learning_rate": 7.686999723985647e-05, "loss": 0.6367, "mean_token_accuracy": 0.8092412538826466, "num_tokens": 240743388.0, "step": 7543 }, { "entropy": 0.7449143286794424, "epoch": 0.694096066152581, "grad_norm": 0.16616688668727875, "learning_rate": 7.686693041371486e-05, "loss": 0.7174, "mean_token_accuracy": 0.7900488376617432, "num_tokens": 240775582.0, "step": 7544 }, { "entropy": 0.7168315853923559, "epoch": 0.6941880725240223, "grad_norm": 0.16117440164089203, "learning_rate": 7.686386358757322e-05, "loss": 0.7094, "mean_token_accuracy": 0.7937523424625397, "num_tokens": 240807396.0, "step": 7545 }, { "entropy": 0.6859567668288946, "epoch": 0.6942800788954635, "grad_norm": 0.15206116437911987, "learning_rate": 7.686079676143159e-05, "loss": 0.6767, "mean_token_accuracy": 0.7981190904974937, "num_tokens": 240839185.0, "step": 7546 }, { "entropy": 0.6723775994032621, "epoch": 0.6943720852669047, "grad_norm": 0.1604377180337906, "learning_rate": 7.685772993528997e-05, "loss": 0.6451, "mean_token_accuracy": 0.8078895844519138, "num_tokens": 240871953.0, "step": 7547 }, { "entropy": 0.6663623508065939, "epoch": 0.694464091638346, "grad_norm": 0.15366703271865845, "learning_rate": 7.685466310914835e-05, "loss": 0.6453, "mean_token_accuracy": 0.807632964104414, "num_tokens": 240904226.0, "step": 7548 }, { "entropy": 0.6802077312022448, "epoch": 0.6945560980097871, "grad_norm": 0.1460757553577423, "learning_rate": 7.685159628300672e-05, "loss": 0.6656, "mean_token_accuracy": 0.8002004660665989, "num_tokens": 240935598.0, "step": 7549 }, { "entropy": 0.7875551898032427, "epoch": 0.6946481043812284, "grad_norm": 0.15767715871334076, "learning_rate": 7.684852945686509e-05, "loss": 0.7672, "mean_token_accuracy": 0.7721450477838516, "num_tokens": 240966956.0, "step": 7550 }, { "entropy": 0.854848001152277, "epoch": 0.6947401107526696, "grad_norm": 0.1625068336725235, "learning_rate": 7.684546263072346e-05, "loss": 0.8733, "mean_token_accuracy": 0.7445134036242962, "num_tokens": 240997950.0, "step": 7551 }, { "entropy": 0.7910617664456367, "epoch": 0.6948321171241109, "grad_norm": 0.16032156348228455, "learning_rate": 7.684239580458185e-05, "loss": 0.7696, "mean_token_accuracy": 0.7674101144075394, "num_tokens": 241029473.0, "step": 7552 }, { "entropy": 0.7291016951203346, "epoch": 0.6949241234955521, "grad_norm": 0.1608472317457199, "learning_rate": 7.683932897844022e-05, "loss": 0.726, "mean_token_accuracy": 0.7854020483791828, "num_tokens": 241061399.0, "step": 7553 }, { "entropy": 0.6913976240903139, "epoch": 0.6950161298669932, "grad_norm": 0.16342705488204956, "learning_rate": 7.683626215229859e-05, "loss": 0.6856, "mean_token_accuracy": 0.7886982858181, "num_tokens": 241092652.0, "step": 7554 }, { "entropy": 0.7766660898923874, "epoch": 0.6951081362384345, "grad_norm": 0.16151392459869385, "learning_rate": 7.683319532615696e-05, "loss": 0.7699, "mean_token_accuracy": 0.776250172406435, "num_tokens": 241124370.0, "step": 7555 }, { "entropy": 0.8568740412592888, "epoch": 0.6952001426098757, "grad_norm": 0.15653185546398163, "learning_rate": 7.683012850001534e-05, "loss": 0.8631, "mean_token_accuracy": 0.7528864815831184, "num_tokens": 241156909.0, "step": 7556 }, { "entropy": 0.7649150863289833, "epoch": 0.695292148981317, "grad_norm": 0.16177113354206085, "learning_rate": 7.682706167387372e-05, "loss": 0.7534, "mean_token_accuracy": 0.77771120890975, "num_tokens": 241188755.0, "step": 7557 }, { "entropy": 0.8534499295055866, "epoch": 0.6953841553527582, "grad_norm": 0.16745978593826294, "learning_rate": 7.682399484773209e-05, "loss": 0.8479, "mean_token_accuracy": 0.7589173130691051, "num_tokens": 241220851.0, "step": 7558 }, { "entropy": 0.7003718297928572, "epoch": 0.6954761617241993, "grad_norm": 0.14728645980358124, "learning_rate": 7.682092802159045e-05, "loss": 0.6798, "mean_token_accuracy": 0.7972778268158436, "num_tokens": 241253254.0, "step": 7559 }, { "entropy": 0.7018515858799219, "epoch": 0.6955681680956406, "grad_norm": 0.1665259748697281, "learning_rate": 7.681786119544884e-05, "loss": 0.6946, "mean_token_accuracy": 0.7910956516861916, "num_tokens": 241285172.0, "step": 7560 }, { "entropy": 0.7994505241513252, "epoch": 0.6956601744670818, "grad_norm": 0.1657220870256424, "learning_rate": 7.68147943693072e-05, "loss": 0.7743, "mean_token_accuracy": 0.7690246365964413, "num_tokens": 241317222.0, "step": 7561 }, { "entropy": 0.7231369446963072, "epoch": 0.6957521808385231, "grad_norm": 0.15103647112846375, "learning_rate": 7.681172754316559e-05, "loss": 0.7027, "mean_token_accuracy": 0.7934114187955856, "num_tokens": 241349192.0, "step": 7562 }, { "entropy": 0.8205822445452213, "epoch": 0.6958441872099643, "grad_norm": 0.16000372171401978, "learning_rate": 7.680866071702395e-05, "loss": 0.8264, "mean_token_accuracy": 0.7578230760991573, "num_tokens": 241381668.0, "step": 7563 }, { "entropy": 0.6687055826187134, "epoch": 0.6959361935814055, "grad_norm": 0.1493268758058548, "learning_rate": 7.680559389088233e-05, "loss": 0.6452, "mean_token_accuracy": 0.808261338621378, "num_tokens": 241413385.0, "step": 7564 }, { "entropy": 0.7479179389774799, "epoch": 0.6960281999528467, "grad_norm": 0.36740005016326904, "learning_rate": 7.68025270647407e-05, "loss": 0.7574, "mean_token_accuracy": 0.7770942784845829, "num_tokens": 241445415.0, "step": 7565 }, { "entropy": 0.742334658280015, "epoch": 0.696120206324288, "grad_norm": 0.1632843017578125, "learning_rate": 7.679946023859907e-05, "loss": 0.7109, "mean_token_accuracy": 0.788420956581831, "num_tokens": 241477292.0, "step": 7566 }, { "entropy": 0.7861579144373536, "epoch": 0.6962122126957292, "grad_norm": 0.16122332215309143, "learning_rate": 7.679639341245745e-05, "loss": 0.7873, "mean_token_accuracy": 0.7680408470332623, "num_tokens": 241508735.0, "step": 7567 }, { "entropy": 0.7302915751934052, "epoch": 0.6963042190671704, "grad_norm": 0.1576634794473648, "learning_rate": 7.679332658631583e-05, "loss": 0.7096, "mean_token_accuracy": 0.7885285131633282, "num_tokens": 241540909.0, "step": 7568 }, { "entropy": 0.7766938265413046, "epoch": 0.6963962254386116, "grad_norm": 0.1673874855041504, "learning_rate": 7.67902597601742e-05, "loss": 0.7781, "mean_token_accuracy": 0.7703855112195015, "num_tokens": 241572410.0, "step": 7569 }, { "entropy": 0.7689692564308643, "epoch": 0.6964882318100528, "grad_norm": 0.1600862592458725, "learning_rate": 7.678719293403257e-05, "loss": 0.7673, "mean_token_accuracy": 0.7805592492222786, "num_tokens": 241604808.0, "step": 7570 }, { "entropy": 0.744633880443871, "epoch": 0.6965802381814941, "grad_norm": 0.15338660776615143, "learning_rate": 7.678412610789095e-05, "loss": 0.7374, "mean_token_accuracy": 0.7810798399150372, "num_tokens": 241636549.0, "step": 7571 }, { "entropy": 0.7205295693129301, "epoch": 0.6966722445529353, "grad_norm": 0.1593475192785263, "learning_rate": 7.678105928174932e-05, "loss": 0.7227, "mean_token_accuracy": 0.787227563560009, "num_tokens": 241668354.0, "step": 7572 }, { "entropy": 0.7885692939162254, "epoch": 0.6967642509243765, "grad_norm": 0.16188636422157288, "learning_rate": 7.67779924556077e-05, "loss": 0.7859, "mean_token_accuracy": 0.7698486894369125, "num_tokens": 241700735.0, "step": 7573 }, { "entropy": 0.7219500662758946, "epoch": 0.6968562572958177, "grad_norm": 0.15191803872585297, "learning_rate": 7.677492562946607e-05, "loss": 0.6983, "mean_token_accuracy": 0.7916063852608204, "num_tokens": 241732753.0, "step": 7574 }, { "entropy": 0.6225885953754187, "epoch": 0.6969482636672589, "grad_norm": 0.1474747359752655, "learning_rate": 7.677185880332445e-05, "loss": 0.6068, "mean_token_accuracy": 0.8180731050670147, "num_tokens": 241765091.0, "step": 7575 }, { "entropy": 0.7783480565994978, "epoch": 0.6970402700387002, "grad_norm": 0.1580721139907837, "learning_rate": 7.676879197718282e-05, "loss": 0.7654, "mean_token_accuracy": 0.7794495299458504, "num_tokens": 241797291.0, "step": 7576 }, { "entropy": 0.7180880298838019, "epoch": 0.6971322764101414, "grad_norm": 0.1569516658782959, "learning_rate": 7.676572515104118e-05, "loss": 0.6988, "mean_token_accuracy": 0.7932194992899895, "num_tokens": 241829432.0, "step": 7577 }, { "entropy": 0.8190671559423208, "epoch": 0.6972242827815827, "grad_norm": 0.16650132834911346, "learning_rate": 7.676265832489957e-05, "loss": 0.8329, "mean_token_accuracy": 0.7573514804244041, "num_tokens": 241860606.0, "step": 7578 }, { "entropy": 0.7655077744275331, "epoch": 0.6973162891530238, "grad_norm": 0.15506044030189514, "learning_rate": 7.675959149875795e-05, "loss": 0.7541, "mean_token_accuracy": 0.7798767127096653, "num_tokens": 241892220.0, "step": 7579 }, { "entropy": 0.7305645477026701, "epoch": 0.697408295524465, "grad_norm": 0.15340057015419006, "learning_rate": 7.675652467261632e-05, "loss": 0.7266, "mean_token_accuracy": 0.7831007800996304, "num_tokens": 241923751.0, "step": 7580 }, { "entropy": 0.6844135755673051, "epoch": 0.6975003018959063, "grad_norm": 0.15518641471862793, "learning_rate": 7.675345784647468e-05, "loss": 0.6709, "mean_token_accuracy": 0.8040879182517529, "num_tokens": 241955910.0, "step": 7581 }, { "entropy": 0.7271458152681589, "epoch": 0.6975923082673475, "grad_norm": 0.16411589086055756, "learning_rate": 7.675039102033305e-05, "loss": 0.7231, "mean_token_accuracy": 0.7825558707118034, "num_tokens": 241987976.0, "step": 7582 }, { "entropy": 0.7097965534776449, "epoch": 0.6976843146387888, "grad_norm": 0.15577435493469238, "learning_rate": 7.674732419419143e-05, "loss": 0.6988, "mean_token_accuracy": 0.7953037656843662, "num_tokens": 242020093.0, "step": 7583 }, { "entropy": 0.6957558449357748, "epoch": 0.6977763210102299, "grad_norm": 0.15555883944034576, "learning_rate": 7.674425736804981e-05, "loss": 0.6695, "mean_token_accuracy": 0.799114391207695, "num_tokens": 242051890.0, "step": 7584 }, { "entropy": 0.7859354130923748, "epoch": 0.6978683273816711, "grad_norm": 0.16423310339450836, "learning_rate": 7.674119054190818e-05, "loss": 0.7828, "mean_token_accuracy": 0.7693586871027946, "num_tokens": 242083509.0, "step": 7585 }, { "entropy": 0.6911279242485762, "epoch": 0.6979603337531124, "grad_norm": 0.1579013615846634, "learning_rate": 7.673812371576655e-05, "loss": 0.67, "mean_token_accuracy": 0.8071000464260578, "num_tokens": 242115782.0, "step": 7586 }, { "entropy": 0.7581703849136829, "epoch": 0.6980523401245536, "grad_norm": 0.16208422183990479, "learning_rate": 7.673505688962493e-05, "loss": 0.7475, "mean_token_accuracy": 0.7812771759927273, "num_tokens": 242147008.0, "step": 7587 }, { "entropy": 0.799053848721087, "epoch": 0.6981443464959949, "grad_norm": 0.15860413014888763, "learning_rate": 7.67319900634833e-05, "loss": 0.7932, "mean_token_accuracy": 0.7673261016607285, "num_tokens": 242178997.0, "step": 7588 }, { "entropy": 0.7378744874149561, "epoch": 0.698236352867436, "grad_norm": 0.15636314451694489, "learning_rate": 7.672892323734168e-05, "loss": 0.7077, "mean_token_accuracy": 0.7912381589412689, "num_tokens": 242211363.0, "step": 7589 }, { "entropy": 0.695764034986496, "epoch": 0.6983283592388773, "grad_norm": 0.16521695256233215, "learning_rate": 7.672585641120005e-05, "loss": 0.6825, "mean_token_accuracy": 0.8008203692734241, "num_tokens": 242242302.0, "step": 7590 }, { "entropy": 0.6144939111545682, "epoch": 0.6984203656103185, "grad_norm": 0.15594683587551117, "learning_rate": 7.672278958505843e-05, "loss": 0.6037, "mean_token_accuracy": 0.8196345679461956, "num_tokens": 242274512.0, "step": 7591 }, { "entropy": 0.7684876210987568, "epoch": 0.6985123719817597, "grad_norm": 0.15255193412303925, "learning_rate": 7.67197227589168e-05, "loss": 0.7432, "mean_token_accuracy": 0.7832121290266514, "num_tokens": 242306436.0, "step": 7592 }, { "entropy": 0.8386517446488142, "epoch": 0.698604378353201, "grad_norm": 0.16076956689357758, "learning_rate": 7.671665593277517e-05, "loss": 0.8361, "mean_token_accuracy": 0.7561880610883236, "num_tokens": 242338768.0, "step": 7593 }, { "entropy": 0.7564974930137396, "epoch": 0.6986963847246421, "grad_norm": 0.16641397774219513, "learning_rate": 7.671358910663355e-05, "loss": 0.7497, "mean_token_accuracy": 0.7773574404418468, "num_tokens": 242369979.0, "step": 7594 }, { "entropy": 0.7363650985062122, "epoch": 0.6987883910960834, "grad_norm": 0.15177984535694122, "learning_rate": 7.671052228049193e-05, "loss": 0.723, "mean_token_accuracy": 0.7853324823081493, "num_tokens": 242402610.0, "step": 7595 }, { "entropy": 0.6202778564766049, "epoch": 0.6988803974675246, "grad_norm": 0.155051589012146, "learning_rate": 7.67074554543503e-05, "loss": 0.6096, "mean_token_accuracy": 0.8184843622148037, "num_tokens": 242435378.0, "step": 7596 }, { "entropy": 0.7546891625970602, "epoch": 0.6989724038389659, "grad_norm": 0.15702076256275177, "learning_rate": 7.670438862820866e-05, "loss": 0.7659, "mean_token_accuracy": 0.7753170765936375, "num_tokens": 242467692.0, "step": 7597 }, { "entropy": 0.7038064934313297, "epoch": 0.6990644102104071, "grad_norm": 0.1545644998550415, "learning_rate": 7.670132180206705e-05, "loss": 0.6805, "mean_token_accuracy": 0.7971108816564083, "num_tokens": 242499313.0, "step": 7598 }, { "entropy": 0.7647252511233091, "epoch": 0.6991564165818482, "grad_norm": 0.16649474203586578, "learning_rate": 7.669825497592543e-05, "loss": 0.7524, "mean_token_accuracy": 0.7781814783811569, "num_tokens": 242532081.0, "step": 7599 }, { "entropy": 0.6631166134029627, "epoch": 0.6992484229532895, "grad_norm": 0.15082499384880066, "learning_rate": 7.66951881497838e-05, "loss": 0.6389, "mean_token_accuracy": 0.807837937027216, "num_tokens": 242563515.0, "step": 7600 }, { "entropy": 0.7767475731670856, "epoch": 0.6993404293247307, "grad_norm": 0.15851366519927979, "learning_rate": 7.669212132364216e-05, "loss": 0.7727, "mean_token_accuracy": 0.7679419293999672, "num_tokens": 242595773.0, "step": 7601 }, { "entropy": 0.6794152278453112, "epoch": 0.699432435696172, "grad_norm": 0.1542198210954666, "learning_rate": 7.668905449750054e-05, "loss": 0.6671, "mean_token_accuracy": 0.8007785491645336, "num_tokens": 242627483.0, "step": 7602 }, { "entropy": 0.806675847619772, "epoch": 0.6995244420676132, "grad_norm": 0.16042479872703552, "learning_rate": 7.668598767135891e-05, "loss": 0.8027, "mean_token_accuracy": 0.760586567223072, "num_tokens": 242659436.0, "step": 7603 }, { "entropy": 0.7055428437888622, "epoch": 0.6996164484390544, "grad_norm": 0.15725025534629822, "learning_rate": 7.66829208452173e-05, "loss": 0.7112, "mean_token_accuracy": 0.7900264114141464, "num_tokens": 242691867.0, "step": 7604 }, { "entropy": 0.7164786159992218, "epoch": 0.6997084548104956, "grad_norm": 0.16067564487457275, "learning_rate": 7.667985401907566e-05, "loss": 0.7046, "mean_token_accuracy": 0.7906749360263348, "num_tokens": 242723696.0, "step": 7605 }, { "entropy": 0.6637847619131207, "epoch": 0.6998004611819368, "grad_norm": 0.1603822559118271, "learning_rate": 7.667678719293404e-05, "loss": 0.6432, "mean_token_accuracy": 0.806567057967186, "num_tokens": 242755283.0, "step": 7606 }, { "entropy": 0.6475533973425627, "epoch": 0.6998924675533781, "grad_norm": 0.14849303662776947, "learning_rate": 7.667372036679241e-05, "loss": 0.6191, "mean_token_accuracy": 0.8133828341960907, "num_tokens": 242787076.0, "step": 7607 }, { "entropy": 0.7253998816013336, "epoch": 0.6999844739248193, "grad_norm": 0.15664871037006378, "learning_rate": 7.667065354065078e-05, "loss": 0.7134, "mean_token_accuracy": 0.7936402149498463, "num_tokens": 242818688.0, "step": 7608 }, { "entropy": 0.7337890844792128, "epoch": 0.7000764802962605, "grad_norm": 0.16120627522468567, "learning_rate": 7.666758671450916e-05, "loss": 0.723, "mean_token_accuracy": 0.78878553211689, "num_tokens": 242851201.0, "step": 7609 }, { "entropy": 0.6738234534859657, "epoch": 0.7001684866677017, "grad_norm": 0.1560145914554596, "learning_rate": 7.666451988836754e-05, "loss": 0.6581, "mean_token_accuracy": 0.8074146173894405, "num_tokens": 242882806.0, "step": 7610 }, { "entropy": 0.8461884576827288, "epoch": 0.700260493039143, "grad_norm": 0.16064859926700592, "learning_rate": 7.666145306222591e-05, "loss": 0.8491, "mean_token_accuracy": 0.7563928514719009, "num_tokens": 242914984.0, "step": 7611 }, { "entropy": 0.8005228042602539, "epoch": 0.7003524994105842, "grad_norm": 0.16478639841079712, "learning_rate": 7.665838623608428e-05, "loss": 0.7938, "mean_token_accuracy": 0.7615905776619911, "num_tokens": 242946679.0, "step": 7612 }, { "entropy": 0.8261461295187473, "epoch": 0.7004445057820254, "grad_norm": 0.16149502992630005, "learning_rate": 7.665531940994265e-05, "loss": 0.8109, "mean_token_accuracy": 0.7635314986109734, "num_tokens": 242978778.0, "step": 7613 }, { "entropy": 0.6754465373232961, "epoch": 0.7005365121534666, "grad_norm": 0.14962594211101532, "learning_rate": 7.665225258380103e-05, "loss": 0.6415, "mean_token_accuracy": 0.8087694570422173, "num_tokens": 243011193.0, "step": 7614 }, { "entropy": 0.7069093883037567, "epoch": 0.7006285185249078, "grad_norm": 0.15102525055408478, "learning_rate": 7.664918575765941e-05, "loss": 0.6832, "mean_token_accuracy": 0.7930694222450256, "num_tokens": 243042773.0, "step": 7615 }, { "entropy": 0.6938801780343056, "epoch": 0.7007205248963491, "grad_norm": 0.1559520810842514, "learning_rate": 7.664611893151778e-05, "loss": 0.6888, "mean_token_accuracy": 0.7912627086043358, "num_tokens": 243074905.0, "step": 7616 }, { "entropy": 0.7394914366304874, "epoch": 0.7008125312677903, "grad_norm": 0.15550178289413452, "learning_rate": 7.664305210537614e-05, "loss": 0.7206, "mean_token_accuracy": 0.7811341546475887, "num_tokens": 243106372.0, "step": 7617 }, { "entropy": 0.755211291834712, "epoch": 0.7009045376392316, "grad_norm": 0.163259819149971, "learning_rate": 7.663998527923453e-05, "loss": 0.7606, "mean_token_accuracy": 0.7754626162350178, "num_tokens": 243138403.0, "step": 7618 }, { "entropy": 0.7355961203575134, "epoch": 0.7009965440106727, "grad_norm": 0.16044124960899353, "learning_rate": 7.663691845309289e-05, "loss": 0.7292, "mean_token_accuracy": 0.785854984074831, "num_tokens": 243169935.0, "step": 7619 }, { "entropy": 0.6787296775728464, "epoch": 0.7010885503821139, "grad_norm": 0.1493343859910965, "learning_rate": 7.663385162695127e-05, "loss": 0.6699, "mean_token_accuracy": 0.8002457469701767, "num_tokens": 243202001.0, "step": 7620 }, { "entropy": 0.767768383026123, "epoch": 0.7011805567535552, "grad_norm": 0.1681603640317917, "learning_rate": 7.663078480080964e-05, "loss": 0.7661, "mean_token_accuracy": 0.7768210545182228, "num_tokens": 243234436.0, "step": 7621 }, { "entropy": 0.8000023681670427, "epoch": 0.7012725631249964, "grad_norm": 0.16010229289531708, "learning_rate": 7.662771797466802e-05, "loss": 0.8034, "mean_token_accuracy": 0.7675610966980457, "num_tokens": 243266470.0, "step": 7622 }, { "entropy": 0.6794110964983702, "epoch": 0.7013645694964377, "grad_norm": 0.1503300964832306, "learning_rate": 7.662465114852639e-05, "loss": 0.6665, "mean_token_accuracy": 0.802143894135952, "num_tokens": 243298589.0, "step": 7623 }, { "entropy": 0.8396780733019114, "epoch": 0.7014565758678788, "grad_norm": 0.15696683526039124, "learning_rate": 7.662158432238476e-05, "loss": 0.8238, "mean_token_accuracy": 0.7561744377017021, "num_tokens": 243330409.0, "step": 7624 }, { "entropy": 0.837322536855936, "epoch": 0.70154858223932, "grad_norm": 0.17641082406044006, "learning_rate": 7.661851749624314e-05, "loss": 0.8393, "mean_token_accuracy": 0.7595140933990479, "num_tokens": 243361940.0, "step": 7625 }, { "entropy": 0.80959577485919, "epoch": 0.7016405886107613, "grad_norm": 0.1627262383699417, "learning_rate": 7.661545067010152e-05, "loss": 0.7933, "mean_token_accuracy": 0.7707135900855064, "num_tokens": 243393825.0, "step": 7626 }, { "entropy": 0.8688065409660339, "epoch": 0.7017325949822025, "grad_norm": 0.157822385430336, "learning_rate": 7.661238384395989e-05, "loss": 0.861, "mean_token_accuracy": 0.749636746942997, "num_tokens": 243425631.0, "step": 7627 }, { "entropy": 0.8274762965738773, "epoch": 0.7018246013536438, "grad_norm": 0.16837841272354126, "learning_rate": 7.660931701781826e-05, "loss": 0.8172, "mean_token_accuracy": 0.7590423114597797, "num_tokens": 243457375.0, "step": 7628 }, { "entropy": 0.7912719622254372, "epoch": 0.7019166077250849, "grad_norm": 0.15320686995983124, "learning_rate": 7.660625019167664e-05, "loss": 0.7749, "mean_token_accuracy": 0.7714890167117119, "num_tokens": 243488533.0, "step": 7629 }, { "entropy": 0.7986083664000034, "epoch": 0.7020086140965262, "grad_norm": 0.1569005399942398, "learning_rate": 7.660318336553501e-05, "loss": 0.7838, "mean_token_accuracy": 0.7688675038516521, "num_tokens": 243520784.0, "step": 7630 }, { "entropy": 0.7508621215820312, "epoch": 0.7021006204679674, "grad_norm": 0.14884549379348755, "learning_rate": 7.660011653939339e-05, "loss": 0.7252, "mean_token_accuracy": 0.7863065302371979, "num_tokens": 243552860.0, "step": 7631 }, { "entropy": 0.6673137880861759, "epoch": 0.7021926268394086, "grad_norm": 0.18313084542751312, "learning_rate": 7.659704971325176e-05, "loss": 0.6613, "mean_token_accuracy": 0.8038823492825031, "num_tokens": 243584245.0, "step": 7632 }, { "entropy": 0.7577792480587959, "epoch": 0.7022846332108499, "grad_norm": 0.15880708396434784, "learning_rate": 7.659398288711014e-05, "loss": 0.753, "mean_token_accuracy": 0.7754039578139782, "num_tokens": 243616014.0, "step": 7633 }, { "entropy": 0.7472808677703142, "epoch": 0.7023766395822911, "grad_norm": 0.1631411910057068, "learning_rate": 7.65909160609685e-05, "loss": 0.7522, "mean_token_accuracy": 0.7805676981806755, "num_tokens": 243648388.0, "step": 7634 }, { "entropy": 0.6803871504962444, "epoch": 0.7024686459537323, "grad_norm": 0.1649216264486313, "learning_rate": 7.658784923482689e-05, "loss": 0.6824, "mean_token_accuracy": 0.8019695430994034, "num_tokens": 243681032.0, "step": 7635 }, { "entropy": 0.893890218809247, "epoch": 0.7025606523251735, "grad_norm": 0.17342601716518402, "learning_rate": 7.658478240868526e-05, "loss": 0.882, "mean_token_accuracy": 0.7472648732364178, "num_tokens": 243712771.0, "step": 7636 }, { "entropy": 0.6216355171054602, "epoch": 0.7026526586966148, "grad_norm": 0.15734365582466125, "learning_rate": 7.658171558254364e-05, "loss": 0.6106, "mean_token_accuracy": 0.8185278289020061, "num_tokens": 243744370.0, "step": 7637 }, { "entropy": 0.8754879757761955, "epoch": 0.702744665068056, "grad_norm": 0.16599132120609283, "learning_rate": 7.6578648756402e-05, "loss": 0.8698, "mean_token_accuracy": 0.7470797635614872, "num_tokens": 243776306.0, "step": 7638 }, { "entropy": 0.8465130366384983, "epoch": 0.7028366714394972, "grad_norm": 0.16264158487319946, "learning_rate": 7.657558193026037e-05, "loss": 0.8359, "mean_token_accuracy": 0.7594253197312355, "num_tokens": 243807104.0, "step": 7639 }, { "entropy": 0.8036378622055054, "epoch": 0.7029286778109384, "grad_norm": 0.15965670347213745, "learning_rate": 7.657251510411875e-05, "loss": 0.8058, "mean_token_accuracy": 0.7677075006067753, "num_tokens": 243839475.0, "step": 7640 }, { "entropy": 0.7541009895503521, "epoch": 0.7030206841823796, "grad_norm": 0.16159340739250183, "learning_rate": 7.656944827797714e-05, "loss": 0.7415, "mean_token_accuracy": 0.7764008119702339, "num_tokens": 243871595.0, "step": 7641 }, { "entropy": 0.8762995544821024, "epoch": 0.7031126905538209, "grad_norm": 0.16330844163894653, "learning_rate": 7.65663814518355e-05, "loss": 0.8623, "mean_token_accuracy": 0.7495631985366344, "num_tokens": 243904111.0, "step": 7642 }, { "entropy": 0.7416193261742592, "epoch": 0.7032046969252621, "grad_norm": 0.15308141708374023, "learning_rate": 7.656331462569387e-05, "loss": 0.7117, "mean_token_accuracy": 0.791195023804903, "num_tokens": 243936544.0, "step": 7643 }, { "entropy": 0.7398144025355577, "epoch": 0.7032967032967034, "grad_norm": 0.162959486246109, "learning_rate": 7.656024779955224e-05, "loss": 0.7413, "mean_token_accuracy": 0.7810872383415699, "num_tokens": 243967664.0, "step": 7644 }, { "entropy": 0.8245735354721546, "epoch": 0.7033887096681445, "grad_norm": 0.15420827269554138, "learning_rate": 7.655718097341062e-05, "loss": 0.8172, "mean_token_accuracy": 0.7579618133604527, "num_tokens": 244000069.0, "step": 7645 }, { "entropy": 0.8574688117951155, "epoch": 0.7034807160395857, "grad_norm": 0.15950457751750946, "learning_rate": 7.6554114147269e-05, "loss": 0.8605, "mean_token_accuracy": 0.7517339773476124, "num_tokens": 244031725.0, "step": 7646 }, { "entropy": 0.7952936924993992, "epoch": 0.703572722411027, "grad_norm": 0.1546565592288971, "learning_rate": 7.655104732112737e-05, "loss": 0.7975, "mean_token_accuracy": 0.7678984962403774, "num_tokens": 244063076.0, "step": 7647 }, { "entropy": 0.7031687721610069, "epoch": 0.7036647287824682, "grad_norm": 0.15763190388679504, "learning_rate": 7.654798049498574e-05, "loss": 0.7065, "mean_token_accuracy": 0.7896900996565819, "num_tokens": 244095194.0, "step": 7648 }, { "entropy": 0.7480364516377449, "epoch": 0.7037567351539095, "grad_norm": 0.15901979804039001, "learning_rate": 7.654491366884412e-05, "loss": 0.7374, "mean_token_accuracy": 0.7852096781134605, "num_tokens": 244126684.0, "step": 7649 }, { "entropy": 0.7617840133607388, "epoch": 0.7038487415253506, "grad_norm": 0.14799635112285614, "learning_rate": 7.654184684270249e-05, "loss": 0.7412, "mean_token_accuracy": 0.7819410488009453, "num_tokens": 244158894.0, "step": 7650 }, { "entropy": 0.8097643330693245, "epoch": 0.7039407478967918, "grad_norm": 0.15385381877422333, "learning_rate": 7.653878001656087e-05, "loss": 0.8022, "mean_token_accuracy": 0.7646013088524342, "num_tokens": 244190431.0, "step": 7651 }, { "entropy": 0.7142127454280853, "epoch": 0.7040327542682331, "grad_norm": 0.16659943759441376, "learning_rate": 7.653571319041924e-05, "loss": 0.7145, "mean_token_accuracy": 0.7863111086189747, "num_tokens": 244222283.0, "step": 7652 }, { "entropy": 0.7652881955727935, "epoch": 0.7041247606396743, "grad_norm": 0.14964427053928375, "learning_rate": 7.653264636427762e-05, "loss": 0.7547, "mean_token_accuracy": 0.7805241197347641, "num_tokens": 244254927.0, "step": 7653 }, { "entropy": 0.7991951033473015, "epoch": 0.7042167670111156, "grad_norm": 0.15512171387672424, "learning_rate": 7.652957953813599e-05, "loss": 0.7937, "mean_token_accuracy": 0.7654928639531136, "num_tokens": 244286853.0, "step": 7654 }, { "entropy": 0.7823294922709465, "epoch": 0.7043087733825567, "grad_norm": 0.15715454518795013, "learning_rate": 7.652651271199435e-05, "loss": 0.7768, "mean_token_accuracy": 0.7727909497916698, "num_tokens": 244319063.0, "step": 7655 }, { "entropy": 0.7177119264379144, "epoch": 0.704400779753998, "grad_norm": 0.15213745832443237, "learning_rate": 7.652344588585273e-05, "loss": 0.7141, "mean_token_accuracy": 0.7892466299235821, "num_tokens": 244350352.0, "step": 7656 }, { "entropy": 0.8000492043793201, "epoch": 0.7044927861254392, "grad_norm": 0.1646660417318344, "learning_rate": 7.652037905971112e-05, "loss": 0.799, "mean_token_accuracy": 0.7665712125599384, "num_tokens": 244382573.0, "step": 7657 }, { "entropy": 0.7314578238874674, "epoch": 0.7045847924968804, "grad_norm": 0.15458540618419647, "learning_rate": 7.651731223356948e-05, "loss": 0.7077, "mean_token_accuracy": 0.79664646089077, "num_tokens": 244414600.0, "step": 7658 }, { "entropy": 0.7465539053082466, "epoch": 0.7046767988683217, "grad_norm": 0.1686175912618637, "learning_rate": 7.651424540742785e-05, "loss": 0.7421, "mean_token_accuracy": 0.7808337435126305, "num_tokens": 244446165.0, "step": 7659 }, { "entropy": 0.7496860548853874, "epoch": 0.7047688052397628, "grad_norm": 0.1515577733516693, "learning_rate": 7.651117858128623e-05, "loss": 0.7478, "mean_token_accuracy": 0.7802695967257023, "num_tokens": 244478149.0, "step": 7660 }, { "entropy": 0.6279978100210428, "epoch": 0.7048608116112041, "grad_norm": 0.16005989909172058, "learning_rate": 7.65081117551446e-05, "loss": 0.6129, "mean_token_accuracy": 0.8216118104755878, "num_tokens": 244510713.0, "step": 7661 }, { "entropy": 0.8142352923750877, "epoch": 0.7049528179826453, "grad_norm": 0.15184378623962402, "learning_rate": 7.650504492900298e-05, "loss": 0.8038, "mean_token_accuracy": 0.7647728845477104, "num_tokens": 244542168.0, "step": 7662 }, { "entropy": 0.765898022800684, "epoch": 0.7050448243540866, "grad_norm": 0.15901324152946472, "learning_rate": 7.650197810286135e-05, "loss": 0.7483, "mean_token_accuracy": 0.7810634337365627, "num_tokens": 244573884.0, "step": 7663 }, { "entropy": 0.765862743370235, "epoch": 0.7051368307255278, "grad_norm": 0.1600445806980133, "learning_rate": 7.649891127671973e-05, "loss": 0.7638, "mean_token_accuracy": 0.7751954458653927, "num_tokens": 244606423.0, "step": 7664 }, { "entropy": 0.7707786429673433, "epoch": 0.7052288370969689, "grad_norm": 0.15818414092063904, "learning_rate": 7.64958444505781e-05, "loss": 0.7698, "mean_token_accuracy": 0.776370219886303, "num_tokens": 244638593.0, "step": 7665 }, { "entropy": 0.8006665501743555, "epoch": 0.7053208434684102, "grad_norm": 0.16076193749904633, "learning_rate": 7.649277762443647e-05, "loss": 0.782, "mean_token_accuracy": 0.7707730457186699, "num_tokens": 244670582.0, "step": 7666 }, { "entropy": 0.6718538273125887, "epoch": 0.7054128498398514, "grad_norm": 0.14689680933952332, "learning_rate": 7.648971079829485e-05, "loss": 0.6541, "mean_token_accuracy": 0.8020724728703499, "num_tokens": 244702100.0, "step": 7667 }, { "entropy": 0.7571428865194321, "epoch": 0.7055048562112927, "grad_norm": 0.1495533436536789, "learning_rate": 7.648664397215323e-05, "loss": 0.7237, "mean_token_accuracy": 0.7815588675439358, "num_tokens": 244734488.0, "step": 7668 }, { "entropy": 0.7070229910314083, "epoch": 0.7055968625827339, "grad_norm": 0.15777841210365295, "learning_rate": 7.64835771460116e-05, "loss": 0.6962, "mean_token_accuracy": 0.7942557521164417, "num_tokens": 244766791.0, "step": 7669 }, { "entropy": 0.7642288729548454, "epoch": 0.705688868954175, "grad_norm": 0.14954622089862823, "learning_rate": 7.648051031986997e-05, "loss": 0.7541, "mean_token_accuracy": 0.7732691168785095, "num_tokens": 244798247.0, "step": 7670 }, { "entropy": 0.748133109882474, "epoch": 0.7057808753256163, "grad_norm": 0.1577063351869583, "learning_rate": 7.647744349372833e-05, "loss": 0.7243, "mean_token_accuracy": 0.7838017120957375, "num_tokens": 244829421.0, "step": 7671 }, { "entropy": 0.7034579142928123, "epoch": 0.7058728816970575, "grad_norm": 0.15316817164421082, "learning_rate": 7.647437666758673e-05, "loss": 0.7163, "mean_token_accuracy": 0.7854543961584568, "num_tokens": 244861943.0, "step": 7672 }, { "entropy": 0.6825434062629938, "epoch": 0.7059648880684988, "grad_norm": 0.16040782630443573, "learning_rate": 7.64713098414451e-05, "loss": 0.6824, "mean_token_accuracy": 0.7968901470303535, "num_tokens": 244893825.0, "step": 7673 }, { "entropy": 0.7395736388862133, "epoch": 0.70605689443994, "grad_norm": 0.15333908796310425, "learning_rate": 7.646824301530346e-05, "loss": 0.7256, "mean_token_accuracy": 0.788584504276514, "num_tokens": 244925837.0, "step": 7674 }, { "entropy": 0.6809925455600023, "epoch": 0.7061489008113812, "grad_norm": 0.1575118452310562, "learning_rate": 7.646517618916183e-05, "loss": 0.6745, "mean_token_accuracy": 0.7932965345680714, "num_tokens": 244956408.0, "step": 7675 }, { "entropy": 0.7466193418949842, "epoch": 0.7062409071828224, "grad_norm": 0.16313517093658447, "learning_rate": 7.646210936302021e-05, "loss": 0.7575, "mean_token_accuracy": 0.7772349752485752, "num_tokens": 244989176.0, "step": 7676 }, { "entropy": 0.6508464310318232, "epoch": 0.7063329135542636, "grad_norm": 0.1589856594800949, "learning_rate": 7.64590425368786e-05, "loss": 0.6522, "mean_token_accuracy": 0.8040228523313999, "num_tokens": 245021182.0, "step": 7677 }, { "entropy": 0.7164694629609585, "epoch": 0.7064249199257049, "grad_norm": 0.1479829102754593, "learning_rate": 7.645597571073696e-05, "loss": 0.7016, "mean_token_accuracy": 0.795869767665863, "num_tokens": 245053868.0, "step": 7678 }, { "entropy": 0.6473747193813324, "epoch": 0.7065169262971461, "grad_norm": 0.1485128402709961, "learning_rate": 7.645290888459533e-05, "loss": 0.6303, "mean_token_accuracy": 0.8104803711175919, "num_tokens": 245085587.0, "step": 7679 }, { "entropy": 0.6614797860383987, "epoch": 0.7066089326685873, "grad_norm": 0.15874788165092468, "learning_rate": 7.644984205845371e-05, "loss": 0.6269, "mean_token_accuracy": 0.8099324591457844, "num_tokens": 245117631.0, "step": 7680 }, { "entropy": 0.729758009314537, "epoch": 0.7067009390400285, "grad_norm": 0.15084581077098846, "learning_rate": 7.644677523231208e-05, "loss": 0.7007, "mean_token_accuracy": 0.7933681979775429, "num_tokens": 245149431.0, "step": 7681 }, { "entropy": 0.7810043077915907, "epoch": 0.7067929454114698, "grad_norm": 0.15181227028369904, "learning_rate": 7.644370840617046e-05, "loss": 0.7739, "mean_token_accuracy": 0.7717147059738636, "num_tokens": 245180591.0, "step": 7682 }, { "entropy": 0.7115541249513626, "epoch": 0.706884951782911, "grad_norm": 0.15495151281356812, "learning_rate": 7.644064158002883e-05, "loss": 0.6958, "mean_token_accuracy": 0.795132365077734, "num_tokens": 245213076.0, "step": 7683 }, { "entropy": 0.7706594727933407, "epoch": 0.7069769581543522, "grad_norm": 0.16620995104312897, "learning_rate": 7.643757475388721e-05, "loss": 0.7601, "mean_token_accuracy": 0.7786032110452652, "num_tokens": 245244688.0, "step": 7684 }, { "entropy": 0.6643151976168156, "epoch": 0.7070689645257934, "grad_norm": 0.16368162631988525, "learning_rate": 7.643450792774558e-05, "loss": 0.6582, "mean_token_accuracy": 0.8038841485977173, "num_tokens": 245276443.0, "step": 7685 }, { "entropy": 0.7632371708750725, "epoch": 0.7071609708972346, "grad_norm": 0.15856462717056274, "learning_rate": 7.643144110160395e-05, "loss": 0.7757, "mean_token_accuracy": 0.7714338041841984, "num_tokens": 245309211.0, "step": 7686 }, { "entropy": 0.6090748328715563, "epoch": 0.7072529772686759, "grad_norm": 0.1495417058467865, "learning_rate": 7.642837427546233e-05, "loss": 0.5819, "mean_token_accuracy": 0.8245352916419506, "num_tokens": 245341488.0, "step": 7687 }, { "entropy": 0.7797046536579728, "epoch": 0.7073449836401171, "grad_norm": 0.15519559383392334, "learning_rate": 7.642530744932071e-05, "loss": 0.7804, "mean_token_accuracy": 0.7702047862112522, "num_tokens": 245373468.0, "step": 7688 }, { "entropy": 0.7170884907245636, "epoch": 0.7074369900115584, "grad_norm": 0.15768687427043915, "learning_rate": 7.642224062317908e-05, "loss": 0.6959, "mean_token_accuracy": 0.7949527502059937, "num_tokens": 245404322.0, "step": 7689 }, { "entropy": 0.7725948467850685, "epoch": 0.7075289963829995, "grad_norm": 0.1593724638223648, "learning_rate": 7.641917379703745e-05, "loss": 0.7629, "mean_token_accuracy": 0.7775341831147671, "num_tokens": 245436613.0, "step": 7690 }, { "entropy": 0.6819283608347178, "epoch": 0.7076210027544407, "grad_norm": 0.15016543865203857, "learning_rate": 7.641610697089583e-05, "loss": 0.6677, "mean_token_accuracy": 0.8024352192878723, "num_tokens": 245467465.0, "step": 7691 }, { "entropy": 0.6789554916322231, "epoch": 0.707713009125882, "grad_norm": 0.1513652503490448, "learning_rate": 7.64130401447542e-05, "loss": 0.6479, "mean_token_accuracy": 0.8103830963373184, "num_tokens": 245499412.0, "step": 7692 }, { "entropy": 0.7533810120075941, "epoch": 0.7078050154973232, "grad_norm": 0.1637014001607895, "learning_rate": 7.640997331861258e-05, "loss": 0.751, "mean_token_accuracy": 0.7792380042374134, "num_tokens": 245531019.0, "step": 7693 }, { "entropy": 0.6371631100773811, "epoch": 0.7078970218687645, "grad_norm": 0.15946808457374573, "learning_rate": 7.640690649247094e-05, "loss": 0.6179, "mean_token_accuracy": 0.8132961466908455, "num_tokens": 245563245.0, "step": 7694 }, { "entropy": 0.7735275998711586, "epoch": 0.7079890282402056, "grad_norm": 0.1603754758834839, "learning_rate": 7.640383966632933e-05, "loss": 0.762, "mean_token_accuracy": 0.7747266441583633, "num_tokens": 245595005.0, "step": 7695 }, { "entropy": 0.7088129110634327, "epoch": 0.7080810346116468, "grad_norm": 0.15929804742336273, "learning_rate": 7.64007728401877e-05, "loss": 0.6977, "mean_token_accuracy": 0.7934445217251778, "num_tokens": 245626845.0, "step": 7696 }, { "entropy": 0.7120589893311262, "epoch": 0.7081730409830881, "grad_norm": 0.1540215015411377, "learning_rate": 7.639770601404606e-05, "loss": 0.7144, "mean_token_accuracy": 0.7856374606490135, "num_tokens": 245658535.0, "step": 7697 }, { "entropy": 0.7811185419559479, "epoch": 0.7082650473545293, "grad_norm": 0.16395685076713562, "learning_rate": 7.639463918790444e-05, "loss": 0.7937, "mean_token_accuracy": 0.7658125683665276, "num_tokens": 245690667.0, "step": 7698 }, { "entropy": 0.7430416382849216, "epoch": 0.7083570537259706, "grad_norm": 0.16229087114334106, "learning_rate": 7.639157236176282e-05, "loss": 0.7458, "mean_token_accuracy": 0.7830075994133949, "num_tokens": 245722440.0, "step": 7699 }, { "entropy": 0.8000804651528597, "epoch": 0.7084490600974117, "grad_norm": 0.17133809626102448, "learning_rate": 7.638850553562119e-05, "loss": 0.8095, "mean_token_accuracy": 0.7619768939912319, "num_tokens": 245754159.0, "step": 7700 }, { "entropy": 0.9374744538217783, "epoch": 0.708541066468853, "grad_norm": 0.16593720018863678, "learning_rate": 7.638543870947956e-05, "loss": 0.9346, "mean_token_accuracy": 0.7316080071032047, "num_tokens": 245785997.0, "step": 7701 }, { "entropy": 0.7476457487791777, "epoch": 0.7086330728402942, "grad_norm": 0.15958671271800995, "learning_rate": 7.638237188333793e-05, "loss": 0.7393, "mean_token_accuracy": 0.7834824584424496, "num_tokens": 245817992.0, "step": 7702 }, { "entropy": 0.6874428149312735, "epoch": 0.7087250792117354, "grad_norm": 0.15295849740505219, "learning_rate": 7.637930505719631e-05, "loss": 0.6762, "mean_token_accuracy": 0.7980634905397892, "num_tokens": 245850100.0, "step": 7703 }, { "entropy": 0.7332922741770744, "epoch": 0.7088170855831767, "grad_norm": 0.15463975071907043, "learning_rate": 7.637623823105469e-05, "loss": 0.7197, "mean_token_accuracy": 0.7853688783943653, "num_tokens": 245881562.0, "step": 7704 }, { "entropy": 0.7456270717084408, "epoch": 0.7089090919546178, "grad_norm": 0.15755492448806763, "learning_rate": 7.637317140491306e-05, "loss": 0.7334, "mean_token_accuracy": 0.7878634668886662, "num_tokens": 245913380.0, "step": 7705 }, { "entropy": 0.741539852693677, "epoch": 0.7090010983260591, "grad_norm": 0.1556846648454666, "learning_rate": 7.637010457877143e-05, "loss": 0.7296, "mean_token_accuracy": 0.7862830348312855, "num_tokens": 245945494.0, "step": 7706 }, { "entropy": 0.8660062626004219, "epoch": 0.7090931046975003, "grad_norm": 0.1610516458749771, "learning_rate": 7.636703775262981e-05, "loss": 0.8628, "mean_token_accuracy": 0.7497411631047726, "num_tokens": 245977409.0, "step": 7707 }, { "entropy": 0.768998958170414, "epoch": 0.7091851110689416, "grad_norm": 0.1633235365152359, "learning_rate": 7.636397092648818e-05, "loss": 0.7571, "mean_token_accuracy": 0.7746807858347893, "num_tokens": 246009225.0, "step": 7708 }, { "entropy": 0.7713670842349529, "epoch": 0.7092771174403828, "grad_norm": 0.15848511457443237, "learning_rate": 7.636090410034656e-05, "loss": 0.7459, "mean_token_accuracy": 0.7745978944003582, "num_tokens": 246041136.0, "step": 7709 }, { "entropy": 0.8566139936447144, "epoch": 0.7093691238118239, "grad_norm": 0.15917418897151947, "learning_rate": 7.635783727420492e-05, "loss": 0.8426, "mean_token_accuracy": 0.7590745314955711, "num_tokens": 246073481.0, "step": 7710 }, { "entropy": 0.7720038276165724, "epoch": 0.7094611301832652, "grad_norm": 0.15933901071548462, "learning_rate": 7.63547704480633e-05, "loss": 0.7646, "mean_token_accuracy": 0.7767154984176159, "num_tokens": 246105422.0, "step": 7711 }, { "entropy": 0.7379417940974236, "epoch": 0.7095531365547064, "grad_norm": 0.15105661749839783, "learning_rate": 7.635170362192167e-05, "loss": 0.7176, "mean_token_accuracy": 0.7872959971427917, "num_tokens": 246137318.0, "step": 7712 }, { "entropy": 0.7422634847462177, "epoch": 0.7096451429261477, "grad_norm": 0.16348151862621307, "learning_rate": 7.634863679578004e-05, "loss": 0.7415, "mean_token_accuracy": 0.7804159075021744, "num_tokens": 246168950.0, "step": 7713 }, { "entropy": 0.7926849648356438, "epoch": 0.7097371492975889, "grad_norm": 0.16398972272872925, "learning_rate": 7.634556996963842e-05, "loss": 0.7785, "mean_token_accuracy": 0.7712567560374737, "num_tokens": 246200029.0, "step": 7714 }, { "entropy": 0.7306593675166368, "epoch": 0.70982915566903, "grad_norm": 0.1523219645023346, "learning_rate": 7.63425031434968e-05, "loss": 0.7042, "mean_token_accuracy": 0.7891686968505383, "num_tokens": 246231645.0, "step": 7715 }, { "entropy": 0.7144572343677282, "epoch": 0.7099211620404713, "grad_norm": 0.15155354142189026, "learning_rate": 7.633943631735517e-05, "loss": 0.6887, "mean_token_accuracy": 0.7955098561942577, "num_tokens": 246264147.0, "step": 7716 }, { "entropy": 0.7619734015315771, "epoch": 0.7100131684119125, "grad_norm": 0.16292253136634827, "learning_rate": 7.633636949121354e-05, "loss": 0.7467, "mean_token_accuracy": 0.7776306755840778, "num_tokens": 246295765.0, "step": 7717 }, { "entropy": 0.7643069978803396, "epoch": 0.7101051747833538, "grad_norm": 0.16074953973293304, "learning_rate": 7.633330266507191e-05, "loss": 0.7567, "mean_token_accuracy": 0.7756357975304127, "num_tokens": 246327015.0, "step": 7718 }, { "entropy": 0.7118450421839952, "epoch": 0.710197181154795, "grad_norm": 0.14952489733695984, "learning_rate": 7.63302358389303e-05, "loss": 0.7131, "mean_token_accuracy": 0.7882188446819782, "num_tokens": 246359172.0, "step": 7719 }, { "entropy": 0.778235737234354, "epoch": 0.7102891875262362, "grad_norm": 0.15898847579956055, "learning_rate": 7.632716901278867e-05, "loss": 0.7651, "mean_token_accuracy": 0.7739639095962048, "num_tokens": 246391307.0, "step": 7720 }, { "entropy": 0.7744659408926964, "epoch": 0.7103811938976774, "grad_norm": 0.16391873359680176, "learning_rate": 7.632410218664704e-05, "loss": 0.7925, "mean_token_accuracy": 0.7749700620770454, "num_tokens": 246423206.0, "step": 7721 }, { "entropy": 0.8283637277781963, "epoch": 0.7104732002691186, "grad_norm": 0.16494673490524292, "learning_rate": 7.632103536050542e-05, "loss": 0.8487, "mean_token_accuracy": 0.7570623457431793, "num_tokens": 246454957.0, "step": 7722 }, { "entropy": 0.7564982054755092, "epoch": 0.7105652066405599, "grad_norm": 0.1586618721485138, "learning_rate": 7.631796853436379e-05, "loss": 0.7295, "mean_token_accuracy": 0.78190703317523, "num_tokens": 246486599.0, "step": 7723 }, { "entropy": 0.6854599639773369, "epoch": 0.7106572130120011, "grad_norm": 0.15351048111915588, "learning_rate": 7.631490170822217e-05, "loss": 0.68, "mean_token_accuracy": 0.7948657311499119, "num_tokens": 246518859.0, "step": 7724 }, { "entropy": 0.812454666942358, "epoch": 0.7107492193834423, "grad_norm": 0.15157049894332886, "learning_rate": 7.631183488208054e-05, "loss": 0.8059, "mean_token_accuracy": 0.7637427859008312, "num_tokens": 246551219.0, "step": 7725 }, { "entropy": 0.5767068527638912, "epoch": 0.7108412257548835, "grad_norm": 0.16225332021713257, "learning_rate": 7.630876805593892e-05, "loss": 0.566, "mean_token_accuracy": 0.8303605765104294, "num_tokens": 246582914.0, "step": 7726 }, { "entropy": 0.7537737116217613, "epoch": 0.7109332321263248, "grad_norm": 0.158100888133049, "learning_rate": 7.630570122979729e-05, "loss": 0.7421, "mean_token_accuracy": 0.7870158441364765, "num_tokens": 246614618.0, "step": 7727 }, { "entropy": 0.7858059946447611, "epoch": 0.711025238497766, "grad_norm": 0.1615440547466278, "learning_rate": 7.630263440365565e-05, "loss": 0.7528, "mean_token_accuracy": 0.7798841521143913, "num_tokens": 246646005.0, "step": 7728 }, { "entropy": 0.7244427585974336, "epoch": 0.7111172448692072, "grad_norm": 0.16013580560684204, "learning_rate": 7.629956757751404e-05, "loss": 0.7089, "mean_token_accuracy": 0.7915889695286751, "num_tokens": 246677590.0, "step": 7729 }, { "entropy": 0.7836611066013575, "epoch": 0.7112092512406484, "grad_norm": 0.16171906888484955, "learning_rate": 7.629650075137242e-05, "loss": 0.7647, "mean_token_accuracy": 0.7724419832229614, "num_tokens": 246708726.0, "step": 7730 }, { "entropy": 0.6929294150322676, "epoch": 0.7113012576120896, "grad_norm": 0.1618535816669464, "learning_rate": 7.629343392523079e-05, "loss": 0.6894, "mean_token_accuracy": 0.795664582401514, "num_tokens": 246740806.0, "step": 7731 }, { "entropy": 0.8313948586583138, "epoch": 0.7113932639835309, "grad_norm": 0.16083213686943054, "learning_rate": 7.629036709908915e-05, "loss": 0.8155, "mean_token_accuracy": 0.7594755440950394, "num_tokens": 246771948.0, "step": 7732 }, { "entropy": 0.8021026514470577, "epoch": 0.7114852703549721, "grad_norm": 0.16246753931045532, "learning_rate": 7.628730027294752e-05, "loss": 0.7861, "mean_token_accuracy": 0.769036553800106, "num_tokens": 246803763.0, "step": 7733 }, { "entropy": 0.6498741749674082, "epoch": 0.7115772767264134, "grad_norm": 0.15244333446025848, "learning_rate": 7.62842334468059e-05, "loss": 0.6361, "mean_token_accuracy": 0.8110232427716255, "num_tokens": 246835425.0, "step": 7734 }, { "entropy": 0.7554204948246479, "epoch": 0.7116692830978545, "grad_norm": 0.15529809892177582, "learning_rate": 7.628116662066428e-05, "loss": 0.7242, "mean_token_accuracy": 0.7877806797623634, "num_tokens": 246867437.0, "step": 7735 }, { "entropy": 0.7026443220674992, "epoch": 0.7117612894692957, "grad_norm": 0.1525433510541916, "learning_rate": 7.627809979452265e-05, "loss": 0.6854, "mean_token_accuracy": 0.7966473810374737, "num_tokens": 246899597.0, "step": 7736 }, { "entropy": 0.7714231349527836, "epoch": 0.711853295840737, "grad_norm": 0.16589736938476562, "learning_rate": 7.627503296838102e-05, "loss": 0.7716, "mean_token_accuracy": 0.7741065993905067, "num_tokens": 246931848.0, "step": 7737 }, { "entropy": 0.7292466778308153, "epoch": 0.7119453022121782, "grad_norm": 0.16648989915847778, "learning_rate": 7.62719661422394e-05, "loss": 0.7113, "mean_token_accuracy": 0.7907077930867672, "num_tokens": 246963267.0, "step": 7738 }, { "entropy": 0.6226468198001385, "epoch": 0.7120373085836195, "grad_norm": 0.14857879281044006, "learning_rate": 7.626889931609777e-05, "loss": 0.598, "mean_token_accuracy": 0.8216148912906647, "num_tokens": 246995264.0, "step": 7739 }, { "entropy": 0.8858596757054329, "epoch": 0.7121293149550606, "grad_norm": 0.1684175729751587, "learning_rate": 7.626583248995615e-05, "loss": 0.9122, "mean_token_accuracy": 0.735633235424757, "num_tokens": 247027588.0, "step": 7740 }, { "entropy": 0.7619121950119734, "epoch": 0.7122213213265018, "grad_norm": 0.15950913727283478, "learning_rate": 7.626276566381452e-05, "loss": 0.7733, "mean_token_accuracy": 0.777202919125557, "num_tokens": 247059787.0, "step": 7741 }, { "entropy": 0.7894290555268526, "epoch": 0.7123133276979431, "grad_norm": 0.15158797800540924, "learning_rate": 7.62596988376729e-05, "loss": 0.7984, "mean_token_accuracy": 0.7638357244431973, "num_tokens": 247091558.0, "step": 7742 }, { "entropy": 0.6752070309594274, "epoch": 0.7124053340693843, "grad_norm": 0.15768490731716156, "learning_rate": 7.625663201153127e-05, "loss": 0.6747, "mean_token_accuracy": 0.8007259666919708, "num_tokens": 247122803.0, "step": 7743 }, { "entropy": 0.7668081298470497, "epoch": 0.7124973404408256, "grad_norm": 0.15152016282081604, "learning_rate": 7.625356518538964e-05, "loss": 0.754, "mean_token_accuracy": 0.7755378596484661, "num_tokens": 247154857.0, "step": 7744 }, { "entropy": 0.7013351935893297, "epoch": 0.7125893468122667, "grad_norm": 0.16090771555900574, "learning_rate": 7.625049835924802e-05, "loss": 0.6562, "mean_token_accuracy": 0.8014717139303684, "num_tokens": 247185560.0, "step": 7745 }, { "entropy": 0.7212214414030313, "epoch": 0.712681353183708, "grad_norm": 0.15394622087478638, "learning_rate": 7.62474315331064e-05, "loss": 0.692, "mean_token_accuracy": 0.7949661128222942, "num_tokens": 247217092.0, "step": 7746 }, { "entropy": 0.8994690794497728, "epoch": 0.7127733595551492, "grad_norm": 0.1590815633535385, "learning_rate": 7.624436470696477e-05, "loss": 0.9049, "mean_token_accuracy": 0.7380979619920254, "num_tokens": 247248843.0, "step": 7747 }, { "entropy": 0.6765907481312752, "epoch": 0.7128653659265904, "grad_norm": 0.16464878618717194, "learning_rate": 7.624129788082313e-05, "loss": 0.6686, "mean_token_accuracy": 0.8038506545126438, "num_tokens": 247280891.0, "step": 7748 }, { "entropy": 0.7584703918546438, "epoch": 0.7129573722980317, "grad_norm": 0.16575177013874054, "learning_rate": 7.623823105468152e-05, "loss": 0.7498, "mean_token_accuracy": 0.7826003953814507, "num_tokens": 247312224.0, "step": 7749 }, { "entropy": 0.7871558163315058, "epoch": 0.7130493786694728, "grad_norm": 0.16131983697414398, "learning_rate": 7.623516422853988e-05, "loss": 0.7778, "mean_token_accuracy": 0.7718077935278416, "num_tokens": 247343743.0, "step": 7750 }, { "entropy": 0.7554525760933757, "epoch": 0.7131413850409141, "grad_norm": 0.1549024134874344, "learning_rate": 7.623209740239827e-05, "loss": 0.7428, "mean_token_accuracy": 0.7801962494850159, "num_tokens": 247375739.0, "step": 7751 }, { "entropy": 0.7187416050583124, "epoch": 0.7132333914123553, "grad_norm": 0.15833783149719238, "learning_rate": 7.622903057625663e-05, "loss": 0.7132, "mean_token_accuracy": 0.7891486622393131, "num_tokens": 247408069.0, "step": 7752 }, { "entropy": 0.7869937848299742, "epoch": 0.7133253977837966, "grad_norm": 0.15364477038383484, "learning_rate": 7.622596375011501e-05, "loss": 0.7882, "mean_token_accuracy": 0.7690650261938572, "num_tokens": 247439802.0, "step": 7753 }, { "entropy": 0.7797029986977577, "epoch": 0.7134174041552378, "grad_norm": 0.1565232276916504, "learning_rate": 7.622289692397338e-05, "loss": 0.7614, "mean_token_accuracy": 0.774081964045763, "num_tokens": 247471383.0, "step": 7754 }, { "entropy": 0.7594541795551777, "epoch": 0.7135094105266789, "grad_norm": 0.15079501271247864, "learning_rate": 7.621983009783176e-05, "loss": 0.7463, "mean_token_accuracy": 0.7770072743296623, "num_tokens": 247504120.0, "step": 7755 }, { "entropy": 0.7640374545007944, "epoch": 0.7136014168981202, "grad_norm": 0.16179980337619781, "learning_rate": 7.621676327169013e-05, "loss": 0.7589, "mean_token_accuracy": 0.7798115313053131, "num_tokens": 247535725.0, "step": 7756 }, { "entropy": 0.7364048329181969, "epoch": 0.7136934232695614, "grad_norm": 0.14941072463989258, "learning_rate": 7.621369644554851e-05, "loss": 0.7288, "mean_token_accuracy": 0.7838046513497829, "num_tokens": 247567631.0, "step": 7757 }, { "entropy": 0.748789869248867, "epoch": 0.7137854296410027, "grad_norm": 0.1541941910982132, "learning_rate": 7.621062961940688e-05, "loss": 0.7296, "mean_token_accuracy": 0.7844168841838837, "num_tokens": 247599802.0, "step": 7758 }, { "entropy": 0.7460678378120065, "epoch": 0.7138774360124439, "grad_norm": 0.16640658676624298, "learning_rate": 7.620756279326525e-05, "loss": 0.7419, "mean_token_accuracy": 0.7892195209860802, "num_tokens": 247632051.0, "step": 7759 }, { "entropy": 0.6909842304885387, "epoch": 0.713969442383885, "grad_norm": 0.16003543138504028, "learning_rate": 7.620449596712363e-05, "loss": 0.6849, "mean_token_accuracy": 0.7961903624236584, "num_tokens": 247663979.0, "step": 7760 }, { "entropy": 0.7195100644603372, "epoch": 0.7140614487553263, "grad_norm": 0.14794141054153442, "learning_rate": 7.620142914098201e-05, "loss": 0.6999, "mean_token_accuracy": 0.7919264361262321, "num_tokens": 247695022.0, "step": 7761 }, { "entropy": 0.7100788988173008, "epoch": 0.7141534551267675, "grad_norm": 0.14736983180046082, "learning_rate": 7.619836231484038e-05, "loss": 0.7089, "mean_token_accuracy": 0.7903619445860386, "num_tokens": 247727326.0, "step": 7762 }, { "entropy": 0.6707541197538376, "epoch": 0.7142454614982088, "grad_norm": 0.1457640826702118, "learning_rate": 7.619529548869875e-05, "loss": 0.6595, "mean_token_accuracy": 0.8016452863812447, "num_tokens": 247759639.0, "step": 7763 }, { "entropy": 0.6537999892607331, "epoch": 0.71433746786965, "grad_norm": 0.15103404223918915, "learning_rate": 7.619222866255712e-05, "loss": 0.642, "mean_token_accuracy": 0.8128191195428371, "num_tokens": 247791978.0, "step": 7764 }, { "entropy": 0.712818218395114, "epoch": 0.7144294742410912, "grad_norm": 0.15465407073497772, "learning_rate": 7.61891618364155e-05, "loss": 0.686, "mean_token_accuracy": 0.7943439707159996, "num_tokens": 247823371.0, "step": 7765 }, { "entropy": 0.7231134865432978, "epoch": 0.7145214806125324, "grad_norm": 0.1691575050354004, "learning_rate": 7.618609501027388e-05, "loss": 0.7352, "mean_token_accuracy": 0.7842858396470547, "num_tokens": 247855480.0, "step": 7766 }, { "entropy": 0.8269942924380302, "epoch": 0.7146134869839736, "grad_norm": 0.16038359701633453, "learning_rate": 7.618302818413225e-05, "loss": 0.8278, "mean_token_accuracy": 0.7608065791428089, "num_tokens": 247887195.0, "step": 7767 }, { "entropy": 0.815205991268158, "epoch": 0.7147054933554149, "grad_norm": 0.15800216794013977, "learning_rate": 7.617996135799061e-05, "loss": 0.7998, "mean_token_accuracy": 0.7682800181210041, "num_tokens": 247919806.0, "step": 7768 }, { "entropy": 0.6953230779618025, "epoch": 0.7147974997268561, "grad_norm": 0.16864758729934692, "learning_rate": 7.6176894531849e-05, "loss": 0.6905, "mean_token_accuracy": 0.796279564499855, "num_tokens": 247951979.0, "step": 7769 }, { "entropy": 0.8127613961696625, "epoch": 0.7148895060982973, "grad_norm": 0.16640840470790863, "learning_rate": 7.617382770570736e-05, "loss": 0.8178, "mean_token_accuracy": 0.7608801908791065, "num_tokens": 247983975.0, "step": 7770 }, { "entropy": 0.8499493338167667, "epoch": 0.7149815124697385, "grad_norm": 0.16478778421878815, "learning_rate": 7.617076087956574e-05, "loss": 0.8565, "mean_token_accuracy": 0.7510617151856422, "num_tokens": 248015622.0, "step": 7771 }, { "entropy": 0.6901806257665157, "epoch": 0.7150735188411798, "grad_norm": 0.15633217990398407, "learning_rate": 7.616769405342411e-05, "loss": 0.6679, "mean_token_accuracy": 0.801559254527092, "num_tokens": 248047759.0, "step": 7772 }, { "entropy": 0.8176596965640783, "epoch": 0.715165525212621, "grad_norm": 0.16402335464954376, "learning_rate": 7.61646272272825e-05, "loss": 0.8107, "mean_token_accuracy": 0.7654799334704876, "num_tokens": 248079147.0, "step": 7773 }, { "entropy": 0.8058506604284048, "epoch": 0.7152575315840622, "grad_norm": 0.15339523553848267, "learning_rate": 7.616156040114086e-05, "loss": 0.7955, "mean_token_accuracy": 0.7651201635599136, "num_tokens": 248110555.0, "step": 7774 }, { "entropy": 0.7172575034201145, "epoch": 0.7153495379555034, "grad_norm": 0.15279529988765717, "learning_rate": 7.615849357499923e-05, "loss": 0.6832, "mean_token_accuracy": 0.7984414994716644, "num_tokens": 248142600.0, "step": 7775 }, { "entropy": 0.6991952322423458, "epoch": 0.7154415443269446, "grad_norm": 0.14327575266361237, "learning_rate": 7.615542674885761e-05, "loss": 0.6792, "mean_token_accuracy": 0.7976426407694817, "num_tokens": 248174769.0, "step": 7776 }, { "entropy": 0.7888136841356754, "epoch": 0.7155335506983859, "grad_norm": 0.15282917022705078, "learning_rate": 7.615235992271599e-05, "loss": 0.7767, "mean_token_accuracy": 0.773173376917839, "num_tokens": 248206929.0, "step": 7777 }, { "entropy": 0.6634180210530758, "epoch": 0.7156255570698271, "grad_norm": 0.15584835410118103, "learning_rate": 7.614929309657436e-05, "loss": 0.6375, "mean_token_accuracy": 0.8113144971430302, "num_tokens": 248238802.0, "step": 7778 }, { "entropy": 0.7935320623219013, "epoch": 0.7157175634412684, "grad_norm": 0.15831786394119263, "learning_rate": 7.614622627043273e-05, "loss": 0.7763, "mean_token_accuracy": 0.7750990763306618, "num_tokens": 248270935.0, "step": 7779 }, { "entropy": 0.6737814890220761, "epoch": 0.7158095698127095, "grad_norm": 0.15074265003204346, "learning_rate": 7.614315944429111e-05, "loss": 0.6619, "mean_token_accuracy": 0.802977092564106, "num_tokens": 248303564.0, "step": 7780 }, { "entropy": 0.7043156158179045, "epoch": 0.7159015761841507, "grad_norm": 0.15215253829956055, "learning_rate": 7.614009261814948e-05, "loss": 0.6875, "mean_token_accuracy": 0.7944777868688107, "num_tokens": 248335336.0, "step": 7781 }, { "entropy": 0.7677399143576622, "epoch": 0.715993582555592, "grad_norm": 0.1607779562473297, "learning_rate": 7.613702579200786e-05, "loss": 0.7594, "mean_token_accuracy": 0.7781425938010216, "num_tokens": 248366698.0, "step": 7782 }, { "entropy": 0.705123282968998, "epoch": 0.7160855889270332, "grad_norm": 0.15246890485286713, "learning_rate": 7.613395896586623e-05, "loss": 0.6912, "mean_token_accuracy": 0.7936547324061394, "num_tokens": 248398616.0, "step": 7783 }, { "entropy": 0.8230610694736242, "epoch": 0.7161775952984745, "grad_norm": 0.16714119911193848, "learning_rate": 7.613089213972461e-05, "loss": 0.8224, "mean_token_accuracy": 0.7576384618878365, "num_tokens": 248430186.0, "step": 7784 }, { "entropy": 0.7469585556536913, "epoch": 0.7162696016699156, "grad_norm": 0.1549912691116333, "learning_rate": 7.612782531358298e-05, "loss": 0.7524, "mean_token_accuracy": 0.7812136970460415, "num_tokens": 248462328.0, "step": 7785 }, { "entropy": 0.7058742865920067, "epoch": 0.7163616080413568, "grad_norm": 0.15642045438289642, "learning_rate": 7.612475848744134e-05, "loss": 0.7016, "mean_token_accuracy": 0.7925045490264893, "num_tokens": 248494796.0, "step": 7786 }, { "entropy": 0.7850315570831299, "epoch": 0.7164536144127981, "grad_norm": 0.16573500633239746, "learning_rate": 7.612169166129973e-05, "loss": 0.7799, "mean_token_accuracy": 0.774956252425909, "num_tokens": 248526653.0, "step": 7787 }, { "entropy": 0.771076025441289, "epoch": 0.7165456207842393, "grad_norm": 0.14662708342075348, "learning_rate": 7.61186248351581e-05, "loss": 0.7615, "mean_token_accuracy": 0.7755336165428162, "num_tokens": 248559268.0, "step": 7788 }, { "entropy": 0.8243791311979294, "epoch": 0.7166376271556806, "grad_norm": 0.16546407341957092, "learning_rate": 7.611555800901647e-05, "loss": 0.8393, "mean_token_accuracy": 0.753466010093689, "num_tokens": 248590916.0, "step": 7789 }, { "entropy": 0.7695344649255276, "epoch": 0.7167296335271217, "grad_norm": 0.15810668468475342, "learning_rate": 7.611249118287484e-05, "loss": 0.7597, "mean_token_accuracy": 0.7773334197700024, "num_tokens": 248623487.0, "step": 7790 }, { "entropy": 0.7846469786018133, "epoch": 0.716821639898563, "grad_norm": 0.15754403173923492, "learning_rate": 7.610942435673321e-05, "loss": 0.791, "mean_token_accuracy": 0.7666886858642101, "num_tokens": 248655731.0, "step": 7791 }, { "entropy": 0.7437743861228228, "epoch": 0.7169136462700042, "grad_norm": 0.15561647713184357, "learning_rate": 7.61063575305916e-05, "loss": 0.7525, "mean_token_accuracy": 0.7852563671767712, "num_tokens": 248687635.0, "step": 7792 }, { "entropy": 0.7466721935197711, "epoch": 0.7170056526414454, "grad_norm": 0.16318325698375702, "learning_rate": 7.610329070444997e-05, "loss": 0.7206, "mean_token_accuracy": 0.7855875976383686, "num_tokens": 248718614.0, "step": 7793 }, { "entropy": 0.7026221007108688, "epoch": 0.7170976590128867, "grad_norm": 0.14973880350589752, "learning_rate": 7.610022387830834e-05, "loss": 0.6929, "mean_token_accuracy": 0.7893313281238079, "num_tokens": 248750974.0, "step": 7794 }, { "entropy": 0.8409431278705597, "epoch": 0.7171896653843278, "grad_norm": 0.1647198647260666, "learning_rate": 7.609715705216671e-05, "loss": 0.8145, "mean_token_accuracy": 0.7611793987452984, "num_tokens": 248782565.0, "step": 7795 }, { "entropy": 0.6431141654029489, "epoch": 0.7172816717557691, "grad_norm": 0.15813638269901276, "learning_rate": 7.609409022602509e-05, "loss": 0.6277, "mean_token_accuracy": 0.8160623461008072, "num_tokens": 248815258.0, "step": 7796 }, { "entropy": 0.6888696309179068, "epoch": 0.7173736781272103, "grad_norm": 0.14767909049987793, "learning_rate": 7.609102339988347e-05, "loss": 0.6635, "mean_token_accuracy": 0.8016304336488247, "num_tokens": 248848026.0, "step": 7797 }, { "entropy": 0.7281116340309381, "epoch": 0.7174656844986516, "grad_norm": 0.1616005152463913, "learning_rate": 7.608795657374184e-05, "loss": 0.7166, "mean_token_accuracy": 0.7896447516977787, "num_tokens": 248880096.0, "step": 7798 }, { "entropy": 0.8291907012462616, "epoch": 0.7175576908700928, "grad_norm": 0.15777286887168884, "learning_rate": 7.608488974760021e-05, "loss": 0.821, "mean_token_accuracy": 0.7602130547165871, "num_tokens": 248912473.0, "step": 7799 }, { "entropy": 0.6723835654556751, "epoch": 0.7176496972415339, "grad_norm": 0.15408095717430115, "learning_rate": 7.608182292145859e-05, "loss": 0.6399, "mean_token_accuracy": 0.8099945895373821, "num_tokens": 248944157.0, "step": 7800 }, { "entropy": 0.7166076507419348, "epoch": 0.7177417036129752, "grad_norm": 0.15199844539165497, "learning_rate": 7.607875609531696e-05, "loss": 0.7078, "mean_token_accuracy": 0.7872540690004826, "num_tokens": 248975823.0, "step": 7801 }, { "entropy": 0.8470213040709496, "epoch": 0.7178337099844164, "grad_norm": 0.15802063047885895, "learning_rate": 7.607568926917534e-05, "loss": 0.8437, "mean_token_accuracy": 0.7559981942176819, "num_tokens": 249008023.0, "step": 7802 }, { "entropy": 0.6305005233734846, "epoch": 0.7179257163558577, "grad_norm": 0.15357202291488647, "learning_rate": 7.60726224430337e-05, "loss": 0.6068, "mean_token_accuracy": 0.8185158036649227, "num_tokens": 249039193.0, "step": 7803 }, { "entropy": 0.7103920048102736, "epoch": 0.7180177227272989, "grad_norm": 0.15432454645633698, "learning_rate": 7.606955561689209e-05, "loss": 0.6846, "mean_token_accuracy": 0.799586396664381, "num_tokens": 249070648.0, "step": 7804 }, { "entropy": 0.754861006513238, "epoch": 0.71810972909874, "grad_norm": 0.16732004284858704, "learning_rate": 7.606648879075046e-05, "loss": 0.774, "mean_token_accuracy": 0.7730255275964737, "num_tokens": 249102487.0, "step": 7805 }, { "entropy": 0.7751673795282841, "epoch": 0.7182017354701813, "grad_norm": 0.1573687195777893, "learning_rate": 7.606342196460882e-05, "loss": 0.7558, "mean_token_accuracy": 0.773172203451395, "num_tokens": 249133763.0, "step": 7806 }, { "entropy": 0.7096458189189434, "epoch": 0.7182937418416225, "grad_norm": 0.14964421093463898, "learning_rate": 7.60603551384672e-05, "loss": 0.7115, "mean_token_accuracy": 0.7864885702729225, "num_tokens": 249165800.0, "step": 7807 }, { "entropy": 0.7759762424975634, "epoch": 0.7183857482130638, "grad_norm": 0.15842406451702118, "learning_rate": 7.605728831232559e-05, "loss": 0.7591, "mean_token_accuracy": 0.774175763130188, "num_tokens": 249197494.0, "step": 7808 }, { "entropy": 0.7814515195786953, "epoch": 0.718477754584505, "grad_norm": 0.16591733694076538, "learning_rate": 7.605422148618395e-05, "loss": 0.7872, "mean_token_accuracy": 0.7737616375088692, "num_tokens": 249229582.0, "step": 7809 }, { "entropy": 0.7549196518957615, "epoch": 0.7185697609559462, "grad_norm": 0.15124650299549103, "learning_rate": 7.605115466004232e-05, "loss": 0.744, "mean_token_accuracy": 0.7792503833770752, "num_tokens": 249261513.0, "step": 7810 }, { "entropy": 0.7750103138387203, "epoch": 0.7186617673273874, "grad_norm": 0.15700888633728027, "learning_rate": 7.60480878339007e-05, "loss": 0.7689, "mean_token_accuracy": 0.7748158536851406, "num_tokens": 249293077.0, "step": 7811 }, { "entropy": 0.7348957248032093, "epoch": 0.7187537736988286, "grad_norm": 0.1551908701658249, "learning_rate": 7.604502100775907e-05, "loss": 0.7151, "mean_token_accuracy": 0.7870091758668423, "num_tokens": 249323753.0, "step": 7812 }, { "entropy": 0.7617241647094488, "epoch": 0.7188457800702699, "grad_norm": 0.14938214421272278, "learning_rate": 7.604195418161745e-05, "loss": 0.7545, "mean_token_accuracy": 0.774508498609066, "num_tokens": 249356126.0, "step": 7813 }, { "entropy": 0.6781882327049971, "epoch": 0.7189377864417111, "grad_norm": 0.15181703865528107, "learning_rate": 7.603888735547582e-05, "loss": 0.6446, "mean_token_accuracy": 0.8086247928440571, "num_tokens": 249388749.0, "step": 7814 }, { "entropy": 0.5783234499394894, "epoch": 0.7190297928131523, "grad_norm": 0.1531478464603424, "learning_rate": 7.60358205293342e-05, "loss": 0.5554, "mean_token_accuracy": 0.832526508718729, "num_tokens": 249420654.0, "step": 7815 }, { "entropy": 0.5863795597106218, "epoch": 0.7191217991845935, "grad_norm": 0.1582360416650772, "learning_rate": 7.603275370319257e-05, "loss": 0.5889, "mean_token_accuracy": 0.8232474401593208, "num_tokens": 249453422.0, "step": 7816 }, { "entropy": 0.7413662322796881, "epoch": 0.7192138055560348, "grad_norm": 0.1634497046470642, "learning_rate": 7.602968687705094e-05, "loss": 0.729, "mean_token_accuracy": 0.7823475748300552, "num_tokens": 249484970.0, "step": 7817 }, { "entropy": 0.8403741233050823, "epoch": 0.719305811927476, "grad_norm": 0.1561255007982254, "learning_rate": 7.602662005090932e-05, "loss": 0.8253, "mean_token_accuracy": 0.7612036541104317, "num_tokens": 249517508.0, "step": 7818 }, { "entropy": 0.7198612354695797, "epoch": 0.7193978182989172, "grad_norm": 0.16850140690803528, "learning_rate": 7.60235532247677e-05, "loss": 0.7115, "mean_token_accuracy": 0.7921142354607582, "num_tokens": 249549375.0, "step": 7819 }, { "entropy": 0.8259382862597704, "epoch": 0.7194898246703584, "grad_norm": 0.16326290369033813, "learning_rate": 7.602048639862607e-05, "loss": 0.8154, "mean_token_accuracy": 0.7632639855146408, "num_tokens": 249580809.0, "step": 7820 }, { "entropy": 0.7156979329884052, "epoch": 0.7195818310417996, "grad_norm": 0.15672911703586578, "learning_rate": 7.601741957248444e-05, "loss": 0.6825, "mean_token_accuracy": 0.7999634258449078, "num_tokens": 249612251.0, "step": 7821 }, { "entropy": 0.7891224585473537, "epoch": 0.7196738374132409, "grad_norm": 0.16958454251289368, "learning_rate": 7.60143527463428e-05, "loss": 0.7748, "mean_token_accuracy": 0.7772296853363514, "num_tokens": 249644581.0, "step": 7822 }, { "entropy": 0.71135398093611, "epoch": 0.7197658437846821, "grad_norm": 0.15872737765312195, "learning_rate": 7.601128592020119e-05, "loss": 0.7023, "mean_token_accuracy": 0.7896397411823273, "num_tokens": 249675811.0, "step": 7823 }, { "entropy": 0.6751199588179588, "epoch": 0.7198578501561234, "grad_norm": 0.1522376388311386, "learning_rate": 7.600821909405957e-05, "loss": 0.654, "mean_token_accuracy": 0.8025815896689892, "num_tokens": 249707973.0, "step": 7824 }, { "entropy": 0.7892940994352102, "epoch": 0.7199498565275645, "grad_norm": 0.15517310798168182, "learning_rate": 7.600515226791793e-05, "loss": 0.7881, "mean_token_accuracy": 0.7612491175532341, "num_tokens": 249739698.0, "step": 7825 }, { "entropy": 0.7357265334576368, "epoch": 0.7200418628990057, "grad_norm": 0.15088872611522675, "learning_rate": 7.60020854417763e-05, "loss": 0.7266, "mean_token_accuracy": 0.7840061336755753, "num_tokens": 249771779.0, "step": 7826 }, { "entropy": 0.7462134966626763, "epoch": 0.720133869270447, "grad_norm": 0.15191501379013062, "learning_rate": 7.599901861563468e-05, "loss": 0.7493, "mean_token_accuracy": 0.7821086719632149, "num_tokens": 249803293.0, "step": 7827 }, { "entropy": 0.7180109173059464, "epoch": 0.7202258756418882, "grad_norm": 0.15315556526184082, "learning_rate": 7.599595178949305e-05, "loss": 0.7161, "mean_token_accuracy": 0.7866601683199406, "num_tokens": 249835570.0, "step": 7828 }, { "entropy": 0.7424497622996569, "epoch": 0.7203178820133295, "grad_norm": 0.16053053736686707, "learning_rate": 7.599288496335143e-05, "loss": 0.7342, "mean_token_accuracy": 0.7813802361488342, "num_tokens": 249867875.0, "step": 7829 }, { "entropy": 0.7689687088131905, "epoch": 0.7204098883847706, "grad_norm": 0.15320421755313873, "learning_rate": 7.59898181372098e-05, "loss": 0.7541, "mean_token_accuracy": 0.7764865010976791, "num_tokens": 249899156.0, "step": 7830 }, { "entropy": 0.676791787147522, "epoch": 0.7205018947562118, "grad_norm": 0.1555180847644806, "learning_rate": 7.598675131106818e-05, "loss": 0.661, "mean_token_accuracy": 0.7996770702302456, "num_tokens": 249931581.0, "step": 7831 }, { "entropy": 0.9106304720044136, "epoch": 0.7205939011276531, "grad_norm": 0.1652318835258484, "learning_rate": 7.598368448492655e-05, "loss": 0.9204, "mean_token_accuracy": 0.7354933805763721, "num_tokens": 249962946.0, "step": 7832 }, { "entropy": 0.7655843961983919, "epoch": 0.7206859074990943, "grad_norm": 0.1514715552330017, "learning_rate": 7.598061765878492e-05, "loss": 0.7519, "mean_token_accuracy": 0.7783109359443188, "num_tokens": 249995187.0, "step": 7833 }, { "entropy": 0.6588938608765602, "epoch": 0.7207779138705356, "grad_norm": 0.1464916169643402, "learning_rate": 7.59775508326433e-05, "loss": 0.6451, "mean_token_accuracy": 0.8086031787097454, "num_tokens": 250027933.0, "step": 7834 }, { "entropy": 0.7518705800175667, "epoch": 0.7208699202419767, "grad_norm": 0.14967560768127441, "learning_rate": 7.597448400650168e-05, "loss": 0.7414, "mean_token_accuracy": 0.785016130656004, "num_tokens": 250060636.0, "step": 7835 }, { "entropy": 0.8548146318644285, "epoch": 0.720961926613418, "grad_norm": 0.15424463152885437, "learning_rate": 7.597141718036005e-05, "loss": 0.8429, "mean_token_accuracy": 0.7532053254544735, "num_tokens": 250092266.0, "step": 7836 }, { "entropy": 0.8493393957614899, "epoch": 0.7210539329848592, "grad_norm": 0.1592412292957306, "learning_rate": 7.596835035421842e-05, "loss": 0.8622, "mean_token_accuracy": 0.7503750175237656, "num_tokens": 250124204.0, "step": 7837 }, { "entropy": 0.8120987080037594, "epoch": 0.7211459393563004, "grad_norm": 0.1668112426996231, "learning_rate": 7.596528352807678e-05, "loss": 0.8061, "mean_token_accuracy": 0.7684736549854279, "num_tokens": 250156073.0, "step": 7838 }, { "entropy": 0.8278126604855061, "epoch": 0.7212379457277417, "grad_norm": 0.15897923707962036, "learning_rate": 7.596221670193518e-05, "loss": 0.8087, "mean_token_accuracy": 0.7571402937173843, "num_tokens": 250187655.0, "step": 7839 }, { "entropy": 0.6908633168786764, "epoch": 0.7213299520991828, "grad_norm": 0.14836974442005157, "learning_rate": 7.595914987579355e-05, "loss": 0.6701, "mean_token_accuracy": 0.8013248704373837, "num_tokens": 250219860.0, "step": 7840 }, { "entropy": 0.7341315988451242, "epoch": 0.7214219584706241, "grad_norm": 0.15764974057674408, "learning_rate": 7.595608304965192e-05, "loss": 0.7349, "mean_token_accuracy": 0.7859954312443733, "num_tokens": 250251976.0, "step": 7841 }, { "entropy": 0.7187400236725807, "epoch": 0.7215139648420653, "grad_norm": 0.15172894299030304, "learning_rate": 7.59530162235103e-05, "loss": 0.6881, "mean_token_accuracy": 0.7949937097728252, "num_tokens": 250283533.0, "step": 7842 }, { "entropy": 0.6541743651032448, "epoch": 0.7216059712135066, "grad_norm": 0.15242579579353333, "learning_rate": 7.594994939736866e-05, "loss": 0.6465, "mean_token_accuracy": 0.8055494651198387, "num_tokens": 250315668.0, "step": 7843 }, { "entropy": 0.7217982020229101, "epoch": 0.7216979775849478, "grad_norm": 0.15646827220916748, "learning_rate": 7.594688257122705e-05, "loss": 0.7273, "mean_token_accuracy": 0.7858561277389526, "num_tokens": 250347700.0, "step": 7844 }, { "entropy": 0.5940914358943701, "epoch": 0.7217899839563889, "grad_norm": 0.16489790380001068, "learning_rate": 7.594381574508541e-05, "loss": 0.5842, "mean_token_accuracy": 0.8202256858348846, "num_tokens": 250379959.0, "step": 7845 }, { "entropy": 0.6855104379355907, "epoch": 0.7218819903278302, "grad_norm": 0.14689376950263977, "learning_rate": 7.59407489189438e-05, "loss": 0.682, "mean_token_accuracy": 0.7930132038891315, "num_tokens": 250411770.0, "step": 7846 }, { "entropy": 0.6610247064381838, "epoch": 0.7219739966992714, "grad_norm": 0.1623591184616089, "learning_rate": 7.593768209280216e-05, "loss": 0.6559, "mean_token_accuracy": 0.8056875579059124, "num_tokens": 250443590.0, "step": 7847 }, { "entropy": 0.8891603630036116, "epoch": 0.7220660030707127, "grad_norm": 0.1627303659915924, "learning_rate": 7.593461526666053e-05, "loss": 0.8956, "mean_token_accuracy": 0.7395302690565586, "num_tokens": 250475767.0, "step": 7848 }, { "entropy": 0.6086974814534187, "epoch": 0.7221580094421539, "grad_norm": 0.16022752225399017, "learning_rate": 7.593154844051891e-05, "loss": 0.6049, "mean_token_accuracy": 0.8214403763413429, "num_tokens": 250507707.0, "step": 7849 }, { "entropy": 0.7726941145956516, "epoch": 0.722250015813595, "grad_norm": 0.16883137822151184, "learning_rate": 7.59284816143773e-05, "loss": 0.7483, "mean_token_accuracy": 0.7789816595613956, "num_tokens": 250539620.0, "step": 7850 }, { "entropy": 0.8549030013382435, "epoch": 0.7223420221850363, "grad_norm": 0.16999629139900208, "learning_rate": 7.592541478823566e-05, "loss": 0.8415, "mean_token_accuracy": 0.7561250850558281, "num_tokens": 250570829.0, "step": 7851 }, { "entropy": 0.7578040938824415, "epoch": 0.7224340285564775, "grad_norm": 0.1520872712135315, "learning_rate": 7.592234796209403e-05, "loss": 0.7381, "mean_token_accuracy": 0.7775016501545906, "num_tokens": 250602051.0, "step": 7852 }, { "entropy": 0.7262165462598205, "epoch": 0.7225260349279188, "grad_norm": 0.15373148024082184, "learning_rate": 7.59192811359524e-05, "loss": 0.7158, "mean_token_accuracy": 0.7854645065963268, "num_tokens": 250634576.0, "step": 7853 }, { "entropy": 0.8073814585804939, "epoch": 0.72261804129936, "grad_norm": 0.1515234112739563, "learning_rate": 7.591621430981078e-05, "loss": 0.7861, "mean_token_accuracy": 0.7672849595546722, "num_tokens": 250665847.0, "step": 7854 }, { "entropy": 0.803986269980669, "epoch": 0.7227100476708012, "grad_norm": 0.15217888355255127, "learning_rate": 7.591314748366916e-05, "loss": 0.7927, "mean_token_accuracy": 0.7678348459303379, "num_tokens": 250697817.0, "step": 7855 }, { "entropy": 0.6912982165813446, "epoch": 0.7228020540422424, "grad_norm": 0.15832598507404327, "learning_rate": 7.591008065752753e-05, "loss": 0.6998, "mean_token_accuracy": 0.7977241687476635, "num_tokens": 250728504.0, "step": 7856 }, { "entropy": 0.7579865101724863, "epoch": 0.7228940604136836, "grad_norm": 0.15762892365455627, "learning_rate": 7.59070138313859e-05, "loss": 0.7428, "mean_token_accuracy": 0.7789614386856556, "num_tokens": 250760547.0, "step": 7857 }, { "entropy": 0.7010397501289845, "epoch": 0.7229860667851249, "grad_norm": 0.15368255972862244, "learning_rate": 7.590394700524428e-05, "loss": 0.6792, "mean_token_accuracy": 0.8007333241403103, "num_tokens": 250792175.0, "step": 7858 }, { "entropy": 0.7337883599102497, "epoch": 0.7230780731565661, "grad_norm": 0.15502247214317322, "learning_rate": 7.590088017910265e-05, "loss": 0.7242, "mean_token_accuracy": 0.788350060582161, "num_tokens": 250824080.0, "step": 7859 }, { "entropy": 0.7374857682734728, "epoch": 0.7231700795280073, "grad_norm": 0.15713320672512054, "learning_rate": 7.589781335296103e-05, "loss": 0.7259, "mean_token_accuracy": 0.7895756177604198, "num_tokens": 250856655.0, "step": 7860 }, { "entropy": 0.838067440316081, "epoch": 0.7232620858994485, "grad_norm": 0.15965953469276428, "learning_rate": 7.58947465268194e-05, "loss": 0.813, "mean_token_accuracy": 0.761335451155901, "num_tokens": 250887626.0, "step": 7861 }, { "entropy": 0.6864751502871513, "epoch": 0.7233540922708898, "grad_norm": 0.15342451632022858, "learning_rate": 7.589167970067778e-05, "loss": 0.6629, "mean_token_accuracy": 0.8021831251680851, "num_tokens": 250919335.0, "step": 7862 }, { "entropy": 0.7580422703176737, "epoch": 0.723446098642331, "grad_norm": 0.1563965231180191, "learning_rate": 7.588861287453614e-05, "loss": 0.729, "mean_token_accuracy": 0.7789822369813919, "num_tokens": 250950165.0, "step": 7863 }, { "entropy": 0.7174432445317507, "epoch": 0.7235381050137722, "grad_norm": 0.15998795628547668, "learning_rate": 7.588554604839451e-05, "loss": 0.7061, "mean_token_accuracy": 0.7942802496254444, "num_tokens": 250981510.0, "step": 7864 }, { "entropy": 0.6402461584657431, "epoch": 0.7236301113852134, "grad_norm": 0.14963191747665405, "learning_rate": 7.58824792222529e-05, "loss": 0.6345, "mean_token_accuracy": 0.8140170685946941, "num_tokens": 251013730.0, "step": 7865 }, { "entropy": 0.6158556919544935, "epoch": 0.7237221177566546, "grad_norm": 0.15309172868728638, "learning_rate": 7.587941239611127e-05, "loss": 0.6167, "mean_token_accuracy": 0.8165701478719711, "num_tokens": 251046147.0, "step": 7866 }, { "entropy": 0.7951819393783808, "epoch": 0.7238141241280959, "grad_norm": 0.16716481745243073, "learning_rate": 7.587634556996964e-05, "loss": 0.8163, "mean_token_accuracy": 0.7628971412777901, "num_tokens": 251078337.0, "step": 7867 }, { "entropy": 0.8026394797489047, "epoch": 0.7239061304995371, "grad_norm": 0.15928445756435394, "learning_rate": 7.587327874382801e-05, "loss": 0.7945, "mean_token_accuracy": 0.7687054090201855, "num_tokens": 251109907.0, "step": 7868 }, { "entropy": 0.820055890828371, "epoch": 0.7239981368709784, "grad_norm": 0.16832119226455688, "learning_rate": 7.587021191768638e-05, "loss": 0.8176, "mean_token_accuracy": 0.7602797076106071, "num_tokens": 251141698.0, "step": 7869 }, { "entropy": 0.7625326849520206, "epoch": 0.7240901432424195, "grad_norm": 0.15650774538516998, "learning_rate": 7.586714509154476e-05, "loss": 0.7454, "mean_token_accuracy": 0.7801604010164738, "num_tokens": 251172818.0, "step": 7870 }, { "entropy": 0.827116833999753, "epoch": 0.7241821496138607, "grad_norm": 0.16842181980609894, "learning_rate": 7.586407826540314e-05, "loss": 0.8117, "mean_token_accuracy": 0.7641343474388123, "num_tokens": 251204290.0, "step": 7871 }, { "entropy": 0.5842435583472252, "epoch": 0.724274155985302, "grad_norm": 0.15183652937412262, "learning_rate": 7.586101143926151e-05, "loss": 0.5777, "mean_token_accuracy": 0.8272777236998081, "num_tokens": 251237058.0, "step": 7872 }, { "entropy": 0.7041285885497928, "epoch": 0.7243661623567432, "grad_norm": 0.15662062168121338, "learning_rate": 7.585794461311989e-05, "loss": 0.6846, "mean_token_accuracy": 0.8001513406634331, "num_tokens": 251269151.0, "step": 7873 }, { "entropy": 0.8016780875623226, "epoch": 0.7244581687281845, "grad_norm": 0.16056226193904877, "learning_rate": 7.585487778697826e-05, "loss": 0.8056, "mean_token_accuracy": 0.7668046727776527, "num_tokens": 251301322.0, "step": 7874 }, { "entropy": 0.7764002662152052, "epoch": 0.7245501750996256, "grad_norm": 0.1575009971857071, "learning_rate": 7.585181096083664e-05, "loss": 0.7846, "mean_token_accuracy": 0.7703137472271919, "num_tokens": 251333122.0, "step": 7875 }, { "entropy": 0.8169222567230463, "epoch": 0.7246421814710668, "grad_norm": 0.1504870057106018, "learning_rate": 7.584874413469501e-05, "loss": 0.8036, "mean_token_accuracy": 0.7608672529459, "num_tokens": 251365644.0, "step": 7876 }, { "entropy": 0.766961308196187, "epoch": 0.7247341878425081, "grad_norm": 0.1525883674621582, "learning_rate": 7.584567730855339e-05, "loss": 0.7387, "mean_token_accuracy": 0.7767328508198261, "num_tokens": 251398195.0, "step": 7877 }, { "entropy": 0.7656928356736898, "epoch": 0.7248261942139493, "grad_norm": 0.1616189330816269, "learning_rate": 7.584261048241176e-05, "loss": 0.7571, "mean_token_accuracy": 0.775357685983181, "num_tokens": 251430431.0, "step": 7878 }, { "entropy": 0.775195773690939, "epoch": 0.7249182005853906, "grad_norm": 0.17015773057937622, "learning_rate": 7.583954365627013e-05, "loss": 0.7798, "mean_token_accuracy": 0.7767594009637833, "num_tokens": 251461868.0, "step": 7879 }, { "entropy": 0.683290982618928, "epoch": 0.7250102069568317, "grad_norm": 0.15220312774181366, "learning_rate": 7.58364768301285e-05, "loss": 0.6757, "mean_token_accuracy": 0.7986709214746952, "num_tokens": 251493397.0, "step": 7880 }, { "entropy": 0.7197461575269699, "epoch": 0.725102213328273, "grad_norm": 0.15147072076797485, "learning_rate": 7.583341000398689e-05, "loss": 0.7035, "mean_token_accuracy": 0.7867350168526173, "num_tokens": 251525812.0, "step": 7881 }, { "entropy": 0.6993083907291293, "epoch": 0.7251942196997142, "grad_norm": 0.15029184520244598, "learning_rate": 7.583034317784526e-05, "loss": 0.6782, "mean_token_accuracy": 0.8030892200767994, "num_tokens": 251557553.0, "step": 7882 }, { "entropy": 0.7166417483240366, "epoch": 0.7252862260711554, "grad_norm": 0.15210284292697906, "learning_rate": 7.582727635170362e-05, "loss": 0.6908, "mean_token_accuracy": 0.7941828928887844, "num_tokens": 251589555.0, "step": 7883 }, { "entropy": 0.6310151033103466, "epoch": 0.7253782324425967, "grad_norm": 0.15015818178653717, "learning_rate": 7.582420952556199e-05, "loss": 0.6112, "mean_token_accuracy": 0.8181525655090809, "num_tokens": 251622050.0, "step": 7884 }, { "entropy": 0.8106321711093187, "epoch": 0.7254702388140378, "grad_norm": 0.15475399792194366, "learning_rate": 7.582114269942037e-05, "loss": 0.7921, "mean_token_accuracy": 0.7731204256415367, "num_tokens": 251653919.0, "step": 7885 }, { "entropy": 0.8742558993399143, "epoch": 0.7255622451854791, "grad_norm": 0.1612847000360489, "learning_rate": 7.581807587327875e-05, "loss": 0.8618, "mean_token_accuracy": 0.7514798901975155, "num_tokens": 251686465.0, "step": 7886 }, { "entropy": 0.6950328722596169, "epoch": 0.7256542515569203, "grad_norm": 0.15197235345840454, "learning_rate": 7.581500904713712e-05, "loss": 0.6802, "mean_token_accuracy": 0.7988152392208576, "num_tokens": 251718413.0, "step": 7887 }, { "entropy": 0.6344367666170001, "epoch": 0.7257462579283616, "grad_norm": 0.1490088254213333, "learning_rate": 7.581194222099549e-05, "loss": 0.609, "mean_token_accuracy": 0.8184834457933903, "num_tokens": 251749967.0, "step": 7888 }, { "entropy": 0.7004262674599886, "epoch": 0.7258382642998028, "grad_norm": 0.1679946482181549, "learning_rate": 7.580887539485387e-05, "loss": 0.6989, "mean_token_accuracy": 0.7959790267050266, "num_tokens": 251781446.0, "step": 7889 }, { "entropy": 0.7620374727994204, "epoch": 0.7259302706712439, "grad_norm": 0.15673412382602692, "learning_rate": 7.580580856871224e-05, "loss": 0.7728, "mean_token_accuracy": 0.7727949246764183, "num_tokens": 251813633.0, "step": 7890 }, { "entropy": 0.8456238284707069, "epoch": 0.7260222770426852, "grad_norm": 0.16465577483177185, "learning_rate": 7.580274174257062e-05, "loss": 0.8518, "mean_token_accuracy": 0.7494657635688782, "num_tokens": 251845972.0, "step": 7891 }, { "entropy": 0.7605965677648783, "epoch": 0.7261142834141264, "grad_norm": 0.15925534069538116, "learning_rate": 7.579967491642899e-05, "loss": 0.766, "mean_token_accuracy": 0.7782953009009361, "num_tokens": 251878383.0, "step": 7892 }, { "entropy": 0.7022535521537066, "epoch": 0.7262062897855677, "grad_norm": 0.15416285395622253, "learning_rate": 7.579660809028737e-05, "loss": 0.6878, "mean_token_accuracy": 0.7924491502344608, "num_tokens": 251910960.0, "step": 7893 }, { "entropy": 0.7717578839510679, "epoch": 0.7262982961570089, "grad_norm": 0.1520114541053772, "learning_rate": 7.579354126414574e-05, "loss": 0.7641, "mean_token_accuracy": 0.7747473306953907, "num_tokens": 251943480.0, "step": 7894 }, { "entropy": 0.806653993204236, "epoch": 0.72639030252845, "grad_norm": 0.16699084639549255, "learning_rate": 7.57904744380041e-05, "loss": 0.7984, "mean_token_accuracy": 0.7667182683944702, "num_tokens": 251974954.0, "step": 7895 }, { "entropy": 0.7779343798756599, "epoch": 0.7264823088998913, "grad_norm": 0.1575072854757309, "learning_rate": 7.578740761186249e-05, "loss": 0.769, "mean_token_accuracy": 0.7684967294335365, "num_tokens": 252006937.0, "step": 7896 }, { "entropy": 0.7620575269684196, "epoch": 0.7265743152713325, "grad_norm": 0.16836895048618317, "learning_rate": 7.578434078572087e-05, "loss": 0.7492, "mean_token_accuracy": 0.7777226157486439, "num_tokens": 252038274.0, "step": 7897 }, { "entropy": 0.5793853607028723, "epoch": 0.7266663216427738, "grad_norm": 0.14838165044784546, "learning_rate": 7.578127395957924e-05, "loss": 0.5597, "mean_token_accuracy": 0.8294431194663048, "num_tokens": 252069973.0, "step": 7898 }, { "entropy": 0.821162324398756, "epoch": 0.726758328014215, "grad_norm": 0.16260945796966553, "learning_rate": 7.57782071334376e-05, "loss": 0.806, "mean_token_accuracy": 0.7652249783277512, "num_tokens": 252101774.0, "step": 7899 }, { "entropy": 0.8114989325404167, "epoch": 0.7268503343856562, "grad_norm": 0.15827545523643494, "learning_rate": 7.577514030729597e-05, "loss": 0.7845, "mean_token_accuracy": 0.770322747528553, "num_tokens": 252134102.0, "step": 7900 }, { "entropy": 0.7714655417948961, "epoch": 0.7269423407570974, "grad_norm": 0.16751447319984436, "learning_rate": 7.577207348115435e-05, "loss": 0.7497, "mean_token_accuracy": 0.7824319936335087, "num_tokens": 252165904.0, "step": 7901 }, { "entropy": 0.7357718478888273, "epoch": 0.7270343471285386, "grad_norm": 0.15308338403701782, "learning_rate": 7.576900665501274e-05, "loss": 0.7117, "mean_token_accuracy": 0.7864997088909149, "num_tokens": 252198012.0, "step": 7902 }, { "entropy": 0.737629123032093, "epoch": 0.7271263534999799, "grad_norm": 0.1595482975244522, "learning_rate": 7.57659398288711e-05, "loss": 0.7135, "mean_token_accuracy": 0.7899434119462967, "num_tokens": 252230216.0, "step": 7903 }, { "entropy": 0.806482782587409, "epoch": 0.7272183598714211, "grad_norm": 0.15723711252212524, "learning_rate": 7.576287300272948e-05, "loss": 0.7979, "mean_token_accuracy": 0.7674141339957714, "num_tokens": 252262092.0, "step": 7904 }, { "entropy": 0.7190824449062347, "epoch": 0.7273103662428623, "grad_norm": 0.15586069226264954, "learning_rate": 7.575980617658785e-05, "loss": 0.6982, "mean_token_accuracy": 0.793573435395956, "num_tokens": 252293035.0, "step": 7905 }, { "entropy": 0.7487450372427702, "epoch": 0.7274023726143035, "grad_norm": 0.16418296098709106, "learning_rate": 7.575673935044622e-05, "loss": 0.7557, "mean_token_accuracy": 0.7759072110056877, "num_tokens": 252323521.0, "step": 7906 }, { "entropy": 0.7843949273228645, "epoch": 0.7274943789857448, "grad_norm": 0.17025581002235413, "learning_rate": 7.57536725243046e-05, "loss": 0.7659, "mean_token_accuracy": 0.775711290538311, "num_tokens": 252354627.0, "step": 7907 }, { "entropy": 0.6166856847703457, "epoch": 0.727586385357186, "grad_norm": 0.14818920195102692, "learning_rate": 7.575060569816298e-05, "loss": 0.6089, "mean_token_accuracy": 0.8168659433722496, "num_tokens": 252387259.0, "step": 7908 }, { "entropy": 0.6661929748952389, "epoch": 0.7276783917286272, "grad_norm": 0.14638425409793854, "learning_rate": 7.574753887202135e-05, "loss": 0.6538, "mean_token_accuracy": 0.8061513751745224, "num_tokens": 252419587.0, "step": 7909 }, { "entropy": 0.7729924824088812, "epoch": 0.7277703981000684, "grad_norm": 0.1573622226715088, "learning_rate": 7.574447204587972e-05, "loss": 0.7778, "mean_token_accuracy": 0.7687584236264229, "num_tokens": 252452122.0, "step": 7910 }, { "entropy": 0.6905913837254047, "epoch": 0.7278624044715096, "grad_norm": 0.15070562064647675, "learning_rate": 7.574140521973809e-05, "loss": 0.6758, "mean_token_accuracy": 0.7991761192679405, "num_tokens": 252484433.0, "step": 7911 }, { "entropy": 0.7499027140438557, "epoch": 0.7279544108429509, "grad_norm": 0.15253068506717682, "learning_rate": 7.573833839359648e-05, "loss": 0.726, "mean_token_accuracy": 0.7845340967178345, "num_tokens": 252516213.0, "step": 7912 }, { "entropy": 0.7437638007104397, "epoch": 0.7280464172143921, "grad_norm": 0.1626688838005066, "learning_rate": 7.573527156745485e-05, "loss": 0.7377, "mean_token_accuracy": 0.7809381894767284, "num_tokens": 252548142.0, "step": 7913 }, { "entropy": 0.8698076009750366, "epoch": 0.7281384235858334, "grad_norm": 0.16642296314239502, "learning_rate": 7.573220474131322e-05, "loss": 0.8744, "mean_token_accuracy": 0.7391108125448227, "num_tokens": 252580085.0, "step": 7914 }, { "entropy": 0.7003586068749428, "epoch": 0.7282304299572745, "grad_norm": 0.15932756662368774, "learning_rate": 7.572913791517159e-05, "loss": 0.6815, "mean_token_accuracy": 0.7978714480996132, "num_tokens": 252612688.0, "step": 7915 }, { "entropy": 0.7636811882257462, "epoch": 0.7283224363287157, "grad_norm": 0.17223118245601654, "learning_rate": 7.572607108902997e-05, "loss": 0.7478, "mean_token_accuracy": 0.7776231840252876, "num_tokens": 252644657.0, "step": 7916 }, { "entropy": 0.7494610082358122, "epoch": 0.728414442700157, "grad_norm": 0.15488079190254211, "learning_rate": 7.572300426288835e-05, "loss": 0.7524, "mean_token_accuracy": 0.778341680765152, "num_tokens": 252677126.0, "step": 7917 }, { "entropy": 0.6931417249143124, "epoch": 0.7285064490715982, "grad_norm": 0.16079236567020416, "learning_rate": 7.571993743674672e-05, "loss": 0.692, "mean_token_accuracy": 0.7970300316810608, "num_tokens": 252709654.0, "step": 7918 }, { "entropy": 0.7279869019985199, "epoch": 0.7285984554430395, "grad_norm": 0.14930546283721924, "learning_rate": 7.571687061060508e-05, "loss": 0.7316, "mean_token_accuracy": 0.7811122015118599, "num_tokens": 252741212.0, "step": 7919 }, { "entropy": 0.623401215299964, "epoch": 0.7286904618144806, "grad_norm": 0.15416908264160156, "learning_rate": 7.571380378446347e-05, "loss": 0.6128, "mean_token_accuracy": 0.8173513375222683, "num_tokens": 252773802.0, "step": 7920 }, { "entropy": 0.7422445379197598, "epoch": 0.7287824681859219, "grad_norm": 0.15258558094501495, "learning_rate": 7.571073695832183e-05, "loss": 0.7303, "mean_token_accuracy": 0.7794930003583431, "num_tokens": 252806215.0, "step": 7921 }, { "entropy": 0.7337194718420506, "epoch": 0.7288744745573631, "grad_norm": 0.1622336506843567, "learning_rate": 7.570767013218021e-05, "loss": 0.724, "mean_token_accuracy": 0.7842049933969975, "num_tokens": 252838716.0, "step": 7922 }, { "entropy": 0.7989636845886707, "epoch": 0.7289664809288043, "grad_norm": 0.1623350977897644, "learning_rate": 7.570460330603858e-05, "loss": 0.8031, "mean_token_accuracy": 0.7682050429284573, "num_tokens": 252870555.0, "step": 7923 }, { "entropy": 0.6782918367534876, "epoch": 0.7290584873002456, "grad_norm": 0.15842172503471375, "learning_rate": 7.570153647989696e-05, "loss": 0.6519, "mean_token_accuracy": 0.8102654293179512, "num_tokens": 252903099.0, "step": 7924 }, { "entropy": 0.6524178143590689, "epoch": 0.7291504936716867, "grad_norm": 0.15155796706676483, "learning_rate": 7.569846965375533e-05, "loss": 0.6312, "mean_token_accuracy": 0.8138269148766994, "num_tokens": 252935421.0, "step": 7925 }, { "entropy": 0.7126379311084747, "epoch": 0.729242500043128, "grad_norm": 0.16040706634521484, "learning_rate": 7.56954028276137e-05, "loss": 0.6875, "mean_token_accuracy": 0.7964474894106388, "num_tokens": 252967062.0, "step": 7926 }, { "entropy": 0.76754280179739, "epoch": 0.7293345064145692, "grad_norm": 0.15099459886550903, "learning_rate": 7.569233600147208e-05, "loss": 0.7393, "mean_token_accuracy": 0.7786346860229969, "num_tokens": 252998777.0, "step": 7927 }, { "entropy": 0.6734980046749115, "epoch": 0.7294265127860105, "grad_norm": 0.1500142514705658, "learning_rate": 7.568926917533046e-05, "loss": 0.6571, "mean_token_accuracy": 0.7942510955035686, "num_tokens": 253030663.0, "step": 7928 }, { "entropy": 0.7833382487297058, "epoch": 0.7295185191574517, "grad_norm": 0.15442423522472382, "learning_rate": 7.568620234918883e-05, "loss": 0.7519, "mean_token_accuracy": 0.7783960066735744, "num_tokens": 253062431.0, "step": 7929 }, { "entropy": 0.7628982793539762, "epoch": 0.7296105255288928, "grad_norm": 0.15740135312080383, "learning_rate": 7.56831355230472e-05, "loss": 0.7557, "mean_token_accuracy": 0.7778056971728802, "num_tokens": 253094190.0, "step": 7930 }, { "entropy": 0.6838789284229279, "epoch": 0.7297025319003341, "grad_norm": 0.15055906772613525, "learning_rate": 7.568006869690557e-05, "loss": 0.6715, "mean_token_accuracy": 0.7983460910618305, "num_tokens": 253126742.0, "step": 7931 }, { "entropy": 0.75821821577847, "epoch": 0.7297945382717753, "grad_norm": 0.15673744678497314, "learning_rate": 7.567700187076395e-05, "loss": 0.7617, "mean_token_accuracy": 0.7718385346233845, "num_tokens": 253158260.0, "step": 7932 }, { "entropy": 0.8084640298038721, "epoch": 0.7298865446432166, "grad_norm": 0.1592136025428772, "learning_rate": 7.567393504462233e-05, "loss": 0.8255, "mean_token_accuracy": 0.7613926120102406, "num_tokens": 253189870.0, "step": 7933 }, { "entropy": 0.8548354189842939, "epoch": 0.7299785510146578, "grad_norm": 0.16113661229610443, "learning_rate": 7.56708682184807e-05, "loss": 0.8557, "mean_token_accuracy": 0.751461286097765, "num_tokens": 253221847.0, "step": 7934 }, { "entropy": 0.7176042851060629, "epoch": 0.7300705573860989, "grad_norm": 0.15872342884540558, "learning_rate": 7.566780139233908e-05, "loss": 0.7024, "mean_token_accuracy": 0.7907408252358437, "num_tokens": 253253293.0, "step": 7935 }, { "entropy": 0.6292059011757374, "epoch": 0.7301625637575402, "grad_norm": 0.15113651752471924, "learning_rate": 7.566473456619745e-05, "loss": 0.6131, "mean_token_accuracy": 0.8188026174902916, "num_tokens": 253285199.0, "step": 7936 }, { "entropy": 0.6483762543648481, "epoch": 0.7302545701289814, "grad_norm": 0.1532796025276184, "learning_rate": 7.566166774005581e-05, "loss": 0.6347, "mean_token_accuracy": 0.8157059140503407, "num_tokens": 253317967.0, "step": 7937 }, { "entropy": 0.6353138834238052, "epoch": 0.7303465765004227, "grad_norm": 0.15265235304832458, "learning_rate": 7.56586009139142e-05, "loss": 0.6174, "mean_token_accuracy": 0.8107044696807861, "num_tokens": 253350238.0, "step": 7938 }, { "entropy": 0.6863475609570742, "epoch": 0.7304385828718639, "grad_norm": 0.16050544381141663, "learning_rate": 7.565553408777258e-05, "loss": 0.6762, "mean_token_accuracy": 0.8000350929796696, "num_tokens": 253382773.0, "step": 7939 }, { "entropy": 0.7641975730657578, "epoch": 0.730530589243305, "grad_norm": 0.15134049952030182, "learning_rate": 7.565246726163094e-05, "loss": 0.7596, "mean_token_accuracy": 0.7772101350128651, "num_tokens": 253414889.0, "step": 7940 }, { "entropy": 0.7570315096527338, "epoch": 0.7306225956147463, "grad_norm": 0.15324823558330536, "learning_rate": 7.564940043548931e-05, "loss": 0.75, "mean_token_accuracy": 0.7740344144403934, "num_tokens": 253446728.0, "step": 7941 }, { "entropy": 0.8193526305258274, "epoch": 0.7307146019861875, "grad_norm": 0.16124288737773895, "learning_rate": 7.564633360934768e-05, "loss": 0.8132, "mean_token_accuracy": 0.7549918219447136, "num_tokens": 253477992.0, "step": 7942 }, { "entropy": 0.7826138585805893, "epoch": 0.7308066083576288, "grad_norm": 0.15467184782028198, "learning_rate": 7.564326678320606e-05, "loss": 0.7814, "mean_token_accuracy": 0.7728930488228798, "num_tokens": 253510515.0, "step": 7943 }, { "entropy": 0.789142481982708, "epoch": 0.73089861472907, "grad_norm": 0.16523361206054688, "learning_rate": 7.564019995706444e-05, "loss": 0.7777, "mean_token_accuracy": 0.7704470157623291, "num_tokens": 253542236.0, "step": 7944 }, { "entropy": 0.7951589170843363, "epoch": 0.7309906211005112, "grad_norm": 0.21056526899337769, "learning_rate": 7.563713313092281e-05, "loss": 0.8231, "mean_token_accuracy": 0.7654098644852638, "num_tokens": 253573971.0, "step": 7945 }, { "entropy": 0.7486943807452917, "epoch": 0.7310826274719524, "grad_norm": 0.15937910974025726, "learning_rate": 7.563406630478118e-05, "loss": 0.7232, "mean_token_accuracy": 0.7888135239481926, "num_tokens": 253606203.0, "step": 7946 }, { "entropy": 0.7433761693537235, "epoch": 0.7311746338433937, "grad_norm": 0.15660560131072998, "learning_rate": 7.563099947863956e-05, "loss": 0.715, "mean_token_accuracy": 0.7913198694586754, "num_tokens": 253638314.0, "step": 7947 }, { "entropy": 0.7425393909215927, "epoch": 0.7312666402148349, "grad_norm": 0.16296958923339844, "learning_rate": 7.562793265249793e-05, "loss": 0.7483, "mean_token_accuracy": 0.7790047861635685, "num_tokens": 253670754.0, "step": 7948 }, { "entropy": 0.7805876862257719, "epoch": 0.7313586465862761, "grad_norm": 0.15797635912895203, "learning_rate": 7.562486582635631e-05, "loss": 0.7657, "mean_token_accuracy": 0.7695169858634472, "num_tokens": 253702905.0, "step": 7949 }, { "entropy": 0.7614521440118551, "epoch": 0.7314506529577173, "grad_norm": 0.15333186089992523, "learning_rate": 7.562179900021468e-05, "loss": 0.7459, "mean_token_accuracy": 0.7785964533686638, "num_tokens": 253735074.0, "step": 7950 }, { "entropy": 0.6324459817260504, "epoch": 0.7315426593291585, "grad_norm": 0.1438017636537552, "learning_rate": 7.561873217407306e-05, "loss": 0.6065, "mean_token_accuracy": 0.8146380670368671, "num_tokens": 253766138.0, "step": 7951 }, { "entropy": 0.818536814302206, "epoch": 0.7316346657005998, "grad_norm": 0.1557816118001938, "learning_rate": 7.561566534793143e-05, "loss": 0.8059, "mean_token_accuracy": 0.7648622393608093, "num_tokens": 253798431.0, "step": 7952 }, { "entropy": 0.7679702155292034, "epoch": 0.731726672072041, "grad_norm": 0.16103729605674744, "learning_rate": 7.56125985217898e-05, "loss": 0.758, "mean_token_accuracy": 0.7805511616170406, "num_tokens": 253830367.0, "step": 7953 }, { "entropy": 0.8294976744800806, "epoch": 0.7318186784434823, "grad_norm": 0.1651262491941452, "learning_rate": 7.560953169564818e-05, "loss": 0.8107, "mean_token_accuracy": 0.7618746869266033, "num_tokens": 253861916.0, "step": 7954 }, { "entropy": 0.680297177284956, "epoch": 0.7319106848149234, "grad_norm": 0.15806886553764343, "learning_rate": 7.560646486950656e-05, "loss": 0.6644, "mean_token_accuracy": 0.8017854616045952, "num_tokens": 253893982.0, "step": 7955 }, { "entropy": 0.7435339726507664, "epoch": 0.7320026911863646, "grad_norm": 0.1549362987279892, "learning_rate": 7.560339804336493e-05, "loss": 0.7256, "mean_token_accuracy": 0.7835787087678909, "num_tokens": 253925297.0, "step": 7956 }, { "entropy": 0.7855102196335793, "epoch": 0.7320946975578059, "grad_norm": 0.15753905475139618, "learning_rate": 7.56003312172233e-05, "loss": 0.7761, "mean_token_accuracy": 0.7737756036221981, "num_tokens": 253957177.0, "step": 7957 }, { "entropy": 0.7434988003224134, "epoch": 0.7321867039292471, "grad_norm": 0.15987050533294678, "learning_rate": 7.559726439108166e-05, "loss": 0.7237, "mean_token_accuracy": 0.784067627042532, "num_tokens": 253989011.0, "step": 7958 }, { "entropy": 0.7001366335898638, "epoch": 0.7322787103006884, "grad_norm": 0.1554851531982422, "learning_rate": 7.559419756494006e-05, "loss": 0.695, "mean_token_accuracy": 0.7912022359669209, "num_tokens": 254021465.0, "step": 7959 }, { "entropy": 0.655152378603816, "epoch": 0.7323707166721295, "grad_norm": 0.16099496185779572, "learning_rate": 7.559113073879842e-05, "loss": 0.6363, "mean_token_accuracy": 0.8110510632395744, "num_tokens": 254053696.0, "step": 7960 }, { "entropy": 0.6959823165088892, "epoch": 0.7324627230435707, "grad_norm": 0.1550913006067276, "learning_rate": 7.558806391265679e-05, "loss": 0.6889, "mean_token_accuracy": 0.7942805290222168, "num_tokens": 254084216.0, "step": 7961 }, { "entropy": 0.6347840195521712, "epoch": 0.732554729415012, "grad_norm": 0.15514636039733887, "learning_rate": 7.558499708651516e-05, "loss": 0.6399, "mean_token_accuracy": 0.8107388615608215, "num_tokens": 254115982.0, "step": 7962 }, { "entropy": 0.7805109936743975, "epoch": 0.7326467357864532, "grad_norm": 0.15526270866394043, "learning_rate": 7.558193026037354e-05, "loss": 0.7777, "mean_token_accuracy": 0.7732713036239147, "num_tokens": 254148701.0, "step": 7963 }, { "entropy": 0.6908981762826443, "epoch": 0.7327387421578945, "grad_norm": 0.15398359298706055, "learning_rate": 7.557886343423192e-05, "loss": 0.6806, "mean_token_accuracy": 0.7986280545592308, "num_tokens": 254180770.0, "step": 7964 }, { "entropy": 0.7456530909985304, "epoch": 0.7328307485293356, "grad_norm": 0.16093984246253967, "learning_rate": 7.557579660809029e-05, "loss": 0.7142, "mean_token_accuracy": 0.7888236753642559, "num_tokens": 254212530.0, "step": 7965 }, { "entropy": 0.7020308570936322, "epoch": 0.7329227549007769, "grad_norm": 0.16295042634010315, "learning_rate": 7.557272978194867e-05, "loss": 0.7022, "mean_token_accuracy": 0.7947042398154736, "num_tokens": 254244867.0, "step": 7966 }, { "entropy": 0.7056153975427151, "epoch": 0.7330147612722181, "grad_norm": 0.14856092631816864, "learning_rate": 7.556966295580704e-05, "loss": 0.6904, "mean_token_accuracy": 0.7949605360627174, "num_tokens": 254277206.0, "step": 7967 }, { "entropy": 0.7195652909576893, "epoch": 0.7331067676436593, "grad_norm": 0.15388768911361694, "learning_rate": 7.556659612966541e-05, "loss": 0.6967, "mean_token_accuracy": 0.795229934155941, "num_tokens": 254309193.0, "step": 7968 }, { "entropy": 0.737976549193263, "epoch": 0.7331987740151006, "grad_norm": 0.15955117344856262, "learning_rate": 7.556352930352379e-05, "loss": 0.7281, "mean_token_accuracy": 0.7848136909306049, "num_tokens": 254341496.0, "step": 7969 }, { "entropy": 0.647602709941566, "epoch": 0.7332907803865417, "grad_norm": 0.15422207117080688, "learning_rate": 7.556046247738217e-05, "loss": 0.6381, "mean_token_accuracy": 0.8123192116618156, "num_tokens": 254373845.0, "step": 7970 }, { "entropy": 0.7097981050610542, "epoch": 0.733382786757983, "grad_norm": 0.15581898391246796, "learning_rate": 7.555739565124054e-05, "loss": 0.7076, "mean_token_accuracy": 0.7933853715658188, "num_tokens": 254406104.0, "step": 7971 }, { "entropy": 0.6440607756376266, "epoch": 0.7334747931294242, "grad_norm": 0.15071403980255127, "learning_rate": 7.55543288250989e-05, "loss": 0.628, "mean_token_accuracy": 0.8126105293631554, "num_tokens": 254437552.0, "step": 7972 }, { "entropy": 0.7490789759904146, "epoch": 0.7335667995008655, "grad_norm": 0.1613229364156723, "learning_rate": 7.555126199895727e-05, "loss": 0.7243, "mean_token_accuracy": 0.7870497144758701, "num_tokens": 254469677.0, "step": 7973 }, { "entropy": 0.8512578178197145, "epoch": 0.7336588058723067, "grad_norm": 0.16155968606472015, "learning_rate": 7.554819517281566e-05, "loss": 0.8394, "mean_token_accuracy": 0.7517282068729401, "num_tokens": 254501161.0, "step": 7974 }, { "entropy": 0.7780516855418682, "epoch": 0.7337508122437478, "grad_norm": 0.1706516146659851, "learning_rate": 7.554512834667404e-05, "loss": 0.7684, "mean_token_accuracy": 0.7738902382552624, "num_tokens": 254533701.0, "step": 7975 }, { "entropy": 0.8212194889783859, "epoch": 0.7338428186151891, "grad_norm": 0.14994770288467407, "learning_rate": 7.55420615205324e-05, "loss": 0.8189, "mean_token_accuracy": 0.7640267796814442, "num_tokens": 254566049.0, "step": 7976 }, { "entropy": 0.8171414844691753, "epoch": 0.7339348249866303, "grad_norm": 0.16187578439712524, "learning_rate": 7.553899469439077e-05, "loss": 0.8066, "mean_token_accuracy": 0.7622466757893562, "num_tokens": 254597513.0, "step": 7977 }, { "entropy": 0.7761191260069609, "epoch": 0.7340268313580716, "grad_norm": 0.16160014271736145, "learning_rate": 7.553592786824915e-05, "loss": 0.7776, "mean_token_accuracy": 0.771003108471632, "num_tokens": 254629595.0, "step": 7978 }, { "entropy": 0.7726502437144518, "epoch": 0.7341188377295128, "grad_norm": 0.15257717669010162, "learning_rate": 7.553286104210752e-05, "loss": 0.7579, "mean_token_accuracy": 0.777103029191494, "num_tokens": 254661623.0, "step": 7979 }, { "entropy": 0.736591711640358, "epoch": 0.7342108441009539, "grad_norm": 0.15118108689785004, "learning_rate": 7.55297942159659e-05, "loss": 0.7256, "mean_token_accuracy": 0.7817702107131481, "num_tokens": 254693703.0, "step": 7980 }, { "entropy": 0.7769963908940554, "epoch": 0.7343028504723952, "grad_norm": 0.15820524096488953, "learning_rate": 7.552672738982427e-05, "loss": 0.7566, "mean_token_accuracy": 0.7763813808560371, "num_tokens": 254725922.0, "step": 7981 }, { "entropy": 0.7541712149977684, "epoch": 0.7343948568438364, "grad_norm": 0.15493535995483398, "learning_rate": 7.552366056368265e-05, "loss": 0.7461, "mean_token_accuracy": 0.7797490023076534, "num_tokens": 254757866.0, "step": 7982 }, { "entropy": 0.8331007808446884, "epoch": 0.7344868632152777, "grad_norm": 0.1810678392648697, "learning_rate": 7.552059373754102e-05, "loss": 0.8302, "mean_token_accuracy": 0.7575288899242878, "num_tokens": 254789490.0, "step": 7983 }, { "entropy": 0.7025050073862076, "epoch": 0.7345788695867189, "grad_norm": 0.1573040634393692, "learning_rate": 7.551752691139939e-05, "loss": 0.6927, "mean_token_accuracy": 0.7961372695863247, "num_tokens": 254821215.0, "step": 7984 }, { "entropy": 0.6755422446876764, "epoch": 0.73467087595816, "grad_norm": 0.15595434606075287, "learning_rate": 7.551446008525777e-05, "loss": 0.681, "mean_token_accuracy": 0.7991278544068336, "num_tokens": 254853444.0, "step": 7985 }, { "entropy": 0.6667997930198908, "epoch": 0.7347628823296013, "grad_norm": 0.16239546239376068, "learning_rate": 7.551139325911615e-05, "loss": 0.6467, "mean_token_accuracy": 0.8062839731574059, "num_tokens": 254884040.0, "step": 7986 }, { "entropy": 0.7444989420473576, "epoch": 0.7348548887010425, "grad_norm": 0.1573944389820099, "learning_rate": 7.550832643297452e-05, "loss": 0.7339, "mean_token_accuracy": 0.7828828357160091, "num_tokens": 254916281.0, "step": 7987 }, { "entropy": 0.6780536621809006, "epoch": 0.7349468950724838, "grad_norm": 0.15516555309295654, "learning_rate": 7.550525960683289e-05, "loss": 0.6753, "mean_token_accuracy": 0.7984740547835827, "num_tokens": 254948716.0, "step": 7988 }, { "entropy": 0.6599221378564835, "epoch": 0.735038901443925, "grad_norm": 0.14724396169185638, "learning_rate": 7.550219278069126e-05, "loss": 0.6468, "mean_token_accuracy": 0.8079675287008286, "num_tokens": 254980657.0, "step": 7989 }, { "entropy": 0.7872522165998816, "epoch": 0.7351309078153662, "grad_norm": 0.1596556007862091, "learning_rate": 7.549912595454965e-05, "loss": 0.7749, "mean_token_accuracy": 0.7741753868758678, "num_tokens": 255012262.0, "step": 7990 }, { "entropy": 0.7418296858668327, "epoch": 0.7352229141868074, "grad_norm": 0.15662319958209991, "learning_rate": 7.549605912840802e-05, "loss": 0.7263, "mean_token_accuracy": 0.7840980179607868, "num_tokens": 255044206.0, "step": 7991 }, { "entropy": 0.6964784748852253, "epoch": 0.7353149205582487, "grad_norm": 0.15638615190982819, "learning_rate": 7.549299230226639e-05, "loss": 0.6977, "mean_token_accuracy": 0.7919233664870262, "num_tokens": 255076664.0, "step": 7992 }, { "entropy": 0.8068237975239754, "epoch": 0.7354069269296899, "grad_norm": 0.1623249650001526, "learning_rate": 7.548992547612477e-05, "loss": 0.8139, "mean_token_accuracy": 0.7629335671663284, "num_tokens": 255108806.0, "step": 7993 }, { "entropy": 0.6661587236449122, "epoch": 0.7354989333011311, "grad_norm": 0.15239734947681427, "learning_rate": 7.548685864998314e-05, "loss": 0.6564, "mean_token_accuracy": 0.7982831485569477, "num_tokens": 255140378.0, "step": 7994 }, { "entropy": 0.7915634661912918, "epoch": 0.7355909396725723, "grad_norm": 0.18126919865608215, "learning_rate": 7.548379182384152e-05, "loss": 0.7838, "mean_token_accuracy": 0.7701074443757534, "num_tokens": 255172392.0, "step": 7995 }, { "entropy": 0.665026493370533, "epoch": 0.7356829460440135, "grad_norm": 0.1556612253189087, "learning_rate": 7.548072499769988e-05, "loss": 0.6428, "mean_token_accuracy": 0.8094350472092628, "num_tokens": 255204617.0, "step": 7996 }, { "entropy": 0.8218211624771357, "epoch": 0.7357749524154548, "grad_norm": 0.1640169620513916, "learning_rate": 7.547765817155827e-05, "loss": 0.8076, "mean_token_accuracy": 0.7655117586255074, "num_tokens": 255236661.0, "step": 7997 }, { "entropy": 0.7972464710474014, "epoch": 0.735866958786896, "grad_norm": 0.17365577816963196, "learning_rate": 7.547459134541663e-05, "loss": 0.792, "mean_token_accuracy": 0.7665201239287853, "num_tokens": 255268355.0, "step": 7998 }, { "entropy": 0.6556734591722488, "epoch": 0.7359589651583373, "grad_norm": 0.15243494510650635, "learning_rate": 7.5471524519275e-05, "loss": 0.6426, "mean_token_accuracy": 0.8068861626088619, "num_tokens": 255300154.0, "step": 7999 }, { "entropy": 0.7967630289494991, "epoch": 0.7360509715297784, "grad_norm": 0.15824931859970093, "learning_rate": 7.546845769313338e-05, "loss": 0.7971, "mean_token_accuracy": 0.768410213291645, "num_tokens": 255332193.0, "step": 8000 }, { "entropy": 0.8360033445060253, "epoch": 0.7361429779012196, "grad_norm": 0.16119720041751862, "learning_rate": 7.546539086699176e-05, "loss": 0.8121, "mean_token_accuracy": 0.758455652743578, "num_tokens": 255364273.0, "step": 8001 }, { "entropy": 0.7262035720050335, "epoch": 0.7362349842726609, "grad_norm": 0.15905381739139557, "learning_rate": 7.546232404085013e-05, "loss": 0.6994, "mean_token_accuracy": 0.7915507592260838, "num_tokens": 255396014.0, "step": 8002 }, { "entropy": 0.8733964338898659, "epoch": 0.7363269906441021, "grad_norm": 0.15840931236743927, "learning_rate": 7.54592572147085e-05, "loss": 0.8686, "mean_token_accuracy": 0.7526811398565769, "num_tokens": 255427479.0, "step": 8003 }, { "entropy": 0.8087934069335461, "epoch": 0.7364189970155434, "grad_norm": 0.16326186060905457, "learning_rate": 7.545619038856687e-05, "loss": 0.8195, "mean_token_accuracy": 0.7594933807849884, "num_tokens": 255458843.0, "step": 8004 }, { "entropy": 0.7902308516204357, "epoch": 0.7365110033869845, "grad_norm": 0.15848040580749512, "learning_rate": 7.545312356242525e-05, "loss": 0.7982, "mean_token_accuracy": 0.7672663033008575, "num_tokens": 255491051.0, "step": 8005 }, { "entropy": 0.6576723139733076, "epoch": 0.7366030097584257, "grad_norm": 0.15184128284454346, "learning_rate": 7.545005673628363e-05, "loss": 0.6495, "mean_token_accuracy": 0.8091097958385944, "num_tokens": 255523117.0, "step": 8006 }, { "entropy": 0.8132628202438354, "epoch": 0.736695016129867, "grad_norm": 0.15818488597869873, "learning_rate": 7.5446989910142e-05, "loss": 0.8084, "mean_token_accuracy": 0.76482904702425, "num_tokens": 255554837.0, "step": 8007 }, { "entropy": 0.6521974243223667, "epoch": 0.7367870225013082, "grad_norm": 0.15826258063316345, "learning_rate": 7.544392308400037e-05, "loss": 0.647, "mean_token_accuracy": 0.8039029464125633, "num_tokens": 255586652.0, "step": 8008 }, { "entropy": 0.7723423540592194, "epoch": 0.7368790288727495, "grad_norm": 0.15902003645896912, "learning_rate": 7.544085625785875e-05, "loss": 0.7594, "mean_token_accuracy": 0.7727055437862873, "num_tokens": 255617316.0, "step": 8009 }, { "entropy": 0.6533186715096235, "epoch": 0.7369710352441906, "grad_norm": 0.15751589834690094, "learning_rate": 7.543778943171712e-05, "loss": 0.6369, "mean_token_accuracy": 0.8121948018670082, "num_tokens": 255649912.0, "step": 8010 }, { "entropy": 0.74369134940207, "epoch": 0.7370630416156319, "grad_norm": 0.15423333644866943, "learning_rate": 7.54347226055755e-05, "loss": 0.7166, "mean_token_accuracy": 0.7868922427296638, "num_tokens": 255681358.0, "step": 8011 }, { "entropy": 0.7384578827768564, "epoch": 0.7371550479870731, "grad_norm": 0.15560251474380493, "learning_rate": 7.543165577943387e-05, "loss": 0.713, "mean_token_accuracy": 0.7907814644277096, "num_tokens": 255713630.0, "step": 8012 }, { "entropy": 0.588830528780818, "epoch": 0.7372470543585143, "grad_norm": 0.14754718542099, "learning_rate": 7.542858895329225e-05, "loss": 0.562, "mean_token_accuracy": 0.8276812620460987, "num_tokens": 255745609.0, "step": 8013 }, { "entropy": 0.8926608748733997, "epoch": 0.7373390607299556, "grad_norm": 0.16081731021404266, "learning_rate": 7.542552212715061e-05, "loss": 0.8697, "mean_token_accuracy": 0.747456032782793, "num_tokens": 255777501.0, "step": 8014 }, { "entropy": 0.8441969305276871, "epoch": 0.7374310671013967, "grad_norm": 0.15751288831233978, "learning_rate": 7.542245530100898e-05, "loss": 0.8329, "mean_token_accuracy": 0.7586066052317619, "num_tokens": 255809953.0, "step": 8015 }, { "entropy": 0.6959374882280827, "epoch": 0.737523073472838, "grad_norm": 0.15334591269493103, "learning_rate": 7.541938847486736e-05, "loss": 0.6808, "mean_token_accuracy": 0.7938166186213493, "num_tokens": 255841711.0, "step": 8016 }, { "entropy": 0.6627671495079994, "epoch": 0.7376150798442792, "grad_norm": 0.15069018304347992, "learning_rate": 7.541632164872575e-05, "loss": 0.6537, "mean_token_accuracy": 0.8049882426857948, "num_tokens": 255874148.0, "step": 8017 }, { "entropy": 0.7220156006515026, "epoch": 0.7377070862157205, "grad_norm": 0.17264895141124725, "learning_rate": 7.541325482258411e-05, "loss": 0.6891, "mean_token_accuracy": 0.7951749302446842, "num_tokens": 255905599.0, "step": 8018 }, { "entropy": 0.72829769551754, "epoch": 0.7377990925871617, "grad_norm": 0.16382116079330444, "learning_rate": 7.541018799644248e-05, "loss": 0.7345, "mean_token_accuracy": 0.784874901175499, "num_tokens": 255938288.0, "step": 8019 }, { "entropy": 0.6420098710805178, "epoch": 0.7378910989586028, "grad_norm": 0.1707415133714676, "learning_rate": 7.540712117030085e-05, "loss": 0.6486, "mean_token_accuracy": 0.8076644279062748, "num_tokens": 255970166.0, "step": 8020 }, { "entropy": 0.7593545131385326, "epoch": 0.7379831053300441, "grad_norm": 0.15128964185714722, "learning_rate": 7.540405434415923e-05, "loss": 0.75, "mean_token_accuracy": 0.7775575295090675, "num_tokens": 256001512.0, "step": 8021 }, { "entropy": 0.7964868377894163, "epoch": 0.7380751117014853, "grad_norm": 0.1687273383140564, "learning_rate": 7.540098751801761e-05, "loss": 0.7921, "mean_token_accuracy": 0.7682682015001774, "num_tokens": 256033658.0, "step": 8022 }, { "entropy": 0.7536402512341738, "epoch": 0.7381671180729266, "grad_norm": 0.15843546390533447, "learning_rate": 7.539792069187598e-05, "loss": 0.761, "mean_token_accuracy": 0.7774581201374531, "num_tokens": 256065895.0, "step": 8023 }, { "entropy": 0.7514795828610659, "epoch": 0.7382591244443678, "grad_norm": 0.15582092106342316, "learning_rate": 7.539485386573436e-05, "loss": 0.7431, "mean_token_accuracy": 0.7838446088135242, "num_tokens": 256098438.0, "step": 8024 }, { "entropy": 0.7972057573497295, "epoch": 0.7383511308158089, "grad_norm": 0.15610793232917786, "learning_rate": 7.539178703959273e-05, "loss": 0.8007, "mean_token_accuracy": 0.7663934044539928, "num_tokens": 256130292.0, "step": 8025 }, { "entropy": 0.834581496194005, "epoch": 0.7384431371872502, "grad_norm": 0.16790282726287842, "learning_rate": 7.53887202134511e-05, "loss": 0.8175, "mean_token_accuracy": 0.7632886916399002, "num_tokens": 256161028.0, "step": 8026 }, { "entropy": 0.7239124495536089, "epoch": 0.7385351435586914, "grad_norm": 0.15775762498378754, "learning_rate": 7.538565338730948e-05, "loss": 0.7081, "mean_token_accuracy": 0.7892268262803555, "num_tokens": 256193158.0, "step": 8027 }, { "entropy": 0.6899391654878855, "epoch": 0.7386271499301327, "grad_norm": 0.15455761551856995, "learning_rate": 7.538258656116786e-05, "loss": 0.6737, "mean_token_accuracy": 0.7978865690529346, "num_tokens": 256225024.0, "step": 8028 }, { "entropy": 0.751967029646039, "epoch": 0.7387191563015739, "grad_norm": 0.15287940204143524, "learning_rate": 7.537951973502623e-05, "loss": 0.7466, "mean_token_accuracy": 0.7832746878266335, "num_tokens": 256257050.0, "step": 8029 }, { "entropy": 0.7759305238723755, "epoch": 0.738811162673015, "grad_norm": 0.16143012046813965, "learning_rate": 7.53764529088846e-05, "loss": 0.7603, "mean_token_accuracy": 0.777433205395937, "num_tokens": 256289376.0, "step": 8030 }, { "entropy": 0.838329678401351, "epoch": 0.7389031690444563, "grad_norm": 0.15767909586429596, "learning_rate": 7.537338608274296e-05, "loss": 0.8197, "mean_token_accuracy": 0.7608492560684681, "num_tokens": 256320504.0, "step": 8031 }, { "entropy": 0.7722492758184671, "epoch": 0.7389951754158975, "grad_norm": 0.15661895275115967, "learning_rate": 7.537031925660136e-05, "loss": 0.7618, "mean_token_accuracy": 0.7751695849001408, "num_tokens": 256352472.0, "step": 8032 }, { "entropy": 0.8077216055244207, "epoch": 0.7390871817873388, "grad_norm": 0.1662754863500595, "learning_rate": 7.536725243045973e-05, "loss": 0.8137, "mean_token_accuracy": 0.7634897232055664, "num_tokens": 256384832.0, "step": 8033 }, { "entropy": 0.6778822932392359, "epoch": 0.73917918815878, "grad_norm": 0.16128943860530853, "learning_rate": 7.53641856043181e-05, "loss": 0.6771, "mean_token_accuracy": 0.7942784056067467, "num_tokens": 256416647.0, "step": 8034 }, { "entropy": 0.6921396143734455, "epoch": 0.7392711945302212, "grad_norm": 0.16028742492198944, "learning_rate": 7.536111877817646e-05, "loss": 0.6658, "mean_token_accuracy": 0.8032757826149464, "num_tokens": 256448642.0, "step": 8035 }, { "entropy": 0.708757609128952, "epoch": 0.7393632009016624, "grad_norm": 0.16418242454528809, "learning_rate": 7.535805195203484e-05, "loss": 0.6971, "mean_token_accuracy": 0.796929806470871, "num_tokens": 256480067.0, "step": 8036 }, { "entropy": 0.7324373070150614, "epoch": 0.7394552072731037, "grad_norm": 0.15333658456802368, "learning_rate": 7.535498512589322e-05, "loss": 0.7117, "mean_token_accuracy": 0.7951207347214222, "num_tokens": 256511851.0, "step": 8037 }, { "entropy": 0.7737599983811378, "epoch": 0.7395472136445449, "grad_norm": 0.1624949872493744, "learning_rate": 7.535191829975159e-05, "loss": 0.7484, "mean_token_accuracy": 0.7751474156975746, "num_tokens": 256543602.0, "step": 8038 }, { "entropy": 0.7295498121529818, "epoch": 0.7396392200159861, "grad_norm": 0.15187206864356995, "learning_rate": 7.534885147360996e-05, "loss": 0.7112, "mean_token_accuracy": 0.7884564958512783, "num_tokens": 256575238.0, "step": 8039 }, { "entropy": 0.720642976462841, "epoch": 0.7397312263874273, "grad_norm": 0.15850234031677246, "learning_rate": 7.534578464746834e-05, "loss": 0.7235, "mean_token_accuracy": 0.7899790219962597, "num_tokens": 256607281.0, "step": 8040 }, { "entropy": 0.6390637140721083, "epoch": 0.7398232327588685, "grad_norm": 0.15619851648807526, "learning_rate": 7.534271782132671e-05, "loss": 0.5987, "mean_token_accuracy": 0.8221164904534817, "num_tokens": 256639552.0, "step": 8041 }, { "entropy": 0.8265862008556724, "epoch": 0.7399152391303098, "grad_norm": 0.16042454540729523, "learning_rate": 7.533965099518509e-05, "loss": 0.8071, "mean_token_accuracy": 0.7679643966257572, "num_tokens": 256672290.0, "step": 8042 }, { "entropy": 0.838137798011303, "epoch": 0.740007245501751, "grad_norm": 0.16002242267131805, "learning_rate": 7.533658416904346e-05, "loss": 0.8287, "mean_token_accuracy": 0.7595362402498722, "num_tokens": 256703642.0, "step": 8043 }, { "entropy": 0.8139375662431121, "epoch": 0.7400992518731923, "grad_norm": 0.16806693375110626, "learning_rate": 7.533351734290184e-05, "loss": 0.8197, "mean_token_accuracy": 0.7625448331236839, "num_tokens": 256736349.0, "step": 8044 }, { "entropy": 0.7596361208707094, "epoch": 0.7401912582446334, "grad_norm": 0.16122758388519287, "learning_rate": 7.533045051676021e-05, "loss": 0.7695, "mean_token_accuracy": 0.7789523676037788, "num_tokens": 256767949.0, "step": 8045 }, { "entropy": 0.7712306492030621, "epoch": 0.7402832646160746, "grad_norm": 0.16040503978729248, "learning_rate": 7.532738369061858e-05, "loss": 0.7767, "mean_token_accuracy": 0.7754655480384827, "num_tokens": 256800470.0, "step": 8046 }, { "entropy": 0.7405154220759869, "epoch": 0.7403752709875159, "grad_norm": 0.1595177948474884, "learning_rate": 7.532431686447696e-05, "loss": 0.725, "mean_token_accuracy": 0.7847346588969231, "num_tokens": 256831585.0, "step": 8047 }, { "entropy": 0.6670710239559412, "epoch": 0.7404672773589571, "grad_norm": 0.1477688103914261, "learning_rate": 7.532125003833534e-05, "loss": 0.651, "mean_token_accuracy": 0.8035143353044987, "num_tokens": 256863371.0, "step": 8048 }, { "entropy": 0.6169558223336935, "epoch": 0.7405592837303984, "grad_norm": 0.1575191617012024, "learning_rate": 7.53181832121937e-05, "loss": 0.6042, "mean_token_accuracy": 0.8210135735571384, "num_tokens": 256895673.0, "step": 8049 }, { "entropy": 0.7091694176197052, "epoch": 0.7406512901018395, "grad_norm": 0.1559368222951889, "learning_rate": 7.531511638605207e-05, "loss": 0.6977, "mean_token_accuracy": 0.7923090308904648, "num_tokens": 256927761.0, "step": 8050 }, { "entropy": 0.7540697157382965, "epoch": 0.7407432964732807, "grad_norm": 0.15680545568466187, "learning_rate": 7.531204955991044e-05, "loss": 0.7554, "mean_token_accuracy": 0.7725899890065193, "num_tokens": 256959785.0, "step": 8051 }, { "entropy": 0.842053011059761, "epoch": 0.740835302844722, "grad_norm": 0.16042739152908325, "learning_rate": 7.530898273376882e-05, "loss": 0.825, "mean_token_accuracy": 0.7556627057492733, "num_tokens": 256990868.0, "step": 8052 }, { "entropy": 0.7356868609786034, "epoch": 0.7409273092161632, "grad_norm": 0.15772175788879395, "learning_rate": 7.53059159076272e-05, "loss": 0.7257, "mean_token_accuracy": 0.7874976508319378, "num_tokens": 257023130.0, "step": 8053 }, { "entropy": 0.7597192376852036, "epoch": 0.7410193155876045, "grad_norm": 0.15751828253269196, "learning_rate": 7.530284908148557e-05, "loss": 0.738, "mean_token_accuracy": 0.783134438097477, "num_tokens": 257054938.0, "step": 8054 }, { "entropy": 0.8692819997668266, "epoch": 0.7411113219590456, "grad_norm": 0.16339243948459625, "learning_rate": 7.529978225534395e-05, "loss": 0.8647, "mean_token_accuracy": 0.7489371113479137, "num_tokens": 257086892.0, "step": 8055 }, { "entropy": 0.7597337625920773, "epoch": 0.7412033283304869, "grad_norm": 0.15756948292255402, "learning_rate": 7.529671542920232e-05, "loss": 0.7436, "mean_token_accuracy": 0.7854396626353264, "num_tokens": 257118504.0, "step": 8056 }, { "entropy": 0.7140550184994936, "epoch": 0.7412953347019281, "grad_norm": 0.15243084728717804, "learning_rate": 7.529364860306069e-05, "loss": 0.7, "mean_token_accuracy": 0.7875637002289295, "num_tokens": 257151007.0, "step": 8057 }, { "entropy": 0.8362363632768393, "epoch": 0.7413873410733693, "grad_norm": 0.16132640838623047, "learning_rate": 7.529058177691907e-05, "loss": 0.8309, "mean_token_accuracy": 0.7603454105556011, "num_tokens": 257183137.0, "step": 8058 }, { "entropy": 0.6719320118427277, "epoch": 0.7414793474448106, "grad_norm": 0.15549570322036743, "learning_rate": 7.528751495077745e-05, "loss": 0.6632, "mean_token_accuracy": 0.8039439544081688, "num_tokens": 257215347.0, "step": 8059 }, { "entropy": 0.682900682091713, "epoch": 0.7415713538162517, "grad_norm": 0.14744041860103607, "learning_rate": 7.528444812463582e-05, "loss": 0.6738, "mean_token_accuracy": 0.8027601353824139, "num_tokens": 257248115.0, "step": 8060 }, { "entropy": 0.7384104952216148, "epoch": 0.741663360187693, "grad_norm": 0.15702170133590698, "learning_rate": 7.528138129849419e-05, "loss": 0.7383, "mean_token_accuracy": 0.7791250422596931, "num_tokens": 257280243.0, "step": 8061 }, { "entropy": 0.6402052622288465, "epoch": 0.7417553665591342, "grad_norm": 0.1548103392124176, "learning_rate": 7.527831447235256e-05, "loss": 0.6235, "mean_token_accuracy": 0.8143100328743458, "num_tokens": 257311996.0, "step": 8062 }, { "entropy": 0.8281719572842121, "epoch": 0.7418473729305755, "grad_norm": 0.1553432047367096, "learning_rate": 7.527524764621094e-05, "loss": 0.8098, "mean_token_accuracy": 0.7612727954983711, "num_tokens": 257344129.0, "step": 8063 }, { "entropy": 0.7759141623973846, "epoch": 0.7419393793020167, "grad_norm": 0.15715515613555908, "learning_rate": 7.527218082006932e-05, "loss": 0.7596, "mean_token_accuracy": 0.7739205621182919, "num_tokens": 257375907.0, "step": 8064 }, { "entropy": 0.641970306634903, "epoch": 0.7420313856734578, "grad_norm": 0.15255849063396454, "learning_rate": 7.526911399392769e-05, "loss": 0.6294, "mean_token_accuracy": 0.8067746721208096, "num_tokens": 257407969.0, "step": 8065 }, { "entropy": 0.6814655028283596, "epoch": 0.7421233920448991, "grad_norm": 0.1522647738456726, "learning_rate": 7.526604716778606e-05, "loss": 0.6614, "mean_token_accuracy": 0.7975085452198982, "num_tokens": 257440737.0, "step": 8066 }, { "entropy": 0.7718297075480223, "epoch": 0.7422153984163403, "grad_norm": 0.15569531917572021, "learning_rate": 7.526298034164444e-05, "loss": 0.7663, "mean_token_accuracy": 0.7768466845154762, "num_tokens": 257472610.0, "step": 8067 }, { "entropy": 0.6676082387566566, "epoch": 0.7423074047877816, "grad_norm": 0.15129660069942474, "learning_rate": 7.52599135155028e-05, "loss": 0.6596, "mean_token_accuracy": 0.8050977177917957, "num_tokens": 257504799.0, "step": 8068 }, { "entropy": 0.7652319935150445, "epoch": 0.7423994111592228, "grad_norm": 0.14887267351150513, "learning_rate": 7.525684668936119e-05, "loss": 0.7638, "mean_token_accuracy": 0.7792015969753265, "num_tokens": 257536945.0, "step": 8069 }, { "entropy": 0.8054147539660335, "epoch": 0.7424914175306639, "grad_norm": 0.16086208820343018, "learning_rate": 7.525377986321955e-05, "loss": 0.7959, "mean_token_accuracy": 0.7661052606999874, "num_tokens": 257568884.0, "step": 8070 }, { "entropy": 0.7449812516570091, "epoch": 0.7425834239021052, "grad_norm": 0.16592009365558624, "learning_rate": 7.525071303707794e-05, "loss": 0.7478, "mean_token_accuracy": 0.7774038128554821, "num_tokens": 257599887.0, "step": 8071 }, { "entropy": 0.6622294886037707, "epoch": 0.7426754302735464, "grad_norm": 0.16200889647006989, "learning_rate": 7.52476462109363e-05, "loss": 0.652, "mean_token_accuracy": 0.8036642335355282, "num_tokens": 257631740.0, "step": 8072 }, { "entropy": 0.7042396888136864, "epoch": 0.7427674366449877, "grad_norm": 0.15181110799312592, "learning_rate": 7.524457938479467e-05, "loss": 0.6978, "mean_token_accuracy": 0.7945433855056763, "num_tokens": 257664099.0, "step": 8073 }, { "entropy": 0.8299365118145943, "epoch": 0.7428594430164289, "grad_norm": 0.1571173071861267, "learning_rate": 7.524151255865305e-05, "loss": 0.829, "mean_token_accuracy": 0.7599273920059204, "num_tokens": 257696366.0, "step": 8074 }, { "entropy": 0.6925945971161127, "epoch": 0.74295144938787, "grad_norm": 0.15408210456371307, "learning_rate": 7.523844573251143e-05, "loss": 0.6827, "mean_token_accuracy": 0.7998567670583725, "num_tokens": 257728824.0, "step": 8075 }, { "entropy": 0.7074849177151918, "epoch": 0.7430434557593113, "grad_norm": 0.15489710867404938, "learning_rate": 7.52353789063698e-05, "loss": 0.7093, "mean_token_accuracy": 0.7920681051909924, "num_tokens": 257761296.0, "step": 8076 }, { "entropy": 0.8453859444707632, "epoch": 0.7431354621307525, "grad_norm": 0.16741155087947845, "learning_rate": 7.523231208022817e-05, "loss": 0.8664, "mean_token_accuracy": 0.7510685995221138, "num_tokens": 257793626.0, "step": 8077 }, { "entropy": 0.805937223136425, "epoch": 0.7432274685021938, "grad_norm": 0.16141533851623535, "learning_rate": 7.522924525408655e-05, "loss": 0.7993, "mean_token_accuracy": 0.7625425793230534, "num_tokens": 257825755.0, "step": 8078 }, { "entropy": 0.8037840500473976, "epoch": 0.743319474873635, "grad_norm": 0.16020327806472778, "learning_rate": 7.522617842794493e-05, "loss": 0.7885, "mean_token_accuracy": 0.7725898250937462, "num_tokens": 257857298.0, "step": 8079 }, { "entropy": 0.756387285888195, "epoch": 0.7434114812450762, "grad_norm": 0.15552634000778198, "learning_rate": 7.52231116018033e-05, "loss": 0.7234, "mean_token_accuracy": 0.7816651649773121, "num_tokens": 257888592.0, "step": 8080 }, { "entropy": 0.7709727101027966, "epoch": 0.7435034876165174, "grad_norm": 0.15203812718391418, "learning_rate": 7.522004477566167e-05, "loss": 0.7615, "mean_token_accuracy": 0.7779220268130302, "num_tokens": 257920995.0, "step": 8081 }, { "entropy": 0.7425828594714403, "epoch": 0.7435954939879587, "grad_norm": 0.1570538431406021, "learning_rate": 7.521697794952004e-05, "loss": 0.7255, "mean_token_accuracy": 0.7850154377520084, "num_tokens": 257953275.0, "step": 8082 }, { "entropy": 0.6321696080267429, "epoch": 0.7436875003593999, "grad_norm": 0.1499525010585785, "learning_rate": 7.521391112337842e-05, "loss": 0.6091, "mean_token_accuracy": 0.8271604552865028, "num_tokens": 257985599.0, "step": 8083 }, { "entropy": 0.7483558226376772, "epoch": 0.7437795067308411, "grad_norm": 0.1541164219379425, "learning_rate": 7.52108442972368e-05, "loss": 0.7395, "mean_token_accuracy": 0.7821946479380131, "num_tokens": 258017979.0, "step": 8084 }, { "entropy": 0.7555364649742842, "epoch": 0.7438715131022823, "grad_norm": 0.1590879261493683, "learning_rate": 7.520777747109517e-05, "loss": 0.7363, "mean_token_accuracy": 0.7879788242280483, "num_tokens": 258050624.0, "step": 8085 }, { "entropy": 0.85886000841856, "epoch": 0.7439635194737235, "grad_norm": 0.16207678616046906, "learning_rate": 7.520471064495355e-05, "loss": 0.8615, "mean_token_accuracy": 0.7507200948894024, "num_tokens": 258083095.0, "step": 8086 }, { "entropy": 0.6464110808447003, "epoch": 0.7440555258451648, "grad_norm": 0.14414264261722565, "learning_rate": 7.520164381881192e-05, "loss": 0.6219, "mean_token_accuracy": 0.8158505409955978, "num_tokens": 258115069.0, "step": 8087 }, { "entropy": 0.596128542907536, "epoch": 0.744147532216606, "grad_norm": 0.14355991780757904, "learning_rate": 7.519857699267028e-05, "loss": 0.5849, "mean_token_accuracy": 0.8217706419527531, "num_tokens": 258147492.0, "step": 8088 }, { "entropy": 0.6372934002429247, "epoch": 0.7442395385880473, "grad_norm": 0.15444093942642212, "learning_rate": 7.519551016652867e-05, "loss": 0.6106, "mean_token_accuracy": 0.8113414607942104, "num_tokens": 258179545.0, "step": 8089 }, { "entropy": 0.7854831535369158, "epoch": 0.7443315449594884, "grad_norm": 0.161748006939888, "learning_rate": 7.519244334038705e-05, "loss": 0.7721, "mean_token_accuracy": 0.768597386777401, "num_tokens": 258211379.0, "step": 8090 }, { "entropy": 0.652193927206099, "epoch": 0.7444235513309296, "grad_norm": 0.15270362794399261, "learning_rate": 7.518937651424541e-05, "loss": 0.6353, "mean_token_accuracy": 0.810158271342516, "num_tokens": 258243417.0, "step": 8091 }, { "entropy": 0.7555181086063385, "epoch": 0.7445155577023709, "grad_norm": 0.16416305303573608, "learning_rate": 7.518630968810378e-05, "loss": 0.7235, "mean_token_accuracy": 0.7894778102636337, "num_tokens": 258275436.0, "step": 8092 }, { "entropy": 0.7627019006758928, "epoch": 0.7446075640738121, "grad_norm": 0.15161822736263275, "learning_rate": 7.518324286196215e-05, "loss": 0.7525, "mean_token_accuracy": 0.7756087072193623, "num_tokens": 258307044.0, "step": 8093 }, { "entropy": 0.7639852222055197, "epoch": 0.7446995704452534, "grad_norm": 0.15704822540283203, "learning_rate": 7.518017603582053e-05, "loss": 0.7526, "mean_token_accuracy": 0.7787619829177856, "num_tokens": 258339073.0, "step": 8094 }, { "entropy": 0.7536395639181137, "epoch": 0.7447915768166946, "grad_norm": 0.15004168450832367, "learning_rate": 7.517710920967891e-05, "loss": 0.7391, "mean_token_accuracy": 0.7810014002025127, "num_tokens": 258370985.0, "step": 8095 }, { "entropy": 0.7362917521968484, "epoch": 0.7448835831881357, "grad_norm": 0.15603694319725037, "learning_rate": 7.517404238353728e-05, "loss": 0.7295, "mean_token_accuracy": 0.7845744341611862, "num_tokens": 258402933.0, "step": 8096 }, { "entropy": 0.7420861031860113, "epoch": 0.744975589559577, "grad_norm": 0.15906183421611786, "learning_rate": 7.517097555739565e-05, "loss": 0.7372, "mean_token_accuracy": 0.7886726520955563, "num_tokens": 258434524.0, "step": 8097 }, { "entropy": 0.7217427957803011, "epoch": 0.7450675959310182, "grad_norm": 0.16248778998851776, "learning_rate": 7.516790873125403e-05, "loss": 0.7008, "mean_token_accuracy": 0.7942018769681454, "num_tokens": 258466097.0, "step": 8098 }, { "entropy": 0.8063083682209253, "epoch": 0.7451596023024595, "grad_norm": 0.16111858189105988, "learning_rate": 7.51648419051124e-05, "loss": 0.8109, "mean_token_accuracy": 0.759985838085413, "num_tokens": 258497597.0, "step": 8099 }, { "entropy": 0.718004371970892, "epoch": 0.7452516086739007, "grad_norm": 0.1605186015367508, "learning_rate": 7.516177507897078e-05, "loss": 0.7173, "mean_token_accuracy": 0.7915062084794044, "num_tokens": 258529871.0, "step": 8100 }, { "entropy": 0.662064254283905, "epoch": 0.7453436150453419, "grad_norm": 0.15533673763275146, "learning_rate": 7.515870825282915e-05, "loss": 0.6528, "mean_token_accuracy": 0.8078296110033989, "num_tokens": 258562244.0, "step": 8101 }, { "entropy": 0.8089977037161589, "epoch": 0.7454356214167831, "grad_norm": 0.15768994390964508, "learning_rate": 7.515564142668753e-05, "loss": 0.7954, "mean_token_accuracy": 0.764208696782589, "num_tokens": 258594906.0, "step": 8102 }, { "entropy": 0.7692747730761766, "epoch": 0.7455276277882243, "grad_norm": 0.15614159405231476, "learning_rate": 7.51525746005459e-05, "loss": 0.7461, "mean_token_accuracy": 0.7799416519701481, "num_tokens": 258626128.0, "step": 8103 }, { "entropy": 0.7267665006220341, "epoch": 0.7456196341596656, "grad_norm": 0.15462851524353027, "learning_rate": 7.514950777440426e-05, "loss": 0.7195, "mean_token_accuracy": 0.7827955558896065, "num_tokens": 258657278.0, "step": 8104 }, { "entropy": 0.8321237713098526, "epoch": 0.7457116405311068, "grad_norm": 0.16024865210056305, "learning_rate": 7.514644094826265e-05, "loss": 0.8261, "mean_token_accuracy": 0.7566846162080765, "num_tokens": 258689527.0, "step": 8105 }, { "entropy": 0.6344469245523214, "epoch": 0.745803646902548, "grad_norm": 0.14674749970436096, "learning_rate": 7.514337412212103e-05, "loss": 0.622, "mean_token_accuracy": 0.811629731208086, "num_tokens": 258721898.0, "step": 8106 }, { "entropy": 0.6775523666292429, "epoch": 0.7458956532739892, "grad_norm": 0.15999835729599, "learning_rate": 7.51403072959794e-05, "loss": 0.6796, "mean_token_accuracy": 0.7979625687003136, "num_tokens": 258753328.0, "step": 8107 }, { "entropy": 0.7211298067122698, "epoch": 0.7459876596454305, "grad_norm": 0.15650928020477295, "learning_rate": 7.513724046983776e-05, "loss": 0.7188, "mean_token_accuracy": 0.7853905782103539, "num_tokens": 258785575.0, "step": 8108 }, { "entropy": 0.7258724607527256, "epoch": 0.7460796660168717, "grad_norm": 0.15271170437335968, "learning_rate": 7.513417364369613e-05, "loss": 0.7154, "mean_token_accuracy": 0.7897887006402016, "num_tokens": 258817952.0, "step": 8109 }, { "entropy": 0.705657010897994, "epoch": 0.746171672388313, "grad_norm": 0.14762578904628754, "learning_rate": 7.513110681755453e-05, "loss": 0.6902, "mean_token_accuracy": 0.7914130389690399, "num_tokens": 258850153.0, "step": 8110 }, { "entropy": 0.6190125606954098, "epoch": 0.7462636787597541, "grad_norm": 0.14790643751621246, "learning_rate": 7.51280399914129e-05, "loss": 0.5991, "mean_token_accuracy": 0.8204900063574314, "num_tokens": 258882704.0, "step": 8111 }, { "entropy": 0.6581332441419363, "epoch": 0.7463556851311953, "grad_norm": 0.16104981303215027, "learning_rate": 7.512497316527126e-05, "loss": 0.6469, "mean_token_accuracy": 0.8084552623331547, "num_tokens": 258915065.0, "step": 8112 }, { "entropy": 0.8364161737263203, "epoch": 0.7464476915026366, "grad_norm": 0.15849189460277557, "learning_rate": 7.512190633912963e-05, "loss": 0.8229, "mean_token_accuracy": 0.7608613818883896, "num_tokens": 258947318.0, "step": 8113 }, { "entropy": 0.6827929280698299, "epoch": 0.7465396978740778, "grad_norm": 0.15612095594406128, "learning_rate": 7.511883951298801e-05, "loss": 0.6848, "mean_token_accuracy": 0.7969828024506569, "num_tokens": 258979869.0, "step": 8114 }, { "entropy": 0.6751663982868195, "epoch": 0.7466317042455191, "grad_norm": 0.15653567016124725, "learning_rate": 7.511577268684639e-05, "loss": 0.655, "mean_token_accuracy": 0.8063732832670212, "num_tokens": 259011666.0, "step": 8115 }, { "entropy": 0.7977599520236254, "epoch": 0.7467237106169602, "grad_norm": 0.16816234588623047, "learning_rate": 7.511270586070476e-05, "loss": 0.7935, "mean_token_accuracy": 0.7684180364012718, "num_tokens": 259043581.0, "step": 8116 }, { "entropy": 0.6802265420556068, "epoch": 0.7468157169884014, "grad_norm": 0.15422099828720093, "learning_rate": 7.510963903456314e-05, "loss": 0.6937, "mean_token_accuracy": 0.7915398590266705, "num_tokens": 259075367.0, "step": 8117 }, { "entropy": 0.740668329410255, "epoch": 0.7469077233598427, "grad_norm": 0.16493543982505798, "learning_rate": 7.510657220842151e-05, "loss": 0.7377, "mean_token_accuracy": 0.7840865850448608, "num_tokens": 259107538.0, "step": 8118 }, { "entropy": 0.6747484728693962, "epoch": 0.7469997297312839, "grad_norm": 0.1540052741765976, "learning_rate": 7.510350538227988e-05, "loss": 0.648, "mean_token_accuracy": 0.8060995526611805, "num_tokens": 259140138.0, "step": 8119 }, { "entropy": 0.6715555675327778, "epoch": 0.7470917361027252, "grad_norm": 0.15101535618305206, "learning_rate": 7.510043855613826e-05, "loss": 0.6628, "mean_token_accuracy": 0.8004560135304928, "num_tokens": 259172249.0, "step": 8120 }, { "entropy": 0.6853430271148682, "epoch": 0.7471837424741663, "grad_norm": 0.1607171893119812, "learning_rate": 7.509737172999664e-05, "loss": 0.6897, "mean_token_accuracy": 0.7959736362099648, "num_tokens": 259204263.0, "step": 8121 }, { "entropy": 0.6943592485040426, "epoch": 0.7472757488456075, "grad_norm": 0.15039412677288055, "learning_rate": 7.509430490385501e-05, "loss": 0.6727, "mean_token_accuracy": 0.7960680723190308, "num_tokens": 259236123.0, "step": 8122 }, { "entropy": 0.7259142706170678, "epoch": 0.7473677552170488, "grad_norm": 0.15020035207271576, "learning_rate": 7.509123807771338e-05, "loss": 0.711, "mean_token_accuracy": 0.7863413281738758, "num_tokens": 259267971.0, "step": 8123 }, { "entropy": 0.7711118664592505, "epoch": 0.74745976158849, "grad_norm": 0.1562512218952179, "learning_rate": 7.508817125157174e-05, "loss": 0.7516, "mean_token_accuracy": 0.7778545208275318, "num_tokens": 259299611.0, "step": 8124 }, { "entropy": 0.6396421398967505, "epoch": 0.7475517679599313, "grad_norm": 0.1627047061920166, "learning_rate": 7.508510442543013e-05, "loss": 0.6204, "mean_token_accuracy": 0.8130744248628616, "num_tokens": 259332222.0, "step": 8125 }, { "entropy": 0.7177404016256332, "epoch": 0.7476437743313724, "grad_norm": 0.15387193858623505, "learning_rate": 7.508203759928851e-05, "loss": 0.7099, "mean_token_accuracy": 0.7916956357657909, "num_tokens": 259364587.0, "step": 8126 }, { "entropy": 0.7154343239963055, "epoch": 0.7477357807028137, "grad_norm": 0.15598678588867188, "learning_rate": 7.507897077314688e-05, "loss": 0.703, "mean_token_accuracy": 0.7937798984348774, "num_tokens": 259396189.0, "step": 8127 }, { "entropy": 0.7844130285084248, "epoch": 0.7478277870742549, "grad_norm": 0.16960446536540985, "learning_rate": 7.507590394700524e-05, "loss": 0.7876, "mean_token_accuracy": 0.7684187963604927, "num_tokens": 259427767.0, "step": 8128 }, { "entropy": 0.8070240598171949, "epoch": 0.7479197934456961, "grad_norm": 0.15786407887935638, "learning_rate": 7.507283712086362e-05, "loss": 0.826, "mean_token_accuracy": 0.7596166245639324, "num_tokens": 259459354.0, "step": 8129 }, { "entropy": 0.7648723665624857, "epoch": 0.7480117998171374, "grad_norm": 0.1556466668844223, "learning_rate": 7.506977029472199e-05, "loss": 0.7575, "mean_token_accuracy": 0.7757137082517147, "num_tokens": 259490890.0, "step": 8130 }, { "entropy": 0.8468314036726952, "epoch": 0.7481038061885785, "grad_norm": 0.1684299260377884, "learning_rate": 7.506670346858037e-05, "loss": 0.85, "mean_token_accuracy": 0.7539239972829819, "num_tokens": 259522112.0, "step": 8131 }, { "entropy": 0.7575648091733456, "epoch": 0.7481958125600198, "grad_norm": 0.1588703840970993, "learning_rate": 7.506363664243874e-05, "loss": 0.7344, "mean_token_accuracy": 0.777477715164423, "num_tokens": 259554133.0, "step": 8132 }, { "entropy": 0.6932330839335918, "epoch": 0.748287818931461, "grad_norm": 0.16398870944976807, "learning_rate": 7.506056981629712e-05, "loss": 0.6801, "mean_token_accuracy": 0.8010055013000965, "num_tokens": 259585677.0, "step": 8133 }, { "entropy": 0.716299258172512, "epoch": 0.7483798253029023, "grad_norm": 0.1555825173854828, "learning_rate": 7.505750299015549e-05, "loss": 0.6967, "mean_token_accuracy": 0.7933918610215187, "num_tokens": 259618016.0, "step": 8134 }, { "entropy": 0.8628173861652613, "epoch": 0.7484718316743435, "grad_norm": 0.15843883156776428, "learning_rate": 7.505443616401386e-05, "loss": 0.8408, "mean_token_accuracy": 0.7538042850792408, "num_tokens": 259650015.0, "step": 8135 }, { "entropy": 0.7312694825232029, "epoch": 0.7485638380457846, "grad_norm": 0.1517000049352646, "learning_rate": 7.505136933787224e-05, "loss": 0.7226, "mean_token_accuracy": 0.7851987443864346, "num_tokens": 259682144.0, "step": 8136 }, { "entropy": 0.7021554093807936, "epoch": 0.7486558444172259, "grad_norm": 0.1586509346961975, "learning_rate": 7.504830251173062e-05, "loss": 0.6802, "mean_token_accuracy": 0.8000686094164848, "num_tokens": 259713950.0, "step": 8137 }, { "entropy": 0.7805796656757593, "epoch": 0.7487478507886671, "grad_norm": 0.1636943370103836, "learning_rate": 7.504523568558899e-05, "loss": 0.7764, "mean_token_accuracy": 0.7721747048199177, "num_tokens": 259746139.0, "step": 8138 }, { "entropy": 0.8571721538901329, "epoch": 0.7488398571601084, "grad_norm": 0.15946200489997864, "learning_rate": 7.504216885944736e-05, "loss": 0.8484, "mean_token_accuracy": 0.757525697350502, "num_tokens": 259777280.0, "step": 8139 }, { "entropy": 0.865317665040493, "epoch": 0.7489318635315496, "grad_norm": 0.16376639902591705, "learning_rate": 7.503910203330573e-05, "loss": 0.8605, "mean_token_accuracy": 0.7500359676778316, "num_tokens": 259809941.0, "step": 8140 }, { "entropy": 0.7168524470180273, "epoch": 0.7490238699029907, "grad_norm": 0.15246321260929108, "learning_rate": 7.50360352071641e-05, "loss": 0.7067, "mean_token_accuracy": 0.7924841865897179, "num_tokens": 259841772.0, "step": 8141 }, { "entropy": 0.73684087023139, "epoch": 0.749115876274432, "grad_norm": 0.15200954675674438, "learning_rate": 7.503296838102249e-05, "loss": 0.7131, "mean_token_accuracy": 0.7905394658446312, "num_tokens": 259873987.0, "step": 8142 }, { "entropy": 0.7072981894016266, "epoch": 0.7492078826458732, "grad_norm": 0.15270838141441345, "learning_rate": 7.502990155488086e-05, "loss": 0.7007, "mean_token_accuracy": 0.7945046313107014, "num_tokens": 259906028.0, "step": 8143 }, { "entropy": 0.7505559772253036, "epoch": 0.7492998890173145, "grad_norm": 0.15338240563869476, "learning_rate": 7.502683472873922e-05, "loss": 0.7404, "mean_token_accuracy": 0.7815869003534317, "num_tokens": 259938244.0, "step": 8144 }, { "entropy": 0.791236974298954, "epoch": 0.7493918953887557, "grad_norm": 0.16219687461853027, "learning_rate": 7.50237679025976e-05, "loss": 0.7683, "mean_token_accuracy": 0.7779770530760288, "num_tokens": 259970699.0, "step": 8145 }, { "entropy": 0.7768952641636133, "epoch": 0.7494839017601969, "grad_norm": 0.15207405388355255, "learning_rate": 7.502070107645597e-05, "loss": 0.7567, "mean_token_accuracy": 0.7748746387660503, "num_tokens": 260002375.0, "step": 8146 }, { "entropy": 0.761058734729886, "epoch": 0.7495759081316381, "grad_norm": 0.15636028349399567, "learning_rate": 7.501763425031435e-05, "loss": 0.7551, "mean_token_accuracy": 0.7784738317131996, "num_tokens": 260034864.0, "step": 8147 }, { "entropy": 0.6940254550427198, "epoch": 0.7496679145030793, "grad_norm": 0.1607494354248047, "learning_rate": 7.501456742417274e-05, "loss": 0.6746, "mean_token_accuracy": 0.805229764431715, "num_tokens": 260066891.0, "step": 8148 }, { "entropy": 0.5877781063318253, "epoch": 0.7497599208745206, "grad_norm": 0.165671244263649, "learning_rate": 7.50115005980311e-05, "loss": 0.5816, "mean_token_accuracy": 0.8223995119333267, "num_tokens": 260099037.0, "step": 8149 }, { "entropy": 0.7518214713782072, "epoch": 0.7498519272459618, "grad_norm": 0.15395142138004303, "learning_rate": 7.500843377188947e-05, "loss": 0.7357, "mean_token_accuracy": 0.7825702764093876, "num_tokens": 260130410.0, "step": 8150 }, { "entropy": 0.7256647404283285, "epoch": 0.749943933617403, "grad_norm": 0.16573216021060944, "learning_rate": 7.500536694574784e-05, "loss": 0.7186, "mean_token_accuracy": 0.7893727868795395, "num_tokens": 260162500.0, "step": 8151 }, { "entropy": 0.6716385390609503, "epoch": 0.7500359399888442, "grad_norm": 0.1532004326581955, "learning_rate": 7.500230011960623e-05, "loss": 0.6822, "mean_token_accuracy": 0.800146572291851, "num_tokens": 260194256.0, "step": 8152 }, { "entropy": 0.7212795987725258, "epoch": 0.7501279463602855, "grad_norm": 0.15752340853214264, "learning_rate": 7.49992332934646e-05, "loss": 0.706, "mean_token_accuracy": 0.78774668648839, "num_tokens": 260226464.0, "step": 8153 }, { "entropy": 0.5704594682902098, "epoch": 0.7502199527317267, "grad_norm": 0.15200984477996826, "learning_rate": 7.499616646732297e-05, "loss": 0.5553, "mean_token_accuracy": 0.835185531526804, "num_tokens": 260258919.0, "step": 8154 }, { "entropy": 0.6271281950175762, "epoch": 0.750311959103168, "grad_norm": 0.15940675139427185, "learning_rate": 7.499309964118134e-05, "loss": 0.619, "mean_token_accuracy": 0.8126987777650356, "num_tokens": 260290788.0, "step": 8155 }, { "entropy": 0.654906889423728, "epoch": 0.7504039654746091, "grad_norm": 0.15506801009178162, "learning_rate": 7.499003281503972e-05, "loss": 0.6501, "mean_token_accuracy": 0.8106148317456245, "num_tokens": 260323340.0, "step": 8156 }, { "entropy": 0.7626913078129292, "epoch": 0.7504959718460503, "grad_norm": 0.15733647346496582, "learning_rate": 7.49869659888981e-05, "loss": 0.771, "mean_token_accuracy": 0.7758265435695648, "num_tokens": 260355368.0, "step": 8157 }, { "entropy": 0.705782238394022, "epoch": 0.7505879782174916, "grad_norm": 0.16183657944202423, "learning_rate": 7.498389916275647e-05, "loss": 0.6988, "mean_token_accuracy": 0.7937086336314678, "num_tokens": 260387635.0, "step": 8158 }, { "entropy": 0.7557651335373521, "epoch": 0.7506799845889328, "grad_norm": 0.14799556136131287, "learning_rate": 7.498083233661484e-05, "loss": 0.745, "mean_token_accuracy": 0.7800781540572643, "num_tokens": 260420235.0, "step": 8159 }, { "entropy": 0.808697147294879, "epoch": 0.7507719909603741, "grad_norm": 0.160725936293602, "learning_rate": 7.497776551047322e-05, "loss": 0.7938, "mean_token_accuracy": 0.7686141096055508, "num_tokens": 260452565.0, "step": 8160 }, { "entropy": 0.7439595954492688, "epoch": 0.7508639973318152, "grad_norm": 0.15518374741077423, "learning_rate": 7.497469868433159e-05, "loss": 0.7222, "mean_token_accuracy": 0.7873161286115646, "num_tokens": 260484248.0, "step": 8161 }, { "entropy": 0.7745867688208818, "epoch": 0.7509560037032564, "grad_norm": 0.15835842490196228, "learning_rate": 7.497163185818997e-05, "loss": 0.7565, "mean_token_accuracy": 0.7708470933139324, "num_tokens": 260515768.0, "step": 8162 }, { "entropy": 0.719865957275033, "epoch": 0.7510480100746977, "grad_norm": 0.1607019156217575, "learning_rate": 7.496856503204834e-05, "loss": 0.7123, "mean_token_accuracy": 0.7936288900673389, "num_tokens": 260547572.0, "step": 8163 }, { "entropy": 0.7498037926852703, "epoch": 0.7511400164461389, "grad_norm": 0.15736305713653564, "learning_rate": 7.496549820590672e-05, "loss": 0.7372, "mean_token_accuracy": 0.7786340452730656, "num_tokens": 260579224.0, "step": 8164 }, { "entropy": 0.7100143749266863, "epoch": 0.7512320228175802, "grad_norm": 0.15127715468406677, "learning_rate": 7.496243137976508e-05, "loss": 0.6912, "mean_token_accuracy": 0.7931430712342262, "num_tokens": 260611245.0, "step": 8165 }, { "entropy": 0.7352777756750584, "epoch": 0.7513240291890213, "grad_norm": 0.15133431553840637, "learning_rate": 7.495936455362345e-05, "loss": 0.7244, "mean_token_accuracy": 0.7867128029465675, "num_tokens": 260643627.0, "step": 8166 }, { "entropy": 0.6755937207490206, "epoch": 0.7514160355604625, "grad_norm": 0.14862285554409027, "learning_rate": 7.495629772748183e-05, "loss": 0.661, "mean_token_accuracy": 0.8028155900537968, "num_tokens": 260676286.0, "step": 8167 }, { "entropy": 0.7321220897138119, "epoch": 0.7515080419319038, "grad_norm": 0.1679999679327011, "learning_rate": 7.495323090134022e-05, "loss": 0.7467, "mean_token_accuracy": 0.7797200083732605, "num_tokens": 260707969.0, "step": 8168 }, { "entropy": 0.6624914836138487, "epoch": 0.751600048303345, "grad_norm": 0.15498585999011993, "learning_rate": 7.495016407519858e-05, "loss": 0.6543, "mean_token_accuracy": 0.8082032464444637, "num_tokens": 260740648.0, "step": 8169 }, { "entropy": 0.6353367976844311, "epoch": 0.7516920546747863, "grad_norm": 0.1652747094631195, "learning_rate": 7.494709724905695e-05, "loss": 0.6281, "mean_token_accuracy": 0.8109821639955044, "num_tokens": 260772732.0, "step": 8170 }, { "entropy": 0.704548922367394, "epoch": 0.7517840610462274, "grad_norm": 0.16201676428318024, "learning_rate": 7.494403042291532e-05, "loss": 0.703, "mean_token_accuracy": 0.7902182415127754, "num_tokens": 260803699.0, "step": 8171 }, { "entropy": 0.7624512538313866, "epoch": 0.7518760674176687, "grad_norm": 0.1571079045534134, "learning_rate": 7.49409635967737e-05, "loss": 0.7396, "mean_token_accuracy": 0.7822989523410797, "num_tokens": 260835697.0, "step": 8172 }, { "entropy": 0.8051909171044827, "epoch": 0.7519680737891099, "grad_norm": 0.16437318921089172, "learning_rate": 7.493789677063208e-05, "loss": 0.7819, "mean_token_accuracy": 0.7690221332013607, "num_tokens": 260867151.0, "step": 8173 }, { "entropy": 0.6807244475930929, "epoch": 0.7520600801605511, "grad_norm": 0.1574520766735077, "learning_rate": 7.493482994449045e-05, "loss": 0.6684, "mean_token_accuracy": 0.7975836619734764, "num_tokens": 260898976.0, "step": 8174 }, { "entropy": 0.8008286450058222, "epoch": 0.7521520865319924, "grad_norm": 0.15357588231563568, "learning_rate": 7.493176311834882e-05, "loss": 0.8001, "mean_token_accuracy": 0.7672271579504013, "num_tokens": 260931354.0, "step": 8175 }, { "entropy": 0.7583520617336035, "epoch": 0.7522440929034335, "grad_norm": 0.15235504508018494, "learning_rate": 7.49286962922072e-05, "loss": 0.7486, "mean_token_accuracy": 0.7772847339510918, "num_tokens": 260963805.0, "step": 8176 }, { "entropy": 0.8241102714091539, "epoch": 0.7523360992748748, "grad_norm": 0.16620345413684845, "learning_rate": 7.492562946606557e-05, "loss": 0.8247, "mean_token_accuracy": 0.7580513507127762, "num_tokens": 260995959.0, "step": 8177 }, { "entropy": 0.7683788016438484, "epoch": 0.752428105646316, "grad_norm": 0.17560122907161713, "learning_rate": 7.492256263992395e-05, "loss": 0.7553, "mean_token_accuracy": 0.7797304391860962, "num_tokens": 261026914.0, "step": 8178 }, { "entropy": 0.5798203386366367, "epoch": 0.7525201120177573, "grad_norm": 0.14537012577056885, "learning_rate": 7.491949581378233e-05, "loss": 0.5491, "mean_token_accuracy": 0.8310942836105824, "num_tokens": 261059682.0, "step": 8179 }, { "entropy": 0.700972156599164, "epoch": 0.7526121183891985, "grad_norm": 0.15300025045871735, "learning_rate": 7.49164289876407e-05, "loss": 0.6934, "mean_token_accuracy": 0.7945052981376648, "num_tokens": 261090680.0, "step": 8180 }, { "entropy": 0.7118259388953447, "epoch": 0.7527041247606396, "grad_norm": 0.15457327663898468, "learning_rate": 7.491336216149907e-05, "loss": 0.6966, "mean_token_accuracy": 0.7910516820847988, "num_tokens": 261123033.0, "step": 8181 }, { "entropy": 0.833488205447793, "epoch": 0.7527961311320809, "grad_norm": 0.15687143802642822, "learning_rate": 7.491029533535743e-05, "loss": 0.8292, "mean_token_accuracy": 0.7570666670799255, "num_tokens": 261154073.0, "step": 8182 }, { "entropy": 0.7915023639798164, "epoch": 0.7528881375035221, "grad_norm": 0.1605619192123413, "learning_rate": 7.490722850921581e-05, "loss": 0.7951, "mean_token_accuracy": 0.7703123278915882, "num_tokens": 261185277.0, "step": 8183 }, { "entropy": 0.6752824895083904, "epoch": 0.7529801438749634, "grad_norm": 0.1528957039117813, "learning_rate": 7.49041616830742e-05, "loss": 0.6541, "mean_token_accuracy": 0.8050530217587948, "num_tokens": 261217470.0, "step": 8184 }, { "entropy": 0.6841637883335352, "epoch": 0.7530721502464046, "grad_norm": 0.15161387622356415, "learning_rate": 7.490109485693256e-05, "loss": 0.6708, "mean_token_accuracy": 0.8002060726284981, "num_tokens": 261249707.0, "step": 8185 }, { "entropy": 0.7354242280125618, "epoch": 0.7531641566178457, "grad_norm": 0.1614283323287964, "learning_rate": 7.489802803079093e-05, "loss": 0.7426, "mean_token_accuracy": 0.780477300286293, "num_tokens": 261281341.0, "step": 8186 }, { "entropy": 0.796094972640276, "epoch": 0.753256162989287, "grad_norm": 0.16440348327159882, "learning_rate": 7.489496120464931e-05, "loss": 0.7939, "mean_token_accuracy": 0.7704532593488693, "num_tokens": 261313176.0, "step": 8187 }, { "entropy": 0.6641734135337174, "epoch": 0.7533481693607282, "grad_norm": 0.16440096497535706, "learning_rate": 7.489189437850768e-05, "loss": 0.6671, "mean_token_accuracy": 0.8028215765953064, "num_tokens": 261345393.0, "step": 8188 }, { "entropy": 0.7380818780511618, "epoch": 0.7534401757321695, "grad_norm": 0.14861905574798584, "learning_rate": 7.488882755236606e-05, "loss": 0.713, "mean_token_accuracy": 0.7873834669589996, "num_tokens": 261377389.0, "step": 8189 }, { "entropy": 0.6921974327415228, "epoch": 0.7535321821036107, "grad_norm": 0.15490610897541046, "learning_rate": 7.488576072622443e-05, "loss": 0.6779, "mean_token_accuracy": 0.7983246371150017, "num_tokens": 261410051.0, "step": 8190 }, { "entropy": 0.6894877022132277, "epoch": 0.7536241884750519, "grad_norm": 0.15635740756988525, "learning_rate": 7.488269390008281e-05, "loss": 0.6669, "mean_token_accuracy": 0.8050928115844727, "num_tokens": 261442390.0, "step": 8191 }, { "entropy": 0.706382516771555, "epoch": 0.7537161948464931, "grad_norm": 0.15374554693698883, "learning_rate": 7.487962707394118e-05, "loss": 0.6936, "mean_token_accuracy": 0.7951792255043983, "num_tokens": 261474314.0, "step": 8192 }, { "entropy": 0.7727990485727787, "epoch": 0.7538082012179343, "grad_norm": 0.15891298651695251, "learning_rate": 7.487656024779955e-05, "loss": 0.7622, "mean_token_accuracy": 0.7765675634145737, "num_tokens": 261506437.0, "step": 8193 }, { "entropy": 0.7824715450406075, "epoch": 0.7539002075893756, "grad_norm": 0.16517873108386993, "learning_rate": 7.487349342165793e-05, "loss": 0.7778, "mean_token_accuracy": 0.7733386419713497, "num_tokens": 261537381.0, "step": 8194 }, { "entropy": 0.7080783788114786, "epoch": 0.7539922139608168, "grad_norm": 0.15313094854354858, "learning_rate": 7.487042659551631e-05, "loss": 0.7119, "mean_token_accuracy": 0.7892317473888397, "num_tokens": 261569747.0, "step": 8195 }, { "entropy": 0.660080211237073, "epoch": 0.754084220332258, "grad_norm": 0.15274693071842194, "learning_rate": 7.486735976937468e-05, "loss": 0.6464, "mean_token_accuracy": 0.803916972130537, "num_tokens": 261601785.0, "step": 8196 }, { "entropy": 0.7246275451034307, "epoch": 0.7541762267036992, "grad_norm": 0.16484051942825317, "learning_rate": 7.486429294323305e-05, "loss": 0.7259, "mean_token_accuracy": 0.7876493521034718, "num_tokens": 261633411.0, "step": 8197 }, { "entropy": 0.6805070443078876, "epoch": 0.7542682330751405, "grad_norm": 0.15904469788074493, "learning_rate": 7.486122611709143e-05, "loss": 0.6733, "mean_token_accuracy": 0.8020042032003403, "num_tokens": 261665624.0, "step": 8198 }, { "entropy": 0.753519942983985, "epoch": 0.7543602394465817, "grad_norm": 0.15709465742111206, "learning_rate": 7.485815929094981e-05, "loss": 0.7352, "mean_token_accuracy": 0.7851568050682545, "num_tokens": 261697312.0, "step": 8199 }, { "entropy": 0.7426989357918501, "epoch": 0.754452245818023, "grad_norm": 0.183659628033638, "learning_rate": 7.485509246480818e-05, "loss": 0.7365, "mean_token_accuracy": 0.7861574292182922, "num_tokens": 261729140.0, "step": 8200 }, { "entropy": 0.6448131706565619, "epoch": 0.7545442521894641, "grad_norm": 0.14870941638946533, "learning_rate": 7.485202563866654e-05, "loss": 0.6346, "mean_token_accuracy": 0.8114809170365334, "num_tokens": 261761026.0, "step": 8201 }, { "entropy": 0.7399176862090826, "epoch": 0.7546362585609053, "grad_norm": 0.15599779784679413, "learning_rate": 7.484895881252491e-05, "loss": 0.731, "mean_token_accuracy": 0.78640441223979, "num_tokens": 261792858.0, "step": 8202 }, { "entropy": 0.6809215173125267, "epoch": 0.7547282649323466, "grad_norm": 0.15540766716003418, "learning_rate": 7.48458919863833e-05, "loss": 0.6708, "mean_token_accuracy": 0.8010811433196068, "num_tokens": 261825214.0, "step": 8203 }, { "entropy": 0.7297811843454838, "epoch": 0.7548202713037878, "grad_norm": 0.15744496881961823, "learning_rate": 7.484282516024168e-05, "loss": 0.7269, "mean_token_accuracy": 0.7868754267692566, "num_tokens": 261857765.0, "step": 8204 }, { "entropy": 0.6819806415587664, "epoch": 0.7549122776752291, "grad_norm": 0.15466612577438354, "learning_rate": 7.483975833410004e-05, "loss": 0.6538, "mean_token_accuracy": 0.8067353963851929, "num_tokens": 261889542.0, "step": 8205 }, { "entropy": 0.7598924599587917, "epoch": 0.7550042840466702, "grad_norm": 0.15165108442306519, "learning_rate": 7.483669150795841e-05, "loss": 0.7603, "mean_token_accuracy": 0.7737213484942913, "num_tokens": 261921837.0, "step": 8206 }, { "entropy": 0.7126630079001188, "epoch": 0.7550962904181114, "grad_norm": 0.15084855258464813, "learning_rate": 7.483362468181679e-05, "loss": 0.6955, "mean_token_accuracy": 0.7913403064012527, "num_tokens": 261954380.0, "step": 8207 }, { "entropy": 0.6328637357801199, "epoch": 0.7551882967895527, "grad_norm": 0.15313968062400818, "learning_rate": 7.483055785567516e-05, "loss": 0.6222, "mean_token_accuracy": 0.8153796195983887, "num_tokens": 261985399.0, "step": 8208 }, { "entropy": 0.6268606930971146, "epoch": 0.7552803031609939, "grad_norm": 0.14737623929977417, "learning_rate": 7.482749102953354e-05, "loss": 0.6074, "mean_token_accuracy": 0.8157814256846905, "num_tokens": 262016787.0, "step": 8209 }, { "entropy": 0.6614891029894352, "epoch": 0.7553723095324352, "grad_norm": 0.15194430947303772, "learning_rate": 7.482442420339192e-05, "loss": 0.6496, "mean_token_accuracy": 0.8074677214026451, "num_tokens": 262048393.0, "step": 8210 }, { "entropy": 0.7158561069518328, "epoch": 0.7554643159038763, "grad_norm": 0.16500596702098846, "learning_rate": 7.482135737725029e-05, "loss": 0.6987, "mean_token_accuracy": 0.7931565903127193, "num_tokens": 262080401.0, "step": 8211 }, { "entropy": 0.7224964424967766, "epoch": 0.7555563222753175, "grad_norm": 0.1551785171031952, "learning_rate": 7.481829055110866e-05, "loss": 0.7095, "mean_token_accuracy": 0.7915256321430206, "num_tokens": 262111596.0, "step": 8212 }, { "entropy": 0.7682050969451666, "epoch": 0.7556483286467588, "grad_norm": 0.15604077279567719, "learning_rate": 7.481522372496703e-05, "loss": 0.7464, "mean_token_accuracy": 0.7791872136294842, "num_tokens": 262142477.0, "step": 8213 }, { "entropy": 0.7908107172697783, "epoch": 0.7557403350182, "grad_norm": 0.1516953855752945, "learning_rate": 7.481215689882541e-05, "loss": 0.7772, "mean_token_accuracy": 0.7702491730451584, "num_tokens": 262174069.0, "step": 8214 }, { "entropy": 0.8287880253046751, "epoch": 0.7558323413896413, "grad_norm": 0.1670948565006256, "learning_rate": 7.480909007268379e-05, "loss": 0.8408, "mean_token_accuracy": 0.752510379999876, "num_tokens": 262206368.0, "step": 8215 }, { "entropy": 0.8625408615916967, "epoch": 0.7559243477610824, "grad_norm": 0.1683575063943863, "learning_rate": 7.480602324654216e-05, "loss": 0.8541, "mean_token_accuracy": 0.7504784017801285, "num_tokens": 262238157.0, "step": 8216 }, { "entropy": 0.6215582769364119, "epoch": 0.7560163541325237, "grad_norm": 0.1479293256998062, "learning_rate": 7.480295642040053e-05, "loss": 0.6062, "mean_token_accuracy": 0.8183351345360279, "num_tokens": 262270645.0, "step": 8217 }, { "entropy": 0.7118756771087646, "epoch": 0.7561083605039649, "grad_norm": 0.15802918374538422, "learning_rate": 7.479988959425891e-05, "loss": 0.7143, "mean_token_accuracy": 0.7851661033928394, "num_tokens": 262302084.0, "step": 8218 }, { "entropy": 0.6988493297249079, "epoch": 0.7562003668754061, "grad_norm": 0.1498042643070221, "learning_rate": 7.479682276811727e-05, "loss": 0.6697, "mean_token_accuracy": 0.7990635484457016, "num_tokens": 262333776.0, "step": 8219 }, { "entropy": 0.7575699770823121, "epoch": 0.7562923732468474, "grad_norm": 0.14928895235061646, "learning_rate": 7.479375594197566e-05, "loss": 0.7487, "mean_token_accuracy": 0.7836466059088707, "num_tokens": 262365805.0, "step": 8220 }, { "entropy": 0.641384856775403, "epoch": 0.7563843796182885, "grad_norm": 0.15321554243564606, "learning_rate": 7.479068911583402e-05, "loss": 0.6247, "mean_token_accuracy": 0.8132530078291893, "num_tokens": 262397380.0, "step": 8221 }, { "entropy": 0.8225880246609449, "epoch": 0.7564763859897298, "grad_norm": 0.17675383388996124, "learning_rate": 7.47876222896924e-05, "loss": 0.8194, "mean_token_accuracy": 0.7577001005411148, "num_tokens": 262428889.0, "step": 8222 }, { "entropy": 0.8032648134976625, "epoch": 0.756568392361171, "grad_norm": 0.16304530203342438, "learning_rate": 7.478455546355077e-05, "loss": 0.8048, "mean_token_accuracy": 0.7689240910112858, "num_tokens": 262461147.0, "step": 8223 }, { "entropy": 0.6944338772445917, "epoch": 0.7566603987326123, "grad_norm": 0.15286129713058472, "learning_rate": 7.478148863740914e-05, "loss": 0.6698, "mean_token_accuracy": 0.8010267689824104, "num_tokens": 262493351.0, "step": 8224 }, { "entropy": 0.8632571995258331, "epoch": 0.7567524051040535, "grad_norm": 0.1684325635433197, "learning_rate": 7.477842181126752e-05, "loss": 0.8585, "mean_token_accuracy": 0.75052360445261, "num_tokens": 262524971.0, "step": 8225 }, { "entropy": 0.8165631741285324, "epoch": 0.7568444114754946, "grad_norm": 0.15757973492145538, "learning_rate": 7.47753549851259e-05, "loss": 0.8025, "mean_token_accuracy": 0.7637781091034412, "num_tokens": 262557177.0, "step": 8226 }, { "entropy": 0.7244785409420729, "epoch": 0.7569364178469359, "grad_norm": 0.15845906734466553, "learning_rate": 7.477228815898427e-05, "loss": 0.704, "mean_token_accuracy": 0.7893138714134693, "num_tokens": 262587738.0, "step": 8227 }, { "entropy": 0.5866013076156378, "epoch": 0.7570284242183771, "grad_norm": 0.1537148356437683, "learning_rate": 7.476922133284264e-05, "loss": 0.5711, "mean_token_accuracy": 0.8287542834877968, "num_tokens": 262620437.0, "step": 8228 }, { "entropy": 0.6251798309385777, "epoch": 0.7571204305898184, "grad_norm": 0.14838430285453796, "learning_rate": 7.476615450670101e-05, "loss": 0.6101, "mean_token_accuracy": 0.8153510019183159, "num_tokens": 262652418.0, "step": 8229 }, { "entropy": 0.8390625156462193, "epoch": 0.7572124369612596, "grad_norm": 0.15559923648834229, "learning_rate": 7.47630876805594e-05, "loss": 0.8091, "mean_token_accuracy": 0.7657324559986591, "num_tokens": 262684670.0, "step": 8230 }, { "entropy": 0.656634408980608, "epoch": 0.7573044433327007, "grad_norm": 0.14747051894664764, "learning_rate": 7.476002085441777e-05, "loss": 0.6396, "mean_token_accuracy": 0.8105392083525658, "num_tokens": 262716162.0, "step": 8231 }, { "entropy": 0.7738148588687181, "epoch": 0.757396449704142, "grad_norm": 0.15811821818351746, "learning_rate": 7.475695402827614e-05, "loss": 0.7725, "mean_token_accuracy": 0.7739506289362907, "num_tokens": 262747369.0, "step": 8232 }, { "entropy": 0.803223755210638, "epoch": 0.7574884560755832, "grad_norm": 0.15423259139060974, "learning_rate": 7.47538872021345e-05, "loss": 0.807, "mean_token_accuracy": 0.7603829652070999, "num_tokens": 262779886.0, "step": 8233 }, { "entropy": 0.8037503100931644, "epoch": 0.7575804624470245, "grad_norm": 0.15880978107452393, "learning_rate": 7.475082037599289e-05, "loss": 0.8331, "mean_token_accuracy": 0.7577344067394733, "num_tokens": 262812256.0, "step": 8234 }, { "entropy": 0.6305478252470493, "epoch": 0.7576724688184657, "grad_norm": 0.14847566187381744, "learning_rate": 7.474775354985127e-05, "loss": 0.6116, "mean_token_accuracy": 0.8217657208442688, "num_tokens": 262844697.0, "step": 8235 }, { "entropy": 0.6503655333071947, "epoch": 0.7577644751899069, "grad_norm": 0.15296663343906403, "learning_rate": 7.474468672370964e-05, "loss": 0.6443, "mean_token_accuracy": 0.8087447956204414, "num_tokens": 262876776.0, "step": 8236 }, { "entropy": 0.5900165317580104, "epoch": 0.7578564815613481, "grad_norm": 0.1531151533126831, "learning_rate": 7.474161989756802e-05, "loss": 0.5794, "mean_token_accuracy": 0.825041726231575, "num_tokens": 262908649.0, "step": 8237 }, { "entropy": 0.6174322310835123, "epoch": 0.7579484879327893, "grad_norm": 0.14951221644878387, "learning_rate": 7.473855307142639e-05, "loss": 0.6135, "mean_token_accuracy": 0.8183983340859413, "num_tokens": 262939866.0, "step": 8238 }, { "entropy": 0.7011986877769232, "epoch": 0.7580404943042306, "grad_norm": 0.1568177193403244, "learning_rate": 7.473548624528475e-05, "loss": 0.69, "mean_token_accuracy": 0.7979583665728569, "num_tokens": 262970936.0, "step": 8239 }, { "entropy": 0.7116019409149885, "epoch": 0.7581325006756718, "grad_norm": 0.15777753293514252, "learning_rate": 7.473241941914314e-05, "loss": 0.6898, "mean_token_accuracy": 0.7889729104936123, "num_tokens": 263001568.0, "step": 8240 }, { "entropy": 0.6978958565741777, "epoch": 0.758224507047113, "grad_norm": 0.15341345965862274, "learning_rate": 7.472935259300152e-05, "loss": 0.6746, "mean_token_accuracy": 0.7986459918320179, "num_tokens": 263034102.0, "step": 8241 }, { "entropy": 0.7310754209756851, "epoch": 0.7583165134185542, "grad_norm": 0.16287925839424133, "learning_rate": 7.472628576685988e-05, "loss": 0.7344, "mean_token_accuracy": 0.7872771918773651, "num_tokens": 263066311.0, "step": 8242 }, { "entropy": 0.7436950039118528, "epoch": 0.7584085197899955, "grad_norm": 0.1499532014131546, "learning_rate": 7.472321894071825e-05, "loss": 0.7153, "mean_token_accuracy": 0.7900819964706898, "num_tokens": 263097782.0, "step": 8243 }, { "entropy": 0.7081038653850555, "epoch": 0.7585005261614367, "grad_norm": 0.15753324329853058, "learning_rate": 7.472015211457662e-05, "loss": 0.6829, "mean_token_accuracy": 0.7988395839929581, "num_tokens": 263129743.0, "step": 8244 }, { "entropy": 0.7242036946117878, "epoch": 0.758592532532878, "grad_norm": 0.16255426406860352, "learning_rate": 7.4717085288435e-05, "loss": 0.7077, "mean_token_accuracy": 0.793377261608839, "num_tokens": 263161412.0, "step": 8245 }, { "entropy": 0.8192476816475391, "epoch": 0.7586845389043191, "grad_norm": 0.15719883143901825, "learning_rate": 7.471401846229338e-05, "loss": 0.8006, "mean_token_accuracy": 0.7623475417494774, "num_tokens": 263193249.0, "step": 8246 }, { "entropy": 0.7637277990579605, "epoch": 0.7587765452757603, "grad_norm": 0.15801171958446503, "learning_rate": 7.471095163615175e-05, "loss": 0.7644, "mean_token_accuracy": 0.7764206156134605, "num_tokens": 263225482.0, "step": 8247 }, { "entropy": 0.6744451876729727, "epoch": 0.7588685516472016, "grad_norm": 0.15485665202140808, "learning_rate": 7.470788481001012e-05, "loss": 0.6563, "mean_token_accuracy": 0.801769319921732, "num_tokens": 263257502.0, "step": 8248 }, { "entropy": 0.7247594557702541, "epoch": 0.7589605580186428, "grad_norm": 0.1554083377122879, "learning_rate": 7.47048179838685e-05, "loss": 0.6939, "mean_token_accuracy": 0.7959292270243168, "num_tokens": 263289444.0, "step": 8249 }, { "entropy": 0.7253250889480114, "epoch": 0.7590525643900841, "grad_norm": 0.16171443462371826, "learning_rate": 7.470175115772687e-05, "loss": 0.731, "mean_token_accuracy": 0.7828046567738056, "num_tokens": 263321432.0, "step": 8250 }, { "entropy": 0.7364598736166954, "epoch": 0.7591445707615252, "grad_norm": 0.1516440361738205, "learning_rate": 7.469868433158525e-05, "loss": 0.7286, "mean_token_accuracy": 0.7803388312458992, "num_tokens": 263353091.0, "step": 8251 }, { "entropy": 0.7685550004243851, "epoch": 0.7592365771329664, "grad_norm": 0.1569109857082367, "learning_rate": 7.469561750544362e-05, "loss": 0.7551, "mean_token_accuracy": 0.7795202918350697, "num_tokens": 263383260.0, "step": 8252 }, { "entropy": 0.6977321524173021, "epoch": 0.7593285835044077, "grad_norm": 0.15398943424224854, "learning_rate": 7.4692550679302e-05, "loss": 0.6776, "mean_token_accuracy": 0.7939479127526283, "num_tokens": 263414642.0, "step": 8253 }, { "entropy": 0.5905602443963289, "epoch": 0.7594205898758489, "grad_norm": 0.17606808245182037, "learning_rate": 7.468948385316037e-05, "loss": 0.578, "mean_token_accuracy": 0.8256075158715248, "num_tokens": 263446628.0, "step": 8254 }, { "entropy": 0.670077913440764, "epoch": 0.7595125962472902, "grad_norm": 0.14777334034442902, "learning_rate": 7.468641702701874e-05, "loss": 0.6567, "mean_token_accuracy": 0.8057082071900368, "num_tokens": 263479391.0, "step": 8255 }, { "entropy": 0.6906910687685013, "epoch": 0.7596046026187313, "grad_norm": 0.15583226084709167, "learning_rate": 7.468335020087712e-05, "loss": 0.6918, "mean_token_accuracy": 0.7932366840541363, "num_tokens": 263511175.0, "step": 8256 }, { "entropy": 0.8440969791263342, "epoch": 0.7596966089901726, "grad_norm": 0.16678713262081146, "learning_rate": 7.46802833747355e-05, "loss": 0.8379, "mean_token_accuracy": 0.7583108358085155, "num_tokens": 263543022.0, "step": 8257 }, { "entropy": 0.7866516038775444, "epoch": 0.7597886153616138, "grad_norm": 0.15734367072582245, "learning_rate": 7.467721654859387e-05, "loss": 0.7743, "mean_token_accuracy": 0.775739099830389, "num_tokens": 263574614.0, "step": 8258 }, { "entropy": 0.7567582465708256, "epoch": 0.759880621733055, "grad_norm": 0.15461865067481995, "learning_rate": 7.467414972245223e-05, "loss": 0.7291, "mean_token_accuracy": 0.7880417332053185, "num_tokens": 263606884.0, "step": 8259 }, { "entropy": 0.7718980945646763, "epoch": 0.7599726281044963, "grad_norm": 0.1584007889032364, "learning_rate": 7.46710828963106e-05, "loss": 0.7451, "mean_token_accuracy": 0.7780902795493603, "num_tokens": 263639502.0, "step": 8260 }, { "entropy": 0.7617189045995474, "epoch": 0.7600646344759374, "grad_norm": 0.15751011669635773, "learning_rate": 7.466801607016898e-05, "loss": 0.7455, "mean_token_accuracy": 0.7796768806874752, "num_tokens": 263671409.0, "step": 8261 }, { "entropy": 0.7474177200347185, "epoch": 0.7601566408473787, "grad_norm": 0.156929150223732, "learning_rate": 7.466494924402736e-05, "loss": 0.7388, "mean_token_accuracy": 0.7842720039188862, "num_tokens": 263703444.0, "step": 8262 }, { "entropy": 0.7766599059104919, "epoch": 0.7602486472188199, "grad_norm": 0.15569151937961578, "learning_rate": 7.466188241788573e-05, "loss": 0.7757, "mean_token_accuracy": 0.7710894010961056, "num_tokens": 263735281.0, "step": 8263 }, { "entropy": 0.7847089245915413, "epoch": 0.7603406535902612, "grad_norm": 0.16274261474609375, "learning_rate": 7.46588155917441e-05, "loss": 0.7703, "mean_token_accuracy": 0.7735401540994644, "num_tokens": 263766981.0, "step": 8264 }, { "entropy": 0.78558149933815, "epoch": 0.7604326599617024, "grad_norm": 0.1562548279762268, "learning_rate": 7.465574876560248e-05, "loss": 0.7838, "mean_token_accuracy": 0.7685136273503304, "num_tokens": 263798860.0, "step": 8265 }, { "entropy": 0.7063761539757252, "epoch": 0.7605246663331435, "grad_norm": 0.163660928606987, "learning_rate": 7.465268193946085e-05, "loss": 0.7141, "mean_token_accuracy": 0.7890478894114494, "num_tokens": 263831369.0, "step": 8266 }, { "entropy": 0.7355092484503984, "epoch": 0.7606166727045848, "grad_norm": 0.16625136137008667, "learning_rate": 7.464961511331923e-05, "loss": 0.7193, "mean_token_accuracy": 0.7888473942875862, "num_tokens": 263862820.0, "step": 8267 }, { "entropy": 0.6950621958822012, "epoch": 0.760708679076026, "grad_norm": 0.15458062291145325, "learning_rate": 7.464654828717761e-05, "loss": 0.6894, "mean_token_accuracy": 0.7909035906195641, "num_tokens": 263893995.0, "step": 8268 }, { "entropy": 0.7436295356601477, "epoch": 0.7608006854474673, "grad_norm": 0.15227586030960083, "learning_rate": 7.464348146103598e-05, "loss": 0.7264, "mean_token_accuracy": 0.7826791629195213, "num_tokens": 263925824.0, "step": 8269 }, { "entropy": 0.6037277914583683, "epoch": 0.7608926918189085, "grad_norm": 0.16530683636665344, "learning_rate": 7.464041463489435e-05, "loss": 0.591, "mean_token_accuracy": 0.8225298039615154, "num_tokens": 263957478.0, "step": 8270 }, { "entropy": 0.750943218357861, "epoch": 0.7609846981903496, "grad_norm": 0.16408447921276093, "learning_rate": 7.463734780875272e-05, "loss": 0.7589, "mean_token_accuracy": 0.7771908864378929, "num_tokens": 263989515.0, "step": 8271 }, { "entropy": 0.639009727165103, "epoch": 0.7610767045617909, "grad_norm": 0.14876317977905273, "learning_rate": 7.463428098261111e-05, "loss": 0.6329, "mean_token_accuracy": 0.8095829300582409, "num_tokens": 264022100.0, "step": 8272 }, { "entropy": 0.7378125004470348, "epoch": 0.7611687109332321, "grad_norm": 0.15150406956672668, "learning_rate": 7.463121415646948e-05, "loss": 0.73, "mean_token_accuracy": 0.7849761582911015, "num_tokens": 264054603.0, "step": 8273 }, { "entropy": 0.7756543280556798, "epoch": 0.7612607173046734, "grad_norm": 0.16021934151649475, "learning_rate": 7.462814733032785e-05, "loss": 0.7553, "mean_token_accuracy": 0.7798147089779377, "num_tokens": 264086681.0, "step": 8274 }, { "entropy": 0.6968152038753033, "epoch": 0.7613527236761146, "grad_norm": 0.15896163880825043, "learning_rate": 7.462508050418621e-05, "loss": 0.6831, "mean_token_accuracy": 0.7991580292582512, "num_tokens": 264118858.0, "step": 8275 }, { "entropy": 0.6914545213803649, "epoch": 0.7614447300475558, "grad_norm": 0.1503048688173294, "learning_rate": 7.46220136780446e-05, "loss": 0.6762, "mean_token_accuracy": 0.8039382323622704, "num_tokens": 264151189.0, "step": 8276 }, { "entropy": 0.6963470783084631, "epoch": 0.761536736418997, "grad_norm": 0.15550266206264496, "learning_rate": 7.461894685190298e-05, "loss": 0.6979, "mean_token_accuracy": 0.7914805263280869, "num_tokens": 264183024.0, "step": 8277 }, { "entropy": 0.7470954842865467, "epoch": 0.7616287427904382, "grad_norm": 0.15412570536136627, "learning_rate": 7.461588002576135e-05, "loss": 0.7306, "mean_token_accuracy": 0.7844413183629513, "num_tokens": 264215367.0, "step": 8278 }, { "entropy": 0.8689124509692192, "epoch": 0.7617207491618795, "grad_norm": 0.15983857214450836, "learning_rate": 7.461281319961971e-05, "loss": 0.87, "mean_token_accuracy": 0.7466276660561562, "num_tokens": 264246734.0, "step": 8279 }, { "entropy": 0.6990936677902937, "epoch": 0.7618127555333207, "grad_norm": 0.158482164144516, "learning_rate": 7.46097463734781e-05, "loss": 0.6924, "mean_token_accuracy": 0.7996118627488613, "num_tokens": 264278451.0, "step": 8280 }, { "entropy": 0.7726360410451889, "epoch": 0.7619047619047619, "grad_norm": 0.16712352633476257, "learning_rate": 7.460667954733646e-05, "loss": 0.7702, "mean_token_accuracy": 0.7735984064638615, "num_tokens": 264310405.0, "step": 8281 }, { "entropy": 0.7697792127728462, "epoch": 0.7619967682762031, "grad_norm": 0.16427171230316162, "learning_rate": 7.460361272119484e-05, "loss": 0.7543, "mean_token_accuracy": 0.7747297063469887, "num_tokens": 264341294.0, "step": 8282 }, { "entropy": 0.6959984041750431, "epoch": 0.7620887746476444, "grad_norm": 0.1569182425737381, "learning_rate": 7.460054589505321e-05, "loss": 0.675, "mean_token_accuracy": 0.803982499986887, "num_tokens": 264373318.0, "step": 8283 }, { "entropy": 0.6800618460401893, "epoch": 0.7621807810190856, "grad_norm": 0.17077399790287018, "learning_rate": 7.459747906891159e-05, "loss": 0.6878, "mean_token_accuracy": 0.803446140140295, "num_tokens": 264405818.0, "step": 8284 }, { "entropy": 0.8083992665633559, "epoch": 0.7622727873905268, "grad_norm": 0.1587560623884201, "learning_rate": 7.459441224276996e-05, "loss": 0.8022, "mean_token_accuracy": 0.7620429247617722, "num_tokens": 264437758.0, "step": 8285 }, { "entropy": 0.7558662556111813, "epoch": 0.762364793761968, "grad_norm": 0.15366318821907043, "learning_rate": 7.459134541662833e-05, "loss": 0.7329, "mean_token_accuracy": 0.7808988317847252, "num_tokens": 264469018.0, "step": 8286 }, { "entropy": 0.6517755035310984, "epoch": 0.7624568001334092, "grad_norm": 0.15608789026737213, "learning_rate": 7.458827859048671e-05, "loss": 0.6334, "mean_token_accuracy": 0.8115746863186359, "num_tokens": 264500928.0, "step": 8287 }, { "entropy": 0.7447854783385992, "epoch": 0.7625488065048505, "grad_norm": 0.15510402619838715, "learning_rate": 7.458521176434509e-05, "loss": 0.7295, "mean_token_accuracy": 0.7839227356016636, "num_tokens": 264533184.0, "step": 8288 }, { "entropy": 0.6868742052465677, "epoch": 0.7626408128762917, "grad_norm": 0.15337343513965607, "learning_rate": 7.458214493820346e-05, "loss": 0.6734, "mean_token_accuracy": 0.8017899505794048, "num_tokens": 264564562.0, "step": 8289 }, { "entropy": 0.7096063271164894, "epoch": 0.762732819247733, "grad_norm": 0.1524781882762909, "learning_rate": 7.457907811206183e-05, "loss": 0.706, "mean_token_accuracy": 0.7920904979109764, "num_tokens": 264597227.0, "step": 8290 }, { "entropy": 0.761906323954463, "epoch": 0.7628248256191741, "grad_norm": 0.15810203552246094, "learning_rate": 7.45760112859202e-05, "loss": 0.7669, "mean_token_accuracy": 0.7728266157209873, "num_tokens": 264628496.0, "step": 8291 }, { "entropy": 0.7340310327708721, "epoch": 0.7629168319906153, "grad_norm": 0.1584690362215042, "learning_rate": 7.457294445977858e-05, "loss": 0.729, "mean_token_accuracy": 0.7859839536249638, "num_tokens": 264660395.0, "step": 8292 }, { "entropy": 0.7026560846716166, "epoch": 0.7630088383620566, "grad_norm": 0.1526041179895401, "learning_rate": 7.456987763363696e-05, "loss": 0.6894, "mean_token_accuracy": 0.7933261133730412, "num_tokens": 264691737.0, "step": 8293 }, { "entropy": 0.7341436576098204, "epoch": 0.7631008447334978, "grad_norm": 0.1534333974123001, "learning_rate": 7.456681080749533e-05, "loss": 0.7203, "mean_token_accuracy": 0.7886669859290123, "num_tokens": 264724035.0, "step": 8294 }, { "entropy": 0.793075580149889, "epoch": 0.7631928511049391, "grad_norm": 0.16162048280239105, "learning_rate": 7.45637439813537e-05, "loss": 0.7953, "mean_token_accuracy": 0.7691131271421909, "num_tokens": 264755889.0, "step": 8295 }, { "entropy": 0.6894465573132038, "epoch": 0.7632848574763802, "grad_norm": 0.14746391773223877, "learning_rate": 7.456067715521208e-05, "loss": 0.6772, "mean_token_accuracy": 0.7981124445796013, "num_tokens": 264787166.0, "step": 8296 }, { "entropy": 0.7581575121730566, "epoch": 0.7633768638478214, "grad_norm": 0.15795835852622986, "learning_rate": 7.455761032907044e-05, "loss": 0.7521, "mean_token_accuracy": 0.7722776420414448, "num_tokens": 264818599.0, "step": 8297 }, { "entropy": 0.7230536099523306, "epoch": 0.7634688702192627, "grad_norm": 0.1462787538766861, "learning_rate": 7.455454350292882e-05, "loss": 0.7074, "mean_token_accuracy": 0.7945027574896812, "num_tokens": 264850169.0, "step": 8298 }, { "entropy": 0.7204119320958853, "epoch": 0.7635608765907039, "grad_norm": 0.15022489428520203, "learning_rate": 7.45514766767872e-05, "loss": 0.6927, "mean_token_accuracy": 0.7934125401079655, "num_tokens": 264882048.0, "step": 8299 }, { "entropy": 0.7572776861488819, "epoch": 0.7636528829621452, "grad_norm": 0.15648382902145386, "learning_rate": 7.454840985064557e-05, "loss": 0.7345, "mean_token_accuracy": 0.7839141748845577, "num_tokens": 264913664.0, "step": 8300 }, { "entropy": 0.6772344037890434, "epoch": 0.7637448893335863, "grad_norm": 0.16265250742435455, "learning_rate": 7.454534302450394e-05, "loss": 0.6606, "mean_token_accuracy": 0.8019225373864174, "num_tokens": 264945388.0, "step": 8301 }, { "entropy": 0.8146530501544476, "epoch": 0.7638368957050276, "grad_norm": 0.15871009230613708, "learning_rate": 7.454227619836231e-05, "loss": 0.8034, "mean_token_accuracy": 0.7633884027600288, "num_tokens": 264977175.0, "step": 8302 }, { "entropy": 0.6485998667776585, "epoch": 0.7639289020764688, "grad_norm": 0.16182856261730194, "learning_rate": 7.453920937222069e-05, "loss": 0.65, "mean_token_accuracy": 0.8045965768396854, "num_tokens": 265008517.0, "step": 8303 }, { "entropy": 0.7152379062026739, "epoch": 0.76402090844791, "grad_norm": 0.16234590113162994, "learning_rate": 7.453614254607907e-05, "loss": 0.7162, "mean_token_accuracy": 0.7890022806823254, "num_tokens": 265040098.0, "step": 8304 }, { "entropy": 0.6008580750785768, "epoch": 0.7641129148193513, "grad_norm": 0.15087386965751648, "learning_rate": 7.453307571993744e-05, "loss": 0.5929, "mean_token_accuracy": 0.8261102475225925, "num_tokens": 265072122.0, "step": 8305 }, { "entropy": 0.8285437822341919, "epoch": 0.7642049211907924, "grad_norm": 0.16193880140781403, "learning_rate": 7.453000889379581e-05, "loss": 0.833, "mean_token_accuracy": 0.7554953992366791, "num_tokens": 265103621.0, "step": 8306 }, { "entropy": 0.7091429531574249, "epoch": 0.7642969275622337, "grad_norm": 0.1662285178899765, "learning_rate": 7.452694206765419e-05, "loss": 0.7187, "mean_token_accuracy": 0.7910330705344677, "num_tokens": 265135452.0, "step": 8307 }, { "entropy": 0.6649100165814161, "epoch": 0.7643889339336749, "grad_norm": 0.16125935316085815, "learning_rate": 7.452387524151256e-05, "loss": 0.6646, "mean_token_accuracy": 0.7997456677258015, "num_tokens": 265167776.0, "step": 8308 }, { "entropy": 0.6712693544104695, "epoch": 0.7644809403051162, "grad_norm": 0.16077309846878052, "learning_rate": 7.452080841537094e-05, "loss": 0.6771, "mean_token_accuracy": 0.7983238250017166, "num_tokens": 265199123.0, "step": 8309 }, { "entropy": 0.7733059264719486, "epoch": 0.7645729466765574, "grad_norm": 0.153147354722023, "learning_rate": 7.451774158922931e-05, "loss": 0.7645, "mean_token_accuracy": 0.7761630080640316, "num_tokens": 265231345.0, "step": 8310 }, { "entropy": 0.7287110639736056, "epoch": 0.7646649530479985, "grad_norm": 0.15086954832077026, "learning_rate": 7.451467476308769e-05, "loss": 0.7279, "mean_token_accuracy": 0.7849809750914574, "num_tokens": 265263948.0, "step": 8311 }, { "entropy": 0.7554072607308626, "epoch": 0.7647569594194398, "grad_norm": 0.1535101979970932, "learning_rate": 7.451160793694606e-05, "loss": 0.7408, "mean_token_accuracy": 0.7762155570089817, "num_tokens": 265295731.0, "step": 8312 }, { "entropy": 0.7793130874633789, "epoch": 0.764848965790881, "grad_norm": 0.15311850607395172, "learning_rate": 7.450854111080442e-05, "loss": 0.7696, "mean_token_accuracy": 0.7743230275809765, "num_tokens": 265327853.0, "step": 8313 }, { "entropy": 0.8236570004373789, "epoch": 0.7649409721623223, "grad_norm": 0.15331685543060303, "learning_rate": 7.45054742846628e-05, "loss": 0.7977, "mean_token_accuracy": 0.7642853520810604, "num_tokens": 265359823.0, "step": 8314 }, { "entropy": 0.74894754961133, "epoch": 0.7650329785337635, "grad_norm": 0.1519385278224945, "learning_rate": 7.450240745852119e-05, "loss": 0.7419, "mean_token_accuracy": 0.7884279116988182, "num_tokens": 265391971.0, "step": 8315 }, { "entropy": 0.7658929079771042, "epoch": 0.7651249849052046, "grad_norm": 0.16059580445289612, "learning_rate": 7.449934063237955e-05, "loss": 0.7549, "mean_token_accuracy": 0.7786662168800831, "num_tokens": 265423533.0, "step": 8316 }, { "entropy": 0.7219445053488016, "epoch": 0.7652169912766459, "grad_norm": 0.14958974719047546, "learning_rate": 7.449627380623792e-05, "loss": 0.7001, "mean_token_accuracy": 0.7941040061414242, "num_tokens": 265455895.0, "step": 8317 }, { "entropy": 0.7200271487236023, "epoch": 0.7653089976480871, "grad_norm": 0.14959660172462463, "learning_rate": 7.44932069800963e-05, "loss": 0.7113, "mean_token_accuracy": 0.7899212688207626, "num_tokens": 265488379.0, "step": 8318 }, { "entropy": 0.6612376738339663, "epoch": 0.7654010040195284, "grad_norm": 0.1489686220884323, "learning_rate": 7.449014015395469e-05, "loss": 0.6331, "mean_token_accuracy": 0.8106556944549084, "num_tokens": 265520593.0, "step": 8319 }, { "entropy": 0.6178223937749863, "epoch": 0.7654930103909696, "grad_norm": 0.15254203975200653, "learning_rate": 7.448707332781305e-05, "loss": 0.603, "mean_token_accuracy": 0.8209312073886395, "num_tokens": 265552815.0, "step": 8320 }, { "entropy": 0.7546176770702004, "epoch": 0.7655850167624108, "grad_norm": 0.1681319624185562, "learning_rate": 7.448400650167142e-05, "loss": 0.7488, "mean_token_accuracy": 0.7782829254865646, "num_tokens": 265583962.0, "step": 8321 }, { "entropy": 0.8568318076431751, "epoch": 0.765677023133852, "grad_norm": 0.16100016236305237, "learning_rate": 7.448093967552979e-05, "loss": 0.8627, "mean_token_accuracy": 0.7485143207013607, "num_tokens": 265616052.0, "step": 8322 }, { "entropy": 0.7068897411227226, "epoch": 0.7657690295052932, "grad_norm": 0.15858453512191772, "learning_rate": 7.447787284938817e-05, "loss": 0.6946, "mean_token_accuracy": 0.7954084575176239, "num_tokens": 265648322.0, "step": 8323 }, { "entropy": 0.8316314201802015, "epoch": 0.7658610358767345, "grad_norm": 0.15685518085956573, "learning_rate": 7.447480602324655e-05, "loss": 0.8139, "mean_token_accuracy": 0.7644484080374241, "num_tokens": 265680390.0, "step": 8324 }, { "entropy": 0.634011322632432, "epoch": 0.7659530422481757, "grad_norm": 0.15188267827033997, "learning_rate": 7.447173919710492e-05, "loss": 0.6146, "mean_token_accuracy": 0.8134104609489441, "num_tokens": 265712533.0, "step": 8325 }, { "entropy": 0.7080543898046017, "epoch": 0.7660450486196169, "grad_norm": 0.1555669903755188, "learning_rate": 7.446867237096329e-05, "loss": 0.7087, "mean_token_accuracy": 0.7920771203935146, "num_tokens": 265744961.0, "step": 8326 }, { "entropy": 0.6251947097480297, "epoch": 0.7661370549910581, "grad_norm": 0.15106333792209625, "learning_rate": 7.446560554482167e-05, "loss": 0.6039, "mean_token_accuracy": 0.8190983347594738, "num_tokens": 265777597.0, "step": 8327 }, { "entropy": 0.6958227697759867, "epoch": 0.7662290613624994, "grad_norm": 0.1474580019712448, "learning_rate": 7.446253871868004e-05, "loss": 0.6848, "mean_token_accuracy": 0.7982716336846352, "num_tokens": 265809552.0, "step": 8328 }, { "entropy": 0.6936463639140129, "epoch": 0.7663210677339406, "grad_norm": 0.15931807458400726, "learning_rate": 7.445947189253842e-05, "loss": 0.6738, "mean_token_accuracy": 0.7984092831611633, "num_tokens": 265841604.0, "step": 8329 }, { "entropy": 0.7399959284812212, "epoch": 0.7664130741053818, "grad_norm": 0.15329481661319733, "learning_rate": 7.44564050663968e-05, "loss": 0.7547, "mean_token_accuracy": 0.7796805612742901, "num_tokens": 265874136.0, "step": 8330 }, { "entropy": 0.830005094408989, "epoch": 0.766505080476823, "grad_norm": 0.157009094953537, "learning_rate": 7.445333824025517e-05, "loss": 0.8389, "mean_token_accuracy": 0.7590945810079575, "num_tokens": 265906262.0, "step": 8331 }, { "entropy": 0.6446575485169888, "epoch": 0.7665970868482642, "grad_norm": 0.15098457038402557, "learning_rate": 7.445027141411354e-05, "loss": 0.6213, "mean_token_accuracy": 0.8141707591712475, "num_tokens": 265937904.0, "step": 8332 }, { "entropy": 0.7695706393569708, "epoch": 0.7666890932197055, "grad_norm": 0.15674686431884766, "learning_rate": 7.44472045879719e-05, "loss": 0.7692, "mean_token_accuracy": 0.7696376219391823, "num_tokens": 265969963.0, "step": 8333 }, { "entropy": 0.7019004449248314, "epoch": 0.7667810995911467, "grad_norm": 0.1583695411682129, "learning_rate": 7.444413776183028e-05, "loss": 0.6833, "mean_token_accuracy": 0.7992760762572289, "num_tokens": 266002485.0, "step": 8334 }, { "entropy": 0.5630377801135182, "epoch": 0.766873105962588, "grad_norm": 0.15089310705661774, "learning_rate": 7.444107093568867e-05, "loss": 0.5631, "mean_token_accuracy": 0.8289602287113667, "num_tokens": 266035223.0, "step": 8335 }, { "entropy": 0.6203255215659738, "epoch": 0.7669651123340291, "grad_norm": 0.1587824523448944, "learning_rate": 7.443800410954703e-05, "loss": 0.609, "mean_token_accuracy": 0.8196348063647747, "num_tokens": 266067636.0, "step": 8336 }, { "entropy": 0.6250579366460443, "epoch": 0.7670571187054703, "grad_norm": 0.1487196385860443, "learning_rate": 7.44349372834054e-05, "loss": 0.6061, "mean_token_accuracy": 0.820033110678196, "num_tokens": 266099552.0, "step": 8337 }, { "entropy": 0.7464414052665234, "epoch": 0.7671491250769116, "grad_norm": 0.1606578826904297, "learning_rate": 7.443187045726378e-05, "loss": 0.724, "mean_token_accuracy": 0.7845488414168358, "num_tokens": 266131726.0, "step": 8338 }, { "entropy": 0.6514873653650284, "epoch": 0.7672411314483528, "grad_norm": 0.15535078942775726, "learning_rate": 7.442880363112215e-05, "loss": 0.631, "mean_token_accuracy": 0.8116038143634796, "num_tokens": 266163447.0, "step": 8339 }, { "entropy": 0.6649088272824883, "epoch": 0.7673331378197941, "grad_norm": 0.14759600162506104, "learning_rate": 7.442573680498053e-05, "loss": 0.6483, "mean_token_accuracy": 0.8098660446703434, "num_tokens": 266195505.0, "step": 8340 }, { "entropy": 0.7976309061050415, "epoch": 0.7674251441912352, "grad_norm": 0.15919998288154602, "learning_rate": 7.44226699788389e-05, "loss": 0.7729, "mean_token_accuracy": 0.7714953981339931, "num_tokens": 266226848.0, "step": 8341 }, { "entropy": 0.7108211982995272, "epoch": 0.7675171505626764, "grad_norm": 0.16107112169265747, "learning_rate": 7.441960315269728e-05, "loss": 0.6914, "mean_token_accuracy": 0.7936585545539856, "num_tokens": 266258153.0, "step": 8342 }, { "entropy": 0.8297690823674202, "epoch": 0.7676091569341177, "grad_norm": 0.15877124667167664, "learning_rate": 7.441653632655565e-05, "loss": 0.8118, "mean_token_accuracy": 0.7593040391802788, "num_tokens": 266290506.0, "step": 8343 }, { "entropy": 0.7665696749463677, "epoch": 0.7677011633055589, "grad_norm": 0.16903752088546753, "learning_rate": 7.441346950041402e-05, "loss": 0.7364, "mean_token_accuracy": 0.7795450948178768, "num_tokens": 266321667.0, "step": 8344 }, { "entropy": 0.7519179452210665, "epoch": 0.7677931696770002, "grad_norm": 0.14469265937805176, "learning_rate": 7.44104026742724e-05, "loss": 0.728, "mean_token_accuracy": 0.7837244234979153, "num_tokens": 266353268.0, "step": 8345 }, { "entropy": 0.7066718228161335, "epoch": 0.7678851760484413, "grad_norm": 0.15169256925582886, "learning_rate": 7.440733584813078e-05, "loss": 0.688, "mean_token_accuracy": 0.7935218997299671, "num_tokens": 266385261.0, "step": 8346 }, { "entropy": 0.779655996710062, "epoch": 0.7679771824198826, "grad_norm": 0.15377488732337952, "learning_rate": 7.440426902198915e-05, "loss": 0.7799, "mean_token_accuracy": 0.7722255364060402, "num_tokens": 266417859.0, "step": 8347 }, { "entropy": 0.7509490475058556, "epoch": 0.7680691887913238, "grad_norm": 0.15091709792613983, "learning_rate": 7.440120219584752e-05, "loss": 0.751, "mean_token_accuracy": 0.7814594320952892, "num_tokens": 266450365.0, "step": 8348 }, { "entropy": 0.8135167676955462, "epoch": 0.768161195162765, "grad_norm": 0.16695556044578552, "learning_rate": 7.439813536970588e-05, "loss": 0.8176, "mean_token_accuracy": 0.7598999068140984, "num_tokens": 266482151.0, "step": 8349 }, { "entropy": 0.7835085056722164, "epoch": 0.7682532015342063, "grad_norm": 0.15918025374412537, "learning_rate": 7.439506854356428e-05, "loss": 0.7923, "mean_token_accuracy": 0.7721270099282265, "num_tokens": 266513903.0, "step": 8350 }, { "entropy": 0.7870461903512478, "epoch": 0.7683452079056474, "grad_norm": 0.1459827423095703, "learning_rate": 7.439200171742265e-05, "loss": 0.7827, "mean_token_accuracy": 0.7675598561763763, "num_tokens": 266546524.0, "step": 8351 }, { "entropy": 0.5834093373268843, "epoch": 0.7684372142770887, "grad_norm": 0.13651293516159058, "learning_rate": 7.438893489128101e-05, "loss": 0.581, "mean_token_accuracy": 0.8257785439491272, "num_tokens": 266578898.0, "step": 8352 }, { "entropy": 0.6438481314107776, "epoch": 0.7685292206485299, "grad_norm": 0.14132794737815857, "learning_rate": 7.438586806513938e-05, "loss": 0.6401, "mean_token_accuracy": 0.8089532516896725, "num_tokens": 266610800.0, "step": 8353 }, { "entropy": 0.8305756729096174, "epoch": 0.7686212270199712, "grad_norm": 0.1588711142539978, "learning_rate": 7.438280123899776e-05, "loss": 0.8219, "mean_token_accuracy": 0.757412564009428, "num_tokens": 266642373.0, "step": 8354 }, { "entropy": 0.7732295971363783, "epoch": 0.7687132333914124, "grad_norm": 0.16805040836334229, "learning_rate": 7.437973441285615e-05, "loss": 0.7728, "mean_token_accuracy": 0.7720735482871532, "num_tokens": 266673354.0, "step": 8355 }, { "entropy": 0.7080164942890406, "epoch": 0.7688052397628535, "grad_norm": 0.14931796491146088, "learning_rate": 7.437666758671451e-05, "loss": 0.699, "mean_token_accuracy": 0.7907474972307682, "num_tokens": 266705478.0, "step": 8356 }, { "entropy": 0.7381488606333733, "epoch": 0.7688972461342948, "grad_norm": 0.15052878856658936, "learning_rate": 7.437360076057288e-05, "loss": 0.7385, "mean_token_accuracy": 0.782787449657917, "num_tokens": 266737040.0, "step": 8357 }, { "entropy": 0.7216777577996254, "epoch": 0.768989252505736, "grad_norm": 0.1579332947731018, "learning_rate": 7.437053393443126e-05, "loss": 0.7003, "mean_token_accuracy": 0.7968901060521603, "num_tokens": 266768511.0, "step": 8358 }, { "entropy": 0.8085314258933067, "epoch": 0.7690812588771773, "grad_norm": 0.15597745776176453, "learning_rate": 7.436746710828963e-05, "loss": 0.7808, "mean_token_accuracy": 0.7711258754134178, "num_tokens": 266799919.0, "step": 8359 }, { "entropy": 0.7236270178109407, "epoch": 0.7691732652486185, "grad_norm": 0.1564657837152481, "learning_rate": 7.436440028214801e-05, "loss": 0.705, "mean_token_accuracy": 0.7913822382688522, "num_tokens": 266831954.0, "step": 8360 }, { "entropy": 0.7879636697471142, "epoch": 0.7692652716200596, "grad_norm": 0.1522190123796463, "learning_rate": 7.43613334560064e-05, "loss": 0.7814, "mean_token_accuracy": 0.768945287913084, "num_tokens": 266863959.0, "step": 8361 }, { "entropy": 0.7010805252939463, "epoch": 0.7693572779915009, "grad_norm": 0.14483608305454254, "learning_rate": 7.435826662986476e-05, "loss": 0.699, "mean_token_accuracy": 0.7925965003669262, "num_tokens": 266896087.0, "step": 8362 }, { "entropy": 0.748110705986619, "epoch": 0.7694492843629421, "grad_norm": 0.15323717892169952, "learning_rate": 7.435519980372313e-05, "loss": 0.7352, "mean_token_accuracy": 0.7839967459440231, "num_tokens": 266928043.0, "step": 8363 }, { "entropy": 0.6732020992785692, "epoch": 0.7695412907343834, "grad_norm": 0.15177102386951447, "learning_rate": 7.43521329775815e-05, "loss": 0.6602, "mean_token_accuracy": 0.8060996830463409, "num_tokens": 266960005.0, "step": 8364 }, { "entropy": 0.7234818544238806, "epoch": 0.7696332971058246, "grad_norm": 0.15801899135112762, "learning_rate": 7.434906615143988e-05, "loss": 0.7106, "mean_token_accuracy": 0.7895690500736237, "num_tokens": 266991870.0, "step": 8365 }, { "entropy": 0.779020631685853, "epoch": 0.7697253034772658, "grad_norm": 0.16592548787593842, "learning_rate": 7.434599932529826e-05, "loss": 0.7829, "mean_token_accuracy": 0.7687381356954575, "num_tokens": 267023807.0, "step": 8366 }, { "entropy": 0.6861949134618044, "epoch": 0.769817309848707, "grad_norm": 0.15504632890224457, "learning_rate": 7.434293249915663e-05, "loss": 0.6841, "mean_token_accuracy": 0.7979201972484589, "num_tokens": 267055371.0, "step": 8367 }, { "entropy": 0.6786569897085428, "epoch": 0.7699093162201482, "grad_norm": 0.1560639888048172, "learning_rate": 7.4339865673015e-05, "loss": 0.6654, "mean_token_accuracy": 0.807722769677639, "num_tokens": 267087630.0, "step": 8368 }, { "entropy": 0.7054673042148352, "epoch": 0.7700013225915895, "grad_norm": 0.1526266485452652, "learning_rate": 7.433679884687338e-05, "loss": 0.6861, "mean_token_accuracy": 0.7976271696388721, "num_tokens": 267119933.0, "step": 8369 }, { "entropy": 0.7660769857466221, "epoch": 0.7700933289630307, "grad_norm": 0.20062820613384247, "learning_rate": 7.433373202073175e-05, "loss": 0.8114, "mean_token_accuracy": 0.7715972177684307, "num_tokens": 267151550.0, "step": 8370 }, { "entropy": 0.6571659408509731, "epoch": 0.7701853353344719, "grad_norm": 0.1633276641368866, "learning_rate": 7.433066519459013e-05, "loss": 0.6748, "mean_token_accuracy": 0.8032484017312527, "num_tokens": 267183593.0, "step": 8371 }, { "entropy": 0.6991027807816863, "epoch": 0.7702773417059131, "grad_norm": 0.15211020410060883, "learning_rate": 7.43275983684485e-05, "loss": 0.6706, "mean_token_accuracy": 0.8042386770248413, "num_tokens": 267215480.0, "step": 8372 }, { "entropy": 0.7310404051095247, "epoch": 0.7703693480773544, "grad_norm": 0.15456819534301758, "learning_rate": 7.432453154230688e-05, "loss": 0.7127, "mean_token_accuracy": 0.7905169874429703, "num_tokens": 267246530.0, "step": 8373 }, { "entropy": 0.7456795834004879, "epoch": 0.7704613544487956, "grad_norm": 0.1552474945783615, "learning_rate": 7.432146471616524e-05, "loss": 0.7288, "mean_token_accuracy": 0.7899028696119785, "num_tokens": 267278576.0, "step": 8374 }, { "entropy": 0.7615787796676159, "epoch": 0.7705533608202368, "grad_norm": 0.15019753575325012, "learning_rate": 7.431839789002361e-05, "loss": 0.7388, "mean_token_accuracy": 0.7843778878450394, "num_tokens": 267310335.0, "step": 8375 }, { "entropy": 0.7517201546579599, "epoch": 0.770645367191678, "grad_norm": 0.15358158946037292, "learning_rate": 7.431533106388199e-05, "loss": 0.7415, "mean_token_accuracy": 0.7779340818524361, "num_tokens": 267342673.0, "step": 8376 }, { "entropy": 0.6661055218428373, "epoch": 0.7707373735631192, "grad_norm": 0.14881256222724915, "learning_rate": 7.431226423774037e-05, "loss": 0.6434, "mean_token_accuracy": 0.8071583323180676, "num_tokens": 267374591.0, "step": 8377 }, { "entropy": 0.8148208912461996, "epoch": 0.7708293799345605, "grad_norm": 0.16142843663692474, "learning_rate": 7.430919741159874e-05, "loss": 0.8047, "mean_token_accuracy": 0.7666492834687233, "num_tokens": 267406969.0, "step": 8378 }, { "entropy": 0.7178295273333788, "epoch": 0.7709213863060017, "grad_norm": 0.14862293004989624, "learning_rate": 7.430613058545711e-05, "loss": 0.7016, "mean_token_accuracy": 0.7926412411034107, "num_tokens": 267439006.0, "step": 8379 }, { "entropy": 0.7361892033368349, "epoch": 0.771013392677443, "grad_norm": 0.16103537380695343, "learning_rate": 7.430306375931548e-05, "loss": 0.7331, "mean_token_accuracy": 0.7853303216397762, "num_tokens": 267471151.0, "step": 8380 }, { "entropy": 0.7362309396266937, "epoch": 0.7711053990488841, "grad_norm": 0.16253434121608734, "learning_rate": 7.429999693317386e-05, "loss": 0.737, "mean_token_accuracy": 0.7820926532149315, "num_tokens": 267502628.0, "step": 8381 }, { "entropy": 0.839718010276556, "epoch": 0.7711974054203253, "grad_norm": 0.15543538331985474, "learning_rate": 7.429693010703224e-05, "loss": 0.8291, "mean_token_accuracy": 0.7520501725375652, "num_tokens": 267533841.0, "step": 8382 }, { "entropy": 0.6607535053044558, "epoch": 0.7712894117917666, "grad_norm": 0.16534920036792755, "learning_rate": 7.429386328089061e-05, "loss": 0.6536, "mean_token_accuracy": 0.807542085647583, "num_tokens": 267565633.0, "step": 8383 }, { "entropy": 0.6823731195181608, "epoch": 0.7713814181632078, "grad_norm": 0.14687055349349976, "learning_rate": 7.429079645474898e-05, "loss": 0.6638, "mean_token_accuracy": 0.801911935210228, "num_tokens": 267597499.0, "step": 8384 }, { "entropy": 0.7188094612210989, "epoch": 0.7714734245346491, "grad_norm": 0.1645669788122177, "learning_rate": 7.428772962860736e-05, "loss": 0.6995, "mean_token_accuracy": 0.7936580181121826, "num_tokens": 267630006.0, "step": 8385 }, { "entropy": 0.7523933444172144, "epoch": 0.7715654309060902, "grad_norm": 0.1695871204137802, "learning_rate": 7.428466280246573e-05, "loss": 0.7407, "mean_token_accuracy": 0.7835961505770683, "num_tokens": 267661448.0, "step": 8386 }, { "entropy": 0.7812820728868246, "epoch": 0.7716574372775314, "grad_norm": 0.1635599136352539, "learning_rate": 7.428159597632411e-05, "loss": 0.7721, "mean_token_accuracy": 0.7736227586865425, "num_tokens": 267693180.0, "step": 8387 }, { "entropy": 0.7909341994673014, "epoch": 0.7717494436489727, "grad_norm": 0.16374804079532623, "learning_rate": 7.427852915018248e-05, "loss": 0.7878, "mean_token_accuracy": 0.767100241035223, "num_tokens": 267725432.0, "step": 8388 }, { "entropy": 0.781392976641655, "epoch": 0.7718414500204139, "grad_norm": 0.15995852649211884, "learning_rate": 7.427546232404086e-05, "loss": 0.7832, "mean_token_accuracy": 0.7706314921379089, "num_tokens": 267757643.0, "step": 8389 }, { "entropy": 0.6286614276468754, "epoch": 0.7719334563918552, "grad_norm": 0.15534387528896332, "learning_rate": 7.427239549789922e-05, "loss": 0.6389, "mean_token_accuracy": 0.8102282099425793, "num_tokens": 267789423.0, "step": 8390 }, { "entropy": 0.7082630582153797, "epoch": 0.7720254627632963, "grad_norm": 0.1587345004081726, "learning_rate": 7.426932867175759e-05, "loss": 0.6951, "mean_token_accuracy": 0.7956516481935978, "num_tokens": 267821565.0, "step": 8391 }, { "entropy": 0.7853483837097883, "epoch": 0.7721174691347376, "grad_norm": 0.1617041528224945, "learning_rate": 7.426626184561599e-05, "loss": 0.7805, "mean_token_accuracy": 0.7714457102119923, "num_tokens": 267853769.0, "step": 8392 }, { "entropy": 0.7127526625990868, "epoch": 0.7722094755061788, "grad_norm": 0.14588497579097748, "learning_rate": 7.426319501947436e-05, "loss": 0.6954, "mean_token_accuracy": 0.7936808690428734, "num_tokens": 267885232.0, "step": 8393 }, { "entropy": 0.6181660573929548, "epoch": 0.77230148187762, "grad_norm": 0.14580833911895752, "learning_rate": 7.426012819333272e-05, "loss": 0.6007, "mean_token_accuracy": 0.8203944116830826, "num_tokens": 267917069.0, "step": 8394 }, { "entropy": 0.7774047702550888, "epoch": 0.7723934882490613, "grad_norm": 0.17007975280284882, "learning_rate": 7.425706136719109e-05, "loss": 0.7858, "mean_token_accuracy": 0.7729325853288174, "num_tokens": 267948859.0, "step": 8395 }, { "entropy": 0.6570176146924496, "epoch": 0.7724854946205024, "grad_norm": 0.15304981172084808, "learning_rate": 7.425399454104947e-05, "loss": 0.6418, "mean_token_accuracy": 0.811908170580864, "num_tokens": 267980920.0, "step": 8396 }, { "entropy": 0.7374170143157244, "epoch": 0.7725775009919437, "grad_norm": 0.16340811550617218, "learning_rate": 7.425092771490785e-05, "loss": 0.7247, "mean_token_accuracy": 0.7855722308158875, "num_tokens": 268012282.0, "step": 8397 }, { "entropy": 0.7774721495807171, "epoch": 0.7726695073633849, "grad_norm": 0.1516706645488739, "learning_rate": 7.424786088876622e-05, "loss": 0.7771, "mean_token_accuracy": 0.7698515504598618, "num_tokens": 268044643.0, "step": 8398 }, { "entropy": 0.7082904018461704, "epoch": 0.7727615137348262, "grad_norm": 0.15444369614124298, "learning_rate": 7.424479406262459e-05, "loss": 0.6937, "mean_token_accuracy": 0.7902578972280025, "num_tokens": 268076582.0, "step": 8399 }, { "entropy": 0.698989525437355, "epoch": 0.7728535201062674, "grad_norm": 0.16233238577842712, "learning_rate": 7.424172723648297e-05, "loss": 0.6716, "mean_token_accuracy": 0.7985612154006958, "num_tokens": 268108673.0, "step": 8400 }, { "entropy": 0.7437477223575115, "epoch": 0.7729455264777085, "grad_norm": 0.16020254790782928, "learning_rate": 7.423866041034134e-05, "loss": 0.7358, "mean_token_accuracy": 0.7831477522850037, "num_tokens": 268140097.0, "step": 8401 }, { "entropy": 0.6760464897379279, "epoch": 0.7730375328491498, "grad_norm": 0.15099237859249115, "learning_rate": 7.423559358419972e-05, "loss": 0.6643, "mean_token_accuracy": 0.8015177249908447, "num_tokens": 268172578.0, "step": 8402 }, { "entropy": 0.7208482464775443, "epoch": 0.773129539220591, "grad_norm": 0.1616649329662323, "learning_rate": 7.423252675805809e-05, "loss": 0.7097, "mean_token_accuracy": 0.7909321188926697, "num_tokens": 268204554.0, "step": 8403 }, { "entropy": 0.6507297614589334, "epoch": 0.7732215455920323, "grad_norm": 0.14895480871200562, "learning_rate": 7.422945993191647e-05, "loss": 0.6308, "mean_token_accuracy": 0.8121646195650101, "num_tokens": 268237270.0, "step": 8404 }, { "entropy": 0.7136127837002277, "epoch": 0.7733135519634735, "grad_norm": 0.15435150265693665, "learning_rate": 7.422639310577484e-05, "loss": 0.6788, "mean_token_accuracy": 0.7917367406189442, "num_tokens": 268269139.0, "step": 8405 }, { "entropy": 0.7983676381409168, "epoch": 0.7734055583349146, "grad_norm": 0.15589064359664917, "learning_rate": 7.42233262796332e-05, "loss": 0.7876, "mean_token_accuracy": 0.7664480283856392, "num_tokens": 268300641.0, "step": 8406 }, { "entropy": 0.7326412294059992, "epoch": 0.7734975647063559, "grad_norm": 0.15702013671398163, "learning_rate": 7.422025945349159e-05, "loss": 0.7223, "mean_token_accuracy": 0.7930477634072304, "num_tokens": 268332664.0, "step": 8407 }, { "entropy": 0.744467981159687, "epoch": 0.7735895710777971, "grad_norm": 0.1516851782798767, "learning_rate": 7.421719262734997e-05, "loss": 0.7394, "mean_token_accuracy": 0.7802860587835312, "num_tokens": 268364447.0, "step": 8408 }, { "entropy": 0.6528158709406853, "epoch": 0.7736815774492384, "grad_norm": 0.15242217481136322, "learning_rate": 7.421412580120834e-05, "loss": 0.6363, "mean_token_accuracy": 0.8104123063385487, "num_tokens": 268396395.0, "step": 8409 }, { "entropy": 0.8747371733188629, "epoch": 0.7737735838206796, "grad_norm": 0.16340754926204681, "learning_rate": 7.42110589750667e-05, "loss": 0.8649, "mean_token_accuracy": 0.7425920218229294, "num_tokens": 268428219.0, "step": 8410 }, { "entropy": 0.6805642284452915, "epoch": 0.7738655901921208, "grad_norm": 0.15514503419399261, "learning_rate": 7.420799214892507e-05, "loss": 0.6856, "mean_token_accuracy": 0.7941848672926426, "num_tokens": 268460760.0, "step": 8411 }, { "entropy": 0.8018915485590696, "epoch": 0.773957596563562, "grad_norm": 0.17150849103927612, "learning_rate": 7.420492532278345e-05, "loss": 0.8062, "mean_token_accuracy": 0.7656481973826885, "num_tokens": 268492396.0, "step": 8412 }, { "entropy": 0.811549074947834, "epoch": 0.7740496029350032, "grad_norm": 0.16509371995925903, "learning_rate": 7.420185849664183e-05, "loss": 0.8171, "mean_token_accuracy": 0.768900703638792, "num_tokens": 268524137.0, "step": 8413 }, { "entropy": 0.804741969332099, "epoch": 0.7741416093064445, "grad_norm": 0.15574100613594055, "learning_rate": 7.41987916705002e-05, "loss": 0.7892, "mean_token_accuracy": 0.770672045648098, "num_tokens": 268556588.0, "step": 8414 }, { "entropy": 0.6789482589811087, "epoch": 0.7742336156778857, "grad_norm": 0.15257465839385986, "learning_rate": 7.419572484435857e-05, "loss": 0.6697, "mean_token_accuracy": 0.8008944615721703, "num_tokens": 268589336.0, "step": 8415 }, { "entropy": 0.7495875135064125, "epoch": 0.7743256220493269, "grad_norm": 0.15332476794719696, "learning_rate": 7.419265801821695e-05, "loss": 0.7368, "mean_token_accuracy": 0.7812209986150265, "num_tokens": 268621415.0, "step": 8416 }, { "entropy": 0.706055847927928, "epoch": 0.7744176284207681, "grad_norm": 0.16794997453689575, "learning_rate": 7.418959119207532e-05, "loss": 0.6824, "mean_token_accuracy": 0.7991289906203747, "num_tokens": 268652911.0, "step": 8417 }, { "entropy": 0.773205304518342, "epoch": 0.7745096347922094, "grad_norm": 0.1523023396730423, "learning_rate": 7.41865243659337e-05, "loss": 0.7437, "mean_token_accuracy": 0.7784441001713276, "num_tokens": 268684718.0, "step": 8418 }, { "entropy": 0.7247454188764095, "epoch": 0.7746016411636506, "grad_norm": 0.15889571607112885, "learning_rate": 7.418345753979207e-05, "loss": 0.6893, "mean_token_accuracy": 0.7917864210903645, "num_tokens": 268716471.0, "step": 8419 }, { "entropy": 0.6239937506616116, "epoch": 0.7746936475350918, "grad_norm": 0.1607053577899933, "learning_rate": 7.418039071365045e-05, "loss": 0.6058, "mean_token_accuracy": 0.814903263002634, "num_tokens": 268747354.0, "step": 8420 }, { "entropy": 0.8182337768375874, "epoch": 0.774785653906533, "grad_norm": 0.1533818393945694, "learning_rate": 7.417732388750882e-05, "loss": 0.7899, "mean_token_accuracy": 0.7646048963069916, "num_tokens": 268779156.0, "step": 8421 }, { "entropy": 0.676281651481986, "epoch": 0.7748776602779742, "grad_norm": 0.145756334066391, "learning_rate": 7.417425706136719e-05, "loss": 0.6648, "mean_token_accuracy": 0.8038845546543598, "num_tokens": 268811824.0, "step": 8422 }, { "entropy": 0.624363262206316, "epoch": 0.7749696666494155, "grad_norm": 0.15423481166362762, "learning_rate": 7.417119023522557e-05, "loss": 0.6086, "mean_token_accuracy": 0.8195128068327904, "num_tokens": 268844058.0, "step": 8423 }, { "entropy": 0.7527207992970943, "epoch": 0.7750616730208567, "grad_norm": 0.15597715973854065, "learning_rate": 7.416812340908395e-05, "loss": 0.74, "mean_token_accuracy": 0.7835301011800766, "num_tokens": 268875604.0, "step": 8424 }, { "entropy": 0.7664725463837385, "epoch": 0.775153679392298, "grad_norm": 0.15973465144634247, "learning_rate": 7.416505658294232e-05, "loss": 0.7539, "mean_token_accuracy": 0.7776155136525631, "num_tokens": 268908029.0, "step": 8425 }, { "entropy": 0.647901950404048, "epoch": 0.7752456857637391, "grad_norm": 0.15824313461780548, "learning_rate": 7.416198975680068e-05, "loss": 0.6518, "mean_token_accuracy": 0.808040514588356, "num_tokens": 268940459.0, "step": 8426 }, { "entropy": 0.6865790598094463, "epoch": 0.7753376921351803, "grad_norm": 0.15223608911037445, "learning_rate": 7.415892293065907e-05, "loss": 0.6833, "mean_token_accuracy": 0.7954586446285248, "num_tokens": 268973004.0, "step": 8427 }, { "entropy": 0.6617205729708076, "epoch": 0.7754296985066216, "grad_norm": 0.16892513632774353, "learning_rate": 7.415585610451743e-05, "loss": 0.6636, "mean_token_accuracy": 0.8024937957525253, "num_tokens": 269004714.0, "step": 8428 }, { "entropy": 0.6701563904061913, "epoch": 0.7755217048780628, "grad_norm": 0.1651470959186554, "learning_rate": 7.415278927837582e-05, "loss": 0.6755, "mean_token_accuracy": 0.7967627011239529, "num_tokens": 269036436.0, "step": 8429 }, { "entropy": 0.6397349163889885, "epoch": 0.7756137112495041, "grad_norm": 0.1605667620897293, "learning_rate": 7.414972245223418e-05, "loss": 0.6352, "mean_token_accuracy": 0.8115903958678246, "num_tokens": 269069003.0, "step": 8430 }, { "entropy": 0.7480891365557909, "epoch": 0.7757057176209452, "grad_norm": 0.17378509044647217, "learning_rate": 7.414665562609256e-05, "loss": 0.7647, "mean_token_accuracy": 0.7769638188183308, "num_tokens": 269101445.0, "step": 8431 }, { "entropy": 0.6993854241445661, "epoch": 0.7757977239923864, "grad_norm": 0.1493859887123108, "learning_rate": 7.414358879995093e-05, "loss": 0.6987, "mean_token_accuracy": 0.7969317212700844, "num_tokens": 269133741.0, "step": 8432 }, { "entropy": 0.7414909256622195, "epoch": 0.7758897303638277, "grad_norm": 0.15440583229064941, "learning_rate": 7.41405219738093e-05, "loss": 0.7312, "mean_token_accuracy": 0.7865445613861084, "num_tokens": 269165924.0, "step": 8433 }, { "entropy": 0.7491185963153839, "epoch": 0.7759817367352689, "grad_norm": 0.15726524591445923, "learning_rate": 7.413745514766768e-05, "loss": 0.743, "mean_token_accuracy": 0.7796621471643448, "num_tokens": 269197881.0, "step": 8434 }, { "entropy": 0.7120674252510071, "epoch": 0.7760737431067102, "grad_norm": 0.15494239330291748, "learning_rate": 7.413438832152606e-05, "loss": 0.6836, "mean_token_accuracy": 0.7957655601203442, "num_tokens": 269229619.0, "step": 8435 }, { "entropy": 0.7821333706378937, "epoch": 0.7761657494781513, "grad_norm": 0.15843357145786285, "learning_rate": 7.413132149538443e-05, "loss": 0.7732, "mean_token_accuracy": 0.7794236205518246, "num_tokens": 269261485.0, "step": 8436 }, { "entropy": 0.8496836870908737, "epoch": 0.7762577558495926, "grad_norm": 0.16164863109588623, "learning_rate": 7.41282546692428e-05, "loss": 0.8361, "mean_token_accuracy": 0.759065069258213, "num_tokens": 269293162.0, "step": 8437 }, { "entropy": 0.7163041215389967, "epoch": 0.7763497622210338, "grad_norm": 0.15455052256584167, "learning_rate": 7.412518784310118e-05, "loss": 0.6976, "mean_token_accuracy": 0.7955849766731262, "num_tokens": 269324573.0, "step": 8438 }, { "entropy": 0.7603961061686277, "epoch": 0.776441768592475, "grad_norm": 0.14962905645370483, "learning_rate": 7.412212101695956e-05, "loss": 0.7478, "mean_token_accuracy": 0.7774780206382275, "num_tokens": 269356825.0, "step": 8439 }, { "entropy": 0.721658450551331, "epoch": 0.7765337749639163, "grad_norm": 0.15850821137428284, "learning_rate": 7.411905419081793e-05, "loss": 0.7136, "mean_token_accuracy": 0.7853643223643303, "num_tokens": 269388485.0, "step": 8440 }, { "entropy": 0.6860156077891588, "epoch": 0.7766257813353574, "grad_norm": 0.15196369588375092, "learning_rate": 7.41159873646763e-05, "loss": 0.6673, "mean_token_accuracy": 0.8040055260062218, "num_tokens": 269420597.0, "step": 8441 }, { "entropy": 0.7453662604093552, "epoch": 0.7767177877067987, "grad_norm": 0.15306375920772552, "learning_rate": 7.411292053853467e-05, "loss": 0.7273, "mean_token_accuracy": 0.7843505889177322, "num_tokens": 269452246.0, "step": 8442 }, { "entropy": 0.8109282851219177, "epoch": 0.7768097940782399, "grad_norm": 0.1569751352071762, "learning_rate": 7.410985371239305e-05, "loss": 0.7935, "mean_token_accuracy": 0.7694814093410969, "num_tokens": 269484528.0, "step": 8443 }, { "entropy": 0.7253571376204491, "epoch": 0.7769018004496812, "grad_norm": 0.15636396408081055, "learning_rate": 7.410678688625143e-05, "loss": 0.7152, "mean_token_accuracy": 0.7856834307312965, "num_tokens": 269515675.0, "step": 8444 }, { "entropy": 0.7576875127851963, "epoch": 0.7769938068211224, "grad_norm": 0.16931787133216858, "learning_rate": 7.41037200601098e-05, "loss": 0.7682, "mean_token_accuracy": 0.7744540050625801, "num_tokens": 269546952.0, "step": 8445 }, { "entropy": 0.703269524499774, "epoch": 0.7770858131925635, "grad_norm": 0.15099526941776276, "learning_rate": 7.410065323396816e-05, "loss": 0.6956, "mean_token_accuracy": 0.7973133437335491, "num_tokens": 269579619.0, "step": 8446 }, { "entropy": 0.728420639410615, "epoch": 0.7771778195640048, "grad_norm": 0.15892623364925385, "learning_rate": 7.409758640782655e-05, "loss": 0.7059, "mean_token_accuracy": 0.7905838266015053, "num_tokens": 269611800.0, "step": 8447 }, { "entropy": 0.6598333939909935, "epoch": 0.777269825935446, "grad_norm": 0.14920447766780853, "learning_rate": 7.409451958168491e-05, "loss": 0.6568, "mean_token_accuracy": 0.8047174587845802, "num_tokens": 269643835.0, "step": 8448 }, { "entropy": 0.6449388330802321, "epoch": 0.7773618323068873, "grad_norm": 0.14903821051120758, "learning_rate": 7.40914527555433e-05, "loss": 0.6238, "mean_token_accuracy": 0.8118040449917316, "num_tokens": 269676037.0, "step": 8449 }, { "entropy": 0.7799408324062824, "epoch": 0.7774538386783285, "grad_norm": 0.16331203281879425, "learning_rate": 7.408838592940166e-05, "loss": 0.7593, "mean_token_accuracy": 0.7755193933844566, "num_tokens": 269707674.0, "step": 8450 }, { "entropy": 0.6844371100887656, "epoch": 0.7775458450497696, "grad_norm": 0.16319283843040466, "learning_rate": 7.408531910326004e-05, "loss": 0.6512, "mean_token_accuracy": 0.8027563989162445, "num_tokens": 269739513.0, "step": 8451 }, { "entropy": 0.8299889918416739, "epoch": 0.7776378514212109, "grad_norm": 0.1683456003665924, "learning_rate": 7.408225227711841e-05, "loss": 0.82, "mean_token_accuracy": 0.764246441423893, "num_tokens": 269770924.0, "step": 8452 }, { "entropy": 0.69473946839571, "epoch": 0.7777298577926521, "grad_norm": 0.15853320062160492, "learning_rate": 7.407918545097678e-05, "loss": 0.6938, "mean_token_accuracy": 0.7943790480494499, "num_tokens": 269802912.0, "step": 8453 }, { "entropy": 0.749951945617795, "epoch": 0.7778218641640934, "grad_norm": 0.16599124670028687, "learning_rate": 7.407611862483516e-05, "loss": 0.7334, "mean_token_accuracy": 0.7830946706235409, "num_tokens": 269835258.0, "step": 8454 }, { "entropy": 0.7060797568410635, "epoch": 0.7779138705355346, "grad_norm": 0.15782001614570618, "learning_rate": 7.407305179869354e-05, "loss": 0.6933, "mean_token_accuracy": 0.794991496950388, "num_tokens": 269867218.0, "step": 8455 }, { "entropy": 0.7606798368506134, "epoch": 0.7780058769069758, "grad_norm": 0.16436246037483215, "learning_rate": 7.406998497255191e-05, "loss": 0.7581, "mean_token_accuracy": 0.7799652777612209, "num_tokens": 269899779.0, "step": 8456 }, { "entropy": 0.7768608257174492, "epoch": 0.778097883278417, "grad_norm": 0.15776051580905914, "learning_rate": 7.406691814641028e-05, "loss": 0.7885, "mean_token_accuracy": 0.772331528365612, "num_tokens": 269931805.0, "step": 8457 }, { "entropy": 0.8023094311356544, "epoch": 0.7781898896498582, "grad_norm": 0.1557949334383011, "learning_rate": 7.406385132026866e-05, "loss": 0.8036, "mean_token_accuracy": 0.765748854726553, "num_tokens": 269963768.0, "step": 8458 }, { "entropy": 0.660432493314147, "epoch": 0.7782818960212995, "grad_norm": 0.1551281362771988, "learning_rate": 7.406078449412703e-05, "loss": 0.6485, "mean_token_accuracy": 0.808917049318552, "num_tokens": 269995486.0, "step": 8459 }, { "entropy": 0.8294745422899723, "epoch": 0.7783739023927407, "grad_norm": 0.159877210855484, "learning_rate": 7.405771766798541e-05, "loss": 0.8322, "mean_token_accuracy": 0.7561885118484497, "num_tokens": 270027342.0, "step": 8460 }, { "entropy": 0.6893805228173733, "epoch": 0.7784659087641819, "grad_norm": 0.16560526192188263, "learning_rate": 7.405465084184378e-05, "loss": 0.6933, "mean_token_accuracy": 0.7971676252782345, "num_tokens": 270058939.0, "step": 8461 }, { "entropy": 0.6560484943911433, "epoch": 0.7785579151356231, "grad_norm": 0.14560219645500183, "learning_rate": 7.405158401570216e-05, "loss": 0.6457, "mean_token_accuracy": 0.8097125664353371, "num_tokens": 270090464.0, "step": 8462 }, { "entropy": 0.8274881131947041, "epoch": 0.7786499215070644, "grad_norm": 0.15921354293823242, "learning_rate": 7.404851718956053e-05, "loss": 0.8297, "mean_token_accuracy": 0.7549255415797234, "num_tokens": 270122212.0, "step": 8463 }, { "entropy": 0.8583139702677727, "epoch": 0.7787419278785056, "grad_norm": 0.15971405804157257, "learning_rate": 7.40454503634189e-05, "loss": 0.865, "mean_token_accuracy": 0.7482916079461575, "num_tokens": 270154056.0, "step": 8464 }, { "entropy": 0.6062721610069275, "epoch": 0.7788339342499468, "grad_norm": 0.15652082860469818, "learning_rate": 7.404238353727728e-05, "loss": 0.6033, "mean_token_accuracy": 0.8164522051811218, "num_tokens": 270185827.0, "step": 8465 }, { "entropy": 0.7899483107030392, "epoch": 0.778925940621388, "grad_norm": 0.15123353898525238, "learning_rate": 7.403931671113566e-05, "loss": 0.7686, "mean_token_accuracy": 0.772488608956337, "num_tokens": 270217926.0, "step": 8466 }, { "entropy": 0.7451774161309004, "epoch": 0.7790179469928292, "grad_norm": 0.16442224383354187, "learning_rate": 7.403624988499402e-05, "loss": 0.7359, "mean_token_accuracy": 0.7820848263800144, "num_tokens": 270250395.0, "step": 8467 }, { "entropy": 0.7349152509123087, "epoch": 0.7791099533642705, "grad_norm": 0.159428671002388, "learning_rate": 7.403318305885239e-05, "loss": 0.7184, "mean_token_accuracy": 0.7865876220166683, "num_tokens": 270282273.0, "step": 8468 }, { "entropy": 0.7473154626786709, "epoch": 0.7792019597357117, "grad_norm": 0.15249498188495636, "learning_rate": 7.403011623271076e-05, "loss": 0.7317, "mean_token_accuracy": 0.7817752994596958, "num_tokens": 270314116.0, "step": 8469 }, { "entropy": 0.821124036796391, "epoch": 0.779293966107153, "grad_norm": 0.15880122780799866, "learning_rate": 7.402704940656916e-05, "loss": 0.807, "mean_token_accuracy": 0.7658600509166718, "num_tokens": 270345775.0, "step": 8470 }, { "entropy": 0.6152582271024585, "epoch": 0.7793859724785941, "grad_norm": 0.1558084636926651, "learning_rate": 7.402398258042752e-05, "loss": 0.6031, "mean_token_accuracy": 0.822352547198534, "num_tokens": 270378041.0, "step": 8471 }, { "entropy": 0.7573912721127272, "epoch": 0.7794779788500353, "grad_norm": 0.15942133963108063, "learning_rate": 7.402091575428589e-05, "loss": 0.7306, "mean_token_accuracy": 0.7812934517860413, "num_tokens": 270409158.0, "step": 8472 }, { "entropy": 0.7820795644074678, "epoch": 0.7795699852214766, "grad_norm": 0.16440118849277496, "learning_rate": 7.401784892814426e-05, "loss": 0.7886, "mean_token_accuracy": 0.7727218642830849, "num_tokens": 270441079.0, "step": 8473 }, { "entropy": 0.6023328276351094, "epoch": 0.7796619915929178, "grad_norm": 0.1477334350347519, "learning_rate": 7.401478210200264e-05, "loss": 0.6074, "mean_token_accuracy": 0.8193027675151825, "num_tokens": 270473452.0, "step": 8474 }, { "entropy": 0.6819146797060966, "epoch": 0.7797539979643591, "grad_norm": 0.1617940217256546, "learning_rate": 7.401171527586102e-05, "loss": 0.682, "mean_token_accuracy": 0.7973816134035587, "num_tokens": 270505435.0, "step": 8475 }, { "entropy": 0.7415379174053669, "epoch": 0.7798460043358002, "grad_norm": 0.1503383070230484, "learning_rate": 7.400864844971939e-05, "loss": 0.7236, "mean_token_accuracy": 0.7812758013606071, "num_tokens": 270537302.0, "step": 8476 }, { "entropy": 0.7329591037705541, "epoch": 0.7799380107072414, "grad_norm": 0.162094384431839, "learning_rate": 7.400558162357776e-05, "loss": 0.7329, "mean_token_accuracy": 0.7854157090187073, "num_tokens": 270568987.0, "step": 8477 }, { "entropy": 0.6281170938163996, "epoch": 0.7800300170786827, "grad_norm": 0.15970712900161743, "learning_rate": 7.400251479743614e-05, "loss": 0.6069, "mean_token_accuracy": 0.8172166459262371, "num_tokens": 270600607.0, "step": 8478 }, { "entropy": 0.6942751817405224, "epoch": 0.7801220234501239, "grad_norm": 0.15127450227737427, "learning_rate": 7.399944797129451e-05, "loss": 0.6602, "mean_token_accuracy": 0.8010799400508404, "num_tokens": 270632233.0, "step": 8479 }, { "entropy": 0.5796406287699938, "epoch": 0.7802140298215652, "grad_norm": 0.14087823033332825, "learning_rate": 7.399638114515289e-05, "loss": 0.5536, "mean_token_accuracy": 0.8326584026217461, "num_tokens": 270663820.0, "step": 8480 }, { "entropy": 0.7461374122649431, "epoch": 0.7803060361930063, "grad_norm": 0.1537722498178482, "learning_rate": 7.399331431901127e-05, "loss": 0.7338, "mean_token_accuracy": 0.7823897749185562, "num_tokens": 270696101.0, "step": 8481 }, { "entropy": 0.7235535820946097, "epoch": 0.7803980425644476, "grad_norm": 0.14775879681110382, "learning_rate": 7.399024749286964e-05, "loss": 0.7051, "mean_token_accuracy": 0.7885327786207199, "num_tokens": 270728082.0, "step": 8482 }, { "entropy": 0.710578840225935, "epoch": 0.7804900489358888, "grad_norm": 0.15709859132766724, "learning_rate": 7.3987180666728e-05, "loss": 0.6902, "mean_token_accuracy": 0.7955599315464497, "num_tokens": 270760207.0, "step": 8483 }, { "entropy": 0.6714707110077143, "epoch": 0.78058205530733, "grad_norm": 0.1521081030368805, "learning_rate": 7.398411384058637e-05, "loss": 0.6514, "mean_token_accuracy": 0.8052070327103138, "num_tokens": 270792303.0, "step": 8484 }, { "entropy": 0.7547136694192886, "epoch": 0.7806740616787713, "grad_norm": 0.15353070199489594, "learning_rate": 7.398104701444475e-05, "loss": 0.742, "mean_token_accuracy": 0.7807872779667377, "num_tokens": 270824160.0, "step": 8485 }, { "entropy": 0.6752267684787512, "epoch": 0.7807660680502124, "grad_norm": 0.15177907049655914, "learning_rate": 7.397798018830314e-05, "loss": 0.6653, "mean_token_accuracy": 0.8009885810315609, "num_tokens": 270856212.0, "step": 8486 }, { "entropy": 0.7236415408551693, "epoch": 0.7808580744216537, "grad_norm": 0.1551021784543991, "learning_rate": 7.39749133621615e-05, "loss": 0.7076, "mean_token_accuracy": 0.7911282926797867, "num_tokens": 270888239.0, "step": 8487 }, { "entropy": 0.8197584003210068, "epoch": 0.7809500807930949, "grad_norm": 0.16155073046684265, "learning_rate": 7.397184653601987e-05, "loss": 0.845, "mean_token_accuracy": 0.7525942772626877, "num_tokens": 270920318.0, "step": 8488 }, { "entropy": 0.6505640102550387, "epoch": 0.7810420871645362, "grad_norm": 0.15686604380607605, "learning_rate": 7.396877970987825e-05, "loss": 0.6559, "mean_token_accuracy": 0.803996704518795, "num_tokens": 270952352.0, "step": 8489 }, { "entropy": 0.7489370983093977, "epoch": 0.7811340935359774, "grad_norm": 0.16374242305755615, "learning_rate": 7.396571288373662e-05, "loss": 0.7674, "mean_token_accuracy": 0.7726884260773659, "num_tokens": 270983430.0, "step": 8490 }, { "entropy": 0.7370063737034798, "epoch": 0.7812260999074185, "grad_norm": 0.15555284917354584, "learning_rate": 7.3962646057595e-05, "loss": 0.7268, "mean_token_accuracy": 0.7846766151487827, "num_tokens": 271015554.0, "step": 8491 }, { "entropy": 0.7605577427893877, "epoch": 0.7813181062788598, "grad_norm": 0.16150332987308502, "learning_rate": 7.395957923145337e-05, "loss": 0.7382, "mean_token_accuracy": 0.7833043895661831, "num_tokens": 271046966.0, "step": 8492 }, { "entropy": 0.7652390394359827, "epoch": 0.781410112650301, "grad_norm": 0.16582337021827698, "learning_rate": 7.395651240531175e-05, "loss": 0.7703, "mean_token_accuracy": 0.7722799442708492, "num_tokens": 271079658.0, "step": 8493 }, { "entropy": 0.7359480950981379, "epoch": 0.7815021190217423, "grad_norm": 0.15548856556415558, "learning_rate": 7.395344557917012e-05, "loss": 0.7149, "mean_token_accuracy": 0.7870174422860146, "num_tokens": 271111847.0, "step": 8494 }, { "entropy": 0.813851110637188, "epoch": 0.7815941253931835, "grad_norm": 0.1645001620054245, "learning_rate": 7.395037875302849e-05, "loss": 0.7949, "mean_token_accuracy": 0.7679225727915764, "num_tokens": 271144615.0, "step": 8495 }, { "entropy": 0.7741543902084231, "epoch": 0.7816861317646246, "grad_norm": 0.15749868750572205, "learning_rate": 7.394731192688687e-05, "loss": 0.7429, "mean_token_accuracy": 0.7856639660894871, "num_tokens": 271176698.0, "step": 8496 }, { "entropy": 0.6690422166138887, "epoch": 0.7817781381360659, "grad_norm": 0.1473979949951172, "learning_rate": 7.394424510074525e-05, "loss": 0.6338, "mean_token_accuracy": 0.8119029626250267, "num_tokens": 271208119.0, "step": 8497 }, { "entropy": 0.7703954912722111, "epoch": 0.7818701445075071, "grad_norm": 0.16149114072322845, "learning_rate": 7.394117827460362e-05, "loss": 0.7588, "mean_token_accuracy": 0.7768103219568729, "num_tokens": 271239981.0, "step": 8498 }, { "entropy": 0.8638346008956432, "epoch": 0.7819621508789484, "grad_norm": 0.1668161004781723, "learning_rate": 7.393811144846199e-05, "loss": 0.8496, "mean_token_accuracy": 0.7564315907657146, "num_tokens": 271272640.0, "step": 8499 }, { "entropy": 0.7306911759078503, "epoch": 0.7820541572503896, "grad_norm": 0.15903018414974213, "learning_rate": 7.393504462232035e-05, "loss": 0.708, "mean_token_accuracy": 0.7972352243959904, "num_tokens": 271305336.0, "step": 8500 }, { "entropy": 0.8422243520617485, "epoch": 0.7821461636218308, "grad_norm": 0.15904955565929413, "learning_rate": 7.393197779617874e-05, "loss": 0.8345, "mean_token_accuracy": 0.7586082704365253, "num_tokens": 271337500.0, "step": 8501 }, { "entropy": 0.7553521385416389, "epoch": 0.782238169993272, "grad_norm": 0.1546938121318817, "learning_rate": 7.392891097003712e-05, "loss": 0.7327, "mean_token_accuracy": 0.7838312797248363, "num_tokens": 271369567.0, "step": 8502 }, { "entropy": 0.7145666358992457, "epoch": 0.7823301763647132, "grad_norm": 0.157041534781456, "learning_rate": 7.392584414389549e-05, "loss": 0.6836, "mean_token_accuracy": 0.7986959107220173, "num_tokens": 271400604.0, "step": 8503 }, { "entropy": 0.6821659300476313, "epoch": 0.7824221827361545, "grad_norm": 0.1578352302312851, "learning_rate": 7.392277731775385e-05, "loss": 0.6741, "mean_token_accuracy": 0.8030373752117157, "num_tokens": 271433103.0, "step": 8504 }, { "entropy": 0.6402300521731377, "epoch": 0.7825141891075957, "grad_norm": 0.14524619281291962, "learning_rate": 7.391971049161223e-05, "loss": 0.6303, "mean_token_accuracy": 0.8119591623544693, "num_tokens": 271465334.0, "step": 8505 }, { "entropy": 0.7315555009990931, "epoch": 0.7826061954790369, "grad_norm": 0.15939107537269592, "learning_rate": 7.39166436654706e-05, "loss": 0.7317, "mean_token_accuracy": 0.7829719893634319, "num_tokens": 271497943.0, "step": 8506 }, { "entropy": 0.6612913329154253, "epoch": 0.7826982018504781, "grad_norm": 0.15721625089645386, "learning_rate": 7.391357683932898e-05, "loss": 0.6618, "mean_token_accuracy": 0.8063562214374542, "num_tokens": 271530275.0, "step": 8507 }, { "entropy": 0.7663223035633564, "epoch": 0.7827902082219194, "grad_norm": 0.1534901261329651, "learning_rate": 7.391051001318735e-05, "loss": 0.7584, "mean_token_accuracy": 0.7761588357388973, "num_tokens": 271562666.0, "step": 8508 }, { "entropy": 0.6189523302018642, "epoch": 0.7828822145933606, "grad_norm": 0.15249097347259521, "learning_rate": 7.390744318704573e-05, "loss": 0.6063, "mean_token_accuracy": 0.8206370808184147, "num_tokens": 271594924.0, "step": 8509 }, { "entropy": 0.7302311901003122, "epoch": 0.7829742209648018, "grad_norm": 0.1509684920310974, "learning_rate": 7.39043763609041e-05, "loss": 0.7252, "mean_token_accuracy": 0.7856609635055065, "num_tokens": 271627524.0, "step": 8510 }, { "entropy": 0.781963337212801, "epoch": 0.783066227336243, "grad_norm": 0.1696271151304245, "learning_rate": 7.390130953476247e-05, "loss": 0.7941, "mean_token_accuracy": 0.7706146836280823, "num_tokens": 271659662.0, "step": 8511 }, { "entropy": 0.7020242903381586, "epoch": 0.7831582337076842, "grad_norm": 0.15776827931404114, "learning_rate": 7.389824270862086e-05, "loss": 0.7094, "mean_token_accuracy": 0.7899495922029018, "num_tokens": 271692129.0, "step": 8512 }, { "entropy": 0.8258201871067286, "epoch": 0.7832502400791255, "grad_norm": 0.16377785801887512, "learning_rate": 7.389517588247923e-05, "loss": 0.8263, "mean_token_accuracy": 0.7578641101717949, "num_tokens": 271724164.0, "step": 8513 }, { "entropy": 0.6663247980177402, "epoch": 0.7833422464505667, "grad_norm": 0.15748898684978485, "learning_rate": 7.38921090563376e-05, "loss": 0.6493, "mean_token_accuracy": 0.8084777519106865, "num_tokens": 271756043.0, "step": 8514 }, { "entropy": 0.9589138105511665, "epoch": 0.783434252822008, "grad_norm": 0.16445249319076538, "learning_rate": 7.388904223019597e-05, "loss": 0.946, "mean_token_accuracy": 0.7243949808180332, "num_tokens": 271787703.0, "step": 8515 }, { "entropy": 0.7770838253200054, "epoch": 0.7835262591934491, "grad_norm": 0.15561869740486145, "learning_rate": 7.388597540405435e-05, "loss": 0.7506, "mean_token_accuracy": 0.777635969221592, "num_tokens": 271819349.0, "step": 8516 }, { "entropy": 0.8095159409567714, "epoch": 0.7836182655648903, "grad_norm": 0.15029647946357727, "learning_rate": 7.388290857791273e-05, "loss": 0.7919, "mean_token_accuracy": 0.7685501016676426, "num_tokens": 271851611.0, "step": 8517 }, { "entropy": 0.6154816746711731, "epoch": 0.7837102719363316, "grad_norm": 0.14434169232845306, "learning_rate": 7.38798417517711e-05, "loss": 0.6087, "mean_token_accuracy": 0.820955153554678, "num_tokens": 271883948.0, "step": 8518 }, { "entropy": 0.7195031903684139, "epoch": 0.7838022783077728, "grad_norm": 0.15756195783615112, "learning_rate": 7.387677492562947e-05, "loss": 0.7001, "mean_token_accuracy": 0.7950352430343628, "num_tokens": 271916120.0, "step": 8519 }, { "entropy": 0.6525544952601194, "epoch": 0.7838942846792141, "grad_norm": 0.1632777452468872, "learning_rate": 7.387370809948785e-05, "loss": 0.6199, "mean_token_accuracy": 0.8131441846489906, "num_tokens": 271948199.0, "step": 8520 }, { "entropy": 0.6348206531256437, "epoch": 0.7839862910506552, "grad_norm": 0.14695827662944794, "learning_rate": 7.387064127334622e-05, "loss": 0.6236, "mean_token_accuracy": 0.8122722953557968, "num_tokens": 271980028.0, "step": 8521 }, { "entropy": 0.7266394607722759, "epoch": 0.7840782974220964, "grad_norm": 0.15805917978286743, "learning_rate": 7.38675744472046e-05, "loss": 0.7227, "mean_token_accuracy": 0.7861533723771572, "num_tokens": 272011999.0, "step": 8522 }, { "entropy": 0.6927889306098223, "epoch": 0.7841703037935377, "grad_norm": 0.14924904704093933, "learning_rate": 7.386450762106296e-05, "loss": 0.672, "mean_token_accuracy": 0.7981198951601982, "num_tokens": 272044096.0, "step": 8523 }, { "entropy": 0.7051739394664764, "epoch": 0.7842623101649789, "grad_norm": 0.15370120108127594, "learning_rate": 7.386144079492135e-05, "loss": 0.7012, "mean_token_accuracy": 0.7923919223248959, "num_tokens": 272076351.0, "step": 8524 }, { "entropy": 0.7693591872230172, "epoch": 0.7843543165364202, "grad_norm": 0.16013094782829285, "learning_rate": 7.385837396877971e-05, "loss": 0.7628, "mean_token_accuracy": 0.7763490565121174, "num_tokens": 272108842.0, "step": 8525 }, { "entropy": 0.764161292463541, "epoch": 0.7844463229078613, "grad_norm": 0.16010309755802155, "learning_rate": 7.385530714263808e-05, "loss": 0.7566, "mean_token_accuracy": 0.7780318781733513, "num_tokens": 272140067.0, "step": 8526 }, { "entropy": 0.7340683452785015, "epoch": 0.7845383292793026, "grad_norm": 0.15414585173130035, "learning_rate": 7.385224031649646e-05, "loss": 0.7323, "mean_token_accuracy": 0.7888293638825417, "num_tokens": 272171754.0, "step": 8527 }, { "entropy": 0.6302158441394567, "epoch": 0.7846303356507438, "grad_norm": 0.16700467467308044, "learning_rate": 7.384917349035484e-05, "loss": 0.6152, "mean_token_accuracy": 0.8170327842235565, "num_tokens": 272203933.0, "step": 8528 }, { "entropy": 0.6855208408087492, "epoch": 0.784722342022185, "grad_norm": 0.1547228991985321, "learning_rate": 7.384610666421321e-05, "loss": 0.6852, "mean_token_accuracy": 0.8005902580916882, "num_tokens": 272235288.0, "step": 8529 }, { "entropy": 0.762965808622539, "epoch": 0.7848143483936263, "grad_norm": 0.15182481706142426, "learning_rate": 7.384303983807158e-05, "loss": 0.7735, "mean_token_accuracy": 0.7717209383845329, "num_tokens": 272267118.0, "step": 8530 }, { "entropy": 0.6949124690145254, "epoch": 0.7849063547650674, "grad_norm": 0.15113437175750732, "learning_rate": 7.383997301192995e-05, "loss": 0.6886, "mean_token_accuracy": 0.7972819842398167, "num_tokens": 272298744.0, "step": 8531 }, { "entropy": 0.7210070807486773, "epoch": 0.7849983611365087, "grad_norm": 0.1545727699995041, "learning_rate": 7.383690618578833e-05, "loss": 0.7095, "mean_token_accuracy": 0.7871234193444252, "num_tokens": 272330898.0, "step": 8532 }, { "entropy": 0.6758428867906332, "epoch": 0.7850903675079499, "grad_norm": 0.15054763853549957, "learning_rate": 7.383383935964671e-05, "loss": 0.6722, "mean_token_accuracy": 0.8015005029737949, "num_tokens": 272362978.0, "step": 8533 }, { "entropy": 0.7831039894372225, "epoch": 0.7851823738793912, "grad_norm": 0.17746292054653168, "learning_rate": 7.383077253350508e-05, "loss": 0.8009, "mean_token_accuracy": 0.7686121910810471, "num_tokens": 272394546.0, "step": 8534 }, { "entropy": 0.7062401492148638, "epoch": 0.7852743802508324, "grad_norm": 0.15497301518917084, "learning_rate": 7.382770570736345e-05, "loss": 0.6925, "mean_token_accuracy": 0.7953660041093826, "num_tokens": 272427008.0, "step": 8535 }, { "entropy": 0.7116552088409662, "epoch": 0.7853663866222735, "grad_norm": 0.1621994823217392, "learning_rate": 7.382463888122183e-05, "loss": 0.7049, "mean_token_accuracy": 0.7932934835553169, "num_tokens": 272459330.0, "step": 8536 }, { "entropy": 0.6832623807713389, "epoch": 0.7854583929937148, "grad_norm": 0.15525010228157043, "learning_rate": 7.38215720550802e-05, "loss": 0.6573, "mean_token_accuracy": 0.8068063668906689, "num_tokens": 272491436.0, "step": 8537 }, { "entropy": 0.8715250566601753, "epoch": 0.785550399365156, "grad_norm": 0.16261185705661774, "learning_rate": 7.381850522893858e-05, "loss": 0.8601, "mean_token_accuracy": 0.7456566356122494, "num_tokens": 272523811.0, "step": 8538 }, { "entropy": 0.7553435936570168, "epoch": 0.7856424057365973, "grad_norm": 0.1507043093442917, "learning_rate": 7.381543840279695e-05, "loss": 0.7321, "mean_token_accuracy": 0.7832330614328384, "num_tokens": 272555698.0, "step": 8539 }, { "entropy": 0.8116856049746275, "epoch": 0.7857344121080385, "grad_norm": 0.1720178872346878, "learning_rate": 7.381237157665533e-05, "loss": 0.7936, "mean_token_accuracy": 0.76827522367239, "num_tokens": 272587957.0, "step": 8540 }, { "entropy": 0.710743760690093, "epoch": 0.7858264184794796, "grad_norm": 0.1596609205007553, "learning_rate": 7.38093047505137e-05, "loss": 0.6992, "mean_token_accuracy": 0.7910830117762089, "num_tokens": 272619823.0, "step": 8541 }, { "entropy": 0.8098485693335533, "epoch": 0.7859184248509209, "grad_norm": 0.15769857168197632, "learning_rate": 7.380623792437206e-05, "loss": 0.8016, "mean_token_accuracy": 0.7665514089167118, "num_tokens": 272651833.0, "step": 8542 }, { "entropy": 0.6909339167177677, "epoch": 0.7860104312223621, "grad_norm": 0.14901579916477203, "learning_rate": 7.380317109823044e-05, "loss": 0.6736, "mean_token_accuracy": 0.799611072987318, "num_tokens": 272683808.0, "step": 8543 }, { "entropy": 0.6987296976149082, "epoch": 0.7861024375938034, "grad_norm": 0.16125808656215668, "learning_rate": 7.380010427208883e-05, "loss": 0.6998, "mean_token_accuracy": 0.795626800507307, "num_tokens": 272714937.0, "step": 8544 }, { "entropy": 0.7419259492307901, "epoch": 0.7861944439652446, "grad_norm": 0.15823298692703247, "learning_rate": 7.379703744594719e-05, "loss": 0.7386, "mean_token_accuracy": 0.7841432765126228, "num_tokens": 272746846.0, "step": 8545 }, { "entropy": 0.7214630153030157, "epoch": 0.7862864503366858, "grad_norm": 0.16559213399887085, "learning_rate": 7.379397061980556e-05, "loss": 0.7164, "mean_token_accuracy": 0.7933027371764183, "num_tokens": 272777860.0, "step": 8546 }, { "entropy": 0.7438743440434337, "epoch": 0.786378456708127, "grad_norm": 0.15091730654239655, "learning_rate": 7.379090379366394e-05, "loss": 0.7359, "mean_token_accuracy": 0.7864509858191013, "num_tokens": 272809775.0, "step": 8547 }, { "entropy": 0.6060006059706211, "epoch": 0.7864704630795682, "grad_norm": 0.14475904405117035, "learning_rate": 7.378783696752231e-05, "loss": 0.5996, "mean_token_accuracy": 0.820652425289154, "num_tokens": 272841791.0, "step": 8548 }, { "entropy": 0.6943454025313258, "epoch": 0.7865624694510095, "grad_norm": 0.16151531040668488, "learning_rate": 7.378477014138069e-05, "loss": 0.7013, "mean_token_accuracy": 0.7942841239273548, "num_tokens": 272874053.0, "step": 8549 }, { "entropy": 0.8227536808699369, "epoch": 0.7866544758224507, "grad_norm": 0.15640684962272644, "learning_rate": 7.378170331523906e-05, "loss": 0.8054, "mean_token_accuracy": 0.7611001990735531, "num_tokens": 272906116.0, "step": 8550 }, { "entropy": 0.7192155793309212, "epoch": 0.7867464821938919, "grad_norm": 0.15136462450027466, "learning_rate": 7.377863648909744e-05, "loss": 0.6903, "mean_token_accuracy": 0.7924254685640335, "num_tokens": 272937777.0, "step": 8551 }, { "entropy": 0.6969116292893887, "epoch": 0.7868384885653331, "grad_norm": 0.15180860459804535, "learning_rate": 7.377556966295581e-05, "loss": 0.6899, "mean_token_accuracy": 0.7938534393906593, "num_tokens": 272970074.0, "step": 8552 }, { "entropy": 0.6636876277625561, "epoch": 0.7869304949367744, "grad_norm": 0.15112192928791046, "learning_rate": 7.377250283681418e-05, "loss": 0.6419, "mean_token_accuracy": 0.8111265935003757, "num_tokens": 273001693.0, "step": 8553 }, { "entropy": 0.7692442703992128, "epoch": 0.7870225013082156, "grad_norm": 0.15780681371688843, "learning_rate": 7.376943601067256e-05, "loss": 0.7451, "mean_token_accuracy": 0.7805689461529255, "num_tokens": 273033984.0, "step": 8554 }, { "entropy": 0.7713220082223415, "epoch": 0.7871145076796568, "grad_norm": 0.1523052155971527, "learning_rate": 7.376636918453094e-05, "loss": 0.7664, "mean_token_accuracy": 0.7744520530104637, "num_tokens": 273065581.0, "step": 8555 }, { "entropy": 0.7557821571826935, "epoch": 0.787206514051098, "grad_norm": 0.17176759243011475, "learning_rate": 7.376330235838931e-05, "loss": 0.7349, "mean_token_accuracy": 0.7784265726804733, "num_tokens": 273096214.0, "step": 8556 }, { "entropy": 0.5424125287681818, "epoch": 0.7872985204225392, "grad_norm": 0.1521076261997223, "learning_rate": 7.376023553224768e-05, "loss": 0.5269, "mean_token_accuracy": 0.8428789675235748, "num_tokens": 273128360.0, "step": 8557 }, { "entropy": 0.7493317387998104, "epoch": 0.7873905267939805, "grad_norm": 0.16830655932426453, "learning_rate": 7.375716870610606e-05, "loss": 0.7362, "mean_token_accuracy": 0.7796186208724976, "num_tokens": 273158895.0, "step": 8558 }, { "entropy": 0.9297135733067989, "epoch": 0.7874825331654217, "grad_norm": 0.1698494404554367, "learning_rate": 7.375410187996444e-05, "loss": 0.9378, "mean_token_accuracy": 0.7319910824298859, "num_tokens": 273190871.0, "step": 8559 }, { "entropy": 0.7792004533112049, "epoch": 0.787574539536863, "grad_norm": 0.1557946652173996, "learning_rate": 7.37510350538228e-05, "loss": 0.7726, "mean_token_accuracy": 0.771990992128849, "num_tokens": 273222967.0, "step": 8560 }, { "entropy": 0.6873204540461302, "epoch": 0.7876665459083042, "grad_norm": 0.1579616218805313, "learning_rate": 7.374796822768117e-05, "loss": 0.6731, "mean_token_accuracy": 0.800992626696825, "num_tokens": 273255177.0, "step": 8561 }, { "entropy": 0.6091364892199636, "epoch": 0.7877585522797453, "grad_norm": 0.14666375517845154, "learning_rate": 7.374490140153954e-05, "loss": 0.6074, "mean_token_accuracy": 0.8194530941545963, "num_tokens": 273287452.0, "step": 8562 }, { "entropy": 0.761012252420187, "epoch": 0.7878505586511866, "grad_norm": 0.1611592024564743, "learning_rate": 7.374183457539792e-05, "loss": 0.752, "mean_token_accuracy": 0.7788048163056374, "num_tokens": 273319558.0, "step": 8563 }, { "entropy": 0.7336780186742544, "epoch": 0.7879425650226278, "grad_norm": 0.15773077309131622, "learning_rate": 7.37387677492563e-05, "loss": 0.7008, "mean_token_accuracy": 0.7894185967743397, "num_tokens": 273351841.0, "step": 8564 }, { "entropy": 0.6742825247347355, "epoch": 0.7880345713940691, "grad_norm": 0.15692102909088135, "learning_rate": 7.373570092311467e-05, "loss": 0.653, "mean_token_accuracy": 0.8098753802478313, "num_tokens": 273384445.0, "step": 8565 }, { "entropy": 0.7086341287940741, "epoch": 0.7881265777655103, "grad_norm": 0.168618306517601, "learning_rate": 7.373263409697304e-05, "loss": 0.6986, "mean_token_accuracy": 0.7984604984521866, "num_tokens": 273415622.0, "step": 8566 }, { "entropy": 0.6993858758360147, "epoch": 0.7882185841369515, "grad_norm": 0.1541106402873993, "learning_rate": 7.372956727083142e-05, "loss": 0.6788, "mean_token_accuracy": 0.800257284194231, "num_tokens": 273447966.0, "step": 8567 }, { "entropy": 0.6398835983127356, "epoch": 0.7883105905083927, "grad_norm": 0.15397000312805176, "learning_rate": 7.372650044468979e-05, "loss": 0.6321, "mean_token_accuracy": 0.8098541162908077, "num_tokens": 273480400.0, "step": 8568 }, { "entropy": 0.7735233772546053, "epoch": 0.7884025968798339, "grad_norm": 0.1581113636493683, "learning_rate": 7.372343361854817e-05, "loss": 0.7603, "mean_token_accuracy": 0.7799490764737129, "num_tokens": 273512572.0, "step": 8569 }, { "entropy": 0.6825246205553412, "epoch": 0.7884946032512752, "grad_norm": 0.15679603815078735, "learning_rate": 7.372036679240654e-05, "loss": 0.6687, "mean_token_accuracy": 0.8012077212333679, "num_tokens": 273544472.0, "step": 8570 }, { "entropy": 0.7472797520458698, "epoch": 0.7885866096227164, "grad_norm": 0.16353359818458557, "learning_rate": 7.371729996626492e-05, "loss": 0.7328, "mean_token_accuracy": 0.7833852767944336, "num_tokens": 273577015.0, "step": 8571 }, { "entropy": 0.7118648011237383, "epoch": 0.7886786159941576, "grad_norm": 0.15723274648189545, "learning_rate": 7.371423314012329e-05, "loss": 0.7108, "mean_token_accuracy": 0.7905420139431953, "num_tokens": 273608493.0, "step": 8572 }, { "entropy": 0.6758079566061497, "epoch": 0.7887706223655988, "grad_norm": 0.15429018437862396, "learning_rate": 7.371116631398166e-05, "loss": 0.6551, "mean_token_accuracy": 0.802077766507864, "num_tokens": 273639914.0, "step": 8573 }, { "entropy": 0.8466695938259363, "epoch": 0.78886262873704, "grad_norm": 0.1673181802034378, "learning_rate": 7.370809948784004e-05, "loss": 0.8454, "mean_token_accuracy": 0.7590932324528694, "num_tokens": 273671420.0, "step": 8574 }, { "entropy": 0.6785710789263248, "epoch": 0.7889546351084813, "grad_norm": 0.14531457424163818, "learning_rate": 7.370503266169842e-05, "loss": 0.6663, "mean_token_accuracy": 0.7995629571378231, "num_tokens": 273704137.0, "step": 8575 }, { "entropy": 0.7604596018791199, "epoch": 0.7890466414799225, "grad_norm": 0.15616276860237122, "learning_rate": 7.370196583555679e-05, "loss": 0.7574, "mean_token_accuracy": 0.775534201413393, "num_tokens": 273735916.0, "step": 8576 }, { "entropy": 0.7103800345212221, "epoch": 0.7891386478513637, "grad_norm": 0.1590428650379181, "learning_rate": 7.369889900941515e-05, "loss": 0.6938, "mean_token_accuracy": 0.7975443340837955, "num_tokens": 273768428.0, "step": 8577 }, { "entropy": 0.7106568459421396, "epoch": 0.7892306542228049, "grad_norm": 0.16185952723026276, "learning_rate": 7.369583218327354e-05, "loss": 0.6966, "mean_token_accuracy": 0.791290320456028, "num_tokens": 273799578.0, "step": 8578 }, { "entropy": 0.7845104336738586, "epoch": 0.7893226605942462, "grad_norm": 0.15051478147506714, "learning_rate": 7.36927653571319e-05, "loss": 0.7757, "mean_token_accuracy": 0.7671909630298615, "num_tokens": 273831159.0, "step": 8579 }, { "entropy": 0.7506093196570873, "epoch": 0.7894146669656874, "grad_norm": 0.14986221492290497, "learning_rate": 7.368969853099029e-05, "loss": 0.7372, "mean_token_accuracy": 0.7796771936118603, "num_tokens": 273863224.0, "step": 8580 }, { "entropy": 0.6893134415149689, "epoch": 0.7895066733371287, "grad_norm": 0.16436223685741425, "learning_rate": 7.368663170484865e-05, "loss": 0.6623, "mean_token_accuracy": 0.8005218096077442, "num_tokens": 273894310.0, "step": 8581 }, { "entropy": 0.7511411318555474, "epoch": 0.7895986797085698, "grad_norm": 0.15950360894203186, "learning_rate": 7.368356487870703e-05, "loss": 0.7631, "mean_token_accuracy": 0.7788693904876709, "num_tokens": 273925707.0, "step": 8582 }, { "entropy": 0.7684105727821589, "epoch": 0.789690686080011, "grad_norm": 0.15488223731517792, "learning_rate": 7.36804980525654e-05, "loss": 0.7449, "mean_token_accuracy": 0.7757253386080265, "num_tokens": 273957201.0, "step": 8583 }, { "entropy": 0.7630168162286282, "epoch": 0.7897826924514523, "grad_norm": 0.16555221378803253, "learning_rate": 7.367743122642377e-05, "loss": 0.7574, "mean_token_accuracy": 0.7739398628473282, "num_tokens": 273988961.0, "step": 8584 }, { "entropy": 0.6836388884112239, "epoch": 0.7898746988228935, "grad_norm": 0.15380649268627167, "learning_rate": 7.367436440028215e-05, "loss": 0.668, "mean_token_accuracy": 0.8092549256980419, "num_tokens": 274020423.0, "step": 8585 }, { "entropy": 0.7630134802311659, "epoch": 0.7899667051943348, "grad_norm": 0.15431813895702362, "learning_rate": 7.367129757414053e-05, "loss": 0.7358, "mean_token_accuracy": 0.7857904434204102, "num_tokens": 274052784.0, "step": 8586 }, { "entropy": 0.7531762197613716, "epoch": 0.7900587115657759, "grad_norm": 0.15231549739837646, "learning_rate": 7.36682307479989e-05, "loss": 0.7497, "mean_token_accuracy": 0.7743534557521343, "num_tokens": 274084779.0, "step": 8587 }, { "entropy": 0.8413972146809101, "epoch": 0.7901507179372171, "grad_norm": 0.1625741869211197, "learning_rate": 7.366516392185727e-05, "loss": 0.8383, "mean_token_accuracy": 0.7559649273753166, "num_tokens": 274116736.0, "step": 8588 }, { "entropy": 0.7303318157792091, "epoch": 0.7902427243086584, "grad_norm": 0.15725639462471008, "learning_rate": 7.366209709571564e-05, "loss": 0.7258, "mean_token_accuracy": 0.786669846624136, "num_tokens": 274148477.0, "step": 8589 }, { "entropy": 0.79659328982234, "epoch": 0.7903347306800996, "grad_norm": 0.15633517503738403, "learning_rate": 7.365903026957403e-05, "loss": 0.7846, "mean_token_accuracy": 0.7710376977920532, "num_tokens": 274180887.0, "step": 8590 }, { "entropy": 0.8377163615077734, "epoch": 0.7904267370515409, "grad_norm": 0.15696901082992554, "learning_rate": 7.36559634434324e-05, "loss": 0.8217, "mean_token_accuracy": 0.759906567633152, "num_tokens": 274212053.0, "step": 8591 }, { "entropy": 0.672072040848434, "epoch": 0.790518743422982, "grad_norm": 0.1511387676000595, "learning_rate": 7.365289661729077e-05, "loss": 0.6648, "mean_token_accuracy": 0.8023151494562626, "num_tokens": 274243564.0, "step": 8592 }, { "entropy": 0.7287766924127936, "epoch": 0.7906107497944233, "grad_norm": 0.15541014075279236, "learning_rate": 7.364982979114914e-05, "loss": 0.7169, "mean_token_accuracy": 0.7881781384348869, "num_tokens": 274275027.0, "step": 8593 }, { "entropy": 0.7706855647265911, "epoch": 0.7907027561658645, "grad_norm": 0.1663215011358261, "learning_rate": 7.364676296500752e-05, "loss": 0.7681, "mean_token_accuracy": 0.7778508588671684, "num_tokens": 274307609.0, "step": 8594 }, { "entropy": 0.8780867643654346, "epoch": 0.7907947625373057, "grad_norm": 0.17531369626522064, "learning_rate": 7.36436961388659e-05, "loss": 0.8556, "mean_token_accuracy": 0.752273440361023, "num_tokens": 274339613.0, "step": 8595 }, { "entropy": 0.8039433620870113, "epoch": 0.790886768908747, "grad_norm": 0.16240191459655762, "learning_rate": 7.364062931272427e-05, "loss": 0.7905, "mean_token_accuracy": 0.7687235586345196, "num_tokens": 274370788.0, "step": 8596 }, { "entropy": 0.8562704306095839, "epoch": 0.7909787752801881, "grad_norm": 0.1710420697927475, "learning_rate": 7.363756248658263e-05, "loss": 0.8586, "mean_token_accuracy": 0.7530887424945831, "num_tokens": 274403177.0, "step": 8597 }, { "entropy": 0.6948898583650589, "epoch": 0.7910707816516294, "grad_norm": 0.14617110788822174, "learning_rate": 7.363449566044102e-05, "loss": 0.6783, "mean_token_accuracy": 0.8022138699889183, "num_tokens": 274435079.0, "step": 8598 }, { "entropy": 0.7582244519144297, "epoch": 0.7911627880230706, "grad_norm": 0.16229483485221863, "learning_rate": 7.363142883429938e-05, "loss": 0.754, "mean_token_accuracy": 0.7741826437413692, "num_tokens": 274466575.0, "step": 8599 }, { "entropy": 0.5704895593225956, "epoch": 0.7912547943945119, "grad_norm": 0.15632276237010956, "learning_rate": 7.362836200815776e-05, "loss": 0.5609, "mean_token_accuracy": 0.833602212369442, "num_tokens": 274497831.0, "step": 8600 }, { "entropy": 0.654584439471364, "epoch": 0.7913468007659531, "grad_norm": 0.15747042000293732, "learning_rate": 7.362529518201613e-05, "loss": 0.6282, "mean_token_accuracy": 0.811036005616188, "num_tokens": 274529557.0, "step": 8601 }, { "entropy": 0.7592297773808241, "epoch": 0.7914388071373942, "grad_norm": 0.15971432626247406, "learning_rate": 7.362222835587451e-05, "loss": 0.7523, "mean_token_accuracy": 0.7802796475589275, "num_tokens": 274561419.0, "step": 8602 }, { "entropy": 0.7047729417681694, "epoch": 0.7915308135088355, "grad_norm": 0.15369847416877747, "learning_rate": 7.361916152973288e-05, "loss": 0.7046, "mean_token_accuracy": 0.7960044331848621, "num_tokens": 274593959.0, "step": 8603 }, { "entropy": 0.6620243433862925, "epoch": 0.7916228198802767, "grad_norm": 0.1461433619260788, "learning_rate": 7.361609470359125e-05, "loss": 0.627, "mean_token_accuracy": 0.8089936338365078, "num_tokens": 274626045.0, "step": 8604 }, { "entropy": 0.7821628358215094, "epoch": 0.791714826251718, "grad_norm": 0.16493122279644012, "learning_rate": 7.361302787744963e-05, "loss": 0.7936, "mean_token_accuracy": 0.7713088393211365, "num_tokens": 274658114.0, "step": 8605 }, { "entropy": 0.7641425207257271, "epoch": 0.7918068326231592, "grad_norm": 0.1649802327156067, "learning_rate": 7.360996105130801e-05, "loss": 0.7715, "mean_token_accuracy": 0.7772484458982944, "num_tokens": 274689996.0, "step": 8606 }, { "entropy": 0.6146721132099628, "epoch": 0.7918988389946003, "grad_norm": 0.14977332949638367, "learning_rate": 7.360689422516638e-05, "loss": 0.5977, "mean_token_accuracy": 0.8185565508902073, "num_tokens": 274721803.0, "step": 8607 }, { "entropy": 0.6639824332669377, "epoch": 0.7919908453660416, "grad_norm": 0.15179799497127533, "learning_rate": 7.360382739902475e-05, "loss": 0.6614, "mean_token_accuracy": 0.8071005567908287, "num_tokens": 274753821.0, "step": 8608 }, { "entropy": 0.6675180271267891, "epoch": 0.7920828517374828, "grad_norm": 0.1461772620677948, "learning_rate": 7.360076057288313e-05, "loss": 0.6551, "mean_token_accuracy": 0.8007979057729244, "num_tokens": 274785928.0, "step": 8609 }, { "entropy": 0.6975451232865453, "epoch": 0.7921748581089241, "grad_norm": 0.15732145309448242, "learning_rate": 7.35976937467415e-05, "loss": 0.6887, "mean_token_accuracy": 0.7989288605749607, "num_tokens": 274817900.0, "step": 8610 }, { "entropy": 0.6818988434970379, "epoch": 0.7922668644803653, "grad_norm": 0.15937431156635284, "learning_rate": 7.359462692059988e-05, "loss": 0.647, "mean_token_accuracy": 0.8076740428805351, "num_tokens": 274850071.0, "step": 8611 }, { "entropy": 0.6721364799886942, "epoch": 0.7923588708518065, "grad_norm": 0.15472657978534698, "learning_rate": 7.359156009445825e-05, "loss": 0.6612, "mean_token_accuracy": 0.8026912622153759, "num_tokens": 274880973.0, "step": 8612 }, { "entropy": 0.7747740875929594, "epoch": 0.7924508772232477, "grad_norm": 0.1608923077583313, "learning_rate": 7.358849326831663e-05, "loss": 0.7806, "mean_token_accuracy": 0.775224182754755, "num_tokens": 274913066.0, "step": 8613 }, { "entropy": 0.6955502862110734, "epoch": 0.7925428835946889, "grad_norm": 0.14988668262958527, "learning_rate": 7.3585426442175e-05, "loss": 0.671, "mean_token_accuracy": 0.8050806038081646, "num_tokens": 274945834.0, "step": 8614 }, { "entropy": 0.7889116518199444, "epoch": 0.7926348899661302, "grad_norm": 0.15525148808956146, "learning_rate": 7.358235961603336e-05, "loss": 0.7707, "mean_token_accuracy": 0.770535834133625, "num_tokens": 274978281.0, "step": 8615 }, { "entropy": 0.6177563574165106, "epoch": 0.7927268963375714, "grad_norm": 0.16196255385875702, "learning_rate": 7.357929278989175e-05, "loss": 0.5885, "mean_token_accuracy": 0.8139913156628609, "num_tokens": 275009828.0, "step": 8616 }, { "entropy": 0.7713784947991371, "epoch": 0.7928189027090126, "grad_norm": 0.16558709740638733, "learning_rate": 7.357622596375013e-05, "loss": 0.7718, "mean_token_accuracy": 0.7705737873911858, "num_tokens": 275041522.0, "step": 8617 }, { "entropy": 0.8728860784322023, "epoch": 0.7929109090804538, "grad_norm": 0.16619348526000977, "learning_rate": 7.35731591376085e-05, "loss": 0.8853, "mean_token_accuracy": 0.7450478672981262, "num_tokens": 275073346.0, "step": 8618 }, { "entropy": 0.7422376433387399, "epoch": 0.793002915451895, "grad_norm": 0.1575368046760559, "learning_rate": 7.357009231146686e-05, "loss": 0.7432, "mean_token_accuracy": 0.7843665890395641, "num_tokens": 275105301.0, "step": 8619 }, { "entropy": 0.7688485234975815, "epoch": 0.7930949218233363, "grad_norm": 0.1515977531671524, "learning_rate": 7.356702548532523e-05, "loss": 0.7555, "mean_token_accuracy": 0.7753106392920017, "num_tokens": 275137393.0, "step": 8620 }, { "entropy": 0.8319140635430813, "epoch": 0.7931869281947775, "grad_norm": 0.1590123325586319, "learning_rate": 7.356395865918361e-05, "loss": 0.8211, "mean_token_accuracy": 0.7576138712465763, "num_tokens": 275169175.0, "step": 8621 }, { "entropy": 0.7218499965965748, "epoch": 0.7932789345662187, "grad_norm": 0.16193337738513947, "learning_rate": 7.3560891833042e-05, "loss": 0.7092, "mean_token_accuracy": 0.7880433686077595, "num_tokens": 275201523.0, "step": 8622 }, { "entropy": 0.8927723821252584, "epoch": 0.7933709409376599, "grad_norm": 0.16460934281349182, "learning_rate": 7.355782500690036e-05, "loss": 0.8835, "mean_token_accuracy": 0.7409804463386536, "num_tokens": 275232969.0, "step": 8623 }, { "entropy": 0.733483949676156, "epoch": 0.7934629473091012, "grad_norm": 0.16281366348266602, "learning_rate": 7.355475818075873e-05, "loss": 0.7135, "mean_token_accuracy": 0.7930534966289997, "num_tokens": 275264713.0, "step": 8624 }, { "entropy": 0.5529687674716115, "epoch": 0.7935549536805424, "grad_norm": 0.15843969583511353, "learning_rate": 7.355169135461711e-05, "loss": 0.532, "mean_token_accuracy": 0.8385082222521305, "num_tokens": 275296850.0, "step": 8625 }, { "entropy": 0.7217599246650934, "epoch": 0.7936469600519837, "grad_norm": 0.14874383807182312, "learning_rate": 7.354862452847548e-05, "loss": 0.6937, "mean_token_accuracy": 0.7927995882928371, "num_tokens": 275327921.0, "step": 8626 }, { "entropy": 0.6552297063171864, "epoch": 0.7937389664234248, "grad_norm": 0.15190809965133667, "learning_rate": 7.354555770233386e-05, "loss": 0.6329, "mean_token_accuracy": 0.8115664087235928, "num_tokens": 275359583.0, "step": 8627 }, { "entropy": 0.7160813882946968, "epoch": 0.793830972794866, "grad_norm": 0.15713636577129364, "learning_rate": 7.354249087619223e-05, "loss": 0.7008, "mean_token_accuracy": 0.7943427078425884, "num_tokens": 275391372.0, "step": 8628 }, { "entropy": 0.7218711394816637, "epoch": 0.7939229791663073, "grad_norm": 0.16313666105270386, "learning_rate": 7.353942405005061e-05, "loss": 0.7227, "mean_token_accuracy": 0.7872022613883018, "num_tokens": 275423353.0, "step": 8629 }, { "entropy": 0.8043688908219337, "epoch": 0.7940149855377485, "grad_norm": 0.15272633731365204, "learning_rate": 7.353635722390898e-05, "loss": 0.7739, "mean_token_accuracy": 0.7699203416705132, "num_tokens": 275455592.0, "step": 8630 }, { "entropy": 0.7237706948071718, "epoch": 0.7941069919091898, "grad_norm": 0.15718333423137665, "learning_rate": 7.353329039776735e-05, "loss": 0.6937, "mean_token_accuracy": 0.7940209098160267, "num_tokens": 275488058.0, "step": 8631 }, { "entropy": 0.6940217334777117, "epoch": 0.7941989982806309, "grad_norm": 0.146015003323555, "learning_rate": 7.353022357162573e-05, "loss": 0.6791, "mean_token_accuracy": 0.7960436791181564, "num_tokens": 275520431.0, "step": 8632 }, { "entropy": 0.7181407762691379, "epoch": 0.7942910046520721, "grad_norm": 0.16015562415122986, "learning_rate": 7.352715674548411e-05, "loss": 0.7121, "mean_token_accuracy": 0.7899916768074036, "num_tokens": 275552922.0, "step": 8633 }, { "entropy": 0.7375677917152643, "epoch": 0.7943830110235134, "grad_norm": 0.14811429381370544, "learning_rate": 7.352408991934248e-05, "loss": 0.7249, "mean_token_accuracy": 0.7809288054704666, "num_tokens": 275584740.0, "step": 8634 }, { "entropy": 0.8046506606042385, "epoch": 0.7944750173949546, "grad_norm": 0.17203399538993835, "learning_rate": 7.352102309320084e-05, "loss": 0.8253, "mean_token_accuracy": 0.7674262449145317, "num_tokens": 275616788.0, "step": 8635 }, { "entropy": 0.749617600813508, "epoch": 0.7945670237663959, "grad_norm": 0.15952078998088837, "learning_rate": 7.351795626705923e-05, "loss": 0.7386, "mean_token_accuracy": 0.7817649841308594, "num_tokens": 275648832.0, "step": 8636 }, { "entropy": 0.6641843467950821, "epoch": 0.794659030137837, "grad_norm": 0.1518545001745224, "learning_rate": 7.35148894409176e-05, "loss": 0.6458, "mean_token_accuracy": 0.8047825545072556, "num_tokens": 275681337.0, "step": 8637 }, { "entropy": 0.8102107010781765, "epoch": 0.7947510365092783, "grad_norm": 0.17020367085933685, "learning_rate": 7.351182261477597e-05, "loss": 0.7951, "mean_token_accuracy": 0.7689100131392479, "num_tokens": 275713722.0, "step": 8638 }, { "entropy": 0.7284613084048033, "epoch": 0.7948430428807195, "grad_norm": 0.1512845903635025, "learning_rate": 7.350875578863434e-05, "loss": 0.7239, "mean_token_accuracy": 0.7883278056979179, "num_tokens": 275745345.0, "step": 8639 }, { "entropy": 0.7759668901562691, "epoch": 0.7949350492521607, "grad_norm": 0.1513255089521408, "learning_rate": 7.350568896249272e-05, "loss": 0.751, "mean_token_accuracy": 0.7834436632692814, "num_tokens": 275777339.0, "step": 8640 }, { "entropy": 0.8371236640959978, "epoch": 0.795027055623602, "grad_norm": 0.1595459282398224, "learning_rate": 7.350262213635109e-05, "loss": 0.8263, "mean_token_accuracy": 0.7535664848983288, "num_tokens": 275809106.0, "step": 8641 }, { "entropy": 0.7633695490658283, "epoch": 0.7951190619950431, "grad_norm": 0.1672288030385971, "learning_rate": 7.349955531020947e-05, "loss": 0.7468, "mean_token_accuracy": 0.7804617285728455, "num_tokens": 275840997.0, "step": 8642 }, { "entropy": 0.7817872315645218, "epoch": 0.7952110683664844, "grad_norm": 0.1579856276512146, "learning_rate": 7.349648848406784e-05, "loss": 0.7712, "mean_token_accuracy": 0.7789361625909805, "num_tokens": 275873216.0, "step": 8643 }, { "entropy": 0.7378325667232275, "epoch": 0.7953030747379256, "grad_norm": 0.15226268768310547, "learning_rate": 7.349342165792622e-05, "loss": 0.7281, "mean_token_accuracy": 0.7871750332415104, "num_tokens": 275905806.0, "step": 8644 }, { "entropy": 0.8145085666328669, "epoch": 0.7953950811093669, "grad_norm": 0.1576419323682785, "learning_rate": 7.349035483178459e-05, "loss": 0.8043, "mean_token_accuracy": 0.7631847225129604, "num_tokens": 275937687.0, "step": 8645 }, { "entropy": 0.7110970262438059, "epoch": 0.7954870874808081, "grad_norm": 0.16469496488571167, "learning_rate": 7.348728800564296e-05, "loss": 0.7176, "mean_token_accuracy": 0.7880043126642704, "num_tokens": 275969271.0, "step": 8646 }, { "entropy": 0.7856228332966566, "epoch": 0.7955790938522492, "grad_norm": 0.16110827028751373, "learning_rate": 7.348422117950134e-05, "loss": 0.7953, "mean_token_accuracy": 0.7684356980025768, "num_tokens": 276001116.0, "step": 8647 }, { "entropy": 0.7973865792155266, "epoch": 0.7956711002236905, "grad_norm": 0.16899259388446808, "learning_rate": 7.348115435335972e-05, "loss": 0.8199, "mean_token_accuracy": 0.7635311968624592, "num_tokens": 276032945.0, "step": 8648 }, { "entropy": 0.7216665148735046, "epoch": 0.7957631065951317, "grad_norm": 0.16332603991031647, "learning_rate": 7.347808752721809e-05, "loss": 0.7262, "mean_token_accuracy": 0.7846609950065613, "num_tokens": 276064138.0, "step": 8649 }, { "entropy": 0.6718251667916775, "epoch": 0.795855112966573, "grad_norm": 0.15148352086544037, "learning_rate": 7.347502070107646e-05, "loss": 0.6642, "mean_token_accuracy": 0.801823478192091, "num_tokens": 276096105.0, "step": 8650 }, { "entropy": 0.8296542838215828, "epoch": 0.7959471193380142, "grad_norm": 0.16838936507701874, "learning_rate": 7.347195387493482e-05, "loss": 0.8328, "mean_token_accuracy": 0.755806315690279, "num_tokens": 276128253.0, "step": 8651 }, { "entropy": 0.6998727340251207, "epoch": 0.7960391257094553, "grad_norm": 0.1535198986530304, "learning_rate": 7.34688870487932e-05, "loss": 0.6857, "mean_token_accuracy": 0.7980379797518253, "num_tokens": 276160397.0, "step": 8652 }, { "entropy": 0.7737140357494354, "epoch": 0.7961311320808966, "grad_norm": 0.16579480469226837, "learning_rate": 7.346582022265159e-05, "loss": 0.7749, "mean_token_accuracy": 0.7687743678689003, "num_tokens": 276192401.0, "step": 8653 }, { "entropy": 0.7474843673408031, "epoch": 0.7962231384523378, "grad_norm": 0.161149263381958, "learning_rate": 7.346275339650996e-05, "loss": 0.7327, "mean_token_accuracy": 0.7795789241790771, "num_tokens": 276224390.0, "step": 8654 }, { "entropy": 0.7095134984701872, "epoch": 0.7963151448237791, "grad_norm": 0.15165315568447113, "learning_rate": 7.345968657036832e-05, "loss": 0.6852, "mean_token_accuracy": 0.7921774163842201, "num_tokens": 276256795.0, "step": 8655 }, { "entropy": 0.7780853118747473, "epoch": 0.7964071511952203, "grad_norm": 0.15648497641086578, "learning_rate": 7.34566197442267e-05, "loss": 0.7547, "mean_token_accuracy": 0.7774479165673256, "num_tokens": 276289205.0, "step": 8656 }, { "entropy": 0.7889130860567093, "epoch": 0.7964991575666615, "grad_norm": 0.16835397481918335, "learning_rate": 7.345355291808507e-05, "loss": 0.76, "mean_token_accuracy": 0.7705518156290054, "num_tokens": 276320263.0, "step": 8657 }, { "entropy": 0.7816012986004353, "epoch": 0.7965911639381027, "grad_norm": 0.15050090849399567, "learning_rate": 7.345048609194345e-05, "loss": 0.7611, "mean_token_accuracy": 0.7725670672953129, "num_tokens": 276352490.0, "step": 8658 }, { "entropy": 0.815913874655962, "epoch": 0.7966831703095439, "grad_norm": 0.15915587544441223, "learning_rate": 7.344741926580182e-05, "loss": 0.7886, "mean_token_accuracy": 0.7668149881064892, "num_tokens": 276384998.0, "step": 8659 }, { "entropy": 0.7811201587319374, "epoch": 0.7967751766809852, "grad_norm": 0.1592133790254593, "learning_rate": 7.34443524396602e-05, "loss": 0.7706, "mean_token_accuracy": 0.7704102098941803, "num_tokens": 276416417.0, "step": 8660 }, { "entropy": 0.6987581262364984, "epoch": 0.7968671830524264, "grad_norm": 0.15221545100212097, "learning_rate": 7.344128561351857e-05, "loss": 0.6641, "mean_token_accuracy": 0.8054456077516079, "num_tokens": 276448874.0, "step": 8661 }, { "entropy": 0.7686122385784984, "epoch": 0.7969591894238676, "grad_norm": 0.15034542977809906, "learning_rate": 7.343821878737694e-05, "loss": 0.777, "mean_token_accuracy": 0.7690579667687416, "num_tokens": 276481291.0, "step": 8662 }, { "entropy": 0.8562644035555422, "epoch": 0.7970511957953088, "grad_norm": 0.16038477420806885, "learning_rate": 7.343515196123532e-05, "loss": 0.8535, "mean_token_accuracy": 0.7549153566360474, "num_tokens": 276513667.0, "step": 8663 }, { "entropy": 0.7356301285326481, "epoch": 0.79714320216675, "grad_norm": 0.15742000937461853, "learning_rate": 7.34320851350937e-05, "loss": 0.7437, "mean_token_accuracy": 0.7810259982943535, "num_tokens": 276545662.0, "step": 8664 }, { "entropy": 0.6638048551976681, "epoch": 0.7972352085381913, "grad_norm": 0.1561233252286911, "learning_rate": 7.342901830895207e-05, "loss": 0.6501, "mean_token_accuracy": 0.8066902607679367, "num_tokens": 276577897.0, "step": 8665 }, { "entropy": 0.6835841406136751, "epoch": 0.7973272149096325, "grad_norm": 0.1634513884782791, "learning_rate": 7.342595148281044e-05, "loss": 0.6619, "mean_token_accuracy": 0.798008993268013, "num_tokens": 276609292.0, "step": 8666 }, { "entropy": 0.6109954845160246, "epoch": 0.7974192212810737, "grad_norm": 0.1543463170528412, "learning_rate": 7.342288465666882e-05, "loss": 0.597, "mean_token_accuracy": 0.8212644495069981, "num_tokens": 276641200.0, "step": 8667 }, { "entropy": 0.7426529694348574, "epoch": 0.7975112276525149, "grad_norm": 0.1565074324607849, "learning_rate": 7.341981783052719e-05, "loss": 0.7131, "mean_token_accuracy": 0.7879211641848087, "num_tokens": 276672906.0, "step": 8668 }, { "entropy": 0.7236555814743042, "epoch": 0.7976032340239562, "grad_norm": 0.1670968383550644, "learning_rate": 7.341675100438557e-05, "loss": 0.6841, "mean_token_accuracy": 0.7947533316910267, "num_tokens": 276704391.0, "step": 8669 }, { "entropy": 0.6885641515254974, "epoch": 0.7976952403953974, "grad_norm": 0.1544513702392578, "learning_rate": 7.341368417824394e-05, "loss": 0.6749, "mean_token_accuracy": 0.8012617863714695, "num_tokens": 276735687.0, "step": 8670 }, { "entropy": 0.7186551298946142, "epoch": 0.7977872467668387, "grad_norm": 0.15337605774402618, "learning_rate": 7.341061735210232e-05, "loss": 0.6968, "mean_token_accuracy": 0.7893872745335102, "num_tokens": 276767169.0, "step": 8671 }, { "entropy": 0.7140410942956805, "epoch": 0.7978792531382798, "grad_norm": 0.15784403681755066, "learning_rate": 7.340755052596069e-05, "loss": 0.717, "mean_token_accuracy": 0.7908207699656487, "num_tokens": 276799307.0, "step": 8672 }, { "entropy": 0.7336580008268356, "epoch": 0.797971259509721, "grad_norm": 0.16007699072360992, "learning_rate": 7.340448369981905e-05, "loss": 0.7118, "mean_token_accuracy": 0.7888613939285278, "num_tokens": 276831128.0, "step": 8673 }, { "entropy": 0.6848418023437262, "epoch": 0.7980632658811623, "grad_norm": 0.1710948646068573, "learning_rate": 7.340141687367743e-05, "loss": 0.6559, "mean_token_accuracy": 0.80562574416399, "num_tokens": 276862990.0, "step": 8674 }, { "entropy": 0.7612132085487247, "epoch": 0.7981552722526035, "grad_norm": 0.15439791977405548, "learning_rate": 7.339835004753582e-05, "loss": 0.7532, "mean_token_accuracy": 0.7762806378304958, "num_tokens": 276894773.0, "step": 8675 }, { "entropy": 0.7526262812316418, "epoch": 0.7982472786240448, "grad_norm": 0.16133055090904236, "learning_rate": 7.339528322139418e-05, "loss": 0.7359, "mean_token_accuracy": 0.7771245688199997, "num_tokens": 276926299.0, "step": 8676 }, { "entropy": 0.7019932009279728, "epoch": 0.7983392849954859, "grad_norm": 0.16710074245929718, "learning_rate": 7.339221639525255e-05, "loss": 0.702, "mean_token_accuracy": 0.7942386940121651, "num_tokens": 276958765.0, "step": 8677 }, { "entropy": 0.8070729710161686, "epoch": 0.7984312913669271, "grad_norm": 0.15946589410305023, "learning_rate": 7.338914956911093e-05, "loss": 0.7962, "mean_token_accuracy": 0.7678358778357506, "num_tokens": 276990599.0, "step": 8678 }, { "entropy": 0.7685145139694214, "epoch": 0.7985232977383684, "grad_norm": 0.1535957157611847, "learning_rate": 7.338608274296931e-05, "loss": 0.7524, "mean_token_accuracy": 0.7762715555727482, "num_tokens": 277022549.0, "step": 8679 }, { "entropy": 0.7281819079071283, "epoch": 0.7986153041098096, "grad_norm": 0.1561039388179779, "learning_rate": 7.338301591682768e-05, "loss": 0.7003, "mean_token_accuracy": 0.7871804945170879, "num_tokens": 277053972.0, "step": 8680 }, { "entropy": 0.7546409610658884, "epoch": 0.7987073104812509, "grad_norm": 0.1641690731048584, "learning_rate": 7.337994909068605e-05, "loss": 0.7469, "mean_token_accuracy": 0.7793191596865654, "num_tokens": 277086634.0, "step": 8681 }, { "entropy": 0.7258099932223558, "epoch": 0.798799316852692, "grad_norm": 0.15330316126346588, "learning_rate": 7.337688226454442e-05, "loss": 0.7087, "mean_token_accuracy": 0.7897977940738201, "num_tokens": 277118126.0, "step": 8682 }, { "entropy": 0.6473147533833981, "epoch": 0.7988913232241333, "grad_norm": 0.16976962983608246, "learning_rate": 7.33738154384028e-05, "loss": 0.6343, "mean_token_accuracy": 0.8130328804254532, "num_tokens": 277150788.0, "step": 8683 }, { "entropy": 0.7093620523810387, "epoch": 0.7989833295955745, "grad_norm": 0.15558768808841705, "learning_rate": 7.337074861226118e-05, "loss": 0.7172, "mean_token_accuracy": 0.7904948033392429, "num_tokens": 277183412.0, "step": 8684 }, { "entropy": 0.6786512937396765, "epoch": 0.7990753359670157, "grad_norm": 0.1613267958164215, "learning_rate": 7.336768178611955e-05, "loss": 0.6826, "mean_token_accuracy": 0.7981942854821682, "num_tokens": 277215441.0, "step": 8685 }, { "entropy": 0.6748366234824061, "epoch": 0.799167342338457, "grad_norm": 0.15456122159957886, "learning_rate": 7.336461495997792e-05, "loss": 0.6541, "mean_token_accuracy": 0.8098076432943344, "num_tokens": 277247000.0, "step": 8686 }, { "entropy": 0.7227402869611979, "epoch": 0.7992593487098981, "grad_norm": 0.159025177359581, "learning_rate": 7.33615481338363e-05, "loss": 0.7123, "mean_token_accuracy": 0.7895055040717125, "num_tokens": 277277958.0, "step": 8687 }, { "entropy": 0.7220110092312098, "epoch": 0.7993513550813394, "grad_norm": 0.16631846129894257, "learning_rate": 7.335848130769467e-05, "loss": 0.7306, "mean_token_accuracy": 0.7850747294723988, "num_tokens": 277309642.0, "step": 8688 }, { "entropy": 0.7130556087940931, "epoch": 0.7994433614527806, "grad_norm": 0.16178148984909058, "learning_rate": 7.335541448155305e-05, "loss": 0.7003, "mean_token_accuracy": 0.7939271405339241, "num_tokens": 277341644.0, "step": 8689 }, { "entropy": 0.7425155211240053, "epoch": 0.7995353678242219, "grad_norm": 0.15410476922988892, "learning_rate": 7.335234765541142e-05, "loss": 0.728, "mean_token_accuracy": 0.7828730829060078, "num_tokens": 277373582.0, "step": 8690 }, { "entropy": 0.6797556346282363, "epoch": 0.7996273741956631, "grad_norm": 0.14900648593902588, "learning_rate": 7.33492808292698e-05, "loss": 0.6587, "mean_token_accuracy": 0.8034528084099293, "num_tokens": 277405720.0, "step": 8691 }, { "entropy": 0.7183944098651409, "epoch": 0.7997193805671042, "grad_norm": 0.15787851810455322, "learning_rate": 7.334621400312816e-05, "loss": 0.7065, "mean_token_accuracy": 0.7908086962997913, "num_tokens": 277437819.0, "step": 8692 }, { "entropy": 0.8576727956533432, "epoch": 0.7998113869385455, "grad_norm": 0.16370825469493866, "learning_rate": 7.334314717698653e-05, "loss": 0.8472, "mean_token_accuracy": 0.756616685539484, "num_tokens": 277469928.0, "step": 8693 }, { "entropy": 0.6558112646453083, "epoch": 0.7999033933099867, "grad_norm": 0.14706553518772125, "learning_rate": 7.334008035084491e-05, "loss": 0.6421, "mean_token_accuracy": 0.8108944296836853, "num_tokens": 277502167.0, "step": 8694 }, { "entropy": 0.6259125154465437, "epoch": 0.799995399681428, "grad_norm": 0.15183736383914948, "learning_rate": 7.33370135247033e-05, "loss": 0.6169, "mean_token_accuracy": 0.8158285468816757, "num_tokens": 277534499.0, "step": 8695 }, { "entropy": 0.7401563841849566, "epoch": 0.8000874060528692, "grad_norm": 0.16472914814949036, "learning_rate": 7.333394669856166e-05, "loss": 0.7298, "mean_token_accuracy": 0.7833366319537163, "num_tokens": 277566539.0, "step": 8696 }, { "entropy": 0.7483876124024391, "epoch": 0.8001794124243103, "grad_norm": 0.1498461365699768, "learning_rate": 7.333087987242003e-05, "loss": 0.7454, "mean_token_accuracy": 0.779013030230999, "num_tokens": 277598643.0, "step": 8697 }, { "entropy": 0.6960453726351261, "epoch": 0.8002714187957516, "grad_norm": 0.14938275516033173, "learning_rate": 7.332781304627841e-05, "loss": 0.673, "mean_token_accuracy": 0.7992946580052376, "num_tokens": 277630138.0, "step": 8698 }, { "entropy": 0.7879940047860146, "epoch": 0.8003634251671928, "grad_norm": 0.1641312688589096, "learning_rate": 7.332474622013678e-05, "loss": 0.7906, "mean_token_accuracy": 0.7687594965100288, "num_tokens": 277662010.0, "step": 8699 }, { "entropy": 0.6813267953693867, "epoch": 0.8004554315386341, "grad_norm": 0.15466268360614777, "learning_rate": 7.332167939399516e-05, "loss": 0.681, "mean_token_accuracy": 0.7962678074836731, "num_tokens": 277693905.0, "step": 8700 }, { "entropy": 0.6661997158080339, "epoch": 0.8005474379100753, "grad_norm": 0.16913190484046936, "learning_rate": 7.331861256785353e-05, "loss": 0.6475, "mean_token_accuracy": 0.8062079288065434, "num_tokens": 277725455.0, "step": 8701 }, { "entropy": 0.7527295667678118, "epoch": 0.8006394442815165, "grad_norm": 0.14732486009597778, "learning_rate": 7.331554574171191e-05, "loss": 0.7459, "mean_token_accuracy": 0.7816265635192394, "num_tokens": 277756909.0, "step": 8702 }, { "entropy": 0.7220632694661617, "epoch": 0.8007314506529577, "grad_norm": 0.15043924748897552, "learning_rate": 7.331247891557028e-05, "loss": 0.718, "mean_token_accuracy": 0.7884098626673222, "num_tokens": 277789677.0, "step": 8703 }, { "entropy": 0.8219965286552906, "epoch": 0.8008234570243989, "grad_norm": 0.1551295518875122, "learning_rate": 7.330941208942865e-05, "loss": 0.8172, "mean_token_accuracy": 0.7622773312032223, "num_tokens": 277821924.0, "step": 8704 }, { "entropy": 0.5846951603889465, "epoch": 0.8009154633958402, "grad_norm": 0.14840760827064514, "learning_rate": 7.330634526328703e-05, "loss": 0.583, "mean_token_accuracy": 0.8244711756706238, "num_tokens": 277853997.0, "step": 8705 }, { "entropy": 0.7002903008833528, "epoch": 0.8010074697672814, "grad_norm": 0.1630277782678604, "learning_rate": 7.330327843714541e-05, "loss": 0.6791, "mean_token_accuracy": 0.8004847094416618, "num_tokens": 277886204.0, "step": 8706 }, { "entropy": 0.7941499054431915, "epoch": 0.8010994761387226, "grad_norm": 0.15977531671524048, "learning_rate": 7.330021161100378e-05, "loss": 0.7817, "mean_token_accuracy": 0.7736492678523064, "num_tokens": 277918007.0, "step": 8707 }, { "entropy": 0.7483111601322889, "epoch": 0.8011914825101638, "grad_norm": 0.1610647737979889, "learning_rate": 7.329714478486215e-05, "loss": 0.7288, "mean_token_accuracy": 0.7870013453066349, "num_tokens": 277950047.0, "step": 8708 }, { "entropy": 0.8663951978087425, "epoch": 0.801283488881605, "grad_norm": 0.18526670336723328, "learning_rate": 7.329407795872051e-05, "loss": 0.8572, "mean_token_accuracy": 0.7490371391177177, "num_tokens": 277981906.0, "step": 8709 }, { "entropy": 0.6642525680363178, "epoch": 0.8013754952530463, "grad_norm": 0.15457867085933685, "learning_rate": 7.329101113257891e-05, "loss": 0.6494, "mean_token_accuracy": 0.8068163990974426, "num_tokens": 278014213.0, "step": 8710 }, { "entropy": 0.7144221179187298, "epoch": 0.8014675016244875, "grad_norm": 0.15216219425201416, "learning_rate": 7.328794430643728e-05, "loss": 0.7072, "mean_token_accuracy": 0.7916690111160278, "num_tokens": 278046474.0, "step": 8711 }, { "entropy": 0.6468470860272646, "epoch": 0.8015595079959287, "grad_norm": 0.1518307328224182, "learning_rate": 7.328487748029564e-05, "loss": 0.6423, "mean_token_accuracy": 0.8126125521957874, "num_tokens": 278079038.0, "step": 8712 }, { "entropy": 0.7223338698968291, "epoch": 0.8016515143673699, "grad_norm": 0.15718403458595276, "learning_rate": 7.328181065415401e-05, "loss": 0.7252, "mean_token_accuracy": 0.7875550799071789, "num_tokens": 278111035.0, "step": 8713 }, { "entropy": 0.7767902743071318, "epoch": 0.8017435207388112, "grad_norm": 0.1617385298013687, "learning_rate": 7.32787438280124e-05, "loss": 0.762, "mean_token_accuracy": 0.7805095911026001, "num_tokens": 278143517.0, "step": 8714 }, { "entropy": 0.8084343895316124, "epoch": 0.8018355271102524, "grad_norm": 0.16689491271972656, "learning_rate": 7.327567700187077e-05, "loss": 0.8036, "mean_token_accuracy": 0.7646379433572292, "num_tokens": 278175949.0, "step": 8715 }, { "entropy": 0.677094804123044, "epoch": 0.8019275334816937, "grad_norm": 0.15737442672252655, "learning_rate": 7.327261017572914e-05, "loss": 0.6745, "mean_token_accuracy": 0.8010976389050484, "num_tokens": 278206930.0, "step": 8716 }, { "entropy": 0.6587237641215324, "epoch": 0.8020195398531348, "grad_norm": 0.15219268202781677, "learning_rate": 7.326954334958751e-05, "loss": 0.6382, "mean_token_accuracy": 0.8060249201953411, "num_tokens": 278238985.0, "step": 8717 }, { "entropy": 0.7126543559134007, "epoch": 0.802111546224576, "grad_norm": 0.1618020236492157, "learning_rate": 7.326647652344589e-05, "loss": 0.6923, "mean_token_accuracy": 0.7932676561176777, "num_tokens": 278270673.0, "step": 8718 }, { "entropy": 0.8643290400505066, "epoch": 0.8022035525960173, "grad_norm": 0.16150318086147308, "learning_rate": 7.326340969730426e-05, "loss": 0.8641, "mean_token_accuracy": 0.7541092038154602, "num_tokens": 278302999.0, "step": 8719 }, { "entropy": 0.7101536775007844, "epoch": 0.8022955589674585, "grad_norm": 0.1548486351966858, "learning_rate": 7.326034287116264e-05, "loss": 0.6871, "mean_token_accuracy": 0.799552146345377, "num_tokens": 278334911.0, "step": 8720 }, { "entropy": 0.701247725635767, "epoch": 0.8023875653388998, "grad_norm": 0.15377475321292877, "learning_rate": 7.325727604502101e-05, "loss": 0.6835, "mean_token_accuracy": 0.799418430775404, "num_tokens": 278366696.0, "step": 8721 }, { "entropy": 0.6602160832844675, "epoch": 0.8024795717103409, "grad_norm": 0.15044865012168884, "learning_rate": 7.325420921887939e-05, "loss": 0.6539, "mean_token_accuracy": 0.803980864584446, "num_tokens": 278398595.0, "step": 8722 }, { "entropy": 0.8016211502254009, "epoch": 0.8025715780817821, "grad_norm": 0.16784293949604034, "learning_rate": 7.325114239273776e-05, "loss": 0.7936, "mean_token_accuracy": 0.7657866030931473, "num_tokens": 278430127.0, "step": 8723 }, { "entropy": 0.7656143456697464, "epoch": 0.8026635844532234, "grad_norm": 0.15474581718444824, "learning_rate": 7.324807556659613e-05, "loss": 0.7466, "mean_token_accuracy": 0.7843096181750298, "num_tokens": 278461639.0, "step": 8724 }, { "entropy": 0.6726931966841221, "epoch": 0.8027555908246646, "grad_norm": 0.15069837868213654, "learning_rate": 7.324500874045451e-05, "loss": 0.6505, "mean_token_accuracy": 0.8045010343194008, "num_tokens": 278494081.0, "step": 8725 }, { "entropy": 0.6026321370154619, "epoch": 0.8028475971961059, "grad_norm": 0.1512342244386673, "learning_rate": 7.324194191431289e-05, "loss": 0.589, "mean_token_accuracy": 0.8220278434455395, "num_tokens": 278525866.0, "step": 8726 }, { "entropy": 0.8075893130153418, "epoch": 0.802939603567547, "grad_norm": 0.14818674325942993, "learning_rate": 7.323887508817126e-05, "loss": 0.7935, "mean_token_accuracy": 0.765643373131752, "num_tokens": 278558359.0, "step": 8727 }, { "entropy": 0.6202487647533417, "epoch": 0.8030316099389883, "grad_norm": 0.14054229855537415, "learning_rate": 7.323580826202962e-05, "loss": 0.608, "mean_token_accuracy": 0.8147233612835407, "num_tokens": 278590276.0, "step": 8728 }, { "entropy": 0.761592710390687, "epoch": 0.8031236163104295, "grad_norm": 0.156532883644104, "learning_rate": 7.3232741435888e-05, "loss": 0.7647, "mean_token_accuracy": 0.7748839184641838, "num_tokens": 278622357.0, "step": 8729 }, { "entropy": 0.7081341221928596, "epoch": 0.8032156226818707, "grad_norm": 0.15648281574249268, "learning_rate": 7.322967460974637e-05, "loss": 0.6899, "mean_token_accuracy": 0.7950776666402817, "num_tokens": 278653591.0, "step": 8730 }, { "entropy": 0.7878997065126896, "epoch": 0.803307629053312, "grad_norm": 0.15642079710960388, "learning_rate": 7.322660778360476e-05, "loss": 0.7683, "mean_token_accuracy": 0.770071305334568, "num_tokens": 278684869.0, "step": 8731 }, { "entropy": 0.6786263203248382, "epoch": 0.8033996354247531, "grad_norm": 0.15891626477241516, "learning_rate": 7.322354095746312e-05, "loss": 0.6695, "mean_token_accuracy": 0.7994782254099846, "num_tokens": 278716387.0, "step": 8732 }, { "entropy": 0.7461670525372028, "epoch": 0.8034916417961944, "grad_norm": 0.159740149974823, "learning_rate": 7.32204741313215e-05, "loss": 0.7274, "mean_token_accuracy": 0.7908696383237839, "num_tokens": 278748481.0, "step": 8733 }, { "entropy": 0.6884655393660069, "epoch": 0.8035836481676356, "grad_norm": 0.1571081280708313, "learning_rate": 7.321740730517987e-05, "loss": 0.6948, "mean_token_accuracy": 0.7933191321790218, "num_tokens": 278780179.0, "step": 8734 }, { "entropy": 0.7051366921514273, "epoch": 0.8036756545390769, "grad_norm": 0.15204043686389923, "learning_rate": 7.321434047903824e-05, "loss": 0.6995, "mean_token_accuracy": 0.7939106188714504, "num_tokens": 278812392.0, "step": 8735 }, { "entropy": 0.7418066514655948, "epoch": 0.8037676609105181, "grad_norm": 0.1719076782464981, "learning_rate": 7.321127365289662e-05, "loss": 0.7269, "mean_token_accuracy": 0.7858679890632629, "num_tokens": 278843833.0, "step": 8736 }, { "entropy": 0.7101117242127657, "epoch": 0.8038596672819592, "grad_norm": 0.15575529634952545, "learning_rate": 7.3208206826755e-05, "loss": 0.7052, "mean_token_accuracy": 0.7888794057071209, "num_tokens": 278876084.0, "step": 8737 }, { "entropy": 0.6791186928749084, "epoch": 0.8039516736534005, "grad_norm": 0.16253961622714996, "learning_rate": 7.320514000061337e-05, "loss": 0.6616, "mean_token_accuracy": 0.8061065338551998, "num_tokens": 278907970.0, "step": 8738 }, { "entropy": 0.794282941147685, "epoch": 0.8040436800248417, "grad_norm": 0.16508202254772186, "learning_rate": 7.320207317447174e-05, "loss": 0.7876, "mean_token_accuracy": 0.7680122330784798, "num_tokens": 278939596.0, "step": 8739 }, { "entropy": 0.6267684977501631, "epoch": 0.804135686396283, "grad_norm": 0.16101735830307007, "learning_rate": 7.319900634833011e-05, "loss": 0.6036, "mean_token_accuracy": 0.8127685971558094, "num_tokens": 278970763.0, "step": 8740 }, { "entropy": 0.5681100264191628, "epoch": 0.8042276927677242, "grad_norm": 0.1554991602897644, "learning_rate": 7.319593952218849e-05, "loss": 0.5582, "mean_token_accuracy": 0.8313648700714111, "num_tokens": 279002883.0, "step": 8741 }, { "entropy": 0.649780485779047, "epoch": 0.8043196991391653, "grad_norm": 0.15616890788078308, "learning_rate": 7.319287269604687e-05, "loss": 0.6348, "mean_token_accuracy": 0.8151688501238823, "num_tokens": 279034984.0, "step": 8742 }, { "entropy": 0.6754046753048897, "epoch": 0.8044117055106066, "grad_norm": 0.14419010281562805, "learning_rate": 7.318980586990524e-05, "loss": 0.6615, "mean_token_accuracy": 0.8046204261481762, "num_tokens": 279067698.0, "step": 8743 }, { "entropy": 0.6780106793157756, "epoch": 0.8045037118820478, "grad_norm": 0.15571212768554688, "learning_rate": 7.31867390437636e-05, "loss": 0.665, "mean_token_accuracy": 0.8009248077869415, "num_tokens": 279099656.0, "step": 8744 }, { "entropy": 0.8162395134568214, "epoch": 0.8045957182534891, "grad_norm": 0.17385460436344147, "learning_rate": 7.318367221762199e-05, "loss": 0.8123, "mean_token_accuracy": 0.762108501046896, "num_tokens": 279131443.0, "step": 8745 }, { "entropy": 0.7638941761106253, "epoch": 0.8046877246249303, "grad_norm": 0.1583751142024994, "learning_rate": 7.318060539148035e-05, "loss": 0.7468, "mean_token_accuracy": 0.7787830047309399, "num_tokens": 279162949.0, "step": 8746 }, { "entropy": 0.7053752020001411, "epoch": 0.8047797309963715, "grad_norm": 0.15668143332004547, "learning_rate": 7.317753856533874e-05, "loss": 0.6965, "mean_token_accuracy": 0.7940533608198166, "num_tokens": 279195648.0, "step": 8747 }, { "entropy": 0.764478761702776, "epoch": 0.8048717373678127, "grad_norm": 0.15658257901668549, "learning_rate": 7.31744717391971e-05, "loss": 0.7563, "mean_token_accuracy": 0.7804531790316105, "num_tokens": 279228105.0, "step": 8748 }, { "entropy": 0.7640081867575645, "epoch": 0.804963743739254, "grad_norm": 0.1552649736404419, "learning_rate": 7.317140491305549e-05, "loss": 0.7618, "mean_token_accuracy": 0.7718638107180595, "num_tokens": 279259051.0, "step": 8749 }, { "entropy": 0.7290884321555495, "epoch": 0.8050557501106952, "grad_norm": 0.15624821186065674, "learning_rate": 7.316833808691385e-05, "loss": 0.7274, "mean_token_accuracy": 0.78649527952075, "num_tokens": 279290600.0, "step": 8750 }, { "entropy": 0.7289764527231455, "epoch": 0.8051477564821364, "grad_norm": 0.1598057895898819, "learning_rate": 7.316527126077222e-05, "loss": 0.722, "mean_token_accuracy": 0.7894418723881245, "num_tokens": 279321742.0, "step": 8751 }, { "entropy": 0.727693947032094, "epoch": 0.8052397628535776, "grad_norm": 0.16058385372161865, "learning_rate": 7.31622044346306e-05, "loss": 0.7063, "mean_token_accuracy": 0.792288426309824, "num_tokens": 279353049.0, "step": 8752 }, { "entropy": 0.8461899943649769, "epoch": 0.8053317692250188, "grad_norm": 0.16353468596935272, "learning_rate": 7.315913760848898e-05, "loss": 0.8337, "mean_token_accuracy": 0.7580994479358196, "num_tokens": 279384153.0, "step": 8753 }, { "entropy": 0.717794869095087, "epoch": 0.8054237755964601, "grad_norm": 0.1647447794675827, "learning_rate": 7.315607078234735e-05, "loss": 0.7018, "mean_token_accuracy": 0.7961878068745136, "num_tokens": 279416197.0, "step": 8754 }, { "entropy": 0.815524410456419, "epoch": 0.8055157819679013, "grad_norm": 0.15477491915225983, "learning_rate": 7.315300395620572e-05, "loss": 0.7831, "mean_token_accuracy": 0.7716096118092537, "num_tokens": 279447460.0, "step": 8755 }, { "entropy": 0.6157420948147774, "epoch": 0.8056077883393425, "grad_norm": 0.1662493348121643, "learning_rate": 7.31499371300641e-05, "loss": 0.5984, "mean_token_accuracy": 0.8204924613237381, "num_tokens": 279479643.0, "step": 8756 }, { "entropy": 0.7537859617732465, "epoch": 0.8056997947107837, "grad_norm": 0.1528196483850479, "learning_rate": 7.314687030392248e-05, "loss": 0.7304, "mean_token_accuracy": 0.785501517355442, "num_tokens": 279512129.0, "step": 8757 }, { "entropy": 0.674949717707932, "epoch": 0.8057918010822249, "grad_norm": 0.15661700069904327, "learning_rate": 7.314380347778085e-05, "loss": 0.6565, "mean_token_accuracy": 0.8029296509921551, "num_tokens": 279544417.0, "step": 8758 }, { "entropy": 0.6889066845178604, "epoch": 0.8058838074536662, "grad_norm": 0.1549614816904068, "learning_rate": 7.314073665163922e-05, "loss": 0.6653, "mean_token_accuracy": 0.8001908957958221, "num_tokens": 279576002.0, "step": 8759 }, { "entropy": 0.7251291740685701, "epoch": 0.8059758138251074, "grad_norm": 0.1630224585533142, "learning_rate": 7.31376698254976e-05, "loss": 0.7217, "mean_token_accuracy": 0.7858989797532558, "num_tokens": 279607020.0, "step": 8760 }, { "entropy": 0.7478988692164421, "epoch": 0.8060678201965487, "grad_norm": 0.15109646320343018, "learning_rate": 7.313460299935597e-05, "loss": 0.7468, "mean_token_accuracy": 0.7814122959971428, "num_tokens": 279639067.0, "step": 8761 }, { "entropy": 0.6018506120890379, "epoch": 0.8061598265679898, "grad_norm": 0.15372908115386963, "learning_rate": 7.313153617321435e-05, "loss": 0.5829, "mean_token_accuracy": 0.8228732533752918, "num_tokens": 279670714.0, "step": 8762 }, { "entropy": 0.6822966281324625, "epoch": 0.806251832939431, "grad_norm": 0.15836812555789948, "learning_rate": 7.312846934707272e-05, "loss": 0.6695, "mean_token_accuracy": 0.8001716956496239, "num_tokens": 279702562.0, "step": 8763 }, { "entropy": 0.6144524896517396, "epoch": 0.8063438393108723, "grad_norm": 0.1546555459499359, "learning_rate": 7.31254025209311e-05, "loss": 0.5958, "mean_token_accuracy": 0.821291096508503, "num_tokens": 279734457.0, "step": 8764 }, { "entropy": 0.6787190530449152, "epoch": 0.8064358456823135, "grad_norm": 0.16779188811779022, "learning_rate": 7.312233569478947e-05, "loss": 0.6765, "mean_token_accuracy": 0.7989127673208714, "num_tokens": 279766373.0, "step": 8765 }, { "entropy": 0.6551671717315912, "epoch": 0.8065278520537548, "grad_norm": 0.1707802265882492, "learning_rate": 7.311926886864783e-05, "loss": 0.6326, "mean_token_accuracy": 0.8082478009164333, "num_tokens": 279797342.0, "step": 8766 }, { "entropy": 0.7121847751550376, "epoch": 0.8066198584251959, "grad_norm": 0.16339369118213654, "learning_rate": 7.311620204250622e-05, "loss": 0.7078, "mean_token_accuracy": 0.7933313101530075, "num_tokens": 279829178.0, "step": 8767 }, { "entropy": 0.7780629508197308, "epoch": 0.8067118647966371, "grad_norm": 0.16245633363723755, "learning_rate": 7.31131352163646e-05, "loss": 0.7664, "mean_token_accuracy": 0.7753198742866516, "num_tokens": 279861716.0, "step": 8768 }, { "entropy": 0.6603033030405641, "epoch": 0.8068038711680784, "grad_norm": 0.15072911977767944, "learning_rate": 7.311006839022297e-05, "loss": 0.6491, "mean_token_accuracy": 0.808539692312479, "num_tokens": 279894083.0, "step": 8769 }, { "entropy": 0.7447666190564632, "epoch": 0.8068958775395196, "grad_norm": 0.15414448082447052, "learning_rate": 7.310700156408133e-05, "loss": 0.7261, "mean_token_accuracy": 0.7853901386260986, "num_tokens": 279925804.0, "step": 8770 }, { "entropy": 0.7642114870250225, "epoch": 0.8069878839109609, "grad_norm": 0.16136810183525085, "learning_rate": 7.31039347379397e-05, "loss": 0.7493, "mean_token_accuracy": 0.7821925990283489, "num_tokens": 279957513.0, "step": 8771 }, { "entropy": 0.6411701454780996, "epoch": 0.807079890282402, "grad_norm": 0.1461721658706665, "learning_rate": 7.310086791179808e-05, "loss": 0.6155, "mean_token_accuracy": 0.8121973536908627, "num_tokens": 279989492.0, "step": 8772 }, { "entropy": 0.716025922447443, "epoch": 0.8071718966538433, "grad_norm": 0.15767790377140045, "learning_rate": 7.309780108565646e-05, "loss": 0.6904, "mean_token_accuracy": 0.7948335558176041, "num_tokens": 280021064.0, "step": 8773 }, { "entropy": 0.7803935967385769, "epoch": 0.8072639030252845, "grad_norm": 0.15702877938747406, "learning_rate": 7.309473425951483e-05, "loss": 0.7722, "mean_token_accuracy": 0.7742666453123093, "num_tokens": 280052760.0, "step": 8774 }, { "entropy": 0.7312551867216825, "epoch": 0.8073559093967257, "grad_norm": 0.153609499335289, "learning_rate": 7.30916674333732e-05, "loss": 0.7124, "mean_token_accuracy": 0.7903361357748508, "num_tokens": 280083883.0, "step": 8775 }, { "entropy": 0.6171490252017975, "epoch": 0.807447915768167, "grad_norm": 0.16608518362045288, "learning_rate": 7.308860060723158e-05, "loss": 0.6033, "mean_token_accuracy": 0.8196253105998039, "num_tokens": 280115977.0, "step": 8776 }, { "entropy": 0.6944465292617679, "epoch": 0.8075399221396081, "grad_norm": 0.15697593986988068, "learning_rate": 7.308553378108995e-05, "loss": 0.6537, "mean_token_accuracy": 0.8060253337025642, "num_tokens": 280148085.0, "step": 8777 }, { "entropy": 0.7477563815191388, "epoch": 0.8076319285110494, "grad_norm": 0.16390866041183472, "learning_rate": 7.308246695494833e-05, "loss": 0.7298, "mean_token_accuracy": 0.7943333126604557, "num_tokens": 280178993.0, "step": 8778 }, { "entropy": 0.7890052832663059, "epoch": 0.8077239348824906, "grad_norm": 0.15958985686302185, "learning_rate": 7.30794001288067e-05, "loss": 0.7784, "mean_token_accuracy": 0.7717009298503399, "num_tokens": 280210723.0, "step": 8779 }, { "entropy": 0.6532865557819605, "epoch": 0.8078159412539319, "grad_norm": 0.14981915056705475, "learning_rate": 7.307633330266508e-05, "loss": 0.6362, "mean_token_accuracy": 0.8062329888343811, "num_tokens": 280242276.0, "step": 8780 }, { "entropy": 0.7250798530876637, "epoch": 0.8079079476253731, "grad_norm": 0.14457906782627106, "learning_rate": 7.307326647652345e-05, "loss": 0.7094, "mean_token_accuracy": 0.7900694347918034, "num_tokens": 280274448.0, "step": 8781 }, { "entropy": 0.8043064400553703, "epoch": 0.8079999539968142, "grad_norm": 0.16484344005584717, "learning_rate": 7.307019965038182e-05, "loss": 0.786, "mean_token_accuracy": 0.7698336355388165, "num_tokens": 280305154.0, "step": 8782 }, { "entropy": 0.6740787765011191, "epoch": 0.8080919603682555, "grad_norm": 0.16965307295322418, "learning_rate": 7.30671328242402e-05, "loss": 0.6563, "mean_token_accuracy": 0.8050937242805958, "num_tokens": 280336962.0, "step": 8783 }, { "entropy": 0.8254942670464516, "epoch": 0.8081839667396967, "grad_norm": 0.1642749309539795, "learning_rate": 7.306406599809858e-05, "loss": 0.8321, "mean_token_accuracy": 0.7613161467015743, "num_tokens": 280368441.0, "step": 8784 }, { "entropy": 0.700109576806426, "epoch": 0.808275973111138, "grad_norm": 0.15932878851890564, "learning_rate": 7.306099917195695e-05, "loss": 0.6966, "mean_token_accuracy": 0.7926087751984596, "num_tokens": 280400048.0, "step": 8785 }, { "entropy": 0.653129430487752, "epoch": 0.8083679794825792, "grad_norm": 0.16596299409866333, "learning_rate": 7.305793234581531e-05, "loss": 0.6577, "mean_token_accuracy": 0.8042387515306473, "num_tokens": 280431656.0, "step": 8786 }, { "entropy": 0.6785263521596789, "epoch": 0.8084599858540203, "grad_norm": 0.16019345819950104, "learning_rate": 7.30548655196737e-05, "loss": 0.6685, "mean_token_accuracy": 0.7992553859949112, "num_tokens": 280463416.0, "step": 8787 }, { "entropy": 0.7235721964389086, "epoch": 0.8085519922254616, "grad_norm": 0.15358476340770721, "learning_rate": 7.305179869353206e-05, "loss": 0.7255, "mean_token_accuracy": 0.7882106862962246, "num_tokens": 280494869.0, "step": 8788 }, { "entropy": 0.7660503722727299, "epoch": 0.8086439985969028, "grad_norm": 0.1604904681444168, "learning_rate": 7.304873186739044e-05, "loss": 0.7835, "mean_token_accuracy": 0.7719584293663502, "num_tokens": 280526490.0, "step": 8789 }, { "entropy": 0.8399364203214645, "epoch": 0.8087360049683441, "grad_norm": 0.16268514096736908, "learning_rate": 7.304566504124881e-05, "loss": 0.8268, "mean_token_accuracy": 0.7574987187981606, "num_tokens": 280558782.0, "step": 8790 }, { "entropy": 0.6631929287686944, "epoch": 0.8088280113397853, "grad_norm": 0.16678792238235474, "learning_rate": 7.30425982151072e-05, "loss": 0.626, "mean_token_accuracy": 0.813741896301508, "num_tokens": 280590043.0, "step": 8791 }, { "entropy": 0.7218763995915651, "epoch": 0.8089200177112265, "grad_norm": 0.15815667808055878, "learning_rate": 7.303953138896556e-05, "loss": 0.7193, "mean_token_accuracy": 0.7891359701752663, "num_tokens": 280622045.0, "step": 8792 }, { "entropy": 0.787384893745184, "epoch": 0.8090120240826677, "grad_norm": 0.1612640768289566, "learning_rate": 7.303646456282394e-05, "loss": 0.7731, "mean_token_accuracy": 0.7696536928415298, "num_tokens": 280654042.0, "step": 8793 }, { "entropy": 0.7347054043784738, "epoch": 0.809104030454109, "grad_norm": 0.1639278680086136, "learning_rate": 7.303339773668231e-05, "loss": 0.718, "mean_token_accuracy": 0.7882935702800751, "num_tokens": 280686283.0, "step": 8794 }, { "entropy": 0.6602313974872231, "epoch": 0.8091960368255502, "grad_norm": 0.1640673130750656, "learning_rate": 7.303033091054069e-05, "loss": 0.6514, "mean_token_accuracy": 0.8017388619482517, "num_tokens": 280717815.0, "step": 8795 }, { "entropy": 0.6770196817815304, "epoch": 0.8092880431969914, "grad_norm": 0.15212877094745636, "learning_rate": 7.302726408439906e-05, "loss": 0.658, "mean_token_accuracy": 0.8074035309255123, "num_tokens": 280748805.0, "step": 8796 }, { "entropy": 0.6483152583241463, "epoch": 0.8093800495684326, "grad_norm": 0.15645915269851685, "learning_rate": 7.302419725825743e-05, "loss": 0.6275, "mean_token_accuracy": 0.8094264045357704, "num_tokens": 280779950.0, "step": 8797 }, { "entropy": 0.7575468113645911, "epoch": 0.8094720559398738, "grad_norm": 0.15636046230793, "learning_rate": 7.302113043211581e-05, "loss": 0.7385, "mean_token_accuracy": 0.7793776132166386, "num_tokens": 280811220.0, "step": 8798 }, { "entropy": 0.7843654099851847, "epoch": 0.8095640623113151, "grad_norm": 0.1499468982219696, "learning_rate": 7.301806360597419e-05, "loss": 0.7695, "mean_token_accuracy": 0.7757474184036255, "num_tokens": 280843696.0, "step": 8799 }, { "entropy": 0.8951494973152876, "epoch": 0.8096560686827563, "grad_norm": 0.161033034324646, "learning_rate": 7.301499677983256e-05, "loss": 0.8789, "mean_token_accuracy": 0.7480482794344425, "num_tokens": 280875576.0, "step": 8800 }, { "entropy": 0.7089257780462503, "epoch": 0.8097480750541975, "grad_norm": 0.14815685153007507, "learning_rate": 7.301192995369093e-05, "loss": 0.6875, "mean_token_accuracy": 0.7991449274122715, "num_tokens": 280907370.0, "step": 8801 }, { "entropy": 0.7315994389355183, "epoch": 0.8098400814256387, "grad_norm": 0.15197136998176575, "learning_rate": 7.30088631275493e-05, "loss": 0.7115, "mean_token_accuracy": 0.7908039651811123, "num_tokens": 280938918.0, "step": 8802 }, { "entropy": 0.7551451288163662, "epoch": 0.8099320877970799, "grad_norm": 0.16854926943778992, "learning_rate": 7.300579630140768e-05, "loss": 0.7533, "mean_token_accuracy": 0.7842795662581921, "num_tokens": 280971001.0, "step": 8803 }, { "entropy": 0.6859685089439154, "epoch": 0.8100240941685212, "grad_norm": 0.15417101979255676, "learning_rate": 7.300272947526606e-05, "loss": 0.6827, "mean_token_accuracy": 0.797606784850359, "num_tokens": 281003000.0, "step": 8804 }, { "entropy": 0.7523537967354059, "epoch": 0.8101161005399624, "grad_norm": 0.15922929346561432, "learning_rate": 7.299966264912443e-05, "loss": 0.7624, "mean_token_accuracy": 0.7778226025402546, "num_tokens": 281035075.0, "step": 8805 }, { "entropy": 0.8452366832643747, "epoch": 0.8102081069114037, "grad_norm": 0.16026504337787628, "learning_rate": 7.299659582298279e-05, "loss": 0.8599, "mean_token_accuracy": 0.7525277324020863, "num_tokens": 281066755.0, "step": 8806 }, { "entropy": 0.622067048214376, "epoch": 0.8103001132828448, "grad_norm": 0.1551104336977005, "learning_rate": 7.299352899684117e-05, "loss": 0.6246, "mean_token_accuracy": 0.8134521245956421, "num_tokens": 281099159.0, "step": 8807 }, { "entropy": 0.7403935818001628, "epoch": 0.810392119654286, "grad_norm": 0.1558847725391388, "learning_rate": 7.299046217069954e-05, "loss": 0.7175, "mean_token_accuracy": 0.7894258201122284, "num_tokens": 281130653.0, "step": 8808 }, { "entropy": 0.7819300182163715, "epoch": 0.8104841260257273, "grad_norm": 0.15648329257965088, "learning_rate": 7.298739534455792e-05, "loss": 0.78, "mean_token_accuracy": 0.7712905146181583, "num_tokens": 281162626.0, "step": 8809 }, { "entropy": 0.8214421309530735, "epoch": 0.8105761323971685, "grad_norm": 0.16528865694999695, "learning_rate": 7.298432851841629e-05, "loss": 0.8148, "mean_token_accuracy": 0.7626269571483135, "num_tokens": 281194707.0, "step": 8810 }, { "entropy": 0.699939239770174, "epoch": 0.8106681387686098, "grad_norm": 0.16284100711345673, "learning_rate": 7.298126169227467e-05, "loss": 0.6923, "mean_token_accuracy": 0.793315514922142, "num_tokens": 281227045.0, "step": 8811 }, { "entropy": 0.6121280323714018, "epoch": 0.8107601451400509, "grad_norm": 0.1594342589378357, "learning_rate": 7.297819486613304e-05, "loss": 0.6061, "mean_token_accuracy": 0.8195356205105782, "num_tokens": 281258076.0, "step": 8812 }, { "entropy": 0.7171043753623962, "epoch": 0.8108521515114921, "grad_norm": 0.1467992514371872, "learning_rate": 7.297512803999141e-05, "loss": 0.6985, "mean_token_accuracy": 0.7929666042327881, "num_tokens": 281290740.0, "step": 8813 }, { "entropy": 0.801898998208344, "epoch": 0.8109441578829334, "grad_norm": 0.16155773401260376, "learning_rate": 7.297206121384979e-05, "loss": 0.7811, "mean_token_accuracy": 0.7693518958985806, "num_tokens": 281322973.0, "step": 8814 }, { "entropy": 0.7128304913640022, "epoch": 0.8110361642543746, "grad_norm": 0.16628646850585938, "learning_rate": 7.296899438770817e-05, "loss": 0.7003, "mean_token_accuracy": 0.7896296568214893, "num_tokens": 281354153.0, "step": 8815 }, { "entropy": 0.7155962474644184, "epoch": 0.8111281706258159, "grad_norm": 0.15674036741256714, "learning_rate": 7.296592756156654e-05, "loss": 0.6922, "mean_token_accuracy": 0.7932563982903957, "num_tokens": 281385560.0, "step": 8816 }, { "entropy": 0.6640739282593131, "epoch": 0.811220176997257, "grad_norm": 0.15892334282398224, "learning_rate": 7.296286073542491e-05, "loss": 0.6397, "mean_token_accuracy": 0.8089822381734848, "num_tokens": 281417126.0, "step": 8817 }, { "entropy": 0.7285239677876234, "epoch": 0.8113121833686983, "grad_norm": 0.15154895186424255, "learning_rate": 7.295979390928329e-05, "loss": 0.6989, "mean_token_accuracy": 0.7905909679830074, "num_tokens": 281449499.0, "step": 8818 }, { "entropy": 0.6988730654120445, "epoch": 0.8114041897401395, "grad_norm": 0.16293446719646454, "learning_rate": 7.295672708314166e-05, "loss": 0.6938, "mean_token_accuracy": 0.8006265833973885, "num_tokens": 281481138.0, "step": 8819 }, { "entropy": 0.6785936690866947, "epoch": 0.8114961961115807, "grad_norm": 0.15084905922412872, "learning_rate": 7.295366025700004e-05, "loss": 0.6632, "mean_token_accuracy": 0.8048894926905632, "num_tokens": 281512548.0, "step": 8820 }, { "entropy": 0.904801931232214, "epoch": 0.811588202483022, "grad_norm": 0.1611488312482834, "learning_rate": 7.29505934308584e-05, "loss": 0.9216, "mean_token_accuracy": 0.7363728359341621, "num_tokens": 281542872.0, "step": 8821 }, { "entropy": 0.7331694019958377, "epoch": 0.8116802088544631, "grad_norm": 0.15519411861896515, "learning_rate": 7.294752660471679e-05, "loss": 0.7329, "mean_token_accuracy": 0.7804453186690807, "num_tokens": 281574563.0, "step": 8822 }, { "entropy": 0.7524434942752123, "epoch": 0.8117722152259044, "grad_norm": 0.1662304401397705, "learning_rate": 7.294445977857516e-05, "loss": 0.7508, "mean_token_accuracy": 0.7835780717432499, "num_tokens": 281605687.0, "step": 8823 }, { "entropy": 0.6548904003575444, "epoch": 0.8118642215973456, "grad_norm": 0.14741657674312592, "learning_rate": 7.294139295243352e-05, "loss": 0.6439, "mean_token_accuracy": 0.8046582750976086, "num_tokens": 281637997.0, "step": 8824 }, { "entropy": 0.6722556035965681, "epoch": 0.8119562279687869, "grad_norm": 0.1545913964509964, "learning_rate": 7.29383261262919e-05, "loss": 0.651, "mean_token_accuracy": 0.8040770292282104, "num_tokens": 281669512.0, "step": 8825 }, { "entropy": 0.7071272470057011, "epoch": 0.8120482343402281, "grad_norm": 0.15020997822284698, "learning_rate": 7.293525930015029e-05, "loss": 0.7098, "mean_token_accuracy": 0.7856381423771381, "num_tokens": 281701917.0, "step": 8826 }, { "entropy": 0.7113747503608465, "epoch": 0.8121402407116692, "grad_norm": 0.15359772741794586, "learning_rate": 7.293219247400865e-05, "loss": 0.7015, "mean_token_accuracy": 0.7938238866627216, "num_tokens": 281733629.0, "step": 8827 }, { "entropy": 0.7640140671283007, "epoch": 0.8122322470831105, "grad_norm": 0.1623331606388092, "learning_rate": 7.292912564786702e-05, "loss": 0.7643, "mean_token_accuracy": 0.774017907679081, "num_tokens": 281765070.0, "step": 8828 }, { "entropy": 0.7643362637609243, "epoch": 0.8123242534545517, "grad_norm": 0.1622413694858551, "learning_rate": 7.292605882172539e-05, "loss": 0.7616, "mean_token_accuracy": 0.7808681279420853, "num_tokens": 281795780.0, "step": 8829 }, { "entropy": 0.6669468283653259, "epoch": 0.812416259825993, "grad_norm": 0.15858986973762512, "learning_rate": 7.292299199558378e-05, "loss": 0.6692, "mean_token_accuracy": 0.8038977384567261, "num_tokens": 281827192.0, "step": 8830 }, { "entropy": 0.6859957072883844, "epoch": 0.8125082661974342, "grad_norm": 0.16934099793434143, "learning_rate": 7.291992516944215e-05, "loss": 0.6855, "mean_token_accuracy": 0.8003430031239986, "num_tokens": 281859505.0, "step": 8831 }, { "entropy": 0.7651117453351617, "epoch": 0.8126002725688753, "grad_norm": 0.15542635321617126, "learning_rate": 7.291685834330052e-05, "loss": 0.7392, "mean_token_accuracy": 0.7810560949146748, "num_tokens": 281891863.0, "step": 8832 }, { "entropy": 0.7125754971057177, "epoch": 0.8126922789403166, "grad_norm": 0.1505800485610962, "learning_rate": 7.291379151715889e-05, "loss": 0.702, "mean_token_accuracy": 0.7918311543762684, "num_tokens": 281923474.0, "step": 8833 }, { "entropy": 0.6695321649312973, "epoch": 0.8127842853117578, "grad_norm": 0.15358196198940277, "learning_rate": 7.291072469101727e-05, "loss": 0.6542, "mean_token_accuracy": 0.801561001688242, "num_tokens": 281955472.0, "step": 8834 }, { "entropy": 0.7819194737821817, "epoch": 0.8128762916831991, "grad_norm": 0.15350036323070526, "learning_rate": 7.290765786487565e-05, "loss": 0.7873, "mean_token_accuracy": 0.7748149819672108, "num_tokens": 281987309.0, "step": 8835 }, { "entropy": 0.8379936423152685, "epoch": 0.8129682980546403, "grad_norm": 0.1584431678056717, "learning_rate": 7.290459103873402e-05, "loss": 0.8213, "mean_token_accuracy": 0.7596557810902596, "num_tokens": 282018670.0, "step": 8836 }, { "entropy": 0.7872576862573624, "epoch": 0.8130603044260815, "grad_norm": 0.1558152139186859, "learning_rate": 7.290152421259239e-05, "loss": 0.7674, "mean_token_accuracy": 0.7778166681528091, "num_tokens": 282051007.0, "step": 8837 }, { "entropy": 0.8222018182277679, "epoch": 0.8131523107975227, "grad_norm": 0.16916054487228394, "learning_rate": 7.289845738645077e-05, "loss": 0.8544, "mean_token_accuracy": 0.7578879036009312, "num_tokens": 282082275.0, "step": 8838 }, { "entropy": 0.7269451608881354, "epoch": 0.813244317168964, "grad_norm": 0.14502111077308655, "learning_rate": 7.289539056030914e-05, "loss": 0.7085, "mean_token_accuracy": 0.7902436442673206, "num_tokens": 282114526.0, "step": 8839 }, { "entropy": 0.8404010888189077, "epoch": 0.8133363235404052, "grad_norm": 0.1541755646467209, "learning_rate": 7.289232373416752e-05, "loss": 0.8231, "mean_token_accuracy": 0.7614155113697052, "num_tokens": 282147011.0, "step": 8840 }, { "entropy": 0.6437424458563328, "epoch": 0.8134283299118464, "grad_norm": 0.15187010169029236, "learning_rate": 7.288925690802589e-05, "loss": 0.6295, "mean_token_accuracy": 0.812542337924242, "num_tokens": 282179263.0, "step": 8841 }, { "entropy": 0.6070180898532271, "epoch": 0.8135203362832876, "grad_norm": 0.1475210338830948, "learning_rate": 7.288619008188427e-05, "loss": 0.5942, "mean_token_accuracy": 0.8224943578243256, "num_tokens": 282211224.0, "step": 8842 }, { "entropy": 0.7110947258770466, "epoch": 0.8136123426547288, "grad_norm": 0.16115175187587738, "learning_rate": 7.288312325574263e-05, "loss": 0.7015, "mean_token_accuracy": 0.7943053729832172, "num_tokens": 282242767.0, "step": 8843 }, { "entropy": 0.678065774962306, "epoch": 0.8137043490261701, "grad_norm": 0.15735198557376862, "learning_rate": 7.2880056429601e-05, "loss": 0.6599, "mean_token_accuracy": 0.8014461509883404, "num_tokens": 282275012.0, "step": 8844 }, { "entropy": 0.8109607920050621, "epoch": 0.8137963553976113, "grad_norm": 0.15819770097732544, "learning_rate": 7.287698960345938e-05, "loss": 0.8024, "mean_token_accuracy": 0.7647063657641411, "num_tokens": 282306918.0, "step": 8845 }, { "entropy": 0.6647379416972399, "epoch": 0.8138883617690525, "grad_norm": 0.16598786413669586, "learning_rate": 7.287392277731777e-05, "loss": 0.6671, "mean_token_accuracy": 0.8026313185691833, "num_tokens": 282338782.0, "step": 8846 }, { "entropy": 0.758580032736063, "epoch": 0.8139803681404937, "grad_norm": 0.16530585289001465, "learning_rate": 7.287085595117613e-05, "loss": 0.7545, "mean_token_accuracy": 0.7776653543114662, "num_tokens": 282370983.0, "step": 8847 }, { "entropy": 0.7231135200709105, "epoch": 0.8140723745119349, "grad_norm": 0.1657288670539856, "learning_rate": 7.28677891250345e-05, "loss": 0.7079, "mean_token_accuracy": 0.7904610820114613, "num_tokens": 282402300.0, "step": 8848 }, { "entropy": 0.7315331194549799, "epoch": 0.8141643808833762, "grad_norm": 0.15555812418460846, "learning_rate": 7.286472229889288e-05, "loss": 0.7367, "mean_token_accuracy": 0.7794448807835579, "num_tokens": 282434154.0, "step": 8849 }, { "entropy": 0.6935278903692961, "epoch": 0.8142563872548174, "grad_norm": 0.1470392495393753, "learning_rate": 7.286165547275125e-05, "loss": 0.6689, "mean_token_accuracy": 0.8053352497518063, "num_tokens": 282466117.0, "step": 8850 }, { "entropy": 0.7131359148770571, "epoch": 0.8143483936262587, "grad_norm": 0.15581178665161133, "learning_rate": 7.285858864660963e-05, "loss": 0.6987, "mean_token_accuracy": 0.7938751801848412, "num_tokens": 282498885.0, "step": 8851 }, { "entropy": 0.7702209986746311, "epoch": 0.8144403999976998, "grad_norm": 0.16139881312847137, "learning_rate": 7.2855521820468e-05, "loss": 0.7574, "mean_token_accuracy": 0.7769039571285248, "num_tokens": 282530625.0, "step": 8852 }, { "entropy": 0.6232226341962814, "epoch": 0.814532406369141, "grad_norm": 0.14995503425598145, "learning_rate": 7.285245499432638e-05, "loss": 0.5903, "mean_token_accuracy": 0.8245407342910767, "num_tokens": 282562706.0, "step": 8853 }, { "entropy": 0.6644568182528019, "epoch": 0.8146244127405823, "grad_norm": 0.14936047792434692, "learning_rate": 7.284938816818475e-05, "loss": 0.6439, "mean_token_accuracy": 0.8056899718940258, "num_tokens": 282594792.0, "step": 8854 }, { "entropy": 0.7307546157389879, "epoch": 0.8147164191120235, "grad_norm": 0.15565499663352966, "learning_rate": 7.284632134204312e-05, "loss": 0.7231, "mean_token_accuracy": 0.7867359705269337, "num_tokens": 282626779.0, "step": 8855 }, { "entropy": 0.7716090036556125, "epoch": 0.8148084254834648, "grad_norm": 0.15901805460453033, "learning_rate": 7.28432545159015e-05, "loss": 0.7809, "mean_token_accuracy": 0.7755277641117573, "num_tokens": 282658859.0, "step": 8856 }, { "entropy": 0.6166004845872521, "epoch": 0.8149004318549059, "grad_norm": 0.16082599759101868, "learning_rate": 7.284018768975988e-05, "loss": 0.6174, "mean_token_accuracy": 0.8097791485488415, "num_tokens": 282690466.0, "step": 8857 }, { "entropy": 0.8147182650864124, "epoch": 0.8149924382263471, "grad_norm": 0.16122965514659882, "learning_rate": 7.283712086361825e-05, "loss": 0.8048, "mean_token_accuracy": 0.7634128518402576, "num_tokens": 282722569.0, "step": 8858 }, { "entropy": 0.731562914326787, "epoch": 0.8150844445977884, "grad_norm": 0.1655273288488388, "learning_rate": 7.283405403747662e-05, "loss": 0.7309, "mean_token_accuracy": 0.7874297760426998, "num_tokens": 282754199.0, "step": 8859 }, { "entropy": 0.7536404319107533, "epoch": 0.8151764509692296, "grad_norm": 0.15255899727344513, "learning_rate": 7.283098721133498e-05, "loss": 0.7516, "mean_token_accuracy": 0.7792046628892422, "num_tokens": 282786019.0, "step": 8860 }, { "entropy": 0.8362527154386044, "epoch": 0.8152684573406709, "grad_norm": 0.16592524945735931, "learning_rate": 7.282792038519336e-05, "loss": 0.8198, "mean_token_accuracy": 0.7620096392929554, "num_tokens": 282816859.0, "step": 8861 }, { "entropy": 0.6645166017115116, "epoch": 0.815360463712112, "grad_norm": 0.16417311131954193, "learning_rate": 7.282485355905175e-05, "loss": 0.6569, "mean_token_accuracy": 0.8073108308017254, "num_tokens": 282849142.0, "step": 8862 }, { "entropy": 0.6329911462962627, "epoch": 0.8154524700835533, "grad_norm": 0.15983767807483673, "learning_rate": 7.282178673291011e-05, "loss": 0.6213, "mean_token_accuracy": 0.8162010423839092, "num_tokens": 282881517.0, "step": 8863 }, { "entropy": 0.6390299266204238, "epoch": 0.8155444764549945, "grad_norm": 0.15358687937259674, "learning_rate": 7.281871990676848e-05, "loss": 0.6178, "mean_token_accuracy": 0.8206056840717793, "num_tokens": 282912432.0, "step": 8864 }, { "entropy": 0.6728829611092806, "epoch": 0.8156364828264357, "grad_norm": 0.1428249478340149, "learning_rate": 7.281565308062686e-05, "loss": 0.6426, "mean_token_accuracy": 0.8059559054672718, "num_tokens": 282944525.0, "step": 8865 }, { "entropy": 0.6589282006025314, "epoch": 0.815728489197877, "grad_norm": 0.19384068250656128, "learning_rate": 7.281258625448523e-05, "loss": 0.6248, "mean_token_accuracy": 0.8146298788487911, "num_tokens": 282976787.0, "step": 8866 }, { "entropy": 0.8172745518386364, "epoch": 0.8158204955693181, "grad_norm": 0.1610552817583084, "learning_rate": 7.280951942834361e-05, "loss": 0.8039, "mean_token_accuracy": 0.7623845748603344, "num_tokens": 283008220.0, "step": 8867 }, { "entropy": 0.7432925309985876, "epoch": 0.8159125019407594, "grad_norm": 0.15912580490112305, "learning_rate": 7.280645260220198e-05, "loss": 0.7302, "mean_token_accuracy": 0.7871149815618992, "num_tokens": 283040063.0, "step": 8868 }, { "entropy": 0.6837506256997585, "epoch": 0.8160045083122006, "grad_norm": 0.14766494929790497, "learning_rate": 7.280338577606036e-05, "loss": 0.6779, "mean_token_accuracy": 0.7994626276195049, "num_tokens": 283072831.0, "step": 8869 }, { "entropy": 0.7056467570364475, "epoch": 0.8160965146836419, "grad_norm": 0.16047316789627075, "learning_rate": 7.280031894991873e-05, "loss": 0.7022, "mean_token_accuracy": 0.7967587821185589, "num_tokens": 283105326.0, "step": 8870 }, { "entropy": 0.6693502105772495, "epoch": 0.8161885210550831, "grad_norm": 0.1468183994293213, "learning_rate": 7.27972521237771e-05, "loss": 0.6532, "mean_token_accuracy": 0.8070458211004734, "num_tokens": 283137491.0, "step": 8871 }, { "entropy": 0.6425915788859129, "epoch": 0.8162805274265242, "grad_norm": 0.15711542963981628, "learning_rate": 7.279418529763548e-05, "loss": 0.6211, "mean_token_accuracy": 0.8133961446583271, "num_tokens": 283169069.0, "step": 8872 }, { "entropy": 0.7631380688399076, "epoch": 0.8163725337979655, "grad_norm": 0.1499480903148651, "learning_rate": 7.279111847149386e-05, "loss": 0.746, "mean_token_accuracy": 0.7797861881554127, "num_tokens": 283200583.0, "step": 8873 }, { "entropy": 0.7319032046943903, "epoch": 0.8164645401694067, "grad_norm": 0.14943814277648926, "learning_rate": 7.278805164535223e-05, "loss": 0.7159, "mean_token_accuracy": 0.7835667803883553, "num_tokens": 283231683.0, "step": 8874 }, { "entropy": 0.7668934892863035, "epoch": 0.816556546540848, "grad_norm": 0.1626661717891693, "learning_rate": 7.27849848192106e-05, "loss": 0.7824, "mean_token_accuracy": 0.7682063542306423, "num_tokens": 283263539.0, "step": 8875 }, { "entropy": 0.7543725930154324, "epoch": 0.8166485529122892, "grad_norm": 0.15735207498073578, "learning_rate": 7.278191799306896e-05, "loss": 0.7517, "mean_token_accuracy": 0.7768127359449863, "num_tokens": 283295465.0, "step": 8876 }, { "entropy": 0.7828283980488777, "epoch": 0.8167405592837303, "grad_norm": 0.17547361552715302, "learning_rate": 7.277885116692736e-05, "loss": 0.7944, "mean_token_accuracy": 0.7684010416269302, "num_tokens": 283327845.0, "step": 8877 }, { "entropy": 0.6212687860243022, "epoch": 0.8168325656551716, "grad_norm": 0.15409885346889496, "learning_rate": 7.277578434078573e-05, "loss": 0.603, "mean_token_accuracy": 0.8212668597698212, "num_tokens": 283360352.0, "step": 8878 }, { "entropy": 0.707438513636589, "epoch": 0.8169245720266128, "grad_norm": 0.1521175503730774, "learning_rate": 7.27727175146441e-05, "loss": 0.6913, "mean_token_accuracy": 0.7997340001165867, "num_tokens": 283392354.0, "step": 8879 }, { "entropy": 0.6796687673777342, "epoch": 0.8170165783980541, "grad_norm": 0.15466517210006714, "learning_rate": 7.276965068850248e-05, "loss": 0.6733, "mean_token_accuracy": 0.7985201738774776, "num_tokens": 283424696.0, "step": 8880 }, { "entropy": 0.632179755717516, "epoch": 0.8171085847694953, "grad_norm": 0.1584043800830841, "learning_rate": 7.276658386236084e-05, "loss": 0.6279, "mean_token_accuracy": 0.8177241794764996, "num_tokens": 283456226.0, "step": 8881 }, { "entropy": 0.7687338851392269, "epoch": 0.8172005911409365, "grad_norm": 0.15326014161109924, "learning_rate": 7.276351703621923e-05, "loss": 0.7649, "mean_token_accuracy": 0.772969413548708, "num_tokens": 283488873.0, "step": 8882 }, { "entropy": 0.8191963210701942, "epoch": 0.8172925975123777, "grad_norm": 0.15639886260032654, "learning_rate": 7.27604502100776e-05, "loss": 0.8097, "mean_token_accuracy": 0.762598343193531, "num_tokens": 283519839.0, "step": 8883 }, { "entropy": 0.6770821567624807, "epoch": 0.817384603883819, "grad_norm": 0.16495661437511444, "learning_rate": 7.275738338393598e-05, "loss": 0.663, "mean_token_accuracy": 0.8018505983054638, "num_tokens": 283551198.0, "step": 8884 }, { "entropy": 0.7852525822818279, "epoch": 0.8174766102552602, "grad_norm": 0.15878231823444366, "learning_rate": 7.275431655779434e-05, "loss": 0.7688, "mean_token_accuracy": 0.7753232270479202, "num_tokens": 283583695.0, "step": 8885 }, { "entropy": 0.6230907812714577, "epoch": 0.8175686166267014, "grad_norm": 0.14271393418312073, "learning_rate": 7.275124973165271e-05, "loss": 0.6037, "mean_token_accuracy": 0.8190775848925114, "num_tokens": 283616167.0, "step": 8886 }, { "entropy": 0.6761398669332266, "epoch": 0.8176606229981426, "grad_norm": 0.1524570882320404, "learning_rate": 7.274818290551109e-05, "loss": 0.6614, "mean_token_accuracy": 0.8088189102709293, "num_tokens": 283648307.0, "step": 8887 }, { "entropy": 0.8470855671912432, "epoch": 0.8177526293695838, "grad_norm": 0.15934288501739502, "learning_rate": 7.274511607936947e-05, "loss": 0.8388, "mean_token_accuracy": 0.753144808113575, "num_tokens": 283679785.0, "step": 8888 }, { "entropy": 0.7899370566010475, "epoch": 0.8178446357410251, "grad_norm": 0.16054481267929077, "learning_rate": 7.274204925322784e-05, "loss": 0.7806, "mean_token_accuracy": 0.7681625857949257, "num_tokens": 283710872.0, "step": 8889 }, { "entropy": 0.6818925896659493, "epoch": 0.8179366421124663, "grad_norm": 0.15273325145244598, "learning_rate": 7.273898242708621e-05, "loss": 0.6567, "mean_token_accuracy": 0.8085002452135086, "num_tokens": 283743640.0, "step": 8890 }, { "entropy": 0.6839016936719418, "epoch": 0.8180286484839076, "grad_norm": 0.14513365924358368, "learning_rate": 7.273591560094458e-05, "loss": 0.6807, "mean_token_accuracy": 0.7950051240622997, "num_tokens": 283775178.0, "step": 8891 }, { "entropy": 0.6777231749147177, "epoch": 0.8181206548553487, "grad_norm": 0.15922227501869202, "learning_rate": 7.273284877480296e-05, "loss": 0.6891, "mean_token_accuracy": 0.7911290563642979, "num_tokens": 283806881.0, "step": 8892 }, { "entropy": 0.7743386402726173, "epoch": 0.8182126612267899, "grad_norm": 0.16230830550193787, "learning_rate": 7.272978194866134e-05, "loss": 0.7637, "mean_token_accuracy": 0.7732686400413513, "num_tokens": 283838376.0, "step": 8893 }, { "entropy": 0.7602397426962852, "epoch": 0.8183046675982312, "grad_norm": 0.16219723224639893, "learning_rate": 7.272671512251971e-05, "loss": 0.7601, "mean_token_accuracy": 0.7753823287785053, "num_tokens": 283870061.0, "step": 8894 }, { "entropy": 0.7483861483633518, "epoch": 0.8183966739696724, "grad_norm": 0.16454194486141205, "learning_rate": 7.272364829637808e-05, "loss": 0.7412, "mean_token_accuracy": 0.7803338058292866, "num_tokens": 283901540.0, "step": 8895 }, { "entropy": 0.6490075001493096, "epoch": 0.8184886803411137, "grad_norm": 0.15494303405284882, "learning_rate": 7.272058147023646e-05, "loss": 0.6433, "mean_token_accuracy": 0.8092268817126751, "num_tokens": 283934005.0, "step": 8896 }, { "entropy": 0.7823300156742334, "epoch": 0.8185806867125548, "grad_norm": 0.1656738966703415, "learning_rate": 7.271751464409483e-05, "loss": 0.7828, "mean_token_accuracy": 0.7707355432212353, "num_tokens": 283966036.0, "step": 8897 }, { "entropy": 0.7003092532977462, "epoch": 0.818672693083996, "grad_norm": 0.15831705927848816, "learning_rate": 7.27144478179532e-05, "loss": 0.6956, "mean_token_accuracy": 0.7982044890522957, "num_tokens": 283998372.0, "step": 8898 }, { "entropy": 0.6349435402080417, "epoch": 0.8187646994554373, "grad_norm": 0.15170037746429443, "learning_rate": 7.271138099181157e-05, "loss": 0.6156, "mean_token_accuracy": 0.8178951218724251, "num_tokens": 284030737.0, "step": 8899 }, { "entropy": 0.6046836357563734, "epoch": 0.8188567058268785, "grad_norm": 0.15465371310710907, "learning_rate": 7.270831416566996e-05, "loss": 0.5849, "mean_token_accuracy": 0.8256338685750961, "num_tokens": 284063099.0, "step": 8900 }, { "entropy": 0.8339173123240471, "epoch": 0.8189487121983198, "grad_norm": 0.1565534770488739, "learning_rate": 7.270524733952832e-05, "loss": 0.8298, "mean_token_accuracy": 0.7543990351259708, "num_tokens": 284094130.0, "step": 8901 }, { "entropy": 0.5927000986412168, "epoch": 0.8190407185697609, "grad_norm": 0.1431489735841751, "learning_rate": 7.270218051338669e-05, "loss": 0.5678, "mean_token_accuracy": 0.8250194899737835, "num_tokens": 284125871.0, "step": 8902 }, { "entropy": 0.6909135021269321, "epoch": 0.8191327249412022, "grad_norm": 0.15771518647670746, "learning_rate": 7.269911368724507e-05, "loss": 0.6752, "mean_token_accuracy": 0.8001469746232033, "num_tokens": 284156764.0, "step": 8903 }, { "entropy": 0.7788947112858295, "epoch": 0.8192247313126434, "grad_norm": 0.1580466628074646, "learning_rate": 7.269604686110345e-05, "loss": 0.7576, "mean_token_accuracy": 0.7775906845927238, "num_tokens": 284188732.0, "step": 8904 }, { "entropy": 0.8277196306735277, "epoch": 0.8193167376840846, "grad_norm": 0.15928709506988525, "learning_rate": 7.269298003496182e-05, "loss": 0.8189, "mean_token_accuracy": 0.7573447786271572, "num_tokens": 284220414.0, "step": 8905 }, { "entropy": 0.7262854222208261, "epoch": 0.8194087440555259, "grad_norm": 0.155595600605011, "learning_rate": 7.268991320882019e-05, "loss": 0.7249, "mean_token_accuracy": 0.7876815795898438, "num_tokens": 284252444.0, "step": 8906 }, { "entropy": 0.7615687288343906, "epoch": 0.819500750426967, "grad_norm": 0.15496665239334106, "learning_rate": 7.268684638267856e-05, "loss": 0.7622, "mean_token_accuracy": 0.7784506678581238, "num_tokens": 284284776.0, "step": 8907 }, { "entropy": 0.7765335142612457, "epoch": 0.8195927567984083, "grad_norm": 0.16071389615535736, "learning_rate": 7.268377955653694e-05, "loss": 0.7699, "mean_token_accuracy": 0.7732838615775108, "num_tokens": 284317059.0, "step": 8908 }, { "entropy": 0.8150903768837452, "epoch": 0.8196847631698495, "grad_norm": 0.15790818631649017, "learning_rate": 7.268071273039532e-05, "loss": 0.8074, "mean_token_accuracy": 0.7639236263930798, "num_tokens": 284349221.0, "step": 8909 }, { "entropy": 0.5948092974722385, "epoch": 0.8197767695412908, "grad_norm": 0.14612305164337158, "learning_rate": 7.267764590425369e-05, "loss": 0.5938, "mean_token_accuracy": 0.8201647475361824, "num_tokens": 284381463.0, "step": 8910 }, { "entropy": 0.6842238791286945, "epoch": 0.819868775912732, "grad_norm": 0.1586386263370514, "learning_rate": 7.267457907811207e-05, "loss": 0.67, "mean_token_accuracy": 0.8074273951351643, "num_tokens": 284413617.0, "step": 8911 }, { "entropy": 0.795402780175209, "epoch": 0.8199607822841731, "grad_norm": 0.15735557675361633, "learning_rate": 7.267151225197044e-05, "loss": 0.793, "mean_token_accuracy": 0.7653169073164463, "num_tokens": 284445509.0, "step": 8912 }, { "entropy": 0.7542642150074244, "epoch": 0.8200527886556144, "grad_norm": 0.16248662769794464, "learning_rate": 7.266844542582882e-05, "loss": 0.7362, "mean_token_accuracy": 0.7828256152570248, "num_tokens": 284477508.0, "step": 8913 }, { "entropy": 0.7218400090932846, "epoch": 0.8201447950270556, "grad_norm": 0.16699829697608948, "learning_rate": 7.266537859968719e-05, "loss": 0.7212, "mean_token_accuracy": 0.7859941199421883, "num_tokens": 284509304.0, "step": 8914 }, { "entropy": 0.5568763841874897, "epoch": 0.8202368013984969, "grad_norm": 0.1467861831188202, "learning_rate": 7.266231177354557e-05, "loss": 0.551, "mean_token_accuracy": 0.8323766440153122, "num_tokens": 284542072.0, "step": 8915 }, { "entropy": 0.727360425516963, "epoch": 0.8203288077699381, "grad_norm": 0.15941035747528076, "learning_rate": 7.265924494740394e-05, "loss": 0.7232, "mean_token_accuracy": 0.786419115960598, "num_tokens": 284574426.0, "step": 8916 }, { "entropy": 0.7960215043276548, "epoch": 0.8204208141413792, "grad_norm": 0.1623135805130005, "learning_rate": 7.26561781212623e-05, "loss": 0.7839, "mean_token_accuracy": 0.7684144712984562, "num_tokens": 284605889.0, "step": 8917 }, { "entropy": 0.7514284271746874, "epoch": 0.8205128205128205, "grad_norm": 0.16022086143493652, "learning_rate": 7.265311129512069e-05, "loss": 0.7532, "mean_token_accuracy": 0.7790559493005276, "num_tokens": 284638231.0, "step": 8918 }, { "entropy": 0.6776708979159594, "epoch": 0.8206048268842617, "grad_norm": 0.15381906926631927, "learning_rate": 7.265004446897907e-05, "loss": 0.6619, "mean_token_accuracy": 0.8008718490600586, "num_tokens": 284669805.0, "step": 8919 }, { "entropy": 0.6677124500274658, "epoch": 0.820696833255703, "grad_norm": 0.15749070048332214, "learning_rate": 7.264697764283744e-05, "loss": 0.6484, "mean_token_accuracy": 0.8037423938512802, "num_tokens": 284701582.0, "step": 8920 }, { "entropy": 0.8012014366686344, "epoch": 0.8207888396271442, "grad_norm": 0.157455712556839, "learning_rate": 7.26439108166958e-05, "loss": 0.788, "mean_token_accuracy": 0.7713336236774921, "num_tokens": 284733371.0, "step": 8921 }, { "entropy": 0.6651942543685436, "epoch": 0.8208808459985854, "grad_norm": 0.15206952393054962, "learning_rate": 7.264084399055417e-05, "loss": 0.6295, "mean_token_accuracy": 0.814245879650116, "num_tokens": 284764480.0, "step": 8922 }, { "entropy": 0.6840065103024244, "epoch": 0.8209728523700266, "grad_norm": 0.15396681427955627, "learning_rate": 7.263777716441255e-05, "loss": 0.669, "mean_token_accuracy": 0.8046112731099129, "num_tokens": 284796607.0, "step": 8923 }, { "entropy": 0.6036889012902975, "epoch": 0.8210648587414678, "grad_norm": 0.15107502043247223, "learning_rate": 7.263471033827093e-05, "loss": 0.5755, "mean_token_accuracy": 0.8231262862682343, "num_tokens": 284827436.0, "step": 8924 }, { "entropy": 0.7014011442661285, "epoch": 0.8211568651129091, "grad_norm": 0.1591929793357849, "learning_rate": 7.26316435121293e-05, "loss": 0.6805, "mean_token_accuracy": 0.8001134544610977, "num_tokens": 284857763.0, "step": 8925 }, { "entropy": 0.772796293720603, "epoch": 0.8212488714843503, "grad_norm": 0.16058947145938873, "learning_rate": 7.262857668598767e-05, "loss": 0.76, "mean_token_accuracy": 0.7762425802648067, "num_tokens": 284890099.0, "step": 8926 }, { "entropy": 0.7709118444472551, "epoch": 0.8213408778557915, "grad_norm": 0.16814643144607544, "learning_rate": 7.262550985984605e-05, "loss": 0.7643, "mean_token_accuracy": 0.779382660984993, "num_tokens": 284921596.0, "step": 8927 }, { "entropy": 0.7489400487393141, "epoch": 0.8214328842272327, "grad_norm": 0.1546616405248642, "learning_rate": 7.262244303370442e-05, "loss": 0.7133, "mean_token_accuracy": 0.7882344946265221, "num_tokens": 284952818.0, "step": 8928 }, { "entropy": 0.6782505381852388, "epoch": 0.821524890598674, "grad_norm": 0.16030468046665192, "learning_rate": 7.26193762075628e-05, "loss": 0.6813, "mean_token_accuracy": 0.7978207990527153, "num_tokens": 284985371.0, "step": 8929 }, { "entropy": 0.8155511673539877, "epoch": 0.8216168969701152, "grad_norm": 0.16628038883209229, "learning_rate": 7.261630938142117e-05, "loss": 0.8032, "mean_token_accuracy": 0.7669973969459534, "num_tokens": 285017775.0, "step": 8930 }, { "entropy": 0.7562508452683687, "epoch": 0.8217089033415564, "grad_norm": 0.15087632834911346, "learning_rate": 7.261324255527955e-05, "loss": 0.7538, "mean_token_accuracy": 0.7731324769556522, "num_tokens": 285049922.0, "step": 8931 }, { "entropy": 0.7298192102462053, "epoch": 0.8218009097129976, "grad_norm": 0.15326179563999176, "learning_rate": 7.261017572913792e-05, "loss": 0.7171, "mean_token_accuracy": 0.791311077773571, "num_tokens": 285081585.0, "step": 8932 }, { "entropy": 0.709159241989255, "epoch": 0.8218929160844388, "grad_norm": 0.14941658079624176, "learning_rate": 7.260710890299629e-05, "loss": 0.6976, "mean_token_accuracy": 0.7960095331072807, "num_tokens": 285113673.0, "step": 8933 }, { "entropy": 0.7204658314585686, "epoch": 0.8219849224558801, "grad_norm": 0.1611117422580719, "learning_rate": 7.260404207685467e-05, "loss": 0.7157, "mean_token_accuracy": 0.7881926000118256, "num_tokens": 285145820.0, "step": 8934 }, { "entropy": 0.6702667865902185, "epoch": 0.8220769288273213, "grad_norm": 0.15612970292568207, "learning_rate": 7.260097525071305e-05, "loss": 0.6556, "mean_token_accuracy": 0.8039199933409691, "num_tokens": 285176903.0, "step": 8935 }, { "entropy": 0.8001235947012901, "epoch": 0.8221689351987626, "grad_norm": 0.16293250024318695, "learning_rate": 7.259790842457142e-05, "loss": 0.7823, "mean_token_accuracy": 0.7663587965071201, "num_tokens": 285208319.0, "step": 8936 }, { "entropy": 0.8077472299337387, "epoch": 0.8222609415702037, "grad_norm": 0.1669590175151825, "learning_rate": 7.259484159842978e-05, "loss": 0.7978, "mean_token_accuracy": 0.7628472745418549, "num_tokens": 285239371.0, "step": 8937 }, { "entropy": 0.6016338150948286, "epoch": 0.8223529479416449, "grad_norm": 0.14659234881401062, "learning_rate": 7.259177477228815e-05, "loss": 0.5841, "mean_token_accuracy": 0.8247440494596958, "num_tokens": 285271497.0, "step": 8938 }, { "entropy": 0.7416516542434692, "epoch": 0.8224449543130862, "grad_norm": 0.15762391686439514, "learning_rate": 7.258870794614653e-05, "loss": 0.7424, "mean_token_accuracy": 0.7811893559992313, "num_tokens": 285303552.0, "step": 8939 }, { "entropy": 0.6924250656738877, "epoch": 0.8225369606845274, "grad_norm": 0.1547284871339798, "learning_rate": 7.258564112000491e-05, "loss": 0.6934, "mean_token_accuracy": 0.7937106117606163, "num_tokens": 285336042.0, "step": 8940 }, { "entropy": 0.8373758736997843, "epoch": 0.8226289670559687, "grad_norm": 0.1577252596616745, "learning_rate": 7.258257429386328e-05, "loss": 0.826, "mean_token_accuracy": 0.7588753290474415, "num_tokens": 285367816.0, "step": 8941 }, { "entropy": 0.6646565785631537, "epoch": 0.8227209734274098, "grad_norm": 0.15737617015838623, "learning_rate": 7.257950746772166e-05, "loss": 0.6371, "mean_token_accuracy": 0.8029040358960629, "num_tokens": 285399229.0, "step": 8942 }, { "entropy": 0.6973677277565002, "epoch": 0.822812979798851, "grad_norm": 0.16932177543640137, "learning_rate": 7.257644064158003e-05, "loss": 0.6869, "mean_token_accuracy": 0.7948487438261509, "num_tokens": 285430940.0, "step": 8943 }, { "entropy": 0.6323857214301825, "epoch": 0.8229049861702923, "grad_norm": 0.15756022930145264, "learning_rate": 7.25733738154384e-05, "loss": 0.6271, "mean_token_accuracy": 0.8107408173382282, "num_tokens": 285463640.0, "step": 8944 }, { "entropy": 0.727318050339818, "epoch": 0.8229969925417335, "grad_norm": 0.15722672641277313, "learning_rate": 7.257030698929678e-05, "loss": 0.7159, "mean_token_accuracy": 0.7904860787093639, "num_tokens": 285496408.0, "step": 8945 }, { "entropy": 0.6942963246256113, "epoch": 0.8230889989131748, "grad_norm": 0.15469060838222504, "learning_rate": 7.256724016315516e-05, "loss": 0.6769, "mean_token_accuracy": 0.795751940459013, "num_tokens": 285527420.0, "step": 8946 }, { "entropy": 0.797913920134306, "epoch": 0.8231810052846159, "grad_norm": 0.154256671667099, "learning_rate": 7.256417333701353e-05, "loss": 0.7867, "mean_token_accuracy": 0.7687107436358929, "num_tokens": 285559426.0, "step": 8947 }, { "entropy": 0.6184217445552349, "epoch": 0.8232730116560572, "grad_norm": 0.15080685913562775, "learning_rate": 7.25611065108719e-05, "loss": 0.5773, "mean_token_accuracy": 0.8293310329318047, "num_tokens": 285591222.0, "step": 8948 }, { "entropy": 0.7895031571388245, "epoch": 0.8233650180274984, "grad_norm": 0.15076005458831787, "learning_rate": 7.255803968473027e-05, "loss": 0.7894, "mean_token_accuracy": 0.7685685604810715, "num_tokens": 285623439.0, "step": 8949 }, { "entropy": 0.7949450332671404, "epoch": 0.8234570243989396, "grad_norm": 0.15249180793762207, "learning_rate": 7.255497285858866e-05, "loss": 0.7858, "mean_token_accuracy": 0.7663241326808929, "num_tokens": 285654721.0, "step": 8950 }, { "entropy": 0.7760120406746864, "epoch": 0.8235490307703809, "grad_norm": 0.16734275221824646, "learning_rate": 7.255190603244703e-05, "loss": 0.776, "mean_token_accuracy": 0.7697091773152351, "num_tokens": 285686503.0, "step": 8951 }, { "entropy": 0.6996889263391495, "epoch": 0.823641037141822, "grad_norm": 0.16084517538547516, "learning_rate": 7.25488392063054e-05, "loss": 0.6933, "mean_token_accuracy": 0.7947257719933987, "num_tokens": 285717840.0, "step": 8952 }, { "entropy": 0.6514554033055902, "epoch": 0.8237330435132633, "grad_norm": 0.14601847529411316, "learning_rate": 7.254577238016376e-05, "loss": 0.6285, "mean_token_accuracy": 0.8144664205610752, "num_tokens": 285750133.0, "step": 8953 }, { "entropy": 0.6074075791984797, "epoch": 0.8238250498847045, "grad_norm": 0.1509881168603897, "learning_rate": 7.254270555402215e-05, "loss": 0.574, "mean_token_accuracy": 0.8255472555756569, "num_tokens": 285782005.0, "step": 8954 }, { "entropy": 0.7604123763740063, "epoch": 0.8239170562561458, "grad_norm": 0.15656660497188568, "learning_rate": 7.253963872788053e-05, "loss": 0.753, "mean_token_accuracy": 0.7780224904417992, "num_tokens": 285811894.0, "step": 8955 }, { "entropy": 0.6791110895574093, "epoch": 0.824009062627587, "grad_norm": 0.1494625061750412, "learning_rate": 7.25365719017389e-05, "loss": 0.6759, "mean_token_accuracy": 0.800452470779419, "num_tokens": 285844652.0, "step": 8956 }, { "entropy": 0.708913279697299, "epoch": 0.8241010689990281, "grad_norm": 0.159681037068367, "learning_rate": 7.253350507559726e-05, "loss": 0.7018, "mean_token_accuracy": 0.7922932095825672, "num_tokens": 285877028.0, "step": 8957 }, { "entropy": 0.8011132031679153, "epoch": 0.8241930753704694, "grad_norm": 0.16026878356933594, "learning_rate": 7.253043824945564e-05, "loss": 0.8154, "mean_token_accuracy": 0.7628692090511322, "num_tokens": 285908947.0, "step": 8958 }, { "entropy": 0.7142870854586363, "epoch": 0.8242850817419106, "grad_norm": 0.15641997754573822, "learning_rate": 7.252737142331401e-05, "loss": 0.7215, "mean_token_accuracy": 0.7857906110584736, "num_tokens": 285940825.0, "step": 8959 }, { "entropy": 0.7827363703399897, "epoch": 0.8243770881133519, "grad_norm": 0.16898083686828613, "learning_rate": 7.25243045971724e-05, "loss": 0.776, "mean_token_accuracy": 0.7749377563595772, "num_tokens": 285972864.0, "step": 8960 }, { "entropy": 0.7203196417540312, "epoch": 0.8244690944847931, "grad_norm": 0.150071382522583, "learning_rate": 7.252123777103076e-05, "loss": 0.706, "mean_token_accuracy": 0.7900875471532345, "num_tokens": 286005278.0, "step": 8961 }, { "entropy": 0.7627804595977068, "epoch": 0.8245611008562342, "grad_norm": 0.15748925507068634, "learning_rate": 7.251817094488914e-05, "loss": 0.7599, "mean_token_accuracy": 0.7751562520861626, "num_tokens": 286036762.0, "step": 8962 }, { "entropy": 0.7508614212274551, "epoch": 0.8246531072276755, "grad_norm": 0.15928609669208527, "learning_rate": 7.251510411874751e-05, "loss": 0.7457, "mean_token_accuracy": 0.7802472375333309, "num_tokens": 286068398.0, "step": 8963 }, { "entropy": 0.8576329164206982, "epoch": 0.8247451135991167, "grad_norm": 0.16591401398181915, "learning_rate": 7.251203729260588e-05, "loss": 0.8672, "mean_token_accuracy": 0.7490975223481655, "num_tokens": 286100586.0, "step": 8964 }, { "entropy": 0.6751609351485968, "epoch": 0.824837119970558, "grad_norm": 0.15011581778526306, "learning_rate": 7.250897046646426e-05, "loss": 0.6525, "mean_token_accuracy": 0.8008700162172318, "num_tokens": 286132187.0, "step": 8965 }, { "entropy": 0.7018976230174303, "epoch": 0.8249291263419992, "grad_norm": 0.1536310911178589, "learning_rate": 7.250590364032264e-05, "loss": 0.6859, "mean_token_accuracy": 0.8027660734951496, "num_tokens": 286164451.0, "step": 8966 }, { "entropy": 0.6982177179306746, "epoch": 0.8250211327134404, "grad_norm": 0.15565235912799835, "learning_rate": 7.250283681418101e-05, "loss": 0.685, "mean_token_accuracy": 0.7973880246281624, "num_tokens": 286196394.0, "step": 8967 }, { "entropy": 0.6583628598600626, "epoch": 0.8251131390848816, "grad_norm": 0.14899961650371552, "learning_rate": 7.249976998803938e-05, "loss": 0.6433, "mean_token_accuracy": 0.8089684806764126, "num_tokens": 286228722.0, "step": 8968 }, { "entropy": 0.7483910918235779, "epoch": 0.8252051454563228, "grad_norm": 0.1580926477909088, "learning_rate": 7.249670316189776e-05, "loss": 0.7257, "mean_token_accuracy": 0.783611886203289, "num_tokens": 286260455.0, "step": 8969 }, { "entropy": 0.6762728448957205, "epoch": 0.8252971518277641, "grad_norm": 0.1476806253194809, "learning_rate": 7.249363633575613e-05, "loss": 0.6494, "mean_token_accuracy": 0.8038259074091911, "num_tokens": 286292402.0, "step": 8970 }, { "entropy": 0.7565533183515072, "epoch": 0.8253891581992053, "grad_norm": 0.15069164335727692, "learning_rate": 7.249056950961451e-05, "loss": 0.7405, "mean_token_accuracy": 0.7831461913883686, "num_tokens": 286324378.0, "step": 8971 }, { "entropy": 0.7935268431901932, "epoch": 0.8254811645706465, "grad_norm": 0.16202698647975922, "learning_rate": 7.248750268347288e-05, "loss": 0.7871, "mean_token_accuracy": 0.7696957215666771, "num_tokens": 286356856.0, "step": 8972 }, { "entropy": 0.7028046706691384, "epoch": 0.8255731709420877, "grad_norm": 0.1535670906305313, "learning_rate": 7.248443585733126e-05, "loss": 0.6757, "mean_token_accuracy": 0.8015553168952465, "num_tokens": 286388603.0, "step": 8973 }, { "entropy": 0.73134471103549, "epoch": 0.825665177313529, "grad_norm": 0.153033047914505, "learning_rate": 7.248136903118963e-05, "loss": 0.7026, "mean_token_accuracy": 0.7926597632467747, "num_tokens": 286420444.0, "step": 8974 }, { "entropy": 0.6885848473757505, "epoch": 0.8257571836849702, "grad_norm": 0.14651906490325928, "learning_rate": 7.2478302205048e-05, "loss": 0.6767, "mean_token_accuracy": 0.7995542213320732, "num_tokens": 286453212.0, "step": 8975 }, { "entropy": 0.6635593939572573, "epoch": 0.8258491900564114, "grad_norm": 0.15837140381336212, "learning_rate": 7.247523537890637e-05, "loss": 0.6388, "mean_token_accuracy": 0.8086057156324387, "num_tokens": 286484692.0, "step": 8976 }, { "entropy": 0.7110080998390913, "epoch": 0.8259411964278526, "grad_norm": 0.15549886226654053, "learning_rate": 7.247216855276476e-05, "loss": 0.6728, "mean_token_accuracy": 0.8004459366202354, "num_tokens": 286515413.0, "step": 8977 }, { "entropy": 0.674189105629921, "epoch": 0.8260332027992938, "grad_norm": 0.16654551029205322, "learning_rate": 7.246910172662312e-05, "loss": 0.6683, "mean_token_accuracy": 0.7973058447241783, "num_tokens": 286547442.0, "step": 8978 }, { "entropy": 0.6516083627939224, "epoch": 0.8261252091707351, "grad_norm": 0.16132307052612305, "learning_rate": 7.246603490048149e-05, "loss": 0.6406, "mean_token_accuracy": 0.8065245486795902, "num_tokens": 286579295.0, "step": 8979 }, { "entropy": 0.6889814017340541, "epoch": 0.8262172155421763, "grad_norm": 0.16747808456420898, "learning_rate": 7.246296807433986e-05, "loss": 0.6819, "mean_token_accuracy": 0.7993496395647526, "num_tokens": 286611723.0, "step": 8980 }, { "entropy": 0.8625480607151985, "epoch": 0.8263092219136176, "grad_norm": 0.166040301322937, "learning_rate": 7.245990124819824e-05, "loss": 0.872, "mean_token_accuracy": 0.7457972131669521, "num_tokens": 286643020.0, "step": 8981 }, { "entropy": 0.7233224231749773, "epoch": 0.8264012282850587, "grad_norm": 0.16105417907238007, "learning_rate": 7.245683442205662e-05, "loss": 0.7018, "mean_token_accuracy": 0.7930994182825089, "num_tokens": 286675159.0, "step": 8982 }, { "entropy": 0.7569531016051769, "epoch": 0.8264932346564999, "grad_norm": 0.15916679799556732, "learning_rate": 7.245376759591499e-05, "loss": 0.747, "mean_token_accuracy": 0.7799199931323528, "num_tokens": 286707059.0, "step": 8983 }, { "entropy": 0.8399435617029667, "epoch": 0.8265852410279412, "grad_norm": 0.16573628783226013, "learning_rate": 7.245070076977336e-05, "loss": 0.8544, "mean_token_accuracy": 0.7536828257143497, "num_tokens": 286738657.0, "step": 8984 }, { "entropy": 0.6747440714389086, "epoch": 0.8266772473993824, "grad_norm": 0.14598838984966278, "learning_rate": 7.244763394363174e-05, "loss": 0.6611, "mean_token_accuracy": 0.802978154271841, "num_tokens": 286770884.0, "step": 8985 }, { "entropy": 0.7300641424953938, "epoch": 0.8267692537708237, "grad_norm": 0.16483032703399658, "learning_rate": 7.244456711749011e-05, "loss": 0.715, "mean_token_accuracy": 0.7867937013506889, "num_tokens": 286802568.0, "step": 8986 }, { "entropy": 0.6254475926980376, "epoch": 0.8268612601422648, "grad_norm": 0.15986885130405426, "learning_rate": 7.244150029134849e-05, "loss": 0.6174, "mean_token_accuracy": 0.8146114684641361, "num_tokens": 286834977.0, "step": 8987 }, { "entropy": 0.7209993782453239, "epoch": 0.826953266513706, "grad_norm": 0.15098638832569122, "learning_rate": 7.243843346520686e-05, "loss": 0.6954, "mean_token_accuracy": 0.7921662516891956, "num_tokens": 286867672.0, "step": 8988 }, { "entropy": 0.6096637770533562, "epoch": 0.8270452728851473, "grad_norm": 0.16232706606388092, "learning_rate": 7.243536663906524e-05, "loss": 0.6009, "mean_token_accuracy": 0.8198185078799725, "num_tokens": 286899597.0, "step": 8989 }, { "entropy": 0.6847195085138083, "epoch": 0.8271372792565885, "grad_norm": 0.15189285576343536, "learning_rate": 7.24322998129236e-05, "loss": 0.6854, "mean_token_accuracy": 0.7910325825214386, "num_tokens": 286931363.0, "step": 8990 }, { "entropy": 0.689436299726367, "epoch": 0.8272292856280298, "grad_norm": 0.15207020938396454, "learning_rate": 7.242923298678197e-05, "loss": 0.6807, "mean_token_accuracy": 0.800985861569643, "num_tokens": 286963686.0, "step": 8991 }, { "entropy": 0.5709239523857832, "epoch": 0.8273212919994709, "grad_norm": 0.15486657619476318, "learning_rate": 7.242616616064036e-05, "loss": 0.5578, "mean_token_accuracy": 0.8337900452315807, "num_tokens": 286996389.0, "step": 8992 }, { "entropy": 0.8054125048220158, "epoch": 0.8274132983709122, "grad_norm": 0.1560627669095993, "learning_rate": 7.242309933449874e-05, "loss": 0.8023, "mean_token_accuracy": 0.7602116726338863, "num_tokens": 287028265.0, "step": 8993 }, { "entropy": 0.7632589526474476, "epoch": 0.8275053047423534, "grad_norm": 0.16058342158794403, "learning_rate": 7.24200325083571e-05, "loss": 0.7617, "mean_token_accuracy": 0.7748209238052368, "num_tokens": 287060666.0, "step": 8994 }, { "entropy": 0.6896180994808674, "epoch": 0.8275973111137946, "grad_norm": 0.14826738834381104, "learning_rate": 7.241696568221547e-05, "loss": 0.677, "mean_token_accuracy": 0.7938706204295158, "num_tokens": 287092071.0, "step": 8995 }, { "entropy": 0.7506554163992405, "epoch": 0.8276893174852359, "grad_norm": 0.16319486498832703, "learning_rate": 7.241389885607384e-05, "loss": 0.726, "mean_token_accuracy": 0.782239269465208, "num_tokens": 287123049.0, "step": 8996 }, { "entropy": 0.7898458410054445, "epoch": 0.827781323856677, "grad_norm": 0.16183070838451385, "learning_rate": 7.241083202993224e-05, "loss": 0.785, "mean_token_accuracy": 0.7679465562105179, "num_tokens": 287154123.0, "step": 8997 }, { "entropy": 0.6768246106803417, "epoch": 0.8278733302281183, "grad_norm": 0.15750867128372192, "learning_rate": 7.24077652037906e-05, "loss": 0.6541, "mean_token_accuracy": 0.8055593781173229, "num_tokens": 287186186.0, "step": 8998 }, { "entropy": 0.8642590716481209, "epoch": 0.8279653365995595, "grad_norm": 0.15480400621891022, "learning_rate": 7.240469837764897e-05, "loss": 0.8455, "mean_token_accuracy": 0.7585528083145618, "num_tokens": 287218538.0, "step": 8999 }, { "entropy": 0.7152856905013323, "epoch": 0.8280573429710008, "grad_norm": 0.15999771654605865, "learning_rate": 7.240163155150735e-05, "loss": 0.6866, "mean_token_accuracy": 0.8001035042107105, "num_tokens": 287249962.0, "step": 9000 }, { "entropy": 0.761523213237524, "epoch": 0.828149349342442, "grad_norm": 0.15745222568511963, "learning_rate": 7.239856472536572e-05, "loss": 0.748, "mean_token_accuracy": 0.7786234319210052, "num_tokens": 287281880.0, "step": 9001 }, { "entropy": 0.708950687199831, "epoch": 0.8282413557138831, "grad_norm": 0.15754638612270355, "learning_rate": 7.23954978992241e-05, "loss": 0.6758, "mean_token_accuracy": 0.8008165247738361, "num_tokens": 287313665.0, "step": 9002 }, { "entropy": 0.7151319161057472, "epoch": 0.8283333620853244, "grad_norm": 0.16598650813102722, "learning_rate": 7.239243107308247e-05, "loss": 0.6825, "mean_token_accuracy": 0.7917914390563965, "num_tokens": 287345145.0, "step": 9003 }, { "entropy": 0.6185675030574203, "epoch": 0.8284253684567656, "grad_norm": 0.15404513478279114, "learning_rate": 7.238936424694085e-05, "loss": 0.6059, "mean_token_accuracy": 0.8185132965445518, "num_tokens": 287377088.0, "step": 9004 }, { "entropy": 0.7598221022635698, "epoch": 0.8285173748282069, "grad_norm": 0.15361785888671875, "learning_rate": 7.238629742079922e-05, "loss": 0.7444, "mean_token_accuracy": 0.7812954969704151, "num_tokens": 287409339.0, "step": 9005 }, { "entropy": 0.7528890855610371, "epoch": 0.8286093811996481, "grad_norm": 0.16694988310337067, "learning_rate": 7.238323059465759e-05, "loss": 0.7562, "mean_token_accuracy": 0.7786045223474503, "num_tokens": 287440897.0, "step": 9006 }, { "entropy": 0.7257866002619267, "epoch": 0.8287013875710892, "grad_norm": 0.15898717939853668, "learning_rate": 7.238016376851597e-05, "loss": 0.7266, "mean_token_accuracy": 0.7842355668544769, "num_tokens": 287472597.0, "step": 9007 }, { "entropy": 0.6250223647803068, "epoch": 0.8287933939425305, "grad_norm": 0.14458304643630981, "learning_rate": 7.237709694237435e-05, "loss": 0.6133, "mean_token_accuracy": 0.8166712820529938, "num_tokens": 287504918.0, "step": 9008 }, { "entropy": 0.8765357509255409, "epoch": 0.8288854003139717, "grad_norm": 0.16685186326503754, "learning_rate": 7.237403011623272e-05, "loss": 0.8893, "mean_token_accuracy": 0.7396270148456097, "num_tokens": 287535928.0, "step": 9009 }, { "entropy": 0.7099541109055281, "epoch": 0.828977406685413, "grad_norm": 0.15405835211277008, "learning_rate": 7.237096329009109e-05, "loss": 0.7122, "mean_token_accuracy": 0.7868079245090485, "num_tokens": 287568198.0, "step": 9010 }, { "entropy": 0.7425329498946667, "epoch": 0.8290694130568542, "grad_norm": 0.1563442200422287, "learning_rate": 7.236789646394945e-05, "loss": 0.7287, "mean_token_accuracy": 0.783229898661375, "num_tokens": 287600229.0, "step": 9011 }, { "entropy": 0.6890686508268118, "epoch": 0.8291614194282954, "grad_norm": 0.15635515749454498, "learning_rate": 7.236482963780784e-05, "loss": 0.6665, "mean_token_accuracy": 0.7989141792058945, "num_tokens": 287631852.0, "step": 9012 }, { "entropy": 0.7994140386581421, "epoch": 0.8292534257997366, "grad_norm": 0.1601131409406662, "learning_rate": 7.236176281166622e-05, "loss": 0.7844, "mean_token_accuracy": 0.769573662430048, "num_tokens": 287663757.0, "step": 9013 }, { "entropy": 0.7297971583902836, "epoch": 0.8293454321711778, "grad_norm": 0.14865612983703613, "learning_rate": 7.235869598552458e-05, "loss": 0.7207, "mean_token_accuracy": 0.7857004143297672, "num_tokens": 287695144.0, "step": 9014 }, { "entropy": 0.7098129745572805, "epoch": 0.8294374385426191, "grad_norm": 0.1574014574289322, "learning_rate": 7.235562915938295e-05, "loss": 0.6903, "mean_token_accuracy": 0.7947061210870743, "num_tokens": 287727332.0, "step": 9015 }, { "entropy": 0.7665156293660402, "epoch": 0.8295294449140603, "grad_norm": 0.16708172857761383, "learning_rate": 7.235256233324133e-05, "loss": 0.7575, "mean_token_accuracy": 0.77857830747962, "num_tokens": 287759056.0, "step": 9016 }, { "entropy": 0.6984675414860249, "epoch": 0.8296214512855015, "grad_norm": 0.1575230360031128, "learning_rate": 7.23494955070997e-05, "loss": 0.6886, "mean_token_accuracy": 0.7969398684799671, "num_tokens": 287791415.0, "step": 9017 }, { "entropy": 0.5786485997959971, "epoch": 0.8297134576569427, "grad_norm": 0.14953181147575378, "learning_rate": 7.234642868095808e-05, "loss": 0.5637, "mean_token_accuracy": 0.8253297582268715, "num_tokens": 287823751.0, "step": 9018 }, { "entropy": 0.7793207466602325, "epoch": 0.829805464028384, "grad_norm": 0.15791882574558258, "learning_rate": 7.234336185481645e-05, "loss": 0.7631, "mean_token_accuracy": 0.7762205973267555, "num_tokens": 287854817.0, "step": 9019 }, { "entropy": 0.8050232790410519, "epoch": 0.8298974703998252, "grad_norm": 0.15131767094135284, "learning_rate": 7.234029502867483e-05, "loss": 0.8078, "mean_token_accuracy": 0.7669456787407398, "num_tokens": 287887337.0, "step": 9020 }, { "entropy": 0.6526709124445915, "epoch": 0.8299894767712664, "grad_norm": 0.1452147662639618, "learning_rate": 7.23372282025332e-05, "loss": 0.6218, "mean_token_accuracy": 0.8102943859994411, "num_tokens": 287919502.0, "step": 9021 }, { "entropy": 0.8400962855666876, "epoch": 0.8300814831427077, "grad_norm": 0.16540585458278656, "learning_rate": 7.233416137639157e-05, "loss": 0.8527, "mean_token_accuracy": 0.7511075586080551, "num_tokens": 287951788.0, "step": 9022 }, { "entropy": 0.7471245685592294, "epoch": 0.8301734895141488, "grad_norm": 0.15939123928546906, "learning_rate": 7.233109455024995e-05, "loss": 0.7364, "mean_token_accuracy": 0.7833173461258411, "num_tokens": 287983948.0, "step": 9023 }, { "entropy": 0.7751171141862869, "epoch": 0.8302654958855901, "grad_norm": 0.1564231961965561, "learning_rate": 7.232802772410833e-05, "loss": 0.7696, "mean_token_accuracy": 0.7723954319953918, "num_tokens": 288015114.0, "step": 9024 }, { "entropy": 0.7902029156684875, "epoch": 0.8303575022570313, "grad_norm": 0.1552777737379074, "learning_rate": 7.23249608979667e-05, "loss": 0.7754, "mean_token_accuracy": 0.779893308877945, "num_tokens": 288046118.0, "step": 9025 }, { "entropy": 0.8213692829012871, "epoch": 0.8304495086284726, "grad_norm": 0.16438235342502594, "learning_rate": 7.232189407182507e-05, "loss": 0.8117, "mean_token_accuracy": 0.759682409465313, "num_tokens": 288077844.0, "step": 9026 }, { "entropy": 0.6879009269177914, "epoch": 0.8305415149999138, "grad_norm": 0.16105374693870544, "learning_rate": 7.231882724568343e-05, "loss": 0.6672, "mean_token_accuracy": 0.8013769239187241, "num_tokens": 288110194.0, "step": 9027 }, { "entropy": 0.7640702128410339, "epoch": 0.8306335213713549, "grad_norm": 0.15473443269729614, "learning_rate": 7.231576041954182e-05, "loss": 0.7554, "mean_token_accuracy": 0.7801374867558479, "num_tokens": 288142266.0, "step": 9028 }, { "entropy": 0.7252395208925009, "epoch": 0.8307255277427962, "grad_norm": 0.16033917665481567, "learning_rate": 7.23126935934002e-05, "loss": 0.7202, "mean_token_accuracy": 0.7915887907147408, "num_tokens": 288173513.0, "step": 9029 }, { "entropy": 0.7625559717416763, "epoch": 0.8308175341142374, "grad_norm": 0.155028834939003, "learning_rate": 7.230962676725857e-05, "loss": 0.7613, "mean_token_accuracy": 0.775902770459652, "num_tokens": 288204848.0, "step": 9030 }, { "entropy": 0.7226546164602041, "epoch": 0.8309095404856787, "grad_norm": 0.1539127230644226, "learning_rate": 7.230655994111695e-05, "loss": 0.6962, "mean_token_accuracy": 0.7994554825127125, "num_tokens": 288236687.0, "step": 9031 }, { "entropy": 0.7526086550205946, "epoch": 0.8310015468571199, "grad_norm": 0.14946207404136658, "learning_rate": 7.230349311497531e-05, "loss": 0.7499, "mean_token_accuracy": 0.7801882028579712, "num_tokens": 288268732.0, "step": 9032 }, { "entropy": 0.7035164404660463, "epoch": 0.831093553228561, "grad_norm": 0.16737692058086395, "learning_rate": 7.23004262888337e-05, "loss": 0.7129, "mean_token_accuracy": 0.7900338843464851, "num_tokens": 288300009.0, "step": 9033 }, { "entropy": 0.7043463783338666, "epoch": 0.8311855596000023, "grad_norm": 0.16487069427967072, "learning_rate": 7.229735946269206e-05, "loss": 0.697, "mean_token_accuracy": 0.7920679710805416, "num_tokens": 288332406.0, "step": 9034 }, { "entropy": 0.7247197423130274, "epoch": 0.8312775659714435, "grad_norm": 0.1542634814977646, "learning_rate": 7.229429263655045e-05, "loss": 0.7259, "mean_token_accuracy": 0.785319097340107, "num_tokens": 288363877.0, "step": 9035 }, { "entropy": 0.6642403639853001, "epoch": 0.8313695723428848, "grad_norm": 0.15734757483005524, "learning_rate": 7.229122581040881e-05, "loss": 0.6246, "mean_token_accuracy": 0.8100782036781311, "num_tokens": 288394914.0, "step": 9036 }, { "entropy": 0.6057250201702118, "epoch": 0.831461578714326, "grad_norm": 0.15744243562221527, "learning_rate": 7.228815898426718e-05, "loss": 0.603, "mean_token_accuracy": 0.8201303109526634, "num_tokens": 288426716.0, "step": 9037 }, { "entropy": 0.602662481367588, "epoch": 0.8315535850857672, "grad_norm": 0.1442810446023941, "learning_rate": 7.228509215812556e-05, "loss": 0.5744, "mean_token_accuracy": 0.8270961083471775, "num_tokens": 288458868.0, "step": 9038 }, { "entropy": 0.7822940368205309, "epoch": 0.8316455914572084, "grad_norm": 0.16748479008674622, "learning_rate": 7.228202533198394e-05, "loss": 0.7671, "mean_token_accuracy": 0.7802121862769127, "num_tokens": 288491024.0, "step": 9039 }, { "entropy": 0.7370800450444221, "epoch": 0.8317375978286496, "grad_norm": 0.15442612767219543, "learning_rate": 7.227895850584231e-05, "loss": 0.7262, "mean_token_accuracy": 0.7869678661227226, "num_tokens": 288523344.0, "step": 9040 }, { "entropy": 0.65129888150841, "epoch": 0.8318296042000909, "grad_norm": 0.1575363129377365, "learning_rate": 7.227589167970068e-05, "loss": 0.6418, "mean_token_accuracy": 0.8064895048737526, "num_tokens": 288556047.0, "step": 9041 }, { "entropy": 0.6010574614629149, "epoch": 0.8319216105715321, "grad_norm": 0.15597344934940338, "learning_rate": 7.227282485355905e-05, "loss": 0.571, "mean_token_accuracy": 0.8293974287807941, "num_tokens": 288587878.0, "step": 9042 }, { "entropy": 0.796992477029562, "epoch": 0.8320136169429733, "grad_norm": 0.15801484882831573, "learning_rate": 7.226975802741743e-05, "loss": 0.7919, "mean_token_accuracy": 0.7683635912835598, "num_tokens": 288620160.0, "step": 9043 }, { "entropy": 0.7380119673907757, "epoch": 0.8321056233144145, "grad_norm": 0.14947862923145294, "learning_rate": 7.226669120127581e-05, "loss": 0.7232, "mean_token_accuracy": 0.7856890857219696, "num_tokens": 288652329.0, "step": 9044 }, { "entropy": 0.679066464304924, "epoch": 0.8321976296858558, "grad_norm": 0.16159687936306, "learning_rate": 7.226362437513418e-05, "loss": 0.6788, "mean_token_accuracy": 0.7998374439775944, "num_tokens": 288684826.0, "step": 9045 }, { "entropy": 0.6982147675007582, "epoch": 0.832289636057297, "grad_norm": 0.15861134231090546, "learning_rate": 7.226055754899255e-05, "loss": 0.6792, "mean_token_accuracy": 0.7959214597940445, "num_tokens": 288715861.0, "step": 9046 }, { "entropy": 0.6829829849302769, "epoch": 0.8323816424287382, "grad_norm": 0.14946940541267395, "learning_rate": 7.225749072285093e-05, "loss": 0.6613, "mean_token_accuracy": 0.8035935424268246, "num_tokens": 288748191.0, "step": 9047 }, { "entropy": 0.7032972620800138, "epoch": 0.8324736488001794, "grad_norm": 0.1501259058713913, "learning_rate": 7.22544238967093e-05, "loss": 0.6875, "mean_token_accuracy": 0.7969786040484905, "num_tokens": 288780224.0, "step": 9048 }, { "entropy": 0.7577467486262321, "epoch": 0.8325656551716206, "grad_norm": 0.15988539159297943, "learning_rate": 7.225135707056768e-05, "loss": 0.7389, "mean_token_accuracy": 0.7871299050748348, "num_tokens": 288812769.0, "step": 9049 }, { "entropy": 0.8337681796401739, "epoch": 0.8326576615430619, "grad_norm": 0.16370603442192078, "learning_rate": 7.224829024442604e-05, "loss": 0.8125, "mean_token_accuracy": 0.7598007544875145, "num_tokens": 288843713.0, "step": 9050 }, { "entropy": 0.7212961576879025, "epoch": 0.8327496679145031, "grad_norm": 0.2335633933544159, "learning_rate": 7.224522341828443e-05, "loss": 0.7276, "mean_token_accuracy": 0.7881589718163013, "num_tokens": 288875768.0, "step": 9051 }, { "entropy": 0.7176481820642948, "epoch": 0.8328416742859444, "grad_norm": 0.15961724519729614, "learning_rate": 7.22421565921428e-05, "loss": 0.6965, "mean_token_accuracy": 0.7944708205759525, "num_tokens": 288908371.0, "step": 9052 }, { "entropy": 0.7095932513475418, "epoch": 0.8329336806573855, "grad_norm": 0.15164814889431, "learning_rate": 7.223908976600116e-05, "loss": 0.7097, "mean_token_accuracy": 0.790350180119276, "num_tokens": 288940948.0, "step": 9053 }, { "entropy": 0.6601394917815924, "epoch": 0.8330256870288267, "grad_norm": 0.14953729510307312, "learning_rate": 7.223602293985954e-05, "loss": 0.6484, "mean_token_accuracy": 0.8044304214417934, "num_tokens": 288972525.0, "step": 9054 }, { "entropy": 0.7356527559459209, "epoch": 0.833117693400268, "grad_norm": 0.15007644891738892, "learning_rate": 7.223295611371792e-05, "loss": 0.7261, "mean_token_accuracy": 0.7848861217498779, "num_tokens": 289004656.0, "step": 9055 }, { "entropy": 0.6611402835696936, "epoch": 0.8332096997717092, "grad_norm": 0.1511750966310501, "learning_rate": 7.222988928757629e-05, "loss": 0.642, "mean_token_accuracy": 0.8087352104485035, "num_tokens": 289036981.0, "step": 9056 }, { "entropy": 0.72827123478055, "epoch": 0.8333017061431505, "grad_norm": 0.15757159888744354, "learning_rate": 7.222682246143466e-05, "loss": 0.7119, "mean_token_accuracy": 0.7875059805810452, "num_tokens": 289068261.0, "step": 9057 }, { "entropy": 0.7024492742493749, "epoch": 0.8333937125145916, "grad_norm": 0.15552684664726257, "learning_rate": 7.222375563529303e-05, "loss": 0.6958, "mean_token_accuracy": 0.7982423640787601, "num_tokens": 289100155.0, "step": 9058 }, { "entropy": 0.7100191693753004, "epoch": 0.8334857188860328, "grad_norm": 0.16387872397899628, "learning_rate": 7.222068880915141e-05, "loss": 0.7039, "mean_token_accuracy": 0.79165318608284, "num_tokens": 289132534.0, "step": 9059 }, { "entropy": 0.7278943229466677, "epoch": 0.8335777252574741, "grad_norm": 0.1531963348388672, "learning_rate": 7.221762198300979e-05, "loss": 0.7248, "mean_token_accuracy": 0.7876242324709892, "num_tokens": 289164482.0, "step": 9060 }, { "entropy": 0.8459995836019516, "epoch": 0.8336697316289153, "grad_norm": 0.15800246596336365, "learning_rate": 7.221455515686816e-05, "loss": 0.8338, "mean_token_accuracy": 0.7521229311823845, "num_tokens": 289196679.0, "step": 9061 }, { "entropy": 0.7535284496843815, "epoch": 0.8337617380003566, "grad_norm": 0.15873971581459045, "learning_rate": 7.221148833072654e-05, "loss": 0.732, "mean_token_accuracy": 0.7823768369853497, "num_tokens": 289228110.0, "step": 9062 }, { "entropy": 0.7912134602665901, "epoch": 0.8338537443717977, "grad_norm": 0.16510143876075745, "learning_rate": 7.220842150458491e-05, "loss": 0.7828, "mean_token_accuracy": 0.7714928016066551, "num_tokens": 289259687.0, "step": 9063 }, { "entropy": 0.7188374362885952, "epoch": 0.833945750743239, "grad_norm": 0.1576336920261383, "learning_rate": 7.220535467844328e-05, "loss": 0.7222, "mean_token_accuracy": 0.7913253493607044, "num_tokens": 289292306.0, "step": 9064 }, { "entropy": 0.6333608757704496, "epoch": 0.8340377571146802, "grad_norm": 0.15111960470676422, "learning_rate": 7.220228785230166e-05, "loss": 0.6252, "mean_token_accuracy": 0.8152494542300701, "num_tokens": 289324022.0, "step": 9065 }, { "entropy": 0.6546909417957067, "epoch": 0.8341297634861214, "grad_norm": 0.15430863201618195, "learning_rate": 7.219922102616004e-05, "loss": 0.6515, "mean_token_accuracy": 0.802647054195404, "num_tokens": 289356660.0, "step": 9066 }, { "entropy": 0.6999685764312744, "epoch": 0.8342217698575627, "grad_norm": 0.1590089499950409, "learning_rate": 7.219615420001841e-05, "loss": 0.6781, "mean_token_accuracy": 0.7941929548978806, "num_tokens": 289387870.0, "step": 9067 }, { "entropy": 0.752943177241832, "epoch": 0.8343137762290038, "grad_norm": 0.16467207670211792, "learning_rate": 7.219308737387677e-05, "loss": 0.7364, "mean_token_accuracy": 0.7855724282562733, "num_tokens": 289419938.0, "step": 9068 }, { "entropy": 0.8011746732518077, "epoch": 0.8344057826004451, "grad_norm": 0.15543636679649353, "learning_rate": 7.219002054773514e-05, "loss": 0.7952, "mean_token_accuracy": 0.7682080380618572, "num_tokens": 289452242.0, "step": 9069 }, { "entropy": 0.7420968264341354, "epoch": 0.8344977889718863, "grad_norm": 0.15573789179325104, "learning_rate": 7.218695372159354e-05, "loss": 0.7404, "mean_token_accuracy": 0.7851684652268887, "num_tokens": 289483012.0, "step": 9070 }, { "entropy": 0.7893108427524567, "epoch": 0.8345897953433276, "grad_norm": 0.15170513093471527, "learning_rate": 7.21838868954519e-05, "loss": 0.7567, "mean_token_accuracy": 0.7760877497494221, "num_tokens": 289514820.0, "step": 9071 }, { "entropy": 0.6985017471015453, "epoch": 0.8346818017147688, "grad_norm": 0.14756865799427032, "learning_rate": 7.218082006931027e-05, "loss": 0.6931, "mean_token_accuracy": 0.7948386967182159, "num_tokens": 289547096.0, "step": 9072 }, { "entropy": 0.7017037626355886, "epoch": 0.8347738080862099, "grad_norm": 0.15140597522258759, "learning_rate": 7.217775324316864e-05, "loss": 0.6785, "mean_token_accuracy": 0.7986987791955471, "num_tokens": 289579199.0, "step": 9073 }, { "entropy": 0.7091028904542327, "epoch": 0.8348658144576512, "grad_norm": 0.16450288891792297, "learning_rate": 7.217468641702702e-05, "loss": 0.6771, "mean_token_accuracy": 0.8006963580846786, "num_tokens": 289610801.0, "step": 9074 }, { "entropy": 0.7282332964241505, "epoch": 0.8349578208290924, "grad_norm": 0.155295267701149, "learning_rate": 7.21716195908854e-05, "loss": 0.7169, "mean_token_accuracy": 0.790201723575592, "num_tokens": 289642645.0, "step": 9075 }, { "entropy": 0.7702591791749, "epoch": 0.8350498272005337, "grad_norm": 0.16323600709438324, "learning_rate": 7.216855276474377e-05, "loss": 0.74, "mean_token_accuracy": 0.780291423201561, "num_tokens": 289674698.0, "step": 9076 }, { "entropy": 0.7883815765380859, "epoch": 0.8351418335719749, "grad_norm": 0.16881293058395386, "learning_rate": 7.216548593860214e-05, "loss": 0.8054, "mean_token_accuracy": 0.7657389044761658, "num_tokens": 289705687.0, "step": 9077 }, { "entropy": 0.7313745729625225, "epoch": 0.835233839943416, "grad_norm": 0.1524861603975296, "learning_rate": 7.216241911246052e-05, "loss": 0.7197, "mean_token_accuracy": 0.7861227318644524, "num_tokens": 289736818.0, "step": 9078 }, { "entropy": 0.8070585038512945, "epoch": 0.8353258463148573, "grad_norm": 0.15937016904354095, "learning_rate": 7.215935228631889e-05, "loss": 0.7981, "mean_token_accuracy": 0.7645954303443432, "num_tokens": 289767905.0, "step": 9079 }, { "entropy": 0.5677783973515034, "epoch": 0.8354178526862985, "grad_norm": 0.16189704835414886, "learning_rate": 7.215628546017727e-05, "loss": 0.5451, "mean_token_accuracy": 0.8356296569108963, "num_tokens": 289800053.0, "step": 9080 }, { "entropy": 0.7145978566259146, "epoch": 0.8355098590577398, "grad_norm": 0.16118332743644714, "learning_rate": 7.215321863403564e-05, "loss": 0.6958, "mean_token_accuracy": 0.7911686673760414, "num_tokens": 289832008.0, "step": 9081 }, { "entropy": 0.7620208309963346, "epoch": 0.835601865429181, "grad_norm": 0.1525549441576004, "learning_rate": 7.215015180789402e-05, "loss": 0.7387, "mean_token_accuracy": 0.7821249067783356, "num_tokens": 289864246.0, "step": 9082 }, { "entropy": 0.6497007552534342, "epoch": 0.8356938718006222, "grad_norm": 0.14238062500953674, "learning_rate": 7.214708498175239e-05, "loss": 0.6277, "mean_token_accuracy": 0.8129583597183228, "num_tokens": 289895952.0, "step": 9083 }, { "entropy": 0.7372745517641306, "epoch": 0.8357858781720634, "grad_norm": 0.1538478583097458, "learning_rate": 7.214401815561076e-05, "loss": 0.7108, "mean_token_accuracy": 0.7909903712570667, "num_tokens": 289928402.0, "step": 9084 }, { "entropy": 0.6672486402094364, "epoch": 0.8358778845435046, "grad_norm": 0.15175490081310272, "learning_rate": 7.214095132946914e-05, "loss": 0.6577, "mean_token_accuracy": 0.7982964813709259, "num_tokens": 289959607.0, "step": 9085 }, { "entropy": 0.7003800440579653, "epoch": 0.8359698909149459, "grad_norm": 0.15945777297019958, "learning_rate": 7.213788450332752e-05, "loss": 0.6851, "mean_token_accuracy": 0.7994478903710842, "num_tokens": 289990766.0, "step": 9086 }, { "entropy": 0.7068077716976404, "epoch": 0.8360618972863871, "grad_norm": 0.15663355588912964, "learning_rate": 7.213481767718589e-05, "loss": 0.7013, "mean_token_accuracy": 0.7938034310936928, "num_tokens": 290022675.0, "step": 9087 }, { "entropy": 0.6730928458273411, "epoch": 0.8361539036578283, "grad_norm": 0.16182364523410797, "learning_rate": 7.213175085104425e-05, "loss": 0.6678, "mean_token_accuracy": 0.7998382449150085, "num_tokens": 290055151.0, "step": 9088 }, { "entropy": 0.7336231525987387, "epoch": 0.8362459100292695, "grad_norm": 0.15595953166484833, "learning_rate": 7.212868402490262e-05, "loss": 0.7375, "mean_token_accuracy": 0.7802033089101315, "num_tokens": 290087012.0, "step": 9089 }, { "entropy": 0.6424590721726418, "epoch": 0.8363379164007108, "grad_norm": 0.1499582827091217, "learning_rate": 7.2125617198761e-05, "loss": 0.6244, "mean_token_accuracy": 0.8121199309825897, "num_tokens": 290118774.0, "step": 9090 }, { "entropy": 0.7046530190855265, "epoch": 0.836429922772152, "grad_norm": 0.1526794135570526, "learning_rate": 7.212255037261938e-05, "loss": 0.7037, "mean_token_accuracy": 0.7907492406666279, "num_tokens": 290151073.0, "step": 9091 }, { "entropy": 0.6194196175783873, "epoch": 0.8365219291435932, "grad_norm": 0.14288388192653656, "learning_rate": 7.211948354647775e-05, "loss": 0.5984, "mean_token_accuracy": 0.8217645697295666, "num_tokens": 290182854.0, "step": 9092 }, { "entropy": 0.641222364269197, "epoch": 0.8366139355150344, "grad_norm": 0.15027932822704315, "learning_rate": 7.211641672033613e-05, "loss": 0.6288, "mean_token_accuracy": 0.8117330186069012, "num_tokens": 290215089.0, "step": 9093 }, { "entropy": 0.7702732374891639, "epoch": 0.8367059418864756, "grad_norm": 0.16285118460655212, "learning_rate": 7.21133498941945e-05, "loss": 0.7643, "mean_token_accuracy": 0.7727273516356945, "num_tokens": 290246879.0, "step": 9094 }, { "entropy": 0.6996157485991716, "epoch": 0.8367979482579169, "grad_norm": 0.1448875069618225, "learning_rate": 7.211028306805287e-05, "loss": 0.6898, "mean_token_accuracy": 0.7903244458138943, "num_tokens": 290279596.0, "step": 9095 }, { "entropy": 0.7506060730665922, "epoch": 0.8368899546293581, "grad_norm": 0.15412555634975433, "learning_rate": 7.210721624191125e-05, "loss": 0.7507, "mean_token_accuracy": 0.7809656746685505, "num_tokens": 290311272.0, "step": 9096 }, { "entropy": 0.7312762401998043, "epoch": 0.8369819610007994, "grad_norm": 0.1577703356742859, "learning_rate": 7.210414941576963e-05, "loss": 0.7324, "mean_token_accuracy": 0.7790478616952896, "num_tokens": 290343641.0, "step": 9097 }, { "entropy": 0.8387475442141294, "epoch": 0.8370739673722405, "grad_norm": 0.16553093492984772, "learning_rate": 7.2101082589628e-05, "loss": 0.8237, "mean_token_accuracy": 0.7642966508865356, "num_tokens": 290374845.0, "step": 9098 }, { "entropy": 0.7379847355186939, "epoch": 0.8371659737436817, "grad_norm": 0.15322065353393555, "learning_rate": 7.209801576348637e-05, "loss": 0.7349, "mean_token_accuracy": 0.7838339321315289, "num_tokens": 290406960.0, "step": 9099 }, { "entropy": 0.6216367911547422, "epoch": 0.837257980115123, "grad_norm": 0.15819482505321503, "learning_rate": 7.209494893734474e-05, "loss": 0.596, "mean_token_accuracy": 0.8189467936754227, "num_tokens": 290438372.0, "step": 9100 }, { "entropy": 0.7426403919234872, "epoch": 0.8373499864865642, "grad_norm": 0.1579977571964264, "learning_rate": 7.209188211120312e-05, "loss": 0.7343, "mean_token_accuracy": 0.7812631540000439, "num_tokens": 290470854.0, "step": 9101 }, { "entropy": 0.6809677165001631, "epoch": 0.8374419928580055, "grad_norm": 0.15011511743068695, "learning_rate": 7.20888152850615e-05, "loss": 0.6706, "mean_token_accuracy": 0.8011860884726048, "num_tokens": 290503406.0, "step": 9102 }, { "entropy": 0.7277039233595133, "epoch": 0.8375339992294466, "grad_norm": 0.1522298902273178, "learning_rate": 7.208574845891987e-05, "loss": 0.7198, "mean_token_accuracy": 0.7868996374309063, "num_tokens": 290534696.0, "step": 9103 }, { "entropy": 0.7818477936089039, "epoch": 0.8376260056008878, "grad_norm": 0.16164185106754303, "learning_rate": 7.208268163277823e-05, "loss": 0.7753, "mean_token_accuracy": 0.7724071629345417, "num_tokens": 290566204.0, "step": 9104 }, { "entropy": 0.7703542821109295, "epoch": 0.8377180119723291, "grad_norm": 0.15275658667087555, "learning_rate": 7.207961480663662e-05, "loss": 0.7656, "mean_token_accuracy": 0.772015817463398, "num_tokens": 290597830.0, "step": 9105 }, { "entropy": 0.7607256602495909, "epoch": 0.8378100183437703, "grad_norm": 0.1534416675567627, "learning_rate": 7.207654798049498e-05, "loss": 0.7529, "mean_token_accuracy": 0.7785833179950714, "num_tokens": 290629931.0, "step": 9106 }, { "entropy": 0.8179734088480473, "epoch": 0.8379020247152116, "grad_norm": 0.16052763164043427, "learning_rate": 7.207348115435337e-05, "loss": 0.8058, "mean_token_accuracy": 0.7636258080601692, "num_tokens": 290662072.0, "step": 9107 }, { "entropy": 0.6669319029897451, "epoch": 0.8379940310866527, "grad_norm": 0.1633872240781784, "learning_rate": 7.207041432821173e-05, "loss": 0.6702, "mean_token_accuracy": 0.8028389737010002, "num_tokens": 290694318.0, "step": 9108 }, { "entropy": 0.7575189173221588, "epoch": 0.838086037458094, "grad_norm": 0.15163789689540863, "learning_rate": 7.206734750207011e-05, "loss": 0.7474, "mean_token_accuracy": 0.7725635282695293, "num_tokens": 290726059.0, "step": 9109 }, { "entropy": 0.7028163289651275, "epoch": 0.8381780438295352, "grad_norm": 0.15795832872390747, "learning_rate": 7.206428067592848e-05, "loss": 0.6891, "mean_token_accuracy": 0.8006570860743523, "num_tokens": 290757574.0, "step": 9110 }, { "entropy": 0.8231040649116039, "epoch": 0.8382700502009764, "grad_norm": 0.15850788354873657, "learning_rate": 7.206121384978685e-05, "loss": 0.8029, "mean_token_accuracy": 0.7611682675778866, "num_tokens": 290789197.0, "step": 9111 }, { "entropy": 0.6808954635635018, "epoch": 0.8383620565724177, "grad_norm": 0.14355963468551636, "learning_rate": 7.205814702364523e-05, "loss": 0.6668, "mean_token_accuracy": 0.8031413070857525, "num_tokens": 290821618.0, "step": 9112 }, { "entropy": 0.824683353304863, "epoch": 0.8384540629438588, "grad_norm": 0.15829217433929443, "learning_rate": 7.205508019750361e-05, "loss": 0.8353, "mean_token_accuracy": 0.7573675513267517, "num_tokens": 290854199.0, "step": 9113 }, { "entropy": 0.655140820890665, "epoch": 0.8385460693153001, "grad_norm": 0.14977408945560455, "learning_rate": 7.205201337136198e-05, "loss": 0.6284, "mean_token_accuracy": 0.8129732832312584, "num_tokens": 290886562.0, "step": 9114 }, { "entropy": 0.7693132124841213, "epoch": 0.8386380756867413, "grad_norm": 0.1705305427312851, "learning_rate": 7.204894654522035e-05, "loss": 0.7726, "mean_token_accuracy": 0.7719013281166553, "num_tokens": 290917860.0, "step": 9115 }, { "entropy": 0.7068646363914013, "epoch": 0.8387300820581826, "grad_norm": 0.16985681653022766, "learning_rate": 7.204587971907872e-05, "loss": 0.7114, "mean_token_accuracy": 0.7856886014342308, "num_tokens": 290949963.0, "step": 9116 }, { "entropy": 0.72588218934834, "epoch": 0.8388220884296238, "grad_norm": 0.16153481602668762, "learning_rate": 7.204281289293711e-05, "loss": 0.7233, "mean_token_accuracy": 0.7865076884627342, "num_tokens": 290981436.0, "step": 9117 }, { "entropy": 0.6672923490405083, "epoch": 0.8389140948010649, "grad_norm": 0.1622495800256729, "learning_rate": 7.203974606679548e-05, "loss": 0.6636, "mean_token_accuracy": 0.8006380833685398, "num_tokens": 291012455.0, "step": 9118 }, { "entropy": 0.7106853816658258, "epoch": 0.8390061011725062, "grad_norm": 0.16657352447509766, "learning_rate": 7.203667924065385e-05, "loss": 0.7224, "mean_token_accuracy": 0.78583649918437, "num_tokens": 291043099.0, "step": 9119 }, { "entropy": 0.6950165051966906, "epoch": 0.8390981075439474, "grad_norm": 0.15076442062854767, "learning_rate": 7.203361241451222e-05, "loss": 0.6803, "mean_token_accuracy": 0.7965792417526245, "num_tokens": 291075162.0, "step": 9120 }, { "entropy": 0.6909131482243538, "epoch": 0.8391901139153887, "grad_norm": 0.15015725791454315, "learning_rate": 7.20305455883706e-05, "loss": 0.6501, "mean_token_accuracy": 0.8066425733268261, "num_tokens": 291107338.0, "step": 9121 }, { "entropy": 0.8037039646878839, "epoch": 0.8392821202868299, "grad_norm": 0.16066840291023254, "learning_rate": 7.202747876222898e-05, "loss": 0.7796, "mean_token_accuracy": 0.774312362074852, "num_tokens": 291138768.0, "step": 9122 }, { "entropy": 0.795921178534627, "epoch": 0.839374126658271, "grad_norm": 0.16759628057479858, "learning_rate": 7.202441193608735e-05, "loss": 0.7814, "mean_token_accuracy": 0.7702923193573952, "num_tokens": 291170495.0, "step": 9123 }, { "entropy": 0.7076387796550989, "epoch": 0.8394661330297123, "grad_norm": 0.15972813963890076, "learning_rate": 7.202134510994573e-05, "loss": 0.6906, "mean_token_accuracy": 0.7926385439932346, "num_tokens": 291201209.0, "step": 9124 }, { "entropy": 0.6522480361163616, "epoch": 0.8395581394011535, "grad_norm": 0.15658971667289734, "learning_rate": 7.20182782838041e-05, "loss": 0.6438, "mean_token_accuracy": 0.8082863688468933, "num_tokens": 291232479.0, "step": 9125 }, { "entropy": 0.7804186958819628, "epoch": 0.8396501457725948, "grad_norm": 0.15578942000865936, "learning_rate": 7.201521145766246e-05, "loss": 0.7543, "mean_token_accuracy": 0.7833068482577801, "num_tokens": 291264594.0, "step": 9126 }, { "entropy": 0.7531399819999933, "epoch": 0.839742152144036, "grad_norm": 0.16203129291534424, "learning_rate": 7.201214463152084e-05, "loss": 0.7453, "mean_token_accuracy": 0.778734628111124, "num_tokens": 291296092.0, "step": 9127 }, { "entropy": 0.7967815641313791, "epoch": 0.8398341585154772, "grad_norm": 0.16317884624004364, "learning_rate": 7.200907780537923e-05, "loss": 0.7801, "mean_token_accuracy": 0.7698479257524014, "num_tokens": 291327205.0, "step": 9128 }, { "entropy": 0.675640681758523, "epoch": 0.8399261648869184, "grad_norm": 0.15583230555057526, "learning_rate": 7.20060109792376e-05, "loss": 0.6721, "mean_token_accuracy": 0.8022660538554192, "num_tokens": 291359155.0, "step": 9129 }, { "entropy": 0.7380182724446058, "epoch": 0.8400181712583596, "grad_norm": 0.14910826086997986, "learning_rate": 7.200294415309596e-05, "loss": 0.7199, "mean_token_accuracy": 0.7871597744524479, "num_tokens": 291391020.0, "step": 9130 }, { "entropy": 0.6940079070627689, "epoch": 0.8401101776298009, "grad_norm": 0.15100473165512085, "learning_rate": 7.199987732695433e-05, "loss": 0.675, "mean_token_accuracy": 0.7931666970252991, "num_tokens": 291423005.0, "step": 9131 }, { "entropy": 0.7716233115643263, "epoch": 0.8402021840012421, "grad_norm": 0.16140922904014587, "learning_rate": 7.199681050081271e-05, "loss": 0.7455, "mean_token_accuracy": 0.7789973504841328, "num_tokens": 291454862.0, "step": 9132 }, { "entropy": 0.7918229848146439, "epoch": 0.8402941903726833, "grad_norm": 0.16213946044445038, "learning_rate": 7.199374367467109e-05, "loss": 0.7791, "mean_token_accuracy": 0.7711617462337017, "num_tokens": 291486798.0, "step": 9133 }, { "entropy": 0.7759582027792931, "epoch": 0.8403861967441245, "grad_norm": 0.15595367550849915, "learning_rate": 7.199067684852946e-05, "loss": 0.7614, "mean_token_accuracy": 0.7725962623953819, "num_tokens": 291518655.0, "step": 9134 }, { "entropy": 0.7150936499238014, "epoch": 0.8404782031155658, "grad_norm": 0.15224827826023102, "learning_rate": 7.198761002238783e-05, "loss": 0.7056, "mean_token_accuracy": 0.7914420291781425, "num_tokens": 291551316.0, "step": 9135 }, { "entropy": 0.6603256389498711, "epoch": 0.840570209487007, "grad_norm": 0.1530485302209854, "learning_rate": 7.198454319624621e-05, "loss": 0.6539, "mean_token_accuracy": 0.8050058484077454, "num_tokens": 291583157.0, "step": 9136 }, { "entropy": 0.710412859916687, "epoch": 0.8406622158584482, "grad_norm": 0.161378413438797, "learning_rate": 7.198147637010458e-05, "loss": 0.7088, "mean_token_accuracy": 0.7920417338609695, "num_tokens": 291615244.0, "step": 9137 }, { "entropy": 0.7094080299139023, "epoch": 0.8407542222298894, "grad_norm": 0.1612183302640915, "learning_rate": 7.197840954396296e-05, "loss": 0.7155, "mean_token_accuracy": 0.7852180972695351, "num_tokens": 291647202.0, "step": 9138 }, { "entropy": 0.6052472312003374, "epoch": 0.8408462286013306, "grad_norm": 0.14680461585521698, "learning_rate": 7.197534271782133e-05, "loss": 0.5818, "mean_token_accuracy": 0.8263604193925858, "num_tokens": 291679447.0, "step": 9139 }, { "entropy": 0.7243910431861877, "epoch": 0.8409382349727719, "grad_norm": 0.15329138934612274, "learning_rate": 7.197227589167971e-05, "loss": 0.7085, "mean_token_accuracy": 0.7877175360918045, "num_tokens": 291711428.0, "step": 9140 }, { "entropy": 0.6879602484405041, "epoch": 0.8410302413442131, "grad_norm": 0.1530250608921051, "learning_rate": 7.196920906553808e-05, "loss": 0.6899, "mean_token_accuracy": 0.7967805787920952, "num_tokens": 291743326.0, "step": 9141 }, { "entropy": 0.7535233972594142, "epoch": 0.8411222477156544, "grad_norm": 0.15617775917053223, "learning_rate": 7.196614223939644e-05, "loss": 0.7602, "mean_token_accuracy": 0.7801307067275047, "num_tokens": 291775639.0, "step": 9142 }, { "entropy": 0.7731720898300409, "epoch": 0.8412142540870955, "grad_norm": 0.16273672878742218, "learning_rate": 7.196307541325483e-05, "loss": 0.7562, "mean_token_accuracy": 0.7743697874248028, "num_tokens": 291807481.0, "step": 9143 }, { "entropy": 0.8433875795453787, "epoch": 0.8413062604585367, "grad_norm": 0.15419432520866394, "learning_rate": 7.196000858711321e-05, "loss": 0.8247, "mean_token_accuracy": 0.7588876411318779, "num_tokens": 291839453.0, "step": 9144 }, { "entropy": 0.7226981520652771, "epoch": 0.841398266829978, "grad_norm": 0.1483229547739029, "learning_rate": 7.195694176097158e-05, "loss": 0.7016, "mean_token_accuracy": 0.7941842451691628, "num_tokens": 291871312.0, "step": 9145 }, { "entropy": 0.6813469771295786, "epoch": 0.8414902732014192, "grad_norm": 0.1489291936159134, "learning_rate": 7.195387493482994e-05, "loss": 0.6662, "mean_token_accuracy": 0.8007392100989819, "num_tokens": 291903543.0, "step": 9146 }, { "entropy": 0.6625216286629438, "epoch": 0.8415822795728605, "grad_norm": 0.1504790335893631, "learning_rate": 7.195080810868831e-05, "loss": 0.6453, "mean_token_accuracy": 0.8096517100930214, "num_tokens": 291935159.0, "step": 9147 }, { "entropy": 0.7267012242227793, "epoch": 0.8416742859443016, "grad_norm": 0.16325423121452332, "learning_rate": 7.194774128254669e-05, "loss": 0.7182, "mean_token_accuracy": 0.7912342511117458, "num_tokens": 291967169.0, "step": 9148 }, { "entropy": 0.709007864817977, "epoch": 0.8417662923157428, "grad_norm": 0.1657252311706543, "learning_rate": 7.194467445640507e-05, "loss": 0.7039, "mean_token_accuracy": 0.7942780181765556, "num_tokens": 291999746.0, "step": 9149 }, { "entropy": 0.7095518782734871, "epoch": 0.8418582986871841, "grad_norm": 0.16132722795009613, "learning_rate": 7.194160763026344e-05, "loss": 0.7033, "mean_token_accuracy": 0.7924651354551315, "num_tokens": 292031823.0, "step": 9150 }, { "entropy": 0.6440283069387078, "epoch": 0.8419503050586253, "grad_norm": 0.1572652906179428, "learning_rate": 7.193854080412181e-05, "loss": 0.6184, "mean_token_accuracy": 0.8158353306353092, "num_tokens": 292063784.0, "step": 9151 }, { "entropy": 0.7242790758609772, "epoch": 0.8420423114300666, "grad_norm": 0.15191426873207092, "learning_rate": 7.193547397798019e-05, "loss": 0.7255, "mean_token_accuracy": 0.7837333753705025, "num_tokens": 292096225.0, "step": 9152 }, { "entropy": 0.8049300238490105, "epoch": 0.8421343178015077, "grad_norm": 0.16763795912265778, "learning_rate": 7.193240715183857e-05, "loss": 0.8077, "mean_token_accuracy": 0.7666965015232563, "num_tokens": 292127685.0, "step": 9153 }, { "entropy": 0.7672038618475199, "epoch": 0.842226324172949, "grad_norm": 0.1521313339471817, "learning_rate": 7.192934032569694e-05, "loss": 0.7606, "mean_token_accuracy": 0.7699453718960285, "num_tokens": 292159234.0, "step": 9154 }, { "entropy": 0.670178510248661, "epoch": 0.8423183305443902, "grad_norm": 0.15014037489891052, "learning_rate": 7.192627349955532e-05, "loss": 0.6628, "mean_token_accuracy": 0.8012550435960293, "num_tokens": 292191241.0, "step": 9155 }, { "entropy": 0.7219825275242329, "epoch": 0.8424103369158314, "grad_norm": 0.1495664119720459, "learning_rate": 7.192320667341369e-05, "loss": 0.7103, "mean_token_accuracy": 0.7907122112810612, "num_tokens": 292222894.0, "step": 9156 }, { "entropy": 0.6905241142958403, "epoch": 0.8425023432872727, "grad_norm": 0.15638595819473267, "learning_rate": 7.192013984727206e-05, "loss": 0.668, "mean_token_accuracy": 0.7961458154022694, "num_tokens": 292254580.0, "step": 9157 }, { "entropy": 0.7114584296941757, "epoch": 0.8425943496587138, "grad_norm": 0.15870784223079681, "learning_rate": 7.191707302113044e-05, "loss": 0.6985, "mean_token_accuracy": 0.7920849099755287, "num_tokens": 292286119.0, "step": 9158 }, { "entropy": 0.6766656888648868, "epoch": 0.8426863560301551, "grad_norm": 0.14660494029521942, "learning_rate": 7.191400619498882e-05, "loss": 0.6636, "mean_token_accuracy": 0.8052758872509003, "num_tokens": 292318391.0, "step": 9159 }, { "entropy": 0.6700955852866173, "epoch": 0.8427783624015963, "grad_norm": 0.15591922402381897, "learning_rate": 7.191093936884719e-05, "loss": 0.6697, "mean_token_accuracy": 0.8001781888306141, "num_tokens": 292350652.0, "step": 9160 }, { "entropy": 0.7005115170031786, "epoch": 0.8428703687730376, "grad_norm": 0.14557160437107086, "learning_rate": 7.190787254270556e-05, "loss": 0.6929, "mean_token_accuracy": 0.7915661409497261, "num_tokens": 292382140.0, "step": 9161 }, { "entropy": 0.8136640302836895, "epoch": 0.8429623751444788, "grad_norm": 0.15356279909610748, "learning_rate": 7.190480571656392e-05, "loss": 0.8031, "mean_token_accuracy": 0.764214813709259, "num_tokens": 292414626.0, "step": 9162 }, { "entropy": 0.7441516611725092, "epoch": 0.8430543815159199, "grad_norm": 0.15078510344028473, "learning_rate": 7.19017388904223e-05, "loss": 0.7471, "mean_token_accuracy": 0.7783933505415916, "num_tokens": 292446321.0, "step": 9163 }, { "entropy": 0.7189911454916, "epoch": 0.8431463878873612, "grad_norm": 0.1564454883337021, "learning_rate": 7.189867206428069e-05, "loss": 0.7183, "mean_token_accuracy": 0.7875682562589645, "num_tokens": 292478299.0, "step": 9164 }, { "entropy": 0.7024230156093836, "epoch": 0.8432383942588024, "grad_norm": 0.14831531047821045, "learning_rate": 7.189560523813905e-05, "loss": 0.7018, "mean_token_accuracy": 0.7926139272749424, "num_tokens": 292509887.0, "step": 9165 }, { "entropy": 0.6817587539553642, "epoch": 0.8433304006302437, "grad_norm": 0.16079320013523102, "learning_rate": 7.189253841199742e-05, "loss": 0.6752, "mean_token_accuracy": 0.7978444024920464, "num_tokens": 292542655.0, "step": 9166 }, { "entropy": 0.7140501905232668, "epoch": 0.8434224070016849, "grad_norm": 0.1615847796201706, "learning_rate": 7.18894715858558e-05, "loss": 0.6957, "mean_token_accuracy": 0.7915410958230495, "num_tokens": 292574690.0, "step": 9167 }, { "entropy": 0.714583944529295, "epoch": 0.843514413373126, "grad_norm": 0.15474404394626617, "learning_rate": 7.188640475971417e-05, "loss": 0.7085, "mean_token_accuracy": 0.7922707013785839, "num_tokens": 292607010.0, "step": 9168 }, { "entropy": 0.6972763650119305, "epoch": 0.8436064197445673, "grad_norm": 0.15226253867149353, "learning_rate": 7.188333793357255e-05, "loss": 0.6742, "mean_token_accuracy": 0.799869854003191, "num_tokens": 292638734.0, "step": 9169 }, { "entropy": 0.7433112189173698, "epoch": 0.8436984261160085, "grad_norm": 0.15649564564228058, "learning_rate": 7.188027110743092e-05, "loss": 0.7257, "mean_token_accuracy": 0.7860777266323566, "num_tokens": 292670088.0, "step": 9170 }, { "entropy": 0.7848769146949053, "epoch": 0.8437904324874498, "grad_norm": 0.15170952677726746, "learning_rate": 7.18772042812893e-05, "loss": 0.7732, "mean_token_accuracy": 0.7689503319561481, "num_tokens": 292702167.0, "step": 9171 }, { "entropy": 0.7587796999141574, "epoch": 0.843882438858891, "grad_norm": 0.1496972143650055, "learning_rate": 7.187413745514767e-05, "loss": 0.7477, "mean_token_accuracy": 0.7812251336872578, "num_tokens": 292734372.0, "step": 9172 }, { "entropy": 0.7783654741942883, "epoch": 0.8439744452303322, "grad_norm": 0.1524667590856552, "learning_rate": 7.187107062900604e-05, "loss": 0.7745, "mean_token_accuracy": 0.7744183391332626, "num_tokens": 292766538.0, "step": 9173 }, { "entropy": 0.8053816445171833, "epoch": 0.8440664516017734, "grad_norm": 0.16029632091522217, "learning_rate": 7.186800380286442e-05, "loss": 0.7924, "mean_token_accuracy": 0.7657095827162266, "num_tokens": 292798105.0, "step": 9174 }, { "entropy": 0.6884124297648668, "epoch": 0.8441584579732146, "grad_norm": 0.15505832433700562, "learning_rate": 7.18649369767228e-05, "loss": 0.6768, "mean_token_accuracy": 0.7969431504607201, "num_tokens": 292830508.0, "step": 9175 }, { "entropy": 0.7801714912056923, "epoch": 0.8442504643446559, "grad_norm": 0.15843702852725983, "learning_rate": 7.186187015058117e-05, "loss": 0.7614, "mean_token_accuracy": 0.7750273942947388, "num_tokens": 292863198.0, "step": 9176 }, { "entropy": 0.7092513535171747, "epoch": 0.8443424707160971, "grad_norm": 0.15084293484687805, "learning_rate": 7.185880332443954e-05, "loss": 0.7052, "mean_token_accuracy": 0.7908965721726418, "num_tokens": 292895221.0, "step": 9177 }, { "entropy": 0.6667038910090923, "epoch": 0.8444344770875383, "grad_norm": 0.16076156497001648, "learning_rate": 7.18557364982979e-05, "loss": 0.6615, "mean_token_accuracy": 0.8025096170604229, "num_tokens": 292927745.0, "step": 9178 }, { "entropy": 0.7156208157539368, "epoch": 0.8445264834589795, "grad_norm": 0.15464666485786438, "learning_rate": 7.185266967215629e-05, "loss": 0.7064, "mean_token_accuracy": 0.7906319051980972, "num_tokens": 292959867.0, "step": 9179 }, { "entropy": 0.7562061324715614, "epoch": 0.8446184898304208, "grad_norm": 0.1567748486995697, "learning_rate": 7.184960284601467e-05, "loss": 0.7583, "mean_token_accuracy": 0.7699157074093819, "num_tokens": 292991694.0, "step": 9180 }, { "entropy": 0.6906786076724529, "epoch": 0.844710496201862, "grad_norm": 0.1554396152496338, "learning_rate": 7.184653601987304e-05, "loss": 0.6751, "mean_token_accuracy": 0.8002968057990074, "num_tokens": 293023034.0, "step": 9181 }, { "entropy": 0.7586347591131926, "epoch": 0.8448025025733032, "grad_norm": 0.16306738555431366, "learning_rate": 7.18434691937314e-05, "loss": 0.7556, "mean_token_accuracy": 0.7768150754272938, "num_tokens": 293054438.0, "step": 9182 }, { "entropy": 0.635008642449975, "epoch": 0.8448945089447444, "grad_norm": 0.15982696413993835, "learning_rate": 7.184040236758978e-05, "loss": 0.624, "mean_token_accuracy": 0.815783154219389, "num_tokens": 293086881.0, "step": 9183 }, { "entropy": 0.7008657902479172, "epoch": 0.8449865153161856, "grad_norm": 0.14395911991596222, "learning_rate": 7.183733554144815e-05, "loss": 0.6954, "mean_token_accuracy": 0.7891611680388451, "num_tokens": 293119638.0, "step": 9184 }, { "entropy": 0.7335260156542063, "epoch": 0.8450785216876269, "grad_norm": 0.1568959355354309, "learning_rate": 7.183426871530653e-05, "loss": 0.7146, "mean_token_accuracy": 0.7843048386275768, "num_tokens": 293151287.0, "step": 9185 }, { "entropy": 0.780246414244175, "epoch": 0.8451705280590681, "grad_norm": 0.16298745572566986, "learning_rate": 7.183120188916492e-05, "loss": 0.7725, "mean_token_accuracy": 0.7741758935153484, "num_tokens": 293183965.0, "step": 9186 }, { "entropy": 0.6956896670162678, "epoch": 0.8452625344305094, "grad_norm": 0.14600618183612823, "learning_rate": 7.182813506302328e-05, "loss": 0.6812, "mean_token_accuracy": 0.799797210842371, "num_tokens": 293215603.0, "step": 9187 }, { "entropy": 0.7747749499976635, "epoch": 0.8453545408019505, "grad_norm": 0.16897286474704742, "learning_rate": 7.182506823688165e-05, "loss": 0.7541, "mean_token_accuracy": 0.7771247625350952, "num_tokens": 293247747.0, "step": 9188 }, { "entropy": 0.7749623879790306, "epoch": 0.8454465471733917, "grad_norm": 0.14899472892284393, "learning_rate": 7.182200141074002e-05, "loss": 0.7676, "mean_token_accuracy": 0.7753770686686039, "num_tokens": 293279830.0, "step": 9189 }, { "entropy": 0.7032394637353718, "epoch": 0.845538553544833, "grad_norm": 0.17058227956295013, "learning_rate": 7.181893458459841e-05, "loss": 0.6996, "mean_token_accuracy": 0.7961457781493664, "num_tokens": 293312001.0, "step": 9190 }, { "entropy": 0.6026732185855508, "epoch": 0.8456305599162742, "grad_norm": 0.15841256082057953, "learning_rate": 7.181586775845678e-05, "loss": 0.573, "mean_token_accuracy": 0.8272872976958752, "num_tokens": 293342572.0, "step": 9191 }, { "entropy": 0.7739413361996412, "epoch": 0.8457225662877155, "grad_norm": 0.16036087274551392, "learning_rate": 7.181280093231515e-05, "loss": 0.752, "mean_token_accuracy": 0.7801231928169727, "num_tokens": 293374683.0, "step": 9192 }, { "entropy": 0.8565878160297871, "epoch": 0.8458145726591566, "grad_norm": 0.15790407359600067, "learning_rate": 7.180973410617352e-05, "loss": 0.8495, "mean_token_accuracy": 0.7525311261415482, "num_tokens": 293406247.0, "step": 9193 }, { "entropy": 0.7613676395267248, "epoch": 0.8459065790305978, "grad_norm": 0.16311173141002655, "learning_rate": 7.18066672800319e-05, "loss": 0.7545, "mean_token_accuracy": 0.7755700945854187, "num_tokens": 293438064.0, "step": 9194 }, { "entropy": 0.7220560852438211, "epoch": 0.8459985854020391, "grad_norm": 0.1587047278881073, "learning_rate": 7.180360045389028e-05, "loss": 0.6937, "mean_token_accuracy": 0.7891317345201969, "num_tokens": 293469022.0, "step": 9195 }, { "entropy": 0.6695957779884338, "epoch": 0.8460905917734803, "grad_norm": 0.14823909103870392, "learning_rate": 7.180053362774865e-05, "loss": 0.6519, "mean_token_accuracy": 0.8060564361512661, "num_tokens": 293501229.0, "step": 9196 }, { "entropy": 0.7239779178053141, "epoch": 0.8461825981449216, "grad_norm": 0.15822318196296692, "learning_rate": 7.179746680160702e-05, "loss": 0.7184, "mean_token_accuracy": 0.7914208956062794, "num_tokens": 293533596.0, "step": 9197 }, { "entropy": 0.757901300676167, "epoch": 0.8462746045163627, "grad_norm": 0.15856708586215973, "learning_rate": 7.17943999754654e-05, "loss": 0.7521, "mean_token_accuracy": 0.7806506454944611, "num_tokens": 293565209.0, "step": 9198 }, { "entropy": 0.7164069004356861, "epoch": 0.846366610887804, "grad_norm": 0.15840736031532288, "learning_rate": 7.179133314932377e-05, "loss": 0.7248, "mean_token_accuracy": 0.7903875485062599, "num_tokens": 293597372.0, "step": 9199 }, { "entropy": 0.6900338064879179, "epoch": 0.8464586172592452, "grad_norm": 0.1546599417924881, "learning_rate": 7.178826632318215e-05, "loss": 0.6783, "mean_token_accuracy": 0.7990505546331406, "num_tokens": 293629283.0, "step": 9200 }, { "entropy": 0.7004851587116718, "epoch": 0.8465506236306864, "grad_norm": 0.14961956441402435, "learning_rate": 7.178519949704051e-05, "loss": 0.6976, "mean_token_accuracy": 0.7914286889135838, "num_tokens": 293661918.0, "step": 9201 }, { "entropy": 0.7097783256322145, "epoch": 0.8466426300021277, "grad_norm": 0.15354159474372864, "learning_rate": 7.17821326708989e-05, "loss": 0.7, "mean_token_accuracy": 0.7904226407408714, "num_tokens": 293694087.0, "step": 9202 }, { "entropy": 0.741591271944344, "epoch": 0.8467346363735688, "grad_norm": 0.15400955080986023, "learning_rate": 7.177906584475726e-05, "loss": 0.7103, "mean_token_accuracy": 0.7888648398220539, "num_tokens": 293724404.0, "step": 9203 }, { "entropy": 0.7345251608639956, "epoch": 0.8468266427450101, "grad_norm": 0.15243278443813324, "learning_rate": 7.177599901861563e-05, "loss": 0.7211, "mean_token_accuracy": 0.7900500409305096, "num_tokens": 293757044.0, "step": 9204 }, { "entropy": 0.7452695947140455, "epoch": 0.8469186491164513, "grad_norm": 0.15192413330078125, "learning_rate": 7.177293219247401e-05, "loss": 0.7316, "mean_token_accuracy": 0.7796895615756512, "num_tokens": 293788278.0, "step": 9205 }, { "entropy": 0.8226054962724447, "epoch": 0.8470106554878926, "grad_norm": 0.16392016410827637, "learning_rate": 7.17698653663324e-05, "loss": 0.8133, "mean_token_accuracy": 0.762117300182581, "num_tokens": 293820182.0, "step": 9206 }, { "entropy": 0.8894792981445789, "epoch": 0.8471026618593338, "grad_norm": 0.158228799700737, "learning_rate": 7.176679854019076e-05, "loss": 0.8844, "mean_token_accuracy": 0.7434817440807819, "num_tokens": 293852571.0, "step": 9207 }, { "entropy": 0.7162426970899105, "epoch": 0.8471946682307749, "grad_norm": 0.15706899762153625, "learning_rate": 7.176373171404913e-05, "loss": 0.7117, "mean_token_accuracy": 0.7904890291392803, "num_tokens": 293884041.0, "step": 9208 }, { "entropy": 0.7407329604029655, "epoch": 0.8472866746022162, "grad_norm": 0.1547851264476776, "learning_rate": 7.17606648879075e-05, "loss": 0.7184, "mean_token_accuracy": 0.7909626513719559, "num_tokens": 293915184.0, "step": 9209 }, { "entropy": 0.6786611713469028, "epoch": 0.8473786809736574, "grad_norm": 0.15295594930648804, "learning_rate": 7.175759806176588e-05, "loss": 0.6758, "mean_token_accuracy": 0.7944788783788681, "num_tokens": 293947105.0, "step": 9210 }, { "entropy": 0.7477181470021605, "epoch": 0.8474706873450987, "grad_norm": 0.1601785272359848, "learning_rate": 7.175453123562426e-05, "loss": 0.7402, "mean_token_accuracy": 0.7802557982504368, "num_tokens": 293978556.0, "step": 9211 }, { "entropy": 0.7973382696509361, "epoch": 0.8475626937165399, "grad_norm": 0.16166172921657562, "learning_rate": 7.175146440948263e-05, "loss": 0.8051, "mean_token_accuracy": 0.7658268734812737, "num_tokens": 294010068.0, "step": 9212 }, { "entropy": 0.8655599392950535, "epoch": 0.847654700087981, "grad_norm": 0.16238465905189514, "learning_rate": 7.174839758334101e-05, "loss": 0.8801, "mean_token_accuracy": 0.7446059957146645, "num_tokens": 294042233.0, "step": 9213 }, { "entropy": 0.6477555762976408, "epoch": 0.8477467064594223, "grad_norm": 0.1534823179244995, "learning_rate": 7.174533075719938e-05, "loss": 0.6409, "mean_token_accuracy": 0.8092668391764164, "num_tokens": 294074457.0, "step": 9214 }, { "entropy": 0.7489454736933112, "epoch": 0.8478387128308635, "grad_norm": 0.15878349542617798, "learning_rate": 7.174226393105775e-05, "loss": 0.74, "mean_token_accuracy": 0.7840565331280231, "num_tokens": 294105899.0, "step": 9215 }, { "entropy": 0.6779028549790382, "epoch": 0.8479307192023048, "grad_norm": 0.1509767472743988, "learning_rate": 7.173919710491613e-05, "loss": 0.6725, "mean_token_accuracy": 0.7995847463607788, "num_tokens": 294138667.0, "step": 9216 }, { "entropy": 0.739797854796052, "epoch": 0.848022725573746, "grad_norm": 0.1614757776260376, "learning_rate": 7.173613027877451e-05, "loss": 0.7082, "mean_token_accuracy": 0.7898979373276234, "num_tokens": 294170744.0, "step": 9217 }, { "entropy": 0.6172679867595434, "epoch": 0.8481147319451872, "grad_norm": 0.1549183428287506, "learning_rate": 7.173306345263288e-05, "loss": 0.6059, "mean_token_accuracy": 0.819999560713768, "num_tokens": 294202989.0, "step": 9218 }, { "entropy": 0.6989898486062884, "epoch": 0.8482067383166284, "grad_norm": 0.1525004506111145, "learning_rate": 7.172999662649124e-05, "loss": 0.6895, "mean_token_accuracy": 0.7935312762856483, "num_tokens": 294235088.0, "step": 9219 }, { "entropy": 0.8720769342035055, "epoch": 0.8482987446880697, "grad_norm": 0.16067087650299072, "learning_rate": 7.172692980034961e-05, "loss": 0.8566, "mean_token_accuracy": 0.7469127289950848, "num_tokens": 294267601.0, "step": 9220 }, { "entropy": 0.7055386696010828, "epoch": 0.8483907510595109, "grad_norm": 0.16139115393161774, "learning_rate": 7.1723862974208e-05, "loss": 0.6876, "mean_token_accuracy": 0.7937961295247078, "num_tokens": 294298909.0, "step": 9221 }, { "entropy": 0.754301531240344, "epoch": 0.8484827574309521, "grad_norm": 0.1617162972688675, "learning_rate": 7.172079614806638e-05, "loss": 0.7479, "mean_token_accuracy": 0.7778256572782993, "num_tokens": 294330151.0, "step": 9222 }, { "entropy": 0.7079686895012856, "epoch": 0.8485747638023933, "grad_norm": 0.14493924379348755, "learning_rate": 7.171772932192474e-05, "loss": 0.6809, "mean_token_accuracy": 0.7959273457527161, "num_tokens": 294361846.0, "step": 9223 }, { "entropy": 0.7169918306171894, "epoch": 0.8486667701738345, "grad_norm": 0.1569448560476303, "learning_rate": 7.171466249578311e-05, "loss": 0.7105, "mean_token_accuracy": 0.791932437568903, "num_tokens": 294394010.0, "step": 9224 }, { "entropy": 0.5775814140215516, "epoch": 0.8487587765452758, "grad_norm": 0.14086732268333435, "learning_rate": 7.171159566964149e-05, "loss": 0.5516, "mean_token_accuracy": 0.8286913707852364, "num_tokens": 294425757.0, "step": 9225 }, { "entropy": 0.6783013325184584, "epoch": 0.848850782916717, "grad_norm": 0.15347783267498016, "learning_rate": 7.170852884349986e-05, "loss": 0.6786, "mean_token_accuracy": 0.7930466346442699, "num_tokens": 294457949.0, "step": 9226 }, { "entropy": 0.7157650254666805, "epoch": 0.8489427892881583, "grad_norm": 0.15602463483810425, "learning_rate": 7.170546201735824e-05, "loss": 0.7132, "mean_token_accuracy": 0.7869654111564159, "num_tokens": 294489631.0, "step": 9227 }, { "entropy": 0.796334408223629, "epoch": 0.8490347956595994, "grad_norm": 0.15323390066623688, "learning_rate": 7.170239519121661e-05, "loss": 0.7835, "mean_token_accuracy": 0.769356083124876, "num_tokens": 294522010.0, "step": 9228 }, { "entropy": 0.7483775354921818, "epoch": 0.8491268020310406, "grad_norm": 0.1554114818572998, "learning_rate": 7.169932836507499e-05, "loss": 0.7401, "mean_token_accuracy": 0.7841345146298409, "num_tokens": 294554351.0, "step": 9229 }, { "entropy": 0.7027828544378281, "epoch": 0.8492188084024819, "grad_norm": 0.15870484709739685, "learning_rate": 7.169626153893336e-05, "loss": 0.6685, "mean_token_accuracy": 0.7998899780213833, "num_tokens": 294586382.0, "step": 9230 }, { "entropy": 0.5796954156830907, "epoch": 0.8493108147739231, "grad_norm": 0.1509189009666443, "learning_rate": 7.169319471279173e-05, "loss": 0.5654, "mean_token_accuracy": 0.8270756639540195, "num_tokens": 294618941.0, "step": 9231 }, { "entropy": 0.781430296599865, "epoch": 0.8494028211453644, "grad_norm": 0.16551601886749268, "learning_rate": 7.169012788665011e-05, "loss": 0.7618, "mean_token_accuracy": 0.776944775134325, "num_tokens": 294651423.0, "step": 9232 }, { "entropy": 0.7833967749029398, "epoch": 0.8494948275168055, "grad_norm": 0.16358345746994019, "learning_rate": 7.168706106050849e-05, "loss": 0.7835, "mean_token_accuracy": 0.7671772055327892, "num_tokens": 294683499.0, "step": 9233 }, { "entropy": 0.7059527970850468, "epoch": 0.8495868338882467, "grad_norm": 0.15662719309329987, "learning_rate": 7.168399423436686e-05, "loss": 0.6956, "mean_token_accuracy": 0.7943080626428127, "num_tokens": 294715362.0, "step": 9234 }, { "entropy": 0.5616456512361765, "epoch": 0.849678840259688, "grad_norm": 0.1501058042049408, "learning_rate": 7.168092740822523e-05, "loss": 0.5292, "mean_token_accuracy": 0.8450856730341911, "num_tokens": 294747523.0, "step": 9235 }, { "entropy": 0.9459944777190685, "epoch": 0.8497708466311292, "grad_norm": 0.16790860891342163, "learning_rate": 7.16778605820836e-05, "loss": 0.9577, "mean_token_accuracy": 0.7286823466420174, "num_tokens": 294778826.0, "step": 9236 }, { "entropy": 0.6862558834254742, "epoch": 0.8498628530025705, "grad_norm": 0.1446121782064438, "learning_rate": 7.167479375594199e-05, "loss": 0.6548, "mean_token_accuracy": 0.8032681532204151, "num_tokens": 294810755.0, "step": 9237 }, { "entropy": 0.6454623285681009, "epoch": 0.8499548593740116, "grad_norm": 0.16041584312915802, "learning_rate": 7.167172692980036e-05, "loss": 0.6511, "mean_token_accuracy": 0.809081431478262, "num_tokens": 294843454.0, "step": 9238 }, { "entropy": 0.7591703534126282, "epoch": 0.8500468657454529, "grad_norm": 0.15679171681404114, "learning_rate": 7.166866010365872e-05, "loss": 0.7436, "mean_token_accuracy": 0.7814613804221153, "num_tokens": 294874727.0, "step": 9239 }, { "entropy": 0.6383411642163992, "epoch": 0.8501388721168941, "grad_norm": 0.15572838485240936, "learning_rate": 7.166559327751709e-05, "loss": 0.6067, "mean_token_accuracy": 0.82059196382761, "num_tokens": 294905749.0, "step": 9240 }, { "entropy": 0.7301694918423891, "epoch": 0.8502308784883353, "grad_norm": 0.15705886483192444, "learning_rate": 7.166252645137547e-05, "loss": 0.7166, "mean_token_accuracy": 0.7865882441401482, "num_tokens": 294937795.0, "step": 9241 }, { "entropy": 0.7536682542413473, "epoch": 0.8503228848597766, "grad_norm": 0.14913347363471985, "learning_rate": 7.165945962523385e-05, "loss": 0.7223, "mean_token_accuracy": 0.7870372459292412, "num_tokens": 294970446.0, "step": 9242 }, { "entropy": 0.7899387031793594, "epoch": 0.8504148912312177, "grad_norm": 0.15425072610378265, "learning_rate": 7.165639279909222e-05, "loss": 0.7946, "mean_token_accuracy": 0.7616885751485825, "num_tokens": 295002270.0, "step": 9243 }, { "entropy": 0.8850183393806219, "epoch": 0.850506897602659, "grad_norm": 0.16105367243289948, "learning_rate": 7.16533259729506e-05, "loss": 0.8826, "mean_token_accuracy": 0.74454340711236, "num_tokens": 295034421.0, "step": 9244 }, { "entropy": 0.7768974304199219, "epoch": 0.8505989039741002, "grad_norm": 0.15736828744411469, "learning_rate": 7.165025914680897e-05, "loss": 0.7578, "mean_token_accuracy": 0.77474220469594, "num_tokens": 295066990.0, "step": 9245 }, { "entropy": 0.6810788493603468, "epoch": 0.8506909103455415, "grad_norm": 0.15527667105197906, "learning_rate": 7.164719232066734e-05, "loss": 0.6708, "mean_token_accuracy": 0.7998138964176178, "num_tokens": 295099623.0, "step": 9246 }, { "entropy": 0.7248140070587397, "epoch": 0.8507829167169827, "grad_norm": 0.16763654351234436, "learning_rate": 7.164412549452572e-05, "loss": 0.7444, "mean_token_accuracy": 0.781427763402462, "num_tokens": 295132121.0, "step": 9247 }, { "entropy": 0.7623528596013784, "epoch": 0.8508749230884238, "grad_norm": 0.15902139246463776, "learning_rate": 7.16410586683841e-05, "loss": 0.7576, "mean_token_accuracy": 0.776562511920929, "num_tokens": 295163978.0, "step": 9248 }, { "entropy": 0.6874351017177105, "epoch": 0.8509669294598651, "grad_norm": 0.16207319498062134, "learning_rate": 7.163799184224247e-05, "loss": 0.6808, "mean_token_accuracy": 0.8005663715302944, "num_tokens": 295196126.0, "step": 9249 }, { "entropy": 0.749596981331706, "epoch": 0.8510589358313063, "grad_norm": 0.16014590859413147, "learning_rate": 7.163492501610084e-05, "loss": 0.7521, "mean_token_accuracy": 0.7778571136295795, "num_tokens": 295228463.0, "step": 9250 }, { "entropy": 0.7579569686204195, "epoch": 0.8511509422027476, "grad_norm": 0.15806153416633606, "learning_rate": 7.16318581899592e-05, "loss": 0.753, "mean_token_accuracy": 0.7787609025835991, "num_tokens": 295259871.0, "step": 9251 }, { "entropy": 0.6719326321035624, "epoch": 0.8512429485741888, "grad_norm": 0.15345031023025513, "learning_rate": 7.162879136381759e-05, "loss": 0.6571, "mean_token_accuracy": 0.8050297535955906, "num_tokens": 295291724.0, "step": 9252 }, { "entropy": 0.8009656332433224, "epoch": 0.8513349549456299, "grad_norm": 0.1620047241449356, "learning_rate": 7.162572453767597e-05, "loss": 0.7865, "mean_token_accuracy": 0.7740407884120941, "num_tokens": 295323233.0, "step": 9253 }, { "entropy": 0.6484742127358913, "epoch": 0.8514269613170712, "grad_norm": 0.15092961490154266, "learning_rate": 7.162265771153434e-05, "loss": 0.6225, "mean_token_accuracy": 0.8164214119315147, "num_tokens": 295355382.0, "step": 9254 }, { "entropy": 0.7230396438390017, "epoch": 0.8515189676885124, "grad_norm": 0.15424619615077972, "learning_rate": 7.16195908853927e-05, "loss": 0.7, "mean_token_accuracy": 0.7940858714282513, "num_tokens": 295387453.0, "step": 9255 }, { "entropy": 0.691457667388022, "epoch": 0.8516109740599537, "grad_norm": 0.1491248905658722, "learning_rate": 7.161652405925109e-05, "loss": 0.6775, "mean_token_accuracy": 0.7946472838521004, "num_tokens": 295419534.0, "step": 9256 }, { "entropy": 0.6256690109148622, "epoch": 0.8517029804313949, "grad_norm": 0.14928953349590302, "learning_rate": 7.161345723310945e-05, "loss": 0.6065, "mean_token_accuracy": 0.8230440691113472, "num_tokens": 295451606.0, "step": 9257 }, { "entropy": 0.6933057215064764, "epoch": 0.851794986802836, "grad_norm": 0.16009092330932617, "learning_rate": 7.161039040696784e-05, "loss": 0.6912, "mean_token_accuracy": 0.7939947471022606, "num_tokens": 295483788.0, "step": 9258 }, { "entropy": 0.5817230446264148, "epoch": 0.8518869931742773, "grad_norm": 0.14524132013320923, "learning_rate": 7.16073235808262e-05, "loss": 0.5614, "mean_token_accuracy": 0.8316090516746044, "num_tokens": 295516417.0, "step": 9259 }, { "entropy": 0.7339549222961068, "epoch": 0.8519789995457185, "grad_norm": 0.15771357715129852, "learning_rate": 7.160425675468459e-05, "loss": 0.7215, "mean_token_accuracy": 0.7868035212159157, "num_tokens": 295548632.0, "step": 9260 }, { "entropy": 0.6919783968478441, "epoch": 0.8520710059171598, "grad_norm": 0.14992010593414307, "learning_rate": 7.160118992854295e-05, "loss": 0.6974, "mean_token_accuracy": 0.7997874282300472, "num_tokens": 295580414.0, "step": 9261 }, { "entropy": 0.7695006765425205, "epoch": 0.852163012288601, "grad_norm": 0.15162672102451324, "learning_rate": 7.159812310240132e-05, "loss": 0.7702, "mean_token_accuracy": 0.7708836980164051, "num_tokens": 295612548.0, "step": 9262 }, { "entropy": 0.6566467825323343, "epoch": 0.8522550186600422, "grad_norm": 0.16399939358234406, "learning_rate": 7.15950562762597e-05, "loss": 0.6397, "mean_token_accuracy": 0.8097750842571259, "num_tokens": 295644055.0, "step": 9263 }, { "entropy": 0.7831311319023371, "epoch": 0.8523470250314834, "grad_norm": 0.15169775485992432, "learning_rate": 7.159198945011808e-05, "loss": 0.7795, "mean_token_accuracy": 0.7710037939250469, "num_tokens": 295676543.0, "step": 9264 }, { "entropy": 0.8629758954048157, "epoch": 0.8524390314029247, "grad_norm": 0.15710625052452087, "learning_rate": 7.158892262397645e-05, "loss": 0.8738, "mean_token_accuracy": 0.7468511760234833, "num_tokens": 295708711.0, "step": 9265 }, { "entropy": 0.5679602976888418, "epoch": 0.8525310377743659, "grad_norm": 0.1501118540763855, "learning_rate": 7.158585579783482e-05, "loss": 0.5573, "mean_token_accuracy": 0.8323536403477192, "num_tokens": 295741165.0, "step": 9266 }, { "entropy": 0.6966983992606401, "epoch": 0.8526230441458071, "grad_norm": 0.15750013291835785, "learning_rate": 7.158278897169319e-05, "loss": 0.6892, "mean_token_accuracy": 0.7943028844892979, "num_tokens": 295773739.0, "step": 9267 }, { "entropy": 0.7111820443533361, "epoch": 0.8527150505172483, "grad_norm": 0.16041125357151031, "learning_rate": 7.157972214555157e-05, "loss": 0.7089, "mean_token_accuracy": 0.7973058894276619, "num_tokens": 295806237.0, "step": 9268 }, { "entropy": 0.7450157999992371, "epoch": 0.8528070568886895, "grad_norm": 0.1591140180826187, "learning_rate": 7.157665531940995e-05, "loss": 0.7288, "mean_token_accuracy": 0.7871914654970169, "num_tokens": 295838060.0, "step": 9269 }, { "entropy": 0.7893609739840031, "epoch": 0.8528990632601308, "grad_norm": 0.153928741812706, "learning_rate": 7.157358849326832e-05, "loss": 0.7618, "mean_token_accuracy": 0.7739544101059437, "num_tokens": 295870126.0, "step": 9270 }, { "entropy": 0.6509202048182487, "epoch": 0.852991069631572, "grad_norm": 0.14922577142715454, "learning_rate": 7.157052166712669e-05, "loss": 0.635, "mean_token_accuracy": 0.8083102628588676, "num_tokens": 295902491.0, "step": 9271 }, { "entropy": 0.7199104931205511, "epoch": 0.8530830760030133, "grad_norm": 0.16797427833080292, "learning_rate": 7.156745484098507e-05, "loss": 0.6947, "mean_token_accuracy": 0.7988784722983837, "num_tokens": 295934066.0, "step": 9272 }, { "entropy": 0.6855895835906267, "epoch": 0.8531750823744544, "grad_norm": 0.1487516164779663, "learning_rate": 7.156438801484345e-05, "loss": 0.6674, "mean_token_accuracy": 0.7969290241599083, "num_tokens": 295965448.0, "step": 9273 }, { "entropy": 0.7808198388665915, "epoch": 0.8532670887458956, "grad_norm": 0.17414379119873047, "learning_rate": 7.156132118870182e-05, "loss": 0.7968, "mean_token_accuracy": 0.7671060785651207, "num_tokens": 295997469.0, "step": 9274 }, { "entropy": 0.6734881959855556, "epoch": 0.8533590951173369, "grad_norm": 0.16426751017570496, "learning_rate": 7.15582543625602e-05, "loss": 0.6638, "mean_token_accuracy": 0.8001768924295902, "num_tokens": 296029407.0, "step": 9275 }, { "entropy": 0.7721558157354593, "epoch": 0.8534511014887781, "grad_norm": 0.15801751613616943, "learning_rate": 7.155518753641857e-05, "loss": 0.775, "mean_token_accuracy": 0.7685927860438824, "num_tokens": 296061382.0, "step": 9276 }, { "entropy": 0.7388074900954962, "epoch": 0.8535431078602194, "grad_norm": 0.1522987186908722, "learning_rate": 7.155212071027693e-05, "loss": 0.7131, "mean_token_accuracy": 0.7860884107649326, "num_tokens": 296093806.0, "step": 9277 }, { "entropy": 0.6497070249170065, "epoch": 0.8536351142316605, "grad_norm": 0.150343656539917, "learning_rate": 7.154905388413532e-05, "loss": 0.6276, "mean_token_accuracy": 0.8116071000695229, "num_tokens": 296125728.0, "step": 9278 }, { "entropy": 0.758166566491127, "epoch": 0.8537271206031017, "grad_norm": 0.15080419182777405, "learning_rate": 7.15459870579937e-05, "loss": 0.743, "mean_token_accuracy": 0.7800386287271976, "num_tokens": 296158097.0, "step": 9279 }, { "entropy": 0.8311229813843966, "epoch": 0.853819126974543, "grad_norm": 0.16156117618083954, "learning_rate": 7.154292023185206e-05, "loss": 0.8152, "mean_token_accuracy": 0.7652864903211594, "num_tokens": 296189649.0, "step": 9280 }, { "entropy": 0.6889754477888346, "epoch": 0.8539111333459842, "grad_norm": 0.14824868738651276, "learning_rate": 7.153985340571043e-05, "loss": 0.6763, "mean_token_accuracy": 0.7970256134867668, "num_tokens": 296222065.0, "step": 9281 }, { "entropy": 0.7700135577470064, "epoch": 0.8540031397174255, "grad_norm": 0.15271902084350586, "learning_rate": 7.15367865795688e-05, "loss": 0.7547, "mean_token_accuracy": 0.7767580300569534, "num_tokens": 296253660.0, "step": 9282 }, { "entropy": 0.7261857818812132, "epoch": 0.8540951460888666, "grad_norm": 0.15626661479473114, "learning_rate": 7.153371975342718e-05, "loss": 0.713, "mean_token_accuracy": 0.7889329828321934, "num_tokens": 296283566.0, "step": 9283 }, { "entropy": 0.7403159290552139, "epoch": 0.8541871524603079, "grad_norm": 0.14912141859531403, "learning_rate": 7.153065292728556e-05, "loss": 0.7177, "mean_token_accuracy": 0.784930158406496, "num_tokens": 296315486.0, "step": 9284 }, { "entropy": 0.597387183457613, "epoch": 0.8542791588317491, "grad_norm": 0.15372668206691742, "learning_rate": 7.152758610114393e-05, "loss": 0.5865, "mean_token_accuracy": 0.8229139111936092, "num_tokens": 296347417.0, "step": 9285 }, { "entropy": 0.7338540926575661, "epoch": 0.8543711652031903, "grad_norm": 0.15401272475719452, "learning_rate": 7.15245192750023e-05, "loss": 0.7348, "mean_token_accuracy": 0.7827333174645901, "num_tokens": 296379020.0, "step": 9286 }, { "entropy": 0.7744400314986706, "epoch": 0.8544631715746316, "grad_norm": 0.15605783462524414, "learning_rate": 7.152145244886068e-05, "loss": 0.7674, "mean_token_accuracy": 0.7725348919630051, "num_tokens": 296411381.0, "step": 9287 }, { "entropy": 0.7000164426863194, "epoch": 0.8545551779460727, "grad_norm": 0.1573788821697235, "learning_rate": 7.151838562271905e-05, "loss": 0.678, "mean_token_accuracy": 0.7972492650151253, "num_tokens": 296443775.0, "step": 9288 }, { "entropy": 0.5995199102908373, "epoch": 0.854647184317514, "grad_norm": 0.146518275141716, "learning_rate": 7.151531879657743e-05, "loss": 0.5793, "mean_token_accuracy": 0.8261918239295483, "num_tokens": 296475700.0, "step": 9289 }, { "entropy": 0.671977061778307, "epoch": 0.8547391906889552, "grad_norm": 0.15351417660713196, "learning_rate": 7.15122519704358e-05, "loss": 0.6654, "mean_token_accuracy": 0.8041447624564171, "num_tokens": 296507587.0, "step": 9290 }, { "entropy": 0.7320583015680313, "epoch": 0.8548311970603965, "grad_norm": 0.15575651824474335, "learning_rate": 7.150918514429418e-05, "loss": 0.7102, "mean_token_accuracy": 0.7875051312148571, "num_tokens": 296538690.0, "step": 9291 }, { "entropy": 0.6746419947594404, "epoch": 0.8549232034318377, "grad_norm": 0.16007113456726074, "learning_rate": 7.150611831815255e-05, "loss": 0.659, "mean_token_accuracy": 0.8036817871034145, "num_tokens": 296570488.0, "step": 9292 }, { "entropy": 0.7095679063349962, "epoch": 0.8550152098032788, "grad_norm": 0.1506062000989914, "learning_rate": 7.150305149201091e-05, "loss": 0.7039, "mean_token_accuracy": 0.7885853685438633, "num_tokens": 296602368.0, "step": 9293 }, { "entropy": 0.7157891988754272, "epoch": 0.8551072161747201, "grad_norm": 0.16648705303668976, "learning_rate": 7.14999846658693e-05, "loss": 0.719, "mean_token_accuracy": 0.7912423275411129, "num_tokens": 296634538.0, "step": 9294 }, { "entropy": 0.6871769111603498, "epoch": 0.8551992225461613, "grad_norm": 0.1517302691936493, "learning_rate": 7.149691783972768e-05, "loss": 0.6693, "mean_token_accuracy": 0.8038580641150475, "num_tokens": 296666072.0, "step": 9295 }, { "entropy": 0.6385317072272301, "epoch": 0.8552912289176026, "grad_norm": 0.16230399906635284, "learning_rate": 7.149385101358605e-05, "loss": 0.6326, "mean_token_accuracy": 0.8112977407872677, "num_tokens": 296697392.0, "step": 9296 }, { "entropy": 0.6222475552931428, "epoch": 0.8553832352890438, "grad_norm": 0.1588875651359558, "learning_rate": 7.149078418744441e-05, "loss": 0.6018, "mean_token_accuracy": 0.8197043016552925, "num_tokens": 296729589.0, "step": 9297 }, { "entropy": 0.675569910556078, "epoch": 0.8554752416604849, "grad_norm": 0.1537511944770813, "learning_rate": 7.148771736130278e-05, "loss": 0.6678, "mean_token_accuracy": 0.8056351952254772, "num_tokens": 296762232.0, "step": 9298 }, { "entropy": 0.7032335121184587, "epoch": 0.8555672480319262, "grad_norm": 0.15394003689289093, "learning_rate": 7.148465053516116e-05, "loss": 0.6881, "mean_token_accuracy": 0.7948860339820385, "num_tokens": 296794249.0, "step": 9299 }, { "entropy": 0.6535628940910101, "epoch": 0.8556592544033674, "grad_norm": 0.165849506855011, "learning_rate": 7.148158370901954e-05, "loss": 0.6368, "mean_token_accuracy": 0.8083375096321106, "num_tokens": 296826576.0, "step": 9300 }, { "entropy": 0.781649649143219, "epoch": 0.8557512607748087, "grad_norm": 0.15680566430091858, "learning_rate": 7.147851688287791e-05, "loss": 0.7747, "mean_token_accuracy": 0.7753229737281799, "num_tokens": 296858490.0, "step": 9301 }, { "entropy": 0.6535873916000128, "epoch": 0.8558432671462499, "grad_norm": 0.15006360411643982, "learning_rate": 7.147545005673628e-05, "loss": 0.6499, "mean_token_accuracy": 0.8052450530230999, "num_tokens": 296890838.0, "step": 9302 }, { "entropy": 0.7341656144708395, "epoch": 0.855935273517691, "grad_norm": 0.14776501059532166, "learning_rate": 7.147238323059466e-05, "loss": 0.7303, "mean_token_accuracy": 0.7858513966202736, "num_tokens": 296922041.0, "step": 9303 }, { "entropy": 0.7369539747014642, "epoch": 0.8560272798891323, "grad_norm": 0.15657730400562286, "learning_rate": 7.146931640445303e-05, "loss": 0.7234, "mean_token_accuracy": 0.782026369124651, "num_tokens": 296953915.0, "step": 9304 }, { "entropy": 0.6443697698414326, "epoch": 0.8561192862605735, "grad_norm": 0.1637953370809555, "learning_rate": 7.146624957831141e-05, "loss": 0.63, "mean_token_accuracy": 0.8153681457042694, "num_tokens": 296985803.0, "step": 9305 }, { "entropy": 0.7375577334314585, "epoch": 0.8562112926320148, "grad_norm": 0.1566283106803894, "learning_rate": 7.146318275216979e-05, "loss": 0.7277, "mean_token_accuracy": 0.779588907957077, "num_tokens": 297018058.0, "step": 9306 }, { "entropy": 0.6474961824715137, "epoch": 0.856303299003456, "grad_norm": 0.1541268229484558, "learning_rate": 7.146011592602816e-05, "loss": 0.6225, "mean_token_accuracy": 0.8131704144179821, "num_tokens": 297049941.0, "step": 9307 }, { "entropy": 0.6624164399690926, "epoch": 0.8563953053748972, "grad_norm": 0.1625298261642456, "learning_rate": 7.145704909988653e-05, "loss": 0.6429, "mean_token_accuracy": 0.8085928037762642, "num_tokens": 297081206.0, "step": 9308 }, { "entropy": 0.7358057871460915, "epoch": 0.8564873117463384, "grad_norm": 0.16583764553070068, "learning_rate": 7.14539822737449e-05, "loss": 0.7238, "mean_token_accuracy": 0.7829283513128757, "num_tokens": 297111810.0, "step": 9309 }, { "entropy": 0.8249125834554434, "epoch": 0.8565793181177797, "grad_norm": 0.159418523311615, "learning_rate": 7.145091544760329e-05, "loss": 0.8297, "mean_token_accuracy": 0.7627994902431965, "num_tokens": 297144039.0, "step": 9310 }, { "entropy": 0.7495959587395191, "epoch": 0.8566713244892209, "grad_norm": 0.15243613719940186, "learning_rate": 7.144784862146166e-05, "loss": 0.7445, "mean_token_accuracy": 0.7796294949948788, "num_tokens": 297175922.0, "step": 9311 }, { "entropy": 0.66484734416008, "epoch": 0.8567633308606621, "grad_norm": 0.14784260094165802, "learning_rate": 7.144478179532003e-05, "loss": 0.6458, "mean_token_accuracy": 0.8074377216398716, "num_tokens": 297207862.0, "step": 9312 }, { "entropy": 0.524963092058897, "epoch": 0.8568553372321033, "grad_norm": 0.14393942058086395, "learning_rate": 7.14417149691784e-05, "loss": 0.4977, "mean_token_accuracy": 0.8467649072408676, "num_tokens": 297239881.0, "step": 9313 }, { "entropy": 0.7670757714658976, "epoch": 0.8569473436035445, "grad_norm": 0.16007854044437408, "learning_rate": 7.143864814303678e-05, "loss": 0.7652, "mean_token_accuracy": 0.7755994573235512, "num_tokens": 297272133.0, "step": 9314 }, { "entropy": 0.788808261975646, "epoch": 0.8570393499749858, "grad_norm": 0.16021373867988586, "learning_rate": 7.143558131689516e-05, "loss": 0.7935, "mean_token_accuracy": 0.7649881131947041, "num_tokens": 297302834.0, "step": 9315 }, { "entropy": 0.7095064520835876, "epoch": 0.857131356346427, "grad_norm": 0.15681712329387665, "learning_rate": 7.143251449075352e-05, "loss": 0.6946, "mean_token_accuracy": 0.7923196665942669, "num_tokens": 297334593.0, "step": 9316 }, { "entropy": 0.7174708247184753, "epoch": 0.8572233627178683, "grad_norm": 0.14910614490509033, "learning_rate": 7.142944766461189e-05, "loss": 0.6964, "mean_token_accuracy": 0.7940537966787815, "num_tokens": 297367193.0, "step": 9317 }, { "entropy": 0.799740944057703, "epoch": 0.8573153690893094, "grad_norm": 0.15455390512943268, "learning_rate": 7.142638083847027e-05, "loss": 0.8013, "mean_token_accuracy": 0.7644482888281345, "num_tokens": 297398588.0, "step": 9318 }, { "entropy": 0.6612803675234318, "epoch": 0.8574073754607506, "grad_norm": 0.150625541806221, "learning_rate": 7.142331401232864e-05, "loss": 0.6372, "mean_token_accuracy": 0.8108151815831661, "num_tokens": 297430719.0, "step": 9319 }, { "entropy": 0.6725093647837639, "epoch": 0.8574993818321919, "grad_norm": 0.14883765578269958, "learning_rate": 7.142024718618702e-05, "loss": 0.657, "mean_token_accuracy": 0.8061027936637402, "num_tokens": 297463444.0, "step": 9320 }, { "entropy": 0.7818607799708843, "epoch": 0.8575913882036331, "grad_norm": 0.15874233841896057, "learning_rate": 7.141718036004539e-05, "loss": 0.7717, "mean_token_accuracy": 0.767365001142025, "num_tokens": 297494937.0, "step": 9321 }, { "entropy": 0.8251926526427269, "epoch": 0.8576833945750744, "grad_norm": 0.16131265461444855, "learning_rate": 7.141411353390377e-05, "loss": 0.8204, "mean_token_accuracy": 0.7624752931296825, "num_tokens": 297527260.0, "step": 9322 }, { "entropy": 0.6777688665315509, "epoch": 0.8577754009465155, "grad_norm": 0.15160194039344788, "learning_rate": 7.141104670776214e-05, "loss": 0.6813, "mean_token_accuracy": 0.796684168279171, "num_tokens": 297560028.0, "step": 9323 }, { "entropy": 0.5320757003501058, "epoch": 0.8578674073179567, "grad_norm": 0.14485399425029755, "learning_rate": 7.140797988162051e-05, "loss": 0.5263, "mean_token_accuracy": 0.8383158072829247, "num_tokens": 297592738.0, "step": 9324 }, { "entropy": 0.8263344466686249, "epoch": 0.857959413689398, "grad_norm": 0.15485422313213348, "learning_rate": 7.140491305547889e-05, "loss": 0.8078, "mean_token_accuracy": 0.7633046358823776, "num_tokens": 297624795.0, "step": 9325 }, { "entropy": 0.685953488573432, "epoch": 0.8580514200608392, "grad_norm": 0.15089641511440277, "learning_rate": 7.140184622933727e-05, "loss": 0.6751, "mean_token_accuracy": 0.797943726181984, "num_tokens": 297657198.0, "step": 9326 }, { "entropy": 0.6988447234034538, "epoch": 0.8581434264322805, "grad_norm": 0.1652422845363617, "learning_rate": 7.139877940319564e-05, "loss": 0.71, "mean_token_accuracy": 0.790430162101984, "num_tokens": 297689874.0, "step": 9327 }, { "entropy": 0.735746905207634, "epoch": 0.8582354328037216, "grad_norm": 0.15638157725334167, "learning_rate": 7.139571257705401e-05, "loss": 0.7236, "mean_token_accuracy": 0.787425022572279, "num_tokens": 297722180.0, "step": 9328 }, { "entropy": 0.7233849866315722, "epoch": 0.8583274391751629, "grad_norm": 0.1499679833650589, "learning_rate": 7.139264575091237e-05, "loss": 0.7049, "mean_token_accuracy": 0.7887495830655098, "num_tokens": 297754052.0, "step": 9329 }, { "entropy": 0.5786712244153023, "epoch": 0.8584194455466041, "grad_norm": 0.14468227326869965, "learning_rate": 7.138957892477076e-05, "loss": 0.5668, "mean_token_accuracy": 0.828399296849966, "num_tokens": 297786252.0, "step": 9330 }, { "entropy": 0.8570959703065455, "epoch": 0.8585114519180453, "grad_norm": 0.1602494716644287, "learning_rate": 7.138651209862914e-05, "loss": 0.8495, "mean_token_accuracy": 0.7536162473261356, "num_tokens": 297817549.0, "step": 9331 }, { "entropy": 0.8060774747282267, "epoch": 0.8586034582894866, "grad_norm": 0.15578515827655792, "learning_rate": 7.13834452724875e-05, "loss": 0.7998, "mean_token_accuracy": 0.7633193731307983, "num_tokens": 297848894.0, "step": 9332 }, { "entropy": 0.6526872832328081, "epoch": 0.8586954646609277, "grad_norm": 0.1524016261100769, "learning_rate": 7.138037844634587e-05, "loss": 0.6351, "mean_token_accuracy": 0.8095323108136654, "num_tokens": 297881286.0, "step": 9333 }, { "entropy": 0.8380382470786572, "epoch": 0.858787471032369, "grad_norm": 0.15755334496498108, "learning_rate": 7.137731162020425e-05, "loss": 0.8228, "mean_token_accuracy": 0.7612464055418968, "num_tokens": 297913102.0, "step": 9334 }, { "entropy": 0.5744717475026846, "epoch": 0.8588794774038102, "grad_norm": 0.13873127102851868, "learning_rate": 7.137424479406262e-05, "loss": 0.5645, "mean_token_accuracy": 0.8298993892967701, "num_tokens": 297945193.0, "step": 9335 }, { "entropy": 0.7727782651782036, "epoch": 0.8589714837752515, "grad_norm": 0.1567884385585785, "learning_rate": 7.1371177967921e-05, "loss": 0.7712, "mean_token_accuracy": 0.767839390784502, "num_tokens": 297977209.0, "step": 9336 }, { "entropy": 0.6931013837456703, "epoch": 0.8590634901466927, "grad_norm": 0.14930345118045807, "learning_rate": 7.136811114177939e-05, "loss": 0.6697, "mean_token_accuracy": 0.7944237478077412, "num_tokens": 298009347.0, "step": 9337 }, { "entropy": 0.6730757746845484, "epoch": 0.8591554965181338, "grad_norm": 0.1625451296567917, "learning_rate": 7.136504431563775e-05, "loss": 0.6614, "mean_token_accuracy": 0.7989698499441147, "num_tokens": 298041492.0, "step": 9338 }, { "entropy": 0.6938877943903208, "epoch": 0.8592475028895751, "grad_norm": 0.16013438999652863, "learning_rate": 7.136197748949612e-05, "loss": 0.6807, "mean_token_accuracy": 0.7982243038713932, "num_tokens": 298073165.0, "step": 9339 }, { "entropy": 0.7943490128964186, "epoch": 0.8593395092610163, "grad_norm": 0.1565820276737213, "learning_rate": 7.135891066335449e-05, "loss": 0.786, "mean_token_accuracy": 0.7694966346025467, "num_tokens": 298105192.0, "step": 9340 }, { "entropy": 0.6411199234426022, "epoch": 0.8594315156324576, "grad_norm": 0.14995883405208588, "learning_rate": 7.135584383721287e-05, "loss": 0.6226, "mean_token_accuracy": 0.816396925598383, "num_tokens": 298137728.0, "step": 9341 }, { "entropy": 0.8068310432136059, "epoch": 0.8595235220038988, "grad_norm": 0.1554294377565384, "learning_rate": 7.135277701107125e-05, "loss": 0.7934, "mean_token_accuracy": 0.7703254967927933, "num_tokens": 298170036.0, "step": 9342 }, { "entropy": 0.6797912418842316, "epoch": 0.8596155283753399, "grad_norm": 0.148912712931633, "learning_rate": 7.134971018492962e-05, "loss": 0.6753, "mean_token_accuracy": 0.7967238947749138, "num_tokens": 298201924.0, "step": 9343 }, { "entropy": 0.7927571497857571, "epoch": 0.8597075347467812, "grad_norm": 0.1606292724609375, "learning_rate": 7.134664335878799e-05, "loss": 0.7832, "mean_token_accuracy": 0.7697999328374863, "num_tokens": 298233843.0, "step": 9344 }, { "entropy": 0.6731222905218601, "epoch": 0.8597995411182224, "grad_norm": 0.16124464571475983, "learning_rate": 7.134357653264637e-05, "loss": 0.6531, "mean_token_accuracy": 0.8043259158730507, "num_tokens": 298266037.0, "step": 9345 }, { "entropy": 0.6806737147271633, "epoch": 0.8598915474896637, "grad_norm": 0.16043823957443237, "learning_rate": 7.134050970650474e-05, "loss": 0.6785, "mean_token_accuracy": 0.7972434684634209, "num_tokens": 298298716.0, "step": 9346 }, { "entropy": 0.7487082909792662, "epoch": 0.8599835538611049, "grad_norm": 0.1544087827205658, "learning_rate": 7.133744288036312e-05, "loss": 0.7452, "mean_token_accuracy": 0.7802769765257835, "num_tokens": 298330337.0, "step": 9347 }, { "entropy": 0.7610769718885422, "epoch": 0.860075560232546, "grad_norm": 0.1525411456823349, "learning_rate": 7.133437605422149e-05, "loss": 0.765, "mean_token_accuracy": 0.7772616781294346, "num_tokens": 298361512.0, "step": 9348 }, { "entropy": 0.7371473023667932, "epoch": 0.8601675666039873, "grad_norm": 0.16762474179267883, "learning_rate": 7.133130922807987e-05, "loss": 0.7159, "mean_token_accuracy": 0.7869123592972755, "num_tokens": 298393924.0, "step": 9349 }, { "entropy": 0.6777955461293459, "epoch": 0.8602595729754285, "grad_norm": 0.15613555908203125, "learning_rate": 7.132824240193824e-05, "loss": 0.6776, "mean_token_accuracy": 0.7975696586072445, "num_tokens": 298425347.0, "step": 9350 }, { "entropy": 0.7873505000025034, "epoch": 0.8603515793468698, "grad_norm": 0.15739117562770844, "learning_rate": 7.13251755757966e-05, "loss": 0.7793, "mean_token_accuracy": 0.7702473998069763, "num_tokens": 298456839.0, "step": 9351 }, { "entropy": 0.6488509960472584, "epoch": 0.860443585718311, "grad_norm": 0.1496942788362503, "learning_rate": 7.132210874965498e-05, "loss": 0.6264, "mean_token_accuracy": 0.8130797371268272, "num_tokens": 298489241.0, "step": 9352 }, { "entropy": 0.7225528489798307, "epoch": 0.8605355920897522, "grad_norm": 0.16193963587284088, "learning_rate": 7.131904192351337e-05, "loss": 0.6987, "mean_token_accuracy": 0.7941003106534481, "num_tokens": 298521252.0, "step": 9353 }, { "entropy": 0.5414722617715597, "epoch": 0.8606275984611934, "grad_norm": 0.14265698194503784, "learning_rate": 7.131597509737173e-05, "loss": 0.5172, "mean_token_accuracy": 0.8444129787385464, "num_tokens": 298553878.0, "step": 9354 }, { "entropy": 0.6608944507315755, "epoch": 0.8607196048326347, "grad_norm": 0.1455209106206894, "learning_rate": 7.13129082712301e-05, "loss": 0.6398, "mean_token_accuracy": 0.8110570982098579, "num_tokens": 298585013.0, "step": 9355 }, { "entropy": 0.7261070720851421, "epoch": 0.8608116112040759, "grad_norm": 0.14705535769462585, "learning_rate": 7.130984144508847e-05, "loss": 0.7187, "mean_token_accuracy": 0.7898045480251312, "num_tokens": 298616758.0, "step": 9356 }, { "entropy": 0.7563739940524101, "epoch": 0.8609036175755171, "grad_norm": 0.1523788869380951, "learning_rate": 7.130677461894686e-05, "loss": 0.744, "mean_token_accuracy": 0.78176524117589, "num_tokens": 298649307.0, "step": 9357 }, { "entropy": 0.7396757546812296, "epoch": 0.8609956239469583, "grad_norm": 0.15923769772052765, "learning_rate": 7.130370779280523e-05, "loss": 0.7254, "mean_token_accuracy": 0.7868451625108719, "num_tokens": 298680773.0, "step": 9358 }, { "entropy": 0.7327138874679804, "epoch": 0.8610876303183995, "grad_norm": 0.16041822731494904, "learning_rate": 7.13006409666636e-05, "loss": 0.7241, "mean_token_accuracy": 0.7845996841788292, "num_tokens": 298713203.0, "step": 9359 }, { "entropy": 0.7311303205788136, "epoch": 0.8611796366898408, "grad_norm": 0.15769672393798828, "learning_rate": 7.129757414052197e-05, "loss": 0.7296, "mean_token_accuracy": 0.7863708809018135, "num_tokens": 298745361.0, "step": 9360 }, { "entropy": 0.7008637581020594, "epoch": 0.861271643061282, "grad_norm": 0.16315065324306488, "learning_rate": 7.129450731438035e-05, "loss": 0.6812, "mean_token_accuracy": 0.801989059895277, "num_tokens": 298777295.0, "step": 9361 }, { "entropy": 0.6692836005240679, "epoch": 0.8613636494327233, "grad_norm": 0.16072410345077515, "learning_rate": 7.129144048823873e-05, "loss": 0.6372, "mean_token_accuracy": 0.81234135851264, "num_tokens": 298808145.0, "step": 9362 }, { "entropy": 0.7899717148393393, "epoch": 0.8614556558041644, "grad_norm": 0.15900303423404694, "learning_rate": 7.12883736620971e-05, "loss": 0.7668, "mean_token_accuracy": 0.7736680582165718, "num_tokens": 298839733.0, "step": 9363 }, { "entropy": 0.7437034863978624, "epoch": 0.8615476621756056, "grad_norm": 0.16146042943000793, "learning_rate": 7.128530683595547e-05, "loss": 0.7417, "mean_token_accuracy": 0.7858252041041851, "num_tokens": 298871766.0, "step": 9364 }, { "entropy": 0.6597649594768882, "epoch": 0.8616396685470469, "grad_norm": 0.14669270813465118, "learning_rate": 7.128224000981385e-05, "loss": 0.6551, "mean_token_accuracy": 0.8035356514155865, "num_tokens": 298904463.0, "step": 9365 }, { "entropy": 0.6583692217245698, "epoch": 0.8617316749184881, "grad_norm": 0.16212201118469238, "learning_rate": 7.127917318367222e-05, "loss": 0.6427, "mean_token_accuracy": 0.8038212023675442, "num_tokens": 298936578.0, "step": 9366 }, { "entropy": 0.7809443064033985, "epoch": 0.8618236812899294, "grad_norm": 0.16503342986106873, "learning_rate": 7.12761063575306e-05, "loss": 0.7898, "mean_token_accuracy": 0.7645572423934937, "num_tokens": 298969097.0, "step": 9367 }, { "entropy": 0.7508597746491432, "epoch": 0.8619156876613705, "grad_norm": 0.16139595210552216, "learning_rate": 7.127303953138898e-05, "loss": 0.739, "mean_token_accuracy": 0.7800043001770973, "num_tokens": 299000038.0, "step": 9368 }, { "entropy": 0.608279675245285, "epoch": 0.8620076940328117, "grad_norm": 0.15536369383335114, "learning_rate": 7.126997270524735e-05, "loss": 0.6135, "mean_token_accuracy": 0.8134923093020916, "num_tokens": 299031974.0, "step": 9369 }, { "entropy": 0.7602689657360315, "epoch": 0.862099700404253, "grad_norm": 0.16456453502178192, "learning_rate": 7.126690587910571e-05, "loss": 0.7495, "mean_token_accuracy": 0.7787371687591076, "num_tokens": 299063732.0, "step": 9370 }, { "entropy": 0.7024401854723692, "epoch": 0.8621917067756942, "grad_norm": 0.15249143540859222, "learning_rate": 7.126383905296408e-05, "loss": 0.6939, "mean_token_accuracy": 0.7948904447257519, "num_tokens": 299095359.0, "step": 9371 }, { "entropy": 0.7347941920161247, "epoch": 0.8622837131471355, "grad_norm": 0.15575668215751648, "learning_rate": 7.126077222682246e-05, "loss": 0.7198, "mean_token_accuracy": 0.7877590842545033, "num_tokens": 299127133.0, "step": 9372 }, { "entropy": 0.8200506959110498, "epoch": 0.8623757195185766, "grad_norm": 0.15288935601711273, "learning_rate": 7.125770540068085e-05, "loss": 0.8032, "mean_token_accuracy": 0.7619360275566578, "num_tokens": 299159114.0, "step": 9373 }, { "entropy": 0.6757137970998883, "epoch": 0.8624677258900179, "grad_norm": 0.15401972830295563, "learning_rate": 7.125463857453921e-05, "loss": 0.6488, "mean_token_accuracy": 0.8064882047474384, "num_tokens": 299191251.0, "step": 9374 }, { "entropy": 0.6827469021081924, "epoch": 0.8625597322614591, "grad_norm": 0.14911216497421265, "learning_rate": 7.125157174839758e-05, "loss": 0.6601, "mean_token_accuracy": 0.8016263656318188, "num_tokens": 299223336.0, "step": 9375 }, { "entropy": 0.6900500860065222, "epoch": 0.8626517386329003, "grad_norm": 0.1534057855606079, "learning_rate": 7.124850492225596e-05, "loss": 0.6792, "mean_token_accuracy": 0.7968048267066479, "num_tokens": 299255386.0, "step": 9376 }, { "entropy": 0.8208514656871557, "epoch": 0.8627437450043416, "grad_norm": 0.1681324541568756, "learning_rate": 7.124543809611433e-05, "loss": 0.8067, "mean_token_accuracy": 0.7633748315274715, "num_tokens": 299287630.0, "step": 9377 }, { "entropy": 0.6749212071299553, "epoch": 0.8628357513757827, "grad_norm": 0.15617109835147858, "learning_rate": 7.124237126997271e-05, "loss": 0.6577, "mean_token_accuracy": 0.8082833215594292, "num_tokens": 299318556.0, "step": 9378 }, { "entropy": 0.6894717160612345, "epoch": 0.862927757747224, "grad_norm": 0.15473876893520355, "learning_rate": 7.123930444383108e-05, "loss": 0.6817, "mean_token_accuracy": 0.802324466407299, "num_tokens": 299350235.0, "step": 9379 }, { "entropy": 0.7316184937953949, "epoch": 0.8630197641186652, "grad_norm": 0.14969295263290405, "learning_rate": 7.123623761768946e-05, "loss": 0.7092, "mean_token_accuracy": 0.7856973484158516, "num_tokens": 299381138.0, "step": 9380 }, { "entropy": 0.685287032276392, "epoch": 0.8631117704901065, "grad_norm": 0.1465553492307663, "learning_rate": 7.123317079154783e-05, "loss": 0.6777, "mean_token_accuracy": 0.8046531528234482, "num_tokens": 299413906.0, "step": 9381 }, { "entropy": 0.830245666205883, "epoch": 0.8632037768615477, "grad_norm": 0.1538570076227188, "learning_rate": 7.12301039654062e-05, "loss": 0.8143, "mean_token_accuracy": 0.7580981180071831, "num_tokens": 299445110.0, "step": 9382 }, { "entropy": 0.663673710078001, "epoch": 0.8632957832329888, "grad_norm": 0.1493903398513794, "learning_rate": 7.122703713926458e-05, "loss": 0.6467, "mean_token_accuracy": 0.8079764321446419, "num_tokens": 299477801.0, "step": 9383 }, { "entropy": 0.5991844329982996, "epoch": 0.8633877896044301, "grad_norm": 0.15614666044712067, "learning_rate": 7.122397031312296e-05, "loss": 0.5927, "mean_token_accuracy": 0.8255625069141388, "num_tokens": 299510211.0, "step": 9384 }, { "entropy": 0.6595040559768677, "epoch": 0.8634797959758713, "grad_norm": 0.1559057980775833, "learning_rate": 7.122090348698133e-05, "loss": 0.6559, "mean_token_accuracy": 0.8054000027477741, "num_tokens": 299541724.0, "step": 9385 }, { "entropy": 0.7625353578478098, "epoch": 0.8635718023473126, "grad_norm": 0.16446596384048462, "learning_rate": 7.12178366608397e-05, "loss": 0.7778, "mean_token_accuracy": 0.773286622017622, "num_tokens": 299572628.0, "step": 9386 }, { "entropy": 0.5428614635020494, "epoch": 0.8636638087187538, "grad_norm": 0.1433032602071762, "learning_rate": 7.121476983469806e-05, "loss": 0.5211, "mean_token_accuracy": 0.8432894051074982, "num_tokens": 299604547.0, "step": 9387 }, { "entropy": 0.7461486291140318, "epoch": 0.863755815090195, "grad_norm": 0.1581535041332245, "learning_rate": 7.121170300855645e-05, "loss": 0.7509, "mean_token_accuracy": 0.7813522480428219, "num_tokens": 299636795.0, "step": 9388 }, { "entropy": 0.7161935400217772, "epoch": 0.8638478214616362, "grad_norm": 0.15428520739078522, "learning_rate": 7.120863618241483e-05, "loss": 0.7205, "mean_token_accuracy": 0.7893827147781849, "num_tokens": 299668364.0, "step": 9389 }, { "entropy": 0.7543684802949429, "epoch": 0.8639398278330774, "grad_norm": 0.15689656138420105, "learning_rate": 7.12055693562732e-05, "loss": 0.7489, "mean_token_accuracy": 0.7772361226379871, "num_tokens": 299700033.0, "step": 9390 }, { "entropy": 0.5843158727511764, "epoch": 0.8640318342045187, "grad_norm": 0.1481853723526001, "learning_rate": 7.120250253013156e-05, "loss": 0.5747, "mean_token_accuracy": 0.8267658092081547, "num_tokens": 299732518.0, "step": 9391 }, { "entropy": 0.6819134410470724, "epoch": 0.8641238405759599, "grad_norm": 0.15792417526245117, "learning_rate": 7.119943570398994e-05, "loss": 0.6716, "mean_token_accuracy": 0.800098180770874, "num_tokens": 299764937.0, "step": 9392 }, { "entropy": 0.6880963798612356, "epoch": 0.8642158469474011, "grad_norm": 0.15414679050445557, "learning_rate": 7.119636887784833e-05, "loss": 0.6806, "mean_token_accuracy": 0.7967887744307518, "num_tokens": 299796771.0, "step": 9393 }, { "entropy": 0.7324457168579102, "epoch": 0.8643078533188423, "grad_norm": 0.1551772803068161, "learning_rate": 7.119330205170669e-05, "loss": 0.7312, "mean_token_accuracy": 0.7846244312822819, "num_tokens": 299829273.0, "step": 9394 }, { "entropy": 0.6403395067900419, "epoch": 0.8643998596902835, "grad_norm": 0.14846108853816986, "learning_rate": 7.119023522556506e-05, "loss": 0.6251, "mean_token_accuracy": 0.8137858547270298, "num_tokens": 299861954.0, "step": 9395 }, { "entropy": 0.6851215865463018, "epoch": 0.8644918660617248, "grad_norm": 0.17375381290912628, "learning_rate": 7.118716839942344e-05, "loss": 0.6693, "mean_token_accuracy": 0.802326925098896, "num_tokens": 299893999.0, "step": 9396 }, { "entropy": 0.6878429874777794, "epoch": 0.864583872433166, "grad_norm": 0.16416507959365845, "learning_rate": 7.118410157328181e-05, "loss": 0.6636, "mean_token_accuracy": 0.8006279990077019, "num_tokens": 299926234.0, "step": 9397 }, { "entropy": 0.7307764273136854, "epoch": 0.8646758788046072, "grad_norm": 0.1567036211490631, "learning_rate": 7.118103474714019e-05, "loss": 0.6986, "mean_token_accuracy": 0.7965372949838638, "num_tokens": 299957921.0, "step": 9398 }, { "entropy": 0.7893817499279976, "epoch": 0.8647678851760484, "grad_norm": 0.16812321543693542, "learning_rate": 7.117796792099857e-05, "loss": 0.7868, "mean_token_accuracy": 0.7669800966978073, "num_tokens": 299989422.0, "step": 9399 }, { "entropy": 0.7787327207624912, "epoch": 0.8648598915474897, "grad_norm": 0.15346363186836243, "learning_rate": 7.117490109485694e-05, "loss": 0.7582, "mean_token_accuracy": 0.7759929969906807, "num_tokens": 300020798.0, "step": 9400 }, { "entropy": 0.745806310325861, "epoch": 0.8649518979189309, "grad_norm": 0.15797533094882965, "learning_rate": 7.117183426871531e-05, "loss": 0.7332, "mean_token_accuracy": 0.7849910296499729, "num_tokens": 300053146.0, "step": 9401 }, { "entropy": 0.6929074302315712, "epoch": 0.8650439042903721, "grad_norm": 0.147673100233078, "learning_rate": 7.116876744257368e-05, "loss": 0.6846, "mean_token_accuracy": 0.7943231239914894, "num_tokens": 300085695.0, "step": 9402 }, { "entropy": 0.7214850448071957, "epoch": 0.8651359106618133, "grad_norm": 0.16046148538589478, "learning_rate": 7.116570061643206e-05, "loss": 0.6853, "mean_token_accuracy": 0.799546480178833, "num_tokens": 300117980.0, "step": 9403 }, { "entropy": 0.6318915672600269, "epoch": 0.8652279170332545, "grad_norm": 0.1728653907775879, "learning_rate": 7.116263379029044e-05, "loss": 0.5989, "mean_token_accuracy": 0.8181651458144188, "num_tokens": 300150090.0, "step": 9404 }, { "entropy": 0.710662767291069, "epoch": 0.8653199234046958, "grad_norm": 0.14905354380607605, "learning_rate": 7.115956696414881e-05, "loss": 0.7073, "mean_token_accuracy": 0.7903906628489494, "num_tokens": 300180597.0, "step": 9405 }, { "entropy": 0.7089619562029839, "epoch": 0.865411929776137, "grad_norm": 0.15632876753807068, "learning_rate": 7.115650013800718e-05, "loss": 0.6911, "mean_token_accuracy": 0.7940429858863354, "num_tokens": 300212967.0, "step": 9406 }, { "entropy": 0.6816257676109672, "epoch": 0.8655039361475783, "grad_norm": 0.15161395072937012, "learning_rate": 7.115343331186556e-05, "loss": 0.6645, "mean_token_accuracy": 0.8036345206201077, "num_tokens": 300245089.0, "step": 9407 }, { "entropy": 0.7538397312164307, "epoch": 0.8655959425190194, "grad_norm": 0.1569976955652237, "learning_rate": 7.115036648572392e-05, "loss": 0.7761, "mean_token_accuracy": 0.7740913853049278, "num_tokens": 300277378.0, "step": 9408 }, { "entropy": 0.7171483132988214, "epoch": 0.8656879488904606, "grad_norm": 0.15576738119125366, "learning_rate": 7.11472996595823e-05, "loss": 0.7049, "mean_token_accuracy": 0.7906314693391323, "num_tokens": 300308930.0, "step": 9409 }, { "entropy": 0.8319399114698172, "epoch": 0.8657799552619019, "grad_norm": 0.1570492535829544, "learning_rate": 7.114423283344067e-05, "loss": 0.836, "mean_token_accuracy": 0.7544476129114628, "num_tokens": 300340483.0, "step": 9410 }, { "entropy": 0.7999623846262693, "epoch": 0.8658719616333431, "grad_norm": 0.1617983877658844, "learning_rate": 7.114116600729906e-05, "loss": 0.7885, "mean_token_accuracy": 0.7660381384193897, "num_tokens": 300372086.0, "step": 9411 }, { "entropy": 0.7237855978310108, "epoch": 0.8659639680047844, "grad_norm": 0.1587868332862854, "learning_rate": 7.113809918115742e-05, "loss": 0.7234, "mean_token_accuracy": 0.7842574529349804, "num_tokens": 300404854.0, "step": 9412 }, { "entropy": 0.7814938835799694, "epoch": 0.8660559743762255, "grad_norm": 0.15497761964797974, "learning_rate": 7.113503235501579e-05, "loss": 0.7816, "mean_token_accuracy": 0.7745209895074368, "num_tokens": 300436938.0, "step": 9413 }, { "entropy": 0.8089552875608206, "epoch": 0.8661479807476667, "grad_norm": 0.16208279132843018, "learning_rate": 7.113196552887417e-05, "loss": 0.8008, "mean_token_accuracy": 0.7689556889235973, "num_tokens": 300468854.0, "step": 9414 }, { "entropy": 0.6917135594412684, "epoch": 0.866239987119108, "grad_norm": 0.1519940346479416, "learning_rate": 7.112889870273255e-05, "loss": 0.6855, "mean_token_accuracy": 0.7955516390502453, "num_tokens": 300500916.0, "step": 9415 }, { "entropy": 0.6809289772063494, "epoch": 0.8663319934905492, "grad_norm": 0.1549980640411377, "learning_rate": 7.112583187659092e-05, "loss": 0.6611, "mean_token_accuracy": 0.8039533533155918, "num_tokens": 300532881.0, "step": 9416 }, { "entropy": 0.7079488737508655, "epoch": 0.8664239998619905, "grad_norm": 0.1466134637594223, "learning_rate": 7.112276505044929e-05, "loss": 0.6889, "mean_token_accuracy": 0.7950500212609768, "num_tokens": 300565119.0, "step": 9417 }, { "entropy": 0.7793791815638542, "epoch": 0.8665160062334316, "grad_norm": 0.15578745305538177, "learning_rate": 7.111969822430766e-05, "loss": 0.7616, "mean_token_accuracy": 0.776256438344717, "num_tokens": 300597056.0, "step": 9418 }, { "entropy": 0.7559075858443975, "epoch": 0.8666080126048729, "grad_norm": 0.15704002976417542, "learning_rate": 7.111663139816604e-05, "loss": 0.7598, "mean_token_accuracy": 0.7764304131269455, "num_tokens": 300627644.0, "step": 9419 }, { "entropy": 0.7665963768959045, "epoch": 0.8667000189763141, "grad_norm": 0.1515263319015503, "learning_rate": 7.111356457202442e-05, "loss": 0.7593, "mean_token_accuracy": 0.7741331905126572, "num_tokens": 300659634.0, "step": 9420 }, { "entropy": 0.7888748310506344, "epoch": 0.8667920253477553, "grad_norm": 0.1598089039325714, "learning_rate": 7.111049774588279e-05, "loss": 0.7709, "mean_token_accuracy": 0.7720173187553883, "num_tokens": 300690817.0, "step": 9421 }, { "entropy": 0.6942821424454451, "epoch": 0.8668840317191966, "grad_norm": 0.1557421088218689, "learning_rate": 7.110743091974116e-05, "loss": 0.6766, "mean_token_accuracy": 0.7931774668395519, "num_tokens": 300722051.0, "step": 9422 }, { "entropy": 0.6799720376729965, "epoch": 0.8669760380906377, "grad_norm": 0.1579056680202484, "learning_rate": 7.110436409359954e-05, "loss": 0.6656, "mean_token_accuracy": 0.8029154315590858, "num_tokens": 300754358.0, "step": 9423 }, { "entropy": 0.7226154636591673, "epoch": 0.867068044462079, "grad_norm": 0.1556926816701889, "learning_rate": 7.11012972674579e-05, "loss": 0.7135, "mean_token_accuracy": 0.7895899824798107, "num_tokens": 300785930.0, "step": 9424 }, { "entropy": 0.7345237042754889, "epoch": 0.8671600508335202, "grad_norm": 0.15676768124103546, "learning_rate": 7.109823044131629e-05, "loss": 0.7236, "mean_token_accuracy": 0.7871703617274761, "num_tokens": 300818235.0, "step": 9425 }, { "entropy": 0.8337792176753283, "epoch": 0.8672520572049615, "grad_norm": 0.15863996744155884, "learning_rate": 7.109516361517465e-05, "loss": 0.8368, "mean_token_accuracy": 0.7580298408865929, "num_tokens": 300849671.0, "step": 9426 }, { "entropy": 0.6408861503005028, "epoch": 0.8673440635764027, "grad_norm": 0.14432469010353088, "learning_rate": 7.109209678903304e-05, "loss": 0.6275, "mean_token_accuracy": 0.8110961392521858, "num_tokens": 300881384.0, "step": 9427 }, { "entropy": 0.6639566514641047, "epoch": 0.8674360699478438, "grad_norm": 0.15528973937034607, "learning_rate": 7.10890299628914e-05, "loss": 0.6414, "mean_token_accuracy": 0.8050641529262066, "num_tokens": 300912498.0, "step": 9428 }, { "entropy": 0.7425696616992354, "epoch": 0.8675280763192851, "grad_norm": 0.15245935320854187, "learning_rate": 7.108596313674977e-05, "loss": 0.7414, "mean_token_accuracy": 0.7844297215342522, "num_tokens": 300945129.0, "step": 9429 }, { "entropy": 0.672296429052949, "epoch": 0.8676200826907263, "grad_norm": 0.15642182528972626, "learning_rate": 7.108289631060817e-05, "loss": 0.6713, "mean_token_accuracy": 0.7971320003271103, "num_tokens": 300976687.0, "step": 9430 }, { "entropy": 0.7621972765773535, "epoch": 0.8677120890621676, "grad_norm": 0.15754960477352142, "learning_rate": 7.107982948446653e-05, "loss": 0.7624, "mean_token_accuracy": 0.7788499556481838, "num_tokens": 301008572.0, "step": 9431 }, { "entropy": 0.7649450586177409, "epoch": 0.8678040954336088, "grad_norm": 0.15176703035831451, "learning_rate": 7.10767626583249e-05, "loss": 0.7536, "mean_token_accuracy": 0.7805104739964008, "num_tokens": 301040225.0, "step": 9432 }, { "entropy": 0.6658989861607552, "epoch": 0.86789610180505, "grad_norm": 0.15933527052402496, "learning_rate": 7.107369583218327e-05, "loss": 0.6628, "mean_token_accuracy": 0.8045866303145885, "num_tokens": 301072022.0, "step": 9433 }, { "entropy": 0.6720318980515003, "epoch": 0.8679881081764912, "grad_norm": 0.16329513490200043, "learning_rate": 7.107062900604165e-05, "loss": 0.6586, "mean_token_accuracy": 0.8015291132032871, "num_tokens": 301102631.0, "step": 9434 }, { "entropy": 0.8501088488847017, "epoch": 0.8680801145479324, "grad_norm": 0.1487184315919876, "learning_rate": 7.106756217990003e-05, "loss": 0.8296, "mean_token_accuracy": 0.7561903186142445, "num_tokens": 301134243.0, "step": 9435 }, { "entropy": 0.7197634484618902, "epoch": 0.8681721209193737, "grad_norm": 0.15416289865970612, "learning_rate": 7.10644953537584e-05, "loss": 0.722, "mean_token_accuracy": 0.7869780398905277, "num_tokens": 301166875.0, "step": 9436 }, { "entropy": 0.7680638814345002, "epoch": 0.8682641272908149, "grad_norm": 0.15282733738422394, "learning_rate": 7.106142852761677e-05, "loss": 0.7508, "mean_token_accuracy": 0.7838510535657406, "num_tokens": 301198403.0, "step": 9437 }, { "entropy": 0.6490823617205024, "epoch": 0.8683561336622561, "grad_norm": 0.15472978353500366, "learning_rate": 7.105836170147515e-05, "loss": 0.634, "mean_token_accuracy": 0.8103040084242821, "num_tokens": 301229929.0, "step": 9438 }, { "entropy": 0.6991249807178974, "epoch": 0.8684481400336973, "grad_norm": 0.1649285852909088, "learning_rate": 7.105529487533352e-05, "loss": 0.6925, "mean_token_accuracy": 0.7925313599407673, "num_tokens": 301261339.0, "step": 9439 }, { "entropy": 0.6567652514204383, "epoch": 0.8685401464051385, "grad_norm": 0.14103394746780396, "learning_rate": 7.10522280491919e-05, "loss": 0.6385, "mean_token_accuracy": 0.8115219697356224, "num_tokens": 301292477.0, "step": 9440 }, { "entropy": 0.713728504255414, "epoch": 0.8686321527765798, "grad_norm": 0.15785759687423706, "learning_rate": 7.104916122305027e-05, "loss": 0.701, "mean_token_accuracy": 0.7906535379588604, "num_tokens": 301324513.0, "step": 9441 }, { "entropy": 0.7993347812443972, "epoch": 0.868724159148021, "grad_norm": 0.15786348283290863, "learning_rate": 7.104609439690865e-05, "loss": 0.8035, "mean_token_accuracy": 0.7655744925141335, "num_tokens": 301356866.0, "step": 9442 }, { "entropy": 0.6744106747210026, "epoch": 0.8688161655194622, "grad_norm": 0.1456708014011383, "learning_rate": 7.104302757076702e-05, "loss": 0.6442, "mean_token_accuracy": 0.8072120472788811, "num_tokens": 301388685.0, "step": 9443 }, { "entropy": 0.6963634938001633, "epoch": 0.8689081718909034, "grad_norm": 0.1476767659187317, "learning_rate": 7.103996074462538e-05, "loss": 0.6734, "mean_token_accuracy": 0.8007310293614864, "num_tokens": 301420365.0, "step": 9444 }, { "entropy": 0.6776910927146673, "epoch": 0.8690001782623447, "grad_norm": 0.1538129597902298, "learning_rate": 7.103689391848377e-05, "loss": 0.6619, "mean_token_accuracy": 0.8012172840535641, "num_tokens": 301452318.0, "step": 9445 }, { "entropy": 0.6588343000039458, "epoch": 0.8690921846337859, "grad_norm": 0.14567917585372925, "learning_rate": 7.103382709234215e-05, "loss": 0.6584, "mean_token_accuracy": 0.8032059147953987, "num_tokens": 301484725.0, "step": 9446 }, { "entropy": 0.7252768520265818, "epoch": 0.8691841910052271, "grad_norm": 0.156536266207695, "learning_rate": 7.103076026620052e-05, "loss": 0.7083, "mean_token_accuracy": 0.790626086294651, "num_tokens": 301516500.0, "step": 9447 }, { "entropy": 0.7714630998671055, "epoch": 0.8692761973766683, "grad_norm": 0.15624500811100006, "learning_rate": 7.102769344005888e-05, "loss": 0.7654, "mean_token_accuracy": 0.7741681709885597, "num_tokens": 301548497.0, "step": 9448 }, { "entropy": 0.8233904056251049, "epoch": 0.8693682037481095, "grad_norm": 0.15213371813297272, "learning_rate": 7.102462661391725e-05, "loss": 0.8139, "mean_token_accuracy": 0.760954562574625, "num_tokens": 301581174.0, "step": 9449 }, { "entropy": 0.7955761272460222, "epoch": 0.8694602101195508, "grad_norm": 0.15440776944160461, "learning_rate": 7.102155978777563e-05, "loss": 0.7766, "mean_token_accuracy": 0.7702567242085934, "num_tokens": 301612881.0, "step": 9450 }, { "entropy": 0.7331493068486452, "epoch": 0.869552216490992, "grad_norm": 0.14947505295276642, "learning_rate": 7.101849296163401e-05, "loss": 0.7208, "mean_token_accuracy": 0.7852564416825771, "num_tokens": 301644200.0, "step": 9451 }, { "entropy": 0.8410804308950901, "epoch": 0.8696442228624333, "grad_norm": 0.16650955379009247, "learning_rate": 7.101542613549238e-05, "loss": 0.8431, "mean_token_accuracy": 0.7546150535345078, "num_tokens": 301675943.0, "step": 9452 }, { "entropy": 0.6401942614465952, "epoch": 0.8697362292338744, "grad_norm": 0.15919563174247742, "learning_rate": 7.101235930935075e-05, "loss": 0.6269, "mean_token_accuracy": 0.8127207942306995, "num_tokens": 301707853.0, "step": 9453 }, { "entropy": 0.8252610377967358, "epoch": 0.8698282356053156, "grad_norm": 0.1646946668624878, "learning_rate": 7.100929248320913e-05, "loss": 0.805, "mean_token_accuracy": 0.7659855931997299, "num_tokens": 301738893.0, "step": 9454 }, { "entropy": 0.6691693309694529, "epoch": 0.8699202419767569, "grad_norm": 0.15261279046535492, "learning_rate": 7.10062256570675e-05, "loss": 0.6467, "mean_token_accuracy": 0.8016528151929379, "num_tokens": 301770299.0, "step": 9455 }, { "entropy": 0.7216642834246159, "epoch": 0.8700122483481981, "grad_norm": 0.15584354102611542, "learning_rate": 7.100315883092588e-05, "loss": 0.7063, "mean_token_accuracy": 0.7929015196859837, "num_tokens": 301802424.0, "step": 9456 }, { "entropy": 0.6661333963274956, "epoch": 0.8701042547196394, "grad_norm": 0.16474248468875885, "learning_rate": 7.100009200478426e-05, "loss": 0.6508, "mean_token_accuracy": 0.8026233203709126, "num_tokens": 301834087.0, "step": 9457 }, { "entropy": 0.6420670691877604, "epoch": 0.8701962610910805, "grad_norm": 0.16124258935451508, "learning_rate": 7.099702517864263e-05, "loss": 0.6323, "mean_token_accuracy": 0.8115709386765957, "num_tokens": 301865725.0, "step": 9458 }, { "entropy": 0.7117118127644062, "epoch": 0.8702882674625217, "grad_norm": 0.1626591682434082, "learning_rate": 7.0993958352501e-05, "loss": 0.7155, "mean_token_accuracy": 0.7894459404051304, "num_tokens": 301897623.0, "step": 9459 }, { "entropy": 0.8022860232740641, "epoch": 0.870380273833963, "grad_norm": 0.15779733657836914, "learning_rate": 7.099089152635937e-05, "loss": 0.7964, "mean_token_accuracy": 0.7696094401180744, "num_tokens": 301929872.0, "step": 9460 }, { "entropy": 0.6929803611710668, "epoch": 0.8704722802054042, "grad_norm": 0.14567877352237701, "learning_rate": 7.098782470021775e-05, "loss": 0.6806, "mean_token_accuracy": 0.7963567636907101, "num_tokens": 301962160.0, "step": 9461 }, { "entropy": 0.7078960966318846, "epoch": 0.8705642865768455, "grad_norm": 0.14545206725597382, "learning_rate": 7.098475787407613e-05, "loss": 0.6837, "mean_token_accuracy": 0.7955137118697166, "num_tokens": 301994159.0, "step": 9462 }, { "entropy": 0.7412412539124489, "epoch": 0.8706562929482866, "grad_norm": 0.15763337910175323, "learning_rate": 7.09816910479345e-05, "loss": 0.7311, "mean_token_accuracy": 0.7856837324798107, "num_tokens": 302026388.0, "step": 9463 }, { "entropy": 0.7852325700223446, "epoch": 0.8707482993197279, "grad_norm": 0.15953169763088226, "learning_rate": 7.097862422179286e-05, "loss": 0.7829, "mean_token_accuracy": 0.7693373784422874, "num_tokens": 302057964.0, "step": 9464 }, { "entropy": 0.726873017847538, "epoch": 0.8708403056911691, "grad_norm": 0.15617746114730835, "learning_rate": 7.097555739565125e-05, "loss": 0.721, "mean_token_accuracy": 0.7840094231069088, "num_tokens": 302089561.0, "step": 9465 }, { "entropy": 0.6638039676472545, "epoch": 0.8709323120626103, "grad_norm": 0.1514037400484085, "learning_rate": 7.097249056950961e-05, "loss": 0.6418, "mean_token_accuracy": 0.8058439232409, "num_tokens": 302122329.0, "step": 9466 }, { "entropy": 0.7913656998425722, "epoch": 0.8710243184340516, "grad_norm": 0.15442600846290588, "learning_rate": 7.0969423743368e-05, "loss": 0.7787, "mean_token_accuracy": 0.7721321769058704, "num_tokens": 302153580.0, "step": 9467 }, { "entropy": 0.5929783284664154, "epoch": 0.8711163248054927, "grad_norm": 0.15177573263645172, "learning_rate": 7.096635691722636e-05, "loss": 0.5859, "mean_token_accuracy": 0.8234858475625515, "num_tokens": 302186167.0, "step": 9468 }, { "entropy": 0.7608021926134825, "epoch": 0.871208331176934, "grad_norm": 0.1640535593032837, "learning_rate": 7.096329009108474e-05, "loss": 0.7715, "mean_token_accuracy": 0.7742783315479755, "num_tokens": 302218133.0, "step": 9469 }, { "entropy": 0.7814521789550781, "epoch": 0.8713003375483752, "grad_norm": 0.16345754265785217, "learning_rate": 7.096022326494311e-05, "loss": 0.7781, "mean_token_accuracy": 0.7698923051357269, "num_tokens": 302250380.0, "step": 9470 }, { "entropy": 0.7607823945581913, "epoch": 0.8713923439198165, "grad_norm": 0.15596403181552887, "learning_rate": 7.095715643880148e-05, "loss": 0.7392, "mean_token_accuracy": 0.7812750414013863, "num_tokens": 302280933.0, "step": 9471 }, { "entropy": 0.7376413093879819, "epoch": 0.8714843502912577, "grad_norm": 0.1518380045890808, "learning_rate": 7.095408961265986e-05, "loss": 0.7225, "mean_token_accuracy": 0.7882676310837269, "num_tokens": 302312598.0, "step": 9472 }, { "entropy": 0.6656134016811848, "epoch": 0.8715763566626988, "grad_norm": 0.16171549260616302, "learning_rate": 7.095102278651824e-05, "loss": 0.6452, "mean_token_accuracy": 0.8056312650442123, "num_tokens": 302344887.0, "step": 9473 }, { "entropy": 0.6262186537496746, "epoch": 0.8716683630341401, "grad_norm": 0.15904594957828522, "learning_rate": 7.094795596037661e-05, "loss": 0.6195, "mean_token_accuracy": 0.8143936358392239, "num_tokens": 302376036.0, "step": 9474 }, { "entropy": 0.6454485580325127, "epoch": 0.8717603694055813, "grad_norm": 0.1557372808456421, "learning_rate": 7.094488913423498e-05, "loss": 0.6202, "mean_token_accuracy": 0.8129967749118805, "num_tokens": 302408286.0, "step": 9475 }, { "entropy": 0.6696409042924643, "epoch": 0.8718523757770226, "grad_norm": 0.1508333683013916, "learning_rate": 7.094182230809336e-05, "loss": 0.6528, "mean_token_accuracy": 0.8086920753121376, "num_tokens": 302440266.0, "step": 9476 }, { "entropy": 0.6822449387982488, "epoch": 0.8719443821484638, "grad_norm": 0.1521729677915573, "learning_rate": 7.093875548195174e-05, "loss": 0.6549, "mean_token_accuracy": 0.8037151731550694, "num_tokens": 302471017.0, "step": 9477 }, { "entropy": 0.7009687088429928, "epoch": 0.872036388519905, "grad_norm": 0.14898468554019928, "learning_rate": 7.093568865581011e-05, "loss": 0.686, "mean_token_accuracy": 0.8025824874639511, "num_tokens": 302503447.0, "step": 9478 }, { "entropy": 0.7051727827638388, "epoch": 0.8721283948913462, "grad_norm": 0.14980155229568481, "learning_rate": 7.093262182966848e-05, "loss": 0.6974, "mean_token_accuracy": 0.7939973175525665, "num_tokens": 302536215.0, "step": 9479 }, { "entropy": 0.7416692562401295, "epoch": 0.8722204012627874, "grad_norm": 0.15849530696868896, "learning_rate": 7.092955500352684e-05, "loss": 0.7331, "mean_token_accuracy": 0.7852247841656208, "num_tokens": 302568007.0, "step": 9480 }, { "entropy": 0.7598546296358109, "epoch": 0.8723124076342287, "grad_norm": 0.16181041300296783, "learning_rate": 7.092648817738523e-05, "loss": 0.7489, "mean_token_accuracy": 0.7797464281320572, "num_tokens": 302599626.0, "step": 9481 }, { "entropy": 0.7342812791466713, "epoch": 0.8724044140056699, "grad_norm": 0.1571923792362213, "learning_rate": 7.092342135124361e-05, "loss": 0.7414, "mean_token_accuracy": 0.7795138843357563, "num_tokens": 302631806.0, "step": 9482 }, { "entropy": 0.6307021770626307, "epoch": 0.8724964203771112, "grad_norm": 0.14694327116012573, "learning_rate": 7.092035452510198e-05, "loss": 0.6169, "mean_token_accuracy": 0.8152629658579826, "num_tokens": 302663375.0, "step": 9483 }, { "entropy": 0.7866385309025645, "epoch": 0.8725884267485523, "grad_norm": 0.17012441158294678, "learning_rate": 7.091728769896034e-05, "loss": 0.7879, "mean_token_accuracy": 0.7737286984920502, "num_tokens": 302695871.0, "step": 9484 }, { "entropy": 0.8208592589944601, "epoch": 0.8726804331199935, "grad_norm": 0.15719197690486908, "learning_rate": 7.091422087281872e-05, "loss": 0.8054, "mean_token_accuracy": 0.7606742791831493, "num_tokens": 302727767.0, "step": 9485 }, { "entropy": 0.6976297805085778, "epoch": 0.8727724394914348, "grad_norm": 0.15792900323867798, "learning_rate": 7.091115404667709e-05, "loss": 0.6907, "mean_token_accuracy": 0.7941882386803627, "num_tokens": 302760066.0, "step": 9486 }, { "entropy": 0.6005914583802223, "epoch": 0.872864445862876, "grad_norm": 0.15012696385383606, "learning_rate": 7.090808722053547e-05, "loss": 0.5867, "mean_token_accuracy": 0.8238208778202534, "num_tokens": 302792125.0, "step": 9487 }, { "entropy": 0.7557874228805304, "epoch": 0.8729564522343173, "grad_norm": 0.15534748136997223, "learning_rate": 7.090502039439386e-05, "loss": 0.7298, "mean_token_accuracy": 0.7841922529041767, "num_tokens": 302824161.0, "step": 9488 }, { "entropy": 0.7220633719116449, "epoch": 0.8730484586057584, "grad_norm": 0.15059684216976166, "learning_rate": 7.090195356825222e-05, "loss": 0.7123, "mean_token_accuracy": 0.7838424891233444, "num_tokens": 302856369.0, "step": 9489 }, { "entropy": 0.8074232637882233, "epoch": 0.8731404649771997, "grad_norm": 0.165130615234375, "learning_rate": 7.089888674211059e-05, "loss": 0.7978, "mean_token_accuracy": 0.7648448422551155, "num_tokens": 302888490.0, "step": 9490 }, { "entropy": 0.6839218540117145, "epoch": 0.8732324713486409, "grad_norm": 0.1515226811170578, "learning_rate": 7.089581991596896e-05, "loss": 0.6795, "mean_token_accuracy": 0.8004763498902321, "num_tokens": 302920991.0, "step": 9491 }, { "entropy": 0.7039325479418039, "epoch": 0.8733244777200821, "grad_norm": 0.14803825318813324, "learning_rate": 7.089275308982734e-05, "loss": 0.6783, "mean_token_accuracy": 0.8033909387886524, "num_tokens": 302952852.0, "step": 9492 }, { "entropy": 0.7303701546043158, "epoch": 0.8734164840915234, "grad_norm": 0.1571943610906601, "learning_rate": 7.088968626368572e-05, "loss": 0.7177, "mean_token_accuracy": 0.7898227423429489, "num_tokens": 302985169.0, "step": 9493 }, { "entropy": 0.7497800588607788, "epoch": 0.8735084904629645, "grad_norm": 0.15568050742149353, "learning_rate": 7.088661943754409e-05, "loss": 0.734, "mean_token_accuracy": 0.7785241790115833, "num_tokens": 303016828.0, "step": 9494 }, { "entropy": 0.8248034520074725, "epoch": 0.8736004968344058, "grad_norm": 0.16465412080287933, "learning_rate": 7.088355261140246e-05, "loss": 0.8115, "mean_token_accuracy": 0.7644734270870686, "num_tokens": 303047837.0, "step": 9495 }, { "entropy": 0.627840319648385, "epoch": 0.873692503205847, "grad_norm": 0.15349248051643372, "learning_rate": 7.088048578526084e-05, "loss": 0.6159, "mean_token_accuracy": 0.8142041862010956, "num_tokens": 303079733.0, "step": 9496 }, { "entropy": 0.772350424900651, "epoch": 0.8737845095772883, "grad_norm": 0.16255183517932892, "learning_rate": 7.087741895911921e-05, "loss": 0.7685, "mean_token_accuracy": 0.7737188674509525, "num_tokens": 303111165.0, "step": 9497 }, { "entropy": 0.7049489915370941, "epoch": 0.8738765159487295, "grad_norm": 0.15161405503749847, "learning_rate": 7.087435213297759e-05, "loss": 0.6967, "mean_token_accuracy": 0.7890214063227177, "num_tokens": 303143047.0, "step": 9498 }, { "entropy": 0.6338754156604409, "epoch": 0.8739685223201706, "grad_norm": 0.1465035229921341, "learning_rate": 7.087128530683596e-05, "loss": 0.6281, "mean_token_accuracy": 0.8130107074975967, "num_tokens": 303175624.0, "step": 9499 }, { "entropy": 0.5907882805913687, "epoch": 0.8740605286916119, "grad_norm": 0.14817287027835846, "learning_rate": 7.086821848069434e-05, "loss": 0.5946, "mean_token_accuracy": 0.8173217549920082, "num_tokens": 303207194.0, "step": 9500 }, { "entropy": 0.7150478037074208, "epoch": 0.8741525350630531, "grad_norm": 0.15299271047115326, "learning_rate": 7.08651516545527e-05, "loss": 0.7247, "mean_token_accuracy": 0.7894177548587322, "num_tokens": 303239446.0, "step": 9501 }, { "entropy": 0.7302867900580168, "epoch": 0.8742445414344944, "grad_norm": 0.15194149315357208, "learning_rate": 7.086208482841107e-05, "loss": 0.7316, "mean_token_accuracy": 0.7842911146581173, "num_tokens": 303270824.0, "step": 9502 }, { "entropy": 0.7121652271598577, "epoch": 0.8743365478059356, "grad_norm": 0.151997908949852, "learning_rate": 7.085901800226945e-05, "loss": 0.6932, "mean_token_accuracy": 0.795502308756113, "num_tokens": 303303475.0, "step": 9503 }, { "entropy": 0.8328878059983253, "epoch": 0.8744285541773767, "grad_norm": 0.16419878602027893, "learning_rate": 7.085595117612784e-05, "loss": 0.8211, "mean_token_accuracy": 0.7633174434304237, "num_tokens": 303333182.0, "step": 9504 }, { "entropy": 0.79943189304322, "epoch": 0.874520560548818, "grad_norm": 0.1580924242734909, "learning_rate": 7.08528843499862e-05, "loss": 0.784, "mean_token_accuracy": 0.7668987177312374, "num_tokens": 303365586.0, "step": 9505 }, { "entropy": 0.8312976695597172, "epoch": 0.8746125669202592, "grad_norm": 0.15992482006549835, "learning_rate": 7.084981752384457e-05, "loss": 0.8125, "mean_token_accuracy": 0.7608719170093536, "num_tokens": 303396963.0, "step": 9506 }, { "entropy": 0.6103994213044643, "epoch": 0.8747045732917005, "grad_norm": 0.15517641603946686, "learning_rate": 7.084675069770294e-05, "loss": 0.5827, "mean_token_accuracy": 0.8206404112279415, "num_tokens": 303429133.0, "step": 9507 }, { "entropy": 0.7239912189543247, "epoch": 0.8747965796631417, "grad_norm": 0.15731917321681976, "learning_rate": 7.084368387156133e-05, "loss": 0.7247, "mean_token_accuracy": 0.7886646389961243, "num_tokens": 303460958.0, "step": 9508 }, { "entropy": 0.7113727852702141, "epoch": 0.8748885860345829, "grad_norm": 0.15942971408367157, "learning_rate": 7.08406170454197e-05, "loss": 0.7116, "mean_token_accuracy": 0.7900479920208454, "num_tokens": 303492760.0, "step": 9509 }, { "entropy": 0.6349211614578962, "epoch": 0.8749805924060241, "grad_norm": 0.154306098818779, "learning_rate": 7.083755021927807e-05, "loss": 0.6107, "mean_token_accuracy": 0.8134110309183598, "num_tokens": 303524079.0, "step": 9510 }, { "entropy": 0.7812917716801167, "epoch": 0.8750725987774653, "grad_norm": 0.16597890853881836, "learning_rate": 7.083448339313644e-05, "loss": 0.7678, "mean_token_accuracy": 0.7731347307562828, "num_tokens": 303555940.0, "step": 9511 }, { "entropy": 0.6509244758635759, "epoch": 0.8751646051489066, "grad_norm": 0.15379466116428375, "learning_rate": 7.083141656699482e-05, "loss": 0.6337, "mean_token_accuracy": 0.813650906085968, "num_tokens": 303587628.0, "step": 9512 }, { "entropy": 0.7601792849600315, "epoch": 0.8752566115203478, "grad_norm": 0.15863455832004547, "learning_rate": 7.08283497408532e-05, "loss": 0.7545, "mean_token_accuracy": 0.7763179279863834, "num_tokens": 303620039.0, "step": 9513 }, { "entropy": 0.6592027638107538, "epoch": 0.875348617891789, "grad_norm": 0.15765076875686646, "learning_rate": 7.082528291471157e-05, "loss": 0.6572, "mean_token_accuracy": 0.8023984767496586, "num_tokens": 303651341.0, "step": 9514 }, { "entropy": 0.7158920411020517, "epoch": 0.8754406242632302, "grad_norm": 0.16139797866344452, "learning_rate": 7.082221608856994e-05, "loss": 0.7184, "mean_token_accuracy": 0.7928129099309444, "num_tokens": 303683377.0, "step": 9515 }, { "entropy": 0.7304631043225527, "epoch": 0.8755326306346715, "grad_norm": 0.15378303825855255, "learning_rate": 7.081914926242832e-05, "loss": 0.7266, "mean_token_accuracy": 0.7834684029221535, "num_tokens": 303715598.0, "step": 9516 }, { "entropy": 0.5726066790521145, "epoch": 0.8756246370061127, "grad_norm": 0.14335691928863525, "learning_rate": 7.081608243628669e-05, "loss": 0.551, "mean_token_accuracy": 0.8371103517711163, "num_tokens": 303748072.0, "step": 9517 }, { "entropy": 0.6243804022669792, "epoch": 0.875716643377554, "grad_norm": 0.15344542264938354, "learning_rate": 7.081301561014507e-05, "loss": 0.5926, "mean_token_accuracy": 0.8210651613771915, "num_tokens": 303780397.0, "step": 9518 }, { "entropy": 0.6964067425578833, "epoch": 0.8758086497489951, "grad_norm": 0.15025892853736877, "learning_rate": 7.080994878400345e-05, "loss": 0.6894, "mean_token_accuracy": 0.7878014147281647, "num_tokens": 303812356.0, "step": 9519 }, { "entropy": 0.7476435974240303, "epoch": 0.8759006561204363, "grad_norm": 0.1675640195608139, "learning_rate": 7.080688195786182e-05, "loss": 0.7486, "mean_token_accuracy": 0.7771080583333969, "num_tokens": 303843675.0, "step": 9520 }, { "entropy": 0.7572608385235071, "epoch": 0.8759926624918776, "grad_norm": 0.15893831849098206, "learning_rate": 7.080381513172019e-05, "loss": 0.7543, "mean_token_accuracy": 0.7785063795745373, "num_tokens": 303874727.0, "step": 9521 }, { "entropy": 0.5448395553976297, "epoch": 0.8760846688633188, "grad_norm": 0.1518707573413849, "learning_rate": 7.080074830557855e-05, "loss": 0.5368, "mean_token_accuracy": 0.8382115177810192, "num_tokens": 303906306.0, "step": 9522 }, { "entropy": 0.7088436875492334, "epoch": 0.8761766752347601, "grad_norm": 0.15108579397201538, "learning_rate": 7.079768147943693e-05, "loss": 0.6995, "mean_token_accuracy": 0.7904795184731483, "num_tokens": 303937922.0, "step": 9523 }, { "entropy": 0.6687766704708338, "epoch": 0.8762686816062012, "grad_norm": 0.15074141323566437, "learning_rate": 7.079461465329532e-05, "loss": 0.6559, "mean_token_accuracy": 0.8020180836319923, "num_tokens": 303969414.0, "step": 9524 }, { "entropy": 0.7106018010526896, "epoch": 0.8763606879776424, "grad_norm": 0.16008706390857697, "learning_rate": 7.079154782715368e-05, "loss": 0.7008, "mean_token_accuracy": 0.7958316840231419, "num_tokens": 304001595.0, "step": 9525 }, { "entropy": 0.6645860392600298, "epoch": 0.8764526943490837, "grad_norm": 0.15013879537582397, "learning_rate": 7.078848100101205e-05, "loss": 0.6435, "mean_token_accuracy": 0.8059172332286835, "num_tokens": 304033319.0, "step": 9526 }, { "entropy": 0.6375437248498201, "epoch": 0.8765447007205249, "grad_norm": 0.1546163409948349, "learning_rate": 7.078541417487043e-05, "loss": 0.637, "mean_token_accuracy": 0.809252142906189, "num_tokens": 304065807.0, "step": 9527 }, { "entropy": 0.6969247292727232, "epoch": 0.8766367070919662, "grad_norm": 0.15995441377162933, "learning_rate": 7.07823473487288e-05, "loss": 0.6783, "mean_token_accuracy": 0.7970060482621193, "num_tokens": 304098160.0, "step": 9528 }, { "entropy": 0.6319955633953214, "epoch": 0.8767287134634073, "grad_norm": 0.15977586805820465, "learning_rate": 7.077928052258718e-05, "loss": 0.6376, "mean_token_accuracy": 0.8142426311969757, "num_tokens": 304129956.0, "step": 9529 }, { "entropy": 0.7331339698284864, "epoch": 0.8768207198348485, "grad_norm": 0.1546429991722107, "learning_rate": 7.077621369644555e-05, "loss": 0.7196, "mean_token_accuracy": 0.7916033565998077, "num_tokens": 304161372.0, "step": 9530 }, { "entropy": 0.6793500334024429, "epoch": 0.8769127262062898, "grad_norm": 0.15140970051288605, "learning_rate": 7.077314687030393e-05, "loss": 0.6807, "mean_token_accuracy": 0.8008390516042709, "num_tokens": 304192704.0, "step": 9531 }, { "entropy": 0.7725203596055508, "epoch": 0.877004732577731, "grad_norm": 0.16519008576869965, "learning_rate": 7.07700800441623e-05, "loss": 0.7693, "mean_token_accuracy": 0.7742812857031822, "num_tokens": 304224470.0, "step": 9532 }, { "entropy": 0.6746007576584816, "epoch": 0.8770967389491723, "grad_norm": 0.16027650237083435, "learning_rate": 7.076701321802067e-05, "loss": 0.6422, "mean_token_accuracy": 0.8093331754207611, "num_tokens": 304256645.0, "step": 9533 }, { "entropy": 0.6952027110382915, "epoch": 0.8771887453206134, "grad_norm": 0.15714499354362488, "learning_rate": 7.076394639187905e-05, "loss": 0.6863, "mean_token_accuracy": 0.7975052148103714, "num_tokens": 304289177.0, "step": 9534 }, { "entropy": 0.7841057237237692, "epoch": 0.8772807516920547, "grad_norm": 0.15390750765800476, "learning_rate": 7.076087956573743e-05, "loss": 0.7577, "mean_token_accuracy": 0.7760691493749619, "num_tokens": 304321032.0, "step": 9535 }, { "entropy": 0.6576796937733889, "epoch": 0.8773727580634959, "grad_norm": 0.15209747850894928, "learning_rate": 7.07578127395958e-05, "loss": 0.6382, "mean_token_accuracy": 0.8096005134284496, "num_tokens": 304353254.0, "step": 9536 }, { "entropy": 0.5831970311701298, "epoch": 0.8774647644349372, "grad_norm": 0.14003942906856537, "learning_rate": 7.075474591345417e-05, "loss": 0.5493, "mean_token_accuracy": 0.8314490914344788, "num_tokens": 304384977.0, "step": 9537 }, { "entropy": 0.8488270658999681, "epoch": 0.8775567708063784, "grad_norm": 0.15711307525634766, "learning_rate": 7.075167908731253e-05, "loss": 0.8387, "mean_token_accuracy": 0.7548383884131908, "num_tokens": 304416693.0, "step": 9538 }, { "entropy": 0.8086378648877144, "epoch": 0.8776487771778195, "grad_norm": 0.1660158336162567, "learning_rate": 7.074861226117092e-05, "loss": 0.8098, "mean_token_accuracy": 0.7595930621027946, "num_tokens": 304446535.0, "step": 9539 }, { "entropy": 0.650096689350903, "epoch": 0.8777407835492608, "grad_norm": 0.1478722244501114, "learning_rate": 7.07455454350293e-05, "loss": 0.6471, "mean_token_accuracy": 0.8055305071175098, "num_tokens": 304478807.0, "step": 9540 }, { "entropy": 0.7322646770626307, "epoch": 0.877832789920702, "grad_norm": 0.15152607858181, "learning_rate": 7.074247860888766e-05, "loss": 0.7127, "mean_token_accuracy": 0.7860793098807335, "num_tokens": 304510853.0, "step": 9541 }, { "entropy": 0.7049979325383902, "epoch": 0.8779247962921433, "grad_norm": 0.16131335496902466, "learning_rate": 7.073941178274603e-05, "loss": 0.688, "mean_token_accuracy": 0.7958362214267254, "num_tokens": 304541843.0, "step": 9542 }, { "entropy": 0.6153056267648935, "epoch": 0.8780168026635845, "grad_norm": 0.14713409543037415, "learning_rate": 7.073634495660441e-05, "loss": 0.5953, "mean_token_accuracy": 0.8205070532858372, "num_tokens": 304574066.0, "step": 9543 }, { "entropy": 0.695370988920331, "epoch": 0.8781088090350256, "grad_norm": 0.16348977386951447, "learning_rate": 7.073327813046278e-05, "loss": 0.6887, "mean_token_accuracy": 0.7939359992742538, "num_tokens": 304606003.0, "step": 9544 }, { "entropy": 0.6828480269759893, "epoch": 0.8782008154064669, "grad_norm": 0.15607891976833344, "learning_rate": 7.073021130432116e-05, "loss": 0.6714, "mean_token_accuracy": 0.7972989045083523, "num_tokens": 304638102.0, "step": 9545 }, { "entropy": 0.7219934361055493, "epoch": 0.8782928217779081, "grad_norm": 0.15484113991260529, "learning_rate": 7.072714447817953e-05, "loss": 0.7179, "mean_token_accuracy": 0.7887686230242252, "num_tokens": 304670603.0, "step": 9546 }, { "entropy": 0.6545900348573923, "epoch": 0.8783848281493494, "grad_norm": 0.15405647456645966, "learning_rate": 7.072407765203791e-05, "loss": 0.6474, "mean_token_accuracy": 0.8071141727268696, "num_tokens": 304702427.0, "step": 9547 }, { "entropy": 0.7335512097924948, "epoch": 0.8784768345207906, "grad_norm": 0.16458065807819366, "learning_rate": 7.072101082589628e-05, "loss": 0.7187, "mean_token_accuracy": 0.7906699627637863, "num_tokens": 304734417.0, "step": 9548 }, { "entropy": 0.6286568231880665, "epoch": 0.8785688408922318, "grad_norm": 0.16361847519874573, "learning_rate": 7.071794399975465e-05, "loss": 0.6187, "mean_token_accuracy": 0.8142566941678524, "num_tokens": 304766931.0, "step": 9549 }, { "entropy": 0.7094953618943691, "epoch": 0.878660847263673, "grad_norm": 0.15366291999816895, "learning_rate": 7.071487717361304e-05, "loss": 0.6924, "mean_token_accuracy": 0.79409234598279, "num_tokens": 304799064.0, "step": 9550 }, { "entropy": 0.7175127118825912, "epoch": 0.8787528536351142, "grad_norm": 0.15633535385131836, "learning_rate": 7.071181034747141e-05, "loss": 0.6977, "mean_token_accuracy": 0.7924710810184479, "num_tokens": 304831003.0, "step": 9551 }, { "entropy": 0.7346137873828411, "epoch": 0.8788448600065555, "grad_norm": 0.15282303094863892, "learning_rate": 7.070874352132978e-05, "loss": 0.7248, "mean_token_accuracy": 0.7809320874512196, "num_tokens": 304862758.0, "step": 9552 }, { "entropy": 0.6817892752587795, "epoch": 0.8789368663779967, "grad_norm": 0.15604519844055176, "learning_rate": 7.070567669518815e-05, "loss": 0.6618, "mean_token_accuracy": 0.7998245432972908, "num_tokens": 304894622.0, "step": 9553 }, { "entropy": 0.723484443500638, "epoch": 0.8790288727494379, "grad_norm": 0.16464875638484955, "learning_rate": 7.070260986904653e-05, "loss": 0.7041, "mean_token_accuracy": 0.7906196415424347, "num_tokens": 304925536.0, "step": 9554 }, { "entropy": 0.697942391037941, "epoch": 0.8791208791208791, "grad_norm": 0.15247201919555664, "learning_rate": 7.069954304290491e-05, "loss": 0.6786, "mean_token_accuracy": 0.7965099066495895, "num_tokens": 304957455.0, "step": 9555 }, { "entropy": 0.6624684957787395, "epoch": 0.8792128854923204, "grad_norm": 0.169123575091362, "learning_rate": 7.069647621676328e-05, "loss": 0.6768, "mean_token_accuracy": 0.7993257828056812, "num_tokens": 304989255.0, "step": 9556 }, { "entropy": 0.6705937888473272, "epoch": 0.8793048918637616, "grad_norm": 0.1642393320798874, "learning_rate": 7.069340939062165e-05, "loss": 0.6844, "mean_token_accuracy": 0.7943196631968021, "num_tokens": 305021235.0, "step": 9557 }, { "entropy": 0.700545059517026, "epoch": 0.8793968982352028, "grad_norm": 0.15919914841651917, "learning_rate": 7.069034256448003e-05, "loss": 0.6855, "mean_token_accuracy": 0.7980202548205853, "num_tokens": 305052778.0, "step": 9558 }, { "entropy": 0.7639635377563536, "epoch": 0.879488904606644, "grad_norm": 0.15614260733127594, "learning_rate": 7.06872757383384e-05, "loss": 0.7606, "mean_token_accuracy": 0.7758842557668686, "num_tokens": 305085434.0, "step": 9559 }, { "entropy": 0.842604722827673, "epoch": 0.8795809109780852, "grad_norm": 0.17533108592033386, "learning_rate": 7.068420891219678e-05, "loss": 0.8526, "mean_token_accuracy": 0.7539642453193665, "num_tokens": 305117143.0, "step": 9560 }, { "entropy": 0.6878068819642067, "epoch": 0.8796729173495265, "grad_norm": 0.14985522627830505, "learning_rate": 7.068114208605514e-05, "loss": 0.672, "mean_token_accuracy": 0.8000341206789017, "num_tokens": 305148829.0, "step": 9561 }, { "entropy": 0.7177100293338299, "epoch": 0.8797649237209677, "grad_norm": 0.16333860158920288, "learning_rate": 7.067807525991353e-05, "loss": 0.686, "mean_token_accuracy": 0.7952856086194515, "num_tokens": 305181026.0, "step": 9562 }, { "entropy": 0.7882575541734695, "epoch": 0.879856930092409, "grad_norm": 0.1619870960712433, "learning_rate": 7.067500843377189e-05, "loss": 0.7757, "mean_token_accuracy": 0.7745972685515881, "num_tokens": 305213107.0, "step": 9563 }, { "entropy": 0.7209370099008083, "epoch": 0.8799489364638501, "grad_norm": 0.14826011657714844, "learning_rate": 7.067194160763026e-05, "loss": 0.7027, "mean_token_accuracy": 0.7890089526772499, "num_tokens": 305245819.0, "step": 9564 }, { "entropy": 0.6584218647330999, "epoch": 0.8800409428352913, "grad_norm": 0.15914234519004822, "learning_rate": 7.066887478148864e-05, "loss": 0.6378, "mean_token_accuracy": 0.8086672201752663, "num_tokens": 305277585.0, "step": 9565 }, { "entropy": 0.711791854351759, "epoch": 0.8801329492067326, "grad_norm": 0.15279118716716766, "learning_rate": 7.066580795534702e-05, "loss": 0.7018, "mean_token_accuracy": 0.7897481620311737, "num_tokens": 305309491.0, "step": 9566 }, { "entropy": 0.6851588087156415, "epoch": 0.8802249555781738, "grad_norm": 0.1519990861415863, "learning_rate": 7.066274112920539e-05, "loss": 0.6698, "mean_token_accuracy": 0.7983748987317085, "num_tokens": 305341455.0, "step": 9567 }, { "entropy": 0.7258566878736019, "epoch": 0.8803169619496151, "grad_norm": 0.15734143555164337, "learning_rate": 7.065967430306376e-05, "loss": 0.7146, "mean_token_accuracy": 0.7904340252280235, "num_tokens": 305372176.0, "step": 9568 }, { "entropy": 0.7794321831315756, "epoch": 0.8804089683210562, "grad_norm": 0.15431247651576996, "learning_rate": 7.065660747692213e-05, "loss": 0.7717, "mean_token_accuracy": 0.7700676396489143, "num_tokens": 305403372.0, "step": 9569 }, { "entropy": 0.7341389786452055, "epoch": 0.8805009746924974, "grad_norm": 0.15281113982200623, "learning_rate": 7.065354065078051e-05, "loss": 0.7194, "mean_token_accuracy": 0.784868448972702, "num_tokens": 305435996.0, "step": 9570 }, { "entropy": 0.6772367209196091, "epoch": 0.8805929810639387, "grad_norm": 0.15415403246879578, "learning_rate": 7.065047382463889e-05, "loss": 0.6655, "mean_token_accuracy": 0.7964773736894131, "num_tokens": 305468496.0, "step": 9571 }, { "entropy": 0.772213576361537, "epoch": 0.8806849874353799, "grad_norm": 0.15304136276245117, "learning_rate": 7.064740699849726e-05, "loss": 0.7689, "mean_token_accuracy": 0.7759356983006, "num_tokens": 305500680.0, "step": 9572 }, { "entropy": 0.6494280062615871, "epoch": 0.8807769938068212, "grad_norm": 0.15364941954612732, "learning_rate": 7.064434017235563e-05, "loss": 0.6396, "mean_token_accuracy": 0.8086218014359474, "num_tokens": 305532418.0, "step": 9573 }, { "entropy": 0.7636018097400665, "epoch": 0.8808690001782623, "grad_norm": 0.1532343626022339, "learning_rate": 7.064127334621401e-05, "loss": 0.7641, "mean_token_accuracy": 0.7767276838421822, "num_tokens": 305563953.0, "step": 9574 }, { "entropy": 0.8379837796092033, "epoch": 0.8809610065497036, "grad_norm": 0.17686010897159576, "learning_rate": 7.063820652007238e-05, "loss": 0.8228, "mean_token_accuracy": 0.7615292631089687, "num_tokens": 305595217.0, "step": 9575 }, { "entropy": 0.7482713218778372, "epoch": 0.8810530129211448, "grad_norm": 0.16134639084339142, "learning_rate": 7.063513969393076e-05, "loss": 0.7419, "mean_token_accuracy": 0.7820266485214233, "num_tokens": 305626796.0, "step": 9576 }, { "entropy": 0.7349460925906897, "epoch": 0.881145019292586, "grad_norm": 0.1599193513393402, "learning_rate": 7.063207286778912e-05, "loss": 0.743, "mean_token_accuracy": 0.7772751338779926, "num_tokens": 305658647.0, "step": 9577 }, { "entropy": 0.6220851093530655, "epoch": 0.8812370256640273, "grad_norm": 0.1495019644498825, "learning_rate": 7.06290060416475e-05, "loss": 0.5915, "mean_token_accuracy": 0.8149818181991577, "num_tokens": 305689594.0, "step": 9578 }, { "entropy": 0.7069403622299433, "epoch": 0.8813290320354684, "grad_norm": 0.15599536895751953, "learning_rate": 7.062593921550587e-05, "loss": 0.7127, "mean_token_accuracy": 0.7884751707315445, "num_tokens": 305720514.0, "step": 9579 }, { "entropy": 0.7973044961690903, "epoch": 0.8814210384069097, "grad_norm": 0.1660662293434143, "learning_rate": 7.062287238936424e-05, "loss": 0.7929, "mean_token_accuracy": 0.7679124400019646, "num_tokens": 305752609.0, "step": 9580 }, { "entropy": 0.6725745461881161, "epoch": 0.8815130447783509, "grad_norm": 0.15989981591701508, "learning_rate": 7.061980556322262e-05, "loss": 0.6736, "mean_token_accuracy": 0.7972501367330551, "num_tokens": 305784120.0, "step": 9581 }, { "entropy": 0.7357601672410965, "epoch": 0.8816050511497922, "grad_norm": 0.15187720954418182, "learning_rate": 7.0616738737081e-05, "loss": 0.7201, "mean_token_accuracy": 0.7890167385339737, "num_tokens": 305816411.0, "step": 9582 }, { "entropy": 0.7976577691733837, "epoch": 0.8816970575212334, "grad_norm": 0.16306032240390778, "learning_rate": 7.061367191093937e-05, "loss": 0.7851, "mean_token_accuracy": 0.769863173365593, "num_tokens": 305848448.0, "step": 9583 }, { "entropy": 0.7200176101177931, "epoch": 0.8817890638926745, "grad_norm": 0.15728668868541718, "learning_rate": 7.061060508479774e-05, "loss": 0.7086, "mean_token_accuracy": 0.7898626551032066, "num_tokens": 305880723.0, "step": 9584 }, { "entropy": 0.6750348499044776, "epoch": 0.8818810702641158, "grad_norm": 0.15257231891155243, "learning_rate": 7.060753825865612e-05, "loss": 0.6685, "mean_token_accuracy": 0.8024095892906189, "num_tokens": 305912753.0, "step": 9585 }, { "entropy": 0.7211212618276477, "epoch": 0.881973076635557, "grad_norm": 0.16150115430355072, "learning_rate": 7.060447143251449e-05, "loss": 0.6981, "mean_token_accuracy": 0.7975541763007641, "num_tokens": 305944994.0, "step": 9586 }, { "entropy": 0.7207027338445187, "epoch": 0.8820650830069983, "grad_norm": 0.15708687901496887, "learning_rate": 7.060140460637287e-05, "loss": 0.7042, "mean_token_accuracy": 0.786486316472292, "num_tokens": 305977762.0, "step": 9587 }, { "entropy": 0.6825596634298563, "epoch": 0.8821570893784395, "grad_norm": 0.15406645834445953, "learning_rate": 7.059833778023124e-05, "loss": 0.6765, "mean_token_accuracy": 0.8008824326097965, "num_tokens": 306009898.0, "step": 9588 }, { "entropy": 0.631110624410212, "epoch": 0.8822490957498806, "grad_norm": 0.15859338641166687, "learning_rate": 7.059527095408962e-05, "loss": 0.6051, "mean_token_accuracy": 0.8166765533387661, "num_tokens": 306041518.0, "step": 9589 }, { "entropy": 0.7579452823847532, "epoch": 0.8823411021213219, "grad_norm": 0.15527045726776123, "learning_rate": 7.059220412794799e-05, "loss": 0.7543, "mean_token_accuracy": 0.7754621207714081, "num_tokens": 306072798.0, "step": 9590 }, { "entropy": 0.6816126480698586, "epoch": 0.8824331084927631, "grad_norm": 0.14849595725536346, "learning_rate": 7.058913730180636e-05, "loss": 0.6508, "mean_token_accuracy": 0.8018495924770832, "num_tokens": 306103540.0, "step": 9591 }, { "entropy": 0.6608305121771991, "epoch": 0.8825251148642044, "grad_norm": 0.15592695772647858, "learning_rate": 7.058607047566474e-05, "loss": 0.6346, "mean_token_accuracy": 0.8111604452133179, "num_tokens": 306135674.0, "step": 9592 }, { "entropy": 0.7069302629679441, "epoch": 0.8826171212356456, "grad_norm": 0.1518353372812271, "learning_rate": 7.058300364952312e-05, "loss": 0.6839, "mean_token_accuracy": 0.7966080754995346, "num_tokens": 306167878.0, "step": 9593 }, { "entropy": 0.5615766393020749, "epoch": 0.8827091276070868, "grad_norm": 0.15556932985782623, "learning_rate": 7.057993682338149e-05, "loss": 0.5397, "mean_token_accuracy": 0.8409388288855553, "num_tokens": 306200468.0, "step": 9594 }, { "entropy": 0.8224303536117077, "epoch": 0.882801133978528, "grad_norm": 0.16242380440235138, "learning_rate": 7.057686999723985e-05, "loss": 0.8171, "mean_token_accuracy": 0.7578083872795105, "num_tokens": 306232299.0, "step": 9595 }, { "entropy": 0.7419270575046539, "epoch": 0.8828931403499692, "grad_norm": 0.15116052329540253, "learning_rate": 7.057380317109824e-05, "loss": 0.7228, "mean_token_accuracy": 0.7841936200857162, "num_tokens": 306264380.0, "step": 9596 }, { "entropy": 0.6420835200697184, "epoch": 0.8829851467214105, "grad_norm": 0.1500396430492401, "learning_rate": 7.057073634495662e-05, "loss": 0.6345, "mean_token_accuracy": 0.8108150362968445, "num_tokens": 306296526.0, "step": 9597 }, { "entropy": 0.6646807929500937, "epoch": 0.8830771530928517, "grad_norm": 0.16234050691127777, "learning_rate": 7.056766951881499e-05, "loss": 0.6606, "mean_token_accuracy": 0.8077064156532288, "num_tokens": 306328974.0, "step": 9598 }, { "entropy": 0.5449506044387817, "epoch": 0.8831691594642929, "grad_norm": 0.1515217423439026, "learning_rate": 7.056460269267335e-05, "loss": 0.5176, "mean_token_accuracy": 0.8450939990580082, "num_tokens": 306361252.0, "step": 9599 }, { "entropy": 0.7388967173174024, "epoch": 0.8832611658357341, "grad_norm": 0.16020016372203827, "learning_rate": 7.056153586653172e-05, "loss": 0.7474, "mean_token_accuracy": 0.7790093123912811, "num_tokens": 306393779.0, "step": 9600 }, { "entropy": 0.5780046246945858, "epoch": 0.8833531722071754, "grad_norm": 0.14695534110069275, "learning_rate": 7.05584690403901e-05, "loss": 0.562, "mean_token_accuracy": 0.8340211138129234, "num_tokens": 306425696.0, "step": 9601 }, { "entropy": 0.7053318284451962, "epoch": 0.8834451785786166, "grad_norm": 0.17010842263698578, "learning_rate": 7.055540221424848e-05, "loss": 0.7127, "mean_token_accuracy": 0.786475881934166, "num_tokens": 306458023.0, "step": 9602 }, { "entropy": 0.7090697921812534, "epoch": 0.8835371849500578, "grad_norm": 0.17311067879199982, "learning_rate": 7.055233538810685e-05, "loss": 0.7047, "mean_token_accuracy": 0.7845826670527458, "num_tokens": 306490241.0, "step": 9603 }, { "entropy": 0.6207144651561975, "epoch": 0.883629191321499, "grad_norm": 0.14848639070987701, "learning_rate": 7.054926856196522e-05, "loss": 0.608, "mean_token_accuracy": 0.8195124082267284, "num_tokens": 306521619.0, "step": 9604 }, { "entropy": 0.7567181400954723, "epoch": 0.8837211976929402, "grad_norm": 0.15678168833255768, "learning_rate": 7.05462017358236e-05, "loss": 0.7598, "mean_token_accuracy": 0.7753489427268505, "num_tokens": 306553935.0, "step": 9605 }, { "entropy": 0.7205708604305983, "epoch": 0.8838132040643815, "grad_norm": 0.15944786369800568, "learning_rate": 7.054313490968197e-05, "loss": 0.723, "mean_token_accuracy": 0.7871533744037151, "num_tokens": 306585324.0, "step": 9606 }, { "entropy": 0.685234347358346, "epoch": 0.8839052104358227, "grad_norm": 0.15606766939163208, "learning_rate": 7.054006808354035e-05, "loss": 0.676, "mean_token_accuracy": 0.7969435527920723, "num_tokens": 306617282.0, "step": 9607 }, { "entropy": 0.7071074079722166, "epoch": 0.883997216807264, "grad_norm": 0.16143502295017242, "learning_rate": 7.053700125739872e-05, "loss": 0.6727, "mean_token_accuracy": 0.7973864190280437, "num_tokens": 306648515.0, "step": 9608 }, { "entropy": 0.6476562339812517, "epoch": 0.8840892231787051, "grad_norm": 0.16689592599868774, "learning_rate": 7.05339344312571e-05, "loss": 0.6442, "mean_token_accuracy": 0.8100879341363907, "num_tokens": 306681283.0, "step": 9609 }, { "entropy": 0.8510579708963633, "epoch": 0.8841812295501463, "grad_norm": 0.1565975844860077, "learning_rate": 7.053086760511547e-05, "loss": 0.8218, "mean_token_accuracy": 0.7536366172134876, "num_tokens": 306713300.0, "step": 9610 }, { "entropy": 0.7068846505135298, "epoch": 0.8842732359215876, "grad_norm": 0.15173284709453583, "learning_rate": 7.052780077897384e-05, "loss": 0.6873, "mean_token_accuracy": 0.7952795773744583, "num_tokens": 306744987.0, "step": 9611 }, { "entropy": 0.7015085322782397, "epoch": 0.8843652422930288, "grad_norm": 0.1513458639383316, "learning_rate": 7.052473395283222e-05, "loss": 0.6731, "mean_token_accuracy": 0.8009830936789513, "num_tokens": 306776767.0, "step": 9612 }, { "entropy": 0.6880677714943886, "epoch": 0.8844572486644701, "grad_norm": 0.15192002058029175, "learning_rate": 7.05216671266906e-05, "loss": 0.6735, "mean_token_accuracy": 0.8005766123533249, "num_tokens": 306808226.0, "step": 9613 }, { "entropy": 0.7348237801343203, "epoch": 0.8845492550359112, "grad_norm": 0.15143539011478424, "learning_rate": 7.051860030054897e-05, "loss": 0.7205, "mean_token_accuracy": 0.7876403294503689, "num_tokens": 306840793.0, "step": 9614 }, { "entropy": 0.8486295025795698, "epoch": 0.8846412614073524, "grad_norm": 0.1617109626531601, "learning_rate": 7.051553347440733e-05, "loss": 0.8454, "mean_token_accuracy": 0.7556461542844772, "num_tokens": 306873217.0, "step": 9615 }, { "entropy": 0.7039809357374907, "epoch": 0.8847332677787937, "grad_norm": 0.15391035377979279, "learning_rate": 7.051246664826572e-05, "loss": 0.6919, "mean_token_accuracy": 0.7946344502270222, "num_tokens": 306905480.0, "step": 9616 }, { "entropy": 0.6885203514248133, "epoch": 0.8848252741502349, "grad_norm": 0.15029747784137726, "learning_rate": 7.050939982212408e-05, "loss": 0.6604, "mean_token_accuracy": 0.8015260472893715, "num_tokens": 306937649.0, "step": 9617 }, { "entropy": 0.7678579147905111, "epoch": 0.8849172805216762, "grad_norm": 0.15394465625286102, "learning_rate": 7.050633299598246e-05, "loss": 0.7411, "mean_token_accuracy": 0.7791832126677036, "num_tokens": 306969296.0, "step": 9618 }, { "entropy": 0.6200787276029587, "epoch": 0.8850092868931173, "grad_norm": 0.14847645163536072, "learning_rate": 7.050326616984083e-05, "loss": 0.6154, "mean_token_accuracy": 0.8171067722141743, "num_tokens": 307001429.0, "step": 9619 }, { "entropy": 0.7037163451313972, "epoch": 0.8851012932645586, "grad_norm": 0.1482899785041809, "learning_rate": 7.050019934369921e-05, "loss": 0.6964, "mean_token_accuracy": 0.7918742038309574, "num_tokens": 307033639.0, "step": 9620 }, { "entropy": 0.6921079633757472, "epoch": 0.8851932996359998, "grad_norm": 0.15904779732227325, "learning_rate": 7.049713251755758e-05, "loss": 0.6755, "mean_token_accuracy": 0.7942922227084637, "num_tokens": 307064550.0, "step": 9621 }, { "entropy": 0.6354828104376793, "epoch": 0.885285306007441, "grad_norm": 0.15782587230205536, "learning_rate": 7.049406569141595e-05, "loss": 0.6261, "mean_token_accuracy": 0.8133354783058167, "num_tokens": 307096193.0, "step": 9622 }, { "entropy": 0.631239041686058, "epoch": 0.8853773123788823, "grad_norm": 0.1499142050743103, "learning_rate": 7.049099886527433e-05, "loss": 0.6183, "mean_token_accuracy": 0.8168279752135277, "num_tokens": 307128426.0, "step": 9623 }, { "entropy": 0.7271452508866787, "epoch": 0.8854693187503234, "grad_norm": 0.15853729844093323, "learning_rate": 7.048793203913271e-05, "loss": 0.7235, "mean_token_accuracy": 0.7892913706600666, "num_tokens": 307160577.0, "step": 9624 }, { "entropy": 0.7904794998466969, "epoch": 0.8855613251217647, "grad_norm": 0.1556849628686905, "learning_rate": 7.048486521299108e-05, "loss": 0.7855, "mean_token_accuracy": 0.7649829909205437, "num_tokens": 307192343.0, "step": 9625 }, { "entropy": 0.6398868421092629, "epoch": 0.8856533314932059, "grad_norm": 0.15467418730258942, "learning_rate": 7.048179838684945e-05, "loss": 0.6325, "mean_token_accuracy": 0.8111378140747547, "num_tokens": 307224596.0, "step": 9626 }, { "entropy": 0.6884300597012043, "epoch": 0.8857453378646472, "grad_norm": 0.15638403594493866, "learning_rate": 7.047873156070782e-05, "loss": 0.6921, "mean_token_accuracy": 0.7944143079221249, "num_tokens": 307257081.0, "step": 9627 }, { "entropy": 0.7966320477426052, "epoch": 0.8858373442360884, "grad_norm": 0.16164684295654297, "learning_rate": 7.047566473456621e-05, "loss": 0.7902, "mean_token_accuracy": 0.7674634791910648, "num_tokens": 307288424.0, "step": 9628 }, { "entropy": 0.6897305082529783, "epoch": 0.8859293506075295, "grad_norm": 0.15129077434539795, "learning_rate": 7.047259790842458e-05, "loss": 0.6624, "mean_token_accuracy": 0.7998327985405922, "num_tokens": 307320449.0, "step": 9629 }, { "entropy": 0.6863480685278773, "epoch": 0.8860213569789708, "grad_norm": 0.16064195334911346, "learning_rate": 7.046953108228295e-05, "loss": 0.6621, "mean_token_accuracy": 0.8018710948526859, "num_tokens": 307351949.0, "step": 9630 }, { "entropy": 0.7443727757781744, "epoch": 0.886113363350412, "grad_norm": 0.15474838018417358, "learning_rate": 7.046646425614132e-05, "loss": 0.7346, "mean_token_accuracy": 0.7842414639890194, "num_tokens": 307383964.0, "step": 9631 }, { "entropy": 0.7420056629925966, "epoch": 0.8862053697218533, "grad_norm": 0.1548931896686554, "learning_rate": 7.04633974299997e-05, "loss": 0.7319, "mean_token_accuracy": 0.783065851777792, "num_tokens": 307416124.0, "step": 9632 }, { "entropy": 0.7689073923975229, "epoch": 0.8862973760932945, "grad_norm": 0.17796577513217926, "learning_rate": 7.046033060385808e-05, "loss": 0.7717, "mean_token_accuracy": 0.7735776305198669, "num_tokens": 307448160.0, "step": 9633 }, { "entropy": 0.7537177801132202, "epoch": 0.8863893824647356, "grad_norm": 0.16050490736961365, "learning_rate": 7.045726377771645e-05, "loss": 0.738, "mean_token_accuracy": 0.7874788492918015, "num_tokens": 307480576.0, "step": 9634 }, { "entropy": 0.6680786870419979, "epoch": 0.8864813888361769, "grad_norm": 0.15357573330402374, "learning_rate": 7.045419695157481e-05, "loss": 0.6459, "mean_token_accuracy": 0.8082058243453503, "num_tokens": 307512767.0, "step": 9635 }, { "entropy": 0.8138674423098564, "epoch": 0.8865733952076181, "grad_norm": 0.157337948679924, "learning_rate": 7.04511301254332e-05, "loss": 0.8035, "mean_token_accuracy": 0.7625872753560543, "num_tokens": 307545086.0, "step": 9636 }, { "entropy": 0.8721104953438044, "epoch": 0.8866654015790594, "grad_norm": 0.15350845456123352, "learning_rate": 7.044806329929156e-05, "loss": 0.8649, "mean_token_accuracy": 0.7445906549692154, "num_tokens": 307576822.0, "step": 9637 }, { "entropy": 0.6852910667657852, "epoch": 0.8867574079505006, "grad_norm": 0.15122373402118683, "learning_rate": 7.044499647314994e-05, "loss": 0.6694, "mean_token_accuracy": 0.8008206076920033, "num_tokens": 307608601.0, "step": 9638 }, { "entropy": 0.7585507407784462, "epoch": 0.8868494143219418, "grad_norm": 0.15271273255348206, "learning_rate": 7.044192964700831e-05, "loss": 0.7423, "mean_token_accuracy": 0.7788259871304035, "num_tokens": 307640378.0, "step": 9639 }, { "entropy": 0.6123691461980343, "epoch": 0.886941420693383, "grad_norm": 0.1540195792913437, "learning_rate": 7.04388628208667e-05, "loss": 0.6186, "mean_token_accuracy": 0.8174866251647472, "num_tokens": 307673100.0, "step": 9640 }, { "entropy": 0.7415809240192175, "epoch": 0.8870334270648242, "grad_norm": 0.1600474715232849, "learning_rate": 7.043579599472506e-05, "loss": 0.7375, "mean_token_accuracy": 0.781391803175211, "num_tokens": 307705302.0, "step": 9641 }, { "entropy": 0.7192567307502031, "epoch": 0.8871254334362655, "grad_norm": 0.15500742197036743, "learning_rate": 7.043272916858343e-05, "loss": 0.6981, "mean_token_accuracy": 0.7894995287060738, "num_tokens": 307736543.0, "step": 9642 }, { "entropy": 0.8774393331259489, "epoch": 0.8872174398077067, "grad_norm": 0.15801529586315155, "learning_rate": 7.042966234244181e-05, "loss": 0.879, "mean_token_accuracy": 0.7401497736573219, "num_tokens": 307768357.0, "step": 9643 }, { "entropy": 0.750929213128984, "epoch": 0.8873094461791479, "grad_norm": 0.15612201392650604, "learning_rate": 7.042659551630019e-05, "loss": 0.7519, "mean_token_accuracy": 0.7809238322079182, "num_tokens": 307800330.0, "step": 9644 }, { "entropy": 0.710002563893795, "epoch": 0.8874014525505891, "grad_norm": 0.1508781611919403, "learning_rate": 7.042352869015856e-05, "loss": 0.697, "mean_token_accuracy": 0.7970291972160339, "num_tokens": 307832344.0, "step": 9645 }, { "entropy": 0.6953284312039614, "epoch": 0.8874934589220304, "grad_norm": 0.15276481211185455, "learning_rate": 7.042046186401693e-05, "loss": 0.6815, "mean_token_accuracy": 0.7960510365664959, "num_tokens": 307864510.0, "step": 9646 }, { "entropy": 0.779976237565279, "epoch": 0.8875854652934716, "grad_norm": 0.16111548244953156, "learning_rate": 7.041739503787531e-05, "loss": 0.7591, "mean_token_accuracy": 0.7786975204944611, "num_tokens": 307896436.0, "step": 9647 }, { "entropy": 0.6979182213544846, "epoch": 0.8876774716649128, "grad_norm": 0.1454891413450241, "learning_rate": 7.041432821173368e-05, "loss": 0.6787, "mean_token_accuracy": 0.7943682707846165, "num_tokens": 307928453.0, "step": 9648 }, { "entropy": 0.8555288389325142, "epoch": 0.887769478036354, "grad_norm": 0.1619478464126587, "learning_rate": 7.041126138559206e-05, "loss": 0.824, "mean_token_accuracy": 0.7568857483565807, "num_tokens": 307959347.0, "step": 9649 }, { "entropy": 0.7843047678470612, "epoch": 0.8878614844077952, "grad_norm": 0.15852880477905273, "learning_rate": 7.040819455945043e-05, "loss": 0.7641, "mean_token_accuracy": 0.7725748494267464, "num_tokens": 307991254.0, "step": 9650 }, { "entropy": 0.6946888603270054, "epoch": 0.8879534907792365, "grad_norm": 0.16466876864433289, "learning_rate": 7.040512773330881e-05, "loss": 0.6824, "mean_token_accuracy": 0.7976789213716984, "num_tokens": 308023699.0, "step": 9651 }, { "entropy": 0.6915777707472444, "epoch": 0.8880454971506777, "grad_norm": 0.15777607262134552, "learning_rate": 7.040206090716718e-05, "loss": 0.6804, "mean_token_accuracy": 0.7980469018220901, "num_tokens": 308054643.0, "step": 9652 }, { "entropy": 0.8185752313584089, "epoch": 0.888137503522119, "grad_norm": 0.16076898574829102, "learning_rate": 7.039899408102554e-05, "loss": 0.8131, "mean_token_accuracy": 0.7611190862953663, "num_tokens": 308086345.0, "step": 9653 }, { "entropy": 0.6776997521519661, "epoch": 0.8882295098935601, "grad_norm": 0.15106405317783356, "learning_rate": 7.039592725488393e-05, "loss": 0.669, "mean_token_accuracy": 0.8023823499679565, "num_tokens": 308117795.0, "step": 9654 }, { "entropy": 0.7409691456705332, "epoch": 0.8883215162650013, "grad_norm": 0.15260465443134308, "learning_rate": 7.03928604287423e-05, "loss": 0.7311, "mean_token_accuracy": 0.7796307131648064, "num_tokens": 308149371.0, "step": 9655 }, { "entropy": 0.7403335925191641, "epoch": 0.8884135226364426, "grad_norm": 0.15359261631965637, "learning_rate": 7.038979360260067e-05, "loss": 0.7314, "mean_token_accuracy": 0.7831679284572601, "num_tokens": 308181211.0, "step": 9656 }, { "entropy": 0.643894228618592, "epoch": 0.8885055290078838, "grad_norm": 0.1439363807439804, "learning_rate": 7.038672677645904e-05, "loss": 0.6393, "mean_token_accuracy": 0.8130439072847366, "num_tokens": 308213541.0, "step": 9657 }, { "entropy": 0.6610963018611073, "epoch": 0.8885975353793251, "grad_norm": 0.1623806208372116, "learning_rate": 7.038365995031741e-05, "loss": 0.6561, "mean_token_accuracy": 0.8034290261566639, "num_tokens": 308245867.0, "step": 9658 }, { "entropy": 0.6358518749475479, "epoch": 0.8886895417507662, "grad_norm": 0.15814737975597382, "learning_rate": 7.038059312417579e-05, "loss": 0.6289, "mean_token_accuracy": 0.8143282979726791, "num_tokens": 308277483.0, "step": 9659 }, { "entropy": 0.7284986805170774, "epoch": 0.8887815481222074, "grad_norm": 0.1522912085056305, "learning_rate": 7.037752629803417e-05, "loss": 0.7362, "mean_token_accuracy": 0.7802562788128853, "num_tokens": 308309678.0, "step": 9660 }, { "entropy": 0.7684119921177626, "epoch": 0.8888735544936487, "grad_norm": 0.16549603641033173, "learning_rate": 7.037445947189254e-05, "loss": 0.7648, "mean_token_accuracy": 0.7730023451149464, "num_tokens": 308340022.0, "step": 9661 }, { "entropy": 0.8047299459576607, "epoch": 0.8889655608650899, "grad_norm": 0.15636329352855682, "learning_rate": 7.037139264575091e-05, "loss": 0.8074, "mean_token_accuracy": 0.7663075886666775, "num_tokens": 308371224.0, "step": 9662 }, { "entropy": 0.7457189299166203, "epoch": 0.8890575672365312, "grad_norm": 0.16062182188034058, "learning_rate": 7.036832581960929e-05, "loss": 0.7475, "mean_token_accuracy": 0.7765879109501839, "num_tokens": 308402151.0, "step": 9663 }, { "entropy": 0.733982166275382, "epoch": 0.8891495736079723, "grad_norm": 0.1596907377243042, "learning_rate": 7.036525899346766e-05, "loss": 0.7347, "mean_token_accuracy": 0.783097505569458, "num_tokens": 308433897.0, "step": 9664 }, { "entropy": 0.6538415336981416, "epoch": 0.8892415799794136, "grad_norm": 0.150006964802742, "learning_rate": 7.036219216732604e-05, "loss": 0.6344, "mean_token_accuracy": 0.8115242794156075, "num_tokens": 308465712.0, "step": 9665 }, { "entropy": 0.7513416139408946, "epoch": 0.8893335863508548, "grad_norm": 0.1560031920671463, "learning_rate": 7.035912534118441e-05, "loss": 0.75, "mean_token_accuracy": 0.7817319631576538, "num_tokens": 308498038.0, "step": 9666 }, { "entropy": 0.6389488037675619, "epoch": 0.889425592722296, "grad_norm": 0.1570833921432495, "learning_rate": 7.035605851504279e-05, "loss": 0.6258, "mean_token_accuracy": 0.811767291277647, "num_tokens": 308530118.0, "step": 9667 }, { "entropy": 0.7172889616340399, "epoch": 0.8895175990937373, "grad_norm": 0.16678012907505035, "learning_rate": 7.035299168890116e-05, "loss": 0.6919, "mean_token_accuracy": 0.7969530299305916, "num_tokens": 308561316.0, "step": 9668 }, { "entropy": 0.8401995971798897, "epoch": 0.8896096054651784, "grad_norm": 0.1594872921705246, "learning_rate": 7.034992486275952e-05, "loss": 0.8227, "mean_token_accuracy": 0.7671616598963737, "num_tokens": 308593980.0, "step": 9669 }, { "entropy": 0.6393571980297565, "epoch": 0.8897016118366197, "grad_norm": 0.15289156138896942, "learning_rate": 7.03468580366179e-05, "loss": 0.6156, "mean_token_accuracy": 0.8200877197086811, "num_tokens": 308625602.0, "step": 9670 }, { "entropy": 0.754255760461092, "epoch": 0.8897936182080609, "grad_norm": 0.15577618777751923, "learning_rate": 7.034379121047629e-05, "loss": 0.7331, "mean_token_accuracy": 0.7813347168266773, "num_tokens": 308657255.0, "step": 9671 }, { "entropy": 0.7062916681170464, "epoch": 0.8898856245795022, "grad_norm": 0.1502193659543991, "learning_rate": 7.034072438433466e-05, "loss": 0.689, "mean_token_accuracy": 0.7964572459459305, "num_tokens": 308689796.0, "step": 9672 }, { "entropy": 0.7181137204170227, "epoch": 0.8899776309509434, "grad_norm": 0.15331952273845673, "learning_rate": 7.033765755819302e-05, "loss": 0.7018, "mean_token_accuracy": 0.7910886146128178, "num_tokens": 308722275.0, "step": 9673 }, { "entropy": 0.7655514925718307, "epoch": 0.8900696373223845, "grad_norm": 0.15565571188926697, "learning_rate": 7.03345907320514e-05, "loss": 0.7558, "mean_token_accuracy": 0.7787880413234234, "num_tokens": 308754930.0, "step": 9674 }, { "entropy": 0.6045652609318495, "epoch": 0.8901616436938258, "grad_norm": 0.15035521984100342, "learning_rate": 7.033152390590979e-05, "loss": 0.5887, "mean_token_accuracy": 0.8217860087752342, "num_tokens": 308787271.0, "step": 9675 }, { "entropy": 0.7893930040299892, "epoch": 0.890253650065267, "grad_norm": 0.1615239828824997, "learning_rate": 7.032845707976815e-05, "loss": 0.8004, "mean_token_accuracy": 0.767118263989687, "num_tokens": 308818650.0, "step": 9676 }, { "entropy": 0.7899424079805613, "epoch": 0.8903456564367083, "grad_norm": 0.15457771718502045, "learning_rate": 7.032539025362652e-05, "loss": 0.7891, "mean_token_accuracy": 0.7674966230988503, "num_tokens": 308851082.0, "step": 9677 }, { "entropy": 0.7123268488794565, "epoch": 0.8904376628081495, "grad_norm": 0.1542898416519165, "learning_rate": 7.03223234274849e-05, "loss": 0.7152, "mean_token_accuracy": 0.7856649607419968, "num_tokens": 308882969.0, "step": 9678 }, { "entropy": 0.671601340174675, "epoch": 0.8905296691795906, "grad_norm": 0.1521022617816925, "learning_rate": 7.031925660134327e-05, "loss": 0.6467, "mean_token_accuracy": 0.8102095723152161, "num_tokens": 308914592.0, "step": 9679 }, { "entropy": 0.7700145319104195, "epoch": 0.8906216755510319, "grad_norm": 0.16368262469768524, "learning_rate": 7.031618977520165e-05, "loss": 0.7614, "mean_token_accuracy": 0.7761921808123589, "num_tokens": 308946621.0, "step": 9680 }, { "entropy": 0.7867386545985937, "epoch": 0.8907136819224731, "grad_norm": 0.15613657236099243, "learning_rate": 7.031312294906002e-05, "loss": 0.7856, "mean_token_accuracy": 0.7718074694275856, "num_tokens": 308978299.0, "step": 9681 }, { "entropy": 0.6076631024479866, "epoch": 0.8908056882939144, "grad_norm": 0.139872744679451, "learning_rate": 7.03100561229184e-05, "loss": 0.5967, "mean_token_accuracy": 0.8183725886046886, "num_tokens": 309010039.0, "step": 9682 }, { "entropy": 0.6448656460270286, "epoch": 0.8908976946653556, "grad_norm": 0.1484212875366211, "learning_rate": 7.030698929677677e-05, "loss": 0.6396, "mean_token_accuracy": 0.8079468868672848, "num_tokens": 309041210.0, "step": 9683 }, { "entropy": 0.6965286415070295, "epoch": 0.8909897010367968, "grad_norm": 0.1567315310239792, "learning_rate": 7.030392247063514e-05, "loss": 0.6912, "mean_token_accuracy": 0.7947283424437046, "num_tokens": 309072755.0, "step": 9684 }, { "entropy": 0.6721262969076633, "epoch": 0.891081707408238, "grad_norm": 0.15393488109111786, "learning_rate": 7.030085564449352e-05, "loss": 0.6546, "mean_token_accuracy": 0.8023935668170452, "num_tokens": 309104482.0, "step": 9685 }, { "entropy": 0.6860969737172127, "epoch": 0.8911737137796792, "grad_norm": 0.14783485233783722, "learning_rate": 7.02977888183519e-05, "loss": 0.6768, "mean_token_accuracy": 0.7961494214832783, "num_tokens": 309136460.0, "step": 9686 }, { "entropy": 0.7602259572595358, "epoch": 0.8912657201511205, "grad_norm": 0.15878857672214508, "learning_rate": 7.029472199221027e-05, "loss": 0.7471, "mean_token_accuracy": 0.7782161384820938, "num_tokens": 309167261.0, "step": 9687 }, { "entropy": 0.82300647161901, "epoch": 0.8913577265225617, "grad_norm": 0.15816228091716766, "learning_rate": 7.029165516606864e-05, "loss": 0.8085, "mean_token_accuracy": 0.7625592947006226, "num_tokens": 309197879.0, "step": 9688 }, { "entropy": 0.7312655746936798, "epoch": 0.8914497328940029, "grad_norm": 0.14812161028385162, "learning_rate": 7.0288588339927e-05, "loss": 0.7205, "mean_token_accuracy": 0.7878422029316425, "num_tokens": 309230505.0, "step": 9689 }, { "entropy": 0.6669285157695413, "epoch": 0.8915417392654441, "grad_norm": 0.15501949191093445, "learning_rate": 7.028552151378539e-05, "loss": 0.653, "mean_token_accuracy": 0.8059894107282162, "num_tokens": 309262588.0, "step": 9690 }, { "entropy": 0.774366999976337, "epoch": 0.8916337456368854, "grad_norm": 0.17113016545772552, "learning_rate": 7.028245468764377e-05, "loss": 0.7782, "mean_token_accuracy": 0.776549905538559, "num_tokens": 309294526.0, "step": 9691 }, { "entropy": 0.7849632147699594, "epoch": 0.8917257520083266, "grad_norm": 0.15285179018974304, "learning_rate": 7.027938786150213e-05, "loss": 0.7714, "mean_token_accuracy": 0.7762327343225479, "num_tokens": 309326443.0, "step": 9692 }, { "entropy": 0.6538647655397654, "epoch": 0.8918177583797678, "grad_norm": 0.1666766107082367, "learning_rate": 7.02763210353605e-05, "loss": 0.6397, "mean_token_accuracy": 0.8115736916661263, "num_tokens": 309358514.0, "step": 9693 }, { "entropy": 0.6936702486127615, "epoch": 0.891909764751209, "grad_norm": 0.16218049824237823, "learning_rate": 7.027325420921888e-05, "loss": 0.6896, "mean_token_accuracy": 0.7987096086144447, "num_tokens": 309390289.0, "step": 9694 }, { "entropy": 0.7407143972814083, "epoch": 0.8920017711226502, "grad_norm": 0.15160223841667175, "learning_rate": 7.027018738307725e-05, "loss": 0.716, "mean_token_accuracy": 0.7893079370260239, "num_tokens": 309422558.0, "step": 9695 }, { "entropy": 0.7109206933528185, "epoch": 0.8920937774940915, "grad_norm": 0.14840839803218842, "learning_rate": 7.026712055693563e-05, "loss": 0.7091, "mean_token_accuracy": 0.793302558362484, "num_tokens": 309454858.0, "step": 9696 }, { "entropy": 0.6923775132745504, "epoch": 0.8921857838655327, "grad_norm": 0.15844149887561798, "learning_rate": 7.0264053730794e-05, "loss": 0.6678, "mean_token_accuracy": 0.799572303891182, "num_tokens": 309487006.0, "step": 9697 }, { "entropy": 0.6767344493418932, "epoch": 0.892277790236974, "grad_norm": 0.1544109731912613, "learning_rate": 7.026098690465238e-05, "loss": 0.6708, "mean_token_accuracy": 0.797864057123661, "num_tokens": 309519351.0, "step": 9698 }, { "entropy": 0.6757818590849638, "epoch": 0.8923697966084151, "grad_norm": 0.155557319521904, "learning_rate": 7.025792007851075e-05, "loss": 0.6642, "mean_token_accuracy": 0.8014401309192181, "num_tokens": 309551049.0, "step": 9699 }, { "entropy": 0.732369152829051, "epoch": 0.8924618029798563, "grad_norm": 0.15993107855319977, "learning_rate": 7.025485325236912e-05, "loss": 0.7014, "mean_token_accuracy": 0.7903265058994293, "num_tokens": 309583335.0, "step": 9700 }, { "entropy": 0.7009381111711264, "epoch": 0.8925538093512976, "grad_norm": 0.15613125264644623, "learning_rate": 7.02517864262275e-05, "loss": 0.689, "mean_token_accuracy": 0.7954860590398312, "num_tokens": 309615426.0, "step": 9701 }, { "entropy": 0.7938085328787565, "epoch": 0.8926458157227388, "grad_norm": 0.16545656323432922, "learning_rate": 7.024871960008588e-05, "loss": 0.802, "mean_token_accuracy": 0.7650130093097687, "num_tokens": 309647163.0, "step": 9702 }, { "entropy": 0.742486952804029, "epoch": 0.8927378220941801, "grad_norm": 0.1516485959291458, "learning_rate": 7.024565277394425e-05, "loss": 0.7277, "mean_token_accuracy": 0.7857805043458939, "num_tokens": 309679229.0, "step": 9703 }, { "entropy": 0.7627192828804255, "epoch": 0.8928298284656212, "grad_norm": 0.173240527510643, "learning_rate": 7.024258594780262e-05, "loss": 0.7486, "mean_token_accuracy": 0.7774785198271275, "num_tokens": 309711683.0, "step": 9704 }, { "entropy": 0.8229615800082684, "epoch": 0.8929218348370624, "grad_norm": 0.15834133327007294, "learning_rate": 7.0239519121661e-05, "loss": 0.8054, "mean_token_accuracy": 0.7608070410788059, "num_tokens": 309742692.0, "step": 9705 }, { "entropy": 0.863924540579319, "epoch": 0.8930138412085037, "grad_norm": 0.16179075837135315, "learning_rate": 7.023645229551937e-05, "loss": 0.8633, "mean_token_accuracy": 0.750846866518259, "num_tokens": 309775143.0, "step": 9706 }, { "entropy": 0.6475413935258985, "epoch": 0.8931058475799449, "grad_norm": 0.16078592836856842, "learning_rate": 7.023338546937775e-05, "loss": 0.6409, "mean_token_accuracy": 0.8031401410698891, "num_tokens": 309806873.0, "step": 9707 }, { "entropy": 0.786225214600563, "epoch": 0.8931978539513862, "grad_norm": 0.15629799664020538, "learning_rate": 7.023031864323612e-05, "loss": 0.7649, "mean_token_accuracy": 0.7725161090493202, "num_tokens": 309838556.0, "step": 9708 }, { "entropy": 0.7441845908761024, "epoch": 0.8932898603228273, "grad_norm": 0.1564975380897522, "learning_rate": 7.02272518170945e-05, "loss": 0.7398, "mean_token_accuracy": 0.7840327546000481, "num_tokens": 309870233.0, "step": 9709 }, { "entropy": 0.773976749740541, "epoch": 0.8933818666942686, "grad_norm": 0.1620330512523651, "learning_rate": 7.022418499095286e-05, "loss": 0.7657, "mean_token_accuracy": 0.7740952782332897, "num_tokens": 309901735.0, "step": 9710 }, { "entropy": 0.7285696119070053, "epoch": 0.8934738730657098, "grad_norm": 0.16926395893096924, "learning_rate": 7.022111816481123e-05, "loss": 0.7164, "mean_token_accuracy": 0.7893508598208427, "num_tokens": 309933674.0, "step": 9711 }, { "entropy": 0.6906839329749346, "epoch": 0.893565879437151, "grad_norm": 0.15170729160308838, "learning_rate": 7.021805133866961e-05, "loss": 0.6695, "mean_token_accuracy": 0.7969261668622494, "num_tokens": 309965300.0, "step": 9712 }, { "entropy": 0.6893171723932028, "epoch": 0.8936578858085923, "grad_norm": 0.15844608843326569, "learning_rate": 7.0214984512528e-05, "loss": 0.6721, "mean_token_accuracy": 0.8009597659111023, "num_tokens": 309997146.0, "step": 9713 }, { "entropy": 0.7376275844871998, "epoch": 0.8937498921800334, "grad_norm": 0.157451331615448, "learning_rate": 7.021191768638636e-05, "loss": 0.7189, "mean_token_accuracy": 0.7831058837473392, "num_tokens": 310029582.0, "step": 9714 }, { "entropy": 0.7229223754256964, "epoch": 0.8938418985514747, "grad_norm": 0.16410456597805023, "learning_rate": 7.020885086024473e-05, "loss": 0.7358, "mean_token_accuracy": 0.7827345654368401, "num_tokens": 310061450.0, "step": 9715 }, { "entropy": 0.7455324344336987, "epoch": 0.8939339049229159, "grad_norm": 0.16147375106811523, "learning_rate": 7.020578403410311e-05, "loss": 0.7386, "mean_token_accuracy": 0.7806043401360512, "num_tokens": 310093784.0, "step": 9716 }, { "entropy": 0.734908202663064, "epoch": 0.8940259112943572, "grad_norm": 0.16121307015419006, "learning_rate": 7.02027172079615e-05, "loss": 0.7307, "mean_token_accuracy": 0.7865401096642017, "num_tokens": 310125479.0, "step": 9717 }, { "entropy": 0.7254662308841944, "epoch": 0.8941179176657984, "grad_norm": 0.16434839367866516, "learning_rate": 7.019965038181986e-05, "loss": 0.721, "mean_token_accuracy": 0.792930644005537, "num_tokens": 310157732.0, "step": 9718 }, { "entropy": 0.6506439801305532, "epoch": 0.8942099240372395, "grad_norm": 0.14761841297149658, "learning_rate": 7.019658355567823e-05, "loss": 0.6479, "mean_token_accuracy": 0.803863599896431, "num_tokens": 310190187.0, "step": 9719 }, { "entropy": 0.6933459471911192, "epoch": 0.8943019304086808, "grad_norm": 0.1621619015932083, "learning_rate": 7.01935167295366e-05, "loss": 0.6873, "mean_token_accuracy": 0.7908600829541683, "num_tokens": 310219906.0, "step": 9720 }, { "entropy": 0.6701205931603909, "epoch": 0.894393936780122, "grad_norm": 0.1533735692501068, "learning_rate": 7.019044990339498e-05, "loss": 0.6653, "mean_token_accuracy": 0.8015193976461887, "num_tokens": 310252212.0, "step": 9721 }, { "entropy": 0.7149121016263962, "epoch": 0.8944859431515633, "grad_norm": 0.14680945873260498, "learning_rate": 7.018738307725336e-05, "loss": 0.7011, "mean_token_accuracy": 0.793262105435133, "num_tokens": 310284149.0, "step": 9722 }, { "entropy": 0.7621957194060087, "epoch": 0.8945779495230045, "grad_norm": 0.15533535182476044, "learning_rate": 7.018431625111173e-05, "loss": 0.746, "mean_token_accuracy": 0.7809430584311485, "num_tokens": 310316286.0, "step": 9723 }, { "entropy": 0.7084170933812857, "epoch": 0.8946699558944456, "grad_norm": 0.1523558348417282, "learning_rate": 7.01812494249701e-05, "loss": 0.7005, "mean_token_accuracy": 0.7889360673725605, "num_tokens": 310348228.0, "step": 9724 }, { "entropy": 0.6464080289006233, "epoch": 0.8947619622658869, "grad_norm": 0.15981796383857727, "learning_rate": 7.017818259882848e-05, "loss": 0.6321, "mean_token_accuracy": 0.8140261173248291, "num_tokens": 310380829.0, "step": 9725 }, { "entropy": 0.7443840745836496, "epoch": 0.8948539686373281, "grad_norm": 0.1542026698589325, "learning_rate": 7.017511577268685e-05, "loss": 0.7342, "mean_token_accuracy": 0.7863458432257175, "num_tokens": 310412856.0, "step": 9726 }, { "entropy": 0.5919651426374912, "epoch": 0.8949459750087694, "grad_norm": 0.15372680127620697, "learning_rate": 7.017204894654523e-05, "loss": 0.5706, "mean_token_accuracy": 0.8285414129495621, "num_tokens": 310444619.0, "step": 9727 }, { "entropy": 0.7046142499893904, "epoch": 0.8950379813802106, "grad_norm": 0.14843183755874634, "learning_rate": 7.01689821204036e-05, "loss": 0.6816, "mean_token_accuracy": 0.7974228486418724, "num_tokens": 310476636.0, "step": 9728 }, { "entropy": 0.7461630403995514, "epoch": 0.8951299877516518, "grad_norm": 0.1592244952917099, "learning_rate": 7.016591529426198e-05, "loss": 0.7458, "mean_token_accuracy": 0.7812934070825577, "num_tokens": 310508940.0, "step": 9729 }, { "entropy": 0.7049547769129276, "epoch": 0.895221994123093, "grad_norm": 0.15638230741024017, "learning_rate": 7.016284846812034e-05, "loss": 0.6929, "mean_token_accuracy": 0.7955847531557083, "num_tokens": 310541132.0, "step": 9730 }, { "entropy": 0.7301756367087364, "epoch": 0.8953140004945342, "grad_norm": 0.15731576085090637, "learning_rate": 7.015978164197871e-05, "loss": 0.7368, "mean_token_accuracy": 0.7872087098658085, "num_tokens": 310572090.0, "step": 9731 }, { "entropy": 0.71028982847929, "epoch": 0.8954060068659755, "grad_norm": 0.15627345442771912, "learning_rate": 7.01567148158371e-05, "loss": 0.7017, "mean_token_accuracy": 0.7907323129475117, "num_tokens": 310604442.0, "step": 9732 }, { "entropy": 0.7490415498614311, "epoch": 0.8954980132374167, "grad_norm": 0.14790017902851105, "learning_rate": 7.015364798969547e-05, "loss": 0.7409, "mean_token_accuracy": 0.7839168235659599, "num_tokens": 310636845.0, "step": 9733 }, { "entropy": 0.7454306595027447, "epoch": 0.8955900196088579, "grad_norm": 0.15182456374168396, "learning_rate": 7.015058116355384e-05, "loss": 0.7399, "mean_token_accuracy": 0.7841071374714375, "num_tokens": 310668385.0, "step": 9734 }, { "entropy": 0.7743997294455767, "epoch": 0.8956820259802991, "grad_norm": 0.14572659134864807, "learning_rate": 7.014751433741221e-05, "loss": 0.7662, "mean_token_accuracy": 0.7715252749621868, "num_tokens": 310700773.0, "step": 9735 }, { "entropy": 0.7429249472916126, "epoch": 0.8957740323517404, "grad_norm": 0.16099292039871216, "learning_rate": 7.014444751127059e-05, "loss": 0.7288, "mean_token_accuracy": 0.7899978458881378, "num_tokens": 310732956.0, "step": 9736 }, { "entropy": 0.6262855222448707, "epoch": 0.8958660387231816, "grad_norm": 0.14752885699272156, "learning_rate": 7.014138068512896e-05, "loss": 0.6191, "mean_token_accuracy": 0.8102495074272156, "num_tokens": 310765203.0, "step": 9737 }, { "entropy": 0.6266257651150227, "epoch": 0.8959580450946228, "grad_norm": 0.15453769266605377, "learning_rate": 7.013831385898734e-05, "loss": 0.6204, "mean_token_accuracy": 0.8117399401962757, "num_tokens": 310796769.0, "step": 9738 }, { "entropy": 0.7293918682262301, "epoch": 0.896050051466064, "grad_norm": 0.16430437564849854, "learning_rate": 7.013524703284571e-05, "loss": 0.724, "mean_token_accuracy": 0.7888215221464634, "num_tokens": 310828562.0, "step": 9739 }, { "entropy": 0.729425510391593, "epoch": 0.8961420578375052, "grad_norm": 0.16010093688964844, "learning_rate": 7.013218020670409e-05, "loss": 0.722, "mean_token_accuracy": 0.7841552682220936, "num_tokens": 310860021.0, "step": 9740 }, { "entropy": 0.7023179419338703, "epoch": 0.8962340642089465, "grad_norm": 0.16280686855316162, "learning_rate": 7.012911338056246e-05, "loss": 0.6983, "mean_token_accuracy": 0.7929897345602512, "num_tokens": 310892789.0, "step": 9741 }, { "entropy": 0.6688303053379059, "epoch": 0.8963260705803877, "grad_norm": 0.15089653432369232, "learning_rate": 7.012604655442083e-05, "loss": 0.6606, "mean_token_accuracy": 0.8056538589298725, "num_tokens": 310924535.0, "step": 9742 }, { "entropy": 0.6134938094764948, "epoch": 0.896418076951829, "grad_norm": 0.14048050343990326, "learning_rate": 7.012297972827921e-05, "loss": 0.5918, "mean_token_accuracy": 0.817150890827179, "num_tokens": 310956434.0, "step": 9743 }, { "entropy": 0.6552703473716974, "epoch": 0.8965100833232701, "grad_norm": 0.1549362689256668, "learning_rate": 7.011991290213759e-05, "loss": 0.6462, "mean_token_accuracy": 0.8065964467823505, "num_tokens": 310987645.0, "step": 9744 }, { "entropy": 0.7720081247389317, "epoch": 0.8966020896947113, "grad_norm": 0.1624019742012024, "learning_rate": 7.011684607599596e-05, "loss": 0.7734, "mean_token_accuracy": 0.7732260227203369, "num_tokens": 311018703.0, "step": 9745 }, { "entropy": 0.7445423752069473, "epoch": 0.8966940960661526, "grad_norm": 0.15188178420066833, "learning_rate": 7.011377924985432e-05, "loss": 0.7359, "mean_token_accuracy": 0.7817879542708397, "num_tokens": 311050517.0, "step": 9746 }, { "entropy": 0.7473039664328098, "epoch": 0.8967861024375938, "grad_norm": 0.153280109167099, "learning_rate": 7.011071242371269e-05, "loss": 0.7395, "mean_token_accuracy": 0.783237561583519, "num_tokens": 311082959.0, "step": 9747 }, { "entropy": 0.7875000387430191, "epoch": 0.8968781088090351, "grad_norm": 0.16047151386737823, "learning_rate": 7.010764559757109e-05, "loss": 0.767, "mean_token_accuracy": 0.776949055492878, "num_tokens": 311113927.0, "step": 9748 }, { "entropy": 0.612736240029335, "epoch": 0.8969701151804762, "grad_norm": 0.162144273519516, "learning_rate": 7.010457877142946e-05, "loss": 0.5987, "mean_token_accuracy": 0.8213411867618561, "num_tokens": 311145636.0, "step": 9749 }, { "entropy": 0.7511744797229767, "epoch": 0.8970621215519174, "grad_norm": 0.15910568833351135, "learning_rate": 7.010151194528782e-05, "loss": 0.7437, "mean_token_accuracy": 0.7773890271782875, "num_tokens": 311178202.0, "step": 9750 }, { "entropy": 0.7898722123354673, "epoch": 0.8971541279233587, "grad_norm": 0.16849593818187714, "learning_rate": 7.009844511914619e-05, "loss": 0.7845, "mean_token_accuracy": 0.7724143080413342, "num_tokens": 311210095.0, "step": 9751 }, { "entropy": 0.8026852607727051, "epoch": 0.8972461342947999, "grad_norm": 0.1586998999118805, "learning_rate": 7.009537829300457e-05, "loss": 0.7859, "mean_token_accuracy": 0.7673180811107159, "num_tokens": 311242403.0, "step": 9752 }, { "entropy": 0.7365549225360155, "epoch": 0.8973381406662412, "grad_norm": 0.15504398941993713, "learning_rate": 7.009231146686295e-05, "loss": 0.708, "mean_token_accuracy": 0.7883164882659912, "num_tokens": 311274587.0, "step": 9753 }, { "entropy": 0.7108295187354088, "epoch": 0.8974301470376823, "grad_norm": 0.1589454561471939, "learning_rate": 7.008924464072132e-05, "loss": 0.685, "mean_token_accuracy": 0.7934074178338051, "num_tokens": 311305470.0, "step": 9754 }, { "entropy": 0.7785720536485314, "epoch": 0.8975221534091236, "grad_norm": 0.15640532970428467, "learning_rate": 7.008617781457969e-05, "loss": 0.7811, "mean_token_accuracy": 0.773921512067318, "num_tokens": 311337920.0, "step": 9755 }, { "entropy": 0.6715652821585536, "epoch": 0.8976141597805648, "grad_norm": 0.1498286873102188, "learning_rate": 7.008311098843807e-05, "loss": 0.6603, "mean_token_accuracy": 0.8060934692621231, "num_tokens": 311369668.0, "step": 9756 }, { "entropy": 0.7154117226600647, "epoch": 0.897706166152006, "grad_norm": 0.15789103507995605, "learning_rate": 7.008004416229644e-05, "loss": 0.7015, "mean_token_accuracy": 0.7950894124805927, "num_tokens": 311402305.0, "step": 9757 }, { "entropy": 0.8201962653547525, "epoch": 0.8977981725234473, "grad_norm": 0.16052629053592682, "learning_rate": 7.007697733615482e-05, "loss": 0.8304, "mean_token_accuracy": 0.7590490020811558, "num_tokens": 311434954.0, "step": 9758 }, { "entropy": 0.815439485013485, "epoch": 0.8978901788948884, "grad_norm": 0.15913765132427216, "learning_rate": 7.007391051001319e-05, "loss": 0.8204, "mean_token_accuracy": 0.7591370642185211, "num_tokens": 311466374.0, "step": 9759 }, { "entropy": 0.7482439130544662, "epoch": 0.8979821852663297, "grad_norm": 0.1558789610862732, "learning_rate": 7.007084368387157e-05, "loss": 0.7387, "mean_token_accuracy": 0.7842269204556942, "num_tokens": 311499142.0, "step": 9760 }, { "entropy": 0.655074667185545, "epoch": 0.8980741916377709, "grad_norm": 0.14644883573055267, "learning_rate": 7.006777685772994e-05, "loss": 0.6333, "mean_token_accuracy": 0.8123593628406525, "num_tokens": 311530691.0, "step": 9761 }, { "entropy": 0.7210860699415207, "epoch": 0.8981661980092122, "grad_norm": 0.15433555841445923, "learning_rate": 7.00647100315883e-05, "loss": 0.7118, "mean_token_accuracy": 0.788340013474226, "num_tokens": 311563015.0, "step": 9762 }, { "entropy": 0.7040946641936898, "epoch": 0.8982582043806534, "grad_norm": 0.15444137156009674, "learning_rate": 7.006164320544669e-05, "loss": 0.6759, "mean_token_accuracy": 0.7983924373984337, "num_tokens": 311594974.0, "step": 9763 }, { "entropy": 0.7302393466234207, "epoch": 0.8983502107520945, "grad_norm": 0.15846437215805054, "learning_rate": 7.005857637930507e-05, "loss": 0.7137, "mean_token_accuracy": 0.7890910655260086, "num_tokens": 311627458.0, "step": 9764 }, { "entropy": 0.6590369679033756, "epoch": 0.8984422171235358, "grad_norm": 0.14430320262908936, "learning_rate": 7.005550955316344e-05, "loss": 0.6379, "mean_token_accuracy": 0.8080693148076534, "num_tokens": 311659688.0, "step": 9765 }, { "entropy": 0.7413441371172667, "epoch": 0.898534223494977, "grad_norm": 0.14801038801670074, "learning_rate": 7.00524427270218e-05, "loss": 0.7236, "mean_token_accuracy": 0.7884866632521152, "num_tokens": 311692010.0, "step": 9766 }, { "entropy": 0.629822576418519, "epoch": 0.8986262298664183, "grad_norm": 0.1455378532409668, "learning_rate": 7.004937590088019e-05, "loss": 0.619, "mean_token_accuracy": 0.8130967542529106, "num_tokens": 311724003.0, "step": 9767 }, { "entropy": 0.6452059149742126, "epoch": 0.8987182362378595, "grad_norm": 0.15701407194137573, "learning_rate": 7.004630907473855e-05, "loss": 0.6288, "mean_token_accuracy": 0.8120154365897179, "num_tokens": 311756676.0, "step": 9768 }, { "entropy": 0.7190279345959425, "epoch": 0.8988102426093006, "grad_norm": 0.15230204164981842, "learning_rate": 7.004324224859694e-05, "loss": 0.7144, "mean_token_accuracy": 0.7880436964333057, "num_tokens": 311788056.0, "step": 9769 }, { "entropy": 0.7450856510549784, "epoch": 0.8989022489807419, "grad_norm": 0.15815109014511108, "learning_rate": 7.00401754224553e-05, "loss": 0.7435, "mean_token_accuracy": 0.783076073974371, "num_tokens": 311820108.0, "step": 9770 }, { "entropy": 0.7825587298721075, "epoch": 0.8989942553521831, "grad_norm": 0.16036280989646912, "learning_rate": 7.003710859631368e-05, "loss": 0.7701, "mean_token_accuracy": 0.7700859978795052, "num_tokens": 311851805.0, "step": 9771 }, { "entropy": 0.7319088838994503, "epoch": 0.8990862617236244, "grad_norm": 0.16398406028747559, "learning_rate": 7.003404177017205e-05, "loss": 0.7311, "mean_token_accuracy": 0.7801793999969959, "num_tokens": 311884199.0, "step": 9772 }, { "entropy": 0.7769899535924196, "epoch": 0.8991782680950656, "grad_norm": 0.16605359315872192, "learning_rate": 7.003097494403042e-05, "loss": 0.7743, "mean_token_accuracy": 0.7745270244777203, "num_tokens": 311914683.0, "step": 9773 }, { "entropy": 0.6506979689002037, "epoch": 0.8992702744665068, "grad_norm": 0.14960184693336487, "learning_rate": 7.00279081178888e-05, "loss": 0.6397, "mean_token_accuracy": 0.8094101101160049, "num_tokens": 311947027.0, "step": 9774 }, { "entropy": 0.6745307296514511, "epoch": 0.899362280837948, "grad_norm": 0.15842914581298828, "learning_rate": 7.002484129174718e-05, "loss": 0.6541, "mean_token_accuracy": 0.805201031267643, "num_tokens": 311978365.0, "step": 9775 }, { "entropy": 0.6936991307884455, "epoch": 0.8994542872093892, "grad_norm": 0.16436250507831573, "learning_rate": 7.002177446560555e-05, "loss": 0.696, "mean_token_accuracy": 0.7945244126021862, "num_tokens": 312010449.0, "step": 9776 }, { "entropy": 0.6627129632979631, "epoch": 0.8995462935808305, "grad_norm": 0.15756377577781677, "learning_rate": 7.001870763946392e-05, "loss": 0.6718, "mean_token_accuracy": 0.7990637272596359, "num_tokens": 312041869.0, "step": 9777 }, { "entropy": 0.7327678613364697, "epoch": 0.8996382999522717, "grad_norm": 0.160724475979805, "learning_rate": 7.001564081332229e-05, "loss": 0.7223, "mean_token_accuracy": 0.7868462279438972, "num_tokens": 312074120.0, "step": 9778 }, { "entropy": 0.7500945702195168, "epoch": 0.8997303063237129, "grad_norm": 0.1520105004310608, "learning_rate": 7.001257398718067e-05, "loss": 0.7442, "mean_token_accuracy": 0.7810527011752129, "num_tokens": 312106380.0, "step": 9779 }, { "entropy": 0.6477057933807373, "epoch": 0.8998223126951541, "grad_norm": 0.15816226601600647, "learning_rate": 7.000950716103905e-05, "loss": 0.6332, "mean_token_accuracy": 0.8058095760643482, "num_tokens": 312138353.0, "step": 9780 }, { "entropy": 0.776277968659997, "epoch": 0.8999143190665954, "grad_norm": 0.16119402647018433, "learning_rate": 7.000644033489742e-05, "loss": 0.7653, "mean_token_accuracy": 0.7704412788152695, "num_tokens": 312170640.0, "step": 9781 }, { "entropy": 0.7974539082497358, "epoch": 0.9000063254380366, "grad_norm": 0.15462848544120789, "learning_rate": 7.000337350875579e-05, "loss": 0.7738, "mean_token_accuracy": 0.7724439986050129, "num_tokens": 312203184.0, "step": 9782 }, { "entropy": 0.7750661857426167, "epoch": 0.9000983318094778, "grad_norm": 0.14983734488487244, "learning_rate": 7.000030668261417e-05, "loss": 0.7488, "mean_token_accuracy": 0.7768608294427395, "num_tokens": 312235086.0, "step": 9783 }, { "entropy": 0.8131045922636986, "epoch": 0.900190338180919, "grad_norm": 0.15743198990821838, "learning_rate": 6.999723985647253e-05, "loss": 0.7858, "mean_token_accuracy": 0.7686615660786629, "num_tokens": 312266360.0, "step": 9784 }, { "entropy": 0.5807728487998247, "epoch": 0.9002823445523602, "grad_norm": 0.14609964191913605, "learning_rate": 6.999417303033092e-05, "loss": 0.5671, "mean_token_accuracy": 0.8288491927087307, "num_tokens": 312298178.0, "step": 9785 }, { "entropy": 0.6535271164029837, "epoch": 0.9003743509238015, "grad_norm": 0.15155813097953796, "learning_rate": 6.999110620418928e-05, "loss": 0.649, "mean_token_accuracy": 0.8075745217502117, "num_tokens": 312329880.0, "step": 9786 }, { "entropy": 0.7291507609188557, "epoch": 0.9004663572952427, "grad_norm": 0.15699797868728638, "learning_rate": 6.998803937804767e-05, "loss": 0.7096, "mean_token_accuracy": 0.792345691472292, "num_tokens": 312362351.0, "step": 9787 }, { "entropy": 0.6720915921032429, "epoch": 0.900558363666684, "grad_norm": 0.1570935845375061, "learning_rate": 6.998497255190603e-05, "loss": 0.6651, "mean_token_accuracy": 0.8029627352952957, "num_tokens": 312394630.0, "step": 9788 }, { "entropy": 0.6465042699128389, "epoch": 0.9006503700381251, "grad_norm": 0.1733008474111557, "learning_rate": 6.99819057257644e-05, "loss": 0.6292, "mean_token_accuracy": 0.812382772564888, "num_tokens": 312425805.0, "step": 9789 }, { "entropy": 0.5883707981556654, "epoch": 0.9007423764095663, "grad_norm": 0.15316803753376007, "learning_rate": 6.997883889962278e-05, "loss": 0.5572, "mean_token_accuracy": 0.83474525436759, "num_tokens": 312458037.0, "step": 9790 }, { "entropy": 0.6612536823377013, "epoch": 0.9008343827810076, "grad_norm": 0.15339699387550354, "learning_rate": 6.997577207348116e-05, "loss": 0.658, "mean_token_accuracy": 0.8016945905983448, "num_tokens": 312489392.0, "step": 9791 }, { "entropy": 0.6629131333902478, "epoch": 0.9009263891524488, "grad_norm": 0.16087733209133148, "learning_rate": 6.997270524733953e-05, "loss": 0.6499, "mean_token_accuracy": 0.806018091738224, "num_tokens": 312521759.0, "step": 9792 }, { "entropy": 0.7252996694296598, "epoch": 0.9010183955238901, "grad_norm": 0.16281099617481232, "learning_rate": 6.99696384211979e-05, "loss": 0.7238, "mean_token_accuracy": 0.7881408557295799, "num_tokens": 312553615.0, "step": 9793 }, { "entropy": 0.6771484483033419, "epoch": 0.9011104018953312, "grad_norm": 0.1725471466779709, "learning_rate": 6.996657159505628e-05, "loss": 0.676, "mean_token_accuracy": 0.8005300164222717, "num_tokens": 312585859.0, "step": 9794 }, { "entropy": 0.6295735482126474, "epoch": 0.9012024082667724, "grad_norm": 0.14799141883850098, "learning_rate": 6.996350476891466e-05, "loss": 0.6131, "mean_token_accuracy": 0.8164939843118191, "num_tokens": 312618247.0, "step": 9795 }, { "entropy": 0.7400970757007599, "epoch": 0.9012944146382137, "grad_norm": 0.15446551144123077, "learning_rate": 6.996043794277303e-05, "loss": 0.7329, "mean_token_accuracy": 0.7860733978450298, "num_tokens": 312650316.0, "step": 9796 }, { "entropy": 0.6991653218865395, "epoch": 0.9013864210096549, "grad_norm": 0.15732482075691223, "learning_rate": 6.99573711166314e-05, "loss": 0.6703, "mean_token_accuracy": 0.8016501441597939, "num_tokens": 312682133.0, "step": 9797 }, { "entropy": 0.7175726126879454, "epoch": 0.9014784273810962, "grad_norm": 0.1599174588918686, "learning_rate": 6.995430429048978e-05, "loss": 0.7128, "mean_token_accuracy": 0.7875833995640278, "num_tokens": 312714815.0, "step": 9798 }, { "entropy": 0.6470885593444109, "epoch": 0.9015704337525373, "grad_norm": 0.15912048518657684, "learning_rate": 6.995123746434815e-05, "loss": 0.644, "mean_token_accuracy": 0.8081750795245171, "num_tokens": 312747105.0, "step": 9799 }, { "entropy": 0.6245025247335434, "epoch": 0.9016624401239786, "grad_norm": 0.15743839740753174, "learning_rate": 6.994817063820653e-05, "loss": 0.6203, "mean_token_accuracy": 0.8138361908495426, "num_tokens": 312779253.0, "step": 9800 }, { "entropy": 0.6972022131085396, "epoch": 0.9017544464954198, "grad_norm": 0.1532084345817566, "learning_rate": 6.99451038120649e-05, "loss": 0.6957, "mean_token_accuracy": 0.7960177324712276, "num_tokens": 312811245.0, "step": 9801 }, { "entropy": 0.6872608549892902, "epoch": 0.901846452866861, "grad_norm": 0.15582983195781708, "learning_rate": 6.994203698592328e-05, "loss": 0.6725, "mean_token_accuracy": 0.8043621443212032, "num_tokens": 312843394.0, "step": 9802 }, { "entropy": 0.7419478930532932, "epoch": 0.9019384592383023, "grad_norm": 0.16141456365585327, "learning_rate": 6.993897015978165e-05, "loss": 0.7433, "mean_token_accuracy": 0.7835108824074268, "num_tokens": 312875048.0, "step": 9803 }, { "entropy": 0.7473692037165165, "epoch": 0.9020304656097434, "grad_norm": 0.14331267774105072, "learning_rate": 6.993590333364001e-05, "loss": 0.7292, "mean_token_accuracy": 0.7796697542071342, "num_tokens": 312906807.0, "step": 9804 }, { "entropy": 0.7191784307360649, "epoch": 0.9021224719811847, "grad_norm": 0.152790829539299, "learning_rate": 6.99328365074984e-05, "loss": 0.7207, "mean_token_accuracy": 0.7888144962489605, "num_tokens": 312939246.0, "step": 9805 }, { "entropy": 0.8391008079051971, "epoch": 0.9022144783526259, "grad_norm": 0.15501053631305695, "learning_rate": 6.992976968135678e-05, "loss": 0.8304, "mean_token_accuracy": 0.7601708620786667, "num_tokens": 312971301.0, "step": 9806 }, { "entropy": 0.6553949918597937, "epoch": 0.9023064847240672, "grad_norm": 0.1474887728691101, "learning_rate": 6.992670285521514e-05, "loss": 0.6344, "mean_token_accuracy": 0.8092664740979671, "num_tokens": 313003646.0, "step": 9807 }, { "entropy": 0.7481492627412081, "epoch": 0.9023984910955084, "grad_norm": 0.16327811777591705, "learning_rate": 6.992363602907351e-05, "loss": 0.7432, "mean_token_accuracy": 0.7837705723941326, "num_tokens": 313035179.0, "step": 9808 }, { "entropy": 0.6252400306984782, "epoch": 0.9024904974669495, "grad_norm": 0.14379404485225677, "learning_rate": 6.992056920293188e-05, "loss": 0.5895, "mean_token_accuracy": 0.8220630213618279, "num_tokens": 313067182.0, "step": 9809 }, { "entropy": 0.6840851828455925, "epoch": 0.9025825038383908, "grad_norm": 0.15334004163742065, "learning_rate": 6.991750237679026e-05, "loss": 0.664, "mean_token_accuracy": 0.8028981685638428, "num_tokens": 313098989.0, "step": 9810 }, { "entropy": 0.6761615984141827, "epoch": 0.902674510209832, "grad_norm": 0.15886333584785461, "learning_rate": 6.991443555064864e-05, "loss": 0.6617, "mean_token_accuracy": 0.8001260198652744, "num_tokens": 313131130.0, "step": 9811 }, { "entropy": 0.7350510582327843, "epoch": 0.9027665165812733, "grad_norm": 0.16361670196056366, "learning_rate": 6.991136872450701e-05, "loss": 0.7398, "mean_token_accuracy": 0.7817340828478336, "num_tokens": 313162607.0, "step": 9812 }, { "entropy": 0.7427537720650434, "epoch": 0.9028585229527145, "grad_norm": 0.15304584801197052, "learning_rate": 6.990830189836538e-05, "loss": 0.7334, "mean_token_accuracy": 0.7836622074246407, "num_tokens": 313194621.0, "step": 9813 }, { "entropy": 0.6531521026045084, "epoch": 0.9029505293241556, "grad_norm": 0.15353186428546906, "learning_rate": 6.990523507222376e-05, "loss": 0.6472, "mean_token_accuracy": 0.8031473755836487, "num_tokens": 313225453.0, "step": 9814 }, { "entropy": 0.607645879033953, "epoch": 0.9030425356955969, "grad_norm": 0.14837847650051117, "learning_rate": 6.990216824608213e-05, "loss": 0.5902, "mean_token_accuracy": 0.8241151012480259, "num_tokens": 313257586.0, "step": 9815 }, { "entropy": 0.8098444268107414, "epoch": 0.9031345420670381, "grad_norm": 0.1632319986820221, "learning_rate": 6.989910141994051e-05, "loss": 0.8093, "mean_token_accuracy": 0.7615335360169411, "num_tokens": 313290234.0, "step": 9816 }, { "entropy": 0.7256257403641939, "epoch": 0.9032265484384794, "grad_norm": 0.1497650295495987, "learning_rate": 6.989603459379888e-05, "loss": 0.7246, "mean_token_accuracy": 0.7849978767335415, "num_tokens": 313322354.0, "step": 9817 }, { "entropy": 0.6722328960895538, "epoch": 0.9033185548099206, "grad_norm": 0.15327788889408112, "learning_rate": 6.989296776765726e-05, "loss": 0.6553, "mean_token_accuracy": 0.8070054352283478, "num_tokens": 313354224.0, "step": 9818 }, { "entropy": 0.7043386250734329, "epoch": 0.9034105611813618, "grad_norm": 0.16479474306106567, "learning_rate": 6.988990094151563e-05, "loss": 0.6931, "mean_token_accuracy": 0.7894992344081402, "num_tokens": 313385581.0, "step": 9819 }, { "entropy": 0.6068550273776054, "epoch": 0.903502567552803, "grad_norm": 0.14737345278263092, "learning_rate": 6.9886834115374e-05, "loss": 0.5975, "mean_token_accuracy": 0.8187743425369263, "num_tokens": 313418144.0, "step": 9820 }, { "entropy": 0.7568378485739231, "epoch": 0.9035945739242442, "grad_norm": 0.16324695944786072, "learning_rate": 6.988376728923238e-05, "loss": 0.7385, "mean_token_accuracy": 0.7820223942399025, "num_tokens": 313450364.0, "step": 9821 }, { "entropy": 0.7064705528318882, "epoch": 0.9036865802956855, "grad_norm": 0.1449199765920639, "learning_rate": 6.988070046309076e-05, "loss": 0.6922, "mean_token_accuracy": 0.795671783387661, "num_tokens": 313482466.0, "step": 9822 }, { "entropy": 0.7375322915613651, "epoch": 0.9037785866671267, "grad_norm": 0.15684305131435394, "learning_rate": 6.987763363694913e-05, "loss": 0.7161, "mean_token_accuracy": 0.7874334454536438, "num_tokens": 313514436.0, "step": 9823 }, { "entropy": 0.6678204871714115, "epoch": 0.9038705930385679, "grad_norm": 0.15447697043418884, "learning_rate": 6.98745668108075e-05, "loss": 0.6413, "mean_token_accuracy": 0.8077951297163963, "num_tokens": 313546445.0, "step": 9824 }, { "entropy": 0.680232772603631, "epoch": 0.9039625994100091, "grad_norm": 0.15950535237789154, "learning_rate": 6.987149998466587e-05, "loss": 0.654, "mean_token_accuracy": 0.805111538618803, "num_tokens": 313578221.0, "step": 9825 }, { "entropy": 0.6654059663414955, "epoch": 0.9040546057814504, "grad_norm": 0.15601997077465057, "learning_rate": 6.986843315852424e-05, "loss": 0.661, "mean_token_accuracy": 0.8031200058758259, "num_tokens": 313610267.0, "step": 9826 }, { "entropy": 0.7716039847582579, "epoch": 0.9041466121528916, "grad_norm": 0.15488244593143463, "learning_rate": 6.986536633238262e-05, "loss": 0.7729, "mean_token_accuracy": 0.7733152210712433, "num_tokens": 313642445.0, "step": 9827 }, { "entropy": 0.7857575621455908, "epoch": 0.9042386185243328, "grad_norm": 0.1599627435207367, "learning_rate": 6.986229950624099e-05, "loss": 0.7726, "mean_token_accuracy": 0.7767398208379745, "num_tokens": 313674039.0, "step": 9828 }, { "entropy": 0.7677183151245117, "epoch": 0.904330624895774, "grad_norm": 0.1578005999326706, "learning_rate": 6.985923268009937e-05, "loss": 0.7502, "mean_token_accuracy": 0.7838185988366604, "num_tokens": 313706567.0, "step": 9829 }, { "entropy": 0.6432377453893423, "epoch": 0.9044226312672152, "grad_norm": 0.1565162092447281, "learning_rate": 6.985616585395774e-05, "loss": 0.6294, "mean_token_accuracy": 0.8118269480764866, "num_tokens": 313738660.0, "step": 9830 }, { "entropy": 0.8904267698526382, "epoch": 0.9045146376386565, "grad_norm": 0.1676774024963379, "learning_rate": 6.985309902781611e-05, "loss": 0.8943, "mean_token_accuracy": 0.7428970113396645, "num_tokens": 313770304.0, "step": 9831 }, { "entropy": 0.6594960726797581, "epoch": 0.9046066440100977, "grad_norm": 0.15930035710334778, "learning_rate": 6.985003220167449e-05, "loss": 0.6535, "mean_token_accuracy": 0.8064328283071518, "num_tokens": 313802441.0, "step": 9832 }, { "entropy": 0.6588748693466187, "epoch": 0.904698650381539, "grad_norm": 0.15119968354701996, "learning_rate": 6.984696537553287e-05, "loss": 0.635, "mean_token_accuracy": 0.809274435043335, "num_tokens": 313834461.0, "step": 9833 }, { "entropy": 0.7757204324007034, "epoch": 0.9047906567529801, "grad_norm": 0.16427789628505707, "learning_rate": 6.984389854939124e-05, "loss": 0.7457, "mean_token_accuracy": 0.7782172560691833, "num_tokens": 313865772.0, "step": 9834 }, { "entropy": 0.7172437068074942, "epoch": 0.9048826631244213, "grad_norm": 0.1589546650648117, "learning_rate": 6.984083172324961e-05, "loss": 0.7024, "mean_token_accuracy": 0.795226190239191, "num_tokens": 313897738.0, "step": 9835 }, { "entropy": 0.7014139154925942, "epoch": 0.9049746694958626, "grad_norm": 0.1567389965057373, "learning_rate": 6.983776489710799e-05, "loss": 0.6927, "mean_token_accuracy": 0.7946244217455387, "num_tokens": 313930135.0, "step": 9836 }, { "entropy": 0.8073681280948222, "epoch": 0.9050666758673038, "grad_norm": 0.16256089508533478, "learning_rate": 6.983469807096637e-05, "loss": 0.805, "mean_token_accuracy": 0.7723867669701576, "num_tokens": 313961878.0, "step": 9837 }, { "entropy": 0.6758123897016048, "epoch": 0.9051586822387451, "grad_norm": 0.14744770526885986, "learning_rate": 6.983163124482474e-05, "loss": 0.6657, "mean_token_accuracy": 0.8023252449929714, "num_tokens": 313994052.0, "step": 9838 }, { "entropy": 0.6766122914850712, "epoch": 0.9052506886101862, "grad_norm": 0.1522417962551117, "learning_rate": 6.98285644186831e-05, "loss": 0.6679, "mean_token_accuracy": 0.8034966364502907, "num_tokens": 314026061.0, "step": 9839 }, { "entropy": 0.7053922209888697, "epoch": 0.9053426949816274, "grad_norm": 0.15152977406978607, "learning_rate": 6.982549759254147e-05, "loss": 0.676, "mean_token_accuracy": 0.796904381364584, "num_tokens": 314057709.0, "step": 9840 }, { "entropy": 0.6486853901296854, "epoch": 0.9054347013530687, "grad_norm": 0.16112056374549866, "learning_rate": 6.982243076639986e-05, "loss": 0.646, "mean_token_accuracy": 0.8058718405663967, "num_tokens": 314089199.0, "step": 9841 }, { "entropy": 0.8038075286895037, "epoch": 0.9055267077245099, "grad_norm": 0.15666624903678894, "learning_rate": 6.981936394025824e-05, "loss": 0.7966, "mean_token_accuracy": 0.7635356895625591, "num_tokens": 314120475.0, "step": 9842 }, { "entropy": 0.722719170153141, "epoch": 0.9056187140959512, "grad_norm": 0.16917426884174347, "learning_rate": 6.98162971141166e-05, "loss": 0.7227, "mean_token_accuracy": 0.7864150293171406, "num_tokens": 314152509.0, "step": 9843 }, { "entropy": 0.7015506383031607, "epoch": 0.9057107204673923, "grad_norm": 0.15085852146148682, "learning_rate": 6.981323028797497e-05, "loss": 0.6922, "mean_token_accuracy": 0.7976479381322861, "num_tokens": 314185142.0, "step": 9844 }, { "entropy": 0.6653766501694918, "epoch": 0.9058027268388336, "grad_norm": 0.15368232131004333, "learning_rate": 6.981016346183335e-05, "loss": 0.6559, "mean_token_accuracy": 0.8042340315878391, "num_tokens": 314217607.0, "step": 9845 }, { "entropy": 0.7172192875295877, "epoch": 0.9058947332102748, "grad_norm": 0.15314981341362, "learning_rate": 6.980709663569172e-05, "loss": 0.7099, "mean_token_accuracy": 0.7914319187402725, "num_tokens": 314250107.0, "step": 9846 }, { "entropy": 0.7581367753446102, "epoch": 0.905986739581716, "grad_norm": 0.1598554253578186, "learning_rate": 6.98040298095501e-05, "loss": 0.7593, "mean_token_accuracy": 0.7729617692530155, "num_tokens": 314282445.0, "step": 9847 }, { "entropy": 0.6987941190600395, "epoch": 0.9060787459531573, "grad_norm": 0.16324779391288757, "learning_rate": 6.980096298340847e-05, "loss": 0.6874, "mean_token_accuracy": 0.7975902669131756, "num_tokens": 314314341.0, "step": 9848 }, { "entropy": 0.7214428950101137, "epoch": 0.9061707523245984, "grad_norm": 0.15869629383087158, "learning_rate": 6.979789615726685e-05, "loss": 0.7138, "mean_token_accuracy": 0.7877066023647785, "num_tokens": 314345873.0, "step": 9849 }, { "entropy": 0.6545142456889153, "epoch": 0.9062627586960397, "grad_norm": 0.15035808086395264, "learning_rate": 6.979482933112522e-05, "loss": 0.6478, "mean_token_accuracy": 0.8063101731240749, "num_tokens": 314378110.0, "step": 9850 }, { "entropy": 0.5233671786263585, "epoch": 0.9063547650674809, "grad_norm": 0.1542322188615799, "learning_rate": 6.979176250498359e-05, "loss": 0.5021, "mean_token_accuracy": 0.8456229828298092, "num_tokens": 314410406.0, "step": 9851 }, { "entropy": 0.7427673805505037, "epoch": 0.9064467714389222, "grad_norm": 0.15971937775611877, "learning_rate": 6.978869567884197e-05, "loss": 0.7328, "mean_token_accuracy": 0.7830657213926315, "num_tokens": 314442603.0, "step": 9852 }, { "entropy": 0.6459930203855038, "epoch": 0.9065387778103634, "grad_norm": 0.1416565626859665, "learning_rate": 6.978562885270035e-05, "loss": 0.6359, "mean_token_accuracy": 0.8107081167399883, "num_tokens": 314474189.0, "step": 9853 }, { "entropy": 0.7264706417918205, "epoch": 0.9066307841818045, "grad_norm": 0.1594800353050232, "learning_rate": 6.978256202655872e-05, "loss": 0.6939, "mean_token_accuracy": 0.794347170740366, "num_tokens": 314506536.0, "step": 9854 }, { "entropy": 0.715314551256597, "epoch": 0.9067227905532458, "grad_norm": 0.1519995480775833, "learning_rate": 6.977949520041709e-05, "loss": 0.6853, "mean_token_accuracy": 0.7924241572618484, "num_tokens": 314537914.0, "step": 9855 }, { "entropy": 0.5832235384732485, "epoch": 0.906814796924687, "grad_norm": 0.1499062180519104, "learning_rate": 6.977642837427547e-05, "loss": 0.5537, "mean_token_accuracy": 0.8342979177832603, "num_tokens": 314569650.0, "step": 9856 }, { "entropy": 0.7124111466109753, "epoch": 0.9069068032961283, "grad_norm": 0.16589726507663727, "learning_rate": 6.977336154813384e-05, "loss": 0.7084, "mean_token_accuracy": 0.7929227687418461, "num_tokens": 314601231.0, "step": 9857 }, { "entropy": 0.8205553442239761, "epoch": 0.9069988096675695, "grad_norm": 0.15954890847206116, "learning_rate": 6.977029472199222e-05, "loss": 0.8035, "mean_token_accuracy": 0.7618141658604145, "num_tokens": 314632984.0, "step": 9858 }, { "entropy": 0.6925916187465191, "epoch": 0.9070908160390107, "grad_norm": 0.15048789978027344, "learning_rate": 6.976722789585059e-05, "loss": 0.6834, "mean_token_accuracy": 0.7987072877585888, "num_tokens": 314665658.0, "step": 9859 }, { "entropy": 0.6845429269596934, "epoch": 0.9071828224104519, "grad_norm": 0.151750847697258, "learning_rate": 6.976416106970897e-05, "loss": 0.6759, "mean_token_accuracy": 0.8009379543364048, "num_tokens": 314697623.0, "step": 9860 }, { "entropy": 0.8663131296634674, "epoch": 0.9072748287818931, "grad_norm": 0.16075517237186432, "learning_rate": 6.976109424356733e-05, "loss": 0.8613, "mean_token_accuracy": 0.7487509027123451, "num_tokens": 314729330.0, "step": 9861 }, { "entropy": 0.7049398459494114, "epoch": 0.9073668351533344, "grad_norm": 0.15750139951705933, "learning_rate": 6.97580274174257e-05, "loss": 0.6897, "mean_token_accuracy": 0.7961486726999283, "num_tokens": 314760419.0, "step": 9862 }, { "entropy": 0.7131492383778095, "epoch": 0.9074588415247756, "grad_norm": 0.15170803666114807, "learning_rate": 6.975496059128408e-05, "loss": 0.6942, "mean_token_accuracy": 0.7899488434195518, "num_tokens": 314792242.0, "step": 9863 }, { "entropy": 0.6848900057375431, "epoch": 0.9075508478962168, "grad_norm": 0.15193608403205872, "learning_rate": 6.975189376514247e-05, "loss": 0.6766, "mean_token_accuracy": 0.7997283153235912, "num_tokens": 314824522.0, "step": 9864 }, { "entropy": 0.7477631997317076, "epoch": 0.907642854267658, "grad_norm": 0.1609216332435608, "learning_rate": 6.974882693900083e-05, "loss": 0.7463, "mean_token_accuracy": 0.780682161450386, "num_tokens": 314855885.0, "step": 9865 }, { "entropy": 0.8301909863948822, "epoch": 0.9077348606390993, "grad_norm": 0.16159681975841522, "learning_rate": 6.97457601128592e-05, "loss": 0.8381, "mean_token_accuracy": 0.7612665742635727, "num_tokens": 314888505.0, "step": 9866 }, { "entropy": 0.7299970611929893, "epoch": 0.9078268670105405, "grad_norm": 0.15771140158176422, "learning_rate": 6.974269328671757e-05, "loss": 0.7352, "mean_token_accuracy": 0.7817654125392437, "num_tokens": 314920186.0, "step": 9867 }, { "entropy": 0.6804525926709175, "epoch": 0.9079188733819817, "grad_norm": 0.16383729875087738, "learning_rate": 6.973962646057596e-05, "loss": 0.6758, "mean_token_accuracy": 0.8056800402700901, "num_tokens": 314952891.0, "step": 9868 }, { "entropy": 0.7460151314735413, "epoch": 0.9080108797534229, "grad_norm": 0.16657377779483795, "learning_rate": 6.973655963443433e-05, "loss": 0.7559, "mean_token_accuracy": 0.7824374884366989, "num_tokens": 314985123.0, "step": 9869 }, { "entropy": 0.7902086544781923, "epoch": 0.9081028861248641, "grad_norm": 0.15634115040302277, "learning_rate": 6.97334928082927e-05, "loss": 0.7933, "mean_token_accuracy": 0.7682635448873043, "num_tokens": 315017221.0, "step": 9870 }, { "entropy": 0.6860272064805031, "epoch": 0.9081948924963054, "grad_norm": 0.14233368635177612, "learning_rate": 6.973042598215107e-05, "loss": 0.671, "mean_token_accuracy": 0.7971482761204243, "num_tokens": 315048919.0, "step": 9871 }, { "entropy": 0.7441874211654067, "epoch": 0.9082868988677466, "grad_norm": 0.15530644357204437, "learning_rate": 6.972735915600945e-05, "loss": 0.7195, "mean_token_accuracy": 0.7853357866406441, "num_tokens": 315081237.0, "step": 9872 }, { "entropy": 0.667265513446182, "epoch": 0.9083789052391879, "grad_norm": 0.1541728526353836, "learning_rate": 6.972429232986783e-05, "loss": 0.6428, "mean_token_accuracy": 0.8077193722128868, "num_tokens": 315113250.0, "step": 9873 }, { "entropy": 0.7807818818837404, "epoch": 0.908470911610629, "grad_norm": 0.163929283618927, "learning_rate": 6.97212255037262e-05, "loss": 0.7767, "mean_token_accuracy": 0.7719280682504177, "num_tokens": 315144935.0, "step": 9874 }, { "entropy": 0.6509709265083075, "epoch": 0.9085629179820702, "grad_norm": 0.15504074096679688, "learning_rate": 6.971815867758457e-05, "loss": 0.636, "mean_token_accuracy": 0.8091997765004635, "num_tokens": 315176776.0, "step": 9875 }, { "entropy": 0.6958451168611646, "epoch": 0.9086549243535115, "grad_norm": 0.15417562425136566, "learning_rate": 6.971509185144295e-05, "loss": 0.6752, "mean_token_accuracy": 0.8002155870199203, "num_tokens": 315208384.0, "step": 9876 }, { "entropy": 0.7998518766835332, "epoch": 0.9087469307249527, "grad_norm": 0.154031902551651, "learning_rate": 6.971202502530132e-05, "loss": 0.7922, "mean_token_accuracy": 0.7664785161614418, "num_tokens": 315239557.0, "step": 9877 }, { "entropy": 0.7380704842507839, "epoch": 0.908838937096394, "grad_norm": 0.15023864805698395, "learning_rate": 6.97089581991597e-05, "loss": 0.7334, "mean_token_accuracy": 0.7818404249846935, "num_tokens": 315271558.0, "step": 9878 }, { "entropy": 0.730588911101222, "epoch": 0.9089309434678351, "grad_norm": 0.15773837268352509, "learning_rate": 6.970589137301806e-05, "loss": 0.7112, "mean_token_accuracy": 0.791744876652956, "num_tokens": 315303612.0, "step": 9879 }, { "entropy": 0.7386471899226308, "epoch": 0.9090229498392763, "grad_norm": 0.150690957903862, "learning_rate": 6.970282454687645e-05, "loss": 0.7303, "mean_token_accuracy": 0.7835359014570713, "num_tokens": 315335941.0, "step": 9880 }, { "entropy": 0.772407777607441, "epoch": 0.9091149562107176, "grad_norm": 0.16093012690544128, "learning_rate": 6.969975772073481e-05, "loss": 0.7736, "mean_token_accuracy": 0.7700521759688854, "num_tokens": 315368059.0, "step": 9881 }, { "entropy": 0.7880233377218246, "epoch": 0.9092069625821588, "grad_norm": 0.169601708650589, "learning_rate": 6.969669089459318e-05, "loss": 0.7941, "mean_token_accuracy": 0.7673871666193008, "num_tokens": 315400769.0, "step": 9882 }, { "entropy": 0.79029724560678, "epoch": 0.9092989689536001, "grad_norm": 0.15437515079975128, "learning_rate": 6.969362406845156e-05, "loss": 0.7856, "mean_token_accuracy": 0.7692475579679012, "num_tokens": 315432357.0, "step": 9883 }, { "entropy": 0.7224316317588091, "epoch": 0.9093909753250412, "grad_norm": 0.15637865662574768, "learning_rate": 6.969055724230994e-05, "loss": 0.695, "mean_token_accuracy": 0.7957786284387112, "num_tokens": 315464452.0, "step": 9884 }, { "entropy": 0.7149686850607395, "epoch": 0.9094829816964825, "grad_norm": 0.14739848673343658, "learning_rate": 6.968749041616831e-05, "loss": 0.7005, "mean_token_accuracy": 0.7913227789103985, "num_tokens": 315496361.0, "step": 9885 }, { "entropy": 0.6809814795851707, "epoch": 0.9095749880679237, "grad_norm": 0.15764528512954712, "learning_rate": 6.968442359002668e-05, "loss": 0.672, "mean_token_accuracy": 0.796702403575182, "num_tokens": 315527718.0, "step": 9886 }, { "entropy": 0.8055642284452915, "epoch": 0.9096669944393649, "grad_norm": 0.15871556103229523, "learning_rate": 6.968135676388506e-05, "loss": 0.7961, "mean_token_accuracy": 0.7646455578505993, "num_tokens": 315559147.0, "step": 9887 }, { "entropy": 0.7623544055968523, "epoch": 0.9097590008108062, "grad_norm": 0.161536306142807, "learning_rate": 6.967828993774343e-05, "loss": 0.7483, "mean_token_accuracy": 0.7818508930504322, "num_tokens": 315591304.0, "step": 9888 }, { "entropy": 0.7663570307195187, "epoch": 0.9098510071822473, "grad_norm": 0.1599097102880478, "learning_rate": 6.967522311160181e-05, "loss": 0.7547, "mean_token_accuracy": 0.7736945524811745, "num_tokens": 315622378.0, "step": 9889 }, { "entropy": 0.7320497836917639, "epoch": 0.9099430135536886, "grad_norm": 0.1612945795059204, "learning_rate": 6.967215628546018e-05, "loss": 0.7083, "mean_token_accuracy": 0.7909064516425133, "num_tokens": 315653684.0, "step": 9890 }, { "entropy": 0.6795080602169037, "epoch": 0.9100350199251298, "grad_norm": 0.1550017148256302, "learning_rate": 6.966908945931856e-05, "loss": 0.6768, "mean_token_accuracy": 0.7976425476372242, "num_tokens": 315685617.0, "step": 9891 }, { "entropy": 0.7301352173089981, "epoch": 0.910127026296571, "grad_norm": 0.1498243510723114, "learning_rate": 6.966602263317693e-05, "loss": 0.7021, "mean_token_accuracy": 0.795051995664835, "num_tokens": 315717018.0, "step": 9892 }, { "entropy": 0.7375743966549635, "epoch": 0.9102190326680123, "grad_norm": 0.1569632887840271, "learning_rate": 6.96629558070353e-05, "loss": 0.7273, "mean_token_accuracy": 0.7890201769769192, "num_tokens": 315748712.0, "step": 9893 }, { "entropy": 0.724428853020072, "epoch": 0.9103110390394534, "grad_norm": 0.1519523561000824, "learning_rate": 6.965988898089368e-05, "loss": 0.7305, "mean_token_accuracy": 0.7794889062643051, "num_tokens": 315780436.0, "step": 9894 }, { "entropy": 0.6701399367302656, "epoch": 0.9104030454108947, "grad_norm": 0.15622501075267792, "learning_rate": 6.965682215475206e-05, "loss": 0.6547, "mean_token_accuracy": 0.8031398020684719, "num_tokens": 315811945.0, "step": 9895 }, { "entropy": 0.6753231612965465, "epoch": 0.9104950517823359, "grad_norm": 0.16504019498825073, "learning_rate": 6.965375532861043e-05, "loss": 0.6669, "mean_token_accuracy": 0.804222110658884, "num_tokens": 315844160.0, "step": 9896 }, { "entropy": 0.7780500873923302, "epoch": 0.9105870581537772, "grad_norm": 0.15847866237163544, "learning_rate": 6.96506885024688e-05, "loss": 0.7623, "mean_token_accuracy": 0.7760356739163399, "num_tokens": 315876419.0, "step": 9897 }, { "entropy": 0.6107933362945914, "epoch": 0.9106790645252184, "grad_norm": 0.15424805879592896, "learning_rate": 6.964762167632716e-05, "loss": 0.5928, "mean_token_accuracy": 0.8241737969219685, "num_tokens": 315909108.0, "step": 9898 }, { "entropy": 0.7619552724063396, "epoch": 0.9107710708966595, "grad_norm": 0.1561582386493683, "learning_rate": 6.964455485018554e-05, "loss": 0.7644, "mean_token_accuracy": 0.7754602394998074, "num_tokens": 315941185.0, "step": 9899 }, { "entropy": 0.6786413658410311, "epoch": 0.9108630772681008, "grad_norm": 0.15292607247829437, "learning_rate": 6.964148802404393e-05, "loss": 0.6688, "mean_token_accuracy": 0.8009535260498524, "num_tokens": 315972650.0, "step": 9900 }, { "entropy": 0.6805456914007664, "epoch": 0.910955083639542, "grad_norm": 0.15290777385234833, "learning_rate": 6.96384211979023e-05, "loss": 0.6769, "mean_token_accuracy": 0.8034671321511269, "num_tokens": 316005178.0, "step": 9901 }, { "entropy": 0.7266144827008247, "epoch": 0.9110470900109833, "grad_norm": 0.16328927874565125, "learning_rate": 6.963535437176066e-05, "loss": 0.7242, "mean_token_accuracy": 0.7884104773402214, "num_tokens": 316036794.0, "step": 9902 }, { "entropy": 0.6110139088705182, "epoch": 0.9111390963824245, "grad_norm": 0.1522422581911087, "learning_rate": 6.963228754561904e-05, "loss": 0.5998, "mean_token_accuracy": 0.8203346952795982, "num_tokens": 316068843.0, "step": 9903 }, { "entropy": 0.7500724289566278, "epoch": 0.9112311027538657, "grad_norm": 0.15557074546813965, "learning_rate": 6.962922071947741e-05, "loss": 0.7369, "mean_token_accuracy": 0.7861584685742855, "num_tokens": 316100142.0, "step": 9904 }, { "entropy": 0.8024079306051135, "epoch": 0.9113231091253069, "grad_norm": 0.159196138381958, "learning_rate": 6.962615389333579e-05, "loss": 0.8012, "mean_token_accuracy": 0.767073854804039, "num_tokens": 316132682.0, "step": 9905 }, { "entropy": 0.6969160605221987, "epoch": 0.9114151154967481, "grad_norm": 0.14915065467357635, "learning_rate": 6.962308706719416e-05, "loss": 0.6752, "mean_token_accuracy": 0.7976376675069332, "num_tokens": 316164745.0, "step": 9906 }, { "entropy": 0.6650022082030773, "epoch": 0.9115071218681894, "grad_norm": 0.14503569900989532, "learning_rate": 6.962002024105254e-05, "loss": 0.6454, "mean_token_accuracy": 0.8059107214212418, "num_tokens": 316197030.0, "step": 9907 }, { "entropy": 0.7657595723867416, "epoch": 0.9115991282396306, "grad_norm": 0.15983769297599792, "learning_rate": 6.961695341491091e-05, "loss": 0.7438, "mean_token_accuracy": 0.7838235534727573, "num_tokens": 316229323.0, "step": 9908 }, { "entropy": 0.6134783467277884, "epoch": 0.9116911346110718, "grad_norm": 0.156590536236763, "learning_rate": 6.961388658876928e-05, "loss": 0.5958, "mean_token_accuracy": 0.8208448886871338, "num_tokens": 316261351.0, "step": 9909 }, { "entropy": 0.7356185307726264, "epoch": 0.911783140982513, "grad_norm": 0.15087851881980896, "learning_rate": 6.961081976262766e-05, "loss": 0.7078, "mean_token_accuracy": 0.7868572361767292, "num_tokens": 316293122.0, "step": 9910 }, { "entropy": 0.5966942282393575, "epoch": 0.9118751473539543, "grad_norm": 0.14734426140785217, "learning_rate": 6.960775293648604e-05, "loss": 0.5789, "mean_token_accuracy": 0.825727041810751, "num_tokens": 316325292.0, "step": 9911 }, { "entropy": 0.676892539486289, "epoch": 0.9119671537253955, "grad_norm": 0.15715257823467255, "learning_rate": 6.960468611034441e-05, "loss": 0.6701, "mean_token_accuracy": 0.79983951151371, "num_tokens": 316356630.0, "step": 9912 }, { "entropy": 0.7365404553711414, "epoch": 0.9120591600968367, "grad_norm": 0.1572246551513672, "learning_rate": 6.960161928420278e-05, "loss": 0.735, "mean_token_accuracy": 0.7826876901090145, "num_tokens": 316389050.0, "step": 9913 }, { "entropy": 0.7741962485015392, "epoch": 0.9121511664682779, "grad_norm": 0.15014219284057617, "learning_rate": 6.959855245806114e-05, "loss": 0.7641, "mean_token_accuracy": 0.7709750719368458, "num_tokens": 316421038.0, "step": 9914 }, { "entropy": 0.8368560876697302, "epoch": 0.9122431728397191, "grad_norm": 0.16129636764526367, "learning_rate": 6.959548563191954e-05, "loss": 0.8407, "mean_token_accuracy": 0.7535016313195229, "num_tokens": 316453116.0, "step": 9915 }, { "entropy": 0.6642161794006824, "epoch": 0.9123351792111604, "grad_norm": 0.14657005667686462, "learning_rate": 6.95924188057779e-05, "loss": 0.6519, "mean_token_accuracy": 0.8058983273804188, "num_tokens": 316484808.0, "step": 9916 }, { "entropy": 0.7492212830111384, "epoch": 0.9124271855826016, "grad_norm": 0.1566193848848343, "learning_rate": 6.958935197963627e-05, "loss": 0.7365, "mean_token_accuracy": 0.7807813212275505, "num_tokens": 316516443.0, "step": 9917 }, { "entropy": 0.68883216381073, "epoch": 0.9125191919540429, "grad_norm": 0.15228170156478882, "learning_rate": 6.958628515349466e-05, "loss": 0.6752, "mean_token_accuracy": 0.8013165891170502, "num_tokens": 316548731.0, "step": 9918 }, { "entropy": 0.7703688591718674, "epoch": 0.912611198325484, "grad_norm": 0.16678579151630402, "learning_rate": 6.958321832735302e-05, "loss": 0.7711, "mean_token_accuracy": 0.7749440148472786, "num_tokens": 316581055.0, "step": 9919 }, { "entropy": 0.6916721183806658, "epoch": 0.9127032046969252, "grad_norm": 0.1576404571533203, "learning_rate": 6.95801515012114e-05, "loss": 0.69, "mean_token_accuracy": 0.7959622405469418, "num_tokens": 316612336.0, "step": 9920 }, { "entropy": 0.7263891790062189, "epoch": 0.9127952110683665, "grad_norm": 0.15550215542316437, "learning_rate": 6.957708467506977e-05, "loss": 0.7052, "mean_token_accuracy": 0.7916035950183868, "num_tokens": 316644814.0, "step": 9921 }, { "entropy": 0.6432506218552589, "epoch": 0.9128872174398077, "grad_norm": 0.16024400293827057, "learning_rate": 6.957401784892815e-05, "loss": 0.6359, "mean_token_accuracy": 0.8109251148998737, "num_tokens": 316676767.0, "step": 9922 }, { "entropy": 0.6867733504623175, "epoch": 0.912979223811249, "grad_norm": 0.14714451134204865, "learning_rate": 6.957095102278652e-05, "loss": 0.6704, "mean_token_accuracy": 0.7995147295296192, "num_tokens": 316709245.0, "step": 9923 }, { "entropy": 0.6895167902112007, "epoch": 0.9130712301826901, "grad_norm": 0.15938501060009003, "learning_rate": 6.956788419664489e-05, "loss": 0.6853, "mean_token_accuracy": 0.8007963374257088, "num_tokens": 316741559.0, "step": 9924 }, { "entropy": 0.7356048617511988, "epoch": 0.9131632365541313, "grad_norm": 0.1528223603963852, "learning_rate": 6.956481737050327e-05, "loss": 0.7408, "mean_token_accuracy": 0.7815223149955273, "num_tokens": 316773015.0, "step": 9925 }, { "entropy": 0.6348440367728472, "epoch": 0.9132552429255726, "grad_norm": 0.17086344957351685, "learning_rate": 6.956175054436165e-05, "loss": 0.6267, "mean_token_accuracy": 0.8143207542598248, "num_tokens": 316804567.0, "step": 9926 }, { "entropy": 0.7385774347931147, "epoch": 0.9133472492970138, "grad_norm": 0.14791327714920044, "learning_rate": 6.955868371822002e-05, "loss": 0.7265, "mean_token_accuracy": 0.7874362953007221, "num_tokens": 316836472.0, "step": 9927 }, { "entropy": 0.7776539586484432, "epoch": 0.9134392556684551, "grad_norm": 0.15791702270507812, "learning_rate": 6.955561689207839e-05, "loss": 0.7629, "mean_token_accuracy": 0.7753236778080463, "num_tokens": 316868662.0, "step": 9928 }, { "entropy": 0.6638348661363125, "epoch": 0.9135312620398962, "grad_norm": 0.15338610112667084, "learning_rate": 6.955255006593676e-05, "loss": 0.6422, "mean_token_accuracy": 0.807020153850317, "num_tokens": 316901054.0, "step": 9929 }, { "entropy": 0.7215070929378271, "epoch": 0.9136232684113375, "grad_norm": 0.15438160300254822, "learning_rate": 6.954948323979514e-05, "loss": 0.7167, "mean_token_accuracy": 0.7853221409022808, "num_tokens": 316932458.0, "step": 9930 }, { "entropy": 0.7091897567734122, "epoch": 0.9137152747827787, "grad_norm": 0.1550876647233963, "learning_rate": 6.954641641365352e-05, "loss": 0.7005, "mean_token_accuracy": 0.7920494973659515, "num_tokens": 316964040.0, "step": 9931 }, { "entropy": 0.783055561594665, "epoch": 0.9138072811542199, "grad_norm": 0.15218020975589752, "learning_rate": 6.954334958751189e-05, "loss": 0.767, "mean_token_accuracy": 0.7738208547234535, "num_tokens": 316996390.0, "step": 9932 }, { "entropy": 0.7263622842729092, "epoch": 0.9138992875256612, "grad_norm": 0.15355050563812256, "learning_rate": 6.954028276137026e-05, "loss": 0.7013, "mean_token_accuracy": 0.7907178401947021, "num_tokens": 317028433.0, "step": 9933 }, { "entropy": 0.6992142908275127, "epoch": 0.9139912938971023, "grad_norm": 0.1508665382862091, "learning_rate": 6.953721593522864e-05, "loss": 0.6867, "mean_token_accuracy": 0.793359499424696, "num_tokens": 317059441.0, "step": 9934 }, { "entropy": 0.7658503837883472, "epoch": 0.9140833002685436, "grad_norm": 0.15848466753959656, "learning_rate": 6.9534149109087e-05, "loss": 0.7643, "mean_token_accuracy": 0.7756367437541485, "num_tokens": 317091865.0, "step": 9935 }, { "entropy": 0.6607688553631306, "epoch": 0.9141753066399848, "grad_norm": 0.1535189300775528, "learning_rate": 6.953108228294539e-05, "loss": 0.6651, "mean_token_accuracy": 0.8036913499236107, "num_tokens": 317123515.0, "step": 9936 }, { "entropy": 0.7675842326134443, "epoch": 0.914267313011426, "grad_norm": 0.157068133354187, "learning_rate": 6.952801545680375e-05, "loss": 0.7702, "mean_token_accuracy": 0.7753793857991695, "num_tokens": 317155534.0, "step": 9937 }, { "entropy": 0.6453035892918706, "epoch": 0.9143593193828673, "grad_norm": 0.15001808106899261, "learning_rate": 6.952494863066214e-05, "loss": 0.6292, "mean_token_accuracy": 0.8124967105686665, "num_tokens": 317187207.0, "step": 9938 }, { "entropy": 0.7825527247041464, "epoch": 0.9144513257543084, "grad_norm": 0.16372056305408478, "learning_rate": 6.95218818045205e-05, "loss": 0.7802, "mean_token_accuracy": 0.7702504396438599, "num_tokens": 317219125.0, "step": 9939 }, { "entropy": 0.7626891061663628, "epoch": 0.9145433321257497, "grad_norm": 0.1572502851486206, "learning_rate": 6.951881497837887e-05, "loss": 0.753, "mean_token_accuracy": 0.7739312537014484, "num_tokens": 317250975.0, "step": 9940 }, { "entropy": 0.6499994248151779, "epoch": 0.9146353384971909, "grad_norm": 0.1503913253545761, "learning_rate": 6.951574815223725e-05, "loss": 0.6217, "mean_token_accuracy": 0.8124854378402233, "num_tokens": 317282834.0, "step": 9941 }, { "entropy": 0.6257903105579317, "epoch": 0.9147273448686322, "grad_norm": 0.1486394703388214, "learning_rate": 6.951268132609563e-05, "loss": 0.6044, "mean_token_accuracy": 0.8177580423653126, "num_tokens": 317314146.0, "step": 9942 }, { "entropy": 0.7766043171286583, "epoch": 0.9148193512400734, "grad_norm": 0.16053040325641632, "learning_rate": 6.9509614499954e-05, "loss": 0.7622, "mean_token_accuracy": 0.7725018784403801, "num_tokens": 317346160.0, "step": 9943 }, { "entropy": 0.7040560031309724, "epoch": 0.9149113576115147, "grad_norm": 0.15694858133792877, "learning_rate": 6.950654767381237e-05, "loss": 0.7067, "mean_token_accuracy": 0.7939725518226624, "num_tokens": 317378457.0, "step": 9944 }, { "entropy": 0.8519250098615885, "epoch": 0.9150033639829558, "grad_norm": 0.16589556634426117, "learning_rate": 6.950348084767075e-05, "loss": 0.8374, "mean_token_accuracy": 0.7552572302520275, "num_tokens": 317410322.0, "step": 9945 }, { "entropy": 0.5933488458395004, "epoch": 0.915095370354397, "grad_norm": 0.1727464497089386, "learning_rate": 6.950041402152912e-05, "loss": 0.6087, "mean_token_accuracy": 0.8226212970912457, "num_tokens": 317442262.0, "step": 9946 }, { "entropy": 0.5894409464672208, "epoch": 0.9151873767258383, "grad_norm": 0.15855944156646729, "learning_rate": 6.94973471953875e-05, "loss": 0.5688, "mean_token_accuracy": 0.8311855345964432, "num_tokens": 317474451.0, "step": 9947 }, { "entropy": 0.7775322217494249, "epoch": 0.9152793830972795, "grad_norm": 0.15149272978305817, "learning_rate": 6.949428036924587e-05, "loss": 0.7684, "mean_token_accuracy": 0.7776103429496288, "num_tokens": 317507168.0, "step": 9948 }, { "entropy": 0.6891325674951077, "epoch": 0.9153713894687208, "grad_norm": 0.15433643758296967, "learning_rate": 6.949121354310425e-05, "loss": 0.6834, "mean_token_accuracy": 0.8002696111798286, "num_tokens": 317538591.0, "step": 9949 }, { "entropy": 0.7655931916087866, "epoch": 0.9154633958401619, "grad_norm": 0.15250885486602783, "learning_rate": 6.948814671696262e-05, "loss": 0.7512, "mean_token_accuracy": 0.7792609818279743, "num_tokens": 317570465.0, "step": 9950 }, { "entropy": 0.7524932948872447, "epoch": 0.9155554022116031, "grad_norm": 0.15422415733337402, "learning_rate": 6.948507989082099e-05, "loss": 0.7364, "mean_token_accuracy": 0.7903403602540493, "num_tokens": 317603111.0, "step": 9951 }, { "entropy": 0.6946470532566309, "epoch": 0.9156474085830444, "grad_norm": 0.1624579131603241, "learning_rate": 6.948201306467937e-05, "loss": 0.7003, "mean_token_accuracy": 0.7896745726466179, "num_tokens": 317635705.0, "step": 9952 }, { "entropy": 0.7080320604145527, "epoch": 0.9157394149544856, "grad_norm": 0.1512802392244339, "learning_rate": 6.947894623853775e-05, "loss": 0.6894, "mean_token_accuracy": 0.7951046787202358, "num_tokens": 317668220.0, "step": 9953 }, { "entropy": 0.6640472151339054, "epoch": 0.9158314213259269, "grad_norm": 0.1492760181427002, "learning_rate": 6.947587941239612e-05, "loss": 0.6406, "mean_token_accuracy": 0.8076999634504318, "num_tokens": 317700645.0, "step": 9954 }, { "entropy": 0.6919131334871054, "epoch": 0.915923427697368, "grad_norm": 0.1529681235551834, "learning_rate": 6.947281258625448e-05, "loss": 0.6832, "mean_token_accuracy": 0.7965882793068886, "num_tokens": 317732390.0, "step": 9955 }, { "entropy": 0.7654892429709435, "epoch": 0.9160154340688093, "grad_norm": 0.15937885642051697, "learning_rate": 6.946974576011287e-05, "loss": 0.766, "mean_token_accuracy": 0.7724371924996376, "num_tokens": 317764658.0, "step": 9956 }, { "entropy": 0.8604301046580076, "epoch": 0.9161074404402505, "grad_norm": 0.1602267175912857, "learning_rate": 6.946667893397125e-05, "loss": 0.8426, "mean_token_accuracy": 0.7526186183094978, "num_tokens": 317796124.0, "step": 9957 }, { "entropy": 0.7300421670079231, "epoch": 0.9161994468116917, "grad_norm": 0.16083726286888123, "learning_rate": 6.946361210782961e-05, "loss": 0.7055, "mean_token_accuracy": 0.794402714818716, "num_tokens": 317828502.0, "step": 9958 }, { "entropy": 0.7887132130563259, "epoch": 0.916291453183133, "grad_norm": 0.15655331313610077, "learning_rate": 6.946054528168798e-05, "loss": 0.7823, "mean_token_accuracy": 0.7685951963067055, "num_tokens": 317859744.0, "step": 9959 }, { "entropy": 0.7913587242364883, "epoch": 0.9163834595545741, "grad_norm": 0.15333998203277588, "learning_rate": 6.945747845554635e-05, "loss": 0.7762, "mean_token_accuracy": 0.7680510580539703, "num_tokens": 317892113.0, "step": 9960 }, { "entropy": 0.6925205439329147, "epoch": 0.9164754659260154, "grad_norm": 0.14994674921035767, "learning_rate": 6.945441162940473e-05, "loss": 0.6745, "mean_token_accuracy": 0.7951846681535244, "num_tokens": 317924314.0, "step": 9961 }, { "entropy": 0.7596172243356705, "epoch": 0.9165674722974566, "grad_norm": 0.15743465721607208, "learning_rate": 6.945134480326311e-05, "loss": 0.7489, "mean_token_accuracy": 0.7793570682406425, "num_tokens": 317956737.0, "step": 9962 }, { "entropy": 0.6805580146610737, "epoch": 0.9166594786688979, "grad_norm": 0.15861579775810242, "learning_rate": 6.944827797712148e-05, "loss": 0.6794, "mean_token_accuracy": 0.8001701943576336, "num_tokens": 317988283.0, "step": 9963 }, { "entropy": 0.7812789753079414, "epoch": 0.9167514850403391, "grad_norm": 0.15527063608169556, "learning_rate": 6.944521115097985e-05, "loss": 0.7733, "mean_token_accuracy": 0.7679052799940109, "num_tokens": 318020353.0, "step": 9964 }, { "entropy": 0.706810999661684, "epoch": 0.9168434914117802, "grad_norm": 0.1532265692949295, "learning_rate": 6.944214432483823e-05, "loss": 0.7033, "mean_token_accuracy": 0.7902745679020882, "num_tokens": 318052699.0, "step": 9965 }, { "entropy": 0.6937880013138056, "epoch": 0.9169354977832215, "grad_norm": 0.16165407001972198, "learning_rate": 6.94390774986966e-05, "loss": 0.6804, "mean_token_accuracy": 0.7978475093841553, "num_tokens": 318083970.0, "step": 9966 }, { "entropy": 0.6965666711330414, "epoch": 0.9170275041546627, "grad_norm": 0.16809342801570892, "learning_rate": 6.943601067255498e-05, "loss": 0.6745, "mean_token_accuracy": 0.7992452010512352, "num_tokens": 318115294.0, "step": 9967 }, { "entropy": 0.6503252424299717, "epoch": 0.917119510526104, "grad_norm": 0.16171392798423767, "learning_rate": 6.943294384641335e-05, "loss": 0.6514, "mean_token_accuracy": 0.8005641810595989, "num_tokens": 318147273.0, "step": 9968 }, { "entropy": 0.8111811578273773, "epoch": 0.9172115168975452, "grad_norm": 0.16488702595233917, "learning_rate": 6.942987702027173e-05, "loss": 0.8047, "mean_token_accuracy": 0.7628498487174511, "num_tokens": 318178734.0, "step": 9969 }, { "entropy": 0.7196056060492992, "epoch": 0.9173035232689863, "grad_norm": 0.15344573557376862, "learning_rate": 6.94268101941301e-05, "loss": 0.6999, "mean_token_accuracy": 0.7865083701908588, "num_tokens": 318210522.0, "step": 9970 }, { "entropy": 0.6921303365379572, "epoch": 0.9173955296404276, "grad_norm": 0.15634600818157196, "learning_rate": 6.942374336798846e-05, "loss": 0.6817, "mean_token_accuracy": 0.7995149195194244, "num_tokens": 318242558.0, "step": 9971 }, { "entropy": 0.7527589909732342, "epoch": 0.9174875360118688, "grad_norm": 0.16255822777748108, "learning_rate": 6.942067654184685e-05, "loss": 0.747, "mean_token_accuracy": 0.7785642631351948, "num_tokens": 318273794.0, "step": 9972 }, { "entropy": 0.6917078038677573, "epoch": 0.9175795423833101, "grad_norm": 0.15654051303863525, "learning_rate": 6.941760971570523e-05, "loss": 0.6774, "mean_token_accuracy": 0.7994005270302296, "num_tokens": 318305236.0, "step": 9973 }, { "entropy": 0.6421024547889829, "epoch": 0.9176715487547513, "grad_norm": 0.14953060448169708, "learning_rate": 6.94145428895636e-05, "loss": 0.6374, "mean_token_accuracy": 0.8121487237513065, "num_tokens": 318337496.0, "step": 9974 }, { "entropy": 0.727041058242321, "epoch": 0.9177635551261925, "grad_norm": 0.15349675714969635, "learning_rate": 6.941147606342196e-05, "loss": 0.7083, "mean_token_accuracy": 0.7896493934094906, "num_tokens": 318369099.0, "step": 9975 }, { "entropy": 0.6205169139429927, "epoch": 0.9178555614976337, "grad_norm": 0.15125249326229095, "learning_rate": 6.940840923728034e-05, "loss": 0.5933, "mean_token_accuracy": 0.8223515525460243, "num_tokens": 318401036.0, "step": 9976 }, { "entropy": 0.7604425735771656, "epoch": 0.9179475678690749, "grad_norm": 0.16217675805091858, "learning_rate": 6.940534241113871e-05, "loss": 0.7692, "mean_token_accuracy": 0.7745232656598091, "num_tokens": 318433104.0, "step": 9977 }, { "entropy": 0.6258802730590105, "epoch": 0.9180395742405162, "grad_norm": 0.14057479798793793, "learning_rate": 6.94022755849971e-05, "loss": 0.5934, "mean_token_accuracy": 0.8177808783948421, "num_tokens": 318464797.0, "step": 9978 }, { "entropy": 0.6739685516804457, "epoch": 0.9181315806119574, "grad_norm": 0.15312393009662628, "learning_rate": 6.939920875885546e-05, "loss": 0.6619, "mean_token_accuracy": 0.8062943294644356, "num_tokens": 318496623.0, "step": 9979 }, { "entropy": 0.7782473489642143, "epoch": 0.9182235869833986, "grad_norm": 0.14988350868225098, "learning_rate": 6.939614193271384e-05, "loss": 0.7629, "mean_token_accuracy": 0.7718226723372936, "num_tokens": 318528792.0, "step": 9980 }, { "entropy": 0.7389786336570978, "epoch": 0.9183155933548398, "grad_norm": 0.1520860493183136, "learning_rate": 6.939307510657221e-05, "loss": 0.7349, "mean_token_accuracy": 0.78506725654006, "num_tokens": 318561086.0, "step": 9981 }, { "entropy": 0.6920284256339073, "epoch": 0.918407599726281, "grad_norm": 0.1512753814458847, "learning_rate": 6.939000828043058e-05, "loss": 0.6761, "mean_token_accuracy": 0.7995144613087177, "num_tokens": 318593072.0, "step": 9982 }, { "entropy": 0.7174007277935743, "epoch": 0.9184996060977223, "grad_norm": 0.14879091084003448, "learning_rate": 6.938694145428896e-05, "loss": 0.6933, "mean_token_accuracy": 0.7916452772915363, "num_tokens": 318624840.0, "step": 9983 }, { "entropy": 0.7099181059747934, "epoch": 0.9185916124691635, "grad_norm": 0.1496090143918991, "learning_rate": 6.938387462814734e-05, "loss": 0.69, "mean_token_accuracy": 0.7962145544588566, "num_tokens": 318656532.0, "step": 9984 }, { "entropy": 0.7843203265219927, "epoch": 0.9186836188406047, "grad_norm": 0.16409288346767426, "learning_rate": 6.938080780200571e-05, "loss": 0.7783, "mean_token_accuracy": 0.7751600220799446, "num_tokens": 318688757.0, "step": 9985 }, { "entropy": 0.7237826623022556, "epoch": 0.9187756252120459, "grad_norm": 0.17175886034965515, "learning_rate": 6.937774097586408e-05, "loss": 0.7393, "mean_token_accuracy": 0.781003650277853, "num_tokens": 318721371.0, "step": 9986 }, { "entropy": 0.6601234581321478, "epoch": 0.9188676315834872, "grad_norm": 0.15273530781269073, "learning_rate": 6.937467414972245e-05, "loss": 0.656, "mean_token_accuracy": 0.8029108494520187, "num_tokens": 318753413.0, "step": 9987 }, { "entropy": 0.7051912695169449, "epoch": 0.9189596379549284, "grad_norm": 0.15639397501945496, "learning_rate": 6.937160732358084e-05, "loss": 0.6943, "mean_token_accuracy": 0.789123423397541, "num_tokens": 318784883.0, "step": 9988 }, { "entropy": 0.7705016061663628, "epoch": 0.9190516443263697, "grad_norm": 0.1670760214328766, "learning_rate": 6.936854049743921e-05, "loss": 0.7645, "mean_token_accuracy": 0.7700841501355171, "num_tokens": 318816124.0, "step": 9989 }, { "entropy": 0.799666678532958, "epoch": 0.9191436506978108, "grad_norm": 0.1554257571697235, "learning_rate": 6.936547367129758e-05, "loss": 0.8133, "mean_token_accuracy": 0.761804610490799, "num_tokens": 318847286.0, "step": 9990 }, { "entropy": 0.7293779980391264, "epoch": 0.919235657069252, "grad_norm": 0.15962086617946625, "learning_rate": 6.936240684515594e-05, "loss": 0.7247, "mean_token_accuracy": 0.7837360315024853, "num_tokens": 318878933.0, "step": 9991 }, { "entropy": 0.7169304648414254, "epoch": 0.9193276634406933, "grad_norm": 0.1580122858285904, "learning_rate": 6.935934001901433e-05, "loss": 0.6972, "mean_token_accuracy": 0.7959704324603081, "num_tokens": 318910208.0, "step": 9992 }, { "entropy": 0.7372545003890991, "epoch": 0.9194196698121345, "grad_norm": 0.16247539222240448, "learning_rate": 6.935627319287271e-05, "loss": 0.7333, "mean_token_accuracy": 0.7839266993105412, "num_tokens": 318941539.0, "step": 9993 }, { "entropy": 0.7418679129332304, "epoch": 0.9195116761835758, "grad_norm": 0.152090921998024, "learning_rate": 6.935320636673107e-05, "loss": 0.7195, "mean_token_accuracy": 0.7925521582365036, "num_tokens": 318974161.0, "step": 9994 }, { "entropy": 0.7352519817650318, "epoch": 0.9196036825550169, "grad_norm": 0.15448540449142456, "learning_rate": 6.935013954058944e-05, "loss": 0.7049, "mean_token_accuracy": 0.7905003167688847, "num_tokens": 319006771.0, "step": 9995 }, { "entropy": 0.7006584238260984, "epoch": 0.9196956889264581, "grad_norm": 0.1504005491733551, "learning_rate": 6.934707271444782e-05, "loss": 0.6759, "mean_token_accuracy": 0.7969538532197475, "num_tokens": 319038676.0, "step": 9996 }, { "entropy": 0.7115880157798529, "epoch": 0.9197876952978994, "grad_norm": 0.1473681628704071, "learning_rate": 6.934400588830619e-05, "loss": 0.6931, "mean_token_accuracy": 0.7941428981721401, "num_tokens": 319070059.0, "step": 9997 }, { "entropy": 0.7326098997145891, "epoch": 0.9198797016693406, "grad_norm": 0.15123046934604645, "learning_rate": 6.934093906216457e-05, "loss": 0.722, "mean_token_accuracy": 0.7821482755243778, "num_tokens": 319101855.0, "step": 9998 }, { "entropy": 0.7548060845583677, "epoch": 0.9199717080407819, "grad_norm": 0.15556462109088898, "learning_rate": 6.933787223602294e-05, "loss": 0.7412, "mean_token_accuracy": 0.7825354300439358, "num_tokens": 319134332.0, "step": 9999 }, { "entropy": 0.7195710502564907, "epoch": 0.920063714412223, "grad_norm": 0.15761610865592957, "learning_rate": 6.933480540988132e-05, "loss": 0.7045, "mean_token_accuracy": 0.7937524653971195, "num_tokens": 319166406.0, "step": 10000 }, { "entropy": 0.7317797038704157, "epoch": 0.9201557207836643, "grad_norm": 0.15185149013996124, "learning_rate": 6.933173858373969e-05, "loss": 0.7069, "mean_token_accuracy": 0.7913852073252201, "num_tokens": 319198252.0, "step": 10001 }, { "entropy": 0.6521715186536312, "epoch": 0.9202477271551055, "grad_norm": 0.15052390098571777, "learning_rate": 6.932867175759806e-05, "loss": 0.638, "mean_token_accuracy": 0.8097384683787823, "num_tokens": 319230588.0, "step": 10002 }, { "entropy": 0.4935324275866151, "epoch": 0.9203397335265467, "grad_norm": 0.14617522060871124, "learning_rate": 6.932560493145644e-05, "loss": 0.466, "mean_token_accuracy": 0.8562178798019886, "num_tokens": 319263190.0, "step": 10003 }, { "entropy": 0.8986342828720808, "epoch": 0.920431739897988, "grad_norm": 0.1668703407049179, "learning_rate": 6.932253810531482e-05, "loss": 0.9063, "mean_token_accuracy": 0.7376941479742527, "num_tokens": 319293931.0, "step": 10004 }, { "entropy": 0.726238583214581, "epoch": 0.9205237462694291, "grad_norm": 0.15867480635643005, "learning_rate": 6.931947127917319e-05, "loss": 0.7188, "mean_token_accuracy": 0.7832648456096649, "num_tokens": 319325237.0, "step": 10005 }, { "entropy": 0.7880181837826967, "epoch": 0.9206157526408704, "grad_norm": 0.15475909411907196, "learning_rate": 6.931640445303156e-05, "loss": 0.7896, "mean_token_accuracy": 0.7691408470273018, "num_tokens": 319357390.0, "step": 10006 }, { "entropy": 0.6472890563309193, "epoch": 0.9207077590123116, "grad_norm": 0.17355003952980042, "learning_rate": 6.931333762688994e-05, "loss": 0.6537, "mean_token_accuracy": 0.8059832043945789, "num_tokens": 319389233.0, "step": 10007 }, { "entropy": 0.6652557821944356, "epoch": 0.9207997653837529, "grad_norm": 0.15902040898799896, "learning_rate": 6.93102708007483e-05, "loss": 0.6542, "mean_token_accuracy": 0.8054920472204685, "num_tokens": 319421180.0, "step": 10008 }, { "entropy": 0.8067612629383802, "epoch": 0.9208917717551941, "grad_norm": 0.15871120989322662, "learning_rate": 6.930720397460669e-05, "loss": 0.7976, "mean_token_accuracy": 0.769433569163084, "num_tokens": 319452721.0, "step": 10009 }, { "entropy": 0.686876630410552, "epoch": 0.9209837781266352, "grad_norm": 0.15559357404708862, "learning_rate": 6.930413714846506e-05, "loss": 0.6894, "mean_token_accuracy": 0.7939366772770882, "num_tokens": 319485171.0, "step": 10010 }, { "entropy": 0.717473616823554, "epoch": 0.9210757844980765, "grad_norm": 0.1565064936876297, "learning_rate": 6.930107032232344e-05, "loss": 0.706, "mean_token_accuracy": 0.7886949703097343, "num_tokens": 319517831.0, "step": 10011 }, { "entropy": 0.7296528425067663, "epoch": 0.9211677908695177, "grad_norm": 0.1593588888645172, "learning_rate": 6.92980034961818e-05, "loss": 0.733, "mean_token_accuracy": 0.7807900942862034, "num_tokens": 319549961.0, "step": 10012 }, { "entropy": 0.6601831577718258, "epoch": 0.921259797240959, "grad_norm": 0.15349198877811432, "learning_rate": 6.929493667004017e-05, "loss": 0.6455, "mean_token_accuracy": 0.806370671838522, "num_tokens": 319582374.0, "step": 10013 }, { "entropy": 0.702958638779819, "epoch": 0.9213518036124002, "grad_norm": 0.16017575562000275, "learning_rate": 6.929186984389855e-05, "loss": 0.6699, "mean_token_accuracy": 0.7966594696044922, "num_tokens": 319614102.0, "step": 10014 }, { "entropy": 0.8034601304680109, "epoch": 0.9214438099838413, "grad_norm": 0.17059485614299774, "learning_rate": 6.928880301775694e-05, "loss": 0.8025, "mean_token_accuracy": 0.767827495932579, "num_tokens": 319646415.0, "step": 10015 }, { "entropy": 0.7202405901625752, "epoch": 0.9215358163552826, "grad_norm": 0.15718232095241547, "learning_rate": 6.92857361916153e-05, "loss": 0.7104, "mean_token_accuracy": 0.7853466831147671, "num_tokens": 319678372.0, "step": 10016 }, { "entropy": 0.6869063312187791, "epoch": 0.9216278227267238, "grad_norm": 0.1456579715013504, "learning_rate": 6.928266936547367e-05, "loss": 0.6666, "mean_token_accuracy": 0.796948991715908, "num_tokens": 319709651.0, "step": 10017 }, { "entropy": 0.5935928355902433, "epoch": 0.9217198290981651, "grad_norm": 0.14472149312496185, "learning_rate": 6.927960253933204e-05, "loss": 0.5947, "mean_token_accuracy": 0.8241494409739971, "num_tokens": 319741248.0, "step": 10018 }, { "entropy": 0.5481100119650364, "epoch": 0.9218118354696063, "grad_norm": 0.14352266490459442, "learning_rate": 6.927653571319042e-05, "loss": 0.5254, "mean_token_accuracy": 0.8393064960837364, "num_tokens": 319773413.0, "step": 10019 }, { "entropy": 0.7654887363314629, "epoch": 0.9219038418410475, "grad_norm": 0.15309712290763855, "learning_rate": 6.92734688870488e-05, "loss": 0.7453, "mean_token_accuracy": 0.7766719982028008, "num_tokens": 319805879.0, "step": 10020 }, { "entropy": 0.6656090337783098, "epoch": 0.9219958482124887, "grad_norm": 0.15048709511756897, "learning_rate": 6.927040206090717e-05, "loss": 0.657, "mean_token_accuracy": 0.8118128255009651, "num_tokens": 319837603.0, "step": 10021 }, { "entropy": 0.7887123208492994, "epoch": 0.92208785458393, "grad_norm": 0.15650716423988342, "learning_rate": 6.926733523476554e-05, "loss": 0.7843, "mean_token_accuracy": 0.7723917625844479, "num_tokens": 319869083.0, "step": 10022 }, { "entropy": 0.7293807994574308, "epoch": 0.9221798609553712, "grad_norm": 0.16031105816364288, "learning_rate": 6.926426840862392e-05, "loss": 0.7085, "mean_token_accuracy": 0.7865784354507923, "num_tokens": 319900780.0, "step": 10023 }, { "entropy": 0.6331095211207867, "epoch": 0.9222718673268124, "grad_norm": 0.14732055366039276, "learning_rate": 6.926120158248229e-05, "loss": 0.6129, "mean_token_accuracy": 0.8129370175302029, "num_tokens": 319932763.0, "step": 10024 }, { "entropy": 0.7142865313217044, "epoch": 0.9223638736982536, "grad_norm": 0.16352733969688416, "learning_rate": 6.925813475634067e-05, "loss": 0.7038, "mean_token_accuracy": 0.7933197468519211, "num_tokens": 319964355.0, "step": 10025 }, { "entropy": 0.6586469803005457, "epoch": 0.9224558800696948, "grad_norm": 0.1499454528093338, "learning_rate": 6.925506793019904e-05, "loss": 0.6473, "mean_token_accuracy": 0.8058638796210289, "num_tokens": 319996677.0, "step": 10026 }, { "entropy": 0.6870859954506159, "epoch": 0.9225478864411361, "grad_norm": 0.16267329454421997, "learning_rate": 6.925200110405742e-05, "loss": 0.6868, "mean_token_accuracy": 0.800089493393898, "num_tokens": 320028680.0, "step": 10027 }, { "entropy": 0.8489757478237152, "epoch": 0.9226398928125773, "grad_norm": 0.16786479949951172, "learning_rate": 6.924893427791579e-05, "loss": 0.8526, "mean_token_accuracy": 0.7477334588766098, "num_tokens": 320059721.0, "step": 10028 }, { "entropy": 0.8023544810712337, "epoch": 0.9227318991840185, "grad_norm": 0.1651490479707718, "learning_rate": 6.924586745177415e-05, "loss": 0.7845, "mean_token_accuracy": 0.7682928405702114, "num_tokens": 320091155.0, "step": 10029 }, { "entropy": 0.7299495283514261, "epoch": 0.9228239055554597, "grad_norm": 0.16199935972690582, "learning_rate": 6.924280062563254e-05, "loss": 0.7192, "mean_token_accuracy": 0.7855132147669792, "num_tokens": 320123115.0, "step": 10030 }, { "entropy": 0.6984968576580286, "epoch": 0.9229159119269009, "grad_norm": 0.15615074336528778, "learning_rate": 6.923973379949092e-05, "loss": 0.678, "mean_token_accuracy": 0.7948505915701389, "num_tokens": 320155016.0, "step": 10031 }, { "entropy": 0.7193333669565618, "epoch": 0.9230079182983422, "grad_norm": 0.163724884390831, "learning_rate": 6.923666697334928e-05, "loss": 0.6986, "mean_token_accuracy": 0.7952575646340847, "num_tokens": 320186271.0, "step": 10032 }, { "entropy": 0.7473000008612871, "epoch": 0.9230999246697834, "grad_norm": 0.15048228204250336, "learning_rate": 6.923360014720765e-05, "loss": 0.7434, "mean_token_accuracy": 0.777312234044075, "num_tokens": 320218893.0, "step": 10033 }, { "entropy": 0.683626439422369, "epoch": 0.9231919310412247, "grad_norm": 0.16222909092903137, "learning_rate": 6.923053332106602e-05, "loss": 0.6761, "mean_token_accuracy": 0.8029282540082932, "num_tokens": 320250361.0, "step": 10034 }, { "entropy": 0.7030383627861738, "epoch": 0.9232839374126658, "grad_norm": 0.15259341895580292, "learning_rate": 6.922746649492442e-05, "loss": 0.6907, "mean_token_accuracy": 0.7928045578300953, "num_tokens": 320282752.0, "step": 10035 }, { "entropy": 0.6658203289844096, "epoch": 0.923375943784107, "grad_norm": 0.14650294184684753, "learning_rate": 6.922439966878278e-05, "loss": 0.6503, "mean_token_accuracy": 0.8053961433470249, "num_tokens": 320315192.0, "step": 10036 }, { "entropy": 0.6745353452861309, "epoch": 0.9234679501555483, "grad_norm": 0.14765432476997375, "learning_rate": 6.922133284264115e-05, "loss": 0.6809, "mean_token_accuracy": 0.7994432747364044, "num_tokens": 320347401.0, "step": 10037 }, { "entropy": 0.7337830904871225, "epoch": 0.9235599565269895, "grad_norm": 0.1632947474718094, "learning_rate": 6.921826601649953e-05, "loss": 0.7259, "mean_token_accuracy": 0.7865215912461281, "num_tokens": 320380000.0, "step": 10038 }, { "entropy": 0.5459805894643068, "epoch": 0.9236519628984308, "grad_norm": 0.14175595343112946, "learning_rate": 6.92151991903579e-05, "loss": 0.5385, "mean_token_accuracy": 0.8329222090542316, "num_tokens": 320412171.0, "step": 10039 }, { "entropy": 0.6332358927465975, "epoch": 0.9237439692698719, "grad_norm": 0.15180563926696777, "learning_rate": 6.921213236421628e-05, "loss": 0.6158, "mean_token_accuracy": 0.8139631822705269, "num_tokens": 320443525.0, "step": 10040 }, { "entropy": 0.776739465072751, "epoch": 0.9238359756413131, "grad_norm": 0.16606175899505615, "learning_rate": 6.920906553807465e-05, "loss": 0.7694, "mean_token_accuracy": 0.7764557749032974, "num_tokens": 320476127.0, "step": 10041 }, { "entropy": 0.792960787191987, "epoch": 0.9239279820127544, "grad_norm": 0.16206376254558563, "learning_rate": 6.920599871193303e-05, "loss": 0.8016, "mean_token_accuracy": 0.7664768546819687, "num_tokens": 320508380.0, "step": 10042 }, { "entropy": 0.8171132728457451, "epoch": 0.9240199883841956, "grad_norm": 0.16963684558868408, "learning_rate": 6.92029318857914e-05, "loss": 0.8092, "mean_token_accuracy": 0.7664848938584328, "num_tokens": 320540349.0, "step": 10043 }, { "entropy": 0.7006282955408096, "epoch": 0.9241119947556369, "grad_norm": 0.15460680425167084, "learning_rate": 6.919986505964977e-05, "loss": 0.6817, "mean_token_accuracy": 0.7925930991768837, "num_tokens": 320571745.0, "step": 10044 }, { "entropy": 0.7206188198179007, "epoch": 0.924204001127078, "grad_norm": 0.16092151403427124, "learning_rate": 6.919679823350815e-05, "loss": 0.7058, "mean_token_accuracy": 0.791772086173296, "num_tokens": 320603961.0, "step": 10045 }, { "entropy": 0.8085630759596825, "epoch": 0.9242960074985193, "grad_norm": 0.16168299317359924, "learning_rate": 6.919373140736653e-05, "loss": 0.7921, "mean_token_accuracy": 0.7689031213521957, "num_tokens": 320635564.0, "step": 10046 }, { "entropy": 0.5516939535737038, "epoch": 0.9243880138699605, "grad_norm": 0.1392057240009308, "learning_rate": 6.91906645812249e-05, "loss": 0.5169, "mean_token_accuracy": 0.8427882194519043, "num_tokens": 320668332.0, "step": 10047 }, { "entropy": 0.7709966078400612, "epoch": 0.9244800202414017, "grad_norm": 0.1561095416545868, "learning_rate": 6.918759775508327e-05, "loss": 0.7561, "mean_token_accuracy": 0.7786037921905518, "num_tokens": 320700353.0, "step": 10048 }, { "entropy": 0.7292346861213446, "epoch": 0.924572026612843, "grad_norm": 0.15002547204494476, "learning_rate": 6.918453092894163e-05, "loss": 0.7192, "mean_token_accuracy": 0.7879794277250767, "num_tokens": 320732605.0, "step": 10049 }, { "entropy": 0.6692859251052141, "epoch": 0.9246640329842841, "grad_norm": 0.15094876289367676, "learning_rate": 6.918146410280001e-05, "loss": 0.6628, "mean_token_accuracy": 0.8035629540681839, "num_tokens": 320764760.0, "step": 10050 }, { "entropy": 0.6223231581971049, "epoch": 0.9247560393557254, "grad_norm": 0.15153905749320984, "learning_rate": 6.91783972766584e-05, "loss": 0.6004, "mean_token_accuracy": 0.8175779841840267, "num_tokens": 320796949.0, "step": 10051 }, { "entropy": 0.5421300865709782, "epoch": 0.9248480457271666, "grad_norm": 0.15300601720809937, "learning_rate": 6.917533045051676e-05, "loss": 0.5351, "mean_token_accuracy": 0.8371445313096046, "num_tokens": 320829601.0, "step": 10052 }, { "entropy": 0.7616028375923634, "epoch": 0.9249400520986079, "grad_norm": 0.16030330955982208, "learning_rate": 6.917226362437513e-05, "loss": 0.7567, "mean_token_accuracy": 0.7761100940406322, "num_tokens": 320860946.0, "step": 10053 }, { "entropy": 0.7592726144939661, "epoch": 0.9250320584700491, "grad_norm": 0.15871545672416687, "learning_rate": 6.916919679823351e-05, "loss": 0.7458, "mean_token_accuracy": 0.7781198844313622, "num_tokens": 320892670.0, "step": 10054 }, { "entropy": 0.6296313665807247, "epoch": 0.9251240648414902, "grad_norm": 0.1460118442773819, "learning_rate": 6.916612997209188e-05, "loss": 0.6213, "mean_token_accuracy": 0.8208964318037033, "num_tokens": 320925438.0, "step": 10055 }, { "entropy": 0.636111730709672, "epoch": 0.9252160712129315, "grad_norm": 0.15088102221488953, "learning_rate": 6.916306314595026e-05, "loss": 0.6288, "mean_token_accuracy": 0.8146796897053719, "num_tokens": 320957486.0, "step": 10056 }, { "entropy": 0.6198417283594608, "epoch": 0.9253080775843727, "grad_norm": 0.16705523431301117, "learning_rate": 6.915999631980863e-05, "loss": 0.6201, "mean_token_accuracy": 0.8150073625147343, "num_tokens": 320989902.0, "step": 10057 }, { "entropy": 0.7687426842749119, "epoch": 0.925400083955814, "grad_norm": 0.16118517518043518, "learning_rate": 6.915692949366701e-05, "loss": 0.7681, "mean_token_accuracy": 0.7754175923764706, "num_tokens": 321021899.0, "step": 10058 }, { "entropy": 0.7426656968891621, "epoch": 0.9254920903272552, "grad_norm": 0.16048260033130646, "learning_rate": 6.915386266752538e-05, "loss": 0.7363, "mean_token_accuracy": 0.7848457545042038, "num_tokens": 321054153.0, "step": 10059 }, { "entropy": 0.6714558964595199, "epoch": 0.9255840966986963, "grad_norm": 0.16212117671966553, "learning_rate": 6.915079584138375e-05, "loss": 0.669, "mean_token_accuracy": 0.8003207370638847, "num_tokens": 321085844.0, "step": 10060 }, { "entropy": 0.7232849858701229, "epoch": 0.9256761030701376, "grad_norm": 0.16266725957393646, "learning_rate": 6.914772901524213e-05, "loss": 0.7197, "mean_token_accuracy": 0.7878721281886101, "num_tokens": 321117393.0, "step": 10061 }, { "entropy": 0.7654467169195414, "epoch": 0.9257681094415788, "grad_norm": 0.16172921657562256, "learning_rate": 6.914466218910051e-05, "loss": 0.7577, "mean_token_accuracy": 0.7756998836994171, "num_tokens": 321149551.0, "step": 10062 }, { "entropy": 0.7012363411486149, "epoch": 0.9258601158130201, "grad_norm": 0.15066835284233093, "learning_rate": 6.914159536295888e-05, "loss": 0.6926, "mean_token_accuracy": 0.7967973276972771, "num_tokens": 321181428.0, "step": 10063 }, { "entropy": 0.7100589666515589, "epoch": 0.9259521221844613, "grad_norm": 0.15040528774261475, "learning_rate": 6.913852853681725e-05, "loss": 0.6978, "mean_token_accuracy": 0.7941379621624947, "num_tokens": 321214096.0, "step": 10064 }, { "entropy": 0.7416942454874516, "epoch": 0.9260441285559025, "grad_norm": 0.1543944925069809, "learning_rate": 6.913546171067561e-05, "loss": 0.7258, "mean_token_accuracy": 0.7829320654273033, "num_tokens": 321245992.0, "step": 10065 }, { "entropy": 0.6624593399465084, "epoch": 0.9261361349273437, "grad_norm": 0.1581188589334488, "learning_rate": 6.9132394884534e-05, "loss": 0.6601, "mean_token_accuracy": 0.800947543233633, "num_tokens": 321278191.0, "step": 10066 }, { "entropy": 0.6524279695004225, "epoch": 0.926228141298785, "grad_norm": 0.15083719789981842, "learning_rate": 6.912932805839238e-05, "loss": 0.6444, "mean_token_accuracy": 0.8062034510076046, "num_tokens": 321310061.0, "step": 10067 }, { "entropy": 0.8177984319627285, "epoch": 0.9263201476702262, "grad_norm": 0.16416975855827332, "learning_rate": 6.912626123225074e-05, "loss": 0.81, "mean_token_accuracy": 0.7623271904885769, "num_tokens": 321342348.0, "step": 10068 }, { "entropy": 0.7641009818762541, "epoch": 0.9264121540416674, "grad_norm": 0.16724248230457306, "learning_rate": 6.912319440610913e-05, "loss": 0.7443, "mean_token_accuracy": 0.7768818587064743, "num_tokens": 321374000.0, "step": 10069 }, { "entropy": 0.8039760161191225, "epoch": 0.9265041604131086, "grad_norm": 0.1725081205368042, "learning_rate": 6.91201275799675e-05, "loss": 0.8071, "mean_token_accuracy": 0.7714586034417152, "num_tokens": 321405629.0, "step": 10070 }, { "entropy": 0.7091279597952962, "epoch": 0.9265961667845498, "grad_norm": 0.1555512696504593, "learning_rate": 6.911706075382586e-05, "loss": 0.7149, "mean_token_accuracy": 0.7893836311995983, "num_tokens": 321437119.0, "step": 10071 }, { "entropy": 0.6160593489184976, "epoch": 0.9266881731559911, "grad_norm": 0.1687343418598175, "learning_rate": 6.911399392768424e-05, "loss": 0.6024, "mean_token_accuracy": 0.82093221321702, "num_tokens": 321468748.0, "step": 10072 }, { "entropy": 0.7596363481134176, "epoch": 0.9267801795274323, "grad_norm": 0.1489769071340561, "learning_rate": 6.911092710154262e-05, "loss": 0.7353, "mean_token_accuracy": 0.7873107083141804, "num_tokens": 321501516.0, "step": 10073 }, { "entropy": 0.7282904125750065, "epoch": 0.9268721858988735, "grad_norm": 0.1611119508743286, "learning_rate": 6.910786027540099e-05, "loss": 0.709, "mean_token_accuracy": 0.790121428668499, "num_tokens": 321533588.0, "step": 10074 }, { "entropy": 0.7752249278128147, "epoch": 0.9269641922703147, "grad_norm": 0.16347157955169678, "learning_rate": 6.910479344925936e-05, "loss": 0.7557, "mean_token_accuracy": 0.7764816731214523, "num_tokens": 321565391.0, "step": 10075 }, { "entropy": 0.6411216538399458, "epoch": 0.9270561986417559, "grad_norm": 0.14603546261787415, "learning_rate": 6.910172662311774e-05, "loss": 0.6175, "mean_token_accuracy": 0.8123501688241959, "num_tokens": 321597450.0, "step": 10076 }, { "entropy": 0.6722378823906183, "epoch": 0.9271482050131972, "grad_norm": 0.15343627333641052, "learning_rate": 6.909865979697612e-05, "loss": 0.6387, "mean_token_accuracy": 0.8089510388672352, "num_tokens": 321629569.0, "step": 10077 }, { "entropy": 0.6157147493213415, "epoch": 0.9272402113846384, "grad_norm": 0.15549327433109283, "learning_rate": 6.909559297083449e-05, "loss": 0.614, "mean_token_accuracy": 0.8133190684020519, "num_tokens": 321661007.0, "step": 10078 }, { "entropy": 0.6817674655467272, "epoch": 0.9273322177560797, "grad_norm": 0.15572255849838257, "learning_rate": 6.909252614469286e-05, "loss": 0.6621, "mean_token_accuracy": 0.8019202537834644, "num_tokens": 321693308.0, "step": 10079 }, { "entropy": 0.5709645822644234, "epoch": 0.9274242241275208, "grad_norm": 0.15026229619979858, "learning_rate": 6.908945931855123e-05, "loss": 0.5674, "mean_token_accuracy": 0.8296796195209026, "num_tokens": 321725509.0, "step": 10080 }, { "entropy": 0.6937322095036507, "epoch": 0.927516230498962, "grad_norm": 0.1592530608177185, "learning_rate": 6.908639249240961e-05, "loss": 0.6775, "mean_token_accuracy": 0.7991457246243954, "num_tokens": 321756088.0, "step": 10081 }, { "entropy": 0.8693338520824909, "epoch": 0.9276082368704033, "grad_norm": 0.17022302746772766, "learning_rate": 6.908332566626799e-05, "loss": 0.8982, "mean_token_accuracy": 0.7372478023171425, "num_tokens": 321787396.0, "step": 10082 }, { "entropy": 0.5100908642634749, "epoch": 0.9277002432418445, "grad_norm": 0.14729033410549164, "learning_rate": 6.908025884012636e-05, "loss": 0.49, "mean_token_accuracy": 0.8506980910897255, "num_tokens": 321819915.0, "step": 10083 }, { "entropy": 0.7158867958933115, "epoch": 0.9277922496132858, "grad_norm": 0.16711753606796265, "learning_rate": 6.907719201398473e-05, "loss": 0.7103, "mean_token_accuracy": 0.7906990014016628, "num_tokens": 321851682.0, "step": 10084 }, { "entropy": 0.759673647582531, "epoch": 0.9278842559847269, "grad_norm": 0.15763312578201294, "learning_rate": 6.907412518784311e-05, "loss": 0.7668, "mean_token_accuracy": 0.7754876054823399, "num_tokens": 321883458.0, "step": 10085 }, { "entropy": 0.5400787517428398, "epoch": 0.9279762623561681, "grad_norm": 0.14842349290847778, "learning_rate": 6.907105836170147e-05, "loss": 0.525, "mean_token_accuracy": 0.8430475071072578, "num_tokens": 321915650.0, "step": 10086 }, { "entropy": 0.682932311668992, "epoch": 0.9280682687276094, "grad_norm": 0.15183192491531372, "learning_rate": 6.906799153555986e-05, "loss": 0.6657, "mean_token_accuracy": 0.8029856085777283, "num_tokens": 321947450.0, "step": 10087 }, { "entropy": 0.7603417783975601, "epoch": 0.9281602750990506, "grad_norm": 0.15779916942119598, "learning_rate": 6.906492470941822e-05, "loss": 0.7518, "mean_token_accuracy": 0.777743998914957, "num_tokens": 321978921.0, "step": 10088 }, { "entropy": 0.7225582785904408, "epoch": 0.9282522814704919, "grad_norm": 0.1613718718290329, "learning_rate": 6.90618578832766e-05, "loss": 0.7098, "mean_token_accuracy": 0.7906680107116699, "num_tokens": 322011382.0, "step": 10089 }, { "entropy": 0.6892097359523177, "epoch": 0.928344287841933, "grad_norm": 0.15986180305480957, "learning_rate": 6.905879105713497e-05, "loss": 0.6745, "mean_token_accuracy": 0.8047891855239868, "num_tokens": 322042877.0, "step": 10090 }, { "entropy": 0.7807013662531972, "epoch": 0.9284362942133743, "grad_norm": 0.17247657477855682, "learning_rate": 6.905572423099334e-05, "loss": 0.7465, "mean_token_accuracy": 0.7813421562314034, "num_tokens": 322074667.0, "step": 10091 }, { "entropy": 0.7125077228993177, "epoch": 0.9285283005848155, "grad_norm": 0.15110737085342407, "learning_rate": 6.905265740485172e-05, "loss": 0.6947, "mean_token_accuracy": 0.794600386172533, "num_tokens": 322106867.0, "step": 10092 }, { "entropy": 0.8483287543058395, "epoch": 0.9286203069562567, "grad_norm": 0.158844456076622, "learning_rate": 6.90495905787101e-05, "loss": 0.8439, "mean_token_accuracy": 0.7530940696597099, "num_tokens": 322139597.0, "step": 10093 }, { "entropy": 0.691204534843564, "epoch": 0.928712313327698, "grad_norm": 0.14293403923511505, "learning_rate": 6.904652375256847e-05, "loss": 0.6701, "mean_token_accuracy": 0.8008691109716892, "num_tokens": 322171592.0, "step": 10094 }, { "entropy": 0.7054439028725028, "epoch": 0.9288043196991391, "grad_norm": 0.15565888583660126, "learning_rate": 6.904345692642684e-05, "loss": 0.6871, "mean_token_accuracy": 0.7925667501986027, "num_tokens": 322203525.0, "step": 10095 }, { "entropy": 0.8024335382506251, "epoch": 0.9288963260705804, "grad_norm": 0.17689859867095947, "learning_rate": 6.904039010028521e-05, "loss": 0.7982, "mean_token_accuracy": 0.7648606970906258, "num_tokens": 322235056.0, "step": 10096 }, { "entropy": 0.7258170172572136, "epoch": 0.9289883324420216, "grad_norm": 0.15618418157100677, "learning_rate": 6.903732327414359e-05, "loss": 0.7267, "mean_token_accuracy": 0.7877820767462254, "num_tokens": 322267715.0, "step": 10097 }, { "entropy": 0.6603909423574805, "epoch": 0.9290803388134629, "grad_norm": 0.15847380459308624, "learning_rate": 6.903425644800197e-05, "loss": 0.6474, "mean_token_accuracy": 0.8042293973267078, "num_tokens": 322300170.0, "step": 10098 }, { "entropy": 0.7146832384169102, "epoch": 0.9291723451849041, "grad_norm": 0.1563357412815094, "learning_rate": 6.903118962186034e-05, "loss": 0.7051, "mean_token_accuracy": 0.7918129824101925, "num_tokens": 322332190.0, "step": 10099 }, { "entropy": 0.6367739280685782, "epoch": 0.9292643515563452, "grad_norm": 0.15132346749305725, "learning_rate": 6.902812279571872e-05, "loss": 0.6183, "mean_token_accuracy": 0.8168084993958473, "num_tokens": 322364699.0, "step": 10100 }, { "entropy": 0.7458810023963451, "epoch": 0.9293563579277865, "grad_norm": 0.14752796292304993, "learning_rate": 6.902505596957709e-05, "loss": 0.7355, "mean_token_accuracy": 0.7832323051989079, "num_tokens": 322396003.0, "step": 10101 }, { "entropy": 0.7932907827198505, "epoch": 0.9294483642992277, "grad_norm": 0.159769669175148, "learning_rate": 6.902198914343546e-05, "loss": 0.7916, "mean_token_accuracy": 0.7681764774024487, "num_tokens": 322427616.0, "step": 10102 }, { "entropy": 0.7277450393885374, "epoch": 0.929540370670669, "grad_norm": 0.15636759996414185, "learning_rate": 6.901892231729384e-05, "loss": 0.7224, "mean_token_accuracy": 0.7815062776207924, "num_tokens": 322459277.0, "step": 10103 }, { "entropy": 0.7303236108273268, "epoch": 0.9296323770421102, "grad_norm": 0.14794310927391052, "learning_rate": 6.901585549115222e-05, "loss": 0.7227, "mean_token_accuracy": 0.782582875341177, "num_tokens": 322490545.0, "step": 10104 }, { "entropy": 0.6138364970684052, "epoch": 0.9297243834135513, "grad_norm": 0.15385182201862335, "learning_rate": 6.901278866501059e-05, "loss": 0.5986, "mean_token_accuracy": 0.8169780932366848, "num_tokens": 322521946.0, "step": 10105 }, { "entropy": 0.7211675699800253, "epoch": 0.9298163897849926, "grad_norm": 0.14555470645427704, "learning_rate": 6.900972183886895e-05, "loss": 0.6931, "mean_token_accuracy": 0.795242715626955, "num_tokens": 322554713.0, "step": 10106 }, { "entropy": 0.8182109426707029, "epoch": 0.9299083961564338, "grad_norm": 0.15608720481395721, "learning_rate": 6.900665501272732e-05, "loss": 0.8163, "mean_token_accuracy": 0.763112235814333, "num_tokens": 322585861.0, "step": 10107 }, { "entropy": 0.7560088392347097, "epoch": 0.9300004025278751, "grad_norm": 0.16317932307720184, "learning_rate": 6.900358818658572e-05, "loss": 0.7444, "mean_token_accuracy": 0.7805887050926685, "num_tokens": 322617983.0, "step": 10108 }, { "entropy": 0.7740400936454535, "epoch": 0.9300924088993163, "grad_norm": 0.1623762547969818, "learning_rate": 6.900052136044408e-05, "loss": 0.7363, "mean_token_accuracy": 0.7853161320090294, "num_tokens": 322648925.0, "step": 10109 }, { "entropy": 0.765366405248642, "epoch": 0.9301844152707575, "grad_norm": 0.15867240726947784, "learning_rate": 6.899745453430245e-05, "loss": 0.7486, "mean_token_accuracy": 0.7841012179851532, "num_tokens": 322681095.0, "step": 10110 }, { "entropy": 0.7334907166659832, "epoch": 0.9302764216421987, "grad_norm": 0.15616540610790253, "learning_rate": 6.899438770816082e-05, "loss": 0.7262, "mean_token_accuracy": 0.7884567119181156, "num_tokens": 322713377.0, "step": 10111 }, { "entropy": 0.6746008209884167, "epoch": 0.93036842801364, "grad_norm": 0.16372458636760712, "learning_rate": 6.89913208820192e-05, "loss": 0.6816, "mean_token_accuracy": 0.8004342392086983, "num_tokens": 322745854.0, "step": 10112 }, { "entropy": 0.7266215058043599, "epoch": 0.9304604343850812, "grad_norm": 0.15073148906230927, "learning_rate": 6.898825405587758e-05, "loss": 0.7193, "mean_token_accuracy": 0.791246373206377, "num_tokens": 322777886.0, "step": 10113 }, { "entropy": 0.7629630714654922, "epoch": 0.9305524407565224, "grad_norm": 0.1556529402732849, "learning_rate": 6.898518722973595e-05, "loss": 0.7397, "mean_token_accuracy": 0.7767633721232414, "num_tokens": 322809621.0, "step": 10114 }, { "entropy": 0.7241054177284241, "epoch": 0.9306444471279636, "grad_norm": 0.15834400057792664, "learning_rate": 6.898212040359432e-05, "loss": 0.7215, "mean_token_accuracy": 0.7874822579324245, "num_tokens": 322841756.0, "step": 10115 }, { "entropy": 0.7104441709816456, "epoch": 0.9307364534994048, "grad_norm": 0.15885885059833527, "learning_rate": 6.89790535774527e-05, "loss": 0.7204, "mean_token_accuracy": 0.7840985618531704, "num_tokens": 322874200.0, "step": 10116 }, { "entropy": 0.7823220239952207, "epoch": 0.9308284598708461, "grad_norm": 0.15713804960250854, "learning_rate": 6.897598675131107e-05, "loss": 0.7845, "mean_token_accuracy": 0.7690116576850414, "num_tokens": 322905858.0, "step": 10117 }, { "entropy": 0.644562229514122, "epoch": 0.9309204662422873, "grad_norm": 0.14216068387031555, "learning_rate": 6.897291992516945e-05, "loss": 0.6314, "mean_token_accuracy": 0.8086646683514118, "num_tokens": 322938430.0, "step": 10118 }, { "entropy": 0.6619132664054632, "epoch": 0.9310124726137285, "grad_norm": 0.14979533851146698, "learning_rate": 6.896985309902782e-05, "loss": 0.6519, "mean_token_accuracy": 0.8048888295888901, "num_tokens": 322970487.0, "step": 10119 }, { "entropy": 0.7058610543608665, "epoch": 0.9311044789851697, "grad_norm": 0.14937850832939148, "learning_rate": 6.89667862728862e-05, "loss": 0.6877, "mean_token_accuracy": 0.7940788231790066, "num_tokens": 323002026.0, "step": 10120 }, { "entropy": 0.6250061132013798, "epoch": 0.9311964853566109, "grad_norm": 0.1475614458322525, "learning_rate": 6.896371944674457e-05, "loss": 0.6026, "mean_token_accuracy": 0.816873911768198, "num_tokens": 323034226.0, "step": 10121 }, { "entropy": 0.8196586258709431, "epoch": 0.9312884917280522, "grad_norm": 0.15701286494731903, "learning_rate": 6.896065262060293e-05, "loss": 0.8121, "mean_token_accuracy": 0.762927919626236, "num_tokens": 323065884.0, "step": 10122 }, { "entropy": 0.6183875780552626, "epoch": 0.9313804980994934, "grad_norm": 0.1496785283088684, "learning_rate": 6.895758579446132e-05, "loss": 0.601, "mean_token_accuracy": 0.8224759958684444, "num_tokens": 323098275.0, "step": 10123 }, { "entropy": 0.5530614103190601, "epoch": 0.9314725044709347, "grad_norm": 0.15011315047740936, "learning_rate": 6.89545189683197e-05, "loss": 0.5359, "mean_token_accuracy": 0.8397418446838856, "num_tokens": 323130399.0, "step": 10124 }, { "entropy": 0.8053175006061792, "epoch": 0.9315645108423758, "grad_norm": 0.15631148219108582, "learning_rate": 6.895145214217807e-05, "loss": 0.8189, "mean_token_accuracy": 0.7570472210645676, "num_tokens": 323162873.0, "step": 10125 }, { "entropy": 0.7704017050564289, "epoch": 0.931656517213817, "grad_norm": 0.16695156693458557, "learning_rate": 6.894838531603643e-05, "loss": 0.7839, "mean_token_accuracy": 0.7731046676635742, "num_tokens": 323195271.0, "step": 10126 }, { "entropy": 0.6949842497706413, "epoch": 0.9317485235852583, "grad_norm": 0.1598910093307495, "learning_rate": 6.89453184898948e-05, "loss": 0.711, "mean_token_accuracy": 0.7931217178702354, "num_tokens": 323227290.0, "step": 10127 }, { "entropy": 0.8004434136673808, "epoch": 0.9318405299566995, "grad_norm": 0.15888231992721558, "learning_rate": 6.894225166375318e-05, "loss": 0.8015, "mean_token_accuracy": 0.7681481316685677, "num_tokens": 323259320.0, "step": 10128 }, { "entropy": 0.7190520148724318, "epoch": 0.9319325363281408, "grad_norm": 0.1558990478515625, "learning_rate": 6.893918483761156e-05, "loss": 0.7105, "mean_token_accuracy": 0.7867806144058704, "num_tokens": 323290308.0, "step": 10129 }, { "entropy": 0.6921202074736357, "epoch": 0.9320245426995819, "grad_norm": 0.1484592854976654, "learning_rate": 6.893611801146993e-05, "loss": 0.6783, "mean_token_accuracy": 0.7970200255513191, "num_tokens": 323323076.0, "step": 10130 }, { "entropy": 0.6590983057394624, "epoch": 0.9321165490710231, "grad_norm": 0.150732159614563, "learning_rate": 6.893305118532831e-05, "loss": 0.64, "mean_token_accuracy": 0.8110101819038391, "num_tokens": 323355079.0, "step": 10131 }, { "entropy": 0.6195534877479076, "epoch": 0.9322085554424644, "grad_norm": 0.15210844576358795, "learning_rate": 6.892998435918668e-05, "loss": 0.5865, "mean_token_accuracy": 0.8238384313881397, "num_tokens": 323386867.0, "step": 10132 }, { "entropy": 0.776025390252471, "epoch": 0.9323005618139056, "grad_norm": 0.16005708277225494, "learning_rate": 6.892691753304505e-05, "loss": 0.7591, "mean_token_accuracy": 0.7756818532943726, "num_tokens": 323418719.0, "step": 10133 }, { "entropy": 0.8539554663002491, "epoch": 0.9323925681853469, "grad_norm": 0.1715088039636612, "learning_rate": 6.892385070690343e-05, "loss": 0.8241, "mean_token_accuracy": 0.759704414755106, "num_tokens": 323451450.0, "step": 10134 }, { "entropy": 0.7603825498372316, "epoch": 0.932484574556788, "grad_norm": 0.1562788486480713, "learning_rate": 6.892078388076181e-05, "loss": 0.7351, "mean_token_accuracy": 0.7794371359050274, "num_tokens": 323483358.0, "step": 10135 }, { "entropy": 0.8624521512538195, "epoch": 0.9325765809282293, "grad_norm": 0.1549885869026184, "learning_rate": 6.891771705462018e-05, "loss": 0.8645, "mean_token_accuracy": 0.7486150413751602, "num_tokens": 323514972.0, "step": 10136 }, { "entropy": 0.7578782495111227, "epoch": 0.9326685872996705, "grad_norm": 0.15582281351089478, "learning_rate": 6.891465022847855e-05, "loss": 0.7449, "mean_token_accuracy": 0.7813914306461811, "num_tokens": 323546457.0, "step": 10137 }, { "entropy": 0.7676836643368006, "epoch": 0.9327605936711117, "grad_norm": 0.16688348352909088, "learning_rate": 6.891158340233692e-05, "loss": 0.7515, "mean_token_accuracy": 0.7786552645266056, "num_tokens": 323577796.0, "step": 10138 }, { "entropy": 0.7014904525130987, "epoch": 0.932852600042553, "grad_norm": 0.15529468655586243, "learning_rate": 6.89085165761953e-05, "loss": 0.6961, "mean_token_accuracy": 0.7971718683838844, "num_tokens": 323610083.0, "step": 10139 }, { "entropy": 0.717237657867372, "epoch": 0.9329446064139941, "grad_norm": 0.15512606501579285, "learning_rate": 6.890544975005368e-05, "loss": 0.7001, "mean_token_accuracy": 0.7861653417348862, "num_tokens": 323641966.0, "step": 10140 }, { "entropy": 0.6810935847461224, "epoch": 0.9330366127854354, "grad_norm": 0.16409756243228912, "learning_rate": 6.890238292391205e-05, "loss": 0.6777, "mean_token_accuracy": 0.8009281866252422, "num_tokens": 323674734.0, "step": 10141 }, { "entropy": 0.6225458662956953, "epoch": 0.9331286191568766, "grad_norm": 0.14883823692798615, "learning_rate": 6.889931609777041e-05, "loss": 0.6199, "mean_token_accuracy": 0.814807690680027, "num_tokens": 323707188.0, "step": 10142 }, { "entropy": 0.8596897907555103, "epoch": 0.9332206255283179, "grad_norm": 0.1700042188167572, "learning_rate": 6.88962492716288e-05, "loss": 0.8573, "mean_token_accuracy": 0.7492248527705669, "num_tokens": 323738780.0, "step": 10143 }, { "entropy": 0.7128691719844937, "epoch": 0.9333126318997591, "grad_norm": 0.1589837223291397, "learning_rate": 6.889318244548716e-05, "loss": 0.7114, "mean_token_accuracy": 0.788653701543808, "num_tokens": 323771125.0, "step": 10144 }, { "entropy": 0.7672869302332401, "epoch": 0.9334046382712002, "grad_norm": 0.15095055103302002, "learning_rate": 6.889011561934555e-05, "loss": 0.765, "mean_token_accuracy": 0.7725601233541965, "num_tokens": 323803270.0, "step": 10145 }, { "entropy": 0.7803751453757286, "epoch": 0.9334966446426415, "grad_norm": 0.16506415605545044, "learning_rate": 6.888704879320391e-05, "loss": 0.7867, "mean_token_accuracy": 0.7696881890296936, "num_tokens": 323835076.0, "step": 10146 }, { "entropy": 0.6314508384093642, "epoch": 0.9335886510140827, "grad_norm": 0.16868750751018524, "learning_rate": 6.88839819670623e-05, "loss": 0.6079, "mean_token_accuracy": 0.8173891380429268, "num_tokens": 323867063.0, "step": 10147 }, { "entropy": 0.6421156749129295, "epoch": 0.933680657385524, "grad_norm": 0.1488923877477646, "learning_rate": 6.888091514092066e-05, "loss": 0.6179, "mean_token_accuracy": 0.8155077770352364, "num_tokens": 323899164.0, "step": 10148 }, { "entropy": 0.7294517625123262, "epoch": 0.9337726637569652, "grad_norm": 0.14206893742084503, "learning_rate": 6.887784831477903e-05, "loss": 0.707, "mean_token_accuracy": 0.7897939309477806, "num_tokens": 323931353.0, "step": 10149 }, { "entropy": 0.6980528580024838, "epoch": 0.9338646701284063, "grad_norm": 0.15744632482528687, "learning_rate": 6.887478148863741e-05, "loss": 0.698, "mean_token_accuracy": 0.7966393753886223, "num_tokens": 323963729.0, "step": 10150 }, { "entropy": 0.6543837338685989, "epoch": 0.9339566764998476, "grad_norm": 0.153764009475708, "learning_rate": 6.887171466249579e-05, "loss": 0.6382, "mean_token_accuracy": 0.8058384172618389, "num_tokens": 323995235.0, "step": 10151 }, { "entropy": 0.6282222801819444, "epoch": 0.9340486828712888, "grad_norm": 0.1475261151790619, "learning_rate": 6.886864783635416e-05, "loss": 0.6113, "mean_token_accuracy": 0.8183899000287056, "num_tokens": 324027014.0, "step": 10152 }, { "entropy": 0.7818011604249477, "epoch": 0.9341406892427301, "grad_norm": 0.1548357456922531, "learning_rate": 6.886558101021253e-05, "loss": 0.7746, "mean_token_accuracy": 0.7727334536612034, "num_tokens": 324057996.0, "step": 10153 }, { "entropy": 0.6588866021484137, "epoch": 0.9342326956141713, "grad_norm": 0.1516200453042984, "learning_rate": 6.88625141840709e-05, "loss": 0.6477, "mean_token_accuracy": 0.8066430427134037, "num_tokens": 324090108.0, "step": 10154 }, { "entropy": 0.7376813665032387, "epoch": 0.9343247019856125, "grad_norm": 0.15880410373210907, "learning_rate": 6.885944735792929e-05, "loss": 0.7388, "mean_token_accuracy": 0.7802061587572098, "num_tokens": 324122230.0, "step": 10155 }, { "entropy": 0.7880259342491627, "epoch": 0.9344167083570537, "grad_norm": 0.16056005656719208, "learning_rate": 6.885638053178766e-05, "loss": 0.7592, "mean_token_accuracy": 0.7759217992424965, "num_tokens": 324153994.0, "step": 10156 }, { "entropy": 0.70884801261127, "epoch": 0.934508714728495, "grad_norm": 0.15792158246040344, "learning_rate": 6.885331370564603e-05, "loss": 0.7001, "mean_token_accuracy": 0.7906686328351498, "num_tokens": 324185175.0, "step": 10157 }, { "entropy": 0.7124788127839565, "epoch": 0.9346007210999362, "grad_norm": 0.15364503860473633, "learning_rate": 6.88502468795044e-05, "loss": 0.7086, "mean_token_accuracy": 0.7886479161679745, "num_tokens": 324216999.0, "step": 10158 }, { "entropy": 0.782972227782011, "epoch": 0.9346927274713774, "grad_norm": 0.15658265352249146, "learning_rate": 6.884718005336278e-05, "loss": 0.7813, "mean_token_accuracy": 0.7722495757043362, "num_tokens": 324248306.0, "step": 10159 }, { "entropy": 0.6909549608826637, "epoch": 0.9347847338428186, "grad_norm": 0.155491903424263, "learning_rate": 6.884411322722116e-05, "loss": 0.6806, "mean_token_accuracy": 0.794401329010725, "num_tokens": 324279928.0, "step": 10160 }, { "entropy": 0.7220604456961155, "epoch": 0.9348767402142598, "grad_norm": 0.14911699295043945, "learning_rate": 6.884104640107953e-05, "loss": 0.7107, "mean_token_accuracy": 0.7912051305174828, "num_tokens": 324312175.0, "step": 10161 }, { "entropy": 0.7396451802924275, "epoch": 0.9349687465857011, "grad_norm": 0.15460941195487976, "learning_rate": 6.883797957493791e-05, "loss": 0.7313, "mean_token_accuracy": 0.781394399702549, "num_tokens": 324343276.0, "step": 10162 }, { "entropy": 0.7455081949010491, "epoch": 0.9350607529571423, "grad_norm": 0.1670181006193161, "learning_rate": 6.883491274879628e-05, "loss": 0.7275, "mean_token_accuracy": 0.7860452309250832, "num_tokens": 324374529.0, "step": 10163 }, { "entropy": 0.6297427164390683, "epoch": 0.9351527593285835, "grad_norm": 0.15406657755374908, "learning_rate": 6.883184592265464e-05, "loss": 0.6323, "mean_token_accuracy": 0.8127997629344463, "num_tokens": 324406188.0, "step": 10164 }, { "entropy": 0.7169634252786636, "epoch": 0.9352447657000247, "grad_norm": 0.1581365019083023, "learning_rate": 6.882877909651302e-05, "loss": 0.7209, "mean_token_accuracy": 0.7916728295385838, "num_tokens": 324438335.0, "step": 10165 }, { "entropy": 0.7583516109734774, "epoch": 0.9353367720714659, "grad_norm": 0.15043190121650696, "learning_rate": 6.88257122703714e-05, "loss": 0.7485, "mean_token_accuracy": 0.7763632200658321, "num_tokens": 324471040.0, "step": 10166 }, { "entropy": 0.6892903102561831, "epoch": 0.9354287784429072, "grad_norm": 0.1483832597732544, "learning_rate": 6.882264544422977e-05, "loss": 0.6856, "mean_token_accuracy": 0.798353299498558, "num_tokens": 324503035.0, "step": 10167 }, { "entropy": 0.6980393305420876, "epoch": 0.9355207848143484, "grad_norm": 0.15539246797561646, "learning_rate": 6.881957861808814e-05, "loss": 0.684, "mean_token_accuracy": 0.7951562851667404, "num_tokens": 324534827.0, "step": 10168 }, { "entropy": 0.7157390704378486, "epoch": 0.9356127911857897, "grad_norm": 0.1677287369966507, "learning_rate": 6.881651179194651e-05, "loss": 0.7261, "mean_token_accuracy": 0.7815553657710552, "num_tokens": 324566348.0, "step": 10169 }, { "entropy": 0.6539084045216441, "epoch": 0.9357047975572308, "grad_norm": 0.14853854477405548, "learning_rate": 6.881344496580489e-05, "loss": 0.6392, "mean_token_accuracy": 0.8074598982930183, "num_tokens": 324597858.0, "step": 10170 }, { "entropy": 0.719328049570322, "epoch": 0.935796803928672, "grad_norm": 0.1542857587337494, "learning_rate": 6.881037813966327e-05, "loss": 0.7078, "mean_token_accuracy": 0.7895593754947186, "num_tokens": 324630485.0, "step": 10171 }, { "entropy": 0.6121994610875845, "epoch": 0.9358888103001133, "grad_norm": 0.14621984958648682, "learning_rate": 6.880731131352164e-05, "loss": 0.5957, "mean_token_accuracy": 0.8193430453538895, "num_tokens": 324662617.0, "step": 10172 }, { "entropy": 0.6609339145943522, "epoch": 0.9359808166715545, "grad_norm": 0.1538531482219696, "learning_rate": 6.880424448738001e-05, "loss": 0.6466, "mean_token_accuracy": 0.8095223233103752, "num_tokens": 324695003.0, "step": 10173 }, { "entropy": 0.7483523469418287, "epoch": 0.9360728230429958, "grad_norm": 0.15791191160678864, "learning_rate": 6.880117766123839e-05, "loss": 0.724, "mean_token_accuracy": 0.782615102827549, "num_tokens": 324727065.0, "step": 10174 }, { "entropy": 0.6919484511017799, "epoch": 0.9361648294144369, "grad_norm": 0.15736140310764313, "learning_rate": 6.879811083509676e-05, "loss": 0.6629, "mean_token_accuracy": 0.8003854900598526, "num_tokens": 324758359.0, "step": 10175 }, { "entropy": 0.6770732365548611, "epoch": 0.9362568357858781, "grad_norm": 0.15773750841617584, "learning_rate": 6.879504400895514e-05, "loss": 0.6757, "mean_token_accuracy": 0.7995035089552402, "num_tokens": 324790754.0, "step": 10176 }, { "entropy": 0.6493137767538428, "epoch": 0.9363488421573194, "grad_norm": 0.14820776879787445, "learning_rate": 6.87919771828135e-05, "loss": 0.6368, "mean_token_accuracy": 0.8095439001917839, "num_tokens": 324823297.0, "step": 10177 }, { "entropy": 0.7998994179069996, "epoch": 0.9364408485287606, "grad_norm": 0.16295860707759857, "learning_rate": 6.878891035667189e-05, "loss": 0.7915, "mean_token_accuracy": 0.768079724162817, "num_tokens": 324855642.0, "step": 10178 }, { "entropy": 0.7966304123401642, "epoch": 0.9365328549002019, "grad_norm": 0.1547269970178604, "learning_rate": 6.878584353053026e-05, "loss": 0.7895, "mean_token_accuracy": 0.7683715932071209, "num_tokens": 324887751.0, "step": 10179 }, { "entropy": 0.7996522262692451, "epoch": 0.936624861271643, "grad_norm": 0.16232949495315552, "learning_rate": 6.878277670438862e-05, "loss": 0.8022, "mean_token_accuracy": 0.7622728087007999, "num_tokens": 324919118.0, "step": 10180 }, { "entropy": 0.7506463248282671, "epoch": 0.9367168676430843, "grad_norm": 0.15489354729652405, "learning_rate": 6.8779709878247e-05, "loss": 0.7506, "mean_token_accuracy": 0.7797782458364964, "num_tokens": 324951301.0, "step": 10181 }, { "entropy": 0.6750179613009095, "epoch": 0.9368088740145255, "grad_norm": 0.14765667915344238, "learning_rate": 6.877664305210539e-05, "loss": 0.6298, "mean_token_accuracy": 0.8105587214231491, "num_tokens": 324983116.0, "step": 10182 }, { "entropy": 0.6595414532348514, "epoch": 0.9369008803859668, "grad_norm": 0.149120032787323, "learning_rate": 6.877357622596375e-05, "loss": 0.6368, "mean_token_accuracy": 0.8143734186887741, "num_tokens": 325014901.0, "step": 10183 }, { "entropy": 0.8206261266022921, "epoch": 0.936992886757408, "grad_norm": 0.15874889492988586, "learning_rate": 6.877050939982212e-05, "loss": 0.8178, "mean_token_accuracy": 0.7595624849200249, "num_tokens": 325047506.0, "step": 10184 }, { "entropy": 0.7795734163373709, "epoch": 0.9370848931288491, "grad_norm": 0.16267234086990356, "learning_rate": 6.876744257368049e-05, "loss": 0.767, "mean_token_accuracy": 0.7766121290624142, "num_tokens": 325080107.0, "step": 10185 }, { "entropy": 0.7462374651804566, "epoch": 0.9371768995002904, "grad_norm": 0.16366128623485565, "learning_rate": 6.876437574753887e-05, "loss": 0.7377, "mean_token_accuracy": 0.7854417487978935, "num_tokens": 325111868.0, "step": 10186 }, { "entropy": 0.8118211440742016, "epoch": 0.9372689058717316, "grad_norm": 0.15623357892036438, "learning_rate": 6.876130892139725e-05, "loss": 0.8175, "mean_token_accuracy": 0.7594134844839573, "num_tokens": 325143353.0, "step": 10187 }, { "entropy": 0.7579035516828299, "epoch": 0.9373609122431729, "grad_norm": 0.1516595035791397, "learning_rate": 6.875824209525562e-05, "loss": 0.7555, "mean_token_accuracy": 0.7753207422792912, "num_tokens": 325175851.0, "step": 10188 }, { "entropy": 0.6672601513564587, "epoch": 0.9374529186146141, "grad_norm": 0.15672117471694946, "learning_rate": 6.8755175269114e-05, "loss": 0.6365, "mean_token_accuracy": 0.8100520260632038, "num_tokens": 325207912.0, "step": 10189 }, { "entropy": 0.7568550575524569, "epoch": 0.9375449249860552, "grad_norm": 0.15948538482189178, "learning_rate": 6.875210844297237e-05, "loss": 0.7611, "mean_token_accuracy": 0.7762533910572529, "num_tokens": 325239278.0, "step": 10190 }, { "entropy": 0.7432481255382299, "epoch": 0.9376369313574965, "grad_norm": 0.15322010219097137, "learning_rate": 6.874904161683075e-05, "loss": 0.7387, "mean_token_accuracy": 0.7802418768405914, "num_tokens": 325272033.0, "step": 10191 }, { "entropy": 0.8094010036438704, "epoch": 0.9377289377289377, "grad_norm": 0.16251105070114136, "learning_rate": 6.874597479068912e-05, "loss": 0.8141, "mean_token_accuracy": 0.7640089616179466, "num_tokens": 325303767.0, "step": 10192 }, { "entropy": 0.7476240340620279, "epoch": 0.937820944100379, "grad_norm": 0.16165699064731598, "learning_rate": 6.87429079645475e-05, "loss": 0.7532, "mean_token_accuracy": 0.7776557728648186, "num_tokens": 325336128.0, "step": 10193 }, { "entropy": 0.7146274521946907, "epoch": 0.9379129504718202, "grad_norm": 0.1552668958902359, "learning_rate": 6.873984113840587e-05, "loss": 0.6966, "mean_token_accuracy": 0.7956897877156734, "num_tokens": 325368271.0, "step": 10194 }, { "entropy": 0.7658624183386564, "epoch": 0.9380049568432614, "grad_norm": 0.15073393285274506, "learning_rate": 6.873677431226424e-05, "loss": 0.7648, "mean_token_accuracy": 0.7740136459469795, "num_tokens": 325400076.0, "step": 10195 }, { "entropy": 0.6907831970602274, "epoch": 0.9380969632147026, "grad_norm": 0.15667015314102173, "learning_rate": 6.873370748612262e-05, "loss": 0.6796, "mean_token_accuracy": 0.7960389107465744, "num_tokens": 325431578.0, "step": 10196 }, { "entropy": 0.6457981672137976, "epoch": 0.9381889695861438, "grad_norm": 0.16848178207874298, "learning_rate": 6.8730640659981e-05, "loss": 0.6379, "mean_token_accuracy": 0.8074898980557919, "num_tokens": 325463900.0, "step": 10197 }, { "entropy": 0.7639705017209053, "epoch": 0.9382809759575851, "grad_norm": 0.15461745858192444, "learning_rate": 6.872757383383937e-05, "loss": 0.7577, "mean_token_accuracy": 0.7753758355975151, "num_tokens": 325495522.0, "step": 10198 }, { "entropy": 0.6272282041609287, "epoch": 0.9383729823290263, "grad_norm": 0.15350225567817688, "learning_rate": 6.872450700769774e-05, "loss": 0.6071, "mean_token_accuracy": 0.8177929371595383, "num_tokens": 325527962.0, "step": 10199 }, { "entropy": 0.6298452988266945, "epoch": 0.9384649887004675, "grad_norm": 0.1537771373987198, "learning_rate": 6.87214401815561e-05, "loss": 0.6006, "mean_token_accuracy": 0.8172840066254139, "num_tokens": 325559899.0, "step": 10200 }, { "entropy": 0.6930432487279177, "epoch": 0.9385569950719087, "grad_norm": 0.15250229835510254, "learning_rate": 6.871837335541448e-05, "loss": 0.6814, "mean_token_accuracy": 0.7980617173016071, "num_tokens": 325591216.0, "step": 10201 }, { "entropy": 0.7052438016980886, "epoch": 0.93864900144335, "grad_norm": 0.15518039464950562, "learning_rate": 6.871530652927287e-05, "loss": 0.6943, "mean_token_accuracy": 0.7916542179882526, "num_tokens": 325622936.0, "step": 10202 }, { "entropy": 0.7359449686482549, "epoch": 0.9387410078147912, "grad_norm": 0.15378747880458832, "learning_rate": 6.871223970313123e-05, "loss": 0.7193, "mean_token_accuracy": 0.783555518835783, "num_tokens": 325654725.0, "step": 10203 }, { "entropy": 0.707669734954834, "epoch": 0.9388330141862324, "grad_norm": 0.1648680716753006, "learning_rate": 6.87091728769896e-05, "loss": 0.706, "mean_token_accuracy": 0.7928328439593315, "num_tokens": 325686674.0, "step": 10204 }, { "entropy": 0.8753211302682757, "epoch": 0.9389250205576736, "grad_norm": 0.16553765535354614, "learning_rate": 6.870610605084798e-05, "loss": 0.8593, "mean_token_accuracy": 0.7489217035472393, "num_tokens": 325718465.0, "step": 10205 }, { "entropy": 0.6870389878749847, "epoch": 0.9390170269291148, "grad_norm": 0.14939694106578827, "learning_rate": 6.870303922470635e-05, "loss": 0.6649, "mean_token_accuracy": 0.8017483241856098, "num_tokens": 325751000.0, "step": 10206 }, { "entropy": 0.7904809061437845, "epoch": 0.9391090333005561, "grad_norm": 0.15569579601287842, "learning_rate": 6.869997239856473e-05, "loss": 0.785, "mean_token_accuracy": 0.772856842726469, "num_tokens": 325783253.0, "step": 10207 }, { "entropy": 0.754199156537652, "epoch": 0.9392010396719973, "grad_norm": 0.1519538313150406, "learning_rate": 6.86969055724231e-05, "loss": 0.7388, "mean_token_accuracy": 0.7801513671875, "num_tokens": 325815141.0, "step": 10208 }, { "entropy": 0.793554050847888, "epoch": 0.9392930460434386, "grad_norm": 0.1515205353498459, "learning_rate": 6.869383874628148e-05, "loss": 0.7907, "mean_token_accuracy": 0.76847705245018, "num_tokens": 325847189.0, "step": 10209 }, { "entropy": 0.6491711316630244, "epoch": 0.9393850524148797, "grad_norm": 0.1513260304927826, "learning_rate": 6.869077192013985e-05, "loss": 0.646, "mean_token_accuracy": 0.8057085201144218, "num_tokens": 325878219.0, "step": 10210 }, { "entropy": 0.591742028016597, "epoch": 0.9394770587863209, "grad_norm": 0.14532308280467987, "learning_rate": 6.868770509399822e-05, "loss": 0.5879, "mean_token_accuracy": 0.8245221525430679, "num_tokens": 325910778.0, "step": 10211 }, { "entropy": 0.7751869149506092, "epoch": 0.9395690651577622, "grad_norm": 0.1556798666715622, "learning_rate": 6.86846382678566e-05, "loss": 0.7773, "mean_token_accuracy": 0.7691521495580673, "num_tokens": 325942731.0, "step": 10212 }, { "entropy": 0.7364711677655578, "epoch": 0.9396610715292034, "grad_norm": 0.14878953993320465, "learning_rate": 6.868157144171498e-05, "loss": 0.7262, "mean_token_accuracy": 0.787368930876255, "num_tokens": 325974589.0, "step": 10213 }, { "entropy": 0.6361248884350061, "epoch": 0.9397530779006447, "grad_norm": 0.14425182342529297, "learning_rate": 6.867850461557335e-05, "loss": 0.6209, "mean_token_accuracy": 0.8126473240554333, "num_tokens": 326006856.0, "step": 10214 }, { "entropy": 0.6959371343255043, "epoch": 0.9398450842720858, "grad_norm": 0.1496036946773529, "learning_rate": 6.867543778943172e-05, "loss": 0.6664, "mean_token_accuracy": 0.8056738451123238, "num_tokens": 326038716.0, "step": 10215 }, { "entropy": 0.5770297516137362, "epoch": 0.939937090643527, "grad_norm": 0.15520043671131134, "learning_rate": 6.867237096329008e-05, "loss": 0.5682, "mean_token_accuracy": 0.8293508477509022, "num_tokens": 326071190.0, "step": 10216 }, { "entropy": 0.8251059278845787, "epoch": 0.9400290970149683, "grad_norm": 0.16532674431800842, "learning_rate": 6.866930413714847e-05, "loss": 0.8174, "mean_token_accuracy": 0.7588772214949131, "num_tokens": 326103244.0, "step": 10217 }, { "entropy": 0.8426848892122507, "epoch": 0.9401211033864095, "grad_norm": 0.15378418564796448, "learning_rate": 6.866623731100685e-05, "loss": 0.8361, "mean_token_accuracy": 0.7598234564065933, "num_tokens": 326135086.0, "step": 10218 }, { "entropy": 0.6852692160755396, "epoch": 0.9402131097578508, "grad_norm": 0.15558287501335144, "learning_rate": 6.866317048486521e-05, "loss": 0.6728, "mean_token_accuracy": 0.7990985848009586, "num_tokens": 326166321.0, "step": 10219 }, { "entropy": 0.7526608817279339, "epoch": 0.9403051161292919, "grad_norm": 0.15306012332439423, "learning_rate": 6.86601036587236e-05, "loss": 0.7433, "mean_token_accuracy": 0.7744256146252155, "num_tokens": 326197363.0, "step": 10220 }, { "entropy": 0.6354440115392208, "epoch": 0.9403971225007332, "grad_norm": 0.14972570538520813, "learning_rate": 6.865703683258196e-05, "loss": 0.6269, "mean_token_accuracy": 0.8109714351594448, "num_tokens": 326229706.0, "step": 10221 }, { "entropy": 0.7949503306299448, "epoch": 0.9404891288721744, "grad_norm": 0.1568681299686432, "learning_rate": 6.865397000644033e-05, "loss": 0.7911, "mean_token_accuracy": 0.7654209993779659, "num_tokens": 326261586.0, "step": 10222 }, { "entropy": 0.8159114345908165, "epoch": 0.9405811352436156, "grad_norm": 0.16404984891414642, "learning_rate": 6.865090318029871e-05, "loss": 0.8163, "mean_token_accuracy": 0.7590224631130695, "num_tokens": 326293642.0, "step": 10223 }, { "entropy": 0.6509511629119515, "epoch": 0.9406731416150569, "grad_norm": 0.1594287008047104, "learning_rate": 6.86478363541571e-05, "loss": 0.6476, "mean_token_accuracy": 0.8082477636635303, "num_tokens": 326325709.0, "step": 10224 }, { "entropy": 0.7140600923448801, "epoch": 0.940765147986498, "grad_norm": 0.15128649771213531, "learning_rate": 6.864476952801546e-05, "loss": 0.715, "mean_token_accuracy": 0.7873488441109657, "num_tokens": 326357792.0, "step": 10225 }, { "entropy": 0.7309846244752407, "epoch": 0.9408571543579393, "grad_norm": 0.1568520963191986, "learning_rate": 6.864170270187383e-05, "loss": 0.731, "mean_token_accuracy": 0.782810527831316, "num_tokens": 326389270.0, "step": 10226 }, { "entropy": 0.7410568911582232, "epoch": 0.9409491607293805, "grad_norm": 0.16111113131046295, "learning_rate": 6.86386358757322e-05, "loss": 0.7327, "mean_token_accuracy": 0.7835461907088757, "num_tokens": 326421231.0, "step": 10227 }, { "entropy": 0.61137705296278, "epoch": 0.9410411671008218, "grad_norm": 0.18584522604942322, "learning_rate": 6.86355690495906e-05, "loss": 0.5844, "mean_token_accuracy": 0.8221396431326866, "num_tokens": 326452670.0, "step": 10228 }, { "entropy": 0.7358296941965818, "epoch": 0.941133173472263, "grad_norm": 0.1519259363412857, "learning_rate": 6.863250222344896e-05, "loss": 0.7308, "mean_token_accuracy": 0.7850101701915264, "num_tokens": 326484271.0, "step": 10229 }, { "entropy": 0.6720579452812672, "epoch": 0.9412251798437041, "grad_norm": 0.16491609811782837, "learning_rate": 6.862943539730733e-05, "loss": 0.6794, "mean_token_accuracy": 0.7996390797197819, "num_tokens": 326516700.0, "step": 10230 }, { "entropy": 0.5724028656259179, "epoch": 0.9413171862151454, "grad_norm": 0.14736048877239227, "learning_rate": 6.86263685711657e-05, "loss": 0.5422, "mean_token_accuracy": 0.8353749327361584, "num_tokens": 326548432.0, "step": 10231 }, { "entropy": 0.6638455335050821, "epoch": 0.9414091925865866, "grad_norm": 0.15493811666965485, "learning_rate": 6.862330174502408e-05, "loss": 0.6523, "mean_token_accuracy": 0.8107175230979919, "num_tokens": 326579834.0, "step": 10232 }, { "entropy": 0.7767457216978073, "epoch": 0.9415011989580279, "grad_norm": 0.15576167404651642, "learning_rate": 6.862023491888246e-05, "loss": 0.7685, "mean_token_accuracy": 0.7726990208029747, "num_tokens": 326611599.0, "step": 10233 }, { "entropy": 0.826952775940299, "epoch": 0.9415932053294691, "grad_norm": 0.16090598702430725, "learning_rate": 6.861716809274083e-05, "loss": 0.8191, "mean_token_accuracy": 0.7627857215702534, "num_tokens": 326643211.0, "step": 10234 }, { "entropy": 0.721154673025012, "epoch": 0.9416852117009102, "grad_norm": 0.15333406627178192, "learning_rate": 6.86141012665992e-05, "loss": 0.7068, "mean_token_accuracy": 0.7920170053839684, "num_tokens": 326675329.0, "step": 10235 }, { "entropy": 0.7062386628240347, "epoch": 0.9417772180723515, "grad_norm": 0.1497337818145752, "learning_rate": 6.861103444045758e-05, "loss": 0.6738, "mean_token_accuracy": 0.7980586849153042, "num_tokens": 326707576.0, "step": 10236 }, { "entropy": 0.8105028811842203, "epoch": 0.9418692244437927, "grad_norm": 0.15584246814250946, "learning_rate": 6.860796761431594e-05, "loss": 0.8146, "mean_token_accuracy": 0.7640279568731785, "num_tokens": 326739817.0, "step": 10237 }, { "entropy": 0.7024173736572266, "epoch": 0.941961230815234, "grad_norm": 0.15445125102996826, "learning_rate": 6.860490078817433e-05, "loss": 0.6932, "mean_token_accuracy": 0.7956416234374046, "num_tokens": 326771023.0, "step": 10238 }, { "entropy": 0.7596748024225235, "epoch": 0.9420532371866752, "grad_norm": 0.1645587831735611, "learning_rate": 6.86018339620327e-05, "loss": 0.7459, "mean_token_accuracy": 0.7764328494668007, "num_tokens": 326802482.0, "step": 10239 }, { "entropy": 0.7880463358014822, "epoch": 0.9421452435581164, "grad_norm": 0.15590660274028778, "learning_rate": 6.859876713589108e-05, "loss": 0.7595, "mean_token_accuracy": 0.7775643356144428, "num_tokens": 326834063.0, "step": 10240 }, { "entropy": 0.5685094054788351, "epoch": 0.9422372499295576, "grad_norm": 0.14119035005569458, "learning_rate": 6.859570030974944e-05, "loss": 0.5526, "mean_token_accuracy": 0.8341074474155903, "num_tokens": 326865632.0, "step": 10241 }, { "entropy": 0.7712514717131853, "epoch": 0.9423292563009988, "grad_norm": 0.1505737602710724, "learning_rate": 6.859263348360781e-05, "loss": 0.7671, "mean_token_accuracy": 0.77292275801301, "num_tokens": 326898026.0, "step": 10242 }, { "entropy": 0.6329084280878305, "epoch": 0.9424212626724401, "grad_norm": 0.15849122405052185, "learning_rate": 6.858956665746619e-05, "loss": 0.6247, "mean_token_accuracy": 0.8136962912976742, "num_tokens": 326930051.0, "step": 10243 }, { "entropy": 0.743819460272789, "epoch": 0.9425132690438813, "grad_norm": 0.15172813832759857, "learning_rate": 6.858649983132457e-05, "loss": 0.7261, "mean_token_accuracy": 0.7860636338591576, "num_tokens": 326962416.0, "step": 10244 }, { "entropy": 0.7510775960981846, "epoch": 0.9426052754153225, "grad_norm": 0.16291096806526184, "learning_rate": 6.858343300518294e-05, "loss": 0.7501, "mean_token_accuracy": 0.7797754406929016, "num_tokens": 326993703.0, "step": 10245 }, { "entropy": 0.7046045921742916, "epoch": 0.9426972817867637, "grad_norm": 0.155190110206604, "learning_rate": 6.858036617904131e-05, "loss": 0.6967, "mean_token_accuracy": 0.7907453961670399, "num_tokens": 327026385.0, "step": 10246 }, { "entropy": 0.7297260612249374, "epoch": 0.942789288158205, "grad_norm": 0.15695008635520935, "learning_rate": 6.857729935289968e-05, "loss": 0.7208, "mean_token_accuracy": 0.7900940291583538, "num_tokens": 327058209.0, "step": 10247 }, { "entropy": 0.7553333342075348, "epoch": 0.9428812945296462, "grad_norm": 0.1624874323606491, "learning_rate": 6.857423252675806e-05, "loss": 0.743, "mean_token_accuracy": 0.7820018902420998, "num_tokens": 327090377.0, "step": 10248 }, { "entropy": 0.7852437272667885, "epoch": 0.9429733009010874, "grad_norm": 0.16023242473602295, "learning_rate": 6.857116570061644e-05, "loss": 0.791, "mean_token_accuracy": 0.7702346965670586, "num_tokens": 327122481.0, "step": 10249 }, { "entropy": 0.5893347314558923, "epoch": 0.9430653072725286, "grad_norm": 0.15100273489952087, "learning_rate": 6.856809887447481e-05, "loss": 0.5867, "mean_token_accuracy": 0.8231504112482071, "num_tokens": 327154866.0, "step": 10250 }, { "entropy": 0.761835565790534, "epoch": 0.9431573136439698, "grad_norm": 0.1613786369562149, "learning_rate": 6.856503204833319e-05, "loss": 0.7721, "mean_token_accuracy": 0.7739069387316704, "num_tokens": 327187634.0, "step": 10251 }, { "entropy": 0.752957072108984, "epoch": 0.9432493200154111, "grad_norm": 0.15474851429462433, "learning_rate": 6.856196522219156e-05, "loss": 0.7517, "mean_token_accuracy": 0.7795467264950275, "num_tokens": 327219329.0, "step": 10252 }, { "entropy": 0.7854017056524754, "epoch": 0.9433413263868523, "grad_norm": 0.155962735414505, "learning_rate": 6.855889839604993e-05, "loss": 0.7875, "mean_token_accuracy": 0.7715791165828705, "num_tokens": 327251298.0, "step": 10253 }, { "entropy": 0.6386408880352974, "epoch": 0.9434333327582936, "grad_norm": 0.16241240501403809, "learning_rate": 6.855583156990831e-05, "loss": 0.6396, "mean_token_accuracy": 0.810828872025013, "num_tokens": 327283726.0, "step": 10254 }, { "entropy": 0.7947721257805824, "epoch": 0.9435253391297347, "grad_norm": 0.15866787731647491, "learning_rate": 6.855276474376669e-05, "loss": 0.7956, "mean_token_accuracy": 0.7664678990840912, "num_tokens": 327315789.0, "step": 10255 }, { "entropy": 0.6443138346076012, "epoch": 0.9436173455011759, "grad_norm": 0.14558905363082886, "learning_rate": 6.854969791762506e-05, "loss": 0.6357, "mean_token_accuracy": 0.8125547766685486, "num_tokens": 327347300.0, "step": 10256 }, { "entropy": 0.5813431283459067, "epoch": 0.9437093518726172, "grad_norm": 0.15731364488601685, "learning_rate": 6.854663109148342e-05, "loss": 0.5543, "mean_token_accuracy": 0.831223264336586, "num_tokens": 327379998.0, "step": 10257 }, { "entropy": 0.759287353605032, "epoch": 0.9438013582440584, "grad_norm": 0.15261337161064148, "learning_rate": 6.854356426534179e-05, "loss": 0.747, "mean_token_accuracy": 0.7787977829575539, "num_tokens": 327412331.0, "step": 10258 }, { "entropy": 0.7852251995354891, "epoch": 0.9438933646154997, "grad_norm": 0.15769319236278534, "learning_rate": 6.854049743920017e-05, "loss": 0.7803, "mean_token_accuracy": 0.7729426510632038, "num_tokens": 327444869.0, "step": 10259 }, { "entropy": 0.7724103406071663, "epoch": 0.9439853709869408, "grad_norm": 0.16673992574214935, "learning_rate": 6.853743061305855e-05, "loss": 0.7574, "mean_token_accuracy": 0.7779949344694614, "num_tokens": 327476918.0, "step": 10260 }, { "entropy": 0.7917922977358103, "epoch": 0.944077377358382, "grad_norm": 0.14707933366298676, "learning_rate": 6.853436378691692e-05, "loss": 0.7784, "mean_token_accuracy": 0.7681001462042332, "num_tokens": 327508881.0, "step": 10261 }, { "entropy": 0.7699980642646551, "epoch": 0.9441693837298233, "grad_norm": 0.16266222298145294, "learning_rate": 6.853129696077529e-05, "loss": 0.7351, "mean_token_accuracy": 0.7825841307640076, "num_tokens": 327540175.0, "step": 10262 }, { "entropy": 0.6927220430225134, "epoch": 0.9442613901012645, "grad_norm": 0.1594981700181961, "learning_rate": 6.852823013463367e-05, "loss": 0.6825, "mean_token_accuracy": 0.7973579801619053, "num_tokens": 327571640.0, "step": 10263 }, { "entropy": 0.6439159344881773, "epoch": 0.9443533964727058, "grad_norm": 0.14696477353572845, "learning_rate": 6.852516330849204e-05, "loss": 0.6286, "mean_token_accuracy": 0.8115537203848362, "num_tokens": 327603228.0, "step": 10264 }, { "entropy": 0.6609776299446821, "epoch": 0.9444454028441469, "grad_norm": 0.1481802612543106, "learning_rate": 6.852209648235042e-05, "loss": 0.6576, "mean_token_accuracy": 0.807225052267313, "num_tokens": 327635725.0, "step": 10265 }, { "entropy": 0.6196193341165781, "epoch": 0.9445374092155882, "grad_norm": 0.16480277478694916, "learning_rate": 6.851902965620879e-05, "loss": 0.6046, "mean_token_accuracy": 0.817658469080925, "num_tokens": 327667572.0, "step": 10266 }, { "entropy": 0.6424077972769737, "epoch": 0.9446294155870294, "grad_norm": 0.15999138355255127, "learning_rate": 6.851596283006717e-05, "loss": 0.6267, "mean_token_accuracy": 0.8194380663335323, "num_tokens": 327699107.0, "step": 10267 }, { "entropy": 0.7649979684501886, "epoch": 0.9447214219584706, "grad_norm": 0.16527801752090454, "learning_rate": 6.851289600392554e-05, "loss": 0.7517, "mean_token_accuracy": 0.7740330100059509, "num_tokens": 327730024.0, "step": 10268 }, { "entropy": 0.7123095486313105, "epoch": 0.9448134283299119, "grad_norm": 0.15189369022846222, "learning_rate": 6.85098291777839e-05, "loss": 0.6942, "mean_token_accuracy": 0.7916049435734749, "num_tokens": 327761463.0, "step": 10269 }, { "entropy": 0.7089124452322721, "epoch": 0.944905434701353, "grad_norm": 0.14614856243133545, "learning_rate": 6.850676235164229e-05, "loss": 0.7034, "mean_token_accuracy": 0.7924223393201828, "num_tokens": 327794115.0, "step": 10270 }, { "entropy": 0.7367655672132969, "epoch": 0.9449974410727943, "grad_norm": 0.15745142102241516, "learning_rate": 6.850369552550067e-05, "loss": 0.7246, "mean_token_accuracy": 0.7848134115338326, "num_tokens": 327825966.0, "step": 10271 }, { "entropy": 0.6902289371937513, "epoch": 0.9450894474442355, "grad_norm": 0.1657087504863739, "learning_rate": 6.850062869935904e-05, "loss": 0.6875, "mean_token_accuracy": 0.7951385080814362, "num_tokens": 327858549.0, "step": 10272 }, { "entropy": 0.6843404471874237, "epoch": 0.9451814538156768, "grad_norm": 0.15135960280895233, "learning_rate": 6.84975618732174e-05, "loss": 0.6628, "mean_token_accuracy": 0.8016533628106117, "num_tokens": 327890522.0, "step": 10273 }, { "entropy": 0.6690133027732372, "epoch": 0.945273460187118, "grad_norm": 0.15363626182079315, "learning_rate": 6.849449504707577e-05, "loss": 0.6627, "mean_token_accuracy": 0.8010441064834595, "num_tokens": 327922681.0, "step": 10274 }, { "entropy": 0.7162890676409006, "epoch": 0.9453654665585591, "grad_norm": 0.15165838599205017, "learning_rate": 6.849142822093417e-05, "loss": 0.7008, "mean_token_accuracy": 0.7939362563192844, "num_tokens": 327955449.0, "step": 10275 }, { "entropy": 0.7244958505034447, "epoch": 0.9454574729300004, "grad_norm": 0.15537843108177185, "learning_rate": 6.848836139479254e-05, "loss": 0.7249, "mean_token_accuracy": 0.7845965512096882, "num_tokens": 327987646.0, "step": 10276 }, { "entropy": 0.8555167317390442, "epoch": 0.9455494793014416, "grad_norm": 0.16201376914978027, "learning_rate": 6.84852945686509e-05, "loss": 0.8579, "mean_token_accuracy": 0.748564638197422, "num_tokens": 328019355.0, "step": 10277 }, { "entropy": 0.7270487304776907, "epoch": 0.9456414856728829, "grad_norm": 0.1523723602294922, "learning_rate": 6.848222774250927e-05, "loss": 0.6963, "mean_token_accuracy": 0.7890530750155449, "num_tokens": 328051237.0, "step": 10278 }, { "entropy": 0.7126069571822882, "epoch": 0.9457334920443241, "grad_norm": 0.15443724393844604, "learning_rate": 6.847916091636765e-05, "loss": 0.7062, "mean_token_accuracy": 0.7893201671540737, "num_tokens": 328083064.0, "step": 10279 }, { "entropy": 0.8223051410168409, "epoch": 0.9458254984157652, "grad_norm": 0.16107648611068726, "learning_rate": 6.847609409022603e-05, "loss": 0.8095, "mean_token_accuracy": 0.7585391663014889, "num_tokens": 328115063.0, "step": 10280 }, { "entropy": 0.7284814957529306, "epoch": 0.9459175047872065, "grad_norm": 0.15903064608573914, "learning_rate": 6.84730272640844e-05, "loss": 0.7145, "mean_token_accuracy": 0.7879007384181023, "num_tokens": 328146940.0, "step": 10281 }, { "entropy": 0.6974259093403816, "epoch": 0.9460095111586477, "grad_norm": 0.15483807027339935, "learning_rate": 6.846996043794278e-05, "loss": 0.7135, "mean_token_accuracy": 0.7872941009700298, "num_tokens": 328178362.0, "step": 10282 }, { "entropy": 0.6267587635666132, "epoch": 0.946101517530089, "grad_norm": 0.14746347069740295, "learning_rate": 6.846689361180115e-05, "loss": 0.6103, "mean_token_accuracy": 0.8171828649938107, "num_tokens": 328210724.0, "step": 10283 }, { "entropy": 0.7485371679067612, "epoch": 0.9461935239015302, "grad_norm": 0.15496504306793213, "learning_rate": 6.846382678565952e-05, "loss": 0.7328, "mean_token_accuracy": 0.7825896814465523, "num_tokens": 328242593.0, "step": 10284 }, { "entropy": 0.7129318099468946, "epoch": 0.9462855302729714, "grad_norm": 0.15777646005153656, "learning_rate": 6.84607599595179e-05, "loss": 0.703, "mean_token_accuracy": 0.7922272272408009, "num_tokens": 328274529.0, "step": 10285 }, { "entropy": 0.6156075457111001, "epoch": 0.9463775366444126, "grad_norm": 0.1528434455394745, "learning_rate": 6.845769313337628e-05, "loss": 0.6147, "mean_token_accuracy": 0.8134769909083843, "num_tokens": 328306954.0, "step": 10286 }, { "entropy": 0.7400847058743238, "epoch": 0.9464695430158538, "grad_norm": 0.16170033812522888, "learning_rate": 6.845462630723465e-05, "loss": 0.7483, "mean_token_accuracy": 0.7786560244858265, "num_tokens": 328339409.0, "step": 10287 }, { "entropy": 0.6700083632022142, "epoch": 0.9465615493872951, "grad_norm": 0.16100279986858368, "learning_rate": 6.845155948109302e-05, "loss": 0.6473, "mean_token_accuracy": 0.8059649765491486, "num_tokens": 328371384.0, "step": 10288 }, { "entropy": 0.8378865458071232, "epoch": 0.9466535557587363, "grad_norm": 0.163504496216774, "learning_rate": 6.844849265495139e-05, "loss": 0.8432, "mean_token_accuracy": 0.7534159682691097, "num_tokens": 328403752.0, "step": 10289 }, { "entropy": 0.7190609239041805, "epoch": 0.9467455621301775, "grad_norm": 0.15694665908813477, "learning_rate": 6.844542582880977e-05, "loss": 0.692, "mean_token_accuracy": 0.7948270030319691, "num_tokens": 328435020.0, "step": 10290 }, { "entropy": 0.5856334585696459, "epoch": 0.9468375685016187, "grad_norm": 0.1510893553495407, "learning_rate": 6.844235900266815e-05, "loss": 0.5779, "mean_token_accuracy": 0.8267110958695412, "num_tokens": 328467029.0, "step": 10291 }, { "entropy": 0.8239528499543667, "epoch": 0.94692957487306, "grad_norm": 0.15996317565441132, "learning_rate": 6.843929217652652e-05, "loss": 0.8141, "mean_token_accuracy": 0.7610402218997478, "num_tokens": 328498349.0, "step": 10292 }, { "entropy": 0.6855325326323509, "epoch": 0.9470215812445012, "grad_norm": 0.15924198925495148, "learning_rate": 6.843622535038488e-05, "loss": 0.6572, "mean_token_accuracy": 0.802146390080452, "num_tokens": 328530289.0, "step": 10293 }, { "entropy": 0.8513432946056128, "epoch": 0.9471135876159424, "grad_norm": 0.16020697355270386, "learning_rate": 6.843315852424327e-05, "loss": 0.8259, "mean_token_accuracy": 0.7598823942244053, "num_tokens": 328562920.0, "step": 10294 }, { "entropy": 0.6496013347059488, "epoch": 0.9472055939873836, "grad_norm": 0.14726974070072174, "learning_rate": 6.843009169810163e-05, "loss": 0.6245, "mean_token_accuracy": 0.8131667338311672, "num_tokens": 328594486.0, "step": 10295 }, { "entropy": 0.8018520437180996, "epoch": 0.9472976003588248, "grad_norm": 0.15916411578655243, "learning_rate": 6.842702487196002e-05, "loss": 0.7838, "mean_token_accuracy": 0.7722727358341217, "num_tokens": 328625552.0, "step": 10296 }, { "entropy": 0.6795486472547054, "epoch": 0.9473896067302661, "grad_norm": 0.15456868708133698, "learning_rate": 6.842395804581838e-05, "loss": 0.6575, "mean_token_accuracy": 0.8035749197006226, "num_tokens": 328656515.0, "step": 10297 }, { "entropy": 0.7545772902667522, "epoch": 0.9474816131017073, "grad_norm": 0.15400910377502441, "learning_rate": 6.842089121967676e-05, "loss": 0.734, "mean_token_accuracy": 0.7799118459224701, "num_tokens": 328689198.0, "step": 10298 }, { "entropy": 0.6595485396683216, "epoch": 0.9475736194731486, "grad_norm": 0.14935563504695892, "learning_rate": 6.841782439353513e-05, "loss": 0.6536, "mean_token_accuracy": 0.8041111901402473, "num_tokens": 328721933.0, "step": 10299 }, { "entropy": 0.7250062450766563, "epoch": 0.9476656258445897, "grad_norm": 0.15180587768554688, "learning_rate": 6.84147575673935e-05, "loss": 0.7164, "mean_token_accuracy": 0.7907767035067081, "num_tokens": 328754509.0, "step": 10300 }, { "entropy": 0.7398843094706535, "epoch": 0.9477576322160309, "grad_norm": 0.15686509013175964, "learning_rate": 6.841169074125188e-05, "loss": 0.7182, "mean_token_accuracy": 0.7886806055903435, "num_tokens": 328786927.0, "step": 10301 }, { "entropy": 0.7243082784116268, "epoch": 0.9478496385874722, "grad_norm": 0.15350216627120972, "learning_rate": 6.840862391511026e-05, "loss": 0.7169, "mean_token_accuracy": 0.7848932966589928, "num_tokens": 328818987.0, "step": 10302 }, { "entropy": 0.7942668218165636, "epoch": 0.9479416449589134, "grad_norm": 0.1576240360736847, "learning_rate": 6.840555708896863e-05, "loss": 0.7869, "mean_token_accuracy": 0.7669716812670231, "num_tokens": 328850132.0, "step": 10303 }, { "entropy": 0.6700397096574306, "epoch": 0.9480336513303547, "grad_norm": 0.15084582567214966, "learning_rate": 6.8402490262827e-05, "loss": 0.6588, "mean_token_accuracy": 0.8035118989646435, "num_tokens": 328882710.0, "step": 10304 }, { "entropy": 0.6904528848826885, "epoch": 0.9481256577017958, "grad_norm": 0.14988377690315247, "learning_rate": 6.839942343668537e-05, "loss": 0.681, "mean_token_accuracy": 0.797615434974432, "num_tokens": 328915090.0, "step": 10305 }, { "entropy": 0.676810160279274, "epoch": 0.948217664073237, "grad_norm": 0.14834477007389069, "learning_rate": 6.839635661054375e-05, "loss": 0.676, "mean_token_accuracy": 0.7989091947674751, "num_tokens": 328947446.0, "step": 10306 }, { "entropy": 0.7534959763288498, "epoch": 0.9483096704446783, "grad_norm": 0.16255152225494385, "learning_rate": 6.839328978440213e-05, "loss": 0.7619, "mean_token_accuracy": 0.7753321677446365, "num_tokens": 328979069.0, "step": 10307 }, { "entropy": 0.7448869049549103, "epoch": 0.9484016768161195, "grad_norm": 0.15851105749607086, "learning_rate": 6.83902229582605e-05, "loss": 0.7283, "mean_token_accuracy": 0.7881651520729065, "num_tokens": 329010987.0, "step": 10308 }, { "entropy": 0.666586569044739, "epoch": 0.9484936831875608, "grad_norm": 0.15496236085891724, "learning_rate": 6.838715613211887e-05, "loss": 0.6617, "mean_token_accuracy": 0.8076634965837002, "num_tokens": 329042548.0, "step": 10309 }, { "entropy": 0.7742556240409613, "epoch": 0.9485856895590019, "grad_norm": 0.15406490862369537, "learning_rate": 6.838408930597725e-05, "loss": 0.7638, "mean_token_accuracy": 0.7759901210665703, "num_tokens": 329074038.0, "step": 10310 }, { "entropy": 0.7554226946085691, "epoch": 0.9486776959304432, "grad_norm": 0.16249322891235352, "learning_rate": 6.838102247983563e-05, "loss": 0.7476, "mean_token_accuracy": 0.7810341082513332, "num_tokens": 329105042.0, "step": 10311 }, { "entropy": 0.747472308576107, "epoch": 0.9487697023018844, "grad_norm": 0.154374897480011, "learning_rate": 6.8377955653694e-05, "loss": 0.7413, "mean_token_accuracy": 0.786244984716177, "num_tokens": 329136481.0, "step": 10312 }, { "entropy": 0.8249295577406883, "epoch": 0.9488617086733256, "grad_norm": 0.15922503173351288, "learning_rate": 6.837488882755238e-05, "loss": 0.8218, "mean_token_accuracy": 0.7583281099796295, "num_tokens": 329168143.0, "step": 10313 }, { "entropy": 0.6936363000422716, "epoch": 0.9489537150447669, "grad_norm": 0.15313883125782013, "learning_rate": 6.837182200141075e-05, "loss": 0.6774, "mean_token_accuracy": 0.8020981848239899, "num_tokens": 329200062.0, "step": 10314 }, { "entropy": 0.711804574355483, "epoch": 0.949045721416208, "grad_norm": 0.1499633640050888, "learning_rate": 6.836875517526911e-05, "loss": 0.7012, "mean_token_accuracy": 0.7911785654723644, "num_tokens": 329231467.0, "step": 10315 }, { "entropy": 0.7636668048799038, "epoch": 0.9491377277876493, "grad_norm": 0.15395349264144897, "learning_rate": 6.83656883491275e-05, "loss": 0.764, "mean_token_accuracy": 0.7757800482213497, "num_tokens": 329263723.0, "step": 10316 }, { "entropy": 0.7769700158387423, "epoch": 0.9492297341590905, "grad_norm": 0.15673257410526276, "learning_rate": 6.836262152298588e-05, "loss": 0.7578, "mean_token_accuracy": 0.7797809429466724, "num_tokens": 329295839.0, "step": 10317 }, { "entropy": 0.7039863262325525, "epoch": 0.9493217405305318, "grad_norm": 0.1644108146429062, "learning_rate": 6.835955469684424e-05, "loss": 0.6958, "mean_token_accuracy": 0.7866733558475971, "num_tokens": 329326825.0, "step": 10318 }, { "entropy": 0.7463262835517526, "epoch": 0.949413746901973, "grad_norm": 0.15772227942943573, "learning_rate": 6.835648787070261e-05, "loss": 0.7329, "mean_token_accuracy": 0.7812688238918781, "num_tokens": 329358645.0, "step": 10319 }, { "entropy": 0.6704513747245073, "epoch": 0.9495057532734141, "grad_norm": 0.1560581922531128, "learning_rate": 6.835342104456098e-05, "loss": 0.6369, "mean_token_accuracy": 0.8078330755233765, "num_tokens": 329389703.0, "step": 10320 }, { "entropy": 0.8076649457216263, "epoch": 0.9495977596448554, "grad_norm": 0.1702118217945099, "learning_rate": 6.835035421841936e-05, "loss": 0.8077, "mean_token_accuracy": 0.7648176550865173, "num_tokens": 329421659.0, "step": 10321 }, { "entropy": 0.6783352103084326, "epoch": 0.9496897660162966, "grad_norm": 0.15081091225147247, "learning_rate": 6.834728739227774e-05, "loss": 0.6386, "mean_token_accuracy": 0.8096504062414169, "num_tokens": 329453698.0, "step": 10322 }, { "entropy": 0.6910475520417094, "epoch": 0.9497817723877379, "grad_norm": 0.15269412100315094, "learning_rate": 6.834422056613611e-05, "loss": 0.6633, "mean_token_accuracy": 0.8057943508028984, "num_tokens": 329486055.0, "step": 10323 }, { "entropy": 0.6840794142335653, "epoch": 0.9498737787591791, "grad_norm": 0.15452580153942108, "learning_rate": 6.834115373999448e-05, "loss": 0.6629, "mean_token_accuracy": 0.8011512719094753, "num_tokens": 329518356.0, "step": 10324 }, { "entropy": 0.7017823867499828, "epoch": 0.9499657851306202, "grad_norm": 0.15440934896469116, "learning_rate": 6.833808691385286e-05, "loss": 0.6912, "mean_token_accuracy": 0.7929501384496689, "num_tokens": 329550302.0, "step": 10325 }, { "entropy": 0.6907314918935299, "epoch": 0.9500577915020615, "grad_norm": 0.1529570072889328, "learning_rate": 6.833502008771123e-05, "loss": 0.6827, "mean_token_accuracy": 0.7938347607851028, "num_tokens": 329581932.0, "step": 10326 }, { "entropy": 0.6697320286184549, "epoch": 0.9501497978735027, "grad_norm": 0.1545184999704361, "learning_rate": 6.833195326156961e-05, "loss": 0.6656, "mean_token_accuracy": 0.8026415407657623, "num_tokens": 329613485.0, "step": 10327 }, { "entropy": 0.718242515809834, "epoch": 0.950241804244944, "grad_norm": 0.17164349555969238, "learning_rate": 6.832888643542798e-05, "loss": 0.7213, "mean_token_accuracy": 0.7849012687802315, "num_tokens": 329644830.0, "step": 10328 }, { "entropy": 0.8030125461518764, "epoch": 0.9503338106163852, "grad_norm": 0.15431763231754303, "learning_rate": 6.832581960928636e-05, "loss": 0.7851, "mean_token_accuracy": 0.7674397937953472, "num_tokens": 329676834.0, "step": 10329 }, { "entropy": 0.629848881624639, "epoch": 0.9504258169878264, "grad_norm": 0.1494298279285431, "learning_rate": 6.832275278314473e-05, "loss": 0.6271, "mean_token_accuracy": 0.8117061480879784, "num_tokens": 329709602.0, "step": 10330 }, { "entropy": 0.5959222931414843, "epoch": 0.9505178233592676, "grad_norm": 0.15927089750766754, "learning_rate": 6.83196859570031e-05, "loss": 0.583, "mean_token_accuracy": 0.8255954794585705, "num_tokens": 329741358.0, "step": 10331 }, { "entropy": 0.7131360387429595, "epoch": 0.9506098297307088, "grad_norm": 0.15496760606765747, "learning_rate": 6.831661913086148e-05, "loss": 0.6978, "mean_token_accuracy": 0.7916103638708591, "num_tokens": 329773700.0, "step": 10332 }, { "entropy": 0.6765552032738924, "epoch": 0.9507018361021501, "grad_norm": 0.15333731472492218, "learning_rate": 6.831355230471986e-05, "loss": 0.6813, "mean_token_accuracy": 0.7967240139842033, "num_tokens": 329806434.0, "step": 10333 }, { "entropy": 0.5991768725216389, "epoch": 0.9507938424735913, "grad_norm": 0.15126122534275055, "learning_rate": 6.831048547857822e-05, "loss": 0.5852, "mean_token_accuracy": 0.8215456381440163, "num_tokens": 329837821.0, "step": 10334 }, { "entropy": 0.6920499000698328, "epoch": 0.9508858488450325, "grad_norm": 0.1542934775352478, "learning_rate": 6.830741865243659e-05, "loss": 0.6846, "mean_token_accuracy": 0.8013885542750359, "num_tokens": 329869128.0, "step": 10335 }, { "entropy": 0.7834386443719268, "epoch": 0.9509778552164737, "grad_norm": 0.1553724706172943, "learning_rate": 6.830435182629496e-05, "loss": 0.7711, "mean_token_accuracy": 0.7717783525586128, "num_tokens": 329901315.0, "step": 10336 }, { "entropy": 0.751272976398468, "epoch": 0.951069861587915, "grad_norm": 0.16046187281608582, "learning_rate": 6.830128500015334e-05, "loss": 0.7444, "mean_token_accuracy": 0.7774026989936829, "num_tokens": 329933243.0, "step": 10337 }, { "entropy": 0.72953275218606, "epoch": 0.9511618679593562, "grad_norm": 0.15783913433551788, "learning_rate": 6.829821817401172e-05, "loss": 0.7315, "mean_token_accuracy": 0.779413241893053, "num_tokens": 329964825.0, "step": 10338 }, { "entropy": 0.7632519965991378, "epoch": 0.9512538743307974, "grad_norm": 0.15950921177864075, "learning_rate": 6.829515134787009e-05, "loss": 0.7403, "mean_token_accuracy": 0.7844377271831036, "num_tokens": 329996911.0, "step": 10339 }, { "entropy": 0.7003697939217091, "epoch": 0.9513458807022386, "grad_norm": 0.1544104665517807, "learning_rate": 6.829208452172846e-05, "loss": 0.6899, "mean_token_accuracy": 0.7947129681706429, "num_tokens": 330028137.0, "step": 10340 }, { "entropy": 0.699734952300787, "epoch": 0.9514378870736798, "grad_norm": 0.1592847853899002, "learning_rate": 6.828901769558684e-05, "loss": 0.6784, "mean_token_accuracy": 0.799206305295229, "num_tokens": 330060519.0, "step": 10341 }, { "entropy": 0.7755158264189959, "epoch": 0.9515298934451211, "grad_norm": 0.15504035353660583, "learning_rate": 6.828595086944521e-05, "loss": 0.757, "mean_token_accuracy": 0.7730560526251793, "num_tokens": 330091834.0, "step": 10342 }, { "entropy": 0.6983494674786925, "epoch": 0.9516218998165623, "grad_norm": 0.1663280576467514, "learning_rate": 6.828288404330359e-05, "loss": 0.6949, "mean_token_accuracy": 0.7930177189409733, "num_tokens": 330123821.0, "step": 10343 }, { "entropy": 0.6716302875429392, "epoch": 0.9517139061880036, "grad_norm": 0.14703315496444702, "learning_rate": 6.827981721716197e-05, "loss": 0.6578, "mean_token_accuracy": 0.8033426031470299, "num_tokens": 330155946.0, "step": 10344 }, { "entropy": 0.6715113278478384, "epoch": 0.9518059125594447, "grad_norm": 0.17111022770404816, "learning_rate": 6.827675039102034e-05, "loss": 0.6627, "mean_token_accuracy": 0.8027927540242672, "num_tokens": 330186146.0, "step": 10345 }, { "entropy": 0.7144035925157368, "epoch": 0.9518979189308859, "grad_norm": 0.15415389835834503, "learning_rate": 6.827368356487871e-05, "loss": 0.6963, "mean_token_accuracy": 0.7901563346385956, "num_tokens": 330217569.0, "step": 10346 }, { "entropy": 0.5822206549346447, "epoch": 0.9519899253023272, "grad_norm": 0.1554756909608841, "learning_rate": 6.827061673873707e-05, "loss": 0.5481, "mean_token_accuracy": 0.8331722132861614, "num_tokens": 330249549.0, "step": 10347 }, { "entropy": 0.6906355638056993, "epoch": 0.9520819316737684, "grad_norm": 0.14547686278820038, "learning_rate": 6.826754991259547e-05, "loss": 0.671, "mean_token_accuracy": 0.8048881441354752, "num_tokens": 330281272.0, "step": 10348 }, { "entropy": 0.5610641781240702, "epoch": 0.9521739380452097, "grad_norm": 0.14641766250133514, "learning_rate": 6.826448308645384e-05, "loss": 0.5414, "mean_token_accuracy": 0.8341645672917366, "num_tokens": 330312976.0, "step": 10349 }, { "entropy": 0.7535094954073429, "epoch": 0.9522659444166508, "grad_norm": 0.1585170179605484, "learning_rate": 6.82614162603122e-05, "loss": 0.7485, "mean_token_accuracy": 0.7790782302618027, "num_tokens": 330345151.0, "step": 10350 }, { "entropy": 0.7332879174500704, "epoch": 0.952357950788092, "grad_norm": 0.1494898796081543, "learning_rate": 6.825834943417057e-05, "loss": 0.7317, "mean_token_accuracy": 0.7851615622639656, "num_tokens": 330377260.0, "step": 10351 }, { "entropy": 0.7531126365065575, "epoch": 0.9524499571595333, "grad_norm": 0.1499609500169754, "learning_rate": 6.825528260802895e-05, "loss": 0.7477, "mean_token_accuracy": 0.7790671400725842, "num_tokens": 330409412.0, "step": 10352 }, { "entropy": 0.7712447289377451, "epoch": 0.9525419635309745, "grad_norm": 0.16035711765289307, "learning_rate": 6.825221578188734e-05, "loss": 0.7622, "mean_token_accuracy": 0.7748049907386303, "num_tokens": 330440666.0, "step": 10353 }, { "entropy": 0.7784079490229487, "epoch": 0.9526339699024158, "grad_norm": 0.15622101724147797, "learning_rate": 6.82491489557457e-05, "loss": 0.755, "mean_token_accuracy": 0.7761527560651302, "num_tokens": 330472824.0, "step": 10354 }, { "entropy": 0.7365318667143583, "epoch": 0.9527259762738569, "grad_norm": 0.15841032564640045, "learning_rate": 6.824608212960407e-05, "loss": 0.7031, "mean_token_accuracy": 0.7872166335582733, "num_tokens": 330503659.0, "step": 10355 }, { "entropy": 0.7545578312128782, "epoch": 0.9528179826452982, "grad_norm": 0.15412180125713348, "learning_rate": 6.824301530346245e-05, "loss": 0.7503, "mean_token_accuracy": 0.777005348354578, "num_tokens": 330534614.0, "step": 10356 }, { "entropy": 0.7202246319502592, "epoch": 0.9529099890167394, "grad_norm": 0.1544807404279709, "learning_rate": 6.823994847732082e-05, "loss": 0.7035, "mean_token_accuracy": 0.7904775477945805, "num_tokens": 330566358.0, "step": 10357 }, { "entropy": 0.6793606076389551, "epoch": 0.9530019953881806, "grad_norm": 0.15205572545528412, "learning_rate": 6.82368816511792e-05, "loss": 0.6576, "mean_token_accuracy": 0.8032529763877392, "num_tokens": 330598257.0, "step": 10358 }, { "entropy": 0.6657685688696802, "epoch": 0.9530940017596219, "grad_norm": 0.14847935736179352, "learning_rate": 6.823381482503757e-05, "loss": 0.6576, "mean_token_accuracy": 0.8071863390505314, "num_tokens": 330629656.0, "step": 10359 }, { "entropy": 0.8413185738027096, "epoch": 0.953186008131063, "grad_norm": 0.1589173525571823, "learning_rate": 6.823074799889595e-05, "loss": 0.8278, "mean_token_accuracy": 0.7557625398039818, "num_tokens": 330660471.0, "step": 10360 }, { "entropy": 0.5988645711913705, "epoch": 0.9532780145025043, "grad_norm": 0.15095260739326477, "learning_rate": 6.822768117275432e-05, "loss": 0.6038, "mean_token_accuracy": 0.8185758404433727, "num_tokens": 330692540.0, "step": 10361 }, { "entropy": 0.7170590162277222, "epoch": 0.9533700208739455, "grad_norm": 0.1654355674982071, "learning_rate": 6.822461434661269e-05, "loss": 0.717, "mean_token_accuracy": 0.7872217446565628, "num_tokens": 330724251.0, "step": 10362 }, { "entropy": 0.7426900770515203, "epoch": 0.9534620272453868, "grad_norm": 0.1547955721616745, "learning_rate": 6.822154752047107e-05, "loss": 0.743, "mean_token_accuracy": 0.7797574996948242, "num_tokens": 330756705.0, "step": 10363 }, { "entropy": 0.7068341113626957, "epoch": 0.953554033616828, "grad_norm": 0.15573282539844513, "learning_rate": 6.821848069432945e-05, "loss": 0.6923, "mean_token_accuracy": 0.7947261370718479, "num_tokens": 330788313.0, "step": 10364 }, { "entropy": 0.6831525526940823, "epoch": 0.9536460399882691, "grad_norm": 0.15726906061172485, "learning_rate": 6.821541386818782e-05, "loss": 0.6689, "mean_token_accuracy": 0.7964128144085407, "num_tokens": 330819628.0, "step": 10365 }, { "entropy": 0.7024758234620094, "epoch": 0.9537380463597104, "grad_norm": 0.1533324271440506, "learning_rate": 6.821234704204619e-05, "loss": 0.6983, "mean_token_accuracy": 0.794379822909832, "num_tokens": 330850323.0, "step": 10366 }, { "entropy": 0.7304856879636645, "epoch": 0.9538300527311516, "grad_norm": 0.1612171232700348, "learning_rate": 6.820928021590455e-05, "loss": 0.7181, "mean_token_accuracy": 0.7858642600476742, "num_tokens": 330882397.0, "step": 10367 }, { "entropy": 0.7194500174373388, "epoch": 0.9539220591025929, "grad_norm": 0.16906310617923737, "learning_rate": 6.820621338976294e-05, "loss": 0.7083, "mean_token_accuracy": 0.79090765863657, "num_tokens": 330914400.0, "step": 10368 }, { "entropy": 0.7798740491271019, "epoch": 0.9540140654740341, "grad_norm": 0.16032767295837402, "learning_rate": 6.820314656362132e-05, "loss": 0.7843, "mean_token_accuracy": 0.770420353859663, "num_tokens": 330946518.0, "step": 10369 }, { "entropy": 0.7835494428873062, "epoch": 0.9541060718454752, "grad_norm": 0.15782110393047333, "learning_rate": 6.820007973747968e-05, "loss": 0.7558, "mean_token_accuracy": 0.7751386798918247, "num_tokens": 330978750.0, "step": 10370 }, { "entropy": 0.7999539375305176, "epoch": 0.9541980782169165, "grad_norm": 0.16153496503829956, "learning_rate": 6.819701291133805e-05, "loss": 0.7845, "mean_token_accuracy": 0.7636932954192162, "num_tokens": 331010946.0, "step": 10371 }, { "entropy": 0.720542473718524, "epoch": 0.9542900845883577, "grad_norm": 0.16235938668251038, "learning_rate": 6.819394608519643e-05, "loss": 0.7214, "mean_token_accuracy": 0.7825980111956596, "num_tokens": 331042486.0, "step": 10372 }, { "entropy": 0.687037056311965, "epoch": 0.954382090959799, "grad_norm": 0.16294613480567932, "learning_rate": 6.81908792590548e-05, "loss": 0.653, "mean_token_accuracy": 0.8043670579791069, "num_tokens": 331073518.0, "step": 10373 }, { "entropy": 0.6109270863234997, "epoch": 0.9544740973312402, "grad_norm": 0.14858472347259521, "learning_rate": 6.818781243291318e-05, "loss": 0.6053, "mean_token_accuracy": 0.8198653161525726, "num_tokens": 331105482.0, "step": 10374 }, { "entropy": 0.7381099797785282, "epoch": 0.9545661037026814, "grad_norm": 0.15823811292648315, "learning_rate": 6.818474560677156e-05, "loss": 0.734, "mean_token_accuracy": 0.7846692986786366, "num_tokens": 331137739.0, "step": 10375 }, { "entropy": 0.739355331286788, "epoch": 0.9546581100741226, "grad_norm": 0.1624433547258377, "learning_rate": 6.818167878062993e-05, "loss": 0.7325, "mean_token_accuracy": 0.7864391021430492, "num_tokens": 331169520.0, "step": 10376 }, { "entropy": 0.7441974394023418, "epoch": 0.9547501164455638, "grad_norm": 0.15793685615062714, "learning_rate": 6.81786119544883e-05, "loss": 0.7435, "mean_token_accuracy": 0.7881110832095146, "num_tokens": 331201539.0, "step": 10377 }, { "entropy": 0.6673200316727161, "epoch": 0.9548421228170051, "grad_norm": 0.14708095788955688, "learning_rate": 6.817554512834667e-05, "loss": 0.6446, "mean_token_accuracy": 0.8022946082055569, "num_tokens": 331232662.0, "step": 10378 }, { "entropy": 0.7148380745202303, "epoch": 0.9549341291884463, "grad_norm": 0.16837042570114136, "learning_rate": 6.817247830220505e-05, "loss": 0.7191, "mean_token_accuracy": 0.7895751893520355, "num_tokens": 331264172.0, "step": 10379 }, { "entropy": 0.6926519572734833, "epoch": 0.9550261355598875, "grad_norm": 0.14734429121017456, "learning_rate": 6.816941147606343e-05, "loss": 0.6904, "mean_token_accuracy": 0.7962998487055302, "num_tokens": 331296645.0, "step": 10380 }, { "entropy": 0.6049151439219713, "epoch": 0.9551181419313287, "grad_norm": 0.14170698821544647, "learning_rate": 6.81663446499218e-05, "loss": 0.5888, "mean_token_accuracy": 0.824204184114933, "num_tokens": 331328779.0, "step": 10381 }, { "entropy": 0.6051322063431144, "epoch": 0.95521014830277, "grad_norm": 0.16112157702445984, "learning_rate": 6.816327782378017e-05, "loss": 0.5763, "mean_token_accuracy": 0.8225452862679958, "num_tokens": 331360472.0, "step": 10382 }, { "entropy": 0.6930302958935499, "epoch": 0.9553021546742112, "grad_norm": 0.15064461529254913, "learning_rate": 6.816021099763855e-05, "loss": 0.6908, "mean_token_accuracy": 0.7972472757101059, "num_tokens": 331392625.0, "step": 10383 }, { "entropy": 0.7574808867648244, "epoch": 0.9553941610456524, "grad_norm": 0.14804288744926453, "learning_rate": 6.815714417149692e-05, "loss": 0.7498, "mean_token_accuracy": 0.7766664922237396, "num_tokens": 331424942.0, "step": 10384 }, { "entropy": 0.7384954579174519, "epoch": 0.9554861674170936, "grad_norm": 0.15282543003559113, "learning_rate": 6.81540773453553e-05, "loss": 0.7183, "mean_token_accuracy": 0.7845971398055553, "num_tokens": 331457123.0, "step": 10385 }, { "entropy": 0.7885136064141989, "epoch": 0.9555781737885348, "grad_norm": 0.162718266248703, "learning_rate": 6.815101051921367e-05, "loss": 0.7665, "mean_token_accuracy": 0.7750266641378403, "num_tokens": 331488590.0, "step": 10386 }, { "entropy": 0.7341670067980886, "epoch": 0.9556701801599761, "grad_norm": 0.1648067831993103, "learning_rate": 6.814794369307205e-05, "loss": 0.7344, "mean_token_accuracy": 0.7846819348633289, "num_tokens": 331520471.0, "step": 10387 }, { "entropy": 0.7197143957018852, "epoch": 0.9557621865314173, "grad_norm": 0.15455861389636993, "learning_rate": 6.814487686693041e-05, "loss": 0.6978, "mean_token_accuracy": 0.7926844172179699, "num_tokens": 331553239.0, "step": 10388 }, { "entropy": 0.6906748618930578, "epoch": 0.9558541929028586, "grad_norm": 0.1478624939918518, "learning_rate": 6.814181004078878e-05, "loss": 0.6789, "mean_token_accuracy": 0.7994207590818405, "num_tokens": 331585543.0, "step": 10389 }, { "entropy": 0.6510620024055243, "epoch": 0.9559461992742997, "grad_norm": 0.15086205303668976, "learning_rate": 6.813874321464716e-05, "loss": 0.6364, "mean_token_accuracy": 0.8057578913867474, "num_tokens": 331616406.0, "step": 10390 }, { "entropy": 0.6300481921061873, "epoch": 0.9560382056457409, "grad_norm": 0.14670509099960327, "learning_rate": 6.813567638850555e-05, "loss": 0.5895, "mean_token_accuracy": 0.8223542906343937, "num_tokens": 331648611.0, "step": 10391 }, { "entropy": 0.805447407066822, "epoch": 0.9561302120171822, "grad_norm": 0.15985581278800964, "learning_rate": 6.813260956236391e-05, "loss": 0.8057, "mean_token_accuracy": 0.7615090124309063, "num_tokens": 331680226.0, "step": 10392 }, { "entropy": 0.7411986812949181, "epoch": 0.9562222183886234, "grad_norm": 0.1552794724702835, "learning_rate": 6.812954273622228e-05, "loss": 0.7273, "mean_token_accuracy": 0.7850522138178349, "num_tokens": 331711885.0, "step": 10393 }, { "entropy": 0.7745989188551903, "epoch": 0.9563142247600647, "grad_norm": 0.167907252907753, "learning_rate": 6.812647591008065e-05, "loss": 0.7616, "mean_token_accuracy": 0.7739268839359283, "num_tokens": 331743836.0, "step": 10394 }, { "entropy": 0.7046617604792118, "epoch": 0.9564062311315058, "grad_norm": 0.15686923265457153, "learning_rate": 6.812340908393904e-05, "loss": 0.6926, "mean_token_accuracy": 0.7946471460163593, "num_tokens": 331776090.0, "step": 10395 }, { "entropy": 0.6639353046193719, "epoch": 0.956498237502947, "grad_norm": 0.16695290803909302, "learning_rate": 6.812034225779741e-05, "loss": 0.6543, "mean_token_accuracy": 0.8067062087357044, "num_tokens": 331808302.0, "step": 10396 }, { "entropy": 0.6614685468375683, "epoch": 0.9565902438743883, "grad_norm": 0.1518082320690155, "learning_rate": 6.811727543165578e-05, "loss": 0.6507, "mean_token_accuracy": 0.8040320798754692, "num_tokens": 331840909.0, "step": 10397 }, { "entropy": 0.6607112372294068, "epoch": 0.9566822502458295, "grad_norm": 0.14555080235004425, "learning_rate": 6.811420860551415e-05, "loss": 0.6531, "mean_token_accuracy": 0.8050027564167976, "num_tokens": 331872952.0, "step": 10398 }, { "entropy": 0.7946364339441061, "epoch": 0.9567742566172708, "grad_norm": 0.1572858989238739, "learning_rate": 6.811114177937253e-05, "loss": 0.7981, "mean_token_accuracy": 0.7643549516797066, "num_tokens": 331905109.0, "step": 10399 }, { "entropy": 0.6281259199604392, "epoch": 0.9568662629887119, "grad_norm": 0.1459970921278, "learning_rate": 6.810807495323091e-05, "loss": 0.6115, "mean_token_accuracy": 0.8164280354976654, "num_tokens": 331936399.0, "step": 10400 }, { "entropy": 0.6092888973653316, "epoch": 0.9569582693601532, "grad_norm": 0.15422403812408447, "learning_rate": 6.810500812708928e-05, "loss": 0.6034, "mean_token_accuracy": 0.820247009396553, "num_tokens": 331967757.0, "step": 10401 }, { "entropy": 0.7659487500786781, "epoch": 0.9570502757315944, "grad_norm": 0.1627964824438095, "learning_rate": 6.810194130094765e-05, "loss": 0.7881, "mean_token_accuracy": 0.7730962820351124, "num_tokens": 331998907.0, "step": 10402 }, { "entropy": 0.6827439526095986, "epoch": 0.9571422821030356, "grad_norm": 0.15675345063209534, "learning_rate": 6.809887447480603e-05, "loss": 0.6569, "mean_token_accuracy": 0.8044237121939659, "num_tokens": 332030623.0, "step": 10403 }, { "entropy": 0.7115828655660152, "epoch": 0.9572342884744769, "grad_norm": 0.15495802462100983, "learning_rate": 6.80958076486644e-05, "loss": 0.7083, "mean_token_accuracy": 0.7914004512131214, "num_tokens": 332063261.0, "step": 10404 }, { "entropy": 0.776873804628849, "epoch": 0.957326294845918, "grad_norm": 0.15778258442878723, "learning_rate": 6.809274082252278e-05, "loss": 0.7605, "mean_token_accuracy": 0.7788488157093525, "num_tokens": 332094767.0, "step": 10405 }, { "entropy": 0.7298601940274239, "epoch": 0.9574183012173593, "grad_norm": 0.15925809741020203, "learning_rate": 6.808967399638116e-05, "loss": 0.7103, "mean_token_accuracy": 0.7893152721226215, "num_tokens": 332127269.0, "step": 10406 }, { "entropy": 0.6768114045262337, "epoch": 0.9575103075888005, "grad_norm": 0.1655510663986206, "learning_rate": 6.808660717023953e-05, "loss": 0.6667, "mean_token_accuracy": 0.8067215792834759, "num_tokens": 332158612.0, "step": 10407 }, { "entropy": 0.6903613340109587, "epoch": 0.9576023139602418, "grad_norm": 0.15687842667102814, "learning_rate": 6.80835403440979e-05, "loss": 0.6745, "mean_token_accuracy": 0.8008562661707401, "num_tokens": 332190577.0, "step": 10408 }, { "entropy": 0.5958782425150275, "epoch": 0.957694320331683, "grad_norm": 0.14586122334003448, "learning_rate": 6.808047351795626e-05, "loss": 0.5837, "mean_token_accuracy": 0.8267413713037968, "num_tokens": 332222689.0, "step": 10409 }, { "entropy": 0.615108042024076, "epoch": 0.9577863267031242, "grad_norm": 0.15335136651992798, "learning_rate": 6.807740669181464e-05, "loss": 0.5906, "mean_token_accuracy": 0.8237563110888004, "num_tokens": 332254877.0, "step": 10410 }, { "entropy": 0.7984740901738405, "epoch": 0.9578783330745654, "grad_norm": 0.16249743103981018, "learning_rate": 6.807433986567303e-05, "loss": 0.7843, "mean_token_accuracy": 0.7708918713033199, "num_tokens": 332286589.0, "step": 10411 }, { "entropy": 0.7338308542966843, "epoch": 0.9579703394460066, "grad_norm": 0.15629039704799652, "learning_rate": 6.807127303953139e-05, "loss": 0.731, "mean_token_accuracy": 0.7853407189249992, "num_tokens": 332318788.0, "step": 10412 }, { "entropy": 0.565003227442503, "epoch": 0.9580623458174479, "grad_norm": 0.15016482770442963, "learning_rate": 6.806820621338976e-05, "loss": 0.5496, "mean_token_accuracy": 0.8307982720434666, "num_tokens": 332350863.0, "step": 10413 }, { "entropy": 0.7665461823344231, "epoch": 0.9581543521888891, "grad_norm": 0.15949726104736328, "learning_rate": 6.806513938724814e-05, "loss": 0.7501, "mean_token_accuracy": 0.7824391908943653, "num_tokens": 332382336.0, "step": 10414 }, { "entropy": 0.7284893468022346, "epoch": 0.9582463585603304, "grad_norm": 0.15831369161605835, "learning_rate": 6.806207256110651e-05, "loss": 0.7211, "mean_token_accuracy": 0.7870792783796787, "num_tokens": 332414933.0, "step": 10415 }, { "entropy": 0.7411925792694092, "epoch": 0.9583383649317715, "grad_norm": 0.1565663069486618, "learning_rate": 6.805900573496489e-05, "loss": 0.7145, "mean_token_accuracy": 0.7858598716557026, "num_tokens": 332445947.0, "step": 10416 }, { "entropy": 0.7581945564597845, "epoch": 0.9584303713032127, "grad_norm": 0.16065749526023865, "learning_rate": 6.805593890882326e-05, "loss": 0.7283, "mean_token_accuracy": 0.7843787483870983, "num_tokens": 332477643.0, "step": 10417 }, { "entropy": 0.581575183197856, "epoch": 0.958522377674654, "grad_norm": 0.1426018923521042, "learning_rate": 6.805287208268164e-05, "loss": 0.5639, "mean_token_accuracy": 0.8259046338498592, "num_tokens": 332509291.0, "step": 10418 }, { "entropy": 0.79386773891747, "epoch": 0.9586143840460952, "grad_norm": 0.152455136179924, "learning_rate": 6.804980525654001e-05, "loss": 0.7889, "mean_token_accuracy": 0.7661974132061005, "num_tokens": 332540783.0, "step": 10419 }, { "entropy": 0.6863946178928018, "epoch": 0.9587063904175365, "grad_norm": 0.15365168452262878, "learning_rate": 6.804673843039838e-05, "loss": 0.6698, "mean_token_accuracy": 0.8025994226336479, "num_tokens": 332572731.0, "step": 10420 }, { "entropy": 0.6888884101063013, "epoch": 0.9587983967889776, "grad_norm": 0.1536545604467392, "learning_rate": 6.804367160425676e-05, "loss": 0.6787, "mean_token_accuracy": 0.7975575514137745, "num_tokens": 332604878.0, "step": 10421 }, { "entropy": 0.7861401326954365, "epoch": 0.9588904031604188, "grad_norm": 0.15668457746505737, "learning_rate": 6.804060477811514e-05, "loss": 0.7828, "mean_token_accuracy": 0.7684304490685463, "num_tokens": 332636410.0, "step": 10422 }, { "entropy": 0.7559653669595718, "epoch": 0.9589824095318601, "grad_norm": 0.157333105802536, "learning_rate": 6.803753795197351e-05, "loss": 0.7536, "mean_token_accuracy": 0.777506485581398, "num_tokens": 332667583.0, "step": 10423 }, { "entropy": 0.72782345674932, "epoch": 0.9590744159033013, "grad_norm": 0.15118083357810974, "learning_rate": 6.803447112583188e-05, "loss": 0.7152, "mean_token_accuracy": 0.7906947396695614, "num_tokens": 332698780.0, "step": 10424 }, { "entropy": 0.7501499224454165, "epoch": 0.9591664222747426, "grad_norm": 0.15752235054969788, "learning_rate": 6.803140429969024e-05, "loss": 0.7405, "mean_token_accuracy": 0.7784449532628059, "num_tokens": 332730944.0, "step": 10425 }, { "entropy": 0.7977633578702807, "epoch": 0.9592584286461837, "grad_norm": 0.15883994102478027, "learning_rate": 6.802833747354862e-05, "loss": 0.8016, "mean_token_accuracy": 0.7701890729367733, "num_tokens": 332762971.0, "step": 10426 }, { "entropy": 0.6104874247685075, "epoch": 0.959350435017625, "grad_norm": 0.1530519425868988, "learning_rate": 6.8025270647407e-05, "loss": 0.6047, "mean_token_accuracy": 0.8181096278131008, "num_tokens": 332795422.0, "step": 10427 }, { "entropy": 0.7724782451987267, "epoch": 0.9594424413890662, "grad_norm": 0.15339310467243195, "learning_rate": 6.802220382126537e-05, "loss": 0.7635, "mean_token_accuracy": 0.7774289511144161, "num_tokens": 332826653.0, "step": 10428 }, { "entropy": 0.5871471241116524, "epoch": 0.9595344477605074, "grad_norm": 0.1512991040945053, "learning_rate": 6.801913699512374e-05, "loss": 0.5773, "mean_token_accuracy": 0.8248698525130749, "num_tokens": 332858534.0, "step": 10429 }, { "entropy": 0.7078781519085169, "epoch": 0.9596264541319487, "grad_norm": 0.16004393994808197, "learning_rate": 6.801607016898212e-05, "loss": 0.6915, "mean_token_accuracy": 0.7923189625144005, "num_tokens": 332890323.0, "step": 10430 }, { "entropy": 0.6549162659794092, "epoch": 0.9597184605033898, "grad_norm": 0.16350652277469635, "learning_rate": 6.80130033428405e-05, "loss": 0.641, "mean_token_accuracy": 0.8091638162732124, "num_tokens": 332921677.0, "step": 10431 }, { "entropy": 0.7088744603097439, "epoch": 0.9598104668748311, "grad_norm": 0.15665943920612335, "learning_rate": 6.800993651669887e-05, "loss": 0.7025, "mean_token_accuracy": 0.7882219031453133, "num_tokens": 332954044.0, "step": 10432 }, { "entropy": 0.6643048394471407, "epoch": 0.9599024732462723, "grad_norm": 0.1399981528520584, "learning_rate": 6.800686969055725e-05, "loss": 0.6277, "mean_token_accuracy": 0.8100103288888931, "num_tokens": 332986037.0, "step": 10433 }, { "entropy": 0.6828327290713787, "epoch": 0.9599944796177136, "grad_norm": 0.1556127965450287, "learning_rate": 6.800380286441562e-05, "loss": 0.6529, "mean_token_accuracy": 0.8025740087032318, "num_tokens": 333017697.0, "step": 10434 }, { "entropy": 0.6876280698925257, "epoch": 0.9600864859891548, "grad_norm": 0.14695671200752258, "learning_rate": 6.800073603827399e-05, "loss": 0.6682, "mean_token_accuracy": 0.79716607183218, "num_tokens": 333050015.0, "step": 10435 }, { "entropy": 0.722772516310215, "epoch": 0.9601784923605959, "grad_norm": 0.15421341359615326, "learning_rate": 6.799766921213237e-05, "loss": 0.7003, "mean_token_accuracy": 0.7907210811972618, "num_tokens": 333082250.0, "step": 10436 }, { "entropy": 0.7943957708775997, "epoch": 0.9602704987320372, "grad_norm": 0.1545526534318924, "learning_rate": 6.799460238599075e-05, "loss": 0.8002, "mean_token_accuracy": 0.7659740000963211, "num_tokens": 333114301.0, "step": 10437 }, { "entropy": 0.677141573280096, "epoch": 0.9603625051034784, "grad_norm": 0.16246284544467926, "learning_rate": 6.799153555984912e-05, "loss": 0.6625, "mean_token_accuracy": 0.8043157421052456, "num_tokens": 333146283.0, "step": 10438 }, { "entropy": 0.6915840785950422, "epoch": 0.9604545114749197, "grad_norm": 0.15433791279792786, "learning_rate": 6.798846873370749e-05, "loss": 0.6775, "mean_token_accuracy": 0.7966926023364067, "num_tokens": 333176660.0, "step": 10439 }, { "entropy": 0.7411697376519442, "epoch": 0.9605465178463609, "grad_norm": 0.1519503891468048, "learning_rate": 6.798540190756586e-05, "loss": 0.7219, "mean_token_accuracy": 0.7849065884947777, "num_tokens": 333209179.0, "step": 10440 }, { "entropy": 0.6435529552400112, "epoch": 0.960638524217802, "grad_norm": 0.1507902294397354, "learning_rate": 6.798233508142424e-05, "loss": 0.6269, "mean_token_accuracy": 0.8134612999856472, "num_tokens": 333241838.0, "step": 10441 }, { "entropy": 0.6608381439000368, "epoch": 0.9607305305892433, "grad_norm": 0.14766854047775269, "learning_rate": 6.797926825528262e-05, "loss": 0.6562, "mean_token_accuracy": 0.8034663610160351, "num_tokens": 333273871.0, "step": 10442 }, { "entropy": 0.7911554463207722, "epoch": 0.9608225369606845, "grad_norm": 0.17438198626041412, "learning_rate": 6.797620142914099e-05, "loss": 0.8096, "mean_token_accuracy": 0.7595423609018326, "num_tokens": 333305056.0, "step": 10443 }, { "entropy": 0.6451566787436604, "epoch": 0.9609145433321258, "grad_norm": 0.1651897430419922, "learning_rate": 6.797313460299935e-05, "loss": 0.619, "mean_token_accuracy": 0.811078991740942, "num_tokens": 333336013.0, "step": 10444 }, { "entropy": 0.6484313337132335, "epoch": 0.961006549703567, "grad_norm": 0.14922724664211273, "learning_rate": 6.797006777685774e-05, "loss": 0.6326, "mean_token_accuracy": 0.812554620206356, "num_tokens": 333368530.0, "step": 10445 }, { "entropy": 0.677259162068367, "epoch": 0.9610985560750082, "grad_norm": 0.15088209509849548, "learning_rate": 6.79670009507161e-05, "loss": 0.6688, "mean_token_accuracy": 0.8069727644324303, "num_tokens": 333399776.0, "step": 10446 }, { "entropy": 0.7230394370853901, "epoch": 0.9611905624464494, "grad_norm": 0.15892080962657928, "learning_rate": 6.796393412457449e-05, "loss": 0.7206, "mean_token_accuracy": 0.7893907316029072, "num_tokens": 333432421.0, "step": 10447 }, { "entropy": 0.7247852198779583, "epoch": 0.9612825688178906, "grad_norm": 0.15304149687290192, "learning_rate": 6.796086729843285e-05, "loss": 0.7032, "mean_token_accuracy": 0.789087351411581, "num_tokens": 333464421.0, "step": 10448 }, { "entropy": 0.7091844407841563, "epoch": 0.9613745751893319, "grad_norm": 0.14794373512268066, "learning_rate": 6.795780047229123e-05, "loss": 0.6895, "mean_token_accuracy": 0.7961963899433613, "num_tokens": 333497036.0, "step": 10449 }, { "entropy": 0.8307904303073883, "epoch": 0.9614665815607731, "grad_norm": 0.16876192390918732, "learning_rate": 6.79547336461496e-05, "loss": 0.8162, "mean_token_accuracy": 0.7629802115261555, "num_tokens": 333527936.0, "step": 10450 }, { "entropy": 0.61202597245574, "epoch": 0.9615585879322143, "grad_norm": 0.15299445390701294, "learning_rate": 6.795166682000797e-05, "loss": 0.5922, "mean_token_accuracy": 0.8218981325626373, "num_tokens": 333559559.0, "step": 10451 }, { "entropy": 0.6905034258961678, "epoch": 0.9616505943036555, "grad_norm": 0.14619655907154083, "learning_rate": 6.794859999386635e-05, "loss": 0.6845, "mean_token_accuracy": 0.7963788509368896, "num_tokens": 333592327.0, "step": 10452 }, { "entropy": 0.6509590670466423, "epoch": 0.9617426006750968, "grad_norm": 0.14761729538440704, "learning_rate": 6.794553316772473e-05, "loss": 0.6445, "mean_token_accuracy": 0.8057989962399006, "num_tokens": 333624612.0, "step": 10453 }, { "entropy": 0.7407727334648371, "epoch": 0.961834607046538, "grad_norm": 0.15885180234909058, "learning_rate": 6.79424663415831e-05, "loss": 0.7374, "mean_token_accuracy": 0.7923368662595749, "num_tokens": 333656873.0, "step": 10454 }, { "entropy": 0.7330195922404528, "epoch": 0.9619266134179792, "grad_norm": 0.15252956748008728, "learning_rate": 6.793939951544147e-05, "loss": 0.745, "mean_token_accuracy": 0.7784949913620949, "num_tokens": 333689106.0, "step": 10455 }, { "entropy": 0.8433579467236996, "epoch": 0.9620186197894204, "grad_norm": 0.15758295357227325, "learning_rate": 6.793633268929984e-05, "loss": 0.835, "mean_token_accuracy": 0.7578773461282253, "num_tokens": 333720586.0, "step": 10456 }, { "entropy": 0.6438830140978098, "epoch": 0.9621106261608616, "grad_norm": 0.15245388448238373, "learning_rate": 6.793326586315822e-05, "loss": 0.6187, "mean_token_accuracy": 0.8142603449523449, "num_tokens": 333751605.0, "step": 10457 }, { "entropy": 0.5749893975444138, "epoch": 0.9622026325323029, "grad_norm": 0.14912867546081543, "learning_rate": 6.79301990370166e-05, "loss": 0.5528, "mean_token_accuracy": 0.8318054974079132, "num_tokens": 333783178.0, "step": 10458 }, { "entropy": 0.8241154234856367, "epoch": 0.9622946389037441, "grad_norm": 0.16769270598888397, "learning_rate": 6.792713221087497e-05, "loss": 0.8144, "mean_token_accuracy": 0.7648150883615017, "num_tokens": 333815392.0, "step": 10459 }, { "entropy": 0.6926734913140535, "epoch": 0.9623866452751854, "grad_norm": 0.16429536044597626, "learning_rate": 6.792406538473334e-05, "loss": 0.6688, "mean_token_accuracy": 0.8050403967499733, "num_tokens": 333847564.0, "step": 10460 }, { "entropy": 0.7573100328445435, "epoch": 0.9624786516466265, "grad_norm": 0.16124336421489716, "learning_rate": 6.792099855859172e-05, "loss": 0.7445, "mean_token_accuracy": 0.7816483192145824, "num_tokens": 333878429.0, "step": 10461 }, { "entropy": 0.7634071614593267, "epoch": 0.9625706580180677, "grad_norm": 0.1559850424528122, "learning_rate": 6.791793173245008e-05, "loss": 0.7672, "mean_token_accuracy": 0.7726938351988792, "num_tokens": 333910147.0, "step": 10462 }, { "entropy": 0.7460916619747877, "epoch": 0.962662664389509, "grad_norm": 0.14970946311950684, "learning_rate": 6.791486490630847e-05, "loss": 0.7361, "mean_token_accuracy": 0.7832610569894314, "num_tokens": 333942204.0, "step": 10463 }, { "entropy": 0.6872613839805126, "epoch": 0.9627546707609502, "grad_norm": 0.1590845137834549, "learning_rate": 6.791179808016685e-05, "loss": 0.6706, "mean_token_accuracy": 0.8016099818050861, "num_tokens": 333973635.0, "step": 10464 }, { "entropy": 0.689918352290988, "epoch": 0.9628466771323915, "grad_norm": 0.15602441132068634, "learning_rate": 6.790873125402522e-05, "loss": 0.6797, "mean_token_accuracy": 0.8007300086319447, "num_tokens": 334004586.0, "step": 10465 }, { "entropy": 0.6297848941758275, "epoch": 0.9629386835038326, "grad_norm": 0.15350694954395294, "learning_rate": 6.790566442788358e-05, "loss": 0.6207, "mean_token_accuracy": 0.8169109933078289, "num_tokens": 334036017.0, "step": 10466 }, { "entropy": 0.6790546178817749, "epoch": 0.9630306898752738, "grad_norm": 0.14826563000679016, "learning_rate": 6.790259760174195e-05, "loss": 0.6736, "mean_token_accuracy": 0.8005842305719852, "num_tokens": 334068468.0, "step": 10467 }, { "entropy": 0.763245502486825, "epoch": 0.9631226962467151, "grad_norm": 0.15922261774539948, "learning_rate": 6.789953077560035e-05, "loss": 0.7532, "mean_token_accuracy": 0.7740016654133797, "num_tokens": 334100530.0, "step": 10468 }, { "entropy": 0.6301877871155739, "epoch": 0.9632147026181563, "grad_norm": 0.15146134793758392, "learning_rate": 6.789646394945871e-05, "loss": 0.6173, "mean_token_accuracy": 0.8153077512979507, "num_tokens": 334132988.0, "step": 10469 }, { "entropy": 0.6215807218104601, "epoch": 0.9633067089895976, "grad_norm": 0.1521523892879486, "learning_rate": 6.789339712331708e-05, "loss": 0.6056, "mean_token_accuracy": 0.8174677565693855, "num_tokens": 334164803.0, "step": 10470 }, { "entropy": 0.7652538754045963, "epoch": 0.9633987153610387, "grad_norm": 0.159673273563385, "learning_rate": 6.789033029717545e-05, "loss": 0.7563, "mean_token_accuracy": 0.7800348252058029, "num_tokens": 334196473.0, "step": 10471 }, { "entropy": 0.7872004620730877, "epoch": 0.96349072173248, "grad_norm": 0.16594651341438293, "learning_rate": 6.788726347103383e-05, "loss": 0.7896, "mean_token_accuracy": 0.7692038491368294, "num_tokens": 334227811.0, "step": 10472 }, { "entropy": 0.7559331152588129, "epoch": 0.9635827281039212, "grad_norm": 0.16109560430049896, "learning_rate": 6.788419664489221e-05, "loss": 0.7386, "mean_token_accuracy": 0.7833860367536545, "num_tokens": 334259663.0, "step": 10473 }, { "entropy": 0.7351145297288895, "epoch": 0.9636747344753624, "grad_norm": 0.15827137231826782, "learning_rate": 6.788112981875058e-05, "loss": 0.7137, "mean_token_accuracy": 0.7903101481497288, "num_tokens": 334291502.0, "step": 10474 }, { "entropy": 0.58737812936306, "epoch": 0.9637667408468037, "grad_norm": 0.1464805155992508, "learning_rate": 6.787806299260895e-05, "loss": 0.5773, "mean_token_accuracy": 0.8271737806499004, "num_tokens": 334323973.0, "step": 10475 }, { "entropy": 0.723706005141139, "epoch": 0.9638587472182448, "grad_norm": 0.15872900187969208, "learning_rate": 6.787499616646733e-05, "loss": 0.6969, "mean_token_accuracy": 0.7944507971405983, "num_tokens": 334355911.0, "step": 10476 }, { "entropy": 0.8124489095062017, "epoch": 0.9639507535896861, "grad_norm": 0.15314558148384094, "learning_rate": 6.78719293403257e-05, "loss": 0.8097, "mean_token_accuracy": 0.7616039328277111, "num_tokens": 334387506.0, "step": 10477 }, { "entropy": 0.7241396177560091, "epoch": 0.9640427599611273, "grad_norm": 0.16408225893974304, "learning_rate": 6.786886251418408e-05, "loss": 0.7134, "mean_token_accuracy": 0.7834387645125389, "num_tokens": 334418895.0, "step": 10478 }, { "entropy": 0.6646340470761061, "epoch": 0.9641347663325686, "grad_norm": 0.1573539674282074, "learning_rate": 6.786579568804245e-05, "loss": 0.6465, "mean_token_accuracy": 0.8048742078244686, "num_tokens": 334450820.0, "step": 10479 }, { "entropy": 0.756290883757174, "epoch": 0.9642267727040098, "grad_norm": 0.15764503180980682, "learning_rate": 6.786272886190083e-05, "loss": 0.7451, "mean_token_accuracy": 0.7791400663554668, "num_tokens": 334481992.0, "step": 10480 }, { "entropy": 0.689883591607213, "epoch": 0.9643187790754509, "grad_norm": 0.16057968139648438, "learning_rate": 6.78596620357592e-05, "loss": 0.6795, "mean_token_accuracy": 0.8027783185243607, "num_tokens": 334514301.0, "step": 10481 }, { "entropy": 0.7971299737691879, "epoch": 0.9644107854468922, "grad_norm": 0.16522438824176788, "learning_rate": 6.785659520961756e-05, "loss": 0.8021, "mean_token_accuracy": 0.7668251693248749, "num_tokens": 334546545.0, "step": 10482 }, { "entropy": 0.6983304657042027, "epoch": 0.9645027918183334, "grad_norm": 0.15243415534496307, "learning_rate": 6.785352838347595e-05, "loss": 0.6916, "mean_token_accuracy": 0.7944676466286182, "num_tokens": 334578667.0, "step": 10483 }, { "entropy": 0.6750128492712975, "epoch": 0.9645947981897747, "grad_norm": 0.16067010164260864, "learning_rate": 6.785046155733433e-05, "loss": 0.6625, "mean_token_accuracy": 0.8025503419339657, "num_tokens": 334610400.0, "step": 10484 }, { "entropy": 0.6921940613538027, "epoch": 0.9646868045612159, "grad_norm": 0.15375195443630219, "learning_rate": 6.78473947311927e-05, "loss": 0.6897, "mean_token_accuracy": 0.7993061542510986, "num_tokens": 334642222.0, "step": 10485 }, { "entropy": 0.6781353885307908, "epoch": 0.964778810932657, "grad_norm": 0.14459428191184998, "learning_rate": 6.784432790505106e-05, "loss": 0.6618, "mean_token_accuracy": 0.7988126128911972, "num_tokens": 334674508.0, "step": 10486 }, { "entropy": 0.7060933643952012, "epoch": 0.9648708173040983, "grad_norm": 0.15126557648181915, "learning_rate": 6.784126107890943e-05, "loss": 0.7011, "mean_token_accuracy": 0.7963321059942245, "num_tokens": 334706666.0, "step": 10487 }, { "entropy": 0.7005090061575174, "epoch": 0.9649628236755395, "grad_norm": 0.15567128360271454, "learning_rate": 6.783819425276781e-05, "loss": 0.6837, "mean_token_accuracy": 0.7974599115550518, "num_tokens": 334738274.0, "step": 10488 }, { "entropy": 0.8124092109501362, "epoch": 0.9650548300469808, "grad_norm": 0.15776626765727997, "learning_rate": 6.78351274266262e-05, "loss": 0.8094, "mean_token_accuracy": 0.7676772437989712, "num_tokens": 334770078.0, "step": 10489 }, { "entropy": 0.7968130074441433, "epoch": 0.965146836418422, "grad_norm": 0.15507860481739044, "learning_rate": 6.783206060048456e-05, "loss": 0.7812, "mean_token_accuracy": 0.7698117047548294, "num_tokens": 334801687.0, "step": 10490 }, { "entropy": 0.701839642599225, "epoch": 0.9652388427898632, "grad_norm": 0.15600761771202087, "learning_rate": 6.782899377434293e-05, "loss": 0.6867, "mean_token_accuracy": 0.7955822199583054, "num_tokens": 334833665.0, "step": 10491 }, { "entropy": 0.76115339435637, "epoch": 0.9653308491613044, "grad_norm": 0.15360896289348602, "learning_rate": 6.782592694820131e-05, "loss": 0.7422, "mean_token_accuracy": 0.7804295979440212, "num_tokens": 334865904.0, "step": 10492 }, { "entropy": 0.8110752096399665, "epoch": 0.9654228555327456, "grad_norm": 0.16557522118091583, "learning_rate": 6.782286012205968e-05, "loss": 0.8061, "mean_token_accuracy": 0.7615419961512089, "num_tokens": 334897583.0, "step": 10493 }, { "entropy": 0.5876595973968506, "epoch": 0.9655148619041869, "grad_norm": 0.14943335950374603, "learning_rate": 6.781979329591806e-05, "loss": 0.5703, "mean_token_accuracy": 0.8286009095609188, "num_tokens": 334930090.0, "step": 10494 }, { "entropy": 0.7785910312086344, "epoch": 0.9656068682756281, "grad_norm": 0.16083769500255585, "learning_rate": 6.781672646977644e-05, "loss": 0.7621, "mean_token_accuracy": 0.7721336595714092, "num_tokens": 334961679.0, "step": 10495 }, { "entropy": 0.6549607086926699, "epoch": 0.9656988746470693, "grad_norm": 0.14495083689689636, "learning_rate": 6.781365964363481e-05, "loss": 0.6427, "mean_token_accuracy": 0.8061939179897308, "num_tokens": 334994414.0, "step": 10496 }, { "entropy": 0.6576637476682663, "epoch": 0.9657908810185105, "grad_norm": 0.14652591943740845, "learning_rate": 6.781059281749318e-05, "loss": 0.6509, "mean_token_accuracy": 0.8034491129219532, "num_tokens": 335027027.0, "step": 10497 }, { "entropy": 0.6730944393202662, "epoch": 0.9658828873899518, "grad_norm": 0.16199244558811188, "learning_rate": 6.780752599135154e-05, "loss": 0.6671, "mean_token_accuracy": 0.8030440472066402, "num_tokens": 335058830.0, "step": 10498 }, { "entropy": 0.6369539201259613, "epoch": 0.965974893761393, "grad_norm": 0.15112310647964478, "learning_rate": 6.780445916520993e-05, "loss": 0.6214, "mean_token_accuracy": 0.8111187517642975, "num_tokens": 335091223.0, "step": 10499 }, { "entropy": 0.6441938569769263, "epoch": 0.9660669001328342, "grad_norm": 0.14958570897579193, "learning_rate": 6.780139233906831e-05, "loss": 0.6208, "mean_token_accuracy": 0.817092277109623, "num_tokens": 335123418.0, "step": 10500 }, { "entropy": 0.7213664762675762, "epoch": 0.9661589065042754, "grad_norm": 0.16534079611301422, "learning_rate": 6.779832551292668e-05, "loss": 0.7149, "mean_token_accuracy": 0.7902813032269478, "num_tokens": 335155393.0, "step": 10501 }, { "entropy": 0.6956989075988531, "epoch": 0.9662509128757166, "grad_norm": 0.15969474613666534, "learning_rate": 6.779525868678504e-05, "loss": 0.6992, "mean_token_accuracy": 0.789272490888834, "num_tokens": 335187039.0, "step": 10502 }, { "entropy": 0.6833267044275999, "epoch": 0.9663429192471579, "grad_norm": 0.16233769059181213, "learning_rate": 6.779219186064342e-05, "loss": 0.6636, "mean_token_accuracy": 0.8015560880303383, "num_tokens": 335219136.0, "step": 10503 }, { "entropy": 0.529009566642344, "epoch": 0.9664349256185991, "grad_norm": 0.14842405915260315, "learning_rate": 6.778912503450179e-05, "loss": 0.4936, "mean_token_accuracy": 0.8472982719540596, "num_tokens": 335250354.0, "step": 10504 }, { "entropy": 0.7445050636306405, "epoch": 0.9665269319900404, "grad_norm": 0.15409502387046814, "learning_rate": 6.778605820836017e-05, "loss": 0.7323, "mean_token_accuracy": 0.782936979085207, "num_tokens": 335281442.0, "step": 10505 }, { "entropy": 0.7050412502139807, "epoch": 0.9666189383614815, "grad_norm": 0.14970716834068298, "learning_rate": 6.778299138221854e-05, "loss": 0.6885, "mean_token_accuracy": 0.7987059950828552, "num_tokens": 335312516.0, "step": 10506 }, { "entropy": 0.7794883642345667, "epoch": 0.9667109447329227, "grad_norm": 0.1615133285522461, "learning_rate": 6.777992455607692e-05, "loss": 0.7788, "mean_token_accuracy": 0.7707688137888908, "num_tokens": 335344903.0, "step": 10507 }, { "entropy": 0.547856415156275, "epoch": 0.966802951104364, "grad_norm": 0.14840613305568695, "learning_rate": 6.777685772993529e-05, "loss": 0.5339, "mean_token_accuracy": 0.836481012403965, "num_tokens": 335377084.0, "step": 10508 }, { "entropy": 0.6776507953181863, "epoch": 0.9668949574758052, "grad_norm": 0.15564417839050293, "learning_rate": 6.777379090379366e-05, "loss": 0.6722, "mean_token_accuracy": 0.7986418195068836, "num_tokens": 335409562.0, "step": 10509 }, { "entropy": 0.8422871958464384, "epoch": 0.9669869638472465, "grad_norm": 0.16530828177928925, "learning_rate": 6.777072407765204e-05, "loss": 0.8396, "mean_token_accuracy": 0.7559425458312035, "num_tokens": 335441210.0, "step": 10510 }, { "entropy": 0.8178528174757957, "epoch": 0.9670789702186876, "grad_norm": 0.1576511263847351, "learning_rate": 6.776765725151042e-05, "loss": 0.8227, "mean_token_accuracy": 0.7563239857554436, "num_tokens": 335473219.0, "step": 10511 }, { "entropy": 0.7150242924690247, "epoch": 0.9671709765901289, "grad_norm": 0.15693390369415283, "learning_rate": 6.776459042536879e-05, "loss": 0.6961, "mean_token_accuracy": 0.7976838611066341, "num_tokens": 335505227.0, "step": 10512 }, { "entropy": 0.7683178726583719, "epoch": 0.9672629829615701, "grad_norm": 0.16684956848621368, "learning_rate": 6.776152359922716e-05, "loss": 0.7442, "mean_token_accuracy": 0.7772562317550182, "num_tokens": 335535898.0, "step": 10513 }, { "entropy": 0.6385474409908056, "epoch": 0.9673549893330113, "grad_norm": 0.15457671880722046, "learning_rate": 6.775845677308553e-05, "loss": 0.6272, "mean_token_accuracy": 0.8160071671009064, "num_tokens": 335568226.0, "step": 10514 }, { "entropy": 0.7511184774339199, "epoch": 0.9674469957044526, "grad_norm": 0.1553974449634552, "learning_rate": 6.775538994694392e-05, "loss": 0.7577, "mean_token_accuracy": 0.7737687900662422, "num_tokens": 335600387.0, "step": 10515 }, { "entropy": 0.7939011920243502, "epoch": 0.9675390020758937, "grad_norm": 0.15741904079914093, "learning_rate": 6.775232312080229e-05, "loss": 0.8032, "mean_token_accuracy": 0.7667487226426601, "num_tokens": 335631918.0, "step": 10516 }, { "entropy": 0.6814411263912916, "epoch": 0.967631008447335, "grad_norm": 0.16158193349838257, "learning_rate": 6.774925629466066e-05, "loss": 0.6684, "mean_token_accuracy": 0.8035847283899784, "num_tokens": 335664155.0, "step": 10517 }, { "entropy": 0.7025232128798962, "epoch": 0.9677230148187762, "grad_norm": 0.15779879689216614, "learning_rate": 6.774618946851902e-05, "loss": 0.6913, "mean_token_accuracy": 0.7940782159566879, "num_tokens": 335696656.0, "step": 10518 }, { "entropy": 0.9049936197698116, "epoch": 0.9678150211902175, "grad_norm": 0.16284102201461792, "learning_rate": 6.77431226423774e-05, "loss": 0.889, "mean_token_accuracy": 0.7431676089763641, "num_tokens": 335728739.0, "step": 10519 }, { "entropy": 0.631651584059, "epoch": 0.9679070275616587, "grad_norm": 0.15819275379180908, "learning_rate": 6.774005581623579e-05, "loss": 0.6139, "mean_token_accuracy": 0.8150783814489841, "num_tokens": 335760492.0, "step": 10520 }, { "entropy": 0.8658122289925814, "epoch": 0.9679990339330998, "grad_norm": 0.15652528405189514, "learning_rate": 6.773698899009416e-05, "loss": 0.8444, "mean_token_accuracy": 0.7536990381777287, "num_tokens": 335792448.0, "step": 10521 }, { "entropy": 0.6179084610193968, "epoch": 0.9680910403045411, "grad_norm": 0.1564515382051468, "learning_rate": 6.773392216395252e-05, "loss": 0.6004, "mean_token_accuracy": 0.818936463445425, "num_tokens": 335824677.0, "step": 10522 }, { "entropy": 0.760549645870924, "epoch": 0.9681830466759823, "grad_norm": 0.15943452715873718, "learning_rate": 6.77308553378109e-05, "loss": 0.7578, "mean_token_accuracy": 0.7739357426762581, "num_tokens": 335856425.0, "step": 10523 }, { "entropy": 0.6810291092842817, "epoch": 0.9682750530474236, "grad_norm": 0.15459364652633667, "learning_rate": 6.772778851166927e-05, "loss": 0.6507, "mean_token_accuracy": 0.8053512200713158, "num_tokens": 335888521.0, "step": 10524 }, { "entropy": 0.7077015172690153, "epoch": 0.9683670594188648, "grad_norm": 0.159923255443573, "learning_rate": 6.772472168552765e-05, "loss": 0.7067, "mean_token_accuracy": 0.7855750471353531, "num_tokens": 335919483.0, "step": 10525 }, { "entropy": 0.6317358752712607, "epoch": 0.9684590657903059, "grad_norm": 0.14460024237632751, "learning_rate": 6.772165485938604e-05, "loss": 0.625, "mean_token_accuracy": 0.8154569007456303, "num_tokens": 335952141.0, "step": 10526 }, { "entropy": 0.6819276548922062, "epoch": 0.9685510721617472, "grad_norm": 0.15570661425590515, "learning_rate": 6.77185880332444e-05, "loss": 0.6736, "mean_token_accuracy": 0.7989084310829639, "num_tokens": 335984464.0, "step": 10527 }, { "entropy": 0.7514672316610813, "epoch": 0.9686430785331884, "grad_norm": 0.15718428790569305, "learning_rate": 6.771552120710277e-05, "loss": 0.7499, "mean_token_accuracy": 0.7783442176878452, "num_tokens": 336016688.0, "step": 10528 }, { "entropy": 0.7650087494403124, "epoch": 0.9687350849046297, "grad_norm": 0.152118980884552, "learning_rate": 6.771245438096114e-05, "loss": 0.7629, "mean_token_accuracy": 0.7765888459980488, "num_tokens": 336048290.0, "step": 10529 }, { "entropy": 0.6672723554074764, "epoch": 0.9688270912760709, "grad_norm": 0.14140962064266205, "learning_rate": 6.770938755481952e-05, "loss": 0.6496, "mean_token_accuracy": 0.8048717826604843, "num_tokens": 336080450.0, "step": 10530 }, { "entropy": 0.7344309277832508, "epoch": 0.968919097647512, "grad_norm": 0.154737189412117, "learning_rate": 6.77063207286779e-05, "loss": 0.725, "mean_token_accuracy": 0.7861641272902489, "num_tokens": 336111962.0, "step": 10531 }, { "entropy": 0.617815419100225, "epoch": 0.9690111040189533, "grad_norm": 0.15271960198879242, "learning_rate": 6.770325390253627e-05, "loss": 0.5973, "mean_token_accuracy": 0.8184418566524982, "num_tokens": 336143098.0, "step": 10532 }, { "entropy": 0.7587207145988941, "epoch": 0.9691031103903945, "grad_norm": 0.15506324172019958, "learning_rate": 6.770018707639464e-05, "loss": 0.7521, "mean_token_accuracy": 0.7766907922923565, "num_tokens": 336174943.0, "step": 10533 }, { "entropy": 0.635185282677412, "epoch": 0.9691951167618358, "grad_norm": 0.15268121659755707, "learning_rate": 6.769712025025302e-05, "loss": 0.6158, "mean_token_accuracy": 0.8147372081875801, "num_tokens": 336206792.0, "step": 10534 }, { "entropy": 0.7282321695238352, "epoch": 0.969287123133277, "grad_norm": 0.15430523455142975, "learning_rate": 6.769405342411139e-05, "loss": 0.7022, "mean_token_accuracy": 0.7884497977793217, "num_tokens": 336239178.0, "step": 10535 }, { "entropy": 0.6893883086740971, "epoch": 0.9693791295047182, "grad_norm": 0.1543431133031845, "learning_rate": 6.769098659796977e-05, "loss": 0.6852, "mean_token_accuracy": 0.7944175004959106, "num_tokens": 336271403.0, "step": 10536 }, { "entropy": 0.7006131149828434, "epoch": 0.9694711358761594, "grad_norm": 0.15469494462013245, "learning_rate": 6.768791977182814e-05, "loss": 0.6969, "mean_token_accuracy": 0.7928788810968399, "num_tokens": 336303543.0, "step": 10537 }, { "entropy": 0.763069299980998, "epoch": 0.9695631422476007, "grad_norm": 0.1571149230003357, "learning_rate": 6.768485294568652e-05, "loss": 0.7407, "mean_token_accuracy": 0.7801626138389111, "num_tokens": 336335889.0, "step": 10538 }, { "entropy": 0.7859314158558846, "epoch": 0.9696551486190419, "grad_norm": 0.16027677059173584, "learning_rate": 6.768178611954489e-05, "loss": 0.7867, "mean_token_accuracy": 0.7688223384320736, "num_tokens": 336367763.0, "step": 10539 }, { "entropy": 0.7926706578582525, "epoch": 0.9697471549904831, "grad_norm": 0.16399525105953217, "learning_rate": 6.767871929340325e-05, "loss": 0.7744, "mean_token_accuracy": 0.7742527239024639, "num_tokens": 336399058.0, "step": 10540 }, { "entropy": 0.6328762136399746, "epoch": 0.9698391613619243, "grad_norm": 0.15599016845226288, "learning_rate": 6.767565246726163e-05, "loss": 0.6177, "mean_token_accuracy": 0.8139687068760395, "num_tokens": 336430847.0, "step": 10541 }, { "entropy": 0.7601782195270061, "epoch": 0.9699311677333655, "grad_norm": 0.16370613873004913, "learning_rate": 6.767258564112002e-05, "loss": 0.7616, "mean_token_accuracy": 0.7771149538457394, "num_tokens": 336463096.0, "step": 10542 }, { "entropy": 0.7432701271027327, "epoch": 0.9700231741048068, "grad_norm": 0.15369117259979248, "learning_rate": 6.766951881497838e-05, "loss": 0.7337, "mean_token_accuracy": 0.7882528565824032, "num_tokens": 336495497.0, "step": 10543 }, { "entropy": 0.6366763459518552, "epoch": 0.970115180476248, "grad_norm": 0.1529141217470169, "learning_rate": 6.766645198883675e-05, "loss": 0.6158, "mean_token_accuracy": 0.8155534453690052, "num_tokens": 336527607.0, "step": 10544 }, { "entropy": 0.6689321752637625, "epoch": 0.9702071868476893, "grad_norm": 0.14516805112361908, "learning_rate": 6.766338516269512e-05, "loss": 0.6536, "mean_token_accuracy": 0.8025650680065155, "num_tokens": 336559789.0, "step": 10545 }, { "entropy": 0.6339048258960247, "epoch": 0.9702991932191304, "grad_norm": 0.14677385985851288, "learning_rate": 6.76603183365535e-05, "loss": 0.6268, "mean_token_accuracy": 0.8107163906097412, "num_tokens": 336591608.0, "step": 10546 }, { "entropy": 0.7093491535633802, "epoch": 0.9703911995905716, "grad_norm": 0.15798795223236084, "learning_rate": 6.765725151041188e-05, "loss": 0.6965, "mean_token_accuracy": 0.7889992520213127, "num_tokens": 336623841.0, "step": 10547 }, { "entropy": 0.6402760352939367, "epoch": 0.9704832059620129, "grad_norm": 0.146479532122612, "learning_rate": 6.765418468427025e-05, "loss": 0.624, "mean_token_accuracy": 0.8124172240495682, "num_tokens": 336655701.0, "step": 10548 }, { "entropy": 0.7333541251718998, "epoch": 0.9705752123334541, "grad_norm": 0.1628318727016449, "learning_rate": 6.765111785812862e-05, "loss": 0.7401, "mean_token_accuracy": 0.7826445251703262, "num_tokens": 336687603.0, "step": 10549 }, { "entropy": 0.7352830395102501, "epoch": 0.9706672187048954, "grad_norm": 0.159367173910141, "learning_rate": 6.7648051031987e-05, "loss": 0.743, "mean_token_accuracy": 0.7770535945892334, "num_tokens": 336719182.0, "step": 10550 }, { "entropy": 0.73453239351511, "epoch": 0.9707592250763365, "grad_norm": 0.15433871746063232, "learning_rate": 6.764498420584538e-05, "loss": 0.7265, "mean_token_accuracy": 0.7847617827355862, "num_tokens": 336751330.0, "step": 10551 }, { "entropy": 0.7827771287411451, "epoch": 0.9708512314477777, "grad_norm": 0.1558324545621872, "learning_rate": 6.764191737970375e-05, "loss": 0.7821, "mean_token_accuracy": 0.7697421684861183, "num_tokens": 336782330.0, "step": 10552 }, { "entropy": 0.7272303551435471, "epoch": 0.970943237819219, "grad_norm": 0.15019746124744415, "learning_rate": 6.763885055356212e-05, "loss": 0.7161, "mean_token_accuracy": 0.787222295999527, "num_tokens": 336814120.0, "step": 10553 }, { "entropy": 0.7602425906807184, "epoch": 0.9710352441906602, "grad_norm": 0.15721143782138824, "learning_rate": 6.76357837274205e-05, "loss": 0.7527, "mean_token_accuracy": 0.7822928056120872, "num_tokens": 336846226.0, "step": 10554 }, { "entropy": 0.6896449904888868, "epoch": 0.9711272505621015, "grad_norm": 0.1520087718963623, "learning_rate": 6.763271690127887e-05, "loss": 0.6713, "mean_token_accuracy": 0.7949179336428642, "num_tokens": 336878179.0, "step": 10555 }, { "entropy": 0.7484518066048622, "epoch": 0.9712192569335426, "grad_norm": 0.15979091823101044, "learning_rate": 6.762965007513725e-05, "loss": 0.7342, "mean_token_accuracy": 0.7846382446587086, "num_tokens": 336909936.0, "step": 10556 }, { "entropy": 0.7735441243276, "epoch": 0.9713112633049839, "grad_norm": 0.15075522661209106, "learning_rate": 6.762658324899563e-05, "loss": 0.7571, "mean_token_accuracy": 0.7785229831933975, "num_tokens": 336941415.0, "step": 10557 }, { "entropy": 0.7245197277516127, "epoch": 0.9714032696764251, "grad_norm": 0.15866287052631378, "learning_rate": 6.7623516422854e-05, "loss": 0.703, "mean_token_accuracy": 0.792338814586401, "num_tokens": 336972010.0, "step": 10558 }, { "entropy": 0.5938303470611572, "epoch": 0.9714952760478663, "grad_norm": 0.14990799129009247, "learning_rate": 6.762044959671236e-05, "loss": 0.5778, "mean_token_accuracy": 0.8244544118642807, "num_tokens": 337003296.0, "step": 10559 }, { "entropy": 0.8035529144108295, "epoch": 0.9715872824193076, "grad_norm": 0.168071448802948, "learning_rate": 6.761738277057073e-05, "loss": 0.8102, "mean_token_accuracy": 0.7637681253254414, "num_tokens": 337034950.0, "step": 10560 }, { "entropy": 0.714344646781683, "epoch": 0.9716792887907487, "grad_norm": 0.14511479437351227, "learning_rate": 6.761431594442911e-05, "loss": 0.7085, "mean_token_accuracy": 0.7860003374516964, "num_tokens": 337067096.0, "step": 10561 }, { "entropy": 0.6640689074993134, "epoch": 0.97177129516219, "grad_norm": 0.15830907225608826, "learning_rate": 6.76112491182875e-05, "loss": 0.6559, "mean_token_accuracy": 0.8070737756788731, "num_tokens": 337098938.0, "step": 10562 }, { "entropy": 0.6577910138294101, "epoch": 0.9718633015336312, "grad_norm": 0.14559032022953033, "learning_rate": 6.760818229214586e-05, "loss": 0.6407, "mean_token_accuracy": 0.806329995393753, "num_tokens": 337131128.0, "step": 10563 }, { "entropy": 0.7828767523169518, "epoch": 0.9719553079050725, "grad_norm": 0.1558733582496643, "learning_rate": 6.760511546600423e-05, "loss": 0.7755, "mean_token_accuracy": 0.7661004476249218, "num_tokens": 337161815.0, "step": 10564 }, { "entropy": 0.7576594091951847, "epoch": 0.9720473142765137, "grad_norm": 0.16401514410972595, "learning_rate": 6.760204863986261e-05, "loss": 0.7662, "mean_token_accuracy": 0.7728305123746395, "num_tokens": 337193743.0, "step": 10565 }, { "entropy": 0.7198924580588937, "epoch": 0.9721393206479548, "grad_norm": 0.15998481214046478, "learning_rate": 6.759898181372098e-05, "loss": 0.7252, "mean_token_accuracy": 0.7881961390376091, "num_tokens": 337226511.0, "step": 10566 }, { "entropy": 0.7353869210928679, "epoch": 0.9722313270193961, "grad_norm": 0.15878520905971527, "learning_rate": 6.759591498757936e-05, "loss": 0.7366, "mean_token_accuracy": 0.7761143408715725, "num_tokens": 337258310.0, "step": 10567 }, { "entropy": 0.604597101919353, "epoch": 0.9723233333908373, "grad_norm": 0.16367650032043457, "learning_rate": 6.759284816143773e-05, "loss": 0.5905, "mean_token_accuracy": 0.8208009898662567, "num_tokens": 337289985.0, "step": 10568 }, { "entropy": 0.7860522139817476, "epoch": 0.9724153397622786, "grad_norm": 0.1582975685596466, "learning_rate": 6.758978133529611e-05, "loss": 0.7767, "mean_token_accuracy": 0.7756835408508778, "num_tokens": 337321629.0, "step": 10569 }, { "entropy": 0.7250996846705675, "epoch": 0.9725073461337198, "grad_norm": 0.15886923670768738, "learning_rate": 6.758671450915448e-05, "loss": 0.7192, "mean_token_accuracy": 0.7956133633852005, "num_tokens": 337353503.0, "step": 10570 }, { "entropy": 0.6459373431280255, "epoch": 0.9725993525051609, "grad_norm": 0.15018582344055176, "learning_rate": 6.758364768301285e-05, "loss": 0.6367, "mean_token_accuracy": 0.8100015446543694, "num_tokens": 337385958.0, "step": 10571 }, { "entropy": 0.7130837645381689, "epoch": 0.9726913588766022, "grad_norm": 0.15575556457042694, "learning_rate": 6.758058085687123e-05, "loss": 0.6877, "mean_token_accuracy": 0.7917790003120899, "num_tokens": 337417093.0, "step": 10572 }, { "entropy": 0.6063654711470008, "epoch": 0.9727833652480434, "grad_norm": 0.15825489163398743, "learning_rate": 6.757751403072961e-05, "loss": 0.5897, "mean_token_accuracy": 0.8247350193560123, "num_tokens": 337449298.0, "step": 10573 }, { "entropy": 0.7501623965799809, "epoch": 0.9728753716194847, "grad_norm": 0.1513490527868271, "learning_rate": 6.757444720458798e-05, "loss": 0.7374, "mean_token_accuracy": 0.7860096953809261, "num_tokens": 337481102.0, "step": 10574 }, { "entropy": 0.7025008499622345, "epoch": 0.9729673779909259, "grad_norm": 0.15990649163722992, "learning_rate": 6.757138037844635e-05, "loss": 0.6813, "mean_token_accuracy": 0.7993027158081532, "num_tokens": 337512603.0, "step": 10575 }, { "entropy": 0.7116616852581501, "epoch": 0.973059384362367, "grad_norm": 0.14640459418296814, "learning_rate": 6.756831355230471e-05, "loss": 0.6923, "mean_token_accuracy": 0.7975670658051968, "num_tokens": 337545009.0, "step": 10576 }, { "entropy": 0.6928593069314957, "epoch": 0.9731513907338083, "grad_norm": 0.15537488460540771, "learning_rate": 6.75652467261631e-05, "loss": 0.6787, "mean_token_accuracy": 0.7972130440175533, "num_tokens": 337577630.0, "step": 10577 }, { "entropy": 0.5907162073999643, "epoch": 0.9732433971052495, "grad_norm": 0.1512099951505661, "learning_rate": 6.756217990002148e-05, "loss": 0.571, "mean_token_accuracy": 0.8313009403645992, "num_tokens": 337609902.0, "step": 10578 }, { "entropy": 0.5856647323817015, "epoch": 0.9733354034766908, "grad_norm": 0.14588406682014465, "learning_rate": 6.755911307387984e-05, "loss": 0.5528, "mean_token_accuracy": 0.8307448625564575, "num_tokens": 337641615.0, "step": 10579 }, { "entropy": 0.6770801078528166, "epoch": 0.973427409848132, "grad_norm": 0.15753860771656036, "learning_rate": 6.755604624773821e-05, "loss": 0.6552, "mean_token_accuracy": 0.802685908973217, "num_tokens": 337672856.0, "step": 10580 }, { "entropy": 0.7444513887166977, "epoch": 0.9735194162195732, "grad_norm": 0.1575642079114914, "learning_rate": 6.75529794215966e-05, "loss": 0.7375, "mean_token_accuracy": 0.7873792387545109, "num_tokens": 337704739.0, "step": 10581 }, { "entropy": 0.8119419813156128, "epoch": 0.9736114225910144, "grad_norm": 0.1580500453710556, "learning_rate": 6.754991259545496e-05, "loss": 0.8008, "mean_token_accuracy": 0.765133935958147, "num_tokens": 337736349.0, "step": 10582 }, { "entropy": 0.7209542170166969, "epoch": 0.9737034289624557, "grad_norm": 0.15572994947433472, "learning_rate": 6.754684576931334e-05, "loss": 0.7072, "mean_token_accuracy": 0.7868721708655357, "num_tokens": 337767975.0, "step": 10583 }, { "entropy": 0.8187835067510605, "epoch": 0.9737954353338969, "grad_norm": 0.16079941391944885, "learning_rate": 6.754377894317171e-05, "loss": 0.8213, "mean_token_accuracy": 0.7564080730080605, "num_tokens": 337799902.0, "step": 10584 }, { "entropy": 0.6487867031246424, "epoch": 0.9738874417053381, "grad_norm": 0.16482362151145935, "learning_rate": 6.754071211703009e-05, "loss": 0.6293, "mean_token_accuracy": 0.8066891022026539, "num_tokens": 337830715.0, "step": 10585 }, { "entropy": 0.721027122810483, "epoch": 0.9739794480767793, "grad_norm": 0.15432745218276978, "learning_rate": 6.753764529088846e-05, "loss": 0.7129, "mean_token_accuracy": 0.7894077450037003, "num_tokens": 337862582.0, "step": 10586 }, { "entropy": 0.7256790231913328, "epoch": 0.9740714544482205, "grad_norm": 0.1622440367937088, "learning_rate": 6.753457846474683e-05, "loss": 0.7309, "mean_token_accuracy": 0.7840545065701008, "num_tokens": 337894778.0, "step": 10587 }, { "entropy": 0.6176075688563287, "epoch": 0.9741634608196618, "grad_norm": 0.15290309488773346, "learning_rate": 6.753151163860522e-05, "loss": 0.5934, "mean_token_accuracy": 0.8250227607786655, "num_tokens": 337926485.0, "step": 10588 }, { "entropy": 0.7470509316772223, "epoch": 0.974255467191103, "grad_norm": 0.15583010017871857, "learning_rate": 6.752844481246359e-05, "loss": 0.7303, "mean_token_accuracy": 0.7845859676599503, "num_tokens": 337958345.0, "step": 10589 }, { "entropy": 0.8283224366605282, "epoch": 0.9743474735625443, "grad_norm": 0.1700611114501953, "learning_rate": 6.752537798632196e-05, "loss": 0.8414, "mean_token_accuracy": 0.7552184946835041, "num_tokens": 337990402.0, "step": 10590 }, { "entropy": 0.6968209920451045, "epoch": 0.9744394799339854, "grad_norm": 0.1519262045621872, "learning_rate": 6.752231116018033e-05, "loss": 0.6766, "mean_token_accuracy": 0.7971009574830532, "num_tokens": 338021582.0, "step": 10591 }, { "entropy": 0.7682728972285986, "epoch": 0.9745314863054266, "grad_norm": 0.15699885785579681, "learning_rate": 6.751924433403871e-05, "loss": 0.7555, "mean_token_accuracy": 0.7757477797567844, "num_tokens": 338053241.0, "step": 10592 }, { "entropy": 0.686125093139708, "epoch": 0.9746234926768679, "grad_norm": 0.14954133331775665, "learning_rate": 6.751617750789709e-05, "loss": 0.6667, "mean_token_accuracy": 0.8009371906518936, "num_tokens": 338085521.0, "step": 10593 }, { "entropy": 0.6611022315919399, "epoch": 0.9747154990483091, "grad_norm": 0.1567360907793045, "learning_rate": 6.751311068175546e-05, "loss": 0.6515, "mean_token_accuracy": 0.8074835985898972, "num_tokens": 338116504.0, "step": 10594 }, { "entropy": 0.6066690571606159, "epoch": 0.9748075054197504, "grad_norm": 0.15125270187854767, "learning_rate": 6.751004385561382e-05, "loss": 0.5823, "mean_token_accuracy": 0.823846310377121, "num_tokens": 338148032.0, "step": 10595 }, { "entropy": 0.7638347633183002, "epoch": 0.9748995117911915, "grad_norm": 0.15812021493911743, "learning_rate": 6.75069770294722e-05, "loss": 0.7556, "mean_token_accuracy": 0.7782583720982075, "num_tokens": 338179410.0, "step": 10596 }, { "entropy": 0.66310172714293, "epoch": 0.9749915181626327, "grad_norm": 0.15262490510940552, "learning_rate": 6.750391020333057e-05, "loss": 0.6549, "mean_token_accuracy": 0.8073478266596794, "num_tokens": 338211807.0, "step": 10597 }, { "entropy": 0.7040813155472279, "epoch": 0.975083524534074, "grad_norm": 0.1516890972852707, "learning_rate": 6.750084337718896e-05, "loss": 0.6937, "mean_token_accuracy": 0.7970133163034916, "num_tokens": 338243940.0, "step": 10598 }, { "entropy": 0.768902562558651, "epoch": 0.9751755309055152, "grad_norm": 0.16012081503868103, "learning_rate": 6.749777655104732e-05, "loss": 0.7579, "mean_token_accuracy": 0.7748105749487877, "num_tokens": 338275724.0, "step": 10599 }, { "entropy": 0.740759564563632, "epoch": 0.9752675372769565, "grad_norm": 0.1601741760969162, "learning_rate": 6.74947097249057e-05, "loss": 0.7245, "mean_token_accuracy": 0.7854767851531506, "num_tokens": 338307712.0, "step": 10600 }, { "entropy": 0.6790946256369352, "epoch": 0.9753595436483976, "grad_norm": 0.1545310765504837, "learning_rate": 6.749164289876407e-05, "loss": 0.6504, "mean_token_accuracy": 0.8050965704023838, "num_tokens": 338339797.0, "step": 10601 }, { "entropy": 0.6184138711541891, "epoch": 0.9754515500198389, "grad_norm": 0.15956680476665497, "learning_rate": 6.748857607262244e-05, "loss": 0.5919, "mean_token_accuracy": 0.8268303573131561, "num_tokens": 338372166.0, "step": 10602 }, { "entropy": 0.7288716584444046, "epoch": 0.9755435563912801, "grad_norm": 0.1587485522031784, "learning_rate": 6.748550924648082e-05, "loss": 0.7217, "mean_token_accuracy": 0.787134513258934, "num_tokens": 338404240.0, "step": 10603 }, { "entropy": 0.7027798295021057, "epoch": 0.9756355627627213, "grad_norm": 0.15404194593429565, "learning_rate": 6.74824424203392e-05, "loss": 0.6775, "mean_token_accuracy": 0.798168808221817, "num_tokens": 338436459.0, "step": 10604 }, { "entropy": 0.6786873713135719, "epoch": 0.9757275691341626, "grad_norm": 0.15494772791862488, "learning_rate": 6.747937559419757e-05, "loss": 0.6518, "mean_token_accuracy": 0.8029133826494217, "num_tokens": 338468371.0, "step": 10605 }, { "entropy": 0.6840687282383442, "epoch": 0.9758195755056037, "grad_norm": 0.16339637339115143, "learning_rate": 6.747630876805594e-05, "loss": 0.6789, "mean_token_accuracy": 0.8003688789904118, "num_tokens": 338499987.0, "step": 10606 }, { "entropy": 0.5773518849164248, "epoch": 0.975911581877045, "grad_norm": 0.16283704340457916, "learning_rate": 6.747324194191431e-05, "loss": 0.5655, "mean_token_accuracy": 0.8299007453024387, "num_tokens": 338531895.0, "step": 10607 }, { "entropy": 0.7104271287098527, "epoch": 0.9760035882484862, "grad_norm": 0.15442417562007904, "learning_rate": 6.747017511577269e-05, "loss": 0.6861, "mean_token_accuracy": 0.7947802282869816, "num_tokens": 338563482.0, "step": 10608 }, { "entropy": 0.7202060278505087, "epoch": 0.9760955946199275, "grad_norm": 0.15835075080394745, "learning_rate": 6.746710828963107e-05, "loss": 0.7168, "mean_token_accuracy": 0.7835622690618038, "num_tokens": 338595797.0, "step": 10609 }, { "entropy": 0.6228368226438761, "epoch": 0.9761876009913687, "grad_norm": 0.145578995347023, "learning_rate": 6.746404146348944e-05, "loss": 0.5996, "mean_token_accuracy": 0.818638265132904, "num_tokens": 338627788.0, "step": 10610 }, { "entropy": 0.7269191946834326, "epoch": 0.9762796073628098, "grad_norm": 0.16028504073619843, "learning_rate": 6.74609746373478e-05, "loss": 0.7151, "mean_token_accuracy": 0.7966817729175091, "num_tokens": 338660178.0, "step": 10611 }, { "entropy": 0.625467075034976, "epoch": 0.9763716137342511, "grad_norm": 0.1483326405286789, "learning_rate": 6.745790781120619e-05, "loss": 0.6032, "mean_token_accuracy": 0.8201422095298767, "num_tokens": 338692021.0, "step": 10612 }, { "entropy": 0.5790224429219961, "epoch": 0.9764636201056923, "grad_norm": 0.15252497792243958, "learning_rate": 6.745484098506455e-05, "loss": 0.5489, "mean_token_accuracy": 0.8353726975619793, "num_tokens": 338722423.0, "step": 10613 }, { "entropy": 0.657885329797864, "epoch": 0.9765556264771336, "grad_norm": 0.15731024742126465, "learning_rate": 6.745177415892294e-05, "loss": 0.6452, "mean_token_accuracy": 0.8062548413872719, "num_tokens": 338753316.0, "step": 10614 }, { "entropy": 0.5910470262169838, "epoch": 0.9766476328485748, "grad_norm": 0.1453896313905716, "learning_rate": 6.74487073327813e-05, "loss": 0.5699, "mean_token_accuracy": 0.8236535526812077, "num_tokens": 338785476.0, "step": 10615 }, { "entropy": 0.7188417613506317, "epoch": 0.9767396392200159, "grad_norm": 0.15789790451526642, "learning_rate": 6.744564050663969e-05, "loss": 0.7195, "mean_token_accuracy": 0.787387166172266, "num_tokens": 338817717.0, "step": 10616 }, { "entropy": 0.7821421977132559, "epoch": 0.9768316455914572, "grad_norm": 0.15802080929279327, "learning_rate": 6.744257368049805e-05, "loss": 0.7866, "mean_token_accuracy": 0.7660809271037579, "num_tokens": 338850324.0, "step": 10617 }, { "entropy": 0.6357427015900612, "epoch": 0.9769236519628984, "grad_norm": 0.14881528913974762, "learning_rate": 6.743950685435642e-05, "loss": 0.629, "mean_token_accuracy": 0.8089667595922947, "num_tokens": 338882051.0, "step": 10618 }, { "entropy": 0.7958768159151077, "epoch": 0.9770156583343397, "grad_norm": 0.1581508070230484, "learning_rate": 6.74364400282148e-05, "loss": 0.782, "mean_token_accuracy": 0.7707370892167091, "num_tokens": 338913666.0, "step": 10619 }, { "entropy": 0.5519986972212791, "epoch": 0.9771076647057809, "grad_norm": 0.14208228886127472, "learning_rate": 6.743337320207318e-05, "loss": 0.5332, "mean_token_accuracy": 0.8371062837541103, "num_tokens": 338945747.0, "step": 10620 }, { "entropy": 0.6252443306148052, "epoch": 0.977199671077222, "grad_norm": 0.15168790519237518, "learning_rate": 6.743030637593155e-05, "loss": 0.6087, "mean_token_accuracy": 0.814689364284277, "num_tokens": 338978223.0, "step": 10621 }, { "entropy": 0.8075909893959761, "epoch": 0.9772916774486633, "grad_norm": 0.16244572401046753, "learning_rate": 6.742723954978992e-05, "loss": 0.7914, "mean_token_accuracy": 0.7665093913674355, "num_tokens": 339009491.0, "step": 10622 }, { "entropy": 0.7375062312930822, "epoch": 0.9773836838201045, "grad_norm": 0.1657152771949768, "learning_rate": 6.74241727236483e-05, "loss": 0.7021, "mean_token_accuracy": 0.7887800745666027, "num_tokens": 339041471.0, "step": 10623 }, { "entropy": 0.8323513269424438, "epoch": 0.9774756901915458, "grad_norm": 0.1657683551311493, "learning_rate": 6.742110589750667e-05, "loss": 0.8351, "mean_token_accuracy": 0.7566789612174034, "num_tokens": 339073151.0, "step": 10624 }, { "entropy": 0.7555996123701334, "epoch": 0.977567696562987, "grad_norm": 0.16382910311222076, "learning_rate": 6.741803907136505e-05, "loss": 0.7508, "mean_token_accuracy": 0.7851800583302975, "num_tokens": 339105495.0, "step": 10625 }, { "entropy": 0.6278354432433844, "epoch": 0.9776597029344282, "grad_norm": 0.17628969252109528, "learning_rate": 6.741497224522342e-05, "loss": 0.6147, "mean_token_accuracy": 0.8158922232687473, "num_tokens": 339136935.0, "step": 10626 }, { "entropy": 0.7004539538174868, "epoch": 0.9777517093058694, "grad_norm": 0.15758752822875977, "learning_rate": 6.74119054190818e-05, "loss": 0.675, "mean_token_accuracy": 0.7957786843180656, "num_tokens": 339168820.0, "step": 10627 }, { "entropy": 0.8613657411187887, "epoch": 0.9778437156773107, "grad_norm": 0.16373014450073242, "learning_rate": 6.740883859294017e-05, "loss": 0.8516, "mean_token_accuracy": 0.7560464255511761, "num_tokens": 339201005.0, "step": 10628 }, { "entropy": 0.6481874091550708, "epoch": 0.9779357220487519, "grad_norm": 0.15759406983852386, "learning_rate": 6.740577176679854e-05, "loss": 0.6185, "mean_token_accuracy": 0.8152636997401714, "num_tokens": 339232792.0, "step": 10629 }, { "entropy": 0.7250134348869324, "epoch": 0.9780277284201931, "grad_norm": 0.1499382108449936, "learning_rate": 6.740270494065692e-05, "loss": 0.72, "mean_token_accuracy": 0.788966242223978, "num_tokens": 339265366.0, "step": 10630 }, { "entropy": 0.7430151924490929, "epoch": 0.9781197347916343, "grad_norm": 0.15708082914352417, "learning_rate": 6.73996381145153e-05, "loss": 0.7319, "mean_token_accuracy": 0.7837865762412548, "num_tokens": 339296611.0, "step": 10631 }, { "entropy": 0.6650301441550255, "epoch": 0.9782117411630755, "grad_norm": 0.15015451610088348, "learning_rate": 6.739657128837367e-05, "loss": 0.65, "mean_token_accuracy": 0.8012652955949306, "num_tokens": 339328519.0, "step": 10632 }, { "entropy": 0.631567862816155, "epoch": 0.9783037475345168, "grad_norm": 0.14712867140769958, "learning_rate": 6.739350446223203e-05, "loss": 0.621, "mean_token_accuracy": 0.8192693889141083, "num_tokens": 339360456.0, "step": 10633 }, { "entropy": 0.6720016375184059, "epoch": 0.978395753905958, "grad_norm": 0.15067559480667114, "learning_rate": 6.73904376360904e-05, "loss": 0.6683, "mean_token_accuracy": 0.8012412339448929, "num_tokens": 339391976.0, "step": 10634 }, { "entropy": 0.680339464917779, "epoch": 0.9784877602773993, "grad_norm": 0.14898161590099335, "learning_rate": 6.73873708099488e-05, "loss": 0.6676, "mean_token_accuracy": 0.8007022142410278, "num_tokens": 339423961.0, "step": 10635 }, { "entropy": 0.8026669584214687, "epoch": 0.9785797666488404, "grad_norm": 0.1564677506685257, "learning_rate": 6.738430398380716e-05, "loss": 0.804, "mean_token_accuracy": 0.7714842669665813, "num_tokens": 339455771.0, "step": 10636 }, { "entropy": 0.7806021086871624, "epoch": 0.9786717730202816, "grad_norm": 0.1547614485025406, "learning_rate": 6.738123715766553e-05, "loss": 0.7759, "mean_token_accuracy": 0.7706379182636738, "num_tokens": 339487413.0, "step": 10637 }, { "entropy": 0.7693557813763618, "epoch": 0.9787637793917229, "grad_norm": 0.1616917997598648, "learning_rate": 6.73781703315239e-05, "loss": 0.7694, "mean_token_accuracy": 0.7737730257213116, "num_tokens": 339519297.0, "step": 10638 }, { "entropy": 0.58122737146914, "epoch": 0.9788557857631641, "grad_norm": 0.17865176498889923, "learning_rate": 6.737510350538228e-05, "loss": 0.5745, "mean_token_accuracy": 0.8251509852707386, "num_tokens": 339551253.0, "step": 10639 }, { "entropy": 0.6680003860965371, "epoch": 0.9789477921346054, "grad_norm": 0.15373562276363373, "learning_rate": 6.737203667924066e-05, "loss": 0.657, "mean_token_accuracy": 0.8019241280853748, "num_tokens": 339583151.0, "step": 10640 }, { "entropy": 0.6653646603226662, "epoch": 0.9790397985060465, "grad_norm": 0.15480153262615204, "learning_rate": 6.736896985309903e-05, "loss": 0.6639, "mean_token_accuracy": 0.8039392158389091, "num_tokens": 339615407.0, "step": 10641 }, { "entropy": 0.6428008042275906, "epoch": 0.9791318048774877, "grad_norm": 0.1487569659948349, "learning_rate": 6.73659030269574e-05, "loss": 0.6276, "mean_token_accuracy": 0.8083941899240017, "num_tokens": 339646864.0, "step": 10642 }, { "entropy": 0.742633230984211, "epoch": 0.979223811248929, "grad_norm": 0.1569424569606781, "learning_rate": 6.736283620081578e-05, "loss": 0.726, "mean_token_accuracy": 0.7838422544300556, "num_tokens": 339677868.0, "step": 10643 }, { "entropy": 0.7661631442606449, "epoch": 0.9793158176203702, "grad_norm": 0.1544497311115265, "learning_rate": 6.735976937467415e-05, "loss": 0.7621, "mean_token_accuracy": 0.7773768864572048, "num_tokens": 339710329.0, "step": 10644 }, { "entropy": 0.717248871922493, "epoch": 0.9794078239918115, "grad_norm": 0.16199244558811188, "learning_rate": 6.735670254853253e-05, "loss": 0.709, "mean_token_accuracy": 0.7878887839615345, "num_tokens": 339742010.0, "step": 10645 }, { "entropy": 0.8198088780045509, "epoch": 0.9794998303632526, "grad_norm": 0.1567835807800293, "learning_rate": 6.73536357223909e-05, "loss": 0.8061, "mean_token_accuracy": 0.7660497799515724, "num_tokens": 339773956.0, "step": 10646 }, { "entropy": 0.6666793972253799, "epoch": 0.9795918367346939, "grad_norm": 0.15395958721637726, "learning_rate": 6.735056889624928e-05, "loss": 0.6455, "mean_token_accuracy": 0.8097910322248936, "num_tokens": 339805915.0, "step": 10647 }, { "entropy": 0.6658129752613604, "epoch": 0.9796838431061351, "grad_norm": 0.15029458701610565, "learning_rate": 6.734750207010765e-05, "loss": 0.6407, "mean_token_accuracy": 0.8115718178451061, "num_tokens": 339838271.0, "step": 10648 }, { "entropy": 0.7826550453901291, "epoch": 0.9797758494775763, "grad_norm": 0.1553201824426651, "learning_rate": 6.734443524396602e-05, "loss": 0.7785, "mean_token_accuracy": 0.7709270305931568, "num_tokens": 339870878.0, "step": 10649 }, { "entropy": 0.7195312557742, "epoch": 0.9798678558490176, "grad_norm": 0.1492643505334854, "learning_rate": 6.73413684178244e-05, "loss": 0.7059, "mean_token_accuracy": 0.7891606464982033, "num_tokens": 339902985.0, "step": 10650 }, { "entropy": 0.6838386887684464, "epoch": 0.9799598622204587, "grad_norm": 0.1702621579170227, "learning_rate": 6.733830159168278e-05, "loss": 0.6513, "mean_token_accuracy": 0.8040628433227539, "num_tokens": 339934794.0, "step": 10651 }, { "entropy": 0.7162658143788576, "epoch": 0.9800518685919, "grad_norm": 0.16132943332195282, "learning_rate": 6.733523476554115e-05, "loss": 0.7166, "mean_token_accuracy": 0.784760408103466, "num_tokens": 339966584.0, "step": 10652 }, { "entropy": 0.7376744374632835, "epoch": 0.9801438749633412, "grad_norm": 0.15600518882274628, "learning_rate": 6.733216793939951e-05, "loss": 0.7287, "mean_token_accuracy": 0.7850036844611168, "num_tokens": 339998155.0, "step": 10653 }, { "entropy": 0.708761977031827, "epoch": 0.9802358813347825, "grad_norm": 0.1618315726518631, "learning_rate": 6.73291011132579e-05, "loss": 0.6971, "mean_token_accuracy": 0.79369742795825, "num_tokens": 340029903.0, "step": 10654 }, { "entropy": 0.6835060566663742, "epoch": 0.9803278877062237, "grad_norm": 0.15703396499156952, "learning_rate": 6.732603428711626e-05, "loss": 0.6872, "mean_token_accuracy": 0.7945076413452625, "num_tokens": 340061691.0, "step": 10655 }, { "entropy": 0.6371063506230712, "epoch": 0.9804198940776648, "grad_norm": 0.15215326845645905, "learning_rate": 6.732296746097464e-05, "loss": 0.6381, "mean_token_accuracy": 0.8198533095419407, "num_tokens": 340093831.0, "step": 10656 }, { "entropy": 0.7259279992431402, "epoch": 0.9805119004491061, "grad_norm": 0.15343718230724335, "learning_rate": 6.731990063483301e-05, "loss": 0.7261, "mean_token_accuracy": 0.7826810516417027, "num_tokens": 340125873.0, "step": 10657 }, { "entropy": 0.6564228171482682, "epoch": 0.9806039068205473, "grad_norm": 0.14669272303581238, "learning_rate": 6.73168338086914e-05, "loss": 0.6523, "mean_token_accuracy": 0.803366232663393, "num_tokens": 340158341.0, "step": 10658 }, { "entropy": 0.6347621958702803, "epoch": 0.9806959131919886, "grad_norm": 0.15829682350158691, "learning_rate": 6.731376698254976e-05, "loss": 0.6215, "mean_token_accuracy": 0.8155990391969681, "num_tokens": 340191061.0, "step": 10659 }, { "entropy": 0.6350116906687617, "epoch": 0.9807879195634298, "grad_norm": 0.14971430599689484, "learning_rate": 6.731070015640813e-05, "loss": 0.6211, "mean_token_accuracy": 0.8175940215587616, "num_tokens": 340222913.0, "step": 10660 }, { "entropy": 0.6956046745181084, "epoch": 0.9808799259348709, "grad_norm": 0.14982624351978302, "learning_rate": 6.730763333026651e-05, "loss": 0.6863, "mean_token_accuracy": 0.7971460521221161, "num_tokens": 340255144.0, "step": 10661 }, { "entropy": 0.6208344101905823, "epoch": 0.9809719323063122, "grad_norm": 0.1541215032339096, "learning_rate": 6.730456650412489e-05, "loss": 0.603, "mean_token_accuracy": 0.8185001760721207, "num_tokens": 340287486.0, "step": 10662 }, { "entropy": 0.7035593800246716, "epoch": 0.9810639386777534, "grad_norm": 0.15996944904327393, "learning_rate": 6.730149967798326e-05, "loss": 0.6927, "mean_token_accuracy": 0.7992163375020027, "num_tokens": 340319257.0, "step": 10663 }, { "entropy": 0.6475210161879659, "epoch": 0.9811559450491947, "grad_norm": 0.14944489300251007, "learning_rate": 6.729843285184163e-05, "loss": 0.624, "mean_token_accuracy": 0.8116655796766281, "num_tokens": 340351278.0, "step": 10664 }, { "entropy": 0.7395369587466121, "epoch": 0.9812479514206359, "grad_norm": 0.16104325652122498, "learning_rate": 6.72953660257e-05, "loss": 0.7257, "mean_token_accuracy": 0.7832578308880329, "num_tokens": 340382340.0, "step": 10665 }, { "entropy": 0.5317175472155213, "epoch": 0.9813399577920771, "grad_norm": 0.1439451426267624, "learning_rate": 6.729229919955838e-05, "loss": 0.4974, "mean_token_accuracy": 0.8496740385890007, "num_tokens": 340414834.0, "step": 10666 }, { "entropy": 0.811916159465909, "epoch": 0.9814319641635183, "grad_norm": 0.15855883061885834, "learning_rate": 6.728923237341676e-05, "loss": 0.8043, "mean_token_accuracy": 0.7632581554353237, "num_tokens": 340446888.0, "step": 10667 }, { "entropy": 0.6885384954512119, "epoch": 0.9815239705349595, "grad_norm": 0.15737544000148773, "learning_rate": 6.728616554727513e-05, "loss": 0.6847, "mean_token_accuracy": 0.7977384068071842, "num_tokens": 340478909.0, "step": 10668 }, { "entropy": 0.7664950825273991, "epoch": 0.9816159769064008, "grad_norm": 0.15581783652305603, "learning_rate": 6.72830987211335e-05, "loss": 0.7523, "mean_token_accuracy": 0.780837893486023, "num_tokens": 340511373.0, "step": 10669 }, { "entropy": 0.78896295838058, "epoch": 0.981707983277842, "grad_norm": 0.1547204852104187, "learning_rate": 6.728003189499188e-05, "loss": 0.7766, "mean_token_accuracy": 0.7691548354923725, "num_tokens": 340543360.0, "step": 10670 }, { "entropy": 0.7590831182897091, "epoch": 0.9817999896492832, "grad_norm": 0.16884124279022217, "learning_rate": 6.727696506885026e-05, "loss": 0.7463, "mean_token_accuracy": 0.7795246317982674, "num_tokens": 340574398.0, "step": 10671 }, { "entropy": 0.6365676112473011, "epoch": 0.9818919960207244, "grad_norm": 0.16068392992019653, "learning_rate": 6.727389824270863e-05, "loss": 0.6211, "mean_token_accuracy": 0.8154824897646904, "num_tokens": 340606610.0, "step": 10672 }, { "entropy": 0.6746859988197684, "epoch": 0.9819840023921657, "grad_norm": 0.15184547007083893, "learning_rate": 6.727083141656699e-05, "loss": 0.6637, "mean_token_accuracy": 0.8043478205800056, "num_tokens": 340639378.0, "step": 10673 }, { "entropy": 0.8352789860218763, "epoch": 0.9820760087636069, "grad_norm": 0.15795911848545074, "learning_rate": 6.726776459042537e-05, "loss": 0.8354, "mean_token_accuracy": 0.7557978183031082, "num_tokens": 340671123.0, "step": 10674 }, { "entropy": 0.5773513941094279, "epoch": 0.9821680151350481, "grad_norm": 0.15004587173461914, "learning_rate": 6.726469776428374e-05, "loss": 0.5685, "mean_token_accuracy": 0.8305414877831936, "num_tokens": 340703411.0, "step": 10675 }, { "entropy": 0.6845098277553916, "epoch": 0.9822600215064893, "grad_norm": 0.14998675882816315, "learning_rate": 6.726163093814212e-05, "loss": 0.6661, "mean_token_accuracy": 0.8026098683476448, "num_tokens": 340735087.0, "step": 10676 }, { "entropy": 0.7267597084864974, "epoch": 0.9823520278779305, "grad_norm": 0.15167909860610962, "learning_rate": 6.72585641120005e-05, "loss": 0.716, "mean_token_accuracy": 0.7872472107410431, "num_tokens": 340767294.0, "step": 10677 }, { "entropy": 0.6687714830040932, "epoch": 0.9824440342493718, "grad_norm": 0.14570148289203644, "learning_rate": 6.725549728585887e-05, "loss": 0.6371, "mean_token_accuracy": 0.8044130727648735, "num_tokens": 340799377.0, "step": 10678 }, { "entropy": 0.7174546960741282, "epoch": 0.982536040620813, "grad_norm": 0.15991050004959106, "learning_rate": 6.725243045971724e-05, "loss": 0.7121, "mean_token_accuracy": 0.7910387143492699, "num_tokens": 340831641.0, "step": 10679 }, { "entropy": 0.7398865707218647, "epoch": 0.9826280469922543, "grad_norm": 0.1677507609128952, "learning_rate": 6.724936363357561e-05, "loss": 0.7363, "mean_token_accuracy": 0.7848191149532795, "num_tokens": 340863639.0, "step": 10680 }, { "entropy": 0.60740558616817, "epoch": 0.9827200533636954, "grad_norm": 0.15986360609531403, "learning_rate": 6.724629680743399e-05, "loss": 0.5821, "mean_token_accuracy": 0.8246910274028778, "num_tokens": 340895603.0, "step": 10681 }, { "entropy": 0.6945192981511354, "epoch": 0.9828120597351366, "grad_norm": 0.15827642381191254, "learning_rate": 6.724322998129237e-05, "loss": 0.692, "mean_token_accuracy": 0.7932898104190826, "num_tokens": 340927587.0, "step": 10682 }, { "entropy": 0.6769187282770872, "epoch": 0.9829040661065779, "grad_norm": 0.15207941830158234, "learning_rate": 6.724016315515074e-05, "loss": 0.6746, "mean_token_accuracy": 0.7956702373921871, "num_tokens": 340959220.0, "step": 10683 }, { "entropy": 0.6096819452941418, "epoch": 0.9829960724780191, "grad_norm": 0.14726604521274567, "learning_rate": 6.723709632900911e-05, "loss": 0.582, "mean_token_accuracy": 0.823176022619009, "num_tokens": 340991277.0, "step": 10684 }, { "entropy": 0.8270751256495714, "epoch": 0.9830880788494604, "grad_norm": 0.1612326204776764, "learning_rate": 6.723402950286749e-05, "loss": 0.8155, "mean_token_accuracy": 0.7606712207198143, "num_tokens": 341022717.0, "step": 10685 }, { "entropy": 0.701416989788413, "epoch": 0.9831800852209015, "grad_norm": 0.15029048919677734, "learning_rate": 6.723096267672586e-05, "loss": 0.6809, "mean_token_accuracy": 0.7946742922067642, "num_tokens": 341055221.0, "step": 10686 }, { "entropy": 0.8002241607755423, "epoch": 0.9832720915923427, "grad_norm": 0.15925928950309753, "learning_rate": 6.722789585058424e-05, "loss": 0.8066, "mean_token_accuracy": 0.7639710269868374, "num_tokens": 341087423.0, "step": 10687 }, { "entropy": 0.7077586334198713, "epoch": 0.983364097963784, "grad_norm": 0.15047641098499298, "learning_rate": 6.72248290244426e-05, "loss": 0.6983, "mean_token_accuracy": 0.7926603928208351, "num_tokens": 341119931.0, "step": 10688 }, { "entropy": 0.6931829694658518, "epoch": 0.9834561043352252, "grad_norm": 0.15825660526752472, "learning_rate": 6.722176219830099e-05, "loss": 0.6822, "mean_token_accuracy": 0.7966234050691128, "num_tokens": 341152489.0, "step": 10689 }, { "entropy": 0.6130394442006946, "epoch": 0.9835481107066665, "grad_norm": 0.15189363062381744, "learning_rate": 6.721869537215936e-05, "loss": 0.5959, "mean_token_accuracy": 0.8189002573490143, "num_tokens": 341183335.0, "step": 10690 }, { "entropy": 0.7160324510186911, "epoch": 0.9836401170781076, "grad_norm": 0.14388436079025269, "learning_rate": 6.721562854601772e-05, "loss": 0.7016, "mean_token_accuracy": 0.7919887155294418, "num_tokens": 341215554.0, "step": 10691 }, { "entropy": 0.79881826415658, "epoch": 0.9837321234495489, "grad_norm": 0.15636423230171204, "learning_rate": 6.72125617198761e-05, "loss": 0.7942, "mean_token_accuracy": 0.7649000771343708, "num_tokens": 341246080.0, "step": 10692 }, { "entropy": 0.6974719683639705, "epoch": 0.9838241298209901, "grad_norm": 0.15531207621097565, "learning_rate": 6.720949489373449e-05, "loss": 0.6898, "mean_token_accuracy": 0.7952987514436245, "num_tokens": 341278221.0, "step": 10693 }, { "entropy": 0.6482951007783413, "epoch": 0.9839161361924313, "grad_norm": 0.16126228868961334, "learning_rate": 6.720642806759285e-05, "loss": 0.6307, "mean_token_accuracy": 0.8080011010169983, "num_tokens": 341310323.0, "step": 10694 }, { "entropy": 0.6941235959529877, "epoch": 0.9840081425638726, "grad_norm": 0.14790797233581543, "learning_rate": 6.720336124145122e-05, "loss": 0.6926, "mean_token_accuracy": 0.7953289970755577, "num_tokens": 341342559.0, "step": 10695 }, { "entropy": 0.7635149266570807, "epoch": 0.9841001489353137, "grad_norm": 0.15529868006706238, "learning_rate": 6.720029441530959e-05, "loss": 0.7727, "mean_token_accuracy": 0.7701333314180374, "num_tokens": 341374586.0, "step": 10696 }, { "entropy": 0.6859048530459404, "epoch": 0.984192155306755, "grad_norm": 0.15027043223381042, "learning_rate": 6.719722758916797e-05, "loss": 0.6823, "mean_token_accuracy": 0.7976969107985497, "num_tokens": 341405874.0, "step": 10697 }, { "entropy": 0.7358623333275318, "epoch": 0.9842841616781962, "grad_norm": 0.16095931828022003, "learning_rate": 6.719416076302635e-05, "loss": 0.7305, "mean_token_accuracy": 0.7860477045178413, "num_tokens": 341437892.0, "step": 10698 }, { "entropy": 0.644883319735527, "epoch": 0.9843761680496375, "grad_norm": 0.14940939843654633, "learning_rate": 6.719109393688472e-05, "loss": 0.6192, "mean_token_accuracy": 0.8117432072758675, "num_tokens": 341469712.0, "step": 10699 }, { "entropy": 0.6901897192001343, "epoch": 0.9844681744210787, "grad_norm": 0.15333226323127747, "learning_rate": 6.718802711074309e-05, "loss": 0.6882, "mean_token_accuracy": 0.7910367660224438, "num_tokens": 341501171.0, "step": 10700 }, { "entropy": 0.7035043984651566, "epoch": 0.9845601807925198, "grad_norm": 0.1523108333349228, "learning_rate": 6.718496028460147e-05, "loss": 0.7149, "mean_token_accuracy": 0.7885532379150391, "num_tokens": 341532905.0, "step": 10701 }, { "entropy": 0.7175933048129082, "epoch": 0.9846521871639611, "grad_norm": 0.15437746047973633, "learning_rate": 6.718189345845984e-05, "loss": 0.6884, "mean_token_accuracy": 0.7947478108108044, "num_tokens": 341565121.0, "step": 10702 }, { "entropy": 0.5460159163922071, "epoch": 0.9847441935354023, "grad_norm": 0.14516349136829376, "learning_rate": 6.717882663231822e-05, "loss": 0.5284, "mean_token_accuracy": 0.8421624004840851, "num_tokens": 341596625.0, "step": 10703 }, { "entropy": 0.6963630188256502, "epoch": 0.9848361999068436, "grad_norm": 0.1680130660533905, "learning_rate": 6.717575980617659e-05, "loss": 0.6906, "mean_token_accuracy": 0.7966231033205986, "num_tokens": 341629393.0, "step": 10704 }, { "entropy": 0.6057257149368525, "epoch": 0.9849282062782848, "grad_norm": 0.14986005425453186, "learning_rate": 6.717269298003497e-05, "loss": 0.5893, "mean_token_accuracy": 0.8268276751041412, "num_tokens": 341661229.0, "step": 10705 }, { "entropy": 0.591246142052114, "epoch": 0.985020212649726, "grad_norm": 0.13910962641239166, "learning_rate": 6.716962615389334e-05, "loss": 0.5706, "mean_token_accuracy": 0.8290906623005867, "num_tokens": 341693930.0, "step": 10706 }, { "entropy": 0.634125187061727, "epoch": 0.9851122190211672, "grad_norm": 0.14676249027252197, "learning_rate": 6.71665593277517e-05, "loss": 0.6112, "mean_token_accuracy": 0.8137099519371986, "num_tokens": 341725483.0, "step": 10707 }, { "entropy": 0.6431856136769056, "epoch": 0.9852042253926084, "grad_norm": 0.15026801824569702, "learning_rate": 6.71634925016101e-05, "loss": 0.6192, "mean_token_accuracy": 0.8166288249194622, "num_tokens": 341757497.0, "step": 10708 }, { "entropy": 0.7354996390640736, "epoch": 0.9852962317640497, "grad_norm": 0.1569245606660843, "learning_rate": 6.716042567546847e-05, "loss": 0.7282, "mean_token_accuracy": 0.7839795649051666, "num_tokens": 341789399.0, "step": 10709 }, { "entropy": 0.6744760097935796, "epoch": 0.9853882381354909, "grad_norm": 0.15067873895168304, "learning_rate": 6.715735884932683e-05, "loss": 0.6615, "mean_token_accuracy": 0.8031509630382061, "num_tokens": 341821859.0, "step": 10710 }, { "entropy": 0.7357632834464312, "epoch": 0.9854802445069321, "grad_norm": 0.17317534983158112, "learning_rate": 6.71542920231852e-05, "loss": 0.7538, "mean_token_accuracy": 0.7801604233682156, "num_tokens": 341854475.0, "step": 10711 }, { "entropy": 0.675763227045536, "epoch": 0.9855722508783733, "grad_norm": 0.15033851563930511, "learning_rate": 6.715122519704358e-05, "loss": 0.6585, "mean_token_accuracy": 0.8007294982671738, "num_tokens": 341886185.0, "step": 10712 }, { "entropy": 0.744746396318078, "epoch": 0.9856642572498145, "grad_norm": 0.16166594624519348, "learning_rate": 6.714815837090197e-05, "loss": 0.7347, "mean_token_accuracy": 0.7871145308017731, "num_tokens": 341917609.0, "step": 10713 }, { "entropy": 0.6038727629929781, "epoch": 0.9857562636212558, "grad_norm": 0.1602073609828949, "learning_rate": 6.714509154476033e-05, "loss": 0.5895, "mean_token_accuracy": 0.8248329311609268, "num_tokens": 341949266.0, "step": 10714 }, { "entropy": 0.6711984761059284, "epoch": 0.985848269992697, "grad_norm": 0.14792989194393158, "learning_rate": 6.71420247186187e-05, "loss": 0.6539, "mean_token_accuracy": 0.8015061318874359, "num_tokens": 341981378.0, "step": 10715 }, { "entropy": 0.7429183339700103, "epoch": 0.9859402763641382, "grad_norm": 0.15745660662651062, "learning_rate": 6.713895789247708e-05, "loss": 0.7442, "mean_token_accuracy": 0.7791816145181656, "num_tokens": 342012920.0, "step": 10716 }, { "entropy": 0.6340972045436502, "epoch": 0.9860322827355794, "grad_norm": 0.15954308211803436, "learning_rate": 6.713589106633545e-05, "loss": 0.621, "mean_token_accuracy": 0.8151038847863674, "num_tokens": 342045155.0, "step": 10717 }, { "entropy": 0.6251770742237568, "epoch": 0.9861242891070207, "grad_norm": 0.1496426910161972, "learning_rate": 6.713282424019383e-05, "loss": 0.5937, "mean_token_accuracy": 0.8226956687867641, "num_tokens": 342077225.0, "step": 10718 }, { "entropy": 0.7192734554409981, "epoch": 0.9862162954784619, "grad_norm": 0.15465523302555084, "learning_rate": 6.71297574140522e-05, "loss": 0.6936, "mean_token_accuracy": 0.7935804724693298, "num_tokens": 342108606.0, "step": 10719 }, { "entropy": 0.7618325632065535, "epoch": 0.9863083018499031, "grad_norm": 0.1574353724718094, "learning_rate": 6.712669058791058e-05, "loss": 0.7527, "mean_token_accuracy": 0.7777319364249706, "num_tokens": 342140247.0, "step": 10720 }, { "entropy": 0.8123092018067837, "epoch": 0.9864003082213443, "grad_norm": 0.16468827426433563, "learning_rate": 6.712362376176895e-05, "loss": 0.7864, "mean_token_accuracy": 0.767015628516674, "num_tokens": 342171689.0, "step": 10721 }, { "entropy": 0.6636488363146782, "epoch": 0.9864923145927855, "grad_norm": 0.14738401770591736, "learning_rate": 6.712055693562732e-05, "loss": 0.6353, "mean_token_accuracy": 0.8134344816207886, "num_tokens": 342204417.0, "step": 10722 }, { "entropy": 0.7238919101655483, "epoch": 0.9865843209642268, "grad_norm": 0.16132871806621552, "learning_rate": 6.71174901094857e-05, "loss": 0.7095, "mean_token_accuracy": 0.7883936651051044, "num_tokens": 342235678.0, "step": 10723 }, { "entropy": 0.7347845742478967, "epoch": 0.986676327335668, "grad_norm": 0.15566398203372955, "learning_rate": 6.711442328334408e-05, "loss": 0.7315, "mean_token_accuracy": 0.7783857360482216, "num_tokens": 342267217.0, "step": 10724 }, { "entropy": 0.6981153748929501, "epoch": 0.9867683337071093, "grad_norm": 0.1591978520154953, "learning_rate": 6.711135645720245e-05, "loss": 0.6952, "mean_token_accuracy": 0.795062966644764, "num_tokens": 342299673.0, "step": 10725 }, { "entropy": 0.8025952689349651, "epoch": 0.9868603400785504, "grad_norm": 0.1569969356060028, "learning_rate": 6.710828963106082e-05, "loss": 0.8002, "mean_token_accuracy": 0.7668984606862068, "num_tokens": 342330915.0, "step": 10726 }, { "entropy": 0.6547057349234819, "epoch": 0.9869523464499916, "grad_norm": 0.1571449339389801, "learning_rate": 6.710522280491918e-05, "loss": 0.6643, "mean_token_accuracy": 0.8040328361093998, "num_tokens": 342362591.0, "step": 10727 }, { "entropy": 0.5869275350123644, "epoch": 0.9870443528214329, "grad_norm": 0.15489153563976288, "learning_rate": 6.710215597877756e-05, "loss": 0.5786, "mean_token_accuracy": 0.8224467448890209, "num_tokens": 342393934.0, "step": 10728 }, { "entropy": 0.7637748457491398, "epoch": 0.9871363591928741, "grad_norm": 0.1553264558315277, "learning_rate": 6.709908915263595e-05, "loss": 0.7409, "mean_token_accuracy": 0.7803970724344254, "num_tokens": 342425696.0, "step": 10729 }, { "entropy": 0.6619486603885889, "epoch": 0.9872283655643154, "grad_norm": 0.15594930946826935, "learning_rate": 6.709602232649431e-05, "loss": 0.6476, "mean_token_accuracy": 0.8037876412272453, "num_tokens": 342457194.0, "step": 10730 }, { "entropy": 0.6627030745148659, "epoch": 0.9873203719357565, "grad_norm": 0.14798647165298462, "learning_rate": 6.709295550035268e-05, "loss": 0.6452, "mean_token_accuracy": 0.8029203861951828, "num_tokens": 342489676.0, "step": 10731 }, { "entropy": 0.7620030697435141, "epoch": 0.9874123783071977, "grad_norm": 0.15814760327339172, "learning_rate": 6.708988867421106e-05, "loss": 0.7562, "mean_token_accuracy": 0.7775351032614708, "num_tokens": 342521050.0, "step": 10732 }, { "entropy": 0.7577329576015472, "epoch": 0.987504384678639, "grad_norm": 0.15735454857349396, "learning_rate": 6.708682184806943e-05, "loss": 0.7389, "mean_token_accuracy": 0.7791989520192146, "num_tokens": 342552676.0, "step": 10733 }, { "entropy": 0.6861260319128633, "epoch": 0.9875963910500802, "grad_norm": 0.14998988807201385, "learning_rate": 6.708375502192781e-05, "loss": 0.6745, "mean_token_accuracy": 0.8019385971128941, "num_tokens": 342584694.0, "step": 10734 }, { "entropy": 0.7339207902550697, "epoch": 0.9876883974215215, "grad_norm": 0.16129682958126068, "learning_rate": 6.708068819578618e-05, "loss": 0.7093, "mean_token_accuracy": 0.7891803681850433, "num_tokens": 342616261.0, "step": 10735 }, { "entropy": 0.6689471062272787, "epoch": 0.9877804037929626, "grad_norm": 0.14422205090522766, "learning_rate": 6.707762136964456e-05, "loss": 0.6555, "mean_token_accuracy": 0.8031104765832424, "num_tokens": 342648029.0, "step": 10736 }, { "entropy": 0.7065583765506744, "epoch": 0.9878724101644039, "grad_norm": 0.14937640726566315, "learning_rate": 6.707455454350293e-05, "loss": 0.7076, "mean_token_accuracy": 0.7923536412417889, "num_tokens": 342680291.0, "step": 10737 }, { "entropy": 0.8047258090227842, "epoch": 0.9879644165358451, "grad_norm": 0.1558113992214203, "learning_rate": 6.70714877173613e-05, "loss": 0.8052, "mean_token_accuracy": 0.763905830681324, "num_tokens": 342712259.0, "step": 10738 }, { "entropy": 0.6521598761901259, "epoch": 0.9880564229072863, "grad_norm": 0.14718444645404816, "learning_rate": 6.706842089121968e-05, "loss": 0.6284, "mean_token_accuracy": 0.8183500468730927, "num_tokens": 342744109.0, "step": 10739 }, { "entropy": 0.7290212623775005, "epoch": 0.9881484292787276, "grad_norm": 0.1555648148059845, "learning_rate": 6.706535406507806e-05, "loss": 0.7004, "mean_token_accuracy": 0.7870186977088451, "num_tokens": 342775787.0, "step": 10740 }, { "entropy": 0.5731196776032448, "epoch": 0.9882404356501687, "grad_norm": 0.14721882343292236, "learning_rate": 6.706228723893643e-05, "loss": 0.557, "mean_token_accuracy": 0.8357735462486744, "num_tokens": 342808185.0, "step": 10741 }, { "entropy": 0.7122553996741772, "epoch": 0.98833244202161, "grad_norm": 0.1551104336977005, "learning_rate": 6.70592204127948e-05, "loss": 0.7042, "mean_token_accuracy": 0.7947388589382172, "num_tokens": 342840595.0, "step": 10742 }, { "entropy": 0.6804009452462196, "epoch": 0.9884244483930512, "grad_norm": 0.15448178350925446, "learning_rate": 6.705615358665318e-05, "loss": 0.6689, "mean_token_accuracy": 0.7970963716506958, "num_tokens": 342872682.0, "step": 10743 }, { "entropy": 0.6680690040811896, "epoch": 0.9885164547644925, "grad_norm": 0.1461191028356552, "learning_rate": 6.705308676051155e-05, "loss": 0.6473, "mean_token_accuracy": 0.8055110238492489, "num_tokens": 342904291.0, "step": 10744 }, { "entropy": 0.6767096184194088, "epoch": 0.9886084611359337, "grad_norm": 0.174092099070549, "learning_rate": 6.705001993436993e-05, "loss": 0.6848, "mean_token_accuracy": 0.7942872121930122, "num_tokens": 342936682.0, "step": 10745 }, { "entropy": 0.7388930274173617, "epoch": 0.9887004675073748, "grad_norm": 0.15219688415527344, "learning_rate": 6.70469531082283e-05, "loss": 0.7438, "mean_token_accuracy": 0.7853900454938412, "num_tokens": 342968630.0, "step": 10746 }, { "entropy": 0.6837972048670053, "epoch": 0.9887924738788161, "grad_norm": 0.15207479894161224, "learning_rate": 6.704388628208668e-05, "loss": 0.663, "mean_token_accuracy": 0.800333920866251, "num_tokens": 343000494.0, "step": 10747 }, { "entropy": 0.7458132058382034, "epoch": 0.9888844802502573, "grad_norm": 0.15495915710926056, "learning_rate": 6.704081945594504e-05, "loss": 0.7506, "mean_token_accuracy": 0.7780111655592918, "num_tokens": 343031924.0, "step": 10748 }, { "entropy": 0.785844910889864, "epoch": 0.9889764866216986, "grad_norm": 0.15896983444690704, "learning_rate": 6.703775262980341e-05, "loss": 0.7833, "mean_token_accuracy": 0.765913300216198, "num_tokens": 343063819.0, "step": 10749 }, { "entropy": 0.6084613744169474, "epoch": 0.9890684929931398, "grad_norm": 0.1541769653558731, "learning_rate": 6.70346858036618e-05, "loss": 0.5962, "mean_token_accuracy": 0.8217114247381687, "num_tokens": 343095811.0, "step": 10750 }, { "entropy": 0.722863707691431, "epoch": 0.989160499364581, "grad_norm": 0.15148432552814484, "learning_rate": 6.703161897752017e-05, "loss": 0.7109, "mean_token_accuracy": 0.7864315584301949, "num_tokens": 343127055.0, "step": 10751 }, { "entropy": 0.6440486563369632, "epoch": 0.9892525057360222, "grad_norm": 0.14748679101467133, "learning_rate": 6.702855215137854e-05, "loss": 0.6347, "mean_token_accuracy": 0.8150553852319717, "num_tokens": 343158974.0, "step": 10752 }, { "entropy": 0.6829834477975965, "epoch": 0.9893445121074634, "grad_norm": 0.15272484719753265, "learning_rate": 6.702548532523691e-05, "loss": 0.6612, "mean_token_accuracy": 0.8025909699499607, "num_tokens": 343191567.0, "step": 10753 }, { "entropy": 0.8635164052248001, "epoch": 0.9894365184789047, "grad_norm": 0.1613001972436905, "learning_rate": 6.702241849909528e-05, "loss": 0.8574, "mean_token_accuracy": 0.7545499727129936, "num_tokens": 343222875.0, "step": 10754 }, { "entropy": 0.7369737103581429, "epoch": 0.9895285248503459, "grad_norm": 0.16535404324531555, "learning_rate": 6.701935167295367e-05, "loss": 0.7381, "mean_token_accuracy": 0.7782619521021843, "num_tokens": 343254319.0, "step": 10755 }, { "entropy": 0.7962956931442022, "epoch": 0.9896205312217871, "grad_norm": 0.16246114671230316, "learning_rate": 6.701628484681204e-05, "loss": 0.7784, "mean_token_accuracy": 0.7698286324739456, "num_tokens": 343286009.0, "step": 10756 }, { "entropy": 0.7675060164183378, "epoch": 0.9897125375932283, "grad_norm": 0.15703585743904114, "learning_rate": 6.701321802067041e-05, "loss": 0.7514, "mean_token_accuracy": 0.7756641656160355, "num_tokens": 343317736.0, "step": 10757 }, { "entropy": 0.7040892308577895, "epoch": 0.9898045439646695, "grad_norm": 0.15862968564033508, "learning_rate": 6.701015119452878e-05, "loss": 0.6907, "mean_token_accuracy": 0.7917059138417244, "num_tokens": 343350182.0, "step": 10758 }, { "entropy": 0.7692784853279591, "epoch": 0.9898965503361108, "grad_norm": 0.17698609828948975, "learning_rate": 6.700708436838716e-05, "loss": 0.758, "mean_token_accuracy": 0.7762006856501102, "num_tokens": 343382289.0, "step": 10759 }, { "entropy": 0.5945233330130577, "epoch": 0.989988556707552, "grad_norm": 0.1400427371263504, "learning_rate": 6.700401754224554e-05, "loss": 0.59, "mean_token_accuracy": 0.8221310190856457, "num_tokens": 343414178.0, "step": 10760 }, { "entropy": 0.6152955498546362, "epoch": 0.9900805630789932, "grad_norm": 0.14927798509597778, "learning_rate": 6.700095071610391e-05, "loss": 0.5952, "mean_token_accuracy": 0.8193485029041767, "num_tokens": 343446489.0, "step": 10761 }, { "entropy": 0.7141527123749256, "epoch": 0.9901725694504344, "grad_norm": 0.1583973914384842, "learning_rate": 6.699788388996228e-05, "loss": 0.6887, "mean_token_accuracy": 0.7976505011320114, "num_tokens": 343478569.0, "step": 10762 }, { "entropy": 0.6849739067256451, "epoch": 0.9902645758218757, "grad_norm": 0.14715206623077393, "learning_rate": 6.699481706382066e-05, "loss": 0.6653, "mean_token_accuracy": 0.8029139712452888, "num_tokens": 343510746.0, "step": 10763 }, { "entropy": 0.6760705541819334, "epoch": 0.9903565821933169, "grad_norm": 0.16324540972709656, "learning_rate": 6.699175023767902e-05, "loss": 0.6649, "mean_token_accuracy": 0.7997146211564541, "num_tokens": 343542612.0, "step": 10764 }, { "entropy": 0.6761240754276514, "epoch": 0.9904485885647581, "grad_norm": 0.14761677384376526, "learning_rate": 6.69886834115374e-05, "loss": 0.6609, "mean_token_accuracy": 0.8030462078750134, "num_tokens": 343575000.0, "step": 10765 }, { "entropy": 0.7475274335592985, "epoch": 0.9905405949361993, "grad_norm": 0.1581384688615799, "learning_rate": 6.698561658539577e-05, "loss": 0.7501, "mean_token_accuracy": 0.7808474749326706, "num_tokens": 343607176.0, "step": 10766 }, { "entropy": 0.7130754292011261, "epoch": 0.9906326013076405, "grad_norm": 0.1629365086555481, "learning_rate": 6.698254975925416e-05, "loss": 0.6959, "mean_token_accuracy": 0.7947229705750942, "num_tokens": 343639420.0, "step": 10767 }, { "entropy": 0.718221090734005, "epoch": 0.9907246076790818, "grad_norm": 0.16604968905448914, "learning_rate": 6.697948293311252e-05, "loss": 0.731, "mean_token_accuracy": 0.7878916822373867, "num_tokens": 343671486.0, "step": 10768 }, { "entropy": 0.7898632325232029, "epoch": 0.990816614050523, "grad_norm": 0.1605367213487625, "learning_rate": 6.697641610697089e-05, "loss": 0.7842, "mean_token_accuracy": 0.7727605551481247, "num_tokens": 343702667.0, "step": 10769 }, { "entropy": 0.6296033356338739, "epoch": 0.9909086204219643, "grad_norm": 0.16042953729629517, "learning_rate": 6.697334928082927e-05, "loss": 0.6232, "mean_token_accuracy": 0.8151320889592171, "num_tokens": 343734741.0, "step": 10770 }, { "entropy": 0.6668254286050797, "epoch": 0.9910006267934054, "grad_norm": 0.154945507645607, "learning_rate": 6.697028245468765e-05, "loss": 0.6637, "mean_token_accuracy": 0.804306261241436, "num_tokens": 343766882.0, "step": 10771 }, { "entropy": 0.6241018762812018, "epoch": 0.9910926331648466, "grad_norm": 0.1460465043783188, "learning_rate": 6.696721562854602e-05, "loss": 0.6013, "mean_token_accuracy": 0.8168587759137154, "num_tokens": 343798548.0, "step": 10772 }, { "entropy": 0.8466452434659004, "epoch": 0.9911846395362879, "grad_norm": 0.16484686732292175, "learning_rate": 6.696414880240439e-05, "loss": 0.8489, "mean_token_accuracy": 0.7563196681439877, "num_tokens": 343831123.0, "step": 10773 }, { "entropy": 0.5859060045331717, "epoch": 0.9912766459077291, "grad_norm": 0.14794258773326874, "learning_rate": 6.696108197626277e-05, "loss": 0.587, "mean_token_accuracy": 0.8244335204362869, "num_tokens": 343862952.0, "step": 10774 }, { "entropy": 0.7442157361656427, "epoch": 0.9913686522791704, "grad_norm": 0.15119753777980804, "learning_rate": 6.695801515012114e-05, "loss": 0.7307, "mean_token_accuracy": 0.7822629623115063, "num_tokens": 343895433.0, "step": 10775 }, { "entropy": 0.6606582626700401, "epoch": 0.9914606586506115, "grad_norm": 0.14821286499500275, "learning_rate": 6.695494832397952e-05, "loss": 0.6588, "mean_token_accuracy": 0.8001754730939865, "num_tokens": 343927663.0, "step": 10776 }, { "entropy": 0.5735927168279886, "epoch": 0.9915526650220527, "grad_norm": 0.15325070917606354, "learning_rate": 6.695188149783789e-05, "loss": 0.5497, "mean_token_accuracy": 0.8329834789037704, "num_tokens": 343960365.0, "step": 10777 }, { "entropy": 0.7826302107423544, "epoch": 0.991644671393494, "grad_norm": 0.16105858981609344, "learning_rate": 6.694881467169627e-05, "loss": 0.7761, "mean_token_accuracy": 0.7726006545126438, "num_tokens": 343992610.0, "step": 10778 }, { "entropy": 0.7275161556899548, "epoch": 0.9917366777649352, "grad_norm": 0.15739943087100983, "learning_rate": 6.694574784555464e-05, "loss": 0.7163, "mean_token_accuracy": 0.7864337973296642, "num_tokens": 344023823.0, "step": 10779 }, { "entropy": 0.6856575161218643, "epoch": 0.9918286841363765, "grad_norm": 0.1538325995206833, "learning_rate": 6.6942681019413e-05, "loss": 0.6909, "mean_token_accuracy": 0.7922129519283772, "num_tokens": 344055534.0, "step": 10780 }, { "entropy": 0.5891643664799631, "epoch": 0.9919206905078176, "grad_norm": 0.1508904993534088, "learning_rate": 6.693961419327139e-05, "loss": 0.5691, "mean_token_accuracy": 0.8265917561948299, "num_tokens": 344087687.0, "step": 10781 }, { "entropy": 0.7669612839818001, "epoch": 0.9920126968792589, "grad_norm": 0.15659593045711517, "learning_rate": 6.693654736712977e-05, "loss": 0.759, "mean_token_accuracy": 0.779259979724884, "num_tokens": 344118586.0, "step": 10782 }, { "entropy": 0.6041261241771281, "epoch": 0.9921047032507001, "grad_norm": 0.1446591466665268, "learning_rate": 6.693348054098814e-05, "loss": 0.5998, "mean_token_accuracy": 0.8241670578718185, "num_tokens": 344151048.0, "step": 10783 }, { "entropy": 0.7308912593871355, "epoch": 0.9921967096221413, "grad_norm": 0.15078559517860413, "learning_rate": 6.69304137148465e-05, "loss": 0.7187, "mean_token_accuracy": 0.7892863526940346, "num_tokens": 344183467.0, "step": 10784 }, { "entropy": 0.7304187547415495, "epoch": 0.9922887159935826, "grad_norm": 0.1534116566181183, "learning_rate": 6.692734688870487e-05, "loss": 0.7044, "mean_token_accuracy": 0.7886729873716831, "num_tokens": 344215047.0, "step": 10785 }, { "entropy": 0.7387849614024162, "epoch": 0.9923807223650237, "grad_norm": 0.15662816166877747, "learning_rate": 6.692428006256325e-05, "loss": 0.7188, "mean_token_accuracy": 0.7899422906339169, "num_tokens": 344247176.0, "step": 10786 }, { "entropy": 0.7515231482684612, "epoch": 0.992472728736465, "grad_norm": 0.15318962931632996, "learning_rate": 6.692121323642164e-05, "loss": 0.7333, "mean_token_accuracy": 0.783893309533596, "num_tokens": 344279531.0, "step": 10787 }, { "entropy": 0.6724366955459118, "epoch": 0.9925647351079062, "grad_norm": 0.15184269845485687, "learning_rate": 6.691814641028e-05, "loss": 0.6546, "mean_token_accuracy": 0.8029724359512329, "num_tokens": 344311630.0, "step": 10788 }, { "entropy": 0.5736624905839562, "epoch": 0.9926567414793475, "grad_norm": 0.14328216016292572, "learning_rate": 6.691507958413837e-05, "loss": 0.5554, "mean_token_accuracy": 0.8324397876858711, "num_tokens": 344343846.0, "step": 10789 }, { "entropy": 0.5934606399387121, "epoch": 0.9927487478507887, "grad_norm": 0.14868777990341187, "learning_rate": 6.691201275799675e-05, "loss": 0.5955, "mean_token_accuracy": 0.819635983556509, "num_tokens": 344375666.0, "step": 10790 }, { "entropy": 0.7812086325138807, "epoch": 0.9928407542222298, "grad_norm": 0.16050119698047638, "learning_rate": 6.690894593185513e-05, "loss": 0.7734, "mean_token_accuracy": 0.7699658460915089, "num_tokens": 344408012.0, "step": 10791 }, { "entropy": 0.7579163946211338, "epoch": 0.9929327605936711, "grad_norm": 0.16025415062904358, "learning_rate": 6.69058791057135e-05, "loss": 0.7752, "mean_token_accuracy": 0.7685063816606998, "num_tokens": 344438517.0, "step": 10792 }, { "entropy": 0.7749667949974537, "epoch": 0.9930247669651123, "grad_norm": 0.16385215520858765, "learning_rate": 6.690281227957187e-05, "loss": 0.7791, "mean_token_accuracy": 0.7710829079151154, "num_tokens": 344470875.0, "step": 10793 }, { "entropy": 0.7205776497721672, "epoch": 0.9931167733365536, "grad_norm": 0.1588430106639862, "learning_rate": 6.689974545343025e-05, "loss": 0.7155, "mean_token_accuracy": 0.785976879298687, "num_tokens": 344502448.0, "step": 10794 }, { "entropy": 0.7119633732363582, "epoch": 0.9932087797079948, "grad_norm": 0.16248252987861633, "learning_rate": 6.689667862728862e-05, "loss": 0.7128, "mean_token_accuracy": 0.7936295755207539, "num_tokens": 344533219.0, "step": 10795 }, { "entropy": 0.6819195002317429, "epoch": 0.993300786079436, "grad_norm": 0.14672689139842987, "learning_rate": 6.6893611801147e-05, "loss": 0.6651, "mean_token_accuracy": 0.8005755506455898, "num_tokens": 344565447.0, "step": 10796 }, { "entropy": 0.7185427099466324, "epoch": 0.9933927924508772, "grad_norm": 0.16160903871059418, "learning_rate": 6.689054497500537e-05, "loss": 0.7186, "mean_token_accuracy": 0.7911116778850555, "num_tokens": 344596008.0, "step": 10797 }, { "entropy": 0.8016707301139832, "epoch": 0.9934847988223184, "grad_norm": 0.16602005064487457, "learning_rate": 6.688747814886375e-05, "loss": 0.7904, "mean_token_accuracy": 0.7696431279182434, "num_tokens": 344628248.0, "step": 10798 }, { "entropy": 0.6824175361543894, "epoch": 0.9935768051937597, "grad_norm": 0.1552087664604187, "learning_rate": 6.688441132272212e-05, "loss": 0.6732, "mean_token_accuracy": 0.8006101995706558, "num_tokens": 344660742.0, "step": 10799 }, { "entropy": 0.670639562420547, "epoch": 0.9936688115652009, "grad_norm": 0.1425110399723053, "learning_rate": 6.688134449658049e-05, "loss": 0.6636, "mean_token_accuracy": 0.8016855455935001, "num_tokens": 344693179.0, "step": 10800 }, { "entropy": 0.6599009223282337, "epoch": 0.9937608179366421, "grad_norm": 0.1553841382265091, "learning_rate": 6.687827767043887e-05, "loss": 0.6551, "mean_token_accuracy": 0.8074255250394344, "num_tokens": 344725469.0, "step": 10801 }, { "entropy": 0.7757883109152317, "epoch": 0.9938528243080833, "grad_norm": 0.15855452418327332, "learning_rate": 6.687521084429725e-05, "loss": 0.7829, "mean_token_accuracy": 0.7689474076032639, "num_tokens": 344757175.0, "step": 10802 }, { "entropy": 0.5795407295227051, "epoch": 0.9939448306795245, "grad_norm": 0.15758000314235687, "learning_rate": 6.687214401815562e-05, "loss": 0.5767, "mean_token_accuracy": 0.8233759813010693, "num_tokens": 344789081.0, "step": 10803 }, { "entropy": 0.7402180396020412, "epoch": 0.9940368370509658, "grad_norm": 0.16361987590789795, "learning_rate": 6.686907719201398e-05, "loss": 0.7282, "mean_token_accuracy": 0.7837566845119, "num_tokens": 344820962.0, "step": 10804 }, { "entropy": 0.7793048862367868, "epoch": 0.994128843422407, "grad_norm": 0.15453974902629852, "learning_rate": 6.686601036587237e-05, "loss": 0.7523, "mean_token_accuracy": 0.77679792791605, "num_tokens": 344852834.0, "step": 10805 }, { "entropy": 0.7493541445583105, "epoch": 0.9942208497938482, "grad_norm": 0.160062775015831, "learning_rate": 6.686294353973073e-05, "loss": 0.7524, "mean_token_accuracy": 0.77812734618783, "num_tokens": 344884693.0, "step": 10806 }, { "entropy": 0.6082068625837564, "epoch": 0.9943128561652894, "grad_norm": 0.13591396808624268, "learning_rate": 6.685987671358911e-05, "loss": 0.5738, "mean_token_accuracy": 0.8299529291689396, "num_tokens": 344916889.0, "step": 10807 }, { "entropy": 0.5910112503916025, "epoch": 0.9944048625367307, "grad_norm": 0.1520845592021942, "learning_rate": 6.685680988744748e-05, "loss": 0.5641, "mean_token_accuracy": 0.8321896269917488, "num_tokens": 344948757.0, "step": 10808 }, { "entropy": 0.6240068860352039, "epoch": 0.9944968689081719, "grad_norm": 0.1496381014585495, "learning_rate": 6.685374306130586e-05, "loss": 0.6019, "mean_token_accuracy": 0.8181179650127888, "num_tokens": 344981525.0, "step": 10809 }, { "entropy": 0.6905934661626816, "epoch": 0.9945888752796131, "grad_norm": 0.14948153495788574, "learning_rate": 6.685067623516423e-05, "loss": 0.6743, "mean_token_accuracy": 0.7986595891416073, "num_tokens": 345013412.0, "step": 10810 }, { "entropy": 0.8332785591483116, "epoch": 0.9946808816510543, "grad_norm": 0.16550293564796448, "learning_rate": 6.68476094090226e-05, "loss": 0.8409, "mean_token_accuracy": 0.756006445735693, "num_tokens": 345045533.0, "step": 10811 }, { "entropy": 0.6532058566808701, "epoch": 0.9947728880224955, "grad_norm": 0.15743549168109894, "learning_rate": 6.684454258288098e-05, "loss": 0.6317, "mean_token_accuracy": 0.8141423799097538, "num_tokens": 345077519.0, "step": 10812 }, { "entropy": 0.7174852453172207, "epoch": 0.9948648943939368, "grad_norm": 0.15358835458755493, "learning_rate": 6.684147575673936e-05, "loss": 0.7026, "mean_token_accuracy": 0.791305385529995, "num_tokens": 345109832.0, "step": 10813 }, { "entropy": 0.6976348096504807, "epoch": 0.994956900765378, "grad_norm": 0.15170064568519592, "learning_rate": 6.683840893059773e-05, "loss": 0.6899, "mean_token_accuracy": 0.7940831072628498, "num_tokens": 345142155.0, "step": 10814 }, { "entropy": 0.6204143255017698, "epoch": 0.9950489071368193, "grad_norm": 0.1409311443567276, "learning_rate": 6.68353421044561e-05, "loss": 0.6152, "mean_token_accuracy": 0.8114605993032455, "num_tokens": 345174078.0, "step": 10815 }, { "entropy": 0.6792154386639595, "epoch": 0.9951409135082604, "grad_norm": 0.14964395761489868, "learning_rate": 6.683227527831447e-05, "loss": 0.6795, "mean_token_accuracy": 0.7974983379244804, "num_tokens": 345206264.0, "step": 10816 }, { "entropy": 0.6952597107738256, "epoch": 0.9952329198797016, "grad_norm": 0.14977137744426727, "learning_rate": 6.682920845217285e-05, "loss": 0.6768, "mean_token_accuracy": 0.7977260127663612, "num_tokens": 345238423.0, "step": 10817 }, { "entropy": 0.6377477552741766, "epoch": 0.9953249262511429, "grad_norm": 0.16152425110340118, "learning_rate": 6.682614162603123e-05, "loss": 0.6385, "mean_token_accuracy": 0.8105308338999748, "num_tokens": 345270641.0, "step": 10818 }, { "entropy": 0.750324472784996, "epoch": 0.9954169326225841, "grad_norm": 0.15432511270046234, "learning_rate": 6.68230747998896e-05, "loss": 0.7503, "mean_token_accuracy": 0.7783770971000195, "num_tokens": 345302362.0, "step": 10819 }, { "entropy": 0.6472237631678581, "epoch": 0.9955089389940254, "grad_norm": 0.1531330943107605, "learning_rate": 6.682000797374796e-05, "loss": 0.6438, "mean_token_accuracy": 0.8036659955978394, "num_tokens": 345334238.0, "step": 10820 }, { "entropy": 0.7867288943380117, "epoch": 0.9956009453654665, "grad_norm": 0.17016279697418213, "learning_rate": 6.681694114760635e-05, "loss": 0.7866, "mean_token_accuracy": 0.7710942961275578, "num_tokens": 345366258.0, "step": 10821 }, { "entropy": 0.7326446920633316, "epoch": 0.9956929517369077, "grad_norm": 0.15269401669502258, "learning_rate": 6.681387432146471e-05, "loss": 0.7269, "mean_token_accuracy": 0.7834556810557842, "num_tokens": 345398404.0, "step": 10822 }, { "entropy": 0.7246920168399811, "epoch": 0.995784958108349, "grad_norm": 0.1623348444700241, "learning_rate": 6.68108074953231e-05, "loss": 0.6891, "mean_token_accuracy": 0.7902564890682697, "num_tokens": 345428884.0, "step": 10823 }, { "entropy": 0.7372211925685406, "epoch": 0.9958769644797902, "grad_norm": 0.16010963916778564, "learning_rate": 6.680774066918146e-05, "loss": 0.7156, "mean_token_accuracy": 0.7888367958366871, "num_tokens": 345460916.0, "step": 10824 }, { "entropy": 0.6847714437171817, "epoch": 0.9959689708512315, "grad_norm": 0.14638179540634155, "learning_rate": 6.680467384303984e-05, "loss": 0.6611, "mean_token_accuracy": 0.8020917288959026, "num_tokens": 345493175.0, "step": 10825 }, { "entropy": 0.7340292874723673, "epoch": 0.9960609772226726, "grad_norm": 0.1611267328262329, "learning_rate": 6.680160701689821e-05, "loss": 0.7166, "mean_token_accuracy": 0.7841636501252651, "num_tokens": 345525508.0, "step": 10826 }, { "entropy": 0.7063327599316835, "epoch": 0.9961529835941139, "grad_norm": 0.1553497016429901, "learning_rate": 6.679854019075658e-05, "loss": 0.6722, "mean_token_accuracy": 0.7971266470849514, "num_tokens": 345557212.0, "step": 10827 }, { "entropy": 0.5671592466533184, "epoch": 0.9962449899655551, "grad_norm": 0.14719940721988678, "learning_rate": 6.679547336461496e-05, "loss": 0.5309, "mean_token_accuracy": 0.8348774202167988, "num_tokens": 345589095.0, "step": 10828 }, { "entropy": 0.6739183831959963, "epoch": 0.9963369963369964, "grad_norm": 0.1585342288017273, "learning_rate": 6.679240653847334e-05, "loss": 0.6964, "mean_token_accuracy": 0.793883703649044, "num_tokens": 345621538.0, "step": 10829 }, { "entropy": 0.7472993321716785, "epoch": 0.9964290027084376, "grad_norm": 0.15805289149284363, "learning_rate": 6.678933971233171e-05, "loss": 0.7516, "mean_token_accuracy": 0.7810756228864193, "num_tokens": 345653324.0, "step": 10830 }, { "entropy": 0.7354216519743204, "epoch": 0.9965210090798787, "grad_norm": 0.15132851898670197, "learning_rate": 6.678627288619008e-05, "loss": 0.7332, "mean_token_accuracy": 0.7836678400635719, "num_tokens": 345685800.0, "step": 10831 }, { "entropy": 0.7084527146071196, "epoch": 0.99661301545132, "grad_norm": 0.14873826503753662, "learning_rate": 6.678320606004846e-05, "loss": 0.7066, "mean_token_accuracy": 0.7900439985096455, "num_tokens": 345717989.0, "step": 10832 }, { "entropy": 0.6555616389960051, "epoch": 0.9967050218227612, "grad_norm": 0.150567427277565, "learning_rate": 6.678013923390684e-05, "loss": 0.6597, "mean_token_accuracy": 0.8023892752826214, "num_tokens": 345750675.0, "step": 10833 }, { "entropy": 0.7393480315804482, "epoch": 0.9967970281942025, "grad_norm": 0.15898364782333374, "learning_rate": 6.677707240776521e-05, "loss": 0.7391, "mean_token_accuracy": 0.7841736897826195, "num_tokens": 345782037.0, "step": 10834 }, { "entropy": 0.6871941313147545, "epoch": 0.9968890345656437, "grad_norm": 0.15557844936847687, "learning_rate": 6.677400558162358e-05, "loss": 0.667, "mean_token_accuracy": 0.8017421141266823, "num_tokens": 345814048.0, "step": 10835 }, { "entropy": 0.5712172649800777, "epoch": 0.9969810409370848, "grad_norm": 0.15374541282653809, "learning_rate": 6.677093875548196e-05, "loss": 0.5558, "mean_token_accuracy": 0.8307640366256237, "num_tokens": 345846267.0, "step": 10836 }, { "entropy": 0.7518662754446268, "epoch": 0.9970730473085261, "grad_norm": 0.15640655159950256, "learning_rate": 6.676787192934033e-05, "loss": 0.7421, "mean_token_accuracy": 0.7804466374218464, "num_tokens": 345877996.0, "step": 10837 }, { "entropy": 0.5528900772333145, "epoch": 0.9971650536799673, "grad_norm": 0.14041969180107117, "learning_rate": 6.676480510319871e-05, "loss": 0.5214, "mean_token_accuracy": 0.839076291769743, "num_tokens": 345909585.0, "step": 10838 }, { "entropy": 0.7652533873915672, "epoch": 0.9972570600514086, "grad_norm": 0.1574499011039734, "learning_rate": 6.676173827705708e-05, "loss": 0.759, "mean_token_accuracy": 0.7736484445631504, "num_tokens": 345940890.0, "step": 10839 }, { "entropy": 0.7549010366201401, "epoch": 0.9973490664228498, "grad_norm": 0.15799598395824432, "learning_rate": 6.675867145091546e-05, "loss": 0.7562, "mean_token_accuracy": 0.7742687463760376, "num_tokens": 345972440.0, "step": 10840 }, { "entropy": 0.6636172076687217, "epoch": 0.997441072794291, "grad_norm": 0.1587314009666443, "learning_rate": 6.675560462477383e-05, "loss": 0.6378, "mean_token_accuracy": 0.8088156096637249, "num_tokens": 346004548.0, "step": 10841 }, { "entropy": 0.7224581986665726, "epoch": 0.9975330791657322, "grad_norm": 0.16612033545970917, "learning_rate": 6.67525377986322e-05, "loss": 0.7329, "mean_token_accuracy": 0.7866311147809029, "num_tokens": 346036676.0, "step": 10842 }, { "entropy": 0.8078804817050695, "epoch": 0.9976250855371734, "grad_norm": 0.1617724746465683, "learning_rate": 6.674947097249057e-05, "loss": 0.821, "mean_token_accuracy": 0.7615036852657795, "num_tokens": 346067749.0, "step": 10843 }, { "entropy": 0.7221355978399515, "epoch": 0.9977170919086147, "grad_norm": 0.1590796262025833, "learning_rate": 6.674640414634896e-05, "loss": 0.7142, "mean_token_accuracy": 0.7887849994003773, "num_tokens": 346099804.0, "step": 10844 }, { "entropy": 0.7533706314861774, "epoch": 0.9978090982800559, "grad_norm": 0.14854960143566132, "learning_rate": 6.674333732020732e-05, "loss": 0.7346, "mean_token_accuracy": 0.7839143127202988, "num_tokens": 346132217.0, "step": 10845 }, { "entropy": 0.6553160981275141, "epoch": 0.9979011046514971, "grad_norm": 0.1495293825864792, "learning_rate": 6.674027049406569e-05, "loss": 0.656, "mean_token_accuracy": 0.8066457323729992, "num_tokens": 346163954.0, "step": 10846 }, { "entropy": 0.69985631108284, "epoch": 0.9979931110229383, "grad_norm": 0.16674433648586273, "learning_rate": 6.673720366792406e-05, "loss": 0.6905, "mean_token_accuracy": 0.799196682870388, "num_tokens": 346196049.0, "step": 10847 }, { "entropy": 0.7850935608148575, "epoch": 0.9980851173943796, "grad_norm": 0.1593358963727951, "learning_rate": 6.673413684178244e-05, "loss": 0.7757, "mean_token_accuracy": 0.773831445723772, "num_tokens": 346228017.0, "step": 10848 }, { "entropy": 0.6615530867129564, "epoch": 0.9981771237658208, "grad_norm": 0.14902935922145844, "learning_rate": 6.673107001564082e-05, "loss": 0.6512, "mean_token_accuracy": 0.8073189482092857, "num_tokens": 346259724.0, "step": 10849 }, { "entropy": 0.5788842597976327, "epoch": 0.998269130137262, "grad_norm": 0.146217942237854, "learning_rate": 6.672800318949919e-05, "loss": 0.5559, "mean_token_accuracy": 0.8317787833511829, "num_tokens": 346292081.0, "step": 10850 }, { "entropy": 0.7186735086143017, "epoch": 0.9983611365087032, "grad_norm": 0.158821240067482, "learning_rate": 6.672493636335756e-05, "loss": 0.7038, "mean_token_accuracy": 0.7934148982167244, "num_tokens": 346323841.0, "step": 10851 }, { "entropy": 0.6809679251164198, "epoch": 0.9984531428801444, "grad_norm": 0.1526089757680893, "learning_rate": 6.672186953721594e-05, "loss": 0.6837, "mean_token_accuracy": 0.7969912327826023, "num_tokens": 346355518.0, "step": 10852 }, { "entropy": 0.6653263624757528, "epoch": 0.9985451492515857, "grad_norm": 0.14160585403442383, "learning_rate": 6.671880271107431e-05, "loss": 0.6549, "mean_token_accuracy": 0.8040918707847595, "num_tokens": 346387794.0, "step": 10853 }, { "entropy": 0.7460291385650635, "epoch": 0.9986371556230269, "grad_norm": 0.15650811791419983, "learning_rate": 6.671573588493269e-05, "loss": 0.7252, "mean_token_accuracy": 0.7846652790904045, "num_tokens": 346419886.0, "step": 10854 }, { "entropy": 0.7169933561235666, "epoch": 0.9987291619944682, "grad_norm": 0.160558819770813, "learning_rate": 6.671266905879106e-05, "loss": 0.6987, "mean_token_accuracy": 0.7922168411314487, "num_tokens": 346451385.0, "step": 10855 }, { "entropy": 0.7304557710886002, "epoch": 0.9988211683659093, "grad_norm": 0.16046153008937836, "learning_rate": 6.670960223264944e-05, "loss": 0.7253, "mean_token_accuracy": 0.7871816568076611, "num_tokens": 346481725.0, "step": 10856 }, { "entropy": 0.742641270160675, "epoch": 0.9989131747373505, "grad_norm": 0.15400442481040955, "learning_rate": 6.67065354065078e-05, "loss": 0.729, "mean_token_accuracy": 0.780948419123888, "num_tokens": 346513390.0, "step": 10857 }, { "entropy": 0.7093084985390306, "epoch": 0.9990051811087918, "grad_norm": 0.15645098686218262, "learning_rate": 6.670346858036617e-05, "loss": 0.6976, "mean_token_accuracy": 0.7937665283679962, "num_tokens": 346545048.0, "step": 10858 }, { "entropy": 0.7258321680128574, "epoch": 0.999097187480233, "grad_norm": 0.1696975976228714, "learning_rate": 6.670040175422456e-05, "loss": 0.7287, "mean_token_accuracy": 0.7844110876321793, "num_tokens": 346576290.0, "step": 10859 }, { "entropy": 0.7598477322608232, "epoch": 0.9991891938516743, "grad_norm": 0.17301052808761597, "learning_rate": 6.669733492808294e-05, "loss": 0.7596, "mean_token_accuracy": 0.7780938781797886, "num_tokens": 346608522.0, "step": 10860 }, { "entropy": 0.6982610691338778, "epoch": 0.9992812002231154, "grad_norm": 0.15256164968013763, "learning_rate": 6.66942681019413e-05, "loss": 0.6761, "mean_token_accuracy": 0.7958274148404598, "num_tokens": 346640195.0, "step": 10861 }, { "entropy": 0.6985594127327204, "epoch": 0.9993732065945566, "grad_norm": 0.15505656599998474, "learning_rate": 6.669120127579967e-05, "loss": 0.6809, "mean_token_accuracy": 0.7996110133826733, "num_tokens": 346672638.0, "step": 10862 }, { "entropy": 0.7910066060721874, "epoch": 0.9994652129659979, "grad_norm": 0.1599981039762497, "learning_rate": 6.668813444965805e-05, "loss": 0.7626, "mean_token_accuracy": 0.7733800001442432, "num_tokens": 346704739.0, "step": 10863 }, { "entropy": 0.700426023453474, "epoch": 0.9995572193374391, "grad_norm": 0.1500086933374405, "learning_rate": 6.668506762351642e-05, "loss": 0.6784, "mean_token_accuracy": 0.7938801124691963, "num_tokens": 346736204.0, "step": 10864 }, { "entropy": 0.7300129123032093, "epoch": 0.9996492257088804, "grad_norm": 0.15329793095588684, "learning_rate": 6.66820007973748e-05, "loss": 0.7098, "mean_token_accuracy": 0.7903252132236958, "num_tokens": 346767693.0, "step": 10865 }, { "entropy": 0.777059517800808, "epoch": 0.9997412320803215, "grad_norm": 0.15498676896095276, "learning_rate": 6.667893397123317e-05, "loss": 0.7614, "mean_token_accuracy": 0.7808580324053764, "num_tokens": 346799524.0, "step": 10866 }, { "entropy": 0.7458492089062929, "epoch": 0.9998332384517628, "grad_norm": 0.1522398740053177, "learning_rate": 6.667586714509155e-05, "loss": 0.7442, "mean_token_accuracy": 0.779858510941267, "num_tokens": 346831308.0, "step": 10867 }, { "entropy": 0.7047930676490068, "epoch": 0.999925244823204, "grad_norm": 0.15304671227931976, "learning_rate": 6.667280031894992e-05, "loss": 0.6983, "mean_token_accuracy": 0.7935652211308479, "num_tokens": 346863175.0, "step": 10868 }, { "entropy": 0.698239232485111, "epoch": 1.0, "grad_norm": 0.1780262291431427, "learning_rate": 6.666973349280829e-05, "loss": 0.6984, "mean_token_accuracy": 0.7843229082914499, "num_tokens": 346887762.0, "step": 10869 }, { "entropy": 0.7446477059274912, "epoch": 1.0000920063714411, "grad_norm": 0.15724828839302063, "learning_rate": 6.666666666666667e-05, "loss": 0.659, "mean_token_accuracy": 0.7963673584163189, "num_tokens": 346919023.0, "step": 10870 }, { "entropy": 0.7004071082919836, "epoch": 1.0001840127428825, "grad_norm": 0.14970508217811584, "learning_rate": 6.666359984052505e-05, "loss": 0.626, "mean_token_accuracy": 0.8065500594675541, "num_tokens": 346950643.0, "step": 10871 }, { "entropy": 0.6081130795646459, "epoch": 1.0002760191143236, "grad_norm": 0.1362941712141037, "learning_rate": 6.666053301438342e-05, "loss": 0.5361, "mean_token_accuracy": 0.8381778001785278, "num_tokens": 346982590.0, "step": 10872 }, { "entropy": 0.6558470688760281, "epoch": 1.000368025485765, "grad_norm": 0.14820900559425354, "learning_rate": 6.665746618824179e-05, "loss": 0.6029, "mean_token_accuracy": 0.8164119645953178, "num_tokens": 347014855.0, "step": 10873 }, { "entropy": 0.6195752928033471, "epoch": 1.0004600318572061, "grad_norm": 0.1447901874780655, "learning_rate": 6.665439936210015e-05, "loss": 0.5941, "mean_token_accuracy": 0.8206167258322239, "num_tokens": 347046900.0, "step": 10874 }, { "entropy": 0.6441139224916697, "epoch": 1.0005520382286472, "grad_norm": 0.15413637459278107, "learning_rate": 6.665133253595855e-05, "loss": 0.6265, "mean_token_accuracy": 0.8087260015308857, "num_tokens": 347078559.0, "step": 10875 }, { "entropy": 0.6043624803423882, "epoch": 1.0006440446000886, "grad_norm": 0.1498301923274994, "learning_rate": 6.664826570981692e-05, "loss": 0.5655, "mean_token_accuracy": 0.8259975053369999, "num_tokens": 347110399.0, "step": 10876 }, { "entropy": 0.6130339885130525, "epoch": 1.0007360509715297, "grad_norm": 0.15572820603847504, "learning_rate": 6.664519888367529e-05, "loss": 0.5898, "mean_token_accuracy": 0.8225942514836788, "num_tokens": 347141606.0, "step": 10877 }, { "entropy": 0.5133166969753802, "epoch": 1.000828057342971, "grad_norm": 0.15125444531440735, "learning_rate": 6.664213205753365e-05, "loss": 0.5191, "mean_token_accuracy": 0.8405295945703983, "num_tokens": 347174125.0, "step": 10878 }, { "entropy": 0.594632226973772, "epoch": 1.0009200637144122, "grad_norm": 0.1516452431678772, "learning_rate": 6.663906523139203e-05, "loss": 0.5749, "mean_token_accuracy": 0.8192759715020657, "num_tokens": 347206200.0, "step": 10879 }, { "entropy": 0.4803753327578306, "epoch": 1.0010120700858534, "grad_norm": 0.1329870969057083, "learning_rate": 6.663599840525042e-05, "loss": 0.4751, "mean_token_accuracy": 0.8517781309783459, "num_tokens": 347238457.0, "step": 10880 }, { "entropy": 0.5796688850969076, "epoch": 1.0011040764572947, "grad_norm": 0.15478304028511047, "learning_rate": 6.663293157910878e-05, "loss": 0.5547, "mean_token_accuracy": 0.8299643285572529, "num_tokens": 347270534.0, "step": 10881 }, { "entropy": 0.4750945996493101, "epoch": 1.0011960828287358, "grad_norm": 0.15997923910617828, "learning_rate": 6.662986475296715e-05, "loss": 0.4664, "mean_token_accuracy": 0.8528170362114906, "num_tokens": 347302506.0, "step": 10882 }, { "entropy": 0.6370038818567991, "epoch": 1.0012880892001772, "grad_norm": 0.16028724610805511, "learning_rate": 6.662679792682553e-05, "loss": 0.6246, "mean_token_accuracy": 0.8069759272038937, "num_tokens": 347333637.0, "step": 10883 }, { "entropy": 0.6827068906277418, "epoch": 1.0013800955716183, "grad_norm": 0.16374889016151428, "learning_rate": 6.66237311006839e-05, "loss": 0.6759, "mean_token_accuracy": 0.7931073792278767, "num_tokens": 347366277.0, "step": 10884 }, { "entropy": 0.6622396018356085, "epoch": 1.0014721019430595, "grad_norm": 0.16930747032165527, "learning_rate": 6.662066427454228e-05, "loss": 0.6423, "mean_token_accuracy": 0.8058211281895638, "num_tokens": 347398373.0, "step": 10885 }, { "entropy": 0.6117447586730123, "epoch": 1.0015641083145008, "grad_norm": 0.1564471274614334, "learning_rate": 6.661759744840065e-05, "loss": 0.6182, "mean_token_accuracy": 0.8085714802145958, "num_tokens": 347430808.0, "step": 10886 }, { "entropy": 0.6259973328560591, "epoch": 1.001656114685942, "grad_norm": 0.15397760272026062, "learning_rate": 6.661453062225903e-05, "loss": 0.594, "mean_token_accuracy": 0.8136333264410496, "num_tokens": 347462019.0, "step": 10887 }, { "entropy": 0.6274276450276375, "epoch": 1.0017481210573833, "grad_norm": 0.15608319640159607, "learning_rate": 6.66114637961174e-05, "loss": 0.6136, "mean_token_accuracy": 0.8106551915407181, "num_tokens": 347494206.0, "step": 10888 }, { "entropy": 0.6654837047681212, "epoch": 1.0018401274288244, "grad_norm": 0.1577060967683792, "learning_rate": 6.660839696997577e-05, "loss": 0.6583, "mean_token_accuracy": 0.7992147840559483, "num_tokens": 347526569.0, "step": 10889 }, { "entropy": 0.5051075536757708, "epoch": 1.0019321338002656, "grad_norm": 0.14683876931667328, "learning_rate": 6.660533014383415e-05, "loss": 0.4758, "mean_token_accuracy": 0.850743792951107, "num_tokens": 347558911.0, "step": 10890 }, { "entropy": 0.5545512214303017, "epoch": 1.002024140171707, "grad_norm": 0.1533421277999878, "learning_rate": 6.660226331769253e-05, "loss": 0.5224, "mean_token_accuracy": 0.8411615788936615, "num_tokens": 347591465.0, "step": 10891 }, { "entropy": 0.6190305072814226, "epoch": 1.002116146543148, "grad_norm": 0.15913037955760956, "learning_rate": 6.65991964915509e-05, "loss": 0.605, "mean_token_accuracy": 0.8129717595875263, "num_tokens": 347623322.0, "step": 10892 }, { "entropy": 0.7353445859625936, "epoch": 1.0022081529145894, "grad_norm": 0.16494370996952057, "learning_rate": 6.659612966540927e-05, "loss": 0.7207, "mean_token_accuracy": 0.7826841808855534, "num_tokens": 347655137.0, "step": 10893 }, { "entropy": 0.5702814906835556, "epoch": 1.0023001592860306, "grad_norm": 0.1446094661951065, "learning_rate": 6.659306283926765e-05, "loss": 0.5394, "mean_token_accuracy": 0.828872561454773, "num_tokens": 347687077.0, "step": 10894 }, { "entropy": 0.6183013552799821, "epoch": 1.0023921656574717, "grad_norm": 0.15070860087871552, "learning_rate": 6.658999601312602e-05, "loss": 0.599, "mean_token_accuracy": 0.8137944340705872, "num_tokens": 347719439.0, "step": 10895 }, { "entropy": 0.5126731246709824, "epoch": 1.002484172028913, "grad_norm": 0.15130530297756195, "learning_rate": 6.65869291869844e-05, "loss": 0.4797, "mean_token_accuracy": 0.853540800511837, "num_tokens": 347751554.0, "step": 10896 }, { "entropy": 0.5193057125434279, "epoch": 1.0025761784003542, "grad_norm": 0.1568012237548828, "learning_rate": 6.658386236084277e-05, "loss": 0.4941, "mean_token_accuracy": 0.843054324388504, "num_tokens": 347783614.0, "step": 10897 }, { "entropy": 0.6923736315220594, "epoch": 1.0026681847717955, "grad_norm": 0.15880896151065826, "learning_rate": 6.658079553470115e-05, "loss": 0.6719, "mean_token_accuracy": 0.798379585146904, "num_tokens": 347815268.0, "step": 10898 }, { "entropy": 0.5896908743306994, "epoch": 1.0027601911432367, "grad_norm": 0.15078572928905487, "learning_rate": 6.657772870855951e-05, "loss": 0.5704, "mean_token_accuracy": 0.8250398524105549, "num_tokens": 347847687.0, "step": 10899 }, { "entropy": 0.6614209776744246, "epoch": 1.0028521975146778, "grad_norm": 0.15421143174171448, "learning_rate": 6.657466188241788e-05, "loss": 0.6306, "mean_token_accuracy": 0.8069374673068523, "num_tokens": 347878858.0, "step": 10900 }, { "entropy": 0.5209066150709987, "epoch": 1.0029442038861192, "grad_norm": 0.15083561837673187, "learning_rate": 6.657159505627626e-05, "loss": 0.4983, "mean_token_accuracy": 0.8474457375705242, "num_tokens": 347911391.0, "step": 10901 }, { "entropy": 0.5923266038298607, "epoch": 1.0030362102575603, "grad_norm": 0.15395836532115936, "learning_rate": 6.656852823013465e-05, "loss": 0.5739, "mean_token_accuracy": 0.8244790397584438, "num_tokens": 347943336.0, "step": 10902 }, { "entropy": 0.6281817005947232, "epoch": 1.0031282166290016, "grad_norm": 0.14728213846683502, "learning_rate": 6.656546140399301e-05, "loss": 0.6082, "mean_token_accuracy": 0.8163062073290348, "num_tokens": 347975307.0, "step": 10903 }, { "entropy": 0.5962233780883253, "epoch": 1.0032202230004428, "grad_norm": 0.1607588231563568, "learning_rate": 6.656239457785138e-05, "loss": 0.6033, "mean_token_accuracy": 0.8131915666162968, "num_tokens": 348006981.0, "step": 10904 }, { "entropy": 0.692023690789938, "epoch": 1.003312229371884, "grad_norm": 0.16088750958442688, "learning_rate": 6.655932775170975e-05, "loss": 0.692, "mean_token_accuracy": 0.7893695011734962, "num_tokens": 348039449.0, "step": 10905 }, { "entropy": 0.5861635897308588, "epoch": 1.0034042357433253, "grad_norm": 0.1503043919801712, "learning_rate": 6.655626092556814e-05, "loss": 0.5589, "mean_token_accuracy": 0.8313687667250633, "num_tokens": 348071351.0, "step": 10906 }, { "entropy": 0.5883157383650541, "epoch": 1.0034962421147664, "grad_norm": 0.15152022242546082, "learning_rate": 6.655319409942651e-05, "loss": 0.575, "mean_token_accuracy": 0.8221167214214802, "num_tokens": 348103150.0, "step": 10907 }, { "entropy": 0.6713458551093936, "epoch": 1.0035882484862078, "grad_norm": 0.15495944023132324, "learning_rate": 6.655012727328488e-05, "loss": 0.6616, "mean_token_accuracy": 0.79629060998559, "num_tokens": 348135452.0, "step": 10908 }, { "entropy": 0.6781594976782799, "epoch": 1.003680254857649, "grad_norm": 0.16349343955516815, "learning_rate": 6.654706044714325e-05, "loss": 0.6397, "mean_token_accuracy": 0.80039456859231, "num_tokens": 348166667.0, "step": 10909 }, { "entropy": 0.6976355519145727, "epoch": 1.00377226122909, "grad_norm": 0.15499527752399445, "learning_rate": 6.654399362100163e-05, "loss": 0.6805, "mean_token_accuracy": 0.7914190366864204, "num_tokens": 348198390.0, "step": 10910 }, { "entropy": 0.5866344040259719, "epoch": 1.0038642676005314, "grad_norm": 0.1617622822523117, "learning_rate": 6.654092679486001e-05, "loss": 0.5669, "mean_token_accuracy": 0.8248719200491905, "num_tokens": 348229341.0, "step": 10911 }, { "entropy": 0.5959839019924402, "epoch": 1.0039562739719725, "grad_norm": 0.15586143732070923, "learning_rate": 6.653785996871838e-05, "loss": 0.5756, "mean_token_accuracy": 0.8203299529850483, "num_tokens": 348261323.0, "step": 10912 }, { "entropy": 0.6106792259961367, "epoch": 1.0040482803434139, "grad_norm": 0.16252771019935608, "learning_rate": 6.653479314257675e-05, "loss": 0.6014, "mean_token_accuracy": 0.8139155842363834, "num_tokens": 348292923.0, "step": 10913 }, { "entropy": 0.6509055066853762, "epoch": 1.004140286714855, "grad_norm": 0.1542721390724182, "learning_rate": 6.653172631643513e-05, "loss": 0.6325, "mean_token_accuracy": 0.8085167855024338, "num_tokens": 348325484.0, "step": 10914 }, { "entropy": 0.6438561379909515, "epoch": 1.0042322930862961, "grad_norm": 0.15605264902114868, "learning_rate": 6.65286594902935e-05, "loss": 0.6184, "mean_token_accuracy": 0.8126851692795753, "num_tokens": 348357574.0, "step": 10915 }, { "entropy": 0.694303534924984, "epoch": 1.0043242994577375, "grad_norm": 0.1615842580795288, "learning_rate": 6.652559266415188e-05, "loss": 0.6871, "mean_token_accuracy": 0.793173111975193, "num_tokens": 348390114.0, "step": 10916 }, { "entropy": 0.6850280910730362, "epoch": 1.0044163058291786, "grad_norm": 0.1665077954530716, "learning_rate": 6.652252583801024e-05, "loss": 0.6687, "mean_token_accuracy": 0.7972176931798458, "num_tokens": 348422166.0, "step": 10917 }, { "entropy": 0.677992528770119, "epoch": 1.00450831220062, "grad_norm": 0.17399096488952637, "learning_rate": 6.651945901186863e-05, "loss": 0.6568, "mean_token_accuracy": 0.803054366260767, "num_tokens": 348453129.0, "step": 10918 }, { "entropy": 0.5873249433934689, "epoch": 1.0046003185720611, "grad_norm": 0.1605038046836853, "learning_rate": 6.6516392185727e-05, "loss": 0.5524, "mean_token_accuracy": 0.8361441493034363, "num_tokens": 348484638.0, "step": 10919 }, { "entropy": 0.5736432652920485, "epoch": 1.0046923249435022, "grad_norm": 0.16228340566158295, "learning_rate": 6.651332535958536e-05, "loss": 0.5615, "mean_token_accuracy": 0.8298228569328785, "num_tokens": 348516680.0, "step": 10920 }, { "entropy": 0.6720968224108219, "epoch": 1.0047843313149436, "grad_norm": 0.16339623928070068, "learning_rate": 6.651025853344374e-05, "loss": 0.6649, "mean_token_accuracy": 0.7987001724541187, "num_tokens": 348548613.0, "step": 10921 }, { "entropy": 0.6046053692698479, "epoch": 1.0048763376863847, "grad_norm": 0.15105615556240082, "learning_rate": 6.650719170730212e-05, "loss": 0.5797, "mean_token_accuracy": 0.8208046741783619, "num_tokens": 348580248.0, "step": 10922 }, { "entropy": 0.6224609753116965, "epoch": 1.004968344057826, "grad_norm": 0.15655265748500824, "learning_rate": 6.650412488116049e-05, "loss": 0.5969, "mean_token_accuracy": 0.8175101950764656, "num_tokens": 348611676.0, "step": 10923 }, { "entropy": 0.7369170933961868, "epoch": 1.0050603504292672, "grad_norm": 0.16962487995624542, "learning_rate": 6.650105805501886e-05, "loss": 0.7153, "mean_token_accuracy": 0.7849998101592064, "num_tokens": 348643748.0, "step": 10924 }, { "entropy": 0.6571086160838604, "epoch": 1.0051523568007084, "grad_norm": 0.16149339079856873, "learning_rate": 6.649799122887724e-05, "loss": 0.6357, "mean_token_accuracy": 0.805961936712265, "num_tokens": 348675135.0, "step": 10925 }, { "entropy": 0.5634472728706896, "epoch": 1.0052443631721497, "grad_norm": 0.15198832750320435, "learning_rate": 6.649492440273561e-05, "loss": 0.5348, "mean_token_accuracy": 0.831954836845398, "num_tokens": 348706089.0, "step": 10926 }, { "entropy": 0.6117124482989311, "epoch": 1.0053363695435908, "grad_norm": 0.14948128163814545, "learning_rate": 6.649185757659399e-05, "loss": 0.6008, "mean_token_accuracy": 0.813456580042839, "num_tokens": 348738573.0, "step": 10927 }, { "entropy": 0.7032616883516312, "epoch": 1.0054283759150322, "grad_norm": 0.16513986885547638, "learning_rate": 6.648879075045236e-05, "loss": 0.695, "mean_token_accuracy": 0.7891263775527477, "num_tokens": 348769841.0, "step": 10928 }, { "entropy": 0.6866722702980042, "epoch": 1.0055203822864733, "grad_norm": 0.16456320881843567, "learning_rate": 6.648572392431074e-05, "loss": 0.6934, "mean_token_accuracy": 0.7922024503350258, "num_tokens": 348802480.0, "step": 10929 }, { "entropy": 0.6138346623629332, "epoch": 1.0056123886579145, "grad_norm": 0.1599079817533493, "learning_rate": 6.648265709816911e-05, "loss": 0.5939, "mean_token_accuracy": 0.8168669529259205, "num_tokens": 348834569.0, "step": 10930 }, { "entropy": 0.6708566974848509, "epoch": 1.0057043950293558, "grad_norm": 0.16316886246204376, "learning_rate": 6.647959027202748e-05, "loss": 0.6351, "mean_token_accuracy": 0.807753648608923, "num_tokens": 348866471.0, "step": 10931 }, { "entropy": 0.6261600940488279, "epoch": 1.005796401400797, "grad_norm": 0.16501733660697937, "learning_rate": 6.647652344588586e-05, "loss": 0.6299, "mean_token_accuracy": 0.8082340285181999, "num_tokens": 348898985.0, "step": 10932 }, { "entropy": 0.6217933064326644, "epoch": 1.0058884077722383, "grad_norm": 0.1578802913427353, "learning_rate": 6.647345661974424e-05, "loss": 0.6093, "mean_token_accuracy": 0.8130737766623497, "num_tokens": 348931141.0, "step": 10933 }, { "entropy": 0.694828761741519, "epoch": 1.0059804141436794, "grad_norm": 0.16271106898784637, "learning_rate": 6.64703897936026e-05, "loss": 0.6619, "mean_token_accuracy": 0.7969559989869595, "num_tokens": 348962766.0, "step": 10934 }, { "entropy": 0.5367849660106003, "epoch": 1.0060724205151206, "grad_norm": 0.15316835045814514, "learning_rate": 6.646732296746097e-05, "loss": 0.5211, "mean_token_accuracy": 0.8399878926575184, "num_tokens": 348995029.0, "step": 10935 }, { "entropy": 0.7776718828827143, "epoch": 1.006164426886562, "grad_norm": 0.16826890408992767, "learning_rate": 6.646425614131934e-05, "loss": 0.7814, "mean_token_accuracy": 0.7707139998674393, "num_tokens": 349026844.0, "step": 10936 }, { "entropy": 0.5574790416285396, "epoch": 1.006256433258003, "grad_norm": 0.14805026352405548, "learning_rate": 6.646118931517772e-05, "loss": 0.5343, "mean_token_accuracy": 0.8367219753563404, "num_tokens": 349059172.0, "step": 10937 }, { "entropy": 0.5391229232773185, "epoch": 1.0063484396294444, "grad_norm": 0.14946506917476654, "learning_rate": 6.64581224890361e-05, "loss": 0.5059, "mean_token_accuracy": 0.8429195284843445, "num_tokens": 349090077.0, "step": 10938 }, { "entropy": 0.6838505603373051, "epoch": 1.0064404460008856, "grad_norm": 0.1615060269832611, "learning_rate": 6.645505566289447e-05, "loss": 0.6675, "mean_token_accuracy": 0.7931743487715721, "num_tokens": 349121816.0, "step": 10939 }, { "entropy": 0.6093126703053713, "epoch": 1.0065324523723267, "grad_norm": 0.15486103296279907, "learning_rate": 6.645198883675284e-05, "loss": 0.5863, "mean_token_accuracy": 0.8203622475266457, "num_tokens": 349153562.0, "step": 10940 }, { "entropy": 0.6195192225277424, "epoch": 1.006624458743768, "grad_norm": 0.15664668381214142, "learning_rate": 6.644892201061122e-05, "loss": 0.6182, "mean_token_accuracy": 0.8057975433766842, "num_tokens": 349185009.0, "step": 10941 }, { "entropy": 0.5902737872675061, "epoch": 1.0067164651152092, "grad_norm": 0.15882104635238647, "learning_rate": 6.644585518446959e-05, "loss": 0.5701, "mean_token_accuracy": 0.82512466609478, "num_tokens": 349216477.0, "step": 10942 }, { "entropy": 0.5902024358510971, "epoch": 1.0068084714866505, "grad_norm": 0.15452225506305695, "learning_rate": 6.644278835832797e-05, "loss": 0.5698, "mean_token_accuracy": 0.820309292525053, "num_tokens": 349248388.0, "step": 10943 }, { "entropy": 0.645845515653491, "epoch": 1.0069004778580917, "grad_norm": 0.15055815875530243, "learning_rate": 6.643972153218634e-05, "loss": 0.6184, "mean_token_accuracy": 0.8088449202477932, "num_tokens": 349280657.0, "step": 10944 }, { "entropy": 0.6308116912841797, "epoch": 1.0069924842295328, "grad_norm": 0.14734742045402527, "learning_rate": 6.643665470604472e-05, "loss": 0.599, "mean_token_accuracy": 0.8171343021094799, "num_tokens": 349312645.0, "step": 10945 }, { "entropy": 0.6608874909579754, "epoch": 1.0070844906009742, "grad_norm": 0.16142140328884125, "learning_rate": 6.643358787990309e-05, "loss": 0.6502, "mean_token_accuracy": 0.8034578897058964, "num_tokens": 349344435.0, "step": 10946 }, { "entropy": 0.6839134944602847, "epoch": 1.0071764969724153, "grad_norm": 0.15933284163475037, "learning_rate": 6.643052105376146e-05, "loss": 0.6572, "mean_token_accuracy": 0.7983086295425892, "num_tokens": 349376854.0, "step": 10947 }, { "entropy": 0.5546489339321852, "epoch": 1.0072685033438566, "grad_norm": 0.1474950760602951, "learning_rate": 6.642745422761984e-05, "loss": 0.5513, "mean_token_accuracy": 0.8296702243387699, "num_tokens": 349408945.0, "step": 10948 }, { "entropy": 0.6891835574060678, "epoch": 1.0073605097152978, "grad_norm": 0.16101473569869995, "learning_rate": 6.642438740147822e-05, "loss": 0.6848, "mean_token_accuracy": 0.788262203335762, "num_tokens": 349441292.0, "step": 10949 }, { "entropy": 0.5566583937034011, "epoch": 1.007452516086739, "grad_norm": 0.1552775353193283, "learning_rate": 6.642132057533659e-05, "loss": 0.5366, "mean_token_accuracy": 0.8339374624192715, "num_tokens": 349473859.0, "step": 10950 }, { "entropy": 0.6355675682425499, "epoch": 1.0075445224581803, "grad_norm": 0.1586921215057373, "learning_rate": 6.641825374919496e-05, "loss": 0.6116, "mean_token_accuracy": 0.8097077757120132, "num_tokens": 349505523.0, "step": 10951 }, { "entropy": 0.5602410202845931, "epoch": 1.0076365288296214, "grad_norm": 0.15822173655033112, "learning_rate": 6.641518692305334e-05, "loss": 0.5465, "mean_token_accuracy": 0.8315250277519226, "num_tokens": 349537651.0, "step": 10952 }, { "entropy": 0.6235916065052152, "epoch": 1.0077285352010628, "grad_norm": 0.14932972192764282, "learning_rate": 6.641212009691172e-05, "loss": 0.5953, "mean_token_accuracy": 0.8160252645611763, "num_tokens": 349569504.0, "step": 10953 }, { "entropy": 0.6084201773628592, "epoch": 1.007820541572504, "grad_norm": 0.1614835262298584, "learning_rate": 6.640905327077009e-05, "loss": 0.5783, "mean_token_accuracy": 0.8183329068124294, "num_tokens": 349600560.0, "step": 10954 }, { "entropy": 0.5823383899405599, "epoch": 1.007912547943945, "grad_norm": 0.15394338965415955, "learning_rate": 6.640598644462845e-05, "loss": 0.5813, "mean_token_accuracy": 0.8194487243890762, "num_tokens": 349633013.0, "step": 10955 }, { "entropy": 0.6999311614781618, "epoch": 1.0080045543153864, "grad_norm": 0.1714368313550949, "learning_rate": 6.640291961848684e-05, "loss": 0.7028, "mean_token_accuracy": 0.7857029214501381, "num_tokens": 349664999.0, "step": 10956 }, { "entropy": 0.6741777062416077, "epoch": 1.0080965606868275, "grad_norm": 0.16806791722774506, "learning_rate": 6.63998527923452e-05, "loss": 0.6471, "mean_token_accuracy": 0.8027965165674686, "num_tokens": 349697099.0, "step": 10957 }, { "entropy": 0.6516195759177208, "epoch": 1.0081885670582689, "grad_norm": 0.15710417926311493, "learning_rate": 6.639678596620358e-05, "loss": 0.6365, "mean_token_accuracy": 0.8075391985476017, "num_tokens": 349729114.0, "step": 10958 }, { "entropy": 0.531251510605216, "epoch": 1.00828057342971, "grad_norm": 0.15802329778671265, "learning_rate": 6.639371914006195e-05, "loss": 0.5136, "mean_token_accuracy": 0.8457512930035591, "num_tokens": 349760772.0, "step": 10959 }, { "entropy": 0.5609109727665782, "epoch": 1.0083725798011511, "grad_norm": 0.15072046220302582, "learning_rate": 6.639065231392033e-05, "loss": 0.5403, "mean_token_accuracy": 0.8319435901939869, "num_tokens": 349793135.0, "step": 10960 }, { "entropy": 0.5749802771024406, "epoch": 1.0084645861725925, "grad_norm": 0.15694987773895264, "learning_rate": 6.63875854877787e-05, "loss": 0.5394, "mean_token_accuracy": 0.8342496640980244, "num_tokens": 349824686.0, "step": 10961 }, { "entropy": 0.5721326526254416, "epoch": 1.0085565925440336, "grad_norm": 0.15424829721450806, "learning_rate": 6.638451866163707e-05, "loss": 0.5503, "mean_token_accuracy": 0.8304428905248642, "num_tokens": 349855901.0, "step": 10962 }, { "entropy": 0.7054499797523022, "epoch": 1.008648598915475, "grad_norm": 0.16125360131263733, "learning_rate": 6.638145183549545e-05, "loss": 0.6925, "mean_token_accuracy": 0.7898795008659363, "num_tokens": 349888121.0, "step": 10963 }, { "entropy": 0.5305404011160135, "epoch": 1.0087406052869161, "grad_norm": 0.14959126710891724, "learning_rate": 6.637838500935383e-05, "loss": 0.5203, "mean_token_accuracy": 0.8383235782384872, "num_tokens": 349919218.0, "step": 10964 }, { "entropy": 0.562034641392529, "epoch": 1.0088326116583572, "grad_norm": 0.1537920981645584, "learning_rate": 6.63753181832122e-05, "loss": 0.541, "mean_token_accuracy": 0.8300891071557999, "num_tokens": 349951335.0, "step": 10965 }, { "entropy": 0.610174274072051, "epoch": 1.0089246180297986, "grad_norm": 0.159748375415802, "learning_rate": 6.637225135707057e-05, "loss": 0.6039, "mean_token_accuracy": 0.8146920464932919, "num_tokens": 349983505.0, "step": 10966 }, { "entropy": 0.6934318616986275, "epoch": 1.0090166244012397, "grad_norm": 0.16524679958820343, "learning_rate": 6.636918453092894e-05, "loss": 0.6862, "mean_token_accuracy": 0.7928786352276802, "num_tokens": 350015068.0, "step": 10967 }, { "entropy": 0.5932855010032654, "epoch": 1.009108630772681, "grad_norm": 0.16383042931556702, "learning_rate": 6.636611770478732e-05, "loss": 0.5807, "mean_token_accuracy": 0.8195142410695553, "num_tokens": 350047588.0, "step": 10968 }, { "entropy": 0.5998427723534405, "epoch": 1.0092006371441222, "grad_norm": 0.15979379415512085, "learning_rate": 6.63630508786457e-05, "loss": 0.584, "mean_token_accuracy": 0.8185329884290695, "num_tokens": 350079461.0, "step": 10969 }, { "entropy": 0.6051503457129002, "epoch": 1.0092926435155634, "grad_norm": 0.14905397593975067, "learning_rate": 6.635998405250407e-05, "loss": 0.5621, "mean_token_accuracy": 0.8277823403477669, "num_tokens": 350111813.0, "step": 10970 }, { "entropy": 0.5949586927890778, "epoch": 1.0093846498870047, "grad_norm": 0.1488446444272995, "learning_rate": 6.635691722636243e-05, "loss": 0.5687, "mean_token_accuracy": 0.8241960927844048, "num_tokens": 350143895.0, "step": 10971 }, { "entropy": 0.5749419275671244, "epoch": 1.0094766562584458, "grad_norm": 0.1522548794746399, "learning_rate": 6.635385040022082e-05, "loss": 0.536, "mean_token_accuracy": 0.8355530314147472, "num_tokens": 350175794.0, "step": 10972 }, { "entropy": 0.5915492009371519, "epoch": 1.0095686626298872, "grad_norm": 0.14872200787067413, "learning_rate": 6.635078357407918e-05, "loss": 0.5713, "mean_token_accuracy": 0.8215517066419125, "num_tokens": 350207935.0, "step": 10973 }, { "entropy": 0.6406087949872017, "epoch": 1.0096606690013283, "grad_norm": 0.15580610930919647, "learning_rate": 6.634771674793757e-05, "loss": 0.6191, "mean_token_accuracy": 0.8094131574034691, "num_tokens": 350240098.0, "step": 10974 }, { "entropy": 0.6285090772435069, "epoch": 1.0097526753727695, "grad_norm": 0.16348868608474731, "learning_rate": 6.634464992179593e-05, "loss": 0.6109, "mean_token_accuracy": 0.8122440874576569, "num_tokens": 350271751.0, "step": 10975 }, { "entropy": 0.5136460815556347, "epoch": 1.0098446817442108, "grad_norm": 0.15793493390083313, "learning_rate": 6.634158309565431e-05, "loss": 0.5075, "mean_token_accuracy": 0.8440858349204063, "num_tokens": 350304167.0, "step": 10976 }, { "entropy": 0.5701566743664443, "epoch": 1.009936688115652, "grad_norm": 0.1520206332206726, "learning_rate": 6.633851626951268e-05, "loss": 0.5587, "mean_token_accuracy": 0.826384648680687, "num_tokens": 350335943.0, "step": 10977 }, { "entropy": 0.609862931072712, "epoch": 1.0100286944870933, "grad_norm": 0.15355715155601501, "learning_rate": 6.633544944337105e-05, "loss": 0.6039, "mean_token_accuracy": 0.8127379417419434, "num_tokens": 350367999.0, "step": 10978 }, { "entropy": 0.62664251960814, "epoch": 1.0101207008585344, "grad_norm": 0.16613921523094177, "learning_rate": 6.633238261722943e-05, "loss": 0.6371, "mean_token_accuracy": 0.8063435256481171, "num_tokens": 350399827.0, "step": 10979 }, { "entropy": 0.5475966851226985, "epoch": 1.0102127072299756, "grad_norm": 0.1591777503490448, "learning_rate": 6.632931579108781e-05, "loss": 0.5401, "mean_token_accuracy": 0.8286989256739616, "num_tokens": 350431104.0, "step": 10980 }, { "entropy": 0.5925411880016327, "epoch": 1.010304713601417, "grad_norm": 0.16003826260566711, "learning_rate": 6.632624896494618e-05, "loss": 0.5589, "mean_token_accuracy": 0.8251691609621048, "num_tokens": 350462814.0, "step": 10981 }, { "entropy": 0.6301700696349144, "epoch": 1.010396719972858, "grad_norm": 0.15587154030799866, "learning_rate": 6.632318213880455e-05, "loss": 0.5886, "mean_token_accuracy": 0.8166570253670216, "num_tokens": 350494381.0, "step": 10982 }, { "entropy": 0.7035482106730342, "epoch": 1.0104887263442994, "grad_norm": 0.15579040348529816, "learning_rate": 6.632011531266293e-05, "loss": 0.6676, "mean_token_accuracy": 0.7928411737084389, "num_tokens": 350526920.0, "step": 10983 }, { "entropy": 0.6481243735179305, "epoch": 1.0105807327157406, "grad_norm": 0.16516435146331787, "learning_rate": 6.63170484865213e-05, "loss": 0.6364, "mean_token_accuracy": 0.8096832558512688, "num_tokens": 350558414.0, "step": 10984 }, { "entropy": 0.6193045303225517, "epoch": 1.0106727390871817, "grad_norm": 0.15473751723766327, "learning_rate": 6.631398166037968e-05, "loss": 0.6162, "mean_token_accuracy": 0.8105091564357281, "num_tokens": 350589818.0, "step": 10985 }, { "entropy": 0.6055394820868969, "epoch": 1.010764745458623, "grad_norm": 0.16377896070480347, "learning_rate": 6.631091483423805e-05, "loss": 0.5909, "mean_token_accuracy": 0.8150523714721203, "num_tokens": 350620985.0, "step": 10986 }, { "entropy": 0.7058002580888569, "epoch": 1.0108567518300642, "grad_norm": 0.16672080755233765, "learning_rate": 6.630784800809643e-05, "loss": 0.7181, "mean_token_accuracy": 0.7820626869797707, "num_tokens": 350652939.0, "step": 10987 }, { "entropy": 0.6873657703399658, "epoch": 1.0109487582015055, "grad_norm": 0.16129228472709656, "learning_rate": 6.63047811819548e-05, "loss": 0.6638, "mean_token_accuracy": 0.7962864749133587, "num_tokens": 350685444.0, "step": 10988 }, { "entropy": 0.5078576104715466, "epoch": 1.0110407645729467, "grad_norm": 0.14289747178554535, "learning_rate": 6.630171435581316e-05, "loss": 0.4963, "mean_token_accuracy": 0.8459775745868683, "num_tokens": 350717967.0, "step": 10989 }, { "entropy": 0.6421841215342283, "epoch": 1.0111327709443878, "grad_norm": 0.1612612009048462, "learning_rate": 6.629864752967155e-05, "loss": 0.6254, "mean_token_accuracy": 0.8093783594667912, "num_tokens": 350749790.0, "step": 10990 }, { "entropy": 0.5625727577134967, "epoch": 1.0112247773158292, "grad_norm": 0.1508132815361023, "learning_rate": 6.629558070352993e-05, "loss": 0.5538, "mean_token_accuracy": 0.8309045024216175, "num_tokens": 350782415.0, "step": 10991 }, { "entropy": 0.6060150675475597, "epoch": 1.0113167836872703, "grad_norm": 0.1535290628671646, "learning_rate": 6.62925138773883e-05, "loss": 0.6005, "mean_token_accuracy": 0.8175417482852936, "num_tokens": 350814096.0, "step": 10992 }, { "entropy": 0.644313232973218, "epoch": 1.0114087900587116, "grad_norm": 0.1566474288702011, "learning_rate": 6.628944705124666e-05, "loss": 0.6384, "mean_token_accuracy": 0.803574126213789, "num_tokens": 350846264.0, "step": 10993 }, { "entropy": 0.58039206918329, "epoch": 1.0115007964301528, "grad_norm": 0.14902934432029724, "learning_rate": 6.628638022510504e-05, "loss": 0.5546, "mean_token_accuracy": 0.827618919312954, "num_tokens": 350878714.0, "step": 10994 }, { "entropy": 0.6707050614058971, "epoch": 1.011592802801594, "grad_norm": 0.17209863662719727, "learning_rate": 6.628331339896343e-05, "loss": 0.662, "mean_token_accuracy": 0.7986576817929745, "num_tokens": 350910076.0, "step": 10995 }, { "entropy": 0.49567429441958666, "epoch": 1.0116848091730353, "grad_norm": 0.15040670335292816, "learning_rate": 6.62802465728218e-05, "loss": 0.4668, "mean_token_accuracy": 0.8537387624382973, "num_tokens": 350942144.0, "step": 10996 }, { "entropy": 0.5120819117873907, "epoch": 1.0117768155444764, "grad_norm": 0.15633948147296906, "learning_rate": 6.627717974668016e-05, "loss": 0.4977, "mean_token_accuracy": 0.841265644878149, "num_tokens": 350974570.0, "step": 10997 }, { "entropy": 0.5664507579058409, "epoch": 1.0118688219159178, "grad_norm": 0.15833806991577148, "learning_rate": 6.627411292053853e-05, "loss": 0.5393, "mean_token_accuracy": 0.83293117582798, "num_tokens": 351006677.0, "step": 10998 }, { "entropy": 0.6160113224759698, "epoch": 1.011960828287359, "grad_norm": 0.15336838364601135, "learning_rate": 6.627104609439691e-05, "loss": 0.6148, "mean_token_accuracy": 0.8110036738216877, "num_tokens": 351039263.0, "step": 10999 }, { "entropy": 0.5967137366533279, "epoch": 1.0120528346588, "grad_norm": 0.15615053474903107, "learning_rate": 6.626797926825529e-05, "loss": 0.5948, "mean_token_accuracy": 0.8153305947780609, "num_tokens": 351071671.0, "step": 11000 }, { "entropy": 0.666102284565568, "epoch": 1.0121448410302414, "grad_norm": 0.15762457251548767, "learning_rate": 6.626491244211366e-05, "loss": 0.6487, "mean_token_accuracy": 0.8029063232243061, "num_tokens": 351103622.0, "step": 11001 }, { "entropy": 0.6005322355777025, "epoch": 1.0122368474016825, "grad_norm": 0.15800757706165314, "learning_rate": 6.626184561597203e-05, "loss": 0.5613, "mean_token_accuracy": 0.8302970752120018, "num_tokens": 351135486.0, "step": 11002 }, { "entropy": 0.6356082502752542, "epoch": 1.0123288537731239, "grad_norm": 0.1611367017030716, "learning_rate": 6.625877878983041e-05, "loss": 0.6451, "mean_token_accuracy": 0.8019732125103474, "num_tokens": 351167625.0, "step": 11003 }, { "entropy": 0.6717119161039591, "epoch": 1.012420860144565, "grad_norm": 0.1592823714017868, "learning_rate": 6.625571196368878e-05, "loss": 0.67, "mean_token_accuracy": 0.795979417860508, "num_tokens": 351199377.0, "step": 11004 }, { "entropy": 0.7132770977914333, "epoch": 1.0125128665160061, "grad_norm": 0.16297759115695953, "learning_rate": 6.625264513754716e-05, "loss": 0.7032, "mean_token_accuracy": 0.7886040546000004, "num_tokens": 351230978.0, "step": 11005 }, { "entropy": 0.6637182980775833, "epoch": 1.0126048728874475, "grad_norm": 0.16253751516342163, "learning_rate": 6.624957831140553e-05, "loss": 0.654, "mean_token_accuracy": 0.8014400750398636, "num_tokens": 351263702.0, "step": 11006 }, { "entropy": 0.6757617415860295, "epoch": 1.0126968792588886, "grad_norm": 0.1623353660106659, "learning_rate": 6.624651148526391e-05, "loss": 0.6515, "mean_token_accuracy": 0.7981824949383736, "num_tokens": 351295243.0, "step": 11007 }, { "entropy": 0.6406693495810032, "epoch": 1.01278888563033, "grad_norm": 0.15957331657409668, "learning_rate": 6.624344465912228e-05, "loss": 0.637, "mean_token_accuracy": 0.8013305403292179, "num_tokens": 351326849.0, "step": 11008 }, { "entropy": 0.5494940634816885, "epoch": 1.0128808920017711, "grad_norm": 0.16706079244613647, "learning_rate": 6.624037783298064e-05, "loss": 0.5326, "mean_token_accuracy": 0.8353089094161987, "num_tokens": 351358129.0, "step": 11009 }, { "entropy": 0.5769694522023201, "epoch": 1.0129728983732122, "grad_norm": 0.15138742327690125, "learning_rate": 6.623731100683903e-05, "loss": 0.5607, "mean_token_accuracy": 0.8291705846786499, "num_tokens": 351390505.0, "step": 11010 }, { "entropy": 0.6034260299056768, "epoch": 1.0130649047446536, "grad_norm": 0.15104998648166656, "learning_rate": 6.623424418069741e-05, "loss": 0.5797, "mean_token_accuracy": 0.8206226788461208, "num_tokens": 351422595.0, "step": 11011 }, { "entropy": 0.6304898988455534, "epoch": 1.0131569111160947, "grad_norm": 0.15169267356395721, "learning_rate": 6.623117735455577e-05, "loss": 0.6111, "mean_token_accuracy": 0.8102647289633751, "num_tokens": 351454072.0, "step": 11012 }, { "entropy": 0.5484110731631517, "epoch": 1.013248917487536, "grad_norm": 0.15564821660518646, "learning_rate": 6.622811052841414e-05, "loss": 0.5263, "mean_token_accuracy": 0.835785299539566, "num_tokens": 351484801.0, "step": 11013 }, { "entropy": 0.6683779153972864, "epoch": 1.0133409238589772, "grad_norm": 0.15732859075069427, "learning_rate": 6.622504370227252e-05, "loss": 0.6509, "mean_token_accuracy": 0.8044260814785957, "num_tokens": 351517014.0, "step": 11014 }, { "entropy": 0.641270337626338, "epoch": 1.0134329302304184, "grad_norm": 0.15394315123558044, "learning_rate": 6.622197687613089e-05, "loss": 0.6334, "mean_token_accuracy": 0.8023986294865608, "num_tokens": 351549521.0, "step": 11015 }, { "entropy": 0.6790159214287996, "epoch": 1.0135249366018597, "grad_norm": 0.16354414820671082, "learning_rate": 6.621891004998927e-05, "loss": 0.6653, "mean_token_accuracy": 0.7977433577179909, "num_tokens": 351581321.0, "step": 11016 }, { "entropy": 0.6376621685922146, "epoch": 1.0136169429733008, "grad_norm": 0.1522216945886612, "learning_rate": 6.621584322384764e-05, "loss": 0.6021, "mean_token_accuracy": 0.8155758269131184, "num_tokens": 351612829.0, "step": 11017 }, { "entropy": 0.5702707208693027, "epoch": 1.0137089493447422, "grad_norm": 0.15142840147018433, "learning_rate": 6.621277639770602e-05, "loss": 0.5606, "mean_token_accuracy": 0.8264832831919193, "num_tokens": 351644458.0, "step": 11018 }, { "entropy": 0.6537159495055676, "epoch": 1.0138009557161833, "grad_norm": 0.1609329879283905, "learning_rate": 6.620970957156439e-05, "loss": 0.6308, "mean_token_accuracy": 0.8043663874268532, "num_tokens": 351676551.0, "step": 11019 }, { "entropy": 0.6457998380064964, "epoch": 1.0138929620876245, "grad_norm": 0.15384197235107422, "learning_rate": 6.620664274542276e-05, "loss": 0.6386, "mean_token_accuracy": 0.8026502579450607, "num_tokens": 351707895.0, "step": 11020 }, { "entropy": 0.523009404540062, "epoch": 1.0139849684590658, "grad_norm": 0.14022475481033325, "learning_rate": 6.620357591928114e-05, "loss": 0.493, "mean_token_accuracy": 0.8502502925693989, "num_tokens": 351739588.0, "step": 11021 }, { "entropy": 0.6179595161229372, "epoch": 1.014076974830507, "grad_norm": 0.15183477103710175, "learning_rate": 6.620050909313952e-05, "loss": 0.6009, "mean_token_accuracy": 0.8168337419629097, "num_tokens": 351772001.0, "step": 11022 }, { "entropy": 0.6887759380042553, "epoch": 1.0141689812019483, "grad_norm": 0.15569652616977692, "learning_rate": 6.619744226699789e-05, "loss": 0.6744, "mean_token_accuracy": 0.7908788993954659, "num_tokens": 351804445.0, "step": 11023 }, { "entropy": 0.5930067300796509, "epoch": 1.0142609875733894, "grad_norm": 0.14936436712741852, "learning_rate": 6.619437544085626e-05, "loss": 0.5644, "mean_token_accuracy": 0.8288798965513706, "num_tokens": 351836266.0, "step": 11024 }, { "entropy": 0.6786847859621048, "epoch": 1.0143529939448306, "grad_norm": 0.15696190297603607, "learning_rate": 6.619130861471463e-05, "loss": 0.6397, "mean_token_accuracy": 0.8030541352927685, "num_tokens": 351868130.0, "step": 11025 }, { "entropy": 0.5820025503635406, "epoch": 1.014445000316272, "grad_norm": 0.1530900001525879, "learning_rate": 6.618824178857302e-05, "loss": 0.5526, "mean_token_accuracy": 0.8288661725819111, "num_tokens": 351900647.0, "step": 11026 }, { "entropy": 0.6647491734474897, "epoch": 1.014537006687713, "grad_norm": 0.15899589657783508, "learning_rate": 6.618517496243139e-05, "loss": 0.643, "mean_token_accuracy": 0.8025966063141823, "num_tokens": 351932774.0, "step": 11027 }, { "entropy": 0.6610039565712214, "epoch": 1.0146290130591544, "grad_norm": 0.16163918375968933, "learning_rate": 6.618210813628976e-05, "loss": 0.6559, "mean_token_accuracy": 0.8008415885269642, "num_tokens": 351964528.0, "step": 11028 }, { "entropy": 0.6319720186293125, "epoch": 1.0147210194305956, "grad_norm": 0.1667981892824173, "learning_rate": 6.617904131014812e-05, "loss": 0.6249, "mean_token_accuracy": 0.8077455908060074, "num_tokens": 351996427.0, "step": 11029 }, { "entropy": 0.7051077205687761, "epoch": 1.0148130258020367, "grad_norm": 0.1610659807920456, "learning_rate": 6.61759744840065e-05, "loss": 0.6961, "mean_token_accuracy": 0.7895935513079166, "num_tokens": 352027774.0, "step": 11030 }, { "entropy": 0.6064496878534555, "epoch": 1.014905032173478, "grad_norm": 0.15710285305976868, "learning_rate": 6.617290765786489e-05, "loss": 0.6014, "mean_token_accuracy": 0.8130242973566055, "num_tokens": 352059263.0, "step": 11031 }, { "entropy": 0.6607928704470396, "epoch": 1.0149970385449192, "grad_norm": 0.15530021488666534, "learning_rate": 6.616984083172325e-05, "loss": 0.6525, "mean_token_accuracy": 0.8018679060041904, "num_tokens": 352091093.0, "step": 11032 }, { "entropy": 0.6263420656323433, "epoch": 1.0150890449163605, "grad_norm": 0.17862440645694733, "learning_rate": 6.616677400558162e-05, "loss": 0.6186, "mean_token_accuracy": 0.8107434585690498, "num_tokens": 352122184.0, "step": 11033 }, { "entropy": 0.6126333978027105, "epoch": 1.0151810512878017, "grad_norm": 0.15853089094161987, "learning_rate": 6.616370717944e-05, "loss": 0.5992, "mean_token_accuracy": 0.8119876272976398, "num_tokens": 352153216.0, "step": 11034 }, { "entropy": 0.6092394208535552, "epoch": 1.0152730576592428, "grad_norm": 0.15811309218406677, "learning_rate": 6.616064035329837e-05, "loss": 0.5874, "mean_token_accuracy": 0.8164487555623055, "num_tokens": 352184968.0, "step": 11035 }, { "entropy": 0.6375425755977631, "epoch": 1.0153650640306842, "grad_norm": 0.1635967642068863, "learning_rate": 6.615757352715675e-05, "loss": 0.6192, "mean_token_accuracy": 0.810476865619421, "num_tokens": 352217595.0, "step": 11036 }, { "entropy": 0.5916134575381875, "epoch": 1.0154570704021253, "grad_norm": 0.17333415150642395, "learning_rate": 6.615450670101512e-05, "loss": 0.5762, "mean_token_accuracy": 0.8232266828417778, "num_tokens": 352249816.0, "step": 11037 }, { "entropy": 0.6880120318382978, "epoch": 1.0155490767735667, "grad_norm": 0.15956367552280426, "learning_rate": 6.61514398748735e-05, "loss": 0.6615, "mean_token_accuracy": 0.7998226620256901, "num_tokens": 352280868.0, "step": 11038 }, { "entropy": 0.6034432090818882, "epoch": 1.0156410831450078, "grad_norm": 0.1485728919506073, "learning_rate": 6.614837304873187e-05, "loss": 0.5773, "mean_token_accuracy": 0.8206797204911709, "num_tokens": 352313438.0, "step": 11039 }, { "entropy": 0.520239258185029, "epoch": 1.015733089516449, "grad_norm": 0.15643763542175293, "learning_rate": 6.614530622259024e-05, "loss": 0.4958, "mean_token_accuracy": 0.8435681946575642, "num_tokens": 352345533.0, "step": 11040 }, { "entropy": 0.584861671552062, "epoch": 1.0158250958878903, "grad_norm": 0.14934131503105164, "learning_rate": 6.614223939644862e-05, "loss": 0.5503, "mean_token_accuracy": 0.828768890351057, "num_tokens": 352377612.0, "step": 11041 }, { "entropy": 0.6946605909615755, "epoch": 1.0159171022593314, "grad_norm": 0.1678958237171173, "learning_rate": 6.6139172570307e-05, "loss": 0.6912, "mean_token_accuracy": 0.7862155400216579, "num_tokens": 352408858.0, "step": 11042 }, { "entropy": 0.6227648006752133, "epoch": 1.0160091086307728, "grad_norm": 0.16486507654190063, "learning_rate": 6.613610574416537e-05, "loss": 0.5947, "mean_token_accuracy": 0.8178276941180229, "num_tokens": 352440565.0, "step": 11043 }, { "entropy": 0.49876074213534594, "epoch": 1.016101115002214, "grad_norm": 0.15790380537509918, "learning_rate": 6.613303891802374e-05, "loss": 0.4687, "mean_token_accuracy": 0.8522159047424793, "num_tokens": 352472008.0, "step": 11044 }, { "entropy": 0.6395889539271593, "epoch": 1.016193121373655, "grad_norm": 0.1610896736383438, "learning_rate": 6.612997209188212e-05, "loss": 0.6201, "mean_token_accuracy": 0.8103026896715164, "num_tokens": 352503770.0, "step": 11045 }, { "entropy": 0.6597904898226261, "epoch": 1.0162851277450964, "grad_norm": 0.1929241269826889, "learning_rate": 6.612690526574049e-05, "loss": 0.6576, "mean_token_accuracy": 0.7993140108883381, "num_tokens": 352535352.0, "step": 11046 }, { "entropy": 0.5410220241174102, "epoch": 1.0163771341165375, "grad_norm": 0.15348826348781586, "learning_rate": 6.612383843959887e-05, "loss": 0.5305, "mean_token_accuracy": 0.8335313722491264, "num_tokens": 352567581.0, "step": 11047 }, { "entropy": 0.6072694230824709, "epoch": 1.0164691404879789, "grad_norm": 0.15070106089115143, "learning_rate": 6.612077161345724e-05, "loss": 0.5987, "mean_token_accuracy": 0.817675918340683, "num_tokens": 352600221.0, "step": 11048 }, { "entropy": 0.7117509618401527, "epoch": 1.01656114685942, "grad_norm": 0.1611892431974411, "learning_rate": 6.611770478731562e-05, "loss": 0.6934, "mean_token_accuracy": 0.78482910618186, "num_tokens": 352632064.0, "step": 11049 }, { "entropy": 0.6598198786377907, "epoch": 1.0166531532308611, "grad_norm": 0.15813371539115906, "learning_rate": 6.611463796117398e-05, "loss": 0.6489, "mean_token_accuracy": 0.8054358623921871, "num_tokens": 352663853.0, "step": 11050 }, { "entropy": 0.6303966827690601, "epoch": 1.0167451596023025, "grad_norm": 0.1589166671037674, "learning_rate": 6.611157113503235e-05, "loss": 0.6335, "mean_token_accuracy": 0.8059895001351833, "num_tokens": 352696118.0, "step": 11051 }, { "entropy": 0.5621340526267886, "epoch": 1.0168371659737436, "grad_norm": 0.16869229078292847, "learning_rate": 6.610850430889073e-05, "loss": 0.5503, "mean_token_accuracy": 0.8305464386940002, "num_tokens": 352727426.0, "step": 11052 }, { "entropy": 0.7095607733353972, "epoch": 1.016929172345185, "grad_norm": 0.1702626794576645, "learning_rate": 6.610543748274912e-05, "loss": 0.6961, "mean_token_accuracy": 0.7891273498535156, "num_tokens": 352759182.0, "step": 11053 }, { "entropy": 0.6976561062037945, "epoch": 1.0170211787166261, "grad_norm": 0.1655324101448059, "learning_rate": 6.610237065660748e-05, "loss": 0.6938, "mean_token_accuracy": 0.7891455292701721, "num_tokens": 352791901.0, "step": 11054 }, { "entropy": 0.5602178629487753, "epoch": 1.0171131850880673, "grad_norm": 0.15013176202774048, "learning_rate": 6.609930383046585e-05, "loss": 0.5313, "mean_token_accuracy": 0.8342827260494232, "num_tokens": 352823951.0, "step": 11055 }, { "entropy": 0.7577825877815485, "epoch": 1.0172051914595086, "grad_norm": 0.16746200621128082, "learning_rate": 6.609623700432422e-05, "loss": 0.7421, "mean_token_accuracy": 0.7731116600334644, "num_tokens": 352854960.0, "step": 11056 }, { "entropy": 0.7051164079457521, "epoch": 1.0172971978309497, "grad_norm": 0.1649230271577835, "learning_rate": 6.60931701781826e-05, "loss": 0.6703, "mean_token_accuracy": 0.7957754954695702, "num_tokens": 352886238.0, "step": 11057 }, { "entropy": 0.671159066259861, "epoch": 1.017389204202391, "grad_norm": 0.1660454273223877, "learning_rate": 6.609010335204098e-05, "loss": 0.6707, "mean_token_accuracy": 0.7966479770839214, "num_tokens": 352918501.0, "step": 11058 }, { "entropy": 0.6223780568689108, "epoch": 1.0174812105738322, "grad_norm": 0.15739114582538605, "learning_rate": 6.608703652589935e-05, "loss": 0.5924, "mean_token_accuracy": 0.8179436028003693, "num_tokens": 352949502.0, "step": 11059 }, { "entropy": 0.5718491282314062, "epoch": 1.0175732169452734, "grad_norm": 0.15061341226100922, "learning_rate": 6.608396969975772e-05, "loss": 0.5412, "mean_token_accuracy": 0.8309592977166176, "num_tokens": 352981143.0, "step": 11060 }, { "entropy": 0.6058708969503641, "epoch": 1.0176652233167147, "grad_norm": 0.16067953407764435, "learning_rate": 6.60809028736161e-05, "loss": 0.5875, "mean_token_accuracy": 0.8155613988637924, "num_tokens": 353012103.0, "step": 11061 }, { "entropy": 0.6546070370823145, "epoch": 1.0177572296881559, "grad_norm": 0.15826952457427979, "learning_rate": 6.607783604747447e-05, "loss": 0.6181, "mean_token_accuracy": 0.8102425299584866, "num_tokens": 353043852.0, "step": 11062 }, { "entropy": 0.7171711754053831, "epoch": 1.0178492360595972, "grad_norm": 0.16422703862190247, "learning_rate": 6.607476922133285e-05, "loss": 0.7044, "mean_token_accuracy": 0.7853160835802555, "num_tokens": 353075750.0, "step": 11063 }, { "entropy": 0.6430658120661974, "epoch": 1.0179412424310383, "grad_norm": 0.16197578608989716, "learning_rate": 6.607170239519122e-05, "loss": 0.6183, "mean_token_accuracy": 0.8090569227933884, "num_tokens": 353108035.0, "step": 11064 }, { "entropy": 0.6222786456346512, "epoch": 1.0180332488024795, "grad_norm": 0.15631158649921417, "learning_rate": 6.60686355690496e-05, "loss": 0.6212, "mean_token_accuracy": 0.8132646605372429, "num_tokens": 353139976.0, "step": 11065 }, { "entropy": 0.7424217462539673, "epoch": 1.0181252551739208, "grad_norm": 0.16745689511299133, "learning_rate": 6.606556874290797e-05, "loss": 0.736, "mean_token_accuracy": 0.7771452255547047, "num_tokens": 353171960.0, "step": 11066 }, { "entropy": 0.5685632722452283, "epoch": 1.018217261545362, "grad_norm": 0.1556652933359146, "learning_rate": 6.606250191676633e-05, "loss": 0.558, "mean_token_accuracy": 0.8258872367441654, "num_tokens": 353203958.0, "step": 11067 }, { "entropy": 0.6338471611961722, "epoch": 1.0183092679168033, "grad_norm": 0.1676892191171646, "learning_rate": 6.605943509062471e-05, "loss": 0.6208, "mean_token_accuracy": 0.8105869218707085, "num_tokens": 353236110.0, "step": 11068 }, { "entropy": 0.6272645900025964, "epoch": 1.0184012742882445, "grad_norm": 0.15850459039211273, "learning_rate": 6.60563682644831e-05, "loss": 0.6221, "mean_token_accuracy": 0.8093082569539547, "num_tokens": 353268695.0, "step": 11069 }, { "entropy": 0.6914626397192478, "epoch": 1.0184932806596856, "grad_norm": 0.16093946993350983, "learning_rate": 6.605330143834146e-05, "loss": 0.6729, "mean_token_accuracy": 0.8020366281270981, "num_tokens": 353300987.0, "step": 11070 }, { "entropy": 0.6326673608273268, "epoch": 1.018585287031127, "grad_norm": 0.1513955295085907, "learning_rate": 6.605023461219983e-05, "loss": 0.6181, "mean_token_accuracy": 0.8095074705779552, "num_tokens": 353332672.0, "step": 11071 }, { "entropy": 0.5841182675212622, "epoch": 1.018677293402568, "grad_norm": 0.14835195243358612, "learning_rate": 6.60471677860582e-05, "loss": 0.572, "mean_token_accuracy": 0.8215572461485863, "num_tokens": 353363721.0, "step": 11072 }, { "entropy": 0.6309042535722256, "epoch": 1.0187692997740094, "grad_norm": 0.1626461297273636, "learning_rate": 6.60441009599166e-05, "loss": 0.6199, "mean_token_accuracy": 0.8123874999582767, "num_tokens": 353394777.0, "step": 11073 }, { "entropy": 0.6438672076910734, "epoch": 1.0188613061454506, "grad_norm": 0.16023921966552734, "learning_rate": 6.604103413377496e-05, "loss": 0.627, "mean_token_accuracy": 0.8075745515525341, "num_tokens": 353427491.0, "step": 11074 }, { "entropy": 0.5389050720259547, "epoch": 1.0189533125168917, "grad_norm": 0.15460754930973053, "learning_rate": 6.603796730763333e-05, "loss": 0.5287, "mean_token_accuracy": 0.8352979086339474, "num_tokens": 353458566.0, "step": 11075 }, { "entropy": 0.525908867828548, "epoch": 1.019045318888333, "grad_norm": 0.1620456576347351, "learning_rate": 6.603490048149171e-05, "loss": 0.5184, "mean_token_accuracy": 0.8396496847271919, "num_tokens": 353490866.0, "step": 11076 }, { "entropy": 0.556233175098896, "epoch": 1.0191373252597742, "grad_norm": 0.15255925059318542, "learning_rate": 6.603183365535008e-05, "loss": 0.5375, "mean_token_accuracy": 0.836491834372282, "num_tokens": 353522873.0, "step": 11077 }, { "entropy": 0.6604852434247732, "epoch": 1.0192293316312155, "grad_norm": 0.16136911511421204, "learning_rate": 6.602876682920846e-05, "loss": 0.6423, "mean_token_accuracy": 0.8049019947648048, "num_tokens": 353555373.0, "step": 11078 }, { "entropy": 0.6759150288999081, "epoch": 1.0193213380026567, "grad_norm": 0.16325074434280396, "learning_rate": 6.602570000306683e-05, "loss": 0.6668, "mean_token_accuracy": 0.7975920960307121, "num_tokens": 353586424.0, "step": 11079 }, { "entropy": 0.6414695112034678, "epoch": 1.0194133443740978, "grad_norm": 0.15506097674369812, "learning_rate": 6.602263317692521e-05, "loss": 0.6327, "mean_token_accuracy": 0.8071647062897682, "num_tokens": 353617784.0, "step": 11080 }, { "entropy": 0.6260799784213305, "epoch": 1.0195053507455392, "grad_norm": 0.15215231478214264, "learning_rate": 6.601956635078358e-05, "loss": 0.6022, "mean_token_accuracy": 0.8158596158027649, "num_tokens": 353650116.0, "step": 11081 }, { "entropy": 0.6704672025516629, "epoch": 1.0195973571169803, "grad_norm": 0.15849238634109497, "learning_rate": 6.601649952464195e-05, "loss": 0.6467, "mean_token_accuracy": 0.803951159119606, "num_tokens": 353682256.0, "step": 11082 }, { "entropy": 0.665842049755156, "epoch": 1.0196893634884217, "grad_norm": 0.15945442020893097, "learning_rate": 6.601343269850033e-05, "loss": 0.6464, "mean_token_accuracy": 0.8055992983281612, "num_tokens": 353714573.0, "step": 11083 }, { "entropy": 0.6950315218418837, "epoch": 1.0197813698598628, "grad_norm": 0.15773607790470123, "learning_rate": 6.601036587235871e-05, "loss": 0.6515, "mean_token_accuracy": 0.792545922100544, "num_tokens": 353746099.0, "step": 11084 }, { "entropy": 0.6785743068903685, "epoch": 1.019873376231304, "grad_norm": 0.16946280002593994, "learning_rate": 6.600729904621708e-05, "loss": 0.666, "mean_token_accuracy": 0.7984946109354496, "num_tokens": 353778522.0, "step": 11085 }, { "entropy": 0.6115368194878101, "epoch": 1.0199653826027453, "grad_norm": 0.16101215779781342, "learning_rate": 6.600423222007544e-05, "loss": 0.5914, "mean_token_accuracy": 0.8179872743785381, "num_tokens": 353810381.0, "step": 11086 }, { "entropy": 0.6322286948561668, "epoch": 1.0200573889741864, "grad_norm": 0.15679097175598145, "learning_rate": 6.600116539393381e-05, "loss": 0.6324, "mean_token_accuracy": 0.8060303702950478, "num_tokens": 353842391.0, "step": 11087 }, { "entropy": 0.6115294303745031, "epoch": 1.0201493953456278, "grad_norm": 0.16463007032871246, "learning_rate": 6.59980985677922e-05, "loss": 0.5904, "mean_token_accuracy": 0.8196417726576328, "num_tokens": 353874222.0, "step": 11088 }, { "entropy": 0.5328229684382677, "epoch": 1.020241401717069, "grad_norm": 0.16088560223579407, "learning_rate": 6.599503174165058e-05, "loss": 0.5163, "mean_token_accuracy": 0.8386833630502224, "num_tokens": 353905412.0, "step": 11089 }, { "entropy": 0.6908662151545286, "epoch": 1.02033340808851, "grad_norm": 0.16650280356407166, "learning_rate": 6.599196491550894e-05, "loss": 0.6678, "mean_token_accuracy": 0.7993615232408047, "num_tokens": 353936790.0, "step": 11090 }, { "entropy": 0.6337641887366772, "epoch": 1.0204254144599514, "grad_norm": 0.16658952832221985, "learning_rate": 6.598889808936731e-05, "loss": 0.6196, "mean_token_accuracy": 0.8101487830281258, "num_tokens": 353969118.0, "step": 11091 }, { "entropy": 0.5568565288558602, "epoch": 1.0205174208313925, "grad_norm": 0.15186917781829834, "learning_rate": 6.598583126322569e-05, "loss": 0.5538, "mean_token_accuracy": 0.830848153680563, "num_tokens": 354000755.0, "step": 11092 }, { "entropy": 0.6763074500486255, "epoch": 1.0206094272028339, "grad_norm": 0.1632208377122879, "learning_rate": 6.598276443708406e-05, "loss": 0.6561, "mean_token_accuracy": 0.7987980842590332, "num_tokens": 354032457.0, "step": 11093 }, { "entropy": 0.5611438155174255, "epoch": 1.020701433574275, "grad_norm": 0.14878307282924652, "learning_rate": 6.597969761094244e-05, "loss": 0.5432, "mean_token_accuracy": 0.8337280079722404, "num_tokens": 354064795.0, "step": 11094 }, { "entropy": 0.6106539517641068, "epoch": 1.0207934399457161, "grad_norm": 0.15188337862491608, "learning_rate": 6.597663078480081e-05, "loss": 0.5782, "mean_token_accuracy": 0.8243507705628872, "num_tokens": 354096675.0, "step": 11095 }, { "entropy": 0.6159883178770542, "epoch": 1.0208854463171575, "grad_norm": 0.1543053239583969, "learning_rate": 6.597356395865919e-05, "loss": 0.6025, "mean_token_accuracy": 0.8131205439567566, "num_tokens": 354128792.0, "step": 11096 }, { "entropy": 0.5276921344920993, "epoch": 1.0209774526885986, "grad_norm": 0.1519629955291748, "learning_rate": 6.597049713251756e-05, "loss": 0.5013, "mean_token_accuracy": 0.8412129320204258, "num_tokens": 354160859.0, "step": 11097 }, { "entropy": 0.5842585302889347, "epoch": 1.02106945906004, "grad_norm": 0.1553962528705597, "learning_rate": 6.596743030637593e-05, "loss": 0.5869, "mean_token_accuracy": 0.8183368258178234, "num_tokens": 354192692.0, "step": 11098 }, { "entropy": 0.548811499029398, "epoch": 1.0211614654314811, "grad_norm": 0.16364656388759613, "learning_rate": 6.596436348023431e-05, "loss": 0.5419, "mean_token_accuracy": 0.8357716351747513, "num_tokens": 354223994.0, "step": 11099 }, { "entropy": 0.654418108984828, "epoch": 1.0212534718029223, "grad_norm": 0.1650916039943695, "learning_rate": 6.596129665409269e-05, "loss": 0.6564, "mean_token_accuracy": 0.8031101487576962, "num_tokens": 354255905.0, "step": 11100 }, { "entropy": 0.6365551818162203, "epoch": 1.0213454781743636, "grad_norm": 0.15012800693511963, "learning_rate": 6.595822982795106e-05, "loss": 0.6028, "mean_token_accuracy": 0.8129064179956913, "num_tokens": 354287931.0, "step": 11101 }, { "entropy": 0.5609106216579676, "epoch": 1.0214374845458047, "grad_norm": 0.14666463434696198, "learning_rate": 6.595516300180943e-05, "loss": 0.5467, "mean_token_accuracy": 0.8333580866456032, "num_tokens": 354319990.0, "step": 11102 }, { "entropy": 0.6174989379942417, "epoch": 1.021529490917246, "grad_norm": 0.15569953620433807, "learning_rate": 6.59520961756678e-05, "loss": 0.6041, "mean_token_accuracy": 0.8138704113662243, "num_tokens": 354352317.0, "step": 11103 }, { "entropy": 0.6093851318582892, "epoch": 1.0216214972886872, "grad_norm": 0.1589273363351822, "learning_rate": 6.594902934952617e-05, "loss": 0.6056, "mean_token_accuracy": 0.8145916312932968, "num_tokens": 354384415.0, "step": 11104 }, { "entropy": 0.6420521875843406, "epoch": 1.0217135036601284, "grad_norm": 0.15510326623916626, "learning_rate": 6.594596252338456e-05, "loss": 0.6177, "mean_token_accuracy": 0.8103531524538994, "num_tokens": 354416747.0, "step": 11105 }, { "entropy": 0.6994703970849514, "epoch": 1.0218055100315697, "grad_norm": 0.1632402092218399, "learning_rate": 6.594289569724292e-05, "loss": 0.6826, "mean_token_accuracy": 0.792529035359621, "num_tokens": 354448328.0, "step": 11106 }, { "entropy": 0.6300539821386337, "epoch": 1.0218975164030109, "grad_norm": 0.1669742316007614, "learning_rate": 6.59398288711013e-05, "loss": 0.6314, "mean_token_accuracy": 0.8051268570125103, "num_tokens": 354479817.0, "step": 11107 }, { "entropy": 0.5499340174719691, "epoch": 1.0219895227744522, "grad_norm": 0.1526762694120407, "learning_rate": 6.593676204495967e-05, "loss": 0.5286, "mean_token_accuracy": 0.8377416767179966, "num_tokens": 354512339.0, "step": 11108 }, { "entropy": 0.6236615059897304, "epoch": 1.0220815291458933, "grad_norm": 0.16852763295173645, "learning_rate": 6.593369521881804e-05, "loss": 0.605, "mean_token_accuracy": 0.8152129165828228, "num_tokens": 354543776.0, "step": 11109 }, { "entropy": 0.5942573705688119, "epoch": 1.0221735355173345, "grad_norm": 0.15385645627975464, "learning_rate": 6.593062839267642e-05, "loss": 0.5855, "mean_token_accuracy": 0.8229169584810734, "num_tokens": 354575433.0, "step": 11110 }, { "entropy": 0.6644972711801529, "epoch": 1.0222655418887758, "grad_norm": 0.16244442760944366, "learning_rate": 6.59275615665348e-05, "loss": 0.6657, "mean_token_accuracy": 0.7971116192638874, "num_tokens": 354608201.0, "step": 11111 }, { "entropy": 0.5990500869229436, "epoch": 1.022357548260217, "grad_norm": 0.1672416776418686, "learning_rate": 6.592449474039317e-05, "loss": 0.5618, "mean_token_accuracy": 0.8262341171503067, "num_tokens": 354640379.0, "step": 11112 }, { "entropy": 0.6213775053620338, "epoch": 1.0224495546316583, "grad_norm": 0.1602761298418045, "learning_rate": 6.592142791425154e-05, "loss": 0.5926, "mean_token_accuracy": 0.8193947710096836, "num_tokens": 354671808.0, "step": 11113 }, { "entropy": 0.554726124741137, "epoch": 1.0225415610030995, "grad_norm": 0.14929072558879852, "learning_rate": 6.591836108810992e-05, "loss": 0.5269, "mean_token_accuracy": 0.8341713026165962, "num_tokens": 354704395.0, "step": 11114 }, { "entropy": 0.6081827320158482, "epoch": 1.0226335673745406, "grad_norm": 0.15853779017925262, "learning_rate": 6.59152942619683e-05, "loss": 0.5915, "mean_token_accuracy": 0.8142186738550663, "num_tokens": 354736508.0, "step": 11115 }, { "entropy": 0.7144319303333759, "epoch": 1.022725573745982, "grad_norm": 0.15909773111343384, "learning_rate": 6.591222743582667e-05, "loss": 0.7067, "mean_token_accuracy": 0.7827513255178928, "num_tokens": 354767476.0, "step": 11116 }, { "entropy": 0.6858319491147995, "epoch": 1.022817580117423, "grad_norm": 0.16167880594730377, "learning_rate": 6.590916060968504e-05, "loss": 0.6763, "mean_token_accuracy": 0.7939940094947815, "num_tokens": 354800094.0, "step": 11117 }, { "entropy": 0.7416092287749052, "epoch": 1.0229095864888644, "grad_norm": 0.16189830005168915, "learning_rate": 6.59060937835434e-05, "loss": 0.758, "mean_token_accuracy": 0.7699565440416336, "num_tokens": 354831949.0, "step": 11118 }, { "entropy": 0.5553849888965487, "epoch": 1.0230015928603056, "grad_norm": 0.1494748294353485, "learning_rate": 6.590302695740179e-05, "loss": 0.5556, "mean_token_accuracy": 0.8281549476087093, "num_tokens": 354864360.0, "step": 11119 }, { "entropy": 0.5576512366533279, "epoch": 1.0230935992317467, "grad_norm": 0.15282440185546875, "learning_rate": 6.589996013126017e-05, "loss": 0.5474, "mean_token_accuracy": 0.8285101875662804, "num_tokens": 354895345.0, "step": 11120 }, { "entropy": 0.639838669449091, "epoch": 1.023185605603188, "grad_norm": 0.16308560967445374, "learning_rate": 6.589689330511854e-05, "loss": 0.629, "mean_token_accuracy": 0.8073063679039478, "num_tokens": 354926781.0, "step": 11121 }, { "entropy": 0.5961843840777874, "epoch": 1.0232776119746292, "grad_norm": 0.15467730164527893, "learning_rate": 6.58938264789769e-05, "loss": 0.5703, "mean_token_accuracy": 0.820558562874794, "num_tokens": 354958189.0, "step": 11122 }, { "entropy": 0.6378604657948017, "epoch": 1.0233696183460705, "grad_norm": 0.16523084044456482, "learning_rate": 6.589075965283529e-05, "loss": 0.6168, "mean_token_accuracy": 0.8114181160926819, "num_tokens": 354990512.0, "step": 11123 }, { "entropy": 0.5497778244316578, "epoch": 1.0234616247175117, "grad_norm": 0.14505857229232788, "learning_rate": 6.588769282669365e-05, "loss": 0.5407, "mean_token_accuracy": 0.8324793092906475, "num_tokens": 355022828.0, "step": 11124 }, { "entropy": 0.6446080766618252, "epoch": 1.0235536310889528, "grad_norm": 0.16275165975093842, "learning_rate": 6.588462600055204e-05, "loss": 0.6512, "mean_token_accuracy": 0.8038684166967869, "num_tokens": 355054782.0, "step": 11125 }, { "entropy": 0.6478744447231293, "epoch": 1.0236456374603942, "grad_norm": 0.16452698409557343, "learning_rate": 6.58815591744104e-05, "loss": 0.6437, "mean_token_accuracy": 0.8083246238529682, "num_tokens": 355086282.0, "step": 11126 }, { "entropy": 0.7061208710074425, "epoch": 1.0237376438318353, "grad_norm": 0.16302618384361267, "learning_rate": 6.587849234826878e-05, "loss": 0.6976, "mean_token_accuracy": 0.7891222164034843, "num_tokens": 355118019.0, "step": 11127 }, { "entropy": 0.6330856643617153, "epoch": 1.0238296502032767, "grad_norm": 0.15950924158096313, "learning_rate": 6.587542552212715e-05, "loss": 0.6095, "mean_token_accuracy": 0.8113800063729286, "num_tokens": 355149298.0, "step": 11128 }, { "entropy": 0.5797736402601004, "epoch": 1.0239216565747178, "grad_norm": 0.1527262181043625, "learning_rate": 6.587235869598552e-05, "loss": 0.5584, "mean_token_accuracy": 0.8283810466527939, "num_tokens": 355181761.0, "step": 11129 }, { "entropy": 0.6083549065515399, "epoch": 1.024013662946159, "grad_norm": 0.15909124910831451, "learning_rate": 6.58692918698439e-05, "loss": 0.5728, "mean_token_accuracy": 0.8239563554525375, "num_tokens": 355213396.0, "step": 11130 }, { "entropy": 0.6916986331343651, "epoch": 1.0241056693176003, "grad_norm": 0.16330231726169586, "learning_rate": 6.586622504370228e-05, "loss": 0.6693, "mean_token_accuracy": 0.7952448911964893, "num_tokens": 355245327.0, "step": 11131 }, { "entropy": 0.4228186681866646, "epoch": 1.0241976756890414, "grad_norm": 0.1542735993862152, "learning_rate": 6.586315821756065e-05, "loss": 0.397, "mean_token_accuracy": 0.8761871457099915, "num_tokens": 355277589.0, "step": 11132 }, { "entropy": 0.5805315556935966, "epoch": 1.0242896820604828, "grad_norm": 0.15418881177902222, "learning_rate": 6.586009139141902e-05, "loss": 0.5668, "mean_token_accuracy": 0.8258967883884907, "num_tokens": 355309576.0, "step": 11133 }, { "entropy": 0.5890538031235337, "epoch": 1.024381688431924, "grad_norm": 0.159847691655159, "learning_rate": 6.585702456527739e-05, "loss": 0.5903, "mean_token_accuracy": 0.8201438225805759, "num_tokens": 355341444.0, "step": 11134 }, { "entropy": 0.5169252487830818, "epoch": 1.024473694803365, "grad_norm": 0.1514231264591217, "learning_rate": 6.585395773913577e-05, "loss": 0.5084, "mean_token_accuracy": 0.8441071957349777, "num_tokens": 355373290.0, "step": 11135 }, { "entropy": 0.5332802999764681, "epoch": 1.0245657011748064, "grad_norm": 0.1653662621974945, "learning_rate": 6.585089091299415e-05, "loss": 0.5388, "mean_token_accuracy": 0.8336604200303555, "num_tokens": 355404485.0, "step": 11136 }, { "entropy": 0.5673503521829844, "epoch": 1.0246577075462475, "grad_norm": 0.15026113390922546, "learning_rate": 6.584782408685252e-05, "loss": 0.555, "mean_token_accuracy": 0.8300462700426579, "num_tokens": 355436915.0, "step": 11137 }, { "entropy": 0.7351520285010338, "epoch": 1.0247497139176889, "grad_norm": 0.17579299211502075, "learning_rate": 6.58447572607109e-05, "loss": 0.7412, "mean_token_accuracy": 0.7737283930182457, "num_tokens": 355467525.0, "step": 11138 }, { "entropy": 0.5895990002900362, "epoch": 1.02484172028913, "grad_norm": 0.15308117866516113, "learning_rate": 6.584169043456927e-05, "loss": 0.5711, "mean_token_accuracy": 0.8244980722665787, "num_tokens": 355499095.0, "step": 11139 }, { "entropy": 0.6220831498503685, "epoch": 1.0249337266605711, "grad_norm": 0.15484720468521118, "learning_rate": 6.583862360842763e-05, "loss": 0.6053, "mean_token_accuracy": 0.814725685864687, "num_tokens": 355531297.0, "step": 11140 }, { "entropy": 0.626759547740221, "epoch": 1.0250257330320125, "grad_norm": 0.16055339574813843, "learning_rate": 6.583555678228602e-05, "loss": 0.6192, "mean_token_accuracy": 0.8114000484347343, "num_tokens": 355563566.0, "step": 11141 }, { "entropy": 0.6269311467185616, "epoch": 1.0251177394034536, "grad_norm": 0.15989360213279724, "learning_rate": 6.58324899561444e-05, "loss": 0.6078, "mean_token_accuracy": 0.8111033551394939, "num_tokens": 355594774.0, "step": 11142 }, { "entropy": 0.61144311260432, "epoch": 1.025209745774895, "grad_norm": 0.15761882066726685, "learning_rate": 6.582942313000277e-05, "loss": 0.5668, "mean_token_accuracy": 0.8230639398097992, "num_tokens": 355626205.0, "step": 11143 }, { "entropy": 0.5285051185637712, "epoch": 1.0253017521463361, "grad_norm": 0.15169763565063477, "learning_rate": 6.582635630386113e-05, "loss": 0.5204, "mean_token_accuracy": 0.8407036922872066, "num_tokens": 355658393.0, "step": 11144 }, { "entropy": 0.5779129816219211, "epoch": 1.0253937585177773, "grad_norm": 0.15228958427906036, "learning_rate": 6.58232894777195e-05, "loss": 0.5263, "mean_token_accuracy": 0.835735984146595, "num_tokens": 355689392.0, "step": 11145 }, { "entropy": 0.5383781120181084, "epoch": 1.0254857648892186, "grad_norm": 0.1535869836807251, "learning_rate": 6.58202226515779e-05, "loss": 0.5281, "mean_token_accuracy": 0.8412112295627594, "num_tokens": 355721868.0, "step": 11146 }, { "entropy": 0.7336319303140044, "epoch": 1.0255777712606597, "grad_norm": 0.16432741284370422, "learning_rate": 6.581715582543626e-05, "loss": 0.7195, "mean_token_accuracy": 0.7799639701843262, "num_tokens": 355753401.0, "step": 11147 }, { "entropy": 0.5101771764457226, "epoch": 1.025669777632101, "grad_norm": 0.14977982640266418, "learning_rate": 6.581408899929463e-05, "loss": 0.4835, "mean_token_accuracy": 0.852300614118576, "num_tokens": 355785785.0, "step": 11148 }, { "entropy": 0.6322557460516691, "epoch": 1.0257617840035422, "grad_norm": 0.15779227018356323, "learning_rate": 6.5811022173153e-05, "loss": 0.62, "mean_token_accuracy": 0.806129727512598, "num_tokens": 355818003.0, "step": 11149 }, { "entropy": 0.6521858964115381, "epoch": 1.0258537903749834, "grad_norm": 0.15728923678398132, "learning_rate": 6.580795534701138e-05, "loss": 0.637, "mean_token_accuracy": 0.8029757365584373, "num_tokens": 355850281.0, "step": 11150 }, { "entropy": 0.6446063239127398, "epoch": 1.0259457967464247, "grad_norm": 0.15990093350410461, "learning_rate": 6.580488852086976e-05, "loss": 0.6356, "mean_token_accuracy": 0.8107896000146866, "num_tokens": 355882222.0, "step": 11151 }, { "entropy": 0.7422805540263653, "epoch": 1.0260378031178659, "grad_norm": 0.16674324870109558, "learning_rate": 6.580182169472813e-05, "loss": 0.7178, "mean_token_accuracy": 0.7809755206108093, "num_tokens": 355913017.0, "step": 11152 }, { "entropy": 0.6274510212242603, "epoch": 1.0261298094893072, "grad_norm": 0.1666877418756485, "learning_rate": 6.57987548685865e-05, "loss": 0.6, "mean_token_accuracy": 0.8150048740208149, "num_tokens": 355944821.0, "step": 11153 }, { "entropy": 0.6204209718853235, "epoch": 1.0262218158607483, "grad_norm": 0.15575242042541504, "learning_rate": 6.579568804244488e-05, "loss": 0.6016, "mean_token_accuracy": 0.8170488774776459, "num_tokens": 355976735.0, "step": 11154 }, { "entropy": 0.6272664051502943, "epoch": 1.0263138222321895, "grad_norm": 0.15776260197162628, "learning_rate": 6.579262121630325e-05, "loss": 0.6144, "mean_token_accuracy": 0.809675183147192, "num_tokens": 356009080.0, "step": 11155 }, { "entropy": 0.7152967974543571, "epoch": 1.0264058286036308, "grad_norm": 0.15648090839385986, "learning_rate": 6.578955439016163e-05, "loss": 0.7097, "mean_token_accuracy": 0.7846948616206646, "num_tokens": 356041241.0, "step": 11156 }, { "entropy": 0.607933247461915, "epoch": 1.026497834975072, "grad_norm": 0.1574198305606842, "learning_rate": 6.578648756402e-05, "loss": 0.5806, "mean_token_accuracy": 0.8226118944585323, "num_tokens": 356073140.0, "step": 11157 }, { "entropy": 0.5809630993753672, "epoch": 1.0265898413465133, "grad_norm": 0.15651533007621765, "learning_rate": 6.578342073787838e-05, "loss": 0.5683, "mean_token_accuracy": 0.822663675993681, "num_tokens": 356104886.0, "step": 11158 }, { "entropy": 0.5935042882338166, "epoch": 1.0266818477179545, "grad_norm": 0.1581466943025589, "learning_rate": 6.578035391173675e-05, "loss": 0.5926, "mean_token_accuracy": 0.8201813958585262, "num_tokens": 356136496.0, "step": 11159 }, { "entropy": 0.6058900514617562, "epoch": 1.0267738540893956, "grad_norm": 0.16271446645259857, "learning_rate": 6.577728708559511e-05, "loss": 0.6074, "mean_token_accuracy": 0.8187516145408154, "num_tokens": 356168684.0, "step": 11160 }, { "entropy": 0.605561375617981, "epoch": 1.026865860460837, "grad_norm": 0.1518544703722, "learning_rate": 6.57742202594535e-05, "loss": 0.6003, "mean_token_accuracy": 0.8132413737475872, "num_tokens": 356200527.0, "step": 11161 }, { "entropy": 0.5402805926278234, "epoch": 1.026957866832278, "grad_norm": 0.15425775945186615, "learning_rate": 6.577115343331188e-05, "loss": 0.5227, "mean_token_accuracy": 0.8370953500270844, "num_tokens": 356232645.0, "step": 11162 }, { "entropy": 0.6417617425322533, "epoch": 1.0270498732037194, "grad_norm": 0.15694303810596466, "learning_rate": 6.576808660717025e-05, "loss": 0.6393, "mean_token_accuracy": 0.8047176338732243, "num_tokens": 356264013.0, "step": 11163 }, { "entropy": 0.4644618174061179, "epoch": 1.0271418795751606, "grad_norm": 0.14796100556850433, "learning_rate": 6.576501978102861e-05, "loss": 0.4486, "mean_token_accuracy": 0.8599135056138039, "num_tokens": 356295799.0, "step": 11164 }, { "entropy": 0.645774464122951, "epoch": 1.0272338859466017, "grad_norm": 0.16234184801578522, "learning_rate": 6.5761952954887e-05, "loss": 0.6159, "mean_token_accuracy": 0.8134028017520905, "num_tokens": 356327594.0, "step": 11165 }, { "entropy": 0.6662279199808836, "epoch": 1.027325892318043, "grad_norm": 0.1563371866941452, "learning_rate": 6.575888612874536e-05, "loss": 0.6676, "mean_token_accuracy": 0.7951232865452766, "num_tokens": 356359917.0, "step": 11166 }, { "entropy": 0.6526262909173965, "epoch": 1.0274178986894842, "grad_norm": 0.1650128811597824, "learning_rate": 6.575581930260374e-05, "loss": 0.6237, "mean_token_accuracy": 0.807604618370533, "num_tokens": 356391474.0, "step": 11167 }, { "entropy": 0.7018301654607058, "epoch": 1.0275099050609255, "grad_norm": 0.15965121984481812, "learning_rate": 6.575275247646211e-05, "loss": 0.6862, "mean_token_accuracy": 0.7937578149139881, "num_tokens": 356422865.0, "step": 11168 }, { "entropy": 0.668730091303587, "epoch": 1.0276019114323667, "grad_norm": 0.15969325602054596, "learning_rate": 6.574968565032049e-05, "loss": 0.6634, "mean_token_accuracy": 0.8020192347466946, "num_tokens": 356454167.0, "step": 11169 }, { "entropy": 0.645359518006444, "epoch": 1.0276939178038078, "grad_norm": 0.1597966104745865, "learning_rate": 6.574661882417886e-05, "loss": 0.6255, "mean_token_accuracy": 0.8072432056069374, "num_tokens": 356486346.0, "step": 11170 }, { "entropy": 0.6369847320020199, "epoch": 1.0277859241752492, "grad_norm": 0.1603982150554657, "learning_rate": 6.574355199803723e-05, "loss": 0.6381, "mean_token_accuracy": 0.8047345019876957, "num_tokens": 356519077.0, "step": 11171 }, { "entropy": 0.7073330264538527, "epoch": 1.0278779305466903, "grad_norm": 0.16839192807674408, "learning_rate": 6.574048517189561e-05, "loss": 0.6954, "mean_token_accuracy": 0.7881055399775505, "num_tokens": 356551347.0, "step": 11172 }, { "entropy": 0.5894474070519209, "epoch": 1.0279699369181317, "grad_norm": 0.15522634983062744, "learning_rate": 6.573741834575399e-05, "loss": 0.5851, "mean_token_accuracy": 0.8214107230305672, "num_tokens": 356582550.0, "step": 11173 }, { "entropy": 0.5580227412283421, "epoch": 1.0280619432895728, "grad_norm": 0.15298543870449066, "learning_rate": 6.573435151961236e-05, "loss": 0.5462, "mean_token_accuracy": 0.8335065133869648, "num_tokens": 356614481.0, "step": 11174 }, { "entropy": 0.6567193642258644, "epoch": 1.028153949661014, "grad_norm": 0.1749880462884903, "learning_rate": 6.573128469347073e-05, "loss": 0.671, "mean_token_accuracy": 0.7964727506041527, "num_tokens": 356646260.0, "step": 11175 }, { "entropy": 0.6559860613197088, "epoch": 1.0282459560324553, "grad_norm": 0.1611291915178299, "learning_rate": 6.57282178673291e-05, "loss": 0.6433, "mean_token_accuracy": 0.802121389657259, "num_tokens": 356677914.0, "step": 11176 }, { "entropy": 0.6459015142172575, "epoch": 1.0283379624038964, "grad_norm": 0.16649475693702698, "learning_rate": 6.572515104118748e-05, "loss": 0.6125, "mean_token_accuracy": 0.8158500678837299, "num_tokens": 356708940.0, "step": 11177 }, { "entropy": 0.5533565804362297, "epoch": 1.0284299687753378, "grad_norm": 0.1525716334581375, "learning_rate": 6.572208421504586e-05, "loss": 0.5449, "mean_token_accuracy": 0.830286517739296, "num_tokens": 356740612.0, "step": 11178 }, { "entropy": 0.6642203498631716, "epoch": 1.028521975146779, "grad_norm": 0.1557031124830246, "learning_rate": 6.571901738890423e-05, "loss": 0.6405, "mean_token_accuracy": 0.7998861521482468, "num_tokens": 356771821.0, "step": 11179 }, { "entropy": 0.5018505984917283, "epoch": 1.02861398151822, "grad_norm": 0.14705398678779602, "learning_rate": 6.57159505627626e-05, "loss": 0.4834, "mean_token_accuracy": 0.8459547534584999, "num_tokens": 356803784.0, "step": 11180 }, { "entropy": 0.7198075894266367, "epoch": 1.0287059878896614, "grad_norm": 0.1608545184135437, "learning_rate": 6.571288373662098e-05, "loss": 0.6991, "mean_token_accuracy": 0.7895880490541458, "num_tokens": 356835893.0, "step": 11181 }, { "entropy": 0.5911889020353556, "epoch": 1.0287979942611025, "grad_norm": 0.15623465180397034, "learning_rate": 6.570981691047934e-05, "loss": 0.5583, "mean_token_accuracy": 0.8299335092306137, "num_tokens": 356867014.0, "step": 11182 }, { "entropy": 0.567258894443512, "epoch": 1.0288900006325439, "grad_norm": 0.15450255572795868, "learning_rate": 6.570675008433772e-05, "loss": 0.5487, "mean_token_accuracy": 0.8321421071887016, "num_tokens": 356898359.0, "step": 11183 }, { "entropy": 0.654614357277751, "epoch": 1.028982007003985, "grad_norm": 0.16758786141872406, "learning_rate": 6.570368325819609e-05, "loss": 0.6474, "mean_token_accuracy": 0.8009790740907192, "num_tokens": 356930251.0, "step": 11184 }, { "entropy": 0.621184716001153, "epoch": 1.0290740133754261, "grad_norm": 0.15916162729263306, "learning_rate": 6.570061643205447e-05, "loss": 0.582, "mean_token_accuracy": 0.8188925497233868, "num_tokens": 356961399.0, "step": 11185 }, { "entropy": 0.6081996322609484, "epoch": 1.0291660197468675, "grad_norm": 0.15683822333812714, "learning_rate": 6.569754960591284e-05, "loss": 0.5952, "mean_token_accuracy": 0.815809078514576, "num_tokens": 356992701.0, "step": 11186 }, { "entropy": 0.6773356478661299, "epoch": 1.0292580261183086, "grad_norm": 0.1669316440820694, "learning_rate": 6.569448277977121e-05, "loss": 0.6482, "mean_token_accuracy": 0.8018272966146469, "num_tokens": 357023993.0, "step": 11187 }, { "entropy": 0.5948080448433757, "epoch": 1.02935003248975, "grad_norm": 0.1556406319141388, "learning_rate": 6.569141595362959e-05, "loss": 0.5848, "mean_token_accuracy": 0.8235202133655548, "num_tokens": 357055663.0, "step": 11188 }, { "entropy": 0.6246946761384606, "epoch": 1.0294420388611911, "grad_norm": 0.16084134578704834, "learning_rate": 6.568834912748797e-05, "loss": 0.6281, "mean_token_accuracy": 0.8092124089598656, "num_tokens": 357087280.0, "step": 11189 }, { "entropy": 0.5400379505008459, "epoch": 1.0295340452326323, "grad_norm": 0.17175115644931793, "learning_rate": 6.568528230134634e-05, "loss": 0.5372, "mean_token_accuracy": 0.832184374332428, "num_tokens": 357118916.0, "step": 11190 }, { "entropy": 0.7275659963488579, "epoch": 1.0296260516040736, "grad_norm": 0.1684601753950119, "learning_rate": 6.568221547520471e-05, "loss": 0.727, "mean_token_accuracy": 0.7834472320973873, "num_tokens": 357151347.0, "step": 11191 }, { "entropy": 0.4981008544564247, "epoch": 1.0297180579755147, "grad_norm": 0.14512968063354492, "learning_rate": 6.567914864906308e-05, "loss": 0.4924, "mean_token_accuracy": 0.8478180356323719, "num_tokens": 357183785.0, "step": 11192 }, { "entropy": 0.6259238012135029, "epoch": 1.029810064346956, "grad_norm": 0.15392276644706726, "learning_rate": 6.567608182292147e-05, "loss": 0.6181, "mean_token_accuracy": 0.8112550191581249, "num_tokens": 357215483.0, "step": 11193 }, { "entropy": 0.5913379192352295, "epoch": 1.0299020707183972, "grad_norm": 0.15633432567119598, "learning_rate": 6.567301499677984e-05, "loss": 0.5709, "mean_token_accuracy": 0.8223900608718395, "num_tokens": 357248140.0, "step": 11194 }, { "entropy": 0.6151008568704128, "epoch": 1.0299940770898384, "grad_norm": 0.1543024778366089, "learning_rate": 6.56699481706382e-05, "loss": 0.6061, "mean_token_accuracy": 0.8108697421848774, "num_tokens": 357279760.0, "step": 11195 }, { "entropy": 0.6578126419335604, "epoch": 1.0300860834612797, "grad_norm": 0.15859423577785492, "learning_rate": 6.566688134449659e-05, "loss": 0.633, "mean_token_accuracy": 0.8001300320029259, "num_tokens": 357311794.0, "step": 11196 }, { "entropy": 0.5486818440258503, "epoch": 1.0301780898327209, "grad_norm": 0.14729826152324677, "learning_rate": 6.566381451835496e-05, "loss": 0.5255, "mean_token_accuracy": 0.8373872339725494, "num_tokens": 357343452.0, "step": 11197 }, { "entropy": 0.5791084785014391, "epoch": 1.0302700962041622, "grad_norm": 0.15082857012748718, "learning_rate": 6.566074769221334e-05, "loss": 0.5642, "mean_token_accuracy": 0.824513491243124, "num_tokens": 357375466.0, "step": 11198 }, { "entropy": 0.7106267549097538, "epoch": 1.0303621025756033, "grad_norm": 0.16655319929122925, "learning_rate": 6.56576808660717e-05, "loss": 0.6922, "mean_token_accuracy": 0.7931222505867481, "num_tokens": 357407557.0, "step": 11199 }, { "entropy": 0.6002542097121477, "epoch": 1.0304541089470445, "grad_norm": 0.16402719914913177, "learning_rate": 6.565461403993009e-05, "loss": 0.5881, "mean_token_accuracy": 0.8153147138655186, "num_tokens": 357439023.0, "step": 11200 }, { "entropy": 0.6549103818833828, "epoch": 1.0305461153184858, "grad_norm": 0.16113047301769257, "learning_rate": 6.565154721378845e-05, "loss": 0.6457, "mean_token_accuracy": 0.802578192204237, "num_tokens": 357470499.0, "step": 11201 }, { "entropy": 0.6089485604315996, "epoch": 1.030638121689927, "grad_norm": 0.15870225429534912, "learning_rate": 6.564848038764682e-05, "loss": 0.5899, "mean_token_accuracy": 0.8211034312844276, "num_tokens": 357502486.0, "step": 11202 }, { "entropy": 0.5897171534597874, "epoch": 1.0307301280613683, "grad_norm": 0.1540016382932663, "learning_rate": 6.56454135615052e-05, "loss": 0.583, "mean_token_accuracy": 0.8176778480410576, "num_tokens": 357534318.0, "step": 11203 }, { "entropy": 0.5221086088567972, "epoch": 1.0308221344328095, "grad_norm": 0.15392553806304932, "learning_rate": 6.564234673536359e-05, "loss": 0.4865, "mean_token_accuracy": 0.8457939140498638, "num_tokens": 357566278.0, "step": 11204 }, { "entropy": 0.7097489228472114, "epoch": 1.0309141408042506, "grad_norm": 0.16394098103046417, "learning_rate": 6.563927990922195e-05, "loss": 0.6867, "mean_token_accuracy": 0.7933954671025276, "num_tokens": 357598294.0, "step": 11205 }, { "entropy": 0.64798878505826, "epoch": 1.031006147175692, "grad_norm": 0.1587889939546585, "learning_rate": 6.563621308308032e-05, "loss": 0.6393, "mean_token_accuracy": 0.8037106767296791, "num_tokens": 357630898.0, "step": 11206 }, { "entropy": 0.5797769781202078, "epoch": 1.031098153547133, "grad_norm": 0.15837378799915314, "learning_rate": 6.563314625693869e-05, "loss": 0.5766, "mean_token_accuracy": 0.8215299993753433, "num_tokens": 357662721.0, "step": 11207 }, { "entropy": 0.5368738728575408, "epoch": 1.0311901599185744, "grad_norm": 0.1563686579465866, "learning_rate": 6.563007943079707e-05, "loss": 0.5246, "mean_token_accuracy": 0.8394439779222012, "num_tokens": 357694753.0, "step": 11208 }, { "entropy": 0.5386973861604929, "epoch": 1.0312821662900156, "grad_norm": 0.16020961105823517, "learning_rate": 6.562701260465545e-05, "loss": 0.5377, "mean_token_accuracy": 0.8332789540290833, "num_tokens": 357727002.0, "step": 11209 }, { "entropy": 0.6422846084460616, "epoch": 1.0313741726614567, "grad_norm": 0.16949813067913055, "learning_rate": 6.562394577851382e-05, "loss": 0.6338, "mean_token_accuracy": 0.8028657957911491, "num_tokens": 357757457.0, "step": 11210 }, { "entropy": 0.7769491225481033, "epoch": 1.031466179032898, "grad_norm": 0.16516825556755066, "learning_rate": 6.562087895237219e-05, "loss": 0.7646, "mean_token_accuracy": 0.7700598202645779, "num_tokens": 357789698.0, "step": 11211 }, { "entropy": 0.571486652828753, "epoch": 1.0315581854043392, "grad_norm": 0.1581244319677353, "learning_rate": 6.561781212623057e-05, "loss": 0.5504, "mean_token_accuracy": 0.8295733295381069, "num_tokens": 357822100.0, "step": 11212 }, { "entropy": 0.6360442079603672, "epoch": 1.0316501917757805, "grad_norm": 0.15768976509571075, "learning_rate": 6.561474530008894e-05, "loss": 0.6183, "mean_token_accuracy": 0.8086828477680683, "num_tokens": 357854459.0, "step": 11213 }, { "entropy": 0.6084075421094894, "epoch": 1.0317421981472217, "grad_norm": 0.15869195759296417, "learning_rate": 6.561167847394732e-05, "loss": 0.601, "mean_token_accuracy": 0.8134176656603813, "num_tokens": 357886180.0, "step": 11214 }, { "entropy": 0.6195746809244156, "epoch": 1.0318342045186628, "grad_norm": 0.15605174005031586, "learning_rate": 6.560861164780569e-05, "loss": 0.6161, "mean_token_accuracy": 0.8086886256933212, "num_tokens": 357917969.0, "step": 11215 }, { "entropy": 0.630449203774333, "epoch": 1.0319262108901042, "grad_norm": 0.15317851305007935, "learning_rate": 6.560554482166407e-05, "loss": 0.6109, "mean_token_accuracy": 0.811018094420433, "num_tokens": 357950075.0, "step": 11216 }, { "entropy": 0.6461335280910134, "epoch": 1.0320182172615453, "grad_norm": 0.153901606798172, "learning_rate": 6.560247799552244e-05, "loss": 0.6072, "mean_token_accuracy": 0.8142009600996971, "num_tokens": 357982398.0, "step": 11217 }, { "entropy": 0.5709450431168079, "epoch": 1.0321102236329867, "grad_norm": 0.15393422544002533, "learning_rate": 6.55994111693808e-05, "loss": 0.54, "mean_token_accuracy": 0.8329514563083649, "num_tokens": 358014437.0, "step": 11218 }, { "entropy": 0.5758693758398294, "epoch": 1.0322022300044278, "grad_norm": 0.15092776715755463, "learning_rate": 6.559634434323918e-05, "loss": 0.5688, "mean_token_accuracy": 0.8273100033402443, "num_tokens": 358046446.0, "step": 11219 }, { "entropy": 0.5527088111266494, "epoch": 1.032294236375869, "grad_norm": 0.164415642619133, "learning_rate": 6.559327751709757e-05, "loss": 0.5466, "mean_token_accuracy": 0.8316296450793743, "num_tokens": 358078677.0, "step": 11220 }, { "entropy": 0.6317416243255138, "epoch": 1.0323862427473103, "grad_norm": 0.16037510335445404, "learning_rate": 6.559021069095593e-05, "loss": 0.6309, "mean_token_accuracy": 0.807031974196434, "num_tokens": 358110715.0, "step": 11221 }, { "entropy": 0.604914229363203, "epoch": 1.0324782491187514, "grad_norm": 0.16620273888111115, "learning_rate": 6.55871438648143e-05, "loss": 0.5794, "mean_token_accuracy": 0.8212810680270195, "num_tokens": 358141371.0, "step": 11222 }, { "entropy": 0.6269135307520628, "epoch": 1.0325702554901928, "grad_norm": 0.1611940860748291, "learning_rate": 6.558407703867267e-05, "loss": 0.61, "mean_token_accuracy": 0.816243339329958, "num_tokens": 358173763.0, "step": 11223 }, { "entropy": 0.5860498826950788, "epoch": 1.032662261861634, "grad_norm": 0.15154896676540375, "learning_rate": 6.558101021253105e-05, "loss": 0.5868, "mean_token_accuracy": 0.8206036798655987, "num_tokens": 358206210.0, "step": 11224 }, { "entropy": 0.6190072223544121, "epoch": 1.032754268233075, "grad_norm": 0.15720811486244202, "learning_rate": 6.557794338638943e-05, "loss": 0.603, "mean_token_accuracy": 0.8138999864459038, "num_tokens": 358237507.0, "step": 11225 }, { "entropy": 0.6829803958535194, "epoch": 1.0328462746045164, "grad_norm": 0.16133752465248108, "learning_rate": 6.55748765602478e-05, "loss": 0.6793, "mean_token_accuracy": 0.7945583015680313, "num_tokens": 358268864.0, "step": 11226 }, { "entropy": 0.6116115637123585, "epoch": 1.0329382809759575, "grad_norm": 0.15127769112586975, "learning_rate": 6.557180973410618e-05, "loss": 0.6114, "mean_token_accuracy": 0.8105361126363277, "num_tokens": 358300669.0, "step": 11227 }, { "entropy": 0.6963477935642004, "epoch": 1.0330302873473989, "grad_norm": 0.16403399407863617, "learning_rate": 6.556874290796455e-05, "loss": 0.6848, "mean_token_accuracy": 0.788776483386755, "num_tokens": 358331782.0, "step": 11228 }, { "entropy": 0.6402001734822989, "epoch": 1.03312229371884, "grad_norm": 0.15336227416992188, "learning_rate": 6.556567608182292e-05, "loss": 0.6216, "mean_token_accuracy": 0.8093182891607285, "num_tokens": 358363215.0, "step": 11229 }, { "entropy": 0.5721560167148709, "epoch": 1.0332143000902811, "grad_norm": 0.15806904435157776, "learning_rate": 6.55626092556813e-05, "loss": 0.5662, "mean_token_accuracy": 0.8244564384222031, "num_tokens": 358395452.0, "step": 11230 }, { "entropy": 0.6152497567236423, "epoch": 1.0333063064617225, "grad_norm": 0.16084058582782745, "learning_rate": 6.555954242953968e-05, "loss": 0.5992, "mean_token_accuracy": 0.8163048177957535, "num_tokens": 358427134.0, "step": 11231 }, { "entropy": 0.6443797256797552, "epoch": 1.0333983128331636, "grad_norm": 0.15951676666736603, "learning_rate": 6.555647560339805e-05, "loss": 0.6258, "mean_token_accuracy": 0.8042616210877895, "num_tokens": 358459253.0, "step": 11232 }, { "entropy": 0.5831717289984226, "epoch": 1.033490319204605, "grad_norm": 0.17002196609973907, "learning_rate": 6.555340877725642e-05, "loss": 0.5623, "mean_token_accuracy": 0.828153844922781, "num_tokens": 358491017.0, "step": 11233 }, { "entropy": 0.5530284061096609, "epoch": 1.0335823255760461, "grad_norm": 0.1540166437625885, "learning_rate": 6.55503419511148e-05, "loss": 0.541, "mean_token_accuracy": 0.8326274491846561, "num_tokens": 358523006.0, "step": 11234 }, { "entropy": 0.5790864285081625, "epoch": 1.0336743319474873, "grad_norm": 0.1564413458108902, "learning_rate": 6.554727512497318e-05, "loss": 0.5606, "mean_token_accuracy": 0.8304401077330112, "num_tokens": 358555048.0, "step": 11235 }, { "entropy": 0.6096401680260897, "epoch": 1.0337663383189286, "grad_norm": 0.16089259088039398, "learning_rate": 6.554420829883155e-05, "loss": 0.5717, "mean_token_accuracy": 0.820878766477108, "num_tokens": 358586031.0, "step": 11236 }, { "entropy": 0.6338641350157559, "epoch": 1.0338583446903697, "grad_norm": 0.15699462592601776, "learning_rate": 6.554114147268991e-05, "loss": 0.609, "mean_token_accuracy": 0.8068219944834709, "num_tokens": 358616302.0, "step": 11237 }, { "entropy": 0.6513941399753094, "epoch": 1.033950351061811, "grad_norm": 0.15782621502876282, "learning_rate": 6.553807464654828e-05, "loss": 0.6242, "mean_token_accuracy": 0.8060525581240654, "num_tokens": 358647592.0, "step": 11238 }, { "entropy": 0.6388822924345732, "epoch": 1.0340423574332522, "grad_norm": 0.15884581208229065, "learning_rate": 6.553500782040666e-05, "loss": 0.6252, "mean_token_accuracy": 0.8081190139055252, "num_tokens": 358678706.0, "step": 11239 }, { "entropy": 0.5580443013459444, "epoch": 1.0341343638046934, "grad_norm": 0.1513216346502304, "learning_rate": 6.553194099426505e-05, "loss": 0.5403, "mean_token_accuracy": 0.8324749507009983, "num_tokens": 358710400.0, "step": 11240 }, { "entropy": 0.5876111406832933, "epoch": 1.0342263701761347, "grad_norm": 0.15666908025741577, "learning_rate": 6.552887416812341e-05, "loss": 0.567, "mean_token_accuracy": 0.8224202543497086, "num_tokens": 358741781.0, "step": 11241 }, { "entropy": 0.5780525393784046, "epoch": 1.0343183765475759, "grad_norm": 0.15570874512195587, "learning_rate": 6.552580734198178e-05, "loss": 0.569, "mean_token_accuracy": 0.8256644941866398, "num_tokens": 358773650.0, "step": 11242 }, { "entropy": 0.5698785241693258, "epoch": 1.0344103829190172, "grad_norm": 0.15447472035884857, "learning_rate": 6.552274051584016e-05, "loss": 0.5684, "mean_token_accuracy": 0.825314212590456, "num_tokens": 358806053.0, "step": 11243 }, { "entropy": 0.6346882805228233, "epoch": 1.0345023892904583, "grad_norm": 0.16997532546520233, "learning_rate": 6.551967368969853e-05, "loss": 0.6221, "mean_token_accuracy": 0.8105118460953236, "num_tokens": 358838508.0, "step": 11244 }, { "entropy": 0.70526616089046, "epoch": 1.0345943956618995, "grad_norm": 0.16605310142040253, "learning_rate": 6.551660686355691e-05, "loss": 0.6929, "mean_token_accuracy": 0.794137179851532, "num_tokens": 358869664.0, "step": 11245 }, { "entropy": 0.606017735786736, "epoch": 1.0346864020333408, "grad_norm": 0.16007481515407562, "learning_rate": 6.551354003741528e-05, "loss": 0.5849, "mean_token_accuracy": 0.8190787136554718, "num_tokens": 358901556.0, "step": 11246 }, { "entropy": 0.5502998121082783, "epoch": 1.034778408404782, "grad_norm": 0.15124063193798065, "learning_rate": 6.551047321127366e-05, "loss": 0.5417, "mean_token_accuracy": 0.8319225795567036, "num_tokens": 358933974.0, "step": 11247 }, { "entropy": 0.5398168936371803, "epoch": 1.0348704147762233, "grad_norm": 0.16363489627838135, "learning_rate": 6.550740638513203e-05, "loss": 0.5071, "mean_token_accuracy": 0.8414734937250614, "num_tokens": 358965991.0, "step": 11248 }, { "entropy": 0.5966099416837096, "epoch": 1.0349624211476645, "grad_norm": 0.15708203613758087, "learning_rate": 6.55043395589904e-05, "loss": 0.5989, "mean_token_accuracy": 0.8157765045762062, "num_tokens": 358997330.0, "step": 11249 }, { "entropy": 0.5581850782036781, "epoch": 1.0350544275191056, "grad_norm": 0.1491868495941162, "learning_rate": 6.550127273284878e-05, "loss": 0.5493, "mean_token_accuracy": 0.8297613821923733, "num_tokens": 359029452.0, "step": 11250 }, { "entropy": 0.5660249562934041, "epoch": 1.035146433890547, "grad_norm": 0.15340019762516022, "learning_rate": 6.549820590670716e-05, "loss": 0.5654, "mean_token_accuracy": 0.8309675864875317, "num_tokens": 359061345.0, "step": 11251 }, { "entropy": 0.701406167820096, "epoch": 1.035238440261988, "grad_norm": 0.16169241070747375, "learning_rate": 6.549513908056553e-05, "loss": 0.6852, "mean_token_accuracy": 0.7912253178656101, "num_tokens": 359093734.0, "step": 11252 }, { "entropy": 0.6404104381799698, "epoch": 1.0353304466334294, "grad_norm": 0.15897880494594574, "learning_rate": 6.54920722544239e-05, "loss": 0.6011, "mean_token_accuracy": 0.8135656714439392, "num_tokens": 359125194.0, "step": 11253 }, { "entropy": 0.6517519950866699, "epoch": 1.0354224530048706, "grad_norm": 0.15694375336170197, "learning_rate": 6.548900542828226e-05, "loss": 0.6181, "mean_token_accuracy": 0.8080190718173981, "num_tokens": 359157613.0, "step": 11254 }, { "entropy": 0.6393206678330898, "epoch": 1.0355144593763117, "grad_norm": 0.1631609946489334, "learning_rate": 6.548593860214064e-05, "loss": 0.627, "mean_token_accuracy": 0.8089647404849529, "num_tokens": 359188725.0, "step": 11255 }, { "entropy": 0.6649221004918218, "epoch": 1.035606465747753, "grad_norm": 0.1545964777469635, "learning_rate": 6.548287177599903e-05, "loss": 0.6485, "mean_token_accuracy": 0.8058474212884903, "num_tokens": 359221188.0, "step": 11256 }, { "entropy": 0.5919221267104149, "epoch": 1.0356984721191942, "grad_norm": 0.16434337198734283, "learning_rate": 6.54798049498574e-05, "loss": 0.5749, "mean_token_accuracy": 0.8225748315453529, "num_tokens": 359253632.0, "step": 11257 }, { "entropy": 0.6446048617362976, "epoch": 1.0357904784906355, "grad_norm": 0.16433022916316986, "learning_rate": 6.547673812371578e-05, "loss": 0.6352, "mean_token_accuracy": 0.8067122548818588, "num_tokens": 359285562.0, "step": 11258 }, { "entropy": 0.4880861770361662, "epoch": 1.0358824848620767, "grad_norm": 0.15272651612758636, "learning_rate": 6.547367129757414e-05, "loss": 0.4717, "mean_token_accuracy": 0.8546700999140739, "num_tokens": 359317435.0, "step": 11259 }, { "entropy": 0.6602481165900826, "epoch": 1.0359744912335178, "grad_norm": 0.17034833133220673, "learning_rate": 6.547060447143251e-05, "loss": 0.6497, "mean_token_accuracy": 0.8063477501273155, "num_tokens": 359349608.0, "step": 11260 }, { "entropy": 0.6174950916320086, "epoch": 1.0360664976049592, "grad_norm": 0.15856313705444336, "learning_rate": 6.546753764529089e-05, "loss": 0.6065, "mean_token_accuracy": 0.8154224939644337, "num_tokens": 359381570.0, "step": 11261 }, { "entropy": 0.6575037855654955, "epoch": 1.0361585039764003, "grad_norm": 0.15837803483009338, "learning_rate": 6.546447081914927e-05, "loss": 0.6592, "mean_token_accuracy": 0.7976585887372494, "num_tokens": 359412831.0, "step": 11262 }, { "entropy": 0.6367569994181395, "epoch": 1.0362505103478417, "grad_norm": 0.15342766046524048, "learning_rate": 6.546140399300764e-05, "loss": 0.6256, "mean_token_accuracy": 0.8035937286913395, "num_tokens": 359444938.0, "step": 11263 }, { "entropy": 0.6461022458970547, "epoch": 1.0363425167192828, "grad_norm": 0.15990446507930756, "learning_rate": 6.545833716686601e-05, "loss": 0.6421, "mean_token_accuracy": 0.8040594421327114, "num_tokens": 359476673.0, "step": 11264 }, { "entropy": 0.5588886719197035, "epoch": 1.036434523090724, "grad_norm": 0.15579748153686523, "learning_rate": 6.545527034072438e-05, "loss": 0.551, "mean_token_accuracy": 0.8322730138897896, "num_tokens": 359508016.0, "step": 11265 }, { "entropy": 0.69586774520576, "epoch": 1.0365265294621653, "grad_norm": 0.16706958413124084, "learning_rate": 6.545220351458277e-05, "loss": 0.6695, "mean_token_accuracy": 0.7957456111907959, "num_tokens": 359540020.0, "step": 11266 }, { "entropy": 0.5514724077656865, "epoch": 1.0366185358336064, "grad_norm": 0.14992979168891907, "learning_rate": 6.544913668844114e-05, "loss": 0.5308, "mean_token_accuracy": 0.8351389616727829, "num_tokens": 359572546.0, "step": 11267 }, { "entropy": 0.562500074505806, "epoch": 1.0367105422050478, "grad_norm": 0.15632300078868866, "learning_rate": 6.544606986229951e-05, "loss": 0.552, "mean_token_accuracy": 0.8297572359442711, "num_tokens": 359604578.0, "step": 11268 }, { "entropy": 0.6200545467436314, "epoch": 1.036802548576489, "grad_norm": 0.1573575884103775, "learning_rate": 6.544300303615788e-05, "loss": 0.6053, "mean_token_accuracy": 0.8134637139737606, "num_tokens": 359636581.0, "step": 11269 }, { "entropy": 0.6691756835207343, "epoch": 1.03689455494793, "grad_norm": 0.1584833413362503, "learning_rate": 6.543993621001626e-05, "loss": 0.6589, "mean_token_accuracy": 0.7942923083901405, "num_tokens": 359668434.0, "step": 11270 }, { "entropy": 0.690344556234777, "epoch": 1.0369865613193714, "grad_norm": 0.1697334498167038, "learning_rate": 6.543686938387464e-05, "loss": 0.6797, "mean_token_accuracy": 0.7929201610386372, "num_tokens": 359699635.0, "step": 11271 }, { "entropy": 0.5330392420291901, "epoch": 1.0370785676908125, "grad_norm": 0.15341712534427643, "learning_rate": 6.543380255773301e-05, "loss": 0.5087, "mean_token_accuracy": 0.8450674377381802, "num_tokens": 359731307.0, "step": 11272 }, { "entropy": 0.5980792324990034, "epoch": 1.0371705740622539, "grad_norm": 0.15647125244140625, "learning_rate": 6.543073573159138e-05, "loss": 0.5847, "mean_token_accuracy": 0.8207773976027966, "num_tokens": 359762994.0, "step": 11273 }, { "entropy": 0.653015517629683, "epoch": 1.037262580433695, "grad_norm": 0.15488234162330627, "learning_rate": 6.542766890544976e-05, "loss": 0.6242, "mean_token_accuracy": 0.8086663410067558, "num_tokens": 359795515.0, "step": 11274 }, { "entropy": 0.6369661763310432, "epoch": 1.0373545868051361, "grad_norm": 0.15562483668327332, "learning_rate": 6.542460207930812e-05, "loss": 0.6216, "mean_token_accuracy": 0.8173789456486702, "num_tokens": 359827015.0, "step": 11275 }, { "entropy": 0.5964508280158043, "epoch": 1.0374465931765775, "grad_norm": 0.16231490671634674, "learning_rate": 6.54215352531665e-05, "loss": 0.5889, "mean_token_accuracy": 0.8185994289815426, "num_tokens": 359858963.0, "step": 11276 }, { "entropy": 0.619480574503541, "epoch": 1.0375385995480186, "grad_norm": 0.15553130209445953, "learning_rate": 6.541846842702487e-05, "loss": 0.6081, "mean_token_accuracy": 0.8121733702719212, "num_tokens": 359891032.0, "step": 11277 }, { "entropy": 0.6400401666760445, "epoch": 1.03763060591946, "grad_norm": 0.16834978759288788, "learning_rate": 6.541540160088326e-05, "loss": 0.6386, "mean_token_accuracy": 0.8061617240309715, "num_tokens": 359922495.0, "step": 11278 }, { "entropy": 0.6658603632822633, "epoch": 1.0377226122909011, "grad_norm": 0.1533675193786621, "learning_rate": 6.541233477474162e-05, "loss": 0.6561, "mean_token_accuracy": 0.8024588413536549, "num_tokens": 359954806.0, "step": 11279 }, { "entropy": 0.6245888397097588, "epoch": 1.0378146186623423, "grad_norm": 0.15304048359394073, "learning_rate": 6.540926794859999e-05, "loss": 0.6084, "mean_token_accuracy": 0.814521424472332, "num_tokens": 359987008.0, "step": 11280 }, { "entropy": 0.5239458573050797, "epoch": 1.0379066250337836, "grad_norm": 0.14923307299613953, "learning_rate": 6.540620112245837e-05, "loss": 0.4966, "mean_token_accuracy": 0.8460754230618477, "num_tokens": 360019338.0, "step": 11281 }, { "entropy": 0.6646715607494116, "epoch": 1.0379986314052247, "grad_norm": 0.16378210484981537, "learning_rate": 6.540313429631675e-05, "loss": 0.6419, "mean_token_accuracy": 0.8059790506958961, "num_tokens": 360051043.0, "step": 11282 }, { "entropy": 0.6406269576400518, "epoch": 1.038090637776666, "grad_norm": 0.15901625156402588, "learning_rate": 6.540006747017512e-05, "loss": 0.6262, "mean_token_accuracy": 0.8079768121242523, "num_tokens": 360082741.0, "step": 11283 }, { "entropy": 0.6018247604370117, "epoch": 1.0381826441481072, "grad_norm": 0.16391518712043762, "learning_rate": 6.539700064403349e-05, "loss": 0.5822, "mean_token_accuracy": 0.8171807266771793, "num_tokens": 360115152.0, "step": 11284 }, { "entropy": 0.6460073199123144, "epoch": 1.0382746505195484, "grad_norm": 0.162327840924263, "learning_rate": 6.539393381789186e-05, "loss": 0.6528, "mean_token_accuracy": 0.8023933693766594, "num_tokens": 360147139.0, "step": 11285 }, { "entropy": 0.688604798167944, "epoch": 1.0383666568909897, "grad_norm": 0.16144128143787384, "learning_rate": 6.539086699175024e-05, "loss": 0.6799, "mean_token_accuracy": 0.7882529571652412, "num_tokens": 360178442.0, "step": 11286 }, { "entropy": 0.6879567429423332, "epoch": 1.0384586632624309, "grad_norm": 0.17104949057102203, "learning_rate": 6.538780016560862e-05, "loss": 0.6813, "mean_token_accuracy": 0.7949122898280621, "num_tokens": 360210505.0, "step": 11287 }, { "entropy": 0.6244544330984354, "epoch": 1.0385506696338722, "grad_norm": 0.16270744800567627, "learning_rate": 6.538473333946699e-05, "loss": 0.6059, "mean_token_accuracy": 0.8130488395690918, "num_tokens": 360242382.0, "step": 11288 }, { "entropy": 0.5901247579604387, "epoch": 1.0386426760053133, "grad_norm": 0.15785330533981323, "learning_rate": 6.538166651332537e-05, "loss": 0.5798, "mean_token_accuracy": 0.8239158503711224, "num_tokens": 360274921.0, "step": 11289 }, { "entropy": 0.4621091363951564, "epoch": 1.0387346823767545, "grad_norm": 0.14036832749843597, "learning_rate": 6.537859968718374e-05, "loss": 0.4461, "mean_token_accuracy": 0.8578538224101067, "num_tokens": 360307055.0, "step": 11290 }, { "entropy": 0.6233379542827606, "epoch": 1.0388266887481958, "grad_norm": 0.1605856865644455, "learning_rate": 6.53755328610421e-05, "loss": 0.6058, "mean_token_accuracy": 0.8112677708268166, "num_tokens": 360339254.0, "step": 11291 }, { "entropy": 0.688158331438899, "epoch": 1.038918695119637, "grad_norm": 0.1578766256570816, "learning_rate": 6.537246603490049e-05, "loss": 0.6851, "mean_token_accuracy": 0.7953712716698647, "num_tokens": 360371231.0, "step": 11292 }, { "entropy": 0.6501013059169054, "epoch": 1.0390107014910783, "grad_norm": 0.15800419449806213, "learning_rate": 6.536939920875887e-05, "loss": 0.6536, "mean_token_accuracy": 0.8028835691511631, "num_tokens": 360402856.0, "step": 11293 }, { "entropy": 0.6760437907651067, "epoch": 1.0391027078625195, "grad_norm": 0.17113277316093445, "learning_rate": 6.536633238261724e-05, "loss": 0.6519, "mean_token_accuracy": 0.8010628744959831, "num_tokens": 360434381.0, "step": 11294 }, { "entropy": 0.6072567403316498, "epoch": 1.0391947142339606, "grad_norm": 0.15749794244766235, "learning_rate": 6.53632655564756e-05, "loss": 0.5879, "mean_token_accuracy": 0.819013349711895, "num_tokens": 360466860.0, "step": 11295 }, { "entropy": 0.6136963907629251, "epoch": 1.039286720605402, "grad_norm": 0.15559901297092438, "learning_rate": 6.536019873033397e-05, "loss": 0.5793, "mean_token_accuracy": 0.8124320469796658, "num_tokens": 360497822.0, "step": 11296 }, { "entropy": 0.6504846680909395, "epoch": 1.039378726976843, "grad_norm": 0.1632031798362732, "learning_rate": 6.535713190419235e-05, "loss": 0.6295, "mean_token_accuracy": 0.8070244565606117, "num_tokens": 360529743.0, "step": 11297 }, { "entropy": 0.6693718936294317, "epoch": 1.0394707333482844, "grad_norm": 0.16140252351760864, "learning_rate": 6.535406507805073e-05, "loss": 0.654, "mean_token_accuracy": 0.798920065164566, "num_tokens": 360561471.0, "step": 11298 }, { "entropy": 0.5929766409099102, "epoch": 1.0395627397197256, "grad_norm": 0.15122537314891815, "learning_rate": 6.53509982519091e-05, "loss": 0.5681, "mean_token_accuracy": 0.822842862457037, "num_tokens": 360592714.0, "step": 11299 }, { "entropy": 0.5161897800862789, "epoch": 1.0396547460911667, "grad_norm": 0.14950916171073914, "learning_rate": 6.534793142576747e-05, "loss": 0.4944, "mean_token_accuracy": 0.8455421663820744, "num_tokens": 360624510.0, "step": 11300 }, { "entropy": 0.685538413003087, "epoch": 1.039746752462608, "grad_norm": 0.16347506642341614, "learning_rate": 6.534486459962585e-05, "loss": 0.6835, "mean_token_accuracy": 0.7920996509492397, "num_tokens": 360656490.0, "step": 11301 }, { "entropy": 0.6164305992424488, "epoch": 1.0398387588340492, "grad_norm": 0.16771110892295837, "learning_rate": 6.534179777348422e-05, "loss": 0.6109, "mean_token_accuracy": 0.8160485401749611, "num_tokens": 360688251.0, "step": 11302 }, { "entropy": 0.6097148424014449, "epoch": 1.0399307652054905, "grad_norm": 0.1593731939792633, "learning_rate": 6.53387309473426e-05, "loss": 0.6116, "mean_token_accuracy": 0.8085715658962727, "num_tokens": 360719920.0, "step": 11303 }, { "entropy": 0.6904276125133038, "epoch": 1.0400227715769317, "grad_norm": 0.16248266398906708, "learning_rate": 6.533566412120097e-05, "loss": 0.684, "mean_token_accuracy": 0.7899565510451794, "num_tokens": 360751855.0, "step": 11304 }, { "entropy": 0.6903837993741035, "epoch": 1.0401147779483728, "grad_norm": 0.16958564519882202, "learning_rate": 6.533259729505935e-05, "loss": 0.6707, "mean_token_accuracy": 0.795820277184248, "num_tokens": 360780946.0, "step": 11305 }, { "entropy": 0.5451074438169599, "epoch": 1.0402067843198142, "grad_norm": 0.15899071097373962, "learning_rate": 6.532953046891772e-05, "loss": 0.5125, "mean_token_accuracy": 0.8433113135397434, "num_tokens": 360812477.0, "step": 11306 }, { "entropy": 0.5934247951954603, "epoch": 1.0402987906912553, "grad_norm": 0.16354793310165405, "learning_rate": 6.532646364277609e-05, "loss": 0.5752, "mean_token_accuracy": 0.822447132319212, "num_tokens": 360844302.0, "step": 11307 }, { "entropy": 0.621164882555604, "epoch": 1.0403907970626967, "grad_norm": 0.16061946749687195, "learning_rate": 6.532339681663447e-05, "loss": 0.5972, "mean_token_accuracy": 0.8134232349693775, "num_tokens": 360875259.0, "step": 11308 }, { "entropy": 0.619119611568749, "epoch": 1.0404828034341378, "grad_norm": 0.15735647082328796, "learning_rate": 6.532032999049285e-05, "loss": 0.5985, "mean_token_accuracy": 0.8188568539917469, "num_tokens": 360907636.0, "step": 11309 }, { "entropy": 0.6336795762181282, "epoch": 1.040574809805579, "grad_norm": 0.1538573056459427, "learning_rate": 6.531726316435122e-05, "loss": 0.6269, "mean_token_accuracy": 0.8041358664631844, "num_tokens": 360939708.0, "step": 11310 }, { "entropy": 0.5527670681476593, "epoch": 1.0406668161770203, "grad_norm": 0.15867435932159424, "learning_rate": 6.531419633820958e-05, "loss": 0.5209, "mean_token_accuracy": 0.8394958190619946, "num_tokens": 360971524.0, "step": 11311 }, { "entropy": 0.6583319511264563, "epoch": 1.0407588225484614, "grad_norm": 0.1653902679681778, "learning_rate": 6.531112951206795e-05, "loss": 0.6392, "mean_token_accuracy": 0.8088385798037052, "num_tokens": 361003587.0, "step": 11312 }, { "entropy": 0.5506768226623535, "epoch": 1.0408508289199028, "grad_norm": 0.15013745427131653, "learning_rate": 6.530806268592635e-05, "loss": 0.5389, "mean_token_accuracy": 0.8332906141877174, "num_tokens": 361036059.0, "step": 11313 }, { "entropy": 0.6330753713846207, "epoch": 1.040942835291344, "grad_norm": 0.15820913016796112, "learning_rate": 6.530499585978472e-05, "loss": 0.6107, "mean_token_accuracy": 0.8124703541398048, "num_tokens": 361067457.0, "step": 11314 }, { "entropy": 0.6449433751404285, "epoch": 1.041034841662785, "grad_norm": 0.1595258265733719, "learning_rate": 6.530192903364308e-05, "loss": 0.6179, "mean_token_accuracy": 0.8071821182966232, "num_tokens": 361098839.0, "step": 11315 }, { "entropy": 0.6982866749167442, "epoch": 1.0411268480342264, "grad_norm": 0.16514776647090912, "learning_rate": 6.529886220750145e-05, "loss": 0.693, "mean_token_accuracy": 0.7937782146036625, "num_tokens": 361130824.0, "step": 11316 }, { "entropy": 0.5698676090687513, "epoch": 1.0412188544056675, "grad_norm": 0.15596292912960052, "learning_rate": 6.529579538135983e-05, "loss": 0.5529, "mean_token_accuracy": 0.8325263448059559, "num_tokens": 361163127.0, "step": 11317 }, { "entropy": 0.625254325568676, "epoch": 1.0413108607771089, "grad_norm": 0.15437157452106476, "learning_rate": 6.529272855521821e-05, "loss": 0.6102, "mean_token_accuracy": 0.8098956756293774, "num_tokens": 361195119.0, "step": 11318 }, { "entropy": 0.6990798246115446, "epoch": 1.04140286714855, "grad_norm": 0.16002075374126434, "learning_rate": 6.528966172907658e-05, "loss": 0.6801, "mean_token_accuracy": 0.7919263541698456, "num_tokens": 361226919.0, "step": 11319 }, { "entropy": 0.6328364587388933, "epoch": 1.0414948735199911, "grad_norm": 0.1617008000612259, "learning_rate": 6.528659490293496e-05, "loss": 0.6248, "mean_token_accuracy": 0.8060440346598625, "num_tokens": 361258536.0, "step": 11320 }, { "entropy": 0.6231993236579001, "epoch": 1.0415868798914325, "grad_norm": 0.1587372124195099, "learning_rate": 6.528352807679333e-05, "loss": 0.6188, "mean_token_accuracy": 0.8130705654621124, "num_tokens": 361291055.0, "step": 11321 }, { "entropy": 0.6681632632389665, "epoch": 1.0416788862628736, "grad_norm": 0.15742380917072296, "learning_rate": 6.52804612506517e-05, "loss": 0.6682, "mean_token_accuracy": 0.799884207546711, "num_tokens": 361322840.0, "step": 11322 }, { "entropy": 0.6115213511511683, "epoch": 1.041770892634315, "grad_norm": 0.15813057124614716, "learning_rate": 6.527739442451008e-05, "loss": 0.6119, "mean_token_accuracy": 0.8124778531491756, "num_tokens": 361355206.0, "step": 11323 }, { "entropy": 0.5987418964505196, "epoch": 1.0418628990057561, "grad_norm": 0.1527065634727478, "learning_rate": 6.527432759836846e-05, "loss": 0.5738, "mean_token_accuracy": 0.8227873370051384, "num_tokens": 361387562.0, "step": 11324 }, { "entropy": 0.6084656808525324, "epoch": 1.0419549053771973, "grad_norm": 0.15500381588935852, "learning_rate": 6.527126077222683e-05, "loss": 0.5884, "mean_token_accuracy": 0.8183947093784809, "num_tokens": 361419880.0, "step": 11325 }, { "entropy": 0.5397191988304257, "epoch": 1.0420469117486386, "grad_norm": 0.15201863646507263, "learning_rate": 6.52681939460852e-05, "loss": 0.5226, "mean_token_accuracy": 0.8353799507021904, "num_tokens": 361452254.0, "step": 11326 }, { "entropy": 0.5283767757937312, "epoch": 1.0421389181200797, "grad_norm": 0.1452038288116455, "learning_rate": 6.526512711994357e-05, "loss": 0.5136, "mean_token_accuracy": 0.8404021486639977, "num_tokens": 361484408.0, "step": 11327 }, { "entropy": 0.614433865994215, "epoch": 1.042230924491521, "grad_norm": 0.15625466406345367, "learning_rate": 6.526206029380195e-05, "loss": 0.6024, "mean_token_accuracy": 0.8171016424894333, "num_tokens": 361515803.0, "step": 11328 }, { "entropy": 0.6728823930025101, "epoch": 1.0423229308629622, "grad_norm": 0.1606377512216568, "learning_rate": 6.525899346766033e-05, "loss": 0.669, "mean_token_accuracy": 0.7937152348458767, "num_tokens": 361547632.0, "step": 11329 }, { "entropy": 0.6121555352583528, "epoch": 1.0424149372344034, "grad_norm": 0.16202230751514435, "learning_rate": 6.52559266415187e-05, "loss": 0.5905, "mean_token_accuracy": 0.8182537108659744, "num_tokens": 361580131.0, "step": 11330 }, { "entropy": 0.6749308267608285, "epoch": 1.0425069436058447, "grad_norm": 0.1637076586484909, "learning_rate": 6.525285981537706e-05, "loss": 0.6715, "mean_token_accuracy": 0.79473427683115, "num_tokens": 361611929.0, "step": 11331 }, { "entropy": 0.7386414967477322, "epoch": 1.0425989499772859, "grad_norm": 0.1592947244644165, "learning_rate": 6.524979298923545e-05, "loss": 0.7352, "mean_token_accuracy": 0.7800780273973942, "num_tokens": 361644598.0, "step": 11332 }, { "entropy": 0.5869670892134309, "epoch": 1.0426909563487272, "grad_norm": 0.1562202423810959, "learning_rate": 6.524672616309381e-05, "loss": 0.577, "mean_token_accuracy": 0.8255320638418198, "num_tokens": 361676673.0, "step": 11333 }, { "entropy": 0.6389273125678301, "epoch": 1.0427829627201683, "grad_norm": 0.16067086160182953, "learning_rate": 6.52436593369522e-05, "loss": 0.6314, "mean_token_accuracy": 0.804293479770422, "num_tokens": 361708831.0, "step": 11334 }, { "entropy": 0.6098017580807209, "epoch": 1.0428749690916095, "grad_norm": 0.15540757775306702, "learning_rate": 6.524059251081056e-05, "loss": 0.6138, "mean_token_accuracy": 0.8104639053344727, "num_tokens": 361741131.0, "step": 11335 }, { "entropy": 0.635205615311861, "epoch": 1.0429669754630508, "grad_norm": 0.15789088606834412, "learning_rate": 6.523752568466894e-05, "loss": 0.6281, "mean_token_accuracy": 0.8059217110276222, "num_tokens": 361773254.0, "step": 11336 }, { "entropy": 0.6679215580224991, "epoch": 1.043058981834492, "grad_norm": 0.1597139835357666, "learning_rate": 6.523445885852731e-05, "loss": 0.6566, "mean_token_accuracy": 0.8011646382510662, "num_tokens": 361804183.0, "step": 11337 }, { "entropy": 0.4984524268656969, "epoch": 1.0431509882059333, "grad_norm": 0.1567150056362152, "learning_rate": 6.523139203238568e-05, "loss": 0.4729, "mean_token_accuracy": 0.8550131805241108, "num_tokens": 361836146.0, "step": 11338 }, { "entropy": 0.558585025370121, "epoch": 1.0432429945773745, "grad_norm": 0.16429337859153748, "learning_rate": 6.522832520624406e-05, "loss": 0.5525, "mean_token_accuracy": 0.828677162528038, "num_tokens": 361868150.0, "step": 11339 }, { "entropy": 0.6236891150474548, "epoch": 1.0433350009488156, "grad_norm": 0.15528947114944458, "learning_rate": 6.522525838010244e-05, "loss": 0.6038, "mean_token_accuracy": 0.8156319819390774, "num_tokens": 361900687.0, "step": 11340 }, { "entropy": 0.6857223361730576, "epoch": 1.043427007320257, "grad_norm": 0.16497768461704254, "learning_rate": 6.522219155396081e-05, "loss": 0.6589, "mean_token_accuracy": 0.7993718199431896, "num_tokens": 361931862.0, "step": 11341 }, { "entropy": 0.6730406787246466, "epoch": 1.043519013691698, "grad_norm": 0.16159197688102722, "learning_rate": 6.521912472781918e-05, "loss": 0.6489, "mean_token_accuracy": 0.8008205257356167, "num_tokens": 361963376.0, "step": 11342 }, { "entropy": 0.6018912214785814, "epoch": 1.0436110200631394, "grad_norm": 0.14345425367355347, "learning_rate": 6.521605790167755e-05, "loss": 0.5745, "mean_token_accuracy": 0.8200779370963573, "num_tokens": 361995695.0, "step": 11343 }, { "entropy": 0.6843041144311428, "epoch": 1.0437030264345806, "grad_norm": 0.15901626646518707, "learning_rate": 6.521299107553593e-05, "loss": 0.6538, "mean_token_accuracy": 0.800620011985302, "num_tokens": 362028388.0, "step": 11344 }, { "entropy": 0.7259683404117823, "epoch": 1.0437950328060217, "grad_norm": 0.16313642263412476, "learning_rate": 6.520992424939431e-05, "loss": 0.7008, "mean_token_accuracy": 0.7865181341767311, "num_tokens": 362059186.0, "step": 11345 }, { "entropy": 0.5867699924856424, "epoch": 1.043887039177463, "grad_norm": 0.14732445776462555, "learning_rate": 6.520685742325268e-05, "loss": 0.5743, "mean_token_accuracy": 0.820958212018013, "num_tokens": 362091150.0, "step": 11346 }, { "entropy": 0.5222950987517834, "epoch": 1.0439790455489042, "grad_norm": 0.15597349405288696, "learning_rate": 6.520379059711104e-05, "loss": 0.498, "mean_token_accuracy": 0.8413230404257774, "num_tokens": 362122687.0, "step": 11347 }, { "entropy": 0.5966097163036466, "epoch": 1.0440710519203455, "grad_norm": 0.15881267189979553, "learning_rate": 6.520072377096943e-05, "loss": 0.5828, "mean_token_accuracy": 0.8181601874530315, "num_tokens": 362155076.0, "step": 11348 }, { "entropy": 0.6202506273984909, "epoch": 1.0441630582917867, "grad_norm": 0.1615038514137268, "learning_rate": 6.51976569448278e-05, "loss": 0.6196, "mean_token_accuracy": 0.8113898076117039, "num_tokens": 362187177.0, "step": 11349 }, { "entropy": 0.6609824821352959, "epoch": 1.0442550646632278, "grad_norm": 0.1627250611782074, "learning_rate": 6.519459011868618e-05, "loss": 0.6555, "mean_token_accuracy": 0.7982389740645885, "num_tokens": 362218877.0, "step": 11350 }, { "entropy": 0.5744073176756501, "epoch": 1.0443470710346692, "grad_norm": 0.16115599870681763, "learning_rate": 6.519152329254456e-05, "loss": 0.5658, "mean_token_accuracy": 0.8283259235322475, "num_tokens": 362249974.0, "step": 11351 }, { "entropy": 0.664430333301425, "epoch": 1.0444390774061103, "grad_norm": 0.15930384397506714, "learning_rate": 6.518845646640292e-05, "loss": 0.6545, "mean_token_accuracy": 0.7999523878097534, "num_tokens": 362282651.0, "step": 11352 }, { "entropy": 0.5951716313138604, "epoch": 1.0445310837775517, "grad_norm": 0.15495075285434723, "learning_rate": 6.518538964026129e-05, "loss": 0.5834, "mean_token_accuracy": 0.8222058266401291, "num_tokens": 362315042.0, "step": 11353 }, { "entropy": 0.5670714639127254, "epoch": 1.0446230901489928, "grad_norm": 0.15432991087436676, "learning_rate": 6.518232281411967e-05, "loss": 0.5526, "mean_token_accuracy": 0.8288856185972691, "num_tokens": 362347079.0, "step": 11354 }, { "entropy": 0.5420350264757872, "epoch": 1.044715096520434, "grad_norm": 0.15763238072395325, "learning_rate": 6.517925598797806e-05, "loss": 0.5306, "mean_token_accuracy": 0.832607489079237, "num_tokens": 362378829.0, "step": 11355 }, { "entropy": 0.7444331981241703, "epoch": 1.0448071028918753, "grad_norm": 0.16290809214115143, "learning_rate": 6.517618916183642e-05, "loss": 0.7268, "mean_token_accuracy": 0.7748517915606499, "num_tokens": 362410812.0, "step": 11356 }, { "entropy": 0.6367619577795267, "epoch": 1.0448991092633164, "grad_norm": 0.15845172107219696, "learning_rate": 6.517312233569479e-05, "loss": 0.6426, "mean_token_accuracy": 0.8022008091211319, "num_tokens": 362442926.0, "step": 11357 }, { "entropy": 0.6414101924747229, "epoch": 1.0449911156347578, "grad_norm": 0.16263112425804138, "learning_rate": 6.517005550955316e-05, "loss": 0.6286, "mean_token_accuracy": 0.8061984591186047, "num_tokens": 362474452.0, "step": 11358 }, { "entropy": 0.710134282708168, "epoch": 1.045083122006199, "grad_norm": 0.1584492176771164, "learning_rate": 6.516698868341154e-05, "loss": 0.6816, "mean_token_accuracy": 0.7893397472798824, "num_tokens": 362505779.0, "step": 11359 }, { "entropy": 0.6443398483097553, "epoch": 1.04517512837764, "grad_norm": 0.15380682051181793, "learning_rate": 6.516392185726992e-05, "loss": 0.6293, "mean_token_accuracy": 0.8028711937367916, "num_tokens": 362538264.0, "step": 11360 }, { "entropy": 0.7032506875693798, "epoch": 1.0452671347490814, "grad_norm": 0.16242197155952454, "learning_rate": 6.516085503112829e-05, "loss": 0.685, "mean_token_accuracy": 0.7926701866090298, "num_tokens": 362570176.0, "step": 11361 }, { "entropy": 0.7444228231906891, "epoch": 1.0453591411205225, "grad_norm": 0.1611459106206894, "learning_rate": 6.515778820498666e-05, "loss": 0.7216, "mean_token_accuracy": 0.7821303308010101, "num_tokens": 362601704.0, "step": 11362 }, { "entropy": 0.6525474116206169, "epoch": 1.0454511474919639, "grad_norm": 0.16241173446178436, "learning_rate": 6.515472137884504e-05, "loss": 0.638, "mean_token_accuracy": 0.8045470342040062, "num_tokens": 362633346.0, "step": 11363 }, { "entropy": 0.674727838486433, "epoch": 1.045543153863405, "grad_norm": 0.15949514508247375, "learning_rate": 6.515165455270341e-05, "loss": 0.6417, "mean_token_accuracy": 0.8001524098217487, "num_tokens": 362664704.0, "step": 11364 }, { "entropy": 0.6382793318480253, "epoch": 1.0456351602348462, "grad_norm": 0.1525222659111023, "learning_rate": 6.514858772656179e-05, "loss": 0.6254, "mean_token_accuracy": 0.8101888038218021, "num_tokens": 362697091.0, "step": 11365 }, { "entropy": 0.5885003674775362, "epoch": 1.0457271666062875, "grad_norm": 0.15260553359985352, "learning_rate": 6.514552090042016e-05, "loss": 0.5657, "mean_token_accuracy": 0.8247752003371716, "num_tokens": 362729310.0, "step": 11366 }, { "entropy": 0.5693422611802816, "epoch": 1.0458191729777286, "grad_norm": 0.16273964941501617, "learning_rate": 6.514245407427854e-05, "loss": 0.5588, "mean_token_accuracy": 0.8279097117483616, "num_tokens": 362761728.0, "step": 11367 }, { "entropy": 0.6291062645614147, "epoch": 1.04591117934917, "grad_norm": 0.16098758578300476, "learning_rate": 6.51393872481369e-05, "loss": 0.6321, "mean_token_accuracy": 0.8051988780498505, "num_tokens": 362793996.0, "step": 11368 }, { "entropy": 0.6343740336596966, "epoch": 1.0460031857206111, "grad_norm": 0.15987972915172577, "learning_rate": 6.513632042199527e-05, "loss": 0.6323, "mean_token_accuracy": 0.8104198686778545, "num_tokens": 362826372.0, "step": 11369 }, { "entropy": 0.652833603322506, "epoch": 1.0460951920920523, "grad_norm": 0.16730745136737823, "learning_rate": 6.513325359585365e-05, "loss": 0.6474, "mean_token_accuracy": 0.803126435726881, "num_tokens": 362858765.0, "step": 11370 }, { "entropy": 0.6223719641566277, "epoch": 1.0461871984634936, "grad_norm": 0.16728921234607697, "learning_rate": 6.513018676971204e-05, "loss": 0.6459, "mean_token_accuracy": 0.8078217208385468, "num_tokens": 362889181.0, "step": 11371 }, { "entropy": 0.6167031144723296, "epoch": 1.0462792048349348, "grad_norm": 0.15332530438899994, "learning_rate": 6.51271199435704e-05, "loss": 0.5923, "mean_token_accuracy": 0.8164460808038712, "num_tokens": 362920844.0, "step": 11372 }, { "entropy": 0.651158350519836, "epoch": 1.046371211206376, "grad_norm": 0.1573869287967682, "learning_rate": 6.512405311742877e-05, "loss": 0.6492, "mean_token_accuracy": 0.801630437374115, "num_tokens": 362953612.0, "step": 11373 }, { "entropy": 0.6780338976532221, "epoch": 1.0464632175778172, "grad_norm": 0.16182108223438263, "learning_rate": 6.512098629128714e-05, "loss": 0.6621, "mean_token_accuracy": 0.800847515463829, "num_tokens": 362986105.0, "step": 11374 }, { "entropy": 0.561512011103332, "epoch": 1.0465552239492584, "grad_norm": 0.15617334842681885, "learning_rate": 6.511791946514552e-05, "loss": 0.5632, "mean_token_accuracy": 0.8264914900064468, "num_tokens": 363017510.0, "step": 11375 }, { "entropy": 0.6154231652617455, "epoch": 1.0466472303206997, "grad_norm": 0.1526922881603241, "learning_rate": 6.51148526390039e-05, "loss": 0.5986, "mean_token_accuracy": 0.8132420852780342, "num_tokens": 363049881.0, "step": 11376 }, { "entropy": 0.5458917832002044, "epoch": 1.0467392366921409, "grad_norm": 0.1463434249162674, "learning_rate": 6.511178581286227e-05, "loss": 0.5257, "mean_token_accuracy": 0.8412224054336548, "num_tokens": 363081988.0, "step": 11377 }, { "entropy": 0.534812000580132, "epoch": 1.0468312430635822, "grad_norm": 0.14850884675979614, "learning_rate": 6.510871898672064e-05, "loss": 0.5025, "mean_token_accuracy": 0.8429783210158348, "num_tokens": 363114476.0, "step": 11378 }, { "entropy": 0.6627360340207815, "epoch": 1.0469232494350234, "grad_norm": 0.16060467064380646, "learning_rate": 6.510565216057902e-05, "loss": 0.6509, "mean_token_accuracy": 0.8042361736297607, "num_tokens": 363146937.0, "step": 11379 }, { "entropy": 0.6090762475505471, "epoch": 1.0470152558064645, "grad_norm": 0.16238924860954285, "learning_rate": 6.510258533443739e-05, "loss": 0.589, "mean_token_accuracy": 0.8206882327795029, "num_tokens": 363178988.0, "step": 11380 }, { "entropy": 0.6503971740603447, "epoch": 1.0471072621779058, "grad_norm": 0.1513805091381073, "learning_rate": 6.509951850829577e-05, "loss": 0.6182, "mean_token_accuracy": 0.8078080676496029, "num_tokens": 363211104.0, "step": 11381 }, { "entropy": 0.5487975468859076, "epoch": 1.047199268549347, "grad_norm": 0.1512773633003235, "learning_rate": 6.509645168215415e-05, "loss": 0.5303, "mean_token_accuracy": 0.8322135470807552, "num_tokens": 363242291.0, "step": 11382 }, { "entropy": 0.579563157632947, "epoch": 1.0472912749207883, "grad_norm": 0.15228909254074097, "learning_rate": 6.509338485601252e-05, "loss": 0.5629, "mean_token_accuracy": 0.8264209479093552, "num_tokens": 363274152.0, "step": 11383 }, { "entropy": 0.6162634734064341, "epoch": 1.0473832812922295, "grad_norm": 0.14861229062080383, "learning_rate": 6.509031802987089e-05, "loss": 0.611, "mean_token_accuracy": 0.8126746490597725, "num_tokens": 363306817.0, "step": 11384 }, { "entropy": 0.6078766463324428, "epoch": 1.0474752876636706, "grad_norm": 0.1599850356578827, "learning_rate": 6.508725120372925e-05, "loss": 0.5947, "mean_token_accuracy": 0.8157589621841908, "num_tokens": 363339314.0, "step": 11385 }, { "entropy": 0.6052808333188295, "epoch": 1.047567294035112, "grad_norm": 0.15287961065769196, "learning_rate": 6.508418437758765e-05, "loss": 0.5901, "mean_token_accuracy": 0.8184751123189926, "num_tokens": 363371759.0, "step": 11386 }, { "entropy": 0.5558225614950061, "epoch": 1.047659300406553, "grad_norm": 0.1629764437675476, "learning_rate": 6.508111755144602e-05, "loss": 0.5609, "mean_token_accuracy": 0.8249412551522255, "num_tokens": 363402221.0, "step": 11387 }, { "entropy": 0.5525262001901865, "epoch": 1.0477513067779944, "grad_norm": 0.15481343865394592, "learning_rate": 6.507805072530438e-05, "loss": 0.5477, "mean_token_accuracy": 0.8304296247661114, "num_tokens": 363433731.0, "step": 11388 }, { "entropy": 0.5358664095401764, "epoch": 1.0478433131494356, "grad_norm": 0.15451189875602722, "learning_rate": 6.507498389916275e-05, "loss": 0.5079, "mean_token_accuracy": 0.8407602943480015, "num_tokens": 363466165.0, "step": 11389 }, { "entropy": 0.5839177342131734, "epoch": 1.0479353195208767, "grad_norm": 0.15513983368873596, "learning_rate": 6.507191707302113e-05, "loss": 0.5796, "mean_token_accuracy": 0.8211032710969448, "num_tokens": 363498189.0, "step": 11390 }, { "entropy": 0.6270215706899762, "epoch": 1.048027325892318, "grad_norm": 0.15259040892124176, "learning_rate": 6.506885024687952e-05, "loss": 0.6222, "mean_token_accuracy": 0.8118256889283657, "num_tokens": 363529917.0, "step": 11391 }, { "entropy": 0.6200581416487694, "epoch": 1.0481193322637592, "grad_norm": 0.1616324782371521, "learning_rate": 6.506578342073788e-05, "loss": 0.6077, "mean_token_accuracy": 0.811031848192215, "num_tokens": 363561095.0, "step": 11392 }, { "entropy": 0.5321970013901591, "epoch": 1.0482113386352006, "grad_norm": 0.1482274979352951, "learning_rate": 6.506271659459625e-05, "loss": 0.5276, "mean_token_accuracy": 0.8340355828404427, "num_tokens": 363593459.0, "step": 11393 }, { "entropy": 0.6453676223754883, "epoch": 1.0483033450066417, "grad_norm": 0.16885577142238617, "learning_rate": 6.505964976845463e-05, "loss": 0.6489, "mean_token_accuracy": 0.8024999983608723, "num_tokens": 363624855.0, "step": 11394 }, { "entropy": 0.6548293363302946, "epoch": 1.0483953513780828, "grad_norm": 0.1533888727426529, "learning_rate": 6.5056582942313e-05, "loss": 0.6468, "mean_token_accuracy": 0.8014822714030743, "num_tokens": 363656498.0, "step": 11395 }, { "entropy": 0.6523930812254548, "epoch": 1.0484873577495242, "grad_norm": 0.17752349376678467, "learning_rate": 6.505351611617138e-05, "loss": 0.6574, "mean_token_accuracy": 0.7999953739345074, "num_tokens": 363688632.0, "step": 11396 }, { "entropy": 0.6131954109296203, "epoch": 1.0485793641209653, "grad_norm": 0.1550181359052658, "learning_rate": 6.505044929002975e-05, "loss": 0.6216, "mean_token_accuracy": 0.8130483664572239, "num_tokens": 363720558.0, "step": 11397 }, { "entropy": 0.5840537641197443, "epoch": 1.0486713704924067, "grad_norm": 0.1643660068511963, "learning_rate": 6.504738246388813e-05, "loss": 0.5664, "mean_token_accuracy": 0.8201086819171906, "num_tokens": 363752629.0, "step": 11398 }, { "entropy": 0.6238615792244673, "epoch": 1.0487633768638478, "grad_norm": 0.16380460560321808, "learning_rate": 6.50443156377465e-05, "loss": 0.5857, "mean_token_accuracy": 0.8153411746025085, "num_tokens": 363784473.0, "step": 11399 }, { "entropy": 0.5458680093288422, "epoch": 1.048855383235289, "grad_norm": 0.15095660090446472, "learning_rate": 6.504124881160487e-05, "loss": 0.5101, "mean_token_accuracy": 0.8369912542402744, "num_tokens": 363815448.0, "step": 11400 }, { "entropy": 0.6456878865137696, "epoch": 1.0489473896067303, "grad_norm": 0.1582343429327011, "learning_rate": 6.503818198546325e-05, "loss": 0.6186, "mean_token_accuracy": 0.81131911277771, "num_tokens": 363847809.0, "step": 11401 }, { "entropy": 0.7851273603737354, "epoch": 1.0490393959781714, "grad_norm": 0.15656065940856934, "learning_rate": 6.503511515932163e-05, "loss": 0.7698, "mean_token_accuracy": 0.7678992412984371, "num_tokens": 363880185.0, "step": 11402 }, { "entropy": 0.6963729951530695, "epoch": 1.0491314023496128, "grad_norm": 0.15824255347251892, "learning_rate": 6.503204833318e-05, "loss": 0.6689, "mean_token_accuracy": 0.7995501272380352, "num_tokens": 363911308.0, "step": 11403 }, { "entropy": 0.5890619242563844, "epoch": 1.049223408721054, "grad_norm": 0.1517166644334793, "learning_rate": 6.502898150703837e-05, "loss": 0.5709, "mean_token_accuracy": 0.8220900520682335, "num_tokens": 363943887.0, "step": 11404 }, { "entropy": 0.6881731264293194, "epoch": 1.0493154150924953, "grad_norm": 0.15675227344036102, "learning_rate": 6.502591468089673e-05, "loss": 0.674, "mean_token_accuracy": 0.7975470162928104, "num_tokens": 363975760.0, "step": 11405 }, { "entropy": 0.6471852473914623, "epoch": 1.0494074214639364, "grad_norm": 0.16173015534877777, "learning_rate": 6.502284785475512e-05, "loss": 0.6438, "mean_token_accuracy": 0.8027476146817207, "num_tokens": 364008410.0, "step": 11406 }, { "entropy": 0.6363593637943268, "epoch": 1.0494994278353775, "grad_norm": 0.14968813955783844, "learning_rate": 6.50197810286135e-05, "loss": 0.6204, "mean_token_accuracy": 0.8104485012590885, "num_tokens": 364040943.0, "step": 11407 }, { "entropy": 0.6776473093777895, "epoch": 1.0495914342068189, "grad_norm": 0.15755045413970947, "learning_rate": 6.501671420247186e-05, "loss": 0.6605, "mean_token_accuracy": 0.7987811975181103, "num_tokens": 364073062.0, "step": 11408 }, { "entropy": 0.5704047251492739, "epoch": 1.04968344057826, "grad_norm": 0.15131087601184845, "learning_rate": 6.501364737633025e-05, "loss": 0.5478, "mean_token_accuracy": 0.8290121592581272, "num_tokens": 364105009.0, "step": 11409 }, { "entropy": 0.538573021069169, "epoch": 1.0497754469497014, "grad_norm": 0.14987801015377045, "learning_rate": 6.501058055018861e-05, "loss": 0.5304, "mean_token_accuracy": 0.8344681486487389, "num_tokens": 364136480.0, "step": 11410 }, { "entropy": 0.6767888758331537, "epoch": 1.0498674533211425, "grad_norm": 0.160080686211586, "learning_rate": 6.500751372404698e-05, "loss": 0.6603, "mean_token_accuracy": 0.7958000786602497, "num_tokens": 364168478.0, "step": 11411 }, { "entropy": 0.6714940965175629, "epoch": 1.0499594596925836, "grad_norm": 0.16177238523960114, "learning_rate": 6.500444689790536e-05, "loss": 0.6688, "mean_token_accuracy": 0.79579097032547, "num_tokens": 364200784.0, "step": 11412 }, { "entropy": 0.47658340679481626, "epoch": 1.050051466064025, "grad_norm": 0.1525873988866806, "learning_rate": 6.500138007176374e-05, "loss": 0.4714, "mean_token_accuracy": 0.8549815379083157, "num_tokens": 364233096.0, "step": 11413 }, { "entropy": 0.6362222153693438, "epoch": 1.0501434724354661, "grad_norm": 0.1554228514432907, "learning_rate": 6.499831324562211e-05, "loss": 0.6216, "mean_token_accuracy": 0.8082991279661655, "num_tokens": 364265077.0, "step": 11414 }, { "entropy": 0.6152723683044314, "epoch": 1.0502354788069075, "grad_norm": 0.16414757072925568, "learning_rate": 6.499524641948048e-05, "loss": 0.5918, "mean_token_accuracy": 0.8192642405629158, "num_tokens": 364297195.0, "step": 11415 }, { "entropy": 0.5170491999015212, "epoch": 1.0503274851783486, "grad_norm": 0.14998678863048553, "learning_rate": 6.499217959333885e-05, "loss": 0.5039, "mean_token_accuracy": 0.8393073379993439, "num_tokens": 364329451.0, "step": 11416 }, { "entropy": 0.5881760595366359, "epoch": 1.0504194915497898, "grad_norm": 0.15749900043010712, "learning_rate": 6.498911276719723e-05, "loss": 0.5719, "mean_token_accuracy": 0.8258674256503582, "num_tokens": 364361404.0, "step": 11417 }, { "entropy": 0.6628879606723785, "epoch": 1.050511497921231, "grad_norm": 0.1667446345090866, "learning_rate": 6.498604594105561e-05, "loss": 0.6403, "mean_token_accuracy": 0.8028820119798183, "num_tokens": 364393103.0, "step": 11418 }, { "entropy": 0.5620206650346518, "epoch": 1.0506035042926722, "grad_norm": 0.1549670249223709, "learning_rate": 6.498297911491398e-05, "loss": 0.538, "mean_token_accuracy": 0.8325112462043762, "num_tokens": 364425325.0, "step": 11419 }, { "entropy": 0.6222828179597855, "epoch": 1.0506955106641136, "grad_norm": 0.15272343158721924, "learning_rate": 6.497991228877235e-05, "loss": 0.6132, "mean_token_accuracy": 0.8119345381855965, "num_tokens": 364457391.0, "step": 11420 }, { "entropy": 0.670191453769803, "epoch": 1.0507875170355547, "grad_norm": 0.15741407871246338, "learning_rate": 6.497684546263073e-05, "loss": 0.6711, "mean_token_accuracy": 0.7968404665589333, "num_tokens": 364489238.0, "step": 11421 }, { "entropy": 0.6151786129921675, "epoch": 1.0508795234069959, "grad_norm": 0.1545073688030243, "learning_rate": 6.49737786364891e-05, "loss": 0.6065, "mean_token_accuracy": 0.8171534761786461, "num_tokens": 364521310.0, "step": 11422 }, { "entropy": 0.48143685702234507, "epoch": 1.0509715297784372, "grad_norm": 0.15412047505378723, "learning_rate": 6.497071181034748e-05, "loss": 0.4708, "mean_token_accuracy": 0.856441680341959, "num_tokens": 364553208.0, "step": 11423 }, { "entropy": 0.5518038030713797, "epoch": 1.0510635361498784, "grad_norm": 0.16590151190757751, "learning_rate": 6.496764498420585e-05, "loss": 0.5376, "mean_token_accuracy": 0.8327039889991283, "num_tokens": 364585093.0, "step": 11424 }, { "entropy": 0.6453018076717854, "epoch": 1.0511555425213197, "grad_norm": 0.15579816699028015, "learning_rate": 6.496457815806423e-05, "loss": 0.62, "mean_token_accuracy": 0.8109638430178165, "num_tokens": 364617247.0, "step": 11425 }, { "entropy": 0.599403889849782, "epoch": 1.0512475488927608, "grad_norm": 0.16371679306030273, "learning_rate": 6.49615113319226e-05, "loss": 0.5949, "mean_token_accuracy": 0.8201431669294834, "num_tokens": 364648988.0, "step": 11426 }, { "entropy": 0.6985520031303167, "epoch": 1.051339555264202, "grad_norm": 0.16643120348453522, "learning_rate": 6.495844450578096e-05, "loss": 0.6841, "mean_token_accuracy": 0.7913945242762566, "num_tokens": 364680305.0, "step": 11427 }, { "entropy": 0.66095139272511, "epoch": 1.0514315616356433, "grad_norm": 0.15751783549785614, "learning_rate": 6.495537767963934e-05, "loss": 0.6525, "mean_token_accuracy": 0.8006252124905586, "num_tokens": 364712065.0, "step": 11428 }, { "entropy": 0.5553001649677753, "epoch": 1.0515235680070845, "grad_norm": 0.15427406132221222, "learning_rate": 6.495231085349773e-05, "loss": 0.5366, "mean_token_accuracy": 0.8348609693348408, "num_tokens": 364743705.0, "step": 11429 }, { "entropy": 0.5332914674654603, "epoch": 1.0516155743785258, "grad_norm": 0.1523066759109497, "learning_rate": 6.494924402735609e-05, "loss": 0.5238, "mean_token_accuracy": 0.8388533480465412, "num_tokens": 364776381.0, "step": 11430 }, { "entropy": 0.618366239592433, "epoch": 1.051707580749967, "grad_norm": 0.1564176082611084, "learning_rate": 6.494617720121446e-05, "loss": 0.6135, "mean_token_accuracy": 0.8139421977102757, "num_tokens": 364808335.0, "step": 11431 }, { "entropy": 0.6617803759872913, "epoch": 1.051799587121408, "grad_norm": 0.16230730712413788, "learning_rate": 6.494311037507283e-05, "loss": 0.645, "mean_token_accuracy": 0.8004652857780457, "num_tokens": 364840423.0, "step": 11432 }, { "entropy": 0.6150843249633908, "epoch": 1.0518915934928494, "grad_norm": 0.15335525572299957, "learning_rate": 6.494004354893122e-05, "loss": 0.5966, "mean_token_accuracy": 0.818917952477932, "num_tokens": 364872048.0, "step": 11433 }, { "entropy": 0.6092608934268355, "epoch": 1.0519835998642906, "grad_norm": 0.15284200012683868, "learning_rate": 6.493697672278959e-05, "loss": 0.5849, "mean_token_accuracy": 0.819420475512743, "num_tokens": 364904228.0, "step": 11434 }, { "entropy": 0.5778341609984636, "epoch": 1.052075606235732, "grad_norm": 0.16060051321983337, "learning_rate": 6.493390989664796e-05, "loss": 0.5625, "mean_token_accuracy": 0.8297654539346695, "num_tokens": 364935623.0, "step": 11435 }, { "entropy": 0.5792207634076476, "epoch": 1.052167612607173, "grad_norm": 0.1688866764307022, "learning_rate": 6.493084307050633e-05, "loss": 0.5635, "mean_token_accuracy": 0.8281609378755093, "num_tokens": 364967590.0, "step": 11436 }, { "entropy": 0.6499683316797018, "epoch": 1.0522596189786142, "grad_norm": 0.16252432763576508, "learning_rate": 6.492777624436471e-05, "loss": 0.6222, "mean_token_accuracy": 0.8106291890144348, "num_tokens": 364999876.0, "step": 11437 }, { "entropy": 0.5336073017679155, "epoch": 1.0523516253500556, "grad_norm": 0.15273095667362213, "learning_rate": 6.492470941822309e-05, "loss": 0.516, "mean_token_accuracy": 0.8439262621104717, "num_tokens": 365031580.0, "step": 11438 }, { "entropy": 0.6080591045320034, "epoch": 1.0524436317214967, "grad_norm": 0.18678493797779083, "learning_rate": 6.492164259208146e-05, "loss": 0.5816, "mean_token_accuracy": 0.820291556417942, "num_tokens": 365063629.0, "step": 11439 }, { "entropy": 0.6720459721982479, "epoch": 1.052535638092938, "grad_norm": 0.15711310505867004, "learning_rate": 6.491857576593984e-05, "loss": 0.6603, "mean_token_accuracy": 0.7955826036632061, "num_tokens": 365094763.0, "step": 11440 }, { "entropy": 0.6508864387869835, "epoch": 1.0526276444643792, "grad_norm": 0.16412372887134552, "learning_rate": 6.491550893979821e-05, "loss": 0.6383, "mean_token_accuracy": 0.8075405061244965, "num_tokens": 365126589.0, "step": 11441 }, { "entropy": 0.5311248833313584, "epoch": 1.0527196508358203, "grad_norm": 0.15657122433185577, "learning_rate": 6.491244211365658e-05, "loss": 0.5121, "mean_token_accuracy": 0.8408185541629791, "num_tokens": 365157666.0, "step": 11442 }, { "entropy": 0.6200449662283063, "epoch": 1.0528116572072617, "grad_norm": 0.15368010103702545, "learning_rate": 6.490937528751496e-05, "loss": 0.5916, "mean_token_accuracy": 0.8181966580450535, "num_tokens": 365189876.0, "step": 11443 }, { "entropy": 0.6649383716285229, "epoch": 1.0529036635787028, "grad_norm": 0.16044892370700836, "learning_rate": 6.490630846137334e-05, "loss": 0.6582, "mean_token_accuracy": 0.7969166412949562, "num_tokens": 365222098.0, "step": 11444 }, { "entropy": 0.5905695641413331, "epoch": 1.0529956699501442, "grad_norm": 0.15867389738559723, "learning_rate": 6.49032416352317e-05, "loss": 0.5749, "mean_token_accuracy": 0.8222676552832127, "num_tokens": 365254560.0, "step": 11445 }, { "entropy": 0.5995423160493374, "epoch": 1.0530876763215853, "grad_norm": 0.16280873119831085, "learning_rate": 6.490017480909007e-05, "loss": 0.567, "mean_token_accuracy": 0.8222132846713066, "num_tokens": 365286094.0, "step": 11446 }, { "entropy": 0.7026238515973091, "epoch": 1.0531796826930264, "grad_norm": 0.15886031091213226, "learning_rate": 6.489710798294844e-05, "loss": 0.6742, "mean_token_accuracy": 0.789745669811964, "num_tokens": 365317490.0, "step": 11447 }, { "entropy": 0.62220817245543, "epoch": 1.0532716890644678, "grad_norm": 0.17237821221351624, "learning_rate": 6.489404115680682e-05, "loss": 0.5958, "mean_token_accuracy": 0.815756231546402, "num_tokens": 365348776.0, "step": 11448 }, { "entropy": 0.603271808475256, "epoch": 1.053363695435909, "grad_norm": 0.1522413194179535, "learning_rate": 6.48909743306652e-05, "loss": 0.5843, "mean_token_accuracy": 0.8188003227114677, "num_tokens": 365380953.0, "step": 11449 }, { "entropy": 0.744919516146183, "epoch": 1.0534557018073503, "grad_norm": 0.16073289513587952, "learning_rate": 6.488790750452357e-05, "loss": 0.7415, "mean_token_accuracy": 0.7769869454205036, "num_tokens": 365413211.0, "step": 11450 }, { "entropy": 0.7036219676956534, "epoch": 1.0535477081787914, "grad_norm": 0.1667218655347824, "learning_rate": 6.488484067838194e-05, "loss": 0.6928, "mean_token_accuracy": 0.7896980419754982, "num_tokens": 365444622.0, "step": 11451 }, { "entropy": 0.6616778858006, "epoch": 1.0536397145502325, "grad_norm": 0.15957853198051453, "learning_rate": 6.488177385224032e-05, "loss": 0.6421, "mean_token_accuracy": 0.8012591674923897, "num_tokens": 365476332.0, "step": 11452 }, { "entropy": 0.7366012325510383, "epoch": 1.0537317209216739, "grad_norm": 0.16776402294635773, "learning_rate": 6.487870702609869e-05, "loss": 0.7209, "mean_token_accuracy": 0.784818485379219, "num_tokens": 365508678.0, "step": 11453 }, { "entropy": 0.6036098822951317, "epoch": 1.053823727293115, "grad_norm": 0.15691295266151428, "learning_rate": 6.487564019995707e-05, "loss": 0.5903, "mean_token_accuracy": 0.818221140652895, "num_tokens": 365540986.0, "step": 11454 }, { "entropy": 0.5597520302981138, "epoch": 1.0539157336645564, "grad_norm": 0.1555941104888916, "learning_rate": 6.487257337381544e-05, "loss": 0.5523, "mean_token_accuracy": 0.8299459777772427, "num_tokens": 365573357.0, "step": 11455 }, { "entropy": 0.7120181117206812, "epoch": 1.0540077400359975, "grad_norm": 0.1715201735496521, "learning_rate": 6.486950654767382e-05, "loss": 0.7061, "mean_token_accuracy": 0.7834617793560028, "num_tokens": 365604784.0, "step": 11456 }, { "entropy": 0.6079757381230593, "epoch": 1.0540997464074386, "grad_norm": 0.16301171481609344, "learning_rate": 6.486643972153219e-05, "loss": 0.5877, "mean_token_accuracy": 0.821682084351778, "num_tokens": 365637345.0, "step": 11457 }, { "entropy": 0.6263370662927628, "epoch": 1.05419175277888, "grad_norm": 0.16043967008590698, "learning_rate": 6.486337289539056e-05, "loss": 0.6326, "mean_token_accuracy": 0.8075398653745651, "num_tokens": 365669251.0, "step": 11458 }, { "entropy": 0.696970833465457, "epoch": 1.0542837591503211, "grad_norm": 0.1733854115009308, "learning_rate": 6.486030606924894e-05, "loss": 0.6878, "mean_token_accuracy": 0.793230127543211, "num_tokens": 365700533.0, "step": 11459 }, { "entropy": 0.6202390226535499, "epoch": 1.0543757655217625, "grad_norm": 0.15885810554027557, "learning_rate": 6.485723924310732e-05, "loss": 0.6072, "mean_token_accuracy": 0.8134983032941818, "num_tokens": 365732259.0, "step": 11460 }, { "entropy": 0.6466219034045935, "epoch": 1.0544677718932036, "grad_norm": 0.16060087084770203, "learning_rate": 6.485417241696569e-05, "loss": 0.6261, "mean_token_accuracy": 0.8088178224861622, "num_tokens": 365764769.0, "step": 11461 }, { "entropy": 0.5861257575452328, "epoch": 1.0545597782646448, "grad_norm": 0.1702958047389984, "learning_rate": 6.485110559082405e-05, "loss": 0.5813, "mean_token_accuracy": 0.8228589184582233, "num_tokens": 365796961.0, "step": 11462 }, { "entropy": 0.592181982472539, "epoch": 1.054651784636086, "grad_norm": 0.15447190403938293, "learning_rate": 6.484803876468242e-05, "loss": 0.5678, "mean_token_accuracy": 0.8252751305699348, "num_tokens": 365828871.0, "step": 11463 }, { "entropy": 0.5563176143914461, "epoch": 1.0547437910075272, "grad_norm": 0.15176764130592346, "learning_rate": 6.48449719385408e-05, "loss": 0.5406, "mean_token_accuracy": 0.8302204087376595, "num_tokens": 365861186.0, "step": 11464 }, { "entropy": 0.7178669571876526, "epoch": 1.0548357973789686, "grad_norm": 0.15300790965557098, "learning_rate": 6.484190511239919e-05, "loss": 0.6955, "mean_token_accuracy": 0.7860890477895737, "num_tokens": 365893808.0, "step": 11465 }, { "entropy": 0.538854718208313, "epoch": 1.0549278037504097, "grad_norm": 0.1524760127067566, "learning_rate": 6.483883828625755e-05, "loss": 0.5255, "mean_token_accuracy": 0.8355808183550835, "num_tokens": 365925625.0, "step": 11466 }, { "entropy": 0.5457146437838674, "epoch": 1.0550198101218509, "grad_norm": 0.1523897796869278, "learning_rate": 6.483577146011592e-05, "loss": 0.5303, "mean_token_accuracy": 0.8391873240470886, "num_tokens": 365957959.0, "step": 11467 }, { "entropy": 0.6861556228250265, "epoch": 1.0551118164932922, "grad_norm": 0.1609906405210495, "learning_rate": 6.48327046339743e-05, "loss": 0.6871, "mean_token_accuracy": 0.7926273979246616, "num_tokens": 365990294.0, "step": 11468 }, { "entropy": 0.5232018399983644, "epoch": 1.0552038228647334, "grad_norm": 0.14434270560741425, "learning_rate": 6.482963780783267e-05, "loss": 0.5139, "mean_token_accuracy": 0.8402024358510971, "num_tokens": 366022784.0, "step": 11469 }, { "entropy": 0.6005763709545135, "epoch": 1.0552958292361747, "grad_norm": 0.15614847838878632, "learning_rate": 6.482657098169105e-05, "loss": 0.5917, "mean_token_accuracy": 0.8170373439788818, "num_tokens": 366055147.0, "step": 11470 }, { "entropy": 0.6486760023981333, "epoch": 1.0553878356076158, "grad_norm": 0.15694381296634674, "learning_rate": 6.482350415554943e-05, "loss": 0.6266, "mean_token_accuracy": 0.8116098307073116, "num_tokens": 366086875.0, "step": 11471 }, { "entropy": 0.617978673428297, "epoch": 1.055479841979057, "grad_norm": 0.15466374158859253, "learning_rate": 6.48204373294078e-05, "loss": 0.5993, "mean_token_accuracy": 0.8134466893970966, "num_tokens": 366118299.0, "step": 11472 }, { "entropy": 0.6101607289165258, "epoch": 1.0555718483504983, "grad_norm": 0.16175709664821625, "learning_rate": 6.481737050326617e-05, "loss": 0.597, "mean_token_accuracy": 0.8210935331881046, "num_tokens": 366150041.0, "step": 11473 }, { "entropy": 0.6031465716660023, "epoch": 1.0556638547219395, "grad_norm": 0.16499513387680054, "learning_rate": 6.481430367712455e-05, "loss": 0.5939, "mean_token_accuracy": 0.8155688717961311, "num_tokens": 366182210.0, "step": 11474 }, { "entropy": 0.5840566302649677, "epoch": 1.0557558610933808, "grad_norm": 0.15060190856456757, "learning_rate": 6.481123685098293e-05, "loss": 0.5679, "mean_token_accuracy": 0.8234964236617088, "num_tokens": 366214412.0, "step": 11475 }, { "entropy": 0.6640490079298615, "epoch": 1.055847867464822, "grad_norm": 0.16135062277317047, "learning_rate": 6.48081700248413e-05, "loss": 0.6414, "mean_token_accuracy": 0.8058769255876541, "num_tokens": 366246492.0, "step": 11476 }, { "entropy": 0.6991221755743027, "epoch": 1.055939873836263, "grad_norm": 0.165602907538414, "learning_rate": 6.480510319869967e-05, "loss": 0.6986, "mean_token_accuracy": 0.7885986492037773, "num_tokens": 366278350.0, "step": 11477 }, { "entropy": 0.5016881646588445, "epoch": 1.0560318802077044, "grad_norm": 0.14411412179470062, "learning_rate": 6.480203637255804e-05, "loss": 0.4753, "mean_token_accuracy": 0.848770622164011, "num_tokens": 366310489.0, "step": 11478 }, { "entropy": 0.5861703921109438, "epoch": 1.0561238865791456, "grad_norm": 0.1534552276134491, "learning_rate": 6.479896954641642e-05, "loss": 0.582, "mean_token_accuracy": 0.8210376724600792, "num_tokens": 366342427.0, "step": 11479 }, { "entropy": 0.6797659546136856, "epoch": 1.056215892950587, "grad_norm": 0.1593485176563263, "learning_rate": 6.47959027202748e-05, "loss": 0.6635, "mean_token_accuracy": 0.7960436344146729, "num_tokens": 366374871.0, "step": 11480 }, { "entropy": 0.6361502222716808, "epoch": 1.056307899322028, "grad_norm": 0.15999962389469147, "learning_rate": 6.479283589413317e-05, "loss": 0.625, "mean_token_accuracy": 0.808661513030529, "num_tokens": 366406572.0, "step": 11481 }, { "entropy": 0.6209884798154235, "epoch": 1.0563999056934692, "grad_norm": 0.15616589784622192, "learning_rate": 6.478976906799153e-05, "loss": 0.6061, "mean_token_accuracy": 0.8120869100093842, "num_tokens": 366438949.0, "step": 11482 }, { "entropy": 0.6283762296661735, "epoch": 1.0564919120649106, "grad_norm": 0.157831072807312, "learning_rate": 6.478670224184992e-05, "loss": 0.6113, "mean_token_accuracy": 0.8126362971961498, "num_tokens": 366470022.0, "step": 11483 }, { "entropy": 0.6398956999182701, "epoch": 1.0565839184363517, "grad_norm": 0.1520375907421112, "learning_rate": 6.478363541570828e-05, "loss": 0.614, "mean_token_accuracy": 0.8123543560504913, "num_tokens": 366502119.0, "step": 11484 }, { "entropy": 0.6121013532392681, "epoch": 1.056675924807793, "grad_norm": 0.15726704895496368, "learning_rate": 6.478056858956666e-05, "loss": 0.6074, "mean_token_accuracy": 0.810021635144949, "num_tokens": 366533564.0, "step": 11485 }, { "entropy": 0.639546986669302, "epoch": 1.0567679311792342, "grad_norm": 0.16478601098060608, "learning_rate": 6.477750176342503e-05, "loss": 0.6224, "mean_token_accuracy": 0.8084999397397041, "num_tokens": 366565626.0, "step": 11486 }, { "entropy": 0.5554078258574009, "epoch": 1.0568599375506753, "grad_norm": 0.1678774207830429, "learning_rate": 6.477443493728341e-05, "loss": 0.5486, "mean_token_accuracy": 0.8334452845156193, "num_tokens": 366598394.0, "step": 11487 }, { "entropy": 0.6281374003738165, "epoch": 1.0569519439221167, "grad_norm": 0.1551823616027832, "learning_rate": 6.477136811114178e-05, "loss": 0.6221, "mean_token_accuracy": 0.8076685853302479, "num_tokens": 366630410.0, "step": 11488 }, { "entropy": 0.6575850276276469, "epoch": 1.0570439502935578, "grad_norm": 0.16264264285564423, "learning_rate": 6.476830128500015e-05, "loss": 0.6367, "mean_token_accuracy": 0.8046320974826813, "num_tokens": 366661907.0, "step": 11489 }, { "entropy": 0.6085373666137457, "epoch": 1.0571359566649992, "grad_norm": 0.16177916526794434, "learning_rate": 6.476523445885853e-05, "loss": 0.5967, "mean_token_accuracy": 0.8159943632781506, "num_tokens": 366693539.0, "step": 11490 }, { "entropy": 0.6654332475736737, "epoch": 1.0572279630364403, "grad_norm": 0.16917279362678528, "learning_rate": 6.476216763271691e-05, "loss": 0.6498, "mean_token_accuracy": 0.8033435679972172, "num_tokens": 366725702.0, "step": 11491 }, { "entropy": 0.6620098669081926, "epoch": 1.0573199694078814, "grad_norm": 0.16638052463531494, "learning_rate": 6.475910080657528e-05, "loss": 0.663, "mean_token_accuracy": 0.7951421327888966, "num_tokens": 366757061.0, "step": 11492 }, { "entropy": 0.6006533335894346, "epoch": 1.0574119757793228, "grad_norm": 0.15395039319992065, "learning_rate": 6.475603398043365e-05, "loss": 0.5814, "mean_token_accuracy": 0.8244869560003281, "num_tokens": 366789202.0, "step": 11493 }, { "entropy": 0.566552366130054, "epoch": 1.057503982150764, "grad_norm": 0.15357200801372528, "learning_rate": 6.475296715429202e-05, "loss": 0.5426, "mean_token_accuracy": 0.8338248766958714, "num_tokens": 366821412.0, "step": 11494 }, { "entropy": 0.6269537284970284, "epoch": 1.0575959885222053, "grad_norm": 0.1563967913389206, "learning_rate": 6.47499003281504e-05, "loss": 0.626, "mean_token_accuracy": 0.8061735145747662, "num_tokens": 366853778.0, "step": 11495 }, { "entropy": 0.6168107502162457, "epoch": 1.0576879948936464, "grad_norm": 0.1582166701555252, "learning_rate": 6.474683350200878e-05, "loss": 0.6086, "mean_token_accuracy": 0.8098671138286591, "num_tokens": 366885912.0, "step": 11496 }, { "entropy": 0.6277752406895161, "epoch": 1.0577800012650875, "grad_norm": 0.1716056764125824, "learning_rate": 6.474376667586715e-05, "loss": 0.6149, "mean_token_accuracy": 0.8101401478052139, "num_tokens": 366918278.0, "step": 11497 }, { "entropy": 0.6201385837048292, "epoch": 1.0578720076365289, "grad_norm": 0.1522868424654007, "learning_rate": 6.474069984972551e-05, "loss": 0.6066, "mean_token_accuracy": 0.8133906610310078, "num_tokens": 366950558.0, "step": 11498 }, { "entropy": 0.6781242080032825, "epoch": 1.05796401400797, "grad_norm": 0.15657739341259003, "learning_rate": 6.47376330235839e-05, "loss": 0.6528, "mean_token_accuracy": 0.8008961118757725, "num_tokens": 366983252.0, "step": 11499 }, { "entropy": 0.5758312745019794, "epoch": 1.0580560203794114, "grad_norm": 0.15020142495632172, "learning_rate": 6.473456619744226e-05, "loss": 0.5635, "mean_token_accuracy": 0.8250300697982311, "num_tokens": 367015221.0, "step": 11500 }, { "entropy": 0.5810476038604975, "epoch": 1.0581480267508525, "grad_norm": 0.15708905458450317, "learning_rate": 6.473149937130065e-05, "loss": 0.5539, "mean_token_accuracy": 0.8290615305304527, "num_tokens": 367047542.0, "step": 11501 }, { "entropy": 0.7193429972976446, "epoch": 1.0582400331222936, "grad_norm": 0.17409391701221466, "learning_rate": 6.472843254515903e-05, "loss": 0.7157, "mean_token_accuracy": 0.7840334326028824, "num_tokens": 367079043.0, "step": 11502 }, { "entropy": 0.6937735229730606, "epoch": 1.058332039493735, "grad_norm": 0.17210322618484497, "learning_rate": 6.47253657190174e-05, "loss": 0.7032, "mean_token_accuracy": 0.7882221229374409, "num_tokens": 367111121.0, "step": 11503 }, { "entropy": 0.6074908766895533, "epoch": 1.0584240458651761, "grad_norm": 0.1623196005821228, "learning_rate": 6.472229889287576e-05, "loss": 0.5926, "mean_token_accuracy": 0.8200472295284271, "num_tokens": 367143101.0, "step": 11504 }, { "entropy": 0.6606934145092964, "epoch": 1.0585160522366175, "grad_norm": 0.15984536707401276, "learning_rate": 6.471923206673413e-05, "loss": 0.647, "mean_token_accuracy": 0.8020777218043804, "num_tokens": 367174491.0, "step": 11505 }, { "entropy": 0.6960956836119294, "epoch": 1.0586080586080586, "grad_norm": 0.16457054018974304, "learning_rate": 6.471616524059253e-05, "loss": 0.6818, "mean_token_accuracy": 0.7928864322602749, "num_tokens": 367206931.0, "step": 11506 }, { "entropy": 0.5857688244432211, "epoch": 1.0587000649794998, "grad_norm": 0.15569522976875305, "learning_rate": 6.47130984144509e-05, "loss": 0.5803, "mean_token_accuracy": 0.8186010271310806, "num_tokens": 367238592.0, "step": 11507 }, { "entropy": 0.647826362401247, "epoch": 1.058792071350941, "grad_norm": 0.16065716743469238, "learning_rate": 6.471003158830926e-05, "loss": 0.6399, "mean_token_accuracy": 0.8006436787545681, "num_tokens": 367269341.0, "step": 11508 }, { "entropy": 0.5808493252843618, "epoch": 1.0588840777223822, "grad_norm": 0.172527015209198, "learning_rate": 6.470696476216763e-05, "loss": 0.5793, "mean_token_accuracy": 0.823421835899353, "num_tokens": 367300071.0, "step": 11509 }, { "entropy": 0.6119796521961689, "epoch": 1.0589760840938236, "grad_norm": 0.15544529259204865, "learning_rate": 6.470389793602601e-05, "loss": 0.5996, "mean_token_accuracy": 0.8123333007097244, "num_tokens": 367332618.0, "step": 11510 }, { "entropy": 0.5743270721286535, "epoch": 1.0590680904652647, "grad_norm": 0.16254781186580658, "learning_rate": 6.470083110988439e-05, "loss": 0.5646, "mean_token_accuracy": 0.8273755013942719, "num_tokens": 367365326.0, "step": 11511 }, { "entropy": 0.565783528611064, "epoch": 1.0591600968367059, "grad_norm": 0.1497086137533188, "learning_rate": 6.469776428374276e-05, "loss": 0.5606, "mean_token_accuracy": 0.8292074464261532, "num_tokens": 367397555.0, "step": 11512 }, { "entropy": 0.6008274229243398, "epoch": 1.0592521032081472, "grad_norm": 0.15726228058338165, "learning_rate": 6.469469745760113e-05, "loss": 0.5978, "mean_token_accuracy": 0.8188272677361965, "num_tokens": 367429956.0, "step": 11513 }, { "entropy": 0.6261375658214092, "epoch": 1.0593441095795884, "grad_norm": 0.15375672280788422, "learning_rate": 6.469163063145951e-05, "loss": 0.6151, "mean_token_accuracy": 0.8107660971581936, "num_tokens": 367462690.0, "step": 11514 }, { "entropy": 0.6685594618320465, "epoch": 1.0594361159510297, "grad_norm": 0.15579469501972198, "learning_rate": 6.468856380531788e-05, "loss": 0.6301, "mean_token_accuracy": 0.8053967989981174, "num_tokens": 367494380.0, "step": 11515 }, { "entropy": 0.5597274685278535, "epoch": 1.0595281223224708, "grad_norm": 0.1679033488035202, "learning_rate": 6.468549697917626e-05, "loss": 0.5402, "mean_token_accuracy": 0.8351445868611336, "num_tokens": 367526558.0, "step": 11516 }, { "entropy": 0.6005108635872602, "epoch": 1.059620128693912, "grad_norm": 0.14408685266971588, "learning_rate": 6.468243015303463e-05, "loss": 0.5716, "mean_token_accuracy": 0.8209397010505199, "num_tokens": 367559145.0, "step": 11517 }, { "entropy": 0.6345889009535313, "epoch": 1.0597121350653533, "grad_norm": 0.1554761379957199, "learning_rate": 6.467936332689301e-05, "loss": 0.6177, "mean_token_accuracy": 0.8124108463525772, "num_tokens": 367591398.0, "step": 11518 }, { "entropy": 0.592604398727417, "epoch": 1.0598041414367945, "grad_norm": 0.16029484570026398, "learning_rate": 6.467629650075138e-05, "loss": 0.5774, "mean_token_accuracy": 0.8208790346980095, "num_tokens": 367622636.0, "step": 11519 }, { "entropy": 0.6592225264757872, "epoch": 1.0598961478082358, "grad_norm": 0.15441328287124634, "learning_rate": 6.467322967460974e-05, "loss": 0.6358, "mean_token_accuracy": 0.8039691224694252, "num_tokens": 367655182.0, "step": 11520 }, { "entropy": 0.6515316413715482, "epoch": 1.059988154179677, "grad_norm": 0.16234493255615234, "learning_rate": 6.467016284846812e-05, "loss": 0.6406, "mean_token_accuracy": 0.8038494065403938, "num_tokens": 367687580.0, "step": 11521 }, { "entropy": 0.5243578841909766, "epoch": 1.060080160551118, "grad_norm": 0.15379688143730164, "learning_rate": 6.46670960223265e-05, "loss": 0.5073, "mean_token_accuracy": 0.8426318764686584, "num_tokens": 367719253.0, "step": 11522 }, { "entropy": 0.6626626662909985, "epoch": 1.0601721669225594, "grad_norm": 0.16241474449634552, "learning_rate": 6.466402919618487e-05, "loss": 0.6613, "mean_token_accuracy": 0.7971420437097549, "num_tokens": 367751279.0, "step": 11523 }, { "entropy": 0.5880952775478363, "epoch": 1.0602641732940006, "grad_norm": 0.15458934009075165, "learning_rate": 6.466096237004324e-05, "loss": 0.5671, "mean_token_accuracy": 0.8219123519957066, "num_tokens": 367783003.0, "step": 11524 }, { "entropy": 0.5741651421412826, "epoch": 1.060356179665442, "grad_norm": 0.15259051322937012, "learning_rate": 6.465789554390161e-05, "loss": 0.5657, "mean_token_accuracy": 0.8259706199169159, "num_tokens": 367815339.0, "step": 11525 }, { "entropy": 0.6429525800049305, "epoch": 1.060448186036883, "grad_norm": 0.16050109267234802, "learning_rate": 6.465482871775999e-05, "loss": 0.6298, "mean_token_accuracy": 0.8096207231283188, "num_tokens": 367847687.0, "step": 11526 }, { "entropy": 0.5803962098434567, "epoch": 1.0605401924083242, "grad_norm": 0.1490607112646103, "learning_rate": 6.465176189161837e-05, "loss": 0.5707, "mean_token_accuracy": 0.8200720474123955, "num_tokens": 367880455.0, "step": 11527 }, { "entropy": 0.7066553300246596, "epoch": 1.0606321987797656, "grad_norm": 0.16702444851398468, "learning_rate": 6.464869506547674e-05, "loss": 0.6905, "mean_token_accuracy": 0.7912511266767979, "num_tokens": 367912305.0, "step": 11528 }, { "entropy": 0.662000959739089, "epoch": 1.0607242051512067, "grad_norm": 0.1649908423423767, "learning_rate": 6.464562823933511e-05, "loss": 0.6654, "mean_token_accuracy": 0.8030708357691765, "num_tokens": 367944649.0, "step": 11529 }, { "entropy": 0.614757064729929, "epoch": 1.060816211522648, "grad_norm": 0.1681906282901764, "learning_rate": 6.464256141319349e-05, "loss": 0.6062, "mean_token_accuracy": 0.8122021295130253, "num_tokens": 367976473.0, "step": 11530 }, { "entropy": 0.709778256714344, "epoch": 1.0609082178940892, "grad_norm": 0.18513475358486176, "learning_rate": 6.463949458705186e-05, "loss": 0.7127, "mean_token_accuracy": 0.785390317440033, "num_tokens": 368007624.0, "step": 11531 }, { "entropy": 0.72544976323843, "epoch": 1.0610002242655303, "grad_norm": 0.1678742617368698, "learning_rate": 6.463642776091024e-05, "loss": 0.7133, "mean_token_accuracy": 0.7822572253644466, "num_tokens": 368039530.0, "step": 11532 }, { "entropy": 0.5854614544659853, "epoch": 1.0610922306369717, "grad_norm": 0.1498972326517105, "learning_rate": 6.463336093476862e-05, "loss": 0.5532, "mean_token_accuracy": 0.8293047808110714, "num_tokens": 368071885.0, "step": 11533 }, { "entropy": 0.6775152441114187, "epoch": 1.0611842370084128, "grad_norm": 0.16292040050029755, "learning_rate": 6.463029410862699e-05, "loss": 0.6669, "mean_token_accuracy": 0.7977136448025703, "num_tokens": 368104294.0, "step": 11534 }, { "entropy": 0.6887227948755026, "epoch": 1.0612762433798542, "grad_norm": 0.16800954937934875, "learning_rate": 6.462722728248536e-05, "loss": 0.6714, "mean_token_accuracy": 0.7981694936752319, "num_tokens": 368136326.0, "step": 11535 }, { "entropy": 0.48423549998551607, "epoch": 1.0613682497512953, "grad_norm": 0.1507328301668167, "learning_rate": 6.462416045634372e-05, "loss": 0.4735, "mean_token_accuracy": 0.8536249957978725, "num_tokens": 368168384.0, "step": 11536 }, { "entropy": 0.682150486856699, "epoch": 1.0614602561227364, "grad_norm": 0.16000638902187347, "learning_rate": 6.46210936302021e-05, "loss": 0.6529, "mean_token_accuracy": 0.7986220642924309, "num_tokens": 368200479.0, "step": 11537 }, { "entropy": 0.5524875465780497, "epoch": 1.0615522624941778, "grad_norm": 0.1488371044397354, "learning_rate": 6.461802680406049e-05, "loss": 0.5316, "mean_token_accuracy": 0.8352935537695885, "num_tokens": 368232817.0, "step": 11538 }, { "entropy": 0.7003696374595165, "epoch": 1.061644268865619, "grad_norm": 0.1670401394367218, "learning_rate": 6.461495997791886e-05, "loss": 0.7014, "mean_token_accuracy": 0.7914176657795906, "num_tokens": 368264439.0, "step": 11539 }, { "entropy": 0.712976137176156, "epoch": 1.0617362752370603, "grad_norm": 0.16605478525161743, "learning_rate": 6.461189315177722e-05, "loss": 0.7033, "mean_token_accuracy": 0.7839868366718292, "num_tokens": 368296348.0, "step": 11540 }, { "entropy": 0.6857746206223965, "epoch": 1.0618282816085014, "grad_norm": 0.1612548828125, "learning_rate": 6.46088263256356e-05, "loss": 0.6716, "mean_token_accuracy": 0.7954084314405918, "num_tokens": 368327583.0, "step": 11541 }, { "entropy": 0.6686652880162001, "epoch": 1.0619202879799425, "grad_norm": 0.15874992311000824, "learning_rate": 6.460575949949397e-05, "loss": 0.6458, "mean_token_accuracy": 0.8022376485168934, "num_tokens": 368359666.0, "step": 11542 }, { "entropy": 0.6560273822396994, "epoch": 1.062012294351384, "grad_norm": 0.1555083841085434, "learning_rate": 6.460269267335235e-05, "loss": 0.6463, "mean_token_accuracy": 0.8036568462848663, "num_tokens": 368391916.0, "step": 11543 }, { "entropy": 0.621699258685112, "epoch": 1.062104300722825, "grad_norm": 0.1514313966035843, "learning_rate": 6.459962584721072e-05, "loss": 0.609, "mean_token_accuracy": 0.809114620089531, "num_tokens": 368424051.0, "step": 11544 }, { "entropy": 0.6723566427826881, "epoch": 1.0621963070942664, "grad_norm": 0.16564278304576874, "learning_rate": 6.45965590210691e-05, "loss": 0.6762, "mean_token_accuracy": 0.794536616653204, "num_tokens": 368456070.0, "step": 11545 }, { "entropy": 0.49571497552096844, "epoch": 1.0622883134657075, "grad_norm": 0.15372534096240997, "learning_rate": 6.459349219492747e-05, "loss": 0.4739, "mean_token_accuracy": 0.8527606278657913, "num_tokens": 368488501.0, "step": 11546 }, { "entropy": 0.5850958302617073, "epoch": 1.0623803198371486, "grad_norm": 0.1599045991897583, "learning_rate": 6.459042536878584e-05, "loss": 0.571, "mean_token_accuracy": 0.8237001411616802, "num_tokens": 368519721.0, "step": 11547 }, { "entropy": 0.6303936038166285, "epoch": 1.06247232620859, "grad_norm": 0.16546770930290222, "learning_rate": 6.458735854264422e-05, "loss": 0.6179, "mean_token_accuracy": 0.8090708926320076, "num_tokens": 368551608.0, "step": 11548 }, { "entropy": 0.5401257737539709, "epoch": 1.0625643325800311, "grad_norm": 0.14839521050453186, "learning_rate": 6.45842917165026e-05, "loss": 0.5295, "mean_token_accuracy": 0.8353700935840607, "num_tokens": 368583341.0, "step": 11549 }, { "entropy": 0.6618144661188126, "epoch": 1.0626563389514725, "grad_norm": 0.16384179890155792, "learning_rate": 6.458122489036097e-05, "loss": 0.6481, "mean_token_accuracy": 0.804459985345602, "num_tokens": 368615699.0, "step": 11550 }, { "entropy": 0.5788997188210487, "epoch": 1.0627483453229136, "grad_norm": 0.17502906918525696, "learning_rate": 6.457815806421934e-05, "loss": 0.5706, "mean_token_accuracy": 0.8244873769581318, "num_tokens": 368647475.0, "step": 11551 }, { "entropy": 0.650476067326963, "epoch": 1.0628403516943548, "grad_norm": 0.15769656002521515, "learning_rate": 6.45750912380777e-05, "loss": 0.6432, "mean_token_accuracy": 0.8050087504088879, "num_tokens": 368679875.0, "step": 11552 }, { "entropy": 0.6292110364884138, "epoch": 1.0629323580657961, "grad_norm": 0.15632644295692444, "learning_rate": 6.45720244119361e-05, "loss": 0.6217, "mean_token_accuracy": 0.8057939074933529, "num_tokens": 368711479.0, "step": 11553 }, { "entropy": 0.6091015841811895, "epoch": 1.0630243644372372, "grad_norm": 0.16359750926494598, "learning_rate": 6.456895758579447e-05, "loss": 0.5859, "mean_token_accuracy": 0.8249770291149616, "num_tokens": 368743450.0, "step": 11554 }, { "entropy": 0.5672963233664632, "epoch": 1.0631163708086786, "grad_norm": 0.1573534607887268, "learning_rate": 6.456589075965284e-05, "loss": 0.5481, "mean_token_accuracy": 0.8354072757065296, "num_tokens": 368775766.0, "step": 11555 }, { "entropy": 0.6002369802445173, "epoch": 1.0632083771801197, "grad_norm": 0.1582612693309784, "learning_rate": 6.45628239335112e-05, "loss": 0.5879, "mean_token_accuracy": 0.8213973343372345, "num_tokens": 368807946.0, "step": 11556 }, { "entropy": 0.5902994852513075, "epoch": 1.0633003835515609, "grad_norm": 0.15616469085216522, "learning_rate": 6.455975710736959e-05, "loss": 0.5644, "mean_token_accuracy": 0.8290104493498802, "num_tokens": 368840276.0, "step": 11557 }, { "entropy": 0.5583338905125856, "epoch": 1.0633923899230022, "grad_norm": 0.14505352079868317, "learning_rate": 6.455669028122797e-05, "loss": 0.5465, "mean_token_accuracy": 0.8319997787475586, "num_tokens": 368872348.0, "step": 11558 }, { "entropy": 0.5943026561290026, "epoch": 1.0634843962944434, "grad_norm": 0.16385997831821442, "learning_rate": 6.455362345508633e-05, "loss": 0.5974, "mean_token_accuracy": 0.8142881616950035, "num_tokens": 368903893.0, "step": 11559 }, { "entropy": 0.6429596859961748, "epoch": 1.0635764026658847, "grad_norm": 0.15957783162593842, "learning_rate": 6.45505566289447e-05, "loss": 0.6251, "mean_token_accuracy": 0.8071904890239239, "num_tokens": 368936016.0, "step": 11560 }, { "entropy": 0.6018205843865871, "epoch": 1.0636684090373258, "grad_norm": 0.15753695368766785, "learning_rate": 6.454748980280308e-05, "loss": 0.5725, "mean_token_accuracy": 0.8207607604563236, "num_tokens": 368967920.0, "step": 11561 }, { "entropy": 0.5891563557088375, "epoch": 1.063760415408767, "grad_norm": 0.16548871994018555, "learning_rate": 6.454442297666145e-05, "loss": 0.5604, "mean_token_accuracy": 0.8260586075484753, "num_tokens": 369000312.0, "step": 11562 }, { "entropy": 0.6878458056598902, "epoch": 1.0638524217802083, "grad_norm": 0.1632123589515686, "learning_rate": 6.454135615051983e-05, "loss": 0.6915, "mean_token_accuracy": 0.7913385592401028, "num_tokens": 369031893.0, "step": 11563 }, { "entropy": 0.637447876855731, "epoch": 1.0639444281516495, "grad_norm": 0.15807922184467316, "learning_rate": 6.453828932437821e-05, "loss": 0.6322, "mean_token_accuracy": 0.8061257973313332, "num_tokens": 369064098.0, "step": 11564 }, { "entropy": 0.5456499997526407, "epoch": 1.0640364345230908, "grad_norm": 0.1534956842660904, "learning_rate": 6.453522249823658e-05, "loss": 0.5214, "mean_token_accuracy": 0.8427030295133591, "num_tokens": 369095869.0, "step": 11565 }, { "entropy": 0.615098100155592, "epoch": 1.064128440894532, "grad_norm": 0.15734048187732697, "learning_rate": 6.453215567209495e-05, "loss": 0.5752, "mean_token_accuracy": 0.8208525814116001, "num_tokens": 369127800.0, "step": 11566 }, { "entropy": 0.5516714630648494, "epoch": 1.064220447265973, "grad_norm": 0.15995261073112488, "learning_rate": 6.452908884595332e-05, "loss": 0.5278, "mean_token_accuracy": 0.8397361077368259, "num_tokens": 369160550.0, "step": 11567 }, { "entropy": 0.647506988607347, "epoch": 1.0643124536374144, "grad_norm": 0.16031694412231445, "learning_rate": 6.45260220198117e-05, "loss": 0.6372, "mean_token_accuracy": 0.8070603795349598, "num_tokens": 369192989.0, "step": 11568 }, { "entropy": 0.767314225435257, "epoch": 1.0644044600088556, "grad_norm": 0.17240594327449799, "learning_rate": 6.452295519367008e-05, "loss": 0.7847, "mean_token_accuracy": 0.7663186155259609, "num_tokens": 369225030.0, "step": 11569 }, { "entropy": 0.555538974236697, "epoch": 1.064496466380297, "grad_norm": 0.15742136538028717, "learning_rate": 6.451988836752845e-05, "loss": 0.5352, "mean_token_accuracy": 0.829916350543499, "num_tokens": 369257117.0, "step": 11570 }, { "entropy": 0.5898737031966448, "epoch": 1.064588472751738, "grad_norm": 0.15741810202598572, "learning_rate": 6.451682154138682e-05, "loss": 0.5583, "mean_token_accuracy": 0.831045351922512, "num_tokens": 369289261.0, "step": 11571 }, { "entropy": 0.6720075402408838, "epoch": 1.0646804791231792, "grad_norm": 0.15796403586864471, "learning_rate": 6.45137547152452e-05, "loss": 0.6707, "mean_token_accuracy": 0.7944017387926579, "num_tokens": 369321346.0, "step": 11572 }, { "entropy": 0.6900858022272587, "epoch": 1.0647724854946206, "grad_norm": 0.16090330481529236, "learning_rate": 6.451068788910357e-05, "loss": 0.6893, "mean_token_accuracy": 0.7871978394687176, "num_tokens": 369353311.0, "step": 11573 }, { "entropy": 0.5939967669546604, "epoch": 1.0648644918660617, "grad_norm": 0.15052542090415955, "learning_rate": 6.450762106296195e-05, "loss": 0.5765, "mean_token_accuracy": 0.8234154172241688, "num_tokens": 369385728.0, "step": 11574 }, { "entropy": 0.559375380165875, "epoch": 1.064956498237503, "grad_norm": 0.16718606650829315, "learning_rate": 6.450455423682032e-05, "loss": 0.5417, "mean_token_accuracy": 0.8295697569847107, "num_tokens": 369418305.0, "step": 11575 }, { "entropy": 0.6062845326960087, "epoch": 1.0650485046089442, "grad_norm": 0.1607314497232437, "learning_rate": 6.45014874106787e-05, "loss": 0.6106, "mean_token_accuracy": 0.8114840276539326, "num_tokens": 369450054.0, "step": 11576 }, { "entropy": 0.7128580845892429, "epoch": 1.0651405109803853, "grad_norm": 0.16722913086414337, "learning_rate": 6.449842058453706e-05, "loss": 0.7072, "mean_token_accuracy": 0.7807188369333744, "num_tokens": 369480895.0, "step": 11577 }, { "entropy": 0.5691962484270334, "epoch": 1.0652325173518267, "grad_norm": 0.15324120223522186, "learning_rate": 6.449535375839543e-05, "loss": 0.5566, "mean_token_accuracy": 0.8271311186254025, "num_tokens": 369513257.0, "step": 11578 }, { "entropy": 0.5664912760257721, "epoch": 1.0653245237232678, "grad_norm": 0.1563396155834198, "learning_rate": 6.449228693225381e-05, "loss": 0.5581, "mean_token_accuracy": 0.825756810605526, "num_tokens": 369544801.0, "step": 11579 }, { "entropy": 0.5900455117225647, "epoch": 1.0654165300947092, "grad_norm": 0.15260006487369537, "learning_rate": 6.44892201061122e-05, "loss": 0.5903, "mean_token_accuracy": 0.8226679153740406, "num_tokens": 369576719.0, "step": 11580 }, { "entropy": 0.6430571107193828, "epoch": 1.0655085364661503, "grad_norm": 0.1590586155653, "learning_rate": 6.448615327997056e-05, "loss": 0.6126, "mean_token_accuracy": 0.8135054856538773, "num_tokens": 369608531.0, "step": 11581 }, { "entropy": 0.6649076258763671, "epoch": 1.0656005428375914, "grad_norm": 0.15925273299217224, "learning_rate": 6.448308645382893e-05, "loss": 0.6595, "mean_token_accuracy": 0.7977683991193771, "num_tokens": 369640678.0, "step": 11582 }, { "entropy": 0.6090736901387572, "epoch": 1.0656925492090328, "grad_norm": 0.1547267884016037, "learning_rate": 6.44800196276873e-05, "loss": 0.5851, "mean_token_accuracy": 0.8188849836587906, "num_tokens": 369672712.0, "step": 11583 }, { "entropy": 0.6969467448070645, "epoch": 1.065784555580474, "grad_norm": 0.16730377078056335, "learning_rate": 6.447695280154568e-05, "loss": 0.6897, "mean_token_accuracy": 0.7922865226864815, "num_tokens": 369704494.0, "step": 11584 }, { "entropy": 0.6088058119639754, "epoch": 1.0658765619519153, "grad_norm": 0.18118621408939362, "learning_rate": 6.447388597540406e-05, "loss": 0.5905, "mean_token_accuracy": 0.8186697587370872, "num_tokens": 369736658.0, "step": 11585 }, { "entropy": 0.6558212758973241, "epoch": 1.0659685683233564, "grad_norm": 0.15899904072284698, "learning_rate": 6.447081914926243e-05, "loss": 0.6433, "mean_token_accuracy": 0.8040133379399776, "num_tokens": 369769184.0, "step": 11586 }, { "entropy": 0.5583428917452693, "epoch": 1.0660605746947975, "grad_norm": 0.1533270627260208, "learning_rate": 6.44677523231208e-05, "loss": 0.5419, "mean_token_accuracy": 0.8313360139727592, "num_tokens": 369801520.0, "step": 11587 }, { "entropy": 0.6326333777979016, "epoch": 1.066152581066239, "grad_norm": 0.1565520465373993, "learning_rate": 6.446468549697918e-05, "loss": 0.6127, "mean_token_accuracy": 0.8109364099800587, "num_tokens": 369832591.0, "step": 11588 }, { "entropy": 0.6455669403076172, "epoch": 1.06624458743768, "grad_norm": 0.15606072545051575, "learning_rate": 6.446161867083755e-05, "loss": 0.6252, "mean_token_accuracy": 0.8080160468816757, "num_tokens": 369863775.0, "step": 11589 }, { "entropy": 0.5302552524954081, "epoch": 1.0663365938091214, "grad_norm": 0.15763446688652039, "learning_rate": 6.445855184469593e-05, "loss": 0.5115, "mean_token_accuracy": 0.8459961749613285, "num_tokens": 369896540.0, "step": 11590 }, { "entropy": 0.6353875696659088, "epoch": 1.0664286001805625, "grad_norm": 0.15829941630363464, "learning_rate": 6.44554850185543e-05, "loss": 0.6176, "mean_token_accuracy": 0.8118090406060219, "num_tokens": 369928453.0, "step": 11591 }, { "entropy": 0.6264742873609066, "epoch": 1.0665206065520036, "grad_norm": 0.16131293773651123, "learning_rate": 6.445241819241268e-05, "loss": 0.6199, "mean_token_accuracy": 0.8079387471079826, "num_tokens": 369960356.0, "step": 11592 }, { "entropy": 0.5894994395785034, "epoch": 1.066612612923445, "grad_norm": 0.1642971783876419, "learning_rate": 6.444935136627105e-05, "loss": 0.5828, "mean_token_accuracy": 0.82105478271842, "num_tokens": 369993061.0, "step": 11593 }, { "entropy": 0.6404398996382952, "epoch": 1.0667046192948861, "grad_norm": 0.15767104923725128, "learning_rate": 6.444628454012943e-05, "loss": 0.6251, "mean_token_accuracy": 0.8108609318733215, "num_tokens": 370025464.0, "step": 11594 }, { "entropy": 0.5835713660344481, "epoch": 1.0667966256663275, "grad_norm": 0.15280288457870483, "learning_rate": 6.444321771398781e-05, "loss": 0.5588, "mean_token_accuracy": 0.8281281478703022, "num_tokens": 370056669.0, "step": 11595 }, { "entropy": 0.5828414503484964, "epoch": 1.0668886320377686, "grad_norm": 0.1503535360097885, "learning_rate": 6.444015088784618e-05, "loss": 0.5608, "mean_token_accuracy": 0.8225713223218918, "num_tokens": 370088631.0, "step": 11596 }, { "entropy": 0.5970825366675854, "epoch": 1.0669806384092098, "grad_norm": 0.15723933279514313, "learning_rate": 6.443708406170454e-05, "loss": 0.5801, "mean_token_accuracy": 0.8205765560269356, "num_tokens": 370120977.0, "step": 11597 }, { "entropy": 0.6746200639754534, "epoch": 1.0670726447806511, "grad_norm": 0.1663256585597992, "learning_rate": 6.443401723556291e-05, "loss": 0.6786, "mean_token_accuracy": 0.7944399639964104, "num_tokens": 370153249.0, "step": 11598 }, { "entropy": 0.6403799429535866, "epoch": 1.0671646511520922, "grad_norm": 0.16980081796646118, "learning_rate": 6.44309504094213e-05, "loss": 0.6317, "mean_token_accuracy": 0.8080658130347729, "num_tokens": 370184667.0, "step": 11599 }, { "entropy": 0.5597822768613696, "epoch": 1.0672566575235336, "grad_norm": 0.1617022454738617, "learning_rate": 6.442788358327967e-05, "loss": 0.5429, "mean_token_accuracy": 0.8287263438105583, "num_tokens": 370216757.0, "step": 11600 }, { "entropy": 0.6803330257534981, "epoch": 1.0673486638949747, "grad_norm": 0.17978239059448242, "learning_rate": 6.442481675713804e-05, "loss": 0.6781, "mean_token_accuracy": 0.7932637929916382, "num_tokens": 370249243.0, "step": 11601 }, { "entropy": 0.6011397335678339, "epoch": 1.0674406702664159, "grad_norm": 0.15760914981365204, "learning_rate": 6.442174993099641e-05, "loss": 0.5936, "mean_token_accuracy": 0.8169428333640099, "num_tokens": 370281429.0, "step": 11602 }, { "entropy": 0.6530337929725647, "epoch": 1.0675326766378572, "grad_norm": 0.16836531460285187, "learning_rate": 6.441868310485479e-05, "loss": 0.6453, "mean_token_accuracy": 0.8027511462569237, "num_tokens": 370313200.0, "step": 11603 }, { "entropy": 0.5887935077771544, "epoch": 1.0676246830092984, "grad_norm": 0.16241472959518433, "learning_rate": 6.441561627871316e-05, "loss": 0.57, "mean_token_accuracy": 0.8275366984307766, "num_tokens": 370344831.0, "step": 11604 }, { "entropy": 0.6944999657571316, "epoch": 1.0677166893807397, "grad_norm": 0.16555608808994293, "learning_rate": 6.441254945257154e-05, "loss": 0.6811, "mean_token_accuracy": 0.7931646034121513, "num_tokens": 370377153.0, "step": 11605 }, { "entropy": 0.6516879517585039, "epoch": 1.0678086957521808, "grad_norm": 0.1566437929868698, "learning_rate": 6.440948262642991e-05, "loss": 0.6446, "mean_token_accuracy": 0.8013469353318214, "num_tokens": 370408740.0, "step": 11606 }, { "entropy": 0.6698861718177795, "epoch": 1.067900702123622, "grad_norm": 0.16139575839042664, "learning_rate": 6.440641580028829e-05, "loss": 0.6533, "mean_token_accuracy": 0.7994333803653717, "num_tokens": 370440616.0, "step": 11607 }, { "entropy": 0.6483898544684052, "epoch": 1.0679927084950633, "grad_norm": 0.1566259115934372, "learning_rate": 6.440334897414666e-05, "loss": 0.6244, "mean_token_accuracy": 0.8104402869939804, "num_tokens": 370472904.0, "step": 11608 }, { "entropy": 0.6192226856946945, "epoch": 1.0680847148665045, "grad_norm": 0.15247716009616852, "learning_rate": 6.440028214800503e-05, "loss": 0.5839, "mean_token_accuracy": 0.8177198097109795, "num_tokens": 370504984.0, "step": 11609 }, { "entropy": 0.6160843316465616, "epoch": 1.0681767212379458, "grad_norm": 0.1577625721693039, "learning_rate": 6.439721532186341e-05, "loss": 0.5791, "mean_token_accuracy": 0.8213581740856171, "num_tokens": 370537512.0, "step": 11610 }, { "entropy": 0.6012045694515109, "epoch": 1.068268727609387, "grad_norm": 0.15591289103031158, "learning_rate": 6.439414849572179e-05, "loss": 0.5804, "mean_token_accuracy": 0.8205518648028374, "num_tokens": 370569771.0, "step": 11611 }, { "entropy": 0.5452516302466393, "epoch": 1.068360733980828, "grad_norm": 0.16142398118972778, "learning_rate": 6.439108166958016e-05, "loss": 0.5311, "mean_token_accuracy": 0.8356574550271034, "num_tokens": 370601518.0, "step": 11612 }, { "entropy": 0.6195458937436342, "epoch": 1.0684527403522694, "grad_norm": 0.15897707641124725, "learning_rate": 6.438801484343852e-05, "loss": 0.6123, "mean_token_accuracy": 0.8138773292303085, "num_tokens": 370634141.0, "step": 11613 }, { "entropy": 0.6130415098741651, "epoch": 1.0685447467237106, "grad_norm": 0.15422165393829346, "learning_rate": 6.438494801729689e-05, "loss": 0.5883, "mean_token_accuracy": 0.8171565905213356, "num_tokens": 370665188.0, "step": 11614 }, { "entropy": 0.5854126764461398, "epoch": 1.068636753095152, "grad_norm": 0.15695688128471375, "learning_rate": 6.438188119115527e-05, "loss": 0.575, "mean_token_accuracy": 0.8211011476814747, "num_tokens": 370696909.0, "step": 11615 }, { "entropy": 0.6403062231838703, "epoch": 1.068728759466593, "grad_norm": 0.17341773211956024, "learning_rate": 6.437881436501366e-05, "loss": 0.6307, "mean_token_accuracy": 0.8051998317241669, "num_tokens": 370728990.0, "step": 11616 }, { "entropy": 0.5872672903351486, "epoch": 1.0688207658380342, "grad_norm": 0.16143976151943207, "learning_rate": 6.437574753887202e-05, "loss": 0.5951, "mean_token_accuracy": 0.8212840557098389, "num_tokens": 370760894.0, "step": 11617 }, { "entropy": 0.5832388438284397, "epoch": 1.0689127722094756, "grad_norm": 0.14635750651359558, "learning_rate": 6.437268071273039e-05, "loss": 0.5513, "mean_token_accuracy": 0.8277604542672634, "num_tokens": 370792683.0, "step": 11618 }, { "entropy": 0.6354620549827814, "epoch": 1.0690047785809167, "grad_norm": 0.15574628114700317, "learning_rate": 6.436961388658877e-05, "loss": 0.6212, "mean_token_accuracy": 0.8097851425409317, "num_tokens": 370824140.0, "step": 11619 }, { "entropy": 0.6053505456075072, "epoch": 1.069096784952358, "grad_norm": 0.15059928596019745, "learning_rate": 6.436654706044714e-05, "loss": 0.6033, "mean_token_accuracy": 0.8171188794076443, "num_tokens": 370856307.0, "step": 11620 }, { "entropy": 0.6567016672343016, "epoch": 1.0691887913237992, "grad_norm": 0.15713395178318024, "learning_rate": 6.436348023430552e-05, "loss": 0.6484, "mean_token_accuracy": 0.8029917851090431, "num_tokens": 370888616.0, "step": 11621 }, { "entropy": 0.6678876467049122, "epoch": 1.0692807976952403, "grad_norm": 0.15961851179599762, "learning_rate": 6.436041340816389e-05, "loss": 0.6463, "mean_token_accuracy": 0.8007687367498875, "num_tokens": 370920547.0, "step": 11622 }, { "entropy": 0.5847564060240984, "epoch": 1.0693728040666817, "grad_norm": 0.15291441977024078, "learning_rate": 6.435734658202227e-05, "loss": 0.5669, "mean_token_accuracy": 0.8281379826366901, "num_tokens": 370952592.0, "step": 11623 }, { "entropy": 0.5737136611714959, "epoch": 1.0694648104381228, "grad_norm": 0.1535821259021759, "learning_rate": 6.435427975588064e-05, "loss": 0.5841, "mean_token_accuracy": 0.8234042897820473, "num_tokens": 370984410.0, "step": 11624 }, { "entropy": 0.6355892457067966, "epoch": 1.0695568168095642, "grad_norm": 0.16014781594276428, "learning_rate": 6.435121292973901e-05, "loss": 0.6125, "mean_token_accuracy": 0.8098964467644691, "num_tokens": 371015087.0, "step": 11625 }, { "entropy": 0.5878320289775729, "epoch": 1.0696488231810053, "grad_norm": 0.16403815150260925, "learning_rate": 6.43481461035974e-05, "loss": 0.579, "mean_token_accuracy": 0.8227477297186852, "num_tokens": 371047162.0, "step": 11626 }, { "entropy": 0.6461958643049002, "epoch": 1.0697408295524464, "grad_norm": 0.15947087109088898, "learning_rate": 6.434507927745577e-05, "loss": 0.6406, "mean_token_accuracy": 0.803675826638937, "num_tokens": 371079389.0, "step": 11627 }, { "entropy": 0.6425506919622421, "epoch": 1.0698328359238878, "grad_norm": 0.15793295204639435, "learning_rate": 6.434201245131414e-05, "loss": 0.6246, "mean_token_accuracy": 0.8072685413062572, "num_tokens": 371110891.0, "step": 11628 }, { "entropy": 0.6717328149825335, "epoch": 1.069924842295329, "grad_norm": 0.16214148700237274, "learning_rate": 6.43389456251725e-05, "loss": 0.6644, "mean_token_accuracy": 0.7973414398729801, "num_tokens": 371142965.0, "step": 11629 }, { "entropy": 0.5758958272635937, "epoch": 1.0700168486667703, "grad_norm": 0.16641193628311157, "learning_rate": 6.433587879903089e-05, "loss": 0.5741, "mean_token_accuracy": 0.8242321759462357, "num_tokens": 371175038.0, "step": 11630 }, { "entropy": 0.6270127706229687, "epoch": 1.0701088550382114, "grad_norm": 0.15508399903774261, "learning_rate": 6.433281197288927e-05, "loss": 0.6184, "mean_token_accuracy": 0.8094885647296906, "num_tokens": 371207239.0, "step": 11631 }, { "entropy": 0.6146877398714423, "epoch": 1.0702008614096525, "grad_norm": 0.16273066401481628, "learning_rate": 6.432974514674764e-05, "loss": 0.6083, "mean_token_accuracy": 0.8209579512476921, "num_tokens": 371239090.0, "step": 11632 }, { "entropy": 0.5980602204799652, "epoch": 1.070292867781094, "grad_norm": 0.15322989225387573, "learning_rate": 6.4326678320606e-05, "loss": 0.5682, "mean_token_accuracy": 0.8264445066452026, "num_tokens": 371271078.0, "step": 11633 }, { "entropy": 0.5868565202690661, "epoch": 1.070384874152535, "grad_norm": 0.15082858502864838, "learning_rate": 6.432361149446439e-05, "loss": 0.578, "mean_token_accuracy": 0.822708822786808, "num_tokens": 371303819.0, "step": 11634 }, { "entropy": 0.5132240001112223, "epoch": 1.0704768805239764, "grad_norm": 0.15319772064685822, "learning_rate": 6.432054466832275e-05, "loss": 0.4947, "mean_token_accuracy": 0.8497599959373474, "num_tokens": 371336368.0, "step": 11635 }, { "entropy": 0.5943759717047215, "epoch": 1.0705688868954175, "grad_norm": 0.15097403526306152, "learning_rate": 6.431747784218113e-05, "loss": 0.5803, "mean_token_accuracy": 0.8227888271212578, "num_tokens": 371368830.0, "step": 11636 }, { "entropy": 0.7277845181524754, "epoch": 1.0706608932668586, "grad_norm": 0.1622588336467743, "learning_rate": 6.43144110160395e-05, "loss": 0.7167, "mean_token_accuracy": 0.7844566218554974, "num_tokens": 371401053.0, "step": 11637 }, { "entropy": 0.6677747908979654, "epoch": 1.0707528996383, "grad_norm": 0.16205556690692902, "learning_rate": 6.431134418989788e-05, "loss": 0.6451, "mean_token_accuracy": 0.7985911555588245, "num_tokens": 371432586.0, "step": 11638 }, { "entropy": 0.7139922603964806, "epoch": 1.0708449060097411, "grad_norm": 0.1656411737203598, "learning_rate": 6.430827736375625e-05, "loss": 0.6955, "mean_token_accuracy": 0.7915518283843994, "num_tokens": 371464579.0, "step": 11639 }, { "entropy": 0.6666705030947924, "epoch": 1.0709369123811825, "grad_norm": 0.1606798619031906, "learning_rate": 6.430521053761462e-05, "loss": 0.6467, "mean_token_accuracy": 0.8009248860180378, "num_tokens": 371497044.0, "step": 11640 }, { "entropy": 0.665817528963089, "epoch": 1.0710289187526236, "grad_norm": 0.1618146002292633, "learning_rate": 6.4302143711473e-05, "loss": 0.6439, "mean_token_accuracy": 0.8006245121359825, "num_tokens": 371528861.0, "step": 11641 }, { "entropy": 0.5409806370735168, "epoch": 1.0711209251240648, "grad_norm": 0.1538720279932022, "learning_rate": 6.429907688533138e-05, "loss": 0.5245, "mean_token_accuracy": 0.8366112150251865, "num_tokens": 371561116.0, "step": 11642 }, { "entropy": 0.6165948491543531, "epoch": 1.0712129314955061, "grad_norm": 0.1574084609746933, "learning_rate": 6.429601005918975e-05, "loss": 0.5972, "mean_token_accuracy": 0.8117814436554909, "num_tokens": 371592310.0, "step": 11643 }, { "entropy": 0.5868088752031326, "epoch": 1.0713049378669472, "grad_norm": 0.15445466339588165, "learning_rate": 6.429294323304812e-05, "loss": 0.5703, "mean_token_accuracy": 0.8265461958944798, "num_tokens": 371624201.0, "step": 11644 }, { "entropy": 0.5644895620644093, "epoch": 1.0713969442383886, "grad_norm": 0.14991754293441772, "learning_rate": 6.428987640690649e-05, "loss": 0.5451, "mean_token_accuracy": 0.8284119628369808, "num_tokens": 371655788.0, "step": 11645 }, { "entropy": 0.662418432533741, "epoch": 1.0714889506098297, "grad_norm": 0.16713286936283112, "learning_rate": 6.428680958076487e-05, "loss": 0.6594, "mean_token_accuracy": 0.7997461296617985, "num_tokens": 371687923.0, "step": 11646 }, { "entropy": 0.6255277022719383, "epoch": 1.0715809569812709, "grad_norm": 0.15264049172401428, "learning_rate": 6.428374275462325e-05, "loss": 0.5939, "mean_token_accuracy": 0.817864615470171, "num_tokens": 371719696.0, "step": 11647 }, { "entropy": 0.6617561466991901, "epoch": 1.0716729633527122, "grad_norm": 0.15623360872268677, "learning_rate": 6.428067592848162e-05, "loss": 0.6489, "mean_token_accuracy": 0.8019847050309181, "num_tokens": 371752181.0, "step": 11648 }, { "entropy": 0.7208687141537666, "epoch": 1.0717649697241534, "grad_norm": 0.1636999100446701, "learning_rate": 6.427760910233998e-05, "loss": 0.7052, "mean_token_accuracy": 0.7812629975378513, "num_tokens": 371784399.0, "step": 11649 }, { "entropy": 0.7220601756125689, "epoch": 1.0718569760955947, "grad_norm": 0.17494699358940125, "learning_rate": 6.427454227619837e-05, "loss": 0.7014, "mean_token_accuracy": 0.7870981208980083, "num_tokens": 371815671.0, "step": 11650 }, { "entropy": 0.5734339393675327, "epoch": 1.0719489824670358, "grad_norm": 0.15487957000732422, "learning_rate": 6.427147545005673e-05, "loss": 0.5636, "mean_token_accuracy": 0.8201901018619537, "num_tokens": 371846928.0, "step": 11651 }, { "entropy": 0.5684410966932774, "epoch": 1.072040988838477, "grad_norm": 0.1559053510427475, "learning_rate": 6.426840862391512e-05, "loss": 0.5576, "mean_token_accuracy": 0.8256592266261578, "num_tokens": 371878845.0, "step": 11652 }, { "entropy": 0.6935500595718622, "epoch": 1.0721329952099183, "grad_norm": 0.17136777937412262, "learning_rate": 6.42653417977735e-05, "loss": 0.6889, "mean_token_accuracy": 0.792652640491724, "num_tokens": 371910011.0, "step": 11653 }, { "entropy": 0.6034531462937593, "epoch": 1.0722250015813595, "grad_norm": 0.1571730524301529, "learning_rate": 6.426227497163187e-05, "loss": 0.5756, "mean_token_accuracy": 0.8270491994917393, "num_tokens": 371941803.0, "step": 11654 }, { "entropy": 0.4832216026261449, "epoch": 1.0723170079528008, "grad_norm": 0.15239962935447693, "learning_rate": 6.425920814549023e-05, "loss": 0.4859, "mean_token_accuracy": 0.8490453958511353, "num_tokens": 371973696.0, "step": 11655 }, { "entropy": 0.5356352021917701, "epoch": 1.072409014324242, "grad_norm": 0.14684809744358063, "learning_rate": 6.42561413193486e-05, "loss": 0.5267, "mean_token_accuracy": 0.8387629315257072, "num_tokens": 372006067.0, "step": 11656 }, { "entropy": 0.6342138964682817, "epoch": 1.072501020695683, "grad_norm": 0.16580000519752502, "learning_rate": 6.425307449320698e-05, "loss": 0.6293, "mean_token_accuracy": 0.8081441037356853, "num_tokens": 372037729.0, "step": 11657 }, { "entropy": 0.6093416903167963, "epoch": 1.0725930270671244, "grad_norm": 0.1567615568637848, "learning_rate": 6.425000766706536e-05, "loss": 0.6019, "mean_token_accuracy": 0.8144979923963547, "num_tokens": 372069624.0, "step": 11658 }, { "entropy": 0.7311144080013037, "epoch": 1.0726850334385656, "grad_norm": 0.16963379085063934, "learning_rate": 6.424694084092373e-05, "loss": 0.7187, "mean_token_accuracy": 0.7841745913028717, "num_tokens": 372101335.0, "step": 11659 }, { "entropy": 0.6017667837440968, "epoch": 1.072777039810007, "grad_norm": 0.1557818055152893, "learning_rate": 6.42438740147821e-05, "loss": 0.5702, "mean_token_accuracy": 0.8236939124763012, "num_tokens": 372133852.0, "step": 11660 }, { "entropy": 0.7382163126021624, "epoch": 1.072869046181448, "grad_norm": 0.16939115524291992, "learning_rate": 6.424080718864048e-05, "loss": 0.7294, "mean_token_accuracy": 0.7779907286167145, "num_tokens": 372166089.0, "step": 11661 }, { "entropy": 0.5989611567929387, "epoch": 1.0729610525528892, "grad_norm": 0.15835238993167877, "learning_rate": 6.423774036249885e-05, "loss": 0.5729, "mean_token_accuracy": 0.8217437602579594, "num_tokens": 372197428.0, "step": 11662 }, { "entropy": 0.6735384985804558, "epoch": 1.0730530589243306, "grad_norm": 0.1611841470003128, "learning_rate": 6.423467353635723e-05, "loss": 0.66, "mean_token_accuracy": 0.799114752560854, "num_tokens": 372229958.0, "step": 11663 }, { "entropy": 0.6216978002339602, "epoch": 1.0731450652957717, "grad_norm": 0.16140873730182648, "learning_rate": 6.42316067102156e-05, "loss": 0.5985, "mean_token_accuracy": 0.8176837153732777, "num_tokens": 372261426.0, "step": 11664 }, { "entropy": 0.4692254848778248, "epoch": 1.073237071667213, "grad_norm": 0.1544477641582489, "learning_rate": 6.422853988407398e-05, "loss": 0.4482, "mean_token_accuracy": 0.8587408103048801, "num_tokens": 372294163.0, "step": 11665 }, { "entropy": 0.7470983369275928, "epoch": 1.0733290780386542, "grad_norm": 0.16874828934669495, "learning_rate": 6.422547305793235e-05, "loss": 0.7416, "mean_token_accuracy": 0.7774449624121189, "num_tokens": 372325913.0, "step": 11666 }, { "entropy": 0.6699259858578444, "epoch": 1.0734210844100953, "grad_norm": 0.16273334622383118, "learning_rate": 6.422240623179072e-05, "loss": 0.6633, "mean_token_accuracy": 0.7977919578552246, "num_tokens": 372357384.0, "step": 11667 }, { "entropy": 0.5773841487243772, "epoch": 1.0735130907815367, "grad_norm": 0.15742623805999756, "learning_rate": 6.42193394056491e-05, "loss": 0.5718, "mean_token_accuracy": 0.8233840987086296, "num_tokens": 372389653.0, "step": 11668 }, { "entropy": 0.6137265376746655, "epoch": 1.0736050971529778, "grad_norm": 0.16545487940311432, "learning_rate": 6.421627257950748e-05, "loss": 0.6095, "mean_token_accuracy": 0.8161028325557709, "num_tokens": 372422421.0, "step": 11669 }, { "entropy": 0.6465345080941916, "epoch": 1.0736971035244192, "grad_norm": 0.1570456475019455, "learning_rate": 6.421320575336585e-05, "loss": 0.6417, "mean_token_accuracy": 0.8044513501226902, "num_tokens": 372454654.0, "step": 11670 }, { "entropy": 0.6513697914779186, "epoch": 1.0737891098958603, "grad_norm": 0.17072387039661407, "learning_rate": 6.421013892722421e-05, "loss": 0.6457, "mean_token_accuracy": 0.8026051633059978, "num_tokens": 372486717.0, "step": 11671 }, { "entropy": 0.6555443042889237, "epoch": 1.0738811162673014, "grad_norm": 0.15131521224975586, "learning_rate": 6.420707210108258e-05, "loss": 0.6333, "mean_token_accuracy": 0.8073174431920052, "num_tokens": 372519456.0, "step": 11672 }, { "entropy": 0.6106728091835976, "epoch": 1.0739731226387428, "grad_norm": 0.15392036736011505, "learning_rate": 6.420400527494098e-05, "loss": 0.5722, "mean_token_accuracy": 0.8221507221460342, "num_tokens": 372550626.0, "step": 11673 }, { "entropy": 0.6584234954789281, "epoch": 1.074065129010184, "grad_norm": 0.15587778389453888, "learning_rate": 6.420093844879934e-05, "loss": 0.6374, "mean_token_accuracy": 0.8042694739997387, "num_tokens": 372583231.0, "step": 11674 }, { "entropy": 0.6802284941077232, "epoch": 1.0741571353816253, "grad_norm": 0.15879328548908234, "learning_rate": 6.419787162265771e-05, "loss": 0.657, "mean_token_accuracy": 0.7968066595494747, "num_tokens": 372614650.0, "step": 11675 }, { "entropy": 0.6051208730787039, "epoch": 1.0742491417530664, "grad_norm": 0.15669173002243042, "learning_rate": 6.419480479651608e-05, "loss": 0.5898, "mean_token_accuracy": 0.8167270570993423, "num_tokens": 372646220.0, "step": 11676 }, { "entropy": 0.6843086816370487, "epoch": 1.0743411481245075, "grad_norm": 0.1585986465215683, "learning_rate": 6.419173797037446e-05, "loss": 0.6735, "mean_token_accuracy": 0.7942273169755936, "num_tokens": 372678569.0, "step": 11677 }, { "entropy": 0.5794034227728844, "epoch": 1.074433154495949, "grad_norm": 0.1572801172733307, "learning_rate": 6.418867114423284e-05, "loss": 0.5492, "mean_token_accuracy": 0.8260965347290039, "num_tokens": 372709552.0, "step": 11678 }, { "entropy": 0.7362527623772621, "epoch": 1.07452516086739, "grad_norm": 0.16612538695335388, "learning_rate": 6.418560431809121e-05, "loss": 0.7214, "mean_token_accuracy": 0.777455747127533, "num_tokens": 372741968.0, "step": 11679 }, { "entropy": 0.5268832305446267, "epoch": 1.0746171672388314, "grad_norm": 0.15639866888523102, "learning_rate": 6.418253749194958e-05, "loss": 0.5182, "mean_token_accuracy": 0.8371351882815361, "num_tokens": 372773129.0, "step": 11680 }, { "entropy": 0.6240232419222593, "epoch": 1.0747091736102725, "grad_norm": 0.15827402472496033, "learning_rate": 6.417947066580796e-05, "loss": 0.6388, "mean_token_accuracy": 0.8072079680860043, "num_tokens": 372805327.0, "step": 11681 }, { "entropy": 0.6210119649767876, "epoch": 1.0748011799817137, "grad_norm": 0.1573728770017624, "learning_rate": 6.417640383966633e-05, "loss": 0.6273, "mean_token_accuracy": 0.8104009330272675, "num_tokens": 372837017.0, "step": 11682 }, { "entropy": 0.668768297880888, "epoch": 1.074893186353155, "grad_norm": 0.16070453822612762, "learning_rate": 6.417333701352471e-05, "loss": 0.6685, "mean_token_accuracy": 0.7970470897853374, "num_tokens": 372869022.0, "step": 11683 }, { "entropy": 0.6882192399352789, "epoch": 1.0749851927245961, "grad_norm": 0.16847407817840576, "learning_rate": 6.417027018738309e-05, "loss": 0.6946, "mean_token_accuracy": 0.7911431007087231, "num_tokens": 372901695.0, "step": 11684 }, { "entropy": 0.6460868776775897, "epoch": 1.0750771990960375, "grad_norm": 0.16570855677127838, "learning_rate": 6.416720336124146e-05, "loss": 0.626, "mean_token_accuracy": 0.8065807968378067, "num_tokens": 372933700.0, "step": 11685 }, { "entropy": 0.5836671404540539, "epoch": 1.0751692054674786, "grad_norm": 0.1585967093706131, "learning_rate": 6.416413653509983e-05, "loss": 0.5519, "mean_token_accuracy": 0.8293144889175892, "num_tokens": 372966119.0, "step": 11686 }, { "entropy": 0.635142408311367, "epoch": 1.0752612118389198, "grad_norm": 0.16564702987670898, "learning_rate": 6.41610697089582e-05, "loss": 0.6003, "mean_token_accuracy": 0.8144719786942005, "num_tokens": 372997866.0, "step": 11687 }, { "entropy": 0.6749577783048153, "epoch": 1.0753532182103611, "grad_norm": 0.1644732654094696, "learning_rate": 6.415800288281658e-05, "loss": 0.6651, "mean_token_accuracy": 0.7964833229780197, "num_tokens": 373029801.0, "step": 11688 }, { "entropy": 0.6247204663231969, "epoch": 1.0754452245818023, "grad_norm": 0.16805550456047058, "learning_rate": 6.415493605667496e-05, "loss": 0.6051, "mean_token_accuracy": 0.8139891177415848, "num_tokens": 373061928.0, "step": 11689 }, { "entropy": 0.6906015705317259, "epoch": 1.0755372309532436, "grad_norm": 0.1623317152261734, "learning_rate": 6.415186923053333e-05, "loss": 0.6799, "mean_token_accuracy": 0.7907254993915558, "num_tokens": 373093253.0, "step": 11690 }, { "entropy": 0.579786934889853, "epoch": 1.0756292373246847, "grad_norm": 0.15861250460147858, "learning_rate": 6.414880240439169e-05, "loss": 0.5683, "mean_token_accuracy": 0.8221667781472206, "num_tokens": 373124660.0, "step": 11691 }, { "entropy": 0.6043314589187503, "epoch": 1.0757212436961259, "grad_norm": 0.15751422941684723, "learning_rate": 6.414573557825007e-05, "loss": 0.5821, "mean_token_accuracy": 0.8245944194495678, "num_tokens": 373156823.0, "step": 11692 }, { "entropy": 0.6465194504708052, "epoch": 1.0758132500675672, "grad_norm": 0.1655506193637848, "learning_rate": 6.414266875210844e-05, "loss": 0.6421, "mean_token_accuracy": 0.8039284721016884, "num_tokens": 373188308.0, "step": 11693 }, { "entropy": 0.6066624019294977, "epoch": 1.0759052564390084, "grad_norm": 0.16162000596523285, "learning_rate": 6.413960192596682e-05, "loss": 0.5986, "mean_token_accuracy": 0.8157803528010845, "num_tokens": 373220635.0, "step": 11694 }, { "entropy": 0.6411512149497867, "epoch": 1.0759972628104497, "grad_norm": 0.15885984897613525, "learning_rate": 6.413653509982519e-05, "loss": 0.6431, "mean_token_accuracy": 0.804802268743515, "num_tokens": 373252370.0, "step": 11695 }, { "entropy": 0.5395876783877611, "epoch": 1.0760892691818909, "grad_norm": 0.14879904687404633, "learning_rate": 6.413346827368357e-05, "loss": 0.5231, "mean_token_accuracy": 0.8406795114278793, "num_tokens": 373284677.0, "step": 11696 }, { "entropy": 0.5941870249807835, "epoch": 1.076181275553332, "grad_norm": 0.16138924658298492, "learning_rate": 6.413040144754194e-05, "loss": 0.5653, "mean_token_accuracy": 0.8243887983262539, "num_tokens": 373316864.0, "step": 11697 }, { "entropy": 0.6280372608453035, "epoch": 1.0762732819247733, "grad_norm": 0.1628701388835907, "learning_rate": 6.412733462140031e-05, "loss": 0.6159, "mean_token_accuracy": 0.8085381388664246, "num_tokens": 373348895.0, "step": 11698 }, { "entropy": 0.6196625353768468, "epoch": 1.0763652882962145, "grad_norm": 0.16152949631214142, "learning_rate": 6.412426779525869e-05, "loss": 0.6125, "mean_token_accuracy": 0.8142991699278355, "num_tokens": 373380747.0, "step": 11699 }, { "entropy": 0.543799951672554, "epoch": 1.0764572946676558, "grad_norm": 0.14794422686100006, "learning_rate": 6.412120096911707e-05, "loss": 0.5402, "mean_token_accuracy": 0.8324489891529083, "num_tokens": 373412942.0, "step": 11700 }, { "entropy": 0.6389734642580152, "epoch": 1.076549301039097, "grad_norm": 0.15725553035736084, "learning_rate": 6.411813414297544e-05, "loss": 0.6317, "mean_token_accuracy": 0.8069495521485806, "num_tokens": 373445707.0, "step": 11701 }, { "entropy": 0.5901557691395283, "epoch": 1.076641307410538, "grad_norm": 0.16474151611328125, "learning_rate": 6.411506731683381e-05, "loss": 0.5877, "mean_token_accuracy": 0.8211846575140953, "num_tokens": 373477267.0, "step": 11702 }, { "entropy": 0.5357124069705606, "epoch": 1.0767333137819795, "grad_norm": 0.14520716667175293, "learning_rate": 6.411200049069218e-05, "loss": 0.5147, "mean_token_accuracy": 0.8376220911741257, "num_tokens": 373509501.0, "step": 11703 }, { "entropy": 0.7386556882411242, "epoch": 1.0768253201534206, "grad_norm": 0.1662726104259491, "learning_rate": 6.410893366455056e-05, "loss": 0.7268, "mean_token_accuracy": 0.778567660599947, "num_tokens": 373541777.0, "step": 11704 }, { "entropy": 0.6760766142979264, "epoch": 1.076917326524862, "grad_norm": 0.16994205117225647, "learning_rate": 6.410586683840894e-05, "loss": 0.6634, "mean_token_accuracy": 0.7965070232748985, "num_tokens": 373574165.0, "step": 11705 }, { "entropy": 0.622443369589746, "epoch": 1.077009332896303, "grad_norm": 0.15661582350730896, "learning_rate": 6.41028000122673e-05, "loss": 0.6122, "mean_token_accuracy": 0.8122677281498909, "num_tokens": 373606901.0, "step": 11706 }, { "entropy": 0.6906845476478338, "epoch": 1.0771013392677442, "grad_norm": 0.16382743418216705, "learning_rate": 6.409973318612567e-05, "loss": 0.6738, "mean_token_accuracy": 0.7939139790832996, "num_tokens": 373637913.0, "step": 11707 }, { "entropy": 0.6488401954993606, "epoch": 1.0771933456391856, "grad_norm": 0.16932536661624908, "learning_rate": 6.409666635998406e-05, "loss": 0.6361, "mean_token_accuracy": 0.8039263971149921, "num_tokens": 373669878.0, "step": 11708 }, { "entropy": 0.5591107867658138, "epoch": 1.0772853520106267, "grad_norm": 0.15846744179725647, "learning_rate": 6.409359953384244e-05, "loss": 0.5428, "mean_token_accuracy": 0.8307424038648605, "num_tokens": 373702095.0, "step": 11709 }, { "entropy": 0.6959099369123578, "epoch": 1.077377358382068, "grad_norm": 0.17049813270568848, "learning_rate": 6.40905327077008e-05, "loss": 0.6999, "mean_token_accuracy": 0.7890578880906105, "num_tokens": 373733302.0, "step": 11710 }, { "entropy": 0.6172031722962856, "epoch": 1.0774693647535092, "grad_norm": 0.1581602692604065, "learning_rate": 6.408746588155917e-05, "loss": 0.6148, "mean_token_accuracy": 0.8139040395617485, "num_tokens": 373765687.0, "step": 11711 }, { "entropy": 0.5916288513690233, "epoch": 1.0775613711249503, "grad_norm": 0.1563778966665268, "learning_rate": 6.408439905541755e-05, "loss": 0.5751, "mean_token_accuracy": 0.8207953944802284, "num_tokens": 373797898.0, "step": 11712 }, { "entropy": 0.5357247502543032, "epoch": 1.0776533774963917, "grad_norm": 0.15581223368644714, "learning_rate": 6.408133222927592e-05, "loss": 0.5181, "mean_token_accuracy": 0.8385773524641991, "num_tokens": 373829983.0, "step": 11713 }, { "entropy": 0.6172058880329132, "epoch": 1.0777453838678328, "grad_norm": 0.15671876072883606, "learning_rate": 6.40782654031343e-05, "loss": 0.5971, "mean_token_accuracy": 0.8125688172876835, "num_tokens": 373861991.0, "step": 11714 }, { "entropy": 0.6001919414848089, "epoch": 1.0778373902392742, "grad_norm": 0.15659430623054504, "learning_rate": 6.407519857699268e-05, "loss": 0.5843, "mean_token_accuracy": 0.8176098130643368, "num_tokens": 373894646.0, "step": 11715 }, { "entropy": 0.6181738134473562, "epoch": 1.0779293966107153, "grad_norm": 0.1609310358762741, "learning_rate": 6.407213175085105e-05, "loss": 0.6063, "mean_token_accuracy": 0.8155347108840942, "num_tokens": 373926078.0, "step": 11716 }, { "entropy": 0.6466336529701948, "epoch": 1.0780214029821564, "grad_norm": 0.1649147868156433, "learning_rate": 6.406906492470942e-05, "loss": 0.6399, "mean_token_accuracy": 0.8025315850973129, "num_tokens": 373957884.0, "step": 11717 }, { "entropy": 0.6858938876539469, "epoch": 1.0781134093535978, "grad_norm": 0.15868540108203888, "learning_rate": 6.406599809856779e-05, "loss": 0.6716, "mean_token_accuracy": 0.7954978942871094, "num_tokens": 373989692.0, "step": 11718 }, { "entropy": 0.5647694440558553, "epoch": 1.078205415725039, "grad_norm": 0.15769553184509277, "learning_rate": 6.406293127242617e-05, "loss": 0.5393, "mean_token_accuracy": 0.8311141580343246, "num_tokens": 374021608.0, "step": 11719 }, { "entropy": 0.6561401188373566, "epoch": 1.0782974220964803, "grad_norm": 0.15798857808113098, "learning_rate": 6.405986444628455e-05, "loss": 0.6377, "mean_token_accuracy": 0.8050548359751701, "num_tokens": 374053396.0, "step": 11720 }, { "entropy": 0.5258029857650399, "epoch": 1.0783894284679214, "grad_norm": 0.1575159728527069, "learning_rate": 6.405679762014292e-05, "loss": 0.5044, "mean_token_accuracy": 0.8436098657548428, "num_tokens": 374085384.0, "step": 11721 }, { "entropy": 0.7223948407918215, "epoch": 1.0784814348393625, "grad_norm": 0.16089577972888947, "learning_rate": 6.405373079400129e-05, "loss": 0.7162, "mean_token_accuracy": 0.7820792719721794, "num_tokens": 374117380.0, "step": 11722 }, { "entropy": 0.6862637661397457, "epoch": 1.078573441210804, "grad_norm": 0.15714521706104279, "learning_rate": 6.405066396785967e-05, "loss": 0.6663, "mean_token_accuracy": 0.7974637448787689, "num_tokens": 374149269.0, "step": 11723 }, { "entropy": 0.570886267349124, "epoch": 1.078665447582245, "grad_norm": 0.15285691618919373, "learning_rate": 6.404759714171804e-05, "loss": 0.5442, "mean_token_accuracy": 0.8322359137237072, "num_tokens": 374180772.0, "step": 11724 }, { "entropy": 0.6274473071098328, "epoch": 1.0787574539536864, "grad_norm": 0.1592620611190796, "learning_rate": 6.404453031557642e-05, "loss": 0.6252, "mean_token_accuracy": 0.806906346231699, "num_tokens": 374212919.0, "step": 11725 }, { "entropy": 0.691464563831687, "epoch": 1.0788494603251275, "grad_norm": 0.16094227135181427, "learning_rate": 6.404146348943479e-05, "loss": 0.6879, "mean_token_accuracy": 0.7941335998475552, "num_tokens": 374245195.0, "step": 11726 }, { "entropy": 0.5801641009747982, "epoch": 1.0789414666965687, "grad_norm": 0.158652663230896, "learning_rate": 6.403839666329317e-05, "loss": 0.5836, "mean_token_accuracy": 0.8184558488428593, "num_tokens": 374277262.0, "step": 11727 }, { "entropy": 0.58926004730165, "epoch": 1.07903347306801, "grad_norm": 0.15594734251499176, "learning_rate": 6.403532983715153e-05, "loss": 0.5928, "mean_token_accuracy": 0.8175482079386711, "num_tokens": 374309335.0, "step": 11728 }, { "entropy": 0.6833104323595762, "epoch": 1.0791254794394511, "grad_norm": 0.1611059159040451, "learning_rate": 6.40322630110099e-05, "loss": 0.6744, "mean_token_accuracy": 0.795548502355814, "num_tokens": 374341648.0, "step": 11729 }, { "entropy": 0.6849204711616039, "epoch": 1.0792174858108925, "grad_norm": 0.16746802628040314, "learning_rate": 6.402919618486828e-05, "loss": 0.6824, "mean_token_accuracy": 0.7932930327951908, "num_tokens": 374373170.0, "step": 11730 }, { "entropy": 0.606786260381341, "epoch": 1.0793094921823336, "grad_norm": 0.1579751968383789, "learning_rate": 6.402612935872667e-05, "loss": 0.5938, "mean_token_accuracy": 0.8170256465673447, "num_tokens": 374405101.0, "step": 11731 }, { "entropy": 0.6111011300235987, "epoch": 1.0794014985537748, "grad_norm": 0.16019785404205322, "learning_rate": 6.402306253258503e-05, "loss": 0.5943, "mean_token_accuracy": 0.8169584386050701, "num_tokens": 374436884.0, "step": 11732 }, { "entropy": 0.6522915977984667, "epoch": 1.0794935049252161, "grad_norm": 0.16081653535366058, "learning_rate": 6.40199957064434e-05, "loss": 0.6368, "mean_token_accuracy": 0.8040214516222477, "num_tokens": 374468373.0, "step": 11733 }, { "entropy": 0.5367119582369924, "epoch": 1.0795855112966573, "grad_norm": 0.15747742354869843, "learning_rate": 6.401692888030177e-05, "loss": 0.5168, "mean_token_accuracy": 0.8424864262342453, "num_tokens": 374500243.0, "step": 11734 }, { "entropy": 0.6577965412288904, "epoch": 1.0796775176680986, "grad_norm": 0.16539588570594788, "learning_rate": 6.401386205416015e-05, "loss": 0.6353, "mean_token_accuracy": 0.8040721379220486, "num_tokens": 374531781.0, "step": 11735 }, { "entropy": 0.6665035430341959, "epoch": 1.0797695240395397, "grad_norm": 0.1610693484544754, "learning_rate": 6.401079522801853e-05, "loss": 0.6519, "mean_token_accuracy": 0.7998344711959362, "num_tokens": 374564037.0, "step": 11736 }, { "entropy": 0.683708418160677, "epoch": 1.0798615304109809, "grad_norm": 0.1689496487379074, "learning_rate": 6.40077284018769e-05, "loss": 0.6804, "mean_token_accuracy": 0.7935049757361412, "num_tokens": 374595433.0, "step": 11737 }, { "entropy": 0.7313556149601936, "epoch": 1.0799535367824222, "grad_norm": 0.16346123814582825, "learning_rate": 6.400466157573527e-05, "loss": 0.7171, "mean_token_accuracy": 0.7807749137282372, "num_tokens": 374627563.0, "step": 11738 }, { "entropy": 0.6428047604858875, "epoch": 1.0800455431538634, "grad_norm": 0.1648382693529129, "learning_rate": 6.400159474959365e-05, "loss": 0.6194, "mean_token_accuracy": 0.8126425035297871, "num_tokens": 374659101.0, "step": 11739 }, { "entropy": 0.6115284692496061, "epoch": 1.0801375495253047, "grad_norm": 0.16023080050945282, "learning_rate": 6.399852792345202e-05, "loss": 0.5879, "mean_token_accuracy": 0.8198267668485641, "num_tokens": 374690746.0, "step": 11740 }, { "entropy": 0.6809972617775202, "epoch": 1.0802295558967459, "grad_norm": 0.17866069078445435, "learning_rate": 6.39954610973104e-05, "loss": 0.6794, "mean_token_accuracy": 0.7939873933792114, "num_tokens": 374722746.0, "step": 11741 }, { "entropy": 0.5035707801580429, "epoch": 1.080321562268187, "grad_norm": 0.14383529126644135, "learning_rate": 6.399239427116877e-05, "loss": 0.4666, "mean_token_accuracy": 0.8562127761542797, "num_tokens": 374755161.0, "step": 11742 }, { "entropy": 0.5770151428878307, "epoch": 1.0804135686396283, "grad_norm": 0.15496684610843658, "learning_rate": 6.398932744502715e-05, "loss": 0.5457, "mean_token_accuracy": 0.8324104733765125, "num_tokens": 374786848.0, "step": 11743 }, { "entropy": 0.7236248850822449, "epoch": 1.0805055750110695, "grad_norm": 0.16471372544765472, "learning_rate": 6.398626061888552e-05, "loss": 0.7064, "mean_token_accuracy": 0.7812177613377571, "num_tokens": 374818379.0, "step": 11744 }, { "entropy": 0.6799155566841364, "epoch": 1.0805975813825108, "grad_norm": 0.16531991958618164, "learning_rate": 6.398319379274388e-05, "loss": 0.6445, "mean_token_accuracy": 0.801029771566391, "num_tokens": 374850171.0, "step": 11745 }, { "entropy": 0.5802870597690344, "epoch": 1.080689587753952, "grad_norm": 0.16401973366737366, "learning_rate": 6.398012696660228e-05, "loss": 0.5674, "mean_token_accuracy": 0.825612086802721, "num_tokens": 374882124.0, "step": 11746 }, { "entropy": 0.5862169098109007, "epoch": 1.080781594125393, "grad_norm": 0.16241145133972168, "learning_rate": 6.397706014046065e-05, "loss": 0.5901, "mean_token_accuracy": 0.8191198222339153, "num_tokens": 374914414.0, "step": 11747 }, { "entropy": 0.5489927642047405, "epoch": 1.0808736004968345, "grad_norm": 0.14926348626613617, "learning_rate": 6.397399331431901e-05, "loss": 0.5369, "mean_token_accuracy": 0.8329838290810585, "num_tokens": 374946377.0, "step": 11748 }, { "entropy": 0.5640841564163566, "epoch": 1.0809656068682756, "grad_norm": 0.16352137923240662, "learning_rate": 6.397092648817738e-05, "loss": 0.5457, "mean_token_accuracy": 0.8306830860674381, "num_tokens": 374978435.0, "step": 11749 }, { "entropy": 0.593018758110702, "epoch": 1.081057613239717, "grad_norm": 0.15238766372203827, "learning_rate": 6.396785966203576e-05, "loss": 0.5758, "mean_token_accuracy": 0.824846874922514, "num_tokens": 375010489.0, "step": 11750 }, { "entropy": 0.651926701888442, "epoch": 1.081149619611158, "grad_norm": 0.15925391018390656, "learning_rate": 6.396479283589414e-05, "loss": 0.6397, "mean_token_accuracy": 0.8056251220405102, "num_tokens": 375042666.0, "step": 11751 }, { "entropy": 0.723782742395997, "epoch": 1.0812416259825992, "grad_norm": 0.1667809933423996, "learning_rate": 6.396172600975251e-05, "loss": 0.7168, "mean_token_accuracy": 0.7810357362031937, "num_tokens": 375074583.0, "step": 11752 }, { "entropy": 0.584253991022706, "epoch": 1.0813336323540406, "grad_norm": 0.1472121626138687, "learning_rate": 6.395865918361088e-05, "loss": 0.5614, "mean_token_accuracy": 0.8271334990859032, "num_tokens": 375107089.0, "step": 11753 }, { "entropy": 0.503829631023109, "epoch": 1.0814256387254817, "grad_norm": 0.14604830741882324, "learning_rate": 6.395559235746926e-05, "loss": 0.4839, "mean_token_accuracy": 0.8493506237864494, "num_tokens": 375139522.0, "step": 11754 }, { "entropy": 0.6669149193912745, "epoch": 1.081517645096923, "grad_norm": 0.1582387238740921, "learning_rate": 6.395252553132763e-05, "loss": 0.6544, "mean_token_accuracy": 0.8034355640411377, "num_tokens": 375171045.0, "step": 11755 }, { "entropy": 0.5165864825248718, "epoch": 1.0816096514683642, "grad_norm": 0.15395529568195343, "learning_rate": 6.394945870518601e-05, "loss": 0.4907, "mean_token_accuracy": 0.8473911955952644, "num_tokens": 375202491.0, "step": 11756 }, { "entropy": 0.559201542288065, "epoch": 1.0817016578398053, "grad_norm": 0.15521331131458282, "learning_rate": 6.394639187904438e-05, "loss": 0.5427, "mean_token_accuracy": 0.8326383419334888, "num_tokens": 375234731.0, "step": 11757 }, { "entropy": 0.6123787835240364, "epoch": 1.0817936642112467, "grad_norm": 0.16565163433551788, "learning_rate": 6.394332505290276e-05, "loss": 0.5906, "mean_token_accuracy": 0.8179084286093712, "num_tokens": 375266878.0, "step": 11758 }, { "entropy": 0.633357607293874, "epoch": 1.0818856705826878, "grad_norm": 0.16025903820991516, "learning_rate": 6.394025822676113e-05, "loss": 0.6135, "mean_token_accuracy": 0.8124375194311142, "num_tokens": 375298181.0, "step": 11759 }, { "entropy": 0.5702516864985228, "epoch": 1.0819776769541292, "grad_norm": 0.15988892316818237, "learning_rate": 6.39371914006195e-05, "loss": 0.5553, "mean_token_accuracy": 0.8259819149971008, "num_tokens": 375330026.0, "step": 11760 }, { "entropy": 0.70073620416224, "epoch": 1.0820696833255703, "grad_norm": 0.1668975055217743, "learning_rate": 6.393412457447788e-05, "loss": 0.672, "mean_token_accuracy": 0.7962789684534073, "num_tokens": 375362085.0, "step": 11761 }, { "entropy": 0.6902743279933929, "epoch": 1.0821616896970114, "grad_norm": 0.165801540017128, "learning_rate": 6.393105774833626e-05, "loss": 0.6789, "mean_token_accuracy": 0.7910769134759903, "num_tokens": 375393639.0, "step": 11762 }, { "entropy": 0.6549540460109711, "epoch": 1.0822536960684528, "grad_norm": 0.1663365513086319, "learning_rate": 6.392799092219463e-05, "loss": 0.642, "mean_token_accuracy": 0.8004297912120819, "num_tokens": 375425178.0, "step": 11763 }, { "entropy": 0.598234080709517, "epoch": 1.082345702439894, "grad_norm": 0.15080296993255615, "learning_rate": 6.3924924096053e-05, "loss": 0.585, "mean_token_accuracy": 0.818576168268919, "num_tokens": 375456347.0, "step": 11764 }, { "entropy": 0.5719208531081676, "epoch": 1.0824377088113353, "grad_norm": 0.15750490128993988, "learning_rate": 6.392185726991136e-05, "loss": 0.553, "mean_token_accuracy": 0.8261391185224056, "num_tokens": 375488106.0, "step": 11765 }, { "entropy": 0.6328635588288307, "epoch": 1.0825297151827764, "grad_norm": 0.16458599269390106, "learning_rate": 6.391879044376974e-05, "loss": 0.6354, "mean_token_accuracy": 0.8084033206105232, "num_tokens": 375520210.0, "step": 11766 }, { "entropy": 0.6358799375593662, "epoch": 1.0826217215542175, "grad_norm": 0.16993597149848938, "learning_rate": 6.391572361762813e-05, "loss": 0.6218, "mean_token_accuracy": 0.8100812211632729, "num_tokens": 375551873.0, "step": 11767 }, { "entropy": 0.6474271975457668, "epoch": 1.082713727925659, "grad_norm": 0.15808071196079254, "learning_rate": 6.39126567914865e-05, "loss": 0.6454, "mean_token_accuracy": 0.8012251369655132, "num_tokens": 375583834.0, "step": 11768 }, { "entropy": 0.5774373169988394, "epoch": 1.0828057342971, "grad_norm": 0.1522171050310135, "learning_rate": 6.390958996534486e-05, "loss": 0.5642, "mean_token_accuracy": 0.8236134313046932, "num_tokens": 375615446.0, "step": 11769 }, { "entropy": 0.5978965517133474, "epoch": 1.0828977406685414, "grad_norm": 0.15926171839237213, "learning_rate": 6.390652313920324e-05, "loss": 0.5777, "mean_token_accuracy": 0.8208948411047459, "num_tokens": 375646698.0, "step": 11770 }, { "entropy": 0.719023184850812, "epoch": 1.0829897470399825, "grad_norm": 0.17156969010829926, "learning_rate": 6.390345631306161e-05, "loss": 0.7229, "mean_token_accuracy": 0.7815680578351021, "num_tokens": 375679083.0, "step": 11771 }, { "entropy": 0.6838039569556713, "epoch": 1.0830817534114237, "grad_norm": 0.16294178366661072, "learning_rate": 6.390038948691999e-05, "loss": 0.6475, "mean_token_accuracy": 0.7991169206798077, "num_tokens": 375710565.0, "step": 11772 }, { "entropy": 0.6562689561396837, "epoch": 1.083173759782865, "grad_norm": 0.1599910855293274, "learning_rate": 6.389732266077836e-05, "loss": 0.6465, "mean_token_accuracy": 0.8029497303068638, "num_tokens": 375742844.0, "step": 11773 }, { "entropy": 0.7388902436941862, "epoch": 1.0832657661543061, "grad_norm": 0.16091124713420868, "learning_rate": 6.389425583463674e-05, "loss": 0.7147, "mean_token_accuracy": 0.7823551222681999, "num_tokens": 375775477.0, "step": 11774 }, { "entropy": 0.5729527734220028, "epoch": 1.0833577725257475, "grad_norm": 0.15771004557609558, "learning_rate": 6.389118900849511e-05, "loss": 0.556, "mean_token_accuracy": 0.8295835256576538, "num_tokens": 375807258.0, "step": 11775 }, { "entropy": 0.5137728303670883, "epoch": 1.0834497788971886, "grad_norm": 0.1577623039484024, "learning_rate": 6.388812218235348e-05, "loss": 0.5118, "mean_token_accuracy": 0.8413833901286125, "num_tokens": 375839908.0, "step": 11776 }, { "entropy": 0.5750700999051332, "epoch": 1.0835417852686298, "grad_norm": 0.15577207505702972, "learning_rate": 6.388505535621186e-05, "loss": 0.5725, "mean_token_accuracy": 0.8260916620492935, "num_tokens": 375871020.0, "step": 11777 }, { "entropy": 0.5857322262600064, "epoch": 1.0836337916400711, "grad_norm": 0.15482491254806519, "learning_rate": 6.388198853007024e-05, "loss": 0.5724, "mean_token_accuracy": 0.8233047425746918, "num_tokens": 375903508.0, "step": 11778 }, { "entropy": 0.5956699112430215, "epoch": 1.0837257980115123, "grad_norm": 0.16710110008716583, "learning_rate": 6.387892170392861e-05, "loss": 0.5761, "mean_token_accuracy": 0.8207273669540882, "num_tokens": 375935219.0, "step": 11779 }, { "entropy": 0.6313351141288877, "epoch": 1.0838178043829536, "grad_norm": 0.1707102507352829, "learning_rate": 6.387585487778698e-05, "loss": 0.6143, "mean_token_accuracy": 0.8142065443098545, "num_tokens": 375967622.0, "step": 11780 }, { "entropy": 0.5764442877843976, "epoch": 1.0839098107543947, "grad_norm": 0.15347634255886078, "learning_rate": 6.387278805164536e-05, "loss": 0.5719, "mean_token_accuracy": 0.8226444609463215, "num_tokens": 375999957.0, "step": 11781 }, { "entropy": 0.6312475106678903, "epoch": 1.0840018171258359, "grad_norm": 0.16079185903072357, "learning_rate": 6.386972122550373e-05, "loss": 0.6213, "mean_token_accuracy": 0.810955498367548, "num_tokens": 376032209.0, "step": 11782 }, { "entropy": 0.6419861521571875, "epoch": 1.0840938234972772, "grad_norm": 0.16185930371284485, "learning_rate": 6.38666543993621e-05, "loss": 0.629, "mean_token_accuracy": 0.8080579414963722, "num_tokens": 376064189.0, "step": 11783 }, { "entropy": 0.5867998069152236, "epoch": 1.0841858298687184, "grad_norm": 0.1510140746831894, "learning_rate": 6.386358757322047e-05, "loss": 0.5743, "mean_token_accuracy": 0.823955874890089, "num_tokens": 376096277.0, "step": 11784 }, { "entropy": 0.6134626567363739, "epoch": 1.0842778362401597, "grad_norm": 0.16317972540855408, "learning_rate": 6.386052074707886e-05, "loss": 0.6113, "mean_token_accuracy": 0.8155191838741302, "num_tokens": 376128705.0, "step": 11785 }, { "entropy": 0.5754716135561466, "epoch": 1.0843698426116009, "grad_norm": 0.16159048676490784, "learning_rate": 6.385745392093722e-05, "loss": 0.5689, "mean_token_accuracy": 0.8224696554243565, "num_tokens": 376160738.0, "step": 11786 }, { "entropy": 0.7537786988541484, "epoch": 1.084461848983042, "grad_norm": 0.16870161890983582, "learning_rate": 6.385438709479559e-05, "loss": 0.7502, "mean_token_accuracy": 0.7718683890998363, "num_tokens": 376192881.0, "step": 11787 }, { "entropy": 0.6943440362811089, "epoch": 1.0845538553544833, "grad_norm": 0.1617308408021927, "learning_rate": 6.385132026865397e-05, "loss": 0.6837, "mean_token_accuracy": 0.7940441630780697, "num_tokens": 376225208.0, "step": 11788 }, { "entropy": 0.6903794705867767, "epoch": 1.0846458617259245, "grad_norm": 0.16157376766204834, "learning_rate": 6.384825344251235e-05, "loss": 0.6729, "mean_token_accuracy": 0.7952468991279602, "num_tokens": 376257151.0, "step": 11789 }, { "entropy": 0.6922485362738371, "epoch": 1.0847378680973658, "grad_norm": 0.16355061531066895, "learning_rate": 6.384518661637072e-05, "loss": 0.6782, "mean_token_accuracy": 0.7914164401590824, "num_tokens": 376288757.0, "step": 11790 }, { "entropy": 0.6380477342754602, "epoch": 1.084829874468807, "grad_norm": 0.151520773768425, "learning_rate": 6.384211979022909e-05, "loss": 0.6148, "mean_token_accuracy": 0.8103494495153427, "num_tokens": 376320860.0, "step": 11791 }, { "entropy": 0.5560551723465323, "epoch": 1.084921880840248, "grad_norm": 0.15167897939682007, "learning_rate": 6.383905296408746e-05, "loss": 0.5432, "mean_token_accuracy": 0.8329638056457043, "num_tokens": 376353194.0, "step": 11792 }, { "entropy": 0.6765514742583036, "epoch": 1.0850138872116895, "grad_norm": 0.15592429041862488, "learning_rate": 6.383598613794585e-05, "loss": 0.6683, "mean_token_accuracy": 0.7910661920905113, "num_tokens": 376385962.0, "step": 11793 }, { "entropy": 0.6914942022413015, "epoch": 1.0851058935831306, "grad_norm": 0.173335000872612, "learning_rate": 6.383291931180422e-05, "loss": 0.6717, "mean_token_accuracy": 0.7949753701686859, "num_tokens": 376417099.0, "step": 11794 }, { "entropy": 0.5509589836001396, "epoch": 1.085197899954572, "grad_norm": 0.1592782586812973, "learning_rate": 6.382985248566259e-05, "loss": 0.5369, "mean_token_accuracy": 0.8333919607102871, "num_tokens": 376449553.0, "step": 11795 }, { "entropy": 0.6295468835160136, "epoch": 1.085289906326013, "grad_norm": 0.16777212917804718, "learning_rate": 6.382678565952096e-05, "loss": 0.6238, "mean_token_accuracy": 0.8107971623539925, "num_tokens": 376481215.0, "step": 11796 }, { "entropy": 0.6963593261316419, "epoch": 1.0853819126974542, "grad_norm": 0.16792689263820648, "learning_rate": 6.382371883337934e-05, "loss": 0.6786, "mean_token_accuracy": 0.7922318428754807, "num_tokens": 376513405.0, "step": 11797 }, { "entropy": 0.595171058550477, "epoch": 1.0854739190688956, "grad_norm": 0.15940074622631073, "learning_rate": 6.382065200723772e-05, "loss": 0.5754, "mean_token_accuracy": 0.8211839906871319, "num_tokens": 376544968.0, "step": 11798 }, { "entropy": 0.6112273498438299, "epoch": 1.0855659254403367, "grad_norm": 0.15919646620750427, "learning_rate": 6.381758518109609e-05, "loss": 0.5885, "mean_token_accuracy": 0.8215779475867748, "num_tokens": 376577189.0, "step": 11799 }, { "entropy": 0.6287319604307413, "epoch": 1.085657931811778, "grad_norm": 0.16673554480075836, "learning_rate": 6.381451835495446e-05, "loss": 0.6225, "mean_token_accuracy": 0.810223463922739, "num_tokens": 376609710.0, "step": 11800 }, { "entropy": 0.6164457481354475, "epoch": 1.0857499381832192, "grad_norm": 0.1661093831062317, "learning_rate": 6.381145152881284e-05, "loss": 0.5814, "mean_token_accuracy": 0.8213748782873154, "num_tokens": 376640952.0, "step": 11801 }, { "entropy": 0.5408950820565224, "epoch": 1.0858419445546603, "grad_norm": 0.15195204317569733, "learning_rate": 6.38083847026712e-05, "loss": 0.5374, "mean_token_accuracy": 0.8332676589488983, "num_tokens": 376673498.0, "step": 11802 }, { "entropy": 0.5958103351294994, "epoch": 1.0859339509261017, "grad_norm": 0.15839973092079163, "learning_rate": 6.380531787652959e-05, "loss": 0.5782, "mean_token_accuracy": 0.8195355273783207, "num_tokens": 376705510.0, "step": 11803 }, { "entropy": 0.5740511221811175, "epoch": 1.0860259572975428, "grad_norm": 0.15318162739276886, "learning_rate": 6.380225105038795e-05, "loss": 0.5569, "mean_token_accuracy": 0.8239482939243317, "num_tokens": 376736914.0, "step": 11804 }, { "entropy": 0.543744646012783, "epoch": 1.0861179636689842, "grad_norm": 0.15479439496994019, "learning_rate": 6.379918422424634e-05, "loss": 0.5365, "mean_token_accuracy": 0.836836252361536, "num_tokens": 376769065.0, "step": 11805 }, { "entropy": 0.7060813158750534, "epoch": 1.0862099700404253, "grad_norm": 0.16534006595611572, "learning_rate": 6.37961173981047e-05, "loss": 0.712, "mean_token_accuracy": 0.7835715934634209, "num_tokens": 376801548.0, "step": 11806 }, { "entropy": 0.6591257154941559, "epoch": 1.0863019764118664, "grad_norm": 0.1598830223083496, "learning_rate": 6.379305057196307e-05, "loss": 0.6404, "mean_token_accuracy": 0.8013137727975845, "num_tokens": 376833249.0, "step": 11807 }, { "entropy": 0.6096173841506243, "epoch": 1.0863939827833078, "grad_norm": 0.150283545255661, "learning_rate": 6.378998374582145e-05, "loss": 0.5994, "mean_token_accuracy": 0.8144221119582653, "num_tokens": 376864941.0, "step": 11808 }, { "entropy": 0.6189433019608259, "epoch": 1.086485989154749, "grad_norm": 0.1530759483575821, "learning_rate": 6.378691691967983e-05, "loss": 0.6229, "mean_token_accuracy": 0.8097016662359238, "num_tokens": 376897352.0, "step": 11809 }, { "entropy": 0.6356941782869399, "epoch": 1.0865779955261903, "grad_norm": 0.16342733800411224, "learning_rate": 6.37838500935382e-05, "loss": 0.6154, "mean_token_accuracy": 0.812426932156086, "num_tokens": 376929494.0, "step": 11810 }, { "entropy": 0.6463294783607125, "epoch": 1.0866700018976314, "grad_norm": 0.15352314710617065, "learning_rate": 6.378078326739657e-05, "loss": 0.626, "mean_token_accuracy": 0.8107717968523502, "num_tokens": 376962152.0, "step": 11811 }, { "entropy": 0.5646679294295609, "epoch": 1.0867620082690725, "grad_norm": 0.15849809348583221, "learning_rate": 6.377771644125495e-05, "loss": 0.5387, "mean_token_accuracy": 0.8309707082808018, "num_tokens": 376994669.0, "step": 11812 }, { "entropy": 0.6231055818498135, "epoch": 1.086854014640514, "grad_norm": 0.15940357744693756, "learning_rate": 6.377464961511332e-05, "loss": 0.6116, "mean_token_accuracy": 0.8114352598786354, "num_tokens": 377026863.0, "step": 11813 }, { "entropy": 0.5599014973267913, "epoch": 1.086946021011955, "grad_norm": 0.15187931060791016, "learning_rate": 6.37715827889717e-05, "loss": 0.5561, "mean_token_accuracy": 0.826855082064867, "num_tokens": 377058765.0, "step": 11814 }, { "entropy": 0.6668716743588448, "epoch": 1.0870380273833964, "grad_norm": 0.16179227828979492, "learning_rate": 6.376851596283007e-05, "loss": 0.6506, "mean_token_accuracy": 0.8001952692866325, "num_tokens": 377090933.0, "step": 11815 }, { "entropy": 0.6488898620009422, "epoch": 1.0871300337548375, "grad_norm": 0.16214345395565033, "learning_rate": 6.376544913668845e-05, "loss": 0.6334, "mean_token_accuracy": 0.8060245178639889, "num_tokens": 377123044.0, "step": 11816 }, { "entropy": 0.582689109724015, "epoch": 1.0872220401262787, "grad_norm": 0.14868660271167755, "learning_rate": 6.376238231054682e-05, "loss": 0.5574, "mean_token_accuracy": 0.8261349573731422, "num_tokens": 377155177.0, "step": 11817 }, { "entropy": 0.654613914899528, "epoch": 1.08731404649772, "grad_norm": 0.16075226664543152, "learning_rate": 6.375931548440519e-05, "loss": 0.6496, "mean_token_accuracy": 0.8046221174299717, "num_tokens": 377186929.0, "step": 11818 }, { "entropy": 0.6399179734289646, "epoch": 1.0874060528691611, "grad_norm": 0.15997624397277832, "learning_rate": 6.375624865826357e-05, "loss": 0.6344, "mean_token_accuracy": 0.8075433447957039, "num_tokens": 377218525.0, "step": 11819 }, { "entropy": 0.5570125784724951, "epoch": 1.0874980592406025, "grad_norm": 0.15449099242687225, "learning_rate": 6.375318183212195e-05, "loss": 0.5445, "mean_token_accuracy": 0.8329515308141708, "num_tokens": 377250922.0, "step": 11820 }, { "entropy": 0.6963294874876738, "epoch": 1.0875900656120436, "grad_norm": 0.16133925318717957, "learning_rate": 6.375011500598032e-05, "loss": 0.6949, "mean_token_accuracy": 0.791571594774723, "num_tokens": 377282793.0, "step": 11821 }, { "entropy": 0.5753876967355609, "epoch": 1.0876820719834848, "grad_norm": 0.15964502096176147, "learning_rate": 6.374704817983868e-05, "loss": 0.5566, "mean_token_accuracy": 0.8308269456028938, "num_tokens": 377314252.0, "step": 11822 }, { "entropy": 0.710295083001256, "epoch": 1.0877740783549261, "grad_norm": 0.1624717116355896, "learning_rate": 6.374398135369705e-05, "loss": 0.7057, "mean_token_accuracy": 0.7850716784596443, "num_tokens": 377346386.0, "step": 11823 }, { "entropy": 0.5638949093408883, "epoch": 1.0878660847263673, "grad_norm": 0.1534026563167572, "learning_rate": 6.374091452755543e-05, "loss": 0.5518, "mean_token_accuracy": 0.8320102505385876, "num_tokens": 377379154.0, "step": 11824 }, { "entropy": 0.6616087984293699, "epoch": 1.0879580910978086, "grad_norm": 0.15585793554782867, "learning_rate": 6.373784770141381e-05, "loss": 0.6547, "mean_token_accuracy": 0.8000896386802197, "num_tokens": 377411720.0, "step": 11825 }, { "entropy": 0.595786145888269, "epoch": 1.0880500974692497, "grad_norm": 0.1554359793663025, "learning_rate": 6.373478087527218e-05, "loss": 0.5926, "mean_token_accuracy": 0.8173374608159065, "num_tokens": 377443695.0, "step": 11826 }, { "entropy": 0.6172572961077094, "epoch": 1.0881421038406909, "grad_norm": 0.16243292391300201, "learning_rate": 6.373171404913055e-05, "loss": 0.6062, "mean_token_accuracy": 0.814652569591999, "num_tokens": 377475888.0, "step": 11827 }, { "entropy": 0.6341392006725073, "epoch": 1.0882341102121322, "grad_norm": 0.15935252606868744, "learning_rate": 6.372864722298893e-05, "loss": 0.6313, "mean_token_accuracy": 0.8085414431989193, "num_tokens": 377508015.0, "step": 11828 }, { "entropy": 0.6114749824628234, "epoch": 1.0883261165835734, "grad_norm": 0.16626609861850739, "learning_rate": 6.372558039684731e-05, "loss": 0.5906, "mean_token_accuracy": 0.8172632902860641, "num_tokens": 377539225.0, "step": 11829 }, { "entropy": 0.5811828393489122, "epoch": 1.0884181229550147, "grad_norm": 0.15159127116203308, "learning_rate": 6.372251357070568e-05, "loss": 0.5604, "mean_token_accuracy": 0.8246563598513603, "num_tokens": 377571178.0, "step": 11830 }, { "entropy": 0.6238956274464726, "epoch": 1.0885101293264559, "grad_norm": 0.15772631764411926, "learning_rate": 6.371944674456405e-05, "loss": 0.6029, "mean_token_accuracy": 0.8146367929875851, "num_tokens": 377603623.0, "step": 11831 }, { "entropy": 0.6585776899009943, "epoch": 1.088602135697897, "grad_norm": 0.16078349947929382, "learning_rate": 6.371637991842243e-05, "loss": 0.6449, "mean_token_accuracy": 0.8000638112425804, "num_tokens": 377634612.0, "step": 11832 }, { "entropy": 0.6242024768143892, "epoch": 1.0886941420693383, "grad_norm": 0.15967023372650146, "learning_rate": 6.37133130922808e-05, "loss": 0.6032, "mean_token_accuracy": 0.814521599560976, "num_tokens": 377666215.0, "step": 11833 }, { "entropy": 0.5499474909156561, "epoch": 1.0887861484407795, "grad_norm": 0.1524859070777893, "learning_rate": 6.371024626613918e-05, "loss": 0.5366, "mean_token_accuracy": 0.8345196098089218, "num_tokens": 377698897.0, "step": 11834 }, { "entropy": 0.6115487404167652, "epoch": 1.0888781548122208, "grad_norm": 0.15343812108039856, "learning_rate": 6.370717943999755e-05, "loss": 0.6023, "mean_token_accuracy": 0.8147511668503284, "num_tokens": 377731124.0, "step": 11835 }, { "entropy": 0.5902906097471714, "epoch": 1.088970161183662, "grad_norm": 0.16336536407470703, "learning_rate": 6.370411261385593e-05, "loss": 0.5896, "mean_token_accuracy": 0.8209645338356495, "num_tokens": 377763259.0, "step": 11836 }, { "entropy": 0.5768775437027216, "epoch": 1.089062167555103, "grad_norm": 0.16705627739429474, "learning_rate": 6.37010457877143e-05, "loss": 0.5683, "mean_token_accuracy": 0.8276519179344177, "num_tokens": 377795629.0, "step": 11837 }, { "entropy": 0.6371710132807493, "epoch": 1.0891541739265445, "grad_norm": 0.16061976552009583, "learning_rate": 6.369797896157266e-05, "loss": 0.6241, "mean_token_accuracy": 0.8102742210030556, "num_tokens": 377827745.0, "step": 11838 }, { "entropy": 0.625950681976974, "epoch": 1.0892461802979856, "grad_norm": 0.14815214276313782, "learning_rate": 6.369491213543105e-05, "loss": 0.6121, "mean_token_accuracy": 0.8113702908158302, "num_tokens": 377860513.0, "step": 11839 }, { "entropy": 0.48567596822977066, "epoch": 1.089338186669427, "grad_norm": 0.15238462388515472, "learning_rate": 6.369184530928943e-05, "loss": 0.4836, "mean_token_accuracy": 0.8475342690944672, "num_tokens": 377891260.0, "step": 11840 }, { "entropy": 0.6768936011940241, "epoch": 1.089430193040868, "grad_norm": 0.1704729050397873, "learning_rate": 6.36887784831478e-05, "loss": 0.6646, "mean_token_accuracy": 0.7968404032289982, "num_tokens": 377922251.0, "step": 11841 }, { "entropy": 0.6482561454176903, "epoch": 1.0895221994123092, "grad_norm": 0.16142717003822327, "learning_rate": 6.368571165700616e-05, "loss": 0.6194, "mean_token_accuracy": 0.8093739002943039, "num_tokens": 377954052.0, "step": 11842 }, { "entropy": 0.6828020848333836, "epoch": 1.0896142057837506, "grad_norm": 0.15785259008407593, "learning_rate": 6.368264483086454e-05, "loss": 0.6705, "mean_token_accuracy": 0.7946175038814545, "num_tokens": 377985983.0, "step": 11843 }, { "entropy": 0.66024349629879, "epoch": 1.0897062121551917, "grad_norm": 0.16369426250457764, "learning_rate": 6.367957800472291e-05, "loss": 0.6563, "mean_token_accuracy": 0.795457262545824, "num_tokens": 378017111.0, "step": 11844 }, { "entropy": 0.6313123181462288, "epoch": 1.089798218526633, "grad_norm": 0.16134080290794373, "learning_rate": 6.36765111785813e-05, "loss": 0.6171, "mean_token_accuracy": 0.8116951696574688, "num_tokens": 378048770.0, "step": 11845 }, { "entropy": 0.6302424734458327, "epoch": 1.0898902248980742, "grad_norm": 0.1585814654827118, "learning_rate": 6.367344435243966e-05, "loss": 0.6285, "mean_token_accuracy": 0.808411817997694, "num_tokens": 378081034.0, "step": 11846 }, { "entropy": 0.6219961559399962, "epoch": 1.0899822312695153, "grad_norm": 0.1623236984014511, "learning_rate": 6.367037752629804e-05, "loss": 0.62, "mean_token_accuracy": 0.8121599033474922, "num_tokens": 378113181.0, "step": 11847 }, { "entropy": 0.6958265285938978, "epoch": 1.0900742376409567, "grad_norm": 0.15989619493484497, "learning_rate": 6.366731070015641e-05, "loss": 0.6824, "mean_token_accuracy": 0.7943555042147636, "num_tokens": 378145544.0, "step": 11848 }, { "entropy": 0.623894952237606, "epoch": 1.0901662440123978, "grad_norm": 0.1613728553056717, "learning_rate": 6.366424387401478e-05, "loss": 0.6088, "mean_token_accuracy": 0.813900675624609, "num_tokens": 378177425.0, "step": 11849 }, { "entropy": 0.5608063414692879, "epoch": 1.0902582503838392, "grad_norm": 0.1504739224910736, "learning_rate": 6.366117704787316e-05, "loss": 0.5454, "mean_token_accuracy": 0.8286383338272572, "num_tokens": 378208741.0, "step": 11850 }, { "entropy": 0.6403994522988796, "epoch": 1.0903502567552803, "grad_norm": 0.16095352172851562, "learning_rate": 6.365811022173154e-05, "loss": 0.622, "mean_token_accuracy": 0.807411827147007, "num_tokens": 378240175.0, "step": 11851 }, { "entropy": 0.5221989210695028, "epoch": 1.0904422631267214, "grad_norm": 0.14686469733715057, "learning_rate": 6.365504339558991e-05, "loss": 0.5193, "mean_token_accuracy": 0.8402607142925262, "num_tokens": 378272465.0, "step": 11852 }, { "entropy": 0.6351076997816563, "epoch": 1.0905342694981628, "grad_norm": 0.18785202503204346, "learning_rate": 6.365197656944828e-05, "loss": 0.639, "mean_token_accuracy": 0.8071022890508175, "num_tokens": 378304275.0, "step": 11853 }, { "entropy": 0.6887276321649551, "epoch": 1.090626275869604, "grad_norm": 0.16600863635540009, "learning_rate": 6.364890974330665e-05, "loss": 0.6819, "mean_token_accuracy": 0.7903700992465019, "num_tokens": 378336228.0, "step": 11854 }, { "entropy": 0.6592941768467426, "epoch": 1.0907182822410453, "grad_norm": 0.1626938134431839, "learning_rate": 6.364584291716503e-05, "loss": 0.6451, "mean_token_accuracy": 0.8050465658307076, "num_tokens": 378368574.0, "step": 11855 }, { "entropy": 0.5970623008906841, "epoch": 1.0908102886124864, "grad_norm": 0.17228686809539795, "learning_rate": 6.364277609102341e-05, "loss": 0.5926, "mean_token_accuracy": 0.8181871324777603, "num_tokens": 378400439.0, "step": 11856 }, { "entropy": 0.7098241131752729, "epoch": 1.0909022949839275, "grad_norm": 0.16100846230983734, "learning_rate": 6.363970926488178e-05, "loss": 0.6825, "mean_token_accuracy": 0.7906316071748734, "num_tokens": 378431807.0, "step": 11857 }, { "entropy": 0.5943564316257834, "epoch": 1.090994301355369, "grad_norm": 0.15678684413433075, "learning_rate": 6.363664243874014e-05, "loss": 0.5809, "mean_token_accuracy": 0.8255210556089878, "num_tokens": 378463177.0, "step": 11858 }, { "entropy": 0.6412585265934467, "epoch": 1.09108630772681, "grad_norm": 0.16088879108428955, "learning_rate": 6.363357561259853e-05, "loss": 0.6185, "mean_token_accuracy": 0.8156879171729088, "num_tokens": 378494781.0, "step": 11859 }, { "entropy": 0.6407788181677461, "epoch": 1.0911783140982514, "grad_norm": 0.16286110877990723, "learning_rate": 6.36305087864569e-05, "loss": 0.6162, "mean_token_accuracy": 0.8116719760000706, "num_tokens": 378526583.0, "step": 11860 }, { "entropy": 0.7015941385179758, "epoch": 1.0912703204696925, "grad_norm": 0.16328366100788116, "learning_rate": 6.362744196031527e-05, "loss": 0.6998, "mean_token_accuracy": 0.7857847027480602, "num_tokens": 378558409.0, "step": 11861 }, { "entropy": 0.6057896791025996, "epoch": 1.0913623268411337, "grad_norm": 0.1538843810558319, "learning_rate": 6.362437513417364e-05, "loss": 0.5833, "mean_token_accuracy": 0.8179833926260471, "num_tokens": 378590489.0, "step": 11862 }, { "entropy": 0.6356091890484095, "epoch": 1.091454333212575, "grad_norm": 0.1570235639810562, "learning_rate": 6.362130830803202e-05, "loss": 0.6193, "mean_token_accuracy": 0.8117100298404694, "num_tokens": 378622472.0, "step": 11863 }, { "entropy": 0.6545014195144176, "epoch": 1.0915463395840161, "grad_norm": 0.15841738879680634, "learning_rate": 6.361824148189039e-05, "loss": 0.6402, "mean_token_accuracy": 0.8080545961856842, "num_tokens": 378654311.0, "step": 11864 }, { "entropy": 0.7073232959955931, "epoch": 1.0916383459554575, "grad_norm": 0.1680661141872406, "learning_rate": 6.361517465574876e-05, "loss": 0.6992, "mean_token_accuracy": 0.7856518775224686, "num_tokens": 378685815.0, "step": 11865 }, { "entropy": 0.5345931760966778, "epoch": 1.0917303523268986, "grad_norm": 0.15238210558891296, "learning_rate": 6.361210782960714e-05, "loss": 0.5138, "mean_token_accuracy": 0.8388416804373264, "num_tokens": 378718126.0, "step": 11866 }, { "entropy": 0.7491922378540039, "epoch": 1.0918223586983398, "grad_norm": 0.16459356248378754, "learning_rate": 6.360904100346552e-05, "loss": 0.7484, "mean_token_accuracy": 0.7729172259569168, "num_tokens": 378749772.0, "step": 11867 }, { "entropy": 0.5692598968744278, "epoch": 1.0919143650697811, "grad_norm": 0.1507723480463028, "learning_rate": 6.360597417732389e-05, "loss": 0.5604, "mean_token_accuracy": 0.8286955691874027, "num_tokens": 378781391.0, "step": 11868 }, { "entropy": 0.6322497744113207, "epoch": 1.0920063714412223, "grad_norm": 0.16114069521427155, "learning_rate": 6.360290735118226e-05, "loss": 0.6232, "mean_token_accuracy": 0.8088402338325977, "num_tokens": 378813440.0, "step": 11869 }, { "entropy": 0.6849557375535369, "epoch": 1.0920983778126636, "grad_norm": 0.1578359752893448, "learning_rate": 6.359984052504064e-05, "loss": 0.6842, "mean_token_accuracy": 0.790432270616293, "num_tokens": 378845674.0, "step": 11870 }, { "entropy": 0.6041748402640224, "epoch": 1.0921903841841047, "grad_norm": 0.15823747217655182, "learning_rate": 6.359677369889902e-05, "loss": 0.5856, "mean_token_accuracy": 0.8263432011008263, "num_tokens": 378877468.0, "step": 11871 }, { "entropy": 0.6527170920744538, "epoch": 1.0922823905555459, "grad_norm": 0.15922623872756958, "learning_rate": 6.359370687275739e-05, "loss": 0.6499, "mean_token_accuracy": 0.8033493272960186, "num_tokens": 378909037.0, "step": 11872 }, { "entropy": 0.6133285984396935, "epoch": 1.0923743969269872, "grad_norm": 0.16054663062095642, "learning_rate": 6.359064004661576e-05, "loss": 0.5828, "mean_token_accuracy": 0.8199496753513813, "num_tokens": 378940553.0, "step": 11873 }, { "entropy": 0.5334213301539421, "epoch": 1.0924664032984284, "grad_norm": 0.14483703672885895, "learning_rate": 6.358757322047414e-05, "loss": 0.5193, "mean_token_accuracy": 0.8400212377309799, "num_tokens": 378972710.0, "step": 11874 }, { "entropy": 0.5739539950154722, "epoch": 1.0925584096698697, "grad_norm": 0.15711325407028198, "learning_rate": 6.35845063943325e-05, "loss": 0.5468, "mean_token_accuracy": 0.8297875933349133, "num_tokens": 379004270.0, "step": 11875 }, { "entropy": 0.6816957900300622, "epoch": 1.0926504160413109, "grad_norm": 0.1719539612531662, "learning_rate": 6.358143956819089e-05, "loss": 0.6783, "mean_token_accuracy": 0.7912918031215668, "num_tokens": 379034613.0, "step": 11876 }, { "entropy": 0.6312663005664945, "epoch": 1.092742422412752, "grad_norm": 0.16140031814575195, "learning_rate": 6.357837274204926e-05, "loss": 0.6085, "mean_token_accuracy": 0.8158974200487137, "num_tokens": 379067179.0, "step": 11877 }, { "entropy": 0.6287515396252275, "epoch": 1.0928344287841933, "grad_norm": 0.15753239393234253, "learning_rate": 6.357530591590764e-05, "loss": 0.6053, "mean_token_accuracy": 0.8140251971781254, "num_tokens": 379098390.0, "step": 11878 }, { "entropy": 0.6936844848096371, "epoch": 1.0929264351556345, "grad_norm": 0.16414448618888855, "learning_rate": 6.3572239089766e-05, "loss": 0.6931, "mean_token_accuracy": 0.7904758974909782, "num_tokens": 379130266.0, "step": 11879 }, { "entropy": 0.6365681039169431, "epoch": 1.0930184415270758, "grad_norm": 0.16383248567581177, "learning_rate": 6.356917226362437e-05, "loss": 0.638, "mean_token_accuracy": 0.8029492981731892, "num_tokens": 379162004.0, "step": 11880 }, { "entropy": 0.6984271183609962, "epoch": 1.093110447898517, "grad_norm": 0.16711117327213287, "learning_rate": 6.356610543748275e-05, "loss": 0.6858, "mean_token_accuracy": 0.7925179190933704, "num_tokens": 379193813.0, "step": 11881 }, { "entropy": 0.5855126492679119, "epoch": 1.093202454269958, "grad_norm": 0.14848856627941132, "learning_rate": 6.356303861134114e-05, "loss": 0.564, "mean_token_accuracy": 0.8260251767933369, "num_tokens": 379226348.0, "step": 11882 }, { "entropy": 0.6863495949655771, "epoch": 1.0932944606413995, "grad_norm": 0.16180817782878876, "learning_rate": 6.35599717851995e-05, "loss": 0.6652, "mean_token_accuracy": 0.7973889671266079, "num_tokens": 379258644.0, "step": 11883 }, { "entropy": 0.5489746038801968, "epoch": 1.0933864670128406, "grad_norm": 0.15349440276622772, "learning_rate": 6.355690495905787e-05, "loss": 0.5294, "mean_token_accuracy": 0.8369076997041702, "num_tokens": 379290313.0, "step": 11884 }, { "entropy": 0.7045743782073259, "epoch": 1.093478473384282, "grad_norm": 0.16506676375865936, "learning_rate": 6.355383813291624e-05, "loss": 0.6802, "mean_token_accuracy": 0.7882198803126812, "num_tokens": 379322554.0, "step": 11885 }, { "entropy": 0.5571859739720821, "epoch": 1.093570479755723, "grad_norm": 0.15464730560779572, "learning_rate": 6.355077130677462e-05, "loss": 0.5486, "mean_token_accuracy": 0.8340722061693668, "num_tokens": 379354605.0, "step": 11886 }, { "entropy": 0.5994292218238115, "epoch": 1.0936624861271642, "grad_norm": 0.15893878042697906, "learning_rate": 6.3547704480633e-05, "loss": 0.5871, "mean_token_accuracy": 0.8213625699281693, "num_tokens": 379386720.0, "step": 11887 }, { "entropy": 0.5660076774656773, "epoch": 1.0937544924986056, "grad_norm": 0.15512599050998688, "learning_rate": 6.354463765449137e-05, "loss": 0.5677, "mean_token_accuracy": 0.8256422989070415, "num_tokens": 379418886.0, "step": 11888 }, { "entropy": 0.6108412016183138, "epoch": 1.0938464988700467, "grad_norm": 0.1618339866399765, "learning_rate": 6.354157082834974e-05, "loss": 0.614, "mean_token_accuracy": 0.8121086359024048, "num_tokens": 379450308.0, "step": 11889 }, { "entropy": 0.7267041895538568, "epoch": 1.093938505241488, "grad_norm": 0.16621871292591095, "learning_rate": 6.353850400220812e-05, "loss": 0.7144, "mean_token_accuracy": 0.783916037529707, "num_tokens": 379482352.0, "step": 11890 }, { "entropy": 0.624447213485837, "epoch": 1.0940305116129292, "grad_norm": 0.15580452978610992, "learning_rate": 6.353543717606649e-05, "loss": 0.6132, "mean_token_accuracy": 0.8115372993052006, "num_tokens": 379513794.0, "step": 11891 }, { "entropy": 0.6038223877549171, "epoch": 1.0941225179843703, "grad_norm": 0.15664193034172058, "learning_rate": 6.353237034992487e-05, "loss": 0.5854, "mean_token_accuracy": 0.8154805824160576, "num_tokens": 379545957.0, "step": 11892 }, { "entropy": 0.7064747326076031, "epoch": 1.0942145243558117, "grad_norm": 0.1612911820411682, "learning_rate": 6.352930352378324e-05, "loss": 0.6911, "mean_token_accuracy": 0.7874097228050232, "num_tokens": 379577931.0, "step": 11893 }, { "entropy": 0.5516957920044661, "epoch": 1.0943065307272528, "grad_norm": 0.15884675085544586, "learning_rate": 6.352623669764162e-05, "loss": 0.5387, "mean_token_accuracy": 0.8342841863632202, "num_tokens": 379610635.0, "step": 11894 }, { "entropy": 0.5521543910726905, "epoch": 1.0943985370986942, "grad_norm": 0.16161219775676727, "learning_rate": 6.352316987149999e-05, "loss": 0.5425, "mean_token_accuracy": 0.8341159448027611, "num_tokens": 379642804.0, "step": 11895 }, { "entropy": 0.6960644358769059, "epoch": 1.0944905434701353, "grad_norm": 0.1627708226442337, "learning_rate": 6.352010304535835e-05, "loss": 0.6753, "mean_token_accuracy": 0.7909561395645142, "num_tokens": 379674422.0, "step": 11896 }, { "entropy": 0.6857427936047316, "epoch": 1.0945825498415764, "grad_norm": 0.16451624035835266, "learning_rate": 6.351703621921673e-05, "loss": 0.6739, "mean_token_accuracy": 0.7908727452158928, "num_tokens": 379706043.0, "step": 11897 }, { "entropy": 0.6903490703552961, "epoch": 1.0946745562130178, "grad_norm": 0.1691029816865921, "learning_rate": 6.351396939307512e-05, "loss": 0.6904, "mean_token_accuracy": 0.7908220030367374, "num_tokens": 379737657.0, "step": 11898 }, { "entropy": 0.571671093814075, "epoch": 1.094766562584459, "grad_norm": 0.15447935461997986, "learning_rate": 6.351090256693348e-05, "loss": 0.5612, "mean_token_accuracy": 0.8282539881765842, "num_tokens": 379770110.0, "step": 11899 }, { "entropy": 0.5005371966399252, "epoch": 1.0948585689559003, "grad_norm": 0.14355427026748657, "learning_rate": 6.350783574079185e-05, "loss": 0.4773, "mean_token_accuracy": 0.8529961593449116, "num_tokens": 379802659.0, "step": 11900 }, { "entropy": 0.6480695400387049, "epoch": 1.0949505753273414, "grad_norm": 0.16121533513069153, "learning_rate": 6.350476891465023e-05, "loss": 0.6431, "mean_token_accuracy": 0.8069467656314373, "num_tokens": 379834158.0, "step": 11901 }, { "entropy": 0.682750079780817, "epoch": 1.0950425816987825, "grad_norm": 0.16380590200424194, "learning_rate": 6.35017020885086e-05, "loss": 0.6832, "mean_token_accuracy": 0.7971929013729095, "num_tokens": 379866475.0, "step": 11902 }, { "entropy": 0.5542347654700279, "epoch": 1.095134588070224, "grad_norm": 0.14995677769184113, "learning_rate": 6.349863526236698e-05, "loss": 0.5355, "mean_token_accuracy": 0.8333236984908581, "num_tokens": 379898249.0, "step": 11903 }, { "entropy": 0.7697122450917959, "epoch": 1.095226594441665, "grad_norm": 0.16773483157157898, "learning_rate": 6.349556843622535e-05, "loss": 0.7668, "mean_token_accuracy": 0.7720367833971977, "num_tokens": 379930354.0, "step": 11904 }, { "entropy": 0.573528666049242, "epoch": 1.0953186008131064, "grad_norm": 0.15291699767112732, "learning_rate": 6.349250161008373e-05, "loss": 0.5573, "mean_token_accuracy": 0.8280670791864395, "num_tokens": 379962523.0, "step": 11905 }, { "entropy": 0.54703782312572, "epoch": 1.0954106071845475, "grad_norm": 0.1627333015203476, "learning_rate": 6.34894347839421e-05, "loss": 0.539, "mean_token_accuracy": 0.8358115553855896, "num_tokens": 379994885.0, "step": 11906 }, { "entropy": 0.6639720872044563, "epoch": 1.0955026135559887, "grad_norm": 0.1630607396364212, "learning_rate": 6.348636795780047e-05, "loss": 0.6285, "mean_token_accuracy": 0.8077680803835392, "num_tokens": 380026875.0, "step": 11907 }, { "entropy": 0.7446363605558872, "epoch": 1.09559461992743, "grad_norm": 0.16203485429286957, "learning_rate": 6.348330113165885e-05, "loss": 0.7108, "mean_token_accuracy": 0.781511727720499, "num_tokens": 380058921.0, "step": 11908 }, { "entropy": 0.619807327631861, "epoch": 1.0956866262988711, "grad_norm": 0.15737125277519226, "learning_rate": 6.348023430551723e-05, "loss": 0.6087, "mean_token_accuracy": 0.8116484619677067, "num_tokens": 380090674.0, "step": 11909 }, { "entropy": 0.4731813268736005, "epoch": 1.0957786326703125, "grad_norm": 0.15189902484416962, "learning_rate": 6.34771674793756e-05, "loss": 0.4508, "mean_token_accuracy": 0.8579883277416229, "num_tokens": 380123013.0, "step": 11910 }, { "entropy": 0.6631059646606445, "epoch": 1.0958706390417536, "grad_norm": 0.16551554203033447, "learning_rate": 6.347410065323397e-05, "loss": 0.6595, "mean_token_accuracy": 0.8003782071173191, "num_tokens": 380155201.0, "step": 11911 }, { "entropy": 0.6518605723977089, "epoch": 1.0959626454131948, "grad_norm": 0.16248954832553864, "learning_rate": 6.347103382709233e-05, "loss": 0.6416, "mean_token_accuracy": 0.8038158304989338, "num_tokens": 380186862.0, "step": 11912 }, { "entropy": 0.5858313236385584, "epoch": 1.0960546517846361, "grad_norm": 0.15565459430217743, "learning_rate": 6.346796700095073e-05, "loss": 0.5685, "mean_token_accuracy": 0.8248612321913242, "num_tokens": 380218460.0, "step": 11913 }, { "entropy": 0.5003202706575394, "epoch": 1.0961466581560773, "grad_norm": 0.15193094313144684, "learning_rate": 6.34649001748091e-05, "loss": 0.4906, "mean_token_accuracy": 0.8449903354048729, "num_tokens": 380249646.0, "step": 11914 }, { "entropy": 0.5564770624041557, "epoch": 1.0962386645275186, "grad_norm": 0.15088704228401184, "learning_rate": 6.346183334866747e-05, "loss": 0.5299, "mean_token_accuracy": 0.8355957008898258, "num_tokens": 380281728.0, "step": 11915 }, { "entropy": 0.6279805079102516, "epoch": 1.0963306708989597, "grad_norm": 0.15901923179626465, "learning_rate": 6.345876652252583e-05, "loss": 0.6178, "mean_token_accuracy": 0.812587209045887, "num_tokens": 380313833.0, "step": 11916 }, { "entropy": 0.6072670286521316, "epoch": 1.0964226772704009, "grad_norm": 0.15542295575141907, "learning_rate": 6.345569969638421e-05, "loss": 0.6014, "mean_token_accuracy": 0.8137932792305946, "num_tokens": 380344958.0, "step": 11917 }, { "entropy": 0.6041550878435373, "epoch": 1.0965146836418422, "grad_norm": 0.15693417191505432, "learning_rate": 6.34526328702426e-05, "loss": 0.5847, "mean_token_accuracy": 0.8227629661560059, "num_tokens": 380376924.0, "step": 11918 }, { "entropy": 0.5667641870677471, "epoch": 1.0966066900132834, "grad_norm": 0.16103875637054443, "learning_rate": 6.344956604410096e-05, "loss": 0.5381, "mean_token_accuracy": 0.8330463729798794, "num_tokens": 380408693.0, "step": 11919 }, { "entropy": 0.603081788867712, "epoch": 1.0966986963847247, "grad_norm": 0.16133926808834076, "learning_rate": 6.344649921795933e-05, "loss": 0.6005, "mean_token_accuracy": 0.815698079764843, "num_tokens": 380441005.0, "step": 11920 }, { "entropy": 0.6703418409451842, "epoch": 1.0967907027561659, "grad_norm": 0.16668850183486938, "learning_rate": 6.344343239181771e-05, "loss": 0.6515, "mean_token_accuracy": 0.7969161048531532, "num_tokens": 380472804.0, "step": 11921 }, { "entropy": 0.5311009967699647, "epoch": 1.096882709127607, "grad_norm": 0.15422064065933228, "learning_rate": 6.344036556567608e-05, "loss": 0.514, "mean_token_accuracy": 0.8387220241129398, "num_tokens": 380504786.0, "step": 11922 }, { "entropy": 0.588913245126605, "epoch": 1.0969747154990483, "grad_norm": 0.15502120554447174, "learning_rate": 6.343729873953446e-05, "loss": 0.5805, "mean_token_accuracy": 0.8271403945982456, "num_tokens": 380537377.0, "step": 11923 }, { "entropy": 0.7171002868562937, "epoch": 1.0970667218704895, "grad_norm": 0.1582155078649521, "learning_rate": 6.343423191339283e-05, "loss": 0.6997, "mean_token_accuracy": 0.7899828962981701, "num_tokens": 380569718.0, "step": 11924 }, { "entropy": 0.6979609187692404, "epoch": 1.0971587282419308, "grad_norm": 0.16427826881408691, "learning_rate": 6.343116508725121e-05, "loss": 0.6905, "mean_token_accuracy": 0.7904232703149319, "num_tokens": 380601255.0, "step": 11925 }, { "entropy": 0.6573767345398664, "epoch": 1.097250734613372, "grad_norm": 0.16941416263580322, "learning_rate": 6.342809826110958e-05, "loss": 0.6397, "mean_token_accuracy": 0.8011911362409592, "num_tokens": 380632831.0, "step": 11926 }, { "entropy": 0.6188094457611442, "epoch": 1.097342740984813, "grad_norm": 0.1624142974615097, "learning_rate": 6.342503143496795e-05, "loss": 0.6143, "mean_token_accuracy": 0.811731856316328, "num_tokens": 380665105.0, "step": 11927 }, { "entropy": 0.8326420709490776, "epoch": 1.0974347473562545, "grad_norm": 0.16903331875801086, "learning_rate": 6.342196460882633e-05, "loss": 0.8308, "mean_token_accuracy": 0.7535650096833706, "num_tokens": 380697180.0, "step": 11928 }, { "entropy": 0.6229967633262277, "epoch": 1.0975267537276956, "grad_norm": 0.15552392601966858, "learning_rate": 6.341889778268471e-05, "loss": 0.6139, "mean_token_accuracy": 0.813365500420332, "num_tokens": 380728257.0, "step": 11929 }, { "entropy": 0.7006345577538013, "epoch": 1.097618760099137, "grad_norm": 0.16479505598545074, "learning_rate": 6.341583095654308e-05, "loss": 0.6939, "mean_token_accuracy": 0.7903308942914009, "num_tokens": 380759940.0, "step": 11930 }, { "entropy": 0.6507134847342968, "epoch": 1.097710766470578, "grad_norm": 0.15576288104057312, "learning_rate": 6.341276413040145e-05, "loss": 0.6419, "mean_token_accuracy": 0.8047078065574169, "num_tokens": 380792013.0, "step": 11931 }, { "entropy": 0.5872362591326237, "epoch": 1.0978027728420192, "grad_norm": 0.16941745579242706, "learning_rate": 6.340969730425983e-05, "loss": 0.5828, "mean_token_accuracy": 0.8229987509548664, "num_tokens": 380823409.0, "step": 11932 }, { "entropy": 0.6890586353838444, "epoch": 1.0978947792134606, "grad_norm": 0.17416314780712128, "learning_rate": 6.34066304781182e-05, "loss": 0.677, "mean_token_accuracy": 0.7941144444048405, "num_tokens": 380854788.0, "step": 11933 }, { "entropy": 0.7644546665251255, "epoch": 1.0979867855849017, "grad_norm": 0.16856995224952698, "learning_rate": 6.340356365197658e-05, "loss": 0.7454, "mean_token_accuracy": 0.7745496071875095, "num_tokens": 380886975.0, "step": 11934 }, { "entropy": 0.6490277796983719, "epoch": 1.098078791956343, "grad_norm": 0.16346299648284912, "learning_rate": 6.340049682583494e-05, "loss": 0.6491, "mean_token_accuracy": 0.8026683926582336, "num_tokens": 380918924.0, "step": 11935 }, { "entropy": 0.542554852552712, "epoch": 1.0981707983277842, "grad_norm": 0.15981094539165497, "learning_rate": 6.339742999969333e-05, "loss": 0.5327, "mean_token_accuracy": 0.837152224034071, "num_tokens": 380950819.0, "step": 11936 }, { "entropy": 0.6335855768993497, "epoch": 1.0982628046992253, "grad_norm": 0.15793505311012268, "learning_rate": 6.33943631735517e-05, "loss": 0.6277, "mean_token_accuracy": 0.8090160898864269, "num_tokens": 380983174.0, "step": 11937 }, { "entropy": 0.708765484392643, "epoch": 1.0983548110706667, "grad_norm": 0.16256099939346313, "learning_rate": 6.339129634741006e-05, "loss": 0.7045, "mean_token_accuracy": 0.7873159572482109, "num_tokens": 381014450.0, "step": 11938 }, { "entropy": 0.5869412049651146, "epoch": 1.0984468174421078, "grad_norm": 0.15997889637947083, "learning_rate": 6.338822952126844e-05, "loss": 0.572, "mean_token_accuracy": 0.8239392302930355, "num_tokens": 381045122.0, "step": 11939 }, { "entropy": 0.628399464301765, "epoch": 1.0985388238135492, "grad_norm": 0.15890677273273468, "learning_rate": 6.338516269512682e-05, "loss": 0.6092, "mean_token_accuracy": 0.811918817460537, "num_tokens": 381076882.0, "step": 11940 }, { "entropy": 0.6837815158069134, "epoch": 1.0986308301849903, "grad_norm": 0.1632758527994156, "learning_rate": 6.338209586898519e-05, "loss": 0.6656, "mean_token_accuracy": 0.8014768958091736, "num_tokens": 381109174.0, "step": 11941 }, { "entropy": 0.568936213850975, "epoch": 1.0987228365564314, "grad_norm": 0.15907713770866394, "learning_rate": 6.337902904284356e-05, "loss": 0.554, "mean_token_accuracy": 0.8282151706516743, "num_tokens": 381141611.0, "step": 11942 }, { "entropy": 0.6307819448411465, "epoch": 1.0988148429278728, "grad_norm": 0.15843963623046875, "learning_rate": 6.337596221670193e-05, "loss": 0.6035, "mean_token_accuracy": 0.8143111281096935, "num_tokens": 381173022.0, "step": 11943 }, { "entropy": 0.6631115898489952, "epoch": 1.098906849299314, "grad_norm": 0.16678956151008606, "learning_rate": 6.337289539056031e-05, "loss": 0.6536, "mean_token_accuracy": 0.8045660257339478, "num_tokens": 381203971.0, "step": 11944 }, { "entropy": 0.6286183726042509, "epoch": 1.0989988556707553, "grad_norm": 0.1566656231880188, "learning_rate": 6.336982856441869e-05, "loss": 0.6151, "mean_token_accuracy": 0.8071400374174118, "num_tokens": 381235485.0, "step": 11945 }, { "entropy": 0.6711976109072566, "epoch": 1.0990908620421964, "grad_norm": 0.16222146153450012, "learning_rate": 6.336676173827706e-05, "loss": 0.6531, "mean_token_accuracy": 0.8032673485577106, "num_tokens": 381267699.0, "step": 11946 }, { "entropy": 0.6371101979166269, "epoch": 1.0991828684136375, "grad_norm": 0.1563735157251358, "learning_rate": 6.336369491213543e-05, "loss": 0.6293, "mean_token_accuracy": 0.8034535050392151, "num_tokens": 381300110.0, "step": 11947 }, { "entropy": 0.6191577352583408, "epoch": 1.099274874785079, "grad_norm": 0.17147879302501678, "learning_rate": 6.336062808599381e-05, "loss": 0.6026, "mean_token_accuracy": 0.8132533207535744, "num_tokens": 381331583.0, "step": 11948 }, { "entropy": 0.6173294028267264, "epoch": 1.09936688115652, "grad_norm": 0.1576484590768814, "learning_rate": 6.335756125985219e-05, "loss": 0.6031, "mean_token_accuracy": 0.8149766698479652, "num_tokens": 381363224.0, "step": 11949 }, { "entropy": 0.6226806100457907, "epoch": 1.0994588875279614, "grad_norm": 0.14877699315547943, "learning_rate": 6.335449443371056e-05, "loss": 0.6181, "mean_token_accuracy": 0.8086972497403622, "num_tokens": 381395877.0, "step": 11950 }, { "entropy": 0.4571898225694895, "epoch": 1.0995508938994025, "grad_norm": 0.1599913090467453, "learning_rate": 6.335142760756893e-05, "loss": 0.4397, "mean_token_accuracy": 0.8645159490406513, "num_tokens": 381428187.0, "step": 11951 }, { "entropy": 0.630360608920455, "epoch": 1.0996429002708437, "grad_norm": 0.16002051532268524, "learning_rate": 6.33483607814273e-05, "loss": 0.6119, "mean_token_accuracy": 0.808208454400301, "num_tokens": 381460215.0, "step": 11952 }, { "entropy": 0.6757314652204514, "epoch": 1.099734906642285, "grad_norm": 0.15840883553028107, "learning_rate": 6.334529395528567e-05, "loss": 0.6679, "mean_token_accuracy": 0.7953606210649014, "num_tokens": 381492695.0, "step": 11953 }, { "entropy": 0.6195656713098288, "epoch": 1.0998269130137261, "grad_norm": 0.15680500864982605, "learning_rate": 6.334222712914406e-05, "loss": 0.6087, "mean_token_accuracy": 0.8105012588202953, "num_tokens": 381525363.0, "step": 11954 }, { "entropy": 0.791356410831213, "epoch": 1.0999189193851675, "grad_norm": 0.17451339960098267, "learning_rate": 6.333916030300242e-05, "loss": 0.7783, "mean_token_accuracy": 0.7643240690231323, "num_tokens": 381556429.0, "step": 11955 }, { "entropy": 0.6430069906637073, "epoch": 1.1000109257566086, "grad_norm": 0.1677086502313614, "learning_rate": 6.33360934768608e-05, "loss": 0.6234, "mean_token_accuracy": 0.8096400983631611, "num_tokens": 381588348.0, "step": 11956 }, { "entropy": 0.594147227704525, "epoch": 1.1001029321280498, "grad_norm": 0.15782730281352997, "learning_rate": 6.333302665071917e-05, "loss": 0.5719, "mean_token_accuracy": 0.8182265236973763, "num_tokens": 381619908.0, "step": 11957 }, { "entropy": 0.6506288843229413, "epoch": 1.1001949384994911, "grad_norm": 0.1632167249917984, "learning_rate": 6.332995982457754e-05, "loss": 0.6325, "mean_token_accuracy": 0.8108272813260555, "num_tokens": 381652147.0, "step": 11958 }, { "entropy": 0.586180504411459, "epoch": 1.1002869448709323, "grad_norm": 0.1586458683013916, "learning_rate": 6.332689299843592e-05, "loss": 0.5794, "mean_token_accuracy": 0.8243829756975174, "num_tokens": 381682857.0, "step": 11959 }, { "entropy": 0.6522474158555269, "epoch": 1.1003789512423736, "grad_norm": 0.15678897500038147, "learning_rate": 6.33238261722943e-05, "loss": 0.6392, "mean_token_accuracy": 0.803611233830452, "num_tokens": 381714784.0, "step": 11960 }, { "entropy": 0.5447798287495971, "epoch": 1.1004709576138147, "grad_norm": 0.1668032556772232, "learning_rate": 6.332075934615267e-05, "loss": 0.5348, "mean_token_accuracy": 0.8351547345519066, "num_tokens": 381746834.0, "step": 11961 }, { "entropy": 0.6587655022740364, "epoch": 1.1005629639852559, "grad_norm": 0.16587460041046143, "learning_rate": 6.331769252001104e-05, "loss": 0.6653, "mean_token_accuracy": 0.7994803078472614, "num_tokens": 381779096.0, "step": 11962 }, { "entropy": 0.5222017737105489, "epoch": 1.1006549703566972, "grad_norm": 0.15956899523735046, "learning_rate": 6.331462569386942e-05, "loss": 0.5029, "mean_token_accuracy": 0.8452509231865406, "num_tokens": 381811006.0, "step": 11963 }, { "entropy": 0.6545507432892919, "epoch": 1.1007469767281384, "grad_norm": 0.1564396470785141, "learning_rate": 6.331155886772779e-05, "loss": 0.6398, "mean_token_accuracy": 0.8037366680800915, "num_tokens": 381843183.0, "step": 11964 }, { "entropy": 0.6679178923368454, "epoch": 1.1008389830995797, "grad_norm": 0.16202862560749054, "learning_rate": 6.330849204158617e-05, "loss": 0.6647, "mean_token_accuracy": 0.798310961574316, "num_tokens": 381874374.0, "step": 11965 }, { "entropy": 0.6865989421494305, "epoch": 1.1009309894710209, "grad_norm": 0.1588037610054016, "learning_rate": 6.330542521544454e-05, "loss": 0.6805, "mean_token_accuracy": 0.7994368523359299, "num_tokens": 381906392.0, "step": 11966 }, { "entropy": 0.7967787981033325, "epoch": 1.101022995842462, "grad_norm": 0.1654234528541565, "learning_rate": 6.330235838930292e-05, "loss": 0.8002, "mean_token_accuracy": 0.7629780098795891, "num_tokens": 381938530.0, "step": 11967 }, { "entropy": 0.6995074637234211, "epoch": 1.1011150022139033, "grad_norm": 0.1583458036184311, "learning_rate": 6.329929156316129e-05, "loss": 0.6901, "mean_token_accuracy": 0.7887689024209976, "num_tokens": 381970562.0, "step": 11968 }, { "entropy": 0.6859185509383678, "epoch": 1.1012070085853445, "grad_norm": 0.16259123384952545, "learning_rate": 6.329622473701966e-05, "loss": 0.687, "mean_token_accuracy": 0.7919819094240665, "num_tokens": 382001960.0, "step": 11969 }, { "entropy": 0.721027310937643, "epoch": 1.1012990149567858, "grad_norm": 0.1599176526069641, "learning_rate": 6.329315791087804e-05, "loss": 0.7018, "mean_token_accuracy": 0.7831134870648384, "num_tokens": 382034210.0, "step": 11970 }, { "entropy": 0.5695859137922525, "epoch": 1.101391021328227, "grad_norm": 0.1586872786283493, "learning_rate": 6.329009108473642e-05, "loss": 0.5451, "mean_token_accuracy": 0.8345566801726818, "num_tokens": 382066654.0, "step": 11971 }, { "entropy": 0.5998999401926994, "epoch": 1.101483027699668, "grad_norm": 0.16278602182865143, "learning_rate": 6.328702425859479e-05, "loss": 0.5892, "mean_token_accuracy": 0.8229323662817478, "num_tokens": 382099237.0, "step": 11972 }, { "entropy": 0.6706593707203865, "epoch": 1.1015750340711095, "grad_norm": 0.16380295157432556, "learning_rate": 6.328395743245315e-05, "loss": 0.6433, "mean_token_accuracy": 0.806949183344841, "num_tokens": 382131522.0, "step": 11973 }, { "entropy": 0.5711197732016444, "epoch": 1.1016670404425506, "grad_norm": 0.15031611919403076, "learning_rate": 6.328089060631152e-05, "loss": 0.5574, "mean_token_accuracy": 0.8254853449761868, "num_tokens": 382163985.0, "step": 11974 }, { "entropy": 0.6687174532562494, "epoch": 1.101759046813992, "grad_norm": 0.16317394375801086, "learning_rate": 6.32778237801699e-05, "loss": 0.6375, "mean_token_accuracy": 0.8033119663596153, "num_tokens": 382195717.0, "step": 11975 }, { "entropy": 0.7160703279078007, "epoch": 1.101851053185433, "grad_norm": 0.15577921271324158, "learning_rate": 6.327475695402828e-05, "loss": 0.6903, "mean_token_accuracy": 0.7890835590660572, "num_tokens": 382227732.0, "step": 11976 }, { "entropy": 0.520350469276309, "epoch": 1.1019430595568742, "grad_norm": 0.15034909546375275, "learning_rate": 6.327169012788665e-05, "loss": 0.5087, "mean_token_accuracy": 0.8396522663533688, "num_tokens": 382260270.0, "step": 11977 }, { "entropy": 0.627936314791441, "epoch": 1.1020350659283156, "grad_norm": 0.1531105488538742, "learning_rate": 6.326862330174502e-05, "loss": 0.6072, "mean_token_accuracy": 0.8124030530452728, "num_tokens": 382292011.0, "step": 11978 }, { "entropy": 0.5766855692490935, "epoch": 1.1021270722997567, "grad_norm": 0.15559548139572144, "learning_rate": 6.32655564756034e-05, "loss": 0.554, "mean_token_accuracy": 0.8248195685446262, "num_tokens": 382323030.0, "step": 11979 }, { "entropy": 0.58954325504601, "epoch": 1.102219078671198, "grad_norm": 0.15747672319412231, "learning_rate": 6.326248964946177e-05, "loss": 0.5898, "mean_token_accuracy": 0.8143748603761196, "num_tokens": 382354424.0, "step": 11980 }, { "entropy": 0.5682789254933596, "epoch": 1.1023110850426392, "grad_norm": 0.1492757946252823, "learning_rate": 6.325942282332015e-05, "loss": 0.5569, "mean_token_accuracy": 0.8241319172084332, "num_tokens": 382385905.0, "step": 11981 }, { "entropy": 0.5835724920034409, "epoch": 1.1024030914140803, "grad_norm": 0.160687655210495, "learning_rate": 6.325635599717852e-05, "loss": 0.5693, "mean_token_accuracy": 0.8245355524122715, "num_tokens": 382418162.0, "step": 11982 }, { "entropy": 0.5771518899127841, "epoch": 1.1024950977855217, "grad_norm": 0.17331644892692566, "learning_rate": 6.32532891710369e-05, "loss": 0.5639, "mean_token_accuracy": 0.8248582482337952, "num_tokens": 382449937.0, "step": 11983 }, { "entropy": 0.6031269682571292, "epoch": 1.1025871041569628, "grad_norm": 0.15962396562099457, "learning_rate": 6.325022234489527e-05, "loss": 0.5979, "mean_token_accuracy": 0.8146620728075504, "num_tokens": 382482540.0, "step": 11984 }, { "entropy": 0.6717560794204473, "epoch": 1.1026791105284042, "grad_norm": 0.16206161677837372, "learning_rate": 6.324715551875364e-05, "loss": 0.6582, "mean_token_accuracy": 0.7978860847651958, "num_tokens": 382514603.0, "step": 11985 }, { "entropy": 0.6009036041796207, "epoch": 1.1027711168998453, "grad_norm": 0.1585412621498108, "learning_rate": 6.324408869261202e-05, "loss": 0.5925, "mean_token_accuracy": 0.8179527893662453, "num_tokens": 382546082.0, "step": 11986 }, { "entropy": 0.6890031443908811, "epoch": 1.1028631232712864, "grad_norm": 0.16296343505382538, "learning_rate": 6.32410218664704e-05, "loss": 0.6788, "mean_token_accuracy": 0.7952912747859955, "num_tokens": 382578475.0, "step": 11987 }, { "entropy": 0.5952843073755503, "epoch": 1.1029551296427278, "grad_norm": 0.1603439897298813, "learning_rate": 6.323795504032877e-05, "loss": 0.5849, "mean_token_accuracy": 0.8173780180513859, "num_tokens": 382610096.0, "step": 11988 }, { "entropy": 0.5689821811392903, "epoch": 1.103047136014169, "grad_norm": 0.15598522126674652, "learning_rate": 6.323488821418713e-05, "loss": 0.554, "mean_token_accuracy": 0.8271706104278564, "num_tokens": 382641970.0, "step": 11989 }, { "entropy": 0.6854412276297808, "epoch": 1.1031391423856103, "grad_norm": 0.17028091847896576, "learning_rate": 6.323182138804552e-05, "loss": 0.6727, "mean_token_accuracy": 0.7930016592144966, "num_tokens": 382673252.0, "step": 11990 }, { "entropy": 0.6088428245857358, "epoch": 1.1032311487570514, "grad_norm": 0.16098040342330933, "learning_rate": 6.32287545619039e-05, "loss": 0.6026, "mean_token_accuracy": 0.8148465901613235, "num_tokens": 382704948.0, "step": 11991 }, { "entropy": 0.6013772636651993, "epoch": 1.1033231551284925, "grad_norm": 0.15744563937187195, "learning_rate": 6.322568773576227e-05, "loss": 0.5959, "mean_token_accuracy": 0.8200106769800186, "num_tokens": 382737144.0, "step": 11992 }, { "entropy": 0.6751821972429752, "epoch": 1.103415161499934, "grad_norm": 0.16724829375743866, "learning_rate": 6.322262090962063e-05, "loss": 0.6633, "mean_token_accuracy": 0.7977272048592567, "num_tokens": 382769424.0, "step": 11993 }, { "entropy": 0.5878638164140284, "epoch": 1.103507167871375, "grad_norm": 0.16226014494895935, "learning_rate": 6.321955408347901e-05, "loss": 0.5756, "mean_token_accuracy": 0.8262227773666382, "num_tokens": 382801588.0, "step": 11994 }, { "entropy": 0.7246158961206675, "epoch": 1.1035991742428164, "grad_norm": 0.17125514149665833, "learning_rate": 6.321648725733738e-05, "loss": 0.712, "mean_token_accuracy": 0.7883660085499287, "num_tokens": 382833664.0, "step": 11995 }, { "entropy": 0.7271316573023796, "epoch": 1.1036911806142575, "grad_norm": 0.17550769448280334, "learning_rate": 6.321342043119576e-05, "loss": 0.719, "mean_token_accuracy": 0.7800336070358753, "num_tokens": 382864504.0, "step": 11996 }, { "entropy": 0.5514501570723951, "epoch": 1.1037831869856987, "grad_norm": 0.1550539880990982, "learning_rate": 6.321035360505413e-05, "loss": 0.5409, "mean_token_accuracy": 0.8344113454222679, "num_tokens": 382896820.0, "step": 11997 }, { "entropy": 0.6465871091932058, "epoch": 1.10387519335714, "grad_norm": 0.16534429788589478, "learning_rate": 6.320728677891251e-05, "loss": 0.6318, "mean_token_accuracy": 0.8025892004370689, "num_tokens": 382927918.0, "step": 11998 }, { "entropy": 0.6107212156057358, "epoch": 1.1039671997285811, "grad_norm": 0.15835008025169373, "learning_rate": 6.320421995277088e-05, "loss": 0.5948, "mean_token_accuracy": 0.8161421529948711, "num_tokens": 382959738.0, "step": 11999 }, { "entropy": 0.5931877382099628, "epoch": 1.1040592061000225, "grad_norm": 0.15515421330928802, "learning_rate": 6.320115312662925e-05, "loss": 0.5693, "mean_token_accuracy": 0.8228791356086731, "num_tokens": 382992079.0, "step": 12000 }, { "entropy": 0.6094473283737898, "epoch": 1.1041512124714636, "grad_norm": 0.16292496025562286, "learning_rate": 6.319808630048763e-05, "loss": 0.5945, "mean_token_accuracy": 0.8226769156754017, "num_tokens": 383024661.0, "step": 12001 }, { "entropy": 0.6634793616831303, "epoch": 1.1042432188429048, "grad_norm": 0.15795069932937622, "learning_rate": 6.319501947434601e-05, "loss": 0.6425, "mean_token_accuracy": 0.8029317706823349, "num_tokens": 383057068.0, "step": 12002 }, { "entropy": 0.6376544609665871, "epoch": 1.1043352252143461, "grad_norm": 0.1588907092809677, "learning_rate": 6.319195264820438e-05, "loss": 0.6273, "mean_token_accuracy": 0.8094801492989063, "num_tokens": 383089272.0, "step": 12003 }, { "entropy": 0.5416455622762442, "epoch": 1.1044272315857873, "grad_norm": 0.15834888815879822, "learning_rate": 6.318888582206275e-05, "loss": 0.5134, "mean_token_accuracy": 0.8383303321897984, "num_tokens": 383120982.0, "step": 12004 }, { "entropy": 0.5758941103704274, "epoch": 1.1045192379572286, "grad_norm": 0.15816035866737366, "learning_rate": 6.318581899592112e-05, "loss": 0.561, "mean_token_accuracy": 0.8268836252391338, "num_tokens": 383153463.0, "step": 12005 }, { "entropy": 0.5869226567447186, "epoch": 1.1046112443286698, "grad_norm": 0.1621537059545517, "learning_rate": 6.31827521697795e-05, "loss": 0.5612, "mean_token_accuracy": 0.826030895113945, "num_tokens": 383185408.0, "step": 12006 }, { "entropy": 0.5731405122205615, "epoch": 1.1047032507001109, "grad_norm": 0.15770556032657623, "learning_rate": 6.317968534363788e-05, "loss": 0.5562, "mean_token_accuracy": 0.829423077404499, "num_tokens": 383217114.0, "step": 12007 }, { "entropy": 0.7190863359719515, "epoch": 1.1047952570715522, "grad_norm": 0.17109417915344238, "learning_rate": 6.317661851749625e-05, "loss": 0.7156, "mean_token_accuracy": 0.7829580716788769, "num_tokens": 383248402.0, "step": 12008 }, { "entropy": 0.5466786315664649, "epoch": 1.1048872634429934, "grad_norm": 0.14585916697978973, "learning_rate": 6.317355169135461e-05, "loss": 0.5304, "mean_token_accuracy": 0.8320934809744358, "num_tokens": 383279870.0, "step": 12009 }, { "entropy": 0.6163487443700433, "epoch": 1.1049792698144347, "grad_norm": 0.16105104982852936, "learning_rate": 6.3170484865213e-05, "loss": 0.6207, "mean_token_accuracy": 0.8124691024422646, "num_tokens": 383312010.0, "step": 12010 }, { "entropy": 0.4792287051677704, "epoch": 1.1050712761858759, "grad_norm": 0.15534374117851257, "learning_rate": 6.316741803907136e-05, "loss": 0.4734, "mean_token_accuracy": 0.8504989221692085, "num_tokens": 383343525.0, "step": 12011 }, { "entropy": 0.5634260438382626, "epoch": 1.105163282557317, "grad_norm": 0.16159643232822418, "learning_rate": 6.316435121292974e-05, "loss": 0.5568, "mean_token_accuracy": 0.827612716704607, "num_tokens": 383375313.0, "step": 12012 }, { "entropy": 0.6184499431401491, "epoch": 1.1052552889287584, "grad_norm": 0.15579114854335785, "learning_rate": 6.316128438678811e-05, "loss": 0.6204, "mean_token_accuracy": 0.8122921325266361, "num_tokens": 383407591.0, "step": 12013 }, { "entropy": 0.6359606646001339, "epoch": 1.1053472953001995, "grad_norm": 0.1558522880077362, "learning_rate": 6.31582175606465e-05, "loss": 0.608, "mean_token_accuracy": 0.8139837309718132, "num_tokens": 383439347.0, "step": 12014 }, { "entropy": 0.6228372287005186, "epoch": 1.1054393016716408, "grad_norm": 0.1675879806280136, "learning_rate": 6.315515073450486e-05, "loss": 0.6175, "mean_token_accuracy": 0.8073762468993664, "num_tokens": 383471846.0, "step": 12015 }, { "entropy": 0.6497380696237087, "epoch": 1.105531308043082, "grad_norm": 0.16210828721523285, "learning_rate": 6.315208390836323e-05, "loss": 0.6289, "mean_token_accuracy": 0.8060955815017223, "num_tokens": 383503628.0, "step": 12016 }, { "entropy": 0.5616650767624378, "epoch": 1.105623314414523, "grad_norm": 0.14947886765003204, "learning_rate": 6.314901708222161e-05, "loss": 0.5419, "mean_token_accuracy": 0.8297236263751984, "num_tokens": 383535217.0, "step": 12017 }, { "entropy": 0.521446275524795, "epoch": 1.1057153207859645, "grad_norm": 0.14871874451637268, "learning_rate": 6.314595025607999e-05, "loss": 0.515, "mean_token_accuracy": 0.8470627814531326, "num_tokens": 383567985.0, "step": 12018 }, { "entropy": 0.5831917012110353, "epoch": 1.1058073271574056, "grad_norm": 0.15154601633548737, "learning_rate": 6.314288342993836e-05, "loss": 0.5665, "mean_token_accuracy": 0.8252966180443764, "num_tokens": 383599727.0, "step": 12019 }, { "entropy": 0.6270369291305542, "epoch": 1.105899333528847, "grad_norm": 0.1628337949514389, "learning_rate": 6.313981660379673e-05, "loss": 0.6018, "mean_token_accuracy": 0.8165284357964993, "num_tokens": 383631824.0, "step": 12020 }, { "entropy": 0.6122035942971706, "epoch": 1.105991339900288, "grad_norm": 0.16548223793506622, "learning_rate": 6.313674977765511e-05, "loss": 0.5983, "mean_token_accuracy": 0.8123471476137638, "num_tokens": 383663174.0, "step": 12021 }, { "entropy": 0.634098244830966, "epoch": 1.1060833462717292, "grad_norm": 0.15254315733909607, "learning_rate": 6.313368295151348e-05, "loss": 0.6152, "mean_token_accuracy": 0.8106791637837887, "num_tokens": 383695543.0, "step": 12022 }, { "entropy": 0.5666808634996414, "epoch": 1.1061753526431706, "grad_norm": 0.15094567835330963, "learning_rate": 6.313061612537186e-05, "loss": 0.5435, "mean_token_accuracy": 0.8299771957099438, "num_tokens": 383727049.0, "step": 12023 }, { "entropy": 0.6612866334617138, "epoch": 1.1062673590146117, "grad_norm": 0.1594214141368866, "learning_rate": 6.312754929923023e-05, "loss": 0.6425, "mean_token_accuracy": 0.8053527288138866, "num_tokens": 383759768.0, "step": 12024 }, { "entropy": 0.5612829886376858, "epoch": 1.106359365386053, "grad_norm": 0.15662670135498047, "learning_rate": 6.312448247308861e-05, "loss": 0.549, "mean_token_accuracy": 0.8318228349089622, "num_tokens": 383791320.0, "step": 12025 }, { "entropy": 0.6920330030843616, "epoch": 1.1064513717574942, "grad_norm": 0.16984252631664276, "learning_rate": 6.312141564694698e-05, "loss": 0.6573, "mean_token_accuracy": 0.8036328256130219, "num_tokens": 383822869.0, "step": 12026 }, { "entropy": 0.6836907491087914, "epoch": 1.1065433781289353, "grad_norm": 0.16968178749084473, "learning_rate": 6.311834882080534e-05, "loss": 0.6672, "mean_token_accuracy": 0.7990001924335957, "num_tokens": 383854050.0, "step": 12027 }, { "entropy": 0.6578105939552188, "epoch": 1.1066353845003767, "grad_norm": 0.1600983589887619, "learning_rate": 6.311528199466373e-05, "loss": 0.6363, "mean_token_accuracy": 0.8074147403240204, "num_tokens": 383886326.0, "step": 12028 }, { "entropy": 0.6586362197995186, "epoch": 1.1067273908718178, "grad_norm": 0.16297981142997742, "learning_rate": 6.311221516852211e-05, "loss": 0.6473, "mean_token_accuracy": 0.8048132210969925, "num_tokens": 383918382.0, "step": 12029 }, { "entropy": 0.6342771155759692, "epoch": 1.1068193972432592, "grad_norm": 0.15569394826889038, "learning_rate": 6.310914834238047e-05, "loss": 0.6259, "mean_token_accuracy": 0.8054095506668091, "num_tokens": 383951080.0, "step": 12030 }, { "entropy": 0.5376173630356789, "epoch": 1.1069114036147003, "grad_norm": 0.15627673268318176, "learning_rate": 6.310608151623884e-05, "loss": 0.5297, "mean_token_accuracy": 0.8374940678477287, "num_tokens": 383983710.0, "step": 12031 }, { "entropy": 0.5390506722033024, "epoch": 1.1070034099861414, "grad_norm": 0.154277503490448, "learning_rate": 6.310301469009721e-05, "loss": 0.525, "mean_token_accuracy": 0.8363459333777428, "num_tokens": 384015217.0, "step": 12032 }, { "entropy": 0.6866044532507658, "epoch": 1.1070954163575828, "grad_norm": 0.1676957905292511, "learning_rate": 6.30999478639556e-05, "loss": 0.6742, "mean_token_accuracy": 0.7978359200060368, "num_tokens": 384047529.0, "step": 12033 }, { "entropy": 0.8098901025950909, "epoch": 1.107187422729024, "grad_norm": 0.17234432697296143, "learning_rate": 6.309688103781397e-05, "loss": 0.814, "mean_token_accuracy": 0.7552516683936119, "num_tokens": 384079634.0, "step": 12034 }, { "entropy": 0.5860696099698544, "epoch": 1.1072794291004653, "grad_norm": 0.1615850031375885, "learning_rate": 6.309381421167234e-05, "loss": 0.5695, "mean_token_accuracy": 0.8246820792555809, "num_tokens": 384111600.0, "step": 12035 }, { "entropy": 0.5879472447559237, "epoch": 1.1073714354719064, "grad_norm": 0.1563267707824707, "learning_rate": 6.309074738553071e-05, "loss": 0.5956, "mean_token_accuracy": 0.817957628518343, "num_tokens": 384142864.0, "step": 12036 }, { "entropy": 0.6467847560998052, "epoch": 1.1074634418433476, "grad_norm": 0.14972388744354248, "learning_rate": 6.308768055938909e-05, "loss": 0.629, "mean_token_accuracy": 0.8058601655066013, "num_tokens": 384174910.0, "step": 12037 }, { "entropy": 0.6174280717968941, "epoch": 1.107555448214789, "grad_norm": 0.16824491322040558, "learning_rate": 6.308461373324747e-05, "loss": 0.601, "mean_token_accuracy": 0.8205983266234398, "num_tokens": 384207075.0, "step": 12038 }, { "entropy": 0.5935301668941975, "epoch": 1.10764745458623, "grad_norm": 0.15920902788639069, "learning_rate": 6.308154690710584e-05, "loss": 0.5781, "mean_token_accuracy": 0.8200115971267223, "num_tokens": 384237643.0, "step": 12039 }, { "entropy": 0.6400418179109693, "epoch": 1.1077394609576714, "grad_norm": 0.1610008180141449, "learning_rate": 6.307848008096421e-05, "loss": 0.6301, "mean_token_accuracy": 0.8065466955304146, "num_tokens": 384269897.0, "step": 12040 }, { "entropy": 0.6438258457928896, "epoch": 1.1078314673291125, "grad_norm": 0.15998513996601105, "learning_rate": 6.307541325482259e-05, "loss": 0.6279, "mean_token_accuracy": 0.8082853630185127, "num_tokens": 384301933.0, "step": 12041 }, { "entropy": 0.6157977469265461, "epoch": 1.1079234737005537, "grad_norm": 0.1536858081817627, "learning_rate": 6.307234642868096e-05, "loss": 0.6005, "mean_token_accuracy": 0.8104097284376621, "num_tokens": 384334184.0, "step": 12042 }, { "entropy": 0.5102575048804283, "epoch": 1.108015480071995, "grad_norm": 0.15157130360603333, "learning_rate": 6.306927960253934e-05, "loss": 0.4864, "mean_token_accuracy": 0.8468540459871292, "num_tokens": 384366385.0, "step": 12043 }, { "entropy": 0.6354872509837151, "epoch": 1.1081074864434362, "grad_norm": 0.15808744728565216, "learning_rate": 6.30662127763977e-05, "loss": 0.6181, "mean_token_accuracy": 0.80919548869133, "num_tokens": 384398113.0, "step": 12044 }, { "entropy": 0.6714009754359722, "epoch": 1.1081994928148775, "grad_norm": 0.16778218746185303, "learning_rate": 6.306314595025609e-05, "loss": 0.6487, "mean_token_accuracy": 0.7991227395832539, "num_tokens": 384429285.0, "step": 12045 }, { "entropy": 0.6176077537238598, "epoch": 1.1082914991863186, "grad_norm": 0.1582685112953186, "learning_rate": 6.306007912411446e-05, "loss": 0.5954, "mean_token_accuracy": 0.8169086761772633, "num_tokens": 384461300.0, "step": 12046 }, { "entropy": 0.7011028490960598, "epoch": 1.1083835055577598, "grad_norm": 0.16058394312858582, "learning_rate": 6.305701229797282e-05, "loss": 0.6925, "mean_token_accuracy": 0.7841862663626671, "num_tokens": 384492985.0, "step": 12047 }, { "entropy": 0.5950198192149401, "epoch": 1.1084755119292011, "grad_norm": 0.1590910702943802, "learning_rate": 6.30539454718312e-05, "loss": 0.5765, "mean_token_accuracy": 0.8234287537634373, "num_tokens": 384524605.0, "step": 12048 }, { "entropy": 0.6356653682887554, "epoch": 1.1085675183006423, "grad_norm": 0.1606191247701645, "learning_rate": 6.305087864568959e-05, "loss": 0.6306, "mean_token_accuracy": 0.8040268942713737, "num_tokens": 384556859.0, "step": 12049 }, { "entropy": 0.6857656296342611, "epoch": 1.1086595246720836, "grad_norm": 0.17119748890399933, "learning_rate": 6.304781181954795e-05, "loss": 0.6875, "mean_token_accuracy": 0.790591225028038, "num_tokens": 384588413.0, "step": 12050 }, { "entropy": 0.5832212101668119, "epoch": 1.1087515310435248, "grad_norm": 0.16215600073337555, "learning_rate": 6.304474499340632e-05, "loss": 0.5729, "mean_token_accuracy": 0.8214516714215279, "num_tokens": 384620101.0, "step": 12051 }, { "entropy": 0.5890526305884123, "epoch": 1.1088435374149659, "grad_norm": 0.14780138432979584, "learning_rate": 6.30416781672647e-05, "loss": 0.5795, "mean_token_accuracy": 0.8232779689133167, "num_tokens": 384652869.0, "step": 12052 }, { "entropy": 0.6441827863454819, "epoch": 1.1089355437864072, "grad_norm": 0.15569570660591125, "learning_rate": 6.303861134112307e-05, "loss": 0.6308, "mean_token_accuracy": 0.8067709356546402, "num_tokens": 384685100.0, "step": 12053 }, { "entropy": 0.5635609570890665, "epoch": 1.1090275501578484, "grad_norm": 0.15884777903556824, "learning_rate": 6.303554451498145e-05, "loss": 0.5635, "mean_token_accuracy": 0.8309917040169239, "num_tokens": 384716757.0, "step": 12054 }, { "entropy": 0.6347595984116197, "epoch": 1.1091195565292897, "grad_norm": 0.16154800355434418, "learning_rate": 6.303247768883982e-05, "loss": 0.6229, "mean_token_accuracy": 0.808841023594141, "num_tokens": 384747956.0, "step": 12055 }, { "entropy": 0.5751896044239402, "epoch": 1.1092115629007309, "grad_norm": 0.1590966433286667, "learning_rate": 6.30294108626982e-05, "loss": 0.5567, "mean_token_accuracy": 0.8329343982040882, "num_tokens": 384780374.0, "step": 12056 }, { "entropy": 0.6791312582790852, "epoch": 1.109303569272172, "grad_norm": 0.15807975828647614, "learning_rate": 6.302634403655657e-05, "loss": 0.6627, "mean_token_accuracy": 0.8023855537176132, "num_tokens": 384812671.0, "step": 12057 }, { "entropy": 0.6411737520247698, "epoch": 1.1093955756436134, "grad_norm": 0.16682231426239014, "learning_rate": 6.302327721041494e-05, "loss": 0.6242, "mean_token_accuracy": 0.8070715256035328, "num_tokens": 384843865.0, "step": 12058 }, { "entropy": 0.7089442908763885, "epoch": 1.1094875820150545, "grad_norm": 0.15862254798412323, "learning_rate": 6.302021038427332e-05, "loss": 0.6886, "mean_token_accuracy": 0.7916867621243, "num_tokens": 384875765.0, "step": 12059 }, { "entropy": 0.608628480695188, "epoch": 1.1095795883864958, "grad_norm": 0.15795181691646576, "learning_rate": 6.30171435581317e-05, "loss": 0.604, "mean_token_accuracy": 0.8168815039098263, "num_tokens": 384907664.0, "step": 12060 }, { "entropy": 0.5973829217255116, "epoch": 1.109671594757937, "grad_norm": 0.15960852801799774, "learning_rate": 6.301407673199007e-05, "loss": 0.596, "mean_token_accuracy": 0.817391712218523, "num_tokens": 384940167.0, "step": 12061 }, { "entropy": 0.6763542108237743, "epoch": 1.109763601129378, "grad_norm": 0.1610650271177292, "learning_rate": 6.301100990584844e-05, "loss": 0.6545, "mean_token_accuracy": 0.7973170392215252, "num_tokens": 384971494.0, "step": 12062 }, { "entropy": 0.6185367219150066, "epoch": 1.1098556075008195, "grad_norm": 0.16985516250133514, "learning_rate": 6.30079430797068e-05, "loss": 0.6103, "mean_token_accuracy": 0.8093392848968506, "num_tokens": 385002866.0, "step": 12063 }, { "entropy": 0.6328936573117971, "epoch": 1.1099476138722606, "grad_norm": 0.15534666180610657, "learning_rate": 6.300487625356519e-05, "loss": 0.611, "mean_token_accuracy": 0.8115195259451866, "num_tokens": 385034976.0, "step": 12064 }, { "entropy": 0.5021874122321606, "epoch": 1.110039620243702, "grad_norm": 0.15914025902748108, "learning_rate": 6.300180942742357e-05, "loss": 0.4812, "mean_token_accuracy": 0.8445672281086445, "num_tokens": 385066781.0, "step": 12065 }, { "entropy": 0.5888270568102598, "epoch": 1.110131626615143, "grad_norm": 0.1593174785375595, "learning_rate": 6.299874260128194e-05, "loss": 0.5886, "mean_token_accuracy": 0.8180723711848259, "num_tokens": 385097489.0, "step": 12066 }, { "entropy": 0.5332597168162465, "epoch": 1.1102236329865842, "grad_norm": 0.15605047345161438, "learning_rate": 6.29956757751403e-05, "loss": 0.51, "mean_token_accuracy": 0.8395263999700546, "num_tokens": 385128876.0, "step": 12067 }, { "entropy": 0.5677589206025004, "epoch": 1.1103156393580256, "grad_norm": 0.15770789980888367, "learning_rate": 6.299260894899868e-05, "loss": 0.5587, "mean_token_accuracy": 0.8278328068554401, "num_tokens": 385160900.0, "step": 12068 }, { "entropy": 0.6055639870464802, "epoch": 1.1104076457294667, "grad_norm": 0.1557881087064743, "learning_rate": 6.298954212285707e-05, "loss": 0.5836, "mean_token_accuracy": 0.8241402618587017, "num_tokens": 385192959.0, "step": 12069 }, { "entropy": 0.6115036141127348, "epoch": 1.110499652100908, "grad_norm": 0.1516178399324417, "learning_rate": 6.298647529671543e-05, "loss": 0.5775, "mean_token_accuracy": 0.8222318068146706, "num_tokens": 385224536.0, "step": 12070 }, { "entropy": 0.5980748003348708, "epoch": 1.1105916584723492, "grad_norm": 0.15914016962051392, "learning_rate": 6.29834084705738e-05, "loss": 0.5856, "mean_token_accuracy": 0.8204961195588112, "num_tokens": 385256190.0, "step": 12071 }, { "entropy": 0.6639385856688023, "epoch": 1.1106836648437903, "grad_norm": 0.17071960866451263, "learning_rate": 6.298034164443218e-05, "loss": 0.6518, "mean_token_accuracy": 0.8006869219243526, "num_tokens": 385287698.0, "step": 12072 }, { "entropy": 0.5065830959938467, "epoch": 1.1107756712152317, "grad_norm": 0.15250568091869354, "learning_rate": 6.297727481829055e-05, "loss": 0.4919, "mean_token_accuracy": 0.8461786471307278, "num_tokens": 385318748.0, "step": 12073 }, { "entropy": 0.6243943981826305, "epoch": 1.1108676775866728, "grad_norm": 0.1636541485786438, "learning_rate": 6.297420799214893e-05, "loss": 0.6215, "mean_token_accuracy": 0.8069710396230221, "num_tokens": 385350675.0, "step": 12074 }, { "entropy": 0.5877062268555164, "epoch": 1.1109596839581142, "grad_norm": 0.15758270025253296, "learning_rate": 6.29711411660073e-05, "loss": 0.5656, "mean_token_accuracy": 0.8242346234619617, "num_tokens": 385381797.0, "step": 12075 }, { "entropy": 0.7365130633115768, "epoch": 1.1110516903295553, "grad_norm": 0.16390351951122284, "learning_rate": 6.296807433986568e-05, "loss": 0.7175, "mean_token_accuracy": 0.7788845226168633, "num_tokens": 385413528.0, "step": 12076 }, { "entropy": 0.6805877778679132, "epoch": 1.1111436967009964, "grad_norm": 0.16608503460884094, "learning_rate": 6.296500751372405e-05, "loss": 0.6708, "mean_token_accuracy": 0.7958868220448494, "num_tokens": 385445327.0, "step": 12077 }, { "entropy": 0.6072870269417763, "epoch": 1.1112357030724378, "grad_norm": 0.16156841814517975, "learning_rate": 6.296194068758242e-05, "loss": 0.602, "mean_token_accuracy": 0.8164609670639038, "num_tokens": 385477541.0, "step": 12078 }, { "entropy": 0.5547613725066185, "epoch": 1.111327709443879, "grad_norm": 0.15913015604019165, "learning_rate": 6.29588738614408e-05, "loss": 0.5363, "mean_token_accuracy": 0.8373364247381687, "num_tokens": 385509264.0, "step": 12079 }, { "entropy": 0.745368167757988, "epoch": 1.1114197158153203, "grad_norm": 0.18012483417987823, "learning_rate": 6.295580703529918e-05, "loss": 0.7398, "mean_token_accuracy": 0.7756605222821236, "num_tokens": 385540722.0, "step": 12080 }, { "entropy": 0.634011797606945, "epoch": 1.1115117221867614, "grad_norm": 0.15897272527217865, "learning_rate": 6.295274020915755e-05, "loss": 0.6227, "mean_token_accuracy": 0.8134532012045383, "num_tokens": 385572362.0, "step": 12081 }, { "entropy": 0.6445634625852108, "epoch": 1.1116037285582026, "grad_norm": 0.1582200676202774, "learning_rate": 6.294967338301592e-05, "loss": 0.6337, "mean_token_accuracy": 0.8045937344431877, "num_tokens": 385604165.0, "step": 12082 }, { "entropy": 0.5892518889158964, "epoch": 1.111695734929644, "grad_norm": 0.16232439875602722, "learning_rate": 6.29466065568743e-05, "loss": 0.5813, "mean_token_accuracy": 0.8241766504943371, "num_tokens": 385636004.0, "step": 12083 }, { "entropy": 0.7152683772146702, "epoch": 1.111787741301085, "grad_norm": 0.16115818917751312, "learning_rate": 6.294353973073267e-05, "loss": 0.6971, "mean_token_accuracy": 0.7877790480852127, "num_tokens": 385668036.0, "step": 12084 }, { "entropy": 0.603926032781601, "epoch": 1.1118797476725264, "grad_norm": 0.16697411239147186, "learning_rate": 6.294047290459105e-05, "loss": 0.5965, "mean_token_accuracy": 0.8185357227921486, "num_tokens": 385700476.0, "step": 12085 }, { "entropy": 0.6513371579349041, "epoch": 1.1119717540439675, "grad_norm": 0.16492721438407898, "learning_rate": 6.293740607844941e-05, "loss": 0.6447, "mean_token_accuracy": 0.8028602339327335, "num_tokens": 385732739.0, "step": 12086 }, { "entropy": 0.639233355410397, "epoch": 1.1120637604154087, "grad_norm": 0.1632261574268341, "learning_rate": 6.29343392523078e-05, "loss": 0.6153, "mean_token_accuracy": 0.8130492232739925, "num_tokens": 385764607.0, "step": 12087 }, { "entropy": 0.5286483764648438, "epoch": 1.11215576678685, "grad_norm": 0.1603332757949829, "learning_rate": 6.293127242616616e-05, "loss": 0.5272, "mean_token_accuracy": 0.8382335156202316, "num_tokens": 385795858.0, "step": 12088 }, { "entropy": 0.6704924628138542, "epoch": 1.1122477731582912, "grad_norm": 0.16073234379291534, "learning_rate": 6.292820560002453e-05, "loss": 0.6503, "mean_token_accuracy": 0.7995770908892155, "num_tokens": 385827478.0, "step": 12089 }, { "entropy": 0.5992990285158157, "epoch": 1.1123397795297325, "grad_norm": 0.16053877770900726, "learning_rate": 6.292513877388291e-05, "loss": 0.5793, "mean_token_accuracy": 0.8183028623461723, "num_tokens": 385859546.0, "step": 12090 }, { "entropy": 0.5971203148365021, "epoch": 1.1124317859011736, "grad_norm": 0.15299256145954132, "learning_rate": 6.29220719477413e-05, "loss": 0.5793, "mean_token_accuracy": 0.8222013302147388, "num_tokens": 385891725.0, "step": 12091 }, { "entropy": 0.513954627327621, "epoch": 1.1125237922726148, "grad_norm": 0.15446777641773224, "learning_rate": 6.291900512159966e-05, "loss": 0.4845, "mean_token_accuracy": 0.8469610586762428, "num_tokens": 385923212.0, "step": 12092 }, { "entropy": 0.592799499630928, "epoch": 1.1126157986440561, "grad_norm": 0.15526577830314636, "learning_rate": 6.291593829545803e-05, "loss": 0.57, "mean_token_accuracy": 0.8247033096849918, "num_tokens": 385955183.0, "step": 12093 }, { "entropy": 0.5560277886688709, "epoch": 1.1127078050154973, "grad_norm": 0.16551519930362701, "learning_rate": 6.29128714693164e-05, "loss": 0.5475, "mean_token_accuracy": 0.830170139670372, "num_tokens": 385987388.0, "step": 12094 }, { "entropy": 0.5858641555532813, "epoch": 1.1127998113869386, "grad_norm": 0.1553163081407547, "learning_rate": 6.290980464317478e-05, "loss": 0.5719, "mean_token_accuracy": 0.8243082240223885, "num_tokens": 386019070.0, "step": 12095 }, { "entropy": 0.49657947942614555, "epoch": 1.1128918177583798, "grad_norm": 0.14877478778362274, "learning_rate": 6.290673781703316e-05, "loss": 0.4744, "mean_token_accuracy": 0.852279718965292, "num_tokens": 386051190.0, "step": 12096 }, { "entropy": 0.49571618996560574, "epoch": 1.1129838241298209, "grad_norm": 0.15356607735157013, "learning_rate": 6.290367099089153e-05, "loss": 0.4906, "mean_token_accuracy": 0.8490956276655197, "num_tokens": 386083757.0, "step": 12097 }, { "entropy": 0.610845829360187, "epoch": 1.1130758305012622, "grad_norm": 0.16548465192317963, "learning_rate": 6.29006041647499e-05, "loss": 0.6154, "mean_token_accuracy": 0.8142615146934986, "num_tokens": 386115949.0, "step": 12098 }, { "entropy": 0.6495084166526794, "epoch": 1.1131678368727034, "grad_norm": 0.16703087091445923, "learning_rate": 6.289753733860828e-05, "loss": 0.635, "mean_token_accuracy": 0.8040970116853714, "num_tokens": 386147785.0, "step": 12099 }, { "entropy": 0.6116006933152676, "epoch": 1.1132598432441447, "grad_norm": 0.15784059464931488, "learning_rate": 6.289447051246665e-05, "loss": 0.5992, "mean_token_accuracy": 0.8136153481900692, "num_tokens": 386180114.0, "step": 12100 }, { "entropy": 0.7258870489895344, "epoch": 1.1133518496155859, "grad_norm": 0.16162638366222382, "learning_rate": 6.289140368632503e-05, "loss": 0.7196, "mean_token_accuracy": 0.7803900502622128, "num_tokens": 386212335.0, "step": 12101 }, { "entropy": 0.6928859241306782, "epoch": 1.113443855987027, "grad_norm": 0.1571415513753891, "learning_rate": 6.28883368601834e-05, "loss": 0.6659, "mean_token_accuracy": 0.7935296520590782, "num_tokens": 386243877.0, "step": 12102 }, { "entropy": 0.7203040756285191, "epoch": 1.1135358623584684, "grad_norm": 0.17155055701732635, "learning_rate": 6.288527003404178e-05, "loss": 0.7218, "mean_token_accuracy": 0.7856583930552006, "num_tokens": 386275524.0, "step": 12103 }, { "entropy": 0.6444077342748642, "epoch": 1.1136278687299095, "grad_norm": 0.1619299203157425, "learning_rate": 6.288220320790014e-05, "loss": 0.6356, "mean_token_accuracy": 0.8048135675489902, "num_tokens": 386307687.0, "step": 12104 }, { "entropy": 0.7044136375188828, "epoch": 1.1137198751013508, "grad_norm": 0.1568893939256668, "learning_rate": 6.287913638175851e-05, "loss": 0.6983, "mean_token_accuracy": 0.7863843701779842, "num_tokens": 386340364.0, "step": 12105 }, { "entropy": 0.712964816018939, "epoch": 1.113811881472792, "grad_norm": 0.16076979041099548, "learning_rate": 6.28760695556169e-05, "loss": 0.6993, "mean_token_accuracy": 0.7847051285207272, "num_tokens": 386372477.0, "step": 12106 }, { "entropy": 0.7715111188590527, "epoch": 1.113903887844233, "grad_norm": 0.16902223229408264, "learning_rate": 6.287300272947528e-05, "loss": 0.7667, "mean_token_accuracy": 0.7725570313632488, "num_tokens": 386405029.0, "step": 12107 }, { "entropy": 0.5362414438277483, "epoch": 1.1139958942156745, "grad_norm": 0.161681666970253, "learning_rate": 6.286993590333364e-05, "loss": 0.5246, "mean_token_accuracy": 0.8353296890854836, "num_tokens": 386437264.0, "step": 12108 }, { "entropy": 0.6114154495298862, "epoch": 1.1140879005871156, "grad_norm": 0.15641936659812927, "learning_rate": 6.286686907719201e-05, "loss": 0.5965, "mean_token_accuracy": 0.8170955069363117, "num_tokens": 386469581.0, "step": 12109 }, { "entropy": 0.7023135907948017, "epoch": 1.114179906958557, "grad_norm": 0.1648755967617035, "learning_rate": 6.286380225105038e-05, "loss": 0.6858, "mean_token_accuracy": 0.7898243553936481, "num_tokens": 386501491.0, "step": 12110 }, { "entropy": 0.6267715697176754, "epoch": 1.114271913329998, "grad_norm": 0.1617051661014557, "learning_rate": 6.286073542490877e-05, "loss": 0.6268, "mean_token_accuracy": 0.8148301541805267, "num_tokens": 386533389.0, "step": 12111 }, { "entropy": 0.5712135126814246, "epoch": 1.1143639197014394, "grad_norm": 0.15543478727340698, "learning_rate": 6.285766859876714e-05, "loss": 0.565, "mean_token_accuracy": 0.8258372843265533, "num_tokens": 386565881.0, "step": 12112 }, { "entropy": 0.6347584556788206, "epoch": 1.1144559260728806, "grad_norm": 0.1605682671070099, "learning_rate": 6.285460177262551e-05, "loss": 0.6317, "mean_token_accuracy": 0.8068779595196247, "num_tokens": 386596367.0, "step": 12113 }, { "entropy": 0.6157841943204403, "epoch": 1.1145479324443217, "grad_norm": 0.15796270966529846, "learning_rate": 6.285153494648389e-05, "loss": 0.5943, "mean_token_accuracy": 0.8196347020566463, "num_tokens": 386628375.0, "step": 12114 }, { "entropy": 0.6086333505809307, "epoch": 1.114639938815763, "grad_norm": 0.15174700319766998, "learning_rate": 6.284846812034226e-05, "loss": 0.5777, "mean_token_accuracy": 0.8203182220458984, "num_tokens": 386660227.0, "step": 12115 }, { "entropy": 0.584507321473211, "epoch": 1.1147319451872042, "grad_norm": 0.16160091757774353, "learning_rate": 6.284540129420064e-05, "loss": 0.5603, "mean_token_accuracy": 0.824185773730278, "num_tokens": 386691707.0, "step": 12116 }, { "entropy": 0.5869407271966338, "epoch": 1.1148239515586456, "grad_norm": 0.15383706986904144, "learning_rate": 6.284233446805901e-05, "loss": 0.5733, "mean_token_accuracy": 0.8195316158235073, "num_tokens": 386722783.0, "step": 12117 }, { "entropy": 0.6151750516146421, "epoch": 1.1149159579300867, "grad_norm": 0.1599535495042801, "learning_rate": 6.283926764191739e-05, "loss": 0.6152, "mean_token_accuracy": 0.8101671971380711, "num_tokens": 386754859.0, "step": 12118 }, { "entropy": 0.5275798444636166, "epoch": 1.1150079643015278, "grad_norm": 0.15003614127635956, "learning_rate": 6.283620081577576e-05, "loss": 0.5095, "mean_token_accuracy": 0.844604566693306, "num_tokens": 386786607.0, "step": 12119 }, { "entropy": 0.6119045969098806, "epoch": 1.1150999706729692, "grad_norm": 0.1641126275062561, "learning_rate": 6.283313398963413e-05, "loss": 0.6014, "mean_token_accuracy": 0.812938753515482, "num_tokens": 386818819.0, "step": 12120 }, { "entropy": 0.6752929100766778, "epoch": 1.1151919770444103, "grad_norm": 0.1740967035293579, "learning_rate": 6.283006716349251e-05, "loss": 0.6691, "mean_token_accuracy": 0.7962855510413647, "num_tokens": 386850562.0, "step": 12121 }, { "entropy": 0.5891275107860565, "epoch": 1.1152839834158517, "grad_norm": 0.1566610485315323, "learning_rate": 6.282700033735089e-05, "loss": 0.5752, "mean_token_accuracy": 0.8209591582417488, "num_tokens": 386882826.0, "step": 12122 }, { "entropy": 0.662980911321938, "epoch": 1.1153759897872928, "grad_norm": 0.16918280720710754, "learning_rate": 6.282393351120926e-05, "loss": 0.6387, "mean_token_accuracy": 0.8079873733222485, "num_tokens": 386914988.0, "step": 12123 }, { "entropy": 0.6518758940510452, "epoch": 1.115467996158734, "grad_norm": 0.15698593854904175, "learning_rate": 6.282086668506762e-05, "loss": 0.6333, "mean_token_accuracy": 0.8060925044119358, "num_tokens": 386946778.0, "step": 12124 }, { "entropy": 0.5729522109031677, "epoch": 1.1155600025301753, "grad_norm": 0.15559199452400208, "learning_rate": 6.281779985892599e-05, "loss": 0.5784, "mean_token_accuracy": 0.8238819502294064, "num_tokens": 386977130.0, "step": 12125 }, { "entropy": 0.5950844474136829, "epoch": 1.1156520089016164, "grad_norm": 0.15603800117969513, "learning_rate": 6.281473303278437e-05, "loss": 0.5765, "mean_token_accuracy": 0.8239938877522945, "num_tokens": 387009484.0, "step": 12126 }, { "entropy": 0.628826797939837, "epoch": 1.1157440152730578, "grad_norm": 0.16120390594005585, "learning_rate": 6.281166620664275e-05, "loss": 0.6236, "mean_token_accuracy": 0.8113384433090687, "num_tokens": 387041520.0, "step": 12127 }, { "entropy": 0.6565228719264269, "epoch": 1.115836021644499, "grad_norm": 0.16070224344730377, "learning_rate": 6.280859938050112e-05, "loss": 0.6266, "mean_token_accuracy": 0.8089266419410706, "num_tokens": 387072606.0, "step": 12128 }, { "entropy": 0.6354540046304464, "epoch": 1.11592802801594, "grad_norm": 0.160100057721138, "learning_rate": 6.280553255435949e-05, "loss": 0.6235, "mean_token_accuracy": 0.809100303798914, "num_tokens": 387103867.0, "step": 12129 }, { "entropy": 0.6412583729252219, "epoch": 1.1160200343873814, "grad_norm": 0.15302447974681854, "learning_rate": 6.280246572821787e-05, "loss": 0.6155, "mean_token_accuracy": 0.8110044375061989, "num_tokens": 387135620.0, "step": 12130 }, { "entropy": 0.6145969144999981, "epoch": 1.1161120407588225, "grad_norm": 0.16689516603946686, "learning_rate": 6.279939890207624e-05, "loss": 0.5942, "mean_token_accuracy": 0.818646427243948, "num_tokens": 387168135.0, "step": 12131 }, { "entropy": 0.5946705425158143, "epoch": 1.1162040471302639, "grad_norm": 0.15712812542915344, "learning_rate": 6.279633207593462e-05, "loss": 0.5984, "mean_token_accuracy": 0.8178642056882381, "num_tokens": 387199581.0, "step": 12132 }, { "entropy": 0.6124974638223648, "epoch": 1.116296053501705, "grad_norm": 0.16141897439956665, "learning_rate": 6.279326524979299e-05, "loss": 0.6105, "mean_token_accuracy": 0.8164975084364414, "num_tokens": 387230827.0, "step": 12133 }, { "entropy": 0.6307868026196957, "epoch": 1.1163880598731462, "grad_norm": 0.16376706957817078, "learning_rate": 6.279019842365137e-05, "loss": 0.6145, "mean_token_accuracy": 0.8133719153702259, "num_tokens": 387262456.0, "step": 12134 }, { "entropy": 0.6082110162824392, "epoch": 1.1164800662445875, "grad_norm": 0.15629763901233673, "learning_rate": 6.278713159750974e-05, "loss": 0.5916, "mean_token_accuracy": 0.8167837485671043, "num_tokens": 387294823.0, "step": 12135 }, { "entropy": 0.6834202315658331, "epoch": 1.1165720726160286, "grad_norm": 0.1594376564025879, "learning_rate": 6.27840647713681e-05, "loss": 0.6729, "mean_token_accuracy": 0.8009903095662594, "num_tokens": 387327108.0, "step": 12136 }, { "entropy": 0.6697252821177244, "epoch": 1.11666407898747, "grad_norm": 0.1640646755695343, "learning_rate": 6.278099794522649e-05, "loss": 0.6534, "mean_token_accuracy": 0.7998804226517677, "num_tokens": 387358694.0, "step": 12137 }, { "entropy": 0.6750289872288704, "epoch": 1.1167560853589111, "grad_norm": 0.16358605027198792, "learning_rate": 6.277793111908487e-05, "loss": 0.6634, "mean_token_accuracy": 0.7975106500089169, "num_tokens": 387391267.0, "step": 12138 }, { "entropy": 0.5953036565333605, "epoch": 1.1168480917303523, "grad_norm": 0.15361717343330383, "learning_rate": 6.277486429294324e-05, "loss": 0.5885, "mean_token_accuracy": 0.8131055645644665, "num_tokens": 387423520.0, "step": 12139 }, { "entropy": 0.669703827239573, "epoch": 1.1169400981017936, "grad_norm": 0.15775735676288605, "learning_rate": 6.27717974668016e-05, "loss": 0.6607, "mean_token_accuracy": 0.7955698780715466, "num_tokens": 387456133.0, "step": 12140 }, { "entropy": 0.5598648055456579, "epoch": 1.1170321044732348, "grad_norm": 0.154282808303833, "learning_rate": 6.276873064065999e-05, "loss": 0.5546, "mean_token_accuracy": 0.8318857960402966, "num_tokens": 387488527.0, "step": 12141 }, { "entropy": 0.5998812578618526, "epoch": 1.117124110844676, "grad_norm": 0.15575256943702698, "learning_rate": 6.276566381451835e-05, "loss": 0.5863, "mean_token_accuracy": 0.8160900957882404, "num_tokens": 387519840.0, "step": 12142 }, { "entropy": 0.6064626509323716, "epoch": 1.1172161172161172, "grad_norm": 0.1547597199678421, "learning_rate": 6.276259698837674e-05, "loss": 0.5907, "mean_token_accuracy": 0.8208630494773388, "num_tokens": 387552044.0, "step": 12143 }, { "entropy": 0.617518630810082, "epoch": 1.1173081235875584, "grad_norm": 0.1556403487920761, "learning_rate": 6.27595301622351e-05, "loss": 0.5999, "mean_token_accuracy": 0.8116064593195915, "num_tokens": 387582898.0, "step": 12144 }, { "entropy": 0.688717607408762, "epoch": 1.1174001299589997, "grad_norm": 0.16368821263313293, "learning_rate": 6.275646333609348e-05, "loss": 0.6707, "mean_token_accuracy": 0.7948914989829063, "num_tokens": 387614351.0, "step": 12145 }, { "entropy": 0.5783405778929591, "epoch": 1.1174921363304409, "grad_norm": 0.1554708182811737, "learning_rate": 6.275339650995185e-05, "loss": 0.5673, "mean_token_accuracy": 0.8279650919139385, "num_tokens": 387646481.0, "step": 12146 }, { "entropy": 0.6014251187443733, "epoch": 1.1175841427018822, "grad_norm": 0.15658484399318695, "learning_rate": 6.275032968381022e-05, "loss": 0.5926, "mean_token_accuracy": 0.818914782255888, "num_tokens": 387678413.0, "step": 12147 }, { "entropy": 0.6247548405081034, "epoch": 1.1176761490733234, "grad_norm": 0.15972864627838135, "learning_rate": 6.27472628576686e-05, "loss": 0.6097, "mean_token_accuracy": 0.8106067627668381, "num_tokens": 387710526.0, "step": 12148 }, { "entropy": 0.4939286857843399, "epoch": 1.1177681554447645, "grad_norm": 0.14794684946537018, "learning_rate": 6.274419603152698e-05, "loss": 0.4781, "mean_token_accuracy": 0.8507971689105034, "num_tokens": 387742767.0, "step": 12149 }, { "entropy": 0.6942765265703201, "epoch": 1.1178601618162058, "grad_norm": 0.1545189768075943, "learning_rate": 6.274112920538535e-05, "loss": 0.6774, "mean_token_accuracy": 0.7935648001730442, "num_tokens": 387775071.0, "step": 12150 }, { "entropy": 0.6898792739957571, "epoch": 1.117952168187647, "grad_norm": 0.16135825216770172, "learning_rate": 6.273806237924372e-05, "loss": 0.685, "mean_token_accuracy": 0.7922096401453018, "num_tokens": 387806904.0, "step": 12151 }, { "entropy": 0.5689001921564341, "epoch": 1.1180441745590883, "grad_norm": 0.15459120273590088, "learning_rate": 6.273499555310209e-05, "loss": 0.5616, "mean_token_accuracy": 0.8267132453620434, "num_tokens": 387839130.0, "step": 12152 }, { "entropy": 0.637919107452035, "epoch": 1.1181361809305295, "grad_norm": 0.15679892897605896, "learning_rate": 6.273192872696048e-05, "loss": 0.6085, "mean_token_accuracy": 0.8112007975578308, "num_tokens": 387871520.0, "step": 12153 }, { "entropy": 0.5916770715266466, "epoch": 1.1182281873019706, "grad_norm": 0.15254662930965424, "learning_rate": 6.272886190081885e-05, "loss": 0.5719, "mean_token_accuracy": 0.8228974901139736, "num_tokens": 387903882.0, "step": 12154 }, { "entropy": 0.5573037397116423, "epoch": 1.118320193673412, "grad_norm": 0.1562248021364212, "learning_rate": 6.272579507467722e-05, "loss": 0.5426, "mean_token_accuracy": 0.8321195282042027, "num_tokens": 387936035.0, "step": 12155 }, { "entropy": 0.594511535950005, "epoch": 1.118412200044853, "grad_norm": 0.15622200071811676, "learning_rate": 6.272272824853559e-05, "loss": 0.5878, "mean_token_accuracy": 0.818859875202179, "num_tokens": 387968047.0, "step": 12156 }, { "entropy": 0.6732793087139726, "epoch": 1.1185042064162944, "grad_norm": 0.16584879159927368, "learning_rate": 6.271966142239397e-05, "loss": 0.661, "mean_token_accuracy": 0.8013495579361916, "num_tokens": 387999640.0, "step": 12157 }, { "entropy": 0.47935498133301735, "epoch": 1.1185962127877356, "grad_norm": 0.15279844403266907, "learning_rate": 6.271659459625235e-05, "loss": 0.4541, "mean_token_accuracy": 0.857850156724453, "num_tokens": 388032136.0, "step": 12158 }, { "entropy": 0.6747901178896427, "epoch": 1.1186882191591767, "grad_norm": 0.16625641286373138, "learning_rate": 6.271352777011072e-05, "loss": 0.6802, "mean_token_accuracy": 0.7956645600497723, "num_tokens": 388064591.0, "step": 12159 }, { "entropy": 0.639413096010685, "epoch": 1.118780225530618, "grad_norm": 0.1676376312971115, "learning_rate": 6.271046094396908e-05, "loss": 0.6429, "mean_token_accuracy": 0.7984349094331264, "num_tokens": 388095546.0, "step": 12160 }, { "entropy": 0.6277893390506506, "epoch": 1.1188722319020592, "grad_norm": 0.1615757942199707, "learning_rate": 6.270739411782747e-05, "loss": 0.6274, "mean_token_accuracy": 0.8045448586344719, "num_tokens": 388127824.0, "step": 12161 }, { "entropy": 0.5879512634128332, "epoch": 1.1189642382735006, "grad_norm": 0.1514732390642166, "learning_rate": 6.270432729168583e-05, "loss": 0.5805, "mean_token_accuracy": 0.8243176266551018, "num_tokens": 388160135.0, "step": 12162 }, { "entropy": 0.5362866842187941, "epoch": 1.1190562446449417, "grad_norm": 0.14763420820236206, "learning_rate": 6.270126046554422e-05, "loss": 0.5139, "mean_token_accuracy": 0.8411957174539566, "num_tokens": 388192129.0, "step": 12163 }, { "entropy": 0.5136353923007846, "epoch": 1.1191482510163828, "grad_norm": 0.1436835527420044, "learning_rate": 6.269819363940258e-05, "loss": 0.4858, "mean_token_accuracy": 0.8488614819943905, "num_tokens": 388224690.0, "step": 12164 }, { "entropy": 0.6844372563064098, "epoch": 1.1192402573878242, "grad_norm": 0.1573692411184311, "learning_rate": 6.269512681326096e-05, "loss": 0.6688, "mean_token_accuracy": 0.7958404645323753, "num_tokens": 388256399.0, "step": 12165 }, { "entropy": 0.64595952257514, "epoch": 1.1193322637592653, "grad_norm": 0.1553141474723816, "learning_rate": 6.269205998711933e-05, "loss": 0.6281, "mean_token_accuracy": 0.807477455586195, "num_tokens": 388288022.0, "step": 12166 }, { "entropy": 0.6765026412904263, "epoch": 1.1194242701307067, "grad_norm": 0.1715923547744751, "learning_rate": 6.26889931609777e-05, "loss": 0.6674, "mean_token_accuracy": 0.7944790758192539, "num_tokens": 388319506.0, "step": 12167 }, { "entropy": 0.6138639729470015, "epoch": 1.1195162765021478, "grad_norm": 0.1587565690279007, "learning_rate": 6.268592633483608e-05, "loss": 0.6089, "mean_token_accuracy": 0.8126843087375164, "num_tokens": 388351635.0, "step": 12168 }, { "entropy": 0.6335076568648219, "epoch": 1.119608282873589, "grad_norm": 0.16094516217708588, "learning_rate": 6.268285950869446e-05, "loss": 0.6195, "mean_token_accuracy": 0.808599054813385, "num_tokens": 388383027.0, "step": 12169 }, { "entropy": 0.5859657041728497, "epoch": 1.1197002892450303, "grad_norm": 0.15644702315330505, "learning_rate": 6.267979268255283e-05, "loss": 0.5692, "mean_token_accuracy": 0.8202797807753086, "num_tokens": 388414509.0, "step": 12170 }, { "entropy": 0.5795813612639904, "epoch": 1.1197922956164714, "grad_norm": 0.1516784429550171, "learning_rate": 6.26767258564112e-05, "loss": 0.5833, "mean_token_accuracy": 0.8172140456736088, "num_tokens": 388446511.0, "step": 12171 }, { "entropy": 0.7137757875025272, "epoch": 1.1198843019879128, "grad_norm": 0.16189798712730408, "learning_rate": 6.267365903026958e-05, "loss": 0.706, "mean_token_accuracy": 0.7858299985527992, "num_tokens": 388478282.0, "step": 12172 }, { "entropy": 0.5247584069147706, "epoch": 1.119976308359354, "grad_norm": 0.15752921998500824, "learning_rate": 6.267059220412795e-05, "loss": 0.5209, "mean_token_accuracy": 0.8385604359209538, "num_tokens": 388510588.0, "step": 12173 }, { "entropy": 0.6179256662726402, "epoch": 1.120068314730795, "grad_norm": 0.16154305636882782, "learning_rate": 6.266752537798633e-05, "loss": 0.6108, "mean_token_accuracy": 0.8124524131417274, "num_tokens": 388542288.0, "step": 12174 }, { "entropy": 0.6170281525701284, "epoch": 1.1201603211022364, "grad_norm": 0.16369417309761047, "learning_rate": 6.26644585518447e-05, "loss": 0.5978, "mean_token_accuracy": 0.8173465207219124, "num_tokens": 388573837.0, "step": 12175 }, { "entropy": 0.5631396099925041, "epoch": 1.1202523274736775, "grad_norm": 0.15140175819396973, "learning_rate": 6.266139172570308e-05, "loss": 0.5287, "mean_token_accuracy": 0.8358767703175545, "num_tokens": 388605063.0, "step": 12176 }, { "entropy": 0.6698744408786297, "epoch": 1.120344333845119, "grad_norm": 0.16333924233913422, "learning_rate": 6.265832489956145e-05, "loss": 0.6656, "mean_token_accuracy": 0.7953897379338741, "num_tokens": 388636438.0, "step": 12177 }, { "entropy": 0.5665833340026438, "epoch": 1.12043634021656, "grad_norm": 0.14915554225444794, "learning_rate": 6.265525807341981e-05, "loss": 0.5448, "mean_token_accuracy": 0.8250980749726295, "num_tokens": 388667934.0, "step": 12178 }, { "entropy": 0.7399786822497845, "epoch": 1.1205283465880012, "grad_norm": 0.16753000020980835, "learning_rate": 6.26521912472782e-05, "loss": 0.717, "mean_token_accuracy": 0.7829414941370487, "num_tokens": 388699620.0, "step": 12179 }, { "entropy": 0.6163069549947977, "epoch": 1.1206203529594425, "grad_norm": 0.16178862750530243, "learning_rate": 6.264912442113658e-05, "loss": 0.61, "mean_token_accuracy": 0.8143032044172287, "num_tokens": 388731321.0, "step": 12180 }, { "entropy": 0.6611706521362066, "epoch": 1.1207123593308836, "grad_norm": 0.16338525712490082, "learning_rate": 6.264605759499495e-05, "loss": 0.66, "mean_token_accuracy": 0.7975606173276901, "num_tokens": 388762422.0, "step": 12181 }, { "entropy": 0.6730274092406034, "epoch": 1.120804365702325, "grad_norm": 0.16613337397575378, "learning_rate": 6.264299076885331e-05, "loss": 0.6696, "mean_token_accuracy": 0.7926733493804932, "num_tokens": 388794903.0, "step": 12182 }, { "entropy": 0.577995334751904, "epoch": 1.1208963720737661, "grad_norm": 0.15582917630672455, "learning_rate": 6.263992394271168e-05, "loss": 0.5446, "mean_token_accuracy": 0.8291815221309662, "num_tokens": 388826467.0, "step": 12183 }, { "entropy": 0.676032311283052, "epoch": 1.1209883784452073, "grad_norm": 0.15753516554832458, "learning_rate": 6.263685711657006e-05, "loss": 0.6612, "mean_token_accuracy": 0.8009379357099533, "num_tokens": 388857819.0, "step": 12184 }, { "entropy": 0.5534293325617909, "epoch": 1.1210803848166486, "grad_norm": 0.1476096361875534, "learning_rate": 6.263379029042844e-05, "loss": 0.5368, "mean_token_accuracy": 0.8311251699924469, "num_tokens": 388889772.0, "step": 12185 }, { "entropy": 0.6437073741108179, "epoch": 1.1211723911880898, "grad_norm": 0.1558183878660202, "learning_rate": 6.263072346428681e-05, "loss": 0.6186, "mean_token_accuracy": 0.8068449981510639, "num_tokens": 388921173.0, "step": 12186 }, { "entropy": 0.6951745059341192, "epoch": 1.1212643975595311, "grad_norm": 0.16562555730342865, "learning_rate": 6.262765663814518e-05, "loss": 0.6783, "mean_token_accuracy": 0.7942397929728031, "num_tokens": 388953177.0, "step": 12187 }, { "entropy": 0.6709417197853327, "epoch": 1.1213564039309722, "grad_norm": 0.16643516719341278, "learning_rate": 6.262458981200356e-05, "loss": 0.6553, "mean_token_accuracy": 0.8011669963598251, "num_tokens": 388984773.0, "step": 12188 }, { "entropy": 0.5872824713587761, "epoch": 1.1214484103024134, "grad_norm": 0.15302881598472595, "learning_rate": 6.262152298586194e-05, "loss": 0.5629, "mean_token_accuracy": 0.8240437619388103, "num_tokens": 389016812.0, "step": 12189 }, { "entropy": 0.6656054444611073, "epoch": 1.1215404166738547, "grad_norm": 0.1595534235239029, "learning_rate": 6.261845615972031e-05, "loss": 0.6513, "mean_token_accuracy": 0.801630437374115, "num_tokens": 389049580.0, "step": 12190 }, { "entropy": 0.6417529303580523, "epoch": 1.1216324230452959, "grad_norm": 0.1581224799156189, "learning_rate": 6.261538933357868e-05, "loss": 0.6285, "mean_token_accuracy": 0.8053717613220215, "num_tokens": 389082070.0, "step": 12191 }, { "entropy": 0.6214770022779703, "epoch": 1.1217244294167372, "grad_norm": 0.16677717864513397, "learning_rate": 6.261232250743706e-05, "loss": 0.6192, "mean_token_accuracy": 0.8124306686222553, "num_tokens": 389113650.0, "step": 12192 }, { "entropy": 0.5405152402818203, "epoch": 1.1218164357881784, "grad_norm": 0.16381323337554932, "learning_rate": 6.260925568129543e-05, "loss": 0.5245, "mean_token_accuracy": 0.8452176228165627, "num_tokens": 389145691.0, "step": 12193 }, { "entropy": 0.5511918552219868, "epoch": 1.1219084421596195, "grad_norm": 0.160098597407341, "learning_rate": 6.260618885515381e-05, "loss": 0.5536, "mean_token_accuracy": 0.8262425251305103, "num_tokens": 389178302.0, "step": 12194 }, { "entropy": 0.6714460095390677, "epoch": 1.1220004485310608, "grad_norm": 0.16266730427742004, "learning_rate": 6.260312202901218e-05, "loss": 0.6659, "mean_token_accuracy": 0.798232726752758, "num_tokens": 389211068.0, "step": 12195 }, { "entropy": 0.5970324017107487, "epoch": 1.122092454902502, "grad_norm": 0.16167142987251282, "learning_rate": 6.260005520287056e-05, "loss": 0.5817, "mean_token_accuracy": 0.8234329856932163, "num_tokens": 389242931.0, "step": 12196 }, { "entropy": 0.5851993151009083, "epoch": 1.1221844612739433, "grad_norm": 0.14655552804470062, "learning_rate": 6.259698837672893e-05, "loss": 0.5728, "mean_token_accuracy": 0.821891900151968, "num_tokens": 389274990.0, "step": 12197 }, { "entropy": 0.6075099362060428, "epoch": 1.1222764676453845, "grad_norm": 0.15676119923591614, "learning_rate": 6.25939215505873e-05, "loss": 0.5899, "mean_token_accuracy": 0.8161752112209797, "num_tokens": 389307023.0, "step": 12198 }, { "entropy": 0.68764977902174, "epoch": 1.1223684740168256, "grad_norm": 0.16272112727165222, "learning_rate": 6.259085472444568e-05, "loss": 0.6737, "mean_token_accuracy": 0.7934075258672237, "num_tokens": 389338503.0, "step": 12199 }, { "entropy": 0.6170589029788971, "epoch": 1.122460480388267, "grad_norm": 0.15361036360263824, "learning_rate": 6.258778789830406e-05, "loss": 0.5909, "mean_token_accuracy": 0.8176712989807129, "num_tokens": 389369952.0, "step": 12200 }, { "entropy": 0.5627485029399395, "epoch": 1.122552486759708, "grad_norm": 0.15487124025821686, "learning_rate": 6.258472107216242e-05, "loss": 0.5559, "mean_token_accuracy": 0.8273320123553276, "num_tokens": 389401973.0, "step": 12201 }, { "entropy": 0.6434088665992022, "epoch": 1.1226444931311494, "grad_norm": 0.1612452119588852, "learning_rate": 6.258165424602079e-05, "loss": 0.628, "mean_token_accuracy": 0.8064448572695255, "num_tokens": 389434092.0, "step": 12202 }, { "entropy": 0.5978073216974735, "epoch": 1.1227364995025906, "grad_norm": 0.16088344156742096, "learning_rate": 6.257858741987917e-05, "loss": 0.5929, "mean_token_accuracy": 0.8173680528998375, "num_tokens": 389465948.0, "step": 12203 }, { "entropy": 0.7285236036404967, "epoch": 1.1228285058740317, "grad_norm": 0.16285350918769836, "learning_rate": 6.257552059373754e-05, "loss": 0.7293, "mean_token_accuracy": 0.7769272066652775, "num_tokens": 389497869.0, "step": 12204 }, { "entropy": 0.665761923417449, "epoch": 1.122920512245473, "grad_norm": 0.16509081423282623, "learning_rate": 6.257245376759592e-05, "loss": 0.6589, "mean_token_accuracy": 0.7984505072236061, "num_tokens": 389529883.0, "step": 12205 }, { "entropy": 0.7141081038862467, "epoch": 1.1230125186169142, "grad_norm": 0.16843369603157043, "learning_rate": 6.256938694145429e-05, "loss": 0.7162, "mean_token_accuracy": 0.7843811325728893, "num_tokens": 389562042.0, "step": 12206 }, { "entropy": 0.6978280358016491, "epoch": 1.1231045249883556, "grad_norm": 0.16192954778671265, "learning_rate": 6.256632011531267e-05, "loss": 0.692, "mean_token_accuracy": 0.7893532961606979, "num_tokens": 389593498.0, "step": 12207 }, { "entropy": 0.6409865152090788, "epoch": 1.1231965313597967, "grad_norm": 0.15829631686210632, "learning_rate": 6.256325328917104e-05, "loss": 0.6331, "mean_token_accuracy": 0.8051211312413216, "num_tokens": 389624599.0, "step": 12208 }, { "entropy": 0.56433873064816, "epoch": 1.1232885377312378, "grad_norm": 0.1503930240869522, "learning_rate": 6.256018646302941e-05, "loss": 0.5584, "mean_token_accuracy": 0.8304724842309952, "num_tokens": 389657244.0, "step": 12209 }, { "entropy": 0.6610716003924608, "epoch": 1.1233805441026792, "grad_norm": 0.16245786845684052, "learning_rate": 6.255711963688779e-05, "loss": 0.6567, "mean_token_accuracy": 0.7977386452257633, "num_tokens": 389689408.0, "step": 12210 }, { "entropy": 0.6332115896511823, "epoch": 1.1234725504741203, "grad_norm": 0.15981976687908173, "learning_rate": 6.255405281074617e-05, "loss": 0.6223, "mean_token_accuracy": 0.8124847002327442, "num_tokens": 389721095.0, "step": 12211 }, { "entropy": 0.6031040474772453, "epoch": 1.1235645568455617, "grad_norm": 0.16927991807460785, "learning_rate": 6.255098598460454e-05, "loss": 0.6039, "mean_token_accuracy": 0.8171661905944347, "num_tokens": 389753251.0, "step": 12212 }, { "entropy": 0.6134344469755888, "epoch": 1.1236565632170028, "grad_norm": 0.1520242840051651, "learning_rate": 6.25479191584629e-05, "loss": 0.6002, "mean_token_accuracy": 0.8175582550466061, "num_tokens": 389785702.0, "step": 12213 }, { "entropy": 0.5569830322638154, "epoch": 1.123748569588444, "grad_norm": 0.15373452007770538, "learning_rate": 6.254485233232127e-05, "loss": 0.5338, "mean_token_accuracy": 0.8345274478197098, "num_tokens": 389817673.0, "step": 12214 }, { "entropy": 0.7192040309309959, "epoch": 1.1238405759598853, "grad_norm": 0.16082864999771118, "learning_rate": 6.254178550617966e-05, "loss": 0.703, "mean_token_accuracy": 0.7867340371012688, "num_tokens": 389849546.0, "step": 12215 }, { "entropy": 0.6580533515661955, "epoch": 1.1239325823313264, "grad_norm": 0.164226233959198, "learning_rate": 6.253871868003804e-05, "loss": 0.644, "mean_token_accuracy": 0.8042950667440891, "num_tokens": 389881086.0, "step": 12216 }, { "entropy": 0.6970789153128862, "epoch": 1.1240245887027678, "grad_norm": 0.17435042560100555, "learning_rate": 6.25356518538964e-05, "loss": 0.7027, "mean_token_accuracy": 0.7875924967229366, "num_tokens": 389912722.0, "step": 12217 }, { "entropy": 0.5997174102813005, "epoch": 1.124116595074209, "grad_norm": 0.15608170628547668, "learning_rate": 6.253258502775477e-05, "loss": 0.5787, "mean_token_accuracy": 0.8174318112432957, "num_tokens": 389945208.0, "step": 12218 }, { "entropy": 0.716785401571542, "epoch": 1.12420860144565, "grad_norm": 0.16981111466884613, "learning_rate": 6.252951820161315e-05, "loss": 0.695, "mean_token_accuracy": 0.7889684215188026, "num_tokens": 389976501.0, "step": 12219 }, { "entropy": 0.5622415896505117, "epoch": 1.1243006078170914, "grad_norm": 0.15238194167613983, "learning_rate": 6.252645137547152e-05, "loss": 0.5302, "mean_token_accuracy": 0.8353838212788105, "num_tokens": 390008762.0, "step": 12220 }, { "entropy": 0.6009800117462873, "epoch": 1.1243926141885325, "grad_norm": 0.14949263632297516, "learning_rate": 6.25233845493299e-05, "loss": 0.5847, "mean_token_accuracy": 0.8182501681149006, "num_tokens": 390040446.0, "step": 12221 }, { "entropy": 0.6074634864926338, "epoch": 1.124484620559974, "grad_norm": 0.1486591100692749, "learning_rate": 6.252031772318827e-05, "loss": 0.5813, "mean_token_accuracy": 0.8240891396999359, "num_tokens": 390072520.0, "step": 12222 }, { "entropy": 0.6077162539586425, "epoch": 1.124576626931415, "grad_norm": 0.154767245054245, "learning_rate": 6.251725089704665e-05, "loss": 0.5853, "mean_token_accuracy": 0.822782926261425, "num_tokens": 390103105.0, "step": 12223 }, { "entropy": 0.6045178370550275, "epoch": 1.1246686333028562, "grad_norm": 0.15919719636440277, "learning_rate": 6.251418407090502e-05, "loss": 0.5967, "mean_token_accuracy": 0.8211998082697392, "num_tokens": 390135748.0, "step": 12224 }, { "entropy": 0.6325082806870341, "epoch": 1.1247606396742975, "grad_norm": 0.15800632536411285, "learning_rate": 6.251111724476339e-05, "loss": 0.628, "mean_token_accuracy": 0.8069018237292767, "num_tokens": 390168316.0, "step": 12225 }, { "entropy": 0.5615962669253349, "epoch": 1.1248526460457386, "grad_norm": 0.15300825238227844, "learning_rate": 6.250805041862177e-05, "loss": 0.5508, "mean_token_accuracy": 0.8291165083646774, "num_tokens": 390200338.0, "step": 12226 }, { "entropy": 0.6629042997956276, "epoch": 1.12494465241718, "grad_norm": 0.16105742752552032, "learning_rate": 6.250498359248015e-05, "loss": 0.6545, "mean_token_accuracy": 0.7970714196562767, "num_tokens": 390231864.0, "step": 12227 }, { "entropy": 0.7259157840162516, "epoch": 1.1250366587886211, "grad_norm": 0.16760748624801636, "learning_rate": 6.250191676633852e-05, "loss": 0.7279, "mean_token_accuracy": 0.7833708822727203, "num_tokens": 390263620.0, "step": 12228 }, { "entropy": 0.5146128749474883, "epoch": 1.1251286651600623, "grad_norm": 0.14703534543514252, "learning_rate": 6.249884994019689e-05, "loss": 0.4988, "mean_token_accuracy": 0.8434556610882282, "num_tokens": 390295923.0, "step": 12229 }, { "entropy": 0.6674160938709974, "epoch": 1.1252206715315036, "grad_norm": 0.172599196434021, "learning_rate": 6.249578311405526e-05, "loss": 0.6525, "mean_token_accuracy": 0.796290498226881, "num_tokens": 390328071.0, "step": 12230 }, { "entropy": 0.6661576898768544, "epoch": 1.1253126779029448, "grad_norm": 0.16179761290550232, "learning_rate": 6.249271628791365e-05, "loss": 0.6548, "mean_token_accuracy": 0.799326665699482, "num_tokens": 390358931.0, "step": 12231 }, { "entropy": 0.6105111055076122, "epoch": 1.1254046842743861, "grad_norm": 0.16021029651165009, "learning_rate": 6.248964946177202e-05, "loss": 0.6094, "mean_token_accuracy": 0.8159906603395939, "num_tokens": 390391289.0, "step": 12232 }, { "entropy": 0.5769012458622456, "epoch": 1.1254966906458272, "grad_norm": 0.1568443924188614, "learning_rate": 6.248658263563039e-05, "loss": 0.5643, "mean_token_accuracy": 0.8283979035913944, "num_tokens": 390423423.0, "step": 12233 }, { "entropy": 0.5749664455652237, "epoch": 1.1255886970172684, "grad_norm": 0.15459245443344116, "learning_rate": 6.248351580948877e-05, "loss": 0.5632, "mean_token_accuracy": 0.8255990743637085, "num_tokens": 390455385.0, "step": 12234 }, { "entropy": 0.5859174244105816, "epoch": 1.1256807033887097, "grad_norm": 0.1622537225484848, "learning_rate": 6.248044898334714e-05, "loss": 0.5735, "mean_token_accuracy": 0.8236128054559231, "num_tokens": 390487360.0, "step": 12235 }, { "entropy": 0.5148732149973512, "epoch": 1.1257727097601509, "grad_norm": 0.14699053764343262, "learning_rate": 6.247738215720552e-05, "loss": 0.4954, "mean_token_accuracy": 0.8430797047913074, "num_tokens": 390518705.0, "step": 12236 }, { "entropy": 0.6685750521719456, "epoch": 1.1258647161315922, "grad_norm": 0.16246701776981354, "learning_rate": 6.247431533106388e-05, "loss": 0.6447, "mean_token_accuracy": 0.805591206997633, "num_tokens": 390550450.0, "step": 12237 }, { "entropy": 0.6810858305543661, "epoch": 1.1259567225030334, "grad_norm": 0.16081364452838898, "learning_rate": 6.247124850492227e-05, "loss": 0.6732, "mean_token_accuracy": 0.7930239252746105, "num_tokens": 390582695.0, "step": 12238 }, { "entropy": 0.6287307413294911, "epoch": 1.1260487288744745, "grad_norm": 0.16652996838092804, "learning_rate": 6.246818167878063e-05, "loss": 0.61, "mean_token_accuracy": 0.8160664066672325, "num_tokens": 390614726.0, "step": 12239 }, { "entropy": 0.5816456750035286, "epoch": 1.1261407352459158, "grad_norm": 0.16290725767612457, "learning_rate": 6.2465114852639e-05, "loss": 0.5613, "mean_token_accuracy": 0.8268264979124069, "num_tokens": 390645955.0, "step": 12240 }, { "entropy": 0.5464858710765839, "epoch": 1.126232741617357, "grad_norm": 0.15299299359321594, "learning_rate": 6.246204802649738e-05, "loss": 0.5327, "mean_token_accuracy": 0.8365838453173637, "num_tokens": 390677624.0, "step": 12241 }, { "entropy": 0.5896412301808596, "epoch": 1.1263247479887983, "grad_norm": 0.15495622158050537, "learning_rate": 6.245898120035576e-05, "loss": 0.5957, "mean_token_accuracy": 0.8178696222603321, "num_tokens": 390710155.0, "step": 12242 }, { "entropy": 0.6161240022629499, "epoch": 1.1264167543602395, "grad_norm": 0.15014274418354034, "learning_rate": 6.245591437421413e-05, "loss": 0.6102, "mean_token_accuracy": 0.8095197826623917, "num_tokens": 390742317.0, "step": 12243 }, { "entropy": 0.5838295798748732, "epoch": 1.1265087607316806, "grad_norm": 0.15939417481422424, "learning_rate": 6.24528475480725e-05, "loss": 0.5695, "mean_token_accuracy": 0.8251358233392239, "num_tokens": 390774363.0, "step": 12244 }, { "entropy": 0.6968494728207588, "epoch": 1.126600767103122, "grad_norm": 0.16109409928321838, "learning_rate": 6.244978072193087e-05, "loss": 0.6912, "mean_token_accuracy": 0.7895634137094021, "num_tokens": 390806749.0, "step": 12245 }, { "entropy": 0.6989008700475097, "epoch": 1.126692773474563, "grad_norm": 0.1662316769361496, "learning_rate": 6.244671389578925e-05, "loss": 0.6922, "mean_token_accuracy": 0.7898368127644062, "num_tokens": 390838636.0, "step": 12246 }, { "entropy": 0.7415228523313999, "epoch": 1.1267847798460044, "grad_norm": 0.17028383910655975, "learning_rate": 6.244364706964763e-05, "loss": 0.7454, "mean_token_accuracy": 0.7799937315285206, "num_tokens": 390871280.0, "step": 12247 }, { "entropy": 0.6201130882836878, "epoch": 1.1268767862174456, "grad_norm": 0.16090355813503265, "learning_rate": 6.2440580243506e-05, "loss": 0.6055, "mean_token_accuracy": 0.8188715316355228, "num_tokens": 390903324.0, "step": 12248 }, { "entropy": 0.6971054095774889, "epoch": 1.1269687925888867, "grad_norm": 0.1662106215953827, "learning_rate": 6.243751341736437e-05, "loss": 0.6787, "mean_token_accuracy": 0.7913970574736595, "num_tokens": 390935325.0, "step": 12249 }, { "entropy": 0.6025424031540751, "epoch": 1.127060798960328, "grad_norm": 0.16041292250156403, "learning_rate": 6.243444659122275e-05, "loss": 0.5765, "mean_token_accuracy": 0.8202284388244152, "num_tokens": 390967363.0, "step": 12250 }, { "entropy": 0.6157169044017792, "epoch": 1.1271528053317692, "grad_norm": 0.15637730062007904, "learning_rate": 6.243137976508112e-05, "loss": 0.6, "mean_token_accuracy": 0.8115477040410042, "num_tokens": 390999312.0, "step": 12251 }, { "entropy": 0.5608044024556875, "epoch": 1.1272448117032106, "grad_norm": 0.1550743281841278, "learning_rate": 6.24283129389395e-05, "loss": 0.5413, "mean_token_accuracy": 0.8320026025176048, "num_tokens": 391031614.0, "step": 12252 }, { "entropy": 0.5441435761749744, "epoch": 1.1273368180746517, "grad_norm": 0.14884009957313538, "learning_rate": 6.242524611279787e-05, "loss": 0.5189, "mean_token_accuracy": 0.8389177918434143, "num_tokens": 391063462.0, "step": 12253 }, { "entropy": 0.5669227130711079, "epoch": 1.1274288244460928, "grad_norm": 0.15523508191108704, "learning_rate": 6.242217928665625e-05, "loss": 0.5527, "mean_token_accuracy": 0.8288879506289959, "num_tokens": 391095638.0, "step": 12254 }, { "entropy": 0.5445665931329131, "epoch": 1.1275208308175342, "grad_norm": 0.1615658551454544, "learning_rate": 6.241911246051461e-05, "loss": 0.5308, "mean_token_accuracy": 0.8373457528650761, "num_tokens": 391127284.0, "step": 12255 }, { "entropy": 0.6436649551615119, "epoch": 1.1276128371889753, "grad_norm": 0.1582445353269577, "learning_rate": 6.241604563437298e-05, "loss": 0.6252, "mean_token_accuracy": 0.8118716813623905, "num_tokens": 391159558.0, "step": 12256 }, { "entropy": 0.6492670746520162, "epoch": 1.1277048435604167, "grad_norm": 0.15533041954040527, "learning_rate": 6.241297880823136e-05, "loss": 0.6328, "mean_token_accuracy": 0.8028708770871162, "num_tokens": 391191680.0, "step": 12257 }, { "entropy": 0.5094097340479493, "epoch": 1.1277968499318578, "grad_norm": 0.14867985248565674, "learning_rate": 6.240991198208975e-05, "loss": 0.492, "mean_token_accuracy": 0.8480989597737789, "num_tokens": 391224399.0, "step": 12258 }, { "entropy": 0.6849898025393486, "epoch": 1.127888856303299, "grad_norm": 0.1595989167690277, "learning_rate": 6.240684515594811e-05, "loss": 0.6627, "mean_token_accuracy": 0.7951829880475998, "num_tokens": 391256506.0, "step": 12259 }, { "entropy": 0.5531642870046198, "epoch": 1.1279808626747403, "grad_norm": 0.1533711701631546, "learning_rate": 6.240377832980648e-05, "loss": 0.5253, "mean_token_accuracy": 0.8372022397816181, "num_tokens": 391289166.0, "step": 12260 }, { "entropy": 0.6410122103989124, "epoch": 1.1280728690461814, "grad_norm": 0.17411935329437256, "learning_rate": 6.240071150366485e-05, "loss": 0.632, "mean_token_accuracy": 0.8086837418377399, "num_tokens": 391321157.0, "step": 12261 }, { "entropy": 0.5701414011418819, "epoch": 1.1281648754176228, "grad_norm": 0.1608845293521881, "learning_rate": 6.239764467752323e-05, "loss": 0.5522, "mean_token_accuracy": 0.8262173868715763, "num_tokens": 391352263.0, "step": 12262 }, { "entropy": 0.6169297434389591, "epoch": 1.128256881789064, "grad_norm": 0.16567569971084595, "learning_rate": 6.239457785138161e-05, "loss": 0.6126, "mean_token_accuracy": 0.8083662278950214, "num_tokens": 391383317.0, "step": 12263 }, { "entropy": 0.6738693192601204, "epoch": 1.128348888160505, "grad_norm": 0.1625688076019287, "learning_rate": 6.239151102523998e-05, "loss": 0.6743, "mean_token_accuracy": 0.7947109267115593, "num_tokens": 391415486.0, "step": 12264 }, { "entropy": 0.635108906775713, "epoch": 1.1284408945319464, "grad_norm": 0.16503790020942688, "learning_rate": 6.238844419909836e-05, "loss": 0.6293, "mean_token_accuracy": 0.8061422929167747, "num_tokens": 391446815.0, "step": 12265 }, { "entropy": 0.756386436522007, "epoch": 1.1285329009033875, "grad_norm": 0.17043514549732208, "learning_rate": 6.238537737295673e-05, "loss": 0.7578, "mean_token_accuracy": 0.7703295536339283, "num_tokens": 391478638.0, "step": 12266 }, { "entropy": 0.6198518201708794, "epoch": 1.128624907274829, "grad_norm": 0.1685205101966858, "learning_rate": 6.23823105468151e-05, "loss": 0.6236, "mean_token_accuracy": 0.8107348829507828, "num_tokens": 391511233.0, "step": 12267 }, { "entropy": 0.5656331572681665, "epoch": 1.12871691364627, "grad_norm": 0.15342174470424652, "learning_rate": 6.237924372067348e-05, "loss": 0.5651, "mean_token_accuracy": 0.8288760334253311, "num_tokens": 391543361.0, "step": 12268 }, { "entropy": 0.7125058528035879, "epoch": 1.1288089200177112, "grad_norm": 0.16686077415943146, "learning_rate": 6.237617689453186e-05, "loss": 0.6901, "mean_token_accuracy": 0.7905103489756584, "num_tokens": 391574870.0, "step": 12269 }, { "entropy": 0.7230622079223394, "epoch": 1.1289009263891525, "grad_norm": 0.17126809060573578, "learning_rate": 6.237311006839023e-05, "loss": 0.7099, "mean_token_accuracy": 0.7864061295986176, "num_tokens": 391606905.0, "step": 12270 }, { "entropy": 0.6679568160325289, "epoch": 1.1289929327605936, "grad_norm": 0.15742310881614685, "learning_rate": 6.23700432422486e-05, "loss": 0.6547, "mean_token_accuracy": 0.802689041942358, "num_tokens": 391639118.0, "step": 12271 }, { "entropy": 0.6688907369971275, "epoch": 1.129084939132035, "grad_norm": 0.15886905789375305, "learning_rate": 6.236697641610696e-05, "loss": 0.6545, "mean_token_accuracy": 0.7996447272598743, "num_tokens": 391671210.0, "step": 12272 }, { "entropy": 0.6525553874671459, "epoch": 1.1291769455034761, "grad_norm": 0.15672554075717926, "learning_rate": 6.236390958996536e-05, "loss": 0.6266, "mean_token_accuracy": 0.8062328174710274, "num_tokens": 391702190.0, "step": 12273 }, { "entropy": 0.6818134430795908, "epoch": 1.1292689518749173, "grad_norm": 0.15690231323242188, "learning_rate": 6.236084276382373e-05, "loss": 0.668, "mean_token_accuracy": 0.7970216386020184, "num_tokens": 391734596.0, "step": 12274 }, { "entropy": 0.5972980633378029, "epoch": 1.1293609582463586, "grad_norm": 0.16030140221118927, "learning_rate": 6.23577759376821e-05, "loss": 0.6009, "mean_token_accuracy": 0.8130358196794987, "num_tokens": 391766817.0, "step": 12275 }, { "entropy": 0.5398918054997921, "epoch": 1.1294529646177998, "grad_norm": 0.15327294170856476, "learning_rate": 6.235470911154046e-05, "loss": 0.5197, "mean_token_accuracy": 0.8355904147028923, "num_tokens": 391797287.0, "step": 12276 }, { "entropy": 0.7549906354397535, "epoch": 1.1295449709892411, "grad_norm": 0.17108669877052307, "learning_rate": 6.235164228539884e-05, "loss": 0.7564, "mean_token_accuracy": 0.7738033346831799, "num_tokens": 391828951.0, "step": 12277 }, { "entropy": 0.7085132971405983, "epoch": 1.1296369773606822, "grad_norm": 0.16037341952323914, "learning_rate": 6.234857545925722e-05, "loss": 0.7076, "mean_token_accuracy": 0.7828568406403065, "num_tokens": 391861159.0, "step": 12278 }, { "entropy": 0.6033173822797835, "epoch": 1.1297289837321234, "grad_norm": 0.15771757066249847, "learning_rate": 6.234550863311559e-05, "loss": 0.582, "mean_token_accuracy": 0.8244365006685257, "num_tokens": 391891866.0, "step": 12279 }, { "entropy": 0.6454706005752087, "epoch": 1.1298209901035647, "grad_norm": 0.15523184835910797, "learning_rate": 6.234244180697396e-05, "loss": 0.6479, "mean_token_accuracy": 0.802466843277216, "num_tokens": 391923978.0, "step": 12280 }, { "entropy": 0.6947300154715776, "epoch": 1.1299129964750059, "grad_norm": 0.15530936419963837, "learning_rate": 6.233937498083234e-05, "loss": 0.6647, "mean_token_accuracy": 0.8013516366481781, "num_tokens": 391956199.0, "step": 12281 }, { "entropy": 0.5993171334266663, "epoch": 1.1300050028464472, "grad_norm": 0.15336376428604126, "learning_rate": 6.233630815469071e-05, "loss": 0.5874, "mean_token_accuracy": 0.8163923919200897, "num_tokens": 391987547.0, "step": 12282 }, { "entropy": 0.6359727792441845, "epoch": 1.1300970092178884, "grad_norm": 0.16467930376529694, "learning_rate": 6.233324132854909e-05, "loss": 0.6234, "mean_token_accuracy": 0.8121641390025616, "num_tokens": 392020315.0, "step": 12283 }, { "entropy": 0.669388061389327, "epoch": 1.1301890155893295, "grad_norm": 0.16219037771224976, "learning_rate": 6.233017450240746e-05, "loss": 0.654, "mean_token_accuracy": 0.8029518499970436, "num_tokens": 392052290.0, "step": 12284 }, { "entropy": 0.6203744802623987, "epoch": 1.1302810219607708, "grad_norm": 0.17093099653720856, "learning_rate": 6.232710767626584e-05, "loss": 0.6204, "mean_token_accuracy": 0.8112956024706364, "num_tokens": 392084605.0, "step": 12285 }, { "entropy": 0.6478435602039099, "epoch": 1.130373028332212, "grad_norm": 0.1681499481201172, "learning_rate": 6.232404085012421e-05, "loss": 0.6482, "mean_token_accuracy": 0.8050568625330925, "num_tokens": 392116152.0, "step": 12286 }, { "entropy": 0.5536952610127628, "epoch": 1.1304650347036533, "grad_norm": 0.15010304749011993, "learning_rate": 6.232097402398258e-05, "loss": 0.5475, "mean_token_accuracy": 0.8329035602509975, "num_tokens": 392148519.0, "step": 12287 }, { "entropy": 0.592045309022069, "epoch": 1.1305570410750945, "grad_norm": 0.1644749492406845, "learning_rate": 6.231790719784096e-05, "loss": 0.5935, "mean_token_accuracy": 0.8201674669981003, "num_tokens": 392181137.0, "step": 12288 }, { "entropy": 0.6090902891010046, "epoch": 1.1306490474465356, "grad_norm": 0.15194542706012726, "learning_rate": 6.231484037169934e-05, "loss": 0.5905, "mean_token_accuracy": 0.8170220665633678, "num_tokens": 392212525.0, "step": 12289 }, { "entropy": 0.7356106955558062, "epoch": 1.130741053817977, "grad_norm": 0.16237938404083252, "learning_rate": 6.231177354555771e-05, "loss": 0.7234, "mean_token_accuracy": 0.7812386862933636, "num_tokens": 392244301.0, "step": 12290 }, { "entropy": 0.6696268729865551, "epoch": 1.130833060189418, "grad_norm": 0.17072536051273346, "learning_rate": 6.230870671941608e-05, "loss": 0.6566, "mean_token_accuracy": 0.7986288517713547, "num_tokens": 392275808.0, "step": 12291 }, { "entropy": 0.5718462448567152, "epoch": 1.1309250665608594, "grad_norm": 0.163856640458107, "learning_rate": 6.230563989327444e-05, "loss": 0.5495, "mean_token_accuracy": 0.8313373439013958, "num_tokens": 392307974.0, "step": 12292 }, { "entropy": 0.5822297548875213, "epoch": 1.1310170729323006, "grad_norm": 0.16134408116340637, "learning_rate": 6.230257306713282e-05, "loss": 0.5579, "mean_token_accuracy": 0.8248727954924107, "num_tokens": 392338496.0, "step": 12293 }, { "entropy": 0.6565506514161825, "epoch": 1.1311090793037417, "grad_norm": 0.15848511457443237, "learning_rate": 6.22995062409912e-05, "loss": 0.647, "mean_token_accuracy": 0.8036904372274876, "num_tokens": 392370505.0, "step": 12294 }, { "entropy": 0.6814506938681006, "epoch": 1.131201085675183, "grad_norm": 0.16233666241168976, "learning_rate": 6.229643941484957e-05, "loss": 0.6496, "mean_token_accuracy": 0.7972255758941174, "num_tokens": 392402625.0, "step": 12295 }, { "entropy": 0.5858832020312548, "epoch": 1.1312930920466242, "grad_norm": 0.1519584357738495, "learning_rate": 6.229337258870796e-05, "loss": 0.5691, "mean_token_accuracy": 0.822447158396244, "num_tokens": 392434005.0, "step": 12296 }, { "entropy": 0.6114946603775024, "epoch": 1.1313850984180656, "grad_norm": 0.15280985832214355, "learning_rate": 6.229030576256632e-05, "loss": 0.5771, "mean_token_accuracy": 0.8222698383033276, "num_tokens": 392466222.0, "step": 12297 }, { "entropy": 0.7092425469309092, "epoch": 1.1314771047895067, "grad_norm": 0.17062333226203918, "learning_rate": 6.228723893642469e-05, "loss": 0.6947, "mean_token_accuracy": 0.78279609978199, "num_tokens": 392497873.0, "step": 12298 }, { "entropy": 0.6452382635325193, "epoch": 1.1315691111609478, "grad_norm": 0.165867418050766, "learning_rate": 6.228417211028307e-05, "loss": 0.6268, "mean_token_accuracy": 0.8062387481331825, "num_tokens": 392530209.0, "step": 12299 }, { "entropy": 0.6940925903618336, "epoch": 1.1316611175323892, "grad_norm": 0.16175763309001923, "learning_rate": 6.228110528414145e-05, "loss": 0.6701, "mean_token_accuracy": 0.7976093515753746, "num_tokens": 392561802.0, "step": 12300 }, { "entropy": 0.6780228149145842, "epoch": 1.1317531239038303, "grad_norm": 0.16283129155635834, "learning_rate": 6.227803845799982e-05, "loss": 0.6599, "mean_token_accuracy": 0.8007563203573227, "num_tokens": 392593687.0, "step": 12301 }, { "entropy": 0.549600345082581, "epoch": 1.1318451302752717, "grad_norm": 0.15096589922904968, "learning_rate": 6.227497163185819e-05, "loss": 0.5422, "mean_token_accuracy": 0.8328261785209179, "num_tokens": 392626145.0, "step": 12302 }, { "entropy": 0.6032944666221738, "epoch": 1.1319371366467128, "grad_norm": 0.1649762988090515, "learning_rate": 6.227190480571656e-05, "loss": 0.5887, "mean_token_accuracy": 0.8194115571677685, "num_tokens": 392658168.0, "step": 12303 }, { "entropy": 0.6156762689352036, "epoch": 1.132029143018154, "grad_norm": 0.1598474234342575, "learning_rate": 6.226883797957495e-05, "loss": 0.6075, "mean_token_accuracy": 0.8116383142769337, "num_tokens": 392689879.0, "step": 12304 }, { "entropy": 0.6119699608534575, "epoch": 1.1321211493895953, "grad_norm": 0.16154032945632935, "learning_rate": 6.226577115343332e-05, "loss": 0.6072, "mean_token_accuracy": 0.8156466633081436, "num_tokens": 392721716.0, "step": 12305 }, { "entropy": 0.725898589938879, "epoch": 1.1322131557610364, "grad_norm": 0.16482435166835785, "learning_rate": 6.226270432729169e-05, "loss": 0.7116, "mean_token_accuracy": 0.7843592576682568, "num_tokens": 392753711.0, "step": 12306 }, { "entropy": 0.5690128142014146, "epoch": 1.1323051621324778, "grad_norm": 0.15671518445014954, "learning_rate": 6.225963750115006e-05, "loss": 0.5526, "mean_token_accuracy": 0.8250868245959282, "num_tokens": 392785340.0, "step": 12307 }, { "entropy": 0.5909899696707726, "epoch": 1.132397168503919, "grad_norm": 0.15450182557106018, "learning_rate": 6.225657067500844e-05, "loss": 0.5838, "mean_token_accuracy": 0.8215879872441292, "num_tokens": 392817160.0, "step": 12308 }, { "entropy": 0.6804636958986521, "epoch": 1.13248917487536, "grad_norm": 0.16278193891048431, "learning_rate": 6.225350384886682e-05, "loss": 0.6697, "mean_token_accuracy": 0.7934175655245781, "num_tokens": 392848902.0, "step": 12309 }, { "entropy": 0.5952820926904678, "epoch": 1.1325811812468014, "grad_norm": 0.16166257858276367, "learning_rate": 6.225043702272519e-05, "loss": 0.5943, "mean_token_accuracy": 0.817878071218729, "num_tokens": 392880910.0, "step": 12310 }, { "entropy": 0.5270485626533628, "epoch": 1.1326731876182425, "grad_norm": 0.155563622713089, "learning_rate": 6.224737019658355e-05, "loss": 0.5, "mean_token_accuracy": 0.845644161105156, "num_tokens": 392913068.0, "step": 12311 }, { "entropy": 0.557780809700489, "epoch": 1.132765193989684, "grad_norm": 0.1632363498210907, "learning_rate": 6.224430337044194e-05, "loss": 0.5491, "mean_token_accuracy": 0.8315729200839996, "num_tokens": 392944872.0, "step": 12312 }, { "entropy": 0.6755315978080034, "epoch": 1.132857200361125, "grad_norm": 0.16163857281208038, "learning_rate": 6.22412365443003e-05, "loss": 0.6596, "mean_token_accuracy": 0.7964269742369652, "num_tokens": 392976581.0, "step": 12313 }, { "entropy": 0.7083921693265438, "epoch": 1.1329492067325662, "grad_norm": 0.17328019440174103, "learning_rate": 6.223816971815869e-05, "loss": 0.6783, "mean_token_accuracy": 0.7884764261543751, "num_tokens": 393007457.0, "step": 12314 }, { "entropy": 0.6149065038189292, "epoch": 1.1330412131040075, "grad_norm": 0.15218201279640198, "learning_rate": 6.223510289201705e-05, "loss": 0.5915, "mean_token_accuracy": 0.8180170729756355, "num_tokens": 393039107.0, "step": 12315 }, { "entropy": 0.5917170001193881, "epoch": 1.1331332194754486, "grad_norm": 0.15937185287475586, "learning_rate": 6.223203606587543e-05, "loss": 0.5812, "mean_token_accuracy": 0.8222680985927582, "num_tokens": 393071059.0, "step": 12316 }, { "entropy": 0.645594896748662, "epoch": 1.13322522584689, "grad_norm": 0.163922518491745, "learning_rate": 6.22289692397338e-05, "loss": 0.6242, "mean_token_accuracy": 0.8085721917450428, "num_tokens": 393102602.0, "step": 12317 }, { "entropy": 0.6096079703420401, "epoch": 1.1333172322183311, "grad_norm": 0.15040433406829834, "learning_rate": 6.222590241359217e-05, "loss": 0.6009, "mean_token_accuracy": 0.81539436429739, "num_tokens": 393134835.0, "step": 12318 }, { "entropy": 0.7109447922557592, "epoch": 1.1334092385897723, "grad_norm": 0.16296744346618652, "learning_rate": 6.222283558745055e-05, "loss": 0.701, "mean_token_accuracy": 0.7903465665876865, "num_tokens": 393166846.0, "step": 12319 }, { "entropy": 0.47809869796037674, "epoch": 1.1335012449612136, "grad_norm": 0.14495256543159485, "learning_rate": 6.221976876130893e-05, "loss": 0.4629, "mean_token_accuracy": 0.8533494099974632, "num_tokens": 393199161.0, "step": 12320 }, { "entropy": 0.6820257194340229, "epoch": 1.1335932513326548, "grad_norm": 0.1631256341934204, "learning_rate": 6.22167019351673e-05, "loss": 0.6646, "mean_token_accuracy": 0.7959784865379333, "num_tokens": 393231242.0, "step": 12321 }, { "entropy": 0.6646714527159929, "epoch": 1.1336852577040961, "grad_norm": 0.1563953310251236, "learning_rate": 6.221363510902567e-05, "loss": 0.6422, "mean_token_accuracy": 0.8023679293692112, "num_tokens": 393263487.0, "step": 12322 }, { "entropy": 0.5923055149614811, "epoch": 1.1337772640755372, "grad_norm": 0.15488485991954803, "learning_rate": 6.221056828288404e-05, "loss": 0.5726, "mean_token_accuracy": 0.8231687434017658, "num_tokens": 393295586.0, "step": 12323 }, { "entropy": 0.6159800440073013, "epoch": 1.1338692704469784, "grad_norm": 0.16243302822113037, "learning_rate": 6.220750145674242e-05, "loss": 0.6039, "mean_token_accuracy": 0.8157337754964828, "num_tokens": 393328026.0, "step": 12324 }, { "entropy": 0.7097544008865952, "epoch": 1.1339612768184197, "grad_norm": 0.16421106457710266, "learning_rate": 6.22044346306008e-05, "loss": 0.6928, "mean_token_accuracy": 0.7934701964259148, "num_tokens": 393360137.0, "step": 12325 }, { "entropy": 0.6259119063615799, "epoch": 1.1340532831898609, "grad_norm": 0.15588416159152985, "learning_rate": 6.220136780445917e-05, "loss": 0.6239, "mean_token_accuracy": 0.8059559427201748, "num_tokens": 393391821.0, "step": 12326 }, { "entropy": 0.5606862790882587, "epoch": 1.1341452895613022, "grad_norm": 0.15644219517707825, "learning_rate": 6.219830097831755e-05, "loss": 0.5589, "mean_token_accuracy": 0.8297991566359997, "num_tokens": 393423829.0, "step": 12327 }, { "entropy": 0.6628409549593925, "epoch": 1.1342372959327434, "grad_norm": 0.1585996448993683, "learning_rate": 6.219523415217592e-05, "loss": 0.6398, "mean_token_accuracy": 0.8046713508665562, "num_tokens": 393455721.0, "step": 12328 }, { "entropy": 0.5748065458610654, "epoch": 1.1343293023041845, "grad_norm": 0.16057245433330536, "learning_rate": 6.219216732603428e-05, "loss": 0.5625, "mean_token_accuracy": 0.8266722522675991, "num_tokens": 393487102.0, "step": 12329 }, { "entropy": 0.6759069124236703, "epoch": 1.1344213086756259, "grad_norm": 0.16487883031368256, "learning_rate": 6.218910049989267e-05, "loss": 0.6596, "mean_token_accuracy": 0.795551523566246, "num_tokens": 393519257.0, "step": 12330 }, { "entropy": 0.6647465527057648, "epoch": 1.134513315047067, "grad_norm": 0.16044220328330994, "learning_rate": 6.218603367375105e-05, "loss": 0.6716, "mean_token_accuracy": 0.8005103543400764, "num_tokens": 393551520.0, "step": 12331 }, { "entropy": 0.6527817221358418, "epoch": 1.1346053214185083, "grad_norm": 0.16175054013729095, "learning_rate": 6.218296684760942e-05, "loss": 0.645, "mean_token_accuracy": 0.7996819466352463, "num_tokens": 393583598.0, "step": 12332 }, { "entropy": 0.5309668425470591, "epoch": 1.1346973277899495, "grad_norm": 0.1475021094083786, "learning_rate": 6.217990002146778e-05, "loss": 0.5242, "mean_token_accuracy": 0.8411750048398972, "num_tokens": 393614884.0, "step": 12333 }, { "entropy": 0.6677129622548819, "epoch": 1.1347893341613906, "grad_norm": 0.1703447550535202, "learning_rate": 6.217683319532615e-05, "loss": 0.667, "mean_token_accuracy": 0.7977585159242153, "num_tokens": 393646487.0, "step": 12334 }, { "entropy": 0.6559971887618303, "epoch": 1.134881340532832, "grad_norm": 0.15778139233589172, "learning_rate": 6.217376636918453e-05, "loss": 0.6561, "mean_token_accuracy": 0.7999578714370728, "num_tokens": 393678910.0, "step": 12335 }, { "entropy": 0.7940126471221447, "epoch": 1.134973346904273, "grad_norm": 0.16828560829162598, "learning_rate": 6.217069954304291e-05, "loss": 0.7909, "mean_token_accuracy": 0.7593330852687359, "num_tokens": 393710642.0, "step": 12336 }, { "entropy": 0.6143331676721573, "epoch": 1.1350653532757145, "grad_norm": 0.15553882718086243, "learning_rate": 6.216763271690128e-05, "loss": 0.5983, "mean_token_accuracy": 0.8199006617069244, "num_tokens": 393743088.0, "step": 12337 }, { "entropy": 0.7092504762113094, "epoch": 1.1351573596471556, "grad_norm": 0.16143575310707092, "learning_rate": 6.216456589075965e-05, "loss": 0.6979, "mean_token_accuracy": 0.7874245569109917, "num_tokens": 393775821.0, "step": 12338 }, { "entropy": 0.623607499524951, "epoch": 1.1352493660185967, "grad_norm": 0.16616837680339813, "learning_rate": 6.216149906461803e-05, "loss": 0.6001, "mean_token_accuracy": 0.8166167177259922, "num_tokens": 393807521.0, "step": 12339 }, { "entropy": 0.47232686914503574, "epoch": 1.135341372390038, "grad_norm": 0.15281306207180023, "learning_rate": 6.21584322384764e-05, "loss": 0.4572, "mean_token_accuracy": 0.8569556064903736, "num_tokens": 393839926.0, "step": 12340 }, { "entropy": 0.6409442238509655, "epoch": 1.1354333787614792, "grad_norm": 0.1584843397140503, "learning_rate": 6.215536541233478e-05, "loss": 0.6046, "mean_token_accuracy": 0.811288133263588, "num_tokens": 393872352.0, "step": 12341 }, { "entropy": 0.5975676514208317, "epoch": 1.1355253851329206, "grad_norm": 0.1589736044406891, "learning_rate": 6.215229858619315e-05, "loss": 0.5804, "mean_token_accuracy": 0.8229115717113018, "num_tokens": 393905120.0, "step": 12342 }, { "entropy": 0.7488523554056883, "epoch": 1.1356173915043617, "grad_norm": 0.16878309845924377, "learning_rate": 6.214923176005153e-05, "loss": 0.7575, "mean_token_accuracy": 0.7745724394917488, "num_tokens": 393936891.0, "step": 12343 }, { "entropy": 0.5846832673996687, "epoch": 1.1357093978758028, "grad_norm": 0.15462666749954224, "learning_rate": 6.21461649339099e-05, "loss": 0.5698, "mean_token_accuracy": 0.8257516659796238, "num_tokens": 393968738.0, "step": 12344 }, { "entropy": 0.6460323520004749, "epoch": 1.1358014042472442, "grad_norm": 0.1643526554107666, "learning_rate": 6.214309810776827e-05, "loss": 0.637, "mean_token_accuracy": 0.8036103807389736, "num_tokens": 394000792.0, "step": 12345 }, { "entropy": 0.5478709973394871, "epoch": 1.1358934106186853, "grad_norm": 0.15844713151454926, "learning_rate": 6.214003128162665e-05, "loss": 0.5244, "mean_token_accuracy": 0.8396775051951408, "num_tokens": 394032710.0, "step": 12346 }, { "entropy": 0.6726537328213453, "epoch": 1.1359854169901267, "grad_norm": 0.15965703129768372, "learning_rate": 6.213696445548503e-05, "loss": 0.6478, "mean_token_accuracy": 0.8027587458491325, "num_tokens": 394064001.0, "step": 12347 }, { "entropy": 0.6116947904229164, "epoch": 1.1360774233615678, "grad_norm": 0.15971821546554565, "learning_rate": 6.21338976293434e-05, "loss": 0.6073, "mean_token_accuracy": 0.8177916407585144, "num_tokens": 394095997.0, "step": 12348 }, { "entropy": 0.5889474134892225, "epoch": 1.136169429733009, "grad_norm": 0.1539253443479538, "learning_rate": 6.213083080320176e-05, "loss": 0.5676, "mean_token_accuracy": 0.8261889554560184, "num_tokens": 394127908.0, "step": 12349 }, { "entropy": 0.6284814616665244, "epoch": 1.1362614361044503, "grad_norm": 0.15516634285449982, "learning_rate": 6.212776397706013e-05, "loss": 0.6266, "mean_token_accuracy": 0.8106968179345131, "num_tokens": 394159791.0, "step": 12350 }, { "entropy": 0.5618092929944396, "epoch": 1.1363534424758914, "grad_norm": 0.15653608739376068, "learning_rate": 6.212469715091853e-05, "loss": 0.5474, "mean_token_accuracy": 0.8352963402867317, "num_tokens": 394191169.0, "step": 12351 }, { "entropy": 0.6074608974158764, "epoch": 1.1364454488473328, "grad_norm": 0.15839944779872894, "learning_rate": 6.21216303247769e-05, "loss": 0.5906, "mean_token_accuracy": 0.8172150924801826, "num_tokens": 394223007.0, "step": 12352 }, { "entropy": 0.5178135049063712, "epoch": 1.136537455218774, "grad_norm": 0.15937285125255585, "learning_rate": 6.211856349863526e-05, "loss": 0.521, "mean_token_accuracy": 0.8415673784911633, "num_tokens": 394255110.0, "step": 12353 }, { "entropy": 0.5548597415909171, "epoch": 1.136629461590215, "grad_norm": 0.1631753295660019, "learning_rate": 6.211549667249363e-05, "loss": 0.5315, "mean_token_accuracy": 0.8350154794752598, "num_tokens": 394286681.0, "step": 12354 }, { "entropy": 0.6128473374992609, "epoch": 1.1367214679616564, "grad_norm": 0.16613374650478363, "learning_rate": 6.211242984635201e-05, "loss": 0.5962, "mean_token_accuracy": 0.8200141340494156, "num_tokens": 394318077.0, "step": 12355 }, { "entropy": 0.569280824624002, "epoch": 1.1368134743330975, "grad_norm": 0.15525124967098236, "learning_rate": 6.21093630202104e-05, "loss": 0.547, "mean_token_accuracy": 0.8332198448479176, "num_tokens": 394350157.0, "step": 12356 }, { "entropy": 0.6814850363880396, "epoch": 1.136905480704539, "grad_norm": 0.164445698261261, "learning_rate": 6.210629619406876e-05, "loss": 0.6776, "mean_token_accuracy": 0.7943492047488689, "num_tokens": 394382144.0, "step": 12357 }, { "entropy": 0.5923316897824407, "epoch": 1.13699748707598, "grad_norm": 0.15584328770637512, "learning_rate": 6.210322936792714e-05, "loss": 0.5602, "mean_token_accuracy": 0.829811342060566, "num_tokens": 394414839.0, "step": 12358 }, { "entropy": 0.6012179283425212, "epoch": 1.1370894934474212, "grad_norm": 0.158112034201622, "learning_rate": 6.210016254178551e-05, "loss": 0.5766, "mean_token_accuracy": 0.8261687010526657, "num_tokens": 394447549.0, "step": 12359 }, { "entropy": 0.5495352195575833, "epoch": 1.1371814998188625, "grad_norm": 0.1625681221485138, "learning_rate": 6.209709571564388e-05, "loss": 0.5278, "mean_token_accuracy": 0.836388636380434, "num_tokens": 394480095.0, "step": 12360 }, { "entropy": 0.5346544748172164, "epoch": 1.1372735061903037, "grad_norm": 0.1533183753490448, "learning_rate": 6.209402888950226e-05, "loss": 0.533, "mean_token_accuracy": 0.8325377479195595, "num_tokens": 394512162.0, "step": 12361 }, { "entropy": 0.6372593753039837, "epoch": 1.137365512561745, "grad_norm": 0.16514630615711212, "learning_rate": 6.209096206336064e-05, "loss": 0.6227, "mean_token_accuracy": 0.8112387247383595, "num_tokens": 394544538.0, "step": 12362 }, { "entropy": 0.636776078492403, "epoch": 1.1374575189331861, "grad_norm": 0.15730862319469452, "learning_rate": 6.208789523721901e-05, "loss": 0.6248, "mean_token_accuracy": 0.8073217160999775, "num_tokens": 394576703.0, "step": 12363 }, { "entropy": 0.5491024050861597, "epoch": 1.1375495253046273, "grad_norm": 0.15518303215503693, "learning_rate": 6.208482841107738e-05, "loss": 0.5384, "mean_token_accuracy": 0.8334970772266388, "num_tokens": 394608784.0, "step": 12364 }, { "entropy": 0.5659561809152365, "epoch": 1.1376415316760686, "grad_norm": 0.15096664428710938, "learning_rate": 6.208176158493574e-05, "loss": 0.5454, "mean_token_accuracy": 0.8334191478788853, "num_tokens": 394641295.0, "step": 12365 }, { "entropy": 0.7255323380231857, "epoch": 1.1377335380475098, "grad_norm": 0.1694958359003067, "learning_rate": 6.207869475879413e-05, "loss": 0.7274, "mean_token_accuracy": 0.7827072367072105, "num_tokens": 394673563.0, "step": 12366 }, { "entropy": 0.6965818954631686, "epoch": 1.1378255444189511, "grad_norm": 0.16082830727100372, "learning_rate": 6.207562793265251e-05, "loss": 0.6954, "mean_token_accuracy": 0.7916997969150543, "num_tokens": 394705939.0, "step": 12367 }, { "entropy": 0.6449702396057546, "epoch": 1.1379175507903923, "grad_norm": 0.16915425658226013, "learning_rate": 6.207256110651088e-05, "loss": 0.6404, "mean_token_accuracy": 0.8040197491645813, "num_tokens": 394737170.0, "step": 12368 }, { "entropy": 0.623005174100399, "epoch": 1.1380095571618334, "grad_norm": 0.15564432740211487, "learning_rate": 6.206949428036924e-05, "loss": 0.6222, "mean_token_accuracy": 0.8127247802913189, "num_tokens": 394769661.0, "step": 12369 }, { "entropy": 0.5177079252898693, "epoch": 1.1381015635332747, "grad_norm": 0.1447088122367859, "learning_rate": 6.206642745422762e-05, "loss": 0.4954, "mean_token_accuracy": 0.846622172743082, "num_tokens": 394801756.0, "step": 12370 }, { "entropy": 0.6313479994423687, "epoch": 1.1381935699047159, "grad_norm": 0.16320443153381348, "learning_rate": 6.206336062808599e-05, "loss": 0.5945, "mean_token_accuracy": 0.8157147988677025, "num_tokens": 394833117.0, "step": 12371 }, { "entropy": 0.6934815645217896, "epoch": 1.1382855762761572, "grad_norm": 0.1595602184534073, "learning_rate": 6.206029380194437e-05, "loss": 0.6847, "mean_token_accuracy": 0.7909411303699017, "num_tokens": 394864840.0, "step": 12372 }, { "entropy": 0.7203186266124249, "epoch": 1.1383775826475984, "grad_norm": 0.16784615814685822, "learning_rate": 6.205722697580274e-05, "loss": 0.722, "mean_token_accuracy": 0.7836071215569973, "num_tokens": 394896396.0, "step": 12373 }, { "entropy": 0.5842782338149846, "epoch": 1.1384695890190395, "grad_norm": 0.15299874544143677, "learning_rate": 6.205416014966112e-05, "loss": 0.5765, "mean_token_accuracy": 0.8256901353597641, "num_tokens": 394928333.0, "step": 12374 }, { "entropy": 0.49247184954583645, "epoch": 1.1385615953904809, "grad_norm": 0.1537412405014038, "learning_rate": 6.205109332351949e-05, "loss": 0.4844, "mean_token_accuracy": 0.8498180881142616, "num_tokens": 394960560.0, "step": 12375 }, { "entropy": 0.6812575459480286, "epoch": 1.138653601761922, "grad_norm": 0.1651483178138733, "learning_rate": 6.204802649737786e-05, "loss": 0.6623, "mean_token_accuracy": 0.7990099191665649, "num_tokens": 394992982.0, "step": 12376 }, { "entropy": 0.5233149817213416, "epoch": 1.1387456081333633, "grad_norm": 0.14749421179294586, "learning_rate": 6.204495967123624e-05, "loss": 0.5052, "mean_token_accuracy": 0.8410474695265293, "num_tokens": 395025335.0, "step": 12377 }, { "entropy": 0.6642313320189714, "epoch": 1.1388376145048045, "grad_norm": 0.15975506603717804, "learning_rate": 6.204189284509462e-05, "loss": 0.6555, "mean_token_accuracy": 0.8007282987236977, "num_tokens": 395057882.0, "step": 12378 }, { "entropy": 0.7056918069720268, "epoch": 1.1389296208762456, "grad_norm": 0.16620883345603943, "learning_rate": 6.203882601895299e-05, "loss": 0.7022, "mean_token_accuracy": 0.7887178026139736, "num_tokens": 395089403.0, "step": 12379 }, { "entropy": 0.6630691699683666, "epoch": 1.139021627247687, "grad_norm": 0.16039837896823883, "learning_rate": 6.203575919281136e-05, "loss": 0.6589, "mean_token_accuracy": 0.8020371422171593, "num_tokens": 395121803.0, "step": 12380 }, { "entropy": 0.5776183507405221, "epoch": 1.139113633619128, "grad_norm": 0.15313725173473358, "learning_rate": 6.203269236666973e-05, "loss": 0.5549, "mean_token_accuracy": 0.8285687863826752, "num_tokens": 395153815.0, "step": 12381 }, { "entropy": 0.5933971544727683, "epoch": 1.1392056399905695, "grad_norm": 0.15539084374904633, "learning_rate": 6.202962554052811e-05, "loss": 0.5912, "mean_token_accuracy": 0.8183011710643768, "num_tokens": 395186583.0, "step": 12382 }, { "entropy": 0.6600109804421663, "epoch": 1.1392976463620106, "grad_norm": 0.16000936925411224, "learning_rate": 6.202655871438649e-05, "loss": 0.6475, "mean_token_accuracy": 0.8024699278175831, "num_tokens": 395218282.0, "step": 12383 }, { "entropy": 0.6397528704255819, "epoch": 1.1393896527334517, "grad_norm": 0.15698426961898804, "learning_rate": 6.202349188824486e-05, "loss": 0.6377, "mean_token_accuracy": 0.8022607937455177, "num_tokens": 395250696.0, "step": 12384 }, { "entropy": 0.7728920914232731, "epoch": 1.139481659104893, "grad_norm": 0.17086392641067505, "learning_rate": 6.202042506210324e-05, "loss": 0.7666, "mean_token_accuracy": 0.7714737839996815, "num_tokens": 395282889.0, "step": 12385 }, { "entropy": 0.5656840410083532, "epoch": 1.1395736654763342, "grad_norm": 0.15899968147277832, "learning_rate": 6.20173582359616e-05, "loss": 0.5557, "mean_token_accuracy": 0.8328882455825806, "num_tokens": 395314592.0, "step": 12386 }, { "entropy": 0.6959112454205751, "epoch": 1.1396656718477756, "grad_norm": 0.1642943173646927, "learning_rate": 6.201429140981997e-05, "loss": 0.6899, "mean_token_accuracy": 0.7895363718271255, "num_tokens": 395346408.0, "step": 12387 }, { "entropy": 0.6443367004394531, "epoch": 1.1397576782192167, "grad_norm": 0.15642262995243073, "learning_rate": 6.201122458367835e-05, "loss": 0.6335, "mean_token_accuracy": 0.8100607134401798, "num_tokens": 395378415.0, "step": 12388 }, { "entropy": 0.6084187878295779, "epoch": 1.1398496845906578, "grad_norm": 0.16397123038768768, "learning_rate": 6.200815775753674e-05, "loss": 0.596, "mean_token_accuracy": 0.8163613267242908, "num_tokens": 395410787.0, "step": 12389 }, { "entropy": 0.6252110991626978, "epoch": 1.1399416909620992, "grad_norm": 0.1681101769208908, "learning_rate": 6.20050909313951e-05, "loss": 0.6079, "mean_token_accuracy": 0.8155026882886887, "num_tokens": 395442642.0, "step": 12390 }, { "entropy": 0.6527020689100027, "epoch": 1.1400336973335403, "grad_norm": 0.1557142287492752, "learning_rate": 6.200202410525347e-05, "loss": 0.6353, "mean_token_accuracy": 0.8036376014351845, "num_tokens": 395474674.0, "step": 12391 }, { "entropy": 0.6265429016202688, "epoch": 1.1401257037049817, "grad_norm": 0.17157284915447235, "learning_rate": 6.199895727911185e-05, "loss": 0.6184, "mean_token_accuracy": 0.8115414418280125, "num_tokens": 395506699.0, "step": 12392 }, { "entropy": 0.6391171962022781, "epoch": 1.1402177100764228, "grad_norm": 0.16240745782852173, "learning_rate": 6.199589045297023e-05, "loss": 0.6246, "mean_token_accuracy": 0.8117387555539608, "num_tokens": 395538451.0, "step": 12393 }, { "entropy": 0.6765471533872187, "epoch": 1.140309716447864, "grad_norm": 0.15574510395526886, "learning_rate": 6.19928236268286e-05, "loss": 0.6784, "mean_token_accuracy": 0.7974761202931404, "num_tokens": 395570761.0, "step": 12394 }, { "entropy": 0.5132903782650828, "epoch": 1.1404017228193053, "grad_norm": 0.1527033895254135, "learning_rate": 6.198975680068697e-05, "loss": 0.5036, "mean_token_accuracy": 0.8457493036985397, "num_tokens": 395602243.0, "step": 12395 }, { "entropy": 0.7308641150593758, "epoch": 1.1404937291907464, "grad_norm": 0.16139931976795197, "learning_rate": 6.198668997454534e-05, "loss": 0.7161, "mean_token_accuracy": 0.7823752611875534, "num_tokens": 395634149.0, "step": 12396 }, { "entropy": 0.6607214901596308, "epoch": 1.1405857355621878, "grad_norm": 0.15887364745140076, "learning_rate": 6.198362314840372e-05, "loss": 0.6374, "mean_token_accuracy": 0.8045762553811073, "num_tokens": 395665038.0, "step": 12397 }, { "entropy": 0.6812430191785097, "epoch": 1.140677741933629, "grad_norm": 0.15610195696353912, "learning_rate": 6.19805563222621e-05, "loss": 0.6661, "mean_token_accuracy": 0.8014470711350441, "num_tokens": 395697399.0, "step": 12398 }, { "entropy": 0.6197273870930076, "epoch": 1.14076974830507, "grad_norm": 0.15428097546100616, "learning_rate": 6.197748949612047e-05, "loss": 0.6039, "mean_token_accuracy": 0.8158012628555298, "num_tokens": 395729387.0, "step": 12399 }, { "entropy": 0.6714733485132456, "epoch": 1.1408617546765114, "grad_norm": 0.16260893642902374, "learning_rate": 6.197442266997884e-05, "loss": 0.6502, "mean_token_accuracy": 0.8007790222764015, "num_tokens": 395760688.0, "step": 12400 }, { "entropy": 0.6364411385729909, "epoch": 1.1409537610479525, "grad_norm": 0.16774992644786835, "learning_rate": 6.197135584383722e-05, "loss": 0.6145, "mean_token_accuracy": 0.8105788603425026, "num_tokens": 395792550.0, "step": 12401 }, { "entropy": 0.6053524827584624, "epoch": 1.141045767419394, "grad_norm": 0.15748253464698792, "learning_rate": 6.196828901769559e-05, "loss": 0.5907, "mean_token_accuracy": 0.8182736672461033, "num_tokens": 395824994.0, "step": 12402 }, { "entropy": 0.6314315591007471, "epoch": 1.141137773790835, "grad_norm": 0.16423700749874115, "learning_rate": 6.196522219155397e-05, "loss": 0.6295, "mean_token_accuracy": 0.8057046234607697, "num_tokens": 395857043.0, "step": 12403 }, { "entropy": 0.626120975241065, "epoch": 1.1412297801622762, "grad_norm": 0.15485729277133942, "learning_rate": 6.196215536541234e-05, "loss": 0.6101, "mean_token_accuracy": 0.8086957708001137, "num_tokens": 395888750.0, "step": 12404 }, { "entropy": 0.5744456993415952, "epoch": 1.1413217865337175, "grad_norm": 0.15394450724124908, "learning_rate": 6.195908853927072e-05, "loss": 0.566, "mean_token_accuracy": 0.8244447112083435, "num_tokens": 395920743.0, "step": 12405 }, { "entropy": 0.6690436210483313, "epoch": 1.1414137929051587, "grad_norm": 0.17307709157466888, "learning_rate": 6.195602171312908e-05, "loss": 0.6623, "mean_token_accuracy": 0.8025307431817055, "num_tokens": 395952462.0, "step": 12406 }, { "entropy": 0.5079704192467034, "epoch": 1.1415057992766, "grad_norm": 0.1569303274154663, "learning_rate": 6.195295488698745e-05, "loss": 0.5005, "mean_token_accuracy": 0.8436812199652195, "num_tokens": 395984578.0, "step": 12407 }, { "entropy": 0.6563872192054987, "epoch": 1.1415978056480411, "grad_norm": 0.164134219288826, "learning_rate": 6.194988806084583e-05, "loss": 0.6393, "mean_token_accuracy": 0.8059910237789154, "num_tokens": 396015527.0, "step": 12408 }, { "entropy": 0.6510522160679102, "epoch": 1.1416898120194823, "grad_norm": 0.16496874392032623, "learning_rate": 6.194682123470422e-05, "loss": 0.6432, "mean_token_accuracy": 0.805675595998764, "num_tokens": 396047430.0, "step": 12409 }, { "entropy": 0.5234911367297173, "epoch": 1.1417818183909236, "grad_norm": 0.15643589198589325, "learning_rate": 6.194375440856258e-05, "loss": 0.5166, "mean_token_accuracy": 0.84093327075243, "num_tokens": 396079347.0, "step": 12410 }, { "entropy": 0.5810280684381723, "epoch": 1.1418738247623648, "grad_norm": 0.14827196300029755, "learning_rate": 6.194068758242095e-05, "loss": 0.5632, "mean_token_accuracy": 0.8262479528784752, "num_tokens": 396111392.0, "step": 12411 }, { "entropy": 0.6840307265520096, "epoch": 1.1419658311338061, "grad_norm": 0.16011863946914673, "learning_rate": 6.193762075627932e-05, "loss": 0.6995, "mean_token_accuracy": 0.7873546667397022, "num_tokens": 396143632.0, "step": 12412 }, { "entropy": 0.7505455948412418, "epoch": 1.1420578375052473, "grad_norm": 0.16815003752708435, "learning_rate": 6.19345539301377e-05, "loss": 0.7472, "mean_token_accuracy": 0.7729654647409916, "num_tokens": 396175456.0, "step": 12413 }, { "entropy": 0.602573552634567, "epoch": 1.1421498438766884, "grad_norm": 0.16156314313411713, "learning_rate": 6.193148710399608e-05, "loss": 0.584, "mean_token_accuracy": 0.8187119178473949, "num_tokens": 396207025.0, "step": 12414 }, { "entropy": 0.614264965057373, "epoch": 1.1422418502481297, "grad_norm": 0.1573498249053955, "learning_rate": 6.192842027785445e-05, "loss": 0.6035, "mean_token_accuracy": 0.816615529358387, "num_tokens": 396238786.0, "step": 12415 }, { "entropy": 0.6730538504198194, "epoch": 1.1423338566195709, "grad_norm": 0.16414783895015717, "learning_rate": 6.192535345171283e-05, "loss": 0.6549, "mean_token_accuracy": 0.7979723960161209, "num_tokens": 396270507.0, "step": 12416 }, { "entropy": 0.6716275569051504, "epoch": 1.1424258629910122, "grad_norm": 0.16298367083072662, "learning_rate": 6.19222866255712e-05, "loss": 0.668, "mean_token_accuracy": 0.8001120686531067, "num_tokens": 396302803.0, "step": 12417 }, { "entropy": 0.6313197873532772, "epoch": 1.1425178693624534, "grad_norm": 0.15750151872634888, "learning_rate": 6.191921979942957e-05, "loss": 0.6045, "mean_token_accuracy": 0.814838096499443, "num_tokens": 396335077.0, "step": 12418 }, { "entropy": 0.674794614315033, "epoch": 1.1426098757338945, "grad_norm": 0.17322558164596558, "learning_rate": 6.191615297328795e-05, "loss": 0.6694, "mean_token_accuracy": 0.7997473627328873, "num_tokens": 396366753.0, "step": 12419 }, { "entropy": 0.6394802406430244, "epoch": 1.1427018821053359, "grad_norm": 0.1666450798511505, "learning_rate": 6.191308614714633e-05, "loss": 0.6407, "mean_token_accuracy": 0.804548192769289, "num_tokens": 396398223.0, "step": 12420 }, { "entropy": 0.5241368832066655, "epoch": 1.142793888476777, "grad_norm": 0.14741474390029907, "learning_rate": 6.19100193210047e-05, "loss": 0.5145, "mean_token_accuracy": 0.8422299735248089, "num_tokens": 396430766.0, "step": 12421 }, { "entropy": 0.5981762809678912, "epoch": 1.1428858948482183, "grad_norm": 0.15144409239292145, "learning_rate": 6.190695249486307e-05, "loss": 0.5935, "mean_token_accuracy": 0.8188077695667744, "num_tokens": 396462482.0, "step": 12422 }, { "entropy": 0.6483870055526495, "epoch": 1.1429779012196595, "grad_norm": 0.15216001868247986, "learning_rate": 6.190388566872143e-05, "loss": 0.642, "mean_token_accuracy": 0.8039689064025879, "num_tokens": 396495229.0, "step": 12423 }, { "entropy": 0.626111158169806, "epoch": 1.1430699075911006, "grad_norm": 0.1528548002243042, "learning_rate": 6.190081884257983e-05, "loss": 0.5906, "mean_token_accuracy": 0.8184879720211029, "num_tokens": 396526348.0, "step": 12424 }, { "entropy": 0.6445505935698748, "epoch": 1.143161913962542, "grad_norm": 0.1545259803533554, "learning_rate": 6.18977520164382e-05, "loss": 0.6086, "mean_token_accuracy": 0.8142320699989796, "num_tokens": 396557920.0, "step": 12425 }, { "entropy": 0.5231994986534119, "epoch": 1.143253920333983, "grad_norm": 0.1490478366613388, "learning_rate": 6.189468519029656e-05, "loss": 0.4945, "mean_token_accuracy": 0.8463121838867664, "num_tokens": 396590245.0, "step": 12426 }, { "entropy": 0.597865954041481, "epoch": 1.1433459267054245, "grad_norm": 0.15328308939933777, "learning_rate": 6.189161836415493e-05, "loss": 0.5912, "mean_token_accuracy": 0.8180431164801121, "num_tokens": 396621638.0, "step": 12427 }, { "entropy": 0.6105694342404604, "epoch": 1.1434379330768656, "grad_norm": 0.15902957320213318, "learning_rate": 6.188855153801331e-05, "loss": 0.6054, "mean_token_accuracy": 0.8103019297122955, "num_tokens": 396652592.0, "step": 12428 }, { "entropy": 0.6478136051446199, "epoch": 1.1435299394483067, "grad_norm": 0.15949390828609467, "learning_rate": 6.18854847118717e-05, "loss": 0.6427, "mean_token_accuracy": 0.8072457611560822, "num_tokens": 396684764.0, "step": 12429 }, { "entropy": 0.7376069463789463, "epoch": 1.143621945819748, "grad_norm": 0.16188976168632507, "learning_rate": 6.188241788573006e-05, "loss": 0.7275, "mean_token_accuracy": 0.7805806025862694, "num_tokens": 396716822.0, "step": 12430 }, { "entropy": 0.5785601790994406, "epoch": 1.1437139521911892, "grad_norm": 0.15297441184520721, "learning_rate": 6.187935105958843e-05, "loss": 0.5713, "mean_token_accuracy": 0.8203974552452564, "num_tokens": 396749515.0, "step": 12431 }, { "entropy": 0.6487518176436424, "epoch": 1.1438059585626306, "grad_norm": 0.15585385262966156, "learning_rate": 6.187628423344681e-05, "loss": 0.637, "mean_token_accuracy": 0.8035667091608047, "num_tokens": 396781738.0, "step": 12432 }, { "entropy": 0.6606129016727209, "epoch": 1.1438979649340717, "grad_norm": 0.17502190172672272, "learning_rate": 6.187321740730518e-05, "loss": 0.66, "mean_token_accuracy": 0.8012001700699329, "num_tokens": 396812944.0, "step": 12433 }, { "entropy": 0.5841666264459491, "epoch": 1.1439899713055128, "grad_norm": 0.15342099964618683, "learning_rate": 6.187015058116356e-05, "loss": 0.5586, "mean_token_accuracy": 0.8259284608066082, "num_tokens": 396845026.0, "step": 12434 }, { "entropy": 0.6372024081647396, "epoch": 1.1440819776769542, "grad_norm": 0.16139303147792816, "learning_rate": 6.186708375502193e-05, "loss": 0.6424, "mean_token_accuracy": 0.8031755350530148, "num_tokens": 396876875.0, "step": 12435 }, { "entropy": 0.5965050058439374, "epoch": 1.1441739840483953, "grad_norm": 0.15972968935966492, "learning_rate": 6.186401692888031e-05, "loss": 0.579, "mean_token_accuracy": 0.8212312608957291, "num_tokens": 396908045.0, "step": 12436 }, { "entropy": 0.5275425743311644, "epoch": 1.1442659904198367, "grad_norm": 0.14700770378112793, "learning_rate": 6.186095010273868e-05, "loss": 0.5171, "mean_token_accuracy": 0.841869805008173, "num_tokens": 396939487.0, "step": 12437 }, { "entropy": 0.6869044788181782, "epoch": 1.1443579967912778, "grad_norm": 0.16122180223464966, "learning_rate": 6.185788327659705e-05, "loss": 0.6751, "mean_token_accuracy": 0.793569665402174, "num_tokens": 396971462.0, "step": 12438 }, { "entropy": 0.6682485826313496, "epoch": 1.144450003162719, "grad_norm": 0.15900689363479614, "learning_rate": 6.185481645045543e-05, "loss": 0.657, "mean_token_accuracy": 0.800269428640604, "num_tokens": 397003721.0, "step": 12439 }, { "entropy": 0.535219163633883, "epoch": 1.1445420095341603, "grad_norm": 0.15656521916389465, "learning_rate": 6.185174962431381e-05, "loss": 0.5204, "mean_token_accuracy": 0.8369112685322762, "num_tokens": 397035415.0, "step": 12440 }, { "entropy": 0.6274595763534307, "epoch": 1.1446340159056014, "grad_norm": 0.1586485207080841, "learning_rate": 6.184868279817218e-05, "loss": 0.6109, "mean_token_accuracy": 0.8136193193495274, "num_tokens": 397067442.0, "step": 12441 }, { "entropy": 0.5496135056018829, "epoch": 1.1447260222770428, "grad_norm": 0.15448737144470215, "learning_rate": 6.184561597203055e-05, "loss": 0.5474, "mean_token_accuracy": 0.831415094435215, "num_tokens": 397099481.0, "step": 12442 }, { "entropy": 0.6107170972973108, "epoch": 1.144818028648484, "grad_norm": 0.15926627814769745, "learning_rate": 6.184254914588891e-05, "loss": 0.6001, "mean_token_accuracy": 0.8182693310081959, "num_tokens": 397130776.0, "step": 12443 }, { "entropy": 0.626948868855834, "epoch": 1.144910035019925, "grad_norm": 0.15877458453178406, "learning_rate": 6.18394823197473e-05, "loss": 0.6308, "mean_token_accuracy": 0.8096575401723385, "num_tokens": 397162968.0, "step": 12444 }, { "entropy": 0.6335325594991446, "epoch": 1.1450020413913664, "grad_norm": 0.15942305326461792, "learning_rate": 6.183641549360568e-05, "loss": 0.6031, "mean_token_accuracy": 0.8117259591817856, "num_tokens": 397194387.0, "step": 12445 }, { "entropy": 0.6468245983123779, "epoch": 1.1450940477628075, "grad_norm": 0.16397881507873535, "learning_rate": 6.183334866746404e-05, "loss": 0.6396, "mean_token_accuracy": 0.8031845763325691, "num_tokens": 397227092.0, "step": 12446 }, { "entropy": 0.5567029081285, "epoch": 1.145186054134249, "grad_norm": 0.1593295782804489, "learning_rate": 6.183028184132243e-05, "loss": 0.5466, "mean_token_accuracy": 0.8342839442193508, "num_tokens": 397258949.0, "step": 12447 }, { "entropy": 0.719151969300583, "epoch": 1.14527806050569, "grad_norm": 0.16210778057575226, "learning_rate": 6.182721501518079e-05, "loss": 0.7047, "mean_token_accuracy": 0.7893036119639874, "num_tokens": 397290974.0, "step": 12448 }, { "entropy": 0.6243793591856956, "epoch": 1.1453700668771312, "grad_norm": 0.16469493508338928, "learning_rate": 6.182414818903916e-05, "loss": 0.6145, "mean_token_accuracy": 0.8118052929639816, "num_tokens": 397322501.0, "step": 12449 }, { "entropy": 0.7673214953392744, "epoch": 1.1454620732485725, "grad_norm": 0.17715772986412048, "learning_rate": 6.182108136289754e-05, "loss": 0.7632, "mean_token_accuracy": 0.7720635905861855, "num_tokens": 397352509.0, "step": 12450 }, { "entropy": 0.5671604666858912, "epoch": 1.1455540796200137, "grad_norm": 0.15873225033283234, "learning_rate": 6.181801453675592e-05, "loss": 0.5487, "mean_token_accuracy": 0.8291239477694035, "num_tokens": 397383632.0, "step": 12451 }, { "entropy": 0.64148950856179, "epoch": 1.145646085991455, "grad_norm": 0.16528421640396118, "learning_rate": 6.181494771061429e-05, "loss": 0.6381, "mean_token_accuracy": 0.80607820302248, "num_tokens": 397415320.0, "step": 12452 }, { "entropy": 0.5881329821422696, "epoch": 1.1457380923628961, "grad_norm": 0.14985701441764832, "learning_rate": 6.181188088447266e-05, "loss": 0.564, "mean_token_accuracy": 0.8275515250861645, "num_tokens": 397447712.0, "step": 12453 }, { "entropy": 0.6130380611866713, "epoch": 1.1458300987343373, "grad_norm": 0.15602156519889832, "learning_rate": 6.180881405833103e-05, "loss": 0.5872, "mean_token_accuracy": 0.8153445608913898, "num_tokens": 397479118.0, "step": 12454 }, { "entropy": 0.6398752778768539, "epoch": 1.1459221051057786, "grad_norm": 0.1588774472475052, "learning_rate": 6.180574723218941e-05, "loss": 0.645, "mean_token_accuracy": 0.8023729138076305, "num_tokens": 397511073.0, "step": 12455 }, { "entropy": 0.6934632528573275, "epoch": 1.1460141114772198, "grad_norm": 0.16544952988624573, "learning_rate": 6.180268040604779e-05, "loss": 0.6846, "mean_token_accuracy": 0.7880833148956299, "num_tokens": 397542600.0, "step": 12456 }, { "entropy": 0.6474995664320886, "epoch": 1.1461061178486611, "grad_norm": 0.15495172142982483, "learning_rate": 6.179961357990616e-05, "loss": 0.6274, "mean_token_accuracy": 0.8121814765036106, "num_tokens": 397574654.0, "step": 12457 }, { "entropy": 0.6714616566896439, "epoch": 1.1461981242201023, "grad_norm": 0.1672070324420929, "learning_rate": 6.179654675376453e-05, "loss": 0.6538, "mean_token_accuracy": 0.7967824377119541, "num_tokens": 397606699.0, "step": 12458 }, { "entropy": 0.549614348448813, "epoch": 1.1462901305915434, "grad_norm": 0.15922768414020538, "learning_rate": 6.179347992762291e-05, "loss": 0.5308, "mean_token_accuracy": 0.8367918692529202, "num_tokens": 397639086.0, "step": 12459 }, { "entropy": 0.6286148531362414, "epoch": 1.1463821369629847, "grad_norm": 0.1581532210111618, "learning_rate": 6.179041310148128e-05, "loss": 0.6067, "mean_token_accuracy": 0.8136859908699989, "num_tokens": 397671019.0, "step": 12460 }, { "entropy": 0.6622096672654152, "epoch": 1.1464741433344259, "grad_norm": 0.1564919650554657, "learning_rate": 6.178734627533966e-05, "loss": 0.6501, "mean_token_accuracy": 0.8028609678149223, "num_tokens": 397703618.0, "step": 12461 }, { "entropy": 0.6285829041153193, "epoch": 1.1465661497058672, "grad_norm": 0.16266392171382904, "learning_rate": 6.178427944919802e-05, "loss": 0.6193, "mean_token_accuracy": 0.8093726336956024, "num_tokens": 397735406.0, "step": 12462 }, { "entropy": 0.5709601864218712, "epoch": 1.1466581560773084, "grad_norm": 0.1632539927959442, "learning_rate": 6.17812126230564e-05, "loss": 0.5578, "mean_token_accuracy": 0.8280309215188026, "num_tokens": 397768119.0, "step": 12463 }, { "entropy": 0.5672345133498311, "epoch": 1.1467501624487495, "grad_norm": 0.1526334285736084, "learning_rate": 6.177814579691477e-05, "loss": 0.5538, "mean_token_accuracy": 0.8329168409109116, "num_tokens": 397799848.0, "step": 12464 }, { "entropy": 0.7530194912105799, "epoch": 1.1468421688201909, "grad_norm": 0.17113281786441803, "learning_rate": 6.177507897077314e-05, "loss": 0.7477, "mean_token_accuracy": 0.7727098241448402, "num_tokens": 397831450.0, "step": 12465 }, { "entropy": 0.5958067318424582, "epoch": 1.146934175191632, "grad_norm": 0.15715409815311432, "learning_rate": 6.177201214463152e-05, "loss": 0.577, "mean_token_accuracy": 0.823171753436327, "num_tokens": 397864153.0, "step": 12466 }, { "entropy": 0.7724650744348764, "epoch": 1.1470261815630733, "grad_norm": 0.1815497726202011, "learning_rate": 6.17689453184899e-05, "loss": 0.7739, "mean_token_accuracy": 0.7725968882441521, "num_tokens": 397895538.0, "step": 12467 }, { "entropy": 0.7119228504598141, "epoch": 1.1471181879345145, "grad_norm": 0.16057145595550537, "learning_rate": 6.176587849234827e-05, "loss": 0.7052, "mean_token_accuracy": 0.7864797785878181, "num_tokens": 397928046.0, "step": 12468 }, { "entropy": 0.6067257300019264, "epoch": 1.1472101943059556, "grad_norm": 0.17007967829704285, "learning_rate": 6.176281166620664e-05, "loss": 0.5952, "mean_token_accuracy": 0.8169468231499195, "num_tokens": 397960290.0, "step": 12469 }, { "entropy": 0.6825837679207325, "epoch": 1.147302200677397, "grad_norm": 0.1590149700641632, "learning_rate": 6.175974484006501e-05, "loss": 0.6716, "mean_token_accuracy": 0.7958759926259518, "num_tokens": 397992403.0, "step": 12470 }, { "entropy": 0.5713729206472635, "epoch": 1.147394207048838, "grad_norm": 0.15989749133586884, "learning_rate": 6.17566780139234e-05, "loss": 0.5627, "mean_token_accuracy": 0.8258596546947956, "num_tokens": 398024538.0, "step": 12471 }, { "entropy": 0.5521664377301931, "epoch": 1.1474862134202795, "grad_norm": 0.15311789512634277, "learning_rate": 6.175361118778177e-05, "loss": 0.544, "mean_token_accuracy": 0.8299490287899971, "num_tokens": 398056880.0, "step": 12472 }, { "entropy": 0.650708282366395, "epoch": 1.1475782197917206, "grad_norm": 0.1533706784248352, "learning_rate": 6.175054436164014e-05, "loss": 0.6515, "mean_token_accuracy": 0.8027827478945255, "num_tokens": 398089456.0, "step": 12473 }, { "entropy": 0.5914721507579088, "epoch": 1.1476702261631617, "grad_norm": 0.15770556032657623, "learning_rate": 6.174747753549851e-05, "loss": 0.5753, "mean_token_accuracy": 0.8224270455539227, "num_tokens": 398122028.0, "step": 12474 }, { "entropy": 0.6822161367163062, "epoch": 1.147762232534603, "grad_norm": 0.1652955561876297, "learning_rate": 6.174441070935689e-05, "loss": 0.667, "mean_token_accuracy": 0.7966043576598167, "num_tokens": 398154141.0, "step": 12475 }, { "entropy": 0.6649995986372232, "epoch": 1.1478542389060442, "grad_norm": 0.1520155966281891, "learning_rate": 6.174134388321527e-05, "loss": 0.6369, "mean_token_accuracy": 0.806101318448782, "num_tokens": 398185588.0, "step": 12476 }, { "entropy": 0.5684383641928434, "epoch": 1.1479462452774856, "grad_norm": 0.15477295219898224, "learning_rate": 6.173827705707364e-05, "loss": 0.5574, "mean_token_accuracy": 0.8276895880699158, "num_tokens": 398217445.0, "step": 12477 }, { "entropy": 0.582215444650501, "epoch": 1.1480382516489267, "grad_norm": 0.1571342498064041, "learning_rate": 6.173521023093202e-05, "loss": 0.5617, "mean_token_accuracy": 0.8311056047677994, "num_tokens": 398249142.0, "step": 12478 }, { "entropy": 0.5368361109867692, "epoch": 1.1481302580203678, "grad_norm": 0.14717097580432892, "learning_rate": 6.173214340479039e-05, "loss": 0.5161, "mean_token_accuracy": 0.8470903001725674, "num_tokens": 398281654.0, "step": 12479 }, { "entropy": 0.6618140856735408, "epoch": 1.1482222643918092, "grad_norm": 0.16528595983982086, "learning_rate": 6.172907657864875e-05, "loss": 0.6439, "mean_token_accuracy": 0.8004782237112522, "num_tokens": 398313412.0, "step": 12480 }, { "entropy": 0.6499750092625618, "epoch": 1.1483142707632503, "grad_norm": 0.16269880533218384, "learning_rate": 6.172600975250714e-05, "loss": 0.645, "mean_token_accuracy": 0.8054536692798138, "num_tokens": 398346073.0, "step": 12481 }, { "entropy": 0.7597648613154888, "epoch": 1.1484062771346917, "grad_norm": 0.16651137173175812, "learning_rate": 6.172294292636552e-05, "loss": 0.7567, "mean_token_accuracy": 0.7689599134027958, "num_tokens": 398377474.0, "step": 12482 }, { "entropy": 0.6769728194922209, "epoch": 1.1484982835061328, "grad_norm": 0.15804097056388855, "learning_rate": 6.171987610022389e-05, "loss": 0.6708, "mean_token_accuracy": 0.7977951355278492, "num_tokens": 398409830.0, "step": 12483 }, { "entropy": 0.6610789932310581, "epoch": 1.148590289877574, "grad_norm": 0.1585070937871933, "learning_rate": 6.171680927408225e-05, "loss": 0.638, "mean_token_accuracy": 0.8068955317139626, "num_tokens": 398442209.0, "step": 12484 }, { "entropy": 0.6604223642498255, "epoch": 1.1486822962490153, "grad_norm": 0.16365469992160797, "learning_rate": 6.171374244794062e-05, "loss": 0.6522, "mean_token_accuracy": 0.8032886795699596, "num_tokens": 398473556.0, "step": 12485 }, { "entropy": 0.5711758444085717, "epoch": 1.1487743026204564, "grad_norm": 0.16323789954185486, "learning_rate": 6.1710675621799e-05, "loss": 0.5641, "mean_token_accuracy": 0.8258028887212276, "num_tokens": 398505182.0, "step": 12486 }, { "entropy": 0.5793720250949264, "epoch": 1.1488663089918978, "grad_norm": 0.1455877125263214, "learning_rate": 6.170760879565738e-05, "loss": 0.5809, "mean_token_accuracy": 0.8219956010580063, "num_tokens": 398537950.0, "step": 12487 }, { "entropy": 0.6082525751553476, "epoch": 1.148958315363339, "grad_norm": 0.16114647686481476, "learning_rate": 6.170454196951575e-05, "loss": 0.6148, "mean_token_accuracy": 0.8132952339947224, "num_tokens": 398570696.0, "step": 12488 }, { "entropy": 0.5676320679485798, "epoch": 1.14905032173478, "grad_norm": 0.15358665585517883, "learning_rate": 6.170147514337412e-05, "loss": 0.5605, "mean_token_accuracy": 0.8285260796546936, "num_tokens": 398602688.0, "step": 12489 }, { "entropy": 0.4463285179808736, "epoch": 1.1491423281062214, "grad_norm": 0.14859817922115326, "learning_rate": 6.16984083172325e-05, "loss": 0.4339, "mean_token_accuracy": 0.8661365173757076, "num_tokens": 398634806.0, "step": 12490 }, { "entropy": 0.6790928561240435, "epoch": 1.1492343344776625, "grad_norm": 0.16621901094913483, "learning_rate": 6.169534149109087e-05, "loss": 0.6862, "mean_token_accuracy": 0.7919354885816574, "num_tokens": 398666020.0, "step": 12491 }, { "entropy": 0.6160495243966579, "epoch": 1.149326340849104, "grad_norm": 0.1578884720802307, "learning_rate": 6.169227466494925e-05, "loss": 0.6087, "mean_token_accuracy": 0.8129483312368393, "num_tokens": 398698115.0, "step": 12492 }, { "entropy": 0.5682510752230883, "epoch": 1.149418347220545, "grad_norm": 0.15616066753864288, "learning_rate": 6.168920783880762e-05, "loss": 0.5587, "mean_token_accuracy": 0.8240585811436176, "num_tokens": 398730520.0, "step": 12493 }, { "entropy": 0.647894062101841, "epoch": 1.1495103535919862, "grad_norm": 0.15358972549438477, "learning_rate": 6.1686141012666e-05, "loss": 0.635, "mean_token_accuracy": 0.8075027950108051, "num_tokens": 398762717.0, "step": 12494 }, { "entropy": 0.6773941516876221, "epoch": 1.1496023599634275, "grad_norm": 0.1613815575838089, "learning_rate": 6.168307418652437e-05, "loss": 0.6687, "mean_token_accuracy": 0.797627966850996, "num_tokens": 398794920.0, "step": 12495 }, { "entropy": 0.640712053515017, "epoch": 1.1496943663348687, "grad_norm": 0.15429727733135223, "learning_rate": 6.168000736038274e-05, "loss": 0.6252, "mean_token_accuracy": 0.8098922222852707, "num_tokens": 398826624.0, "step": 12496 }, { "entropy": 0.5796362049877644, "epoch": 1.14978637270631, "grad_norm": 0.15390892326831818, "learning_rate": 6.167694053424112e-05, "loss": 0.566, "mean_token_accuracy": 0.824682779610157, "num_tokens": 398858537.0, "step": 12497 }, { "entropy": 0.5819000769406557, "epoch": 1.1498783790777511, "grad_norm": 0.1557639241218567, "learning_rate": 6.16738737080995e-05, "loss": 0.5593, "mean_token_accuracy": 0.8310986831784248, "num_tokens": 398891153.0, "step": 12498 }, { "entropy": 0.6530608218163252, "epoch": 1.1499703854491923, "grad_norm": 0.1570030003786087, "learning_rate": 6.167080688195787e-05, "loss": 0.6251, "mean_token_accuracy": 0.8092974834144115, "num_tokens": 398923665.0, "step": 12499 }, { "entropy": 0.5882731191813946, "epoch": 1.1500623918206336, "grad_norm": 0.17019732296466827, "learning_rate": 6.166774005581623e-05, "loss": 0.5784, "mean_token_accuracy": 0.8248474784195423, "num_tokens": 398955693.0, "step": 12500 }, { "entropy": 0.60167570784688, "epoch": 1.1501543981920748, "grad_norm": 0.1530766636133194, "learning_rate": 6.16646732296746e-05, "loss": 0.5843, "mean_token_accuracy": 0.8181661292910576, "num_tokens": 398987704.0, "step": 12501 }, { "entropy": 0.584281818009913, "epoch": 1.1502464045635161, "grad_norm": 0.15858326852321625, "learning_rate": 6.166160640353298e-05, "loss": 0.5743, "mean_token_accuracy": 0.819682240486145, "num_tokens": 399020102.0, "step": 12502 }, { "entropy": 0.6961255669593811, "epoch": 1.1503384109349573, "grad_norm": 0.16187046468257904, "learning_rate": 6.165853957739136e-05, "loss": 0.696, "mean_token_accuracy": 0.7883487120270729, "num_tokens": 399052085.0, "step": 12503 }, { "entropy": 0.6256786119192839, "epoch": 1.1504304173063984, "grad_norm": 0.1624433696269989, "learning_rate": 6.165547275124973e-05, "loss": 0.6198, "mean_token_accuracy": 0.8117522895336151, "num_tokens": 399083969.0, "step": 12504 }, { "entropy": 0.7229004427790642, "epoch": 1.1505224236778397, "grad_norm": 0.16991500556468964, "learning_rate": 6.16524059251081e-05, "loss": 0.722, "mean_token_accuracy": 0.7804803922772408, "num_tokens": 399116262.0, "step": 12505 }, { "entropy": 0.5329565550200641, "epoch": 1.1506144300492809, "grad_norm": 0.16053129732608795, "learning_rate": 6.164933909896648e-05, "loss": 0.5204, "mean_token_accuracy": 0.840036004781723, "num_tokens": 399148414.0, "step": 12506 }, { "entropy": 0.5931178545579314, "epoch": 1.1507064364207222, "grad_norm": 0.1590176224708557, "learning_rate": 6.164627227282485e-05, "loss": 0.579, "mean_token_accuracy": 0.8202678374946117, "num_tokens": 399180674.0, "step": 12507 }, { "entropy": 0.6207096977159381, "epoch": 1.1507984427921634, "grad_norm": 0.15645700693130493, "learning_rate": 6.164320544668323e-05, "loss": 0.6124, "mean_token_accuracy": 0.8154609836637974, "num_tokens": 399213001.0, "step": 12508 }, { "entropy": 0.6490658614784479, "epoch": 1.1508904491636045, "grad_norm": 0.16453945636749268, "learning_rate": 6.164013862054161e-05, "loss": 0.6296, "mean_token_accuracy": 0.8059286363422871, "num_tokens": 399243912.0, "step": 12509 }, { "entropy": 0.6588023798540235, "epoch": 1.1509824555350459, "grad_norm": 0.16029897332191467, "learning_rate": 6.163707179439998e-05, "loss": 0.6563, "mean_token_accuracy": 0.7998053357005119, "num_tokens": 399276268.0, "step": 12510 }, { "entropy": 0.5743353818543255, "epoch": 1.151074461906487, "grad_norm": 0.158537819981575, "learning_rate": 6.163400496825835e-05, "loss": 0.5661, "mean_token_accuracy": 0.8280709683895111, "num_tokens": 399308419.0, "step": 12511 }, { "entropy": 0.6334912721067667, "epoch": 1.1511664682779283, "grad_norm": 0.16213703155517578, "learning_rate": 6.163093814211673e-05, "loss": 0.6256, "mean_token_accuracy": 0.8092435412108898, "num_tokens": 399340745.0, "step": 12512 }, { "entropy": 0.7522643022239208, "epoch": 1.1512584746493695, "grad_norm": 0.16518191993236542, "learning_rate": 6.162787131597511e-05, "loss": 0.7449, "mean_token_accuracy": 0.7792953550815582, "num_tokens": 399373217.0, "step": 12513 }, { "entropy": 0.6375181330367923, "epoch": 1.1513504810208106, "grad_norm": 0.1620526760816574, "learning_rate": 6.162480448983348e-05, "loss": 0.611, "mean_token_accuracy": 0.8144148774445057, "num_tokens": 399405631.0, "step": 12514 }, { "entropy": 0.6473494535312057, "epoch": 1.151442487392252, "grad_norm": 0.16530899703502655, "learning_rate": 6.162173766369185e-05, "loss": 0.644, "mean_token_accuracy": 0.7997112348675728, "num_tokens": 399437823.0, "step": 12515 }, { "entropy": 0.5499817440286279, "epoch": 1.151534493763693, "grad_norm": 0.15687783062458038, "learning_rate": 6.161867083755021e-05, "loss": 0.5383, "mean_token_accuracy": 0.8332377672195435, "num_tokens": 399469243.0, "step": 12516 }, { "entropy": 0.6338571077212691, "epoch": 1.1516265001351345, "grad_norm": 0.15736311674118042, "learning_rate": 6.16156040114086e-05, "loss": 0.63, "mean_token_accuracy": 0.806858267635107, "num_tokens": 399501193.0, "step": 12517 }, { "entropy": 0.667673422023654, "epoch": 1.1517185065065756, "grad_norm": 0.1574450135231018, "learning_rate": 6.161253718526698e-05, "loss": 0.6458, "mean_token_accuracy": 0.7998207993805408, "num_tokens": 399533242.0, "step": 12518 }, { "entropy": 0.5393115812912583, "epoch": 1.1518105128780167, "grad_norm": 0.1480705589056015, "learning_rate": 6.160947035912535e-05, "loss": 0.516, "mean_token_accuracy": 0.8414127640426159, "num_tokens": 399565048.0, "step": 12519 }, { "entropy": 0.6692915260791779, "epoch": 1.151902519249458, "grad_norm": 0.16342847049236298, "learning_rate": 6.160640353298371e-05, "loss": 0.6648, "mean_token_accuracy": 0.8019160255789757, "num_tokens": 399597162.0, "step": 12520 }, { "entropy": 0.5546263311989605, "epoch": 1.1519945256208992, "grad_norm": 0.1662762612104416, "learning_rate": 6.16033367068421e-05, "loss": 0.5201, "mean_token_accuracy": 0.8373949751257896, "num_tokens": 399629090.0, "step": 12521 }, { "entropy": 0.6724150124937296, "epoch": 1.1520865319923406, "grad_norm": 0.160316601395607, "learning_rate": 6.160026988070046e-05, "loss": 0.6645, "mean_token_accuracy": 0.8011331968009472, "num_tokens": 399660844.0, "step": 12522 }, { "entropy": 0.5720565123483539, "epoch": 1.1521785383637817, "grad_norm": 0.15511725842952728, "learning_rate": 6.159720305455884e-05, "loss": 0.5516, "mean_token_accuracy": 0.829716645181179, "num_tokens": 399692722.0, "step": 12523 }, { "entropy": 0.7351727737113833, "epoch": 1.1522705447352228, "grad_norm": 0.16435250639915466, "learning_rate": 6.159413622841721e-05, "loss": 0.7435, "mean_token_accuracy": 0.7797145992517471, "num_tokens": 399724481.0, "step": 12524 }, { "entropy": 0.5913975834846497, "epoch": 1.1523625511066642, "grad_norm": 0.15161928534507751, "learning_rate": 6.15910694022756e-05, "loss": 0.5678, "mean_token_accuracy": 0.8246057666838169, "num_tokens": 399756807.0, "step": 12525 }, { "entropy": 0.7019187090918422, "epoch": 1.1524545574781053, "grad_norm": 0.16494333744049072, "learning_rate": 6.158800257613396e-05, "loss": 0.6965, "mean_token_accuracy": 0.7897191643714905, "num_tokens": 399788506.0, "step": 12526 }, { "entropy": 0.5857827886939049, "epoch": 1.1525465638495467, "grad_norm": 0.1537531167268753, "learning_rate": 6.158493574999233e-05, "loss": 0.5833, "mean_token_accuracy": 0.8228163085877895, "num_tokens": 399821216.0, "step": 12527 }, { "entropy": 0.5228724647313356, "epoch": 1.1526385702209878, "grad_norm": 0.1561654657125473, "learning_rate": 6.158186892385071e-05, "loss": 0.5212, "mean_token_accuracy": 0.8409807719290257, "num_tokens": 399852988.0, "step": 12528 }, { "entropy": 0.6890172716230154, "epoch": 1.152730576592429, "grad_norm": 0.16496893763542175, "learning_rate": 6.157880209770909e-05, "loss": 0.685, "mean_token_accuracy": 0.7920877523720264, "num_tokens": 399883998.0, "step": 12529 }, { "entropy": 0.7213133657351136, "epoch": 1.1528225829638703, "grad_norm": 0.16401194036006927, "learning_rate": 6.157573527156746e-05, "loss": 0.7345, "mean_token_accuracy": 0.7776467055082321, "num_tokens": 399915931.0, "step": 12530 }, { "entropy": 0.7536927722394466, "epoch": 1.1529145893353114, "grad_norm": 0.1661224514245987, "learning_rate": 6.157266844542583e-05, "loss": 0.7468, "mean_token_accuracy": 0.7718115001916885, "num_tokens": 399947589.0, "step": 12531 }, { "entropy": 0.6651991233229637, "epoch": 1.1530065957067528, "grad_norm": 0.15460124611854553, "learning_rate": 6.15696016192842e-05, "loss": 0.6557, "mean_token_accuracy": 0.8005007319152355, "num_tokens": 399980357.0, "step": 12532 }, { "entropy": 0.6461223671212792, "epoch": 1.153098602078194, "grad_norm": 0.16007381677627563, "learning_rate": 6.156653479314258e-05, "loss": 0.6205, "mean_token_accuracy": 0.8111306577920914, "num_tokens": 400011699.0, "step": 12533 }, { "entropy": 0.597927650436759, "epoch": 1.153190608449635, "grad_norm": 0.16182544827461243, "learning_rate": 6.156346796700096e-05, "loss": 0.5573, "mean_token_accuracy": 0.8288383185863495, "num_tokens": 400043360.0, "step": 12534 }, { "entropy": 0.7442982625216246, "epoch": 1.1532826148210764, "grad_norm": 0.16018398106098175, "learning_rate": 6.156040114085933e-05, "loss": 0.7328, "mean_token_accuracy": 0.7771634161472321, "num_tokens": 400075292.0, "step": 12535 }, { "entropy": 0.6614075060933828, "epoch": 1.1533746211925175, "grad_norm": 0.9762125015258789, "learning_rate": 6.15573343147177e-05, "loss": 0.7105, "mean_token_accuracy": 0.8012426644563675, "num_tokens": 400107453.0, "step": 12536 }, { "entropy": 0.5775686390697956, "epoch": 1.153466627563959, "grad_norm": 0.1544279009103775, "learning_rate": 6.155426748857608e-05, "loss": 0.557, "mean_token_accuracy": 0.8284998014569283, "num_tokens": 400139846.0, "step": 12537 }, { "entropy": 0.6102480255067348, "epoch": 1.1535586339354, "grad_norm": 0.17959213256835938, "learning_rate": 6.155120066243444e-05, "loss": 0.5893, "mean_token_accuracy": 0.8196839578449726, "num_tokens": 400172246.0, "step": 12538 }, { "entropy": 0.6789997331798077, "epoch": 1.1536506403068412, "grad_norm": 0.17623034119606018, "learning_rate": 6.154813383629283e-05, "loss": 0.6738, "mean_token_accuracy": 0.8028445951640606, "num_tokens": 400203144.0, "step": 12539 }, { "entropy": 0.6175279673188925, "epoch": 1.1537426466782825, "grad_norm": 0.31593430042266846, "learning_rate": 6.15450670101512e-05, "loss": 0.6102, "mean_token_accuracy": 0.8166398108005524, "num_tokens": 400235345.0, "step": 12540 }, { "entropy": 0.7198263350874186, "epoch": 1.1538346530497237, "grad_norm": 0.16532424092292786, "learning_rate": 6.154200018400957e-05, "loss": 0.7108, "mean_token_accuracy": 0.7864139229059219, "num_tokens": 400267742.0, "step": 12541 }, { "entropy": 0.6043607504107058, "epoch": 1.153926659421165, "grad_norm": 0.1636044681072235, "learning_rate": 6.153893335786794e-05, "loss": 0.5897, "mean_token_accuracy": 0.8219213038682938, "num_tokens": 400299081.0, "step": 12542 }, { "entropy": 0.5588542148470879, "epoch": 1.1540186657926061, "grad_norm": 0.16600896418094635, "learning_rate": 6.153586653172631e-05, "loss": 0.5634, "mean_token_accuracy": 0.8266470804810524, "num_tokens": 400330547.0, "step": 12543 }, { "entropy": 0.6366480784490705, "epoch": 1.1541106721640473, "grad_norm": 0.16014273464679718, "learning_rate": 6.15327997055847e-05, "loss": 0.6238, "mean_token_accuracy": 0.8074254579842091, "num_tokens": 400362880.0, "step": 12544 }, { "entropy": 0.4666228275746107, "epoch": 1.1542026785354886, "grad_norm": 0.1453714817762375, "learning_rate": 6.152973287944307e-05, "loss": 0.4579, "mean_token_accuracy": 0.8573523610830307, "num_tokens": 400394902.0, "step": 12545 }, { "entropy": 0.5390175860375166, "epoch": 1.1542946849069298, "grad_norm": 0.14768849313259125, "learning_rate": 6.152666605330144e-05, "loss": 0.5184, "mean_token_accuracy": 0.8354245834052563, "num_tokens": 400426737.0, "step": 12546 }, { "entropy": 0.6629142444580793, "epoch": 1.1543866912783711, "grad_norm": 0.16559794545173645, "learning_rate": 6.152359922715981e-05, "loss": 0.6521, "mean_token_accuracy": 0.7994280233979225, "num_tokens": 400458828.0, "step": 12547 }, { "entropy": 0.6264387415722013, "epoch": 1.1544786976498123, "grad_norm": 0.15769243240356445, "learning_rate": 6.152053240101819e-05, "loss": 0.6211, "mean_token_accuracy": 0.8078948110342026, "num_tokens": 400490391.0, "step": 12548 }, { "entropy": 0.5609429571777582, "epoch": 1.1545707040212534, "grad_norm": 0.15816394984722137, "learning_rate": 6.151746557487657e-05, "loss": 0.5537, "mean_token_accuracy": 0.8288928158581257, "num_tokens": 400522218.0, "step": 12549 }, { "entropy": 0.6014771512709558, "epoch": 1.1546627103926947, "grad_norm": 0.15566343069076538, "learning_rate": 6.151439874873494e-05, "loss": 0.5937, "mean_token_accuracy": 0.8201383166015148, "num_tokens": 400554225.0, "step": 12550 }, { "entropy": 0.6809070874005556, "epoch": 1.1547547167641359, "grad_norm": 0.15970923006534576, "learning_rate": 6.151133192259331e-05, "loss": 0.6565, "mean_token_accuracy": 0.8001220971345901, "num_tokens": 400586460.0, "step": 12551 }, { "entropy": 0.584039100445807, "epoch": 1.1548467231355772, "grad_norm": 0.1590511053800583, "learning_rate": 6.150826509645169e-05, "loss": 0.5563, "mean_token_accuracy": 0.8237068094313145, "num_tokens": 400617908.0, "step": 12552 }, { "entropy": 0.6425019688904285, "epoch": 1.1549387295070184, "grad_norm": 0.15902400016784668, "learning_rate": 6.150519827031006e-05, "loss": 0.6328, "mean_token_accuracy": 0.8060521185398102, "num_tokens": 400649504.0, "step": 12553 }, { "entropy": 0.634262578561902, "epoch": 1.1550307358784595, "grad_norm": 0.16272272169589996, "learning_rate": 6.150213144416844e-05, "loss": 0.6281, "mean_token_accuracy": 0.8065553940832615, "num_tokens": 400681948.0, "step": 12554 }, { "entropy": 0.7281483337283134, "epoch": 1.1551227422499009, "grad_norm": 0.16158601641654968, "learning_rate": 6.14990646180268e-05, "loss": 0.729, "mean_token_accuracy": 0.7813884653151035, "num_tokens": 400713567.0, "step": 12555 }, { "entropy": 0.6343301106244326, "epoch": 1.155214748621342, "grad_norm": 0.15761631727218628, "learning_rate": 6.149599779188519e-05, "loss": 0.6247, "mean_token_accuracy": 0.8086086474359035, "num_tokens": 400745389.0, "step": 12556 }, { "entropy": 0.5284028798341751, "epoch": 1.1553067549927833, "grad_norm": 0.15922819077968597, "learning_rate": 6.149293096574356e-05, "loss": 0.5125, "mean_token_accuracy": 0.8446672074496746, "num_tokens": 400776640.0, "step": 12557 }, { "entropy": 0.5586043866351247, "epoch": 1.1553987613642245, "grad_norm": 0.19897381961345673, "learning_rate": 6.148986413960192e-05, "loss": 0.5488, "mean_token_accuracy": 0.8349239490926266, "num_tokens": 400808498.0, "step": 12558 }, { "entropy": 0.5805538278073072, "epoch": 1.1554907677356656, "grad_norm": 0.15442386269569397, "learning_rate": 6.14867973134603e-05, "loss": 0.5736, "mean_token_accuracy": 0.8229454793035984, "num_tokens": 400841176.0, "step": 12559 }, { "entropy": 0.5896794870495796, "epoch": 1.155582774107107, "grad_norm": 0.15235577523708344, "learning_rate": 6.148373048731869e-05, "loss": 0.5811, "mean_token_accuracy": 0.8182911761105061, "num_tokens": 400873231.0, "step": 12560 }, { "entropy": 0.6123478738591075, "epoch": 1.155674780478548, "grad_norm": 0.16093820333480835, "learning_rate": 6.148066366117705e-05, "loss": 0.6042, "mean_token_accuracy": 0.8170471973717213, "num_tokens": 400905655.0, "step": 12561 }, { "entropy": 0.5621436964720488, "epoch": 1.1557667868499895, "grad_norm": 0.16095098853111267, "learning_rate": 6.147759683503542e-05, "loss": 0.5575, "mean_token_accuracy": 0.8271565288305283, "num_tokens": 400937423.0, "step": 12562 }, { "entropy": 0.643779506906867, "epoch": 1.1558587932214306, "grad_norm": 0.15668343007564545, "learning_rate": 6.147453000889379e-05, "loss": 0.6418, "mean_token_accuracy": 0.802987165749073, "num_tokens": 400969520.0, "step": 12563 }, { "entropy": 0.571981268003583, "epoch": 1.1559507995928717, "grad_norm": 0.15695954859256744, "learning_rate": 6.147146318275217e-05, "loss": 0.5555, "mean_token_accuracy": 0.8307585045695305, "num_tokens": 401001779.0, "step": 12564 }, { "entropy": 0.6169859888032079, "epoch": 1.156042805964313, "grad_norm": 0.15969878435134888, "learning_rate": 6.146839635661055e-05, "loss": 0.6041, "mean_token_accuracy": 0.8126465529203415, "num_tokens": 401033237.0, "step": 12565 }, { "entropy": 0.7689934968948364, "epoch": 1.1561348123357542, "grad_norm": 0.1705353707075119, "learning_rate": 6.146532953046892e-05, "loss": 0.7616, "mean_token_accuracy": 0.7709814384579659, "num_tokens": 401065059.0, "step": 12566 }, { "entropy": 0.6564987916499376, "epoch": 1.1562268187071956, "grad_norm": 0.16360372304916382, "learning_rate": 6.146226270432729e-05, "loss": 0.6343, "mean_token_accuracy": 0.8023303672671318, "num_tokens": 401096387.0, "step": 12567 }, { "entropy": 0.6653701290488243, "epoch": 1.1563188250786367, "grad_norm": 0.15895193815231323, "learning_rate": 6.145919587818567e-05, "loss": 0.6436, "mean_token_accuracy": 0.8040464967489243, "num_tokens": 401127996.0, "step": 12568 }, { "entropy": 0.5966701973229647, "epoch": 1.1564108314500778, "grad_norm": 0.15566350519657135, "learning_rate": 6.145612905204404e-05, "loss": 0.5933, "mean_token_accuracy": 0.8207437768578529, "num_tokens": 401160764.0, "step": 12569 }, { "entropy": 0.6979442723095417, "epoch": 1.1565028378215192, "grad_norm": 0.16105620563030243, "learning_rate": 6.145306222590242e-05, "loss": 0.6813, "mean_token_accuracy": 0.7937680669128895, "num_tokens": 401191793.0, "step": 12570 }, { "entropy": 0.678867019712925, "epoch": 1.1565948441929603, "grad_norm": 0.15583637356758118, "learning_rate": 6.14499953997608e-05, "loss": 0.6607, "mean_token_accuracy": 0.7966363579034805, "num_tokens": 401223946.0, "step": 12571 }, { "entropy": 0.6271709781140089, "epoch": 1.1566868505644017, "grad_norm": 0.157325878739357, "learning_rate": 6.144692857361917e-05, "loss": 0.618, "mean_token_accuracy": 0.8074054382741451, "num_tokens": 401255857.0, "step": 12572 }, { "entropy": 0.688151016831398, "epoch": 1.1567788569358428, "grad_norm": 0.16152985394001007, "learning_rate": 6.144386174747754e-05, "loss": 0.676, "mean_token_accuracy": 0.7991058938205242, "num_tokens": 401287468.0, "step": 12573 }, { "entropy": 0.6466993670910597, "epoch": 1.156870863307284, "grad_norm": 0.15849439799785614, "learning_rate": 6.14407949213359e-05, "loss": 0.6193, "mean_token_accuracy": 0.8097205758094788, "num_tokens": 401319442.0, "step": 12574 }, { "entropy": 0.5906429355964065, "epoch": 1.1569628696787253, "grad_norm": 0.16175219416618347, "learning_rate": 6.143772809519429e-05, "loss": 0.5696, "mean_token_accuracy": 0.823595192283392, "num_tokens": 401350918.0, "step": 12575 }, { "entropy": 0.6266635814681649, "epoch": 1.1570548760501664, "grad_norm": 0.15555544197559357, "learning_rate": 6.143466126905267e-05, "loss": 0.627, "mean_token_accuracy": 0.8125366009771824, "num_tokens": 401383571.0, "step": 12576 }, { "entropy": 0.7180796694010496, "epoch": 1.1571468824216078, "grad_norm": 0.1607608199119568, "learning_rate": 6.143159444291103e-05, "loss": 0.7156, "mean_token_accuracy": 0.7855488173663616, "num_tokens": 401415140.0, "step": 12577 }, { "entropy": 0.6287715081125498, "epoch": 1.157238888793049, "grad_norm": 0.16212141513824463, "learning_rate": 6.14285276167694e-05, "loss": 0.6176, "mean_token_accuracy": 0.8103734217584133, "num_tokens": 401446975.0, "step": 12578 }, { "entropy": 0.6359396188054234, "epoch": 1.15733089516449, "grad_norm": 0.15376703441143036, "learning_rate": 6.142546079062778e-05, "loss": 0.6243, "mean_token_accuracy": 0.8074772469699383, "num_tokens": 401478906.0, "step": 12579 }, { "entropy": 0.6734068319201469, "epoch": 1.1574229015359314, "grad_norm": 0.16696463525295258, "learning_rate": 6.142239396448615e-05, "loss": 0.6611, "mean_token_accuracy": 0.796523205935955, "num_tokens": 401510913.0, "step": 12580 }, { "entropy": 0.6459511108696461, "epoch": 1.1575149079073725, "grad_norm": 0.15991081297397614, "learning_rate": 6.141932713834453e-05, "loss": 0.6387, "mean_token_accuracy": 0.80333561450243, "num_tokens": 401543136.0, "step": 12581 }, { "entropy": 0.7846213448792696, "epoch": 1.157606914278814, "grad_norm": 0.17464055120944977, "learning_rate": 6.14162603122029e-05, "loss": 0.7719, "mean_token_accuracy": 0.7684539444744587, "num_tokens": 401574764.0, "step": 12582 }, { "entropy": 0.6234679650515318, "epoch": 1.157698920650255, "grad_norm": 0.15831829607486725, "learning_rate": 6.141319348606128e-05, "loss": 0.6095, "mean_token_accuracy": 0.8102762959897518, "num_tokens": 401606517.0, "step": 12583 }, { "entropy": 0.5717992410063744, "epoch": 1.1577909270216962, "grad_norm": 0.20177678763866425, "learning_rate": 6.141012665991965e-05, "loss": 0.5756, "mean_token_accuracy": 0.8219264410436153, "num_tokens": 401638926.0, "step": 12584 }, { "entropy": 0.5372052034363151, "epoch": 1.1578829333931375, "grad_norm": 0.15601781010627747, "learning_rate": 6.140705983377802e-05, "loss": 0.5104, "mean_token_accuracy": 0.8421565406024456, "num_tokens": 401671367.0, "step": 12585 }, { "entropy": 0.6953169452026486, "epoch": 1.1579749397645787, "grad_norm": 0.1638512909412384, "learning_rate": 6.14039930076364e-05, "loss": 0.673, "mean_token_accuracy": 0.7946280762553215, "num_tokens": 401703707.0, "step": 12586 }, { "entropy": 0.554560977499932, "epoch": 1.15806694613602, "grad_norm": 0.16423475742340088, "learning_rate": 6.140092618149478e-05, "loss": 0.5551, "mean_token_accuracy": 0.8282148912549019, "num_tokens": 401735470.0, "step": 12587 }, { "entropy": 0.6296832822263241, "epoch": 1.1581589525074611, "grad_norm": 0.1663064807653427, "learning_rate": 6.139785935535315e-05, "loss": 0.6105, "mean_token_accuracy": 0.8114977069199085, "num_tokens": 401767359.0, "step": 12588 }, { "entropy": 0.5633092131465673, "epoch": 1.1582509588789023, "grad_norm": 0.1477556824684143, "learning_rate": 6.139479252921152e-05, "loss": 0.5461, "mean_token_accuracy": 0.8293136432766914, "num_tokens": 401799736.0, "step": 12589 }, { "entropy": 0.6159085724502802, "epoch": 1.1583429652503436, "grad_norm": 0.1688009649515152, "learning_rate": 6.139172570306988e-05, "loss": 0.6017, "mean_token_accuracy": 0.8152236565947533, "num_tokens": 401831881.0, "step": 12590 }, { "entropy": 0.6485949447378516, "epoch": 1.1584349716217848, "grad_norm": 0.16668526828289032, "learning_rate": 6.138865887692828e-05, "loss": 0.6428, "mean_token_accuracy": 0.8064571470022202, "num_tokens": 401862938.0, "step": 12591 }, { "entropy": 0.6474290629848838, "epoch": 1.1585269779932261, "grad_norm": 0.1665302813053131, "learning_rate": 6.138559205078665e-05, "loss": 0.6374, "mean_token_accuracy": 0.8042043820023537, "num_tokens": 401894977.0, "step": 12592 }, { "entropy": 0.5788237918168306, "epoch": 1.1586189843646673, "grad_norm": 0.16325215995311737, "learning_rate": 6.138252522464502e-05, "loss": 0.5558, "mean_token_accuracy": 0.8246861472725868, "num_tokens": 401925248.0, "step": 12593 }, { "entropy": 0.6510245949029922, "epoch": 1.1587109907361084, "grad_norm": 0.1652635931968689, "learning_rate": 6.137945839850338e-05, "loss": 0.6296, "mean_token_accuracy": 0.808032289147377, "num_tokens": 401957180.0, "step": 12594 }, { "entropy": 0.5245853550732136, "epoch": 1.1588029971075497, "grad_norm": 0.14271168410778046, "learning_rate": 6.137639157236176e-05, "loss": 0.5125, "mean_token_accuracy": 0.8423182666301727, "num_tokens": 401989493.0, "step": 12595 }, { "entropy": 0.6381749417632818, "epoch": 1.1588950034789909, "grad_norm": 0.16046643257141113, "learning_rate": 6.137332474622015e-05, "loss": 0.6306, "mean_token_accuracy": 0.8073310814797878, "num_tokens": 402021034.0, "step": 12596 }, { "entropy": 0.6103674778714776, "epoch": 1.1589870098504322, "grad_norm": 0.15521511435508728, "learning_rate": 6.137025792007851e-05, "loss": 0.5986, "mean_token_accuracy": 0.8160270936787128, "num_tokens": 402052524.0, "step": 12597 }, { "entropy": 0.6625061351805925, "epoch": 1.1590790162218734, "grad_norm": 0.1674436628818512, "learning_rate": 6.136719109393688e-05, "loss": 0.6588, "mean_token_accuracy": 0.8000541962683201, "num_tokens": 402084195.0, "step": 12598 }, { "entropy": 0.6060051023960114, "epoch": 1.1591710225933145, "grad_norm": 0.1557805836200714, "learning_rate": 6.136412426779526e-05, "loss": 0.5951, "mean_token_accuracy": 0.8197619356215, "num_tokens": 402116535.0, "step": 12599 }, { "entropy": 0.5846638893708587, "epoch": 1.1592630289647559, "grad_norm": 0.1565539836883545, "learning_rate": 6.136105744165363e-05, "loss": 0.5621, "mean_token_accuracy": 0.8268745020031929, "num_tokens": 402148115.0, "step": 12600 }, { "entropy": 0.6131699224933982, "epoch": 1.159355035336197, "grad_norm": 0.1559438407421112, "learning_rate": 6.135799061551201e-05, "loss": 0.6093, "mean_token_accuracy": 0.8155316822230816, "num_tokens": 402179324.0, "step": 12601 }, { "entropy": 0.6681925021111965, "epoch": 1.1594470417076383, "grad_norm": 0.15712720155715942, "learning_rate": 6.13549237893704e-05, "loss": 0.6565, "mean_token_accuracy": 0.8017873652279377, "num_tokens": 402211515.0, "step": 12602 }, { "entropy": 0.6545578520745039, "epoch": 1.1595390480790795, "grad_norm": 0.15620771050453186, "learning_rate": 6.135185696322876e-05, "loss": 0.6375, "mean_token_accuracy": 0.8064906410872936, "num_tokens": 402243336.0, "step": 12603 }, { "entropy": 0.5536239501088858, "epoch": 1.1596310544505206, "grad_norm": 0.17193558812141418, "learning_rate": 6.134879013708713e-05, "loss": 0.5493, "mean_token_accuracy": 0.8306376077234745, "num_tokens": 402275702.0, "step": 12604 }, { "entropy": 0.6858114115893841, "epoch": 1.159723060821962, "grad_norm": 0.16404224932193756, "learning_rate": 6.13457233109455e-05, "loss": 0.6805, "mean_token_accuracy": 0.7914594635367393, "num_tokens": 402307741.0, "step": 12605 }, { "entropy": 0.6188222859054804, "epoch": 1.159815067193403, "grad_norm": 0.16406695544719696, "learning_rate": 6.134265648480388e-05, "loss": 0.611, "mean_token_accuracy": 0.8166882582008839, "num_tokens": 402340355.0, "step": 12606 }, { "entropy": 0.6386982412077487, "epoch": 1.1599070735648445, "grad_norm": 0.15928398072719574, "learning_rate": 6.133958965866226e-05, "loss": 0.6166, "mean_token_accuracy": 0.8090976662933826, "num_tokens": 402371685.0, "step": 12607 }, { "entropy": 0.5292554451152682, "epoch": 1.1599990799362856, "grad_norm": 0.1552577167749405, "learning_rate": 6.133652283252063e-05, "loss": 0.5014, "mean_token_accuracy": 0.8441266380250454, "num_tokens": 402403179.0, "step": 12608 }, { "entropy": 0.6152433753013611, "epoch": 1.1600910863077267, "grad_norm": 0.1563802808523178, "learning_rate": 6.1333456006379e-05, "loss": 0.5966, "mean_token_accuracy": 0.8131097182631493, "num_tokens": 402434582.0, "step": 12609 }, { "entropy": 0.6548888105899096, "epoch": 1.160183092679168, "grad_norm": 0.16312217712402344, "learning_rate": 6.133038918023738e-05, "loss": 0.6488, "mean_token_accuracy": 0.8055039681494236, "num_tokens": 402466946.0, "step": 12610 }, { "entropy": 0.5758315958082676, "epoch": 1.1602750990506092, "grad_norm": 0.1509566307067871, "learning_rate": 6.132732235409575e-05, "loss": 0.5581, "mean_token_accuracy": 0.8257107511162758, "num_tokens": 402498846.0, "step": 12611 }, { "entropy": 0.7015667259693146, "epoch": 1.1603671054220506, "grad_norm": 0.17107658088207245, "learning_rate": 6.132425552795413e-05, "loss": 0.6825, "mean_token_accuracy": 0.7925826422870159, "num_tokens": 402530964.0, "step": 12612 }, { "entropy": 0.5461074290797114, "epoch": 1.1604591117934917, "grad_norm": 0.15512371063232422, "learning_rate": 6.13211887018125e-05, "loss": 0.5309, "mean_token_accuracy": 0.8334028795361519, "num_tokens": 402562891.0, "step": 12613 }, { "entropy": 0.7169230543076992, "epoch": 1.1605511181649328, "grad_norm": 0.1634054034948349, "learning_rate": 6.131812187567088e-05, "loss": 0.7007, "mean_token_accuracy": 0.7883635461330414, "num_tokens": 402593000.0, "step": 12614 }, { "entropy": 0.7332150191068649, "epoch": 1.1606431245363742, "grad_norm": 0.16382350027561188, "learning_rate": 6.131505504952924e-05, "loss": 0.7446, "mean_token_accuracy": 0.773632138967514, "num_tokens": 402625768.0, "step": 12615 }, { "entropy": 0.6379959671758115, "epoch": 1.1607351309078153, "grad_norm": 0.16594724357128143, "learning_rate": 6.131198822338761e-05, "loss": 0.6268, "mean_token_accuracy": 0.8069444298744202, "num_tokens": 402658303.0, "step": 12616 }, { "entropy": 0.5497546847909689, "epoch": 1.1608271372792567, "grad_norm": 0.15443538129329681, "learning_rate": 6.1308921397246e-05, "loss": 0.5312, "mean_token_accuracy": 0.8350522369146347, "num_tokens": 402690236.0, "step": 12617 }, { "entropy": 0.6416899021714926, "epoch": 1.1609191436506978, "grad_norm": 0.15975037217140198, "learning_rate": 6.130585457110437e-05, "loss": 0.6233, "mean_token_accuracy": 0.8141794055700302, "num_tokens": 402721743.0, "step": 12618 }, { "entropy": 0.6891572885215282, "epoch": 1.161011150022139, "grad_norm": 0.1577051281929016, "learning_rate": 6.130278774496274e-05, "loss": 0.6733, "mean_token_accuracy": 0.7924104332923889, "num_tokens": 402753098.0, "step": 12619 }, { "entropy": 0.5602606711909175, "epoch": 1.1611031563935803, "grad_norm": 0.1521521955728531, "learning_rate": 6.129972091882111e-05, "loss": 0.542, "mean_token_accuracy": 0.8335167095065117, "num_tokens": 402784800.0, "step": 12620 }, { "entropy": 0.5860346588306129, "epoch": 1.1611951627650214, "grad_norm": 0.16238930821418762, "learning_rate": 6.129665409267948e-05, "loss": 0.5695, "mean_token_accuracy": 0.8219230808317661, "num_tokens": 402816894.0, "step": 12621 }, { "entropy": 0.6699978150427341, "epoch": 1.1612871691364628, "grad_norm": 0.1629120409488678, "learning_rate": 6.129358726653786e-05, "loss": 0.659, "mean_token_accuracy": 0.8031052015721798, "num_tokens": 402849492.0, "step": 12622 }, { "entropy": 0.4735582135617733, "epoch": 1.161379175507904, "grad_norm": 0.15115344524383545, "learning_rate": 6.129052044039624e-05, "loss": 0.4484, "mean_token_accuracy": 0.8598279133439064, "num_tokens": 402881450.0, "step": 12623 }, { "entropy": 0.5911038368940353, "epoch": 1.161471181879345, "grad_norm": 0.16885314881801605, "learning_rate": 6.128745361425461e-05, "loss": 0.5825, "mean_token_accuracy": 0.8189284577965736, "num_tokens": 402913458.0, "step": 12624 }, { "entropy": 0.6674218215048313, "epoch": 1.1615631882507864, "grad_norm": 0.16606995463371277, "learning_rate": 6.128438678811298e-05, "loss": 0.6494, "mean_token_accuracy": 0.800078496336937, "num_tokens": 402945014.0, "step": 12625 }, { "entropy": 0.7274369169026613, "epoch": 1.1616551946222275, "grad_norm": 0.16600994765758514, "learning_rate": 6.128131996197136e-05, "loss": 0.7267, "mean_token_accuracy": 0.777463685721159, "num_tokens": 402976938.0, "step": 12626 }, { "entropy": 0.5529254321008921, "epoch": 1.161747200993669, "grad_norm": 0.16516871750354767, "learning_rate": 6.127825313582973e-05, "loss": 0.5499, "mean_token_accuracy": 0.8283937871456146, "num_tokens": 403009050.0, "step": 12627 }, { "entropy": 0.6669282019138336, "epoch": 1.16183920736511, "grad_norm": 0.16189001500606537, "learning_rate": 6.127518630968811e-05, "loss": 0.6617, "mean_token_accuracy": 0.7996062487363815, "num_tokens": 403041136.0, "step": 12628 }, { "entropy": 0.6757936794310808, "epoch": 1.1619312137365512, "grad_norm": 0.16339272260665894, "learning_rate": 6.127211948354649e-05, "loss": 0.6646, "mean_token_accuracy": 0.797191709280014, "num_tokens": 403072796.0, "step": 12629 }, { "entropy": 0.6777433324605227, "epoch": 1.1620232201079925, "grad_norm": 0.16179117560386658, "learning_rate": 6.126905265740486e-05, "loss": 0.6474, "mean_token_accuracy": 0.7984489351511002, "num_tokens": 403104640.0, "step": 12630 }, { "entropy": 0.6064231302589178, "epoch": 1.1621152264794337, "grad_norm": 0.15480133891105652, "learning_rate": 6.126598583126322e-05, "loss": 0.5992, "mean_token_accuracy": 0.8180192559957504, "num_tokens": 403137269.0, "step": 12631 }, { "entropy": 0.5867715105414391, "epoch": 1.162207232850875, "grad_norm": 0.15712150931358337, "learning_rate": 6.12629190051216e-05, "loss": 0.5703, "mean_token_accuracy": 0.8252596594393253, "num_tokens": 403168339.0, "step": 12632 }, { "entropy": 0.7177749257534742, "epoch": 1.1622992392223161, "grad_norm": 0.15992599725723267, "learning_rate": 6.125985217897999e-05, "loss": 0.6908, "mean_token_accuracy": 0.789518591016531, "num_tokens": 403200460.0, "step": 12633 }, { "entropy": 0.6387641089968383, "epoch": 1.1623912455937573, "grad_norm": 0.160330668091774, "learning_rate": 6.125678535283836e-05, "loss": 0.6289, "mean_token_accuracy": 0.8124796003103256, "num_tokens": 403232364.0, "step": 12634 }, { "entropy": 0.6075585447251797, "epoch": 1.1624832519651986, "grad_norm": 0.15176504850387573, "learning_rate": 6.125371852669672e-05, "loss": 0.6041, "mean_token_accuracy": 0.8130687177181244, "num_tokens": 403264060.0, "step": 12635 }, { "entropy": 0.6591655239462852, "epoch": 1.1625752583366398, "grad_norm": 0.16431885957717896, "learning_rate": 6.125065170055509e-05, "loss": 0.6712, "mean_token_accuracy": 0.7990915812551975, "num_tokens": 403296491.0, "step": 12636 }, { "entropy": 0.6523353457450867, "epoch": 1.1626672647080811, "grad_norm": 0.16331468522548676, "learning_rate": 6.124758487441347e-05, "loss": 0.6632, "mean_token_accuracy": 0.7947211638092995, "num_tokens": 403328050.0, "step": 12637 }, { "entropy": 0.5675372797995806, "epoch": 1.1627592710795223, "grad_norm": 0.15957719087600708, "learning_rate": 6.124451804827185e-05, "loss": 0.5703, "mean_token_accuracy": 0.8233926855027676, "num_tokens": 403359756.0, "step": 12638 }, { "entropy": 0.5891177952289581, "epoch": 1.1628512774509634, "grad_norm": 0.15044298768043518, "learning_rate": 6.124145122213022e-05, "loss": 0.5805, "mean_token_accuracy": 0.8235832937061787, "num_tokens": 403392524.0, "step": 12639 }, { "entropy": 0.6632768521085382, "epoch": 1.1629432838224047, "grad_norm": 0.1667858213186264, "learning_rate": 6.123838439598859e-05, "loss": 0.6306, "mean_token_accuracy": 0.8088501840829849, "num_tokens": 403424850.0, "step": 12640 }, { "entropy": 0.5708592971786857, "epoch": 1.1630352901938459, "grad_norm": 0.15563218295574188, "learning_rate": 6.123531756984697e-05, "loss": 0.5585, "mean_token_accuracy": 0.8259898163378239, "num_tokens": 403456095.0, "step": 12641 }, { "entropy": 0.659967178478837, "epoch": 1.1631272965652872, "grad_norm": 0.15621967613697052, "learning_rate": 6.123225074370534e-05, "loss": 0.6579, "mean_token_accuracy": 0.8017999306321144, "num_tokens": 403487847.0, "step": 12642 }, { "entropy": 0.5758118350058794, "epoch": 1.1632193029367284, "grad_norm": 0.1479964554309845, "learning_rate": 6.122918391756372e-05, "loss": 0.5559, "mean_token_accuracy": 0.8248954825103283, "num_tokens": 403519744.0, "step": 12643 }, { "entropy": 0.646555919200182, "epoch": 1.1633113093081695, "grad_norm": 0.16675490140914917, "learning_rate": 6.122611709142209e-05, "loss": 0.6225, "mean_token_accuracy": 0.8092065416276455, "num_tokens": 403551566.0, "step": 12644 }, { "entropy": 0.549762412905693, "epoch": 1.1634033156796109, "grad_norm": 0.1533418595790863, "learning_rate": 6.122305026528047e-05, "loss": 0.5442, "mean_token_accuracy": 0.8345587626099586, "num_tokens": 403583329.0, "step": 12645 }, { "entropy": 0.5639318842440844, "epoch": 1.163495322051052, "grad_norm": 0.15899145603179932, "learning_rate": 6.121998343913884e-05, "loss": 0.5533, "mean_token_accuracy": 0.8298796378076077, "num_tokens": 403615993.0, "step": 12646 }, { "entropy": 0.7105090525001287, "epoch": 1.1635873284224933, "grad_norm": 0.16259311139583588, "learning_rate": 6.12169166129972e-05, "loss": 0.7069, "mean_token_accuracy": 0.7882751785218716, "num_tokens": 403646971.0, "step": 12647 }, { "entropy": 0.641019074479118, "epoch": 1.1636793347939345, "grad_norm": 0.16683407127857208, "learning_rate": 6.121384978685559e-05, "loss": 0.6319, "mean_token_accuracy": 0.8091555088758469, "num_tokens": 403679157.0, "step": 12648 }, { "entropy": 0.7378407251089811, "epoch": 1.1637713411653756, "grad_norm": 0.1687498837709427, "learning_rate": 6.121078296071397e-05, "loss": 0.7314, "mean_token_accuracy": 0.7814208902418613, "num_tokens": 403711600.0, "step": 12649 }, { "entropy": 0.6564894486218691, "epoch": 1.163863347536817, "grad_norm": 0.1586129069328308, "learning_rate": 6.120771613457234e-05, "loss": 0.6424, "mean_token_accuracy": 0.8047425858676434, "num_tokens": 403744219.0, "step": 12650 }, { "entropy": 0.6221248954534531, "epoch": 1.163955353908258, "grad_norm": 0.17044657468795776, "learning_rate": 6.12046493084307e-05, "loss": 0.6189, "mean_token_accuracy": 0.8106247559189796, "num_tokens": 403776316.0, "step": 12651 }, { "entropy": 0.6802108474075794, "epoch": 1.1640473602796995, "grad_norm": 0.1665278822183609, "learning_rate": 6.120158248228907e-05, "loss": 0.6866, "mean_token_accuracy": 0.7926533594727516, "num_tokens": 403808540.0, "step": 12652 }, { "entropy": 0.560454600956291, "epoch": 1.1641393666511406, "grad_norm": 0.16332679986953735, "learning_rate": 6.119851565614745e-05, "loss": 0.548, "mean_token_accuracy": 0.8286487273871899, "num_tokens": 403840168.0, "step": 12653 }, { "entropy": 0.5741901365108788, "epoch": 1.1642313730225817, "grad_norm": 0.1515815407037735, "learning_rate": 6.119544883000583e-05, "loss": 0.5571, "mean_token_accuracy": 0.826216708868742, "num_tokens": 403872743.0, "step": 12654 }, { "entropy": 0.6217704375740141, "epoch": 1.164323379394023, "grad_norm": 0.15673713386058807, "learning_rate": 6.11923820038642e-05, "loss": 0.625, "mean_token_accuracy": 0.8122352473437786, "num_tokens": 403904745.0, "step": 12655 }, { "entropy": 0.6009446289390326, "epoch": 1.1644153857654642, "grad_norm": 0.14699195325374603, "learning_rate": 6.118931517772257e-05, "loss": 0.5972, "mean_token_accuracy": 0.8161117769777775, "num_tokens": 403937385.0, "step": 12656 }, { "entropy": 0.6320998501032591, "epoch": 1.1645073921369056, "grad_norm": 0.15535758435726166, "learning_rate": 6.118624835158095e-05, "loss": 0.6165, "mean_token_accuracy": 0.8123835250735283, "num_tokens": 403969840.0, "step": 12657 }, { "entropy": 0.6674230434000492, "epoch": 1.1645993985083467, "grad_norm": 0.15902099013328552, "learning_rate": 6.118318152543932e-05, "loss": 0.6517, "mean_token_accuracy": 0.8011654429137707, "num_tokens": 404001721.0, "step": 12658 }, { "entropy": 0.6135320942848921, "epoch": 1.1646914048797878, "grad_norm": 0.1540921926498413, "learning_rate": 6.11801146992977e-05, "loss": 0.5965, "mean_token_accuracy": 0.819852102547884, "num_tokens": 404033447.0, "step": 12659 }, { "entropy": 0.5212987754493952, "epoch": 1.1647834112512292, "grad_norm": 0.15379109978675842, "learning_rate": 6.117704787315608e-05, "loss": 0.4946, "mean_token_accuracy": 0.8456364646553993, "num_tokens": 404065821.0, "step": 12660 }, { "entropy": 0.6714410148561001, "epoch": 1.1648754176226703, "grad_norm": 0.15691517293453217, "learning_rate": 6.117398104701445e-05, "loss": 0.6509, "mean_token_accuracy": 0.798434428870678, "num_tokens": 404097740.0, "step": 12661 }, { "entropy": 0.6144701475277543, "epoch": 1.1649674239941117, "grad_norm": 0.1618310511112213, "learning_rate": 6.117091422087282e-05, "loss": 0.6119, "mean_token_accuracy": 0.813060887157917, "num_tokens": 404130240.0, "step": 12662 }, { "entropy": 0.608712911605835, "epoch": 1.1650594303655528, "grad_norm": 0.16153372824192047, "learning_rate": 6.116784739473119e-05, "loss": 0.6079, "mean_token_accuracy": 0.8141636066138744, "num_tokens": 404162060.0, "step": 12663 }, { "entropy": 0.5777365323156118, "epoch": 1.165151436736994, "grad_norm": 0.1538206934928894, "learning_rate": 6.116478056858958e-05, "loss": 0.5659, "mean_token_accuracy": 0.82506338134408, "num_tokens": 404193959.0, "step": 12664 }, { "entropy": 0.6580703388899565, "epoch": 1.1652434431084353, "grad_norm": 0.16361920535564423, "learning_rate": 6.116171374244795e-05, "loss": 0.6473, "mean_token_accuracy": 0.8052406348288059, "num_tokens": 404225707.0, "step": 12665 }, { "entropy": 0.7011438459157944, "epoch": 1.1653354494798764, "grad_norm": 0.15812768042087555, "learning_rate": 6.115864691630632e-05, "loss": 0.6831, "mean_token_accuracy": 0.7925545200705528, "num_tokens": 404257593.0, "step": 12666 }, { "entropy": 0.6018199357204139, "epoch": 1.1654274558513178, "grad_norm": 0.15394315123558044, "learning_rate": 6.115558009016469e-05, "loss": 0.5992, "mean_token_accuracy": 0.818795770406723, "num_tokens": 404289610.0, "step": 12667 }, { "entropy": 0.6380753749981523, "epoch": 1.165519462222759, "grad_norm": 0.15824416279792786, "learning_rate": 6.115251326402307e-05, "loss": 0.6218, "mean_token_accuracy": 0.8073582835495472, "num_tokens": 404322076.0, "step": 12668 }, { "entropy": 0.6977597274817526, "epoch": 1.1656114685942, "grad_norm": 0.16361482441425323, "learning_rate": 6.114944643788145e-05, "loss": 0.6925, "mean_token_accuracy": 0.7896884307265282, "num_tokens": 404354199.0, "step": 12669 }, { "entropy": 0.5628902763128281, "epoch": 1.1657034749656414, "grad_norm": 0.1568567305803299, "learning_rate": 6.114637961173982e-05, "loss": 0.5496, "mean_token_accuracy": 0.829556155949831, "num_tokens": 404386014.0, "step": 12670 }, { "entropy": 0.6752585154026747, "epoch": 1.1657954813370826, "grad_norm": 0.16327977180480957, "learning_rate": 6.114331278559818e-05, "loss": 0.664, "mean_token_accuracy": 0.7973078265786171, "num_tokens": 404418174.0, "step": 12671 }, { "entropy": 0.4471165919676423, "epoch": 1.165887487708524, "grad_norm": 0.14580433070659637, "learning_rate": 6.114024595945657e-05, "loss": 0.4156, "mean_token_accuracy": 0.8724851086735725, "num_tokens": 404450339.0, "step": 12672 }, { "entropy": 0.6734555047005415, "epoch": 1.165979494079965, "grad_norm": 0.16563880443572998, "learning_rate": 6.113717913331493e-05, "loss": 0.6591, "mean_token_accuracy": 0.7983401603996754, "num_tokens": 404483073.0, "step": 12673 }, { "entropy": 0.5652454383671284, "epoch": 1.1660715004514062, "grad_norm": 0.1579791158437729, "learning_rate": 6.113411230717331e-05, "loss": 0.5591, "mean_token_accuracy": 0.8271444290876389, "num_tokens": 404514749.0, "step": 12674 }, { "entropy": 0.5862823133356869, "epoch": 1.1661635068228475, "grad_norm": 0.15216027200222015, "learning_rate": 6.113104548103168e-05, "loss": 0.5729, "mean_token_accuracy": 0.8219812475144863, "num_tokens": 404547323.0, "step": 12675 }, { "entropy": 0.6413582796230912, "epoch": 1.1662555131942887, "grad_norm": 0.1496254950761795, "learning_rate": 6.112797865489006e-05, "loss": 0.6281, "mean_token_accuracy": 0.8068566396832466, "num_tokens": 404579120.0, "step": 12676 }, { "entropy": 0.592612381093204, "epoch": 1.16634751956573, "grad_norm": 0.15614409744739532, "learning_rate": 6.112491182874843e-05, "loss": 0.5742, "mean_token_accuracy": 0.8259659297764301, "num_tokens": 404611334.0, "step": 12677 }, { "entropy": 0.5636953180655837, "epoch": 1.1664395259371712, "grad_norm": 0.1621299833059311, "learning_rate": 6.11218450026068e-05, "loss": 0.5448, "mean_token_accuracy": 0.8317964673042297, "num_tokens": 404642704.0, "step": 12678 }, { "entropy": 0.5607934216968715, "epoch": 1.1665315323086123, "grad_norm": 0.1600496619939804, "learning_rate": 6.111877817646518e-05, "loss": 0.5477, "mean_token_accuracy": 0.8355367295444012, "num_tokens": 404675204.0, "step": 12679 }, { "entropy": 0.6474362146109343, "epoch": 1.1666235386800536, "grad_norm": 0.16199065744876862, "learning_rate": 6.111571135032356e-05, "loss": 0.6474, "mean_token_accuracy": 0.8057184889912605, "num_tokens": 404707417.0, "step": 12680 }, { "entropy": 0.7304923003539443, "epoch": 1.1667155450514948, "grad_norm": 0.16311100125312805, "learning_rate": 6.111264452418193e-05, "loss": 0.7275, "mean_token_accuracy": 0.7831490971148014, "num_tokens": 404739108.0, "step": 12681 }, { "entropy": 0.6142390742897987, "epoch": 1.1668075514229361, "grad_norm": 0.15486204624176025, "learning_rate": 6.11095776980403e-05, "loss": 0.5906, "mean_token_accuracy": 0.8203126154839993, "num_tokens": 404771017.0, "step": 12682 }, { "entropy": 0.6322346180677414, "epoch": 1.1668995577943773, "grad_norm": 0.15507927536964417, "learning_rate": 6.110651087189867e-05, "loss": 0.611, "mean_token_accuracy": 0.8168717697262764, "num_tokens": 404803208.0, "step": 12683 }, { "entropy": 0.601616065017879, "epoch": 1.1669915641658184, "grad_norm": 0.15389446914196014, "learning_rate": 6.110344404575705e-05, "loss": 0.5963, "mean_token_accuracy": 0.8153219632804394, "num_tokens": 404834844.0, "step": 12684 }, { "entropy": 0.5695150550454855, "epoch": 1.1670835705372598, "grad_norm": 0.15109197795391083, "learning_rate": 6.110037721961543e-05, "loss": 0.5579, "mean_token_accuracy": 0.8298392854630947, "num_tokens": 404866628.0, "step": 12685 }, { "entropy": 0.6998587939888239, "epoch": 1.1671755769087009, "grad_norm": 0.1677805632352829, "learning_rate": 6.10973103934738e-05, "loss": 0.6711, "mean_token_accuracy": 0.7927443347871304, "num_tokens": 404898827.0, "step": 12686 }, { "entropy": 0.5125611866824329, "epoch": 1.1672675832801422, "grad_norm": 0.14718079566955566, "learning_rate": 6.109424356733216e-05, "loss": 0.4997, "mean_token_accuracy": 0.847861610352993, "num_tokens": 404930339.0, "step": 12687 }, { "entropy": 0.5793621968477964, "epoch": 1.1673595896515834, "grad_norm": 0.14715348184108734, "learning_rate": 6.109117674119055e-05, "loss": 0.5481, "mean_token_accuracy": 0.8329680562019348, "num_tokens": 404962415.0, "step": 12688 }, { "entropy": 0.6750026112422347, "epoch": 1.1674515960230245, "grad_norm": 0.15986061096191406, "learning_rate": 6.108810991504891e-05, "loss": 0.669, "mean_token_accuracy": 0.7972557470202446, "num_tokens": 404994946.0, "step": 12689 }, { "entropy": 0.6691183932125568, "epoch": 1.1675436023944659, "grad_norm": 0.16457925736904144, "learning_rate": 6.10850430889073e-05, "loss": 0.653, "mean_token_accuracy": 0.7992641925811768, "num_tokens": 405025948.0, "step": 12690 }, { "entropy": 0.69153908547014, "epoch": 1.167635608765907, "grad_norm": 0.1672302931547165, "learning_rate": 6.108197626276568e-05, "loss": 0.6848, "mean_token_accuracy": 0.7918420918285847, "num_tokens": 405058687.0, "step": 12691 }, { "entropy": 0.6538674384355545, "epoch": 1.1677276151373484, "grad_norm": 0.16448603570461273, "learning_rate": 6.107890943662404e-05, "loss": 0.6372, "mean_token_accuracy": 0.8070193119347095, "num_tokens": 405090307.0, "step": 12692 }, { "entropy": 0.6837374959141016, "epoch": 1.1678196215087895, "grad_norm": 0.16034099459648132, "learning_rate": 6.107584261048241e-05, "loss": 0.6805, "mean_token_accuracy": 0.7939751408994198, "num_tokens": 405122414.0, "step": 12693 }, { "entropy": 0.6063252398744226, "epoch": 1.1679116278802306, "grad_norm": 0.15882453322410583, "learning_rate": 6.107277578434078e-05, "loss": 0.6038, "mean_token_accuracy": 0.8174955956637859, "num_tokens": 405154786.0, "step": 12694 }, { "entropy": 0.5916091427206993, "epoch": 1.168003634251672, "grad_norm": 0.15548671782016754, "learning_rate": 6.106970895819916e-05, "loss": 0.5794, "mean_token_accuracy": 0.8216841705143452, "num_tokens": 405186926.0, "step": 12695 }, { "entropy": 0.5510899936780334, "epoch": 1.168095640623113, "grad_norm": 0.16780242323875427, "learning_rate": 6.106664213205754e-05, "loss": 0.5244, "mean_token_accuracy": 0.8385966010391712, "num_tokens": 405219035.0, "step": 12696 }, { "entropy": 0.6381193613633513, "epoch": 1.1681876469945545, "grad_norm": 0.15909194946289062, "learning_rate": 6.106357530591591e-05, "loss": 0.626, "mean_token_accuracy": 0.8069191500544548, "num_tokens": 405251016.0, "step": 12697 }, { "entropy": 0.577943948097527, "epoch": 1.1682796533659956, "grad_norm": 0.16247142851352692, "learning_rate": 6.106050847977428e-05, "loss": 0.5656, "mean_token_accuracy": 0.8297855630517006, "num_tokens": 405283421.0, "step": 12698 }, { "entropy": 0.6232094801962376, "epoch": 1.1683716597374367, "grad_norm": 0.163001149892807, "learning_rate": 6.105744165363266e-05, "loss": 0.6227, "mean_token_accuracy": 0.8108972422778606, "num_tokens": 405315818.0, "step": 12699 }, { "entropy": 0.5645198412239552, "epoch": 1.168463666108878, "grad_norm": 0.15448720753192902, "learning_rate": 6.105437482749103e-05, "loss": 0.5501, "mean_token_accuracy": 0.8275416195392609, "num_tokens": 405347715.0, "step": 12700 }, { "entropy": 0.7325584646314383, "epoch": 1.1685556724803192, "grad_norm": 0.1644921749830246, "learning_rate": 6.105130800134941e-05, "loss": 0.7175, "mean_token_accuracy": 0.7844203747808933, "num_tokens": 405380012.0, "step": 12701 }, { "entropy": 0.5394227816723287, "epoch": 1.1686476788517606, "grad_norm": 0.15931645035743713, "learning_rate": 6.104824117520778e-05, "loss": 0.5283, "mean_token_accuracy": 0.8359356969594955, "num_tokens": 405411795.0, "step": 12702 }, { "entropy": 0.5291157746687531, "epoch": 1.1687396852232017, "grad_norm": 0.15077249705791473, "learning_rate": 6.104517434906616e-05, "loss": 0.518, "mean_token_accuracy": 0.8352096937596798, "num_tokens": 405443260.0, "step": 12703 }, { "entropy": 0.5970950108021498, "epoch": 1.1688316915946428, "grad_norm": 0.15855784714221954, "learning_rate": 6.104210752292453e-05, "loss": 0.5745, "mean_token_accuracy": 0.8241670988500118, "num_tokens": 405475148.0, "step": 12704 }, { "entropy": 0.5294525912031531, "epoch": 1.1689236979660842, "grad_norm": 0.14721767604351044, "learning_rate": 6.10390406967829e-05, "loss": 0.5253, "mean_token_accuracy": 0.8384719714522362, "num_tokens": 405507243.0, "step": 12705 }, { "entropy": 0.7737531643360853, "epoch": 1.1690157043375253, "grad_norm": 0.1737314760684967, "learning_rate": 6.103597387064128e-05, "loss": 0.7732, "mean_token_accuracy": 0.7665000967681408, "num_tokens": 405539581.0, "step": 12706 }, { "entropy": 0.6552637871354818, "epoch": 1.1691077107089667, "grad_norm": 0.1599409431219101, "learning_rate": 6.103290704449966e-05, "loss": 0.6549, "mean_token_accuracy": 0.8027216158807278, "num_tokens": 405571167.0, "step": 12707 }, { "entropy": 0.665824631229043, "epoch": 1.1691997170804078, "grad_norm": 0.16301193833351135, "learning_rate": 6.1029840218358025e-05, "loss": 0.6513, "mean_token_accuracy": 0.798660896718502, "num_tokens": 405602802.0, "step": 12708 }, { "entropy": 0.6641330327838659, "epoch": 1.169291723451849, "grad_norm": 0.16691391170024872, "learning_rate": 6.102677339221639e-05, "loss": 0.6341, "mean_token_accuracy": 0.8060023710131645, "num_tokens": 405633892.0, "step": 12709 }, { "entropy": 0.6230142265558243, "epoch": 1.1693837298232903, "grad_norm": 0.1579827070236206, "learning_rate": 6.102370656607477e-05, "loss": 0.5967, "mean_token_accuracy": 0.8148881606757641, "num_tokens": 405665082.0, "step": 12710 }, { "entropy": 0.5628484822809696, "epoch": 1.1694757361947314, "grad_norm": 0.15280374884605408, "learning_rate": 6.102063973993315e-05, "loss": 0.5527, "mean_token_accuracy": 0.8325560763478279, "num_tokens": 405697675.0, "step": 12711 }, { "entropy": 0.6220531985163689, "epoch": 1.1695677425661728, "grad_norm": 0.15543076395988464, "learning_rate": 6.1017572913791524e-05, "loss": 0.6018, "mean_token_accuracy": 0.8119761720299721, "num_tokens": 405729707.0, "step": 12712 }, { "entropy": 0.6699754875153303, "epoch": 1.169659748937614, "grad_norm": 0.1673119217157364, "learning_rate": 6.101450608764989e-05, "loss": 0.6494, "mean_token_accuracy": 0.8008839264512062, "num_tokens": 405761566.0, "step": 12713 }, { "entropy": 0.49218873074278235, "epoch": 1.169751755309055, "grad_norm": 0.14342951774597168, "learning_rate": 6.1011439261508266e-05, "loss": 0.4804, "mean_token_accuracy": 0.8518491089344025, "num_tokens": 405793737.0, "step": 12714 }, { "entropy": 0.6767038386315107, "epoch": 1.1698437616804964, "grad_norm": 0.1637333780527115, "learning_rate": 6.100837243536665e-05, "loss": 0.6675, "mean_token_accuracy": 0.7993181273341179, "num_tokens": 405826126.0, "step": 12715 }, { "entropy": 0.5841982550919056, "epoch": 1.1699357680519376, "grad_norm": 0.15549936890602112, "learning_rate": 6.1005305609225016e-05, "loss": 0.5759, "mean_token_accuracy": 0.8216799758374691, "num_tokens": 405858233.0, "step": 12716 }, { "entropy": 0.6161065488122404, "epoch": 1.170027774423379, "grad_norm": 0.15177151560783386, "learning_rate": 6.100223878308339e-05, "loss": 0.6179, "mean_token_accuracy": 0.8109329454600811, "num_tokens": 405889928.0, "step": 12717 }, { "entropy": 0.6372742149978876, "epoch": 1.17011978079482, "grad_norm": 0.16659508645534515, "learning_rate": 6.099917195694176e-05, "loss": 0.6327, "mean_token_accuracy": 0.8055512197315693, "num_tokens": 405921831.0, "step": 12718 }, { "entropy": 0.6809663232415915, "epoch": 1.1702117871662612, "grad_norm": 0.15969699621200562, "learning_rate": 6.099610513080014e-05, "loss": 0.6758, "mean_token_accuracy": 0.7934380993247032, "num_tokens": 405953110.0, "step": 12719 }, { "entropy": 0.6315272403880954, "epoch": 1.1703037935377025, "grad_norm": 0.15657590329647064, "learning_rate": 6.0993038304658514e-05, "loss": 0.6255, "mean_token_accuracy": 0.8075342699885368, "num_tokens": 405985258.0, "step": 12720 }, { "entropy": 0.5875232629477978, "epoch": 1.1703957999091437, "grad_norm": 0.15818507969379425, "learning_rate": 6.098997147851688e-05, "loss": 0.5753, "mean_token_accuracy": 0.8245118819177151, "num_tokens": 406017739.0, "step": 12721 }, { "entropy": 0.5230427719652653, "epoch": 1.170487806280585, "grad_norm": 0.15181657671928406, "learning_rate": 6.0986904652375264e-05, "loss": 0.5192, "mean_token_accuracy": 0.8410500250756741, "num_tokens": 406049559.0, "step": 12722 }, { "entropy": 0.6033643372356892, "epoch": 1.1705798126520262, "grad_norm": 0.1589975357055664, "learning_rate": 6.098383782623364e-05, "loss": 0.5912, "mean_token_accuracy": 0.8182668760418892, "num_tokens": 406081360.0, "step": 12723 }, { "entropy": 0.6110208742320538, "epoch": 1.1706718190234673, "grad_norm": 0.15479236841201782, "learning_rate": 6.0980771000092006e-05, "loss": 0.5928, "mean_token_accuracy": 0.8161911591887474, "num_tokens": 406113531.0, "step": 12724 }, { "entropy": 0.49226576648652554, "epoch": 1.1707638253949086, "grad_norm": 0.15131348371505737, "learning_rate": 6.097770417395038e-05, "loss": 0.4863, "mean_token_accuracy": 0.8496181145310402, "num_tokens": 406145237.0, "step": 12725 }, { "entropy": 0.6405715327709913, "epoch": 1.1708558317663498, "grad_norm": 0.15978476405143738, "learning_rate": 6.097463734780876e-05, "loss": 0.6347, "mean_token_accuracy": 0.8054680824279785, "num_tokens": 406177541.0, "step": 12726 }, { "entropy": 0.6383450021967292, "epoch": 1.1709478381377911, "grad_norm": 0.166026771068573, "learning_rate": 6.097157052166713e-05, "loss": 0.628, "mean_token_accuracy": 0.8074133545160294, "num_tokens": 406209056.0, "step": 12727 }, { "entropy": 0.5835109576582909, "epoch": 1.1710398445092323, "grad_norm": 0.15402765572071075, "learning_rate": 6.0968503695525505e-05, "loss": 0.5687, "mean_token_accuracy": 0.8260383307933807, "num_tokens": 406240757.0, "step": 12728 }, { "entropy": 0.579437181353569, "epoch": 1.1711318508806734, "grad_norm": 0.15311574935913086, "learning_rate": 6.096543686938387e-05, "loss": 0.56, "mean_token_accuracy": 0.8240049965679646, "num_tokens": 406272101.0, "step": 12729 }, { "entropy": 0.5860629230737686, "epoch": 1.1712238572521148, "grad_norm": 0.1642579287290573, "learning_rate": 6.0962370043242254e-05, "loss": 0.5817, "mean_token_accuracy": 0.8216734230518341, "num_tokens": 406304163.0, "step": 12730 }, { "entropy": 0.6786310449242592, "epoch": 1.1713158636235559, "grad_norm": 0.16082462668418884, "learning_rate": 6.095930321710063e-05, "loss": 0.6625, "mean_token_accuracy": 0.7992794252932072, "num_tokens": 406336931.0, "step": 12731 }, { "entropy": 0.5668971692211926, "epoch": 1.1714078699949972, "grad_norm": 0.15580295026302338, "learning_rate": 6.0956236390958996e-05, "loss": 0.553, "mean_token_accuracy": 0.832791656255722, "num_tokens": 406369662.0, "step": 12732 }, { "entropy": 0.6670769080519676, "epoch": 1.1714998763664384, "grad_norm": 0.1614105999469757, "learning_rate": 6.095316956481737e-05, "loss": 0.6382, "mean_token_accuracy": 0.8110053464770317, "num_tokens": 406402076.0, "step": 12733 }, { "entropy": 0.679668053984642, "epoch": 1.1715918827378795, "grad_norm": 0.16015096008777618, "learning_rate": 6.095010273867575e-05, "loss": 0.6608, "mean_token_accuracy": 0.7990810461342335, "num_tokens": 406433934.0, "step": 12734 }, { "entropy": 0.6125657539814711, "epoch": 1.1716838891093209, "grad_norm": 0.15865980088710785, "learning_rate": 6.094703591253412e-05, "loss": 0.5911, "mean_token_accuracy": 0.8176275789737701, "num_tokens": 406465888.0, "step": 12735 }, { "entropy": 0.5641652224585414, "epoch": 1.171775895480762, "grad_norm": 0.15833981335163116, "learning_rate": 6.0943969086392495e-05, "loss": 0.561, "mean_token_accuracy": 0.8337734863162041, "num_tokens": 406497513.0, "step": 12736 }, { "entropy": 0.5846628863364458, "epoch": 1.1718679018522034, "grad_norm": 0.1574895679950714, "learning_rate": 6.094090226025086e-05, "loss": 0.5661, "mean_token_accuracy": 0.820073951035738, "num_tokens": 406528617.0, "step": 12737 }, { "entropy": 0.5478672115132213, "epoch": 1.1719599082236445, "grad_norm": 0.14957524836063385, "learning_rate": 6.0937835434109244e-05, "loss": 0.5267, "mean_token_accuracy": 0.8354589864611626, "num_tokens": 406560428.0, "step": 12738 }, { "entropy": 0.6382253263145685, "epoch": 1.1720519145950856, "grad_norm": 0.16551603376865387, "learning_rate": 6.093476860796762e-05, "loss": 0.6368, "mean_token_accuracy": 0.8070534393191338, "num_tokens": 406593062.0, "step": 12739 }, { "entropy": 0.6000440642237663, "epoch": 1.172143920966527, "grad_norm": 0.15175332129001617, "learning_rate": 6.093170178182599e-05, "loss": 0.5949, "mean_token_accuracy": 0.8158478401601315, "num_tokens": 406624832.0, "step": 12740 }, { "entropy": 0.6065329629927874, "epoch": 1.172235927337968, "grad_norm": 0.165225088596344, "learning_rate": 6.092863495568436e-05, "loss": 0.5966, "mean_token_accuracy": 0.8116251826286316, "num_tokens": 406656785.0, "step": 12741 }, { "entropy": 0.6450487766414881, "epoch": 1.1723279337094095, "grad_norm": 0.16548706591129303, "learning_rate": 6.092556812954274e-05, "loss": 0.6158, "mean_token_accuracy": 0.8075078092515469, "num_tokens": 406688574.0, "step": 12742 }, { "entropy": 0.6206421134993434, "epoch": 1.1724199400808506, "grad_norm": 0.1592569500207901, "learning_rate": 6.092250130340111e-05, "loss": 0.6124, "mean_token_accuracy": 0.8134020455181599, "num_tokens": 406720528.0, "step": 12743 }, { "entropy": 0.5082128681242466, "epoch": 1.1725119464522917, "grad_norm": 0.1503574401140213, "learning_rate": 6.0919434477259485e-05, "loss": 0.4932, "mean_token_accuracy": 0.8447812087833881, "num_tokens": 406752599.0, "step": 12744 }, { "entropy": 0.7528585232794285, "epoch": 1.172603952823733, "grad_norm": 0.16674205660820007, "learning_rate": 6.091636765111785e-05, "loss": 0.7379, "mean_token_accuracy": 0.7771284990012646, "num_tokens": 406784681.0, "step": 12745 }, { "entropy": 0.6262429784983397, "epoch": 1.1726959591951742, "grad_norm": 0.15923461318016052, "learning_rate": 6.091330082497624e-05, "loss": 0.6251, "mean_token_accuracy": 0.8109865337610245, "num_tokens": 406816422.0, "step": 12746 }, { "entropy": 0.6536807790398598, "epoch": 1.1727879655666156, "grad_norm": 0.15723265707492828, "learning_rate": 6.091023399883461e-05, "loss": 0.6286, "mean_token_accuracy": 0.8063134253025055, "num_tokens": 406848408.0, "step": 12747 }, { "entropy": 0.6540792919695377, "epoch": 1.1728799719380567, "grad_norm": 0.15710540115833282, "learning_rate": 6.090716717269298e-05, "loss": 0.6304, "mean_token_accuracy": 0.8074497878551483, "num_tokens": 406880507.0, "step": 12748 }, { "entropy": 0.6005316935479641, "epoch": 1.1729719783094978, "grad_norm": 0.16284377872943878, "learning_rate": 6.090410034655135e-05, "loss": 0.5899, "mean_token_accuracy": 0.8189321793615818, "num_tokens": 406912288.0, "step": 12749 }, { "entropy": 0.6312586665153503, "epoch": 1.1730639846809392, "grad_norm": 0.15743710100650787, "learning_rate": 6.090103352040973e-05, "loss": 0.6247, "mean_token_accuracy": 0.8107891827821732, "num_tokens": 406944617.0, "step": 12750 }, { "entropy": 0.6123976269736886, "epoch": 1.1731559910523803, "grad_norm": 0.1626615673303604, "learning_rate": 6.089796669426811e-05, "loss": 0.6047, "mean_token_accuracy": 0.815016470849514, "num_tokens": 406976434.0, "step": 12751 }, { "entropy": 0.6256641624495387, "epoch": 1.1732479974238217, "grad_norm": 0.15701745450496674, "learning_rate": 6.0894899868126476e-05, "loss": 0.6056, "mean_token_accuracy": 0.8141790814697742, "num_tokens": 407008630.0, "step": 12752 }, { "entropy": 0.541200352832675, "epoch": 1.1733400037952628, "grad_norm": 0.14727966487407684, "learning_rate": 6.089183304198486e-05, "loss": 0.538, "mean_token_accuracy": 0.8364496938884258, "num_tokens": 407040857.0, "step": 12753 }, { "entropy": 0.7370462836697698, "epoch": 1.173432010166704, "grad_norm": 0.17198871076107025, "learning_rate": 6.088876621584323e-05, "loss": 0.747, "mean_token_accuracy": 0.7782877162098885, "num_tokens": 407071911.0, "step": 12754 }, { "entropy": 0.5717560742050409, "epoch": 1.1735240165381453, "grad_norm": 0.15651968121528625, "learning_rate": 6.08856993897016e-05, "loss": 0.5466, "mean_token_accuracy": 0.8280287571251392, "num_tokens": 407103481.0, "step": 12755 }, { "entropy": 0.5864193048328161, "epoch": 1.1736160229095864, "grad_norm": 0.15488377213478088, "learning_rate": 6.0882632563559974e-05, "loss": 0.5782, "mean_token_accuracy": 0.81834477186203, "num_tokens": 407135099.0, "step": 12756 }, { "entropy": 0.5608217688277364, "epoch": 1.1737080292810278, "grad_norm": 0.15422746539115906, "learning_rate": 6.0879565737418356e-05, "loss": 0.5269, "mean_token_accuracy": 0.8386127538979053, "num_tokens": 407167397.0, "step": 12757 }, { "entropy": 0.6659384202212095, "epoch": 1.173800035652469, "grad_norm": 0.17444126307964325, "learning_rate": 6.0876498911276724e-05, "loss": 0.6622, "mean_token_accuracy": 0.7979831509292126, "num_tokens": 407198594.0, "step": 12758 }, { "entropy": 0.6683011446148157, "epoch": 1.17389204202391, "grad_norm": 0.1631225198507309, "learning_rate": 6.08734320851351e-05, "loss": 0.6597, "mean_token_accuracy": 0.7949567437171936, "num_tokens": 407229630.0, "step": 12759 }, { "entropy": 0.5211081746965647, "epoch": 1.1739840483953514, "grad_norm": 0.15671630203723907, "learning_rate": 6.0870365258993466e-05, "loss": 0.5023, "mean_token_accuracy": 0.8415449261665344, "num_tokens": 407261655.0, "step": 12760 }, { "entropy": 0.746961148455739, "epoch": 1.1740760547667926, "grad_norm": 0.16738229990005493, "learning_rate": 6.086729843285185e-05, "loss": 0.7464, "mean_token_accuracy": 0.77591847255826, "num_tokens": 407293024.0, "step": 12761 }, { "entropy": 0.5106835281476378, "epoch": 1.174168061138234, "grad_norm": 0.1558929830789566, "learning_rate": 6.086423160671022e-05, "loss": 0.4979, "mean_token_accuracy": 0.847391851246357, "num_tokens": 407325325.0, "step": 12762 }, { "entropy": 0.5200215689837933, "epoch": 1.174260067509675, "grad_norm": 0.16874666512012482, "learning_rate": 6.086116478056859e-05, "loss": 0.5082, "mean_token_accuracy": 0.8433544561266899, "num_tokens": 407357822.0, "step": 12763 }, { "entropy": 0.6859582932665944, "epoch": 1.1743520738811162, "grad_norm": 0.16303814947605133, "learning_rate": 6.0858097954426965e-05, "loss": 0.6778, "mean_token_accuracy": 0.7951883934438229, "num_tokens": 407389774.0, "step": 12764 }, { "entropy": 0.7917574141174555, "epoch": 1.1744440802525575, "grad_norm": 0.17307135462760925, "learning_rate": 6.0855031128285346e-05, "loss": 0.7946, "mean_token_accuracy": 0.7602671384811401, "num_tokens": 407421997.0, "step": 12765 }, { "entropy": 0.6167860440909863, "epoch": 1.1745360866239987, "grad_norm": 0.1579926460981369, "learning_rate": 6.0851964302143714e-05, "loss": 0.6094, "mean_token_accuracy": 0.8138345591723919, "num_tokens": 407453959.0, "step": 12766 }, { "entropy": 0.6673713196069002, "epoch": 1.17462809299544, "grad_norm": 0.15836398303508759, "learning_rate": 6.084889747600209e-05, "loss": 0.6512, "mean_token_accuracy": 0.7983118519186974, "num_tokens": 407486515.0, "step": 12767 }, { "entropy": 0.5780379790812731, "epoch": 1.1747200993668812, "grad_norm": 0.1591811180114746, "learning_rate": 6.084583064986046e-05, "loss": 0.5746, "mean_token_accuracy": 0.8228588849306107, "num_tokens": 407517789.0, "step": 12768 }, { "entropy": 0.6533560464158654, "epoch": 1.1748121057383223, "grad_norm": 0.1558014154434204, "learning_rate": 6.084276382371884e-05, "loss": 0.6386, "mean_token_accuracy": 0.80068514123559, "num_tokens": 407549182.0, "step": 12769 }, { "entropy": 0.5427117787767202, "epoch": 1.1749041121097636, "grad_norm": 0.14908117055892944, "learning_rate": 6.083969699757721e-05, "loss": 0.521, "mean_token_accuracy": 0.8413454480469227, "num_tokens": 407580883.0, "step": 12770 }, { "entropy": 0.6261754110455513, "epoch": 1.1749961184812048, "grad_norm": 0.15955790877342224, "learning_rate": 6.083663017143558e-05, "loss": 0.6152, "mean_token_accuracy": 0.8095375150442123, "num_tokens": 407612996.0, "step": 12771 }, { "entropy": 0.6684248084202409, "epoch": 1.1750881248526461, "grad_norm": 0.1621030569076538, "learning_rate": 6.0833563345293955e-05, "loss": 0.6484, "mean_token_accuracy": 0.7985404320061207, "num_tokens": 407644111.0, "step": 12772 }, { "entropy": 0.569434130564332, "epoch": 1.1751801312240873, "grad_norm": 0.15266858041286469, "learning_rate": 6.083049651915234e-05, "loss": 0.5556, "mean_token_accuracy": 0.8286662511527538, "num_tokens": 407676260.0, "step": 12773 }, { "entropy": 0.5449368534609675, "epoch": 1.1752721375955284, "grad_norm": 0.14624515175819397, "learning_rate": 6.0827429693010705e-05, "loss": 0.5277, "mean_token_accuracy": 0.8365836888551712, "num_tokens": 407708697.0, "step": 12774 }, { "entropy": 0.6322678960859776, "epoch": 1.1753641439669698, "grad_norm": 0.15531550347805023, "learning_rate": 6.082436286686908e-05, "loss": 0.6111, "mean_token_accuracy": 0.8170810453593731, "num_tokens": 407741058.0, "step": 12775 }, { "entropy": 0.700784420594573, "epoch": 1.1754561503384109, "grad_norm": 0.16285955905914307, "learning_rate": 6.082129604072745e-05, "loss": 0.6938, "mean_token_accuracy": 0.7916183769702911, "num_tokens": 407772970.0, "step": 12776 }, { "entropy": 0.6470303107053041, "epoch": 1.1755481567098522, "grad_norm": 0.15695512294769287, "learning_rate": 6.081822921458583e-05, "loss": 0.6242, "mean_token_accuracy": 0.8102377317845821, "num_tokens": 407804803.0, "step": 12777 }, { "entropy": 0.5581740560010076, "epoch": 1.1756401630812934, "grad_norm": 0.15515203773975372, "learning_rate": 6.08151623884442e-05, "loss": 0.5446, "mean_token_accuracy": 0.8319455981254578, "num_tokens": 407836273.0, "step": 12778 }, { "entropy": 0.62677101790905, "epoch": 1.1757321694527345, "grad_norm": 0.15673108398914337, "learning_rate": 6.081209556230257e-05, "loss": 0.6023, "mean_token_accuracy": 0.8144170716404915, "num_tokens": 407867990.0, "step": 12779 }, { "entropy": 0.6344245970249176, "epoch": 1.1758241758241759, "grad_norm": 0.16233284771442413, "learning_rate": 6.0809028736160946e-05, "loss": 0.6249, "mean_token_accuracy": 0.8097932524979115, "num_tokens": 407899190.0, "step": 12780 }, { "entropy": 0.6026475699618459, "epoch": 1.175916182195617, "grad_norm": 0.1590389907360077, "learning_rate": 6.080596191001933e-05, "loss": 0.5813, "mean_token_accuracy": 0.8210140652954578, "num_tokens": 407931440.0, "step": 12781 }, { "entropy": 0.559157052077353, "epoch": 1.1760081885670584, "grad_norm": 0.16486454010009766, "learning_rate": 6.0802895083877695e-05, "loss": 0.5478, "mean_token_accuracy": 0.8316208980977535, "num_tokens": 407963820.0, "step": 12782 }, { "entropy": 0.5830582622438669, "epoch": 1.1761001949384995, "grad_norm": 0.16232247650623322, "learning_rate": 6.079982825773607e-05, "loss": 0.5722, "mean_token_accuracy": 0.8205007761716843, "num_tokens": 407994513.0, "step": 12783 }, { "entropy": 0.6326200356706977, "epoch": 1.1761922013099406, "grad_norm": 0.15721987187862396, "learning_rate": 6.079676143159445e-05, "loss": 0.6175, "mean_token_accuracy": 0.8051367402076721, "num_tokens": 408026298.0, "step": 12784 }, { "entropy": 0.6334924604743719, "epoch": 1.176284207681382, "grad_norm": 0.15888625383377075, "learning_rate": 6.079369460545282e-05, "loss": 0.6294, "mean_token_accuracy": 0.8097102493047714, "num_tokens": 408058770.0, "step": 12785 }, { "entropy": 0.6473674811422825, "epoch": 1.176376214052823, "grad_norm": 0.16651202738285065, "learning_rate": 6.0790627779311194e-05, "loss": 0.6455, "mean_token_accuracy": 0.8025207854807377, "num_tokens": 408090520.0, "step": 12786 }, { "entropy": 0.7553344294428825, "epoch": 1.1764682204242645, "grad_norm": 0.170662522315979, "learning_rate": 6.078756095316956e-05, "loss": 0.7724, "mean_token_accuracy": 0.7711690701544285, "num_tokens": 408122335.0, "step": 12787 }, { "entropy": 0.6359975654631853, "epoch": 1.1765602267957056, "grad_norm": 0.1631392389535904, "learning_rate": 6.078449412702795e-05, "loss": 0.6031, "mean_token_accuracy": 0.8163022436201572, "num_tokens": 408153677.0, "step": 12788 }, { "entropy": 0.6694142054766417, "epoch": 1.1766522331671467, "grad_norm": 0.16092340648174286, "learning_rate": 6.078142730088632e-05, "loss": 0.6626, "mean_token_accuracy": 0.7988073192536831, "num_tokens": 408184893.0, "step": 12789 }, { "entropy": 0.6702719815075397, "epoch": 1.176744239538588, "grad_norm": 0.16322875022888184, "learning_rate": 6.077836047474469e-05, "loss": 0.6471, "mean_token_accuracy": 0.8003043942153454, "num_tokens": 408216305.0, "step": 12790 }, { "entropy": 0.7211842183023691, "epoch": 1.1768362459100292, "grad_norm": 0.17251920700073242, "learning_rate": 6.077529364860306e-05, "loss": 0.6992, "mean_token_accuracy": 0.7845070362091064, "num_tokens": 408247185.0, "step": 12791 }, { "entropy": 0.5805152431130409, "epoch": 1.1769282522814706, "grad_norm": 0.159579336643219, "learning_rate": 6.077222682246144e-05, "loss": 0.5655, "mean_token_accuracy": 0.8252116292715073, "num_tokens": 408279222.0, "step": 12792 }, { "entropy": 0.7079675663262606, "epoch": 1.1770202586529117, "grad_norm": 0.16709178686141968, "learning_rate": 6.0769159996319816e-05, "loss": 0.7056, "mean_token_accuracy": 0.7900221087038517, "num_tokens": 408311305.0, "step": 12793 }, { "entropy": 0.7560301003977656, "epoch": 1.1771122650243528, "grad_norm": 0.17371408641338348, "learning_rate": 6.0766093170178184e-05, "loss": 0.7465, "mean_token_accuracy": 0.7768257856369019, "num_tokens": 408342265.0, "step": 12794 }, { "entropy": 0.539337164722383, "epoch": 1.1772042713957942, "grad_norm": 0.15573018789291382, "learning_rate": 6.076302634403656e-05, "loss": 0.5236, "mean_token_accuracy": 0.8371158577501774, "num_tokens": 408374784.0, "step": 12795 }, { "entropy": 0.64905821159482, "epoch": 1.1772962777672353, "grad_norm": 0.16486600041389465, "learning_rate": 6.075995951789494e-05, "loss": 0.6599, "mean_token_accuracy": 0.7991401068866253, "num_tokens": 408406808.0, "step": 12796 }, { "entropy": 0.6805592412129045, "epoch": 1.1773882841386767, "grad_norm": 0.16640853881835938, "learning_rate": 6.075689269175331e-05, "loss": 0.6802, "mean_token_accuracy": 0.7973605021834373, "num_tokens": 408438421.0, "step": 12797 }, { "entropy": 0.6323010083287954, "epoch": 1.1774802905101178, "grad_norm": 0.15358193218708038, "learning_rate": 6.075382586561168e-05, "loss": 0.6252, "mean_token_accuracy": 0.8140072375535965, "num_tokens": 408470679.0, "step": 12798 }, { "entropy": 0.6846966538578272, "epoch": 1.177572296881559, "grad_norm": 0.15838094055652618, "learning_rate": 6.075075903947005e-05, "loss": 0.6599, "mean_token_accuracy": 0.8009763434529305, "num_tokens": 408502661.0, "step": 12799 }, { "entropy": 0.6293739769607782, "epoch": 1.1776643032530003, "grad_norm": 0.15254352986812592, "learning_rate": 6.074769221332843e-05, "loss": 0.6231, "mean_token_accuracy": 0.8071268796920776, "num_tokens": 408535104.0, "step": 12800 }, { "entropy": 0.6550117917358875, "epoch": 1.1777563096244414, "grad_norm": 0.15782584249973297, "learning_rate": 6.0744625387186806e-05, "loss": 0.6426, "mean_token_accuracy": 0.8051098883152008, "num_tokens": 408567210.0, "step": 12801 }, { "entropy": 0.6591804204508662, "epoch": 1.1778483159958828, "grad_norm": 0.15834955871105194, "learning_rate": 6.0741558561045174e-05, "loss": 0.6487, "mean_token_accuracy": 0.8050226606428623, "num_tokens": 408599761.0, "step": 12802 }, { "entropy": 0.6123838163912296, "epoch": 1.177940322367324, "grad_norm": 0.15773789584636688, "learning_rate": 6.073849173490355e-05, "loss": 0.587, "mean_token_accuracy": 0.8169838227331638, "num_tokens": 408631734.0, "step": 12803 }, { "entropy": 0.7924594320356846, "epoch": 1.178032328738765, "grad_norm": 0.16763360798358917, "learning_rate": 6.073542490876193e-05, "loss": 0.7741, "mean_token_accuracy": 0.7658708766102791, "num_tokens": 408664365.0, "step": 12804 }, { "entropy": 0.6407094392925501, "epoch": 1.1781243351102064, "grad_norm": 0.1614852100610733, "learning_rate": 6.07323580826203e-05, "loss": 0.6377, "mean_token_accuracy": 0.8016873486340046, "num_tokens": 408696640.0, "step": 12805 }, { "entropy": 0.6743394583463669, "epoch": 1.1782163414816476, "grad_norm": 0.15859590470790863, "learning_rate": 6.072929125647867e-05, "loss": 0.6583, "mean_token_accuracy": 0.7972917072474957, "num_tokens": 408728564.0, "step": 12806 }, { "entropy": 0.5978240319527686, "epoch": 1.178308347853089, "grad_norm": 0.16349764168262482, "learning_rate": 6.072622443033704e-05, "loss": 0.5788, "mean_token_accuracy": 0.8271327540278435, "num_tokens": 408760315.0, "step": 12807 }, { "entropy": 0.6137932622805238, "epoch": 1.17840035422453, "grad_norm": 0.15444286167621613, "learning_rate": 6.072315760419542e-05, "loss": 0.6032, "mean_token_accuracy": 0.8114595152437687, "num_tokens": 408792360.0, "step": 12808 }, { "entropy": 0.5973086170852184, "epoch": 1.1784923605959712, "grad_norm": 0.16439910233020782, "learning_rate": 6.07200907780538e-05, "loss": 0.5815, "mean_token_accuracy": 0.8181856982409954, "num_tokens": 408824498.0, "step": 12809 }, { "entropy": 0.6200208365917206, "epoch": 1.1785843669674125, "grad_norm": 0.1558399796485901, "learning_rate": 6.0717023951912165e-05, "loss": 0.6123, "mean_token_accuracy": 0.8115965574979782, "num_tokens": 408856726.0, "step": 12810 }, { "entropy": 0.6186262127012014, "epoch": 1.1786763733388537, "grad_norm": 0.16148318350315094, "learning_rate": 6.071395712577054e-05, "loss": 0.6148, "mean_token_accuracy": 0.8094556629657745, "num_tokens": 408888046.0, "step": 12811 }, { "entropy": 0.5552530330605805, "epoch": 1.178768379710295, "grad_norm": 0.15198737382888794, "learning_rate": 6.071089029962892e-05, "loss": 0.5502, "mean_token_accuracy": 0.8334855102002621, "num_tokens": 408920566.0, "step": 12812 }, { "entropy": 0.49385589826852083, "epoch": 1.1788603860817362, "grad_norm": 0.15056167542934418, "learning_rate": 6.070782347348729e-05, "loss": 0.4864, "mean_token_accuracy": 0.8463666774332523, "num_tokens": 408952739.0, "step": 12813 }, { "entropy": 0.5825871592387557, "epoch": 1.1789523924531773, "grad_norm": 0.1565801054239273, "learning_rate": 6.070475664734566e-05, "loss": 0.5766, "mean_token_accuracy": 0.8210620433092117, "num_tokens": 408984536.0, "step": 12814 }, { "entropy": 0.597351485863328, "epoch": 1.1790443988246186, "grad_norm": 0.15211522579193115, "learning_rate": 6.0701689821204045e-05, "loss": 0.5951, "mean_token_accuracy": 0.8166293688118458, "num_tokens": 409016840.0, "step": 12815 }, { "entropy": 0.5530285304412246, "epoch": 1.1791364051960598, "grad_norm": 0.15017487108707428, "learning_rate": 6.069862299506241e-05, "loss": 0.5278, "mean_token_accuracy": 0.8351617269217968, "num_tokens": 409048706.0, "step": 12816 }, { "entropy": 0.6663478035479784, "epoch": 1.1792284115675011, "grad_norm": 0.1654634177684784, "learning_rate": 6.069555616892079e-05, "loss": 0.6551, "mean_token_accuracy": 0.7962551712989807, "num_tokens": 409080301.0, "step": 12817 }, { "entropy": 0.6501547060906887, "epoch": 1.1793204179389423, "grad_norm": 0.16839751601219177, "learning_rate": 6.0692489342779155e-05, "loss": 0.6382, "mean_token_accuracy": 0.802005086094141, "num_tokens": 409110370.0, "step": 12818 }, { "entropy": 0.6803659070283175, "epoch": 1.1794124243103834, "grad_norm": 0.1635662168264389, "learning_rate": 6.0689422516637537e-05, "loss": 0.6742, "mean_token_accuracy": 0.7968026846647263, "num_tokens": 409142517.0, "step": 12819 }, { "entropy": 0.595958886668086, "epoch": 1.1795044306818248, "grad_norm": 0.15990608930587769, "learning_rate": 6.068635569049591e-05, "loss": 0.5993, "mean_token_accuracy": 0.8205725662410259, "num_tokens": 409174208.0, "step": 12820 }, { "entropy": 0.6585810147225857, "epoch": 1.179596437053266, "grad_norm": 0.15683068335056305, "learning_rate": 6.068328886435428e-05, "loss": 0.6385, "mean_token_accuracy": 0.8041860498487949, "num_tokens": 409206248.0, "step": 12821 }, { "entropy": 0.5681253466755152, "epoch": 1.1796884434247072, "grad_norm": 0.15520286560058594, "learning_rate": 6.0680222038212654e-05, "loss": 0.5422, "mean_token_accuracy": 0.8302231058478355, "num_tokens": 409237770.0, "step": 12822 }, { "entropy": 0.5851716613397002, "epoch": 1.1797804497961484, "grad_norm": 0.16266874969005585, "learning_rate": 6.0677155212071035e-05, "loss": 0.559, "mean_token_accuracy": 0.829734243452549, "num_tokens": 409269284.0, "step": 12823 }, { "entropy": 0.5951076112687588, "epoch": 1.1798724561675895, "grad_norm": 0.1545606106519699, "learning_rate": 6.06740883859294e-05, "loss": 0.5787, "mean_token_accuracy": 0.8188728988170624, "num_tokens": 409301265.0, "step": 12824 }, { "entropy": 0.584199097007513, "epoch": 1.1799644625390309, "grad_norm": 0.1673383265733719, "learning_rate": 6.067102155978778e-05, "loss": 0.5627, "mean_token_accuracy": 0.824126411229372, "num_tokens": 409332534.0, "step": 12825 }, { "entropy": 0.6272962661460042, "epoch": 1.180056468910472, "grad_norm": 0.5330429077148438, "learning_rate": 6.0667954733646146e-05, "loss": 0.6107, "mean_token_accuracy": 0.8134483620524406, "num_tokens": 409364547.0, "step": 12826 }, { "entropy": 0.6910545136779547, "epoch": 1.1801484752819134, "grad_norm": 0.16435980796813965, "learning_rate": 6.0664887907504534e-05, "loss": 0.6675, "mean_token_accuracy": 0.7955349199473858, "num_tokens": 409396502.0, "step": 12827 }, { "entropy": 0.6493249610066414, "epoch": 1.1802404816533545, "grad_norm": 0.16249294579029083, "learning_rate": 6.06618210813629e-05, "loss": 0.6421, "mean_token_accuracy": 0.8033401966094971, "num_tokens": 409428620.0, "step": 12828 }, { "entropy": 0.5851630941033363, "epoch": 1.1803324880247956, "grad_norm": 0.16093024611473083, "learning_rate": 6.065875425522127e-05, "loss": 0.5739, "mean_token_accuracy": 0.8238081894814968, "num_tokens": 409460173.0, "step": 12829 }, { "entropy": 0.586370088160038, "epoch": 1.180424494396237, "grad_norm": 0.173745796084404, "learning_rate": 6.0655687429079644e-05, "loss": 0.5713, "mean_token_accuracy": 0.8222965188324451, "num_tokens": 409492289.0, "step": 12830 }, { "entropy": 0.651757107116282, "epoch": 1.1805165007676781, "grad_norm": 0.1597006767988205, "learning_rate": 6.0652620602938026e-05, "loss": 0.6346, "mean_token_accuracy": 0.807503592222929, "num_tokens": 409524690.0, "step": 12831 }, { "entropy": 0.7561479639261961, "epoch": 1.1806085071391195, "grad_norm": 0.17377810180187225, "learning_rate": 6.06495537767964e-05, "loss": 0.7528, "mean_token_accuracy": 0.7723657861351967, "num_tokens": 409556481.0, "step": 12832 }, { "entropy": 0.6703077079728246, "epoch": 1.1807005135105606, "grad_norm": 0.16391624510288239, "learning_rate": 6.064648695065477e-05, "loss": 0.6618, "mean_token_accuracy": 0.7988701611757278, "num_tokens": 409588856.0, "step": 12833 }, { "entropy": 0.7681279890239239, "epoch": 1.1807925198820017, "grad_norm": 0.16730621457099915, "learning_rate": 6.064342012451314e-05, "loss": 0.7754, "mean_token_accuracy": 0.7650698311626911, "num_tokens": 409620813.0, "step": 12834 }, { "entropy": 0.5949154337868094, "epoch": 1.180884526253443, "grad_norm": 0.15510797500610352, "learning_rate": 6.0640353298371524e-05, "loss": 0.5938, "mean_token_accuracy": 0.8206617794930935, "num_tokens": 409653120.0, "step": 12835 }, { "entropy": 0.6225858014076948, "epoch": 1.1809765326248842, "grad_norm": 0.17176562547683716, "learning_rate": 6.063728647222989e-05, "loss": 0.6082, "mean_token_accuracy": 0.8125547543168068, "num_tokens": 409684909.0, "step": 12836 }, { "entropy": 0.5959023199975491, "epoch": 1.1810685389963256, "grad_norm": 0.15855368971824646, "learning_rate": 6.063421964608827e-05, "loss": 0.5804, "mean_token_accuracy": 0.8192933574318886, "num_tokens": 409716216.0, "step": 12837 }, { "entropy": 0.5967301726341248, "epoch": 1.1811605453677667, "grad_norm": 0.1518947035074234, "learning_rate": 6.0631152819946635e-05, "loss": 0.5823, "mean_token_accuracy": 0.8197972550988197, "num_tokens": 409748984.0, "step": 12838 }, { "entropy": 0.6170119373127818, "epoch": 1.1812525517392078, "grad_norm": 0.1576225757598877, "learning_rate": 6.0628085993805016e-05, "loss": 0.5819, "mean_token_accuracy": 0.8212177976965904, "num_tokens": 409780658.0, "step": 12839 }, { "entropy": 0.6137290522456169, "epoch": 1.1813445581106492, "grad_norm": 0.16177381575107574, "learning_rate": 6.062501916766339e-05, "loss": 0.5956, "mean_token_accuracy": 0.8147336095571518, "num_tokens": 409812440.0, "step": 12840 }, { "entropy": 0.5905677545815706, "epoch": 1.1814365644820903, "grad_norm": 0.16221065819263458, "learning_rate": 6.062195234152176e-05, "loss": 0.5878, "mean_token_accuracy": 0.8201001062989235, "num_tokens": 409844682.0, "step": 12841 }, { "entropy": 0.5305453427135944, "epoch": 1.1815285708535317, "grad_norm": 0.15989354252815247, "learning_rate": 6.061888551538013e-05, "loss": 0.5128, "mean_token_accuracy": 0.8421405963599682, "num_tokens": 409876595.0, "step": 12842 }, { "entropy": 0.6618895437568426, "epoch": 1.1816205772249728, "grad_norm": 0.15954725444316864, "learning_rate": 6.0615818689238515e-05, "loss": 0.6595, "mean_token_accuracy": 0.8014923669397831, "num_tokens": 409908596.0, "step": 12843 }, { "entropy": 0.5636222250759602, "epoch": 1.181712583596414, "grad_norm": 0.1591787040233612, "learning_rate": 6.061275186309688e-05, "loss": 0.5548, "mean_token_accuracy": 0.8279785439372063, "num_tokens": 409940480.0, "step": 12844 }, { "entropy": 0.6284146150574088, "epoch": 1.1818045899678553, "grad_norm": 0.15905113518238068, "learning_rate": 6.060968503695526e-05, "loss": 0.6055, "mean_token_accuracy": 0.8118184767663479, "num_tokens": 409973102.0, "step": 12845 }, { "entropy": 0.6240399079397321, "epoch": 1.1818965963392964, "grad_norm": 0.16031309962272644, "learning_rate": 6.060661821081364e-05, "loss": 0.6269, "mean_token_accuracy": 0.8104398436844349, "num_tokens": 410005135.0, "step": 12846 }, { "entropy": 0.692963657900691, "epoch": 1.1819886027107378, "grad_norm": 0.16286158561706543, "learning_rate": 6.0603551384672006e-05, "loss": 0.6905, "mean_token_accuracy": 0.791682954877615, "num_tokens": 410037282.0, "step": 12847 }, { "entropy": 0.6297562716063112, "epoch": 1.182080609082179, "grad_norm": 0.16225384175777435, "learning_rate": 6.060048455853038e-05, "loss": 0.6173, "mean_token_accuracy": 0.8165185563266277, "num_tokens": 410069810.0, "step": 12848 }, { "entropy": 0.6574691254645586, "epoch": 1.18217261545362, "grad_norm": 0.15992605686187744, "learning_rate": 6.059741773238875e-05, "loss": 0.6475, "mean_token_accuracy": 0.8047504611313343, "num_tokens": 410101293.0, "step": 12849 }, { "entropy": 0.6484873332083225, "epoch": 1.1822646218250614, "grad_norm": 0.1608210653066635, "learning_rate": 6.059435090624713e-05, "loss": 0.6397, "mean_token_accuracy": 0.8085398897528648, "num_tokens": 410133379.0, "step": 12850 }, { "entropy": 0.6523200552910566, "epoch": 1.1823566281965026, "grad_norm": 0.15733548998832703, "learning_rate": 6.0591284080105505e-05, "loss": 0.6448, "mean_token_accuracy": 0.7999961413443089, "num_tokens": 410165367.0, "step": 12851 }, { "entropy": 0.6119341384619474, "epoch": 1.182448634567944, "grad_norm": 0.1558966338634491, "learning_rate": 6.058821725396387e-05, "loss": 0.5934, "mean_token_accuracy": 0.8138749077916145, "num_tokens": 410197125.0, "step": 12852 }, { "entropy": 0.668057007715106, "epoch": 1.182540640939385, "grad_norm": 0.1627742350101471, "learning_rate": 6.058515042782225e-05, "loss": 0.6543, "mean_token_accuracy": 0.8024899363517761, "num_tokens": 410228970.0, "step": 12853 }, { "entropy": 0.6217446802183986, "epoch": 1.1826326473108262, "grad_norm": 0.15942099690437317, "learning_rate": 6.058208360168063e-05, "loss": 0.6128, "mean_token_accuracy": 0.8124975971877575, "num_tokens": 410261721.0, "step": 12854 }, { "entropy": 0.5217242427170277, "epoch": 1.1827246536822675, "grad_norm": 0.14671209454536438, "learning_rate": 6.0579016775539e-05, "loss": 0.5066, "mean_token_accuracy": 0.8398961536586285, "num_tokens": 410293778.0, "step": 12855 }, { "entropy": 0.5325000714510679, "epoch": 1.1828166600537087, "grad_norm": 0.14626295864582062, "learning_rate": 6.057594994939737e-05, "loss": 0.5238, "mean_token_accuracy": 0.8411106616258621, "num_tokens": 410325886.0, "step": 12856 }, { "entropy": 0.6917587053030729, "epoch": 1.18290866642515, "grad_norm": 0.17106474936008453, "learning_rate": 6.057288312325574e-05, "loss": 0.6793, "mean_token_accuracy": 0.7928517796099186, "num_tokens": 410358196.0, "step": 12857 }, { "entropy": 0.6211818046867847, "epoch": 1.1830006727965912, "grad_norm": 0.16705621778964996, "learning_rate": 6.056981629711412e-05, "loss": 0.6118, "mean_token_accuracy": 0.8095204122364521, "num_tokens": 410389947.0, "step": 12858 }, { "entropy": 0.632463064044714, "epoch": 1.1830926791680323, "grad_norm": 0.15922266244888306, "learning_rate": 6.0566749470972495e-05, "loss": 0.6383, "mean_token_accuracy": 0.805241946130991, "num_tokens": 410421658.0, "step": 12859 }, { "entropy": 0.5693967835977674, "epoch": 1.1831846855394736, "grad_norm": 0.15652354061603546, "learning_rate": 6.056368264483086e-05, "loss": 0.553, "mean_token_accuracy": 0.8316059969365597, "num_tokens": 410453110.0, "step": 12860 }, { "entropy": 0.6711183656007051, "epoch": 1.1832766919109148, "grad_norm": 0.16308577358722687, "learning_rate": 6.056061581868924e-05, "loss": 0.6678, "mean_token_accuracy": 0.8025546073913574, "num_tokens": 410485087.0, "step": 12861 }, { "entropy": 0.5163745004683733, "epoch": 1.1833686982823561, "grad_norm": 0.14833982288837433, "learning_rate": 6.055754899254762e-05, "loss": 0.4964, "mean_token_accuracy": 0.8495572544634342, "num_tokens": 410517494.0, "step": 12862 }, { "entropy": 0.5666032275184989, "epoch": 1.1834607046537973, "grad_norm": 0.15680193901062012, "learning_rate": 6.055448216640599e-05, "loss": 0.5511, "mean_token_accuracy": 0.8290773667395115, "num_tokens": 410549603.0, "step": 12863 }, { "entropy": 0.6440720614045858, "epoch": 1.1835527110252384, "grad_norm": 0.15361739695072174, "learning_rate": 6.055141534026436e-05, "loss": 0.627, "mean_token_accuracy": 0.8083376027643681, "num_tokens": 410581813.0, "step": 12864 }, { "entropy": 0.7263589613139629, "epoch": 1.1836447173966798, "grad_norm": 0.16079625487327576, "learning_rate": 6.054834851412273e-05, "loss": 0.7167, "mean_token_accuracy": 0.780796654522419, "num_tokens": 410613857.0, "step": 12865 }, { "entropy": 0.6702664494514465, "epoch": 1.183736723768121, "grad_norm": 0.16401860117912292, "learning_rate": 6.054528168798112e-05, "loss": 0.652, "mean_token_accuracy": 0.8004784658551216, "num_tokens": 410646062.0, "step": 12866 }, { "entropy": 0.6296720616519451, "epoch": 1.1838287301395622, "grad_norm": 0.16353578865528107, "learning_rate": 6.0542214861839486e-05, "loss": 0.6307, "mean_token_accuracy": 0.8045900650322437, "num_tokens": 410677903.0, "step": 12867 }, { "entropy": 0.5165645405650139, "epoch": 1.1839207365110034, "grad_norm": 0.15600460767745972, "learning_rate": 6.0539148035697854e-05, "loss": 0.5076, "mean_token_accuracy": 0.840537529438734, "num_tokens": 410709359.0, "step": 12868 }, { "entropy": 0.6606485582888126, "epoch": 1.1840127428824445, "grad_norm": 0.16115926206111908, "learning_rate": 6.053608120955623e-05, "loss": 0.6601, "mean_token_accuracy": 0.7964460477232933, "num_tokens": 410741965.0, "step": 12869 }, { "entropy": 0.5955555159598589, "epoch": 1.1841047492538859, "grad_norm": 0.1585136204957962, "learning_rate": 6.053301438341461e-05, "loss": 0.5734, "mean_token_accuracy": 0.8212171904742718, "num_tokens": 410773647.0, "step": 12870 }, { "entropy": 0.6964815147221088, "epoch": 1.184196755625327, "grad_norm": 0.16256742179393768, "learning_rate": 6.0529947557272984e-05, "loss": 0.683, "mean_token_accuracy": 0.7917600646615028, "num_tokens": 410805533.0, "step": 12871 }, { "entropy": 0.6459903568029404, "epoch": 1.1842887619967684, "grad_norm": 0.15680153667926788, "learning_rate": 6.052688073113135e-05, "loss": 0.6289, "mean_token_accuracy": 0.8103121109306812, "num_tokens": 410836554.0, "step": 12872 }, { "entropy": 0.6041005849838257, "epoch": 1.1843807683682095, "grad_norm": 0.15702031552791595, "learning_rate": 6.0523813904989734e-05, "loss": 0.5823, "mean_token_accuracy": 0.8161187246441841, "num_tokens": 410867934.0, "step": 12873 }, { "entropy": 0.565071483142674, "epoch": 1.1844727747396506, "grad_norm": 0.1616765707731247, "learning_rate": 6.052074707884811e-05, "loss": 0.5524, "mean_token_accuracy": 0.8305428549647331, "num_tokens": 410899689.0, "step": 12874 }, { "entropy": 0.7267187163233757, "epoch": 1.184564781111092, "grad_norm": 0.1724214255809784, "learning_rate": 6.0517680252706476e-05, "loss": 0.7079, "mean_token_accuracy": 0.7849208824336529, "num_tokens": 410930729.0, "step": 12875 }, { "entropy": 0.6075108367949724, "epoch": 1.1846567874825331, "grad_norm": 0.1635294109582901, "learning_rate": 6.051461342656485e-05, "loss": 0.6006, "mean_token_accuracy": 0.8122540712356567, "num_tokens": 410962011.0, "step": 12876 }, { "entropy": 0.6876761121675372, "epoch": 1.1847487938539745, "grad_norm": 0.16272957623004913, "learning_rate": 6.051154660042323e-05, "loss": 0.6719, "mean_token_accuracy": 0.796604111790657, "num_tokens": 410993577.0, "step": 12877 }, { "entropy": 0.6693268194794655, "epoch": 1.1848408002254156, "grad_norm": 0.16332793235778809, "learning_rate": 6.05084797742816e-05, "loss": 0.6638, "mean_token_accuracy": 0.7996008507907391, "num_tokens": 411025515.0, "step": 12878 }, { "entropy": 0.5904426574707031, "epoch": 1.1849328065968567, "grad_norm": 0.15868507325649261, "learning_rate": 6.0505412948139975e-05, "loss": 0.5804, "mean_token_accuracy": 0.8229742012917995, "num_tokens": 411057894.0, "step": 12879 }, { "entropy": 0.6249990556389093, "epoch": 1.185024812968298, "grad_norm": 0.1704150140285492, "learning_rate": 6.050234612199834e-05, "loss": 0.6314, "mean_token_accuracy": 0.808990228921175, "num_tokens": 411088683.0, "step": 12880 }, { "entropy": 0.6249595563858747, "epoch": 1.1851168193397392, "grad_norm": 0.15521781146526337, "learning_rate": 6.0499279295856724e-05, "loss": 0.6063, "mean_token_accuracy": 0.8146154135465622, "num_tokens": 411121422.0, "step": 12881 }, { "entropy": 0.637336503714323, "epoch": 1.1852088257111806, "grad_norm": 0.15958553552627563, "learning_rate": 6.04962124697151e-05, "loss": 0.6275, "mean_token_accuracy": 0.8068297505378723, "num_tokens": 411153028.0, "step": 12882 }, { "entropy": 0.6513865813612938, "epoch": 1.1853008320826217, "grad_norm": 0.1579613834619522, "learning_rate": 6.0493145643573467e-05, "loss": 0.6412, "mean_token_accuracy": 0.8037446066737175, "num_tokens": 411185438.0, "step": 12883 }, { "entropy": 0.763935498893261, "epoch": 1.1853928384540628, "grad_norm": 0.1638147383928299, "learning_rate": 6.049007881743184e-05, "loss": 0.7571, "mean_token_accuracy": 0.7690280377864838, "num_tokens": 411217637.0, "step": 12884 }, { "entropy": 0.5395246469415724, "epoch": 1.1854848448255042, "grad_norm": 0.1650964468717575, "learning_rate": 6.048701199129022e-05, "loss": 0.5117, "mean_token_accuracy": 0.8423259668052197, "num_tokens": 411250060.0, "step": 12885 }, { "entropy": 0.6249136356636882, "epoch": 1.1855768511969453, "grad_norm": 0.15146276354789734, "learning_rate": 6.048394516514859e-05, "loss": 0.6057, "mean_token_accuracy": 0.8123128600418568, "num_tokens": 411282384.0, "step": 12886 }, { "entropy": 0.6015826789662242, "epoch": 1.1856688575683867, "grad_norm": 0.1524311751127243, "learning_rate": 6.0480878339006965e-05, "loss": 0.5899, "mean_token_accuracy": 0.8154684491455555, "num_tokens": 411314800.0, "step": 12887 }, { "entropy": 0.6336343679577112, "epoch": 1.1857608639398278, "grad_norm": 0.15778134763240814, "learning_rate": 6.047781151286533e-05, "loss": 0.6216, "mean_token_accuracy": 0.8124285191297531, "num_tokens": 411347498.0, "step": 12888 }, { "entropy": 0.656800439581275, "epoch": 1.185852870311269, "grad_norm": 0.17137038707733154, "learning_rate": 6.0474744686723714e-05, "loss": 0.6398, "mean_token_accuracy": 0.8018249236047268, "num_tokens": 411378589.0, "step": 12889 }, { "entropy": 0.5184663943946362, "epoch": 1.1859448766827103, "grad_norm": 0.15502318739891052, "learning_rate": 6.047167786058209e-05, "loss": 0.4991, "mean_token_accuracy": 0.8438099250197411, "num_tokens": 411410861.0, "step": 12890 }, { "entropy": 0.57224484346807, "epoch": 1.1860368830541514, "grad_norm": 0.1550436168909073, "learning_rate": 6.046861103444046e-05, "loss": 0.5621, "mean_token_accuracy": 0.823591735213995, "num_tokens": 411441985.0, "step": 12891 }, { "entropy": 0.5151236054953188, "epoch": 1.1861288894255928, "grad_norm": 0.1508413702249527, "learning_rate": 6.046554420829883e-05, "loss": 0.4957, "mean_token_accuracy": 0.8448976539075375, "num_tokens": 411474241.0, "step": 12892 }, { "entropy": 0.6307276543229818, "epoch": 1.186220895797034, "grad_norm": 0.15391504764556885, "learning_rate": 6.046247738215721e-05, "loss": 0.6233, "mean_token_accuracy": 0.8089801073074341, "num_tokens": 411506545.0, "step": 12893 }, { "entropy": 0.49785149935632944, "epoch": 1.186312902168475, "grad_norm": 0.14616230130195618, "learning_rate": 6.045941055601558e-05, "loss": 0.4871, "mean_token_accuracy": 0.8483933508396149, "num_tokens": 411538877.0, "step": 12894 }, { "entropy": 0.5104107651859522, "epoch": 1.1864049085399164, "grad_norm": 0.15420880913734436, "learning_rate": 6.0456343729873956e-05, "loss": 0.5012, "mean_token_accuracy": 0.8421576805412769, "num_tokens": 411570987.0, "step": 12895 }, { "entropy": 0.7047312166541815, "epoch": 1.1864969149113576, "grad_norm": 0.1630563586950302, "learning_rate": 6.0453276903732323e-05, "loss": 0.7044, "mean_token_accuracy": 0.7878213562071323, "num_tokens": 411602622.0, "step": 12896 }, { "entropy": 0.5895881745964289, "epoch": 1.186588921282799, "grad_norm": 0.15224012732505798, "learning_rate": 6.0450210077590705e-05, "loss": 0.5677, "mean_token_accuracy": 0.8246490731835365, "num_tokens": 411634863.0, "step": 12897 }, { "entropy": 0.5681608496233821, "epoch": 1.18668092765424, "grad_norm": 0.15649960935115814, "learning_rate": 6.044714325144908e-05, "loss": 0.564, "mean_token_accuracy": 0.8295067325234413, "num_tokens": 411667097.0, "step": 12898 }, { "entropy": 0.4878831682726741, "epoch": 1.1867729340256812, "grad_norm": 0.15333670377731323, "learning_rate": 6.044407642530745e-05, "loss": 0.4698, "mean_token_accuracy": 0.8531825803220272, "num_tokens": 411699794.0, "step": 12899 }, { "entropy": 0.6228166781365871, "epoch": 1.1868649403971225, "grad_norm": 0.15943261981010437, "learning_rate": 6.044100959916582e-05, "loss": 0.6308, "mean_token_accuracy": 0.8057497106492519, "num_tokens": 411731879.0, "step": 12900 }, { "entropy": 0.5792943835258484, "epoch": 1.1869569467685637, "grad_norm": 0.1730756163597107, "learning_rate": 6.0437942773024203e-05, "loss": 0.5685, "mean_token_accuracy": 0.8226151540875435, "num_tokens": 411763009.0, "step": 12901 }, { "entropy": 0.5071085756644607, "epoch": 1.187048953140005, "grad_norm": 0.1501636952161789, "learning_rate": 6.043487594688257e-05, "loss": 0.4948, "mean_token_accuracy": 0.8451801724731922, "num_tokens": 411794866.0, "step": 12902 }, { "entropy": 0.605363305658102, "epoch": 1.1871409595114462, "grad_norm": 0.15578654408454895, "learning_rate": 6.0431809120740946e-05, "loss": 0.5982, "mean_token_accuracy": 0.8189945891499519, "num_tokens": 411827051.0, "step": 12903 }, { "entropy": 0.6800463758409023, "epoch": 1.1872329658828873, "grad_norm": 0.16238172352313995, "learning_rate": 6.042874229459933e-05, "loss": 0.6742, "mean_token_accuracy": 0.792614821344614, "num_tokens": 411858884.0, "step": 12904 }, { "entropy": 0.6642596386373043, "epoch": 1.1873249722543286, "grad_norm": 0.1641029417514801, "learning_rate": 6.0425675468457695e-05, "loss": 0.6329, "mean_token_accuracy": 0.8061506077647209, "num_tokens": 411890849.0, "step": 12905 }, { "entropy": 0.6642412804067135, "epoch": 1.1874169786257698, "grad_norm": 0.16158293187618256, "learning_rate": 6.042260864231607e-05, "loss": 0.6577, "mean_token_accuracy": 0.7977614924311638, "num_tokens": 411922118.0, "step": 12906 }, { "entropy": 0.7027017809450626, "epoch": 1.1875089849972111, "grad_norm": 0.16589194536209106, "learning_rate": 6.041954181617444e-05, "loss": 0.688, "mean_token_accuracy": 0.7875435464084148, "num_tokens": 411953674.0, "step": 12907 }, { "entropy": 0.7225943394005299, "epoch": 1.1876009913686523, "grad_norm": 0.15984661877155304, "learning_rate": 6.0416474990032826e-05, "loss": 0.714, "mean_token_accuracy": 0.777837660163641, "num_tokens": 411985646.0, "step": 12908 }, { "entropy": 0.6836789008229971, "epoch": 1.1876929977400934, "grad_norm": 0.16519048810005188, "learning_rate": 6.0413408163891194e-05, "loss": 0.6816, "mean_token_accuracy": 0.7985980473458767, "num_tokens": 412017163.0, "step": 12909 }, { "entropy": 0.6219694651663303, "epoch": 1.1877850041115348, "grad_norm": 0.15134617686271667, "learning_rate": 6.041034133774957e-05, "loss": 0.6115, "mean_token_accuracy": 0.8125102818012238, "num_tokens": 412048951.0, "step": 12910 }, { "entropy": 0.5172385200858116, "epoch": 1.187877010482976, "grad_norm": 0.15703244507312775, "learning_rate": 6.0407274511607936e-05, "loss": 0.4982, "mean_token_accuracy": 0.8470037803053856, "num_tokens": 412081263.0, "step": 12911 }, { "entropy": 0.5755518544465303, "epoch": 1.1879690168544172, "grad_norm": 0.15334543585777283, "learning_rate": 6.040420768546632e-05, "loss": 0.5418, "mean_token_accuracy": 0.8329243287444115, "num_tokens": 412113554.0, "step": 12912 }, { "entropy": 0.5638619577512145, "epoch": 1.1880610232258584, "grad_norm": 0.15300965309143066, "learning_rate": 6.040114085932469e-05, "loss": 0.5426, "mean_token_accuracy": 0.8337432183325291, "num_tokens": 412146164.0, "step": 12913 }, { "entropy": 0.43261874839663506, "epoch": 1.1881530295972995, "grad_norm": 0.14375944435596466, "learning_rate": 6.039807403318306e-05, "loss": 0.4098, "mean_token_accuracy": 0.8715882264077663, "num_tokens": 412178700.0, "step": 12914 }, { "entropy": 0.7158865150995553, "epoch": 1.1882450359687409, "grad_norm": 0.15856191515922546, "learning_rate": 6.0395007207041435e-05, "loss": 0.6962, "mean_token_accuracy": 0.7887215055525303, "num_tokens": 412210773.0, "step": 12915 }, { "entropy": 0.574910094961524, "epoch": 1.188337042340182, "grad_norm": 0.15066885948181152, "learning_rate": 6.0391940380899816e-05, "loss": 0.5638, "mean_token_accuracy": 0.825688362121582, "num_tokens": 412242769.0, "step": 12916 }, { "entropy": 0.6499043228104711, "epoch": 1.1884290487116234, "grad_norm": 0.15248294174671173, "learning_rate": 6.0388873554758184e-05, "loss": 0.6215, "mean_token_accuracy": 0.8051152005791664, "num_tokens": 412274541.0, "step": 12917 }, { "entropy": 0.529246206395328, "epoch": 1.1885210550830645, "grad_norm": 0.14718180894851685, "learning_rate": 6.038580672861656e-05, "loss": 0.517, "mean_token_accuracy": 0.8402014710009098, "num_tokens": 412306339.0, "step": 12918 }, { "entropy": 0.5973511505872011, "epoch": 1.1886130614545056, "grad_norm": 0.15314503014087677, "learning_rate": 6.038273990247493e-05, "loss": 0.5849, "mean_token_accuracy": 0.8170783035457134, "num_tokens": 412338577.0, "step": 12919 }, { "entropy": 0.6615813542157412, "epoch": 1.188705067825947, "grad_norm": 0.16858428716659546, "learning_rate": 6.037967307633331e-05, "loss": 0.6643, "mean_token_accuracy": 0.8000758141279221, "num_tokens": 412371032.0, "step": 12920 }, { "entropy": 0.5204954547807574, "epoch": 1.1887970741973881, "grad_norm": 0.15875308215618134, "learning_rate": 6.037660625019168e-05, "loss": 0.5109, "mean_token_accuracy": 0.8478487357497215, "num_tokens": 412403362.0, "step": 12921 }, { "entropy": 0.7020768877118826, "epoch": 1.1888890805688295, "grad_norm": 0.16914820671081543, "learning_rate": 6.037353942405005e-05, "loss": 0.7051, "mean_token_accuracy": 0.7854323647916317, "num_tokens": 412435880.0, "step": 12922 }, { "entropy": 0.585023395717144, "epoch": 1.1889810869402706, "grad_norm": 0.15374670922756195, "learning_rate": 6.0370472597908425e-05, "loss": 0.5803, "mean_token_accuracy": 0.8225524872541428, "num_tokens": 412468057.0, "step": 12923 }, { "entropy": 0.5923198889940977, "epoch": 1.1890730933117117, "grad_norm": 0.16419124603271484, "learning_rate": 6.036740577176681e-05, "loss": 0.5808, "mean_token_accuracy": 0.823333777487278, "num_tokens": 412499873.0, "step": 12924 }, { "entropy": 0.5354879545047879, "epoch": 1.189165099683153, "grad_norm": 0.1537798047065735, "learning_rate": 6.0364338945625175e-05, "loss": 0.5235, "mean_token_accuracy": 0.8346861153841019, "num_tokens": 412531700.0, "step": 12925 }, { "entropy": 0.599360466003418, "epoch": 1.1892571060545942, "grad_norm": 0.1624981015920639, "learning_rate": 6.036127211948355e-05, "loss": 0.5901, "mean_token_accuracy": 0.8133135288953781, "num_tokens": 412563212.0, "step": 12926 }, { "entropy": 0.6972933802753687, "epoch": 1.1893491124260356, "grad_norm": 0.1620873510837555, "learning_rate": 6.035820529334192e-05, "loss": 0.6938, "mean_token_accuracy": 0.7911777086555958, "num_tokens": 412595665.0, "step": 12927 }, { "entropy": 0.6904404703527689, "epoch": 1.1894411187974767, "grad_norm": 0.16163800656795502, "learning_rate": 6.03551384672003e-05, "loss": 0.6779, "mean_token_accuracy": 0.7978106290102005, "num_tokens": 412628013.0, "step": 12928 }, { "entropy": 0.5955011984333396, "epoch": 1.1895331251689178, "grad_norm": 0.1536337286233902, "learning_rate": 6.035207164105867e-05, "loss": 0.5732, "mean_token_accuracy": 0.8185814246535301, "num_tokens": 412659795.0, "step": 12929 }, { "entropy": 0.6482262620702386, "epoch": 1.1896251315403592, "grad_norm": 0.15930841863155365, "learning_rate": 6.034900481491704e-05, "loss": 0.6413, "mean_token_accuracy": 0.8056476823985577, "num_tokens": 412692114.0, "step": 12930 }, { "entropy": 0.5667450567707419, "epoch": 1.1897171379118003, "grad_norm": 0.1492510288953781, "learning_rate": 6.0345937988775416e-05, "loss": 0.5496, "mean_token_accuracy": 0.8315381407737732, "num_tokens": 412724637.0, "step": 12931 }, { "entropy": 0.5658194813877344, "epoch": 1.1898091442832417, "grad_norm": 0.16022823750972748, "learning_rate": 6.03428711626338e-05, "loss": 0.5246, "mean_token_accuracy": 0.8321414180099964, "num_tokens": 412755185.0, "step": 12932 }, { "entropy": 0.7076150085777044, "epoch": 1.1899011506546828, "grad_norm": 0.16214579343795776, "learning_rate": 6.0339804336492165e-05, "loss": 0.6902, "mean_token_accuracy": 0.7908612452447414, "num_tokens": 412787316.0, "step": 12933 }, { "entropy": 0.5672255093231797, "epoch": 1.189993157026124, "grad_norm": 0.15646225214004517, "learning_rate": 6.033673751035054e-05, "loss": 0.5393, "mean_token_accuracy": 0.8313247710466385, "num_tokens": 412819320.0, "step": 12934 }, { "entropy": 0.6194953545928001, "epoch": 1.1900851633975653, "grad_norm": 0.14914673566818237, "learning_rate": 6.033367068420892e-05, "loss": 0.6006, "mean_token_accuracy": 0.8151112124323845, "num_tokens": 412852079.0, "step": 12935 }, { "entropy": 0.554384870454669, "epoch": 1.1901771697690064, "grad_norm": 0.15027625858783722, "learning_rate": 6.033060385806729e-05, "loss": 0.5401, "mean_token_accuracy": 0.8311931975185871, "num_tokens": 412884673.0, "step": 12936 }, { "entropy": 0.6140545941889286, "epoch": 1.1902691761404478, "grad_norm": 0.15064236521720886, "learning_rate": 6.0327537031925664e-05, "loss": 0.6126, "mean_token_accuracy": 0.8163776211440563, "num_tokens": 412917441.0, "step": 12937 }, { "entropy": 0.6443721447139978, "epoch": 1.190361182511889, "grad_norm": 0.16096869111061096, "learning_rate": 6.032447020578403e-05, "loss": 0.6306, "mean_token_accuracy": 0.8117424994707108, "num_tokens": 412949587.0, "step": 12938 }, { "entropy": 0.6607138067483902, "epoch": 1.19045318888333, "grad_norm": 0.15992142260074615, "learning_rate": 6.032140337964241e-05, "loss": 0.654, "mean_token_accuracy": 0.7976130805909634, "num_tokens": 412981056.0, "step": 12939 }, { "entropy": 0.6168176387436688, "epoch": 1.1905451952547714, "grad_norm": 0.16099253296852112, "learning_rate": 6.031833655350079e-05, "loss": 0.6145, "mean_token_accuracy": 0.814532645046711, "num_tokens": 413013257.0, "step": 12940 }, { "entropy": 0.652438866905868, "epoch": 1.1906372016262126, "grad_norm": 0.1594868004322052, "learning_rate": 6.0315269727359156e-05, "loss": 0.6484, "mean_token_accuracy": 0.8016856946051121, "num_tokens": 413045466.0, "step": 12941 }, { "entropy": 0.6601704070344567, "epoch": 1.190729207997654, "grad_norm": 0.1644580066204071, "learning_rate": 6.031220290121753e-05, "loss": 0.6521, "mean_token_accuracy": 0.8019727505743504, "num_tokens": 413077630.0, "step": 12942 }, { "entropy": 0.46943290857598186, "epoch": 1.190821214369095, "grad_norm": 0.15409138798713684, "learning_rate": 6.030913607507591e-05, "loss": 0.4603, "mean_token_accuracy": 0.8595850579440594, "num_tokens": 413109952.0, "step": 12943 }, { "entropy": 0.6207207459956408, "epoch": 1.1909132207405362, "grad_norm": 0.15547607839107513, "learning_rate": 6.030606924893428e-05, "loss": 0.6104, "mean_token_accuracy": 0.8116990178823471, "num_tokens": 413142329.0, "step": 12944 }, { "entropy": 0.6771057089790702, "epoch": 1.1910052271119775, "grad_norm": 0.1608951836824417, "learning_rate": 6.0303002422792654e-05, "loss": 0.6758, "mean_token_accuracy": 0.794353611767292, "num_tokens": 413174712.0, "step": 12945 }, { "entropy": 0.6286241225898266, "epoch": 1.1910972334834187, "grad_norm": 0.15560559928417206, "learning_rate": 6.029993559665102e-05, "loss": 0.6162, "mean_token_accuracy": 0.8155966363847256, "num_tokens": 413206802.0, "step": 12946 }, { "entropy": 0.6505820993334055, "epoch": 1.19118923985486, "grad_norm": 0.15819257497787476, "learning_rate": 6.029686877050941e-05, "loss": 0.6438, "mean_token_accuracy": 0.8049435093998909, "num_tokens": 413238659.0, "step": 12947 }, { "entropy": 0.6965616121888161, "epoch": 1.1912812462263012, "grad_norm": 0.16269536316394806, "learning_rate": 6.029380194436778e-05, "loss": 0.6991, "mean_token_accuracy": 0.7852487191557884, "num_tokens": 413270944.0, "step": 12948 }, { "entropy": 0.7449693977832794, "epoch": 1.1913732525977423, "grad_norm": 0.17631401121616364, "learning_rate": 6.0290735118226146e-05, "loss": 0.7466, "mean_token_accuracy": 0.7783134765923023, "num_tokens": 413302901.0, "step": 12949 }, { "entropy": 0.5778220500797033, "epoch": 1.1914652589691836, "grad_norm": 0.15685111284255981, "learning_rate": 6.028766829208452e-05, "loss": 0.5706, "mean_token_accuracy": 0.82271683588624, "num_tokens": 413335080.0, "step": 12950 }, { "entropy": 0.6429454232566059, "epoch": 1.1915572653406248, "grad_norm": 0.15303926169872284, "learning_rate": 6.02846014659429e-05, "loss": 0.6286, "mean_token_accuracy": 0.8093688488006592, "num_tokens": 413367056.0, "step": 12951 }, { "entropy": 0.6288506258279085, "epoch": 1.1916492717120661, "grad_norm": 0.17288829386234283, "learning_rate": 6.028153463980128e-05, "loss": 0.6229, "mean_token_accuracy": 0.8067662194371223, "num_tokens": 413397795.0, "step": 12952 }, { "entropy": 0.5449880911037326, "epoch": 1.1917412780835073, "grad_norm": 0.14552177488803864, "learning_rate": 6.0278467813659645e-05, "loss": 0.5312, "mean_token_accuracy": 0.8336432352662086, "num_tokens": 413430063.0, "step": 12953 }, { "entropy": 0.5225226059556007, "epoch": 1.1918332844549484, "grad_norm": 0.1491377353668213, "learning_rate": 6.027540098751802e-05, "loss": 0.5105, "mean_token_accuracy": 0.842152439057827, "num_tokens": 413462011.0, "step": 12954 }, { "entropy": 0.6508317068219185, "epoch": 1.1919252908263898, "grad_norm": 0.15631957352161407, "learning_rate": 6.02723341613764e-05, "loss": 0.6286, "mean_token_accuracy": 0.8078235238790512, "num_tokens": 413494055.0, "step": 12955 }, { "entropy": 0.5017553996294737, "epoch": 1.192017297197831, "grad_norm": 0.15128152072429657, "learning_rate": 6.026926733523477e-05, "loss": 0.4914, "mean_token_accuracy": 0.8508582040667534, "num_tokens": 413526061.0, "step": 12956 }, { "entropy": 0.6323916986584663, "epoch": 1.1921093035692722, "grad_norm": 0.15381073951721191, "learning_rate": 6.026620050909314e-05, "loss": 0.618, "mean_token_accuracy": 0.8141316287219524, "num_tokens": 413558185.0, "step": 12957 }, { "entropy": 0.7761156475171447, "epoch": 1.1922013099407134, "grad_norm": 0.18158479034900665, "learning_rate": 6.026313368295151e-05, "loss": 0.7665, "mean_token_accuracy": 0.7713797762989998, "num_tokens": 413589469.0, "step": 12958 }, { "entropy": 0.5305654630064964, "epoch": 1.1922933163121545, "grad_norm": 0.1479751020669937, "learning_rate": 6.026006685680989e-05, "loss": 0.518, "mean_token_accuracy": 0.8370233215391636, "num_tokens": 413620930.0, "step": 12959 }, { "entropy": 0.5754859037697315, "epoch": 1.1923853226835959, "grad_norm": 0.1643238216638565, "learning_rate": 6.025700003066827e-05, "loss": 0.5685, "mean_token_accuracy": 0.8246095813810825, "num_tokens": 413652116.0, "step": 12960 }, { "entropy": 0.6407639570534229, "epoch": 1.192477329055037, "grad_norm": 0.1532324105501175, "learning_rate": 6.0253933204526635e-05, "loss": 0.6321, "mean_token_accuracy": 0.8065248057246208, "num_tokens": 413684793.0, "step": 12961 }, { "entropy": 0.7331072986125946, "epoch": 1.1925693354264784, "grad_norm": 0.16691647469997406, "learning_rate": 6.025086637838501e-05, "loss": 0.7173, "mean_token_accuracy": 0.7824029810726643, "num_tokens": 413716677.0, "step": 12962 }, { "entropy": 0.6126660360023379, "epoch": 1.1926613417979195, "grad_norm": 0.1586424559354782, "learning_rate": 6.024779955224339e-05, "loss": 0.5937, "mean_token_accuracy": 0.819816593080759, "num_tokens": 413749018.0, "step": 12963 }, { "entropy": 0.5948704043403268, "epoch": 1.1927533481693606, "grad_norm": 0.15694181621074677, "learning_rate": 6.024473272610176e-05, "loss": 0.5736, "mean_token_accuracy": 0.8243765011429787, "num_tokens": 413781594.0, "step": 12964 }, { "entropy": 0.653703186661005, "epoch": 1.192845354540802, "grad_norm": 0.16050399839878082, "learning_rate": 6.0241665899960134e-05, "loss": 0.6263, "mean_token_accuracy": 0.8067592680454254, "num_tokens": 413813207.0, "step": 12965 }, { "entropy": 0.7070904653519392, "epoch": 1.1929373609122431, "grad_norm": 0.1708565056324005, "learning_rate": 6.0238599073818515e-05, "loss": 0.6957, "mean_token_accuracy": 0.7871012203395367, "num_tokens": 413844901.0, "step": 12966 }, { "entropy": 0.5429828404448926, "epoch": 1.1930293672836845, "grad_norm": 0.1629900187253952, "learning_rate": 6.023553224767688e-05, "loss": 0.5357, "mean_token_accuracy": 0.8366168662905693, "num_tokens": 413877448.0, "step": 12967 }, { "entropy": 0.6169707104563713, "epoch": 1.1931213736551256, "grad_norm": 0.15831728279590607, "learning_rate": 6.023246542153526e-05, "loss": 0.6085, "mean_token_accuracy": 0.8144526183605194, "num_tokens": 413908208.0, "step": 12968 }, { "entropy": 0.5788307599723339, "epoch": 1.1932133800265667, "grad_norm": 0.1558813750743866, "learning_rate": 6.0229398595393625e-05, "loss": 0.5672, "mean_token_accuracy": 0.8235832899808884, "num_tokens": 413940976.0, "step": 12969 }, { "entropy": 0.6377137303352356, "epoch": 1.193305386398008, "grad_norm": 0.15645325183868408, "learning_rate": 6.022633176925201e-05, "loss": 0.6272, "mean_token_accuracy": 0.8082258366048336, "num_tokens": 413973003.0, "step": 12970 }, { "entropy": 0.5512858163565397, "epoch": 1.1933973927694492, "grad_norm": 0.15477624535560608, "learning_rate": 6.022326494311038e-05, "loss": 0.5464, "mean_token_accuracy": 0.8314606621861458, "num_tokens": 414005771.0, "step": 12971 }, { "entropy": 0.6227812208235264, "epoch": 1.1934893991408906, "grad_norm": 0.15793730318546295, "learning_rate": 6.022019811696875e-05, "loss": 0.6081, "mean_token_accuracy": 0.8114351406693459, "num_tokens": 414037530.0, "step": 12972 }, { "entropy": 0.728292353451252, "epoch": 1.1935814055123317, "grad_norm": 0.16534411907196045, "learning_rate": 6.0217131290827124e-05, "loss": 0.7256, "mean_token_accuracy": 0.775928758084774, "num_tokens": 414069593.0, "step": 12973 }, { "entropy": 0.5524968486279249, "epoch": 1.1936734118837729, "grad_norm": 0.15492941439151764, "learning_rate": 6.0214064464685505e-05, "loss": 0.5284, "mean_token_accuracy": 0.8390820994973183, "num_tokens": 414101352.0, "step": 12974 }, { "entropy": 0.6708187200129032, "epoch": 1.1937654182552142, "grad_norm": 0.16469743847846985, "learning_rate": 6.021099763854387e-05, "loss": 0.6495, "mean_token_accuracy": 0.8006170988082886, "num_tokens": 414133668.0, "step": 12975 }, { "entropy": 0.5528062689118087, "epoch": 1.1938574246266553, "grad_norm": 0.14786450564861298, "learning_rate": 6.020793081240225e-05, "loss": 0.5498, "mean_token_accuracy": 0.8277317807078362, "num_tokens": 414166221.0, "step": 12976 }, { "entropy": 0.6161195635795593, "epoch": 1.1939494309980967, "grad_norm": 0.1597299724817276, "learning_rate": 6.0204863986260616e-05, "loss": 0.5944, "mean_token_accuracy": 0.8179482519626617, "num_tokens": 414198025.0, "step": 12977 }, { "entropy": 0.6442152243107557, "epoch": 1.1940414373695378, "grad_norm": 0.1617545783519745, "learning_rate": 6.0201797160119e-05, "loss": 0.6154, "mean_token_accuracy": 0.8121930174529552, "num_tokens": 414229527.0, "step": 12978 }, { "entropy": 0.620650639757514, "epoch": 1.194133443740979, "grad_norm": 0.1524384468793869, "learning_rate": 6.019873033397737e-05, "loss": 0.6045, "mean_token_accuracy": 0.815290343016386, "num_tokens": 414261464.0, "step": 12979 }, { "entropy": 0.6087453765794635, "epoch": 1.1942254501124203, "grad_norm": 0.15629859268665314, "learning_rate": 6.019566350783574e-05, "loss": 0.5835, "mean_token_accuracy": 0.8214310519397259, "num_tokens": 414292966.0, "step": 12980 }, { "entropy": 0.550206933170557, "epoch": 1.1943174564838615, "grad_norm": 0.14983920753002167, "learning_rate": 6.0192596681694114e-05, "loss": 0.5428, "mean_token_accuracy": 0.8345733024179935, "num_tokens": 414325321.0, "step": 12981 }, { "entropy": 0.563748930580914, "epoch": 1.1944094628553028, "grad_norm": 0.15943624079227448, "learning_rate": 6.0189529855552496e-05, "loss": 0.5623, "mean_token_accuracy": 0.8265962265431881, "num_tokens": 414357853.0, "step": 12982 }, { "entropy": 0.5706585557200015, "epoch": 1.194501469226744, "grad_norm": 0.15355169773101807, "learning_rate": 6.0186463029410864e-05, "loss": 0.5466, "mean_token_accuracy": 0.8310533054172993, "num_tokens": 414390458.0, "step": 12983 }, { "entropy": 0.6356290578842163, "epoch": 1.194593475598185, "grad_norm": 0.15525540709495544, "learning_rate": 6.018339620326924e-05, "loss": 0.6317, "mean_token_accuracy": 0.8059317618608475, "num_tokens": 414422999.0, "step": 12984 }, { "entropy": 0.7037357222288847, "epoch": 1.1946854819696264, "grad_norm": 0.16261082887649536, "learning_rate": 6.0180329377127606e-05, "loss": 0.7067, "mean_token_accuracy": 0.7860014848411083, "num_tokens": 414454800.0, "step": 12985 }, { "entropy": 0.6401643604040146, "epoch": 1.1947774883410676, "grad_norm": 0.16666653752326965, "learning_rate": 6.0177262550985994e-05, "loss": 0.6419, "mean_token_accuracy": 0.8058981075882912, "num_tokens": 414486000.0, "step": 12986 }, { "entropy": 0.6324488995596766, "epoch": 1.194869494712509, "grad_norm": 0.16603893041610718, "learning_rate": 6.017419572484436e-05, "loss": 0.6157, "mean_token_accuracy": 0.8092028759419918, "num_tokens": 414517813.0, "step": 12987 }, { "entropy": 0.484440291300416, "epoch": 1.19496150108395, "grad_norm": 0.16720198094844818, "learning_rate": 6.017112889870273e-05, "loss": 0.453, "mean_token_accuracy": 0.8541475683450699, "num_tokens": 414549084.0, "step": 12988 }, { "entropy": 0.593599483370781, "epoch": 1.1950535074553912, "grad_norm": 0.1477828323841095, "learning_rate": 6.0168062072561105e-05, "loss": 0.5892, "mean_token_accuracy": 0.8196864910423756, "num_tokens": 414581150.0, "step": 12989 }, { "entropy": 0.6493975836783648, "epoch": 1.1951455138268325, "grad_norm": 0.1598268747329712, "learning_rate": 6.0164995246419486e-05, "loss": 0.6394, "mean_token_accuracy": 0.8071234002709389, "num_tokens": 414613333.0, "step": 12990 }, { "entropy": 0.6309031648561358, "epoch": 1.1952375201982737, "grad_norm": 0.1608072817325592, "learning_rate": 6.016192842027786e-05, "loss": 0.6215, "mean_token_accuracy": 0.8098122328519821, "num_tokens": 414645258.0, "step": 12991 }, { "entropy": 0.6688140891492367, "epoch": 1.195329526569715, "grad_norm": 0.15593448281288147, "learning_rate": 6.015886159413623e-05, "loss": 0.6524, "mean_token_accuracy": 0.8010559342801571, "num_tokens": 414677662.0, "step": 12992 }, { "entropy": 0.646027434617281, "epoch": 1.1954215329411562, "grad_norm": 0.1600857973098755, "learning_rate": 6.0155794767994597e-05, "loss": 0.6352, "mean_token_accuracy": 0.8087330274283886, "num_tokens": 414709818.0, "step": 12993 }, { "entropy": 0.6340792719274759, "epoch": 1.1955135393125973, "grad_norm": 0.162253275513649, "learning_rate": 6.0152727941852985e-05, "loss": 0.6171, "mean_token_accuracy": 0.8109401538968086, "num_tokens": 414742208.0, "step": 12994 }, { "entropy": 0.5893305670469999, "epoch": 1.1956055456840387, "grad_norm": 0.16127710044384003, "learning_rate": 6.014966111571135e-05, "loss": 0.5687, "mean_token_accuracy": 0.8225369602441788, "num_tokens": 414773761.0, "step": 12995 }, { "entropy": 0.6146195866167545, "epoch": 1.1956975520554798, "grad_norm": 0.15361468493938446, "learning_rate": 6.014659428956973e-05, "loss": 0.5848, "mean_token_accuracy": 0.8218158185482025, "num_tokens": 414806223.0, "step": 12996 }, { "entropy": 0.629583285190165, "epoch": 1.1957895584269211, "grad_norm": 0.16131363809108734, "learning_rate": 6.014352746342811e-05, "loss": 0.6104, "mean_token_accuracy": 0.8109550848603249, "num_tokens": 414838225.0, "step": 12997 }, { "entropy": 0.647470273077488, "epoch": 1.1958815647983623, "grad_norm": 0.16246531903743744, "learning_rate": 6.0140460637286477e-05, "loss": 0.6428, "mean_token_accuracy": 0.8032623305916786, "num_tokens": 414870740.0, "step": 12998 }, { "entropy": 0.5697713326662779, "epoch": 1.1959735711698034, "grad_norm": 0.15811394155025482, "learning_rate": 6.013739381114485e-05, "loss": 0.5427, "mean_token_accuracy": 0.829469345510006, "num_tokens": 414901847.0, "step": 12999 }, { "entropy": 0.5800871169194579, "epoch": 1.1960655775412448, "grad_norm": 0.15875762701034546, "learning_rate": 6.013432698500322e-05, "loss": 0.5583, "mean_token_accuracy": 0.8283914625644684, "num_tokens": 414933982.0, "step": 13000 }, { "entropy": 0.6328763710334897, "epoch": 1.196157583912686, "grad_norm": 0.15315742790699005, "learning_rate": 6.01312601588616e-05, "loss": 0.6234, "mean_token_accuracy": 0.8105231374502182, "num_tokens": 414966123.0, "step": 13001 }, { "entropy": 0.6992759639397264, "epoch": 1.1962495902841273, "grad_norm": 0.1617761105298996, "learning_rate": 6.0128193332719975e-05, "loss": 0.6992, "mean_token_accuracy": 0.7894046194851398, "num_tokens": 414998477.0, "step": 13002 }, { "entropy": 0.495380621869117, "epoch": 1.1963415966555684, "grad_norm": 0.15228545665740967, "learning_rate": 6.012512650657834e-05, "loss": 0.4885, "mean_token_accuracy": 0.8497373796999454, "num_tokens": 415030505.0, "step": 13003 }, { "entropy": 0.6274855546653271, "epoch": 1.1964336030270095, "grad_norm": 0.1522865891456604, "learning_rate": 6.012205968043672e-05, "loss": 0.6216, "mean_token_accuracy": 0.8081307671964169, "num_tokens": 415062354.0, "step": 13004 }, { "entropy": 0.6410403046756983, "epoch": 1.1965256093984509, "grad_norm": 0.15856176614761353, "learning_rate": 6.01189928542951e-05, "loss": 0.6415, "mean_token_accuracy": 0.8016859143972397, "num_tokens": 415094897.0, "step": 13005 }, { "entropy": 0.5958133451640606, "epoch": 1.196617615769892, "grad_norm": 0.15684495866298676, "learning_rate": 6.011592602815347e-05, "loss": 0.5899, "mean_token_accuracy": 0.8189065344631672, "num_tokens": 415126804.0, "step": 13006 }, { "entropy": 0.56841048784554, "epoch": 1.1967096221413334, "grad_norm": 0.15678708255290985, "learning_rate": 6.011285920201184e-05, "loss": 0.5666, "mean_token_accuracy": 0.8218335025012493, "num_tokens": 415159285.0, "step": 13007 }, { "entropy": 0.6145685957744718, "epoch": 1.1968016285127745, "grad_norm": 0.1700088083744049, "learning_rate": 6.010979237587021e-05, "loss": 0.6069, "mean_token_accuracy": 0.8185309320688248, "num_tokens": 415191435.0, "step": 13008 }, { "entropy": 0.641692440956831, "epoch": 1.1968936348842156, "grad_norm": 0.17840273678302765, "learning_rate": 6.010672554972859e-05, "loss": 0.6486, "mean_token_accuracy": 0.8080082423985004, "num_tokens": 415221777.0, "step": 13009 }, { "entropy": 0.5901474598795176, "epoch": 1.196985641255657, "grad_norm": 0.16320621967315674, "learning_rate": 6.0103658723586966e-05, "loss": 0.5783, "mean_token_accuracy": 0.8232305683195591, "num_tokens": 415253249.0, "step": 13010 }, { "entropy": 0.6393881645053625, "epoch": 1.1970776476270981, "grad_norm": 0.166458398103714, "learning_rate": 6.0100591897445333e-05, "loss": 0.6463, "mean_token_accuracy": 0.8000488430261612, "num_tokens": 415284619.0, "step": 13011 }, { "entropy": 0.5633505834266543, "epoch": 1.1971696539985395, "grad_norm": 0.15751788020133972, "learning_rate": 6.009752507130371e-05, "loss": 0.5502, "mean_token_accuracy": 0.8285314626991749, "num_tokens": 415316613.0, "step": 13012 }, { "entropy": 0.6663244599476457, "epoch": 1.1972616603699806, "grad_norm": 0.16832461953163147, "learning_rate": 6.009445824516209e-05, "loss": 0.6473, "mean_token_accuracy": 0.8000671900808811, "num_tokens": 415348759.0, "step": 13013 }, { "entropy": 0.6139925876632333, "epoch": 1.1973536667414217, "grad_norm": 0.15311630070209503, "learning_rate": 6.009139141902046e-05, "loss": 0.5984, "mean_token_accuracy": 0.8202281147241592, "num_tokens": 415381391.0, "step": 13014 }, { "entropy": 0.6013573408126831, "epoch": 1.197445673112863, "grad_norm": 0.15590256452560425, "learning_rate": 6.008832459287883e-05, "loss": 0.583, "mean_token_accuracy": 0.8191929049789906, "num_tokens": 415413297.0, "step": 13015 }, { "entropy": 0.6387728881090879, "epoch": 1.1975376794843042, "grad_norm": 0.16446565091609955, "learning_rate": 6.00852577667372e-05, "loss": 0.6368, "mean_token_accuracy": 0.8049489594995975, "num_tokens": 415445540.0, "step": 13016 }, { "entropy": 0.68042266741395, "epoch": 1.1976296858557456, "grad_norm": 0.1559692919254303, "learning_rate": 6.008219094059558e-05, "loss": 0.6665, "mean_token_accuracy": 0.797811858355999, "num_tokens": 415477324.0, "step": 13017 }, { "entropy": 0.6310700550675392, "epoch": 1.1977216922271867, "grad_norm": 0.1557679921388626, "learning_rate": 6.0079124114453956e-05, "loss": 0.6157, "mean_token_accuracy": 0.8141250610351562, "num_tokens": 415509585.0, "step": 13018 }, { "entropy": 0.6321336114779115, "epoch": 1.1978136985986279, "grad_norm": 0.15582680702209473, "learning_rate": 6.0076057288312324e-05, "loss": 0.6201, "mean_token_accuracy": 0.8059694431722164, "num_tokens": 415541673.0, "step": 13019 }, { "entropy": 0.6103196330368519, "epoch": 1.1979057049700692, "grad_norm": 0.15349751710891724, "learning_rate": 6.00729904621707e-05, "loss": 0.5924, "mean_token_accuracy": 0.8189001232385635, "num_tokens": 415573567.0, "step": 13020 }, { "entropy": 0.6831368785351515, "epoch": 1.1979977113415103, "grad_norm": 0.164847269654274, "learning_rate": 6.006992363602908e-05, "loss": 0.6666, "mean_token_accuracy": 0.7969490811228752, "num_tokens": 415605644.0, "step": 13021 }, { "entropy": 0.6885925643146038, "epoch": 1.1980897177129517, "grad_norm": 0.15915772318840027, "learning_rate": 6.006685680988745e-05, "loss": 0.6905, "mean_token_accuracy": 0.7946601919829845, "num_tokens": 415636969.0, "step": 13022 }, { "entropy": 0.6556102000176907, "epoch": 1.1981817240843928, "grad_norm": 0.1618194282054901, "learning_rate": 6.006378998374582e-05, "loss": 0.6414, "mean_token_accuracy": 0.8020149134099483, "num_tokens": 415668978.0, "step": 13023 }, { "entropy": 0.6273304326459765, "epoch": 1.198273730455834, "grad_norm": 0.1561550498008728, "learning_rate": 6.006072315760419e-05, "loss": 0.5971, "mean_token_accuracy": 0.8146014921367168, "num_tokens": 415700407.0, "step": 13024 }, { "entropy": 0.6700379997491837, "epoch": 1.1983657368272753, "grad_norm": 0.17570564150810242, "learning_rate": 6.005765633146257e-05, "loss": 0.6472, "mean_token_accuracy": 0.8037039041519165, "num_tokens": 415731753.0, "step": 13025 }, { "entropy": 0.6506435163319111, "epoch": 1.1984577431987165, "grad_norm": 0.16119031608104706, "learning_rate": 6.0054589505320946e-05, "loss": 0.647, "mean_token_accuracy": 0.8017200939357281, "num_tokens": 415764052.0, "step": 13026 }, { "entropy": 0.7035203166306019, "epoch": 1.1985497495701578, "grad_norm": 0.15784604847431183, "learning_rate": 6.0051522679179314e-05, "loss": 0.6848, "mean_token_accuracy": 0.7890656664967537, "num_tokens": 415796643.0, "step": 13027 }, { "entropy": 0.49096013605594635, "epoch": 1.198641755941599, "grad_norm": 0.16812551021575928, "learning_rate": 6.00484558530377e-05, "loss": 0.4913, "mean_token_accuracy": 0.8497197069227695, "num_tokens": 415828688.0, "step": 13028 }, { "entropy": 0.6662360150367022, "epoch": 1.19873376231304, "grad_norm": 0.15924043953418732, "learning_rate": 6.004538902689607e-05, "loss": 0.6591, "mean_token_accuracy": 0.795759528875351, "num_tokens": 415861096.0, "step": 13029 }, { "entropy": 0.581687806174159, "epoch": 1.1988257686844814, "grad_norm": 0.15644729137420654, "learning_rate": 6.0042322200754445e-05, "loss": 0.5591, "mean_token_accuracy": 0.8290119245648384, "num_tokens": 415892992.0, "step": 13030 }, { "entropy": 0.6425761356949806, "epoch": 1.1989177750559226, "grad_norm": 0.16236570477485657, "learning_rate": 6.003925537461281e-05, "loss": 0.6457, "mean_token_accuracy": 0.8059611432254314, "num_tokens": 415925063.0, "step": 13031 }, { "entropy": 0.6094631515443325, "epoch": 1.199009781427364, "grad_norm": 0.15907356142997742, "learning_rate": 6.0036188548471194e-05, "loss": 0.5974, "mean_token_accuracy": 0.8095955923199654, "num_tokens": 415956325.0, "step": 13032 }, { "entropy": 0.6236458830535412, "epoch": 1.199101787798805, "grad_norm": 0.1632297933101654, "learning_rate": 6.003312172232957e-05, "loss": 0.6237, "mean_token_accuracy": 0.8093317821621895, "num_tokens": 415988253.0, "step": 13033 }, { "entropy": 0.6454971022903919, "epoch": 1.1991937941702462, "grad_norm": 0.15786227583885193, "learning_rate": 6.003005489618794e-05, "loss": 0.636, "mean_token_accuracy": 0.8103420399129391, "num_tokens": 416020234.0, "step": 13034 }, { "entropy": 0.6108095832169056, "epoch": 1.1992858005416875, "grad_norm": 0.15627451241016388, "learning_rate": 6.002698807004631e-05, "loss": 0.5877, "mean_token_accuracy": 0.8241627402603626, "num_tokens": 416052062.0, "step": 13035 }, { "entropy": 0.6200011745095253, "epoch": 1.1993778069131287, "grad_norm": 0.15605860948562622, "learning_rate": 6.002392124390469e-05, "loss": 0.5873, "mean_token_accuracy": 0.8201241306960583, "num_tokens": 416083978.0, "step": 13036 }, { "entropy": 0.780923081561923, "epoch": 1.19946981328457, "grad_norm": 0.1712142825126648, "learning_rate": 6.002085441776306e-05, "loss": 0.7676, "mean_token_accuracy": 0.7683721370995045, "num_tokens": 416116296.0, "step": 13037 }, { "entropy": 0.5971446130424738, "epoch": 1.1995618196560112, "grad_norm": 0.15581689774990082, "learning_rate": 6.0017787591621435e-05, "loss": 0.5903, "mean_token_accuracy": 0.8223257698118687, "num_tokens": 416148293.0, "step": 13038 }, { "entropy": 0.585293160751462, "epoch": 1.1996538260274523, "grad_norm": 0.15093782544136047, "learning_rate": 6.00147207654798e-05, "loss": 0.5627, "mean_token_accuracy": 0.8243624344468117, "num_tokens": 416179624.0, "step": 13039 }, { "entropy": 0.6821936741471291, "epoch": 1.1997458323988937, "grad_norm": 0.15975630283355713, "learning_rate": 6.0011653939338185e-05, "loss": 0.652, "mean_token_accuracy": 0.8044241145253181, "num_tokens": 416211621.0, "step": 13040 }, { "entropy": 0.5972270015627146, "epoch": 1.1998378387703348, "grad_norm": 0.16343489289283752, "learning_rate": 6.000858711319656e-05, "loss": 0.5837, "mean_token_accuracy": 0.8217406161129475, "num_tokens": 416244172.0, "step": 13041 }, { "entropy": 0.6135218366980553, "epoch": 1.1999298451417761, "grad_norm": 0.17141760885715485, "learning_rate": 6.000552028705493e-05, "loss": 0.6062, "mean_token_accuracy": 0.8165040202438831, "num_tokens": 416276375.0, "step": 13042 }, { "entropy": 0.7249039113521576, "epoch": 1.2000218515132173, "grad_norm": 0.1679985523223877, "learning_rate": 6.00024534609133e-05, "loss": 0.7264, "mean_token_accuracy": 0.778686385601759, "num_tokens": 416308682.0, "step": 13043 }, { "entropy": 0.5981201231479645, "epoch": 1.2001138578846584, "grad_norm": 0.16005094349384308, "learning_rate": 5.999938663477168e-05, "loss": 0.5882, "mean_token_accuracy": 0.8155602775514126, "num_tokens": 416340670.0, "step": 13044 }, { "entropy": 0.6112986002117395, "epoch": 1.2002058642560998, "grad_norm": 0.1578228920698166, "learning_rate": 5.999631980863005e-05, "loss": 0.6139, "mean_token_accuracy": 0.8118961714208126, "num_tokens": 416372559.0, "step": 13045 }, { "entropy": 0.5449804961681366, "epoch": 1.200297870627541, "grad_norm": 0.16628816723823547, "learning_rate": 5.9993252982488426e-05, "loss": 0.5174, "mean_token_accuracy": 0.8462403155863285, "num_tokens": 416404689.0, "step": 13046 }, { "entropy": 0.5885756397619843, "epoch": 1.2003898769989823, "grad_norm": 0.15005575120449066, "learning_rate": 5.9990186156346794e-05, "loss": 0.5691, "mean_token_accuracy": 0.8245609775185585, "num_tokens": 416437036.0, "step": 13047 }, { "entropy": 0.6448211232200265, "epoch": 1.2004818833704234, "grad_norm": 0.16171927750110626, "learning_rate": 5.9987119330205175e-05, "loss": 0.6533, "mean_token_accuracy": 0.8031815588474274, "num_tokens": 416468984.0, "step": 13048 }, { "entropy": 0.596752991899848, "epoch": 1.2005738897418645, "grad_norm": 0.165516197681427, "learning_rate": 5.998405250406355e-05, "loss": 0.5912, "mean_token_accuracy": 0.8196251913905144, "num_tokens": 416501475.0, "step": 13049 }, { "entropy": 0.6446545775979757, "epoch": 1.2006658961133059, "grad_norm": 0.15637964010238647, "learning_rate": 5.998098567792192e-05, "loss": 0.6324, "mean_token_accuracy": 0.8092103265225887, "num_tokens": 416533159.0, "step": 13050 }, { "entropy": 0.5756786717101932, "epoch": 1.200757902484747, "grad_norm": 0.1502281129360199, "learning_rate": 5.997791885178029e-05, "loss": 0.559, "mean_token_accuracy": 0.8283563777804375, "num_tokens": 416565371.0, "step": 13051 }, { "entropy": 0.6191781722009182, "epoch": 1.2008499088561884, "grad_norm": 0.1534678190946579, "learning_rate": 5.9974852025638674e-05, "loss": 0.6019, "mean_token_accuracy": 0.8105527497828007, "num_tokens": 416597246.0, "step": 13052 }, { "entropy": 0.6787472246214747, "epoch": 1.2009419152276295, "grad_norm": 0.15239636600017548, "learning_rate": 5.997178519949704e-05, "loss": 0.658, "mean_token_accuracy": 0.7987881079316139, "num_tokens": 416628701.0, "step": 13053 }, { "entropy": 0.7060671411454678, "epoch": 1.2010339215990706, "grad_norm": 0.15692664682865143, "learning_rate": 5.9968718373355416e-05, "loss": 0.6754, "mean_token_accuracy": 0.7938053980469704, "num_tokens": 416660860.0, "step": 13054 }, { "entropy": 0.6640402004122734, "epoch": 1.201125927970512, "grad_norm": 0.16413982212543488, "learning_rate": 5.9965651547213784e-05, "loss": 0.6602, "mean_token_accuracy": 0.8016851842403412, "num_tokens": 416692554.0, "step": 13055 }, { "entropy": 0.6695271041244268, "epoch": 1.2012179343419531, "grad_norm": 0.15800701081752777, "learning_rate": 5.9962584721072165e-05, "loss": 0.6504, "mean_token_accuracy": 0.7998920567333698, "num_tokens": 416724988.0, "step": 13056 }, { "entropy": 0.6623428091406822, "epoch": 1.2013099407133945, "grad_norm": 0.15953543782234192, "learning_rate": 5.995951789493054e-05, "loss": 0.6327, "mean_token_accuracy": 0.8050685673952103, "num_tokens": 416757089.0, "step": 13057 }, { "entropy": 0.5610321583226323, "epoch": 1.2014019470848356, "grad_norm": 0.1519128531217575, "learning_rate": 5.995645106878891e-05, "loss": 0.5492, "mean_token_accuracy": 0.8318494111299515, "num_tokens": 416789054.0, "step": 13058 }, { "entropy": 0.7393439337611198, "epoch": 1.2014939534562767, "grad_norm": 0.16864150762557983, "learning_rate": 5.995338424264729e-05, "loss": 0.7429, "mean_token_accuracy": 0.7747665084898472, "num_tokens": 416819818.0, "step": 13059 }, { "entropy": 0.6477660369127989, "epoch": 1.201585959827718, "grad_norm": 0.1624513864517212, "learning_rate": 5.9950317416505664e-05, "loss": 0.6263, "mean_token_accuracy": 0.805779404938221, "num_tokens": 416851335.0, "step": 13060 }, { "entropy": 0.6810052879154682, "epoch": 1.2016779661991592, "grad_norm": 0.1598825454711914, "learning_rate": 5.994725059036403e-05, "loss": 0.6679, "mean_token_accuracy": 0.7951637990772724, "num_tokens": 416883547.0, "step": 13061 }, { "entropy": 0.5024714269675314, "epoch": 1.2017699725706006, "grad_norm": 0.15066565573215485, "learning_rate": 5.9944183764222407e-05, "loss": 0.494, "mean_token_accuracy": 0.8478314653038979, "num_tokens": 416916064.0, "step": 13062 }, { "entropy": 0.688546996563673, "epoch": 1.2018619789420417, "grad_norm": 0.16151192784309387, "learning_rate": 5.994111693808079e-05, "loss": 0.6878, "mean_token_accuracy": 0.79188646748662, "num_tokens": 416948114.0, "step": 13063 }, { "entropy": 0.6685505770146847, "epoch": 1.2019539853134829, "grad_norm": 0.16030554473400116, "learning_rate": 5.9938050111939156e-05, "loss": 0.6708, "mean_token_accuracy": 0.7989250384271145, "num_tokens": 416980245.0, "step": 13064 }, { "entropy": 0.6248587593436241, "epoch": 1.2020459916849242, "grad_norm": 0.16989301145076752, "learning_rate": 5.993498328579753e-05, "loss": 0.6203, "mean_token_accuracy": 0.8118893466889858, "num_tokens": 417013013.0, "step": 13065 }, { "entropy": 0.5620099706575274, "epoch": 1.2021379980563653, "grad_norm": 0.15042123198509216, "learning_rate": 5.99319164596559e-05, "loss": 0.5508, "mean_token_accuracy": 0.8276017047464848, "num_tokens": 417044875.0, "step": 13066 }, { "entropy": 0.6327706314623356, "epoch": 1.2022300044278067, "grad_norm": 0.15852420032024384, "learning_rate": 5.9928849633514287e-05, "loss": 0.6233, "mean_token_accuracy": 0.8049004264175892, "num_tokens": 417076132.0, "step": 13067 }, { "entropy": 0.5271862936206162, "epoch": 1.2023220107992478, "grad_norm": 0.15647000074386597, "learning_rate": 5.9925782807372654e-05, "loss": 0.5176, "mean_token_accuracy": 0.8389548510313034, "num_tokens": 417108401.0, "step": 13068 }, { "entropy": 0.5281755165196955, "epoch": 1.202414017170689, "grad_norm": 0.15575921535491943, "learning_rate": 5.992271598123103e-05, "loss": 0.5159, "mean_token_accuracy": 0.8438719026744366, "num_tokens": 417140821.0, "step": 13069 }, { "entropy": 0.5119760571978986, "epoch": 1.2025060235421303, "grad_norm": 0.1571093052625656, "learning_rate": 5.99196491550894e-05, "loss": 0.5165, "mean_token_accuracy": 0.8428016379475594, "num_tokens": 417173223.0, "step": 13070 }, { "entropy": 0.5582075212150812, "epoch": 1.2025980299135715, "grad_norm": 0.15184567868709564, "learning_rate": 5.991658232894778e-05, "loss": 0.5607, "mean_token_accuracy": 0.8269798457622528, "num_tokens": 417205637.0, "step": 13071 }, { "entropy": 0.7545397281646729, "epoch": 1.2026900362850128, "grad_norm": 0.17350968718528748, "learning_rate": 5.991351550280615e-05, "loss": 0.7554, "mean_token_accuracy": 0.7714822739362717, "num_tokens": 417237252.0, "step": 13072 }, { "entropy": 0.7508737705647945, "epoch": 1.202782042656454, "grad_norm": 0.17599104344844818, "learning_rate": 5.991044867666452e-05, "loss": 0.7468, "mean_token_accuracy": 0.7762726806104183, "num_tokens": 417268587.0, "step": 13073 }, { "entropy": 0.5915879029780626, "epoch": 1.202874049027895, "grad_norm": 0.15614014863967896, "learning_rate": 5.9907381850522896e-05, "loss": 0.5811, "mean_token_accuracy": 0.8259908966720104, "num_tokens": 417300671.0, "step": 13074 }, { "entropy": 0.5367394760251045, "epoch": 1.2029660553993364, "grad_norm": 0.1457509696483612, "learning_rate": 5.990431502438128e-05, "loss": 0.5327, "mean_token_accuracy": 0.8388849496841431, "num_tokens": 417332736.0, "step": 13075 }, { "entropy": 0.623305331915617, "epoch": 1.2030580617707776, "grad_norm": 0.16302768886089325, "learning_rate": 5.9901248198239645e-05, "loss": 0.6082, "mean_token_accuracy": 0.8165913559496403, "num_tokens": 417365504.0, "step": 13076 }, { "entropy": 0.6208368628285825, "epoch": 1.203150068142219, "grad_norm": 0.15475411713123322, "learning_rate": 5.989818137209802e-05, "loss": 0.6032, "mean_token_accuracy": 0.8149573653936386, "num_tokens": 417397274.0, "step": 13077 }, { "entropy": 0.6887991279363632, "epoch": 1.20324207451366, "grad_norm": 0.1625126749277115, "learning_rate": 5.989511454595639e-05, "loss": 0.6759, "mean_token_accuracy": 0.7968224734067917, "num_tokens": 417429477.0, "step": 13078 }, { "entropy": 0.5465079648420215, "epoch": 1.2033340808851012, "grad_norm": 0.14786958694458008, "learning_rate": 5.989204771981477e-05, "loss": 0.5298, "mean_token_accuracy": 0.8412254452705383, "num_tokens": 417462195.0, "step": 13079 }, { "entropy": 0.6721578305587173, "epoch": 1.2034260872565425, "grad_norm": 0.16892589628696442, "learning_rate": 5.9888980893673143e-05, "loss": 0.6517, "mean_token_accuracy": 0.800596222281456, "num_tokens": 417494490.0, "step": 13080 }, { "entropy": 0.5193083323538303, "epoch": 1.2035180936279837, "grad_norm": 0.149741530418396, "learning_rate": 5.988591406753151e-05, "loss": 0.4979, "mean_token_accuracy": 0.8465625569224358, "num_tokens": 417526462.0, "step": 13081 }, { "entropy": 0.7250908724963665, "epoch": 1.203610099999425, "grad_norm": 0.16351507604122162, "learning_rate": 5.9882847241389886e-05, "loss": 0.71, "mean_token_accuracy": 0.7879924550652504, "num_tokens": 417558904.0, "step": 13082 }, { "entropy": 0.6176714599132538, "epoch": 1.2037021063708662, "grad_norm": 0.15854254364967346, "learning_rate": 5.987978041524827e-05, "loss": 0.6047, "mean_token_accuracy": 0.8166135922074318, "num_tokens": 417590198.0, "step": 13083 }, { "entropy": 0.7308749295771122, "epoch": 1.2037941127423073, "grad_norm": 0.16058477759361267, "learning_rate": 5.9876713589106635e-05, "loss": 0.7152, "mean_token_accuracy": 0.7858859673142433, "num_tokens": 417621551.0, "step": 13084 }, { "entropy": 0.6275713755749166, "epoch": 1.2038861191137487, "grad_norm": 0.1582873910665512, "learning_rate": 5.987364676296501e-05, "loss": 0.6134, "mean_token_accuracy": 0.8091071136295795, "num_tokens": 417652974.0, "step": 13085 }, { "entropy": 0.7231127433478832, "epoch": 1.2039781254851898, "grad_norm": 0.17213678359985352, "learning_rate": 5.987057993682338e-05, "loss": 0.722, "mean_token_accuracy": 0.7874291613698006, "num_tokens": 417684123.0, "step": 13086 }, { "entropy": 0.7487799450755119, "epoch": 1.2040701318566311, "grad_norm": 0.17559406161308289, "learning_rate": 5.986751311068176e-05, "loss": 0.7538, "mean_token_accuracy": 0.7727548256516457, "num_tokens": 417714737.0, "step": 13087 }, { "entropy": 0.660110654309392, "epoch": 1.2041621382280723, "grad_norm": 0.16147683560848236, "learning_rate": 5.9864446284540134e-05, "loss": 0.6556, "mean_token_accuracy": 0.8001503981649876, "num_tokens": 417747217.0, "step": 13088 }, { "entropy": 0.6091721314005554, "epoch": 1.2042541445995134, "grad_norm": 0.15969803929328918, "learning_rate": 5.98613794583985e-05, "loss": 0.5931, "mean_token_accuracy": 0.8209819160401821, "num_tokens": 417779087.0, "step": 13089 }, { "entropy": 0.6081715244799852, "epoch": 1.2043461509709548, "grad_norm": 0.15693315863609314, "learning_rate": 5.985831263225688e-05, "loss": 0.5969, "mean_token_accuracy": 0.8159861862659454, "num_tokens": 417811231.0, "step": 13090 }, { "entropy": 0.5634792316704988, "epoch": 1.204438157342396, "grad_norm": 0.16645294427871704, "learning_rate": 5.985524580611526e-05, "loss": 0.5643, "mean_token_accuracy": 0.8276128396391869, "num_tokens": 417843381.0, "step": 13091 }, { "entropy": 0.56101318821311, "epoch": 1.2045301637138373, "grad_norm": 0.15301276743412018, "learning_rate": 5.9852178979973626e-05, "loss": 0.5567, "mean_token_accuracy": 0.8297299891710281, "num_tokens": 417875168.0, "step": 13092 }, { "entropy": 0.6568753328174353, "epoch": 1.2046221700852784, "grad_norm": 0.16681376099586487, "learning_rate": 5.9849112153832e-05, "loss": 0.6438, "mean_token_accuracy": 0.804804153740406, "num_tokens": 417906282.0, "step": 13093 }, { "entropy": 0.5852841213345528, "epoch": 1.2047141764567195, "grad_norm": 0.15899331867694855, "learning_rate": 5.984604532769038e-05, "loss": 0.5742, "mean_token_accuracy": 0.8202630393207073, "num_tokens": 417937722.0, "step": 13094 }, { "entropy": 0.5972239701077342, "epoch": 1.2048061828281609, "grad_norm": 0.1582976132631302, "learning_rate": 5.984297850154875e-05, "loss": 0.5807, "mean_token_accuracy": 0.823598712682724, "num_tokens": 417970488.0, "step": 13095 }, { "entropy": 0.5944761876016855, "epoch": 1.204898189199602, "grad_norm": 0.1553552895784378, "learning_rate": 5.9839911675407124e-05, "loss": 0.5779, "mean_token_accuracy": 0.8202619552612305, "num_tokens": 418003116.0, "step": 13096 }, { "entropy": 0.6459754481911659, "epoch": 1.2049901955710434, "grad_norm": 0.15979954600334167, "learning_rate": 5.983684484926549e-05, "loss": 0.6303, "mean_token_accuracy": 0.8100377023220062, "num_tokens": 418035554.0, "step": 13097 }, { "entropy": 0.6333734886720777, "epoch": 1.2050822019424845, "grad_norm": 0.162678524851799, "learning_rate": 5.9833778023123874e-05, "loss": 0.6142, "mean_token_accuracy": 0.8106794208288193, "num_tokens": 418067504.0, "step": 13098 }, { "entropy": 0.7060635285452008, "epoch": 1.2051742083139256, "grad_norm": 0.15542009472846985, "learning_rate": 5.983071119698225e-05, "loss": 0.6828, "mean_token_accuracy": 0.7953747250139713, "num_tokens": 418099572.0, "step": 13099 }, { "entropy": 0.6663775537163019, "epoch": 1.205266214685367, "grad_norm": 0.16628192365169525, "learning_rate": 5.9827644370840616e-05, "loss": 0.6529, "mean_token_accuracy": 0.8012927360832691, "num_tokens": 418131454.0, "step": 13100 }, { "entropy": 0.6782145984470844, "epoch": 1.2053582210568081, "grad_norm": 0.16178931295871735, "learning_rate": 5.982457754469899e-05, "loss": 0.6736, "mean_token_accuracy": 0.7949395179748535, "num_tokens": 418163682.0, "step": 13101 }, { "entropy": 0.4830636531114578, "epoch": 1.2054502274282495, "grad_norm": 0.16171038150787354, "learning_rate": 5.982151071855737e-05, "loss": 0.4642, "mean_token_accuracy": 0.8538331761956215, "num_tokens": 418196127.0, "step": 13102 }, { "entropy": 0.6658601588569582, "epoch": 1.2055422337996906, "grad_norm": 0.16121065616607666, "learning_rate": 5.981844389241574e-05, "loss": 0.6406, "mean_token_accuracy": 0.8073973543941975, "num_tokens": 418227754.0, "step": 13103 }, { "entropy": 0.6698483880609274, "epoch": 1.2056342401711317, "grad_norm": 0.1608714908361435, "learning_rate": 5.9815377066274115e-05, "loss": 0.6615, "mean_token_accuracy": 0.8007297180593014, "num_tokens": 418259396.0, "step": 13104 }, { "entropy": 0.60167545825243, "epoch": 1.205726246542573, "grad_norm": 0.15650604665279388, "learning_rate": 5.981231024013248e-05, "loss": 0.596, "mean_token_accuracy": 0.8215013705193996, "num_tokens": 418290772.0, "step": 13105 }, { "entropy": 0.5868304669857025, "epoch": 1.2058182529140142, "grad_norm": 0.16162465512752533, "learning_rate": 5.980924341399087e-05, "loss": 0.581, "mean_token_accuracy": 0.823226910084486, "num_tokens": 418322692.0, "step": 13106 }, { "entropy": 0.6229428080841899, "epoch": 1.2059102592854556, "grad_norm": 0.161623015999794, "learning_rate": 5.980617658784924e-05, "loss": 0.6157, "mean_token_accuracy": 0.811893817037344, "num_tokens": 418355220.0, "step": 13107 }, { "entropy": 0.631968361325562, "epoch": 1.2060022656568967, "grad_norm": 0.16255250573158264, "learning_rate": 5.9803109761707606e-05, "loss": 0.6185, "mean_token_accuracy": 0.8139911890029907, "num_tokens": 418387535.0, "step": 13108 }, { "entropy": 0.636125510558486, "epoch": 1.2060942720283379, "grad_norm": 0.15837161242961884, "learning_rate": 5.980004293556598e-05, "loss": 0.6165, "mean_token_accuracy": 0.8129058107733727, "num_tokens": 418419712.0, "step": 13109 }, { "entropy": 0.6087225396186113, "epoch": 1.2061862783997792, "grad_norm": 0.15673337876796722, "learning_rate": 5.979697610942436e-05, "loss": 0.6095, "mean_token_accuracy": 0.8136234953999519, "num_tokens": 418452073.0, "step": 13110 }, { "entropy": 0.6492832293733954, "epoch": 1.2062782847712203, "grad_norm": 0.1652195006608963, "learning_rate": 5.979390928328274e-05, "loss": 0.6437, "mean_token_accuracy": 0.8031660318374634, "num_tokens": 418484482.0, "step": 13111 }, { "entropy": 0.6306798998266459, "epoch": 1.2063702911426617, "grad_norm": 0.15662643313407898, "learning_rate": 5.9790842457141105e-05, "loss": 0.6168, "mean_token_accuracy": 0.8107193969190121, "num_tokens": 418516413.0, "step": 13112 }, { "entropy": 0.6813495475798845, "epoch": 1.2064622975141028, "grad_norm": 0.16090594232082367, "learning_rate": 5.978777563099948e-05, "loss": 0.6724, "mean_token_accuracy": 0.7922053635120392, "num_tokens": 418547955.0, "step": 13113 }, { "entropy": 0.5972009934484959, "epoch": 1.206554303885544, "grad_norm": 0.1505705565214157, "learning_rate": 5.978470880485786e-05, "loss": 0.5858, "mean_token_accuracy": 0.8222817927598953, "num_tokens": 418580312.0, "step": 13114 }, { "entropy": 0.6117472760379314, "epoch": 1.2066463102569853, "grad_norm": 0.15710972249507904, "learning_rate": 5.978164197871623e-05, "loss": 0.6025, "mean_token_accuracy": 0.8162397108972073, "num_tokens": 418612802.0, "step": 13115 }, { "entropy": 0.552031728439033, "epoch": 1.2067383166284265, "grad_norm": 0.15427550673484802, "learning_rate": 5.9778575152574604e-05, "loss": 0.5367, "mean_token_accuracy": 0.83394780382514, "num_tokens": 418644657.0, "step": 13116 }, { "entropy": 0.6701981835067272, "epoch": 1.2068303229998678, "grad_norm": 0.16571323573589325, "learning_rate": 5.977550832643297e-05, "loss": 0.6539, "mean_token_accuracy": 0.80174845084548, "num_tokens": 418676238.0, "step": 13117 }, { "entropy": 0.6613078825175762, "epoch": 1.206922329371309, "grad_norm": 0.15801458060741425, "learning_rate": 5.977244150029135e-05, "loss": 0.6497, "mean_token_accuracy": 0.8020570911467075, "num_tokens": 418708330.0, "step": 13118 }, { "entropy": 0.5330276535823941, "epoch": 1.20701433574275, "grad_norm": 0.15914183855056763, "learning_rate": 5.976937467414973e-05, "loss": 0.5246, "mean_token_accuracy": 0.8397204801440239, "num_tokens": 418740819.0, "step": 13119 }, { "entropy": 0.5191608141176403, "epoch": 1.2071063421141914, "grad_norm": 0.14689156413078308, "learning_rate": 5.9766307848008095e-05, "loss": 0.4975, "mean_token_accuracy": 0.8463682532310486, "num_tokens": 418773223.0, "step": 13120 }, { "entropy": 0.5385568495839834, "epoch": 1.2071983484856326, "grad_norm": 0.1587272584438324, "learning_rate": 5.976324102186648e-05, "loss": 0.5293, "mean_token_accuracy": 0.8369233533740044, "num_tokens": 418804845.0, "step": 13121 }, { "entropy": 0.6722131948918104, "epoch": 1.207290354857074, "grad_norm": 0.16234353184700012, "learning_rate": 5.976017419572485e-05, "loss": 0.6671, "mean_token_accuracy": 0.7957969680428505, "num_tokens": 418836788.0, "step": 13122 }, { "entropy": 0.5006232541054487, "epoch": 1.207382361228515, "grad_norm": 0.15010125935077667, "learning_rate": 5.975710736958322e-05, "loss": 0.4993, "mean_token_accuracy": 0.8475238271057606, "num_tokens": 418868993.0, "step": 13123 }, { "entropy": 0.6865468416363001, "epoch": 1.2074743675999562, "grad_norm": 0.16745220124721527, "learning_rate": 5.9754040543441594e-05, "loss": 0.6731, "mean_token_accuracy": 0.7963152639567852, "num_tokens": 418901206.0, "step": 13124 }, { "entropy": 0.6356700304895639, "epoch": 1.2075663739713975, "grad_norm": 0.16255518794059753, "learning_rate": 5.9750973717299975e-05, "loss": 0.623, "mean_token_accuracy": 0.8104881532490253, "num_tokens": 418933341.0, "step": 13125 }, { "entropy": 0.6473942832089961, "epoch": 1.2076583803428387, "grad_norm": 0.16581399738788605, "learning_rate": 5.974790689115834e-05, "loss": 0.6324, "mean_token_accuracy": 0.8042908161878586, "num_tokens": 418964819.0, "step": 13126 }, { "entropy": 0.5330698247998953, "epoch": 1.20775038671428, "grad_norm": 0.1471177041530609, "learning_rate": 5.974484006501672e-05, "loss": 0.5151, "mean_token_accuracy": 0.8353292532265186, "num_tokens": 418996896.0, "step": 13127 }, { "entropy": 0.6411269661039114, "epoch": 1.2078423930857212, "grad_norm": 0.1592719852924347, "learning_rate": 5.9741773238875086e-05, "loss": 0.6415, "mean_token_accuracy": 0.8082250021398067, "num_tokens": 419029014.0, "step": 13128 }, { "entropy": 0.5957448156550527, "epoch": 1.2079343994571623, "grad_norm": 0.15885396301746368, "learning_rate": 5.973870641273347e-05, "loss": 0.5829, "mean_token_accuracy": 0.8242083750665188, "num_tokens": 419060550.0, "step": 13129 }, { "entropy": 0.6489674113690853, "epoch": 1.2080264058286037, "grad_norm": 0.16194912791252136, "learning_rate": 5.973563958659184e-05, "loss": 0.6215, "mean_token_accuracy": 0.8085448369383812, "num_tokens": 419092523.0, "step": 13130 }, { "entropy": 0.6992375236004591, "epoch": 1.2081184122000448, "grad_norm": 0.1658024936914444, "learning_rate": 5.973257276045021e-05, "loss": 0.685, "mean_token_accuracy": 0.7920464314520359, "num_tokens": 419124614.0, "step": 13131 }, { "entropy": 0.6435550637543201, "epoch": 1.2082104185714861, "grad_norm": 0.15352317690849304, "learning_rate": 5.9729505934308584e-05, "loss": 0.6307, "mean_token_accuracy": 0.8087445050477982, "num_tokens": 419157382.0, "step": 13132 }, { "entropy": 0.6043731011450291, "epoch": 1.2083024249429273, "grad_norm": 0.15727946162223816, "learning_rate": 5.9726439108166966e-05, "loss": 0.5862, "mean_token_accuracy": 0.8186298310756683, "num_tokens": 419189409.0, "step": 13133 }, { "entropy": 0.5368176102638245, "epoch": 1.2083944313143684, "grad_norm": 0.15075229108333588, "learning_rate": 5.9723372282025334e-05, "loss": 0.5077, "mean_token_accuracy": 0.8420897796750069, "num_tokens": 419221855.0, "step": 13134 }, { "entropy": 0.6630297787487507, "epoch": 1.2084864376858098, "grad_norm": 0.1603853702545166, "learning_rate": 5.972030545588371e-05, "loss": 0.6371, "mean_token_accuracy": 0.8008332177996635, "num_tokens": 419253351.0, "step": 13135 }, { "entropy": 0.6657328065484762, "epoch": 1.208578444057251, "grad_norm": 0.15949048101902008, "learning_rate": 5.9717238629742076e-05, "loss": 0.6569, "mean_token_accuracy": 0.8032860308885574, "num_tokens": 419284274.0, "step": 13136 }, { "entropy": 0.6224249973893166, "epoch": 1.2086704504286923, "grad_norm": 0.1591549813747406, "learning_rate": 5.971417180360046e-05, "loss": 0.5983, "mean_token_accuracy": 0.8144010715186596, "num_tokens": 419316347.0, "step": 13137 }, { "entropy": 0.5499319527298212, "epoch": 1.2087624568001334, "grad_norm": 0.14890260994434357, "learning_rate": 5.971110497745883e-05, "loss": 0.5314, "mean_token_accuracy": 0.8347436599433422, "num_tokens": 419348751.0, "step": 13138 }, { "entropy": 0.5938344839960337, "epoch": 1.2088544631715745, "grad_norm": 0.15981389582157135, "learning_rate": 5.97080381513172e-05, "loss": 0.5982, "mean_token_accuracy": 0.8153700456023216, "num_tokens": 419381519.0, "step": 13139 }, { "entropy": 0.608480763155967, "epoch": 1.2089464695430159, "grad_norm": 0.17269013822078705, "learning_rate": 5.9704971325175575e-05, "loss": 0.6106, "mean_token_accuracy": 0.8159881681203842, "num_tokens": 419412932.0, "step": 13140 }, { "entropy": 0.6091998512856662, "epoch": 1.209038475914457, "grad_norm": 0.15953688323497772, "learning_rate": 5.9701904499033956e-05, "loss": 0.6103, "mean_token_accuracy": 0.8091586530208588, "num_tokens": 419445355.0, "step": 13141 }, { "entropy": 0.5396599248051643, "epoch": 1.2091304822858984, "grad_norm": 0.15257325768470764, "learning_rate": 5.9698837672892324e-05, "loss": 0.5286, "mean_token_accuracy": 0.8359788544476032, "num_tokens": 419476827.0, "step": 13142 }, { "entropy": 0.6095498017966747, "epoch": 1.2092224886573395, "grad_norm": 0.16600647568702698, "learning_rate": 5.96957708467507e-05, "loss": 0.5981, "mean_token_accuracy": 0.8077440857887268, "num_tokens": 419508446.0, "step": 13143 }, { "entropy": 0.5441438062116504, "epoch": 1.2093144950287806, "grad_norm": 0.16232797503471375, "learning_rate": 5.969270402060907e-05, "loss": 0.5326, "mean_token_accuracy": 0.8381537161767483, "num_tokens": 419539637.0, "step": 13144 }, { "entropy": 0.5281860725954175, "epoch": 1.209406501400222, "grad_norm": 0.1536368429660797, "learning_rate": 5.9689637194467455e-05, "loss": 0.5325, "mean_token_accuracy": 0.8371071554720402, "num_tokens": 419571936.0, "step": 13145 }, { "entropy": 0.6750898659229279, "epoch": 1.2094985077716631, "grad_norm": 0.17552302777767181, "learning_rate": 5.968657036832582e-05, "loss": 0.6598, "mean_token_accuracy": 0.7996794916689396, "num_tokens": 419603072.0, "step": 13146 }, { "entropy": 0.5616124616935849, "epoch": 1.2095905141431045, "grad_norm": 0.15635329484939575, "learning_rate": 5.968350354218419e-05, "loss": 0.546, "mean_token_accuracy": 0.8317404873669147, "num_tokens": 419635663.0, "step": 13147 }, { "entropy": 0.8008070606738329, "epoch": 1.2096825205145456, "grad_norm": 0.16728059947490692, "learning_rate": 5.968043671604258e-05, "loss": 0.7814, "mean_token_accuracy": 0.7668768912553787, "num_tokens": 419667416.0, "step": 13148 }, { "entropy": 0.5894123110920191, "epoch": 1.2097745268859867, "grad_norm": 0.15319043397903442, "learning_rate": 5.967736988990095e-05, "loss": 0.5675, "mean_token_accuracy": 0.8264666870236397, "num_tokens": 419699534.0, "step": 13149 }, { "entropy": 0.6921615414321423, "epoch": 1.209866533257428, "grad_norm": 0.16260379552841187, "learning_rate": 5.967430306375932e-05, "loss": 0.6793, "mean_token_accuracy": 0.7930688709020615, "num_tokens": 419731468.0, "step": 13150 }, { "entropy": 0.6317856265231967, "epoch": 1.2099585396288692, "grad_norm": 0.16068755090236664, "learning_rate": 5.967123623761769e-05, "loss": 0.6169, "mean_token_accuracy": 0.8085537627339363, "num_tokens": 419763327.0, "step": 13151 }, { "entropy": 0.4640753131825477, "epoch": 1.2100505460003106, "grad_norm": 0.14517125487327576, "learning_rate": 5.966816941147607e-05, "loss": 0.4484, "mean_token_accuracy": 0.8630923293530941, "num_tokens": 419796095.0, "step": 13152 }, { "entropy": 0.6687251450493932, "epoch": 1.2101425523717517, "grad_norm": 0.15870478749275208, "learning_rate": 5.9665102585334445e-05, "loss": 0.658, "mean_token_accuracy": 0.8002379909157753, "num_tokens": 419828214.0, "step": 13153 }, { "entropy": 0.6557367062196136, "epoch": 1.2102345587431929, "grad_norm": 0.15799404680728912, "learning_rate": 5.966203575919281e-05, "loss": 0.6461, "mean_token_accuracy": 0.8031837232410908, "num_tokens": 419860529.0, "step": 13154 }, { "entropy": 0.7007526494562626, "epoch": 1.2103265651146342, "grad_norm": 0.15655775368213654, "learning_rate": 5.965896893305119e-05, "loss": 0.6791, "mean_token_accuracy": 0.7904522567987442, "num_tokens": 419892821.0, "step": 13155 }, { "entropy": 0.5189750827848911, "epoch": 1.2104185714860753, "grad_norm": 0.16523636877536774, "learning_rate": 5.965590210690957e-05, "loss": 0.5134, "mean_token_accuracy": 0.843421820551157, "num_tokens": 419925050.0, "step": 13156 }, { "entropy": 0.495705708861351, "epoch": 1.2105105778575167, "grad_norm": 0.1454704850912094, "learning_rate": 5.965283528076794e-05, "loss": 0.4762, "mean_token_accuracy": 0.8529044091701508, "num_tokens": 419957130.0, "step": 13157 }, { "entropy": 0.6107633970677853, "epoch": 1.2106025842289578, "grad_norm": 0.16592176258563995, "learning_rate": 5.964976845462631e-05, "loss": 0.6007, "mean_token_accuracy": 0.8127967268228531, "num_tokens": 419988173.0, "step": 13158 }, { "entropy": 0.6614165939390659, "epoch": 1.210694590600399, "grad_norm": 0.16310779750347137, "learning_rate": 5.964670162848468e-05, "loss": 0.6437, "mean_token_accuracy": 0.8059839643537998, "num_tokens": 420019590.0, "step": 13159 }, { "entropy": 0.6659792228601873, "epoch": 1.2107865969718403, "grad_norm": 0.16182632744312286, "learning_rate": 5.964363480234306e-05, "loss": 0.6543, "mean_token_accuracy": 0.8005308844149113, "num_tokens": 420052206.0, "step": 13160 }, { "entropy": 0.5891882958821952, "epoch": 1.2108786033432815, "grad_norm": 0.15923456847667694, "learning_rate": 5.9640567976201436e-05, "loss": 0.5788, "mean_token_accuracy": 0.8227400444447994, "num_tokens": 420083710.0, "step": 13161 }, { "entropy": 0.6711738146841526, "epoch": 1.2109706097147228, "grad_norm": 0.15900318324565887, "learning_rate": 5.9637501150059804e-05, "loss": 0.6595, "mean_token_accuracy": 0.7946132980287075, "num_tokens": 420115671.0, "step": 13162 }, { "entropy": 0.5277845861855894, "epoch": 1.211062616086164, "grad_norm": 0.15055802464485168, "learning_rate": 5.963443432391818e-05, "loss": 0.5235, "mean_token_accuracy": 0.8387626260519028, "num_tokens": 420147685.0, "step": 13163 }, { "entropy": 0.5997943393886089, "epoch": 1.211154622457605, "grad_norm": 0.15726159512996674, "learning_rate": 5.963136749777656e-05, "loss": 0.5801, "mean_token_accuracy": 0.8219645619392395, "num_tokens": 420179475.0, "step": 13164 }, { "entropy": 0.604179747402668, "epoch": 1.2112466288290464, "grad_norm": 0.15921853482723236, "learning_rate": 5.962830067163493e-05, "loss": 0.6009, "mean_token_accuracy": 0.81578004732728, "num_tokens": 420211288.0, "step": 13165 }, { "entropy": 0.6161545189097524, "epoch": 1.2113386352004876, "grad_norm": 0.1591368317604065, "learning_rate": 5.96252338454933e-05, "loss": 0.6077, "mean_token_accuracy": 0.8154373839497566, "num_tokens": 420243075.0, "step": 13166 }, { "entropy": 0.6892130058258772, "epoch": 1.211430641571929, "grad_norm": 0.16130900382995605, "learning_rate": 5.962216701935167e-05, "loss": 0.6831, "mean_token_accuracy": 0.7928603477776051, "num_tokens": 420275160.0, "step": 13167 }, { "entropy": 0.6408870257437229, "epoch": 1.21152264794337, "grad_norm": 0.1560058742761612, "learning_rate": 5.961910019321005e-05, "loss": 0.6221, "mean_token_accuracy": 0.8095366954803467, "num_tokens": 420307583.0, "step": 13168 }, { "entropy": 0.5973208574578166, "epoch": 1.2116146543148112, "grad_norm": 0.15026362240314484, "learning_rate": 5.9616033367068426e-05, "loss": 0.5796, "mean_token_accuracy": 0.8198951296508312, "num_tokens": 420339859.0, "step": 13169 }, { "entropy": 0.5604884852655232, "epoch": 1.2117066606862525, "grad_norm": 0.15843282639980316, "learning_rate": 5.9612966540926794e-05, "loss": 0.5434, "mean_token_accuracy": 0.8286520093679428, "num_tokens": 420370860.0, "step": 13170 }, { "entropy": 0.6225533969700336, "epoch": 1.2117986670576937, "grad_norm": 0.16125939786434174, "learning_rate": 5.960989971478517e-05, "loss": 0.6297, "mean_token_accuracy": 0.8119363151490688, "num_tokens": 420402124.0, "step": 13171 }, { "entropy": 0.6353972051292658, "epoch": 1.211890673429135, "grad_norm": 0.16152624785900116, "learning_rate": 5.960683288864355e-05, "loss": 0.6346, "mean_token_accuracy": 0.8086857125163078, "num_tokens": 420434336.0, "step": 13172 }, { "entropy": 0.6990877315402031, "epoch": 1.2119826798005762, "grad_norm": 0.1614162176847458, "learning_rate": 5.960376606250192e-05, "loss": 0.6883, "mean_token_accuracy": 0.7884212993085384, "num_tokens": 420465254.0, "step": 13173 }, { "entropy": 0.545277604367584, "epoch": 1.2120746861720173, "grad_norm": 0.15011556446552277, "learning_rate": 5.960069923636029e-05, "loss": 0.5321, "mean_token_accuracy": 0.8352583721280098, "num_tokens": 420497337.0, "step": 13174 }, { "entropy": 0.6150883426889777, "epoch": 1.2121666925434587, "grad_norm": 0.1706770658493042, "learning_rate": 5.959763241021866e-05, "loss": 0.6025, "mean_token_accuracy": 0.8143964037299156, "num_tokens": 420529001.0, "step": 13175 }, { "entropy": 0.5865510310977697, "epoch": 1.2122586989148998, "grad_norm": 0.1594560444355011, "learning_rate": 5.959456558407704e-05, "loss": 0.5697, "mean_token_accuracy": 0.8226295411586761, "num_tokens": 420560835.0, "step": 13176 }, { "entropy": 0.5820660162717104, "epoch": 1.2123507052863411, "grad_norm": 0.1571420282125473, "learning_rate": 5.9591498757935416e-05, "loss": 0.581, "mean_token_accuracy": 0.823383629322052, "num_tokens": 420593111.0, "step": 13177 }, { "entropy": 0.5779969384893775, "epoch": 1.2124427116577823, "grad_norm": 0.16471336781978607, "learning_rate": 5.9588431931793784e-05, "loss": 0.5481, "mean_token_accuracy": 0.8337027840316296, "num_tokens": 420625866.0, "step": 13178 }, { "entropy": 0.570180376060307, "epoch": 1.2125347180292234, "grad_norm": 0.14994558691978455, "learning_rate": 5.9585365105652166e-05, "loss": 0.5527, "mean_token_accuracy": 0.8291242010891438, "num_tokens": 420657881.0, "step": 13179 }, { "entropy": 0.6189155261963606, "epoch": 1.2126267244006648, "grad_norm": 0.1533227264881134, "learning_rate": 5.958229827951054e-05, "loss": 0.5971, "mean_token_accuracy": 0.815012764185667, "num_tokens": 420689067.0, "step": 13180 }, { "entropy": 0.5355353699997067, "epoch": 1.212718730772106, "grad_norm": 0.1646324247121811, "learning_rate": 5.957923145336891e-05, "loss": 0.5277, "mean_token_accuracy": 0.8390000052750111, "num_tokens": 420721349.0, "step": 13181 }, { "entropy": 0.6885867659002542, "epoch": 1.2128107371435473, "grad_norm": 0.1551678627729416, "learning_rate": 5.957616462722728e-05, "loss": 0.6638, "mean_token_accuracy": 0.7974307276308537, "num_tokens": 420753302.0, "step": 13182 }, { "entropy": 0.5309297172352672, "epoch": 1.2129027435149884, "grad_norm": 0.14730092883110046, "learning_rate": 5.9573097801085664e-05, "loss": 0.5126, "mean_token_accuracy": 0.840465996414423, "num_tokens": 420784646.0, "step": 13183 }, { "entropy": 0.6721677668392658, "epoch": 1.2129947498864295, "grad_norm": 0.1633022278547287, "learning_rate": 5.957003097494403e-05, "loss": 0.6659, "mean_token_accuracy": 0.7973197139799595, "num_tokens": 420816889.0, "step": 13184 }, { "entropy": 0.6845377087593079, "epoch": 1.2130867562578709, "grad_norm": 0.1645459234714508, "learning_rate": 5.956696414880241e-05, "loss": 0.6742, "mean_token_accuracy": 0.792406789958477, "num_tokens": 420847867.0, "step": 13185 }, { "entropy": 0.6871895547956228, "epoch": 1.213178762629312, "grad_norm": 0.16293787956237793, "learning_rate": 5.9563897322660775e-05, "loss": 0.6788, "mean_token_accuracy": 0.7983747757971287, "num_tokens": 420879086.0, "step": 13186 }, { "entropy": 0.6728473398834467, "epoch": 1.2132707690007534, "grad_norm": 0.15618187189102173, "learning_rate": 5.956083049651916e-05, "loss": 0.6653, "mean_token_accuracy": 0.7997690550982952, "num_tokens": 420911367.0, "step": 13187 }, { "entropy": 0.66188869997859, "epoch": 1.2133627753721945, "grad_norm": 0.1577100306749344, "learning_rate": 5.955776367037753e-05, "loss": 0.6523, "mean_token_accuracy": 0.8025219701230526, "num_tokens": 420943085.0, "step": 13188 }, { "entropy": 0.7008387669920921, "epoch": 1.2134547817436356, "grad_norm": 0.16246075928211212, "learning_rate": 5.9554696844235905e-05, "loss": 0.6845, "mean_token_accuracy": 0.7880585081875324, "num_tokens": 420975392.0, "step": 13189 }, { "entropy": 0.6924092248082161, "epoch": 1.213546788115077, "grad_norm": 0.16932572424411774, "learning_rate": 5.955163001809427e-05, "loss": 0.6835, "mean_token_accuracy": 0.794053465127945, "num_tokens": 421006602.0, "step": 13190 }, { "entropy": 0.65396648645401, "epoch": 1.2136387944865181, "grad_norm": 0.16560587286949158, "learning_rate": 5.9548563191952655e-05, "loss": 0.6418, "mean_token_accuracy": 0.8013336211442947, "num_tokens": 421038421.0, "step": 13191 }, { "entropy": 0.6298087043687701, "epoch": 1.2137308008579595, "grad_norm": 0.1561332643032074, "learning_rate": 5.954549636581103e-05, "loss": 0.6261, "mean_token_accuracy": 0.8081695064902306, "num_tokens": 421070701.0, "step": 13192 }, { "entropy": 0.6009201379492879, "epoch": 1.2138228072294006, "grad_norm": 0.1654665470123291, "learning_rate": 5.95424295396694e-05, "loss": 0.5873, "mean_token_accuracy": 0.8188036419451237, "num_tokens": 421103195.0, "step": 13193 }, { "entropy": 0.5859109833836555, "epoch": 1.2139148136008417, "grad_norm": 0.15753674507141113, "learning_rate": 5.953936271352777e-05, "loss": 0.5822, "mean_token_accuracy": 0.8202537931501865, "num_tokens": 421135045.0, "step": 13194 }, { "entropy": 0.6098553761839867, "epoch": 1.214006819972283, "grad_norm": 0.1570158749818802, "learning_rate": 5.953629588738615e-05, "loss": 0.6072, "mean_token_accuracy": 0.8150880336761475, "num_tokens": 421166337.0, "step": 13195 }, { "entropy": 0.6207606662064791, "epoch": 1.2140988263437242, "grad_norm": 0.1558356136083603, "learning_rate": 5.953322906124452e-05, "loss": 0.6005, "mean_token_accuracy": 0.8126688487827778, "num_tokens": 421198112.0, "step": 13196 }, { "entropy": 0.7565501360222697, "epoch": 1.2141908327151656, "grad_norm": 0.17019186913967133, "learning_rate": 5.9530162235102896e-05, "loss": 0.7447, "mean_token_accuracy": 0.7801199518144131, "num_tokens": 421230506.0, "step": 13197 }, { "entropy": 0.8065432403236628, "epoch": 1.2142828390866067, "grad_norm": 0.16805680096149445, "learning_rate": 5.9527095408961264e-05, "loss": 0.7751, "mean_token_accuracy": 0.7643074430525303, "num_tokens": 421262659.0, "step": 13198 }, { "entropy": 0.566320457495749, "epoch": 1.2143748454580479, "grad_norm": 0.1570814698934555, "learning_rate": 5.9524028582819645e-05, "loss": 0.5545, "mean_token_accuracy": 0.8294464088976383, "num_tokens": 421294422.0, "step": 13199 }, { "entropy": 0.5337793417274952, "epoch": 1.2144668518294892, "grad_norm": 0.14923767745494843, "learning_rate": 5.952096175667802e-05, "loss": 0.5174, "mean_token_accuracy": 0.8335201144218445, "num_tokens": 421326352.0, "step": 13200 }, { "entropy": 0.6049358937889338, "epoch": 1.2145588582009303, "grad_norm": 0.15790985524654388, "learning_rate": 5.951789493053639e-05, "loss": 0.5976, "mean_token_accuracy": 0.8151747845113277, "num_tokens": 421358615.0, "step": 13201 }, { "entropy": 0.47603102400898933, "epoch": 1.2146508645723717, "grad_norm": 0.14663077890872955, "learning_rate": 5.951482810439476e-05, "loss": 0.4557, "mean_token_accuracy": 0.858923863619566, "num_tokens": 421390829.0, "step": 13202 }, { "entropy": 0.6390418782830238, "epoch": 1.2147428709438128, "grad_norm": 0.16124825179576874, "learning_rate": 5.9511761278253144e-05, "loss": 0.6299, "mean_token_accuracy": 0.8057404197752476, "num_tokens": 421422835.0, "step": 13203 }, { "entropy": 0.5791002810001373, "epoch": 1.214834877315254, "grad_norm": 0.15714548528194427, "learning_rate": 5.950869445211151e-05, "loss": 0.562, "mean_token_accuracy": 0.8299914076924324, "num_tokens": 421454738.0, "step": 13204 }, { "entropy": 0.779263511300087, "epoch": 1.2149268836866953, "grad_norm": 0.1733836531639099, "learning_rate": 5.9505627625969886e-05, "loss": 0.7733, "mean_token_accuracy": 0.7672752477228642, "num_tokens": 421485507.0, "step": 13205 }, { "entropy": 0.6525705587118864, "epoch": 1.2150188900581365, "grad_norm": 0.15816059708595276, "learning_rate": 5.9502560799828254e-05, "loss": 0.6518, "mean_token_accuracy": 0.8034031204879284, "num_tokens": 421517848.0, "step": 13206 }, { "entropy": 0.7017074059695005, "epoch": 1.2151108964295778, "grad_norm": 0.16651801764965057, "learning_rate": 5.9499493973686636e-05, "loss": 0.7039, "mean_token_accuracy": 0.7884657382965088, "num_tokens": 421550108.0, "step": 13207 }, { "entropy": 0.5221341550350189, "epoch": 1.215202902801019, "grad_norm": 0.15361745655536652, "learning_rate": 5.949642714754501e-05, "loss": 0.506, "mean_token_accuracy": 0.8440750502049923, "num_tokens": 421581096.0, "step": 13208 }, { "entropy": 0.5780196525156498, "epoch": 1.21529490917246, "grad_norm": 0.152821347117424, "learning_rate": 5.949336032140338e-05, "loss": 0.5521, "mean_token_accuracy": 0.8289959169924259, "num_tokens": 421612687.0, "step": 13209 }, { "entropy": 0.7700272649526596, "epoch": 1.2153869155439014, "grad_norm": 0.16088373959064484, "learning_rate": 5.949029349526176e-05, "loss": 0.7539, "mean_token_accuracy": 0.7697839327156544, "num_tokens": 421645244.0, "step": 13210 }, { "entropy": 0.6325645297765732, "epoch": 1.2154789219153426, "grad_norm": 0.1575164794921875, "learning_rate": 5.9487226669120134e-05, "loss": 0.6184, "mean_token_accuracy": 0.8106268234550953, "num_tokens": 421677013.0, "step": 13211 }, { "entropy": 0.6189095620065928, "epoch": 1.215570928286784, "grad_norm": 0.16264349222183228, "learning_rate": 5.94841598429785e-05, "loss": 0.6116, "mean_token_accuracy": 0.8151322901248932, "num_tokens": 421708853.0, "step": 13212 }, { "entropy": 0.6454381626099348, "epoch": 1.215662934658225, "grad_norm": 0.16490787267684937, "learning_rate": 5.948109301683688e-05, "loss": 0.6283, "mean_token_accuracy": 0.8060055859386921, "num_tokens": 421740338.0, "step": 13213 }, { "entropy": 0.6473144944757223, "epoch": 1.2157549410296662, "grad_norm": 0.1603682041168213, "learning_rate": 5.947802619069526e-05, "loss": 0.6193, "mean_token_accuracy": 0.8094655312597752, "num_tokens": 421771119.0, "step": 13214 }, { "entropy": 0.6937107555568218, "epoch": 1.2158469474011075, "grad_norm": 0.16511720418930054, "learning_rate": 5.9474959364553626e-05, "loss": 0.6931, "mean_token_accuracy": 0.7933748438954353, "num_tokens": 421803234.0, "step": 13215 }, { "entropy": 0.6870383638888597, "epoch": 1.2159389537725487, "grad_norm": 0.1638563871383667, "learning_rate": 5.9471892538412e-05, "loss": 0.6668, "mean_token_accuracy": 0.7930885180830956, "num_tokens": 421835542.0, "step": 13216 }, { "entropy": 0.5076667852699757, "epoch": 1.21603096014399, "grad_norm": 0.14463815093040466, "learning_rate": 5.946882571227037e-05, "loss": 0.492, "mean_token_accuracy": 0.8463995829224586, "num_tokens": 421868026.0, "step": 13217 }, { "entropy": 0.5187691897153854, "epoch": 1.2161229665154312, "grad_norm": 0.1505492925643921, "learning_rate": 5.946575888612875e-05, "loss": 0.5041, "mean_token_accuracy": 0.8448237366974354, "num_tokens": 421899946.0, "step": 13218 }, { "entropy": 0.5844136066734791, "epoch": 1.2162149728868723, "grad_norm": 0.15577493607997894, "learning_rate": 5.9462692059987125e-05, "loss": 0.5632, "mean_token_accuracy": 0.8235294297337532, "num_tokens": 421931559.0, "step": 13219 }, { "entropy": 0.6109859347343445, "epoch": 1.2163069792583137, "grad_norm": 0.15961863100528717, "learning_rate": 5.945962523384549e-05, "loss": 0.6005, "mean_token_accuracy": 0.8143456354737282, "num_tokens": 421962912.0, "step": 13220 }, { "entropy": 0.7015581391751766, "epoch": 1.2163989856297548, "grad_norm": 0.1673239916563034, "learning_rate": 5.945655840770387e-05, "loss": 0.7011, "mean_token_accuracy": 0.7903411351144314, "num_tokens": 421994355.0, "step": 13221 }, { "entropy": 0.5846061781048775, "epoch": 1.2164909920011961, "grad_norm": 0.1551455557346344, "learning_rate": 5.945349158156225e-05, "loss": 0.5813, "mean_token_accuracy": 0.8195104524493217, "num_tokens": 422026034.0, "step": 13222 }, { "entropy": 0.7132098507136106, "epoch": 1.2165829983726373, "grad_norm": 0.16304659843444824, "learning_rate": 5.9450424755420616e-05, "loss": 0.7041, "mean_token_accuracy": 0.7862912304699421, "num_tokens": 422058524.0, "step": 13223 }, { "entropy": 0.6514510437846184, "epoch": 1.2166750047440784, "grad_norm": 0.16076365113258362, "learning_rate": 5.944735792927899e-05, "loss": 0.6419, "mean_token_accuracy": 0.8042267300188541, "num_tokens": 422090713.0, "step": 13224 }, { "entropy": 0.5922899637371302, "epoch": 1.2167670111155198, "grad_norm": 0.157011479139328, "learning_rate": 5.944429110313736e-05, "loss": 0.5781, "mean_token_accuracy": 0.8240313194692135, "num_tokens": 422122579.0, "step": 13225 }, { "entropy": 0.45005336636677384, "epoch": 1.216859017486961, "grad_norm": 0.1414766162633896, "learning_rate": 5.944122427699575e-05, "loss": 0.4333, "mean_token_accuracy": 0.8678591400384903, "num_tokens": 422154043.0, "step": 13226 }, { "entropy": 0.7117372453212738, "epoch": 1.2169510238584023, "grad_norm": 0.1689269244670868, "learning_rate": 5.9438157450854115e-05, "loss": 0.7099, "mean_token_accuracy": 0.7835213057696819, "num_tokens": 422186028.0, "step": 13227 }, { "entropy": 0.46597175672650337, "epoch": 1.2170430302298434, "grad_norm": 0.15331073105335236, "learning_rate": 5.943509062471248e-05, "loss": 0.4503, "mean_token_accuracy": 0.8615503124892712, "num_tokens": 422218444.0, "step": 13228 }, { "entropy": 0.5455353325232863, "epoch": 1.2171350366012845, "grad_norm": 0.16372524201869965, "learning_rate": 5.943202379857086e-05, "loss": 0.5369, "mean_token_accuracy": 0.8344626799225807, "num_tokens": 422250418.0, "step": 13229 }, { "entropy": 0.6683600293472409, "epoch": 1.2172270429727259, "grad_norm": 0.161394402384758, "learning_rate": 5.942895697242924e-05, "loss": 0.674, "mean_token_accuracy": 0.7932555601000786, "num_tokens": 422282346.0, "step": 13230 }, { "entropy": 0.6059288010001183, "epoch": 1.217319049344167, "grad_norm": 0.15742287039756775, "learning_rate": 5.9425890146287614e-05, "loss": 0.582, "mean_token_accuracy": 0.8221736550331116, "num_tokens": 422314746.0, "step": 13231 }, { "entropy": 0.7229148577898741, "epoch": 1.2174110557156084, "grad_norm": 0.15794193744659424, "learning_rate": 5.942282332014598e-05, "loss": 0.7091, "mean_token_accuracy": 0.7856264039874077, "num_tokens": 422346853.0, "step": 13232 }, { "entropy": 0.6867092866450548, "epoch": 1.2175030620870495, "grad_norm": 0.1615864485502243, "learning_rate": 5.9419756494004356e-05, "loss": 0.6853, "mean_token_accuracy": 0.7939198724925518, "num_tokens": 422379581.0, "step": 13233 }, { "entropy": 0.5260039838030934, "epoch": 1.2175950684584906, "grad_norm": 0.15458272397518158, "learning_rate": 5.941668966786274e-05, "loss": 0.5086, "mean_token_accuracy": 0.8420055508613586, "num_tokens": 422411722.0, "step": 13234 }, { "entropy": 0.5656318170949817, "epoch": 1.217687074829932, "grad_norm": 0.1488407701253891, "learning_rate": 5.9413622841721105e-05, "loss": 0.5489, "mean_token_accuracy": 0.8296033777296543, "num_tokens": 422442949.0, "step": 13235 }, { "entropy": 0.591316469013691, "epoch": 1.2177790812013731, "grad_norm": 0.16527453064918518, "learning_rate": 5.941055601557948e-05, "loss": 0.5781, "mean_token_accuracy": 0.8222857229411602, "num_tokens": 422475522.0, "step": 13236 }, { "entropy": 0.6896599009633064, "epoch": 1.2178710875728145, "grad_norm": 0.15875661373138428, "learning_rate": 5.940748918943785e-05, "loss": 0.6771, "mean_token_accuracy": 0.7936260513961315, "num_tokens": 422507947.0, "step": 13237 }, { "entropy": 0.5861258422955871, "epoch": 1.2179630939442556, "grad_norm": 0.15529315173625946, "learning_rate": 5.940442236329623e-05, "loss": 0.5728, "mean_token_accuracy": 0.8217477537691593, "num_tokens": 422538831.0, "step": 13238 }, { "entropy": 0.5921025136485696, "epoch": 1.2180551003156967, "grad_norm": 0.1608409434556961, "learning_rate": 5.9401355537154604e-05, "loss": 0.5912, "mean_token_accuracy": 0.821340274065733, "num_tokens": 422571074.0, "step": 13239 }, { "entropy": 0.5060474742203951, "epoch": 1.218147106687138, "grad_norm": 0.15965023636817932, "learning_rate": 5.939828871101297e-05, "loss": 0.4924, "mean_token_accuracy": 0.8479134552180767, "num_tokens": 422603299.0, "step": 13240 }, { "entropy": 0.5989187890663743, "epoch": 1.2182391130585792, "grad_norm": 0.15627093613147736, "learning_rate": 5.939522188487135e-05, "loss": 0.5813, "mean_token_accuracy": 0.8221620693802834, "num_tokens": 422635343.0, "step": 13241 }, { "entropy": 0.6167837642133236, "epoch": 1.2183311194300206, "grad_norm": 0.1592186838388443, "learning_rate": 5.939215505872973e-05, "loss": 0.6185, "mean_token_accuracy": 0.8095571175217628, "num_tokens": 422666426.0, "step": 13242 }, { "entropy": 0.6356431394815445, "epoch": 1.2184231258014617, "grad_norm": 0.15438540279865265, "learning_rate": 5.9389088232588096e-05, "loss": 0.6301, "mean_token_accuracy": 0.805605411529541, "num_tokens": 422698455.0, "step": 13243 }, { "entropy": 0.6907157646492124, "epoch": 1.2185151321729029, "grad_norm": 0.16241972148418427, "learning_rate": 5.938602140644647e-05, "loss": 0.6771, "mean_token_accuracy": 0.7903539836406708, "num_tokens": 422730511.0, "step": 13244 }, { "entropy": 0.6216133944690228, "epoch": 1.2186071385443442, "grad_norm": 0.15086473524570465, "learning_rate": 5.938295458030485e-05, "loss": 0.6128, "mean_token_accuracy": 0.8094703406095505, "num_tokens": 422762228.0, "step": 13245 }, { "entropy": 0.5431929272599518, "epoch": 1.2186991449157853, "grad_norm": 0.15260355174541473, "learning_rate": 5.937988775416322e-05, "loss": 0.5257, "mean_token_accuracy": 0.838477112352848, "num_tokens": 422794288.0, "step": 13246 }, { "entropy": 0.5848347721621394, "epoch": 1.2187911512872267, "grad_norm": 0.1615760326385498, "learning_rate": 5.9376820928021594e-05, "loss": 0.5717, "mean_token_accuracy": 0.8239231035113335, "num_tokens": 422825968.0, "step": 13247 }, { "entropy": 0.6065728329122066, "epoch": 1.2188831576586678, "grad_norm": 0.1607409119606018, "learning_rate": 5.937375410187996e-05, "loss": 0.6055, "mean_token_accuracy": 0.8165749460458755, "num_tokens": 422858295.0, "step": 13248 }, { "entropy": 0.6256109569221735, "epoch": 1.218975164030109, "grad_norm": 0.1616056263446808, "learning_rate": 5.9370687275738344e-05, "loss": 0.6169, "mean_token_accuracy": 0.8084888346493244, "num_tokens": 422890109.0, "step": 13249 }, { "entropy": 0.6861296966671944, "epoch": 1.2190671704015503, "grad_norm": 0.15910793840885162, "learning_rate": 5.936762044959672e-05, "loss": 0.6662, "mean_token_accuracy": 0.7964163348078728, "num_tokens": 422921631.0, "step": 13250 }, { "entropy": 0.5608882596716285, "epoch": 1.2191591767729915, "grad_norm": 0.15002284944057465, "learning_rate": 5.9364553623455086e-05, "loss": 0.5526, "mean_token_accuracy": 0.8285998925566673, "num_tokens": 422954105.0, "step": 13251 }, { "entropy": 0.6169448886066675, "epoch": 1.2192511831444328, "grad_norm": 0.16046175360679626, "learning_rate": 5.936148679731346e-05, "loss": 0.5949, "mean_token_accuracy": 0.8198980502784252, "num_tokens": 422986381.0, "step": 13252 }, { "entropy": 0.787552597001195, "epoch": 1.219343189515874, "grad_norm": 0.17527951300144196, "learning_rate": 5.935841997117184e-05, "loss": 0.7891, "mean_token_accuracy": 0.7644544392824173, "num_tokens": 423017135.0, "step": 13253 }, { "entropy": 0.6096754772588611, "epoch": 1.219435195887315, "grad_norm": 0.16240687668323517, "learning_rate": 5.935535314503021e-05, "loss": 0.6082, "mean_token_accuracy": 0.8174018897116184, "num_tokens": 423049187.0, "step": 13254 }, { "entropy": 0.6286130829248577, "epoch": 1.2195272022587564, "grad_norm": 0.16265273094177246, "learning_rate": 5.9352286318888585e-05, "loss": 0.6206, "mean_token_accuracy": 0.8120665661990643, "num_tokens": 423081308.0, "step": 13255 }, { "entropy": 0.6046443283557892, "epoch": 1.2196192086301976, "grad_norm": 0.15579424798488617, "learning_rate": 5.934921949274695e-05, "loss": 0.5873, "mean_token_accuracy": 0.8165584914386272, "num_tokens": 423113554.0, "step": 13256 }, { "entropy": 0.6825486626476049, "epoch": 1.219711215001639, "grad_norm": 0.15856119990348816, "learning_rate": 5.9346152666605334e-05, "loss": 0.6681, "mean_token_accuracy": 0.794383205473423, "num_tokens": 423145321.0, "step": 13257 }, { "entropy": 0.6805654317140579, "epoch": 1.21980322137308, "grad_norm": 0.16322481632232666, "learning_rate": 5.934308584046371e-05, "loss": 0.6612, "mean_token_accuracy": 0.7985414192080498, "num_tokens": 423177378.0, "step": 13258 }, { "entropy": 0.6004644008353353, "epoch": 1.2198952277445212, "grad_norm": 0.15809760987758636, "learning_rate": 5.9340019014322077e-05, "loss": 0.5747, "mean_token_accuracy": 0.8274427689611912, "num_tokens": 423208866.0, "step": 13259 }, { "entropy": 0.5872793542221189, "epoch": 1.2199872341159625, "grad_norm": 0.15757128596305847, "learning_rate": 5.933695218818045e-05, "loss": 0.5672, "mean_token_accuracy": 0.8287952952086926, "num_tokens": 423241034.0, "step": 13260 }, { "entropy": 0.6808096319437027, "epoch": 1.2200792404874037, "grad_norm": 0.1610376536846161, "learning_rate": 5.933388536203883e-05, "loss": 0.6747, "mean_token_accuracy": 0.7928323745727539, "num_tokens": 423273141.0, "step": 13261 }, { "entropy": 0.6853478075936437, "epoch": 1.220171246858845, "grad_norm": 0.16996759176254272, "learning_rate": 5.93308185358972e-05, "loss": 0.6804, "mean_token_accuracy": 0.7938939072191715, "num_tokens": 423304362.0, "step": 13262 }, { "entropy": 0.6484235916286707, "epoch": 1.2202632532302862, "grad_norm": 0.1636662632226944, "learning_rate": 5.9327751709755575e-05, "loss": 0.6363, "mean_token_accuracy": 0.8050144016742706, "num_tokens": 423336492.0, "step": 13263 }, { "entropy": 0.5832020714879036, "epoch": 1.2203552596017273, "grad_norm": 0.15882118046283722, "learning_rate": 5.932468488361394e-05, "loss": 0.5509, "mean_token_accuracy": 0.8329656608402729, "num_tokens": 423368561.0, "step": 13264 }, { "entropy": 0.6571524441242218, "epoch": 1.2204472659731687, "grad_norm": 0.1546737551689148, "learning_rate": 5.932161805747233e-05, "loss": 0.6537, "mean_token_accuracy": 0.806542482227087, "num_tokens": 423399787.0, "step": 13265 }, { "entropy": 0.7110765445977449, "epoch": 1.2205392723446098, "grad_norm": 0.16509751975536346, "learning_rate": 5.93185512313307e-05, "loss": 0.6833, "mean_token_accuracy": 0.7908631414175034, "num_tokens": 423431188.0, "step": 13266 }, { "entropy": 0.6630082316696644, "epoch": 1.2206312787160511, "grad_norm": 0.16446444392204285, "learning_rate": 5.931548440518907e-05, "loss": 0.6595, "mean_token_accuracy": 0.7986820004880428, "num_tokens": 423463470.0, "step": 13267 }, { "entropy": 0.6154363257810473, "epoch": 1.2207232850874923, "grad_norm": 0.15435446798801422, "learning_rate": 5.931241757904744e-05, "loss": 0.6053, "mean_token_accuracy": 0.8097293451428413, "num_tokens": 423495379.0, "step": 13268 }, { "entropy": 0.6813861448317766, "epoch": 1.2208152914589334, "grad_norm": 0.15811850130558014, "learning_rate": 5.930935075290582e-05, "loss": 0.6667, "mean_token_accuracy": 0.7969845570623875, "num_tokens": 423527833.0, "step": 13269 }, { "entropy": 0.6247764499858022, "epoch": 1.2209072978303748, "grad_norm": 0.15718822181224823, "learning_rate": 5.93062839267642e-05, "loss": 0.6215, "mean_token_accuracy": 0.8105971701443195, "num_tokens": 423559879.0, "step": 13270 }, { "entropy": 0.6388178905472159, "epoch": 1.220999304201816, "grad_norm": 0.15834683179855347, "learning_rate": 5.9303217100622566e-05, "loss": 0.6494, "mean_token_accuracy": 0.8017720580101013, "num_tokens": 423591391.0, "step": 13271 }, { "entropy": 0.703703448176384, "epoch": 1.2210913105732573, "grad_norm": 0.16179794073104858, "learning_rate": 5.930015027448095e-05, "loss": 0.698, "mean_token_accuracy": 0.7832212932407856, "num_tokens": 423623539.0, "step": 13272 }, { "entropy": 0.6407062280923128, "epoch": 1.2211833169446984, "grad_norm": 0.15483751893043518, "learning_rate": 5.929708344833932e-05, "loss": 0.6258, "mean_token_accuracy": 0.8067551255226135, "num_tokens": 423655638.0, "step": 13273 }, { "entropy": 0.5788387283682823, "epoch": 1.2212753233161395, "grad_norm": 0.15763266384601593, "learning_rate": 5.929401662219769e-05, "loss": 0.5652, "mean_token_accuracy": 0.8233742788434029, "num_tokens": 423687197.0, "step": 13274 }, { "entropy": 0.5182957630604506, "epoch": 1.2213673296875809, "grad_norm": 0.15383364260196686, "learning_rate": 5.9290949796056064e-05, "loss": 0.5107, "mean_token_accuracy": 0.8432344384491444, "num_tokens": 423719176.0, "step": 13275 }, { "entropy": 0.5531255044043064, "epoch": 1.221459336059022, "grad_norm": 0.15275870263576508, "learning_rate": 5.9287882969914446e-05, "loss": 0.5398, "mean_token_accuracy": 0.8307754136621952, "num_tokens": 423751297.0, "step": 13276 }, { "entropy": 0.5827916823327541, "epoch": 1.2215513424304634, "grad_norm": 0.15564055740833282, "learning_rate": 5.9284816143772813e-05, "loss": 0.582, "mean_token_accuracy": 0.8195070140063763, "num_tokens": 423783520.0, "step": 13277 }, { "entropy": 0.6373172700405121, "epoch": 1.2216433488019045, "grad_norm": 0.16858592629432678, "learning_rate": 5.928174931763119e-05, "loss": 0.632, "mean_token_accuracy": 0.8067202642560005, "num_tokens": 423814803.0, "step": 13278 }, { "entropy": 0.6005971096456051, "epoch": 1.2217353551733456, "grad_norm": 0.15612612664699554, "learning_rate": 5.9278682491489556e-05, "loss": 0.5801, "mean_token_accuracy": 0.8188204914331436, "num_tokens": 423846504.0, "step": 13279 }, { "entropy": 0.7343875300139189, "epoch": 1.221827361544787, "grad_norm": 0.17205718159675598, "learning_rate": 5.927561566534794e-05, "loss": 0.7153, "mean_token_accuracy": 0.7797991782426834, "num_tokens": 423877855.0, "step": 13280 }, { "entropy": 0.6111818067729473, "epoch": 1.2219193679162281, "grad_norm": 0.15693014860153198, "learning_rate": 5.927254883920631e-05, "loss": 0.6041, "mean_token_accuracy": 0.8150610513985157, "num_tokens": 423910078.0, "step": 13281 }, { "entropy": 0.6725980285555124, "epoch": 1.2220113742876695, "grad_norm": 0.16279277205467224, "learning_rate": 5.926948201306468e-05, "loss": 0.6609, "mean_token_accuracy": 0.7990440912544727, "num_tokens": 423942104.0, "step": 13282 }, { "entropy": 0.6496825031936169, "epoch": 1.2221033806591106, "grad_norm": 0.15206550061702728, "learning_rate": 5.9266415186923055e-05, "loss": 0.6377, "mean_token_accuracy": 0.8079261817038059, "num_tokens": 423974280.0, "step": 13283 }, { "entropy": 0.5866645034402609, "epoch": 1.2221953870305517, "grad_norm": 0.15781864523887634, "learning_rate": 5.9263348360781436e-05, "loss": 0.5743, "mean_token_accuracy": 0.825641043484211, "num_tokens": 424006168.0, "step": 13284 }, { "entropy": 0.6561309872195125, "epoch": 1.222287393401993, "grad_norm": 0.16060130298137665, "learning_rate": 5.9260281534639804e-05, "loss": 0.6479, "mean_token_accuracy": 0.8011677786707878, "num_tokens": 424038263.0, "step": 13285 }, { "entropy": 0.6638198047876358, "epoch": 1.2223793997734342, "grad_norm": 0.16226515173912048, "learning_rate": 5.925721470849818e-05, "loss": 0.6423, "mean_token_accuracy": 0.8016659542918205, "num_tokens": 424069664.0, "step": 13286 }, { "entropy": 0.5951927993446589, "epoch": 1.2224714061448756, "grad_norm": 0.15549592673778534, "learning_rate": 5.9254147882356546e-05, "loss": 0.5739, "mean_token_accuracy": 0.8255579806864262, "num_tokens": 424101602.0, "step": 13287 }, { "entropy": 0.6420920165255666, "epoch": 1.2225634125163167, "grad_norm": 0.15599846839904785, "learning_rate": 5.925108105621493e-05, "loss": 0.6409, "mean_token_accuracy": 0.8079594522714615, "num_tokens": 424133782.0, "step": 13288 }, { "entropy": 0.7115699192509055, "epoch": 1.2226554188877579, "grad_norm": 0.16599400341510773, "learning_rate": 5.92480142300733e-05, "loss": 0.7002, "mean_token_accuracy": 0.7890862710773945, "num_tokens": 424165287.0, "step": 13289 }, { "entropy": 0.6538106156513095, "epoch": 1.2227474252591992, "grad_norm": 0.15968981385231018, "learning_rate": 5.924494740393167e-05, "loss": 0.6517, "mean_token_accuracy": 0.7999206110835075, "num_tokens": 424198055.0, "step": 13290 }, { "entropy": 0.509689318947494, "epoch": 1.2228394316306403, "grad_norm": 0.15109454095363617, "learning_rate": 5.9241880577790045e-05, "loss": 0.4955, "mean_token_accuracy": 0.8444932214915752, "num_tokens": 424230231.0, "step": 13291 }, { "entropy": 0.655466478317976, "epoch": 1.2229314380020817, "grad_norm": 0.15936696529388428, "learning_rate": 5.9238813751648426e-05, "loss": 0.6464, "mean_token_accuracy": 0.7997689284384251, "num_tokens": 424262224.0, "step": 13292 }, { "entropy": 0.6421069204807281, "epoch": 1.2230234443735228, "grad_norm": 0.15716524422168732, "learning_rate": 5.9235746925506794e-05, "loss": 0.6376, "mean_token_accuracy": 0.8082860633730888, "num_tokens": 424294367.0, "step": 13293 }, { "entropy": 0.712106860242784, "epoch": 1.223115450744964, "grad_norm": 0.16483370959758759, "learning_rate": 5.923268009936517e-05, "loss": 0.7086, "mean_token_accuracy": 0.7838376574218273, "num_tokens": 424326256.0, "step": 13294 }, { "entropy": 0.6938832672312856, "epoch": 1.2232074571164053, "grad_norm": 0.1662072241306305, "learning_rate": 5.922961327322354e-05, "loss": 0.6905, "mean_token_accuracy": 0.7902839370071888, "num_tokens": 424357790.0, "step": 13295 }, { "entropy": 0.591149341315031, "epoch": 1.2232994634878465, "grad_norm": 0.1515239030122757, "learning_rate": 5.922654644708192e-05, "loss": 0.566, "mean_token_accuracy": 0.8235814422369003, "num_tokens": 424389978.0, "step": 13296 }, { "entropy": 0.5949892178177834, "epoch": 1.2233914698592878, "grad_norm": 0.154016375541687, "learning_rate": 5.922347962094029e-05, "loss": 0.5655, "mean_token_accuracy": 0.8274503387510777, "num_tokens": 424421637.0, "step": 13297 }, { "entropy": 0.6292326506227255, "epoch": 1.223483476230729, "grad_norm": 0.1541510820388794, "learning_rate": 5.922041279479866e-05, "loss": 0.6007, "mean_token_accuracy": 0.8127983175218105, "num_tokens": 424453804.0, "step": 13298 }, { "entropy": 0.5210873689502478, "epoch": 1.22357548260217, "grad_norm": 0.16149000823497772, "learning_rate": 5.9217345968657035e-05, "loss": 0.5003, "mean_token_accuracy": 0.8442587628960609, "num_tokens": 424485725.0, "step": 13299 }, { "entropy": 0.6080566989257932, "epoch": 1.2236674889736114, "grad_norm": 0.15156790614128113, "learning_rate": 5.921427914251542e-05, "loss": 0.5995, "mean_token_accuracy": 0.8163835592567921, "num_tokens": 424518314.0, "step": 13300 }, { "entropy": 0.6840624809265137, "epoch": 1.2237594953450526, "grad_norm": 0.1691131442785263, "learning_rate": 5.9211212316373785e-05, "loss": 0.6543, "mean_token_accuracy": 0.7983358204364777, "num_tokens": 424549119.0, "step": 13301 }, { "entropy": 0.6604460645467043, "epoch": 1.223851501716494, "grad_norm": 0.16297346353530884, "learning_rate": 5.920814549023216e-05, "loss": 0.6477, "mean_token_accuracy": 0.8056505434215069, "num_tokens": 424581423.0, "step": 13302 }, { "entropy": 0.5822379551827908, "epoch": 1.223943508087935, "grad_norm": 0.15241938829421997, "learning_rate": 5.920507866409054e-05, "loss": 0.575, "mean_token_accuracy": 0.8244989700615406, "num_tokens": 424613307.0, "step": 13303 }, { "entropy": 0.5679228929802775, "epoch": 1.2240355144593762, "grad_norm": 0.15793141722679138, "learning_rate": 5.920201183794891e-05, "loss": 0.5678, "mean_token_accuracy": 0.8227443993091583, "num_tokens": 424645384.0, "step": 13304 }, { "entropy": 0.6312033054418862, "epoch": 1.2241275208308176, "grad_norm": 0.15747016668319702, "learning_rate": 5.919894501180728e-05, "loss": 0.6236, "mean_token_accuracy": 0.810293011367321, "num_tokens": 424677673.0, "step": 13305 }, { "entropy": 0.6446540113538504, "epoch": 1.2242195272022587, "grad_norm": 0.16051417589187622, "learning_rate": 5.919587818566565e-05, "loss": 0.6466, "mean_token_accuracy": 0.8037542402744293, "num_tokens": 424709376.0, "step": 13306 }, { "entropy": 0.5704477392137051, "epoch": 1.2243115335737, "grad_norm": 0.1591799408197403, "learning_rate": 5.919281135952404e-05, "loss": 0.5699, "mean_token_accuracy": 0.8236147463321686, "num_tokens": 424742139.0, "step": 13307 }, { "entropy": 0.7185067683458328, "epoch": 1.2244035399451412, "grad_norm": 0.16554509103298187, "learning_rate": 5.918974453338241e-05, "loss": 0.7186, "mean_token_accuracy": 0.7821395434439182, "num_tokens": 424774304.0, "step": 13308 }, { "entropy": 0.6679869899526238, "epoch": 1.2244955463165823, "grad_norm": 0.15626779198646545, "learning_rate": 5.918667770724078e-05, "loss": 0.6568, "mean_token_accuracy": 0.7991255037486553, "num_tokens": 424806193.0, "step": 13309 }, { "entropy": 0.6482338048517704, "epoch": 1.2245875526880237, "grad_norm": 0.15557511150836945, "learning_rate": 5.918361088109915e-05, "loss": 0.6364, "mean_token_accuracy": 0.8059840649366379, "num_tokens": 424838926.0, "step": 13310 }, { "entropy": 0.6260678917169571, "epoch": 1.2246795590594648, "grad_norm": 0.15879209339618683, "learning_rate": 5.918054405495753e-05, "loss": 0.6246, "mean_token_accuracy": 0.8151314668357372, "num_tokens": 424870294.0, "step": 13311 }, { "entropy": 0.7280023209750652, "epoch": 1.2247715654309062, "grad_norm": 0.16401898860931396, "learning_rate": 5.9177477228815906e-05, "loss": 0.7148, "mean_token_accuracy": 0.7866154052317142, "num_tokens": 424902270.0, "step": 13312 }, { "entropy": 0.5865366412326694, "epoch": 1.2248635718023473, "grad_norm": 0.1552533358335495, "learning_rate": 5.9174410402674274e-05, "loss": 0.5663, "mean_token_accuracy": 0.8225958533585072, "num_tokens": 424934201.0, "step": 13313 }, { "entropy": 0.630867188796401, "epoch": 1.2249555781737884, "grad_norm": 0.1584150493144989, "learning_rate": 5.917134357653265e-05, "loss": 0.6332, "mean_token_accuracy": 0.801986251026392, "num_tokens": 424966035.0, "step": 13314 }, { "entropy": 0.616697751916945, "epoch": 1.2250475845452298, "grad_norm": 0.15613235533237457, "learning_rate": 5.916827675039103e-05, "loss": 0.595, "mean_token_accuracy": 0.8158542513847351, "num_tokens": 424997866.0, "step": 13315 }, { "entropy": 0.617148666176945, "epoch": 1.225139590916671, "grad_norm": 0.15616922080516815, "learning_rate": 5.91652099242494e-05, "loss": 0.5921, "mean_token_accuracy": 0.8161198571324348, "num_tokens": 425029757.0, "step": 13316 }, { "entropy": 0.6369333807379007, "epoch": 1.2252315972881123, "grad_norm": 0.15592791140079498, "learning_rate": 5.916214309810777e-05, "loss": 0.6275, "mean_token_accuracy": 0.8124227672815323, "num_tokens": 425062496.0, "step": 13317 }, { "entropy": 0.5576633121818304, "epoch": 1.2253236036595534, "grad_norm": 0.1559525728225708, "learning_rate": 5.915907627196614e-05, "loss": 0.5376, "mean_token_accuracy": 0.8353893309831619, "num_tokens": 425094916.0, "step": 13318 }, { "entropy": 0.7277183569967747, "epoch": 1.2254156100309945, "grad_norm": 0.1634381115436554, "learning_rate": 5.915600944582452e-05, "loss": 0.7142, "mean_token_accuracy": 0.784584853798151, "num_tokens": 425126990.0, "step": 13319 }, { "entropy": 0.5925385016016662, "epoch": 1.2255076164024359, "grad_norm": 0.16518183052539825, "learning_rate": 5.9152942619682896e-05, "loss": 0.5709, "mean_token_accuracy": 0.8225282579660416, "num_tokens": 425158737.0, "step": 13320 }, { "entropy": 0.7147017642855644, "epoch": 1.225599622773877, "grad_norm": 0.17119652032852173, "learning_rate": 5.9149875793541264e-05, "loss": 0.7113, "mean_token_accuracy": 0.7818463258445263, "num_tokens": 425191053.0, "step": 13321 }, { "entropy": 0.605428060516715, "epoch": 1.2256916291453184, "grad_norm": 0.160367950797081, "learning_rate": 5.914680896739964e-05, "loss": 0.5986, "mean_token_accuracy": 0.8168773911893368, "num_tokens": 425222892.0, "step": 13322 }, { "entropy": 0.5328482538461685, "epoch": 1.2257836355167595, "grad_norm": 0.15394939482212067, "learning_rate": 5.914374214125802e-05, "loss": 0.5221, "mean_token_accuracy": 0.8365905843675137, "num_tokens": 425255016.0, "step": 13323 }, { "entropy": 0.6407016646116972, "epoch": 1.2258756418882006, "grad_norm": 0.15582320094108582, "learning_rate": 5.914067531511639e-05, "loss": 0.6321, "mean_token_accuracy": 0.79974365234375, "num_tokens": 425286574.0, "step": 13324 }, { "entropy": 0.6724757570773363, "epoch": 1.225967648259642, "grad_norm": 0.16080127656459808, "learning_rate": 5.913760848897476e-05, "loss": 0.6602, "mean_token_accuracy": 0.7975413277745247, "num_tokens": 425317702.0, "step": 13325 }, { "entropy": 0.712267505005002, "epoch": 1.2260596546310831, "grad_norm": 0.16733334958553314, "learning_rate": 5.913454166283313e-05, "loss": 0.7073, "mean_token_accuracy": 0.7884644903242588, "num_tokens": 425350438.0, "step": 13326 }, { "entropy": 0.5657169595360756, "epoch": 1.2261516610025245, "grad_norm": 0.15143859386444092, "learning_rate": 5.913147483669151e-05, "loss": 0.5531, "mean_token_accuracy": 0.8287386745214462, "num_tokens": 425382875.0, "step": 13327 }, { "entropy": 0.7421667128801346, "epoch": 1.2262436673739656, "grad_norm": 0.16227975487709045, "learning_rate": 5.912840801054989e-05, "loss": 0.7207, "mean_token_accuracy": 0.7774351835250854, "num_tokens": 425414209.0, "step": 13328 }, { "entropy": 0.5151744782924652, "epoch": 1.2263356737454068, "grad_norm": 0.15794603526592255, "learning_rate": 5.9125341184408254e-05, "loss": 0.5077, "mean_token_accuracy": 0.8426604680716991, "num_tokens": 425445904.0, "step": 13329 }, { "entropy": 0.5242103096097708, "epoch": 1.226427680116848, "grad_norm": 0.15942376852035522, "learning_rate": 5.912227435826663e-05, "loss": 0.5091, "mean_token_accuracy": 0.8446247912943363, "num_tokens": 425477522.0, "step": 13330 }, { "entropy": 0.6315458128228784, "epoch": 1.2265196864882892, "grad_norm": 0.17078381776809692, "learning_rate": 5.911920753212501e-05, "loss": 0.6262, "mean_token_accuracy": 0.8083125725388527, "num_tokens": 425508984.0, "step": 13331 }, { "entropy": 0.6080804672092199, "epoch": 1.2266116928597306, "grad_norm": 0.16085967421531677, "learning_rate": 5.911614070598338e-05, "loss": 0.6016, "mean_token_accuracy": 0.8140720874071121, "num_tokens": 425541029.0, "step": 13332 }, { "entropy": 0.6671762000769377, "epoch": 1.2267036992311717, "grad_norm": 0.16012664139270782, "learning_rate": 5.911307387984175e-05, "loss": 0.6455, "mean_token_accuracy": 0.7963589653372765, "num_tokens": 425572422.0, "step": 13333 }, { "entropy": 0.6727479537948966, "epoch": 1.2267957056026129, "grad_norm": 0.16353200376033783, "learning_rate": 5.9110007053700135e-05, "loss": 0.6637, "mean_token_accuracy": 0.7944327183067799, "num_tokens": 425604145.0, "step": 13334 }, { "entropy": 0.7255304511636496, "epoch": 1.2268877119740542, "grad_norm": 0.17065928876399994, "learning_rate": 5.91069402275585e-05, "loss": 0.7176, "mean_token_accuracy": 0.7861846499145031, "num_tokens": 425635460.0, "step": 13335 }, { "entropy": 0.6721388194710016, "epoch": 1.2269797183454954, "grad_norm": 0.15175551176071167, "learning_rate": 5.910387340141688e-05, "loss": 0.6509, "mean_token_accuracy": 0.802678607404232, "num_tokens": 425667961.0, "step": 13336 }, { "entropy": 0.7160092443227768, "epoch": 1.2270717247169367, "grad_norm": 0.16596639156341553, "learning_rate": 5.9100806575275245e-05, "loss": 0.6955, "mean_token_accuracy": 0.7871794700622559, "num_tokens": 425699685.0, "step": 13337 }, { "entropy": 0.6388903446495533, "epoch": 1.2271637310883778, "grad_norm": 0.1592939794063568, "learning_rate": 5.9097739749133626e-05, "loss": 0.6093, "mean_token_accuracy": 0.8132065758109093, "num_tokens": 425731414.0, "step": 13338 }, { "entropy": 0.6156607698649168, "epoch": 1.227255737459819, "grad_norm": 0.1550336480140686, "learning_rate": 5.9094672922992e-05, "loss": 0.6021, "mean_token_accuracy": 0.8190678209066391, "num_tokens": 425763706.0, "step": 13339 }, { "entropy": 0.6066476292908192, "epoch": 1.2273477438312603, "grad_norm": 0.15787625312805176, "learning_rate": 5.909160609685037e-05, "loss": 0.5894, "mean_token_accuracy": 0.821702629327774, "num_tokens": 425795978.0, "step": 13340 }, { "entropy": 0.6392934024333954, "epoch": 1.2274397502027015, "grad_norm": 0.160056471824646, "learning_rate": 5.9088539270708743e-05, "loss": 0.6256, "mean_token_accuracy": 0.8096638880670071, "num_tokens": 425828219.0, "step": 13341 }, { "entropy": 0.580087929032743, "epoch": 1.2275317565741428, "grad_norm": 0.16108758747577667, "learning_rate": 5.9085472444567125e-05, "loss": 0.5769, "mean_token_accuracy": 0.8224281519651413, "num_tokens": 425860207.0, "step": 13342 }, { "entropy": 0.6850283723324537, "epoch": 1.227623762945584, "grad_norm": 0.15674585103988647, "learning_rate": 5.908240561842549e-05, "loss": 0.6918, "mean_token_accuracy": 0.7901696600019932, "num_tokens": 425892408.0, "step": 13343 }, { "entropy": 0.5963471373543143, "epoch": 1.227715769317025, "grad_norm": 0.16165992617607117, "learning_rate": 5.907933879228387e-05, "loss": 0.5983, "mean_token_accuracy": 0.8193343542516232, "num_tokens": 425924529.0, "step": 13344 }, { "entropy": 0.7035087645053864, "epoch": 1.2278077756884664, "grad_norm": 0.16333112120628357, "learning_rate": 5.9076271966142235e-05, "loss": 0.7037, "mean_token_accuracy": 0.7896149009466171, "num_tokens": 425956273.0, "step": 13345 }, { "entropy": 0.5357664204202592, "epoch": 1.2278997820599076, "grad_norm": 0.15413935482501984, "learning_rate": 5.9073205140000624e-05, "loss": 0.5162, "mean_token_accuracy": 0.8394184224307537, "num_tokens": 425987656.0, "step": 13346 }, { "entropy": 0.6357546499930322, "epoch": 1.227991788431349, "grad_norm": 0.15975087881088257, "learning_rate": 5.907013831385899e-05, "loss": 0.6408, "mean_token_accuracy": 0.8081224225461483, "num_tokens": 426020014.0, "step": 13347 }, { "entropy": 0.6448170784860849, "epoch": 1.22808379480279, "grad_norm": 0.16045024991035461, "learning_rate": 5.906707148771736e-05, "loss": 0.6503, "mean_token_accuracy": 0.8024361580610275, "num_tokens": 426051338.0, "step": 13348 }, { "entropy": 0.6408550888299942, "epoch": 1.2281758011742312, "grad_norm": 0.18761789798736572, "learning_rate": 5.9064004661575734e-05, "loss": 0.6277, "mean_token_accuracy": 0.8049575239419937, "num_tokens": 426082548.0, "step": 13349 }, { "entropy": 0.6361253252252936, "epoch": 1.2282678075456726, "grad_norm": 0.1514665186405182, "learning_rate": 5.9060937835434115e-05, "loss": 0.61, "mean_token_accuracy": 0.8129489533603191, "num_tokens": 426114623.0, "step": 13350 }, { "entropy": 0.7049540914595127, "epoch": 1.2283598139171137, "grad_norm": 0.1613485962152481, "learning_rate": 5.905787100929249e-05, "loss": 0.6918, "mean_token_accuracy": 0.7906777039170265, "num_tokens": 426146189.0, "step": 13351 }, { "entropy": 0.5962607031688094, "epoch": 1.228451820288555, "grad_norm": 0.15101967751979828, "learning_rate": 5.905480418315086e-05, "loss": 0.5855, "mean_token_accuracy": 0.8202161304652691, "num_tokens": 426178136.0, "step": 13352 }, { "entropy": 0.6235365602187812, "epoch": 1.2285438266599962, "grad_norm": 0.15396109223365784, "learning_rate": 5.905173735700923e-05, "loss": 0.5942, "mean_token_accuracy": 0.8163008391857147, "num_tokens": 426210399.0, "step": 13353 }, { "entropy": 0.5649724560789764, "epoch": 1.2286358330314373, "grad_norm": 0.15346978604793549, "learning_rate": 5.9048670530867614e-05, "loss": 0.545, "mean_token_accuracy": 0.8327162824571133, "num_tokens": 426242369.0, "step": 13354 }, { "entropy": 0.6138121178373694, "epoch": 1.2287278394028787, "grad_norm": 0.15507015585899353, "learning_rate": 5.904560370472598e-05, "loss": 0.5846, "mean_token_accuracy": 0.8159619122743607, "num_tokens": 426273627.0, "step": 13355 }, { "entropy": 0.6994784139096737, "epoch": 1.2288198457743198, "grad_norm": 0.16331180930137634, "learning_rate": 5.9042536878584356e-05, "loss": 0.704, "mean_token_accuracy": 0.7885402888059616, "num_tokens": 426305192.0, "step": 13356 }, { "entropy": 0.5847479924559593, "epoch": 1.2289118521457612, "grad_norm": 0.1534118950366974, "learning_rate": 5.9039470052442724e-05, "loss": 0.5706, "mean_token_accuracy": 0.8240877687931061, "num_tokens": 426337255.0, "step": 13357 }, { "entropy": 0.5608043968677521, "epoch": 1.2290038585172023, "grad_norm": 0.1574990600347519, "learning_rate": 5.9036403226301106e-05, "loss": 0.5359, "mean_token_accuracy": 0.8366935849189758, "num_tokens": 426369412.0, "step": 13358 }, { "entropy": 0.654835844412446, "epoch": 1.2290958648886434, "grad_norm": 0.15898708999156952, "learning_rate": 5.903333640015948e-05, "loss": 0.6472, "mean_token_accuracy": 0.80640684440732, "num_tokens": 426401527.0, "step": 13359 }, { "entropy": 0.6058022957295179, "epoch": 1.2291878712600848, "grad_norm": 0.1632753163576126, "learning_rate": 5.903026957401785e-05, "loss": 0.6126, "mean_token_accuracy": 0.8139821961522102, "num_tokens": 426433355.0, "step": 13360 }, { "entropy": 0.6849205773323774, "epoch": 1.229279877631526, "grad_norm": 0.1627674698829651, "learning_rate": 5.902720274787622e-05, "loss": 0.6726, "mean_token_accuracy": 0.7937182225286961, "num_tokens": 426465198.0, "step": 13361 }, { "entropy": 0.6311476640403271, "epoch": 1.2293718840029673, "grad_norm": 0.15702849626541138, "learning_rate": 5.9024135921734604e-05, "loss": 0.6273, "mean_token_accuracy": 0.8068927861750126, "num_tokens": 426497227.0, "step": 13362 }, { "entropy": 0.5852786004543304, "epoch": 1.2294638903744084, "grad_norm": 0.1542612761259079, "learning_rate": 5.902106909559297e-05, "loss": 0.5747, "mean_token_accuracy": 0.8233715631067753, "num_tokens": 426529905.0, "step": 13363 }, { "entropy": 0.6928582396358252, "epoch": 1.2295558967458495, "grad_norm": 0.16771124303340912, "learning_rate": 5.901800226945135e-05, "loss": 0.6715, "mean_token_accuracy": 0.7954389974474907, "num_tokens": 426561461.0, "step": 13364 }, { "entropy": 0.677357817068696, "epoch": 1.2296479031172909, "grad_norm": 0.16103987395763397, "learning_rate": 5.901493544330973e-05, "loss": 0.6635, "mean_token_accuracy": 0.7942529171705246, "num_tokens": 426593163.0, "step": 13365 }, { "entropy": 0.7107107155025005, "epoch": 1.229739909488732, "grad_norm": 0.1655282825231552, "learning_rate": 5.9011868617168096e-05, "loss": 0.6985, "mean_token_accuracy": 0.7852502688765526, "num_tokens": 426624915.0, "step": 13366 }, { "entropy": 0.5517902337014675, "epoch": 1.2298319158601734, "grad_norm": 0.15202024579048157, "learning_rate": 5.900880179102647e-05, "loss": 0.5317, "mean_token_accuracy": 0.8354974426329136, "num_tokens": 426656853.0, "step": 13367 }, { "entropy": 0.5638036672025919, "epoch": 1.2299239222316145, "grad_norm": 0.15200500190258026, "learning_rate": 5.900573496488484e-05, "loss": 0.543, "mean_token_accuracy": 0.828588355332613, "num_tokens": 426688495.0, "step": 13368 }, { "entropy": 0.6123722027987242, "epoch": 1.2300159286030556, "grad_norm": 0.15515395998954773, "learning_rate": 5.900266813874322e-05, "loss": 0.6048, "mean_token_accuracy": 0.8165422081947327, "num_tokens": 426720650.0, "step": 13369 }, { "entropy": 0.7282486734911799, "epoch": 1.230107934974497, "grad_norm": 0.16943633556365967, "learning_rate": 5.8999601312601595e-05, "loss": 0.7409, "mean_token_accuracy": 0.781453225761652, "num_tokens": 426752238.0, "step": 13370 }, { "entropy": 0.641569621860981, "epoch": 1.2301999413459381, "grad_norm": 0.1601875275373459, "learning_rate": 5.899653448645996e-05, "loss": 0.6353, "mean_token_accuracy": 0.8070286363363266, "num_tokens": 426784451.0, "step": 13371 }, { "entropy": 0.5546399550512433, "epoch": 1.2302919477173795, "grad_norm": 0.14879170060157776, "learning_rate": 5.899346766031834e-05, "loss": 0.5382, "mean_token_accuracy": 0.833292480558157, "num_tokens": 426815724.0, "step": 13372 }, { "entropy": 0.6534878313541412, "epoch": 1.2303839540888206, "grad_norm": 0.16082307696342468, "learning_rate": 5.899040083417672e-05, "loss": 0.6404, "mean_token_accuracy": 0.8054520301520824, "num_tokens": 426847265.0, "step": 13373 }, { "entropy": 0.6118086706846952, "epoch": 1.2304759604602618, "grad_norm": 0.1539972424507141, "learning_rate": 5.8987334008035087e-05, "loss": 0.593, "mean_token_accuracy": 0.8168966770172119, "num_tokens": 426880033.0, "step": 13374 }, { "entropy": 0.5712413275614381, "epoch": 1.230567966831703, "grad_norm": 0.15226846933364868, "learning_rate": 5.898426718189346e-05, "loss": 0.559, "mean_token_accuracy": 0.828665878623724, "num_tokens": 426912716.0, "step": 13375 }, { "entropy": 0.6920671174302697, "epoch": 1.2306599732031442, "grad_norm": 0.16717354953289032, "learning_rate": 5.898120035575183e-05, "loss": 0.6742, "mean_token_accuracy": 0.7904736399650574, "num_tokens": 426944336.0, "step": 13376 }, { "entropy": 0.5485686613246799, "epoch": 1.2307519795745856, "grad_norm": 0.149138942360878, "learning_rate": 5.897813352961021e-05, "loss": 0.5218, "mean_token_accuracy": 0.8299591578543186, "num_tokens": 426975604.0, "step": 13377 }, { "entropy": 0.6474285125732422, "epoch": 1.2308439859460267, "grad_norm": 0.16157355904579163, "learning_rate": 5.8975066703468585e-05, "loss": 0.6404, "mean_token_accuracy": 0.8050435557961464, "num_tokens": 427007646.0, "step": 13378 }, { "entropy": 0.5441933227702975, "epoch": 1.2309359923174679, "grad_norm": 0.1448923498392105, "learning_rate": 5.897199987732695e-05, "loss": 0.5275, "mean_token_accuracy": 0.8336702026426792, "num_tokens": 427039830.0, "step": 13379 }, { "entropy": 0.5837899108882993, "epoch": 1.2310279986889092, "grad_norm": 0.1630827635526657, "learning_rate": 5.896893305118533e-05, "loss": 0.5682, "mean_token_accuracy": 0.8264226242899895, "num_tokens": 427072154.0, "step": 13380 }, { "entropy": 0.6489161662757397, "epoch": 1.2311200050603504, "grad_norm": 0.17024490237236023, "learning_rate": 5.896586622504371e-05, "loss": 0.63, "mean_token_accuracy": 0.8099381662905216, "num_tokens": 427104750.0, "step": 13381 }, { "entropy": 0.6255656601861119, "epoch": 1.2312120114317917, "grad_norm": 0.16282996535301208, "learning_rate": 5.896279939890208e-05, "loss": 0.6131, "mean_token_accuracy": 0.814533032476902, "num_tokens": 427136891.0, "step": 13382 }, { "entropy": 0.6081263720989227, "epoch": 1.2313040178032328, "grad_norm": 0.15642359852790833, "learning_rate": 5.895973257276045e-05, "loss": 0.5899, "mean_token_accuracy": 0.8175378926098347, "num_tokens": 427168272.0, "step": 13383 }, { "entropy": 0.6317267213016748, "epoch": 1.231396024174674, "grad_norm": 0.16005392372608185, "learning_rate": 5.895666574661882e-05, "loss": 0.6138, "mean_token_accuracy": 0.809424877166748, "num_tokens": 427200333.0, "step": 13384 }, { "entropy": 0.6076961811631918, "epoch": 1.2314880305461153, "grad_norm": 0.16352249681949615, "learning_rate": 5.895359892047721e-05, "loss": 0.6035, "mean_token_accuracy": 0.8102075718343258, "num_tokens": 427232903.0, "step": 13385 }, { "entropy": 0.6812859512865543, "epoch": 1.2315800369175565, "grad_norm": 0.1632111519575119, "learning_rate": 5.8950532094335576e-05, "loss": 0.6788, "mean_token_accuracy": 0.7908568792045116, "num_tokens": 427264764.0, "step": 13386 }, { "entropy": 0.5922729410231113, "epoch": 1.2316720432889978, "grad_norm": 0.15526621043682098, "learning_rate": 5.8947465268193943e-05, "loss": 0.5741, "mean_token_accuracy": 0.8206134997308254, "num_tokens": 427296471.0, "step": 13387 }, { "entropy": 0.6697286628186703, "epoch": 1.231764049660439, "grad_norm": 0.1571321338415146, "learning_rate": 5.894439844205232e-05, "loss": 0.6656, "mean_token_accuracy": 0.7992173507809639, "num_tokens": 427328355.0, "step": 13388 }, { "entropy": 0.5421639811247587, "epoch": 1.23185605603188, "grad_norm": 0.15129193663597107, "learning_rate": 5.89413316159107e-05, "loss": 0.5292, "mean_token_accuracy": 0.8400687500834465, "num_tokens": 427360151.0, "step": 13389 }, { "entropy": 0.551855793222785, "epoch": 1.2319480624033214, "grad_norm": 0.15533652901649475, "learning_rate": 5.8938264789769074e-05, "loss": 0.5477, "mean_token_accuracy": 0.8330289721488953, "num_tokens": 427392574.0, "step": 13390 }, { "entropy": 0.6398058831691742, "epoch": 1.2320400687747626, "grad_norm": 0.1638793796300888, "learning_rate": 5.893519796362744e-05, "loss": 0.6327, "mean_token_accuracy": 0.8064146637916565, "num_tokens": 427424534.0, "step": 13391 }, { "entropy": 0.5811767689883709, "epoch": 1.232132075146204, "grad_norm": 0.15566757321357727, "learning_rate": 5.8932131137485823e-05, "loss": 0.5715, "mean_token_accuracy": 0.8231801763176918, "num_tokens": 427455474.0, "step": 13392 }, { "entropy": 0.5370157277211547, "epoch": 1.232224081517645, "grad_norm": 0.15402750670909882, "learning_rate": 5.89290643113442e-05, "loss": 0.5126, "mean_token_accuracy": 0.8442453481256962, "num_tokens": 427486392.0, "step": 13393 }, { "entropy": 0.5986258676275611, "epoch": 1.2323160878890862, "grad_norm": 0.1559285968542099, "learning_rate": 5.8925997485202566e-05, "loss": 0.5858, "mean_token_accuracy": 0.82054078951478, "num_tokens": 427518592.0, "step": 13394 }, { "entropy": 0.5570327062159777, "epoch": 1.2324080942605276, "grad_norm": 0.16505245864391327, "learning_rate": 5.892293065906094e-05, "loss": 0.547, "mean_token_accuracy": 0.8328560143709183, "num_tokens": 427549448.0, "step": 13395 }, { "entropy": 0.6364135071635246, "epoch": 1.2325001006319687, "grad_norm": 0.15946276485919952, "learning_rate": 5.891986383291932e-05, "loss": 0.6398, "mean_token_accuracy": 0.8053694069385529, "num_tokens": 427581085.0, "step": 13396 }, { "entropy": 0.6437008082866669, "epoch": 1.23259210700341, "grad_norm": 0.17442260682582855, "learning_rate": 5.891679700677769e-05, "loss": 0.6526, "mean_token_accuracy": 0.8046580702066422, "num_tokens": 427612880.0, "step": 13397 }, { "entropy": 0.6567103583365679, "epoch": 1.2326841133748512, "grad_norm": 0.1602054238319397, "learning_rate": 5.8913730180636065e-05, "loss": 0.6495, "mean_token_accuracy": 0.8016152791678905, "num_tokens": 427644677.0, "step": 13398 }, { "entropy": 0.6793159395456314, "epoch": 1.2327761197462923, "grad_norm": 0.15781457722187042, "learning_rate": 5.891066335449443e-05, "loss": 0.6901, "mean_token_accuracy": 0.7942089289426804, "num_tokens": 427677328.0, "step": 13399 }, { "entropy": 0.6408419609069824, "epoch": 1.2328681261177337, "grad_norm": 0.16033349931240082, "learning_rate": 5.8907596528352814e-05, "loss": 0.6317, "mean_token_accuracy": 0.8058685064315796, "num_tokens": 427709109.0, "step": 13400 }, { "entropy": 0.7008167654275894, "epoch": 1.2329601324891748, "grad_norm": 0.16167660057544708, "learning_rate": 5.890452970221119e-05, "loss": 0.669, "mean_token_accuracy": 0.7948584817349911, "num_tokens": 427739988.0, "step": 13401 }, { "entropy": 0.6364569123834372, "epoch": 1.2330521388606162, "grad_norm": 0.1615370362997055, "learning_rate": 5.8901462876069556e-05, "loss": 0.6203, "mean_token_accuracy": 0.8084508590400219, "num_tokens": 427771894.0, "step": 13402 }, { "entropy": 0.5639573941007257, "epoch": 1.2331441452320573, "grad_norm": 0.16622672975063324, "learning_rate": 5.889839604992793e-05, "loss": 0.5556, "mean_token_accuracy": 0.8281468078494072, "num_tokens": 427803544.0, "step": 13403 }, { "entropy": 0.7297418583184481, "epoch": 1.2332361516034984, "grad_norm": 0.16418509185314178, "learning_rate": 5.889532922378631e-05, "loss": 0.7203, "mean_token_accuracy": 0.7822202369570732, "num_tokens": 427835301.0, "step": 13404 }, { "entropy": 0.6153154857456684, "epoch": 1.2333281579749398, "grad_norm": 0.1638842523097992, "learning_rate": 5.889226239764468e-05, "loss": 0.6078, "mean_token_accuracy": 0.8150176592171192, "num_tokens": 427867463.0, "step": 13405 }, { "entropy": 0.5948311076499522, "epoch": 1.233420164346381, "grad_norm": 0.15492583811283112, "learning_rate": 5.8889195571503055e-05, "loss": 0.572, "mean_token_accuracy": 0.8211899437010288, "num_tokens": 427899287.0, "step": 13406 }, { "entropy": 0.6639568619430065, "epoch": 1.2335121707178223, "grad_norm": 0.15321284532546997, "learning_rate": 5.888612874536142e-05, "loss": 0.6485, "mean_token_accuracy": 0.8008996918797493, "num_tokens": 427931141.0, "step": 13407 }, { "entropy": 0.5952378152869642, "epoch": 1.2336041770892634, "grad_norm": 0.15837092697620392, "learning_rate": 5.8883061919219804e-05, "loss": 0.5876, "mean_token_accuracy": 0.821228601038456, "num_tokens": 427962791.0, "step": 13408 }, { "entropy": 0.5730472784489393, "epoch": 1.2336961834607045, "grad_norm": 0.15889808535575867, "learning_rate": 5.887999509307818e-05, "loss": 0.5509, "mean_token_accuracy": 0.8294570222496986, "num_tokens": 427993954.0, "step": 13409 }, { "entropy": 0.6535204313695431, "epoch": 1.2337881898321459, "grad_norm": 0.15871579945087433, "learning_rate": 5.887692826693655e-05, "loss": 0.6525, "mean_token_accuracy": 0.7964617237448692, "num_tokens": 428025991.0, "step": 13410 }, { "entropy": 0.78292072750628, "epoch": 1.233880196203587, "grad_norm": 0.16531136631965637, "learning_rate": 5.887386144079492e-05, "loss": 0.7741, "mean_token_accuracy": 0.7668449468910694, "num_tokens": 428058119.0, "step": 13411 }, { "entropy": 0.7157217133790255, "epoch": 1.2339722025750284, "grad_norm": 0.16059309244155884, "learning_rate": 5.88707946146533e-05, "loss": 0.7092, "mean_token_accuracy": 0.7856179513037205, "num_tokens": 428090827.0, "step": 13412 }, { "entropy": 0.6306106336414814, "epoch": 1.2340642089464695, "grad_norm": 0.1547502726316452, "learning_rate": 5.886772778851167e-05, "loss": 0.6082, "mean_token_accuracy": 0.8132478073239326, "num_tokens": 428122681.0, "step": 13413 }, { "entropy": 0.5968686724081635, "epoch": 1.2341562153179106, "grad_norm": 0.1574159860610962, "learning_rate": 5.8864660962370045e-05, "loss": 0.5806, "mean_token_accuracy": 0.8223661594092846, "num_tokens": 428154982.0, "step": 13414 }, { "entropy": 0.5733635872602463, "epoch": 1.234248221689352, "grad_norm": 0.15315109491348267, "learning_rate": 5.886159413622841e-05, "loss": 0.5669, "mean_token_accuracy": 0.8276055604219437, "num_tokens": 428186640.0, "step": 13415 }, { "entropy": 0.4284244840964675, "epoch": 1.2343402280607931, "grad_norm": 0.14110495150089264, "learning_rate": 5.8858527310086795e-05, "loss": 0.4047, "mean_token_accuracy": 0.8730539157986641, "num_tokens": 428218775.0, "step": 13416 }, { "entropy": 0.6498561315238476, "epoch": 1.2344322344322345, "grad_norm": 0.16389070451259613, "learning_rate": 5.885546048394517e-05, "loss": 0.6575, "mean_token_accuracy": 0.8046083487570286, "num_tokens": 428250472.0, "step": 13417 }, { "entropy": 0.6827135356143117, "epoch": 1.2345242408036756, "grad_norm": 0.16425132751464844, "learning_rate": 5.885239365780354e-05, "loss": 0.6677, "mean_token_accuracy": 0.7981232367455959, "num_tokens": 428282320.0, "step": 13418 }, { "entropy": 0.6045280378311872, "epoch": 1.2346162471751168, "grad_norm": 0.15002217888832092, "learning_rate": 5.884932683166191e-05, "loss": 0.5916, "mean_token_accuracy": 0.8203990906476974, "num_tokens": 428314324.0, "step": 13419 }, { "entropy": 0.6142421923577785, "epoch": 1.234708253546558, "grad_norm": 0.15734440088272095, "learning_rate": 5.884626000552029e-05, "loss": 0.5978, "mean_token_accuracy": 0.8177132196724415, "num_tokens": 428346286.0, "step": 13420 }, { "entropy": 0.5867367526516318, "epoch": 1.2348002599179992, "grad_norm": 0.15563786029815674, "learning_rate": 5.884319317937866e-05, "loss": 0.5748, "mean_token_accuracy": 0.8251416087150574, "num_tokens": 428378403.0, "step": 13421 }, { "entropy": 0.685653967782855, "epoch": 1.2348922662894406, "grad_norm": 0.16297423839569092, "learning_rate": 5.8840126353237036e-05, "loss": 0.6827, "mean_token_accuracy": 0.7950894385576248, "num_tokens": 428410308.0, "step": 13422 }, { "entropy": 0.6087547289207578, "epoch": 1.2349842726608817, "grad_norm": 0.16080696880817413, "learning_rate": 5.883705952709542e-05, "loss": 0.5859, "mean_token_accuracy": 0.8212596476078033, "num_tokens": 428442287.0, "step": 13423 }, { "entropy": 0.6213243789970875, "epoch": 1.2350762790323229, "grad_norm": 0.15535570681095123, "learning_rate": 5.8833992700953785e-05, "loss": 0.6173, "mean_token_accuracy": 0.8134682476520538, "num_tokens": 428474235.0, "step": 13424 }, { "entropy": 0.606918117031455, "epoch": 1.2351682854037642, "grad_norm": 0.1594035029411316, "learning_rate": 5.883092587481216e-05, "loss": 0.6078, "mean_token_accuracy": 0.8113574422895908, "num_tokens": 428505943.0, "step": 13425 }, { "entropy": 0.5537551711313426, "epoch": 1.2352602917752054, "grad_norm": 0.14994794130325317, "learning_rate": 5.882785904867053e-05, "loss": 0.5398, "mean_token_accuracy": 0.8369018509984016, "num_tokens": 428538251.0, "step": 13426 }, { "entropy": 0.5898460019379854, "epoch": 1.2353522981466467, "grad_norm": 0.1651187539100647, "learning_rate": 5.8824792222528916e-05, "loss": 0.5815, "mean_token_accuracy": 0.8248382024466991, "num_tokens": 428569706.0, "step": 13427 }, { "entropy": 0.6874966211616993, "epoch": 1.2354443045180878, "grad_norm": 0.16442926228046417, "learning_rate": 5.8821725396387284e-05, "loss": 0.6709, "mean_token_accuracy": 0.7965231202542782, "num_tokens": 428601164.0, "step": 13428 }, { "entropy": 0.6269114012829959, "epoch": 1.235536310889529, "grad_norm": 0.16209842264652252, "learning_rate": 5.881865857024566e-05, "loss": 0.6217, "mean_token_accuracy": 0.8113307729363441, "num_tokens": 428633253.0, "step": 13429 }, { "entropy": 0.5877078818157315, "epoch": 1.2356283172609703, "grad_norm": 0.15749339759349823, "learning_rate": 5.8815591744104026e-05, "loss": 0.5889, "mean_token_accuracy": 0.8181546628475189, "num_tokens": 428665619.0, "step": 13430 }, { "entropy": 0.6448710830882192, "epoch": 1.2357203236324115, "grad_norm": 0.1613968163728714, "learning_rate": 5.881252491796241e-05, "loss": 0.6371, "mean_token_accuracy": 0.8045681975781918, "num_tokens": 428697559.0, "step": 13431 }, { "entropy": 0.5813704542815685, "epoch": 1.2358123300038528, "grad_norm": 0.14814673364162445, "learning_rate": 5.880945809182078e-05, "loss": 0.5696, "mean_token_accuracy": 0.8258935064077377, "num_tokens": 428730211.0, "step": 13432 }, { "entropy": 0.6281665274873376, "epoch": 1.235904336375294, "grad_norm": 0.1561862975358963, "learning_rate": 5.880639126567915e-05, "loss": 0.6188, "mean_token_accuracy": 0.8080056607723236, "num_tokens": 428762235.0, "step": 13433 }, { "entropy": 0.6228580344468355, "epoch": 1.235996342746735, "grad_norm": 0.1522064357995987, "learning_rate": 5.8803324439537525e-05, "loss": 0.6125, "mean_token_accuracy": 0.8112704940140247, "num_tokens": 428794856.0, "step": 13434 }, { "entropy": 0.6038763206452131, "epoch": 1.2360883491181764, "grad_norm": 0.16917534172534943, "learning_rate": 5.8800257613395906e-05, "loss": 0.5934, "mean_token_accuracy": 0.814390029758215, "num_tokens": 428827056.0, "step": 13435 }, { "entropy": 0.6157181784510612, "epoch": 1.2361803554896176, "grad_norm": 0.1603897213935852, "learning_rate": 5.8797190787254274e-05, "loss": 0.6069, "mean_token_accuracy": 0.8134528808295727, "num_tokens": 428858814.0, "step": 13436 }, { "entropy": 0.5979391690343618, "epoch": 1.236272361861059, "grad_norm": 0.15228715538978577, "learning_rate": 5.879412396111265e-05, "loss": 0.5855, "mean_token_accuracy": 0.8186348266899586, "num_tokens": 428890301.0, "step": 13437 }, { "entropy": 0.5802043909206986, "epoch": 1.2363643682325, "grad_norm": 0.1535598784685135, "learning_rate": 5.8791057134971017e-05, "loss": 0.5706, "mean_token_accuracy": 0.8219574838876724, "num_tokens": 428922355.0, "step": 13438 }, { "entropy": 0.6903489604592323, "epoch": 1.2364563746039412, "grad_norm": 0.16552825272083282, "learning_rate": 5.87879903088294e-05, "loss": 0.6844, "mean_token_accuracy": 0.7965548522770405, "num_tokens": 428953857.0, "step": 13439 }, { "entropy": 0.6793220490217209, "epoch": 1.2365483809753826, "grad_norm": 0.15532168745994568, "learning_rate": 5.878492348268777e-05, "loss": 0.6553, "mean_token_accuracy": 0.7984054014086723, "num_tokens": 428985334.0, "step": 13440 }, { "entropy": 0.48755977442488074, "epoch": 1.2366403873468237, "grad_norm": 0.1503746211528778, "learning_rate": 5.878185665654614e-05, "loss": 0.4632, "mean_token_accuracy": 0.855194266885519, "num_tokens": 429017096.0, "step": 13441 }, { "entropy": 0.7664265111088753, "epoch": 1.236732393718265, "grad_norm": 0.1839134842157364, "learning_rate": 5.8778789830404515e-05, "loss": 0.7722, "mean_token_accuracy": 0.7698239870369434, "num_tokens": 429048422.0, "step": 13442 }, { "entropy": 0.6720030680298805, "epoch": 1.2368244000897062, "grad_norm": 0.16844002902507782, "learning_rate": 5.8775723004262897e-05, "loss": 0.6689, "mean_token_accuracy": 0.7959161177277565, "num_tokens": 429080146.0, "step": 13443 }, { "entropy": 0.61621009465307, "epoch": 1.2369164064611473, "grad_norm": 0.14858682453632355, "learning_rate": 5.8772656178121264e-05, "loss": 0.6047, "mean_token_accuracy": 0.8154445551335812, "num_tokens": 429112381.0, "step": 13444 }, { "entropy": 0.5884604137390852, "epoch": 1.2370084128325887, "grad_norm": 0.15703490376472473, "learning_rate": 5.876958935197964e-05, "loss": 0.5705, "mean_token_accuracy": 0.8243416398763657, "num_tokens": 429144882.0, "step": 13445 }, { "entropy": 0.7382212169468403, "epoch": 1.2371004192040298, "grad_norm": 0.16359958052635193, "learning_rate": 5.876652252583801e-05, "loss": 0.7215, "mean_token_accuracy": 0.7818636298179626, "num_tokens": 429176331.0, "step": 13446 }, { "entropy": 0.6211536824703217, "epoch": 1.2371924255754712, "grad_norm": 0.15039919316768646, "learning_rate": 5.876345569969639e-05, "loss": 0.6024, "mean_token_accuracy": 0.8184629417955875, "num_tokens": 429208886.0, "step": 13447 }, { "entropy": 0.6394818816334009, "epoch": 1.2372844319469123, "grad_norm": 0.1498263031244278, "learning_rate": 5.876038887355476e-05, "loss": 0.61, "mean_token_accuracy": 0.8136590085923672, "num_tokens": 429241290.0, "step": 13448 }, { "entropy": 0.6410828968510032, "epoch": 1.2373764383183534, "grad_norm": 0.16106201708316803, "learning_rate": 5.875732204741313e-05, "loss": 0.6299, "mean_token_accuracy": 0.8064023852348328, "num_tokens": 429271859.0, "step": 13449 }, { "entropy": 0.5971753392368555, "epoch": 1.2374684446897948, "grad_norm": 0.15658250451087952, "learning_rate": 5.8754255221271506e-05, "loss": 0.591, "mean_token_accuracy": 0.8208846971392632, "num_tokens": 429303761.0, "step": 13450 }, { "entropy": 0.6655870713293552, "epoch": 1.237560451061236, "grad_norm": 0.1669778972864151, "learning_rate": 5.875118839512989e-05, "loss": 0.663, "mean_token_accuracy": 0.802204929292202, "num_tokens": 429335923.0, "step": 13451 }, { "entropy": 0.6755134668201208, "epoch": 1.2376524574326773, "grad_norm": 0.16663379967212677, "learning_rate": 5.8748121568988255e-05, "loss": 0.6598, "mean_token_accuracy": 0.8006080277264118, "num_tokens": 429367066.0, "step": 13452 }, { "entropy": 0.6869114227592945, "epoch": 1.2377444638041184, "grad_norm": 0.15935376286506653, "learning_rate": 5.874505474284663e-05, "loss": 0.6846, "mean_token_accuracy": 0.7967069633305073, "num_tokens": 429398944.0, "step": 13453 }, { "entropy": 0.4430586341768503, "epoch": 1.2378364701755595, "grad_norm": 0.14387726783752441, "learning_rate": 5.874198791670501e-05, "loss": 0.425, "mean_token_accuracy": 0.8665709421038628, "num_tokens": 429430954.0, "step": 13454 }, { "entropy": 0.5024450430646539, "epoch": 1.2379284765470009, "grad_norm": 0.15187714993953705, "learning_rate": 5.873892109056338e-05, "loss": 0.4964, "mean_token_accuracy": 0.8467492870986462, "num_tokens": 429462999.0, "step": 13455 }, { "entropy": 0.525319155305624, "epoch": 1.238020482918442, "grad_norm": 0.16442181169986725, "learning_rate": 5.8735854264421753e-05, "loss": 0.5175, "mean_token_accuracy": 0.8388881199061871, "num_tokens": 429494702.0, "step": 13456 }, { "entropy": 0.6814172305166721, "epoch": 1.2381124892898834, "grad_norm": 0.1648281216621399, "learning_rate": 5.873278743828012e-05, "loss": 0.6832, "mean_token_accuracy": 0.797504972666502, "num_tokens": 429526319.0, "step": 13457 }, { "entropy": 0.5915819238871336, "epoch": 1.2382044956613245, "grad_norm": 0.15487509965896606, "learning_rate": 5.87297206121385e-05, "loss": 0.5857, "mean_token_accuracy": 0.8224320933222771, "num_tokens": 429559056.0, "step": 13458 }, { "entropy": 0.7147410474717617, "epoch": 1.2382965020327656, "grad_norm": 0.16500882804393768, "learning_rate": 5.872665378599688e-05, "loss": 0.7098, "mean_token_accuracy": 0.784333985298872, "num_tokens": 429590716.0, "step": 13459 }, { "entropy": 0.5925349583849311, "epoch": 1.238388508404207, "grad_norm": 0.1522141844034195, "learning_rate": 5.8723586959855245e-05, "loss": 0.5772, "mean_token_accuracy": 0.822451014071703, "num_tokens": 429622382.0, "step": 13460 }, { "entropy": 0.5974573204293847, "epoch": 1.2384805147756481, "grad_norm": 0.17175450921058655, "learning_rate": 5.872052013371362e-05, "loss": 0.5711, "mean_token_accuracy": 0.8247728906571865, "num_tokens": 429654451.0, "step": 13461 }, { "entropy": 0.6241476866416633, "epoch": 1.2385725211470895, "grad_norm": 0.155990868806839, "learning_rate": 5.8717453307572e-05, "loss": 0.6091, "mean_token_accuracy": 0.8129206337034702, "num_tokens": 429686628.0, "step": 13462 }, { "entropy": 0.6264461409300566, "epoch": 1.2386645275185306, "grad_norm": 0.15187351405620575, "learning_rate": 5.871438648143037e-05, "loss": 0.6221, "mean_token_accuracy": 0.8115541897714138, "num_tokens": 429718698.0, "step": 13463 }, { "entropy": 0.6454753447324038, "epoch": 1.2387565338899718, "grad_norm": 0.16145268082618713, "learning_rate": 5.8711319655288744e-05, "loss": 0.6436, "mean_token_accuracy": 0.8044914677739143, "num_tokens": 429751120.0, "step": 13464 }, { "entropy": 0.622252251021564, "epoch": 1.2388485402614131, "grad_norm": 0.16505315899848938, "learning_rate": 5.870825282914711e-05, "loss": 0.6078, "mean_token_accuracy": 0.8140260055661201, "num_tokens": 429783091.0, "step": 13465 }, { "entropy": 0.6603395789861679, "epoch": 1.2389405466328542, "grad_norm": 0.15763749182224274, "learning_rate": 5.87051860030055e-05, "loss": 0.6683, "mean_token_accuracy": 0.7963934950530529, "num_tokens": 429815158.0, "step": 13466 }, { "entropy": 0.6292084511369467, "epoch": 1.2390325530042956, "grad_norm": 0.15660446882247925, "learning_rate": 5.870211917686387e-05, "loss": 0.604, "mean_token_accuracy": 0.8138937205076218, "num_tokens": 429847411.0, "step": 13467 }, { "entropy": 0.6929601635783911, "epoch": 1.2391245593757367, "grad_norm": 0.16702772676944733, "learning_rate": 5.8699052350722236e-05, "loss": 0.6735, "mean_token_accuracy": 0.7974533513188362, "num_tokens": 429879789.0, "step": 13468 }, { "entropy": 0.5929981898516417, "epoch": 1.2392165657471779, "grad_norm": 0.15737242996692657, "learning_rate": 5.869598552458061e-05, "loss": 0.567, "mean_token_accuracy": 0.8246527835726738, "num_tokens": 429910892.0, "step": 13469 }, { "entropy": 0.6852457271888852, "epoch": 1.2393085721186192, "grad_norm": 0.1531020998954773, "learning_rate": 5.869291869843899e-05, "loss": 0.6565, "mean_token_accuracy": 0.7986118644475937, "num_tokens": 429942843.0, "step": 13470 }, { "entropy": 0.5994620807468891, "epoch": 1.2394005784900604, "grad_norm": 0.15968815982341766, "learning_rate": 5.8689851872297366e-05, "loss": 0.5917, "mean_token_accuracy": 0.8210483007133007, "num_tokens": 429974658.0, "step": 13471 }, { "entropy": 0.5744737051427364, "epoch": 1.2394925848615017, "grad_norm": 0.15830989181995392, "learning_rate": 5.8686785046155734e-05, "loss": 0.5574, "mean_token_accuracy": 0.8312143497169018, "num_tokens": 430006718.0, "step": 13472 }, { "entropy": 0.5611130632460117, "epoch": 1.2395845912329428, "grad_norm": 0.15984316170215607, "learning_rate": 5.868371822001411e-05, "loss": 0.5465, "mean_token_accuracy": 0.8309947364032269, "num_tokens": 430038457.0, "step": 13473 }, { "entropy": 0.6283718515187502, "epoch": 1.2396765976043842, "grad_norm": 0.15987084805965424, "learning_rate": 5.868065139387249e-05, "loss": 0.6223, "mean_token_accuracy": 0.8128928653895855, "num_tokens": 430069990.0, "step": 13474 }, { "entropy": 0.6126599796116352, "epoch": 1.2397686039758253, "grad_norm": 0.16323666274547577, "learning_rate": 5.867758456773086e-05, "loss": 0.6099, "mean_token_accuracy": 0.8128771595656872, "num_tokens": 430102070.0, "step": 13475 }, { "entropy": 0.61398970708251, "epoch": 1.2398606103472665, "grad_norm": 0.15428270399570465, "learning_rate": 5.867451774158923e-05, "loss": 0.6042, "mean_token_accuracy": 0.8196262270212173, "num_tokens": 430133628.0, "step": 13476 }, { "entropy": 0.6784104518592358, "epoch": 1.2399526167187078, "grad_norm": 0.1593165248632431, "learning_rate": 5.86714509154476e-05, "loss": 0.6886, "mean_token_accuracy": 0.7955339699983597, "num_tokens": 430165915.0, "step": 13477 }, { "entropy": 0.6261078184470534, "epoch": 1.240044623090149, "grad_norm": 0.1614503562450409, "learning_rate": 5.866838408930598e-05, "loss": 0.6, "mean_token_accuracy": 0.811595194041729, "num_tokens": 430197602.0, "step": 13478 }, { "entropy": 0.6156491423025727, "epoch": 1.2401366294615903, "grad_norm": 0.1542300134897232, "learning_rate": 5.866531726316436e-05, "loss": 0.6096, "mean_token_accuracy": 0.8139000423252583, "num_tokens": 430229673.0, "step": 13479 }, { "entropy": 0.5326061146333814, "epoch": 1.2402286358330314, "grad_norm": 0.1501654088497162, "learning_rate": 5.8662250437022725e-05, "loss": 0.527, "mean_token_accuracy": 0.8387362398207188, "num_tokens": 430261864.0, "step": 13480 }, { "entropy": 0.6247670073062181, "epoch": 1.2403206422044726, "grad_norm": 0.1645587980747223, "learning_rate": 5.86591836108811e-05, "loss": 0.6136, "mean_token_accuracy": 0.8184154257178307, "num_tokens": 430294479.0, "step": 13481 }, { "entropy": 0.6511237621307373, "epoch": 1.240412648575914, "grad_norm": 0.15750113129615784, "learning_rate": 5.865611678473948e-05, "loss": 0.6449, "mean_token_accuracy": 0.8056518547236919, "num_tokens": 430326135.0, "step": 13482 }, { "entropy": 0.6746707521378994, "epoch": 1.240504654947355, "grad_norm": 0.15803878009319305, "learning_rate": 5.865304995859785e-05, "loss": 0.6562, "mean_token_accuracy": 0.7943121716380119, "num_tokens": 430357579.0, "step": 13483 }, { "entropy": 0.6278254128992558, "epoch": 1.2405966613187964, "grad_norm": 0.15380606055259705, "learning_rate": 5.864998313245622e-05, "loss": 0.6063, "mean_token_accuracy": 0.8104276396334171, "num_tokens": 430389745.0, "step": 13484 }, { "entropy": 0.6316166166216135, "epoch": 1.2406886676902376, "grad_norm": 0.16159023344516754, "learning_rate": 5.8646916306314605e-05, "loss": 0.6139, "mean_token_accuracy": 0.8113133423030376, "num_tokens": 430421528.0, "step": 13485 }, { "entropy": 0.6673262547701597, "epoch": 1.2407806740616787, "grad_norm": 0.1618277132511139, "learning_rate": 5.864384948017297e-05, "loss": 0.6514, "mean_token_accuracy": 0.8040045537054539, "num_tokens": 430453176.0, "step": 13486 }, { "entropy": 0.6783617623150349, "epoch": 1.24087268043312, "grad_norm": 0.16010984778404236, "learning_rate": 5.864078265403135e-05, "loss": 0.6781, "mean_token_accuracy": 0.7945582866668701, "num_tokens": 430484796.0, "step": 13487 }, { "entropy": 0.5898780040442944, "epoch": 1.2409646868045612, "grad_norm": 0.15143224596977234, "learning_rate": 5.8637715827889715e-05, "loss": 0.5729, "mean_token_accuracy": 0.8222760297358036, "num_tokens": 430516996.0, "step": 13488 }, { "entropy": 0.6978292223066092, "epoch": 1.2410566931760025, "grad_norm": 0.1664000153541565, "learning_rate": 5.8634649001748096e-05, "loss": 0.6927, "mean_token_accuracy": 0.7915643006563187, "num_tokens": 430549277.0, "step": 13489 }, { "entropy": 0.6091406084597111, "epoch": 1.2411486995474437, "grad_norm": 0.15479923784732819, "learning_rate": 5.863158217560647e-05, "loss": 0.5909, "mean_token_accuracy": 0.8188314735889435, "num_tokens": 430580762.0, "step": 13490 }, { "entropy": 0.594437725841999, "epoch": 1.2412407059188848, "grad_norm": 0.16201473772525787, "learning_rate": 5.862851534946484e-05, "loss": 0.5759, "mean_token_accuracy": 0.8223603032529354, "num_tokens": 430612947.0, "step": 13491 }, { "entropy": 0.6373399738222361, "epoch": 1.2413327122903262, "grad_norm": 0.15996097028255463, "learning_rate": 5.8625448523323214e-05, "loss": 0.6343, "mean_token_accuracy": 0.810515072196722, "num_tokens": 430645690.0, "step": 13492 }, { "entropy": 0.6680008042603731, "epoch": 1.2414247186617673, "grad_norm": 0.1606743186712265, "learning_rate": 5.8622381697181595e-05, "loss": 0.6613, "mean_token_accuracy": 0.8028510212898254, "num_tokens": 430677029.0, "step": 13493 }, { "entropy": 0.6866645254194736, "epoch": 1.2415167250332086, "grad_norm": 0.16693685948848724, "learning_rate": 5.861931487103996e-05, "loss": 0.6837, "mean_token_accuracy": 0.7900399193167686, "num_tokens": 430708532.0, "step": 13494 }, { "entropy": 0.5533930072560906, "epoch": 1.2416087314046498, "grad_norm": 0.14948934316635132, "learning_rate": 5.861624804489834e-05, "loss": 0.5316, "mean_token_accuracy": 0.8347533456981182, "num_tokens": 430740954.0, "step": 13495 }, { "entropy": 0.6100653186440468, "epoch": 1.241700737776091, "grad_norm": 0.15542016923427582, "learning_rate": 5.8613181218756705e-05, "loss": 0.6067, "mean_token_accuracy": 0.8136220425367355, "num_tokens": 430773385.0, "step": 13496 }, { "entropy": 0.5539974332787097, "epoch": 1.2417927441475323, "grad_norm": 0.1562240868806839, "learning_rate": 5.861011439261509e-05, "loss": 0.5397, "mean_token_accuracy": 0.8311381302773952, "num_tokens": 430805635.0, "step": 13497 }, { "entropy": 0.6147636752575636, "epoch": 1.2418847505189734, "grad_norm": 0.15571017563343048, "learning_rate": 5.860704756647346e-05, "loss": 0.6061, "mean_token_accuracy": 0.8136125691235065, "num_tokens": 430837810.0, "step": 13498 }, { "entropy": 0.5584591748192906, "epoch": 1.2419767568904148, "grad_norm": 0.15161803364753723, "learning_rate": 5.860398074033183e-05, "loss": 0.5527, "mean_token_accuracy": 0.8314989320933819, "num_tokens": 430870273.0, "step": 13499 }, { "entropy": 0.55952771846205, "epoch": 1.242068763261856, "grad_norm": 0.15429715812206268, "learning_rate": 5.8600913914190204e-05, "loss": 0.5493, "mean_token_accuracy": 0.8326489962637424, "num_tokens": 430901963.0, "step": 13500 }, { "entropy": 0.6509762965142727, "epoch": 1.242160769633297, "grad_norm": 0.1644594967365265, "learning_rate": 5.8597847088048585e-05, "loss": 0.6607, "mean_token_accuracy": 0.7979962453246117, "num_tokens": 430934177.0, "step": 13501 }, { "entropy": 0.5861798273399472, "epoch": 1.2422527760047384, "grad_norm": 0.15759772062301636, "learning_rate": 5.859478026190695e-05, "loss": 0.5902, "mean_token_accuracy": 0.8203009366989136, "num_tokens": 430965095.0, "step": 13502 }, { "entropy": 0.6360366027802229, "epoch": 1.2423447823761795, "grad_norm": 0.15371251106262207, "learning_rate": 5.859171343576533e-05, "loss": 0.6239, "mean_token_accuracy": 0.8065202832221985, "num_tokens": 430996740.0, "step": 13503 }, { "entropy": 0.6301224865019321, "epoch": 1.2424367887476209, "grad_norm": 0.15903310477733612, "learning_rate": 5.8588646609623696e-05, "loss": 0.6207, "mean_token_accuracy": 0.8122281059622765, "num_tokens": 431028509.0, "step": 13504 }, { "entropy": 0.6031939322128892, "epoch": 1.242528795119062, "grad_norm": 0.1818179190158844, "learning_rate": 5.8585579783482084e-05, "loss": 0.5998, "mean_token_accuracy": 0.8156940452754498, "num_tokens": 431060791.0, "step": 13505 }, { "entropy": 0.5747685520909727, "epoch": 1.2426208014905031, "grad_norm": 0.14987117052078247, "learning_rate": 5.858251295734045e-05, "loss": 0.5723, "mean_token_accuracy": 0.8217327520251274, "num_tokens": 431093174.0, "step": 13506 }, { "entropy": 0.7109661204740405, "epoch": 1.2427128078619445, "grad_norm": 0.16305503249168396, "learning_rate": 5.857944613119882e-05, "loss": 0.7108, "mean_token_accuracy": 0.7846770100295544, "num_tokens": 431125761.0, "step": 13507 }, { "entropy": 0.6081267427653074, "epoch": 1.2428048142333856, "grad_norm": 0.1624978929758072, "learning_rate": 5.8576379305057194e-05, "loss": 0.5718, "mean_token_accuracy": 0.821160614490509, "num_tokens": 431157716.0, "step": 13508 }, { "entropy": 0.6069595832377672, "epoch": 1.242896820604827, "grad_norm": 0.15559162199497223, "learning_rate": 5.8573312478915576e-05, "loss": 0.5897, "mean_token_accuracy": 0.8154036365449429, "num_tokens": 431189386.0, "step": 13509 }, { "entropy": 0.5925675109028816, "epoch": 1.2429888269762681, "grad_norm": 0.15497367084026337, "learning_rate": 5.857024565277395e-05, "loss": 0.5772, "mean_token_accuracy": 0.8204798735678196, "num_tokens": 431221617.0, "step": 13510 }, { "entropy": 0.5995412264019251, "epoch": 1.2430808333477092, "grad_norm": 0.15700607001781464, "learning_rate": 5.856717882663232e-05, "loss": 0.5829, "mean_token_accuracy": 0.8299849927425385, "num_tokens": 431253552.0, "step": 13511 }, { "entropy": 0.7118108198046684, "epoch": 1.2431728397191506, "grad_norm": 0.16879823803901672, "learning_rate": 5.8564112000490686e-05, "loss": 0.7217, "mean_token_accuracy": 0.7904781959950924, "num_tokens": 431285363.0, "step": 13512 }, { "entropy": 0.7546670511364937, "epoch": 1.2432648460905917, "grad_norm": 0.16552932560443878, "learning_rate": 5.8561045174349074e-05, "loss": 0.7376, "mean_token_accuracy": 0.774103756994009, "num_tokens": 431317364.0, "step": 13513 }, { "entropy": 0.6725046169012785, "epoch": 1.243356852462033, "grad_norm": 0.1628207564353943, "learning_rate": 5.855797834820744e-05, "loss": 0.6386, "mean_token_accuracy": 0.8026120886206627, "num_tokens": 431349354.0, "step": 13514 }, { "entropy": 0.6258168276399374, "epoch": 1.2434488588334742, "grad_norm": 0.15652517974376678, "learning_rate": 5.855491152206582e-05, "loss": 0.6184, "mean_token_accuracy": 0.8095082901418209, "num_tokens": 431381569.0, "step": 13515 }, { "entropy": 0.5421446277759969, "epoch": 1.2435408652049154, "grad_norm": 0.14782394468784332, "learning_rate": 5.85518446959242e-05, "loss": 0.5239, "mean_token_accuracy": 0.8353825844824314, "num_tokens": 431413051.0, "step": 13516 }, { "entropy": 0.5443812552839518, "epoch": 1.2436328715763567, "grad_norm": 0.15323564410209656, "learning_rate": 5.8548777869782566e-05, "loss": 0.5343, "mean_token_accuracy": 0.8387059271335602, "num_tokens": 431444810.0, "step": 13517 }, { "entropy": 0.5383858426939696, "epoch": 1.2437248779477978, "grad_norm": 0.1580013781785965, "learning_rate": 5.854571104364094e-05, "loss": 0.5177, "mean_token_accuracy": 0.8379182070493698, "num_tokens": 431476120.0, "step": 13518 }, { "entropy": 0.6624132320284843, "epoch": 1.2438168843192392, "grad_norm": 0.15867194533348083, "learning_rate": 5.854264421749931e-05, "loss": 0.6551, "mean_token_accuracy": 0.7974934577941895, "num_tokens": 431507931.0, "step": 13519 }, { "entropy": 0.6221994804218411, "epoch": 1.2439088906906803, "grad_norm": 0.16077858209609985, "learning_rate": 5.853957739135769e-05, "loss": 0.6098, "mean_token_accuracy": 0.8130468800663948, "num_tokens": 431539696.0, "step": 13520 }, { "entropy": 0.5002462472766638, "epoch": 1.2440008970621215, "grad_norm": 0.15034490823745728, "learning_rate": 5.8536510565216065e-05, "loss": 0.4787, "mean_token_accuracy": 0.8507877327501774, "num_tokens": 431572464.0, "step": 13521 }, { "entropy": 0.6002569161355495, "epoch": 1.2440929034335628, "grad_norm": 0.16642369329929352, "learning_rate": 5.853344373907443e-05, "loss": 0.5861, "mean_token_accuracy": 0.818130623549223, "num_tokens": 431602825.0, "step": 13522 }, { "entropy": 0.6698072999715805, "epoch": 1.244184909805004, "grad_norm": 0.1584080159664154, "learning_rate": 5.853037691293281e-05, "loss": 0.6646, "mean_token_accuracy": 0.7988357730209827, "num_tokens": 431635024.0, "step": 13523 }, { "entropy": 0.5946244345977902, "epoch": 1.2442769161764453, "grad_norm": 0.16195467114448547, "learning_rate": 5.852731008679119e-05, "loss": 0.5976, "mean_token_accuracy": 0.8153934702277184, "num_tokens": 431667377.0, "step": 13524 }, { "entropy": 0.6994889825582504, "epoch": 1.2443689225478864, "grad_norm": 0.16479472815990448, "learning_rate": 5.852424326064956e-05, "loss": 0.6929, "mean_token_accuracy": 0.7915644906461239, "num_tokens": 431699960.0, "step": 13525 }, { "entropy": 0.6136886011809111, "epoch": 1.2444609289193276, "grad_norm": 0.1560410112142563, "learning_rate": 5.852117643450793e-05, "loss": 0.6005, "mean_token_accuracy": 0.8140053115785122, "num_tokens": 431732196.0, "step": 13526 }, { "entropy": 0.6628198903053999, "epoch": 1.244552935290769, "grad_norm": 0.17455020546913147, "learning_rate": 5.85181096083663e-05, "loss": 0.6631, "mean_token_accuracy": 0.8004330284893513, "num_tokens": 431763686.0, "step": 13527 }, { "entropy": 0.6616682009771466, "epoch": 1.24464494166221, "grad_norm": 0.16122765839099884, "learning_rate": 5.851504278222468e-05, "loss": 0.6509, "mean_token_accuracy": 0.8018053993582726, "num_tokens": 431795627.0, "step": 13528 }, { "entropy": 0.5279988199472427, "epoch": 1.2447369480336514, "grad_norm": 0.14384829998016357, "learning_rate": 5.8511975956083055e-05, "loss": 0.5126, "mean_token_accuracy": 0.8391779847443104, "num_tokens": 431827924.0, "step": 13529 }, { "entropy": 0.686291141435504, "epoch": 1.2448289544050926, "grad_norm": 0.15945489704608917, "learning_rate": 5.850890912994142e-05, "loss": 0.6797, "mean_token_accuracy": 0.7910711392760277, "num_tokens": 431860022.0, "step": 13530 }, { "entropy": 0.6336824279278517, "epoch": 1.2449209607765337, "grad_norm": 0.15919534862041473, "learning_rate": 5.85058423037998e-05, "loss": 0.6127, "mean_token_accuracy": 0.8124319687485695, "num_tokens": 431891055.0, "step": 13531 }, { "entropy": 0.6611185558140278, "epoch": 1.245012967147975, "grad_norm": 0.16616344451904297, "learning_rate": 5.850277547765818e-05, "loss": 0.6547, "mean_token_accuracy": 0.8019640780985355, "num_tokens": 431922095.0, "step": 13532 }, { "entropy": 0.5612351316958666, "epoch": 1.2451049735194162, "grad_norm": 0.16020068526268005, "learning_rate": 5.849970865151655e-05, "loss": 0.5378, "mean_token_accuracy": 0.831519365310669, "num_tokens": 431953182.0, "step": 13533 }, { "entropy": 0.6171158980578184, "epoch": 1.2451969798908575, "grad_norm": 0.1496899425983429, "learning_rate": 5.849664182537492e-05, "loss": 0.5882, "mean_token_accuracy": 0.8193084709346294, "num_tokens": 431985610.0, "step": 13534 }, { "entropy": 0.5575939491391182, "epoch": 1.2452889862622987, "grad_norm": 0.14726081490516663, "learning_rate": 5.849357499923329e-05, "loss": 0.5482, "mean_token_accuracy": 0.8296798467636108, "num_tokens": 432018293.0, "step": 13535 }, { "entropy": 0.7294934410601854, "epoch": 1.2453809926337398, "grad_norm": 0.1609850525856018, "learning_rate": 5.849050817309167e-05, "loss": 0.7239, "mean_token_accuracy": 0.7790153957903385, "num_tokens": 432050819.0, "step": 13536 }, { "entropy": 0.7276347652077675, "epoch": 1.2454729990051812, "grad_norm": 0.16883541643619537, "learning_rate": 5.8487441346950046e-05, "loss": 0.7262, "mean_token_accuracy": 0.7852255366742611, "num_tokens": 432083218.0, "step": 13537 }, { "entropy": 0.6129519483074546, "epoch": 1.2455650053766223, "grad_norm": 0.15405769646167755, "learning_rate": 5.8484374520808414e-05, "loss": 0.6022, "mean_token_accuracy": 0.8117906153202057, "num_tokens": 432115129.0, "step": 13538 }, { "entropy": 0.6494015343487263, "epoch": 1.2456570117480636, "grad_norm": 0.16114167869091034, "learning_rate": 5.848130769466679e-05, "loss": 0.6573, "mean_token_accuracy": 0.7980438992381096, "num_tokens": 432147437.0, "step": 13539 }, { "entropy": 0.5814390173181891, "epoch": 1.2457490181195048, "grad_norm": 0.15859095752239227, "learning_rate": 5.847824086852517e-05, "loss": 0.5612, "mean_token_accuracy": 0.8298780098557472, "num_tokens": 432179286.0, "step": 13540 }, { "entropy": 0.7119233086705208, "epoch": 1.245841024490946, "grad_norm": 0.16384780406951904, "learning_rate": 5.847517404238354e-05, "loss": 0.6981, "mean_token_accuracy": 0.7904137782752514, "num_tokens": 432211833.0, "step": 13541 }, { "entropy": 0.6574539472348988, "epoch": 1.2459330308623873, "grad_norm": 0.16414231061935425, "learning_rate": 5.847210721624191e-05, "loss": 0.64, "mean_token_accuracy": 0.8050792068243027, "num_tokens": 432243817.0, "step": 13542 }, { "entropy": 0.5379533302038908, "epoch": 1.2460250372338284, "grad_norm": 0.15731212496757507, "learning_rate": 5.846904039010028e-05, "loss": 0.5172, "mean_token_accuracy": 0.843318447470665, "num_tokens": 432276033.0, "step": 13543 }, { "entropy": 0.7644574795849621, "epoch": 1.2461170436052698, "grad_norm": 0.1699763834476471, "learning_rate": 5.846597356395866e-05, "loss": 0.7542, "mean_token_accuracy": 0.7725793644785881, "num_tokens": 432308491.0, "step": 13544 }, { "entropy": 0.586843641474843, "epoch": 1.246209049976711, "grad_norm": 0.16509824991226196, "learning_rate": 5.8462906737817036e-05, "loss": 0.5691, "mean_token_accuracy": 0.825155645608902, "num_tokens": 432340658.0, "step": 13545 }, { "entropy": 0.6004185006022453, "epoch": 1.246301056348152, "grad_norm": 0.1559741199016571, "learning_rate": 5.8459839911675404e-05, "loss": 0.5841, "mean_token_accuracy": 0.8157529011368752, "num_tokens": 432372886.0, "step": 13546 }, { "entropy": 0.6839172430336475, "epoch": 1.2463930627195934, "grad_norm": 0.15709196031093597, "learning_rate": 5.845677308553379e-05, "loss": 0.6697, "mean_token_accuracy": 0.7995891459286213, "num_tokens": 432404862.0, "step": 13547 }, { "entropy": 0.6588228270411491, "epoch": 1.2464850690910345, "grad_norm": 0.1621522456407547, "learning_rate": 5.845370625939216e-05, "loss": 0.6358, "mean_token_accuracy": 0.804885882884264, "num_tokens": 432436849.0, "step": 13548 }, { "entropy": 0.6215848447754979, "epoch": 1.2465770754624759, "grad_norm": 0.1582815945148468, "learning_rate": 5.8450639433250535e-05, "loss": 0.6115, "mean_token_accuracy": 0.8139011152088642, "num_tokens": 432468997.0, "step": 13549 }, { "entropy": 0.5450646262615919, "epoch": 1.246669081833917, "grad_norm": 0.14948125183582306, "learning_rate": 5.84475726071089e-05, "loss": 0.5391, "mean_token_accuracy": 0.8343516476452351, "num_tokens": 432501095.0, "step": 13550 }, { "entropy": 0.7273653531447053, "epoch": 1.2467610882053581, "grad_norm": 0.1691914200782776, "learning_rate": 5.8444505780967284e-05, "loss": 0.7166, "mean_token_accuracy": 0.7832535654306412, "num_tokens": 432532852.0, "step": 13551 }, { "entropy": 0.6479080226272345, "epoch": 1.2468530945767995, "grad_norm": 0.16146038472652435, "learning_rate": 5.844143895482566e-05, "loss": 0.6443, "mean_token_accuracy": 0.802228257060051, "num_tokens": 432564945.0, "step": 13552 }, { "entropy": 0.6518581379204988, "epoch": 1.2469451009482406, "grad_norm": 0.16434897482395172, "learning_rate": 5.8438372128684026e-05, "loss": 0.6414, "mean_token_accuracy": 0.8001020289957523, "num_tokens": 432596399.0, "step": 13553 }, { "entropy": 0.6322071086615324, "epoch": 1.247037107319682, "grad_norm": 0.15968717634677887, "learning_rate": 5.84353053025424e-05, "loss": 0.6326, "mean_token_accuracy": 0.8093116357922554, "num_tokens": 432628525.0, "step": 13554 }, { "entropy": 0.6333552682772279, "epoch": 1.2471291136911231, "grad_norm": 0.15790694952011108, "learning_rate": 5.843223847640078e-05, "loss": 0.6236, "mean_token_accuracy": 0.8092686757445335, "num_tokens": 432660280.0, "step": 13555 }, { "entropy": 0.6164904367178679, "epoch": 1.2472211200625642, "grad_norm": 0.15962274372577667, "learning_rate": 5.842917165025915e-05, "loss": 0.5984, "mean_token_accuracy": 0.8168250732123852, "num_tokens": 432692017.0, "step": 13556 }, { "entropy": 0.6411498105153441, "epoch": 1.2473131264340056, "grad_norm": 0.1553613245487213, "learning_rate": 5.8426104824117525e-05, "loss": 0.6315, "mean_token_accuracy": 0.8056334219872952, "num_tokens": 432723394.0, "step": 13557 }, { "entropy": 0.5788328826893121, "epoch": 1.2474051328054467, "grad_norm": 0.14970356225967407, "learning_rate": 5.842303799797589e-05, "loss": 0.5674, "mean_token_accuracy": 0.8263806141912937, "num_tokens": 432755699.0, "step": 13558 }, { "entropy": 0.6461909841746092, "epoch": 1.247497139176888, "grad_norm": 0.16533806920051575, "learning_rate": 5.8419971171834274e-05, "loss": 0.6438, "mean_token_accuracy": 0.8047874644398689, "num_tokens": 432787697.0, "step": 13559 }, { "entropy": 0.6061988472938538, "epoch": 1.2475891455483292, "grad_norm": 0.1686784327030182, "learning_rate": 5.841690434569265e-05, "loss": 0.6032, "mean_token_accuracy": 0.817499216645956, "num_tokens": 432820129.0, "step": 13560 }, { "entropy": 0.6989496685564518, "epoch": 1.2476811519197704, "grad_norm": 0.16431134939193726, "learning_rate": 5.841383751955102e-05, "loss": 0.6845, "mean_token_accuracy": 0.7900674566626549, "num_tokens": 432852755.0, "step": 13561 }, { "entropy": 0.7207445949316025, "epoch": 1.2477731582912117, "grad_norm": 0.15922293066978455, "learning_rate": 5.841077069340939e-05, "loss": 0.6999, "mean_token_accuracy": 0.786980614066124, "num_tokens": 432884306.0, "step": 13562 }, { "entropy": 0.7563261780887842, "epoch": 1.2478651646626528, "grad_norm": 0.1663479208946228, "learning_rate": 5.840770386726777e-05, "loss": 0.7477, "mean_token_accuracy": 0.7790796905755997, "num_tokens": 432915948.0, "step": 13563 }, { "entropy": 0.6050158776342869, "epoch": 1.2479571710340942, "grad_norm": 0.15667405724525452, "learning_rate": 5.840463704112614e-05, "loss": 0.5929, "mean_token_accuracy": 0.8154220320284367, "num_tokens": 432947138.0, "step": 13564 }, { "entropy": 0.6108365841209888, "epoch": 1.2480491774055353, "grad_norm": 0.15548670291900635, "learning_rate": 5.8401570214984515e-05, "loss": 0.5965, "mean_token_accuracy": 0.8151691146194935, "num_tokens": 432978424.0, "step": 13565 }, { "entropy": 0.6168243177235126, "epoch": 1.2481411837769765, "grad_norm": 0.1603458672761917, "learning_rate": 5.839850338884288e-05, "loss": 0.5926, "mean_token_accuracy": 0.8190787695348263, "num_tokens": 433010929.0, "step": 13566 }, { "entropy": 0.6113046547397971, "epoch": 1.2482331901484178, "grad_norm": 0.16739551723003387, "learning_rate": 5.8395436562701265e-05, "loss": 0.5945, "mean_token_accuracy": 0.8172762021422386, "num_tokens": 433042187.0, "step": 13567 }, { "entropy": 0.6769581325352192, "epoch": 1.248325196519859, "grad_norm": 0.16136081516742706, "learning_rate": 5.839236973655964e-05, "loss": 0.6658, "mean_token_accuracy": 0.7979142256081104, "num_tokens": 433073685.0, "step": 13568 }, { "entropy": 0.5736592635512352, "epoch": 1.2484172028913003, "grad_norm": 0.18366113305091858, "learning_rate": 5.838930291041801e-05, "loss": 0.5593, "mean_token_accuracy": 0.8324122056365013, "num_tokens": 433105814.0, "step": 13569 }, { "entropy": 0.6664004549384117, "epoch": 1.2485092092627414, "grad_norm": 0.15995897352695465, "learning_rate": 5.838623608427638e-05, "loss": 0.6602, "mean_token_accuracy": 0.7985290139913559, "num_tokens": 433137631.0, "step": 13570 }, { "entropy": 0.650577811524272, "epoch": 1.2486012156341826, "grad_norm": 0.15970934927463531, "learning_rate": 5.838316925813476e-05, "loss": 0.6321, "mean_token_accuracy": 0.8083401210606098, "num_tokens": 433170280.0, "step": 13571 }, { "entropy": 0.5982727948576212, "epoch": 1.248693222005624, "grad_norm": 0.15630251169204712, "learning_rate": 5.838010243199313e-05, "loss": 0.5835, "mean_token_accuracy": 0.8208181895315647, "num_tokens": 433202634.0, "step": 13572 }, { "entropy": 0.5072833825834095, "epoch": 1.248785228377065, "grad_norm": 0.14842307567596436, "learning_rate": 5.8377035605851506e-05, "loss": 0.5034, "mean_token_accuracy": 0.8466499447822571, "num_tokens": 433234315.0, "step": 13573 }, { "entropy": 0.6545376516878605, "epoch": 1.2488772347485064, "grad_norm": 0.1619809865951538, "learning_rate": 5.8373968779709874e-05, "loss": 0.6402, "mean_token_accuracy": 0.8020425513386726, "num_tokens": 433266692.0, "step": 13574 }, { "entropy": 0.48188381362706423, "epoch": 1.2489692411199476, "grad_norm": 0.14114414155483246, "learning_rate": 5.8370901953568255e-05, "loss": 0.4702, "mean_token_accuracy": 0.8553413450717926, "num_tokens": 433298818.0, "step": 13575 }, { "entropy": 0.6324389539659023, "epoch": 1.2490612474913887, "grad_norm": 0.1502128541469574, "learning_rate": 5.836783512742663e-05, "loss": 0.6118, "mean_token_accuracy": 0.8137650936841965, "num_tokens": 433331362.0, "step": 13576 }, { "entropy": 0.7108718436211348, "epoch": 1.24915325386283, "grad_norm": 0.16905659437179565, "learning_rate": 5.8364768301285e-05, "loss": 0.7078, "mean_token_accuracy": 0.7848527431488037, "num_tokens": 433362791.0, "step": 13577 }, { "entropy": 0.5801659333519638, "epoch": 1.2492452602342712, "grad_norm": 0.16089190542697906, "learning_rate": 5.836170147514338e-05, "loss": 0.5687, "mean_token_accuracy": 0.8291189558804035, "num_tokens": 433394817.0, "step": 13578 }, { "entropy": 0.7265507224947214, "epoch": 1.2493372666057125, "grad_norm": 0.16762475669384003, "learning_rate": 5.8358634649001754e-05, "loss": 0.7268, "mean_token_accuracy": 0.7822379544377327, "num_tokens": 433426503.0, "step": 13579 }, { "entropy": 0.5870698569342494, "epoch": 1.2494292729771537, "grad_norm": 0.15566863119602203, "learning_rate": 5.835556782286012e-05, "loss": 0.5776, "mean_token_accuracy": 0.8229421079158783, "num_tokens": 433459271.0, "step": 13580 }, { "entropy": 0.5152214355766773, "epoch": 1.2495212793485948, "grad_norm": 0.16356495022773743, "learning_rate": 5.8352500996718496e-05, "loss": 0.5098, "mean_token_accuracy": 0.8405087701976299, "num_tokens": 433491760.0, "step": 13581 }, { "entropy": 0.5941928261891007, "epoch": 1.2496132857200362, "grad_norm": 0.15254025161266327, "learning_rate": 5.834943417057688e-05, "loss": 0.5827, "mean_token_accuracy": 0.8201040327548981, "num_tokens": 433524243.0, "step": 13582 }, { "entropy": 0.627136318013072, "epoch": 1.2497052920914773, "grad_norm": 0.1646062284708023, "learning_rate": 5.8346367344435246e-05, "loss": 0.6356, "mean_token_accuracy": 0.8024653010070324, "num_tokens": 433555926.0, "step": 13583 }, { "entropy": 0.6342028006911278, "epoch": 1.2497972984629186, "grad_norm": 0.158645361661911, "learning_rate": 5.834330051829362e-05, "loss": 0.6284, "mean_token_accuracy": 0.8067393749952316, "num_tokens": 433588047.0, "step": 13584 }, { "entropy": 0.7749241404235363, "epoch": 1.2498893048343598, "grad_norm": 0.1737881451845169, "learning_rate": 5.834023369215199e-05, "loss": 0.7686, "mean_token_accuracy": 0.7678365670144558, "num_tokens": 433619710.0, "step": 13585 }, { "entropy": 0.7444337513297796, "epoch": 1.249981311205801, "grad_norm": 0.16746576130390167, "learning_rate": 5.8337166866010376e-05, "loss": 0.718, "mean_token_accuracy": 0.7798621952533722, "num_tokens": 433650814.0, "step": 13586 }, { "entropy": 0.6744423303753138, "epoch": 1.2500733175772423, "grad_norm": 0.1580801159143448, "learning_rate": 5.8334100039868744e-05, "loss": 0.6737, "mean_token_accuracy": 0.7917984873056412, "num_tokens": 433682831.0, "step": 13587 }, { "entropy": 0.6697842674329877, "epoch": 1.2501653239486834, "grad_norm": 0.16270826756954193, "learning_rate": 5.833103321372711e-05, "loss": 0.6634, "mean_token_accuracy": 0.8004623837769032, "num_tokens": 433714700.0, "step": 13588 }, { "entropy": 0.6101587247103453, "epoch": 1.2502573303201245, "grad_norm": 0.15851427614688873, "learning_rate": 5.832796638758549e-05, "loss": 0.5917, "mean_token_accuracy": 0.8199047036468983, "num_tokens": 433745303.0, "step": 13589 }, { "entropy": 0.6925514582544565, "epoch": 1.250349336691566, "grad_norm": 0.16202689707279205, "learning_rate": 5.832489956144387e-05, "loss": 0.6874, "mean_token_accuracy": 0.7926772609353065, "num_tokens": 433776908.0, "step": 13590 }, { "entropy": 0.5882102251052856, "epoch": 1.2504413430630072, "grad_norm": 0.150215283036232, "learning_rate": 5.832183273530224e-05, "loss": 0.5728, "mean_token_accuracy": 0.825865413993597, "num_tokens": 433808954.0, "step": 13591 }, { "entropy": 0.6289986539632082, "epoch": 1.2505333494344484, "grad_norm": 0.1580798476934433, "learning_rate": 5.831876590916061e-05, "loss": 0.5952, "mean_token_accuracy": 0.8144492879509926, "num_tokens": 433840428.0, "step": 13592 }, { "entropy": 0.6850251480937004, "epoch": 1.2506253558058895, "grad_norm": 0.15445822477340698, "learning_rate": 5.8315699083018985e-05, "loss": 0.6685, "mean_token_accuracy": 0.7940789982676506, "num_tokens": 433871940.0, "step": 13593 }, { "entropy": 0.6937677906826138, "epoch": 1.2507173621773306, "grad_norm": 0.17444536089897156, "learning_rate": 5.831263225687737e-05, "loss": 0.6839, "mean_token_accuracy": 0.7875981554389, "num_tokens": 433903266.0, "step": 13594 }, { "entropy": 0.6051407810300589, "epoch": 1.250809368548772, "grad_norm": 0.15545816719532013, "learning_rate": 5.8309565430735735e-05, "loss": 0.5876, "mean_token_accuracy": 0.8209045305848122, "num_tokens": 433935716.0, "step": 13595 }, { "entropy": 0.5564764784649014, "epoch": 1.2509013749202134, "grad_norm": 0.1519545316696167, "learning_rate": 5.830649860459411e-05, "loss": 0.5396, "mean_token_accuracy": 0.8310263156890869, "num_tokens": 433968092.0, "step": 13596 }, { "entropy": 0.5316421296447515, "epoch": 1.2509933812916545, "grad_norm": 0.15023034811019897, "learning_rate": 5.830343177845248e-05, "loss": 0.5175, "mean_token_accuracy": 0.8434770032763481, "num_tokens": 434000154.0, "step": 13597 }, { "entropy": 0.6941378936171532, "epoch": 1.2510853876630956, "grad_norm": 0.1642829328775406, "learning_rate": 5.830036495231086e-05, "loss": 0.6805, "mean_token_accuracy": 0.7958221882581711, "num_tokens": 434031785.0, "step": 13598 }, { "entropy": 0.6135280653834343, "epoch": 1.2511773940345368, "grad_norm": 0.15915237367153168, "learning_rate": 5.829729812616923e-05, "loss": 0.6144, "mean_token_accuracy": 0.8115504011511803, "num_tokens": 434063940.0, "step": 13599 }, { "entropy": 0.55869853310287, "epoch": 1.2512694004059781, "grad_norm": 0.1501564234495163, "learning_rate": 5.82942313000276e-05, "loss": 0.5565, "mean_token_accuracy": 0.8276578187942505, "num_tokens": 434095579.0, "step": 13600 }, { "entropy": 0.5352748651057482, "epoch": 1.2513614067774195, "grad_norm": 0.1491609662771225, "learning_rate": 5.8291164473885976e-05, "loss": 0.5315, "mean_token_accuracy": 0.8346877247095108, "num_tokens": 434127494.0, "step": 13601 }, { "entropy": 0.589847844094038, "epoch": 1.2514534131488606, "grad_norm": 0.1564723402261734, "learning_rate": 5.828809764774436e-05, "loss": 0.5847, "mean_token_accuracy": 0.8182928673923016, "num_tokens": 434159801.0, "step": 13602 }, { "entropy": 0.6257422268390656, "epoch": 1.2515454195203017, "grad_norm": 0.1558103859424591, "learning_rate": 5.8285030821602725e-05, "loss": 0.6148, "mean_token_accuracy": 0.8159666918218136, "num_tokens": 434191091.0, "step": 13603 }, { "entropy": 0.5929930591955781, "epoch": 1.2516374258917429, "grad_norm": 0.14978595077991486, "learning_rate": 5.82819639954611e-05, "loss": 0.574, "mean_token_accuracy": 0.8183021433651447, "num_tokens": 434223511.0, "step": 13604 }, { "entropy": 0.545425727032125, "epoch": 1.2517294322631842, "grad_norm": 0.15911944210529327, "learning_rate": 5.827889716931947e-05, "loss": 0.5417, "mean_token_accuracy": 0.8324592709541321, "num_tokens": 434255512.0, "step": 13605 }, { "entropy": 0.5835385480895638, "epoch": 1.2518214386346256, "grad_norm": 0.15905387699604034, "learning_rate": 5.827583034317785e-05, "loss": 0.5679, "mean_token_accuracy": 0.8223843239247799, "num_tokens": 434287601.0, "step": 13606 }, { "entropy": 0.5735831633210182, "epoch": 1.2519134450060667, "grad_norm": 0.15574988722801208, "learning_rate": 5.8272763517036224e-05, "loss": 0.5626, "mean_token_accuracy": 0.8262788243591785, "num_tokens": 434319540.0, "step": 13607 }, { "entropy": 0.6436597658321261, "epoch": 1.2520054513775078, "grad_norm": 0.15553101897239685, "learning_rate": 5.826969669089459e-05, "loss": 0.6406, "mean_token_accuracy": 0.8024387545883656, "num_tokens": 434351094.0, "step": 13608 }, { "entropy": 0.5639484319835901, "epoch": 1.252097457748949, "grad_norm": 0.1593909114599228, "learning_rate": 5.826662986475297e-05, "loss": 0.5607, "mean_token_accuracy": 0.827514573931694, "num_tokens": 434383452.0, "step": 13609 }, { "entropy": 0.5543096344918013, "epoch": 1.2521894641203903, "grad_norm": 0.15684348344802856, "learning_rate": 5.826356303861135e-05, "loss": 0.5564, "mean_token_accuracy": 0.8274409435689449, "num_tokens": 434415146.0, "step": 13610 }, { "entropy": 0.5915232533589005, "epoch": 1.2522814704918317, "grad_norm": 0.152741938829422, "learning_rate": 5.8260496212469715e-05, "loss": 0.572, "mean_token_accuracy": 0.8244687281548977, "num_tokens": 434447914.0, "step": 13611 }, { "entropy": 0.6014915350824594, "epoch": 1.2523734768632728, "grad_norm": 0.15750928223133087, "learning_rate": 5.825742938632809e-05, "loss": 0.5983, "mean_token_accuracy": 0.8186559975147247, "num_tokens": 434480279.0, "step": 13612 }, { "entropy": 0.5507243783213198, "epoch": 1.252465483234714, "grad_norm": 0.15290828049182892, "learning_rate": 5.825436256018647e-05, "loss": 0.5318, "mean_token_accuracy": 0.8368194289505482, "num_tokens": 434512097.0, "step": 13613 }, { "entropy": 0.6398242292925715, "epoch": 1.252557489606155, "grad_norm": 0.16185437142848969, "learning_rate": 5.825129573404484e-05, "loss": 0.6143, "mean_token_accuracy": 0.8103312142193317, "num_tokens": 434543929.0, "step": 13614 }, { "entropy": 0.5687246369197965, "epoch": 1.2526494959775964, "grad_norm": 0.15386071801185608, "learning_rate": 5.8248228907903214e-05, "loss": 0.5559, "mean_token_accuracy": 0.8309563584625721, "num_tokens": 434576303.0, "step": 13615 }, { "entropy": 0.6424074955284595, "epoch": 1.2527415023490378, "grad_norm": 0.16532748937606812, "learning_rate": 5.824516208176158e-05, "loss": 0.6213, "mean_token_accuracy": 0.8094907663762569, "num_tokens": 434608449.0, "step": 13616 }, { "entropy": 0.6610729414969683, "epoch": 1.252833508720479, "grad_norm": 0.1580122411251068, "learning_rate": 5.824209525561996e-05, "loss": 0.6518, "mean_token_accuracy": 0.7996850423514843, "num_tokens": 434640146.0, "step": 13617 }, { "entropy": 0.6328689716756344, "epoch": 1.25292551509192, "grad_norm": 0.1583128124475479, "learning_rate": 5.823902842947834e-05, "loss": 0.6289, "mean_token_accuracy": 0.8111495934426785, "num_tokens": 434671957.0, "step": 13618 }, { "entropy": 0.6377339735627174, "epoch": 1.2530175214633612, "grad_norm": 0.15829838812351227, "learning_rate": 5.8235961603336706e-05, "loss": 0.6302, "mean_token_accuracy": 0.8068484589457512, "num_tokens": 434704279.0, "step": 13619 }, { "entropy": 0.7601367719471455, "epoch": 1.2531095278348026, "grad_norm": 0.16766640543937683, "learning_rate": 5.823289477719508e-05, "loss": 0.7652, "mean_token_accuracy": 0.7722020521759987, "num_tokens": 434735636.0, "step": 13620 }, { "entropy": 0.6200429936870933, "epoch": 1.253201534206244, "grad_norm": 0.15310364961624146, "learning_rate": 5.822982795105346e-05, "loss": 0.5906, "mean_token_accuracy": 0.8164769411087036, "num_tokens": 434767257.0, "step": 13621 }, { "entropy": 0.6331547386944294, "epoch": 1.253293540577685, "grad_norm": 0.1562199741601944, "learning_rate": 5.822676112491183e-05, "loss": 0.6159, "mean_token_accuracy": 0.8146170899271965, "num_tokens": 434800000.0, "step": 13622 }, { "entropy": 0.5620622523128986, "epoch": 1.2533855469491262, "grad_norm": 0.15183494985103607, "learning_rate": 5.8223694298770204e-05, "loss": 0.5481, "mean_token_accuracy": 0.8336027972400188, "num_tokens": 434831412.0, "step": 13623 }, { "entropy": 0.5046822112053633, "epoch": 1.2534775533205673, "grad_norm": 0.15086548030376434, "learning_rate": 5.822062747262857e-05, "loss": 0.4968, "mean_token_accuracy": 0.8424895741045475, "num_tokens": 434862680.0, "step": 13624 }, { "entropy": 0.7350164316594601, "epoch": 1.2535695596920087, "grad_norm": 0.16614554822444916, "learning_rate": 5.821756064648696e-05, "loss": 0.7416, "mean_token_accuracy": 0.7771963551640511, "num_tokens": 434895107.0, "step": 13625 }, { "entropy": 0.4535769382491708, "epoch": 1.25366156606345, "grad_norm": 0.15286265313625336, "learning_rate": 5.821449382034533e-05, "loss": 0.4235, "mean_token_accuracy": 0.8690435811877251, "num_tokens": 434926515.0, "step": 13626 }, { "entropy": 0.690495241433382, "epoch": 1.2537535724348912, "grad_norm": 0.15991295874118805, "learning_rate": 5.8211426994203696e-05, "loss": 0.6857, "mean_token_accuracy": 0.7944705300033092, "num_tokens": 434958587.0, "step": 13627 }, { "entropy": 0.6072365585714579, "epoch": 1.2538455788063323, "grad_norm": 0.16131538152694702, "learning_rate": 5.820836016806207e-05, "loss": 0.5881, "mean_token_accuracy": 0.8207561261951923, "num_tokens": 434990694.0, "step": 13628 }, { "entropy": 0.5765265468508005, "epoch": 1.2539375851777734, "grad_norm": 0.15532363951206207, "learning_rate": 5.820529334192045e-05, "loss": 0.5632, "mean_token_accuracy": 0.8255302868783474, "num_tokens": 435022751.0, "step": 13629 }, { "entropy": 0.5916787218302488, "epoch": 1.2540295915492148, "grad_norm": 0.15699619054794312, "learning_rate": 5.820222651577883e-05, "loss": 0.5792, "mean_token_accuracy": 0.8206822089850903, "num_tokens": 435054583.0, "step": 13630 }, { "entropy": 0.5737063260748982, "epoch": 1.2541215979206561, "grad_norm": 0.16422803699970245, "learning_rate": 5.8199159689637195e-05, "loss": 0.5774, "mean_token_accuracy": 0.8264249265193939, "num_tokens": 435085980.0, "step": 13631 }, { "entropy": 0.5542237930931151, "epoch": 1.2542136042920973, "grad_norm": 0.1538374423980713, "learning_rate": 5.819609286349556e-05, "loss": 0.5268, "mean_token_accuracy": 0.8390670120716095, "num_tokens": 435117863.0, "step": 13632 }, { "entropy": 0.6469243662431836, "epoch": 1.2543056106635384, "grad_norm": 0.17331239581108093, "learning_rate": 5.819302603735395e-05, "loss": 0.6459, "mean_token_accuracy": 0.8025184758007526, "num_tokens": 435150044.0, "step": 13633 }, { "entropy": 0.6178058413788676, "epoch": 1.2543976170349795, "grad_norm": 0.1676267832517624, "learning_rate": 5.818995921121232e-05, "loss": 0.6005, "mean_token_accuracy": 0.8149045445024967, "num_tokens": 435181661.0, "step": 13634 }, { "entropy": 0.7169063650071621, "epoch": 1.254489623406421, "grad_norm": 0.17151640355587006, "learning_rate": 5.818689238507069e-05, "loss": 0.7197, "mean_token_accuracy": 0.7799645736813545, "num_tokens": 435213863.0, "step": 13635 }, { "entropy": 0.5815444542095065, "epoch": 1.2545816297778623, "grad_norm": 0.15722180902957916, "learning_rate": 5.8183825558929075e-05, "loss": 0.577, "mean_token_accuracy": 0.8260765410959721, "num_tokens": 435245696.0, "step": 13636 }, { "entropy": 0.6548863518983126, "epoch": 1.2546736361493034, "grad_norm": 0.15795059502124786, "learning_rate": 5.818075873278744e-05, "loss": 0.6337, "mean_token_accuracy": 0.8069775514304638, "num_tokens": 435278207.0, "step": 13637 }, { "entropy": 0.6099499766714871, "epoch": 1.2547656425207445, "grad_norm": 0.15754881501197815, "learning_rate": 5.817769190664582e-05, "loss": 0.6135, "mean_token_accuracy": 0.8145431280136108, "num_tokens": 435309919.0, "step": 13638 }, { "entropy": 0.5571518521755934, "epoch": 1.2548576488921857, "grad_norm": 0.15907052159309387, "learning_rate": 5.8174625080504185e-05, "loss": 0.5377, "mean_token_accuracy": 0.8327736221253872, "num_tokens": 435341316.0, "step": 13639 }, { "entropy": 0.6047813538461924, "epoch": 1.254949655263627, "grad_norm": 0.159969300031662, "learning_rate": 5.8171558254362567e-05, "loss": 0.5808, "mean_token_accuracy": 0.8212082013487816, "num_tokens": 435371983.0, "step": 13640 }, { "entropy": 0.6903152912855148, "epoch": 1.2550416616350684, "grad_norm": 0.16970178484916687, "learning_rate": 5.816849142822094e-05, "loss": 0.6762, "mean_token_accuracy": 0.7924971356987953, "num_tokens": 435404065.0, "step": 13641 }, { "entropy": 0.6632866561412811, "epoch": 1.2551336680065095, "grad_norm": 0.16707375645637512, "learning_rate": 5.816542460207931e-05, "loss": 0.635, "mean_token_accuracy": 0.8061380200088024, "num_tokens": 435436161.0, "step": 13642 }, { "entropy": 0.648351401090622, "epoch": 1.2552256743779506, "grad_norm": 0.15764057636260986, "learning_rate": 5.8162357775937684e-05, "loss": 0.6425, "mean_token_accuracy": 0.8063574358820915, "num_tokens": 435468491.0, "step": 13643 }, { "entropy": 0.5398991145193577, "epoch": 1.2553176807493918, "grad_norm": 0.1520121842622757, "learning_rate": 5.8159290949796065e-05, "loss": 0.522, "mean_token_accuracy": 0.8354054801166058, "num_tokens": 435500557.0, "step": 13644 }, { "entropy": 0.5607970524579287, "epoch": 1.2554096871208331, "grad_norm": 0.14940722286701202, "learning_rate": 5.815622412365443e-05, "loss": 0.5327, "mean_token_accuracy": 0.8338676989078522, "num_tokens": 435532323.0, "step": 13645 }, { "entropy": 0.6134951133280993, "epoch": 1.2555016934922745, "grad_norm": 0.15334729850292206, "learning_rate": 5.815315729751281e-05, "loss": 0.6013, "mean_token_accuracy": 0.8160414695739746, "num_tokens": 435564863.0, "step": 13646 }, { "entropy": 0.6523516476154327, "epoch": 1.2555936998637156, "grad_norm": 0.16623999178409576, "learning_rate": 5.8150090471371176e-05, "loss": 0.6539, "mean_token_accuracy": 0.8021928891539574, "num_tokens": 435597382.0, "step": 13647 }, { "entropy": 0.6487322021275759, "epoch": 1.2556857062351567, "grad_norm": 0.15549160540103912, "learning_rate": 5.814702364522956e-05, "loss": 0.6355, "mean_token_accuracy": 0.8048530407249928, "num_tokens": 435629464.0, "step": 13648 }, { "entropy": 0.5477808117866516, "epoch": 1.2557777126065979, "grad_norm": 0.151653453707695, "learning_rate": 5.814395681908793e-05, "loss": 0.5409, "mean_token_accuracy": 0.8316429704427719, "num_tokens": 435661085.0, "step": 13649 }, { "entropy": 0.5554218746256083, "epoch": 1.2558697189780392, "grad_norm": 0.16039544343948364, "learning_rate": 5.81408899929463e-05, "loss": 0.5462, "mean_token_accuracy": 0.8348941579461098, "num_tokens": 435693759.0, "step": 13650 }, { "entropy": 0.6816946798935533, "epoch": 1.2559617253494806, "grad_norm": 0.15961383283138275, "learning_rate": 5.8137823166804674e-05, "loss": 0.6705, "mean_token_accuracy": 0.7961686104536057, "num_tokens": 435725983.0, "step": 13651 }, { "entropy": 0.5324064139276743, "epoch": 1.2560537317209217, "grad_norm": 0.16104111075401306, "learning_rate": 5.8134756340663056e-05, "loss": 0.5171, "mean_token_accuracy": 0.843619741499424, "num_tokens": 435758524.0, "step": 13652 }, { "entropy": 0.4992150692269206, "epoch": 1.2561457380923629, "grad_norm": 0.1461208164691925, "learning_rate": 5.8131689514521423e-05, "loss": 0.4941, "mean_token_accuracy": 0.8505524694919586, "num_tokens": 435790780.0, "step": 13653 }, { "entropy": 0.6311277132481337, "epoch": 1.256237744463804, "grad_norm": 0.16256491839885712, "learning_rate": 5.81286226883798e-05, "loss": 0.6259, "mean_token_accuracy": 0.8056371062994003, "num_tokens": 435821599.0, "step": 13654 }, { "entropy": 0.656229505315423, "epoch": 1.2563297508352453, "grad_norm": 0.1670663058757782, "learning_rate": 5.8125555862238166e-05, "loss": 0.6422, "mean_token_accuracy": 0.8041480630636215, "num_tokens": 435853041.0, "step": 13655 }, { "entropy": 0.5945656355470419, "epoch": 1.2564217572066867, "grad_norm": 0.1514093279838562, "learning_rate": 5.812248903609655e-05, "loss": 0.5728, "mean_token_accuracy": 0.8246347196400166, "num_tokens": 435885026.0, "step": 13656 }, { "entropy": 0.6275304760783911, "epoch": 1.2565137635781278, "grad_norm": 0.1531461924314499, "learning_rate": 5.811942220995492e-05, "loss": 0.5962, "mean_token_accuracy": 0.8172629922628403, "num_tokens": 435916604.0, "step": 13657 }, { "entropy": 0.5275810770690441, "epoch": 1.256605769949569, "grad_norm": 0.14519594609737396, "learning_rate": 5.811635538381329e-05, "loss": 0.521, "mean_token_accuracy": 0.8366330862045288, "num_tokens": 435948700.0, "step": 13658 }, { "entropy": 0.6745608430355787, "epoch": 1.25669777632101, "grad_norm": 0.1546560674905777, "learning_rate": 5.8113288557671665e-05, "loss": 0.6563, "mean_token_accuracy": 0.796975564211607, "num_tokens": 435980868.0, "step": 13659 }, { "entropy": 0.5804679868742824, "epoch": 1.2567897826924515, "grad_norm": 0.15185654163360596, "learning_rate": 5.8110221731530046e-05, "loss": 0.5615, "mean_token_accuracy": 0.8243133202195168, "num_tokens": 436012439.0, "step": 13660 }, { "entropy": 0.5385894356295466, "epoch": 1.2568817890638928, "grad_norm": 0.1520770937204361, "learning_rate": 5.8107154905388414e-05, "loss": 0.5211, "mean_token_accuracy": 0.8389720879495144, "num_tokens": 436044282.0, "step": 13661 }, { "entropy": 0.5961839761584997, "epoch": 1.256973795435334, "grad_norm": 0.15826700627803802, "learning_rate": 5.810408807924679e-05, "loss": 0.5906, "mean_token_accuracy": 0.8164738900959492, "num_tokens": 436076291.0, "step": 13662 }, { "entropy": 0.6370399966835976, "epoch": 1.257065801806775, "grad_norm": 0.15838630497455597, "learning_rate": 5.8101021253105156e-05, "loss": 0.6312, "mean_token_accuracy": 0.8057442866265774, "num_tokens": 436107489.0, "step": 13663 }, { "entropy": 0.6417255224660039, "epoch": 1.2571578081782162, "grad_norm": 0.16165275871753693, "learning_rate": 5.809795442696354e-05, "loss": 0.6345, "mean_token_accuracy": 0.8025124408304691, "num_tokens": 436139705.0, "step": 13664 }, { "entropy": 0.5125674800947309, "epoch": 1.2572498145496576, "grad_norm": 0.15870796144008636, "learning_rate": 5.809488760082191e-05, "loss": 0.4999, "mean_token_accuracy": 0.844484843313694, "num_tokens": 436172232.0, "step": 13665 }, { "entropy": 0.6268217032775283, "epoch": 1.257341820921099, "grad_norm": 0.1629694253206253, "learning_rate": 5.809182077468028e-05, "loss": 0.6223, "mean_token_accuracy": 0.8087681941688061, "num_tokens": 436204099.0, "step": 13666 }, { "entropy": 0.7425359562039375, "epoch": 1.25743382729254, "grad_norm": 0.17244724929332733, "learning_rate": 5.808875394853867e-05, "loss": 0.7357, "mean_token_accuracy": 0.7784502729773521, "num_tokens": 436236194.0, "step": 13667 }, { "entropy": 0.5878154039382935, "epoch": 1.2575258336639812, "grad_norm": 0.14707857370376587, "learning_rate": 5.8085687122397036e-05, "loss": 0.5736, "mean_token_accuracy": 0.825842697173357, "num_tokens": 436268962.0, "step": 13668 }, { "entropy": 0.6562045160681009, "epoch": 1.2576178400354223, "grad_norm": 0.167812779545784, "learning_rate": 5.808262029625541e-05, "loss": 0.6421, "mean_token_accuracy": 0.8023116551339626, "num_tokens": 436300919.0, "step": 13669 }, { "entropy": 0.617229632101953, "epoch": 1.2577098464068637, "grad_norm": 0.16002872586250305, "learning_rate": 5.807955347011378e-05, "loss": 0.6142, "mean_token_accuracy": 0.8117799274623394, "num_tokens": 436332920.0, "step": 13670 }, { "entropy": 0.6809809934347868, "epoch": 1.257801852778305, "grad_norm": 0.16578036546707153, "learning_rate": 5.807648664397216e-05, "loss": 0.6773, "mean_token_accuracy": 0.7949528284370899, "num_tokens": 436364810.0, "step": 13671 }, { "entropy": 0.48816477367654443, "epoch": 1.2578938591497462, "grad_norm": 0.15387794375419617, "learning_rate": 5.8073419817830535e-05, "loss": 0.4707, "mean_token_accuracy": 0.8503233194351196, "num_tokens": 436396537.0, "step": 13672 }, { "entropy": 0.7457143012434244, "epoch": 1.2579858655211873, "grad_norm": 0.16682220995426178, "learning_rate": 5.80703529916889e-05, "loss": 0.7428, "mean_token_accuracy": 0.7788374833762646, "num_tokens": 436428405.0, "step": 13673 }, { "entropy": 0.6844955421984196, "epoch": 1.2580778718926284, "grad_norm": 0.16952720284461975, "learning_rate": 5.806728616554728e-05, "loss": 0.6845, "mean_token_accuracy": 0.7922520935535431, "num_tokens": 436459260.0, "step": 13674 }, { "entropy": 0.6277901027351618, "epoch": 1.2581698782640698, "grad_norm": 0.15775327384471893, "learning_rate": 5.806421933940566e-05, "loss": 0.6068, "mean_token_accuracy": 0.8096248544752598, "num_tokens": 436490763.0, "step": 13675 }, { "entropy": 0.5837818700820208, "epoch": 1.2582618846355111, "grad_norm": 0.14718598127365112, "learning_rate": 5.806115251326403e-05, "loss": 0.5589, "mean_token_accuracy": 0.8289042450487614, "num_tokens": 436522433.0, "step": 13676 }, { "entropy": 0.6897852420806885, "epoch": 1.2583538910069523, "grad_norm": 0.16030238568782806, "learning_rate": 5.80580856871224e-05, "loss": 0.6635, "mean_token_accuracy": 0.7934593819081783, "num_tokens": 436554070.0, "step": 13677 }, { "entropy": 0.6991717759519815, "epoch": 1.2584458973783934, "grad_norm": 0.16114352643489838, "learning_rate": 5.805501886098077e-05, "loss": 0.6893, "mean_token_accuracy": 0.7939013764262199, "num_tokens": 436586085.0, "step": 13678 }, { "entropy": 0.6184375127777457, "epoch": 1.2585379037498345, "grad_norm": 0.15728577971458435, "learning_rate": 5.805195203483915e-05, "loss": 0.6163, "mean_token_accuracy": 0.8129852078855038, "num_tokens": 436618062.0, "step": 13679 }, { "entropy": 0.604900823906064, "epoch": 1.258629910121276, "grad_norm": 0.15387053787708282, "learning_rate": 5.8048885208697525e-05, "loss": 0.5847, "mean_token_accuracy": 0.825279738754034, "num_tokens": 436650575.0, "step": 13680 }, { "entropy": 0.6279559843242168, "epoch": 1.2587219164927173, "grad_norm": 0.15896327793598175, "learning_rate": 5.804581838255589e-05, "loss": 0.6081, "mean_token_accuracy": 0.8137033991515636, "num_tokens": 436682150.0, "step": 13681 }, { "entropy": 0.6318195350468159, "epoch": 1.2588139228641584, "grad_norm": 0.15740148723125458, "learning_rate": 5.804275155641427e-05, "loss": 0.6212, "mean_token_accuracy": 0.8106242902576923, "num_tokens": 436713969.0, "step": 13682 }, { "entropy": 0.5899330638349056, "epoch": 1.2589059292355995, "grad_norm": 0.15041781961917877, "learning_rate": 5.803968473027265e-05, "loss": 0.5824, "mean_token_accuracy": 0.8250339962542057, "num_tokens": 436745715.0, "step": 13683 }, { "entropy": 0.6316450517624617, "epoch": 1.2589979356070407, "grad_norm": 0.16030316054821014, "learning_rate": 5.803661790413102e-05, "loss": 0.6204, "mean_token_accuracy": 0.8085256665945053, "num_tokens": 436777391.0, "step": 13684 }, { "entropy": 0.6858752369880676, "epoch": 1.259089941978482, "grad_norm": 0.16567544639110565, "learning_rate": 5.803355107798939e-05, "loss": 0.6837, "mean_token_accuracy": 0.7938522696495056, "num_tokens": 436809627.0, "step": 13685 }, { "entropy": 0.6066624373197556, "epoch": 1.2591819483499234, "grad_norm": 0.15981805324554443, "learning_rate": 5.803048425184776e-05, "loss": 0.6002, "mean_token_accuracy": 0.8136745616793633, "num_tokens": 436841478.0, "step": 13686 }, { "entropy": 0.6505708508193493, "epoch": 1.2592739547213645, "grad_norm": 0.1591271311044693, "learning_rate": 5.802741742570614e-05, "loss": 0.6378, "mean_token_accuracy": 0.8060159794986248, "num_tokens": 436873201.0, "step": 13687 }, { "entropy": 0.659436721354723, "epoch": 1.2593659610928056, "grad_norm": 0.15871307253837585, "learning_rate": 5.8024350599564516e-05, "loss": 0.6637, "mean_token_accuracy": 0.799128532409668, "num_tokens": 436905406.0, "step": 13688 }, { "entropy": 0.7083176057785749, "epoch": 1.2594579674642468, "grad_norm": 0.1756422370672226, "learning_rate": 5.8021283773422884e-05, "loss": 0.7067, "mean_token_accuracy": 0.7909508123993874, "num_tokens": 436936683.0, "step": 13689 }, { "entropy": 0.6399471312761307, "epoch": 1.2595499738356881, "grad_norm": 0.15628892183303833, "learning_rate": 5.801821694728126e-05, "loss": 0.6334, "mean_token_accuracy": 0.8068052195012569, "num_tokens": 436968985.0, "step": 13690 }, { "entropy": 0.6842237245291471, "epoch": 1.2596419802071295, "grad_norm": 0.1685868352651596, "learning_rate": 5.801515012113964e-05, "loss": 0.6651, "mean_token_accuracy": 0.7957841157913208, "num_tokens": 437000473.0, "step": 13691 }, { "entropy": 0.7616059444844723, "epoch": 1.2597339865785706, "grad_norm": 0.17196066677570343, "learning_rate": 5.801208329499801e-05, "loss": 0.7618, "mean_token_accuracy": 0.7682157531380653, "num_tokens": 437031704.0, "step": 13692 }, { "entropy": 0.6974148098379374, "epoch": 1.2598259929500117, "grad_norm": 0.16710494458675385, "learning_rate": 5.800901646885638e-05, "loss": 0.7014, "mean_token_accuracy": 0.787652999162674, "num_tokens": 437063066.0, "step": 13693 }, { "entropy": 0.7034330125898123, "epoch": 1.2599179993214529, "grad_norm": 0.1627243459224701, "learning_rate": 5.800594964271475e-05, "loss": 0.6788, "mean_token_accuracy": 0.7947148494422436, "num_tokens": 437095105.0, "step": 13694 }, { "entropy": 0.6151662520132959, "epoch": 1.2600100056928942, "grad_norm": 0.1584627479314804, "learning_rate": 5.800288281657313e-05, "loss": 0.6078, "mean_token_accuracy": 0.8148611858487129, "num_tokens": 437126681.0, "step": 13695 }, { "entropy": 0.65718699619174, "epoch": 1.2601020120643356, "grad_norm": 0.1549854576587677, "learning_rate": 5.7999815990431506e-05, "loss": 0.646, "mean_token_accuracy": 0.80357675999403, "num_tokens": 437158273.0, "step": 13696 }, { "entropy": 0.6510269418358803, "epoch": 1.2601940184357767, "grad_norm": 0.1586599498987198, "learning_rate": 5.7996749164289874e-05, "loss": 0.6401, "mean_token_accuracy": 0.8094366751611233, "num_tokens": 437190132.0, "step": 13697 }, { "entropy": 0.7824202496558428, "epoch": 1.2602860248072179, "grad_norm": 0.16092392802238464, "learning_rate": 5.7993682338148256e-05, "loss": 0.7623, "mean_token_accuracy": 0.7709265388548374, "num_tokens": 437222651.0, "step": 13698 }, { "entropy": 0.6032309448346496, "epoch": 1.260378031178659, "grad_norm": 0.15560069680213928, "learning_rate": 5.799061551200663e-05, "loss": 0.5842, "mean_token_accuracy": 0.8212880231440067, "num_tokens": 437254548.0, "step": 13699 }, { "entropy": 0.6152170039713383, "epoch": 1.2604700375501003, "grad_norm": 0.15077722072601318, "learning_rate": 5.7987548685865e-05, "loss": 0.5935, "mean_token_accuracy": 0.8138209618628025, "num_tokens": 437286417.0, "step": 13700 }, { "entropy": 0.6444226931780577, "epoch": 1.2605620439215417, "grad_norm": 0.15743428468704224, "learning_rate": 5.798448185972337e-05, "loss": 0.6344, "mean_token_accuracy": 0.8081530071794987, "num_tokens": 437318811.0, "step": 13701 }, { "entropy": 0.6261066533625126, "epoch": 1.2606540502929828, "grad_norm": 0.1607842743396759, "learning_rate": 5.7981415033581754e-05, "loss": 0.6102, "mean_token_accuracy": 0.8134374730288982, "num_tokens": 437350524.0, "step": 13702 }, { "entropy": 0.5927297053858638, "epoch": 1.260746056664424, "grad_norm": 0.1764361411333084, "learning_rate": 5.797834820744012e-05, "loss": 0.5823, "mean_token_accuracy": 0.8252977021038532, "num_tokens": 437382272.0, "step": 13703 }, { "entropy": 0.6681660795584321, "epoch": 1.260838063035865, "grad_norm": 0.15843342244625092, "learning_rate": 5.7975281381298497e-05, "loss": 0.6715, "mean_token_accuracy": 0.7967858389019966, "num_tokens": 437414876.0, "step": 13704 }, { "entropy": 0.5811425466090441, "epoch": 1.2609300694073065, "grad_norm": 0.1580074429512024, "learning_rate": 5.7972214555156864e-05, "loss": 0.5633, "mean_token_accuracy": 0.8302118293941021, "num_tokens": 437447199.0, "step": 13705 }, { "entropy": 0.4959310023114085, "epoch": 1.2610220757787478, "grad_norm": 0.14028817415237427, "learning_rate": 5.796914772901525e-05, "loss": 0.4769, "mean_token_accuracy": 0.8501442708075047, "num_tokens": 437478867.0, "step": 13706 }, { "entropy": 0.590019004419446, "epoch": 1.261114082150189, "grad_norm": 0.1543416529893875, "learning_rate": 5.796608090287362e-05, "loss": 0.5658, "mean_token_accuracy": 0.8218632414937019, "num_tokens": 437510292.0, "step": 13707 }, { "entropy": 0.5404981728643179, "epoch": 1.26120608852163, "grad_norm": 0.1579848974943161, "learning_rate": 5.796301407673199e-05, "loss": 0.538, "mean_token_accuracy": 0.8332445994019508, "num_tokens": 437542073.0, "step": 13708 }, { "entropy": 0.5911095780320466, "epoch": 1.2612980948930712, "grad_norm": 0.15382631123065948, "learning_rate": 5.795994725059036e-05, "loss": 0.5784, "mean_token_accuracy": 0.8210938684642315, "num_tokens": 437574060.0, "step": 13709 }, { "entropy": 0.5179063575342298, "epoch": 1.2613901012645126, "grad_norm": 0.14957548677921295, "learning_rate": 5.7956880424448744e-05, "loss": 0.5161, "mean_token_accuracy": 0.839840468019247, "num_tokens": 437605390.0, "step": 13710 }, { "entropy": 0.7480579558759928, "epoch": 1.261482107635954, "grad_norm": 0.16457128524780273, "learning_rate": 5.795381359830712e-05, "loss": 0.7465, "mean_token_accuracy": 0.7777762115001678, "num_tokens": 437637350.0, "step": 13711 }, { "entropy": 0.5635834722779691, "epoch": 1.261574114007395, "grad_norm": 0.1625271439552307, "learning_rate": 5.795074677216549e-05, "loss": 0.5579, "mean_token_accuracy": 0.825296375900507, "num_tokens": 437669111.0, "step": 13712 }, { "entropy": 0.6037453711032867, "epoch": 1.2616661203788362, "grad_norm": 0.1583925038576126, "learning_rate": 5.794767994602386e-05, "loss": 0.6002, "mean_token_accuracy": 0.815705519169569, "num_tokens": 437701152.0, "step": 13713 }, { "entropy": 0.5784766646102071, "epoch": 1.2617581267502773, "grad_norm": 0.15420205891132355, "learning_rate": 5.794461311988224e-05, "loss": 0.554, "mean_token_accuracy": 0.8271432407200336, "num_tokens": 437732977.0, "step": 13714 }, { "entropy": 0.4909834433346987, "epoch": 1.2618501331217187, "grad_norm": 0.15331459045410156, "learning_rate": 5.794154629374061e-05, "loss": 0.4763, "mean_token_accuracy": 0.8518258295953274, "num_tokens": 437764984.0, "step": 13715 }, { "entropy": 0.6318513322621584, "epoch": 1.26194213949316, "grad_norm": 0.16049198806285858, "learning_rate": 5.7938479467598986e-05, "loss": 0.6117, "mean_token_accuracy": 0.8129026256501675, "num_tokens": 437796441.0, "step": 13716 }, { "entropy": 0.5694343615323305, "epoch": 1.2620341458646012, "grad_norm": 0.15513081848621368, "learning_rate": 5.7935412641457353e-05, "loss": 0.5625, "mean_token_accuracy": 0.8271933756768703, "num_tokens": 437829002.0, "step": 13717 }, { "entropy": 0.6629965286701918, "epoch": 1.2621261522360423, "grad_norm": 0.16043683886528015, "learning_rate": 5.7932345815315735e-05, "loss": 0.6527, "mean_token_accuracy": 0.8001281134784222, "num_tokens": 437861201.0, "step": 13718 }, { "entropy": 0.6111866626888514, "epoch": 1.2622181586074834, "grad_norm": 0.16301684081554413, "learning_rate": 5.792927898917411e-05, "loss": 0.5938, "mean_token_accuracy": 0.8203914351761341, "num_tokens": 437893300.0, "step": 13719 }, { "entropy": 0.5580829447135329, "epoch": 1.2623101649789248, "grad_norm": 0.15420153737068176, "learning_rate": 5.792621216303248e-05, "loss": 0.5538, "mean_token_accuracy": 0.8314461708068848, "num_tokens": 437924987.0, "step": 13720 }, { "entropy": 0.7987187765538692, "epoch": 1.2624021713503661, "grad_norm": 0.17007331550121307, "learning_rate": 5.792314533689085e-05, "loss": 0.8081, "mean_token_accuracy": 0.762097679078579, "num_tokens": 437956775.0, "step": 13721 }, { "entropy": 0.6621308773756027, "epoch": 1.2624941777218073, "grad_norm": 0.15915058553218842, "learning_rate": 5.7920078510749233e-05, "loss": 0.6596, "mean_token_accuracy": 0.7980025112628937, "num_tokens": 437988988.0, "step": 13722 }, { "entropy": 0.6815325375646353, "epoch": 1.2625861840932484, "grad_norm": 0.16443856060504913, "learning_rate": 5.79170116846076e-05, "loss": 0.6692, "mean_token_accuracy": 0.7929310724139214, "num_tokens": 438020582.0, "step": 13723 }, { "entropy": 0.611801678314805, "epoch": 1.2626781904646895, "grad_norm": 0.15760627388954163, "learning_rate": 5.7913944858465976e-05, "loss": 0.6135, "mean_token_accuracy": 0.8129325099289417, "num_tokens": 438053162.0, "step": 13724 }, { "entropy": 0.6250302214175463, "epoch": 1.262770196836131, "grad_norm": 0.15671208500862122, "learning_rate": 5.7910878032324344e-05, "loss": 0.6093, "mean_token_accuracy": 0.8161828592419624, "num_tokens": 438085166.0, "step": 13725 }, { "entropy": 0.535996078979224, "epoch": 1.2628622032075723, "grad_norm": 0.1484290361404419, "learning_rate": 5.7907811206182725e-05, "loss": 0.511, "mean_token_accuracy": 0.8399997055530548, "num_tokens": 438116630.0, "step": 13726 }, { "entropy": 0.5999484313651919, "epoch": 1.2629542095790134, "grad_norm": 0.1809384673833847, "learning_rate": 5.79047443800411e-05, "loss": 0.6049, "mean_token_accuracy": 0.8168606795370579, "num_tokens": 438147215.0, "step": 13727 }, { "entropy": 0.7309411130845547, "epoch": 1.2630462159504545, "grad_norm": 0.16507674753665924, "learning_rate": 5.790167755389947e-05, "loss": 0.7257, "mean_token_accuracy": 0.7836959548294544, "num_tokens": 438178981.0, "step": 13728 }, { "entropy": 0.619749067351222, "epoch": 1.2631382223218957, "grad_norm": 0.15703168511390686, "learning_rate": 5.789861072775785e-05, "loss": 0.617, "mean_token_accuracy": 0.811744213104248, "num_tokens": 438210666.0, "step": 13729 }, { "entropy": 0.6262092581018806, "epoch": 1.263230228693337, "grad_norm": 0.15438854694366455, "learning_rate": 5.7895543901616224e-05, "loss": 0.6084, "mean_token_accuracy": 0.8138249963521957, "num_tokens": 438242920.0, "step": 13730 }, { "entropy": 0.550021992996335, "epoch": 1.2633222350647784, "grad_norm": 0.144331693649292, "learning_rate": 5.789247707547459e-05, "loss": 0.5281, "mean_token_accuracy": 0.8353813290596008, "num_tokens": 438275185.0, "step": 13731 }, { "entropy": 0.6006852071732283, "epoch": 1.2634142414362195, "grad_norm": 0.150711789727211, "learning_rate": 5.7889410249332966e-05, "loss": 0.5778, "mean_token_accuracy": 0.8199211917817593, "num_tokens": 438307470.0, "step": 13732 }, { "entropy": 0.6936467550694942, "epoch": 1.2635062478076606, "grad_norm": 0.16807857155799866, "learning_rate": 5.788634342319135e-05, "loss": 0.676, "mean_token_accuracy": 0.7937901169061661, "num_tokens": 438339396.0, "step": 13733 }, { "entropy": 0.5733952317386866, "epoch": 1.2635982541791018, "grad_norm": 0.16455870866775513, "learning_rate": 5.7883276597049716e-05, "loss": 0.5755, "mean_token_accuracy": 0.8244554027915001, "num_tokens": 438371402.0, "step": 13734 }, { "entropy": 0.7072537019848824, "epoch": 1.2636902605505431, "grad_norm": 0.16083458065986633, "learning_rate": 5.788020977090809e-05, "loss": 0.7113, "mean_token_accuracy": 0.7834815122187138, "num_tokens": 438403195.0, "step": 13735 }, { "entropy": 0.6744230575859547, "epoch": 1.2637822669219845, "grad_norm": 0.1583990752696991, "learning_rate": 5.787714294476646e-05, "loss": 0.6747, "mean_token_accuracy": 0.7974455766379833, "num_tokens": 438435265.0, "step": 13736 }, { "entropy": 0.6464333217591047, "epoch": 1.2638742732934256, "grad_norm": 0.15935631096363068, "learning_rate": 5.787407611862484e-05, "loss": 0.6315, "mean_token_accuracy": 0.805219043046236, "num_tokens": 438466347.0, "step": 13737 }, { "entropy": 0.6575862150639296, "epoch": 1.2639662796648667, "grad_norm": 0.15972796082496643, "learning_rate": 5.7871009292483214e-05, "loss": 0.635, "mean_token_accuracy": 0.80533467233181, "num_tokens": 438498306.0, "step": 13738 }, { "entropy": 0.6307687070220709, "epoch": 1.2640582860363079, "grad_norm": 0.1547071635723114, "learning_rate": 5.786794246634158e-05, "loss": 0.6132, "mean_token_accuracy": 0.812846727669239, "num_tokens": 438530393.0, "step": 13739 }, { "entropy": 0.6325311362743378, "epoch": 1.2641502924077492, "grad_norm": 0.1573491096496582, "learning_rate": 5.786487564019996e-05, "loss": 0.6147, "mean_token_accuracy": 0.8123775310814381, "num_tokens": 438562360.0, "step": 13740 }, { "entropy": 0.5498445695266128, "epoch": 1.2642422987791906, "grad_norm": 0.1593708097934723, "learning_rate": 5.786180881405834e-05, "loss": 0.5356, "mean_token_accuracy": 0.8309050276875496, "num_tokens": 438594073.0, "step": 13741 }, { "entropy": 0.5159841305576265, "epoch": 1.2643343051506317, "grad_norm": 0.14529584348201752, "learning_rate": 5.7858741987916706e-05, "loss": 0.4882, "mean_token_accuracy": 0.8471213132143021, "num_tokens": 438626063.0, "step": 13742 }, { "entropy": 0.5967738665640354, "epoch": 1.2644263115220729, "grad_norm": 0.15732207894325256, "learning_rate": 5.785567516177508e-05, "loss": 0.5969, "mean_token_accuracy": 0.8148504793643951, "num_tokens": 438658138.0, "step": 13743 }, { "entropy": 0.6380666252225637, "epoch": 1.264518317893514, "grad_norm": 0.16364844143390656, "learning_rate": 5.785260833563345e-05, "loss": 0.6383, "mean_token_accuracy": 0.8086763918399811, "num_tokens": 438690089.0, "step": 13744 }, { "entropy": 0.5800126646645367, "epoch": 1.2646103242649553, "grad_norm": 0.15401408076286316, "learning_rate": 5.784954150949184e-05, "loss": 0.5798, "mean_token_accuracy": 0.8222378268837929, "num_tokens": 438722330.0, "step": 13745 }, { "entropy": 0.6779597923159599, "epoch": 1.2647023306363967, "grad_norm": 0.1594392955303192, "learning_rate": 5.7846474683350205e-05, "loss": 0.6623, "mean_token_accuracy": 0.7983884960412979, "num_tokens": 438754640.0, "step": 13746 }, { "entropy": 0.6125987693667412, "epoch": 1.2647943370078378, "grad_norm": 0.15857064723968506, "learning_rate": 5.784340785720857e-05, "loss": 0.5979, "mean_token_accuracy": 0.8155373483896255, "num_tokens": 438784685.0, "step": 13747 }, { "entropy": 0.6178328525274992, "epoch": 1.264886343379279, "grad_norm": 0.15251502394676208, "learning_rate": 5.784034103106695e-05, "loss": 0.6082, "mean_token_accuracy": 0.8116765692830086, "num_tokens": 438816879.0, "step": 13748 }, { "entropy": 0.6052141319960356, "epoch": 1.26497834975072, "grad_norm": 0.15773345530033112, "learning_rate": 5.783727420492533e-05, "loss": 0.5921, "mean_token_accuracy": 0.8171080984175205, "num_tokens": 438848902.0, "step": 13749 }, { "entropy": 0.6929060164839029, "epoch": 1.2650703561221615, "grad_norm": 0.1620091199874878, "learning_rate": 5.78342073787837e-05, "loss": 0.6715, "mean_token_accuracy": 0.7947232015430927, "num_tokens": 438880581.0, "step": 13750 }, { "entropy": 0.5717438710853457, "epoch": 1.2651623624936028, "grad_norm": 0.15394631028175354, "learning_rate": 5.783114055264207e-05, "loss": 0.5644, "mean_token_accuracy": 0.8252474144101143, "num_tokens": 438912207.0, "step": 13751 }, { "entropy": 0.67267812974751, "epoch": 1.265254368865044, "grad_norm": 0.16387198865413666, "learning_rate": 5.782807372650044e-05, "loss": 0.668, "mean_token_accuracy": 0.7966343238949776, "num_tokens": 438943667.0, "step": 13752 }, { "entropy": 0.58520183339715, "epoch": 1.265346375236485, "grad_norm": 0.15540838241577148, "learning_rate": 5.782500690035883e-05, "loss": 0.5706, "mean_token_accuracy": 0.8235589042305946, "num_tokens": 438975262.0, "step": 13753 }, { "entropy": 0.5135431690141559, "epoch": 1.2654383816079262, "grad_norm": 0.14271491765975952, "learning_rate": 5.7821940074217195e-05, "loss": 0.5036, "mean_token_accuracy": 0.8461661450564861, "num_tokens": 439007120.0, "step": 13754 }, { "entropy": 0.5401266701519489, "epoch": 1.2655303879793676, "grad_norm": 0.1541070193052292, "learning_rate": 5.781887324807557e-05, "loss": 0.5424, "mean_token_accuracy": 0.8327365443110466, "num_tokens": 439039664.0, "step": 13755 }, { "entropy": 0.5715267099440098, "epoch": 1.265622394350809, "grad_norm": 0.15987472236156464, "learning_rate": 5.781580642193394e-05, "loss": 0.5693, "mean_token_accuracy": 0.8261524923145771, "num_tokens": 439070994.0, "step": 13756 }, { "entropy": 0.6786004714667797, "epoch": 1.26571440072225, "grad_norm": 0.16592134535312653, "learning_rate": 5.781273959579232e-05, "loss": 0.6789, "mean_token_accuracy": 0.7923277094960213, "num_tokens": 439102076.0, "step": 13757 }, { "entropy": 0.6381137333810329, "epoch": 1.2658064070936912, "grad_norm": 0.15315087139606476, "learning_rate": 5.7809672769650694e-05, "loss": 0.6259, "mean_token_accuracy": 0.8073647134006023, "num_tokens": 439134782.0, "step": 13758 }, { "entropy": 0.6173055893741548, "epoch": 1.2658984134651323, "grad_norm": 0.15498214960098267, "learning_rate": 5.780660594350906e-05, "loss": 0.6031, "mean_token_accuracy": 0.8111415319144726, "num_tokens": 439166603.0, "step": 13759 }, { "entropy": 0.6344747766852379, "epoch": 1.2659904198365737, "grad_norm": 0.16453328728675842, "learning_rate": 5.780353911736744e-05, "loss": 0.6171, "mean_token_accuracy": 0.8125417307019234, "num_tokens": 439198148.0, "step": 13760 }, { "entropy": 0.5708293532952666, "epoch": 1.266082426208015, "grad_norm": 0.15702217817306519, "learning_rate": 5.780047229122582e-05, "loss": 0.573, "mean_token_accuracy": 0.8258732296526432, "num_tokens": 439230916.0, "step": 13761 }, { "entropy": 0.53183813393116, "epoch": 1.2661744325794562, "grad_norm": 0.15059877932071686, "learning_rate": 5.7797405465084186e-05, "loss": 0.5227, "mean_token_accuracy": 0.8385734669864178, "num_tokens": 439263657.0, "step": 13762 }, { "entropy": 0.5990386549383402, "epoch": 1.2662664389508973, "grad_norm": 0.15963777899742126, "learning_rate": 5.779433863894256e-05, "loss": 0.5785, "mean_token_accuracy": 0.8243114911019802, "num_tokens": 439295182.0, "step": 13763 }, { "entropy": 0.5023461068049073, "epoch": 1.2663584453223387, "grad_norm": 0.14742983877658844, "learning_rate": 5.779127181280094e-05, "loss": 0.481, "mean_token_accuracy": 0.8517886810004711, "num_tokens": 439327654.0, "step": 13764 }, { "entropy": 0.628225376829505, "epoch": 1.2664504516937798, "grad_norm": 0.15992984175682068, "learning_rate": 5.778820498665931e-05, "loss": 0.6117, "mean_token_accuracy": 0.8113311231136322, "num_tokens": 439359488.0, "step": 13765 }, { "entropy": 0.6744086258113384, "epoch": 1.2665424580652211, "grad_norm": 0.16198669373989105, "learning_rate": 5.7785138160517684e-05, "loss": 0.6522, "mean_token_accuracy": 0.8017571456730366, "num_tokens": 439390828.0, "step": 13766 }, { "entropy": 0.6353954020887613, "epoch": 1.2666344644366623, "grad_norm": 0.15533164143562317, "learning_rate": 5.778207133437605e-05, "loss": 0.6304, "mean_token_accuracy": 0.8063975311815739, "num_tokens": 439422855.0, "step": 13767 }, { "entropy": 0.6986438315361738, "epoch": 1.2667264708081034, "grad_norm": 0.16634538769721985, "learning_rate": 5.7779004508234433e-05, "loss": 0.6957, "mean_token_accuracy": 0.7895130775868893, "num_tokens": 439455003.0, "step": 13768 }, { "entropy": 0.5912506282329559, "epoch": 1.2668184771795448, "grad_norm": 0.15831808745861053, "learning_rate": 5.777593768209281e-05, "loss": 0.575, "mean_token_accuracy": 0.8252931125462055, "num_tokens": 439487771.0, "step": 13769 }, { "entropy": 0.5404855851083994, "epoch": 1.266910483550986, "grad_norm": 0.15732689201831818, "learning_rate": 5.7772870855951176e-05, "loss": 0.5318, "mean_token_accuracy": 0.8361400105059147, "num_tokens": 439519406.0, "step": 13770 }, { "entropy": 0.55109510011971, "epoch": 1.2670024899224273, "grad_norm": 0.16485466063022614, "learning_rate": 5.776980402980955e-05, "loss": 0.5415, "mean_token_accuracy": 0.8304088115692139, "num_tokens": 439551247.0, "step": 13771 }, { "entropy": 0.5657030129805207, "epoch": 1.2670944962938684, "grad_norm": 0.15448838472366333, "learning_rate": 5.776673720366793e-05, "loss": 0.5559, "mean_token_accuracy": 0.8313202150166035, "num_tokens": 439583643.0, "step": 13772 }, { "entropy": 0.6541113965213299, "epoch": 1.2671865026653095, "grad_norm": 0.15886668860912323, "learning_rate": 5.77636703775263e-05, "loss": 0.6332, "mean_token_accuracy": 0.8088391534984112, "num_tokens": 439615012.0, "step": 13773 }, { "entropy": 0.5947929695248604, "epoch": 1.2672785090367509, "grad_norm": 0.15301169455051422, "learning_rate": 5.7760603551384675e-05, "loss": 0.5626, "mean_token_accuracy": 0.823301937431097, "num_tokens": 439646275.0, "step": 13774 }, { "entropy": 0.5852472428232431, "epoch": 1.267370515408192, "grad_norm": 0.15075983107089996, "learning_rate": 5.775753672524304e-05, "loss": 0.5645, "mean_token_accuracy": 0.8242523483932018, "num_tokens": 439678123.0, "step": 13775 }, { "entropy": 0.6696411073207855, "epoch": 1.2674625217796334, "grad_norm": 0.16363607347011566, "learning_rate": 5.7754469899101424e-05, "loss": 0.657, "mean_token_accuracy": 0.8039701879024506, "num_tokens": 439709978.0, "step": 13776 }, { "entropy": 0.48017821181565523, "epoch": 1.2675545281510745, "grad_norm": 0.14806224405765533, "learning_rate": 5.77514030729598e-05, "loss": 0.4612, "mean_token_accuracy": 0.8567595668137074, "num_tokens": 439741840.0, "step": 13777 }, { "entropy": 0.6841826140880585, "epoch": 1.2676465345225156, "grad_norm": 0.16064894199371338, "learning_rate": 5.7748336246818166e-05, "loss": 0.6713, "mean_token_accuracy": 0.7966771461069584, "num_tokens": 439773549.0, "step": 13778 }, { "entropy": 0.7108347751200199, "epoch": 1.267738540893957, "grad_norm": 0.16078463196754456, "learning_rate": 5.774526942067654e-05, "loss": 0.6958, "mean_token_accuracy": 0.784707210958004, "num_tokens": 439805252.0, "step": 13779 }, { "entropy": 0.5878602098673582, "epoch": 1.2678305472653981, "grad_norm": 0.1499243676662445, "learning_rate": 5.774220259453492e-05, "loss": 0.5769, "mean_token_accuracy": 0.8213383071124554, "num_tokens": 439837150.0, "step": 13780 }, { "entropy": 0.5603157030418515, "epoch": 1.2679225536368395, "grad_norm": 0.16476786136627197, "learning_rate": 5.773913576839329e-05, "loss": 0.553, "mean_token_accuracy": 0.8286260962486267, "num_tokens": 439869084.0, "step": 13781 }, { "entropy": 0.6063054464757442, "epoch": 1.2680145600082806, "grad_norm": 0.154469832777977, "learning_rate": 5.7736068942251665e-05, "loss": 0.5927, "mean_token_accuracy": 0.8164966627955437, "num_tokens": 439901221.0, "step": 13782 }, { "entropy": 0.6917987745255232, "epoch": 1.2681065663797217, "grad_norm": 0.17053069174289703, "learning_rate": 5.773300211611003e-05, "loss": 0.6942, "mean_token_accuracy": 0.7879476137459278, "num_tokens": 439932692.0, "step": 13783 }, { "entropy": 0.6701811198145151, "epoch": 1.268198572751163, "grad_norm": 0.161770761013031, "learning_rate": 5.772993528996842e-05, "loss": 0.6552, "mean_token_accuracy": 0.7974055372178555, "num_tokens": 439965031.0, "step": 13784 }, { "entropy": 0.5110015431419015, "epoch": 1.2682905791226042, "grad_norm": 0.15486016869544983, "learning_rate": 5.772686846382679e-05, "loss": 0.5071, "mean_token_accuracy": 0.8452044799923897, "num_tokens": 439997176.0, "step": 13785 }, { "entropy": 0.7225799364969134, "epoch": 1.2683825854940456, "grad_norm": 0.16789081692695618, "learning_rate": 5.772380163768516e-05, "loss": 0.726, "mean_token_accuracy": 0.7797723710536957, "num_tokens": 440029698.0, "step": 13786 }, { "entropy": 0.5401289416477084, "epoch": 1.2684745918654867, "grad_norm": 0.14539852738380432, "learning_rate": 5.772073481154353e-05, "loss": 0.5276, "mean_token_accuracy": 0.8366796672344208, "num_tokens": 440062152.0, "step": 13787 }, { "entropy": 0.5128947738558054, "epoch": 1.2685665982369279, "grad_norm": 0.15809257328510284, "learning_rate": 5.771766798540191e-05, "loss": 0.4854, "mean_token_accuracy": 0.8475893102586269, "num_tokens": 440094133.0, "step": 13788 }, { "entropy": 0.7198819555342197, "epoch": 1.2686586046083692, "grad_norm": 0.1667206585407257, "learning_rate": 5.771460115926029e-05, "loss": 0.7148, "mean_token_accuracy": 0.7824502997100353, "num_tokens": 440125674.0, "step": 13789 }, { "entropy": 0.5739311098586768, "epoch": 1.2687506109798103, "grad_norm": 0.15329621732234955, "learning_rate": 5.7711534333118655e-05, "loss": 0.5613, "mean_token_accuracy": 0.8260896615684032, "num_tokens": 440158236.0, "step": 13790 }, { "entropy": 0.5350831290706992, "epoch": 1.2688426173512517, "grad_norm": 0.1457105427980423, "learning_rate": 5.770846750697704e-05, "loss": 0.524, "mean_token_accuracy": 0.8380444534122944, "num_tokens": 440190145.0, "step": 13791 }, { "entropy": 0.6712054796516895, "epoch": 1.2689346237226928, "grad_norm": 0.15702159702777863, "learning_rate": 5.770540068083541e-05, "loss": 0.6661, "mean_token_accuracy": 0.799128495156765, "num_tokens": 440222333.0, "step": 13792 }, { "entropy": 0.5866163615137339, "epoch": 1.269026630094134, "grad_norm": 0.15363295376300812, "learning_rate": 5.770233385469378e-05, "loss": 0.583, "mean_token_accuracy": 0.8196604922413826, "num_tokens": 440254763.0, "step": 13793 }, { "entropy": 0.5611393190920353, "epoch": 1.2691186364655753, "grad_norm": 0.15867279469966888, "learning_rate": 5.7699267028552154e-05, "loss": 0.5442, "mean_token_accuracy": 0.8289593532681465, "num_tokens": 440287162.0, "step": 13794 }, { "entropy": 0.550787543412298, "epoch": 1.2692106428370165, "grad_norm": 0.15062953531742096, "learning_rate": 5.7696200202410535e-05, "loss": 0.5381, "mean_token_accuracy": 0.833231259137392, "num_tokens": 440319130.0, "step": 13795 }, { "entropy": 0.6171670462936163, "epoch": 1.2693026492084578, "grad_norm": 0.15959621965885162, "learning_rate": 5.76931333762689e-05, "loss": 0.6047, "mean_token_accuracy": 0.8137450814247131, "num_tokens": 440350427.0, "step": 13796 }, { "entropy": 0.6375608462840319, "epoch": 1.269394655579899, "grad_norm": 0.15607643127441406, "learning_rate": 5.769006655012728e-05, "loss": 0.6298, "mean_token_accuracy": 0.8073320500552654, "num_tokens": 440382711.0, "step": 13797 }, { "entropy": 0.6464697252959013, "epoch": 1.26948666195134, "grad_norm": 0.16145503520965576, "learning_rate": 5.7686999723985646e-05, "loss": 0.6488, "mean_token_accuracy": 0.8052172251045704, "num_tokens": 440414759.0, "step": 13798 }, { "entropy": 0.7107817232608795, "epoch": 1.2695786683227814, "grad_norm": 0.16713950037956238, "learning_rate": 5.768393289784403e-05, "loss": 0.7128, "mean_token_accuracy": 0.7838229387998581, "num_tokens": 440446505.0, "step": 13799 }, { "entropy": 0.5620288867503405, "epoch": 1.2696706746942226, "grad_norm": 0.1476304978132248, "learning_rate": 5.76808660717024e-05, "loss": 0.5473, "mean_token_accuracy": 0.8285129889845848, "num_tokens": 440478783.0, "step": 13800 }, { "entropy": 0.650095958262682, "epoch": 1.269762681065664, "grad_norm": 0.16378401219844818, "learning_rate": 5.767779924556077e-05, "loss": 0.6366, "mean_token_accuracy": 0.8033820278942585, "num_tokens": 440510398.0, "step": 13801 }, { "entropy": 0.6074390653520823, "epoch": 1.269854687437105, "grad_norm": 0.1628562957048416, "learning_rate": 5.7674732419419144e-05, "loss": 0.6069, "mean_token_accuracy": 0.8150371760129929, "num_tokens": 440542505.0, "step": 13802 }, { "entropy": 0.5744472052901983, "epoch": 1.2699466938085462, "grad_norm": 0.14746052026748657, "learning_rate": 5.7671665593277526e-05, "loss": 0.5593, "mean_token_accuracy": 0.8255939744412899, "num_tokens": 440574672.0, "step": 13803 }, { "entropy": 0.6232615932822227, "epoch": 1.2700387001799875, "grad_norm": 0.15896300971508026, "learning_rate": 5.7668598767135894e-05, "loss": 0.617, "mean_token_accuracy": 0.8133557327091694, "num_tokens": 440606929.0, "step": 13804 }, { "entropy": 0.6685177534818649, "epoch": 1.2701307065514287, "grad_norm": 0.16299718618392944, "learning_rate": 5.766553194099427e-05, "loss": 0.6569, "mean_token_accuracy": 0.7992502339184284, "num_tokens": 440638659.0, "step": 13805 }, { "entropy": 0.634759115986526, "epoch": 1.27022271292287, "grad_norm": 0.15785636007785797, "learning_rate": 5.7662465114852636e-05, "loss": 0.6071, "mean_token_accuracy": 0.8161735199391842, "num_tokens": 440670593.0, "step": 13806 }, { "entropy": 0.5525024672970176, "epoch": 1.2703147192943112, "grad_norm": 0.15504798293113708, "learning_rate": 5.765939828871102e-05, "loss": 0.5308, "mean_token_accuracy": 0.835678543895483, "num_tokens": 440701870.0, "step": 13807 }, { "entropy": 0.6227516289800406, "epoch": 1.2704067256657523, "grad_norm": 0.1634073406457901, "learning_rate": 5.765633146256939e-05, "loss": 0.606, "mean_token_accuracy": 0.8096674010157585, "num_tokens": 440732597.0, "step": 13808 }, { "entropy": 0.5335129173472524, "epoch": 1.2704987320371937, "grad_norm": 0.14506670832633972, "learning_rate": 5.765326463642776e-05, "loss": 0.5136, "mean_token_accuracy": 0.8409722782671452, "num_tokens": 440764385.0, "step": 13809 }, { "entropy": 0.6415604399517179, "epoch": 1.2705907384086348, "grad_norm": 0.16487589478492737, "learning_rate": 5.7650197810286135e-05, "loss": 0.6348, "mean_token_accuracy": 0.8093107342720032, "num_tokens": 440796999.0, "step": 13810 }, { "entropy": 0.6221687346696854, "epoch": 1.2706827447800761, "grad_norm": 0.15995191037654877, "learning_rate": 5.7647130984144516e-05, "loss": 0.6131, "mean_token_accuracy": 0.8156876191496849, "num_tokens": 440828026.0, "step": 13811 }, { "entropy": 0.5349616473540664, "epoch": 1.2707747511515173, "grad_norm": 0.1497558206319809, "learning_rate": 5.7644064158002884e-05, "loss": 0.5218, "mean_token_accuracy": 0.8411870077252388, "num_tokens": 440859383.0, "step": 13812 }, { "entropy": 0.6019812077283859, "epoch": 1.2708667575229584, "grad_norm": 0.15618813037872314, "learning_rate": 5.764099733186126e-05, "loss": 0.5923, "mean_token_accuracy": 0.8220997974276543, "num_tokens": 440891467.0, "step": 13813 }, { "entropy": 0.6835436644032598, "epoch": 1.2709587638943998, "grad_norm": 0.1668415665626526, "learning_rate": 5.7637930505719627e-05, "loss": 0.6684, "mean_token_accuracy": 0.7953656986355782, "num_tokens": 440923900.0, "step": 13814 }, { "entropy": 0.5516601167619228, "epoch": 1.271050770265841, "grad_norm": 0.14585795998573303, "learning_rate": 5.763486367957801e-05, "loss": 0.5335, "mean_token_accuracy": 0.8363810889422894, "num_tokens": 440956574.0, "step": 13815 }, { "entropy": 0.5600680224597454, "epoch": 1.2711427766372823, "grad_norm": 0.1488608866930008, "learning_rate": 5.763179685343638e-05, "loss": 0.5586, "mean_token_accuracy": 0.8300561681389809, "num_tokens": 440989342.0, "step": 13816 }, { "entropy": 0.650835670530796, "epoch": 1.2712347830087234, "grad_norm": 0.16844171285629272, "learning_rate": 5.762873002729475e-05, "loss": 0.6319, "mean_token_accuracy": 0.8081373013556004, "num_tokens": 441020410.0, "step": 13817 }, { "entropy": 0.6224777325987816, "epoch": 1.2713267893801645, "grad_norm": 0.15846839547157288, "learning_rate": 5.7625663201153125e-05, "loss": 0.6169, "mean_token_accuracy": 0.8111876398324966, "num_tokens": 441053089.0, "step": 13818 }, { "entropy": 0.5860644560307264, "epoch": 1.2714187957516059, "grad_norm": 0.15950800478458405, "learning_rate": 5.7622596375011507e-05, "loss": 0.5616, "mean_token_accuracy": 0.8268010690808296, "num_tokens": 441084119.0, "step": 13819 }, { "entropy": 0.5717830564826727, "epoch": 1.271510802123047, "grad_norm": 0.15866833925247192, "learning_rate": 5.7619529548869874e-05, "loss": 0.5589, "mean_token_accuracy": 0.8255448527634144, "num_tokens": 441116638.0, "step": 13820 }, { "entropy": 0.6927671115845442, "epoch": 1.2716028084944884, "grad_norm": 0.16553106904029846, "learning_rate": 5.761646272272825e-05, "loss": 0.6892, "mean_token_accuracy": 0.7919283732771873, "num_tokens": 441148654.0, "step": 13821 }, { "entropy": 0.6401946377009153, "epoch": 1.2716948148659295, "grad_norm": 0.16350410878658295, "learning_rate": 5.761339589658663e-05, "loss": 0.6218, "mean_token_accuracy": 0.8058386035263538, "num_tokens": 441180723.0, "step": 13822 }, { "entropy": 0.6923335511237383, "epoch": 1.2717868212373706, "grad_norm": 0.15983091294765472, "learning_rate": 5.7610329070445e-05, "loss": 0.6888, "mean_token_accuracy": 0.7915571220219135, "num_tokens": 441212586.0, "step": 13823 }, { "entropy": 0.594536162680015, "epoch": 1.271878827608812, "grad_norm": 0.16395476460456848, "learning_rate": 5.760726224430337e-05, "loss": 0.5974, "mean_token_accuracy": 0.8201429657638073, "num_tokens": 441244210.0, "step": 13824 }, { "entropy": 0.532375868409872, "epoch": 1.2719708339802531, "grad_norm": 0.1584663987159729, "learning_rate": 5.760419541816174e-05, "loss": 0.5353, "mean_token_accuracy": 0.8369136229157448, "num_tokens": 441276670.0, "step": 13825 }, { "entropy": 0.6258563362061977, "epoch": 1.2720628403516945, "grad_norm": 0.15396229922771454, "learning_rate": 5.760112859202013e-05, "loss": 0.6147, "mean_token_accuracy": 0.8093373440206051, "num_tokens": 441308622.0, "step": 13826 }, { "entropy": 0.6061709001660347, "epoch": 1.2721548467231356, "grad_norm": 0.1604192703962326, "learning_rate": 5.75980617658785e-05, "loss": 0.6013, "mean_token_accuracy": 0.8163116089999676, "num_tokens": 441341158.0, "step": 13827 }, { "entropy": 0.6623376775532961, "epoch": 1.2722468530945767, "grad_norm": 0.1596689075231552, "learning_rate": 5.759499493973687e-05, "loss": 0.652, "mean_token_accuracy": 0.8022796660661697, "num_tokens": 441372450.0, "step": 13828 }, { "entropy": 0.6190747730433941, "epoch": 1.272338859466018, "grad_norm": 0.15410862863063812, "learning_rate": 5.759192811359524e-05, "loss": 0.604, "mean_token_accuracy": 0.8139769770205021, "num_tokens": 441404544.0, "step": 13829 }, { "entropy": 0.6470602639019489, "epoch": 1.2724308658374592, "grad_norm": 0.15431171655654907, "learning_rate": 5.758886128745362e-05, "loss": 0.6374, "mean_token_accuracy": 0.8021760955452919, "num_tokens": 441435727.0, "step": 13830 }, { "entropy": 0.7247574552893639, "epoch": 1.2725228722089006, "grad_norm": 0.16241970658302307, "learning_rate": 5.7585794461311996e-05, "loss": 0.7313, "mean_token_accuracy": 0.7763128317892551, "num_tokens": 441467254.0, "step": 13831 }, { "entropy": 0.6637845207005739, "epoch": 1.2726148785803417, "grad_norm": 0.15826597809791565, "learning_rate": 5.7582727635170363e-05, "loss": 0.6417, "mean_token_accuracy": 0.8029331788420677, "num_tokens": 441499442.0, "step": 13832 }, { "entropy": 0.7051487434655428, "epoch": 1.2727068849517829, "grad_norm": 0.16533924639225006, "learning_rate": 5.757966080902874e-05, "loss": 0.7007, "mean_token_accuracy": 0.7870677225291729, "num_tokens": 441530694.0, "step": 13833 }, { "entropy": 0.6898352075368166, "epoch": 1.2727988913232242, "grad_norm": 0.16541637480258942, "learning_rate": 5.757659398288712e-05, "loss": 0.6829, "mean_token_accuracy": 0.7883370779454708, "num_tokens": 441561544.0, "step": 13834 }, { "entropy": 0.5695726941339672, "epoch": 1.2728908976946653, "grad_norm": 0.15103237330913544, "learning_rate": 5.757352715674549e-05, "loss": 0.5476, "mean_token_accuracy": 0.8321606516838074, "num_tokens": 441593435.0, "step": 13835 }, { "entropy": 0.6152792545035481, "epoch": 1.2729829040661067, "grad_norm": 0.16093946993350983, "learning_rate": 5.757046033060386e-05, "loss": 0.5966, "mean_token_accuracy": 0.8158233687281609, "num_tokens": 441624298.0, "step": 13836 }, { "entropy": 0.6104194968938828, "epoch": 1.2730749104375478, "grad_norm": 0.15467391908168793, "learning_rate": 5.756739350446223e-05, "loss": 0.5889, "mean_token_accuracy": 0.8173552937805653, "num_tokens": 441656191.0, "step": 13837 }, { "entropy": 0.6196712795644999, "epoch": 1.273166916808989, "grad_norm": 0.15923695266246796, "learning_rate": 5.756432667832061e-05, "loss": 0.6007, "mean_token_accuracy": 0.8188120722770691, "num_tokens": 441688543.0, "step": 13838 }, { "entropy": 0.5993935372680426, "epoch": 1.2732589231804303, "grad_norm": 0.14865665137767792, "learning_rate": 5.7561259852178986e-05, "loss": 0.5965, "mean_token_accuracy": 0.8170304633677006, "num_tokens": 441721149.0, "step": 13839 }, { "entropy": 0.5539134088903666, "epoch": 1.2733509295518715, "grad_norm": 0.15042364597320557, "learning_rate": 5.7558193026037354e-05, "loss": 0.5409, "mean_token_accuracy": 0.832875233143568, "num_tokens": 441752936.0, "step": 13840 }, { "entropy": 0.6769829438999295, "epoch": 1.2734429359233128, "grad_norm": 0.16352351009845734, "learning_rate": 5.755512619989573e-05, "loss": 0.6649, "mean_token_accuracy": 0.7944390848278999, "num_tokens": 441784372.0, "step": 13841 }, { "entropy": 0.5919586946256459, "epoch": 1.273534942294754, "grad_norm": 0.14974480867385864, "learning_rate": 5.755205937375411e-05, "loss": 0.5845, "mean_token_accuracy": 0.8220030665397644, "num_tokens": 441816644.0, "step": 13842 }, { "entropy": 0.5995071521028876, "epoch": 1.273626948666195, "grad_norm": 0.1582026332616806, "learning_rate": 5.754899254761248e-05, "loss": 0.5775, "mean_token_accuracy": 0.8212923519313335, "num_tokens": 441847007.0, "step": 13843 }, { "entropy": 0.587158776819706, "epoch": 1.2737189550376364, "grad_norm": 0.15900833904743195, "learning_rate": 5.754592572147085e-05, "loss": 0.5863, "mean_token_accuracy": 0.8201338388025761, "num_tokens": 441878543.0, "step": 13844 }, { "entropy": 0.593153971247375, "epoch": 1.2738109614090776, "grad_norm": 0.16789330542087555, "learning_rate": 5.754285889532922e-05, "loss": 0.5985, "mean_token_accuracy": 0.8173963613808155, "num_tokens": 441910133.0, "step": 13845 }, { "entropy": 0.5071455137804151, "epoch": 1.273902967780519, "grad_norm": 0.1521548181772232, "learning_rate": 5.75397920691876e-05, "loss": 0.5046, "mean_token_accuracy": 0.8444474749267101, "num_tokens": 441942432.0, "step": 13846 }, { "entropy": 0.5231405235826969, "epoch": 1.27399497415196, "grad_norm": 0.14768217504024506, "learning_rate": 5.7536725243045976e-05, "loss": 0.5231, "mean_token_accuracy": 0.8339936845004559, "num_tokens": 441974624.0, "step": 13847 }, { "entropy": 0.6174324341118336, "epoch": 1.2740869805234012, "grad_norm": 0.15763483941555023, "learning_rate": 5.7533658416904344e-05, "loss": 0.6032, "mean_token_accuracy": 0.8130255676805973, "num_tokens": 442007003.0, "step": 13848 }, { "entropy": 0.662416135892272, "epoch": 1.2741789868948425, "grad_norm": 0.1658257246017456, "learning_rate": 5.753059159076272e-05, "loss": 0.6518, "mean_token_accuracy": 0.8001807779073715, "num_tokens": 442038555.0, "step": 13849 }, { "entropy": 0.7047492824494839, "epoch": 1.2742709932662837, "grad_norm": 0.16315844655036926, "learning_rate": 5.75275247646211e-05, "loss": 0.6942, "mean_token_accuracy": 0.787362840026617, "num_tokens": 442069928.0, "step": 13850 }, { "entropy": 0.606521500274539, "epoch": 1.274362999637725, "grad_norm": 0.151242196559906, "learning_rate": 5.752445793847947e-05, "loss": 0.5902, "mean_token_accuracy": 0.8212295360863209, "num_tokens": 442101840.0, "step": 13851 }, { "entropy": 0.6789348497986794, "epoch": 1.2744550060091662, "grad_norm": 0.17026516795158386, "learning_rate": 5.752139111233784e-05, "loss": 0.6799, "mean_token_accuracy": 0.795574814081192, "num_tokens": 442132987.0, "step": 13852 }, { "entropy": 0.6980616003274918, "epoch": 1.2745470123806073, "grad_norm": 0.16185380518436432, "learning_rate": 5.7518324286196224e-05, "loss": 0.691, "mean_token_accuracy": 0.7918191477656364, "num_tokens": 442165120.0, "step": 13853 }, { "entropy": 0.5436262395232916, "epoch": 1.2746390187520487, "grad_norm": 0.15807361900806427, "learning_rate": 5.751525746005459e-05, "loss": 0.5203, "mean_token_accuracy": 0.8398622013628483, "num_tokens": 442196792.0, "step": 13854 }, { "entropy": 0.6259259423241019, "epoch": 1.2747310251234898, "grad_norm": 0.1555822640657425, "learning_rate": 5.751219063391297e-05, "loss": 0.6205, "mean_token_accuracy": 0.8086319752037525, "num_tokens": 442229118.0, "step": 13855 }, { "entropy": 0.691930714994669, "epoch": 1.2748230314949311, "grad_norm": 0.161603644490242, "learning_rate": 5.7509123807771335e-05, "loss": 0.6866, "mean_token_accuracy": 0.7947201356291771, "num_tokens": 442261567.0, "step": 13856 }, { "entropy": 0.6193616297096014, "epoch": 1.2749150378663723, "grad_norm": 0.15491046011447906, "learning_rate": 5.7506056981629716e-05, "loss": 0.6135, "mean_token_accuracy": 0.8129960596561432, "num_tokens": 442293814.0, "step": 13857 }, { "entropy": 0.6622995901852846, "epoch": 1.2750070442378134, "grad_norm": 0.1638595312833786, "learning_rate": 5.750299015548809e-05, "loss": 0.628, "mean_token_accuracy": 0.8040282428264618, "num_tokens": 442325792.0, "step": 13858 }, { "entropy": 0.6606711912900209, "epoch": 1.2750990506092548, "grad_norm": 0.16940262913703918, "learning_rate": 5.749992332934646e-05, "loss": 0.652, "mean_token_accuracy": 0.799287885427475, "num_tokens": 442357331.0, "step": 13859 }, { "entropy": 0.6001984924077988, "epoch": 1.275191056980696, "grad_norm": 0.1576623171567917, "learning_rate": 5.749685650320483e-05, "loss": 0.5884, "mean_token_accuracy": 0.822505671530962, "num_tokens": 442389220.0, "step": 13860 }, { "entropy": 0.6381700364872813, "epoch": 1.2752830633521373, "grad_norm": 0.1608884334564209, "learning_rate": 5.7493789677063215e-05, "loss": 0.6298, "mean_token_accuracy": 0.805727381259203, "num_tokens": 442421422.0, "step": 13861 }, { "entropy": 0.6713154036551714, "epoch": 1.2753750697235784, "grad_norm": 0.1662663072347641, "learning_rate": 5.749072285092158e-05, "loss": 0.6518, "mean_token_accuracy": 0.7999961413443089, "num_tokens": 442452683.0, "step": 13862 }, { "entropy": 0.5742783714085817, "epoch": 1.2754670760950195, "grad_norm": 0.15358808636665344, "learning_rate": 5.748765602477996e-05, "loss": 0.5729, "mean_token_accuracy": 0.8235509432852268, "num_tokens": 442484667.0, "step": 13863 }, { "entropy": 0.640785239636898, "epoch": 1.2755590824664609, "grad_norm": 0.16236808896064758, "learning_rate": 5.7484589198638325e-05, "loss": 0.6332, "mean_token_accuracy": 0.8109557554125786, "num_tokens": 442516573.0, "step": 13864 }, { "entropy": 0.5951370066031814, "epoch": 1.275651088837902, "grad_norm": 0.1589687168598175, "learning_rate": 5.748152237249671e-05, "loss": 0.5994, "mean_token_accuracy": 0.8179879523813725, "num_tokens": 442548913.0, "step": 13865 }, { "entropy": 0.5362338447012007, "epoch": 1.2757430952093434, "grad_norm": 0.14742857217788696, "learning_rate": 5.747845554635508e-05, "loss": 0.513, "mean_token_accuracy": 0.841978169977665, "num_tokens": 442581297.0, "step": 13866 }, { "entropy": 0.6002123542129993, "epoch": 1.2758351015807845, "grad_norm": 0.15513888001441956, "learning_rate": 5.747538872021345e-05, "loss": 0.5904, "mean_token_accuracy": 0.8172590769827366, "num_tokens": 442613362.0, "step": 13867 }, { "entropy": 0.604791562538594, "epoch": 1.2759271079522256, "grad_norm": 0.15436150133609772, "learning_rate": 5.7472321894071824e-05, "loss": 0.5909, "mean_token_accuracy": 0.8183875232934952, "num_tokens": 442645382.0, "step": 13868 }, { "entropy": 0.6546464245766401, "epoch": 1.276019114323667, "grad_norm": 0.16635754704475403, "learning_rate": 5.7469255067930205e-05, "loss": 0.6547, "mean_token_accuracy": 0.8003407903015614, "num_tokens": 442677768.0, "step": 13869 }, { "entropy": 0.5626140739768744, "epoch": 1.2761111206951081, "grad_norm": 0.14636586606502533, "learning_rate": 5.746618824178858e-05, "loss": 0.534, "mean_token_accuracy": 0.8332091085612774, "num_tokens": 442709181.0, "step": 13870 }, { "entropy": 0.6373679451644421, "epoch": 1.2762031270665495, "grad_norm": 0.16426651179790497, "learning_rate": 5.746312141564695e-05, "loss": 0.624, "mean_token_accuracy": 0.8091262653470039, "num_tokens": 442741449.0, "step": 13871 }, { "entropy": 0.5476949214935303, "epoch": 1.2762951334379906, "grad_norm": 0.1590166687965393, "learning_rate": 5.746005458950532e-05, "loss": 0.5371, "mean_token_accuracy": 0.8294711671769619, "num_tokens": 442772604.0, "step": 13872 }, { "entropy": 0.6741463355720043, "epoch": 1.2763871398094317, "grad_norm": 0.15701577067375183, "learning_rate": 5.7456987763363704e-05, "loss": 0.6677, "mean_token_accuracy": 0.7978526018559933, "num_tokens": 442805243.0, "step": 13873 }, { "entropy": 0.5980631848797202, "epoch": 1.276479146180873, "grad_norm": 0.15351064503192902, "learning_rate": 5.745392093722207e-05, "loss": 0.5944, "mean_token_accuracy": 0.8179227560758591, "num_tokens": 442837818.0, "step": 13874 }, { "entropy": 0.5846872692927718, "epoch": 1.2765711525523142, "grad_norm": 0.15152305364608765, "learning_rate": 5.7450854111080446e-05, "loss": 0.5593, "mean_token_accuracy": 0.8291415721178055, "num_tokens": 442870294.0, "step": 13875 }, { "entropy": 0.6315066013485193, "epoch": 1.2766631589237556, "grad_norm": 0.16094501316547394, "learning_rate": 5.7447787284938814e-05, "loss": 0.622, "mean_token_accuracy": 0.8124467618763447, "num_tokens": 442901320.0, "step": 13876 }, { "entropy": 0.6440190710127354, "epoch": 1.2767551652951967, "grad_norm": 0.1623286008834839, "learning_rate": 5.7444720458797195e-05, "loss": 0.6336, "mean_token_accuracy": 0.810612827539444, "num_tokens": 442932540.0, "step": 13877 }, { "entropy": 0.5546012930572033, "epoch": 1.2768471716666379, "grad_norm": 0.1508064866065979, "learning_rate": 5.744165363265557e-05, "loss": 0.5434, "mean_token_accuracy": 0.8314789421856403, "num_tokens": 442964669.0, "step": 13878 }, { "entropy": 0.6075981156900525, "epoch": 1.2769391780380792, "grad_norm": 0.14901448786258698, "learning_rate": 5.743858680651394e-05, "loss": 0.5917, "mean_token_accuracy": 0.81851901486516, "num_tokens": 442997142.0, "step": 13879 }, { "entropy": 0.5741992890834808, "epoch": 1.2770311844095203, "grad_norm": 0.15267673134803772, "learning_rate": 5.743551998037232e-05, "loss": 0.5546, "mean_token_accuracy": 0.8267999924719334, "num_tokens": 443029192.0, "step": 13880 }, { "entropy": 0.6102674882858992, "epoch": 1.2771231907809617, "grad_norm": 0.1511266678571701, "learning_rate": 5.7432453154230694e-05, "loss": 0.6009, "mean_token_accuracy": 0.8175448328256607, "num_tokens": 443061583.0, "step": 13881 }, { "entropy": 0.6474477238953114, "epoch": 1.2772151971524028, "grad_norm": 0.16258618235588074, "learning_rate": 5.742938632808906e-05, "loss": 0.6404, "mean_token_accuracy": 0.8039922937750816, "num_tokens": 443093850.0, "step": 13882 }, { "entropy": 0.6355354581028223, "epoch": 1.277307203523844, "grad_norm": 0.1558583527803421, "learning_rate": 5.7426319501947437e-05, "loss": 0.6221, "mean_token_accuracy": 0.8060208633542061, "num_tokens": 443125256.0, "step": 13883 }, { "entropy": 0.6766267828643322, "epoch": 1.2773992098952853, "grad_norm": 0.1623411774635315, "learning_rate": 5.742325267580582e-05, "loss": 0.6651, "mean_token_accuracy": 0.7953330129384995, "num_tokens": 443157218.0, "step": 13884 }, { "entropy": 0.6958759129047394, "epoch": 1.2774912162667265, "grad_norm": 0.16498631238937378, "learning_rate": 5.7420185849664186e-05, "loss": 0.7041, "mean_token_accuracy": 0.7883907556533813, "num_tokens": 443188794.0, "step": 13885 }, { "entropy": 0.6225306894630194, "epoch": 1.2775832226381678, "grad_norm": 0.15882191061973572, "learning_rate": 5.741711902352256e-05, "loss": 0.6242, "mean_token_accuracy": 0.8108721785247326, "num_tokens": 443220729.0, "step": 13886 }, { "entropy": 0.6861286610364914, "epoch": 1.277675229009609, "grad_norm": 0.15713398158550262, "learning_rate": 5.741405219738093e-05, "loss": 0.6682, "mean_token_accuracy": 0.8001101687550545, "num_tokens": 443252989.0, "step": 13887 }, { "entropy": 0.6635510958731174, "epoch": 1.27776723538105, "grad_norm": 0.16457854211330414, "learning_rate": 5.741098537123931e-05, "loss": 0.6554, "mean_token_accuracy": 0.7990943714976311, "num_tokens": 443285065.0, "step": 13888 }, { "entropy": 0.5411069020628929, "epoch": 1.2778592417524914, "grad_norm": 0.15547390282154083, "learning_rate": 5.7407918545097684e-05, "loss": 0.5316, "mean_token_accuracy": 0.8361757360398769, "num_tokens": 443317036.0, "step": 13889 }, { "entropy": 0.6196090411394835, "epoch": 1.2779512481239326, "grad_norm": 0.16910439729690552, "learning_rate": 5.740485171895605e-05, "loss": 0.5916, "mean_token_accuracy": 0.8167320638895035, "num_tokens": 443349292.0, "step": 13890 }, { "entropy": 0.6818442586809397, "epoch": 1.278043254495374, "grad_norm": 0.16202512383460999, "learning_rate": 5.740178489281443e-05, "loss": 0.6694, "mean_token_accuracy": 0.7934325039386749, "num_tokens": 443380620.0, "step": 13891 }, { "entropy": 0.5619233138859272, "epoch": 1.278135260866815, "grad_norm": 0.14270591735839844, "learning_rate": 5.739871806667281e-05, "loss": 0.5376, "mean_token_accuracy": 0.8353612162172794, "num_tokens": 443412739.0, "step": 13892 }, { "entropy": 0.5053449254482985, "epoch": 1.2782272672382562, "grad_norm": 0.14793437719345093, "learning_rate": 5.7395651240531176e-05, "loss": 0.4899, "mean_token_accuracy": 0.8469527848064899, "num_tokens": 443444685.0, "step": 13893 }, { "entropy": 0.601453335955739, "epoch": 1.2783192736096975, "grad_norm": 0.15477211773395538, "learning_rate": 5.739258441438955e-05, "loss": 0.6028, "mean_token_accuracy": 0.8138456158339977, "num_tokens": 443476647.0, "step": 13894 }, { "entropy": 0.6592674730345607, "epoch": 1.2784112799811387, "grad_norm": 0.15954343974590302, "learning_rate": 5.738951758824792e-05, "loss": 0.6549, "mean_token_accuracy": 0.8022481240332127, "num_tokens": 443508313.0, "step": 13895 }, { "entropy": 0.6614724099636078, "epoch": 1.27850328635258, "grad_norm": 0.1588982492685318, "learning_rate": 5.73864507621063e-05, "loss": 0.6545, "mean_token_accuracy": 0.8011260367929935, "num_tokens": 443539467.0, "step": 13896 }, { "entropy": 0.5582099333405495, "epoch": 1.2785952927240212, "grad_norm": 0.15015427768230438, "learning_rate": 5.7383383935964675e-05, "loss": 0.5443, "mean_token_accuracy": 0.8341596573591232, "num_tokens": 443571812.0, "step": 13897 }, { "entropy": 0.6074298359453678, "epoch": 1.2786872990954623, "grad_norm": 0.15247176587581635, "learning_rate": 5.738031710982304e-05, "loss": 0.5927, "mean_token_accuracy": 0.8189163766801357, "num_tokens": 443604281.0, "step": 13898 }, { "entropy": 0.6786485072225332, "epoch": 1.2787793054669037, "grad_norm": 0.15448060631752014, "learning_rate": 5.737725028368142e-05, "loss": 0.6625, "mean_token_accuracy": 0.7966324761509895, "num_tokens": 443636442.0, "step": 13899 }, { "entropy": 0.5783123942092061, "epoch": 1.2788713118383448, "grad_norm": 0.15984287858009338, "learning_rate": 5.73741834575398e-05, "loss": 0.559, "mean_token_accuracy": 0.827831044793129, "num_tokens": 443668414.0, "step": 13900 }, { "entropy": 0.7830788102000952, "epoch": 1.2789633182097861, "grad_norm": 0.17612740397453308, "learning_rate": 5.737111663139817e-05, "loss": 0.7916, "mean_token_accuracy": 0.7601870708167553, "num_tokens": 443699686.0, "step": 13901 }, { "entropy": 0.6530077308416367, "epoch": 1.2790553245812273, "grad_norm": 0.15881122648715973, "learning_rate": 5.736804980525654e-05, "loss": 0.6373, "mean_token_accuracy": 0.8060609176754951, "num_tokens": 443732036.0, "step": 13902 }, { "entropy": 0.6050755344331264, "epoch": 1.2791473309526684, "grad_norm": 0.1556432992219925, "learning_rate": 5.736498297911491e-05, "loss": 0.5867, "mean_token_accuracy": 0.816082451492548, "num_tokens": 443763465.0, "step": 13903 }, { "entropy": 0.5841084159910679, "epoch": 1.2792393373241098, "grad_norm": 0.1531592607498169, "learning_rate": 5.73619161529733e-05, "loss": 0.5793, "mean_token_accuracy": 0.8198496252298355, "num_tokens": 443795719.0, "step": 13904 }, { "entropy": 0.5860727392137051, "epoch": 1.279331343695551, "grad_norm": 0.15251538157463074, "learning_rate": 5.7358849326831665e-05, "loss": 0.5779, "mean_token_accuracy": 0.8216086067259312, "num_tokens": 443827672.0, "step": 13905 }, { "entropy": 0.658170341514051, "epoch": 1.2794233500669923, "grad_norm": 0.1612427830696106, "learning_rate": 5.735578250069003e-05, "loss": 0.6446, "mean_token_accuracy": 0.8021383732557297, "num_tokens": 443859485.0, "step": 13906 }, { "entropy": 0.6303599812090397, "epoch": 1.2795153564384334, "grad_norm": 0.16068285703659058, "learning_rate": 5.735271567454841e-05, "loss": 0.6178, "mean_token_accuracy": 0.8095703981816769, "num_tokens": 443890922.0, "step": 13907 }, { "entropy": 0.6264244494959712, "epoch": 1.2796073628098745, "grad_norm": 0.15577398240566254, "learning_rate": 5.734964884840679e-05, "loss": 0.6235, "mean_token_accuracy": 0.8102701120078564, "num_tokens": 443923087.0, "step": 13908 }, { "entropy": 0.531996110221371, "epoch": 1.2796993691813159, "grad_norm": 0.1472480297088623, "learning_rate": 5.7346582022265164e-05, "loss": 0.5189, "mean_token_accuracy": 0.838898628950119, "num_tokens": 443955058.0, "step": 13909 }, { "entropy": 0.7032715668901801, "epoch": 1.279791375552757, "grad_norm": 0.16553564369678497, "learning_rate": 5.734351519612353e-05, "loss": 0.7068, "mean_token_accuracy": 0.7826730534434319, "num_tokens": 443987285.0, "step": 13910 }, { "entropy": 0.6079462091438472, "epoch": 1.2798833819241984, "grad_norm": 0.15632589161396027, "learning_rate": 5.734044836998191e-05, "loss": 0.5871, "mean_token_accuracy": 0.8173440843820572, "num_tokens": 444018927.0, "step": 13911 }, { "entropy": 0.5597226750105619, "epoch": 1.2799753882956395, "grad_norm": 0.1509910523891449, "learning_rate": 5.733738154384029e-05, "loss": 0.5393, "mean_token_accuracy": 0.8311402648687363, "num_tokens": 444051206.0, "step": 13912 }, { "entropy": 0.5342313107103109, "epoch": 1.2800673946670806, "grad_norm": 0.1507698893547058, "learning_rate": 5.7334314717698656e-05, "loss": 0.5228, "mean_token_accuracy": 0.8412925116717815, "num_tokens": 444083463.0, "step": 13913 }, { "entropy": 0.656307877972722, "epoch": 1.280159401038522, "grad_norm": 0.168048694729805, "learning_rate": 5.733124789155703e-05, "loss": 0.642, "mean_token_accuracy": 0.8022663742303848, "num_tokens": 444115661.0, "step": 13914 }, { "entropy": 0.5275769259314984, "epoch": 1.2802514074099631, "grad_norm": 0.1569826304912567, "learning_rate": 5.732818106541541e-05, "loss": 0.5206, "mean_token_accuracy": 0.8364079110324383, "num_tokens": 444147624.0, "step": 13915 }, { "entropy": 0.6051745638251305, "epoch": 1.2803434137814045, "grad_norm": 0.15243114531040192, "learning_rate": 5.732511423927378e-05, "loss": 0.6037, "mean_token_accuracy": 0.8143372572958469, "num_tokens": 444178960.0, "step": 13916 }, { "entropy": 0.5977047979831696, "epoch": 1.2804354201528456, "grad_norm": 0.1473105251789093, "learning_rate": 5.7322047413132154e-05, "loss": 0.5775, "mean_token_accuracy": 0.8205301724374294, "num_tokens": 444211244.0, "step": 13917 }, { "entropy": 0.5579828973859549, "epoch": 1.2805274265242867, "grad_norm": 0.15171952545642853, "learning_rate": 5.731898058699052e-05, "loss": 0.5542, "mean_token_accuracy": 0.8330010622739792, "num_tokens": 444243245.0, "step": 13918 }, { "entropy": 0.642421749420464, "epoch": 1.280619432895728, "grad_norm": 0.1569940447807312, "learning_rate": 5.7315913760848904e-05, "loss": 0.6128, "mean_token_accuracy": 0.8115162290632725, "num_tokens": 444274867.0, "step": 13919 }, { "entropy": 0.4964998164214194, "epoch": 1.2807114392671692, "grad_norm": 0.14283116161823273, "learning_rate": 5.731284693470728e-05, "loss": 0.4832, "mean_token_accuracy": 0.8496962077915668, "num_tokens": 444307199.0, "step": 13920 }, { "entropy": 0.6392024513334036, "epoch": 1.2808034456386106, "grad_norm": 0.15604428946971893, "learning_rate": 5.7309780108565646e-05, "loss": 0.623, "mean_token_accuracy": 0.8076278641819954, "num_tokens": 444338771.0, "step": 13921 }, { "entropy": 0.6734645124524832, "epoch": 1.2808954520100517, "grad_norm": 0.16512955725193024, "learning_rate": 5.730671328242402e-05, "loss": 0.6662, "mean_token_accuracy": 0.7932133041322231, "num_tokens": 444369366.0, "step": 13922 }, { "entropy": 0.6289970623329282, "epoch": 1.2809874583814929, "grad_norm": 0.1530550718307495, "learning_rate": 5.73036464562824e-05, "loss": 0.6201, "mean_token_accuracy": 0.8094162195920944, "num_tokens": 444402134.0, "step": 13923 }, { "entropy": 0.709039619192481, "epoch": 1.2810794647529342, "grad_norm": 0.15522493422031403, "learning_rate": 5.730057963014077e-05, "loss": 0.6963, "mean_token_accuracy": 0.7868913486599922, "num_tokens": 444434738.0, "step": 13924 }, { "entropy": 0.5966073321178555, "epoch": 1.2811714711243753, "grad_norm": 0.15839232504367828, "learning_rate": 5.7297512803999145e-05, "loss": 0.5986, "mean_token_accuracy": 0.8194049969315529, "num_tokens": 444466638.0, "step": 13925 }, { "entropy": 0.6396216731518507, "epoch": 1.2812634774958167, "grad_norm": 0.15620547533035278, "learning_rate": 5.729444597785751e-05, "loss": 0.6228, "mean_token_accuracy": 0.8115263357758522, "num_tokens": 444499036.0, "step": 13926 }, { "entropy": 0.6450654771178961, "epoch": 1.2813554838672578, "grad_norm": 0.1647142618894577, "learning_rate": 5.7291379151715894e-05, "loss": 0.6383, "mean_token_accuracy": 0.8096137717366219, "num_tokens": 444530788.0, "step": 13927 }, { "entropy": 0.6863249819725752, "epoch": 1.281447490238699, "grad_norm": 0.16221748292446136, "learning_rate": 5.728831232557427e-05, "loss": 0.6859, "mean_token_accuracy": 0.7953794896602631, "num_tokens": 444562985.0, "step": 13928 }, { "entropy": 0.5681913336738944, "epoch": 1.2815394966101403, "grad_norm": 0.15061919391155243, "learning_rate": 5.7285245499432636e-05, "loss": 0.5557, "mean_token_accuracy": 0.8303997479379177, "num_tokens": 444595599.0, "step": 13929 }, { "entropy": 0.5743945240974426, "epoch": 1.2816315029815815, "grad_norm": 0.16482746601104736, "learning_rate": 5.728217867329101e-05, "loss": 0.5595, "mean_token_accuracy": 0.827164925634861, "num_tokens": 444627206.0, "step": 13930 }, { "entropy": 0.5096466802060604, "epoch": 1.2817235093530228, "grad_norm": 0.15136906504631042, "learning_rate": 5.727911184714939e-05, "loss": 0.5036, "mean_token_accuracy": 0.8418514765799046, "num_tokens": 444659255.0, "step": 13931 }, { "entropy": 0.6395183894783258, "epoch": 1.281815515724464, "grad_norm": 0.16679984331130981, "learning_rate": 5.727604502100776e-05, "loss": 0.6361, "mean_token_accuracy": 0.8083477541804314, "num_tokens": 444691098.0, "step": 13932 }, { "entropy": 0.5993913726415485, "epoch": 1.281907522095905, "grad_norm": 0.1472110152244568, "learning_rate": 5.7272978194866135e-05, "loss": 0.5826, "mean_token_accuracy": 0.8186062835156918, "num_tokens": 444723381.0, "step": 13933 }, { "entropy": 0.6620615441352129, "epoch": 1.2819995284673464, "grad_norm": 0.16367988288402557, "learning_rate": 5.72699113687245e-05, "loss": 0.65, "mean_token_accuracy": 0.7980656400322914, "num_tokens": 444754720.0, "step": 13934 }, { "entropy": 0.7607994414865971, "epoch": 1.2820915348387876, "grad_norm": 0.16631393134593964, "learning_rate": 5.7266844542582884e-05, "loss": 0.7677, "mean_token_accuracy": 0.7708362825214863, "num_tokens": 444786889.0, "step": 13935 }, { "entropy": 0.7072200961410999, "epoch": 1.282183541210229, "grad_norm": 0.16468006372451782, "learning_rate": 5.726377771644126e-05, "loss": 0.6758, "mean_token_accuracy": 0.7955215871334076, "num_tokens": 444818092.0, "step": 13936 }, { "entropy": 0.6496148770675063, "epoch": 1.28227554758167, "grad_norm": 0.1569986790418625, "learning_rate": 5.726071089029963e-05, "loss": 0.6418, "mean_token_accuracy": 0.8037200570106506, "num_tokens": 444850142.0, "step": 13937 }, { "entropy": 0.6366099659353495, "epoch": 1.2823675539531112, "grad_norm": 0.16238898038864136, "learning_rate": 5.7257644064158e-05, "loss": 0.6339, "mean_token_accuracy": 0.8054422065615654, "num_tokens": 444882545.0, "step": 13938 }, { "entropy": 0.6071907859295607, "epoch": 1.2824595603245525, "grad_norm": 0.1558872014284134, "learning_rate": 5.725457723801638e-05, "loss": 0.595, "mean_token_accuracy": 0.8213501311838627, "num_tokens": 444914519.0, "step": 13939 }, { "entropy": 0.6177520286291838, "epoch": 1.2825515666959937, "grad_norm": 0.15828369557857513, "learning_rate": 5.725151041187475e-05, "loss": 0.6163, "mean_token_accuracy": 0.8105834648013115, "num_tokens": 444946182.0, "step": 13940 }, { "entropy": 0.6746214497834444, "epoch": 1.282643573067435, "grad_norm": 0.16179712116718292, "learning_rate": 5.7248443585733125e-05, "loss": 0.6553, "mean_token_accuracy": 0.7999606244266033, "num_tokens": 444977911.0, "step": 13941 }, { "entropy": 0.7045242842286825, "epoch": 1.2827355794388762, "grad_norm": 0.1626707911491394, "learning_rate": 5.724537675959151e-05, "loss": 0.706, "mean_token_accuracy": 0.7827534824609756, "num_tokens": 445009113.0, "step": 13942 }, { "entropy": 0.5822938377968967, "epoch": 1.2828275858103173, "grad_norm": 0.16205139458179474, "learning_rate": 5.7242309933449875e-05, "loss": 0.5674, "mean_token_accuracy": 0.8221582062542439, "num_tokens": 445041304.0, "step": 13943 }, { "entropy": 0.65912951156497, "epoch": 1.2829195921817587, "grad_norm": 0.15650713443756104, "learning_rate": 5.723924310730825e-05, "loss": 0.649, "mean_token_accuracy": 0.8004701137542725, "num_tokens": 445073219.0, "step": 13944 }, { "entropy": 0.677761547267437, "epoch": 1.2830115985531998, "grad_norm": 0.16562122106552124, "learning_rate": 5.723617628116662e-05, "loss": 0.6763, "mean_token_accuracy": 0.7949628047645092, "num_tokens": 445105216.0, "step": 13945 }, { "entropy": 0.6676440332084894, "epoch": 1.2831036049246412, "grad_norm": 0.1578352153301239, "learning_rate": 5.7233109455025005e-05, "loss": 0.657, "mean_token_accuracy": 0.7966528162360191, "num_tokens": 445137497.0, "step": 13946 }, { "entropy": 0.6746672447770834, "epoch": 1.2831956112960823, "grad_norm": 0.15596118569374084, "learning_rate": 5.723004262888337e-05, "loss": 0.6835, "mean_token_accuracy": 0.7942074202001095, "num_tokens": 445169248.0, "step": 13947 }, { "entropy": 0.7151540089398623, "epoch": 1.2832876176675234, "grad_norm": 0.16903771460056305, "learning_rate": 5.722697580274175e-05, "loss": 0.7209, "mean_token_accuracy": 0.7843733876943588, "num_tokens": 445200550.0, "step": 13948 }, { "entropy": 0.7138705928809941, "epoch": 1.2833796240389648, "grad_norm": 0.16670918464660645, "learning_rate": 5.7223908976600116e-05, "loss": 0.6989, "mean_token_accuracy": 0.7900672629475594, "num_tokens": 445232608.0, "step": 13949 }, { "entropy": 0.7321032993495464, "epoch": 1.283471630410406, "grad_norm": 0.15805403888225555, "learning_rate": 5.72208421504585e-05, "loss": 0.7244, "mean_token_accuracy": 0.7813287377357483, "num_tokens": 445264878.0, "step": 13950 }, { "entropy": 0.5995832923799753, "epoch": 1.2835636367818473, "grad_norm": 0.16169840097427368, "learning_rate": 5.721777532431687e-05, "loss": 0.5761, "mean_token_accuracy": 0.8201040625572205, "num_tokens": 445296344.0, "step": 13951 }, { "entropy": 0.6074795294553041, "epoch": 1.2836556431532884, "grad_norm": 0.1568029522895813, "learning_rate": 5.721470849817524e-05, "loss": 0.5985, "mean_token_accuracy": 0.816398274153471, "num_tokens": 445328715.0, "step": 13952 }, { "entropy": 0.6095465878024697, "epoch": 1.2837476495247295, "grad_norm": 0.15441302955150604, "learning_rate": 5.7211641672033614e-05, "loss": 0.5839, "mean_token_accuracy": 0.8216642960906029, "num_tokens": 445360768.0, "step": 13953 }, { "entropy": 0.5625454783439636, "epoch": 1.2838396558961709, "grad_norm": 0.16092853248119354, "learning_rate": 5.7208574845891996e-05, "loss": 0.5441, "mean_token_accuracy": 0.833562683314085, "num_tokens": 445392786.0, "step": 13954 }, { "entropy": 0.6417212653905153, "epoch": 1.283931662267612, "grad_norm": 0.15759584307670593, "learning_rate": 5.7205508019750364e-05, "loss": 0.6327, "mean_token_accuracy": 0.8066905029118061, "num_tokens": 445425336.0, "step": 13955 }, { "entropy": 0.6172169037163258, "epoch": 1.2840236686390534, "grad_norm": 0.1521005630493164, "learning_rate": 5.720244119360874e-05, "loss": 0.6078, "mean_token_accuracy": 0.8140291236341, "num_tokens": 445457602.0, "step": 13956 }, { "entropy": 0.6092513846233487, "epoch": 1.2841156750104945, "grad_norm": 0.1618632674217224, "learning_rate": 5.7199374367467106e-05, "loss": 0.5916, "mean_token_accuracy": 0.8154792934656143, "num_tokens": 445489601.0, "step": 13957 }, { "entropy": 0.5709778852760792, "epoch": 1.2842076813819356, "grad_norm": 0.15427421033382416, "learning_rate": 5.719630754132549e-05, "loss": 0.5553, "mean_token_accuracy": 0.8311301358044147, "num_tokens": 445521740.0, "step": 13958 }, { "entropy": 0.6190004323143512, "epoch": 1.284299687753377, "grad_norm": 0.156508669257164, "learning_rate": 5.719324071518386e-05, "loss": 0.5954, "mean_token_accuracy": 0.8157352060079575, "num_tokens": 445552863.0, "step": 13959 }, { "entropy": 0.5364960813894868, "epoch": 1.2843916941248181, "grad_norm": 0.15338818728923798, "learning_rate": 5.719017388904223e-05, "loss": 0.5303, "mean_token_accuracy": 0.8396273888647556, "num_tokens": 445584758.0, "step": 13960 }, { "entropy": 0.6696375943720341, "epoch": 1.2844837004962595, "grad_norm": 0.16528908908367157, "learning_rate": 5.7187107062900605e-05, "loss": 0.6646, "mean_token_accuracy": 0.7996410578489304, "num_tokens": 445616781.0, "step": 13961 }, { "entropy": 0.6345050353556871, "epoch": 1.2845757068677006, "grad_norm": 0.16502732038497925, "learning_rate": 5.7184040236758986e-05, "loss": 0.6187, "mean_token_accuracy": 0.8116022199392319, "num_tokens": 445648439.0, "step": 13962 }, { "entropy": 0.6001757886260748, "epoch": 1.2846677132391418, "grad_norm": 0.1639164835214615, "learning_rate": 5.7180973410617354e-05, "loss": 0.6053, "mean_token_accuracy": 0.8126375451683998, "num_tokens": 445679008.0, "step": 13963 }, { "entropy": 0.6863175481557846, "epoch": 1.284759719610583, "grad_norm": 0.15739378333091736, "learning_rate": 5.717790658447573e-05, "loss": 0.6861, "mean_token_accuracy": 0.7941100560128689, "num_tokens": 445710994.0, "step": 13964 }, { "entropy": 0.6191085958853364, "epoch": 1.2848517259820242, "grad_norm": 0.15476249158382416, "learning_rate": 5.71748397583341e-05, "loss": 0.6054, "mean_token_accuracy": 0.8146487474441528, "num_tokens": 445743545.0, "step": 13965 }, { "entropy": 0.5185008223634213, "epoch": 1.2849437323534656, "grad_norm": 0.15538392961025238, "learning_rate": 5.717177293219248e-05, "loss": 0.5088, "mean_token_accuracy": 0.8449302427470684, "num_tokens": 445774648.0, "step": 13966 }, { "entropy": 0.6260475516319275, "epoch": 1.2850357387249067, "grad_norm": 0.16241499781608582, "learning_rate": 5.716870610605085e-05, "loss": 0.626, "mean_token_accuracy": 0.8121362775564194, "num_tokens": 445806560.0, "step": 13967 }, { "entropy": 0.5738927088677883, "epoch": 1.2851277450963479, "grad_norm": 0.15127766132354736, "learning_rate": 5.716563927990922e-05, "loss": 0.5676, "mean_token_accuracy": 0.8247968629002571, "num_tokens": 445838659.0, "step": 13968 }, { "entropy": 0.6371417529881, "epoch": 1.2852197514677892, "grad_norm": 0.16202884912490845, "learning_rate": 5.7162572453767595e-05, "loss": 0.6173, "mean_token_accuracy": 0.8088314421474934, "num_tokens": 445870394.0, "step": 13969 }, { "entropy": 0.5979816876351833, "epoch": 1.2853117578392304, "grad_norm": 0.15755139291286469, "learning_rate": 5.715950562762598e-05, "loss": 0.5848, "mean_token_accuracy": 0.8170301914215088, "num_tokens": 445902373.0, "step": 13970 }, { "entropy": 0.5916828755289316, "epoch": 1.2854037642106717, "grad_norm": 0.15523701906204224, "learning_rate": 5.7156438801484345e-05, "loss": 0.5821, "mean_token_accuracy": 0.820569958537817, "num_tokens": 445934165.0, "step": 13971 }, { "entropy": 0.6583787081763148, "epoch": 1.2854957705821128, "grad_norm": 0.16748572885990143, "learning_rate": 5.715337197534272e-05, "loss": 0.6483, "mean_token_accuracy": 0.8023795932531357, "num_tokens": 445966135.0, "step": 13972 }, { "entropy": 0.6438766606152058, "epoch": 1.285587776953554, "grad_norm": 0.1546589732170105, "learning_rate": 5.71503051492011e-05, "loss": 0.63, "mean_token_accuracy": 0.801011212170124, "num_tokens": 445998161.0, "step": 13973 }, { "entropy": 0.5614010645076632, "epoch": 1.2856797833249953, "grad_norm": 0.14944209158420563, "learning_rate": 5.714723832305947e-05, "loss": 0.5567, "mean_token_accuracy": 0.8290481679141521, "num_tokens": 446030611.0, "step": 13974 }, { "entropy": 0.5279432525858283, "epoch": 1.2857717896964365, "grad_norm": 0.14851973950862885, "learning_rate": 5.714417149691784e-05, "loss": 0.5182, "mean_token_accuracy": 0.8390407003462315, "num_tokens": 446062445.0, "step": 13975 }, { "entropy": 0.6046153949573636, "epoch": 1.2858637960678778, "grad_norm": 0.1581742912530899, "learning_rate": 5.714110467077621e-05, "loss": 0.5917, "mean_token_accuracy": 0.8145664781332016, "num_tokens": 446094503.0, "step": 13976 }, { "entropy": 0.5919231195002794, "epoch": 1.285955802439319, "grad_norm": 0.16216111183166504, "learning_rate": 5.713803784463459e-05, "loss": 0.5703, "mean_token_accuracy": 0.8223271928727627, "num_tokens": 446125472.0, "step": 13977 }, { "entropy": 0.5395850585773587, "epoch": 1.28604780881076, "grad_norm": 0.15714263916015625, "learning_rate": 5.713497101849297e-05, "loss": 0.5183, "mean_token_accuracy": 0.8413593582808971, "num_tokens": 446157714.0, "step": 13978 }, { "entropy": 0.6488213976845145, "epoch": 1.2861398151822014, "grad_norm": 0.1615578979253769, "learning_rate": 5.7131904192351335e-05, "loss": 0.6284, "mean_token_accuracy": 0.8090370930731297, "num_tokens": 446189405.0, "step": 13979 }, { "entropy": 0.5806027632206678, "epoch": 1.2862318215536426, "grad_norm": 0.15910804271697998, "learning_rate": 5.712883736620971e-05, "loss": 0.5622, "mean_token_accuracy": 0.8247654847800732, "num_tokens": 446221301.0, "step": 13980 }, { "entropy": 0.7497548051178455, "epoch": 1.286323827925084, "grad_norm": 0.1671525537967682, "learning_rate": 5.712577054006809e-05, "loss": 0.7327, "mean_token_accuracy": 0.7817831709980965, "num_tokens": 446253236.0, "step": 13981 }, { "entropy": 0.5812160167843103, "epoch": 1.286415834296525, "grad_norm": 0.16209182143211365, "learning_rate": 5.712270371392646e-05, "loss": 0.5846, "mean_token_accuracy": 0.820591364055872, "num_tokens": 446284788.0, "step": 13982 }, { "entropy": 0.5283577041700482, "epoch": 1.2865078406679662, "grad_norm": 0.14945925772190094, "learning_rate": 5.7119636887784834e-05, "loss": 0.5203, "mean_token_accuracy": 0.842688761651516, "num_tokens": 446317013.0, "step": 13983 }, { "entropy": 0.7596057262271643, "epoch": 1.2865998470394076, "grad_norm": 0.17152191698551178, "learning_rate": 5.71165700616432e-05, "loss": 0.7474, "mean_token_accuracy": 0.7693666592240334, "num_tokens": 446347570.0, "step": 13984 }, { "entropy": 0.6353377364575863, "epoch": 1.2866918534108487, "grad_norm": 0.16053929924964905, "learning_rate": 5.711350323550159e-05, "loss": 0.6236, "mean_token_accuracy": 0.8085015006363392, "num_tokens": 446378883.0, "step": 13985 }, { "entropy": 0.5854429882019758, "epoch": 1.28678385978229, "grad_norm": 0.16099068522453308, "learning_rate": 5.711043640935996e-05, "loss": 0.5802, "mean_token_accuracy": 0.8197457864880562, "num_tokens": 446411584.0, "step": 13986 }, { "entropy": 0.5952069954946637, "epoch": 1.2868758661537312, "grad_norm": 0.16098667681217194, "learning_rate": 5.7107369583218325e-05, "loss": 0.5954, "mean_token_accuracy": 0.81777523458004, "num_tokens": 446442804.0, "step": 13987 }, { "entropy": 0.5749766128137708, "epoch": 1.2869678725251723, "grad_norm": 0.15745709836483002, "learning_rate": 5.71043027570767e-05, "loss": 0.5555, "mean_token_accuracy": 0.8317190408706665, "num_tokens": 446474820.0, "step": 13988 }, { "entropy": 0.6016020681709051, "epoch": 1.2870598788966137, "grad_norm": 0.15473581850528717, "learning_rate": 5.710123593093508e-05, "loss": 0.5822, "mean_token_accuracy": 0.8200168423354626, "num_tokens": 446506876.0, "step": 13989 }, { "entropy": 0.6629216633737087, "epoch": 1.2871518852680548, "grad_norm": 0.15940505266189575, "learning_rate": 5.7098169104793456e-05, "loss": 0.6462, "mean_token_accuracy": 0.8044280670583248, "num_tokens": 446539536.0, "step": 13990 }, { "entropy": 0.5560964588075876, "epoch": 1.2872438916394962, "grad_norm": 0.16345135867595673, "learning_rate": 5.7095102278651824e-05, "loss": 0.5452, "mean_token_accuracy": 0.833584226667881, "num_tokens": 446571752.0, "step": 13991 }, { "entropy": 0.7146218800917268, "epoch": 1.2873358980109373, "grad_norm": 0.1676354855298996, "learning_rate": 5.70920354525102e-05, "loss": 0.7042, "mean_token_accuracy": 0.7861871793866158, "num_tokens": 446602964.0, "step": 13992 }, { "entropy": 0.6588567062281072, "epoch": 1.2874279043823784, "grad_norm": 0.16895334422588348, "learning_rate": 5.708896862636858e-05, "loss": 0.6412, "mean_token_accuracy": 0.8027874603867531, "num_tokens": 446634646.0, "step": 13993 }, { "entropy": 0.5945086269639432, "epoch": 1.2875199107538198, "grad_norm": 0.16393083333969116, "learning_rate": 5.708590180022695e-05, "loss": 0.5835, "mean_token_accuracy": 0.8205623887479305, "num_tokens": 446665821.0, "step": 13994 }, { "entropy": 0.733405087608844, "epoch": 1.287611917125261, "grad_norm": 0.16414162516593933, "learning_rate": 5.708283497408532e-05, "loss": 0.7425, "mean_token_accuracy": 0.7807683125138283, "num_tokens": 446697969.0, "step": 13995 }, { "entropy": 0.7093808744102716, "epoch": 1.2877039234967023, "grad_norm": 0.16647954285144806, "learning_rate": 5.707976814794369e-05, "loss": 0.7021, "mean_token_accuracy": 0.7899001874029636, "num_tokens": 446729028.0, "step": 13996 }, { "entropy": 0.5849340502172709, "epoch": 1.2877959298681434, "grad_norm": 0.15517130494117737, "learning_rate": 5.707670132180207e-05, "loss": 0.5806, "mean_token_accuracy": 0.8197870701551437, "num_tokens": 446761470.0, "step": 13997 }, { "entropy": 0.6507070437073708, "epoch": 1.2878879362395845, "grad_norm": 0.16066132485866547, "learning_rate": 5.7073634495660446e-05, "loss": 0.6289, "mean_token_accuracy": 0.8048723042011261, "num_tokens": 446791687.0, "step": 13998 }, { "entropy": 0.5717760939151049, "epoch": 1.2879799426110259, "grad_norm": 0.1482459306716919, "learning_rate": 5.7070567669518814e-05, "loss": 0.565, "mean_token_accuracy": 0.8260086141526699, "num_tokens": 446823872.0, "step": 13999 }, { "entropy": 0.6567368702962995, "epoch": 1.288071948982467, "grad_norm": 0.15951859951019287, "learning_rate": 5.706750084337719e-05, "loss": 0.6409, "mean_token_accuracy": 0.8066972754895687, "num_tokens": 446855248.0, "step": 14000 }, { "entropy": 0.6097631165757775, "epoch": 1.2881639553539084, "grad_norm": 0.16435714066028595, "learning_rate": 5.706443401723557e-05, "loss": 0.5792, "mean_token_accuracy": 0.8217272758483887, "num_tokens": 446886355.0, "step": 14001 }, { "entropy": 0.6166216898709536, "epoch": 1.2882559617253495, "grad_norm": 0.15488776564598083, "learning_rate": 5.706136719109394e-05, "loss": 0.6157, "mean_token_accuracy": 0.8152743689715862, "num_tokens": 446919044.0, "step": 14002 }, { "entropy": 0.6778901340439916, "epoch": 1.2883479680967906, "grad_norm": 0.15974344313144684, "learning_rate": 5.705830036495231e-05, "loss": 0.6667, "mean_token_accuracy": 0.7955623008310795, "num_tokens": 446950318.0, "step": 14003 }, { "entropy": 0.6221089567989111, "epoch": 1.288439974468232, "grad_norm": 0.15765292942523956, "learning_rate": 5.7055233538810694e-05, "loss": 0.611, "mean_token_accuracy": 0.814859502017498, "num_tokens": 446982602.0, "step": 14004 }, { "entropy": 0.6088612340390682, "epoch": 1.2885319808396731, "grad_norm": 0.153483584523201, "learning_rate": 5.705216671266906e-05, "loss": 0.5917, "mean_token_accuracy": 0.8177281506359577, "num_tokens": 447014716.0, "step": 14005 }, { "entropy": 0.7101770620793104, "epoch": 1.2886239872111145, "grad_norm": 0.16383078694343567, "learning_rate": 5.704909988652744e-05, "loss": 0.6972, "mean_token_accuracy": 0.7875152043998241, "num_tokens": 447047151.0, "step": 14006 }, { "entropy": 0.5544429766014218, "epoch": 1.2887159935825556, "grad_norm": 0.17319828271865845, "learning_rate": 5.7046033060385805e-05, "loss": 0.5378, "mean_token_accuracy": 0.8319817930459976, "num_tokens": 447077931.0, "step": 14007 }, { "entropy": 0.6591421263292432, "epoch": 1.2888079999539968, "grad_norm": 0.1630212813615799, "learning_rate": 5.7042966234244186e-05, "loss": 0.6375, "mean_token_accuracy": 0.8055839389562607, "num_tokens": 447109920.0, "step": 14008 }, { "entropy": 0.46549655171111226, "epoch": 1.288900006325438, "grad_norm": 0.1425088495016098, "learning_rate": 5.703989940810256e-05, "loss": 0.4442, "mean_token_accuracy": 0.8629516586661339, "num_tokens": 447142632.0, "step": 14009 }, { "entropy": 0.6074774116277695, "epoch": 1.2889920126968792, "grad_norm": 0.1634298712015152, "learning_rate": 5.703683258196093e-05, "loss": 0.5904, "mean_token_accuracy": 0.8183351159095764, "num_tokens": 447174937.0, "step": 14010 }, { "entropy": 0.6938739642500877, "epoch": 1.2890840190683206, "grad_norm": 0.16444720327854156, "learning_rate": 5.70337657558193e-05, "loss": 0.702, "mean_token_accuracy": 0.7862946502864361, "num_tokens": 447206995.0, "step": 14011 }, { "entropy": 0.5012623826041818, "epoch": 1.2891760254397617, "grad_norm": 0.14854520559310913, "learning_rate": 5.7030698929677685e-05, "loss": 0.4817, "mean_token_accuracy": 0.8532154522836208, "num_tokens": 447239495.0, "step": 14012 }, { "entropy": 0.634602002799511, "epoch": 1.2892680318112029, "grad_norm": 0.16519108414649963, "learning_rate": 5.702763210353605e-05, "loss": 0.6177, "mean_token_accuracy": 0.8076952733099461, "num_tokens": 447270330.0, "step": 14013 }, { "entropy": 0.6271747406572104, "epoch": 1.2893600381826442, "grad_norm": 0.1542249172925949, "learning_rate": 5.702456527739443e-05, "loss": 0.6199, "mean_token_accuracy": 0.8092962987720966, "num_tokens": 447301917.0, "step": 14014 }, { "entropy": 0.6139727123081684, "epoch": 1.2894520445540854, "grad_norm": 0.17236867547035217, "learning_rate": 5.7021498451252795e-05, "loss": 0.6056, "mean_token_accuracy": 0.8137241639196873, "num_tokens": 447333270.0, "step": 14015 }, { "entropy": 0.6844496484845877, "epoch": 1.2895440509255267, "grad_norm": 0.15690098702907562, "learning_rate": 5.7018431625111177e-05, "loss": 0.6643, "mean_token_accuracy": 0.7956405282020569, "num_tokens": 447364487.0, "step": 14016 }, { "entropy": 0.5106719359755516, "epoch": 1.2896360572969678, "grad_norm": 0.15298789739608765, "learning_rate": 5.701536479896955e-05, "loss": 0.4896, "mean_token_accuracy": 0.8453160785138607, "num_tokens": 447395985.0, "step": 14017 }, { "entropy": 0.7208800902590156, "epoch": 1.289728063668409, "grad_norm": 0.17328022420406342, "learning_rate": 5.701229797282792e-05, "loss": 0.7204, "mean_token_accuracy": 0.7797926664352417, "num_tokens": 447427954.0, "step": 14018 }, { "entropy": 0.5974624836817384, "epoch": 1.2898200700398503, "grad_norm": 0.15796814858913422, "learning_rate": 5.7009231146686294e-05, "loss": 0.595, "mean_token_accuracy": 0.8174579404294491, "num_tokens": 447459256.0, "step": 14019 }, { "entropy": 0.575535804964602, "epoch": 1.2899120764112915, "grad_norm": 0.15470397472381592, "learning_rate": 5.7006164320544675e-05, "loss": 0.5672, "mean_token_accuracy": 0.8226194828748703, "num_tokens": 447491786.0, "step": 14020 }, { "entropy": 0.6230591777712107, "epoch": 1.2900040827827328, "grad_norm": 0.16041213274002075, "learning_rate": 5.700309749440304e-05, "loss": 0.6184, "mean_token_accuracy": 0.8154834359884262, "num_tokens": 447523283.0, "step": 14021 }, { "entropy": 0.6820690631866455, "epoch": 1.290096089154174, "grad_norm": 0.16331136226654053, "learning_rate": 5.700003066826142e-05, "loss": 0.6588, "mean_token_accuracy": 0.7973615862429142, "num_tokens": 447554495.0, "step": 14022 }, { "entropy": 0.616450612898916, "epoch": 1.290188095525615, "grad_norm": 0.15609534084796906, "learning_rate": 5.6996963842119786e-05, "loss": 0.6066, "mean_token_accuracy": 0.8113955482840538, "num_tokens": 447586977.0, "step": 14023 }, { "entropy": 0.6203049449250102, "epoch": 1.2902801018970564, "grad_norm": 0.15814615786075592, "learning_rate": 5.6993897015978174e-05, "loss": 0.6033, "mean_token_accuracy": 0.8109190985560417, "num_tokens": 447618762.0, "step": 14024 }, { "entropy": 0.5562991872429848, "epoch": 1.2903721082684976, "grad_norm": 0.15654614567756653, "learning_rate": 5.699083018983654e-05, "loss": 0.5338, "mean_token_accuracy": 0.8284711390733719, "num_tokens": 447650071.0, "step": 14025 }, { "entropy": 0.6180775202810764, "epoch": 1.290464114639939, "grad_norm": 0.16384531557559967, "learning_rate": 5.698776336369491e-05, "loss": 0.5926, "mean_token_accuracy": 0.8194349743425846, "num_tokens": 447682380.0, "step": 14026 }, { "entropy": 0.6151044275611639, "epoch": 1.29055612101138, "grad_norm": 0.1552550047636032, "learning_rate": 5.6984696537553284e-05, "loss": 0.6084, "mean_token_accuracy": 0.8162878453731537, "num_tokens": 447713656.0, "step": 14027 }, { "entropy": 0.6558500826358795, "epoch": 1.2906481273828212, "grad_norm": 0.1668684184551239, "learning_rate": 5.6981629711411666e-05, "loss": 0.6456, "mean_token_accuracy": 0.8004801832139492, "num_tokens": 447745542.0, "step": 14028 }, { "entropy": 0.5617868755944073, "epoch": 1.2907401337542626, "grad_norm": 0.14994406700134277, "learning_rate": 5.697856288527004e-05, "loss": 0.5592, "mean_token_accuracy": 0.827654343098402, "num_tokens": 447778046.0, "step": 14029 }, { "entropy": 0.6707556173205376, "epoch": 1.2908321401257037, "grad_norm": 0.1630813628435135, "learning_rate": 5.697549605912841e-05, "loss": 0.6699, "mean_token_accuracy": 0.7948749735951424, "num_tokens": 447810036.0, "step": 14030 }, { "entropy": 0.48306333855725825, "epoch": 1.290924146497145, "grad_norm": 0.14897659420967102, "learning_rate": 5.6972429232986776e-05, "loss": 0.4471, "mean_token_accuracy": 0.8607721216976643, "num_tokens": 447841635.0, "step": 14031 }, { "entropy": 0.5812762696295977, "epoch": 1.2910161528685862, "grad_norm": 0.15191856026649475, "learning_rate": 5.6969362406845164e-05, "loss": 0.5791, "mean_token_accuracy": 0.8170327693223953, "num_tokens": 447873984.0, "step": 14032 }, { "entropy": 0.5871564168483019, "epoch": 1.2911081592400273, "grad_norm": 0.15987803041934967, "learning_rate": 5.696629558070353e-05, "loss": 0.5591, "mean_token_accuracy": 0.831376489251852, "num_tokens": 447906139.0, "step": 14033 }, { "entropy": 0.6109083108603954, "epoch": 1.2912001656114687, "grad_norm": 0.15518344938755035, "learning_rate": 5.696322875456191e-05, "loss": 0.5913, "mean_token_accuracy": 0.815921276807785, "num_tokens": 447937886.0, "step": 14034 }, { "entropy": 0.6980117820203304, "epoch": 1.2912921719829098, "grad_norm": 0.1584400236606598, "learning_rate": 5.696016192842029e-05, "loss": 0.6853, "mean_token_accuracy": 0.7895571328699589, "num_tokens": 447969491.0, "step": 14035 }, { "entropy": 0.5791720254346728, "epoch": 1.2913841783543512, "grad_norm": 0.15643109381198883, "learning_rate": 5.6957095102278656e-05, "loss": 0.5842, "mean_token_accuracy": 0.8205494657158852, "num_tokens": 448001986.0, "step": 14036 }, { "entropy": 0.5982432682067156, "epoch": 1.2914761847257923, "grad_norm": 0.1671922504901886, "learning_rate": 5.695402827613703e-05, "loss": 0.5916, "mean_token_accuracy": 0.8189477138221264, "num_tokens": 448033622.0, "step": 14037 }, { "entropy": 0.483365660533309, "epoch": 1.2915681910972334, "grad_norm": 0.14973287284374237, "learning_rate": 5.69509614499954e-05, "loss": 0.4844, "mean_token_accuracy": 0.8528380580246449, "num_tokens": 448065343.0, "step": 14038 }, { "entropy": 0.648288307711482, "epoch": 1.2916601974686748, "grad_norm": 0.15763112902641296, "learning_rate": 5.694789462385378e-05, "loss": 0.6312, "mean_token_accuracy": 0.8097008652985096, "num_tokens": 448097146.0, "step": 14039 }, { "entropy": 0.6848084889352322, "epoch": 1.291752203840116, "grad_norm": 0.17653749883174896, "learning_rate": 5.6944827797712155e-05, "loss": 0.6721, "mean_token_accuracy": 0.7992489002645016, "num_tokens": 448129914.0, "step": 14040 }, { "entropy": 0.7010174747556448, "epoch": 1.2918442102115573, "grad_norm": 0.17343966662883759, "learning_rate": 5.694176097157052e-05, "loss": 0.705, "mean_token_accuracy": 0.788276668637991, "num_tokens": 448161606.0, "step": 14041 }, { "entropy": 0.5856279917061329, "epoch": 1.2919362165829984, "grad_norm": 0.1618364006280899, "learning_rate": 5.69386941454289e-05, "loss": 0.5622, "mean_token_accuracy": 0.826987013220787, "num_tokens": 448193218.0, "step": 14042 }, { "entropy": 0.6633358001708984, "epoch": 1.2920282229544395, "grad_norm": 0.1680656373500824, "learning_rate": 5.693562731928728e-05, "loss": 0.6594, "mean_token_accuracy": 0.800275094807148, "num_tokens": 448225307.0, "step": 14043 }, { "entropy": 0.7006569169461727, "epoch": 1.2921202293258809, "grad_norm": 0.16690264642238617, "learning_rate": 5.6932560493145646e-05, "loss": 0.6997, "mean_token_accuracy": 0.791817918419838, "num_tokens": 448256679.0, "step": 14044 }, { "entropy": 0.6343168709427118, "epoch": 1.292212235697322, "grad_norm": 0.15689215064048767, "learning_rate": 5.692949366700402e-05, "loss": 0.6122, "mean_token_accuracy": 0.8124607615172863, "num_tokens": 448288404.0, "step": 14045 }, { "entropy": 0.629418296739459, "epoch": 1.2923042420687634, "grad_norm": 0.1551646739244461, "learning_rate": 5.692642684086239e-05, "loss": 0.6054, "mean_token_accuracy": 0.8143397942185402, "num_tokens": 448320796.0, "step": 14046 }, { "entropy": 0.6224557785317302, "epoch": 1.2923962484402045, "grad_norm": 0.15654326975345612, "learning_rate": 5.692336001472077e-05, "loss": 0.5935, "mean_token_accuracy": 0.8189258426427841, "num_tokens": 448353087.0, "step": 14047 }, { "entropy": 0.6442159609869123, "epoch": 1.2924882548116456, "grad_norm": 0.15034157037734985, "learning_rate": 5.6920293188579145e-05, "loss": 0.6256, "mean_token_accuracy": 0.8104140311479568, "num_tokens": 448385392.0, "step": 14048 }, { "entropy": 0.572890181094408, "epoch": 1.292580261183087, "grad_norm": 0.15265583992004395, "learning_rate": 5.691722636243751e-05, "loss": 0.5561, "mean_token_accuracy": 0.8227478004992008, "num_tokens": 448416615.0, "step": 14049 }, { "entropy": 0.603379406966269, "epoch": 1.2926722675545281, "grad_norm": 0.1586771309375763, "learning_rate": 5.691415953629589e-05, "loss": 0.5902, "mean_token_accuracy": 0.8209464773535728, "num_tokens": 448449212.0, "step": 14050 }, { "entropy": 0.6499553807079792, "epoch": 1.2927642739259695, "grad_norm": 0.1621023416519165, "learning_rate": 5.691109271015427e-05, "loss": 0.6492, "mean_token_accuracy": 0.804377444088459, "num_tokens": 448480467.0, "step": 14051 }, { "entropy": 0.58765016682446, "epoch": 1.2928562802974106, "grad_norm": 0.15311236679553986, "learning_rate": 5.690802588401264e-05, "loss": 0.5704, "mean_token_accuracy": 0.8245320580899715, "num_tokens": 448512688.0, "step": 14052 }, { "entropy": 0.6433910904452205, "epoch": 1.2929482866688518, "grad_norm": 0.16068534553050995, "learning_rate": 5.690495905787101e-05, "loss": 0.6451, "mean_token_accuracy": 0.8060132712125778, "num_tokens": 448544374.0, "step": 14053 }, { "entropy": 0.6641067024320364, "epoch": 1.293040293040293, "grad_norm": 0.16141332685947418, "learning_rate": 5.690189223172938e-05, "loss": 0.6407, "mean_token_accuracy": 0.8015515245497227, "num_tokens": 448574912.0, "step": 14054 }, { "entropy": 0.6983122956007719, "epoch": 1.2931322994117342, "grad_norm": 0.1654028445482254, "learning_rate": 5.689882540558776e-05, "loss": 0.6811, "mean_token_accuracy": 0.7952557057142258, "num_tokens": 448607082.0, "step": 14055 }, { "entropy": 0.66097541898489, "epoch": 1.2932243057831756, "grad_norm": 0.15693804621696472, "learning_rate": 5.6895758579446135e-05, "loss": 0.6332, "mean_token_accuracy": 0.8027726970613003, "num_tokens": 448638610.0, "step": 14056 }, { "entropy": 0.5819047586992383, "epoch": 1.2933163121546167, "grad_norm": 0.1555127650499344, "learning_rate": 5.68926917533045e-05, "loss": 0.5934, "mean_token_accuracy": 0.815970741212368, "num_tokens": 448670636.0, "step": 14057 }, { "entropy": 0.7229906804859638, "epoch": 1.2934083185260579, "grad_norm": 0.15775753557682037, "learning_rate": 5.688962492716288e-05, "loss": 0.7006, "mean_token_accuracy": 0.7858829163014889, "num_tokens": 448702983.0, "step": 14058 }, { "entropy": 0.6025979295372963, "epoch": 1.2935003248974992, "grad_norm": 0.1608542948961258, "learning_rate": 5.688655810102126e-05, "loss": 0.6028, "mean_token_accuracy": 0.81197689473629, "num_tokens": 448733793.0, "step": 14059 }, { "entropy": 0.7050354108214378, "epoch": 1.2935923312689404, "grad_norm": 0.16754406690597534, "learning_rate": 5.688349127487963e-05, "loss": 0.6911, "mean_token_accuracy": 0.7910335548222065, "num_tokens": 448765375.0, "step": 14060 }, { "entropy": 0.6641436722129583, "epoch": 1.2936843376403817, "grad_norm": 0.16714854538440704, "learning_rate": 5.6880424448738e-05, "loss": 0.6504, "mean_token_accuracy": 0.7977238595485687, "num_tokens": 448796883.0, "step": 14061 }, { "entropy": 0.5575748579576612, "epoch": 1.2937763440118228, "grad_norm": 0.15502220392227173, "learning_rate": 5.687735762259637e-05, "loss": 0.5389, "mean_token_accuracy": 0.8297434635460377, "num_tokens": 448828476.0, "step": 14062 }, { "entropy": 0.6815229672938585, "epoch": 1.293868350383264, "grad_norm": 0.15756450593471527, "learning_rate": 5.687429079645475e-05, "loss": 0.6784, "mean_token_accuracy": 0.7926940768957138, "num_tokens": 448860903.0, "step": 14063 }, { "entropy": 0.6100843865424395, "epoch": 1.2939603567547053, "grad_norm": 0.15559224784374237, "learning_rate": 5.6871223970313126e-05, "loss": 0.5835, "mean_token_accuracy": 0.8218072839081287, "num_tokens": 448893491.0, "step": 14064 }, { "entropy": 0.6189542328938842, "epoch": 1.2940523631261465, "grad_norm": 0.16164349019527435, "learning_rate": 5.6868157144171494e-05, "loss": 0.6045, "mean_token_accuracy": 0.8155557066202164, "num_tokens": 448925186.0, "step": 14065 }, { "entropy": 0.5764297544956207, "epoch": 1.2941443694975878, "grad_norm": 0.1612176150083542, "learning_rate": 5.686509031802988e-05, "loss": 0.5786, "mean_token_accuracy": 0.8266394473612309, "num_tokens": 448956808.0, "step": 14066 }, { "entropy": 0.5941633246839046, "epoch": 1.294236375869029, "grad_norm": 0.16545164585113525, "learning_rate": 5.686202349188825e-05, "loss": 0.5892, "mean_token_accuracy": 0.8185088485479355, "num_tokens": 448989140.0, "step": 14067 }, { "entropy": 0.7234292114153504, "epoch": 1.29432838224047, "grad_norm": 0.16196668148040771, "learning_rate": 5.6858956665746624e-05, "loss": 0.7257, "mean_token_accuracy": 0.7807888649404049, "num_tokens": 449021416.0, "step": 14068 }, { "entropy": 0.580414017662406, "epoch": 1.2944203886119114, "grad_norm": 0.15682506561279297, "learning_rate": 5.685588983960499e-05, "loss": 0.5758, "mean_token_accuracy": 0.8244771026074886, "num_tokens": 449053322.0, "step": 14069 }, { "entropy": 0.5594294304028153, "epoch": 1.2945123949833526, "grad_norm": 0.1596907526254654, "learning_rate": 5.6852823013463374e-05, "loss": 0.5445, "mean_token_accuracy": 0.831557996571064, "num_tokens": 449085830.0, "step": 14070 }, { "entropy": 0.6598297758027911, "epoch": 1.294604401354794, "grad_norm": 0.1586473435163498, "learning_rate": 5.684975618732175e-05, "loss": 0.6463, "mean_token_accuracy": 0.8024885691702366, "num_tokens": 449117877.0, "step": 14071 }, { "entropy": 0.6655331193469465, "epoch": 1.294696407726235, "grad_norm": 0.1641789674758911, "learning_rate": 5.6846689361180116e-05, "loss": 0.67, "mean_token_accuracy": 0.7966321669518948, "num_tokens": 449150397.0, "step": 14072 }, { "entropy": 0.6540958415716887, "epoch": 1.2947884140976762, "grad_norm": 0.1489747166633606, "learning_rate": 5.684362253503849e-05, "loss": 0.6489, "mean_token_accuracy": 0.7993064932525158, "num_tokens": 449182835.0, "step": 14073 }, { "entropy": 0.6711306758224964, "epoch": 1.2948804204691176, "grad_norm": 0.16434425115585327, "learning_rate": 5.684055570889687e-05, "loss": 0.6517, "mean_token_accuracy": 0.7964199595153332, "num_tokens": 449213812.0, "step": 14074 }, { "entropy": 0.6113068498671055, "epoch": 1.2949724268405587, "grad_norm": 0.15490293502807617, "learning_rate": 5.683748888275524e-05, "loss": 0.6003, "mean_token_accuracy": 0.8143842630088329, "num_tokens": 449245881.0, "step": 14075 }, { "entropy": 0.6176041625440121, "epoch": 1.295064433212, "grad_norm": 0.15932367742061615, "learning_rate": 5.6834422056613615e-05, "loss": 0.6212, "mean_token_accuracy": 0.8108608350157738, "num_tokens": 449278277.0, "step": 14076 }, { "entropy": 0.58239037822932, "epoch": 1.2951564395834412, "grad_norm": 0.15765854716300964, "learning_rate": 5.683135523047198e-05, "loss": 0.5618, "mean_token_accuracy": 0.8284293077886105, "num_tokens": 449310197.0, "step": 14077 }, { "entropy": 0.6309778653085232, "epoch": 1.2952484459548823, "grad_norm": 0.15861079096794128, "learning_rate": 5.6828288404330364e-05, "loss": 0.6196, "mean_token_accuracy": 0.8132680729031563, "num_tokens": 449342888.0, "step": 14078 }, { "entropy": 0.6578690055757761, "epoch": 1.2953404523263237, "grad_norm": 0.15994690358638763, "learning_rate": 5.682522157818874e-05, "loss": 0.6535, "mean_token_accuracy": 0.7999934181571007, "num_tokens": 449374437.0, "step": 14079 }, { "entropy": 0.733477808535099, "epoch": 1.2954324586977648, "grad_norm": 0.19178566336631775, "learning_rate": 5.6822154752047107e-05, "loss": 0.7458, "mean_token_accuracy": 0.7764397412538528, "num_tokens": 449407182.0, "step": 14080 }, { "entropy": 0.5661391830071807, "epoch": 1.2955244650692062, "grad_norm": 0.15106570720672607, "learning_rate": 5.681908792590548e-05, "loss": 0.5471, "mean_token_accuracy": 0.8324419930577278, "num_tokens": 449438989.0, "step": 14081 }, { "entropy": 0.6237515266984701, "epoch": 1.2956164714406473, "grad_norm": 0.15613976120948792, "learning_rate": 5.681602109976386e-05, "loss": 0.606, "mean_token_accuracy": 0.8152570277452469, "num_tokens": 449471346.0, "step": 14082 }, { "entropy": 0.7008398193866014, "epoch": 1.2957084778120884, "grad_norm": 0.16127519309520721, "learning_rate": 5.681295427362223e-05, "loss": 0.6839, "mean_token_accuracy": 0.789038673043251, "num_tokens": 449502842.0, "step": 14083 }, { "entropy": 0.7049426632001996, "epoch": 1.2958004841835298, "grad_norm": 0.16008538007736206, "learning_rate": 5.6809887447480605e-05, "loss": 0.7039, "mean_token_accuracy": 0.7893760167062283, "num_tokens": 449535260.0, "step": 14084 }, { "entropy": 0.6113659460097551, "epoch": 1.295892490554971, "grad_norm": 0.15325403213500977, "learning_rate": 5.680682062133897e-05, "loss": 0.5855, "mean_token_accuracy": 0.8176307305693626, "num_tokens": 449567048.0, "step": 14085 }, { "entropy": 0.6074004825204611, "epoch": 1.2959844969264123, "grad_norm": 0.15154927968978882, "learning_rate": 5.6803753795197354e-05, "loss": 0.5989, "mean_token_accuracy": 0.8181116804480553, "num_tokens": 449599237.0, "step": 14086 }, { "entropy": 0.6355305220931768, "epoch": 1.2960765032978534, "grad_norm": 0.15137259662151337, "learning_rate": 5.680068696905573e-05, "loss": 0.6007, "mean_token_accuracy": 0.8158092424273491, "num_tokens": 449631505.0, "step": 14087 }, { "entropy": 0.6404386050999165, "epoch": 1.2961685096692945, "grad_norm": 0.15710531175136566, "learning_rate": 5.67976201429141e-05, "loss": 0.6144, "mean_token_accuracy": 0.8128298744559288, "num_tokens": 449663940.0, "step": 14088 }, { "entropy": 0.6964611783623695, "epoch": 1.2962605160407359, "grad_norm": 0.15619881451129913, "learning_rate": 5.679455331677247e-05, "loss": 0.6821, "mean_token_accuracy": 0.7939391620457172, "num_tokens": 449695639.0, "step": 14089 }, { "entropy": 0.574175201356411, "epoch": 1.296352522412177, "grad_norm": 0.15994830429553986, "learning_rate": 5.679148649063085e-05, "loss": 0.5633, "mean_token_accuracy": 0.827039260417223, "num_tokens": 449727722.0, "step": 14090 }, { "entropy": 0.5828412147238851, "epoch": 1.2964445287836184, "grad_norm": 0.15574584901332855, "learning_rate": 5.678841966448922e-05, "loss": 0.5643, "mean_token_accuracy": 0.8332378752529621, "num_tokens": 449759403.0, "step": 14091 }, { "entropy": 0.6094749793410301, "epoch": 1.2965365351550595, "grad_norm": 0.16095614433288574, "learning_rate": 5.6785352838347596e-05, "loss": 0.6045, "mean_token_accuracy": 0.8162420094013214, "num_tokens": 449791398.0, "step": 14092 }, { "entropy": 0.600488813361153, "epoch": 1.2966285415265006, "grad_norm": 0.1525934636592865, "learning_rate": 5.6782286012205963e-05, "loss": 0.5694, "mean_token_accuracy": 0.8231056444346905, "num_tokens": 449822726.0, "step": 14093 }, { "entropy": 0.6226524170488119, "epoch": 1.296720547897942, "grad_norm": 0.16088783740997314, "learning_rate": 5.6779219186064345e-05, "loss": 0.626, "mean_token_accuracy": 0.8098371624946594, "num_tokens": 449854663.0, "step": 14094 }, { "entropy": 0.6828446816653013, "epoch": 1.2968125542693831, "grad_norm": 0.16849280893802643, "learning_rate": 5.677615235992272e-05, "loss": 0.6687, "mean_token_accuracy": 0.7958424687385559, "num_tokens": 449886251.0, "step": 14095 }, { "entropy": 0.5238605532795191, "epoch": 1.2969045606408245, "grad_norm": 0.14240726828575134, "learning_rate": 5.677308553378109e-05, "loss": 0.5209, "mean_token_accuracy": 0.8399419225752354, "num_tokens": 449918425.0, "step": 14096 }, { "entropy": 0.676772229373455, "epoch": 1.2969965670122656, "grad_norm": 0.1636686623096466, "learning_rate": 5.677001870763947e-05, "loss": 0.6731, "mean_token_accuracy": 0.7952029928565025, "num_tokens": 449950588.0, "step": 14097 }, { "entropy": 0.5867391061037779, "epoch": 1.2970885733837068, "grad_norm": 0.15680089592933655, "learning_rate": 5.6766951881497843e-05, "loss": 0.573, "mean_token_accuracy": 0.8227995485067368, "num_tokens": 449983070.0, "step": 14098 }, { "entropy": 0.6978129968047142, "epoch": 1.297180579755148, "grad_norm": 0.16530677676200867, "learning_rate": 5.676388505535621e-05, "loss": 0.6777, "mean_token_accuracy": 0.7931539006531239, "num_tokens": 450015208.0, "step": 14099 }, { "entropy": 0.6330585516989231, "epoch": 1.2972725861265892, "grad_norm": 0.1622617542743683, "learning_rate": 5.6760818229214586e-05, "loss": 0.6192, "mean_token_accuracy": 0.8104122765362263, "num_tokens": 450047049.0, "step": 14100 }, { "entropy": 0.6621448807418346, "epoch": 1.2973645924980306, "grad_norm": 0.16606557369232178, "learning_rate": 5.675775140307297e-05, "loss": 0.6525, "mean_token_accuracy": 0.7987774759531021, "num_tokens": 450079409.0, "step": 14101 }, { "entropy": 0.6189676988869905, "epoch": 1.2974565988694717, "grad_norm": 0.15570539236068726, "learning_rate": 5.6754684576931335e-05, "loss": 0.6031, "mean_token_accuracy": 0.8122152462601662, "num_tokens": 450111334.0, "step": 14102 }, { "entropy": 0.6781708258204162, "epoch": 1.2975486052409129, "grad_norm": 0.16659598052501678, "learning_rate": 5.675161775078971e-05, "loss": 0.6795, "mean_token_accuracy": 0.7911194451153278, "num_tokens": 450143004.0, "step": 14103 }, { "entropy": 0.659027922898531, "epoch": 1.2976406116123542, "grad_norm": 0.1581011563539505, "learning_rate": 5.674855092464808e-05, "loss": 0.6456, "mean_token_accuracy": 0.8069794699549675, "num_tokens": 450175500.0, "step": 14104 }, { "entropy": 0.6713562868535519, "epoch": 1.2977326179837954, "grad_norm": 0.15810315310955048, "learning_rate": 5.6745484098506466e-05, "loss": 0.6605, "mean_token_accuracy": 0.8020285293459892, "num_tokens": 450207836.0, "step": 14105 }, { "entropy": 0.6716575790196657, "epoch": 1.2978246243552367, "grad_norm": 0.16797763109207153, "learning_rate": 5.6742417272364834e-05, "loss": 0.6473, "mean_token_accuracy": 0.8068930320441723, "num_tokens": 450239547.0, "step": 14106 }, { "entropy": 0.5737167121842504, "epoch": 1.2979166307266778, "grad_norm": 0.16067688167095184, "learning_rate": 5.67393504462232e-05, "loss": 0.5597, "mean_token_accuracy": 0.8258233927190304, "num_tokens": 450272072.0, "step": 14107 }, { "entropy": 0.6685552410781384, "epoch": 1.298008637098119, "grad_norm": 0.16255401074886322, "learning_rate": 5.6736283620081576e-05, "loss": 0.6449, "mean_token_accuracy": 0.8020008206367493, "num_tokens": 450303660.0, "step": 14108 }, { "entropy": 0.5917443912476301, "epoch": 1.2981006434695603, "grad_norm": 0.15930522978305817, "learning_rate": 5.673321679393996e-05, "loss": 0.5885, "mean_token_accuracy": 0.8170139044523239, "num_tokens": 450336199.0, "step": 14109 }, { "entropy": 0.7293838681653142, "epoch": 1.2981926498410015, "grad_norm": 0.16745179891586304, "learning_rate": 5.673014996779833e-05, "loss": 0.729, "mean_token_accuracy": 0.7815571911633015, "num_tokens": 450368327.0, "step": 14110 }, { "entropy": 0.5730354432016611, "epoch": 1.2982846562124428, "grad_norm": 0.155316561460495, "learning_rate": 5.67270831416567e-05, "loss": 0.5699, "mean_token_accuracy": 0.8260693028569221, "num_tokens": 450400390.0, "step": 14111 }, { "entropy": 0.6720197256654501, "epoch": 1.298376662583884, "grad_norm": 0.16194011270999908, "learning_rate": 5.6724016315515075e-05, "loss": 0.6681, "mean_token_accuracy": 0.7965727970004082, "num_tokens": 450432021.0, "step": 14112 }, { "entropy": 0.7417417764663696, "epoch": 1.298468668955325, "grad_norm": 0.1648610234260559, "learning_rate": 5.6720949489373456e-05, "loss": 0.7196, "mean_token_accuracy": 0.7855866998434067, "num_tokens": 450463736.0, "step": 14113 }, { "entropy": 0.6305225305259228, "epoch": 1.2985606753267664, "grad_norm": 0.1588418334722519, "learning_rate": 5.6717882663231824e-05, "loss": 0.6153, "mean_token_accuracy": 0.8079644553363323, "num_tokens": 450495277.0, "step": 14114 }, { "entropy": 0.5484697264619172, "epoch": 1.2986526816982076, "grad_norm": 0.14936192333698273, "learning_rate": 5.67148158370902e-05, "loss": 0.5272, "mean_token_accuracy": 0.8376250825822353, "num_tokens": 450527801.0, "step": 14115 }, { "entropy": 0.641801668331027, "epoch": 1.298744688069649, "grad_norm": 0.16357947885990143, "learning_rate": 5.671174901094857e-05, "loss": 0.63, "mean_token_accuracy": 0.8099037297070026, "num_tokens": 450559922.0, "step": 14116 }, { "entropy": 0.6723351655527949, "epoch": 1.29883669444109, "grad_norm": 0.16038425266742706, "learning_rate": 5.670868218480695e-05, "loss": 0.6502, "mean_token_accuracy": 0.802112452685833, "num_tokens": 450591023.0, "step": 14117 }, { "entropy": 0.6279600095003843, "epoch": 1.2989287008125312, "grad_norm": 0.16330771148204803, "learning_rate": 5.670561535866532e-05, "loss": 0.6174, "mean_token_accuracy": 0.8126541115343571, "num_tokens": 450623505.0, "step": 14118 }, { "entropy": 0.6868522260338068, "epoch": 1.2990207071839726, "grad_norm": 0.16103965044021606, "learning_rate": 5.670254853252369e-05, "loss": 0.6703, "mean_token_accuracy": 0.7960306294262409, "num_tokens": 450656265.0, "step": 14119 }, { "entropy": 0.6725050881505013, "epoch": 1.2991127135554137, "grad_norm": 0.16584442555904388, "learning_rate": 5.6699481706382065e-05, "loss": 0.6656, "mean_token_accuracy": 0.8000534810125828, "num_tokens": 450687463.0, "step": 14120 }, { "entropy": 0.6818377617746592, "epoch": 1.299204719926855, "grad_norm": 0.16263628005981445, "learning_rate": 5.669641488024045e-05, "loss": 0.6839, "mean_token_accuracy": 0.7929953783750534, "num_tokens": 450719488.0, "step": 14121 }, { "entropy": 0.6108419522643089, "epoch": 1.2992967262982962, "grad_norm": 0.1586856245994568, "learning_rate": 5.6693348054098815e-05, "loss": 0.6023, "mean_token_accuracy": 0.8143168538808823, "num_tokens": 450751166.0, "step": 14122 }, { "entropy": 0.5699164802208543, "epoch": 1.2993887326697373, "grad_norm": 0.16610506176948547, "learning_rate": 5.669028122795719e-05, "loss": 0.534, "mean_token_accuracy": 0.834653202444315, "num_tokens": 450782498.0, "step": 14123 }, { "entropy": 0.6021362021565437, "epoch": 1.2994807390411787, "grad_norm": 0.16147759556770325, "learning_rate": 5.668721440181557e-05, "loss": 0.5999, "mean_token_accuracy": 0.8167499341070652, "num_tokens": 450814484.0, "step": 14124 }, { "entropy": 0.5805344320833683, "epoch": 1.2995727454126198, "grad_norm": 0.15124104917049408, "learning_rate": 5.668414757567394e-05, "loss": 0.5677, "mean_token_accuracy": 0.8223090544342995, "num_tokens": 450846274.0, "step": 14125 }, { "entropy": 0.7293174769729376, "epoch": 1.2996647517840612, "grad_norm": 0.18005427718162537, "learning_rate": 5.668108074953231e-05, "loss": 0.7267, "mean_token_accuracy": 0.7782646641135216, "num_tokens": 450878120.0, "step": 14126 }, { "entropy": 0.5889028385281563, "epoch": 1.2997567581555023, "grad_norm": 0.15055055916309357, "learning_rate": 5.667801392339068e-05, "loss": 0.5816, "mean_token_accuracy": 0.8196426630020142, "num_tokens": 450910726.0, "step": 14127 }, { "entropy": 0.5845724176615477, "epoch": 1.2998487645269434, "grad_norm": 0.16501590609550476, "learning_rate": 5.667494709724906e-05, "loss": 0.5795, "mean_token_accuracy": 0.8225745260715485, "num_tokens": 450943135.0, "step": 14128 }, { "entropy": 0.6190129807218909, "epoch": 1.2999407708983848, "grad_norm": 0.1634722352027893, "learning_rate": 5.667188027110744e-05, "loss": 0.614, "mean_token_accuracy": 0.8141670152544975, "num_tokens": 450975269.0, "step": 14129 }, { "entropy": 0.6195561047643423, "epoch": 1.300032777269826, "grad_norm": 0.15705546736717224, "learning_rate": 5.6668813444965805e-05, "loss": 0.6168, "mean_token_accuracy": 0.8083833828568459, "num_tokens": 451006849.0, "step": 14130 }, { "entropy": 0.6725555267184973, "epoch": 1.3001247836412673, "grad_norm": 0.15332017838954926, "learning_rate": 5.666574661882418e-05, "loss": 0.6531, "mean_token_accuracy": 0.8008037358522415, "num_tokens": 451039201.0, "step": 14131 }, { "entropy": 0.6937914062291384, "epoch": 1.3002167900127084, "grad_norm": 0.16039317846298218, "learning_rate": 5.666267979268256e-05, "loss": 0.6819, "mean_token_accuracy": 0.7947497516870499, "num_tokens": 451071184.0, "step": 14132 }, { "entropy": 0.4841713053174317, "epoch": 1.3003087963841495, "grad_norm": 0.1450086534023285, "learning_rate": 5.665961296654093e-05, "loss": 0.4629, "mean_token_accuracy": 0.8559462837874889, "num_tokens": 451103423.0, "step": 14133 }, { "entropy": 0.5883592739701271, "epoch": 1.300400802755591, "grad_norm": 0.15572218596935272, "learning_rate": 5.6656546140399304e-05, "loss": 0.5705, "mean_token_accuracy": 0.823624424636364, "num_tokens": 451135439.0, "step": 14134 }, { "entropy": 0.628103194758296, "epoch": 1.300492809127032, "grad_norm": 0.16705146431922913, "learning_rate": 5.665347931425767e-05, "loss": 0.6127, "mean_token_accuracy": 0.8115005381405354, "num_tokens": 451166699.0, "step": 14135 }, { "entropy": 0.7239241283386946, "epoch": 1.3005848154984734, "grad_norm": 0.16525070369243622, "learning_rate": 5.665041248811605e-05, "loss": 0.708, "mean_token_accuracy": 0.782979927957058, "num_tokens": 451198831.0, "step": 14136 }, { "entropy": 0.7000889088958502, "epoch": 1.3006768218699145, "grad_norm": 0.1653728187084198, "learning_rate": 5.664734566197443e-05, "loss": 0.6931, "mean_token_accuracy": 0.7938465178012848, "num_tokens": 451231058.0, "step": 14137 }, { "entropy": 0.662241006270051, "epoch": 1.3007688282413556, "grad_norm": 0.16048675775527954, "learning_rate": 5.6644278835832796e-05, "loss": 0.6538, "mean_token_accuracy": 0.7962746843695641, "num_tokens": 451262175.0, "step": 14138 }, { "entropy": 0.58027508482337, "epoch": 1.300860834612797, "grad_norm": 0.15989738702774048, "learning_rate": 5.664121200969117e-05, "loss": 0.5587, "mean_token_accuracy": 0.8284625671803951, "num_tokens": 451293795.0, "step": 14139 }, { "entropy": 0.5825416035950184, "epoch": 1.3009528409842381, "grad_norm": 0.1585339456796646, "learning_rate": 5.663814518354955e-05, "loss": 0.5705, "mean_token_accuracy": 0.8245270885527134, "num_tokens": 451326194.0, "step": 14140 }, { "entropy": 0.5627476722002029, "epoch": 1.3010448473556795, "grad_norm": 0.14990749955177307, "learning_rate": 5.663507835740792e-05, "loss": 0.5353, "mean_token_accuracy": 0.8329578451812267, "num_tokens": 451358019.0, "step": 14141 }, { "entropy": 0.5887848027050495, "epoch": 1.3011368537271206, "grad_norm": 0.16474469006061554, "learning_rate": 5.6632011531266294e-05, "loss": 0.5881, "mean_token_accuracy": 0.8211576081812382, "num_tokens": 451389606.0, "step": 14142 }, { "entropy": 0.6833654511719942, "epoch": 1.3012288600985618, "grad_norm": 0.16149884462356567, "learning_rate": 5.662894470512466e-05, "loss": 0.6626, "mean_token_accuracy": 0.7976226881146431, "num_tokens": 451421262.0, "step": 14143 }, { "entropy": 0.7029880797490478, "epoch": 1.3013208664700031, "grad_norm": 0.16169105470180511, "learning_rate": 5.662587787898305e-05, "loss": 0.7002, "mean_token_accuracy": 0.7868851833045483, "num_tokens": 451452947.0, "step": 14144 }, { "entropy": 0.5861524529755116, "epoch": 1.3014128728414442, "grad_norm": 0.15630562603473663, "learning_rate": 5.662281105284142e-05, "loss": 0.5642, "mean_token_accuracy": 0.8214069828391075, "num_tokens": 451484450.0, "step": 14145 }, { "entropy": 0.6532900333404541, "epoch": 1.3015048792128856, "grad_norm": 0.16896098852157593, "learning_rate": 5.6619744226699786e-05, "loss": 0.6483, "mean_token_accuracy": 0.8023543134331703, "num_tokens": 451515614.0, "step": 14146 }, { "entropy": 0.703533586114645, "epoch": 1.3015968855843267, "grad_norm": 0.1670503169298172, "learning_rate": 5.661667740055816e-05, "loss": 0.6912, "mean_token_accuracy": 0.7870315387845039, "num_tokens": 451546600.0, "step": 14147 }, { "entropy": 0.6408507861196995, "epoch": 1.3016888919557679, "grad_norm": 0.16626548767089844, "learning_rate": 5.661361057441654e-05, "loss": 0.6293, "mean_token_accuracy": 0.8080746792256832, "num_tokens": 451577869.0, "step": 14148 }, { "entropy": 0.6209717988967896, "epoch": 1.3017808983272092, "grad_norm": 0.1574353575706482, "learning_rate": 5.661054374827492e-05, "loss": 0.6215, "mean_token_accuracy": 0.8100657239556313, "num_tokens": 451610276.0, "step": 14149 }, { "entropy": 0.6610043877735734, "epoch": 1.3018729046986504, "grad_norm": 0.16134098172187805, "learning_rate": 5.6607476922133284e-05, "loss": 0.6579, "mean_token_accuracy": 0.8043201267719269, "num_tokens": 451642728.0, "step": 14150 }, { "entropy": 0.5013809725642204, "epoch": 1.3019649110700917, "grad_norm": 0.14321854710578918, "learning_rate": 5.660441009599165e-05, "loss": 0.4858, "mean_token_accuracy": 0.8481438532471657, "num_tokens": 451674135.0, "step": 14151 }, { "entropy": 0.6978876329958439, "epoch": 1.3020569174415328, "grad_norm": 0.15780675411224365, "learning_rate": 5.660134326985004e-05, "loss": 0.6965, "mean_token_accuracy": 0.789735559374094, "num_tokens": 451706469.0, "step": 14152 }, { "entropy": 0.6831526942551136, "epoch": 1.302148923812974, "grad_norm": 0.16468673944473267, "learning_rate": 5.659827644370841e-05, "loss": 0.6774, "mean_token_accuracy": 0.7946798838675022, "num_tokens": 451738080.0, "step": 14153 }, { "entropy": 0.6212801923975348, "epoch": 1.3022409301844153, "grad_norm": 0.1628989279270172, "learning_rate": 5.659520961756678e-05, "loss": 0.6101, "mean_token_accuracy": 0.8164263516664505, "num_tokens": 451770226.0, "step": 14154 }, { "entropy": 0.5694291898980737, "epoch": 1.3023329365558565, "grad_norm": 0.1523875892162323, "learning_rate": 5.6592142791425165e-05, "loss": 0.5481, "mean_token_accuracy": 0.8275193721055984, "num_tokens": 451801100.0, "step": 14155 }, { "entropy": 0.535117874853313, "epoch": 1.3024249429272978, "grad_norm": 0.15155485272407532, "learning_rate": 5.658907596528353e-05, "loss": 0.5119, "mean_token_accuracy": 0.8407567515969276, "num_tokens": 451832452.0, "step": 14156 }, { "entropy": 0.556527242064476, "epoch": 1.302516949298739, "grad_norm": 0.1486176699399948, "learning_rate": 5.658600913914191e-05, "loss": 0.5438, "mean_token_accuracy": 0.8327492251992226, "num_tokens": 451864825.0, "step": 14157 }, { "entropy": 0.6735260314308107, "epoch": 1.30260895567018, "grad_norm": 0.16119442880153656, "learning_rate": 5.6582942313000275e-05, "loss": 0.647, "mean_token_accuracy": 0.8037379197776318, "num_tokens": 451896978.0, "step": 14158 }, { "entropy": 0.6420170795172453, "epoch": 1.3027009620416214, "grad_norm": 0.15974125266075134, "learning_rate": 5.6579875486858656e-05, "loss": 0.6274, "mean_token_accuracy": 0.8098234608769417, "num_tokens": 451928311.0, "step": 14159 }, { "entropy": 0.6258079884573817, "epoch": 1.3027929684130626, "grad_norm": 0.16415266692638397, "learning_rate": 5.657680866071703e-05, "loss": 0.6048, "mean_token_accuracy": 0.8154684454202652, "num_tokens": 451960530.0, "step": 14160 }, { "entropy": 0.6628070212900639, "epoch": 1.302884974784504, "grad_norm": 0.16879737377166748, "learning_rate": 5.65737418345754e-05, "loss": 0.6502, "mean_token_accuracy": 0.8006644174456596, "num_tokens": 451992444.0, "step": 14161 }, { "entropy": 0.6556344516575336, "epoch": 1.302976981155945, "grad_norm": 0.15669044852256775, "learning_rate": 5.6570675008433773e-05, "loss": 0.6457, "mean_token_accuracy": 0.8016831651329994, "num_tokens": 452024728.0, "step": 14162 }, { "entropy": 0.6253615943714976, "epoch": 1.3030689875273862, "grad_norm": 0.15464112162590027, "learning_rate": 5.6567608182292155e-05, "loss": 0.6127, "mean_token_accuracy": 0.808548666536808, "num_tokens": 452056913.0, "step": 14163 }, { "entropy": 0.5492186211049557, "epoch": 1.3031609938988276, "grad_norm": 0.14868983626365662, "learning_rate": 5.656454135615052e-05, "loss": 0.5416, "mean_token_accuracy": 0.830946259200573, "num_tokens": 452089462.0, "step": 14164 }, { "entropy": 0.677087876945734, "epoch": 1.3032530002702687, "grad_norm": 0.16725902259349823, "learning_rate": 5.65614745300089e-05, "loss": 0.6848, "mean_token_accuracy": 0.7908815704286098, "num_tokens": 452120910.0, "step": 14165 }, { "entropy": 0.7726412490010262, "epoch": 1.30334500664171, "grad_norm": 0.17075291275978088, "learning_rate": 5.6558407703867265e-05, "loss": 0.7895, "mean_token_accuracy": 0.7665707282721996, "num_tokens": 452152948.0, "step": 14166 }, { "entropy": 0.6857729209586978, "epoch": 1.3034370130131512, "grad_norm": 0.17010173201560974, "learning_rate": 5.655534087772565e-05, "loss": 0.6743, "mean_token_accuracy": 0.7998028956353664, "num_tokens": 452184876.0, "step": 14167 }, { "entropy": 0.4678496830165386, "epoch": 1.3035290193845923, "grad_norm": 0.14278192818164825, "learning_rate": 5.655227405158402e-05, "loss": 0.4366, "mean_token_accuracy": 0.8602608889341354, "num_tokens": 452216917.0, "step": 14168 }, { "entropy": 0.6749248839914799, "epoch": 1.3036210257560337, "grad_norm": 0.15994229912757874, "learning_rate": 5.654920722544239e-05, "loss": 0.6532, "mean_token_accuracy": 0.7989485077559948, "num_tokens": 452249105.0, "step": 14169 }, { "entropy": 0.5747872367501259, "epoch": 1.3037130321274748, "grad_norm": 0.15526999533176422, "learning_rate": 5.6546140399300764e-05, "loss": 0.5781, "mean_token_accuracy": 0.8233098089694977, "num_tokens": 452280521.0, "step": 14170 }, { "entropy": 0.565888368524611, "epoch": 1.3038050384989162, "grad_norm": 0.15456268191337585, "learning_rate": 5.6543073573159145e-05, "loss": 0.5531, "mean_token_accuracy": 0.8268180415034294, "num_tokens": 452311798.0, "step": 14171 }, { "entropy": 0.4669596664607525, "epoch": 1.3038970448703573, "grad_norm": 0.16009590029716492, "learning_rate": 5.654000674701751e-05, "loss": 0.4667, "mean_token_accuracy": 0.8587457202374935, "num_tokens": 452343878.0, "step": 14172 }, { "entropy": 0.6124655399471521, "epoch": 1.3039890512417984, "grad_norm": 0.16571716964244843, "learning_rate": 5.653693992087589e-05, "loss": 0.6018, "mean_token_accuracy": 0.8165828734636307, "num_tokens": 452375363.0, "step": 14173 }, { "entropy": 0.5967504503205419, "epoch": 1.3040810576132398, "grad_norm": 0.15122421085834503, "learning_rate": 5.6533873094734256e-05, "loss": 0.5811, "mean_token_accuracy": 0.8210471943020821, "num_tokens": 452407711.0, "step": 14174 }, { "entropy": 0.6720668263733387, "epoch": 1.304173063984681, "grad_norm": 0.16511985659599304, "learning_rate": 5.653080626859264e-05, "loss": 0.6699, "mean_token_accuracy": 0.7966867685317993, "num_tokens": 452439787.0, "step": 14175 }, { "entropy": 0.6509403977543116, "epoch": 1.3042650703561223, "grad_norm": 0.15977199375629425, "learning_rate": 5.652773944245101e-05, "loss": 0.6402, "mean_token_accuracy": 0.8022051118314266, "num_tokens": 452471371.0, "step": 14176 }, { "entropy": 0.5676786676049232, "epoch": 1.3043570767275634, "grad_norm": 0.1637677103281021, "learning_rate": 5.652467261630938e-05, "loss": 0.5639, "mean_token_accuracy": 0.8293512277305126, "num_tokens": 452503606.0, "step": 14177 }, { "entropy": 0.6532020596787333, "epoch": 1.3044490830990045, "grad_norm": 0.1557745337486267, "learning_rate": 5.6521605790167754e-05, "loss": 0.6195, "mean_token_accuracy": 0.8130415193736553, "num_tokens": 452535240.0, "step": 14178 }, { "entropy": 0.6321513261646032, "epoch": 1.304541089470446, "grad_norm": 0.1710381954908371, "learning_rate": 5.6518538964026136e-05, "loss": 0.6159, "mean_token_accuracy": 0.8137585073709488, "num_tokens": 452566608.0, "step": 14179 }, { "entropy": 0.5560627086088061, "epoch": 1.304633095841887, "grad_norm": 0.14683350920677185, "learning_rate": 5.6515472137884504e-05, "loss": 0.5439, "mean_token_accuracy": 0.8331592530012131, "num_tokens": 452598751.0, "step": 14180 }, { "entropy": 0.7503755344077945, "epoch": 1.3047251022133284, "grad_norm": 0.16914047300815582, "learning_rate": 5.651240531174288e-05, "loss": 0.7352, "mean_token_accuracy": 0.7783846110105515, "num_tokens": 452630563.0, "step": 14181 }, { "entropy": 0.5051311310380697, "epoch": 1.3048171085847695, "grad_norm": 0.1503400355577469, "learning_rate": 5.6509338485601246e-05, "loss": 0.472, "mean_token_accuracy": 0.8501496985554695, "num_tokens": 452661418.0, "step": 14182 }, { "entropy": 0.5661604646593332, "epoch": 1.3049091149562106, "grad_norm": 0.15560080111026764, "learning_rate": 5.650627165945963e-05, "loss": 0.5553, "mean_token_accuracy": 0.8306216262280941, "num_tokens": 452693772.0, "step": 14183 }, { "entropy": 0.5544636640697718, "epoch": 1.305001121327652, "grad_norm": 0.14958856999874115, "learning_rate": 5.6503204833318e-05, "loss": 0.5396, "mean_token_accuracy": 0.8322720639407635, "num_tokens": 452725522.0, "step": 14184 }, { "entropy": 0.6422067107632756, "epoch": 1.3050931276990931, "grad_norm": 0.15473192930221558, "learning_rate": 5.650013800717637e-05, "loss": 0.6322, "mean_token_accuracy": 0.8074900470674038, "num_tokens": 452758157.0, "step": 14185 }, { "entropy": 0.6548685748130083, "epoch": 1.3051851340705345, "grad_norm": 0.1675262451171875, "learning_rate": 5.649707118103476e-05, "loss": 0.6541, "mean_token_accuracy": 0.804037194699049, "num_tokens": 452789536.0, "step": 14186 }, { "entropy": 0.5317169614136219, "epoch": 1.3052771404419756, "grad_norm": 0.14818090200424194, "learning_rate": 5.6494004354893126e-05, "loss": 0.5213, "mean_token_accuracy": 0.8370732069015503, "num_tokens": 452821891.0, "step": 14187 }, { "entropy": 0.7075565438717604, "epoch": 1.3053691468134168, "grad_norm": 0.163914754986763, "learning_rate": 5.64909375287515e-05, "loss": 0.7142, "mean_token_accuracy": 0.7839655764400959, "num_tokens": 452853856.0, "step": 14188 }, { "entropy": 0.46147291315719485, "epoch": 1.3054611531848581, "grad_norm": 0.14618393778800964, "learning_rate": 5.648787070260987e-05, "loss": 0.4522, "mean_token_accuracy": 0.8595870807766914, "num_tokens": 452886341.0, "step": 14189 }, { "entropy": 0.5367695484310389, "epoch": 1.3055531595562992, "grad_norm": 0.14136357605457306, "learning_rate": 5.648480387646825e-05, "loss": 0.5237, "mean_token_accuracy": 0.8377616107463837, "num_tokens": 452918968.0, "step": 14190 }, { "entropy": 0.617236795835197, "epoch": 1.3056451659277406, "grad_norm": 0.15540499985218048, "learning_rate": 5.6481737050326625e-05, "loss": 0.6077, "mean_token_accuracy": 0.8134312480688095, "num_tokens": 452950632.0, "step": 14191 }, { "entropy": 0.6690814457833767, "epoch": 1.3057371722991817, "grad_norm": 0.16012518107891083, "learning_rate": 5.647867022418499e-05, "loss": 0.6528, "mean_token_accuracy": 0.7955675236880779, "num_tokens": 452983048.0, "step": 14192 }, { "entropy": 0.6013571713119745, "epoch": 1.3058291786706229, "grad_norm": 0.15393255650997162, "learning_rate": 5.647560339804337e-05, "loss": 0.5955, "mean_token_accuracy": 0.81996975466609, "num_tokens": 453015483.0, "step": 14193 }, { "entropy": 0.5652347011491656, "epoch": 1.3059211850420642, "grad_norm": 0.1506577879190445, "learning_rate": 5.647253657190175e-05, "loss": 0.5581, "mean_token_accuracy": 0.8268205374479294, "num_tokens": 453047911.0, "step": 14194 }, { "entropy": 0.642705611884594, "epoch": 1.3060131914135054, "grad_norm": 0.15598973631858826, "learning_rate": 5.6469469745760117e-05, "loss": 0.6299, "mean_token_accuracy": 0.8049218915402889, "num_tokens": 453079297.0, "step": 14195 }, { "entropy": 0.5964294285513461, "epoch": 1.3061051977849467, "grad_norm": 0.155684694647789, "learning_rate": 5.646640291961849e-05, "loss": 0.5912, "mean_token_accuracy": 0.8193826377391815, "num_tokens": 453109882.0, "step": 14196 }, { "entropy": 0.6459777420386672, "epoch": 1.3061972041563878, "grad_norm": 0.15923330187797546, "learning_rate": 5.646333609347686e-05, "loss": 0.6447, "mean_token_accuracy": 0.8020971976220608, "num_tokens": 453141863.0, "step": 14197 }, { "entropy": 0.6359434500336647, "epoch": 1.306289210527829, "grad_norm": 0.16064627468585968, "learning_rate": 5.646026926733524e-05, "loss": 0.6305, "mean_token_accuracy": 0.8068743757903576, "num_tokens": 453173976.0, "step": 14198 }, { "entropy": 0.6606067195534706, "epoch": 1.3063812168992703, "grad_norm": 0.16578233242034912, "learning_rate": 5.6457202441193615e-05, "loss": 0.648, "mean_token_accuracy": 0.7973568327724934, "num_tokens": 453206290.0, "step": 14199 }, { "entropy": 0.6388007197529078, "epoch": 1.3064732232707115, "grad_norm": 0.15871314704418182, "learning_rate": 5.645413561505198e-05, "loss": 0.6423, "mean_token_accuracy": 0.8056211732327938, "num_tokens": 453238793.0, "step": 14200 }, { "entropy": 0.6534602884203196, "epoch": 1.3065652296421528, "grad_norm": 0.17106540501117706, "learning_rate": 5.645106878891036e-05, "loss": 0.639, "mean_token_accuracy": 0.8036491572856903, "num_tokens": 453269641.0, "step": 14201 }, { "entropy": 0.5789098292589188, "epoch": 1.306657236013594, "grad_norm": 0.15193891525268555, "learning_rate": 5.644800196276874e-05, "loss": 0.5654, "mean_token_accuracy": 0.8238321207463741, "num_tokens": 453301523.0, "step": 14202 }, { "entropy": 0.5703686121851206, "epoch": 1.306749242385035, "grad_norm": 0.16647589206695557, "learning_rate": 5.644493513662711e-05, "loss": 0.5627, "mean_token_accuracy": 0.8304155170917511, "num_tokens": 453332993.0, "step": 14203 }, { "entropy": 0.4248194666579366, "epoch": 1.3068412487564764, "grad_norm": 0.14863815903663635, "learning_rate": 5.644186831048548e-05, "loss": 0.4123, "mean_token_accuracy": 0.870030052959919, "num_tokens": 453364774.0, "step": 14204 }, { "entropy": 0.574378527700901, "epoch": 1.3069332551279176, "grad_norm": 0.1536719799041748, "learning_rate": 5.643880148434385e-05, "loss": 0.5619, "mean_token_accuracy": 0.8240927532315254, "num_tokens": 453397426.0, "step": 14205 }, { "entropy": 0.7497223988175392, "epoch": 1.307025261499359, "grad_norm": 0.1734118014574051, "learning_rate": 5.643573465820223e-05, "loss": 0.7507, "mean_token_accuracy": 0.7759820595383644, "num_tokens": 453429509.0, "step": 14206 }, { "entropy": 0.7639605402946472, "epoch": 1.3071172678708, "grad_norm": 0.16609257459640503, "learning_rate": 5.6432667832060606e-05, "loss": 0.7435, "mean_token_accuracy": 0.7773479335010052, "num_tokens": 453461393.0, "step": 14207 }, { "entropy": 0.6672632470726967, "epoch": 1.3072092742422412, "grad_norm": 0.16230686008930206, "learning_rate": 5.6429601005918973e-05, "loss": 0.6619, "mean_token_accuracy": 0.7997845336794853, "num_tokens": 453493977.0, "step": 14208 }, { "entropy": 0.5912244226783514, "epoch": 1.3073012806136826, "grad_norm": 0.1539868861436844, "learning_rate": 5.642653417977735e-05, "loss": 0.5748, "mean_token_accuracy": 0.8211885541677475, "num_tokens": 453525420.0, "step": 14209 }, { "entropy": 0.5713470987975597, "epoch": 1.3073932869851237, "grad_norm": 0.15395788848400116, "learning_rate": 5.642346735363573e-05, "loss": 0.549, "mean_token_accuracy": 0.8303076960146427, "num_tokens": 453557056.0, "step": 14210 }, { "entropy": 0.6017084661871195, "epoch": 1.307485293356565, "grad_norm": 0.1545892357826233, "learning_rate": 5.64204005274941e-05, "loss": 0.5885, "mean_token_accuracy": 0.8188052400946617, "num_tokens": 453588504.0, "step": 14211 }, { "entropy": 0.5432381951250136, "epoch": 1.3075772997280062, "grad_norm": 0.15406270325183868, "learning_rate": 5.641733370135247e-05, "loss": 0.5274, "mean_token_accuracy": 0.836008582264185, "num_tokens": 453620389.0, "step": 14212 }, { "entropy": 0.688975665718317, "epoch": 1.3076693060994473, "grad_norm": 0.16378186643123627, "learning_rate": 5.641426687521084e-05, "loss": 0.6809, "mean_token_accuracy": 0.7963170371949673, "num_tokens": 453652633.0, "step": 14213 }, { "entropy": 0.6382385157048702, "epoch": 1.3077613124708887, "grad_norm": 0.15718354284763336, "learning_rate": 5.641120004906922e-05, "loss": 0.625, "mean_token_accuracy": 0.8086726553738117, "num_tokens": 453684451.0, "step": 14214 }, { "entropy": 0.5251387730240822, "epoch": 1.3078533188423298, "grad_norm": 0.164112851023674, "learning_rate": 5.6408133222927596e-05, "loss": 0.5175, "mean_token_accuracy": 0.8395457230508327, "num_tokens": 453716158.0, "step": 14215 }, { "entropy": 0.6618406779598445, "epoch": 1.3079453252137712, "grad_norm": 0.15705345571041107, "learning_rate": 5.6405066396785964e-05, "loss": 0.6345, "mean_token_accuracy": 0.8060081675648689, "num_tokens": 453748284.0, "step": 14216 }, { "entropy": 0.628295049071312, "epoch": 1.3080373315852123, "grad_norm": 0.1562836468219757, "learning_rate": 5.6401999570644345e-05, "loss": 0.6196, "mean_token_accuracy": 0.8102926760911942, "num_tokens": 453780074.0, "step": 14217 }, { "entropy": 0.6792711541056633, "epoch": 1.3081293379566534, "grad_norm": 0.15783335268497467, "learning_rate": 5.639893274450272e-05, "loss": 0.6653, "mean_token_accuracy": 0.796589408069849, "num_tokens": 453811801.0, "step": 14218 }, { "entropy": 0.8093993719667196, "epoch": 1.3082213443280948, "grad_norm": 0.1723400056362152, "learning_rate": 5.639586591836109e-05, "loss": 0.8167, "mean_token_accuracy": 0.7546344734728336, "num_tokens": 453844064.0, "step": 14219 }, { "entropy": 0.6650958508253098, "epoch": 1.308313350699536, "grad_norm": 0.1567000150680542, "learning_rate": 5.639279909221946e-05, "loss": 0.6542, "mean_token_accuracy": 0.8011481836438179, "num_tokens": 453875418.0, "step": 14220 }, { "entropy": 0.5923005044460297, "epoch": 1.3084053570709773, "grad_norm": 0.15913188457489014, "learning_rate": 5.6389732266077844e-05, "loss": 0.5873, "mean_token_accuracy": 0.8186895586550236, "num_tokens": 453907154.0, "step": 14221 }, { "entropy": 0.5857669822871685, "epoch": 1.3084973634424184, "grad_norm": 0.15656688809394836, "learning_rate": 5.638666543993621e-05, "loss": 0.5802, "mean_token_accuracy": 0.8225698992609978, "num_tokens": 453939433.0, "step": 14222 }, { "entropy": 0.644032683223486, "epoch": 1.3085893698138595, "grad_norm": 0.16518253087997437, "learning_rate": 5.6383598613794586e-05, "loss": 0.6391, "mean_token_accuracy": 0.8003973327577114, "num_tokens": 453971240.0, "step": 14223 }, { "entropy": 0.6180855957791209, "epoch": 1.308681376185301, "grad_norm": 0.1623259335756302, "learning_rate": 5.6380531787652954e-05, "loss": 0.6002, "mean_token_accuracy": 0.8144916445016861, "num_tokens": 454002976.0, "step": 14224 }, { "entropy": 0.6932114735245705, "epoch": 1.308773382556742, "grad_norm": 0.158138245344162, "learning_rate": 5.637746496151134e-05, "loss": 0.6763, "mean_token_accuracy": 0.7931058220565319, "num_tokens": 454034994.0, "step": 14225 }, { "entropy": 0.6705208150669932, "epoch": 1.3088653889281834, "grad_norm": 0.1595105081796646, "learning_rate": 5.637439813536971e-05, "loss": 0.6589, "mean_token_accuracy": 0.7975498996675014, "num_tokens": 454067288.0, "step": 14226 }, { "entropy": 0.6687650703825057, "epoch": 1.3089573952996245, "grad_norm": 0.16126830875873566, "learning_rate": 5.637133130922808e-05, "loss": 0.6506, "mean_token_accuracy": 0.8006312772631645, "num_tokens": 454099542.0, "step": 14227 }, { "entropy": 0.6981386430561543, "epoch": 1.3090494016710656, "grad_norm": 0.15932871401309967, "learning_rate": 5.636826448308645e-05, "loss": 0.6924, "mean_token_accuracy": 0.7925928197801113, "num_tokens": 454132310.0, "step": 14228 }, { "entropy": 0.5631336327642202, "epoch": 1.309141408042507, "grad_norm": 0.15705250203609467, "learning_rate": 5.6365197656944834e-05, "loss": 0.5517, "mean_token_accuracy": 0.827445175498724, "num_tokens": 454163639.0, "step": 14229 }, { "entropy": 0.6061041671782732, "epoch": 1.3092334144139481, "grad_norm": 0.156753271818161, "learning_rate": 5.636213083080321e-05, "loss": 0.5952, "mean_token_accuracy": 0.8158175684511662, "num_tokens": 454195060.0, "step": 14230 }, { "entropy": 0.6575558576732874, "epoch": 1.3093254207853895, "grad_norm": 0.16130410134792328, "learning_rate": 5.635906400466158e-05, "loss": 0.6441, "mean_token_accuracy": 0.8032171502709389, "num_tokens": 454226751.0, "step": 14231 }, { "entropy": 0.6544948085211217, "epoch": 1.3094174271568306, "grad_norm": 0.1630346179008484, "learning_rate": 5.635599717851995e-05, "loss": 0.6341, "mean_token_accuracy": 0.8063949383795261, "num_tokens": 454258660.0, "step": 14232 }, { "entropy": 0.5851624049246311, "epoch": 1.3095094335282718, "grad_norm": 0.1542077660560608, "learning_rate": 5.635293035237833e-05, "loss": 0.5706, "mean_token_accuracy": 0.8247383870184422, "num_tokens": 454290681.0, "step": 14233 }, { "entropy": 0.5482022482901812, "epoch": 1.3096014398997131, "grad_norm": 0.16690626740455627, "learning_rate": 5.63498635262367e-05, "loss": 0.5325, "mean_token_accuracy": 0.8349030166864395, "num_tokens": 454322329.0, "step": 14234 }, { "entropy": 0.6855246936902404, "epoch": 1.3096934462711542, "grad_norm": 0.1683550477027893, "learning_rate": 5.6346796700095075e-05, "loss": 0.6608, "mean_token_accuracy": 0.797224897891283, "num_tokens": 454353886.0, "step": 14235 }, { "entropy": 0.5992552172392607, "epoch": 1.3097854526425956, "grad_norm": 0.16218139231204987, "learning_rate": 5.634372987395344e-05, "loss": 0.5916, "mean_token_accuracy": 0.818369422107935, "num_tokens": 454386374.0, "step": 14236 }, { "entropy": 0.6698393588885665, "epoch": 1.3098774590140367, "grad_norm": 0.1561673879623413, "learning_rate": 5.6340663047811825e-05, "loss": 0.6543, "mean_token_accuracy": 0.799030389636755, "num_tokens": 454418524.0, "step": 14237 }, { "entropy": 0.5537024871446192, "epoch": 1.3099694653854779, "grad_norm": 0.15026244521141052, "learning_rate": 5.63375962216702e-05, "loss": 0.534, "mean_token_accuracy": 0.8293924778699875, "num_tokens": 454450119.0, "step": 14238 }, { "entropy": 0.655488520860672, "epoch": 1.3100614717569192, "grad_norm": 0.16205711662769318, "learning_rate": 5.633452939552857e-05, "loss": 0.6619, "mean_token_accuracy": 0.7991825453937054, "num_tokens": 454481653.0, "step": 14239 }, { "entropy": 0.6538149258121848, "epoch": 1.3101534781283604, "grad_norm": 0.15605370700359344, "learning_rate": 5.633146256938694e-05, "loss": 0.6345, "mean_token_accuracy": 0.8050349615514278, "num_tokens": 454512932.0, "step": 14240 }, { "entropy": 0.6820078529417515, "epoch": 1.3102454844998017, "grad_norm": 0.15810523927211761, "learning_rate": 5.632839574324532e-05, "loss": 0.6695, "mean_token_accuracy": 0.795282494276762, "num_tokens": 454545079.0, "step": 14241 }, { "entropy": 0.6858618836849928, "epoch": 1.3103374908712428, "grad_norm": 0.16821661591529846, "learning_rate": 5.632532891710369e-05, "loss": 0.6804, "mean_token_accuracy": 0.7939349748194218, "num_tokens": 454576600.0, "step": 14242 }, { "entropy": 0.7309833075851202, "epoch": 1.310429497242684, "grad_norm": 0.16468605399131775, "learning_rate": 5.6322262090962066e-05, "loss": 0.7296, "mean_token_accuracy": 0.7792327255010605, "num_tokens": 454608258.0, "step": 14243 }, { "entropy": 0.5639790454879403, "epoch": 1.3105215036141253, "grad_norm": 0.14903543889522552, "learning_rate": 5.6319195264820434e-05, "loss": 0.5614, "mean_token_accuracy": 0.8260557986795902, "num_tokens": 454640209.0, "step": 14244 }, { "entropy": 0.6907211635261774, "epoch": 1.3106135099855665, "grad_norm": 0.1641438603401184, "learning_rate": 5.6316128438678815e-05, "loss": 0.6756, "mean_token_accuracy": 0.7909909524023533, "num_tokens": 454672020.0, "step": 14245 }, { "entropy": 0.6239675944671035, "epoch": 1.3107055163570078, "grad_norm": 0.1567392200231552, "learning_rate": 5.631306161253719e-05, "loss": 0.6149, "mean_token_accuracy": 0.8127138987183571, "num_tokens": 454703970.0, "step": 14246 }, { "entropy": 0.5533350892364979, "epoch": 1.310797522728449, "grad_norm": 0.1497531235218048, "learning_rate": 5.630999478639556e-05, "loss": 0.5491, "mean_token_accuracy": 0.8270482607185841, "num_tokens": 454736541.0, "step": 14247 }, { "entropy": 0.6456318376585841, "epoch": 1.31088952909989, "grad_norm": 0.15386641025543213, "learning_rate": 5.630692796025394e-05, "loss": 0.6212, "mean_token_accuracy": 0.8078200146555901, "num_tokens": 454768161.0, "step": 14248 }, { "entropy": 0.6246470990590751, "epoch": 1.3109815354713314, "grad_norm": 0.16012372076511383, "learning_rate": 5.6303861134112314e-05, "loss": 0.6118, "mean_token_accuracy": 0.8133852854371071, "num_tokens": 454799413.0, "step": 14249 }, { "entropy": 0.6808357425034046, "epoch": 1.3110735418427726, "grad_norm": 0.1606132984161377, "learning_rate": 5.630079430797068e-05, "loss": 0.678, "mean_token_accuracy": 0.7916521318256855, "num_tokens": 454831651.0, "step": 14250 }, { "entropy": 0.7222789525985718, "epoch": 1.311165548214214, "grad_norm": 0.1619492471218109, "learning_rate": 5.6297727481829056e-05, "loss": 0.7178, "mean_token_accuracy": 0.7837371863424778, "num_tokens": 454864411.0, "step": 14251 }, { "entropy": 0.6852001175284386, "epoch": 1.311257554585655, "grad_norm": 0.16675494611263275, "learning_rate": 5.629466065568744e-05, "loss": 0.6859, "mean_token_accuracy": 0.7951492555439472, "num_tokens": 454896008.0, "step": 14252 }, { "entropy": 0.7531926706433296, "epoch": 1.3113495609570962, "grad_norm": 0.17276442050933838, "learning_rate": 5.6291593829545805e-05, "loss": 0.742, "mean_token_accuracy": 0.7743937112390995, "num_tokens": 454927326.0, "step": 14253 }, { "entropy": 0.662922540679574, "epoch": 1.3114415673285376, "grad_norm": 0.16223566234111786, "learning_rate": 5.628852700340418e-05, "loss": 0.6496, "mean_token_accuracy": 0.7998629510402679, "num_tokens": 454958609.0, "step": 14254 }, { "entropy": 0.6541419364511967, "epoch": 1.3115335736999787, "grad_norm": 0.15650339424610138, "learning_rate": 5.628546017726255e-05, "loss": 0.642, "mean_token_accuracy": 0.8058395199477673, "num_tokens": 454990901.0, "step": 14255 }, { "entropy": 0.6325326543301344, "epoch": 1.31162558007142, "grad_norm": 0.15754574537277222, "learning_rate": 5.628239335112093e-05, "loss": 0.6073, "mean_token_accuracy": 0.8114927373826504, "num_tokens": 455022891.0, "step": 14256 }, { "entropy": 0.650550689548254, "epoch": 1.3117175864428612, "grad_norm": 0.16125385463237762, "learning_rate": 5.6279326524979304e-05, "loss": 0.6487, "mean_token_accuracy": 0.8056738562881947, "num_tokens": 455055192.0, "step": 14257 }, { "entropy": 0.6818867921829224, "epoch": 1.3118095928143023, "grad_norm": 0.16455182433128357, "learning_rate": 5.627625969883767e-05, "loss": 0.6734, "mean_token_accuracy": 0.7960145212709904, "num_tokens": 455087011.0, "step": 14258 }, { "entropy": 0.7285914421081543, "epoch": 1.3119015991857437, "grad_norm": 0.16498339176177979, "learning_rate": 5.6273192872696047e-05, "loss": 0.7155, "mean_token_accuracy": 0.781865268945694, "num_tokens": 455119248.0, "step": 14259 }, { "entropy": 0.5373873533681035, "epoch": 1.3119936055571848, "grad_norm": 0.1647735983133316, "learning_rate": 5.627012604655443e-05, "loss": 0.5242, "mean_token_accuracy": 0.8384292460978031, "num_tokens": 455151026.0, "step": 14260 }, { "entropy": 0.5642903167754412, "epoch": 1.3120856119286262, "grad_norm": 0.1652287244796753, "learning_rate": 5.6267059220412796e-05, "loss": 0.5563, "mean_token_accuracy": 0.8272133506834507, "num_tokens": 455182820.0, "step": 14261 }, { "entropy": 0.6946740560233593, "epoch": 1.3121776183000673, "grad_norm": 0.16896823048591614, "learning_rate": 5.626399239427117e-05, "loss": 0.6904, "mean_token_accuracy": 0.7879503034055233, "num_tokens": 455214521.0, "step": 14262 }, { "entropy": 0.5277412859722972, "epoch": 1.3122696246715084, "grad_norm": 0.14966405928134918, "learning_rate": 5.626092556812954e-05, "loss": 0.5125, "mean_token_accuracy": 0.8422884047031403, "num_tokens": 455247261.0, "step": 14263 }, { "entropy": 0.689933548681438, "epoch": 1.3123616310429498, "grad_norm": 0.1678270399570465, "learning_rate": 5.6257858741987927e-05, "loss": 0.6834, "mean_token_accuracy": 0.7930788584053516, "num_tokens": 455278926.0, "step": 14264 }, { "entropy": 0.6216852022334933, "epoch": 1.312453637414391, "grad_norm": 0.15657176077365875, "learning_rate": 5.6254791915846294e-05, "loss": 0.6014, "mean_token_accuracy": 0.8195048086345196, "num_tokens": 455310984.0, "step": 14265 }, { "entropy": 0.6229301448911428, "epoch": 1.3125456437858323, "grad_norm": 0.15599793195724487, "learning_rate": 5.625172508970466e-05, "loss": 0.6162, "mean_token_accuracy": 0.8135586827993393, "num_tokens": 455343744.0, "step": 14266 }, { "entropy": 0.7245909236371517, "epoch": 1.3126376501572734, "grad_norm": 0.1562384068965912, "learning_rate": 5.624865826356304e-05, "loss": 0.7127, "mean_token_accuracy": 0.7834360413253307, "num_tokens": 455376238.0, "step": 14267 }, { "entropy": 0.6181972781196237, "epoch": 1.3127296565287145, "grad_norm": 0.15811923146247864, "learning_rate": 5.624559143742142e-05, "loss": 0.5873, "mean_token_accuracy": 0.8180348873138428, "num_tokens": 455408283.0, "step": 14268 }, { "entropy": 0.638216448482126, "epoch": 1.312821662900156, "grad_norm": 0.15359438955783844, "learning_rate": 5.624252461127979e-05, "loss": 0.611, "mean_token_accuracy": 0.8103735409677029, "num_tokens": 455440005.0, "step": 14269 }, { "entropy": 0.7065864484757185, "epoch": 1.312913669271597, "grad_norm": 0.16181014478206635, "learning_rate": 5.623945778513816e-05, "loss": 0.6787, "mean_token_accuracy": 0.7961168810725212, "num_tokens": 455471279.0, "step": 14270 }, { "entropy": 0.5998503435403109, "epoch": 1.3130056756430384, "grad_norm": 0.16414067149162292, "learning_rate": 5.623639095899653e-05, "loss": 0.5961, "mean_token_accuracy": 0.8192868903279305, "num_tokens": 455502717.0, "step": 14271 }, { "entropy": 0.6139820870012045, "epoch": 1.3130976820144795, "grad_norm": 0.1577177792787552, "learning_rate": 5.623332413285492e-05, "loss": 0.6028, "mean_token_accuracy": 0.8177148997783661, "num_tokens": 455534310.0, "step": 14272 }, { "entropy": 0.6673392616212368, "epoch": 1.3131896883859207, "grad_norm": 0.16542144119739532, "learning_rate": 5.6230257306713285e-05, "loss": 0.6583, "mean_token_accuracy": 0.7991878315806389, "num_tokens": 455567078.0, "step": 14273 }, { "entropy": 0.6109679462388158, "epoch": 1.313281694757362, "grad_norm": 0.14988096058368683, "learning_rate": 5.622719048057166e-05, "loss": 0.6026, "mean_token_accuracy": 0.8181577511131763, "num_tokens": 455599583.0, "step": 14274 }, { "entropy": 0.5541861988604069, "epoch": 1.3133737011288031, "grad_norm": 0.15400919318199158, "learning_rate": 5.622412365443003e-05, "loss": 0.5358, "mean_token_accuracy": 0.8313758447766304, "num_tokens": 455631376.0, "step": 14275 }, { "entropy": 0.5893823746591806, "epoch": 1.3134657075002445, "grad_norm": 0.15761935710906982, "learning_rate": 5.622105682828841e-05, "loss": 0.5533, "mean_token_accuracy": 0.8270940817892551, "num_tokens": 455663152.0, "step": 14276 }, { "entropy": 0.7214862322434783, "epoch": 1.3135577138716856, "grad_norm": 0.16710138320922852, "learning_rate": 5.6217990002146783e-05, "loss": 0.7037, "mean_token_accuracy": 0.7860258370637894, "num_tokens": 455694133.0, "step": 14277 }, { "entropy": 0.6369915418326855, "epoch": 1.3136497202431268, "grad_norm": 0.16460563242435455, "learning_rate": 5.621492317600515e-05, "loss": 0.6354, "mean_token_accuracy": 0.8045721128582954, "num_tokens": 455726673.0, "step": 14278 }, { "entropy": 0.5620156582444906, "epoch": 1.3137417266145681, "grad_norm": 0.1597939133644104, "learning_rate": 5.621185634986353e-05, "loss": 0.552, "mean_token_accuracy": 0.8287848830223083, "num_tokens": 455758920.0, "step": 14279 }, { "entropy": 0.6581323035061359, "epoch": 1.3138337329860093, "grad_norm": 0.15593285858631134, "learning_rate": 5.620878952372191e-05, "loss": 0.6453, "mean_token_accuracy": 0.8016141839325428, "num_tokens": 455791366.0, "step": 14280 }, { "entropy": 0.5903088105842471, "epoch": 1.3139257393574506, "grad_norm": 0.15223237872123718, "learning_rate": 5.6205722697580275e-05, "loss": 0.5748, "mean_token_accuracy": 0.8195203766226768, "num_tokens": 455823044.0, "step": 14281 }, { "entropy": 0.5320273032411933, "epoch": 1.3140177457288917, "grad_norm": 0.14569896459579468, "learning_rate": 5.620265587143865e-05, "loss": 0.5257, "mean_token_accuracy": 0.836896326392889, "num_tokens": 455854588.0, "step": 14282 }, { "entropy": 0.5800527092069387, "epoch": 1.3141097521003329, "grad_norm": 0.15453685820102692, "learning_rate": 5.619958904529703e-05, "loss": 0.5748, "mean_token_accuracy": 0.8212558589875698, "num_tokens": 455886779.0, "step": 14283 }, { "entropy": 0.5755104180425406, "epoch": 1.3142017584717742, "grad_norm": 0.15006892383098602, "learning_rate": 5.61965222191554e-05, "loss": 0.5702, "mean_token_accuracy": 0.8273985460400581, "num_tokens": 455919076.0, "step": 14284 }, { "entropy": 0.5452785547822714, "epoch": 1.3142937648432154, "grad_norm": 0.1545899510383606, "learning_rate": 5.6193455393013774e-05, "loss": 0.5391, "mean_token_accuracy": 0.8364806920289993, "num_tokens": 455951080.0, "step": 14285 }, { "entropy": 0.6554987076669931, "epoch": 1.3143857712146567, "grad_norm": 0.16308172047138214, "learning_rate": 5.619038856687214e-05, "loss": 0.6536, "mean_token_accuracy": 0.8012369498610497, "num_tokens": 455983339.0, "step": 14286 }, { "entropy": 0.5276092053391039, "epoch": 1.3144777775860979, "grad_norm": 0.15014037489891052, "learning_rate": 5.618732174073052e-05, "loss": 0.515, "mean_token_accuracy": 0.8380127176642418, "num_tokens": 456015530.0, "step": 14287 }, { "entropy": 0.6694241855293512, "epoch": 1.314569783957539, "grad_norm": 0.15935468673706055, "learning_rate": 5.61842549145889e-05, "loss": 0.6578, "mean_token_accuracy": 0.801991630345583, "num_tokens": 456047051.0, "step": 14288 }, { "entropy": 0.559768492821604, "epoch": 1.3146617903289803, "grad_norm": 0.15483158826828003, "learning_rate": 5.6181188088447266e-05, "loss": 0.5539, "mean_token_accuracy": 0.8315756320953369, "num_tokens": 456078577.0, "step": 14289 }, { "entropy": 0.5845174547284842, "epoch": 1.3147537967004215, "grad_norm": 0.1583409309387207, "learning_rate": 5.617812126230564e-05, "loss": 0.5746, "mean_token_accuracy": 0.8222522735595703, "num_tokens": 456111248.0, "step": 14290 }, { "entropy": 0.5779199730604887, "epoch": 1.3148458030718628, "grad_norm": 0.16361188888549805, "learning_rate": 5.617505443616402e-05, "loss": 0.5524, "mean_token_accuracy": 0.8327660001814365, "num_tokens": 456142665.0, "step": 14291 }, { "entropy": 0.5821020947769284, "epoch": 1.314937809443304, "grad_norm": 0.1632312685251236, "learning_rate": 5.617198761002239e-05, "loss": 0.5633, "mean_token_accuracy": 0.8252839408814907, "num_tokens": 456175151.0, "step": 14292 }, { "entropy": 0.6041314173489809, "epoch": 1.315029815814745, "grad_norm": 0.1544383317232132, "learning_rate": 5.6168920783880764e-05, "loss": 0.5925, "mean_token_accuracy": 0.8190574683248997, "num_tokens": 456207151.0, "step": 14293 }, { "entropy": 0.5172856021672487, "epoch": 1.3151218221861865, "grad_norm": 0.15621575713157654, "learning_rate": 5.616585395773913e-05, "loss": 0.4989, "mean_token_accuracy": 0.84850212931633, "num_tokens": 456239857.0, "step": 14294 }, { "entropy": 0.6184176672250032, "epoch": 1.3152138285576276, "grad_norm": 0.1567763388156891, "learning_rate": 5.6162787131597514e-05, "loss": 0.6056, "mean_token_accuracy": 0.8124345727264881, "num_tokens": 456271764.0, "step": 14295 }, { "entropy": 0.6587536102160811, "epoch": 1.315305834929069, "grad_norm": 0.1670931577682495, "learning_rate": 5.615972030545589e-05, "loss": 0.6436, "mean_token_accuracy": 0.810546163469553, "num_tokens": 456303140.0, "step": 14296 }, { "entropy": 0.6190512869507074, "epoch": 1.31539784130051, "grad_norm": 0.15926295518875122, "learning_rate": 5.6156653479314256e-05, "loss": 0.603, "mean_token_accuracy": 0.8158088251948357, "num_tokens": 456335066.0, "step": 14297 }, { "entropy": 0.6048125680536032, "epoch": 1.3154898476719512, "grad_norm": 0.1559811383485794, "learning_rate": 5.615358665317263e-05, "loss": 0.5934, "mean_token_accuracy": 0.8212872073054314, "num_tokens": 456367314.0, "step": 14298 }, { "entropy": 0.6023055436089635, "epoch": 1.3155818540433926, "grad_norm": 0.15343110263347626, "learning_rate": 5.615051982703101e-05, "loss": 0.6006, "mean_token_accuracy": 0.8142195269465446, "num_tokens": 456399447.0, "step": 14299 }, { "entropy": 0.5855016801506281, "epoch": 1.3156738604148337, "grad_norm": 0.15718570351600647, "learning_rate": 5.614745300088938e-05, "loss": 0.5714, "mean_token_accuracy": 0.821625143289566, "num_tokens": 456431842.0, "step": 14300 }, { "entropy": 0.6495391707867384, "epoch": 1.315765866786275, "grad_norm": 0.1566428542137146, "learning_rate": 5.6144386174747755e-05, "loss": 0.6463, "mean_token_accuracy": 0.8037073500454426, "num_tokens": 456464007.0, "step": 14301 }, { "entropy": 0.648623501881957, "epoch": 1.3158578731577162, "grad_norm": 0.16226403415203094, "learning_rate": 5.614131934860612e-05, "loss": 0.6121, "mean_token_accuracy": 0.810089036822319, "num_tokens": 456495514.0, "step": 14302 }, { "entropy": 0.536782099865377, "epoch": 1.3159498795291573, "grad_norm": 0.15871337056159973, "learning_rate": 5.6138252522464504e-05, "loss": 0.5296, "mean_token_accuracy": 0.8347918540239334, "num_tokens": 456527542.0, "step": 14303 }, { "entropy": 0.6388052515685558, "epoch": 1.3160418859005987, "grad_norm": 0.15867365896701813, "learning_rate": 5.613518569632288e-05, "loss": 0.6266, "mean_token_accuracy": 0.8091149590909481, "num_tokens": 456559378.0, "step": 14304 }, { "entropy": 0.5850212443619967, "epoch": 1.3161338922720398, "grad_norm": 0.17406588792800903, "learning_rate": 5.6132118870181246e-05, "loss": 0.5815, "mean_token_accuracy": 0.8236736208200455, "num_tokens": 456590734.0, "step": 14305 }, { "entropy": 0.629714097827673, "epoch": 1.3162258986434812, "grad_norm": 0.17023196816444397, "learning_rate": 5.612905204403962e-05, "loss": 0.633, "mean_token_accuracy": 0.8090553805232048, "num_tokens": 456622625.0, "step": 14306 }, { "entropy": 0.5990107711404562, "epoch": 1.3163179050149223, "grad_norm": 0.159720778465271, "learning_rate": 5.6125985217898e-05, "loss": 0.6084, "mean_token_accuracy": 0.8152787536382675, "num_tokens": 456654813.0, "step": 14307 }, { "entropy": 0.5776107860729098, "epoch": 1.3164099113863634, "grad_norm": 0.15146517753601074, "learning_rate": 5.612291839175638e-05, "loss": 0.5545, "mean_token_accuracy": 0.8270467706024647, "num_tokens": 456686801.0, "step": 14308 }, { "entropy": 0.5821972563862801, "epoch": 1.3165019177578048, "grad_norm": 0.14831650257110596, "learning_rate": 5.6119851565614745e-05, "loss": 0.5617, "mean_token_accuracy": 0.8255185633897781, "num_tokens": 456718430.0, "step": 14309 }, { "entropy": 0.5424175690859556, "epoch": 1.316593924129246, "grad_norm": 0.15142740309238434, "learning_rate": 5.6116784739473126e-05, "loss": 0.5168, "mean_token_accuracy": 0.8414005935192108, "num_tokens": 456750096.0, "step": 14310 }, { "entropy": 0.5882885549217463, "epoch": 1.3166859305006873, "grad_norm": 0.15798240900039673, "learning_rate": 5.61137179133315e-05, "loss": 0.5796, "mean_token_accuracy": 0.8250640816986561, "num_tokens": 456781435.0, "step": 14311 }, { "entropy": 0.7190563622862101, "epoch": 1.3167779368721284, "grad_norm": 0.1691783368587494, "learning_rate": 5.611065108718987e-05, "loss": 0.7128, "mean_token_accuracy": 0.7878545112907887, "num_tokens": 456813365.0, "step": 14312 }, { "entropy": 0.670741556212306, "epoch": 1.3168699432435695, "grad_norm": 0.15555615723133087, "learning_rate": 5.6107584261048244e-05, "loss": 0.6559, "mean_token_accuracy": 0.7978518046438694, "num_tokens": 456845621.0, "step": 14313 }, { "entropy": 0.558360243216157, "epoch": 1.316961949615011, "grad_norm": 0.15487989783287048, "learning_rate": 5.6104517434906625e-05, "loss": 0.5454, "mean_token_accuracy": 0.8310375064611435, "num_tokens": 456877465.0, "step": 14314 }, { "entropy": 0.7007043920457363, "epoch": 1.317053955986452, "grad_norm": 0.1672583520412445, "learning_rate": 5.610145060876499e-05, "loss": 0.6936, "mean_token_accuracy": 0.7864038348197937, "num_tokens": 456908601.0, "step": 14315 }, { "entropy": 0.627567826770246, "epoch": 1.3171459623578934, "grad_norm": 0.1607467383146286, "learning_rate": 5.609838378262337e-05, "loss": 0.609, "mean_token_accuracy": 0.8149882964789867, "num_tokens": 456940704.0, "step": 14316 }, { "entropy": 0.6331809125840664, "epoch": 1.3172379687293345, "grad_norm": 0.16280362010002136, "learning_rate": 5.6095316956481735e-05, "loss": 0.6369, "mean_token_accuracy": 0.807162020355463, "num_tokens": 456972384.0, "step": 14317 }, { "entropy": 0.5950271934270859, "epoch": 1.3173299751007757, "grad_norm": 0.15642060339450836, "learning_rate": 5.609225013034012e-05, "loss": 0.582, "mean_token_accuracy": 0.822408813983202, "num_tokens": 457005109.0, "step": 14318 }, { "entropy": 0.6101786457002163, "epoch": 1.317421981472217, "grad_norm": 0.1566852182149887, "learning_rate": 5.608918330419849e-05, "loss": 0.5998, "mean_token_accuracy": 0.8215819634497166, "num_tokens": 457037036.0, "step": 14319 }, { "entropy": 0.7006552927196026, "epoch": 1.3175139878436581, "grad_norm": 0.16823391616344452, "learning_rate": 5.608611647805686e-05, "loss": 0.6945, "mean_token_accuracy": 0.7896288670599461, "num_tokens": 457069085.0, "step": 14320 }, { "entropy": 0.6383642749860883, "epoch": 1.3176059942150995, "grad_norm": 0.1598946750164032, "learning_rate": 5.6083049651915234e-05, "loss": 0.6174, "mean_token_accuracy": 0.8123338855803013, "num_tokens": 457099883.0, "step": 14321 }, { "entropy": 0.6377084190025926, "epoch": 1.3176980005865406, "grad_norm": 0.15458174049854279, "learning_rate": 5.6079982825773615e-05, "loss": 0.6237, "mean_token_accuracy": 0.8116252832114697, "num_tokens": 457131829.0, "step": 14322 }, { "entropy": 0.6212920714169741, "epoch": 1.3177900069579818, "grad_norm": 0.15234003961086273, "learning_rate": 5.607691599963198e-05, "loss": 0.6061, "mean_token_accuracy": 0.8118273057043552, "num_tokens": 457164037.0, "step": 14323 }, { "entropy": 0.5865630889311433, "epoch": 1.3178820133294231, "grad_norm": 0.15448720753192902, "learning_rate": 5.607384917349036e-05, "loss": 0.5725, "mean_token_accuracy": 0.824253898113966, "num_tokens": 457195207.0, "step": 14324 }, { "entropy": 0.5724903428927064, "epoch": 1.3179740197008643, "grad_norm": 0.15112487971782684, "learning_rate": 5.6070782347348726e-05, "loss": 0.5558, "mean_token_accuracy": 0.8275623433291912, "num_tokens": 457226430.0, "step": 14325 }, { "entropy": 0.5536251626908779, "epoch": 1.3180660260723056, "grad_norm": 0.15124279260635376, "learning_rate": 5.606771552120711e-05, "loss": 0.5468, "mean_token_accuracy": 0.8295178189873695, "num_tokens": 457258322.0, "step": 14326 }, { "entropy": 0.5862578060477972, "epoch": 1.3181580324437467, "grad_norm": 0.15307965874671936, "learning_rate": 5.606464869506548e-05, "loss": 0.5703, "mean_token_accuracy": 0.8216967135667801, "num_tokens": 457289943.0, "step": 14327 }, { "entropy": 0.6473401514813304, "epoch": 1.3182500388151879, "grad_norm": 0.15649108588695526, "learning_rate": 5.606158186892385e-05, "loss": 0.647, "mean_token_accuracy": 0.8027572743594646, "num_tokens": 457322678.0, "step": 14328 }, { "entropy": 0.5847535897046328, "epoch": 1.3183420451866292, "grad_norm": 0.16222789883613586, "learning_rate": 5.6058515042782224e-05, "loss": 0.5874, "mean_token_accuracy": 0.8238011375069618, "num_tokens": 457355248.0, "step": 14329 }, { "entropy": 0.5643026009202003, "epoch": 1.3184340515580704, "grad_norm": 0.1513214260339737, "learning_rate": 5.6055448216640606e-05, "loss": 0.5654, "mean_token_accuracy": 0.8251530192792416, "num_tokens": 457387468.0, "step": 14330 }, { "entropy": 0.5780859924852848, "epoch": 1.3185260579295117, "grad_norm": 0.16005206108093262, "learning_rate": 5.6052381390498974e-05, "loss": 0.5759, "mean_token_accuracy": 0.8217889964580536, "num_tokens": 457419638.0, "step": 14331 }, { "entropy": 0.6795655619353056, "epoch": 1.3186180643009529, "grad_norm": 0.16023504734039307, "learning_rate": 5.604931456435735e-05, "loss": 0.6755, "mean_token_accuracy": 0.791520718485117, "num_tokens": 457451675.0, "step": 14332 }, { "entropy": 0.6093870894983411, "epoch": 1.318710070672394, "grad_norm": 0.1639716476202011, "learning_rate": 5.6046247738215716e-05, "loss": 0.601, "mean_token_accuracy": 0.8174678832292557, "num_tokens": 457483248.0, "step": 14333 }, { "entropy": 0.6274670669808984, "epoch": 1.3188020770438353, "grad_norm": 0.16020803153514862, "learning_rate": 5.60431809120741e-05, "loss": 0.6251, "mean_token_accuracy": 0.8094567060470581, "num_tokens": 457515094.0, "step": 14334 }, { "entropy": 0.6269160769879818, "epoch": 1.3188940834152765, "grad_norm": 0.15699467062950134, "learning_rate": 5.604011408593247e-05, "loss": 0.6201, "mean_token_accuracy": 0.8095708899199963, "num_tokens": 457546927.0, "step": 14335 }, { "entropy": 0.6121396068483591, "epoch": 1.3189860897867178, "grad_norm": 0.15616635978221893, "learning_rate": 5.603704725979084e-05, "loss": 0.5884, "mean_token_accuracy": 0.8172132968902588, "num_tokens": 457578935.0, "step": 14336 }, { "entropy": 0.6010236889123917, "epoch": 1.319078096158159, "grad_norm": 0.15298834443092346, "learning_rate": 5.6033980433649215e-05, "loss": 0.5712, "mean_token_accuracy": 0.8218872435390949, "num_tokens": 457610601.0, "step": 14337 }, { "entropy": 0.6475709807127714, "epoch": 1.3191701025296, "grad_norm": 0.16115571558475494, "learning_rate": 5.6030913607507596e-05, "loss": 0.6295, "mean_token_accuracy": 0.8079609982669353, "num_tokens": 457642579.0, "step": 14338 }, { "entropy": 0.5321576856076717, "epoch": 1.3192621089010415, "grad_norm": 0.15747933089733124, "learning_rate": 5.6027846781365964e-05, "loss": 0.5257, "mean_token_accuracy": 0.83638471737504, "num_tokens": 457673602.0, "step": 14339 }, { "entropy": 0.6855260012671351, "epoch": 1.3193541152724826, "grad_norm": 0.16276206076145172, "learning_rate": 5.602477995522434e-05, "loss": 0.6926, "mean_token_accuracy": 0.7880529426038265, "num_tokens": 457705773.0, "step": 14340 }, { "entropy": 0.5950098671019077, "epoch": 1.319446121643924, "grad_norm": 0.15772190690040588, "learning_rate": 5.602171312908272e-05, "loss": 0.588, "mean_token_accuracy": 0.8195012100040913, "num_tokens": 457737288.0, "step": 14341 }, { "entropy": 0.6876471526920795, "epoch": 1.319538128015365, "grad_norm": 0.162477046251297, "learning_rate": 5.601864630294109e-05, "loss": 0.6869, "mean_token_accuracy": 0.7926183640956879, "num_tokens": 457769907.0, "step": 14342 }, { "entropy": 0.5371973365545273, "epoch": 1.3196301343868062, "grad_norm": 0.14926567673683167, "learning_rate": 5.601557947679946e-05, "loss": 0.5147, "mean_token_accuracy": 0.8380269855260849, "num_tokens": 457801929.0, "step": 14343 }, { "entropy": 0.6704232534393668, "epoch": 1.3197221407582476, "grad_norm": 0.1644313484430313, "learning_rate": 5.601251265065783e-05, "loss": 0.6517, "mean_token_accuracy": 0.7965182214975357, "num_tokens": 457833843.0, "step": 14344 }, { "entropy": 0.5881751934066415, "epoch": 1.3198141471296887, "grad_norm": 0.1612999439239502, "learning_rate": 5.600944582451622e-05, "loss": 0.5803, "mean_token_accuracy": 0.8243576698005199, "num_tokens": 457865474.0, "step": 14345 }, { "entropy": 0.5380340181291103, "epoch": 1.31990615350113, "grad_norm": 0.14329321682453156, "learning_rate": 5.600637899837459e-05, "loss": 0.5165, "mean_token_accuracy": 0.8388099670410156, "num_tokens": 457897233.0, "step": 14346 }, { "entropy": 0.6772993407212198, "epoch": 1.3199981598725712, "grad_norm": 0.15698875486850739, "learning_rate": 5.6003312172232955e-05, "loss": 0.6631, "mean_token_accuracy": 0.8066830523312092, "num_tokens": 457929251.0, "step": 14347 }, { "entropy": 0.5466817393898964, "epoch": 1.3200901662440123, "grad_norm": 0.15791064500808716, "learning_rate": 5.600024534609133e-05, "loss": 0.5337, "mean_token_accuracy": 0.8354505859315395, "num_tokens": 457961715.0, "step": 14348 }, { "entropy": 0.7277012839913368, "epoch": 1.3201821726154537, "grad_norm": 0.16310670971870422, "learning_rate": 5.599717851994971e-05, "loss": 0.715, "mean_token_accuracy": 0.7845185026526451, "num_tokens": 457994053.0, "step": 14349 }, { "entropy": 0.5952043309807777, "epoch": 1.3202741789868948, "grad_norm": 0.15930312871932983, "learning_rate": 5.5994111693808085e-05, "loss": 0.5818, "mean_token_accuracy": 0.8214195892214775, "num_tokens": 458025106.0, "step": 14350 }, { "entropy": 0.5934214917942882, "epoch": 1.3203661853583362, "grad_norm": 0.1527300775051117, "learning_rate": 5.599104486766645e-05, "loss": 0.5748, "mean_token_accuracy": 0.8191104345023632, "num_tokens": 458057524.0, "step": 14351 }, { "entropy": 0.6556130181998014, "epoch": 1.3204581917297773, "grad_norm": 0.1568373739719391, "learning_rate": 5.598797804152483e-05, "loss": 0.6451, "mean_token_accuracy": 0.8055623732507229, "num_tokens": 458089507.0, "step": 14352 }, { "entropy": 0.6621993258595467, "epoch": 1.3205501981012184, "grad_norm": 0.1569075584411621, "learning_rate": 5.598491121538321e-05, "loss": 0.6426, "mean_token_accuracy": 0.8020729795098305, "num_tokens": 458122247.0, "step": 14353 }, { "entropy": 0.604265196248889, "epoch": 1.3206422044726598, "grad_norm": 0.15170902013778687, "learning_rate": 5.598184438924158e-05, "loss": 0.5925, "mean_token_accuracy": 0.8183776140213013, "num_tokens": 458153859.0, "step": 14354 }, { "entropy": 0.6565006449818611, "epoch": 1.320734210844101, "grad_norm": 0.16170887649059296, "learning_rate": 5.597877756309995e-05, "loss": 0.6383, "mean_token_accuracy": 0.8048034720122814, "num_tokens": 458186070.0, "step": 14355 }, { "entropy": 0.6184587515890598, "epoch": 1.3208262172155423, "grad_norm": 0.15416696667671204, "learning_rate": 5.597571073695832e-05, "loss": 0.5974, "mean_token_accuracy": 0.8159245029091835, "num_tokens": 458217464.0, "step": 14356 }, { "entropy": 0.6868350375443697, "epoch": 1.3209182235869834, "grad_norm": 0.16425766050815582, "learning_rate": 5.59726439108167e-05, "loss": 0.6788, "mean_token_accuracy": 0.7911044210195541, "num_tokens": 458249592.0, "step": 14357 }, { "entropy": 0.6397701613605022, "epoch": 1.3210102299584245, "grad_norm": 0.1562775820493698, "learning_rate": 5.5969577084675076e-05, "loss": 0.6357, "mean_token_accuracy": 0.8044923767447472, "num_tokens": 458281714.0, "step": 14358 }, { "entropy": 0.4990499969571829, "epoch": 1.321102236329866, "grad_norm": 0.1582186073064804, "learning_rate": 5.5966510258533444e-05, "loss": 0.4849, "mean_token_accuracy": 0.8488713875412941, "num_tokens": 458313474.0, "step": 14359 }, { "entropy": 0.509779118001461, "epoch": 1.321194242701307, "grad_norm": 0.14967317879199982, "learning_rate": 5.596344343239182e-05, "loss": 0.4978, "mean_token_accuracy": 0.8466059044003487, "num_tokens": 458346042.0, "step": 14360 }, { "entropy": 0.6614109072834253, "epoch": 1.3212862490727484, "grad_norm": 0.16324277222156525, "learning_rate": 5.59603766062502e-05, "loss": 0.6582, "mean_token_accuracy": 0.7987163662910461, "num_tokens": 458377473.0, "step": 14361 }, { "entropy": 0.44483199110254645, "epoch": 1.3213782554441895, "grad_norm": 0.14750346541404724, "learning_rate": 5.595730978010857e-05, "loss": 0.4344, "mean_token_accuracy": 0.8633127473294735, "num_tokens": 458409271.0, "step": 14362 }, { "entropy": 0.7304984563961625, "epoch": 1.3214702618156307, "grad_norm": 0.1769295185804367, "learning_rate": 5.595424295396694e-05, "loss": 0.7266, "mean_token_accuracy": 0.7820142172276974, "num_tokens": 458441291.0, "step": 14363 }, { "entropy": 0.5160506838001311, "epoch": 1.321562268187072, "grad_norm": 0.15762101113796234, "learning_rate": 5.595117612782531e-05, "loss": 0.5069, "mean_token_accuracy": 0.8436752483248711, "num_tokens": 458473094.0, "step": 14364 }, { "entropy": 0.5859627351164818, "epoch": 1.3216542745585131, "grad_norm": 0.15062426030635834, "learning_rate": 5.594810930168369e-05, "loss": 0.5562, "mean_token_accuracy": 0.8263354077935219, "num_tokens": 458504764.0, "step": 14365 }, { "entropy": 0.6544387945905328, "epoch": 1.3217462809299545, "grad_norm": 0.16052736341953278, "learning_rate": 5.5945042475542066e-05, "loss": 0.6441, "mean_token_accuracy": 0.8064819872379303, "num_tokens": 458536516.0, "step": 14366 }, { "entropy": 0.6782863419502974, "epoch": 1.3218382873013956, "grad_norm": 0.16182300448417664, "learning_rate": 5.5941975649400434e-05, "loss": 0.6779, "mean_token_accuracy": 0.7949536442756653, "num_tokens": 458569201.0, "step": 14367 }, { "entropy": 0.5809610178694129, "epoch": 1.3219302936728368, "grad_norm": 0.15497581660747528, "learning_rate": 5.5938908823258815e-05, "loss": 0.5639, "mean_token_accuracy": 0.8270348608493805, "num_tokens": 458600999.0, "step": 14368 }, { "entropy": 0.6055756425485015, "epoch": 1.3220223000442781, "grad_norm": 0.15633367002010345, "learning_rate": 5.593584199711719e-05, "loss": 0.5813, "mean_token_accuracy": 0.8211613297462463, "num_tokens": 458632591.0, "step": 14369 }, { "entropy": 0.6289436873048544, "epoch": 1.3221143064157193, "grad_norm": 0.17039532959461212, "learning_rate": 5.593277517097556e-05, "loss": 0.6231, "mean_token_accuracy": 0.8111468553543091, "num_tokens": 458663310.0, "step": 14370 }, { "entropy": 0.6449506673961878, "epoch": 1.3222063127871606, "grad_norm": 0.15903863310813904, "learning_rate": 5.592970834483393e-05, "loss": 0.6324, "mean_token_accuracy": 0.8069311380386353, "num_tokens": 458694505.0, "step": 14371 }, { "entropy": 0.6367842238396406, "epoch": 1.3222983191586017, "grad_norm": 0.1561354398727417, "learning_rate": 5.5926641518692314e-05, "loss": 0.6328, "mean_token_accuracy": 0.8062745593488216, "num_tokens": 458726728.0, "step": 14372 }, { "entropy": 0.6034509055316448, "epoch": 1.3223903255300429, "grad_norm": 0.15767411887645721, "learning_rate": 5.592357469255068e-05, "loss": 0.6001, "mean_token_accuracy": 0.817828793078661, "num_tokens": 458758457.0, "step": 14373 }, { "entropy": 0.5606782357208431, "epoch": 1.3224823319014842, "grad_norm": 0.1530206948518753, "learning_rate": 5.5920507866409056e-05, "loss": 0.5466, "mean_token_accuracy": 0.8319174125790596, "num_tokens": 458790413.0, "step": 14374 }, { "entropy": 0.6146647278219461, "epoch": 1.3225743382729254, "grad_norm": 0.15808473527431488, "learning_rate": 5.5917441040267424e-05, "loss": 0.6118, "mean_token_accuracy": 0.813124805688858, "num_tokens": 458823150.0, "step": 14375 }, { "entropy": 0.6792084854096174, "epoch": 1.3226663446443667, "grad_norm": 0.16296197474002838, "learning_rate": 5.5914374214125806e-05, "loss": 0.6632, "mean_token_accuracy": 0.7980935834348202, "num_tokens": 458854817.0, "step": 14376 }, { "entropy": 0.672207523137331, "epoch": 1.3227583510158079, "grad_norm": 0.1612107753753662, "learning_rate": 5.591130738798418e-05, "loss": 0.6686, "mean_token_accuracy": 0.7953696884214878, "num_tokens": 458886647.0, "step": 14377 }, { "entropy": 0.5280847074463964, "epoch": 1.322850357387249, "grad_norm": 0.14659735560417175, "learning_rate": 5.590824056184255e-05, "loss": 0.5228, "mean_token_accuracy": 0.8403030894696712, "num_tokens": 458918723.0, "step": 14378 }, { "entropy": 0.6814106609672308, "epoch": 1.3229423637586903, "grad_norm": 0.16366586089134216, "learning_rate": 5.590517373570092e-05, "loss": 0.6693, "mean_token_accuracy": 0.7994055785238743, "num_tokens": 458950664.0, "step": 14379 }, { "entropy": 0.566112233325839, "epoch": 1.3230343701301315, "grad_norm": 0.14978960156440735, "learning_rate": 5.5902106909559304e-05, "loss": 0.5411, "mean_token_accuracy": 0.8328451253473759, "num_tokens": 458983351.0, "step": 14380 }, { "entropy": 0.59717614389956, "epoch": 1.3231263765015728, "grad_norm": 0.15228575468063354, "learning_rate": 5.589904008341767e-05, "loss": 0.5742, "mean_token_accuracy": 0.8222027085721493, "num_tokens": 459015076.0, "step": 14381 }, { "entropy": 0.6230165036395192, "epoch": 1.323218382873014, "grad_norm": 0.15703518688678741, "learning_rate": 5.589597325727605e-05, "loss": 0.6094, "mean_token_accuracy": 0.8156979382038116, "num_tokens": 459047328.0, "step": 14382 }, { "entropy": 0.6772934158798307, "epoch": 1.323310389244455, "grad_norm": 0.16027435660362244, "learning_rate": 5.5892906431134415e-05, "loss": 0.6651, "mean_token_accuracy": 0.7999740764498711, "num_tokens": 459079621.0, "step": 14383 }, { "entropy": 0.5133299371227622, "epoch": 1.3234023956158965, "grad_norm": 0.15298408269882202, "learning_rate": 5.58898396049928e-05, "loss": 0.507, "mean_token_accuracy": 0.8469127751886845, "num_tokens": 459111642.0, "step": 14384 }, { "entropy": 0.6170206246897578, "epoch": 1.3234944019873376, "grad_norm": 0.1559583842754364, "learning_rate": 5.588677277885117e-05, "loss": 0.6162, "mean_token_accuracy": 0.8140238672494888, "num_tokens": 459144217.0, "step": 14385 }, { "entropy": 0.5723481103777885, "epoch": 1.323586408358779, "grad_norm": 0.16489177942276, "learning_rate": 5.588370595270954e-05, "loss": 0.5429, "mean_token_accuracy": 0.829243578016758, "num_tokens": 459175601.0, "step": 14386 }, { "entropy": 0.6228690817952156, "epoch": 1.32367841473022, "grad_norm": 0.16019825637340546, "learning_rate": 5.588063912656791e-05, "loss": 0.6074, "mean_token_accuracy": 0.8148720152676105, "num_tokens": 459207650.0, "step": 14387 }, { "entropy": 0.5373925948515534, "epoch": 1.3237704211016612, "grad_norm": 0.14708183705806732, "learning_rate": 5.5877572300426295e-05, "loss": 0.5238, "mean_token_accuracy": 0.8381722941994667, "num_tokens": 459239713.0, "step": 14388 }, { "entropy": 0.6607765341177583, "epoch": 1.3238624274731026, "grad_norm": 0.1702759712934494, "learning_rate": 5.587450547428467e-05, "loss": 0.6684, "mean_token_accuracy": 0.7986993119120598, "num_tokens": 459272481.0, "step": 14389 }, { "entropy": 0.6424854025244713, "epoch": 1.3239544338445437, "grad_norm": 0.1635957509279251, "learning_rate": 5.587143864814304e-05, "loss": 0.6442, "mean_token_accuracy": 0.8039128705859184, "num_tokens": 459304553.0, "step": 14390 }, { "entropy": 0.6172916367650032, "epoch": 1.324046440215985, "grad_norm": 0.15853829681873322, "learning_rate": 5.5868371822001405e-05, "loss": 0.62, "mean_token_accuracy": 0.8118678331375122, "num_tokens": 459336229.0, "step": 14391 }, { "entropy": 0.6250624638050795, "epoch": 1.3241384465874262, "grad_norm": 0.16248925030231476, "learning_rate": 5.586530499585979e-05, "loss": 0.6288, "mean_token_accuracy": 0.807981576770544, "num_tokens": 459367507.0, "step": 14392 }, { "entropy": 0.6397762093693018, "epoch": 1.3242304529588673, "grad_norm": 0.15870517492294312, "learning_rate": 5.586223816971816e-05, "loss": 0.6305, "mean_token_accuracy": 0.8033646456897259, "num_tokens": 459399499.0, "step": 14393 }, { "entropy": 0.633925125002861, "epoch": 1.3243224593303087, "grad_norm": 0.1602535992860794, "learning_rate": 5.5859171343576536e-05, "loss": 0.621, "mean_token_accuracy": 0.8079922161996365, "num_tokens": 459431405.0, "step": 14394 }, { "entropy": 0.6573430318385363, "epoch": 1.3244144657017498, "grad_norm": 0.16661801934242249, "learning_rate": 5.5856104517434904e-05, "loss": 0.647, "mean_token_accuracy": 0.8039291128516197, "num_tokens": 459462255.0, "step": 14395 }, { "entropy": 0.6493573468178511, "epoch": 1.3245064720731912, "grad_norm": 0.16173872351646423, "learning_rate": 5.5853037691293285e-05, "loss": 0.6394, "mean_token_accuracy": 0.8054585158824921, "num_tokens": 459494437.0, "step": 14396 }, { "entropy": 0.6575450375676155, "epoch": 1.3245984784446323, "grad_norm": 0.1578081101179123, "learning_rate": 5.584997086515166e-05, "loss": 0.6526, "mean_token_accuracy": 0.8044386468827724, "num_tokens": 459527095.0, "step": 14397 }, { "entropy": 0.658793032169342, "epoch": 1.3246904848160734, "grad_norm": 0.16694587469100952, "learning_rate": 5.584690403901003e-05, "loss": 0.6517, "mean_token_accuracy": 0.8013628832995892, "num_tokens": 459559621.0, "step": 14398 }, { "entropy": 0.6284939800389111, "epoch": 1.3247824911875148, "grad_norm": 0.15379516780376434, "learning_rate": 5.584383721286841e-05, "loss": 0.6107, "mean_token_accuracy": 0.8108744211494923, "num_tokens": 459591625.0, "step": 14399 }, { "entropy": 0.6941548511385918, "epoch": 1.324874497558956, "grad_norm": 0.15875262022018433, "learning_rate": 5.5840770386726784e-05, "loss": 0.681, "mean_token_accuracy": 0.7948163598775864, "num_tokens": 459623456.0, "step": 14400 }, { "entropy": 0.6646914444863796, "epoch": 1.3249665039303973, "grad_norm": 0.15719391405582428, "learning_rate": 5.583770356058515e-05, "loss": 0.6522, "mean_token_accuracy": 0.7997282445430756, "num_tokens": 459655816.0, "step": 14401 }, { "entropy": 0.5767603134736419, "epoch": 1.3250585103018384, "grad_norm": 0.1494196206331253, "learning_rate": 5.5834636734443526e-05, "loss": 0.5546, "mean_token_accuracy": 0.8300332985818386, "num_tokens": 459687938.0, "step": 14402 }, { "entropy": 0.6681399904191494, "epoch": 1.3251505166732795, "grad_norm": 0.1607617884874344, "learning_rate": 5.583156990830191e-05, "loss": 0.6452, "mean_token_accuracy": 0.7994741201400757, "num_tokens": 459719152.0, "step": 14403 }, { "entropy": 0.6097706696018577, "epoch": 1.325242523044721, "grad_norm": 0.1551206111907959, "learning_rate": 5.5828503082160276e-05, "loss": 0.5988, "mean_token_accuracy": 0.8187141008675098, "num_tokens": 459751198.0, "step": 14404 }, { "entropy": 0.6534766629338264, "epoch": 1.325334529416162, "grad_norm": 0.15588544309139252, "learning_rate": 5.582543625601865e-05, "loss": 0.6281, "mean_token_accuracy": 0.8058770783245564, "num_tokens": 459783579.0, "step": 14405 }, { "entropy": 0.5378757105208933, "epoch": 1.3254265357876034, "grad_norm": 0.15180708467960358, "learning_rate": 5.582236942987702e-05, "loss": 0.511, "mean_token_accuracy": 0.8402684293687344, "num_tokens": 459815526.0, "step": 14406 }, { "entropy": 0.59434406273067, "epoch": 1.3255185421590445, "grad_norm": 0.15083010494709015, "learning_rate": 5.58193026037354e-05, "loss": 0.5857, "mean_token_accuracy": 0.8195525594055653, "num_tokens": 459848062.0, "step": 14407 }, { "entropy": 0.7261941116303205, "epoch": 1.3256105485304857, "grad_norm": 0.1663103997707367, "learning_rate": 5.5816235777593774e-05, "loss": 0.7229, "mean_token_accuracy": 0.7814601548016071, "num_tokens": 459880339.0, "step": 14408 }, { "entropy": 0.5724414121359587, "epoch": 1.325702554901927, "grad_norm": 0.15267473459243774, "learning_rate": 5.581316895145214e-05, "loss": 0.5642, "mean_token_accuracy": 0.8258856907486916, "num_tokens": 459911963.0, "step": 14409 }, { "entropy": 0.626915168017149, "epoch": 1.3257945612733681, "grad_norm": 0.15889562666416168, "learning_rate": 5.581010212531052e-05, "loss": 0.6098, "mean_token_accuracy": 0.8120537586510181, "num_tokens": 459943649.0, "step": 14410 }, { "entropy": 0.6492106774821877, "epoch": 1.3258865676448095, "grad_norm": 0.16171565651893616, "learning_rate": 5.58070352991689e-05, "loss": 0.6305, "mean_token_accuracy": 0.8099975809454918, "num_tokens": 459975734.0, "step": 14411 }, { "entropy": 0.6456405306234956, "epoch": 1.3259785740162506, "grad_norm": 0.15692168474197388, "learning_rate": 5.5803968473027266e-05, "loss": 0.6421, "mean_token_accuracy": 0.8020241260528564, "num_tokens": 460007425.0, "step": 14412 }, { "entropy": 0.617704726755619, "epoch": 1.3260705803876918, "grad_norm": 0.16464699804782867, "learning_rate": 5.580090164688564e-05, "loss": 0.6149, "mean_token_accuracy": 0.816474799066782, "num_tokens": 460039469.0, "step": 14413 }, { "entropy": 0.47528793197125196, "epoch": 1.3261625867591331, "grad_norm": 0.1561247855424881, "learning_rate": 5.579783482074401e-05, "loss": 0.4581, "mean_token_accuracy": 0.8549025245010853, "num_tokens": 460071527.0, "step": 14414 }, { "entropy": 0.5752186542376876, "epoch": 1.3262545931305743, "grad_norm": 0.15093380212783813, "learning_rate": 5.579476799460239e-05, "loss": 0.5734, "mean_token_accuracy": 0.8211898282170296, "num_tokens": 460103050.0, "step": 14415 }, { "entropy": 0.6781531423330307, "epoch": 1.3263465995020156, "grad_norm": 0.16542522609233856, "learning_rate": 5.5791701168460765e-05, "loss": 0.6889, "mean_token_accuracy": 0.7914833687245846, "num_tokens": 460134376.0, "step": 14416 }, { "entropy": 0.6711187530308962, "epoch": 1.3264386058734567, "grad_norm": 0.16561399400234222, "learning_rate": 5.578863434231913e-05, "loss": 0.6823, "mean_token_accuracy": 0.7939467169344425, "num_tokens": 460166902.0, "step": 14417 }, { "entropy": 0.6828630566596985, "epoch": 1.3265306122448979, "grad_norm": 0.1723017394542694, "learning_rate": 5.578556751617751e-05, "loss": 0.7019, "mean_token_accuracy": 0.7918225638568401, "num_tokens": 460198293.0, "step": 14418 }, { "entropy": 0.6424890011548996, "epoch": 1.3266226186163392, "grad_norm": 0.16127683222293854, "learning_rate": 5.578250069003589e-05, "loss": 0.6088, "mean_token_accuracy": 0.8114796057343483, "num_tokens": 460229768.0, "step": 14419 }, { "entropy": 0.7425209414213896, "epoch": 1.3267146249877804, "grad_norm": 0.1649257093667984, "learning_rate": 5.5779433863894256e-05, "loss": 0.7327, "mean_token_accuracy": 0.7816731035709381, "num_tokens": 460261902.0, "step": 14420 }, { "entropy": 0.5408813608810306, "epoch": 1.3268066313592217, "grad_norm": 0.14734791219234467, "learning_rate": 5.577636703775263e-05, "loss": 0.5256, "mean_token_accuracy": 0.8374324180185795, "num_tokens": 460294054.0, "step": 14421 }, { "entropy": 0.6813992308452725, "epoch": 1.3268986377306629, "grad_norm": 0.1672595590353012, "learning_rate": 5.5773300211611e-05, "loss": 0.6692, "mean_token_accuracy": 0.7974129170179367, "num_tokens": 460325563.0, "step": 14422 }, { "entropy": 0.6582678570412099, "epoch": 1.326990644102104, "grad_norm": 0.16064846515655518, "learning_rate": 5.577023338546938e-05, "loss": 0.639, "mean_token_accuracy": 0.8024744465947151, "num_tokens": 460357250.0, "step": 14423 }, { "entropy": 0.6287343688309193, "epoch": 1.3270826504735453, "grad_norm": 0.15160737931728363, "learning_rate": 5.5767166559327755e-05, "loss": 0.6028, "mean_token_accuracy": 0.8114610202610493, "num_tokens": 460389020.0, "step": 14424 }, { "entropy": 0.698663083370775, "epoch": 1.3271746568449865, "grad_norm": 0.16202153265476227, "learning_rate": 5.576409973318612e-05, "loss": 0.6751, "mean_token_accuracy": 0.7973127290606499, "num_tokens": 460420262.0, "step": 14425 }, { "entropy": 0.5492636300623417, "epoch": 1.3272666632164278, "grad_norm": 0.15656423568725586, "learning_rate": 5.57610329070445e-05, "loss": 0.5248, "mean_token_accuracy": 0.8342520222067833, "num_tokens": 460451702.0, "step": 14426 }, { "entropy": 0.6750367991626263, "epoch": 1.327358669587869, "grad_norm": 0.1628343164920807, "learning_rate": 5.575796608090288e-05, "loss": 0.6623, "mean_token_accuracy": 0.7947282716631889, "num_tokens": 460483670.0, "step": 14427 }, { "entropy": 0.6993088088929653, "epoch": 1.32745067595931, "grad_norm": 0.16079898178577423, "learning_rate": 5.5754899254761254e-05, "loss": 0.6861, "mean_token_accuracy": 0.7942884564399719, "num_tokens": 460515689.0, "step": 14428 }, { "entropy": 0.6636185962706804, "epoch": 1.3275426823307515, "grad_norm": 0.16250838339328766, "learning_rate": 5.575183242861962e-05, "loss": 0.6581, "mean_token_accuracy": 0.8013267479836941, "num_tokens": 460547710.0, "step": 14429 }, { "entropy": 0.5961956726387143, "epoch": 1.3276346887021926, "grad_norm": 0.1525125950574875, "learning_rate": 5.5748765602478e-05, "loss": 0.5868, "mean_token_accuracy": 0.822100818157196, "num_tokens": 460580330.0, "step": 14430 }, { "entropy": 0.6171290073543787, "epoch": 1.327726695073634, "grad_norm": 0.16771191358566284, "learning_rate": 5.574569877633638e-05, "loss": 0.6104, "mean_token_accuracy": 0.812702689319849, "num_tokens": 460611284.0, "step": 14431 }, { "entropy": 0.5122120650485158, "epoch": 1.327818701445075, "grad_norm": 0.1463739275932312, "learning_rate": 5.5742631950194745e-05, "loss": 0.4882, "mean_token_accuracy": 0.84395382553339, "num_tokens": 460643003.0, "step": 14432 }, { "entropy": 0.606245880946517, "epoch": 1.3279107078165162, "grad_norm": 0.16034665703773499, "learning_rate": 5.573956512405312e-05, "loss": 0.6068, "mean_token_accuracy": 0.8176310174167156, "num_tokens": 460674499.0, "step": 14433 }, { "entropy": 0.6605525137856603, "epoch": 1.3280027141879576, "grad_norm": 0.16369497776031494, "learning_rate": 5.57364982979115e-05, "loss": 0.6528, "mean_token_accuracy": 0.8003305457532406, "num_tokens": 460706410.0, "step": 14434 }, { "entropy": 0.5766303054988384, "epoch": 1.3280947205593987, "grad_norm": 0.15774571895599365, "learning_rate": 5.573343147176987e-05, "loss": 0.5654, "mean_token_accuracy": 0.825241357088089, "num_tokens": 460737765.0, "step": 14435 }, { "entropy": 0.5641635740175843, "epoch": 1.32818672693084, "grad_norm": 0.15275906026363373, "learning_rate": 5.5730364645628244e-05, "loss": 0.5318, "mean_token_accuracy": 0.8334121853113174, "num_tokens": 460769336.0, "step": 14436 }, { "entropy": 0.6066486574709415, "epoch": 1.3282787333022812, "grad_norm": 0.15734966099262238, "learning_rate": 5.572729781948661e-05, "loss": 0.5997, "mean_token_accuracy": 0.8189746923744678, "num_tokens": 460801056.0, "step": 14437 }, { "entropy": 0.7099963333457708, "epoch": 1.3283707396737223, "grad_norm": 0.16541391611099243, "learning_rate": 5.572423099334499e-05, "loss": 0.7002, "mean_token_accuracy": 0.7862544395029545, "num_tokens": 460832964.0, "step": 14438 }, { "entropy": 0.7050770437344909, "epoch": 1.3284627460451637, "grad_norm": 0.17275448143482208, "learning_rate": 5.572116416720337e-05, "loss": 0.6909, "mean_token_accuracy": 0.7922174781560898, "num_tokens": 460864830.0, "step": 14439 }, { "entropy": 0.6921308394521475, "epoch": 1.3285547524166048, "grad_norm": 0.16066651046276093, "learning_rate": 5.5718097341061736e-05, "loss": 0.6867, "mean_token_accuracy": 0.7881753630936146, "num_tokens": 460896298.0, "step": 14440 }, { "entropy": 0.6267073191702366, "epoch": 1.3286467587880462, "grad_norm": 0.1631920337677002, "learning_rate": 5.571503051492011e-05, "loss": 0.6248, "mean_token_accuracy": 0.8081871867179871, "num_tokens": 460928396.0, "step": 14441 }, { "entropy": 0.5448039937764406, "epoch": 1.3287387651594873, "grad_norm": 0.15291529893875122, "learning_rate": 5.571196368877849e-05, "loss": 0.5254, "mean_token_accuracy": 0.8400403000414371, "num_tokens": 460961164.0, "step": 14442 }, { "entropy": 0.49508774280548096, "epoch": 1.3288307715309284, "grad_norm": 0.1550692468881607, "learning_rate": 5.570889686263686e-05, "loss": 0.4773, "mean_token_accuracy": 0.8536647036671638, "num_tokens": 460993392.0, "step": 14443 }, { "entropy": 0.6137406472116709, "epoch": 1.3289227779023698, "grad_norm": 0.15946398675441742, "learning_rate": 5.5705830036495234e-05, "loss": 0.6035, "mean_token_accuracy": 0.8140948414802551, "num_tokens": 461025310.0, "step": 14444 }, { "entropy": 0.5784679409116507, "epoch": 1.329014784273811, "grad_norm": 0.1549598127603531, "learning_rate": 5.57027632103536e-05, "loss": 0.563, "mean_token_accuracy": 0.8233480341732502, "num_tokens": 461056879.0, "step": 14445 }, { "entropy": 0.6583687299862504, "epoch": 1.3291067906452523, "grad_norm": 0.16308079659938812, "learning_rate": 5.5699696384211984e-05, "loss": 0.6408, "mean_token_accuracy": 0.8037627674639225, "num_tokens": 461088514.0, "step": 14446 }, { "entropy": 0.5869943741708994, "epoch": 1.3291987970166934, "grad_norm": 0.1546449363231659, "learning_rate": 5.569662955807036e-05, "loss": 0.5719, "mean_token_accuracy": 0.8244005143642426, "num_tokens": 461120312.0, "step": 14447 }, { "entropy": 0.6684396136552095, "epoch": 1.3292908033881345, "grad_norm": 0.1663816124200821, "learning_rate": 5.5693562731928726e-05, "loss": 0.6557, "mean_token_accuracy": 0.8016509413719177, "num_tokens": 461152085.0, "step": 14448 }, { "entropy": 0.6190246804617345, "epoch": 1.329382809759576, "grad_norm": 0.1533937156200409, "learning_rate": 5.56904959057871e-05, "loss": 0.5893, "mean_token_accuracy": 0.8177538476884365, "num_tokens": 461183659.0, "step": 14449 }, { "entropy": 0.7259950041770935, "epoch": 1.329474816131017, "grad_norm": 0.1707986295223236, "learning_rate": 5.568742907964548e-05, "loss": 0.7187, "mean_token_accuracy": 0.7821751162409782, "num_tokens": 461214563.0, "step": 14450 }, { "entropy": 0.5722694611176848, "epoch": 1.3295668225024584, "grad_norm": 0.16510488092899323, "learning_rate": 5.568436225350385e-05, "loss": 0.5687, "mean_token_accuracy": 0.8256399482488632, "num_tokens": 461246006.0, "step": 14451 }, { "entropy": 0.682668985798955, "epoch": 1.3296588288738995, "grad_norm": 0.15967994928359985, "learning_rate": 5.5681295427362225e-05, "loss": 0.6856, "mean_token_accuracy": 0.7885411940515041, "num_tokens": 461277601.0, "step": 14452 }, { "entropy": 0.5146767194382846, "epoch": 1.3297508352453407, "grad_norm": 0.1451113075017929, "learning_rate": 5.567822860122059e-05, "loss": 0.4956, "mean_token_accuracy": 0.8471417762339115, "num_tokens": 461309730.0, "step": 14453 }, { "entropy": 0.6888346839696169, "epoch": 1.329842841616782, "grad_norm": 0.1620924472808838, "learning_rate": 5.5675161775078974e-05, "loss": 0.6742, "mean_token_accuracy": 0.7924071662127972, "num_tokens": 461342121.0, "step": 14454 }, { "entropy": 0.619576083496213, "epoch": 1.3299348479882231, "grad_norm": 0.1688697785139084, "learning_rate": 5.567209494893735e-05, "loss": 0.6037, "mean_token_accuracy": 0.8161693774163723, "num_tokens": 461372914.0, "step": 14455 }, { "entropy": 0.5211191773414612, "epoch": 1.3300268543596645, "grad_norm": 0.1567046344280243, "learning_rate": 5.5669028122795717e-05, "loss": 0.5129, "mean_token_accuracy": 0.8412358090281487, "num_tokens": 461404211.0, "step": 14456 }, { "entropy": 0.7144050598144531, "epoch": 1.3301188607311056, "grad_norm": 0.16884495317935944, "learning_rate": 5.566596129665409e-05, "loss": 0.7013, "mean_token_accuracy": 0.7897385954856873, "num_tokens": 461435741.0, "step": 14457 }, { "entropy": 0.7168893674388528, "epoch": 1.3302108671025468, "grad_norm": 0.15991592407226562, "learning_rate": 5.566289447051247e-05, "loss": 0.709, "mean_token_accuracy": 0.7851334437727928, "num_tokens": 461467869.0, "step": 14458 }, { "entropy": 0.7603101190179586, "epoch": 1.3303028734739881, "grad_norm": 0.16614781320095062, "learning_rate": 5.565982764437084e-05, "loss": 0.7531, "mean_token_accuracy": 0.7684352956712246, "num_tokens": 461499981.0, "step": 14459 }, { "entropy": 0.5894179432652891, "epoch": 1.3303948798454293, "grad_norm": 0.1519666314125061, "learning_rate": 5.5656760818229215e-05, "loss": 0.5724, "mean_token_accuracy": 0.8249103128910065, "num_tokens": 461531146.0, "step": 14460 }, { "entropy": 0.5530823022127151, "epoch": 1.3304868862168706, "grad_norm": 0.1586655229330063, "learning_rate": 5.5653693992087597e-05, "loss": 0.5368, "mean_token_accuracy": 0.8340612575411797, "num_tokens": 461563319.0, "step": 14461 }, { "entropy": 0.6339332554489374, "epoch": 1.3305788925883117, "grad_norm": 0.1618899703025818, "learning_rate": 5.5650627165945964e-05, "loss": 0.6243, "mean_token_accuracy": 0.8109728693962097, "num_tokens": 461594923.0, "step": 14462 }, { "entropy": 0.5953389769420028, "epoch": 1.3306708989597529, "grad_norm": 0.16330543160438538, "learning_rate": 5.564756033980434e-05, "loss": 0.5926, "mean_token_accuracy": 0.8188716545701027, "num_tokens": 461627394.0, "step": 14463 }, { "entropy": 0.5861460650339723, "epoch": 1.3307629053311942, "grad_norm": 0.159479558467865, "learning_rate": 5.564449351366271e-05, "loss": 0.5752, "mean_token_accuracy": 0.8190908171236515, "num_tokens": 461659218.0, "step": 14464 }, { "entropy": 0.6727364799007773, "epoch": 1.3308549117026354, "grad_norm": 0.16203093528747559, "learning_rate": 5.5641426687521095e-05, "loss": 0.6702, "mean_token_accuracy": 0.7954865097999573, "num_tokens": 461690454.0, "step": 14465 }, { "entropy": 0.6202947106212378, "epoch": 1.3309469180740767, "grad_norm": 0.1587403118610382, "learning_rate": 5.563835986137946e-05, "loss": 0.6128, "mean_token_accuracy": 0.8149010948836803, "num_tokens": 461722453.0, "step": 14466 }, { "entropy": 0.5164048979058862, "epoch": 1.3310389244455179, "grad_norm": 0.15850290656089783, "learning_rate": 5.563529303523783e-05, "loss": 0.49, "mean_token_accuracy": 0.8505431041121483, "num_tokens": 461754217.0, "step": 14467 }, { "entropy": 0.5119165503419936, "epoch": 1.331130930816959, "grad_norm": 0.15416565537452698, "learning_rate": 5.5632226209096206e-05, "loss": 0.5103, "mean_token_accuracy": 0.8415441438555717, "num_tokens": 461785822.0, "step": 14468 }, { "entropy": 0.5909610288217664, "epoch": 1.3312229371884003, "grad_norm": 0.15963536500930786, "learning_rate": 5.562915938295459e-05, "loss": 0.572, "mean_token_accuracy": 0.8245884254574776, "num_tokens": 461817049.0, "step": 14469 }, { "entropy": 0.661874046549201, "epoch": 1.3313149435598415, "grad_norm": 0.16014961898326874, "learning_rate": 5.562609255681296e-05, "loss": 0.657, "mean_token_accuracy": 0.7991653829813004, "num_tokens": 461849442.0, "step": 14470 }, { "entropy": 0.6673479964956641, "epoch": 1.3314069499312828, "grad_norm": 0.17080937325954437, "learning_rate": 5.562302573067133e-05, "loss": 0.6666, "mean_token_accuracy": 0.80052350461483, "num_tokens": 461881361.0, "step": 14471 }, { "entropy": 0.636769587174058, "epoch": 1.331498956302724, "grad_norm": 0.16338513791561127, "learning_rate": 5.5619958904529704e-05, "loss": 0.6128, "mean_token_accuracy": 0.8123266994953156, "num_tokens": 461913576.0, "step": 14472 }, { "entropy": 0.5188631080091, "epoch": 1.331590962674165, "grad_norm": 0.1441473811864853, "learning_rate": 5.5616892078388086e-05, "loss": 0.5163, "mean_token_accuracy": 0.8402199223637581, "num_tokens": 461945589.0, "step": 14473 }, { "entropy": 0.5488900141790509, "epoch": 1.3316829690456065, "grad_norm": 0.15053440630435944, "learning_rate": 5.5613825252246453e-05, "loss": 0.5307, "mean_token_accuracy": 0.8358579874038696, "num_tokens": 461977728.0, "step": 14474 }, { "entropy": 0.6116762049496174, "epoch": 1.3317749754170476, "grad_norm": 0.16158118844032288, "learning_rate": 5.561075842610483e-05, "loss": 0.5945, "mean_token_accuracy": 0.8190388828516006, "num_tokens": 462008295.0, "step": 14475 }, { "entropy": 0.5926147224381566, "epoch": 1.331866981788489, "grad_norm": 0.15017668902873993, "learning_rate": 5.5607691599963196e-05, "loss": 0.5733, "mean_token_accuracy": 0.8228863961994648, "num_tokens": 462040051.0, "step": 14476 }, { "entropy": 0.6285447813570499, "epoch": 1.33195898815993, "grad_norm": 0.16286659240722656, "learning_rate": 5.560462477382158e-05, "loss": 0.6154, "mean_token_accuracy": 0.8122457712888718, "num_tokens": 462071854.0, "step": 14477 }, { "entropy": 0.673042168840766, "epoch": 1.3320509945313712, "grad_norm": 0.16430135071277618, "learning_rate": 5.560155794767995e-05, "loss": 0.6706, "mean_token_accuracy": 0.7964512668550014, "num_tokens": 462102893.0, "step": 14478 }, { "entropy": 0.7137251403182745, "epoch": 1.3321430009028126, "grad_norm": 0.16105203330516815, "learning_rate": 5.559849112153832e-05, "loss": 0.7104, "mean_token_accuracy": 0.7857039533555508, "num_tokens": 462134872.0, "step": 14479 }, { "entropy": 0.5134280119091272, "epoch": 1.3322350072742537, "grad_norm": 0.15558157861232758, "learning_rate": 5.5595424295396695e-05, "loss": 0.5031, "mean_token_accuracy": 0.8460186421871185, "num_tokens": 462167488.0, "step": 14480 }, { "entropy": 0.6328403512015939, "epoch": 1.332327013645695, "grad_norm": 0.1560143381357193, "learning_rate": 5.5592357469255076e-05, "loss": 0.6078, "mean_token_accuracy": 0.8139887638390064, "num_tokens": 462199186.0, "step": 14481 }, { "entropy": 0.5997415482997894, "epoch": 1.3324190200171362, "grad_norm": 0.1588798612356186, "learning_rate": 5.5589290643113444e-05, "loss": 0.5847, "mean_token_accuracy": 0.8238187246024609, "num_tokens": 462230773.0, "step": 14482 }, { "entropy": 0.6673230361193419, "epoch": 1.3325110263885773, "grad_norm": 0.15898524224758148, "learning_rate": 5.558622381697182e-05, "loss": 0.6626, "mean_token_accuracy": 0.7983726672828197, "num_tokens": 462263106.0, "step": 14483 }, { "entropy": 0.5720591540448368, "epoch": 1.3326030327600187, "grad_norm": 0.1622304469347, "learning_rate": 5.5583156990830186e-05, "loss": 0.5555, "mean_token_accuracy": 0.8272851929068565, "num_tokens": 462295216.0, "step": 14484 }, { "entropy": 0.5955195524729788, "epoch": 1.3326950391314598, "grad_norm": 0.1541413962841034, "learning_rate": 5.558009016468857e-05, "loss": 0.5911, "mean_token_accuracy": 0.8196911029517651, "num_tokens": 462327904.0, "step": 14485 }, { "entropy": 0.6134832929819822, "epoch": 1.3327870455029012, "grad_norm": 0.16127507388591766, "learning_rate": 5.557702333854694e-05, "loss": 0.6064, "mean_token_accuracy": 0.8137442022562027, "num_tokens": 462359619.0, "step": 14486 }, { "entropy": 0.6843208223581314, "epoch": 1.3328790518743423, "grad_norm": 0.17040786147117615, "learning_rate": 5.557395651240531e-05, "loss": 0.6765, "mean_token_accuracy": 0.7969470173120499, "num_tokens": 462391108.0, "step": 14487 }, { "entropy": 0.6187680028378963, "epoch": 1.3329710582457834, "grad_norm": 0.1600627601146698, "learning_rate": 5.5570889686263685e-05, "loss": 0.615, "mean_token_accuracy": 0.8143176846206188, "num_tokens": 462422892.0, "step": 14488 }, { "entropy": 0.6752285901457071, "epoch": 1.3330630646172248, "grad_norm": 0.15730254352092743, "learning_rate": 5.5567822860122066e-05, "loss": 0.6727, "mean_token_accuracy": 0.7963389903306961, "num_tokens": 462454111.0, "step": 14489 }, { "entropy": 0.5532999541610479, "epoch": 1.333155070988666, "grad_norm": 0.15004472434520721, "learning_rate": 5.5564756033980434e-05, "loss": 0.5392, "mean_token_accuracy": 0.8370266258716583, "num_tokens": 462486104.0, "step": 14490 }, { "entropy": 0.6694894647225738, "epoch": 1.3332470773601073, "grad_norm": 0.158040851354599, "learning_rate": 5.556168920783881e-05, "loss": 0.6602, "mean_token_accuracy": 0.8000914789736271, "num_tokens": 462517349.0, "step": 14491 }, { "entropy": 0.6493754778057337, "epoch": 1.3333390837315484, "grad_norm": 0.1536777913570404, "learning_rate": 5.555862238169719e-05, "loss": 0.6437, "mean_token_accuracy": 0.8007073178887367, "num_tokens": 462548858.0, "step": 14492 }, { "entropy": 0.6397463399916887, "epoch": 1.3334310901029895, "grad_norm": 0.15449485182762146, "learning_rate": 5.555555555555556e-05, "loss": 0.6195, "mean_token_accuracy": 0.8074741996824741, "num_tokens": 462580817.0, "step": 14493 }, { "entropy": 0.7836001552641392, "epoch": 1.333523096474431, "grad_norm": 0.17196066677570343, "learning_rate": 5.555248872941393e-05, "loss": 0.7719, "mean_token_accuracy": 0.7697333246469498, "num_tokens": 462612728.0, "step": 14494 }, { "entropy": 0.6858805567026138, "epoch": 1.333615102845872, "grad_norm": 0.16154010593891144, "learning_rate": 5.55494219032723e-05, "loss": 0.6779, "mean_token_accuracy": 0.7937280237674713, "num_tokens": 462644760.0, "step": 14495 }, { "entropy": 0.6095299478620291, "epoch": 1.3337071092173134, "grad_norm": 0.15858638286590576, "learning_rate": 5.554635507713068e-05, "loss": 0.602, "mean_token_accuracy": 0.8176052868366241, "num_tokens": 462676372.0, "step": 14496 }, { "entropy": 0.6711037252098322, "epoch": 1.3337991155887545, "grad_norm": 0.15971364080905914, "learning_rate": 5.554328825098906e-05, "loss": 0.6585, "mean_token_accuracy": 0.800826471298933, "num_tokens": 462708375.0, "step": 14497 }, { "entropy": 0.6848444733768702, "epoch": 1.3338911219601957, "grad_norm": 0.17365069687366486, "learning_rate": 5.5540221424847425e-05, "loss": 0.6848, "mean_token_accuracy": 0.7917322292923927, "num_tokens": 462740233.0, "step": 14498 }, { "entropy": 0.6031951326876879, "epoch": 1.333983128331637, "grad_norm": 0.16421687602996826, "learning_rate": 5.55371545987058e-05, "loss": 0.5922, "mean_token_accuracy": 0.8190814070403576, "num_tokens": 462771448.0, "step": 14499 }, { "entropy": 0.5894454447552562, "epoch": 1.3340751347030781, "grad_norm": 0.1540152132511139, "learning_rate": 5.553408777256418e-05, "loss": 0.594, "mean_token_accuracy": 0.8181961216032505, "num_tokens": 462803574.0, "step": 14500 }, { "entropy": 0.6360881039872766, "epoch": 1.3341671410745195, "grad_norm": 0.15049052238464355, "learning_rate": 5.553102094642255e-05, "loss": 0.6126, "mean_token_accuracy": 0.8137758485972881, "num_tokens": 462835957.0, "step": 14501 }, { "entropy": 0.6290986426174641, "epoch": 1.3342591474459606, "grad_norm": 0.16181840002536774, "learning_rate": 5.552795412028092e-05, "loss": 0.6083, "mean_token_accuracy": 0.8145762756466866, "num_tokens": 462867030.0, "step": 14502 }, { "entropy": 0.6494290381669998, "epoch": 1.3343511538174018, "grad_norm": 0.15928548574447632, "learning_rate": 5.552488729413929e-05, "loss": 0.6466, "mean_token_accuracy": 0.8031244352459908, "num_tokens": 462899279.0, "step": 14503 }, { "entropy": 0.7369049284607172, "epoch": 1.3344431601888431, "grad_norm": 0.1641530841588974, "learning_rate": 5.552182046799768e-05, "loss": 0.7149, "mean_token_accuracy": 0.782608225941658, "num_tokens": 462930603.0, "step": 14504 }, { "entropy": 0.6967377532273531, "epoch": 1.3345351665602843, "grad_norm": 0.1608887016773224, "learning_rate": 5.551875364185605e-05, "loss": 0.6844, "mean_token_accuracy": 0.7963503561913967, "num_tokens": 462962545.0, "step": 14505 }, { "entropy": 0.6717738704755902, "epoch": 1.3346271729317256, "grad_norm": 0.15919406712055206, "learning_rate": 5.5515686815714415e-05, "loss": 0.6551, "mean_token_accuracy": 0.799633365124464, "num_tokens": 462995016.0, "step": 14506 }, { "entropy": 0.641620023176074, "epoch": 1.3347191793031667, "grad_norm": 0.1620682179927826, "learning_rate": 5.551261998957279e-05, "loss": 0.623, "mean_token_accuracy": 0.8119829371571541, "num_tokens": 463026194.0, "step": 14507 }, { "entropy": 0.6757025634869933, "epoch": 1.3348111856746079, "grad_norm": 0.15948815643787384, "learning_rate": 5.550955316343117e-05, "loss": 0.6592, "mean_token_accuracy": 0.7937206476926804, "num_tokens": 463057909.0, "step": 14508 }, { "entropy": 0.6299752052873373, "epoch": 1.3349031920460492, "grad_norm": 0.16082598268985748, "learning_rate": 5.5506486337289546e-05, "loss": 0.6163, "mean_token_accuracy": 0.8121503740549088, "num_tokens": 463089979.0, "step": 14509 }, { "entropy": 0.6402903189882636, "epoch": 1.3349951984174904, "grad_norm": 0.1633899062871933, "learning_rate": 5.5503419511147914e-05, "loss": 0.6217, "mean_token_accuracy": 0.81116558983922, "num_tokens": 463120643.0, "step": 14510 }, { "entropy": 0.6180581916123629, "epoch": 1.3350872047889317, "grad_norm": 0.15351803600788116, "learning_rate": 5.550035268500628e-05, "loss": 0.6139, "mean_token_accuracy": 0.8081353195011616, "num_tokens": 463153033.0, "step": 14511 }, { "entropy": 0.7047320483252406, "epoch": 1.3351792111603729, "grad_norm": 0.16007296741008759, "learning_rate": 5.549728585886467e-05, "loss": 0.6994, "mean_token_accuracy": 0.7835200503468513, "num_tokens": 463184799.0, "step": 14512 }, { "entropy": 0.6117585063911974, "epoch": 1.335271217531814, "grad_norm": 0.1537911295890808, "learning_rate": 5.549421903272304e-05, "loss": 0.594, "mean_token_accuracy": 0.817797165364027, "num_tokens": 463216693.0, "step": 14513 }, { "entropy": 0.6530936295166612, "epoch": 1.3353632239032553, "grad_norm": 0.1602376103401184, "learning_rate": 5.549115220658141e-05, "loss": 0.6341, "mean_token_accuracy": 0.8057854436337948, "num_tokens": 463247809.0, "step": 14514 }, { "entropy": 0.6446726247668266, "epoch": 1.3354552302746965, "grad_norm": 0.16163085401058197, "learning_rate": 5.548808538043978e-05, "loss": 0.6315, "mean_token_accuracy": 0.8063433468341827, "num_tokens": 463279172.0, "step": 14515 }, { "entropy": 0.6729410933330655, "epoch": 1.3355472366461378, "grad_norm": 0.1781492680311203, "learning_rate": 5.548501855429816e-05, "loss": 0.6783, "mean_token_accuracy": 0.7986119315028191, "num_tokens": 463310922.0, "step": 14516 }, { "entropy": 0.6343136439099908, "epoch": 1.335639243017579, "grad_norm": 0.1680612862110138, "learning_rate": 5.5481951728156536e-05, "loss": 0.6253, "mean_token_accuracy": 0.8129147104918957, "num_tokens": 463343263.0, "step": 14517 }, { "entropy": 0.6402264758944511, "epoch": 1.33573124938902, "grad_norm": 0.16779464483261108, "learning_rate": 5.5478884902014904e-05, "loss": 0.6459, "mean_token_accuracy": 0.8091515935957432, "num_tokens": 463374427.0, "step": 14518 }, { "entropy": 0.5483184857293963, "epoch": 1.3358232557604615, "grad_norm": 0.14806325733661652, "learning_rate": 5.547581807587328e-05, "loss": 0.5456, "mean_token_accuracy": 0.8322589732706547, "num_tokens": 463406788.0, "step": 14519 }, { "entropy": 0.6829013302922249, "epoch": 1.3359152621319026, "grad_norm": 0.16870738565921783, "learning_rate": 5.547275124973166e-05, "loss": 0.6737, "mean_token_accuracy": 0.7906236983835697, "num_tokens": 463436750.0, "step": 14520 }, { "entropy": 0.6418870575726032, "epoch": 1.336007268503344, "grad_norm": 0.15791675448417664, "learning_rate": 5.546968442359003e-05, "loss": 0.6388, "mean_token_accuracy": 0.8005970530211926, "num_tokens": 463468146.0, "step": 14521 }, { "entropy": 0.5992852225899696, "epoch": 1.336099274874785, "grad_norm": 0.157169371843338, "learning_rate": 5.54666175974484e-05, "loss": 0.5903, "mean_token_accuracy": 0.8155548833310604, "num_tokens": 463499757.0, "step": 14522 }, { "entropy": 0.6656354637816548, "epoch": 1.3361912812462262, "grad_norm": 0.1596848964691162, "learning_rate": 5.5463550771306784e-05, "loss": 0.6571, "mean_token_accuracy": 0.7979285418987274, "num_tokens": 463531572.0, "step": 14523 }, { "entropy": 0.6332176476716995, "epoch": 1.3362832876176676, "grad_norm": 0.15477055311203003, "learning_rate": 5.546048394516515e-05, "loss": 0.6181, "mean_token_accuracy": 0.8092262297868729, "num_tokens": 463562994.0, "step": 14524 }, { "entropy": 0.6398006700910628, "epoch": 1.3363752939891087, "grad_norm": 0.15768498182296753, "learning_rate": 5.5457417119023527e-05, "loss": 0.6197, "mean_token_accuracy": 0.808952983468771, "num_tokens": 463594147.0, "step": 14525 }, { "entropy": 0.6252258755266666, "epoch": 1.33646730036055, "grad_norm": 0.15696139633655548, "learning_rate": 5.5454350292881894e-05, "loss": 0.5962, "mean_token_accuracy": 0.8203690126538277, "num_tokens": 463624778.0, "step": 14526 }, { "entropy": 0.6572722587734461, "epoch": 1.3365593067319912, "grad_norm": 0.1586192399263382, "learning_rate": 5.5451283466740276e-05, "loss": 0.6371, "mean_token_accuracy": 0.8048565573990345, "num_tokens": 463656439.0, "step": 14527 }, { "entropy": 0.5788278393447399, "epoch": 1.3366513131034323, "grad_norm": 0.1538158655166626, "learning_rate": 5.544821664059865e-05, "loss": 0.5529, "mean_token_accuracy": 0.8302943371236324, "num_tokens": 463687365.0, "step": 14528 }, { "entropy": 0.5391317801550031, "epoch": 1.3367433194748737, "grad_norm": 0.15243756771087646, "learning_rate": 5.544514981445702e-05, "loss": 0.5132, "mean_token_accuracy": 0.8379557803273201, "num_tokens": 463718409.0, "step": 14529 }, { "entropy": 0.5386734805069864, "epoch": 1.3368353258463148, "grad_norm": 0.15356312692165375, "learning_rate": 5.544208298831539e-05, "loss": 0.5318, "mean_token_accuracy": 0.8402892760932446, "num_tokens": 463750080.0, "step": 14530 }, { "entropy": 0.6117658410221338, "epoch": 1.3369273322177562, "grad_norm": 0.1511985808610916, "learning_rate": 5.5439016162173774e-05, "loss": 0.5991, "mean_token_accuracy": 0.8136431090533733, "num_tokens": 463781321.0, "step": 14531 }, { "entropy": 0.5996205396950245, "epoch": 1.3370193385891973, "grad_norm": 0.1517624706029892, "learning_rate": 5.543594933603214e-05, "loss": 0.5971, "mean_token_accuracy": 0.8153595328330994, "num_tokens": 463812882.0, "step": 14532 }, { "entropy": 0.6680297162383795, "epoch": 1.3371113449606384, "grad_norm": 0.1574474424123764, "learning_rate": 5.543288250989052e-05, "loss": 0.6467, "mean_token_accuracy": 0.8033435344696045, "num_tokens": 463845098.0, "step": 14533 }, { "entropy": 0.6684643309563398, "epoch": 1.3372033513320798, "grad_norm": 0.15636394917964935, "learning_rate": 5.5429815683748885e-05, "loss": 0.6522, "mean_token_accuracy": 0.8011781759560108, "num_tokens": 463876258.0, "step": 14534 }, { "entropy": 0.5173950409516692, "epoch": 1.337295357703521, "grad_norm": 0.15349243581295013, "learning_rate": 5.5426748857607266e-05, "loss": 0.5071, "mean_token_accuracy": 0.8405390381813049, "num_tokens": 463908342.0, "step": 14535 }, { "entropy": 0.7038077376782894, "epoch": 1.3373873640749623, "grad_norm": 0.1577114760875702, "learning_rate": 5.542368203146564e-05, "loss": 0.6935, "mean_token_accuracy": 0.7887147478759289, "num_tokens": 463940903.0, "step": 14536 }, { "entropy": 0.499802484177053, "epoch": 1.3374793704464034, "grad_norm": 0.14055611193180084, "learning_rate": 5.542061520532401e-05, "loss": 0.5013, "mean_token_accuracy": 0.8412703387439251, "num_tokens": 463973393.0, "step": 14537 }, { "entropy": 0.5999884186312556, "epoch": 1.3375713768178445, "grad_norm": 0.15264470875263214, "learning_rate": 5.5417548379182383e-05, "loss": 0.5972, "mean_token_accuracy": 0.8167230114340782, "num_tokens": 464005316.0, "step": 14538 }, { "entropy": 0.5919666290283203, "epoch": 1.337663383189286, "grad_norm": 0.158732071518898, "learning_rate": 5.5414481553040765e-05, "loss": 0.5811, "mean_token_accuracy": 0.8177611492574215, "num_tokens": 464037118.0, "step": 14539 }, { "entropy": 0.648607874289155, "epoch": 1.337755389560727, "grad_norm": 0.15741997957229614, "learning_rate": 5.541141472689913e-05, "loss": 0.6554, "mean_token_accuracy": 0.8007791414856911, "num_tokens": 464069384.0, "step": 14540 }, { "entropy": 0.5642108004540205, "epoch": 1.3378473959321684, "grad_norm": 0.1607840657234192, "learning_rate": 5.540834790075751e-05, "loss": 0.5618, "mean_token_accuracy": 0.8280154317617416, "num_tokens": 464099533.0, "step": 14541 }, { "entropy": 0.6239833664149046, "epoch": 1.3379394023036095, "grad_norm": 0.15763011574745178, "learning_rate": 5.5405281074615875e-05, "loss": 0.6295, "mean_token_accuracy": 0.8074835054576397, "num_tokens": 464131699.0, "step": 14542 }, { "entropy": 0.6520706377923489, "epoch": 1.3380314086750507, "grad_norm": 0.15913838148117065, "learning_rate": 5.5402214248474263e-05, "loss": 0.66, "mean_token_accuracy": 0.8002638109028339, "num_tokens": 464163897.0, "step": 14543 }, { "entropy": 0.5036133551038802, "epoch": 1.338123415046492, "grad_norm": 0.1403285264968872, "learning_rate": 5.539914742233263e-05, "loss": 0.4967, "mean_token_accuracy": 0.8445331081748009, "num_tokens": 464196116.0, "step": 14544 }, { "entropy": 0.5818773526698351, "epoch": 1.3382154214179331, "grad_norm": 0.1541047990322113, "learning_rate": 5.5396080596191e-05, "loss": 0.573, "mean_token_accuracy": 0.8213014826178551, "num_tokens": 464228418.0, "step": 14545 }, { "entropy": 0.649690642952919, "epoch": 1.3383074277893745, "grad_norm": 0.16517971456050873, "learning_rate": 5.5393013770049374e-05, "loss": 0.644, "mean_token_accuracy": 0.8022758550941944, "num_tokens": 464259943.0, "step": 14546 }, { "entropy": 0.6043940568342805, "epoch": 1.3383994341608156, "grad_norm": 0.15949736535549164, "learning_rate": 5.5389946943907755e-05, "loss": 0.5966, "mean_token_accuracy": 0.8135321512818336, "num_tokens": 464291394.0, "step": 14547 }, { "entropy": 0.7651250809431076, "epoch": 1.3384914405322568, "grad_norm": 0.16495446860790253, "learning_rate": 5.538688011776613e-05, "loss": 0.7792, "mean_token_accuracy": 0.7669337466359138, "num_tokens": 464323773.0, "step": 14548 }, { "entropy": 0.4834187775850296, "epoch": 1.3385834469036981, "grad_norm": 0.15762147307395935, "learning_rate": 5.53838132916245e-05, "loss": 0.4679, "mean_token_accuracy": 0.8582226559519768, "num_tokens": 464355570.0, "step": 14549 }, { "entropy": 0.6871478129178286, "epoch": 1.3386754532751393, "grad_norm": 0.16605214774608612, "learning_rate": 5.5380746465482866e-05, "loss": 0.6633, "mean_token_accuracy": 0.7966687977313995, "num_tokens": 464387691.0, "step": 14550 }, { "entropy": 0.6444044420495629, "epoch": 1.3387674596465806, "grad_norm": 0.16704414784908295, "learning_rate": 5.5377679639341254e-05, "loss": 0.6328, "mean_token_accuracy": 0.8077816963195801, "num_tokens": 464419991.0, "step": 14551 }, { "entropy": 0.5813427995890379, "epoch": 1.3388594660180217, "grad_norm": 0.1573123335838318, "learning_rate": 5.537461281319962e-05, "loss": 0.5645, "mean_token_accuracy": 0.824774406850338, "num_tokens": 464452543.0, "step": 14552 }, { "entropy": 0.6403444651514292, "epoch": 1.3389514723894629, "grad_norm": 0.15794862806797028, "learning_rate": 5.5371545987057996e-05, "loss": 0.6227, "mean_token_accuracy": 0.8112939335405827, "num_tokens": 464484397.0, "step": 14553 }, { "entropy": 0.6809296244755387, "epoch": 1.3390434787609042, "grad_norm": 0.1627720296382904, "learning_rate": 5.536847916091638e-05, "loss": 0.6477, "mean_token_accuracy": 0.8001640625298023, "num_tokens": 464516016.0, "step": 14554 }, { "entropy": 0.6830106414854527, "epoch": 1.3391354851323454, "grad_norm": 0.16273683309555054, "learning_rate": 5.5365412334774746e-05, "loss": 0.6743, "mean_token_accuracy": 0.7985956333577633, "num_tokens": 464547617.0, "step": 14555 }, { "entropy": 0.6194204576313496, "epoch": 1.3392274915037867, "grad_norm": 0.1635269820690155, "learning_rate": 5.536234550863312e-05, "loss": 0.6067, "mean_token_accuracy": 0.8139382600784302, "num_tokens": 464578499.0, "step": 14556 }, { "entropy": 0.5807373346760869, "epoch": 1.3393194978752279, "grad_norm": 0.15309756994247437, "learning_rate": 5.535927868249149e-05, "loss": 0.5578, "mean_token_accuracy": 0.827396247535944, "num_tokens": 464610099.0, "step": 14557 }, { "entropy": 0.6380708776414394, "epoch": 1.339411504246669, "grad_norm": 0.15712442994117737, "learning_rate": 5.535621185634987e-05, "loss": 0.6111, "mean_token_accuracy": 0.8166894093155861, "num_tokens": 464641667.0, "step": 14558 }, { "entropy": 0.6045759608969092, "epoch": 1.3395035106181103, "grad_norm": 0.15448640286922455, "learning_rate": 5.5353145030208244e-05, "loss": 0.5916, "mean_token_accuracy": 0.8178783282637596, "num_tokens": 464674156.0, "step": 14559 }, { "entropy": 0.5620197830721736, "epoch": 1.3395955169895515, "grad_norm": 0.14808781445026398, "learning_rate": 5.535007820406661e-05, "loss": 0.538, "mean_token_accuracy": 0.8321709632873535, "num_tokens": 464705811.0, "step": 14560 }, { "entropy": 0.5944844670593739, "epoch": 1.3396875233609928, "grad_norm": 0.15505889058113098, "learning_rate": 5.534701137792499e-05, "loss": 0.5755, "mean_token_accuracy": 0.8249280117452145, "num_tokens": 464738387.0, "step": 14561 }, { "entropy": 0.6739346450194716, "epoch": 1.339779529732434, "grad_norm": 0.1577652245759964, "learning_rate": 5.534394455178337e-05, "loss": 0.6572, "mean_token_accuracy": 0.800433773547411, "num_tokens": 464770047.0, "step": 14562 }, { "entropy": 0.5668320162221789, "epoch": 1.339871536103875, "grad_norm": 0.14977428317070007, "learning_rate": 5.5340877725641736e-05, "loss": 0.5567, "mean_token_accuracy": 0.8303255848586559, "num_tokens": 464802155.0, "step": 14563 }, { "entropy": 0.7234597317874432, "epoch": 1.3399635424753165, "grad_norm": 0.1631777137517929, "learning_rate": 5.533781089950011e-05, "loss": 0.72, "mean_token_accuracy": 0.7806147299706936, "num_tokens": 464833675.0, "step": 14564 }, { "entropy": 0.637717304751277, "epoch": 1.3400555488467576, "grad_norm": 0.16803409159183502, "learning_rate": 5.533474407335848e-05, "loss": 0.6409, "mean_token_accuracy": 0.8055274188518524, "num_tokens": 464865842.0, "step": 14565 }, { "entropy": 0.4560142168775201, "epoch": 1.340147555218199, "grad_norm": 0.14745397865772247, "learning_rate": 5.533167724721686e-05, "loss": 0.4433, "mean_token_accuracy": 0.8609347566962242, "num_tokens": 464898068.0, "step": 14566 }, { "entropy": 0.5780769279226661, "epoch": 1.34023956158964, "grad_norm": 0.15213695168495178, "learning_rate": 5.5328610421075235e-05, "loss": 0.563, "mean_token_accuracy": 0.8221845664083958, "num_tokens": 464929929.0, "step": 14567 }, { "entropy": 0.6855164337903261, "epoch": 1.3403315679610812, "grad_norm": 0.16909492015838623, "learning_rate": 5.53255435949336e-05, "loss": 0.6838, "mean_token_accuracy": 0.7947349883615971, "num_tokens": 464961280.0, "step": 14568 }, { "entropy": 0.5611421596258879, "epoch": 1.3404235743325226, "grad_norm": 0.14955830574035645, "learning_rate": 5.532247676879198e-05, "loss": 0.5459, "mean_token_accuracy": 0.83179135248065, "num_tokens": 464993317.0, "step": 14569 }, { "entropy": 0.6962741855531931, "epoch": 1.3405155807039637, "grad_norm": 0.1616121083498001, "learning_rate": 5.531940994265036e-05, "loss": 0.7087, "mean_token_accuracy": 0.7803705893456936, "num_tokens": 465025456.0, "step": 14570 }, { "entropy": 0.6991517578717321, "epoch": 1.340607587075405, "grad_norm": 0.16076508164405823, "learning_rate": 5.5316343116508727e-05, "loss": 0.6894, "mean_token_accuracy": 0.7940920256078243, "num_tokens": 465056827.0, "step": 14571 }, { "entropy": 0.5618357285857201, "epoch": 1.3406995934468462, "grad_norm": 0.14988335967063904, "learning_rate": 5.53132762903671e-05, "loss": 0.5392, "mean_token_accuracy": 0.8296152874827385, "num_tokens": 465088835.0, "step": 14572 }, { "entropy": 0.6929016630165279, "epoch": 1.3407915998182873, "grad_norm": 0.16353827714920044, "learning_rate": 5.531020946422547e-05, "loss": 0.6809, "mean_token_accuracy": 0.7925403788685799, "num_tokens": 465120382.0, "step": 14573 }, { "entropy": 0.5725655183196068, "epoch": 1.3408836061897287, "grad_norm": 0.15429267287254333, "learning_rate": 5.530714263808385e-05, "loss": 0.5604, "mean_token_accuracy": 0.8275073990225792, "num_tokens": 465152536.0, "step": 14574 }, { "entropy": 0.6500510480254889, "epoch": 1.3409756125611698, "grad_norm": 0.1566227823495865, "learning_rate": 5.5304075811942225e-05, "loss": 0.6384, "mean_token_accuracy": 0.8033285588026047, "num_tokens": 465184554.0, "step": 14575 }, { "entropy": 0.5723518179729581, "epoch": 1.3410676189326112, "grad_norm": 0.1669560968875885, "learning_rate": 5.530100898580059e-05, "loss": 0.5508, "mean_token_accuracy": 0.826117143034935, "num_tokens": 465216161.0, "step": 14576 }, { "entropy": 0.7537697143852711, "epoch": 1.3411596253040523, "grad_norm": 0.16875948011875153, "learning_rate": 5.529794215965897e-05, "loss": 0.7477, "mean_token_accuracy": 0.7744300253689289, "num_tokens": 465248294.0, "step": 14577 }, { "entropy": 0.5734994057565928, "epoch": 1.3412516316754934, "grad_norm": 0.1489192694425583, "learning_rate": 5.529487533351735e-05, "loss": 0.5603, "mean_token_accuracy": 0.8265109546482563, "num_tokens": 465280267.0, "step": 14578 }, { "entropy": 0.5230711624026299, "epoch": 1.3413436380469348, "grad_norm": 0.15730705857276917, "learning_rate": 5.529180850737572e-05, "loss": 0.5098, "mean_token_accuracy": 0.8412227220833302, "num_tokens": 465311671.0, "step": 14579 }, { "entropy": 0.6795086050406098, "epoch": 1.341435644418376, "grad_norm": 0.16927611827850342, "learning_rate": 5.528874168123409e-05, "loss": 0.6752, "mean_token_accuracy": 0.7963729649782181, "num_tokens": 465343585.0, "step": 14580 }, { "entropy": 0.6017687264829874, "epoch": 1.3415276507898173, "grad_norm": 0.15514343976974487, "learning_rate": 5.528567485509246e-05, "loss": 0.603, "mean_token_accuracy": 0.8183830827474594, "num_tokens": 465375728.0, "step": 14581 }, { "entropy": 0.655028460547328, "epoch": 1.3416196571612584, "grad_norm": 0.1631273329257965, "learning_rate": 5.528260802895084e-05, "loss": 0.6405, "mean_token_accuracy": 0.8073387406766415, "num_tokens": 465407939.0, "step": 14582 }, { "entropy": 0.6495299926027656, "epoch": 1.3417116635326995, "grad_norm": 0.1558968722820282, "learning_rate": 5.5279541202809216e-05, "loss": 0.6427, "mean_token_accuracy": 0.8012167401611805, "num_tokens": 465439610.0, "step": 14583 }, { "entropy": 0.6581801846623421, "epoch": 1.341803669904141, "grad_norm": 0.16964465379714966, "learning_rate": 5.527647437666758e-05, "loss": 0.6598, "mean_token_accuracy": 0.8025665953755379, "num_tokens": 465471275.0, "step": 14584 }, { "entropy": 0.5288279447704554, "epoch": 1.341895676275582, "grad_norm": 0.1486670970916748, "learning_rate": 5.527340755052597e-05, "loss": 0.5087, "mean_token_accuracy": 0.8452484905719757, "num_tokens": 465503345.0, "step": 14585 }, { "entropy": 0.6444483492523432, "epoch": 1.3419876826470234, "grad_norm": 0.16117922961711884, "learning_rate": 5.527034072438434e-05, "loss": 0.6317, "mean_token_accuracy": 0.8068473227322102, "num_tokens": 465533965.0, "step": 14586 }, { "entropy": 0.6738056652247906, "epoch": 1.3420796890184645, "grad_norm": 0.15860223770141602, "learning_rate": 5.5267273898242714e-05, "loss": 0.666, "mean_token_accuracy": 0.7969825305044651, "num_tokens": 465565885.0, "step": 14587 }, { "entropy": 0.5808619577437639, "epoch": 1.3421716953899057, "grad_norm": 0.1490841954946518, "learning_rate": 5.526420707210108e-05, "loss": 0.5802, "mean_token_accuracy": 0.8183219060301781, "num_tokens": 465598327.0, "step": 14588 }, { "entropy": 0.7039571180939674, "epoch": 1.342263701761347, "grad_norm": 0.1641073226928711, "learning_rate": 5.5261140245959463e-05, "loss": 0.6893, "mean_token_accuracy": 0.7881631813943386, "num_tokens": 465630383.0, "step": 14589 }, { "entropy": 0.5784109337255359, "epoch": 1.3423557081327882, "grad_norm": 0.14845310151576996, "learning_rate": 5.525807341981784e-05, "loss": 0.577, "mean_token_accuracy": 0.8213746286928654, "num_tokens": 465662672.0, "step": 14590 }, { "entropy": 0.6610774770379066, "epoch": 1.3424477145042295, "grad_norm": 0.15812331438064575, "learning_rate": 5.5255006593676206e-05, "loss": 0.6431, "mean_token_accuracy": 0.8035270534455776, "num_tokens": 465694866.0, "step": 14591 }, { "entropy": 0.7031540609896183, "epoch": 1.3425397208756706, "grad_norm": 0.16303084790706635, "learning_rate": 5.525193976753458e-05, "loss": 0.7012, "mean_token_accuracy": 0.7863119356334209, "num_tokens": 465726810.0, "step": 14592 }, { "entropy": 0.6036721225827932, "epoch": 1.3426317272471118, "grad_norm": 0.1498565971851349, "learning_rate": 5.524887294139296e-05, "loss": 0.58, "mean_token_accuracy": 0.8225781694054604, "num_tokens": 465759255.0, "step": 14593 }, { "entropy": 0.5700885569676757, "epoch": 1.3427237336185531, "grad_norm": 0.14702996611595154, "learning_rate": 5.524580611525133e-05, "loss": 0.5548, "mean_token_accuracy": 0.8303910158574581, "num_tokens": 465791545.0, "step": 14594 }, { "entropy": 0.6444214717485011, "epoch": 1.3428157399899943, "grad_norm": 0.15962517261505127, "learning_rate": 5.5242739289109705e-05, "loss": 0.6338, "mean_token_accuracy": 0.8071480691432953, "num_tokens": 465823275.0, "step": 14595 }, { "entropy": 0.6583511680364609, "epoch": 1.3429077463614356, "grad_norm": 0.1595609337091446, "learning_rate": 5.523967246296807e-05, "loss": 0.6511, "mean_token_accuracy": 0.8022337518632412, "num_tokens": 465854639.0, "step": 14596 }, { "entropy": 0.7242467198520899, "epoch": 1.3429997527328768, "grad_norm": 0.16471004486083984, "learning_rate": 5.5236605636826454e-05, "loss": 0.7154, "mean_token_accuracy": 0.7864199765026569, "num_tokens": 465886432.0, "step": 14597 }, { "entropy": 0.5828711660578847, "epoch": 1.3430917591043179, "grad_norm": 0.15240991115570068, "learning_rate": 5.523353881068483e-05, "loss": 0.5604, "mean_token_accuracy": 0.8262817896902561, "num_tokens": 465919099.0, "step": 14598 }, { "entropy": 0.5874059805646539, "epoch": 1.3431837654757592, "grad_norm": 0.15550190210342407, "learning_rate": 5.5230471984543196e-05, "loss": 0.5866, "mean_token_accuracy": 0.8234008178114891, "num_tokens": 465951767.0, "step": 14599 }, { "entropy": 0.5669521447271109, "epoch": 1.3432757718472004, "grad_norm": 0.15077407658100128, "learning_rate": 5.522740515840157e-05, "loss": 0.5416, "mean_token_accuracy": 0.8331436887383461, "num_tokens": 465983131.0, "step": 14600 }, { "entropy": 0.5999411102384329, "epoch": 1.3433677782186417, "grad_norm": 0.15848684310913086, "learning_rate": 5.522433833225995e-05, "loss": 0.5882, "mean_token_accuracy": 0.8184205815196037, "num_tokens": 466015539.0, "step": 14601 }, { "entropy": 0.5887102670967579, "epoch": 1.3434597845900829, "grad_norm": 0.15767690539360046, "learning_rate": 5.522127150611832e-05, "loss": 0.5806, "mean_token_accuracy": 0.8177564032375813, "num_tokens": 466047418.0, "step": 14602 }, { "entropy": 0.5965588726103306, "epoch": 1.343551790961524, "grad_norm": 0.14999833703041077, "learning_rate": 5.5218204679976695e-05, "loss": 0.595, "mean_token_accuracy": 0.8186494410037994, "num_tokens": 466079322.0, "step": 14603 }, { "entropy": 0.6808634963817894, "epoch": 1.3436437973329654, "grad_norm": 0.1613369882106781, "learning_rate": 5.521513785383506e-05, "loss": 0.6839, "mean_token_accuracy": 0.796429093927145, "num_tokens": 466111521.0, "step": 14604 }, { "entropy": 0.5935218092054129, "epoch": 1.3437358037044065, "grad_norm": 0.16624251008033752, "learning_rate": 5.5212071027693444e-05, "loss": 0.5929, "mean_token_accuracy": 0.8197607770562172, "num_tokens": 466143394.0, "step": 14605 }, { "entropy": 0.6626315386965871, "epoch": 1.3438278100758478, "grad_norm": 0.15897013247013092, "learning_rate": 5.520900420155182e-05, "loss": 0.6556, "mean_token_accuracy": 0.7966256439685822, "num_tokens": 466175798.0, "step": 14606 }, { "entropy": 0.6354603422805667, "epoch": 1.343919816447289, "grad_norm": 0.15694864094257355, "learning_rate": 5.520593737541019e-05, "loss": 0.6331, "mean_token_accuracy": 0.8072206303477287, "num_tokens": 466207846.0, "step": 14607 }, { "entropy": 0.5796185079962015, "epoch": 1.34401182281873, "grad_norm": 0.15777646005153656, "learning_rate": 5.520287054926856e-05, "loss": 0.5661, "mean_token_accuracy": 0.8275038450956345, "num_tokens": 466239518.0, "step": 14608 }, { "entropy": 0.6663821078836918, "epoch": 1.3441038291901715, "grad_norm": 0.15908990800380707, "learning_rate": 5.519980372312694e-05, "loss": 0.6553, "mean_token_accuracy": 0.8032567165791988, "num_tokens": 466271857.0, "step": 14609 }, { "entropy": 0.5747182834893465, "epoch": 1.3441958355616126, "grad_norm": 0.15297099947929382, "learning_rate": 5.519673689698531e-05, "loss": 0.5387, "mean_token_accuracy": 0.8306274004280567, "num_tokens": 466304614.0, "step": 14610 }, { "entropy": 0.6519698761403561, "epoch": 1.344287841933054, "grad_norm": 0.16176660358905792, "learning_rate": 5.5193670070843685e-05, "loss": 0.6294, "mean_token_accuracy": 0.808183565735817, "num_tokens": 466336949.0, "step": 14611 }, { "entropy": 0.6339093614369631, "epoch": 1.344379848304495, "grad_norm": 0.16077403724193573, "learning_rate": 5.519060324470207e-05, "loss": 0.6183, "mean_token_accuracy": 0.8099652081727982, "num_tokens": 466368910.0, "step": 14612 }, { "entropy": 0.6598029872402549, "epoch": 1.3444718546759362, "grad_norm": 0.1610211730003357, "learning_rate": 5.5187536418560435e-05, "loss": 0.6522, "mean_token_accuracy": 0.8018473945558071, "num_tokens": 466401190.0, "step": 14613 }, { "entropy": 0.6495620654895902, "epoch": 1.3445638610473776, "grad_norm": 0.16144508123397827, "learning_rate": 5.518446959241881e-05, "loss": 0.6396, "mean_token_accuracy": 0.8025612607598305, "num_tokens": 466432143.0, "step": 14614 }, { "entropy": 0.6982021071016788, "epoch": 1.3446558674188187, "grad_norm": 0.16554927825927734, "learning_rate": 5.518140276627718e-05, "loss": 0.6957, "mean_token_accuracy": 0.7885153219103813, "num_tokens": 466464371.0, "step": 14615 }, { "entropy": 0.5308394562453032, "epoch": 1.34474787379026, "grad_norm": 0.1455153524875641, "learning_rate": 5.517833594013556e-05, "loss": 0.5223, "mean_token_accuracy": 0.835718497633934, "num_tokens": 466496292.0, "step": 14616 }, { "entropy": 0.6886152401566505, "epoch": 1.3448398801617012, "grad_norm": 0.16412508487701416, "learning_rate": 5.517526911399393e-05, "loss": 0.6841, "mean_token_accuracy": 0.7919296585023403, "num_tokens": 466527783.0, "step": 14617 }, { "entropy": 0.7042386829853058, "epoch": 1.3449318865331423, "grad_norm": 0.16515062749385834, "learning_rate": 5.51722022878523e-05, "loss": 0.6904, "mean_token_accuracy": 0.785403486341238, "num_tokens": 466559099.0, "step": 14618 }, { "entropy": 0.6258791405707598, "epoch": 1.3450238929045837, "grad_norm": 0.15969984233379364, "learning_rate": 5.5169135461710676e-05, "loss": 0.6318, "mean_token_accuracy": 0.8045515045523643, "num_tokens": 466591115.0, "step": 14619 }, { "entropy": 0.5191247840411961, "epoch": 1.3451158992760248, "grad_norm": 0.15011000633239746, "learning_rate": 5.516606863556906e-05, "loss": 0.5091, "mean_token_accuracy": 0.8426393866539001, "num_tokens": 466623021.0, "step": 14620 }, { "entropy": 0.587442715652287, "epoch": 1.3452079056474662, "grad_norm": 0.1571742445230484, "learning_rate": 5.5163001809427425e-05, "loss": 0.5973, "mean_token_accuracy": 0.8197650536894798, "num_tokens": 466654899.0, "step": 14621 }, { "entropy": 0.6160374097526073, "epoch": 1.3452999120189073, "grad_norm": 0.1626960188150406, "learning_rate": 5.51599349832858e-05, "loss": 0.6139, "mean_token_accuracy": 0.8184729069471359, "num_tokens": 466686939.0, "step": 14622 }, { "entropy": 0.7052385210990906, "epoch": 1.3453919183903484, "grad_norm": 0.15579672157764435, "learning_rate": 5.515686815714417e-05, "loss": 0.6934, "mean_token_accuracy": 0.786295160651207, "num_tokens": 466719302.0, "step": 14623 }, { "entropy": 0.64674380607903, "epoch": 1.3454839247617898, "grad_norm": 0.1560927927494049, "learning_rate": 5.5153801331002556e-05, "loss": 0.6508, "mean_token_accuracy": 0.8010960035026073, "num_tokens": 466750836.0, "step": 14624 }, { "entropy": 0.5864535039290786, "epoch": 1.345575931133231, "grad_norm": 0.15365934371948242, "learning_rate": 5.5150734504860924e-05, "loss": 0.555, "mean_token_accuracy": 0.824067085981369, "num_tokens": 466782363.0, "step": 14625 }, { "entropy": 0.5638302089646459, "epoch": 1.3456679375046723, "grad_norm": 0.16407440602779388, "learning_rate": 5.514766767871929e-05, "loss": 0.5445, "mean_token_accuracy": 0.8347475044429302, "num_tokens": 466814163.0, "step": 14626 }, { "entropy": 0.5749542200937867, "epoch": 1.3457599438761134, "grad_norm": 0.1451949179172516, "learning_rate": 5.5144600852577666e-05, "loss": 0.5588, "mean_token_accuracy": 0.8285631164908409, "num_tokens": 466845928.0, "step": 14627 }, { "entropy": 0.6269979570060968, "epoch": 1.3458519502475546, "grad_norm": 0.16454268991947174, "learning_rate": 5.514153402643605e-05, "loss": 0.6056, "mean_token_accuracy": 0.8139622695744038, "num_tokens": 466877283.0, "step": 14628 }, { "entropy": 0.6682307599112391, "epoch": 1.345943956618996, "grad_norm": 0.16247707605361938, "learning_rate": 5.513846720029442e-05, "loss": 0.6605, "mean_token_accuracy": 0.7981833256781101, "num_tokens": 466908619.0, "step": 14629 }, { "entropy": 0.6187205379828811, "epoch": 1.346035962990437, "grad_norm": 0.1586172878742218, "learning_rate": 5.513540037415279e-05, "loss": 0.6123, "mean_token_accuracy": 0.8150833584368229, "num_tokens": 466940465.0, "step": 14630 }, { "entropy": 0.6844214173033834, "epoch": 1.3461279693618784, "grad_norm": 0.15568162500858307, "learning_rate": 5.5132333548011165e-05, "loss": 0.6631, "mean_token_accuracy": 0.796856228262186, "num_tokens": 466972137.0, "step": 14631 }, { "entropy": 0.6361434236168861, "epoch": 1.3462199757333195, "grad_norm": 0.1586819440126419, "learning_rate": 5.5129266721869546e-05, "loss": 0.6239, "mean_token_accuracy": 0.8076202794909477, "num_tokens": 467004218.0, "step": 14632 }, { "entropy": 0.6757839638739824, "epoch": 1.3463119821047607, "grad_norm": 0.16212399303913116, "learning_rate": 5.5126199895727914e-05, "loss": 0.6653, "mean_token_accuracy": 0.7942702025175095, "num_tokens": 467035431.0, "step": 14633 }, { "entropy": 0.637092487886548, "epoch": 1.346403988476202, "grad_norm": 0.16230563819408417, "learning_rate": 5.512313306958629e-05, "loss": 0.6087, "mean_token_accuracy": 0.8084519319236279, "num_tokens": 467066322.0, "step": 14634 }, { "entropy": 0.6691391821950674, "epoch": 1.3464959948476432, "grad_norm": 0.16203851997852325, "learning_rate": 5.5120066243444657e-05, "loss": 0.6603, "mean_token_accuracy": 0.7997932769358158, "num_tokens": 467098160.0, "step": 14635 }, { "entropy": 0.5866084136068821, "epoch": 1.3465880012190845, "grad_norm": 0.15489359200000763, "learning_rate": 5.511699941730304e-05, "loss": 0.5782, "mean_token_accuracy": 0.8224041350185871, "num_tokens": 467129771.0, "step": 14636 }, { "entropy": 0.6128857228904963, "epoch": 1.3466800075905256, "grad_norm": 0.1561719924211502, "learning_rate": 5.511393259116141e-05, "loss": 0.592, "mean_token_accuracy": 0.8159217275679111, "num_tokens": 467161263.0, "step": 14637 }, { "entropy": 0.5987232085317373, "epoch": 1.3467720139619668, "grad_norm": 0.15391910076141357, "learning_rate": 5.511086576501978e-05, "loss": 0.5885, "mean_token_accuracy": 0.8197337202727795, "num_tokens": 467192736.0, "step": 14638 }, { "entropy": 0.6260922215878963, "epoch": 1.3468640203334081, "grad_norm": 0.15472418069839478, "learning_rate": 5.5107798938878155e-05, "loss": 0.621, "mean_token_accuracy": 0.8114812932908535, "num_tokens": 467224722.0, "step": 14639 }, { "entropy": 0.5830506042111665, "epoch": 1.3469560267048493, "grad_norm": 0.1546601802110672, "learning_rate": 5.5104732112736537e-05, "loss": 0.5742, "mean_token_accuracy": 0.8234020993113518, "num_tokens": 467256660.0, "step": 14640 }, { "entropy": 0.6253827288746834, "epoch": 1.3470480330762906, "grad_norm": 0.16429705917835236, "learning_rate": 5.5101665286594904e-05, "loss": 0.6192, "mean_token_accuracy": 0.8069103434681892, "num_tokens": 467287968.0, "step": 14641 }, { "entropy": 0.614273251965642, "epoch": 1.3471400394477318, "grad_norm": 0.16000930964946747, "learning_rate": 5.509859846045328e-05, "loss": 0.6188, "mean_token_accuracy": 0.8071829378604889, "num_tokens": 467319096.0, "step": 14642 }, { "entropy": 0.6349589941091835, "epoch": 1.3472320458191729, "grad_norm": 0.15747585892677307, "learning_rate": 5.509553163431166e-05, "loss": 0.6322, "mean_token_accuracy": 0.8106686733663082, "num_tokens": 467351534.0, "step": 14643 }, { "entropy": 0.6326035670936108, "epoch": 1.3473240521906142, "grad_norm": 0.1578516662120819, "learning_rate": 5.509246480817003e-05, "loss": 0.6258, "mean_token_accuracy": 0.8079079128801823, "num_tokens": 467383192.0, "step": 14644 }, { "entropy": 0.6963685229420662, "epoch": 1.3474160585620554, "grad_norm": 0.16342301666736603, "learning_rate": 5.50893979820284e-05, "loss": 0.6757, "mean_token_accuracy": 0.7920359000563622, "num_tokens": 467414505.0, "step": 14645 }, { "entropy": 0.6057593822479248, "epoch": 1.3475080649334967, "grad_norm": 0.15615549683570862, "learning_rate": 5.508633115588677e-05, "loss": 0.5945, "mean_token_accuracy": 0.8163361884653568, "num_tokens": 467446341.0, "step": 14646 }, { "entropy": 0.5905669322237372, "epoch": 1.3476000713049379, "grad_norm": 0.14912478625774384, "learning_rate": 5.508326432974515e-05, "loss": 0.5866, "mean_token_accuracy": 0.8196186311542988, "num_tokens": 467478441.0, "step": 14647 }, { "entropy": 0.5478211913723499, "epoch": 1.347692077676379, "grad_norm": 0.15946662425994873, "learning_rate": 5.508019750360353e-05, "loss": 0.5364, "mean_token_accuracy": 0.8330729641020298, "num_tokens": 467510200.0, "step": 14648 }, { "entropy": 0.5853137318044901, "epoch": 1.3477840840478204, "grad_norm": 0.17327284812927246, "learning_rate": 5.5077130677461895e-05, "loss": 0.5693, "mean_token_accuracy": 0.8241978585720062, "num_tokens": 467542130.0, "step": 14649 }, { "entropy": 0.7089829556643963, "epoch": 1.3478760904192615, "grad_norm": 0.16843582689762115, "learning_rate": 5.507406385132027e-05, "loss": 0.706, "mean_token_accuracy": 0.7846762873232365, "num_tokens": 467573209.0, "step": 14650 }, { "entropy": 0.5522478390485048, "epoch": 1.3479680967907028, "grad_norm": 0.14941349625587463, "learning_rate": 5.507099702517865e-05, "loss": 0.5334, "mean_token_accuracy": 0.8323520012199879, "num_tokens": 467604879.0, "step": 14651 }, { "entropy": 0.5973620377480984, "epoch": 1.348060103162144, "grad_norm": 0.16265559196472168, "learning_rate": 5.506793019903702e-05, "loss": 0.5821, "mean_token_accuracy": 0.8236492276191711, "num_tokens": 467637066.0, "step": 14652 }, { "entropy": 0.5732437232509255, "epoch": 1.348152109533585, "grad_norm": 0.15032778680324554, "learning_rate": 5.5064863372895393e-05, "loss": 0.5627, "mean_token_accuracy": 0.824813649058342, "num_tokens": 467669522.0, "step": 14653 }, { "entropy": 0.6221229564398527, "epoch": 1.3482441159050265, "grad_norm": 0.1596708446741104, "learning_rate": 5.506179654675376e-05, "loss": 0.614, "mean_token_accuracy": 0.8092232123017311, "num_tokens": 467701420.0, "step": 14654 }, { "entropy": 0.663469479419291, "epoch": 1.3483361222764676, "grad_norm": 0.15816128253936768, "learning_rate": 5.505872972061214e-05, "loss": 0.6477, "mean_token_accuracy": 0.8026783168315887, "num_tokens": 467733468.0, "step": 14655 }, { "entropy": 0.5608764197677374, "epoch": 1.348428128647909, "grad_norm": 0.15188798308372498, "learning_rate": 5.505566289447052e-05, "loss": 0.5379, "mean_token_accuracy": 0.8350550308823586, "num_tokens": 467765474.0, "step": 14656 }, { "entropy": 0.6777988281100988, "epoch": 1.34852013501935, "grad_norm": 0.16851459443569183, "learning_rate": 5.5052596068328885e-05, "loss": 0.6732, "mean_token_accuracy": 0.7969768792390823, "num_tokens": 467797424.0, "step": 14657 }, { "entropy": 0.5983353182673454, "epoch": 1.3486121413907912, "grad_norm": 0.15396103262901306, "learning_rate": 5.504952924218726e-05, "loss": 0.5933, "mean_token_accuracy": 0.8171647824347019, "num_tokens": 467829844.0, "step": 14658 }, { "entropy": 0.6394079327583313, "epoch": 1.3487041477622326, "grad_norm": 0.15945762395858765, "learning_rate": 5.504646241604564e-05, "loss": 0.6295, "mean_token_accuracy": 0.8073664903640747, "num_tokens": 467862117.0, "step": 14659 }, { "entropy": 0.7406965177506208, "epoch": 1.3487961541336737, "grad_norm": 0.1578383594751358, "learning_rate": 5.504339558990401e-05, "loss": 0.7087, "mean_token_accuracy": 0.7758539579808712, "num_tokens": 467893021.0, "step": 14660 }, { "entropy": 0.6460036020725965, "epoch": 1.348888160505115, "grad_norm": 0.1575346291065216, "learning_rate": 5.5040328763762384e-05, "loss": 0.64, "mean_token_accuracy": 0.8053660839796066, "num_tokens": 467925692.0, "step": 14661 }, { "entropy": 0.618834288790822, "epoch": 1.3489801668765562, "grad_norm": 0.1537853181362152, "learning_rate": 5.503726193762075e-05, "loss": 0.607, "mean_token_accuracy": 0.8124931342899799, "num_tokens": 467957496.0, "step": 14662 }, { "entropy": 0.7773927338421345, "epoch": 1.3490721732479973, "grad_norm": 0.16289763152599335, "learning_rate": 5.503419511147914e-05, "loss": 0.757, "mean_token_accuracy": 0.768048420548439, "num_tokens": 467989357.0, "step": 14663 }, { "entropy": 0.6361457277089357, "epoch": 1.3491641796194387, "grad_norm": 0.15931326150894165, "learning_rate": 5.503112828533751e-05, "loss": 0.6223, "mean_token_accuracy": 0.8092742711305618, "num_tokens": 468020904.0, "step": 14664 }, { "entropy": 0.5969007853418589, "epoch": 1.3492561859908798, "grad_norm": 0.1502041071653366, "learning_rate": 5.5028061459195876e-05, "loss": 0.5794, "mean_token_accuracy": 0.8240650072693825, "num_tokens": 468053420.0, "step": 14665 }, { "entropy": 0.6268738582730293, "epoch": 1.3493481923623212, "grad_norm": 0.15839803218841553, "learning_rate": 5.502499463305425e-05, "loss": 0.6221, "mean_token_accuracy": 0.810091495513916, "num_tokens": 468085955.0, "step": 14666 }, { "entropy": 0.6813087947666645, "epoch": 1.3494401987337623, "grad_norm": 0.16195067763328552, "learning_rate": 5.502192780691263e-05, "loss": 0.6874, "mean_token_accuracy": 0.7919379882514477, "num_tokens": 468118124.0, "step": 14667 }, { "entropy": 0.7073140554130077, "epoch": 1.3495322051052034, "grad_norm": 0.1591597944498062, "learning_rate": 5.5018860980771006e-05, "loss": 0.6944, "mean_token_accuracy": 0.7895864173769951, "num_tokens": 468150042.0, "step": 14668 }, { "entropy": 0.615777206607163, "epoch": 1.3496242114766448, "grad_norm": 0.15488925576210022, "learning_rate": 5.5015794154629374e-05, "loss": 0.6016, "mean_token_accuracy": 0.811143197119236, "num_tokens": 468182040.0, "step": 14669 }, { "entropy": 0.58083526045084, "epoch": 1.349716217848086, "grad_norm": 0.1539848893880844, "learning_rate": 5.501272732848774e-05, "loss": 0.5605, "mean_token_accuracy": 0.8291188441216946, "num_tokens": 468212812.0, "step": 14670 }, { "entropy": 0.6596193872392178, "epoch": 1.3498082242195273, "grad_norm": 0.16315235197544098, "learning_rate": 5.500966050234613e-05, "loss": 0.6507, "mean_token_accuracy": 0.8037034198641777, "num_tokens": 468243633.0, "step": 14671 }, { "entropy": 0.590236664749682, "epoch": 1.3499002305909684, "grad_norm": 0.15151505172252655, "learning_rate": 5.50065936762045e-05, "loss": 0.5806, "mean_token_accuracy": 0.8211543820798397, "num_tokens": 468274968.0, "step": 14672 }, { "entropy": 0.6169228637591004, "epoch": 1.3499922369624096, "grad_norm": 0.15061479806900024, "learning_rate": 5.500352685006287e-05, "loss": 0.6123, "mean_token_accuracy": 0.8175216764211655, "num_tokens": 468307664.0, "step": 14673 }, { "entropy": 0.6300032972358167, "epoch": 1.350084243333851, "grad_norm": 0.15836650133132935, "learning_rate": 5.5000460023921254e-05, "loss": 0.6298, "mean_token_accuracy": 0.805866926908493, "num_tokens": 468339676.0, "step": 14674 }, { "entropy": 0.7475789599120617, "epoch": 1.350176249705292, "grad_norm": 0.1722394973039627, "learning_rate": 5.499739319777962e-05, "loss": 0.7485, "mean_token_accuracy": 0.7730598263442516, "num_tokens": 468372193.0, "step": 14675 }, { "entropy": 0.6198837943375111, "epoch": 1.3502682560767334, "grad_norm": 0.1580936163663864, "learning_rate": 5.4994326371638e-05, "loss": 0.6139, "mean_token_accuracy": 0.8111650422215462, "num_tokens": 468404184.0, "step": 14676 }, { "entropy": 0.5735403327271342, "epoch": 1.3503602624481745, "grad_norm": 0.1576077789068222, "learning_rate": 5.4991259545496365e-05, "loss": 0.5674, "mean_token_accuracy": 0.8292984403669834, "num_tokens": 468436823.0, "step": 14677 }, { "entropy": 0.6618277970701456, "epoch": 1.3504522688196157, "grad_norm": 0.15672726929187775, "learning_rate": 5.4988192719354746e-05, "loss": 0.6411, "mean_token_accuracy": 0.8020278178155422, "num_tokens": 468468841.0, "step": 14678 }, { "entropy": 0.5213112882338464, "epoch": 1.350544275191057, "grad_norm": 0.14612917602062225, "learning_rate": 5.498512589321312e-05, "loss": 0.5019, "mean_token_accuracy": 0.8435754142701626, "num_tokens": 468501263.0, "step": 14679 }, { "entropy": 0.5263933020178229, "epoch": 1.3506362815624982, "grad_norm": 0.14793480932712555, "learning_rate": 5.498205906707149e-05, "loss": 0.5093, "mean_token_accuracy": 0.8412965312600136, "num_tokens": 468532326.0, "step": 14680 }, { "entropy": 0.516806548461318, "epoch": 1.3507282879339395, "grad_norm": 0.14176443219184875, "learning_rate": 5.497899224092986e-05, "loss": 0.4952, "mean_token_accuracy": 0.8444674909114838, "num_tokens": 468564367.0, "step": 14681 }, { "entropy": 0.6871064677834511, "epoch": 1.3508202943053806, "grad_norm": 0.16106398403644562, "learning_rate": 5.4975925414788245e-05, "loss": 0.6924, "mean_token_accuracy": 0.7916266433894634, "num_tokens": 468596809.0, "step": 14682 }, { "entropy": 0.5974480248987675, "epoch": 1.3509123006768218, "grad_norm": 0.1557808667421341, "learning_rate": 5.497285858864661e-05, "loss": 0.5865, "mean_token_accuracy": 0.8204926960170269, "num_tokens": 468628905.0, "step": 14683 }, { "entropy": 0.6203712113201618, "epoch": 1.3510043070482631, "grad_norm": 0.16421616077423096, "learning_rate": 5.496979176250499e-05, "loss": 0.6169, "mean_token_accuracy": 0.8119299225509167, "num_tokens": 468660102.0, "step": 14684 }, { "entropy": 0.6856940649449825, "epoch": 1.3510963134197043, "grad_norm": 0.16242758929729462, "learning_rate": 5.4966724936363355e-05, "loss": 0.6805, "mean_token_accuracy": 0.795138780027628, "num_tokens": 468692673.0, "step": 14685 }, { "entropy": 0.6076365206390619, "epoch": 1.3511883197911456, "grad_norm": 0.15696954727172852, "learning_rate": 5.4963658110221736e-05, "loss": 0.5991, "mean_token_accuracy": 0.8164095245301723, "num_tokens": 468725201.0, "step": 14686 }, { "entropy": 0.6638117656111717, "epoch": 1.3512803261625868, "grad_norm": 0.1616266518831253, "learning_rate": 5.496059128408011e-05, "loss": 0.6561, "mean_token_accuracy": 0.8007662743330002, "num_tokens": 468757735.0, "step": 14687 }, { "entropy": 0.6191193033009768, "epoch": 1.3513723325340279, "grad_norm": 0.15107330679893494, "learning_rate": 5.495752445793848e-05, "loss": 0.6079, "mean_token_accuracy": 0.8139500357210636, "num_tokens": 468790114.0, "step": 14688 }, { "entropy": 0.5608787182718515, "epoch": 1.3514643389054692, "grad_norm": 0.15100523829460144, "learning_rate": 5.4954457631796854e-05, "loss": 0.5442, "mean_token_accuracy": 0.8287653475999832, "num_tokens": 468820835.0, "step": 14689 }, { "entropy": 0.6653584716841578, "epoch": 1.3515563452769104, "grad_norm": 0.164289653301239, "learning_rate": 5.4951390805655235e-05, "loss": 0.6437, "mean_token_accuracy": 0.8025845997035503, "num_tokens": 468852717.0, "step": 14690 }, { "entropy": 0.6280757524073124, "epoch": 1.3516483516483517, "grad_norm": 0.15710724890232086, "learning_rate": 5.49483239795136e-05, "loss": 0.6223, "mean_token_accuracy": 0.8055935353040695, "num_tokens": 468885229.0, "step": 14691 }, { "entropy": 0.5385112585499883, "epoch": 1.3517403580197929, "grad_norm": 0.14927566051483154, "learning_rate": 5.494525715337198e-05, "loss": 0.5263, "mean_token_accuracy": 0.8376956395804882, "num_tokens": 468917702.0, "step": 14692 }, { "entropy": 0.6375886695459485, "epoch": 1.351832364391234, "grad_norm": 0.16353949904441833, "learning_rate": 5.4942190327230345e-05, "loss": 0.6318, "mean_token_accuracy": 0.8061693869531155, "num_tokens": 468949391.0, "step": 14693 }, { "entropy": 0.6976904198527336, "epoch": 1.3519243707626754, "grad_norm": 0.16168011724948883, "learning_rate": 5.493912350108873e-05, "loss": 0.6756, "mean_token_accuracy": 0.7968547642230988, "num_tokens": 468981608.0, "step": 14694 }, { "entropy": 0.593445397913456, "epoch": 1.3520163771341165, "grad_norm": 0.15312519669532776, "learning_rate": 5.49360566749471e-05, "loss": 0.586, "mean_token_accuracy": 0.816348809748888, "num_tokens": 469013679.0, "step": 14695 }, { "entropy": 0.6461929911747575, "epoch": 1.3521083835055578, "grad_norm": 0.1696833223104477, "learning_rate": 5.493298984880547e-05, "loss": 0.6275, "mean_token_accuracy": 0.8072440847754478, "num_tokens": 469044641.0, "step": 14696 }, { "entropy": 0.6005293559283018, "epoch": 1.352200389876999, "grad_norm": 0.16369770467281342, "learning_rate": 5.4929923022663844e-05, "loss": 0.577, "mean_token_accuracy": 0.8199713341891766, "num_tokens": 469075541.0, "step": 14697 }, { "entropy": 0.6205514967441559, "epoch": 1.35229239624844, "grad_norm": 0.16148220002651215, "learning_rate": 5.4926856196522225e-05, "loss": 0.5898, "mean_token_accuracy": 0.816047914326191, "num_tokens": 469106242.0, "step": 14698 }, { "entropy": 0.6542916428297758, "epoch": 1.3523844026198815, "grad_norm": 0.15750500559806824, "learning_rate": 5.492378937038059e-05, "loss": 0.666, "mean_token_accuracy": 0.7957699969410896, "num_tokens": 469138341.0, "step": 14699 }, { "entropy": 0.6494984570890665, "epoch": 1.3524764089913226, "grad_norm": 0.16120287775993347, "learning_rate": 5.492072254423897e-05, "loss": 0.6434, "mean_token_accuracy": 0.8063666895031929, "num_tokens": 469170801.0, "step": 14700 }, { "entropy": 0.6669717533513904, "epoch": 1.352568415362764, "grad_norm": 0.16027094423770905, "learning_rate": 5.4917655718097336e-05, "loss": 0.6551, "mean_token_accuracy": 0.8013458587229252, "num_tokens": 469202775.0, "step": 14701 }, { "entropy": 0.6031773304566741, "epoch": 1.352660421734205, "grad_norm": 0.16765953600406647, "learning_rate": 5.491458889195572e-05, "loss": 0.5917, "mean_token_accuracy": 0.8199883848428726, "num_tokens": 469234106.0, "step": 14702 }, { "entropy": 0.5859543588012457, "epoch": 1.3527524281056462, "grad_norm": 0.15349110960960388, "learning_rate": 5.491152206581409e-05, "loss": 0.569, "mean_token_accuracy": 0.823901642113924, "num_tokens": 469264883.0, "step": 14703 }, { "entropy": 0.6448238855227828, "epoch": 1.3528444344770876, "grad_norm": 0.16023406386375427, "learning_rate": 5.490845523967246e-05, "loss": 0.6379, "mean_token_accuracy": 0.8066481910645962, "num_tokens": 469296350.0, "step": 14704 }, { "entropy": 0.659963137935847, "epoch": 1.3529364408485287, "grad_norm": 0.1613236665725708, "learning_rate": 5.490538841353085e-05, "loss": 0.659, "mean_token_accuracy": 0.802082184702158, "num_tokens": 469328593.0, "step": 14705 }, { "entropy": 0.6111921388655901, "epoch": 1.35302844721997, "grad_norm": 0.15556840598583221, "learning_rate": 5.4902321587389216e-05, "loss": 0.5932, "mean_token_accuracy": 0.8173818998038769, "num_tokens": 469361048.0, "step": 14706 }, { "entropy": 0.5505812987685204, "epoch": 1.3531204535914112, "grad_norm": 0.1509464830160141, "learning_rate": 5.489925476124759e-05, "loss": 0.5244, "mean_token_accuracy": 0.839062474668026, "num_tokens": 469392943.0, "step": 14707 }, { "entropy": 0.6771602295339108, "epoch": 1.3532124599628523, "grad_norm": 0.16232311725616455, "learning_rate": 5.489618793510596e-05, "loss": 0.6676, "mean_token_accuracy": 0.7989814206957817, "num_tokens": 469425262.0, "step": 14708 }, { "entropy": 0.5769048929214478, "epoch": 1.3533044663342937, "grad_norm": 0.15592406690120697, "learning_rate": 5.489312110896434e-05, "loss": 0.5603, "mean_token_accuracy": 0.8268850073218346, "num_tokens": 469457464.0, "step": 14709 }, { "entropy": 0.5922532361000776, "epoch": 1.3533964727057348, "grad_norm": 0.15798050165176392, "learning_rate": 5.4890054282822714e-05, "loss": 0.5868, "mean_token_accuracy": 0.8198157176375389, "num_tokens": 469489552.0, "step": 14710 }, { "entropy": 0.6154823657125235, "epoch": 1.3534884790771762, "grad_norm": 0.15962103009223938, "learning_rate": 5.488698745668108e-05, "loss": 0.6045, "mean_token_accuracy": 0.8199844770133495, "num_tokens": 469521846.0, "step": 14711 }, { "entropy": 0.5014054700732231, "epoch": 1.3535804854486173, "grad_norm": 0.14511972665786743, "learning_rate": 5.488392063053946e-05, "loss": 0.4927, "mean_token_accuracy": 0.8488524183630943, "num_tokens": 469553690.0, "step": 14712 }, { "entropy": 0.549377916380763, "epoch": 1.3536724918200584, "grad_norm": 0.15441003441810608, "learning_rate": 5.488085380439784e-05, "loss": 0.5357, "mean_token_accuracy": 0.8302528113126755, "num_tokens": 469585741.0, "step": 14713 }, { "entropy": 0.5502155553549528, "epoch": 1.3537644981914998, "grad_norm": 0.148070827126503, "learning_rate": 5.4877786978256206e-05, "loss": 0.5332, "mean_token_accuracy": 0.8340898044407368, "num_tokens": 469617642.0, "step": 14714 }, { "entropy": 0.49619755893945694, "epoch": 1.353856504562941, "grad_norm": 0.14979444444179535, "learning_rate": 5.487472015211458e-05, "loss": 0.4755, "mean_token_accuracy": 0.8519890047609806, "num_tokens": 469649676.0, "step": 14715 }, { "entropy": 0.6025059875100851, "epoch": 1.3539485109343823, "grad_norm": 0.15026655793190002, "learning_rate": 5.487165332597295e-05, "loss": 0.602, "mean_token_accuracy": 0.8144104368984699, "num_tokens": 469682134.0, "step": 14716 }, { "entropy": 0.5593804214149714, "epoch": 1.3540405173058234, "grad_norm": 0.15612006187438965, "learning_rate": 5.486858649983133e-05, "loss": 0.5504, "mean_token_accuracy": 0.8287537582218647, "num_tokens": 469714064.0, "step": 14717 }, { "entropy": 0.5862536914646626, "epoch": 1.3541325236772646, "grad_norm": 0.1626586616039276, "learning_rate": 5.4865519673689705e-05, "loss": 0.5705, "mean_token_accuracy": 0.8272892460227013, "num_tokens": 469745837.0, "step": 14718 }, { "entropy": 0.6404256988316774, "epoch": 1.354224530048706, "grad_norm": 0.1591843217611313, "learning_rate": 5.486245284754807e-05, "loss": 0.6345, "mean_token_accuracy": 0.8042816780507565, "num_tokens": 469778143.0, "step": 14719 }, { "entropy": 0.5818128706887364, "epoch": 1.354316536420147, "grad_norm": 0.15921717882156372, "learning_rate": 5.485938602140645e-05, "loss": 0.5523, "mean_token_accuracy": 0.8297712467610836, "num_tokens": 469810518.0, "step": 14720 }, { "entropy": 0.6387194292619824, "epoch": 1.3544085427915884, "grad_norm": 0.1640874296426773, "learning_rate": 5.485631919526483e-05, "loss": 0.6246, "mean_token_accuracy": 0.8098399341106415, "num_tokens": 469842292.0, "step": 14721 }, { "entropy": 0.5555978938937187, "epoch": 1.3545005491630295, "grad_norm": 0.147792249917984, "learning_rate": 5.48532523691232e-05, "loss": 0.5342, "mean_token_accuracy": 0.8354363478720188, "num_tokens": 469874384.0, "step": 14722 }, { "entropy": 0.6060567181557417, "epoch": 1.3545925555344707, "grad_norm": 0.16105790436267853, "learning_rate": 5.485018554298157e-05, "loss": 0.5877, "mean_token_accuracy": 0.8181341029703617, "num_tokens": 469905568.0, "step": 14723 }, { "entropy": 0.5013373577967286, "epoch": 1.354684561905912, "grad_norm": 0.16173683106899261, "learning_rate": 5.484711871683994e-05, "loss": 0.4913, "mean_token_accuracy": 0.8492575474083424, "num_tokens": 469937654.0, "step": 14724 }, { "entropy": 0.6633637314662337, "epoch": 1.3547765682773532, "grad_norm": 0.165988951921463, "learning_rate": 5.484405189069832e-05, "loss": 0.6545, "mean_token_accuracy": 0.7992563396692276, "num_tokens": 469970023.0, "step": 14725 }, { "entropy": 0.7304394487291574, "epoch": 1.3548685746487945, "grad_norm": 0.1651276797056198, "learning_rate": 5.4840985064556695e-05, "loss": 0.7232, "mean_token_accuracy": 0.7801786847412586, "num_tokens": 470001889.0, "step": 14726 }, { "entropy": 0.5683437073603272, "epoch": 1.3549605810202356, "grad_norm": 0.15148860216140747, "learning_rate": 5.483791823841506e-05, "loss": 0.5459, "mean_token_accuracy": 0.8314051926136017, "num_tokens": 470034167.0, "step": 14727 }, { "entropy": 0.7034685644321144, "epoch": 1.3550525873916768, "grad_norm": 0.15680283308029175, "learning_rate": 5.483485141227344e-05, "loss": 0.6946, "mean_token_accuracy": 0.7885586284101009, "num_tokens": 470066324.0, "step": 14728 }, { "entropy": 0.6133805681020021, "epoch": 1.3551445937631181, "grad_norm": 0.15167081356048584, "learning_rate": 5.483178458613182e-05, "loss": 0.6015, "mean_token_accuracy": 0.8173081912100315, "num_tokens": 470098608.0, "step": 14729 }, { "entropy": 0.6086510196328163, "epoch": 1.3552366001345593, "grad_norm": 0.1616763174533844, "learning_rate": 5.482871775999019e-05, "loss": 0.5952, "mean_token_accuracy": 0.8176645264029503, "num_tokens": 470130817.0, "step": 14730 }, { "entropy": 0.5428434135392308, "epoch": 1.3553286065060006, "grad_norm": 0.15099331736564636, "learning_rate": 5.482565093384856e-05, "loss": 0.5322, "mean_token_accuracy": 0.8380420990288258, "num_tokens": 470163477.0, "step": 14731 }, { "entropy": 0.5084349093958735, "epoch": 1.3554206128774418, "grad_norm": 0.15301960706710815, "learning_rate": 5.482258410770693e-05, "loss": 0.5028, "mean_token_accuracy": 0.8457734473049641, "num_tokens": 470196015.0, "step": 14732 }, { "entropy": 0.6496388949453831, "epoch": 1.3555126192488829, "grad_norm": 0.1612861454486847, "learning_rate": 5.481951728156531e-05, "loss": 0.6387, "mean_token_accuracy": 0.8042855300009251, "num_tokens": 470227701.0, "step": 14733 }, { "entropy": 0.6250578677281737, "epoch": 1.3556046256203242, "grad_norm": 0.16123203933238983, "learning_rate": 5.4816450455423686e-05, "loss": 0.6071, "mean_token_accuracy": 0.8119805864989758, "num_tokens": 470258401.0, "step": 14734 }, { "entropy": 0.7368014380335808, "epoch": 1.3556966319917654, "grad_norm": 0.16977395117282867, "learning_rate": 5.4813383629282054e-05, "loss": 0.7353, "mean_token_accuracy": 0.7772468961775303, "num_tokens": 470290645.0, "step": 14735 }, { "entropy": 0.6666177348233759, "epoch": 1.3557886383632067, "grad_norm": 0.15822561085224152, "learning_rate": 5.4810316803140435e-05, "loss": 0.6622, "mean_token_accuracy": 0.7974517345428467, "num_tokens": 470323000.0, "step": 14736 }, { "entropy": 0.5431550154462457, "epoch": 1.3558806447346479, "grad_norm": 0.1597980409860611, "learning_rate": 5.480724997699881e-05, "loss": 0.536, "mean_token_accuracy": 0.8348720148205757, "num_tokens": 470355084.0, "step": 14737 }, { "entropy": 0.5724566685967147, "epoch": 1.355972651106089, "grad_norm": 0.15829907357692719, "learning_rate": 5.480418315085718e-05, "loss": 0.5451, "mean_token_accuracy": 0.8283042386174202, "num_tokens": 470386428.0, "step": 14738 }, { "entropy": 0.7035950515419245, "epoch": 1.3560646574775304, "grad_norm": 0.15978491306304932, "learning_rate": 5.480111632471555e-05, "loss": 0.6967, "mean_token_accuracy": 0.7916225679218769, "num_tokens": 470418446.0, "step": 14739 }, { "entropy": 0.5684420662000775, "epoch": 1.3561566638489715, "grad_norm": 0.1498793363571167, "learning_rate": 5.4798049498573934e-05, "loss": 0.53, "mean_token_accuracy": 0.8327326066792011, "num_tokens": 470448148.0, "step": 14740 }, { "entropy": 0.6875486988574266, "epoch": 1.3562486702204128, "grad_norm": 0.15793615579605103, "learning_rate": 5.47949826724323e-05, "loss": 0.676, "mean_token_accuracy": 0.7909862399101257, "num_tokens": 470480397.0, "step": 14741 }, { "entropy": 0.6170417740941048, "epoch": 1.356340676591854, "grad_norm": 0.1566699892282486, "learning_rate": 5.4791915846290676e-05, "loss": 0.6007, "mean_token_accuracy": 0.8183836191892624, "num_tokens": 470512131.0, "step": 14742 }, { "entropy": 0.6200792752206326, "epoch": 1.3564326829632951, "grad_norm": 0.15664821863174438, "learning_rate": 5.4788849020149044e-05, "loss": 0.6058, "mean_token_accuracy": 0.8132312558591366, "num_tokens": 470544516.0, "step": 14743 }, { "entropy": 0.6042091064155102, "epoch": 1.3565246893347365, "grad_norm": 0.15700402855873108, "learning_rate": 5.478578219400743e-05, "loss": 0.5946, "mean_token_accuracy": 0.8164425678551197, "num_tokens": 470576353.0, "step": 14744 }, { "entropy": 0.5156581560149789, "epoch": 1.3566166957061776, "grad_norm": 0.15514178574085236, "learning_rate": 5.47827153678658e-05, "loss": 0.4971, "mean_token_accuracy": 0.8448445126414299, "num_tokens": 470608326.0, "step": 14745 }, { "entropy": 0.7324144411832094, "epoch": 1.356708702077619, "grad_norm": 0.16028863191604614, "learning_rate": 5.477964854172417e-05, "loss": 0.7303, "mean_token_accuracy": 0.7812350578606129, "num_tokens": 470640905.0, "step": 14746 }, { "entropy": 0.7703166119754314, "epoch": 1.35680070844906, "grad_norm": 0.16505025327205658, "learning_rate": 5.477658171558254e-05, "loss": 0.7583, "mean_token_accuracy": 0.772431094199419, "num_tokens": 470672996.0, "step": 14747 }, { "entropy": 0.5731086498126388, "epoch": 1.3568927148205012, "grad_norm": 0.14712443947792053, "learning_rate": 5.4773514889440924e-05, "loss": 0.5637, "mean_token_accuracy": 0.8270552903413773, "num_tokens": 470705344.0, "step": 14748 }, { "entropy": 0.6807742724195123, "epoch": 1.3569847211919426, "grad_norm": 0.15706093609333038, "learning_rate": 5.47704480632993e-05, "loss": 0.6744, "mean_token_accuracy": 0.7982071749866009, "num_tokens": 470737205.0, "step": 14749 }, { "entropy": 0.6395709551870823, "epoch": 1.3570767275633837, "grad_norm": 0.15909631550312042, "learning_rate": 5.4767381237157666e-05, "loss": 0.6217, "mean_token_accuracy": 0.8108632080256939, "num_tokens": 470769565.0, "step": 14750 }, { "entropy": 0.5977461459115148, "epoch": 1.357168733934825, "grad_norm": 0.15591953694820404, "learning_rate": 5.476431441101604e-05, "loss": 0.5785, "mean_token_accuracy": 0.8200635276734829, "num_tokens": 470801768.0, "step": 14751 }, { "entropy": 0.6532891346141696, "epoch": 1.3572607403062662, "grad_norm": 0.16403041779994965, "learning_rate": 5.476124758487442e-05, "loss": 0.6404, "mean_token_accuracy": 0.8029187843203545, "num_tokens": 470833639.0, "step": 14752 }, { "entropy": 0.7143934806808829, "epoch": 1.3573527466777073, "grad_norm": 0.16935120522975922, "learning_rate": 5.475818075873279e-05, "loss": 0.7034, "mean_token_accuracy": 0.7874809838831425, "num_tokens": 470864610.0, "step": 14753 }, { "entropy": 0.5987176350317895, "epoch": 1.3574447530491487, "grad_norm": 0.15136030316352844, "learning_rate": 5.4755113932591165e-05, "loss": 0.5939, "mean_token_accuracy": 0.8182382769882679, "num_tokens": 470896975.0, "step": 14754 }, { "entropy": 0.6217348836362362, "epoch": 1.3575367594205898, "grad_norm": 0.161088228225708, "learning_rate": 5.475204710644953e-05, "loss": 0.6226, "mean_token_accuracy": 0.811268113553524, "num_tokens": 470928792.0, "step": 14755 }, { "entropy": 0.7452399209141731, "epoch": 1.3576287657920312, "grad_norm": 0.1662234365940094, "learning_rate": 5.4748980280307914e-05, "loss": 0.7476, "mean_token_accuracy": 0.7735028304159641, "num_tokens": 470960955.0, "step": 14756 }, { "entropy": 0.6142778191715479, "epoch": 1.3577207721634723, "grad_norm": 0.16878865659236908, "learning_rate": 5.474591345416629e-05, "loss": 0.6035, "mean_token_accuracy": 0.8179073706269264, "num_tokens": 470992003.0, "step": 14757 }, { "entropy": 0.594173526391387, "epoch": 1.3578127785349134, "grad_norm": 0.15906153619289398, "learning_rate": 5.474284662802466e-05, "loss": 0.5798, "mean_token_accuracy": 0.8200754597783089, "num_tokens": 471024048.0, "step": 14758 }, { "entropy": 0.6447041928768158, "epoch": 1.3579047849063548, "grad_norm": 0.16550561785697937, "learning_rate": 5.473977980188303e-05, "loss": 0.6263, "mean_token_accuracy": 0.8103642985224724, "num_tokens": 471054299.0, "step": 14759 }, { "entropy": 0.5634053777903318, "epoch": 1.357996791277796, "grad_norm": 0.14741645753383636, "learning_rate": 5.473671297574141e-05, "loss": 0.5471, "mean_token_accuracy": 0.831094279885292, "num_tokens": 471087067.0, "step": 14760 }, { "entropy": 0.6746086124330759, "epoch": 1.3580887976492373, "grad_norm": 0.16668327152729034, "learning_rate": 5.473364614959978e-05, "loss": 0.6673, "mean_token_accuracy": 0.7938984408974648, "num_tokens": 471118229.0, "step": 14761 }, { "entropy": 0.5869448278099298, "epoch": 1.3581808040206784, "grad_norm": 0.15832731127738953, "learning_rate": 5.4730579323458155e-05, "loss": 0.5889, "mean_token_accuracy": 0.8204493075609207, "num_tokens": 471150674.0, "step": 14762 }, { "entropy": 0.7792690265923738, "epoch": 1.3582728103921196, "grad_norm": 0.17224332690238953, "learning_rate": 5.472751249731652e-05, "loss": 0.7636, "mean_token_accuracy": 0.7689434476196766, "num_tokens": 471182503.0, "step": 14763 }, { "entropy": 0.5112734008580446, "epoch": 1.358364816763561, "grad_norm": 0.14958137273788452, "learning_rate": 5.4724445671174905e-05, "loss": 0.4826, "mean_token_accuracy": 0.8485530465841293, "num_tokens": 471212967.0, "step": 14764 }, { "entropy": 0.7285653427243233, "epoch": 1.358456823135002, "grad_norm": 0.16553862392902374, "learning_rate": 5.472137884503328e-05, "loss": 0.699, "mean_token_accuracy": 0.792279876768589, "num_tokens": 471244816.0, "step": 14765 }, { "entropy": 0.6202983055263758, "epoch": 1.3585488295064434, "grad_norm": 0.15813754498958588, "learning_rate": 5.471831201889165e-05, "loss": 0.6235, "mean_token_accuracy": 0.8113929033279419, "num_tokens": 471276534.0, "step": 14766 }, { "entropy": 0.465388341806829, "epoch": 1.3586408358778845, "grad_norm": 0.14026616513729095, "learning_rate": 5.471524519275003e-05, "loss": 0.4628, "mean_token_accuracy": 0.854987908154726, "num_tokens": 471309017.0, "step": 14767 }, { "entropy": 0.521997332572937, "epoch": 1.3587328422493257, "grad_norm": 0.1477198749780655, "learning_rate": 5.47121783666084e-05, "loss": 0.5178, "mean_token_accuracy": 0.8378437981009483, "num_tokens": 471341337.0, "step": 14768 }, { "entropy": 0.5170130301266909, "epoch": 1.358824848620767, "grad_norm": 0.145376518368721, "learning_rate": 5.470911154046677e-05, "loss": 0.5082, "mean_token_accuracy": 0.8419976606965065, "num_tokens": 471373479.0, "step": 14769 }, { "entropy": 0.6247686194255948, "epoch": 1.3589168549922082, "grad_norm": 0.16640080511569977, "learning_rate": 5.4706044714325146e-05, "loss": 0.6129, "mean_token_accuracy": 0.8130148127675056, "num_tokens": 471405797.0, "step": 14770 }, { "entropy": 0.552773549221456, "epoch": 1.3590088613636495, "grad_norm": 0.1570340394973755, "learning_rate": 5.470297788818353e-05, "loss": 0.5514, "mean_token_accuracy": 0.8315332606434822, "num_tokens": 471438285.0, "step": 14771 }, { "entropy": 0.547497428022325, "epoch": 1.3591008677350906, "grad_norm": 0.1574798822402954, "learning_rate": 5.4699911062041895e-05, "loss": 0.5234, "mean_token_accuracy": 0.8379277177155018, "num_tokens": 471469337.0, "step": 14772 }, { "entropy": 0.6708313655108213, "epoch": 1.3591928741065318, "grad_norm": 0.16511660814285278, "learning_rate": 5.469684423590027e-05, "loss": 0.6705, "mean_token_accuracy": 0.7996749505400658, "num_tokens": 471501631.0, "step": 14773 }, { "entropy": 0.6148986304178834, "epoch": 1.3592848804779731, "grad_norm": 0.15127679705619812, "learning_rate": 5.469377740975864e-05, "loss": 0.6066, "mean_token_accuracy": 0.8118594400584698, "num_tokens": 471533799.0, "step": 14774 }, { "entropy": 0.5758499521762133, "epoch": 1.3593768868494143, "grad_norm": 0.15796971321105957, "learning_rate": 5.469071058361702e-05, "loss": 0.5715, "mean_token_accuracy": 0.8251705281436443, "num_tokens": 471565641.0, "step": 14775 }, { "entropy": 0.6336061786860228, "epoch": 1.3594688932208556, "grad_norm": 0.15916535258293152, "learning_rate": 5.4687643757475394e-05, "loss": 0.6361, "mean_token_accuracy": 0.811239380389452, "num_tokens": 471597474.0, "step": 14776 }, { "entropy": 0.7412385791540146, "epoch": 1.3595608995922968, "grad_norm": 0.16261285543441772, "learning_rate": 5.468457693133376e-05, "loss": 0.7255, "mean_token_accuracy": 0.7777695879340172, "num_tokens": 471629934.0, "step": 14777 }, { "entropy": 0.7093592849560082, "epoch": 1.359652905963738, "grad_norm": 0.1647273749113083, "learning_rate": 5.4681510105192136e-05, "loss": 0.715, "mean_token_accuracy": 0.7845073714852333, "num_tokens": 471661834.0, "step": 14778 }, { "entropy": 0.5974999479949474, "epoch": 1.3597449123351792, "grad_norm": 0.15183967351913452, "learning_rate": 5.467844327905052e-05, "loss": 0.5795, "mean_token_accuracy": 0.8205709159374237, "num_tokens": 471693789.0, "step": 14779 }, { "entropy": 0.542597041465342, "epoch": 1.3598369187066204, "grad_norm": 0.15290583670139313, "learning_rate": 5.4675376452908886e-05, "loss": 0.538, "mean_token_accuracy": 0.8350273370742798, "num_tokens": 471725799.0, "step": 14780 }, { "entropy": 0.5728659387677908, "epoch": 1.3599289250780617, "grad_norm": 0.15263420343399048, "learning_rate": 5.467230962676726e-05, "loss": 0.5466, "mean_token_accuracy": 0.8349909111857414, "num_tokens": 471758334.0, "step": 14781 }, { "entropy": 0.6081976722925901, "epoch": 1.3600209314495029, "grad_norm": 0.16279800236225128, "learning_rate": 5.466924280062563e-05, "loss": 0.5866, "mean_token_accuracy": 0.8219171054661274, "num_tokens": 471789017.0, "step": 14782 }, { "entropy": 0.5885456884279847, "epoch": 1.360112937820944, "grad_norm": 0.15556079149246216, "learning_rate": 5.4666175974484016e-05, "loss": 0.5594, "mean_token_accuracy": 0.8278969638049603, "num_tokens": 471821084.0, "step": 14783 }, { "entropy": 0.6488203033804893, "epoch": 1.3602049441923854, "grad_norm": 0.15654350817203522, "learning_rate": 5.4663109148342384e-05, "loss": 0.6363, "mean_token_accuracy": 0.8053701184689999, "num_tokens": 471853278.0, "step": 14784 }, { "entropy": 0.605016715824604, "epoch": 1.3602969505638265, "grad_norm": 0.15789903700351715, "learning_rate": 5.466004232220075e-05, "loss": 0.6002, "mean_token_accuracy": 0.8178737238049507, "num_tokens": 471884958.0, "step": 14785 }, { "entropy": 0.5635826587677002, "epoch": 1.3603889569352678, "grad_norm": 0.15051047503948212, "learning_rate": 5.465697549605913e-05, "loss": 0.5387, "mean_token_accuracy": 0.8319021686911583, "num_tokens": 471916883.0, "step": 14786 }, { "entropy": 0.6193576762452722, "epoch": 1.360480963306709, "grad_norm": 0.16366122663021088, "learning_rate": 5.465390866991751e-05, "loss": 0.5946, "mean_token_accuracy": 0.812518049031496, "num_tokens": 471947943.0, "step": 14787 }, { "entropy": 0.5318534029647708, "epoch": 1.3605729696781501, "grad_norm": 0.21704436838626862, "learning_rate": 5.465084184377588e-05, "loss": 0.5202, "mean_token_accuracy": 0.8357645869255066, "num_tokens": 471979881.0, "step": 14788 }, { "entropy": 0.7622074596583843, "epoch": 1.3606649760495915, "grad_norm": 0.16176946461200714, "learning_rate": 5.464777501763425e-05, "loss": 0.7569, "mean_token_accuracy": 0.7692379616200924, "num_tokens": 472012124.0, "step": 14789 }, { "entropy": 0.5973674114793539, "epoch": 1.3607569824210326, "grad_norm": 0.15791481733322144, "learning_rate": 5.464470819149262e-05, "loss": 0.5874, "mean_token_accuracy": 0.817779790610075, "num_tokens": 472044502.0, "step": 14790 }, { "entropy": 0.5729891264345497, "epoch": 1.360848988792474, "grad_norm": 0.1686742901802063, "learning_rate": 5.464164136535101e-05, "loss": 0.5665, "mean_token_accuracy": 0.8268828168511391, "num_tokens": 472076625.0, "step": 14791 }, { "entropy": 0.6226290483027697, "epoch": 1.360940995163915, "grad_norm": 0.164840430021286, "learning_rate": 5.4638574539209375e-05, "loss": 0.6194, "mean_token_accuracy": 0.8127108477056026, "num_tokens": 472108249.0, "step": 14792 }, { "entropy": 0.6482587028294802, "epoch": 1.3610330015353562, "grad_norm": 0.15939822793006897, "learning_rate": 5.463550771306775e-05, "loss": 0.6287, "mean_token_accuracy": 0.8072500824928284, "num_tokens": 472140636.0, "step": 14793 }, { "entropy": 0.6288119489327073, "epoch": 1.3611250079067976, "grad_norm": 0.15551961958408356, "learning_rate": 5.463244088692612e-05, "loss": 0.6136, "mean_token_accuracy": 0.8118827790021896, "num_tokens": 472172858.0, "step": 14794 }, { "entropy": 0.6629222314804792, "epoch": 1.3612170142782387, "grad_norm": 0.1615617871284485, "learning_rate": 5.46293740607845e-05, "loss": 0.6464, "mean_token_accuracy": 0.801449604332447, "num_tokens": 472204814.0, "step": 14795 }, { "entropy": 0.6129262894392014, "epoch": 1.36130902064968, "grad_norm": 0.16570723056793213, "learning_rate": 5.462630723464287e-05, "loss": 0.5969, "mean_token_accuracy": 0.8152804374694824, "num_tokens": 472236072.0, "step": 14796 }, { "entropy": 0.5519015807658434, "epoch": 1.3614010270211212, "grad_norm": 0.15722595155239105, "learning_rate": 5.462324040850124e-05, "loss": 0.5375, "mean_token_accuracy": 0.8341149128973484, "num_tokens": 472267609.0, "step": 14797 }, { "entropy": 0.5828439081087708, "epoch": 1.3614930333925623, "grad_norm": 0.14858971536159515, "learning_rate": 5.462017358235962e-05, "loss": 0.5829, "mean_token_accuracy": 0.8219590447843075, "num_tokens": 472300043.0, "step": 14798 }, { "entropy": 0.6395940762013197, "epoch": 1.3615850397640037, "grad_norm": 0.16645562648773193, "learning_rate": 5.4617106756218e-05, "loss": 0.6275, "mean_token_accuracy": 0.8070606514811516, "num_tokens": 472331345.0, "step": 14799 }, { "entropy": 0.626725347712636, "epoch": 1.3616770461354448, "grad_norm": 0.15733511745929718, "learning_rate": 5.4614039930076365e-05, "loss": 0.6224, "mean_token_accuracy": 0.8117739297449589, "num_tokens": 472363859.0, "step": 14800 }, { "entropy": 0.6577073065564036, "epoch": 1.3617690525068862, "grad_norm": 0.1578184962272644, "learning_rate": 5.461097310393474e-05, "loss": 0.6384, "mean_token_accuracy": 0.8044055253267288, "num_tokens": 472396112.0, "step": 14801 }, { "entropy": 0.6715552322566509, "epoch": 1.3618610588783273, "grad_norm": 0.16469848155975342, "learning_rate": 5.460790627779312e-05, "loss": 0.6598, "mean_token_accuracy": 0.7971605025231838, "num_tokens": 472428106.0, "step": 14802 }, { "entropy": 0.5657972991466522, "epoch": 1.3619530652497684, "grad_norm": 0.16077539324760437, "learning_rate": 5.460483945165149e-05, "loss": 0.5463, "mean_token_accuracy": 0.8252173103392124, "num_tokens": 472459068.0, "step": 14803 }, { "entropy": 0.5970916757360101, "epoch": 1.3620450716212098, "grad_norm": 0.15882357954978943, "learning_rate": 5.4601772625509864e-05, "loss": 0.5908, "mean_token_accuracy": 0.818274449557066, "num_tokens": 472490518.0, "step": 14804 }, { "entropy": 0.5779086872935295, "epoch": 1.362137077992651, "grad_norm": 0.15716001391410828, "learning_rate": 5.459870579936823e-05, "loss": 0.5574, "mean_token_accuracy": 0.8257689848542213, "num_tokens": 472522360.0, "step": 14805 }, { "entropy": 0.7507755625993013, "epoch": 1.3622290843640923, "grad_norm": 0.1672755777835846, "learning_rate": 5.459563897322661e-05, "loss": 0.7375, "mean_token_accuracy": 0.7823594026267529, "num_tokens": 472554796.0, "step": 14806 }, { "entropy": 0.770779263228178, "epoch": 1.3623210907355334, "grad_norm": 0.17010219395160675, "learning_rate": 5.459257214708499e-05, "loss": 0.7481, "mean_token_accuracy": 0.7710510827600956, "num_tokens": 472586942.0, "step": 14807 }, { "entropy": 0.6110842265188694, "epoch": 1.3624130971069746, "grad_norm": 0.15969768166542053, "learning_rate": 5.4589505320943355e-05, "loss": 0.613, "mean_token_accuracy": 0.8129841051995754, "num_tokens": 472618910.0, "step": 14808 }, { "entropy": 0.6914944425225258, "epoch": 1.362505103478416, "grad_norm": 0.17817965149879456, "learning_rate": 5.458643849480173e-05, "loss": 0.685, "mean_token_accuracy": 0.7891444861888885, "num_tokens": 472650725.0, "step": 14809 }, { "entropy": 0.6087187435477972, "epoch": 1.362597109849857, "grad_norm": 0.15884554386138916, "learning_rate": 5.458337166866011e-05, "loss": 0.581, "mean_token_accuracy": 0.8181317448616028, "num_tokens": 472682031.0, "step": 14810 }, { "entropy": 0.6044431896880269, "epoch": 1.3626891162212984, "grad_norm": 0.15935151278972626, "learning_rate": 5.458030484251848e-05, "loss": 0.5876, "mean_token_accuracy": 0.8204010054469109, "num_tokens": 472713298.0, "step": 14811 }, { "entropy": 0.7552844695746899, "epoch": 1.3627811225927395, "grad_norm": 0.16841834783554077, "learning_rate": 5.4577238016376854e-05, "loss": 0.7568, "mean_token_accuracy": 0.7771924659609795, "num_tokens": 472745354.0, "step": 14812 }, { "entropy": 0.5653055720031261, "epoch": 1.3628731289641807, "grad_norm": 0.1554718017578125, "learning_rate": 5.457417119023522e-05, "loss": 0.561, "mean_token_accuracy": 0.8267281353473663, "num_tokens": 472778122.0, "step": 14813 }, { "entropy": 0.7246195208281279, "epoch": 1.362965135335622, "grad_norm": 0.16463547945022583, "learning_rate": 5.45711043640936e-05, "loss": 0.726, "mean_token_accuracy": 0.7783796004951, "num_tokens": 472809744.0, "step": 14814 }, { "entropy": 0.5811671689152718, "epoch": 1.3630571417070632, "grad_norm": 0.15145893394947052, "learning_rate": 5.456803753795198e-05, "loss": 0.5607, "mean_token_accuracy": 0.8224967643618584, "num_tokens": 472842071.0, "step": 14815 }, { "entropy": 0.6244808631017804, "epoch": 1.3631491480785045, "grad_norm": 0.1602703183889389, "learning_rate": 5.4564970711810346e-05, "loss": 0.6223, "mean_token_accuracy": 0.8101966679096222, "num_tokens": 472873986.0, "step": 14816 }, { "entropy": 0.5334235671907663, "epoch": 1.3632411544499456, "grad_norm": 0.1542893797159195, "learning_rate": 5.456190388566872e-05, "loss": 0.5121, "mean_token_accuracy": 0.8449419178068638, "num_tokens": 472905665.0, "step": 14817 }, { "entropy": 0.5651484676636755, "epoch": 1.3633331608213868, "grad_norm": 0.16227369010448456, "learning_rate": 5.45588370595271e-05, "loss": 0.5381, "mean_token_accuracy": 0.8338333815336227, "num_tokens": 472936470.0, "step": 14818 }, { "entropy": 0.5998210329562426, "epoch": 1.3634251671928281, "grad_norm": 0.155211940407753, "learning_rate": 5.455577023338547e-05, "loss": 0.5952, "mean_token_accuracy": 0.8147284761071205, "num_tokens": 472968026.0, "step": 14819 }, { "entropy": 0.6152719920501113, "epoch": 1.3635171735642693, "grad_norm": 0.15782776474952698, "learning_rate": 5.4552703407243844e-05, "loss": 0.6162, "mean_token_accuracy": 0.8116865493357182, "num_tokens": 473000547.0, "step": 14820 }, { "entropy": 0.7474411241710186, "epoch": 1.3636091799357106, "grad_norm": 0.17025691270828247, "learning_rate": 5.454963658110221e-05, "loss": 0.7379, "mean_token_accuracy": 0.7764107920229435, "num_tokens": 473032815.0, "step": 14821 }, { "entropy": 0.5787136591970921, "epoch": 1.3637011863071518, "grad_norm": 0.15294912457466125, "learning_rate": 5.4546569754960594e-05, "loss": 0.5665, "mean_token_accuracy": 0.8222388364374638, "num_tokens": 473065269.0, "step": 14822 }, { "entropy": 0.6405050735920668, "epoch": 1.363793192678593, "grad_norm": 0.16316409409046173, "learning_rate": 5.454350292881897e-05, "loss": 0.6268, "mean_token_accuracy": 0.8048049882054329, "num_tokens": 473097773.0, "step": 14823 }, { "entropy": 0.5936155766248703, "epoch": 1.3638851990500342, "grad_norm": 0.15177060663700104, "learning_rate": 5.4540436102677336e-05, "loss": 0.5633, "mean_token_accuracy": 0.8276866972446442, "num_tokens": 473130288.0, "step": 14824 }, { "entropy": 0.6258907606825233, "epoch": 1.3639772054214754, "grad_norm": 0.14889633655548096, "learning_rate": 5.453736927653571e-05, "loss": 0.6129, "mean_token_accuracy": 0.8099110014736652, "num_tokens": 473162622.0, "step": 14825 }, { "entropy": 0.597690284717828, "epoch": 1.3640692117929167, "grad_norm": 0.1616983264684677, "learning_rate": 5.453430245039409e-05, "loss": 0.5762, "mean_token_accuracy": 0.824566375464201, "num_tokens": 473194761.0, "step": 14826 }, { "entropy": 0.7348250951617956, "epoch": 1.3641612181643579, "grad_norm": 0.17054860293865204, "learning_rate": 5.453123562425247e-05, "loss": 0.7243, "mean_token_accuracy": 0.7805736996233463, "num_tokens": 473225982.0, "step": 14827 }, { "entropy": 0.6035751653835177, "epoch": 1.364253224535799, "grad_norm": 0.17113707959651947, "learning_rate": 5.4528168798110835e-05, "loss": 0.5941, "mean_token_accuracy": 0.819229606539011, "num_tokens": 473257939.0, "step": 14828 }, { "entropy": 0.6307136798277497, "epoch": 1.3643452309072404, "grad_norm": 0.1566263735294342, "learning_rate": 5.4525101971969216e-05, "loss": 0.616, "mean_token_accuracy": 0.8075053840875626, "num_tokens": 473289855.0, "step": 14829 }, { "entropy": 0.659479012247175, "epoch": 1.3644372372786815, "grad_norm": 0.15671740472316742, "learning_rate": 5.452203514582759e-05, "loss": 0.6446, "mean_token_accuracy": 0.8007677644491196, "num_tokens": 473322280.0, "step": 14830 }, { "entropy": 0.6417530979961157, "epoch": 1.3645292436501228, "grad_norm": 0.16756847500801086, "learning_rate": 5.451896831968596e-05, "loss": 0.6532, "mean_token_accuracy": 0.8031021952629089, "num_tokens": 473353051.0, "step": 14831 }, { "entropy": 0.6309918449260294, "epoch": 1.364621250021564, "grad_norm": 0.16399738192558289, "learning_rate": 5.451590149354433e-05, "loss": 0.632, "mean_token_accuracy": 0.8074105083942413, "num_tokens": 473384610.0, "step": 14832 }, { "entropy": 0.721406452357769, "epoch": 1.3647132563930051, "grad_norm": 0.17403919994831085, "learning_rate": 5.4512834667402715e-05, "loss": 0.7291, "mean_token_accuracy": 0.7814735472202301, "num_tokens": 473416081.0, "step": 14833 }, { "entropy": 0.6250427290797234, "epoch": 1.3648052627644465, "grad_norm": 0.15554864704608917, "learning_rate": 5.450976784126108e-05, "loss": 0.6195, "mean_token_accuracy": 0.8086059018969536, "num_tokens": 473447406.0, "step": 14834 }, { "entropy": 0.6158986212685704, "epoch": 1.3648972691358876, "grad_norm": 0.1541067361831665, "learning_rate": 5.450670101511946e-05, "loss": 0.59, "mean_token_accuracy": 0.8198179826140404, "num_tokens": 473478997.0, "step": 14835 }, { "entropy": 0.6639467868953943, "epoch": 1.364989275507329, "grad_norm": 0.1571158915758133, "learning_rate": 5.4503634188977825e-05, "loss": 0.6362, "mean_token_accuracy": 0.8054708652198315, "num_tokens": 473511064.0, "step": 14836 }, { "entropy": 0.5761940656229854, "epoch": 1.36508128187877, "grad_norm": 0.15345630049705505, "learning_rate": 5.4500567362836207e-05, "loss": 0.5696, "mean_token_accuracy": 0.8216156549751759, "num_tokens": 473542875.0, "step": 14837 }, { "entropy": 0.7047865185886621, "epoch": 1.3651732882502112, "grad_norm": 0.17281481623649597, "learning_rate": 5.449750053669458e-05, "loss": 0.6987, "mean_token_accuracy": 0.7901402041316032, "num_tokens": 473573465.0, "step": 14838 }, { "entropy": 0.693654359318316, "epoch": 1.3652652946216526, "grad_norm": 0.1624569147825241, "learning_rate": 5.449443371055295e-05, "loss": 0.6653, "mean_token_accuracy": 0.7953478805720806, "num_tokens": 473605555.0, "step": 14839 }, { "entropy": 0.619381190277636, "epoch": 1.3653573009930937, "grad_norm": 0.15694975852966309, "learning_rate": 5.4491366884411324e-05, "loss": 0.6115, "mean_token_accuracy": 0.813109777867794, "num_tokens": 473637302.0, "step": 14840 }, { "entropy": 0.5310512036085129, "epoch": 1.365449307364535, "grad_norm": 0.15617065131664276, "learning_rate": 5.4488300058269705e-05, "loss": 0.5275, "mean_token_accuracy": 0.8400905467569828, "num_tokens": 473668608.0, "step": 14841 }, { "entropy": 0.7432443480938673, "epoch": 1.3655413137359762, "grad_norm": 0.16631552577018738, "learning_rate": 5.448523323212807e-05, "loss": 0.7407, "mean_token_accuracy": 0.7785496115684509, "num_tokens": 473700699.0, "step": 14842 }, { "entropy": 0.6606606794521213, "epoch": 1.3656333201074173, "grad_norm": 0.16075436770915985, "learning_rate": 5.448216640598645e-05, "loss": 0.6683, "mean_token_accuracy": 0.7969315014779568, "num_tokens": 473731916.0, "step": 14843 }, { "entropy": 0.6127339508384466, "epoch": 1.3657253264788587, "grad_norm": 0.15022720396518707, "learning_rate": 5.4479099579844816e-05, "loss": 0.5884, "mean_token_accuracy": 0.8194640278816223, "num_tokens": 473764348.0, "step": 14844 }, { "entropy": 0.6366215832531452, "epoch": 1.3658173328502998, "grad_norm": 0.1548628807067871, "learning_rate": 5.44760327537032e-05, "loss": 0.6273, "mean_token_accuracy": 0.8077674508094788, "num_tokens": 473797116.0, "step": 14845 }, { "entropy": 0.6105389334261417, "epoch": 1.3659093392217412, "grad_norm": 0.1574733555316925, "learning_rate": 5.447296592756157e-05, "loss": 0.6019, "mean_token_accuracy": 0.8173138946294785, "num_tokens": 473829827.0, "step": 14846 }, { "entropy": 0.5806025005877018, "epoch": 1.3660013455931823, "grad_norm": 0.15756674110889435, "learning_rate": 5.446989910141994e-05, "loss": 0.572, "mean_token_accuracy": 0.8220369555056095, "num_tokens": 473861697.0, "step": 14847 }, { "entropy": 0.6067609824240208, "epoch": 1.3660933519646234, "grad_norm": 0.15545949339866638, "learning_rate": 5.4466832275278314e-05, "loss": 0.5947, "mean_token_accuracy": 0.8138863630592823, "num_tokens": 473894089.0, "step": 14848 }, { "entropy": 0.6446395460516214, "epoch": 1.3661853583360648, "grad_norm": 0.1576579511165619, "learning_rate": 5.4463765449136696e-05, "loss": 0.6295, "mean_token_accuracy": 0.8119549788534641, "num_tokens": 473926044.0, "step": 14849 }, { "entropy": 0.6574149681255221, "epoch": 1.366277364707506, "grad_norm": 0.16167402267456055, "learning_rate": 5.4460698622995063e-05, "loss": 0.6584, "mean_token_accuracy": 0.8026246316730976, "num_tokens": 473957404.0, "step": 14850 }, { "entropy": 0.6689197737723589, "epoch": 1.3663693710789473, "grad_norm": 0.15919630229473114, "learning_rate": 5.445763179685344e-05, "loss": 0.67, "mean_token_accuracy": 0.7971770726144314, "num_tokens": 473989575.0, "step": 14851 }, { "entropy": 0.653816414065659, "epoch": 1.3664613774503884, "grad_norm": 0.15797017514705658, "learning_rate": 5.4454564970711806e-05, "loss": 0.6344, "mean_token_accuracy": 0.8058624416589737, "num_tokens": 474021589.0, "step": 14852 }, { "entropy": 0.5922977151349187, "epoch": 1.3665533838218296, "grad_norm": 0.15488219261169434, "learning_rate": 5.445149814457019e-05, "loss": 0.5688, "mean_token_accuracy": 0.8212926797568798, "num_tokens": 474053245.0, "step": 14853 }, { "entropy": 0.6246970165520906, "epoch": 1.366645390193271, "grad_norm": 0.15885908901691437, "learning_rate": 5.444843131842856e-05, "loss": 0.6171, "mean_token_accuracy": 0.8122226521372795, "num_tokens": 474084616.0, "step": 14854 }, { "entropy": 0.5374174825847149, "epoch": 1.366737396564712, "grad_norm": 0.15372520685195923, "learning_rate": 5.444536449228693e-05, "loss": 0.5156, "mean_token_accuracy": 0.8418491035699844, "num_tokens": 474115928.0, "step": 14855 }, { "entropy": 0.6552369887940586, "epoch": 1.3668294029361534, "grad_norm": 0.16396315395832062, "learning_rate": 5.444229766614531e-05, "loss": 0.6333, "mean_token_accuracy": 0.8084022663533688, "num_tokens": 474147787.0, "step": 14856 }, { "entropy": 0.5074883843772113, "epoch": 1.3669214093075945, "grad_norm": 0.1615222990512848, "learning_rate": 5.4439230840003686e-05, "loss": 0.4958, "mean_token_accuracy": 0.8457372933626175, "num_tokens": 474179073.0, "step": 14857 }, { "entropy": 0.6052651219069958, "epoch": 1.3670134156790357, "grad_norm": 0.15707868337631226, "learning_rate": 5.4436164013862054e-05, "loss": 0.5886, "mean_token_accuracy": 0.8184614107012749, "num_tokens": 474211157.0, "step": 14858 }, { "entropy": 0.5801599398255348, "epoch": 1.367105422050477, "grad_norm": 0.157980278134346, "learning_rate": 5.443309718772043e-05, "loss": 0.561, "mean_token_accuracy": 0.8277778401970863, "num_tokens": 474242850.0, "step": 14859 }, { "entropy": 0.611263089813292, "epoch": 1.3671974284219182, "grad_norm": 0.16172994673252106, "learning_rate": 5.443003036157881e-05, "loss": 0.5995, "mean_token_accuracy": 0.8185182586312294, "num_tokens": 474274621.0, "step": 14860 }, { "entropy": 0.6083276364952326, "epoch": 1.3672894347933595, "grad_norm": 0.16299006342887878, "learning_rate": 5.442696353543718e-05, "loss": 0.6001, "mean_token_accuracy": 0.8140943571925163, "num_tokens": 474305844.0, "step": 14861 }, { "entropy": 0.5073516108095646, "epoch": 1.3673814411648006, "grad_norm": 0.15028104186058044, "learning_rate": 5.442389670929555e-05, "loss": 0.4919, "mean_token_accuracy": 0.8485007025301456, "num_tokens": 474338023.0, "step": 14862 }, { "entropy": 0.7381275799125433, "epoch": 1.3674734475362418, "grad_norm": 0.17506396770477295, "learning_rate": 5.442082988315392e-05, "loss": 0.7284, "mean_token_accuracy": 0.7773973718285561, "num_tokens": 474370101.0, "step": 14863 }, { "entropy": 0.6185234794393182, "epoch": 1.3675654539076831, "grad_norm": 0.1634891927242279, "learning_rate": 5.441776305701231e-05, "loss": 0.5837, "mean_token_accuracy": 0.8183968737721443, "num_tokens": 474401788.0, "step": 14864 }, { "entropy": 0.5785906105302274, "epoch": 1.3676574602791243, "grad_norm": 0.1476881355047226, "learning_rate": 5.4414696230870676e-05, "loss": 0.562, "mean_token_accuracy": 0.8252273499965668, "num_tokens": 474433566.0, "step": 14865 }, { "entropy": 0.5527751832269132, "epoch": 1.3677494666505656, "grad_norm": 0.14643536508083344, "learning_rate": 5.4411629404729044e-05, "loss": 0.5439, "mean_token_accuracy": 0.8305991739034653, "num_tokens": 474466178.0, "step": 14866 }, { "entropy": 0.5947403032332659, "epoch": 1.3678414730220068, "grad_norm": 0.15524381399154663, "learning_rate": 5.440856257858742e-05, "loss": 0.5817, "mean_token_accuracy": 0.8233547173440456, "num_tokens": 474498104.0, "step": 14867 }, { "entropy": 0.7445166651159525, "epoch": 1.367933479393448, "grad_norm": 0.17035000026226044, "learning_rate": 5.44054957524458e-05, "loss": 0.7495, "mean_token_accuracy": 0.7758444994688034, "num_tokens": 474530087.0, "step": 14868 }, { "entropy": 0.5506325522437692, "epoch": 1.3680254857648892, "grad_norm": 0.1537391096353531, "learning_rate": 5.4402428926304175e-05, "loss": 0.5459, "mean_token_accuracy": 0.8325963169336319, "num_tokens": 474562593.0, "step": 14869 }, { "entropy": 0.5940755093470216, "epoch": 1.3681174921363304, "grad_norm": 0.16118550300598145, "learning_rate": 5.439936210016254e-05, "loss": 0.5842, "mean_token_accuracy": 0.8225292377173901, "num_tokens": 474595100.0, "step": 14870 }, { "entropy": 0.6428136462345719, "epoch": 1.3682094985077717, "grad_norm": 0.1632632613182068, "learning_rate": 5.439629527402092e-05, "loss": 0.6264, "mean_token_accuracy": 0.8114411905407906, "num_tokens": 474626358.0, "step": 14871 }, { "entropy": 0.5930825788527727, "epoch": 1.3683015048792129, "grad_norm": 0.15263473987579346, "learning_rate": 5.43932284478793e-05, "loss": 0.584, "mean_token_accuracy": 0.8228264302015305, "num_tokens": 474658131.0, "step": 14872 }, { "entropy": 0.6010708883404732, "epoch": 1.368393511250654, "grad_norm": 0.15749865770339966, "learning_rate": 5.439016162173767e-05, "loss": 0.6066, "mean_token_accuracy": 0.8175395242869854, "num_tokens": 474690201.0, "step": 14873 }, { "entropy": 0.5901040313765407, "epoch": 1.3684855176220954, "grad_norm": 0.15229637920856476, "learning_rate": 5.438709479559604e-05, "loss": 0.5704, "mean_token_accuracy": 0.8185281231999397, "num_tokens": 474722002.0, "step": 14874 }, { "entropy": 0.6739374212920666, "epoch": 1.3685775239935365, "grad_norm": 0.16616389155387878, "learning_rate": 5.438402796945441e-05, "loss": 0.6752, "mean_token_accuracy": 0.7922751344740391, "num_tokens": 474754215.0, "step": 14875 }, { "entropy": 0.5694593265652657, "epoch": 1.3686695303649778, "grad_norm": 0.16645480692386627, "learning_rate": 5.438096114331279e-05, "loss": 0.5481, "mean_token_accuracy": 0.8357750996947289, "num_tokens": 474785884.0, "step": 14876 }, { "entropy": 0.5898637496866286, "epoch": 1.368761536736419, "grad_norm": 0.15699559450149536, "learning_rate": 5.4377894317171165e-05, "loss": 0.5778, "mean_token_accuracy": 0.8188724368810654, "num_tokens": 474817593.0, "step": 14877 }, { "entropy": 0.6675460822880268, "epoch": 1.3688535431078601, "grad_norm": 0.15829120576381683, "learning_rate": 5.437482749102953e-05, "loss": 0.6757, "mean_token_accuracy": 0.8008308447897434, "num_tokens": 474849100.0, "step": 14878 }, { "entropy": 0.5381361320614815, "epoch": 1.3689455494793015, "grad_norm": 0.14896848797798157, "learning_rate": 5.437176066488791e-05, "loss": 0.5344, "mean_token_accuracy": 0.8368161208927631, "num_tokens": 474880532.0, "step": 14879 }, { "entropy": 0.590598470531404, "epoch": 1.3690375558507426, "grad_norm": 0.15709273517131805, "learning_rate": 5.436869383874629e-05, "loss": 0.5887, "mean_token_accuracy": 0.820056289434433, "num_tokens": 474913093.0, "step": 14880 }, { "entropy": 0.5781155792064965, "epoch": 1.369129562222184, "grad_norm": 0.14672799408435822, "learning_rate": 5.436562701260466e-05, "loss": 0.5556, "mean_token_accuracy": 0.8264653161168098, "num_tokens": 474944935.0, "step": 14881 }, { "entropy": 0.6326858196407557, "epoch": 1.369221568593625, "grad_norm": 0.15443412959575653, "learning_rate": 5.436256018646303e-05, "loss": 0.6148, "mean_token_accuracy": 0.8104564808309078, "num_tokens": 474976404.0, "step": 14882 }, { "entropy": 0.6788447946310043, "epoch": 1.3693135749650662, "grad_norm": 0.16754133999347687, "learning_rate": 5.43594933603214e-05, "loss": 0.669, "mean_token_accuracy": 0.7969121672213078, "num_tokens": 475008197.0, "step": 14883 }, { "entropy": 0.574551367200911, "epoch": 1.3694055813365076, "grad_norm": 0.17190413177013397, "learning_rate": 5.435642653417978e-05, "loss": 0.5629, "mean_token_accuracy": 0.8290866613388062, "num_tokens": 475038692.0, "step": 14884 }, { "entropy": 0.628354037180543, "epoch": 1.3694975877079487, "grad_norm": 0.15953034162521362, "learning_rate": 5.4353359708038156e-05, "loss": 0.6045, "mean_token_accuracy": 0.8165908046066761, "num_tokens": 475070950.0, "step": 14885 }, { "entropy": 0.5960626723244786, "epoch": 1.36958959407939, "grad_norm": 0.1487419307231903, "learning_rate": 5.4350292881896524e-05, "loss": 0.5904, "mean_token_accuracy": 0.8206704929471016, "num_tokens": 475103421.0, "step": 14886 }, { "entropy": 0.7228640057146549, "epoch": 1.3696816004508312, "grad_norm": 0.16579246520996094, "learning_rate": 5.4347226055754905e-05, "loss": 0.7162, "mean_token_accuracy": 0.7832732535898685, "num_tokens": 475134998.0, "step": 14887 }, { "entropy": 0.71418615616858, "epoch": 1.3697736068222723, "grad_norm": 0.1615007519721985, "learning_rate": 5.434415922961328e-05, "loss": 0.6992, "mean_token_accuracy": 0.7893525697290897, "num_tokens": 475167166.0, "step": 14888 }, { "entropy": 0.5117521500214934, "epoch": 1.3698656131937137, "grad_norm": 0.14506462216377258, "learning_rate": 5.434109240347165e-05, "loss": 0.4968, "mean_token_accuracy": 0.8450639732182026, "num_tokens": 475198752.0, "step": 14889 }, { "entropy": 0.6173694618046284, "epoch": 1.3699576195651548, "grad_norm": 0.15831980109214783, "learning_rate": 5.433802557733002e-05, "loss": 0.5987, "mean_token_accuracy": 0.8133906088769436, "num_tokens": 475230510.0, "step": 14890 }, { "entropy": 0.6708178520202637, "epoch": 1.3700496259365962, "grad_norm": 0.15979434549808502, "learning_rate": 5.4334958751188404e-05, "loss": 0.6646, "mean_token_accuracy": 0.7943404279649258, "num_tokens": 475262087.0, "step": 14891 }, { "entropy": 0.7762134876102209, "epoch": 1.3701416323080373, "grad_norm": 0.16818411648273468, "learning_rate": 5.433189192504677e-05, "loss": 0.7672, "mean_token_accuracy": 0.7687661908566952, "num_tokens": 475294538.0, "step": 14892 }, { "entropy": 0.6628153277561069, "epoch": 1.3702336386794784, "grad_norm": 0.15749314427375793, "learning_rate": 5.4328825098905146e-05, "loss": 0.6591, "mean_token_accuracy": 0.797665748745203, "num_tokens": 475326268.0, "step": 14893 }, { "entropy": 0.5957813560962677, "epoch": 1.3703256450509198, "grad_norm": 0.15724897384643555, "learning_rate": 5.4325758272763514e-05, "loss": 0.5791, "mean_token_accuracy": 0.8233277834951878, "num_tokens": 475358278.0, "step": 14894 }, { "entropy": 0.657971803098917, "epoch": 1.370417651422361, "grad_norm": 0.1700311303138733, "learning_rate": 5.4322691446621895e-05, "loss": 0.6686, "mean_token_accuracy": 0.7960115037858486, "num_tokens": 475390776.0, "step": 14895 }, { "entropy": 0.5743267592042685, "epoch": 1.3705096577938023, "grad_norm": 0.15865685045719147, "learning_rate": 5.431962462048027e-05, "loss": 0.5531, "mean_token_accuracy": 0.8271050825715065, "num_tokens": 475421162.0, "step": 14896 }, { "entropy": 0.5670245569199324, "epoch": 1.3706016641652434, "grad_norm": 0.1550329327583313, "learning_rate": 5.431655779433864e-05, "loss": 0.5441, "mean_token_accuracy": 0.8325482569634914, "num_tokens": 475452804.0, "step": 14897 }, { "entropy": 0.5114805037155747, "epoch": 1.3706936705366846, "grad_norm": 0.14961715042591095, "learning_rate": 5.431349096819701e-05, "loss": 0.5044, "mean_token_accuracy": 0.844264879822731, "num_tokens": 475485304.0, "step": 14898 }, { "entropy": 0.6827250346541405, "epoch": 1.370785676908126, "grad_norm": 0.15722383558750153, "learning_rate": 5.4310424142055394e-05, "loss": 0.6679, "mean_token_accuracy": 0.7977500222623348, "num_tokens": 475517836.0, "step": 14899 }, { "entropy": 0.6422661524266005, "epoch": 1.370877683279567, "grad_norm": 0.15578578412532806, "learning_rate": 5.430735731591376e-05, "loss": 0.6297, "mean_token_accuracy": 0.8039793968200684, "num_tokens": 475549698.0, "step": 14900 }, { "entropy": 0.6488235425204039, "epoch": 1.3709696896510084, "grad_norm": 0.15675760805606842, "learning_rate": 5.4304290489772137e-05, "loss": 0.643, "mean_token_accuracy": 0.803089801222086, "num_tokens": 475582373.0, "step": 14901 }, { "entropy": 0.6622053664177656, "epoch": 1.3710616960224495, "grad_norm": 0.159122496843338, "learning_rate": 5.4301223663630504e-05, "loss": 0.6394, "mean_token_accuracy": 0.7978577241301537, "num_tokens": 475613703.0, "step": 14902 }, { "entropy": 0.7200161423534155, "epoch": 1.3711537023938907, "grad_norm": 0.16966088116168976, "learning_rate": 5.429815683748889e-05, "loss": 0.7087, "mean_token_accuracy": 0.7868615873157978, "num_tokens": 475645559.0, "step": 14903 }, { "entropy": 0.6032181028276682, "epoch": 1.371245708765332, "grad_norm": 0.1498129814863205, "learning_rate": 5.429509001134726e-05, "loss": 0.5933, "mean_token_accuracy": 0.8175404220819473, "num_tokens": 475677741.0, "step": 14904 }, { "entropy": 0.6834641979075968, "epoch": 1.3713377151367732, "grad_norm": 0.15917041897773743, "learning_rate": 5.429202318520563e-05, "loss": 0.6695, "mean_token_accuracy": 0.7986400201916695, "num_tokens": 475709650.0, "step": 14905 }, { "entropy": 0.6026671696454287, "epoch": 1.3714297215082145, "grad_norm": 0.16216519474983215, "learning_rate": 5.4288956359064e-05, "loss": 0.5918, "mean_token_accuracy": 0.8184634521603584, "num_tokens": 475741558.0, "step": 14906 }, { "entropy": 0.6627792250365019, "epoch": 1.3715217278796556, "grad_norm": 0.165084570646286, "learning_rate": 5.4285889532922384e-05, "loss": 0.6593, "mean_token_accuracy": 0.7990543693304062, "num_tokens": 475773563.0, "step": 14907 }, { "entropy": 0.5404683882370591, "epoch": 1.3716137342510968, "grad_norm": 0.15504030883312225, "learning_rate": 5.428282270678076e-05, "loss": 0.5168, "mean_token_accuracy": 0.8398977555334568, "num_tokens": 475805489.0, "step": 14908 }, { "entropy": 0.6037964820861816, "epoch": 1.3717057406225381, "grad_norm": 0.16052764654159546, "learning_rate": 5.427975588063913e-05, "loss": 0.5987, "mean_token_accuracy": 0.8144530653953552, "num_tokens": 475837563.0, "step": 14909 }, { "entropy": 0.6372378915548325, "epoch": 1.3717977469939793, "grad_norm": 0.15905533730983734, "learning_rate": 5.4276689054497495e-05, "loss": 0.6196, "mean_token_accuracy": 0.8087698668241501, "num_tokens": 475869937.0, "step": 14910 }, { "entropy": 0.6649472638964653, "epoch": 1.3718897533654206, "grad_norm": 0.15856100618839264, "learning_rate": 5.427362222835588e-05, "loss": 0.6498, "mean_token_accuracy": 0.8033129535615444, "num_tokens": 475901742.0, "step": 14911 }, { "entropy": 0.6078518005087972, "epoch": 1.3719817597368618, "grad_norm": 0.16381117701530457, "learning_rate": 5.427055540221425e-05, "loss": 0.6184, "mean_token_accuracy": 0.8114999309182167, "num_tokens": 475932873.0, "step": 14912 }, { "entropy": 0.6511949338018894, "epoch": 1.372073766108303, "grad_norm": 0.16267450153827667, "learning_rate": 5.4267488576072626e-05, "loss": 0.6412, "mean_token_accuracy": 0.8020018748939037, "num_tokens": 475963824.0, "step": 14913 }, { "entropy": 0.5571130737662315, "epoch": 1.3721657724797443, "grad_norm": 0.1556788831949234, "learning_rate": 5.4264421749930993e-05, "loss": 0.5397, "mean_token_accuracy": 0.8266228996217251, "num_tokens": 475995770.0, "step": 14914 }, { "entropy": 0.6134438598528504, "epoch": 1.3722577788511854, "grad_norm": 0.16849982738494873, "learning_rate": 5.4261354923789375e-05, "loss": 0.5956, "mean_token_accuracy": 0.82152059674263, "num_tokens": 476026949.0, "step": 14915 }, { "entropy": 0.6822099164128304, "epoch": 1.3723497852226267, "grad_norm": 0.1673053801059723, "learning_rate": 5.425828809764775e-05, "loss": 0.6674, "mean_token_accuracy": 0.7990541867911816, "num_tokens": 476059103.0, "step": 14916 }, { "entropy": 0.6646579457446933, "epoch": 1.3724417915940679, "grad_norm": 0.16281060874462128, "learning_rate": 5.425522127150612e-05, "loss": 0.6595, "mean_token_accuracy": 0.8028423897922039, "num_tokens": 476090585.0, "step": 14917 }, { "entropy": 0.5738340057432652, "epoch": 1.372533797965509, "grad_norm": 0.15015539526939392, "learning_rate": 5.42521544453645e-05, "loss": 0.5575, "mean_token_accuracy": 0.8264924101531506, "num_tokens": 476121733.0, "step": 14918 }, { "entropy": 0.7694063372910023, "epoch": 1.3726258043369504, "grad_norm": 0.16549956798553467, "learning_rate": 5.4249087619222873e-05, "loss": 0.748, "mean_token_accuracy": 0.7704296670854092, "num_tokens": 476153041.0, "step": 14919 }, { "entropy": 0.5457449201494455, "epoch": 1.3727178107083915, "grad_norm": 0.147752583026886, "learning_rate": 5.424602079308124e-05, "loss": 0.5162, "mean_token_accuracy": 0.8399834744632244, "num_tokens": 476185388.0, "step": 14920 }, { "entropy": 0.6684708949178457, "epoch": 1.3728098170798329, "grad_norm": 0.15777859091758728, "learning_rate": 5.4242953966939616e-05, "loss": 0.6414, "mean_token_accuracy": 0.8052492886781693, "num_tokens": 476217645.0, "step": 14921 }, { "entropy": 0.6173944545444101, "epoch": 1.372901823451274, "grad_norm": 0.1578381359577179, "learning_rate": 5.4239887140798e-05, "loss": 0.6022, "mean_token_accuracy": 0.8144170418381691, "num_tokens": 476249929.0, "step": 14922 }, { "entropy": 0.6773587320931256, "epoch": 1.3729938298227151, "grad_norm": 0.15703195333480835, "learning_rate": 5.4236820314656365e-05, "loss": 0.6712, "mean_token_accuracy": 0.795068085193634, "num_tokens": 476281974.0, "step": 14923 }, { "entropy": 0.6438519507646561, "epoch": 1.3730858361941565, "grad_norm": 0.15941546857357025, "learning_rate": 5.423375348851474e-05, "loss": 0.6321, "mean_token_accuracy": 0.8076662495732307, "num_tokens": 476314345.0, "step": 14924 }, { "entropy": 0.6668091854080558, "epoch": 1.3731778425655976, "grad_norm": 0.1667299121618271, "learning_rate": 5.423068666237311e-05, "loss": 0.6684, "mean_token_accuracy": 0.7994198277592659, "num_tokens": 476346037.0, "step": 14925 }, { "entropy": 0.5572089804336429, "epoch": 1.373269848937039, "grad_norm": 0.1539291888475418, "learning_rate": 5.422761983623149e-05, "loss": 0.5406, "mean_token_accuracy": 0.8326855711638927, "num_tokens": 476377988.0, "step": 14926 }, { "entropy": 0.695832371711731, "epoch": 1.37336185530848, "grad_norm": 0.16865475475788116, "learning_rate": 5.4224553010089864e-05, "loss": 0.7064, "mean_token_accuracy": 0.784368671476841, "num_tokens": 476410078.0, "step": 14927 }, { "entropy": 0.6296723233535886, "epoch": 1.3734538616799212, "grad_norm": 0.16721509397029877, "learning_rate": 5.422148618394823e-05, "loss": 0.6169, "mean_token_accuracy": 0.8149751052260399, "num_tokens": 476441972.0, "step": 14928 }, { "entropy": 0.5915725566446781, "epoch": 1.3735458680513626, "grad_norm": 0.15250064432621002, "learning_rate": 5.4218419357806606e-05, "loss": 0.5676, "mean_token_accuracy": 0.8235325664281845, "num_tokens": 476473781.0, "step": 14929 }, { "entropy": 0.45378031535074115, "epoch": 1.3736378744228037, "grad_norm": 0.14577716588974, "learning_rate": 5.421535253166499e-05, "loss": 0.4432, "mean_token_accuracy": 0.8630438409745693, "num_tokens": 476505986.0, "step": 14930 }, { "entropy": 0.5906660961918533, "epoch": 1.373729880794245, "grad_norm": 0.16181032359600067, "learning_rate": 5.4212285705523356e-05, "loss": 0.5751, "mean_token_accuracy": 0.8207370638847351, "num_tokens": 476537211.0, "step": 14931 }, { "entropy": 0.6621408006176353, "epoch": 1.3738218871656862, "grad_norm": 0.16396458446979523, "learning_rate": 5.420921887938173e-05, "loss": 0.6529, "mean_token_accuracy": 0.8028239011764526, "num_tokens": 476568686.0, "step": 14932 }, { "entropy": 0.6233959570527077, "epoch": 1.3739138935371273, "grad_norm": 0.16840438544750214, "learning_rate": 5.42061520532401e-05, "loss": 0.6046, "mean_token_accuracy": 0.8161724507808685, "num_tokens": 476600851.0, "step": 14933 }, { "entropy": 0.6087331082671881, "epoch": 1.3740058999085687, "grad_norm": 0.15533605217933655, "learning_rate": 5.420308522709848e-05, "loss": 0.5965, "mean_token_accuracy": 0.8162521980702877, "num_tokens": 476631797.0, "step": 14934 }, { "entropy": 0.6721489056944847, "epoch": 1.3740979062800098, "grad_norm": 0.16184942424297333, "learning_rate": 5.4200018400956854e-05, "loss": 0.6687, "mean_token_accuracy": 0.7977869249880314, "num_tokens": 476663533.0, "step": 14935 }, { "entropy": 0.7073728051036596, "epoch": 1.3741899126514512, "grad_norm": 0.16507865488529205, "learning_rate": 5.419695157481522e-05, "loss": 0.7066, "mean_token_accuracy": 0.7857302390038967, "num_tokens": 476695467.0, "step": 14936 }, { "entropy": 0.7006683964282274, "epoch": 1.3742819190228923, "grad_norm": 0.16022302210330963, "learning_rate": 5.41938847486736e-05, "loss": 0.6934, "mean_token_accuracy": 0.7897386327385902, "num_tokens": 476727863.0, "step": 14937 }, { "entropy": 0.6242291200906038, "epoch": 1.3743739253943335, "grad_norm": 0.15441511571407318, "learning_rate": 5.419081792253198e-05, "loss": 0.6284, "mean_token_accuracy": 0.8076505176723003, "num_tokens": 476760260.0, "step": 14938 }, { "entropy": 0.5531758470460773, "epoch": 1.3744659317657748, "grad_norm": 0.14987966418266296, "learning_rate": 5.4187751096390346e-05, "loss": 0.5579, "mean_token_accuracy": 0.8284235149621964, "num_tokens": 476792731.0, "step": 14939 }, { "entropy": 0.6076144333928823, "epoch": 1.374557938137216, "grad_norm": 0.15852390229701996, "learning_rate": 5.418468427024872e-05, "loss": 0.5861, "mean_token_accuracy": 0.8208057768642902, "num_tokens": 476824781.0, "step": 14940 }, { "entropy": 0.6609813831746578, "epoch": 1.3746499445086573, "grad_norm": 0.15536239743232727, "learning_rate": 5.418161744410709e-05, "loss": 0.6465, "mean_token_accuracy": 0.8005546294152737, "num_tokens": 476857184.0, "step": 14941 }, { "entropy": 0.646066527813673, "epoch": 1.3747419508800984, "grad_norm": 0.15560486912727356, "learning_rate": 5.417855061796547e-05, "loss": 0.6268, "mean_token_accuracy": 0.8072894252836704, "num_tokens": 476889563.0, "step": 14942 }, { "entropy": 0.6807376118376851, "epoch": 1.3748339572515396, "grad_norm": 0.1597168743610382, "learning_rate": 5.4175483791823845e-05, "loss": 0.6578, "mean_token_accuracy": 0.8030672967433929, "num_tokens": 476921747.0, "step": 14943 }, { "entropy": 0.6894102860242128, "epoch": 1.374925963622981, "grad_norm": 0.16127389669418335, "learning_rate": 5.417241696568221e-05, "loss": 0.6772, "mean_token_accuracy": 0.7946926839649677, "num_tokens": 476954491.0, "step": 14944 }, { "entropy": 0.6464547924697399, "epoch": 1.375017969994422, "grad_norm": 0.1649363487958908, "learning_rate": 5.416935013954059e-05, "loss": 0.6416, "mean_token_accuracy": 0.8082542568445206, "num_tokens": 476985390.0, "step": 14945 }, { "entropy": 0.5954149379394948, "epoch": 1.3751099763658634, "grad_norm": 0.1545429676771164, "learning_rate": 5.416628331339897e-05, "loss": 0.5663, "mean_token_accuracy": 0.8221376836299896, "num_tokens": 477016846.0, "step": 14946 }, { "entropy": 0.5842277267947793, "epoch": 1.3752019827373045, "grad_norm": 0.15563949942588806, "learning_rate": 5.416321648725734e-05, "loss": 0.5596, "mean_token_accuracy": 0.8278061673045158, "num_tokens": 477048530.0, "step": 14947 }, { "entropy": 0.5850693434476852, "epoch": 1.3752939891087457, "grad_norm": 0.1570942997932434, "learning_rate": 5.416014966111571e-05, "loss": 0.5804, "mean_token_accuracy": 0.821444496512413, "num_tokens": 477080025.0, "step": 14948 }, { "entropy": 0.6061463970690966, "epoch": 1.375385995480187, "grad_norm": 0.1638065129518509, "learning_rate": 5.415708283497409e-05, "loss": 0.5979, "mean_token_accuracy": 0.81351513043046, "num_tokens": 477111858.0, "step": 14949 }, { "entropy": 0.6208301279693842, "epoch": 1.3754780018516282, "grad_norm": 0.16443195939064026, "learning_rate": 5.415401600883247e-05, "loss": 0.6033, "mean_token_accuracy": 0.8120645023882389, "num_tokens": 477143593.0, "step": 14950 }, { "entropy": 0.6375775896012783, "epoch": 1.3755700082230695, "grad_norm": 0.1540077030658722, "learning_rate": 5.4150949182690835e-05, "loss": 0.6334, "mean_token_accuracy": 0.8031171336770058, "num_tokens": 477175832.0, "step": 14951 }, { "entropy": 0.6014215890318155, "epoch": 1.3756620145945107, "grad_norm": 0.15303002297878265, "learning_rate": 5.414788235654921e-05, "loss": 0.5811, "mean_token_accuracy": 0.8187747597694397, "num_tokens": 477207241.0, "step": 14952 }, { "entropy": 0.7780362404882908, "epoch": 1.3757540209659518, "grad_norm": 0.1707969307899475, "learning_rate": 5.414481553040759e-05, "loss": 0.7773, "mean_token_accuracy": 0.7663059011101723, "num_tokens": 477238937.0, "step": 14953 }, { "entropy": 0.5915431915782392, "epoch": 1.3758460273373931, "grad_norm": 0.15392686426639557, "learning_rate": 5.414174870426596e-05, "loss": 0.5902, "mean_token_accuracy": 0.8207919783890247, "num_tokens": 477271088.0, "step": 14954 }, { "entropy": 0.7848700080066919, "epoch": 1.3759380337088343, "grad_norm": 0.17320013046264648, "learning_rate": 5.4138681878124334e-05, "loss": 0.7844, "mean_token_accuracy": 0.766521118581295, "num_tokens": 477302787.0, "step": 14955 }, { "entropy": 0.7249782485887408, "epoch": 1.3760300400802756, "grad_norm": 0.16258549690246582, "learning_rate": 5.41356150519827e-05, "loss": 0.7318, "mean_token_accuracy": 0.7794199697673321, "num_tokens": 477335183.0, "step": 14956 }, { "entropy": 0.6321470141410828, "epoch": 1.3761220464517168, "grad_norm": 0.15147671103477478, "learning_rate": 5.413254822584108e-05, "loss": 0.6047, "mean_token_accuracy": 0.8132954724133015, "num_tokens": 477366516.0, "step": 14957 }, { "entropy": 0.6025239657610655, "epoch": 1.376214052823158, "grad_norm": 0.15633292496204376, "learning_rate": 5.412948139969946e-05, "loss": 0.5966, "mean_token_accuracy": 0.8181670047342777, "num_tokens": 477397979.0, "step": 14958 }, { "entropy": 0.6001942194998264, "epoch": 1.3763060591945993, "grad_norm": 0.1659117341041565, "learning_rate": 5.4126414573557826e-05, "loss": 0.5946, "mean_token_accuracy": 0.8199860192835331, "num_tokens": 477430013.0, "step": 14959 }, { "entropy": 0.5718221617862582, "epoch": 1.3763980655660404, "grad_norm": 0.16179119050502777, "learning_rate": 5.41233477474162e-05, "loss": 0.5641, "mean_token_accuracy": 0.8249674774706364, "num_tokens": 477462311.0, "step": 14960 }, { "entropy": 0.6472466103732586, "epoch": 1.3764900719374817, "grad_norm": 0.16060514748096466, "learning_rate": 5.412028092127458e-05, "loss": 0.6372, "mean_token_accuracy": 0.8036318495869637, "num_tokens": 477493871.0, "step": 14961 }, { "entropy": 0.6296706907451153, "epoch": 1.3765820783089229, "grad_norm": 0.1598348617553711, "learning_rate": 5.411721409513295e-05, "loss": 0.6248, "mean_token_accuracy": 0.81458830088377, "num_tokens": 477526288.0, "step": 14962 }, { "entropy": 0.678931251168251, "epoch": 1.376674084680364, "grad_norm": 0.16157111525535583, "learning_rate": 5.4114147268991324e-05, "loss": 0.6474, "mean_token_accuracy": 0.8023487366735935, "num_tokens": 477557627.0, "step": 14963 }, { "entropy": 0.621091527864337, "epoch": 1.3767660910518054, "grad_norm": 0.1541248857975006, "learning_rate": 5.411108044284969e-05, "loss": 0.5998, "mean_token_accuracy": 0.8174206390976906, "num_tokens": 477589733.0, "step": 14964 }, { "entropy": 0.6390293366275728, "epoch": 1.3768580974232465, "grad_norm": 0.1569078117609024, "learning_rate": 5.410801361670807e-05, "loss": 0.6295, "mean_token_accuracy": 0.8076532632112503, "num_tokens": 477622497.0, "step": 14965 }, { "entropy": 0.6113298204727471, "epoch": 1.3769501037946879, "grad_norm": 0.1548633873462677, "learning_rate": 5.410494679056645e-05, "loss": 0.5916, "mean_token_accuracy": 0.8199019357562065, "num_tokens": 477654995.0, "step": 14966 }, { "entropy": 0.6093850806355476, "epoch": 1.377042110166129, "grad_norm": 0.15288002789020538, "learning_rate": 5.4101879964424816e-05, "loss": 0.5954, "mean_token_accuracy": 0.8191415220499039, "num_tokens": 477687462.0, "step": 14967 }, { "entropy": 0.5133176017552614, "epoch": 1.3771341165375701, "grad_norm": 0.14790447056293488, "learning_rate": 5.409881313828319e-05, "loss": 0.481, "mean_token_accuracy": 0.8482778705656528, "num_tokens": 477719266.0, "step": 14968 }, { "entropy": 0.48965707095339894, "epoch": 1.3772261229090115, "grad_norm": 0.1466759294271469, "learning_rate": 5.409574631214157e-05, "loss": 0.4649, "mean_token_accuracy": 0.8522424399852753, "num_tokens": 477750722.0, "step": 14969 }, { "entropy": 0.5929316906258464, "epoch": 1.3773181292804526, "grad_norm": 0.15356934070587158, "learning_rate": 5.409267948599994e-05, "loss": 0.589, "mean_token_accuracy": 0.8218838274478912, "num_tokens": 477782727.0, "step": 14970 }, { "entropy": 0.5568674430251122, "epoch": 1.377410135651894, "grad_norm": 0.16415168344974518, "learning_rate": 5.4089612659858314e-05, "loss": 0.5449, "mean_token_accuracy": 0.8335238248109818, "num_tokens": 477815187.0, "step": 14971 }, { "entropy": 0.5396550511941314, "epoch": 1.377502142023335, "grad_norm": 0.1541062742471695, "learning_rate": 5.408654583371668e-05, "loss": 0.5289, "mean_token_accuracy": 0.8348345831036568, "num_tokens": 477847273.0, "step": 14972 }, { "entropy": 0.6643192125484347, "epoch": 1.3775941483947762, "grad_norm": 0.1624174416065216, "learning_rate": 5.4083479007575064e-05, "loss": 0.6538, "mean_token_accuracy": 0.7994563095271587, "num_tokens": 477878810.0, "step": 14973 }, { "entropy": 0.6851068306714296, "epoch": 1.3776861547662176, "grad_norm": 0.1626092493534088, "learning_rate": 5.408041218143344e-05, "loss": 0.6669, "mean_token_accuracy": 0.7998993545770645, "num_tokens": 477909328.0, "step": 14974 }, { "entropy": 0.730296466499567, "epoch": 1.3777781611376587, "grad_norm": 0.16266939043998718, "learning_rate": 5.4077345355291806e-05, "loss": 0.7234, "mean_token_accuracy": 0.7787055633962154, "num_tokens": 477941034.0, "step": 14975 }, { "entropy": 0.6126102562993765, "epoch": 1.3778701675091, "grad_norm": 0.1580500304698944, "learning_rate": 5.407427852915018e-05, "loss": 0.6014, "mean_token_accuracy": 0.8159619830548763, "num_tokens": 477972603.0, "step": 14976 }, { "entropy": 0.5875917375087738, "epoch": 1.3779621738805412, "grad_norm": 0.15936924517154694, "learning_rate": 5.407121170300856e-05, "loss": 0.5762, "mean_token_accuracy": 0.8238633461296558, "num_tokens": 478004380.0, "step": 14977 }, { "entropy": 0.569952230900526, "epoch": 1.3780541802519823, "grad_norm": 0.15177969634532928, "learning_rate": 5.406814487686693e-05, "loss": 0.5514, "mean_token_accuracy": 0.8311657048761845, "num_tokens": 478035854.0, "step": 14978 }, { "entropy": 0.6196613516658545, "epoch": 1.3781461866234237, "grad_norm": 0.1579984575510025, "learning_rate": 5.4065078050725305e-05, "loss": 0.6029, "mean_token_accuracy": 0.8151780180633068, "num_tokens": 478067723.0, "step": 14979 }, { "entropy": 0.5257614590227604, "epoch": 1.3782381929948648, "grad_norm": 0.15479078888893127, "learning_rate": 5.4062011224583686e-05, "loss": 0.5251, "mean_token_accuracy": 0.8354016318917274, "num_tokens": 478099179.0, "step": 14980 }, { "entropy": 0.6489925738424063, "epoch": 1.3783301993663062, "grad_norm": 0.1672946661710739, "learning_rate": 5.4058944398442054e-05, "loss": 0.6399, "mean_token_accuracy": 0.8049986511468887, "num_tokens": 478129807.0, "step": 14981 }, { "entropy": 0.6549622789025307, "epoch": 1.3784222057377473, "grad_norm": 0.16954101622104645, "learning_rate": 5.405587757230043e-05, "loss": 0.6495, "mean_token_accuracy": 0.8000534102320671, "num_tokens": 478159966.0, "step": 14982 }, { "entropy": 0.6780518721789122, "epoch": 1.3785142121091885, "grad_norm": 0.1772109866142273, "learning_rate": 5.40528107461588e-05, "loss": 0.6808, "mean_token_accuracy": 0.7937671355903149, "num_tokens": 478191744.0, "step": 14983 }, { "entropy": 0.5963972462341189, "epoch": 1.3786062184806298, "grad_norm": 0.15773724019527435, "learning_rate": 5.4049743920017185e-05, "loss": 0.5852, "mean_token_accuracy": 0.8246431611478329, "num_tokens": 478224273.0, "step": 14984 }, { "entropy": 0.6693075336515903, "epoch": 1.378698224852071, "grad_norm": 0.1630958467721939, "learning_rate": 5.404667709387555e-05, "loss": 0.6549, "mean_token_accuracy": 0.7969756051898003, "num_tokens": 478255443.0, "step": 14985 }, { "entropy": 0.5404051523655653, "epoch": 1.3787902312235123, "grad_norm": 0.15340377390384674, "learning_rate": 5.404361026773392e-05, "loss": 0.5341, "mean_token_accuracy": 0.8335658945143223, "num_tokens": 478287686.0, "step": 14986 }, { "entropy": 0.7285548830404878, "epoch": 1.3788822375949534, "grad_norm": 0.1629677712917328, "learning_rate": 5.4040543441592295e-05, "loss": 0.7289, "mean_token_accuracy": 0.780209805816412, "num_tokens": 478320171.0, "step": 14987 }, { "entropy": 0.6975354366004467, "epoch": 1.3789742439663946, "grad_norm": 0.1629534810781479, "learning_rate": 5.403747661545068e-05, "loss": 0.6999, "mean_token_accuracy": 0.7840665243566036, "num_tokens": 478351492.0, "step": 14988 }, { "entropy": 0.6440494647249579, "epoch": 1.379066250337836, "grad_norm": 0.16921094059944153, "learning_rate": 5.403440978930905e-05, "loss": 0.6198, "mean_token_accuracy": 0.8098917044699192, "num_tokens": 478382558.0, "step": 14989 }, { "entropy": 0.7207122538238764, "epoch": 1.379158256709277, "grad_norm": 0.16431032121181488, "learning_rate": 5.403134296316742e-05, "loss": 0.703, "mean_token_accuracy": 0.7862970903515816, "num_tokens": 478414446.0, "step": 14990 }, { "entropy": 0.6440649125725031, "epoch": 1.3792502630807184, "grad_norm": 0.1578667163848877, "learning_rate": 5.4028276137025794e-05, "loss": 0.6279, "mean_token_accuracy": 0.8037366457283497, "num_tokens": 478445936.0, "step": 14991 }, { "entropy": 0.6503578275442123, "epoch": 1.3793422694521595, "grad_norm": 0.15502312779426575, "learning_rate": 5.4025209310884175e-05, "loss": 0.6363, "mean_token_accuracy": 0.8062879741191864, "num_tokens": 478478317.0, "step": 14992 }, { "entropy": 0.5858661392703652, "epoch": 1.3794342758236007, "grad_norm": 0.15446995198726654, "learning_rate": 5.402214248474254e-05, "loss": 0.573, "mean_token_accuracy": 0.8200505711138248, "num_tokens": 478510020.0, "step": 14993 }, { "entropy": 0.6279553426429629, "epoch": 1.379526282195042, "grad_norm": 0.15133118629455566, "learning_rate": 5.401907565860092e-05, "loss": 0.6134, "mean_token_accuracy": 0.8086814992129803, "num_tokens": 478542107.0, "step": 14994 }, { "entropy": 0.5817398340441287, "epoch": 1.3796182885664832, "grad_norm": 0.16062569618225098, "learning_rate": 5.4016008832459286e-05, "loss": 0.5722, "mean_token_accuracy": 0.8220590353012085, "num_tokens": 478573941.0, "step": 14995 }, { "entropy": 0.7425936358049512, "epoch": 1.3797102949379245, "grad_norm": 0.1605396866798401, "learning_rate": 5.401294200631767e-05, "loss": 0.7294, "mean_token_accuracy": 0.7794704213738441, "num_tokens": 478605992.0, "step": 14996 }, { "entropy": 0.6473066676408052, "epoch": 1.3798023013093657, "grad_norm": 0.14965051412582397, "learning_rate": 5.400987518017604e-05, "loss": 0.6247, "mean_token_accuracy": 0.8093862757086754, "num_tokens": 478638148.0, "step": 14997 }, { "entropy": 0.6247008079662919, "epoch": 1.3798943076808068, "grad_norm": 0.17262914776802063, "learning_rate": 5.400680835403441e-05, "loss": 0.6213, "mean_token_accuracy": 0.8108941577374935, "num_tokens": 478670014.0, "step": 14998 }, { "entropy": 0.5164309190586209, "epoch": 1.3799863140522481, "grad_norm": 0.14479126036167145, "learning_rate": 5.4003741527892784e-05, "loss": 0.5137, "mean_token_accuracy": 0.8392765298485756, "num_tokens": 478702655.0, "step": 14999 }, { "entropy": 0.5359436827711761, "epoch": 1.3800783204236893, "grad_norm": 0.1496240496635437, "learning_rate": 5.4000674701751166e-05, "loss": 0.514, "mean_token_accuracy": 0.8401033207774162, "num_tokens": 478734605.0, "step": 15000 }, { "entropy": 0.6185065116733313, "epoch": 1.3801703267951306, "grad_norm": 0.16110318899154663, "learning_rate": 5.3997607875609534e-05, "loss": 0.5838, "mean_token_accuracy": 0.8215113878250122, "num_tokens": 478766338.0, "step": 15001 }, { "entropy": 0.6143472399562597, "epoch": 1.3802623331665718, "grad_norm": 0.15979760885238647, "learning_rate": 5.399454104946791e-05, "loss": 0.6078, "mean_token_accuracy": 0.8155271969735622, "num_tokens": 478797792.0, "step": 15002 }, { "entropy": 0.5335310762748122, "epoch": 1.380354339538013, "grad_norm": 0.14508089423179626, "learning_rate": 5.3991474223326276e-05, "loss": 0.5099, "mean_token_accuracy": 0.8414219506084919, "num_tokens": 478830153.0, "step": 15003 }, { "entropy": 0.5688100233674049, "epoch": 1.3804463459094543, "grad_norm": 0.15641526877880096, "learning_rate": 5.398840739718466e-05, "loss": 0.5526, "mean_token_accuracy": 0.8309963792562485, "num_tokens": 478862045.0, "step": 15004 }, { "entropy": 0.6460552830249071, "epoch": 1.3805383522808954, "grad_norm": 0.16073668003082275, "learning_rate": 5.398534057104303e-05, "loss": 0.6506, "mean_token_accuracy": 0.804061770439148, "num_tokens": 478893494.0, "step": 15005 }, { "entropy": 0.6307973035145551, "epoch": 1.3806303586523367, "grad_norm": 0.15409615635871887, "learning_rate": 5.39822737449014e-05, "loss": 0.631, "mean_token_accuracy": 0.8054283149540424, "num_tokens": 478925470.0, "step": 15006 }, { "entropy": 0.5753796044737101, "epoch": 1.3807223650237779, "grad_norm": 0.16327784955501556, "learning_rate": 5.3979206918759775e-05, "loss": 0.5687, "mean_token_accuracy": 0.8262509219348431, "num_tokens": 478957524.0, "step": 15007 }, { "entropy": 0.7297482471913099, "epoch": 1.380814371395219, "grad_norm": 0.1712968945503235, "learning_rate": 5.3976140092618156e-05, "loss": 0.7142, "mean_token_accuracy": 0.7827882654964924, "num_tokens": 478989801.0, "step": 15008 }, { "entropy": 0.7003817902877927, "epoch": 1.3809063777666604, "grad_norm": 0.16429539024829865, "learning_rate": 5.3973073266476524e-05, "loss": 0.6852, "mean_token_accuracy": 0.7929309085011482, "num_tokens": 479021656.0, "step": 15009 }, { "entropy": 0.5802193805575371, "epoch": 1.3809983841381015, "grad_norm": 0.1579047292470932, "learning_rate": 5.39700064403349e-05, "loss": 0.5737, "mean_token_accuracy": 0.8273662999272346, "num_tokens": 479053781.0, "step": 15010 }, { "entropy": 0.5672704000025988, "epoch": 1.3810903905095429, "grad_norm": 0.1511450856924057, "learning_rate": 5.396693961419328e-05, "loss": 0.545, "mean_token_accuracy": 0.8296195417642593, "num_tokens": 479085306.0, "step": 15011 }, { "entropy": 0.554361030459404, "epoch": 1.381182396880984, "grad_norm": 0.150045707821846, "learning_rate": 5.396387278805165e-05, "loss": 0.5506, "mean_token_accuracy": 0.8310933820903301, "num_tokens": 479117206.0, "step": 15012 }, { "entropy": 0.6267484975978732, "epoch": 1.3812744032524251, "grad_norm": 0.1571190506219864, "learning_rate": 5.396080596191002e-05, "loss": 0.6154, "mean_token_accuracy": 0.8129322901368141, "num_tokens": 479149645.0, "step": 15013 }, { "entropy": 0.5969376154243946, "epoch": 1.3813664096238665, "grad_norm": 0.1543402075767517, "learning_rate": 5.395773913576839e-05, "loss": 0.6014, "mean_token_accuracy": 0.8141588792204857, "num_tokens": 479181272.0, "step": 15014 }, { "entropy": 0.609663711860776, "epoch": 1.3814584159953076, "grad_norm": 0.15388818085193634, "learning_rate": 5.395467230962677e-05, "loss": 0.6014, "mean_token_accuracy": 0.8170346617698669, "num_tokens": 479213072.0, "step": 15015 }, { "entropy": 0.6136439442634583, "epoch": 1.381550422366749, "grad_norm": 0.1560717225074768, "learning_rate": 5.3951605483485147e-05, "loss": 0.5929, "mean_token_accuracy": 0.8178392499685287, "num_tokens": 479244466.0, "step": 15016 }, { "entropy": 0.49896139558404684, "epoch": 1.38164242873819, "grad_norm": 0.1522819697856903, "learning_rate": 5.3948538657343514e-05, "loss": 0.4974, "mean_token_accuracy": 0.8466627970337868, "num_tokens": 479276776.0, "step": 15017 }, { "entropy": 0.597970062866807, "epoch": 1.3817344351096312, "grad_norm": 0.15863490104675293, "learning_rate": 5.394547183120189e-05, "loss": 0.5849, "mean_token_accuracy": 0.820741705596447, "num_tokens": 479309155.0, "step": 15018 }, { "entropy": 0.6007932219654322, "epoch": 1.3818264414810726, "grad_norm": 0.16121463477611542, "learning_rate": 5.394240500506027e-05, "loss": 0.5881, "mean_token_accuracy": 0.8201408982276917, "num_tokens": 479341191.0, "step": 15019 }, { "entropy": 0.6086448221467435, "epoch": 1.3819184478525137, "grad_norm": 0.15991990268230438, "learning_rate": 5.393933817891864e-05, "loss": 0.6013, "mean_token_accuracy": 0.8165146633982658, "num_tokens": 479373165.0, "step": 15020 }, { "entropy": 0.556672926992178, "epoch": 1.382010454223955, "grad_norm": 0.16236868500709534, "learning_rate": 5.393627135277701e-05, "loss": 0.5464, "mean_token_accuracy": 0.8284193128347397, "num_tokens": 479404632.0, "step": 15021 }, { "entropy": 0.6818356104195118, "epoch": 1.3821024605953962, "grad_norm": 0.15493476390838623, "learning_rate": 5.393320452663538e-05, "loss": 0.6838, "mean_token_accuracy": 0.7934299074113369, "num_tokens": 479436682.0, "step": 15022 }, { "entropy": 0.7117904433980584, "epoch": 1.3821944669668373, "grad_norm": 0.16159141063690186, "learning_rate": 5.393013770049377e-05, "loss": 0.6898, "mean_token_accuracy": 0.7907328195869923, "num_tokens": 479468089.0, "step": 15023 }, { "entropy": 0.6025333912111819, "epoch": 1.3822864733382787, "grad_norm": 0.1475444883108139, "learning_rate": 5.392707087435214e-05, "loss": 0.5881, "mean_token_accuracy": 0.8216991573572159, "num_tokens": 479500618.0, "step": 15024 }, { "entropy": 0.5389242614619434, "epoch": 1.3823784797097198, "grad_norm": 0.1526334285736084, "learning_rate": 5.3924004048210505e-05, "loss": 0.5241, "mean_token_accuracy": 0.8370568454265594, "num_tokens": 479532634.0, "step": 15025 }, { "entropy": 0.640519404783845, "epoch": 1.3824704860811612, "grad_norm": 0.15652033686637878, "learning_rate": 5.392093722206888e-05, "loss": 0.6244, "mean_token_accuracy": 0.8060200251638889, "num_tokens": 479564390.0, "step": 15026 }, { "entropy": 0.520042672753334, "epoch": 1.3825624924526023, "grad_norm": 0.1502406746149063, "learning_rate": 5.391787039592726e-05, "loss": 0.5002, "mean_token_accuracy": 0.8470633067190647, "num_tokens": 479595738.0, "step": 15027 }, { "entropy": 0.5914176166988909, "epoch": 1.3826544988240435, "grad_norm": 0.15870077908039093, "learning_rate": 5.3914803569785636e-05, "loss": 0.579, "mean_token_accuracy": 0.8244524374604225, "num_tokens": 479627215.0, "step": 15028 }, { "entropy": 0.6019380462821573, "epoch": 1.3827465051954848, "grad_norm": 0.15423409640789032, "learning_rate": 5.3911736743644003e-05, "loss": 0.5848, "mean_token_accuracy": 0.820493221282959, "num_tokens": 479659341.0, "step": 15029 }, { "entropy": 0.5767673943191767, "epoch": 1.382838511566926, "grad_norm": 0.15452925860881805, "learning_rate": 5.390866991750237e-05, "loss": 0.5564, "mean_token_accuracy": 0.8274812810122967, "num_tokens": 479690508.0, "step": 15030 }, { "entropy": 0.6906782947480679, "epoch": 1.3829305179383673, "grad_norm": 0.1595180332660675, "learning_rate": 5.390560309136076e-05, "loss": 0.6784, "mean_token_accuracy": 0.7927804253995419, "num_tokens": 479722443.0, "step": 15031 }, { "entropy": 0.5198345426470041, "epoch": 1.3830225243098084, "grad_norm": 0.14924463629722595, "learning_rate": 5.390253626521913e-05, "loss": 0.5219, "mean_token_accuracy": 0.8407010957598686, "num_tokens": 479753839.0, "step": 15032 }, { "entropy": 0.5914210025221109, "epoch": 1.3831145306812496, "grad_norm": 0.1535811722278595, "learning_rate": 5.38994694390775e-05, "loss": 0.5769, "mean_token_accuracy": 0.8160724528133869, "num_tokens": 479785671.0, "step": 15033 }, { "entropy": 0.6792634837329388, "epoch": 1.383206537052691, "grad_norm": 0.15814119577407837, "learning_rate": 5.389640261293587e-05, "loss": 0.6668, "mean_token_accuracy": 0.7967772521078587, "num_tokens": 479817525.0, "step": 15034 }, { "entropy": 0.6095374701544642, "epoch": 1.383298543424132, "grad_norm": 0.16440792381763458, "learning_rate": 5.389333578679425e-05, "loss": 0.6119, "mean_token_accuracy": 0.8150526769459248, "num_tokens": 479849743.0, "step": 15035 }, { "entropy": 0.6934779398143291, "epoch": 1.3833905497955734, "grad_norm": 0.16450487077236176, "learning_rate": 5.3890268960652626e-05, "loss": 0.6857, "mean_token_accuracy": 0.7909518927335739, "num_tokens": 479881226.0, "step": 15036 }, { "entropy": 0.6048901826143265, "epoch": 1.3834825561670145, "grad_norm": 0.1595529317855835, "learning_rate": 5.3887202134510994e-05, "loss": 0.5975, "mean_token_accuracy": 0.8175789378583431, "num_tokens": 479913144.0, "step": 15037 }, { "entropy": 0.6734392959624529, "epoch": 1.3835745625384557, "grad_norm": 0.16423486173152924, "learning_rate": 5.388413530836937e-05, "loss": 0.6638, "mean_token_accuracy": 0.7979573383927345, "num_tokens": 479943898.0, "step": 15038 }, { "entropy": 0.6966054439544678, "epoch": 1.383666568909897, "grad_norm": 0.17275530099868774, "learning_rate": 5.388106848222775e-05, "loss": 0.6874, "mean_token_accuracy": 0.7860759384930134, "num_tokens": 479975412.0, "step": 15039 }, { "entropy": 0.5510879866778851, "epoch": 1.3837585752813382, "grad_norm": 0.15449151396751404, "learning_rate": 5.387800165608612e-05, "loss": 0.545, "mean_token_accuracy": 0.8321738876402378, "num_tokens": 480007317.0, "step": 15040 }, { "entropy": 0.6894300431013107, "epoch": 1.3838505816527795, "grad_norm": 0.16714809834957123, "learning_rate": 5.387493482994449e-05, "loss": 0.6936, "mean_token_accuracy": 0.7934844568371773, "num_tokens": 480039444.0, "step": 15041 }, { "entropy": 0.6194839328527451, "epoch": 1.3839425880242207, "grad_norm": 0.15879708528518677, "learning_rate": 5.3871868003802874e-05, "loss": 0.5973, "mean_token_accuracy": 0.8161039762198925, "num_tokens": 480070342.0, "step": 15042 }, { "entropy": 0.5356742721050978, "epoch": 1.3840345943956618, "grad_norm": 0.15329709649085999, "learning_rate": 5.386880117766124e-05, "loss": 0.5181, "mean_token_accuracy": 0.8429401405155659, "num_tokens": 480102378.0, "step": 15043 }, { "entropy": 0.5813276525586843, "epoch": 1.3841266007671031, "grad_norm": 0.15270957350730896, "learning_rate": 5.3865734351519616e-05, "loss": 0.5594, "mean_token_accuracy": 0.8226130679249763, "num_tokens": 480134436.0, "step": 15044 }, { "entropy": 0.7102247402071953, "epoch": 1.3842186071385443, "grad_norm": 0.1684463918209076, "learning_rate": 5.3862667525377984e-05, "loss": 0.7049, "mean_token_accuracy": 0.790333416312933, "num_tokens": 480167204.0, "step": 15045 }, { "entropy": 0.6989480312913656, "epoch": 1.3843106135099856, "grad_norm": 0.16092996299266815, "learning_rate": 5.3859600699236366e-05, "loss": 0.6788, "mean_token_accuracy": 0.7888235785067081, "num_tokens": 480199185.0, "step": 15046 }, { "entropy": 0.679448900744319, "epoch": 1.3844026198814268, "grad_norm": 0.16355526447296143, "learning_rate": 5.385653387309474e-05, "loss": 0.6681, "mean_token_accuracy": 0.7963674329221249, "num_tokens": 480230850.0, "step": 15047 }, { "entropy": 0.7407621871680021, "epoch": 1.384494626252868, "grad_norm": 0.16060024499893188, "learning_rate": 5.385346704695311e-05, "loss": 0.743, "mean_token_accuracy": 0.7748262397944927, "num_tokens": 480263483.0, "step": 15048 }, { "entropy": 0.6045486368238926, "epoch": 1.3845866326243093, "grad_norm": 0.15624995529651642, "learning_rate": 5.385040022081148e-05, "loss": 0.5919, "mean_token_accuracy": 0.8159331530332565, "num_tokens": 480294544.0, "step": 15049 }, { "entropy": 0.591907620895654, "epoch": 1.3846786389957504, "grad_norm": 0.15669696033000946, "learning_rate": 5.3847333394669864e-05, "loss": 0.5803, "mean_token_accuracy": 0.823590062558651, "num_tokens": 480325973.0, "step": 15050 }, { "entropy": 0.6198105597868562, "epoch": 1.3847706453671917, "grad_norm": 0.15466852486133575, "learning_rate": 5.384426656852823e-05, "loss": 0.6045, "mean_token_accuracy": 0.8107556663453579, "num_tokens": 480358629.0, "step": 15051 }, { "entropy": 0.7567916214466095, "epoch": 1.3848626517386329, "grad_norm": 0.17016009986400604, "learning_rate": 5.384119974238661e-05, "loss": 0.7565, "mean_token_accuracy": 0.7744597867131233, "num_tokens": 480389520.0, "step": 15052 }, { "entropy": 0.6704023256897926, "epoch": 1.384954658110074, "grad_norm": 0.16340090334415436, "learning_rate": 5.3838132916244975e-05, "loss": 0.6727, "mean_token_accuracy": 0.7950354181230068, "num_tokens": 480421623.0, "step": 15053 }, { "entropy": 0.5520228799432516, "epoch": 1.3850466644815154, "grad_norm": 0.15273256599903107, "learning_rate": 5.3835066090103356e-05, "loss": 0.5335, "mean_token_accuracy": 0.8345955349504948, "num_tokens": 480453356.0, "step": 15054 }, { "entropy": 0.5539502897299826, "epoch": 1.3851386708529565, "grad_norm": 0.1525501161813736, "learning_rate": 5.383199926396173e-05, "loss": 0.5521, "mean_token_accuracy": 0.8282056488096714, "num_tokens": 480485818.0, "step": 15055 }, { "entropy": 0.5362869054079056, "epoch": 1.3852306772243979, "grad_norm": 0.16154702007770538, "learning_rate": 5.38289324378201e-05, "loss": 0.5157, "mean_token_accuracy": 0.8410099074244499, "num_tokens": 480517862.0, "step": 15056 }, { "entropy": 0.5650068856775761, "epoch": 1.385322683595839, "grad_norm": 0.14911340177059174, "learning_rate": 5.382586561167847e-05, "loss": 0.5519, "mean_token_accuracy": 0.832304697483778, "num_tokens": 480550041.0, "step": 15057 }, { "entropy": 0.5472307046875358, "epoch": 1.3854146899672801, "grad_norm": 0.1476265788078308, "learning_rate": 5.3822798785536855e-05, "loss": 0.537, "mean_token_accuracy": 0.8356661386787891, "num_tokens": 480582402.0, "step": 15058 }, { "entropy": 0.6952767297625542, "epoch": 1.3855066963387215, "grad_norm": 0.16822519898414612, "learning_rate": 5.381973195939522e-05, "loss": 0.6862, "mean_token_accuracy": 0.790110357105732, "num_tokens": 480613549.0, "step": 15059 }, { "entropy": 0.616052808240056, "epoch": 1.3855987027101626, "grad_norm": 0.1537257879972458, "learning_rate": 5.38166651332536e-05, "loss": 0.6017, "mean_token_accuracy": 0.8152834922075272, "num_tokens": 480645367.0, "step": 15060 }, { "entropy": 0.647583732381463, "epoch": 1.385690709081604, "grad_norm": 0.16250789165496826, "learning_rate": 5.3813598307111965e-05, "loss": 0.628, "mean_token_accuracy": 0.8050988726317883, "num_tokens": 480677435.0, "step": 15061 }, { "entropy": 0.5429914421401918, "epoch": 1.385782715453045, "grad_norm": 0.14924342930316925, "learning_rate": 5.3810531480970346e-05, "loss": 0.527, "mean_token_accuracy": 0.836400680243969, "num_tokens": 480709395.0, "step": 15062 }, { "entropy": 0.6466148225590587, "epoch": 1.3858747218244862, "grad_norm": 0.16293534636497498, "learning_rate": 5.380746465482872e-05, "loss": 0.6474, "mean_token_accuracy": 0.8038857132196426, "num_tokens": 480741268.0, "step": 15063 }, { "entropy": 0.6173511883243918, "epoch": 1.3859667281959276, "grad_norm": 0.15149274468421936, "learning_rate": 5.380439782868709e-05, "loss": 0.6018, "mean_token_accuracy": 0.8165186457335949, "num_tokens": 480772239.0, "step": 15064 }, { "entropy": 0.6305900644510984, "epoch": 1.3860587345673687, "grad_norm": 0.15732036530971527, "learning_rate": 5.3801331002545464e-05, "loss": 0.61, "mean_token_accuracy": 0.8102799691259861, "num_tokens": 480803882.0, "step": 15065 }, { "entropy": 0.7029399387538433, "epoch": 1.38615074093881, "grad_norm": 0.16512496769428253, "learning_rate": 5.3798264176403845e-05, "loss": 0.696, "mean_token_accuracy": 0.7905776761472225, "num_tokens": 480835248.0, "step": 15066 }, { "entropy": 0.6203714590519667, "epoch": 1.3862427473102512, "grad_norm": 0.16051119565963745, "learning_rate": 5.379519735026222e-05, "loss": 0.5978, "mean_token_accuracy": 0.8130321241915226, "num_tokens": 480866765.0, "step": 15067 }, { "entropy": 0.7789949327707291, "epoch": 1.3863347536816923, "grad_norm": 0.16798104345798492, "learning_rate": 5.379213052412059e-05, "loss": 0.7699, "mean_token_accuracy": 0.7636334635317326, "num_tokens": 480898396.0, "step": 15068 }, { "entropy": 0.6634422754868865, "epoch": 1.3864267600531337, "grad_norm": 0.16066837310791016, "learning_rate": 5.3789063697978955e-05, "loss": 0.6513, "mean_token_accuracy": 0.8016883358359337, "num_tokens": 480930310.0, "step": 15069 }, { "entropy": 0.6589894061908126, "epoch": 1.3865187664245748, "grad_norm": 0.15749482810497284, "learning_rate": 5.3785996871837344e-05, "loss": 0.6435, "mean_token_accuracy": 0.808730062097311, "num_tokens": 480962173.0, "step": 15070 }, { "entropy": 0.6499456409364939, "epoch": 1.3866107727960162, "grad_norm": 0.15956512093544006, "learning_rate": 5.378293004569571e-05, "loss": 0.6369, "mean_token_accuracy": 0.8040928468108177, "num_tokens": 480994125.0, "step": 15071 }, { "entropy": 0.6173209380358458, "epoch": 1.3867027791674573, "grad_norm": 0.157173290848732, "learning_rate": 5.3779863219554086e-05, "loss": 0.6101, "mean_token_accuracy": 0.8168232887983322, "num_tokens": 481026163.0, "step": 15072 }, { "entropy": 0.5974016515538096, "epoch": 1.3867947855388985, "grad_norm": 0.15391099452972412, "learning_rate": 5.377679639341247e-05, "loss": 0.5808, "mean_token_accuracy": 0.8230699002742767, "num_tokens": 481058525.0, "step": 15073 }, { "entropy": 0.5525264162570238, "epoch": 1.3868867919103398, "grad_norm": 0.15278635919094086, "learning_rate": 5.3773729567270835e-05, "loss": 0.5185, "mean_token_accuracy": 0.8416446931660175, "num_tokens": 481090849.0, "step": 15074 }, { "entropy": 0.47322733979672194, "epoch": 1.386978798281781, "grad_norm": 0.14905966818332672, "learning_rate": 5.377066274112921e-05, "loss": 0.4601, "mean_token_accuracy": 0.8562816604971886, "num_tokens": 481122987.0, "step": 15075 }, { "entropy": 0.7051634751260281, "epoch": 1.3870708046532223, "grad_norm": 0.1608947217464447, "learning_rate": 5.376759591498758e-05, "loss": 0.7001, "mean_token_accuracy": 0.7886574752628803, "num_tokens": 481155062.0, "step": 15076 }, { "entropy": 0.4882275420241058, "epoch": 1.3871628110246634, "grad_norm": 0.15413789451122284, "learning_rate": 5.376452908884596e-05, "loss": 0.4692, "mean_token_accuracy": 0.8555795848369598, "num_tokens": 481186959.0, "step": 15077 }, { "entropy": 0.6672544647008181, "epoch": 1.3872548173961046, "grad_norm": 0.1790514588356018, "learning_rate": 5.3761462262704334e-05, "loss": 0.6686, "mean_token_accuracy": 0.7956382408738136, "num_tokens": 481219334.0, "step": 15078 }, { "entropy": 0.6058958973735571, "epoch": 1.387346823767546, "grad_norm": 0.16276580095291138, "learning_rate": 5.37583954365627e-05, "loss": 0.5945, "mean_token_accuracy": 0.817156221717596, "num_tokens": 481250840.0, "step": 15079 }, { "entropy": 0.5239001261070371, "epoch": 1.387438830138987, "grad_norm": 0.14520445466041565, "learning_rate": 5.3755328610421077e-05, "loss": 0.5197, "mean_token_accuracy": 0.8396640680730343, "num_tokens": 481282752.0, "step": 15080 }, { "entropy": 0.6593295382335782, "epoch": 1.3875308365104284, "grad_norm": 0.1590399295091629, "learning_rate": 5.375226178427946e-05, "loss": 0.6556, "mean_token_accuracy": 0.8016006387770176, "num_tokens": 481315089.0, "step": 15081 }, { "entropy": 0.721117977052927, "epoch": 1.3876228428818695, "grad_norm": 0.16020657122135162, "learning_rate": 5.3749194958137826e-05, "loss": 0.7109, "mean_token_accuracy": 0.7825213335454464, "num_tokens": 481346701.0, "step": 15082 }, { "entropy": 0.6150806080549955, "epoch": 1.3877148492533107, "grad_norm": 0.158853679895401, "learning_rate": 5.37461281319962e-05, "loss": 0.6043, "mean_token_accuracy": 0.8113737143576145, "num_tokens": 481379084.0, "step": 15083 }, { "entropy": 0.5508286841213703, "epoch": 1.387806855624752, "grad_norm": 0.1473166048526764, "learning_rate": 5.374306130585457e-05, "loss": 0.5388, "mean_token_accuracy": 0.8340629637241364, "num_tokens": 481411446.0, "step": 15084 }, { "entropy": 0.581901459954679, "epoch": 1.3878988619961932, "grad_norm": 0.1535482406616211, "learning_rate": 5.373999447971295e-05, "loss": 0.5765, "mean_token_accuracy": 0.8207255303859711, "num_tokens": 481443709.0, "step": 15085 }, { "entropy": 0.6669548861682415, "epoch": 1.3879908683676345, "grad_norm": 0.1615408957004547, "learning_rate": 5.3736927653571324e-05, "loss": 0.6673, "mean_token_accuracy": 0.7987936697900295, "num_tokens": 481475469.0, "step": 15086 }, { "entropy": 0.5774583630263805, "epoch": 1.3880828747390757, "grad_norm": 0.1608763039112091, "learning_rate": 5.373386082742969e-05, "loss": 0.5737, "mean_token_accuracy": 0.8248417787253857, "num_tokens": 481507401.0, "step": 15087 }, { "entropy": 0.5757575500756502, "epoch": 1.3881748811105168, "grad_norm": 0.14940407872200012, "learning_rate": 5.373079400128807e-05, "loss": 0.5561, "mean_token_accuracy": 0.826555110514164, "num_tokens": 481539647.0, "step": 15088 }, { "entropy": 0.6307274987921119, "epoch": 1.3882668874819581, "grad_norm": 0.15621069073677063, "learning_rate": 5.372772717514645e-05, "loss": 0.6121, "mean_token_accuracy": 0.8114646151661873, "num_tokens": 481571663.0, "step": 15089 }, { "entropy": 0.6546815950423479, "epoch": 1.3883588938533993, "grad_norm": 0.16003923118114471, "learning_rate": 5.3724660349004816e-05, "loss": 0.6532, "mean_token_accuracy": 0.8029684014618397, "num_tokens": 481603338.0, "step": 15090 }, { "entropy": 0.7155684120953083, "epoch": 1.3884509002248406, "grad_norm": 0.16542235016822815, "learning_rate": 5.372159352286319e-05, "loss": 0.7006, "mean_token_accuracy": 0.7872339375317097, "num_tokens": 481634537.0, "step": 15091 }, { "entropy": 0.5675797036383301, "epoch": 1.3885429065962818, "grad_norm": 0.15181207656860352, "learning_rate": 5.371852669672156e-05, "loss": 0.5461, "mean_token_accuracy": 0.8301781266927719, "num_tokens": 481667134.0, "step": 15092 }, { "entropy": 0.5707734236493707, "epoch": 1.388634912967723, "grad_norm": 0.16145852208137512, "learning_rate": 5.371545987057994e-05, "loss": 0.5619, "mean_token_accuracy": 0.8274017348885536, "num_tokens": 481699558.0, "step": 15093 }, { "entropy": 0.5756315132603049, "epoch": 1.3887269193391643, "grad_norm": 0.1454664021730423, "learning_rate": 5.3712393044438315e-05, "loss": 0.5754, "mean_token_accuracy": 0.8243116699159145, "num_tokens": 481731766.0, "step": 15094 }, { "entropy": 0.676866352558136, "epoch": 1.3888189257106054, "grad_norm": 0.16624489426612854, "learning_rate": 5.370932621829668e-05, "loss": 0.6622, "mean_token_accuracy": 0.7963552065193653, "num_tokens": 481763579.0, "step": 15095 }, { "entropy": 0.6834894865751266, "epoch": 1.3889109320820467, "grad_norm": 0.16377359628677368, "learning_rate": 5.370625939215506e-05, "loss": 0.6805, "mean_token_accuracy": 0.790365893393755, "num_tokens": 481795933.0, "step": 15096 }, { "entropy": 0.6428903508931398, "epoch": 1.3890029384534879, "grad_norm": 0.15732133388519287, "learning_rate": 5.370319256601344e-05, "loss": 0.6451, "mean_token_accuracy": 0.8055059239268303, "num_tokens": 481828014.0, "step": 15097 }, { "entropy": 0.5475013272371143, "epoch": 1.389094944824929, "grad_norm": 0.15568320453166962, "learning_rate": 5.370012573987181e-05, "loss": 0.5323, "mean_token_accuracy": 0.8361629955470562, "num_tokens": 481859716.0, "step": 15098 }, { "entropy": 0.6448834575712681, "epoch": 1.3891869511963704, "grad_norm": 0.15926487743854523, "learning_rate": 5.369705891373018e-05, "loss": 0.6156, "mean_token_accuracy": 0.8070113472640514, "num_tokens": 481890423.0, "step": 15099 }, { "entropy": 0.632417744025588, "epoch": 1.3892789575678115, "grad_norm": 0.16104784607887268, "learning_rate": 5.369399208758856e-05, "loss": 0.622, "mean_token_accuracy": 0.8101359158754349, "num_tokens": 481921819.0, "step": 15100 }, { "entropy": 0.6189237516373396, "epoch": 1.3893709639392529, "grad_norm": 0.16517768800258636, "learning_rate": 5.369092526144693e-05, "loss": 0.6217, "mean_token_accuracy": 0.809347290545702, "num_tokens": 481953221.0, "step": 15101 }, { "entropy": 0.6692878734320402, "epoch": 1.389462970310694, "grad_norm": 0.16486956179141998, "learning_rate": 5.3687858435305305e-05, "loss": 0.6581, "mean_token_accuracy": 0.8012467063963413, "num_tokens": 481984899.0, "step": 15102 }, { "entropy": 0.5981682930141687, "epoch": 1.3895549766821351, "grad_norm": 0.15706056356430054, "learning_rate": 5.368479160916367e-05, "loss": 0.5808, "mean_token_accuracy": 0.8187293596565723, "num_tokens": 482016691.0, "step": 15103 }, { "entropy": 0.5772356381639838, "epoch": 1.3896469830535765, "grad_norm": 0.1499229073524475, "learning_rate": 5.368172478302206e-05, "loss": 0.5696, "mean_token_accuracy": 0.8235937356948853, "num_tokens": 482048718.0, "step": 15104 }, { "entropy": 0.5982987419702113, "epoch": 1.3897389894250176, "grad_norm": 0.15820346772670746, "learning_rate": 5.367865795688043e-05, "loss": 0.5839, "mean_token_accuracy": 0.8204263933002949, "num_tokens": 482080185.0, "step": 15105 }, { "entropy": 0.6113948160782456, "epoch": 1.389830995796459, "grad_norm": 0.15892209112644196, "learning_rate": 5.36755911307388e-05, "loss": 0.5948, "mean_token_accuracy": 0.8170584961771965, "num_tokens": 482112484.0, "step": 15106 }, { "entropy": 0.6410810761153698, "epoch": 1.3899230021679, "grad_norm": 0.15426281094551086, "learning_rate": 5.367252430459717e-05, "loss": 0.6252, "mean_token_accuracy": 0.808081179857254, "num_tokens": 482144601.0, "step": 15107 }, { "entropy": 0.6087575359269977, "epoch": 1.3900150085393412, "grad_norm": 0.1544707864522934, "learning_rate": 5.366945747845555e-05, "loss": 0.6042, "mean_token_accuracy": 0.8129563443362713, "num_tokens": 482176475.0, "step": 15108 }, { "entropy": 0.6184211429208517, "epoch": 1.3901070149107826, "grad_norm": 0.1629578173160553, "learning_rate": 5.366639065231393e-05, "loss": 0.6067, "mean_token_accuracy": 0.8142150230705738, "num_tokens": 482209084.0, "step": 15109 }, { "entropy": 0.7095652464777231, "epoch": 1.3901990212822237, "grad_norm": 0.18161119520664215, "learning_rate": 5.3663323826172296e-05, "loss": 0.7173, "mean_token_accuracy": 0.7839862704277039, "num_tokens": 482239812.0, "step": 15110 }, { "entropy": 0.5860241409391165, "epoch": 1.390291027653665, "grad_norm": 0.15363487601280212, "learning_rate": 5.366025700003067e-05, "loss": 0.576, "mean_token_accuracy": 0.8232356011867523, "num_tokens": 482271838.0, "step": 15111 }, { "entropy": 0.6921687722206116, "epoch": 1.3903830340251062, "grad_norm": 0.16051803529262543, "learning_rate": 5.365719017388905e-05, "loss": 0.6726, "mean_token_accuracy": 0.7954920716583729, "num_tokens": 482302868.0, "step": 15112 }, { "entropy": 0.6712545827031136, "epoch": 1.3904750403965473, "grad_norm": 0.15969017148017883, "learning_rate": 5.365412334774742e-05, "loss": 0.6667, "mean_token_accuracy": 0.7997078150510788, "num_tokens": 482334184.0, "step": 15113 }, { "entropy": 0.6661553159356117, "epoch": 1.3905670467679887, "grad_norm": 0.16148218512535095, "learning_rate": 5.3651056521605794e-05, "loss": 0.6631, "mean_token_accuracy": 0.7963365465402603, "num_tokens": 482366070.0, "step": 15114 }, { "entropy": 0.6717393640428782, "epoch": 1.3906590531394298, "grad_norm": 0.16962258517742157, "learning_rate": 5.364798969546416e-05, "loss": 0.6521, "mean_token_accuracy": 0.8041979223489761, "num_tokens": 482398429.0, "step": 15115 }, { "entropy": 0.6186907039955258, "epoch": 1.3907510595108712, "grad_norm": 0.15797926485538483, "learning_rate": 5.3644922869322544e-05, "loss": 0.607, "mean_token_accuracy": 0.8140568844974041, "num_tokens": 482430685.0, "step": 15116 }, { "entropy": 0.686114065349102, "epoch": 1.3908430658823123, "grad_norm": 0.15757736563682556, "learning_rate": 5.364185604318092e-05, "loss": 0.6713, "mean_token_accuracy": 0.7934623844921589, "num_tokens": 482462506.0, "step": 15117 }, { "entropy": 0.5939579354599118, "epoch": 1.3909350722537535, "grad_norm": 0.14462746679782867, "learning_rate": 5.3638789217039286e-05, "loss": 0.5603, "mean_token_accuracy": 0.8267203457653522, "num_tokens": 482494558.0, "step": 15118 }, { "entropy": 0.6170077370479703, "epoch": 1.3910270786251948, "grad_norm": 0.15392078459262848, "learning_rate": 5.363572239089766e-05, "loss": 0.6122, "mean_token_accuracy": 0.8120029978454113, "num_tokens": 482525932.0, "step": 15119 }, { "entropy": 0.6062852498143911, "epoch": 1.391119084996636, "grad_norm": 0.15510085225105286, "learning_rate": 5.363265556475604e-05, "loss": 0.5876, "mean_token_accuracy": 0.8184941411018372, "num_tokens": 482557348.0, "step": 15120 }, { "entropy": 0.6959567293524742, "epoch": 1.3912110913680773, "grad_norm": 0.1644957810640335, "learning_rate": 5.362958873861441e-05, "loss": 0.6867, "mean_token_accuracy": 0.7905135191977024, "num_tokens": 482589251.0, "step": 15121 }, { "entropy": 0.5766162150539458, "epoch": 1.3913030977395184, "grad_norm": 0.15538816154003143, "learning_rate": 5.3626521912472785e-05, "loss": 0.5719, "mean_token_accuracy": 0.8257271125912666, "num_tokens": 482621144.0, "step": 15122 }, { "entropy": 0.6682594511657953, "epoch": 1.3913951041109596, "grad_norm": 0.16092954576015472, "learning_rate": 5.362345508633115e-05, "loss": 0.6675, "mean_token_accuracy": 0.7980110384523869, "num_tokens": 482653298.0, "step": 15123 }, { "entropy": 0.6167380474507809, "epoch": 1.391487110482401, "grad_norm": 0.16455714404582977, "learning_rate": 5.3620388260189534e-05, "loss": 0.6087, "mean_token_accuracy": 0.8157143071293831, "num_tokens": 482685461.0, "step": 15124 }, { "entropy": 0.5512083247303963, "epoch": 1.391579116853842, "grad_norm": 0.15424013137817383, "learning_rate": 5.361732143404791e-05, "loss": 0.5429, "mean_token_accuracy": 0.8315113820135593, "num_tokens": 482717535.0, "step": 15125 }, { "entropy": 0.7335672844201326, "epoch": 1.3916711232252834, "grad_norm": 0.1610735058784485, "learning_rate": 5.3614254607906276e-05, "loss": 0.724, "mean_token_accuracy": 0.7780125662684441, "num_tokens": 482749175.0, "step": 15126 }, { "entropy": 0.626841944642365, "epoch": 1.3917631295967245, "grad_norm": 0.15378136932849884, "learning_rate": 5.361118778176465e-05, "loss": 0.6204, "mean_token_accuracy": 0.8092267215251923, "num_tokens": 482781418.0, "step": 15127 }, { "entropy": 0.5979949235916138, "epoch": 1.3918551359681657, "grad_norm": 0.1568886637687683, "learning_rate": 5.360812095562303e-05, "loss": 0.5889, "mean_token_accuracy": 0.8196239434182644, "num_tokens": 482813797.0, "step": 15128 }, { "entropy": 0.5593167655169964, "epoch": 1.391947142339607, "grad_norm": 0.16826483607292175, "learning_rate": 5.36050541294814e-05, "loss": 0.5613, "mean_token_accuracy": 0.8281670399010181, "num_tokens": 482846075.0, "step": 15129 }, { "entropy": 0.6620109211653471, "epoch": 1.3920391487110482, "grad_norm": 0.1604452133178711, "learning_rate": 5.3601987303339775e-05, "loss": 0.6597, "mean_token_accuracy": 0.7980256751179695, "num_tokens": 482877916.0, "step": 15130 }, { "entropy": 0.5878921858966351, "epoch": 1.3921311550824895, "grad_norm": 0.15871334075927734, "learning_rate": 5.3598920477198156e-05, "loss": 0.573, "mean_token_accuracy": 0.8271348588168621, "num_tokens": 482910495.0, "step": 15131 }, { "entropy": 0.6243736958131194, "epoch": 1.3922231614539307, "grad_norm": 0.1612803190946579, "learning_rate": 5.3595853651056524e-05, "loss": 0.6139, "mean_token_accuracy": 0.8140394315123558, "num_tokens": 482941988.0, "step": 15132 }, { "entropy": 0.6687428373843431, "epoch": 1.3923151678253718, "grad_norm": 0.16080094873905182, "learning_rate": 5.35927868249149e-05, "loss": 0.6583, "mean_token_accuracy": 0.8032273538410664, "num_tokens": 482974104.0, "step": 15133 }, { "entropy": 0.5875765159726143, "epoch": 1.3924071741968131, "grad_norm": 0.1543435901403427, "learning_rate": 5.358971999877327e-05, "loss": 0.576, "mean_token_accuracy": 0.8235383108258247, "num_tokens": 483005592.0, "step": 15134 }, { "entropy": 0.6880113482475281, "epoch": 1.3924991805682543, "grad_norm": 0.15819425880908966, "learning_rate": 5.358665317263165e-05, "loss": 0.6695, "mean_token_accuracy": 0.7956010550260544, "num_tokens": 483037279.0, "step": 15135 }, { "entropy": 0.7027365975081921, "epoch": 1.3925911869396956, "grad_norm": 0.16683663427829742, "learning_rate": 5.358358634649002e-05, "loss": 0.6903, "mean_token_accuracy": 0.7966227754950523, "num_tokens": 483069485.0, "step": 15136 }, { "entropy": 0.5587956588715315, "epoch": 1.3926831933111368, "grad_norm": 0.15345001220703125, "learning_rate": 5.358051952034839e-05, "loss": 0.544, "mean_token_accuracy": 0.8347478024661541, "num_tokens": 483102113.0, "step": 15137 }, { "entropy": 0.6296444665640593, "epoch": 1.392775199682578, "grad_norm": 0.15397804975509644, "learning_rate": 5.3577452694206765e-05, "loss": 0.6119, "mean_token_accuracy": 0.8135824576020241, "num_tokens": 483134424.0, "step": 15138 }, { "entropy": 0.663333373144269, "epoch": 1.3928672060540193, "grad_norm": 0.16291698813438416, "learning_rate": 5.357438586806515e-05, "loss": 0.665, "mean_token_accuracy": 0.797654815018177, "num_tokens": 483166032.0, "step": 15139 }, { "entropy": 0.5417357259429991, "epoch": 1.3929592124254604, "grad_norm": 0.1429964154958725, "learning_rate": 5.3571319041923515e-05, "loss": 0.5299, "mean_token_accuracy": 0.8367475718259811, "num_tokens": 483198733.0, "step": 15140 }, { "entropy": 0.5986736174672842, "epoch": 1.3930512187969017, "grad_norm": 0.15980912744998932, "learning_rate": 5.356825221578189e-05, "loss": 0.5887, "mean_token_accuracy": 0.8174174875020981, "num_tokens": 483229617.0, "step": 15141 }, { "entropy": 0.6108477395027876, "epoch": 1.3931432251683429, "grad_norm": 0.15039627254009247, "learning_rate": 5.356518538964026e-05, "loss": 0.5971, "mean_token_accuracy": 0.8175426796078682, "num_tokens": 483261544.0, "step": 15142 }, { "entropy": 0.6331802429631352, "epoch": 1.393235231539784, "grad_norm": 0.1577913761138916, "learning_rate": 5.3562118563498645e-05, "loss": 0.612, "mean_token_accuracy": 0.8132497631013393, "num_tokens": 483294043.0, "step": 15143 }, { "entropy": 0.6123892674222589, "epoch": 1.3933272379112254, "grad_norm": 0.15725749731063843, "learning_rate": 5.355905173735701e-05, "loss": 0.6069, "mean_token_accuracy": 0.8128358013927937, "num_tokens": 483326719.0, "step": 15144 }, { "entropy": 0.6221149675548077, "epoch": 1.3934192442826665, "grad_norm": 0.15716104209423065, "learning_rate": 5.355598491121538e-05, "loss": 0.6103, "mean_token_accuracy": 0.8196910358965397, "num_tokens": 483359154.0, "step": 15145 }, { "entropy": 0.7047959910705686, "epoch": 1.3935112506541079, "grad_norm": 0.16235917806625366, "learning_rate": 5.3552918085073756e-05, "loss": 0.6914, "mean_token_accuracy": 0.7941413559019566, "num_tokens": 483391311.0, "step": 15146 }, { "entropy": 0.5327480845153332, "epoch": 1.393603257025549, "grad_norm": 0.1592390090227127, "learning_rate": 5.354985125893214e-05, "loss": 0.5166, "mean_token_accuracy": 0.8411899879574776, "num_tokens": 483423556.0, "step": 15147 }, { "entropy": 0.5458124671131372, "epoch": 1.3936952633969901, "grad_norm": 0.1587514728307724, "learning_rate": 5.354678443279051e-05, "loss": 0.5338, "mean_token_accuracy": 0.8343716636300087, "num_tokens": 483456051.0, "step": 15148 }, { "entropy": 0.6273721754550934, "epoch": 1.3937872697684315, "grad_norm": 0.15528284013271332, "learning_rate": 5.354371760664888e-05, "loss": 0.611, "mean_token_accuracy": 0.8123288825154305, "num_tokens": 483488425.0, "step": 15149 }, { "entropy": 0.6388930976390839, "epoch": 1.3938792761398726, "grad_norm": 0.1615820825099945, "learning_rate": 5.354065078050725e-05, "loss": 0.63, "mean_token_accuracy": 0.8074002489447594, "num_tokens": 483519192.0, "step": 15150 }, { "entropy": 0.5461455336771905, "epoch": 1.393971282511314, "grad_norm": 0.159457266330719, "learning_rate": 5.3537583954365636e-05, "loss": 0.5256, "mean_token_accuracy": 0.8340172134339809, "num_tokens": 483550453.0, "step": 15151 }, { "entropy": 0.6648688688874245, "epoch": 1.394063288882755, "grad_norm": 0.16021738946437836, "learning_rate": 5.3534517128224004e-05, "loss": 0.6638, "mean_token_accuracy": 0.7980843149125576, "num_tokens": 483581984.0, "step": 15152 }, { "entropy": 0.5930600259453058, "epoch": 1.3941552952541962, "grad_norm": 0.15382273495197296, "learning_rate": 5.353145030208238e-05, "loss": 0.5877, "mean_token_accuracy": 0.8190644793212414, "num_tokens": 483614752.0, "step": 15153 }, { "entropy": 0.6720713023096323, "epoch": 1.3942473016256376, "grad_norm": 0.16558700799942017, "learning_rate": 5.3528383475940746e-05, "loss": 0.6642, "mean_token_accuracy": 0.794465396553278, "num_tokens": 483646671.0, "step": 15154 }, { "entropy": 0.5876091551035643, "epoch": 1.3943393079970787, "grad_norm": 0.15854030847549438, "learning_rate": 5.352531664979913e-05, "loss": 0.5731, "mean_token_accuracy": 0.8225438892841339, "num_tokens": 483678609.0, "step": 15155 }, { "entropy": 0.6670588199049234, "epoch": 1.39443131436852, "grad_norm": 0.16130530834197998, "learning_rate": 5.35222498236575e-05, "loss": 0.6585, "mean_token_accuracy": 0.7997955605387688, "num_tokens": 483710703.0, "step": 15156 }, { "entropy": 0.6715096868574619, "epoch": 1.3945233207399612, "grad_norm": 0.16376253962516785, "learning_rate": 5.351918299751587e-05, "loss": 0.6762, "mean_token_accuracy": 0.7949693687260151, "num_tokens": 483742802.0, "step": 15157 }, { "entropy": 0.6999020464718342, "epoch": 1.3946153271114023, "grad_norm": 0.16731682419776917, "learning_rate": 5.3516116171374245e-05, "loss": 0.6997, "mean_token_accuracy": 0.7870360687375069, "num_tokens": 483774900.0, "step": 15158 }, { "entropy": 0.5660539418458939, "epoch": 1.3947073334828437, "grad_norm": 0.1534574329853058, "learning_rate": 5.3513049345232626e-05, "loss": 0.5484, "mean_token_accuracy": 0.8297363631427288, "num_tokens": 483806530.0, "step": 15159 }, { "entropy": 0.5544678214937449, "epoch": 1.3947993398542848, "grad_norm": 0.1502067893743515, "learning_rate": 5.3509982519090994e-05, "loss": 0.5499, "mean_token_accuracy": 0.8286012783646584, "num_tokens": 483839038.0, "step": 15160 }, { "entropy": 0.7234027162194252, "epoch": 1.3948913462257262, "grad_norm": 0.16950462758541107, "learning_rate": 5.350691569294937e-05, "loss": 0.7142, "mean_token_accuracy": 0.784739226102829, "num_tokens": 483870966.0, "step": 15161 }, { "entropy": 0.6277991263195872, "epoch": 1.3949833525971673, "grad_norm": 0.15764062106609344, "learning_rate": 5.350384886680775e-05, "loss": 0.6124, "mean_token_accuracy": 0.8104136660695076, "num_tokens": 483902605.0, "step": 15162 }, { "entropy": 0.53183702705428, "epoch": 1.3950753589686085, "grad_norm": 0.1528007835149765, "learning_rate": 5.350078204066612e-05, "loss": 0.5099, "mean_token_accuracy": 0.8410982824862003, "num_tokens": 483934070.0, "step": 15163 }, { "entropy": 0.682472831569612, "epoch": 1.3951673653400498, "grad_norm": 0.16072030365467072, "learning_rate": 5.349771521452449e-05, "loss": 0.6729, "mean_token_accuracy": 0.7979100272059441, "num_tokens": 483966109.0, "step": 15164 }, { "entropy": 0.6193535849452019, "epoch": 1.395259371711491, "grad_norm": 0.16889256238937378, "learning_rate": 5.349464838838286e-05, "loss": 0.6002, "mean_token_accuracy": 0.8126201555132866, "num_tokens": 483997292.0, "step": 15165 }, { "entropy": 0.6039032626431435, "epoch": 1.3953513780829323, "grad_norm": 0.15318071842193604, "learning_rate": 5.349158156224124e-05, "loss": 0.5983, "mean_token_accuracy": 0.8174367137253284, "num_tokens": 484028846.0, "step": 15166 }, { "entropy": 0.57245186669752, "epoch": 1.3954433844543734, "grad_norm": 0.1490100622177124, "learning_rate": 5.348851473609962e-05, "loss": 0.5683, "mean_token_accuracy": 0.8279928602278233, "num_tokens": 484060822.0, "step": 15167 }, { "entropy": 0.6788538582623005, "epoch": 1.3955353908258146, "grad_norm": 0.15527845919132233, "learning_rate": 5.3485447909957985e-05, "loss": 0.6707, "mean_token_accuracy": 0.7912475243210793, "num_tokens": 484093216.0, "step": 15168 }, { "entropy": 0.6916705071926117, "epoch": 1.395627397197256, "grad_norm": 0.16403347253799438, "learning_rate": 5.348238108381636e-05, "loss": 0.6795, "mean_token_accuracy": 0.792442187666893, "num_tokens": 484125032.0, "step": 15169 }, { "entropy": 0.5529796555638313, "epoch": 1.395719403568697, "grad_norm": 0.15420491993427277, "learning_rate": 5.347931425767474e-05, "loss": 0.5389, "mean_token_accuracy": 0.8368982337415218, "num_tokens": 484157524.0, "step": 15170 }, { "entropy": 0.5821375008672476, "epoch": 1.3958114099401384, "grad_norm": 0.1546124368906021, "learning_rate": 5.347624743153311e-05, "loss": 0.5746, "mean_token_accuracy": 0.8218651413917542, "num_tokens": 484189669.0, "step": 15171 }, { "entropy": 0.5060271229594946, "epoch": 1.3959034163115795, "grad_norm": 0.14916196465492249, "learning_rate": 5.347318060539148e-05, "loss": 0.4934, "mean_token_accuracy": 0.8454355373978615, "num_tokens": 484221799.0, "step": 15172 }, { "entropy": 0.6362815643660724, "epoch": 1.3959954226830207, "grad_norm": 0.1530921310186386, "learning_rate": 5.347011377924985e-05, "loss": 0.6203, "mean_token_accuracy": 0.8115149028599262, "num_tokens": 484253815.0, "step": 15173 }, { "entropy": 0.5966842044144869, "epoch": 1.396087429054462, "grad_norm": 0.15439969301223755, "learning_rate": 5.346704695310823e-05, "loss": 0.5789, "mean_token_accuracy": 0.8246920295059681, "num_tokens": 484285406.0, "step": 15174 }, { "entropy": 0.6085546016693115, "epoch": 1.3961794354259032, "grad_norm": 0.15819723904132843, "learning_rate": 5.346398012696661e-05, "loss": 0.5946, "mean_token_accuracy": 0.821663610637188, "num_tokens": 484317943.0, "step": 15175 }, { "entropy": 0.697729249484837, "epoch": 1.3962714417973445, "grad_norm": 0.16205623745918274, "learning_rate": 5.3460913300824975e-05, "loss": 0.6853, "mean_token_accuracy": 0.7931268103420734, "num_tokens": 484350163.0, "step": 15176 }, { "entropy": 0.5941299023106694, "epoch": 1.3963634481687857, "grad_norm": 0.15642090141773224, "learning_rate": 5.345784647468335e-05, "loss": 0.5815, "mean_token_accuracy": 0.8201844803988934, "num_tokens": 484382426.0, "step": 15177 }, { "entropy": 0.55201296787709, "epoch": 1.3964554545402268, "grad_norm": 0.15704195201396942, "learning_rate": 5.345477964854173e-05, "loss": 0.5418, "mean_token_accuracy": 0.8316918984055519, "num_tokens": 484414413.0, "step": 15178 }, { "entropy": 0.7584404069930315, "epoch": 1.3965474609116681, "grad_norm": 0.16541312634944916, "learning_rate": 5.34517128224001e-05, "loss": 0.7494, "mean_token_accuracy": 0.7731148228049278, "num_tokens": 484445390.0, "step": 15179 }, { "entropy": 0.6860215864144266, "epoch": 1.3966394672831093, "grad_norm": 0.15675272047519684, "learning_rate": 5.3448645996258474e-05, "loss": 0.6617, "mean_token_accuracy": 0.8014574572443962, "num_tokens": 484477862.0, "step": 15180 }, { "entropy": 0.5848916256800294, "epoch": 1.3967314736545506, "grad_norm": 0.15256206691265106, "learning_rate": 5.344557917011684e-05, "loss": 0.5767, "mean_token_accuracy": 0.8234541155397892, "num_tokens": 484509191.0, "step": 15181 }, { "entropy": 0.6282033333554864, "epoch": 1.3968234800259918, "grad_norm": 0.1594715714454651, "learning_rate": 5.344251234397522e-05, "loss": 0.6183, "mean_token_accuracy": 0.8142357692122459, "num_tokens": 484541565.0, "step": 15182 }, { "entropy": 0.6050581801682711, "epoch": 1.396915486397433, "grad_norm": 0.15986128151416779, "learning_rate": 5.34394455178336e-05, "loss": 0.6052, "mean_token_accuracy": 0.8179474547505379, "num_tokens": 484573859.0, "step": 15183 }, { "entropy": 0.6309493817389011, "epoch": 1.3970074927688743, "grad_norm": 0.15460677444934845, "learning_rate": 5.3436378691691965e-05, "loss": 0.6255, "mean_token_accuracy": 0.8081497699022293, "num_tokens": 484605810.0, "step": 15184 }, { "entropy": 0.6876831278204918, "epoch": 1.3970994991403154, "grad_norm": 0.1792559176683426, "learning_rate": 5.343331186555034e-05, "loss": 0.6681, "mean_token_accuracy": 0.7965166233479977, "num_tokens": 484637735.0, "step": 15185 }, { "entropy": 0.6176596563309431, "epoch": 1.3971915055117567, "grad_norm": 0.15759097039699554, "learning_rate": 5.343024503940872e-05, "loss": 0.6052, "mean_token_accuracy": 0.8133482038974762, "num_tokens": 484669656.0, "step": 15186 }, { "entropy": 0.6143154455348849, "epoch": 1.3972835118831979, "grad_norm": 0.1557808369398117, "learning_rate": 5.3427178213267096e-05, "loss": 0.6065, "mean_token_accuracy": 0.8157669678330421, "num_tokens": 484702424.0, "step": 15187 }, { "entropy": 0.5916835647076368, "epoch": 1.397375518254639, "grad_norm": 0.15013185143470764, "learning_rate": 5.3424111387125464e-05, "loss": 0.5764, "mean_token_accuracy": 0.8240131437778473, "num_tokens": 484734809.0, "step": 15188 }, { "entropy": 0.5911649595946074, "epoch": 1.3974675246260804, "grad_norm": 0.15344995260238647, "learning_rate": 5.342104456098383e-05, "loss": 0.5681, "mean_token_accuracy": 0.8247897066175938, "num_tokens": 484766928.0, "step": 15189 }, { "entropy": 0.6822904217988253, "epoch": 1.3975595309975215, "grad_norm": 0.16478902101516724, "learning_rate": 5.341797773484222e-05, "loss": 0.6685, "mean_token_accuracy": 0.7963370271027088, "num_tokens": 484799163.0, "step": 15190 }, { "entropy": 0.5985718015581369, "epoch": 1.3976515373689629, "grad_norm": 0.1552872657775879, "learning_rate": 5.341491090870059e-05, "loss": 0.5939, "mean_token_accuracy": 0.8170474655926228, "num_tokens": 484831495.0, "step": 15191 }, { "entropy": 0.7098405598662794, "epoch": 1.397743543740404, "grad_norm": 0.1600891649723053, "learning_rate": 5.341184408255896e-05, "loss": 0.6922, "mean_token_accuracy": 0.7931519486010075, "num_tokens": 484863770.0, "step": 15192 }, { "entropy": 0.6049203081056476, "epoch": 1.3978355501118451, "grad_norm": 0.1632710099220276, "learning_rate": 5.3408777256417344e-05, "loss": 0.5827, "mean_token_accuracy": 0.8161060772836208, "num_tokens": 484895181.0, "step": 15193 }, { "entropy": 0.6696636416018009, "epoch": 1.3979275564832865, "grad_norm": 0.15896053612232208, "learning_rate": 5.340571043027571e-05, "loss": 0.6599, "mean_token_accuracy": 0.7996800169348717, "num_tokens": 484927422.0, "step": 15194 }, { "entropy": 0.5931581696495414, "epoch": 1.3980195628547276, "grad_norm": 0.14937488734722137, "learning_rate": 5.3402643604134086e-05, "loss": 0.5923, "mean_token_accuracy": 0.8202966675162315, "num_tokens": 484959784.0, "step": 15195 }, { "entropy": 0.561268787831068, "epoch": 1.398111569226169, "grad_norm": 0.15067073702812195, "learning_rate": 5.3399576777992454e-05, "loss": 0.552, "mean_token_accuracy": 0.8255253657698631, "num_tokens": 484991692.0, "step": 15196 }, { "entropy": 0.5587304532527924, "epoch": 1.39820357559761, "grad_norm": 0.14902344346046448, "learning_rate": 5.3396509951850836e-05, "loss": 0.5625, "mean_token_accuracy": 0.822979960590601, "num_tokens": 485023673.0, "step": 15197 }, { "entropy": 0.5788237694650888, "epoch": 1.3982955819690512, "grad_norm": 0.15042243897914886, "learning_rate": 5.339344312570921e-05, "loss": 0.5716, "mean_token_accuracy": 0.8225456848740578, "num_tokens": 485055903.0, "step": 15198 }, { "entropy": 0.6593305841088295, "epoch": 1.3983875883404926, "grad_norm": 0.1631711721420288, "learning_rate": 5.339037629956758e-05, "loss": 0.6501, "mean_token_accuracy": 0.8011138886213303, "num_tokens": 485088030.0, "step": 15199 }, { "entropy": 0.5737909395247698, "epoch": 1.3984795947119337, "grad_norm": 0.14803124964237213, "learning_rate": 5.338730947342595e-05, "loss": 0.5659, "mean_token_accuracy": 0.8224553130567074, "num_tokens": 485120471.0, "step": 15200 }, { "entropy": 0.6076087616384029, "epoch": 1.398571601083375, "grad_norm": 0.15843670070171356, "learning_rate": 5.3384242647284334e-05, "loss": 0.6038, "mean_token_accuracy": 0.8165304698050022, "num_tokens": 485152501.0, "step": 15201 }, { "entropy": 0.6831332361325622, "epoch": 1.3986636074548162, "grad_norm": 0.1581231951713562, "learning_rate": 5.33811758211427e-05, "loss": 0.6809, "mean_token_accuracy": 0.7957522310316563, "num_tokens": 485184794.0, "step": 15202 }, { "entropy": 0.6252107750624418, "epoch": 1.3987556138262573, "grad_norm": 0.16439013183116913, "learning_rate": 5.337810899500108e-05, "loss": 0.6143, "mean_token_accuracy": 0.8105451688170433, "num_tokens": 485216554.0, "step": 15203 }, { "entropy": 0.6075268154963851, "epoch": 1.3988476201976987, "grad_norm": 0.1556159406900406, "learning_rate": 5.3375042168859445e-05, "loss": 0.5993, "mean_token_accuracy": 0.8188886493444443, "num_tokens": 485248734.0, "step": 15204 }, { "entropy": 0.5392001215368509, "epoch": 1.3989396265691398, "grad_norm": 0.14413069188594818, "learning_rate": 5.3371975342717826e-05, "loss": 0.5292, "mean_token_accuracy": 0.8376503512263298, "num_tokens": 485281104.0, "step": 15205 }, { "entropy": 0.6098469896242023, "epoch": 1.3990316329405812, "grad_norm": 0.15596473217010498, "learning_rate": 5.33689085165762e-05, "loss": 0.5897, "mean_token_accuracy": 0.8203212581574917, "num_tokens": 485312373.0, "step": 15206 }, { "entropy": 0.5912623507902026, "epoch": 1.3991236393120223, "grad_norm": 0.15412019193172455, "learning_rate": 5.336584169043457e-05, "loss": 0.5682, "mean_token_accuracy": 0.8231315352022648, "num_tokens": 485344848.0, "step": 15207 }, { "entropy": 0.527862417511642, "epoch": 1.3992156456834635, "grad_norm": 0.15142126381397247, "learning_rate": 5.336277486429294e-05, "loss": 0.4994, "mean_token_accuracy": 0.8451798632740974, "num_tokens": 485376627.0, "step": 15208 }, { "entropy": 0.555587169714272, "epoch": 1.3993076520549048, "grad_norm": 0.16320593655109406, "learning_rate": 5.3359708038151325e-05, "loss": 0.5392, "mean_token_accuracy": 0.8346041962504387, "num_tokens": 485408289.0, "step": 15209 }, { "entropy": 0.6007113326340914, "epoch": 1.399399658426346, "grad_norm": 0.15475252270698547, "learning_rate": 5.335664121200969e-05, "loss": 0.5944, "mean_token_accuracy": 0.8216967210173607, "num_tokens": 485440522.0, "step": 15210 }, { "entropy": 0.59678990021348, "epoch": 1.3994916647977873, "grad_norm": 0.14872875809669495, "learning_rate": 5.335357438586807e-05, "loss": 0.5821, "mean_token_accuracy": 0.8195930309593678, "num_tokens": 485472855.0, "step": 15211 }, { "entropy": 0.6215633004903793, "epoch": 1.3995836711692284, "grad_norm": 0.1588040590286255, "learning_rate": 5.3350507559726435e-05, "loss": 0.6131, "mean_token_accuracy": 0.8101638369262218, "num_tokens": 485505063.0, "step": 15212 }, { "entropy": 0.5540709402412176, "epoch": 1.3996756775406696, "grad_norm": 0.15621674060821533, "learning_rate": 5.3347440733584817e-05, "loss": 0.5549, "mean_token_accuracy": 0.8296704478561878, "num_tokens": 485536799.0, "step": 15213 }, { "entropy": 0.5643017990514636, "epoch": 1.399767683912111, "grad_norm": 0.15854327380657196, "learning_rate": 5.334437390744319e-05, "loss": 0.5542, "mean_token_accuracy": 0.8296115174889565, "num_tokens": 485569105.0, "step": 15214 }, { "entropy": 0.6627131756395102, "epoch": 1.399859690283552, "grad_norm": 0.15880024433135986, "learning_rate": 5.334130708130156e-05, "loss": 0.6596, "mean_token_accuracy": 0.8003541603684425, "num_tokens": 485601112.0, "step": 15215 }, { "entropy": 0.5065802987664938, "epoch": 1.3999516966549934, "grad_norm": 0.16081617772579193, "learning_rate": 5.3338240255159934e-05, "loss": 0.4953, "mean_token_accuracy": 0.8476205505430698, "num_tokens": 485632573.0, "step": 15216 }, { "entropy": 0.6537554487586021, "epoch": 1.4000437030264345, "grad_norm": 0.16771452128887177, "learning_rate": 5.3335173429018315e-05, "loss": 0.6457, "mean_token_accuracy": 0.8020741268992424, "num_tokens": 485664617.0, "step": 15217 }, { "entropy": 0.6495654154568911, "epoch": 1.4001357093978757, "grad_norm": 0.1575821489095688, "learning_rate": 5.333210660287668e-05, "loss": 0.6499, "mean_token_accuracy": 0.8015691041946411, "num_tokens": 485696087.0, "step": 15218 }, { "entropy": 0.6954506144393235, "epoch": 1.400227715769317, "grad_norm": 0.15388034284114838, "learning_rate": 5.332903977673506e-05, "loss": 0.6819, "mean_token_accuracy": 0.7946239709854126, "num_tokens": 485728657.0, "step": 15219 }, { "entropy": 0.6791565306484699, "epoch": 1.4003197221407582, "grad_norm": 0.15990084409713745, "learning_rate": 5.3325972950593426e-05, "loss": 0.6592, "mean_token_accuracy": 0.8013941757380962, "num_tokens": 485760532.0, "step": 15220 }, { "entropy": 0.7030488289892673, "epoch": 1.4004117285121995, "grad_norm": 0.15555597841739655, "learning_rate": 5.332290612445181e-05, "loss": 0.6876, "mean_token_accuracy": 0.792548306286335, "num_tokens": 485792546.0, "step": 15221 }, { "entropy": 0.5610217610374093, "epoch": 1.4005037348836407, "grad_norm": 0.1551191359758377, "learning_rate": 5.331983929831018e-05, "loss": 0.5482, "mean_token_accuracy": 0.8344278819859028, "num_tokens": 485824961.0, "step": 15222 }, { "entropy": 0.6276563964784145, "epoch": 1.4005957412550818, "grad_norm": 0.1511392593383789, "learning_rate": 5.331677247216855e-05, "loss": 0.6182, "mean_token_accuracy": 0.8104291968047619, "num_tokens": 485857097.0, "step": 15223 }, { "entropy": 0.6451674802228808, "epoch": 1.4006877476265231, "grad_norm": 0.161118283867836, "learning_rate": 5.331370564602694e-05, "loss": 0.63, "mean_token_accuracy": 0.8086323365569115, "num_tokens": 485889551.0, "step": 15224 }, { "entropy": 0.5949078947305679, "epoch": 1.4007797539979643, "grad_norm": 0.1516989916563034, "learning_rate": 5.3310638819885306e-05, "loss": 0.5809, "mean_token_accuracy": 0.8196915052831173, "num_tokens": 485921183.0, "step": 15225 }, { "entropy": 0.6014637108892202, "epoch": 1.4008717603694056, "grad_norm": 0.1590190827846527, "learning_rate": 5.330757199374368e-05, "loss": 0.5801, "mean_token_accuracy": 0.8204270340502262, "num_tokens": 485953124.0, "step": 15226 }, { "entropy": 0.6055864011868834, "epoch": 1.4009637667408468, "grad_norm": 0.153182715177536, "learning_rate": 5.330450516760205e-05, "loss": 0.5921, "mean_token_accuracy": 0.8175683915615082, "num_tokens": 485985892.0, "step": 15227 }, { "entropy": 0.6746439440175891, "epoch": 1.401055773112288, "grad_norm": 0.16355878114700317, "learning_rate": 5.330143834146043e-05, "loss": 0.6709, "mean_token_accuracy": 0.8003303036093712, "num_tokens": 486017769.0, "step": 15228 }, { "entropy": 0.6786901112645864, "epoch": 1.4011477794837293, "grad_norm": 0.16573598980903625, "learning_rate": 5.3298371515318804e-05, "loss": 0.6694, "mean_token_accuracy": 0.7920028530061245, "num_tokens": 486049211.0, "step": 15229 }, { "entropy": 0.6334695387631655, "epoch": 1.4012397858551704, "grad_norm": 0.15296554565429688, "learning_rate": 5.329530468917717e-05, "loss": 0.6232, "mean_token_accuracy": 0.8098510801792145, "num_tokens": 486081593.0, "step": 15230 }, { "entropy": 0.6893298709765077, "epoch": 1.4013317922266117, "grad_norm": 0.1586633026599884, "learning_rate": 5.329223786303555e-05, "loss": 0.6809, "mean_token_accuracy": 0.7918584458529949, "num_tokens": 486114197.0, "step": 15231 }, { "entropy": 0.5593343237414956, "epoch": 1.4014237985980529, "grad_norm": 0.15181468427181244, "learning_rate": 5.328917103689393e-05, "loss": 0.5431, "mean_token_accuracy": 0.8326040469110012, "num_tokens": 486146109.0, "step": 15232 }, { "entropy": 0.7007709871977568, "epoch": 1.401515804969494, "grad_norm": 0.16239044070243835, "learning_rate": 5.3286104210752296e-05, "loss": 0.6926, "mean_token_accuracy": 0.7841852270066738, "num_tokens": 486177772.0, "step": 15233 }, { "entropy": 0.5815663831308484, "epoch": 1.4016078113409354, "grad_norm": 0.15620234608650208, "learning_rate": 5.328303738461067e-05, "loss": 0.5758, "mean_token_accuracy": 0.823066707700491, "num_tokens": 486210090.0, "step": 15234 }, { "entropy": 0.6021432112902403, "epoch": 1.4016998177123765, "grad_norm": 0.16076600551605225, "learning_rate": 5.327997055846904e-05, "loss": 0.6036, "mean_token_accuracy": 0.8169089555740356, "num_tokens": 486242110.0, "step": 15235 }, { "entropy": 0.6010150676593184, "epoch": 1.4017918240838179, "grad_norm": 0.16007660329341888, "learning_rate": 5.327690373232742e-05, "loss": 0.5865, "mean_token_accuracy": 0.8163632825016975, "num_tokens": 486273921.0, "step": 15236 }, { "entropy": 0.4796686419285834, "epoch": 1.401883830455259, "grad_norm": 0.1419937014579773, "learning_rate": 5.3273836906185795e-05, "loss": 0.4596, "mean_token_accuracy": 0.8537754788994789, "num_tokens": 486306359.0, "step": 15237 }, { "entropy": 0.5681639146059752, "epoch": 1.4019758368267001, "grad_norm": 0.15945148468017578, "learning_rate": 5.327077008004416e-05, "loss": 0.5577, "mean_token_accuracy": 0.8271456174552441, "num_tokens": 486336789.0, "step": 15238 }, { "entropy": 0.5394621519371867, "epoch": 1.4020678431981415, "grad_norm": 0.14996901154518127, "learning_rate": 5.326770325390254e-05, "loss": 0.5248, "mean_token_accuracy": 0.8358619809150696, "num_tokens": 486368460.0, "step": 15239 }, { "entropy": 0.6015882678329945, "epoch": 1.4021598495695826, "grad_norm": 0.15540194511413574, "learning_rate": 5.326463642776092e-05, "loss": 0.5887, "mean_token_accuracy": 0.818665899336338, "num_tokens": 486400537.0, "step": 15240 }, { "entropy": 0.7016670648008585, "epoch": 1.402251855941024, "grad_norm": 0.16642850637435913, "learning_rate": 5.3261569601619286e-05, "loss": 0.6944, "mean_token_accuracy": 0.79373649507761, "num_tokens": 486432344.0, "step": 15241 }, { "entropy": 0.594503091648221, "epoch": 1.402343862312465, "grad_norm": 0.16048982739448547, "learning_rate": 5.325850277547766e-05, "loss": 0.5769, "mean_token_accuracy": 0.8236000649631023, "num_tokens": 486463964.0, "step": 15242 }, { "entropy": 0.6360301962122321, "epoch": 1.4024358686839062, "grad_norm": 0.1533174216747284, "learning_rate": 5.325543594933603e-05, "loss": 0.6341, "mean_token_accuracy": 0.8057439289987087, "num_tokens": 486496207.0, "step": 15243 }, { "entropy": 0.5756992064416409, "epoch": 1.4025278750553476, "grad_norm": 0.1603887975215912, "learning_rate": 5.325236912319441e-05, "loss": 0.5754, "mean_token_accuracy": 0.8246300406754017, "num_tokens": 486527061.0, "step": 15244 }, { "entropy": 0.5535460205283016, "epoch": 1.4026198814267887, "grad_norm": 0.1640520840883255, "learning_rate": 5.3249302297052785e-05, "loss": 0.549, "mean_token_accuracy": 0.8320127427577972, "num_tokens": 486558928.0, "step": 15245 }, { "entropy": 0.6114097870886326, "epoch": 1.40271188779823, "grad_norm": 0.16247598826885223, "learning_rate": 5.324623547091115e-05, "loss": 0.6071, "mean_token_accuracy": 0.8134049102663994, "num_tokens": 486590640.0, "step": 15246 }, { "entropy": 0.6356755746528506, "epoch": 1.4028038941696712, "grad_norm": 0.1648918092250824, "learning_rate": 5.324316864476953e-05, "loss": 0.6233, "mean_token_accuracy": 0.8065075054764748, "num_tokens": 486622335.0, "step": 15247 }, { "entropy": 0.4993219589814544, "epoch": 1.4028959005411124, "grad_norm": 0.15179064869880676, "learning_rate": 5.324010181862791e-05, "loss": 0.4683, "mean_token_accuracy": 0.8534139581024647, "num_tokens": 486654111.0, "step": 15248 }, { "entropy": 0.7238290384411812, "epoch": 1.4029879069125537, "grad_norm": 0.16211949288845062, "learning_rate": 5.323703499248628e-05, "loss": 0.7086, "mean_token_accuracy": 0.7844134569168091, "num_tokens": 486686462.0, "step": 15249 }, { "entropy": 0.6047627795487642, "epoch": 1.4030799132839948, "grad_norm": 0.15794150531291962, "learning_rate": 5.323396816634465e-05, "loss": 0.5955, "mean_token_accuracy": 0.8187708333134651, "num_tokens": 486717688.0, "step": 15250 }, { "entropy": 0.4594041993841529, "epoch": 1.4031719196554362, "grad_norm": 0.15585875511169434, "learning_rate": 5.323090134020302e-05, "loss": 0.4385, "mean_token_accuracy": 0.8645736239850521, "num_tokens": 486750143.0, "step": 15251 }, { "entropy": 0.5738633936271071, "epoch": 1.4032639260268773, "grad_norm": 0.16547007858753204, "learning_rate": 5.32278345140614e-05, "loss": 0.5629, "mean_token_accuracy": 0.8271709866821766, "num_tokens": 486781830.0, "step": 15252 }, { "entropy": 0.5646119732409716, "epoch": 1.4033559323983185, "grad_norm": 0.14784854650497437, "learning_rate": 5.3224767687919775e-05, "loss": 0.5537, "mean_token_accuracy": 0.8268708139657974, "num_tokens": 486813861.0, "step": 15253 }, { "entropy": 0.6528734341263771, "epoch": 1.4034479387697598, "grad_norm": 0.16293881833553314, "learning_rate": 5.322170086177814e-05, "loss": 0.6476, "mean_token_accuracy": 0.80480170622468, "num_tokens": 486845994.0, "step": 15254 }, { "entropy": 0.64247758500278, "epoch": 1.403539945141201, "grad_norm": 0.15516386926174164, "learning_rate": 5.3218634035636525e-05, "loss": 0.6273, "mean_token_accuracy": 0.8098942525684834, "num_tokens": 486878265.0, "step": 15255 }, { "entropy": 0.6705501372925937, "epoch": 1.4036319515126423, "grad_norm": 0.1608368307352066, "learning_rate": 5.32155672094949e-05, "loss": 0.6687, "mean_token_accuracy": 0.7994280122220516, "num_tokens": 486910126.0, "step": 15256 }, { "entropy": 0.5870199128985405, "epoch": 1.4037239578840834, "grad_norm": 0.15381260216236115, "learning_rate": 5.321250038335327e-05, "loss": 0.576, "mean_token_accuracy": 0.8207539096474648, "num_tokens": 486942611.0, "step": 15257 }, { "entropy": 0.5791694996878505, "epoch": 1.4038159642555246, "grad_norm": 0.16311593353748322, "learning_rate": 5.320943355721164e-05, "loss": 0.555, "mean_token_accuracy": 0.8277761563658714, "num_tokens": 486974240.0, "step": 15258 }, { "entropy": 0.575820900965482, "epoch": 1.403907970626966, "grad_norm": 0.15530037879943848, "learning_rate": 5.320636673107002e-05, "loss": 0.5669, "mean_token_accuracy": 0.8271275907754898, "num_tokens": 487005536.0, "step": 15259 }, { "entropy": 0.6875792443752289, "epoch": 1.403999976998407, "grad_norm": 0.16182570159435272, "learning_rate": 5.320329990492839e-05, "loss": 0.6873, "mean_token_accuracy": 0.7926139608025551, "num_tokens": 487037497.0, "step": 15260 }, { "entropy": 0.6832538787275553, "epoch": 1.4040919833698484, "grad_norm": 0.16401934623718262, "learning_rate": 5.3200233078786766e-05, "loss": 0.6633, "mean_token_accuracy": 0.7977738454937935, "num_tokens": 487069060.0, "step": 15261 }, { "entropy": 0.6577444961294532, "epoch": 1.4041839897412896, "grad_norm": 0.16453154385089874, "learning_rate": 5.3197166252645134e-05, "loss": 0.6644, "mean_token_accuracy": 0.8009327761828899, "num_tokens": 487099872.0, "step": 15262 }, { "entropy": 0.6072616837918758, "epoch": 1.4042759961127307, "grad_norm": 0.15728069841861725, "learning_rate": 5.319409942650352e-05, "loss": 0.59, "mean_token_accuracy": 0.8159242458641529, "num_tokens": 487131190.0, "step": 15263 }, { "entropy": 0.6108940113335848, "epoch": 1.404368002484172, "grad_norm": 0.15343637764453888, "learning_rate": 5.319103260036189e-05, "loss": 0.6088, "mean_token_accuracy": 0.8160094544291496, "num_tokens": 487163510.0, "step": 15264 }, { "entropy": 0.5550868678838015, "epoch": 1.4044600088556132, "grad_norm": 0.15500247478485107, "learning_rate": 5.318796577422026e-05, "loss": 0.5435, "mean_token_accuracy": 0.829854317009449, "num_tokens": 487195579.0, "step": 15265 }, { "entropy": 0.6527521833777428, "epoch": 1.4045520152270545, "grad_norm": 0.1585613340139389, "learning_rate": 5.318489894807863e-05, "loss": 0.6561, "mean_token_accuracy": 0.8025599457323551, "num_tokens": 487227911.0, "step": 15266 }, { "entropy": 0.6035809554159641, "epoch": 1.4046440215984957, "grad_norm": 0.15534767508506775, "learning_rate": 5.3181832121937014e-05, "loss": 0.5935, "mean_token_accuracy": 0.8172976821660995, "num_tokens": 487259489.0, "step": 15267 }, { "entropy": 0.648838876048103, "epoch": 1.4047360279699368, "grad_norm": 0.15594948828220367, "learning_rate": 5.317876529579539e-05, "loss": 0.6315, "mean_token_accuracy": 0.8072623647749424, "num_tokens": 487292205.0, "step": 15268 }, { "entropy": 0.5898030889220536, "epoch": 1.4048280343413782, "grad_norm": 0.1494666188955307, "learning_rate": 5.3175698469653756e-05, "loss": 0.5664, "mean_token_accuracy": 0.8257778026163578, "num_tokens": 487324572.0, "step": 15269 }, { "entropy": 0.624253885820508, "epoch": 1.4049200407128193, "grad_norm": 0.1556445211172104, "learning_rate": 5.317263164351213e-05, "loss": 0.6128, "mean_token_accuracy": 0.8126649670302868, "num_tokens": 487356697.0, "step": 15270 }, { "entropy": 0.5445368764922023, "epoch": 1.4050120470842606, "grad_norm": 0.14631003141403198, "learning_rate": 5.316956481737051e-05, "loss": 0.5255, "mean_token_accuracy": 0.8400739170610905, "num_tokens": 487389156.0, "step": 15271 }, { "entropy": 0.6590197430923581, "epoch": 1.4051040534557018, "grad_norm": 0.16472162306308746, "learning_rate": 5.316649799122888e-05, "loss": 0.6557, "mean_token_accuracy": 0.8038139827549458, "num_tokens": 487420883.0, "step": 15272 }, { "entropy": 0.5184468715451658, "epoch": 1.405196059827143, "grad_norm": 0.15846216678619385, "learning_rate": 5.3163431165087255e-05, "loss": 0.4879, "mean_token_accuracy": 0.8468754626810551, "num_tokens": 487452284.0, "step": 15273 }, { "entropy": 0.5400831438601017, "epoch": 1.4052880661985843, "grad_norm": 0.15062986314296722, "learning_rate": 5.316036433894562e-05, "loss": 0.534, "mean_token_accuracy": 0.8377424627542496, "num_tokens": 487484233.0, "step": 15274 }, { "entropy": 0.6073900181800127, "epoch": 1.4053800725700254, "grad_norm": 0.16294530034065247, "learning_rate": 5.3157297512804004e-05, "loss": 0.5951, "mean_token_accuracy": 0.8181222081184387, "num_tokens": 487516461.0, "step": 15275 }, { "entropy": 0.5915073323994875, "epoch": 1.4054720789414668, "grad_norm": 0.15056703984737396, "learning_rate": 5.315423068666238e-05, "loss": 0.5839, "mean_token_accuracy": 0.8199011757969856, "num_tokens": 487548313.0, "step": 15276 }, { "entropy": 0.5703252851963043, "epoch": 1.4055640853129079, "grad_norm": 0.15520495176315308, "learning_rate": 5.3151163860520747e-05, "loss": 0.5572, "mean_token_accuracy": 0.8301072642207146, "num_tokens": 487580208.0, "step": 15277 }, { "entropy": 0.6348697040230036, "epoch": 1.405656091684349, "grad_norm": 0.16497385501861572, "learning_rate": 5.314809703437912e-05, "loss": 0.6372, "mean_token_accuracy": 0.8069254755973816, "num_tokens": 487611558.0, "step": 15278 }, { "entropy": 0.5036752466112375, "epoch": 1.4057480980557904, "grad_norm": 0.15566475689411163, "learning_rate": 5.31450302082375e-05, "loss": 0.4957, "mean_token_accuracy": 0.8483621217310429, "num_tokens": 487643086.0, "step": 15279 }, { "entropy": 0.6196948057040572, "epoch": 1.4058401044272315, "grad_norm": 0.16236470639705658, "learning_rate": 5.314196338209587e-05, "loss": 0.6104, "mean_token_accuracy": 0.815090473741293, "num_tokens": 487674791.0, "step": 15280 }, { "entropy": 0.721234505996108, "epoch": 1.4059321107986729, "grad_norm": 0.16236263513565063, "learning_rate": 5.3138896555954245e-05, "loss": 0.7304, "mean_token_accuracy": 0.777460265904665, "num_tokens": 487706295.0, "step": 15281 }, { "entropy": 0.7408735733479261, "epoch": 1.406024117170114, "grad_norm": 0.16345198452472687, "learning_rate": 5.313582972981261e-05, "loss": 0.73, "mean_token_accuracy": 0.7822703868150711, "num_tokens": 487738702.0, "step": 15282 }, { "entropy": 0.542714549228549, "epoch": 1.4061161235415551, "grad_norm": 0.14653120934963226, "learning_rate": 5.3132762903670994e-05, "loss": 0.5215, "mean_token_accuracy": 0.8433949984610081, "num_tokens": 487770518.0, "step": 15283 }, { "entropy": 0.688910536468029, "epoch": 1.4062081299129965, "grad_norm": 0.16220290958881378, "learning_rate": 5.312969607752937e-05, "loss": 0.6765, "mean_token_accuracy": 0.7935415804386139, "num_tokens": 487802346.0, "step": 15284 }, { "entropy": 0.564340578392148, "epoch": 1.4063001362844376, "grad_norm": 0.15278306603431702, "learning_rate": 5.312662925138774e-05, "loss": 0.5283, "mean_token_accuracy": 0.8363953158259392, "num_tokens": 487834141.0, "step": 15285 }, { "entropy": 0.7222544541582465, "epoch": 1.406392142655879, "grad_norm": 0.165878564119339, "learning_rate": 5.312356242524612e-05, "loss": 0.7072, "mean_token_accuracy": 0.786216501146555, "num_tokens": 487866222.0, "step": 15286 }, { "entropy": 0.6307913810014725, "epoch": 1.40648414902732, "grad_norm": 0.15863999724388123, "learning_rate": 5.312049559910449e-05, "loss": 0.6154, "mean_token_accuracy": 0.8127797953784466, "num_tokens": 487897954.0, "step": 15287 }, { "entropy": 0.7433861009776592, "epoch": 1.4065761553987612, "grad_norm": 0.1666620671749115, "learning_rate": 5.311742877296286e-05, "loss": 0.7216, "mean_token_accuracy": 0.7858527153730392, "num_tokens": 487930717.0, "step": 15288 }, { "entropy": 0.6327617662027478, "epoch": 1.4066681617702026, "grad_norm": 0.1576872169971466, "learning_rate": 5.3114361946821236e-05, "loss": 0.624, "mean_token_accuracy": 0.8047334589064121, "num_tokens": 487962690.0, "step": 15289 }, { "entropy": 0.5742378709837794, "epoch": 1.4067601681416437, "grad_norm": 0.1516074389219284, "learning_rate": 5.311129512067962e-05, "loss": 0.5573, "mean_token_accuracy": 0.8299559764564037, "num_tokens": 487994703.0, "step": 15290 }, { "entropy": 0.5793960941955447, "epoch": 1.406852174513085, "grad_norm": 0.16419410705566406, "learning_rate": 5.3108228294537985e-05, "loss": 0.5763, "mean_token_accuracy": 0.8232254646718502, "num_tokens": 488026290.0, "step": 15291 }, { "entropy": 0.7588746389374137, "epoch": 1.4069441808845262, "grad_norm": 0.16524772346019745, "learning_rate": 5.310516146839636e-05, "loss": 0.7511, "mean_token_accuracy": 0.774524874985218, "num_tokens": 488058327.0, "step": 15292 }, { "entropy": 0.6104453383013606, "epoch": 1.4070361872559674, "grad_norm": 0.1536269634962082, "learning_rate": 5.310209464225473e-05, "loss": 0.6026, "mean_token_accuracy": 0.8129221275448799, "num_tokens": 488090128.0, "step": 15293 }, { "entropy": 0.6277781678363681, "epoch": 1.4071281936274087, "grad_norm": 0.15277168154716492, "learning_rate": 5.309902781611311e-05, "loss": 0.6196, "mean_token_accuracy": 0.8112550303339958, "num_tokens": 488122475.0, "step": 15294 }, { "entropy": 0.6680510956794024, "epoch": 1.4072201999988498, "grad_norm": 0.1595848798751831, "learning_rate": 5.3095960989971483e-05, "loss": 0.6648, "mean_token_accuracy": 0.7959019765257835, "num_tokens": 488154306.0, "step": 15295 }, { "entropy": 0.5898949457332492, "epoch": 1.4073122063702912, "grad_norm": 0.1518932431936264, "learning_rate": 5.309289416382985e-05, "loss": 0.5762, "mean_token_accuracy": 0.8247500285506248, "num_tokens": 488185585.0, "step": 15296 }, { "entropy": 0.6874928968027234, "epoch": 1.4074042127417323, "grad_norm": 0.15734204649925232, "learning_rate": 5.3089827337688226e-05, "loss": 0.6785, "mean_token_accuracy": 0.792572844773531, "num_tokens": 488217805.0, "step": 15297 }, { "entropy": 0.6445957208052278, "epoch": 1.4074962191131735, "grad_norm": 0.15577290952205658, "learning_rate": 5.308676051154661e-05, "loss": 0.6327, "mean_token_accuracy": 0.8095278404653072, "num_tokens": 488250318.0, "step": 15298 }, { "entropy": 0.6178026394918561, "epoch": 1.4075882254846148, "grad_norm": 0.15668973326683044, "learning_rate": 5.3083693685404975e-05, "loss": 0.6068, "mean_token_accuracy": 0.8166442401707172, "num_tokens": 488282207.0, "step": 15299 }, { "entropy": 0.6447202805429697, "epoch": 1.407680231856056, "grad_norm": 0.1571938842535019, "learning_rate": 5.308062685926335e-05, "loss": 0.6368, "mean_token_accuracy": 0.8069269582629204, "num_tokens": 488313740.0, "step": 15300 }, { "entropy": 0.6182971373200417, "epoch": 1.4077722382274973, "grad_norm": 0.16172391176223755, "learning_rate": 5.307756003312172e-05, "loss": 0.6184, "mean_token_accuracy": 0.8100530281662941, "num_tokens": 488345269.0, "step": 15301 }, { "entropy": 0.5553032474126667, "epoch": 1.4078642445989384, "grad_norm": 0.15460146963596344, "learning_rate": 5.3074493206980106e-05, "loss": 0.555, "mean_token_accuracy": 0.8295189626514912, "num_tokens": 488377570.0, "step": 15302 }, { "entropy": 0.5026899934746325, "epoch": 1.4079562509703796, "grad_norm": 0.1420556604862213, "learning_rate": 5.3071426380838474e-05, "loss": 0.4803, "mean_token_accuracy": 0.8478940799832344, "num_tokens": 488408781.0, "step": 15303 }, { "entropy": 0.6519004860892892, "epoch": 1.408048257341821, "grad_norm": 0.15612943470478058, "learning_rate": 5.306835955469684e-05, "loss": 0.6461, "mean_token_accuracy": 0.8049517944455147, "num_tokens": 488440685.0, "step": 15304 }, { "entropy": 0.6073935232125223, "epoch": 1.408140263713262, "grad_norm": 0.16148874163627625, "learning_rate": 5.3065292728555216e-05, "loss": 0.5979, "mean_token_accuracy": 0.8160014748573303, "num_tokens": 488471631.0, "step": 15305 }, { "entropy": 0.6831851699389517, "epoch": 1.4082322700847034, "grad_norm": 0.16295728087425232, "learning_rate": 5.30622259024136e-05, "loss": 0.6741, "mean_token_accuracy": 0.7950636856257915, "num_tokens": 488503326.0, "step": 15306 }, { "entropy": 0.6265941401943564, "epoch": 1.4083242764561446, "grad_norm": 0.15983128547668457, "learning_rate": 5.305915907627197e-05, "loss": 0.6196, "mean_token_accuracy": 0.8087420910596848, "num_tokens": 488535943.0, "step": 15307 }, { "entropy": 0.621041995473206, "epoch": 1.4084162828275857, "grad_norm": 0.15993064641952515, "learning_rate": 5.305609225013034e-05, "loss": 0.6092, "mean_token_accuracy": 0.8139655590057373, "num_tokens": 488568711.0, "step": 15308 }, { "entropy": 0.6622148994356394, "epoch": 1.408508289199027, "grad_norm": 0.15588541328907013, "learning_rate": 5.305302542398871e-05, "loss": 0.6609, "mean_token_accuracy": 0.8024056404829025, "num_tokens": 488601243.0, "step": 15309 }, { "entropy": 0.5910425465553999, "epoch": 1.4086002955704682, "grad_norm": 0.15388070046901703, "learning_rate": 5.3049958597847096e-05, "loss": 0.5748, "mean_token_accuracy": 0.8236626982688904, "num_tokens": 488633463.0, "step": 15310 }, { "entropy": 0.6075641820207238, "epoch": 1.4086923019419095, "grad_norm": 0.15845094621181488, "learning_rate": 5.3046891771705464e-05, "loss": 0.6007, "mean_token_accuracy": 0.8149989023804665, "num_tokens": 488665476.0, "step": 15311 }, { "entropy": 0.5296744578517973, "epoch": 1.4087843083133507, "grad_norm": 0.15348409116268158, "learning_rate": 5.304382494556384e-05, "loss": 0.5096, "mean_token_accuracy": 0.8415365926921368, "num_tokens": 488697806.0, "step": 15312 }, { "entropy": 0.5861926898360252, "epoch": 1.4088763146847918, "grad_norm": 0.1525213122367859, "learning_rate": 5.304075811942221e-05, "loss": 0.5774, "mean_token_accuracy": 0.8211039006710052, "num_tokens": 488729903.0, "step": 15313 }, { "entropy": 0.6535147521644831, "epoch": 1.4089683210562332, "grad_norm": 0.1632235050201416, "learning_rate": 5.303769129328059e-05, "loss": 0.6456, "mean_token_accuracy": 0.802250012755394, "num_tokens": 488762488.0, "step": 15314 }, { "entropy": 0.5723133534193039, "epoch": 1.4090603274276743, "grad_norm": 0.1633490025997162, "learning_rate": 5.303462446713896e-05, "loss": 0.5728, "mean_token_accuracy": 0.8226849660277367, "num_tokens": 488794248.0, "step": 15315 }, { "entropy": 0.6262085177004337, "epoch": 1.4091523337991156, "grad_norm": 0.1625182330608368, "learning_rate": 5.303155764099733e-05, "loss": 0.6062, "mean_token_accuracy": 0.8163077794015408, "num_tokens": 488826484.0, "step": 15316 }, { "entropy": 0.601121200248599, "epoch": 1.4092443401705568, "grad_norm": 0.1622476577758789, "learning_rate": 5.302849081485571e-05, "loss": 0.5928, "mean_token_accuracy": 0.8172049894928932, "num_tokens": 488858658.0, "step": 15317 }, { "entropy": 0.6480224295519292, "epoch": 1.409336346541998, "grad_norm": 0.1519586741924286, "learning_rate": 5.302542398871409e-05, "loss": 0.6371, "mean_token_accuracy": 0.8072790205478668, "num_tokens": 488890999.0, "step": 15318 }, { "entropy": 0.609926288947463, "epoch": 1.4094283529134393, "grad_norm": 0.15716920793056488, "learning_rate": 5.3022357162572455e-05, "loss": 0.595, "mean_token_accuracy": 0.8200767710804939, "num_tokens": 488922545.0, "step": 15319 }, { "entropy": 0.699685275554657, "epoch": 1.4095203592848804, "grad_norm": 0.16404686868190765, "learning_rate": 5.301929033643083e-05, "loss": 0.6834, "mean_token_accuracy": 0.7929071001708508, "num_tokens": 488954124.0, "step": 15320 }, { "entropy": 0.6062635518610477, "epoch": 1.4096123656563218, "grad_norm": 0.15761254727840424, "learning_rate": 5.301622351028921e-05, "loss": 0.6016, "mean_token_accuracy": 0.8176194056868553, "num_tokens": 488985480.0, "step": 15321 }, { "entropy": 0.5913577154278755, "epoch": 1.4097043720277629, "grad_norm": 0.14988066256046295, "learning_rate": 5.301315668414758e-05, "loss": 0.5827, "mean_token_accuracy": 0.8189326785504818, "num_tokens": 489017505.0, "step": 15322 }, { "entropy": 0.6806764854118228, "epoch": 1.409796378399204, "grad_norm": 0.16075032949447632, "learning_rate": 5.301008985800595e-05, "loss": 0.6723, "mean_token_accuracy": 0.7979416027665138, "num_tokens": 489049207.0, "step": 15323 }, { "entropy": 0.6870513432659209, "epoch": 1.4098883847706454, "grad_norm": 0.16593563556671143, "learning_rate": 5.300702303186432e-05, "loss": 0.687, "mean_token_accuracy": 0.7888948321342468, "num_tokens": 489079910.0, "step": 15324 }, { "entropy": 0.6955335829406977, "epoch": 1.4099803911420865, "grad_norm": 0.16737547516822815, "learning_rate": 5.30039562057227e-05, "loss": 0.6809, "mean_token_accuracy": 0.7884808778762817, "num_tokens": 489110351.0, "step": 15325 }, { "entropy": 0.6076020412147045, "epoch": 1.4100723975135279, "grad_norm": 0.1563960760831833, "learning_rate": 5.300088937958108e-05, "loss": 0.6021, "mean_token_accuracy": 0.8112610429525375, "num_tokens": 489142221.0, "step": 15326 }, { "entropy": 0.5997037943452597, "epoch": 1.410164403884969, "grad_norm": 0.15424318611621857, "learning_rate": 5.2997822553439445e-05, "loss": 0.586, "mean_token_accuracy": 0.8176491633057594, "num_tokens": 489173867.0, "step": 15327 }, { "entropy": 0.5974665060639381, "epoch": 1.4102564102564101, "grad_norm": 0.15849053859710693, "learning_rate": 5.299475572729782e-05, "loss": 0.5858, "mean_token_accuracy": 0.8197358176112175, "num_tokens": 489205784.0, "step": 15328 }, { "entropy": 0.5676660221070051, "epoch": 1.4103484166278515, "grad_norm": 0.15392442047595978, "learning_rate": 5.29916889011562e-05, "loss": 0.5496, "mean_token_accuracy": 0.8269581906497478, "num_tokens": 489238027.0, "step": 15329 }, { "entropy": 0.7298863278701901, "epoch": 1.4104404229992926, "grad_norm": 0.16154582798480988, "learning_rate": 5.298862207501457e-05, "loss": 0.7133, "mean_token_accuracy": 0.785091008991003, "num_tokens": 489270266.0, "step": 15330 }, { "entropy": 0.6711881086230278, "epoch": 1.410532429370734, "grad_norm": 0.158863827586174, "learning_rate": 5.2985555248872944e-05, "loss": 0.6531, "mean_token_accuracy": 0.8038175851106644, "num_tokens": 489302452.0, "step": 15331 }, { "entropy": 0.6507463809102774, "epoch": 1.410624435742175, "grad_norm": 0.163125678896904, "learning_rate": 5.298248842273131e-05, "loss": 0.641, "mean_token_accuracy": 0.8041867539286613, "num_tokens": 489334437.0, "step": 15332 }, { "entropy": 0.6823274083435535, "epoch": 1.4107164421136162, "grad_norm": 0.16595692932605743, "learning_rate": 5.297942159658969e-05, "loss": 0.6663, "mean_token_accuracy": 0.7955467291176319, "num_tokens": 489365699.0, "step": 15333 }, { "entropy": 0.555912759155035, "epoch": 1.4108084484850576, "grad_norm": 0.15535421669483185, "learning_rate": 5.297635477044807e-05, "loss": 0.5468, "mean_token_accuracy": 0.8342216573655605, "num_tokens": 489398073.0, "step": 15334 }, { "entropy": 0.6570857772603631, "epoch": 1.4109004548564987, "grad_norm": 0.15709732472896576, "learning_rate": 5.2973287944306435e-05, "loss": 0.6421, "mean_token_accuracy": 0.8031359799206257, "num_tokens": 489429985.0, "step": 15335 }, { "entropy": 0.6242386549711227, "epoch": 1.41099246122794, "grad_norm": 0.16070076823234558, "learning_rate": 5.297022111816481e-05, "loss": 0.6151, "mean_token_accuracy": 0.8126376494765282, "num_tokens": 489461797.0, "step": 15336 }, { "entropy": 0.6306798774749041, "epoch": 1.4110844675993812, "grad_norm": 0.16001084446907043, "learning_rate": 5.296715429202319e-05, "loss": 0.6208, "mean_token_accuracy": 0.8085699081420898, "num_tokens": 489492627.0, "step": 15337 }, { "entropy": 0.6180215030908585, "epoch": 1.4111764739708224, "grad_norm": 0.15011432766914368, "learning_rate": 5.296408746588156e-05, "loss": 0.6056, "mean_token_accuracy": 0.8136832006275654, "num_tokens": 489524952.0, "step": 15338 }, { "entropy": 0.6698107505217195, "epoch": 1.4112684803422637, "grad_norm": 0.15524789690971375, "learning_rate": 5.2961020639739934e-05, "loss": 0.6542, "mean_token_accuracy": 0.7996007911860943, "num_tokens": 489557061.0, "step": 15339 }, { "entropy": 0.5444951658137143, "epoch": 1.4113604867137048, "grad_norm": 0.153168186545372, "learning_rate": 5.29579538135983e-05, "loss": 0.5369, "mean_token_accuracy": 0.8387733809649944, "num_tokens": 489589564.0, "step": 15340 }, { "entropy": 0.6859938129782677, "epoch": 1.4114524930851462, "grad_norm": 0.1675758957862854, "learning_rate": 5.295488698745668e-05, "loss": 0.6714, "mean_token_accuracy": 0.7942909970879555, "num_tokens": 489621831.0, "step": 15341 }, { "entropy": 0.5286345602944493, "epoch": 1.4115444994565873, "grad_norm": 0.1444603055715561, "learning_rate": 5.295182016131506e-05, "loss": 0.5168, "mean_token_accuracy": 0.8399224653840065, "num_tokens": 489654079.0, "step": 15342 }, { "entropy": 0.6350334053859115, "epoch": 1.4116365058280285, "grad_norm": 0.15901495516300201, "learning_rate": 5.2948753335173426e-05, "loss": 0.6264, "mean_token_accuracy": 0.8071246109902859, "num_tokens": 489686379.0, "step": 15343 }, { "entropy": 0.5742808356881142, "epoch": 1.4117285121994698, "grad_norm": 0.15422335267066956, "learning_rate": 5.2945686509031814e-05, "loss": 0.5662, "mean_token_accuracy": 0.8268059678375721, "num_tokens": 489718118.0, "step": 15344 }, { "entropy": 0.5542657375335693, "epoch": 1.411820518570911, "grad_norm": 0.15431435406208038, "learning_rate": 5.294261968289018e-05, "loss": 0.5312, "mean_token_accuracy": 0.8338841386139393, "num_tokens": 489749813.0, "step": 15345 }, { "entropy": 0.5465168668888509, "epoch": 1.4119125249423523, "grad_norm": 0.15230534970760345, "learning_rate": 5.2939552856748557e-05, "loss": 0.5362, "mean_token_accuracy": 0.83586236089468, "num_tokens": 489782170.0, "step": 15346 }, { "entropy": 0.5897638257592916, "epoch": 1.4120045313137934, "grad_norm": 0.15708941221237183, "learning_rate": 5.2936486030606924e-05, "loss": 0.586, "mean_token_accuracy": 0.8166618831455708, "num_tokens": 489813969.0, "step": 15347 }, { "entropy": 0.6051710322499275, "epoch": 1.4120965376852346, "grad_norm": 0.1534903198480606, "learning_rate": 5.2933419204465306e-05, "loss": 0.5934, "mean_token_accuracy": 0.8209854885935783, "num_tokens": 489845790.0, "step": 15348 }, { "entropy": 0.6455524563789368, "epoch": 1.412188544056676, "grad_norm": 0.150975301861763, "learning_rate": 5.293035237832368e-05, "loss": 0.6422, "mean_token_accuracy": 0.8029180951416492, "num_tokens": 489878554.0, "step": 15349 }, { "entropy": 0.6750368038192391, "epoch": 1.412280550428117, "grad_norm": 0.15725605189800262, "learning_rate": 5.292728555218205e-05, "loss": 0.66, "mean_token_accuracy": 0.800733856856823, "num_tokens": 489910316.0, "step": 15350 }, { "entropy": 0.721755538135767, "epoch": 1.4123725567995584, "grad_norm": 0.16148732602596283, "learning_rate": 5.292421872604042e-05, "loss": 0.7034, "mean_token_accuracy": 0.7869605123996735, "num_tokens": 489942032.0, "step": 15351 }, { "entropy": 0.7731480542570353, "epoch": 1.4124645631709996, "grad_norm": 0.16494271159172058, "learning_rate": 5.2921151899898804e-05, "loss": 0.7561, "mean_token_accuracy": 0.7749280147254467, "num_tokens": 489974026.0, "step": 15352 }, { "entropy": 0.6586611047387123, "epoch": 1.4125565695424407, "grad_norm": 0.16115830838680267, "learning_rate": 5.291808507375717e-05, "loss": 0.6435, "mean_token_accuracy": 0.8037238605320454, "num_tokens": 490006042.0, "step": 15353 }, { "entropy": 0.6122302617877722, "epoch": 1.412648575913882, "grad_norm": 0.15708020329475403, "learning_rate": 5.291501824761555e-05, "loss": 0.6101, "mean_token_accuracy": 0.811190627515316, "num_tokens": 490038205.0, "step": 15354 }, { "entropy": 0.5569055285304785, "epoch": 1.4127405822853232, "grad_norm": 0.15231379866600037, "learning_rate": 5.2911951421473915e-05, "loss": 0.5416, "mean_token_accuracy": 0.8357484191656113, "num_tokens": 490070718.0, "step": 15355 }, { "entropy": 0.6188960820436478, "epoch": 1.4128325886567645, "grad_norm": 0.15184922516345978, "learning_rate": 5.2908884595332296e-05, "loss": 0.6101, "mean_token_accuracy": 0.8142894133925438, "num_tokens": 490103130.0, "step": 15356 }, { "entropy": 0.6196503462269902, "epoch": 1.4129245950282057, "grad_norm": 0.15573057532310486, "learning_rate": 5.290581776919067e-05, "loss": 0.6149, "mean_token_accuracy": 0.812189344316721, "num_tokens": 490135407.0, "step": 15357 }, { "entropy": 0.6315686041489244, "epoch": 1.4130166013996468, "grad_norm": 0.15835842490196228, "learning_rate": 5.290275094304904e-05, "loss": 0.6199, "mean_token_accuracy": 0.8122154213488102, "num_tokens": 490167441.0, "step": 15358 }, { "entropy": 0.6289777681231499, "epoch": 1.4131086077710882, "grad_norm": 0.15899847447872162, "learning_rate": 5.2899684116907413e-05, "loss": 0.6118, "mean_token_accuracy": 0.8113442994654179, "num_tokens": 490198625.0, "step": 15359 }, { "entropy": 0.7057408522814512, "epoch": 1.4132006141425293, "grad_norm": 0.16440710425376892, "learning_rate": 5.2896617290765795e-05, "loss": 0.707, "mean_token_accuracy": 0.7894854694604874, "num_tokens": 490231110.0, "step": 15360 }, { "entropy": 0.5788752799853683, "epoch": 1.4132926205139706, "grad_norm": 0.16423757374286652, "learning_rate": 5.289355046462416e-05, "loss": 0.5631, "mean_token_accuracy": 0.8263331390917301, "num_tokens": 490262421.0, "step": 15361 }, { "entropy": 0.6621713563799858, "epoch": 1.4133846268854118, "grad_norm": 0.15367774665355682, "learning_rate": 5.289048363848254e-05, "loss": 0.6439, "mean_token_accuracy": 0.8016893267631531, "num_tokens": 490294798.0, "step": 15362 }, { "entropy": 0.6316179595887661, "epoch": 1.413476633256853, "grad_norm": 0.15551622211933136, "learning_rate": 5.2887416812340905e-05, "loss": 0.6268, "mean_token_accuracy": 0.8114778324961662, "num_tokens": 490327034.0, "step": 15363 }, { "entropy": 0.5332371620461345, "epoch": 1.4135686396282943, "grad_norm": 0.15245792269706726, "learning_rate": 5.288434998619929e-05, "loss": 0.5185, "mean_token_accuracy": 0.8360911644995213, "num_tokens": 490358983.0, "step": 15364 }, { "entropy": 0.5637179538607597, "epoch": 1.4136606459997354, "grad_norm": 0.15103159844875336, "learning_rate": 5.288128316005766e-05, "loss": 0.5512, "mean_token_accuracy": 0.8279215209186077, "num_tokens": 490391127.0, "step": 15365 }, { "entropy": 0.5855046808719635, "epoch": 1.4137526523711768, "grad_norm": 0.1514948159456253, "learning_rate": 5.287821633391603e-05, "loss": 0.5695, "mean_token_accuracy": 0.8239837363362312, "num_tokens": 490422910.0, "step": 15366 }, { "entropy": 0.6207795944064856, "epoch": 1.4138446587426179, "grad_norm": 0.1634671837091446, "learning_rate": 5.2875149507774404e-05, "loss": 0.599, "mean_token_accuracy": 0.8158352002501488, "num_tokens": 490454317.0, "step": 15367 }, { "entropy": 0.5639979559928179, "epoch": 1.413936665114059, "grad_norm": 0.15518425405025482, "learning_rate": 5.2872082681632785e-05, "loss": 0.5598, "mean_token_accuracy": 0.8295666947960854, "num_tokens": 490486579.0, "step": 15368 }, { "entropy": 0.6093049459159374, "epoch": 1.4140286714855004, "grad_norm": 0.16170631349086761, "learning_rate": 5.286901585549115e-05, "loss": 0.6078, "mean_token_accuracy": 0.8123147077858448, "num_tokens": 490518258.0, "step": 15369 }, { "entropy": 0.6983311893418431, "epoch": 1.4141206778569415, "grad_norm": 0.1724918782711029, "learning_rate": 5.286594902934953e-05, "loss": 0.7119, "mean_token_accuracy": 0.7860892228782177, "num_tokens": 490550959.0, "step": 15370 }, { "entropy": 0.6538557857275009, "epoch": 1.4142126842283829, "grad_norm": 0.16840046644210815, "learning_rate": 5.2862882203207896e-05, "loss": 0.6411, "mean_token_accuracy": 0.8009047582745552, "num_tokens": 490583362.0, "step": 15371 }, { "entropy": 0.6034431159496307, "epoch": 1.414304690599824, "grad_norm": 0.15946784615516663, "learning_rate": 5.285981537706628e-05, "loss": 0.5933, "mean_token_accuracy": 0.8178427517414093, "num_tokens": 490615381.0, "step": 15372 }, { "entropy": 0.6762716826051474, "epoch": 1.4143966969712651, "grad_norm": 0.1726544052362442, "learning_rate": 5.285674855092465e-05, "loss": 0.6769, "mean_token_accuracy": 0.7942431345582008, "num_tokens": 490647707.0, "step": 15373 }, { "entropy": 0.6479336377233267, "epoch": 1.4144887033427065, "grad_norm": 0.15547235310077667, "learning_rate": 5.285368172478302e-05, "loss": 0.635, "mean_token_accuracy": 0.806144967675209, "num_tokens": 490679215.0, "step": 15374 }, { "entropy": 0.7301639914512634, "epoch": 1.4145807097141476, "grad_norm": 0.1626797765493393, "learning_rate": 5.28506148986414e-05, "loss": 0.7315, "mean_token_accuracy": 0.7793500758707523, "num_tokens": 490710885.0, "step": 15375 }, { "entropy": 0.6598696717992425, "epoch": 1.414672716085589, "grad_norm": 0.163276806473732, "learning_rate": 5.2847548072499776e-05, "loss": 0.6446, "mean_token_accuracy": 0.8047741614282131, "num_tokens": 490742475.0, "step": 15376 }, { "entropy": 0.5603220975026488, "epoch": 1.41476472245703, "grad_norm": 0.1453525573015213, "learning_rate": 5.2844481246358144e-05, "loss": 0.5473, "mean_token_accuracy": 0.8293982371687889, "num_tokens": 490775101.0, "step": 15377 }, { "entropy": 0.684409886598587, "epoch": 1.4148567288284712, "grad_norm": 0.1616021990776062, "learning_rate": 5.284141442021652e-05, "loss": 0.6649, "mean_token_accuracy": 0.7976300977170467, "num_tokens": 490806865.0, "step": 15378 }, { "entropy": 0.5752520803362131, "epoch": 1.4149487351999126, "grad_norm": 0.15168112516403198, "learning_rate": 5.28383475940749e-05, "loss": 0.5635, "mean_token_accuracy": 0.8273430056869984, "num_tokens": 490839165.0, "step": 15379 }, { "entropy": 0.5964994048699737, "epoch": 1.415040741571354, "grad_norm": 0.14845909178256989, "learning_rate": 5.283528076793327e-05, "loss": 0.5742, "mean_token_accuracy": 0.8203756399452686, "num_tokens": 490871052.0, "step": 15380 }, { "entropy": 0.6235447432845831, "epoch": 1.415132747942795, "grad_norm": 0.15624257922172546, "learning_rate": 5.283221394179164e-05, "loss": 0.6035, "mean_token_accuracy": 0.8134434334933758, "num_tokens": 490903250.0, "step": 15381 }, { "entropy": 0.6272587943822145, "epoch": 1.4152247543142362, "grad_norm": 0.1604537069797516, "learning_rate": 5.282914711565001e-05, "loss": 0.6167, "mean_token_accuracy": 0.8103026151657104, "num_tokens": 490935163.0, "step": 15382 }, { "entropy": 0.722938634455204, "epoch": 1.4153167606856774, "grad_norm": 0.1613156944513321, "learning_rate": 5.28260802895084e-05, "loss": 0.722, "mean_token_accuracy": 0.7838884368538857, "num_tokens": 490967366.0, "step": 15383 }, { "entropy": 0.6140503715723753, "epoch": 1.4154087670571187, "grad_norm": 0.1542789787054062, "learning_rate": 5.2823013463366766e-05, "loss": 0.6014, "mean_token_accuracy": 0.8156932629644871, "num_tokens": 490999594.0, "step": 15384 }, { "entropy": 0.60285066626966, "epoch": 1.41550077342856, "grad_norm": 0.16850167512893677, "learning_rate": 5.2819946637225134e-05, "loss": 0.6048, "mean_token_accuracy": 0.8166209198534489, "num_tokens": 491031630.0, "step": 15385 }, { "entropy": 0.6961261089891195, "epoch": 1.4155927798000012, "grad_norm": 0.15897786617279053, "learning_rate": 5.281687981108351e-05, "loss": 0.6935, "mean_token_accuracy": 0.7873920649290085, "num_tokens": 491063815.0, "step": 15386 }, { "entropy": 0.5035765590146184, "epoch": 1.4156847861714423, "grad_norm": 0.14493784308433533, "learning_rate": 5.281381298494189e-05, "loss": 0.4883, "mean_token_accuracy": 0.8499904498457909, "num_tokens": 491096232.0, "step": 15387 }, { "entropy": 0.6789825651794672, "epoch": 1.4157767925428835, "grad_norm": 0.1622830629348755, "learning_rate": 5.2810746158800265e-05, "loss": 0.6677, "mean_token_accuracy": 0.7941774874925613, "num_tokens": 491128243.0, "step": 15388 }, { "entropy": 0.5712355617433786, "epoch": 1.4158687989143248, "grad_norm": 0.14671632647514343, "learning_rate": 5.280767933265863e-05, "loss": 0.5654, "mean_token_accuracy": 0.8275863640010357, "num_tokens": 491160918.0, "step": 15389 }, { "entropy": 0.6189969349652529, "epoch": 1.4159608052857662, "grad_norm": 0.16060248017311096, "learning_rate": 5.280461250651701e-05, "loss": 0.6077, "mean_token_accuracy": 0.814625009894371, "num_tokens": 491193310.0, "step": 15390 }, { "entropy": 0.7265803776681423, "epoch": 1.4160528116572073, "grad_norm": 0.16709662973880768, "learning_rate": 5.280154568037539e-05, "loss": 0.7303, "mean_token_accuracy": 0.781378623098135, "num_tokens": 491225424.0, "step": 15391 }, { "entropy": 0.6109869107604027, "epoch": 1.4161448180286484, "grad_norm": 0.16356788575649261, "learning_rate": 5.2798478854233757e-05, "loss": 0.6041, "mean_token_accuracy": 0.8140734545886517, "num_tokens": 491257778.0, "step": 15392 }, { "entropy": 0.6439702664501965, "epoch": 1.4162368244000896, "grad_norm": 0.15353479981422424, "learning_rate": 5.279541202809213e-05, "loss": 0.6313, "mean_token_accuracy": 0.8101891092956066, "num_tokens": 491289698.0, "step": 15393 }, { "entropy": 0.7032667230814695, "epoch": 1.416328830771531, "grad_norm": 0.1656343787908554, "learning_rate": 5.27923452019505e-05, "loss": 0.6991, "mean_token_accuracy": 0.78865185379982, "num_tokens": 491321366.0, "step": 15394 }, { "entropy": 0.6220672614872456, "epoch": 1.4164208371429723, "grad_norm": 0.1612556129693985, "learning_rate": 5.278927837580888e-05, "loss": 0.6004, "mean_token_accuracy": 0.8189092837274075, "num_tokens": 491353623.0, "step": 15395 }, { "entropy": 0.6414111875928938, "epoch": 1.4165128435144134, "grad_norm": 0.15375208854675293, "learning_rate": 5.2786211549667255e-05, "loss": 0.6324, "mean_token_accuracy": 0.807960107922554, "num_tokens": 491386058.0, "step": 15396 }, { "entropy": 0.6554678222164512, "epoch": 1.4166048498858546, "grad_norm": 0.1594211906194687, "learning_rate": 5.278314472352562e-05, "loss": 0.6491, "mean_token_accuracy": 0.7984637916088104, "num_tokens": 491417511.0, "step": 15397 }, { "entropy": 0.5460104332305491, "epoch": 1.4166968562572957, "grad_norm": 0.15424196422100067, "learning_rate": 5.2780077897384e-05, "loss": 0.5312, "mean_token_accuracy": 0.8381285667419434, "num_tokens": 491449328.0, "step": 15398 }, { "entropy": 0.716932462528348, "epoch": 1.416788862628737, "grad_norm": 0.16827182471752167, "learning_rate": 5.277701107124238e-05, "loss": 0.7196, "mean_token_accuracy": 0.7831595465540886, "num_tokens": 491481105.0, "step": 15399 }, { "entropy": 0.6078282725065947, "epoch": 1.4168808690001784, "grad_norm": 0.1562427133321762, "learning_rate": 5.277394424510075e-05, "loss": 0.5983, "mean_token_accuracy": 0.8159366883337498, "num_tokens": 491513139.0, "step": 15400 }, { "entropy": 0.6720555913634598, "epoch": 1.4169728753716195, "grad_norm": 0.1541070193052292, "learning_rate": 5.277087741895912e-05, "loss": 0.6478, "mean_token_accuracy": 0.8057103753089905, "num_tokens": 491545618.0, "step": 15401 }, { "entropy": 0.5919599728658795, "epoch": 1.4170648817430607, "grad_norm": 0.15529850125312805, "learning_rate": 5.276781059281749e-05, "loss": 0.5892, "mean_token_accuracy": 0.8204655759036541, "num_tokens": 491578194.0, "step": 15402 }, { "entropy": 0.6191137852147222, "epoch": 1.4171568881145018, "grad_norm": 0.15694795548915863, "learning_rate": 5.276474376667587e-05, "loss": 0.6079, "mean_token_accuracy": 0.8148420415818691, "num_tokens": 491610647.0, "step": 15403 }, { "entropy": 0.5277523119002581, "epoch": 1.4172488944859432, "grad_norm": 0.1465207189321518, "learning_rate": 5.2761676940534246e-05, "loss": 0.5005, "mean_token_accuracy": 0.8476972430944443, "num_tokens": 491642191.0, "step": 15404 }, { "entropy": 0.5771569702774286, "epoch": 1.4173409008573845, "grad_norm": 0.1512133926153183, "learning_rate": 5.275861011439261e-05, "loss": 0.5574, "mean_token_accuracy": 0.8269226625561714, "num_tokens": 491674034.0, "step": 15405 }, { "entropy": 0.6940582152456045, "epoch": 1.4174329072288256, "grad_norm": 0.160121351480484, "learning_rate": 5.2755543288250995e-05, "loss": 0.6844, "mean_token_accuracy": 0.7883287891745567, "num_tokens": 491706167.0, "step": 15406 }, { "entropy": 0.5947671169415116, "epoch": 1.4175249136002668, "grad_norm": 0.15885616838932037, "learning_rate": 5.275247646210937e-05, "loss": 0.5927, "mean_token_accuracy": 0.8186366930603981, "num_tokens": 491738734.0, "step": 15407 }, { "entropy": 0.5641571991145611, "epoch": 1.417616919971708, "grad_norm": 0.15183289349079132, "learning_rate": 5.274940963596774e-05, "loss": 0.5537, "mean_token_accuracy": 0.831402450799942, "num_tokens": 491770259.0, "step": 15408 }, { "entropy": 0.5207720836624503, "epoch": 1.4177089263431493, "grad_norm": 0.14777326583862305, "learning_rate": 5.274634280982611e-05, "loss": 0.5135, "mean_token_accuracy": 0.8452372662723064, "num_tokens": 491802880.0, "step": 15409 }, { "entropy": 0.6689429124817252, "epoch": 1.4178009327145906, "grad_norm": 0.15641269087791443, "learning_rate": 5.2743275983684493e-05, "loss": 0.6472, "mean_token_accuracy": 0.8076067045331001, "num_tokens": 491834772.0, "step": 15410 }, { "entropy": 0.7459311205893755, "epoch": 1.4178929390860318, "grad_norm": 0.16639746725559235, "learning_rate": 5.274020915754286e-05, "loss": 0.7412, "mean_token_accuracy": 0.7801926322281361, "num_tokens": 491867167.0, "step": 15411 }, { "entropy": 0.6830470683053136, "epoch": 1.417984945457473, "grad_norm": 0.16392222046852112, "learning_rate": 5.2737142331401236e-05, "loss": 0.6797, "mean_token_accuracy": 0.7935988306999207, "num_tokens": 491899471.0, "step": 15412 }, { "entropy": 0.5613020358141512, "epoch": 1.418076951828914, "grad_norm": 0.15851061046123505, "learning_rate": 5.2734075505259604e-05, "loss": 0.5455, "mean_token_accuracy": 0.8315790072083473, "num_tokens": 491930721.0, "step": 15413 }, { "entropy": 0.5556157864630222, "epoch": 1.4181689582003554, "grad_norm": 0.15512055158615112, "learning_rate": 5.2731008679117985e-05, "loss": 0.5383, "mean_token_accuracy": 0.8317376039922237, "num_tokens": 491962554.0, "step": 15414 }, { "entropy": 0.7100781686604023, "epoch": 1.4182609645717967, "grad_norm": 0.16485324501991272, "learning_rate": 5.272794185297636e-05, "loss": 0.7013, "mean_token_accuracy": 0.7864921055734158, "num_tokens": 491994908.0, "step": 15415 }, { "entropy": 0.7297190260142088, "epoch": 1.4183529709432379, "grad_norm": 0.16101129353046417, "learning_rate": 5.272487502683473e-05, "loss": 0.7258, "mean_token_accuracy": 0.7794414423406124, "num_tokens": 492026684.0, "step": 15416 }, { "entropy": 0.6331856492906809, "epoch": 1.418444977314679, "grad_norm": 0.15615709125995636, "learning_rate": 5.27218082006931e-05, "loss": 0.62, "mean_token_accuracy": 0.8088640905916691, "num_tokens": 492059041.0, "step": 15417 }, { "entropy": 0.6601867210119963, "epoch": 1.4185369836861201, "grad_norm": 0.15802103281021118, "learning_rate": 5.2718741374551484e-05, "loss": 0.6551, "mean_token_accuracy": 0.7977999337017536, "num_tokens": 492091108.0, "step": 15418 }, { "entropy": 0.5997693911194801, "epoch": 1.4186289900575615, "grad_norm": 0.15536008775234222, "learning_rate": 5.271567454840985e-05, "loss": 0.5921, "mean_token_accuracy": 0.8171800039708614, "num_tokens": 492123096.0, "step": 15419 }, { "entropy": 0.5429612486623228, "epoch": 1.4187209964290028, "grad_norm": 0.14652982354164124, "learning_rate": 5.2712607722268226e-05, "loss": 0.5427, "mean_token_accuracy": 0.8323616795241833, "num_tokens": 492155786.0, "step": 15420 }, { "entropy": 0.6155583527870476, "epoch": 1.418813002800444, "grad_norm": 0.15846028923988342, "learning_rate": 5.2709540896126594e-05, "loss": 0.603, "mean_token_accuracy": 0.8177987486124039, "num_tokens": 492187830.0, "step": 15421 }, { "entropy": 0.5501620471477509, "epoch": 1.4189050091718851, "grad_norm": 0.1529226452112198, "learning_rate": 5.270647406998498e-05, "loss": 0.5388, "mean_token_accuracy": 0.8315199539065361, "num_tokens": 492219823.0, "step": 15422 }, { "entropy": 0.6288833515718579, "epoch": 1.4189970155433262, "grad_norm": 0.1588977873325348, "learning_rate": 5.270340724384335e-05, "loss": 0.622, "mean_token_accuracy": 0.807062666863203, "num_tokens": 492251797.0, "step": 15423 }, { "entropy": 0.5172520484775305, "epoch": 1.4190890219147676, "grad_norm": 0.15158918499946594, "learning_rate": 5.270034041770172e-05, "loss": 0.5139, "mean_token_accuracy": 0.8436535373330116, "num_tokens": 492283258.0, "step": 15424 }, { "entropy": 0.604634060524404, "epoch": 1.419181028286209, "grad_norm": 0.1536514014005661, "learning_rate": 5.269727359156009e-05, "loss": 0.5965, "mean_token_accuracy": 0.8180724121630192, "num_tokens": 492314711.0, "step": 15425 }, { "entropy": 0.6216080281883478, "epoch": 1.41927303465765, "grad_norm": 0.15262900292873383, "learning_rate": 5.2694206765418474e-05, "loss": 0.6152, "mean_token_accuracy": 0.8117267563939095, "num_tokens": 492346483.0, "step": 15426 }, { "entropy": 0.5105062294751406, "epoch": 1.4193650410290912, "grad_norm": 0.1462351679801941, "learning_rate": 5.269113993927685e-05, "loss": 0.5064, "mean_token_accuracy": 0.8482773266732693, "num_tokens": 492378036.0, "step": 15427 }, { "entropy": 0.8423711471259594, "epoch": 1.4194570474005324, "grad_norm": 0.173638716340065, "learning_rate": 5.268807311313522e-05, "loss": 0.8337, "mean_token_accuracy": 0.750945195555687, "num_tokens": 492409886.0, "step": 15428 }, { "entropy": 0.44831938948482275, "epoch": 1.4195490537719737, "grad_norm": 0.13945670425891876, "learning_rate": 5.2685006286993585e-05, "loss": 0.4276, "mean_token_accuracy": 0.866335067898035, "num_tokens": 492442043.0, "step": 15429 }, { "entropy": 0.48203158285468817, "epoch": 1.419641060143415, "grad_norm": 0.14383277297019958, "learning_rate": 5.268193946085197e-05, "loss": 0.4739, "mean_token_accuracy": 0.8563549183309078, "num_tokens": 492474282.0, "step": 15430 }, { "entropy": 0.6937399562448263, "epoch": 1.4197330665148562, "grad_norm": 0.15905322134494781, "learning_rate": 5.267887263471034e-05, "loss": 0.6948, "mean_token_accuracy": 0.7873479053378105, "num_tokens": 492506537.0, "step": 15431 }, { "entropy": 0.6339296102523804, "epoch": 1.4198250728862973, "grad_norm": 0.15568943321704865, "learning_rate": 5.2675805808568715e-05, "loss": 0.6294, "mean_token_accuracy": 0.8074956946074963, "num_tokens": 492538276.0, "step": 15432 }, { "entropy": 0.5832704873755574, "epoch": 1.4199170792577385, "grad_norm": 0.15406584739685059, "learning_rate": 5.267273898242708e-05, "loss": 0.5553, "mean_token_accuracy": 0.831025492399931, "num_tokens": 492570706.0, "step": 15433 }, { "entropy": 0.6195313949137926, "epoch": 1.4200090856291798, "grad_norm": 0.16686712205410004, "learning_rate": 5.2669672156285465e-05, "loss": 0.6199, "mean_token_accuracy": 0.8157282248139381, "num_tokens": 492602126.0, "step": 15434 }, { "entropy": 0.5266499072313309, "epoch": 1.4201010920006212, "grad_norm": 0.14821334183216095, "learning_rate": 5.266660533014384e-05, "loss": 0.513, "mean_token_accuracy": 0.8402007892727852, "num_tokens": 492634705.0, "step": 15435 }, { "entropy": 0.6044804267585278, "epoch": 1.4201930983720623, "grad_norm": 0.15374092757701874, "learning_rate": 5.266353850400221e-05, "loss": 0.5934, "mean_token_accuracy": 0.8177616931498051, "num_tokens": 492667186.0, "step": 15436 }, { "entropy": 0.6372524909675121, "epoch": 1.4202851047435034, "grad_norm": 0.16174006462097168, "learning_rate": 5.266047167786059e-05, "loss": 0.6313, "mean_token_accuracy": 0.8112174309790134, "num_tokens": 492699011.0, "step": 15437 }, { "entropy": 0.7507132096216083, "epoch": 1.4203771111149446, "grad_norm": 0.16751840710639954, "learning_rate": 5.265740485171896e-05, "loss": 0.7557, "mean_token_accuracy": 0.7739903628826141, "num_tokens": 492731199.0, "step": 15438 }, { "entropy": 0.4653239520266652, "epoch": 1.420469117486386, "grad_norm": 0.13886545598506927, "learning_rate": 5.265433802557733e-05, "loss": 0.4488, "mean_token_accuracy": 0.8616646640002728, "num_tokens": 492763453.0, "step": 15439 }, { "entropy": 0.6506461333483458, "epoch": 1.4205611238578273, "grad_norm": 0.15779469907283783, "learning_rate": 5.2651271199435706e-05, "loss": 0.6356, "mean_token_accuracy": 0.8029118068516254, "num_tokens": 492795025.0, "step": 15440 }, { "entropy": 0.5680940989404917, "epoch": 1.4206531302292684, "grad_norm": 0.16170217096805573, "learning_rate": 5.264820437329409e-05, "loss": 0.557, "mean_token_accuracy": 0.8301823362708092, "num_tokens": 492826550.0, "step": 15441 }, { "entropy": 0.6944792978465557, "epoch": 1.4207451366007096, "grad_norm": 0.1711236536502838, "learning_rate": 5.2645137547152455e-05, "loss": 0.6833, "mean_token_accuracy": 0.7927571907639503, "num_tokens": 492858698.0, "step": 15442 }, { "entropy": 0.61983472853899, "epoch": 1.4208371429721507, "grad_norm": 0.15814639627933502, "learning_rate": 5.264207072101083e-05, "loss": 0.6051, "mean_token_accuracy": 0.8179514966905117, "num_tokens": 492890451.0, "step": 15443 }, { "entropy": 0.4787241346202791, "epoch": 1.420929149343592, "grad_norm": 0.14858637750148773, "learning_rate": 5.26390038948692e-05, "loss": 0.4688, "mean_token_accuracy": 0.8563638180494308, "num_tokens": 492921385.0, "step": 15444 }, { "entropy": 0.694378150627017, "epoch": 1.4210211557150334, "grad_norm": 0.16060350835323334, "learning_rate": 5.263593706872758e-05, "loss": 0.6698, "mean_token_accuracy": 0.7903412878513336, "num_tokens": 492953096.0, "step": 15445 }, { "entropy": 0.698095646686852, "epoch": 1.4211131620864745, "grad_norm": 0.1597421020269394, "learning_rate": 5.2632870242585954e-05, "loss": 0.6649, "mean_token_accuracy": 0.7956738285720348, "num_tokens": 492984125.0, "step": 15446 }, { "entropy": 0.6081800907850266, "epoch": 1.4212051684579157, "grad_norm": 0.16011328995227814, "learning_rate": 5.262980341644432e-05, "loss": 0.5955, "mean_token_accuracy": 0.8165701813995838, "num_tokens": 493015451.0, "step": 15447 }, { "entropy": 0.649647668004036, "epoch": 1.4212971748293568, "grad_norm": 0.16127711534500122, "learning_rate": 5.2626736590302696e-05, "loss": 0.6314, "mean_token_accuracy": 0.8074377626180649, "num_tokens": 493047130.0, "step": 15448 }, { "entropy": 0.5577567317523062, "epoch": 1.4213891812007982, "grad_norm": 0.1492285132408142, "learning_rate": 5.262366976416108e-05, "loss": 0.5246, "mean_token_accuracy": 0.8392284996807575, "num_tokens": 493079112.0, "step": 15449 }, { "entropy": 0.648871548473835, "epoch": 1.4214811875722395, "grad_norm": 0.1591200977563858, "learning_rate": 5.2620602938019445e-05, "loss": 0.6403, "mean_token_accuracy": 0.8053562678396702, "num_tokens": 493111527.0, "step": 15450 }, { "entropy": 0.600224070250988, "epoch": 1.4215731939436806, "grad_norm": 0.1590854823589325, "learning_rate": 5.261753611187782e-05, "loss": 0.5983, "mean_token_accuracy": 0.8155535086989403, "num_tokens": 493143138.0, "step": 15451 }, { "entropy": 0.5958604114130139, "epoch": 1.4216652003151218, "grad_norm": 0.1521848440170288, "learning_rate": 5.261446928573619e-05, "loss": 0.5845, "mean_token_accuracy": 0.823216125369072, "num_tokens": 493175399.0, "step": 15452 }, { "entropy": 0.6854305155575275, "epoch": 1.421757206686563, "grad_norm": 0.16008244454860687, "learning_rate": 5.261140245959457e-05, "loss": 0.6896, "mean_token_accuracy": 0.789950292557478, "num_tokens": 493207069.0, "step": 15453 }, { "entropy": 0.5411847243085504, "epoch": 1.4218492130580043, "grad_norm": 0.14960095286369324, "learning_rate": 5.2608335633452944e-05, "loss": 0.5184, "mean_token_accuracy": 0.8387462384998798, "num_tokens": 493239086.0, "step": 15454 }, { "entropy": 0.5305888322182, "epoch": 1.4219412194294456, "grad_norm": 0.15202143788337708, "learning_rate": 5.260526880731131e-05, "loss": 0.5235, "mean_token_accuracy": 0.8426261954009533, "num_tokens": 493271437.0, "step": 15455 }, { "entropy": 0.5631477413699031, "epoch": 1.4220332258008868, "grad_norm": 0.1438053995370865, "learning_rate": 5.2602201981169687e-05, "loss": 0.5522, "mean_token_accuracy": 0.8324790149927139, "num_tokens": 493303973.0, "step": 15456 }, { "entropy": 0.5424318914301693, "epoch": 1.422125232172328, "grad_norm": 0.14758062362670898, "learning_rate": 5.259913515502807e-05, "loss": 0.5312, "mean_token_accuracy": 0.835383839905262, "num_tokens": 493335806.0, "step": 15457 }, { "entropy": 0.549853203818202, "epoch": 1.422217238543769, "grad_norm": 0.16142234206199646, "learning_rate": 5.2596068328886436e-05, "loss": 0.5444, "mean_token_accuracy": 0.8325000815093517, "num_tokens": 493368097.0, "step": 15458 }, { "entropy": 0.649102620780468, "epoch": 1.4223092449152104, "grad_norm": 0.15795624256134033, "learning_rate": 5.259300150274481e-05, "loss": 0.6343, "mean_token_accuracy": 0.8025830686092377, "num_tokens": 493400149.0, "step": 15459 }, { "entropy": 0.5596595872193575, "epoch": 1.4224012512866517, "grad_norm": 0.1513034999370575, "learning_rate": 5.258993467660318e-05, "loss": 0.5556, "mean_token_accuracy": 0.8309655822813511, "num_tokens": 493432720.0, "step": 15460 }, { "entropy": 0.6172481961548328, "epoch": 1.4224932576580929, "grad_norm": 0.16099978983402252, "learning_rate": 5.258686785046156e-05, "loss": 0.618, "mean_token_accuracy": 0.8095487616956234, "num_tokens": 493464568.0, "step": 15461 }, { "entropy": 0.6748708002269268, "epoch": 1.422585264029534, "grad_norm": 0.16911453008651733, "learning_rate": 5.2583801024319934e-05, "loss": 0.6641, "mean_token_accuracy": 0.7988059557974339, "num_tokens": 493495925.0, "step": 15462 }, { "entropy": 0.519480163231492, "epoch": 1.4226772704009751, "grad_norm": 0.15022024512290955, "learning_rate": 5.25807341981783e-05, "loss": 0.5023, "mean_token_accuracy": 0.8479218445718288, "num_tokens": 493528378.0, "step": 15463 }, { "entropy": 0.6237487983889878, "epoch": 1.4227692767724165, "grad_norm": 0.15082550048828125, "learning_rate": 5.257766737203668e-05, "loss": 0.6116, "mean_token_accuracy": 0.815644171088934, "num_tokens": 493560561.0, "step": 15464 }, { "entropy": 0.46898384392261505, "epoch": 1.4228612831438578, "grad_norm": 0.15188191831111908, "learning_rate": 5.257460054589506e-05, "loss": 0.4466, "mean_token_accuracy": 0.8573509752750397, "num_tokens": 493592197.0, "step": 15465 }, { "entropy": 0.713208713568747, "epoch": 1.422953289515299, "grad_norm": 0.1638454794883728, "learning_rate": 5.257153371975343e-05, "loss": 0.7064, "mean_token_accuracy": 0.7851984575390816, "num_tokens": 493624504.0, "step": 15466 }, { "entropy": 0.697346618399024, "epoch": 1.4230452958867401, "grad_norm": 0.16331255435943604, "learning_rate": 5.25684668936118e-05, "loss": 0.6924, "mean_token_accuracy": 0.7891150116920471, "num_tokens": 493656425.0, "step": 15467 }, { "entropy": 0.5275817755609751, "epoch": 1.4231373022581812, "grad_norm": 0.15567328035831451, "learning_rate": 5.256540006747018e-05, "loss": 0.5153, "mean_token_accuracy": 0.8426481895148754, "num_tokens": 493688059.0, "step": 15468 }, { "entropy": 0.5762913944199681, "epoch": 1.4232293086296226, "grad_norm": 0.15855233371257782, "learning_rate": 5.256233324132856e-05, "loss": 0.575, "mean_token_accuracy": 0.82537791877985, "num_tokens": 493719275.0, "step": 15469 }, { "entropy": 0.6176075870171189, "epoch": 1.423321315001064, "grad_norm": 0.15397588908672333, "learning_rate": 5.2559266415186925e-05, "loss": 0.6013, "mean_token_accuracy": 0.8122598119080067, "num_tokens": 493751660.0, "step": 15470 }, { "entropy": 0.4784331116825342, "epoch": 1.423413321372505, "grad_norm": 0.13852235674858093, "learning_rate": 5.25561995890453e-05, "loss": 0.459, "mean_token_accuracy": 0.856749452650547, "num_tokens": 493783984.0, "step": 15471 }, { "entropy": 0.6424979362636805, "epoch": 1.4235053277439462, "grad_norm": 0.152029350399971, "learning_rate": 5.255313276290368e-05, "loss": 0.6317, "mean_token_accuracy": 0.8069554455578327, "num_tokens": 493816161.0, "step": 15472 }, { "entropy": 0.6716794921085238, "epoch": 1.4235973341153874, "grad_norm": 0.16343562304973602, "learning_rate": 5.255006593676205e-05, "loss": 0.6525, "mean_token_accuracy": 0.8028629831969738, "num_tokens": 493848545.0, "step": 15473 }, { "entropy": 0.6697252318263054, "epoch": 1.4236893404868287, "grad_norm": 0.15321142971515656, "learning_rate": 5.2546999110620423e-05, "loss": 0.6637, "mean_token_accuracy": 0.7984671071171761, "num_tokens": 493880626.0, "step": 15474 }, { "entropy": 0.6147329467348754, "epoch": 1.42378134685827, "grad_norm": 0.1592283993959427, "learning_rate": 5.254393228447879e-05, "loss": 0.601, "mean_token_accuracy": 0.8148143626749516, "num_tokens": 493911647.0, "step": 15475 }, { "entropy": 0.5569762038066983, "epoch": 1.4238733532297112, "grad_norm": 0.1488126814365387, "learning_rate": 5.254086545833717e-05, "loss": 0.5484, "mean_token_accuracy": 0.8332904540002346, "num_tokens": 493943376.0, "step": 15476 }, { "entropy": 0.5717708887532353, "epoch": 1.4239653596011523, "grad_norm": 0.15403100848197937, "learning_rate": 5.253779863219555e-05, "loss": 0.5622, "mean_token_accuracy": 0.8280018717050552, "num_tokens": 493974029.0, "step": 15477 }, { "entropy": 0.6091271918267012, "epoch": 1.4240573659725935, "grad_norm": 0.15442760288715363, "learning_rate": 5.2534731806053915e-05, "loss": 0.6188, "mean_token_accuracy": 0.814203355461359, "num_tokens": 494006326.0, "step": 15478 }, { "entropy": 0.6360110584646463, "epoch": 1.4241493723440348, "grad_norm": 0.16406896710395813, "learning_rate": 5.253166497991229e-05, "loss": 0.6362, "mean_token_accuracy": 0.810696117579937, "num_tokens": 494038168.0, "step": 15479 }, { "entropy": 0.5672980449162424, "epoch": 1.4242413787154762, "grad_norm": 0.15549945831298828, "learning_rate": 5.252859815377067e-05, "loss": 0.5714, "mean_token_accuracy": 0.8292445354163647, "num_tokens": 494070215.0, "step": 15480 }, { "entropy": 0.6170927453786135, "epoch": 1.4243333850869173, "grad_norm": 0.1608782708644867, "learning_rate": 5.252553132762904e-05, "loss": 0.6275, "mean_token_accuracy": 0.8079848699271679, "num_tokens": 494102202.0, "step": 15481 }, { "entropy": 0.573135506361723, "epoch": 1.4244253914583584, "grad_norm": 0.16623716056346893, "learning_rate": 5.2522464501487414e-05, "loss": 0.5692, "mean_token_accuracy": 0.8254134654998779, "num_tokens": 494133210.0, "step": 15482 }, { "entropy": 0.6557944156229496, "epoch": 1.4245173978297996, "grad_norm": 0.15875041484832764, "learning_rate": 5.251939767534578e-05, "loss": 0.6493, "mean_token_accuracy": 0.8003769814968109, "num_tokens": 494165759.0, "step": 15483 }, { "entropy": 0.6276382557116449, "epoch": 1.424609404201241, "grad_norm": 0.15901285409927368, "learning_rate": 5.251633084920416e-05, "loss": 0.6153, "mean_token_accuracy": 0.8093756884336472, "num_tokens": 494197560.0, "step": 15484 }, { "entropy": 0.7169501446187496, "epoch": 1.4247014105726823, "grad_norm": 0.16499772667884827, "learning_rate": 5.251326402306254e-05, "loss": 0.7031, "mean_token_accuracy": 0.7863481752574444, "num_tokens": 494229337.0, "step": 15485 }, { "entropy": 0.6216110987588763, "epoch": 1.4247934169441234, "grad_norm": 0.16021858155727386, "learning_rate": 5.2510197196920906e-05, "loss": 0.6107, "mean_token_accuracy": 0.8133955337107182, "num_tokens": 494261613.0, "step": 15486 }, { "entropy": 0.5284197516739368, "epoch": 1.4248854233155646, "grad_norm": 0.1530025452375412, "learning_rate": 5.250713037077928e-05, "loss": 0.51, "mean_token_accuracy": 0.8415730632841587, "num_tokens": 494293937.0, "step": 15487 }, { "entropy": 0.5499851498752832, "epoch": 1.4249774296870057, "grad_norm": 0.14426003396511078, "learning_rate": 5.250406354463766e-05, "loss": 0.526, "mean_token_accuracy": 0.8377081081271172, "num_tokens": 494326019.0, "step": 15488 }, { "entropy": 0.6070480644702911, "epoch": 1.425069436058447, "grad_norm": 0.15790696442127228, "learning_rate": 5.250099671849603e-05, "loss": 0.6022, "mean_token_accuracy": 0.8204613141715527, "num_tokens": 494358250.0, "step": 15489 }, { "entropy": 0.5584985613822937, "epoch": 1.4251614424298884, "grad_norm": 0.1526651233434677, "learning_rate": 5.2497929892354404e-05, "loss": 0.5448, "mean_token_accuracy": 0.8318184167146683, "num_tokens": 494390531.0, "step": 15490 }, { "entropy": 0.7372242789715528, "epoch": 1.4252534488013295, "grad_norm": 0.1687421053647995, "learning_rate": 5.249486306621277e-05, "loss": 0.724, "mean_token_accuracy": 0.7825111858546734, "num_tokens": 494421472.0, "step": 15491 }, { "entropy": 0.6616543922573328, "epoch": 1.4253454551727707, "grad_norm": 0.15571968257427216, "learning_rate": 5.2491796240071154e-05, "loss": 0.6458, "mean_token_accuracy": 0.8004332557320595, "num_tokens": 494453346.0, "step": 15492 }, { "entropy": 0.6287122913636267, "epoch": 1.4254374615442118, "grad_norm": 0.15762270987033844, "learning_rate": 5.248872941392953e-05, "loss": 0.6091, "mean_token_accuracy": 0.8152336403727531, "num_tokens": 494486042.0, "step": 15493 }, { "entropy": 0.5919103398919106, "epoch": 1.4255294679156532, "grad_norm": 0.16516706347465515, "learning_rate": 5.2485662587787896e-05, "loss": 0.586, "mean_token_accuracy": 0.819897998124361, "num_tokens": 494517609.0, "step": 15494 }, { "entropy": 0.6638571973890066, "epoch": 1.4256214742870945, "grad_norm": 0.15782806277275085, "learning_rate": 5.248259576164627e-05, "loss": 0.6659, "mean_token_accuracy": 0.7983730621635914, "num_tokens": 494549792.0, "step": 15495 }, { "entropy": 0.6964529231190681, "epoch": 1.4257134806585356, "grad_norm": 0.16344279050827026, "learning_rate": 5.247952893550465e-05, "loss": 0.6949, "mean_token_accuracy": 0.7888756692409515, "num_tokens": 494582400.0, "step": 15496 }, { "entropy": 0.5617287373170257, "epoch": 1.4258054870299768, "grad_norm": 0.15550006926059723, "learning_rate": 5.247646210936302e-05, "loss": 0.5596, "mean_token_accuracy": 0.8271918185055256, "num_tokens": 494614586.0, "step": 15497 }, { "entropy": 0.5905014872550964, "epoch": 1.425897493401418, "grad_norm": 0.1555827558040619, "learning_rate": 5.2473395283221395e-05, "loss": 0.5727, "mean_token_accuracy": 0.8205106295645237, "num_tokens": 494645689.0, "step": 15498 }, { "entropy": 0.6069281222298741, "epoch": 1.4259894997728593, "grad_norm": 0.15804670751094818, "learning_rate": 5.2470328457079776e-05, "loss": 0.5894, "mean_token_accuracy": 0.8178148791193962, "num_tokens": 494677490.0, "step": 15499 }, { "entropy": 0.5971739124506712, "epoch": 1.4260815061443006, "grad_norm": 0.15573245286941528, "learning_rate": 5.2467261630938144e-05, "loss": 0.5913, "mean_token_accuracy": 0.8226595297455788, "num_tokens": 494708911.0, "step": 15500 }, { "entropy": 0.6146353492513299, "epoch": 1.4261735125157418, "grad_norm": 0.15323524177074432, "learning_rate": 5.246419480479652e-05, "loss": 0.595, "mean_token_accuracy": 0.8151458539068699, "num_tokens": 494740850.0, "step": 15501 }, { "entropy": 0.8214519312605262, "epoch": 1.426265518887183, "grad_norm": 0.167527437210083, "learning_rate": 5.2461127978654886e-05, "loss": 0.8156, "mean_token_accuracy": 0.7581864222884178, "num_tokens": 494772657.0, "step": 15502 }, { "entropy": 0.47018243838101625, "epoch": 1.426357525258624, "grad_norm": 0.14443692564964294, "learning_rate": 5.2458061152513275e-05, "loss": 0.4518, "mean_token_accuracy": 0.8613918125629425, "num_tokens": 494805139.0, "step": 15503 }, { "entropy": 0.5635250881314278, "epoch": 1.4264495316300654, "grad_norm": 0.14645032584667206, "learning_rate": 5.245499432637164e-05, "loss": 0.544, "mean_token_accuracy": 0.8347110599279404, "num_tokens": 494837444.0, "step": 15504 }, { "entropy": 0.6015375219285488, "epoch": 1.4265415380015067, "grad_norm": 0.1529208868741989, "learning_rate": 5.245192750023001e-05, "loss": 0.5838, "mean_token_accuracy": 0.8183358758687973, "num_tokens": 494869442.0, "step": 15505 }, { "entropy": 0.5208538942970335, "epoch": 1.4266335443729479, "grad_norm": 0.14207255840301514, "learning_rate": 5.2448860674088385e-05, "loss": 0.5018, "mean_token_accuracy": 0.8440082855522633, "num_tokens": 494901462.0, "step": 15506 }, { "entropy": 0.5146657004952431, "epoch": 1.426725550744389, "grad_norm": 0.14714764058589935, "learning_rate": 5.2445793847946766e-05, "loss": 0.488, "mean_token_accuracy": 0.851256463676691, "num_tokens": 494933776.0, "step": 15507 }, { "entropy": 0.6827997267246246, "epoch": 1.4268175571158301, "grad_norm": 0.16255541145801544, "learning_rate": 5.244272702180514e-05, "loss": 0.6754, "mean_token_accuracy": 0.7970612086355686, "num_tokens": 494965862.0, "step": 15508 }, { "entropy": 0.598397970199585, "epoch": 1.4269095634872715, "grad_norm": 0.16387929022312164, "learning_rate": 5.243966019566351e-05, "loss": 0.577, "mean_token_accuracy": 0.8228239975869656, "num_tokens": 494997769.0, "step": 15509 }, { "entropy": 0.7195404376834631, "epoch": 1.4270015698587128, "grad_norm": 0.16005578637123108, "learning_rate": 5.2436593369521884e-05, "loss": 0.6997, "mean_token_accuracy": 0.7870693579316139, "num_tokens": 495029547.0, "step": 15510 }, { "entropy": 0.6684610284864902, "epoch": 1.427093576230154, "grad_norm": 0.16052021086215973, "learning_rate": 5.2433526543380265e-05, "loss": 0.669, "mean_token_accuracy": 0.7977222613990307, "num_tokens": 495062030.0, "step": 15511 }, { "entropy": 0.6265624207444489, "epoch": 1.4271855826015951, "grad_norm": 0.15128636360168457, "learning_rate": 5.243045971723863e-05, "loss": 0.6157, "mean_token_accuracy": 0.8093544580042362, "num_tokens": 495094569.0, "step": 15512 }, { "entropy": 0.6803357200697064, "epoch": 1.4272775889730362, "grad_norm": 0.1681784987449646, "learning_rate": 5.242739289109701e-05, "loss": 0.6625, "mean_token_accuracy": 0.7963150255382061, "num_tokens": 495126089.0, "step": 15513 }, { "entropy": 0.6701808422803879, "epoch": 1.4273695953444776, "grad_norm": 0.16046062111854553, "learning_rate": 5.2424326064955375e-05, "loss": 0.6603, "mean_token_accuracy": 0.799200814217329, "num_tokens": 495158219.0, "step": 15514 }, { "entropy": 0.6680217757821083, "epoch": 1.427461601715919, "grad_norm": 0.16348989307880402, "learning_rate": 5.242125923881376e-05, "loss": 0.6801, "mean_token_accuracy": 0.7964480519294739, "num_tokens": 495189907.0, "step": 15515 }, { "entropy": 0.6623592469841242, "epoch": 1.42755360808736, "grad_norm": 0.16864866018295288, "learning_rate": 5.241819241267213e-05, "loss": 0.6537, "mean_token_accuracy": 0.7979048527777195, "num_tokens": 495221784.0, "step": 15516 }, { "entropy": 0.8263909835368395, "epoch": 1.4276456144588012, "grad_norm": 0.1701730191707611, "learning_rate": 5.24151255865305e-05, "loss": 0.8148, "mean_token_accuracy": 0.7535849697887897, "num_tokens": 495253623.0, "step": 15517 }, { "entropy": 0.585370269138366, "epoch": 1.4277376208302424, "grad_norm": 0.1546233743429184, "learning_rate": 5.2412058760388874e-05, "loss": 0.578, "mean_token_accuracy": 0.8252248540520668, "num_tokens": 495285622.0, "step": 15518 }, { "entropy": 0.5743485558778048, "epoch": 1.4278296272016837, "grad_norm": 0.15352453291416168, "learning_rate": 5.2408991934247255e-05, "loss": 0.5521, "mean_token_accuracy": 0.823016207665205, "num_tokens": 495316944.0, "step": 15519 }, { "entropy": 0.6220565922558308, "epoch": 1.427921633573125, "grad_norm": 0.16064772009849548, "learning_rate": 5.240592510810562e-05, "loss": 0.6009, "mean_token_accuracy": 0.8160230778157711, "num_tokens": 495348875.0, "step": 15520 }, { "entropy": 0.6096883825957775, "epoch": 1.4280136399445662, "grad_norm": 0.1637454479932785, "learning_rate": 5.2402858281964e-05, "loss": 0.6064, "mean_token_accuracy": 0.8164507336914539, "num_tokens": 495380341.0, "step": 15521 }, { "entropy": 0.6037893607281148, "epoch": 1.4281056463160073, "grad_norm": 0.1544988751411438, "learning_rate": 5.2399791455822366e-05, "loss": 0.5979, "mean_token_accuracy": 0.8171330280601978, "num_tokens": 495411570.0, "step": 15522 }, { "entropy": 0.7070438042283058, "epoch": 1.4281976526874485, "grad_norm": 0.16264590620994568, "learning_rate": 5.239672462968075e-05, "loss": 0.6947, "mean_token_accuracy": 0.7846408188343048, "num_tokens": 495442615.0, "step": 15523 }, { "entropy": 0.5019555301405489, "epoch": 1.4282896590588898, "grad_norm": 0.14463888108730316, "learning_rate": 5.239365780353912e-05, "loss": 0.4979, "mean_token_accuracy": 0.847332913428545, "num_tokens": 495475007.0, "step": 15524 }, { "entropy": 0.6825884971767664, "epoch": 1.4283816654303312, "grad_norm": 0.15230657160282135, "learning_rate": 5.239059097739749e-05, "loss": 0.6743, "mean_token_accuracy": 0.7962395064532757, "num_tokens": 495507540.0, "step": 15525 }, { "entropy": 0.606282171793282, "epoch": 1.4284736718017723, "grad_norm": 0.1571529656648636, "learning_rate": 5.2387524151255864e-05, "loss": 0.5873, "mean_token_accuracy": 0.8186900354921818, "num_tokens": 495539477.0, "step": 15526 }, { "entropy": 0.7039528526365757, "epoch": 1.4285656781732134, "grad_norm": 0.1623801440000534, "learning_rate": 5.2384457325114246e-05, "loss": 0.6939, "mean_token_accuracy": 0.7900258265435696, "num_tokens": 495571165.0, "step": 15527 }, { "entropy": 0.6743398569524288, "epoch": 1.4286576845446546, "grad_norm": 0.16377325356006622, "learning_rate": 5.2381390498972614e-05, "loss": 0.6663, "mean_token_accuracy": 0.7967530637979507, "num_tokens": 495602161.0, "step": 15528 }, { "entropy": 0.6770967356860638, "epoch": 1.428749690916096, "grad_norm": 0.15396133065223694, "learning_rate": 5.237832367283099e-05, "loss": 0.6575, "mean_token_accuracy": 0.8009378127753735, "num_tokens": 495634753.0, "step": 15529 }, { "entropy": 0.6261424925178289, "epoch": 1.4288416972875373, "grad_norm": 0.16255968809127808, "learning_rate": 5.237525684668937e-05, "loss": 0.6151, "mean_token_accuracy": 0.8099711462855339, "num_tokens": 495666262.0, "step": 15530 }, { "entropy": 0.6696912087500095, "epoch": 1.4289337036589784, "grad_norm": 0.1588861346244812, "learning_rate": 5.237219002054774e-05, "loss": 0.6779, "mean_token_accuracy": 0.7960153333842754, "num_tokens": 495698574.0, "step": 15531 }, { "entropy": 0.4911328498274088, "epoch": 1.4290257100304196, "grad_norm": 0.14802949130535126, "learning_rate": 5.236912319440611e-05, "loss": 0.485, "mean_token_accuracy": 0.8495148532092571, "num_tokens": 495730098.0, "step": 15532 }, { "entropy": 0.5986253754235804, "epoch": 1.4291177164018607, "grad_norm": 0.15341894328594208, "learning_rate": 5.236605636826448e-05, "loss": 0.5907, "mean_token_accuracy": 0.8162140734493732, "num_tokens": 495762532.0, "step": 15533 }, { "entropy": 0.5411570221185684, "epoch": 1.429209722773302, "grad_norm": 0.16025404632091522, "learning_rate": 5.236298954212286e-05, "loss": 0.5325, "mean_token_accuracy": 0.8350036665797234, "num_tokens": 495794148.0, "step": 15534 }, { "entropy": 0.6571971084922552, "epoch": 1.4293017291447434, "grad_norm": 0.15625780820846558, "learning_rate": 5.2359922715981236e-05, "loss": 0.6559, "mean_token_accuracy": 0.7992537841200829, "num_tokens": 495826528.0, "step": 15535 }, { "entropy": 0.600527934730053, "epoch": 1.4293937355161845, "grad_norm": 0.160993754863739, "learning_rate": 5.2356855889839604e-05, "loss": 0.591, "mean_token_accuracy": 0.8189083933830261, "num_tokens": 495858044.0, "step": 15536 }, { "entropy": 0.5849609514698386, "epoch": 1.4294857418876257, "grad_norm": 0.15181121230125427, "learning_rate": 5.235378906369798e-05, "loss": 0.573, "mean_token_accuracy": 0.8237663693726063, "num_tokens": 495890001.0, "step": 15537 }, { "entropy": 0.605909607373178, "epoch": 1.4295777482590668, "grad_norm": 0.15270961821079254, "learning_rate": 5.235072223755636e-05, "loss": 0.6066, "mean_token_accuracy": 0.8166850097477436, "num_tokens": 495922546.0, "step": 15538 }, { "entropy": 0.6771186171099544, "epoch": 1.4296697546305082, "grad_norm": 0.15986496210098267, "learning_rate": 5.234765541141473e-05, "loss": 0.6652, "mean_token_accuracy": 0.7939507327973843, "num_tokens": 495954577.0, "step": 15539 }, { "entropy": 0.6305023268796504, "epoch": 1.4297617610019495, "grad_norm": 0.15191328525543213, "learning_rate": 5.23445885852731e-05, "loss": 0.6127, "mean_token_accuracy": 0.8116863891482353, "num_tokens": 495986673.0, "step": 15540 }, { "entropy": 0.777996364980936, "epoch": 1.4298537673733906, "grad_norm": 0.16707053780555725, "learning_rate": 5.234152175913147e-05, "loss": 0.7827, "mean_token_accuracy": 0.7644574828445911, "num_tokens": 496019169.0, "step": 15541 }, { "entropy": 0.6923096179962158, "epoch": 1.4299457737448318, "grad_norm": 0.16088423132896423, "learning_rate": 5.233845493298986e-05, "loss": 0.6893, "mean_token_accuracy": 0.7936426214873791, "num_tokens": 496051658.0, "step": 15542 }, { "entropy": 0.7082524131983519, "epoch": 1.430037780116273, "grad_norm": 0.16984882950782776, "learning_rate": 5.233538810684823e-05, "loss": 0.714, "mean_token_accuracy": 0.784333098679781, "num_tokens": 496083425.0, "step": 15543 }, { "entropy": 0.5681199717801064, "epoch": 1.4301297864877143, "grad_norm": 0.14803798496723175, "learning_rate": 5.2332321280706595e-05, "loss": 0.5527, "mean_token_accuracy": 0.8322671949863434, "num_tokens": 496116044.0, "step": 15544 }, { "entropy": 0.5837467247620225, "epoch": 1.4302217928591556, "grad_norm": 0.15712998807430267, "learning_rate": 5.232925445456497e-05, "loss": 0.567, "mean_token_accuracy": 0.824740894138813, "num_tokens": 496147641.0, "step": 15545 }, { "entropy": 0.6727136354893446, "epoch": 1.4303137992305968, "grad_norm": 0.1571642905473709, "learning_rate": 5.232618762842335e-05, "loss": 0.647, "mean_token_accuracy": 0.8051378838717937, "num_tokens": 496180300.0, "step": 15546 }, { "entropy": 0.7248712573200464, "epoch": 1.430405805602038, "grad_norm": 0.16477234661579132, "learning_rate": 5.2323120802281725e-05, "loss": 0.705, "mean_token_accuracy": 0.78655606508255, "num_tokens": 496212143.0, "step": 15547 }, { "entropy": 0.6836782619357109, "epoch": 1.430497811973479, "grad_norm": 0.16371457278728485, "learning_rate": 5.232005397614009e-05, "loss": 0.6654, "mean_token_accuracy": 0.7942860312759876, "num_tokens": 496243457.0, "step": 15548 }, { "entropy": 0.48127134214155376, "epoch": 1.4305898183449204, "grad_norm": 0.15062293410301208, "learning_rate": 5.231698714999846e-05, "loss": 0.4629, "mean_token_accuracy": 0.855895396322012, "num_tokens": 496275789.0, "step": 15549 }, { "entropy": 0.5651678089052439, "epoch": 1.4306818247163617, "grad_norm": 0.15826795995235443, "learning_rate": 5.231392032385685e-05, "loss": 0.5599, "mean_token_accuracy": 0.8280559740960598, "num_tokens": 496306537.0, "step": 15550 }, { "entropy": 0.6159114374313504, "epoch": 1.4307738310878029, "grad_norm": 0.15783841907978058, "learning_rate": 5.231085349771522e-05, "loss": 0.6029, "mean_token_accuracy": 0.8151340819895267, "num_tokens": 496338416.0, "step": 15551 }, { "entropy": 0.5583408316597342, "epoch": 1.430865837459244, "grad_norm": 0.15825775265693665, "learning_rate": 5.230778667157359e-05, "loss": 0.5597, "mean_token_accuracy": 0.8290204852819443, "num_tokens": 496370374.0, "step": 15552 }, { "entropy": 0.6395311951637268, "epoch": 1.4309578438306851, "grad_norm": 0.16246768832206726, "learning_rate": 5.230471984543196e-05, "loss": 0.6323, "mean_token_accuracy": 0.8061164431273937, "num_tokens": 496401284.0, "step": 15553 }, { "entropy": 0.5832535242661834, "epoch": 1.4310498502021265, "grad_norm": 0.1504589468240738, "learning_rate": 5.230165301929034e-05, "loss": 0.5798, "mean_token_accuracy": 0.824747309088707, "num_tokens": 496433416.0, "step": 15554 }, { "entropy": 0.5659232120960951, "epoch": 1.4311418565735678, "grad_norm": 0.15203030407428741, "learning_rate": 5.2298586193148716e-05, "loss": 0.5603, "mean_token_accuracy": 0.826669916510582, "num_tokens": 496465003.0, "step": 15555 }, { "entropy": 0.5704447254538536, "epoch": 1.431233862945009, "grad_norm": 0.1532922387123108, "learning_rate": 5.2295519367007084e-05, "loss": 0.5575, "mean_token_accuracy": 0.8282331898808479, "num_tokens": 496496869.0, "step": 15556 }, { "entropy": 0.657305283471942, "epoch": 1.4313258693164501, "grad_norm": 0.16869838535785675, "learning_rate": 5.229245254086546e-05, "loss": 0.6411, "mean_token_accuracy": 0.8054153509438038, "num_tokens": 496528679.0, "step": 15557 }, { "entropy": 0.5186298228800297, "epoch": 1.4314178756878913, "grad_norm": 0.1503845751285553, "learning_rate": 5.228938571472384e-05, "loss": 0.5117, "mean_token_accuracy": 0.842134028673172, "num_tokens": 496561371.0, "step": 15558 }, { "entropy": 0.5710265669040382, "epoch": 1.4315098820593326, "grad_norm": 0.15567637979984283, "learning_rate": 5.228631888858221e-05, "loss": 0.5663, "mean_token_accuracy": 0.8263734579086304, "num_tokens": 496593247.0, "step": 15559 }, { "entropy": 0.6094832462258637, "epoch": 1.431601888430774, "grad_norm": 0.15532760322093964, "learning_rate": 5.228325206244058e-05, "loss": 0.5852, "mean_token_accuracy": 0.8163229003548622, "num_tokens": 496625140.0, "step": 15560 }, { "entropy": 0.6899444796144962, "epoch": 1.431693894802215, "grad_norm": 0.16899873316287994, "learning_rate": 5.2280185236298964e-05, "loss": 0.6788, "mean_token_accuracy": 0.7939147129654884, "num_tokens": 496657183.0, "step": 15561 }, { "entropy": 0.6562434025108814, "epoch": 1.4317859011736562, "grad_norm": 0.15254877507686615, "learning_rate": 5.227711841015733e-05, "loss": 0.6392, "mean_token_accuracy": 0.8035753108561039, "num_tokens": 496688940.0, "step": 15562 }, { "entropy": 0.7038390804082155, "epoch": 1.4318779075450974, "grad_norm": 0.16772902011871338, "learning_rate": 5.2274051584015706e-05, "loss": 0.6839, "mean_token_accuracy": 0.7914648205041885, "num_tokens": 496720573.0, "step": 15563 }, { "entropy": 0.5427443133667111, "epoch": 1.4319699139165387, "grad_norm": 0.14819267392158508, "learning_rate": 5.2270984757874074e-05, "loss": 0.5351, "mean_token_accuracy": 0.8383729234337807, "num_tokens": 496752802.0, "step": 15564 }, { "entropy": 0.652543980628252, "epoch": 1.43206192028798, "grad_norm": 0.15710948407649994, "learning_rate": 5.2267917931732455e-05, "loss": 0.6383, "mean_token_accuracy": 0.8050408996641636, "num_tokens": 496785438.0, "step": 15565 }, { "entropy": 0.676066592335701, "epoch": 1.4321539266594212, "grad_norm": 0.15932267904281616, "learning_rate": 5.226485110559083e-05, "loss": 0.6644, "mean_token_accuracy": 0.7945845127105713, "num_tokens": 496817667.0, "step": 15566 }, { "entropy": 0.7452034838497639, "epoch": 1.4322459330308623, "grad_norm": 0.16575980186462402, "learning_rate": 5.22617842794492e-05, "loss": 0.7339, "mean_token_accuracy": 0.7787391915917397, "num_tokens": 496849550.0, "step": 15567 }, { "entropy": 0.519769661128521, "epoch": 1.4323379394023035, "grad_norm": 0.15292055904865265, "learning_rate": 5.225871745330757e-05, "loss": 0.5069, "mean_token_accuracy": 0.8452047072350979, "num_tokens": 496881515.0, "step": 15568 }, { "entropy": 0.6270600128918886, "epoch": 1.4324299457737448, "grad_norm": 0.16322365403175354, "learning_rate": 5.2255650627165954e-05, "loss": 0.6261, "mean_token_accuracy": 0.8064805902540684, "num_tokens": 496912508.0, "step": 15569 }, { "entropy": 0.6274191737174988, "epoch": 1.4325219521451862, "grad_norm": 0.1572556495666504, "learning_rate": 5.225258380102432e-05, "loss": 0.6396, "mean_token_accuracy": 0.8053786791861057, "num_tokens": 496944195.0, "step": 15570 }, { "entropy": 0.5807233024388552, "epoch": 1.4326139585166273, "grad_norm": 0.15483389794826508, "learning_rate": 5.2249516974882696e-05, "loss": 0.5725, "mean_token_accuracy": 0.8266893960535526, "num_tokens": 496976576.0, "step": 15571 }, { "entropy": 0.7257951013743877, "epoch": 1.4327059648880685, "grad_norm": 0.1604730784893036, "learning_rate": 5.2246450148741064e-05, "loss": 0.7181, "mean_token_accuracy": 0.781004223972559, "num_tokens": 497008424.0, "step": 15572 }, { "entropy": 0.6351621299982071, "epoch": 1.4327979712595096, "grad_norm": 0.15546129643917084, "learning_rate": 5.2243383322599446e-05, "loss": 0.6253, "mean_token_accuracy": 0.8061861507594585, "num_tokens": 497040718.0, "step": 15573 }, { "entropy": 0.5865325201302767, "epoch": 1.432889977630951, "grad_norm": 0.16476744413375854, "learning_rate": 5.224031649645782e-05, "loss": 0.5774, "mean_token_accuracy": 0.8208578452467918, "num_tokens": 497072071.0, "step": 15574 }, { "entropy": 0.5767264193855226, "epoch": 1.4329819840023923, "grad_norm": 0.15214946866035461, "learning_rate": 5.223724967031619e-05, "loss": 0.5696, "mean_token_accuracy": 0.8223808892071247, "num_tokens": 497104472.0, "step": 15575 }, { "entropy": 0.6176936458796263, "epoch": 1.4330739903738334, "grad_norm": 0.1537388414144516, "learning_rate": 5.223418284417456e-05, "loss": 0.5937, "mean_token_accuracy": 0.8215548098087311, "num_tokens": 497136350.0, "step": 15576 }, { "entropy": 0.6339197922497988, "epoch": 1.4331659967452746, "grad_norm": 0.1575649529695511, "learning_rate": 5.2231116018032944e-05, "loss": 0.624, "mean_token_accuracy": 0.8054828867316246, "num_tokens": 497168921.0, "step": 15577 }, { "entropy": 0.6101653166115284, "epoch": 1.4332580031167157, "grad_norm": 0.15653713047504425, "learning_rate": 5.222804919189131e-05, "loss": 0.611, "mean_token_accuracy": 0.8161866776645184, "num_tokens": 497200200.0, "step": 15578 }, { "entropy": 0.4948614537715912, "epoch": 1.433350009488157, "grad_norm": 0.14620588719844818, "learning_rate": 5.222498236574969e-05, "loss": 0.4798, "mean_token_accuracy": 0.8500591814517975, "num_tokens": 497232294.0, "step": 15579 }, { "entropy": 0.5219084955751896, "epoch": 1.4334420158595984, "grad_norm": 0.14899034798145294, "learning_rate": 5.2221915539608055e-05, "loss": 0.5225, "mean_token_accuracy": 0.8374692350625992, "num_tokens": 497264788.0, "step": 15580 }, { "entropy": 0.5367708122357726, "epoch": 1.4335340222310395, "grad_norm": 0.15524810552597046, "learning_rate": 5.2218848713466436e-05, "loss": 0.5323, "mean_token_accuracy": 0.8382177501916885, "num_tokens": 497297070.0, "step": 15581 }, { "entropy": 0.45924649597145617, "epoch": 1.4336260286024807, "grad_norm": 0.13894911110401154, "learning_rate": 5.221578188732481e-05, "loss": 0.4375, "mean_token_accuracy": 0.8615890145301819, "num_tokens": 497328441.0, "step": 15582 }, { "entropy": 0.6116392151452601, "epoch": 1.4337180349739218, "grad_norm": 0.1574968844652176, "learning_rate": 5.221271506118318e-05, "loss": 0.6047, "mean_token_accuracy": 0.8166877068579197, "num_tokens": 497360512.0, "step": 15583 }, { "entropy": 0.6459121108055115, "epoch": 1.4338100413453632, "grad_norm": 0.16094985604286194, "learning_rate": 5.220964823504155e-05, "loss": 0.6351, "mean_token_accuracy": 0.805361021310091, "num_tokens": 497392441.0, "step": 15584 }, { "entropy": 0.6338962360750884, "epoch": 1.4339020477168045, "grad_norm": 0.1682024598121643, "learning_rate": 5.2206581408899935e-05, "loss": 0.6226, "mean_token_accuracy": 0.8082119151949883, "num_tokens": 497423878.0, "step": 15585 }, { "entropy": 0.5431099990382791, "epoch": 1.4339940540882457, "grad_norm": 0.15079694986343384, "learning_rate": 5.220351458275831e-05, "loss": 0.5313, "mean_token_accuracy": 0.8376238383352757, "num_tokens": 497455933.0, "step": 15586 }, { "entropy": 0.7056921441107988, "epoch": 1.4340860604596868, "grad_norm": 0.1613268256187439, "learning_rate": 5.220044775661668e-05, "loss": 0.6929, "mean_token_accuracy": 0.7879372946918011, "num_tokens": 497488316.0, "step": 15587 }, { "entropy": 0.6108889486640692, "epoch": 1.434178066831128, "grad_norm": 0.14608365297317505, "learning_rate": 5.219738093047506e-05, "loss": 0.5849, "mean_token_accuracy": 0.818357590585947, "num_tokens": 497520432.0, "step": 15588 }, { "entropy": 0.6475992687046528, "epoch": 1.4342700732025693, "grad_norm": 0.15560220181941986, "learning_rate": 5.219431410433343e-05, "loss": 0.6415, "mean_token_accuracy": 0.8053792268037796, "num_tokens": 497551737.0, "step": 15589 }, { "entropy": 0.5963029712438583, "epoch": 1.4343620795740106, "grad_norm": 0.1582372784614563, "learning_rate": 5.21912472781918e-05, "loss": 0.5769, "mean_token_accuracy": 0.8217727690935135, "num_tokens": 497583788.0, "step": 15590 }, { "entropy": 0.5835982300341129, "epoch": 1.4344540859454518, "grad_norm": 0.15706956386566162, "learning_rate": 5.2188180452050176e-05, "loss": 0.5887, "mean_token_accuracy": 0.8231544904410839, "num_tokens": 497615606.0, "step": 15591 }, { "entropy": 0.6426843078806996, "epoch": 1.434546092316893, "grad_norm": 0.16749578714370728, "learning_rate": 5.218511362590856e-05, "loss": 0.6356, "mean_token_accuracy": 0.8057844527065754, "num_tokens": 497647559.0, "step": 15592 }, { "entropy": 0.618081521242857, "epoch": 1.434638098688334, "grad_norm": 0.1683102697134018, "learning_rate": 5.2182046799766925e-05, "loss": 0.6079, "mean_token_accuracy": 0.815703734755516, "num_tokens": 497679151.0, "step": 15593 }, { "entropy": 0.685479050502181, "epoch": 1.4347301050597754, "grad_norm": 0.15824250876903534, "learning_rate": 5.21789799736253e-05, "loss": 0.6665, "mean_token_accuracy": 0.7980564832687378, "num_tokens": 497711114.0, "step": 15594 }, { "entropy": 0.676484664902091, "epoch": 1.4348221114312167, "grad_norm": 0.1559326946735382, "learning_rate": 5.217591314748367e-05, "loss": 0.6624, "mean_token_accuracy": 0.798570055514574, "num_tokens": 497743781.0, "step": 15595 }, { "entropy": 0.6954952292144299, "epoch": 1.4349141178026579, "grad_norm": 0.16477741301059723, "learning_rate": 5.217284632134205e-05, "loss": 0.6817, "mean_token_accuracy": 0.7955702990293503, "num_tokens": 497774907.0, "step": 15596 }, { "entropy": 0.5785264726728201, "epoch": 1.435006124174099, "grad_norm": 0.15809564292430878, "learning_rate": 5.2169779495200424e-05, "loss": 0.5585, "mean_token_accuracy": 0.822939570993185, "num_tokens": 497806573.0, "step": 15597 }, { "entropy": 0.5892633004114032, "epoch": 1.4350981305455401, "grad_norm": 0.14904990792274475, "learning_rate": 5.216671266905879e-05, "loss": 0.568, "mean_token_accuracy": 0.8214247301220894, "num_tokens": 497839198.0, "step": 15598 }, { "entropy": 0.620760187972337, "epoch": 1.4351901369169815, "grad_norm": 0.15674641728401184, "learning_rate": 5.2163645842917166e-05, "loss": 0.6071, "mean_token_accuracy": 0.8132009319961071, "num_tokens": 497871163.0, "step": 15599 }, { "entropy": 0.607427385635674, "epoch": 1.4352821432884229, "grad_norm": 0.15817029774188995, "learning_rate": 5.216057901677555e-05, "loss": 0.5936, "mean_token_accuracy": 0.8227142505347729, "num_tokens": 497903281.0, "step": 15600 }, { "entropy": 0.537072230130434, "epoch": 1.435374149659864, "grad_norm": 0.14723728597164154, "learning_rate": 5.2157512190633916e-05, "loss": 0.5169, "mean_token_accuracy": 0.8365003280341625, "num_tokens": 497935696.0, "step": 15601 }, { "entropy": 0.6667176764458418, "epoch": 1.4354661560313051, "grad_norm": 0.16264256834983826, "learning_rate": 5.215444536449229e-05, "loss": 0.6649, "mean_token_accuracy": 0.7950919978320599, "num_tokens": 497966944.0, "step": 15602 }, { "entropy": 0.6629846505820751, "epoch": 1.4355581624027463, "grad_norm": 0.15894436836242676, "learning_rate": 5.215137853835066e-05, "loss": 0.6631, "mean_token_accuracy": 0.7998712100088596, "num_tokens": 497998284.0, "step": 15603 }, { "entropy": 0.6136459661647677, "epoch": 1.4356501687741876, "grad_norm": 0.1493716537952423, "learning_rate": 5.214831171220904e-05, "loss": 0.6107, "mean_token_accuracy": 0.8129575178027153, "num_tokens": 498030498.0, "step": 15604 }, { "entropy": 0.5717803556472063, "epoch": 1.435742175145629, "grad_norm": 0.16584526002407074, "learning_rate": 5.2145244886067414e-05, "loss": 0.5607, "mean_token_accuracy": 0.8293655663728714, "num_tokens": 498063154.0, "step": 15605 }, { "entropy": 0.6127206981182098, "epoch": 1.43583418151707, "grad_norm": 0.15468193590641022, "learning_rate": 5.214217805992578e-05, "loss": 0.5892, "mean_token_accuracy": 0.818120464682579, "num_tokens": 498095202.0, "step": 15606 }, { "entropy": 0.6193830240517855, "epoch": 1.4359261878885112, "grad_norm": 0.17214757204055786, "learning_rate": 5.213911123378416e-05, "loss": 0.6115, "mean_token_accuracy": 0.8117590509355068, "num_tokens": 498126934.0, "step": 15607 }, { "entropy": 0.5804014690220356, "epoch": 1.4360181942599524, "grad_norm": 0.14645341038703918, "learning_rate": 5.213604440764254e-05, "loss": 0.565, "mean_token_accuracy": 0.8273640125989914, "num_tokens": 498159183.0, "step": 15608 }, { "entropy": 0.5925946459174156, "epoch": 1.4361102006313937, "grad_norm": 0.15128527581691742, "learning_rate": 5.2132977581500906e-05, "loss": 0.5807, "mean_token_accuracy": 0.8240508250892162, "num_tokens": 498191646.0, "step": 15609 }, { "entropy": 0.573908006772399, "epoch": 1.436202207002835, "grad_norm": 0.1495758593082428, "learning_rate": 5.212991075535928e-05, "loss": 0.552, "mean_token_accuracy": 0.8295629508793354, "num_tokens": 498224096.0, "step": 15610 }, { "entropy": 0.5113772079348564, "epoch": 1.4362942133742762, "grad_norm": 0.15001676976680756, "learning_rate": 5.212684392921765e-05, "loss": 0.4982, "mean_token_accuracy": 0.8456969261169434, "num_tokens": 498255148.0, "step": 15611 }, { "entropy": 0.7122325096279383, "epoch": 1.4363862197457173, "grad_norm": 0.1612595170736313, "learning_rate": 5.212377710307603e-05, "loss": 0.7072, "mean_token_accuracy": 0.7859127596020699, "num_tokens": 498287600.0, "step": 15612 }, { "entropy": 0.47927866876125336, "epoch": 1.4364782261171587, "grad_norm": 0.14834220707416534, "learning_rate": 5.2120710276934405e-05, "loss": 0.4553, "mean_token_accuracy": 0.8595594502985477, "num_tokens": 498319714.0, "step": 15613 }, { "entropy": 0.6932126814499497, "epoch": 1.4365702324885998, "grad_norm": 0.15969933569431305, "learning_rate": 5.211764345079277e-05, "loss": 0.6871, "mean_token_accuracy": 0.7911808751523495, "num_tokens": 498351686.0, "step": 15614 }, { "entropy": 0.6337010562419891, "epoch": 1.4366622388600412, "grad_norm": 0.1581137776374817, "learning_rate": 5.211457662465115e-05, "loss": 0.6262, "mean_token_accuracy": 0.8063249848783016, "num_tokens": 498383915.0, "step": 15615 }, { "entropy": 0.7065134197473526, "epoch": 1.4367542452314823, "grad_norm": 0.15847843885421753, "learning_rate": 5.211150979850953e-05, "loss": 0.6905, "mean_token_accuracy": 0.7880505695939064, "num_tokens": 498416476.0, "step": 15616 }, { "entropy": 0.6045380509458482, "epoch": 1.4368462516029235, "grad_norm": 0.15655553340911865, "learning_rate": 5.2108442972367896e-05, "loss": 0.5989, "mean_token_accuracy": 0.8171024285256863, "num_tokens": 498448872.0, "step": 15617 }, { "entropy": 0.5760469129309058, "epoch": 1.4369382579743648, "grad_norm": 0.15749427676200867, "learning_rate": 5.210537614622627e-05, "loss": 0.56, "mean_token_accuracy": 0.8267820104956627, "num_tokens": 498481207.0, "step": 15618 }, { "entropy": 0.5986538305878639, "epoch": 1.437030264345806, "grad_norm": 0.15148203074932098, "learning_rate": 5.210230932008465e-05, "loss": 0.5913, "mean_token_accuracy": 0.8201174661517143, "num_tokens": 498513639.0, "step": 15619 }, { "entropy": 0.5622076205909252, "epoch": 1.4371222707172473, "grad_norm": 0.15906912088394165, "learning_rate": 5.209924249394302e-05, "loss": 0.5503, "mean_token_accuracy": 0.8280416578054428, "num_tokens": 498545940.0, "step": 15620 }, { "entropy": 0.5285150874406099, "epoch": 1.4372142770886884, "grad_norm": 0.16354769468307495, "learning_rate": 5.2096175667801395e-05, "loss": 0.5276, "mean_token_accuracy": 0.8374639749526978, "num_tokens": 498578428.0, "step": 15621 }, { "entropy": 0.6004327796399593, "epoch": 1.4373062834601296, "grad_norm": 0.16100946068763733, "learning_rate": 5.209310884165976e-05, "loss": 0.5928, "mean_token_accuracy": 0.8194555230438709, "num_tokens": 498609461.0, "step": 15622 }, { "entropy": 0.6218350359704345, "epoch": 1.437398289831571, "grad_norm": 0.15006349980831146, "learning_rate": 5.209004201551815e-05, "loss": 0.6178, "mean_token_accuracy": 0.8119430206716061, "num_tokens": 498640636.0, "step": 15623 }, { "entropy": 0.5870259872172028, "epoch": 1.437490296203012, "grad_norm": 0.1511276364326477, "learning_rate": 5.208697518937652e-05, "loss": 0.5857, "mean_token_accuracy": 0.8238219022750854, "num_tokens": 498673008.0, "step": 15624 }, { "entropy": 0.6126443799585104, "epoch": 1.4375823025744534, "grad_norm": 0.15612582862377167, "learning_rate": 5.208390836323489e-05, "loss": 0.6145, "mean_token_accuracy": 0.8123681172728539, "num_tokens": 498705159.0, "step": 15625 }, { "entropy": 0.7117244657129049, "epoch": 1.4376743089458945, "grad_norm": 0.1590295284986496, "learning_rate": 5.208084153709326e-05, "loss": 0.7139, "mean_token_accuracy": 0.781468965113163, "num_tokens": 498737275.0, "step": 15626 }, { "entropy": 0.6290026139467955, "epoch": 1.4377663153173357, "grad_norm": 0.15457434952259064, "learning_rate": 5.207777471095164e-05, "loss": 0.6208, "mean_token_accuracy": 0.808571845293045, "num_tokens": 498768828.0, "step": 15627 }, { "entropy": 0.5305772763676941, "epoch": 1.437858321688777, "grad_norm": 0.1408088654279709, "learning_rate": 5.207470788481002e-05, "loss": 0.5094, "mean_token_accuracy": 0.8436126075685024, "num_tokens": 498801596.0, "step": 15628 }, { "entropy": 0.6635271133854985, "epoch": 1.4379503280602182, "grad_norm": 0.15744806826114655, "learning_rate": 5.2071641058668385e-05, "loss": 0.6605, "mean_token_accuracy": 0.7970437705516815, "num_tokens": 498833572.0, "step": 15629 }, { "entropy": 0.6018239539116621, "epoch": 1.4380423344316595, "grad_norm": 0.15430986881256104, "learning_rate": 5.206857423252676e-05, "loss": 0.597, "mean_token_accuracy": 0.8211268149316311, "num_tokens": 498866278.0, "step": 15630 }, { "entropy": 0.5558368414640427, "epoch": 1.4381343408031007, "grad_norm": 0.15225227177143097, "learning_rate": 5.206550740638514e-05, "loss": 0.5522, "mean_token_accuracy": 0.8282800503075123, "num_tokens": 498898735.0, "step": 15631 }, { "entropy": 0.5513075785711408, "epoch": 1.4382263471745418, "grad_norm": 0.1535380780696869, "learning_rate": 5.206244058024351e-05, "loss": 0.5432, "mean_token_accuracy": 0.8365579321980476, "num_tokens": 498930463.0, "step": 15632 }, { "entropy": 0.6824104888364673, "epoch": 1.4383183535459831, "grad_norm": 0.1611691117286682, "learning_rate": 5.2059373754101884e-05, "loss": 0.6791, "mean_token_accuracy": 0.7958348356187344, "num_tokens": 498962215.0, "step": 15633 }, { "entropy": 0.6280222535133362, "epoch": 1.4384103599174243, "grad_norm": 0.15951068699359894, "learning_rate": 5.205630692796025e-05, "loss": 0.6021, "mean_token_accuracy": 0.8154070153832436, "num_tokens": 498994141.0, "step": 15634 }, { "entropy": 0.6276498045772314, "epoch": 1.4385023662888656, "grad_norm": 0.15399810671806335, "learning_rate": 5.205324010181863e-05, "loss": 0.6139, "mean_token_accuracy": 0.8126625865697861, "num_tokens": 499025886.0, "step": 15635 }, { "entropy": 0.6408166605979204, "epoch": 1.4385943726603068, "grad_norm": 0.1582910567522049, "learning_rate": 5.205017327567701e-05, "loss": 0.6324, "mean_token_accuracy": 0.8077059648931026, "num_tokens": 499057712.0, "step": 15636 }, { "entropy": 0.5386843653395772, "epoch": 1.438686379031748, "grad_norm": 0.15806183218955994, "learning_rate": 5.2047106449535376e-05, "loss": 0.5293, "mean_token_accuracy": 0.8424341753125191, "num_tokens": 499089333.0, "step": 15637 }, { "entropy": 0.6753366151824594, "epoch": 1.4387783854031893, "grad_norm": 0.1607438027858734, "learning_rate": 5.204403962339375e-05, "loss": 0.6509, "mean_token_accuracy": 0.8009168654680252, "num_tokens": 499121633.0, "step": 15638 }, { "entropy": 0.48136403877288103, "epoch": 1.4388703917746304, "grad_norm": 0.1369350552558899, "learning_rate": 5.204097279725213e-05, "loss": 0.4688, "mean_token_accuracy": 0.850258368998766, "num_tokens": 499154190.0, "step": 15639 }, { "entropy": 0.6912176217883825, "epoch": 1.4389623981460717, "grad_norm": 0.15693560242652893, "learning_rate": 5.20379059711105e-05, "loss": 0.6774, "mean_token_accuracy": 0.7921726517379284, "num_tokens": 499185704.0, "step": 15640 }, { "entropy": 0.6166213965043426, "epoch": 1.4390544045175129, "grad_norm": 0.154525026679039, "learning_rate": 5.2034839144968874e-05, "loss": 0.6149, "mean_token_accuracy": 0.8140550032258034, "num_tokens": 499217651.0, "step": 15641 }, { "entropy": 0.6142898593097925, "epoch": 1.439146410888954, "grad_norm": 0.16064471006393433, "learning_rate": 5.203177231882724e-05, "loss": 0.6046, "mean_token_accuracy": 0.8145329914987087, "num_tokens": 499249076.0, "step": 15642 }, { "entropy": 0.633676958270371, "epoch": 1.4392384172603954, "grad_norm": 0.15536576509475708, "learning_rate": 5.2028705492685624e-05, "loss": 0.6235, "mean_token_accuracy": 0.8110143803060055, "num_tokens": 499280927.0, "step": 15643 }, { "entropy": 0.5410933922976255, "epoch": 1.4393304236318365, "grad_norm": 0.1491195410490036, "learning_rate": 5.2025638666544e-05, "loss": 0.5321, "mean_token_accuracy": 0.8372093699872494, "num_tokens": 499312750.0, "step": 15644 }, { "entropy": 0.6816350240260363, "epoch": 1.4394224300032779, "grad_norm": 0.16582629084587097, "learning_rate": 5.2022571840402366e-05, "loss": 0.6795, "mean_token_accuracy": 0.789965994656086, "num_tokens": 499344038.0, "step": 15645 }, { "entropy": 0.5513217272236943, "epoch": 1.439514436374719, "grad_norm": 0.15326489508152008, "learning_rate": 5.201950501426074e-05, "loss": 0.5319, "mean_token_accuracy": 0.8351566046476364, "num_tokens": 499376247.0, "step": 15646 }, { "entropy": 0.6722101885825396, "epoch": 1.4396064427461601, "grad_norm": 0.15858645737171173, "learning_rate": 5.201643818811912e-05, "loss": 0.6775, "mean_token_accuracy": 0.7960621453821659, "num_tokens": 499408227.0, "step": 15647 }, { "entropy": 0.6235938398167491, "epoch": 1.4396984491176015, "grad_norm": 0.15827742218971252, "learning_rate": 5.201337136197749e-05, "loss": 0.6001, "mean_token_accuracy": 0.8170912712812424, "num_tokens": 499439677.0, "step": 15648 }, { "entropy": 0.5270544067025185, "epoch": 1.4397904554890426, "grad_norm": 0.14626461267471313, "learning_rate": 5.2010304535835865e-05, "loss": 0.5152, "mean_token_accuracy": 0.8410940282046795, "num_tokens": 499470959.0, "step": 15649 }, { "entropy": 0.660162441432476, "epoch": 1.439882461860484, "grad_norm": 0.1598125696182251, "learning_rate": 5.2007237709694246e-05, "loss": 0.6465, "mean_token_accuracy": 0.8044916689395905, "num_tokens": 499503193.0, "step": 15650 }, { "entropy": 0.6440750639885664, "epoch": 1.439974468231925, "grad_norm": 0.16225944459438324, "learning_rate": 5.2004170883552614e-05, "loss": 0.6385, "mean_token_accuracy": 0.804326456040144, "num_tokens": 499534401.0, "step": 15651 }, { "entropy": 0.633007675409317, "epoch": 1.4400664746033662, "grad_norm": 0.17360137403011322, "learning_rate": 5.200110405741099e-05, "loss": 0.6314, "mean_token_accuracy": 0.8110081776976585, "num_tokens": 499566319.0, "step": 15652 }, { "entropy": 0.5955833252519369, "epoch": 1.4401584809748076, "grad_norm": 0.15803764760494232, "learning_rate": 5.1998037231269357e-05, "loss": 0.5875, "mean_token_accuracy": 0.819840244948864, "num_tokens": 499598138.0, "step": 15653 }, { "entropy": 0.670654121786356, "epoch": 1.4402504873462487, "grad_norm": 0.1572466492652893, "learning_rate": 5.199497040512774e-05, "loss": 0.671, "mean_token_accuracy": 0.7939980141818523, "num_tokens": 499630071.0, "step": 15654 }, { "entropy": 0.6363110542297363, "epoch": 1.44034249371769, "grad_norm": 0.15920047461986542, "learning_rate": 5.199190357898611e-05, "loss": 0.6249, "mean_token_accuracy": 0.8084778115153313, "num_tokens": 499661775.0, "step": 15655 }, { "entropy": 0.6114938799291849, "epoch": 1.4404345000891312, "grad_norm": 0.16049180924892426, "learning_rate": 5.198883675284448e-05, "loss": 0.5994, "mean_token_accuracy": 0.8150862641632557, "num_tokens": 499693434.0, "step": 15656 }, { "entropy": 0.6495343595743179, "epoch": 1.4405265064605723, "grad_norm": 0.15924540162086487, "learning_rate": 5.1985769926702855e-05, "loss": 0.6415, "mean_token_accuracy": 0.8076490759849548, "num_tokens": 499725318.0, "step": 15657 }, { "entropy": 0.6452169604599476, "epoch": 1.4406185128320137, "grad_norm": 0.15765561163425446, "learning_rate": 5.1982703100561237e-05, "loss": 0.6363, "mean_token_accuracy": 0.8005719967186451, "num_tokens": 499757354.0, "step": 15658 }, { "entropy": 0.6893719788640738, "epoch": 1.4407105192034548, "grad_norm": 0.16859681904315948, "learning_rate": 5.1979636274419604e-05, "loss": 0.6743, "mean_token_accuracy": 0.7941508367657661, "num_tokens": 499788946.0, "step": 15659 }, { "entropy": 0.6164061985909939, "epoch": 1.4408025255748962, "grad_norm": 0.15115857124328613, "learning_rate": 5.197656944827798e-05, "loss": 0.6049, "mean_token_accuracy": 0.811129666864872, "num_tokens": 499820997.0, "step": 15660 }, { "entropy": 0.6069641290232539, "epoch": 1.4408945319463373, "grad_norm": 0.14805473387241364, "learning_rate": 5.197350262213635e-05, "loss": 0.5849, "mean_token_accuracy": 0.8221410661935806, "num_tokens": 499853495.0, "step": 15661 }, { "entropy": 0.657615662086755, "epoch": 1.4409865383177785, "grad_norm": 0.1541614830493927, "learning_rate": 5.1970435795994735e-05, "loss": 0.6557, "mean_token_accuracy": 0.8001722916960716, "num_tokens": 499885182.0, "step": 15662 }, { "entropy": 0.6029439140111208, "epoch": 1.4410785446892198, "grad_norm": 0.15936248004436493, "learning_rate": 5.19673689698531e-05, "loss": 0.5948, "mean_token_accuracy": 0.8187226988375187, "num_tokens": 499917659.0, "step": 15663 }, { "entropy": 0.5619012378156185, "epoch": 1.441170551060661, "grad_norm": 0.15465407073497772, "learning_rate": 5.196430214371147e-05, "loss": 0.5576, "mean_token_accuracy": 0.8304653763771057, "num_tokens": 499949549.0, "step": 15664 }, { "entropy": 0.7075056787580252, "epoch": 1.4412625574321023, "grad_norm": 0.1659955084323883, "learning_rate": 5.1961235317569846e-05, "loss": 0.7004, "mean_token_accuracy": 0.7854507118463516, "num_tokens": 499980622.0, "step": 15665 }, { "entropy": 0.7281126379966736, "epoch": 1.4413545638035434, "grad_norm": 0.16069824993610382, "learning_rate": 5.195816849142823e-05, "loss": 0.721, "mean_token_accuracy": 0.7869280464947224, "num_tokens": 500013366.0, "step": 15666 }, { "entropy": 0.5802493337541819, "epoch": 1.4414465701749846, "grad_norm": 0.15219660103321075, "learning_rate": 5.19551016652866e-05, "loss": 0.5616, "mean_token_accuracy": 0.8281449116766453, "num_tokens": 500044940.0, "step": 15667 }, { "entropy": 0.5937228719703853, "epoch": 1.441538576546426, "grad_norm": 0.15463490784168243, "learning_rate": 5.195203483914497e-05, "loss": 0.5861, "mean_token_accuracy": 0.8226738534867764, "num_tokens": 500076614.0, "step": 15668 }, { "entropy": 0.7125667668879032, "epoch": 1.441630582917867, "grad_norm": 0.17180116474628448, "learning_rate": 5.194896801300334e-05, "loss": 0.7052, "mean_token_accuracy": 0.7857908681035042, "num_tokens": 500108073.0, "step": 15669 }, { "entropy": 0.5646152119152248, "epoch": 1.4417225892893084, "grad_norm": 0.149471715092659, "learning_rate": 5.1945901186861726e-05, "loss": 0.565, "mean_token_accuracy": 0.8272683583199978, "num_tokens": 500139999.0, "step": 15670 }, { "entropy": 0.5395527193322778, "epoch": 1.4418145956607495, "grad_norm": 0.15241573750972748, "learning_rate": 5.1942834360720093e-05, "loss": 0.531, "mean_token_accuracy": 0.8403129503130913, "num_tokens": 500171415.0, "step": 15671 }, { "entropy": 0.7055346872657537, "epoch": 1.4419066020321907, "grad_norm": 0.16150319576263428, "learning_rate": 5.193976753457847e-05, "loss": 0.6886, "mean_token_accuracy": 0.7932313270866871, "num_tokens": 500202749.0, "step": 15672 }, { "entropy": 0.506667266599834, "epoch": 1.441998608403632, "grad_norm": 0.15654256939888, "learning_rate": 5.1936700708436836e-05, "loss": 0.4978, "mean_token_accuracy": 0.8470388166606426, "num_tokens": 500234369.0, "step": 15673 }, { "entropy": 0.6589371170848608, "epoch": 1.4420906147750732, "grad_norm": 0.15969504415988922, "learning_rate": 5.193363388229522e-05, "loss": 0.6355, "mean_token_accuracy": 0.8044284284114838, "num_tokens": 500265416.0, "step": 15674 }, { "entropy": 0.621686976402998, "epoch": 1.4421826211465145, "grad_norm": 0.1575791835784912, "learning_rate": 5.193056705615359e-05, "loss": 0.5964, "mean_token_accuracy": 0.8131720088422298, "num_tokens": 500296991.0, "step": 15675 }, { "entropy": 0.5439040521159768, "epoch": 1.4422746275179557, "grad_norm": 0.15401700139045715, "learning_rate": 5.192750023001196e-05, "loss": 0.5383, "mean_token_accuracy": 0.834080196917057, "num_tokens": 500329108.0, "step": 15676 }, { "entropy": 0.5053191110491753, "epoch": 1.4423666338893968, "grad_norm": 0.14923827350139618, "learning_rate": 5.1924433403870335e-05, "loss": 0.4861, "mean_token_accuracy": 0.8504025638103485, "num_tokens": 500360645.0, "step": 15677 }, { "entropy": 0.542908578645438, "epoch": 1.4424586402608381, "grad_norm": 0.14979174733161926, "learning_rate": 5.1921366577728716e-05, "loss": 0.5334, "mean_token_accuracy": 0.8348880186676979, "num_tokens": 500392794.0, "step": 15678 }, { "entropy": 0.5896643046289682, "epoch": 1.4425506466322793, "grad_norm": 0.15678080916404724, "learning_rate": 5.1918299751587084e-05, "loss": 0.5722, "mean_token_accuracy": 0.8214852064847946, "num_tokens": 500424521.0, "step": 15679 }, { "entropy": 0.5667223846539855, "epoch": 1.4426426530037206, "grad_norm": 0.16164043545722961, "learning_rate": 5.191523292544546e-05, "loss": 0.5616, "mean_token_accuracy": 0.8284224234521389, "num_tokens": 500455935.0, "step": 15680 }, { "entropy": 0.7139086090028286, "epoch": 1.4427346593751618, "grad_norm": 0.16793544590473175, "learning_rate": 5.191216609930384e-05, "loss": 0.7132, "mean_token_accuracy": 0.7814307734370232, "num_tokens": 500488341.0, "step": 15681 }, { "entropy": 0.7078898642212152, "epoch": 1.442826665746603, "grad_norm": 0.1633855104446411, "learning_rate": 5.190909927316221e-05, "loss": 0.7092, "mean_token_accuracy": 0.7862892672419548, "num_tokens": 500519595.0, "step": 15682 }, { "entropy": 0.6344558410346508, "epoch": 1.4429186721180443, "grad_norm": 0.15467305481433868, "learning_rate": 5.190603244702058e-05, "loss": 0.6032, "mean_token_accuracy": 0.813832513988018, "num_tokens": 500551701.0, "step": 15683 }, { "entropy": 0.6606058049947023, "epoch": 1.4430106784894854, "grad_norm": 0.16060973703861237, "learning_rate": 5.190296562087895e-05, "loss": 0.658, "mean_token_accuracy": 0.8024740070104599, "num_tokens": 500583365.0, "step": 15684 }, { "entropy": 0.5787179060280323, "epoch": 1.4431026848609267, "grad_norm": 0.15332470834255219, "learning_rate": 5.189989879473733e-05, "loss": 0.5613, "mean_token_accuracy": 0.8229568190872669, "num_tokens": 500614001.0, "step": 15685 }, { "entropy": 0.5590316173620522, "epoch": 1.4431946912323679, "grad_norm": 0.15578514337539673, "learning_rate": 5.1896831968595706e-05, "loss": 0.5543, "mean_token_accuracy": 0.8331095278263092, "num_tokens": 500646504.0, "step": 15686 }, { "entropy": 0.5997512266039848, "epoch": 1.443286697603809, "grad_norm": 0.1598382592201233, "learning_rate": 5.1893765142454074e-05, "loss": 0.5933, "mean_token_accuracy": 0.8181789591908455, "num_tokens": 500678655.0, "step": 15687 }, { "entropy": 0.5268417927436531, "epoch": 1.4433787039752504, "grad_norm": 0.14876608550548553, "learning_rate": 5.189069831631245e-05, "loss": 0.5165, "mean_token_accuracy": 0.8403434529900551, "num_tokens": 500710237.0, "step": 15688 }, { "entropy": 0.627172164618969, "epoch": 1.4434707103466915, "grad_norm": 0.16137829422950745, "learning_rate": 5.188763149017083e-05, "loss": 0.6227, "mean_token_accuracy": 0.8083162307739258, "num_tokens": 500741780.0, "step": 15689 }, { "entropy": 0.5982195353135467, "epoch": 1.4435627167181329, "grad_norm": 0.15245676040649414, "learning_rate": 5.18845646640292e-05, "loss": 0.5893, "mean_token_accuracy": 0.8184335418045521, "num_tokens": 500774063.0, "step": 15690 }, { "entropy": 0.6574294995516539, "epoch": 1.443654723089574, "grad_norm": 0.15811751782894135, "learning_rate": 5.188149783788757e-05, "loss": 0.6474, "mean_token_accuracy": 0.7984780259430408, "num_tokens": 500805380.0, "step": 15691 }, { "entropy": 0.6478750398382545, "epoch": 1.4437467294610151, "grad_norm": 0.15317970514297485, "learning_rate": 5.187843101174594e-05, "loss": 0.6328, "mean_token_accuracy": 0.8042971678078175, "num_tokens": 500836637.0, "step": 15692 }, { "entropy": 0.6450932249426842, "epoch": 1.4438387358324565, "grad_norm": 0.1551068276166916, "learning_rate": 5.187536418560432e-05, "loss": 0.6268, "mean_token_accuracy": 0.8050121963024139, "num_tokens": 500868177.0, "step": 15693 }, { "entropy": 0.67843665368855, "epoch": 1.4439307422038976, "grad_norm": 0.16133606433868408, "learning_rate": 5.18722973594627e-05, "loss": 0.6789, "mean_token_accuracy": 0.7948955930769444, "num_tokens": 500900296.0, "step": 15694 }, { "entropy": 0.5515557583421469, "epoch": 1.444022748575339, "grad_norm": 0.15010158717632294, "learning_rate": 5.1869230533321065e-05, "loss": 0.5438, "mean_token_accuracy": 0.8340113088488579, "num_tokens": 500932086.0, "step": 15695 }, { "entropy": 0.5964016942307353, "epoch": 1.44411475494678, "grad_norm": 0.15995769202709198, "learning_rate": 5.186616370717944e-05, "loss": 0.5889, "mean_token_accuracy": 0.8195374235510826, "num_tokens": 500964354.0, "step": 15696 }, { "entropy": 0.5885719694197178, "epoch": 1.4442067613182212, "grad_norm": 0.1548122614622116, "learning_rate": 5.186309688103782e-05, "loss": 0.5878, "mean_token_accuracy": 0.8220949470996857, "num_tokens": 500996841.0, "step": 15697 }, { "entropy": 0.6225017569959164, "epoch": 1.4442987676896626, "grad_norm": 0.15708167850971222, "learning_rate": 5.186003005489619e-05, "loss": 0.6155, "mean_token_accuracy": 0.8116728737950325, "num_tokens": 501028934.0, "step": 15698 }, { "entropy": 0.6768473535776138, "epoch": 1.4443907740611037, "grad_norm": 0.16341355443000793, "learning_rate": 5.185696322875456e-05, "loss": 0.6765, "mean_token_accuracy": 0.7937556393444538, "num_tokens": 501061252.0, "step": 15699 }, { "entropy": 0.5597397582605481, "epoch": 1.444482780432545, "grad_norm": 0.15325109660625458, "learning_rate": 5.185389640261293e-05, "loss": 0.5464, "mean_token_accuracy": 0.8297169916331768, "num_tokens": 501092981.0, "step": 15700 }, { "entropy": 0.75951929949224, "epoch": 1.4445747868039862, "grad_norm": 0.17490188777446747, "learning_rate": 5.185082957647131e-05, "loss": 0.7318, "mean_token_accuracy": 0.7780756056308746, "num_tokens": 501124795.0, "step": 15701 }, { "entropy": 0.6506090806797147, "epoch": 1.4446667931754273, "grad_norm": 0.1629764884710312, "learning_rate": 5.184776275032969e-05, "loss": 0.6462, "mean_token_accuracy": 0.7988641783595085, "num_tokens": 501155876.0, "step": 15702 }, { "entropy": 0.5752848517149687, "epoch": 1.4447587995468687, "grad_norm": 0.14675134420394897, "learning_rate": 5.1844695924188055e-05, "loss": 0.5602, "mean_token_accuracy": 0.8260462954640388, "num_tokens": 501188510.0, "step": 15703 }, { "entropy": 0.5586128868162632, "epoch": 1.4448508059183098, "grad_norm": 0.1524234116077423, "learning_rate": 5.184162909804643e-05, "loss": 0.5503, "mean_token_accuracy": 0.8324042819440365, "num_tokens": 501220496.0, "step": 15704 }, { "entropy": 0.5406489460729063, "epoch": 1.4449428122897512, "grad_norm": 0.1487109512090683, "learning_rate": 5.183856227190481e-05, "loss": 0.532, "mean_token_accuracy": 0.8422480821609497, "num_tokens": 501252386.0, "step": 15705 }, { "entropy": 0.5842731688171625, "epoch": 1.4450348186611923, "grad_norm": 0.1572112739086151, "learning_rate": 5.1835495445763186e-05, "loss": 0.5723, "mean_token_accuracy": 0.8251101784408092, "num_tokens": 501284567.0, "step": 15706 }, { "entropy": 0.7237949445843697, "epoch": 1.4451268250326335, "grad_norm": 0.16169941425323486, "learning_rate": 5.1832428619621554e-05, "loss": 0.7013, "mean_token_accuracy": 0.7836882472038269, "num_tokens": 501316866.0, "step": 15707 }, { "entropy": 0.7200224567204714, "epoch": 1.4452188314040748, "grad_norm": 0.1642746478319168, "learning_rate": 5.182936179347992e-05, "loss": 0.6945, "mean_token_accuracy": 0.7917207814753056, "num_tokens": 501348033.0, "step": 15708 }, { "entropy": 0.5855368925258517, "epoch": 1.445310837775516, "grad_norm": 0.1566953808069229, "learning_rate": 5.182629496733831e-05, "loss": 0.5719, "mean_token_accuracy": 0.8275202624499798, "num_tokens": 501380340.0, "step": 15709 }, { "entropy": 0.6179522159509361, "epoch": 1.4454028441469573, "grad_norm": 0.14940103888511658, "learning_rate": 5.182322814119668e-05, "loss": 0.5961, "mean_token_accuracy": 0.8197749815881252, "num_tokens": 501411842.0, "step": 15710 }, { "entropy": 0.6687678238376975, "epoch": 1.4454948505183984, "grad_norm": 0.15976449847221375, "learning_rate": 5.182016131505505e-05, "loss": 0.674, "mean_token_accuracy": 0.7948578894138336, "num_tokens": 501443649.0, "step": 15711 }, { "entropy": 0.5607018731534481, "epoch": 1.4455868568898396, "grad_norm": 0.15983925759792328, "learning_rate": 5.1817094488913434e-05, "loss": 0.5429, "mean_token_accuracy": 0.8292003870010376, "num_tokens": 501475240.0, "step": 15712 }, { "entropy": 0.6080004312098026, "epoch": 1.445678863261281, "grad_norm": 0.15898041427135468, "learning_rate": 5.18140276627718e-05, "loss": 0.5868, "mean_token_accuracy": 0.8196976743638515, "num_tokens": 501507069.0, "step": 15713 }, { "entropy": 0.5558412238024175, "epoch": 1.445770869632722, "grad_norm": 0.1624632030725479, "learning_rate": 5.1810960836630176e-05, "loss": 0.5442, "mean_token_accuracy": 0.8318880386650562, "num_tokens": 501538504.0, "step": 15714 }, { "entropy": 0.6510980539023876, "epoch": 1.4458628760041634, "grad_norm": 0.15881188213825226, "learning_rate": 5.1807894010488544e-05, "loss": 0.6447, "mean_token_accuracy": 0.8032910116016865, "num_tokens": 501570094.0, "step": 15715 }, { "entropy": 0.6762349978089333, "epoch": 1.4459548823756045, "grad_norm": 0.16690441966056824, "learning_rate": 5.1804827184346925e-05, "loss": 0.6657, "mean_token_accuracy": 0.7950247377157211, "num_tokens": 501600341.0, "step": 15716 }, { "entropy": 0.6388398418202996, "epoch": 1.4460468887470457, "grad_norm": 0.15627124905586243, "learning_rate": 5.18017603582053e-05, "loss": 0.6228, "mean_token_accuracy": 0.808622270822525, "num_tokens": 501631398.0, "step": 15717 }, { "entropy": 0.7236428689211607, "epoch": 1.446138895118487, "grad_norm": 0.16691288352012634, "learning_rate": 5.179869353206367e-05, "loss": 0.7151, "mean_token_accuracy": 0.7831502705812454, "num_tokens": 501663862.0, "step": 15718 }, { "entropy": 0.5912930369377136, "epoch": 1.4462309014899282, "grad_norm": 0.15332618355751038, "learning_rate": 5.179562670592204e-05, "loss": 0.5751, "mean_token_accuracy": 0.821050975471735, "num_tokens": 501695604.0, "step": 15719 }, { "entropy": 0.6732875965535641, "epoch": 1.4463229078613695, "grad_norm": 0.16260212659835815, "learning_rate": 5.1792559879780424e-05, "loss": 0.6658, "mean_token_accuracy": 0.7954854369163513, "num_tokens": 501727536.0, "step": 15720 }, { "entropy": 0.6463106740266085, "epoch": 1.4464149142328107, "grad_norm": 0.15724311769008636, "learning_rate": 5.178949305363879e-05, "loss": 0.6433, "mean_token_accuracy": 0.8019617535173893, "num_tokens": 501759621.0, "step": 15721 }, { "entropy": 0.5950822131708264, "epoch": 1.4465069206042518, "grad_norm": 0.15180577337741852, "learning_rate": 5.1786426227497167e-05, "loss": 0.5786, "mean_token_accuracy": 0.819844264537096, "num_tokens": 501792092.0, "step": 15722 }, { "entropy": 0.6712682452052832, "epoch": 1.4465989269756931, "grad_norm": 0.16107553243637085, "learning_rate": 5.1783359401355534e-05, "loss": 0.6887, "mean_token_accuracy": 0.7896644100546837, "num_tokens": 501824176.0, "step": 15723 }, { "entropy": 0.724453741684556, "epoch": 1.4466909333471343, "grad_norm": 0.16721071302890778, "learning_rate": 5.1780292575213916e-05, "loss": 0.7276, "mean_token_accuracy": 0.7834668383002281, "num_tokens": 501856283.0, "step": 15724 }, { "entropy": 0.5421556863002479, "epoch": 1.4467829397185756, "grad_norm": 0.14902029931545258, "learning_rate": 5.177722574907229e-05, "loss": 0.5173, "mean_token_accuracy": 0.8352654315531254, "num_tokens": 501887875.0, "step": 15725 }, { "entropy": 0.5834228973835707, "epoch": 1.4468749460900168, "grad_norm": 0.15465106070041656, "learning_rate": 5.177415892293066e-05, "loss": 0.5676, "mean_token_accuracy": 0.8266318924725056, "num_tokens": 501918863.0, "step": 15726 }, { "entropy": 0.6530616693198681, "epoch": 1.446966952461458, "grad_norm": 0.15362121164798737, "learning_rate": 5.177109209678903e-05, "loss": 0.6372, "mean_token_accuracy": 0.8030346892774105, "num_tokens": 501951108.0, "step": 15727 }, { "entropy": 0.5966401076875627, "epoch": 1.4470589588328993, "grad_norm": 0.15059727430343628, "learning_rate": 5.1768025270647414e-05, "loss": 0.5795, "mean_token_accuracy": 0.8237702995538712, "num_tokens": 501983763.0, "step": 15728 }, { "entropy": 0.6208657566457987, "epoch": 1.4471509652043404, "grad_norm": 0.155916228890419, "learning_rate": 5.176495844450578e-05, "loss": 0.6081, "mean_token_accuracy": 0.8114113733172417, "num_tokens": 502015864.0, "step": 15729 }, { "entropy": 0.6423929817974567, "epoch": 1.4472429715757817, "grad_norm": 0.15912939608097076, "learning_rate": 5.176189161836416e-05, "loss": 0.6295, "mean_token_accuracy": 0.802539199590683, "num_tokens": 502046670.0, "step": 15730 }, { "entropy": 0.5989354960620403, "epoch": 1.4473349779472229, "grad_norm": 0.163077250123024, "learning_rate": 5.1758824792222525e-05, "loss": 0.5945, "mean_token_accuracy": 0.8157868422567844, "num_tokens": 502077485.0, "step": 15731 }, { "entropy": 0.5545177264139056, "epoch": 1.447426984318664, "grad_norm": 0.15527501702308655, "learning_rate": 5.1755757966080906e-05, "loss": 0.5432, "mean_token_accuracy": 0.8328269980847836, "num_tokens": 502109715.0, "step": 15732 }, { "entropy": 0.5626667905598879, "epoch": 1.4475189906901054, "grad_norm": 0.14996790885925293, "learning_rate": 5.175269113993928e-05, "loss": 0.5395, "mean_token_accuracy": 0.8322620950639248, "num_tokens": 502141609.0, "step": 15733 }, { "entropy": 0.6319514755159616, "epoch": 1.4476109970615465, "grad_norm": 0.15822233259677887, "learning_rate": 5.174962431379765e-05, "loss": 0.6384, "mean_token_accuracy": 0.8020589835941792, "num_tokens": 502173128.0, "step": 15734 }, { "entropy": 0.6258345600217581, "epoch": 1.4477030034329879, "grad_norm": 0.15542520582675934, "learning_rate": 5.1746557487656023e-05, "loss": 0.6209, "mean_token_accuracy": 0.8050011806190014, "num_tokens": 502205148.0, "step": 15735 }, { "entropy": 0.6134357172995806, "epoch": 1.447795009804429, "grad_norm": 0.1577172875404358, "learning_rate": 5.1743490661514405e-05, "loss": 0.5952, "mean_token_accuracy": 0.8140515238046646, "num_tokens": 502237352.0, "step": 15736 }, { "entropy": 0.631394550204277, "epoch": 1.4478870161758701, "grad_norm": 0.15193916857242584, "learning_rate": 5.174042383537277e-05, "loss": 0.6251, "mean_token_accuracy": 0.8061434552073479, "num_tokens": 502270010.0, "step": 15737 }, { "entropy": 0.6849610470235348, "epoch": 1.4479790225473115, "grad_norm": 6.822237014770508, "learning_rate": 5.173735700923115e-05, "loss": 0.6616, "mean_token_accuracy": 0.8010885324329138, "num_tokens": 502301646.0, "step": 15738 }, { "entropy": 0.7273469157516956, "epoch": 1.4480710289187526, "grad_norm": 0.16405382752418518, "learning_rate": 5.1734290183089515e-05, "loss": 0.7187, "mean_token_accuracy": 0.781328771263361, "num_tokens": 502333893.0, "step": 15739 }, { "entropy": 0.5894296355545521, "epoch": 1.448163035290194, "grad_norm": 0.1522318422794342, "learning_rate": 5.17312233569479e-05, "loss": 0.5798, "mean_token_accuracy": 0.8220011964440346, "num_tokens": 502366228.0, "step": 15740 }, { "entropy": 0.5755199268460274, "epoch": 1.448255041661635, "grad_norm": 0.15365225076675415, "learning_rate": 5.172815653080627e-05, "loss": 0.5722, "mean_token_accuracy": 0.8244568109512329, "num_tokens": 502398269.0, "step": 15741 }, { "entropy": 0.5454120337963104, "epoch": 1.4483470480330762, "grad_norm": 0.15237192809581757, "learning_rate": 5.172508970466464e-05, "loss": 0.5325, "mean_token_accuracy": 0.8365891836583614, "num_tokens": 502429979.0, "step": 15742 }, { "entropy": 0.6565990950912237, "epoch": 1.4484390544045176, "grad_norm": 0.16289488971233368, "learning_rate": 5.172202287852303e-05, "loss": 0.6443, "mean_token_accuracy": 0.8050572276115417, "num_tokens": 502462021.0, "step": 15743 }, { "entropy": 0.6506851240992546, "epoch": 1.4485310607759587, "grad_norm": 0.16085833311080933, "learning_rate": 5.1718956052381395e-05, "loss": 0.6327, "mean_token_accuracy": 0.8048226423561573, "num_tokens": 502494043.0, "step": 15744 }, { "entropy": 0.5594254890456796, "epoch": 1.4486230671474, "grad_norm": 0.1511635184288025, "learning_rate": 5.171588922623976e-05, "loss": 0.5501, "mean_token_accuracy": 0.8292663656175137, "num_tokens": 502526098.0, "step": 15745 }, { "entropy": 0.625136480666697, "epoch": 1.4487150735188412, "grad_norm": 0.15686990320682526, "learning_rate": 5.171282240009814e-05, "loss": 0.6184, "mean_token_accuracy": 0.8118405416607857, "num_tokens": 502557546.0, "step": 15746 }, { "entropy": 0.5279641300439835, "epoch": 1.4488070798902823, "grad_norm": 0.14943793416023254, "learning_rate": 5.170975557395652e-05, "loss": 0.5024, "mean_token_accuracy": 0.8466445915400982, "num_tokens": 502589305.0, "step": 15747 }, { "entropy": 0.6482254769653082, "epoch": 1.4488990862617237, "grad_norm": 0.15765586495399475, "learning_rate": 5.1706688747814894e-05, "loss": 0.635, "mean_token_accuracy": 0.8047546036541462, "num_tokens": 502620693.0, "step": 15748 }, { "entropy": 0.5908115785568953, "epoch": 1.4489910926331648, "grad_norm": 0.15644146502017975, "learning_rate": 5.170362192167326e-05, "loss": 0.5772, "mean_token_accuracy": 0.823126781731844, "num_tokens": 502652308.0, "step": 15749 }, { "entropy": 0.6606712490320206, "epoch": 1.4490830990046062, "grad_norm": 0.16032136976718903, "learning_rate": 5.1700555095531636e-05, "loss": 0.6423, "mean_token_accuracy": 0.8045300133526325, "num_tokens": 502684497.0, "step": 15750 }, { "entropy": 0.6888804286718369, "epoch": 1.4491751053760473, "grad_norm": 0.16843238472938538, "learning_rate": 5.169748826939002e-05, "loss": 0.6873, "mean_token_accuracy": 0.7921571731567383, "num_tokens": 502717057.0, "step": 15751 }, { "entropy": 0.7746430356055498, "epoch": 1.4492671117474885, "grad_norm": 0.17095544934272766, "learning_rate": 5.1694421443248386e-05, "loss": 0.7781, "mean_token_accuracy": 0.7691900320351124, "num_tokens": 502748606.0, "step": 15752 }, { "entropy": 0.5973783135414124, "epoch": 1.4493591181189298, "grad_norm": 0.15823951363563538, "learning_rate": 5.169135461710676e-05, "loss": 0.594, "mean_token_accuracy": 0.8160071484744549, "num_tokens": 502780880.0, "step": 15753 }, { "entropy": 0.6544720437377691, "epoch": 1.449451124490371, "grad_norm": 0.1647266298532486, "learning_rate": 5.168828779096513e-05, "loss": 0.6517, "mean_token_accuracy": 0.7995687611401081, "num_tokens": 502812134.0, "step": 15754 }, { "entropy": 0.6002061339095235, "epoch": 1.4495431308618123, "grad_norm": 0.15344776213169098, "learning_rate": 5.168522096482351e-05, "loss": 0.594, "mean_token_accuracy": 0.8184713535010815, "num_tokens": 502843997.0, "step": 15755 }, { "entropy": 0.5463123098015785, "epoch": 1.4496351372332534, "grad_norm": 0.1492263227701187, "learning_rate": 5.1682154138681884e-05, "loss": 0.5343, "mean_token_accuracy": 0.8375916630029678, "num_tokens": 502875905.0, "step": 15756 }, { "entropy": 0.6721840798854828, "epoch": 1.4497271436046946, "grad_norm": 0.16254417598247528, "learning_rate": 5.167908731254025e-05, "loss": 0.6707, "mean_token_accuracy": 0.7957402467727661, "num_tokens": 502907889.0, "step": 15757 }, { "entropy": 0.6671585515141487, "epoch": 1.449819149976136, "grad_norm": 0.16031818091869354, "learning_rate": 5.167602048639863e-05, "loss": 0.6556, "mean_token_accuracy": 0.7969964258372784, "num_tokens": 502939485.0, "step": 15758 }, { "entropy": 0.6003734888508916, "epoch": 1.449911156347577, "grad_norm": 0.1489659994840622, "learning_rate": 5.167295366025701e-05, "loss": 0.5615, "mean_token_accuracy": 0.8264736980199814, "num_tokens": 502970627.0, "step": 15759 }, { "entropy": 0.5413641696795821, "epoch": 1.4500031627190184, "grad_norm": 0.14658091962337494, "learning_rate": 5.1669886834115376e-05, "loss": 0.5406, "mean_token_accuracy": 0.8305419497191906, "num_tokens": 503002653.0, "step": 15760 }, { "entropy": 0.579532706644386, "epoch": 1.4500951690904595, "grad_norm": 0.16481827199459076, "learning_rate": 5.166682000797375e-05, "loss": 0.5578, "mean_token_accuracy": 0.827094029635191, "num_tokens": 503034954.0, "step": 15761 }, { "entropy": 0.5766190933063626, "epoch": 1.4501871754619007, "grad_norm": 0.15493981540203094, "learning_rate": 5.166375318183212e-05, "loss": 0.5588, "mean_token_accuracy": 0.8231207765638828, "num_tokens": 503066845.0, "step": 15762 }, { "entropy": 0.7131756898015738, "epoch": 1.450279181833342, "grad_norm": 0.1655331254005432, "learning_rate": 5.16606863556905e-05, "loss": 0.7013, "mean_token_accuracy": 0.789719246327877, "num_tokens": 503098222.0, "step": 15763 }, { "entropy": 0.599360017105937, "epoch": 1.4503711882047832, "grad_norm": 0.1474238634109497, "learning_rate": 5.1657619529548875e-05, "loss": 0.5924, "mean_token_accuracy": 0.8199055157601833, "num_tokens": 503130691.0, "step": 15764 }, { "entropy": 0.6825484922155738, "epoch": 1.4504631945762245, "grad_norm": 0.16421030461788177, "learning_rate": 5.165455270340724e-05, "loss": 0.6689, "mean_token_accuracy": 0.796640183776617, "num_tokens": 503163344.0, "step": 15765 }, { "entropy": 0.5503674065694213, "epoch": 1.4505552009476657, "grad_norm": 0.16059468686580658, "learning_rate": 5.165148587726562e-05, "loss": 0.5357, "mean_token_accuracy": 0.8366094119846821, "num_tokens": 503194882.0, "step": 15766 }, { "entropy": 0.6575087942183018, "epoch": 1.4506472073191068, "grad_norm": 0.1651662141084671, "learning_rate": 5.1648419051124e-05, "loss": 0.6488, "mean_token_accuracy": 0.8007034100592136, "num_tokens": 503227200.0, "step": 15767 }, { "entropy": 0.6606774404644966, "epoch": 1.4507392136905481, "grad_norm": 0.1598503738641739, "learning_rate": 5.1645352224982367e-05, "loss": 0.6551, "mean_token_accuracy": 0.8024585098028183, "num_tokens": 503258954.0, "step": 15768 }, { "entropy": 0.5625569429248571, "epoch": 1.4508312200619893, "grad_norm": 0.15411381423473358, "learning_rate": 5.164228539884074e-05, "loss": 0.5584, "mean_token_accuracy": 0.8294287100434303, "num_tokens": 503290776.0, "step": 15769 }, { "entropy": 0.642357999458909, "epoch": 1.4509232264334306, "grad_norm": 0.1605043113231659, "learning_rate": 5.163921857269911e-05, "loss": 0.6285, "mean_token_accuracy": 0.8102966398000717, "num_tokens": 503323349.0, "step": 15770 }, { "entropy": 0.6702718427404761, "epoch": 1.4510152328048718, "grad_norm": 0.16130128502845764, "learning_rate": 5.163615174655749e-05, "loss": 0.6576, "mean_token_accuracy": 0.7969168797135353, "num_tokens": 503354790.0, "step": 15771 }, { "entropy": 0.6732852403074503, "epoch": 1.451107239176313, "grad_norm": 0.16453315317630768, "learning_rate": 5.1633084920415865e-05, "loss": 0.6593, "mean_token_accuracy": 0.7982374653220177, "num_tokens": 503386650.0, "step": 15772 }, { "entropy": 0.6218149904161692, "epoch": 1.4511992455477543, "grad_norm": 0.16084541380405426, "learning_rate": 5.163001809427423e-05, "loss": 0.609, "mean_token_accuracy": 0.8121970444917679, "num_tokens": 503418650.0, "step": 15773 }, { "entropy": 0.7611789051443338, "epoch": 1.4512912519191954, "grad_norm": 0.16716627776622772, "learning_rate": 5.1626951268132614e-05, "loss": 0.7671, "mean_token_accuracy": 0.7684641852974892, "num_tokens": 503450046.0, "step": 15774 }, { "entropy": 0.5615000538527966, "epoch": 1.4513832582906367, "grad_norm": 0.14921335875988007, "learning_rate": 5.162388444199099e-05, "loss": 0.55, "mean_token_accuracy": 0.8258992470800877, "num_tokens": 503482056.0, "step": 15775 }, { "entropy": 0.5529997097328305, "epoch": 1.4514752646620779, "grad_norm": 0.16251875460147858, "learning_rate": 5.162081761584936e-05, "loss": 0.5326, "mean_token_accuracy": 0.8344514258205891, "num_tokens": 503513757.0, "step": 15776 }, { "entropy": 0.551959065720439, "epoch": 1.451567271033519, "grad_norm": 0.15023227035999298, "learning_rate": 5.161775078970773e-05, "loss": 0.5412, "mean_token_accuracy": 0.8327785842120647, "num_tokens": 503544749.0, "step": 15777 }, { "entropy": 0.7472381414845586, "epoch": 1.4516592774049604, "grad_norm": 0.16714227199554443, "learning_rate": 5.161468396356611e-05, "loss": 0.7315, "mean_token_accuracy": 0.7807230353355408, "num_tokens": 503576672.0, "step": 15778 }, { "entropy": 0.5037945955991745, "epoch": 1.4517512837764015, "grad_norm": 0.145772323012352, "learning_rate": 5.161161713742448e-05, "loss": 0.4913, "mean_token_accuracy": 0.8458196744322777, "num_tokens": 503608779.0, "step": 15779 }, { "entropy": 0.7220970178022981, "epoch": 1.4518432901478429, "grad_norm": 0.1616988629102707, "learning_rate": 5.1608550311282856e-05, "loss": 0.719, "mean_token_accuracy": 0.7842064686119556, "num_tokens": 503640970.0, "step": 15780 }, { "entropy": 0.5943058654665947, "epoch": 1.451935296519284, "grad_norm": 0.15329048037528992, "learning_rate": 5.160548348514122e-05, "loss": 0.5887, "mean_token_accuracy": 0.8155795261263847, "num_tokens": 503673443.0, "step": 15781 }, { "entropy": 0.5263654887676239, "epoch": 1.4520273028907251, "grad_norm": 0.1561894565820694, "learning_rate": 5.160241665899961e-05, "loss": 0.5086, "mean_token_accuracy": 0.8429156020283699, "num_tokens": 503705448.0, "step": 15782 }, { "entropy": 0.5677182897925377, "epoch": 1.4521193092621665, "grad_norm": 0.15173101425170898, "learning_rate": 5.159934983285798e-05, "loss": 0.5604, "mean_token_accuracy": 0.82490274310112, "num_tokens": 503737236.0, "step": 15783 }, { "entropy": 0.5604721121490002, "epoch": 1.4522113156336076, "grad_norm": 0.15027062594890594, "learning_rate": 5.159628300671635e-05, "loss": 0.547, "mean_token_accuracy": 0.8314025439321995, "num_tokens": 503769822.0, "step": 15784 }, { "entropy": 0.5153427459299564, "epoch": 1.452303322005049, "grad_norm": 0.14916911721229553, "learning_rate": 5.159321618057472e-05, "loss": 0.505, "mean_token_accuracy": 0.8414570689201355, "num_tokens": 503801988.0, "step": 15785 }, { "entropy": 0.679119520355016, "epoch": 1.45239532837649, "grad_norm": 0.15985755622386932, "learning_rate": 5.15901493544331e-05, "loss": 0.671, "mean_token_accuracy": 0.7940322794020176, "num_tokens": 503834286.0, "step": 15786 }, { "entropy": 0.7503518015146255, "epoch": 1.4524873347479312, "grad_norm": 0.1691657155752182, "learning_rate": 5.158708252829148e-05, "loss": 0.7503, "mean_token_accuracy": 0.7682212144136429, "num_tokens": 503865713.0, "step": 15787 }, { "entropy": 0.6978887263685465, "epoch": 1.4525793411193726, "grad_norm": 0.15969353914260864, "learning_rate": 5.1584015702149846e-05, "loss": 0.69, "mean_token_accuracy": 0.7887703403830528, "num_tokens": 503897925.0, "step": 15788 }, { "entropy": 0.7337517719715834, "epoch": 1.4526713474908137, "grad_norm": 0.17235659062862396, "learning_rate": 5.1580948876008214e-05, "loss": 0.7171, "mean_token_accuracy": 0.7853335216641426, "num_tokens": 503929531.0, "step": 15789 }, { "entropy": 0.6871141269803047, "epoch": 1.452763353862255, "grad_norm": 0.1625438779592514, "learning_rate": 5.15778820498666e-05, "loss": 0.6793, "mean_token_accuracy": 0.7939862608909607, "num_tokens": 503960973.0, "step": 15790 }, { "entropy": 0.5529995488468558, "epoch": 1.4528553602336962, "grad_norm": 0.15305835008621216, "learning_rate": 5.157481522372497e-05, "loss": 0.5229, "mean_token_accuracy": 0.8352208025753498, "num_tokens": 503992012.0, "step": 15791 }, { "entropy": 0.7236314807087183, "epoch": 1.4529473666051373, "grad_norm": 0.1714264303445816, "learning_rate": 5.1571748397583344e-05, "loss": 0.7099, "mean_token_accuracy": 0.7859515883028507, "num_tokens": 504023896.0, "step": 15792 }, { "entropy": 0.5942583531141281, "epoch": 1.4530393729765787, "grad_norm": 0.1522926539182663, "learning_rate": 5.156868157144171e-05, "loss": 0.5784, "mean_token_accuracy": 0.8237128257751465, "num_tokens": 504056055.0, "step": 15793 }, { "entropy": 0.6862996853888035, "epoch": 1.4531313793480198, "grad_norm": 0.16716104745864868, "learning_rate": 5.1565614745300094e-05, "loss": 0.6859, "mean_token_accuracy": 0.7949174866080284, "num_tokens": 504087518.0, "step": 15794 }, { "entropy": 0.5311277466826141, "epoch": 1.4532233857194612, "grad_norm": 0.14790713787078857, "learning_rate": 5.156254791915847e-05, "loss": 0.5295, "mean_token_accuracy": 0.8377847969532013, "num_tokens": 504119132.0, "step": 15795 }, { "entropy": 0.5403058603405952, "epoch": 1.4533153920909023, "grad_norm": 0.15611770749092102, "learning_rate": 5.1559481093016836e-05, "loss": 0.5196, "mean_token_accuracy": 0.8410667218267918, "num_tokens": 504150468.0, "step": 15796 }, { "entropy": 0.7092645540833473, "epoch": 1.4534073984623435, "grad_norm": 0.1616283506155014, "learning_rate": 5.155641426687521e-05, "loss": 0.6943, "mean_token_accuracy": 0.7882866151630878, "num_tokens": 504181860.0, "step": 15797 }, { "entropy": 0.5907447086647153, "epoch": 1.4534994048337848, "grad_norm": 0.15358573198318481, "learning_rate": 5.155334744073359e-05, "loss": 0.5678, "mean_token_accuracy": 0.8232538625597954, "num_tokens": 504213565.0, "step": 15798 }, { "entropy": 0.548805695027113, "epoch": 1.453591411205226, "grad_norm": 0.15003728866577148, "learning_rate": 5.155028061459196e-05, "loss": 0.5313, "mean_token_accuracy": 0.8341030813753605, "num_tokens": 504244611.0, "step": 15799 }, { "entropy": 0.7239287691190839, "epoch": 1.4536834175766673, "grad_norm": 0.16481515765190125, "learning_rate": 5.1547213788450335e-05, "loss": 0.707, "mean_token_accuracy": 0.7841576151549816, "num_tokens": 504275569.0, "step": 15800 }, { "entropy": 0.613507951144129, "epoch": 1.4537754239481084, "grad_norm": 0.16017155349254608, "learning_rate": 5.15441469623087e-05, "loss": 0.5967, "mean_token_accuracy": 0.8151057697832584, "num_tokens": 504307822.0, "step": 15801 }, { "entropy": 0.6481163026764989, "epoch": 1.4538674303195496, "grad_norm": 0.1700168251991272, "learning_rate": 5.1541080136167084e-05, "loss": 0.6421, "mean_token_accuracy": 0.8070324324071407, "num_tokens": 504339014.0, "step": 15802 }, { "entropy": 0.6571158617734909, "epoch": 1.453959436690991, "grad_norm": 0.16184751689434052, "learning_rate": 5.153801331002546e-05, "loss": 0.6506, "mean_token_accuracy": 0.8003628067672253, "num_tokens": 504371409.0, "step": 15803 }, { "entropy": 0.6139889019541442, "epoch": 1.454051443062432, "grad_norm": 0.1573951691389084, "learning_rate": 5.153494648388383e-05, "loss": 0.606, "mean_token_accuracy": 0.8151005804538727, "num_tokens": 504402380.0, "step": 15804 }, { "entropy": 0.6613219324499369, "epoch": 1.4541434494338734, "grad_norm": 0.1627090871334076, "learning_rate": 5.153187965774221e-05, "loss": 0.6615, "mean_token_accuracy": 0.8010417334735394, "num_tokens": 504433769.0, "step": 15805 }, { "entropy": 0.6188844237476587, "epoch": 1.4542354558053145, "grad_norm": 0.151238352060318, "learning_rate": 5.152881283160058e-05, "loss": 0.6068, "mean_token_accuracy": 0.8115369379520416, "num_tokens": 504465772.0, "step": 15806 }, { "entropy": 0.5570871066302061, "epoch": 1.4543274621767557, "grad_norm": 0.15971580147743225, "learning_rate": 5.152574600545895e-05, "loss": 0.5322, "mean_token_accuracy": 0.8331260941922665, "num_tokens": 504497320.0, "step": 15807 }, { "entropy": 0.598905717022717, "epoch": 1.454419468548197, "grad_norm": 0.16426445543766022, "learning_rate": 5.1522679179317325e-05, "loss": 0.5851, "mean_token_accuracy": 0.8211383894085884, "num_tokens": 504528406.0, "step": 15808 }, { "entropy": 0.6246505249291658, "epoch": 1.4545114749196382, "grad_norm": 0.1550159454345703, "learning_rate": 5.151961235317571e-05, "loss": 0.6167, "mean_token_accuracy": 0.8123116828501225, "num_tokens": 504560625.0, "step": 15809 }, { "entropy": 0.6150377001613379, "epoch": 1.4546034812910795, "grad_norm": 0.16279752552509308, "learning_rate": 5.1516545527034075e-05, "loss": 0.6056, "mean_token_accuracy": 0.8183284513652325, "num_tokens": 504591676.0, "step": 15810 }, { "entropy": 0.6116444766521454, "epoch": 1.4546954876625207, "grad_norm": 0.16338807344436646, "learning_rate": 5.151347870089245e-05, "loss": 0.5984, "mean_token_accuracy": 0.8120118901133537, "num_tokens": 504622332.0, "step": 15811 }, { "entropy": 0.5603195666335523, "epoch": 1.4547874940339618, "grad_norm": 0.1419735848903656, "learning_rate": 5.151041187475082e-05, "loss": 0.5512, "mean_token_accuracy": 0.8283580094575882, "num_tokens": 504654544.0, "step": 15812 }, { "entropy": 0.6557175843045115, "epoch": 1.4548795004054031, "grad_norm": 0.15831224620342255, "learning_rate": 5.15073450486092e-05, "loss": 0.6427, "mean_token_accuracy": 0.8027049489319324, "num_tokens": 504686779.0, "step": 15813 }, { "entropy": 0.6289523188024759, "epoch": 1.4549715067768443, "grad_norm": 0.15706782042980194, "learning_rate": 5.150427822246757e-05, "loss": 0.6243, "mean_token_accuracy": 0.8102222979068756, "num_tokens": 504719182.0, "step": 15814 }, { "entropy": 0.687131161801517, "epoch": 1.4550635131482856, "grad_norm": 0.16247442364692688, "learning_rate": 5.150121139632594e-05, "loss": 0.6778, "mean_token_accuracy": 0.8010516874492168, "num_tokens": 504751746.0, "step": 15815 }, { "entropy": 0.6256302110850811, "epoch": 1.4551555195197268, "grad_norm": 0.16106535494327545, "learning_rate": 5.1498144570184316e-05, "loss": 0.618, "mean_token_accuracy": 0.8099383600056171, "num_tokens": 504783489.0, "step": 15816 }, { "entropy": 0.5273675890639424, "epoch": 1.455247525891168, "grad_norm": 0.14637644588947296, "learning_rate": 5.14950777440427e-05, "loss": 0.5228, "mean_token_accuracy": 0.8386023044586182, "num_tokens": 504815674.0, "step": 15817 }, { "entropy": 0.5409243507310748, "epoch": 1.4553395322626093, "grad_norm": 0.15350952744483948, "learning_rate": 5.1492010917901065e-05, "loss": 0.5325, "mean_token_accuracy": 0.8370373770594597, "num_tokens": 504846879.0, "step": 15818 }, { "entropy": 0.6405602409504354, "epoch": 1.4554315386340504, "grad_norm": 0.15845870971679688, "learning_rate": 5.148894409175944e-05, "loss": 0.6271, "mean_token_accuracy": 0.8025601245462894, "num_tokens": 504877760.0, "step": 15819 }, { "entropy": 0.5666216262616217, "epoch": 1.4555235450054917, "grad_norm": 0.15690977871418, "learning_rate": 5.148587726561781e-05, "loss": 0.5511, "mean_token_accuracy": 0.8303386941552162, "num_tokens": 504910294.0, "step": 15820 }, { "entropy": 0.6157129406929016, "epoch": 1.4556155513769329, "grad_norm": 0.15824569761753082, "learning_rate": 5.148281043947619e-05, "loss": 0.6096, "mean_token_accuracy": 0.809375885874033, "num_tokens": 504942376.0, "step": 15821 }, { "entropy": 0.6679643336683512, "epoch": 1.455707557748374, "grad_norm": 0.15827225148677826, "learning_rate": 5.1479743613334564e-05, "loss": 0.6508, "mean_token_accuracy": 0.7997612990438938, "num_tokens": 504973403.0, "step": 15822 }, { "entropy": 0.7346063051372766, "epoch": 1.4557995641198154, "grad_norm": 0.16567164659500122, "learning_rate": 5.147667678719293e-05, "loss": 0.7319, "mean_token_accuracy": 0.7809737510979176, "num_tokens": 505005232.0, "step": 15823 }, { "entropy": 0.461185545893386, "epoch": 1.4558915704912565, "grad_norm": 0.14391493797302246, "learning_rate": 5.1473609961051306e-05, "loss": 0.4519, "mean_token_accuracy": 0.8584975004196167, "num_tokens": 505036827.0, "step": 15824 }, { "entropy": 0.6930051436647773, "epoch": 1.4559835768626979, "grad_norm": 0.16557596623897552, "learning_rate": 5.147054313490969e-05, "loss": 0.6841, "mean_token_accuracy": 0.7921140864491463, "num_tokens": 505068822.0, "step": 15825 }, { "entropy": 0.6910206992179155, "epoch": 1.456075583234139, "grad_norm": 0.1653420776128769, "learning_rate": 5.146747630876806e-05, "loss": 0.6644, "mean_token_accuracy": 0.7981648109853268, "num_tokens": 505100273.0, "step": 15826 }, { "entropy": 0.5796243846416473, "epoch": 1.4561675896055801, "grad_norm": 0.15690977871418, "learning_rate": 5.146440948262643e-05, "loss": 0.5768, "mean_token_accuracy": 0.8215974122285843, "num_tokens": 505132417.0, "step": 15827 }, { "entropy": 0.5493333516642451, "epoch": 1.4562595959770215, "grad_norm": 0.15755823254585266, "learning_rate": 5.14613426564848e-05, "loss": 0.5379, "mean_token_accuracy": 0.8315065167844296, "num_tokens": 505163831.0, "step": 15828 }, { "entropy": 0.5097054736688733, "epoch": 1.4563516023484626, "grad_norm": 0.14849476516246796, "learning_rate": 5.1458275830343186e-05, "loss": 0.4893, "mean_token_accuracy": 0.8504113145172596, "num_tokens": 505195292.0, "step": 15829 }, { "entropy": 0.6903154784813523, "epoch": 1.456443608719904, "grad_norm": 0.16186966001987457, "learning_rate": 5.1455209004201554e-05, "loss": 0.6752, "mean_token_accuracy": 0.7988710254430771, "num_tokens": 505226868.0, "step": 15830 }, { "entropy": 0.6446634046733379, "epoch": 1.456535615091345, "grad_norm": 0.16838961839675903, "learning_rate": 5.145214217805993e-05, "loss": 0.6426, "mean_token_accuracy": 0.8052138909697533, "num_tokens": 505259555.0, "step": 15831 }, { "entropy": 0.5559707204811275, "epoch": 1.4566276214627862, "grad_norm": 0.16011936962604523, "learning_rate": 5.144907535191831e-05, "loss": 0.5352, "mean_token_accuracy": 0.8348453268408775, "num_tokens": 505290638.0, "step": 15832 }, { "entropy": 0.6177871022373438, "epoch": 1.4567196278342276, "grad_norm": 0.1533050537109375, "learning_rate": 5.144600852577668e-05, "loss": 0.5966, "mean_token_accuracy": 0.8182569816708565, "num_tokens": 505322269.0, "step": 15833 }, { "entropy": 0.6733123809099197, "epoch": 1.4568116342056687, "grad_norm": 0.15860141813755035, "learning_rate": 5.144294169963505e-05, "loss": 0.6637, "mean_token_accuracy": 0.7984003387391567, "num_tokens": 505354696.0, "step": 15834 }, { "entropy": 0.6748689655214548, "epoch": 1.45690364057711, "grad_norm": 0.16394269466400146, "learning_rate": 5.143987487349342e-05, "loss": 0.6653, "mean_token_accuracy": 0.7980838716030121, "num_tokens": 505386967.0, "step": 15835 }, { "entropy": 0.5356528637930751, "epoch": 1.4569956469485512, "grad_norm": 0.146586611866951, "learning_rate": 5.14368080473518e-05, "loss": 0.5172, "mean_token_accuracy": 0.8429821282625198, "num_tokens": 505419595.0, "step": 15836 }, { "entropy": 0.557378988713026, "epoch": 1.4570876533199923, "grad_norm": 0.1470826268196106, "learning_rate": 5.1433741221210177e-05, "loss": 0.5456, "mean_token_accuracy": 0.8295264802873135, "num_tokens": 505451244.0, "step": 15837 }, { "entropy": 0.6041176486760378, "epoch": 1.4571796596914337, "grad_norm": 0.16320112347602844, "learning_rate": 5.1430674395068544e-05, "loss": 0.5954, "mean_token_accuracy": 0.8187270946800709, "num_tokens": 505483569.0, "step": 15838 }, { "entropy": 0.5649297889322042, "epoch": 1.4572716660628748, "grad_norm": 0.1577875316143036, "learning_rate": 5.142760756892692e-05, "loss": 0.5404, "mean_token_accuracy": 0.8319936394691467, "num_tokens": 505515815.0, "step": 15839 }, { "entropy": 0.7161605507135391, "epoch": 1.4573636724343162, "grad_norm": 0.17125515639781952, "learning_rate": 5.14245407427853e-05, "loss": 0.7061, "mean_token_accuracy": 0.783320177346468, "num_tokens": 505546492.0, "step": 15840 }, { "entropy": 0.5979152633808553, "epoch": 1.4574556788057573, "grad_norm": 0.15191560983657837, "learning_rate": 5.142147391664367e-05, "loss": 0.5779, "mean_token_accuracy": 0.8228286132216454, "num_tokens": 505578093.0, "step": 15841 }, { "entropy": 0.584631685167551, "epoch": 1.4575476851771985, "grad_norm": 0.1584203988313675, "learning_rate": 5.141840709050204e-05, "loss": 0.5798, "mean_token_accuracy": 0.8217008970677853, "num_tokens": 505609720.0, "step": 15842 }, { "entropy": 0.567213524132967, "epoch": 1.4576396915486398, "grad_norm": 0.1484849900007248, "learning_rate": 5.141534026436041e-05, "loss": 0.5458, "mean_token_accuracy": 0.831494614481926, "num_tokens": 505641665.0, "step": 15843 }, { "entropy": 0.5800243690609932, "epoch": 1.457731697920081, "grad_norm": 0.15931539237499237, "learning_rate": 5.141227343821879e-05, "loss": 0.5726, "mean_token_accuracy": 0.8252805843949318, "num_tokens": 505673680.0, "step": 15844 }, { "entropy": 0.5434837117791176, "epoch": 1.4578237042915223, "grad_norm": 0.14991740882396698, "learning_rate": 5.140920661207717e-05, "loss": 0.5385, "mean_token_accuracy": 0.8346811942756176, "num_tokens": 505705801.0, "step": 15845 }, { "entropy": 0.6168646300211549, "epoch": 1.4579157106629634, "grad_norm": 0.1568572074174881, "learning_rate": 5.1406139785935535e-05, "loss": 0.6133, "mean_token_accuracy": 0.8119605109095573, "num_tokens": 505738202.0, "step": 15846 }, { "entropy": 0.5380668547004461, "epoch": 1.4580077170344046, "grad_norm": 0.14694033563137054, "learning_rate": 5.140307295979391e-05, "loss": 0.5259, "mean_token_accuracy": 0.8381116054952145, "num_tokens": 505770894.0, "step": 15847 }, { "entropy": 0.6736534461379051, "epoch": 1.458099723405846, "grad_norm": 0.1662304848432541, "learning_rate": 5.140000613365229e-05, "loss": 0.6759, "mean_token_accuracy": 0.79625129327178, "num_tokens": 505803356.0, "step": 15848 }, { "entropy": 0.513797047547996, "epoch": 1.458191729777287, "grad_norm": 0.15537405014038086, "learning_rate": 5.139693930751066e-05, "loss": 0.5036, "mean_token_accuracy": 0.8449638411402702, "num_tokens": 505835518.0, "step": 15849 }, { "entropy": 0.5998875610530376, "epoch": 1.4582837361487284, "grad_norm": 0.1554698497056961, "learning_rate": 5.1393872481369033e-05, "loss": 0.5917, "mean_token_accuracy": 0.8202530555427074, "num_tokens": 505868014.0, "step": 15850 }, { "entropy": 0.6695145908743143, "epoch": 1.4583757425201695, "grad_norm": 0.1600845456123352, "learning_rate": 5.13908056552274e-05, "loss": 0.6536, "mean_token_accuracy": 0.8010216504335403, "num_tokens": 505900292.0, "step": 15851 }, { "entropy": 0.6367033161222935, "epoch": 1.4584677488916107, "grad_norm": 0.15665361285209656, "learning_rate": 5.138773882908578e-05, "loss": 0.6161, "mean_token_accuracy": 0.8059038333594799, "num_tokens": 505932041.0, "step": 15852 }, { "entropy": 0.5068095037713647, "epoch": 1.458559755263052, "grad_norm": 0.13997673988342285, "learning_rate": 5.138467200294416e-05, "loss": 0.4942, "mean_token_accuracy": 0.8457505740225315, "num_tokens": 505964229.0, "step": 15853 }, { "entropy": 0.587566529167816, "epoch": 1.4586517616344932, "grad_norm": 0.15159448981285095, "learning_rate": 5.1381605176802525e-05, "loss": 0.568, "mean_token_accuracy": 0.8278598673641682, "num_tokens": 505996465.0, "step": 15854 }, { "entropy": 0.5910827554762363, "epoch": 1.4587437680059345, "grad_norm": 0.16499090194702148, "learning_rate": 5.13785383506609e-05, "loss": 0.575, "mean_token_accuracy": 0.8262392170727253, "num_tokens": 506027602.0, "step": 15855 }, { "entropy": 0.5550304455682635, "epoch": 1.4588357743773757, "grad_norm": 0.14802969992160797, "learning_rate": 5.137547152451928e-05, "loss": 0.5267, "mean_token_accuracy": 0.8364850953221321, "num_tokens": 506059420.0, "step": 15856 }, { "entropy": 0.5645258743315935, "epoch": 1.4589277807488168, "grad_norm": 0.1559331715106964, "learning_rate": 5.137240469837765e-05, "loss": 0.5697, "mean_token_accuracy": 0.8213145323097706, "num_tokens": 506091049.0, "step": 15857 }, { "entropy": 0.6131428759545088, "epoch": 1.4590197871202581, "grad_norm": 0.14935249090194702, "learning_rate": 5.1369337872236024e-05, "loss": 0.5935, "mean_token_accuracy": 0.8179425336420536, "num_tokens": 506123180.0, "step": 15858 }, { "entropy": 0.5099128559231758, "epoch": 1.4591117934916993, "grad_norm": 0.14392879605293274, "learning_rate": 5.136627104609439e-05, "loss": 0.4863, "mean_token_accuracy": 0.8480139747262001, "num_tokens": 506155233.0, "step": 15859 }, { "entropy": 0.5218269471079111, "epoch": 1.4592037998631406, "grad_norm": 0.1432790607213974, "learning_rate": 5.136320421995277e-05, "loss": 0.512, "mean_token_accuracy": 0.8399169258773327, "num_tokens": 506187356.0, "step": 15860 }, { "entropy": 0.5702369371429086, "epoch": 1.4592958062345818, "grad_norm": 0.14906342327594757, "learning_rate": 5.136013739381115e-05, "loss": 0.553, "mean_token_accuracy": 0.8294149897992611, "num_tokens": 506220124.0, "step": 15861 }, { "entropy": 0.5777165957260877, "epoch": 1.459387812606023, "grad_norm": 0.15072770416736603, "learning_rate": 5.1357070567669516e-05, "loss": 0.5584, "mean_token_accuracy": 0.8280680030584335, "num_tokens": 506252434.0, "step": 15862 }, { "entropy": 0.5393446944653988, "epoch": 1.4594798189774643, "grad_norm": 0.15146751701831818, "learning_rate": 5.1354003741527904e-05, "loss": 0.5318, "mean_token_accuracy": 0.836260337382555, "num_tokens": 506283829.0, "step": 15863 }, { "entropy": 0.5661842375993729, "epoch": 1.4595718253489054, "grad_norm": 0.1539762169122696, "learning_rate": 5.135093691538627e-05, "loss": 0.5581, "mean_token_accuracy": 0.8261567838490009, "num_tokens": 506316018.0, "step": 15864 }, { "entropy": 0.5697293244302273, "epoch": 1.4596638317203467, "grad_norm": 0.15349815785884857, "learning_rate": 5.134787008924464e-05, "loss": 0.5597, "mean_token_accuracy": 0.8317884914577007, "num_tokens": 506348425.0, "step": 15865 }, { "entropy": 0.5902610635384917, "epoch": 1.4597558380917879, "grad_norm": 0.15944841504096985, "learning_rate": 5.1344803263103014e-05, "loss": 0.5841, "mean_token_accuracy": 0.822501502931118, "num_tokens": 506380758.0, "step": 15866 }, { "entropy": 0.7174284979701042, "epoch": 1.459847844463229, "grad_norm": 0.16837261617183685, "learning_rate": 5.1341736436961396e-05, "loss": 0.7083, "mean_token_accuracy": 0.7874757014214993, "num_tokens": 506412031.0, "step": 15867 }, { "entropy": 0.6727189049124718, "epoch": 1.4599398508346704, "grad_norm": 0.16429097950458527, "learning_rate": 5.133866961081977e-05, "loss": 0.6688, "mean_token_accuracy": 0.7965656667947769, "num_tokens": 506444636.0, "step": 15868 }, { "entropy": 0.656867902725935, "epoch": 1.4600318572061115, "grad_norm": 0.16187843680381775, "learning_rate": 5.133560278467814e-05, "loss": 0.6557, "mean_token_accuracy": 0.7988658733665943, "num_tokens": 506475958.0, "step": 15869 }, { "entropy": 0.641137408092618, "epoch": 1.4601238635775529, "grad_norm": 0.1613541543483734, "learning_rate": 5.133253595853651e-05, "loss": 0.6427, "mean_token_accuracy": 0.8019476421177387, "num_tokens": 506508415.0, "step": 15870 }, { "entropy": 0.5807381700724363, "epoch": 1.460215869948994, "grad_norm": 0.15647581219673157, "learning_rate": 5.1329469132394894e-05, "loss": 0.5721, "mean_token_accuracy": 0.8255370333790779, "num_tokens": 506540030.0, "step": 15871 }, { "entropy": 0.663539320230484, "epoch": 1.4603078763204351, "grad_norm": 0.164651557803154, "learning_rate": 5.132640230625326e-05, "loss": 0.6519, "mean_token_accuracy": 0.799929678440094, "num_tokens": 506571434.0, "step": 15872 }, { "entropy": 0.5751142017543316, "epoch": 1.4603998826918765, "grad_norm": 0.15299898386001587, "learning_rate": 5.132333548011164e-05, "loss": 0.55, "mean_token_accuracy": 0.8313946537673473, "num_tokens": 506602953.0, "step": 15873 }, { "entropy": 0.755827846005559, "epoch": 1.4604918890633176, "grad_norm": 0.16542436182498932, "learning_rate": 5.1320268653970005e-05, "loss": 0.7502, "mean_token_accuracy": 0.7736002020537853, "num_tokens": 506634743.0, "step": 15874 }, { "entropy": 0.5940661076456308, "epoch": 1.460583895434759, "grad_norm": 0.15204912424087524, "learning_rate": 5.1317201827828386e-05, "loss": 0.5777, "mean_token_accuracy": 0.8232545331120491, "num_tokens": 506665902.0, "step": 15875 }, { "entropy": 0.6186506003141403, "epoch": 1.4606759018062, "grad_norm": 0.16324126720428467, "learning_rate": 5.131413500168676e-05, "loss": 0.6142, "mean_token_accuracy": 0.809911098331213, "num_tokens": 506697861.0, "step": 15876 }, { "entropy": 0.6764592863619328, "epoch": 1.4607679081776412, "grad_norm": 0.16672943532466888, "learning_rate": 5.131106817554513e-05, "loss": 0.6734, "mean_token_accuracy": 0.8000675216317177, "num_tokens": 506728948.0, "step": 15877 }, { "entropy": 0.6605377439409494, "epoch": 1.4608599145490826, "grad_norm": 0.161664679646492, "learning_rate": 5.13080013494035e-05, "loss": 0.6499, "mean_token_accuracy": 0.8030348867177963, "num_tokens": 506760518.0, "step": 15878 }, { "entropy": 0.5585836749523878, "epoch": 1.4609519209205237, "grad_norm": 0.16382937133312225, "learning_rate": 5.1304934523261885e-05, "loss": 0.5521, "mean_token_accuracy": 0.830992329865694, "num_tokens": 506792138.0, "step": 15879 }, { "entropy": 0.6054228637367487, "epoch": 1.461043927291965, "grad_norm": 0.1555086225271225, "learning_rate": 5.130186769712025e-05, "loss": 0.5991, "mean_token_accuracy": 0.8154040686786175, "num_tokens": 506824083.0, "step": 15880 }, { "entropy": 0.5608537802472711, "epoch": 1.4611359336634062, "grad_norm": 0.14924824237823486, "learning_rate": 5.129880087097863e-05, "loss": 0.5371, "mean_token_accuracy": 0.8295242227613926, "num_tokens": 506856310.0, "step": 15881 }, { "entropy": 0.6515063736587763, "epoch": 1.4612279400348474, "grad_norm": 0.15614445507526398, "learning_rate": 5.1295734044836995e-05, "loss": 0.6493, "mean_token_accuracy": 0.8017243072390556, "num_tokens": 506888067.0, "step": 15882 }, { "entropy": 0.6853741817176342, "epoch": 1.4613199464062887, "grad_norm": 0.16151225566864014, "learning_rate": 5.1292667218695376e-05, "loss": 0.6769, "mean_token_accuracy": 0.7948987483978271, "num_tokens": 506919567.0, "step": 15883 }, { "entropy": 0.7005405994132161, "epoch": 1.4614119527777298, "grad_norm": 0.16857722401618958, "learning_rate": 5.128960039255375e-05, "loss": 0.6921, "mean_token_accuracy": 0.7861473746597767, "num_tokens": 506951570.0, "step": 15884 }, { "entropy": 0.5420658821240067, "epoch": 1.4615039591491712, "grad_norm": 0.1490577757358551, "learning_rate": 5.128653356641212e-05, "loss": 0.539, "mean_token_accuracy": 0.8309638909995556, "num_tokens": 506983658.0, "step": 15885 }, { "entropy": 0.6203089444898069, "epoch": 1.4615959655206123, "grad_norm": 0.15342701971530914, "learning_rate": 5.1283466740270494e-05, "loss": 0.6133, "mean_token_accuracy": 0.8117764964699745, "num_tokens": 507015644.0, "step": 15886 }, { "entropy": 0.731168707832694, "epoch": 1.4616879718920535, "grad_norm": 0.16821454465389252, "learning_rate": 5.1280399914128875e-05, "loss": 0.721, "mean_token_accuracy": 0.782596729695797, "num_tokens": 507046634.0, "step": 15887 }, { "entropy": 0.6473845429718494, "epoch": 1.4617799782634948, "grad_norm": 0.15607880055904388, "learning_rate": 5.127733308798724e-05, "loss": 0.6374, "mean_token_accuracy": 0.8090558983385563, "num_tokens": 507079069.0, "step": 15888 }, { "entropy": 0.5996034829877317, "epoch": 1.461871984634936, "grad_norm": 0.14889118075370789, "learning_rate": 5.127426626184562e-05, "loss": 0.5842, "mean_token_accuracy": 0.8186839483678341, "num_tokens": 507111088.0, "step": 15889 }, { "entropy": 0.5632627909071743, "epoch": 1.4619639910063773, "grad_norm": 0.1545657068490982, "learning_rate": 5.1271199435703985e-05, "loss": 0.5516, "mean_token_accuracy": 0.8321934565901756, "num_tokens": 507143856.0, "step": 15890 }, { "entropy": 0.6417528819292784, "epoch": 1.4620559973778184, "grad_norm": 0.15693001449108124, "learning_rate": 5.126813260956237e-05, "loss": 0.6268, "mean_token_accuracy": 0.8073729947209358, "num_tokens": 507176258.0, "step": 15891 }, { "entropy": 0.5787632949650288, "epoch": 1.4621480037492596, "grad_norm": 0.16075432300567627, "learning_rate": 5.126506578342074e-05, "loss": 0.5768, "mean_token_accuracy": 0.8255566656589508, "num_tokens": 507207049.0, "step": 15892 }, { "entropy": 0.5611402369104326, "epoch": 1.462240010120701, "grad_norm": 0.1523512601852417, "learning_rate": 5.126199895727911e-05, "loss": 0.5441, "mean_token_accuracy": 0.8340384438633919, "num_tokens": 507239804.0, "step": 15893 }, { "entropy": 0.5347157400101423, "epoch": 1.462332016492142, "grad_norm": 0.15350501239299774, "learning_rate": 5.125893213113749e-05, "loss": 0.5285, "mean_token_accuracy": 0.8310201279819012, "num_tokens": 507271542.0, "step": 15894 }, { "entropy": 0.64595468621701, "epoch": 1.4624240228635834, "grad_norm": 0.15967440605163574, "learning_rate": 5.1255865304995865e-05, "loss": 0.636, "mean_token_accuracy": 0.8042149841785431, "num_tokens": 507303096.0, "step": 15895 }, { "entropy": 0.5754511058330536, "epoch": 1.4625160292350246, "grad_norm": 0.1511564552783966, "learning_rate": 5.125279847885423e-05, "loss": 0.5574, "mean_token_accuracy": 0.8291707336902618, "num_tokens": 507335864.0, "step": 15896 }, { "entropy": 0.6354533703997731, "epoch": 1.4626080356064657, "grad_norm": 0.1588154286146164, "learning_rate": 5.124973165271261e-05, "loss": 0.6214, "mean_token_accuracy": 0.8080038875341415, "num_tokens": 507368172.0, "step": 15897 }, { "entropy": 0.623896487057209, "epoch": 1.462700041977907, "grad_norm": 0.1621084362268448, "learning_rate": 5.124666482657099e-05, "loss": 0.6256, "mean_token_accuracy": 0.8121611550450325, "num_tokens": 507399474.0, "step": 15898 }, { "entropy": 0.6759926620870829, "epoch": 1.4627920483493482, "grad_norm": 0.1654987335205078, "learning_rate": 5.124359800042936e-05, "loss": 0.6626, "mean_token_accuracy": 0.7972207553684711, "num_tokens": 507431409.0, "step": 15899 }, { "entropy": 0.6005591936409473, "epoch": 1.4628840547207895, "grad_norm": 0.15742768347263336, "learning_rate": 5.124053117428773e-05, "loss": 0.5977, "mean_token_accuracy": 0.8185376636683941, "num_tokens": 507463592.0, "step": 15900 }, { "entropy": 0.623132417909801, "epoch": 1.4629760610922307, "grad_norm": 0.1573338359594345, "learning_rate": 5.12374643481461e-05, "loss": 0.6089, "mean_token_accuracy": 0.810604490339756, "num_tokens": 507495859.0, "step": 15901 }, { "entropy": 0.7386713214218616, "epoch": 1.4630680674636718, "grad_norm": 0.16260655224323273, "learning_rate": 5.123439752200449e-05, "loss": 0.7444, "mean_token_accuracy": 0.7782795242965221, "num_tokens": 507528299.0, "step": 15902 }, { "entropy": 0.5181692084297538, "epoch": 1.4631600738351132, "grad_norm": 0.15056835114955902, "learning_rate": 5.1231330695862856e-05, "loss": 0.512, "mean_token_accuracy": 0.8441139571368694, "num_tokens": 507560390.0, "step": 15903 }, { "entropy": 0.6403921484015882, "epoch": 1.4632520802065543, "grad_norm": 0.15617486834526062, "learning_rate": 5.1228263869721224e-05, "loss": 0.621, "mean_token_accuracy": 0.8068017065525055, "num_tokens": 507591381.0, "step": 15904 }, { "entropy": 0.5861259996891022, "epoch": 1.4633440865779956, "grad_norm": 0.15513966977596283, "learning_rate": 5.12251970435796e-05, "loss": 0.5753, "mean_token_accuracy": 0.8237701132893562, "num_tokens": 507623418.0, "step": 15905 }, { "entropy": 0.5946513283997774, "epoch": 1.4634360929494368, "grad_norm": 0.159029021859169, "learning_rate": 5.122213021743798e-05, "loss": 0.5854, "mean_token_accuracy": 0.8179615139961243, "num_tokens": 507655204.0, "step": 15906 }, { "entropy": 0.5997709846124053, "epoch": 1.463528099320878, "grad_norm": 0.1523367315530777, "learning_rate": 5.1219063391296354e-05, "loss": 0.586, "mean_token_accuracy": 0.8195608854293823, "num_tokens": 507687357.0, "step": 15907 }, { "entropy": 0.47903452813625336, "epoch": 1.4636201056923193, "grad_norm": 0.14307361841201782, "learning_rate": 5.121599656515472e-05, "loss": 0.4755, "mean_token_accuracy": 0.8509043790400028, "num_tokens": 507719899.0, "step": 15908 }, { "entropy": 0.5412639458663762, "epoch": 1.4637121120637604, "grad_norm": 0.14707843959331512, "learning_rate": 5.121292973901309e-05, "loss": 0.5256, "mean_token_accuracy": 0.8385359011590481, "num_tokens": 507752514.0, "step": 15909 }, { "entropy": 0.6435603313148022, "epoch": 1.4638041184352018, "grad_norm": 0.1646440625190735, "learning_rate": 5.120986291287148e-05, "loss": 0.641, "mean_token_accuracy": 0.8079498670995235, "num_tokens": 507784369.0, "step": 15910 }, { "entropy": 0.5567183243110776, "epoch": 1.4638961248066429, "grad_norm": 0.15615710616111755, "learning_rate": 5.1206796086729846e-05, "loss": 0.55, "mean_token_accuracy": 0.8297693580389023, "num_tokens": 507816469.0, "step": 15911 }, { "entropy": 0.6658146195113659, "epoch": 1.463988131178084, "grad_norm": 0.16090849041938782, "learning_rate": 5.120372926058822e-05, "loss": 0.659, "mean_token_accuracy": 0.7993878871202469, "num_tokens": 507848573.0, "step": 15912 }, { "entropy": 0.6205844096839428, "epoch": 1.4640801375495254, "grad_norm": 0.1543278843164444, "learning_rate": 5.120066243444659e-05, "loss": 0.6117, "mean_token_accuracy": 0.8120178543031216, "num_tokens": 507881185.0, "step": 15913 }, { "entropy": 0.6350229803938419, "epoch": 1.4641721439209665, "grad_norm": 0.16436268389225006, "learning_rate": 5.119759560830497e-05, "loss": 0.6172, "mean_token_accuracy": 0.8106080517172813, "num_tokens": 507912764.0, "step": 15914 }, { "entropy": 0.6670551989227533, "epoch": 1.4642641502924079, "grad_norm": 0.15635280311107635, "learning_rate": 5.1194528782163345e-05, "loss": 0.6489, "mean_token_accuracy": 0.799011580646038, "num_tokens": 507944909.0, "step": 15915 }, { "entropy": 0.5817303247749805, "epoch": 1.464356156663849, "grad_norm": 0.15498532354831696, "learning_rate": 5.119146195602171e-05, "loss": 0.5697, "mean_token_accuracy": 0.8226425684988499, "num_tokens": 507976186.0, "step": 15916 }, { "entropy": 0.6852188371121883, "epoch": 1.4644481630352901, "grad_norm": 0.16456769406795502, "learning_rate": 5.118839512988009e-05, "loss": 0.6767, "mean_token_accuracy": 0.795818917453289, "num_tokens": 508008018.0, "step": 15917 }, { "entropy": 0.5696108546108007, "epoch": 1.4645401694067315, "grad_norm": 0.15294642746448517, "learning_rate": 5.118532830373847e-05, "loss": 0.5521, "mean_token_accuracy": 0.8296087235212326, "num_tokens": 508040710.0, "step": 15918 }, { "entropy": 0.6282053710892797, "epoch": 1.4646321757781726, "grad_norm": 0.15326738357543945, "learning_rate": 5.118226147759684e-05, "loss": 0.6039, "mean_token_accuracy": 0.8118971362709999, "num_tokens": 508071379.0, "step": 15919 }, { "entropy": 0.6287098852917552, "epoch": 1.464724182149614, "grad_norm": 0.1523112952709198, "learning_rate": 5.117919465145521e-05, "loss": 0.6209, "mean_token_accuracy": 0.8126650415360928, "num_tokens": 508103694.0, "step": 15920 }, { "entropy": 0.6035135718993843, "epoch": 1.464816188521055, "grad_norm": 0.15889933705329895, "learning_rate": 5.117612782531358e-05, "loss": 0.5998, "mean_token_accuracy": 0.8184774555265903, "num_tokens": 508135561.0, "step": 15921 }, { "entropy": 0.5903111677616835, "epoch": 1.4649081948924962, "grad_norm": 0.15381459891796112, "learning_rate": 5.117306099917196e-05, "loss": 0.5742, "mean_token_accuracy": 0.8235205970704556, "num_tokens": 508166995.0, "step": 15922 }, { "entropy": 0.6698893941938877, "epoch": 1.4650002012639376, "grad_norm": 0.16782407462596893, "learning_rate": 5.1169994173030335e-05, "loss": 0.6722, "mean_token_accuracy": 0.7961210086941719, "num_tokens": 508198963.0, "step": 15923 }, { "entropy": 0.7107939198613167, "epoch": 1.4650922076353787, "grad_norm": 0.16866366565227509, "learning_rate": 5.11669273468887e-05, "loss": 0.719, "mean_token_accuracy": 0.782434731721878, "num_tokens": 508231075.0, "step": 15924 }, { "entropy": 0.5295754526741803, "epoch": 1.46518421400682, "grad_norm": 0.15860974788665771, "learning_rate": 5.1163860520747085e-05, "loss": 0.5357, "mean_token_accuracy": 0.840716477483511, "num_tokens": 508262583.0, "step": 15925 }, { "entropy": 0.6167087499052286, "epoch": 1.4652762203782612, "grad_norm": 0.15992256999015808, "learning_rate": 5.116079369460546e-05, "loss": 0.6217, "mean_token_accuracy": 0.8117366880178452, "num_tokens": 508295351.0, "step": 15926 }, { "entropy": 0.6505383774638176, "epoch": 1.4653682267497024, "grad_norm": 0.15997202694416046, "learning_rate": 5.115772686846383e-05, "loss": 0.6452, "mean_token_accuracy": 0.8068117648363113, "num_tokens": 508327527.0, "step": 15927 }, { "entropy": 0.574298856779933, "epoch": 1.4654602331211437, "grad_norm": 0.15693914890289307, "learning_rate": 5.11546600423222e-05, "loss": 0.5711, "mean_token_accuracy": 0.825566753745079, "num_tokens": 508359472.0, "step": 15928 }, { "entropy": 0.5562572106719017, "epoch": 1.4655522394925848, "grad_norm": 0.1485726684331894, "learning_rate": 5.115159321618058e-05, "loss": 0.5573, "mean_token_accuracy": 0.8288935907185078, "num_tokens": 508390840.0, "step": 15929 }, { "entropy": 0.5935538774356246, "epoch": 1.4656442458640262, "grad_norm": 0.15970315039157867, "learning_rate": 5.114852639003895e-05, "loss": 0.5685, "mean_token_accuracy": 0.8263090029358864, "num_tokens": 508422509.0, "step": 15930 }, { "entropy": 0.6148797497153282, "epoch": 1.4657362522354673, "grad_norm": 0.15710654854774475, "learning_rate": 5.1145459563897326e-05, "loss": 0.5917, "mean_token_accuracy": 0.8173316419124603, "num_tokens": 508453925.0, "step": 15931 }, { "entropy": 0.7273372150957584, "epoch": 1.4658282586069085, "grad_norm": 0.16064032912254333, "learning_rate": 5.1142392737755694e-05, "loss": 0.6943, "mean_token_accuracy": 0.7874250113964081, "num_tokens": 508485732.0, "step": 15932 }, { "entropy": 0.6659738477319479, "epoch": 1.4659202649783498, "grad_norm": 0.15378761291503906, "learning_rate": 5.1139325911614075e-05, "loss": 0.6463, "mean_token_accuracy": 0.805313166230917, "num_tokens": 508518415.0, "step": 15933 }, { "entropy": 0.6446541715413332, "epoch": 1.466012271349791, "grad_norm": 0.16106048226356506, "learning_rate": 5.113625908547245e-05, "loss": 0.6432, "mean_token_accuracy": 0.8029591739177704, "num_tokens": 508549441.0, "step": 15934 }, { "entropy": 0.5932256700471044, "epoch": 1.4661042777212323, "grad_norm": 0.15495772659778595, "learning_rate": 5.113319225933082e-05, "loss": 0.5732, "mean_token_accuracy": 0.8232782036066055, "num_tokens": 508580811.0, "step": 15935 }, { "entropy": 0.6811099937185645, "epoch": 1.4661962840926734, "grad_norm": 0.16076351702213287, "learning_rate": 5.113012543318919e-05, "loss": 0.6682, "mean_token_accuracy": 0.7932293638586998, "num_tokens": 508611685.0, "step": 15936 }, { "entropy": 0.6073485780507326, "epoch": 1.4662882904641146, "grad_norm": 0.15786060690879822, "learning_rate": 5.1127058607047574e-05, "loss": 0.6061, "mean_token_accuracy": 0.8145323134958744, "num_tokens": 508643151.0, "step": 15937 }, { "entropy": 0.6549968738108873, "epoch": 1.466380296835556, "grad_norm": 0.1625804305076599, "learning_rate": 5.112399178090594e-05, "loss": 0.6592, "mean_token_accuracy": 0.7974734865128994, "num_tokens": 508675769.0, "step": 15938 }, { "entropy": 0.570815050508827, "epoch": 1.466472303206997, "grad_norm": 0.15215975046157837, "learning_rate": 5.1120924954764316e-05, "loss": 0.5689, "mean_token_accuracy": 0.8239960819482803, "num_tokens": 508707642.0, "step": 15939 }, { "entropy": 0.6717222342267632, "epoch": 1.4665643095784384, "grad_norm": 0.1613398790359497, "learning_rate": 5.1117858128622684e-05, "loss": 0.6625, "mean_token_accuracy": 0.7990337871015072, "num_tokens": 508739207.0, "step": 15940 }, { "entropy": 0.6019633989781141, "epoch": 1.4666563159498796, "grad_norm": 0.15876072645187378, "learning_rate": 5.111479130248107e-05, "loss": 0.5934, "mean_token_accuracy": 0.816921204328537, "num_tokens": 508770369.0, "step": 15941 }, { "entropy": 0.5599199552088976, "epoch": 1.4667483223213207, "grad_norm": 0.15733402967453003, "learning_rate": 5.111172447633944e-05, "loss": 0.5527, "mean_token_accuracy": 0.8252818956971169, "num_tokens": 508802159.0, "step": 15942 }, { "entropy": 0.5548652671277523, "epoch": 1.466840328692762, "grad_norm": 0.14915278553962708, "learning_rate": 5.110865765019781e-05, "loss": 0.5321, "mean_token_accuracy": 0.8338733501732349, "num_tokens": 508833623.0, "step": 15943 }, { "entropy": 0.5427144030109048, "epoch": 1.4669323350642032, "grad_norm": 0.14849120378494263, "learning_rate": 5.110559082405618e-05, "loss": 0.5184, "mean_token_accuracy": 0.838168278336525, "num_tokens": 508865365.0, "step": 15944 }, { "entropy": 0.6662249490618706, "epoch": 1.4670243414356445, "grad_norm": 0.15243838727474213, "learning_rate": 5.1102523997914564e-05, "loss": 0.6476, "mean_token_accuracy": 0.8041662648320198, "num_tokens": 508896985.0, "step": 15945 }, { "entropy": 0.7024514507502317, "epoch": 1.4671163478070857, "grad_norm": 0.16752123832702637, "learning_rate": 5.109945717177294e-05, "loss": 0.6846, "mean_token_accuracy": 0.7895078100264072, "num_tokens": 508929406.0, "step": 15946 }, { "entropy": 0.562535974662751, "epoch": 1.4672083541785268, "grad_norm": 0.15031246840953827, "learning_rate": 5.1096390345631306e-05, "loss": 0.541, "mean_token_accuracy": 0.8310008123517036, "num_tokens": 508960731.0, "step": 15947 }, { "entropy": 0.5863947980105877, "epoch": 1.4673003605499682, "grad_norm": 0.16005833446979523, "learning_rate": 5.1093323519489674e-05, "loss": 0.5736, "mean_token_accuracy": 0.8218329772353172, "num_tokens": 508992088.0, "step": 15948 }, { "entropy": 0.7189249880611897, "epoch": 1.4673923669214093, "grad_norm": 0.16434045135974884, "learning_rate": 5.109025669334806e-05, "loss": 0.7147, "mean_token_accuracy": 0.7825240902602673, "num_tokens": 509023952.0, "step": 15949 }, { "entropy": 0.6591387633234262, "epoch": 1.4674843732928506, "grad_norm": 0.15799911320209503, "learning_rate": 5.108718986720643e-05, "loss": 0.6577, "mean_token_accuracy": 0.8013168349862099, "num_tokens": 509055416.0, "step": 15950 }, { "entropy": 0.6902538705617189, "epoch": 1.4675763796642918, "grad_norm": 0.16323047876358032, "learning_rate": 5.1084123041064805e-05, "loss": 0.6797, "mean_token_accuracy": 0.7958275489509106, "num_tokens": 509088052.0, "step": 15951 }, { "entropy": 0.5717755653895438, "epoch": 1.467668386035733, "grad_norm": 0.15130029618740082, "learning_rate": 5.108105621492317e-05, "loss": 0.5582, "mean_token_accuracy": 0.8267852738499641, "num_tokens": 509119960.0, "step": 15952 }, { "entropy": 0.586000083014369, "epoch": 1.4677603924071743, "grad_norm": 0.15720263123512268, "learning_rate": 5.1077989388781554e-05, "loss": 0.5877, "mean_token_accuracy": 0.8192725032567978, "num_tokens": 509151889.0, "step": 15953 }, { "entropy": 0.6936807502061129, "epoch": 1.4678523987786154, "grad_norm": 0.16561627388000488, "learning_rate": 5.107492256263993e-05, "loss": 0.689, "mean_token_accuracy": 0.7905058898031712, "num_tokens": 509183722.0, "step": 15954 }, { "entropy": 0.5746378148905933, "epoch": 1.4679444051500568, "grad_norm": 0.14689065515995026, "learning_rate": 5.10718557364983e-05, "loss": 0.562, "mean_token_accuracy": 0.8312898389995098, "num_tokens": 509216434.0, "step": 15955 }, { "entropy": 0.6550695169717073, "epoch": 1.4680364115214979, "grad_norm": 0.16188980638980865, "learning_rate": 5.106878891035668e-05, "loss": 0.6547, "mean_token_accuracy": 0.7995774522423744, "num_tokens": 509248672.0, "step": 15956 }, { "entropy": 0.5881237601861358, "epoch": 1.468128417892939, "grad_norm": 0.15113408863544464, "learning_rate": 5.106572208421505e-05, "loss": 0.5812, "mean_token_accuracy": 0.8226920031011105, "num_tokens": 509280684.0, "step": 15957 }, { "entropy": 0.6656683813780546, "epoch": 1.4682204242643804, "grad_norm": 0.16587373614311218, "learning_rate": 5.106265525807342e-05, "loss": 0.6554, "mean_token_accuracy": 0.8009638376533985, "num_tokens": 509311810.0, "step": 15958 }, { "entropy": 0.6488853311166167, "epoch": 1.4683124306358215, "grad_norm": 0.15786142647266388, "learning_rate": 5.1059588431931795e-05, "loss": 0.6447, "mean_token_accuracy": 0.8087005540728569, "num_tokens": 509343782.0, "step": 15959 }, { "entropy": 0.5177758997306228, "epoch": 1.4684044370072629, "grad_norm": 0.14818821847438812, "learning_rate": 5.105652160579018e-05, "loss": 0.4939, "mean_token_accuracy": 0.8512648604810238, "num_tokens": 509375506.0, "step": 15960 }, { "entropy": 0.5873172865249217, "epoch": 1.468496443378704, "grad_norm": 0.1477336883544922, "learning_rate": 5.1053454779648545e-05, "loss": 0.5767, "mean_token_accuracy": 0.8233020901679993, "num_tokens": 509408084.0, "step": 15961 }, { "entropy": 0.5765517605468631, "epoch": 1.4685884497501451, "grad_norm": 0.1597055047750473, "learning_rate": 5.105038795350692e-05, "loss": 0.5592, "mean_token_accuracy": 0.8249683901667595, "num_tokens": 509439284.0, "step": 15962 }, { "entropy": 0.604067524895072, "epoch": 1.4686804561215865, "grad_norm": 0.15576283633708954, "learning_rate": 5.104732112736529e-05, "loss": 0.601, "mean_token_accuracy": 0.8150692209601402, "num_tokens": 509470735.0, "step": 15963 }, { "entropy": 0.5154793094843626, "epoch": 1.4687724624930276, "grad_norm": 0.16475552320480347, "learning_rate": 5.104425430122367e-05, "loss": 0.5113, "mean_token_accuracy": 0.84091891720891, "num_tokens": 509502542.0, "step": 15964 }, { "entropy": 0.5347779858857393, "epoch": 1.468864468864469, "grad_norm": 0.15549896657466888, "learning_rate": 5.104118747508204e-05, "loss": 0.5147, "mean_token_accuracy": 0.8442765027284622, "num_tokens": 509534595.0, "step": 15965 }, { "entropy": 0.5990712493658066, "epoch": 1.46895647523591, "grad_norm": 0.16095127165317535, "learning_rate": 5.103812064894041e-05, "loss": 0.5678, "mean_token_accuracy": 0.823313545435667, "num_tokens": 509566785.0, "step": 15966 }, { "entropy": 0.6539916750043631, "epoch": 1.4690484816073512, "grad_norm": 0.15690496563911438, "learning_rate": 5.1035053822798786e-05, "loss": 0.6394, "mean_token_accuracy": 0.8025204688310623, "num_tokens": 509599131.0, "step": 15967 }, { "entropy": 0.6282392889261246, "epoch": 1.4691404879787926, "grad_norm": 0.15658795833587646, "learning_rate": 5.103198699665717e-05, "loss": 0.6219, "mean_token_accuracy": 0.8044080771505833, "num_tokens": 509630622.0, "step": 15968 }, { "entropy": 0.6111203841865063, "epoch": 1.4692324943502337, "grad_norm": 0.16632325947284698, "learning_rate": 5.1028920170515535e-05, "loss": 0.5945, "mean_token_accuracy": 0.8187356255948544, "num_tokens": 509662115.0, "step": 15969 }, { "entropy": 0.7127977106720209, "epoch": 1.469324500721675, "grad_norm": 0.15941132605075836, "learning_rate": 5.102585334437391e-05, "loss": 0.7112, "mean_token_accuracy": 0.7837253920733929, "num_tokens": 509694789.0, "step": 15970 }, { "entropy": 0.5910996943712234, "epoch": 1.4694165070931162, "grad_norm": 0.15133225917816162, "learning_rate": 5.102278651823228e-05, "loss": 0.5933, "mean_token_accuracy": 0.8196336217224598, "num_tokens": 509726881.0, "step": 15971 }, { "entropy": 0.616640951950103, "epoch": 1.4695085134645574, "grad_norm": 0.16347061097621918, "learning_rate": 5.101971969209066e-05, "loss": 0.6212, "mean_token_accuracy": 0.8136050850152969, "num_tokens": 509758813.0, "step": 15972 }, { "entropy": 0.7275374457240105, "epoch": 1.4696005198359987, "grad_norm": 0.16148822009563446, "learning_rate": 5.1016652865949034e-05, "loss": 0.718, "mean_token_accuracy": 0.7791686505079269, "num_tokens": 509790672.0, "step": 15973 }, { "entropy": 0.5749047603458166, "epoch": 1.4696925262074398, "grad_norm": 0.16265623271465302, "learning_rate": 5.10135860398074e-05, "loss": 0.5601, "mean_token_accuracy": 0.8300409391522408, "num_tokens": 509822416.0, "step": 15974 }, { "entropy": 0.6293880557641387, "epoch": 1.4697845325788812, "grad_norm": 0.15264296531677246, "learning_rate": 5.1010519213665776e-05, "loss": 0.6295, "mean_token_accuracy": 0.806852214038372, "num_tokens": 509855069.0, "step": 15975 }, { "entropy": 0.6069798413664103, "epoch": 1.4698765389503223, "grad_norm": 0.1572076827287674, "learning_rate": 5.100745238752416e-05, "loss": 0.5928, "mean_token_accuracy": 0.8209596499800682, "num_tokens": 509886500.0, "step": 15976 }, { "entropy": 0.5654487647116184, "epoch": 1.4699685453217635, "grad_norm": 0.15272414684295654, "learning_rate": 5.1004385561382526e-05, "loss": 0.5682, "mean_token_accuracy": 0.8271587565541267, "num_tokens": 509918273.0, "step": 15977 }, { "entropy": 0.7084674704819918, "epoch": 1.4700605516932048, "grad_norm": 0.17020846903324127, "learning_rate": 5.10013187352409e-05, "loss": 0.6895, "mean_token_accuracy": 0.7890656590461731, "num_tokens": 509949272.0, "step": 15978 }, { "entropy": 0.7004134925082326, "epoch": 1.470152558064646, "grad_norm": 0.16177591681480408, "learning_rate": 5.099825190909927e-05, "loss": 0.6821, "mean_token_accuracy": 0.794464435428381, "num_tokens": 509981160.0, "step": 15979 }, { "entropy": 0.5840126178227365, "epoch": 1.4702445644360873, "grad_norm": 0.15505032241344452, "learning_rate": 5.099518508295765e-05, "loss": 0.5563, "mean_token_accuracy": 0.8232966065406799, "num_tokens": 510012983.0, "step": 15980 }, { "entropy": 0.7045270763337612, "epoch": 1.4703365708075284, "grad_norm": 0.1602136492729187, "learning_rate": 5.0992118256816024e-05, "loss": 0.6896, "mean_token_accuracy": 0.7881079167127609, "num_tokens": 510044806.0, "step": 15981 }, { "entropy": 0.6538307592272758, "epoch": 1.4704285771789696, "grad_norm": 0.1616784632205963, "learning_rate": 5.098905143067439e-05, "loss": 0.6414, "mean_token_accuracy": 0.8033874779939651, "num_tokens": 510076583.0, "step": 15982 }, { "entropy": 0.6799112348817289, "epoch": 1.470520583550411, "grad_norm": 0.16252058744430542, "learning_rate": 5.098598460453277e-05, "loss": 0.6666, "mean_token_accuracy": 0.7959653288125992, "num_tokens": 510107989.0, "step": 15983 }, { "entropy": 0.6512375194579363, "epoch": 1.470612589921852, "grad_norm": 0.16322055459022522, "learning_rate": 5.098291777839115e-05, "loss": 0.6305, "mean_token_accuracy": 0.8005880527198315, "num_tokens": 510138816.0, "step": 15984 }, { "entropy": 0.5621978202834725, "epoch": 1.4707045962932934, "grad_norm": 0.1498989462852478, "learning_rate": 5.097985095224952e-05, "loss": 0.5573, "mean_token_accuracy": 0.8287069238722324, "num_tokens": 510170480.0, "step": 15985 }, { "entropy": 0.6055818479508162, "epoch": 1.4707966026647346, "grad_norm": 0.15334175527095795, "learning_rate": 5.097678412610789e-05, "loss": 0.6, "mean_token_accuracy": 0.8172479085624218, "num_tokens": 510202397.0, "step": 15986 }, { "entropy": 0.777574323117733, "epoch": 1.4708886090361757, "grad_norm": 0.1651112288236618, "learning_rate": 5.097371729996627e-05, "loss": 0.7735, "mean_token_accuracy": 0.7686921395361423, "num_tokens": 510234555.0, "step": 15987 }, { "entropy": 0.6397453248500824, "epoch": 1.470980615407617, "grad_norm": 0.15385708212852478, "learning_rate": 5.097065047382465e-05, "loss": 0.6284, "mean_token_accuracy": 0.8051528781652451, "num_tokens": 510266636.0, "step": 15988 }, { "entropy": 0.5391913950443268, "epoch": 1.4710726217790582, "grad_norm": 0.14930851757526398, "learning_rate": 5.0967583647683015e-05, "loss": 0.5107, "mean_token_accuracy": 0.8419300727546215, "num_tokens": 510297455.0, "step": 15989 }, { "entropy": 0.6529263909906149, "epoch": 1.4711646281504995, "grad_norm": 0.15816810727119446, "learning_rate": 5.096451682154139e-05, "loss": 0.6453, "mean_token_accuracy": 0.806100819259882, "num_tokens": 510329315.0, "step": 15990 }, { "entropy": 0.5095427678897977, "epoch": 1.4712566345219407, "grad_norm": 0.14546532928943634, "learning_rate": 5.096144999539977e-05, "loss": 0.4926, "mean_token_accuracy": 0.8450485207140446, "num_tokens": 510361498.0, "step": 15991 }, { "entropy": 0.6180995274335146, "epoch": 1.4713486408933818, "grad_norm": 0.1589595526456833, "learning_rate": 5.095838316925814e-05, "loss": 0.6077, "mean_token_accuracy": 0.8121523484587669, "num_tokens": 510393363.0, "step": 15992 }, { "entropy": 0.5356566249392927, "epoch": 1.4714406472648232, "grad_norm": 0.146757572889328, "learning_rate": 5.095531634311651e-05, "loss": 0.5324, "mean_token_accuracy": 0.8386358022689819, "num_tokens": 510426131.0, "step": 15993 }, { "entropy": 0.7396923992782831, "epoch": 1.4715326536362643, "grad_norm": 0.17426709830760956, "learning_rate": 5.095224951697488e-05, "loss": 0.7373, "mean_token_accuracy": 0.7747406847774982, "num_tokens": 510457240.0, "step": 15994 }, { "entropy": 0.5260018771514297, "epoch": 1.4716246600077056, "grad_norm": 0.15518806874752045, "learning_rate": 5.094918269083326e-05, "loss": 0.5157, "mean_token_accuracy": 0.8431943282485008, "num_tokens": 510488833.0, "step": 15995 }, { "entropy": 0.6848260816186666, "epoch": 1.4717166663791468, "grad_norm": 0.15965278446674347, "learning_rate": 5.094611586469164e-05, "loss": 0.678, "mean_token_accuracy": 0.7973788529634476, "num_tokens": 510521030.0, "step": 15996 }, { "entropy": 0.5671626813709736, "epoch": 1.471808672750588, "grad_norm": 0.15450580418109894, "learning_rate": 5.0943049038550005e-05, "loss": 0.5495, "mean_token_accuracy": 0.8311156146228313, "num_tokens": 510552378.0, "step": 15997 }, { "entropy": 0.5645353021100163, "epoch": 1.4719006791220293, "grad_norm": 0.15685118734836578, "learning_rate": 5.093998221240838e-05, "loss": 0.5557, "mean_token_accuracy": 0.8306384198367596, "num_tokens": 510584725.0, "step": 15998 }, { "entropy": 0.5389210518915206, "epoch": 1.4719926854934704, "grad_norm": 0.1501077264547348, "learning_rate": 5.093691538626676e-05, "loss": 0.5252, "mean_token_accuracy": 0.834149856120348, "num_tokens": 510616401.0, "step": 15999 }, { "entropy": 0.6647173259407282, "epoch": 1.4720846918649118, "grad_norm": 0.16269034147262573, "learning_rate": 5.093384856012513e-05, "loss": 0.6523, "mean_token_accuracy": 0.7955413870513439, "num_tokens": 510648038.0, "step": 16000 }, { "entropy": 0.5823867348954082, "epoch": 1.4721766982363529, "grad_norm": 0.15429380536079407, "learning_rate": 5.0930781733983504e-05, "loss": 0.5614, "mean_token_accuracy": 0.826870072633028, "num_tokens": 510679887.0, "step": 16001 }, { "entropy": 0.7015952728688717, "epoch": 1.472268704607794, "grad_norm": 0.1657872200012207, "learning_rate": 5.092771490784187e-05, "loss": 0.6943, "mean_token_accuracy": 0.7862445376813412, "num_tokens": 510711239.0, "step": 16002 }, { "entropy": 0.7133355792611837, "epoch": 1.4723607109792354, "grad_norm": 0.16099214553833008, "learning_rate": 5.092464808170025e-05, "loss": 0.7111, "mean_token_accuracy": 0.7855964154005051, "num_tokens": 510743573.0, "step": 16003 }, { "entropy": 0.6791190537624061, "epoch": 1.4724527173506765, "grad_norm": 0.16803361475467682, "learning_rate": 5.092158125555863e-05, "loss": 0.668, "mean_token_accuracy": 0.796227939426899, "num_tokens": 510775354.0, "step": 16004 }, { "entropy": 0.6214567627757788, "epoch": 1.4725447237221179, "grad_norm": 0.15450800955295563, "learning_rate": 5.0918514429416995e-05, "loss": 0.612, "mean_token_accuracy": 0.8100589960813522, "num_tokens": 510808113.0, "step": 16005 }, { "entropy": 0.46473312890157104, "epoch": 1.472636730093559, "grad_norm": 0.15197256207466125, "learning_rate": 5.091544760327537e-05, "loss": 0.4514, "mean_token_accuracy": 0.8591911457479, "num_tokens": 510839780.0, "step": 16006 }, { "entropy": 0.5536595657467842, "epoch": 1.4727287364650001, "grad_norm": 0.1482667326927185, "learning_rate": 5.091238077713375e-05, "loss": 0.5335, "mean_token_accuracy": 0.8375285528600216, "num_tokens": 510871863.0, "step": 16007 }, { "entropy": 0.6084594111889601, "epoch": 1.4728207428364415, "grad_norm": 0.1580580174922943, "learning_rate": 5.090931395099212e-05, "loss": 0.5867, "mean_token_accuracy": 0.8172558955848217, "num_tokens": 510903624.0, "step": 16008 }, { "entropy": 0.5670912554487586, "epoch": 1.4729127492078826, "grad_norm": 0.15518389642238617, "learning_rate": 5.0906247124850494e-05, "loss": 0.5524, "mean_token_accuracy": 0.8283307924866676, "num_tokens": 510936198.0, "step": 16009 }, { "entropy": 0.5904342709109187, "epoch": 1.473004755579324, "grad_norm": 0.15387026965618134, "learning_rate": 5.090318029870886e-05, "loss": 0.5623, "mean_token_accuracy": 0.8237414881587029, "num_tokens": 510968892.0, "step": 16010 }, { "entropy": 0.7020953642204404, "epoch": 1.473096761950765, "grad_norm": 0.16638270020484924, "learning_rate": 5.090011347256724e-05, "loss": 0.7099, "mean_token_accuracy": 0.786855548620224, "num_tokens": 511000742.0, "step": 16011 }, { "entropy": 0.6071746572852135, "epoch": 1.4731887683222062, "grad_norm": 0.15898069739341736, "learning_rate": 5.089704664642562e-05, "loss": 0.5951, "mean_token_accuracy": 0.8167122006416321, "num_tokens": 511032802.0, "step": 16012 }, { "entropy": 0.6249652290716767, "epoch": 1.4732807746936476, "grad_norm": 0.16602225601673126, "learning_rate": 5.0893979820283986e-05, "loss": 0.6118, "mean_token_accuracy": 0.8130382895469666, "num_tokens": 511064356.0, "step": 16013 }, { "entropy": 0.5452067730948329, "epoch": 1.4733727810650887, "grad_norm": 0.15065303444862366, "learning_rate": 5.089091299414236e-05, "loss": 0.5347, "mean_token_accuracy": 0.8352636098861694, "num_tokens": 511096328.0, "step": 16014 }, { "entropy": 0.6050297697074711, "epoch": 1.47346478743653, "grad_norm": 0.1606193333864212, "learning_rate": 5.088784616800074e-05, "loss": 0.6049, "mean_token_accuracy": 0.8129940144717693, "num_tokens": 511128555.0, "step": 16015 }, { "entropy": 0.5676583878230304, "epoch": 1.4735567938079712, "grad_norm": 0.15260358154773712, "learning_rate": 5.088477934185911e-05, "loss": 0.5559, "mean_token_accuracy": 0.8301826417446136, "num_tokens": 511160926.0, "step": 16016 }, { "entropy": 0.5831018257886171, "epoch": 1.4736488001794124, "grad_norm": 0.15344996750354767, "learning_rate": 5.0881712515717484e-05, "loss": 0.5814, "mean_token_accuracy": 0.8259548880159855, "num_tokens": 511193018.0, "step": 16017 }, { "entropy": 0.47388966800644994, "epoch": 1.4737408065508537, "grad_norm": 0.15264129638671875, "learning_rate": 5.0878645689575866e-05, "loss": 0.468, "mean_token_accuracy": 0.8559945970773697, "num_tokens": 511225709.0, "step": 16018 }, { "entropy": 0.6918405573815107, "epoch": 1.4738328129222948, "grad_norm": 0.16826236248016357, "learning_rate": 5.0875578863434234e-05, "loss": 0.7002, "mean_token_accuracy": 0.786638006567955, "num_tokens": 511258062.0, "step": 16019 }, { "entropy": 0.6150410380214453, "epoch": 1.4739248192937362, "grad_norm": 0.15197192132472992, "learning_rate": 5.087251203729261e-05, "loss": 0.6001, "mean_token_accuracy": 0.8132493235170841, "num_tokens": 511289591.0, "step": 16020 }, { "entropy": 0.6398514490574598, "epoch": 1.4740168256651773, "grad_norm": 0.16062603890895844, "learning_rate": 5.0869445211150976e-05, "loss": 0.6389, "mean_token_accuracy": 0.8034036569297314, "num_tokens": 511321570.0, "step": 16021 }, { "entropy": 0.6207520607858896, "epoch": 1.4741088320366185, "grad_norm": 0.14865200221538544, "learning_rate": 5.0866378385009364e-05, "loss": 0.607, "mean_token_accuracy": 0.8098250441253185, "num_tokens": 511353746.0, "step": 16022 }, { "entropy": 0.5678999265655875, "epoch": 1.4742008384080598, "grad_norm": 0.15562909841537476, "learning_rate": 5.086331155886773e-05, "loss": 0.5612, "mean_token_accuracy": 0.8262464180588722, "num_tokens": 511385298.0, "step": 16023 }, { "entropy": 0.6963678542524576, "epoch": 1.474292844779501, "grad_norm": 0.16092480719089508, "learning_rate": 5.08602447327261e-05, "loss": 0.6704, "mean_token_accuracy": 0.7997297570109367, "num_tokens": 511417598.0, "step": 16024 }, { "entropy": 0.49863080494105816, "epoch": 1.4743848511509423, "grad_norm": 0.1501077562570572, "learning_rate": 5.0857177906584475e-05, "loss": 0.4932, "mean_token_accuracy": 0.8490837179124355, "num_tokens": 511449758.0, "step": 16025 }, { "entropy": 0.6100638774223626, "epoch": 1.4744768575223834, "grad_norm": 0.15779484808444977, "learning_rate": 5.0854111080442856e-05, "loss": 0.5868, "mean_token_accuracy": 0.8198613300919533, "num_tokens": 511481517.0, "step": 16026 }, { "entropy": 0.6425882475450635, "epoch": 1.4745688638938246, "grad_norm": 0.1600872278213501, "learning_rate": 5.085104425430123e-05, "loss": 0.6165, "mean_token_accuracy": 0.8086658120155334, "num_tokens": 511513038.0, "step": 16027 }, { "entropy": 0.5638876943849027, "epoch": 1.474660870265266, "grad_norm": 0.14394772052764893, "learning_rate": 5.08479774281596e-05, "loss": 0.5297, "mean_token_accuracy": 0.8352477364242077, "num_tokens": 511544797.0, "step": 16028 }, { "entropy": 0.5585115645080805, "epoch": 1.474752876636707, "grad_norm": 0.15672047436237335, "learning_rate": 5.084491060201797e-05, "loss": 0.5669, "mean_token_accuracy": 0.8278173692524433, "num_tokens": 511576930.0, "step": 16029 }, { "entropy": 0.5890337750315666, "epoch": 1.4748448830081484, "grad_norm": 0.1583382487297058, "learning_rate": 5.0841843775876355e-05, "loss": 0.5881, "mean_token_accuracy": 0.8203676752746105, "num_tokens": 511608743.0, "step": 16030 }, { "entropy": 0.5282049048691988, "epoch": 1.4749368893795896, "grad_norm": 0.14596010744571686, "learning_rate": 5.083877694973472e-05, "loss": 0.5056, "mean_token_accuracy": 0.8455988317728043, "num_tokens": 511641278.0, "step": 16031 }, { "entropy": 0.5050257137045264, "epoch": 1.4750288957510307, "grad_norm": 0.14993366599082947, "learning_rate": 5.08357101235931e-05, "loss": 0.4926, "mean_token_accuracy": 0.844811350107193, "num_tokens": 511673170.0, "step": 16032 }, { "entropy": 0.654677658341825, "epoch": 1.475120902122472, "grad_norm": 0.16142508387565613, "learning_rate": 5.0832643297451465e-05, "loss": 0.6561, "mean_token_accuracy": 0.8024044185876846, "num_tokens": 511705375.0, "step": 16033 }, { "entropy": 0.5171549543738365, "epoch": 1.4752129084939132, "grad_norm": 0.15596584975719452, "learning_rate": 5.0829576471309847e-05, "loss": 0.512, "mean_token_accuracy": 0.8416088931262493, "num_tokens": 511737342.0, "step": 16034 }, { "entropy": 0.7229429110884666, "epoch": 1.4753049148653545, "grad_norm": 0.16646341979503632, "learning_rate": 5.082650964516822e-05, "loss": 0.7233, "mean_token_accuracy": 0.7824760861694813, "num_tokens": 511769254.0, "step": 16035 }, { "entropy": 0.6285952590405941, "epoch": 1.4753969212367957, "grad_norm": 0.16415785253047943, "learning_rate": 5.082344281902659e-05, "loss": 0.6305, "mean_token_accuracy": 0.812701515853405, "num_tokens": 511801186.0, "step": 16036 }, { "entropy": 0.6511784130707383, "epoch": 1.4754889276082368, "grad_norm": 0.16272473335266113, "learning_rate": 5.0820375992884964e-05, "loss": 0.6345, "mean_token_accuracy": 0.8063649721443653, "num_tokens": 511833141.0, "step": 16037 }, { "entropy": 0.5512428961228579, "epoch": 1.4755809339796782, "grad_norm": 0.15701092779636383, "learning_rate": 5.0817309166743345e-05, "loss": 0.5405, "mean_token_accuracy": 0.8345290571451187, "num_tokens": 511864640.0, "step": 16038 }, { "entropy": 0.5422277469187975, "epoch": 1.4756729403511193, "grad_norm": 0.15512889623641968, "learning_rate": 5.081424234060171e-05, "loss": 0.5362, "mean_token_accuracy": 0.8341970667243004, "num_tokens": 511896822.0, "step": 16039 }, { "entropy": 0.6271087545901537, "epoch": 1.4757649467225606, "grad_norm": 0.15699146687984467, "learning_rate": 5.081117551446009e-05, "loss": 0.6194, "mean_token_accuracy": 0.8096061125397682, "num_tokens": 511929429.0, "step": 16040 }, { "entropy": 0.5825403584167361, "epoch": 1.4758569530940018, "grad_norm": 0.14764384925365448, "learning_rate": 5.0808108688318456e-05, "loss": 0.5576, "mean_token_accuracy": 0.8274793215095997, "num_tokens": 511961680.0, "step": 16041 }, { "entropy": 0.5429397313855588, "epoch": 1.475948959465443, "grad_norm": 0.1588088721036911, "learning_rate": 5.080504186217684e-05, "loss": 0.5246, "mean_token_accuracy": 0.8343306295573711, "num_tokens": 511993587.0, "step": 16042 }, { "entropy": 0.6923926752060652, "epoch": 1.4760409658368843, "grad_norm": 0.16473114490509033, "learning_rate": 5.080197503603521e-05, "loss": 0.6882, "mean_token_accuracy": 0.7864477150142193, "num_tokens": 512025187.0, "step": 16043 }, { "entropy": 0.6878744028508663, "epoch": 1.4761329722083254, "grad_norm": 0.16651350259780884, "learning_rate": 5.079890820989358e-05, "loss": 0.6781, "mean_token_accuracy": 0.7937735691666603, "num_tokens": 512056849.0, "step": 16044 }, { "entropy": 0.596764157526195, "epoch": 1.4762249785797668, "grad_norm": 0.15020789206027985, "learning_rate": 5.0795841383751954e-05, "loss": 0.5808, "mean_token_accuracy": 0.824017234146595, "num_tokens": 512089610.0, "step": 16045 }, { "entropy": 0.6227611498907208, "epoch": 1.476316984951208, "grad_norm": 0.16003867983818054, "learning_rate": 5.0792774557610336e-05, "loss": 0.6113, "mean_token_accuracy": 0.8089326582849026, "num_tokens": 512121094.0, "step": 16046 }, { "entropy": 0.6221178816631436, "epoch": 1.476408991322649, "grad_norm": 0.16766490042209625, "learning_rate": 5.0789707731468703e-05, "loss": 0.6161, "mean_token_accuracy": 0.8108029216527939, "num_tokens": 512152750.0, "step": 16047 }, { "entropy": 0.6618838608264923, "epoch": 1.4765009976940904, "grad_norm": 0.1642068773508072, "learning_rate": 5.078664090532708e-05, "loss": 0.6663, "mean_token_accuracy": 0.8000991269946098, "num_tokens": 512184684.0, "step": 16048 }, { "entropy": 0.6490077897906303, "epoch": 1.4765930040655315, "grad_norm": 0.1613558977842331, "learning_rate": 5.078357407918546e-05, "loss": 0.6423, "mean_token_accuracy": 0.7987562902271748, "num_tokens": 512216742.0, "step": 16049 }, { "entropy": 0.6791489291936159, "epoch": 1.4766850104369729, "grad_norm": 0.15518581867218018, "learning_rate": 5.078050725304383e-05, "loss": 0.6723, "mean_token_accuracy": 0.7968743406236172, "num_tokens": 512248880.0, "step": 16050 }, { "entropy": 0.5941023956984282, "epoch": 1.476777016808414, "grad_norm": 0.16363653540611267, "learning_rate": 5.07774404269022e-05, "loss": 0.592, "mean_token_accuracy": 0.8207066580653191, "num_tokens": 512280632.0, "step": 16051 }, { "entropy": 0.572066280990839, "epoch": 1.4768690231798551, "grad_norm": 0.15602664649486542, "learning_rate": 5.077437360076057e-05, "loss": 0.5566, "mean_token_accuracy": 0.8286199532449245, "num_tokens": 512311971.0, "step": 16052 }, { "entropy": 0.6454997677356005, "epoch": 1.4769610295512965, "grad_norm": 0.1588660180568695, "learning_rate": 5.077130677461895e-05, "loss": 0.6317, "mean_token_accuracy": 0.8055740147829056, "num_tokens": 512343501.0, "step": 16053 }, { "entropy": 0.48423856403678656, "epoch": 1.4770530359227376, "grad_norm": 0.14541518688201904, "learning_rate": 5.0768239948477326e-05, "loss": 0.4725, "mean_token_accuracy": 0.8547562509775162, "num_tokens": 512375561.0, "step": 16054 }, { "entropy": 0.5898207849822938, "epoch": 1.477145042294179, "grad_norm": 0.150970458984375, "learning_rate": 5.0765173122335694e-05, "loss": 0.5872, "mean_token_accuracy": 0.823562853038311, "num_tokens": 512408157.0, "step": 16055 }, { "entropy": 0.7079749908298254, "epoch": 1.4772370486656201, "grad_norm": 0.16034115850925446, "learning_rate": 5.076210629619407e-05, "loss": 0.6855, "mean_token_accuracy": 0.7925847694277763, "num_tokens": 512439815.0, "step": 16056 }, { "entropy": 0.5237994166091084, "epoch": 1.4773290550370612, "grad_norm": 0.1529180109500885, "learning_rate": 5.075903947005245e-05, "loss": 0.5152, "mean_token_accuracy": 0.8371656984090805, "num_tokens": 512472084.0, "step": 16057 }, { "entropy": 0.46568831615149975, "epoch": 1.4774210614085026, "grad_norm": 0.14589619636535645, "learning_rate": 5.075597264391082e-05, "loss": 0.4462, "mean_token_accuracy": 0.8580259084701538, "num_tokens": 512503273.0, "step": 16058 }, { "entropy": 0.5404984978958964, "epoch": 1.4775130677799437, "grad_norm": 0.15153701603412628, "learning_rate": 5.075290581776919e-05, "loss": 0.518, "mean_token_accuracy": 0.8395073115825653, "num_tokens": 512534853.0, "step": 16059 }, { "entropy": 0.6163366592954844, "epoch": 1.477605074151385, "grad_norm": 0.15242986381053925, "learning_rate": 5.074983899162756e-05, "loss": 0.5988, "mean_token_accuracy": 0.8160647936165333, "num_tokens": 512566802.0, "step": 16060 }, { "entropy": 0.6118268673308194, "epoch": 1.4776970805228262, "grad_norm": 0.1565944403409958, "learning_rate": 5.074677216548595e-05, "loss": 0.5913, "mean_token_accuracy": 0.8207729794085026, "num_tokens": 512598256.0, "step": 16061 }, { "entropy": 0.5668819807469845, "epoch": 1.4777890868942674, "grad_norm": 0.15182992815971375, "learning_rate": 5.0743705339344316e-05, "loss": 0.5519, "mean_token_accuracy": 0.8271508291363716, "num_tokens": 512630580.0, "step": 16062 }, { "entropy": 0.5890184305608273, "epoch": 1.4778810932657087, "grad_norm": 0.16358181834220886, "learning_rate": 5.0740638513202684e-05, "loss": 0.5727, "mean_token_accuracy": 0.8246911019086838, "num_tokens": 512661820.0, "step": 16063 }, { "entropy": 0.5608248431235552, "epoch": 1.4779730996371498, "grad_norm": 0.1584094911813736, "learning_rate": 5.073757168706106e-05, "loss": 0.5535, "mean_token_accuracy": 0.8348924070596695, "num_tokens": 512693032.0, "step": 16064 }, { "entropy": 0.6138962786644697, "epoch": 1.4780651060085912, "grad_norm": 0.16663378477096558, "learning_rate": 5.073450486091944e-05, "loss": 0.6135, "mean_token_accuracy": 0.8158909045159817, "num_tokens": 512724965.0, "step": 16065 }, { "entropy": 0.5944944024085999, "epoch": 1.4781571123800323, "grad_norm": 0.15987341105937958, "learning_rate": 5.0731438034777815e-05, "loss": 0.5909, "mean_token_accuracy": 0.8195530250668526, "num_tokens": 512757326.0, "step": 16066 }, { "entropy": 0.6159391161054373, "epoch": 1.4782491187514735, "grad_norm": 0.1619202047586441, "learning_rate": 5.072837120863618e-05, "loss": 0.595, "mean_token_accuracy": 0.8175023347139359, "num_tokens": 512789001.0, "step": 16067 }, { "entropy": 0.6353000123053789, "epoch": 1.4783411251229148, "grad_norm": 0.16055789589881897, "learning_rate": 5.072530438249455e-05, "loss": 0.6242, "mean_token_accuracy": 0.8119189999997616, "num_tokens": 512820589.0, "step": 16068 }, { "entropy": 0.6006145514547825, "epoch": 1.478433131494356, "grad_norm": 0.15889111161231995, "learning_rate": 5.072223755635294e-05, "loss": 0.6075, "mean_token_accuracy": 0.8136765323579311, "num_tokens": 512853128.0, "step": 16069 }, { "entropy": 0.613546334207058, "epoch": 1.4785251378657973, "grad_norm": 0.15619328618049622, "learning_rate": 5.071917073021131e-05, "loss": 0.6004, "mean_token_accuracy": 0.8172740526497364, "num_tokens": 512884786.0, "step": 16070 }, { "entropy": 0.6926618032157421, "epoch": 1.4786171442372384, "grad_norm": 0.16801555454730988, "learning_rate": 5.071610390406968e-05, "loss": 0.6948, "mean_token_accuracy": 0.7904590852558613, "num_tokens": 512916550.0, "step": 16071 }, { "entropy": 0.49046480376273394, "epoch": 1.4787091506086796, "grad_norm": 0.14621412754058838, "learning_rate": 5.071303707792805e-05, "loss": 0.4737, "mean_token_accuracy": 0.8563446514308453, "num_tokens": 512949318.0, "step": 16072 }, { "entropy": 0.6099044242873788, "epoch": 1.478801156980121, "grad_norm": 0.16106480360031128, "learning_rate": 5.070997025178643e-05, "loss": 0.605, "mean_token_accuracy": 0.8161625601351261, "num_tokens": 512981050.0, "step": 16073 }, { "entropy": 0.5383069100789726, "epoch": 1.478893163351562, "grad_norm": 0.15463410317897797, "learning_rate": 5.0706903425644805e-05, "loss": 0.5286, "mean_token_accuracy": 0.8356892541050911, "num_tokens": 513012371.0, "step": 16074 }, { "entropy": 0.6671279259026051, "epoch": 1.4789851697230034, "grad_norm": 0.1571977734565735, "learning_rate": 5.070383659950317e-05, "loss": 0.6528, "mean_token_accuracy": 0.7963910885155201, "num_tokens": 513043748.0, "step": 16075 }, { "entropy": 0.654227240011096, "epoch": 1.4790771760944446, "grad_norm": 0.16773264110088348, "learning_rate": 5.0700769773361555e-05, "loss": 0.6259, "mean_token_accuracy": 0.8098270036280155, "num_tokens": 513075984.0, "step": 16076 }, { "entropy": 0.5857298420742154, "epoch": 1.4791691824658857, "grad_norm": 0.15290652215480804, "learning_rate": 5.069770294721993e-05, "loss": 0.5703, "mean_token_accuracy": 0.8263112381100655, "num_tokens": 513107580.0, "step": 16077 }, { "entropy": 0.6203469838947058, "epoch": 1.479261188837327, "grad_norm": 0.16007563471794128, "learning_rate": 5.06946361210783e-05, "loss": 0.624, "mean_token_accuracy": 0.8103689961135387, "num_tokens": 513139109.0, "step": 16078 }, { "entropy": 0.5672541549429297, "epoch": 1.4793531952087682, "grad_norm": 0.15374596416950226, "learning_rate": 5.069156929493667e-05, "loss": 0.5612, "mean_token_accuracy": 0.8273997530341148, "num_tokens": 513170928.0, "step": 16079 }, { "entropy": 0.6822249256074429, "epoch": 1.4794452015802095, "grad_norm": 0.16600903868675232, "learning_rate": 5.068850246879505e-05, "loss": 0.652, "mean_token_accuracy": 0.7997731976211071, "num_tokens": 513202426.0, "step": 16080 }, { "entropy": 0.5636249668896198, "epoch": 1.4795372079516507, "grad_norm": 0.15861636400222778, "learning_rate": 5.068543564265342e-05, "loss": 0.5713, "mean_token_accuracy": 0.8236238770186901, "num_tokens": 513234991.0, "step": 16081 }, { "entropy": 0.6402336098253727, "epoch": 1.4796292143230918, "grad_norm": 0.16340944170951843, "learning_rate": 5.0682368816511796e-05, "loss": 0.6429, "mean_token_accuracy": 0.8004857450723648, "num_tokens": 513265687.0, "step": 16082 }, { "entropy": 0.5682840747758746, "epoch": 1.4797212206945332, "grad_norm": 0.14946527779102325, "learning_rate": 5.0679301990370164e-05, "loss": 0.5506, "mean_token_accuracy": 0.826967116445303, "num_tokens": 513297752.0, "step": 16083 }, { "entropy": 0.586499304510653, "epoch": 1.4798132270659743, "grad_norm": 0.1685948222875595, "learning_rate": 5.0676235164228545e-05, "loss": 0.6007, "mean_token_accuracy": 0.8170319125056267, "num_tokens": 513329848.0, "step": 16084 }, { "entropy": 0.6395126283168793, "epoch": 1.4799052334374156, "grad_norm": 0.15803097188472748, "learning_rate": 5.067316833808692e-05, "loss": 0.6242, "mean_token_accuracy": 0.8127102628350258, "num_tokens": 513361682.0, "step": 16085 }, { "entropy": 0.567735911346972, "epoch": 1.4799972398088568, "grad_norm": 0.15744444727897644, "learning_rate": 5.067010151194529e-05, "loss": 0.5592, "mean_token_accuracy": 0.83447440341115, "num_tokens": 513393634.0, "step": 16086 }, { "entropy": 0.7063456792384386, "epoch": 1.480089246180298, "grad_norm": 0.1604876071214676, "learning_rate": 5.066703468580366e-05, "loss": 0.7014, "mean_token_accuracy": 0.7845691964030266, "num_tokens": 513425599.0, "step": 16087 }, { "entropy": 0.6159630622714758, "epoch": 1.4801812525517393, "grad_norm": 0.15456119179725647, "learning_rate": 5.0663967859662044e-05, "loss": 0.5994, "mean_token_accuracy": 0.8173937983810902, "num_tokens": 513458210.0, "step": 16088 }, { "entropy": 0.6553422892466187, "epoch": 1.4802732589231804, "grad_norm": 0.16407077014446259, "learning_rate": 5.066090103352041e-05, "loss": 0.643, "mean_token_accuracy": 0.8058932386338711, "num_tokens": 513490103.0, "step": 16089 }, { "entropy": 0.646432138979435, "epoch": 1.4803652652946218, "grad_norm": 0.14927512407302856, "learning_rate": 5.0657834207378786e-05, "loss": 0.625, "mean_token_accuracy": 0.8092367462813854, "num_tokens": 513522174.0, "step": 16090 }, { "entropy": 0.6345349624752998, "epoch": 1.480457271666063, "grad_norm": 0.16453760862350464, "learning_rate": 5.0654767381237154e-05, "loss": 0.6142, "mean_token_accuracy": 0.815247505903244, "num_tokens": 513553995.0, "step": 16091 }, { "entropy": 0.5793380802497268, "epoch": 1.480549278037504, "grad_norm": 0.1510246843099594, "learning_rate": 5.0651700555095535e-05, "loss": 0.5623, "mean_token_accuracy": 0.8243974186480045, "num_tokens": 513585900.0, "step": 16092 }, { "entropy": 0.4880145248025656, "epoch": 1.4806412844089454, "grad_norm": 0.1437702775001526, "learning_rate": 5.064863372895391e-05, "loss": 0.4774, "mean_token_accuracy": 0.8516700118780136, "num_tokens": 513618145.0, "step": 16093 }, { "entropy": 0.574979405850172, "epoch": 1.4807332907803865, "grad_norm": 0.15494520962238312, "learning_rate": 5.064556690281228e-05, "loss": 0.5774, "mean_token_accuracy": 0.8226847648620605, "num_tokens": 513650230.0, "step": 16094 }, { "entropy": 0.5639351047575474, "epoch": 1.4808252971518279, "grad_norm": 0.1517832726240158, "learning_rate": 5.064250007667065e-05, "loss": 0.5425, "mean_token_accuracy": 0.8292075134813786, "num_tokens": 513681364.0, "step": 16095 }, { "entropy": 0.7478372976183891, "epoch": 1.480917303523269, "grad_norm": 0.17402683198451996, "learning_rate": 5.0639433250529034e-05, "loss": 0.7435, "mean_token_accuracy": 0.7748860009014606, "num_tokens": 513713151.0, "step": 16096 }, { "entropy": 0.6142439264804125, "epoch": 1.4810093098947101, "grad_norm": 0.1598377525806427, "learning_rate": 5.06363664243874e-05, "loss": 0.6095, "mean_token_accuracy": 0.8159720785915852, "num_tokens": 513744803.0, "step": 16097 }, { "entropy": 0.64082121104002, "epoch": 1.4811013162661515, "grad_norm": 0.16152651607990265, "learning_rate": 5.0633299598245777e-05, "loss": 0.6225, "mean_token_accuracy": 0.8093561641871929, "num_tokens": 513776034.0, "step": 16098 }, { "entropy": 0.6537200431339443, "epoch": 1.4811933226375926, "grad_norm": 0.1545664668083191, "learning_rate": 5.0630232772104144e-05, "loss": 0.6368, "mean_token_accuracy": 0.807172030210495, "num_tokens": 513808727.0, "step": 16099 }, { "entropy": 0.6443739980459213, "epoch": 1.481285329009034, "grad_norm": 0.1583775281906128, "learning_rate": 5.0627165945962526e-05, "loss": 0.6304, "mean_token_accuracy": 0.8022038266062737, "num_tokens": 513840452.0, "step": 16100 }, { "entropy": 0.594266970641911, "epoch": 1.4813773353804751, "grad_norm": 0.15524567663669586, "learning_rate": 5.06240991198209e-05, "loss": 0.5885, "mean_token_accuracy": 0.8197060935199261, "num_tokens": 513871150.0, "step": 16101 }, { "entropy": 0.6418464705348015, "epoch": 1.4814693417519162, "grad_norm": 0.1570194959640503, "learning_rate": 5.062103229367927e-05, "loss": 0.6309, "mean_token_accuracy": 0.8035012446343899, "num_tokens": 513903219.0, "step": 16102 }, { "entropy": 0.5540559543296695, "epoch": 1.4815613481233576, "grad_norm": 0.15669570863246918, "learning_rate": 5.061796546753764e-05, "loss": 0.5359, "mean_token_accuracy": 0.8353727236390114, "num_tokens": 513934865.0, "step": 16103 }, { "entropy": 0.5573987108655274, "epoch": 1.4816533544947987, "grad_norm": 0.15103064477443695, "learning_rate": 5.0614898641396024e-05, "loss": 0.5364, "mean_token_accuracy": 0.8356275744736195, "num_tokens": 513966724.0, "step": 16104 }, { "entropy": 0.6696040173992515, "epoch": 1.48174536086624, "grad_norm": 0.1575339287519455, "learning_rate": 5.06118318152544e-05, "loss": 0.6576, "mean_token_accuracy": 0.8005973957479, "num_tokens": 513999272.0, "step": 16105 }, { "entropy": 0.665422422811389, "epoch": 1.4818373672376812, "grad_norm": 0.1557517647743225, "learning_rate": 5.060876498911277e-05, "loss": 0.6524, "mean_token_accuracy": 0.8025294058024883, "num_tokens": 514031326.0, "step": 16106 }, { "entropy": 0.6697114491835237, "epoch": 1.4819293736091224, "grad_norm": 0.16216912865638733, "learning_rate": 5.060569816297115e-05, "loss": 0.6726, "mean_token_accuracy": 0.7947506010532379, "num_tokens": 514063355.0, "step": 16107 }, { "entropy": 0.5655484087765217, "epoch": 1.4820213799805637, "grad_norm": 0.15626157820224762, "learning_rate": 5.060263133682952e-05, "loss": 0.5562, "mean_token_accuracy": 0.8281633034348488, "num_tokens": 514095585.0, "step": 16108 }, { "entropy": 0.5921599715948105, "epoch": 1.4821133863520048, "grad_norm": 0.1583063006401062, "learning_rate": 5.059956451068789e-05, "loss": 0.5948, "mean_token_accuracy": 0.8228722363710403, "num_tokens": 514127767.0, "step": 16109 }, { "entropy": 0.6713088639080524, "epoch": 1.4822053927234462, "grad_norm": 0.16202442348003387, "learning_rate": 5.0596497684546266e-05, "loss": 0.6527, "mean_token_accuracy": 0.8000332713127136, "num_tokens": 514160043.0, "step": 16110 }, { "entropy": 0.6105905640870333, "epoch": 1.4822973990948873, "grad_norm": 0.158506378531456, "learning_rate": 5.059343085840465e-05, "loss": 0.6092, "mean_token_accuracy": 0.819517232477665, "num_tokens": 514191486.0, "step": 16111 }, { "entropy": 0.6265278905630112, "epoch": 1.4823894054663285, "grad_norm": 0.15529701113700867, "learning_rate": 5.0590364032263015e-05, "loss": 0.6148, "mean_token_accuracy": 0.8117177039384842, "num_tokens": 514223853.0, "step": 16112 }, { "entropy": 0.6359787220135331, "epoch": 1.4824814118377698, "grad_norm": 0.15860623121261597, "learning_rate": 5.058729720612139e-05, "loss": 0.6409, "mean_token_accuracy": 0.8086076229810715, "num_tokens": 514256263.0, "step": 16113 }, { "entropy": 0.4724173923023045, "epoch": 1.482573418209211, "grad_norm": 0.14564283192157745, "learning_rate": 5.058423037997976e-05, "loss": 0.4583, "mean_token_accuracy": 0.8599707297980785, "num_tokens": 514288795.0, "step": 16114 }, { "entropy": 0.5131559614092112, "epoch": 1.4826654245806523, "grad_norm": 0.13600747287273407, "learning_rate": 5.058116355383814e-05, "loss": 0.4963, "mean_token_accuracy": 0.843426987528801, "num_tokens": 514321218.0, "step": 16115 }, { "entropy": 0.7264975570142269, "epoch": 1.4827574309520934, "grad_norm": 0.16710901260375977, "learning_rate": 5.0578096727696513e-05, "loss": 0.7057, "mean_token_accuracy": 0.7854963541030884, "num_tokens": 514353126.0, "step": 16116 }, { "entropy": 0.4747876198962331, "epoch": 1.4828494373235346, "grad_norm": 0.14183902740478516, "learning_rate": 5.057502990155488e-05, "loss": 0.4583, "mean_token_accuracy": 0.8578038401901722, "num_tokens": 514385573.0, "step": 16117 }, { "entropy": 0.5750042553991079, "epoch": 1.482941443694976, "grad_norm": 0.1595827341079712, "learning_rate": 5.0571963075413256e-05, "loss": 0.5676, "mean_token_accuracy": 0.8298050351440907, "num_tokens": 514417460.0, "step": 16118 }, { "entropy": 0.5422269124537706, "epoch": 1.483033450066417, "grad_norm": 0.15363985300064087, "learning_rate": 5.056889624927164e-05, "loss": 0.523, "mean_token_accuracy": 0.8354398384690285, "num_tokens": 514450012.0, "step": 16119 }, { "entropy": 0.6880043838173151, "epoch": 1.4831254564378584, "grad_norm": 0.16214703023433685, "learning_rate": 5.0565829423130005e-05, "loss": 0.6698, "mean_token_accuracy": 0.7945517972111702, "num_tokens": 514481179.0, "step": 16120 }, { "entropy": 0.5331525607034564, "epoch": 1.4832174628092996, "grad_norm": 0.15025027096271515, "learning_rate": 5.056276259698838e-05, "loss": 0.522, "mean_token_accuracy": 0.8373595289885998, "num_tokens": 514513053.0, "step": 16121 }, { "entropy": 0.569239349104464, "epoch": 1.4833094691807407, "grad_norm": 0.16097700595855713, "learning_rate": 5.055969577084675e-05, "loss": 0.5684, "mean_token_accuracy": 0.8265933655202389, "num_tokens": 514545796.0, "step": 16122 }, { "entropy": 0.6979657262563705, "epoch": 1.483401475552182, "grad_norm": 0.16313734650611877, "learning_rate": 5.055662894470513e-05, "loss": 0.6775, "mean_token_accuracy": 0.7935514077544212, "num_tokens": 514577534.0, "step": 16123 }, { "entropy": 0.5375326536595821, "epoch": 1.4834934819236232, "grad_norm": 0.1482933908700943, "learning_rate": 5.0553562118563504e-05, "loss": 0.5178, "mean_token_accuracy": 0.8366243578493595, "num_tokens": 514609492.0, "step": 16124 }, { "entropy": 0.7253273725509644, "epoch": 1.4835854882950645, "grad_norm": 0.15407992899417877, "learning_rate": 5.055049529242187e-05, "loss": 0.6964, "mean_token_accuracy": 0.7874709405004978, "num_tokens": 514642004.0, "step": 16125 }, { "entropy": 0.5613313112407923, "epoch": 1.4836774946665057, "grad_norm": 0.15290305018424988, "learning_rate": 5.0547428466280246e-05, "loss": 0.5524, "mean_token_accuracy": 0.8315282054245472, "num_tokens": 514674334.0, "step": 16126 }, { "entropy": 0.6906211413443089, "epoch": 1.4837695010379468, "grad_norm": 0.15603038668632507, "learning_rate": 5.054436164013863e-05, "loss": 0.68, "mean_token_accuracy": 0.7923731133341789, "num_tokens": 514706819.0, "step": 16127 }, { "entropy": 0.6027239579707384, "epoch": 1.4838615074093882, "grad_norm": 0.15506714582443237, "learning_rate": 5.0541294813996996e-05, "loss": 0.6035, "mean_token_accuracy": 0.8174517750740051, "num_tokens": 514738967.0, "step": 16128 }, { "entropy": 0.6013673692941666, "epoch": 1.4839535137808293, "grad_norm": 0.15954133868217468, "learning_rate": 5.053822798785537e-05, "loss": 0.5886, "mean_token_accuracy": 0.8164821155369282, "num_tokens": 514771030.0, "step": 16129 }, { "entropy": 0.5153239173814654, "epoch": 1.4840455201522706, "grad_norm": 0.14495468139648438, "learning_rate": 5.053516116171374e-05, "loss": 0.5068, "mean_token_accuracy": 0.8444551005959511, "num_tokens": 514803513.0, "step": 16130 }, { "entropy": 0.5069654192775488, "epoch": 1.4841375265237118, "grad_norm": 0.14992740750312805, "learning_rate": 5.053209433557212e-05, "loss": 0.4924, "mean_token_accuracy": 0.847723513841629, "num_tokens": 514834803.0, "step": 16131 }, { "entropy": 0.45381412003189325, "epoch": 1.484229532895153, "grad_norm": 0.1542329043149948, "learning_rate": 5.0529027509430494e-05, "loss": 0.4496, "mean_token_accuracy": 0.8620407544076443, "num_tokens": 514867003.0, "step": 16132 }, { "entropy": 0.63799644773826, "epoch": 1.4843215392665943, "grad_norm": 0.16344577074050903, "learning_rate": 5.052596068328886e-05, "loss": 0.6396, "mean_token_accuracy": 0.8067412190139294, "num_tokens": 514898830.0, "step": 16133 }, { "entropy": 0.5556032340973616, "epoch": 1.4844135456380354, "grad_norm": 0.1548805981874466, "learning_rate": 5.052289385714724e-05, "loss": 0.5346, "mean_token_accuracy": 0.8326989449560642, "num_tokens": 514930509.0, "step": 16134 }, { "entropy": 0.5827672723680735, "epoch": 1.4845055520094768, "grad_norm": 0.15320909023284912, "learning_rate": 5.051982703100562e-05, "loss": 0.5531, "mean_token_accuracy": 0.8250007554888725, "num_tokens": 514962309.0, "step": 16135 }, { "entropy": 0.5217318385839462, "epoch": 1.484597558380918, "grad_norm": 0.16112864017486572, "learning_rate": 5.0516760204863986e-05, "loss": 0.5106, "mean_token_accuracy": 0.8409978114068508, "num_tokens": 514993623.0, "step": 16136 }, { "entropy": 0.663711866363883, "epoch": 1.484689564752359, "grad_norm": 0.15744903683662415, "learning_rate": 5.051369337872236e-05, "loss": 0.6524, "mean_token_accuracy": 0.7975933998823166, "num_tokens": 515024965.0, "step": 16137 }, { "entropy": 0.6690626181662083, "epoch": 1.4847815711238004, "grad_norm": 0.163033127784729, "learning_rate": 5.051062655258074e-05, "loss": 0.6488, "mean_token_accuracy": 0.8003667369484901, "num_tokens": 515056084.0, "step": 16138 }, { "entropy": 0.5848624054342508, "epoch": 1.4848735774952415, "grad_norm": 0.1478581726551056, "learning_rate": 5.050755972643911e-05, "loss": 0.5807, "mean_token_accuracy": 0.8216748684644699, "num_tokens": 515088765.0, "step": 16139 }, { "entropy": 0.6521319542080164, "epoch": 1.4849655838666829, "grad_norm": 0.16436459124088287, "learning_rate": 5.0504492900297485e-05, "loss": 0.6264, "mean_token_accuracy": 0.8054182268679142, "num_tokens": 515119932.0, "step": 16140 }, { "entropy": 0.651344433426857, "epoch": 1.485057590238124, "grad_norm": 0.16235384345054626, "learning_rate": 5.050142607415585e-05, "loss": 0.6353, "mean_token_accuracy": 0.8068019039928913, "num_tokens": 515151349.0, "step": 16141 }, { "entropy": 0.6783323492854834, "epoch": 1.4851495966095651, "grad_norm": 0.16976462304592133, "learning_rate": 5.049835924801424e-05, "loss": 0.6748, "mean_token_accuracy": 0.7938030026853085, "num_tokens": 515183704.0, "step": 16142 }, { "entropy": 0.6321980310603976, "epoch": 1.4852416029810065, "grad_norm": 0.16879208385944366, "learning_rate": 5.049529242187261e-05, "loss": 0.6431, "mean_token_accuracy": 0.8025574795901775, "num_tokens": 515215257.0, "step": 16143 }, { "entropy": 0.5282552279531956, "epoch": 1.4853336093524476, "grad_norm": 0.15760943293571472, "learning_rate": 5.0492225595730976e-05, "loss": 0.5221, "mean_token_accuracy": 0.8409321159124374, "num_tokens": 515247424.0, "step": 16144 }, { "entropy": 0.5414022160694003, "epoch": 1.485425615723889, "grad_norm": 0.15054218471050262, "learning_rate": 5.048915876958935e-05, "loss": 0.5129, "mean_token_accuracy": 0.840088602155447, "num_tokens": 515278644.0, "step": 16145 }, { "entropy": 0.6644223099574447, "epoch": 1.4855176220953301, "grad_norm": 0.15677358210086823, "learning_rate": 5.048609194344773e-05, "loss": 0.6505, "mean_token_accuracy": 0.8037404678761959, "num_tokens": 515310630.0, "step": 16146 }, { "entropy": 0.5607881862670183, "epoch": 1.4856096284667712, "grad_norm": 0.15437407791614532, "learning_rate": 5.048302511730611e-05, "loss": 0.5501, "mean_token_accuracy": 0.8308925442397594, "num_tokens": 515341927.0, "step": 16147 }, { "entropy": 0.6984633198007941, "epoch": 1.4857016348382126, "grad_norm": 0.16157874464988708, "learning_rate": 5.0479958291164475e-05, "loss": 0.6882, "mean_token_accuracy": 0.7890633381903172, "num_tokens": 515373536.0, "step": 16148 }, { "entropy": 0.6298819789662957, "epoch": 1.4857936412096537, "grad_norm": 0.1545710265636444, "learning_rate": 5.047689146502285e-05, "loss": 0.6224, "mean_token_accuracy": 0.8105611950159073, "num_tokens": 515405760.0, "step": 16149 }, { "entropy": 0.6912771333009005, "epoch": 1.485885647581095, "grad_norm": 0.16032227873802185, "learning_rate": 5.047382463888123e-05, "loss": 0.6845, "mean_token_accuracy": 0.7926223427057266, "num_tokens": 515437757.0, "step": 16150 }, { "entropy": 0.6461029937490821, "epoch": 1.4859776539525362, "grad_norm": 0.15858885645866394, "learning_rate": 5.04707578127396e-05, "loss": 0.6412, "mean_token_accuracy": 0.8052701838314533, "num_tokens": 515469137.0, "step": 16151 }, { "entropy": 0.6759928520768881, "epoch": 1.4860696603239774, "grad_norm": 0.15619628131389618, "learning_rate": 5.0467690986597974e-05, "loss": 0.6768, "mean_token_accuracy": 0.7951079793274403, "num_tokens": 515501088.0, "step": 16152 }, { "entropy": 0.504689269233495, "epoch": 1.4861616666954187, "grad_norm": 0.14898568391799927, "learning_rate": 5.046462416045634e-05, "loss": 0.5079, "mean_token_accuracy": 0.8436406292021275, "num_tokens": 515533114.0, "step": 16153 }, { "entropy": 0.6980325281620026, "epoch": 1.4862536730668598, "grad_norm": 0.16157715022563934, "learning_rate": 5.046155733431472e-05, "loss": 0.6915, "mean_token_accuracy": 0.7959745563566685, "num_tokens": 515565238.0, "step": 16154 }, { "entropy": 0.6103603346273303, "epoch": 1.4863456794383012, "grad_norm": 0.1498032659292221, "learning_rate": 5.04584905081731e-05, "loss": 0.5973, "mean_token_accuracy": 0.8163856491446495, "num_tokens": 515596952.0, "step": 16155 }, { "entropy": 0.5625821547582746, "epoch": 1.4864376858097423, "grad_norm": 0.15348049998283386, "learning_rate": 5.0455423682031465e-05, "loss": 0.5486, "mean_token_accuracy": 0.8322275727987289, "num_tokens": 515629458.0, "step": 16156 }, { "entropy": 0.6314675882458687, "epoch": 1.4865296921811835, "grad_norm": 0.15552875399589539, "learning_rate": 5.045235685588984e-05, "loss": 0.6158, "mean_token_accuracy": 0.8091889843344688, "num_tokens": 515661199.0, "step": 16157 }, { "entropy": 0.568878729827702, "epoch": 1.4866216985526248, "grad_norm": 0.1478244513273239, "learning_rate": 5.044929002974822e-05, "loss": 0.5492, "mean_token_accuracy": 0.8316179811954498, "num_tokens": 515693144.0, "step": 16158 }, { "entropy": 0.5028918907046318, "epoch": 1.486713704924066, "grad_norm": 0.1519918590784073, "learning_rate": 5.044622320360659e-05, "loss": 0.4975, "mean_token_accuracy": 0.8438693396747112, "num_tokens": 515725494.0, "step": 16159 }, { "entropy": 0.6699254345148802, "epoch": 1.4868057112955073, "grad_norm": 0.1577645093202591, "learning_rate": 5.0443156377464964e-05, "loss": 0.6561, "mean_token_accuracy": 0.7990474179387093, "num_tokens": 515757202.0, "step": 16160 }, { "entropy": 0.594770897179842, "epoch": 1.4868977176669484, "grad_norm": 0.16052685678005219, "learning_rate": 5.044008955132333e-05, "loss": 0.5777, "mean_token_accuracy": 0.8207250274717808, "num_tokens": 515789636.0, "step": 16161 }, { "entropy": 0.6639395523816347, "epoch": 1.4869897240383896, "grad_norm": 0.16436892747879028, "learning_rate": 5.043702272518171e-05, "loss": 0.6514, "mean_token_accuracy": 0.8028261438012123, "num_tokens": 515821934.0, "step": 16162 }, { "entropy": 0.6504925210028887, "epoch": 1.487081730409831, "grad_norm": 0.15590491890907288, "learning_rate": 5.043395589904009e-05, "loss": 0.6384, "mean_token_accuracy": 0.8030591905117035, "num_tokens": 515853317.0, "step": 16163 }, { "entropy": 0.5420741476118565, "epoch": 1.487173736781272, "grad_norm": 0.1477051079273224, "learning_rate": 5.0430889072898456e-05, "loss": 0.5291, "mean_token_accuracy": 0.8321202322840691, "num_tokens": 515885611.0, "step": 16164 }, { "entropy": 0.6376443617045879, "epoch": 1.4872657431527134, "grad_norm": 0.16186349093914032, "learning_rate": 5.042782224675683e-05, "loss": 0.6199, "mean_token_accuracy": 0.8090373538434505, "num_tokens": 515917165.0, "step": 16165 }, { "entropy": 0.6239594584330916, "epoch": 1.4873577495241546, "grad_norm": 0.1616056114435196, "learning_rate": 5.042475542061521e-05, "loss": 0.6126, "mean_token_accuracy": 0.814458429813385, "num_tokens": 515949313.0, "step": 16166 }, { "entropy": 0.6772261392325163, "epoch": 1.4874497558955957, "grad_norm": 0.16193445026874542, "learning_rate": 5.042168859447358e-05, "loss": 0.6746, "mean_token_accuracy": 0.7909603416919708, "num_tokens": 515981250.0, "step": 16167 }, { "entropy": 0.5914163505658507, "epoch": 1.487541762267037, "grad_norm": 0.15303660929203033, "learning_rate": 5.0418621768331954e-05, "loss": 0.5844, "mean_token_accuracy": 0.8256238102912903, "num_tokens": 516013644.0, "step": 16168 }, { "entropy": 0.5289221371058375, "epoch": 1.4876337686384782, "grad_norm": 0.1485247164964676, "learning_rate": 5.0415554942190336e-05, "loss": 0.522, "mean_token_accuracy": 0.8381413817405701, "num_tokens": 516045866.0, "step": 16169 }, { "entropy": 0.5059668552130461, "epoch": 1.4877257750099195, "grad_norm": 0.14245207607746124, "learning_rate": 5.0412488116048704e-05, "loss": 0.4988, "mean_token_accuracy": 0.8413607887923717, "num_tokens": 516077828.0, "step": 16170 }, { "entropy": 0.6357972025871277, "epoch": 1.4878177813813607, "grad_norm": 0.15392959117889404, "learning_rate": 5.040942128990708e-05, "loss": 0.6153, "mean_token_accuracy": 0.8100596182048321, "num_tokens": 516109757.0, "step": 16171 }, { "entropy": 0.6183966211974621, "epoch": 1.4879097877528018, "grad_norm": 0.1553707718849182, "learning_rate": 5.0406354463765446e-05, "loss": 0.6248, "mean_token_accuracy": 0.8101348504424095, "num_tokens": 516141125.0, "step": 16172 }, { "entropy": 0.5847351681441069, "epoch": 1.4880017941242432, "grad_norm": 0.15185175836086273, "learning_rate": 5.040328763762383e-05, "loss": 0.5875, "mean_token_accuracy": 0.816451296210289, "num_tokens": 516173677.0, "step": 16173 }, { "entropy": 0.681676147505641, "epoch": 1.4880938004956843, "grad_norm": 0.16568303108215332, "learning_rate": 5.04002208114822e-05, "loss": 0.6726, "mean_token_accuracy": 0.7934736907482147, "num_tokens": 516206156.0, "step": 16174 }, { "entropy": 0.6181088797748089, "epoch": 1.4881858068671256, "grad_norm": 0.15614765882492065, "learning_rate": 5.039715398534057e-05, "loss": 0.6118, "mean_token_accuracy": 0.8110475279390812, "num_tokens": 516237770.0, "step": 16175 }, { "entropy": 0.5438322387635708, "epoch": 1.4882778132385668, "grad_norm": 0.1508798450231552, "learning_rate": 5.0394087159198945e-05, "loss": 0.5416, "mean_token_accuracy": 0.8341372944414616, "num_tokens": 516270063.0, "step": 16176 }, { "entropy": 0.643830394372344, "epoch": 1.488369819610008, "grad_norm": 0.1582023948431015, "learning_rate": 5.0391020333057326e-05, "loss": 0.6389, "mean_token_accuracy": 0.8080593571066856, "num_tokens": 516301747.0, "step": 16177 }, { "entropy": 0.5574062736704946, "epoch": 1.4884618259814493, "grad_norm": 0.15211018919944763, "learning_rate": 5.0387953506915694e-05, "loss": 0.5507, "mean_token_accuracy": 0.8344499990344048, "num_tokens": 516333660.0, "step": 16178 }, { "entropy": 0.5904898722656071, "epoch": 1.4885538323528904, "grad_norm": 0.15323907136917114, "learning_rate": 5.038488668077407e-05, "loss": 0.5839, "mean_token_accuracy": 0.8223464265465736, "num_tokens": 516365596.0, "step": 16179 }, { "entropy": 0.5993799120187759, "epoch": 1.4886458387243318, "grad_norm": 0.15258412063121796, "learning_rate": 5.038181985463244e-05, "loss": 0.5839, "mean_token_accuracy": 0.8164182901382446, "num_tokens": 516397198.0, "step": 16180 }, { "entropy": 0.5192406345158815, "epoch": 1.488737845095773, "grad_norm": 0.15115542709827423, "learning_rate": 5.0378753028490825e-05, "loss": 0.5082, "mean_token_accuracy": 0.8458072543144226, "num_tokens": 516429709.0, "step": 16181 }, { "entropy": 0.716437540948391, "epoch": 1.488829851467214, "grad_norm": 0.16603529453277588, "learning_rate": 5.037568620234919e-05, "loss": 0.7063, "mean_token_accuracy": 0.7881963066756725, "num_tokens": 516461582.0, "step": 16182 }, { "entropy": 0.5132129611447453, "epoch": 1.4889218578386554, "grad_norm": 0.15071532130241394, "learning_rate": 5.037261937620756e-05, "loss": 0.5081, "mean_token_accuracy": 0.8436971828341484, "num_tokens": 516494331.0, "step": 16183 }, { "entropy": 0.6382366195321083, "epoch": 1.4890138642100965, "grad_norm": 0.15908168256282806, "learning_rate": 5.0369552550065935e-05, "loss": 0.6264, "mean_token_accuracy": 0.8076206408441067, "num_tokens": 516526454.0, "step": 16184 }, { "entropy": 0.511110863648355, "epoch": 1.4891058705815379, "grad_norm": 0.14743740856647491, "learning_rate": 5.036648572392432e-05, "loss": 0.5034, "mean_token_accuracy": 0.8418456092476845, "num_tokens": 516558785.0, "step": 16185 }, { "entropy": 0.5114666824229062, "epoch": 1.489197876952979, "grad_norm": 0.14277523756027222, "learning_rate": 5.036341889778269e-05, "loss": 0.4905, "mean_token_accuracy": 0.847908366471529, "num_tokens": 516591303.0, "step": 16186 }, { "entropy": 0.660923894494772, "epoch": 1.4892898833244201, "grad_norm": 0.1560402363538742, "learning_rate": 5.036035207164106e-05, "loss": 0.644, "mean_token_accuracy": 0.8040119595825672, "num_tokens": 516624071.0, "step": 16187 }, { "entropy": 0.583776568993926, "epoch": 1.4893818896958615, "grad_norm": 0.14883436262607574, "learning_rate": 5.035728524549943e-05, "loss": 0.5763, "mean_token_accuracy": 0.8224257603287697, "num_tokens": 516656624.0, "step": 16188 }, { "entropy": 0.6286794152110815, "epoch": 1.4894738960673026, "grad_norm": 0.16101589798927307, "learning_rate": 5.0354218419357815e-05, "loss": 0.6288, "mean_token_accuracy": 0.8088016398251057, "num_tokens": 516688660.0, "step": 16189 }, { "entropy": 0.6226568929851055, "epoch": 1.489565902438744, "grad_norm": 0.15869447588920593, "learning_rate": 5.035115159321618e-05, "loss": 0.6277, "mean_token_accuracy": 0.8103545121848583, "num_tokens": 516720843.0, "step": 16190 }, { "entropy": 0.668093878775835, "epoch": 1.4896579088101851, "grad_norm": 0.1597071886062622, "learning_rate": 5.034808476707456e-05, "loss": 0.6483, "mean_token_accuracy": 0.8020178489387035, "num_tokens": 516752278.0, "step": 16191 }, { "entropy": 0.6617699451744556, "epoch": 1.4897499151816262, "grad_norm": 0.17632855474948883, "learning_rate": 5.0345017940932926e-05, "loss": 0.654, "mean_token_accuracy": 0.7999658323824406, "num_tokens": 516782768.0, "step": 16192 }, { "entropy": 0.7430152744054794, "epoch": 1.4898419215530676, "grad_norm": 0.16582229733467102, "learning_rate": 5.034195111479131e-05, "loss": 0.7434, "mean_token_accuracy": 0.7779799364507198, "num_tokens": 516815069.0, "step": 16193 }, { "entropy": 0.6442425604909658, "epoch": 1.4899339279245087, "grad_norm": 0.1622278243303299, "learning_rate": 5.033888428864968e-05, "loss": 0.6312, "mean_token_accuracy": 0.8079820945858955, "num_tokens": 516846199.0, "step": 16194 }, { "entropy": 0.5834477385506034, "epoch": 1.49002593429595, "grad_norm": 0.16128501296043396, "learning_rate": 5.033581746250805e-05, "loss": 0.5809, "mean_token_accuracy": 0.8216868527233601, "num_tokens": 516877538.0, "step": 16195 }, { "entropy": 0.7191119976341724, "epoch": 1.4901179406673912, "grad_norm": 0.17409244179725647, "learning_rate": 5.0332750636366424e-05, "loss": 0.7147, "mean_token_accuracy": 0.784320455044508, "num_tokens": 516908854.0, "step": 16196 }, { "entropy": 0.6749866846948862, "epoch": 1.4902099470388324, "grad_norm": 0.15948505699634552, "learning_rate": 5.0329683810224806e-05, "loss": 0.6592, "mean_token_accuracy": 0.7978093847632408, "num_tokens": 516940753.0, "step": 16197 }, { "entropy": 0.48049821984022856, "epoch": 1.4903019534102737, "grad_norm": 0.14689011871814728, "learning_rate": 5.0326616984083174e-05, "loss": 0.4614, "mean_token_accuracy": 0.8557126969099045, "num_tokens": 516972807.0, "step": 16198 }, { "entropy": 0.7072955891489983, "epoch": 1.4903939597817148, "grad_norm": 0.16508467495441437, "learning_rate": 5.032355015794155e-05, "loss": 0.6998, "mean_token_accuracy": 0.7876431234180927, "num_tokens": 517004638.0, "step": 16199 }, { "entropy": 0.6687352247536182, "epoch": 1.4904859661531562, "grad_norm": 0.1596597582101822, "learning_rate": 5.032048333179993e-05, "loss": 0.6516, "mean_token_accuracy": 0.798374842852354, "num_tokens": 517036197.0, "step": 16200 }, { "entropy": 0.6305385045707226, "epoch": 1.4905779725245973, "grad_norm": 0.15415501594543457, "learning_rate": 5.03174165056583e-05, "loss": 0.6189, "mean_token_accuracy": 0.8112533874809742, "num_tokens": 517068463.0, "step": 16201 }, { "entropy": 0.5591384554281831, "epoch": 1.4906699788960385, "grad_norm": 0.15475155413150787, "learning_rate": 5.031434967951667e-05, "loss": 0.546, "mean_token_accuracy": 0.8294692933559418, "num_tokens": 517100330.0, "step": 16202 }, { "entropy": 0.5256894817575812, "epoch": 1.4907619852674798, "grad_norm": 0.14159433543682098, "learning_rate": 5.031128285337504e-05, "loss": 0.5009, "mean_token_accuracy": 0.841724306344986, "num_tokens": 517132170.0, "step": 16203 }, { "entropy": 0.6267874510958791, "epoch": 1.490853991638921, "grad_norm": 0.15058933198451996, "learning_rate": 5.030821602723342e-05, "loss": 0.6184, "mean_token_accuracy": 0.8140408210456371, "num_tokens": 517164755.0, "step": 16204 }, { "entropy": 0.579365624114871, "epoch": 1.4909459980103623, "grad_norm": 0.16063319146633148, "learning_rate": 5.0305149201091796e-05, "loss": 0.5656, "mean_token_accuracy": 0.8236632533371449, "num_tokens": 517196384.0, "step": 16205 }, { "entropy": 0.6985575519502163, "epoch": 1.4910380043818035, "grad_norm": 0.15527985990047455, "learning_rate": 5.0302082374950164e-05, "loss": 0.6854, "mean_token_accuracy": 0.7928141392767429, "num_tokens": 517228623.0, "step": 16206 }, { "entropy": 0.6757974363863468, "epoch": 1.4911300107532446, "grad_norm": 0.16801927983760834, "learning_rate": 5.029901554880854e-05, "loss": 0.665, "mean_token_accuracy": 0.7975552342832088, "num_tokens": 517259649.0, "step": 16207 }, { "entropy": 0.6597025282680988, "epoch": 1.491222017124686, "grad_norm": 0.15670695900917053, "learning_rate": 5.029594872266692e-05, "loss": 0.6489, "mean_token_accuracy": 0.8032318651676178, "num_tokens": 517291889.0, "step": 16208 }, { "entropy": 0.5262983068823814, "epoch": 1.491314023496127, "grad_norm": 0.15092158317565918, "learning_rate": 5.029288189652529e-05, "loss": 0.5058, "mean_token_accuracy": 0.8446837514638901, "num_tokens": 517323858.0, "step": 16209 }, { "entropy": 0.5551241170614958, "epoch": 1.4914060298675684, "grad_norm": 0.14824295043945312, "learning_rate": 5.028981507038366e-05, "loss": 0.5428, "mean_token_accuracy": 0.8328935690224171, "num_tokens": 517355360.0, "step": 16210 }, { "entropy": 0.6143254609778523, "epoch": 1.4914980362390096, "grad_norm": 0.1584097295999527, "learning_rate": 5.028674824424203e-05, "loss": 0.6139, "mean_token_accuracy": 0.8118981644511223, "num_tokens": 517387495.0, "step": 16211 }, { "entropy": 0.5740426676347852, "epoch": 1.4915900426104507, "grad_norm": 0.15490856766700745, "learning_rate": 5.028368141810041e-05, "loss": 0.58, "mean_token_accuracy": 0.822069339454174, "num_tokens": 517419409.0, "step": 16212 }, { "entropy": 0.6302547957748175, "epoch": 1.491682048981892, "grad_norm": 0.16100923717021942, "learning_rate": 5.0280614591958787e-05, "loss": 0.6328, "mean_token_accuracy": 0.8078658916056156, "num_tokens": 517451654.0, "step": 16213 }, { "entropy": 0.6400513807311654, "epoch": 1.4917740553533332, "grad_norm": 0.17049647867679596, "learning_rate": 5.0277547765817154e-05, "loss": 0.6339, "mean_token_accuracy": 0.8085396513342857, "num_tokens": 517483578.0, "step": 16214 }, { "entropy": 0.7730420865118504, "epoch": 1.4918660617247745, "grad_norm": 0.16443131864070892, "learning_rate": 5.027448093967553e-05, "loss": 0.7678, "mean_token_accuracy": 0.7672378085553646, "num_tokens": 517514637.0, "step": 16215 }, { "entropy": 0.7165831420570612, "epoch": 1.4919580680962157, "grad_norm": 0.16320393979549408, "learning_rate": 5.027141411353391e-05, "loss": 0.7169, "mean_token_accuracy": 0.7826709933578968, "num_tokens": 517545822.0, "step": 16216 }, { "entropy": 0.5395801570266485, "epoch": 1.4920500744676568, "grad_norm": 0.1501472294330597, "learning_rate": 5.026834728739228e-05, "loss": 0.5269, "mean_token_accuracy": 0.8343892022967339, "num_tokens": 517577169.0, "step": 16217 }, { "entropy": 0.6960512660443783, "epoch": 1.4921420808390982, "grad_norm": 0.16544978320598602, "learning_rate": 5.026528046125065e-05, "loss": 0.6915, "mean_token_accuracy": 0.7911573015153408, "num_tokens": 517608972.0, "step": 16218 }, { "entropy": 0.5514113034587353, "epoch": 1.4922340872105393, "grad_norm": 0.1607915163040161, "learning_rate": 5.026221363510902e-05, "loss": 0.5342, "mean_token_accuracy": 0.835975207388401, "num_tokens": 517641217.0, "step": 16219 }, { "entropy": 0.6700161760672927, "epoch": 1.4923260935819807, "grad_norm": 0.16003455221652985, "learning_rate": 5.02591468089674e-05, "loss": 0.6557, "mean_token_accuracy": 0.8014818392693996, "num_tokens": 517672617.0, "step": 16220 }, { "entropy": 0.6305635059252381, "epoch": 1.4924180999534218, "grad_norm": 0.15501533448696136, "learning_rate": 5.025607998282578e-05, "loss": 0.6238, "mean_token_accuracy": 0.8103632815182209, "num_tokens": 517704910.0, "step": 16221 }, { "entropy": 0.6667200250085443, "epoch": 1.492510106324863, "grad_norm": 0.15654930472373962, "learning_rate": 5.0253013156684145e-05, "loss": 0.6583, "mean_token_accuracy": 0.8035890199244022, "num_tokens": 517736923.0, "step": 16222 }, { "entropy": 0.523686470463872, "epoch": 1.4926021126963043, "grad_norm": 0.1476583629846573, "learning_rate": 5.024994633054252e-05, "loss": 0.5183, "mean_token_accuracy": 0.8396972119808197, "num_tokens": 517768987.0, "step": 16223 }, { "entropy": 0.5617240089923143, "epoch": 1.4926941190677454, "grad_norm": 0.15598176419734955, "learning_rate": 5.02468795044009e-05, "loss": 0.5492, "mean_token_accuracy": 0.8285439349710941, "num_tokens": 517801066.0, "step": 16224 }, { "entropy": 0.6435711402446032, "epoch": 1.4927861254391868, "grad_norm": 0.15794095396995544, "learning_rate": 5.0243812678259276e-05, "loss": 0.6249, "mean_token_accuracy": 0.8087073788046837, "num_tokens": 517832711.0, "step": 16225 }, { "entropy": 0.6148434830829501, "epoch": 1.492878131810628, "grad_norm": 0.15649619698524475, "learning_rate": 5.024074585211764e-05, "loss": 0.5869, "mean_token_accuracy": 0.8193994648754597, "num_tokens": 517863746.0, "step": 16226 }, { "entropy": 0.6909322030842304, "epoch": 1.492970138182069, "grad_norm": 0.16089767217636108, "learning_rate": 5.023767902597601e-05, "loss": 0.6903, "mean_token_accuracy": 0.7903914414346218, "num_tokens": 517895868.0, "step": 16227 }, { "entropy": 0.7207761565223336, "epoch": 1.4930621445535104, "grad_norm": 0.16763731837272644, "learning_rate": 5.02346121998344e-05, "loss": 0.7162, "mean_token_accuracy": 0.7842054590582848, "num_tokens": 517927799.0, "step": 16228 }, { "entropy": 0.6912538465112448, "epoch": 1.4931541509249515, "grad_norm": 0.15581730008125305, "learning_rate": 5.023154537369277e-05, "loss": 0.6828, "mean_token_accuracy": 0.7918225862085819, "num_tokens": 517960220.0, "step": 16229 }, { "entropy": 0.619774853810668, "epoch": 1.4932461572963929, "grad_norm": 0.15562470257282257, "learning_rate": 5.022847854755114e-05, "loss": 0.6159, "mean_token_accuracy": 0.8117432594299316, "num_tokens": 517992145.0, "step": 16230 }, { "entropy": 0.5850679716095328, "epoch": 1.493338163667834, "grad_norm": 0.15341129899024963, "learning_rate": 5.0225411721409523e-05, "loss": 0.5697, "mean_token_accuracy": 0.8284372054040432, "num_tokens": 518023208.0, "step": 16231 }, { "entropy": 0.5949359722435474, "epoch": 1.4934301700392751, "grad_norm": 0.15149223804473877, "learning_rate": 5.022234489526789e-05, "loss": 0.5922, "mean_token_accuracy": 0.816733930259943, "num_tokens": 518055054.0, "step": 16232 }, { "entropy": 0.5239692516624928, "epoch": 1.4935221764107165, "grad_norm": 0.1473686546087265, "learning_rate": 5.0219278069126266e-05, "loss": 0.5179, "mean_token_accuracy": 0.8386280499398708, "num_tokens": 518086703.0, "step": 16233 }, { "entropy": 0.7086114110425115, "epoch": 1.4936141827821576, "grad_norm": 0.16411474347114563, "learning_rate": 5.0216211242984634e-05, "loss": 0.6963, "mean_token_accuracy": 0.7902999557554722, "num_tokens": 518118855.0, "step": 16234 }, { "entropy": 0.5286179650574923, "epoch": 1.493706189153599, "grad_norm": 0.15164542198181152, "learning_rate": 5.0213144416843015e-05, "loss": 0.5262, "mean_token_accuracy": 0.8418199233710766, "num_tokens": 518151287.0, "step": 16235 }, { "entropy": 0.6586718643084168, "epoch": 1.4937981955250401, "grad_norm": 0.1588474065065384, "learning_rate": 5.021007759070139e-05, "loss": 0.6506, "mean_token_accuracy": 0.7987498305737972, "num_tokens": 518183749.0, "step": 16236 }, { "entropy": 0.6399428145959973, "epoch": 1.4938902018964813, "grad_norm": 0.16235369443893433, "learning_rate": 5.020701076455976e-05, "loss": 0.6396, "mean_token_accuracy": 0.8048094697296619, "num_tokens": 518215728.0, "step": 16237 }, { "entropy": 0.7146992776542902, "epoch": 1.4939822082679226, "grad_norm": 0.16230709850788116, "learning_rate": 5.020394393841813e-05, "loss": 0.7039, "mean_token_accuracy": 0.7873551733791828, "num_tokens": 518247055.0, "step": 16238 }, { "entropy": 0.5411536935716867, "epoch": 1.4940742146393637, "grad_norm": 0.15520139038562775, "learning_rate": 5.0200877112276514e-05, "loss": 0.519, "mean_token_accuracy": 0.8393915519118309, "num_tokens": 518279087.0, "step": 16239 }, { "entropy": 0.6777658704668283, "epoch": 1.494166221010805, "grad_norm": 0.15693913400173187, "learning_rate": 5.019781028613488e-05, "loss": 0.6622, "mean_token_accuracy": 0.7987099848687649, "num_tokens": 518310939.0, "step": 16240 }, { "entropy": 0.6366395317018032, "epoch": 1.4942582273822462, "grad_norm": 0.1679409146308899, "learning_rate": 5.0194743459993256e-05, "loss": 0.6257, "mean_token_accuracy": 0.8059302642941475, "num_tokens": 518342628.0, "step": 16241 }, { "entropy": 0.5663635875098407, "epoch": 1.4943502337536874, "grad_norm": 0.1545296013355255, "learning_rate": 5.0191676633851624e-05, "loss": 0.5522, "mean_token_accuracy": 0.8295724764466286, "num_tokens": 518374646.0, "step": 16242 }, { "entropy": 0.6709370221942663, "epoch": 1.4944422401251287, "grad_norm": 0.16449667513370514, "learning_rate": 5.0188609807710006e-05, "loss": 0.6517, "mean_token_accuracy": 0.8048068434000015, "num_tokens": 518406141.0, "step": 16243 }, { "entropy": 0.6975988987833261, "epoch": 1.4945342464965699, "grad_norm": 0.1572275608778, "learning_rate": 5.018554298156838e-05, "loss": 0.6854, "mean_token_accuracy": 0.7909569926559925, "num_tokens": 518438478.0, "step": 16244 }, { "entropy": 0.6308197705075145, "epoch": 1.4946262528680112, "grad_norm": 0.16099265217781067, "learning_rate": 5.018247615542675e-05, "loss": 0.6258, "mean_token_accuracy": 0.8036006689071655, "num_tokens": 518470342.0, "step": 16245 }, { "entropy": 0.6574935615062714, "epoch": 1.4947182592394523, "grad_norm": 0.15585312247276306, "learning_rate": 5.017940932928512e-05, "loss": 0.6413, "mean_token_accuracy": 0.8023420870304108, "num_tokens": 518501757.0, "step": 16246 }, { "entropy": 0.639295494183898, "epoch": 1.4948102656108935, "grad_norm": 0.15535880625247955, "learning_rate": 5.0176342503143504e-05, "loss": 0.622, "mean_token_accuracy": 0.8071105442941189, "num_tokens": 518534049.0, "step": 16247 }, { "entropy": 0.46663554082624614, "epoch": 1.4949022719823348, "grad_norm": 0.1412316858768463, "learning_rate": 5.017327567700187e-05, "loss": 0.4565, "mean_token_accuracy": 0.8564235530793667, "num_tokens": 518566453.0, "step": 16248 }, { "entropy": 0.599495098926127, "epoch": 1.494994278353776, "grad_norm": 0.1685599684715271, "learning_rate": 5.017020885086025e-05, "loss": 0.5881, "mean_token_accuracy": 0.8176647499203682, "num_tokens": 518598061.0, "step": 16249 }, { "entropy": 0.616158977150917, "epoch": 1.4950862847252173, "grad_norm": 0.1615329384803772, "learning_rate": 5.0167142024718615e-05, "loss": 0.6028, "mean_token_accuracy": 0.8132088854908943, "num_tokens": 518629091.0, "step": 16250 }, { "entropy": 0.4919720459729433, "epoch": 1.4951782910966585, "grad_norm": 0.14817050099372864, "learning_rate": 5.0164075198576996e-05, "loss": 0.4777, "mean_token_accuracy": 0.8527227118611336, "num_tokens": 518661403.0, "step": 16251 }, { "entropy": 0.6043423064984381, "epoch": 1.4952702974680996, "grad_norm": 0.16005395352840424, "learning_rate": 5.016100837243537e-05, "loss": 0.6003, "mean_token_accuracy": 0.8127457089722157, "num_tokens": 518692172.0, "step": 16252 }, { "entropy": 0.6280464921146631, "epoch": 1.495362303839541, "grad_norm": 0.17052911221981049, "learning_rate": 5.015794154629374e-05, "loss": 0.6208, "mean_token_accuracy": 0.8090980686247349, "num_tokens": 518723036.0, "step": 16253 }, { "entropy": 0.6939353700727224, "epoch": 1.495454310210982, "grad_norm": 0.15936297178268433, "learning_rate": 5.015487472015211e-05, "loss": 0.6847, "mean_token_accuracy": 0.7899843640625477, "num_tokens": 518755233.0, "step": 16254 }, { "entropy": 0.6905739326030016, "epoch": 1.4955463165824234, "grad_norm": 0.1595885157585144, "learning_rate": 5.0151807894010495e-05, "loss": 0.6835, "mean_token_accuracy": 0.7974032126367092, "num_tokens": 518786851.0, "step": 16255 }, { "entropy": 0.625312490388751, "epoch": 1.4956383229538646, "grad_norm": 0.15671837329864502, "learning_rate": 5.014874106786886e-05, "loss": 0.619, "mean_token_accuracy": 0.809685330837965, "num_tokens": 518818640.0, "step": 16256 }, { "entropy": 0.5898359157145023, "epoch": 1.4957303293253057, "grad_norm": 0.14982067048549652, "learning_rate": 5.014567424172724e-05, "loss": 0.5713, "mean_token_accuracy": 0.8243403024971485, "num_tokens": 518850772.0, "step": 16257 }, { "entropy": 0.5571118844673038, "epoch": 1.495822335696747, "grad_norm": 0.15748028457164764, "learning_rate": 5.0142607415585605e-05, "loss": 0.5505, "mean_token_accuracy": 0.8300941213965416, "num_tokens": 518882458.0, "step": 16258 }, { "entropy": 0.6064098887145519, "epoch": 1.4959143420681882, "grad_norm": 0.1506923884153366, "learning_rate": 5.0139540589443986e-05, "loss": 0.6032, "mean_token_accuracy": 0.816335704177618, "num_tokens": 518914809.0, "step": 16259 }, { "entropy": 0.547521352302283, "epoch": 1.4960063484396295, "grad_norm": 0.15263281762599945, "learning_rate": 5.013647376330236e-05, "loss": 0.5251, "mean_token_accuracy": 0.8371458575129509, "num_tokens": 518946450.0, "step": 16260 }, { "entropy": 0.6611374458298087, "epoch": 1.4960983548110707, "grad_norm": 0.159267395734787, "learning_rate": 5.013340693716073e-05, "loss": 0.652, "mean_token_accuracy": 0.8050085715949535, "num_tokens": 518978680.0, "step": 16261 }, { "entropy": 0.6134055140428245, "epoch": 1.4961903611825118, "grad_norm": 0.15438470244407654, "learning_rate": 5.013034011101912e-05, "loss": 0.6059, "mean_token_accuracy": 0.8178128302097321, "num_tokens": 519010455.0, "step": 16262 }, { "entropy": 0.5612787203863263, "epoch": 1.4962823675539532, "grad_norm": 0.1520514041185379, "learning_rate": 5.0127273284877485e-05, "loss": 0.5532, "mean_token_accuracy": 0.8288862220942974, "num_tokens": 519042787.0, "step": 16263 }, { "entropy": 0.5864141946658492, "epoch": 1.4963743739253943, "grad_norm": 0.1524561643600464, "learning_rate": 5.012420645873585e-05, "loss": 0.5735, "mean_token_accuracy": 0.8255137093365192, "num_tokens": 519074974.0, "step": 16264 }, { "entropy": 0.6102110482752323, "epoch": 1.4964663802968357, "grad_norm": 0.1577424854040146, "learning_rate": 5.012113963259423e-05, "loss": 0.6146, "mean_token_accuracy": 0.812428917735815, "num_tokens": 519107605.0, "step": 16265 }, { "entropy": 0.5195951480418444, "epoch": 1.4965583866682768, "grad_norm": 0.14931051433086395, "learning_rate": 5.011807280645261e-05, "loss": 0.5065, "mean_token_accuracy": 0.8431267626583576, "num_tokens": 519139126.0, "step": 16266 }, { "entropy": 0.6170388199388981, "epoch": 1.496650393039718, "grad_norm": 0.15290363132953644, "learning_rate": 5.0115005980310984e-05, "loss": 0.6051, "mean_token_accuracy": 0.8104843385517597, "num_tokens": 519171060.0, "step": 16267 }, { "entropy": 0.6563302830327302, "epoch": 1.4967423994111593, "grad_norm": 0.1564388871192932, "learning_rate": 5.011193915416935e-05, "loss": 0.6546, "mean_token_accuracy": 0.8045634962618351, "num_tokens": 519203300.0, "step": 16268 }, { "entropy": 0.6190138328820467, "epoch": 1.4968344057826004, "grad_norm": 0.15102502703666687, "learning_rate": 5.0108872328027726e-05, "loss": 0.6087, "mean_token_accuracy": 0.8125868141651154, "num_tokens": 519235457.0, "step": 16269 }, { "entropy": 0.7008902989327908, "epoch": 1.4969264121540418, "grad_norm": 0.1620507538318634, "learning_rate": 5.010580550188611e-05, "loss": 0.7044, "mean_token_accuracy": 0.7907343283295631, "num_tokens": 519266873.0, "step": 16270 }, { "entropy": 0.7567003332078457, "epoch": 1.497018418525483, "grad_norm": 0.16551336646080017, "learning_rate": 5.0102738675744475e-05, "loss": 0.7543, "mean_token_accuracy": 0.7736301831901073, "num_tokens": 519298839.0, "step": 16271 }, { "entropy": 0.6382582876831293, "epoch": 1.497110424896924, "grad_norm": 0.1514878273010254, "learning_rate": 5.009967184960285e-05, "loss": 0.6132, "mean_token_accuracy": 0.8107943423092365, "num_tokens": 519331518.0, "step": 16272 }, { "entropy": 0.6850503664463758, "epoch": 1.4972024312683654, "grad_norm": 0.15273965895175934, "learning_rate": 5.009660502346122e-05, "loss": 0.6644, "mean_token_accuracy": 0.7956764698028564, "num_tokens": 519363821.0, "step": 16273 }, { "entropy": 0.763950552791357, "epoch": 1.4972944376398065, "grad_norm": 0.16970515251159668, "learning_rate": 5.00935381973196e-05, "loss": 0.7539, "mean_token_accuracy": 0.7691413089632988, "num_tokens": 519395189.0, "step": 16274 }, { "entropy": 0.6198550779372454, "epoch": 1.4973864440112479, "grad_norm": 0.15250352025032043, "learning_rate": 5.0090471371177974e-05, "loss": 0.5967, "mean_token_accuracy": 0.8169227838516235, "num_tokens": 519427129.0, "step": 16275 }, { "entropy": 0.6428937967866659, "epoch": 1.497478450382689, "grad_norm": 0.16409069299697876, "learning_rate": 5.008740454503634e-05, "loss": 0.6325, "mean_token_accuracy": 0.807512179017067, "num_tokens": 519459082.0, "step": 16276 }, { "entropy": 0.5642026886343956, "epoch": 1.4975704567541301, "grad_norm": 0.15475204586982727, "learning_rate": 5.0084337718894717e-05, "loss": 0.5412, "mean_token_accuracy": 0.8373178988695145, "num_tokens": 519490525.0, "step": 16277 }, { "entropy": 0.5719184060581028, "epoch": 1.4976624631255715, "grad_norm": 0.16776274144649506, "learning_rate": 5.00812708927531e-05, "loss": 0.5752, "mean_token_accuracy": 0.8233360983431339, "num_tokens": 519523009.0, "step": 16278 }, { "entropy": 0.676095805130899, "epoch": 1.4977544694970126, "grad_norm": 0.15834613144397736, "learning_rate": 5.0078204066611466e-05, "loss": 0.6678, "mean_token_accuracy": 0.7940887585282326, "num_tokens": 519555097.0, "step": 16279 }, { "entropy": 0.5639263298362494, "epoch": 1.497846475868454, "grad_norm": 0.15447494387626648, "learning_rate": 5.007513724046984e-05, "loss": 0.5685, "mean_token_accuracy": 0.8275305554270744, "num_tokens": 519587440.0, "step": 16280 }, { "entropy": 0.6441043578088284, "epoch": 1.4979384822398951, "grad_norm": 0.16203239560127258, "learning_rate": 5.007207041432821e-05, "loss": 0.6279, "mean_token_accuracy": 0.8061078116297722, "num_tokens": 519619383.0, "step": 16281 }, { "entropy": 0.6773220864124596, "epoch": 1.4980304886113363, "grad_norm": 0.15434102714061737, "learning_rate": 5.006900358818659e-05, "loss": 0.6528, "mean_token_accuracy": 0.80196463316679, "num_tokens": 519651013.0, "step": 16282 }, { "entropy": 0.5783246653154492, "epoch": 1.4981224949827776, "grad_norm": 0.15285392105579376, "learning_rate": 5.0065936762044964e-05, "loss": 0.5657, "mean_token_accuracy": 0.823984831571579, "num_tokens": 519682517.0, "step": 16283 }, { "entropy": 0.6785071063786745, "epoch": 1.4982145013542187, "grad_norm": 0.16220736503601074, "learning_rate": 5.006286993590333e-05, "loss": 0.6664, "mean_token_accuracy": 0.792412132024765, "num_tokens": 519713827.0, "step": 16284 }, { "entropy": 0.6664417143911123, "epoch": 1.49830650772566, "grad_norm": 0.15951085090637207, "learning_rate": 5.005980310976171e-05, "loss": 0.6447, "mean_token_accuracy": 0.8002356477081776, "num_tokens": 519744835.0, "step": 16285 }, { "entropy": 0.6308552001137286, "epoch": 1.4983985140971012, "grad_norm": 0.15804430842399597, "learning_rate": 5.005673628362009e-05, "loss": 0.6268, "mean_token_accuracy": 0.8100051768124104, "num_tokens": 519777473.0, "step": 16286 }, { "entropy": 0.6033377489075065, "epoch": 1.4984905204685424, "grad_norm": 0.1540280133485794, "learning_rate": 5.0053669457478456e-05, "loss": 0.5916, "mean_token_accuracy": 0.8178284578025341, "num_tokens": 519809544.0, "step": 16287 }, { "entropy": 0.6175946281291544, "epoch": 1.4985825268399837, "grad_norm": 0.15588587522506714, "learning_rate": 5.005060263133683e-05, "loss": 0.6122, "mean_token_accuracy": 0.8149074427783489, "num_tokens": 519841607.0, "step": 16288 }, { "entropy": 0.46615503961220384, "epoch": 1.4986745332114249, "grad_norm": 0.14136573672294617, "learning_rate": 5.00475358051952e-05, "loss": 0.4541, "mean_token_accuracy": 0.8593435361981392, "num_tokens": 519873770.0, "step": 16289 }, { "entropy": 0.6025034720078111, "epoch": 1.4987665395828662, "grad_norm": 0.15841516852378845, "learning_rate": 5.004446897905358e-05, "loss": 0.6028, "mean_token_accuracy": 0.8158068805932999, "num_tokens": 519906181.0, "step": 16290 }, { "entropy": 0.594915421679616, "epoch": 1.4988585459543073, "grad_norm": 0.14835573732852936, "learning_rate": 5.0041402152911955e-05, "loss": 0.5832, "mean_token_accuracy": 0.8199011199176311, "num_tokens": 519937964.0, "step": 16291 }, { "entropy": 0.6991227306425571, "epoch": 1.4989505523257485, "grad_norm": 0.16599014401435852, "learning_rate": 5.003833532677032e-05, "loss": 0.696, "mean_token_accuracy": 0.7892464362084866, "num_tokens": 519969638.0, "step": 16292 }, { "entropy": 0.5880889277905226, "epoch": 1.4990425586971898, "grad_norm": 0.1504155397415161, "learning_rate": 5.0035268500628704e-05, "loss": 0.5887, "mean_token_accuracy": 0.8231081552803516, "num_tokens": 520001884.0, "step": 16293 }, { "entropy": 0.5361072532832623, "epoch": 1.499134565068631, "grad_norm": 0.15097536146640778, "learning_rate": 5.003220167448708e-05, "loss": 0.5201, "mean_token_accuracy": 0.8379601091146469, "num_tokens": 520033946.0, "step": 16294 }, { "entropy": 0.6614172365516424, "epoch": 1.4992265714400723, "grad_norm": 0.16643927991390228, "learning_rate": 5.002913484834545e-05, "loss": 0.6605, "mean_token_accuracy": 0.80240473523736, "num_tokens": 520065922.0, "step": 16295 }, { "entropy": 0.5925206979736686, "epoch": 1.4993185778115135, "grad_norm": 0.15476907789707184, "learning_rate": 5.002606802220382e-05, "loss": 0.5858, "mean_token_accuracy": 0.8212395459413528, "num_tokens": 520097996.0, "step": 16296 }, { "entropy": 0.6498627765104175, "epoch": 1.4994105841829546, "grad_norm": 0.15443289279937744, "learning_rate": 5.00230011960622e-05, "loss": 0.6299, "mean_token_accuracy": 0.8038502521812916, "num_tokens": 520129303.0, "step": 16297 }, { "entropy": 0.4557531587779522, "epoch": 1.499502590554396, "grad_norm": 0.15332429111003876, "learning_rate": 5.001993436992057e-05, "loss": 0.4377, "mean_token_accuracy": 0.8641344383358955, "num_tokens": 520161275.0, "step": 16298 }, { "entropy": 0.5607723286375403, "epoch": 1.499594596925837, "grad_norm": 0.1524176001548767, "learning_rate": 5.0016867543778945e-05, "loss": 0.5475, "mean_token_accuracy": 0.8290630728006363, "num_tokens": 520192837.0, "step": 16299 }, { "entropy": 0.5931360349059105, "epoch": 1.4996866032972784, "grad_norm": 0.15756237506866455, "learning_rate": 5.001380071763731e-05, "loss": 0.5791, "mean_token_accuracy": 0.8204130157828331, "num_tokens": 520225216.0, "step": 16300 }, { "entropy": 0.5759957628324628, "epoch": 1.4997786096687196, "grad_norm": 0.1571849137544632, "learning_rate": 5.00107338914957e-05, "loss": 0.5564, "mean_token_accuracy": 0.8281769454479218, "num_tokens": 520257001.0, "step": 16301 }, { "entropy": 0.6319784559309483, "epoch": 1.4998706160401607, "grad_norm": 0.15942931175231934, "learning_rate": 5.000766706535407e-05, "loss": 0.6305, "mean_token_accuracy": 0.8121825158596039, "num_tokens": 520288551.0, "step": 16302 }, { "entropy": 0.7025346700102091, "epoch": 1.499962622411602, "grad_norm": 0.16002918779850006, "learning_rate": 5.000460023921244e-05, "loss": 0.6866, "mean_token_accuracy": 0.7883297726511955, "num_tokens": 520320679.0, "step": 16303 }, { "entropy": 0.7363336849957705, "epoch": 1.5000546287830432, "grad_norm": 0.16545289754867554, "learning_rate": 5.000153341307081e-05, "loss": 0.7331, "mean_token_accuracy": 0.7801949456334114, "num_tokens": 520352257.0, "step": 16304 }, { "entropy": 0.6765636149793863, "epoch": 1.5001466351544845, "grad_norm": 0.1534818708896637, "learning_rate": 4.9998466586929186e-05, "loss": 0.6516, "mean_token_accuracy": 0.7969535477459431, "num_tokens": 520383855.0, "step": 16305 }, { "entropy": 0.742636626586318, "epoch": 1.5002386415259257, "grad_norm": 0.16392290592193604, "learning_rate": 4.999539976078757e-05, "loss": 0.7373, "mean_token_accuracy": 0.7769818790256977, "num_tokens": 520415442.0, "step": 16306 }, { "entropy": 0.7794741466641426, "epoch": 1.5003306478973668, "grad_norm": 0.16315583884716034, "learning_rate": 4.9992332934645936e-05, "loss": 0.7657, "mean_token_accuracy": 0.7698907405138016, "num_tokens": 520447252.0, "step": 16307 }, { "entropy": 0.6145577533170581, "epoch": 1.5004226542688082, "grad_norm": 0.15769991278648376, "learning_rate": 4.998926610850431e-05, "loss": 0.6001, "mean_token_accuracy": 0.8164447583258152, "num_tokens": 520478994.0, "step": 16308 }, { "entropy": 0.6835497571155429, "epoch": 1.5005146606402493, "grad_norm": 0.16329145431518555, "learning_rate": 4.9986199282362685e-05, "loss": 0.6788, "mean_token_accuracy": 0.7974919304251671, "num_tokens": 520510478.0, "step": 16309 }, { "entropy": 0.6171260643750429, "epoch": 1.5006066670116907, "grad_norm": 0.1596706211566925, "learning_rate": 4.998313245622106e-05, "loss": 0.6146, "mean_token_accuracy": 0.8141146786510944, "num_tokens": 520542807.0, "step": 16310 }, { "entropy": 0.6589476228691638, "epoch": 1.5006986733831318, "grad_norm": 0.16131478548049927, "learning_rate": 4.9980065630079434e-05, "loss": 0.653, "mean_token_accuracy": 0.8049104660749435, "num_tokens": 520575290.0, "step": 16311 }, { "entropy": 0.5669786669313908, "epoch": 1.500790679754573, "grad_norm": 0.146406352519989, "learning_rate": 4.997699880393781e-05, "loss": 0.5589, "mean_token_accuracy": 0.8267541155219078, "num_tokens": 520606831.0, "step": 16312 }, { "entropy": 0.600586992688477, "epoch": 1.5008826861260143, "grad_norm": 0.1711856722831726, "learning_rate": 4.997393197779618e-05, "loss": 0.587, "mean_token_accuracy": 0.8176977038383484, "num_tokens": 520638430.0, "step": 16313 }, { "entropy": 0.6144288573414087, "epoch": 1.5009746924974554, "grad_norm": 0.15748196840286255, "learning_rate": 4.997086515165456e-05, "loss": 0.6118, "mean_token_accuracy": 0.8124257400631905, "num_tokens": 520670138.0, "step": 16314 }, { "entropy": 0.48265715688467026, "epoch": 1.5010666988688968, "grad_norm": 0.15043480694293976, "learning_rate": 4.9967798325512926e-05, "loss": 0.4703, "mean_token_accuracy": 0.8531522415578365, "num_tokens": 520702297.0, "step": 16315 }, { "entropy": 0.5167260449379683, "epoch": 1.501158705240338, "grad_norm": 0.15788580477237701, "learning_rate": 4.99647314993713e-05, "loss": 0.5136, "mean_token_accuracy": 0.8390432707965374, "num_tokens": 520734685.0, "step": 16316 }, { "entropy": 0.5884448327124119, "epoch": 1.501250711611779, "grad_norm": 0.1548207551240921, "learning_rate": 4.9961664673229675e-05, "loss": 0.5881, "mean_token_accuracy": 0.8166767843067646, "num_tokens": 520766454.0, "step": 16317 }, { "entropy": 0.565355908125639, "epoch": 1.5013427179832204, "grad_norm": 0.15548041462898254, "learning_rate": 4.995859784708805e-05, "loss": 0.5461, "mean_token_accuracy": 0.8294635340571404, "num_tokens": 520798453.0, "step": 16318 }, { "entropy": 0.5132227446883917, "epoch": 1.5014347243546615, "grad_norm": 0.14797142148017883, "learning_rate": 4.9955531020946425e-05, "loss": 0.4909, "mean_token_accuracy": 0.8494327664375305, "num_tokens": 520830098.0, "step": 16319 }, { "entropy": 0.6637027766555548, "epoch": 1.5015267307261029, "grad_norm": 0.16541461646556854, "learning_rate": 4.99524641948048e-05, "loss": 0.663, "mean_token_accuracy": 0.8005969114601612, "num_tokens": 520862294.0, "step": 16320 }, { "entropy": 0.6606342559680343, "epoch": 1.501618737097544, "grad_norm": 0.16691948473453522, "learning_rate": 4.9949397368663174e-05, "loss": 0.6624, "mean_token_accuracy": 0.8005809187889099, "num_tokens": 520893889.0, "step": 16321 }, { "entropy": 0.6170861590653658, "epoch": 1.5017107434689851, "grad_norm": 0.15392425656318665, "learning_rate": 4.994633054252155e-05, "loss": 0.6103, "mean_token_accuracy": 0.814464621245861, "num_tokens": 520925994.0, "step": 16322 }, { "entropy": 0.5764527982100844, "epoch": 1.5018027498404265, "grad_norm": 0.15187707543373108, "learning_rate": 4.994326371637992e-05, "loss": 0.551, "mean_token_accuracy": 0.8243389204144478, "num_tokens": 520957275.0, "step": 16323 }, { "entropy": 0.7157519850879908, "epoch": 1.5018947562118676, "grad_norm": 0.16653192043304443, "learning_rate": 4.994019689023829e-05, "loss": 0.6938, "mean_token_accuracy": 0.7902208007872105, "num_tokens": 520988439.0, "step": 16324 }, { "entropy": 0.6026729568839073, "epoch": 1.501986762583309, "grad_norm": 0.16110284626483917, "learning_rate": 4.993713006409667e-05, "loss": 0.5945, "mean_token_accuracy": 0.8186162486672401, "num_tokens": 521020039.0, "step": 16325 }, { "entropy": 0.6274428977631032, "epoch": 1.5020787689547501, "grad_norm": 0.16076160967350006, "learning_rate": 4.993406323795504e-05, "loss": 0.6216, "mean_token_accuracy": 0.8089384809136391, "num_tokens": 521051699.0, "step": 16326 }, { "entropy": 0.61060088314116, "epoch": 1.5021707753261913, "grad_norm": 0.15861888229846954, "learning_rate": 4.993099641181342e-05, "loss": 0.593, "mean_token_accuracy": 0.8178570047020912, "num_tokens": 521083574.0, "step": 16327 }, { "entropy": 0.6468413043767214, "epoch": 1.5022627816976326, "grad_norm": 0.1576913446187973, "learning_rate": 4.992792958567179e-05, "loss": 0.6402, "mean_token_accuracy": 0.8004915416240692, "num_tokens": 521115558.0, "step": 16328 }, { "entropy": 0.5241647940129042, "epoch": 1.5023547880690737, "grad_norm": 0.15202602744102478, "learning_rate": 4.9924862759530164e-05, "loss": 0.5133, "mean_token_accuracy": 0.8410617336630821, "num_tokens": 521147925.0, "step": 16329 }, { "entropy": 0.5466732131317258, "epoch": 1.502446794440515, "grad_norm": 0.1539016216993332, "learning_rate": 4.992179593338854e-05, "loss": 0.5281, "mean_token_accuracy": 0.8350077867507935, "num_tokens": 521179424.0, "step": 16330 }, { "entropy": 0.6362898498773575, "epoch": 1.5025388008119562, "grad_norm": 0.15439626574516296, "learning_rate": 4.9918729107246914e-05, "loss": 0.6034, "mean_token_accuracy": 0.8098659478127956, "num_tokens": 521210426.0, "step": 16331 }, { "entropy": 0.7003332730382681, "epoch": 1.5026308071833974, "grad_norm": 0.1629142016172409, "learning_rate": 4.991566228110529e-05, "loss": 0.6813, "mean_token_accuracy": 0.7931044325232506, "num_tokens": 521242715.0, "step": 16332 }, { "entropy": 0.672012778930366, "epoch": 1.5027228135548387, "grad_norm": 0.1583200842142105, "learning_rate": 4.991259545496366e-05, "loss": 0.6507, "mean_token_accuracy": 0.8012231215834618, "num_tokens": 521274533.0, "step": 16333 }, { "entropy": 0.554248783737421, "epoch": 1.5028148199262799, "grad_norm": 0.15057647228240967, "learning_rate": 4.990952862882203e-05, "loss": 0.5257, "mean_token_accuracy": 0.8337250016629696, "num_tokens": 521305606.0, "step": 16334 }, { "entropy": 0.6919771060347557, "epoch": 1.5029068262977212, "grad_norm": 0.16147315502166748, "learning_rate": 4.990646180268041e-05, "loss": 0.6915, "mean_token_accuracy": 0.7914533466100693, "num_tokens": 521337507.0, "step": 16335 }, { "entropy": 0.590173838660121, "epoch": 1.5029988326691623, "grad_norm": 0.14875911176204681, "learning_rate": 4.990339497653878e-05, "loss": 0.5806, "mean_token_accuracy": 0.8264310210943222, "num_tokens": 521369417.0, "step": 16336 }, { "entropy": 0.5330926249735057, "epoch": 1.5030908390406035, "grad_norm": 0.15171056985855103, "learning_rate": 4.9900328150397155e-05, "loss": 0.5141, "mean_token_accuracy": 0.8418653458356857, "num_tokens": 521401946.0, "step": 16337 }, { "entropy": 0.6180866523645818, "epoch": 1.5031828454120448, "grad_norm": 0.1616845428943634, "learning_rate": 4.989726132425553e-05, "loss": 0.617, "mean_token_accuracy": 0.8095943331718445, "num_tokens": 521432986.0, "step": 16338 }, { "entropy": 0.6826612427830696, "epoch": 1.503274851783486, "grad_norm": 0.16339337825775146, "learning_rate": 4.9894194498113904e-05, "loss": 0.6915, "mean_token_accuracy": 0.7894563935697079, "num_tokens": 521464525.0, "step": 16339 }, { "entropy": 0.6250942945480347, "epoch": 1.5033668581549273, "grad_norm": 0.16019637882709503, "learning_rate": 4.989112767197228e-05, "loss": 0.6057, "mean_token_accuracy": 0.8118110448122025, "num_tokens": 521495012.0, "step": 16340 }, { "entropy": 0.5357760721817613, "epoch": 1.5034588645263685, "grad_norm": 0.15489044785499573, "learning_rate": 4.988806084583065e-05, "loss": 0.5289, "mean_token_accuracy": 0.8377189375460148, "num_tokens": 521527564.0, "step": 16341 }, { "entropy": 0.6096489988267422, "epoch": 1.5035508708978096, "grad_norm": 0.15040992200374603, "learning_rate": 4.988499401968902e-05, "loss": 0.5964, "mean_token_accuracy": 0.8184109851717949, "num_tokens": 521559572.0, "step": 16342 }, { "entropy": 0.6828893842175603, "epoch": 1.503642877269251, "grad_norm": 0.16986243426799774, "learning_rate": 4.98819271935474e-05, "loss": 0.6717, "mean_token_accuracy": 0.7996262274682522, "num_tokens": 521591156.0, "step": 16343 }, { "entropy": 0.605214532930404, "epoch": 1.503734883640692, "grad_norm": 0.15742000937461853, "learning_rate": 4.987886036740577e-05, "loss": 0.6004, "mean_token_accuracy": 0.8149600327014923, "num_tokens": 521623391.0, "step": 16344 }, { "entropy": 0.6123142298310995, "epoch": 1.5038268900121334, "grad_norm": 0.16112332046031952, "learning_rate": 4.987579354126415e-05, "loss": 0.6084, "mean_token_accuracy": 0.814785324037075, "num_tokens": 521656023.0, "step": 16345 }, { "entropy": 0.5889260936528444, "epoch": 1.5039188963835746, "grad_norm": 0.15480844676494598, "learning_rate": 4.987272671512252e-05, "loss": 0.5748, "mean_token_accuracy": 0.8216128274798393, "num_tokens": 521687864.0, "step": 16346 }, { "entropy": 0.590854100883007, "epoch": 1.5040109027550157, "grad_norm": 0.15622805058956146, "learning_rate": 4.9869659888980894e-05, "loss": 0.5831, "mean_token_accuracy": 0.8246207609772682, "num_tokens": 521719707.0, "step": 16347 }, { "entropy": 0.6823996622115374, "epoch": 1.504102909126457, "grad_norm": 0.16466018557548523, "learning_rate": 4.986659306283927e-05, "loss": 0.6786, "mean_token_accuracy": 0.7959307320415974, "num_tokens": 521751275.0, "step": 16348 }, { "entropy": 0.6200321642681956, "epoch": 1.5041949154978982, "grad_norm": 0.1539524793624878, "learning_rate": 4.9863526236697644e-05, "loss": 0.6007, "mean_token_accuracy": 0.8165811561048031, "num_tokens": 521782991.0, "step": 16349 }, { "entropy": 0.5988291455432773, "epoch": 1.5042869218693395, "grad_norm": 0.16265030205249786, "learning_rate": 4.986045941055602e-05, "loss": 0.5876, "mean_token_accuracy": 0.8198855109512806, "num_tokens": 521815238.0, "step": 16350 }, { "entropy": 0.6606251541525126, "epoch": 1.5043789282407807, "grad_norm": 0.15285958349704742, "learning_rate": 4.985739258441439e-05, "loss": 0.6444, "mean_token_accuracy": 0.7984039708971977, "num_tokens": 521847061.0, "step": 16351 }, { "entropy": 0.6123846657574177, "epoch": 1.5044709346122218, "grad_norm": 0.15396662056446075, "learning_rate": 4.985432575827277e-05, "loss": 0.5983, "mean_token_accuracy": 0.8138068281114101, "num_tokens": 521879125.0, "step": 16352 }, { "entropy": 0.6343252882361412, "epoch": 1.5045629409836632, "grad_norm": 0.16085012257099152, "learning_rate": 4.985125893213114e-05, "loss": 0.6325, "mean_token_accuracy": 0.8045223876833916, "num_tokens": 521911053.0, "step": 16353 }, { "entropy": 0.516839895863086, "epoch": 1.5046549473551043, "grad_norm": 0.1567508429288864, "learning_rate": 4.984819210598952e-05, "loss": 0.5036, "mean_token_accuracy": 0.8465340286493301, "num_tokens": 521943078.0, "step": 16354 }, { "entropy": 0.5136163460556418, "epoch": 1.5047469537265457, "grad_norm": 0.14551512897014618, "learning_rate": 4.9845125279847885e-05, "loss": 0.505, "mean_token_accuracy": 0.8469688259065151, "num_tokens": 521975243.0, "step": 16355 }, { "entropy": 0.6883100252598524, "epoch": 1.5048389600979868, "grad_norm": 0.1614481657743454, "learning_rate": 4.9842058453706266e-05, "loss": 0.6854, "mean_token_accuracy": 0.7953351065516472, "num_tokens": 522007336.0, "step": 16356 }, { "entropy": 0.5746427476406097, "epoch": 1.504930966469428, "grad_norm": 0.15419307351112366, "learning_rate": 4.9838991627564634e-05, "loss": 0.564, "mean_token_accuracy": 0.8265024647116661, "num_tokens": 522039816.0, "step": 16357 }, { "entropy": 0.7247334457933903, "epoch": 1.5050229728408693, "grad_norm": 0.15982313454151154, "learning_rate": 4.983592480142301e-05, "loss": 0.7269, "mean_token_accuracy": 0.7811844870448112, "num_tokens": 522071975.0, "step": 16358 }, { "entropy": 0.49009907338768244, "epoch": 1.5051149792123104, "grad_norm": 0.14270493388175964, "learning_rate": 4.9832857975281383e-05, "loss": 0.4815, "mean_token_accuracy": 0.8486810252070427, "num_tokens": 522104271.0, "step": 16359 }, { "entropy": 0.6923829847946763, "epoch": 1.5052069855837518, "grad_norm": 0.1629944145679474, "learning_rate": 4.982979114913976e-05, "loss": 0.6843, "mean_token_accuracy": 0.7909551374614239, "num_tokens": 522135201.0, "step": 16360 }, { "entropy": 0.5499452576041222, "epoch": 1.505298991955193, "grad_norm": 0.14778843522071838, "learning_rate": 4.982672432299813e-05, "loss": 0.5478, "mean_token_accuracy": 0.8332520090043545, "num_tokens": 522167777.0, "step": 16361 }, { "entropy": 0.5414037951268256, "epoch": 1.505390998326634, "grad_norm": 0.1517229825258255, "learning_rate": 4.982365749685651e-05, "loss": 0.5362, "mean_token_accuracy": 0.8390632644295692, "num_tokens": 522200545.0, "step": 16362 }, { "entropy": 0.651836359873414, "epoch": 1.5054830046980754, "grad_norm": 0.15506939589977264, "learning_rate": 4.9820590670714875e-05, "loss": 0.6445, "mean_token_accuracy": 0.8046170324087143, "num_tokens": 522232010.0, "step": 16363 }, { "entropy": 0.6348950816318393, "epoch": 1.5055750110695165, "grad_norm": 0.15664079785346985, "learning_rate": 4.981752384457326e-05, "loss": 0.6209, "mean_token_accuracy": 0.8099624514579773, "num_tokens": 522264207.0, "step": 16364 }, { "entropy": 0.6229902543127537, "epoch": 1.5056670174409579, "grad_norm": 0.15486881136894226, "learning_rate": 4.9814457018431625e-05, "loss": 0.608, "mean_token_accuracy": 0.8143616318702698, "num_tokens": 522296310.0, "step": 16365 }, { "entropy": 0.661310900002718, "epoch": 1.505759023812399, "grad_norm": 0.1638251692056656, "learning_rate": 4.9811390192290006e-05, "loss": 0.6589, "mean_token_accuracy": 0.7962377034127712, "num_tokens": 522327130.0, "step": 16366 }, { "entropy": 0.6002229247242212, "epoch": 1.5058510301838401, "grad_norm": 0.15928366780281067, "learning_rate": 4.9808323366148374e-05, "loss": 0.5898, "mean_token_accuracy": 0.8161758594214916, "num_tokens": 522358537.0, "step": 16367 }, { "entropy": 0.68096605502069, "epoch": 1.5059430365552815, "grad_norm": 0.15672406554222107, "learning_rate": 4.980525654000675e-05, "loss": 0.6735, "mean_token_accuracy": 0.793179627507925, "num_tokens": 522390928.0, "step": 16368 }, { "entropy": 0.6116173304617405, "epoch": 1.5060350429267226, "grad_norm": 0.1609281450510025, "learning_rate": 4.980218971386512e-05, "loss": 0.5947, "mean_token_accuracy": 0.8193437233567238, "num_tokens": 522423117.0, "step": 16369 }, { "entropy": 0.6446241661906242, "epoch": 1.506127049298164, "grad_norm": 0.15380996465682983, "learning_rate": 4.97991228877235e-05, "loss": 0.6399, "mean_token_accuracy": 0.8038244545459747, "num_tokens": 522455328.0, "step": 16370 }, { "entropy": 0.664314977824688, "epoch": 1.5062190556696051, "grad_norm": 0.16039705276489258, "learning_rate": 4.979605606158187e-05, "loss": 0.6615, "mean_token_accuracy": 0.7959950007498264, "num_tokens": 522486662.0, "step": 16371 }, { "entropy": 0.5053537769708782, "epoch": 1.5063110620410463, "grad_norm": 0.14630873501300812, "learning_rate": 4.979298923544025e-05, "loss": 0.478, "mean_token_accuracy": 0.8469624146819115, "num_tokens": 522518179.0, "step": 16372 }, { "entropy": 0.6810359749943018, "epoch": 1.5064030684124876, "grad_norm": 0.1652657389640808, "learning_rate": 4.9789922409298615e-05, "loss": 0.6677, "mean_token_accuracy": 0.797539509832859, "num_tokens": 522548889.0, "step": 16373 }, { "entropy": 0.511934501118958, "epoch": 1.5064950747839287, "grad_norm": 0.14738023281097412, "learning_rate": 4.9786855583156996e-05, "loss": 0.5024, "mean_token_accuracy": 0.8443538323044777, "num_tokens": 522580461.0, "step": 16374 }, { "entropy": 0.6109574665315449, "epoch": 1.50658708115537, "grad_norm": 0.15068316459655762, "learning_rate": 4.9783788757015364e-05, "loss": 0.5988, "mean_token_accuracy": 0.8178425133228302, "num_tokens": 522612839.0, "step": 16375 }, { "entropy": 0.6887601399794221, "epoch": 1.5066790875268112, "grad_norm": 0.17140604555606842, "learning_rate": 4.978072193087374e-05, "loss": 0.6941, "mean_token_accuracy": 0.7933692522346973, "num_tokens": 522644274.0, "step": 16376 }, { "entropy": 0.6364605091512203, "epoch": 1.5067710938982524, "grad_norm": 0.16204366087913513, "learning_rate": 4.9777655104732114e-05, "loss": 0.6191, "mean_token_accuracy": 0.8093516826629639, "num_tokens": 522675687.0, "step": 16377 }, { "entropy": 0.7081547882407904, "epoch": 1.5068631002696937, "grad_norm": 0.168548122048378, "learning_rate": 4.977458827859049e-05, "loss": 0.7062, "mean_token_accuracy": 0.7828826904296875, "num_tokens": 522707312.0, "step": 16378 }, { "entropy": 0.6621488619130105, "epoch": 1.5069551066411349, "grad_norm": 0.15656279027462006, "learning_rate": 4.977152145244886e-05, "loss": 0.6608, "mean_token_accuracy": 0.796688124537468, "num_tokens": 522739333.0, "step": 16379 }, { "entropy": 0.6713601090013981, "epoch": 1.5070471130125762, "grad_norm": 0.15973584353923798, "learning_rate": 4.976845462630724e-05, "loss": 0.6631, "mean_token_accuracy": 0.797757014632225, "num_tokens": 522771194.0, "step": 16380 }, { "entropy": 0.6710949223488569, "epoch": 1.5071391193840173, "grad_norm": 0.16041572391986847, "learning_rate": 4.976538780016561e-05, "loss": 0.6688, "mean_token_accuracy": 0.7955072075128555, "num_tokens": 522803190.0, "step": 16381 }, { "entropy": 0.7700161170214415, "epoch": 1.5072311257554585, "grad_norm": 0.16035889089107513, "learning_rate": 4.976232097402399e-05, "loss": 0.7542, "mean_token_accuracy": 0.7684964910149574, "num_tokens": 522835372.0, "step": 16382 }, { "entropy": 0.6049975529313087, "epoch": 1.5073231321268998, "grad_norm": 0.15574412047863007, "learning_rate": 4.975925414788236e-05, "loss": 0.5979, "mean_token_accuracy": 0.815814733505249, "num_tokens": 522867552.0, "step": 16383 }, { "entropy": 0.6840643305331469, "epoch": 1.507415138498341, "grad_norm": 0.16440121829509735, "learning_rate": 4.975618732174073e-05, "loss": 0.656, "mean_token_accuracy": 0.7950108200311661, "num_tokens": 522898991.0, "step": 16384 }, { "entropy": 0.6332362778484821, "epoch": 1.5075071448697823, "grad_norm": 0.15274281799793243, "learning_rate": 4.975312049559911e-05, "loss": 0.6264, "mean_token_accuracy": 0.8071577586233616, "num_tokens": 522930679.0, "step": 16385 }, { "entropy": 0.610038090031594, "epoch": 1.5075991512412235, "grad_norm": 0.15372918546199799, "learning_rate": 4.975005366945748e-05, "loss": 0.5969, "mean_token_accuracy": 0.8149901032447815, "num_tokens": 522962916.0, "step": 16386 }, { "entropy": 0.5279651284217834, "epoch": 1.5076911576126646, "grad_norm": 0.15311846137046814, "learning_rate": 4.974698684331586e-05, "loss": 0.5098, "mean_token_accuracy": 0.8416672646999359, "num_tokens": 522994928.0, "step": 16387 }, { "entropy": 0.5125464517623186, "epoch": 1.507783163984106, "grad_norm": 0.15288028120994568, "learning_rate": 4.974392001717423e-05, "loss": 0.519, "mean_token_accuracy": 0.8394517377018929, "num_tokens": 523025942.0, "step": 16388 }, { "entropy": 0.5405121315270662, "epoch": 1.507875170355547, "grad_norm": 0.15855994820594788, "learning_rate": 4.97408531910326e-05, "loss": 0.5431, "mean_token_accuracy": 0.8373795635998249, "num_tokens": 523058253.0, "step": 16389 }, { "entropy": 0.6258140671998262, "epoch": 1.5079671767269884, "grad_norm": 0.15728384256362915, "learning_rate": 4.973778636489098e-05, "loss": 0.6175, "mean_token_accuracy": 0.8078401833772659, "num_tokens": 523090047.0, "step": 16390 }, { "entropy": 0.6542252227663994, "epoch": 1.5080591830984296, "grad_norm": 0.16102662682533264, "learning_rate": 4.973471953874935e-05, "loss": 0.6486, "mean_token_accuracy": 0.8007468394935131, "num_tokens": 523121073.0, "step": 16391 }, { "entropy": 0.6405909806489944, "epoch": 1.5081511894698707, "grad_norm": 0.15657593309879303, "learning_rate": 4.9731652712607726e-05, "loss": 0.6269, "mean_token_accuracy": 0.8057692758738995, "num_tokens": 523152974.0, "step": 16392 }, { "entropy": 0.5038892542943358, "epoch": 1.508243195841312, "grad_norm": 0.14662683010101318, "learning_rate": 4.97285858864661e-05, "loss": 0.4897, "mean_token_accuracy": 0.8463908359408379, "num_tokens": 523185051.0, "step": 16393 }, { "entropy": 0.5880353301763535, "epoch": 1.5083352022127532, "grad_norm": 0.15613889694213867, "learning_rate": 4.972551906032447e-05, "loss": 0.5732, "mean_token_accuracy": 0.8173594735562801, "num_tokens": 523216556.0, "step": 16394 }, { "entropy": 0.6148339966312051, "epoch": 1.5084272085841945, "grad_norm": 0.15645168721675873, "learning_rate": 4.972245223418285e-05, "loss": 0.6187, "mean_token_accuracy": 0.8116189315915108, "num_tokens": 523249176.0, "step": 16395 }, { "entropy": 0.5655514486134052, "epoch": 1.5085192149556357, "grad_norm": 0.1485845446586609, "learning_rate": 4.971938540804122e-05, "loss": 0.5433, "mean_token_accuracy": 0.829513181000948, "num_tokens": 523280897.0, "step": 16396 }, { "entropy": 0.5891941310837865, "epoch": 1.5086112213270768, "grad_norm": 0.14833763241767883, "learning_rate": 4.971631858189959e-05, "loss": 0.5753, "mean_token_accuracy": 0.8239930272102356, "num_tokens": 523313137.0, "step": 16397 }, { "entropy": 0.5971573889255524, "epoch": 1.5087032276985182, "grad_norm": 0.15337781608104706, "learning_rate": 4.971325175575797e-05, "loss": 0.5947, "mean_token_accuracy": 0.8214845359325409, "num_tokens": 523344664.0, "step": 16398 }, { "entropy": 0.5971156619489193, "epoch": 1.5087952340699593, "grad_norm": 0.15257154405117035, "learning_rate": 4.971018492961634e-05, "loss": 0.5762, "mean_token_accuracy": 0.8205722942948341, "num_tokens": 523376542.0, "step": 16399 }, { "entropy": 0.517319900682196, "epoch": 1.5088872404414007, "grad_norm": 0.14357848465442657, "learning_rate": 4.970711810347472e-05, "loss": 0.5109, "mean_token_accuracy": 0.8417353853583336, "num_tokens": 523408788.0, "step": 16400 }, { "entropy": 0.5123237743973732, "epoch": 1.5089792468128418, "grad_norm": 0.15082401037216187, "learning_rate": 4.970405127733309e-05, "loss": 0.5025, "mean_token_accuracy": 0.8432066068053246, "num_tokens": 523441246.0, "step": 16401 }, { "entropy": 0.6093061715364456, "epoch": 1.509071253184283, "grad_norm": 0.15399259328842163, "learning_rate": 4.970098445119146e-05, "loss": 0.6133, "mean_token_accuracy": 0.8137886039912701, "num_tokens": 523472672.0, "step": 16402 }, { "entropy": 0.6982007715851068, "epoch": 1.5091632595557243, "grad_norm": 0.16020990908145905, "learning_rate": 4.969791762504984e-05, "loss": 0.6899, "mean_token_accuracy": 0.7922412753105164, "num_tokens": 523503641.0, "step": 16403 }, { "entropy": 0.591031963005662, "epoch": 1.5092552659271654, "grad_norm": 0.14901219308376312, "learning_rate": 4.969485079890821e-05, "loss": 0.5757, "mean_token_accuracy": 0.8229443095624447, "num_tokens": 523534947.0, "step": 16404 }, { "entropy": 0.545577097684145, "epoch": 1.5093472722986068, "grad_norm": 0.16748638451099396, "learning_rate": 4.969178397276659e-05, "loss": 0.5249, "mean_token_accuracy": 0.8406426757574081, "num_tokens": 523566579.0, "step": 16405 }, { "entropy": 0.6087081488221884, "epoch": 1.509439278670048, "grad_norm": 0.1503390371799469, "learning_rate": 4.968871714662496e-05, "loss": 0.5973, "mean_token_accuracy": 0.8175829611718655, "num_tokens": 523598336.0, "step": 16406 }, { "entropy": 0.4978989977389574, "epoch": 1.509531285041489, "grad_norm": 0.14492081105709076, "learning_rate": 4.968565032048333e-05, "loss": 0.4861, "mean_token_accuracy": 0.8511750139296055, "num_tokens": 523630510.0, "step": 16407 }, { "entropy": 0.6004605125635862, "epoch": 1.5096232914129304, "grad_norm": 0.1493738442659378, "learning_rate": 4.968258349434171e-05, "loss": 0.5775, "mean_token_accuracy": 0.8216243498027325, "num_tokens": 523662080.0, "step": 16408 }, { "entropy": 0.7106331698596478, "epoch": 1.5097152977843715, "grad_norm": 0.16376349329948425, "learning_rate": 4.967951666820008e-05, "loss": 0.7077, "mean_token_accuracy": 0.786718025803566, "num_tokens": 523694266.0, "step": 16409 }, { "entropy": 0.5739306006580591, "epoch": 1.5098073041558129, "grad_norm": 0.15150421857833862, "learning_rate": 4.9676449842058457e-05, "loss": 0.5576, "mean_token_accuracy": 0.8294266238808632, "num_tokens": 523726330.0, "step": 16410 }, { "entropy": 0.7084923181682825, "epoch": 1.509899310527254, "grad_norm": 0.16280624270439148, "learning_rate": 4.967338301591683e-05, "loss": 0.7189, "mean_token_accuracy": 0.7853424660861492, "num_tokens": 523758352.0, "step": 16411 }, { "entropy": 0.5280152820050716, "epoch": 1.5099913168986951, "grad_norm": 0.15145239233970642, "learning_rate": 4.9670316189775206e-05, "loss": 0.5154, "mean_token_accuracy": 0.8397051580250263, "num_tokens": 523790263.0, "step": 16412 }, { "entropy": 0.5779776112176478, "epoch": 1.5100833232701365, "grad_norm": 0.15939028561115265, "learning_rate": 4.966724936363358e-05, "loss": 0.5658, "mean_token_accuracy": 0.825232345610857, "num_tokens": 523821311.0, "step": 16413 }, { "entropy": 0.5398863302543759, "epoch": 1.5101753296415776, "grad_norm": 0.1521347463130951, "learning_rate": 4.9664182537491955e-05, "loss": 0.5251, "mean_token_accuracy": 0.8375434540212154, "num_tokens": 523853022.0, "step": 16414 }, { "entropy": 0.5419476022943854, "epoch": 1.510267336013019, "grad_norm": 0.1546827256679535, "learning_rate": 4.966111571135032e-05, "loss": 0.5409, "mean_token_accuracy": 0.8361411802470684, "num_tokens": 523885266.0, "step": 16415 }, { "entropy": 0.5780805023387074, "epoch": 1.5103593423844601, "grad_norm": 0.15738394856452942, "learning_rate": 4.9658048885208704e-05, "loss": 0.5705, "mean_token_accuracy": 0.824682742357254, "num_tokens": 523917729.0, "step": 16416 }, { "entropy": 0.6219223467633128, "epoch": 1.5104513487559013, "grad_norm": 0.16160579025745392, "learning_rate": 4.965498205906707e-05, "loss": 0.6144, "mean_token_accuracy": 0.8146139942109585, "num_tokens": 523949057.0, "step": 16417 }, { "entropy": 0.5480977077968419, "epoch": 1.5105433551273426, "grad_norm": 0.15414302051067352, "learning_rate": 4.965191523292545e-05, "loss": 0.537, "mean_token_accuracy": 0.8333761915564537, "num_tokens": 523981597.0, "step": 16418 }, { "entropy": 0.5258810771629214, "epoch": 1.5106353614987837, "grad_norm": 0.14664778113365173, "learning_rate": 4.964884840678382e-05, "loss": 0.504, "mean_token_accuracy": 0.8419066853821278, "num_tokens": 524013112.0, "step": 16419 }, { "entropy": 0.6719522355124354, "epoch": 1.510727367870225, "grad_norm": 0.16304834187030792, "learning_rate": 4.9645781580642196e-05, "loss": 0.6549, "mean_token_accuracy": 0.7993730939924717, "num_tokens": 524044973.0, "step": 16420 }, { "entropy": 0.5954354740679264, "epoch": 1.5108193742416662, "grad_norm": 0.1569843590259552, "learning_rate": 4.964271475450057e-05, "loss": 0.5772, "mean_token_accuracy": 0.8242672644555569, "num_tokens": 524077054.0, "step": 16421 }, { "entropy": 0.6046548951417208, "epoch": 1.5109113806131074, "grad_norm": 0.15922699868679047, "learning_rate": 4.9639647928358946e-05, "loss": 0.5885, "mean_token_accuracy": 0.8159687407314777, "num_tokens": 524109480.0, "step": 16422 }, { "entropy": 0.6498640216886997, "epoch": 1.5110033869845487, "grad_norm": 0.15532690286636353, "learning_rate": 4.9636581102217313e-05, "loss": 0.6489, "mean_token_accuracy": 0.8051257468760014, "num_tokens": 524142063.0, "step": 16423 }, { "entropy": 0.622819465585053, "epoch": 1.5110953933559899, "grad_norm": 0.15316249430179596, "learning_rate": 4.9633514276075695e-05, "loss": 0.6117, "mean_token_accuracy": 0.8122252151370049, "num_tokens": 524174182.0, "step": 16424 }, { "entropy": 0.5577126899734139, "epoch": 1.5111873997274312, "grad_norm": 0.15662942826747894, "learning_rate": 4.963044744993406e-05, "loss": 0.524, "mean_token_accuracy": 0.837782695889473, "num_tokens": 524204952.0, "step": 16425 }, { "entropy": 0.6629860866814852, "epoch": 1.5112794060988723, "grad_norm": 0.16207347810268402, "learning_rate": 4.9627380623792444e-05, "loss": 0.6608, "mean_token_accuracy": 0.7958904057741165, "num_tokens": 524236821.0, "step": 16426 }, { "entropy": 0.5328289857134223, "epoch": 1.5113714124703135, "grad_norm": 0.1489851474761963, "learning_rate": 4.962431379765081e-05, "loss": 0.5201, "mean_token_accuracy": 0.840586643666029, "num_tokens": 524268858.0, "step": 16427 }, { "entropy": 0.5826719817705452, "epoch": 1.5114634188417548, "grad_norm": 0.15626239776611328, "learning_rate": 4.962124697150919e-05, "loss": 0.584, "mean_token_accuracy": 0.8219802901148796, "num_tokens": 524300971.0, "step": 16428 }, { "entropy": 0.6717667207121849, "epoch": 1.511555425213196, "grad_norm": 0.16686366498470306, "learning_rate": 4.961818014536756e-05, "loss": 0.6627, "mean_token_accuracy": 0.7982704825699329, "num_tokens": 524332777.0, "step": 16429 }, { "entropy": 0.5774929886683822, "epoch": 1.5116474315846373, "grad_norm": 0.15422774851322174, "learning_rate": 4.9615113319225936e-05, "loss": 0.5729, "mean_token_accuracy": 0.8236156664788723, "num_tokens": 524364716.0, "step": 16430 }, { "entropy": 0.6304360684007406, "epoch": 1.5117394379560785, "grad_norm": 0.16395984590053558, "learning_rate": 4.961204649308431e-05, "loss": 0.614, "mean_token_accuracy": 0.8093161284923553, "num_tokens": 524396659.0, "step": 16431 }, { "entropy": 0.6699433475732803, "epoch": 1.5118314443275196, "grad_norm": 0.1693120300769806, "learning_rate": 4.9608979666942685e-05, "loss": 0.6663, "mean_token_accuracy": 0.7983846440911293, "num_tokens": 524428454.0, "step": 16432 }, { "entropy": 0.5826223567128181, "epoch": 1.511923450698961, "grad_norm": 0.15558652579784393, "learning_rate": 4.960591284080105e-05, "loss": 0.5603, "mean_token_accuracy": 0.8275687769055367, "num_tokens": 524460250.0, "step": 16433 }, { "entropy": 0.5489384457468987, "epoch": 1.512015457070402, "grad_norm": 0.14771316945552826, "learning_rate": 4.9602846014659435e-05, "loss": 0.5379, "mean_token_accuracy": 0.8315367288887501, "num_tokens": 524492594.0, "step": 16434 }, { "entropy": 0.6260805353522301, "epoch": 1.5121074634418434, "grad_norm": 0.1642848253250122, "learning_rate": 4.95997791885178e-05, "loss": 0.6222, "mean_token_accuracy": 0.8115999847650528, "num_tokens": 524524555.0, "step": 16435 }, { "entropy": 0.7571729626506567, "epoch": 1.5121994698132846, "grad_norm": 0.16269752383232117, "learning_rate": 4.959671236237618e-05, "loss": 0.7539, "mean_token_accuracy": 0.7712948396801949, "num_tokens": 524556433.0, "step": 16436 }, { "entropy": 0.7192706279456615, "epoch": 1.5122914761847257, "grad_norm": 0.15937457978725433, "learning_rate": 4.959364553623455e-05, "loss": 0.7095, "mean_token_accuracy": 0.7877982668578625, "num_tokens": 524588948.0, "step": 16437 }, { "entropy": 0.4913281223271042, "epoch": 1.512383482556167, "grad_norm": 0.14792819321155548, "learning_rate": 4.9590578710092926e-05, "loss": 0.4852, "mean_token_accuracy": 0.8479973636567593, "num_tokens": 524621108.0, "step": 16438 }, { "entropy": 0.5349740805104375, "epoch": 1.5124754889276082, "grad_norm": 0.14718899130821228, "learning_rate": 4.95875118839513e-05, "loss": 0.5308, "mean_token_accuracy": 0.8406924791634083, "num_tokens": 524653376.0, "step": 16439 }, { "entropy": 0.6239903196692467, "epoch": 1.5125674952990495, "grad_norm": 0.15908290445804596, "learning_rate": 4.9584445057809676e-05, "loss": 0.621, "mean_token_accuracy": 0.8116497881710529, "num_tokens": 524685555.0, "step": 16440 }, { "entropy": 0.7222330272197723, "epoch": 1.5126595016704907, "grad_norm": 0.16524969041347504, "learning_rate": 4.9581378231668044e-05, "loss": 0.7113, "mean_token_accuracy": 0.7840781509876251, "num_tokens": 524717221.0, "step": 16441 }, { "entropy": 0.6140110176056623, "epoch": 1.5127515080419318, "grad_norm": 0.15647491812705994, "learning_rate": 4.9578311405526425e-05, "loss": 0.6044, "mean_token_accuracy": 0.8132853843271732, "num_tokens": 524749038.0, "step": 16442 }, { "entropy": 0.5666463132947683, "epoch": 1.5128435144133732, "grad_norm": 0.15520429611206055, "learning_rate": 4.95752445793848e-05, "loss": 0.5656, "mean_token_accuracy": 0.8280054554343224, "num_tokens": 524780631.0, "step": 16443 }, { "entropy": 0.6728631742298603, "epoch": 1.5129355207848143, "grad_norm": 0.16151422262191772, "learning_rate": 4.957217775324317e-05, "loss": 0.6575, "mean_token_accuracy": 0.7990815080702305, "num_tokens": 524811756.0, "step": 16444 }, { "entropy": 0.6598709244281054, "epoch": 1.5130275271562557, "grad_norm": 0.16053742170333862, "learning_rate": 4.956911092710155e-05, "loss": 0.6541, "mean_token_accuracy": 0.8016269989311695, "num_tokens": 524843585.0, "step": 16445 }, { "entropy": 0.6791190514340997, "epoch": 1.5131195335276968, "grad_norm": 0.15702283382415771, "learning_rate": 4.956604410095992e-05, "loss": 0.6779, "mean_token_accuracy": 0.7922293283045292, "num_tokens": 524876303.0, "step": 16446 }, { "entropy": 0.4932596944272518, "epoch": 1.513211539899138, "grad_norm": 0.15114019811153412, "learning_rate": 4.95629772748183e-05, "loss": 0.4942, "mean_token_accuracy": 0.8466220013797283, "num_tokens": 524908585.0, "step": 16447 }, { "entropy": 0.5039003826677799, "epoch": 1.5133035462705793, "grad_norm": 0.14042514562606812, "learning_rate": 4.9559910448676666e-05, "loss": 0.4917, "mean_token_accuracy": 0.8456263318657875, "num_tokens": 524940294.0, "step": 16448 }, { "entropy": 0.5184528848621994, "epoch": 1.5133955526420204, "grad_norm": 0.15162396430969238, "learning_rate": 4.955684362253504e-05, "loss": 0.5068, "mean_token_accuracy": 0.8409995548427105, "num_tokens": 524972616.0, "step": 16449 }, { "entropy": 0.7013223059475422, "epoch": 1.5134875590134618, "grad_norm": 0.16470085084438324, "learning_rate": 4.9553776796393415e-05, "loss": 0.6924, "mean_token_accuracy": 0.7875389643013477, "num_tokens": 525003609.0, "step": 16450 }, { "entropy": 0.6029633302241564, "epoch": 1.513579565384903, "grad_norm": 0.15726707875728607, "learning_rate": 4.955070997025179e-05, "loss": 0.5962, "mean_token_accuracy": 0.819722656160593, "num_tokens": 525035474.0, "step": 16451 }, { "entropy": 0.6104047354310751, "epoch": 1.513671571756344, "grad_norm": 0.15838263928890228, "learning_rate": 4.9547643144110165e-05, "loss": 0.6028, "mean_token_accuracy": 0.8127826973795891, "num_tokens": 525067020.0, "step": 16452 }, { "entropy": 0.5645928531885147, "epoch": 1.5137635781277854, "grad_norm": 0.14933742582798004, "learning_rate": 4.954457631796854e-05, "loss": 0.561, "mean_token_accuracy": 0.8317053876817226, "num_tokens": 525098820.0, "step": 16453 }, { "entropy": 0.5712949051521719, "epoch": 1.5138555844992265, "grad_norm": 0.15545330941677094, "learning_rate": 4.954150949182691e-05, "loss": 0.5405, "mean_token_accuracy": 0.8312475197017193, "num_tokens": 525128777.0, "step": 16454 }, { "entropy": 0.6536805341020226, "epoch": 1.5139475908706679, "grad_norm": 0.16069568693637848, "learning_rate": 4.953844266568529e-05, "loss": 0.6279, "mean_token_accuracy": 0.8076161704957485, "num_tokens": 525160754.0, "step": 16455 }, { "entropy": 0.5275046667084098, "epoch": 1.514039597242109, "grad_norm": 0.14476178586483002, "learning_rate": 4.9535375839543656e-05, "loss": 0.508, "mean_token_accuracy": 0.8432426564395428, "num_tokens": 525192733.0, "step": 16456 }, { "entropy": 0.7434333618730307, "epoch": 1.5141316036135501, "grad_norm": 0.16461771726608276, "learning_rate": 4.953230901340203e-05, "loss": 0.7252, "mean_token_accuracy": 0.7770531587302685, "num_tokens": 525224620.0, "step": 16457 }, { "entropy": 0.6483962088823318, "epoch": 1.5142236099849915, "grad_norm": 0.1556069254875183, "learning_rate": 4.9529242187260406e-05, "loss": 0.6293, "mean_token_accuracy": 0.8005147762596607, "num_tokens": 525256273.0, "step": 16458 }, { "entropy": 0.6143429661169648, "epoch": 1.5143156163564326, "grad_norm": 0.15655596554279327, "learning_rate": 4.952617536111878e-05, "loss": 0.6031, "mean_token_accuracy": 0.8129107505083084, "num_tokens": 525288052.0, "step": 16459 }, { "entropy": 0.67038544267416, "epoch": 1.514407622727874, "grad_norm": 0.15766234695911407, "learning_rate": 4.9523108534977155e-05, "loss": 0.6529, "mean_token_accuracy": 0.8027070835232735, "num_tokens": 525319923.0, "step": 16460 }, { "entropy": 0.7235256303101778, "epoch": 1.5144996290993151, "grad_norm": 0.16536614298820496, "learning_rate": 4.952004170883553e-05, "loss": 0.7062, "mean_token_accuracy": 0.7866819463670254, "num_tokens": 525352257.0, "step": 16461 }, { "entropy": 0.5620538834482431, "epoch": 1.5145916354707563, "grad_norm": 0.15222403407096863, "learning_rate": 4.95169748826939e-05, "loss": 0.5445, "mean_token_accuracy": 0.8307767435908318, "num_tokens": 525384187.0, "step": 16462 }, { "entropy": 0.6782028134912252, "epoch": 1.5146836418421976, "grad_norm": 0.1667155921459198, "learning_rate": 4.951390805655228e-05, "loss": 0.6723, "mean_token_accuracy": 0.7967058420181274, "num_tokens": 525416222.0, "step": 16463 }, { "entropy": 0.639498533681035, "epoch": 1.5147756482136387, "grad_norm": 0.16197898983955383, "learning_rate": 4.951084123041065e-05, "loss": 0.6426, "mean_token_accuracy": 0.7986823059618473, "num_tokens": 525448375.0, "step": 16464 }, { "entropy": 0.6570445140823722, "epoch": 1.51486765458508, "grad_norm": 0.16215206682682037, "learning_rate": 4.950777440426903e-05, "loss": 0.6525, "mean_token_accuracy": 0.8037302605807781, "num_tokens": 525480558.0, "step": 16465 }, { "entropy": 0.6517907027155161, "epoch": 1.5149596609565212, "grad_norm": 0.15421505272388458, "learning_rate": 4.9504707578127396e-05, "loss": 0.6368, "mean_token_accuracy": 0.8029937148094177, "num_tokens": 525512386.0, "step": 16466 }, { "entropy": 0.5723423117306083, "epoch": 1.5150516673279624, "grad_norm": 0.15331323444843292, "learning_rate": 4.950164075198577e-05, "loss": 0.5735, "mean_token_accuracy": 0.8244944699108601, "num_tokens": 525544816.0, "step": 16467 }, { "entropy": 0.6338437842205167, "epoch": 1.5151436736994037, "grad_norm": 0.1566825956106186, "learning_rate": 4.9498573925844145e-05, "loss": 0.6176, "mean_token_accuracy": 0.8110004477202892, "num_tokens": 525576478.0, "step": 16468 }, { "entropy": 0.5427188980393112, "epoch": 1.5152356800708449, "grad_norm": 0.149854376912117, "learning_rate": 4.949550709970252e-05, "loss": 0.5215, "mean_token_accuracy": 0.8351171612739563, "num_tokens": 525608359.0, "step": 16469 }, { "entropy": 0.6220479449257255, "epoch": 1.5153276864422862, "grad_norm": 0.16002795100212097, "learning_rate": 4.9492440273560895e-05, "loss": 0.6133, "mean_token_accuracy": 0.8130283914506435, "num_tokens": 525640851.0, "step": 16470 }, { "entropy": 0.6081933062523603, "epoch": 1.5154196928137273, "grad_norm": 0.1538315713405609, "learning_rate": 4.948937344741927e-05, "loss": 0.5973, "mean_token_accuracy": 0.81698989123106, "num_tokens": 525673383.0, "step": 16471 }, { "entropy": 0.6157899349927902, "epoch": 1.5155116991851685, "grad_norm": 0.15421636402606964, "learning_rate": 4.948630662127764e-05, "loss": 0.6082, "mean_token_accuracy": 0.8154948949813843, "num_tokens": 525705604.0, "step": 16472 }, { "entropy": 0.6078154128044844, "epoch": 1.5156037055566098, "grad_norm": 0.1547004133462906, "learning_rate": 4.948323979513602e-05, "loss": 0.6043, "mean_token_accuracy": 0.8163070604205132, "num_tokens": 525738146.0, "step": 16473 }, { "entropy": 0.6415057983249426, "epoch": 1.515695711928051, "grad_norm": 0.15960153937339783, "learning_rate": 4.948017296899439e-05, "loss": 0.6154, "mean_token_accuracy": 0.8079086095094681, "num_tokens": 525769219.0, "step": 16474 }, { "entropy": 0.6246890034526587, "epoch": 1.5157877182994923, "grad_norm": 0.15542006492614746, "learning_rate": 4.947710614285276e-05, "loss": 0.6119, "mean_token_accuracy": 0.8149034529924393, "num_tokens": 525801685.0, "step": 16475 }, { "entropy": 0.6004705000668764, "epoch": 1.5158797246709335, "grad_norm": 0.15760137140750885, "learning_rate": 4.947403931671114e-05, "loss": 0.6004, "mean_token_accuracy": 0.8125746473670006, "num_tokens": 525833891.0, "step": 16476 }, { "entropy": 0.6676219450309873, "epoch": 1.5159717310423746, "grad_norm": 0.16147467494010925, "learning_rate": 4.947097249056951e-05, "loss": 0.659, "mean_token_accuracy": 0.7982079386711121, "num_tokens": 525866034.0, "step": 16477 }, { "entropy": 0.5834331046789885, "epoch": 1.516063737413816, "grad_norm": 0.15604177117347717, "learning_rate": 4.9467905664427885e-05, "loss": 0.5658, "mean_token_accuracy": 0.8239332027733326, "num_tokens": 525898125.0, "step": 16478 }, { "entropy": 0.6017081514000893, "epoch": 1.516155743785257, "grad_norm": 0.15752726793289185, "learning_rate": 4.946483883828626e-05, "loss": 0.6033, "mean_token_accuracy": 0.817605447024107, "num_tokens": 525930574.0, "step": 16479 }, { "entropy": 0.6032543028704822, "epoch": 1.5162477501566984, "grad_norm": 0.1641794890165329, "learning_rate": 4.9461772012144634e-05, "loss": 0.594, "mean_token_accuracy": 0.8188711926341057, "num_tokens": 525962030.0, "step": 16480 }, { "entropy": 0.6389053678140044, "epoch": 1.5163397565281396, "grad_norm": 0.15319757163524628, "learning_rate": 4.945870518600301e-05, "loss": 0.6313, "mean_token_accuracy": 0.8079757280647755, "num_tokens": 525993885.0, "step": 16481 }, { "entropy": 0.6958352876827121, "epoch": 1.5164317628995807, "grad_norm": 0.16024774312973022, "learning_rate": 4.9455638359861384e-05, "loss": 0.7023, "mean_token_accuracy": 0.7901992723345757, "num_tokens": 526025835.0, "step": 16482 }, { "entropy": 0.5646014865487814, "epoch": 1.516523769271022, "grad_norm": 0.14759472012519836, "learning_rate": 4.945257153371975e-05, "loss": 0.5562, "mean_token_accuracy": 0.8324916139245033, "num_tokens": 526058084.0, "step": 16483 }, { "entropy": 0.6095221359282732, "epoch": 1.5166157756424632, "grad_norm": 0.15157414972782135, "learning_rate": 4.944950470757813e-05, "loss": 0.5962, "mean_token_accuracy": 0.8169955350458622, "num_tokens": 526090353.0, "step": 16484 }, { "entropy": 0.5696427589282393, "epoch": 1.5167077820139045, "grad_norm": 0.1455613374710083, "learning_rate": 4.94464378814365e-05, "loss": 0.5618, "mean_token_accuracy": 0.8260600753128529, "num_tokens": 526122445.0, "step": 16485 }, { "entropy": 0.6575075089931488, "epoch": 1.5167997883853457, "grad_norm": 0.16038312017917633, "learning_rate": 4.944337105529488e-05, "loss": 0.6417, "mean_token_accuracy": 0.8066590689122677, "num_tokens": 526154435.0, "step": 16486 }, { "entropy": 0.6031435709446669, "epoch": 1.5168917947567868, "grad_norm": 0.15057259798049927, "learning_rate": 4.944030422915325e-05, "loss": 0.5917, "mean_token_accuracy": 0.820949450135231, "num_tokens": 526186181.0, "step": 16487 }, { "entropy": 0.639779519289732, "epoch": 1.5169838011282282, "grad_norm": 0.15485210716724396, "learning_rate": 4.9437237403011625e-05, "loss": 0.6315, "mean_token_accuracy": 0.8066113628447056, "num_tokens": 526218782.0, "step": 16488 }, { "entropy": 0.6153357289731503, "epoch": 1.5170758074996693, "grad_norm": 0.1610313504934311, "learning_rate": 4.943417057687e-05, "loss": 0.592, "mean_token_accuracy": 0.8149732239544392, "num_tokens": 526250578.0, "step": 16489 }, { "entropy": 0.554743617773056, "epoch": 1.5171678138711107, "grad_norm": 0.1508634388446808, "learning_rate": 4.9431103750728374e-05, "loss": 0.5566, "mean_token_accuracy": 0.8308373503386974, "num_tokens": 526283035.0, "step": 16490 }, { "entropy": 0.5944658294320107, "epoch": 1.5172598202425518, "grad_norm": 0.15711693465709686, "learning_rate": 4.942803692458675e-05, "loss": 0.5787, "mean_token_accuracy": 0.8220564164221287, "num_tokens": 526314677.0, "step": 16491 }, { "entropy": 0.5870146593078971, "epoch": 1.517351826613993, "grad_norm": 0.15250276029109955, "learning_rate": 4.9424970098445123e-05, "loss": 0.5748, "mean_token_accuracy": 0.8259579874575138, "num_tokens": 526346767.0, "step": 16492 }, { "entropy": 0.5796989724040031, "epoch": 1.5174438329854343, "grad_norm": 0.16843488812446594, "learning_rate": 4.942190327230349e-05, "loss": 0.5688, "mean_token_accuracy": 0.8245409727096558, "num_tokens": 526378764.0, "step": 16493 }, { "entropy": 0.5876847933977842, "epoch": 1.5175358393568754, "grad_norm": 0.15294773876667023, "learning_rate": 4.941883644616187e-05, "loss": 0.5704, "mean_token_accuracy": 0.8238460868597031, "num_tokens": 526410205.0, "step": 16494 }, { "entropy": 0.6412427425384521, "epoch": 1.5176278457283168, "grad_norm": 0.1624068021774292, "learning_rate": 4.941576962002024e-05, "loss": 0.6362, "mean_token_accuracy": 0.7990022338926792, "num_tokens": 526441256.0, "step": 16495 }, { "entropy": 0.6499526435509324, "epoch": 1.517719852099758, "grad_norm": 0.1535618007183075, "learning_rate": 4.9412702793878615e-05, "loss": 0.6341, "mean_token_accuracy": 0.8071523793041706, "num_tokens": 526473516.0, "step": 16496 }, { "entropy": 0.668819684535265, "epoch": 1.517811858471199, "grad_norm": 0.1597776859998703, "learning_rate": 4.940963596773699e-05, "loss": 0.6659, "mean_token_accuracy": 0.7940640263259411, "num_tokens": 526505358.0, "step": 16497 }, { "entropy": 0.6549066565930843, "epoch": 1.5179038648426404, "grad_norm": 0.1545163094997406, "learning_rate": 4.9406569141595365e-05, "loss": 0.6381, "mean_token_accuracy": 0.8050271198153496, "num_tokens": 526537216.0, "step": 16498 }, { "entropy": 0.6294102212414145, "epoch": 1.5179958712140815, "grad_norm": 0.15729683637619019, "learning_rate": 4.940350231545374e-05, "loss": 0.6172, "mean_token_accuracy": 0.8100723884999752, "num_tokens": 526569627.0, "step": 16499 }, { "entropy": 0.6597276590764523, "epoch": 1.5180878775855229, "grad_norm": 0.16044820845127106, "learning_rate": 4.9400435489312114e-05, "loss": 0.6487, "mean_token_accuracy": 0.7988115325570107, "num_tokens": 526601513.0, "step": 16500 }, { "entropy": 0.5734455659985542, "epoch": 1.518179883956964, "grad_norm": 0.15273302793502808, "learning_rate": 4.939736866317048e-05, "loss": 0.5617, "mean_token_accuracy": 0.8258678093552589, "num_tokens": 526633189.0, "step": 16501 }, { "entropy": 0.6405914947390556, "epoch": 1.5182718903284051, "grad_norm": 0.15933077037334442, "learning_rate": 4.939430183702886e-05, "loss": 0.6243, "mean_token_accuracy": 0.8056851550936699, "num_tokens": 526665691.0, "step": 16502 }, { "entropy": 0.5916606062091887, "epoch": 1.5183638966998465, "grad_norm": 0.15563228726387024, "learning_rate": 4.939123501088724e-05, "loss": 0.5799, "mean_token_accuracy": 0.8214592151343822, "num_tokens": 526696878.0, "step": 16503 }, { "entropy": 0.6873699352145195, "epoch": 1.5184559030712876, "grad_norm": 0.16203981637954712, "learning_rate": 4.9388168184745606e-05, "loss": 0.6832, "mean_token_accuracy": 0.7922581359744072, "num_tokens": 526728060.0, "step": 16504 }, { "entropy": 0.6111687030643225, "epoch": 1.518547909442729, "grad_norm": 0.1542670726776123, "learning_rate": 4.938510135860399e-05, "loss": 0.6059, "mean_token_accuracy": 0.8175611644983292, "num_tokens": 526760144.0, "step": 16505 }, { "entropy": 0.5933074299246073, "epoch": 1.5186399158141701, "grad_norm": 0.15630070865154266, "learning_rate": 4.9382034532462355e-05, "loss": 0.5889, "mean_token_accuracy": 0.8170476853847504, "num_tokens": 526792574.0, "step": 16506 }, { "entropy": 0.5767204165458679, "epoch": 1.5187319221856113, "grad_norm": 0.16168953478336334, "learning_rate": 4.9378967706320736e-05, "loss": 0.5597, "mean_token_accuracy": 0.8281556181609631, "num_tokens": 526824682.0, "step": 16507 }, { "entropy": 0.6288373824208975, "epoch": 1.5188239285570526, "grad_norm": 0.15820500254631042, "learning_rate": 4.9375900880179104e-05, "loss": 0.6318, "mean_token_accuracy": 0.8097222074866295, "num_tokens": 526856870.0, "step": 16508 }, { "entropy": 0.5519189797341824, "epoch": 1.5189159349284937, "grad_norm": 0.14823651313781738, "learning_rate": 4.937283405403748e-05, "loss": 0.5424, "mean_token_accuracy": 0.8297552205622196, "num_tokens": 526889602.0, "step": 16509 }, { "entropy": 0.6102744620293379, "epoch": 1.519007941299935, "grad_norm": 0.15959563851356506, "learning_rate": 4.9369767227895854e-05, "loss": 0.6095, "mean_token_accuracy": 0.8115913383662701, "num_tokens": 526921356.0, "step": 16510 }, { "entropy": 0.5638866927474737, "epoch": 1.5190999476713762, "grad_norm": 0.1516043096780777, "learning_rate": 4.936670040175423e-05, "loss": 0.5522, "mean_token_accuracy": 0.8300323970615864, "num_tokens": 526953162.0, "step": 16511 }, { "entropy": 0.6111222207546234, "epoch": 1.5191919540428174, "grad_norm": 0.16150639951229095, "learning_rate": 4.93636335756126e-05, "loss": 0.6079, "mean_token_accuracy": 0.8178420290350914, "num_tokens": 526985340.0, "step": 16512 }, { "entropy": 0.6490694154053926, "epoch": 1.5192839604142587, "grad_norm": 0.15604516863822937, "learning_rate": 4.936056674947098e-05, "loss": 0.6309, "mean_token_accuracy": 0.8071588352322578, "num_tokens": 527016919.0, "step": 16513 }, { "entropy": 0.6364948842674494, "epoch": 1.5193759667856999, "grad_norm": 0.15791484713554382, "learning_rate": 4.9357499923329345e-05, "loss": 0.6099, "mean_token_accuracy": 0.8159605413675308, "num_tokens": 527048454.0, "step": 16514 }, { "entropy": 0.6354039087891579, "epoch": 1.5194679731571412, "grad_norm": 0.1551956981420517, "learning_rate": 4.935443309718773e-05, "loss": 0.6296, "mean_token_accuracy": 0.806107223033905, "num_tokens": 527080847.0, "step": 16515 }, { "entropy": 0.5803968235850334, "epoch": 1.5195599795285823, "grad_norm": 0.15678228437900543, "learning_rate": 4.9351366271046095e-05, "loss": 0.5665, "mean_token_accuracy": 0.8279697448015213, "num_tokens": 527112488.0, "step": 16516 }, { "entropy": 0.6011387561447918, "epoch": 1.5196519859000235, "grad_norm": 0.14999113976955414, "learning_rate": 4.934829944490447e-05, "loss": 0.5815, "mean_token_accuracy": 0.8210340104997158, "num_tokens": 527144773.0, "step": 16517 }, { "entropy": 0.5905690779909492, "epoch": 1.5197439922714648, "grad_norm": 0.15185026824474335, "learning_rate": 4.9345232618762844e-05, "loss": 0.5734, "mean_token_accuracy": 0.8214596100151539, "num_tokens": 527176704.0, "step": 16518 }, { "entropy": 0.6608882676810026, "epoch": 1.519835998642906, "grad_norm": 0.15917174518108368, "learning_rate": 4.934216579262122e-05, "loss": 0.6557, "mean_token_accuracy": 0.7969521172344685, "num_tokens": 527208985.0, "step": 16519 }, { "entropy": 0.5636718245223165, "epoch": 1.5199280050143473, "grad_norm": 0.15091224014759064, "learning_rate": 4.933909896647959e-05, "loss": 0.5567, "mean_token_accuracy": 0.8283116854727268, "num_tokens": 527241190.0, "step": 16520 }, { "entropy": 0.7258144728839397, "epoch": 1.5200200113857885, "grad_norm": 0.16192159056663513, "learning_rate": 4.933603214033797e-05, "loss": 0.7149, "mean_token_accuracy": 0.7816574722528458, "num_tokens": 527272925.0, "step": 16521 }, { "entropy": 0.590102399000898, "epoch": 1.5201120177572296, "grad_norm": 0.15885156393051147, "learning_rate": 4.9332965314196336e-05, "loss": 0.5748, "mean_token_accuracy": 0.8254778981208801, "num_tokens": 527304847.0, "step": 16522 }, { "entropy": 0.6517719505354762, "epoch": 1.520204024128671, "grad_norm": 0.1566925346851349, "learning_rate": 4.932989848805472e-05, "loss": 0.6423, "mean_token_accuracy": 0.8048259131610394, "num_tokens": 527337117.0, "step": 16523 }, { "entropy": 0.6827370543032885, "epoch": 1.520296030500112, "grad_norm": 0.1584622710943222, "learning_rate": 4.9326831661913085e-05, "loss": 0.6691, "mean_token_accuracy": 0.7924227491021156, "num_tokens": 527368428.0, "step": 16524 }, { "entropy": 0.5113977817818522, "epoch": 1.5203880368715534, "grad_norm": 0.15039043128490448, "learning_rate": 4.9323764835771466e-05, "loss": 0.5093, "mean_token_accuracy": 0.8450251668691635, "num_tokens": 527401087.0, "step": 16525 }, { "entropy": 0.5791545603424311, "epoch": 1.5204800432429946, "grad_norm": 0.15915343165397644, "learning_rate": 4.9320698009629834e-05, "loss": 0.579, "mean_token_accuracy": 0.8227903284132481, "num_tokens": 527432516.0, "step": 16526 }, { "entropy": 0.519720271229744, "epoch": 1.5205720496144357, "grad_norm": 0.14825798571109772, "learning_rate": 4.931763118348821e-05, "loss": 0.511, "mean_token_accuracy": 0.8395257070660591, "num_tokens": 527464328.0, "step": 16527 }, { "entropy": 0.602475443854928, "epoch": 1.520664055985877, "grad_norm": 0.15442149341106415, "learning_rate": 4.9314564357346584e-05, "loss": 0.5877, "mean_token_accuracy": 0.815783329308033, "num_tokens": 527496464.0, "step": 16528 }, { "entropy": 0.5320751229301095, "epoch": 1.5207560623573182, "grad_norm": 0.1525323987007141, "learning_rate": 4.931149753120496e-05, "loss": 0.5083, "mean_token_accuracy": 0.8422673754394054, "num_tokens": 527528645.0, "step": 16529 }, { "entropy": 0.6703555407002568, "epoch": 1.5208480687287596, "grad_norm": 0.17915183305740356, "learning_rate": 4.930843070506333e-05, "loss": 0.6485, "mean_token_accuracy": 0.8006265982985497, "num_tokens": 527560341.0, "step": 16530 }, { "entropy": 0.6943517131730914, "epoch": 1.5209400751002007, "grad_norm": 0.16760139167308807, "learning_rate": 4.930536387892171e-05, "loss": 0.6865, "mean_token_accuracy": 0.7878704071044922, "num_tokens": 527591749.0, "step": 16531 }, { "entropy": 0.6104346653446555, "epoch": 1.5210320814716418, "grad_norm": 0.15855997800827026, "learning_rate": 4.9302297052780075e-05, "loss": 0.6066, "mean_token_accuracy": 0.8122986294329166, "num_tokens": 527623075.0, "step": 16532 }, { "entropy": 0.6118032787926495, "epoch": 1.5211240878430832, "grad_norm": 0.16004154086112976, "learning_rate": 4.929923022663846e-05, "loss": 0.5885, "mean_token_accuracy": 0.8145452216267586, "num_tokens": 527654649.0, "step": 16533 }, { "entropy": 0.5914721470326185, "epoch": 1.5212160942145243, "grad_norm": 0.15794338285923004, "learning_rate": 4.929616340049683e-05, "loss": 0.5706, "mean_token_accuracy": 0.8253653571009636, "num_tokens": 527686762.0, "step": 16534 }, { "entropy": 0.6896715462207794, "epoch": 1.5213081005859657, "grad_norm": 0.1615317165851593, "learning_rate": 4.92930965743552e-05, "loss": 0.6781, "mean_token_accuracy": 0.7948140278458595, "num_tokens": 527718131.0, "step": 16535 }, { "entropy": 0.6503585055470467, "epoch": 1.5214001069574068, "grad_norm": 0.15542463958263397, "learning_rate": 4.929002974821358e-05, "loss": 0.632, "mean_token_accuracy": 0.8066948093473911, "num_tokens": 527750318.0, "step": 16536 }, { "entropy": 0.6306429039686918, "epoch": 1.521492113328848, "grad_norm": 0.15433400869369507, "learning_rate": 4.928696292207195e-05, "loss": 0.6271, "mean_token_accuracy": 0.81059854850173, "num_tokens": 527782563.0, "step": 16537 }, { "entropy": 0.6573727671056986, "epoch": 1.5215841197002893, "grad_norm": 0.15777279436588287, "learning_rate": 4.928389609593032e-05, "loss": 0.6601, "mean_token_accuracy": 0.8001940585672855, "num_tokens": 527814863.0, "step": 16538 }, { "entropy": 0.6637552976608276, "epoch": 1.5216761260717304, "grad_norm": 0.15510553121566772, "learning_rate": 4.92808292697887e-05, "loss": 0.6471, "mean_token_accuracy": 0.7981804050505161, "num_tokens": 527847056.0, "step": 16539 }, { "entropy": 0.6122811138629913, "epoch": 1.5217681324431718, "grad_norm": 0.16687612235546112, "learning_rate": 4.927776244364707e-05, "loss": 0.6111, "mean_token_accuracy": 0.8121418245136738, "num_tokens": 527879461.0, "step": 16540 }, { "entropy": 0.6998784057796001, "epoch": 1.521860138814613, "grad_norm": 0.16340163350105286, "learning_rate": 4.927469561750545e-05, "loss": 0.6887, "mean_token_accuracy": 0.7905695289373398, "num_tokens": 527910800.0, "step": 16541 }, { "entropy": 0.6108220871537924, "epoch": 1.521952145186054, "grad_norm": 0.16150616109371185, "learning_rate": 4.927162879136382e-05, "loss": 0.6117, "mean_token_accuracy": 0.8108691312372684, "num_tokens": 527942796.0, "step": 16542 }, { "entropy": 0.5878836251795292, "epoch": 1.5220441515574954, "grad_norm": 0.15422342717647552, "learning_rate": 4.926856196522219e-05, "loss": 0.5907, "mean_token_accuracy": 0.8189480639994144, "num_tokens": 527974818.0, "step": 16543 }, { "entropy": 0.6859790831804276, "epoch": 1.5221361579289365, "grad_norm": 0.15682680904865265, "learning_rate": 4.926549513908057e-05, "loss": 0.6784, "mean_token_accuracy": 0.7907069995999336, "num_tokens": 528007119.0, "step": 16544 }, { "entropy": 0.6116712703369558, "epoch": 1.5222281643003779, "grad_norm": 0.15353785455226898, "learning_rate": 4.926242831293894e-05, "loss": 0.595, "mean_token_accuracy": 0.8167304880917072, "num_tokens": 528039157.0, "step": 16545 }, { "entropy": 0.6319145746529102, "epoch": 1.522320170671819, "grad_norm": 0.15747153759002686, "learning_rate": 4.925936148679732e-05, "loss": 0.615, "mean_token_accuracy": 0.8133190609514713, "num_tokens": 528071396.0, "step": 16546 }, { "entropy": 0.6290771933272481, "epoch": 1.5224121770432602, "grad_norm": 0.15793509781360626, "learning_rate": 4.925629466065569e-05, "loss": 0.606, "mean_token_accuracy": 0.8151703663170338, "num_tokens": 528102758.0, "step": 16547 }, { "entropy": 0.6603141278028488, "epoch": 1.5225041834147015, "grad_norm": 0.1583685427904129, "learning_rate": 4.925322783451406e-05, "loss": 0.6521, "mean_token_accuracy": 0.8015799857676029, "num_tokens": 528134471.0, "step": 16548 }, { "entropy": 0.588864678516984, "epoch": 1.5225961897861426, "grad_norm": 0.15699289739131927, "learning_rate": 4.925016100837244e-05, "loss": 0.5791, "mean_token_accuracy": 0.8237920664250851, "num_tokens": 528166497.0, "step": 16549 }, { "entropy": 0.5526434995699674, "epoch": 1.522688196157584, "grad_norm": 0.15717977285385132, "learning_rate": 4.924709418223081e-05, "loss": 0.5492, "mean_token_accuracy": 0.8314349316060543, "num_tokens": 528198127.0, "step": 16550 }, { "entropy": 0.606762109324336, "epoch": 1.5227802025290251, "grad_norm": 0.15662892162799835, "learning_rate": 4.924402735608919e-05, "loss": 0.5994, "mean_token_accuracy": 0.8177457451820374, "num_tokens": 528230238.0, "step": 16551 }, { "entropy": 0.6239919355139136, "epoch": 1.5228722089004663, "grad_norm": 0.16194488108158112, "learning_rate": 4.924096052994756e-05, "loss": 0.6339, "mean_token_accuracy": 0.8072803989052773, "num_tokens": 528262340.0, "step": 16552 }, { "entropy": 0.7145175114274025, "epoch": 1.5229642152719076, "grad_norm": 0.1660831719636917, "learning_rate": 4.923789370380593e-05, "loss": 0.7075, "mean_token_accuracy": 0.7821329906582832, "num_tokens": 528294295.0, "step": 16553 }, { "entropy": 0.5717959078028798, "epoch": 1.5230562216433488, "grad_norm": 0.15196159482002258, "learning_rate": 4.923482687766431e-05, "loss": 0.561, "mean_token_accuracy": 0.8271680437028408, "num_tokens": 528326423.0, "step": 16554 }, { "entropy": 0.524331412743777, "epoch": 1.52314822801479, "grad_norm": 0.14516593515872955, "learning_rate": 4.923176005152268e-05, "loss": 0.5031, "mean_token_accuracy": 0.8443445339798927, "num_tokens": 528358739.0, "step": 16555 }, { "entropy": 0.6307591330260038, "epoch": 1.5232402343862312, "grad_norm": 0.16015437245368958, "learning_rate": 4.9228693225381053e-05, "loss": 0.6273, "mean_token_accuracy": 0.8101574704051018, "num_tokens": 528391175.0, "step": 16556 }, { "entropy": 0.5772523740306497, "epoch": 1.5233322407576724, "grad_norm": 0.15431365370750427, "learning_rate": 4.922562639923943e-05, "loss": 0.5625, "mean_token_accuracy": 0.8281646445393562, "num_tokens": 528423337.0, "step": 16557 }, { "entropy": 0.6808778271079063, "epoch": 1.5234242471291137, "grad_norm": 0.17241564393043518, "learning_rate": 4.92225595730978e-05, "loss": 0.6698, "mean_token_accuracy": 0.7968861535191536, "num_tokens": 528455221.0, "step": 16558 }, { "entropy": 0.5450560487806797, "epoch": 1.5235162535005549, "grad_norm": 0.15030166506767273, "learning_rate": 4.921949274695618e-05, "loss": 0.5165, "mean_token_accuracy": 0.8405566476285458, "num_tokens": 528487484.0, "step": 16559 }, { "entropy": 0.6865616403520107, "epoch": 1.5236082598719962, "grad_norm": 0.16116127371788025, "learning_rate": 4.921642592081455e-05, "loss": 0.6643, "mean_token_accuracy": 0.796602800488472, "num_tokens": 528518917.0, "step": 16560 }, { "entropy": 0.5408937442116439, "epoch": 1.5237002662434374, "grad_norm": 0.15165290236473083, "learning_rate": 4.921335909467292e-05, "loss": 0.5258, "mean_token_accuracy": 0.8389518596231937, "num_tokens": 528550229.0, "step": 16561 }, { "entropy": 0.644461995922029, "epoch": 1.5237922726148785, "grad_norm": 0.14969828724861145, "learning_rate": 4.92102922685313e-05, "loss": 0.6377, "mean_token_accuracy": 0.7995346933603287, "num_tokens": 528582633.0, "step": 16562 }, { "entropy": 0.5679704286158085, "epoch": 1.5238842789863198, "grad_norm": 0.15901388227939606, "learning_rate": 4.920722544238967e-05, "loss": 0.5629, "mean_token_accuracy": 0.8283427208662033, "num_tokens": 528614373.0, "step": 16563 }, { "entropy": 0.5892972191795707, "epoch": 1.523976285357761, "grad_norm": 0.15560925006866455, "learning_rate": 4.9204158616248044e-05, "loss": 0.581, "mean_token_accuracy": 0.8195765875279903, "num_tokens": 528645963.0, "step": 16564 }, { "entropy": 0.5624236464500427, "epoch": 1.5240682917292023, "grad_norm": 0.15102098882198334, "learning_rate": 4.9201091790106425e-05, "loss": 0.5551, "mean_token_accuracy": 0.8298157230019569, "num_tokens": 528678173.0, "step": 16565 }, { "entropy": 0.612639999948442, "epoch": 1.5241602981006435, "grad_norm": 0.15589025616645813, "learning_rate": 4.919802496396479e-05, "loss": 0.6015, "mean_token_accuracy": 0.8153745718300343, "num_tokens": 528710494.0, "step": 16566 }, { "entropy": 0.6232336442917585, "epoch": 1.5242523044720846, "grad_norm": 0.15908372402191162, "learning_rate": 4.9194958137823175e-05, "loss": 0.6233, "mean_token_accuracy": 0.8082961142063141, "num_tokens": 528742392.0, "step": 16567 }, { "entropy": 0.6169014275074005, "epoch": 1.524344310843526, "grad_norm": 0.15811142325401306, "learning_rate": 4.919189131168154e-05, "loss": 0.6065, "mean_token_accuracy": 0.8173240981996059, "num_tokens": 528774949.0, "step": 16568 }, { "entropy": 0.526100117713213, "epoch": 1.524436317214967, "grad_norm": 0.16424019634723663, "learning_rate": 4.918882448553992e-05, "loss": 0.5109, "mean_token_accuracy": 0.8400375694036484, "num_tokens": 528806660.0, "step": 16569 }, { "entropy": 0.5294187162071466, "epoch": 1.5245283235864084, "grad_norm": 0.1463291198015213, "learning_rate": 4.918575765939829e-05, "loss": 0.5177, "mean_token_accuracy": 0.8383526429533958, "num_tokens": 528839310.0, "step": 16570 }, { "entropy": 0.6393635347485542, "epoch": 1.5246203299578496, "grad_norm": 0.1526903510093689, "learning_rate": 4.9182690833256666e-05, "loss": 0.6245, "mean_token_accuracy": 0.8077404014766216, "num_tokens": 528871434.0, "step": 16571 }, { "entropy": 0.6031456300988793, "epoch": 1.5247123363292907, "grad_norm": 0.15266330540180206, "learning_rate": 4.917962400711504e-05, "loss": 0.589, "mean_token_accuracy": 0.8175104185938835, "num_tokens": 528903746.0, "step": 16572 }, { "entropy": 0.5792659316211939, "epoch": 1.524804342700732, "grad_norm": 0.15548986196517944, "learning_rate": 4.9176557180973416e-05, "loss": 0.5624, "mean_token_accuracy": 0.8290232084691525, "num_tokens": 528935230.0, "step": 16573 }, { "entropy": 0.6898874957114458, "epoch": 1.5248963490721732, "grad_norm": 0.16112476587295532, "learning_rate": 4.9173490354831784e-05, "loss": 0.6753, "mean_token_accuracy": 0.7951638847589493, "num_tokens": 528967379.0, "step": 16574 }, { "entropy": 0.6889080181717873, "epoch": 1.5249883554436146, "grad_norm": 0.15681138634681702, "learning_rate": 4.9170423528690165e-05, "loss": 0.667, "mean_token_accuracy": 0.7975130975246429, "num_tokens": 528999404.0, "step": 16575 }, { "entropy": 0.5869499207474291, "epoch": 1.5250803618150557, "grad_norm": 0.14922139048576355, "learning_rate": 4.916735670254853e-05, "loss": 0.5622, "mean_token_accuracy": 0.8262416310608387, "num_tokens": 529030824.0, "step": 16576 }, { "entropy": 0.5506965280510485, "epoch": 1.5251723681864968, "grad_norm": 0.15112529695034027, "learning_rate": 4.916428987640691e-05, "loss": 0.5354, "mean_token_accuracy": 0.8355726525187492, "num_tokens": 529062783.0, "step": 16577 }, { "entropy": 0.6901394687592983, "epoch": 1.5252643745579382, "grad_norm": 0.16617204248905182, "learning_rate": 4.916122305026528e-05, "loss": 0.6917, "mean_token_accuracy": 0.7934467270970345, "num_tokens": 529093587.0, "step": 16578 }, { "entropy": 0.6473276736214757, "epoch": 1.5253563809293793, "grad_norm": 0.15974482893943787, "learning_rate": 4.915815622412366e-05, "loss": 0.6356, "mean_token_accuracy": 0.807346198707819, "num_tokens": 529125007.0, "step": 16579 }, { "entropy": 0.4659056290984154, "epoch": 1.5254483873008207, "grad_norm": 0.1578729748725891, "learning_rate": 4.915508939798203e-05, "loss": 0.4623, "mean_token_accuracy": 0.8563388884067535, "num_tokens": 529156838.0, "step": 16580 }, { "entropy": 0.5947121786884964, "epoch": 1.5255403936722618, "grad_norm": 0.1543368697166443, "learning_rate": 4.9152022571840406e-05, "loss": 0.5818, "mean_token_accuracy": 0.8212741687893867, "num_tokens": 529188454.0, "step": 16581 }, { "entropy": 0.5673114461824298, "epoch": 1.525632400043703, "grad_norm": 0.15198026597499847, "learning_rate": 4.9148955745698774e-05, "loss": 0.5669, "mean_token_accuracy": 0.8263893611729145, "num_tokens": 529220684.0, "step": 16582 }, { "entropy": 0.5929160974919796, "epoch": 1.5257244064151443, "grad_norm": 0.1609189361333847, "learning_rate": 4.9145888919557155e-05, "loss": 0.5897, "mean_token_accuracy": 0.8157070502638817, "num_tokens": 529251993.0, "step": 16583 }, { "entropy": 0.5091171823441982, "epoch": 1.5258164127865854, "grad_norm": 0.14754609763622284, "learning_rate": 4.914282209341552e-05, "loss": 0.4981, "mean_token_accuracy": 0.8479176387190819, "num_tokens": 529284452.0, "step": 16584 }, { "entropy": 0.6757408604025841, "epoch": 1.5259084191580268, "grad_norm": 0.15858076512813568, "learning_rate": 4.9139755267273905e-05, "loss": 0.6774, "mean_token_accuracy": 0.7941181845963001, "num_tokens": 529316627.0, "step": 16585 }, { "entropy": 0.5404332033358514, "epoch": 1.526000425529468, "grad_norm": 0.1495986133813858, "learning_rate": 4.913668844113227e-05, "loss": 0.5136, "mean_token_accuracy": 0.8422566838562489, "num_tokens": 529348322.0, "step": 16586 }, { "entropy": 0.5095608532428741, "epoch": 1.526092431900909, "grad_norm": 0.1473742425441742, "learning_rate": 4.913362161499065e-05, "loss": 0.4987, "mean_token_accuracy": 0.8432375974953175, "num_tokens": 529380259.0, "step": 16587 }, { "entropy": 0.45354621787555516, "epoch": 1.5261844382723504, "grad_norm": 0.14529697597026825, "learning_rate": 4.913055478884902e-05, "loss": 0.4478, "mean_token_accuracy": 0.8640005961060524, "num_tokens": 529413025.0, "step": 16588 }, { "entropy": 0.5412250645458698, "epoch": 1.5262764446437915, "grad_norm": 0.1614299863576889, "learning_rate": 4.9127487962707397e-05, "loss": 0.545, "mean_token_accuracy": 0.8334466964006424, "num_tokens": 529443685.0, "step": 16589 }, { "entropy": 0.5903942380100489, "epoch": 1.5263684510152329, "grad_norm": 0.1568058282136917, "learning_rate": 4.912442113656577e-05, "loss": 0.577, "mean_token_accuracy": 0.8241964988410473, "num_tokens": 529474622.0, "step": 16590 }, { "entropy": 0.6595178376883268, "epoch": 1.526460457386674, "grad_norm": 0.1597389578819275, "learning_rate": 4.9121354310424146e-05, "loss": 0.6588, "mean_token_accuracy": 0.8016118034720421, "num_tokens": 529506336.0, "step": 16591 }, { "entropy": 0.7054630909115076, "epoch": 1.5265524637581152, "grad_norm": 0.16514761745929718, "learning_rate": 4.9118287484282514e-05, "loss": 0.7018, "mean_token_accuracy": 0.7915130108594894, "num_tokens": 529538541.0, "step": 16592 }, { "entropy": 0.5638193534687161, "epoch": 1.5266444701295565, "grad_norm": 0.14898581802845, "learning_rate": 4.9115220658140895e-05, "loss": 0.5444, "mean_token_accuracy": 0.827970627695322, "num_tokens": 529570891.0, "step": 16593 }, { "entropy": 0.6225284785032272, "epoch": 1.5267364765009976, "grad_norm": 0.16008099913597107, "learning_rate": 4.911215383199926e-05, "loss": 0.606, "mean_token_accuracy": 0.8100022375583649, "num_tokens": 529602213.0, "step": 16594 }, { "entropy": 0.5306655284948647, "epoch": 1.526828482872439, "grad_norm": 0.15633714199066162, "learning_rate": 4.910908700585764e-05, "loss": 0.5182, "mean_token_accuracy": 0.8388569131493568, "num_tokens": 529633989.0, "step": 16595 }, { "entropy": 0.603593435138464, "epoch": 1.5269204892438801, "grad_norm": 0.15270943939685822, "learning_rate": 4.910602017971602e-05, "loss": 0.6063, "mean_token_accuracy": 0.8170741610229015, "num_tokens": 529666110.0, "step": 16596 }, { "entropy": 0.6868840977549553, "epoch": 1.5270124956153213, "grad_norm": 0.16824166476726532, "learning_rate": 4.910295335357439e-05, "loss": 0.6922, "mean_token_accuracy": 0.7938742414116859, "num_tokens": 529698038.0, "step": 16597 }, { "entropy": 0.5856648944318295, "epoch": 1.5271045019867626, "grad_norm": 0.15261483192443848, "learning_rate": 4.909988652743276e-05, "loss": 0.5737, "mean_token_accuracy": 0.8236256800591946, "num_tokens": 529729828.0, "step": 16598 }, { "entropy": 0.644649799913168, "epoch": 1.5271965083582038, "grad_norm": 0.15888775885105133, "learning_rate": 4.9096819701291136e-05, "loss": 0.6211, "mean_token_accuracy": 0.8073699735105038, "num_tokens": 529761417.0, "step": 16599 }, { "entropy": 0.5689111491665244, "epoch": 1.527288514729645, "grad_norm": 0.14542926847934723, "learning_rate": 4.909375287514951e-05, "loss": 0.5472, "mean_token_accuracy": 0.8312892466783524, "num_tokens": 529793640.0, "step": 16600 }, { "entropy": 0.5176237700507045, "epoch": 1.5273805211010862, "grad_norm": 0.14641934633255005, "learning_rate": 4.9090686049007886e-05, "loss": 0.5013, "mean_token_accuracy": 0.8357004597783089, "num_tokens": 529824560.0, "step": 16601 }, { "entropy": 0.644124430604279, "epoch": 1.5274725274725274, "grad_norm": 0.15319009125232697, "learning_rate": 4.908761922286626e-05, "loss": 0.627, "mean_token_accuracy": 0.8102684356272221, "num_tokens": 529855412.0, "step": 16602 }, { "entropy": 0.7319613313302398, "epoch": 1.5275645338439687, "grad_norm": 0.16399610042572021, "learning_rate": 4.908455239672463e-05, "loss": 0.7188, "mean_token_accuracy": 0.7779453359544277, "num_tokens": 529887686.0, "step": 16603 }, { "entropy": 0.62395397759974, "epoch": 1.5276565402154099, "grad_norm": 0.16541001200675964, "learning_rate": 4.908148557058301e-05, "loss": 0.6192, "mean_token_accuracy": 0.8100747317075729, "num_tokens": 529919059.0, "step": 16604 }, { "entropy": 0.5781202497892082, "epoch": 1.5277485465868512, "grad_norm": 0.1536174714565277, "learning_rate": 4.907841874444138e-05, "loss": 0.5653, "mean_token_accuracy": 0.8220346979796886, "num_tokens": 529950750.0, "step": 16605 }, { "entropy": 0.5716502359136939, "epoch": 1.5278405529582924, "grad_norm": 0.15323975682258606, "learning_rate": 4.907535191829976e-05, "loss": 0.5746, "mean_token_accuracy": 0.8226268775761127, "num_tokens": 529982428.0, "step": 16606 }, { "entropy": 0.6897704391740263, "epoch": 1.5279325593297335, "grad_norm": 0.15610261261463165, "learning_rate": 4.9072285092158127e-05, "loss": 0.6828, "mean_token_accuracy": 0.7934139929711819, "num_tokens": 530014315.0, "step": 16607 }, { "entropy": 0.6152018308639526, "epoch": 1.5280245657011748, "grad_norm": 0.15403933823108673, "learning_rate": 4.90692182660165e-05, "loss": 0.6103, "mean_token_accuracy": 0.8147405944764614, "num_tokens": 530046892.0, "step": 16608 }, { "entropy": 0.5324181290343404, "epoch": 1.528116572072616, "grad_norm": 0.15273317694664001, "learning_rate": 4.9066151439874876e-05, "loss": 0.5144, "mean_token_accuracy": 0.8394965305924416, "num_tokens": 530078475.0, "step": 16609 }, { "entropy": 0.5057840719819069, "epoch": 1.5282085784440573, "grad_norm": 0.15578241646289825, "learning_rate": 4.906308461373325e-05, "loss": 0.4946, "mean_token_accuracy": 0.846567265689373, "num_tokens": 530110707.0, "step": 16610 }, { "entropy": 0.5856322487816215, "epoch": 1.5283005848154985, "grad_norm": 0.14726465940475464, "learning_rate": 4.9060017787591625e-05, "loss": 0.569, "mean_token_accuracy": 0.8261259160935879, "num_tokens": 530142964.0, "step": 16611 }, { "entropy": 0.6255930550396442, "epoch": 1.5283925911869396, "grad_norm": 0.15723253786563873, "learning_rate": 4.905695096145e-05, "loss": 0.6151, "mean_token_accuracy": 0.8109627738595009, "num_tokens": 530175230.0, "step": 16612 }, { "entropy": 0.604949189350009, "epoch": 1.528484597558381, "grad_norm": 0.1615719348192215, "learning_rate": 4.905388413530837e-05, "loss": 0.5969, "mean_token_accuracy": 0.8174238204956055, "num_tokens": 530206448.0, "step": 16613 }, { "entropy": 0.6014221142977476, "epoch": 1.528576603929822, "grad_norm": 0.15043573081493378, "learning_rate": 4.905081730916675e-05, "loss": 0.5906, "mean_token_accuracy": 0.8200630024075508, "num_tokens": 530238650.0, "step": 16614 }, { "entropy": 0.6016643699258566, "epoch": 1.5286686103012634, "grad_norm": 0.1589881032705307, "learning_rate": 4.904775048302512e-05, "loss": 0.5905, "mean_token_accuracy": 0.8186891749501228, "num_tokens": 530270416.0, "step": 16615 }, { "entropy": 0.4937232434749603, "epoch": 1.5287606166727046, "grad_norm": 0.14372655749320984, "learning_rate": 4.904468365688349e-05, "loss": 0.4754, "mean_token_accuracy": 0.8525296449661255, "num_tokens": 530302836.0, "step": 16616 }, { "entropy": 0.5985220316797495, "epoch": 1.5288526230441457, "grad_norm": 0.15659675002098083, "learning_rate": 4.9041616830741866e-05, "loss": 0.5797, "mean_token_accuracy": 0.8201946951448917, "num_tokens": 530335217.0, "step": 16617 }, { "entropy": 0.6861875392496586, "epoch": 1.528944629415587, "grad_norm": 0.15662506222724915, "learning_rate": 4.903855000460024e-05, "loss": 0.6782, "mean_token_accuracy": 0.7947066947817802, "num_tokens": 530367957.0, "step": 16618 }, { "entropy": 0.5980888083577156, "epoch": 1.5290366357870282, "grad_norm": 0.15480278432369232, "learning_rate": 4.9035483178458616e-05, "loss": 0.5963, "mean_token_accuracy": 0.818034715950489, "num_tokens": 530400480.0, "step": 16619 }, { "entropy": 0.668041281402111, "epoch": 1.5291286421584696, "grad_norm": 0.15949440002441406, "learning_rate": 4.903241635231699e-05, "loss": 0.6507, "mean_token_accuracy": 0.802837073802948, "num_tokens": 530432510.0, "step": 16620 }, { "entropy": 0.6033818144351244, "epoch": 1.5292206485299107, "grad_norm": 0.1541086733341217, "learning_rate": 4.902934952617536e-05, "loss": 0.608, "mean_token_accuracy": 0.8121641837060452, "num_tokens": 530464001.0, "step": 16621 }, { "entropy": 0.5126804020255804, "epoch": 1.5293126549013518, "grad_norm": 0.15112438797950745, "learning_rate": 4.902628270003374e-05, "loss": 0.4948, "mean_token_accuracy": 0.8479503877460957, "num_tokens": 530496253.0, "step": 16622 }, { "entropy": 0.5884058908559382, "epoch": 1.5294046612727932, "grad_norm": 0.15069401264190674, "learning_rate": 4.902321587389211e-05, "loss": 0.5728, "mean_token_accuracy": 0.8224900551140308, "num_tokens": 530528039.0, "step": 16623 }, { "entropy": 0.5845776156056672, "epoch": 1.5294966676442343, "grad_norm": 0.15633410215377808, "learning_rate": 4.902014904775048e-05, "loss": 0.5853, "mean_token_accuracy": 0.8193132691085339, "num_tokens": 530560312.0, "step": 16624 }, { "entropy": 0.48532241769135, "epoch": 1.5295886740156757, "grad_norm": 0.1441277712583542, "learning_rate": 4.9017082221608863e-05, "loss": 0.4682, "mean_token_accuracy": 0.85352573543787, "num_tokens": 530592718.0, "step": 16625 }, { "entropy": 0.6081004061270505, "epoch": 1.5296806803871168, "grad_norm": 0.15527519583702087, "learning_rate": 4.901401539546723e-05, "loss": 0.603, "mean_token_accuracy": 0.8155422136187553, "num_tokens": 530624830.0, "step": 16626 }, { "entropy": 0.6745463516563177, "epoch": 1.529772686758558, "grad_norm": 0.16330915689468384, "learning_rate": 4.901094856932561e-05, "loss": 0.658, "mean_token_accuracy": 0.799688208848238, "num_tokens": 530656131.0, "step": 16627 }, { "entropy": 0.6008928194642067, "epoch": 1.5298646931299993, "grad_norm": 0.1591942459344864, "learning_rate": 4.900788174318398e-05, "loss": 0.5996, "mean_token_accuracy": 0.8157485239207745, "num_tokens": 530687278.0, "step": 16628 }, { "entropy": 0.6307365484535694, "epoch": 1.5299566995014404, "grad_norm": 0.15327520668506622, "learning_rate": 4.9004814917042355e-05, "loss": 0.6174, "mean_token_accuracy": 0.8103295341134071, "num_tokens": 530718702.0, "step": 16629 }, { "entropy": 0.5370337897911668, "epoch": 1.5300487058728818, "grad_norm": 0.15016305446624756, "learning_rate": 4.900174809090073e-05, "loss": 0.5332, "mean_token_accuracy": 0.8382038585841656, "num_tokens": 530750448.0, "step": 16630 }, { "entropy": 0.5938581619411707, "epoch": 1.530140712244323, "grad_norm": 0.16662907600402832, "learning_rate": 4.8998681264759105e-05, "loss": 0.5897, "mean_token_accuracy": 0.8194583989679813, "num_tokens": 530782243.0, "step": 16631 }, { "entropy": 0.571426962967962, "epoch": 1.530232718615764, "grad_norm": 0.17081645131111145, "learning_rate": 4.899561443861748e-05, "loss": 0.5692, "mean_token_accuracy": 0.8307923413813114, "num_tokens": 530814823.0, "step": 16632 }, { "entropy": 0.6717910822480917, "epoch": 1.5303247249872054, "grad_norm": 0.15765047073364258, "learning_rate": 4.8992547612475854e-05, "loss": 0.6747, "mean_token_accuracy": 0.7959094867110252, "num_tokens": 530846899.0, "step": 16633 }, { "entropy": 0.6502723768353462, "epoch": 1.5304167313586465, "grad_norm": 0.15815700590610504, "learning_rate": 4.898948078633422e-05, "loss": 0.6516, "mean_token_accuracy": 0.8041570149362087, "num_tokens": 530879434.0, "step": 16634 }, { "entropy": 0.4505192628130317, "epoch": 1.5305087377300879, "grad_norm": 0.1403140425682068, "learning_rate": 4.89864139601926e-05, "loss": 0.44, "mean_token_accuracy": 0.8615367710590363, "num_tokens": 530911551.0, "step": 16635 }, { "entropy": 0.6352963699027896, "epoch": 1.530600744101529, "grad_norm": 0.15829618275165558, "learning_rate": 4.898334713405097e-05, "loss": 0.6332, "mean_token_accuracy": 0.8088048920035362, "num_tokens": 530943807.0, "step": 16636 }, { "entropy": 0.5906238593161106, "epoch": 1.5306927504729702, "grad_norm": 0.1438986212015152, "learning_rate": 4.8980280307909346e-05, "loss": 0.5694, "mean_token_accuracy": 0.8233708068728447, "num_tokens": 530975916.0, "step": 16637 }, { "entropy": 0.6652483213692904, "epoch": 1.5307847568444115, "grad_norm": 0.15785947442054749, "learning_rate": 4.897721348176772e-05, "loss": 0.6429, "mean_token_accuracy": 0.8034623637795448, "num_tokens": 531007047.0, "step": 16638 }, { "entropy": 0.5629390422254801, "epoch": 1.5308767632158526, "grad_norm": 0.15487270057201385, "learning_rate": 4.8974146655626095e-05, "loss": 0.5426, "mean_token_accuracy": 0.8363204263150692, "num_tokens": 531039257.0, "step": 16639 }, { "entropy": 0.6189919952303171, "epoch": 1.530968769587294, "grad_norm": 0.14965684711933136, "learning_rate": 4.897107982948447e-05, "loss": 0.6112, "mean_token_accuracy": 0.8084173500537872, "num_tokens": 531071936.0, "step": 16640 }, { "entropy": 0.5446044262498617, "epoch": 1.5310607759587351, "grad_norm": 0.14827556908130646, "learning_rate": 4.8968013003342844e-05, "loss": 0.5478, "mean_token_accuracy": 0.8316228464245796, "num_tokens": 531104225.0, "step": 16641 }, { "entropy": 0.6171448053792119, "epoch": 1.5311527823301763, "grad_norm": 0.15235379338264465, "learning_rate": 4.896494617720121e-05, "loss": 0.6109, "mean_token_accuracy": 0.8100639134645462, "num_tokens": 531136022.0, "step": 16642 }, { "entropy": 0.5934058157727122, "epoch": 1.5312447887016176, "grad_norm": 0.15000678598880768, "learning_rate": 4.8961879351059594e-05, "loss": 0.5691, "mean_token_accuracy": 0.8280476368963718, "num_tokens": 531167851.0, "step": 16643 }, { "entropy": 0.5667247008532286, "epoch": 1.5313367950730588, "grad_norm": 0.14305377006530762, "learning_rate": 4.895881252491796e-05, "loss": 0.5535, "mean_token_accuracy": 0.830923356115818, "num_tokens": 531200279.0, "step": 16644 }, { "entropy": 0.5792864188551903, "epoch": 1.5314288014445, "grad_norm": 0.15312492847442627, "learning_rate": 4.895574569877634e-05, "loss": 0.5692, "mean_token_accuracy": 0.822537861764431, "num_tokens": 531232616.0, "step": 16645 }, { "entropy": 0.6841884963214397, "epoch": 1.5315208078159412, "grad_norm": 0.1733655035495758, "learning_rate": 4.895267887263471e-05, "loss": 0.667, "mean_token_accuracy": 0.7927428185939789, "num_tokens": 531264140.0, "step": 16646 }, { "entropy": 0.6781822219491005, "epoch": 1.5316128141873824, "grad_norm": 0.16188964247703552, "learning_rate": 4.8949612046493085e-05, "loss": 0.6728, "mean_token_accuracy": 0.7969134040176868, "num_tokens": 531296711.0, "step": 16647 }, { "entropy": 0.5893618473783135, "epoch": 1.5317048205588237, "grad_norm": 0.1588018834590912, "learning_rate": 4.894654522035146e-05, "loss": 0.5893, "mean_token_accuracy": 0.8220020085573196, "num_tokens": 531328903.0, "step": 16648 }, { "entropy": 0.5759569443762302, "epoch": 1.5317968269302649, "grad_norm": 0.16322802007198334, "learning_rate": 4.8943478394209835e-05, "loss": 0.5717, "mean_token_accuracy": 0.8268704675137997, "num_tokens": 531361431.0, "step": 16649 }, { "entropy": 0.5955304643139243, "epoch": 1.5318888333017062, "grad_norm": 0.14875562489032745, "learning_rate": 4.894041156806821e-05, "loss": 0.5827, "mean_token_accuracy": 0.824214905500412, "num_tokens": 531393479.0, "step": 16650 }, { "entropy": 0.6018773261457682, "epoch": 1.5319808396731474, "grad_norm": 0.15670734643936157, "learning_rate": 4.8937344741926584e-05, "loss": 0.5879, "mean_token_accuracy": 0.8177613392472267, "num_tokens": 531425426.0, "step": 16651 }, { "entropy": 0.6039286162704229, "epoch": 1.5320728460445885, "grad_norm": 0.1597594916820526, "learning_rate": 4.893427791578495e-05, "loss": 0.5901, "mean_token_accuracy": 0.8204764910042286, "num_tokens": 531457820.0, "step": 16652 }, { "entropy": 0.5656763203442097, "epoch": 1.5321648524160298, "grad_norm": 0.15611256659030914, "learning_rate": 4.893121108964333e-05, "loss": 0.5402, "mean_token_accuracy": 0.8303453549742699, "num_tokens": 531490335.0, "step": 16653 }, { "entropy": 0.6991248494014144, "epoch": 1.5322568587874712, "grad_norm": 0.16586142778396606, "learning_rate": 4.89281442635017e-05, "loss": 0.7031, "mean_token_accuracy": 0.7848452515900135, "num_tokens": 531522302.0, "step": 16654 }, { "entropy": 0.6162538155913353, "epoch": 1.5323488651589123, "grad_norm": 0.1586848497390747, "learning_rate": 4.8925077437360076e-05, "loss": 0.6013, "mean_token_accuracy": 0.8168446645140648, "num_tokens": 531554333.0, "step": 16655 }, { "entropy": 0.5896953158080578, "epoch": 1.5324408715303535, "grad_norm": 0.14847610890865326, "learning_rate": 4.892201061121846e-05, "loss": 0.5732, "mean_token_accuracy": 0.819385688751936, "num_tokens": 531586617.0, "step": 16656 }, { "entropy": 0.6233134772628546, "epoch": 1.5325328779017946, "grad_norm": 0.15272121131420135, "learning_rate": 4.8918943785076825e-05, "loss": 0.6164, "mean_token_accuracy": 0.8107400983572006, "num_tokens": 531618765.0, "step": 16657 }, { "entropy": 0.7047692267224193, "epoch": 1.532624884273236, "grad_norm": 0.16521471738815308, "learning_rate": 4.89158769589352e-05, "loss": 0.7093, "mean_token_accuracy": 0.7870591543614864, "num_tokens": 531651510.0, "step": 16658 }, { "entropy": 0.5621075159870088, "epoch": 1.5327168906446773, "grad_norm": 0.14508448541164398, "learning_rate": 4.8912810132793574e-05, "loss": 0.5468, "mean_token_accuracy": 0.834070585668087, "num_tokens": 531683940.0, "step": 16659 }, { "entropy": 0.6266862582415342, "epoch": 1.5328088970161184, "grad_norm": 0.15110842883586884, "learning_rate": 4.890974330665195e-05, "loss": 0.6078, "mean_token_accuracy": 0.8122256807982922, "num_tokens": 531716322.0, "step": 16660 }, { "entropy": 0.6013573613017797, "epoch": 1.5329009033875596, "grad_norm": 0.15289324522018433, "learning_rate": 4.8906676480510324e-05, "loss": 0.5877, "mean_token_accuracy": 0.8174616396427155, "num_tokens": 531748499.0, "step": 16661 }, { "entropy": 0.5612768856808543, "epoch": 1.5329929097590007, "grad_norm": 0.15635135769844055, "learning_rate": 4.89036096543687e-05, "loss": 0.5432, "mean_token_accuracy": 0.8331555053591728, "num_tokens": 531780458.0, "step": 16662 }, { "entropy": 0.5733124697580934, "epoch": 1.533084916130442, "grad_norm": 0.1501568853855133, "learning_rate": 4.8900542828227066e-05, "loss": 0.5502, "mean_token_accuracy": 0.8309986591339111, "num_tokens": 531812415.0, "step": 16663 }, { "entropy": 0.5382702429778874, "epoch": 1.5331769225018834, "grad_norm": 0.14644856750965118, "learning_rate": 4.889747600208545e-05, "loss": 0.5107, "mean_token_accuracy": 0.8424866162240505, "num_tokens": 531844613.0, "step": 16664 }, { "entropy": 0.6322224866598845, "epoch": 1.5332689288733246, "grad_norm": 0.16455194354057312, "learning_rate": 4.8894409175943816e-05, "loss": 0.6348, "mean_token_accuracy": 0.809073805809021, "num_tokens": 531877001.0, "step": 16665 }, { "entropy": 0.597591548692435, "epoch": 1.5333609352447657, "grad_norm": 0.1564944088459015, "learning_rate": 4.88913423498022e-05, "loss": 0.5841, "mean_token_accuracy": 0.8216569572687149, "num_tokens": 531909031.0, "step": 16666 }, { "entropy": 0.6313079334795475, "epoch": 1.5334529416162068, "grad_norm": 0.16050103306770325, "learning_rate": 4.8888275523660565e-05, "loss": 0.6311, "mean_token_accuracy": 0.8061057962477207, "num_tokens": 531941089.0, "step": 16667 }, { "entropy": 0.6122173722833395, "epoch": 1.5335449479876482, "grad_norm": 0.15885518491268158, "learning_rate": 4.888520869751894e-05, "loss": 0.6013, "mean_token_accuracy": 0.8170132488012314, "num_tokens": 531972462.0, "step": 16668 }, { "entropy": 0.6524430452845991, "epoch": 1.5336369543590895, "grad_norm": 0.16495376825332642, "learning_rate": 4.8882141871377314e-05, "loss": 0.6499, "mean_token_accuracy": 0.802241075783968, "num_tokens": 532005230.0, "step": 16669 }, { "entropy": 0.5785846607759595, "epoch": 1.5337289607305307, "grad_norm": 0.15307657420635223, "learning_rate": 4.887907504523569e-05, "loss": 0.5669, "mean_token_accuracy": 0.8265798054635525, "num_tokens": 532037158.0, "step": 16670 }, { "entropy": 0.5381657555699348, "epoch": 1.5338209671019718, "grad_norm": 0.15508578717708588, "learning_rate": 4.8876008219094063e-05, "loss": 0.5284, "mean_token_accuracy": 0.8350585140287876, "num_tokens": 532069482.0, "step": 16671 }, { "entropy": 0.6474285088479519, "epoch": 1.533912973473413, "grad_norm": 0.16052773594856262, "learning_rate": 4.887294139295244e-05, "loss": 0.6345, "mean_token_accuracy": 0.8036474213004112, "num_tokens": 532102017.0, "step": 16672 }, { "entropy": 0.7008578618988395, "epoch": 1.5340049798448543, "grad_norm": 0.16175587475299835, "learning_rate": 4.8869874566810806e-05, "loss": 0.7033, "mean_token_accuracy": 0.7831700555980206, "num_tokens": 532133986.0, "step": 16673 }, { "entropy": 0.4605826176702976, "epoch": 1.5340969862162956, "grad_norm": 0.14482422173023224, "learning_rate": 4.886680774066919e-05, "loss": 0.4437, "mean_token_accuracy": 0.8619328364729881, "num_tokens": 532166616.0, "step": 16674 }, { "entropy": 0.7657330799847841, "epoch": 1.5341889925877368, "grad_norm": 0.16430462896823883, "learning_rate": 4.8863740914527555e-05, "loss": 0.7591, "mean_token_accuracy": 0.7735075354576111, "num_tokens": 532198797.0, "step": 16675 }, { "entropy": 0.6293457429856062, "epoch": 1.534280998959178, "grad_norm": 0.15480011701583862, "learning_rate": 4.886067408838593e-05, "loss": 0.6214, "mean_token_accuracy": 0.8089748881757259, "num_tokens": 532231307.0, "step": 16676 }, { "entropy": 0.5405803984031081, "epoch": 1.534373005330619, "grad_norm": 0.14856606721878052, "learning_rate": 4.8857607262244305e-05, "loss": 0.511, "mean_token_accuracy": 0.8402869552373886, "num_tokens": 532262154.0, "step": 16677 }, { "entropy": 0.7071920104790479, "epoch": 1.5344650117020604, "grad_norm": 0.15633615851402283, "learning_rate": 4.885454043610268e-05, "loss": 0.6942, "mean_token_accuracy": 0.7889284677803516, "num_tokens": 532294608.0, "step": 16678 }, { "entropy": 0.6945059932768345, "epoch": 1.5345570180735018, "grad_norm": 0.1605415642261505, "learning_rate": 4.8851473609961054e-05, "loss": 0.6951, "mean_token_accuracy": 0.7898929677903652, "num_tokens": 532326057.0, "step": 16679 }, { "entropy": 0.7223389558494091, "epoch": 1.5346490244449429, "grad_norm": 0.1634630411863327, "learning_rate": 4.884840678381943e-05, "loss": 0.733, "mean_token_accuracy": 0.7790688686072826, "num_tokens": 532357923.0, "step": 16680 }, { "entropy": 0.46645402535796165, "epoch": 1.534741030816384, "grad_norm": 0.1376510113477707, "learning_rate": 4.8845339957677796e-05, "loss": 0.4512, "mean_token_accuracy": 0.8559658005833626, "num_tokens": 532389556.0, "step": 16681 }, { "entropy": 0.6717223324812949, "epoch": 1.5348330371878252, "grad_norm": 0.15410004556179047, "learning_rate": 4.884227313153618e-05, "loss": 0.6548, "mean_token_accuracy": 0.8058447502553463, "num_tokens": 532421678.0, "step": 16682 }, { "entropy": 0.5924117853865027, "epoch": 1.5349250435592665, "grad_norm": 0.1518900841474533, "learning_rate": 4.8839206305394546e-05, "loss": 0.5801, "mean_token_accuracy": 0.82110995054245, "num_tokens": 532453986.0, "step": 16683 }, { "entropy": 0.676208607852459, "epoch": 1.5350170499307079, "grad_norm": 0.1563485562801361, "learning_rate": 4.883613947925293e-05, "loss": 0.6787, "mean_token_accuracy": 0.7952880300581455, "num_tokens": 532486062.0, "step": 16684 }, { "entropy": 0.6767987366765738, "epoch": 1.535109056302149, "grad_norm": 0.15635822713375092, "learning_rate": 4.8833072653111295e-05, "loss": 0.6757, "mean_token_accuracy": 0.7924316674470901, "num_tokens": 532518670.0, "step": 16685 }, { "entropy": 0.5538074132055044, "epoch": 1.5352010626735901, "grad_norm": 0.14764775335788727, "learning_rate": 4.883000582696967e-05, "loss": 0.5359, "mean_token_accuracy": 0.8351359702646732, "num_tokens": 532550954.0, "step": 16686 }, { "entropy": 0.6425099708139896, "epoch": 1.5352930690450313, "grad_norm": 0.16071702539920807, "learning_rate": 4.882693900082805e-05, "loss": 0.622, "mean_token_accuracy": 0.8084884323179722, "num_tokens": 532582043.0, "step": 16687 }, { "entropy": 0.5302258357405663, "epoch": 1.5353850754164726, "grad_norm": 0.15345506370067596, "learning_rate": 4.882387217468642e-05, "loss": 0.5124, "mean_token_accuracy": 0.8372346200048923, "num_tokens": 532613927.0, "step": 16688 }, { "entropy": 0.6772467140108347, "epoch": 1.535477081787914, "grad_norm": 0.15625083446502686, "learning_rate": 4.8820805348544793e-05, "loss": 0.6655, "mean_token_accuracy": 0.7971406728029251, "num_tokens": 532646396.0, "step": 16689 }, { "entropy": 0.6148962508887053, "epoch": 1.5355690881593551, "grad_norm": 0.15106025338172913, "learning_rate": 4.881773852240317e-05, "loss": 0.5937, "mean_token_accuracy": 0.8168198093771935, "num_tokens": 532678924.0, "step": 16690 }, { "entropy": 0.5803386624902487, "epoch": 1.5356610945307962, "grad_norm": 0.14902809262275696, "learning_rate": 4.881467169626154e-05, "loss": 0.5751, "mean_token_accuracy": 0.8243416324257851, "num_tokens": 532711337.0, "step": 16691 }, { "entropy": 0.6010224847123027, "epoch": 1.5357531009022374, "grad_norm": 0.15132151544094086, "learning_rate": 4.881160487011992e-05, "loss": 0.5911, "mean_token_accuracy": 0.8199749365448952, "num_tokens": 532743578.0, "step": 16692 }, { "entropy": 0.6474008355289698, "epoch": 1.5358451072736787, "grad_norm": 0.1754487007856369, "learning_rate": 4.880853804397829e-05, "loss": 0.6362, "mean_token_accuracy": 0.8057382479310036, "num_tokens": 532775010.0, "step": 16693 }, { "entropy": 0.574708984233439, "epoch": 1.53593711364512, "grad_norm": 0.1543949693441391, "learning_rate": 4.880547121783666e-05, "loss": 0.5682, "mean_token_accuracy": 0.8291515968739986, "num_tokens": 532807097.0, "step": 16694 }, { "entropy": 0.6019217129796743, "epoch": 1.5360291200165612, "grad_norm": 0.15820766985416412, "learning_rate": 4.880240439169504e-05, "loss": 0.5953, "mean_token_accuracy": 0.8193766176700592, "num_tokens": 532838922.0, "step": 16695 }, { "entropy": 0.6895260820165277, "epoch": 1.5361211263880024, "grad_norm": 0.16718529164791107, "learning_rate": 4.879933756555341e-05, "loss": 0.6924, "mean_token_accuracy": 0.7891257666051388, "num_tokens": 532870486.0, "step": 16696 }, { "entropy": 0.6488480968400836, "epoch": 1.5362131327594435, "grad_norm": 0.16100850701332092, "learning_rate": 4.8796270739411784e-05, "loss": 0.6403, "mean_token_accuracy": 0.804622620344162, "num_tokens": 532903254.0, "step": 16697 }, { "entropy": 0.5933830412104726, "epoch": 1.5363051391308848, "grad_norm": 0.15581002831459045, "learning_rate": 4.879320391327016e-05, "loss": 0.5833, "mean_token_accuracy": 0.8233758509159088, "num_tokens": 532935690.0, "step": 16698 }, { "entropy": 0.6568577094003558, "epoch": 1.5363971455023262, "grad_norm": 0.15718239545822144, "learning_rate": 4.879013708712853e-05, "loss": 0.6472, "mean_token_accuracy": 0.8060807026922703, "num_tokens": 532968274.0, "step": 16699 }, { "entropy": 0.5641084890812635, "epoch": 1.5364891518737673, "grad_norm": 0.15360265970230103, "learning_rate": 4.878707026098691e-05, "loss": 0.5598, "mean_token_accuracy": 0.8234237991273403, "num_tokens": 533000220.0, "step": 16700 }, { "entropy": 0.6382030192762613, "epoch": 1.5365811582452085, "grad_norm": 0.15776170790195465, "learning_rate": 4.878400343484528e-05, "loss": 0.6207, "mean_token_accuracy": 0.8119431473314762, "num_tokens": 533032682.0, "step": 16701 }, { "entropy": 0.7056819330900908, "epoch": 1.5366731646166496, "grad_norm": 0.1644447296857834, "learning_rate": 4.878093660870365e-05, "loss": 0.6977, "mean_token_accuracy": 0.7899991311132908, "num_tokens": 533063590.0, "step": 16702 }, { "entropy": 0.6081531997770071, "epoch": 1.536765170988091, "grad_norm": 0.1549336314201355, "learning_rate": 4.877786978256203e-05, "loss": 0.5841, "mean_token_accuracy": 0.8195102326571941, "num_tokens": 533094575.0, "step": 16703 }, { "entropy": 0.6477363612502813, "epoch": 1.5368571773595323, "grad_norm": 0.16168421506881714, "learning_rate": 4.87748029564204e-05, "loss": 0.6558, "mean_token_accuracy": 0.7980470918118954, "num_tokens": 533125609.0, "step": 16704 }, { "entropy": 0.5999901574105024, "epoch": 1.5369491837309734, "grad_norm": 0.1497228443622589, "learning_rate": 4.877173613027878e-05, "loss": 0.5776, "mean_token_accuracy": 0.8217574320733547, "num_tokens": 533158284.0, "step": 16705 }, { "entropy": 0.6490564085543156, "epoch": 1.5370411901024146, "grad_norm": 0.1534540355205536, "learning_rate": 4.876866930413715e-05, "loss": 0.6381, "mean_token_accuracy": 0.8056481555104256, "num_tokens": 533189792.0, "step": 16706 }, { "entropy": 0.6902514845132828, "epoch": 1.5371331964738557, "grad_norm": 0.16632488369941711, "learning_rate": 4.8765602477995524e-05, "loss": 0.6745, "mean_token_accuracy": 0.799822848290205, "num_tokens": 533220814.0, "step": 16707 }, { "entropy": 0.7360730767250061, "epoch": 1.537225202845297, "grad_norm": 0.16446572542190552, "learning_rate": 4.87625356518539e-05, "loss": 0.727, "mean_token_accuracy": 0.7802900560200214, "num_tokens": 533253058.0, "step": 16708 }, { "entropy": 0.6738643236458302, "epoch": 1.5373172092167384, "grad_norm": 0.15477055311203003, "learning_rate": 4.875946882571227e-05, "loss": 0.6546, "mean_token_accuracy": 0.797528114169836, "num_tokens": 533284899.0, "step": 16709 }, { "entropy": 0.5609199749305844, "epoch": 1.5374092155881796, "grad_norm": 0.14616334438323975, "learning_rate": 4.875640199957065e-05, "loss": 0.5424, "mean_token_accuracy": 0.8359145857393742, "num_tokens": 533317048.0, "step": 16710 }, { "entropy": 0.5417928625829518, "epoch": 1.5375012219596207, "grad_norm": 0.14650525152683258, "learning_rate": 4.875333517342902e-05, "loss": 0.5274, "mean_token_accuracy": 0.839940071105957, "num_tokens": 533349241.0, "step": 16711 }, { "entropy": 0.615096696652472, "epoch": 1.5375932283310618, "grad_norm": 0.15478812158107758, "learning_rate": 4.875026834728739e-05, "loss": 0.5935, "mean_token_accuracy": 0.8155270926654339, "num_tokens": 533380691.0, "step": 16712 }, { "entropy": 0.7191495532169938, "epoch": 1.5376852347025032, "grad_norm": 0.1601143479347229, "learning_rate": 4.874720152114577e-05, "loss": 0.711, "mean_token_accuracy": 0.7853939719498158, "num_tokens": 533413186.0, "step": 16713 }, { "entropy": 0.6345072835683823, "epoch": 1.5377772410739445, "grad_norm": 0.1556129902601242, "learning_rate": 4.874413469500414e-05, "loss": 0.628, "mean_token_accuracy": 0.8037090674042702, "num_tokens": 533445160.0, "step": 16714 }, { "entropy": 0.6747263558208942, "epoch": 1.5378692474453857, "grad_norm": 0.15680554509162903, "learning_rate": 4.8741067868862514e-05, "loss": 0.6688, "mean_token_accuracy": 0.7963961884379387, "num_tokens": 533476861.0, "step": 16715 }, { "entropy": 0.6093288145493716, "epoch": 1.5379612538168268, "grad_norm": 0.149540513753891, "learning_rate": 4.873800104272089e-05, "loss": 0.5985, "mean_token_accuracy": 0.8194749616086483, "num_tokens": 533509272.0, "step": 16716 }, { "entropy": 0.5796257946640253, "epoch": 1.538053260188268, "grad_norm": 0.15482284128665924, "learning_rate": 4.873493421657926e-05, "loss": 0.5554, "mean_token_accuracy": 0.826549094170332, "num_tokens": 533540658.0, "step": 16717 }, { "entropy": 0.6808862667530775, "epoch": 1.5381452665597093, "grad_norm": 0.16316193342208862, "learning_rate": 4.873186739043764e-05, "loss": 0.6675, "mean_token_accuracy": 0.794792402535677, "num_tokens": 533572309.0, "step": 16718 }, { "entropy": 0.5673627685755491, "epoch": 1.5382372729311506, "grad_norm": 0.16731782257556915, "learning_rate": 4.872880056429601e-05, "loss": 0.5585, "mean_token_accuracy": 0.8272229135036469, "num_tokens": 533602810.0, "step": 16719 }, { "entropy": 0.5157920867204666, "epoch": 1.5383292793025918, "grad_norm": 0.1466541886329651, "learning_rate": 4.872573373815439e-05, "loss": 0.5064, "mean_token_accuracy": 0.8423049002885818, "num_tokens": 533634672.0, "step": 16720 }, { "entropy": 0.5895738992840052, "epoch": 1.538421285674033, "grad_norm": 0.16288624703884125, "learning_rate": 4.872266691201276e-05, "loss": 0.5882, "mean_token_accuracy": 0.8188086226582527, "num_tokens": 533665814.0, "step": 16721 }, { "entropy": 0.5781047027558088, "epoch": 1.538513292045474, "grad_norm": 0.15623857080936432, "learning_rate": 4.8719600085871137e-05, "loss": 0.5727, "mean_token_accuracy": 0.8201611861586571, "num_tokens": 533696586.0, "step": 16722 }, { "entropy": 0.6294315166305751, "epoch": 1.5386052984169154, "grad_norm": 0.17334984242916107, "learning_rate": 4.8716533259729504e-05, "loss": 0.6277, "mean_token_accuracy": 0.8061946593225002, "num_tokens": 533728350.0, "step": 16723 }, { "entropy": 0.7119524963200092, "epoch": 1.5386973047883568, "grad_norm": 0.16230995953083038, "learning_rate": 4.8713466433587886e-05, "loss": 0.7051, "mean_token_accuracy": 0.7872883789241314, "num_tokens": 533760645.0, "step": 16724 }, { "entropy": 0.4734776224941015, "epoch": 1.538789311159798, "grad_norm": 0.1463349461555481, "learning_rate": 4.8710399607446254e-05, "loss": 0.4694, "mean_token_accuracy": 0.85218720510602, "num_tokens": 533792283.0, "step": 16725 }, { "entropy": 0.6344854477792978, "epoch": 1.538881317531239, "grad_norm": 0.15783479809761047, "learning_rate": 4.8707332781304635e-05, "loss": 0.631, "mean_token_accuracy": 0.8068316839635372, "num_tokens": 533824598.0, "step": 16726 }, { "entropy": 0.6974272429943085, "epoch": 1.5389733239026802, "grad_norm": 0.1640259474515915, "learning_rate": 4.8704265955163e-05, "loss": 0.6743, "mean_token_accuracy": 0.7946178428828716, "num_tokens": 533855802.0, "step": 16727 }, { "entropy": 0.6250097402371466, "epoch": 1.5390653302741215, "grad_norm": 0.1628042310476303, "learning_rate": 4.870119912902138e-05, "loss": 0.6088, "mean_token_accuracy": 0.8119150027632713, "num_tokens": 533887592.0, "step": 16728 }, { "entropy": 0.6422786023467779, "epoch": 1.5391573366455629, "grad_norm": 0.16321785748004913, "learning_rate": 4.869813230287975e-05, "loss": 0.6333, "mean_token_accuracy": 0.8084430173039436, "num_tokens": 533918566.0, "step": 16729 }, { "entropy": 0.575001603923738, "epoch": 1.539249343017004, "grad_norm": 0.15427012741565704, "learning_rate": 4.869506547673813e-05, "loss": 0.5658, "mean_token_accuracy": 0.8239607661962509, "num_tokens": 533950905.0, "step": 16730 }, { "entropy": 0.5906529063358903, "epoch": 1.5393413493884451, "grad_norm": 0.15089957416057587, "learning_rate": 4.86919986505965e-05, "loss": 0.5802, "mean_token_accuracy": 0.8218013234436512, "num_tokens": 533982869.0, "step": 16731 }, { "entropy": 0.6174094621092081, "epoch": 1.5394333557598863, "grad_norm": 0.15292319655418396, "learning_rate": 4.8688931824454876e-05, "loss": 0.6042, "mean_token_accuracy": 0.8154423534870148, "num_tokens": 534015193.0, "step": 16732 }, { "entropy": 0.5825012158602476, "epoch": 1.5395253621313276, "grad_norm": 0.15807582437992096, "learning_rate": 4.8685864998313244e-05, "loss": 0.569, "mean_token_accuracy": 0.8221127986907959, "num_tokens": 534045589.0, "step": 16733 }, { "entropy": 0.5902309473603964, "epoch": 1.539617368502769, "grad_norm": 0.15253396332263947, "learning_rate": 4.8682798172171626e-05, "loss": 0.5855, "mean_token_accuracy": 0.8182416744530201, "num_tokens": 534077600.0, "step": 16734 }, { "entropy": 0.6256960267201066, "epoch": 1.5397093748742101, "grad_norm": 0.15555043518543243, "learning_rate": 4.8679731346029993e-05, "loss": 0.6136, "mean_token_accuracy": 0.8140337914228439, "num_tokens": 534109516.0, "step": 16735 }, { "entropy": 0.5505384718999267, "epoch": 1.5398013812456512, "grad_norm": 0.15151281654834747, "learning_rate": 4.867666451988837e-05, "loss": 0.5472, "mean_token_accuracy": 0.8348408490419388, "num_tokens": 534141994.0, "step": 16736 }, { "entropy": 0.7445137146860361, "epoch": 1.5398933876170924, "grad_norm": 0.16529931128025055, "learning_rate": 4.867359769374674e-05, "loss": 0.7275, "mean_token_accuracy": 0.7729001827538013, "num_tokens": 534173481.0, "step": 16737 }, { "entropy": 0.6346455421298742, "epoch": 1.5399853939885337, "grad_norm": 0.1555176079273224, "learning_rate": 4.867053086760512e-05, "loss": 0.639, "mean_token_accuracy": 0.8053391575813293, "num_tokens": 534205448.0, "step": 16738 }, { "entropy": 0.6570374118164182, "epoch": 1.540077400359975, "grad_norm": 0.15335869789123535, "learning_rate": 4.866746404146349e-05, "loss": 0.6419, "mean_token_accuracy": 0.8038530685007572, "num_tokens": 534237123.0, "step": 16739 }, { "entropy": 0.5655712448060513, "epoch": 1.5401694067314162, "grad_norm": 0.15329095721244812, "learning_rate": 4.866439721532187e-05, "loss": 0.5648, "mean_token_accuracy": 0.8274016156792641, "num_tokens": 534269015.0, "step": 16740 }, { "entropy": 0.6264520976692438, "epoch": 1.5402614131028574, "grad_norm": 0.14915122091770172, "learning_rate": 4.8661330389180235e-05, "loss": 0.6105, "mean_token_accuracy": 0.8122941292822361, "num_tokens": 534301100.0, "step": 16741 }, { "entropy": 0.6121608717367053, "epoch": 1.5403534194742985, "grad_norm": 0.15226009488105774, "learning_rate": 4.8658263563038616e-05, "loss": 0.5913, "mean_token_accuracy": 0.8156581409275532, "num_tokens": 534332973.0, "step": 16742 }, { "entropy": 0.619570467621088, "epoch": 1.5404454258457398, "grad_norm": 0.151201531291008, "learning_rate": 4.8655196736896984e-05, "loss": 0.6076, "mean_token_accuracy": 0.8173029385507107, "num_tokens": 534365137.0, "step": 16743 }, { "entropy": 0.6122921188361943, "epoch": 1.5405374322171812, "grad_norm": 0.15922486782073975, "learning_rate": 4.8652129910755365e-05, "loss": 0.6077, "mean_token_accuracy": 0.8164732679724693, "num_tokens": 534397650.0, "step": 16744 }, { "entropy": 0.6475800219923258, "epoch": 1.5406294385886223, "grad_norm": 0.15864650905132294, "learning_rate": 4.864906308461373e-05, "loss": 0.6587, "mean_token_accuracy": 0.7987233772873878, "num_tokens": 534429625.0, "step": 16745 }, { "entropy": 0.570534098893404, "epoch": 1.5407214449600635, "grad_norm": 0.15436910092830658, "learning_rate": 4.864599625847211e-05, "loss": 0.5648, "mean_token_accuracy": 0.8278074264526367, "num_tokens": 534461402.0, "step": 16746 }, { "entropy": 0.5727490540593863, "epoch": 1.5408134513315046, "grad_norm": 0.15910908579826355, "learning_rate": 4.864292943233049e-05, "loss": 0.5556, "mean_token_accuracy": 0.829381138086319, "num_tokens": 534493327.0, "step": 16747 }, { "entropy": 0.48341842368245125, "epoch": 1.540905457702946, "grad_norm": 0.14316074550151825, "learning_rate": 4.863986260618886e-05, "loss": 0.4635, "mean_token_accuracy": 0.8571001030504704, "num_tokens": 534525902.0, "step": 16748 }, { "entropy": 0.6708500161767006, "epoch": 1.5409974640743873, "grad_norm": 0.1678410768508911, "learning_rate": 4.863679578004723e-05, "loss": 0.6559, "mean_token_accuracy": 0.7989755123853683, "num_tokens": 534556841.0, "step": 16749 }, { "entropy": 0.6399373356252909, "epoch": 1.5410894704458284, "grad_norm": 0.1599031388759613, "learning_rate": 4.8633728953905606e-05, "loss": 0.6413, "mean_token_accuracy": 0.8024808391928673, "num_tokens": 534588377.0, "step": 16750 }, { "entropy": 0.6321983300149441, "epoch": 1.5411814768172696, "grad_norm": 0.15907342731952667, "learning_rate": 4.863066212776398e-05, "loss": 0.6346, "mean_token_accuracy": 0.806833740323782, "num_tokens": 534620896.0, "step": 16751 }, { "entropy": 0.5740562891587615, "epoch": 1.5412734831887107, "grad_norm": 0.15766964852809906, "learning_rate": 4.8627595301622356e-05, "loss": 0.5643, "mean_token_accuracy": 0.8258088268339634, "num_tokens": 534652787.0, "step": 16752 }, { "entropy": 0.6591412723064423, "epoch": 1.541365489560152, "grad_norm": 0.15944482386112213, "learning_rate": 4.862452847548073e-05, "loss": 0.6512, "mean_token_accuracy": 0.801820881664753, "num_tokens": 534685054.0, "step": 16753 }, { "entropy": 0.6574253551661968, "epoch": 1.5414574959315934, "grad_norm": 0.16448861360549927, "learning_rate": 4.86214616493391e-05, "loss": 0.6382, "mean_token_accuracy": 0.809797577559948, "num_tokens": 534716679.0, "step": 16754 }, { "entropy": 0.6455120192840695, "epoch": 1.5415495023030346, "grad_norm": 0.15502282977104187, "learning_rate": 4.861839482319748e-05, "loss": 0.6404, "mean_token_accuracy": 0.8043806180357933, "num_tokens": 534749039.0, "step": 16755 }, { "entropy": 0.5970958294346929, "epoch": 1.5416415086744757, "grad_norm": 0.15370602905750275, "learning_rate": 4.861532799705585e-05, "loss": 0.5879, "mean_token_accuracy": 0.81724464148283, "num_tokens": 534780416.0, "step": 16756 }, { "entropy": 0.6060113133862615, "epoch": 1.5417335150459168, "grad_norm": 0.15851424634456635, "learning_rate": 4.861226117091422e-05, "loss": 0.5917, "mean_token_accuracy": 0.8172442354261875, "num_tokens": 534812621.0, "step": 16757 }, { "entropy": 0.5955435205250978, "epoch": 1.5418255214173582, "grad_norm": 0.1869523823261261, "learning_rate": 4.86091943447726e-05, "loss": 0.5726, "mean_token_accuracy": 0.8225115612149239, "num_tokens": 534844118.0, "step": 16758 }, { "entropy": 0.6174914967268705, "epoch": 1.5419175277887995, "grad_norm": 0.15322615206241608, "learning_rate": 4.860612751863097e-05, "loss": 0.6166, "mean_token_accuracy": 0.813122846186161, "num_tokens": 534876459.0, "step": 16759 }, { "entropy": 0.6921174339950085, "epoch": 1.5420095341602407, "grad_norm": 0.156356543302536, "learning_rate": 4.8603060692489346e-05, "loss": 0.682, "mean_token_accuracy": 0.7913378924131393, "num_tokens": 534908453.0, "step": 16760 }, { "entropy": 0.6870741229504347, "epoch": 1.5421015405316818, "grad_norm": 0.16409918665885925, "learning_rate": 4.859999386634772e-05, "loss": 0.6862, "mean_token_accuracy": 0.792221937328577, "num_tokens": 534939918.0, "step": 16761 }, { "entropy": 0.568550038151443, "epoch": 1.542193546903123, "grad_norm": 0.15143725275993347, "learning_rate": 4.859692704020609e-05, "loss": 0.5742, "mean_token_accuracy": 0.8296327218413353, "num_tokens": 534972049.0, "step": 16762 }, { "entropy": 0.6584862973541021, "epoch": 1.5422855532745643, "grad_norm": 0.16120454668998718, "learning_rate": 4.859386021406447e-05, "loss": 0.653, "mean_token_accuracy": 0.7998167760670185, "num_tokens": 535003606.0, "step": 16763 }, { "entropy": 0.7736897096037865, "epoch": 1.5423775596460056, "grad_norm": 0.16607722640037537, "learning_rate": 4.859079338792284e-05, "loss": 0.7632, "mean_token_accuracy": 0.769744511693716, "num_tokens": 535035728.0, "step": 16764 }, { "entropy": 0.6544139590114355, "epoch": 1.5424695660174468, "grad_norm": 0.16111204028129578, "learning_rate": 4.858772656178122e-05, "loss": 0.6325, "mean_token_accuracy": 0.806391429156065, "num_tokens": 535067307.0, "step": 16765 }, { "entropy": 0.6113275098614395, "epoch": 1.542561572388888, "grad_norm": 0.15343402326107025, "learning_rate": 4.858465973563959e-05, "loss": 0.5988, "mean_token_accuracy": 0.8149918913841248, "num_tokens": 535099265.0, "step": 16766 }, { "entropy": 0.6337373126298189, "epoch": 1.542653578760329, "grad_norm": 0.15868373215198517, "learning_rate": 4.858159290949796e-05, "loss": 0.6162, "mean_token_accuracy": 0.8131214939057827, "num_tokens": 535131490.0, "step": 16767 }, { "entropy": 0.6554018557071686, "epoch": 1.5427455851317704, "grad_norm": 0.16215084493160248, "learning_rate": 4.8578526083356336e-05, "loss": 0.6329, "mean_token_accuracy": 0.8051623702049255, "num_tokens": 535162486.0, "step": 16768 }, { "entropy": 0.6926757954061031, "epoch": 1.5428375915032118, "grad_norm": 0.16013532876968384, "learning_rate": 4.857545925721471e-05, "loss": 0.6626, "mean_token_accuracy": 0.7960186004638672, "num_tokens": 535194100.0, "step": 16769 }, { "entropy": 0.5855578081682324, "epoch": 1.542929597874653, "grad_norm": 0.15347842872142792, "learning_rate": 4.8572392431073086e-05, "loss": 0.5766, "mean_token_accuracy": 0.8226808346807957, "num_tokens": 535226360.0, "step": 16770 }, { "entropy": 0.6494536907412112, "epoch": 1.543021604246094, "grad_norm": 0.16376857459545135, "learning_rate": 4.856932560493146e-05, "loss": 0.6279, "mean_token_accuracy": 0.8073702119290829, "num_tokens": 535258325.0, "step": 16771 }, { "entropy": 0.7570474799722433, "epoch": 1.5431136106175352, "grad_norm": 0.1651514768600464, "learning_rate": 4.856625877878983e-05, "loss": 0.742, "mean_token_accuracy": 0.7769633196294308, "num_tokens": 535290845.0, "step": 16772 }, { "entropy": 0.5959161892533302, "epoch": 1.5432056169889765, "grad_norm": 0.14994193613529205, "learning_rate": 4.856319195264821e-05, "loss": 0.5887, "mean_token_accuracy": 0.821856252849102, "num_tokens": 535323437.0, "step": 16773 }, { "entropy": 0.6113578816875815, "epoch": 1.5432976233604179, "grad_norm": 0.16380999982357025, "learning_rate": 4.856012512650658e-05, "loss": 0.5973, "mean_token_accuracy": 0.8132656514644623, "num_tokens": 535354712.0, "step": 16774 }, { "entropy": 0.5230695977807045, "epoch": 1.543389629731859, "grad_norm": 0.15371191501617432, "learning_rate": 4.855705830036495e-05, "loss": 0.5125, "mean_token_accuracy": 0.8388974033296108, "num_tokens": 535386941.0, "step": 16775 }, { "entropy": 0.668524419888854, "epoch": 1.5434816361033001, "grad_norm": 0.1604067087173462, "learning_rate": 4.855399147422333e-05, "loss": 0.6543, "mean_token_accuracy": 0.8053231835365295, "num_tokens": 535419307.0, "step": 16776 }, { "entropy": 0.5782194435596466, "epoch": 1.5435736424747413, "grad_norm": 0.15529532730579376, "learning_rate": 4.85509246480817e-05, "loss": 0.575, "mean_token_accuracy": 0.8218185231089592, "num_tokens": 535450255.0, "step": 16777 }, { "entropy": 0.5416859146207571, "epoch": 1.5436656488461826, "grad_norm": 0.15018592774868011, "learning_rate": 4.8547857821940076e-05, "loss": 0.5365, "mean_token_accuracy": 0.8344463482499123, "num_tokens": 535482273.0, "step": 16778 }, { "entropy": 0.6087373988702893, "epoch": 1.543757655217624, "grad_norm": 0.16249412298202515, "learning_rate": 4.854479099579845e-05, "loss": 0.613, "mean_token_accuracy": 0.815627995878458, "num_tokens": 535514705.0, "step": 16779 }, { "entropy": 0.6630628034472466, "epoch": 1.5438496615890651, "grad_norm": 0.1633557677268982, "learning_rate": 4.8541724169656825e-05, "loss": 0.658, "mean_token_accuracy": 0.8046206384897232, "num_tokens": 535547134.0, "step": 16780 }, { "entropy": 0.579534194432199, "epoch": 1.5439416679605062, "grad_norm": 0.1537521928548813, "learning_rate": 4.85386573435152e-05, "loss": 0.5711, "mean_token_accuracy": 0.8231966383755207, "num_tokens": 535579452.0, "step": 16781 }, { "entropy": 0.6800615414977074, "epoch": 1.5440336743319474, "grad_norm": 0.16268180310726166, "learning_rate": 4.8535590517373575e-05, "loss": 0.6703, "mean_token_accuracy": 0.7985139712691307, "num_tokens": 535610904.0, "step": 16782 }, { "entropy": 0.5972783258184791, "epoch": 1.5441256807033887, "grad_norm": 0.15644283592700958, "learning_rate": 4.853252369123194e-05, "loss": 0.5843, "mean_token_accuracy": 0.8209734037518501, "num_tokens": 535642694.0, "step": 16783 }, { "entropy": 0.5527463648468256, "epoch": 1.54421768707483, "grad_norm": 0.14751186966896057, "learning_rate": 4.8529456865090324e-05, "loss": 0.5392, "mean_token_accuracy": 0.8332393877208233, "num_tokens": 535674504.0, "step": 16784 }, { "entropy": 0.5368259819224477, "epoch": 1.5443096934462712, "grad_norm": 0.1487436592578888, "learning_rate": 4.852639003894869e-05, "loss": 0.527, "mean_token_accuracy": 0.837278887629509, "num_tokens": 535706477.0, "step": 16785 }, { "entropy": 0.5151106994599104, "epoch": 1.5444016998177124, "grad_norm": 0.14716751873493195, "learning_rate": 4.852332321280707e-05, "loss": 0.5049, "mean_token_accuracy": 0.8404967151582241, "num_tokens": 535738550.0, "step": 16786 }, { "entropy": 0.6262980215251446, "epoch": 1.5444937061891535, "grad_norm": 0.15129999816417694, "learning_rate": 4.852025638666544e-05, "loss": 0.6063, "mean_token_accuracy": 0.8136518523097038, "num_tokens": 535770615.0, "step": 16787 }, { "entropy": 0.6476047448813915, "epoch": 1.5445857125605948, "grad_norm": 0.15740659832954407, "learning_rate": 4.8517189560523816e-05, "loss": 0.6542, "mean_token_accuracy": 0.8000140152871609, "num_tokens": 535802883.0, "step": 16788 }, { "entropy": 0.693029260262847, "epoch": 1.5446777189320362, "grad_norm": 0.16197864711284637, "learning_rate": 4.851412273438219e-05, "loss": 0.6736, "mean_token_accuracy": 0.7999381944537163, "num_tokens": 535834647.0, "step": 16789 }, { "entropy": 0.5495074018836021, "epoch": 1.5447697253034773, "grad_norm": 0.15485426783561707, "learning_rate": 4.8511055908240565e-05, "loss": 0.5345, "mean_token_accuracy": 0.8352390825748444, "num_tokens": 535866485.0, "step": 16790 }, { "entropy": 0.659773469902575, "epoch": 1.5448617316749185, "grad_norm": 0.15280675888061523, "learning_rate": 4.850798908209894e-05, "loss": 0.6511, "mean_token_accuracy": 0.8005794398486614, "num_tokens": 535898347.0, "step": 16791 }, { "entropy": 0.666874710470438, "epoch": 1.5449537380463596, "grad_norm": 0.16204412281513214, "learning_rate": 4.8504922255957314e-05, "loss": 0.6543, "mean_token_accuracy": 0.8058662749826908, "num_tokens": 535930422.0, "step": 16792 }, { "entropy": 0.5994910802692175, "epoch": 1.545045744417801, "grad_norm": 0.1627541333436966, "learning_rate": 4.850185542981568e-05, "loss": 0.5934, "mean_token_accuracy": 0.8161672838032246, "num_tokens": 535962154.0, "step": 16793 }, { "entropy": 0.6316513903439045, "epoch": 1.5451377507892423, "grad_norm": 0.15755629539489746, "learning_rate": 4.8498788603674064e-05, "loss": 0.6156, "mean_token_accuracy": 0.8101803883910179, "num_tokens": 535994098.0, "step": 16794 }, { "entropy": 0.6117746368981898, "epoch": 1.5452297571606834, "grad_norm": 0.15590347349643707, "learning_rate": 4.849572177753243e-05, "loss": 0.5967, "mean_token_accuracy": 0.8173241354525089, "num_tokens": 536026866.0, "step": 16795 }, { "entropy": 0.5135190784931183, "epoch": 1.5453217635321246, "grad_norm": 0.14487324655056, "learning_rate": 4.8492654951390806e-05, "loss": 0.4911, "mean_token_accuracy": 0.8499728664755821, "num_tokens": 536058972.0, "step": 16796 }, { "entropy": 0.6321863452903926, "epoch": 1.5454137699035657, "grad_norm": 0.15465782582759857, "learning_rate": 4.848958812524918e-05, "loss": 0.6236, "mean_token_accuracy": 0.8088383264839649, "num_tokens": 536090976.0, "step": 16797 }, { "entropy": 0.6003154087811708, "epoch": 1.545505776275007, "grad_norm": 0.15336744487285614, "learning_rate": 4.8486521299107556e-05, "loss": 0.59, "mean_token_accuracy": 0.8177503906190395, "num_tokens": 536123282.0, "step": 16798 }, { "entropy": 0.5297454334795475, "epoch": 1.5455977826464484, "grad_norm": 0.15395021438598633, "learning_rate": 4.848345447296593e-05, "loss": 0.5232, "mean_token_accuracy": 0.8381331861019135, "num_tokens": 536155230.0, "step": 16799 }, { "entropy": 0.5782006774097681, "epoch": 1.5456897890178896, "grad_norm": 0.149706169962883, "learning_rate": 4.8480387646824305e-05, "loss": 0.5745, "mean_token_accuracy": 0.8222797550261021, "num_tokens": 536187490.0, "step": 16800 }, { "entropy": 0.6139357052743435, "epoch": 1.5457817953893307, "grad_norm": 0.1474168449640274, "learning_rate": 4.847732082068267e-05, "loss": 0.6108, "mean_token_accuracy": 0.814196340739727, "num_tokens": 536220217.0, "step": 16801 }, { "entropy": 0.5689513124525547, "epoch": 1.5458738017607718, "grad_norm": 0.15521526336669922, "learning_rate": 4.8474253994541054e-05, "loss": 0.5597, "mean_token_accuracy": 0.8255514837801456, "num_tokens": 536251597.0, "step": 16802 }, { "entropy": 0.6071568606421351, "epoch": 1.5459658081322132, "grad_norm": 0.1487666666507721, "learning_rate": 4.847118716839942e-05, "loss": 0.5957, "mean_token_accuracy": 0.8193725198507309, "num_tokens": 536284108.0, "step": 16803 }, { "entropy": 0.6812950782477856, "epoch": 1.5460578145036545, "grad_norm": 0.16095878183841705, "learning_rate": 4.8468120342257803e-05, "loss": 0.6717, "mean_token_accuracy": 0.7978796251118183, "num_tokens": 536316187.0, "step": 16804 }, { "entropy": 0.6744360933080316, "epoch": 1.5461498208750957, "grad_norm": 0.15495403110980988, "learning_rate": 4.846505351611617e-05, "loss": 0.665, "mean_token_accuracy": 0.798248540610075, "num_tokens": 536348107.0, "step": 16805 }, { "entropy": 0.5662409961223602, "epoch": 1.5462418272465368, "grad_norm": 0.15348820388317108, "learning_rate": 4.8461986689974546e-05, "loss": 0.5613, "mean_token_accuracy": 0.8253890052437782, "num_tokens": 536380033.0, "step": 16806 }, { "entropy": 0.6291577517986298, "epoch": 1.546333833617978, "grad_norm": 0.1551407277584076, "learning_rate": 4.845891986383292e-05, "loss": 0.6182, "mean_token_accuracy": 0.8102274909615517, "num_tokens": 536412033.0, "step": 16807 }, { "entropy": 0.5692737996578217, "epoch": 1.5464258399894193, "grad_norm": 0.15206874907016754, "learning_rate": 4.8455853037691295e-05, "loss": 0.5462, "mean_token_accuracy": 0.8296345248818398, "num_tokens": 536443335.0, "step": 16808 }, { "entropy": 0.7248868513852358, "epoch": 1.5465178463608606, "grad_norm": 0.16511540114879608, "learning_rate": 4.845278621154967e-05, "loss": 0.7133, "mean_token_accuracy": 0.7804566472768784, "num_tokens": 536475569.0, "step": 16809 }, { "entropy": 0.7204847084358335, "epoch": 1.5466098527323018, "grad_norm": 0.16061857342720032, "learning_rate": 4.8449719385408045e-05, "loss": 0.7032, "mean_token_accuracy": 0.7890807837247849, "num_tokens": 536507365.0, "step": 16810 }, { "entropy": 0.5822309916839004, "epoch": 1.546701859103743, "grad_norm": 0.1537160724401474, "learning_rate": 4.844665255926642e-05, "loss": 0.582, "mean_token_accuracy": 0.8235328383743763, "num_tokens": 536540094.0, "step": 16811 }, { "entropy": 0.6538620665669441, "epoch": 1.546793865475184, "grad_norm": 0.16697680950164795, "learning_rate": 4.8443585733124794e-05, "loss": 0.6313, "mean_token_accuracy": 0.8034873567521572, "num_tokens": 536571702.0, "step": 16812 }, { "entropy": 0.6470622420310974, "epoch": 1.5468858718466254, "grad_norm": 0.1601923108100891, "learning_rate": 4.844051890698317e-05, "loss": 0.6465, "mean_token_accuracy": 0.802482184022665, "num_tokens": 536603933.0, "step": 16813 }, { "entropy": 0.6622630106285214, "epoch": 1.5469778782180668, "grad_norm": 0.15955324470996857, "learning_rate": 4.8437452080841536e-05, "loss": 0.6562, "mean_token_accuracy": 0.8015442490577698, "num_tokens": 536636219.0, "step": 16814 }, { "entropy": 0.6948969289660454, "epoch": 1.547069884589508, "grad_norm": 0.1548943668603897, "learning_rate": 4.843438525469992e-05, "loss": 0.6878, "mean_token_accuracy": 0.7912449762225151, "num_tokens": 536668356.0, "step": 16815 }, { "entropy": 0.5460700010880828, "epoch": 1.547161890960949, "grad_norm": 0.15257692337036133, "learning_rate": 4.8431318428558286e-05, "loss": 0.5351, "mean_token_accuracy": 0.8320209197700024, "num_tokens": 536700742.0, "step": 16816 }, { "entropy": 0.6482355492189527, "epoch": 1.5472538973323902, "grad_norm": 0.16417697072029114, "learning_rate": 4.842825160241666e-05, "loss": 0.6511, "mean_token_accuracy": 0.8034920580685139, "num_tokens": 536732967.0, "step": 16817 }, { "entropy": 0.5323441196233034, "epoch": 1.5473459037038315, "grad_norm": 0.14783106744289398, "learning_rate": 4.8425184776275035e-05, "loss": 0.522, "mean_token_accuracy": 0.8392868898808956, "num_tokens": 536765488.0, "step": 16818 }, { "entropy": 0.6858398457989097, "epoch": 1.5474379100752729, "grad_norm": 0.16312627494335175, "learning_rate": 4.842211795013341e-05, "loss": 0.6728, "mean_token_accuracy": 0.7969440594315529, "num_tokens": 536797202.0, "step": 16819 }, { "entropy": 0.5851907962933183, "epoch": 1.547529916446714, "grad_norm": 0.16368696093559265, "learning_rate": 4.8419051123991784e-05, "loss": 0.5695, "mean_token_accuracy": 0.8242566585540771, "num_tokens": 536829516.0, "step": 16820 }, { "entropy": 0.6237015817314386, "epoch": 1.5476219228181551, "grad_norm": 0.15786288678646088, "learning_rate": 4.841598429785016e-05, "loss": 0.6155, "mean_token_accuracy": 0.8143219761550426, "num_tokens": 536861593.0, "step": 16821 }, { "entropy": 0.5894962102174759, "epoch": 1.5477139291895963, "grad_norm": 0.14935220777988434, "learning_rate": 4.841291747170853e-05, "loss": 0.5708, "mean_token_accuracy": 0.8265173360705376, "num_tokens": 536893627.0, "step": 16822 }, { "entropy": 0.6574267810210586, "epoch": 1.5478059355610376, "grad_norm": 0.16323791444301605, "learning_rate": 4.840985064556691e-05, "loss": 0.6441, "mean_token_accuracy": 0.8042137064039707, "num_tokens": 536924841.0, "step": 16823 }, { "entropy": 0.6363742873072624, "epoch": 1.547897941932479, "grad_norm": 0.15786823630332947, "learning_rate": 4.8406783819425276e-05, "loss": 0.6304, "mean_token_accuracy": 0.8093893490731716, "num_tokens": 536957321.0, "step": 16824 }, { "entropy": 0.6214093843009323, "epoch": 1.5479899483039201, "grad_norm": 0.1562998741865158, "learning_rate": 4.840371699328366e-05, "loss": 0.6116, "mean_token_accuracy": 0.8112667798995972, "num_tokens": 536989657.0, "step": 16825 }, { "entropy": 0.659534128382802, "epoch": 1.5480819546753612, "grad_norm": 0.1533999741077423, "learning_rate": 4.8400650167142025e-05, "loss": 0.6451, "mean_token_accuracy": 0.802195530384779, "num_tokens": 537022123.0, "step": 16826 }, { "entropy": 0.6165014812722802, "epoch": 1.5481739610468024, "grad_norm": 0.1666567623615265, "learning_rate": 4.83975833410004e-05, "loss": 0.5996, "mean_token_accuracy": 0.8140166886150837, "num_tokens": 537053259.0, "step": 16827 }, { "entropy": 0.6214941572397947, "epoch": 1.5482659674182437, "grad_norm": 0.16542531549930573, "learning_rate": 4.8394516514858775e-05, "loss": 0.6334, "mean_token_accuracy": 0.8087045438587666, "num_tokens": 537085344.0, "step": 16828 }, { "entropy": 0.6386388307437301, "epoch": 1.548357973789685, "grad_norm": 0.15848198533058167, "learning_rate": 4.839144968871715e-05, "loss": 0.6428, "mean_token_accuracy": 0.8024182692170143, "num_tokens": 537117509.0, "step": 16829 }, { "entropy": 0.5661832606419921, "epoch": 1.5484499801611262, "grad_norm": 0.15416598320007324, "learning_rate": 4.8388382862575524e-05, "loss": 0.5739, "mean_token_accuracy": 0.8246203698217869, "num_tokens": 537150103.0, "step": 16830 }, { "entropy": 0.635637553408742, "epoch": 1.5485419865325674, "grad_norm": 0.153608039021492, "learning_rate": 4.83853160364339e-05, "loss": 0.6284, "mean_token_accuracy": 0.8115742914378643, "num_tokens": 537182081.0, "step": 16831 }, { "entropy": 0.5923128193244338, "epoch": 1.5486339929040085, "grad_norm": 0.1605375111103058, "learning_rate": 4.8382249210292266e-05, "loss": 0.581, "mean_token_accuracy": 0.8235440477728844, "num_tokens": 537213468.0, "step": 16832 }, { "entropy": 0.6715577617287636, "epoch": 1.5487259992754498, "grad_norm": 0.15939553081989288, "learning_rate": 4.837918238415065e-05, "loss": 0.667, "mean_token_accuracy": 0.7942696325480938, "num_tokens": 537245398.0, "step": 16833 }, { "entropy": 0.6362502556294203, "epoch": 1.5488180056468912, "grad_norm": 0.1630130410194397, "learning_rate": 4.8376115558009016e-05, "loss": 0.6323, "mean_token_accuracy": 0.8085350506007671, "num_tokens": 537276995.0, "step": 16834 }, { "entropy": 0.5130029688589275, "epoch": 1.5489100120183323, "grad_norm": 0.1423085629940033, "learning_rate": 4.837304873186739e-05, "loss": 0.4925, "mean_token_accuracy": 0.8467982448637486, "num_tokens": 537308996.0, "step": 16835 }, { "entropy": 0.6140719540417194, "epoch": 1.5490020183897735, "grad_norm": 0.1584002673625946, "learning_rate": 4.8369981905725765e-05, "loss": 0.6021, "mean_token_accuracy": 0.8156212493777275, "num_tokens": 537340943.0, "step": 16836 }, { "entropy": 0.5803517419844866, "epoch": 1.5490940247612146, "grad_norm": 0.1527986377477646, "learning_rate": 4.836691507958414e-05, "loss": 0.5634, "mean_token_accuracy": 0.8270045183598995, "num_tokens": 537373270.0, "step": 16837 }, { "entropy": 0.6494263876229525, "epoch": 1.549186031132656, "grad_norm": 0.17034024000167847, "learning_rate": 4.8363848253442514e-05, "loss": 0.6467, "mean_token_accuracy": 0.7990933582186699, "num_tokens": 537405178.0, "step": 16838 }, { "entropy": 0.6618201122619212, "epoch": 1.5492780375040973, "grad_norm": 0.1617821455001831, "learning_rate": 4.836078142730089e-05, "loss": 0.6438, "mean_token_accuracy": 0.8030790574848652, "num_tokens": 537436920.0, "step": 16839 }, { "entropy": 0.6023155692964792, "epoch": 1.5493700438755384, "grad_norm": 0.15267875790596008, "learning_rate": 4.8357714601159264e-05, "loss": 0.5925, "mean_token_accuracy": 0.8177425861358643, "num_tokens": 537469539.0, "step": 16840 }, { "entropy": 0.7327085975557566, "epoch": 1.5494620502469796, "grad_norm": 0.17069244384765625, "learning_rate": 4.835464777501764e-05, "loss": 0.7239, "mean_token_accuracy": 0.7773448936641216, "num_tokens": 537500817.0, "step": 16841 }, { "entropy": 0.55307746399194, "epoch": 1.5495540566184207, "grad_norm": 0.1471729725599289, "learning_rate": 4.835158094887601e-05, "loss": 0.5277, "mean_token_accuracy": 0.8329284563660622, "num_tokens": 537532831.0, "step": 16842 }, { "entropy": 0.6247746497392654, "epoch": 1.549646062989862, "grad_norm": 0.15509004890918732, "learning_rate": 4.834851412273438e-05, "loss": 0.609, "mean_token_accuracy": 0.8119172230362892, "num_tokens": 537564639.0, "step": 16843 }, { "entropy": 0.6811153255403042, "epoch": 1.5497380693613034, "grad_norm": 0.15862908959388733, "learning_rate": 4.834544729659276e-05, "loss": 0.6664, "mean_token_accuracy": 0.7922000773251057, "num_tokens": 537596478.0, "step": 16844 }, { "entropy": 0.68638267647475, "epoch": 1.5498300757327446, "grad_norm": 0.15888994932174683, "learning_rate": 4.834238047045113e-05, "loss": 0.6723, "mean_token_accuracy": 0.7937124781310558, "num_tokens": 537628731.0, "step": 16845 }, { "entropy": 0.5645057898946106, "epoch": 1.5499220821041857, "grad_norm": 0.16197660565376282, "learning_rate": 4.833931364430951e-05, "loss": 0.56, "mean_token_accuracy": 0.8227940462529659, "num_tokens": 537660244.0, "step": 16846 }, { "entropy": 0.6301847184076905, "epoch": 1.5500140884756268, "grad_norm": 0.15198445320129395, "learning_rate": 4.833624681816788e-05, "loss": 0.6138, "mean_token_accuracy": 0.8146571293473244, "num_tokens": 537692777.0, "step": 16847 }, { "entropy": 0.6606928333640099, "epoch": 1.5501060948470682, "grad_norm": 0.16163310408592224, "learning_rate": 4.8333179992026254e-05, "loss": 0.6539, "mean_token_accuracy": 0.8012738488614559, "num_tokens": 537725481.0, "step": 16848 }, { "entropy": 0.5277027487754822, "epoch": 1.5501981012185095, "grad_norm": 0.14655032753944397, "learning_rate": 4.833011316588463e-05, "loss": 0.5153, "mean_token_accuracy": 0.8391853906214237, "num_tokens": 537758249.0, "step": 16849 }, { "entropy": 0.5911285746842623, "epoch": 1.5502901075899507, "grad_norm": 0.15247659385204315, "learning_rate": 4.8327046339743e-05, "loss": 0.583, "mean_token_accuracy": 0.8206344582140446, "num_tokens": 537790756.0, "step": 16850 }, { "entropy": 0.5259783510118723, "epoch": 1.5503821139613918, "grad_norm": 0.15374867618083954, "learning_rate": 4.832397951360138e-05, "loss": 0.5057, "mean_token_accuracy": 0.8434191979467869, "num_tokens": 537823208.0, "step": 16851 }, { "entropy": 0.6595614496618509, "epoch": 1.550474120332833, "grad_norm": 0.15791191160678864, "learning_rate": 4.832091268745975e-05, "loss": 0.6583, "mean_token_accuracy": 0.8002524189651012, "num_tokens": 537855835.0, "step": 16852 }, { "entropy": 0.665057210251689, "epoch": 1.5505661267042743, "grad_norm": 0.15904657542705536, "learning_rate": 4.831784586131812e-05, "loss": 0.6529, "mean_token_accuracy": 0.8033314421772957, "num_tokens": 537888057.0, "step": 16853 }, { "entropy": 0.5799215100705624, "epoch": 1.5506581330757157, "grad_norm": 0.1494247168302536, "learning_rate": 4.83147790351765e-05, "loss": 0.5776, "mean_token_accuracy": 0.8224682733416557, "num_tokens": 537920275.0, "step": 16854 }, { "entropy": 0.6199096124619246, "epoch": 1.5507501394471568, "grad_norm": 0.15554822981357574, "learning_rate": 4.831171220903487e-05, "loss": 0.6052, "mean_token_accuracy": 0.8109720721840858, "num_tokens": 537952596.0, "step": 16855 }, { "entropy": 0.7496019285172224, "epoch": 1.550842145818598, "grad_norm": 0.16332003474235535, "learning_rate": 4.8308645382893244e-05, "loss": 0.7452, "mean_token_accuracy": 0.7720877192914486, "num_tokens": 537985107.0, "step": 16856 }, { "entropy": 0.6790919303894043, "epoch": 1.550934152190039, "grad_norm": 0.1698521226644516, "learning_rate": 4.830557855675162e-05, "loss": 0.6667, "mean_token_accuracy": 0.7941385358572006, "num_tokens": 538015761.0, "step": 16857 }, { "entropy": 0.5770970177836716, "epoch": 1.5510261585614804, "grad_norm": 0.15687572956085205, "learning_rate": 4.8302511730609994e-05, "loss": 0.5589, "mean_token_accuracy": 0.8297050558030605, "num_tokens": 538047574.0, "step": 16858 }, { "entropy": 0.6022099000401795, "epoch": 1.5511181649329218, "grad_norm": 0.15588989853858948, "learning_rate": 4.829944490446837e-05, "loss": 0.5929, "mean_token_accuracy": 0.8206201791763306, "num_tokens": 538080114.0, "step": 16859 }, { "entropy": 0.5093274209648371, "epoch": 1.551210171304363, "grad_norm": 0.14278340339660645, "learning_rate": 4.829637807832674e-05, "loss": 0.4888, "mean_token_accuracy": 0.8461382240056992, "num_tokens": 538112683.0, "step": 16860 }, { "entropy": 0.6227012183517218, "epoch": 1.551302177675804, "grad_norm": 0.15579666197299957, "learning_rate": 4.829331125218511e-05, "loss": 0.6079, "mean_token_accuracy": 0.8117585331201553, "num_tokens": 538144857.0, "step": 16861 }, { "entropy": 0.6680541117675602, "epoch": 1.5513941840472452, "grad_norm": 0.15733572840690613, "learning_rate": 4.829024442604349e-05, "loss": 0.6668, "mean_token_accuracy": 0.7947811782360077, "num_tokens": 538177519.0, "step": 16862 }, { "entropy": 0.5317955417558551, "epoch": 1.5514861904186865, "grad_norm": 0.14927519857883453, "learning_rate": 4.828717759990186e-05, "loss": 0.5198, "mean_token_accuracy": 0.8369297347962856, "num_tokens": 538209512.0, "step": 16863 }, { "entropy": 0.6333469729870558, "epoch": 1.5515781967901279, "grad_norm": 0.15648780763149261, "learning_rate": 4.828411077376024e-05, "loss": 0.6146, "mean_token_accuracy": 0.8129834085702896, "num_tokens": 538241564.0, "step": 16864 }, { "entropy": 0.5147939566522837, "epoch": 1.551670203161569, "grad_norm": 0.14319969713687897, "learning_rate": 4.828104394761861e-05, "loss": 0.4835, "mean_token_accuracy": 0.850363627076149, "num_tokens": 538273664.0, "step": 16865 }, { "entropy": 0.6922069825232029, "epoch": 1.5517622095330101, "grad_norm": 0.16067704558372498, "learning_rate": 4.8277977121476984e-05, "loss": 0.6786, "mean_token_accuracy": 0.7914809435606003, "num_tokens": 538304916.0, "step": 16866 }, { "entropy": 0.5656511094421148, "epoch": 1.5518542159044513, "grad_norm": 0.1516963094472885, "learning_rate": 4.827491029533536e-05, "loss": 0.5627, "mean_token_accuracy": 0.8297001719474792, "num_tokens": 538337460.0, "step": 16867 }, { "entropy": 0.49595236126333475, "epoch": 1.5519462222758926, "grad_norm": 0.14871612191200256, "learning_rate": 4.8271843469193733e-05, "loss": 0.4838, "mean_token_accuracy": 0.850448239594698, "num_tokens": 538369868.0, "step": 16868 }, { "entropy": 0.6157837454229593, "epoch": 1.552038228647334, "grad_norm": 0.161015123128891, "learning_rate": 4.826877664305211e-05, "loss": 0.5993, "mean_token_accuracy": 0.815193697810173, "num_tokens": 538401197.0, "step": 16869 }, { "entropy": 0.5946946078911424, "epoch": 1.5521302350187751, "grad_norm": 0.16067636013031006, "learning_rate": 4.826570981691048e-05, "loss": 0.585, "mean_token_accuracy": 0.816437978297472, "num_tokens": 538432851.0, "step": 16870 }, { "entropy": 0.5837146863341331, "epoch": 1.5522222413902163, "grad_norm": 0.1454564481973648, "learning_rate": 4.826264299076886e-05, "loss": 0.5764, "mean_token_accuracy": 0.8245887495577335, "num_tokens": 538464803.0, "step": 16871 }, { "entropy": 0.6548323947936296, "epoch": 1.5523142477616574, "grad_norm": 0.1658470183610916, "learning_rate": 4.825957616462723e-05, "loss": 0.6396, "mean_token_accuracy": 0.8048544749617577, "num_tokens": 538496892.0, "step": 16872 }, { "entropy": 0.587608315050602, "epoch": 1.5524062541330987, "grad_norm": 0.15833733975887299, "learning_rate": 4.825650933848561e-05, "loss": 0.5915, "mean_token_accuracy": 0.8162438347935677, "num_tokens": 538529172.0, "step": 16873 }, { "entropy": 0.6673035342246294, "epoch": 1.55249826050454, "grad_norm": 0.16323408484458923, "learning_rate": 4.8253442512343975e-05, "loss": 0.6496, "mean_token_accuracy": 0.8021915182471275, "num_tokens": 538560140.0, "step": 16874 }, { "entropy": 0.6460228161886334, "epoch": 1.5525902668759812, "grad_norm": 0.15921229124069214, "learning_rate": 4.8250375686202356e-05, "loss": 0.641, "mean_token_accuracy": 0.8079546578228474, "num_tokens": 538591286.0, "step": 16875 }, { "entropy": 0.6631326526403427, "epoch": 1.5526822732474224, "grad_norm": 0.17378142476081848, "learning_rate": 4.8247308860060724e-05, "loss": 0.6521, "mean_token_accuracy": 0.8020143769681454, "num_tokens": 538623570.0, "step": 16876 }, { "entropy": 0.5972441078629345, "epoch": 1.5527742796188635, "grad_norm": 0.15339308977127075, "learning_rate": 4.82442420339191e-05, "loss": 0.5803, "mean_token_accuracy": 0.8196616768836975, "num_tokens": 538655977.0, "step": 16877 }, { "entropy": 0.6572736166417599, "epoch": 1.5528662859903049, "grad_norm": 0.1566147357225418, "learning_rate": 4.824117520777747e-05, "loss": 0.6516, "mean_token_accuracy": 0.8005131185054779, "num_tokens": 538688383.0, "step": 16878 }, { "entropy": 0.5371394669637084, "epoch": 1.5529582923617462, "grad_norm": 0.15801699459552765, "learning_rate": 4.823810838163585e-05, "loss": 0.5199, "mean_token_accuracy": 0.8385567553341389, "num_tokens": 538720900.0, "step": 16879 }, { "entropy": 0.6157824853435159, "epoch": 1.5530502987331873, "grad_norm": 0.15522253513336182, "learning_rate": 4.823504155549422e-05, "loss": 0.6068, "mean_token_accuracy": 0.8157833889126778, "num_tokens": 538752786.0, "step": 16880 }, { "entropy": 0.5932908244431019, "epoch": 1.5531423051046285, "grad_norm": 0.14812801778316498, "learning_rate": 4.82319747293526e-05, "loss": 0.5836, "mean_token_accuracy": 0.818306241184473, "num_tokens": 538784599.0, "step": 16881 }, { "entropy": 0.5153076080605388, "epoch": 1.5532343114760696, "grad_norm": 0.14479859173297882, "learning_rate": 4.8228907903210965e-05, "loss": 0.5099, "mean_token_accuracy": 0.8421944230794907, "num_tokens": 538816082.0, "step": 16882 }, { "entropy": 0.6365571646019816, "epoch": 1.553326317847511, "grad_norm": 0.15688970685005188, "learning_rate": 4.8225841077069346e-05, "loss": 0.621, "mean_token_accuracy": 0.8081857189536095, "num_tokens": 538847870.0, "step": 16883 }, { "entropy": 0.6378952022641897, "epoch": 1.5534183242189523, "grad_norm": 0.1616443544626236, "learning_rate": 4.8222774250927714e-05, "loss": 0.6292, "mean_token_accuracy": 0.8052861802279949, "num_tokens": 538879474.0, "step": 16884 }, { "entropy": 0.6003139261156321, "epoch": 1.5535103305903935, "grad_norm": 0.15850259363651276, "learning_rate": 4.8219707424786096e-05, "loss": 0.5897, "mean_token_accuracy": 0.8155240938067436, "num_tokens": 538911094.0, "step": 16885 }, { "entropy": 0.6961224945262074, "epoch": 1.5536023369618346, "grad_norm": 0.1626812368631363, "learning_rate": 4.8216640598644464e-05, "loss": 0.683, "mean_token_accuracy": 0.7927363216876984, "num_tokens": 538942948.0, "step": 16886 }, { "entropy": 0.6794290794059634, "epoch": 1.5536943433332757, "grad_norm": 0.157316654920578, "learning_rate": 4.821357377250284e-05, "loss": 0.676, "mean_token_accuracy": 0.7909890450537205, "num_tokens": 538975459.0, "step": 16887 }, { "entropy": 0.6777465976774693, "epoch": 1.553786349704717, "grad_norm": 0.1606663167476654, "learning_rate": 4.821050694636121e-05, "loss": 0.6749, "mean_token_accuracy": 0.796750120818615, "num_tokens": 539007306.0, "step": 16888 }, { "entropy": 0.6841382198035717, "epoch": 1.5538783560761584, "grad_norm": 0.1585787683725357, "learning_rate": 4.820744012021959e-05, "loss": 0.6727, "mean_token_accuracy": 0.7939280122518539, "num_tokens": 539039435.0, "step": 16889 }, { "entropy": 0.6011803415603936, "epoch": 1.5539703624475996, "grad_norm": 0.15528878569602966, "learning_rate": 4.820437329407796e-05, "loss": 0.5933, "mean_token_accuracy": 0.8194537311792374, "num_tokens": 539071578.0, "step": 16890 }, { "entropy": 0.5937186991795897, "epoch": 1.5540623688190407, "grad_norm": 0.15199430286884308, "learning_rate": 4.820130646793634e-05, "loss": 0.5979, "mean_token_accuracy": 0.8156440556049347, "num_tokens": 539103965.0, "step": 16891 }, { "entropy": 0.6380165619775653, "epoch": 1.5541543751904818, "grad_norm": 0.1688891351222992, "learning_rate": 4.8198239641794705e-05, "loss": 0.6317, "mean_token_accuracy": 0.810836311429739, "num_tokens": 539134771.0, "step": 16892 }, { "entropy": 0.6020946158096194, "epoch": 1.5542463815619232, "grad_norm": 0.15554018318653107, "learning_rate": 4.8195172815653086e-05, "loss": 0.5899, "mean_token_accuracy": 0.8196677640080452, "num_tokens": 539166749.0, "step": 16893 }, { "entropy": 0.5701466351747513, "epoch": 1.5543383879333645, "grad_norm": 0.15199102461338043, "learning_rate": 4.8192105989511454e-05, "loss": 0.568, "mean_token_accuracy": 0.8284638747572899, "num_tokens": 539198020.0, "step": 16894 }, { "entropy": 0.5933902207762003, "epoch": 1.5544303943048057, "grad_norm": 0.15352103114128113, "learning_rate": 4.818903916336983e-05, "loss": 0.5723, "mean_token_accuracy": 0.8232559971511364, "num_tokens": 539229675.0, "step": 16895 }, { "entropy": 0.5734577081166208, "epoch": 1.5545224006762468, "grad_norm": 0.14768488705158234, "learning_rate": 4.81859723372282e-05, "loss": 0.54, "mean_token_accuracy": 0.8320793621242046, "num_tokens": 539260872.0, "step": 16896 }, { "entropy": 0.5772641450166702, "epoch": 1.554614407047688, "grad_norm": 0.1469101905822754, "learning_rate": 4.818290551108658e-05, "loss": 0.5654, "mean_token_accuracy": 0.8235838674008846, "num_tokens": 539293225.0, "step": 16897 }, { "entropy": 0.6103631462901831, "epoch": 1.5547064134191293, "grad_norm": 0.16125811636447906, "learning_rate": 4.817983868494495e-05, "loss": 0.5976, "mean_token_accuracy": 0.8157299757003784, "num_tokens": 539325559.0, "step": 16898 }, { "entropy": 0.5137110520154238, "epoch": 1.5547984197905707, "grad_norm": 0.1434779167175293, "learning_rate": 4.817677185880333e-05, "loss": 0.4985, "mean_token_accuracy": 0.8475112654268742, "num_tokens": 539357911.0, "step": 16899 }, { "entropy": 0.644060842692852, "epoch": 1.5548904261620118, "grad_norm": 0.16057027876377106, "learning_rate": 4.81737050326617e-05, "loss": 0.6401, "mean_token_accuracy": 0.8049417585134506, "num_tokens": 539389908.0, "step": 16900 }, { "entropy": 0.5917244292795658, "epoch": 1.554982432533453, "grad_norm": 0.16030116379261017, "learning_rate": 4.8170638206520076e-05, "loss": 0.5811, "mean_token_accuracy": 0.8206113837659359, "num_tokens": 539422147.0, "step": 16901 }, { "entropy": 0.5694777946919203, "epoch": 1.555074438904894, "grad_norm": 0.15259237587451935, "learning_rate": 4.816757138037845e-05, "loss": 0.5723, "mean_token_accuracy": 0.8224456310272217, "num_tokens": 539454351.0, "step": 16902 }, { "entropy": 0.5939163770526648, "epoch": 1.5551664452763354, "grad_norm": 0.15310390293598175, "learning_rate": 4.816450455423682e-05, "loss": 0.5864, "mean_token_accuracy": 0.823145117610693, "num_tokens": 539486955.0, "step": 16903 }, { "entropy": 0.6289293505251408, "epoch": 1.5552584516477768, "grad_norm": 0.16152192652225494, "learning_rate": 4.81614377280952e-05, "loss": 0.6264, "mean_token_accuracy": 0.8069568909704685, "num_tokens": 539519125.0, "step": 16904 }, { "entropy": 0.5800776481628418, "epoch": 1.555350458019218, "grad_norm": 0.14782051742076874, "learning_rate": 4.815837090195357e-05, "loss": 0.5698, "mean_token_accuracy": 0.822857242077589, "num_tokens": 539551802.0, "step": 16905 }, { "entropy": 0.6908879624679685, "epoch": 1.555442464390659, "grad_norm": 0.16188687086105347, "learning_rate": 4.815530407581195e-05, "loss": 0.672, "mean_token_accuracy": 0.792552325874567, "num_tokens": 539582597.0, "step": 16906 }, { "entropy": 0.5923152072355151, "epoch": 1.5555344707621002, "grad_norm": 0.15687160193920135, "learning_rate": 4.815223724967032e-05, "loss": 0.5854, "mean_token_accuracy": 0.8218693397939205, "num_tokens": 539614784.0, "step": 16907 }, { "entropy": 0.6976561695337296, "epoch": 1.5556264771335415, "grad_norm": 0.16640256345272064, "learning_rate": 4.814917042352869e-05, "loss": 0.685, "mean_token_accuracy": 0.7876560688018799, "num_tokens": 539644926.0, "step": 16908 }, { "entropy": 0.5172362178564072, "epoch": 1.5557184835049829, "grad_norm": 0.1484460085630417, "learning_rate": 4.814610359738707e-05, "loss": 0.5099, "mean_token_accuracy": 0.8421775661408901, "num_tokens": 539677694.0, "step": 16909 }, { "entropy": 0.5533578526228666, "epoch": 1.555810489876424, "grad_norm": 0.150816410779953, "learning_rate": 4.814303677124544e-05, "loss": 0.5394, "mean_token_accuracy": 0.8317542970180511, "num_tokens": 539710199.0, "step": 16910 }, { "entropy": 0.683261239901185, "epoch": 1.5559024962478651, "grad_norm": 0.16506719589233398, "learning_rate": 4.8139969945103816e-05, "loss": 0.6764, "mean_token_accuracy": 0.7966607995331287, "num_tokens": 539741791.0, "step": 16911 }, { "entropy": 0.5576768405735493, "epoch": 1.5559945026193063, "grad_norm": 0.15128439664840698, "learning_rate": 4.813690311896219e-05, "loss": 0.5404, "mean_token_accuracy": 0.8331075869500637, "num_tokens": 539773566.0, "step": 16912 }, { "entropy": 0.5435215379111469, "epoch": 1.5560865089907476, "grad_norm": 0.15370842814445496, "learning_rate": 4.813383629282056e-05, "loss": 0.5432, "mean_token_accuracy": 0.8378221988677979, "num_tokens": 539806003.0, "step": 16913 }, { "entropy": 0.6220966535620391, "epoch": 1.556178515362189, "grad_norm": 0.16302277147769928, "learning_rate": 4.813076946667894e-05, "loss": 0.6153, "mean_token_accuracy": 0.8109432868659496, "num_tokens": 539837685.0, "step": 16914 }, { "entropy": 0.6529379952698946, "epoch": 1.5562705217336301, "grad_norm": 0.15670105814933777, "learning_rate": 4.812770264053731e-05, "loss": 0.6545, "mean_token_accuracy": 0.7983526065945625, "num_tokens": 539870305.0, "step": 16915 }, { "entropy": 0.5159652750007808, "epoch": 1.5563625281050713, "grad_norm": 0.14363963901996613, "learning_rate": 4.812463581439568e-05, "loss": 0.4991, "mean_token_accuracy": 0.8464633896946907, "num_tokens": 539902675.0, "step": 16916 }, { "entropy": 0.5712733371183276, "epoch": 1.5564545344765124, "grad_norm": 0.16101042926311493, "learning_rate": 4.812156898825406e-05, "loss": 0.5671, "mean_token_accuracy": 0.8284684903919697, "num_tokens": 539935443.0, "step": 16917 }, { "entropy": 0.5768107771873474, "epoch": 1.5565465408479537, "grad_norm": 0.15416984260082245, "learning_rate": 4.811850216211243e-05, "loss": 0.5579, "mean_token_accuracy": 0.8293735012412071, "num_tokens": 539967719.0, "step": 16918 }, { "entropy": 0.4392927587032318, "epoch": 1.556638547219395, "grad_norm": 0.1417098194360733, "learning_rate": 4.8115435335970807e-05, "loss": 0.4215, "mean_token_accuracy": 0.8655703291296959, "num_tokens": 539999869.0, "step": 16919 }, { "entropy": 0.6477336958050728, "epoch": 1.5567305535908362, "grad_norm": 0.15602360665798187, "learning_rate": 4.811236850982918e-05, "loss": 0.6448, "mean_token_accuracy": 0.80296990275383, "num_tokens": 540032303.0, "step": 16920 }, { "entropy": 0.7245255894958973, "epoch": 1.5568225599622774, "grad_norm": 0.16118276119232178, "learning_rate": 4.810930168368755e-05, "loss": 0.7072, "mean_token_accuracy": 0.7828141115605831, "num_tokens": 540063862.0, "step": 16921 }, { "entropy": 0.5576057899743319, "epoch": 1.5569145663337185, "grad_norm": 0.15240895748138428, "learning_rate": 4.810623485754593e-05, "loss": 0.5525, "mean_token_accuracy": 0.8283314779400826, "num_tokens": 540095514.0, "step": 16922 }, { "entropy": 0.6399878868833184, "epoch": 1.5570065727051599, "grad_norm": 0.15514957904815674, "learning_rate": 4.81031680314043e-05, "loss": 0.6305, "mean_token_accuracy": 0.8065376318991184, "num_tokens": 540127205.0, "step": 16923 }, { "entropy": 0.6305287480354309, "epoch": 1.5570985790766012, "grad_norm": 0.16388455033302307, "learning_rate": 4.810010120526268e-05, "loss": 0.6237, "mean_token_accuracy": 0.8058769255876541, "num_tokens": 540158497.0, "step": 16924 }, { "entropy": 0.6161862015724182, "epoch": 1.5571905854480423, "grad_norm": 0.15283627808094025, "learning_rate": 4.809703437912105e-05, "loss": 0.608, "mean_token_accuracy": 0.81242411211133, "num_tokens": 540190900.0, "step": 16925 }, { "entropy": 0.5845544226467609, "epoch": 1.5572825918194835, "grad_norm": 0.14517754316329956, "learning_rate": 4.809396755297942e-05, "loss": 0.5676, "mean_token_accuracy": 0.821904432028532, "num_tokens": 540222854.0, "step": 16926 }, { "entropy": 0.7421532925218344, "epoch": 1.5573745981909246, "grad_norm": 0.16291582584381104, "learning_rate": 4.80909007268378e-05, "loss": 0.7342, "mean_token_accuracy": 0.7801032476127148, "num_tokens": 540254646.0, "step": 16927 }, { "entropy": 0.6176619837060571, "epoch": 1.557466604562366, "grad_norm": 0.15616144239902496, "learning_rate": 4.808783390069617e-05, "loss": 0.6099, "mean_token_accuracy": 0.8158208467066288, "num_tokens": 540286942.0, "step": 16928 }, { "entropy": 0.5366966966539621, "epoch": 1.5575586109338073, "grad_norm": 0.14572343230247498, "learning_rate": 4.8084767074554546e-05, "loss": 0.5255, "mean_token_accuracy": 0.8340786509215832, "num_tokens": 540319279.0, "step": 16929 }, { "entropy": 0.6315982006490231, "epoch": 1.5576506173052485, "grad_norm": 0.1543375551700592, "learning_rate": 4.808170024841292e-05, "loss": 0.6161, "mean_token_accuracy": 0.8091884180903435, "num_tokens": 540350992.0, "step": 16930 }, { "entropy": 0.5859789568930864, "epoch": 1.5577426236766896, "grad_norm": 0.15722833573818207, "learning_rate": 4.8078633422271296e-05, "loss": 0.5803, "mean_token_accuracy": 0.8213418498635292, "num_tokens": 540381803.0, "step": 16931 }, { "entropy": 0.5567561071366072, "epoch": 1.5578346300481307, "grad_norm": 0.14514385163784027, "learning_rate": 4.807556659612967e-05, "loss": 0.5426, "mean_token_accuracy": 0.8284836448729038, "num_tokens": 540413633.0, "step": 16932 }, { "entropy": 0.6554358433932066, "epoch": 1.557926636419572, "grad_norm": 0.15729032456874847, "learning_rate": 4.8072499769988045e-05, "loss": 0.6401, "mean_token_accuracy": 0.8068714514374733, "num_tokens": 540445098.0, "step": 16933 }, { "entropy": 0.6073678452521563, "epoch": 1.5580186427910134, "grad_norm": 0.1554742157459259, "learning_rate": 4.806943294384641e-05, "loss": 0.5904, "mean_token_accuracy": 0.8158774487674236, "num_tokens": 540476862.0, "step": 16934 }, { "entropy": 0.5435816338285804, "epoch": 1.5581106491624546, "grad_norm": 0.1504540592432022, "learning_rate": 4.8066366117704794e-05, "loss": 0.5219, "mean_token_accuracy": 0.8334810920059681, "num_tokens": 540508517.0, "step": 16935 }, { "entropy": 0.5715521760284901, "epoch": 1.5582026555338957, "grad_norm": 0.1476559042930603, "learning_rate": 4.806329929156316e-05, "loss": 0.5646, "mean_token_accuracy": 0.8313102200627327, "num_tokens": 540540311.0, "step": 16936 }, { "entropy": 0.5730502677615732, "epoch": 1.5582946619053368, "grad_norm": 0.15444420278072357, "learning_rate": 4.806023246542154e-05, "loss": 0.5604, "mean_token_accuracy": 0.8278621397912502, "num_tokens": 540571982.0, "step": 16937 }, { "entropy": 0.6735983975231647, "epoch": 1.5583866682767782, "grad_norm": 0.16258183121681213, "learning_rate": 4.805716563927991e-05, "loss": 0.6714, "mean_token_accuracy": 0.79395791888237, "num_tokens": 540603824.0, "step": 16938 }, { "entropy": 0.7214549779891968, "epoch": 1.5584786746482195, "grad_norm": 0.16686661541461945, "learning_rate": 4.8054098813138286e-05, "loss": 0.7238, "mean_token_accuracy": 0.7847379371523857, "num_tokens": 540635345.0, "step": 16939 }, { "entropy": 0.4968668036162853, "epoch": 1.5585706810196607, "grad_norm": 0.16049762070178986, "learning_rate": 4.805103198699666e-05, "loss": 0.4948, "mean_token_accuracy": 0.851196400821209, "num_tokens": 540667325.0, "step": 16940 }, { "entropy": 0.7226730631664395, "epoch": 1.5586626873911018, "grad_norm": 0.17221318185329437, "learning_rate": 4.8047965160855035e-05, "loss": 0.7072, "mean_token_accuracy": 0.7866709157824516, "num_tokens": 540698096.0, "step": 16941 }, { "entropy": 0.6244318764656782, "epoch": 1.558754693762543, "grad_norm": 0.15884089469909668, "learning_rate": 4.80448983347134e-05, "loss": 0.6028, "mean_token_accuracy": 0.8156474232673645, "num_tokens": 540729446.0, "step": 16942 }, { "entropy": 0.5782786216586828, "epoch": 1.5588467001339843, "grad_norm": 0.17593148350715637, "learning_rate": 4.8041831508571785e-05, "loss": 0.5928, "mean_token_accuracy": 0.8197923004627228, "num_tokens": 540761615.0, "step": 16943 }, { "entropy": 0.5410898909904063, "epoch": 1.5589387065054257, "grad_norm": 0.1517399400472641, "learning_rate": 4.803876468243015e-05, "loss": 0.5297, "mean_token_accuracy": 0.8363790065050125, "num_tokens": 540793137.0, "step": 16944 }, { "entropy": 0.7166554220020771, "epoch": 1.5590307128768668, "grad_norm": 0.16189883649349213, "learning_rate": 4.8035697856288534e-05, "loss": 0.6998, "mean_token_accuracy": 0.7879813574254513, "num_tokens": 540825389.0, "step": 16945 }, { "entropy": 0.6693460047245026, "epoch": 1.559122719248308, "grad_norm": 0.16171319782733917, "learning_rate": 4.80326310301469e-05, "loss": 0.647, "mean_token_accuracy": 0.80380579829216, "num_tokens": 540857045.0, "step": 16946 }, { "entropy": 0.5597273670136929, "epoch": 1.559214725619749, "grad_norm": 0.15388505160808563, "learning_rate": 4.8029564204005276e-05, "loss": 0.5402, "mean_token_accuracy": 0.8296188153326511, "num_tokens": 540888790.0, "step": 16947 }, { "entropy": 0.682404775172472, "epoch": 1.5593067319911904, "grad_norm": 0.1653805524110794, "learning_rate": 4.802649737786365e-05, "loss": 0.6542, "mean_token_accuracy": 0.8015361241996288, "num_tokens": 540920812.0, "step": 16948 }, { "entropy": 0.6760833505541086, "epoch": 1.5593987383626318, "grad_norm": 0.16029949486255646, "learning_rate": 4.8023430551722026e-05, "loss": 0.6642, "mean_token_accuracy": 0.796030081808567, "num_tokens": 540952572.0, "step": 16949 }, { "entropy": 0.6154549084603786, "epoch": 1.559490744734073, "grad_norm": 0.16042305529117584, "learning_rate": 4.80203637255804e-05, "loss": 0.6127, "mean_token_accuracy": 0.8149422891438007, "num_tokens": 540984236.0, "step": 16950 }, { "entropy": 0.48595955641940236, "epoch": 1.559582751105514, "grad_norm": 0.14668792486190796, "learning_rate": 4.8017296899438775e-05, "loss": 0.4736, "mean_token_accuracy": 0.8543429225683212, "num_tokens": 541016939.0, "step": 16951 }, { "entropy": 0.6991585027426481, "epoch": 1.5596747574769552, "grad_norm": 0.165376216173172, "learning_rate": 4.801423007329714e-05, "loss": 0.6814, "mean_token_accuracy": 0.790705855935812, "num_tokens": 541047993.0, "step": 16952 }, { "entropy": 0.549565676599741, "epoch": 1.5597667638483965, "grad_norm": 0.1449407935142517, "learning_rate": 4.8011163247155524e-05, "loss": 0.5337, "mean_token_accuracy": 0.837771050632, "num_tokens": 541080253.0, "step": 16953 }, { "entropy": 0.6389753497205675, "epoch": 1.5598587702198379, "grad_norm": 0.15576206147670746, "learning_rate": 4.800809642101389e-05, "loss": 0.6325, "mean_token_accuracy": 0.8051219433546066, "num_tokens": 541112498.0, "step": 16954 }, { "entropy": 0.6639365516602993, "epoch": 1.559950776591279, "grad_norm": 0.1622207760810852, "learning_rate": 4.800502959487227e-05, "loss": 0.6612, "mean_token_accuracy": 0.8035777173936367, "num_tokens": 541144493.0, "step": 16955 }, { "entropy": 0.6297060237266123, "epoch": 1.5600427829627201, "grad_norm": 0.1541309505701065, "learning_rate": 4.800196276873064e-05, "loss": 0.6077, "mean_token_accuracy": 0.8136062957346439, "num_tokens": 541175191.0, "step": 16956 }, { "entropy": 0.5609583184123039, "epoch": 1.5601347893341613, "grad_norm": 0.14880666136741638, "learning_rate": 4.7998895942589016e-05, "loss": 0.5526, "mean_token_accuracy": 0.8302407339215279, "num_tokens": 541207703.0, "step": 16957 }, { "entropy": 0.581012349575758, "epoch": 1.5602267957056026, "grad_norm": 0.15402856469154358, "learning_rate": 4.799582911644739e-05, "loss": 0.5657, "mean_token_accuracy": 0.8239794261753559, "num_tokens": 541239840.0, "step": 16958 }, { "entropy": 0.5565020591020584, "epoch": 1.560318802077044, "grad_norm": 0.15275241434574127, "learning_rate": 4.7992762290305765e-05, "loss": 0.5516, "mean_token_accuracy": 0.8284539058804512, "num_tokens": 541272221.0, "step": 16959 }, { "entropy": 0.5828147940337658, "epoch": 1.5604108084484851, "grad_norm": 0.15590135753154755, "learning_rate": 4.798969546416413e-05, "loss": 0.5837, "mean_token_accuracy": 0.8209983073174953, "num_tokens": 541304229.0, "step": 16960 }, { "entropy": 0.7314867321401834, "epoch": 1.5605028148199263, "grad_norm": 0.16686542332172394, "learning_rate": 4.7986628638022515e-05, "loss": 0.7215, "mean_token_accuracy": 0.7835241705179214, "num_tokens": 541336119.0, "step": 16961 }, { "entropy": 0.6683014901354909, "epoch": 1.5605948211913674, "grad_norm": 0.1696888655424118, "learning_rate": 4.798356181188089e-05, "loss": 0.6713, "mean_token_accuracy": 0.796862430870533, "num_tokens": 541367947.0, "step": 16962 }, { "entropy": 0.6943355482071638, "epoch": 1.5606868275628087, "grad_norm": 0.15739108622074127, "learning_rate": 4.798049498573926e-05, "loss": 0.6763, "mean_token_accuracy": 0.7984101176261902, "num_tokens": 541399927.0, "step": 16963 }, { "entropy": 0.622891865670681, "epoch": 1.56077883393425, "grad_norm": 0.15337619185447693, "learning_rate": 4.797742815959764e-05, "loss": 0.6063, "mean_token_accuracy": 0.8108342550694942, "num_tokens": 541431831.0, "step": 16964 }, { "entropy": 0.550036771222949, "epoch": 1.5608708403056912, "grad_norm": 0.15335556864738464, "learning_rate": 4.7974361333456006e-05, "loss": 0.5464, "mean_token_accuracy": 0.8326299637556076, "num_tokens": 541463714.0, "step": 16965 }, { "entropy": 0.5102520538493991, "epoch": 1.5609628466771324, "grad_norm": 0.15397238731384277, "learning_rate": 4.797129450731439e-05, "loss": 0.5065, "mean_token_accuracy": 0.8441371731460094, "num_tokens": 541495110.0, "step": 16966 }, { "entropy": 0.5877146958373487, "epoch": 1.5610548530485735, "grad_norm": 0.14610733091831207, "learning_rate": 4.7968227681172756e-05, "loss": 0.5715, "mean_token_accuracy": 0.8237082660198212, "num_tokens": 541526802.0, "step": 16967 }, { "entropy": 0.600098142400384, "epoch": 1.5611468594200149, "grad_norm": 0.15208053588867188, "learning_rate": 4.796516085503113e-05, "loss": 0.5734, "mean_token_accuracy": 0.8191959485411644, "num_tokens": 541558742.0, "step": 16968 }, { "entropy": 0.7320534968748689, "epoch": 1.5612388657914562, "grad_norm": 0.1617090106010437, "learning_rate": 4.7962094028889505e-05, "loss": 0.7264, "mean_token_accuracy": 0.7787245362997055, "num_tokens": 541590898.0, "step": 16969 }, { "entropy": 0.46664432249963284, "epoch": 1.5613308721628973, "grad_norm": 0.13871192932128906, "learning_rate": 4.795902720274788e-05, "loss": 0.4584, "mean_token_accuracy": 0.8588743694126606, "num_tokens": 541623445.0, "step": 16970 }, { "entropy": 0.6012039298657328, "epoch": 1.5614228785343385, "grad_norm": 0.15433016419410706, "learning_rate": 4.7955960376606254e-05, "loss": 0.5934, "mean_token_accuracy": 0.8173097483813763, "num_tokens": 541655486.0, "step": 16971 }, { "entropy": 0.6338136065751314, "epoch": 1.5615148849057796, "grad_norm": 0.16309301555156708, "learning_rate": 4.795289355046463e-05, "loss": 0.6166, "mean_token_accuracy": 0.810226958245039, "num_tokens": 541686984.0, "step": 16972 }, { "entropy": 0.6225014161318541, "epoch": 1.561606891277221, "grad_norm": 0.16101492941379547, "learning_rate": 4.7949826724323e-05, "loss": 0.6186, "mean_token_accuracy": 0.8130158558487892, "num_tokens": 541718875.0, "step": 16973 }, { "entropy": 0.6279719267040491, "epoch": 1.5616988976486623, "grad_norm": 0.1593695729970932, "learning_rate": 4.794675989818138e-05, "loss": 0.62, "mean_token_accuracy": 0.8084156364202499, "num_tokens": 541750349.0, "step": 16974 }, { "entropy": 0.6658581420779228, "epoch": 1.5617909040201035, "grad_norm": 0.15521983802318573, "learning_rate": 4.7943693072039746e-05, "loss": 0.6523, "mean_token_accuracy": 0.7981556877493858, "num_tokens": 541782328.0, "step": 16975 }, { "entropy": 0.6502876970916986, "epoch": 1.5618829103915446, "grad_norm": 0.15751022100448608, "learning_rate": 4.794062624589812e-05, "loss": 0.6473, "mean_token_accuracy": 0.8018810115754604, "num_tokens": 541813172.0, "step": 16976 }, { "entropy": 0.5806296057999134, "epoch": 1.5619749167629857, "grad_norm": 0.15908274054527283, "learning_rate": 4.7937559419756495e-05, "loss": 0.5676, "mean_token_accuracy": 0.8263547606766224, "num_tokens": 541844985.0, "step": 16977 }, { "entropy": 0.6598385199904442, "epoch": 1.562066923134427, "grad_norm": 0.1556321382522583, "learning_rate": 4.793449259361487e-05, "loss": 0.6533, "mean_token_accuracy": 0.799910344183445, "num_tokens": 541876798.0, "step": 16978 }, { "entropy": 0.645426869392395, "epoch": 1.5621589295058684, "grad_norm": 0.15634100139141083, "learning_rate": 4.7931425767473245e-05, "loss": 0.6199, "mean_token_accuracy": 0.8099141977727413, "num_tokens": 541908612.0, "step": 16979 }, { "entropy": 0.6404429078102112, "epoch": 1.5622509358773096, "grad_norm": 0.15531601011753082, "learning_rate": 4.792835894133162e-05, "loss": 0.615, "mean_token_accuracy": 0.8133598528802395, "num_tokens": 541940552.0, "step": 16980 }, { "entropy": 0.6277308650314808, "epoch": 1.5623429422487507, "grad_norm": 0.1581084281206131, "learning_rate": 4.792529211518999e-05, "loss": 0.6152, "mean_token_accuracy": 0.815336748957634, "num_tokens": 541973272.0, "step": 16981 }, { "entropy": 0.722930601797998, "epoch": 1.5624349486201918, "grad_norm": 0.16661110520362854, "learning_rate": 4.792222528904837e-05, "loss": 0.7184, "mean_token_accuracy": 0.7831715829670429, "num_tokens": 542005637.0, "step": 16982 }, { "entropy": 0.5350319519639015, "epoch": 1.5625269549916332, "grad_norm": 0.1550159454345703, "learning_rate": 4.7919158462906737e-05, "loss": 0.5207, "mean_token_accuracy": 0.8383871912956238, "num_tokens": 542038069.0, "step": 16983 }, { "entropy": 0.6964630875736475, "epoch": 1.5626189613630745, "grad_norm": 0.1629531979560852, "learning_rate": 4.791609163676512e-05, "loss": 0.7077, "mean_token_accuracy": 0.7824721969664097, "num_tokens": 542070455.0, "step": 16984 }, { "entropy": 0.626460294239223, "epoch": 1.5627109677345157, "grad_norm": 0.1540650874376297, "learning_rate": 4.7913024810623486e-05, "loss": 0.6172, "mean_token_accuracy": 0.8114516846835613, "num_tokens": 542102522.0, "step": 16985 }, { "entropy": 0.5070397555828094, "epoch": 1.5628029741059568, "grad_norm": 0.14546893537044525, "learning_rate": 4.790995798448186e-05, "loss": 0.5064, "mean_token_accuracy": 0.8461498618125916, "num_tokens": 542134836.0, "step": 16986 }, { "entropy": 0.6814198354259133, "epoch": 1.562894980477398, "grad_norm": 0.16291625797748566, "learning_rate": 4.7906891158340235e-05, "loss": 0.6965, "mean_token_accuracy": 0.7919612899422646, "num_tokens": 542166939.0, "step": 16987 }, { "entropy": 0.6150445519015193, "epoch": 1.5629869868488393, "grad_norm": 0.1602942794561386, "learning_rate": 4.790382433219861e-05, "loss": 0.5989, "mean_token_accuracy": 0.8199897482991219, "num_tokens": 542198415.0, "step": 16988 }, { "entropy": 0.49378224182873964, "epoch": 1.5630789932202807, "grad_norm": 0.14925973117351532, "learning_rate": 4.7900757506056984e-05, "loss": 0.4873, "mean_token_accuracy": 0.8471593856811523, "num_tokens": 542230706.0, "step": 16989 }, { "entropy": 0.5920986942946911, "epoch": 1.5631709995917218, "grad_norm": 0.1583532691001892, "learning_rate": 4.789769067991536e-05, "loss": 0.592, "mean_token_accuracy": 0.8177226409316063, "num_tokens": 542263162.0, "step": 16990 }, { "entropy": 0.5624576006084681, "epoch": 1.563263005963163, "grad_norm": 0.14883510768413544, "learning_rate": 4.7894623853773734e-05, "loss": 0.5604, "mean_token_accuracy": 0.8251732774078846, "num_tokens": 542295633.0, "step": 16991 }, { "entropy": 0.5157265020534396, "epoch": 1.563355012334604, "grad_norm": 0.14795391261577606, "learning_rate": 4.789155702763211e-05, "loss": 0.4991, "mean_token_accuracy": 0.8474596925079823, "num_tokens": 542328401.0, "step": 16992 }, { "entropy": 0.6274944320321083, "epoch": 1.5634470187060454, "grad_norm": 0.15427552163600922, "learning_rate": 4.788849020149048e-05, "loss": 0.616, "mean_token_accuracy": 0.8102590516209602, "num_tokens": 542360076.0, "step": 16993 }, { "entropy": 0.6042216308414936, "epoch": 1.5635390250774868, "grad_norm": 0.15263696014881134, "learning_rate": 4.788542337534885e-05, "loss": 0.5962, "mean_token_accuracy": 0.8141313940286636, "num_tokens": 542392423.0, "step": 16994 }, { "entropy": 0.6706614550203085, "epoch": 1.563631031448928, "grad_norm": 0.1623212695121765, "learning_rate": 4.788235654920723e-05, "loss": 0.6468, "mean_token_accuracy": 0.8013029098510742, "num_tokens": 542424035.0, "step": 16995 }, { "entropy": 0.7031190879642963, "epoch": 1.563723037820369, "grad_norm": 0.1602984517812729, "learning_rate": 4.78792897230656e-05, "loss": 0.6755, "mean_token_accuracy": 0.7916977405548096, "num_tokens": 542455622.0, "step": 16996 }, { "entropy": 0.5951339267194271, "epoch": 1.5638150441918102, "grad_norm": 0.15071704983711243, "learning_rate": 4.7876222896923975e-05, "loss": 0.5722, "mean_token_accuracy": 0.8223372027277946, "num_tokens": 542487412.0, "step": 16997 }, { "entropy": 0.6249010134488344, "epoch": 1.5639070505632515, "grad_norm": 0.15618260204792023, "learning_rate": 4.787315607078235e-05, "loss": 0.5942, "mean_token_accuracy": 0.8157787248492241, "num_tokens": 542517946.0, "step": 16998 }, { "entropy": 0.6377061195671558, "epoch": 1.5639990569346929, "grad_norm": 0.16675986349582672, "learning_rate": 4.7870089244640724e-05, "loss": 0.6199, "mean_token_accuracy": 0.8117336519062519, "num_tokens": 542549834.0, "step": 16999 }, { "entropy": 0.669497162103653, "epoch": 1.564091063306134, "grad_norm": 0.15944138169288635, "learning_rate": 4.78670224184991e-05, "loss": 0.664, "mean_token_accuracy": 0.8002081029117107, "num_tokens": 542581929.0, "step": 17000 }, { "entropy": 0.7193190269172192, "epoch": 1.5641830696775751, "grad_norm": 0.16822193562984467, "learning_rate": 4.7863955592357473e-05, "loss": 0.7204, "mean_token_accuracy": 0.7852589078247547, "num_tokens": 542613174.0, "step": 17001 }, { "entropy": 0.5954258413985372, "epoch": 1.5642750760490163, "grad_norm": 0.15022358298301697, "learning_rate": 4.786088876621584e-05, "loss": 0.5701, "mean_token_accuracy": 0.8250363506376743, "num_tokens": 542644764.0, "step": 17002 }, { "entropy": 0.6625263411551714, "epoch": 1.5643670824204576, "grad_norm": 0.15676648914813995, "learning_rate": 4.785782194007422e-05, "loss": 0.6624, "mean_token_accuracy": 0.7957218959927559, "num_tokens": 542677247.0, "step": 17003 }, { "entropy": 0.4962779739871621, "epoch": 1.564459088791899, "grad_norm": 0.15532571077346802, "learning_rate": 4.785475511393259e-05, "loss": 0.4927, "mean_token_accuracy": 0.8456964194774628, "num_tokens": 542709766.0, "step": 17004 }, { "entropy": 0.4775468045845628, "epoch": 1.5645510951633401, "grad_norm": 0.149307519197464, "learning_rate": 4.785168828779097e-05, "loss": 0.4594, "mean_token_accuracy": 0.8530677258968353, "num_tokens": 542741549.0, "step": 17005 }, { "entropy": 0.5978935975581408, "epoch": 1.5646431015347813, "grad_norm": 0.15256242454051971, "learning_rate": 4.784862146164934e-05, "loss": 0.588, "mean_token_accuracy": 0.824051670730114, "num_tokens": 542773653.0, "step": 17006 }, { "entropy": 0.6075341114774346, "epoch": 1.5647351079062224, "grad_norm": 0.1495390385389328, "learning_rate": 4.7845554635507715e-05, "loss": 0.5945, "mean_token_accuracy": 0.8193510808050632, "num_tokens": 542805722.0, "step": 17007 }, { "entropy": 0.6746673453599215, "epoch": 1.5648271142776637, "grad_norm": 0.15582381188869476, "learning_rate": 4.784248780936609e-05, "loss": 0.6758, "mean_token_accuracy": 0.7934990860521793, "num_tokens": 542837797.0, "step": 17008 }, { "entropy": 0.6504545770585537, "epoch": 1.564919120649105, "grad_norm": 0.15548722445964813, "learning_rate": 4.7839420983224464e-05, "loss": 0.6247, "mean_token_accuracy": 0.8078318573534489, "num_tokens": 542869909.0, "step": 17009 }, { "entropy": 0.5836726240813732, "epoch": 1.5650111270205462, "grad_norm": 0.15209412574768066, "learning_rate": 4.783635415708284e-05, "loss": 0.5599, "mean_token_accuracy": 0.8283923529088497, "num_tokens": 542902184.0, "step": 17010 }, { "entropy": 0.5809586234390736, "epoch": 1.5651031333919874, "grad_norm": 0.15975305438041687, "learning_rate": 4.783328733094121e-05, "loss": 0.5611, "mean_token_accuracy": 0.8297773376107216, "num_tokens": 542934481.0, "step": 17011 }, { "entropy": 0.565169139765203, "epoch": 1.5651951397634285, "grad_norm": 0.16575868427753448, "learning_rate": 4.783022050479958e-05, "loss": 0.5607, "mean_token_accuracy": 0.8298337869346142, "num_tokens": 542966291.0, "step": 17012 }, { "entropy": 0.721586199477315, "epoch": 1.5652871461348699, "grad_norm": 0.16532060503959656, "learning_rate": 4.782715367865796e-05, "loss": 0.7069, "mean_token_accuracy": 0.7878416888415813, "num_tokens": 542998498.0, "step": 17013 }, { "entropy": 0.6262413393706083, "epoch": 1.5653791525063112, "grad_norm": 0.16247566044330597, "learning_rate": 4.782408685251633e-05, "loss": 0.6206, "mean_token_accuracy": 0.8095951750874519, "num_tokens": 543030850.0, "step": 17014 }, { "entropy": 0.5607587872073054, "epoch": 1.5654711588777523, "grad_norm": 0.14717522263526917, "learning_rate": 4.7821020026374705e-05, "loss": 0.5579, "mean_token_accuracy": 0.829169575124979, "num_tokens": 543063581.0, "step": 17015 }, { "entropy": 0.5890572592616081, "epoch": 1.5655631652491935, "grad_norm": 0.1534767895936966, "learning_rate": 4.781795320023308e-05, "loss": 0.5828, "mean_token_accuracy": 0.8198216035962105, "num_tokens": 543096291.0, "step": 17016 }, { "entropy": 0.5412318669259548, "epoch": 1.5656551716206346, "grad_norm": 0.15437878668308258, "learning_rate": 4.7814886374091454e-05, "loss": 0.5277, "mean_token_accuracy": 0.8371837064623833, "num_tokens": 543128418.0, "step": 17017 }, { "entropy": 0.5960258580744267, "epoch": 1.565747177992076, "grad_norm": 0.1529259979724884, "learning_rate": 4.781181954794983e-05, "loss": 0.6015, "mean_token_accuracy": 0.8181772157549858, "num_tokens": 543160835.0, "step": 17018 }, { "entropy": 0.6553479442372918, "epoch": 1.5658391843635173, "grad_norm": 0.16070431470870972, "learning_rate": 4.7808752721808204e-05, "loss": 0.6498, "mean_token_accuracy": 0.8022882863879204, "num_tokens": 543193219.0, "step": 17019 }, { "entropy": 0.7654071999713778, "epoch": 1.5659311907349585, "grad_norm": 0.16260379552841187, "learning_rate": 4.780568589566657e-05, "loss": 0.7515, "mean_token_accuracy": 0.7736910432577133, "num_tokens": 543225259.0, "step": 17020 }, { "entropy": 0.5304662957787514, "epoch": 1.5660231971063996, "grad_norm": 0.14731715619564056, "learning_rate": 4.780261906952495e-05, "loss": 0.5155, "mean_token_accuracy": 0.8404916189610958, "num_tokens": 543257250.0, "step": 17021 }, { "entropy": 0.6008216990157962, "epoch": 1.5661152034778407, "grad_norm": 0.16076481342315674, "learning_rate": 4.779955224338333e-05, "loss": 0.5774, "mean_token_accuracy": 0.8227437175810337, "num_tokens": 543288771.0, "step": 17022 }, { "entropy": 0.579690427519381, "epoch": 1.566207209849282, "grad_norm": 0.15964359045028687, "learning_rate": 4.7796485417241695e-05, "loss": 0.555, "mean_token_accuracy": 0.8272137753665447, "num_tokens": 543320094.0, "step": 17023 }, { "entropy": 0.6087274262681603, "epoch": 1.5662992162207234, "grad_norm": 0.1530449390411377, "learning_rate": 4.779341859110008e-05, "loss": 0.6051, "mean_token_accuracy": 0.8156892918050289, "num_tokens": 543352088.0, "step": 17024 }, { "entropy": 0.5386966029182076, "epoch": 1.5663912225921646, "grad_norm": 0.1542174518108368, "learning_rate": 4.7790351764958445e-05, "loss": 0.5323, "mean_token_accuracy": 0.8345778658986092, "num_tokens": 543383756.0, "step": 17025 }, { "entropy": 0.6097683720290661, "epoch": 1.5664832289636057, "grad_norm": 0.15140946209430695, "learning_rate": 4.7787284938816826e-05, "loss": 0.5859, "mean_token_accuracy": 0.8168801888823509, "num_tokens": 543415221.0, "step": 17026 }, { "entropy": 0.5895569622516632, "epoch": 1.5665752353350468, "grad_norm": 0.15191328525543213, "learning_rate": 4.7784218112675194e-05, "loss": 0.5868, "mean_token_accuracy": 0.8209693133831024, "num_tokens": 543446578.0, "step": 17027 }, { "entropy": 0.6817703377455473, "epoch": 1.5666672417064882, "grad_norm": 0.1670692265033722, "learning_rate": 4.778115128653357e-05, "loss": 0.6705, "mean_token_accuracy": 0.7963819541037083, "num_tokens": 543478263.0, "step": 17028 }, { "entropy": 0.6455013900995255, "epoch": 1.5667592480779295, "grad_norm": 0.16559046506881714, "learning_rate": 4.777808446039194e-05, "loss": 0.6439, "mean_token_accuracy": 0.8077379800379276, "num_tokens": 543509967.0, "step": 17029 }, { "entropy": 0.5873005664907396, "epoch": 1.5668512544493707, "grad_norm": 0.15703757107257843, "learning_rate": 4.777501763425032e-05, "loss": 0.5782, "mean_token_accuracy": 0.824066124856472, "num_tokens": 543541313.0, "step": 17030 }, { "entropy": 0.5912674013525248, "epoch": 1.5669432608208118, "grad_norm": 0.15697601437568665, "learning_rate": 4.777195080810869e-05, "loss": 0.5824, "mean_token_accuracy": 0.823423232883215, "num_tokens": 543571505.0, "step": 17031 }, { "entropy": 0.6619510781019926, "epoch": 1.567035267192253, "grad_norm": 0.1507483869791031, "learning_rate": 4.776888398196707e-05, "loss": 0.6448, "mean_token_accuracy": 0.7990536987781525, "num_tokens": 543603515.0, "step": 17032 }, { "entropy": 0.5472749136388302, "epoch": 1.5671272735636943, "grad_norm": 0.15933842957019806, "learning_rate": 4.7765817155825435e-05, "loss": 0.5392, "mean_token_accuracy": 0.8355779238045216, "num_tokens": 543635291.0, "step": 17033 }, { "entropy": 0.6578534878790379, "epoch": 1.5672192799351357, "grad_norm": 0.15744724869728088, "learning_rate": 4.7762750329683817e-05, "loss": 0.6281, "mean_token_accuracy": 0.8057134374976158, "num_tokens": 543666639.0, "step": 17034 }, { "entropy": 0.6124729868024588, "epoch": 1.5673112863065768, "grad_norm": 0.1520490199327469, "learning_rate": 4.7759683503542184e-05, "loss": 0.5979, "mean_token_accuracy": 0.8174434676766396, "num_tokens": 543698569.0, "step": 17035 }, { "entropy": 0.5887286551296711, "epoch": 1.567403292678018, "grad_norm": 0.15287558734416962, "learning_rate": 4.775661667740056e-05, "loss": 0.578, "mean_token_accuracy": 0.8253246806561947, "num_tokens": 543730814.0, "step": 17036 }, { "entropy": 0.5987151293084025, "epoch": 1.567495299049459, "grad_norm": 0.15486162900924683, "learning_rate": 4.7753549851258934e-05, "loss": 0.5865, "mean_token_accuracy": 0.8198989927768707, "num_tokens": 543762546.0, "step": 17037 }, { "entropy": 0.6265807589516044, "epoch": 1.5675873054209004, "grad_norm": 0.15311671793460846, "learning_rate": 4.775048302511731e-05, "loss": 0.6202, "mean_token_accuracy": 0.8075467981398106, "num_tokens": 543794739.0, "step": 17038 }, { "entropy": 0.5972684435546398, "epoch": 1.5676793117923418, "grad_norm": 0.1524234414100647, "learning_rate": 4.774741619897568e-05, "loss": 0.6032, "mean_token_accuracy": 0.8178052417933941, "num_tokens": 543826964.0, "step": 17039 }, { "entropy": 0.49733811570331454, "epoch": 1.567771318163783, "grad_norm": 0.1434365063905716, "learning_rate": 4.774434937283406e-05, "loss": 0.467, "mean_token_accuracy": 0.8545226939022541, "num_tokens": 543858984.0, "step": 17040 }, { "entropy": 0.6069827349856496, "epoch": 1.567863324535224, "grad_norm": 0.15335485339164734, "learning_rate": 4.7741282546692425e-05, "loss": 0.599, "mean_token_accuracy": 0.8172951489686966, "num_tokens": 543891326.0, "step": 17041 }, { "entropy": 0.6304009594023228, "epoch": 1.5679553309066652, "grad_norm": 0.16362281143665314, "learning_rate": 4.773821572055081e-05, "loss": 0.6222, "mean_token_accuracy": 0.8100421391427517, "num_tokens": 543922734.0, "step": 17042 }, { "entropy": 0.5180795225314796, "epoch": 1.5680473372781065, "grad_norm": 0.1540052592754364, "learning_rate": 4.7735148894409175e-05, "loss": 0.4954, "mean_token_accuracy": 0.8464696519076824, "num_tokens": 543954413.0, "step": 17043 }, { "entropy": 0.6636233131866902, "epoch": 1.5681393436495479, "grad_norm": 0.1615520715713501, "learning_rate": 4.7732082068267556e-05, "loss": 0.6566, "mean_token_accuracy": 0.7985086143016815, "num_tokens": 543986453.0, "step": 17044 }, { "entropy": 0.6630700193345547, "epoch": 1.568231350020989, "grad_norm": 0.15877342224121094, "learning_rate": 4.7729015242125924e-05, "loss": 0.6543, "mean_token_accuracy": 0.8032457008957863, "num_tokens": 544018044.0, "step": 17045 }, { "entropy": 0.5882303724065423, "epoch": 1.5683233563924301, "grad_norm": 0.16157369315624237, "learning_rate": 4.77259484159843e-05, "loss": 0.5753, "mean_token_accuracy": 0.8225559741258621, "num_tokens": 544049640.0, "step": 17046 }, { "entropy": 0.7433116286993027, "epoch": 1.5684153627638713, "grad_norm": 0.16388778388500214, "learning_rate": 4.772288158984267e-05, "loss": 0.7308, "mean_token_accuracy": 0.7812152579426765, "num_tokens": 544081802.0, "step": 17047 }, { "entropy": 0.72552938060835, "epoch": 1.5685073691353126, "grad_norm": 0.16084825992584229, "learning_rate": 4.771981476370105e-05, "loss": 0.7154, "mean_token_accuracy": 0.7854840755462646, "num_tokens": 544113116.0, "step": 17048 }, { "entropy": 0.5545881688594818, "epoch": 1.568599375506754, "grad_norm": 0.1459731012582779, "learning_rate": 4.771674793755942e-05, "loss": 0.5443, "mean_token_accuracy": 0.8343359492719173, "num_tokens": 544145534.0, "step": 17049 }, { "entropy": 0.5364762172102928, "epoch": 1.5686913818781951, "grad_norm": 0.1505458652973175, "learning_rate": 4.77136811114178e-05, "loss": 0.5291, "mean_token_accuracy": 0.836921151727438, "num_tokens": 544177994.0, "step": 17050 }, { "entropy": 0.6091045513749123, "epoch": 1.5687833882496363, "grad_norm": 0.15646333992481232, "learning_rate": 4.7710614285276165e-05, "loss": 0.5885, "mean_token_accuracy": 0.8220726437866688, "num_tokens": 544210096.0, "step": 17051 }, { "entropy": 0.6990275401622057, "epoch": 1.5688753946210774, "grad_norm": 0.16058897972106934, "learning_rate": 4.770754745913455e-05, "loss": 0.6809, "mean_token_accuracy": 0.7915055565536022, "num_tokens": 544241792.0, "step": 17052 }, { "entropy": 0.6697375494986773, "epoch": 1.5689674009925187, "grad_norm": 0.16125927865505219, "learning_rate": 4.770448063299292e-05, "loss": 0.6645, "mean_token_accuracy": 0.7994320876896381, "num_tokens": 544274560.0, "step": 17053 }, { "entropy": 0.47486250940710306, "epoch": 1.56905940736396, "grad_norm": 0.15650543570518494, "learning_rate": 4.770141380685129e-05, "loss": 0.4692, "mean_token_accuracy": 0.8573379255831242, "num_tokens": 544306689.0, "step": 17054 }, { "entropy": 0.6008210508152843, "epoch": 1.5691514137354012, "grad_norm": 0.15010619163513184, "learning_rate": 4.769834698070967e-05, "loss": 0.5935, "mean_token_accuracy": 0.8163955174386501, "num_tokens": 544338313.0, "step": 17055 }, { "entropy": 0.6364187449216843, "epoch": 1.5692434201068424, "grad_norm": 0.16218982636928558, "learning_rate": 4.769528015456804e-05, "loss": 0.6343, "mean_token_accuracy": 0.8031776584684849, "num_tokens": 544369127.0, "step": 17056 }, { "entropy": 0.6545947678387165, "epoch": 1.5693354264782835, "grad_norm": 0.15920504927635193, "learning_rate": 4.769221332842641e-05, "loss": 0.6547, "mean_token_accuracy": 0.7996243461966515, "num_tokens": 544400918.0, "step": 17057 }, { "entropy": 0.5763465669006109, "epoch": 1.5694274328497249, "grad_norm": 0.1508476883172989, "learning_rate": 4.768914650228479e-05, "loss": 0.5729, "mean_token_accuracy": 0.8237517289817333, "num_tokens": 544433229.0, "step": 17058 }, { "entropy": 0.6027202978730202, "epoch": 1.5695194392211662, "grad_norm": 0.15337108075618744, "learning_rate": 4.768607967614316e-05, "loss": 0.598, "mean_token_accuracy": 0.8144224993884563, "num_tokens": 544465237.0, "step": 17059 }, { "entropy": 0.7470695730298758, "epoch": 1.5696114455926073, "grad_norm": 0.1608259230852127, "learning_rate": 4.768301285000154e-05, "loss": 0.7369, "mean_token_accuracy": 0.7776651158928871, "num_tokens": 544497724.0, "step": 17060 }, { "entropy": 0.6502459850162268, "epoch": 1.5697034519640485, "grad_norm": 0.15671376883983612, "learning_rate": 4.767994602385991e-05, "loss": 0.6346, "mean_token_accuracy": 0.8048661164939404, "num_tokens": 544530086.0, "step": 17061 }, { "entropy": 0.6546431500464678, "epoch": 1.5697954583354896, "grad_norm": 0.15613514184951782, "learning_rate": 4.767687919771828e-05, "loss": 0.6474, "mean_token_accuracy": 0.8004521243274212, "num_tokens": 544561617.0, "step": 17062 }, { "entropy": 0.4691129978746176, "epoch": 1.569887464706931, "grad_norm": 0.14863869547843933, "learning_rate": 4.767381237157666e-05, "loss": 0.4473, "mean_token_accuracy": 0.8591318912804127, "num_tokens": 544592647.0, "step": 17063 }, { "entropy": 0.5340330554172397, "epoch": 1.5699794710783723, "grad_norm": 0.15491510927677155, "learning_rate": 4.767074554543503e-05, "loss": 0.5185, "mean_token_accuracy": 0.8383833840489388, "num_tokens": 544624956.0, "step": 17064 }, { "entropy": 0.619185596704483, "epoch": 1.5700714774498135, "grad_norm": 0.1562587022781372, "learning_rate": 4.766767871929341e-05, "loss": 0.6048, "mean_token_accuracy": 0.8170270062983036, "num_tokens": 544656865.0, "step": 17065 }, { "entropy": 0.709619328379631, "epoch": 1.5701634838212546, "grad_norm": 0.16173239052295685, "learning_rate": 4.766461189315178e-05, "loss": 0.6957, "mean_token_accuracy": 0.7882242240011692, "num_tokens": 544688564.0, "step": 17066 }, { "entropy": 0.6631835773587227, "epoch": 1.5702554901926957, "grad_norm": 0.15956370532512665, "learning_rate": 4.766154506701015e-05, "loss": 0.653, "mean_token_accuracy": 0.8010526522994041, "num_tokens": 544720593.0, "step": 17067 }, { "entropy": 0.5851899180561304, "epoch": 1.570347496564137, "grad_norm": 0.16183722019195557, "learning_rate": 4.765847824086853e-05, "loss": 0.5644, "mean_token_accuracy": 0.8259475231170654, "num_tokens": 544751905.0, "step": 17068 }, { "entropy": 0.60802898183465, "epoch": 1.5704395029355784, "grad_norm": 0.16194725036621094, "learning_rate": 4.76554114147269e-05, "loss": 0.5935, "mean_token_accuracy": 0.8209335692226887, "num_tokens": 544783359.0, "step": 17069 }, { "entropy": 0.6571177737787366, "epoch": 1.5705315093070196, "grad_norm": 0.16198286414146423, "learning_rate": 4.765234458858528e-05, "loss": 0.6342, "mean_token_accuracy": 0.8031006641685963, "num_tokens": 544814400.0, "step": 17070 }, { "entropy": 0.655156257096678, "epoch": 1.5706235156784607, "grad_norm": 0.1568504422903061, "learning_rate": 4.764927776244365e-05, "loss": 0.6381, "mean_token_accuracy": 0.8026408813893795, "num_tokens": 544846609.0, "step": 17071 }, { "entropy": 0.5006589060649276, "epoch": 1.5707155220499018, "grad_norm": 0.14083755016326904, "learning_rate": 4.764621093630202e-05, "loss": 0.4982, "mean_token_accuracy": 0.8492497503757477, "num_tokens": 544879276.0, "step": 17072 }, { "entropy": 0.5683826431632042, "epoch": 1.5708075284213432, "grad_norm": 0.14694392681121826, "learning_rate": 4.76431441101604e-05, "loss": 0.5542, "mean_token_accuracy": 0.8289941102266312, "num_tokens": 544911315.0, "step": 17073 }, { "entropy": 0.5125743225216866, "epoch": 1.5708995347927845, "grad_norm": 0.14717547595500946, "learning_rate": 4.764007728401877e-05, "loss": 0.5, "mean_token_accuracy": 0.8469490222632885, "num_tokens": 544943241.0, "step": 17074 }, { "entropy": 0.6339569594711065, "epoch": 1.5709915411642257, "grad_norm": 0.1658685952425003, "learning_rate": 4.763701045787714e-05, "loss": 0.6161, "mean_token_accuracy": 0.8132749125361443, "num_tokens": 544975286.0, "step": 17075 }, { "entropy": 0.6263838987797499, "epoch": 1.5710835475356668, "grad_norm": 0.15720151364803314, "learning_rate": 4.763394363173552e-05, "loss": 0.625, "mean_token_accuracy": 0.8087953440845013, "num_tokens": 545007779.0, "step": 17076 }, { "entropy": 0.5789707372896373, "epoch": 1.571175553907108, "grad_norm": 0.15265007317066193, "learning_rate": 4.763087680559389e-05, "loss": 0.5581, "mean_token_accuracy": 0.8311333991587162, "num_tokens": 545040251.0, "step": 17077 }, { "entropy": 0.5426044464111328, "epoch": 1.5712675602785493, "grad_norm": 0.1543177217245102, "learning_rate": 4.762780997945227e-05, "loss": 0.5212, "mean_token_accuracy": 0.83657056838274, "num_tokens": 545071973.0, "step": 17078 }, { "entropy": 0.6680910605937243, "epoch": 1.5713595666499907, "grad_norm": 0.1604710966348648, "learning_rate": 4.762474315331064e-05, "loss": 0.6725, "mean_token_accuracy": 0.7962633706629276, "num_tokens": 545104413.0, "step": 17079 }, { "entropy": 0.6203606948256493, "epoch": 1.5714515730214318, "grad_norm": 0.1653319150209427, "learning_rate": 4.762167632716901e-05, "loss": 0.5984, "mean_token_accuracy": 0.8152971267700195, "num_tokens": 545136122.0, "step": 17080 }, { "entropy": 0.5632173186168075, "epoch": 1.571543579392873, "grad_norm": 0.14851900935173035, "learning_rate": 4.761860950102739e-05, "loss": 0.5547, "mean_token_accuracy": 0.8283562287688255, "num_tokens": 545167858.0, "step": 17081 }, { "entropy": 0.5014135595411062, "epoch": 1.571635585764314, "grad_norm": 0.1436472088098526, "learning_rate": 4.761554267488576e-05, "loss": 0.4885, "mean_token_accuracy": 0.8495801165699959, "num_tokens": 545200121.0, "step": 17082 }, { "entropy": 0.5717768194153905, "epoch": 1.5717275921357554, "grad_norm": 0.1531398892402649, "learning_rate": 4.7612475848744134e-05, "loss": 0.5597, "mean_token_accuracy": 0.8286494761705399, "num_tokens": 545232339.0, "step": 17083 }, { "entropy": 0.5102578671649098, "epoch": 1.5718195985071968, "grad_norm": 0.1564328819513321, "learning_rate": 4.7609409022602515e-05, "loss": 0.5004, "mean_token_accuracy": 0.8456403166055679, "num_tokens": 545264364.0, "step": 17084 }, { "entropy": 0.654880790039897, "epoch": 1.571911604878638, "grad_norm": 0.1565561592578888, "learning_rate": 4.760634219646088e-05, "loss": 0.6502, "mean_token_accuracy": 0.8037426248192787, "num_tokens": 545296466.0, "step": 17085 }, { "entropy": 0.6690162420272827, "epoch": 1.572003611250079, "grad_norm": 0.16899418830871582, "learning_rate": 4.7603275370319264e-05, "loss": 0.661, "mean_token_accuracy": 0.8031307868659496, "num_tokens": 545328506.0, "step": 17086 }, { "entropy": 0.5389540451578796, "epoch": 1.5720956176215202, "grad_norm": 0.155915766954422, "learning_rate": 4.760020854417763e-05, "loss": 0.5174, "mean_token_accuracy": 0.8416682258248329, "num_tokens": 545359444.0, "step": 17087 }, { "entropy": 0.5753929819911718, "epoch": 1.5721876239929615, "grad_norm": 0.1570620983839035, "learning_rate": 4.759714171803601e-05, "loss": 0.5793, "mean_token_accuracy": 0.821269690990448, "num_tokens": 545391103.0, "step": 17088 }, { "entropy": 0.5160142416134477, "epoch": 1.5722796303644029, "grad_norm": 0.1457356959581375, "learning_rate": 4.759407489189438e-05, "loss": 0.5155, "mean_token_accuracy": 0.8420724347233772, "num_tokens": 545423452.0, "step": 17089 }, { "entropy": 0.6172914300113916, "epoch": 1.572371636735844, "grad_norm": 0.15551188588142395, "learning_rate": 4.7591008065752756e-05, "loss": 0.6105, "mean_token_accuracy": 0.8129637539386749, "num_tokens": 545455460.0, "step": 17090 }, { "entropy": 0.603679177351296, "epoch": 1.5724636431072851, "grad_norm": 0.1561899185180664, "learning_rate": 4.758794123961113e-05, "loss": 0.5946, "mean_token_accuracy": 0.8115699253976345, "num_tokens": 545486234.0, "step": 17091 }, { "entropy": 0.5408529071137309, "epoch": 1.5725556494787263, "grad_norm": 0.15327061712741852, "learning_rate": 4.7584874413469505e-05, "loss": 0.5287, "mean_token_accuracy": 0.8363208621740341, "num_tokens": 545517900.0, "step": 17092 }, { "entropy": 0.6276458036154509, "epoch": 1.5726476558501676, "grad_norm": 0.1590700000524521, "learning_rate": 4.758180758732787e-05, "loss": 0.618, "mean_token_accuracy": 0.8124554082751274, "num_tokens": 545549067.0, "step": 17093 }, { "entropy": 0.509167367592454, "epoch": 1.572739662221609, "grad_norm": 0.14708589017391205, "learning_rate": 4.7578740761186255e-05, "loss": 0.5015, "mean_token_accuracy": 0.8472808822989464, "num_tokens": 545581163.0, "step": 17094 }, { "entropy": 0.6319268373772502, "epoch": 1.5728316685930501, "grad_norm": 0.15812306106090546, "learning_rate": 4.757567393504462e-05, "loss": 0.6287, "mean_token_accuracy": 0.8060627542436123, "num_tokens": 545612552.0, "step": 17095 }, { "entropy": 0.6041099969297647, "epoch": 1.5729236749644913, "grad_norm": 0.15494133532047272, "learning_rate": 4.7572607108903e-05, "loss": 0.5898, "mean_token_accuracy": 0.820923175662756, "num_tokens": 545644494.0, "step": 17096 }, { "entropy": 0.5237900093197823, "epoch": 1.5730156813359324, "grad_norm": 0.14564310014247894, "learning_rate": 4.756954028276137e-05, "loss": 0.5027, "mean_token_accuracy": 0.841711338609457, "num_tokens": 545675814.0, "step": 17097 }, { "entropy": 0.6178318690508604, "epoch": 1.5731076877073737, "grad_norm": 0.15228913724422455, "learning_rate": 4.7566473456619747e-05, "loss": 0.6101, "mean_token_accuracy": 0.8111914843320847, "num_tokens": 545708050.0, "step": 17098 }, { "entropy": 0.6479746326804161, "epoch": 1.573199694078815, "grad_norm": 0.15779678523540497, "learning_rate": 4.756340663047812e-05, "loss": 0.6371, "mean_token_accuracy": 0.8060195744037628, "num_tokens": 545739872.0, "step": 17099 }, { "entropy": 0.6444749366492033, "epoch": 1.5732917004502562, "grad_norm": 0.17961321771144867, "learning_rate": 4.7560339804336496e-05, "loss": 0.6241, "mean_token_accuracy": 0.8090741336345673, "num_tokens": 545772448.0, "step": 17100 }, { "entropy": 0.6248152144253254, "epoch": 1.5733837068216974, "grad_norm": 0.15987500548362732, "learning_rate": 4.7557272978194864e-05, "loss": 0.6046, "mean_token_accuracy": 0.8167676962912083, "num_tokens": 545803828.0, "step": 17101 }, { "entropy": 0.6877743294462562, "epoch": 1.5734757131931385, "grad_norm": 0.16150091588497162, "learning_rate": 4.7554206152053245e-05, "loss": 0.6805, "mean_token_accuracy": 0.7935284040868282, "num_tokens": 545835755.0, "step": 17102 }, { "entropy": 0.6629192624241114, "epoch": 1.5735677195645799, "grad_norm": 0.15586590766906738, "learning_rate": 4.755113932591161e-05, "loss": 0.6622, "mean_token_accuracy": 0.7975038774311543, "num_tokens": 545867592.0, "step": 17103 }, { "entropy": 0.5814272155985236, "epoch": 1.5736597259360212, "grad_norm": 0.1511196494102478, "learning_rate": 4.7548072499769994e-05, "loss": 0.5578, "mean_token_accuracy": 0.8260821141302586, "num_tokens": 545899747.0, "step": 17104 }, { "entropy": 0.7063285019248724, "epoch": 1.5737517323074623, "grad_norm": 0.16428451240062714, "learning_rate": 4.754500567362836e-05, "loss": 0.6991, "mean_token_accuracy": 0.786528542637825, "num_tokens": 545930975.0, "step": 17105 }, { "entropy": 0.6229520477354527, "epoch": 1.5738437386789035, "grad_norm": 0.15764926373958588, "learning_rate": 4.754193884748674e-05, "loss": 0.6121, "mean_token_accuracy": 0.8083864115178585, "num_tokens": 545962480.0, "step": 17106 }, { "entropy": 0.5826554312370718, "epoch": 1.5739357450503446, "grad_norm": 0.1586071401834488, "learning_rate": 4.753887202134511e-05, "loss": 0.5753, "mean_token_accuracy": 0.8202768377959728, "num_tokens": 545994577.0, "step": 17107 }, { "entropy": 0.6410672385245562, "epoch": 1.574027751421786, "grad_norm": 0.16307470202445984, "learning_rate": 4.7535805195203486e-05, "loss": 0.6427, "mean_token_accuracy": 0.8016727045178413, "num_tokens": 546026056.0, "step": 17108 }, { "entropy": 0.6969601698219776, "epoch": 1.5741197577932273, "grad_norm": 0.16386087238788605, "learning_rate": 4.753273836906186e-05, "loss": 0.7019, "mean_token_accuracy": 0.7843081764876842, "num_tokens": 546058081.0, "step": 17109 }, { "entropy": 0.5139843337237835, "epoch": 1.5742117641646685, "grad_norm": 0.14895592629909515, "learning_rate": 4.7529671542920236e-05, "loss": 0.4876, "mean_token_accuracy": 0.846751406788826, "num_tokens": 546089547.0, "step": 17110 }, { "entropy": 0.6969523672014475, "epoch": 1.5743037705361096, "grad_norm": 0.1627657264471054, "learning_rate": 4.7526604716778603e-05, "loss": 0.6972, "mean_token_accuracy": 0.7893077507615089, "num_tokens": 546120952.0, "step": 17111 }, { "entropy": 0.6910208035260439, "epoch": 1.5743957769075507, "grad_norm": 0.16408134996891022, "learning_rate": 4.7523537890636985e-05, "loss": 0.681, "mean_token_accuracy": 0.7934880070388317, "num_tokens": 546152099.0, "step": 17112 }, { "entropy": 0.5624227896332741, "epoch": 1.574487783278992, "grad_norm": 0.15064875781536102, "learning_rate": 4.752047106449536e-05, "loss": 0.5471, "mean_token_accuracy": 0.8320666700601578, "num_tokens": 546184182.0, "step": 17113 }, { "entropy": 0.615127719938755, "epoch": 1.5745797896504334, "grad_norm": 0.15761588513851166, "learning_rate": 4.751740423835373e-05, "loss": 0.6016, "mean_token_accuracy": 0.8121427446603775, "num_tokens": 546215329.0, "step": 17114 }, { "entropy": 0.6255456323269755, "epoch": 1.5746717960218746, "grad_norm": 0.15207123756408691, "learning_rate": 4.751433741221211e-05, "loss": 0.6195, "mean_token_accuracy": 0.8100421465933323, "num_tokens": 546247955.0, "step": 17115 }, { "entropy": 0.723395636305213, "epoch": 1.5747638023933157, "grad_norm": 0.1663830578327179, "learning_rate": 4.751127058607048e-05, "loss": 0.713, "mean_token_accuracy": 0.7841677963733673, "num_tokens": 546279583.0, "step": 17116 }, { "entropy": 0.6454102452844381, "epoch": 1.5748558087647568, "grad_norm": 0.1631133258342743, "learning_rate": 4.750820375992885e-05, "loss": 0.6416, "mean_token_accuracy": 0.8027440533041954, "num_tokens": 546310684.0, "step": 17117 }, { "entropy": 0.7152496790513396, "epoch": 1.5749478151361982, "grad_norm": 0.16357095539569855, "learning_rate": 4.7505136933787226e-05, "loss": 0.7083, "mean_token_accuracy": 0.7824101597070694, "num_tokens": 546342870.0, "step": 17118 }, { "entropy": 0.5960429329425097, "epoch": 1.5750398215076395, "grad_norm": 0.14695000648498535, "learning_rate": 4.75020701076456e-05, "loss": 0.5829, "mean_token_accuracy": 0.8197418339550495, "num_tokens": 546375036.0, "step": 17119 }, { "entropy": 0.5916581777855754, "epoch": 1.5751318278790807, "grad_norm": 0.16663038730621338, "learning_rate": 4.7499003281503975e-05, "loss": 0.569, "mean_token_accuracy": 0.8242411613464355, "num_tokens": 546406622.0, "step": 17120 }, { "entropy": 0.5478697381913662, "epoch": 1.5752238342505218, "grad_norm": 0.14903169870376587, "learning_rate": 4.749593645536235e-05, "loss": 0.5411, "mean_token_accuracy": 0.8323812261223793, "num_tokens": 546439123.0, "step": 17121 }, { "entropy": 0.5684241498820484, "epoch": 1.575315840621963, "grad_norm": 0.1481020152568817, "learning_rate": 4.749286962922072e-05, "loss": 0.5461, "mean_token_accuracy": 0.8317357748746872, "num_tokens": 546471583.0, "step": 17122 }, { "entropy": 0.5620642993599176, "epoch": 1.5754078469934043, "grad_norm": 0.15488769114017487, "learning_rate": 4.74898028030791e-05, "loss": 0.5377, "mean_token_accuracy": 0.8342850133776665, "num_tokens": 546503691.0, "step": 17123 }, { "entropy": 0.6130684372037649, "epoch": 1.5754998533648457, "grad_norm": 0.15430942177772522, "learning_rate": 4.748673597693747e-05, "loss": 0.6043, "mean_token_accuracy": 0.8138044662773609, "num_tokens": 546535988.0, "step": 17124 }, { "entropy": 0.6371645508334041, "epoch": 1.5755918597362868, "grad_norm": 0.15901121497154236, "learning_rate": 4.748366915079585e-05, "loss": 0.6323, "mean_token_accuracy": 0.8043836653232574, "num_tokens": 546567680.0, "step": 17125 }, { "entropy": 0.6395663507282734, "epoch": 1.575683866107728, "grad_norm": 0.16660597920417786, "learning_rate": 4.7480602324654216e-05, "loss": 0.6242, "mean_token_accuracy": 0.8065934367477894, "num_tokens": 546598922.0, "step": 17126 }, { "entropy": 0.5458716377615929, "epoch": 1.575775872479169, "grad_norm": 0.15074436366558075, "learning_rate": 4.747753549851259e-05, "loss": 0.5386, "mean_token_accuracy": 0.8318939916789532, "num_tokens": 546631347.0, "step": 17127 }, { "entropy": 0.6656217984855175, "epoch": 1.5758678788506104, "grad_norm": 0.15996916592121124, "learning_rate": 4.7474468672370966e-05, "loss": 0.6616, "mean_token_accuracy": 0.7990351617336273, "num_tokens": 546664115.0, "step": 17128 }, { "entropy": 0.6162683330476284, "epoch": 1.5759598852220518, "grad_norm": 0.15947633981704712, "learning_rate": 4.747140184622934e-05, "loss": 0.6108, "mean_token_accuracy": 0.8073750212788582, "num_tokens": 546696030.0, "step": 17129 }, { "entropy": 0.6040589979384094, "epoch": 1.576051891593493, "grad_norm": 0.15149088203907013, "learning_rate": 4.7468335020087715e-05, "loss": 0.5952, "mean_token_accuracy": 0.8228621520102024, "num_tokens": 546728726.0, "step": 17130 }, { "entropy": 0.7244839705526829, "epoch": 1.576143897964934, "grad_norm": 0.16809038817882538, "learning_rate": 4.746526819394609e-05, "loss": 0.7098, "mean_token_accuracy": 0.7846744693815708, "num_tokens": 546760856.0, "step": 17131 }, { "entropy": 0.6297617377713323, "epoch": 1.5762359043363752, "grad_norm": 0.1624630242586136, "learning_rate": 4.746220136780446e-05, "loss": 0.6257, "mean_token_accuracy": 0.8107068799436092, "num_tokens": 546793355.0, "step": 17132 }, { "entropy": 0.7105263322591782, "epoch": 1.5763279107078165, "grad_norm": 0.1677854061126709, "learning_rate": 4.745913454166284e-05, "loss": 0.7049, "mean_token_accuracy": 0.788682121783495, "num_tokens": 546825099.0, "step": 17133 }, { "entropy": 0.6238522529602051, "epoch": 1.5764199170792579, "grad_norm": 0.1577150970697403, "learning_rate": 4.745606771552121e-05, "loss": 0.5995, "mean_token_accuracy": 0.8191373944282532, "num_tokens": 546857072.0, "step": 17134 }, { "entropy": 0.657599838450551, "epoch": 1.576511923450699, "grad_norm": 0.15531764924526215, "learning_rate": 4.745300088937958e-05, "loss": 0.6459, "mean_token_accuracy": 0.8001746833324432, "num_tokens": 546889490.0, "step": 17135 }, { "entropy": 0.6646223776042461, "epoch": 1.5766039298221401, "grad_norm": 0.15934330224990845, "learning_rate": 4.7449934063237956e-05, "loss": 0.6508, "mean_token_accuracy": 0.7989486679434776, "num_tokens": 546921365.0, "step": 17136 }, { "entropy": 0.6132154110819101, "epoch": 1.5766959361935813, "grad_norm": 0.1485031545162201, "learning_rate": 4.744686723709633e-05, "loss": 0.594, "mean_token_accuracy": 0.8168659768998623, "num_tokens": 546953067.0, "step": 17137 }, { "entropy": 0.6437358930706978, "epoch": 1.5767879425650226, "grad_norm": 0.15645530819892883, "learning_rate": 4.7443800410954705e-05, "loss": 0.6167, "mean_token_accuracy": 0.8105561956763268, "num_tokens": 546984811.0, "step": 17138 }, { "entropy": 0.5596108175814152, "epoch": 1.576879948936464, "grad_norm": 0.1556711494922638, "learning_rate": 4.744073358481308e-05, "loss": 0.5542, "mean_token_accuracy": 0.8305409885942936, "num_tokens": 547016159.0, "step": 17139 }, { "entropy": 0.6053741620853543, "epoch": 1.5769719553079051, "grad_norm": 0.15213218331336975, "learning_rate": 4.743766675867145e-05, "loss": 0.5971, "mean_token_accuracy": 0.81947061419487, "num_tokens": 547048830.0, "step": 17140 }, { "entropy": 0.5854282267391682, "epoch": 1.5770639616793463, "grad_norm": 0.14731226861476898, "learning_rate": 4.743459993252983e-05, "loss": 0.5803, "mean_token_accuracy": 0.8242211155593395, "num_tokens": 547081389.0, "step": 17141 }, { "entropy": 0.6071947030723095, "epoch": 1.5771559680507874, "grad_norm": 0.15666824579238892, "learning_rate": 4.74315331063882e-05, "loss": 0.6006, "mean_token_accuracy": 0.8183872476220131, "num_tokens": 547113432.0, "step": 17142 }, { "entropy": 0.7045609299093485, "epoch": 1.5772479744222287, "grad_norm": 0.16219770908355713, "learning_rate": 4.742846628024657e-05, "loss": 0.7128, "mean_token_accuracy": 0.7847355082631111, "num_tokens": 547145662.0, "step": 17143 }, { "entropy": 0.4713833020068705, "epoch": 1.57733998079367, "grad_norm": 0.143607959151268, "learning_rate": 4.742539945410495e-05, "loss": 0.4591, "mean_token_accuracy": 0.8562598414719105, "num_tokens": 547178024.0, "step": 17144 }, { "entropy": 0.5937671745195985, "epoch": 1.5774319871651112, "grad_norm": 0.15549446642398834, "learning_rate": 4.742233262796332e-05, "loss": 0.5841, "mean_token_accuracy": 0.8188236691057682, "num_tokens": 547209752.0, "step": 17145 }, { "entropy": 0.6428636275231838, "epoch": 1.5775239935365524, "grad_norm": 0.16153615713119507, "learning_rate": 4.74192658018217e-05, "loss": 0.6342, "mean_token_accuracy": 0.8055179379880428, "num_tokens": 547241353.0, "step": 17146 }, { "entropy": 0.6588586140424013, "epoch": 1.5776159999079935, "grad_norm": 0.15854981541633606, "learning_rate": 4.741619897568007e-05, "loss": 0.6413, "mean_token_accuracy": 0.8041065558791161, "num_tokens": 547274061.0, "step": 17147 }, { "entropy": 0.5682955328375101, "epoch": 1.5777080062794349, "grad_norm": 0.1520422101020813, "learning_rate": 4.7413132149538445e-05, "loss": 0.5561, "mean_token_accuracy": 0.8312624096870422, "num_tokens": 547306259.0, "step": 17148 }, { "entropy": 0.54153798148036, "epoch": 1.5778000126508762, "grad_norm": 0.14950114488601685, "learning_rate": 4.741006532339682e-05, "loss": 0.5392, "mean_token_accuracy": 0.8333747908473015, "num_tokens": 547338759.0, "step": 17149 }, { "entropy": 0.49537351494655013, "epoch": 1.5778920190223173, "grad_norm": 0.14384178817272186, "learning_rate": 4.7406998497255194e-05, "loss": 0.4896, "mean_token_accuracy": 0.8487379252910614, "num_tokens": 547370904.0, "step": 17150 }, { "entropy": 0.5401685833930969, "epoch": 1.5779840253937585, "grad_norm": 0.14881017804145813, "learning_rate": 4.740393167111357e-05, "loss": 0.5402, "mean_token_accuracy": 0.8317680545151234, "num_tokens": 547402621.0, "step": 17151 }, { "entropy": 0.5984025890938938, "epoch": 1.5780760317651996, "grad_norm": 0.15065890550613403, "learning_rate": 4.7400864844971944e-05, "loss": 0.59, "mean_token_accuracy": 0.8203104734420776, "num_tokens": 547434943.0, "step": 17152 }, { "entropy": 0.5580399259924889, "epoch": 1.578168038136641, "grad_norm": 0.14974620938301086, "learning_rate": 4.739779801883031e-05, "loss": 0.556, "mean_token_accuracy": 0.8293487913906574, "num_tokens": 547467419.0, "step": 17153 }, { "entropy": 0.630718357861042, "epoch": 1.5782600445080823, "grad_norm": 0.15323880314826965, "learning_rate": 4.739473119268869e-05, "loss": 0.6108, "mean_token_accuracy": 0.8103530779480934, "num_tokens": 547499585.0, "step": 17154 }, { "entropy": 0.6614488158375025, "epoch": 1.5783520508795235, "grad_norm": 0.16321280598640442, "learning_rate": 4.739166436654706e-05, "loss": 0.6624, "mean_token_accuracy": 0.7977663241326809, "num_tokens": 547531126.0, "step": 17155 }, { "entropy": 0.6489768177270889, "epoch": 1.5784440572509646, "grad_norm": 0.16101479530334473, "learning_rate": 4.7388597540405435e-05, "loss": 0.633, "mean_token_accuracy": 0.8040363974869251, "num_tokens": 547563164.0, "step": 17156 }, { "entropy": 0.6577582210302353, "epoch": 1.5785360636224057, "grad_norm": 0.15880100429058075, "learning_rate": 4.738553071426381e-05, "loss": 0.6411, "mean_token_accuracy": 0.8018363825976849, "num_tokens": 547594901.0, "step": 17157 }, { "entropy": 0.6596464719623327, "epoch": 1.578628069993847, "grad_norm": 0.15843699872493744, "learning_rate": 4.7382463888122185e-05, "loss": 0.6581, "mean_token_accuracy": 0.7982022538781166, "num_tokens": 547626095.0, "step": 17158 }, { "entropy": 0.5723990676924586, "epoch": 1.5787200763652884, "grad_norm": 0.1494695395231247, "learning_rate": 4.737939706198056e-05, "loss": 0.5507, "mean_token_accuracy": 0.8273310028016567, "num_tokens": 547658107.0, "step": 17159 }, { "entropy": 0.6564028924331069, "epoch": 1.5788120827367296, "grad_norm": 0.1580173224210739, "learning_rate": 4.7376330235838934e-05, "loss": 0.6458, "mean_token_accuracy": 0.8005405738949776, "num_tokens": 547689799.0, "step": 17160 }, { "entropy": 0.6085729952901602, "epoch": 1.5789040891081707, "grad_norm": 0.14836642146110535, "learning_rate": 4.73732634096973e-05, "loss": 0.5952, "mean_token_accuracy": 0.8165943436324596, "num_tokens": 547721588.0, "step": 17161 }, { "entropy": 0.5701492689549923, "epoch": 1.5789960954796118, "grad_norm": 0.1538352519273758, "learning_rate": 4.737019658355568e-05, "loss": 0.5499, "mean_token_accuracy": 0.8267039880156517, "num_tokens": 547753153.0, "step": 17162 }, { "entropy": 0.5848608501255512, "epoch": 1.5790881018510532, "grad_norm": 0.15873835980892181, "learning_rate": 4.736712975741405e-05, "loss": 0.5661, "mean_token_accuracy": 0.8253401480615139, "num_tokens": 547783651.0, "step": 17163 }, { "entropy": 0.5906747616827488, "epoch": 1.5791801082224945, "grad_norm": 0.1640232354402542, "learning_rate": 4.736406293127243e-05, "loss": 0.5813, "mean_token_accuracy": 0.8200059570372105, "num_tokens": 547814849.0, "step": 17164 }, { "entropy": 0.6057431194931269, "epoch": 1.5792721145939357, "grad_norm": 0.15611110627651215, "learning_rate": 4.73609961051308e-05, "loss": 0.6056, "mean_token_accuracy": 0.8122803494334221, "num_tokens": 547846299.0, "step": 17165 }, { "entropy": 0.6182456184178591, "epoch": 1.5793641209653768, "grad_norm": 0.15764938294887543, "learning_rate": 4.7357929278989175e-05, "loss": 0.6123, "mean_token_accuracy": 0.8128765150904655, "num_tokens": 547877697.0, "step": 17166 }, { "entropy": 0.5953467292711139, "epoch": 1.579456127336818, "grad_norm": 0.15376873314380646, "learning_rate": 4.735486245284755e-05, "loss": 0.5625, "mean_token_accuracy": 0.8207242786884308, "num_tokens": 547909092.0, "step": 17167 }, { "entropy": 0.5989406243897974, "epoch": 1.5795481337082593, "grad_norm": 0.15396560728549957, "learning_rate": 4.7351795626705924e-05, "loss": 0.5717, "mean_token_accuracy": 0.8217873647809029, "num_tokens": 547940610.0, "step": 17168 }, { "entropy": 0.5952049698680639, "epoch": 1.5796401400797007, "grad_norm": 0.15488436818122864, "learning_rate": 4.73487288005643e-05, "loss": 0.5917, "mean_token_accuracy": 0.8217909149825573, "num_tokens": 547972575.0, "step": 17169 }, { "entropy": 0.526267021894455, "epoch": 1.5797321464511418, "grad_norm": 0.14714106917381287, "learning_rate": 4.7345661974422674e-05, "loss": 0.5111, "mean_token_accuracy": 0.8425286822021008, "num_tokens": 548004931.0, "step": 17170 }, { "entropy": 0.6795961055904627, "epoch": 1.579824152822583, "grad_norm": 0.15890300273895264, "learning_rate": 4.734259514828104e-05, "loss": 0.6593, "mean_token_accuracy": 0.7999304607510567, "num_tokens": 548036906.0, "step": 17171 }, { "entropy": 0.5752454306930304, "epoch": 1.579916159194024, "grad_norm": 0.15026254951953888, "learning_rate": 4.733952832213942e-05, "loss": 0.5668, "mean_token_accuracy": 0.8245389275252819, "num_tokens": 548069083.0, "step": 17172 }, { "entropy": 0.5686573304701596, "epoch": 1.5800081655654654, "grad_norm": 0.15659630298614502, "learning_rate": 4.733646149599779e-05, "loss": 0.5581, "mean_token_accuracy": 0.8326665349304676, "num_tokens": 548101380.0, "step": 17173 }, { "entropy": 0.5690696174278855, "epoch": 1.5801001719369068, "grad_norm": 0.14662180840969086, "learning_rate": 4.7333394669856166e-05, "loss": 0.5655, "mean_token_accuracy": 0.8287525624036789, "num_tokens": 548133864.0, "step": 17174 }, { "entropy": 0.5737315970472991, "epoch": 1.580192178308348, "grad_norm": 0.14445848762989044, "learning_rate": 4.733032784371455e-05, "loss": 0.5604, "mean_token_accuracy": 0.827739767730236, "num_tokens": 548166126.0, "step": 17175 }, { "entropy": 0.5982474503107369, "epoch": 1.580284184679789, "grad_norm": 0.14973962306976318, "learning_rate": 4.7327261017572915e-05, "loss": 0.5889, "mean_token_accuracy": 0.8219047598540783, "num_tokens": 548198418.0, "step": 17176 }, { "entropy": 0.6219963077455759, "epoch": 1.5803761910512302, "grad_norm": 0.16056334972381592, "learning_rate": 4.732419419143129e-05, "loss": 0.6168, "mean_token_accuracy": 0.8102629408240318, "num_tokens": 548229843.0, "step": 17177 }, { "entropy": 0.6014267378486693, "epoch": 1.5804681974226715, "grad_norm": 0.1562049686908722, "learning_rate": 4.7321127365289664e-05, "loss": 0.5837, "mean_token_accuracy": 0.8174160495400429, "num_tokens": 548260748.0, "step": 17178 }, { "entropy": 0.5998056884855032, "epoch": 1.5805602037941129, "grad_norm": 0.15876592695713043, "learning_rate": 4.731806053914804e-05, "loss": 0.5896, "mean_token_accuracy": 0.8192646540701389, "num_tokens": 548292850.0, "step": 17179 }, { "entropy": 0.5370111586526036, "epoch": 1.580652210165554, "grad_norm": 0.1499624103307724, "learning_rate": 4.7314993713006413e-05, "loss": 0.5279, "mean_token_accuracy": 0.8389746248722076, "num_tokens": 548324799.0, "step": 17180 }, { "entropy": 0.6718806065618992, "epoch": 1.5807442165369952, "grad_norm": 0.15971916913986206, "learning_rate": 4.731192688686479e-05, "loss": 0.6414, "mean_token_accuracy": 0.8033573962748051, "num_tokens": 548356513.0, "step": 17181 }, { "entropy": 0.5204277336597443, "epoch": 1.5808362229084363, "grad_norm": 0.14639122784137726, "learning_rate": 4.7308860060723156e-05, "loss": 0.5108, "mean_token_accuracy": 0.8418228477239609, "num_tokens": 548388715.0, "step": 17182 }, { "entropy": 0.537041618488729, "epoch": 1.5809282292798776, "grad_norm": 0.15005461871623993, "learning_rate": 4.730579323458154e-05, "loss": 0.5178, "mean_token_accuracy": 0.8382411226630211, "num_tokens": 548419652.0, "step": 17183 }, { "entropy": 0.6002835687249899, "epoch": 1.581020235651319, "grad_norm": 0.15915514528751373, "learning_rate": 4.7302726408439905e-05, "loss": 0.5876, "mean_token_accuracy": 0.8202528357505798, "num_tokens": 548451395.0, "step": 17184 }, { "entropy": 0.7428519893437624, "epoch": 1.5811122420227601, "grad_norm": 0.16262929141521454, "learning_rate": 4.729965958229829e-05, "loss": 0.7349, "mean_token_accuracy": 0.7777785696089268, "num_tokens": 548483688.0, "step": 17185 }, { "entropy": 0.44899845961481333, "epoch": 1.5812042483942013, "grad_norm": 0.14255528151988983, "learning_rate": 4.7296592756156655e-05, "loss": 0.4363, "mean_token_accuracy": 0.862346526235342, "num_tokens": 548515350.0, "step": 17186 }, { "entropy": 0.5480848886072636, "epoch": 1.5812962547656424, "grad_norm": 0.14695818722248077, "learning_rate": 4.729352593001503e-05, "loss": 0.552, "mean_token_accuracy": 0.827464085072279, "num_tokens": 548547718.0, "step": 17187 }, { "entropy": 0.627758314833045, "epoch": 1.5813882611370838, "grad_norm": 0.15370965003967285, "learning_rate": 4.7290459103873404e-05, "loss": 0.6252, "mean_token_accuracy": 0.8086415752768517, "num_tokens": 548579618.0, "step": 17188 }, { "entropy": 0.6671025697141886, "epoch": 1.581480267508525, "grad_norm": 0.1543537676334381, "learning_rate": 4.728739227773178e-05, "loss": 0.667, "mean_token_accuracy": 0.7984829545021057, "num_tokens": 548611618.0, "step": 17189 }, { "entropy": 0.6315167341381311, "epoch": 1.5815722738799662, "grad_norm": 0.1594032347202301, "learning_rate": 4.728432545159015e-05, "loss": 0.6205, "mean_token_accuracy": 0.8026236295700073, "num_tokens": 548643851.0, "step": 17190 }, { "entropy": 0.6095159146934748, "epoch": 1.5816642802514074, "grad_norm": 0.15292364358901978, "learning_rate": 4.728125862544853e-05, "loss": 0.6033, "mean_token_accuracy": 0.8167394548654556, "num_tokens": 548675627.0, "step": 17191 }, { "entropy": 0.6323738279752433, "epoch": 1.5817562866228485, "grad_norm": 0.15809431672096252, "learning_rate": 4.7278191799306896e-05, "loss": 0.6149, "mean_token_accuracy": 0.8100833147764206, "num_tokens": 548707688.0, "step": 17192 }, { "entropy": 0.544045967515558, "epoch": 1.5818482929942899, "grad_norm": 0.1472608745098114, "learning_rate": 4.727512497316528e-05, "loss": 0.5217, "mean_token_accuracy": 0.8393196240067482, "num_tokens": 548739314.0, "step": 17193 }, { "entropy": 0.5705924723297358, "epoch": 1.5819402993657312, "grad_norm": 0.15503531694412231, "learning_rate": 4.7272058147023645e-05, "loss": 0.5418, "mean_token_accuracy": 0.8325949274003506, "num_tokens": 548771059.0, "step": 17194 }, { "entropy": 0.6420497884973884, "epoch": 1.5820323057371724, "grad_norm": 0.15600767731666565, "learning_rate": 4.726899132088202e-05, "loss": 0.6343, "mean_token_accuracy": 0.802443478256464, "num_tokens": 548802681.0, "step": 17195 }, { "entropy": 0.6875431779772043, "epoch": 1.5821243121086135, "grad_norm": 0.16178005933761597, "learning_rate": 4.7265924494740394e-05, "loss": 0.6823, "mean_token_accuracy": 0.7918109744787216, "num_tokens": 548834761.0, "step": 17196 }, { "entropy": 0.6364830294623971, "epoch": 1.5822163184800546, "grad_norm": 0.15671581029891968, "learning_rate": 4.726285766859877e-05, "loss": 0.6201, "mean_token_accuracy": 0.8069938533008099, "num_tokens": 548866852.0, "step": 17197 }, { "entropy": 0.5081106210127473, "epoch": 1.582308324851496, "grad_norm": 0.14226911962032318, "learning_rate": 4.7259790842457144e-05, "loss": 0.4924, "mean_token_accuracy": 0.847493764013052, "num_tokens": 548898757.0, "step": 17198 }, { "entropy": 0.6233567483723164, "epoch": 1.5824003312229373, "grad_norm": 0.1547093391418457, "learning_rate": 4.725672401631552e-05, "loss": 0.6005, "mean_token_accuracy": 0.8154957294464111, "num_tokens": 548931170.0, "step": 17199 }, { "entropy": 0.6385440360754728, "epoch": 1.5824923375943785, "grad_norm": 0.15307117998600006, "learning_rate": 4.7253657190173886e-05, "loss": 0.6287, "mean_token_accuracy": 0.8073010146617889, "num_tokens": 548962587.0, "step": 17200 }, { "entropy": 0.540330246090889, "epoch": 1.5825843439658196, "grad_norm": 0.15837565064430237, "learning_rate": 4.725059036403227e-05, "loss": 0.5239, "mean_token_accuracy": 0.8364821821451187, "num_tokens": 548993264.0, "step": 17201 }, { "entropy": 0.5848226491361856, "epoch": 1.5826763503372607, "grad_norm": 0.1589815616607666, "learning_rate": 4.7247523537890635e-05, "loss": 0.5699, "mean_token_accuracy": 0.8249616324901581, "num_tokens": 549024897.0, "step": 17202 }, { "entropy": 0.6029954515397549, "epoch": 1.582768356708702, "grad_norm": 0.15680259466171265, "learning_rate": 4.724445671174901e-05, "loss": 0.589, "mean_token_accuracy": 0.8176603429019451, "num_tokens": 549056989.0, "step": 17203 }, { "entropy": 0.6277605094946921, "epoch": 1.5828603630801434, "grad_norm": 0.159760519862175, "learning_rate": 4.7241389885607385e-05, "loss": 0.6115, "mean_token_accuracy": 0.8137124888598919, "num_tokens": 549089193.0, "step": 17204 }, { "entropy": 0.6538015846163034, "epoch": 1.5829523694515846, "grad_norm": 0.1674542874097824, "learning_rate": 4.723832305946576e-05, "loss": 0.6541, "mean_token_accuracy": 0.8011259734630585, "num_tokens": 549120935.0, "step": 17205 }, { "entropy": 0.5382857890799642, "epoch": 1.5830443758230257, "grad_norm": 0.1626414954662323, "learning_rate": 4.723525623332414e-05, "loss": 0.5331, "mean_token_accuracy": 0.8359395228326321, "num_tokens": 549152692.0, "step": 17206 }, { "entropy": 0.750809321179986, "epoch": 1.5831363821944668, "grad_norm": 0.16542673110961914, "learning_rate": 4.723218940718251e-05, "loss": 0.7461, "mean_token_accuracy": 0.7740796953439713, "num_tokens": 549184378.0, "step": 17207 }, { "entropy": 0.5714062452316284, "epoch": 1.5832283885659082, "grad_norm": 0.16111581027507782, "learning_rate": 4.722912258104088e-05, "loss": 0.5713, "mean_token_accuracy": 0.8240353949368, "num_tokens": 549214879.0, "step": 17208 }, { "entropy": 0.57699572481215, "epoch": 1.5833203949373496, "grad_norm": 0.15801195800304413, "learning_rate": 4.722605575489926e-05, "loss": 0.5763, "mean_token_accuracy": 0.8221567794680595, "num_tokens": 549247040.0, "step": 17209 }, { "entropy": 0.5350518662016839, "epoch": 1.5834124013087907, "grad_norm": 0.15347115695476532, "learning_rate": 4.722298892875763e-05, "loss": 0.5324, "mean_token_accuracy": 0.839922621846199, "num_tokens": 549279232.0, "step": 17210 }, { "entropy": 0.5055956924334168, "epoch": 1.5835044076802318, "grad_norm": 0.14051887392997742, "learning_rate": 4.721992210261601e-05, "loss": 0.4956, "mean_token_accuracy": 0.8463623523712158, "num_tokens": 549311942.0, "step": 17211 }, { "entropy": 0.662161267362535, "epoch": 1.583596414051673, "grad_norm": 0.15621881186962128, "learning_rate": 4.721685527647438e-05, "loss": 0.6438, "mean_token_accuracy": 0.8042758777737617, "num_tokens": 549344050.0, "step": 17212 }, { "entropy": 0.5788511577993631, "epoch": 1.5836884204231143, "grad_norm": 0.15280002355575562, "learning_rate": 4.721378845033275e-05, "loss": 0.563, "mean_token_accuracy": 0.8275604248046875, "num_tokens": 549375551.0, "step": 17213 }, { "entropy": 0.68495640065521, "epoch": 1.5837804267945557, "grad_norm": 0.15471190214157104, "learning_rate": 4.721072162419113e-05, "loss": 0.6647, "mean_token_accuracy": 0.7960507795214653, "num_tokens": 549407191.0, "step": 17214 }, { "entropy": 0.6706165550276637, "epoch": 1.5838724331659968, "grad_norm": 0.15801195800304413, "learning_rate": 4.72076547980495e-05, "loss": 0.663, "mean_token_accuracy": 0.7962225787341595, "num_tokens": 549439416.0, "step": 17215 }, { "entropy": 0.556857792660594, "epoch": 1.583964439537438, "grad_norm": 0.1522272378206253, "learning_rate": 4.7204587971907874e-05, "loss": 0.5379, "mean_token_accuracy": 0.8313604146242142, "num_tokens": 549471748.0, "step": 17216 }, { "entropy": 0.7490406259894371, "epoch": 1.584056445908879, "grad_norm": 0.16492301225662231, "learning_rate": 4.720152114576625e-05, "loss": 0.7449, "mean_token_accuracy": 0.7768629677593708, "num_tokens": 549503903.0, "step": 17217 }, { "entropy": 0.6866011787205935, "epoch": 1.5841484522803204, "grad_norm": 0.15574538707733154, "learning_rate": 4.719845431962462e-05, "loss": 0.6667, "mean_token_accuracy": 0.7956314161419868, "num_tokens": 549535788.0, "step": 17218 }, { "entropy": 0.5577317951247096, "epoch": 1.5842404586517618, "grad_norm": 0.14592969417572021, "learning_rate": 4.7195387493483e-05, "loss": 0.5372, "mean_token_accuracy": 0.8388761952519417, "num_tokens": 549568488.0, "step": 17219 }, { "entropy": 0.6205584993585944, "epoch": 1.584332465023203, "grad_norm": 0.1500846892595291, "learning_rate": 4.719232066734137e-05, "loss": 0.6085, "mean_token_accuracy": 0.8141405694186687, "num_tokens": 549600925.0, "step": 17220 }, { "entropy": 0.5884916903451085, "epoch": 1.584424471394644, "grad_norm": 0.16235704720020294, "learning_rate": 4.718925384119974e-05, "loss": 0.5844, "mean_token_accuracy": 0.8219817355275154, "num_tokens": 549632533.0, "step": 17221 }, { "entropy": 0.6136264503002167, "epoch": 1.5845164777660852, "grad_norm": 0.1491910219192505, "learning_rate": 4.718618701505812e-05, "loss": 0.6092, "mean_token_accuracy": 0.8097474686801434, "num_tokens": 549664818.0, "step": 17222 }, { "entropy": 0.5960055589675903, "epoch": 1.5846084841375265, "grad_norm": 0.15174320340156555, "learning_rate": 4.718312018891649e-05, "loss": 0.596, "mean_token_accuracy": 0.8157007545232773, "num_tokens": 549696720.0, "step": 17223 }, { "entropy": 0.5920317489653826, "epoch": 1.5847004905089679, "grad_norm": 0.15170149505138397, "learning_rate": 4.718005336277487e-05, "loss": 0.5762, "mean_token_accuracy": 0.8183524012565613, "num_tokens": 549727704.0, "step": 17224 }, { "entropy": 0.5446124775335193, "epoch": 1.584792496880409, "grad_norm": 0.15731076896190643, "learning_rate": 4.717698653663324e-05, "loss": 0.5324, "mean_token_accuracy": 0.8348651938140392, "num_tokens": 549759447.0, "step": 17225 }, { "entropy": 0.5376856317743659, "epoch": 1.5848845032518502, "grad_norm": 0.152279332280159, "learning_rate": 4.717391971049161e-05, "loss": 0.5273, "mean_token_accuracy": 0.836134422570467, "num_tokens": 549791612.0, "step": 17226 }, { "entropy": 0.6301244162023067, "epoch": 1.5849765096232913, "grad_norm": 0.17057976126670837, "learning_rate": 4.717085288434999e-05, "loss": 0.6273, "mean_token_accuracy": 0.8050364479422569, "num_tokens": 549822785.0, "step": 17227 }, { "entropy": 0.6994412222411484, "epoch": 1.5850685159947326, "grad_norm": 0.16319745779037476, "learning_rate": 4.716778605820836e-05, "loss": 0.6918, "mean_token_accuracy": 0.7905564978718758, "num_tokens": 549855303.0, "step": 17228 }, { "entropy": 0.6840738642495126, "epoch": 1.585160522366174, "grad_norm": 0.157151460647583, "learning_rate": 4.716471923206674e-05, "loss": 0.6713, "mean_token_accuracy": 0.7970346733927727, "num_tokens": 549887571.0, "step": 17229 }, { "entropy": 0.5831845793873072, "epoch": 1.5852525287376151, "grad_norm": 0.14794357120990753, "learning_rate": 4.716165240592511e-05, "loss": 0.569, "mean_token_accuracy": 0.8206489980220795, "num_tokens": 549919736.0, "step": 17230 }, { "entropy": 0.6409462294541299, "epoch": 1.5853445351090563, "grad_norm": 0.15290318429470062, "learning_rate": 4.715858557978348e-05, "loss": 0.6346, "mean_token_accuracy": 0.804053321480751, "num_tokens": 549952376.0, "step": 17231 }, { "entropy": 0.4909524228423834, "epoch": 1.5854365414804974, "grad_norm": 0.1469520926475525, "learning_rate": 4.715551875364186e-05, "loss": 0.4756, "mean_token_accuracy": 0.8531882651150227, "num_tokens": 549984572.0, "step": 17232 }, { "entropy": 0.6139780003577471, "epoch": 1.5855285478519388, "grad_norm": 0.15363387763500214, "learning_rate": 4.715245192750023e-05, "loss": 0.6019, "mean_token_accuracy": 0.8144874311983585, "num_tokens": 550017058.0, "step": 17233 }, { "entropy": 0.6234558783471584, "epoch": 1.58562055422338, "grad_norm": 0.15524861216545105, "learning_rate": 4.7149385101358604e-05, "loss": 0.6067, "mean_token_accuracy": 0.8150551915168762, "num_tokens": 550048602.0, "step": 17234 }, { "entropy": 0.6459231832996011, "epoch": 1.5857125605948212, "grad_norm": 0.15365895628929138, "learning_rate": 4.7146318275216985e-05, "loss": 0.6474, "mean_token_accuracy": 0.8008827194571495, "num_tokens": 550080403.0, "step": 17235 }, { "entropy": 0.5162313152104616, "epoch": 1.5858045669662624, "grad_norm": 0.14895856380462646, "learning_rate": 4.714325144907535e-05, "loss": 0.5196, "mean_token_accuracy": 0.8407998271286488, "num_tokens": 550113104.0, "step": 17236 }, { "entropy": 0.662294426932931, "epoch": 1.5858965733377035, "grad_norm": 0.15560385584831238, "learning_rate": 4.714018462293373e-05, "loss": 0.6608, "mean_token_accuracy": 0.802034754306078, "num_tokens": 550145418.0, "step": 17237 }, { "entropy": 0.5885314326733351, "epoch": 1.5859885797091449, "grad_norm": 0.14879687130451202, "learning_rate": 4.71371177967921e-05, "loss": 0.5741, "mean_token_accuracy": 0.8207731693983078, "num_tokens": 550178022.0, "step": 17238 }, { "entropy": 0.6515207188203931, "epoch": 1.5860805860805862, "grad_norm": 0.16127261519432068, "learning_rate": 4.713405097065048e-05, "loss": 0.64, "mean_token_accuracy": 0.8023936897516251, "num_tokens": 550209608.0, "step": 17239 }, { "entropy": 0.5392730655148625, "epoch": 1.5861725924520274, "grad_norm": 0.15322589874267578, "learning_rate": 4.713098414450885e-05, "loss": 0.5168, "mean_token_accuracy": 0.8409888558089733, "num_tokens": 550241747.0, "step": 17240 }, { "entropy": 0.5609770156443119, "epoch": 1.5862645988234685, "grad_norm": 0.1529446244239807, "learning_rate": 4.7127917318367226e-05, "loss": 0.5508, "mean_token_accuracy": 0.830734845250845, "num_tokens": 550274122.0, "step": 17241 }, { "entropy": 0.60217041708529, "epoch": 1.5863566051949096, "grad_norm": 0.15639027953147888, "learning_rate": 4.7124850492225594e-05, "loss": 0.5909, "mean_token_accuracy": 0.8168587200343609, "num_tokens": 550306273.0, "step": 17242 }, { "entropy": 0.5604018177837133, "epoch": 1.586448611566351, "grad_norm": 0.15163147449493408, "learning_rate": 4.7121783666083976e-05, "loss": 0.5459, "mean_token_accuracy": 0.8304190561175346, "num_tokens": 550338200.0, "step": 17243 }, { "entropy": 0.6630261484533548, "epoch": 1.5865406179377923, "grad_norm": 0.15654942393302917, "learning_rate": 4.7118716839942343e-05, "loss": 0.6525, "mean_token_accuracy": 0.7990017384290695, "num_tokens": 550370383.0, "step": 17244 }, { "entropy": 0.5996436954010278, "epoch": 1.5866326243092335, "grad_norm": 0.16125279664993286, "learning_rate": 4.7115650013800725e-05, "loss": 0.5975, "mean_token_accuracy": 0.8155657351016998, "num_tokens": 550402763.0, "step": 17245 }, { "entropy": 0.6178810866549611, "epoch": 1.5867246306806746, "grad_norm": 0.1627112627029419, "learning_rate": 4.711258318765909e-05, "loss": 0.599, "mean_token_accuracy": 0.8176997192203999, "num_tokens": 550433626.0, "step": 17246 }, { "entropy": 0.5638852615375072, "epoch": 1.5868166370521157, "grad_norm": 0.1578766256570816, "learning_rate": 4.710951636151747e-05, "loss": 0.5575, "mean_token_accuracy": 0.828500758856535, "num_tokens": 550465345.0, "step": 17247 }, { "entropy": 0.5962979970499873, "epoch": 1.586908643423557, "grad_norm": 0.16113600134849548, "learning_rate": 4.710644953537584e-05, "loss": 0.5809, "mean_token_accuracy": 0.8197517022490501, "num_tokens": 550496392.0, "step": 17248 }, { "entropy": 0.7058214694261551, "epoch": 1.5870006497949984, "grad_norm": 0.1652499884366989, "learning_rate": 4.710338270923422e-05, "loss": 0.6989, "mean_token_accuracy": 0.7899340093135834, "num_tokens": 550528034.0, "step": 17249 }, { "entropy": 0.5887055220082402, "epoch": 1.5870926561664396, "grad_norm": 0.15287108719348907, "learning_rate": 4.710031588309259e-05, "loss": 0.584, "mean_token_accuracy": 0.8192290142178535, "num_tokens": 550560285.0, "step": 17250 }, { "entropy": 0.5896537527441978, "epoch": 1.5871846625378807, "grad_norm": 0.16028954088687897, "learning_rate": 4.7097249056950966e-05, "loss": 0.593, "mean_token_accuracy": 0.8258451409637928, "num_tokens": 550592249.0, "step": 17251 }, { "entropy": 0.6136754211038351, "epoch": 1.5872766689093218, "grad_norm": 0.15454840660095215, "learning_rate": 4.7094182230809334e-05, "loss": 0.6172, "mean_token_accuracy": 0.8082726746797562, "num_tokens": 550623884.0, "step": 17252 }, { "entropy": 0.6450157668441534, "epoch": 1.5873686752807632, "grad_norm": 0.16006159782409668, "learning_rate": 4.7091115404667715e-05, "loss": 0.6423, "mean_token_accuracy": 0.8069131039083004, "num_tokens": 550655693.0, "step": 17253 }, { "entropy": 0.5651371823623776, "epoch": 1.5874606816522046, "grad_norm": 0.14800256490707397, "learning_rate": 4.708804857852608e-05, "loss": 0.5621, "mean_token_accuracy": 0.8275998160243034, "num_tokens": 550688244.0, "step": 17254 }, { "entropy": 0.5283901263028383, "epoch": 1.5875526880236457, "grad_norm": 0.154303640127182, "learning_rate": 4.708498175238446e-05, "loss": 0.5151, "mean_token_accuracy": 0.8440536260604858, "num_tokens": 550720055.0, "step": 17255 }, { "entropy": 0.6371227307245135, "epoch": 1.5876446943950868, "grad_norm": 0.16008360683918, "learning_rate": 4.708191492624283e-05, "loss": 0.6194, "mean_token_accuracy": 0.807068832218647, "num_tokens": 550752170.0, "step": 17256 }, { "entropy": 0.6753180585801601, "epoch": 1.587736700766528, "grad_norm": 0.15965324640274048, "learning_rate": 4.707884810010121e-05, "loss": 0.6735, "mean_token_accuracy": 0.7977302446961403, "num_tokens": 550784818.0, "step": 17257 }, { "entropy": 0.6486703054979444, "epoch": 1.5878287071379693, "grad_norm": 0.16003692150115967, "learning_rate": 4.707578127395958e-05, "loss": 0.6402, "mean_token_accuracy": 0.8083135820925236, "num_tokens": 550816056.0, "step": 17258 }, { "entropy": 0.5509741995483637, "epoch": 1.5879207135094107, "grad_norm": 0.14647430181503296, "learning_rate": 4.7072714447817956e-05, "loss": 0.5287, "mean_token_accuracy": 0.836028553545475, "num_tokens": 550848316.0, "step": 17259 }, { "entropy": 0.7313811052590609, "epoch": 1.5880127198808518, "grad_norm": 0.16274859011173248, "learning_rate": 4.7069647621676324e-05, "loss": 0.7253, "mean_token_accuracy": 0.7762185335159302, "num_tokens": 550880734.0, "step": 17260 }, { "entropy": 0.5992793855257332, "epoch": 1.588104726252293, "grad_norm": 0.15357574820518494, "learning_rate": 4.7066580795534706e-05, "loss": 0.5879, "mean_token_accuracy": 0.8191413395106792, "num_tokens": 550912854.0, "step": 17261 }, { "entropy": 0.6363813206553459, "epoch": 1.588196732623734, "grad_norm": 0.15664787590503693, "learning_rate": 4.7063513969393074e-05, "loss": 0.6254, "mean_token_accuracy": 0.8087003640830517, "num_tokens": 550944585.0, "step": 17262 }, { "entropy": 0.6962259151041508, "epoch": 1.5882887389951754, "grad_norm": 0.16010276973247528, "learning_rate": 4.706044714325145e-05, "loss": 0.6912, "mean_token_accuracy": 0.7898617014288902, "num_tokens": 550975915.0, "step": 17263 }, { "entropy": 0.5616347584873438, "epoch": 1.5883807453666168, "grad_norm": 0.15379948914051056, "learning_rate": 4.705738031710982e-05, "loss": 0.5315, "mean_token_accuracy": 0.8361615017056465, "num_tokens": 551007659.0, "step": 17264 }, { "entropy": 0.6712458934634924, "epoch": 1.588472751738058, "grad_norm": 0.16437719762325287, "learning_rate": 4.70543134909682e-05, "loss": 0.6584, "mean_token_accuracy": 0.801846444606781, "num_tokens": 551039203.0, "step": 17265 }, { "entropy": 0.6177470460534096, "epoch": 1.588564758109499, "grad_norm": 0.1483398675918579, "learning_rate": 4.705124666482658e-05, "loss": 0.5927, "mean_token_accuracy": 0.817857164889574, "num_tokens": 551071335.0, "step": 17266 }, { "entropy": 0.6138487420976162, "epoch": 1.5886567644809402, "grad_norm": 0.1558712124824524, "learning_rate": 4.704817983868495e-05, "loss": 0.5949, "mean_token_accuracy": 0.8167527131736279, "num_tokens": 551102875.0, "step": 17267 }, { "entropy": 0.604390730150044, "epoch": 1.5887487708523815, "grad_norm": 0.1586112231016159, "learning_rate": 4.704511301254332e-05, "loss": 0.5931, "mean_token_accuracy": 0.8178552910685539, "num_tokens": 551135225.0, "step": 17268 }, { "entropy": 0.588624058291316, "epoch": 1.5888407772238229, "grad_norm": 0.15183985233306885, "learning_rate": 4.7042046186401696e-05, "loss": 0.5839, "mean_token_accuracy": 0.8200203776359558, "num_tokens": 551166900.0, "step": 17269 }, { "entropy": 0.5790469534695148, "epoch": 1.588932783595264, "grad_norm": 0.14955031871795654, "learning_rate": 4.703897936026007e-05, "loss": 0.5686, "mean_token_accuracy": 0.8252292796969414, "num_tokens": 551198917.0, "step": 17270 }, { "entropy": 0.580485531128943, "epoch": 1.5890247899667052, "grad_norm": 0.1463015377521515, "learning_rate": 4.7035912534118445e-05, "loss": 0.5686, "mean_token_accuracy": 0.8223413228988647, "num_tokens": 551231354.0, "step": 17271 }, { "entropy": 0.5469827931374311, "epoch": 1.5891167963381463, "grad_norm": 0.1477474719285965, "learning_rate": 4.703284570797682e-05, "loss": 0.5311, "mean_token_accuracy": 0.8386106230318546, "num_tokens": 551264087.0, "step": 17272 }, { "entropy": 0.7104151956737041, "epoch": 1.5892088027095876, "grad_norm": 0.16337423026561737, "learning_rate": 4.702977888183519e-05, "loss": 0.694, "mean_token_accuracy": 0.7885334976017475, "num_tokens": 551295986.0, "step": 17273 }, { "entropy": 0.6901795826852322, "epoch": 1.589300809081029, "grad_norm": 0.16533319652080536, "learning_rate": 4.702671205569357e-05, "loss": 0.6938, "mean_token_accuracy": 0.7883811704814434, "num_tokens": 551328448.0, "step": 17274 }, { "entropy": 0.751216234639287, "epoch": 1.5893928154524701, "grad_norm": 0.16602833569049835, "learning_rate": 4.702364522955194e-05, "loss": 0.7472, "mean_token_accuracy": 0.7709835171699524, "num_tokens": 551360527.0, "step": 17275 }, { "entropy": 0.6028240267187357, "epoch": 1.5894848218239113, "grad_norm": 0.1609295755624771, "learning_rate": 4.702057840341031e-05, "loss": 0.5971, "mean_token_accuracy": 0.8172751106321812, "num_tokens": 551391432.0, "step": 17276 }, { "entropy": 0.6351351868361235, "epoch": 1.5895768281953524, "grad_norm": 0.15911827981472015, "learning_rate": 4.7017511577268686e-05, "loss": 0.6369, "mean_token_accuracy": 0.8095726035535336, "num_tokens": 551423454.0, "step": 17277 }, { "entropy": 0.5703206807374954, "epoch": 1.5896688345667938, "grad_norm": 0.1537005752325058, "learning_rate": 4.701444475112706e-05, "loss": 0.5721, "mean_token_accuracy": 0.8251103088259697, "num_tokens": 551454950.0, "step": 17278 }, { "entropy": 0.5044965464621782, "epoch": 1.589760840938235, "grad_norm": 0.1505553275346756, "learning_rate": 4.7011377924985436e-05, "loss": 0.4975, "mean_token_accuracy": 0.8477720208466053, "num_tokens": 551486902.0, "step": 17279 }, { "entropy": 0.6661854749545455, "epoch": 1.5898528473096762, "grad_norm": 0.1586749106645584, "learning_rate": 4.700831109884381e-05, "loss": 0.6549, "mean_token_accuracy": 0.7995399720966816, "num_tokens": 551518699.0, "step": 17280 }, { "entropy": 0.5203749854117632, "epoch": 1.5899448536811174, "grad_norm": 0.15002048015594482, "learning_rate": 4.700524427270218e-05, "loss": 0.5, "mean_token_accuracy": 0.8449756875634193, "num_tokens": 551549873.0, "step": 17281 }, { "entropy": 0.6114677125588059, "epoch": 1.5900368600525585, "grad_norm": 0.1618233025074005, "learning_rate": 4.700217744656056e-05, "loss": 0.6043, "mean_token_accuracy": 0.813486073166132, "num_tokens": 551581673.0, "step": 17282 }, { "entropy": 0.5824228087440133, "epoch": 1.5901288664239999, "grad_norm": 0.16011349856853485, "learning_rate": 4.699911062041893e-05, "loss": 0.568, "mean_token_accuracy": 0.8278033696115017, "num_tokens": 551613710.0, "step": 17283 }, { "entropy": 0.6371847558766603, "epoch": 1.5902208727954412, "grad_norm": 0.1632065773010254, "learning_rate": 4.699604379427731e-05, "loss": 0.6344, "mean_token_accuracy": 0.805861659348011, "num_tokens": 551645656.0, "step": 17284 }, { "entropy": 0.6152529455721378, "epoch": 1.5903128791668824, "grad_norm": 0.1633043736219406, "learning_rate": 4.699297696813568e-05, "loss": 0.6075, "mean_token_accuracy": 0.8151079639792442, "num_tokens": 551677591.0, "step": 17285 }, { "entropy": 0.6570737045258284, "epoch": 1.5904048855383235, "grad_norm": 0.1527007818222046, "learning_rate": 4.698991014199405e-05, "loss": 0.6484, "mean_token_accuracy": 0.803346149623394, "num_tokens": 551709179.0, "step": 17286 }, { "entropy": 0.4886588007211685, "epoch": 1.5904968919097646, "grad_norm": 0.14598815143108368, "learning_rate": 4.6986843315852426e-05, "loss": 0.4703, "mean_token_accuracy": 0.8524528741836548, "num_tokens": 551740623.0, "step": 17287 }, { "entropy": 0.49873096588999033, "epoch": 1.590588898281206, "grad_norm": 0.14676067233085632, "learning_rate": 4.69837764897108e-05, "loss": 0.481, "mean_token_accuracy": 0.8532067537307739, "num_tokens": 551772938.0, "step": 17288 }, { "entropy": 0.5998070668429136, "epoch": 1.5906809046526473, "grad_norm": 0.1517818123102188, "learning_rate": 4.6980709663569175e-05, "loss": 0.5838, "mean_token_accuracy": 0.8179526589810848, "num_tokens": 551804963.0, "step": 17289 }, { "entropy": 0.5808638706803322, "epoch": 1.5907729110240885, "grad_norm": 0.15512380003929138, "learning_rate": 4.697764283742755e-05, "loss": 0.583, "mean_token_accuracy": 0.8209508210420609, "num_tokens": 551836946.0, "step": 17290 }, { "entropy": 0.6079311668872833, "epoch": 1.5908649173955296, "grad_norm": 0.15314830839633942, "learning_rate": 4.697457601128592e-05, "loss": 0.602, "mean_token_accuracy": 0.8154666312038898, "num_tokens": 551868358.0, "step": 17291 }, { "entropy": 0.5560766793787479, "epoch": 1.5909569237669707, "grad_norm": 0.15331916511058807, "learning_rate": 4.69715091851443e-05, "loss": 0.5437, "mean_token_accuracy": 0.830791499465704, "num_tokens": 551900031.0, "step": 17292 }, { "entropy": 0.6265639625489712, "epoch": 1.591048930138412, "grad_norm": 0.15612289309501648, "learning_rate": 4.696844235900267e-05, "loss": 0.6122, "mean_token_accuracy": 0.8095423169434071, "num_tokens": 551932528.0, "step": 17293 }, { "entropy": 0.5418840693309903, "epoch": 1.5911409365098534, "grad_norm": 0.15064223110675812, "learning_rate": 4.696537553286104e-05, "loss": 0.5266, "mean_token_accuracy": 0.8343319781124592, "num_tokens": 551963866.0, "step": 17294 }, { "entropy": 0.6492280755192041, "epoch": 1.5912329428812946, "grad_norm": 0.15549112856388092, "learning_rate": 4.6962308706719417e-05, "loss": 0.644, "mean_token_accuracy": 0.8050264157354832, "num_tokens": 551996448.0, "step": 17295 }, { "entropy": 0.6018771585077047, "epoch": 1.5913249492527357, "grad_norm": 0.15851108729839325, "learning_rate": 4.695924188057779e-05, "loss": 0.6007, "mean_token_accuracy": 0.8155762664973736, "num_tokens": 552028188.0, "step": 17296 }, { "entropy": 0.6163225779309869, "epoch": 1.5914169556241768, "grad_norm": 0.15719611942768097, "learning_rate": 4.6956175054436166e-05, "loss": 0.6019, "mean_token_accuracy": 0.8149137236177921, "num_tokens": 552059390.0, "step": 17297 }, { "entropy": 0.6732851676642895, "epoch": 1.5915089619956182, "grad_norm": 0.16010160744190216, "learning_rate": 4.695310822829454e-05, "loss": 0.6668, "mean_token_accuracy": 0.7957071289420128, "num_tokens": 552091079.0, "step": 17298 }, { "entropy": 0.616686801193282, "epoch": 1.5916009683670596, "grad_norm": 0.15954215824604034, "learning_rate": 4.6950041402152915e-05, "loss": 0.6139, "mean_token_accuracy": 0.8136047460138798, "num_tokens": 552123222.0, "step": 17299 }, { "entropy": 0.6276923306286335, "epoch": 1.5916929747385007, "grad_norm": 0.16188260912895203, "learning_rate": 4.694697457601129e-05, "loss": 0.6182, "mean_token_accuracy": 0.8074701987206936, "num_tokens": 552155045.0, "step": 17300 }, { "entropy": 0.5704368501901627, "epoch": 1.5917849811099418, "grad_norm": 0.14957940578460693, "learning_rate": 4.6943907749869664e-05, "loss": 0.5647, "mean_token_accuracy": 0.8258426897227764, "num_tokens": 552187813.0, "step": 17301 }, { "entropy": 0.7001447593793273, "epoch": 1.591876987481383, "grad_norm": 0.16497576236724854, "learning_rate": 4.694084092372803e-05, "loss": 0.6904, "mean_token_accuracy": 0.7913804724812508, "num_tokens": 552219810.0, "step": 17302 }, { "entropy": 0.5588367627933621, "epoch": 1.5919689938528243, "grad_norm": 0.15012028813362122, "learning_rate": 4.6937774097586414e-05, "loss": 0.5422, "mean_token_accuracy": 0.8337580375373363, "num_tokens": 552252080.0, "step": 17303 }, { "entropy": 0.6399114951491356, "epoch": 1.5920610002242657, "grad_norm": 0.1560550183057785, "learning_rate": 4.693470727144478e-05, "loss": 0.6255, "mean_token_accuracy": 0.8058739490807056, "num_tokens": 552283127.0, "step": 17304 }, { "entropy": 0.5859512630850077, "epoch": 1.5921530065957068, "grad_norm": 0.14936354756355286, "learning_rate": 4.693164044530316e-05, "loss": 0.5684, "mean_token_accuracy": 0.824503980576992, "num_tokens": 552315258.0, "step": 17305 }, { "entropy": 0.5989923607558012, "epoch": 1.592245012967148, "grad_norm": 0.15759685635566711, "learning_rate": 4.692857361916153e-05, "loss": 0.5874, "mean_token_accuracy": 0.8223132155835629, "num_tokens": 552346886.0, "step": 17306 }, { "entropy": 0.5741000380367041, "epoch": 1.592337019338589, "grad_norm": 0.15495355427265167, "learning_rate": 4.6925506793019906e-05, "loss": 0.5658, "mean_token_accuracy": 0.8271766789257526, "num_tokens": 552378727.0, "step": 17307 }, { "entropy": 0.6923017147928476, "epoch": 1.5924290257100304, "grad_norm": 0.1670246720314026, "learning_rate": 4.692243996687828e-05, "loss": 0.6859, "mean_token_accuracy": 0.7910178601741791, "num_tokens": 552409715.0, "step": 17308 }, { "entropy": 0.6254730094224215, "epoch": 1.5925210320814718, "grad_norm": 0.15375085175037384, "learning_rate": 4.6919373140736655e-05, "loss": 0.6215, "mean_token_accuracy": 0.808133639395237, "num_tokens": 552441787.0, "step": 17309 }, { "entropy": 0.6858981437981129, "epoch": 1.592613038452913, "grad_norm": 0.1632765829563141, "learning_rate": 4.691630631459503e-05, "loss": 0.6779, "mean_token_accuracy": 0.7927988432347775, "num_tokens": 552473278.0, "step": 17310 }, { "entropy": 0.5817203763872385, "epoch": 1.592705044824354, "grad_norm": 0.14824102818965912, "learning_rate": 4.6913239488453404e-05, "loss": 0.567, "mean_token_accuracy": 0.8246191516518593, "num_tokens": 552505354.0, "step": 17311 }, { "entropy": 0.6088007632642984, "epoch": 1.5927970511957952, "grad_norm": 0.15529367327690125, "learning_rate": 4.691017266231177e-05, "loss": 0.5912, "mean_token_accuracy": 0.8190714605152607, "num_tokens": 552537065.0, "step": 17312 }, { "entropy": 0.6852185260504484, "epoch": 1.5928890575672365, "grad_norm": 0.15820324420928955, "learning_rate": 4.6907105836170153e-05, "loss": 0.6942, "mean_token_accuracy": 0.7883853204548359, "num_tokens": 552568280.0, "step": 17313 }, { "entropy": 0.5749502219259739, "epoch": 1.5929810639386779, "grad_norm": 0.1499762386083603, "learning_rate": 4.690403901002852e-05, "loss": 0.5467, "mean_token_accuracy": 0.8310773149132729, "num_tokens": 552600419.0, "step": 17314 }, { "entropy": 0.6743513187393546, "epoch": 1.593073070310119, "grad_norm": 0.1563340425491333, "learning_rate": 4.6900972183886896e-05, "loss": 0.6497, "mean_token_accuracy": 0.7994319051504135, "num_tokens": 552632796.0, "step": 17315 }, { "entropy": 0.5741426581516862, "epoch": 1.5931650766815602, "grad_norm": 0.1558190882205963, "learning_rate": 4.689790535774527e-05, "loss": 0.5691, "mean_token_accuracy": 0.8245677091181278, "num_tokens": 552664823.0, "step": 17316 }, { "entropy": 0.6764082461595535, "epoch": 1.5932570830530013, "grad_norm": 0.17044314742088318, "learning_rate": 4.6894838531603645e-05, "loss": 0.6768, "mean_token_accuracy": 0.7917434945702553, "num_tokens": 552696898.0, "step": 17317 }, { "entropy": 0.6795915495604277, "epoch": 1.5933490894244426, "grad_norm": 0.16298967599868774, "learning_rate": 4.689177170546202e-05, "loss": 0.6683, "mean_token_accuracy": 0.7950000874698162, "num_tokens": 552729213.0, "step": 17318 }, { "entropy": 0.6709051392972469, "epoch": 1.593441095795884, "grad_norm": 0.16085682809352875, "learning_rate": 4.6888704879320395e-05, "loss": 0.6649, "mean_token_accuracy": 0.7983705624938011, "num_tokens": 552760466.0, "step": 17319 }, { "entropy": 0.581931403838098, "epoch": 1.5935331021673251, "grad_norm": 0.15808609127998352, "learning_rate": 4.688563805317876e-05, "loss": 0.5572, "mean_token_accuracy": 0.828574176877737, "num_tokens": 552791719.0, "step": 17320 }, { "entropy": 0.660325912758708, "epoch": 1.5936251085387663, "grad_norm": 0.1593647301197052, "learning_rate": 4.6882571227037144e-05, "loss": 0.6534, "mean_token_accuracy": 0.7968180701136589, "num_tokens": 552823449.0, "step": 17321 }, { "entropy": 0.5641504023224115, "epoch": 1.5937171149102074, "grad_norm": 0.15422755479812622, "learning_rate": 4.687950440089551e-05, "loss": 0.5558, "mean_token_accuracy": 0.8300426341593266, "num_tokens": 552853614.0, "step": 17322 }, { "entropy": 0.7159838154911995, "epoch": 1.5938091212816488, "grad_norm": 0.16461056470870972, "learning_rate": 4.6876437574753886e-05, "loss": 0.7008, "mean_token_accuracy": 0.7864412404596806, "num_tokens": 552884959.0, "step": 17323 }, { "entropy": 0.6513334535993636, "epoch": 1.59390112765309, "grad_norm": 0.15887275338172913, "learning_rate": 4.687337074861226e-05, "loss": 0.6298, "mean_token_accuracy": 0.8059676587581635, "num_tokens": 552916197.0, "step": 17324 }, { "entropy": 0.6393599659204483, "epoch": 1.5939931340245312, "grad_norm": 0.1566588282585144, "learning_rate": 4.6870303922470636e-05, "loss": 0.6327, "mean_token_accuracy": 0.8097217865288258, "num_tokens": 552948584.0, "step": 17325 }, { "entropy": 0.611744724214077, "epoch": 1.5940851403959724, "grad_norm": 0.14927400648593903, "learning_rate": 4.686723709632901e-05, "loss": 0.593, "mean_token_accuracy": 0.818660344928503, "num_tokens": 552980321.0, "step": 17326 }, { "entropy": 0.7191246598958969, "epoch": 1.5941771467674135, "grad_norm": 0.16616950929164886, "learning_rate": 4.6864170270187385e-05, "loss": 0.7172, "mean_token_accuracy": 0.7857485897839069, "num_tokens": 553012385.0, "step": 17327 }, { "entropy": 0.5546397129073739, "epoch": 1.5942691531388549, "grad_norm": 0.16020987927913666, "learning_rate": 4.686110344404576e-05, "loss": 0.5378, "mean_token_accuracy": 0.832588866353035, "num_tokens": 553044338.0, "step": 17328 }, { "entropy": 0.487130175344646, "epoch": 1.5943611595102962, "grad_norm": 0.14285194873809814, "learning_rate": 4.6858036617904134e-05, "loss": 0.4671, "mean_token_accuracy": 0.8568311333656311, "num_tokens": 553076504.0, "step": 17329 }, { "entropy": 0.6549659371376038, "epoch": 1.5944531658817374, "grad_norm": 0.15642578899860382, "learning_rate": 4.685496979176251e-05, "loss": 0.6513, "mean_token_accuracy": 0.803568858653307, "num_tokens": 553108711.0, "step": 17330 }, { "entropy": 0.6695391032844782, "epoch": 1.5945451722531785, "grad_norm": 0.15802448987960815, "learning_rate": 4.6851902965620884e-05, "loss": 0.6552, "mean_token_accuracy": 0.797603253275156, "num_tokens": 553140342.0, "step": 17331 }, { "entropy": 0.5902714319527149, "epoch": 1.5946371786246196, "grad_norm": 0.1537695825099945, "learning_rate": 4.684883613947926e-05, "loss": 0.5871, "mean_token_accuracy": 0.8228741064667702, "num_tokens": 553172132.0, "step": 17332 }, { "entropy": 0.5869333776645362, "epoch": 1.594729184996061, "grad_norm": 0.15351589024066925, "learning_rate": 4.6845769313337626e-05, "loss": 0.5677, "mean_token_accuracy": 0.8212643191218376, "num_tokens": 553203499.0, "step": 17333 }, { "entropy": 0.5854882188141346, "epoch": 1.5948211913675023, "grad_norm": 0.15343625843524933, "learning_rate": 4.684270248719601e-05, "loss": 0.5824, "mean_token_accuracy": 0.817091565579176, "num_tokens": 553235270.0, "step": 17334 }, { "entropy": 0.6043896060436964, "epoch": 1.5949131977389435, "grad_norm": 0.15523186326026917, "learning_rate": 4.6839635661054375e-05, "loss": 0.5945, "mean_token_accuracy": 0.8197827972471714, "num_tokens": 553266699.0, "step": 17335 }, { "entropy": 0.557685773819685, "epoch": 1.5950052041103846, "grad_norm": 0.14470359683036804, "learning_rate": 4.683656883491275e-05, "loss": 0.544, "mean_token_accuracy": 0.8319027572870255, "num_tokens": 553299128.0, "step": 17336 }, { "entropy": 0.6527090482413769, "epoch": 1.5950972104818257, "grad_norm": 0.16196905076503754, "learning_rate": 4.6833502008771125e-05, "loss": 0.6396, "mean_token_accuracy": 0.8024529851973057, "num_tokens": 553330388.0, "step": 17337 }, { "entropy": 0.6705875135958195, "epoch": 1.595189216853267, "grad_norm": 0.16555774211883545, "learning_rate": 4.68304351826295e-05, "loss": 0.6608, "mean_token_accuracy": 0.7986540831625462, "num_tokens": 553362745.0, "step": 17338 }, { "entropy": 0.6184958070516586, "epoch": 1.5952812232247084, "grad_norm": 0.15874934196472168, "learning_rate": 4.6827368356487874e-05, "loss": 0.6159, "mean_token_accuracy": 0.8150686696171761, "num_tokens": 553394795.0, "step": 17339 }, { "entropy": 0.6948220878839493, "epoch": 1.5953732295961496, "grad_norm": 0.1616954505443573, "learning_rate": 4.682430153034625e-05, "loss": 0.6859, "mean_token_accuracy": 0.7942549139261246, "num_tokens": 553426882.0, "step": 17340 }, { "entropy": 0.5420425441116095, "epoch": 1.5954652359675907, "grad_norm": 0.15503790974617004, "learning_rate": 4.6821234704204616e-05, "loss": 0.5269, "mean_token_accuracy": 0.8360644392669201, "num_tokens": 553459213.0, "step": 17341 }, { "entropy": 0.7408944517374039, "epoch": 1.5955572423390318, "grad_norm": 0.1665981411933899, "learning_rate": 4.6818167878063e-05, "loss": 0.7229, "mean_token_accuracy": 0.7790061384439468, "num_tokens": 553490463.0, "step": 17342 }, { "entropy": 0.5049485606141388, "epoch": 1.5956492487104732, "grad_norm": 0.15327543020248413, "learning_rate": 4.6815101051921366e-05, "loss": 0.4907, "mean_token_accuracy": 0.8464972339570522, "num_tokens": 553521488.0, "step": 17343 }, { "entropy": 0.5328005936462432, "epoch": 1.5957412550819146, "grad_norm": 0.1496233195066452, "learning_rate": 4.681203422577975e-05, "loss": 0.5223, "mean_token_accuracy": 0.8394538052380085, "num_tokens": 553553927.0, "step": 17344 }, { "entropy": 0.5977550968527794, "epoch": 1.5958332614533557, "grad_norm": 0.16349059343338013, "learning_rate": 4.6808967399638115e-05, "loss": 0.5819, "mean_token_accuracy": 0.8209315948188305, "num_tokens": 553586615.0, "step": 17345 }, { "entropy": 0.6393994428217411, "epoch": 1.5959252678247968, "grad_norm": 0.15965870022773743, "learning_rate": 4.680590057349649e-05, "loss": 0.6258, "mean_token_accuracy": 0.8081825524568558, "num_tokens": 553618814.0, "step": 17346 }, { "entropy": 0.6184785850346088, "epoch": 1.596017274196238, "grad_norm": 0.1573093682527542, "learning_rate": 4.6802833747354864e-05, "loss": 0.6141, "mean_token_accuracy": 0.8113559223711491, "num_tokens": 553650149.0, "step": 17347 }, { "entropy": 0.43015290703624487, "epoch": 1.5961092805676793, "grad_norm": 0.14686349034309387, "learning_rate": 4.679976692121324e-05, "loss": 0.4103, "mean_token_accuracy": 0.870822586119175, "num_tokens": 553681860.0, "step": 17348 }, { "entropy": 0.7295316904783249, "epoch": 1.5962012869391207, "grad_norm": 0.16114556789398193, "learning_rate": 4.6796700095071614e-05, "loss": 0.716, "mean_token_accuracy": 0.7789799384772778, "num_tokens": 553714275.0, "step": 17349 }, { "entropy": 0.6360704991966486, "epoch": 1.5962932933105618, "grad_norm": 0.15841488540172577, "learning_rate": 4.679363326892999e-05, "loss": 0.6193, "mean_token_accuracy": 0.8087552934885025, "num_tokens": 553745966.0, "step": 17350 }, { "entropy": 0.6363892648369074, "epoch": 1.596385299682003, "grad_norm": 0.16327886283397675, "learning_rate": 4.6790566442788356e-05, "loss": 0.6091, "mean_token_accuracy": 0.8091661147773266, "num_tokens": 553777762.0, "step": 17351 }, { "entropy": 0.5341871734708548, "epoch": 1.596477306053444, "grad_norm": 0.15065963566303253, "learning_rate": 4.678749961664674e-05, "loss": 0.5199, "mean_token_accuracy": 0.8372554630041122, "num_tokens": 553810198.0, "step": 17352 }, { "entropy": 0.6156328627839684, "epoch": 1.5965693124248854, "grad_norm": 0.15573406219482422, "learning_rate": 4.6784432790505105e-05, "loss": 0.6083, "mean_token_accuracy": 0.8146674558520317, "num_tokens": 553842346.0, "step": 17353 }, { "entropy": 0.6341654844582081, "epoch": 1.5966613187963268, "grad_norm": 0.15608395636081696, "learning_rate": 4.678136596436348e-05, "loss": 0.6245, "mean_token_accuracy": 0.8111165016889572, "num_tokens": 553873561.0, "step": 17354 }, { "entropy": 0.6129954988136888, "epoch": 1.596753325167768, "grad_norm": 0.15097665786743164, "learning_rate": 4.6778299138221855e-05, "loss": 0.6004, "mean_token_accuracy": 0.8188612051308155, "num_tokens": 553904985.0, "step": 17355 }, { "entropy": 0.6525896023958921, "epoch": 1.596845331539209, "grad_norm": 0.1562524139881134, "learning_rate": 4.677523231208023e-05, "loss": 0.6434, "mean_token_accuracy": 0.8014295995235443, "num_tokens": 553937577.0, "step": 17356 }, { "entropy": 0.6953767659142613, "epoch": 1.5969373379106502, "grad_norm": 0.15795747935771942, "learning_rate": 4.6772165485938604e-05, "loss": 0.6895, "mean_token_accuracy": 0.7938313968479633, "num_tokens": 553969693.0, "step": 17357 }, { "entropy": 0.5596385090611875, "epoch": 1.5970293442820915, "grad_norm": 0.15870392322540283, "learning_rate": 4.676909865979698e-05, "loss": 0.5563, "mean_token_accuracy": 0.827978502959013, "num_tokens": 554001551.0, "step": 17358 }, { "entropy": 0.6633436139672995, "epoch": 1.597121350653533, "grad_norm": 0.16186195611953735, "learning_rate": 4.676603183365535e-05, "loss": 0.6528, "mean_token_accuracy": 0.8003555461764336, "num_tokens": 554032801.0, "step": 17359 }, { "entropy": 0.780376885086298, "epoch": 1.597213357024974, "grad_norm": 0.1656826287508011, "learning_rate": 4.676296500751373e-05, "loss": 0.7813, "mean_token_accuracy": 0.7677910290658474, "num_tokens": 554065140.0, "step": 17360 }, { "entropy": 0.7011492177844048, "epoch": 1.5973053633964152, "grad_norm": 0.15487182140350342, "learning_rate": 4.67598981813721e-05, "loss": 0.695, "mean_token_accuracy": 0.7892970778048038, "num_tokens": 554097692.0, "step": 17361 }, { "entropy": 0.6676167491823435, "epoch": 1.5973973697678563, "grad_norm": 0.15522554516792297, "learning_rate": 4.675683135523047e-05, "loss": 0.6607, "mean_token_accuracy": 0.7987304702401161, "num_tokens": 554130373.0, "step": 17362 }, { "entropy": 0.5643365134019405, "epoch": 1.5974893761392976, "grad_norm": 0.14554692804813385, "learning_rate": 4.675376452908885e-05, "loss": 0.5511, "mean_token_accuracy": 0.8322933465242386, "num_tokens": 554162634.0, "step": 17363 }, { "entropy": 0.6483741868287325, "epoch": 1.597581382510739, "grad_norm": 0.15696200728416443, "learning_rate": 4.675069770294722e-05, "loss": 0.6391, "mean_token_accuracy": 0.8084573708474636, "num_tokens": 554194041.0, "step": 17364 }, { "entropy": 0.5763349067419767, "epoch": 1.5976733888821801, "grad_norm": 0.1469612717628479, "learning_rate": 4.67476308768056e-05, "loss": 0.5591, "mean_token_accuracy": 0.8250813260674477, "num_tokens": 554225780.0, "step": 17365 }, { "entropy": 0.5674100443720818, "epoch": 1.5977653952536213, "grad_norm": 0.15638798475265503, "learning_rate": 4.674456405066397e-05, "loss": 0.5438, "mean_token_accuracy": 0.8301015198230743, "num_tokens": 554256131.0, "step": 17366 }, { "entropy": 0.6860989220440388, "epoch": 1.5978574016250624, "grad_norm": 0.16196322441101074, "learning_rate": 4.6741497224522344e-05, "loss": 0.6788, "mean_token_accuracy": 0.7921440713107586, "num_tokens": 554288015.0, "step": 17367 }, { "entropy": 0.6732331775128841, "epoch": 1.5979494079965038, "grad_norm": 0.17033794522285461, "learning_rate": 4.673843039838072e-05, "loss": 0.6798, "mean_token_accuracy": 0.7956615798175335, "num_tokens": 554319012.0, "step": 17368 }, { "entropy": 0.5934430938214064, "epoch": 1.5980414143679451, "grad_norm": 0.15524382889270782, "learning_rate": 4.673536357223909e-05, "loss": 0.5841, "mean_token_accuracy": 0.8233371302485466, "num_tokens": 554351544.0, "step": 17369 }, { "entropy": 0.6707937149330974, "epoch": 1.5981334207393862, "grad_norm": 0.1583922654390335, "learning_rate": 4.673229674609747e-05, "loss": 0.6659, "mean_token_accuracy": 0.8008548952639103, "num_tokens": 554383622.0, "step": 17370 }, { "entropy": 0.6520941406488419, "epoch": 1.5982254271108274, "grad_norm": 0.15357105433940887, "learning_rate": 4.672922991995584e-05, "loss": 0.6488, "mean_token_accuracy": 0.8021370805799961, "num_tokens": 554415317.0, "step": 17371 }, { "entropy": 0.5562971495091915, "epoch": 1.5983174334822685, "grad_norm": 0.1588454246520996, "learning_rate": 4.672616309381421e-05, "loss": 0.5349, "mean_token_accuracy": 0.8327007703483105, "num_tokens": 554446324.0, "step": 17372 }, { "entropy": 0.6313788965344429, "epoch": 1.5984094398537099, "grad_norm": 0.16209134459495544, "learning_rate": 4.672309626767259e-05, "loss": 0.6202, "mean_token_accuracy": 0.8076026923954487, "num_tokens": 554476323.0, "step": 17373 }, { "entropy": 0.5935082565993071, "epoch": 1.5985014462251512, "grad_norm": 0.15915243327617645, "learning_rate": 4.672002944153096e-05, "loss": 0.5846, "mean_token_accuracy": 0.8233541436493397, "num_tokens": 554508427.0, "step": 17374 }, { "entropy": 0.6498674266040325, "epoch": 1.5985934525965924, "grad_norm": 0.15779276192188263, "learning_rate": 4.6716962615389334e-05, "loss": 0.6366, "mean_token_accuracy": 0.8041076436638832, "num_tokens": 554540292.0, "step": 17375 }, { "entropy": 0.5639319894835353, "epoch": 1.5986854589680335, "grad_norm": 0.15314066410064697, "learning_rate": 4.671389578924771e-05, "loss": 0.5409, "mean_token_accuracy": 0.8346424959599972, "num_tokens": 554572377.0, "step": 17376 }, { "entropy": 0.618813281878829, "epoch": 1.5987774653394746, "grad_norm": 0.15886341035366058, "learning_rate": 4.6710828963106083e-05, "loss": 0.6068, "mean_token_accuracy": 0.815531849861145, "num_tokens": 554603688.0, "step": 17377 }, { "entropy": 0.5774128381162882, "epoch": 1.598869471710916, "grad_norm": 0.15727902948856354, "learning_rate": 4.670776213696446e-05, "loss": 0.5587, "mean_token_accuracy": 0.8294234946370125, "num_tokens": 554636078.0, "step": 17378 }, { "entropy": 0.5373574197292328, "epoch": 1.5989614780823573, "grad_norm": 0.14827962219715118, "learning_rate": 4.670469531082283e-05, "loss": 0.528, "mean_token_accuracy": 0.8370965234935284, "num_tokens": 554668685.0, "step": 17379 }, { "entropy": 0.64363818988204, "epoch": 1.5990534844537985, "grad_norm": 0.16230174899101257, "learning_rate": 4.67016284846812e-05, "loss": 0.6223, "mean_token_accuracy": 0.8092714622616768, "num_tokens": 554700383.0, "step": 17380 }, { "entropy": 0.7508567459881306, "epoch": 1.5991454908252396, "grad_norm": 0.16914485394954681, "learning_rate": 4.669856165853958e-05, "loss": 0.7493, "mean_token_accuracy": 0.7754619270563126, "num_tokens": 554732560.0, "step": 17381 }, { "entropy": 0.5424686577171087, "epoch": 1.5992374971966807, "grad_norm": 0.14770469069480896, "learning_rate": 4.669549483239795e-05, "loss": 0.522, "mean_token_accuracy": 0.8400966711342335, "num_tokens": 554764693.0, "step": 17382 }, { "entropy": 0.7045532492920756, "epoch": 1.599329503568122, "grad_norm": 0.16288089752197266, "learning_rate": 4.6692428006256325e-05, "loss": 0.7071, "mean_token_accuracy": 0.7877545692026615, "num_tokens": 554797224.0, "step": 17383 }, { "entropy": 0.6958820540457964, "epoch": 1.5994215099395634, "grad_norm": 0.1637406051158905, "learning_rate": 4.66893611801147e-05, "loss": 0.6838, "mean_token_accuracy": 0.7900810539722443, "num_tokens": 554827910.0, "step": 17384 }, { "entropy": 0.5279269618913531, "epoch": 1.5995135163110046, "grad_norm": 0.14282412827014923, "learning_rate": 4.6686294353973074e-05, "loss": 0.5077, "mean_token_accuracy": 0.8403127677738667, "num_tokens": 554860342.0, "step": 17385 }, { "entropy": 0.7331554889678955, "epoch": 1.5996055226824457, "grad_norm": 0.1638190597295761, "learning_rate": 4.668322752783145e-05, "loss": 0.7274, "mean_token_accuracy": 0.7794185020029545, "num_tokens": 554892189.0, "step": 17386 }, { "entropy": 0.5877863112837076, "epoch": 1.5996975290538868, "grad_norm": 0.1552312672138214, "learning_rate": 4.668016070168982e-05, "loss": 0.5702, "mean_token_accuracy": 0.8224539496004581, "num_tokens": 554924567.0, "step": 17387 }, { "entropy": 0.5077908518724144, "epoch": 1.5997895354253282, "grad_norm": 0.14254461228847504, "learning_rate": 4.66770938755482e-05, "loss": 0.4992, "mean_token_accuracy": 0.8436728082597256, "num_tokens": 554956943.0, "step": 17388 }, { "entropy": 0.7204472813755274, "epoch": 1.5998815417967696, "grad_norm": 0.1686946004629135, "learning_rate": 4.667402704940657e-05, "loss": 0.7245, "mean_token_accuracy": 0.7798423245549202, "num_tokens": 554988852.0, "step": 17389 }, { "entropy": 0.6117822043597698, "epoch": 1.5999735481682107, "grad_norm": 0.16404588520526886, "learning_rate": 4.667096022326495e-05, "loss": 0.6078, "mean_token_accuracy": 0.8146913275122643, "num_tokens": 555020504.0, "step": 17390 }, { "entropy": 0.5573426019400358, "epoch": 1.6000655545396518, "grad_norm": 0.15084004402160645, "learning_rate": 4.666789339712332e-05, "loss": 0.5504, "mean_token_accuracy": 0.8275575339794159, "num_tokens": 555053002.0, "step": 17391 }, { "entropy": 0.5700408294796944, "epoch": 1.600157560911093, "grad_norm": 0.15526887774467468, "learning_rate": 4.6664826570981696e-05, "loss": 0.56, "mean_token_accuracy": 0.8289894945919514, "num_tokens": 555085030.0, "step": 17392 }, { "entropy": 0.574810535646975, "epoch": 1.6002495672825343, "grad_norm": 0.15959812700748444, "learning_rate": 4.6661759744840064e-05, "loss": 0.5694, "mean_token_accuracy": 0.8226217404007912, "num_tokens": 555117011.0, "step": 17393 }, { "entropy": 0.6111467089504004, "epoch": 1.6003415736539757, "grad_norm": 0.15752367675304413, "learning_rate": 4.6658692918698446e-05, "loss": 0.6094, "mean_token_accuracy": 0.814623199403286, "num_tokens": 555149486.0, "step": 17394 }, { "entropy": 0.687653646338731, "epoch": 1.6004335800254168, "grad_norm": 0.16518686711788177, "learning_rate": 4.6655626092556814e-05, "loss": 0.6808, "mean_token_accuracy": 0.793267510831356, "num_tokens": 555181298.0, "step": 17395 }, { "entropy": 0.5651208069175482, "epoch": 1.600525586396858, "grad_norm": 0.15643475949764252, "learning_rate": 4.665255926641519e-05, "loss": 0.5559, "mean_token_accuracy": 0.8288239501416683, "num_tokens": 555213473.0, "step": 17396 }, { "entropy": 0.7351449392735958, "epoch": 1.600617592768299, "grad_norm": 0.16548268496990204, "learning_rate": 4.664949244027356e-05, "loss": 0.7213, "mean_token_accuracy": 0.7808121927082539, "num_tokens": 555245434.0, "step": 17397 }, { "entropy": 0.6827635113149881, "epoch": 1.6007095991397404, "grad_norm": 0.15653863549232483, "learning_rate": 4.664642561413194e-05, "loss": 0.6667, "mean_token_accuracy": 0.7907703928649426, "num_tokens": 555276428.0, "step": 17398 }, { "entropy": 0.5464648026973009, "epoch": 1.6008016055111818, "grad_norm": 0.1542312651872635, "learning_rate": 4.664335878799031e-05, "loss": 0.5275, "mean_token_accuracy": 0.8388038799166679, "num_tokens": 555307873.0, "step": 17399 }, { "entropy": 0.6879167277365923, "epoch": 1.600893611882623, "grad_norm": 0.16209474205970764, "learning_rate": 4.664029196184869e-05, "loss": 0.6733, "mean_token_accuracy": 0.7940997704863548, "num_tokens": 555339876.0, "step": 17400 }, { "entropy": 0.5960098472423851, "epoch": 1.600985618254064, "grad_norm": 0.1486070603132248, "learning_rate": 4.6637225135707055e-05, "loss": 0.575, "mean_token_accuracy": 0.8237071521580219, "num_tokens": 555372232.0, "step": 17401 }, { "entropy": 0.6319793239235878, "epoch": 1.6010776246255052, "grad_norm": 0.1531968116760254, "learning_rate": 4.6634158309565436e-05, "loss": 0.6241, "mean_token_accuracy": 0.8111091777682304, "num_tokens": 555404620.0, "step": 17402 }, { "entropy": 0.5653302357532084, "epoch": 1.6011696309969465, "grad_norm": 0.15044227242469788, "learning_rate": 4.6631091483423804e-05, "loss": 0.5448, "mean_token_accuracy": 0.8299350999295712, "num_tokens": 555435939.0, "step": 17403 }, { "entropy": 0.6437962444033474, "epoch": 1.601261637368388, "grad_norm": 0.15396080911159515, "learning_rate": 4.6628024657282185e-05, "loss": 0.6372, "mean_token_accuracy": 0.8018505610525608, "num_tokens": 555467979.0, "step": 17404 }, { "entropy": 0.5361565034836531, "epoch": 1.601353643739829, "grad_norm": 0.14957186579704285, "learning_rate": 4.662495783114055e-05, "loss": 0.5258, "mean_token_accuracy": 0.8383483812212944, "num_tokens": 555500676.0, "step": 17405 }, { "entropy": 0.7581098861992359, "epoch": 1.6014456501112702, "grad_norm": 0.1657324731349945, "learning_rate": 4.662189100499893e-05, "loss": 0.7392, "mean_token_accuracy": 0.777847845107317, "num_tokens": 555532431.0, "step": 17406 }, { "entropy": 0.6278737708926201, "epoch": 1.6015376564827113, "grad_norm": 0.1585872620344162, "learning_rate": 4.66188241788573e-05, "loss": 0.6191, "mean_token_accuracy": 0.8102063834667206, "num_tokens": 555564412.0, "step": 17407 }, { "entropy": 0.636494911275804, "epoch": 1.6016296628541526, "grad_norm": 0.1604262888431549, "learning_rate": 4.661575735271568e-05, "loss": 0.6282, "mean_token_accuracy": 0.8080724701285362, "num_tokens": 555596166.0, "step": 17408 }, { "entropy": 0.6151054911315441, "epoch": 1.601721669225594, "grad_norm": 0.15621431171894073, "learning_rate": 4.661269052657405e-05, "loss": 0.6132, "mean_token_accuracy": 0.8134359121322632, "num_tokens": 555628039.0, "step": 17409 }, { "entropy": 0.6555610438808799, "epoch": 1.6018136755970351, "grad_norm": 0.15894602239131927, "learning_rate": 4.6609623700432427e-05, "loss": 0.6387, "mean_token_accuracy": 0.8045738376677036, "num_tokens": 555659615.0, "step": 17410 }, { "entropy": 0.5372354043647647, "epoch": 1.6019056819684763, "grad_norm": 0.1523684561252594, "learning_rate": 4.6606556874290794e-05, "loss": 0.5284, "mean_token_accuracy": 0.8377204164862633, "num_tokens": 555691238.0, "step": 17411 }, { "entropy": 0.5883991168811917, "epoch": 1.6019976883399174, "grad_norm": 0.1539577841758728, "learning_rate": 4.6603490048149176e-05, "loss": 0.5687, "mean_token_accuracy": 0.8257290758192539, "num_tokens": 555723393.0, "step": 17412 }, { "entropy": 0.5568088572472334, "epoch": 1.6020896947113588, "grad_norm": 0.15090765058994293, "learning_rate": 4.6600423222007544e-05, "loss": 0.5622, "mean_token_accuracy": 0.8300878033041954, "num_tokens": 555755900.0, "step": 17413 }, { "entropy": 0.6037592738866806, "epoch": 1.6021817010828001, "grad_norm": 0.15200965106487274, "learning_rate": 4.659735639586592e-05, "loss": 0.5988, "mean_token_accuracy": 0.8176746927201748, "num_tokens": 555788369.0, "step": 17414 }, { "entropy": 0.600107479840517, "epoch": 1.6022737074542412, "grad_norm": 0.15975329279899597, "learning_rate": 4.659428956972429e-05, "loss": 0.5777, "mean_token_accuracy": 0.8211971260607243, "num_tokens": 555819532.0, "step": 17415 }, { "entropy": 0.5849685196299106, "epoch": 1.6023657138256824, "grad_norm": 0.15122264623641968, "learning_rate": 4.659122274358267e-05, "loss": 0.5638, "mean_token_accuracy": 0.8272525891661644, "num_tokens": 555851182.0, "step": 17416 }, { "entropy": 0.4435387868434191, "epoch": 1.6024577201971235, "grad_norm": 0.14218206703662872, "learning_rate": 4.658815591744104e-05, "loss": 0.4348, "mean_token_accuracy": 0.8657281138002872, "num_tokens": 555882924.0, "step": 17417 }, { "entropy": 0.6084568463265896, "epoch": 1.6025497265685649, "grad_norm": 0.1567726731300354, "learning_rate": 4.658508909129942e-05, "loss": 0.5953, "mean_token_accuracy": 0.8159128166735172, "num_tokens": 555915427.0, "step": 17418 }, { "entropy": 0.615587342530489, "epoch": 1.6026417329400062, "grad_norm": 0.1627284437417984, "learning_rate": 4.658202226515779e-05, "loss": 0.6012, "mean_token_accuracy": 0.8148558735847473, "num_tokens": 555947486.0, "step": 17419 }, { "entropy": 0.6105477046221495, "epoch": 1.6027337393114474, "grad_norm": 0.16122952103614807, "learning_rate": 4.6578955439016166e-05, "loss": 0.5987, "mean_token_accuracy": 0.8131947480142117, "num_tokens": 555979498.0, "step": 17420 }, { "entropy": 0.671414190903306, "epoch": 1.6028257456828885, "grad_norm": 0.1613941490650177, "learning_rate": 4.657588861287454e-05, "loss": 0.674, "mean_token_accuracy": 0.7943513430655003, "num_tokens": 556011013.0, "step": 17421 }, { "entropy": 0.5290704686194658, "epoch": 1.6029177520543296, "grad_norm": 0.14482399821281433, "learning_rate": 4.657282178673291e-05, "loss": 0.5223, "mean_token_accuracy": 0.8403506018221378, "num_tokens": 556043300.0, "step": 17422 }, { "entropy": 0.6486639939248562, "epoch": 1.603009758425771, "grad_norm": 0.161046102643013, "learning_rate": 4.656975496059129e-05, "loss": 0.6463, "mean_token_accuracy": 0.8067154176533222, "num_tokens": 556075763.0, "step": 17423 }, { "entropy": 0.5796013288199902, "epoch": 1.6031017647972123, "grad_norm": 0.15155676007270813, "learning_rate": 4.656668813444966e-05, "loss": 0.5653, "mean_token_accuracy": 0.8221333436667919, "num_tokens": 556107692.0, "step": 17424 }, { "entropy": 0.6057600523345172, "epoch": 1.6031937711686535, "grad_norm": 0.15587694942951202, "learning_rate": 4.656362130830804e-05, "loss": 0.5859, "mean_token_accuracy": 0.8177054822444916, "num_tokens": 556138835.0, "step": 17425 }, { "entropy": 0.5848910305649042, "epoch": 1.6032857775400946, "grad_norm": 0.15539799630641937, "learning_rate": 4.656055448216641e-05, "loss": 0.5743, "mean_token_accuracy": 0.8194634467363358, "num_tokens": 556170980.0, "step": 17426 }, { "entropy": 0.649871401488781, "epoch": 1.6033777839115357, "grad_norm": 0.1569100171327591, "learning_rate": 4.655748765602478e-05, "loss": 0.63, "mean_token_accuracy": 0.8115618340671062, "num_tokens": 556203145.0, "step": 17427 }, { "entropy": 0.5483626648783684, "epoch": 1.603469790282977, "grad_norm": 0.15711534023284912, "learning_rate": 4.6554420829883157e-05, "loss": 0.5329, "mean_token_accuracy": 0.8366206660866737, "num_tokens": 556235913.0, "step": 17428 }, { "entropy": 0.5581258721649647, "epoch": 1.6035617966544184, "grad_norm": 0.15202729403972626, "learning_rate": 4.655135400374153e-05, "loss": 0.5449, "mean_token_accuracy": 0.829258669167757, "num_tokens": 556268393.0, "step": 17429 }, { "entropy": 0.6661475114524364, "epoch": 1.6036538030258596, "grad_norm": 0.16303324699401855, "learning_rate": 4.6548287177599906e-05, "loss": 0.6618, "mean_token_accuracy": 0.7948164455592632, "num_tokens": 556300280.0, "step": 17430 }, { "entropy": 0.6824828116223216, "epoch": 1.6037458093973007, "grad_norm": 0.1570524275302887, "learning_rate": 4.654522035145828e-05, "loss": 0.6653, "mean_token_accuracy": 0.7967737689614296, "num_tokens": 556332365.0, "step": 17431 }, { "entropy": 0.547926114872098, "epoch": 1.6038378157687418, "grad_norm": 0.14455169439315796, "learning_rate": 4.654215352531665e-05, "loss": 0.528, "mean_token_accuracy": 0.8394347801804543, "num_tokens": 556364090.0, "step": 17432 }, { "entropy": 0.6645328244194388, "epoch": 1.6039298221401832, "grad_norm": 0.15387599170207977, "learning_rate": 4.653908669917503e-05, "loss": 0.6574, "mean_token_accuracy": 0.8025646843016148, "num_tokens": 556396556.0, "step": 17433 }, { "entropy": 0.6274789907038212, "epoch": 1.6040218285116246, "grad_norm": 0.15589235723018646, "learning_rate": 4.65360198730334e-05, "loss": 0.6099, "mean_token_accuracy": 0.8096941858530045, "num_tokens": 556428306.0, "step": 17434 }, { "entropy": 0.5404412157367915, "epoch": 1.6041138348830657, "grad_norm": 0.1478751003742218, "learning_rate": 4.653295304689177e-05, "loss": 0.5303, "mean_token_accuracy": 0.834822703152895, "num_tokens": 556460326.0, "step": 17435 }, { "entropy": 0.6228210553526878, "epoch": 1.6042058412545068, "grad_norm": 0.15058965981006622, "learning_rate": 4.652988622075015e-05, "loss": 0.6167, "mean_token_accuracy": 0.8127839714288712, "num_tokens": 556492759.0, "step": 17436 }, { "entropy": 0.794783828780055, "epoch": 1.604297847625948, "grad_norm": 0.1716737300157547, "learning_rate": 4.652681939460852e-05, "loss": 0.8048, "mean_token_accuracy": 0.761423759162426, "num_tokens": 556524508.0, "step": 17437 }, { "entropy": 0.5969148147851229, "epoch": 1.6043898539973893, "grad_norm": 0.156156986951828, "learning_rate": 4.6523752568466896e-05, "loss": 0.5901, "mean_token_accuracy": 0.819124486297369, "num_tokens": 556556956.0, "step": 17438 }, { "entropy": 0.5971282087266445, "epoch": 1.6044818603688307, "grad_norm": 0.15142226219177246, "learning_rate": 4.652068574232527e-05, "loss": 0.5901, "mean_token_accuracy": 0.8184718079864979, "num_tokens": 556588667.0, "step": 17439 }, { "entropy": 0.5793345812708139, "epoch": 1.6045738667402718, "grad_norm": 0.15572476387023926, "learning_rate": 4.651761891618364e-05, "loss": 0.5684, "mean_token_accuracy": 0.8198249414563179, "num_tokens": 556619972.0, "step": 17440 }, { "entropy": 0.5413028057664633, "epoch": 1.604665873111713, "grad_norm": 0.15477487444877625, "learning_rate": 4.651455209004202e-05, "loss": 0.5334, "mean_token_accuracy": 0.8383471481502056, "num_tokens": 556651696.0, "step": 17441 }, { "entropy": 0.7071652319282293, "epoch": 1.604757879483154, "grad_norm": 0.1640888899564743, "learning_rate": 4.651148526390039e-05, "loss": 0.7047, "mean_token_accuracy": 0.787962406873703, "num_tokens": 556682889.0, "step": 17442 }, { "entropy": 0.6674027424305677, "epoch": 1.6048498858545954, "grad_norm": 0.1584145724773407, "learning_rate": 4.650841843775877e-05, "loss": 0.6538, "mean_token_accuracy": 0.7966838851571083, "num_tokens": 556715103.0, "step": 17443 }, { "entropy": 0.640647891908884, "epoch": 1.6049418922260368, "grad_norm": 0.1618005782365799, "learning_rate": 4.650535161161714e-05, "loss": 0.6439, "mean_token_accuracy": 0.8096354007720947, "num_tokens": 556747437.0, "step": 17444 }, { "entropy": 0.6254130452871323, "epoch": 1.605033898597478, "grad_norm": 0.16394010186195374, "learning_rate": 4.650228478547551e-05, "loss": 0.6094, "mean_token_accuracy": 0.8171681985259056, "num_tokens": 556779934.0, "step": 17445 }, { "entropy": 0.5843552174046636, "epoch": 1.605125904968919, "grad_norm": 0.15193124115467072, "learning_rate": 4.649921795933389e-05, "loss": 0.5693, "mean_token_accuracy": 0.8259908817708492, "num_tokens": 556811580.0, "step": 17446 }, { "entropy": 0.5829885406419635, "epoch": 1.6052179113403602, "grad_norm": 0.15165944397449493, "learning_rate": 4.649615113319226e-05, "loss": 0.5796, "mean_token_accuracy": 0.8211876265704632, "num_tokens": 556843789.0, "step": 17447 }, { "entropy": 0.6426444966346025, "epoch": 1.6053099177118015, "grad_norm": 0.15892678499221802, "learning_rate": 4.6493084307050636e-05, "loss": 0.6264, "mean_token_accuracy": 0.804452657699585, "num_tokens": 556874785.0, "step": 17448 }, { "entropy": 0.5129110808484256, "epoch": 1.605401924083243, "grad_norm": 0.1461961567401886, "learning_rate": 4.649001748090901e-05, "loss": 0.5013, "mean_token_accuracy": 0.8482327535748482, "num_tokens": 556906913.0, "step": 17449 }, { "entropy": 0.5772253791801631, "epoch": 1.605493930454684, "grad_norm": 0.14994966983795166, "learning_rate": 4.6486950654767385e-05, "loss": 0.5728, "mean_token_accuracy": 0.8233412057161331, "num_tokens": 556938653.0, "step": 17450 }, { "entropy": 0.49010048247873783, "epoch": 1.6055859368261252, "grad_norm": 0.1524031162261963, "learning_rate": 4.648388382862576e-05, "loss": 0.4728, "mean_token_accuracy": 0.8537222184240818, "num_tokens": 556970658.0, "step": 17451 }, { "entropy": 0.6341253221035004, "epoch": 1.6056779431975663, "grad_norm": 0.15570513904094696, "learning_rate": 4.6480817002484135e-05, "loss": 0.6264, "mean_token_accuracy": 0.8096006810665131, "num_tokens": 557003270.0, "step": 17452 }, { "entropy": 0.713491638423875, "epoch": 1.6057699495690076, "grad_norm": 0.15812475979328156, "learning_rate": 4.64777501763425e-05, "loss": 0.7016, "mean_token_accuracy": 0.791439950466156, "num_tokens": 557035752.0, "step": 17453 }, { "entropy": 0.6111651225946844, "epoch": 1.605861955940449, "grad_norm": 0.1522684246301651, "learning_rate": 4.6474683350200884e-05, "loss": 0.5878, "mean_token_accuracy": 0.8188711628317833, "num_tokens": 557067110.0, "step": 17454 }, { "entropy": 0.6213798928074539, "epoch": 1.6059539623118901, "grad_norm": 0.16955551505088806, "learning_rate": 4.647161652405925e-05, "loss": 0.6119, "mean_token_accuracy": 0.8159720115363598, "num_tokens": 557098807.0, "step": 17455 }, { "entropy": 0.6594769228249788, "epoch": 1.6060459686833313, "grad_norm": 0.1582072526216507, "learning_rate": 4.6468549697917626e-05, "loss": 0.6481, "mean_token_accuracy": 0.8025893457233906, "num_tokens": 557130450.0, "step": 17456 }, { "entropy": 0.6449019815772772, "epoch": 1.6061379750547724, "grad_norm": 0.1489245593547821, "learning_rate": 4.6465482871776e-05, "loss": 0.6317, "mean_token_accuracy": 0.8076993264257908, "num_tokens": 557162969.0, "step": 17457 }, { "entropy": 0.6178886978887022, "epoch": 1.6062299814262138, "grad_norm": 0.15414166450500488, "learning_rate": 4.6462416045634376e-05, "loss": 0.6139, "mean_token_accuracy": 0.8163226507604122, "num_tokens": 557195401.0, "step": 17458 }, { "entropy": 0.6194975851103663, "epoch": 1.6063219877976551, "grad_norm": 0.1522343009710312, "learning_rate": 4.645934921949275e-05, "loss": 0.6007, "mean_token_accuracy": 0.8134279623627663, "num_tokens": 557226972.0, "step": 17459 }, { "entropy": 0.4852743800729513, "epoch": 1.6064139941690962, "grad_norm": 0.14357870817184448, "learning_rate": 4.6456282393351125e-05, "loss": 0.4756, "mean_token_accuracy": 0.8504672273993492, "num_tokens": 557258702.0, "step": 17460 }, { "entropy": 0.6051835818216205, "epoch": 1.6065060005405374, "grad_norm": 0.1505623459815979, "learning_rate": 4.645321556720949e-05, "loss": 0.5896, "mean_token_accuracy": 0.8188775107264519, "num_tokens": 557291202.0, "step": 17461 }, { "entropy": 0.594799080863595, "epoch": 1.6065980069119785, "grad_norm": 0.16199535131454468, "learning_rate": 4.6450148741067874e-05, "loss": 0.5766, "mean_token_accuracy": 0.8216538652777672, "num_tokens": 557323402.0, "step": 17462 }, { "entropy": 0.5275127431377769, "epoch": 1.6066900132834199, "grad_norm": 0.145639106631279, "learning_rate": 4.644708191492624e-05, "loss": 0.5135, "mean_token_accuracy": 0.8415839038789272, "num_tokens": 557354715.0, "step": 17463 }, { "entropy": 0.6785784550011158, "epoch": 1.6067820196548612, "grad_norm": 0.15886768698692322, "learning_rate": 4.6444015088784624e-05, "loss": 0.6675, "mean_token_accuracy": 0.8000557720661163, "num_tokens": 557387379.0, "step": 17464 }, { "entropy": 0.5964267458766699, "epoch": 1.6068740260263024, "grad_norm": 0.14834807813167572, "learning_rate": 4.644094826264299e-05, "loss": 0.5833, "mean_token_accuracy": 0.8205602653324604, "num_tokens": 557419108.0, "step": 17465 }, { "entropy": 0.5100677702575922, "epoch": 1.6069660323977435, "grad_norm": 0.15710999071598053, "learning_rate": 4.6437881436501366e-05, "loss": 0.4966, "mean_token_accuracy": 0.8463062942028046, "num_tokens": 557450018.0, "step": 17466 }, { "entropy": 0.5690752109512687, "epoch": 1.6070580387691846, "grad_norm": 0.14697393774986267, "learning_rate": 4.643481461035974e-05, "loss": 0.556, "mean_token_accuracy": 0.8303008563816547, "num_tokens": 557482204.0, "step": 17467 }, { "entropy": 0.544894224498421, "epoch": 1.607150045140626, "grad_norm": 0.14759261906147003, "learning_rate": 4.6431747784218115e-05, "loss": 0.5393, "mean_token_accuracy": 0.8361821658909321, "num_tokens": 557514722.0, "step": 17468 }, { "entropy": 0.5918578300625086, "epoch": 1.6072420515120673, "grad_norm": 0.15623390674591064, "learning_rate": 4.642868095807649e-05, "loss": 0.5709, "mean_token_accuracy": 0.8220916427671909, "num_tokens": 557546382.0, "step": 17469 }, { "entropy": 0.5870149056427181, "epoch": 1.6073340578835085, "grad_norm": 0.1534956395626068, "learning_rate": 4.6425614131934865e-05, "loss": 0.5728, "mean_token_accuracy": 0.828751876950264, "num_tokens": 557578705.0, "step": 17470 }, { "entropy": 0.6323249647393823, "epoch": 1.6074260642549496, "grad_norm": 0.16029039025306702, "learning_rate": 4.642254730579323e-05, "loss": 0.6231, "mean_token_accuracy": 0.8105973787605762, "num_tokens": 557610963.0, "step": 17471 }, { "entropy": 0.6484651435166597, "epoch": 1.6075180706263907, "grad_norm": 0.15953095257282257, "learning_rate": 4.6419480479651614e-05, "loss": 0.6371, "mean_token_accuracy": 0.8070896156132221, "num_tokens": 557642855.0, "step": 17472 }, { "entropy": 0.5650432172697037, "epoch": 1.607610076997832, "grad_norm": 0.15001989901065826, "learning_rate": 4.641641365350998e-05, "loss": 0.5549, "mean_token_accuracy": 0.8315557613968849, "num_tokens": 557675464.0, "step": 17473 }, { "entropy": 0.5806641345843673, "epoch": 1.6077020833692734, "grad_norm": 0.15465860068798065, "learning_rate": 4.6413346827368357e-05, "loss": 0.5817, "mean_token_accuracy": 0.8198429979383945, "num_tokens": 557707627.0, "step": 17474 }, { "entropy": 0.6561975292861462, "epoch": 1.6077940897407146, "grad_norm": 0.15805912017822266, "learning_rate": 4.641028000122673e-05, "loss": 0.6467, "mean_token_accuracy": 0.8038895055651665, "num_tokens": 557739229.0, "step": 17475 }, { "entropy": 0.6511763129383326, "epoch": 1.6078860961121557, "grad_norm": 0.16354900598526, "learning_rate": 4.6407213175085106e-05, "loss": 0.6515, "mean_token_accuracy": 0.8043708875775337, "num_tokens": 557771416.0, "step": 17476 }, { "entropy": 0.5430748742073774, "epoch": 1.6079781024835968, "grad_norm": 0.15606656670570374, "learning_rate": 4.640414634894348e-05, "loss": 0.533, "mean_token_accuracy": 0.8323608376085758, "num_tokens": 557802754.0, "step": 17477 }, { "entropy": 0.6347108390182257, "epoch": 1.6080701088550382, "grad_norm": 0.16149269044399261, "learning_rate": 4.6401079522801855e-05, "loss": 0.6279, "mean_token_accuracy": 0.805280726402998, "num_tokens": 557834857.0, "step": 17478 }, { "entropy": 0.6641124337911606, "epoch": 1.6081621152264796, "grad_norm": 0.15981656312942505, "learning_rate": 4.639801269666023e-05, "loss": 0.665, "mean_token_accuracy": 0.7923991121351719, "num_tokens": 557867300.0, "step": 17479 }, { "entropy": 0.570964653044939, "epoch": 1.6082541215979207, "grad_norm": 0.16054502129554749, "learning_rate": 4.6394945870518604e-05, "loss": 0.5596, "mean_token_accuracy": 0.8284892551600933, "num_tokens": 557899852.0, "step": 17480 }, { "entropy": 0.5716898217797279, "epoch": 1.6083461279693618, "grad_norm": 0.15082310140132904, "learning_rate": 4.639187904437698e-05, "loss": 0.5784, "mean_token_accuracy": 0.823974747210741, "num_tokens": 557931320.0, "step": 17481 }, { "entropy": 0.6574204191565514, "epoch": 1.608438134340803, "grad_norm": 0.16181470453739166, "learning_rate": 4.638881221823535e-05, "loss": 0.6462, "mean_token_accuracy": 0.8020723685622215, "num_tokens": 557963432.0, "step": 17482 }, { "entropy": 0.6329269777052104, "epoch": 1.6085301407122443, "grad_norm": 0.16010206937789917, "learning_rate": 4.638574539209373e-05, "loss": 0.6102, "mean_token_accuracy": 0.8127921484410763, "num_tokens": 557995333.0, "step": 17483 }, { "entropy": 0.6005680896341801, "epoch": 1.6086221470836857, "grad_norm": 0.15104639530181885, "learning_rate": 4.6382678565952096e-05, "loss": 0.5885, "mean_token_accuracy": 0.8195523098111153, "num_tokens": 558027822.0, "step": 17484 }, { "entropy": 0.6869800835847855, "epoch": 1.6087141534551268, "grad_norm": 0.16249732673168182, "learning_rate": 4.637961173981048e-05, "loss": 0.6765, "mean_token_accuracy": 0.797555647790432, "num_tokens": 558059801.0, "step": 17485 }, { "entropy": 0.6552161718718708, "epoch": 1.608806159826568, "grad_norm": 0.16029763221740723, "learning_rate": 4.6376544913668846e-05, "loss": 0.6307, "mean_token_accuracy": 0.8060556575655937, "num_tokens": 558091076.0, "step": 17486 }, { "entropy": 0.5967641426250339, "epoch": 1.608898166198009, "grad_norm": 0.14960557222366333, "learning_rate": 4.637347808752722e-05, "loss": 0.5916, "mean_token_accuracy": 0.8201534636318684, "num_tokens": 558123439.0, "step": 17487 }, { "entropy": 0.64583929348737, "epoch": 1.6089901725694504, "grad_norm": 0.15884147584438324, "learning_rate": 4.6370411261385595e-05, "loss": 0.6449, "mean_token_accuracy": 0.8003845550119877, "num_tokens": 558155749.0, "step": 17488 }, { "entropy": 0.6280965600162745, "epoch": 1.6090821789408918, "grad_norm": 0.15392577648162842, "learning_rate": 4.636734443524397e-05, "loss": 0.6241, "mean_token_accuracy": 0.8081072941422462, "num_tokens": 558188123.0, "step": 17489 }, { "entropy": 0.5786479241214693, "epoch": 1.609174185312333, "grad_norm": 0.1558489203453064, "learning_rate": 4.6364277609102344e-05, "loss": 0.5528, "mean_token_accuracy": 0.8262701481580734, "num_tokens": 558220891.0, "step": 17490 }, { "entropy": 0.6588387470692396, "epoch": 1.609266191683774, "grad_norm": 0.15778835117816925, "learning_rate": 4.636121078296072e-05, "loss": 0.6416, "mean_token_accuracy": 0.8016809858381748, "num_tokens": 558252311.0, "step": 17491 }, { "entropy": 0.6599852899089456, "epoch": 1.6093581980552152, "grad_norm": 0.1567077338695526, "learning_rate": 4.635814395681909e-05, "loss": 0.65, "mean_token_accuracy": 0.7979404702782631, "num_tokens": 558284525.0, "step": 17492 }, { "entropy": 0.627837423235178, "epoch": 1.6094502044266565, "grad_norm": 0.1553865522146225, "learning_rate": 4.635507713067747e-05, "loss": 0.6285, "mean_token_accuracy": 0.8082710951566696, "num_tokens": 558317193.0, "step": 17493 }, { "entropy": 0.5506362249143422, "epoch": 1.609542210798098, "grad_norm": 0.1479157656431198, "learning_rate": 4.6352010304535836e-05, "loss": 0.5441, "mean_token_accuracy": 0.8364238031208515, "num_tokens": 558349754.0, "step": 17494 }, { "entropy": 0.54957598564215, "epoch": 1.609634217169539, "grad_norm": 0.15316104888916016, "learning_rate": 4.634894347839421e-05, "loss": 0.5368, "mean_token_accuracy": 0.8345811888575554, "num_tokens": 558381893.0, "step": 17495 }, { "entropy": 0.5910650547593832, "epoch": 1.6097262235409802, "grad_norm": 0.15560100972652435, "learning_rate": 4.6345876652252585e-05, "loss": 0.5786, "mean_token_accuracy": 0.8236086666584015, "num_tokens": 558414523.0, "step": 17496 }, { "entropy": 0.7003950793296099, "epoch": 1.6098182299124213, "grad_norm": 0.16313432157039642, "learning_rate": 4.634280982611096e-05, "loss": 0.6938, "mean_token_accuracy": 0.7890109829604626, "num_tokens": 558446653.0, "step": 17497 }, { "entropy": 0.571780126541853, "epoch": 1.6099102362838627, "grad_norm": 0.15879391133785248, "learning_rate": 4.6339742999969335e-05, "loss": 0.5665, "mean_token_accuracy": 0.8275970481336117, "num_tokens": 558478720.0, "step": 17498 }, { "entropy": 0.5606716237962246, "epoch": 1.610002242655304, "grad_norm": 0.14485715329647064, "learning_rate": 4.633667617382771e-05, "loss": 0.55, "mean_token_accuracy": 0.8315306752920151, "num_tokens": 558511256.0, "step": 17499 }, { "entropy": 0.6848841430619359, "epoch": 1.6100942490267451, "grad_norm": 0.16378365457057953, "learning_rate": 4.633360934768608e-05, "loss": 0.665, "mean_token_accuracy": 0.7970220297574997, "num_tokens": 558542717.0, "step": 17500 }, { "entropy": 0.5679123289883137, "epoch": 1.6101862553981863, "grad_norm": 0.15699468553066254, "learning_rate": 4.633054252154446e-05, "loss": 0.5687, "mean_token_accuracy": 0.8280131369829178, "num_tokens": 558574663.0, "step": 17501 }, { "entropy": 0.5965096019208431, "epoch": 1.6102782617696274, "grad_norm": 0.15032950043678284, "learning_rate": 4.6327475695402826e-05, "loss": 0.5834, "mean_token_accuracy": 0.8223349899053574, "num_tokens": 558606389.0, "step": 17502 }, { "entropy": 0.6647724485956132, "epoch": 1.6103702681410688, "grad_norm": 0.16016049683094025, "learning_rate": 4.632440886926121e-05, "loss": 0.6556, "mean_token_accuracy": 0.802052766084671, "num_tokens": 558637709.0, "step": 17503 }, { "entropy": 0.5832825712859631, "epoch": 1.6104622745125101, "grad_norm": 0.15975067019462585, "learning_rate": 4.6321342043119576e-05, "loss": 0.5789, "mean_token_accuracy": 0.8264950290322304, "num_tokens": 558669702.0, "step": 17504 }, { "entropy": 0.6406064331531525, "epoch": 1.6105542808839513, "grad_norm": 0.1603943109512329, "learning_rate": 4.631827521697795e-05, "loss": 0.6402, "mean_token_accuracy": 0.8029492869973183, "num_tokens": 558701497.0, "step": 17505 }, { "entropy": 0.5204739505425096, "epoch": 1.6106462872553924, "grad_norm": 0.14946255087852478, "learning_rate": 4.6315208390836325e-05, "loss": 0.5076, "mean_token_accuracy": 0.8453235700726509, "num_tokens": 558733770.0, "step": 17506 }, { "entropy": 0.6744629293680191, "epoch": 1.6107382936268335, "grad_norm": 0.15603071451187134, "learning_rate": 4.63121415646947e-05, "loss": 0.6739, "mean_token_accuracy": 0.7966865748167038, "num_tokens": 558766358.0, "step": 17507 }, { "entropy": 0.6333722285926342, "epoch": 1.6108302999982749, "grad_norm": 0.15192203223705292, "learning_rate": 4.6309074738553074e-05, "loss": 0.6272, "mean_token_accuracy": 0.8078503459692001, "num_tokens": 558798415.0, "step": 17508 }, { "entropy": 0.6967080589383841, "epoch": 1.6109223063697162, "grad_norm": 0.16515624523162842, "learning_rate": 4.630600791241145e-05, "loss": 0.6948, "mean_token_accuracy": 0.7908778339624405, "num_tokens": 558830294.0, "step": 17509 }, { "entropy": 0.5663769692182541, "epoch": 1.6110143127411574, "grad_norm": 0.1505759358406067, "learning_rate": 4.6302941086269823e-05, "loss": 0.5594, "mean_token_accuracy": 0.8287228792905807, "num_tokens": 558862458.0, "step": 17510 }, { "entropy": 0.6406414052471519, "epoch": 1.6111063191125985, "grad_norm": 0.15868613123893738, "learning_rate": 4.62998742601282e-05, "loss": 0.6253, "mean_token_accuracy": 0.8061326742172241, "num_tokens": 558893970.0, "step": 17511 }, { "entropy": 0.6959962649270892, "epoch": 1.6111983254840396, "grad_norm": 0.16180814802646637, "learning_rate": 4.629680743398657e-05, "loss": 0.6741, "mean_token_accuracy": 0.792423639446497, "num_tokens": 558925553.0, "step": 17512 }, { "entropy": 0.602536041289568, "epoch": 1.611290331855481, "grad_norm": 0.16217245161533356, "learning_rate": 4.629374060784494e-05, "loss": 0.5798, "mean_token_accuracy": 0.8197517581284046, "num_tokens": 558957351.0, "step": 17513 }, { "entropy": 0.56290627643466, "epoch": 1.6113823382269223, "grad_norm": 0.14968125522136688, "learning_rate": 4.629067378170332e-05, "loss": 0.5453, "mean_token_accuracy": 0.8277059756219387, "num_tokens": 558989498.0, "step": 17514 }, { "entropy": 0.6476096296682954, "epoch": 1.6114743445983635, "grad_norm": 0.1561359465122223, "learning_rate": 4.628760695556169e-05, "loss": 0.6229, "mean_token_accuracy": 0.8094584159553051, "num_tokens": 559021965.0, "step": 17515 }, { "entropy": 0.5732286870479584, "epoch": 1.6115663509698046, "grad_norm": 0.15795989334583282, "learning_rate": 4.6284540129420065e-05, "loss": 0.5537, "mean_token_accuracy": 0.8275236450135708, "num_tokens": 559053334.0, "step": 17516 }, { "entropy": 0.6330113164149225, "epoch": 1.6116583573412457, "grad_norm": 0.15311695635318756, "learning_rate": 4.628147330327844e-05, "loss": 0.6158, "mean_token_accuracy": 0.814426563680172, "num_tokens": 559085888.0, "step": 17517 }, { "entropy": 0.6371185760945082, "epoch": 1.611750363712687, "grad_norm": 0.15635225176811218, "learning_rate": 4.6278406477136814e-05, "loss": 0.6252, "mean_token_accuracy": 0.8065694458782673, "num_tokens": 559117766.0, "step": 17518 }, { "entropy": 0.642926805652678, "epoch": 1.6118423700841285, "grad_norm": 0.15734875202178955, "learning_rate": 4.627533965099519e-05, "loss": 0.6292, "mean_token_accuracy": 0.8071915991604328, "num_tokens": 559149944.0, "step": 17519 }, { "entropy": 0.5854745237156749, "epoch": 1.6119343764555696, "grad_norm": 0.15573275089263916, "learning_rate": 4.627227282485356e-05, "loss": 0.5753, "mean_token_accuracy": 0.8240702636539936, "num_tokens": 559182401.0, "step": 17520 }, { "entropy": 0.5835944339632988, "epoch": 1.6120263828270107, "grad_norm": 0.15242759883403778, "learning_rate": 4.626920599871193e-05, "loss": 0.5743, "mean_token_accuracy": 0.8243948146700859, "num_tokens": 559214809.0, "step": 17521 }, { "entropy": 0.7852814784273505, "epoch": 1.6121183891984519, "grad_norm": 0.17484928667545319, "learning_rate": 4.626613917257031e-05, "loss": 0.7844, "mean_token_accuracy": 0.764711894094944, "num_tokens": 559247139.0, "step": 17522 }, { "entropy": 0.6511913239955902, "epoch": 1.6122103955698932, "grad_norm": 0.15851172804832458, "learning_rate": 4.626307234642868e-05, "loss": 0.6461, "mean_token_accuracy": 0.8029165416955948, "num_tokens": 559279428.0, "step": 17523 }, { "entropy": 0.6687136236578226, "epoch": 1.6123024019413346, "grad_norm": 0.1636350452899933, "learning_rate": 4.626000552028706e-05, "loss": 0.6773, "mean_token_accuracy": 0.7959966324269772, "num_tokens": 559311246.0, "step": 17524 }, { "entropy": 0.6399038732051849, "epoch": 1.6123944083127757, "grad_norm": 0.15441475808620453, "learning_rate": 4.625693869414543e-05, "loss": 0.6282, "mean_token_accuracy": 0.8047981895506382, "num_tokens": 559343264.0, "step": 17525 }, { "entropy": 0.49871095921844244, "epoch": 1.6124864146842168, "grad_norm": 0.1494656801223755, "learning_rate": 4.6253871868003804e-05, "loss": 0.4912, "mean_token_accuracy": 0.8469885289669037, "num_tokens": 559375220.0, "step": 17526 }, { "entropy": 0.5865662824362516, "epoch": 1.612578421055658, "grad_norm": 0.1505713164806366, "learning_rate": 4.625080504186218e-05, "loss": 0.5854, "mean_token_accuracy": 0.8202890902757645, "num_tokens": 559406819.0, "step": 17527 }, { "entropy": 0.6230405988171697, "epoch": 1.6126704274270993, "grad_norm": 0.15504907071590424, "learning_rate": 4.6247738215720554e-05, "loss": 0.6161, "mean_token_accuracy": 0.8137092143297195, "num_tokens": 559438570.0, "step": 17528 }, { "entropy": 0.5751097360625863, "epoch": 1.6127624337985407, "grad_norm": 0.15065233409404755, "learning_rate": 4.624467138957893e-05, "loss": 0.5604, "mean_token_accuracy": 0.829809233546257, "num_tokens": 559470047.0, "step": 17529 }, { "entropy": 0.6681636441498995, "epoch": 1.6128544401699818, "grad_norm": 0.15925830602645874, "learning_rate": 4.62416045634373e-05, "loss": 0.646, "mean_token_accuracy": 0.8018548339605331, "num_tokens": 559500627.0, "step": 17530 }, { "entropy": 0.6163792461156845, "epoch": 1.612946446541423, "grad_norm": 0.14873066544532776, "learning_rate": 4.623853773729567e-05, "loss": 0.5965, "mean_token_accuracy": 0.8167514726519585, "num_tokens": 559532476.0, "step": 17531 }, { "entropy": 0.5722589248325676, "epoch": 1.613038452912864, "grad_norm": 0.14424502849578857, "learning_rate": 4.623547091115405e-05, "loss": 0.5548, "mean_token_accuracy": 0.8320575319230556, "num_tokens": 559565037.0, "step": 17532 }, { "entropy": 0.5407416615635157, "epoch": 1.6131304592843054, "grad_norm": 0.15339703857898712, "learning_rate": 4.623240408501242e-05, "loss": 0.5295, "mean_token_accuracy": 0.8348691761493683, "num_tokens": 559596718.0, "step": 17533 }, { "entropy": 0.6590034235268831, "epoch": 1.6132224656557468, "grad_norm": 0.1638828068971634, "learning_rate": 4.6229337258870795e-05, "loss": 0.6667, "mean_token_accuracy": 0.7961879447102547, "num_tokens": 559628251.0, "step": 17534 }, { "entropy": 0.5395421581342816, "epoch": 1.613314472027188, "grad_norm": 0.14690423011779785, "learning_rate": 4.622627043272917e-05, "loss": 0.5034, "mean_token_accuracy": 0.8437882922589779, "num_tokens": 559660347.0, "step": 17535 }, { "entropy": 0.5165337547659874, "epoch": 1.613406478398629, "grad_norm": 0.15198113024234772, "learning_rate": 4.6223203606587544e-05, "loss": 0.5022, "mean_token_accuracy": 0.8411539196968079, "num_tokens": 559692398.0, "step": 17536 }, { "entropy": 0.5724102621898055, "epoch": 1.6134984847700702, "grad_norm": 0.1555643528699875, "learning_rate": 4.622013678044592e-05, "loss": 0.567, "mean_token_accuracy": 0.8323008380830288, "num_tokens": 559723563.0, "step": 17537 }, { "entropy": 0.5906764818355441, "epoch": 1.6135904911415115, "grad_norm": 0.1553087830543518, "learning_rate": 4.621706995430429e-05, "loss": 0.5858, "mean_token_accuracy": 0.8197499439120293, "num_tokens": 559755979.0, "step": 17538 }, { "entropy": 0.7005741950124502, "epoch": 1.613682497512953, "grad_norm": 0.16842523217201233, "learning_rate": 4.621400312816266e-05, "loss": 0.6995, "mean_token_accuracy": 0.7883813716471195, "num_tokens": 559787426.0, "step": 17539 }, { "entropy": 0.5791436564177275, "epoch": 1.613774503884394, "grad_norm": 0.1532442718744278, "learning_rate": 4.621093630202104e-05, "loss": 0.5627, "mean_token_accuracy": 0.8273614645004272, "num_tokens": 559819535.0, "step": 17540 }, { "entropy": 0.5937895425595343, "epoch": 1.6138665102558352, "grad_norm": 0.1536843180656433, "learning_rate": 4.620786947587942e-05, "loss": 0.5773, "mean_token_accuracy": 0.8232925608754158, "num_tokens": 559852055.0, "step": 17541 }, { "entropy": 0.5984996967017651, "epoch": 1.6139585166272763, "grad_norm": 0.1574965864419937, "learning_rate": 4.6204802649737785e-05, "loss": 0.5922, "mean_token_accuracy": 0.815970778465271, "num_tokens": 559882994.0, "step": 17542 }, { "entropy": 0.5832142056897283, "epoch": 1.6140505229987177, "grad_norm": 0.15386104583740234, "learning_rate": 4.6201735823596167e-05, "loss": 0.5708, "mean_token_accuracy": 0.8273943103849888, "num_tokens": 559915295.0, "step": 17543 }, { "entropy": 0.6761104678735137, "epoch": 1.614142529370159, "grad_norm": 0.16535182297229767, "learning_rate": 4.6198668997454534e-05, "loss": 0.6878, "mean_token_accuracy": 0.7939346432685852, "num_tokens": 559947045.0, "step": 17544 }, { "entropy": 0.5938074104487896, "epoch": 1.6142345357416001, "grad_norm": 0.1628013402223587, "learning_rate": 4.6195602171312916e-05, "loss": 0.5787, "mean_token_accuracy": 0.8198057785630226, "num_tokens": 559977687.0, "step": 17545 }, { "entropy": 0.6433861255645752, "epoch": 1.6143265421130413, "grad_norm": 0.16068409383296967, "learning_rate": 4.6192535345171284e-05, "loss": 0.6205, "mean_token_accuracy": 0.8118277490139008, "num_tokens": 560008987.0, "step": 17546 }, { "entropy": 0.6115557886660099, "epoch": 1.6144185484844824, "grad_norm": 0.155338317155838, "learning_rate": 4.618946851902966e-05, "loss": 0.5961, "mean_token_accuracy": 0.8145620562136173, "num_tokens": 560041151.0, "step": 17547 }, { "entropy": 0.7340655876323581, "epoch": 1.6145105548559238, "grad_norm": 0.16184554994106293, "learning_rate": 4.618640169288803e-05, "loss": 0.7171, "mean_token_accuracy": 0.7796087376773357, "num_tokens": 560072312.0, "step": 17548 }, { "entropy": 0.6333396341651678, "epoch": 1.6146025612273651, "grad_norm": 0.15979379415512085, "learning_rate": 4.618333486674641e-05, "loss": 0.6188, "mean_token_accuracy": 0.8083180114626884, "num_tokens": 560104434.0, "step": 17549 }, { "entropy": 0.6328769726678729, "epoch": 1.6146945675988063, "grad_norm": 0.1582156866788864, "learning_rate": 4.618026804060478e-05, "loss": 0.639, "mean_token_accuracy": 0.8062199279665947, "num_tokens": 560136573.0, "step": 17550 }, { "entropy": 0.6108391201123595, "epoch": 1.6147865739702474, "grad_norm": 0.15996290743350983, "learning_rate": 4.617720121446316e-05, "loss": 0.6061, "mean_token_accuracy": 0.8102548606693745, "num_tokens": 560168142.0, "step": 17551 }, { "entropy": 0.5168550200760365, "epoch": 1.6148785803416885, "grad_norm": 0.14924079179763794, "learning_rate": 4.6174134388321525e-05, "loss": 0.5091, "mean_token_accuracy": 0.8403526283800602, "num_tokens": 560199257.0, "step": 17552 }, { "entropy": 0.5562458019703627, "epoch": 1.6149705867131299, "grad_norm": 0.15705187618732452, "learning_rate": 4.6171067562179906e-05, "loss": 0.5441, "mean_token_accuracy": 0.8309539593756199, "num_tokens": 560230952.0, "step": 17553 }, { "entropy": 0.4623796483501792, "epoch": 1.6150625930845712, "grad_norm": 0.14573007822036743, "learning_rate": 4.6168000736038274e-05, "loss": 0.4599, "mean_token_accuracy": 0.8576932102441788, "num_tokens": 560262671.0, "step": 17554 }, { "entropy": 0.5588565263897181, "epoch": 1.6151545994560124, "grad_norm": 0.1428855061531067, "learning_rate": 4.616493390989665e-05, "loss": 0.5496, "mean_token_accuracy": 0.8286826647818089, "num_tokens": 560294825.0, "step": 17555 }, { "entropy": 0.619672411121428, "epoch": 1.6152466058274535, "grad_norm": 0.16010800004005432, "learning_rate": 4.6161867083755023e-05, "loss": 0.6094, "mean_token_accuracy": 0.8123138584196568, "num_tokens": 560327474.0, "step": 17556 }, { "entropy": 0.5660004392266273, "epoch": 1.6153386121988946, "grad_norm": 0.15044234693050385, "learning_rate": 4.61588002576134e-05, "loss": 0.5573, "mean_token_accuracy": 0.8279813416302204, "num_tokens": 560359874.0, "step": 17557 }, { "entropy": 0.6078404518775642, "epoch": 1.615430618570336, "grad_norm": 0.15183894336223602, "learning_rate": 4.615573343147177e-05, "loss": 0.5994, "mean_token_accuracy": 0.8161401264369488, "num_tokens": 560391871.0, "step": 17558 }, { "entropy": 0.6131289228796959, "epoch": 1.6155226249417773, "grad_norm": 0.15372410416603088, "learning_rate": 4.615266660533015e-05, "loss": 0.6097, "mean_token_accuracy": 0.81446623057127, "num_tokens": 560424013.0, "step": 17559 }, { "entropy": 0.6297242064028978, "epoch": 1.6156146313132185, "grad_norm": 0.15494205057621002, "learning_rate": 4.6149599779188515e-05, "loss": 0.6316, "mean_token_accuracy": 0.8048682697117329, "num_tokens": 560456679.0, "step": 17560 }, { "entropy": 0.6294058440253139, "epoch": 1.6157066376846596, "grad_norm": 0.1588345170021057, "learning_rate": 4.61465329530469e-05, "loss": 0.6239, "mean_token_accuracy": 0.8112617135047913, "num_tokens": 560488620.0, "step": 17561 }, { "entropy": 0.5660280000884086, "epoch": 1.6157986440561007, "grad_norm": 0.14621137082576752, "learning_rate": 4.6143466126905265e-05, "loss": 0.5487, "mean_token_accuracy": 0.8296401500701904, "num_tokens": 560521171.0, "step": 17562 }, { "entropy": 0.516694406978786, "epoch": 1.615890650427542, "grad_norm": 0.1508360207080841, "learning_rate": 4.6140399300763646e-05, "loss": 0.4922, "mean_token_accuracy": 0.8464846163988113, "num_tokens": 560553077.0, "step": 17563 }, { "entropy": 0.6467911638319492, "epoch": 1.6159826567989835, "grad_norm": 0.15985579788684845, "learning_rate": 4.6137332474622014e-05, "loss": 0.6349, "mean_token_accuracy": 0.8036250323057175, "num_tokens": 560584817.0, "step": 17564 }, { "entropy": 0.4996953271329403, "epoch": 1.6160746631704246, "grad_norm": 0.14402393996715546, "learning_rate": 4.613426564848039e-05, "loss": 0.4904, "mean_token_accuracy": 0.8475804179906845, "num_tokens": 560617274.0, "step": 17565 }, { "entropy": 0.6571931298822165, "epoch": 1.6161666695418657, "grad_norm": 0.1533932089805603, "learning_rate": 4.613119882233876e-05, "loss": 0.6474, "mean_token_accuracy": 0.8021744452416897, "num_tokens": 560649484.0, "step": 17566 }, { "entropy": 0.6723258420825005, "epoch": 1.6162586759133069, "grad_norm": 0.16087652742862701, "learning_rate": 4.612813199619714e-05, "loss": 0.6573, "mean_token_accuracy": 0.7960666008293629, "num_tokens": 560680604.0, "step": 17567 }, { "entropy": 0.616443837992847, "epoch": 1.6163506822847482, "grad_norm": 0.15916845202445984, "learning_rate": 4.612506517005551e-05, "loss": 0.6013, "mean_token_accuracy": 0.8145846463739872, "num_tokens": 560711678.0, "step": 17568 }, { "entropy": 0.5209729003254324, "epoch": 1.6164426886561896, "grad_norm": 0.14694073796272278, "learning_rate": 4.612199834391389e-05, "loss": 0.5025, "mean_token_accuracy": 0.8431878350675106, "num_tokens": 560743503.0, "step": 17569 }, { "entropy": 0.6472979346290231, "epoch": 1.6165346950276307, "grad_norm": 0.1594913750886917, "learning_rate": 4.6118931517772255e-05, "loss": 0.6439, "mean_token_accuracy": 0.8047049529850483, "num_tokens": 560776208.0, "step": 17570 }, { "entropy": 0.48892561439424753, "epoch": 1.6166267013990718, "grad_norm": 0.1523415744304657, "learning_rate": 4.6115864691630636e-05, "loss": 0.4878, "mean_token_accuracy": 0.848516371101141, "num_tokens": 560808627.0, "step": 17571 }, { "entropy": 0.6196350324898958, "epoch": 1.616718707770513, "grad_norm": 0.1534002274274826, "learning_rate": 4.611279786548901e-05, "loss": 0.6135, "mean_token_accuracy": 0.8101006522774696, "num_tokens": 560840391.0, "step": 17572 }, { "entropy": 0.6543221492320299, "epoch": 1.6168107141419543, "grad_norm": 0.16506808996200562, "learning_rate": 4.610973103934738e-05, "loss": 0.6339, "mean_token_accuracy": 0.807551771402359, "num_tokens": 560871649.0, "step": 17573 }, { "entropy": 0.6129415049217641, "epoch": 1.6169027205133957, "grad_norm": 0.15747514367103577, "learning_rate": 4.610666421320576e-05, "loss": 0.6035, "mean_token_accuracy": 0.8164429739117622, "num_tokens": 560903205.0, "step": 17574 }, { "entropy": 0.549281011801213, "epoch": 1.6169947268848368, "grad_norm": 0.15251287817955017, "learning_rate": 4.610359738706413e-05, "loss": 0.5489, "mean_token_accuracy": 0.8277245536446571, "num_tokens": 560933924.0, "step": 17575 }, { "entropy": 0.6633269097656012, "epoch": 1.617086733256278, "grad_norm": 0.16066034138202667, "learning_rate": 4.61005305609225e-05, "loss": 0.655, "mean_token_accuracy": 0.7988852821290493, "num_tokens": 560965437.0, "step": 17576 }, { "entropy": 0.5526090683415532, "epoch": 1.617178739627719, "grad_norm": 0.1491652876138687, "learning_rate": 4.609746373478088e-05, "loss": 0.5308, "mean_token_accuracy": 0.8376220352947712, "num_tokens": 560997784.0, "step": 17577 }, { "entropy": 0.5539158014580607, "epoch": 1.6172707459991604, "grad_norm": 0.15159624814987183, "learning_rate": 4.609439690863925e-05, "loss": 0.5321, "mean_token_accuracy": 0.8342948108911514, "num_tokens": 561029169.0, "step": 17578 }, { "entropy": 0.6069529314991087, "epoch": 1.6173627523706018, "grad_norm": 0.16062481701374054, "learning_rate": 4.609133008249763e-05, "loss": 0.5896, "mean_token_accuracy": 0.8173455409705639, "num_tokens": 561060791.0, "step": 17579 }, { "entropy": 0.6642577284947038, "epoch": 1.617454758742043, "grad_norm": 0.1575773060321808, "learning_rate": 4.6088263256356e-05, "loss": 0.6559, "mean_token_accuracy": 0.7998754531145096, "num_tokens": 561093142.0, "step": 17580 }, { "entropy": 0.5812005717307329, "epoch": 1.617546765113484, "grad_norm": 0.1505051702260971, "learning_rate": 4.608519643021437e-05, "loss": 0.5613, "mean_token_accuracy": 0.8282398916780949, "num_tokens": 561125013.0, "step": 17581 }, { "entropy": 0.5637873148079962, "epoch": 1.6176387714849252, "grad_norm": 0.15347619354724884, "learning_rate": 4.608212960407275e-05, "loss": 0.5528, "mean_token_accuracy": 0.8269647732377052, "num_tokens": 561157418.0, "step": 17582 }, { "entropy": 0.6494222842156887, "epoch": 1.6177307778563665, "grad_norm": 0.15746520459651947, "learning_rate": 4.607906277793112e-05, "loss": 0.6349, "mean_token_accuracy": 0.8062295950949192, "num_tokens": 561189051.0, "step": 17583 }, { "entropy": 0.6028131376951933, "epoch": 1.617822784227808, "grad_norm": 0.15292824804782867, "learning_rate": 4.60759959517895e-05, "loss": 0.5968, "mean_token_accuracy": 0.8147169053554535, "num_tokens": 561221649.0, "step": 17584 }, { "entropy": 0.6506537240929902, "epoch": 1.617914790599249, "grad_norm": 0.16673143208026886, "learning_rate": 4.607292912564787e-05, "loss": 0.6414, "mean_token_accuracy": 0.8023666515946388, "num_tokens": 561252672.0, "step": 17585 }, { "entropy": 0.6916785892099142, "epoch": 1.6180067969706902, "grad_norm": 0.16218392550945282, "learning_rate": 4.606986229950624e-05, "loss": 0.6671, "mean_token_accuracy": 0.7937545962631702, "num_tokens": 561285195.0, "step": 17586 }, { "entropy": 0.6736481450498104, "epoch": 1.6180988033421313, "grad_norm": 0.15767613053321838, "learning_rate": 4.606679547336462e-05, "loss": 0.6641, "mean_token_accuracy": 0.7994914725422859, "num_tokens": 561317413.0, "step": 17587 }, { "entropy": 0.6550032328814268, "epoch": 1.6181908097135727, "grad_norm": 0.15718142688274384, "learning_rate": 4.606372864722299e-05, "loss": 0.6478, "mean_token_accuracy": 0.8019910790026188, "num_tokens": 561349494.0, "step": 17588 }, { "entropy": 0.5313377492129803, "epoch": 1.618282816085014, "grad_norm": 0.14495448768138885, "learning_rate": 4.6060661821081366e-05, "loss": 0.511, "mean_token_accuracy": 0.8389703705906868, "num_tokens": 561381790.0, "step": 17589 }, { "entropy": 0.5037620728835464, "epoch": 1.6183748224564551, "grad_norm": 0.15554504096508026, "learning_rate": 4.605759499493974e-05, "loss": 0.4772, "mean_token_accuracy": 0.8493625335395336, "num_tokens": 561413462.0, "step": 17590 }, { "entropy": 0.5507787549868226, "epoch": 1.6184668288278963, "grad_norm": 0.15222232043743134, "learning_rate": 4.605452816879811e-05, "loss": 0.5367, "mean_token_accuracy": 0.8365486152470112, "num_tokens": 561446152.0, "step": 17591 }, { "entropy": 0.5749750584363937, "epoch": 1.6185588351993374, "grad_norm": 0.15011101961135864, "learning_rate": 4.605146134265649e-05, "loss": 0.5503, "mean_token_accuracy": 0.8287843428552151, "num_tokens": 561477940.0, "step": 17592 }, { "entropy": 0.6505255699157715, "epoch": 1.6186508415707788, "grad_norm": 0.16157115995883942, "learning_rate": 4.604839451651486e-05, "loss": 0.6412, "mean_token_accuracy": 0.8059894219040871, "num_tokens": 561510468.0, "step": 17593 }, { "entropy": 0.6456192545592785, "epoch": 1.6187428479422201, "grad_norm": 0.154238760471344, "learning_rate": 4.604532769037323e-05, "loss": 0.6383, "mean_token_accuracy": 0.8023125752806664, "num_tokens": 561543171.0, "step": 17594 }, { "entropy": 0.5722297951579094, "epoch": 1.6188348543136613, "grad_norm": 0.15453898906707764, "learning_rate": 4.604226086423161e-05, "loss": 0.5731, "mean_token_accuracy": 0.8229694291949272, "num_tokens": 561575853.0, "step": 17595 }, { "entropy": 0.6720445640385151, "epoch": 1.6189268606851024, "grad_norm": 0.16358286142349243, "learning_rate": 4.603919403808998e-05, "loss": 0.6697, "mean_token_accuracy": 0.7953943312168121, "num_tokens": 561607859.0, "step": 17596 }, { "entropy": 0.6354157142341137, "epoch": 1.6190188670565435, "grad_norm": 0.16973194479942322, "learning_rate": 4.603612721194836e-05, "loss": 0.6275, "mean_token_accuracy": 0.8117069564759731, "num_tokens": 561639658.0, "step": 17597 }, { "entropy": 0.5109672551043332, "epoch": 1.6191108734279849, "grad_norm": 0.1462024599313736, "learning_rate": 4.603306038580673e-05, "loss": 0.5092, "mean_token_accuracy": 0.8404867351055145, "num_tokens": 561671387.0, "step": 17598 }, { "entropy": 0.6660945136100054, "epoch": 1.6192028797994262, "grad_norm": 0.15767288208007812, "learning_rate": 4.60299935596651e-05, "loss": 0.6582, "mean_token_accuracy": 0.8014330118894577, "num_tokens": 561702733.0, "step": 17599 }, { "entropy": 0.606036240234971, "epoch": 1.6192948861708674, "grad_norm": 0.15241001546382904, "learning_rate": 4.602692673352348e-05, "loss": 0.5971, "mean_token_accuracy": 0.8179849162697792, "num_tokens": 561735301.0, "step": 17600 }, { "entropy": 0.5860166517086327, "epoch": 1.6193868925423085, "grad_norm": 0.15821757912635803, "learning_rate": 4.6023859907381855e-05, "loss": 0.574, "mean_token_accuracy": 0.8221433982253075, "num_tokens": 561767260.0, "step": 17601 }, { "entropy": 0.6528866793960333, "epoch": 1.6194788989137496, "grad_norm": 0.16138729453086853, "learning_rate": 4.602079308124022e-05, "loss": 0.6405, "mean_token_accuracy": 0.8040642142295837, "num_tokens": 561798965.0, "step": 17602 }, { "entropy": 0.556471161544323, "epoch": 1.619570905285191, "grad_norm": 0.1551724672317505, "learning_rate": 4.6017726255098605e-05, "loss": 0.5304, "mean_token_accuracy": 0.8338987156748772, "num_tokens": 561830385.0, "step": 17603 }, { "entropy": 0.6039825426414609, "epoch": 1.6196629116566323, "grad_norm": 0.14735235273838043, "learning_rate": 4.601465942895697e-05, "loss": 0.5845, "mean_token_accuracy": 0.8233994580805302, "num_tokens": 561862986.0, "step": 17604 }, { "entropy": 0.734599694609642, "epoch": 1.6197549180280735, "grad_norm": 0.15798205137252808, "learning_rate": 4.6011592602815354e-05, "loss": 0.7201, "mean_token_accuracy": 0.7794390842318535, "num_tokens": 561894650.0, "step": 17605 }, { "entropy": 0.6530949743464589, "epoch": 1.6198469243995146, "grad_norm": 0.1568678617477417, "learning_rate": 4.600852577667372e-05, "loss": 0.6315, "mean_token_accuracy": 0.8061380349099636, "num_tokens": 561926260.0, "step": 17606 }, { "entropy": 0.565856110304594, "epoch": 1.6199389307709557, "grad_norm": 0.14764532446861267, "learning_rate": 4.6005458950532097e-05, "loss": 0.5431, "mean_token_accuracy": 0.8310247771441936, "num_tokens": 561958537.0, "step": 17607 }, { "entropy": 0.5814054068177938, "epoch": 1.620030937142397, "grad_norm": 0.14922721683979034, "learning_rate": 4.600239212439047e-05, "loss": 0.5799, "mean_token_accuracy": 0.8215662576258183, "num_tokens": 561991164.0, "step": 17608 }, { "entropy": 0.6080864961259067, "epoch": 1.6201229435138385, "grad_norm": 0.15481363236904144, "learning_rate": 4.5999325298248846e-05, "loss": 0.5949, "mean_token_accuracy": 0.8193825148046017, "num_tokens": 562023539.0, "step": 17609 }, { "entropy": 0.636718014255166, "epoch": 1.6202149498852796, "grad_norm": 0.1534159779548645, "learning_rate": 4.599625847210722e-05, "loss": 0.624, "mean_token_accuracy": 0.8051497526466846, "num_tokens": 562055842.0, "step": 17610 }, { "entropy": 0.48408601246774197, "epoch": 1.6203069562567207, "grad_norm": 0.147276371717453, "learning_rate": 4.5993191645965595e-05, "loss": 0.4771, "mean_token_accuracy": 0.8511279448866844, "num_tokens": 562088248.0, "step": 17611 }, { "entropy": 0.5890598781406879, "epoch": 1.6203989626281619, "grad_norm": 0.1577337384223938, "learning_rate": 4.599012481982396e-05, "loss": 0.5908, "mean_token_accuracy": 0.8204598911106586, "num_tokens": 562120262.0, "step": 17612 }, { "entropy": 0.5190798277035356, "epoch": 1.6204909689996032, "grad_norm": 0.14648346602916718, "learning_rate": 4.5987057993682344e-05, "loss": 0.5021, "mean_token_accuracy": 0.8443814069032669, "num_tokens": 562152309.0, "step": 17613 }, { "entropy": 0.7214558459818363, "epoch": 1.6205829753710446, "grad_norm": 0.16092762351036072, "learning_rate": 4.598399116754071e-05, "loss": 0.6984, "mean_token_accuracy": 0.7895839102566242, "num_tokens": 562183729.0, "step": 17614 }, { "entropy": 0.6119940355420113, "epoch": 1.6206749817424857, "grad_norm": 0.1560182124376297, "learning_rate": 4.598092434139909e-05, "loss": 0.6063, "mean_token_accuracy": 0.8138740658760071, "num_tokens": 562215368.0, "step": 17615 }, { "entropy": 0.6686999714002013, "epoch": 1.6207669881139268, "grad_norm": 0.15862387418746948, "learning_rate": 4.597785751525746e-05, "loss": 0.6645, "mean_token_accuracy": 0.7990272007882595, "num_tokens": 562247355.0, "step": 17616 }, { "entropy": 0.6806930070742965, "epoch": 1.620858994485368, "grad_norm": 0.1579895317554474, "learning_rate": 4.5974790689115836e-05, "loss": 0.6755, "mean_token_accuracy": 0.7966034449636936, "num_tokens": 562279318.0, "step": 17617 }, { "entropy": 0.6203882489353418, "epoch": 1.6209510008568093, "grad_norm": 0.15378892421722412, "learning_rate": 4.597172386297421e-05, "loss": 0.6048, "mean_token_accuracy": 0.8163637071847916, "num_tokens": 562311782.0, "step": 17618 }, { "entropy": 0.5995144944172353, "epoch": 1.6210430072282507, "grad_norm": 0.14346514642238617, "learning_rate": 4.5968657036832586e-05, "loss": 0.5858, "mean_token_accuracy": 0.8177515864372253, "num_tokens": 562344550.0, "step": 17619 }, { "entropy": 0.4216906900983304, "epoch": 1.6211350135996918, "grad_norm": 0.1465955227613449, "learning_rate": 4.5965590210690953e-05, "loss": 0.3955, "mean_token_accuracy": 0.8781150951981544, "num_tokens": 562376763.0, "step": 17620 }, { "entropy": 0.5718246870674193, "epoch": 1.621227019971133, "grad_norm": 0.14753830432891846, "learning_rate": 4.5962523384549335e-05, "loss": 0.5707, "mean_token_accuracy": 0.8238744921982288, "num_tokens": 562409510.0, "step": 17621 }, { "entropy": 0.6356112314388156, "epoch": 1.621319026342574, "grad_norm": 0.15597529709339142, "learning_rate": 4.59594565584077e-05, "loss": 0.6321, "mean_token_accuracy": 0.8092902824282646, "num_tokens": 562441741.0, "step": 17622 }, { "entropy": 0.6693520341068506, "epoch": 1.6214110327140154, "grad_norm": 0.16611190140247345, "learning_rate": 4.5956389732266084e-05, "loss": 0.6539, "mean_token_accuracy": 0.8031826429069042, "num_tokens": 562472949.0, "step": 17623 }, { "entropy": 0.6738807894289494, "epoch": 1.6215030390854568, "grad_norm": 0.16146741807460785, "learning_rate": 4.595332290612445e-05, "loss": 0.6677, "mean_token_accuracy": 0.8007539846003056, "num_tokens": 562505152.0, "step": 17624 }, { "entropy": 0.7371621187776327, "epoch": 1.621595045456898, "grad_norm": 0.16176508367061615, "learning_rate": 4.595025607998283e-05, "loss": 0.7374, "mean_token_accuracy": 0.7783225066959858, "num_tokens": 562537144.0, "step": 17625 }, { "entropy": 0.5657526049762964, "epoch": 1.621687051828339, "grad_norm": 0.14107589423656464, "learning_rate": 4.59471892538412e-05, "loss": 0.5529, "mean_token_accuracy": 0.8278683163225651, "num_tokens": 562569683.0, "step": 17626 }, { "entropy": 0.6343997558578849, "epoch": 1.6217790581997802, "grad_norm": 0.15867847204208374, "learning_rate": 4.5944122427699576e-05, "loss": 0.6222, "mean_token_accuracy": 0.8073475621640682, "num_tokens": 562600490.0, "step": 17627 }, { "entropy": 0.5486204959452152, "epoch": 1.6218710645712215, "grad_norm": 0.14858098328113556, "learning_rate": 4.594105560155795e-05, "loss": 0.5564, "mean_token_accuracy": 0.8274767510592937, "num_tokens": 562632432.0, "step": 17628 }, { "entropy": 0.5834578052163124, "epoch": 1.621963070942663, "grad_norm": 0.15793238580226898, "learning_rate": 4.5937988775416325e-05, "loss": 0.5757, "mean_token_accuracy": 0.8229964040219784, "num_tokens": 562664306.0, "step": 17629 }, { "entropy": 0.6678530313074589, "epoch": 1.622055077314104, "grad_norm": 0.1588418185710907, "learning_rate": 4.593492194927469e-05, "loss": 0.6711, "mean_token_accuracy": 0.7991420105099678, "num_tokens": 562696870.0, "step": 17630 }, { "entropy": 0.5696177398785949, "epoch": 1.6221470836855452, "grad_norm": 0.14766645431518555, "learning_rate": 4.5931855123133075e-05, "loss": 0.5574, "mean_token_accuracy": 0.8256295435130596, "num_tokens": 562729116.0, "step": 17631 }, { "entropy": 0.6826026327908039, "epoch": 1.6222390900569863, "grad_norm": 0.15987809002399445, "learning_rate": 4.592878829699145e-05, "loss": 0.6704, "mean_token_accuracy": 0.7951645739376545, "num_tokens": 562761740.0, "step": 17632 }, { "entropy": 0.5739548783749342, "epoch": 1.6223310964284277, "grad_norm": 0.15333665907382965, "learning_rate": 4.592572147084982e-05, "loss": 0.5515, "mean_token_accuracy": 0.828120481222868, "num_tokens": 562793105.0, "step": 17633 }, { "entropy": 0.6175371780991554, "epoch": 1.622423102799869, "grad_norm": 0.15530331432819366, "learning_rate": 4.59226546447082e-05, "loss": 0.6008, "mean_token_accuracy": 0.8153719939291477, "num_tokens": 562825052.0, "step": 17634 }, { "entropy": 0.6928404392674565, "epoch": 1.6225151091713101, "grad_norm": 0.16511346399784088, "learning_rate": 4.5919587818566566e-05, "loss": 0.6854, "mean_token_accuracy": 0.7915300652384758, "num_tokens": 562856837.0, "step": 17635 }, { "entropy": 0.6345274336636066, "epoch": 1.6226071155427513, "grad_norm": 0.14918546378612518, "learning_rate": 4.591652099242494e-05, "loss": 0.6114, "mean_token_accuracy": 0.8101187087595463, "num_tokens": 562889091.0, "step": 17636 }, { "entropy": 0.5618543687742203, "epoch": 1.6226991219141924, "grad_norm": 0.15746080875396729, "learning_rate": 4.5913454166283316e-05, "loss": 0.5364, "mean_token_accuracy": 0.8304241858422756, "num_tokens": 562920806.0, "step": 17637 }, { "entropy": 0.7598466835916042, "epoch": 1.6227911282856338, "grad_norm": 0.16220489144325256, "learning_rate": 4.591038734014169e-05, "loss": 0.7461, "mean_token_accuracy": 0.7708836682140827, "num_tokens": 562952771.0, "step": 17638 }, { "entropy": 0.5612823837436736, "epoch": 1.6228831346570751, "grad_norm": 0.15604929625988007, "learning_rate": 4.5907320514000065e-05, "loss": 0.5364, "mean_token_accuracy": 0.8331983610987663, "num_tokens": 562984754.0, "step": 17639 }, { "entropy": 0.6585187949240208, "epoch": 1.6229751410285163, "grad_norm": 0.15400755405426025, "learning_rate": 4.590425368785844e-05, "loss": 0.6515, "mean_token_accuracy": 0.8013216219842434, "num_tokens": 563017399.0, "step": 17640 }, { "entropy": 0.6228405460715294, "epoch": 1.6230671473999574, "grad_norm": 0.15416784584522247, "learning_rate": 4.590118686171681e-05, "loss": 0.6194, "mean_token_accuracy": 0.8087447732686996, "num_tokens": 563049116.0, "step": 17641 }, { "entropy": 0.6771945431828499, "epoch": 1.6231591537713985, "grad_norm": 0.1589067280292511, "learning_rate": 4.589812003557519e-05, "loss": 0.672, "mean_token_accuracy": 0.7943817935883999, "num_tokens": 563081217.0, "step": 17642 }, { "entropy": 0.5143127464689314, "epoch": 1.6232511601428399, "grad_norm": 0.1548255831003189, "learning_rate": 4.589505320943356e-05, "loss": 0.5152, "mean_token_accuracy": 0.8421720489859581, "num_tokens": 563113530.0, "step": 17643 }, { "entropy": 0.7074330057948828, "epoch": 1.6233431665142812, "grad_norm": 0.16268198192119598, "learning_rate": 4.589198638329194e-05, "loss": 0.7051, "mean_token_accuracy": 0.7862961553037167, "num_tokens": 563145349.0, "step": 17644 }, { "entropy": 0.5230715044308454, "epoch": 1.6234351728857224, "grad_norm": 0.1401727795600891, "learning_rate": 4.5888919557150306e-05, "loss": 0.5077, "mean_token_accuracy": 0.8483936935663223, "num_tokens": 563177515.0, "step": 17645 }, { "entropy": 0.5833548940718174, "epoch": 1.6235271792571635, "grad_norm": 0.15289530158042908, "learning_rate": 4.588585273100868e-05, "loss": 0.5813, "mean_token_accuracy": 0.8203197978436947, "num_tokens": 563209667.0, "step": 17646 }, { "entropy": 0.5497688283212483, "epoch": 1.6236191856286046, "grad_norm": 0.14406396448612213, "learning_rate": 4.5882785904867055e-05, "loss": 0.535, "mean_token_accuracy": 0.8331570066511631, "num_tokens": 563242074.0, "step": 17647 }, { "entropy": 0.5713912667706609, "epoch": 1.623711192000046, "grad_norm": 0.15423175692558289, "learning_rate": 4.587971907872543e-05, "loss": 0.5745, "mean_token_accuracy": 0.8247703798115253, "num_tokens": 563274479.0, "step": 17648 }, { "entropy": 0.5874504493549466, "epoch": 1.6238031983714873, "grad_norm": 0.15666832029819489, "learning_rate": 4.5876652252583805e-05, "loss": 0.5643, "mean_token_accuracy": 0.8285096809267998, "num_tokens": 563306775.0, "step": 17649 }, { "entropy": 0.5956499818712473, "epoch": 1.6238952047429285, "grad_norm": 0.15832985937595367, "learning_rate": 4.587358542644218e-05, "loss": 0.5881, "mean_token_accuracy": 0.8175435066223145, "num_tokens": 563338290.0, "step": 17650 }, { "entropy": 0.5543025992810726, "epoch": 1.6239872111143696, "grad_norm": 0.15460754930973053, "learning_rate": 4.587051860030055e-05, "loss": 0.535, "mean_token_accuracy": 0.8324840255081654, "num_tokens": 563370523.0, "step": 17651 }, { "entropy": 0.5629763398319483, "epoch": 1.6240792174858107, "grad_norm": 0.15317487716674805, "learning_rate": 4.586745177415893e-05, "loss": 0.5565, "mean_token_accuracy": 0.8274426460266113, "num_tokens": 563402539.0, "step": 17652 }, { "entropy": 0.7582437358796597, "epoch": 1.624171223857252, "grad_norm": 0.16917933523654938, "learning_rate": 4.5864384948017296e-05, "loss": 0.7475, "mean_token_accuracy": 0.7756477780640125, "num_tokens": 563433848.0, "step": 17653 }, { "entropy": 0.5388970449566841, "epoch": 1.6242632302286935, "grad_norm": 0.157659113407135, "learning_rate": 4.586131812187567e-05, "loss": 0.5265, "mean_token_accuracy": 0.8393608406186104, "num_tokens": 563465859.0, "step": 17654 }, { "entropy": 0.5339662004262209, "epoch": 1.6243552366001346, "grad_norm": 0.152385413646698, "learning_rate": 4.5858251295734046e-05, "loss": 0.5159, "mean_token_accuracy": 0.8386702388525009, "num_tokens": 563498173.0, "step": 17655 }, { "entropy": 0.5243678651750088, "epoch": 1.6244472429715757, "grad_norm": 0.14253799617290497, "learning_rate": 4.585518446959242e-05, "loss": 0.5053, "mean_token_accuracy": 0.8406244739890099, "num_tokens": 563530163.0, "step": 17656 }, { "entropy": 0.5919871018268168, "epoch": 1.6245392493430169, "grad_norm": 0.15301775932312012, "learning_rate": 4.5852117643450795e-05, "loss": 0.5779, "mean_token_accuracy": 0.8225881569087505, "num_tokens": 563562759.0, "step": 17657 }, { "entropy": 0.6050185495987535, "epoch": 1.6246312557144582, "grad_norm": 0.15466831624507904, "learning_rate": 4.584905081730917e-05, "loss": 0.5972, "mean_token_accuracy": 0.8203265927731991, "num_tokens": 563594729.0, "step": 17658 }, { "entropy": 0.5794617682695389, "epoch": 1.6247232620858996, "grad_norm": 0.15113410353660583, "learning_rate": 4.584598399116754e-05, "loss": 0.5741, "mean_token_accuracy": 0.8217495009303093, "num_tokens": 563626021.0, "step": 17659 }, { "entropy": 0.6139328358694911, "epoch": 1.6248152684573407, "grad_norm": 0.15298758447170258, "learning_rate": 4.584291716502592e-05, "loss": 0.5882, "mean_token_accuracy": 0.8163884580135345, "num_tokens": 563658209.0, "step": 17660 }, { "entropy": 0.6089153904467821, "epoch": 1.6249072748287818, "grad_norm": 0.1578344702720642, "learning_rate": 4.583985033888429e-05, "loss": 0.6116, "mean_token_accuracy": 0.8106761090457439, "num_tokens": 563690320.0, "step": 17661 }, { "entropy": 0.6173359211534262, "epoch": 1.624999281200223, "grad_norm": 0.1549990177154541, "learning_rate": 4.583678351274266e-05, "loss": 0.615, "mean_token_accuracy": 0.8095545545220375, "num_tokens": 563722577.0, "step": 17662 }, { "entropy": 0.5849922075867653, "epoch": 1.6250912875716643, "grad_norm": 0.1489308476448059, "learning_rate": 4.583371668660104e-05, "loss": 0.5798, "mean_token_accuracy": 0.8206691108644009, "num_tokens": 563754372.0, "step": 17663 }, { "entropy": 0.6270868205465376, "epoch": 1.6251832939431057, "grad_norm": 0.1558988243341446, "learning_rate": 4.583064986045941e-05, "loss": 0.6259, "mean_token_accuracy": 0.8089127019047737, "num_tokens": 563785937.0, "step": 17664 }, { "entropy": 0.5787683655507863, "epoch": 1.6252753003145468, "grad_norm": 0.15214379131793976, "learning_rate": 4.582758303431779e-05, "loss": 0.5795, "mean_token_accuracy": 0.821601752191782, "num_tokens": 563817520.0, "step": 17665 }, { "entropy": 0.5457033955026418, "epoch": 1.625367306685988, "grad_norm": 0.14614084362983704, "learning_rate": 4.582451620817616e-05, "loss": 0.5359, "mean_token_accuracy": 0.8339305743575096, "num_tokens": 563849321.0, "step": 17666 }, { "entropy": 0.5933140907436609, "epoch": 1.625459313057429, "grad_norm": 0.15046155452728271, "learning_rate": 4.5821449382034535e-05, "loss": 0.5858, "mean_token_accuracy": 0.8206638917326927, "num_tokens": 563881769.0, "step": 17667 }, { "entropy": 0.5900199189782143, "epoch": 1.6255513194288704, "grad_norm": 0.15145346522331238, "learning_rate": 4.581838255589291e-05, "loss": 0.5737, "mean_token_accuracy": 0.8235291875898838, "num_tokens": 563914052.0, "step": 17668 }, { "entropy": 0.5507936752401292, "epoch": 1.6256433258003118, "grad_norm": 0.15655308961868286, "learning_rate": 4.5815315729751284e-05, "loss": 0.5397, "mean_token_accuracy": 0.8350730389356613, "num_tokens": 563946155.0, "step": 17669 }, { "entropy": 0.6542985234409571, "epoch": 1.625735332171753, "grad_norm": 0.16398899257183075, "learning_rate": 4.581224890360966e-05, "loss": 0.6396, "mean_token_accuracy": 0.8033582009375095, "num_tokens": 563977806.0, "step": 17670 }, { "entropy": 0.5916280625388026, "epoch": 1.625827338543194, "grad_norm": 0.15359823405742645, "learning_rate": 4.580918207746803e-05, "loss": 0.5892, "mean_token_accuracy": 0.820200502872467, "num_tokens": 564009964.0, "step": 17671 }, { "entropy": 0.6262435596436262, "epoch": 1.6259193449146352, "grad_norm": 0.15996752679347992, "learning_rate": 4.58061152513264e-05, "loss": 0.6077, "mean_token_accuracy": 0.8130194246768951, "num_tokens": 564042156.0, "step": 17672 }, { "entropy": 0.6193608674220741, "epoch": 1.6260113512860765, "grad_norm": 0.15443067252635956, "learning_rate": 4.580304842518478e-05, "loss": 0.597, "mean_token_accuracy": 0.8184283785521984, "num_tokens": 564073897.0, "step": 17673 }, { "entropy": 0.5564071331173182, "epoch": 1.626103357657518, "grad_norm": 0.1510579138994217, "learning_rate": 4.579998159904315e-05, "loss": 0.5425, "mean_token_accuracy": 0.8313402868807316, "num_tokens": 564106372.0, "step": 17674 }, { "entropy": 0.6169271692633629, "epoch": 1.626195364028959, "grad_norm": 0.16139031946659088, "learning_rate": 4.5796914772901525e-05, "loss": 0.6015, "mean_token_accuracy": 0.8176755867898464, "num_tokens": 564138333.0, "step": 17675 }, { "entropy": 0.7070359364151955, "epoch": 1.6262873704004002, "grad_norm": 0.16985167562961578, "learning_rate": 4.57938479467599e-05, "loss": 0.6957, "mean_token_accuracy": 0.786908321082592, "num_tokens": 564170435.0, "step": 17676 }, { "entropy": 0.5347176259383559, "epoch": 1.6263793767718413, "grad_norm": 0.14944179356098175, "learning_rate": 4.5790781120618274e-05, "loss": 0.5264, "mean_token_accuracy": 0.8376003839075565, "num_tokens": 564202318.0, "step": 17677 }, { "entropy": 0.605217857286334, "epoch": 1.6264713831432827, "grad_norm": 0.15487545728683472, "learning_rate": 4.578771429447665e-05, "loss": 0.6015, "mean_token_accuracy": 0.8167965821921825, "num_tokens": 564234940.0, "step": 17678 }, { "entropy": 0.7166769374161959, "epoch": 1.626563389514724, "grad_norm": 0.16216430068016052, "learning_rate": 4.5784647468335024e-05, "loss": 0.7105, "mean_token_accuracy": 0.779553335160017, "num_tokens": 564266584.0, "step": 17679 }, { "entropy": 0.47070576529949903, "epoch": 1.6266553958861651, "grad_norm": 0.14424802362918854, "learning_rate": 4.578158064219339e-05, "loss": 0.4502, "mean_token_accuracy": 0.857589490711689, "num_tokens": 564298679.0, "step": 17680 }, { "entropy": 0.6333659775555134, "epoch": 1.6267474022576063, "grad_norm": 0.15668438374996185, "learning_rate": 4.577851381605177e-05, "loss": 0.6362, "mean_token_accuracy": 0.8059347569942474, "num_tokens": 564330051.0, "step": 17681 }, { "entropy": 0.5756493741646409, "epoch": 1.6268394086290474, "grad_norm": 0.15599721670150757, "learning_rate": 4.577544698991014e-05, "loss": 0.5761, "mean_token_accuracy": 0.8214837796986103, "num_tokens": 564362263.0, "step": 17682 }, { "entropy": 0.5726744495332241, "epoch": 1.6269314150004888, "grad_norm": 0.1535663902759552, "learning_rate": 4.577238016376852e-05, "loss": 0.5627, "mean_token_accuracy": 0.8299490809440613, "num_tokens": 564394219.0, "step": 17683 }, { "entropy": 0.5064241923391819, "epoch": 1.6270234213719301, "grad_norm": 0.14625124633312225, "learning_rate": 4.576931333762689e-05, "loss": 0.4951, "mean_token_accuracy": 0.8482900224626064, "num_tokens": 564426012.0, "step": 17684 }, { "entropy": 0.6130437031388283, "epoch": 1.6271154277433713, "grad_norm": 0.16093900799751282, "learning_rate": 4.5766246511485265e-05, "loss": 0.6071, "mean_token_accuracy": 0.8158838450908661, "num_tokens": 564456374.0, "step": 17685 }, { "entropy": 0.6166143855080009, "epoch": 1.6272074341148124, "grad_norm": 0.1607324182987213, "learning_rate": 4.576317968534364e-05, "loss": 0.6189, "mean_token_accuracy": 0.8111753389239311, "num_tokens": 564488374.0, "step": 17686 }, { "entropy": 0.6506353747099638, "epoch": 1.6272994404862535, "grad_norm": 0.15715819597244263, "learning_rate": 4.5760112859202014e-05, "loss": 0.6476, "mean_token_accuracy": 0.7984244041144848, "num_tokens": 564520505.0, "step": 17687 }, { "entropy": 0.5635434444993734, "epoch": 1.6273914468576949, "grad_norm": 0.15274780988693237, "learning_rate": 4.575704603306039e-05, "loss": 0.5584, "mean_token_accuracy": 0.8271752446889877, "num_tokens": 564552589.0, "step": 17688 }, { "entropy": 0.5832740366458893, "epoch": 1.6274834532291362, "grad_norm": 0.16407296061515808, "learning_rate": 4.5753979206918763e-05, "loss": 0.5719, "mean_token_accuracy": 0.8264477849006653, "num_tokens": 564584696.0, "step": 17689 }, { "entropy": 0.6481256382539868, "epoch": 1.6275754596005774, "grad_norm": 0.15632404386997223, "learning_rate": 4.575091238077713e-05, "loss": 0.6417, "mean_token_accuracy": 0.8031194284558296, "num_tokens": 564616987.0, "step": 17690 }, { "entropy": 0.6063327994197607, "epoch": 1.6276674659720185, "grad_norm": 0.16098788380622864, "learning_rate": 4.574784555463551e-05, "loss": 0.5882, "mean_token_accuracy": 0.8193506486713886, "num_tokens": 564648922.0, "step": 17691 }, { "entropy": 0.5847358296159655, "epoch": 1.6277594723434596, "grad_norm": 0.1517340987920761, "learning_rate": 4.574477872849388e-05, "loss": 0.5774, "mean_token_accuracy": 0.8252099007368088, "num_tokens": 564681408.0, "step": 17692 }, { "entropy": 0.7409079503268003, "epoch": 1.627851478714901, "grad_norm": 0.1572525054216385, "learning_rate": 4.5741711902352255e-05, "loss": 0.7297, "mean_token_accuracy": 0.777902714908123, "num_tokens": 564713588.0, "step": 17693 }, { "entropy": 0.6312433984130621, "epoch": 1.6279434850863423, "grad_norm": 0.1538809835910797, "learning_rate": 4.573864507621064e-05, "loss": 0.6214, "mean_token_accuracy": 0.8086367398500443, "num_tokens": 564745482.0, "step": 17694 }, { "entropy": 0.6812398340553045, "epoch": 1.6280354914577835, "grad_norm": 0.1586005836725235, "learning_rate": 4.5735578250069005e-05, "loss": 0.6615, "mean_token_accuracy": 0.7988447733223438, "num_tokens": 564777616.0, "step": 17695 }, { "entropy": 0.5311529925093055, "epoch": 1.6281274978292246, "grad_norm": 0.1403936743736267, "learning_rate": 4.573251142392738e-05, "loss": 0.504, "mean_token_accuracy": 0.8482943177223206, "num_tokens": 564810310.0, "step": 17696 }, { "entropy": 0.6180878113955259, "epoch": 1.6282195042006657, "grad_norm": 0.15237338840961456, "learning_rate": 4.5729444597785754e-05, "loss": 0.6007, "mean_token_accuracy": 0.8187608607113361, "num_tokens": 564841263.0, "step": 17697 }, { "entropy": 0.5615589146036655, "epoch": 1.628311510572107, "grad_norm": 0.16213995218276978, "learning_rate": 4.572637777164413e-05, "loss": 0.5543, "mean_token_accuracy": 0.8287797272205353, "num_tokens": 564873057.0, "step": 17698 }, { "entropy": 0.6471722200512886, "epoch": 1.6284035169435485, "grad_norm": 0.15311653912067413, "learning_rate": 4.57233109455025e-05, "loss": 0.6295, "mean_token_accuracy": 0.8057138882577419, "num_tokens": 564905121.0, "step": 17699 }, { "entropy": 0.5540884835645556, "epoch": 1.6284955233149896, "grad_norm": 0.14830787479877472, "learning_rate": 4.572024411936088e-05, "loss": 0.5289, "mean_token_accuracy": 0.8350439742207527, "num_tokens": 564936884.0, "step": 17700 }, { "entropy": 0.6768482476472855, "epoch": 1.6285875296864307, "grad_norm": 0.1582619547843933, "learning_rate": 4.5717177293219246e-05, "loss": 0.6746, "mean_token_accuracy": 0.7932287380099297, "num_tokens": 564968748.0, "step": 17701 }, { "entropy": 0.7076269425451756, "epoch": 1.6286795360578719, "grad_norm": 0.16132910549640656, "learning_rate": 4.571411046707763e-05, "loss": 0.7001, "mean_token_accuracy": 0.7886176593601704, "num_tokens": 565000618.0, "step": 17702 }, { "entropy": 0.5836967825889587, "epoch": 1.6287715424293132, "grad_norm": 0.15399134159088135, "learning_rate": 4.5711043640935995e-05, "loss": 0.5657, "mean_token_accuracy": 0.8226247243583202, "num_tokens": 565032398.0, "step": 17703 }, { "entropy": 0.6351749580353498, "epoch": 1.6288635488007546, "grad_norm": 0.15603388845920563, "learning_rate": 4.5707976814794376e-05, "loss": 0.6218, "mean_token_accuracy": 0.8100393749773502, "num_tokens": 565064511.0, "step": 17704 }, { "entropy": 0.6225511310622096, "epoch": 1.6289555551721957, "grad_norm": 0.16173316538333893, "learning_rate": 4.5704909988652744e-05, "loss": 0.6313, "mean_token_accuracy": 0.8136365339159966, "num_tokens": 565096778.0, "step": 17705 }, { "entropy": 0.5992487650364637, "epoch": 1.6290475615436368, "grad_norm": 0.16168226301670074, "learning_rate": 4.570184316251112e-05, "loss": 0.5924, "mean_token_accuracy": 0.8155617453157902, "num_tokens": 565126812.0, "step": 17706 }, { "entropy": 0.5940585099160671, "epoch": 1.629139567915078, "grad_norm": 0.16000282764434814, "learning_rate": 4.5698776336369494e-05, "loss": 0.5944, "mean_token_accuracy": 0.8176786601543427, "num_tokens": 565158856.0, "step": 17707 }, { "entropy": 0.6836568070575595, "epoch": 1.6292315742865193, "grad_norm": 0.16237396001815796, "learning_rate": 4.569570951022787e-05, "loss": 0.6785, "mean_token_accuracy": 0.7921840101480484, "num_tokens": 565190651.0, "step": 17708 }, { "entropy": 0.6022575665265322, "epoch": 1.6293235806579607, "grad_norm": 0.15437814593315125, "learning_rate": 4.569264268408624e-05, "loss": 0.5994, "mean_token_accuracy": 0.8191561102867126, "num_tokens": 565223064.0, "step": 17709 }, { "entropy": 0.5276249293237925, "epoch": 1.6294155870294018, "grad_norm": 0.15720774233341217, "learning_rate": 4.568957585794462e-05, "loss": 0.5263, "mean_token_accuracy": 0.8356506489217281, "num_tokens": 565254059.0, "step": 17710 }, { "entropy": 0.671818945556879, "epoch": 1.629507593400843, "grad_norm": 0.16234326362609863, "learning_rate": 4.5686509031802985e-05, "loss": 0.6701, "mean_token_accuracy": 0.7976867184042931, "num_tokens": 565285686.0, "step": 17711 }, { "entropy": 0.612807109951973, "epoch": 1.629599599772284, "grad_norm": 0.15408039093017578, "learning_rate": 4.568344220566137e-05, "loss": 0.6172, "mean_token_accuracy": 0.809896606951952, "num_tokens": 565317786.0, "step": 17712 }, { "entropy": 0.48488541692495346, "epoch": 1.6296916061437254, "grad_norm": 0.14827130734920502, "learning_rate": 4.5680375379519735e-05, "loss": 0.4857, "mean_token_accuracy": 0.8533112816512585, "num_tokens": 565349544.0, "step": 17713 }, { "entropy": 0.653469929471612, "epoch": 1.6297836125151668, "grad_norm": 0.15538588166236877, "learning_rate": 4.567730855337811e-05, "loss": 0.653, "mean_token_accuracy": 0.7992041371762753, "num_tokens": 565382120.0, "step": 17714 }, { "entropy": 0.5729878321290016, "epoch": 1.629875618886608, "grad_norm": 0.16125242412090302, "learning_rate": 4.5674241727236484e-05, "loss": 0.5629, "mean_token_accuracy": 0.8291018269956112, "num_tokens": 565413519.0, "step": 17715 }, { "entropy": 0.6886250358074903, "epoch": 1.629967625258049, "grad_norm": 0.16019503772258759, "learning_rate": 4.567117490109486e-05, "loss": 0.6704, "mean_token_accuracy": 0.796610277146101, "num_tokens": 565444543.0, "step": 17716 }, { "entropy": 0.6031002411618829, "epoch": 1.6300596316294902, "grad_norm": 0.14923211932182312, "learning_rate": 4.566810807495323e-05, "loss": 0.5862, "mean_token_accuracy": 0.8231797032058239, "num_tokens": 565476289.0, "step": 17717 }, { "entropy": 0.5754358367994428, "epoch": 1.6301516380009315, "grad_norm": 0.15482982993125916, "learning_rate": 4.566504124881161e-05, "loss": 0.5564, "mean_token_accuracy": 0.8268493488430977, "num_tokens": 565507799.0, "step": 17718 }, { "entropy": 0.5692971227690578, "epoch": 1.630243644372373, "grad_norm": 0.14836271107196808, "learning_rate": 4.5661974422669976e-05, "loss": 0.5542, "mean_token_accuracy": 0.8297423124313354, "num_tokens": 565539580.0, "step": 17719 }, { "entropy": 0.5956183569505811, "epoch": 1.630335650743814, "grad_norm": 0.1582699865102768, "learning_rate": 4.565890759652836e-05, "loss": 0.5783, "mean_token_accuracy": 0.8220105320215225, "num_tokens": 565572016.0, "step": 17720 }, { "entropy": 0.5412567900493741, "epoch": 1.6304276571152552, "grad_norm": 0.1479692906141281, "learning_rate": 4.5655840770386725e-05, "loss": 0.5277, "mean_token_accuracy": 0.8388317413628101, "num_tokens": 565603264.0, "step": 17721 }, { "entropy": 0.5945216882973909, "epoch": 1.6305196634866963, "grad_norm": 0.15065455436706543, "learning_rate": 4.56527739442451e-05, "loss": 0.5845, "mean_token_accuracy": 0.818368561565876, "num_tokens": 565635073.0, "step": 17722 }, { "entropy": 0.6134762968868017, "epoch": 1.6306116698581377, "grad_norm": 0.15282376110553741, "learning_rate": 4.564970711810348e-05, "loss": 0.5974, "mean_token_accuracy": 0.8170627802610397, "num_tokens": 565667357.0, "step": 17723 }, { "entropy": 0.6700414111837745, "epoch": 1.630703676229579, "grad_norm": 0.1538347601890564, "learning_rate": 4.564664029196185e-05, "loss": 0.6642, "mean_token_accuracy": 0.7994994819164276, "num_tokens": 565699500.0, "step": 17724 }, { "entropy": 0.6450831443071365, "epoch": 1.6307956826010201, "grad_norm": 0.16546469926834106, "learning_rate": 4.564357346582023e-05, "loss": 0.6381, "mean_token_accuracy": 0.8045657984912395, "num_tokens": 565730926.0, "step": 17725 }, { "entropy": 0.5716448193415999, "epoch": 1.6308876889724613, "grad_norm": 0.14779238402843475, "learning_rate": 4.56405066396786e-05, "loss": 0.5637, "mean_token_accuracy": 0.8291682749986649, "num_tokens": 565763081.0, "step": 17726 }, { "entropy": 0.6585580445826054, "epoch": 1.6309796953439024, "grad_norm": 0.15961384773254395, "learning_rate": 4.563743981353697e-05, "loss": 0.67, "mean_token_accuracy": 0.7979151457548141, "num_tokens": 565794718.0, "step": 17727 }, { "entropy": 0.6761747673153877, "epoch": 1.6310717017153438, "grad_norm": 0.15753890573978424, "learning_rate": 4.563437298739535e-05, "loss": 0.6627, "mean_token_accuracy": 0.7964846268296242, "num_tokens": 565826664.0, "step": 17728 }, { "entropy": 0.5550961189437658, "epoch": 1.6311637080867851, "grad_norm": 0.14966675639152527, "learning_rate": 4.563130616125372e-05, "loss": 0.5458, "mean_token_accuracy": 0.8340779170393944, "num_tokens": 565859194.0, "step": 17729 }, { "entropy": 0.6015951046720147, "epoch": 1.6312557144582263, "grad_norm": 0.1591639667749405, "learning_rate": 4.56282393351121e-05, "loss": 0.5836, "mean_token_accuracy": 0.8235682547092438, "num_tokens": 565890880.0, "step": 17730 }, { "entropy": 0.4926480804570019, "epoch": 1.6313477208296674, "grad_norm": 0.1467362344264984, "learning_rate": 4.562517250897047e-05, "loss": 0.4788, "mean_token_accuracy": 0.8549846485257149, "num_tokens": 565922975.0, "step": 17731 }, { "entropy": 0.6417694613337517, "epoch": 1.6314397272011085, "grad_norm": 0.15493734180927277, "learning_rate": 4.562210568282884e-05, "loss": 0.6199, "mean_token_accuracy": 0.8064266182482243, "num_tokens": 565954753.0, "step": 17732 }, { "entropy": 0.648925231769681, "epoch": 1.6315317335725499, "grad_norm": 0.15883740782737732, "learning_rate": 4.561903885668722e-05, "loss": 0.6446, "mean_token_accuracy": 0.8050539940595627, "num_tokens": 565986798.0, "step": 17733 }, { "entropy": 0.5831764377653599, "epoch": 1.6316237399439912, "grad_norm": 0.15652675926685333, "learning_rate": 4.561597203054559e-05, "loss": 0.555, "mean_token_accuracy": 0.8266134336590767, "num_tokens": 566018036.0, "step": 17734 }, { "entropy": 0.7192401140928268, "epoch": 1.6317157463154324, "grad_norm": 0.1622152477502823, "learning_rate": 4.561290520440396e-05, "loss": 0.7082, "mean_token_accuracy": 0.7846149913966656, "num_tokens": 566049749.0, "step": 17735 }, { "entropy": 0.6267928490415215, "epoch": 1.6318077526868735, "grad_norm": 0.15183961391448975, "learning_rate": 4.560983837826234e-05, "loss": 0.6083, "mean_token_accuracy": 0.8138791806995869, "num_tokens": 566081903.0, "step": 17736 }, { "entropy": 0.5274764220230281, "epoch": 1.6318997590583146, "grad_norm": 0.1455797255039215, "learning_rate": 4.560677155212071e-05, "loss": 0.5079, "mean_token_accuracy": 0.8448412604629993, "num_tokens": 566114098.0, "step": 17737 }, { "entropy": 0.5295306760817766, "epoch": 1.631991765429756, "grad_norm": 0.14911915361881256, "learning_rate": 4.560370472597909e-05, "loss": 0.5051, "mean_token_accuracy": 0.8436954542994499, "num_tokens": 566146433.0, "step": 17738 }, { "entropy": 0.6305457600392401, "epoch": 1.6320837718011973, "grad_norm": 0.1556706726551056, "learning_rate": 4.560063789983746e-05, "loss": 0.6236, "mean_token_accuracy": 0.8063069321215153, "num_tokens": 566178428.0, "step": 17739 }, { "entropy": 0.5847582826390862, "epoch": 1.6321757781726385, "grad_norm": 0.15947698056697845, "learning_rate": 4.559757107369583e-05, "loss": 0.5851, "mean_token_accuracy": 0.8222775645554066, "num_tokens": 566210143.0, "step": 17740 }, { "entropy": 0.6140529420226812, "epoch": 1.6322677845440796, "grad_norm": 0.1602889448404312, "learning_rate": 4.559450424755421e-05, "loss": 0.6028, "mean_token_accuracy": 0.8164141103625298, "num_tokens": 566242357.0, "step": 17741 }, { "entropy": 0.535666425479576, "epoch": 1.6323597909155207, "grad_norm": 0.14916430413722992, "learning_rate": 4.559143742141258e-05, "loss": 0.5202, "mean_token_accuracy": 0.8408259302377701, "num_tokens": 566274336.0, "step": 17742 }, { "entropy": 0.7594916671514511, "epoch": 1.632451797286962, "grad_norm": 0.17634864151477814, "learning_rate": 4.558837059527096e-05, "loss": 0.7517, "mean_token_accuracy": 0.7716458365321159, "num_tokens": 566306457.0, "step": 17743 }, { "entropy": 0.5743121183477342, "epoch": 1.6325438036584035, "grad_norm": 0.15907134115695953, "learning_rate": 4.558530376912933e-05, "loss": 0.5674, "mean_token_accuracy": 0.8300248980522156, "num_tokens": 566338946.0, "step": 17744 }, { "entropy": 0.6439201859757304, "epoch": 1.6326358100298446, "grad_norm": 0.15811960399150848, "learning_rate": 4.55822369429877e-05, "loss": 0.628, "mean_token_accuracy": 0.8089150711894035, "num_tokens": 566371592.0, "step": 17745 }, { "entropy": 0.6546051483601332, "epoch": 1.6327278164012857, "grad_norm": 0.16370141506195068, "learning_rate": 4.557917011684608e-05, "loss": 0.6493, "mean_token_accuracy": 0.8030550368130207, "num_tokens": 566403740.0, "step": 17746 }, { "entropy": 0.6200022241100669, "epoch": 1.6328198227727269, "grad_norm": 0.15597736835479736, "learning_rate": 4.557610329070445e-05, "loss": 0.6111, "mean_token_accuracy": 0.8135559037327766, "num_tokens": 566436089.0, "step": 17747 }, { "entropy": 0.6810074942186475, "epoch": 1.6329118291441682, "grad_norm": 0.1574532389640808, "learning_rate": 4.557303646456283e-05, "loss": 0.6711, "mean_token_accuracy": 0.7955805994570255, "num_tokens": 566468593.0, "step": 17748 }, { "entropy": 0.5316601051017642, "epoch": 1.6330038355156096, "grad_norm": 0.1518038511276245, "learning_rate": 4.55699696384212e-05, "loss": 0.5158, "mean_token_accuracy": 0.8421497568488121, "num_tokens": 566500576.0, "step": 17749 }, { "entropy": 0.5956124579533935, "epoch": 1.6330958418870507, "grad_norm": 0.16343475878238678, "learning_rate": 4.556690281227957e-05, "loss": 0.584, "mean_token_accuracy": 0.8223761208355427, "num_tokens": 566532674.0, "step": 17750 }, { "entropy": 0.7170812077820301, "epoch": 1.6331878482584918, "grad_norm": 0.16642442345619202, "learning_rate": 4.556383598613795e-05, "loss": 0.7021, "mean_token_accuracy": 0.7880812361836433, "num_tokens": 566564201.0, "step": 17751 }, { "entropy": 0.5196863091550767, "epoch": 1.633279854629933, "grad_norm": 0.1535627394914627, "learning_rate": 4.556076915999632e-05, "loss": 0.5132, "mean_token_accuracy": 0.839704904705286, "num_tokens": 566596055.0, "step": 17752 }, { "entropy": 0.5785280428826809, "epoch": 1.6333718610013743, "grad_norm": 0.15565554797649384, "learning_rate": 4.5557702333854693e-05, "loss": 0.5563, "mean_token_accuracy": 0.8290782272815704, "num_tokens": 566627846.0, "step": 17753 }, { "entropy": 0.5529928728938103, "epoch": 1.6334638673728157, "grad_norm": 0.1608409881591797, "learning_rate": 4.5554635507713075e-05, "loss": 0.5474, "mean_token_accuracy": 0.8292484097182751, "num_tokens": 566659896.0, "step": 17754 }, { "entropy": 0.6225582845509052, "epoch": 1.6335558737442568, "grad_norm": 0.15333408117294312, "learning_rate": 4.555156868157144e-05, "loss": 0.6048, "mean_token_accuracy": 0.813753817230463, "num_tokens": 566691710.0, "step": 17755 }, { "entropy": 0.5635590571910143, "epoch": 1.633647880115698, "grad_norm": 0.15239489078521729, "learning_rate": 4.554850185542982e-05, "loss": 0.5583, "mean_token_accuracy": 0.8286555670201778, "num_tokens": 566724129.0, "step": 17756 }, { "entropy": 0.6980666443705559, "epoch": 1.633739886487139, "grad_norm": 0.1670314073562622, "learning_rate": 4.554543502928819e-05, "loss": 0.6782, "mean_token_accuracy": 0.7916963435709476, "num_tokens": 566755490.0, "step": 17757 }, { "entropy": 0.5939077353104949, "epoch": 1.6338318928585804, "grad_norm": 0.1570827066898346, "learning_rate": 4.554236820314657e-05, "loss": 0.5816, "mean_token_accuracy": 0.8218638598918915, "num_tokens": 566787598.0, "step": 17758 }, { "entropy": 0.5785277206450701, "epoch": 1.6339238992300218, "grad_norm": 0.15895113348960876, "learning_rate": 4.553930137700494e-05, "loss": 0.5706, "mean_token_accuracy": 0.8244913257658482, "num_tokens": 566820098.0, "step": 17759 }, { "entropy": 0.584912552498281, "epoch": 1.634015905601463, "grad_norm": 0.14861831068992615, "learning_rate": 4.5536234550863316e-05, "loss": 0.5778, "mean_token_accuracy": 0.8220036700367928, "num_tokens": 566852724.0, "step": 17760 }, { "entropy": 0.687725119292736, "epoch": 1.634107911972904, "grad_norm": 0.15898382663726807, "learning_rate": 4.5533167724721684e-05, "loss": 0.6819, "mean_token_accuracy": 0.7896619103848934, "num_tokens": 566885072.0, "step": 17761 }, { "entropy": 0.5425646319054067, "epoch": 1.6341999183443452, "grad_norm": 0.15013667941093445, "learning_rate": 4.5530100898580065e-05, "loss": 0.5354, "mean_token_accuracy": 0.8365427739918232, "num_tokens": 566917188.0, "step": 17762 }, { "entropy": 0.5123956776224077, "epoch": 1.6342919247157865, "grad_norm": 0.14569169282913208, "learning_rate": 4.552703407243843e-05, "loss": 0.5001, "mean_token_accuracy": 0.843796893954277, "num_tokens": 566949230.0, "step": 17763 }, { "entropy": 0.5749507937580347, "epoch": 1.634383931087228, "grad_norm": 0.15043513476848602, "learning_rate": 4.5523967246296815e-05, "loss": 0.5672, "mean_token_accuracy": 0.8262970931828022, "num_tokens": 566980988.0, "step": 17764 }, { "entropy": 0.7231700774282217, "epoch": 1.634475937458669, "grad_norm": 0.16470196843147278, "learning_rate": 4.552090042015518e-05, "loss": 0.709, "mean_token_accuracy": 0.7795716561377048, "num_tokens": 567012916.0, "step": 17765 }, { "entropy": 0.5887714186683297, "epoch": 1.6345679438301102, "grad_norm": 0.1531851589679718, "learning_rate": 4.551783359401356e-05, "loss": 0.5819, "mean_token_accuracy": 0.8224165327847004, "num_tokens": 567044953.0, "step": 17766 }, { "entropy": 0.6107837450690567, "epoch": 1.6346599502015513, "grad_norm": 0.15057827532291412, "learning_rate": 4.551476676787193e-05, "loss": 0.6155, "mean_token_accuracy": 0.8106069751083851, "num_tokens": 567077721.0, "step": 17767 }, { "entropy": 0.5020563248544931, "epoch": 1.6347519565729927, "grad_norm": 0.14149387180805206, "learning_rate": 4.5511699941730306e-05, "loss": 0.4796, "mean_token_accuracy": 0.8488568961620331, "num_tokens": 567109958.0, "step": 17768 }, { "entropy": 0.7185599394142628, "epoch": 1.634843962944434, "grad_norm": 0.15944695472717285, "learning_rate": 4.550863311558868e-05, "loss": 0.7119, "mean_token_accuracy": 0.7874947786331177, "num_tokens": 567142262.0, "step": 17769 }, { "entropy": 0.6828294582664967, "epoch": 1.6349359693158751, "grad_norm": 0.1568102240562439, "learning_rate": 4.5505566289447056e-05, "loss": 0.6824, "mean_token_accuracy": 0.795043334364891, "num_tokens": 567173378.0, "step": 17770 }, { "entropy": 0.629958507604897, "epoch": 1.6350279756873163, "grad_norm": 0.15457698702812195, "learning_rate": 4.5502499463305424e-05, "loss": 0.6229, "mean_token_accuracy": 0.8091951198875904, "num_tokens": 567205446.0, "step": 17771 }, { "entropy": 0.6139678210020065, "epoch": 1.6351199820587574, "grad_norm": 0.15319553017616272, "learning_rate": 4.5499432637163805e-05, "loss": 0.6083, "mean_token_accuracy": 0.8119939491152763, "num_tokens": 567237422.0, "step": 17772 }, { "entropy": 0.6735959891229868, "epoch": 1.6352119884301988, "grad_norm": 0.1627088487148285, "learning_rate": 4.549636581102217e-05, "loss": 0.6612, "mean_token_accuracy": 0.7985762022435665, "num_tokens": 567268927.0, "step": 17773 }, { "entropy": 0.5734220016747713, "epoch": 1.6353039948016401, "grad_norm": 0.14508207142353058, "learning_rate": 4.549329898488055e-05, "loss": 0.5596, "mean_token_accuracy": 0.8303388208150864, "num_tokens": 567301469.0, "step": 17774 }, { "entropy": 0.5848006047308445, "epoch": 1.6353960011730813, "grad_norm": 0.15034236013889313, "learning_rate": 4.549023215873892e-05, "loss": 0.5757, "mean_token_accuracy": 0.8234538920223713, "num_tokens": 567333282.0, "step": 17775 }, { "entropy": 0.5486111296340823, "epoch": 1.6354880075445224, "grad_norm": 0.14663521945476532, "learning_rate": 4.54871653325973e-05, "loss": 0.5459, "mean_token_accuracy": 0.8331131748855114, "num_tokens": 567365422.0, "step": 17776 }, { "entropy": 0.646320978179574, "epoch": 1.6355800139159635, "grad_norm": 0.1558404415845871, "learning_rate": 4.548409850645567e-05, "loss": 0.6218, "mean_token_accuracy": 0.8082056306302547, "num_tokens": 567396893.0, "step": 17777 }, { "entropy": 0.4919106010347605, "epoch": 1.6356720202874049, "grad_norm": 0.14776845276355743, "learning_rate": 4.5481031680314046e-05, "loss": 0.4809, "mean_token_accuracy": 0.8509463965892792, "num_tokens": 567428206.0, "step": 17778 }, { "entropy": 0.5801529586315155, "epoch": 1.6357640266588462, "grad_norm": 0.15442918241024017, "learning_rate": 4.5477964854172414e-05, "loss": 0.5751, "mean_token_accuracy": 0.823800578713417, "num_tokens": 567460289.0, "step": 17779 }, { "entropy": 0.5617355015128851, "epoch": 1.6358560330302874, "grad_norm": 0.15574878454208374, "learning_rate": 4.5474898028030795e-05, "loss": 0.5543, "mean_token_accuracy": 0.8294081166386604, "num_tokens": 567492282.0, "step": 17780 }, { "entropy": 0.5961917079985142, "epoch": 1.6359480394017285, "grad_norm": 0.15985161066055298, "learning_rate": 4.547183120188916e-05, "loss": 0.5877, "mean_token_accuracy": 0.8194462768733501, "num_tokens": 567524101.0, "step": 17781 }, { "entropy": 0.5674320794641972, "epoch": 1.6360400457731696, "grad_norm": 0.1484011858701706, "learning_rate": 4.546876437574754e-05, "loss": 0.5517, "mean_token_accuracy": 0.8255032263696194, "num_tokens": 567556177.0, "step": 17782 }, { "entropy": 0.7372874859720469, "epoch": 1.636132052144611, "grad_norm": 0.16614125669002533, "learning_rate": 4.546569754960591e-05, "loss": 0.7191, "mean_token_accuracy": 0.7824387066066265, "num_tokens": 567588094.0, "step": 17783 }, { "entropy": 0.598331113345921, "epoch": 1.6362240585160523, "grad_norm": 0.16421473026275635, "learning_rate": 4.546263072346429e-05, "loss": 0.591, "mean_token_accuracy": 0.8194397427141666, "num_tokens": 567619201.0, "step": 17784 }, { "entropy": 0.5843673180788755, "epoch": 1.6363160648874935, "grad_norm": 0.15450742840766907, "learning_rate": 4.545956389732267e-05, "loss": 0.5804, "mean_token_accuracy": 0.8210508450865746, "num_tokens": 567650819.0, "step": 17785 }, { "entropy": 0.7707011066377163, "epoch": 1.6364080712589346, "grad_norm": 0.1670563966035843, "learning_rate": 4.5456497071181036e-05, "loss": 0.7771, "mean_token_accuracy": 0.766554232686758, "num_tokens": 567683131.0, "step": 17786 }, { "entropy": 0.6320126038044691, "epoch": 1.6365000776303757, "grad_norm": 0.1572142243385315, "learning_rate": 4.545343024503941e-05, "loss": 0.6277, "mean_token_accuracy": 0.8070419616997242, "num_tokens": 567715297.0, "step": 17787 }, { "entropy": 0.4892138526774943, "epoch": 1.636592084001817, "grad_norm": 0.1437394767999649, "learning_rate": 4.5450363418897786e-05, "loss": 0.4784, "mean_token_accuracy": 0.8516903892159462, "num_tokens": 567747476.0, "step": 17788 }, { "entropy": 0.6410316377878189, "epoch": 1.6366840903732585, "grad_norm": 0.15734504163265228, "learning_rate": 4.544729659275616e-05, "loss": 0.6329, "mean_token_accuracy": 0.8092267215251923, "num_tokens": 567779951.0, "step": 17789 }, { "entropy": 0.668855395168066, "epoch": 1.6367760967446996, "grad_norm": 0.16092686355113983, "learning_rate": 4.5444229766614535e-05, "loss": 0.6578, "mean_token_accuracy": 0.7966791428625584, "num_tokens": 567810955.0, "step": 17790 }, { "entropy": 0.6583823319524527, "epoch": 1.6368681031161407, "grad_norm": 0.17409773170948029, "learning_rate": 4.544116294047291e-05, "loss": 0.6514, "mean_token_accuracy": 0.7995495274662971, "num_tokens": 567843100.0, "step": 17791 }, { "entropy": 0.5311616696417332, "epoch": 1.6369601094875819, "grad_norm": 0.1450931578874588, "learning_rate": 4.543809611433128e-05, "loss": 0.5276, "mean_token_accuracy": 0.8366958871483803, "num_tokens": 567875360.0, "step": 17792 }, { "entropy": 0.5969677940011024, "epoch": 1.6370521158590232, "grad_norm": 0.15007616579532623, "learning_rate": 4.543502928818966e-05, "loss": 0.596, "mean_token_accuracy": 0.8150299750268459, "num_tokens": 567907423.0, "step": 17793 }, { "entropy": 0.7279502786695957, "epoch": 1.6371441222304646, "grad_norm": 0.1708497703075409, "learning_rate": 4.543196246204803e-05, "loss": 0.7273, "mean_token_accuracy": 0.7838058955967426, "num_tokens": 567940165.0, "step": 17794 }, { "entropy": 0.7117631137371063, "epoch": 1.6372361286019057, "grad_norm": 0.16621950268745422, "learning_rate": 4.54288956359064e-05, "loss": 0.707, "mean_token_accuracy": 0.7858130820095539, "num_tokens": 567972103.0, "step": 17795 }, { "entropy": 0.6202612635679543, "epoch": 1.6373281349733468, "grad_norm": 0.1523170918226242, "learning_rate": 4.5425828809764776e-05, "loss": 0.5964, "mean_token_accuracy": 0.8166312947869301, "num_tokens": 568004127.0, "step": 17796 }, { "entropy": 0.6033721873536706, "epoch": 1.637420141344788, "grad_norm": 0.15248997509479523, "learning_rate": 4.542276198362315e-05, "loss": 0.6, "mean_token_accuracy": 0.8169702738523483, "num_tokens": 568036476.0, "step": 17797 }, { "entropy": 0.5653615780174732, "epoch": 1.6375121477162293, "grad_norm": 0.1578492820262909, "learning_rate": 4.5419695157481525e-05, "loss": 0.5518, "mean_token_accuracy": 0.833521343767643, "num_tokens": 568068024.0, "step": 17798 }, { "entropy": 0.6415158901363611, "epoch": 1.6376041540876707, "grad_norm": 0.15248458087444305, "learning_rate": 4.54166283313399e-05, "loss": 0.6269, "mean_token_accuracy": 0.8031349182128906, "num_tokens": 568099948.0, "step": 17799 }, { "entropy": 0.5837619639933109, "epoch": 1.6376961604591118, "grad_norm": 0.15485629439353943, "learning_rate": 4.541356150519827e-05, "loss": 0.5727, "mean_token_accuracy": 0.8231355957686901, "num_tokens": 568131491.0, "step": 17800 }, { "entropy": 0.5904533956199884, "epoch": 1.637788166830553, "grad_norm": 0.1583954095840454, "learning_rate": 4.541049467905665e-05, "loss": 0.5753, "mean_token_accuracy": 0.8200223185122013, "num_tokens": 568162599.0, "step": 17801 }, { "entropy": 0.6071220356971025, "epoch": 1.637880173201994, "grad_norm": 0.16112275421619415, "learning_rate": 4.540742785291502e-05, "loss": 0.6038, "mean_token_accuracy": 0.8183063715696335, "num_tokens": 568194758.0, "step": 17802 }, { "entropy": 0.6299661677330732, "epoch": 1.6379721795734354, "grad_norm": 0.15681621432304382, "learning_rate": 4.54043610267734e-05, "loss": 0.5991, "mean_token_accuracy": 0.8142127729952335, "num_tokens": 568226340.0, "step": 17803 }, { "entropy": 0.4692814676091075, "epoch": 1.6380641859448768, "grad_norm": 0.15052294731140137, "learning_rate": 4.5401294200631767e-05, "loss": 0.4547, "mean_token_accuracy": 0.85740976780653, "num_tokens": 568258215.0, "step": 17804 }, { "entropy": 0.5598073117434978, "epoch": 1.638156192316318, "grad_norm": 0.15504179894924164, "learning_rate": 4.539822737449014e-05, "loss": 0.5405, "mean_token_accuracy": 0.8310186676681042, "num_tokens": 568290026.0, "step": 17805 }, { "entropy": 0.7014594171196222, "epoch": 1.638248198687759, "grad_norm": 0.16531766951084137, "learning_rate": 4.5395160548348516e-05, "loss": 0.6906, "mean_token_accuracy": 0.786021288484335, "num_tokens": 568322044.0, "step": 17806 }, { "entropy": 0.7125425543636084, "epoch": 1.6383402050592002, "grad_norm": 0.16337864100933075, "learning_rate": 4.539209372220689e-05, "loss": 0.7012, "mean_token_accuracy": 0.7905019298195839, "num_tokens": 568354260.0, "step": 17807 }, { "entropy": 0.6542597953230143, "epoch": 1.6384322114306415, "grad_norm": 0.154709130525589, "learning_rate": 4.5389026896065265e-05, "loss": 0.6446, "mean_token_accuracy": 0.8022446371614933, "num_tokens": 568386302.0, "step": 17808 }, { "entropy": 0.5882760342210531, "epoch": 1.638524217802083, "grad_norm": 0.15233469009399414, "learning_rate": 4.538596006992364e-05, "loss": 0.5767, "mean_token_accuracy": 0.8221522271633148, "num_tokens": 568418537.0, "step": 17809 }, { "entropy": 0.49031928507611156, "epoch": 1.638616224173524, "grad_norm": 0.1427900791168213, "learning_rate": 4.538289324378201e-05, "loss": 0.4658, "mean_token_accuracy": 0.8562346138060093, "num_tokens": 568450904.0, "step": 17810 }, { "entropy": 0.6796510871499777, "epoch": 1.6387082305449652, "grad_norm": 0.16130782663822174, "learning_rate": 4.537982641764039e-05, "loss": 0.6813, "mean_token_accuracy": 0.794017605483532, "num_tokens": 568482876.0, "step": 17811 }, { "entropy": 0.5977785484865308, "epoch": 1.6388002369164063, "grad_norm": 0.15171095728874207, "learning_rate": 4.537675959149876e-05, "loss": 0.5903, "mean_token_accuracy": 0.8177107200026512, "num_tokens": 568515625.0, "step": 17812 }, { "entropy": 0.6103422180749476, "epoch": 1.6388922432878477, "grad_norm": 0.15356676280498505, "learning_rate": 4.537369276535713e-05, "loss": 0.6031, "mean_token_accuracy": 0.8145244494080544, "num_tokens": 568546917.0, "step": 17813 }, { "entropy": 0.5820826329290867, "epoch": 1.638984249659289, "grad_norm": 0.15770204365253448, "learning_rate": 4.5370625939215506e-05, "loss": 0.5778, "mean_token_accuracy": 0.8190198726952076, "num_tokens": 568579283.0, "step": 17814 }, { "entropy": 0.5505415452644229, "epoch": 1.6390762560307301, "grad_norm": 0.15301935374736786, "learning_rate": 4.536755911307388e-05, "loss": 0.5439, "mean_token_accuracy": 0.832745473831892, "num_tokens": 568611031.0, "step": 17815 }, { "entropy": 0.5719368513673544, "epoch": 1.6391682624021713, "grad_norm": 0.1585230529308319, "learning_rate": 4.5364492286932256e-05, "loss": 0.5565, "mean_token_accuracy": 0.8311421684920788, "num_tokens": 568643322.0, "step": 17816 }, { "entropy": 0.6187512120231986, "epoch": 1.6392602687736124, "grad_norm": 0.15910299122333527, "learning_rate": 4.536142546079063e-05, "loss": 0.6021, "mean_token_accuracy": 0.8157400265336037, "num_tokens": 568675441.0, "step": 17817 }, { "entropy": 0.6333004301413894, "epoch": 1.6393522751450538, "grad_norm": 0.15305499732494354, "learning_rate": 4.5358358634649005e-05, "loss": 0.619, "mean_token_accuracy": 0.8128488138318062, "num_tokens": 568707313.0, "step": 17818 }, { "entropy": 0.5162450522184372, "epoch": 1.6394442815164951, "grad_norm": 0.1450931280851364, "learning_rate": 4.535529180850738e-05, "loss": 0.5157, "mean_token_accuracy": 0.8418653048574924, "num_tokens": 568739242.0, "step": 17819 }, { "entropy": 0.7408787291496992, "epoch": 1.6395362878879363, "grad_norm": 0.16380265355110168, "learning_rate": 4.5352224982365754e-05, "loss": 0.7387, "mean_token_accuracy": 0.7739404253661633, "num_tokens": 568771017.0, "step": 17820 }, { "entropy": 0.5299119893461466, "epoch": 1.6396282942593774, "grad_norm": 0.15229614078998566, "learning_rate": 4.534915815622412e-05, "loss": 0.5124, "mean_token_accuracy": 0.8417514786124229, "num_tokens": 568802992.0, "step": 17821 }, { "entropy": 0.6376312682405114, "epoch": 1.6397203006308185, "grad_norm": 0.16279523074626923, "learning_rate": 4.5346091330082503e-05, "loss": 0.6172, "mean_token_accuracy": 0.8071298561990261, "num_tokens": 568834411.0, "step": 17822 }, { "entropy": 0.6111845523118973, "epoch": 1.6398123070022599, "grad_norm": 0.15742990374565125, "learning_rate": 4.534302450394087e-05, "loss": 0.6169, "mean_token_accuracy": 0.8119388967752457, "num_tokens": 568866368.0, "step": 17823 }, { "entropy": 0.57645224314183, "epoch": 1.6399043133737012, "grad_norm": 0.1588544100522995, "learning_rate": 4.533995767779925e-05, "loss": 0.5502, "mean_token_accuracy": 0.8278718329966068, "num_tokens": 568897603.0, "step": 17824 }, { "entropy": 0.5441555827856064, "epoch": 1.6399963197451424, "grad_norm": 0.1524433195590973, "learning_rate": 4.533689085165762e-05, "loss": 0.537, "mean_token_accuracy": 0.835609495639801, "num_tokens": 568929917.0, "step": 17825 }, { "entropy": 0.5886726975440979, "epoch": 1.6400883261165835, "grad_norm": 0.155929297208786, "learning_rate": 4.5333824025515995e-05, "loss": 0.5762, "mean_token_accuracy": 0.8229660168290138, "num_tokens": 568961817.0, "step": 17826 }, { "entropy": 0.6999181918799877, "epoch": 1.6401803324880246, "grad_norm": 0.1632905900478363, "learning_rate": 4.533075719937437e-05, "loss": 0.691, "mean_token_accuracy": 0.7900977730751038, "num_tokens": 568993651.0, "step": 17827 }, { "entropy": 0.6108215004205704, "epoch": 1.640272338859466, "grad_norm": 0.1589670181274414, "learning_rate": 4.5327690373232745e-05, "loss": 0.6105, "mean_token_accuracy": 0.8115341700613499, "num_tokens": 569025487.0, "step": 17828 }, { "entropy": 0.579405982978642, "epoch": 1.6403643452309074, "grad_norm": 0.1589975655078888, "learning_rate": 4.532462354709112e-05, "loss": 0.5722, "mean_token_accuracy": 0.8273649215698242, "num_tokens": 569057457.0, "step": 17829 }, { "entropy": 0.6391524914652109, "epoch": 1.6404563516023485, "grad_norm": 0.15762671828269958, "learning_rate": 4.5321556720949494e-05, "loss": 0.6325, "mean_token_accuracy": 0.804540291428566, "num_tokens": 569088490.0, "step": 17830 }, { "entropy": 0.5500223636627197, "epoch": 1.6405483579737896, "grad_norm": 0.1521042287349701, "learning_rate": 4.531848989480786e-05, "loss": 0.5432, "mean_token_accuracy": 0.8297235742211342, "num_tokens": 569120317.0, "step": 17831 }, { "entropy": 0.7172684241086245, "epoch": 1.6406403643452308, "grad_norm": 0.16500726342201233, "learning_rate": 4.531542306866624e-05, "loss": 0.7201, "mean_token_accuracy": 0.782511867582798, "num_tokens": 569152400.0, "step": 17832 }, { "entropy": 0.5404115132987499, "epoch": 1.640732370716672, "grad_norm": 0.1470848023891449, "learning_rate": 4.531235624252461e-05, "loss": 0.5339, "mean_token_accuracy": 0.8372330330312252, "num_tokens": 569185144.0, "step": 17833 }, { "entropy": 0.5863529406487942, "epoch": 1.6408243770881135, "grad_norm": 0.15621547400951385, "learning_rate": 4.5309289416382986e-05, "loss": 0.5711, "mean_token_accuracy": 0.8220230303704739, "num_tokens": 569216629.0, "step": 17834 }, { "entropy": 0.5420011412352324, "epoch": 1.6409163834595546, "grad_norm": 0.14734740555286407, "learning_rate": 4.530622259024136e-05, "loss": 0.5409, "mean_token_accuracy": 0.8315859287977219, "num_tokens": 569249036.0, "step": 17835 }, { "entropy": 0.6040893206372857, "epoch": 1.6410083898309957, "grad_norm": 0.1513812392950058, "learning_rate": 4.5303155764099735e-05, "loss": 0.5885, "mean_token_accuracy": 0.819236259907484, "num_tokens": 569280919.0, "step": 17836 }, { "entropy": 0.5479511525481939, "epoch": 1.6411003962024369, "grad_norm": 0.14783820509910583, "learning_rate": 4.530008893795811e-05, "loss": 0.5383, "mean_token_accuracy": 0.8362606950104237, "num_tokens": 569313155.0, "step": 17837 }, { "entropy": 0.6034442530944943, "epoch": 1.6411924025738782, "grad_norm": 0.15632598102092743, "learning_rate": 4.5297022111816484e-05, "loss": 0.5767, "mean_token_accuracy": 0.820350144058466, "num_tokens": 569345433.0, "step": 17838 }, { "entropy": 0.6146118110045791, "epoch": 1.6412844089453196, "grad_norm": 0.16255930066108704, "learning_rate": 4.529395528567485e-05, "loss": 0.6082, "mean_token_accuracy": 0.8106978014111519, "num_tokens": 569376901.0, "step": 17839 }, { "entropy": 0.6487459354102612, "epoch": 1.6413764153167607, "grad_norm": 0.15785326063632965, "learning_rate": 4.5290888459533234e-05, "loss": 0.6283, "mean_token_accuracy": 0.8028433509171009, "num_tokens": 569408524.0, "step": 17840 }, { "entropy": 0.5624745720997453, "epoch": 1.6414684216882018, "grad_norm": 0.1524367481470108, "learning_rate": 4.52878216333916e-05, "loss": 0.5466, "mean_token_accuracy": 0.8303419835865498, "num_tokens": 569440302.0, "step": 17841 }, { "entropy": 0.590660153888166, "epoch": 1.641560428059643, "grad_norm": 0.15239939093589783, "learning_rate": 4.5284754807249976e-05, "loss": 0.5632, "mean_token_accuracy": 0.8239805288612843, "num_tokens": 569471818.0, "step": 17842 }, { "entropy": 0.4961615726351738, "epoch": 1.6416524344310843, "grad_norm": 0.13864128291606903, "learning_rate": 4.528168798110835e-05, "loss": 0.4895, "mean_token_accuracy": 0.8483363799750805, "num_tokens": 569503695.0, "step": 17843 }, { "entropy": 0.6468328088521957, "epoch": 1.6417444408025257, "grad_norm": 0.15608271956443787, "learning_rate": 4.5278621154966725e-05, "loss": 0.6374, "mean_token_accuracy": 0.8044871389865875, "num_tokens": 569535125.0, "step": 17844 }, { "entropy": 0.5911794654093683, "epoch": 1.6418364471739668, "grad_norm": 0.15716880559921265, "learning_rate": 4.527555432882511e-05, "loss": 0.5812, "mean_token_accuracy": 0.8219478502869606, "num_tokens": 569566577.0, "step": 17845 }, { "entropy": 0.5477539673447609, "epoch": 1.641928453545408, "grad_norm": 0.15161767601966858, "learning_rate": 4.5272487502683475e-05, "loss": 0.5395, "mean_token_accuracy": 0.8342555500566959, "num_tokens": 569597941.0, "step": 17846 }, { "entropy": 0.4751307424157858, "epoch": 1.642020459916849, "grad_norm": 0.14001671969890594, "learning_rate": 4.526942067654185e-05, "loss": 0.4566, "mean_token_accuracy": 0.8582270108163357, "num_tokens": 569630430.0, "step": 17847 }, { "entropy": 0.5175348808988929, "epoch": 1.6421124662882904, "grad_norm": 0.14671681821346283, "learning_rate": 4.5266353850400224e-05, "loss": 0.5021, "mean_token_accuracy": 0.8423979058861732, "num_tokens": 569661939.0, "step": 17848 }, { "entropy": 0.5502931252121925, "epoch": 1.6422044726597318, "grad_norm": 0.14742767810821533, "learning_rate": 4.52632870242586e-05, "loss": 0.5393, "mean_token_accuracy": 0.8329269140958786, "num_tokens": 569694311.0, "step": 17849 }, { "entropy": 0.5084139192476869, "epoch": 1.642296479031173, "grad_norm": 0.1484837383031845, "learning_rate": 4.526022019811697e-05, "loss": 0.4872, "mean_token_accuracy": 0.8484311029314995, "num_tokens": 569725853.0, "step": 17850 }, { "entropy": 0.6740380022674799, "epoch": 1.642388485402614, "grad_norm": 0.1637452244758606, "learning_rate": 4.525715337197535e-05, "loss": 0.6692, "mean_token_accuracy": 0.7984800226986408, "num_tokens": 569757801.0, "step": 17851 }, { "entropy": 0.6690152175724506, "epoch": 1.6424804917740552, "grad_norm": 0.15527324378490448, "learning_rate": 4.5254086545833716e-05, "loss": 0.6757, "mean_token_accuracy": 0.795094758272171, "num_tokens": 569789559.0, "step": 17852 }, { "entropy": 0.5720125497318804, "epoch": 1.6425724981454966, "grad_norm": 0.1494637131690979, "learning_rate": 4.52510197196921e-05, "loss": 0.5637, "mean_token_accuracy": 0.8272472806274891, "num_tokens": 569821973.0, "step": 17853 }, { "entropy": 0.626431580632925, "epoch": 1.642664504516938, "grad_norm": 0.1522340476512909, "learning_rate": 4.5247952893550465e-05, "loss": 0.6087, "mean_token_accuracy": 0.8099761120975018, "num_tokens": 569853883.0, "step": 17854 }, { "entropy": 0.6042951699346304, "epoch": 1.642756510888379, "grad_norm": 0.15866093337535858, "learning_rate": 4.524488606740884e-05, "loss": 0.5963, "mean_token_accuracy": 0.8134225308895111, "num_tokens": 569884725.0, "step": 17855 }, { "entropy": 0.5216146684251726, "epoch": 1.6428485172598202, "grad_norm": 0.14628179371356964, "learning_rate": 4.5241819241267214e-05, "loss": 0.5058, "mean_token_accuracy": 0.8434362709522247, "num_tokens": 569916965.0, "step": 17856 }, { "entropy": 0.6360859367996454, "epoch": 1.6429405236312613, "grad_norm": 0.1597154140472412, "learning_rate": 4.523875241512559e-05, "loss": 0.6129, "mean_token_accuracy": 0.8092762306332588, "num_tokens": 569948783.0, "step": 17857 }, { "entropy": 0.5888946745544672, "epoch": 1.6430325300027027, "grad_norm": 0.1523541361093521, "learning_rate": 4.5235685588983964e-05, "loss": 0.5762, "mean_token_accuracy": 0.8231318481266499, "num_tokens": 569980620.0, "step": 17858 }, { "entropy": 0.613241333514452, "epoch": 1.643124536374144, "grad_norm": 0.15950223803520203, "learning_rate": 4.523261876284234e-05, "loss": 0.6047, "mean_token_accuracy": 0.8135683573782444, "num_tokens": 570013070.0, "step": 17859 }, { "entropy": 0.678469005972147, "epoch": 1.6432165427455852, "grad_norm": 0.16752728819847107, "learning_rate": 4.5229551936700706e-05, "loss": 0.6792, "mean_token_accuracy": 0.7908682227134705, "num_tokens": 570044203.0, "step": 17860 }, { "entropy": 0.6572464182972908, "epoch": 1.6433085491170263, "grad_norm": 0.16700014472007751, "learning_rate": 4.522648511055909e-05, "loss": 0.6562, "mean_token_accuracy": 0.8023353219032288, "num_tokens": 570075724.0, "step": 17861 }, { "entropy": 0.5964886359870434, "epoch": 1.6434005554884674, "grad_norm": 0.15237076580524445, "learning_rate": 4.5223418284417455e-05, "loss": 0.5912, "mean_token_accuracy": 0.820186834782362, "num_tokens": 570107280.0, "step": 17862 }, { "entropy": 0.7524480279535055, "epoch": 1.6434925618599088, "grad_norm": 0.16402818262577057, "learning_rate": 4.522035145827584e-05, "loss": 0.7443, "mean_token_accuracy": 0.7759027741849422, "num_tokens": 570138789.0, "step": 17863 }, { "entropy": 0.5850910814478993, "epoch": 1.6435845682313501, "grad_norm": 0.15049324929714203, "learning_rate": 4.5217284632134205e-05, "loss": 0.567, "mean_token_accuracy": 0.8246501572430134, "num_tokens": 570171265.0, "step": 17864 }, { "entropy": 0.6356695769354701, "epoch": 1.6436765746027913, "grad_norm": 0.15345360338687897, "learning_rate": 4.521421780599258e-05, "loss": 0.6197, "mean_token_accuracy": 0.8107804171741009, "num_tokens": 570202730.0, "step": 17865 }, { "entropy": 0.6925992295145988, "epoch": 1.6437685809742324, "grad_norm": 0.16316944360733032, "learning_rate": 4.5211150979850954e-05, "loss": 0.6686, "mean_token_accuracy": 0.8007317297160625, "num_tokens": 570233936.0, "step": 17866 }, { "entropy": 0.6398725565522909, "epoch": 1.6438605873456735, "grad_norm": 0.16377510130405426, "learning_rate": 4.520808415370933e-05, "loss": 0.6439, "mean_token_accuracy": 0.80451450496912, "num_tokens": 570266501.0, "step": 17867 }, { "entropy": 0.5215266700834036, "epoch": 1.6439525937171149, "grad_norm": 0.1456378698348999, "learning_rate": 4.52050173275677e-05, "loss": 0.5093, "mean_token_accuracy": 0.8425530530512333, "num_tokens": 570298486.0, "step": 17868 }, { "entropy": 0.5178817724809051, "epoch": 1.6440446000885562, "grad_norm": 0.1510242372751236, "learning_rate": 4.520195050142608e-05, "loss": 0.5125, "mean_token_accuracy": 0.8411091677844524, "num_tokens": 570330822.0, "step": 17869 }, { "entropy": 0.5674204477109015, "epoch": 1.6441366064599974, "grad_norm": 0.153060644865036, "learning_rate": 4.5198883675284446e-05, "loss": 0.5473, "mean_token_accuracy": 0.8281413652002811, "num_tokens": 570362151.0, "step": 17870 }, { "entropy": 0.6105600595474243, "epoch": 1.6442286128314385, "grad_norm": 0.14976969361305237, "learning_rate": 4.519581684914283e-05, "loss": 0.6192, "mean_token_accuracy": 0.809936810284853, "num_tokens": 570394567.0, "step": 17871 }, { "entropy": 0.6190236741676927, "epoch": 1.6443206192028796, "grad_norm": 0.1542583703994751, "learning_rate": 4.5192750023001195e-05, "loss": 0.6221, "mean_token_accuracy": 0.8077370896935463, "num_tokens": 570425696.0, "step": 17872 }, { "entropy": 0.6506138797849417, "epoch": 1.644412625574321, "grad_norm": 0.15763388574123383, "learning_rate": 4.518968319685957e-05, "loss": 0.6489, "mean_token_accuracy": 0.8017415106296539, "num_tokens": 570457736.0, "step": 17873 }, { "entropy": 0.6072725486010313, "epoch": 1.6445046319457624, "grad_norm": 0.1508648693561554, "learning_rate": 4.5186616370717944e-05, "loss": 0.6046, "mean_token_accuracy": 0.8137628808617592, "num_tokens": 570489729.0, "step": 17874 }, { "entropy": 0.5283399447798729, "epoch": 1.6445966383172035, "grad_norm": 0.14823231101036072, "learning_rate": 4.518354954457632e-05, "loss": 0.5088, "mean_token_accuracy": 0.840742152184248, "num_tokens": 570521136.0, "step": 17875 }, { "entropy": 0.6786608342081308, "epoch": 1.6446886446886446, "grad_norm": 0.1568453162908554, "learning_rate": 4.5180482718434694e-05, "loss": 0.6582, "mean_token_accuracy": 0.7972679324448109, "num_tokens": 570553069.0, "step": 17876 }, { "entropy": 0.49262914061546326, "epoch": 1.6447806510600858, "grad_norm": 0.14923225343227386, "learning_rate": 4.517741589229307e-05, "loss": 0.4799, "mean_token_accuracy": 0.8505535013973713, "num_tokens": 570584588.0, "step": 17877 }, { "entropy": 0.6844069212675095, "epoch": 1.644872657431527, "grad_norm": 0.15951630473136902, "learning_rate": 4.517434906615144e-05, "loss": 0.6941, "mean_token_accuracy": 0.790986955165863, "num_tokens": 570615981.0, "step": 17878 }, { "entropy": 0.6833724174648523, "epoch": 1.6449646638029685, "grad_norm": 0.1626068502664566, "learning_rate": 4.517128224000982e-05, "loss": 0.6734, "mean_token_accuracy": 0.7942856103181839, "num_tokens": 570647159.0, "step": 17879 }, { "entropy": 0.6514050243422389, "epoch": 1.6450566701744096, "grad_norm": 0.1631929725408554, "learning_rate": 4.516821541386819e-05, "loss": 0.6406, "mean_token_accuracy": 0.8007881231606007, "num_tokens": 570678839.0, "step": 17880 }, { "entropy": 0.6607302958145738, "epoch": 1.6451486765458507, "grad_norm": 0.15502241253852844, "learning_rate": 4.516514858772656e-05, "loss": 0.6516, "mean_token_accuracy": 0.7995791174471378, "num_tokens": 570711495.0, "step": 17881 }, { "entropy": 0.5910527147352695, "epoch": 1.6452406829172919, "grad_norm": 0.1578790694475174, "learning_rate": 4.516208176158494e-05, "loss": 0.5829, "mean_token_accuracy": 0.8215505629777908, "num_tokens": 570743714.0, "step": 17882 }, { "entropy": 0.7116758320480585, "epoch": 1.6453326892887332, "grad_norm": 0.15590164065361023, "learning_rate": 4.515901493544331e-05, "loss": 0.6957, "mean_token_accuracy": 0.7865889817476273, "num_tokens": 570775734.0, "step": 17883 }, { "entropy": 0.6088232882320881, "epoch": 1.6454246956601746, "grad_norm": 0.15390849113464355, "learning_rate": 4.515594810930169e-05, "loss": 0.5983, "mean_token_accuracy": 0.8193558864295483, "num_tokens": 570808169.0, "step": 17884 }, { "entropy": 0.5560739925131202, "epoch": 1.6455167020316157, "grad_norm": 0.16144108772277832, "learning_rate": 4.515288128316006e-05, "loss": 0.5512, "mean_token_accuracy": 0.8289951346814632, "num_tokens": 570840535.0, "step": 17885 }, { "entropy": 0.6786738922819495, "epoch": 1.6456087084030568, "grad_norm": 0.16610777378082275, "learning_rate": 4.5149814457018433e-05, "loss": 0.673, "mean_token_accuracy": 0.7946116290986538, "num_tokens": 570872366.0, "step": 17886 }, { "entropy": 0.641319178044796, "epoch": 1.645700714774498, "grad_norm": 0.1575978547334671, "learning_rate": 4.514674763087681e-05, "loss": 0.633, "mean_token_accuracy": 0.8057567365467548, "num_tokens": 570904208.0, "step": 17887 }, { "entropy": 0.5947358813136816, "epoch": 1.6457927211459393, "grad_norm": 0.1530696153640747, "learning_rate": 4.514368080473518e-05, "loss": 0.5813, "mean_token_accuracy": 0.8204573839902878, "num_tokens": 570935419.0, "step": 17888 }, { "entropy": 0.6447816854342818, "epoch": 1.6458847275173807, "grad_norm": 0.1556701809167862, "learning_rate": 4.514061397859356e-05, "loss": 0.6287, "mean_token_accuracy": 0.807439174503088, "num_tokens": 570967183.0, "step": 17889 }, { "entropy": 0.6124552777037024, "epoch": 1.6459767338888218, "grad_norm": 0.16085317730903625, "learning_rate": 4.513754715245193e-05, "loss": 0.6011, "mean_token_accuracy": 0.8110159374773502, "num_tokens": 570998332.0, "step": 17890 }, { "entropy": 0.5917114848271012, "epoch": 1.646068740260263, "grad_norm": 0.1518530696630478, "learning_rate": 4.51344803263103e-05, "loss": 0.5828, "mean_token_accuracy": 0.8218094892799854, "num_tokens": 571029794.0, "step": 17891 }, { "entropy": 0.7195227518677711, "epoch": 1.646160746631704, "grad_norm": 0.16349229216575623, "learning_rate": 4.513141350016868e-05, "loss": 0.7122, "mean_token_accuracy": 0.7854994833469391, "num_tokens": 571062171.0, "step": 17892 }, { "entropy": 0.5756879635155201, "epoch": 1.6462527530031454, "grad_norm": 0.1509205400943756, "learning_rate": 4.512834667402705e-05, "loss": 0.5618, "mean_token_accuracy": 0.8208430856466293, "num_tokens": 571094606.0, "step": 17893 }, { "entropy": 0.6696104230359197, "epoch": 1.6463447593745868, "grad_norm": 0.16188673675060272, "learning_rate": 4.5125279847885424e-05, "loss": 0.6788, "mean_token_accuracy": 0.795146569609642, "num_tokens": 571126431.0, "step": 17894 }, { "entropy": 0.6603629682213068, "epoch": 1.646436765746028, "grad_norm": 0.1564675271511078, "learning_rate": 4.51222130217438e-05, "loss": 0.652, "mean_token_accuracy": 0.7997394390404224, "num_tokens": 571158056.0, "step": 17895 }, { "entropy": 0.5971706607379019, "epoch": 1.646528772117469, "grad_norm": 0.15542419254779816, "learning_rate": 4.511914619560217e-05, "loss": 0.5839, "mean_token_accuracy": 0.8215497806668282, "num_tokens": 571190031.0, "step": 17896 }, { "entropy": 0.5941147543489933, "epoch": 1.6466207784889102, "grad_norm": 0.14954262971878052, "learning_rate": 4.511607936946055e-05, "loss": 0.5864, "mean_token_accuracy": 0.8192750066518784, "num_tokens": 571222688.0, "step": 17897 }, { "entropy": 0.6410716800019145, "epoch": 1.6467127848603516, "grad_norm": 0.15856793522834778, "learning_rate": 4.511301254331892e-05, "loss": 0.6307, "mean_token_accuracy": 0.8082916997373104, "num_tokens": 571254389.0, "step": 17898 }, { "entropy": 0.6114595499821007, "epoch": 1.646804791231793, "grad_norm": 0.16453418135643005, "learning_rate": 4.510994571717729e-05, "loss": 0.6079, "mean_token_accuracy": 0.8102443255484104, "num_tokens": 571286459.0, "step": 17899 }, { "entropy": 0.5522905979305506, "epoch": 1.646896797603234, "grad_norm": 0.1583118885755539, "learning_rate": 4.510687889103567e-05, "loss": 0.5458, "mean_token_accuracy": 0.8360114693641663, "num_tokens": 571318680.0, "step": 17900 }, { "entropy": 0.5936418073251843, "epoch": 1.6469888039746752, "grad_norm": 0.15510088205337524, "learning_rate": 4.510381206489404e-05, "loss": 0.5794, "mean_token_accuracy": 0.8192081451416016, "num_tokens": 571351239.0, "step": 17901 }, { "entropy": 0.4967019958421588, "epoch": 1.6470808103461163, "grad_norm": 0.1585046350955963, "learning_rate": 4.5100745238752414e-05, "loss": 0.4957, "mean_token_accuracy": 0.8483894541859627, "num_tokens": 571383400.0, "step": 17902 }, { "entropy": 0.6673358958214521, "epoch": 1.6471728167175577, "grad_norm": 0.1619929075241089, "learning_rate": 4.509767841261079e-05, "loss": 0.6442, "mean_token_accuracy": 0.8062969371676445, "num_tokens": 571415841.0, "step": 17903 }, { "entropy": 0.6109105497598648, "epoch": 1.647264823088999, "grad_norm": 0.1560165137052536, "learning_rate": 4.5094611586469164e-05, "loss": 0.6026, "mean_token_accuracy": 0.8165610507130623, "num_tokens": 571448167.0, "step": 17904 }, { "entropy": 0.4995802892372012, "epoch": 1.6473568294604402, "grad_norm": 0.1397603154182434, "learning_rate": 4.509154476032754e-05, "loss": 0.4885, "mean_token_accuracy": 0.8481671884655952, "num_tokens": 571479994.0, "step": 17905 }, { "entropy": 0.6155916098505259, "epoch": 1.6474488358318813, "grad_norm": 0.15606985986232758, "learning_rate": 4.508847793418591e-05, "loss": 0.6037, "mean_token_accuracy": 0.8133266642689705, "num_tokens": 571512360.0, "step": 17906 }, { "entropy": 0.6120213335379958, "epoch": 1.6475408422033224, "grad_norm": 0.15245914459228516, "learning_rate": 4.508541110804429e-05, "loss": 0.5949, "mean_token_accuracy": 0.8133569471538067, "num_tokens": 571543938.0, "step": 17907 }, { "entropy": 0.631780203897506, "epoch": 1.6476328485747638, "grad_norm": 0.15848328173160553, "learning_rate": 4.508234428190266e-05, "loss": 0.6176, "mean_token_accuracy": 0.8094696961343288, "num_tokens": 571576087.0, "step": 17908 }, { "entropy": 0.6255066953599453, "epoch": 1.6477248549462051, "grad_norm": 0.1560261845588684, "learning_rate": 4.507927745576104e-05, "loss": 0.6282, "mean_token_accuracy": 0.8028248511254787, "num_tokens": 571608611.0, "step": 17909 }, { "entropy": 0.48978146398440003, "epoch": 1.6478168613176463, "grad_norm": 0.14830604195594788, "learning_rate": 4.507621062961941e-05, "loss": 0.4908, "mean_token_accuracy": 0.8465211801230907, "num_tokens": 571640635.0, "step": 17910 }, { "entropy": 0.65287702716887, "epoch": 1.6479088676890874, "grad_norm": 0.1571444571018219, "learning_rate": 4.5073143803477786e-05, "loss": 0.6482, "mean_token_accuracy": 0.8002186082303524, "num_tokens": 571673079.0, "step": 17911 }, { "entropy": 0.6622057678177953, "epoch": 1.6480008740605285, "grad_norm": 0.16660015285015106, "learning_rate": 4.5070076977336154e-05, "loss": 0.6461, "mean_token_accuracy": 0.8034160286188126, "num_tokens": 571704488.0, "step": 17912 }, { "entropy": 0.5586019195616245, "epoch": 1.6480928804319699, "grad_norm": 0.15475672483444214, "learning_rate": 4.5067010151194535e-05, "loss": 0.5375, "mean_token_accuracy": 0.8297803103923798, "num_tokens": 571736376.0, "step": 17913 }, { "entropy": 0.7445345167070627, "epoch": 1.6481848868034112, "grad_norm": 0.1623125821352005, "learning_rate": 4.50639433250529e-05, "loss": 0.7381, "mean_token_accuracy": 0.7769242003560066, "num_tokens": 571768283.0, "step": 17914 }, { "entropy": 0.5208107400685549, "epoch": 1.6482768931748524, "grad_norm": 0.14317314326763153, "learning_rate": 4.506087649891128e-05, "loss": 0.508, "mean_token_accuracy": 0.8404495604336262, "num_tokens": 571800524.0, "step": 17915 }, { "entropy": 0.49805828323587775, "epoch": 1.6483688995462935, "grad_norm": 0.14978651702404022, "learning_rate": 4.505780967276965e-05, "loss": 0.4815, "mean_token_accuracy": 0.8501144275069237, "num_tokens": 571832047.0, "step": 17916 }, { "entropy": 0.5721400054171681, "epoch": 1.6484609059177346, "grad_norm": 0.14761470258235931, "learning_rate": 4.505474284662803e-05, "loss": 0.548, "mean_token_accuracy": 0.8338770307600498, "num_tokens": 571864220.0, "step": 17917 }, { "entropy": 0.6279718838632107, "epoch": 1.648552912289176, "grad_norm": 0.1509236842393875, "learning_rate": 4.50516760204864e-05, "loss": 0.6038, "mean_token_accuracy": 0.8157816715538502, "num_tokens": 571896978.0, "step": 17918 }, { "entropy": 0.581975007429719, "epoch": 1.6486449186606174, "grad_norm": 0.1525518149137497, "learning_rate": 4.5048609194344777e-05, "loss": 0.5652, "mean_token_accuracy": 0.8235763870179653, "num_tokens": 571928617.0, "step": 17919 }, { "entropy": 0.5830812137573957, "epoch": 1.6487369250320585, "grad_norm": 0.1506119817495346, "learning_rate": 4.5045542368203144e-05, "loss": 0.5655, "mean_token_accuracy": 0.8245438188314438, "num_tokens": 571960981.0, "step": 17920 }, { "entropy": 0.5028396220877767, "epoch": 1.6488289314034996, "grad_norm": 0.14063243567943573, "learning_rate": 4.5042475542061526e-05, "loss": 0.4938, "mean_token_accuracy": 0.8468637764453888, "num_tokens": 571993453.0, "step": 17921 }, { "entropy": 0.5146072553470731, "epoch": 1.6489209377749408, "grad_norm": 0.1486063301563263, "learning_rate": 4.5039408715919894e-05, "loss": 0.5119, "mean_token_accuracy": 0.8356643579900265, "num_tokens": 572026038.0, "step": 17922 }, { "entropy": 0.5511841382831335, "epoch": 1.649012944146382, "grad_norm": 0.1509329229593277, "learning_rate": 4.5036341889778275e-05, "loss": 0.5513, "mean_token_accuracy": 0.8304036222398281, "num_tokens": 572058544.0, "step": 17923 }, { "entropy": 0.46818089368753135, "epoch": 1.6491049505178235, "grad_norm": 0.14353784918785095, "learning_rate": 4.503327506363664e-05, "loss": 0.4512, "mean_token_accuracy": 0.8568013869225979, "num_tokens": 572090582.0, "step": 17924 }, { "entropy": 0.5947971818968654, "epoch": 1.6491969568892646, "grad_norm": 0.14959776401519775, "learning_rate": 4.503020823749502e-05, "loss": 0.582, "mean_token_accuracy": 0.8256024196743965, "num_tokens": 572121888.0, "step": 17925 }, { "entropy": 0.5987301953136921, "epoch": 1.6492889632607057, "grad_norm": 0.15666739642620087, "learning_rate": 4.502714141135339e-05, "loss": 0.5819, "mean_token_accuracy": 0.8246219456195831, "num_tokens": 572153517.0, "step": 17926 }, { "entropy": 0.5847441842779517, "epoch": 1.6493809696321469, "grad_norm": 0.1492239236831665, "learning_rate": 4.502407458521177e-05, "loss": 0.5706, "mean_token_accuracy": 0.8269481249153614, "num_tokens": 572185846.0, "step": 17927 }, { "entropy": 0.6503035770729184, "epoch": 1.6494729760035882, "grad_norm": 0.16670559346675873, "learning_rate": 4.502100775907014e-05, "loss": 0.6354, "mean_token_accuracy": 0.8093233443796635, "num_tokens": 572217680.0, "step": 17928 }, { "entropy": 0.6403976092115045, "epoch": 1.6495649823750296, "grad_norm": 0.15450188517570496, "learning_rate": 4.5017940932928516e-05, "loss": 0.6283, "mean_token_accuracy": 0.8067164346575737, "num_tokens": 572249520.0, "step": 17929 }, { "entropy": 0.5971850426867604, "epoch": 1.6496569887464707, "grad_norm": 0.15912771224975586, "learning_rate": 4.5014874106786884e-05, "loss": 0.6055, "mean_token_accuracy": 0.8185030780732632, "num_tokens": 572281082.0, "step": 17930 }, { "entropy": 0.6538698058575392, "epoch": 1.6497489951179118, "grad_norm": 0.15481065213680267, "learning_rate": 4.5011807280645266e-05, "loss": 0.6541, "mean_token_accuracy": 0.8004724904894829, "num_tokens": 572313449.0, "step": 17931 }, { "entropy": 0.5828907378017902, "epoch": 1.649841001489353, "grad_norm": 0.14938010275363922, "learning_rate": 4.5008740454503633e-05, "loss": 0.5816, "mean_token_accuracy": 0.8223481848835945, "num_tokens": 572345568.0, "step": 17932 }, { "entropy": 0.5496855080127716, "epoch": 1.6499330078607943, "grad_norm": 0.15349604189395905, "learning_rate": 4.500567362836201e-05, "loss": 0.5461, "mean_token_accuracy": 0.8314433209598064, "num_tokens": 572377665.0, "step": 17933 }, { "entropy": 0.5748599916696548, "epoch": 1.6500250142322357, "grad_norm": 0.154911071062088, "learning_rate": 4.500260680222038e-05, "loss": 0.5749, "mean_token_accuracy": 0.8239085003733635, "num_tokens": 572409960.0, "step": 17934 }, { "entropy": 0.6304971016943455, "epoch": 1.6501170206036768, "grad_norm": 0.15601757168769836, "learning_rate": 4.499953997607876e-05, "loss": 0.6221, "mean_token_accuracy": 0.8088325783610344, "num_tokens": 572441679.0, "step": 17935 }, { "entropy": 0.5123607669956982, "epoch": 1.650209026975118, "grad_norm": 0.15075141191482544, "learning_rate": 4.499647314993713e-05, "loss": 0.5018, "mean_token_accuracy": 0.8423372954130173, "num_tokens": 572473240.0, "step": 17936 }, { "entropy": 0.6465067807585001, "epoch": 1.650301033346559, "grad_norm": 0.16164717078208923, "learning_rate": 4.499340632379551e-05, "loss": 0.6392, "mean_token_accuracy": 0.8033463545143604, "num_tokens": 572505083.0, "step": 17937 }, { "entropy": 0.5703146941959858, "epoch": 1.6503930397180004, "grad_norm": 0.15419892966747284, "learning_rate": 4.499033949765388e-05, "loss": 0.5679, "mean_token_accuracy": 0.826228853315115, "num_tokens": 572536792.0, "step": 17938 }, { "entropy": 0.7191582471132278, "epoch": 1.6504850460894418, "grad_norm": 0.15894915163516998, "learning_rate": 4.4987272671512256e-05, "loss": 0.7115, "mean_token_accuracy": 0.7806838750839233, "num_tokens": 572568956.0, "step": 17939 }, { "entropy": 0.4958818058948964, "epoch": 1.650577052460883, "grad_norm": 0.14697006344795227, "learning_rate": 4.498420584537063e-05, "loss": 0.4711, "mean_token_accuracy": 0.8538658693432808, "num_tokens": 572599993.0, "step": 17940 }, { "entropy": 0.6889557642862201, "epoch": 1.650669058832324, "grad_norm": 0.15561328828334808, "learning_rate": 4.4981139019229e-05, "loss": 0.6882, "mean_token_accuracy": 0.7915941849350929, "num_tokens": 572631960.0, "step": 17941 }, { "entropy": 0.6502674510702491, "epoch": 1.6507610652037652, "grad_norm": 0.15920181572437286, "learning_rate": 4.497807219308738e-05, "loss": 0.6541, "mean_token_accuracy": 0.8002465143799782, "num_tokens": 572663368.0, "step": 17942 }, { "entropy": 0.5875687478110194, "epoch": 1.6508530715752066, "grad_norm": 0.15246620774269104, "learning_rate": 4.497500536694575e-05, "loss": 0.5662, "mean_token_accuracy": 0.823261272162199, "num_tokens": 572694860.0, "step": 17943 }, { "entropy": 0.6048404760658741, "epoch": 1.650945077946648, "grad_norm": 0.1531287431716919, "learning_rate": 4.497193854080413e-05, "loss": 0.5822, "mean_token_accuracy": 0.8198568969964981, "num_tokens": 572726550.0, "step": 17944 }, { "entropy": 0.6385020408779383, "epoch": 1.651037084318089, "grad_norm": 0.15276934206485748, "learning_rate": 4.49688717146625e-05, "loss": 0.6132, "mean_token_accuracy": 0.8068753108382225, "num_tokens": 572758313.0, "step": 17945 }, { "entropy": 0.7262556087225676, "epoch": 1.6511290906895302, "grad_norm": 0.16104170680046082, "learning_rate": 4.496580488852087e-05, "loss": 0.7222, "mean_token_accuracy": 0.783306036144495, "num_tokens": 572790636.0, "step": 17946 }, { "entropy": 0.6293928623199463, "epoch": 1.6512210970609713, "grad_norm": 0.16203029453754425, "learning_rate": 4.4962738062379246e-05, "loss": 0.6387, "mean_token_accuracy": 0.8080032132565975, "num_tokens": 572822861.0, "step": 17947 }, { "entropy": 0.6423506774008274, "epoch": 1.6513131034324127, "grad_norm": 0.1585145890712738, "learning_rate": 4.495967123623762e-05, "loss": 0.6233, "mean_token_accuracy": 0.8082794919610023, "num_tokens": 572853993.0, "step": 17948 }, { "entropy": 0.45637337025254965, "epoch": 1.651405109803854, "grad_norm": 0.13575130701065063, "learning_rate": 4.4956604410095996e-05, "loss": 0.4446, "mean_token_accuracy": 0.8612548671662807, "num_tokens": 572886308.0, "step": 17949 }, { "entropy": 0.5935531794093549, "epoch": 1.6514971161752952, "grad_norm": 0.152655690908432, "learning_rate": 4.495353758395437e-05, "loss": 0.5846, "mean_token_accuracy": 0.8237752541899681, "num_tokens": 572918568.0, "step": 17950 }, { "entropy": 0.4706328413449228, "epoch": 1.6515891225467363, "grad_norm": 0.14571931958198547, "learning_rate": 4.495047075781274e-05, "loss": 0.4479, "mean_token_accuracy": 0.8588506691157818, "num_tokens": 572950529.0, "step": 17951 }, { "entropy": 0.6005186447873712, "epoch": 1.6516811289181774, "grad_norm": 0.14590874314308167, "learning_rate": 4.494740393167112e-05, "loss": 0.5843, "mean_token_accuracy": 0.8197913430631161, "num_tokens": 572983228.0, "step": 17952 }, { "entropy": 0.622830780223012, "epoch": 1.6517731352896188, "grad_norm": 0.14746056497097015, "learning_rate": 4.494433710552949e-05, "loss": 0.6136, "mean_token_accuracy": 0.8137329034507275, "num_tokens": 573015774.0, "step": 17953 }, { "entropy": 0.512634998653084, "epoch": 1.6518651416610601, "grad_norm": 0.1500527411699295, "learning_rate": 4.494127027938786e-05, "loss": 0.4941, "mean_token_accuracy": 0.8432161100208759, "num_tokens": 573046582.0, "step": 17954 }, { "entropy": 0.5970009570010006, "epoch": 1.6519571480325013, "grad_norm": 0.15342681109905243, "learning_rate": 4.493820345324624e-05, "loss": 0.5771, "mean_token_accuracy": 0.8214581981301308, "num_tokens": 573078751.0, "step": 17955 }, { "entropy": 0.5701214801520109, "epoch": 1.6520491544039424, "grad_norm": 0.15433737635612488, "learning_rate": 4.493513662710461e-05, "loss": 0.5531, "mean_token_accuracy": 0.8285452164709568, "num_tokens": 573110583.0, "step": 17956 }, { "entropy": 0.7367727514356375, "epoch": 1.6521411607753835, "grad_norm": 0.16393452882766724, "learning_rate": 4.4932069800962986e-05, "loss": 0.7159, "mean_token_accuracy": 0.7831017561256886, "num_tokens": 573141709.0, "step": 17957 }, { "entropy": 0.6155882049351931, "epoch": 1.6522331671468249, "grad_norm": 0.14887912571430206, "learning_rate": 4.492900297482136e-05, "loss": 0.6003, "mean_token_accuracy": 0.8135052993893623, "num_tokens": 573173840.0, "step": 17958 }, { "entropy": 0.597988598048687, "epoch": 1.6523251735182662, "grad_norm": 0.15433254837989807, "learning_rate": 4.492593614867973e-05, "loss": 0.6017, "mean_token_accuracy": 0.8182274103164673, "num_tokens": 573204642.0, "step": 17959 }, { "entropy": 0.5814739125780761, "epoch": 1.6524171798897074, "grad_norm": 0.15689541399478912, "learning_rate": 4.492286932253811e-05, "loss": 0.5753, "mean_token_accuracy": 0.8237165659666061, "num_tokens": 573236727.0, "step": 17960 }, { "entropy": 0.6298194415867329, "epoch": 1.6525091862611485, "grad_norm": 0.15979748964309692, "learning_rate": 4.491980249639648e-05, "loss": 0.6152, "mean_token_accuracy": 0.8102431073784828, "num_tokens": 573268024.0, "step": 17961 }, { "entropy": 0.6467712987214327, "epoch": 1.6526011926325896, "grad_norm": 0.16535049676895142, "learning_rate": 4.491673567025485e-05, "loss": 0.6349, "mean_token_accuracy": 0.8037067502737045, "num_tokens": 573298851.0, "step": 17962 }, { "entropy": 0.6995880715548992, "epoch": 1.652693199004031, "grad_norm": 0.167426198720932, "learning_rate": 4.491366884411323e-05, "loss": 0.7048, "mean_token_accuracy": 0.7859979942440987, "num_tokens": 573330164.0, "step": 17963 }, { "entropy": 0.6035536425188184, "epoch": 1.6527852053754724, "grad_norm": 0.1630251407623291, "learning_rate": 4.49106020179716e-05, "loss": 0.5979, "mean_token_accuracy": 0.8176639042794704, "num_tokens": 573362683.0, "step": 17964 }, { "entropy": 0.6391331730410457, "epoch": 1.6528772117469135, "grad_norm": 0.15878717601299286, "learning_rate": 4.4907535191829976e-05, "loss": 0.629, "mean_token_accuracy": 0.8106228411197662, "num_tokens": 573394621.0, "step": 17965 }, { "entropy": 0.6681746151298285, "epoch": 1.6529692181183546, "grad_norm": 0.15667904913425446, "learning_rate": 4.490446836568835e-05, "loss": 0.6539, "mean_token_accuracy": 0.7964588664472103, "num_tokens": 573426122.0, "step": 17966 }, { "entropy": 0.5075780584011227, "epoch": 1.6530612244897958, "grad_norm": 0.14547409117221832, "learning_rate": 4.4901401539546726e-05, "loss": 0.4867, "mean_token_accuracy": 0.8474978134036064, "num_tokens": 573458104.0, "step": 17967 }, { "entropy": 0.6265882831066847, "epoch": 1.653153230861237, "grad_norm": 0.15780679881572723, "learning_rate": 4.48983347134051e-05, "loss": 0.6219, "mean_token_accuracy": 0.8102605380117893, "num_tokens": 573489965.0, "step": 17968 }, { "entropy": 0.6086218990385532, "epoch": 1.6532452372326785, "grad_norm": 0.16261234879493713, "learning_rate": 4.4895267887263475e-05, "loss": 0.5917, "mean_token_accuracy": 0.8172046914696693, "num_tokens": 573521836.0, "step": 17969 }, { "entropy": 0.6241317950189114, "epoch": 1.6533372436041196, "grad_norm": 0.15095190703868866, "learning_rate": 4.489220106112185e-05, "loss": 0.6129, "mean_token_accuracy": 0.8123645037412643, "num_tokens": 573553593.0, "step": 17970 }, { "entropy": 0.6366913188248873, "epoch": 1.6534292499755607, "grad_norm": 0.15910027921199799, "learning_rate": 4.4889134234980224e-05, "loss": 0.6401, "mean_token_accuracy": 0.8030433356761932, "num_tokens": 573585476.0, "step": 17971 }, { "entropy": 0.5618000440299511, "epoch": 1.6535212563470019, "grad_norm": 0.15674936771392822, "learning_rate": 4.488606740883859e-05, "loss": 0.5604, "mean_token_accuracy": 0.8255190886557102, "num_tokens": 573617703.0, "step": 17972 }, { "entropy": 0.6311264140531421, "epoch": 1.6536132627184432, "grad_norm": 0.1619318127632141, "learning_rate": 4.4883000582696974e-05, "loss": 0.6249, "mean_token_accuracy": 0.8115505166351795, "num_tokens": 573649560.0, "step": 17973 }, { "entropy": 0.5248315057251602, "epoch": 1.6537052690898846, "grad_norm": 0.16045624017715454, "learning_rate": 4.487993375655534e-05, "loss": 0.5076, "mean_token_accuracy": 0.8437677621841431, "num_tokens": 573682081.0, "step": 17974 }, { "entropy": 0.5993173439055681, "epoch": 1.6537972754613257, "grad_norm": 0.16328375041484833, "learning_rate": 4.4876866930413716e-05, "loss": 0.6072, "mean_token_accuracy": 0.8186302036046982, "num_tokens": 573713881.0, "step": 17975 }, { "entropy": 0.6748819453641772, "epoch": 1.6538892818327668, "grad_norm": 0.15824632346630096, "learning_rate": 4.487380010427209e-05, "loss": 0.6639, "mean_token_accuracy": 0.7962042838335037, "num_tokens": 573746024.0, "step": 17976 }, { "entropy": 0.6088535785675049, "epoch": 1.653981288204208, "grad_norm": 0.16125556826591492, "learning_rate": 4.4870733278130465e-05, "loss": 0.5977, "mean_token_accuracy": 0.8158589638769627, "num_tokens": 573777351.0, "step": 17977 }, { "entropy": 0.5909535065293312, "epoch": 1.6540732945756493, "grad_norm": 0.15132007002830505, "learning_rate": 4.486766645198884e-05, "loss": 0.5807, "mean_token_accuracy": 0.8228648267686367, "num_tokens": 573809745.0, "step": 17978 }, { "entropy": 0.581357330083847, "epoch": 1.6541653009470907, "grad_norm": 0.15499013662338257, "learning_rate": 4.4864599625847215e-05, "loss": 0.5672, "mean_token_accuracy": 0.8310367651283741, "num_tokens": 573841563.0, "step": 17979 }, { "entropy": 0.7285208804532886, "epoch": 1.6542573073185318, "grad_norm": 0.1683715432882309, "learning_rate": 4.486153279970558e-05, "loss": 0.7155, "mean_token_accuracy": 0.7849111631512642, "num_tokens": 573873490.0, "step": 17980 }, { "entropy": 0.4626779002137482, "epoch": 1.654349313689973, "grad_norm": 0.14014169573783875, "learning_rate": 4.4858465973563964e-05, "loss": 0.4582, "mean_token_accuracy": 0.8576792739331722, "num_tokens": 573905613.0, "step": 17981 }, { "entropy": 0.6553596686571836, "epoch": 1.654441320061414, "grad_norm": 0.15550842881202698, "learning_rate": 4.485539914742233e-05, "loss": 0.6417, "mean_token_accuracy": 0.8036219291388988, "num_tokens": 573938037.0, "step": 17982 }, { "entropy": 0.6081982031464577, "epoch": 1.6545333264328554, "grad_norm": 0.15108229219913483, "learning_rate": 4.485233232128071e-05, "loss": 0.6016, "mean_token_accuracy": 0.8181911408901215, "num_tokens": 573970154.0, "step": 17983 }, { "entropy": 0.605467364192009, "epoch": 1.6546253328042968, "grad_norm": 0.15354520082473755, "learning_rate": 4.484926549513908e-05, "loss": 0.5917, "mean_token_accuracy": 0.8165123499929905, "num_tokens": 574002195.0, "step": 17984 }, { "entropy": 0.6613468565046787, "epoch": 1.654717339175738, "grad_norm": 0.16145452857017517, "learning_rate": 4.4846198668997456e-05, "loss": 0.6553, "mean_token_accuracy": 0.8029578104615211, "num_tokens": 574034224.0, "step": 17985 }, { "entropy": 0.6409602127969265, "epoch": 1.654809345547179, "grad_norm": 0.15660220384597778, "learning_rate": 4.484313184285583e-05, "loss": 0.6218, "mean_token_accuracy": 0.8044566921889782, "num_tokens": 574066142.0, "step": 17986 }, { "entropy": 0.5840492751449347, "epoch": 1.6549013519186202, "grad_norm": 0.14870376884937286, "learning_rate": 4.4840065016714205e-05, "loss": 0.5767, "mean_token_accuracy": 0.8179136738181114, "num_tokens": 574098151.0, "step": 17987 }, { "entropy": 0.6231877710670233, "epoch": 1.6549933582900616, "grad_norm": 0.15683306753635406, "learning_rate": 4.483699819057258e-05, "loss": 0.6147, "mean_token_accuracy": 0.8153428956866264, "num_tokens": 574130523.0, "step": 17988 }, { "entropy": 0.5288860891014338, "epoch": 1.655085364661503, "grad_norm": 0.14937537908554077, "learning_rate": 4.4833931364430954e-05, "loss": 0.5164, "mean_token_accuracy": 0.8417195864021778, "num_tokens": 574163291.0, "step": 17989 }, { "entropy": 0.5939929466694593, "epoch": 1.655177371032944, "grad_norm": 0.1521151065826416, "learning_rate": 4.483086453828932e-05, "loss": 0.5771, "mean_token_accuracy": 0.8204876147210598, "num_tokens": 574195151.0, "step": 17990 }, { "entropy": 0.6126599768176675, "epoch": 1.6552693774043852, "grad_norm": 0.1526506096124649, "learning_rate": 4.4827797712147704e-05, "loss": 0.592, "mean_token_accuracy": 0.8215601891279221, "num_tokens": 574226660.0, "step": 17991 }, { "entropy": 0.5961508238688111, "epoch": 1.6553613837758263, "grad_norm": 0.15564264357089996, "learning_rate": 4.482473088600607e-05, "loss": 0.5858, "mean_token_accuracy": 0.8171588219702244, "num_tokens": 574257997.0, "step": 17992 }, { "entropy": 0.6786542721092701, "epoch": 1.6554533901472677, "grad_norm": 0.1550474762916565, "learning_rate": 4.4821664059864446e-05, "loss": 0.6674, "mean_token_accuracy": 0.7968449853360653, "num_tokens": 574290290.0, "step": 17993 }, { "entropy": 0.5556579548865557, "epoch": 1.655545396518709, "grad_norm": 0.14843519032001495, "learning_rate": 4.481859723372282e-05, "loss": 0.5492, "mean_token_accuracy": 0.8333571441471577, "num_tokens": 574322392.0, "step": 17994 }, { "entropy": 0.5264284815639257, "epoch": 1.6556374028901502, "grad_norm": 0.1470731645822525, "learning_rate": 4.4815530407581196e-05, "loss": 0.5123, "mean_token_accuracy": 0.8408543653786182, "num_tokens": 574355050.0, "step": 17995 }, { "entropy": 0.6309391483664513, "epoch": 1.6557294092615913, "grad_norm": 0.155859112739563, "learning_rate": 4.481246358143957e-05, "loss": 0.6304, "mean_token_accuracy": 0.8053272739052773, "num_tokens": 574386641.0, "step": 17996 }, { "entropy": 0.7171065807342529, "epoch": 1.6558214156330324, "grad_norm": 0.163505420088768, "learning_rate": 4.4809396755297945e-05, "loss": 0.724, "mean_token_accuracy": 0.7797792814671993, "num_tokens": 574418253.0, "step": 17997 }, { "entropy": 0.5853305216878653, "epoch": 1.6559134220044738, "grad_norm": 0.15366053581237793, "learning_rate": 4.480632992915632e-05, "loss": 0.5766, "mean_token_accuracy": 0.8179108984768391, "num_tokens": 574450409.0, "step": 17998 }, { "entropy": 0.6691236579790711, "epoch": 1.6560054283759151, "grad_norm": 0.1576545238494873, "learning_rate": 4.4803263103014694e-05, "loss": 0.6632, "mean_token_accuracy": 0.7964361943304539, "num_tokens": 574482604.0, "step": 17999 }, { "entropy": 0.5664147809147835, "epoch": 1.6560974347473563, "grad_norm": 0.15642951428890228, "learning_rate": 4.480019627687307e-05, "loss": 0.5638, "mean_token_accuracy": 0.8253801055252552, "num_tokens": 574514554.0, "step": 18000 }, { "entropy": 0.5926323318853974, "epoch": 1.6561894411187974, "grad_norm": 0.1539933681488037, "learning_rate": 4.479712945073144e-05, "loss": 0.5852, "mean_token_accuracy": 0.8163289576768875, "num_tokens": 574546637.0, "step": 18001 }, { "entropy": 0.7828766703605652, "epoch": 1.6562814474902385, "grad_norm": 0.1716596931219101, "learning_rate": 4.479406262458982e-05, "loss": 0.7859, "mean_token_accuracy": 0.7655859664082527, "num_tokens": 574577724.0, "step": 18002 }, { "entropy": 0.6722813546657562, "epoch": 1.65637345386168, "grad_norm": 0.15629327297210693, "learning_rate": 4.4790995798448186e-05, "loss": 0.6741, "mean_token_accuracy": 0.7948299646377563, "num_tokens": 574609710.0, "step": 18003 }, { "entropy": 0.676087224856019, "epoch": 1.6564654602331212, "grad_norm": 0.16491396725177765, "learning_rate": 4.478792897230657e-05, "loss": 0.675, "mean_token_accuracy": 0.7926600277423859, "num_tokens": 574641085.0, "step": 18004 }, { "entropy": 0.5122663537040353, "epoch": 1.6565574666045624, "grad_norm": 0.14870163798332214, "learning_rate": 4.4784862146164935e-05, "loss": 0.5082, "mean_token_accuracy": 0.8416198119521141, "num_tokens": 574673431.0, "step": 18005 }, { "entropy": 0.6767975110560656, "epoch": 1.6566494729760035, "grad_norm": 0.15628117322921753, "learning_rate": 4.478179532002331e-05, "loss": 0.6624, "mean_token_accuracy": 0.8020676411688328, "num_tokens": 574705898.0, "step": 18006 }, { "entropy": 0.565249071456492, "epoch": 1.6567414793474446, "grad_norm": 0.15390987694263458, "learning_rate": 4.4778728493881685e-05, "loss": 0.5618, "mean_token_accuracy": 0.8299192301928997, "num_tokens": 574738098.0, "step": 18007 }, { "entropy": 0.6122033959254622, "epoch": 1.656833485718886, "grad_norm": 0.15633758902549744, "learning_rate": 4.477566166774006e-05, "loss": 0.6154, "mean_token_accuracy": 0.8182802796363831, "num_tokens": 574769950.0, "step": 18008 }, { "entropy": 0.5728526180610061, "epoch": 1.6569254920903274, "grad_norm": 0.15684911608695984, "learning_rate": 4.4772594841598434e-05, "loss": 0.5548, "mean_token_accuracy": 0.8282267674803734, "num_tokens": 574802535.0, "step": 18009 }, { "entropy": 0.6422329153865576, "epoch": 1.6570174984617685, "grad_norm": 0.1569713056087494, "learning_rate": 4.476952801545681e-05, "loss": 0.6266, "mean_token_accuracy": 0.8092595972120762, "num_tokens": 574835122.0, "step": 18010 }, { "entropy": 0.6445924863219261, "epoch": 1.6571095048332096, "grad_norm": 0.16070111095905304, "learning_rate": 4.4766461189315176e-05, "loss": 0.6193, "mean_token_accuracy": 0.8103103786706924, "num_tokens": 574866178.0, "step": 18011 }, { "entropy": 0.7145569063723087, "epoch": 1.6572015112046508, "grad_norm": 0.16655321419239044, "learning_rate": 4.476339436317356e-05, "loss": 0.6988, "mean_token_accuracy": 0.7878029011189938, "num_tokens": 574897727.0, "step": 18012 }, { "entropy": 0.5398356644436717, "epoch": 1.6572935175760921, "grad_norm": 0.1539754569530487, "learning_rate": 4.4760327537031926e-05, "loss": 0.5175, "mean_token_accuracy": 0.8408563993871212, "num_tokens": 574929938.0, "step": 18013 }, { "entropy": 0.6541794445365667, "epoch": 1.6573855239475335, "grad_norm": 0.1646013855934143, "learning_rate": 4.47572607108903e-05, "loss": 0.638, "mean_token_accuracy": 0.806171890348196, "num_tokens": 574961686.0, "step": 18014 }, { "entropy": 0.5441033514216542, "epoch": 1.6574775303189746, "grad_norm": 0.1459563821554184, "learning_rate": 4.4754193884748675e-05, "loss": 0.5378, "mean_token_accuracy": 0.8302698917686939, "num_tokens": 574994454.0, "step": 18015 }, { "entropy": 0.6258156914263964, "epoch": 1.6575695366904157, "grad_norm": 0.15591910481452942, "learning_rate": 4.475112705860705e-05, "loss": 0.6234, "mean_token_accuracy": 0.8127529136836529, "num_tokens": 575026808.0, "step": 18016 }, { "entropy": 0.6165930917486548, "epoch": 1.6576615430618569, "grad_norm": 0.15962758660316467, "learning_rate": 4.4748060232465424e-05, "loss": 0.5938, "mean_token_accuracy": 0.815124474465847, "num_tokens": 575058717.0, "step": 18017 }, { "entropy": 0.6671857684850693, "epoch": 1.6577535494332982, "grad_norm": 0.15718966722488403, "learning_rate": 4.47449934063238e-05, "loss": 0.6679, "mean_token_accuracy": 0.7953507862985134, "num_tokens": 575090590.0, "step": 18018 }, { "entropy": 0.6622865591198206, "epoch": 1.6578455558047396, "grad_norm": 0.15619085729122162, "learning_rate": 4.474192658018217e-05, "loss": 0.6489, "mean_token_accuracy": 0.8016753010451794, "num_tokens": 575122336.0, "step": 18019 }, { "entropy": 0.7343048304319382, "epoch": 1.6579375621761807, "grad_norm": 0.15941095352172852, "learning_rate": 4.473885975404055e-05, "loss": 0.723, "mean_token_accuracy": 0.7816201969981194, "num_tokens": 575154328.0, "step": 18020 }, { "entropy": 0.5882188137620687, "epoch": 1.6580295685476218, "grad_norm": 0.15025359392166138, "learning_rate": 4.4735792927898916e-05, "loss": 0.5815, "mean_token_accuracy": 0.8175830505788326, "num_tokens": 575186576.0, "step": 18021 }, { "entropy": 0.47512665623798966, "epoch": 1.658121574919063, "grad_norm": 0.14296835660934448, "learning_rate": 4.473272610175729e-05, "loss": 0.4564, "mean_token_accuracy": 0.8563417308032513, "num_tokens": 575218766.0, "step": 18022 }, { "entropy": 0.6392529550939798, "epoch": 1.6582135812905043, "grad_norm": 0.15784098207950592, "learning_rate": 4.4729659275615665e-05, "loss": 0.6208, "mean_token_accuracy": 0.8089197389781475, "num_tokens": 575250615.0, "step": 18023 }, { "entropy": 0.5476682130247355, "epoch": 1.6583055876619457, "grad_norm": 0.15785594284534454, "learning_rate": 4.472659244947404e-05, "loss": 0.5456, "mean_token_accuracy": 0.8344421908259392, "num_tokens": 575283050.0, "step": 18024 }, { "entropy": 0.6292442437261343, "epoch": 1.6583975940333868, "grad_norm": 0.16285869479179382, "learning_rate": 4.4723525623332415e-05, "loss": 0.6335, "mean_token_accuracy": 0.8117702640593052, "num_tokens": 575314701.0, "step": 18025 }, { "entropy": 0.5733131300657988, "epoch": 1.658489600404828, "grad_norm": 0.1561255306005478, "learning_rate": 4.472045879719079e-05, "loss": 0.5558, "mean_token_accuracy": 0.8313980139791965, "num_tokens": 575346735.0, "step": 18026 }, { "entropy": 0.5387018509209156, "epoch": 1.658581606776269, "grad_norm": 0.15365168452262878, "learning_rate": 4.4717391971049164e-05, "loss": 0.5226, "mean_token_accuracy": 0.8339833952486515, "num_tokens": 575378204.0, "step": 18027 }, { "entropy": 0.6024173479527235, "epoch": 1.6586736131477104, "grad_norm": 0.15534967184066772, "learning_rate": 4.471432514490754e-05, "loss": 0.6196, "mean_token_accuracy": 0.810537800192833, "num_tokens": 575410452.0, "step": 18028 }, { "entropy": 0.4977486040443182, "epoch": 1.6587656195191518, "grad_norm": 0.14928849041461945, "learning_rate": 4.471125831876591e-05, "loss": 0.4955, "mean_token_accuracy": 0.8493347801268101, "num_tokens": 575442223.0, "step": 18029 }, { "entropy": 0.5582638066262007, "epoch": 1.658857625890593, "grad_norm": 0.15241718292236328, "learning_rate": 4.470819149262429e-05, "loss": 0.5489, "mean_token_accuracy": 0.828496091067791, "num_tokens": 575474085.0, "step": 18030 }, { "entropy": 0.6555322324857116, "epoch": 1.658949632262034, "grad_norm": 0.16787773370742798, "learning_rate": 4.470512466648266e-05, "loss": 0.6601, "mean_token_accuracy": 0.8010609857738018, "num_tokens": 575506385.0, "step": 18031 }, { "entropy": 0.5325894011184573, "epoch": 1.6590416386334752, "grad_norm": 0.15075361728668213, "learning_rate": 4.470205784034103e-05, "loss": 0.5284, "mean_token_accuracy": 0.8350830264389515, "num_tokens": 575538367.0, "step": 18032 }, { "entropy": 0.5542085357010365, "epoch": 1.6591336450049166, "grad_norm": 0.15934138000011444, "learning_rate": 4.469899101419941e-05, "loss": 0.54, "mean_token_accuracy": 0.8295574113726616, "num_tokens": 575570192.0, "step": 18033 }, { "entropy": 0.6016766121610999, "epoch": 1.659225651376358, "grad_norm": 0.1560574173927307, "learning_rate": 4.469592418805778e-05, "loss": 0.5963, "mean_token_accuracy": 0.8211071714758873, "num_tokens": 575602070.0, "step": 18034 }, { "entropy": 0.5408251266926527, "epoch": 1.659317657747799, "grad_norm": 0.14993391931056976, "learning_rate": 4.4692857361916154e-05, "loss": 0.5268, "mean_token_accuracy": 0.8376109413802624, "num_tokens": 575634684.0, "step": 18035 }, { "entropy": 0.6589452493935823, "epoch": 1.6594096641192402, "grad_norm": 0.15621958673000336, "learning_rate": 4.468979053577453e-05, "loss": 0.653, "mean_token_accuracy": 0.8001441285014153, "num_tokens": 575667003.0, "step": 18036 }, { "entropy": 0.593667758628726, "epoch": 1.6595016704906813, "grad_norm": 0.15137933194637299, "learning_rate": 4.4686723709632904e-05, "loss": 0.5759, "mean_token_accuracy": 0.8210833743214607, "num_tokens": 575698351.0, "step": 18037 }, { "entropy": 0.5403475612401962, "epoch": 1.6595936768621227, "grad_norm": 0.14760014414787292, "learning_rate": 4.468365688349128e-05, "loss": 0.5227, "mean_token_accuracy": 0.8395303301513195, "num_tokens": 575730810.0, "step": 18038 }, { "entropy": 0.5782657535746694, "epoch": 1.659685683233564, "grad_norm": 0.15070763230323792, "learning_rate": 4.468059005734965e-05, "loss": 0.5744, "mean_token_accuracy": 0.8257276378571987, "num_tokens": 575762846.0, "step": 18039 }, { "entropy": 0.639416029676795, "epoch": 1.6597776896050052, "grad_norm": 0.15322303771972656, "learning_rate": 4.467752323120802e-05, "loss": 0.6166, "mean_token_accuracy": 0.8104389645159245, "num_tokens": 575794700.0, "step": 18040 }, { "entropy": 0.6674619149416685, "epoch": 1.6598696959764463, "grad_norm": 0.15668199956417084, "learning_rate": 4.46744564050664e-05, "loss": 0.6525, "mean_token_accuracy": 0.7993850521743298, "num_tokens": 575826837.0, "step": 18041 }, { "entropy": 0.6311318539083004, "epoch": 1.6599617023478876, "grad_norm": 0.14969155192375183, "learning_rate": 4.467138957892477e-05, "loss": 0.6201, "mean_token_accuracy": 0.8112843558192253, "num_tokens": 575859162.0, "step": 18042 }, { "entropy": 0.6716200290247798, "epoch": 1.6600537087193288, "grad_norm": 0.16001221537590027, "learning_rate": 4.466832275278315e-05, "loss": 0.6738, "mean_token_accuracy": 0.7948304712772369, "num_tokens": 575890905.0, "step": 18043 }, { "entropy": 0.6349484175443649, "epoch": 1.6601457150907701, "grad_norm": 0.1560164839029312, "learning_rate": 4.466525592664152e-05, "loss": 0.631, "mean_token_accuracy": 0.8057285770773888, "num_tokens": 575921864.0, "step": 18044 }, { "entropy": 0.6369542814791203, "epoch": 1.6602377214622113, "grad_norm": 0.15723901987075806, "learning_rate": 4.4662189100499894e-05, "loss": 0.6348, "mean_token_accuracy": 0.8078317530453205, "num_tokens": 575954041.0, "step": 18045 }, { "entropy": 0.5407876409590244, "epoch": 1.6603297278336524, "grad_norm": 0.1443590223789215, "learning_rate": 4.465912227435827e-05, "loss": 0.5305, "mean_token_accuracy": 0.835625272244215, "num_tokens": 575986308.0, "step": 18046 }, { "entropy": 0.6788274301216006, "epoch": 1.6604217342050938, "grad_norm": 0.1562638282775879, "learning_rate": 4.465605544821664e-05, "loss": 0.6687, "mean_token_accuracy": 0.7958102412521839, "num_tokens": 576018690.0, "step": 18047 }, { "entropy": 0.6338363294489682, "epoch": 1.660513740576535, "grad_norm": 0.15765050053596497, "learning_rate": 4.465298862207502e-05, "loss": 0.6311, "mean_token_accuracy": 0.8089170195162296, "num_tokens": 576051106.0, "step": 18048 }, { "entropy": 0.6894770171493292, "epoch": 1.6606057469479762, "grad_norm": 0.1649559736251831, "learning_rate": 4.464992179593339e-05, "loss": 0.6822, "mean_token_accuracy": 0.7903286702930927, "num_tokens": 576082495.0, "step": 18049 }, { "entropy": 0.6317182458005846, "epoch": 1.6606977533194174, "grad_norm": 0.1515890210866928, "learning_rate": 4.464685496979176e-05, "loss": 0.618, "mean_token_accuracy": 0.8131836988031864, "num_tokens": 576114649.0, "step": 18050 }, { "entropy": 0.6365022845566273, "epoch": 1.6607897596908585, "grad_norm": 0.15688291192054749, "learning_rate": 4.464378814365014e-05, "loss": 0.6118, "mean_token_accuracy": 0.809945821762085, "num_tokens": 576146766.0, "step": 18051 }, { "entropy": 0.6464200252667069, "epoch": 1.6608817660622999, "grad_norm": 0.16660159826278687, "learning_rate": 4.464072131750851e-05, "loss": 0.6404, "mean_token_accuracy": 0.8083170279860497, "num_tokens": 576178015.0, "step": 18052 }, { "entropy": 0.59038209868595, "epoch": 1.660973772433741, "grad_norm": 0.1621173769235611, "learning_rate": 4.4637654491366884e-05, "loss": 0.5828, "mean_token_accuracy": 0.8256188929080963, "num_tokens": 576210390.0, "step": 18053 }, { "entropy": 0.581020737066865, "epoch": 1.6610657788051824, "grad_norm": 0.15313515067100525, "learning_rate": 4.463458766522526e-05, "loss": 0.5768, "mean_token_accuracy": 0.8257301039993763, "num_tokens": 576242332.0, "step": 18054 }, { "entropy": 0.6416329499334097, "epoch": 1.6611577851766235, "grad_norm": 0.15685246884822845, "learning_rate": 4.4631520839083634e-05, "loss": 0.6281, "mean_token_accuracy": 0.8077561296522617, "num_tokens": 576274307.0, "step": 18055 }, { "entropy": 0.6184592470526695, "epoch": 1.6612497915480646, "grad_norm": 0.15535937249660492, "learning_rate": 4.462845401294201e-05, "loss": 0.618, "mean_token_accuracy": 0.8101210854947567, "num_tokens": 576306892.0, "step": 18056 }, { "entropy": 0.6015987703576684, "epoch": 1.661341797919506, "grad_norm": 0.14796172082424164, "learning_rate": 4.462538718680038e-05, "loss": 0.5894, "mean_token_accuracy": 0.8206216432154179, "num_tokens": 576339660.0, "step": 18057 }, { "entropy": 0.7084956783801317, "epoch": 1.6614338042909471, "grad_norm": 0.15969395637512207, "learning_rate": 4.462232036065875e-05, "loss": 0.6986, "mean_token_accuracy": 0.7900053635239601, "num_tokens": 576371996.0, "step": 18058 }, { "entropy": 0.6259436700493097, "epoch": 1.6615258106623885, "grad_norm": 0.16362084448337555, "learning_rate": 4.461925353451713e-05, "loss": 0.6215, "mean_token_accuracy": 0.809430293738842, "num_tokens": 576403825.0, "step": 18059 }, { "entropy": 0.6428906721994281, "epoch": 1.6616178170338296, "grad_norm": 0.1586197167634964, "learning_rate": 4.461618670837551e-05, "loss": 0.6324, "mean_token_accuracy": 0.8080931305885315, "num_tokens": 576435185.0, "step": 18060 }, { "entropy": 0.6050984053872526, "epoch": 1.6617098234052707, "grad_norm": 0.15473002195358276, "learning_rate": 4.4613119882233875e-05, "loss": 0.5762, "mean_token_accuracy": 0.82209886983037, "num_tokens": 576466683.0, "step": 18061 }, { "entropy": 0.6777467969805002, "epoch": 1.661801829776712, "grad_norm": 0.15761470794677734, "learning_rate": 4.4610053056092256e-05, "loss": 0.6684, "mean_token_accuracy": 0.792513981461525, "num_tokens": 576498468.0, "step": 18062 }, { "entropy": 0.6535167992115021, "epoch": 1.6618938361481532, "grad_norm": 0.15369409322738647, "learning_rate": 4.4606986229950624e-05, "loss": 0.66, "mean_token_accuracy": 0.7947251163423061, "num_tokens": 576530587.0, "step": 18063 }, { "entropy": 0.5358627373352647, "epoch": 1.6619858425195946, "grad_norm": 0.14965586364269257, "learning_rate": 4.4603919403809006e-05, "loss": 0.5313, "mean_token_accuracy": 0.8341746106743813, "num_tokens": 576563207.0, "step": 18064 }, { "entropy": 0.8105085473507643, "epoch": 1.6620778488910357, "grad_norm": 0.16916175186634064, "learning_rate": 4.4600852577667373e-05, "loss": 0.8092, "mean_token_accuracy": 0.7569985836744308, "num_tokens": 576594342.0, "step": 18065 }, { "entropy": 0.5040823016315699, "epoch": 1.6621698552624768, "grad_norm": 0.14731627702713013, "learning_rate": 4.459778575152575e-05, "loss": 0.4913, "mean_token_accuracy": 0.8472427725791931, "num_tokens": 576626040.0, "step": 18066 }, { "entropy": 0.5588035881519318, "epoch": 1.6622618616339182, "grad_norm": 0.15176689624786377, "learning_rate": 4.459471892538412e-05, "loss": 0.5404, "mean_token_accuracy": 0.8343801163136959, "num_tokens": 576657867.0, "step": 18067 }, { "entropy": 0.5697964075952768, "epoch": 1.6623538680053593, "grad_norm": 0.15220338106155396, "learning_rate": 4.45916520992425e-05, "loss": 0.5593, "mean_token_accuracy": 0.8273047469556332, "num_tokens": 576689604.0, "step": 18068 }, { "entropy": 0.6615147697739303, "epoch": 1.6624458743768007, "grad_norm": 0.1555754542350769, "learning_rate": 4.458858527310087e-05, "loss": 0.6606, "mean_token_accuracy": 0.8003087639808655, "num_tokens": 576721897.0, "step": 18069 }, { "entropy": 0.6551344562321901, "epoch": 1.6625378807482418, "grad_norm": 0.15769724547863007, "learning_rate": 4.458551844695925e-05, "loss": 0.6389, "mean_token_accuracy": 0.8010283149778843, "num_tokens": 576752916.0, "step": 18070 }, { "entropy": 0.7021841937676072, "epoch": 1.662629887119683, "grad_norm": 0.1589888036251068, "learning_rate": 4.4582451620817615e-05, "loss": 0.6861, "mean_token_accuracy": 0.7886137627065182, "num_tokens": 576784246.0, "step": 18071 }, { "entropy": 0.6296205641701818, "epoch": 1.6627218934911243, "grad_norm": 0.15507464110851288, "learning_rate": 4.4579384794675996e-05, "loss": 0.6217, "mean_token_accuracy": 0.8047246560454369, "num_tokens": 576816066.0, "step": 18072 }, { "entropy": 0.624412689357996, "epoch": 1.6628138998625654, "grad_norm": 0.16192443668842316, "learning_rate": 4.4576317968534364e-05, "loss": 0.618, "mean_token_accuracy": 0.8092009052634239, "num_tokens": 576847775.0, "step": 18073 }, { "entropy": 0.6891696527600288, "epoch": 1.6629059062340068, "grad_norm": 0.15934064984321594, "learning_rate": 4.457325114239274e-05, "loss": 0.6863, "mean_token_accuracy": 0.7920280583202839, "num_tokens": 576879474.0, "step": 18074 }, { "entropy": 0.47494963370263577, "epoch": 1.662997912605448, "grad_norm": 0.14858165383338928, "learning_rate": 4.457018431625111e-05, "loss": 0.4631, "mean_token_accuracy": 0.8558255955576897, "num_tokens": 576912242.0, "step": 18075 }, { "entropy": 0.6773597132414579, "epoch": 1.663089918976889, "grad_norm": 0.15910103917121887, "learning_rate": 4.456711749010949e-05, "loss": 0.6668, "mean_token_accuracy": 0.7930590733885765, "num_tokens": 576943918.0, "step": 18076 }, { "entropy": 0.6217924081720412, "epoch": 1.6631819253483304, "grad_norm": 0.1417572945356369, "learning_rate": 4.456405066396786e-05, "loss": 0.6041, "mean_token_accuracy": 0.8149918057024479, "num_tokens": 576976318.0, "step": 18077 }, { "entropy": 0.5203657187521458, "epoch": 1.6632739317197716, "grad_norm": 0.15324446558952332, "learning_rate": 4.456098383782624e-05, "loss": 0.5155, "mean_token_accuracy": 0.8414462804794312, "num_tokens": 577008414.0, "step": 18078 }, { "entropy": 0.7582183182239532, "epoch": 1.663365938091213, "grad_norm": 0.16705526411533356, "learning_rate": 4.4557917011684605e-05, "loss": 0.7498, "mean_token_accuracy": 0.7728880867362022, "num_tokens": 577040757.0, "step": 18079 }, { "entropy": 0.6663035154342651, "epoch": 1.663457944462654, "grad_norm": 0.1651802361011505, "learning_rate": 4.4554850185542986e-05, "loss": 0.6423, "mean_token_accuracy": 0.8007744699716568, "num_tokens": 577073045.0, "step": 18080 }, { "entropy": 0.5788248546887189, "epoch": 1.6635499508340952, "grad_norm": 0.14677536487579346, "learning_rate": 4.4551783359401354e-05, "loss": 0.5581, "mean_token_accuracy": 0.8291273899376392, "num_tokens": 577105382.0, "step": 18081 }, { "entropy": 0.6929194377735257, "epoch": 1.6636419572055365, "grad_norm": 0.16172794997692108, "learning_rate": 4.454871653325973e-05, "loss": 0.6831, "mean_token_accuracy": 0.7931446358561516, "num_tokens": 577137709.0, "step": 18082 }, { "entropy": 0.5968289412558079, "epoch": 1.6637339635769777, "grad_norm": 0.15605302155017853, "learning_rate": 4.4545649707118104e-05, "loss": 0.5833, "mean_token_accuracy": 0.8195335678756237, "num_tokens": 577170417.0, "step": 18083 }, { "entropy": 0.6125463917851448, "epoch": 1.663825969948419, "grad_norm": 0.14706481993198395, "learning_rate": 4.454258288097648e-05, "loss": 0.5961, "mean_token_accuracy": 0.8173158839344978, "num_tokens": 577202185.0, "step": 18084 }, { "entropy": 0.645797586068511, "epoch": 1.6639179763198602, "grad_norm": 0.15359027683734894, "learning_rate": 4.453951605483485e-05, "loss": 0.6296, "mean_token_accuracy": 0.805704690515995, "num_tokens": 577234684.0, "step": 18085 }, { "entropy": 0.635418669320643, "epoch": 1.6640099826913013, "grad_norm": 0.1586684286594391, "learning_rate": 4.453644922869323e-05, "loss": 0.6229, "mean_token_accuracy": 0.8088104762136936, "num_tokens": 577265614.0, "step": 18086 }, { "entropy": 0.6293468838557601, "epoch": 1.6641019890627426, "grad_norm": 0.1624356359243393, "learning_rate": 4.45333824025516e-05, "loss": 0.6272, "mean_token_accuracy": 0.8087403103709221, "num_tokens": 577297495.0, "step": 18087 }, { "entropy": 0.5674877078272402, "epoch": 1.6641939954341838, "grad_norm": 0.14954060316085815, "learning_rate": 4.453031557640998e-05, "loss": 0.5539, "mean_token_accuracy": 0.8275160752236843, "num_tokens": 577329556.0, "step": 18088 }, { "entropy": 0.549138767644763, "epoch": 1.6642860018056251, "grad_norm": 0.1459449976682663, "learning_rate": 4.452724875026835e-05, "loss": 0.5465, "mean_token_accuracy": 0.8272685520350933, "num_tokens": 577361436.0, "step": 18089 }, { "entropy": 0.6353329587727785, "epoch": 1.6643780081770663, "grad_norm": 0.16101127862930298, "learning_rate": 4.4524181924126726e-05, "loss": 0.6329, "mean_token_accuracy": 0.805918488651514, "num_tokens": 577393509.0, "step": 18090 }, { "entropy": 0.6423663087189198, "epoch": 1.6644700145485074, "grad_norm": 0.1620064526796341, "learning_rate": 4.45211150979851e-05, "loss": 0.6458, "mean_token_accuracy": 0.803744163364172, "num_tokens": 577425078.0, "step": 18091 }, { "entropy": 0.7446543592959642, "epoch": 1.6645620209199488, "grad_norm": 0.1655103862285614, "learning_rate": 4.451804827184347e-05, "loss": 0.7546, "mean_token_accuracy": 0.7709299512207508, "num_tokens": 577457713.0, "step": 18092 }, { "entropy": 0.5488154962658882, "epoch": 1.66465402729139, "grad_norm": 0.15062011778354645, "learning_rate": 4.451498144570185e-05, "loss": 0.5495, "mean_token_accuracy": 0.828723669052124, "num_tokens": 577490120.0, "step": 18093 }, { "entropy": 0.5786855267360806, "epoch": 1.6647460336628312, "grad_norm": 0.1497105211019516, "learning_rate": 4.451191461956022e-05, "loss": 0.5784, "mean_token_accuracy": 0.8205403201282024, "num_tokens": 577521951.0, "step": 18094 }, { "entropy": 0.5943891108036041, "epoch": 1.6648380400342724, "grad_norm": 0.1482742428779602, "learning_rate": 4.450884779341859e-05, "loss": 0.5797, "mean_token_accuracy": 0.8235910944640636, "num_tokens": 577554421.0, "step": 18095 }, { "entropy": 0.6590743232518435, "epoch": 1.6649300464057135, "grad_norm": 0.15776947140693665, "learning_rate": 4.450578096727697e-05, "loss": 0.639, "mean_token_accuracy": 0.8031991831958294, "num_tokens": 577586355.0, "step": 18096 }, { "entropy": 0.5885818435344845, "epoch": 1.6650220527771549, "grad_norm": 0.15594454109668732, "learning_rate": 4.450271414113534e-05, "loss": 0.564, "mean_token_accuracy": 0.8255924917757511, "num_tokens": 577617539.0, "step": 18097 }, { "entropy": 0.6469578687101603, "epoch": 1.665114059148596, "grad_norm": 0.16511377692222595, "learning_rate": 4.4499647314993716e-05, "loss": 0.6363, "mean_token_accuracy": 0.8060152977705002, "num_tokens": 577648481.0, "step": 18098 }, { "entropy": 0.576120575889945, "epoch": 1.6652060655200374, "grad_norm": 0.15868811309337616, "learning_rate": 4.449658048885209e-05, "loss": 0.5543, "mean_token_accuracy": 0.828580129891634, "num_tokens": 577679896.0, "step": 18099 }, { "entropy": 0.5471557476557791, "epoch": 1.6652980718914785, "grad_norm": 0.14702175557613373, "learning_rate": 4.449351366271046e-05, "loss": 0.528, "mean_token_accuracy": 0.8355026841163635, "num_tokens": 577712196.0, "step": 18100 }, { "entropy": 0.6738431006669998, "epoch": 1.6653900782629196, "grad_norm": 0.15502560138702393, "learning_rate": 4.449044683656884e-05, "loss": 0.6615, "mean_token_accuracy": 0.7954094856977463, "num_tokens": 577744442.0, "step": 18101 }, { "entropy": 0.5924012567847967, "epoch": 1.665482084634361, "grad_norm": 0.1584709882736206, "learning_rate": 4.448738001042721e-05, "loss": 0.5908, "mean_token_accuracy": 0.8177027031779289, "num_tokens": 577775994.0, "step": 18102 }, { "entropy": 0.5393248219043016, "epoch": 1.6655740910058021, "grad_norm": 0.15077567100524902, "learning_rate": 4.448431318428559e-05, "loss": 0.5268, "mean_token_accuracy": 0.8375218026340008, "num_tokens": 577807736.0, "step": 18103 }, { "entropy": 0.5710276253521442, "epoch": 1.6656660973772435, "grad_norm": 0.15304119884967804, "learning_rate": 4.448124635814396e-05, "loss": 0.5594, "mean_token_accuracy": 0.8265897668898106, "num_tokens": 577839753.0, "step": 18104 }, { "entropy": 0.6308994358405471, "epoch": 1.6657581037486846, "grad_norm": 0.15975964069366455, "learning_rate": 4.447817953200233e-05, "loss": 0.6148, "mean_token_accuracy": 0.8062648996710777, "num_tokens": 577871216.0, "step": 18105 }, { "entropy": 0.6061580181121826, "epoch": 1.6658501101201257, "grad_norm": 0.15545488893985748, "learning_rate": 4.447511270586071e-05, "loss": 0.5953, "mean_token_accuracy": 0.8147757835686207, "num_tokens": 577901830.0, "step": 18106 }, { "entropy": 0.6364169307053089, "epoch": 1.665942116491567, "grad_norm": 0.16477392613887787, "learning_rate": 4.447204587971908e-05, "loss": 0.6312, "mean_token_accuracy": 0.8100823014974594, "num_tokens": 577934191.0, "step": 18107 }, { "entropy": 0.6537208277732134, "epoch": 1.6660341228630082, "grad_norm": 0.161940336227417, "learning_rate": 4.4468979053577456e-05, "loss": 0.6445, "mean_token_accuracy": 0.8033558838069439, "num_tokens": 577965471.0, "step": 18108 }, { "entropy": 0.6455942466855049, "epoch": 1.6661261292344496, "grad_norm": 0.1636590212583542, "learning_rate": 4.446591222743583e-05, "loss": 0.6445, "mean_token_accuracy": 0.8049628026783466, "num_tokens": 577996535.0, "step": 18109 }, { "entropy": 0.6286803688853979, "epoch": 1.6662181356058907, "grad_norm": 0.15461444854736328, "learning_rate": 4.44628454012942e-05, "loss": 0.6286, "mean_token_accuracy": 0.8087188154459, "num_tokens": 578028520.0, "step": 18110 }, { "entropy": 0.6219283835962415, "epoch": 1.6663101419773318, "grad_norm": 0.15693344175815582, "learning_rate": 4.445977857515258e-05, "loss": 0.6124, "mean_token_accuracy": 0.811643410474062, "num_tokens": 578060932.0, "step": 18111 }, { "entropy": 0.5503249280154705, "epoch": 1.6664021483487732, "grad_norm": 0.14652983844280243, "learning_rate": 4.445671174901095e-05, "loss": 0.5302, "mean_token_accuracy": 0.8322583511471748, "num_tokens": 578092633.0, "step": 18112 }, { "entropy": 0.5998499859124422, "epoch": 1.6664941547202143, "grad_norm": 0.15826961398124695, "learning_rate": 4.445364492286932e-05, "loss": 0.5997, "mean_token_accuracy": 0.815842404961586, "num_tokens": 578124631.0, "step": 18113 }, { "entropy": 0.5785106457769871, "epoch": 1.6665861610916557, "grad_norm": 0.1560920923948288, "learning_rate": 4.44505780967277e-05, "loss": 0.5665, "mean_token_accuracy": 0.8253421187400818, "num_tokens": 578156545.0, "step": 18114 }, { "entropy": 0.657822210341692, "epoch": 1.6666781674630968, "grad_norm": 0.15836170315742493, "learning_rate": 4.444751127058607e-05, "loss": 0.6524, "mean_token_accuracy": 0.8046371079981327, "num_tokens": 578187741.0, "step": 18115 }, { "entropy": 0.5403626812621951, "epoch": 1.666770173834538, "grad_norm": 0.1483544111251831, "learning_rate": 4.4444444444444447e-05, "loss": 0.5343, "mean_token_accuracy": 0.8344581462442875, "num_tokens": 578219545.0, "step": 18116 }, { "entropy": 0.6916290754452348, "epoch": 1.6668621802059793, "grad_norm": 0.15794293582439423, "learning_rate": 4.444137761830282e-05, "loss": 0.676, "mean_token_accuracy": 0.7941446378827095, "num_tokens": 578251212.0, "step": 18117 }, { "entropy": 0.6080209091305733, "epoch": 1.6669541865774204, "grad_norm": 0.15454481542110443, "learning_rate": 4.443831079216119e-05, "loss": 0.6001, "mean_token_accuracy": 0.8159416802227497, "num_tokens": 578282881.0, "step": 18118 }, { "entropy": 0.6529159937053919, "epoch": 1.6670461929488618, "grad_norm": 0.15454067289829254, "learning_rate": 4.443524396601957e-05, "loss": 0.6385, "mean_token_accuracy": 0.8025971613824368, "num_tokens": 578314823.0, "step": 18119 }, { "entropy": 0.6256624180823565, "epoch": 1.667138199320303, "grad_norm": 0.15087811648845673, "learning_rate": 4.4432177139877945e-05, "loss": 0.6076, "mean_token_accuracy": 0.8081984259188175, "num_tokens": 578346269.0, "step": 18120 }, { "entropy": 0.6432315008714795, "epoch": 1.667230205691744, "grad_norm": 0.15455397963523865, "learning_rate": 4.442911031373631e-05, "loss": 0.6244, "mean_token_accuracy": 0.8097775168716908, "num_tokens": 578378110.0, "step": 18121 }, { "entropy": 0.6592534841038287, "epoch": 1.6673222120631854, "grad_norm": 0.17277754843235016, "learning_rate": 4.4426043487594694e-05, "loss": 0.6483, "mean_token_accuracy": 0.8057345449924469, "num_tokens": 578409617.0, "step": 18122 }, { "entropy": 0.5327677791938186, "epoch": 1.6674142184346266, "grad_norm": 0.14881767332553864, "learning_rate": 4.442297666145306e-05, "loss": 0.5052, "mean_token_accuracy": 0.8422058187425137, "num_tokens": 578441305.0, "step": 18123 }, { "entropy": 0.7107112612575293, "epoch": 1.667506224806068, "grad_norm": 0.16556581854820251, "learning_rate": 4.4419909835311444e-05, "loss": 0.689, "mean_token_accuracy": 0.7862027511000633, "num_tokens": 578473056.0, "step": 18124 }, { "entropy": 0.5910538733005524, "epoch": 1.667598231177509, "grad_norm": 0.15353074669837952, "learning_rate": 4.441684300916981e-05, "loss": 0.5949, "mean_token_accuracy": 0.8182858824729919, "num_tokens": 578504182.0, "step": 18125 }, { "entropy": 0.7040506424382329, "epoch": 1.6676902375489502, "grad_norm": 0.1648697853088379, "learning_rate": 4.4413776183028186e-05, "loss": 0.7016, "mean_token_accuracy": 0.7835803776979446, "num_tokens": 578535013.0, "step": 18126 }, { "entropy": 0.48364877328276634, "epoch": 1.6677822439203915, "grad_norm": 0.14766520261764526, "learning_rate": 4.441070935688656e-05, "loss": 0.4701, "mean_token_accuracy": 0.8531778007745743, "num_tokens": 578567176.0, "step": 18127 }, { "entropy": 0.5603998443111777, "epoch": 1.6678742502918327, "grad_norm": 0.14873658120632172, "learning_rate": 4.4407642530744936e-05, "loss": 0.5545, "mean_token_accuracy": 0.8285655789077282, "num_tokens": 578599180.0, "step": 18128 }, { "entropy": 0.709986605681479, "epoch": 1.667966256663274, "grad_norm": 0.16415710747241974, "learning_rate": 4.440457570460331e-05, "loss": 0.6994, "mean_token_accuracy": 0.7871778719127178, "num_tokens": 578630770.0, "step": 18129 }, { "entropy": 0.6075197383761406, "epoch": 1.6680582630347152, "grad_norm": 0.1502065658569336, "learning_rate": 4.4401508878461685e-05, "loss": 0.6035, "mean_token_accuracy": 0.8143816106021404, "num_tokens": 578663284.0, "step": 18130 }, { "entropy": 0.606867897324264, "epoch": 1.6681502694061563, "grad_norm": 0.15098769962787628, "learning_rate": 4.439844205232005e-05, "loss": 0.5966, "mean_token_accuracy": 0.8233256116509438, "num_tokens": 578695381.0, "step": 18131 }, { "entropy": 0.6262895371764898, "epoch": 1.6682422757775976, "grad_norm": 0.153891921043396, "learning_rate": 4.4395375226178434e-05, "loss": 0.6275, "mean_token_accuracy": 0.8085298612713814, "num_tokens": 578727435.0, "step": 18132 }, { "entropy": 0.6152610073331743, "epoch": 1.6683342821490388, "grad_norm": 0.159868523478508, "learning_rate": 4.43923084000368e-05, "loss": 0.6126, "mean_token_accuracy": 0.8105676174163818, "num_tokens": 578759227.0, "step": 18133 }, { "entropy": 0.6172127472236753, "epoch": 1.6684262885204801, "grad_norm": 0.1568783074617386, "learning_rate": 4.438924157389518e-05, "loss": 0.6015, "mean_token_accuracy": 0.8161834441125393, "num_tokens": 578791419.0, "step": 18134 }, { "entropy": 0.6388647239655256, "epoch": 1.6685182948919213, "grad_norm": 0.15400925278663635, "learning_rate": 4.438617474775355e-05, "loss": 0.6288, "mean_token_accuracy": 0.8039311058819294, "num_tokens": 578823570.0, "step": 18135 }, { "entropy": 0.6438169358298182, "epoch": 1.6686103012633624, "grad_norm": 0.16099874675273895, "learning_rate": 4.4383107921611926e-05, "loss": 0.6452, "mean_token_accuracy": 0.803695023059845, "num_tokens": 578856336.0, "step": 18136 }, { "entropy": 0.6055660881102085, "epoch": 1.6687023076348038, "grad_norm": 0.15763571858406067, "learning_rate": 4.43800410954703e-05, "loss": 0.5934, "mean_token_accuracy": 0.8154997304081917, "num_tokens": 578887982.0, "step": 18137 }, { "entropy": 0.4689360617194325, "epoch": 1.668794314006245, "grad_norm": 0.14584365487098694, "learning_rate": 4.4376974269328675e-05, "loss": 0.4503, "mean_token_accuracy": 0.8579132333397865, "num_tokens": 578919754.0, "step": 18138 }, { "entropy": 0.6055549141019583, "epoch": 1.6688863203776862, "grad_norm": 0.15443217754364014, "learning_rate": 4.437390744318704e-05, "loss": 0.5961, "mean_token_accuracy": 0.8207067400217056, "num_tokens": 578951947.0, "step": 18139 }, { "entropy": 0.5538912629708648, "epoch": 1.6689783267491274, "grad_norm": 0.14908693730831146, "learning_rate": 4.4370840617045425e-05, "loss": 0.5477, "mean_token_accuracy": 0.8346233442425728, "num_tokens": 578983477.0, "step": 18140 }, { "entropy": 0.6502531692385674, "epoch": 1.6690703331205685, "grad_norm": 0.16029676795005798, "learning_rate": 4.436777379090379e-05, "loss": 0.6469, "mean_token_accuracy": 0.800416387617588, "num_tokens": 579015155.0, "step": 18141 }, { "entropy": 0.6004307097755373, "epoch": 1.6691623394920099, "grad_norm": 0.16278813779354095, "learning_rate": 4.4364706964762174e-05, "loss": 0.5913, "mean_token_accuracy": 0.817766971886158, "num_tokens": 579046481.0, "step": 18142 }, { "entropy": 0.5538263600319624, "epoch": 1.669254345863451, "grad_norm": 0.14893732964992523, "learning_rate": 4.436164013862054e-05, "loss": 0.5398, "mean_token_accuracy": 0.83177300542593, "num_tokens": 579079204.0, "step": 18143 }, { "entropy": 0.5738144107162952, "epoch": 1.6693463522348924, "grad_norm": 0.15234892070293427, "learning_rate": 4.4358573312478916e-05, "loss": 0.5665, "mean_token_accuracy": 0.8262820281088352, "num_tokens": 579111278.0, "step": 18144 }, { "entropy": 0.64921710267663, "epoch": 1.6694383586063335, "grad_norm": 0.1583639234304428, "learning_rate": 4.435550648633729e-05, "loss": 0.6429, "mean_token_accuracy": 0.8040217906236649, "num_tokens": 579142799.0, "step": 18145 }, { "entropy": 0.5605803392827511, "epoch": 1.6695303649777746, "grad_norm": 0.15677690505981445, "learning_rate": 4.4352439660195666e-05, "loss": 0.5617, "mean_token_accuracy": 0.8217168860137463, "num_tokens": 579174301.0, "step": 18146 }, { "entropy": 0.45065529691055417, "epoch": 1.669622371349216, "grad_norm": 0.1422102153301239, "learning_rate": 4.434937283405404e-05, "loss": 0.429, "mean_token_accuracy": 0.8668825104832649, "num_tokens": 579206546.0, "step": 18147 }, { "entropy": 0.5312519897706807, "epoch": 1.6697143777206571, "grad_norm": 0.154485285282135, "learning_rate": 4.4346306007912415e-05, "loss": 0.5166, "mean_token_accuracy": 0.8405753187835217, "num_tokens": 579238855.0, "step": 18148 }, { "entropy": 0.7315480634570122, "epoch": 1.6698063840920985, "grad_norm": 0.16272255778312683, "learning_rate": 4.434323918177078e-05, "loss": 0.7322, "mean_token_accuracy": 0.7760665714740753, "num_tokens": 579271048.0, "step": 18149 }, { "entropy": 0.6605300009250641, "epoch": 1.6698983904635396, "grad_norm": 0.15959668159484863, "learning_rate": 4.4340172355629164e-05, "loss": 0.6445, "mean_token_accuracy": 0.8047159239649773, "num_tokens": 579303013.0, "step": 18150 }, { "entropy": 0.5857319196220487, "epoch": 1.6699903968349807, "grad_norm": 0.1500224471092224, "learning_rate": 4.433710552948754e-05, "loss": 0.5718, "mean_token_accuracy": 0.8207821659743786, "num_tokens": 579335388.0, "step": 18151 }, { "entropy": 0.5609546285122633, "epoch": 1.670082403206422, "grad_norm": 0.14816004037857056, "learning_rate": 4.433403870334591e-05, "loss": 0.5494, "mean_token_accuracy": 0.8289247862994671, "num_tokens": 579367708.0, "step": 18152 }, { "entropy": 0.6107095871120691, "epoch": 1.6701744095778632, "grad_norm": 0.15753932297229767, "learning_rate": 4.433097187720429e-05, "loss": 0.5899, "mean_token_accuracy": 0.8184393271803856, "num_tokens": 579399826.0, "step": 18153 }, { "entropy": 0.573121593799442, "epoch": 1.6702664159493046, "grad_norm": 0.15018294751644135, "learning_rate": 4.4327905051062656e-05, "loss": 0.5545, "mean_token_accuracy": 0.827273566275835, "num_tokens": 579432304.0, "step": 18154 }, { "entropy": 0.6720980815589428, "epoch": 1.6703584223207457, "grad_norm": 0.16012856364250183, "learning_rate": 4.432483822492103e-05, "loss": 0.6523, "mean_token_accuracy": 0.8044956363737583, "num_tokens": 579463273.0, "step": 18155 }, { "entropy": 0.5838097613304853, "epoch": 1.6704504286921869, "grad_norm": 0.15854519605636597, "learning_rate": 4.4321771398779405e-05, "loss": 0.5788, "mean_token_accuracy": 0.8223811946809292, "num_tokens": 579494950.0, "step": 18156 }, { "entropy": 0.6763705778867006, "epoch": 1.6705424350636282, "grad_norm": 0.15640713274478912, "learning_rate": 4.431870457263778e-05, "loss": 0.6692, "mean_token_accuracy": 0.795939601957798, "num_tokens": 579526716.0, "step": 18157 }, { "entropy": 0.6668069083243608, "epoch": 1.6706344414350693, "grad_norm": 0.1662401407957077, "learning_rate": 4.4315637746496155e-05, "loss": 0.6588, "mean_token_accuracy": 0.7992674000561237, "num_tokens": 579557517.0, "step": 18158 }, { "entropy": 0.6225216332823038, "epoch": 1.6707264478065107, "grad_norm": 0.1515757292509079, "learning_rate": 4.431257092035453e-05, "loss": 0.6123, "mean_token_accuracy": 0.8077355176210403, "num_tokens": 579589712.0, "step": 18159 }, { "entropy": 0.6177056459710002, "epoch": 1.6708184541779518, "grad_norm": 0.1538446992635727, "learning_rate": 4.43095040942129e-05, "loss": 0.6178, "mean_token_accuracy": 0.8117533065378666, "num_tokens": 579621924.0, "step": 18160 }, { "entropy": 0.4675157438032329, "epoch": 1.670910460549393, "grad_norm": 0.14244891703128815, "learning_rate": 4.430643726807128e-05, "loss": 0.4464, "mean_token_accuracy": 0.8604089841246605, "num_tokens": 579654321.0, "step": 18161 }, { "entropy": 0.6136738173663616, "epoch": 1.6710024669208343, "grad_norm": 0.16191346943378448, "learning_rate": 4.4303370441929646e-05, "loss": 0.617, "mean_token_accuracy": 0.811640877276659, "num_tokens": 579686487.0, "step": 18162 }, { "entropy": 0.5570085868239403, "epoch": 1.6710944732922755, "grad_norm": 0.16172261536121368, "learning_rate": 4.430030361578803e-05, "loss": 0.5375, "mean_token_accuracy": 0.8346844650804996, "num_tokens": 579718233.0, "step": 18163 }, { "entropy": 0.4997693384066224, "epoch": 1.6711864796637168, "grad_norm": 0.14287161827087402, "learning_rate": 4.4297236789646396e-05, "loss": 0.4907, "mean_token_accuracy": 0.8512484356760979, "num_tokens": 579750281.0, "step": 18164 }, { "entropy": 0.6568299010396004, "epoch": 1.671278486035158, "grad_norm": 0.15553025901317596, "learning_rate": 4.429416996350477e-05, "loss": 0.6426, "mean_token_accuracy": 0.8033244535326958, "num_tokens": 579782656.0, "step": 18165 }, { "entropy": 0.6849106717854738, "epoch": 1.671370492406599, "grad_norm": 0.1587713360786438, "learning_rate": 4.4291103137363145e-05, "loss": 0.6848, "mean_token_accuracy": 0.7916042283177376, "num_tokens": 579814543.0, "step": 18166 }, { "entropy": 0.6232204819098115, "epoch": 1.6714624987780404, "grad_norm": 0.15416614711284637, "learning_rate": 4.428803631122152e-05, "loss": 0.6093, "mean_token_accuracy": 0.8151821978390217, "num_tokens": 579846463.0, "step": 18167 }, { "entropy": 0.6244965754449368, "epoch": 1.6715545051494816, "grad_norm": 0.16342145204544067, "learning_rate": 4.4284969485079894e-05, "loss": 0.6199, "mean_token_accuracy": 0.8069352470338345, "num_tokens": 579878753.0, "step": 18168 }, { "entropy": 0.48759941570460796, "epoch": 1.671646511520923, "grad_norm": 0.1460922509431839, "learning_rate": 4.428190265893827e-05, "loss": 0.4746, "mean_token_accuracy": 0.8515124246478081, "num_tokens": 579910275.0, "step": 18169 }, { "entropy": 0.6374774109572172, "epoch": 1.671738517892364, "grad_norm": 0.1613079458475113, "learning_rate": 4.427883583279664e-05, "loss": 0.6242, "mean_token_accuracy": 0.8101133890450001, "num_tokens": 579941890.0, "step": 18170 }, { "entropy": 0.5232750354334712, "epoch": 1.6718305242638052, "grad_norm": 0.16037452220916748, "learning_rate": 4.427576900665502e-05, "loss": 0.5238, "mean_token_accuracy": 0.8415237255394459, "num_tokens": 579974243.0, "step": 18171 }, { "entropy": 0.471366825979203, "epoch": 1.6719225306352465, "grad_norm": 0.1493290364742279, "learning_rate": 4.4272702180513386e-05, "loss": 0.4594, "mean_token_accuracy": 0.8585121892392635, "num_tokens": 580006439.0, "step": 18172 }, { "entropy": 0.6371158761903644, "epoch": 1.6720145370066877, "grad_norm": 0.15698064863681793, "learning_rate": 4.426963535437176e-05, "loss": 0.6342, "mean_token_accuracy": 0.8073808141052723, "num_tokens": 580038683.0, "step": 18173 }, { "entropy": 0.6166638117283583, "epoch": 1.672106543378129, "grad_norm": 0.15500260889530182, "learning_rate": 4.4266568528230135e-05, "loss": 0.5961, "mean_token_accuracy": 0.8164867274463177, "num_tokens": 580070872.0, "step": 18174 }, { "entropy": 0.6803553216159344, "epoch": 1.6721985497495702, "grad_norm": 0.16041484475135803, "learning_rate": 4.426350170208851e-05, "loss": 0.6742, "mean_token_accuracy": 0.7950804270803928, "num_tokens": 580102971.0, "step": 18175 }, { "entropy": 0.6060168789699674, "epoch": 1.6722905561210113, "grad_norm": 0.15346312522888184, "learning_rate": 4.4260434875946885e-05, "loss": 0.6046, "mean_token_accuracy": 0.814266886562109, "num_tokens": 580134857.0, "step": 18176 }, { "entropy": 0.5616825092583895, "epoch": 1.6723825624924527, "grad_norm": 0.14765937626361847, "learning_rate": 4.425736804980526e-05, "loss": 0.5437, "mean_token_accuracy": 0.8341588526964188, "num_tokens": 580167353.0, "step": 18177 }, { "entropy": 0.6513635911978781, "epoch": 1.6724745688638938, "grad_norm": 0.1583004891872406, "learning_rate": 4.425430122366363e-05, "loss": 0.6431, "mean_token_accuracy": 0.8079972229897976, "num_tokens": 580199681.0, "step": 18178 }, { "entropy": 0.583634982816875, "epoch": 1.6725665752353351, "grad_norm": 0.15362851321697235, "learning_rate": 4.425123439752201e-05, "loss": 0.5737, "mean_token_accuracy": 0.8233050182461739, "num_tokens": 580231897.0, "step": 18179 }, { "entropy": 0.5702108107507229, "epoch": 1.6726585816067763, "grad_norm": 0.15982036292552948, "learning_rate": 4.4248167571380377e-05, "loss": 0.5674, "mean_token_accuracy": 0.8281018622219563, "num_tokens": 580263485.0, "step": 18180 }, { "entropy": 0.5763865690678358, "epoch": 1.6727505879782174, "grad_norm": 0.16630299389362335, "learning_rate": 4.424510074523875e-05, "loss": 0.5683, "mean_token_accuracy": 0.8253846280276775, "num_tokens": 580295581.0, "step": 18181 }, { "entropy": 0.5878303016070276, "epoch": 1.6728425943496588, "grad_norm": 0.15722189843654633, "learning_rate": 4.424203391909713e-05, "loss": 0.5753, "mean_token_accuracy": 0.8245633170008659, "num_tokens": 580326863.0, "step": 18182 }, { "entropy": 0.4951922604814172, "epoch": 1.6729346007211, "grad_norm": 0.14852531254291534, "learning_rate": 4.42389670929555e-05, "loss": 0.488, "mean_token_accuracy": 0.8480178862810135, "num_tokens": 580358919.0, "step": 18183 }, { "entropy": 0.6806748514063656, "epoch": 1.6730266070925413, "grad_norm": 0.15835314989089966, "learning_rate": 4.423590026681388e-05, "loss": 0.6612, "mean_token_accuracy": 0.7967010177671909, "num_tokens": 580391039.0, "step": 18184 }, { "entropy": 0.5952403098344803, "epoch": 1.6731186134639824, "grad_norm": 0.15211568772792816, "learning_rate": 4.423283344067225e-05, "loss": 0.5878, "mean_token_accuracy": 0.8224467188119888, "num_tokens": 580423018.0, "step": 18185 }, { "entropy": 0.5220026094466448, "epoch": 1.6732106198354235, "grad_norm": 0.14973480999469757, "learning_rate": 4.4229766614530624e-05, "loss": 0.503, "mean_token_accuracy": 0.842437244951725, "num_tokens": 580454712.0, "step": 18186 }, { "entropy": 0.6029074285179377, "epoch": 1.6733026262068649, "grad_norm": 0.15044492483139038, "learning_rate": 4.4226699788389e-05, "loss": 0.5952, "mean_token_accuracy": 0.8193572908639908, "num_tokens": 580487309.0, "step": 18187 }, { "entropy": 0.5889033218845725, "epoch": 1.673394632578306, "grad_norm": 0.15108926594257355, "learning_rate": 4.4223632962247374e-05, "loss": 0.5831, "mean_token_accuracy": 0.8194884099066257, "num_tokens": 580518751.0, "step": 18188 }, { "entropy": 0.6053304215893149, "epoch": 1.6734866389497474, "grad_norm": 0.1552760750055313, "learning_rate": 4.422056613610575e-05, "loss": 0.5852, "mean_token_accuracy": 0.8171234466135502, "num_tokens": 580551212.0, "step": 18189 }, { "entropy": 0.5988119710236788, "epoch": 1.6735786453211885, "grad_norm": 0.1599041074514389, "learning_rate": 4.421749930996412e-05, "loss": 0.5829, "mean_token_accuracy": 0.8211552910506725, "num_tokens": 580582565.0, "step": 18190 }, { "entropy": 0.6185165154747665, "epoch": 1.6736706516926296, "grad_norm": 0.15956220030784607, "learning_rate": 4.421443248382249e-05, "loss": 0.5947, "mean_token_accuracy": 0.81314392760396, "num_tokens": 580614110.0, "step": 18191 }, { "entropy": 0.5151458019390702, "epoch": 1.673762658064071, "grad_norm": 0.15009784698486328, "learning_rate": 4.421136565768087e-05, "loss": 0.5115, "mean_token_accuracy": 0.8464117497205734, "num_tokens": 580646851.0, "step": 18192 }, { "entropy": 0.6883588656783104, "epoch": 1.6738546644355121, "grad_norm": 0.15961213409900665, "learning_rate": 4.420829883153924e-05, "loss": 0.6635, "mean_token_accuracy": 0.7966697253286839, "num_tokens": 580679057.0, "step": 18193 }, { "entropy": 0.6632695142179728, "epoch": 1.6739466708069535, "grad_norm": 0.15960584580898285, "learning_rate": 4.4205232005397615e-05, "loss": 0.6456, "mean_token_accuracy": 0.8038932457566261, "num_tokens": 580710771.0, "step": 18194 }, { "entropy": 0.6230181250721216, "epoch": 1.6740386771783946, "grad_norm": 0.1506483554840088, "learning_rate": 4.420216517925599e-05, "loss": 0.6036, "mean_token_accuracy": 0.8173487223684788, "num_tokens": 580742912.0, "step": 18195 }, { "entropy": 0.554826807230711, "epoch": 1.6741306835498357, "grad_norm": 0.15061554312705994, "learning_rate": 4.4199098353114364e-05, "loss": 0.5501, "mean_token_accuracy": 0.8312606550753117, "num_tokens": 580775125.0, "step": 18196 }, { "entropy": 0.5544152287766337, "epoch": 1.674222689921277, "grad_norm": 0.15091414749622345, "learning_rate": 4.419603152697274e-05, "loss": 0.5364, "mean_token_accuracy": 0.832951758056879, "num_tokens": 580807280.0, "step": 18197 }, { "entropy": 0.6434188364073634, "epoch": 1.6743146962927182, "grad_norm": 0.16453512012958527, "learning_rate": 4.4192964700831113e-05, "loss": 0.6379, "mean_token_accuracy": 0.8042763359844685, "num_tokens": 580838657.0, "step": 18198 }, { "entropy": 0.6425942899659276, "epoch": 1.6744067026641596, "grad_norm": 0.16151206195354462, "learning_rate": 4.418989787468948e-05, "loss": 0.6324, "mean_token_accuracy": 0.8032471500337124, "num_tokens": 580869601.0, "step": 18199 }, { "entropy": 0.605420783162117, "epoch": 1.6744987090356007, "grad_norm": 0.15634967386722565, "learning_rate": 4.418683104854786e-05, "loss": 0.586, "mean_token_accuracy": 0.8189966902136803, "num_tokens": 580900917.0, "step": 18200 }, { "entropy": 0.6986872628331184, "epoch": 1.6745907154070419, "grad_norm": 0.15841235220432281, "learning_rate": 4.418376422240623e-05, "loss": 0.6907, "mean_token_accuracy": 0.7906171418726444, "num_tokens": 580933613.0, "step": 18201 }, { "entropy": 0.6897006407380104, "epoch": 1.6746827217784832, "grad_norm": 0.16785375773906708, "learning_rate": 4.418069739626461e-05, "loss": 0.701, "mean_token_accuracy": 0.7891482077538967, "num_tokens": 580966055.0, "step": 18202 }, { "entropy": 0.5375266466289759, "epoch": 1.6747747281499243, "grad_norm": 0.14754201471805573, "learning_rate": 4.417763057012298e-05, "loss": 0.5335, "mean_token_accuracy": 0.8357976675033569, "num_tokens": 580998627.0, "step": 18203 }, { "entropy": 0.40490588638931513, "epoch": 1.6748667345213657, "grad_norm": 0.14097586274147034, "learning_rate": 4.4174563743981355e-05, "loss": 0.3824, "mean_token_accuracy": 0.8795833177864552, "num_tokens": 581029495.0, "step": 18204 }, { "entropy": 0.6059495098888874, "epoch": 1.6749587408928068, "grad_norm": 0.15165777504444122, "learning_rate": 4.417149691783973e-05, "loss": 0.6035, "mean_token_accuracy": 0.815094955265522, "num_tokens": 581061862.0, "step": 18205 }, { "entropy": 0.6582096554338932, "epoch": 1.675050747264248, "grad_norm": 0.16481277346611023, "learning_rate": 4.4168430091698104e-05, "loss": 0.6576, "mean_token_accuracy": 0.7983002848923206, "num_tokens": 581093775.0, "step": 18206 }, { "entropy": 0.5253190035000443, "epoch": 1.6751427536356893, "grad_norm": 0.15070638060569763, "learning_rate": 4.416536326555648e-05, "loss": 0.5143, "mean_token_accuracy": 0.8385881148278713, "num_tokens": 581126098.0, "step": 18207 }, { "entropy": 0.5503243622370064, "epoch": 1.6752347600071305, "grad_norm": 0.15482188761234283, "learning_rate": 4.416229643941485e-05, "loss": 0.5377, "mean_token_accuracy": 0.8332651369273663, "num_tokens": 581157761.0, "step": 18208 }, { "entropy": 0.5429349550977349, "epoch": 1.6753267663785718, "grad_norm": 0.14931701123714447, "learning_rate": 4.415922961327322e-05, "loss": 0.539, "mean_token_accuracy": 0.8336086757481098, "num_tokens": 581189782.0, "step": 18209 }, { "entropy": 0.5997992167249322, "epoch": 1.675418772750013, "grad_norm": 0.15225978195667267, "learning_rate": 4.41561627871316e-05, "loss": 0.5747, "mean_token_accuracy": 0.8216887712478638, "num_tokens": 581221395.0, "step": 18210 }, { "entropy": 0.6008401094004512, "epoch": 1.675510779121454, "grad_norm": 0.16043967008590698, "learning_rate": 4.415309596098998e-05, "loss": 0.5836, "mean_token_accuracy": 0.8186898194253445, "num_tokens": 581253890.0, "step": 18211 }, { "entropy": 0.5906290467828512, "epoch": 1.6756027854928954, "grad_norm": 0.14755429327487946, "learning_rate": 4.4150029134848345e-05, "loss": 0.5835, "mean_token_accuracy": 0.8206791803240776, "num_tokens": 581286576.0, "step": 18212 }, { "entropy": 0.5058987280353904, "epoch": 1.6756947918643366, "grad_norm": 0.1479005515575409, "learning_rate": 4.4146962308706726e-05, "loss": 0.5002, "mean_token_accuracy": 0.8490747176110744, "num_tokens": 581318059.0, "step": 18213 }, { "entropy": 0.5466127500403672, "epoch": 1.675786798235778, "grad_norm": 0.14468596875667572, "learning_rate": 4.4143895482565094e-05, "loss": 0.5383, "mean_token_accuracy": 0.8346060961484909, "num_tokens": 581350566.0, "step": 18214 }, { "entropy": 0.5110579477623105, "epoch": 1.675878804607219, "grad_norm": 0.14605078101158142, "learning_rate": 4.414082865642347e-05, "loss": 0.4903, "mean_token_accuracy": 0.8482770398259163, "num_tokens": 581382484.0, "step": 18215 }, { "entropy": 0.5763339409604669, "epoch": 1.6759708109786602, "grad_norm": 0.15175580978393555, "learning_rate": 4.4137761830281844e-05, "loss": 0.5691, "mean_token_accuracy": 0.8268751464784145, "num_tokens": 581415117.0, "step": 18216 }, { "entropy": 0.6340409778058529, "epoch": 1.6760628173501015, "grad_norm": 0.1634058654308319, "learning_rate": 4.413469500414022e-05, "loss": 0.6204, "mean_token_accuracy": 0.8069071173667908, "num_tokens": 581446172.0, "step": 18217 }, { "entropy": 0.6474154982715845, "epoch": 1.6761548237215427, "grad_norm": 0.14937950670719147, "learning_rate": 4.413162817799859e-05, "loss": 0.6298, "mean_token_accuracy": 0.8094747178256512, "num_tokens": 581478557.0, "step": 18218 }, { "entropy": 0.6058244127780199, "epoch": 1.676246830092984, "grad_norm": 0.15718653798103333, "learning_rate": 4.412856135185697e-05, "loss": 0.5953, "mean_token_accuracy": 0.8183009289205074, "num_tokens": 581510428.0, "step": 18219 }, { "entropy": 0.6915724240243435, "epoch": 1.6763388364644252, "grad_norm": 0.16599993407726288, "learning_rate": 4.4125494525715335e-05, "loss": 0.6872, "mean_token_accuracy": 0.7930403687059879, "num_tokens": 581542061.0, "step": 18220 }, { "entropy": 0.572188210207969, "epoch": 1.6764308428358663, "grad_norm": 0.155237078666687, "learning_rate": 4.412242769957372e-05, "loss": 0.5725, "mean_token_accuracy": 0.8256289623677731, "num_tokens": 581574829.0, "step": 18221 }, { "entropy": 0.5710374731570482, "epoch": 1.6765228492073077, "grad_norm": 0.15414534509181976, "learning_rate": 4.4119360873432085e-05, "loss": 0.5605, "mean_token_accuracy": 0.8264559097588062, "num_tokens": 581607166.0, "step": 18222 }, { "entropy": 0.6250860840082169, "epoch": 1.6766148555787488, "grad_norm": 0.16327515244483948, "learning_rate": 4.4116294047290466e-05, "loss": 0.6088, "mean_token_accuracy": 0.8102397210896015, "num_tokens": 581638406.0, "step": 18223 }, { "entropy": 0.513842255808413, "epoch": 1.6767068619501901, "grad_norm": 0.14268723130226135, "learning_rate": 4.4113227221148834e-05, "loss": 0.5062, "mean_token_accuracy": 0.8431757725775242, "num_tokens": 581670502.0, "step": 18224 }, { "entropy": 0.6172311017289758, "epoch": 1.6767988683216313, "grad_norm": 0.15031762421131134, "learning_rate": 4.411016039500721e-05, "loss": 0.6115, "mean_token_accuracy": 0.8119894452393055, "num_tokens": 581702237.0, "step": 18225 }, { "entropy": 0.5362009601667523, "epoch": 1.6768908746930724, "grad_norm": 0.14803528785705566, "learning_rate": 4.410709356886558e-05, "loss": 0.5265, "mean_token_accuracy": 0.8387880437076092, "num_tokens": 581734570.0, "step": 18226 }, { "entropy": 0.6103075686842203, "epoch": 1.6769828810645138, "grad_norm": 0.1582091897726059, "learning_rate": 4.410402674272396e-05, "loss": 0.5909, "mean_token_accuracy": 0.8180103749036789, "num_tokens": 581765952.0, "step": 18227 }, { "entropy": 0.5525245242752135, "epoch": 1.677074887435955, "grad_norm": 0.14610189199447632, "learning_rate": 4.410095991658233e-05, "loss": 0.5315, "mean_token_accuracy": 0.8379650004208088, "num_tokens": 581797857.0, "step": 18228 }, { "entropy": 0.5021331403404474, "epoch": 1.6771668938073963, "grad_norm": 0.15175575017929077, "learning_rate": 4.409789309044071e-05, "loss": 0.5037, "mean_token_accuracy": 0.8478409647941589, "num_tokens": 581830333.0, "step": 18229 }, { "entropy": 0.6293753972277045, "epoch": 1.6772589001788374, "grad_norm": 0.15594549477100372, "learning_rate": 4.4094826264299075e-05, "loss": 0.6189, "mean_token_accuracy": 0.8129195161163807, "num_tokens": 581862641.0, "step": 18230 }, { "entropy": 0.5735914115794003, "epoch": 1.6773509065502785, "grad_norm": 0.14909344911575317, "learning_rate": 4.4091759438157457e-05, "loss": 0.5617, "mean_token_accuracy": 0.8304219953715801, "num_tokens": 581895195.0, "step": 18231 }, { "entropy": 0.7004291713237762, "epoch": 1.6774429129217199, "grad_norm": 0.16271574795246124, "learning_rate": 4.4088692612015824e-05, "loss": 0.706, "mean_token_accuracy": 0.7906401492655277, "num_tokens": 581926468.0, "step": 18232 }, { "entropy": 0.6742025595158339, "epoch": 1.677534919293161, "grad_norm": 0.15661388635635376, "learning_rate": 4.40856257858742e-05, "loss": 0.6545, "mean_token_accuracy": 0.7983842827379704, "num_tokens": 581958870.0, "step": 18233 }, { "entropy": 0.5266702296212316, "epoch": 1.6776269256646024, "grad_norm": 0.15392431616783142, "learning_rate": 4.4082558959732574e-05, "loss": 0.5151, "mean_token_accuracy": 0.8393741473555565, "num_tokens": 581991115.0, "step": 18234 }, { "entropy": 0.5188803048804402, "epoch": 1.6777189320360435, "grad_norm": 0.14643065631389618, "learning_rate": 4.407949213359095e-05, "loss": 0.4996, "mean_token_accuracy": 0.8441047295928001, "num_tokens": 582023446.0, "step": 18235 }, { "entropy": 0.5215158956125379, "epoch": 1.6778109384074846, "grad_norm": 0.1434207260608673, "learning_rate": 4.407642530744932e-05, "loss": 0.5134, "mean_token_accuracy": 0.8412204384803772, "num_tokens": 582055039.0, "step": 18236 }, { "entropy": 0.501891546882689, "epoch": 1.677902944778926, "grad_norm": 0.14708556234836578, "learning_rate": 4.40733584813077e-05, "loss": 0.477, "mean_token_accuracy": 0.8478039763867855, "num_tokens": 582086752.0, "step": 18237 }, { "entropy": 0.6592328734695911, "epoch": 1.6779949511503671, "grad_norm": 0.16025936603546143, "learning_rate": 4.4070291655166065e-05, "loss": 0.6595, "mean_token_accuracy": 0.7975529581308365, "num_tokens": 582119031.0, "step": 18238 }, { "entropy": 0.5608880678191781, "epoch": 1.6780869575218085, "grad_norm": 0.15069596469402313, "learning_rate": 4.406722482902445e-05, "loss": 0.5424, "mean_token_accuracy": 0.833646796643734, "num_tokens": 582151017.0, "step": 18239 }, { "entropy": 0.5964005645364523, "epoch": 1.6781789638932496, "grad_norm": 0.1512700468301773, "learning_rate": 4.4064158002882815e-05, "loss": 0.5765, "mean_token_accuracy": 0.8212694525718689, "num_tokens": 582183246.0, "step": 18240 }, { "entropy": 0.5924228690564632, "epoch": 1.6782709702646907, "grad_norm": 0.15854409337043762, "learning_rate": 4.406109117674119e-05, "loss": 0.5933, "mean_token_accuracy": 0.8170623481273651, "num_tokens": 582214881.0, "step": 18241 }, { "entropy": 0.6295134359970689, "epoch": 1.678362976636132, "grad_norm": 0.15197345614433289, "learning_rate": 4.405802435059957e-05, "loss": 0.6091, "mean_token_accuracy": 0.8156432807445526, "num_tokens": 582246566.0, "step": 18242 }, { "entropy": 0.6685749851167202, "epoch": 1.6784549830075732, "grad_norm": 0.15860028564929962, "learning_rate": 4.405495752445794e-05, "loss": 0.6583, "mean_token_accuracy": 0.8005097024142742, "num_tokens": 582278381.0, "step": 18243 }, { "entropy": 0.6234974712133408, "epoch": 1.6785469893790146, "grad_norm": 0.15887963771820068, "learning_rate": 4.405189069831632e-05, "loss": 0.6178, "mean_token_accuracy": 0.8130819089710712, "num_tokens": 582310579.0, "step": 18244 }, { "entropy": 0.7034777905791998, "epoch": 1.6786389957504557, "grad_norm": 0.1627415269613266, "learning_rate": 4.404882387217469e-05, "loss": 0.7028, "mean_token_accuracy": 0.7879655659198761, "num_tokens": 582341298.0, "step": 18245 }, { "entropy": 0.5992383304983377, "epoch": 1.6787310021218969, "grad_norm": 0.15483564138412476, "learning_rate": 4.404575704603306e-05, "loss": 0.5936, "mean_token_accuracy": 0.8178233727812767, "num_tokens": 582373487.0, "step": 18246 }, { "entropy": 0.6919922986999154, "epoch": 1.6788230084933382, "grad_norm": 0.15689237415790558, "learning_rate": 4.404269021989144e-05, "loss": 0.6721, "mean_token_accuracy": 0.7898262403905392, "num_tokens": 582405942.0, "step": 18247 }, { "entropy": 0.5466506127268076, "epoch": 1.6789150148647793, "grad_norm": 0.15589193999767303, "learning_rate": 4.403962339374981e-05, "loss": 0.5536, "mean_token_accuracy": 0.829013254493475, "num_tokens": 582438161.0, "step": 18248 }, { "entropy": 0.5835589193738997, "epoch": 1.6790070212362207, "grad_norm": 0.15281552076339722, "learning_rate": 4.4036556567608187e-05, "loss": 0.5723, "mean_token_accuracy": 0.8235187567770481, "num_tokens": 582470178.0, "step": 18249 }, { "entropy": 0.5593003570102155, "epoch": 1.6790990276076618, "grad_norm": 0.14092876017093658, "learning_rate": 4.403348974146656e-05, "loss": 0.5439, "mean_token_accuracy": 0.8326295018196106, "num_tokens": 582502930.0, "step": 18250 }, { "entropy": 0.4998738616704941, "epoch": 1.679191033979103, "grad_norm": 0.14269669353961945, "learning_rate": 4.403042291532493e-05, "loss": 0.4901, "mean_token_accuracy": 0.8505158387124538, "num_tokens": 582534917.0, "step": 18251 }, { "entropy": 0.5924201812595129, "epoch": 1.6792830403505443, "grad_norm": 0.15922801196575165, "learning_rate": 4.402735608918331e-05, "loss": 0.5853, "mean_token_accuracy": 0.8208322897553444, "num_tokens": 582566086.0, "step": 18252 }, { "entropy": 0.7182062873616815, "epoch": 1.6793750467219855, "grad_norm": 0.16807107627391815, "learning_rate": 4.402428926304168e-05, "loss": 0.7225, "mean_token_accuracy": 0.7784571535885334, "num_tokens": 582597973.0, "step": 18253 }, { "entropy": 0.5472306162118912, "epoch": 1.6794670530934268, "grad_norm": 0.15369348227977753, "learning_rate": 4.402122243690005e-05, "loss": 0.5312, "mean_token_accuracy": 0.8339691385626793, "num_tokens": 582629669.0, "step": 18254 }, { "entropy": 0.6304202880710363, "epoch": 1.679559059464868, "grad_norm": 0.15553520619869232, "learning_rate": 4.401815561075843e-05, "loss": 0.6283, "mean_token_accuracy": 0.8045927062630653, "num_tokens": 582661614.0, "step": 18255 }, { "entropy": 0.6498059537261724, "epoch": 1.679651065836309, "grad_norm": 0.15957172214984894, "learning_rate": 4.40150887846168e-05, "loss": 0.6456, "mean_token_accuracy": 0.8022035583853722, "num_tokens": 582693710.0, "step": 18256 }, { "entropy": 0.7272587167099118, "epoch": 1.6797430722077504, "grad_norm": 0.16406698524951935, "learning_rate": 4.401202195847518e-05, "loss": 0.7045, "mean_token_accuracy": 0.7843319997191429, "num_tokens": 582725133.0, "step": 18257 }, { "entropy": 0.6008610380813479, "epoch": 1.6798350785791916, "grad_norm": 0.15474717319011688, "learning_rate": 4.400895513233355e-05, "loss": 0.595, "mean_token_accuracy": 0.8178685531020164, "num_tokens": 582757600.0, "step": 18258 }, { "entropy": 0.5705265374854207, "epoch": 1.679927084950633, "grad_norm": 0.15138965845108032, "learning_rate": 4.400588830619192e-05, "loss": 0.554, "mean_token_accuracy": 0.8272294886410236, "num_tokens": 582789961.0, "step": 18259 }, { "entropy": 0.5935626104474068, "epoch": 1.680019091322074, "grad_norm": 0.15297219157218933, "learning_rate": 4.40028214800503e-05, "loss": 0.5752, "mean_token_accuracy": 0.8238450698554516, "num_tokens": 582822122.0, "step": 18260 }, { "entropy": 0.5925865964964032, "epoch": 1.6801110976935152, "grad_norm": 0.1632986217737198, "learning_rate": 4.399975465390867e-05, "loss": 0.5909, "mean_token_accuracy": 0.8201166987419128, "num_tokens": 582853897.0, "step": 18261 }, { "entropy": 0.6315636523067951, "epoch": 1.6802031040649565, "grad_norm": 0.1592751294374466, "learning_rate": 4.399668782776705e-05, "loss": 0.6338, "mean_token_accuracy": 0.8091042824089527, "num_tokens": 582886484.0, "step": 18262 }, { "entropy": 0.4936336176469922, "epoch": 1.6802951104363977, "grad_norm": 0.1443060338497162, "learning_rate": 4.399362100162542e-05, "loss": 0.4779, "mean_token_accuracy": 0.8511234819889069, "num_tokens": 582918701.0, "step": 18263 }, { "entropy": 0.5895609520375729, "epoch": 1.680387116807839, "grad_norm": 0.15615904331207275, "learning_rate": 4.399055417548379e-05, "loss": 0.5708, "mean_token_accuracy": 0.8219513334333897, "num_tokens": 582950691.0, "step": 18264 }, { "entropy": 0.6326336562633514, "epoch": 1.6804791231792802, "grad_norm": 0.163932204246521, "learning_rate": 4.398748734934217e-05, "loss": 0.6066, "mean_token_accuracy": 0.8116262890398502, "num_tokens": 582981608.0, "step": 18265 }, { "entropy": 0.5117055848240852, "epoch": 1.6805711295507213, "grad_norm": 0.15072286128997803, "learning_rate": 4.398442052320054e-05, "loss": 0.4902, "mean_token_accuracy": 0.8463119566440582, "num_tokens": 583013146.0, "step": 18266 }, { "entropy": 0.6691371183842421, "epoch": 1.6806631359221627, "grad_norm": 0.16155201196670532, "learning_rate": 4.398135369705892e-05, "loss": 0.6666, "mean_token_accuracy": 0.8008532002568245, "num_tokens": 583045286.0, "step": 18267 }, { "entropy": 0.6412241719663143, "epoch": 1.6807551422936038, "grad_norm": 0.1563841849565506, "learning_rate": 4.397828687091729e-05, "loss": 0.6338, "mean_token_accuracy": 0.8072704076766968, "num_tokens": 583077327.0, "step": 18268 }, { "entropy": 0.5691340127959847, "epoch": 1.6808471486650451, "grad_norm": 0.14912576973438263, "learning_rate": 4.397522004477566e-05, "loss": 0.5574, "mean_token_accuracy": 0.826173447072506, "num_tokens": 583109343.0, "step": 18269 }, { "entropy": 0.6575247570872307, "epoch": 1.6809391550364863, "grad_norm": 0.16124844551086426, "learning_rate": 4.397215321863404e-05, "loss": 0.6523, "mean_token_accuracy": 0.8031696751713753, "num_tokens": 583140725.0, "step": 18270 }, { "entropy": 0.5577293802052736, "epoch": 1.6810311614079274, "grad_norm": 0.14417271316051483, "learning_rate": 4.396908639249241e-05, "loss": 0.5445, "mean_token_accuracy": 0.8310305289924145, "num_tokens": 583172957.0, "step": 18271 }, { "entropy": 0.5321153635159135, "epoch": 1.6811231677793688, "grad_norm": 0.14985491335391998, "learning_rate": 4.396601956635078e-05, "loss": 0.5197, "mean_token_accuracy": 0.8387012109160423, "num_tokens": 583205401.0, "step": 18272 }, { "entropy": 0.49671847536228597, "epoch": 1.68121517415081, "grad_norm": 0.13970769941806793, "learning_rate": 4.3962952740209165e-05, "loss": 0.4761, "mean_token_accuracy": 0.849360428750515, "num_tokens": 583237387.0, "step": 18273 }, { "entropy": 0.6378919025883079, "epoch": 1.6813071805222513, "grad_norm": 0.15777648985385895, "learning_rate": 4.395988591406753e-05, "loss": 0.6401, "mean_token_accuracy": 0.8037179857492447, "num_tokens": 583269344.0, "step": 18274 }, { "entropy": 0.6251575611531734, "epoch": 1.6813991868936924, "grad_norm": 0.15621036291122437, "learning_rate": 4.395681908792591e-05, "loss": 0.5934, "mean_token_accuracy": 0.812733855098486, "num_tokens": 583299685.0, "step": 18275 }, { "entropy": 0.6423271540552378, "epoch": 1.6814911932651335, "grad_norm": 0.15845851600170135, "learning_rate": 4.395375226178428e-05, "loss": 0.627, "mean_token_accuracy": 0.8057023473083973, "num_tokens": 583331522.0, "step": 18276 }, { "entropy": 0.4602011423557997, "epoch": 1.6815831996365749, "grad_norm": 0.13917593657970428, "learning_rate": 4.3950685435642656e-05, "loss": 0.44, "mean_token_accuracy": 0.8661895841360092, "num_tokens": 583363951.0, "step": 18277 }, { "entropy": 0.5954477172344923, "epoch": 1.681675206008016, "grad_norm": 0.15405257046222687, "learning_rate": 4.394761860950103e-05, "loss": 0.5842, "mean_token_accuracy": 0.8210797682404518, "num_tokens": 583395890.0, "step": 18278 }, { "entropy": 0.5745592792518437, "epoch": 1.6817672123794574, "grad_norm": 0.15132783353328705, "learning_rate": 4.3944551783359406e-05, "loss": 0.5648, "mean_token_accuracy": 0.8288263753056526, "num_tokens": 583427553.0, "step": 18279 }, { "entropy": 0.7170029766857624, "epoch": 1.6818592187508985, "grad_norm": 0.16537030041217804, "learning_rate": 4.3941484957217774e-05, "loss": 0.7087, "mean_token_accuracy": 0.7860399782657623, "num_tokens": 583458324.0, "step": 18280 }, { "entropy": 0.7062690667808056, "epoch": 1.6819512251223396, "grad_norm": 0.16503433883190155, "learning_rate": 4.3938418131076155e-05, "loss": 0.6989, "mean_token_accuracy": 0.7873138710856438, "num_tokens": 583489508.0, "step": 18281 }, { "entropy": 0.5471284883096814, "epoch": 1.682043231493781, "grad_norm": 0.15403759479522705, "learning_rate": 4.393535130493452e-05, "loss": 0.5417, "mean_token_accuracy": 0.8336870186030865, "num_tokens": 583521631.0, "step": 18282 }, { "entropy": 0.5740578379482031, "epoch": 1.6821352378652221, "grad_norm": 0.14987805485725403, "learning_rate": 4.3932284478792904e-05, "loss": 0.57, "mean_token_accuracy": 0.8232158832252026, "num_tokens": 583553713.0, "step": 18283 }, { "entropy": 0.7685333974659443, "epoch": 1.6822272442366635, "grad_norm": 0.17120720446109772, "learning_rate": 4.392921765265127e-05, "loss": 0.7601, "mean_token_accuracy": 0.7722236588597298, "num_tokens": 583584895.0, "step": 18284 }, { "entropy": 0.7526569627225399, "epoch": 1.6823192506081046, "grad_norm": 0.17047350108623505, "learning_rate": 4.392615082650965e-05, "loss": 0.7476, "mean_token_accuracy": 0.7726166360080242, "num_tokens": 583617060.0, "step": 18285 }, { "entropy": 0.6042210701853037, "epoch": 1.6824112569795457, "grad_norm": 0.15026697516441345, "learning_rate": 4.392308400036802e-05, "loss": 0.5954, "mean_token_accuracy": 0.8188386857509613, "num_tokens": 583649664.0, "step": 18286 }, { "entropy": 0.6391297755762935, "epoch": 1.682503263350987, "grad_norm": 0.1619480550289154, "learning_rate": 4.3920017174226396e-05, "loss": 0.6228, "mean_token_accuracy": 0.8074298053979874, "num_tokens": 583680745.0, "step": 18287 }, { "entropy": 0.6092376918531954, "epoch": 1.6825952697224282, "grad_norm": 0.15016788244247437, "learning_rate": 4.391695034808477e-05, "loss": 0.5892, "mean_token_accuracy": 0.8163487426936626, "num_tokens": 583712949.0, "step": 18288 }, { "entropy": 0.5476008728146553, "epoch": 1.6826872760938696, "grad_norm": 0.15065431594848633, "learning_rate": 4.3913883521943145e-05, "loss": 0.54, "mean_token_accuracy": 0.8318971358239651, "num_tokens": 583745295.0, "step": 18289 }, { "entropy": 0.6112810960039496, "epoch": 1.6827792824653107, "grad_norm": 0.1484098732471466, "learning_rate": 4.391081669580151e-05, "loss": 0.6057, "mean_token_accuracy": 0.8183838315308094, "num_tokens": 583777084.0, "step": 18290 }, { "entropy": 0.6011072508990765, "epoch": 1.6828712888367519, "grad_norm": 0.1544007509946823, "learning_rate": 4.3907749869659895e-05, "loss": 0.5857, "mean_token_accuracy": 0.819329958409071, "num_tokens": 583808916.0, "step": 18291 }, { "entropy": 0.6321235205978155, "epoch": 1.6829632952081932, "grad_norm": 0.15460488200187683, "learning_rate": 4.390468304351826e-05, "loss": 0.6194, "mean_token_accuracy": 0.8112559802830219, "num_tokens": 583841193.0, "step": 18292 }, { "entropy": 0.6367239933460951, "epoch": 1.6830553015796343, "grad_norm": 0.16074064373970032, "learning_rate": 4.390161621737664e-05, "loss": 0.6447, "mean_token_accuracy": 0.8064451105892658, "num_tokens": 583872760.0, "step": 18293 }, { "entropy": 0.5119185708463192, "epoch": 1.6831473079510757, "grad_norm": 0.14744208753108978, "learning_rate": 4.389854939123501e-05, "loss": 0.4914, "mean_token_accuracy": 0.8482880294322968, "num_tokens": 583905121.0, "step": 18294 }, { "entropy": 0.6375892637297511, "epoch": 1.6832393143225168, "grad_norm": 0.15220829844474792, "learning_rate": 4.3895482565093387e-05, "loss": 0.6229, "mean_token_accuracy": 0.8085787445306778, "num_tokens": 583937538.0, "step": 18295 }, { "entropy": 0.6199583364650607, "epoch": 1.683331320693958, "grad_norm": 0.15610116720199585, "learning_rate": 4.389241573895176e-05, "loss": 0.6139, "mean_token_accuracy": 0.8138264194130898, "num_tokens": 583970129.0, "step": 18296 }, { "entropy": 0.4992179302498698, "epoch": 1.6834233270653993, "grad_norm": 0.1439947485923767, "learning_rate": 4.3889348912810136e-05, "loss": 0.4912, "mean_token_accuracy": 0.8487752377986908, "num_tokens": 584002543.0, "step": 18297 }, { "entropy": 0.5793168600648642, "epoch": 1.6835153334368405, "grad_norm": 0.15667669475078583, "learning_rate": 4.3886282086668504e-05, "loss": 0.557, "mean_token_accuracy": 0.8265281170606613, "num_tokens": 584035110.0, "step": 18298 }, { "entropy": 0.601556277833879, "epoch": 1.6836073398082818, "grad_norm": 0.15349264442920685, "learning_rate": 4.3883215260526885e-05, "loss": 0.5964, "mean_token_accuracy": 0.8164326027035713, "num_tokens": 584067013.0, "step": 18299 }, { "entropy": 0.6413939548656344, "epoch": 1.683699346179723, "grad_norm": 0.16009339690208435, "learning_rate": 4.388014843438525e-05, "loss": 0.6312, "mean_token_accuracy": 0.8061821013689041, "num_tokens": 584098519.0, "step": 18300 }, { "entropy": 0.5757073601707816, "epoch": 1.683791352551164, "grad_norm": 0.15152613818645477, "learning_rate": 4.387708160824363e-05, "loss": 0.5688, "mean_token_accuracy": 0.8283414803445339, "num_tokens": 584130559.0, "step": 18301 }, { "entropy": 0.5974721587263048, "epoch": 1.6838833589226054, "grad_norm": 0.15097957849502563, "learning_rate": 4.3874014782102e-05, "loss": 0.5949, "mean_token_accuracy": 0.8194234818220139, "num_tokens": 584163054.0, "step": 18302 }, { "entropy": 0.5210330635309219, "epoch": 1.6839753652940466, "grad_norm": 0.1497763842344284, "learning_rate": 4.387094795596038e-05, "loss": 0.4987, "mean_token_accuracy": 0.8437016233801842, "num_tokens": 584194344.0, "step": 18303 }, { "entropy": 0.5612441888079047, "epoch": 1.684067371665488, "grad_norm": 0.1476142257452011, "learning_rate": 4.386788112981876e-05, "loss": 0.5507, "mean_token_accuracy": 0.8332802392542362, "num_tokens": 584226590.0, "step": 18304 }, { "entropy": 0.519160927971825, "epoch": 1.684159378036929, "grad_norm": 0.15169471502304077, "learning_rate": 4.3864814303677126e-05, "loss": 0.5103, "mean_token_accuracy": 0.844407070428133, "num_tokens": 584258681.0, "step": 18305 }, { "entropy": 0.5941620543599129, "epoch": 1.6842513844083702, "grad_norm": 0.15446804463863373, "learning_rate": 4.38617474775355e-05, "loss": 0.5899, "mean_token_accuracy": 0.818816177546978, "num_tokens": 584291448.0, "step": 18306 }, { "entropy": 0.5471654934808612, "epoch": 1.6843433907798115, "grad_norm": 0.14885641634464264, "learning_rate": 4.3858680651393876e-05, "loss": 0.5376, "mean_token_accuracy": 0.832906685769558, "num_tokens": 584323486.0, "step": 18307 }, { "entropy": 0.5983629170805216, "epoch": 1.6844353971512527, "grad_norm": 0.16028451919555664, "learning_rate": 4.385561382525225e-05, "loss": 0.5954, "mean_token_accuracy": 0.8162489272654057, "num_tokens": 584355382.0, "step": 18308 }, { "entropy": 0.5222775600850582, "epoch": 1.684527403522694, "grad_norm": 0.15474744141101837, "learning_rate": 4.3852546999110625e-05, "loss": 0.5104, "mean_token_accuracy": 0.8413292728364468, "num_tokens": 584386640.0, "step": 18309 }, { "entropy": 0.6889529530890286, "epoch": 1.6846194098941352, "grad_norm": 0.16113592684268951, "learning_rate": 4.3849480172969e-05, "loss": 0.6862, "mean_token_accuracy": 0.7900679111480713, "num_tokens": 584418227.0, "step": 18310 }, { "entropy": 0.5714503861963749, "epoch": 1.6847114162655763, "grad_norm": 0.1657312512397766, "learning_rate": 4.384641334682737e-05, "loss": 0.5644, "mean_token_accuracy": 0.825586561113596, "num_tokens": 584449869.0, "step": 18311 }, { "entropy": 0.5139881763607264, "epoch": 1.6848034226370177, "grad_norm": 0.14523214101791382, "learning_rate": 4.384334652068575e-05, "loss": 0.4988, "mean_token_accuracy": 0.8422465771436691, "num_tokens": 584482000.0, "step": 18312 }, { "entropy": 0.655033765360713, "epoch": 1.6848954290084588, "grad_norm": 0.15457908809185028, "learning_rate": 4.384027969454412e-05, "loss": 0.6398, "mean_token_accuracy": 0.8062746934592724, "num_tokens": 584514504.0, "step": 18313 }, { "entropy": 0.6518444218672812, "epoch": 1.6849874353799001, "grad_norm": 0.15509840846061707, "learning_rate": 4.383721286840249e-05, "loss": 0.6404, "mean_token_accuracy": 0.8062356896698475, "num_tokens": 584546557.0, "step": 18314 }, { "entropy": 0.6006749346852303, "epoch": 1.6850794417513413, "grad_norm": 0.15732136368751526, "learning_rate": 4.3834146042260866e-05, "loss": 0.5907, "mean_token_accuracy": 0.8184856958687305, "num_tokens": 584578411.0, "step": 18315 }, { "entropy": 0.6034524233546108, "epoch": 1.6851714481227824, "grad_norm": 0.15009263157844543, "learning_rate": 4.383107921611924e-05, "loss": 0.5807, "mean_token_accuracy": 0.825228612869978, "num_tokens": 584610412.0, "step": 18316 }, { "entropy": 0.5757454675622284, "epoch": 1.6852634544942238, "grad_norm": 0.15307874977588654, "learning_rate": 4.3828012389977615e-05, "loss": 0.5686, "mean_token_accuracy": 0.8266474008560181, "num_tokens": 584642490.0, "step": 18317 }, { "entropy": 0.6078398479148746, "epoch": 1.685355460865665, "grad_norm": 0.1531205177307129, "learning_rate": 4.382494556383599e-05, "loss": 0.5937, "mean_token_accuracy": 0.8183726631104946, "num_tokens": 584673979.0, "step": 18318 }, { "entropy": 0.7107502594590187, "epoch": 1.6854474672371063, "grad_norm": 0.1601436585187912, "learning_rate": 4.382187873769436e-05, "loss": 0.6913, "mean_token_accuracy": 0.7891173101961613, "num_tokens": 584706361.0, "step": 18319 }, { "entropy": 0.6528557203710079, "epoch": 1.6855394736085474, "grad_norm": 0.16151650249958038, "learning_rate": 4.381881191155274e-05, "loss": 0.6606, "mean_token_accuracy": 0.8015039823949337, "num_tokens": 584737782.0, "step": 18320 }, { "entropy": 0.6800206545740366, "epoch": 1.6856314799799885, "grad_norm": 0.16777303814888, "learning_rate": 4.381574508541111e-05, "loss": 0.6835, "mean_token_accuracy": 0.7934298887848854, "num_tokens": 584769020.0, "step": 18321 }, { "entropy": 0.5079681696370244, "epoch": 1.6857234863514299, "grad_norm": 0.14851714670658112, "learning_rate": 4.381267825926949e-05, "loss": 0.5063, "mean_token_accuracy": 0.8447441384196281, "num_tokens": 584801011.0, "step": 18322 }, { "entropy": 0.57472974807024, "epoch": 1.685815492722871, "grad_norm": 0.15923964977264404, "learning_rate": 4.3809611433127856e-05, "loss": 0.5824, "mean_token_accuracy": 0.8190155662596226, "num_tokens": 584833020.0, "step": 18323 }, { "entropy": 0.6127247249241918, "epoch": 1.6859074990943124, "grad_norm": 0.14891518652439117, "learning_rate": 4.380654460698623e-05, "loss": 0.5918, "mean_token_accuracy": 0.8211951889097691, "num_tokens": 584864372.0, "step": 18324 }, { "entropy": 0.73013586550951, "epoch": 1.6859995054657535, "grad_norm": 0.16220633685588837, "learning_rate": 4.3803477780844606e-05, "loss": 0.7198, "mean_token_accuracy": 0.785042367875576, "num_tokens": 584896390.0, "step": 18325 }, { "entropy": 0.575688480399549, "epoch": 1.6860915118371946, "grad_norm": 0.15480881929397583, "learning_rate": 4.380041095470298e-05, "loss": 0.5652, "mean_token_accuracy": 0.8273265101015568, "num_tokens": 584928208.0, "step": 18326 }, { "entropy": 0.7508062049746513, "epoch": 1.686183518208636, "grad_norm": 0.16643026471138, "learning_rate": 4.3797344128561355e-05, "loss": 0.7464, "mean_token_accuracy": 0.774582851678133, "num_tokens": 584959847.0, "step": 18327 }, { "entropy": 0.5757310874760151, "epoch": 1.6862755245800771, "grad_norm": 0.14998385310173035, "learning_rate": 4.379427730241973e-05, "loss": 0.5734, "mean_token_accuracy": 0.8239204026758671, "num_tokens": 584992177.0, "step": 18328 }, { "entropy": 0.6297884713858366, "epoch": 1.6863675309515185, "grad_norm": 0.1513999104499817, "learning_rate": 4.37912104762781e-05, "loss": 0.6201, "mean_token_accuracy": 0.8114747516810894, "num_tokens": 585024380.0, "step": 18329 }, { "entropy": 0.5453423755243421, "epoch": 1.6864595373229596, "grad_norm": 0.15467792749404907, "learning_rate": 4.378814365013648e-05, "loss": 0.5316, "mean_token_accuracy": 0.8363192118704319, "num_tokens": 585055853.0, "step": 18330 }, { "entropy": 0.6046038493514061, "epoch": 1.6865515436944007, "grad_norm": 0.15358959138393402, "learning_rate": 4.378507682399485e-05, "loss": 0.5952, "mean_token_accuracy": 0.8151990100741386, "num_tokens": 585087725.0, "step": 18331 }, { "entropy": 0.6944432631134987, "epoch": 1.686643550065842, "grad_norm": 0.1537497490644455, "learning_rate": 4.378200999785322e-05, "loss": 0.6799, "mean_token_accuracy": 0.7913361378014088, "num_tokens": 585120238.0, "step": 18332 }, { "entropy": 0.5395734841004014, "epoch": 1.6867355564372832, "grad_norm": 0.15236221253871918, "learning_rate": 4.37789431717116e-05, "loss": 0.5252, "mean_token_accuracy": 0.8356862999498844, "num_tokens": 585152592.0, "step": 18333 }, { "entropy": 0.49862429965287447, "epoch": 1.6868275628087246, "grad_norm": 0.15070192515850067, "learning_rate": 4.377587634556997e-05, "loss": 0.4798, "mean_token_accuracy": 0.8463908843696117, "num_tokens": 585184624.0, "step": 18334 }, { "entropy": 0.5457268785685301, "epoch": 1.6869195691801657, "grad_norm": 0.14741499722003937, "learning_rate": 4.3772809519428345e-05, "loss": 0.5426, "mean_token_accuracy": 0.8321007415652275, "num_tokens": 585216695.0, "step": 18335 }, { "entropy": 0.6530294492840767, "epoch": 1.6870115755516069, "grad_norm": 0.17048956453800201, "learning_rate": 4.376974269328672e-05, "loss": 0.6519, "mean_token_accuracy": 0.8013546727597713, "num_tokens": 585248382.0, "step": 18336 }, { "entropy": 0.5888009136542678, "epoch": 1.6871035819230482, "grad_norm": 0.15109354257583618, "learning_rate": 4.3766675867145095e-05, "loss": 0.5701, "mean_token_accuracy": 0.82380136474967, "num_tokens": 585280212.0, "step": 18337 }, { "entropy": 0.5153891621157527, "epoch": 1.6871955882944893, "grad_norm": 0.15275326371192932, "learning_rate": 4.376360904100347e-05, "loss": 0.5109, "mean_token_accuracy": 0.8431210219860077, "num_tokens": 585312314.0, "step": 18338 }, { "entropy": 0.6511192582547665, "epoch": 1.6872875946659307, "grad_norm": 0.1569906622171402, "learning_rate": 4.3760542214861844e-05, "loss": 0.6342, "mean_token_accuracy": 0.8046337887644768, "num_tokens": 585344445.0, "step": 18339 }, { "entropy": 0.5337929464876652, "epoch": 1.6873796010373718, "grad_norm": 0.15637393295764923, "learning_rate": 4.375747538872021e-05, "loss": 0.521, "mean_token_accuracy": 0.8350762277841568, "num_tokens": 585376171.0, "step": 18340 }, { "entropy": 0.5759244533255696, "epoch": 1.687471607408813, "grad_norm": 0.148925319314003, "learning_rate": 4.375440856257859e-05, "loss": 0.5659, "mean_token_accuracy": 0.8275878950953484, "num_tokens": 585407631.0, "step": 18341 }, { "entropy": 0.5986175499856472, "epoch": 1.6875636137802543, "grad_norm": 0.15303681790828705, "learning_rate": 4.375134173643696e-05, "loss": 0.5896, "mean_token_accuracy": 0.8202645145356655, "num_tokens": 585439228.0, "step": 18342 }, { "entropy": 0.5354221109300852, "epoch": 1.6876556201516955, "grad_norm": 0.15531586110591888, "learning_rate": 4.374827491029534e-05, "loss": 0.5105, "mean_token_accuracy": 0.8396165519952774, "num_tokens": 585470570.0, "step": 18343 }, { "entropy": 0.6285147909075022, "epoch": 1.6877476265231368, "grad_norm": 0.152794748544693, "learning_rate": 4.374520808415371e-05, "loss": 0.6165, "mean_token_accuracy": 0.8101099766790867, "num_tokens": 585502679.0, "step": 18344 }, { "entropy": 0.6263280604034662, "epoch": 1.687839632894578, "grad_norm": 0.16394193470478058, "learning_rate": 4.3742141258012085e-05, "loss": 0.6187, "mean_token_accuracy": 0.81076904758811, "num_tokens": 585535092.0, "step": 18345 }, { "entropy": 0.6694249017164111, "epoch": 1.687931639266019, "grad_norm": 0.1593048870563507, "learning_rate": 4.373907443187046e-05, "loss": 0.6575, "mean_token_accuracy": 0.7962511368095875, "num_tokens": 585566734.0, "step": 18346 }, { "entropy": 0.5362485023215413, "epoch": 1.6880236456374604, "grad_norm": 0.14829587936401367, "learning_rate": 4.3736007605728834e-05, "loss": 0.5241, "mean_token_accuracy": 0.84070248529315, "num_tokens": 585598223.0, "step": 18347 }, { "entropy": 0.5792909442679957, "epoch": 1.6881156520089016, "grad_norm": 0.15421223640441895, "learning_rate": 4.373294077958721e-05, "loss": 0.5729, "mean_token_accuracy": 0.8251766301691532, "num_tokens": 585630064.0, "step": 18348 }, { "entropy": 0.6168117495253682, "epoch": 1.688207658380343, "grad_norm": 0.15360327064990997, "learning_rate": 4.3729873953445584e-05, "loss": 0.6101, "mean_token_accuracy": 0.8112287819385529, "num_tokens": 585661954.0, "step": 18349 }, { "entropy": 0.6474901409819722, "epoch": 1.688299664751784, "grad_norm": 0.16032522916793823, "learning_rate": 4.372680712730395e-05, "loss": 0.6363, "mean_token_accuracy": 0.8018609620630741, "num_tokens": 585693967.0, "step": 18350 }, { "entropy": 0.6707997247576714, "epoch": 1.6883916711232252, "grad_norm": 0.1575835794210434, "learning_rate": 4.372374030116233e-05, "loss": 0.6726, "mean_token_accuracy": 0.7935571111738682, "num_tokens": 585725761.0, "step": 18351 }, { "entropy": 0.5980529058724642, "epoch": 1.6884836774946665, "grad_norm": 0.15206734836101532, "learning_rate": 4.37206734750207e-05, "loss": 0.5932, "mean_token_accuracy": 0.8165548592805862, "num_tokens": 585758039.0, "step": 18352 }, { "entropy": 0.5833911467343569, "epoch": 1.6885756838661077, "grad_norm": 0.15189722180366516, "learning_rate": 4.3717606648879075e-05, "loss": 0.5783, "mean_token_accuracy": 0.8216124214231968, "num_tokens": 585790639.0, "step": 18353 }, { "entropy": 0.6696184687316418, "epoch": 1.688667690237549, "grad_norm": 0.15731579065322876, "learning_rate": 4.371453982273745e-05, "loss": 0.6607, "mean_token_accuracy": 0.7992384769022465, "num_tokens": 585822096.0, "step": 18354 }, { "entropy": 0.5738721955567598, "epoch": 1.6887596966089902, "grad_norm": 0.15357784926891327, "learning_rate": 4.3711472996595825e-05, "loss": 0.5601, "mean_token_accuracy": 0.8294500485062599, "num_tokens": 585853621.0, "step": 18355 }, { "entropy": 0.5377235533669591, "epoch": 1.6888517029804313, "grad_norm": 0.15369875729084015, "learning_rate": 4.37084061704542e-05, "loss": 0.5345, "mean_token_accuracy": 0.8379846885800362, "num_tokens": 585885594.0, "step": 18356 }, { "entropy": 0.4944965159520507, "epoch": 1.6889437093518727, "grad_norm": 0.14146895706653595, "learning_rate": 4.3705339344312574e-05, "loss": 0.4788, "mean_token_accuracy": 0.8510550335049629, "num_tokens": 585917800.0, "step": 18357 }, { "entropy": 0.6811487227678299, "epoch": 1.6890357157233138, "grad_norm": 0.15921780467033386, "learning_rate": 4.370227251817094e-05, "loss": 0.6776, "mean_token_accuracy": 0.7943317741155624, "num_tokens": 585949928.0, "step": 18358 }, { "entropy": 0.5781120108440518, "epoch": 1.6891277220947551, "grad_norm": 0.15565474331378937, "learning_rate": 4.369920569202932e-05, "loss": 0.5666, "mean_token_accuracy": 0.8235251791775227, "num_tokens": 585982081.0, "step": 18359 }, { "entropy": 0.6697069802321494, "epoch": 1.6892197284661963, "grad_norm": 0.1592462658882141, "learning_rate": 4.369613886588769e-05, "loss": 0.6657, "mean_token_accuracy": 0.8005416989326477, "num_tokens": 586014245.0, "step": 18360 }, { "entropy": 0.5617673862725496, "epoch": 1.6893117348376374, "grad_norm": 0.15338559448719025, "learning_rate": 4.3693072039746066e-05, "loss": 0.5584, "mean_token_accuracy": 0.8243122324347496, "num_tokens": 586045598.0, "step": 18361 }, { "entropy": 0.5660423915833235, "epoch": 1.6894037412090788, "grad_norm": 0.1470344215631485, "learning_rate": 4.369000521360444e-05, "loss": 0.5513, "mean_token_accuracy": 0.8299991637468338, "num_tokens": 586077983.0, "step": 18362 }, { "entropy": 0.66982202231884, "epoch": 1.68949574758052, "grad_norm": 0.16106751561164856, "learning_rate": 4.3686938387462815e-05, "loss": 0.6542, "mean_token_accuracy": 0.7939707301557064, "num_tokens": 586109307.0, "step": 18363 }, { "entropy": 0.680996872484684, "epoch": 1.6895877539519613, "grad_norm": 0.1608162671327591, "learning_rate": 4.3683871561321197e-05, "loss": 0.6858, "mean_token_accuracy": 0.7931499406695366, "num_tokens": 586141620.0, "step": 18364 }, { "entropy": 0.6363926809281111, "epoch": 1.6896797603234024, "grad_norm": 0.1552644670009613, "learning_rate": 4.3680804735179564e-05, "loss": 0.6183, "mean_token_accuracy": 0.8072918355464935, "num_tokens": 586174162.0, "step": 18365 }, { "entropy": 0.6401008823886514, "epoch": 1.6897717666948435, "grad_norm": 0.15618202090263367, "learning_rate": 4.367773790903794e-05, "loss": 0.6311, "mean_token_accuracy": 0.8076570741832256, "num_tokens": 586205483.0, "step": 18366 }, { "entropy": 0.5848010275512934, "epoch": 1.6898637730662849, "grad_norm": 0.150425985455513, "learning_rate": 4.3674671082896314e-05, "loss": 0.5733, "mean_token_accuracy": 0.8251743763685226, "num_tokens": 586236673.0, "step": 18367 }, { "entropy": 0.496879227925092, "epoch": 1.689955779437726, "grad_norm": 0.1619945466518402, "learning_rate": 4.367160425675469e-05, "loss": 0.4811, "mean_token_accuracy": 0.8517354018986225, "num_tokens": 586268266.0, "step": 18368 }, { "entropy": 0.5724665804300457, "epoch": 1.6900477858091674, "grad_norm": 0.15558943152427673, "learning_rate": 4.366853743061306e-05, "loss": 0.5645, "mean_token_accuracy": 0.8291406109929085, "num_tokens": 586300633.0, "step": 18369 }, { "entropy": 0.6353645231574774, "epoch": 1.6901397921806085, "grad_norm": 0.1578582525253296, "learning_rate": 4.366547060447144e-05, "loss": 0.6297, "mean_token_accuracy": 0.8067265041172504, "num_tokens": 586332626.0, "step": 18370 }, { "entropy": 0.4869861928746104, "epoch": 1.6902317985520496, "grad_norm": 0.14623942971229553, "learning_rate": 4.3662403778329806e-05, "loss": 0.4738, "mean_token_accuracy": 0.8531530350446701, "num_tokens": 586364340.0, "step": 18371 }, { "entropy": 0.5804362567141652, "epoch": 1.690323804923491, "grad_norm": 0.1545773446559906, "learning_rate": 4.365933695218819e-05, "loss": 0.57, "mean_token_accuracy": 0.8247597478330135, "num_tokens": 586395488.0, "step": 18372 }, { "entropy": 0.5574918519705534, "epoch": 1.6904158112949321, "grad_norm": 0.14538265764713287, "learning_rate": 4.3656270126046555e-05, "loss": 0.5567, "mean_token_accuracy": 0.8286291025578976, "num_tokens": 586427889.0, "step": 18373 }, { "entropy": 0.5713267344981432, "epoch": 1.6905078176663735, "grad_norm": 0.14691567420959473, "learning_rate": 4.365320329990493e-05, "loss": 0.5516, "mean_token_accuracy": 0.8276946470141411, "num_tokens": 586459954.0, "step": 18374 }, { "entropy": 0.5531822505872697, "epoch": 1.6905998240378146, "grad_norm": 0.15175823867321014, "learning_rate": 4.3650136473763304e-05, "loss": 0.5431, "mean_token_accuracy": 0.8330871909856796, "num_tokens": 586492058.0, "step": 18375 }, { "entropy": 0.5494305107276887, "epoch": 1.6906918304092557, "grad_norm": 0.14425188302993774, "learning_rate": 4.364706964762168e-05, "loss": 0.532, "mean_token_accuracy": 0.8362694159150124, "num_tokens": 586524435.0, "step": 18376 }, { "entropy": 0.5848115272819996, "epoch": 1.690783836780697, "grad_norm": 0.15116959810256958, "learning_rate": 4.3644002821480053e-05, "loss": 0.5606, "mean_token_accuracy": 0.8232622034847736, "num_tokens": 586556452.0, "step": 18377 }, { "entropy": 0.5582094769924879, "epoch": 1.6908758431521382, "grad_norm": 0.15399520099163055, "learning_rate": 4.364093599533843e-05, "loss": 0.5626, "mean_token_accuracy": 0.8304580450057983, "num_tokens": 586588782.0, "step": 18378 }, { "entropy": 0.5841601341962814, "epoch": 1.6909678495235796, "grad_norm": 0.14688391983509064, "learning_rate": 4.3637869169196796e-05, "loss": 0.5652, "mean_token_accuracy": 0.8248622193932533, "num_tokens": 586621012.0, "step": 18379 }, { "entropy": 0.578871856443584, "epoch": 1.6910598558950207, "grad_norm": 0.15142886340618134, "learning_rate": 4.363480234305518e-05, "loss": 0.581, "mean_token_accuracy": 0.8292490802705288, "num_tokens": 586652767.0, "step": 18380 }, { "entropy": 0.6507391575723886, "epoch": 1.6911518622664619, "grad_norm": 0.1602127104997635, "learning_rate": 4.3631735516913545e-05, "loss": 0.6424, "mean_token_accuracy": 0.8013669028878212, "num_tokens": 586684230.0, "step": 18381 }, { "entropy": 0.6583095034584403, "epoch": 1.6912438686379032, "grad_norm": 0.16246303915977478, "learning_rate": 4.362866869077193e-05, "loss": 0.6612, "mean_token_accuracy": 0.80109428986907, "num_tokens": 586716885.0, "step": 18382 }, { "entropy": 0.5815250128507614, "epoch": 1.6913358750093443, "grad_norm": 0.15033847093582153, "learning_rate": 4.3625601864630295e-05, "loss": 0.5787, "mean_token_accuracy": 0.8255843371152878, "num_tokens": 586748999.0, "step": 18383 }, { "entropy": 0.6294097285717726, "epoch": 1.6914278813807857, "grad_norm": 0.15490396320819855, "learning_rate": 4.362253503848867e-05, "loss": 0.6225, "mean_token_accuracy": 0.808561310172081, "num_tokens": 586781767.0, "step": 18384 }, { "entropy": 0.5642022807151079, "epoch": 1.6915198877522268, "grad_norm": 0.1569616049528122, "learning_rate": 4.3619468212347044e-05, "loss": 0.5474, "mean_token_accuracy": 0.8355674035847187, "num_tokens": 586813555.0, "step": 18385 }, { "entropy": 0.6040282100439072, "epoch": 1.691611894123668, "grad_norm": 0.1614800989627838, "learning_rate": 4.361640138620542e-05, "loss": 0.5945, "mean_token_accuracy": 0.8197048678994179, "num_tokens": 586845150.0, "step": 18386 }, { "entropy": 0.6229828465729952, "epoch": 1.6917039004951093, "grad_norm": 0.1567278653383255, "learning_rate": 4.361333456006379e-05, "loss": 0.6087, "mean_token_accuracy": 0.8172919228672981, "num_tokens": 586876907.0, "step": 18387 }, { "entropy": 0.6115531902760267, "epoch": 1.6917959068665505, "grad_norm": 0.15673989057540894, "learning_rate": 4.361026773392217e-05, "loss": 0.6034, "mean_token_accuracy": 0.8194367326796055, "num_tokens": 586909229.0, "step": 18388 }, { "entropy": 0.5472872843965888, "epoch": 1.6918879132379918, "grad_norm": 0.14979049563407898, "learning_rate": 4.3607200907780536e-05, "loss": 0.5454, "mean_token_accuracy": 0.8339706994593143, "num_tokens": 586941446.0, "step": 18389 }, { "entropy": 0.7082349676638842, "epoch": 1.691979919609433, "grad_norm": 0.16012506186962128, "learning_rate": 4.360413408163892e-05, "loss": 0.7063, "mean_token_accuracy": 0.7861600704491138, "num_tokens": 586973604.0, "step": 18390 }, { "entropy": 0.6296662129461765, "epoch": 1.692071925980874, "grad_norm": 0.15730193257331848, "learning_rate": 4.3601067255497285e-05, "loss": 0.6178, "mean_token_accuracy": 0.8103850409388542, "num_tokens": 587005464.0, "step": 18391 }, { "entropy": 0.6306332405656576, "epoch": 1.6921639323523154, "grad_norm": 0.1607389897108078, "learning_rate": 4.359800042935566e-05, "loss": 0.6241, "mean_token_accuracy": 0.8103515096008778, "num_tokens": 587037521.0, "step": 18392 }, { "entropy": 0.5434005912393332, "epoch": 1.6922559387237566, "grad_norm": 0.14828315377235413, "learning_rate": 4.3594933603214034e-05, "loss": 0.5344, "mean_token_accuracy": 0.8358854427933693, "num_tokens": 587069160.0, "step": 18393 }, { "entropy": 0.6049639340490103, "epoch": 1.692347945095198, "grad_norm": 0.15310348570346832, "learning_rate": 4.359186677707241e-05, "loss": 0.5945, "mean_token_accuracy": 0.8156154528260231, "num_tokens": 587101252.0, "step": 18394 }, { "entropy": 0.665145848877728, "epoch": 1.692439951466639, "grad_norm": 0.15921828150749207, "learning_rate": 4.3588799950930784e-05, "loss": 0.6527, "mean_token_accuracy": 0.7980097457766533, "num_tokens": 587133459.0, "step": 18395 }, { "entropy": 0.583815343445167, "epoch": 1.6925319578380802, "grad_norm": 0.15307298302650452, "learning_rate": 4.358573312478916e-05, "loss": 0.5659, "mean_token_accuracy": 0.8233412951231003, "num_tokens": 587164253.0, "step": 18396 }, { "entropy": 0.6639682874083519, "epoch": 1.6926239642095215, "grad_norm": 0.15856249630451202, "learning_rate": 4.358266629864753e-05, "loss": 0.6661, "mean_token_accuracy": 0.7969589456915855, "num_tokens": 587196662.0, "step": 18397 }, { "entropy": 0.5776577852666378, "epoch": 1.6927159705809627, "grad_norm": 0.15907840430736542, "learning_rate": 4.357959947250591e-05, "loss": 0.5736, "mean_token_accuracy": 0.8266055695712566, "num_tokens": 587229112.0, "step": 18398 }, { "entropy": 0.5593933714553714, "epoch": 1.692807976952404, "grad_norm": 0.1581360548734665, "learning_rate": 4.357653264636428e-05, "loss": 0.545, "mean_token_accuracy": 0.8325214572250843, "num_tokens": 587261364.0, "step": 18399 }, { "entropy": 0.49413512740284204, "epoch": 1.6928999833238452, "grad_norm": 0.14407430589199066, "learning_rate": 4.357346582022265e-05, "loss": 0.4722, "mean_token_accuracy": 0.8545210957527161, "num_tokens": 587293072.0, "step": 18400 }, { "entropy": 0.6291030403226614, "epoch": 1.6929919896952863, "grad_norm": 0.15613949298858643, "learning_rate": 4.357039899408103e-05, "loss": 0.6223, "mean_token_accuracy": 0.8134948536753654, "num_tokens": 587325119.0, "step": 18401 }, { "entropy": 0.6347861588001251, "epoch": 1.6930839960667277, "grad_norm": 0.15487341582775116, "learning_rate": 4.35673321679394e-05, "loss": 0.6253, "mean_token_accuracy": 0.8049218915402889, "num_tokens": 587356689.0, "step": 18402 }, { "entropy": 0.5674461582675576, "epoch": 1.6931760024381688, "grad_norm": 0.14322669804096222, "learning_rate": 4.356426534179778e-05, "loss": 0.5532, "mean_token_accuracy": 0.8324043303728104, "num_tokens": 587389138.0, "step": 18403 }, { "entropy": 0.634026349755004, "epoch": 1.6932680088096101, "grad_norm": 0.15816208720207214, "learning_rate": 4.356119851565615e-05, "loss": 0.6158, "mean_token_accuracy": 0.809504572302103, "num_tokens": 587420010.0, "step": 18404 }, { "entropy": 0.5994433192536235, "epoch": 1.6933600151810513, "grad_norm": 0.15612775087356567, "learning_rate": 4.355813168951452e-05, "loss": 0.5719, "mean_token_accuracy": 0.8234921470284462, "num_tokens": 587451166.0, "step": 18405 }, { "entropy": 0.6443960107862949, "epoch": 1.6934520215524924, "grad_norm": 0.16582418978214264, "learning_rate": 4.35550648633729e-05, "loss": 0.6347, "mean_token_accuracy": 0.805833961814642, "num_tokens": 587481521.0, "step": 18406 }, { "entropy": 0.5641657039523125, "epoch": 1.6935440279239338, "grad_norm": 0.15143322944641113, "learning_rate": 4.355199803723127e-05, "loss": 0.5511, "mean_token_accuracy": 0.8289021477103233, "num_tokens": 587513942.0, "step": 18407 }, { "entropy": 0.6654325239360332, "epoch": 1.693636034295375, "grad_norm": 0.15921102464199066, "learning_rate": 4.354893121108965e-05, "loss": 0.6434, "mean_token_accuracy": 0.8031970635056496, "num_tokens": 587546213.0, "step": 18408 }, { "entropy": 0.5989088404458016, "epoch": 1.6937280406668163, "grad_norm": 0.15234315395355225, "learning_rate": 4.354586438494802e-05, "loss": 0.5846, "mean_token_accuracy": 0.8217759728431702, "num_tokens": 587578226.0, "step": 18409 }, { "entropy": 0.6387266777455807, "epoch": 1.6938200470382574, "grad_norm": 0.15533053874969482, "learning_rate": 4.354279755880639e-05, "loss": 0.6396, "mean_token_accuracy": 0.8051913902163506, "num_tokens": 587610350.0, "step": 18410 }, { "entropy": 0.6493906239047647, "epoch": 1.6939120534096985, "grad_norm": 0.15942718088626862, "learning_rate": 4.353973073266477e-05, "loss": 0.6509, "mean_token_accuracy": 0.8063803054392338, "num_tokens": 587642239.0, "step": 18411 }, { "entropy": 0.6510259546339512, "epoch": 1.6940040597811399, "grad_norm": 0.15967486798763275, "learning_rate": 4.353666390652314e-05, "loss": 0.6297, "mean_token_accuracy": 0.8074197545647621, "num_tokens": 587674552.0, "step": 18412 }, { "entropy": 0.6084071034565568, "epoch": 1.694096066152581, "grad_norm": 0.1570311039686203, "learning_rate": 4.3533597080381514e-05, "loss": 0.6117, "mean_token_accuracy": 0.8118571825325489, "num_tokens": 587706790.0, "step": 18413 }, { "entropy": 0.5552931614220142, "epoch": 1.6941880725240224, "grad_norm": 0.15197858214378357, "learning_rate": 4.353053025423989e-05, "loss": 0.5469, "mean_token_accuracy": 0.8278703987598419, "num_tokens": 587738014.0, "step": 18414 }, { "entropy": 0.6030499832704663, "epoch": 1.6942800788954635, "grad_norm": 0.15615518391132355, "learning_rate": 4.352746342809826e-05, "loss": 0.5793, "mean_token_accuracy": 0.8196456097066402, "num_tokens": 587769437.0, "step": 18415 }, { "entropy": 0.5783545486629009, "epoch": 1.6943720852669046, "grad_norm": 0.1625809222459793, "learning_rate": 4.352439660195664e-05, "loss": 0.5554, "mean_token_accuracy": 0.8267388604581356, "num_tokens": 587799835.0, "step": 18416 }, { "entropy": 0.6507317870855331, "epoch": 1.694464091638346, "grad_norm": 0.15909388661384583, "learning_rate": 4.352132977581501e-05, "loss": 0.6493, "mean_token_accuracy": 0.8021978214383125, "num_tokens": 587832299.0, "step": 18417 }, { "entropy": 0.5031209867447615, "epoch": 1.6945560980097871, "grad_norm": 0.13889966905117035, "learning_rate": 4.351826294967338e-05, "loss": 0.4985, "mean_token_accuracy": 0.8457944914698601, "num_tokens": 587864423.0, "step": 18418 }, { "entropy": 0.6173863764852285, "epoch": 1.6946481043812285, "grad_norm": 0.15141154825687408, "learning_rate": 4.351519612353176e-05, "loss": 0.6187, "mean_token_accuracy": 0.8073650225996971, "num_tokens": 587896802.0, "step": 18419 }, { "entropy": 0.44303925335407257, "epoch": 1.6947401107526696, "grad_norm": 0.14652001857757568, "learning_rate": 4.351212929739013e-05, "loss": 0.4466, "mean_token_accuracy": 0.8649734854698181, "num_tokens": 587928255.0, "step": 18420 }, { "entropy": 0.5416290983557701, "epoch": 1.6948321171241107, "grad_norm": 0.14984728395938873, "learning_rate": 4.3509062471248504e-05, "loss": 0.5378, "mean_token_accuracy": 0.833978071808815, "num_tokens": 587959962.0, "step": 18421 }, { "entropy": 0.5696462905034423, "epoch": 1.694924123495552, "grad_norm": 0.14707182347774506, "learning_rate": 4.350599564510688e-05, "loss": 0.5557, "mean_token_accuracy": 0.8340601660311222, "num_tokens": 587992100.0, "step": 18422 }, { "entropy": 0.5483913887292147, "epoch": 1.6950161298669932, "grad_norm": 0.15575909614562988, "learning_rate": 4.350292881896525e-05, "loss": 0.5416, "mean_token_accuracy": 0.8320976532995701, "num_tokens": 588024077.0, "step": 18423 }, { "entropy": 0.6273685740306973, "epoch": 1.6951081362384346, "grad_norm": 0.1589784175157547, "learning_rate": 4.349986199282363e-05, "loss": 0.6111, "mean_token_accuracy": 0.8145561069250107, "num_tokens": 588056000.0, "step": 18424 }, { "entropy": 0.5952739184722304, "epoch": 1.6952001426098757, "grad_norm": 0.15679332613945007, "learning_rate": 4.3496795166682e-05, "loss": 0.5789, "mean_token_accuracy": 0.8267504870891571, "num_tokens": 588087335.0, "step": 18425 }, { "entropy": 0.6791492914780974, "epoch": 1.6952921489813169, "grad_norm": 0.15606367588043213, "learning_rate": 4.349372834054038e-05, "loss": 0.664, "mean_token_accuracy": 0.7978039272129536, "num_tokens": 588119575.0, "step": 18426 }, { "entropy": 0.6291680498979986, "epoch": 1.6953841553527582, "grad_norm": 0.16094909608364105, "learning_rate": 4.349066151439875e-05, "loss": 0.6105, "mean_token_accuracy": 0.8154231309890747, "num_tokens": 588150914.0, "step": 18427 }, { "entropy": 0.590786324813962, "epoch": 1.6954761617241993, "grad_norm": 0.15915368497371674, "learning_rate": 4.3487594688257127e-05, "loss": 0.5816, "mean_token_accuracy": 0.8226877637207508, "num_tokens": 588183001.0, "step": 18428 }, { "entropy": 0.6157570602372289, "epoch": 1.6955681680956407, "grad_norm": 0.15760819613933563, "learning_rate": 4.34845278621155e-05, "loss": 0.5992, "mean_token_accuracy": 0.8173147737979889, "num_tokens": 588214526.0, "step": 18429 }, { "entropy": 0.6460991464555264, "epoch": 1.6956601744670818, "grad_norm": 0.15788830816745758, "learning_rate": 4.3481461035973876e-05, "loss": 0.6354, "mean_token_accuracy": 0.8054445497691631, "num_tokens": 588246473.0, "step": 18430 }, { "entropy": 0.6587066855281591, "epoch": 1.695752180838523, "grad_norm": 0.16106612980365753, "learning_rate": 4.3478394209832244e-05, "loss": 0.6411, "mean_token_accuracy": 0.8019272051751614, "num_tokens": 588278261.0, "step": 18431 }, { "entropy": 0.6025052312761545, "epoch": 1.6958441872099643, "grad_norm": 0.15042267739772797, "learning_rate": 4.3475327383690625e-05, "loss": 0.5895, "mean_token_accuracy": 0.8174622021615505, "num_tokens": 588310163.0, "step": 18432 }, { "entropy": 0.5577194560319185, "epoch": 1.6959361935814055, "grad_norm": 0.15206314623355865, "learning_rate": 4.347226055754899e-05, "loss": 0.5472, "mean_token_accuracy": 0.8299205787479877, "num_tokens": 588341288.0, "step": 18433 }, { "entropy": 0.5707679300103337, "epoch": 1.6960281999528468, "grad_norm": 0.14676176011562347, "learning_rate": 4.346919373140737e-05, "loss": 0.5639, "mean_token_accuracy": 0.8256403282284737, "num_tokens": 588373420.0, "step": 18434 }, { "entropy": 0.6274117734283209, "epoch": 1.696120206324288, "grad_norm": 0.15926070511341095, "learning_rate": 4.346612690526574e-05, "loss": 0.6214, "mean_token_accuracy": 0.8111732937395573, "num_tokens": 588405744.0, "step": 18435 }, { "entropy": 0.5405623577535152, "epoch": 1.696212212695729, "grad_norm": 0.14515653252601624, "learning_rate": 4.346306007912412e-05, "loss": 0.5314, "mean_token_accuracy": 0.8366645462810993, "num_tokens": 588438265.0, "step": 18436 }, { "entropy": 0.551134985871613, "epoch": 1.6963042190671704, "grad_norm": 0.15556693077087402, "learning_rate": 4.345999325298249e-05, "loss": 0.5407, "mean_token_accuracy": 0.8332723490893841, "num_tokens": 588470176.0, "step": 18437 }, { "entropy": 0.4811762971803546, "epoch": 1.6963962254386116, "grad_norm": 0.14058619737625122, "learning_rate": 4.3456926426840866e-05, "loss": 0.4694, "mean_token_accuracy": 0.8543487451970577, "num_tokens": 588502342.0, "step": 18438 }, { "entropy": 0.6076651480980217, "epoch": 1.696488231810053, "grad_norm": 0.15628540515899658, "learning_rate": 4.3453859600699234e-05, "loss": 0.5962, "mean_token_accuracy": 0.817248985171318, "num_tokens": 588534227.0, "step": 18439 }, { "entropy": 0.6729256473481655, "epoch": 1.696580238181494, "grad_norm": 0.16274741291999817, "learning_rate": 4.3450792774557616e-05, "loss": 0.6751, "mean_token_accuracy": 0.792446568608284, "num_tokens": 588565986.0, "step": 18440 }, { "entropy": 0.5433006568346173, "epoch": 1.6966722445529352, "grad_norm": 0.14443205296993256, "learning_rate": 4.3447725948415983e-05, "loss": 0.529, "mean_token_accuracy": 0.8366485685110092, "num_tokens": 588597588.0, "step": 18441 }, { "entropy": 0.6173856118693948, "epoch": 1.6967642509243765, "grad_norm": 0.16082148253917694, "learning_rate": 4.3444659122274365e-05, "loss": 0.6021, "mean_token_accuracy": 0.8146566562354565, "num_tokens": 588628709.0, "step": 18442 }, { "entropy": 0.629576669074595, "epoch": 1.6968562572958177, "grad_norm": 0.15479624271392822, "learning_rate": 4.344159229613273e-05, "loss": 0.6136, "mean_token_accuracy": 0.8085192106664181, "num_tokens": 588660565.0, "step": 18443 }, { "entropy": 0.502192092128098, "epoch": 1.696948263667259, "grad_norm": 0.14398640394210815, "learning_rate": 4.343852546999111e-05, "loss": 0.4856, "mean_token_accuracy": 0.8491214364767075, "num_tokens": 588692799.0, "step": 18444 }, { "entropy": 0.6572241298854351, "epoch": 1.6970402700387002, "grad_norm": 0.16123105585575104, "learning_rate": 4.343545864384948e-05, "loss": 0.6574, "mean_token_accuracy": 0.7972839809954166, "num_tokens": 588725153.0, "step": 18445 }, { "entropy": 0.590052873827517, "epoch": 1.6971322764101413, "grad_norm": 0.15180185437202454, "learning_rate": 4.343239181770786e-05, "loss": 0.591, "mean_token_accuracy": 0.8169620893895626, "num_tokens": 588757570.0, "step": 18446 }, { "entropy": 0.5136648397892714, "epoch": 1.6972242827815827, "grad_norm": 0.14383892714977264, "learning_rate": 4.342932499156623e-05, "loss": 0.5123, "mean_token_accuracy": 0.8443947546184063, "num_tokens": 588789870.0, "step": 18447 }, { "entropy": 0.683208012022078, "epoch": 1.6973162891530238, "grad_norm": 0.15918804705142975, "learning_rate": 4.3426258165424606e-05, "loss": 0.6698, "mean_token_accuracy": 0.7991132214665413, "num_tokens": 588821814.0, "step": 18448 }, { "entropy": 0.623269010335207, "epoch": 1.6974082955244651, "grad_norm": 0.1526372879743576, "learning_rate": 4.3423191339282974e-05, "loss": 0.5995, "mean_token_accuracy": 0.8165196403861046, "num_tokens": 588853871.0, "step": 18449 }, { "entropy": 0.6831203615292907, "epoch": 1.6975003018959063, "grad_norm": 0.15776199102401733, "learning_rate": 4.3420124513141355e-05, "loss": 0.6799, "mean_token_accuracy": 0.78752401471138, "num_tokens": 588886384.0, "step": 18450 }, { "entropy": 0.4655967294238508, "epoch": 1.6975923082673474, "grad_norm": 0.14306609332561493, "learning_rate": 4.341705768699972e-05, "loss": 0.456, "mean_token_accuracy": 0.856754370033741, "num_tokens": 588917993.0, "step": 18451 }, { "entropy": 0.6142483185976744, "epoch": 1.6976843146387888, "grad_norm": 0.15191037952899933, "learning_rate": 4.34139908608581e-05, "loss": 0.5968, "mean_token_accuracy": 0.8158519119024277, "num_tokens": 588949415.0, "step": 18452 }, { "entropy": 0.5904209775617346, "epoch": 1.69777632101023, "grad_norm": 0.1499367356300354, "learning_rate": 4.341092403471647e-05, "loss": 0.5852, "mean_token_accuracy": 0.8194957785308361, "num_tokens": 588980962.0, "step": 18453 }, { "entropy": 0.5185675658285618, "epoch": 1.6978683273816713, "grad_norm": 0.14244352281093597, "learning_rate": 4.340785720857485e-05, "loss": 0.5123, "mean_token_accuracy": 0.8414500094950199, "num_tokens": 589013364.0, "step": 18454 }, { "entropy": 0.5396894440054893, "epoch": 1.6979603337531124, "grad_norm": 0.1522633582353592, "learning_rate": 4.340479038243322e-05, "loss": 0.5366, "mean_token_accuracy": 0.834348302334547, "num_tokens": 589045310.0, "step": 18455 }, { "entropy": 0.7208814360201359, "epoch": 1.6980523401245535, "grad_norm": 0.1626274585723877, "learning_rate": 4.3401723556291596e-05, "loss": 0.725, "mean_token_accuracy": 0.7811965495347977, "num_tokens": 589077242.0, "step": 18456 }, { "entropy": 0.6658765077590942, "epoch": 1.6981443464959949, "grad_norm": 0.15944470465183258, "learning_rate": 4.339865673014997e-05, "loss": 0.6679, "mean_token_accuracy": 0.7981298752129078, "num_tokens": 589109764.0, "step": 18457 }, { "entropy": 0.5910831466317177, "epoch": 1.698236352867436, "grad_norm": 0.15589796006679535, "learning_rate": 4.3395589904008346e-05, "loss": 0.5946, "mean_token_accuracy": 0.8152587041258812, "num_tokens": 589141998.0, "step": 18458 }, { "entropy": 0.7856415286660194, "epoch": 1.6983283592388774, "grad_norm": 0.1704552322626114, "learning_rate": 4.339252307786672e-05, "loss": 0.7815, "mean_token_accuracy": 0.7604516632854939, "num_tokens": 589173909.0, "step": 18459 }, { "entropy": 0.5775080737657845, "epoch": 1.6984203656103185, "grad_norm": 0.14872293174266815, "learning_rate": 4.338945625172509e-05, "loss": 0.5624, "mean_token_accuracy": 0.8252491168677807, "num_tokens": 589205833.0, "step": 18460 }, { "entropy": 0.6166323041543365, "epoch": 1.6985123719817596, "grad_norm": 0.1499153971672058, "learning_rate": 4.338638942558347e-05, "loss": 0.5957, "mean_token_accuracy": 0.8157620690762997, "num_tokens": 589238249.0, "step": 18461 }, { "entropy": 0.5793084008619189, "epoch": 1.698604378353201, "grad_norm": 0.15395447611808777, "learning_rate": 4.338332259944184e-05, "loss": 0.5704, "mean_token_accuracy": 0.8275145143270493, "num_tokens": 589270484.0, "step": 18462 }, { "entropy": 0.6144809797406197, "epoch": 1.6986963847246421, "grad_norm": 0.15577644109725952, "learning_rate": 4.338025577330022e-05, "loss": 0.6048, "mean_token_accuracy": 0.8158523738384247, "num_tokens": 589302553.0, "step": 18463 }, { "entropy": 0.5932198560331017, "epoch": 1.6987883910960835, "grad_norm": 0.1531713753938675, "learning_rate": 4.337718894715859e-05, "loss": 0.5786, "mean_token_accuracy": 0.8204208500683308, "num_tokens": 589334300.0, "step": 18464 }, { "entropy": 0.6586618069559336, "epoch": 1.6988803974675246, "grad_norm": 0.15669222176074982, "learning_rate": 4.337412212101696e-05, "loss": 0.6476, "mean_token_accuracy": 0.8018350712954998, "num_tokens": 589365997.0, "step": 18465 }, { "entropy": 0.6517608175054193, "epoch": 1.6989724038389658, "grad_norm": 0.1600392609834671, "learning_rate": 4.3371055294875336e-05, "loss": 0.6469, "mean_token_accuracy": 0.8020252510905266, "num_tokens": 589397511.0, "step": 18466 }, { "entropy": 0.6071168072521687, "epoch": 1.699064410210407, "grad_norm": 0.1472749412059784, "learning_rate": 4.336798846873371e-05, "loss": 0.5959, "mean_token_accuracy": 0.8172474801540375, "num_tokens": 589429990.0, "step": 18467 }, { "entropy": 0.7253922801464796, "epoch": 1.6991564165818482, "grad_norm": 0.16044436395168304, "learning_rate": 4.3364921642592085e-05, "loss": 0.7244, "mean_token_accuracy": 0.7867164611816406, "num_tokens": 589461234.0, "step": 18468 }, { "entropy": 0.5768087208271027, "epoch": 1.6992484229532896, "grad_norm": 0.15431222319602966, "learning_rate": 4.336185481645046e-05, "loss": 0.5474, "mean_token_accuracy": 0.8307097479701042, "num_tokens": 589493514.0, "step": 18469 }, { "entropy": 0.638455281034112, "epoch": 1.6993404293247307, "grad_norm": 0.15965895354747772, "learning_rate": 4.335878799030883e-05, "loss": 0.6266, "mean_token_accuracy": 0.8069493807852268, "num_tokens": 589525623.0, "step": 18470 }, { "entropy": 0.6780338007956743, "epoch": 1.6994324356961719, "grad_norm": 0.16333338618278503, "learning_rate": 4.335572116416721e-05, "loss": 0.6785, "mean_token_accuracy": 0.7919697128236294, "num_tokens": 589557904.0, "step": 18471 }, { "entropy": 0.6887124311178923, "epoch": 1.6995244420676132, "grad_norm": 0.16525916755199432, "learning_rate": 4.335265433802558e-05, "loss": 0.6933, "mean_token_accuracy": 0.7910476885735989, "num_tokens": 589589887.0, "step": 18472 }, { "entropy": 0.6245485232211649, "epoch": 1.6996164484390544, "grad_norm": 0.15462790429592133, "learning_rate": 4.334958751188395e-05, "loss": 0.6145, "mean_token_accuracy": 0.8132783249020576, "num_tokens": 589622274.0, "step": 18473 }, { "entropy": 0.6184563506394625, "epoch": 1.6997084548104957, "grad_norm": 0.15475334227085114, "learning_rate": 4.3346520685742326e-05, "loss": 0.61, "mean_token_accuracy": 0.812042985111475, "num_tokens": 589654107.0, "step": 18474 }, { "entropy": 0.6878101825714111, "epoch": 1.6998004611819368, "grad_norm": 0.15852995216846466, "learning_rate": 4.33434538596007e-05, "loss": 0.6744, "mean_token_accuracy": 0.7951664179563522, "num_tokens": 589686215.0, "step": 18475 }, { "entropy": 0.6582869682461023, "epoch": 1.699892467553378, "grad_norm": 0.15731529891490936, "learning_rate": 4.3340387033459076e-05, "loss": 0.6536, "mean_token_accuracy": 0.8001772835850716, "num_tokens": 589717710.0, "step": 18476 }, { "entropy": 0.5706868525594473, "epoch": 1.6999844739248193, "grad_norm": 0.14754796028137207, "learning_rate": 4.333732020731745e-05, "loss": 0.5541, "mean_token_accuracy": 0.8308042287826538, "num_tokens": 589750409.0, "step": 18477 }, { "entropy": 0.6379914712160826, "epoch": 1.7000764802962605, "grad_norm": 0.15372717380523682, "learning_rate": 4.333425338117582e-05, "loss": 0.6241, "mean_token_accuracy": 0.804260291159153, "num_tokens": 589781917.0, "step": 18478 }, { "entropy": 0.6341215381398797, "epoch": 1.7001684866677018, "grad_norm": 0.15756331384181976, "learning_rate": 4.33311865550342e-05, "loss": 0.6134, "mean_token_accuracy": 0.8069992773234844, "num_tokens": 589813198.0, "step": 18479 }, { "entropy": 0.5614200662821531, "epoch": 1.700260493039143, "grad_norm": 0.15407519042491913, "learning_rate": 4.332811972889257e-05, "loss": 0.5622, "mean_token_accuracy": 0.8283643573522568, "num_tokens": 589845158.0, "step": 18480 }, { "entropy": 0.6028850544244051, "epoch": 1.700352499410584, "grad_norm": 0.15604844689369202, "learning_rate": 4.332505290275094e-05, "loss": 0.5884, "mean_token_accuracy": 0.8164391592144966, "num_tokens": 589877303.0, "step": 18481 }, { "entropy": 0.6392002254724503, "epoch": 1.7004445057820254, "grad_norm": 0.15965236723423004, "learning_rate": 4.332198607660932e-05, "loss": 0.6267, "mean_token_accuracy": 0.8092700354754925, "num_tokens": 589909289.0, "step": 18482 }, { "entropy": 0.6364929955452681, "epoch": 1.7005365121534666, "grad_norm": 0.16164182126522064, "learning_rate": 4.331891925046769e-05, "loss": 0.613, "mean_token_accuracy": 0.8101599924266338, "num_tokens": 589941337.0, "step": 18483 }, { "entropy": 0.5279473338741809, "epoch": 1.700628518524908, "grad_norm": 0.14758892357349396, "learning_rate": 4.3315852424326066e-05, "loss": 0.5147, "mean_token_accuracy": 0.8392584100365639, "num_tokens": 589973971.0, "step": 18484 }, { "entropy": 0.6356919407844543, "epoch": 1.700720524896349, "grad_norm": 0.15838530659675598, "learning_rate": 4.331278559818444e-05, "loss": 0.6311, "mean_token_accuracy": 0.8047512322664261, "num_tokens": 590005731.0, "step": 18485 }, { "entropy": 0.681212093681097, "epoch": 1.7008125312677902, "grad_norm": 0.16079983115196228, "learning_rate": 4.3309718772042815e-05, "loss": 0.6751, "mean_token_accuracy": 0.7954626455903053, "num_tokens": 590037587.0, "step": 18486 }, { "entropy": 0.5407469645142555, "epoch": 1.7009045376392316, "grad_norm": 0.1517559289932251, "learning_rate": 4.330665194590119e-05, "loss": 0.5283, "mean_token_accuracy": 0.8336001299321651, "num_tokens": 590068738.0, "step": 18487 }, { "entropy": 0.6657405588775873, "epoch": 1.7009965440106727, "grad_norm": 0.16403748095035553, "learning_rate": 4.3303585119759565e-05, "loss": 0.6587, "mean_token_accuracy": 0.8011924102902412, "num_tokens": 590100202.0, "step": 18488 }, { "entropy": 0.6906909700483084, "epoch": 1.701088550382114, "grad_norm": 0.15829278528690338, "learning_rate": 4.330051829361794e-05, "loss": 0.6838, "mean_token_accuracy": 0.7914650626480579, "num_tokens": 590131483.0, "step": 18489 }, { "entropy": 0.6088766641914845, "epoch": 1.7011805567535552, "grad_norm": 0.15714426338672638, "learning_rate": 4.3297451467476314e-05, "loss": 0.5956, "mean_token_accuracy": 0.8116152621805668, "num_tokens": 590163380.0, "step": 18490 }, { "entropy": 0.5469550052657723, "epoch": 1.7012725631249963, "grad_norm": 0.1439819186925888, "learning_rate": 4.329438464133468e-05, "loss": 0.5394, "mean_token_accuracy": 0.8336788415908813, "num_tokens": 590195212.0, "step": 18491 }, { "entropy": 0.5461481306701899, "epoch": 1.7013645694964377, "grad_norm": 0.14712782204151154, "learning_rate": 4.329131781519306e-05, "loss": 0.5328, "mean_token_accuracy": 0.8320152461528778, "num_tokens": 590227220.0, "step": 18492 }, { "entropy": 0.49039215222001076, "epoch": 1.7014565758678788, "grad_norm": 0.14523953199386597, "learning_rate": 4.328825098905143e-05, "loss": 0.4779, "mean_token_accuracy": 0.8504128083586693, "num_tokens": 590259784.0, "step": 18493 }, { "entropy": 0.6964020980522037, "epoch": 1.7015485822393202, "grad_norm": 0.16092947125434875, "learning_rate": 4.3285184162909806e-05, "loss": 0.6959, "mean_token_accuracy": 0.7900769673287868, "num_tokens": 590291167.0, "step": 18494 }, { "entropy": 0.4358631824143231, "epoch": 1.7016405886107613, "grad_norm": 0.1462910771369934, "learning_rate": 4.328211733676818e-05, "loss": 0.4186, "mean_token_accuracy": 0.8646043837070465, "num_tokens": 590322883.0, "step": 18495 }, { "entropy": 0.7313349470496178, "epoch": 1.7017325949822024, "grad_norm": 0.1667155921459198, "learning_rate": 4.3279050510626555e-05, "loss": 0.7177, "mean_token_accuracy": 0.783086534589529, "num_tokens": 590354932.0, "step": 18496 }, { "entropy": 0.64105917327106, "epoch": 1.7018246013536438, "grad_norm": 0.16041232645511627, "learning_rate": 4.327598368448493e-05, "loss": 0.6491, "mean_token_accuracy": 0.8036639243364334, "num_tokens": 590386648.0, "step": 18497 }, { "entropy": 0.5991866383701563, "epoch": 1.701916607725085, "grad_norm": 0.15559524297714233, "learning_rate": 4.3272916858343304e-05, "loss": 0.5859, "mean_token_accuracy": 0.819328211247921, "num_tokens": 590418371.0, "step": 18498 }, { "entropy": 0.6858785524964333, "epoch": 1.7020086140965263, "grad_norm": 0.16218741238117218, "learning_rate": 4.326985003220167e-05, "loss": 0.6785, "mean_token_accuracy": 0.7939840219914913, "num_tokens": 590450188.0, "step": 18499 }, { "entropy": 0.5796874864026904, "epoch": 1.7021006204679674, "grad_norm": 0.1464882493019104, "learning_rate": 4.3266783206060054e-05, "loss": 0.5677, "mean_token_accuracy": 0.8262629620730877, "num_tokens": 590482241.0, "step": 18500 }, { "entropy": 0.5671443548053503, "epoch": 1.7021926268394085, "grad_norm": 0.15536896884441376, "learning_rate": 4.326371637991842e-05, "loss": 0.5604, "mean_token_accuracy": 0.8279390782117844, "num_tokens": 590514385.0, "step": 18501 }, { "entropy": 0.5730184782296419, "epoch": 1.7022846332108499, "grad_norm": 0.15870970487594604, "learning_rate": 4.32606495537768e-05, "loss": 0.5638, "mean_token_accuracy": 0.8219228871166706, "num_tokens": 590546378.0, "step": 18502 }, { "entropy": 0.6489887591451406, "epoch": 1.7023766395822912, "grad_norm": 0.1569584459066391, "learning_rate": 4.325758272763517e-05, "loss": 0.6452, "mean_token_accuracy": 0.8012672290205956, "num_tokens": 590578664.0, "step": 18503 }, { "entropy": 0.5594515046104789, "epoch": 1.7024686459537324, "grad_norm": 0.15053047239780426, "learning_rate": 4.3254515901493546e-05, "loss": 0.5446, "mean_token_accuracy": 0.829731147736311, "num_tokens": 590610428.0, "step": 18504 }, { "entropy": 0.7234377525746822, "epoch": 1.7025606523251735, "grad_norm": 0.16239503026008606, "learning_rate": 4.325144907535192e-05, "loss": 0.7091, "mean_token_accuracy": 0.7848448753356934, "num_tokens": 590642041.0, "step": 18505 }, { "entropy": 0.5662931110709906, "epoch": 1.7026526586966146, "grad_norm": 0.14759430289268494, "learning_rate": 4.3248382249210295e-05, "loss": 0.5588, "mean_token_accuracy": 0.8273534849286079, "num_tokens": 590674141.0, "step": 18506 }, { "entropy": 0.5711950706318021, "epoch": 1.702744665068056, "grad_norm": 0.15647603571414948, "learning_rate": 4.324531542306867e-05, "loss": 0.5685, "mean_token_accuracy": 0.826300822198391, "num_tokens": 590705900.0, "step": 18507 }, { "entropy": 0.5398175492882729, "epoch": 1.7028366714394974, "grad_norm": 0.14288891851902008, "learning_rate": 4.3242248596927044e-05, "loss": 0.5282, "mean_token_accuracy": 0.8375294730067253, "num_tokens": 590738267.0, "step": 18508 }, { "entropy": 0.5621651108376682, "epoch": 1.7029286778109385, "grad_norm": 0.15868909657001495, "learning_rate": 4.323918177078541e-05, "loss": 0.5462, "mean_token_accuracy": 0.8260793909430504, "num_tokens": 590769928.0, "step": 18509 }, { "entropy": 0.5454700705595315, "epoch": 1.7030206841823796, "grad_norm": 0.14401759207248688, "learning_rate": 4.3236114944643793e-05, "loss": 0.539, "mean_token_accuracy": 0.838415551930666, "num_tokens": 590802675.0, "step": 18510 }, { "entropy": 0.5467212228104472, "epoch": 1.7031126905538208, "grad_norm": 0.14751212298870087, "learning_rate": 4.323304811850216e-05, "loss": 0.5473, "mean_token_accuracy": 0.8322051391005516, "num_tokens": 590834709.0, "step": 18511 }, { "entropy": 0.5860138991847634, "epoch": 1.703204696925262, "grad_norm": 0.1499340981245041, "learning_rate": 4.3229981292360536e-05, "loss": 0.5777, "mean_token_accuracy": 0.8223005011677742, "num_tokens": 590867039.0, "step": 18512 }, { "entropy": 0.5613792622461915, "epoch": 1.7032967032967035, "grad_norm": 0.15714824199676514, "learning_rate": 4.322691446621891e-05, "loss": 0.5426, "mean_token_accuracy": 0.8308545649051666, "num_tokens": 590898182.0, "step": 18513 }, { "entropy": 0.5822851471602917, "epoch": 1.7033887096681446, "grad_norm": 0.14910495281219482, "learning_rate": 4.3223847640077285e-05, "loss": 0.5747, "mean_token_accuracy": 0.8249287605285645, "num_tokens": 590930888.0, "step": 18514 }, { "entropy": 0.6130818948149681, "epoch": 1.7034807160395857, "grad_norm": 0.16012457013130188, "learning_rate": 4.322078081393566e-05, "loss": 0.6216, "mean_token_accuracy": 0.8068731129169464, "num_tokens": 590963007.0, "step": 18515 }, { "entropy": 0.530451353173703, "epoch": 1.7035727224110269, "grad_norm": 0.14995579421520233, "learning_rate": 4.3217713987794035e-05, "loss": 0.5185, "mean_token_accuracy": 0.8406858816742897, "num_tokens": 590994967.0, "step": 18516 }, { "entropy": 0.6245351452380419, "epoch": 1.7036647287824682, "grad_norm": 0.15816013514995575, "learning_rate": 4.321464716165241e-05, "loss": 0.6153, "mean_token_accuracy": 0.8113754652440548, "num_tokens": 591026933.0, "step": 18517 }, { "entropy": 0.5433363942429423, "epoch": 1.7037567351539096, "grad_norm": 0.14948679506778717, "learning_rate": 4.3211580335510784e-05, "loss": 0.5479, "mean_token_accuracy": 0.8320051729679108, "num_tokens": 591058983.0, "step": 18518 }, { "entropy": 0.5966420788317919, "epoch": 1.7038487415253507, "grad_norm": 0.1531527191400528, "learning_rate": 4.320851350936916e-05, "loss": 0.5763, "mean_token_accuracy": 0.8193149492144585, "num_tokens": 591091229.0, "step": 18519 }, { "entropy": 0.5295281279832125, "epoch": 1.7039407478967918, "grad_norm": 0.14936797320842743, "learning_rate": 4.3205446683227526e-05, "loss": 0.523, "mean_token_accuracy": 0.8337665274739265, "num_tokens": 591123276.0, "step": 18520 }, { "entropy": 0.5903604025952518, "epoch": 1.704032754268233, "grad_norm": 0.15583258867263794, "learning_rate": 4.320237985708591e-05, "loss": 0.5921, "mean_token_accuracy": 0.8189320452511311, "num_tokens": 591154560.0, "step": 18521 }, { "entropy": 0.7213636115193367, "epoch": 1.7041247606396743, "grad_norm": 0.1667565554380417, "learning_rate": 4.3199313030944276e-05, "loss": 0.72, "mean_token_accuracy": 0.7807835899293423, "num_tokens": 591186232.0, "step": 18522 }, { "entropy": 0.7120594773441553, "epoch": 1.7042167670111157, "grad_norm": 0.15809576213359833, "learning_rate": 4.319624620480266e-05, "loss": 0.6957, "mean_token_accuracy": 0.7890820242464542, "num_tokens": 591217502.0, "step": 18523 }, { "entropy": 0.708829689770937, "epoch": 1.7043087733825568, "grad_norm": 0.1639758050441742, "learning_rate": 4.3193179378661025e-05, "loss": 0.6945, "mean_token_accuracy": 0.7900526821613312, "num_tokens": 591249123.0, "step": 18524 }, { "entropy": 0.6492002829909325, "epoch": 1.704400779753998, "grad_norm": 0.1579829901456833, "learning_rate": 4.31901125525194e-05, "loss": 0.6259, "mean_token_accuracy": 0.8046450577676296, "num_tokens": 591280714.0, "step": 18525 }, { "entropy": 0.5680166287347674, "epoch": 1.704492786125439, "grad_norm": 0.15612870454788208, "learning_rate": 4.3187045726377774e-05, "loss": 0.553, "mean_token_accuracy": 0.8312224298715591, "num_tokens": 591313343.0, "step": 18526 }, { "entropy": 0.6190493442118168, "epoch": 1.7045847924968804, "grad_norm": 0.15407058596611023, "learning_rate": 4.318397890023615e-05, "loss": 0.6017, "mean_token_accuracy": 0.8162629418075085, "num_tokens": 591345453.0, "step": 18527 }, { "entropy": 0.5598542522639036, "epoch": 1.7046767988683218, "grad_norm": 0.15266302227973938, "learning_rate": 4.3180912074094524e-05, "loss": 0.5374, "mean_token_accuracy": 0.8359952345490456, "num_tokens": 591376874.0, "step": 18528 }, { "entropy": 0.5848038140684366, "epoch": 1.704768805239763, "grad_norm": 0.1520274132490158, "learning_rate": 4.31778452479529e-05, "loss": 0.5535, "mean_token_accuracy": 0.8224668204784393, "num_tokens": 591408147.0, "step": 18529 }, { "entropy": 0.5580922700464725, "epoch": 1.704860811611204, "grad_norm": 0.1547228842973709, "learning_rate": 4.3174778421811266e-05, "loss": 0.5384, "mean_token_accuracy": 0.8352249450981617, "num_tokens": 591440199.0, "step": 18530 }, { "entropy": 0.6370693109929562, "epoch": 1.7049528179826452, "grad_norm": 0.1520196497440338, "learning_rate": 4.317171159566965e-05, "loss": 0.6237, "mean_token_accuracy": 0.8100930489599705, "num_tokens": 591472464.0, "step": 18531 }, { "entropy": 0.5008453289046884, "epoch": 1.7050448243540866, "grad_norm": 0.14922459423542023, "learning_rate": 4.3168644769528015e-05, "loss": 0.4894, "mean_token_accuracy": 0.8463876210153103, "num_tokens": 591503821.0, "step": 18532 }, { "entropy": 0.5618497999384999, "epoch": 1.705136830725528, "grad_norm": 0.15066206455230713, "learning_rate": 4.316557794338639e-05, "loss": 0.5508, "mean_token_accuracy": 0.831241600215435, "num_tokens": 591535596.0, "step": 18533 }, { "entropy": 0.7131576370447874, "epoch": 1.705228837096969, "grad_norm": 0.1682099550962448, "learning_rate": 4.3162511117244765e-05, "loss": 0.7145, "mean_token_accuracy": 0.7884935773909092, "num_tokens": 591567909.0, "step": 18534 }, { "entropy": 0.4142937930300832, "epoch": 1.7053208434684102, "grad_norm": 0.13256002962589264, "learning_rate": 4.315944429110314e-05, "loss": 0.4018, "mean_token_accuracy": 0.8726906776428223, "num_tokens": 591599959.0, "step": 18535 }, { "entropy": 0.5971131324768066, "epoch": 1.7054128498398513, "grad_norm": 0.14954769611358643, "learning_rate": 4.3156377464961514e-05, "loss": 0.585, "mean_token_accuracy": 0.822620328515768, "num_tokens": 591632107.0, "step": 18536 }, { "entropy": 0.5633002854883671, "epoch": 1.7055048562112927, "grad_norm": 0.14648787677288055, "learning_rate": 4.315331063881989e-05, "loss": 0.5537, "mean_token_accuracy": 0.8296898007392883, "num_tokens": 591664580.0, "step": 18537 }, { "entropy": 0.5550855710171163, "epoch": 1.705596862582734, "grad_norm": 0.15242180228233337, "learning_rate": 4.3150243812678256e-05, "loss": 0.5578, "mean_token_accuracy": 0.829811304807663, "num_tokens": 591696004.0, "step": 18538 }, { "entropy": 0.48382814414799213, "epoch": 1.7056888689541752, "grad_norm": 0.1502729058265686, "learning_rate": 4.314717698653664e-05, "loss": 0.4791, "mean_token_accuracy": 0.8477377593517303, "num_tokens": 591728420.0, "step": 18539 }, { "entropy": 0.6592730600386858, "epoch": 1.7057808753256163, "grad_norm": 0.15873222053050995, "learning_rate": 4.3144110160395006e-05, "loss": 0.6412, "mean_token_accuracy": 0.8022210597991943, "num_tokens": 591759970.0, "step": 18540 }, { "entropy": 0.5987363150343299, "epoch": 1.7058728816970574, "grad_norm": 0.15537257492542267, "learning_rate": 4.314104333425338e-05, "loss": 0.5984, "mean_token_accuracy": 0.8212200589478016, "num_tokens": 591791996.0, "step": 18541 }, { "entropy": 0.5783218508586287, "epoch": 1.7059648880684988, "grad_norm": 0.15505388379096985, "learning_rate": 4.3137976508111755e-05, "loss": 0.5688, "mean_token_accuracy": 0.8221551179885864, "num_tokens": 591824289.0, "step": 18542 }, { "entropy": 0.6156395561993122, "epoch": 1.7060568944399401, "grad_norm": 0.15842337906360626, "learning_rate": 4.313490968197013e-05, "loss": 0.6093, "mean_token_accuracy": 0.8107838518917561, "num_tokens": 591856514.0, "step": 18543 }, { "entropy": 0.6749777123332024, "epoch": 1.7061489008113813, "grad_norm": 0.15818434953689575, "learning_rate": 4.3131842855828504e-05, "loss": 0.6576, "mean_token_accuracy": 0.7979209497570992, "num_tokens": 591887806.0, "step": 18544 }, { "entropy": 0.5888166769873351, "epoch": 1.7062409071828224, "grad_norm": 0.15084560215473175, "learning_rate": 4.312877602968688e-05, "loss": 0.582, "mean_token_accuracy": 0.8239969871938229, "num_tokens": 591919931.0, "step": 18545 }, { "entropy": 0.5617733858525753, "epoch": 1.7063329135542635, "grad_norm": 0.14966511726379395, "learning_rate": 4.3125709203545254e-05, "loss": 0.548, "mean_token_accuracy": 0.8305093683302402, "num_tokens": 591952233.0, "step": 18546 }, { "entropy": 0.5599923804402351, "epoch": 1.7064249199257049, "grad_norm": 0.14818412065505981, "learning_rate": 4.312264237740363e-05, "loss": 0.541, "mean_token_accuracy": 0.8355659246444702, "num_tokens": 591983314.0, "step": 18547 }, { "entropy": 0.6374699422158301, "epoch": 1.7065169262971462, "grad_norm": 0.1612899899482727, "learning_rate": 4.3119575551262e-05, "loss": 0.628, "mean_token_accuracy": 0.8097050562500954, "num_tokens": 592015544.0, "step": 18548 }, { "entropy": 0.6006647888571024, "epoch": 1.7066089326685874, "grad_norm": 0.1582821011543274, "learning_rate": 4.311650872512038e-05, "loss": 0.5771, "mean_token_accuracy": 0.8220110759139061, "num_tokens": 592047642.0, "step": 18549 }, { "entropy": 0.5248645825777203, "epoch": 1.7067009390400285, "grad_norm": 0.14855974912643433, "learning_rate": 4.311344189897875e-05, "loss": 0.5204, "mean_token_accuracy": 0.8418196700513363, "num_tokens": 592080250.0, "step": 18550 }, { "entropy": 0.6450114534236491, "epoch": 1.7067929454114696, "grad_norm": 0.1582130789756775, "learning_rate": 4.311037507283712e-05, "loss": 0.6448, "mean_token_accuracy": 0.8034885413944721, "num_tokens": 592111238.0, "step": 18551 }, { "entropy": 0.7020458355545998, "epoch": 1.706884951782911, "grad_norm": 0.16211311519145966, "learning_rate": 4.31073082466955e-05, "loss": 0.6859, "mean_token_accuracy": 0.7898649163544178, "num_tokens": 592142553.0, "step": 18552 }, { "entropy": 0.5793888978660107, "epoch": 1.7069769581543524, "grad_norm": 0.15434877574443817, "learning_rate": 4.310424142055387e-05, "loss": 0.5602, "mean_token_accuracy": 0.8236661963164806, "num_tokens": 592174056.0, "step": 18553 }, { "entropy": 0.58451340906322, "epoch": 1.7070689645257935, "grad_norm": 0.1539301723241806, "learning_rate": 4.3101174594412244e-05, "loss": 0.5772, "mean_token_accuracy": 0.8195346221327782, "num_tokens": 592205068.0, "step": 18554 }, { "entropy": 0.69652945920825, "epoch": 1.7071609708972346, "grad_norm": 0.16723862290382385, "learning_rate": 4.309810776827062e-05, "loss": 0.6971, "mean_token_accuracy": 0.7918095737695694, "num_tokens": 592236168.0, "step": 18555 }, { "entropy": 0.5754241235554218, "epoch": 1.7072529772686758, "grad_norm": 0.15240873396396637, "learning_rate": 4.309504094212899e-05, "loss": 0.5645, "mean_token_accuracy": 0.8272681012749672, "num_tokens": 592268360.0, "step": 18556 }, { "entropy": 0.6015109252184629, "epoch": 1.707344983640117, "grad_norm": 0.15102991461753845, "learning_rate": 4.309197411598737e-05, "loss": 0.5936, "mean_token_accuracy": 0.8202612325549126, "num_tokens": 592299660.0, "step": 18557 }, { "entropy": 0.5768546620383859, "epoch": 1.7074369900115585, "grad_norm": 0.1598718911409378, "learning_rate": 4.308890728984574e-05, "loss": 0.5798, "mean_token_accuracy": 0.8238951005041599, "num_tokens": 592330517.0, "step": 18558 }, { "entropy": 0.5037902663461864, "epoch": 1.7075289963829996, "grad_norm": 0.14830507338047028, "learning_rate": 4.308584046370411e-05, "loss": 0.4961, "mean_token_accuracy": 0.846704974770546, "num_tokens": 592361971.0, "step": 18559 }, { "entropy": 0.5903837792575359, "epoch": 1.7076210027544407, "grad_norm": 0.14629578590393066, "learning_rate": 4.308277363756249e-05, "loss": 0.5706, "mean_token_accuracy": 0.8229061178863049, "num_tokens": 592393805.0, "step": 18560 }, { "entropy": 0.633722297847271, "epoch": 1.7077130091258819, "grad_norm": 0.15794843435287476, "learning_rate": 4.307970681142086e-05, "loss": 0.6215, "mean_token_accuracy": 0.811347309499979, "num_tokens": 592426521.0, "step": 18561 }, { "entropy": 0.6479030381888151, "epoch": 1.7078050154973232, "grad_norm": 0.15832464396953583, "learning_rate": 4.307663998527924e-05, "loss": 0.6331, "mean_token_accuracy": 0.8091930150985718, "num_tokens": 592458876.0, "step": 18562 }, { "entropy": 0.6662773601710796, "epoch": 1.7078970218687646, "grad_norm": 0.16332194209098816, "learning_rate": 4.307357315913761e-05, "loss": 0.6533, "mean_token_accuracy": 0.8018324822187424, "num_tokens": 592490637.0, "step": 18563 }, { "entropy": 0.6846255362033844, "epoch": 1.7079890282402057, "grad_norm": 0.15844498574733734, "learning_rate": 4.3070506332995984e-05, "loss": 0.6755, "mean_token_accuracy": 0.7939007878303528, "num_tokens": 592521786.0, "step": 18564 }, { "entropy": 0.7393733412027359, "epoch": 1.7080810346116468, "grad_norm": 0.1707116961479187, "learning_rate": 4.306743950685436e-05, "loss": 0.727, "mean_token_accuracy": 0.7763060368597507, "num_tokens": 592553757.0, "step": 18565 }, { "entropy": 0.5549713429063559, "epoch": 1.708173040983088, "grad_norm": 0.1549854278564453, "learning_rate": 4.306437268071273e-05, "loss": 0.5467, "mean_token_accuracy": 0.8343307189643383, "num_tokens": 592586525.0, "step": 18566 }, { "entropy": 0.6231631338596344, "epoch": 1.7082650473545293, "grad_norm": 0.1567842960357666, "learning_rate": 4.306130585457111e-05, "loss": 0.6134, "mean_token_accuracy": 0.8145304098725319, "num_tokens": 592618654.0, "step": 18567 }, { "entropy": 0.6252487003803253, "epoch": 1.7083570537259707, "grad_norm": 0.15938034653663635, "learning_rate": 4.305823902842948e-05, "loss": 0.6323, "mean_token_accuracy": 0.8086613230407238, "num_tokens": 592649842.0, "step": 18568 }, { "entropy": 0.5011957446113229, "epoch": 1.7084490600974118, "grad_norm": 0.14815951883792877, "learning_rate": 4.305517220228785e-05, "loss": 0.4829, "mean_token_accuracy": 0.8473300486803055, "num_tokens": 592681593.0, "step": 18569 }, { "entropy": 0.4925826136022806, "epoch": 1.708541066468853, "grad_norm": 0.14513693749904633, "learning_rate": 4.305210537614623e-05, "loss": 0.479, "mean_token_accuracy": 0.8486065566539764, "num_tokens": 592713466.0, "step": 18570 }, { "entropy": 0.7085178522393107, "epoch": 1.708633072840294, "grad_norm": 0.15916158258914948, "learning_rate": 4.30490385500046e-05, "loss": 0.6897, "mean_token_accuracy": 0.7886235006153584, "num_tokens": 592745279.0, "step": 18571 }, { "entropy": 0.6440632548183203, "epoch": 1.7087250792117354, "grad_norm": 0.15706005692481995, "learning_rate": 4.3045971723862974e-05, "loss": 0.637, "mean_token_accuracy": 0.8048165589570999, "num_tokens": 592777319.0, "step": 18572 }, { "entropy": 0.6897039427421987, "epoch": 1.7088170855831768, "grad_norm": 0.15625564754009247, "learning_rate": 4.304290489772135e-05, "loss": 0.6856, "mean_token_accuracy": 0.791066188365221, "num_tokens": 592810087.0, "step": 18573 }, { "entropy": 0.6522763948887587, "epoch": 1.708909091954618, "grad_norm": 0.15691262483596802, "learning_rate": 4.3039838071579723e-05, "loss": 0.6509, "mean_token_accuracy": 0.8042047470808029, "num_tokens": 592842327.0, "step": 18574 }, { "entropy": 0.6279069883748889, "epoch": 1.709001098326059, "grad_norm": 0.15541912615299225, "learning_rate": 4.30367712454381e-05, "loss": 0.6219, "mean_token_accuracy": 0.813308160752058, "num_tokens": 592874534.0, "step": 18575 }, { "entropy": 0.6152468807995319, "epoch": 1.7090931046975002, "grad_norm": 0.16162872314453125, "learning_rate": 4.303370441929647e-05, "loss": 0.6045, "mean_token_accuracy": 0.8143512047827244, "num_tokens": 592906681.0, "step": 18576 }, { "entropy": 0.6538624819368124, "epoch": 1.7091851110689416, "grad_norm": 0.1542944312095642, "learning_rate": 4.303063759315485e-05, "loss": 0.6375, "mean_token_accuracy": 0.8057322911918163, "num_tokens": 592939207.0, "step": 18577 }, { "entropy": 0.615428427234292, "epoch": 1.709277117440383, "grad_norm": 0.16048195958137512, "learning_rate": 4.302757076701322e-05, "loss": 0.6027, "mean_token_accuracy": 0.8116350285708904, "num_tokens": 592970275.0, "step": 18578 }, { "entropy": 0.6322948934976012, "epoch": 1.709369123811824, "grad_norm": 0.15746335685253143, "learning_rate": 4.30245039408716e-05, "loss": 0.6176, "mean_token_accuracy": 0.808678399771452, "num_tokens": 593001857.0, "step": 18579 }, { "entropy": 0.6194499339908361, "epoch": 1.7094611301832652, "grad_norm": 0.15217235684394836, "learning_rate": 4.3021437114729965e-05, "loss": 0.6166, "mean_token_accuracy": 0.8140109330415726, "num_tokens": 593034469.0, "step": 18580 }, { "entropy": 0.5614497177302837, "epoch": 1.7095531365547063, "grad_norm": 0.14820003509521484, "learning_rate": 4.3018370288588346e-05, "loss": 0.5363, "mean_token_accuracy": 0.8315073251724243, "num_tokens": 593065844.0, "step": 18581 }, { "entropy": 0.6497903075069189, "epoch": 1.7096451429261477, "grad_norm": 0.16075065732002258, "learning_rate": 4.3015303462446714e-05, "loss": 0.6429, "mean_token_accuracy": 0.7988933958113194, "num_tokens": 593096811.0, "step": 18582 }, { "entropy": 0.6299812868237495, "epoch": 1.709737149297589, "grad_norm": 0.15604311227798462, "learning_rate": 4.3012236636305095e-05, "loss": 0.625, "mean_token_accuracy": 0.8116488493978977, "num_tokens": 593128507.0, "step": 18583 }, { "entropy": 0.5864133748691529, "epoch": 1.7098291556690302, "grad_norm": 0.1484430879354477, "learning_rate": 4.300916981016346e-05, "loss": 0.5813, "mean_token_accuracy": 0.8229323551058769, "num_tokens": 593160909.0, "step": 18584 }, { "entropy": 0.6677423277869821, "epoch": 1.7099211620404713, "grad_norm": 0.16705970466136932, "learning_rate": 4.300610298402184e-05, "loss": 0.6765, "mean_token_accuracy": 0.7987125739455223, "num_tokens": 593192183.0, "step": 18585 }, { "entropy": 0.5304914563894272, "epoch": 1.7100131684119124, "grad_norm": 0.15982158482074738, "learning_rate": 4.300303615788021e-05, "loss": 0.5151, "mean_token_accuracy": 0.8385265953838825, "num_tokens": 593223772.0, "step": 18586 }, { "entropy": 0.5992724755778909, "epoch": 1.7101051747833538, "grad_norm": 0.1599227637052536, "learning_rate": 4.299996933173859e-05, "loss": 0.5811, "mean_token_accuracy": 0.8200402855873108, "num_tokens": 593255681.0, "step": 18587 }, { "entropy": 0.6527821887284517, "epoch": 1.7101971811547951, "grad_norm": 0.15756507217884064, "learning_rate": 4.299690250559696e-05, "loss": 0.6332, "mean_token_accuracy": 0.8050932921469212, "num_tokens": 593286406.0, "step": 18588 }, { "entropy": 0.5930569169577211, "epoch": 1.7102891875262363, "grad_norm": 0.15308596193790436, "learning_rate": 4.2993835679455336e-05, "loss": 0.5641, "mean_token_accuracy": 0.8223659098148346, "num_tokens": 593318250.0, "step": 18589 }, { "entropy": 0.5506706405431032, "epoch": 1.7103811938976774, "grad_norm": 0.14833520352840424, "learning_rate": 4.2990768853313704e-05, "loss": 0.5369, "mean_token_accuracy": 0.8341872617602348, "num_tokens": 593349816.0, "step": 18590 }, { "entropy": 0.5928919622674584, "epoch": 1.7104732002691185, "grad_norm": 0.15335068106651306, "learning_rate": 4.2987702027172086e-05, "loss": 0.5865, "mean_token_accuracy": 0.8166923820972443, "num_tokens": 593381277.0, "step": 18591 }, { "entropy": 0.49029590329155326, "epoch": 1.7105652066405599, "grad_norm": 0.14688675105571747, "learning_rate": 4.2984635201030454e-05, "loss": 0.4822, "mean_token_accuracy": 0.8560506999492645, "num_tokens": 593413512.0, "step": 18592 }, { "entropy": 0.6387984026223421, "epoch": 1.7106572130120012, "grad_norm": 0.16397725045681, "learning_rate": 4.298156837488883e-05, "loss": 0.6319, "mean_token_accuracy": 0.8070162534713745, "num_tokens": 593445530.0, "step": 18593 }, { "entropy": 0.6541102021001279, "epoch": 1.7107492193834424, "grad_norm": 0.1578264683485031, "learning_rate": 4.29785015487472e-05, "loss": 0.6464, "mean_token_accuracy": 0.8030143827199936, "num_tokens": 593477889.0, "step": 18594 }, { "entropy": 0.5018319650553167, "epoch": 1.7108412257548835, "grad_norm": 0.1416640728712082, "learning_rate": 4.297543472260558e-05, "loss": 0.4869, "mean_token_accuracy": 0.8476288914680481, "num_tokens": 593510569.0, "step": 18595 }, { "entropy": 0.631610905751586, "epoch": 1.7109332321263246, "grad_norm": 0.15584667026996613, "learning_rate": 4.297236789646395e-05, "loss": 0.6024, "mean_token_accuracy": 0.8128025718033314, "num_tokens": 593542322.0, "step": 18596 }, { "entropy": 0.5832160264253616, "epoch": 1.711025238497766, "grad_norm": 0.15273034572601318, "learning_rate": 4.296930107032233e-05, "loss": 0.5721, "mean_token_accuracy": 0.8198876865208149, "num_tokens": 593574122.0, "step": 18597 }, { "entropy": 0.5637242272496223, "epoch": 1.7111172448692074, "grad_norm": 0.14748162031173706, "learning_rate": 4.2966234244180695e-05, "loss": 0.5567, "mean_token_accuracy": 0.8259805962443352, "num_tokens": 593606320.0, "step": 18598 }, { "entropy": 0.666810660623014, "epoch": 1.7112092512406485, "grad_norm": 0.16063693165779114, "learning_rate": 4.2963167418039076e-05, "loss": 0.6521, "mean_token_accuracy": 0.8008303232491016, "num_tokens": 593638379.0, "step": 18599 }, { "entropy": 0.596760205924511, "epoch": 1.7113012576120896, "grad_norm": 0.14878243207931519, "learning_rate": 4.2960100591897444e-05, "loss": 0.5909, "mean_token_accuracy": 0.8193047717213631, "num_tokens": 593670276.0, "step": 18600 }, { "entropy": 0.562294140458107, "epoch": 1.7113932639835308, "grad_norm": 0.15063297748565674, "learning_rate": 4.295703376575582e-05, "loss": 0.5476, "mean_token_accuracy": 0.8325030505657196, "num_tokens": 593701462.0, "step": 18601 }, { "entropy": 0.6728185210376978, "epoch": 1.711485270354972, "grad_norm": 0.1588989943265915, "learning_rate": 4.295396693961419e-05, "loss": 0.6753, "mean_token_accuracy": 0.7972433753311634, "num_tokens": 593733182.0, "step": 18602 }, { "entropy": 0.6529406195040792, "epoch": 1.7115772767264135, "grad_norm": 0.15190042555332184, "learning_rate": 4.295090011347257e-05, "loss": 0.6521, "mean_token_accuracy": 0.8072912730276585, "num_tokens": 593765621.0, "step": 18603 }, { "entropy": 0.6220085043460131, "epoch": 1.7116692830978546, "grad_norm": 0.15609024465084076, "learning_rate": 4.294783328733094e-05, "loss": 0.6239, "mean_token_accuracy": 0.8052593804895878, "num_tokens": 593797482.0, "step": 18604 }, { "entropy": 0.5075786628294736, "epoch": 1.7117612894692957, "grad_norm": 0.14733818173408508, "learning_rate": 4.294476646118932e-05, "loss": 0.4984, "mean_token_accuracy": 0.8422782979905605, "num_tokens": 593829111.0, "step": 18605 }, { "entropy": 0.6895252270624042, "epoch": 1.7118532958407369, "grad_norm": 0.15700210630893707, "learning_rate": 4.294169963504769e-05, "loss": 0.6679, "mean_token_accuracy": 0.7902493998408318, "num_tokens": 593860978.0, "step": 18606 }, { "entropy": 0.6157594919204712, "epoch": 1.7119453022121782, "grad_norm": 0.16611996293067932, "learning_rate": 4.2938632808906066e-05, "loss": 0.5903, "mean_token_accuracy": 0.814691673964262, "num_tokens": 593891871.0, "step": 18607 }, { "entropy": 0.68453673645854, "epoch": 1.7120373085836196, "grad_norm": 0.16279520094394684, "learning_rate": 4.293556598276444e-05, "loss": 0.6804, "mean_token_accuracy": 0.7932364083826542, "num_tokens": 593923946.0, "step": 18608 }, { "entropy": 0.5814753184095025, "epoch": 1.7121293149550607, "grad_norm": 0.1506289541721344, "learning_rate": 4.2932499156622816e-05, "loss": 0.5743, "mean_token_accuracy": 0.822074081748724, "num_tokens": 593956095.0, "step": 18609 }, { "entropy": 0.5616172282025218, "epoch": 1.7122213213265018, "grad_norm": 0.14972500503063202, "learning_rate": 4.292943233048119e-05, "loss": 0.5481, "mean_token_accuracy": 0.832381084561348, "num_tokens": 593988275.0, "step": 18610 }, { "entropy": 0.570147093385458, "epoch": 1.712313327697943, "grad_norm": 0.15751641988754272, "learning_rate": 4.292636550433956e-05, "loss": 0.5616, "mean_token_accuracy": 0.8278515003621578, "num_tokens": 594020614.0, "step": 18611 }, { "entropy": 0.5935282539576292, "epoch": 1.7124053340693843, "grad_norm": 0.15189911425113678, "learning_rate": 4.292329867819794e-05, "loss": 0.5834, "mean_token_accuracy": 0.8229424469172955, "num_tokens": 594052298.0, "step": 18612 }, { "entropy": 0.5835447451099753, "epoch": 1.7124973404408257, "grad_norm": 0.15195365250110626, "learning_rate": 4.292023185205631e-05, "loss": 0.5761, "mean_token_accuracy": 0.8222760073840618, "num_tokens": 594084523.0, "step": 18613 }, { "entropy": 0.7331805238500237, "epoch": 1.7125893468122668, "grad_norm": 0.16579905152320862, "learning_rate": 4.291716502591468e-05, "loss": 0.7166, "mean_token_accuracy": 0.7795041352510452, "num_tokens": 594115623.0, "step": 18614 }, { "entropy": 0.5468313274905086, "epoch": 1.712681353183708, "grad_norm": 0.14878909289836884, "learning_rate": 4.291409819977306e-05, "loss": 0.5314, "mean_token_accuracy": 0.8350576981902122, "num_tokens": 594147600.0, "step": 18615 }, { "entropy": 0.7110353969037533, "epoch": 1.712773359555149, "grad_norm": 0.1619841605424881, "learning_rate": 4.291103137363143e-05, "loss": 0.7104, "mean_token_accuracy": 0.7852285355329514, "num_tokens": 594179142.0, "step": 18616 }, { "entropy": 0.61651511490345, "epoch": 1.7128653659265904, "grad_norm": 0.15254083275794983, "learning_rate": 4.2907964547489806e-05, "loss": 0.5939, "mean_token_accuracy": 0.8169547393918037, "num_tokens": 594210485.0, "step": 18617 }, { "entropy": 0.6919538602232933, "epoch": 1.7129573722980318, "grad_norm": 0.16229814291000366, "learning_rate": 4.290489772134818e-05, "loss": 0.6876, "mean_token_accuracy": 0.786827340722084, "num_tokens": 594241941.0, "step": 18618 }, { "entropy": 0.6709566805511713, "epoch": 1.713049378669473, "grad_norm": 0.1598464846611023, "learning_rate": 4.290183089520655e-05, "loss": 0.6487, "mean_token_accuracy": 0.8000471144914627, "num_tokens": 594272569.0, "step": 18619 }, { "entropy": 0.5408893255516887, "epoch": 1.713141385040914, "grad_norm": 0.15308158099651337, "learning_rate": 4.289876406906493e-05, "loss": 0.5356, "mean_token_accuracy": 0.8355008065700531, "num_tokens": 594305046.0, "step": 18620 }, { "entropy": 0.6683670114725828, "epoch": 1.7132333914123552, "grad_norm": 0.16318552196025848, "learning_rate": 4.28956972429233e-05, "loss": 0.6521, "mean_token_accuracy": 0.8008392192423344, "num_tokens": 594336831.0, "step": 18621 }, { "entropy": 0.46764848148450255, "epoch": 1.7133253977837966, "grad_norm": 0.15609854459762573, "learning_rate": 4.289263041678168e-05, "loss": 0.4468, "mean_token_accuracy": 0.8610377386212349, "num_tokens": 594368962.0, "step": 18622 }, { "entropy": 0.6295841059181839, "epoch": 1.713417404155238, "grad_norm": 0.1586647927761078, "learning_rate": 4.288956359064005e-05, "loss": 0.6056, "mean_token_accuracy": 0.8124643191695213, "num_tokens": 594400518.0, "step": 18623 }, { "entropy": 0.5500833373516798, "epoch": 1.713509410526679, "grad_norm": 0.14682820439338684, "learning_rate": 4.288649676449842e-05, "loss": 0.5274, "mean_token_accuracy": 0.8373046107590199, "num_tokens": 594432895.0, "step": 18624 }, { "entropy": 0.6413569077849388, "epoch": 1.7136014168981202, "grad_norm": 0.16072705388069153, "learning_rate": 4.2883429938356797e-05, "loss": 0.6139, "mean_token_accuracy": 0.8155490085482597, "num_tokens": 594464480.0, "step": 18625 }, { "entropy": 0.6710848454385996, "epoch": 1.7136934232695613, "grad_norm": 0.16332195699214935, "learning_rate": 4.288036311221517e-05, "loss": 0.6663, "mean_token_accuracy": 0.8010462671518326, "num_tokens": 594496453.0, "step": 18626 }, { "entropy": 0.5826425906270742, "epoch": 1.7137854296410027, "grad_norm": 0.14992521703243256, "learning_rate": 4.2877296286073546e-05, "loss": 0.5871, "mean_token_accuracy": 0.8200895600020885, "num_tokens": 594528682.0, "step": 18627 }, { "entropy": 0.6211324818432331, "epoch": 1.713877436012444, "grad_norm": 0.15361258387565613, "learning_rate": 4.287422945993192e-05, "loss": 0.6037, "mean_token_accuracy": 0.817153062671423, "num_tokens": 594560805.0, "step": 18628 }, { "entropy": 0.6321671027690172, "epoch": 1.7139694423838852, "grad_norm": 0.15566207468509674, "learning_rate": 4.287116263379029e-05, "loss": 0.6229, "mean_token_accuracy": 0.8080545626580715, "num_tokens": 594592340.0, "step": 18629 }, { "entropy": 0.5528152836486697, "epoch": 1.7140614487553263, "grad_norm": 0.1499110758304596, "learning_rate": 4.286809580764867e-05, "loss": 0.5536, "mean_token_accuracy": 0.8273102194070816, "num_tokens": 594624589.0, "step": 18630 }, { "entropy": 0.6087893852964044, "epoch": 1.7141534551267674, "grad_norm": 0.15170277655124664, "learning_rate": 4.286502898150704e-05, "loss": 0.5982, "mean_token_accuracy": 0.8183591514825821, "num_tokens": 594655824.0, "step": 18631 }, { "entropy": 0.587302245432511, "epoch": 1.7142454614982088, "grad_norm": 0.1605362743139267, "learning_rate": 4.286196215536541e-05, "loss": 0.5764, "mean_token_accuracy": 0.8215187527239323, "num_tokens": 594687884.0, "step": 18632 }, { "entropy": 0.537959910929203, "epoch": 1.7143374678696501, "grad_norm": 0.15043719112873077, "learning_rate": 4.285889532922379e-05, "loss": 0.5308, "mean_token_accuracy": 0.835751436650753, "num_tokens": 594720081.0, "step": 18633 }, { "entropy": 0.6116235014051199, "epoch": 1.7144294742410913, "grad_norm": 0.15955215692520142, "learning_rate": 4.285582850308216e-05, "loss": 0.5972, "mean_token_accuracy": 0.8211684934794903, "num_tokens": 594751942.0, "step": 18634 }, { "entropy": 0.7175960522145033, "epoch": 1.7145214806125324, "grad_norm": 0.16655300557613373, "learning_rate": 4.2852761676940536e-05, "loss": 0.7368, "mean_token_accuracy": 0.7800209634006023, "num_tokens": 594783868.0, "step": 18635 }, { "entropy": 0.606422659009695, "epoch": 1.7146134869839735, "grad_norm": 0.15336491167545319, "learning_rate": 4.284969485079891e-05, "loss": 0.5992, "mean_token_accuracy": 0.8157277181744576, "num_tokens": 594816083.0, "step": 18636 }, { "entropy": 0.6685738554224372, "epoch": 1.714705493355415, "grad_norm": 0.1609172374010086, "learning_rate": 4.284662802465728e-05, "loss": 0.6721, "mean_token_accuracy": 0.7927752137184143, "num_tokens": 594848175.0, "step": 18637 }, { "entropy": 0.6685944106429815, "epoch": 1.7147974997268562, "grad_norm": 0.16624344885349274, "learning_rate": 4.284356119851566e-05, "loss": 0.6515, "mean_token_accuracy": 0.8017987832427025, "num_tokens": 594880075.0, "step": 18638 }, { "entropy": 0.5971534131094813, "epoch": 1.7148895060982974, "grad_norm": 0.1487657129764557, "learning_rate": 4.2840494372374035e-05, "loss": 0.5845, "mean_token_accuracy": 0.8193048760294914, "num_tokens": 594911938.0, "step": 18639 }, { "entropy": 0.5805832715705037, "epoch": 1.7149815124697385, "grad_norm": 0.15105368196964264, "learning_rate": 4.28374275462324e-05, "loss": 0.5716, "mean_token_accuracy": 0.8234638199210167, "num_tokens": 594943426.0, "step": 18640 }, { "entropy": 0.6018551215529442, "epoch": 1.7150735188411796, "grad_norm": 0.15217280387878418, "learning_rate": 4.2834360720090784e-05, "loss": 0.579, "mean_token_accuracy": 0.818292673677206, "num_tokens": 594974938.0, "step": 18641 }, { "entropy": 0.6836679792031646, "epoch": 1.715165525212621, "grad_norm": 0.1605721116065979, "learning_rate": 4.283129389394915e-05, "loss": 0.6661, "mean_token_accuracy": 0.7966345958411694, "num_tokens": 595007187.0, "step": 18642 }, { "entropy": 0.5974672455340624, "epoch": 1.7152575315840624, "grad_norm": 0.16262133419513702, "learning_rate": 4.2828227067807533e-05, "loss": 0.5845, "mean_token_accuracy": 0.8212598040699959, "num_tokens": 595038366.0, "step": 18643 }, { "entropy": 0.6909939255565405, "epoch": 1.7153495379555035, "grad_norm": 0.16196103394031525, "learning_rate": 4.28251602416659e-05, "loss": 0.677, "mean_token_accuracy": 0.7926809377968311, "num_tokens": 595069835.0, "step": 18644 }, { "entropy": 0.5188715439289808, "epoch": 1.7154415443269446, "grad_norm": 0.14794078469276428, "learning_rate": 4.2822093415524276e-05, "loss": 0.5086, "mean_token_accuracy": 0.8420902639627457, "num_tokens": 595102301.0, "step": 18645 }, { "entropy": 0.6405024935957044, "epoch": 1.7155335506983858, "grad_norm": 0.15343928337097168, "learning_rate": 4.281902658938265e-05, "loss": 0.608, "mean_token_accuracy": 0.8167093768715858, "num_tokens": 595132997.0, "step": 18646 }, { "entropy": 0.501690368168056, "epoch": 1.7156255570698271, "grad_norm": 0.14215484261512756, "learning_rate": 4.2815959763241025e-05, "loss": 0.4903, "mean_token_accuracy": 0.8451055586338043, "num_tokens": 595165411.0, "step": 18647 }, { "entropy": 0.4829440275207162, "epoch": 1.7157175634412685, "grad_norm": 0.14246854186058044, "learning_rate": 4.28128929370994e-05, "loss": 0.4755, "mean_token_accuracy": 0.8537286631762981, "num_tokens": 595197853.0, "step": 18648 }, { "entropy": 0.6662945561110973, "epoch": 1.7158095698127096, "grad_norm": 0.16099239885807037, "learning_rate": 4.2809826110957775e-05, "loss": 0.6641, "mean_token_accuracy": 0.7974800728261471, "num_tokens": 595229980.0, "step": 18649 }, { "entropy": 0.6099058310501277, "epoch": 1.7159015761841507, "grad_norm": 0.15894447267055511, "learning_rate": 4.280675928481614e-05, "loss": 0.6111, "mean_token_accuracy": 0.8184676431119442, "num_tokens": 595261830.0, "step": 18650 }, { "entropy": 0.5588706042617559, "epoch": 1.7159935825555919, "grad_norm": 0.15712472796440125, "learning_rate": 4.2803692458674524e-05, "loss": 0.5395, "mean_token_accuracy": 0.8314060941338539, "num_tokens": 595293696.0, "step": 18651 }, { "entropy": 0.683025011792779, "epoch": 1.7160855889270332, "grad_norm": 0.15997976064682007, "learning_rate": 4.280062563253289e-05, "loss": 0.6872, "mean_token_accuracy": 0.7906922847032547, "num_tokens": 595326162.0, "step": 18652 }, { "entropy": 0.6947181578725576, "epoch": 1.7161775952984746, "grad_norm": 0.1613796502351761, "learning_rate": 4.2797558806391266e-05, "loss": 0.6891, "mean_token_accuracy": 0.7924043126404285, "num_tokens": 595357004.0, "step": 18653 }, { "entropy": 0.5700676357373595, "epoch": 1.7162696016699157, "grad_norm": 0.148630291223526, "learning_rate": 4.279449198024964e-05, "loss": 0.5702, "mean_token_accuracy": 0.8256397545337677, "num_tokens": 595388579.0, "step": 18654 }, { "entropy": 0.6656178552657366, "epoch": 1.7163616080413568, "grad_norm": 0.1622547209262848, "learning_rate": 4.2791425154108016e-05, "loss": 0.6654, "mean_token_accuracy": 0.8001205325126648, "num_tokens": 595419746.0, "step": 18655 }, { "entropy": 0.6174825886264443, "epoch": 1.716453614412798, "grad_norm": 0.15413378179073334, "learning_rate": 4.278835832796639e-05, "loss": 0.6082, "mean_token_accuracy": 0.8127110153436661, "num_tokens": 595451784.0, "step": 18656 }, { "entropy": 0.5718026841059327, "epoch": 1.7165456207842393, "grad_norm": 0.14940981566905975, "learning_rate": 4.2785291501824765e-05, "loss": 0.5622, "mean_token_accuracy": 0.8287006728351116, "num_tokens": 595483294.0, "step": 18657 }, { "entropy": 0.5723532382398844, "epoch": 1.7166376271556807, "grad_norm": 0.15458610653877258, "learning_rate": 4.278222467568313e-05, "loss": 0.562, "mean_token_accuracy": 0.8214116618037224, "num_tokens": 595514232.0, "step": 18658 }, { "entropy": 0.49709557369351387, "epoch": 1.7167296335271218, "grad_norm": 0.14761139452457428, "learning_rate": 4.2779157849541514e-05, "loss": 0.4866, "mean_token_accuracy": 0.8493692278862, "num_tokens": 595546988.0, "step": 18659 }, { "entropy": 0.5694780219346285, "epoch": 1.716821639898563, "grad_norm": 0.147380068898201, "learning_rate": 4.277609102339988e-05, "loss": 0.5547, "mean_token_accuracy": 0.8280248716473579, "num_tokens": 595579042.0, "step": 18660 }, { "entropy": 0.6194128915667534, "epoch": 1.716913646270004, "grad_norm": 0.1535666584968567, "learning_rate": 4.277302419725826e-05, "loss": 0.5982, "mean_token_accuracy": 0.8149301409721375, "num_tokens": 595610802.0, "step": 18661 }, { "entropy": 0.5508185001090169, "epoch": 1.7170056526414454, "grad_norm": 0.15540023148059845, "learning_rate": 4.276995737111663e-05, "loss": 0.5454, "mean_token_accuracy": 0.8313575424253941, "num_tokens": 595643212.0, "step": 18662 }, { "entropy": 0.6080079302191734, "epoch": 1.7170976590128868, "grad_norm": 0.14971823990345, "learning_rate": 4.2766890544975006e-05, "loss": 0.6026, "mean_token_accuracy": 0.8134148418903351, "num_tokens": 595675745.0, "step": 18663 }, { "entropy": 0.6094846557825804, "epoch": 1.717189665384328, "grad_norm": 0.15146668255329132, "learning_rate": 4.276382371883338e-05, "loss": 0.5954, "mean_token_accuracy": 0.820320438593626, "num_tokens": 595708339.0, "step": 18664 }, { "entropy": 0.674252447206527, "epoch": 1.717281671755769, "grad_norm": 0.16335538029670715, "learning_rate": 4.2760756892691755e-05, "loss": 0.6609, "mean_token_accuracy": 0.7977587506175041, "num_tokens": 595740735.0, "step": 18665 }, { "entropy": 0.6921152547001839, "epoch": 1.7173736781272102, "grad_norm": 0.15722788870334625, "learning_rate": 4.275769006655013e-05, "loss": 0.6817, "mean_token_accuracy": 0.793195515871048, "num_tokens": 595772998.0, "step": 18666 }, { "entropy": 0.6602446343749762, "epoch": 1.7174656844986516, "grad_norm": 0.15565544366836548, "learning_rate": 4.2754623240408505e-05, "loss": 0.6498, "mean_token_accuracy": 0.7975087910890579, "num_tokens": 595805182.0, "step": 18667 }, { "entropy": 0.6754110646434128, "epoch": 1.717557690870093, "grad_norm": 0.15900208055973053, "learning_rate": 4.275155641426687e-05, "loss": 0.6643, "mean_token_accuracy": 0.7953316867351532, "num_tokens": 595837204.0, "step": 18668 }, { "entropy": 0.59120699390769, "epoch": 1.717649697241534, "grad_norm": 0.16181035339832306, "learning_rate": 4.2748489588125254e-05, "loss": 0.569, "mean_token_accuracy": 0.8232941254973412, "num_tokens": 595869308.0, "step": 18669 }, { "entropy": 0.636240791529417, "epoch": 1.7177417036129752, "grad_norm": 0.15989570319652557, "learning_rate": 4.274542276198363e-05, "loss": 0.6224, "mean_token_accuracy": 0.8137090392410755, "num_tokens": 595901436.0, "step": 18670 }, { "entropy": 0.6276546004228294, "epoch": 1.7178337099844163, "grad_norm": 0.15501829981803894, "learning_rate": 4.2742355935841997e-05, "loss": 0.6259, "mean_token_accuracy": 0.8085947409272194, "num_tokens": 595934008.0, "step": 18671 }, { "entropy": 0.6944107040762901, "epoch": 1.7179257163558577, "grad_norm": 0.1676190197467804, "learning_rate": 4.273928910970038e-05, "loss": 0.69, "mean_token_accuracy": 0.7906716801226139, "num_tokens": 595965603.0, "step": 18672 }, { "entropy": 0.6287892977707088, "epoch": 1.718017722727299, "grad_norm": 0.15748797357082367, "learning_rate": 4.2736222283558746e-05, "loss": 0.6302, "mean_token_accuracy": 0.8080521449446678, "num_tokens": 595997687.0, "step": 18673 }, { "entropy": 0.5571961207315326, "epoch": 1.7181097290987402, "grad_norm": 0.14529171586036682, "learning_rate": 4.273315545741712e-05, "loss": 0.5578, "mean_token_accuracy": 0.8319132477045059, "num_tokens": 596029778.0, "step": 18674 }, { "entropy": 0.6466646594926715, "epoch": 1.7182017354701813, "grad_norm": 0.15844261646270752, "learning_rate": 4.2730088631275495e-05, "loss": 0.6254, "mean_token_accuracy": 0.8074357956647873, "num_tokens": 596060705.0, "step": 18675 }, { "entropy": 0.5728799626231194, "epoch": 1.7182937418416224, "grad_norm": 0.15702159702777863, "learning_rate": 4.272702180513387e-05, "loss": 0.5637, "mean_token_accuracy": 0.824549924582243, "num_tokens": 596091572.0, "step": 18676 }, { "entropy": 0.6132001150399446, "epoch": 1.7183857482130638, "grad_norm": 0.15710942447185516, "learning_rate": 4.2723954978992244e-05, "loss": 0.6039, "mean_token_accuracy": 0.8140703104436398, "num_tokens": 596123179.0, "step": 18677 }, { "entropy": 0.6213192781433463, "epoch": 1.7184777545845051, "grad_norm": 0.155583918094635, "learning_rate": 4.272088815285062e-05, "loss": 0.608, "mean_token_accuracy": 0.8151810839772224, "num_tokens": 596155472.0, "step": 18678 }, { "entropy": 0.6261079029645771, "epoch": 1.7185697609559463, "grad_norm": 0.15381696820259094, "learning_rate": 4.271782132670899e-05, "loss": 0.6112, "mean_token_accuracy": 0.813203439116478, "num_tokens": 596186947.0, "step": 18679 }, { "entropy": 0.6504339454695582, "epoch": 1.7186617673273874, "grad_norm": 0.16396348178386688, "learning_rate": 4.271475450056737e-05, "loss": 0.6513, "mean_token_accuracy": 0.8006839230656624, "num_tokens": 596219715.0, "step": 18680 }, { "entropy": 0.5987766664475203, "epoch": 1.7187537736988285, "grad_norm": 0.1576036810874939, "learning_rate": 4.2711687674425736e-05, "loss": 0.597, "mean_token_accuracy": 0.8170289061963558, "num_tokens": 596252173.0, "step": 18681 }, { "entropy": 0.5959054529666901, "epoch": 1.71884578007027, "grad_norm": 0.15041406452655792, "learning_rate": 4.270862084828412e-05, "loss": 0.5854, "mean_token_accuracy": 0.8174444995820522, "num_tokens": 596283926.0, "step": 18682 }, { "entropy": 0.6035791873000562, "epoch": 1.7189377864417112, "grad_norm": 0.16185343265533447, "learning_rate": 4.2705554022142485e-05, "loss": 0.5966, "mean_token_accuracy": 0.8171377889811993, "num_tokens": 596315813.0, "step": 18683 }, { "entropy": 0.6358019234612584, "epoch": 1.7190297928131524, "grad_norm": 0.1549578160047531, "learning_rate": 4.270248719600086e-05, "loss": 0.6288, "mean_token_accuracy": 0.8073740936815739, "num_tokens": 596347942.0, "step": 18684 }, { "entropy": 0.6220850721001625, "epoch": 1.7191217991845935, "grad_norm": 0.15170170366764069, "learning_rate": 4.2699420369859235e-05, "loss": 0.605, "mean_token_accuracy": 0.8104937300086021, "num_tokens": 596380053.0, "step": 18685 }, { "entropy": 0.5669726165942848, "epoch": 1.7192138055560346, "grad_norm": 0.15453410148620605, "learning_rate": 4.269635354371761e-05, "loss": 0.5445, "mean_token_accuracy": 0.829756636172533, "num_tokens": 596411631.0, "step": 18686 }, { "entropy": 0.6173996482975781, "epoch": 1.719305811927476, "grad_norm": 0.16165941953659058, "learning_rate": 4.2693286717575984e-05, "loss": 0.6087, "mean_token_accuracy": 0.814340453594923, "num_tokens": 596444038.0, "step": 18687 }, { "entropy": 0.7150531634688377, "epoch": 1.7193978182989174, "grad_norm": 0.16188156604766846, "learning_rate": 4.269021989143436e-05, "loss": 0.7014, "mean_token_accuracy": 0.7841871343553066, "num_tokens": 596475350.0, "step": 18688 }, { "entropy": 0.6886276043951511, "epoch": 1.7194898246703585, "grad_norm": 0.16041795909404755, "learning_rate": 4.2687153065292727e-05, "loss": 0.6883, "mean_token_accuracy": 0.7906437404453754, "num_tokens": 596506937.0, "step": 18689 }, { "entropy": 0.6031605498865247, "epoch": 1.7195818310417996, "grad_norm": 0.15770085155963898, "learning_rate": 4.268408623915111e-05, "loss": 0.6004, "mean_token_accuracy": 0.8175084143877029, "num_tokens": 596539138.0, "step": 18690 }, { "entropy": 0.6308001633733511, "epoch": 1.7196738374132408, "grad_norm": 0.15663954615592957, "learning_rate": 4.2681019413009476e-05, "loss": 0.6114, "mean_token_accuracy": 0.8096433319151402, "num_tokens": 596570959.0, "step": 18691 }, { "entropy": 0.7292324248701334, "epoch": 1.7197658437846821, "grad_norm": 0.169825941324234, "learning_rate": 4.267795258686785e-05, "loss": 0.7242, "mean_token_accuracy": 0.7836735025048256, "num_tokens": 596602632.0, "step": 18692 }, { "entropy": 0.614569615572691, "epoch": 1.7198578501561235, "grad_norm": 0.1573660522699356, "learning_rate": 4.2674885760726225e-05, "loss": 0.6003, "mean_token_accuracy": 0.8146829083561897, "num_tokens": 596634634.0, "step": 18693 }, { "entropy": 0.631322493776679, "epoch": 1.7199498565275646, "grad_norm": 0.15685708820819855, "learning_rate": 4.26718189345846e-05, "loss": 0.6178, "mean_token_accuracy": 0.813079085201025, "num_tokens": 596666933.0, "step": 18694 }, { "entropy": 0.6036824528127909, "epoch": 1.7200418628990057, "grad_norm": 0.152161106467247, "learning_rate": 4.2668752108442974e-05, "loss": 0.6067, "mean_token_accuracy": 0.8151000142097473, "num_tokens": 596698742.0, "step": 18695 }, { "entropy": 0.5698661007918417, "epoch": 1.7201338692704469, "grad_norm": 0.1624162346124649, "learning_rate": 4.266568528230135e-05, "loss": 0.5524, "mean_token_accuracy": 0.8303275071084499, "num_tokens": 596730713.0, "step": 18696 }, { "entropy": 0.6620407924056053, "epoch": 1.7202258756418882, "grad_norm": 0.1646869033575058, "learning_rate": 4.266261845615972e-05, "loss": 0.6508, "mean_token_accuracy": 0.8043395429849625, "num_tokens": 596763170.0, "step": 18697 }, { "entropy": 0.6176734436303377, "epoch": 1.7203178820133296, "grad_norm": 0.15773169696331024, "learning_rate": 4.26595516300181e-05, "loss": 0.6199, "mean_token_accuracy": 0.8107342720031738, "num_tokens": 596794832.0, "step": 18698 }, { "entropy": 0.6664251442998648, "epoch": 1.7204098883847707, "grad_norm": 0.15685078501701355, "learning_rate": 4.265648480387647e-05, "loss": 0.6634, "mean_token_accuracy": 0.7951051853597164, "num_tokens": 596826689.0, "step": 18699 }, { "entropy": 0.711011603474617, "epoch": 1.7205018947562118, "grad_norm": 0.165338933467865, "learning_rate": 4.265341797773484e-05, "loss": 0.7095, "mean_token_accuracy": 0.7856147848069668, "num_tokens": 596857974.0, "step": 18700 }, { "entropy": 0.7118798196315765, "epoch": 1.720593901127653, "grad_norm": 0.16702161729335785, "learning_rate": 4.265035115159322e-05, "loss": 0.7039, "mean_token_accuracy": 0.7851848155260086, "num_tokens": 596889723.0, "step": 18701 }, { "entropy": 0.5661494475789368, "epoch": 1.7206859074990943, "grad_norm": 0.15642192959785461, "learning_rate": 4.264728432545159e-05, "loss": 0.5645, "mean_token_accuracy": 0.8276655748486519, "num_tokens": 596922170.0, "step": 18702 }, { "entropy": 0.59000409161672, "epoch": 1.7207779138705357, "grad_norm": 0.16000910103321075, "learning_rate": 4.264421749930997e-05, "loss": 0.581, "mean_token_accuracy": 0.8202684335410595, "num_tokens": 596953406.0, "step": 18703 }, { "entropy": 0.4910478317178786, "epoch": 1.7208699202419768, "grad_norm": 0.1414054036140442, "learning_rate": 4.264115067316834e-05, "loss": 0.4614, "mean_token_accuracy": 0.854062981903553, "num_tokens": 596985182.0, "step": 18704 }, { "entropy": 0.49088639626279473, "epoch": 1.720961926613418, "grad_norm": 0.14936785399913788, "learning_rate": 4.2638083847026714e-05, "loss": 0.4755, "mean_token_accuracy": 0.850143875926733, "num_tokens": 597016562.0, "step": 18705 }, { "entropy": 0.6131110563874245, "epoch": 1.721053932984859, "grad_norm": 0.14996004104614258, "learning_rate": 4.263501702088509e-05, "loss": 0.6035, "mean_token_accuracy": 0.8123840354382992, "num_tokens": 597049018.0, "step": 18706 }, { "entropy": 0.5263089369982481, "epoch": 1.7211459393563004, "grad_norm": 0.14629362523555756, "learning_rate": 4.2631950194743463e-05, "loss": 0.5129, "mean_token_accuracy": 0.8434848301112652, "num_tokens": 597081250.0, "step": 18707 }, { "entropy": 0.615070603787899, "epoch": 1.7212379457277418, "grad_norm": 0.16337715089321136, "learning_rate": 4.262888336860184e-05, "loss": 0.5948, "mean_token_accuracy": 0.8175633363425732, "num_tokens": 597113067.0, "step": 18708 }, { "entropy": 0.6993865789845586, "epoch": 1.721329952099183, "grad_norm": 0.16392530500888824, "learning_rate": 4.262581654246021e-05, "loss": 0.686, "mean_token_accuracy": 0.7866712287068367, "num_tokens": 597144708.0, "step": 18709 }, { "entropy": 0.4690217664465308, "epoch": 1.721421958470624, "grad_norm": 0.1412772238254547, "learning_rate": 4.262274971631858e-05, "loss": 0.4665, "mean_token_accuracy": 0.8539780490100384, "num_tokens": 597176969.0, "step": 18710 }, { "entropy": 0.49257620982825756, "epoch": 1.7215139648420652, "grad_norm": 0.14427898824214935, "learning_rate": 4.261968289017696e-05, "loss": 0.4724, "mean_token_accuracy": 0.8518822826445103, "num_tokens": 597209217.0, "step": 18711 }, { "entropy": 0.7002028506249189, "epoch": 1.7216059712135066, "grad_norm": 0.1613532453775406, "learning_rate": 4.261661606403533e-05, "loss": 0.6934, "mean_token_accuracy": 0.791912630200386, "num_tokens": 597241533.0, "step": 18712 }, { "entropy": 0.624772546812892, "epoch": 1.721697977584948, "grad_norm": 0.15747645497322083, "learning_rate": 4.2613549237893705e-05, "loss": 0.6081, "mean_token_accuracy": 0.813452884554863, "num_tokens": 597273727.0, "step": 18713 }, { "entropy": 0.624244986101985, "epoch": 1.721789983956389, "grad_norm": 0.16179518401622772, "learning_rate": 4.261048241175208e-05, "loss": 0.6109, "mean_token_accuracy": 0.8125009387731552, "num_tokens": 597303909.0, "step": 18714 }, { "entropy": 0.6967216841876507, "epoch": 1.7218819903278302, "grad_norm": 0.16150091588497162, "learning_rate": 4.2607415585610454e-05, "loss": 0.6837, "mean_token_accuracy": 0.7919182516634464, "num_tokens": 597336077.0, "step": 18715 }, { "entropy": 0.6474388316273689, "epoch": 1.7219739966992713, "grad_norm": 0.16787803173065186, "learning_rate": 4.260434875946883e-05, "loss": 0.6495, "mean_token_accuracy": 0.8039448596537113, "num_tokens": 597367353.0, "step": 18716 }, { "entropy": 0.650826022028923, "epoch": 1.7220660030707127, "grad_norm": 0.1590779721736908, "learning_rate": 4.26012819333272e-05, "loss": 0.6419, "mean_token_accuracy": 0.8000667542219162, "num_tokens": 597399375.0, "step": 18717 }, { "entropy": 0.495645085349679, "epoch": 1.722158009442154, "grad_norm": 0.14875507354736328, "learning_rate": 4.259821510718557e-05, "loss": 0.4866, "mean_token_accuracy": 0.8497687205672264, "num_tokens": 597431580.0, "step": 18718 }, { "entropy": 0.5838420062791556, "epoch": 1.7222500158135952, "grad_norm": 0.16324028372764587, "learning_rate": 4.259514828104395e-05, "loss": 0.5801, "mean_token_accuracy": 0.8188368193805218, "num_tokens": 597463220.0, "step": 18719 }, { "entropy": 0.5132117597386241, "epoch": 1.7223420221850363, "grad_norm": 0.15814091265201569, "learning_rate": 4.259208145490232e-05, "loss": 0.5076, "mean_token_accuracy": 0.8407192565500736, "num_tokens": 597494109.0, "step": 18720 }, { "entropy": 0.6789046116173267, "epoch": 1.7224340285564774, "grad_norm": 0.16268327832221985, "learning_rate": 4.2589014628760695e-05, "loss": 0.6812, "mean_token_accuracy": 0.7956169210374355, "num_tokens": 597526019.0, "step": 18721 }, { "entropy": 0.7133170869201422, "epoch": 1.7225260349279188, "grad_norm": 0.16561196744441986, "learning_rate": 4.258594780261907e-05, "loss": 0.7228, "mean_token_accuracy": 0.7819140255451202, "num_tokens": 597558274.0, "step": 18722 }, { "entropy": 0.4181837602518499, "epoch": 1.7226180412993601, "grad_norm": 0.1374886929988861, "learning_rate": 4.2582880976477444e-05, "loss": 0.4046, "mean_token_accuracy": 0.8764131627976894, "num_tokens": 597590723.0, "step": 18723 }, { "entropy": 0.5985846053808928, "epoch": 1.7227100476708013, "grad_norm": 0.158891960978508, "learning_rate": 4.257981415033582e-05, "loss": 0.5809, "mean_token_accuracy": 0.8216747418045998, "num_tokens": 597622515.0, "step": 18724 }, { "entropy": 0.5627135913819075, "epoch": 1.7228020540422424, "grad_norm": 0.14694567024707794, "learning_rate": 4.2576747324194194e-05, "loss": 0.5499, "mean_token_accuracy": 0.8317748531699181, "num_tokens": 597654778.0, "step": 18725 }, { "entropy": 0.5326122101396322, "epoch": 1.7228940604136835, "grad_norm": 0.16076074540615082, "learning_rate": 4.257368049805257e-05, "loss": 0.5296, "mean_token_accuracy": 0.8386765196919441, "num_tokens": 597687208.0, "step": 18726 }, { "entropy": 0.5935116456821561, "epoch": 1.722986066785125, "grad_norm": 0.15175855159759521, "learning_rate": 4.257061367191094e-05, "loss": 0.5774, "mean_token_accuracy": 0.8250058926641941, "num_tokens": 597718994.0, "step": 18727 }, { "entropy": 0.575743816094473, "epoch": 1.7230780731565662, "grad_norm": 0.1446414291858673, "learning_rate": 4.256754684576931e-05, "loss": 0.5471, "mean_token_accuracy": 0.8286002315580845, "num_tokens": 597751595.0, "step": 18728 }, { "entropy": 0.6278365598991513, "epoch": 1.7231700795280074, "grad_norm": 0.15558558702468872, "learning_rate": 4.256448001962769e-05, "loss": 0.6292, "mean_token_accuracy": 0.8084704130887985, "num_tokens": 597783857.0, "step": 18729 }, { "entropy": 0.6372435628436506, "epoch": 1.7232620858994485, "grad_norm": 0.1581469178199768, "learning_rate": 4.256141319348607e-05, "loss": 0.6275, "mean_token_accuracy": 0.8081312030553818, "num_tokens": 597816010.0, "step": 18730 }, { "entropy": 0.5910394042730331, "epoch": 1.7233540922708896, "grad_norm": 0.15322600305080414, "learning_rate": 4.2558346367344435e-05, "loss": 0.5673, "mean_token_accuracy": 0.8249485641717911, "num_tokens": 597847975.0, "step": 18731 }, { "entropy": 0.6688684672117233, "epoch": 1.723446098642331, "grad_norm": 0.15576985478401184, "learning_rate": 4.2555279541202816e-05, "loss": 0.6569, "mean_token_accuracy": 0.7974669151008129, "num_tokens": 597880613.0, "step": 18732 }, { "entropy": 0.46648225747048855, "epoch": 1.7235381050137724, "grad_norm": 0.13949987292289734, "learning_rate": 4.2552212715061184e-05, "loss": 0.4483, "mean_token_accuracy": 0.8620974346995354, "num_tokens": 597913049.0, "step": 18733 }, { "entropy": 0.5572111615911126, "epoch": 1.7236301113852135, "grad_norm": 0.15273499488830566, "learning_rate": 4.254914588891956e-05, "loss": 0.5385, "mean_token_accuracy": 0.8354408778250217, "num_tokens": 597945369.0, "step": 18734 }, { "entropy": 0.6473877690732479, "epoch": 1.7237221177566546, "grad_norm": 0.162742480635643, "learning_rate": 4.254607906277793e-05, "loss": 0.6446, "mean_token_accuracy": 0.8082365840673447, "num_tokens": 597977048.0, "step": 18735 }, { "entropy": 0.5464080623351038, "epoch": 1.7238141241280958, "grad_norm": 0.1476314514875412, "learning_rate": 4.254301223663631e-05, "loss": 0.5345, "mean_token_accuracy": 0.8306864500045776, "num_tokens": 598008701.0, "step": 18736 }, { "entropy": 0.6263816431164742, "epoch": 1.7239061304995371, "grad_norm": 0.15517431497573853, "learning_rate": 4.253994541049468e-05, "loss": 0.6152, "mean_token_accuracy": 0.8169272020459175, "num_tokens": 598041469.0, "step": 18737 }, { "entropy": 0.594895962625742, "epoch": 1.7239981368709785, "grad_norm": 0.15397091209888458, "learning_rate": 4.253687858435306e-05, "loss": 0.5876, "mean_token_accuracy": 0.8178054988384247, "num_tokens": 598073500.0, "step": 18738 }, { "entropy": 0.6562718711793423, "epoch": 1.7240901432424196, "grad_norm": 0.15401093661785126, "learning_rate": 4.2533811758211425e-05, "loss": 0.6575, "mean_token_accuracy": 0.799934484064579, "num_tokens": 598105719.0, "step": 18739 }, { "entropy": 0.6309219091199338, "epoch": 1.7241821496138607, "grad_norm": 0.15146812796592712, "learning_rate": 4.2530744932069807e-05, "loss": 0.6137, "mean_token_accuracy": 0.810460738837719, "num_tokens": 598137831.0, "step": 18740 }, { "entropy": 0.5972519954666495, "epoch": 1.7242741559853019, "grad_norm": 0.1565370112657547, "learning_rate": 4.2527678105928174e-05, "loss": 0.5916, "mean_token_accuracy": 0.8168376870453358, "num_tokens": 598168826.0, "step": 18741 }, { "entropy": 0.6347688110545278, "epoch": 1.7243661623567432, "grad_norm": 0.15974849462509155, "learning_rate": 4.2524611279786556e-05, "loss": 0.6394, "mean_token_accuracy": 0.8053505085408688, "num_tokens": 598199776.0, "step": 18742 }, { "entropy": 0.6417576093226671, "epoch": 1.7244581687281846, "grad_norm": 0.1535370945930481, "learning_rate": 4.2521544453644924e-05, "loss": 0.6292, "mean_token_accuracy": 0.8074252381920815, "num_tokens": 598232192.0, "step": 18743 }, { "entropy": 0.5634278343059123, "epoch": 1.7245501750996257, "grad_norm": 0.1406482309103012, "learning_rate": 4.25184776275033e-05, "loss": 0.549, "mean_token_accuracy": 0.8299289755523205, "num_tokens": 598264451.0, "step": 18744 }, { "entropy": 0.6123904511332512, "epoch": 1.7246421814710668, "grad_norm": 0.16151271760463715, "learning_rate": 4.251541080136167e-05, "loss": 0.6081, "mean_token_accuracy": 0.8128625191748142, "num_tokens": 598296931.0, "step": 18745 }, { "entropy": 0.6412615654990077, "epoch": 1.724734187842508, "grad_norm": 0.1558612883090973, "learning_rate": 4.251234397522005e-05, "loss": 0.6443, "mean_token_accuracy": 0.8058784939348698, "num_tokens": 598329018.0, "step": 18746 }, { "entropy": 0.7409670874476433, "epoch": 1.7248261942139493, "grad_norm": 0.16784979403018951, "learning_rate": 4.250927714907842e-05, "loss": 0.7358, "mean_token_accuracy": 0.7795825228095055, "num_tokens": 598360473.0, "step": 18747 }, { "entropy": 0.6342871226370335, "epoch": 1.7249182005853907, "grad_norm": 0.15103591978549957, "learning_rate": 4.25062103229368e-05, "loss": 0.6249, "mean_token_accuracy": 0.8091719597578049, "num_tokens": 598393241.0, "step": 18748 }, { "entropy": 0.657616812735796, "epoch": 1.7250102069568318, "grad_norm": 0.16119785606861115, "learning_rate": 4.2503143496795165e-05, "loss": 0.6398, "mean_token_accuracy": 0.8063726462423801, "num_tokens": 598425366.0, "step": 18749 }, { "entropy": 0.6470424719154835, "epoch": 1.725102213328273, "grad_norm": 0.15436339378356934, "learning_rate": 4.2500076670653546e-05, "loss": 0.64, "mean_token_accuracy": 0.8073941431939602, "num_tokens": 598457946.0, "step": 18750 }, { "entropy": 0.6543567646294832, "epoch": 1.725194219699714, "grad_norm": 0.1587587147951126, "learning_rate": 4.2497009844511914e-05, "loss": 0.6381, "mean_token_accuracy": 0.8027055338025093, "num_tokens": 598489925.0, "step": 18751 }, { "entropy": 0.6821699580177665, "epoch": 1.7252862260711554, "grad_norm": 0.1601942479610443, "learning_rate": 4.249394301837029e-05, "loss": 0.672, "mean_token_accuracy": 0.7943791747093201, "num_tokens": 598522216.0, "step": 18752 }, { "entropy": 0.7177654129918665, "epoch": 1.7253782324425968, "grad_norm": 0.15927040576934814, "learning_rate": 4.2490876192228663e-05, "loss": 0.7127, "mean_token_accuracy": 0.7837658897042274, "num_tokens": 598554899.0, "step": 18753 }, { "entropy": 0.6901990734040737, "epoch": 1.725470238814038, "grad_norm": 0.16157905757427216, "learning_rate": 4.248780936608704e-05, "loss": 0.6801, "mean_token_accuracy": 0.7909192144870758, "num_tokens": 598586770.0, "step": 18754 }, { "entropy": 0.5529921911656857, "epoch": 1.725562245185479, "grad_norm": 0.15242141485214233, "learning_rate": 4.248474253994541e-05, "loss": 0.5529, "mean_token_accuracy": 0.8297051675617695, "num_tokens": 598618755.0, "step": 18755 }, { "entropy": 0.6692357277497649, "epoch": 1.7256542515569202, "grad_norm": 0.1602068990468979, "learning_rate": 4.248167571380379e-05, "loss": 0.6649, "mean_token_accuracy": 0.7971430271863937, "num_tokens": 598650669.0, "step": 18756 }, { "entropy": 0.5985615812242031, "epoch": 1.7257462579283616, "grad_norm": 0.160661980509758, "learning_rate": 4.2478608887662155e-05, "loss": 0.5745, "mean_token_accuracy": 0.8214727565646172, "num_tokens": 598682614.0, "step": 18757 }, { "entropy": 0.54968227352947, "epoch": 1.725838264299803, "grad_norm": 0.15941452980041504, "learning_rate": 4.247554206152054e-05, "loss": 0.5403, "mean_token_accuracy": 0.8318698853254318, "num_tokens": 598714065.0, "step": 18758 }, { "entropy": 0.5473819710314274, "epoch": 1.725930270671244, "grad_norm": 0.15845274925231934, "learning_rate": 4.2472475235378905e-05, "loss": 0.5289, "mean_token_accuracy": 0.8392169997096062, "num_tokens": 598746790.0, "step": 18759 }, { "entropy": 0.5581188881769776, "epoch": 1.7260222770426852, "grad_norm": 0.15249744057655334, "learning_rate": 4.246940840923728e-05, "loss": 0.5499, "mean_token_accuracy": 0.828160535544157, "num_tokens": 598778376.0, "step": 18760 }, { "entropy": 0.6558958664536476, "epoch": 1.7261142834141263, "grad_norm": 0.15948475897312164, "learning_rate": 4.246634158309566e-05, "loss": 0.6495, "mean_token_accuracy": 0.8012000732123852, "num_tokens": 598810833.0, "step": 18761 }, { "entropy": 0.6048575583845377, "epoch": 1.7262062897855677, "grad_norm": 0.14889660477638245, "learning_rate": 4.246327475695403e-05, "loss": 0.5872, "mean_token_accuracy": 0.8191363997757435, "num_tokens": 598843049.0, "step": 18762 }, { "entropy": 0.4974434822797775, "epoch": 1.726298296157009, "grad_norm": 0.14991061389446259, "learning_rate": 4.246020793081241e-05, "loss": 0.4994, "mean_token_accuracy": 0.84335857629776, "num_tokens": 598874595.0, "step": 18763 }, { "entropy": 0.6949564013630152, "epoch": 1.7263903025284502, "grad_norm": 0.1624458283185959, "learning_rate": 4.245714110467078e-05, "loss": 0.687, "mean_token_accuracy": 0.7918921299278736, "num_tokens": 598906033.0, "step": 18764 }, { "entropy": 0.5929019497707486, "epoch": 1.7264823088998913, "grad_norm": 0.1479976326227188, "learning_rate": 4.245407427852915e-05, "loss": 0.5904, "mean_token_accuracy": 0.8197917826473713, "num_tokens": 598938739.0, "step": 18765 }, { "entropy": 0.5651146108284593, "epoch": 1.7265743152713324, "grad_norm": 0.1504720002412796, "learning_rate": 4.245100745238753e-05, "loss": 0.5586, "mean_token_accuracy": 0.8283776082098484, "num_tokens": 598970817.0, "step": 18766 }, { "entropy": 0.5779312485828996, "epoch": 1.7266663216427738, "grad_norm": 0.14650224149227142, "learning_rate": 4.24479406262459e-05, "loss": 0.5585, "mean_token_accuracy": 0.8270390368998051, "num_tokens": 599002599.0, "step": 18767 }, { "entropy": 0.5601243739947677, "epoch": 1.7267583280142151, "grad_norm": 0.14976902306079865, "learning_rate": 4.2444873800104276e-05, "loss": 0.5336, "mean_token_accuracy": 0.8320377059280872, "num_tokens": 599033663.0, "step": 18768 }, { "entropy": 0.679733463563025, "epoch": 1.7268503343856563, "grad_norm": 0.16414335370063782, "learning_rate": 4.244180697396265e-05, "loss": 0.6689, "mean_token_accuracy": 0.7925274595618248, "num_tokens": 599065463.0, "step": 18769 }, { "entropy": 0.5479773096740246, "epoch": 1.7269423407570974, "grad_norm": 0.14677606523036957, "learning_rate": 4.243874014782102e-05, "loss": 0.5455, "mean_token_accuracy": 0.8349798433482647, "num_tokens": 599098003.0, "step": 18770 }, { "entropy": 0.693467739969492, "epoch": 1.7270343471285385, "grad_norm": 0.15963691473007202, "learning_rate": 4.24356733216794e-05, "loss": 0.6851, "mean_token_accuracy": 0.7899991013109684, "num_tokens": 599130037.0, "step": 18771 }, { "entropy": 0.6616175044327974, "epoch": 1.72712635349998, "grad_norm": 0.16159631311893463, "learning_rate": 4.243260649553777e-05, "loss": 0.6512, "mean_token_accuracy": 0.8013336099684238, "num_tokens": 599162258.0, "step": 18772 }, { "entropy": 0.615893267095089, "epoch": 1.7272183598714212, "grad_norm": 0.15686753392219543, "learning_rate": 4.242953966939614e-05, "loss": 0.6038, "mean_token_accuracy": 0.8189969919621944, "num_tokens": 599194273.0, "step": 18773 }, { "entropy": 0.6651415126398206, "epoch": 1.7273103662428624, "grad_norm": 0.16077570617198944, "learning_rate": 4.242647284325452e-05, "loss": 0.6501, "mean_token_accuracy": 0.7995653636753559, "num_tokens": 599225670.0, "step": 18774 }, { "entropy": 0.6271183360368013, "epoch": 1.7274023726143035, "grad_norm": 0.1598881036043167, "learning_rate": 4.242340601711289e-05, "loss": 0.6051, "mean_token_accuracy": 0.8154629208147526, "num_tokens": 599257307.0, "step": 18775 }, { "entropy": 0.6080810585990548, "epoch": 1.7274943789857446, "grad_norm": 0.15997864305973053, "learning_rate": 4.242033919097127e-05, "loss": 0.5981, "mean_token_accuracy": 0.8169115148484707, "num_tokens": 599289521.0, "step": 18776 }, { "entropy": 0.5952079957351089, "epoch": 1.727586385357186, "grad_norm": 0.15387499332427979, "learning_rate": 4.241727236482964e-05, "loss": 0.5988, "mean_token_accuracy": 0.818506695330143, "num_tokens": 599321993.0, "step": 18777 }, { "entropy": 0.623122988268733, "epoch": 1.7276783917286274, "grad_norm": 0.156886026263237, "learning_rate": 4.241420553868801e-05, "loss": 0.6141, "mean_token_accuracy": 0.8131698742508888, "num_tokens": 599353736.0, "step": 18778 }, { "entropy": 0.6794359320774674, "epoch": 1.7277703981000685, "grad_norm": 0.15802282094955444, "learning_rate": 4.241113871254639e-05, "loss": 0.6639, "mean_token_accuracy": 0.7988394759595394, "num_tokens": 599385649.0, "step": 18779 }, { "entropy": 0.6694005150347948, "epoch": 1.7278624044715096, "grad_norm": 0.15857116878032684, "learning_rate": 4.240807188640476e-05, "loss": 0.6578, "mean_token_accuracy": 0.8001030944287777, "num_tokens": 599417712.0, "step": 18780 }, { "entropy": 0.661597391590476, "epoch": 1.7279544108429508, "grad_norm": 0.1574275940656662, "learning_rate": 4.240500506026313e-05, "loss": 0.6411, "mean_token_accuracy": 0.8063443228602409, "num_tokens": 599450126.0, "step": 18781 }, { "entropy": 0.5822187438607216, "epoch": 1.7280464172143921, "grad_norm": 0.1536860316991806, "learning_rate": 4.240193823412151e-05, "loss": 0.5609, "mean_token_accuracy": 0.8262606933712959, "num_tokens": 599482215.0, "step": 18782 }, { "entropy": 0.5817486559972167, "epoch": 1.7281384235858335, "grad_norm": 0.1586386114358902, "learning_rate": 4.239887140797988e-05, "loss": 0.574, "mean_token_accuracy": 0.8223308026790619, "num_tokens": 599513764.0, "step": 18783 }, { "entropy": 0.6221984601579607, "epoch": 1.7282304299572746, "grad_norm": 0.1550411880016327, "learning_rate": 4.239580458183826e-05, "loss": 0.6109, "mean_token_accuracy": 0.811048973351717, "num_tokens": 599545895.0, "step": 18784 }, { "entropy": 0.6015756474807858, "epoch": 1.7283224363287157, "grad_norm": 0.15273797512054443, "learning_rate": 4.239273775569663e-05, "loss": 0.5721, "mean_token_accuracy": 0.8226415403187275, "num_tokens": 599577714.0, "step": 18785 }, { "entropy": 0.7537926509976387, "epoch": 1.7284144427001569, "grad_norm": 0.17365260422229767, "learning_rate": 4.2389670929555006e-05, "loss": 0.7476, "mean_token_accuracy": 0.7722075991332531, "num_tokens": 599608379.0, "step": 18786 }, { "entropy": 0.6269450727850199, "epoch": 1.7285064490715982, "grad_norm": 0.16070181131362915, "learning_rate": 4.238660410341338e-05, "loss": 0.6181, "mean_token_accuracy": 0.8083692416548729, "num_tokens": 599640333.0, "step": 18787 }, { "entropy": 0.5047663524746895, "epoch": 1.7285984554430396, "grad_norm": 0.14568640291690826, "learning_rate": 4.238353727727175e-05, "loss": 0.4924, "mean_token_accuracy": 0.8529488481581211, "num_tokens": 599672424.0, "step": 18788 }, { "entropy": 0.6349676502868533, "epoch": 1.7286904618144807, "grad_norm": 0.1591658890247345, "learning_rate": 4.238047045113013e-05, "loss": 0.6181, "mean_token_accuracy": 0.8076958768069744, "num_tokens": 599704047.0, "step": 18789 }, { "entropy": 0.5822779834270477, "epoch": 1.7287824681859219, "grad_norm": 0.15315236151218414, "learning_rate": 4.23774036249885e-05, "loss": 0.5726, "mean_token_accuracy": 0.8232446350157261, "num_tokens": 599736318.0, "step": 18790 }, { "entropy": 0.582124033709988, "epoch": 1.728874474557363, "grad_norm": 0.1508396565914154, "learning_rate": 4.237433679884687e-05, "loss": 0.5698, "mean_token_accuracy": 0.8197614476084709, "num_tokens": 599768026.0, "step": 18791 }, { "entropy": 0.6367468531243503, "epoch": 1.7289664809288043, "grad_norm": 0.1558639258146286, "learning_rate": 4.2371269972705254e-05, "loss": 0.6416, "mean_token_accuracy": 0.8034106567502022, "num_tokens": 599800042.0, "step": 18792 }, { "entropy": 0.6351031251251698, "epoch": 1.7290584873002457, "grad_norm": 0.15734784305095673, "learning_rate": 4.236820314656362e-05, "loss": 0.6261, "mean_token_accuracy": 0.8129230849444866, "num_tokens": 599832213.0, "step": 18793 }, { "entropy": 0.5960308983922005, "epoch": 1.7291504936716868, "grad_norm": 0.15157945454120636, "learning_rate": 4.2365136320422e-05, "loss": 0.5939, "mean_token_accuracy": 0.818046797066927, "num_tokens": 599864366.0, "step": 18794 }, { "entropy": 0.5812858939170837, "epoch": 1.729242500043128, "grad_norm": 0.15876588225364685, "learning_rate": 4.236206949428037e-05, "loss": 0.5686, "mean_token_accuracy": 0.8247823491692543, "num_tokens": 599895873.0, "step": 18795 }, { "entropy": 0.5533134769648314, "epoch": 1.729334506414569, "grad_norm": 0.15641437470912933, "learning_rate": 4.2359002668138746e-05, "loss": 0.5446, "mean_token_accuracy": 0.8307269476354122, "num_tokens": 599927431.0, "step": 18796 }, { "entropy": 0.6334799565374851, "epoch": 1.7294265127860105, "grad_norm": 0.16206558048725128, "learning_rate": 4.235593584199712e-05, "loss": 0.6178, "mean_token_accuracy": 0.8121458478271961, "num_tokens": 599958718.0, "step": 18797 }, { "entropy": 0.6300189513713121, "epoch": 1.7295185191574518, "grad_norm": 0.1646416336297989, "learning_rate": 4.2352869015855495e-05, "loss": 0.62, "mean_token_accuracy": 0.8109044693410397, "num_tokens": 599990531.0, "step": 18798 }, { "entropy": 0.46968519128859043, "epoch": 1.729610525528893, "grad_norm": 0.14543063938617706, "learning_rate": 4.234980218971386e-05, "loss": 0.4512, "mean_token_accuracy": 0.8573682047426701, "num_tokens": 600022428.0, "step": 18799 }, { "entropy": 0.564839200116694, "epoch": 1.729702531900334, "grad_norm": 0.14778441190719604, "learning_rate": 4.2346735363572245e-05, "loss": 0.5485, "mean_token_accuracy": 0.832365520298481, "num_tokens": 600054417.0, "step": 18800 }, { "entropy": 0.515252117998898, "epoch": 1.7297945382717752, "grad_norm": 0.14351879060268402, "learning_rate": 4.234366853743061e-05, "loss": 0.4971, "mean_token_accuracy": 0.8489923141896725, "num_tokens": 600086826.0, "step": 18801 }, { "entropy": 0.5061147680971771, "epoch": 1.7298865446432166, "grad_norm": 0.1420290768146515, "learning_rate": 4.2340601711288994e-05, "loss": 0.4893, "mean_token_accuracy": 0.8514286018908024, "num_tokens": 600118800.0, "step": 18802 }, { "entropy": 0.6806196887046099, "epoch": 1.729978551014658, "grad_norm": 0.1607835441827774, "learning_rate": 4.233753488514736e-05, "loss": 0.6733, "mean_token_accuracy": 0.7955358028411865, "num_tokens": 600150113.0, "step": 18803 }, { "entropy": 0.6866794563829899, "epoch": 1.730070557386099, "grad_norm": 0.16148711740970612, "learning_rate": 4.2334468059005737e-05, "loss": 0.6766, "mean_token_accuracy": 0.7931140065193176, "num_tokens": 600181287.0, "step": 18804 }, { "entropy": 0.596106730401516, "epoch": 1.7301625637575402, "grad_norm": 0.15146811306476593, "learning_rate": 4.233140123286411e-05, "loss": 0.5888, "mean_token_accuracy": 0.8166471272706985, "num_tokens": 600212719.0, "step": 18805 }, { "entropy": 0.5693533215671778, "epoch": 1.7302545701289813, "grad_norm": 0.14708170294761658, "learning_rate": 4.2328334406722486e-05, "loss": 0.5648, "mean_token_accuracy": 0.8235963061451912, "num_tokens": 600245018.0, "step": 18806 }, { "entropy": 0.47382653784006834, "epoch": 1.7303465765004227, "grad_norm": 0.13705091178417206, "learning_rate": 4.232526758058086e-05, "loss": 0.4619, "mean_token_accuracy": 0.8547112308442593, "num_tokens": 600277273.0, "step": 18807 }, { "entropy": 0.6951630841940641, "epoch": 1.730438582871864, "grad_norm": 0.1647549569606781, "learning_rate": 4.2322200754439235e-05, "loss": 0.702, "mean_token_accuracy": 0.7885302193462849, "num_tokens": 600309180.0, "step": 18808 }, { "entropy": 0.6380895767360926, "epoch": 1.7305305892433052, "grad_norm": 0.15875877439975739, "learning_rate": 4.23191339282976e-05, "loss": 0.6442, "mean_token_accuracy": 0.8053009733557701, "num_tokens": 600340807.0, "step": 18809 }, { "entropy": 0.5360943221021444, "epoch": 1.7306225956147463, "grad_norm": 0.14113643765449524, "learning_rate": 4.2316067102155984e-05, "loss": 0.5288, "mean_token_accuracy": 0.8359577693045139, "num_tokens": 600373231.0, "step": 18810 }, { "entropy": 0.6769628711044788, "epoch": 1.7307146019861874, "grad_norm": 0.16313698887825012, "learning_rate": 4.231300027601435e-05, "loss": 0.6818, "mean_token_accuracy": 0.7902455404400826, "num_tokens": 600404906.0, "step": 18811 }, { "entropy": 0.6063888259232044, "epoch": 1.7308066083576288, "grad_norm": 0.16020488739013672, "learning_rate": 4.230993344987273e-05, "loss": 0.6019, "mean_token_accuracy": 0.8160061724483967, "num_tokens": 600437240.0, "step": 18812 }, { "entropy": 0.5742949629202485, "epoch": 1.7308986147290701, "grad_norm": 0.15683917701244354, "learning_rate": 4.23068666237311e-05, "loss": 0.582, "mean_token_accuracy": 0.821500588208437, "num_tokens": 600468947.0, "step": 18813 }, { "entropy": 0.6194980833679438, "epoch": 1.7309906211005113, "grad_norm": 0.15883822739124298, "learning_rate": 4.2303799797589476e-05, "loss": 0.6062, "mean_token_accuracy": 0.8121887221932411, "num_tokens": 600499943.0, "step": 18814 }, { "entropy": 0.5960036450996995, "epoch": 1.7310826274719524, "grad_norm": 0.16421131789684296, "learning_rate": 4.230073297144785e-05, "loss": 0.5842, "mean_token_accuracy": 0.8200581669807434, "num_tokens": 600531164.0, "step": 18815 }, { "entropy": 0.513653053669259, "epoch": 1.7311746338433935, "grad_norm": 0.1518278270959854, "learning_rate": 4.2297666145306226e-05, "loss": 0.5002, "mean_token_accuracy": 0.8438251167535782, "num_tokens": 600562837.0, "step": 18816 }, { "entropy": 0.7738536037504673, "epoch": 1.731266640214835, "grad_norm": 0.16748926043510437, "learning_rate": 4.2294599319164593e-05, "loss": 0.7682, "mean_token_accuracy": 0.7657725140452385, "num_tokens": 600594683.0, "step": 18817 }, { "entropy": 0.5224501956254244, "epoch": 1.7313586465862763, "grad_norm": 0.1545124500989914, "learning_rate": 4.2291532493022975e-05, "loss": 0.5025, "mean_token_accuracy": 0.844904538244009, "num_tokens": 600625915.0, "step": 18818 }, { "entropy": 0.6562407519668341, "epoch": 1.7314506529577174, "grad_norm": 0.1539071798324585, "learning_rate": 4.228846566688134e-05, "loss": 0.6363, "mean_token_accuracy": 0.8058958724141121, "num_tokens": 600657265.0, "step": 18819 }, { "entropy": 0.6433726865798235, "epoch": 1.7315426593291585, "grad_norm": 0.152007594704628, "learning_rate": 4.228539884073972e-05, "loss": 0.6384, "mean_token_accuracy": 0.8056704364717007, "num_tokens": 600689928.0, "step": 18820 }, { "entropy": 0.7189935250207782, "epoch": 1.7316346657005997, "grad_norm": 0.1593324840068817, "learning_rate": 4.22823320145981e-05, "loss": 0.7049, "mean_token_accuracy": 0.7856765165925026, "num_tokens": 600722275.0, "step": 18821 }, { "entropy": 0.6335627362132072, "epoch": 1.731726672072041, "grad_norm": 0.16715285181999207, "learning_rate": 4.227926518845647e-05, "loss": 0.6199, "mean_token_accuracy": 0.811591625213623, "num_tokens": 600753228.0, "step": 18822 }, { "entropy": 0.5457864617928863, "epoch": 1.7318186784434824, "grad_norm": 0.1512870341539383, "learning_rate": 4.227619836231485e-05, "loss": 0.5344, "mean_token_accuracy": 0.8353350684046745, "num_tokens": 600784274.0, "step": 18823 }, { "entropy": 0.6725518237799406, "epoch": 1.7319106848149235, "grad_norm": 0.15734772384166718, "learning_rate": 4.2273131536173216e-05, "loss": 0.6509, "mean_token_accuracy": 0.7989542298018932, "num_tokens": 600815499.0, "step": 18824 }, { "entropy": 0.5770807689987123, "epoch": 1.7320026911863646, "grad_norm": 0.15240955352783203, "learning_rate": 4.227006471003159e-05, "loss": 0.5588, "mean_token_accuracy": 0.829025711864233, "num_tokens": 600848000.0, "step": 18825 }, { "entropy": 0.690018666908145, "epoch": 1.7320946975578058, "grad_norm": 0.15894228219985962, "learning_rate": 4.2266997883889965e-05, "loss": 0.678, "mean_token_accuracy": 0.7938508912920952, "num_tokens": 600880151.0, "step": 18826 }, { "entropy": 0.7294075936079025, "epoch": 1.7321867039292471, "grad_norm": 0.1637323945760727, "learning_rate": 4.226393105774834e-05, "loss": 0.7144, "mean_token_accuracy": 0.7831262908875942, "num_tokens": 600912209.0, "step": 18827 }, { "entropy": 0.591367750428617, "epoch": 1.7322787103006885, "grad_norm": 0.1463409662246704, "learning_rate": 4.2260864231606715e-05, "loss": 0.5771, "mean_token_accuracy": 0.8218822069466114, "num_tokens": 600944597.0, "step": 18828 }, { "entropy": 0.7060023061931133, "epoch": 1.7323707166721296, "grad_norm": 0.16159196197986603, "learning_rate": 4.225779740546509e-05, "loss": 0.7188, "mean_token_accuracy": 0.7856814973056316, "num_tokens": 600976391.0, "step": 18829 }, { "entropy": 0.5186847154982388, "epoch": 1.7324627230435707, "grad_norm": 0.152225062251091, "learning_rate": 4.225473057932346e-05, "loss": 0.5159, "mean_token_accuracy": 0.8386551253497601, "num_tokens": 601008569.0, "step": 18830 }, { "entropy": 0.6575809791684151, "epoch": 1.7325547294150119, "grad_norm": 0.15377332270145416, "learning_rate": 4.225166375318184e-05, "loss": 0.6446, "mean_token_accuracy": 0.8002496212720871, "num_tokens": 601040339.0, "step": 18831 }, { "entropy": 0.5754322931170464, "epoch": 1.7326467357864532, "grad_norm": 0.15795183181762695, "learning_rate": 4.2248596927040206e-05, "loss": 0.5664, "mean_token_accuracy": 0.8241823613643646, "num_tokens": 601072781.0, "step": 18832 }, { "entropy": 0.5287236217409372, "epoch": 1.7327387421578946, "grad_norm": 0.14449913799762726, "learning_rate": 4.224553010089858e-05, "loss": 0.5144, "mean_token_accuracy": 0.8428319282829762, "num_tokens": 601105182.0, "step": 18833 }, { "entropy": 0.6252371165901423, "epoch": 1.7328307485293357, "grad_norm": 0.15823695063591003, "learning_rate": 4.2242463274756956e-05, "loss": 0.6245, "mean_token_accuracy": 0.8111359626054764, "num_tokens": 601136800.0, "step": 18834 }, { "entropy": 0.5448673078790307, "epoch": 1.7329227549007769, "grad_norm": 0.1522957682609558, "learning_rate": 4.223939644861533e-05, "loss": 0.5408, "mean_token_accuracy": 0.8355144411325455, "num_tokens": 601169344.0, "step": 18835 }, { "entropy": 0.6158992163836956, "epoch": 1.733014761272218, "grad_norm": 0.1479862630367279, "learning_rate": 4.2236329622473705e-05, "loss": 0.601, "mean_token_accuracy": 0.8167539983987808, "num_tokens": 601201311.0, "step": 18836 }, { "entropy": 0.5963720791041851, "epoch": 1.7331067676436593, "grad_norm": 0.14986364543437958, "learning_rate": 4.223326279633208e-05, "loss": 0.5843, "mean_token_accuracy": 0.8171462714672089, "num_tokens": 601233171.0, "step": 18837 }, { "entropy": 0.6768324133008718, "epoch": 1.7331987740151007, "grad_norm": 0.1640443652868271, "learning_rate": 4.223019597019045e-05, "loss": 0.6796, "mean_token_accuracy": 0.7978736534714699, "num_tokens": 601264848.0, "step": 18838 }, { "entropy": 0.6192285679280758, "epoch": 1.7332907803865418, "grad_norm": 0.15402181446552277, "learning_rate": 4.222712914404883e-05, "loss": 0.6124, "mean_token_accuracy": 0.8155877962708473, "num_tokens": 601297312.0, "step": 18839 }, { "entropy": 0.5477281750645489, "epoch": 1.733382786757983, "grad_norm": 0.15337061882019043, "learning_rate": 4.22240623179072e-05, "loss": 0.5279, "mean_token_accuracy": 0.8343467004597187, "num_tokens": 601329427.0, "step": 18840 }, { "entropy": 0.600143427029252, "epoch": 1.733474793129424, "grad_norm": 0.14826035499572754, "learning_rate": 4.222099549176558e-05, "loss": 0.5687, "mean_token_accuracy": 0.8217121623456478, "num_tokens": 601361299.0, "step": 18841 }, { "entropy": 0.6249179681763053, "epoch": 1.7335667995008655, "grad_norm": 0.15571412444114685, "learning_rate": 4.2217928665623946e-05, "loss": 0.6143, "mean_token_accuracy": 0.8130206689238548, "num_tokens": 601393223.0, "step": 18842 }, { "entropy": 0.5260046161711216, "epoch": 1.7336588058723068, "grad_norm": 0.15144580602645874, "learning_rate": 4.221486183948232e-05, "loss": 0.5145, "mean_token_accuracy": 0.8404380455613136, "num_tokens": 601425535.0, "step": 18843 }, { "entropy": 0.5398557111620903, "epoch": 1.733750812243748, "grad_norm": 0.15351174771785736, "learning_rate": 4.2211795013340695e-05, "loss": 0.5362, "mean_token_accuracy": 0.8372367955744267, "num_tokens": 601457313.0, "step": 18844 }, { "entropy": 0.5842023603618145, "epoch": 1.733842818615189, "grad_norm": 0.15692946314811707, "learning_rate": 4.220872818719907e-05, "loss": 0.5754, "mean_token_accuracy": 0.8262364007532597, "num_tokens": 601489557.0, "step": 18845 }, { "entropy": 0.6216004956513643, "epoch": 1.7339348249866302, "grad_norm": 0.16226781904697418, "learning_rate": 4.2205661361057445e-05, "loss": 0.6149, "mean_token_accuracy": 0.810600757598877, "num_tokens": 601521349.0, "step": 18846 }, { "entropy": 0.6085889972746372, "epoch": 1.7340268313580716, "grad_norm": 0.16301056742668152, "learning_rate": 4.220259453491582e-05, "loss": 0.5969, "mean_token_accuracy": 0.8190958648920059, "num_tokens": 601552687.0, "step": 18847 }, { "entropy": 0.6058426832314581, "epoch": 1.734118837729513, "grad_norm": 0.15172304213047028, "learning_rate": 4.219952770877419e-05, "loss": 0.6054, "mean_token_accuracy": 0.8181876577436924, "num_tokens": 601585035.0, "step": 18848 }, { "entropy": 0.5715881902724504, "epoch": 1.734210844100954, "grad_norm": 0.1610708087682724, "learning_rate": 4.219646088263257e-05, "loss": 0.5501, "mean_token_accuracy": 0.8271909281611443, "num_tokens": 601616306.0, "step": 18849 }, { "entropy": 0.7041213689371943, "epoch": 1.7343028504723952, "grad_norm": 0.15907356142997742, "learning_rate": 4.2193394056490936e-05, "loss": 0.6906, "mean_token_accuracy": 0.7874523140490055, "num_tokens": 601648710.0, "step": 18850 }, { "entropy": 0.6288966201245785, "epoch": 1.7343948568438363, "grad_norm": 0.1610017567873001, "learning_rate": 4.219032723034931e-05, "loss": 0.6147, "mean_token_accuracy": 0.8127221763134003, "num_tokens": 601679943.0, "step": 18851 }, { "entropy": 0.6250236150808632, "epoch": 1.7344868632152777, "grad_norm": 0.15652073919773102, "learning_rate": 4.218726040420769e-05, "loss": 0.6188, "mean_token_accuracy": 0.8115817271173, "num_tokens": 601711959.0, "step": 18852 }, { "entropy": 0.6316497900988907, "epoch": 1.734578869586719, "grad_norm": 0.16139435768127441, "learning_rate": 4.218419357806606e-05, "loss": 0.621, "mean_token_accuracy": 0.8117442391812801, "num_tokens": 601743630.0, "step": 18853 }, { "entropy": 0.5757109932601452, "epoch": 1.7346708759581602, "grad_norm": 0.1494656354188919, "learning_rate": 4.2181126751924435e-05, "loss": 0.5646, "mean_token_accuracy": 0.8244369216263294, "num_tokens": 601775386.0, "step": 18854 }, { "entropy": 0.5221302926074713, "epoch": 1.7347628823296013, "grad_norm": 0.15078341960906982, "learning_rate": 4.217805992578281e-05, "loss": 0.5082, "mean_token_accuracy": 0.8395588807761669, "num_tokens": 601806486.0, "step": 18855 }, { "entropy": 0.6509780958294868, "epoch": 1.7348548887010424, "grad_norm": 0.15953227877616882, "learning_rate": 4.2174993099641184e-05, "loss": 0.644, "mean_token_accuracy": 0.8000358827412128, "num_tokens": 601838202.0, "step": 18856 }, { "entropy": 0.5751794492825866, "epoch": 1.7349468950724838, "grad_norm": 0.15216852724552155, "learning_rate": 4.217192627349956e-05, "loss": 0.557, "mean_token_accuracy": 0.8292422331869602, "num_tokens": 601869596.0, "step": 18857 }, { "entropy": 0.571254150941968, "epoch": 1.7350389014439251, "grad_norm": 0.1560012400150299, "learning_rate": 4.2168859447357934e-05, "loss": 0.5504, "mean_token_accuracy": 0.828889399766922, "num_tokens": 601901051.0, "step": 18858 }, { "entropy": 0.6430804673582315, "epoch": 1.7351309078153663, "grad_norm": 0.15443967282772064, "learning_rate": 4.21657926212163e-05, "loss": 0.633, "mean_token_accuracy": 0.80467863753438, "num_tokens": 601933657.0, "step": 18859 }, { "entropy": 0.643119104206562, "epoch": 1.7352229141868074, "grad_norm": 0.1569230556488037, "learning_rate": 4.216272579507468e-05, "loss": 0.6227, "mean_token_accuracy": 0.810212142765522, "num_tokens": 601965241.0, "step": 18860 }, { "entropy": 0.5816749054938555, "epoch": 1.7353149205582485, "grad_norm": 0.15156017243862152, "learning_rate": 4.215965896893305e-05, "loss": 0.5835, "mean_token_accuracy": 0.8203502483665943, "num_tokens": 601995990.0, "step": 18861 }, { "entropy": 0.5258151907473803, "epoch": 1.73540692692969, "grad_norm": 0.14581863582134247, "learning_rate": 4.215659214279143e-05, "loss": 0.5122, "mean_token_accuracy": 0.8386580608785152, "num_tokens": 602027666.0, "step": 18862 }, { "entropy": 0.5250915782526135, "epoch": 1.7354989333011313, "grad_norm": 0.15249617397785187, "learning_rate": 4.21535253166498e-05, "loss": 0.5172, "mean_token_accuracy": 0.8470356576144695, "num_tokens": 602059752.0, "step": 18863 }, { "entropy": 0.5581158492714167, "epoch": 1.7355909396725724, "grad_norm": 0.1469288170337677, "learning_rate": 4.2150458490508175e-05, "loss": 0.5425, "mean_token_accuracy": 0.8314113020896912, "num_tokens": 602090976.0, "step": 18864 }, { "entropy": 0.5244380170479417, "epoch": 1.7356829460440135, "grad_norm": 0.1467086523771286, "learning_rate": 4.214739166436655e-05, "loss": 0.513, "mean_token_accuracy": 0.8363667167723179, "num_tokens": 602122681.0, "step": 18865 }, { "entropy": 0.599687248468399, "epoch": 1.7357749524154547, "grad_norm": 0.15224295854568481, "learning_rate": 4.2144324838224924e-05, "loss": 0.5868, "mean_token_accuracy": 0.8189199641346931, "num_tokens": 602154615.0, "step": 18866 }, { "entropy": 0.647417213767767, "epoch": 1.735866958786896, "grad_norm": 0.15864112973213196, "learning_rate": 4.21412580120833e-05, "loss": 0.6423, "mean_token_accuracy": 0.805709533393383, "num_tokens": 602187265.0, "step": 18867 }, { "entropy": 0.5534328040666878, "epoch": 1.7359589651583374, "grad_norm": 0.15043975412845612, "learning_rate": 4.213819118594167e-05, "loss": 0.5481, "mean_token_accuracy": 0.832963764667511, "num_tokens": 602219674.0, "step": 18868 }, { "entropy": 0.6590967606753111, "epoch": 1.7360509715297785, "grad_norm": 0.15713021159172058, "learning_rate": 4.213512435980004e-05, "loss": 0.6547, "mean_token_accuracy": 0.8013758286833763, "num_tokens": 602251597.0, "step": 18869 }, { "entropy": 0.6536568030714989, "epoch": 1.7361429779012196, "grad_norm": 0.1608688086271286, "learning_rate": 4.213205753365842e-05, "loss": 0.6485, "mean_token_accuracy": 0.7998201623558998, "num_tokens": 602283610.0, "step": 18870 }, { "entropy": 0.6331498119980097, "epoch": 1.7362349842726608, "grad_norm": 0.16176320612430573, "learning_rate": 4.212899070751679e-05, "loss": 0.6157, "mean_token_accuracy": 0.8120024725794792, "num_tokens": 602315272.0, "step": 18871 }, { "entropy": 0.6087036468088627, "epoch": 1.7363269906441021, "grad_norm": 0.15887761116027832, "learning_rate": 4.2125923881375165e-05, "loss": 0.5971, "mean_token_accuracy": 0.8147946372628212, "num_tokens": 602346719.0, "step": 18872 }, { "entropy": 0.6253848467022181, "epoch": 1.7364189970155435, "grad_norm": 0.165482759475708, "learning_rate": 4.212285705523354e-05, "loss": 0.642, "mean_token_accuracy": 0.8048324026167393, "num_tokens": 602378537.0, "step": 18873 }, { "entropy": 0.5817783484235406, "epoch": 1.7365110033869846, "grad_norm": 0.14789873361587524, "learning_rate": 4.2119790229091914e-05, "loss": 0.578, "mean_token_accuracy": 0.8202953860163689, "num_tokens": 602410907.0, "step": 18874 }, { "entropy": 0.6321502476930618, "epoch": 1.7366030097584257, "grad_norm": 0.1536732167005539, "learning_rate": 4.211672340295029e-05, "loss": 0.6132, "mean_token_accuracy": 0.8120230734348297, "num_tokens": 602443445.0, "step": 18875 }, { "entropy": 0.6257749013602734, "epoch": 1.7366950161298669, "grad_norm": 0.16017131507396698, "learning_rate": 4.2113656576808664e-05, "loss": 0.6034, "mean_token_accuracy": 0.8109328337013721, "num_tokens": 602474900.0, "step": 18876 }, { "entropy": 0.5569409187883139, "epoch": 1.7367870225013082, "grad_norm": 0.14630621671676636, "learning_rate": 4.211058975066703e-05, "loss": 0.552, "mean_token_accuracy": 0.8277061134576797, "num_tokens": 602506899.0, "step": 18877 }, { "entropy": 0.5006356341764331, "epoch": 1.7368790288727496, "grad_norm": 0.147138774394989, "learning_rate": 4.210752292452541e-05, "loss": 0.4982, "mean_token_accuracy": 0.8446715548634529, "num_tokens": 602538813.0, "step": 18878 }, { "entropy": 0.6310586091130972, "epoch": 1.7369710352441907, "grad_norm": 0.15487313270568848, "learning_rate": 4.210445609838378e-05, "loss": 0.6252, "mean_token_accuracy": 0.8094345517456532, "num_tokens": 602571072.0, "step": 18879 }, { "entropy": 0.5893867956474423, "epoch": 1.7370630416156319, "grad_norm": 0.15112337470054626, "learning_rate": 4.2101389272242156e-05, "loss": 0.578, "mean_token_accuracy": 0.8203949518501759, "num_tokens": 602602871.0, "step": 18880 }, { "entropy": 0.5963109717704356, "epoch": 1.737155047987073, "grad_norm": 0.15401121973991394, "learning_rate": 4.209832244610053e-05, "loss": 0.595, "mean_token_accuracy": 0.8198564536869526, "num_tokens": 602634387.0, "step": 18881 }, { "entropy": 0.602221891283989, "epoch": 1.7372470543585143, "grad_norm": 0.15127603709697723, "learning_rate": 4.2095255619958905e-05, "loss": 0.6034, "mean_token_accuracy": 0.8133271709084511, "num_tokens": 602666663.0, "step": 18882 }, { "entropy": 0.6946284677833319, "epoch": 1.7373390607299557, "grad_norm": 0.16235585510730743, "learning_rate": 4.2092188793817286e-05, "loss": 0.6906, "mean_token_accuracy": 0.7912711948156357, "num_tokens": 602698531.0, "step": 18883 }, { "entropy": 0.5961194280534983, "epoch": 1.7374310671013968, "grad_norm": 0.14784476161003113, "learning_rate": 4.2089121967675654e-05, "loss": 0.5881, "mean_token_accuracy": 0.8205495998263359, "num_tokens": 602730805.0, "step": 18884 }, { "entropy": 0.5996664594858885, "epoch": 1.737523073472838, "grad_norm": 0.1537388563156128, "learning_rate": 4.208605514153403e-05, "loss": 0.5906, "mean_token_accuracy": 0.8199531510472298, "num_tokens": 602763020.0, "step": 18885 }, { "entropy": 0.5744144814088941, "epoch": 1.737615079844279, "grad_norm": 0.14854629337787628, "learning_rate": 4.2082988315392403e-05, "loss": 0.5668, "mean_token_accuracy": 0.8273636139929295, "num_tokens": 602795528.0, "step": 18886 }, { "entropy": 0.7127011083066463, "epoch": 1.7377070862157205, "grad_norm": 0.16563060879707336, "learning_rate": 4.207992148925078e-05, "loss": 0.7041, "mean_token_accuracy": 0.7854208126664162, "num_tokens": 602825952.0, "step": 18887 }, { "entropy": 0.5925232050940394, "epoch": 1.7377990925871618, "grad_norm": 0.15045945346355438, "learning_rate": 4.207685466310915e-05, "loss": 0.5782, "mean_token_accuracy": 0.8210625611245632, "num_tokens": 602858141.0, "step": 18888 }, { "entropy": 0.6101887738332152, "epoch": 1.737891098958603, "grad_norm": 0.1640608012676239, "learning_rate": 4.207378783696753e-05, "loss": 0.5901, "mean_token_accuracy": 0.8210658840835094, "num_tokens": 602890611.0, "step": 18889 }, { "entropy": 0.5008365162648261, "epoch": 1.737983105330044, "grad_norm": 0.14313824474811554, "learning_rate": 4.2070721010825895e-05, "loss": 0.4839, "mean_token_accuracy": 0.8492686748504639, "num_tokens": 602922723.0, "step": 18890 }, { "entropy": 0.5712152421474457, "epoch": 1.7380751117014852, "grad_norm": 0.15606938302516937, "learning_rate": 4.206765418468428e-05, "loss": 0.5503, "mean_token_accuracy": 0.8290042467415333, "num_tokens": 602954773.0, "step": 18891 }, { "entropy": 0.6576368920505047, "epoch": 1.7381671180729266, "grad_norm": 0.15816627442836761, "learning_rate": 4.2064587358542645e-05, "loss": 0.6503, "mean_token_accuracy": 0.8011680468916893, "num_tokens": 602986425.0, "step": 18892 }, { "entropy": 0.4641693951562047, "epoch": 1.738259124444368, "grad_norm": 0.141921728849411, "learning_rate": 4.206152053240102e-05, "loss": 0.4459, "mean_token_accuracy": 0.859856054186821, "num_tokens": 603017466.0, "step": 18893 }, { "entropy": 0.5612538158893585, "epoch": 1.738351130815809, "grad_norm": 0.14839288592338562, "learning_rate": 4.2058453706259394e-05, "loss": 0.5423, "mean_token_accuracy": 0.8276170454919338, "num_tokens": 603049301.0, "step": 18894 }, { "entropy": 0.6064086891710758, "epoch": 1.7384431371872502, "grad_norm": 0.15560919046401978, "learning_rate": 4.205538688011777e-05, "loss": 0.6045, "mean_token_accuracy": 0.8128041103482246, "num_tokens": 603081137.0, "step": 18895 }, { "entropy": 0.5461269086226821, "epoch": 1.7385351435586913, "grad_norm": 0.15073098242282867, "learning_rate": 4.205232005397614e-05, "loss": 0.5321, "mean_token_accuracy": 0.8340305984020233, "num_tokens": 603113453.0, "step": 18896 }, { "entropy": 0.7081242576241493, "epoch": 1.7386271499301327, "grad_norm": 0.16369253396987915, "learning_rate": 4.204925322783452e-05, "loss": 0.7036, "mean_token_accuracy": 0.7852742373943329, "num_tokens": 603145028.0, "step": 18897 }, { "entropy": 0.609211590141058, "epoch": 1.738719156301574, "grad_norm": 0.15458989143371582, "learning_rate": 4.2046186401692886e-05, "loss": 0.593, "mean_token_accuracy": 0.8170433081686497, "num_tokens": 603176317.0, "step": 18898 }, { "entropy": 0.49538624472916126, "epoch": 1.7388111626730152, "grad_norm": 0.1530454009771347, "learning_rate": 4.204311957555127e-05, "loss": 0.5, "mean_token_accuracy": 0.846094224601984, "num_tokens": 603208047.0, "step": 18899 }, { "entropy": 0.6196106178686023, "epoch": 1.7389031690444563, "grad_norm": 0.15907855331897736, "learning_rate": 4.2040052749409635e-05, "loss": 0.6287, "mean_token_accuracy": 0.8115137405693531, "num_tokens": 603240430.0, "step": 18900 }, { "entropy": 0.6308850254863501, "epoch": 1.7389951754158974, "grad_norm": 0.1563754677772522, "learning_rate": 4.2036985923268016e-05, "loss": 0.6195, "mean_token_accuracy": 0.8042851686477661, "num_tokens": 603272652.0, "step": 18901 }, { "entropy": 0.6087502194568515, "epoch": 1.7390871817873388, "grad_norm": 0.15338096022605896, "learning_rate": 4.2033919097126384e-05, "loss": 0.6015, "mean_token_accuracy": 0.8163457401096821, "num_tokens": 603303621.0, "step": 18902 }, { "entropy": 0.7143909968435764, "epoch": 1.7391791881587801, "grad_norm": 0.1605740189552307, "learning_rate": 4.203085227098476e-05, "loss": 0.715, "mean_token_accuracy": 0.7846557460725307, "num_tokens": 603335437.0, "step": 18903 }, { "entropy": 0.5925226546823978, "epoch": 1.7392711945302213, "grad_norm": 0.1534019112586975, "learning_rate": 4.2027785444843134e-05, "loss": 0.5734, "mean_token_accuracy": 0.8206611536443233, "num_tokens": 603367180.0, "step": 18904 }, { "entropy": 0.5215223131235689, "epoch": 1.7393632009016624, "grad_norm": 0.14816054701805115, "learning_rate": 4.202471861870151e-05, "loss": 0.5121, "mean_token_accuracy": 0.8411221392452717, "num_tokens": 603399684.0, "step": 18905 }, { "entropy": 0.6887851785868406, "epoch": 1.7394552072731035, "grad_norm": 0.16171516478061676, "learning_rate": 4.202165179255988e-05, "loss": 0.6826, "mean_token_accuracy": 0.7913898266851902, "num_tokens": 603431541.0, "step": 18906 }, { "entropy": 0.6426271572709084, "epoch": 1.739547213644545, "grad_norm": 0.15506397187709808, "learning_rate": 4.201858496641826e-05, "loss": 0.6261, "mean_token_accuracy": 0.8085445687174797, "num_tokens": 603463332.0, "step": 18907 }, { "entropy": 0.6447505569085479, "epoch": 1.7396392200159863, "grad_norm": 0.16273276507854462, "learning_rate": 4.2015518140276625e-05, "loss": 0.6456, "mean_token_accuracy": 0.8026386983692646, "num_tokens": 603495876.0, "step": 18908 }, { "entropy": 0.669253334403038, "epoch": 1.7397312263874274, "grad_norm": 0.15868471562862396, "learning_rate": 4.201245131413501e-05, "loss": 0.6615, "mean_token_accuracy": 0.7984006777405739, "num_tokens": 603528177.0, "step": 18909 }, { "entropy": 0.6171634029597044, "epoch": 1.7398232327588685, "grad_norm": 0.1561916470527649, "learning_rate": 4.2009384487993375e-05, "loss": 0.5946, "mean_token_accuracy": 0.8156193122267723, "num_tokens": 603560245.0, "step": 18910 }, { "entropy": 0.6791915483772755, "epoch": 1.7399152391303097, "grad_norm": 0.1583314687013626, "learning_rate": 4.200631766185175e-05, "loss": 0.6717, "mean_token_accuracy": 0.7983976602554321, "num_tokens": 603592691.0, "step": 18911 }, { "entropy": 0.6724912356585264, "epoch": 1.740007245501751, "grad_norm": 0.15541060268878937, "learning_rate": 4.2003250835710124e-05, "loss": 0.6539, "mean_token_accuracy": 0.802518717944622, "num_tokens": 603623858.0, "step": 18912 }, { "entropy": 0.6329523157328367, "epoch": 1.7400992518731924, "grad_norm": 0.1528375893831253, "learning_rate": 4.20001840095685e-05, "loss": 0.6329, "mean_token_accuracy": 0.8077016547322273, "num_tokens": 603655870.0, "step": 18913 }, { "entropy": 0.6062539517879486, "epoch": 1.7401912582446335, "grad_norm": 0.15229398012161255, "learning_rate": 4.199711718342687e-05, "loss": 0.587, "mean_token_accuracy": 0.8167297840118408, "num_tokens": 603688211.0, "step": 18914 }, { "entropy": 0.6621478535234928, "epoch": 1.7402832646160746, "grad_norm": 0.15567171573638916, "learning_rate": 4.199405035728525e-05, "loss": 0.6589, "mean_token_accuracy": 0.7971150726079941, "num_tokens": 603720497.0, "step": 18915 }, { "entropy": 0.5712015656754375, "epoch": 1.7403752709875158, "grad_norm": 0.1504756361246109, "learning_rate": 4.199098353114362e-05, "loss": 0.5653, "mean_token_accuracy": 0.8273103013634682, "num_tokens": 603752831.0, "step": 18916 }, { "entropy": 0.5895668398588896, "epoch": 1.7404672773589571, "grad_norm": 0.15379905700683594, "learning_rate": 4.1987916705002e-05, "loss": 0.5699, "mean_token_accuracy": 0.8244770616292953, "num_tokens": 603785206.0, "step": 18917 }, { "entropy": 0.5740209054201841, "epoch": 1.7405592837303985, "grad_norm": 0.1564187854528427, "learning_rate": 4.198484987886037e-05, "loss": 0.5709, "mean_token_accuracy": 0.825866412371397, "num_tokens": 603817028.0, "step": 18918 }, { "entropy": 0.5276920644100755, "epoch": 1.7406512901018396, "grad_norm": 0.15401098132133484, "learning_rate": 4.198178305271874e-05, "loss": 0.5142, "mean_token_accuracy": 0.841917872428894, "num_tokens": 603848198.0, "step": 18919 }, { "entropy": 0.6282826503738761, "epoch": 1.7407432964732807, "grad_norm": 0.1544046700000763, "learning_rate": 4.197871622657712e-05, "loss": 0.6082, "mean_token_accuracy": 0.812689658254385, "num_tokens": 603880109.0, "step": 18920 }, { "entropy": 0.6120225246995687, "epoch": 1.7408353028447219, "grad_norm": 0.1548732966184616, "learning_rate": 4.197564940043549e-05, "loss": 0.6215, "mean_token_accuracy": 0.8086276985704899, "num_tokens": 603912572.0, "step": 18921 }, { "entropy": 0.5306780557148159, "epoch": 1.7409273092161632, "grad_norm": 0.1525736004114151, "learning_rate": 4.197258257429387e-05, "loss": 0.5289, "mean_token_accuracy": 0.8347797058522701, "num_tokens": 603944603.0, "step": 18922 }, { "entropy": 0.6339456830173731, "epoch": 1.7410193155876046, "grad_norm": 0.15526054799556732, "learning_rate": 4.196951574815224e-05, "loss": 0.6421, "mean_token_accuracy": 0.8039596788585186, "num_tokens": 603976385.0, "step": 18923 }, { "entropy": 0.7197327930480242, "epoch": 1.7411113219590457, "grad_norm": 0.16099011898040771, "learning_rate": 4.196644892201061e-05, "loss": 0.7054, "mean_token_accuracy": 0.7864749431610107, "num_tokens": 604008515.0, "step": 18924 }, { "entropy": 0.7163858329877257, "epoch": 1.7412033283304869, "grad_norm": 0.16648083925247192, "learning_rate": 4.196338209586899e-05, "loss": 0.6983, "mean_token_accuracy": 0.7877045050263405, "num_tokens": 604040031.0, "step": 18925 }, { "entropy": 0.5353901381604373, "epoch": 1.741295334701928, "grad_norm": 0.15741322934627533, "learning_rate": 4.196031526972736e-05, "loss": 0.5275, "mean_token_accuracy": 0.8410791791975498, "num_tokens": 604071907.0, "step": 18926 }, { "entropy": 0.6750953793525696, "epoch": 1.7413873410733693, "grad_norm": 0.161361962556839, "learning_rate": 4.195724844358574e-05, "loss": 0.6626, "mean_token_accuracy": 0.7992555797100067, "num_tokens": 604103036.0, "step": 18927 }, { "entropy": 0.6755589637905359, "epoch": 1.7414793474448107, "grad_norm": 0.16254237294197083, "learning_rate": 4.195418161744411e-05, "loss": 0.6535, "mean_token_accuracy": 0.8001275770366192, "num_tokens": 604135440.0, "step": 18928 }, { "entropy": 0.6965082548558712, "epoch": 1.7415713538162518, "grad_norm": 0.15700379014015198, "learning_rate": 4.195111479130248e-05, "loss": 0.6797, "mean_token_accuracy": 0.7927725128829479, "num_tokens": 604167292.0, "step": 18929 }, { "entropy": 0.5902611250057817, "epoch": 1.741663360187693, "grad_norm": 0.15976764261722565, "learning_rate": 4.194804796516086e-05, "loss": 0.5819, "mean_token_accuracy": 0.8223399482667446, "num_tokens": 604198832.0, "step": 18930 }, { "entropy": 0.5604426423087716, "epoch": 1.741755366559134, "grad_norm": 0.15224149823188782, "learning_rate": 4.194498113901923e-05, "loss": 0.5509, "mean_token_accuracy": 0.8281377851963043, "num_tokens": 604230765.0, "step": 18931 }, { "entropy": 0.591717672534287, "epoch": 1.7418473729305755, "grad_norm": 0.1504969447851181, "learning_rate": 4.19419143128776e-05, "loss": 0.5918, "mean_token_accuracy": 0.8162132985889912, "num_tokens": 604263353.0, "step": 18932 }, { "entropy": 0.5695671066641808, "epoch": 1.7419393793020168, "grad_norm": 0.14945626258850098, "learning_rate": 4.193884748673598e-05, "loss": 0.5595, "mean_token_accuracy": 0.8256500698626041, "num_tokens": 604295507.0, "step": 18933 }, { "entropy": 0.663484388962388, "epoch": 1.742031385673458, "grad_norm": 0.16288040578365326, "learning_rate": 4.193578066059435e-05, "loss": 0.6507, "mean_token_accuracy": 0.8026250004768372, "num_tokens": 604327096.0, "step": 18934 }, { "entropy": 0.6392512619495392, "epoch": 1.742123392044899, "grad_norm": 0.1641092747449875, "learning_rate": 4.193271383445273e-05, "loss": 0.6183, "mean_token_accuracy": 0.8089606203138828, "num_tokens": 604358298.0, "step": 18935 }, { "entropy": 0.6274412889033556, "epoch": 1.7422153984163402, "grad_norm": 0.15229634940624237, "learning_rate": 4.19296470083111e-05, "loss": 0.6132, "mean_token_accuracy": 0.8127674572169781, "num_tokens": 604390145.0, "step": 18936 }, { "entropy": 0.5380861759185791, "epoch": 1.7423074047877816, "grad_norm": 0.14959117770195007, "learning_rate": 4.192658018216947e-05, "loss": 0.5343, "mean_token_accuracy": 0.8331530839204788, "num_tokens": 604422616.0, "step": 18937 }, { "entropy": 0.6234356202185154, "epoch": 1.742399411159223, "grad_norm": 0.14894291758537292, "learning_rate": 4.192351335602785e-05, "loss": 0.6074, "mean_token_accuracy": 0.8118157275021076, "num_tokens": 604454948.0, "step": 18938 }, { "entropy": 0.6808871328830719, "epoch": 1.742491417530664, "grad_norm": 0.1601387858390808, "learning_rate": 4.192044652988622e-05, "loss": 0.6896, "mean_token_accuracy": 0.7918186411261559, "num_tokens": 604486960.0, "step": 18939 }, { "entropy": 0.6535183601081371, "epoch": 1.7425834239021052, "grad_norm": 0.1578759104013443, "learning_rate": 4.1917379703744594e-05, "loss": 0.6491, "mean_token_accuracy": 0.8007809743285179, "num_tokens": 604518524.0, "step": 18940 }, { "entropy": 0.5517001478001475, "epoch": 1.7426754302735463, "grad_norm": 0.15003737807273865, "learning_rate": 4.191431287760297e-05, "loss": 0.5343, "mean_token_accuracy": 0.8344559036195278, "num_tokens": 604549517.0, "step": 18941 }, { "entropy": 0.581650972366333, "epoch": 1.7427674366449877, "grad_norm": 0.15148989856243134, "learning_rate": 4.191124605146134e-05, "loss": 0.5672, "mean_token_accuracy": 0.8276172839105129, "num_tokens": 604581597.0, "step": 18942 }, { "entropy": 0.644284755922854, "epoch": 1.742859443016429, "grad_norm": 0.1540708988904953, "learning_rate": 4.1908179225319724e-05, "loss": 0.6477, "mean_token_accuracy": 0.8054324015974998, "num_tokens": 604613557.0, "step": 18943 }, { "entropy": 0.6026373477652669, "epoch": 1.7429514493878702, "grad_norm": 0.1572548747062683, "learning_rate": 4.190511239917809e-05, "loss": 0.5846, "mean_token_accuracy": 0.8147625289857388, "num_tokens": 604644359.0, "step": 18944 }, { "entropy": 0.5785134369507432, "epoch": 1.7430434557593113, "grad_norm": 0.1561329960823059, "learning_rate": 4.190204557303647e-05, "loss": 0.5746, "mean_token_accuracy": 0.8251364380121231, "num_tokens": 604675196.0, "step": 18945 }, { "entropy": 0.6166622741147876, "epoch": 1.7431354621307524, "grad_norm": 0.15410089492797852, "learning_rate": 4.189897874689484e-05, "loss": 0.614, "mean_token_accuracy": 0.8138334713876247, "num_tokens": 604706350.0, "step": 18946 }, { "entropy": 0.5866459757089615, "epoch": 1.7432274685021938, "grad_norm": 0.1540946662425995, "learning_rate": 4.1895911920753216e-05, "loss": 0.5757, "mean_token_accuracy": 0.8188332952558994, "num_tokens": 604737478.0, "step": 18947 }, { "entropy": 0.603767222724855, "epoch": 1.7433194748736351, "grad_norm": 0.15813425183296204, "learning_rate": 4.189284509461159e-05, "loss": 0.5972, "mean_token_accuracy": 0.8163457252085209, "num_tokens": 604769566.0, "step": 18948 }, { "entropy": 0.6269696624949574, "epoch": 1.7434114812450763, "grad_norm": 0.15795360505580902, "learning_rate": 4.1889778268469966e-05, "loss": 0.6118, "mean_token_accuracy": 0.8166306056082249, "num_tokens": 604801365.0, "step": 18949 }, { "entropy": 0.6080723945051432, "epoch": 1.7435034876165174, "grad_norm": 0.1571371704339981, "learning_rate": 4.1886711442328333e-05, "loss": 0.6033, "mean_token_accuracy": 0.8096595332026482, "num_tokens": 604833310.0, "step": 18950 }, { "entropy": 0.637987706810236, "epoch": 1.7435954939879585, "grad_norm": 0.1572650969028473, "learning_rate": 4.1883644616186715e-05, "loss": 0.6299, "mean_token_accuracy": 0.8054482415318489, "num_tokens": 604864915.0, "step": 18951 }, { "entropy": 0.6016921950504184, "epoch": 1.7436875003594, "grad_norm": 0.1545862853527069, "learning_rate": 4.188057779004508e-05, "loss": 0.5816, "mean_token_accuracy": 0.819539126008749, "num_tokens": 604896720.0, "step": 18952 }, { "entropy": 0.6674605347216129, "epoch": 1.7437795067308413, "grad_norm": 0.1585761159658432, "learning_rate": 4.187751096390346e-05, "loss": 0.6589, "mean_token_accuracy": 0.8027708120644093, "num_tokens": 604928488.0, "step": 18953 }, { "entropy": 0.48735043220221996, "epoch": 1.7438715131022824, "grad_norm": 0.14084532856941223, "learning_rate": 4.187444413776183e-05, "loss": 0.4802, "mean_token_accuracy": 0.8461776971817017, "num_tokens": 604960626.0, "step": 18954 }, { "entropy": 0.5935924891382456, "epoch": 1.7439635194737235, "grad_norm": 0.15700243413448334, "learning_rate": 4.187137731162021e-05, "loss": 0.5805, "mean_token_accuracy": 0.8198273330926895, "num_tokens": 604992958.0, "step": 18955 }, { "entropy": 0.6535293643828481, "epoch": 1.7440555258451647, "grad_norm": 0.1581263691186905, "learning_rate": 4.186831048547858e-05, "loss": 0.6386, "mean_token_accuracy": 0.8048110119998455, "num_tokens": 605024256.0, "step": 18956 }, { "entropy": 0.6159811234101653, "epoch": 1.744147532216606, "grad_norm": 0.15611188113689423, "learning_rate": 4.1865243659336956e-05, "loss": 0.6042, "mean_token_accuracy": 0.8169330470263958, "num_tokens": 605055494.0, "step": 18957 }, { "entropy": 0.5287050567567348, "epoch": 1.7442395385880474, "grad_norm": 0.1477816104888916, "learning_rate": 4.1862176833195324e-05, "loss": 0.5104, "mean_token_accuracy": 0.8377485573291779, "num_tokens": 605086997.0, "step": 18958 }, { "entropy": 0.6454189093783498, "epoch": 1.7443315449594885, "grad_norm": 0.1555437296628952, "learning_rate": 4.1859110007053705e-05, "loss": 0.6174, "mean_token_accuracy": 0.8076643869280815, "num_tokens": 605118306.0, "step": 18959 }, { "entropy": 0.6116811903193593, "epoch": 1.7444235513309296, "grad_norm": 0.1573735773563385, "learning_rate": 4.185604318091207e-05, "loss": 0.5937, "mean_token_accuracy": 0.8159789927303791, "num_tokens": 605150495.0, "step": 18960 }, { "entropy": 0.6028266255743802, "epoch": 1.7445155577023708, "grad_norm": 0.1509263813495636, "learning_rate": 4.1852976354770455e-05, "loss": 0.5899, "mean_token_accuracy": 0.8207990638911724, "num_tokens": 605182881.0, "step": 18961 }, { "entropy": 0.5606627967208624, "epoch": 1.7446075640738121, "grad_norm": 0.15049923956394196, "learning_rate": 4.184990952862882e-05, "loss": 0.5437, "mean_token_accuracy": 0.8325780853629112, "num_tokens": 605214758.0, "step": 18962 }, { "entropy": 0.5549530182033777, "epoch": 1.7446995704452535, "grad_norm": 0.14853809773921967, "learning_rate": 4.18468427024872e-05, "loss": 0.5372, "mean_token_accuracy": 0.837111834436655, "num_tokens": 605246231.0, "step": 18963 }, { "entropy": 0.5689058932475746, "epoch": 1.7447915768166946, "grad_norm": 0.15137608349323273, "learning_rate": 4.184377587634557e-05, "loss": 0.5628, "mean_token_accuracy": 0.8220884129405022, "num_tokens": 605278099.0, "step": 18964 }, { "entropy": 0.6871358882635832, "epoch": 1.7448835831881357, "grad_norm": 0.16764889657497406, "learning_rate": 4.1840709050203946e-05, "loss": 0.683, "mean_token_accuracy": 0.7940003089606762, "num_tokens": 605310040.0, "step": 18965 }, { "entropy": 0.5799547750502825, "epoch": 1.7449755895595769, "grad_norm": 0.1503172665834427, "learning_rate": 4.183764222406232e-05, "loss": 0.5803, "mean_token_accuracy": 0.8235917203128338, "num_tokens": 605342530.0, "step": 18966 }, { "entropy": 0.5624538278207183, "epoch": 1.7450675959310182, "grad_norm": 0.1551269292831421, "learning_rate": 4.1834575397920696e-05, "loss": 0.5444, "mean_token_accuracy": 0.8301258608698845, "num_tokens": 605374581.0, "step": 18967 }, { "entropy": 0.6331241601146758, "epoch": 1.7451596023024596, "grad_norm": 0.15536271035671234, "learning_rate": 4.1831508571779064e-05, "loss": 0.6388, "mean_token_accuracy": 0.8059673123061657, "num_tokens": 605406388.0, "step": 18968 }, { "entropy": 0.7180468160659075, "epoch": 1.7452516086739007, "grad_norm": 0.16607239842414856, "learning_rate": 4.1828441745637445e-05, "loss": 0.7285, "mean_token_accuracy": 0.7817682214081287, "num_tokens": 605439002.0, "step": 18969 }, { "entropy": 0.6011262219399214, "epoch": 1.7453436150453419, "grad_norm": 0.15607422590255737, "learning_rate": 4.182537491949581e-05, "loss": 0.5895, "mean_token_accuracy": 0.8162476979196072, "num_tokens": 605471283.0, "step": 18970 }, { "entropy": 0.5957333920523524, "epoch": 1.745435621416783, "grad_norm": 0.1581902652978897, "learning_rate": 4.182230809335419e-05, "loss": 0.5858, "mean_token_accuracy": 0.8197089917957783, "num_tokens": 605502993.0, "step": 18971 }, { "entropy": 0.6450443919748068, "epoch": 1.7455276277882243, "grad_norm": 0.15700238943099976, "learning_rate": 4.181924126721256e-05, "loss": 0.6369, "mean_token_accuracy": 0.8049737773835659, "num_tokens": 605534437.0, "step": 18972 }, { "entropy": 0.5163764441385865, "epoch": 1.7456196341596657, "grad_norm": 0.14451168477535248, "learning_rate": 4.181617444107094e-05, "loss": 0.5114, "mean_token_accuracy": 0.8440160006284714, "num_tokens": 605566647.0, "step": 18973 }, { "entropy": 0.6139185521751642, "epoch": 1.7457116405311068, "grad_norm": 0.15109451115131378, "learning_rate": 4.181310761492931e-05, "loss": 0.6023, "mean_token_accuracy": 0.8087961226701736, "num_tokens": 605598780.0, "step": 18974 }, { "entropy": 0.6793694561347365, "epoch": 1.745803646902548, "grad_norm": 0.16305597126483917, "learning_rate": 4.1810040788787686e-05, "loss": 0.6672, "mean_token_accuracy": 0.7965548448264599, "num_tokens": 605629987.0, "step": 18975 }, { "entropy": 0.6333385407924652, "epoch": 1.745895653273989, "grad_norm": 0.1607937067747116, "learning_rate": 4.180697396264606e-05, "loss": 0.6372, "mean_token_accuracy": 0.8073692508041859, "num_tokens": 605662432.0, "step": 18976 }, { "entropy": 0.4991969335824251, "epoch": 1.7459876596454305, "grad_norm": 0.15178313851356506, "learning_rate": 4.1803907136504435e-05, "loss": 0.4937, "mean_token_accuracy": 0.8462244719266891, "num_tokens": 605694705.0, "step": 18977 }, { "entropy": 0.5606359678786248, "epoch": 1.7460796660168718, "grad_norm": 0.1464255154132843, "learning_rate": 4.180084031036281e-05, "loss": 0.5559, "mean_token_accuracy": 0.8269402086734772, "num_tokens": 605727238.0, "step": 18978 }, { "entropy": 0.514404300134629, "epoch": 1.746171672388313, "grad_norm": 0.15298017859458923, "learning_rate": 4.179777348422118e-05, "loss": 0.4879, "mean_token_accuracy": 0.8482009619474411, "num_tokens": 605759062.0, "step": 18979 }, { "entropy": 0.5667544202879071, "epoch": 1.746263678759754, "grad_norm": 0.15224696695804596, "learning_rate": 4.179470665807956e-05, "loss": 0.5563, "mean_token_accuracy": 0.8273454010486603, "num_tokens": 605790726.0, "step": 18980 }, { "entropy": 0.6791427042335272, "epoch": 1.7463556851311952, "grad_norm": 0.15961354970932007, "learning_rate": 4.179163983193793e-05, "loss": 0.6627, "mean_token_accuracy": 0.7967328540980816, "num_tokens": 605822927.0, "step": 18981 }, { "entropy": 0.6231837207451463, "epoch": 1.7464476915026366, "grad_norm": 0.15477657318115234, "learning_rate": 4.178857300579631e-05, "loss": 0.612, "mean_token_accuracy": 0.8093395456671715, "num_tokens": 605854571.0, "step": 18982 }, { "entropy": 0.7074177749454975, "epoch": 1.746539697874078, "grad_norm": 0.16220296919345856, "learning_rate": 4.1785506179654676e-05, "loss": 0.6971, "mean_token_accuracy": 0.7870027311146259, "num_tokens": 605885851.0, "step": 18983 }, { "entropy": 0.5888018812984228, "epoch": 1.746631704245519, "grad_norm": 0.15055780112743378, "learning_rate": 4.178243935351305e-05, "loss": 0.5823, "mean_token_accuracy": 0.824279174208641, "num_tokens": 605918124.0, "step": 18984 }, { "entropy": 0.5618829606100917, "epoch": 1.7467237106169602, "grad_norm": 0.14938855171203613, "learning_rate": 4.1779372527371426e-05, "loss": 0.5444, "mean_token_accuracy": 0.8287164904177189, "num_tokens": 605950070.0, "step": 18985 }, { "entropy": 0.6712947878986597, "epoch": 1.7468157169884013, "grad_norm": 0.15892605483531952, "learning_rate": 4.17763057012298e-05, "loss": 0.6636, "mean_token_accuracy": 0.796335980296135, "num_tokens": 605981804.0, "step": 18986 }, { "entropy": 0.5982852419838309, "epoch": 1.7469077233598427, "grad_norm": 0.15163947641849518, "learning_rate": 4.1773238875088175e-05, "loss": 0.5887, "mean_token_accuracy": 0.8168790340423584, "num_tokens": 606013932.0, "step": 18987 }, { "entropy": 0.6287400112487376, "epoch": 1.746999729731284, "grad_norm": 0.1533065140247345, "learning_rate": 4.177017204894655e-05, "loss": 0.6017, "mean_token_accuracy": 0.8098687119781971, "num_tokens": 606045329.0, "step": 18988 }, { "entropy": 0.7039467515423894, "epoch": 1.7470917361027252, "grad_norm": 0.1582724153995514, "learning_rate": 4.176710522280492e-05, "loss": 0.6832, "mean_token_accuracy": 0.7925003208220005, "num_tokens": 606076858.0, "step": 18989 }, { "entropy": 0.6050849466118962, "epoch": 1.7471837424741663, "grad_norm": 0.15288561582565308, "learning_rate": 4.17640383966633e-05, "loss": 0.5883, "mean_token_accuracy": 0.8198932409286499, "num_tokens": 606109517.0, "step": 18990 }, { "entropy": 0.5477679315954447, "epoch": 1.7472757488456074, "grad_norm": 0.1610974818468094, "learning_rate": 4.176097157052167e-05, "loss": 0.5555, "mean_token_accuracy": 0.8306951597332954, "num_tokens": 606141715.0, "step": 18991 }, { "entropy": 0.5150000443682075, "epoch": 1.7473677552170488, "grad_norm": 0.1462128907442093, "learning_rate": 4.175790474438004e-05, "loss": 0.4865, "mean_token_accuracy": 0.8465107120573521, "num_tokens": 606173556.0, "step": 18992 }, { "entropy": 0.5654730640817434, "epoch": 1.7474597615884901, "grad_norm": 0.14675763249397278, "learning_rate": 4.1754837918238416e-05, "loss": 0.5494, "mean_token_accuracy": 0.830366313457489, "num_tokens": 606205760.0, "step": 18993 }, { "entropy": 0.6204254208132625, "epoch": 1.7475517679599313, "grad_norm": 0.15745767951011658, "learning_rate": 4.175177109209679e-05, "loss": 0.6198, "mean_token_accuracy": 0.8118895180523396, "num_tokens": 606237843.0, "step": 18994 }, { "entropy": 0.568571004550904, "epoch": 1.7476437743313724, "grad_norm": 0.15180884301662445, "learning_rate": 4.1748704265955165e-05, "loss": 0.5487, "mean_token_accuracy": 0.8318855576217175, "num_tokens": 606269623.0, "step": 18995 }, { "entropy": 0.5725711663253605, "epoch": 1.7477357807028135, "grad_norm": 0.15693944692611694, "learning_rate": 4.174563743981354e-05, "loss": 0.5627, "mean_token_accuracy": 0.825993001461029, "num_tokens": 606301565.0, "step": 18996 }, { "entropy": 0.6974701303988695, "epoch": 1.747827787074255, "grad_norm": 0.16501709818840027, "learning_rate": 4.174257061367191e-05, "loss": 0.6956, "mean_token_accuracy": 0.7875528112053871, "num_tokens": 606332767.0, "step": 18997 }, { "entropy": 0.5227490486577153, "epoch": 1.7479197934456963, "grad_norm": 0.14821331202983856, "learning_rate": 4.173950378753029e-05, "loss": 0.5183, "mean_token_accuracy": 0.8400495536625385, "num_tokens": 606364149.0, "step": 18998 }, { "entropy": 0.5593122662976384, "epoch": 1.7480117998171374, "grad_norm": 0.15746040642261505, "learning_rate": 4.173643696138866e-05, "loss": 0.5656, "mean_token_accuracy": 0.8293017745018005, "num_tokens": 606395821.0, "step": 18999 }, { "entropy": 0.5308979842811823, "epoch": 1.7481038061885785, "grad_norm": 0.1433177888393402, "learning_rate": 4.173337013524703e-05, "loss": 0.5378, "mean_token_accuracy": 0.8314257636666298, "num_tokens": 606428140.0, "step": 19000 }, { "entropy": 0.5064555164426565, "epoch": 1.7481958125600197, "grad_norm": 0.15682223439216614, "learning_rate": 4.1730303309105407e-05, "loss": 0.494, "mean_token_accuracy": 0.8479796797037125, "num_tokens": 606460796.0, "step": 19001 }, { "entropy": 0.7496210597455502, "epoch": 1.748287818931461, "grad_norm": 0.16281184554100037, "learning_rate": 4.172723648296378e-05, "loss": 0.7375, "mean_token_accuracy": 0.77632200345397, "num_tokens": 606492336.0, "step": 19002 }, { "entropy": 0.5848562056198716, "epoch": 1.7483798253029024, "grad_norm": 0.1534808725118637, "learning_rate": 4.1724169656822156e-05, "loss": 0.5778, "mean_token_accuracy": 0.8240968137979507, "num_tokens": 606525047.0, "step": 19003 }, { "entropy": 0.6329195639118552, "epoch": 1.7484718316743435, "grad_norm": 0.15835855901241302, "learning_rate": 4.172110283068053e-05, "loss": 0.6122, "mean_token_accuracy": 0.8137977607548237, "num_tokens": 606556956.0, "step": 19004 }, { "entropy": 0.7202121298760176, "epoch": 1.7485638380457846, "grad_norm": 0.1570628434419632, "learning_rate": 4.1718036004538905e-05, "loss": 0.706, "mean_token_accuracy": 0.7868960537016392, "num_tokens": 606589343.0, "step": 19005 }, { "entropy": 0.7022245340049267, "epoch": 1.7486558444172258, "grad_norm": 0.16115370392799377, "learning_rate": 4.171496917839728e-05, "loss": 0.6814, "mean_token_accuracy": 0.7911697626113892, "num_tokens": 606621241.0, "step": 19006 }, { "entropy": 0.6369646470993757, "epoch": 1.7487478507886671, "grad_norm": 0.1591259092092514, "learning_rate": 4.1711902352255654e-05, "loss": 0.622, "mean_token_accuracy": 0.8114693686366081, "num_tokens": 606652503.0, "step": 19007 }, { "entropy": 0.5740658175200224, "epoch": 1.7488398571601085, "grad_norm": 0.15258148312568665, "learning_rate": 4.170883552611403e-05, "loss": 0.5557, "mean_token_accuracy": 0.8282914087176323, "num_tokens": 606684230.0, "step": 19008 }, { "entropy": 0.6268722582608461, "epoch": 1.7489318635315496, "grad_norm": 0.15249574184417725, "learning_rate": 4.1705768699972404e-05, "loss": 0.6108, "mean_token_accuracy": 0.8101908192038536, "num_tokens": 606716887.0, "step": 19009 }, { "entropy": 0.5436038998886943, "epoch": 1.7490238699029907, "grad_norm": 0.14623169600963593, "learning_rate": 4.170270187383077e-05, "loss": 0.5316, "mean_token_accuracy": 0.8332532234489918, "num_tokens": 606749017.0, "step": 19010 }, { "entropy": 0.6167960520833731, "epoch": 1.7491158762744319, "grad_norm": 0.1540830135345459, "learning_rate": 4.169963504768915e-05, "loss": 0.5921, "mean_token_accuracy": 0.8188757449388504, "num_tokens": 606780680.0, "step": 19011 }, { "entropy": 0.5941995307803154, "epoch": 1.7492078826458732, "grad_norm": 0.15129563212394714, "learning_rate": 4.169656822154752e-05, "loss": 0.5823, "mean_token_accuracy": 0.8214666359126568, "num_tokens": 606813172.0, "step": 19012 }, { "entropy": 0.5838430752046406, "epoch": 1.7492998890173146, "grad_norm": 0.15049365162849426, "learning_rate": 4.1693501395405896e-05, "loss": 0.5642, "mean_token_accuracy": 0.8287052512168884, "num_tokens": 606845275.0, "step": 19013 }, { "entropy": 0.6982726817950606, "epoch": 1.7493918953887557, "grad_norm": 0.15394531190395355, "learning_rate": 4.169043456926427e-05, "loss": 0.6861, "mean_token_accuracy": 0.787609051913023, "num_tokens": 606877697.0, "step": 19014 }, { "entropy": 0.5787779670208693, "epoch": 1.7494839017601969, "grad_norm": 0.15511462092399597, "learning_rate": 4.1687367743122645e-05, "loss": 0.571, "mean_token_accuracy": 0.820647094398737, "num_tokens": 606909769.0, "step": 19015 }, { "entropy": 0.5180239547044039, "epoch": 1.749575908131638, "grad_norm": 0.14194633066654205, "learning_rate": 4.168430091698102e-05, "loss": 0.5054, "mean_token_accuracy": 0.844327300786972, "num_tokens": 606942238.0, "step": 19016 }, { "entropy": 0.5624481271952391, "epoch": 1.7496679145030793, "grad_norm": 0.152133971452713, "learning_rate": 4.1681234090839394e-05, "loss": 0.5505, "mean_token_accuracy": 0.8274163492023945, "num_tokens": 606974313.0, "step": 19017 }, { "entropy": 0.6466563753783703, "epoch": 1.7497599208745207, "grad_norm": 0.15899744629859924, "learning_rate": 4.167816726469776e-05, "loss": 0.6393, "mean_token_accuracy": 0.8013211339712143, "num_tokens": 607006180.0, "step": 19018 }, { "entropy": 0.5906625334173441, "epoch": 1.7498519272459618, "grad_norm": 0.14971429109573364, "learning_rate": 4.1675100438556143e-05, "loss": 0.5774, "mean_token_accuracy": 0.8173555098474026, "num_tokens": 607038102.0, "step": 19019 }, { "entropy": 0.6697855070233345, "epoch": 1.749943933617403, "grad_norm": 0.15961290895938873, "learning_rate": 4.167203361241451e-05, "loss": 0.6658, "mean_token_accuracy": 0.7976555861532688, "num_tokens": 607070152.0, "step": 19020 }, { "entropy": 0.5052434606477618, "epoch": 1.750035939988844, "grad_norm": 0.15170276165008545, "learning_rate": 4.166896678627289e-05, "loss": 0.5029, "mean_token_accuracy": 0.8432533480226994, "num_tokens": 607102238.0, "step": 19021 }, { "entropy": 0.6473940084688365, "epoch": 1.7501279463602855, "grad_norm": 0.15709279477596283, "learning_rate": 4.166589996013126e-05, "loss": 0.6501, "mean_token_accuracy": 0.8013940118253231, "num_tokens": 607134527.0, "step": 19022 }, { "entropy": 0.5662986333481967, "epoch": 1.7502199527317268, "grad_norm": 0.15454289317131042, "learning_rate": 4.1662833133989635e-05, "loss": 0.5602, "mean_token_accuracy": 0.8265665173530579, "num_tokens": 607166073.0, "step": 19023 }, { "entropy": 0.5401400940027088, "epoch": 1.750311959103168, "grad_norm": 0.14884904026985168, "learning_rate": 4.165976630784801e-05, "loss": 0.526, "mean_token_accuracy": 0.8375366292893887, "num_tokens": 607198841.0, "step": 19024 }, { "entropy": 0.6351240370422602, "epoch": 1.750403965474609, "grad_norm": 0.16125145554542542, "learning_rate": 4.1656699481706385e-05, "loss": 0.6425, "mean_token_accuracy": 0.7999243214726448, "num_tokens": 607229816.0, "step": 19025 }, { "entropy": 0.5591802932322025, "epoch": 1.7504959718460502, "grad_norm": 0.14939168095588684, "learning_rate": 4.165363265556476e-05, "loss": 0.5476, "mean_token_accuracy": 0.8287230916321278, "num_tokens": 607262167.0, "step": 19026 }, { "entropy": 0.6228501368314028, "epoch": 1.7505879782174916, "grad_norm": 0.15157249569892883, "learning_rate": 4.1650565829423134e-05, "loss": 0.622, "mean_token_accuracy": 0.8105882033705711, "num_tokens": 607294699.0, "step": 19027 }, { "entropy": 0.5607379684224725, "epoch": 1.750679984588933, "grad_norm": 0.16264155507087708, "learning_rate": 4.16474990032815e-05, "loss": 0.5447, "mean_token_accuracy": 0.8315287679433823, "num_tokens": 607326010.0, "step": 19028 }, { "entropy": 0.6501550637185574, "epoch": 1.750771990960374, "grad_norm": 0.1591395139694214, "learning_rate": 4.164443217713988e-05, "loss": 0.647, "mean_token_accuracy": 0.8026022911071777, "num_tokens": 607358147.0, "step": 19029 }, { "entropy": 0.5299756322056055, "epoch": 1.7508639973318152, "grad_norm": 0.14866812527179718, "learning_rate": 4.164136535099825e-05, "loss": 0.5186, "mean_token_accuracy": 0.839774027466774, "num_tokens": 607390039.0, "step": 19030 }, { "entropy": 0.6576817687600851, "epoch": 1.7509560037032563, "grad_norm": 0.15996263921260834, "learning_rate": 4.1638298524856626e-05, "loss": 0.6335, "mean_token_accuracy": 0.8047953173518181, "num_tokens": 607421316.0, "step": 19031 }, { "entropy": 0.4743795543909073, "epoch": 1.7510480100746977, "grad_norm": 0.15001723170280457, "learning_rate": 4.1635231698715e-05, "loss": 0.4587, "mean_token_accuracy": 0.8564139120280743, "num_tokens": 607452787.0, "step": 19032 }, { "entropy": 0.5854383483529091, "epoch": 1.751140016446139, "grad_norm": 0.15378813445568085, "learning_rate": 4.1632164872573375e-05, "loss": 0.5741, "mean_token_accuracy": 0.8247830234467983, "num_tokens": 607485105.0, "step": 19033 }, { "entropy": 0.6467857006937265, "epoch": 1.7512320228175802, "grad_norm": 0.15633746981620789, "learning_rate": 4.162909804643175e-05, "loss": 0.6336, "mean_token_accuracy": 0.8081753067672253, "num_tokens": 607516883.0, "step": 19034 }, { "entropy": 0.6381613612174988, "epoch": 1.7513240291890213, "grad_norm": 0.1546400934457779, "learning_rate": 4.1626031220290124e-05, "loss": 0.6335, "mean_token_accuracy": 0.8047912493348122, "num_tokens": 607548923.0, "step": 19035 }, { "entropy": 0.6949703246355057, "epoch": 1.7514160355604624, "grad_norm": 0.1602914184331894, "learning_rate": 4.16229643941485e-05, "loss": 0.6862, "mean_token_accuracy": 0.7954008653759956, "num_tokens": 607581156.0, "step": 19036 }, { "entropy": 0.6447350643575191, "epoch": 1.7515080419319038, "grad_norm": 0.15221348404884338, "learning_rate": 4.1619897568006874e-05, "loss": 0.6362, "mean_token_accuracy": 0.8073132261633873, "num_tokens": 607613551.0, "step": 19037 }, { "entropy": 0.6742587722837925, "epoch": 1.7516000483033451, "grad_norm": 0.15804649889469147, "learning_rate": 4.161683074186525e-05, "loss": 0.6645, "mean_token_accuracy": 0.7975421659648418, "num_tokens": 607644521.0, "step": 19038 }, { "entropy": 0.6451102048158646, "epoch": 1.7516920546747863, "grad_norm": 0.15510056912899017, "learning_rate": 4.1613763915723616e-05, "loss": 0.6409, "mean_token_accuracy": 0.8031417280435562, "num_tokens": 607676938.0, "step": 19039 }, { "entropy": 0.6302368380129337, "epoch": 1.7517840610462274, "grad_norm": 0.15532104671001434, "learning_rate": 4.1610697089582e-05, "loss": 0.6244, "mean_token_accuracy": 0.812759630382061, "num_tokens": 607709501.0, "step": 19040 }, { "entropy": 0.5529199186712503, "epoch": 1.7518760674176685, "grad_norm": 0.14736391603946686, "learning_rate": 4.1607630263440365e-05, "loss": 0.5365, "mean_token_accuracy": 0.8352396450936794, "num_tokens": 607741655.0, "step": 19041 }, { "entropy": 0.528076047077775, "epoch": 1.75196807378911, "grad_norm": 0.14286521077156067, "learning_rate": 4.160456343729875e-05, "loss": 0.5177, "mean_token_accuracy": 0.8399285636842251, "num_tokens": 607774123.0, "step": 19042 }, { "entropy": 0.5507827736437321, "epoch": 1.7520600801605513, "grad_norm": 0.15712861716747284, "learning_rate": 4.1601496611157115e-05, "loss": 0.5459, "mean_token_accuracy": 0.8346259109675884, "num_tokens": 607806504.0, "step": 19043 }, { "entropy": 0.6202923581004143, "epoch": 1.7521520865319924, "grad_norm": 0.1585107147693634, "learning_rate": 4.159842978501549e-05, "loss": 0.6212, "mean_token_accuracy": 0.8103036731481552, "num_tokens": 607839040.0, "step": 19044 }, { "entropy": 0.6353509873151779, "epoch": 1.7522440929034335, "grad_norm": 0.16116423904895782, "learning_rate": 4.1595362958873864e-05, "loss": 0.6199, "mean_token_accuracy": 0.8056905977427959, "num_tokens": 607870242.0, "step": 19045 }, { "entropy": 0.612562651745975, "epoch": 1.7523360992748747, "grad_norm": 0.15170685946941376, "learning_rate": 4.159229613273224e-05, "loss": 0.6124, "mean_token_accuracy": 0.8106423728168011, "num_tokens": 607902931.0, "step": 19046 }, { "entropy": 0.5965875843539834, "epoch": 1.752428105646316, "grad_norm": 0.15377937257289886, "learning_rate": 4.158922930659061e-05, "loss": 0.5909, "mean_token_accuracy": 0.8181613571941853, "num_tokens": 607934142.0, "step": 19047 }, { "entropy": 0.5523910727351904, "epoch": 1.7525201120177574, "grad_norm": 0.15178915858268738, "learning_rate": 4.158616248044899e-05, "loss": 0.5443, "mean_token_accuracy": 0.8288293033838272, "num_tokens": 607966261.0, "step": 19048 }, { "entropy": 0.6389783988706768, "epoch": 1.7526121183891985, "grad_norm": 0.1556919813156128, "learning_rate": 4.1583095654307356e-05, "loss": 0.6406, "mean_token_accuracy": 0.8077142015099525, "num_tokens": 607998984.0, "step": 19049 }, { "entropy": 0.6319818166084588, "epoch": 1.7527041247606396, "grad_norm": 0.1569332629442215, "learning_rate": 4.158002882816574e-05, "loss": 0.621, "mean_token_accuracy": 0.8084758743643761, "num_tokens": 608030955.0, "step": 19050 }, { "entropy": 0.5832287105731666, "epoch": 1.7527961311320808, "grad_norm": 0.14836373925209045, "learning_rate": 4.1576962002024105e-05, "loss": 0.574, "mean_token_accuracy": 0.8203871250152588, "num_tokens": 608062182.0, "step": 19051 }, { "entropy": 0.6304134577512741, "epoch": 1.7528881375035221, "grad_norm": 0.16048355400562286, "learning_rate": 4.157389517588248e-05, "loss": 0.6175, "mean_token_accuracy": 0.811127133667469, "num_tokens": 608093377.0, "step": 19052 }, { "entropy": 0.5272427201271057, "epoch": 1.7529801438749635, "grad_norm": 0.1489383727312088, "learning_rate": 4.1570828349740854e-05, "loss": 0.5167, "mean_token_accuracy": 0.8416360840201378, "num_tokens": 608125055.0, "step": 19053 }, { "entropy": 0.7491339333355427, "epoch": 1.7530721502464046, "grad_norm": 0.16751542687416077, "learning_rate": 4.156776152359923e-05, "loss": 0.7355, "mean_token_accuracy": 0.7727388702332973, "num_tokens": 608157134.0, "step": 19054 }, { "entropy": 0.6041224850341678, "epoch": 1.7531641566178457, "grad_norm": 0.1580776572227478, "learning_rate": 4.1564694697457604e-05, "loss": 0.5938, "mean_token_accuracy": 0.8179506585001945, "num_tokens": 608188177.0, "step": 19055 }, { "entropy": 0.5655973316170275, "epoch": 1.7532561629892869, "grad_norm": 0.14708811044692993, "learning_rate": 4.156162787131598e-05, "loss": 0.5498, "mean_token_accuracy": 0.8316726759076118, "num_tokens": 608220518.0, "step": 19056 }, { "entropy": 0.622043730225414, "epoch": 1.7533481693607282, "grad_norm": 0.15081241726875305, "learning_rate": 4.1558561045174346e-05, "loss": 0.5949, "mean_token_accuracy": 0.8144946694374084, "num_tokens": 608252503.0, "step": 19057 }, { "entropy": 0.6325775468721986, "epoch": 1.7534401757321696, "grad_norm": 0.15453381836414337, "learning_rate": 4.155549421903273e-05, "loss": 0.6309, "mean_token_accuracy": 0.8064327538013458, "num_tokens": 608283862.0, "step": 19058 }, { "entropy": 0.5448739184066653, "epoch": 1.7535321821036107, "grad_norm": 0.14313529431819916, "learning_rate": 4.1552427392891095e-05, "loss": 0.5273, "mean_token_accuracy": 0.8357763960957527, "num_tokens": 608315749.0, "step": 19059 }, { "entropy": 0.5695199863985181, "epoch": 1.7536241884750519, "grad_norm": 0.1566399484872818, "learning_rate": 4.154936056674947e-05, "loss": 0.5565, "mean_token_accuracy": 0.829145722091198, "num_tokens": 608347906.0, "step": 19060 }, { "entropy": 0.5934568154625595, "epoch": 1.753716194846493, "grad_norm": 0.15148305892944336, "learning_rate": 4.1546293740607845e-05, "loss": 0.5883, "mean_token_accuracy": 0.8225543424487114, "num_tokens": 608380467.0, "step": 19061 }, { "entropy": 0.6078901048749685, "epoch": 1.7538082012179343, "grad_norm": 0.15531061589717865, "learning_rate": 4.154322691446622e-05, "loss": 0.6012, "mean_token_accuracy": 0.8179597742855549, "num_tokens": 608412673.0, "step": 19062 }, { "entropy": 0.6017694985494018, "epoch": 1.7539002075893757, "grad_norm": 0.1538974493741989, "learning_rate": 4.1540160088324594e-05, "loss": 0.5836, "mean_token_accuracy": 0.8170096948742867, "num_tokens": 608443780.0, "step": 19063 }, { "entropy": 0.5750778615474701, "epoch": 1.7539922139608168, "grad_norm": 0.15747439861297607, "learning_rate": 4.153709326218297e-05, "loss": 0.5693, "mean_token_accuracy": 0.8267878964543343, "num_tokens": 608475669.0, "step": 19064 }, { "entropy": 0.6040342776104808, "epoch": 1.754084220332258, "grad_norm": 0.15350428223609924, "learning_rate": 4.153402643604134e-05, "loss": 0.6032, "mean_token_accuracy": 0.8174277655780315, "num_tokens": 608507693.0, "step": 19065 }, { "entropy": 0.4791451683267951, "epoch": 1.754176226703699, "grad_norm": 0.13961996138095856, "learning_rate": 4.153095960989972e-05, "loss": 0.4774, "mean_token_accuracy": 0.8524732142686844, "num_tokens": 608539783.0, "step": 19066 }, { "entropy": 0.6088655833154917, "epoch": 1.7542682330751405, "grad_norm": 0.15448957681655884, "learning_rate": 4.152789278375809e-05, "loss": 0.59, "mean_token_accuracy": 0.8161894418299198, "num_tokens": 608572252.0, "step": 19067 }, { "entropy": 0.5401041463483125, "epoch": 1.7543602394465818, "grad_norm": 0.14954496920108795, "learning_rate": 4.152482595761647e-05, "loss": 0.5345, "mean_token_accuracy": 0.8346280194818974, "num_tokens": 608604368.0, "step": 19068 }, { "entropy": 0.5948046557605267, "epoch": 1.754452245818023, "grad_norm": 0.14984913170337677, "learning_rate": 4.152175913147484e-05, "loss": 0.5743, "mean_token_accuracy": 0.8206764832139015, "num_tokens": 608635795.0, "step": 19069 }, { "entropy": 0.5253113526850939, "epoch": 1.754544252189464, "grad_norm": 0.15125419199466705, "learning_rate": 4.151869230533321e-05, "loss": 0.5091, "mean_token_accuracy": 0.840433731675148, "num_tokens": 608667080.0, "step": 19070 }, { "entropy": 0.5303541999310255, "epoch": 1.7546362585609052, "grad_norm": 0.14883345365524292, "learning_rate": 4.151562547919159e-05, "loss": 0.5112, "mean_token_accuracy": 0.8389666303992271, "num_tokens": 608698708.0, "step": 19071 }, { "entropy": 0.6534818513318896, "epoch": 1.7547282649323466, "grad_norm": 0.1564939320087433, "learning_rate": 4.151255865304996e-05, "loss": 0.6556, "mean_token_accuracy": 0.8010306432843208, "num_tokens": 608730365.0, "step": 19072 }, { "entropy": 0.6190655999816954, "epoch": 1.754820271303788, "grad_norm": 0.17038288712501526, "learning_rate": 4.1509491826908334e-05, "loss": 0.6259, "mean_token_accuracy": 0.806782279163599, "num_tokens": 608762254.0, "step": 19073 }, { "entropy": 0.7227852176874876, "epoch": 1.754912277675229, "grad_norm": 0.16649657487869263, "learning_rate": 4.150642500076671e-05, "loss": 0.7156, "mean_token_accuracy": 0.7862221784889698, "num_tokens": 608794110.0, "step": 19074 }, { "entropy": 0.623510617762804, "epoch": 1.7550042840466702, "grad_norm": 0.16247422993183136, "learning_rate": 4.150335817462508e-05, "loss": 0.6154, "mean_token_accuracy": 0.8114158622920513, "num_tokens": 608825418.0, "step": 19075 }, { "entropy": 0.5731516107916832, "epoch": 1.7550962904181113, "grad_norm": 0.1508314162492752, "learning_rate": 4.150029134848346e-05, "loss": 0.5633, "mean_token_accuracy": 0.8290759399533272, "num_tokens": 608857592.0, "step": 19076 }, { "entropy": 0.7101188097149134, "epoch": 1.7551882967895527, "grad_norm": 0.1568392962217331, "learning_rate": 4.149722452234183e-05, "loss": 0.6911, "mean_token_accuracy": 0.7889789827167988, "num_tokens": 608889895.0, "step": 19077 }, { "entropy": 0.711393772624433, "epoch": 1.755280303160994, "grad_norm": 0.1604827344417572, "learning_rate": 4.14941576962002e-05, "loss": 0.692, "mean_token_accuracy": 0.7904000356793404, "num_tokens": 608920863.0, "step": 19078 }, { "entropy": 0.5447638342157006, "epoch": 1.7553723095324352, "grad_norm": 0.1461867243051529, "learning_rate": 4.149109087005858e-05, "loss": 0.5259, "mean_token_accuracy": 0.8340710327029228, "num_tokens": 608952735.0, "step": 19079 }, { "entropy": 0.6904314253479242, "epoch": 1.7554643159038763, "grad_norm": 0.1619957685470581, "learning_rate": 4.148802404391695e-05, "loss": 0.6864, "mean_token_accuracy": 0.7936356514692307, "num_tokens": 608985084.0, "step": 19080 }, { "entropy": 0.5793271586298943, "epoch": 1.7555563222753174, "grad_norm": 0.14886049926280975, "learning_rate": 4.148495721777533e-05, "loss": 0.5681, "mean_token_accuracy": 0.824138455092907, "num_tokens": 609017077.0, "step": 19081 }, { "entropy": 0.5702716838568449, "epoch": 1.7556483286467588, "grad_norm": 0.1495383232831955, "learning_rate": 4.14818903916337e-05, "loss": 0.5572, "mean_token_accuracy": 0.8296073824167252, "num_tokens": 609049119.0, "step": 19082 }, { "entropy": 0.6730485912412405, "epoch": 1.7557403350182001, "grad_norm": 0.15848074853420258, "learning_rate": 4.1478823565492073e-05, "loss": 0.6536, "mean_token_accuracy": 0.8017488643527031, "num_tokens": 609080650.0, "step": 19083 }, { "entropy": 0.48264908976852894, "epoch": 1.7558323413896413, "grad_norm": 0.1443280428647995, "learning_rate": 4.147575673935045e-05, "loss": 0.4705, "mean_token_accuracy": 0.8544499315321445, "num_tokens": 609112745.0, "step": 19084 }, { "entropy": 0.6633457564748824, "epoch": 1.7559243477610824, "grad_norm": 0.16130311787128448, "learning_rate": 4.147268991320882e-05, "loss": 0.6565, "mean_token_accuracy": 0.805428046733141, "num_tokens": 609144051.0, "step": 19085 }, { "entropy": 0.6554378848522902, "epoch": 1.7560163541325235, "grad_norm": 0.15971790254116058, "learning_rate": 4.14696230870672e-05, "loss": 0.653, "mean_token_accuracy": 0.7993462309241295, "num_tokens": 609176545.0, "step": 19086 }, { "entropy": 0.622024105861783, "epoch": 1.756108360503965, "grad_norm": 0.15592943131923676, "learning_rate": 4.146655626092557e-05, "loss": 0.6181, "mean_token_accuracy": 0.8139617629349232, "num_tokens": 609208832.0, "step": 19087 }, { "entropy": 0.526950185187161, "epoch": 1.7562003668754063, "grad_norm": 0.14660440385341644, "learning_rate": 4.146348943478394e-05, "loss": 0.5248, "mean_token_accuracy": 0.8394265398383141, "num_tokens": 609240833.0, "step": 19088 }, { "entropy": 0.5801294092088938, "epoch": 1.7562923732468474, "grad_norm": 0.16484199464321136, "learning_rate": 4.146042260864232e-05, "loss": 0.5695, "mean_token_accuracy": 0.8193403445184231, "num_tokens": 609272735.0, "step": 19089 }, { "entropy": 0.6048416667617857, "epoch": 1.7563843796182885, "grad_norm": 0.1551641970872879, "learning_rate": 4.145735578250069e-05, "loss": 0.5937, "mean_token_accuracy": 0.8157837949693203, "num_tokens": 609305153.0, "step": 19090 }, { "entropy": 0.522768447175622, "epoch": 1.7564763859897297, "grad_norm": 0.16019658744335175, "learning_rate": 4.1454288956359064e-05, "loss": 0.515, "mean_token_accuracy": 0.8449134901165962, "num_tokens": 609337497.0, "step": 19091 }, { "entropy": 0.6596762798726559, "epoch": 1.756568392361171, "grad_norm": 0.15850839018821716, "learning_rate": 4.145122213021744e-05, "loss": 0.6546, "mean_token_accuracy": 0.8014524467289448, "num_tokens": 609369846.0, "step": 19092 }, { "entropy": 0.6601245608180761, "epoch": 1.7566603987326124, "grad_norm": 0.1620195209980011, "learning_rate": 4.144815530407581e-05, "loss": 0.6694, "mean_token_accuracy": 0.7955327667295933, "num_tokens": 609402246.0, "step": 19093 }, { "entropy": 0.601070936769247, "epoch": 1.7567524051040535, "grad_norm": 0.15716052055358887, "learning_rate": 4.144508847793419e-05, "loss": 0.5854, "mean_token_accuracy": 0.8205757178366184, "num_tokens": 609434357.0, "step": 19094 }, { "entropy": 0.6158333644270897, "epoch": 1.7568444114754946, "grad_norm": 0.15335120260715485, "learning_rate": 4.144202165179256e-05, "loss": 0.6042, "mean_token_accuracy": 0.8113305456936359, "num_tokens": 609466710.0, "step": 19095 }, { "entropy": 0.5334361339919269, "epoch": 1.7569364178469358, "grad_norm": 0.1452058106660843, "learning_rate": 4.143895482565094e-05, "loss": 0.5118, "mean_token_accuracy": 0.842510387301445, "num_tokens": 609498738.0, "step": 19096 }, { "entropy": 0.6153035778552294, "epoch": 1.7570284242183771, "grad_norm": 0.16144175827503204, "learning_rate": 4.143588799950931e-05, "loss": 0.6041, "mean_token_accuracy": 0.8130035847425461, "num_tokens": 609530049.0, "step": 19097 }, { "entropy": 0.5972603810951114, "epoch": 1.7571204305898185, "grad_norm": 0.15520331263542175, "learning_rate": 4.1432821173367686e-05, "loss": 0.5909, "mean_token_accuracy": 0.8181374408304691, "num_tokens": 609562110.0, "step": 19098 }, { "entropy": 0.6671513337641954, "epoch": 1.7572124369612596, "grad_norm": 0.16137298941612244, "learning_rate": 4.1429754347226054e-05, "loss": 0.6542, "mean_token_accuracy": 0.8027463257312775, "num_tokens": 609593743.0, "step": 19099 }, { "entropy": 0.601836696267128, "epoch": 1.7573044433327007, "grad_norm": 0.15616187453269958, "learning_rate": 4.1426687521084436e-05, "loss": 0.6043, "mean_token_accuracy": 0.8150919005274773, "num_tokens": 609626343.0, "step": 19100 }, { "entropy": 0.6370095405727625, "epoch": 1.7573964497041419, "grad_norm": 0.15717121958732605, "learning_rate": 4.1423620694942804e-05, "loss": 0.6331, "mean_token_accuracy": 0.8100361563265324, "num_tokens": 609658731.0, "step": 19101 }, { "entropy": 0.6161282602697611, "epoch": 1.7574884560755832, "grad_norm": 0.15423640608787537, "learning_rate": 4.1420553868801185e-05, "loss": 0.6012, "mean_token_accuracy": 0.8137118779122829, "num_tokens": 609689341.0, "step": 19102 }, { "entropy": 0.6135658631101251, "epoch": 1.7575804624470246, "grad_norm": 0.1560726761817932, "learning_rate": 4.141748704265955e-05, "loss": 0.5905, "mean_token_accuracy": 0.8149869330227375, "num_tokens": 609721312.0, "step": 19103 }, { "entropy": 0.5984882973134518, "epoch": 1.7576724688184657, "grad_norm": 0.14566336572170258, "learning_rate": 4.141442021651793e-05, "loss": 0.5729, "mean_token_accuracy": 0.818773228675127, "num_tokens": 609753434.0, "step": 19104 }, { "entropy": 0.5799127644859254, "epoch": 1.7577644751899069, "grad_norm": 0.15437600016593933, "learning_rate": 4.14113533903763e-05, "loss": 0.5751, "mean_token_accuracy": 0.8196482993662357, "num_tokens": 609784900.0, "step": 19105 }, { "entropy": 0.5185920773074031, "epoch": 1.757856481561348, "grad_norm": 0.15107308328151703, "learning_rate": 4.140828656423468e-05, "loss": 0.5049, "mean_token_accuracy": 0.8431973867118359, "num_tokens": 609816621.0, "step": 19106 }, { "entropy": 0.6307043414562941, "epoch": 1.7579484879327893, "grad_norm": 0.15512540936470032, "learning_rate": 4.140521973809305e-05, "loss": 0.609, "mean_token_accuracy": 0.8079760037362576, "num_tokens": 609848651.0, "step": 19107 }, { "entropy": 0.6008984446525574, "epoch": 1.7580404943042307, "grad_norm": 0.1487671434879303, "learning_rate": 4.1402152911951426e-05, "loss": 0.5914, "mean_token_accuracy": 0.8153907433152199, "num_tokens": 609880578.0, "step": 19108 }, { "entropy": 0.5886555202305317, "epoch": 1.7581325006756718, "grad_norm": 0.14759822189807892, "learning_rate": 4.1399086085809794e-05, "loss": 0.5648, "mean_token_accuracy": 0.8226158879697323, "num_tokens": 609912331.0, "step": 19109 }, { "entropy": 0.5601716786623001, "epoch": 1.758224507047113, "grad_norm": 0.14243362843990326, "learning_rate": 4.1396019259668175e-05, "loss": 0.5542, "mean_token_accuracy": 0.8299310132861137, "num_tokens": 609944422.0, "step": 19110 }, { "entropy": 0.6577439475804567, "epoch": 1.758316513418554, "grad_norm": 0.15354831516742706, "learning_rate": 4.139295243352654e-05, "loss": 0.659, "mean_token_accuracy": 0.8024037964642048, "num_tokens": 609976879.0, "step": 19111 }, { "entropy": 0.6564547251909971, "epoch": 1.7584085197899955, "grad_norm": 0.16008038818836212, "learning_rate": 4.138988560738492e-05, "loss": 0.6548, "mean_token_accuracy": 0.8004736974835396, "num_tokens": 610008904.0, "step": 19112 }, { "entropy": 0.5072426935657859, "epoch": 1.7585005261614368, "grad_norm": 0.14572015404701233, "learning_rate": 4.138681878124329e-05, "loss": 0.4928, "mean_token_accuracy": 0.8454993963241577, "num_tokens": 610040131.0, "step": 19113 }, { "entropy": 0.6068824231624603, "epoch": 1.758592532532878, "grad_norm": 0.1556551456451416, "learning_rate": 4.138375195510167e-05, "loss": 0.6032, "mean_token_accuracy": 0.817047480493784, "num_tokens": 610071578.0, "step": 19114 }, { "entropy": 0.6587246139533818, "epoch": 1.758684538904319, "grad_norm": 0.16079913079738617, "learning_rate": 4.138068512896004e-05, "loss": 0.6528, "mean_token_accuracy": 0.8032409846782684, "num_tokens": 610103527.0, "step": 19115 }, { "entropy": 0.6036436017602682, "epoch": 1.7587765452757602, "grad_norm": 0.15284408628940582, "learning_rate": 4.1377618302818417e-05, "loss": 0.607, "mean_token_accuracy": 0.8146251291036606, "num_tokens": 610135628.0, "step": 19116 }, { "entropy": 0.5563490940257907, "epoch": 1.7588685516472016, "grad_norm": 0.15412887930870056, "learning_rate": 4.1374551476676784e-05, "loss": 0.5447, "mean_token_accuracy": 0.8305287137627602, "num_tokens": 610167888.0, "step": 19117 }, { "entropy": 0.5825919383205473, "epoch": 1.758960558018643, "grad_norm": 0.15810543298721313, "learning_rate": 4.1371484650535166e-05, "loss": 0.5812, "mean_token_accuracy": 0.8220688849687576, "num_tokens": 610200272.0, "step": 19118 }, { "entropy": 0.576705064624548, "epoch": 1.759052564390084, "grad_norm": 0.15357929468154907, "learning_rate": 4.1368417824393534e-05, "loss": 0.5689, "mean_token_accuracy": 0.8217475935816765, "num_tokens": 610232623.0, "step": 19119 }, { "entropy": 0.5791017096489668, "epoch": 1.7591445707615252, "grad_norm": 0.14828351140022278, "learning_rate": 4.136535099825191e-05, "loss": 0.566, "mean_token_accuracy": 0.8279194720089436, "num_tokens": 610265104.0, "step": 19120 }, { "entropy": 0.6044644778594375, "epoch": 1.7592365771329663, "grad_norm": 0.15613466501235962, "learning_rate": 4.136228417211028e-05, "loss": 0.5882, "mean_token_accuracy": 0.8198056295514107, "num_tokens": 610297100.0, "step": 19121 }, { "entropy": 0.721256572753191, "epoch": 1.7593285835044077, "grad_norm": 0.16369281709194183, "learning_rate": 4.135921734596866e-05, "loss": 0.7041, "mean_token_accuracy": 0.7830605767667294, "num_tokens": 610328490.0, "step": 19122 }, { "entropy": 0.6548959668725729, "epoch": 1.759420589875849, "grad_norm": 0.15565697848796844, "learning_rate": 4.135615051982703e-05, "loss": 0.6532, "mean_token_accuracy": 0.8032598085701466, "num_tokens": 610360439.0, "step": 19123 }, { "entropy": 0.6011337926611304, "epoch": 1.7595125962472902, "grad_norm": 0.1546880304813385, "learning_rate": 4.135308369368541e-05, "loss": 0.588, "mean_token_accuracy": 0.8158554844558239, "num_tokens": 610391966.0, "step": 19124 }, { "entropy": 0.5406528036110103, "epoch": 1.7596046026187313, "grad_norm": 0.14561140537261963, "learning_rate": 4.135001686754378e-05, "loss": 0.524, "mean_token_accuracy": 0.8430426307022572, "num_tokens": 610424446.0, "step": 19125 }, { "entropy": 0.6071658153086901, "epoch": 1.7596966089901724, "grad_norm": 0.14887595176696777, "learning_rate": 4.1346950041402156e-05, "loss": 0.596, "mean_token_accuracy": 0.8194962181150913, "num_tokens": 610456299.0, "step": 19126 }, { "entropy": 0.5380248948931694, "epoch": 1.7597886153616138, "grad_norm": 0.14551471173763275, "learning_rate": 4.134388321526053e-05, "loss": 0.5253, "mean_token_accuracy": 0.8357577584683895, "num_tokens": 610488094.0, "step": 19127 }, { "entropy": 0.6367363166064024, "epoch": 1.7598806217330552, "grad_norm": 0.15298675000667572, "learning_rate": 4.1340816389118906e-05, "loss": 0.6232, "mean_token_accuracy": 0.8093093410134315, "num_tokens": 610520633.0, "step": 19128 }, { "entropy": 0.5690097929909825, "epoch": 1.7599726281044963, "grad_norm": 0.15206223726272583, "learning_rate": 4.133774956297728e-05, "loss": 0.5561, "mean_token_accuracy": 0.8286900036036968, "num_tokens": 610552991.0, "step": 19129 }, { "entropy": 0.7178013678640127, "epoch": 1.7600646344759374, "grad_norm": 0.16528339684009552, "learning_rate": 4.133468273683565e-05, "loss": 0.6994, "mean_token_accuracy": 0.7880042158067226, "num_tokens": 610584376.0, "step": 19130 }, { "entropy": 0.650084376335144, "epoch": 1.7601566408473786, "grad_norm": 0.1579996645450592, "learning_rate": 4.133161591069403e-05, "loss": 0.6522, "mean_token_accuracy": 0.8028866574168205, "num_tokens": 610616704.0, "step": 19131 }, { "entropy": 0.6379134124144912, "epoch": 1.76024864721882, "grad_norm": 0.15945346653461456, "learning_rate": 4.13285490845524e-05, "loss": 0.618, "mean_token_accuracy": 0.8110391348600388, "num_tokens": 610648132.0, "step": 19132 }, { "entropy": 0.537617146037519, "epoch": 1.7603406535902613, "grad_norm": 0.15009084343910217, "learning_rate": 4.132548225841077e-05, "loss": 0.5266, "mean_token_accuracy": 0.8418445140123367, "num_tokens": 610680182.0, "step": 19133 }, { "entropy": 0.61588220205158, "epoch": 1.7604326599617024, "grad_norm": 0.1523984670639038, "learning_rate": 4.132241543226915e-05, "loss": 0.6083, "mean_token_accuracy": 0.8104044198989868, "num_tokens": 610712278.0, "step": 19134 }, { "entropy": 0.5208516214042902, "epoch": 1.7605246663331435, "grad_norm": 0.14899803698062897, "learning_rate": 4.131934860612752e-05, "loss": 0.5024, "mean_token_accuracy": 0.8427783250808716, "num_tokens": 610743617.0, "step": 19135 }, { "entropy": 0.6813563741743565, "epoch": 1.7606166727045847, "grad_norm": 0.16153071820735931, "learning_rate": 4.1316281779985896e-05, "loss": 0.6714, "mean_token_accuracy": 0.796801570802927, "num_tokens": 610775773.0, "step": 19136 }, { "entropy": 0.5313835171982646, "epoch": 1.760708679076026, "grad_norm": 0.15499576926231384, "learning_rate": 4.131321495384427e-05, "loss": 0.5128, "mean_token_accuracy": 0.8403392471373081, "num_tokens": 610807502.0, "step": 19137 }, { "entropy": 0.62526033539325, "epoch": 1.7608006854474674, "grad_norm": 0.15747323632240295, "learning_rate": 4.131014812770264e-05, "loss": 0.6187, "mean_token_accuracy": 0.8074978925287724, "num_tokens": 610839499.0, "step": 19138 }, { "entropy": 0.5931365694850683, "epoch": 1.7608926918189085, "grad_norm": 0.1554892659187317, "learning_rate": 4.130708130156102e-05, "loss": 0.5918, "mean_token_accuracy": 0.8209166415035725, "num_tokens": 610871674.0, "step": 19139 }, { "entropy": 0.5839841030538082, "epoch": 1.7609846981903496, "grad_norm": 0.15105965733528137, "learning_rate": 4.130401447541939e-05, "loss": 0.5692, "mean_token_accuracy": 0.8211916871368885, "num_tokens": 610903808.0, "step": 19140 }, { "entropy": 0.6160612776875496, "epoch": 1.7610767045617908, "grad_norm": 0.1596289575099945, "learning_rate": 4.130094764927777e-05, "loss": 0.61, "mean_token_accuracy": 0.8175734356045723, "num_tokens": 610935056.0, "step": 19141 }, { "entropy": 0.6466558650135994, "epoch": 1.7611687109332321, "grad_norm": 0.15791499614715576, "learning_rate": 4.129788082313614e-05, "loss": 0.6324, "mean_token_accuracy": 0.8074085041880608, "num_tokens": 610967450.0, "step": 19142 }, { "entropy": 0.6611157041043043, "epoch": 1.7612607173046735, "grad_norm": 0.16155603528022766, "learning_rate": 4.129481399699451e-05, "loss": 0.6611, "mean_token_accuracy": 0.7990453168749809, "num_tokens": 611000074.0, "step": 19143 }, { "entropy": 0.5196818104013801, "epoch": 1.7613527236761146, "grad_norm": 0.1498953253030777, "learning_rate": 4.1291747170852886e-05, "loss": 0.5069, "mean_token_accuracy": 0.84070635586977, "num_tokens": 611032098.0, "step": 19144 }, { "entropy": 0.6706633046269417, "epoch": 1.7614447300475558, "grad_norm": 0.16466142237186432, "learning_rate": 4.128868034471126e-05, "loss": 0.6697, "mean_token_accuracy": 0.8002796247601509, "num_tokens": 611064263.0, "step": 19145 }, { "entropy": 0.5621722596697509, "epoch": 1.7615367364189969, "grad_norm": 0.14897605776786804, "learning_rate": 4.1285613518569636e-05, "loss": 0.5587, "mean_token_accuracy": 0.8312661498785019, "num_tokens": 611096690.0, "step": 19146 }, { "entropy": 0.6426506259012967, "epoch": 1.7616287427904382, "grad_norm": 0.1611117571592331, "learning_rate": 4.128254669242801e-05, "loss": 0.6391, "mean_token_accuracy": 0.8061103820800781, "num_tokens": 611127730.0, "step": 19147 }, { "entropy": 0.5806536916643381, "epoch": 1.7617207491618796, "grad_norm": 0.15119972825050354, "learning_rate": 4.127947986628638e-05, "loss": 0.5796, "mean_token_accuracy": 0.8237042687833309, "num_tokens": 611159595.0, "step": 19148 }, { "entropy": 0.591741381213069, "epoch": 1.7618127555333207, "grad_norm": 0.1577240526676178, "learning_rate": 4.127641304014476e-05, "loss": 0.5716, "mean_token_accuracy": 0.8227860853075981, "num_tokens": 611190609.0, "step": 19149 }, { "entropy": 0.6027887407690287, "epoch": 1.7619047619047619, "grad_norm": 0.15385758876800537, "learning_rate": 4.127334621400313e-05, "loss": 0.6027, "mean_token_accuracy": 0.8175178840756416, "num_tokens": 611222797.0, "step": 19150 }, { "entropy": 0.6025541350245476, "epoch": 1.761996768276203, "grad_norm": 0.15234768390655518, "learning_rate": 4.12702793878615e-05, "loss": 0.5991, "mean_token_accuracy": 0.8174135722219944, "num_tokens": 611255132.0, "step": 19151 }, { "entropy": 0.5911812502890825, "epoch": 1.7620887746476444, "grad_norm": 0.15163956582546234, "learning_rate": 4.126721256171988e-05, "loss": 0.5831, "mean_token_accuracy": 0.8194975256919861, "num_tokens": 611286648.0, "step": 19152 }, { "entropy": 0.5764160882681608, "epoch": 1.7621807810190857, "grad_norm": 0.151494562625885, "learning_rate": 4.126414573557825e-05, "loss": 0.5595, "mean_token_accuracy": 0.8279771506786346, "num_tokens": 611317995.0, "step": 19153 }, { "entropy": 0.6929999887943268, "epoch": 1.7622727873905268, "grad_norm": 0.1633455753326416, "learning_rate": 4.1261078909436626e-05, "loss": 0.6983, "mean_token_accuracy": 0.7877116836607456, "num_tokens": 611350457.0, "step": 19154 }, { "entropy": 0.5559319402091205, "epoch": 1.762364793761968, "grad_norm": 0.15277917683124542, "learning_rate": 4.1258012083295e-05, "loss": 0.5456, "mean_token_accuracy": 0.8307423740625381, "num_tokens": 611382833.0, "step": 19155 }, { "entropy": 0.5561770722270012, "epoch": 1.762456800133409, "grad_norm": 0.1462421864271164, "learning_rate": 4.125494525715337e-05, "loss": 0.5423, "mean_token_accuracy": 0.8337363414466381, "num_tokens": 611415043.0, "step": 19156 }, { "entropy": 0.5710400706157088, "epoch": 1.7625488065048505, "grad_norm": 0.15664449334144592, "learning_rate": 4.125187843101175e-05, "loss": 0.5699, "mean_token_accuracy": 0.8238530643284321, "num_tokens": 611446898.0, "step": 19157 }, { "entropy": 0.5984462536871433, "epoch": 1.7626408128762918, "grad_norm": 0.1554669290781021, "learning_rate": 4.1248811604870125e-05, "loss": 0.5716, "mean_token_accuracy": 0.8199938870966434, "num_tokens": 611478302.0, "step": 19158 }, { "entropy": 0.5083274962380528, "epoch": 1.762732819247733, "grad_norm": 0.14244532585144043, "learning_rate": 4.124574477872849e-05, "loss": 0.4999, "mean_token_accuracy": 0.8436707444489002, "num_tokens": 611509951.0, "step": 19159 }, { "entropy": 0.6781518496572971, "epoch": 1.762824825619174, "grad_norm": 0.15557977557182312, "learning_rate": 4.1242677952586874e-05, "loss": 0.6607, "mean_token_accuracy": 0.8021545708179474, "num_tokens": 611542128.0, "step": 19160 }, { "entropy": 0.48110597394406796, "epoch": 1.7629168319906152, "grad_norm": 0.139712855219841, "learning_rate": 4.123961112644524e-05, "loss": 0.46, "mean_token_accuracy": 0.8531520627439022, "num_tokens": 611573975.0, "step": 19161 }, { "entropy": 0.5327544333413243, "epoch": 1.7630088383620566, "grad_norm": 0.16122864186763763, "learning_rate": 4.123654430030362e-05, "loss": 0.5189, "mean_token_accuracy": 0.8387136571109295, "num_tokens": 611606434.0, "step": 19162 }, { "entropy": 0.5933559006080031, "epoch": 1.763100844733498, "grad_norm": 0.155628964304924, "learning_rate": 4.123347747416199e-05, "loss": 0.5904, "mean_token_accuracy": 0.8183843456208706, "num_tokens": 611638242.0, "step": 19163 }, { "entropy": 0.5283039603382349, "epoch": 1.763192851104939, "grad_norm": 0.14898823201656342, "learning_rate": 4.1230410648020366e-05, "loss": 0.518, "mean_token_accuracy": 0.8410684317350388, "num_tokens": 611670062.0, "step": 19164 }, { "entropy": 0.7304014395922422, "epoch": 1.7632848574763802, "grad_norm": 0.16979648172855377, "learning_rate": 4.122734382187874e-05, "loss": 0.7243, "mean_token_accuracy": 0.7828702330589294, "num_tokens": 611701719.0, "step": 19165 }, { "entropy": 0.604650741443038, "epoch": 1.7633768638478213, "grad_norm": 0.15274475514888763, "learning_rate": 4.1224276995737115e-05, "loss": 0.5955, "mean_token_accuracy": 0.817396555095911, "num_tokens": 611733632.0, "step": 19166 }, { "entropy": 0.6098520741797984, "epoch": 1.7634688702192627, "grad_norm": 0.15884236991405487, "learning_rate": 4.122121016959549e-05, "loss": 0.5995, "mean_token_accuracy": 0.8175870291888714, "num_tokens": 611765329.0, "step": 19167 }, { "entropy": 0.6251417957246304, "epoch": 1.763560876590704, "grad_norm": 0.15510234236717224, "learning_rate": 4.1218143343453864e-05, "loss": 0.6284, "mean_token_accuracy": 0.808320801705122, "num_tokens": 611797748.0, "step": 19168 }, { "entropy": 0.7005877625197172, "epoch": 1.7636528829621452, "grad_norm": 0.16209222376346588, "learning_rate": 4.121507651731223e-05, "loss": 0.6989, "mean_token_accuracy": 0.7895579002797604, "num_tokens": 611829433.0, "step": 19169 }, { "entropy": 0.6205676356330514, "epoch": 1.7637448893335863, "grad_norm": 0.14991696178913116, "learning_rate": 4.1212009691170614e-05, "loss": 0.6122, "mean_token_accuracy": 0.8132313303649426, "num_tokens": 611861937.0, "step": 19170 }, { "entropy": 0.6652755523100495, "epoch": 1.7638368957050274, "grad_norm": 0.16145539283752441, "learning_rate": 4.120894286502898e-05, "loss": 0.6542, "mean_token_accuracy": 0.7996858283877373, "num_tokens": 611892973.0, "step": 19171 }, { "entropy": 0.5394933559000492, "epoch": 1.7639289020764688, "grad_norm": 0.1472652107477188, "learning_rate": 4.1205876038887356e-05, "loss": 0.5193, "mean_token_accuracy": 0.8372183330357075, "num_tokens": 611924814.0, "step": 19172 }, { "entropy": 0.6549736689776182, "epoch": 1.7640209084479102, "grad_norm": 0.1589881181716919, "learning_rate": 4.120280921274573e-05, "loss": 0.6367, "mean_token_accuracy": 0.8052956163883209, "num_tokens": 611957531.0, "step": 19173 }, { "entropy": 0.6556270066648722, "epoch": 1.7641129148193513, "grad_norm": 0.15771381556987762, "learning_rate": 4.1199742386604105e-05, "loss": 0.6518, "mean_token_accuracy": 0.7993382550776005, "num_tokens": 611988917.0, "step": 19174 }, { "entropy": 0.6275620926171541, "epoch": 1.7642049211907924, "grad_norm": 0.15537023544311523, "learning_rate": 4.119667556046248e-05, "loss": 0.6241, "mean_token_accuracy": 0.8095750324428082, "num_tokens": 612020796.0, "step": 19175 }, { "entropy": 0.6944689210504293, "epoch": 1.7642969275622336, "grad_norm": 0.15271122753620148, "learning_rate": 4.1193608734320855e-05, "loss": 0.6717, "mean_token_accuracy": 0.7928572632372379, "num_tokens": 612052590.0, "step": 19176 }, { "entropy": 0.6964299697428942, "epoch": 1.764388933933675, "grad_norm": 0.16089005768299103, "learning_rate": 4.119054190817922e-05, "loss": 0.6854, "mean_token_accuracy": 0.7954432144761086, "num_tokens": 612084446.0, "step": 19177 }, { "entropy": 0.5587370633147657, "epoch": 1.7644809403051163, "grad_norm": 0.14824846386909485, "learning_rate": 4.1187475082037604e-05, "loss": 0.5431, "mean_token_accuracy": 0.8334801718592644, "num_tokens": 612116426.0, "step": 19178 }, { "entropy": 0.6977652478963137, "epoch": 1.7645729466765574, "grad_norm": 0.16406656801700592, "learning_rate": 4.118440825589597e-05, "loss": 0.6846, "mean_token_accuracy": 0.7915931046009064, "num_tokens": 612147913.0, "step": 19179 }, { "entropy": 0.6451562200672925, "epoch": 1.7646649530479985, "grad_norm": 0.15872453153133392, "learning_rate": 4.1181341429754347e-05, "loss": 0.6288, "mean_token_accuracy": 0.8062588609755039, "num_tokens": 612179839.0, "step": 19180 }, { "entropy": 0.6426993263885379, "epoch": 1.7647569594194397, "grad_norm": 0.15637674927711487, "learning_rate": 4.117827460361272e-05, "loss": 0.6378, "mean_token_accuracy": 0.808086697012186, "num_tokens": 612212264.0, "step": 19181 }, { "entropy": 0.5319612640887499, "epoch": 1.764848965790881, "grad_norm": 0.1424800604581833, "learning_rate": 4.1175207777471096e-05, "loss": 0.5175, "mean_token_accuracy": 0.8377645537257195, "num_tokens": 612244681.0, "step": 19182 }, { "entropy": 0.5440970230847597, "epoch": 1.7649409721623224, "grad_norm": 0.15067867934703827, "learning_rate": 4.117214095132947e-05, "loss": 0.5479, "mean_token_accuracy": 0.8287228532135487, "num_tokens": 612277404.0, "step": 19183 }, { "entropy": 0.5893942681141198, "epoch": 1.7650329785337635, "grad_norm": 0.1621224582195282, "learning_rate": 4.1169074125187845e-05, "loss": 0.5894, "mean_token_accuracy": 0.8239320516586304, "num_tokens": 612309607.0, "step": 19184 }, { "entropy": 0.6771736536175013, "epoch": 1.7651249849052046, "grad_norm": 0.16178399324417114, "learning_rate": 4.116600729904622e-05, "loss": 0.6662, "mean_token_accuracy": 0.7966158427298069, "num_tokens": 612341298.0, "step": 19185 }, { "entropy": 0.5988347232341766, "epoch": 1.7652169912766458, "grad_norm": 0.16297326982021332, "learning_rate": 4.1162940472904594e-05, "loss": 0.5813, "mean_token_accuracy": 0.8219203278422356, "num_tokens": 612372701.0, "step": 19186 }, { "entropy": 0.5650125369429588, "epoch": 1.7653089976480871, "grad_norm": 0.15358398854732513, "learning_rate": 4.115987364676297e-05, "loss": 0.5516, "mean_token_accuracy": 0.8312968090176582, "num_tokens": 612403928.0, "step": 19187 }, { "entropy": 0.58233388280496, "epoch": 1.7654010040195285, "grad_norm": 0.1493379771709442, "learning_rate": 4.1156806820621344e-05, "loss": 0.5747, "mean_token_accuracy": 0.823033019900322, "num_tokens": 612436290.0, "step": 19188 }, { "entropy": 0.6060700691305101, "epoch": 1.7654930103909696, "grad_norm": 0.15038272738456726, "learning_rate": 4.115373999447972e-05, "loss": 0.5936, "mean_token_accuracy": 0.8185318410396576, "num_tokens": 612467971.0, "step": 19189 }, { "entropy": 0.584547583013773, "epoch": 1.7655850167624108, "grad_norm": 0.15051482617855072, "learning_rate": 4.1150673168338086e-05, "loss": 0.5731, "mean_token_accuracy": 0.8226565420627594, "num_tokens": 612500011.0, "step": 19190 }, { "entropy": 0.49093507416546345, "epoch": 1.7656770231338519, "grad_norm": 0.14031092822551727, "learning_rate": 4.114760634219647e-05, "loss": 0.4723, "mean_token_accuracy": 0.8537493459880352, "num_tokens": 612532254.0, "step": 19191 }, { "entropy": 0.5708145136013627, "epoch": 1.7657690295052932, "grad_norm": 0.15831811726093292, "learning_rate": 4.1144539516054836e-05, "loss": 0.5617, "mean_token_accuracy": 0.8269103057682514, "num_tokens": 612564535.0, "step": 19192 }, { "entropy": 0.6815436836332083, "epoch": 1.7658610358767346, "grad_norm": 0.1636464148759842, "learning_rate": 4.114147268991321e-05, "loss": 0.6864, "mean_token_accuracy": 0.7955589704215527, "num_tokens": 612596635.0, "step": 19193 }, { "entropy": 0.6643506921827793, "epoch": 1.7659530422481757, "grad_norm": 0.16068604588508606, "learning_rate": 4.1138405863771585e-05, "loss": 0.6512, "mean_token_accuracy": 0.7999295145273209, "num_tokens": 612628661.0, "step": 19194 }, { "entropy": 0.597972322255373, "epoch": 1.7660450486196169, "grad_norm": 0.15599748492240906, "learning_rate": 4.113533903762996e-05, "loss": 0.5886, "mean_token_accuracy": 0.8145229443907738, "num_tokens": 612660618.0, "step": 19195 }, { "entropy": 0.7041512168943882, "epoch": 1.766137054991058, "grad_norm": 0.16372215747833252, "learning_rate": 4.1132272211488334e-05, "loss": 0.6944, "mean_token_accuracy": 0.786935456097126, "num_tokens": 612691357.0, "step": 19196 }, { "entropy": 0.6569698192179203, "epoch": 1.7662290613624994, "grad_norm": 0.15615881979465485, "learning_rate": 4.112920538534671e-05, "loss": 0.645, "mean_token_accuracy": 0.8027772307395935, "num_tokens": 612723057.0, "step": 19197 }, { "entropy": 0.6653582733124495, "epoch": 1.7663210677339407, "grad_norm": 0.1547240912914276, "learning_rate": 4.112613855920508e-05, "loss": 0.6474, "mean_token_accuracy": 0.7987943142652512, "num_tokens": 612754944.0, "step": 19198 }, { "entropy": 0.6584567204117775, "epoch": 1.7664130741053818, "grad_norm": 0.15373334288597107, "learning_rate": 4.112307173306346e-05, "loss": 0.6436, "mean_token_accuracy": 0.8049040734767914, "num_tokens": 612787240.0, "step": 19199 }, { "entropy": 0.5772416233085096, "epoch": 1.766505080476823, "grad_norm": 0.15283511579036713, "learning_rate": 4.1120004906921826e-05, "loss": 0.5713, "mean_token_accuracy": 0.8257986009120941, "num_tokens": 612818988.0, "step": 19200 }, { "entropy": 0.7396116517484188, "epoch": 1.766597086848264, "grad_norm": 0.16587196290493011, "learning_rate": 4.111693808078021e-05, "loss": 0.7277, "mean_token_accuracy": 0.7741243503987789, "num_tokens": 612849846.0, "step": 19201 }, { "entropy": 0.5312547739595175, "epoch": 1.7666890932197055, "grad_norm": 0.15243522822856903, "learning_rate": 4.1113871254638575e-05, "loss": 0.5179, "mean_token_accuracy": 0.8395699672400951, "num_tokens": 612881759.0, "step": 19202 }, { "entropy": 0.4868663512170315, "epoch": 1.7667810995911468, "grad_norm": 0.13997788727283478, "learning_rate": 4.111080442849695e-05, "loss": 0.4698, "mean_token_accuracy": 0.8539500683546066, "num_tokens": 612913415.0, "step": 19203 }, { "entropy": 0.6038715168833733, "epoch": 1.766873105962588, "grad_norm": 0.15790677070617676, "learning_rate": 4.1107737602355325e-05, "loss": 0.5975, "mean_token_accuracy": 0.8130933865904808, "num_tokens": 612944945.0, "step": 19204 }, { "entropy": 0.5236852336674929, "epoch": 1.766965112334029, "grad_norm": 0.15390534698963165, "learning_rate": 4.11046707762137e-05, "loss": 0.5082, "mean_token_accuracy": 0.8422041162848473, "num_tokens": 612976537.0, "step": 19205 }, { "entropy": 0.6147444120142609, "epoch": 1.7670571187054702, "grad_norm": 0.15584279596805573, "learning_rate": 4.1101603950072074e-05, "loss": 0.5962, "mean_token_accuracy": 0.8153346106410027, "num_tokens": 613008252.0, "step": 19206 }, { "entropy": 0.5830676017794758, "epoch": 1.7671491250769116, "grad_norm": 0.15242095291614532, "learning_rate": 4.109853712393045e-05, "loss": 0.5798, "mean_token_accuracy": 0.8180710226297379, "num_tokens": 613040012.0, "step": 19207 }, { "entropy": 0.6660137120634317, "epoch": 1.767241131448353, "grad_norm": 0.1616414487361908, "learning_rate": 4.1095470297788816e-05, "loss": 0.6556, "mean_token_accuracy": 0.80381665751338, "num_tokens": 613071908.0, "step": 19208 }, { "entropy": 0.647943839430809, "epoch": 1.767333137819794, "grad_norm": 0.15778318047523499, "learning_rate": 4.10924034716472e-05, "loss": 0.6326, "mean_token_accuracy": 0.8028069585561752, "num_tokens": 613102781.0, "step": 19209 }, { "entropy": 0.6613576505333185, "epoch": 1.7674251441912352, "grad_norm": 0.16009946167469025, "learning_rate": 4.1089336645505566e-05, "loss": 0.6391, "mean_token_accuracy": 0.801283709704876, "num_tokens": 613134445.0, "step": 19210 }, { "entropy": 0.6342017762362957, "epoch": 1.7675171505626763, "grad_norm": 0.15748904645442963, "learning_rate": 4.108626981936394e-05, "loss": 0.6295, "mean_token_accuracy": 0.8056006841361523, "num_tokens": 613166363.0, "step": 19211 }, { "entropy": 0.7319600200280547, "epoch": 1.7676091569341177, "grad_norm": 0.1599220484495163, "learning_rate": 4.1083202993222315e-05, "loss": 0.7105, "mean_token_accuracy": 0.7827688157558441, "num_tokens": 613198819.0, "step": 19212 }, { "entropy": 0.6649634018540382, "epoch": 1.767701163305559, "grad_norm": 0.16222696006298065, "learning_rate": 4.108013616708069e-05, "loss": 0.6606, "mean_token_accuracy": 0.7985853254795074, "num_tokens": 613230261.0, "step": 19213 }, { "entropy": 0.6927696652710438, "epoch": 1.7677931696770002, "grad_norm": 0.15994097292423248, "learning_rate": 4.1077069340939064e-05, "loss": 0.7, "mean_token_accuracy": 0.7913739122450352, "num_tokens": 613262226.0, "step": 19214 }, { "entropy": 0.6640940671786666, "epoch": 1.7678851760484413, "grad_norm": 0.15710189938545227, "learning_rate": 4.107400251479744e-05, "loss": 0.6612, "mean_token_accuracy": 0.8003752678632736, "num_tokens": 613294662.0, "step": 19215 }, { "entropy": 0.624059647321701, "epoch": 1.7679771824198824, "grad_norm": 0.16316917538642883, "learning_rate": 4.107093568865581e-05, "loss": 0.6204, "mean_token_accuracy": 0.8065422773361206, "num_tokens": 613326624.0, "step": 19216 }, { "entropy": 0.4977406756952405, "epoch": 1.7680691887913238, "grad_norm": 0.15112490952014923, "learning_rate": 4.106786886251419e-05, "loss": 0.4771, "mean_token_accuracy": 0.8521203212440014, "num_tokens": 613358756.0, "step": 19217 }, { "entropy": 0.5051762899383903, "epoch": 1.7681611951627652, "grad_norm": 0.14859512448310852, "learning_rate": 4.106480203637256e-05, "loss": 0.4956, "mean_token_accuracy": 0.8457594811916351, "num_tokens": 613391265.0, "step": 19218 }, { "entropy": 0.5600707130506635, "epoch": 1.7682532015342063, "grad_norm": 0.14491383731365204, "learning_rate": 4.106173521023093e-05, "loss": 0.5493, "mean_token_accuracy": 0.834351684898138, "num_tokens": 613423720.0, "step": 19219 }, { "entropy": 0.6166912317276001, "epoch": 1.7683452079056474, "grad_norm": 0.15454013645648956, "learning_rate": 4.105866838408931e-05, "loss": 0.5981, "mean_token_accuracy": 0.8165423311293125, "num_tokens": 613455496.0, "step": 19220 }, { "entropy": 0.516917790286243, "epoch": 1.7684372142770886, "grad_norm": 0.1455754190683365, "learning_rate": 4.105560155794768e-05, "loss": 0.4941, "mean_token_accuracy": 0.848742064088583, "num_tokens": 613488264.0, "step": 19221 }, { "entropy": 0.5617925338447094, "epoch": 1.76852922064853, "grad_norm": 0.14800000190734863, "learning_rate": 4.105253473180606e-05, "loss": 0.554, "mean_token_accuracy": 0.8294927999377251, "num_tokens": 613520521.0, "step": 19222 }, { "entropy": 0.7467650659382343, "epoch": 1.7686212270199713, "grad_norm": 0.16128678619861603, "learning_rate": 4.104946790566443e-05, "loss": 0.7356, "mean_token_accuracy": 0.7772736214101315, "num_tokens": 613552825.0, "step": 19223 }, { "entropy": 0.5852450388483703, "epoch": 1.7687132333914124, "grad_norm": 0.15685437619686127, "learning_rate": 4.1046401079522804e-05, "loss": 0.571, "mean_token_accuracy": 0.8226759620010853, "num_tokens": 613584682.0, "step": 19224 }, { "entropy": 0.5018087504431605, "epoch": 1.7688052397628535, "grad_norm": 0.15158390998840332, "learning_rate": 4.104333425338118e-05, "loss": 0.4861, "mean_token_accuracy": 0.8491310216486454, "num_tokens": 613617349.0, "step": 19225 }, { "entropy": 0.5127664878964424, "epoch": 1.7688972461342947, "grad_norm": 0.1463548243045807, "learning_rate": 4.104026742723955e-05, "loss": 0.4956, "mean_token_accuracy": 0.8431496061384678, "num_tokens": 613649663.0, "step": 19226 }, { "entropy": 0.5489731756970286, "epoch": 1.768989252505736, "grad_norm": 0.14355657994747162, "learning_rate": 4.103720060109793e-05, "loss": 0.5449, "mean_token_accuracy": 0.8319962956011295, "num_tokens": 613681828.0, "step": 19227 }, { "entropy": 0.48932841094210744, "epoch": 1.7690812588771774, "grad_norm": 0.14068526029586792, "learning_rate": 4.10341337749563e-05, "loss": 0.4802, "mean_token_accuracy": 0.8530670627951622, "num_tokens": 613713843.0, "step": 19228 }, { "entropy": 0.5752556985244155, "epoch": 1.7691732652486185, "grad_norm": 0.15058720111846924, "learning_rate": 4.103106694881467e-05, "loss": 0.5593, "mean_token_accuracy": 0.8237934745848179, "num_tokens": 613745986.0, "step": 19229 }, { "entropy": 0.5746751371771097, "epoch": 1.7692652716200596, "grad_norm": 0.14790652692317963, "learning_rate": 4.102800012267305e-05, "loss": 0.5623, "mean_token_accuracy": 0.8285114616155624, "num_tokens": 613778202.0, "step": 19230 }, { "entropy": 0.5853431662544608, "epoch": 1.7693572779915008, "grad_norm": 0.1517871618270874, "learning_rate": 4.102493329653142e-05, "loss": 0.5637, "mean_token_accuracy": 0.8270026929676533, "num_tokens": 613810264.0, "step": 19231 }, { "entropy": 0.6373228766024113, "epoch": 1.7694492843629421, "grad_norm": 0.15460379421710968, "learning_rate": 4.1021866470389794e-05, "loss": 0.6217, "mean_token_accuracy": 0.8092655427753925, "num_tokens": 613841964.0, "step": 19232 }, { "entropy": 0.6522016916424036, "epoch": 1.7695412907343835, "grad_norm": 0.1603693664073944, "learning_rate": 4.101879964424817e-05, "loss": 0.64, "mean_token_accuracy": 0.8038547597825527, "num_tokens": 613873785.0, "step": 19233 }, { "entropy": 0.5505627859383821, "epoch": 1.7696332971058246, "grad_norm": 0.1435912698507309, "learning_rate": 4.1015732818106544e-05, "loss": 0.5296, "mean_token_accuracy": 0.8352420218288898, "num_tokens": 613906256.0, "step": 19234 }, { "entropy": 0.5797744551673532, "epoch": 1.7697253034772658, "grad_norm": 0.14988000690937042, "learning_rate": 4.101266599196492e-05, "loss": 0.5716, "mean_token_accuracy": 0.8252931162714958, "num_tokens": 613939024.0, "step": 19235 }, { "entropy": 0.5812291651964188, "epoch": 1.7698173098487069, "grad_norm": 0.14814947545528412, "learning_rate": 4.100959916582329e-05, "loss": 0.5683, "mean_token_accuracy": 0.8275147676467896, "num_tokens": 613970332.0, "step": 19236 }, { "entropy": 0.5363809112459421, "epoch": 1.7699093162201482, "grad_norm": 0.14813244342803955, "learning_rate": 4.100653233968166e-05, "loss": 0.526, "mean_token_accuracy": 0.8355163224041462, "num_tokens": 614001764.0, "step": 19237 }, { "entropy": 0.5935838592704386, "epoch": 1.7700013225915896, "grad_norm": 0.1473783552646637, "learning_rate": 4.100346551354004e-05, "loss": 0.5821, "mean_token_accuracy": 0.8239375874400139, "num_tokens": 614033926.0, "step": 19238 }, { "entropy": 0.6300501395016909, "epoch": 1.7700933289630307, "grad_norm": 0.1585536152124405, "learning_rate": 4.100039868739841e-05, "loss": 0.6207, "mean_token_accuracy": 0.8087001033127308, "num_tokens": 614065725.0, "step": 19239 }, { "entropy": 0.6292230729013681, "epoch": 1.7701853353344719, "grad_norm": 0.15163928270339966, "learning_rate": 4.0997331861256785e-05, "loss": 0.6312, "mean_token_accuracy": 0.805448018014431, "num_tokens": 614097995.0, "step": 19240 }, { "entropy": 0.4761274876073003, "epoch": 1.770277341705913, "grad_norm": 0.15190772712230682, "learning_rate": 4.099426503511516e-05, "loss": 0.4861, "mean_token_accuracy": 0.8489442989230156, "num_tokens": 614130255.0, "step": 19241 }, { "entropy": 0.596309594810009, "epoch": 1.7703693480773544, "grad_norm": 0.15453693270683289, "learning_rate": 4.0991198208973534e-05, "loss": 0.593, "mean_token_accuracy": 0.8171074539422989, "num_tokens": 614162275.0, "step": 19242 }, { "entropy": 0.6062624510377645, "epoch": 1.7704613544487957, "grad_norm": 0.15042123198509216, "learning_rate": 4.098813138283191e-05, "loss": 0.5973, "mean_token_accuracy": 0.8160581775009632, "num_tokens": 614194336.0, "step": 19243 }, { "entropy": 0.6170411026105285, "epoch": 1.7705533608202368, "grad_norm": 0.16306810081005096, "learning_rate": 4.098506455669028e-05, "loss": 0.6112, "mean_token_accuracy": 0.8114476650953293, "num_tokens": 614226131.0, "step": 19244 }, { "entropy": 0.6715835174545646, "epoch": 1.770645367191678, "grad_norm": 0.15403054654598236, "learning_rate": 4.098199773054866e-05, "loss": 0.6677, "mean_token_accuracy": 0.7957676947116852, "num_tokens": 614258484.0, "step": 19245 }, { "entropy": 0.5017677322030067, "epoch": 1.770737373563119, "grad_norm": 0.14014193415641785, "learning_rate": 4.097893090440703e-05, "loss": 0.4975, "mean_token_accuracy": 0.8447137512266636, "num_tokens": 614290851.0, "step": 19246 }, { "entropy": 0.4246373677160591, "epoch": 1.7708293799345605, "grad_norm": 0.14434726536273956, "learning_rate": 4.09758640782654e-05, "loss": 0.3993, "mean_token_accuracy": 0.8747029043734074, "num_tokens": 614322371.0, "step": 19247 }, { "entropy": 0.5987805724143982, "epoch": 1.7709213863060018, "grad_norm": 0.1544717699289322, "learning_rate": 4.097279725212378e-05, "loss": 0.5768, "mean_token_accuracy": 0.8221237808465958, "num_tokens": 614354238.0, "step": 19248 }, { "entropy": 0.5826413612812757, "epoch": 1.771013392677443, "grad_norm": 0.15378357470035553, "learning_rate": 4.0969730425982157e-05, "loss": 0.5695, "mean_token_accuracy": 0.8256261087954044, "num_tokens": 614385917.0, "step": 19249 }, { "entropy": 0.6686650961637497, "epoch": 1.771105399048884, "grad_norm": 0.1550590842962265, "learning_rate": 4.0966663599840524e-05, "loss": 0.653, "mean_token_accuracy": 0.8013434410095215, "num_tokens": 614417508.0, "step": 19250 }, { "entropy": 0.6400720837991685, "epoch": 1.7711974054203252, "grad_norm": 0.15004406869411469, "learning_rate": 4.0963596773698906e-05, "loss": 0.6088, "mean_token_accuracy": 0.8123033046722412, "num_tokens": 614449529.0, "step": 19251 }, { "entropy": 0.6340414471924305, "epoch": 1.7712894117917666, "grad_norm": 0.15262524783611298, "learning_rate": 4.0960529947557274e-05, "loss": 0.6214, "mean_token_accuracy": 0.8110571391880512, "num_tokens": 614481984.0, "step": 19252 }, { "entropy": 0.5904355207458138, "epoch": 1.771381418163208, "grad_norm": 0.16100113093852997, "learning_rate": 4.095746312141565e-05, "loss": 0.5659, "mean_token_accuracy": 0.825705710798502, "num_tokens": 614513449.0, "step": 19253 }, { "entropy": 0.6967086745426059, "epoch": 1.771473424534649, "grad_norm": 0.15873633325099945, "learning_rate": 4.095439629527402e-05, "loss": 0.6905, "mean_token_accuracy": 0.785109456628561, "num_tokens": 614545420.0, "step": 19254 }, { "entropy": 0.6226256396621466, "epoch": 1.7715654309060902, "grad_norm": 0.15477943420410156, "learning_rate": 4.09513294691324e-05, "loss": 0.6, "mean_token_accuracy": 0.8157532624900341, "num_tokens": 614577819.0, "step": 19255 }, { "entropy": 0.5425547789782286, "epoch": 1.7716574372775313, "grad_norm": 0.14749523997306824, "learning_rate": 4.094826264299077e-05, "loss": 0.5305, "mean_token_accuracy": 0.8344622328877449, "num_tokens": 614609444.0, "step": 19256 }, { "entropy": 0.710570496506989, "epoch": 1.7717494436489727, "grad_norm": 0.16250912845134735, "learning_rate": 4.094519581684915e-05, "loss": 0.7042, "mean_token_accuracy": 0.7885507829487324, "num_tokens": 614640826.0, "step": 19257 }, { "entropy": 0.633452967274934, "epoch": 1.771841450020414, "grad_norm": 0.1599225401878357, "learning_rate": 4.0942128990707515e-05, "loss": 0.6224, "mean_token_accuracy": 0.8084648102521896, "num_tokens": 614672846.0, "step": 19258 }, { "entropy": 0.6455473778769374, "epoch": 1.7719334563918552, "grad_norm": 0.16361160576343536, "learning_rate": 4.0939062164565896e-05, "loss": 0.646, "mean_token_accuracy": 0.8020756095647812, "num_tokens": 614703929.0, "step": 19259 }, { "entropy": 0.6825797092169523, "epoch": 1.7720254627632963, "grad_norm": 0.15818513929843903, "learning_rate": 4.0935995338424264e-05, "loss": 0.6783, "mean_token_accuracy": 0.7932658270001411, "num_tokens": 614736058.0, "step": 19260 }, { "entropy": 0.7082426119595766, "epoch": 1.7721174691347374, "grad_norm": 0.16779285669326782, "learning_rate": 4.0932928512282646e-05, "loss": 0.7017, "mean_token_accuracy": 0.786484457552433, "num_tokens": 614767105.0, "step": 19261 }, { "entropy": 0.6212917976081371, "epoch": 1.7722094755061788, "grad_norm": 0.15517282485961914, "learning_rate": 4.0929861686141013e-05, "loss": 0.6115, "mean_token_accuracy": 0.8127920888364315, "num_tokens": 614799274.0, "step": 19262 }, { "entropy": 0.5589230298064649, "epoch": 1.7723014818776202, "grad_norm": 0.15417544543743134, "learning_rate": 4.092679485999939e-05, "loss": 0.5436, "mean_token_accuracy": 0.830602154135704, "num_tokens": 614831196.0, "step": 19263 }, { "entropy": 0.49504078226163983, "epoch": 1.7723934882490613, "grad_norm": 0.1544865220785141, "learning_rate": 4.092372803385776e-05, "loss": 0.4867, "mean_token_accuracy": 0.8472822308540344, "num_tokens": 614863231.0, "step": 19264 }, { "entropy": 0.6075216885656118, "epoch": 1.7724854946205024, "grad_norm": 0.15804414451122284, "learning_rate": 4.092066120771614e-05, "loss": 0.5983, "mean_token_accuracy": 0.8130542524158955, "num_tokens": 614895833.0, "step": 19265 }, { "entropy": 0.6398003753274679, "epoch": 1.7725775009919436, "grad_norm": 0.15683691203594208, "learning_rate": 4.091759438157451e-05, "loss": 0.6361, "mean_token_accuracy": 0.8049778863787651, "num_tokens": 614927827.0, "step": 19266 }, { "entropy": 0.7305775918066502, "epoch": 1.772669507363385, "grad_norm": 0.1701153665781021, "learning_rate": 4.091452755543289e-05, "loss": 0.7386, "mean_token_accuracy": 0.7758681252598763, "num_tokens": 614958937.0, "step": 19267 }, { "entropy": 0.5097410895396024, "epoch": 1.7727615137348263, "grad_norm": 0.1509188413619995, "learning_rate": 4.0911460729291255e-05, "loss": 0.51, "mean_token_accuracy": 0.8446149341762066, "num_tokens": 614991560.0, "step": 19268 }, { "entropy": 0.6032358296215534, "epoch": 1.7728535201062674, "grad_norm": 0.1636064052581787, "learning_rate": 4.0908393903149636e-05, "loss": 0.5999, "mean_token_accuracy": 0.8192426785826683, "num_tokens": 615023448.0, "step": 19269 }, { "entropy": 0.5235235430300236, "epoch": 1.7729455264777085, "grad_norm": 0.14119073748588562, "learning_rate": 4.0905327077008004e-05, "loss": 0.508, "mean_token_accuracy": 0.8439401425421238, "num_tokens": 615055997.0, "step": 19270 }, { "entropy": 0.5731991920620203, "epoch": 1.7730375328491497, "grad_norm": 0.14923176169395447, "learning_rate": 4.090226025086638e-05, "loss": 0.5567, "mean_token_accuracy": 0.8263181671500206, "num_tokens": 615087816.0, "step": 19271 }, { "entropy": 0.49045774806290865, "epoch": 1.773129539220591, "grad_norm": 0.14367108047008514, "learning_rate": 4.089919342472475e-05, "loss": 0.4749, "mean_token_accuracy": 0.8542164228856564, "num_tokens": 615120373.0, "step": 19272 }, { "entropy": 0.5956164430826902, "epoch": 1.7732215455920324, "grad_norm": 0.15529562532901764, "learning_rate": 4.089612659858313e-05, "loss": 0.5891, "mean_token_accuracy": 0.8156051635742188, "num_tokens": 615151927.0, "step": 19273 }, { "entropy": 0.5603784453123808, "epoch": 1.7733135519634735, "grad_norm": 0.15219490230083466, "learning_rate": 4.08930597724415e-05, "loss": 0.5364, "mean_token_accuracy": 0.8329316899180412, "num_tokens": 615184216.0, "step": 19274 }, { "entropy": 0.5484124924987555, "epoch": 1.7734055583349146, "grad_norm": 0.14718136191368103, "learning_rate": 4.088999294629988e-05, "loss": 0.527, "mean_token_accuracy": 0.8342149741947651, "num_tokens": 615216037.0, "step": 19275 }, { "entropy": 0.660651545971632, "epoch": 1.7734975647063558, "grad_norm": 0.1653081476688385, "learning_rate": 4.0886926120158245e-05, "loss": 0.6487, "mean_token_accuracy": 0.8028227351605892, "num_tokens": 615247507.0, "step": 19276 }, { "entropy": 0.6255127815529704, "epoch": 1.7735895710777971, "grad_norm": 0.15169158577919006, "learning_rate": 4.0883859294016626e-05, "loss": 0.6027, "mean_token_accuracy": 0.8113902360200882, "num_tokens": 615279509.0, "step": 19277 }, { "entropy": 0.5887383385561407, "epoch": 1.7736815774492385, "grad_norm": 0.15193606913089752, "learning_rate": 4.0880792467874994e-05, "loss": 0.5781, "mean_token_accuracy": 0.824335440993309, "num_tokens": 615310971.0, "step": 19278 }, { "entropy": 0.6035459199920297, "epoch": 1.7737735838206796, "grad_norm": 0.15156826376914978, "learning_rate": 4.087772564173337e-05, "loss": 0.5961, "mean_token_accuracy": 0.8173638172447681, "num_tokens": 615343494.0, "step": 19279 }, { "entropy": 0.619488675147295, "epoch": 1.7738655901921208, "grad_norm": 0.16087111830711365, "learning_rate": 4.087465881559175e-05, "loss": 0.6177, "mean_token_accuracy": 0.8118380978703499, "num_tokens": 615375180.0, "step": 19280 }, { "entropy": 0.6269407663494349, "epoch": 1.773957596563562, "grad_norm": 0.1552698165178299, "learning_rate": 4.087159198945012e-05, "loss": 0.6231, "mean_token_accuracy": 0.8139290437102318, "num_tokens": 615407773.0, "step": 19281 }, { "entropy": 0.5185138415545225, "epoch": 1.7740496029350032, "grad_norm": 0.14731311798095703, "learning_rate": 4.08685251633085e-05, "loss": 0.5104, "mean_token_accuracy": 0.8404700830578804, "num_tokens": 615439194.0, "step": 19282 }, { "entropy": 0.6771367508918047, "epoch": 1.7741416093064446, "grad_norm": 0.15802522003650665, "learning_rate": 4.086545833716687e-05, "loss": 0.6509, "mean_token_accuracy": 0.8002302087843418, "num_tokens": 615470891.0, "step": 19283 }, { "entropy": 0.5685902638360858, "epoch": 1.7742336156778857, "grad_norm": 0.1526743620634079, "learning_rate": 4.086239151102524e-05, "loss": 0.5713, "mean_token_accuracy": 0.825993325561285, "num_tokens": 615503342.0, "step": 19284 }, { "entropy": 0.585833746008575, "epoch": 1.7743256220493269, "grad_norm": 0.15102869272232056, "learning_rate": 4.085932468488362e-05, "loss": 0.5818, "mean_token_accuracy": 0.825806200504303, "num_tokens": 615535245.0, "step": 19285 }, { "entropy": 0.6255216631107032, "epoch": 1.774417628420768, "grad_norm": 0.1607740819454193, "learning_rate": 4.085625785874199e-05, "loss": 0.6254, "mean_token_accuracy": 0.8081391975283623, "num_tokens": 615566518.0, "step": 19286 }, { "entropy": 0.5412426525726914, "epoch": 1.7745096347922094, "grad_norm": 0.15104465186595917, "learning_rate": 4.0853191032600366e-05, "loss": 0.5351, "mean_token_accuracy": 0.8346518836915493, "num_tokens": 615598732.0, "step": 19287 }, { "entropy": 0.5839775055646896, "epoch": 1.7746016411636507, "grad_norm": 0.1533668041229248, "learning_rate": 4.085012420645874e-05, "loss": 0.5823, "mean_token_accuracy": 0.8228689394891262, "num_tokens": 615631266.0, "step": 19288 }, { "entropy": 0.609574830159545, "epoch": 1.7746936475350918, "grad_norm": 0.15623514354228973, "learning_rate": 4.084705738031711e-05, "loss": 0.5895, "mean_token_accuracy": 0.815965261310339, "num_tokens": 615662791.0, "step": 19289 }, { "entropy": 0.6494690962135792, "epoch": 1.774785653906533, "grad_norm": 0.16264905035495758, "learning_rate": 4.084399055417549e-05, "loss": 0.6499, "mean_token_accuracy": 0.8026752769947052, "num_tokens": 615693914.0, "step": 19290 }, { "entropy": 0.5625622607767582, "epoch": 1.7748776602779741, "grad_norm": 0.14848116040229797, "learning_rate": 4.084092372803386e-05, "loss": 0.5547, "mean_token_accuracy": 0.826312318444252, "num_tokens": 615726476.0, "step": 19291 }, { "entropy": 0.5699272509664297, "epoch": 1.7749696666494155, "grad_norm": 0.15227021276950836, "learning_rate": 4.083785690189223e-05, "loss": 0.5537, "mean_token_accuracy": 0.8305531665682793, "num_tokens": 615758303.0, "step": 19292 }, { "entropy": 0.6337460298091173, "epoch": 1.7750616730208568, "grad_norm": 0.15277022123336792, "learning_rate": 4.083479007575061e-05, "loss": 0.6397, "mean_token_accuracy": 0.8003792315721512, "num_tokens": 615790755.0, "step": 19293 }, { "entropy": 0.6643698289990425, "epoch": 1.775153679392298, "grad_norm": 0.15862002968788147, "learning_rate": 4.083172324960898e-05, "loss": 0.6574, "mean_token_accuracy": 0.8009845204651356, "num_tokens": 615822332.0, "step": 19294 }, { "entropy": 0.7452677078545094, "epoch": 1.775245685763739, "grad_norm": 0.16541458666324615, "learning_rate": 4.0828656423467356e-05, "loss": 0.7265, "mean_token_accuracy": 0.7855896316468716, "num_tokens": 615854092.0, "step": 19295 }, { "entropy": 0.624284740537405, "epoch": 1.7753376921351802, "grad_norm": 0.16162770986557007, "learning_rate": 4.082558959732573e-05, "loss": 0.6185, "mean_token_accuracy": 0.8137671276926994, "num_tokens": 615885805.0, "step": 19296 }, { "entropy": 0.5455516236834228, "epoch": 1.7754296985066216, "grad_norm": 0.1482667773962021, "learning_rate": 4.08225227711841e-05, "loss": 0.5209, "mean_token_accuracy": 0.8378506377339363, "num_tokens": 615917564.0, "step": 19297 }, { "entropy": 0.6088163126260042, "epoch": 1.775521704878063, "grad_norm": 0.1567237675189972, "learning_rate": 4.081945594504248e-05, "loss": 0.605, "mean_token_accuracy": 0.8130179606378078, "num_tokens": 615949236.0, "step": 19298 }, { "entropy": 0.5478186905384064, "epoch": 1.775613711249504, "grad_norm": 0.1543591320514679, "learning_rate": 4.081638911890085e-05, "loss": 0.546, "mean_token_accuracy": 0.8337034806609154, "num_tokens": 615981213.0, "step": 19299 }, { "entropy": 0.5278043425641954, "epoch": 1.7757057176209452, "grad_norm": 0.14809182286262512, "learning_rate": 4.081332229275922e-05, "loss": 0.496, "mean_token_accuracy": 0.8447104841470718, "num_tokens": 616012965.0, "step": 19300 }, { "entropy": 0.6221133787184954, "epoch": 1.7757977239923863, "grad_norm": 0.1546306163072586, "learning_rate": 4.08102554666176e-05, "loss": 0.6189, "mean_token_accuracy": 0.8135264329612255, "num_tokens": 616045535.0, "step": 19301 }, { "entropy": 0.6187393609434366, "epoch": 1.7758897303638277, "grad_norm": 0.1484777331352234, "learning_rate": 4.080718864047597e-05, "loss": 0.6116, "mean_token_accuracy": 0.811452180147171, "num_tokens": 616077808.0, "step": 19302 }, { "entropy": 0.6929229144006968, "epoch": 1.775981736735269, "grad_norm": 0.15995344519615173, "learning_rate": 4.080412181433435e-05, "loss": 0.681, "mean_token_accuracy": 0.7888068668544292, "num_tokens": 616109409.0, "step": 19303 }, { "entropy": 0.545766388066113, "epoch": 1.7760737431067102, "grad_norm": 0.14933086931705475, "learning_rate": 4.080105498819272e-05, "loss": 0.5278, "mean_token_accuracy": 0.8378793336451054, "num_tokens": 616141844.0, "step": 19304 }, { "entropy": 0.5980487503111362, "epoch": 1.7761657494781513, "grad_norm": 0.14993059635162354, "learning_rate": 4.0797988162051096e-05, "loss": 0.5757, "mean_token_accuracy": 0.8222357295453548, "num_tokens": 616173568.0, "step": 19305 }, { "entropy": 0.5136332903057337, "epoch": 1.7762577558495924, "grad_norm": 0.14777567982673645, "learning_rate": 4.079492133590947e-05, "loss": 0.5006, "mean_token_accuracy": 0.8444352000951767, "num_tokens": 616205702.0, "step": 19306 }, { "entropy": 0.6392662795260549, "epoch": 1.7763497622210338, "grad_norm": 0.15649789571762085, "learning_rate": 4.079185450976784e-05, "loss": 0.6349, "mean_token_accuracy": 0.8079506605863571, "num_tokens": 616238470.0, "step": 19307 }, { "entropy": 0.6273494130000472, "epoch": 1.7764417685924752, "grad_norm": 0.1616516262292862, "learning_rate": 4.078878768362622e-05, "loss": 0.6177, "mean_token_accuracy": 0.8102927692234516, "num_tokens": 616270197.0, "step": 19308 }, { "entropy": 0.6099435752257705, "epoch": 1.7765337749639163, "grad_norm": 0.1524585336446762, "learning_rate": 4.0785720857484595e-05, "loss": 0.5922, "mean_token_accuracy": 0.8137170858681202, "num_tokens": 616302254.0, "step": 19309 }, { "entropy": 0.5407339856028557, "epoch": 1.7766257813353574, "grad_norm": 0.14841821789741516, "learning_rate": 4.078265403134296e-05, "loss": 0.5167, "mean_token_accuracy": 0.8366318345069885, "num_tokens": 616334366.0, "step": 19310 }, { "entropy": 0.5834013689309359, "epoch": 1.7767177877067986, "grad_norm": 0.15524983406066895, "learning_rate": 4.0779587205201344e-05, "loss": 0.5756, "mean_token_accuracy": 0.8232226744294167, "num_tokens": 616366136.0, "step": 19311 }, { "entropy": 0.6673464421182871, "epoch": 1.77680979407824, "grad_norm": 0.15686681866645813, "learning_rate": 4.077652037905971e-05, "loss": 0.6597, "mean_token_accuracy": 0.7954033799469471, "num_tokens": 616398127.0, "step": 19312 }, { "entropy": 0.44426987832412124, "epoch": 1.7769018004496813, "grad_norm": 0.14466191828250885, "learning_rate": 4.0773453552918087e-05, "loss": 0.4319, "mean_token_accuracy": 0.8663232326507568, "num_tokens": 616430416.0, "step": 19313 }, { "entropy": 0.6860130317509174, "epoch": 1.7769938068211224, "grad_norm": 0.15881353616714478, "learning_rate": 4.077038672677646e-05, "loss": 0.6858, "mean_token_accuracy": 0.7923532873392105, "num_tokens": 616462223.0, "step": 19314 }, { "entropy": 0.6296082548797131, "epoch": 1.7770858131925635, "grad_norm": 0.15853191912174225, "learning_rate": 4.0767319900634836e-05, "loss": 0.6212, "mean_token_accuracy": 0.8081512823700905, "num_tokens": 616494341.0, "step": 19315 }, { "entropy": 0.6351584941148758, "epoch": 1.7771778195640047, "grad_norm": 0.15808849036693573, "learning_rate": 4.076425307449321e-05, "loss": 0.62, "mean_token_accuracy": 0.8071064464747906, "num_tokens": 616526470.0, "step": 19316 }, { "entropy": 0.5904481131583452, "epoch": 1.777269825935446, "grad_norm": 0.15194171667099, "learning_rate": 4.0761186248351585e-05, "loss": 0.5771, "mean_token_accuracy": 0.8238503150641918, "num_tokens": 616558592.0, "step": 19317 }, { "entropy": 0.7337514329701662, "epoch": 1.7773618323068874, "grad_norm": 0.1618199497461319, "learning_rate": 4.075811942220995e-05, "loss": 0.7139, "mean_token_accuracy": 0.7785102352499962, "num_tokens": 616590083.0, "step": 19318 }, { "entropy": 0.6197800068184733, "epoch": 1.7774538386783285, "grad_norm": 0.15631461143493652, "learning_rate": 4.0755052596068334e-05, "loss": 0.6149, "mean_token_accuracy": 0.8122651875019073, "num_tokens": 616621278.0, "step": 19319 }, { "entropy": 0.5078245913609862, "epoch": 1.7775458450497696, "grad_norm": 0.1474807858467102, "learning_rate": 4.07519857699267e-05, "loss": 0.4982, "mean_token_accuracy": 0.8467894904315472, "num_tokens": 616653164.0, "step": 19320 }, { "entropy": 0.6432785131037235, "epoch": 1.7776378514212108, "grad_norm": 0.16109523177146912, "learning_rate": 4.0748918943785084e-05, "loss": 0.6241, "mean_token_accuracy": 0.8046672530472279, "num_tokens": 616683366.0, "step": 19321 }, { "entropy": 0.6697529461234808, "epoch": 1.7777298577926521, "grad_norm": 0.1572074443101883, "learning_rate": 4.074585211764345e-05, "loss": 0.6658, "mean_token_accuracy": 0.7957393936812878, "num_tokens": 616715918.0, "step": 19322 }, { "entropy": 0.6454856898635626, "epoch": 1.7778218641640935, "grad_norm": 0.15970979630947113, "learning_rate": 4.0742785291501826e-05, "loss": 0.6374, "mean_token_accuracy": 0.8054381087422371, "num_tokens": 616747042.0, "step": 19323 }, { "entropy": 0.638367410749197, "epoch": 1.7779138705355346, "grad_norm": 0.16065678000450134, "learning_rate": 4.07397184653602e-05, "loss": 0.6293, "mean_token_accuracy": 0.8069113381206989, "num_tokens": 616779135.0, "step": 19324 }, { "entropy": 0.6500659338198602, "epoch": 1.7780058769069758, "grad_norm": 0.15854527056217194, "learning_rate": 4.0736651639218576e-05, "loss": 0.638, "mean_token_accuracy": 0.8032433874905109, "num_tokens": 616811031.0, "step": 19325 }, { "entropy": 0.6215934120118618, "epoch": 1.778097883278417, "grad_norm": 0.15377932786941528, "learning_rate": 4.073358481307695e-05, "loss": 0.5922, "mean_token_accuracy": 0.8162139728665352, "num_tokens": 616842770.0, "step": 19326 }, { "entropy": 0.5223806970752776, "epoch": 1.7781898896498582, "grad_norm": 0.15566223859786987, "learning_rate": 4.0730517986935325e-05, "loss": 0.5155, "mean_token_accuracy": 0.8404981195926666, "num_tokens": 616873936.0, "step": 19327 }, { "entropy": 0.6313034947961569, "epoch": 1.7782818960212996, "grad_norm": 0.15638358891010284, "learning_rate": 4.072745116079369e-05, "loss": 0.6373, "mean_token_accuracy": 0.8020717464387417, "num_tokens": 616906287.0, "step": 19328 }, { "entropy": 0.6370447464287281, "epoch": 1.7783739023927407, "grad_norm": 0.16179031133651733, "learning_rate": 4.0724384334652074e-05, "loss": 0.6344, "mean_token_accuracy": 0.8037056028842926, "num_tokens": 616938147.0, "step": 19329 }, { "entropy": 0.6516362596303225, "epoch": 1.7784659087641819, "grad_norm": 0.15952858328819275, "learning_rate": 4.072131750851044e-05, "loss": 0.655, "mean_token_accuracy": 0.8018849156796932, "num_tokens": 616970556.0, "step": 19330 }, { "entropy": 0.6782269757241011, "epoch": 1.778557915135623, "grad_norm": 0.1564025580883026, "learning_rate": 4.071825068236882e-05, "loss": 0.6644, "mean_token_accuracy": 0.7937888540327549, "num_tokens": 617002619.0, "step": 19331 }, { "entropy": 0.631675710901618, "epoch": 1.7786499215070644, "grad_norm": 0.15775534510612488, "learning_rate": 4.071518385622719e-05, "loss": 0.6254, "mean_token_accuracy": 0.8074002712965012, "num_tokens": 617033772.0, "step": 19332 }, { "entropy": 0.5331694539636374, "epoch": 1.7787419278785057, "grad_norm": 0.1436474472284317, "learning_rate": 4.0712117030085566e-05, "loss": 0.5276, "mean_token_accuracy": 0.8375514596700668, "num_tokens": 617065606.0, "step": 19333 }, { "entropy": 0.7136117201298475, "epoch": 1.7788339342499468, "grad_norm": 0.16373257339000702, "learning_rate": 4.070905020394394e-05, "loss": 0.7194, "mean_token_accuracy": 0.7842353731393814, "num_tokens": 617097729.0, "step": 19334 }, { "entropy": 0.5815692525357008, "epoch": 1.778925940621388, "grad_norm": 0.15552423894405365, "learning_rate": 4.0705983377802315e-05, "loss": 0.5667, "mean_token_accuracy": 0.8229001238942146, "num_tokens": 617129352.0, "step": 19335 }, { "entropy": 0.587492504157126, "epoch": 1.7790179469928291, "grad_norm": 0.15586695075035095, "learning_rate": 4.070291655166068e-05, "loss": 0.5647, "mean_token_accuracy": 0.8265712521970272, "num_tokens": 617161644.0, "step": 19336 }, { "entropy": 0.643276390619576, "epoch": 1.7791099533642705, "grad_norm": 0.1603449285030365, "learning_rate": 4.0699849725519065e-05, "loss": 0.6129, "mean_token_accuracy": 0.8126229085028172, "num_tokens": 617193216.0, "step": 19337 }, { "entropy": 0.6343389246612787, "epoch": 1.7792019597357118, "grad_norm": 0.1558314710855484, "learning_rate": 4.069678289937743e-05, "loss": 0.617, "mean_token_accuracy": 0.8108134791254997, "num_tokens": 617224980.0, "step": 19338 }, { "entropy": 0.5976569037884474, "epoch": 1.779293966107153, "grad_norm": 0.15776415169239044, "learning_rate": 4.069371607323581e-05, "loss": 0.5856, "mean_token_accuracy": 0.8179762363433838, "num_tokens": 617257031.0, "step": 19339 }, { "entropy": 0.5003809914924204, "epoch": 1.779385972478594, "grad_norm": 0.1455221176147461, "learning_rate": 4.069064924709419e-05, "loss": 0.4848, "mean_token_accuracy": 0.8493923246860504, "num_tokens": 617288928.0, "step": 19340 }, { "entropy": 0.5690196843352169, "epoch": 1.7794779788500352, "grad_norm": 0.1515074372291565, "learning_rate": 4.0687582420952556e-05, "loss": 0.5592, "mean_token_accuracy": 0.8297321312129498, "num_tokens": 617320113.0, "step": 19341 }, { "entropy": 0.6324479170143604, "epoch": 1.7795699852214766, "grad_norm": 0.15281574428081512, "learning_rate": 4.068451559481094e-05, "loss": 0.6225, "mean_token_accuracy": 0.8094739802181721, "num_tokens": 617351845.0, "step": 19342 }, { "entropy": 0.5554801551625133, "epoch": 1.779661991592918, "grad_norm": 0.15016625821590424, "learning_rate": 4.0681448768669306e-05, "loss": 0.5431, "mean_token_accuracy": 0.8354038149118423, "num_tokens": 617383730.0, "step": 19343 }, { "entropy": 0.635894276201725, "epoch": 1.779753997964359, "grad_norm": 0.15888488292694092, "learning_rate": 4.067838194252768e-05, "loss": 0.6307, "mean_token_accuracy": 0.8084451667964458, "num_tokens": 617416033.0, "step": 19344 }, { "entropy": 0.6799620920792222, "epoch": 1.7798460043358002, "grad_norm": 0.1587878167629242, "learning_rate": 4.0675315116386055e-05, "loss": 0.6704, "mean_token_accuracy": 0.7963862381875515, "num_tokens": 617447657.0, "step": 19345 }, { "entropy": 0.5603113023098558, "epoch": 1.7799380107072413, "grad_norm": 0.14817586541175842, "learning_rate": 4.067224829024443e-05, "loss": 0.5529, "mean_token_accuracy": 0.8308286294341087, "num_tokens": 617479524.0, "step": 19346 }, { "entropy": 0.5369715974666178, "epoch": 1.7800300170786827, "grad_norm": 0.1478525549173355, "learning_rate": 4.0669181464102804e-05, "loss": 0.5312, "mean_token_accuracy": 0.834588099271059, "num_tokens": 617511695.0, "step": 19347 }, { "entropy": 0.6180419381707907, "epoch": 1.780122023450124, "grad_norm": 0.15077345073223114, "learning_rate": 4.066611463796118e-05, "loss": 0.5882, "mean_token_accuracy": 0.818224836140871, "num_tokens": 617543557.0, "step": 19348 }, { "entropy": 0.6186595819890499, "epoch": 1.7802140298215652, "grad_norm": 0.15373262763023376, "learning_rate": 4.066304781181955e-05, "loss": 0.6076, "mean_token_accuracy": 0.8132040500640869, "num_tokens": 617575942.0, "step": 19349 }, { "entropy": 0.5279638799838722, "epoch": 1.7803060361930063, "grad_norm": 0.1528480499982834, "learning_rate": 4.065998098567793e-05, "loss": 0.526, "mean_token_accuracy": 0.838721938431263, "num_tokens": 617607537.0, "step": 19350 }, { "entropy": 0.6154088322073221, "epoch": 1.7803980425644474, "grad_norm": 0.15164780616760254, "learning_rate": 4.0656914159536296e-05, "loss": 0.6044, "mean_token_accuracy": 0.8128847554326057, "num_tokens": 617639928.0, "step": 19351 }, { "entropy": 0.6038249433040619, "epoch": 1.7804900489358888, "grad_norm": 0.15399812161922455, "learning_rate": 4.065384733339467e-05, "loss": 0.5926, "mean_token_accuracy": 0.8174360729753971, "num_tokens": 617671778.0, "step": 19352 }, { "entropy": 0.5853242613375187, "epoch": 1.7805820553073302, "grad_norm": 0.1500568389892578, "learning_rate": 4.0650780507253045e-05, "loss": 0.5789, "mean_token_accuracy": 0.8206394240260124, "num_tokens": 617703845.0, "step": 19353 }, { "entropy": 0.6297962516546249, "epoch": 1.7806740616787713, "grad_norm": 0.15431979298591614, "learning_rate": 4.064771368111142e-05, "loss": 0.6312, "mean_token_accuracy": 0.8075109086930752, "num_tokens": 617736397.0, "step": 19354 }, { "entropy": 0.6937397010624409, "epoch": 1.7807660680502124, "grad_norm": 0.1568097025156021, "learning_rate": 4.0644646854969795e-05, "loss": 0.6919, "mean_token_accuracy": 0.7891132533550262, "num_tokens": 617769008.0, "step": 19355 }, { "entropy": 0.67493562027812, "epoch": 1.7808580744216536, "grad_norm": 0.1605442762374878, "learning_rate": 4.064158002882817e-05, "loss": 0.6648, "mean_token_accuracy": 0.797492478042841, "num_tokens": 617799663.0, "step": 19356 }, { "entropy": 0.6183915287256241, "epoch": 1.780950080793095, "grad_norm": 0.15030832588672638, "learning_rate": 4.063851320268654e-05, "loss": 0.607, "mean_token_accuracy": 0.8125099167227745, "num_tokens": 617831760.0, "step": 19357 }, { "entropy": 0.6094676898792386, "epoch": 1.7810420871645363, "grad_norm": 0.1561734676361084, "learning_rate": 4.063544637654492e-05, "loss": 0.5932, "mean_token_accuracy": 0.8194180801510811, "num_tokens": 617863805.0, "step": 19358 }, { "entropy": 0.6629252154380083, "epoch": 1.7811340935359774, "grad_norm": 0.1561354398727417, "learning_rate": 4.0632379550403286e-05, "loss": 0.6493, "mean_token_accuracy": 0.7991216741502285, "num_tokens": 617895562.0, "step": 19359 }, { "entropy": 0.6147411679849029, "epoch": 1.7812260999074185, "grad_norm": 0.15059995651245117, "learning_rate": 4.062931272426166e-05, "loss": 0.5818, "mean_token_accuracy": 0.8195209391415119, "num_tokens": 617927430.0, "step": 19360 }, { "entropy": 0.5835388572886586, "epoch": 1.7813181062788597, "grad_norm": 0.14790676534175873, "learning_rate": 4.0626245898120036e-05, "loss": 0.5633, "mean_token_accuracy": 0.8263020552694798, "num_tokens": 617959687.0, "step": 19361 }, { "entropy": 0.6468011643737555, "epoch": 1.781410112650301, "grad_norm": 0.15608282387256622, "learning_rate": 4.062317907197841e-05, "loss": 0.6438, "mean_token_accuracy": 0.804775282740593, "num_tokens": 617992455.0, "step": 19362 }, { "entropy": 0.647794621065259, "epoch": 1.7815021190217424, "grad_norm": 0.1622731238603592, "learning_rate": 4.0620112245836785e-05, "loss": 0.6417, "mean_token_accuracy": 0.806134320795536, "num_tokens": 618024266.0, "step": 19363 }, { "entropy": 0.6220854688435793, "epoch": 1.7815941253931835, "grad_norm": 0.15826494991779327, "learning_rate": 4.061704541969516e-05, "loss": 0.6206, "mean_token_accuracy": 0.8083418384194374, "num_tokens": 618056343.0, "step": 19364 }, { "entropy": 0.5409425459802151, "epoch": 1.7816861317646246, "grad_norm": 0.14872236549854279, "learning_rate": 4.0613978593553534e-05, "loss": 0.5328, "mean_token_accuracy": 0.8356994688510895, "num_tokens": 618088478.0, "step": 19365 }, { "entropy": 0.543692484498024, "epoch": 1.7817781381360658, "grad_norm": 0.15091903507709503, "learning_rate": 4.061091176741191e-05, "loss": 0.543, "mean_token_accuracy": 0.8296348340809345, "num_tokens": 618120414.0, "step": 19366 }, { "entropy": 0.528448099270463, "epoch": 1.7818701445075071, "grad_norm": 0.15045605599880219, "learning_rate": 4.060784494127028e-05, "loss": 0.5241, "mean_token_accuracy": 0.8334177024662495, "num_tokens": 618152928.0, "step": 19367 }, { "entropy": 0.620751716196537, "epoch": 1.7819621508789485, "grad_norm": 0.15160001814365387, "learning_rate": 4.060477811512866e-05, "loss": 0.6035, "mean_token_accuracy": 0.8122178092598915, "num_tokens": 618184733.0, "step": 19368 }, { "entropy": 0.6267432840541005, "epoch": 1.7820541572503896, "grad_norm": 0.16207276284694672, "learning_rate": 4.0601711288987026e-05, "loss": 0.6147, "mean_token_accuracy": 0.8094052895903587, "num_tokens": 618216183.0, "step": 19369 }, { "entropy": 0.5082770697772503, "epoch": 1.7821461636218308, "grad_norm": 0.15529531240463257, "learning_rate": 4.05986444628454e-05, "loss": 0.487, "mean_token_accuracy": 0.8470663614571095, "num_tokens": 618247762.0, "step": 19370 }, { "entropy": 0.6007422059774399, "epoch": 1.782238169993272, "grad_norm": 0.1583109200000763, "learning_rate": 4.059557763670378e-05, "loss": 0.6017, "mean_token_accuracy": 0.8198062516748905, "num_tokens": 618279427.0, "step": 19371 }, { "entropy": 0.5361032169312239, "epoch": 1.7823301763647132, "grad_norm": 0.15163756906986237, "learning_rate": 4.059251081056215e-05, "loss": 0.525, "mean_token_accuracy": 0.8421176895499229, "num_tokens": 618311672.0, "step": 19372 }, { "entropy": 0.5361483814194798, "epoch": 1.7824221827361546, "grad_norm": 0.1476820856332779, "learning_rate": 4.0589443984420525e-05, "loss": 0.5145, "mean_token_accuracy": 0.8394832126796246, "num_tokens": 618342919.0, "step": 19373 }, { "entropy": 0.707514557056129, "epoch": 1.7825141891075957, "grad_norm": 0.15625424683094025, "learning_rate": 4.05863771582789e-05, "loss": 0.6919, "mean_token_accuracy": 0.787882924079895, "num_tokens": 618374855.0, "step": 19374 }, { "entropy": 0.6972712492570281, "epoch": 1.7826061954790369, "grad_norm": 0.16503480076789856, "learning_rate": 4.0583310332137274e-05, "loss": 0.668, "mean_token_accuracy": 0.7964018024504185, "num_tokens": 618406455.0, "step": 19375 }, { "entropy": 0.5212913099676371, "epoch": 1.782698201850478, "grad_norm": 0.1457734853029251, "learning_rate": 4.058024350599565e-05, "loss": 0.5083, "mean_token_accuracy": 0.8411864899098873, "num_tokens": 618438408.0, "step": 19376 }, { "entropy": 0.5714408550411463, "epoch": 1.7827902082219194, "grad_norm": 0.15314331650733948, "learning_rate": 4.057717667985402e-05, "loss": 0.5624, "mean_token_accuracy": 0.8265142701566219, "num_tokens": 618470159.0, "step": 19377 }, { "entropy": 0.5738061561714858, "epoch": 1.7828822145933607, "grad_norm": 0.14882177114486694, "learning_rate": 4.057410985371239e-05, "loss": 0.5761, "mean_token_accuracy": 0.8243330158293247, "num_tokens": 618502359.0, "step": 19378 }, { "entropy": 0.6283177779987454, "epoch": 1.7829742209648018, "grad_norm": 0.1610935479402542, "learning_rate": 4.057104302757077e-05, "loss": 0.6046, "mean_token_accuracy": 0.814644068479538, "num_tokens": 618533719.0, "step": 19379 }, { "entropy": 0.7496877796947956, "epoch": 1.783066227336243, "grad_norm": 0.16520072519779205, "learning_rate": 4.056797620142914e-05, "loss": 0.7355, "mean_token_accuracy": 0.7797323726117611, "num_tokens": 618565467.0, "step": 19380 }, { "entropy": 0.6190337631851435, "epoch": 1.7831582337076841, "grad_norm": 0.15276969969272614, "learning_rate": 4.056490937528752e-05, "loss": 0.6022, "mean_token_accuracy": 0.8119705803692341, "num_tokens": 618596972.0, "step": 19381 }, { "entropy": 0.5684828320518136, "epoch": 1.7832502400791255, "grad_norm": 0.14756153523921967, "learning_rate": 4.056184254914589e-05, "loss": 0.556, "mean_token_accuracy": 0.8264755681157112, "num_tokens": 618629376.0, "step": 19382 }, { "entropy": 0.6380664948374033, "epoch": 1.7833422464505668, "grad_norm": 0.15820902585983276, "learning_rate": 4.0558775723004264e-05, "loss": 0.6327, "mean_token_accuracy": 0.8064534850418568, "num_tokens": 618661090.0, "step": 19383 }, { "entropy": 0.5097991665825248, "epoch": 1.783434252822008, "grad_norm": 0.1527581512928009, "learning_rate": 4.055570889686264e-05, "loss": 0.5157, "mean_token_accuracy": 0.8441308923065662, "num_tokens": 618692979.0, "step": 19384 }, { "entropy": 0.6060345582664013, "epoch": 1.783526259193449, "grad_norm": 0.16170981526374817, "learning_rate": 4.0552642070721014e-05, "loss": 0.6101, "mean_token_accuracy": 0.8177350200712681, "num_tokens": 618724574.0, "step": 19385 }, { "entropy": 0.6303611323237419, "epoch": 1.7836182655648902, "grad_norm": 0.15853962302207947, "learning_rate": 4.054957524457939e-05, "loss": 0.6334, "mean_token_accuracy": 0.8031510226428509, "num_tokens": 618756709.0, "step": 19386 }, { "entropy": 0.648733826354146, "epoch": 1.7837102719363316, "grad_norm": 0.16017091274261475, "learning_rate": 4.054650841843776e-05, "loss": 0.665, "mean_token_accuracy": 0.7952555231750011, "num_tokens": 618788816.0, "step": 19387 }, { "entropy": 0.543773652985692, "epoch": 1.783802278307773, "grad_norm": 0.15019646286964417, "learning_rate": 4.054344159229613e-05, "loss": 0.5381, "mean_token_accuracy": 0.836064662784338, "num_tokens": 618820824.0, "step": 19388 }, { "entropy": 0.5842665638774633, "epoch": 1.783894284679214, "grad_norm": 0.15700194239616394, "learning_rate": 4.054037476615451e-05, "loss": 0.5744, "mean_token_accuracy": 0.823285385966301, "num_tokens": 618852004.0, "step": 19389 }, { "entropy": 0.598788027651608, "epoch": 1.7839862910506552, "grad_norm": 0.14958555996418, "learning_rate": 4.053730794001288e-05, "loss": 0.5897, "mean_token_accuracy": 0.8183458149433136, "num_tokens": 618884417.0, "step": 19390 }, { "entropy": 0.49426087853498757, "epoch": 1.7840782974220963, "grad_norm": 0.14236240088939667, "learning_rate": 4.0534241113871255e-05, "loss": 0.4812, "mean_token_accuracy": 0.8514648377895355, "num_tokens": 618917144.0, "step": 19391 }, { "entropy": 0.5508274976164103, "epoch": 1.7841703037935377, "grad_norm": 0.14616477489471436, "learning_rate": 4.053117428772963e-05, "loss": 0.5342, "mean_token_accuracy": 0.8355760462582111, "num_tokens": 618949655.0, "step": 19392 }, { "entropy": 0.5753605514764786, "epoch": 1.784262310164979, "grad_norm": 0.15197882056236267, "learning_rate": 4.0528107461588004e-05, "loss": 0.57, "mean_token_accuracy": 0.8252900466322899, "num_tokens": 618981461.0, "step": 19393 }, { "entropy": 0.5665397886186838, "epoch": 1.7843543165364202, "grad_norm": 0.15048739314079285, "learning_rate": 4.052504063544638e-05, "loss": 0.5556, "mean_token_accuracy": 0.8297578543424606, "num_tokens": 619013814.0, "step": 19394 }, { "entropy": 0.5520739909261465, "epoch": 1.7844463229078613, "grad_norm": 0.15293216705322266, "learning_rate": 4.0521973809304753e-05, "loss": 0.5354, "mean_token_accuracy": 0.8332019932568073, "num_tokens": 619045666.0, "step": 19395 }, { "entropy": 0.6229084357619286, "epoch": 1.7845383292793024, "grad_norm": 0.15209431946277618, "learning_rate": 4.051890698316312e-05, "loss": 0.6109, "mean_token_accuracy": 0.8144810907542706, "num_tokens": 619078042.0, "step": 19396 }, { "entropy": 0.6142837405204773, "epoch": 1.7846303356507438, "grad_norm": 0.16216455399990082, "learning_rate": 4.05158401570215e-05, "loss": 0.587, "mean_token_accuracy": 0.8203213550150394, "num_tokens": 619109756.0, "step": 19397 }, { "entropy": 0.5564159005880356, "epoch": 1.7847223420221852, "grad_norm": 0.14579521119594574, "learning_rate": 4.051277333087987e-05, "loss": 0.5423, "mean_token_accuracy": 0.8315212763845921, "num_tokens": 619142079.0, "step": 19398 }, { "entropy": 0.5709600588306785, "epoch": 1.7848143483936263, "grad_norm": 0.14711928367614746, "learning_rate": 4.0509706504738245e-05, "loss": 0.5549, "mean_token_accuracy": 0.8276379965245724, "num_tokens": 619174425.0, "step": 19399 }, { "entropy": 0.7492733784019947, "epoch": 1.7849063547650674, "grad_norm": 0.17185470461845398, "learning_rate": 4.050663967859662e-05, "loss": 0.748, "mean_token_accuracy": 0.7723137997090816, "num_tokens": 619205605.0, "step": 19400 }, { "entropy": 0.577132023870945, "epoch": 1.7849983611365086, "grad_norm": 0.15134809911251068, "learning_rate": 4.0503572852454995e-05, "loss": 0.5687, "mean_token_accuracy": 0.8260027579963207, "num_tokens": 619238002.0, "step": 19401 }, { "entropy": 0.47995578730478883, "epoch": 1.78509036750795, "grad_norm": 0.14022444188594818, "learning_rate": 4.0500506026313376e-05, "loss": 0.462, "mean_token_accuracy": 0.8533686175942421, "num_tokens": 619269465.0, "step": 19402 }, { "entropy": 0.6682004574686289, "epoch": 1.7851823738793913, "grad_norm": 0.16693517565727234, "learning_rate": 4.0497439200171744e-05, "loss": 0.6704, "mean_token_accuracy": 0.7987548857927322, "num_tokens": 619301078.0, "step": 19403 }, { "entropy": 0.6005545370280743, "epoch": 1.7852743802508324, "grad_norm": 0.15814149379730225, "learning_rate": 4.049437237403012e-05, "loss": 0.6028, "mean_token_accuracy": 0.814648300409317, "num_tokens": 619333043.0, "step": 19404 }, { "entropy": 0.5741257909685373, "epoch": 1.7853663866222735, "grad_norm": 0.15613967180252075, "learning_rate": 4.049130554788849e-05, "loss": 0.5612, "mean_token_accuracy": 0.8214654587209225, "num_tokens": 619364463.0, "step": 19405 }, { "entropy": 0.5739250713959336, "epoch": 1.7854583929937147, "grad_norm": 0.15090397000312805, "learning_rate": 4.048823872174687e-05, "loss": 0.5645, "mean_token_accuracy": 0.8263272009789944, "num_tokens": 619396218.0, "step": 19406 }, { "entropy": 0.5120488358661532, "epoch": 1.785550399365156, "grad_norm": 0.14493465423583984, "learning_rate": 4.048517189560524e-05, "loss": 0.506, "mean_token_accuracy": 0.8418328128755093, "num_tokens": 619428239.0, "step": 19407 }, { "entropy": 0.5322709772735834, "epoch": 1.7856424057365974, "grad_norm": 0.15113817155361176, "learning_rate": 4.048210506946362e-05, "loss": 0.5179, "mean_token_accuracy": 0.8399789296090603, "num_tokens": 619459954.0, "step": 19408 }, { "entropy": 0.6743805445730686, "epoch": 1.7857344121080385, "grad_norm": 0.1569666862487793, "learning_rate": 4.0479038243321985e-05, "loss": 0.671, "mean_token_accuracy": 0.7981225475668907, "num_tokens": 619492185.0, "step": 19409 }, { "entropy": 0.531962369568646, "epoch": 1.7858264184794796, "grad_norm": 0.15929952263832092, "learning_rate": 4.0475971417180366e-05, "loss": 0.5128, "mean_token_accuracy": 0.8383386805653572, "num_tokens": 619524149.0, "step": 19410 }, { "entropy": 0.6625535599887371, "epoch": 1.7859184248509208, "grad_norm": 0.1573571115732193, "learning_rate": 4.0472904591038734e-05, "loss": 0.6504, "mean_token_accuracy": 0.8031328432261944, "num_tokens": 619555627.0, "step": 19411 }, { "entropy": 0.6629178933799267, "epoch": 1.7860104312223621, "grad_norm": 0.16129058599472046, "learning_rate": 4.046983776489711e-05, "loss": 0.6684, "mean_token_accuracy": 0.7979425080120564, "num_tokens": 619587299.0, "step": 19412 }, { "entropy": 0.6864123269915581, "epoch": 1.7861024375938035, "grad_norm": 0.15851804614067078, "learning_rate": 4.0466770938755484e-05, "loss": 0.6777, "mean_token_accuracy": 0.792851272970438, "num_tokens": 619618929.0, "step": 19413 }, { "entropy": 0.6282221078872681, "epoch": 1.7861944439652446, "grad_norm": 0.1528451144695282, "learning_rate": 4.046370411261386e-05, "loss": 0.5998, "mean_token_accuracy": 0.8127072900533676, "num_tokens": 619651007.0, "step": 19414 }, { "entropy": 0.5854148026555777, "epoch": 1.7862864503366858, "grad_norm": 0.15663400292396545, "learning_rate": 4.046063728647223e-05, "loss": 0.5723, "mean_token_accuracy": 0.8208932168781757, "num_tokens": 619682513.0, "step": 19415 }, { "entropy": 0.3992458516731858, "epoch": 1.786378456708127, "grad_norm": 0.13477690517902374, "learning_rate": 4.045757046033061e-05, "loss": 0.3858, "mean_token_accuracy": 0.8793476484715939, "num_tokens": 619714873.0, "step": 19416 }, { "entropy": 0.6450210059992969, "epoch": 1.7864704630795682, "grad_norm": 0.15605829656124115, "learning_rate": 4.0454503634188975e-05, "loss": 0.6276, "mean_token_accuracy": 0.8075947500765324, "num_tokens": 619747044.0, "step": 19417 }, { "entropy": 0.6335801854729652, "epoch": 1.7865624694510096, "grad_norm": 0.15109550952911377, "learning_rate": 4.045143680804736e-05, "loss": 0.6158, "mean_token_accuracy": 0.8121349848806858, "num_tokens": 619778686.0, "step": 19418 }, { "entropy": 0.6066373633220792, "epoch": 1.7866544758224507, "grad_norm": 0.16070930659770966, "learning_rate": 4.0448369981905725e-05, "loss": 0.5948, "mean_token_accuracy": 0.8206999897956848, "num_tokens": 619809796.0, "step": 19419 }, { "entropy": 0.5440232641994953, "epoch": 1.7867464821938919, "grad_norm": 0.14702089130878448, "learning_rate": 4.04453031557641e-05, "loss": 0.5383, "mean_token_accuracy": 0.8285122960805893, "num_tokens": 619841525.0, "step": 19420 }, { "entropy": 0.6043472848832607, "epoch": 1.786838488565333, "grad_norm": 0.15190161764621735, "learning_rate": 4.0442236329622474e-05, "loss": 0.5816, "mean_token_accuracy": 0.8183502219617367, "num_tokens": 619873437.0, "step": 19421 }, { "entropy": 0.5114789633080363, "epoch": 1.7869304949367744, "grad_norm": 0.14652663469314575, "learning_rate": 4.043916950348085e-05, "loss": 0.4956, "mean_token_accuracy": 0.8429297842085361, "num_tokens": 619905018.0, "step": 19422 }, { "entropy": 0.6450016871094704, "epoch": 1.7870225013082157, "grad_norm": 0.15896062552928925, "learning_rate": 4.043610267733922e-05, "loss": 0.6266, "mean_token_accuracy": 0.8029185906052589, "num_tokens": 619936164.0, "step": 19423 }, { "entropy": 0.6891979295760393, "epoch": 1.7871145076796568, "grad_norm": 0.1604168862104416, "learning_rate": 4.04330358511976e-05, "loss": 0.6801, "mean_token_accuracy": 0.7922062911093235, "num_tokens": 619968349.0, "step": 19424 }, { "entropy": 0.5167165640741587, "epoch": 1.787206514051098, "grad_norm": 0.14883540570735931, "learning_rate": 4.042996902505597e-05, "loss": 0.501, "mean_token_accuracy": 0.8426244556903839, "num_tokens": 620000025.0, "step": 19425 }, { "entropy": 0.48757585580460727, "epoch": 1.7872985204225391, "grad_norm": 0.1435290277004242, "learning_rate": 4.042690219891435e-05, "loss": 0.4698, "mean_token_accuracy": 0.8546939678490162, "num_tokens": 620032128.0, "step": 19426 }, { "entropy": 0.5371782323345542, "epoch": 1.7873905267939805, "grad_norm": 0.15197806060314178, "learning_rate": 4.0423835372772715e-05, "loss": 0.5247, "mean_token_accuracy": 0.8404375985264778, "num_tokens": 620064248.0, "step": 19427 }, { "entropy": 0.5311647886410356, "epoch": 1.7874825331654218, "grad_norm": 0.15105675160884857, "learning_rate": 4.0420768546631096e-05, "loss": 0.521, "mean_token_accuracy": 0.8354666605591774, "num_tokens": 620096338.0, "step": 19428 }, { "entropy": 0.6032483708113432, "epoch": 1.787574539536863, "grad_norm": 0.15484698116779327, "learning_rate": 4.0417701720489464e-05, "loss": 0.6048, "mean_token_accuracy": 0.8111373409628868, "num_tokens": 620127596.0, "step": 19429 }, { "entropy": 0.5518551748245955, "epoch": 1.787666545908304, "grad_norm": 0.1504993438720703, "learning_rate": 4.041463489434784e-05, "loss": 0.5637, "mean_token_accuracy": 0.8269849680364132, "num_tokens": 620160345.0, "step": 19430 }, { "entropy": 0.6067683380097151, "epoch": 1.7877585522797452, "grad_norm": 0.15027935802936554, "learning_rate": 4.041156806820622e-05, "loss": 0.5905, "mean_token_accuracy": 0.8205276317894459, "num_tokens": 620191899.0, "step": 19431 }, { "entropy": 0.6244331784546375, "epoch": 1.7878505586511866, "grad_norm": 0.16088362038135529, "learning_rate": 4.040850124206459e-05, "loss": 0.6267, "mean_token_accuracy": 0.8095851764082909, "num_tokens": 620223595.0, "step": 19432 }, { "entropy": 0.6005472457036376, "epoch": 1.787942565022628, "grad_norm": 0.1564405858516693, "learning_rate": 4.040543441592296e-05, "loss": 0.5825, "mean_token_accuracy": 0.8191997744143009, "num_tokens": 620254635.0, "step": 19433 }, { "entropy": 0.560071736574173, "epoch": 1.788034571394069, "grad_norm": 0.15496431291103363, "learning_rate": 4.040236758978134e-05, "loss": 0.5447, "mean_token_accuracy": 0.828532338142395, "num_tokens": 620285766.0, "step": 19434 }, { "entropy": 0.595000920817256, "epoch": 1.7881265777655102, "grad_norm": 0.1553345024585724, "learning_rate": 4.039930076363971e-05, "loss": 0.585, "mean_token_accuracy": 0.82387974858284, "num_tokens": 620317256.0, "step": 19435 }, { "entropy": 0.6789679229259491, "epoch": 1.7882185841369513, "grad_norm": 0.1621452122926712, "learning_rate": 4.039623393749809e-05, "loss": 0.6708, "mean_token_accuracy": 0.794887438416481, "num_tokens": 620349571.0, "step": 19436 }, { "entropy": 0.674022862687707, "epoch": 1.7883105905083927, "grad_norm": 0.16251768171787262, "learning_rate": 4.039316711135646e-05, "loss": 0.6537, "mean_token_accuracy": 0.7995859645307064, "num_tokens": 620381931.0, "step": 19437 }, { "entropy": 0.697617806494236, "epoch": 1.788402596879834, "grad_norm": 0.16446952521800995, "learning_rate": 4.039010028521483e-05, "loss": 0.7037, "mean_token_accuracy": 0.7869775369763374, "num_tokens": 620413298.0, "step": 19438 }, { "entropy": 0.7043021097779274, "epoch": 1.7884946032512752, "grad_norm": 0.16088329255580902, "learning_rate": 4.038703345907321e-05, "loss": 0.7001, "mean_token_accuracy": 0.7867378629744053, "num_tokens": 620444805.0, "step": 19439 }, { "entropy": 0.6240355595946312, "epoch": 1.7885866096227163, "grad_norm": 0.1574057936668396, "learning_rate": 4.038396663293158e-05, "loss": 0.6049, "mean_token_accuracy": 0.8117480538785458, "num_tokens": 620475810.0, "step": 19440 }, { "entropy": 0.6785184685140848, "epoch": 1.7886786159941575, "grad_norm": 0.15467917919158936, "learning_rate": 4.038089980678996e-05, "loss": 0.6727, "mean_token_accuracy": 0.7915291823446751, "num_tokens": 620508105.0, "step": 19441 }, { "entropy": 0.5988051351159811, "epoch": 1.7887706223655988, "grad_norm": 0.1556602418422699, "learning_rate": 4.037783298064833e-05, "loss": 0.5883, "mean_token_accuracy": 0.818275410681963, "num_tokens": 620540492.0, "step": 19442 }, { "entropy": 0.5828497326001525, "epoch": 1.7888626287370402, "grad_norm": 0.15281589329242706, "learning_rate": 4.03747661545067e-05, "loss": 0.5616, "mean_token_accuracy": 0.8220208659768105, "num_tokens": 620571803.0, "step": 19443 }, { "entropy": 0.522799483500421, "epoch": 1.7889546351084813, "grad_norm": 0.15659697353839874, "learning_rate": 4.037169932836508e-05, "loss": 0.5032, "mean_token_accuracy": 0.8438123613595963, "num_tokens": 620602917.0, "step": 19444 }, { "entropy": 0.5886427350342274, "epoch": 1.7890466414799224, "grad_norm": 0.15230081975460052, "learning_rate": 4.036863250222345e-05, "loss": 0.5867, "mean_token_accuracy": 0.8190001659095287, "num_tokens": 620635145.0, "step": 19445 }, { "entropy": 0.6434482727199793, "epoch": 1.7891386478513636, "grad_norm": 0.15473097562789917, "learning_rate": 4.0365565676081827e-05, "loss": 0.6291, "mean_token_accuracy": 0.8087826855480671, "num_tokens": 620666688.0, "step": 19446 }, { "entropy": 0.5686134733259678, "epoch": 1.789230654222805, "grad_norm": 0.14524951577186584, "learning_rate": 4.03624988499402e-05, "loss": 0.5593, "mean_token_accuracy": 0.8275332041084766, "num_tokens": 620699081.0, "step": 19447 }, { "entropy": 0.6237299358472228, "epoch": 1.7893226605942463, "grad_norm": 0.15425504744052887, "learning_rate": 4.035943202379857e-05, "loss": 0.6071, "mean_token_accuracy": 0.8142830282449722, "num_tokens": 620730970.0, "step": 19448 }, { "entropy": 0.6431021429598331, "epoch": 1.7894146669656874, "grad_norm": 0.1586689054965973, "learning_rate": 4.035636519765695e-05, "loss": 0.6381, "mean_token_accuracy": 0.8067659884691238, "num_tokens": 620762704.0, "step": 19449 }, { "entropy": 0.619950957596302, "epoch": 1.7895066733371285, "grad_norm": 0.16406364738941193, "learning_rate": 4.035329837151532e-05, "loss": 0.6051, "mean_token_accuracy": 0.8155817538499832, "num_tokens": 620795397.0, "step": 19450 }, { "entropy": 0.6036900691688061, "epoch": 1.7895986797085697, "grad_norm": 0.15737776458263397, "learning_rate": 4.035023154537369e-05, "loss": 0.5881, "mean_token_accuracy": 0.8184571117162704, "num_tokens": 620826848.0, "step": 19451 }, { "entropy": 0.6006881799548864, "epoch": 1.789690686080011, "grad_norm": 0.15701015293598175, "learning_rate": 4.034716471923207e-05, "loss": 0.5845, "mean_token_accuracy": 0.8209408447146416, "num_tokens": 620858945.0, "step": 19452 }, { "entropy": 0.6248437976464629, "epoch": 1.7897826924514524, "grad_norm": 0.15242330729961395, "learning_rate": 4.034409789309044e-05, "loss": 0.6144, "mean_token_accuracy": 0.8103888779878616, "num_tokens": 620891712.0, "step": 19453 }, { "entropy": 0.5925332987681031, "epoch": 1.7898746988228935, "grad_norm": 0.14907628297805786, "learning_rate": 4.034103106694882e-05, "loss": 0.5603, "mean_token_accuracy": 0.8250542394816875, "num_tokens": 620923294.0, "step": 19454 }, { "entropy": 0.5393299893476069, "epoch": 1.7899667051943347, "grad_norm": 0.1519044190645218, "learning_rate": 4.033796424080719e-05, "loss": 0.536, "mean_token_accuracy": 0.8358015194535255, "num_tokens": 620955252.0, "step": 19455 }, { "entropy": 0.6372549964580685, "epoch": 1.7900587115657758, "grad_norm": 0.15757311880588531, "learning_rate": 4.033489741466556e-05, "loss": 0.6245, "mean_token_accuracy": 0.8090530224144459, "num_tokens": 620986903.0, "step": 19456 }, { "entropy": 0.5225949126761407, "epoch": 1.7901507179372171, "grad_norm": 0.14893995225429535, "learning_rate": 4.033183058852394e-05, "loss": 0.5162, "mean_token_accuracy": 0.839904673397541, "num_tokens": 621019092.0, "step": 19457 }, { "entropy": 0.6061562481336296, "epoch": 1.7902427243086585, "grad_norm": 0.1559334397315979, "learning_rate": 4.032876376238231e-05, "loss": 0.6036, "mean_token_accuracy": 0.8192960172891617, "num_tokens": 621050187.0, "step": 19458 }, { "entropy": 0.7035151515156031, "epoch": 1.7903347306800996, "grad_norm": 0.15746861696243286, "learning_rate": 4.0325696936240683e-05, "loss": 0.7062, "mean_token_accuracy": 0.7857277728617191, "num_tokens": 621082181.0, "step": 19459 }, { "entropy": 0.6163928527384996, "epoch": 1.7904267370515408, "grad_norm": 0.15396158397197723, "learning_rate": 4.032263011009906e-05, "loss": 0.6031, "mean_token_accuracy": 0.8099206686019897, "num_tokens": 621114457.0, "step": 19460 }, { "entropy": 0.6267971880733967, "epoch": 1.790518743422982, "grad_norm": 0.15260356664657593, "learning_rate": 4.031956328395743e-05, "loss": 0.6255, "mean_token_accuracy": 0.8056301921606064, "num_tokens": 621147225.0, "step": 19461 }, { "entropy": 0.5720449201762676, "epoch": 1.7906107497944233, "grad_norm": 0.14951016008853912, "learning_rate": 4.0316496457815814e-05, "loss": 0.5651, "mean_token_accuracy": 0.8263776265084743, "num_tokens": 621179288.0, "step": 19462 }, { "entropy": 0.5738233011215925, "epoch": 1.7907027561658646, "grad_norm": 0.15415675938129425, "learning_rate": 4.031342963167418e-05, "loss": 0.5797, "mean_token_accuracy": 0.820650115609169, "num_tokens": 621210832.0, "step": 19463 }, { "entropy": 0.5898313606157899, "epoch": 1.7907947625373057, "grad_norm": 0.15342725813388824, "learning_rate": 4.031036280553256e-05, "loss": 0.5833, "mean_token_accuracy": 0.8224771805107594, "num_tokens": 621243154.0, "step": 19464 }, { "entropy": 0.5830861236900091, "epoch": 1.7908867689087469, "grad_norm": 0.1590854823589325, "learning_rate": 4.030729597939093e-05, "loss": 0.5759, "mean_token_accuracy": 0.824543721973896, "num_tokens": 621275068.0, "step": 19465 }, { "entropy": 0.456204011105001, "epoch": 1.790978775280188, "grad_norm": 0.13714174926280975, "learning_rate": 4.0304229153249306e-05, "loss": 0.4443, "mean_token_accuracy": 0.8598401136696339, "num_tokens": 621307319.0, "step": 19466 }, { "entropy": 0.63907206710428, "epoch": 1.7910707816516294, "grad_norm": 0.15715263783931732, "learning_rate": 4.030116232710768e-05, "loss": 0.6235, "mean_token_accuracy": 0.808080580085516, "num_tokens": 621338827.0, "step": 19467 }, { "entropy": 0.6238085869699717, "epoch": 1.7911627880230707, "grad_norm": 0.15826797485351562, "learning_rate": 4.0298095500966055e-05, "loss": 0.6224, "mean_token_accuracy": 0.8103451505303383, "num_tokens": 621371063.0, "step": 19468 }, { "entropy": 0.5610912637785077, "epoch": 1.7912547943945119, "grad_norm": 0.1571831852197647, "learning_rate": 4.029502867482442e-05, "loss": 0.5478, "mean_token_accuracy": 0.8277348130941391, "num_tokens": 621402979.0, "step": 19469 }, { "entropy": 0.651059371419251, "epoch": 1.791346800765953, "grad_norm": 0.15669922530651093, "learning_rate": 4.0291961848682805e-05, "loss": 0.6286, "mean_token_accuracy": 0.804577324539423, "num_tokens": 621434424.0, "step": 19470 }, { "entropy": 0.6182642299681902, "epoch": 1.7914388071373941, "grad_norm": 0.15247875452041626, "learning_rate": 4.028889502254117e-05, "loss": 0.6095, "mean_token_accuracy": 0.8146678060293198, "num_tokens": 621467192.0, "step": 19471 }, { "entropy": 0.6936570070683956, "epoch": 1.7915308135088355, "grad_norm": 0.1541554033756256, "learning_rate": 4.028582819639955e-05, "loss": 0.6757, "mean_token_accuracy": 0.7946087121963501, "num_tokens": 621499480.0, "step": 19472 }, { "entropy": 0.5593642294406891, "epoch": 1.7916228198802768, "grad_norm": 0.15181730687618256, "learning_rate": 4.028276137025792e-05, "loss": 0.5554, "mean_token_accuracy": 0.8281313218176365, "num_tokens": 621531268.0, "step": 19473 }, { "entropy": 0.5841260384768248, "epoch": 1.791714826251718, "grad_norm": 0.15769830346107483, "learning_rate": 4.0279694544116296e-05, "loss": 0.5766, "mean_token_accuracy": 0.8223591521382332, "num_tokens": 621562718.0, "step": 19474 }, { "entropy": 0.654976848512888, "epoch": 1.791806832623159, "grad_norm": 0.1520797312259674, "learning_rate": 4.027662771797467e-05, "loss": 0.6465, "mean_token_accuracy": 0.7994986772537231, "num_tokens": 621594610.0, "step": 19475 }, { "entropy": 0.6221233308315277, "epoch": 1.7918988389946002, "grad_norm": 0.15475428104400635, "learning_rate": 4.0273560891833046e-05, "loss": 0.6141, "mean_token_accuracy": 0.8068985976278782, "num_tokens": 621626280.0, "step": 19476 }, { "entropy": 0.7037905361503363, "epoch": 1.7919908453660416, "grad_norm": 0.15949377417564392, "learning_rate": 4.0270494065691414e-05, "loss": 0.7068, "mean_token_accuracy": 0.785997923463583, "num_tokens": 621658170.0, "step": 19477 }, { "entropy": 0.6075007813051343, "epoch": 1.792082851737483, "grad_norm": 0.15365634858608246, "learning_rate": 4.0267427239549795e-05, "loss": 0.6079, "mean_token_accuracy": 0.8105350323021412, "num_tokens": 621690037.0, "step": 19478 }, { "entropy": 0.6726132519543171, "epoch": 1.792174858108924, "grad_norm": 0.16063259541988373, "learning_rate": 4.026436041340816e-05, "loss": 0.662, "mean_token_accuracy": 0.8006707206368446, "num_tokens": 621722520.0, "step": 19479 }, { "entropy": 0.45116962864995, "epoch": 1.7922668644803652, "grad_norm": 0.13770973682403564, "learning_rate": 4.026129358726654e-05, "loss": 0.4348, "mean_token_accuracy": 0.8645273633301258, "num_tokens": 621755288.0, "step": 19480 }, { "entropy": 0.5853784345090389, "epoch": 1.7923588708518063, "grad_norm": 0.15004003047943115, "learning_rate": 4.025822676112491e-05, "loss": 0.5872, "mean_token_accuracy": 0.8180258795619011, "num_tokens": 621787098.0, "step": 19481 }, { "entropy": 0.6093548089265823, "epoch": 1.7924508772232477, "grad_norm": 0.15602749586105347, "learning_rate": 4.025515993498329e-05, "loss": 0.5991, "mean_token_accuracy": 0.8112314529716969, "num_tokens": 621818411.0, "step": 19482 }, { "entropy": 0.6275549060665071, "epoch": 1.792542883594689, "grad_norm": 0.15257933735847473, "learning_rate": 4.025209310884166e-05, "loss": 0.6194, "mean_token_accuracy": 0.8092596456408501, "num_tokens": 621850237.0, "step": 19483 }, { "entropy": 0.6022745054215193, "epoch": 1.7926348899661302, "grad_norm": 0.15321297943592072, "learning_rate": 4.0249026282700036e-05, "loss": 0.5908, "mean_token_accuracy": 0.8193902000784874, "num_tokens": 621882311.0, "step": 19484 }, { "entropy": 0.60987897682935, "epoch": 1.7927268963375713, "grad_norm": 0.1660332977771759, "learning_rate": 4.024595945655841e-05, "loss": 0.6009, "mean_token_accuracy": 0.8153146579861641, "num_tokens": 621914278.0, "step": 19485 }, { "entropy": 0.5744119007140398, "epoch": 1.7928189027090125, "grad_norm": 0.14763037860393524, "learning_rate": 4.0242892630416785e-05, "loss": 0.567, "mean_token_accuracy": 0.8268242925405502, "num_tokens": 621946272.0, "step": 19486 }, { "entropy": 0.6051635248586535, "epoch": 1.7929109090804538, "grad_norm": 0.15212321281433105, "learning_rate": 4.023982580427515e-05, "loss": 0.5943, "mean_token_accuracy": 0.8149620220065117, "num_tokens": 621978428.0, "step": 19487 }, { "entropy": 0.637501978315413, "epoch": 1.7930029154518952, "grad_norm": 0.16326875984668732, "learning_rate": 4.0236758978133535e-05, "loss": 0.6314, "mean_token_accuracy": 0.8086782470345497, "num_tokens": 622010484.0, "step": 19488 }, { "entropy": 0.6102305371314287, "epoch": 1.7930949218233363, "grad_norm": 0.1519545614719391, "learning_rate": 4.02336921519919e-05, "loss": 0.5992, "mean_token_accuracy": 0.8130411729216576, "num_tokens": 622042898.0, "step": 19489 }, { "entropy": 0.5158922951668501, "epoch": 1.7931869281947774, "grad_norm": 0.15026021003723145, "learning_rate": 4.023062532585028e-05, "loss": 0.5004, "mean_token_accuracy": 0.8450391963124275, "num_tokens": 622074792.0, "step": 19490 }, { "entropy": 0.6019369077403098, "epoch": 1.7932789345662186, "grad_norm": 0.16132742166519165, "learning_rate": 4.022755849970865e-05, "loss": 0.593, "mean_token_accuracy": 0.8187772147357464, "num_tokens": 622106491.0, "step": 19491 }, { "entropy": 0.6293381508439779, "epoch": 1.79337094093766, "grad_norm": 0.15546965599060059, "learning_rate": 4.0224491673567027e-05, "loss": 0.6194, "mean_token_accuracy": 0.8079463206231594, "num_tokens": 622138610.0, "step": 19492 }, { "entropy": 0.5480932351201773, "epoch": 1.7934629473091013, "grad_norm": 0.14958727359771729, "learning_rate": 4.02214248474254e-05, "loss": 0.5418, "mean_token_accuracy": 0.831038661301136, "num_tokens": 622170251.0, "step": 19493 }, { "entropy": 0.6709445975720882, "epoch": 1.7935549536805424, "grad_norm": 0.16016080975532532, "learning_rate": 4.0218358021283776e-05, "loss": 0.6562, "mean_token_accuracy": 0.8002257235348225, "num_tokens": 622202525.0, "step": 19494 }, { "entropy": 0.48444786481559277, "epoch": 1.7936469600519835, "grad_norm": 0.15457649528980255, "learning_rate": 4.021529119514215e-05, "loss": 0.4769, "mean_token_accuracy": 0.8529354967176914, "num_tokens": 622234412.0, "step": 19495 }, { "entropy": 0.6157173756510019, "epoch": 1.7937389664234247, "grad_norm": 0.15662658214569092, "learning_rate": 4.0212224369000525e-05, "loss": 0.6058, "mean_token_accuracy": 0.8149858303368092, "num_tokens": 622266748.0, "step": 19496 }, { "entropy": 0.5890843509696424, "epoch": 1.793830972794866, "grad_norm": 0.14860734343528748, "learning_rate": 4.02091575428589e-05, "loss": 0.5609, "mean_token_accuracy": 0.8242240399122238, "num_tokens": 622297816.0, "step": 19497 }, { "entropy": 0.6507026311010122, "epoch": 1.7939229791663074, "grad_norm": 0.15712712705135345, "learning_rate": 4.020609071671727e-05, "loss": 0.6357, "mean_token_accuracy": 0.8015968538820744, "num_tokens": 622329528.0, "step": 19498 }, { "entropy": 0.6665265751071274, "epoch": 1.7940149855377485, "grad_norm": 0.15882140398025513, "learning_rate": 4.020302389057565e-05, "loss": 0.6576, "mean_token_accuracy": 0.7970383204519749, "num_tokens": 622361047.0, "step": 19499 }, { "entropy": 0.6103649884462357, "epoch": 1.7941069919091897, "grad_norm": 0.15559156239032745, "learning_rate": 4.019995706443402e-05, "loss": 0.5955, "mean_token_accuracy": 0.816752701997757, "num_tokens": 622392858.0, "step": 19500 }, { "entropy": 0.5051949890330434, "epoch": 1.7941989982806308, "grad_norm": 0.1499263495206833, "learning_rate": 4.01968902382924e-05, "loss": 0.4949, "mean_token_accuracy": 0.851163387298584, "num_tokens": 622425356.0, "step": 19501 }, { "entropy": 0.5630968566983938, "epoch": 1.7942910046520721, "grad_norm": 0.15049003064632416, "learning_rate": 4.0193823412150766e-05, "loss": 0.5582, "mean_token_accuracy": 0.8247440978884697, "num_tokens": 622457476.0, "step": 19502 }, { "entropy": 0.5867312354966998, "epoch": 1.7943830110235135, "grad_norm": 0.14196181297302246, "learning_rate": 4.019075658600914e-05, "loss": 0.5751, "mean_token_accuracy": 0.8218698091804981, "num_tokens": 622489891.0, "step": 19503 }, { "entropy": 0.6096700420603156, "epoch": 1.7944750173949546, "grad_norm": 0.15045206248760223, "learning_rate": 4.0187689759867515e-05, "loss": 0.5925, "mean_token_accuracy": 0.8213077858090401, "num_tokens": 622522608.0, "step": 19504 }, { "entropy": 0.5824045017361641, "epoch": 1.7945670237663958, "grad_norm": 0.15423256158828735, "learning_rate": 4.018462293372589e-05, "loss": 0.5764, "mean_token_accuracy": 0.8228941820561886, "num_tokens": 622555027.0, "step": 19505 }, { "entropy": 0.6184666287153959, "epoch": 1.794659030137837, "grad_norm": 0.15644297003746033, "learning_rate": 4.0181556107584265e-05, "loss": 0.6205, "mean_token_accuracy": 0.8115994557738304, "num_tokens": 622586602.0, "step": 19506 }, { "entropy": 0.45212111016735435, "epoch": 1.7947510365092783, "grad_norm": 0.1459340751171112, "learning_rate": 4.017848928144264e-05, "loss": 0.4427, "mean_token_accuracy": 0.8608143404126167, "num_tokens": 622618653.0, "step": 19507 }, { "entropy": 0.579104833304882, "epoch": 1.7948430428807196, "grad_norm": 0.15869146585464478, "learning_rate": 4.017542245530101e-05, "loss": 0.5724, "mean_token_accuracy": 0.8214460611343384, "num_tokens": 622649552.0, "step": 19508 }, { "entropy": 0.529763001948595, "epoch": 1.7949350492521607, "grad_norm": 0.14588546752929688, "learning_rate": 4.017235562915939e-05, "loss": 0.5293, "mean_token_accuracy": 0.8373063169419765, "num_tokens": 622682256.0, "step": 19509 }, { "entropy": 0.5169894807040691, "epoch": 1.7950270556236019, "grad_norm": 0.14754422008991241, "learning_rate": 4.0169288803017757e-05, "loss": 0.5232, "mean_token_accuracy": 0.8412900120019913, "num_tokens": 622713255.0, "step": 19510 }, { "entropy": 0.5480415411293507, "epoch": 1.795119061995043, "grad_norm": 0.14842350780963898, "learning_rate": 4.016622197687613e-05, "loss": 0.5462, "mean_token_accuracy": 0.8358223177492619, "num_tokens": 622745818.0, "step": 19511 }, { "entropy": 0.5596487345173955, "epoch": 1.7952110683664844, "grad_norm": 0.14585058391094208, "learning_rate": 4.0163155150734506e-05, "loss": 0.5377, "mean_token_accuracy": 0.829110499471426, "num_tokens": 622777651.0, "step": 19512 }, { "entropy": 0.6515575461089611, "epoch": 1.7953030747379257, "grad_norm": 0.16086195409297943, "learning_rate": 4.016008832459288e-05, "loss": 0.6491, "mean_token_accuracy": 0.802736297249794, "num_tokens": 622809940.0, "step": 19513 }, { "entropy": 0.6578889284282923, "epoch": 1.7953950811093669, "grad_norm": 0.1594780683517456, "learning_rate": 4.0157021498451255e-05, "loss": 0.6612, "mean_token_accuracy": 0.7950654067099094, "num_tokens": 622841811.0, "step": 19514 }, { "entropy": 0.6419019494205713, "epoch": 1.795487087480808, "grad_norm": 0.15245220065116882, "learning_rate": 4.015395467230963e-05, "loss": 0.6348, "mean_token_accuracy": 0.8078682720661163, "num_tokens": 622873732.0, "step": 19515 }, { "entropy": 0.59763473412022, "epoch": 1.7955790938522491, "grad_norm": 0.1517390012741089, "learning_rate": 4.0150887846168e-05, "loss": 0.5898, "mean_token_accuracy": 0.818672701716423, "num_tokens": 622906072.0, "step": 19516 }, { "entropy": 0.5901925228536129, "epoch": 1.7956711002236905, "grad_norm": 0.1500285416841507, "learning_rate": 4.014782102002638e-05, "loss": 0.5842, "mean_token_accuracy": 0.8205366358160973, "num_tokens": 622938378.0, "step": 19517 }, { "entropy": 0.5954364156350493, "epoch": 1.7957631065951318, "grad_norm": 0.15823689103126526, "learning_rate": 4.014475419388475e-05, "loss": 0.5783, "mean_token_accuracy": 0.8188992068171501, "num_tokens": 622969327.0, "step": 19518 }, { "entropy": 0.6648181863129139, "epoch": 1.795855112966573, "grad_norm": 0.1549546718597412, "learning_rate": 4.014168736774312e-05, "loss": 0.6513, "mean_token_accuracy": 0.7998059950768948, "num_tokens": 623000670.0, "step": 19519 }, { "entropy": 0.6245649319607764, "epoch": 1.795947119338014, "grad_norm": 0.15492267906665802, "learning_rate": 4.0138620541601496e-05, "loss": 0.6147, "mean_token_accuracy": 0.8171831928193569, "num_tokens": 623032306.0, "step": 19520 }, { "entropy": 0.6766307447105646, "epoch": 1.7960391257094552, "grad_norm": 0.15711866319179535, "learning_rate": 4.013555371545987e-05, "loss": 0.6626, "mean_token_accuracy": 0.7981351427733898, "num_tokens": 623064283.0, "step": 19521 }, { "entropy": 0.70171676017344, "epoch": 1.7961311320808966, "grad_norm": 0.15468916296958923, "learning_rate": 4.0132486889318246e-05, "loss": 0.6917, "mean_token_accuracy": 0.7913065813481808, "num_tokens": 623096388.0, "step": 19522 }, { "entropy": 0.5462312661111355, "epoch": 1.796223138452338, "grad_norm": 0.1558401882648468, "learning_rate": 4.012942006317662e-05, "loss": 0.5322, "mean_token_accuracy": 0.8364636972546577, "num_tokens": 623128162.0, "step": 19523 }, { "entropy": 0.5841459771618247, "epoch": 1.796315144823779, "grad_norm": 0.1566859483718872, "learning_rate": 4.0126353237034995e-05, "loss": 0.5707, "mean_token_accuracy": 0.8203765116631985, "num_tokens": 623159224.0, "step": 19524 }, { "entropy": 0.5498985182493925, "epoch": 1.7964071511952202, "grad_norm": 0.15756972134113312, "learning_rate": 4.012328641089337e-05, "loss": 0.535, "mean_token_accuracy": 0.8370789773762226, "num_tokens": 623191102.0, "step": 19525 }, { "entropy": 0.689766176044941, "epoch": 1.7964991575666613, "grad_norm": 0.15963596105575562, "learning_rate": 4.0120219584751744e-05, "loss": 0.6628, "mean_token_accuracy": 0.7972214110195637, "num_tokens": 623223114.0, "step": 19526 }, { "entropy": 0.6486291522160172, "epoch": 1.7965911639381027, "grad_norm": 0.1528448909521103, "learning_rate": 4.011715275861012e-05, "loss": 0.632, "mean_token_accuracy": 0.8104747124016285, "num_tokens": 623255025.0, "step": 19527 }, { "entropy": 0.595500179566443, "epoch": 1.796683170309544, "grad_norm": 0.15483549237251282, "learning_rate": 4.0114085932468493e-05, "loss": 0.5899, "mean_token_accuracy": 0.8192808777093887, "num_tokens": 623286534.0, "step": 19528 }, { "entropy": 0.5576311042532325, "epoch": 1.7967751766809852, "grad_norm": 0.15372776985168457, "learning_rate": 4.011101910632686e-05, "loss": 0.5552, "mean_token_accuracy": 0.8292244598269463, "num_tokens": 623318249.0, "step": 19529 }, { "entropy": 0.5604456826113164, "epoch": 1.7968671830524263, "grad_norm": 0.15377432107925415, "learning_rate": 4.010795228018524e-05, "loss": 0.5473, "mean_token_accuracy": 0.8331066332757473, "num_tokens": 623349773.0, "step": 19530 }, { "entropy": 0.6162936883047223, "epoch": 1.7969591894238675, "grad_norm": 0.1522544026374817, "learning_rate": 4.010488545404361e-05, "loss": 0.6038, "mean_token_accuracy": 0.813172847032547, "num_tokens": 623381195.0, "step": 19531 }, { "entropy": 0.5568767786026001, "epoch": 1.7970511957953088, "grad_norm": 0.1435166597366333, "learning_rate": 4.0101818627901985e-05, "loss": 0.5428, "mean_token_accuracy": 0.834366500377655, "num_tokens": 623413716.0, "step": 19532 }, { "entropy": 0.591919285710901, "epoch": 1.7971432021667502, "grad_norm": 0.15734624862670898, "learning_rate": 4.009875180176036e-05, "loss": 0.5703, "mean_token_accuracy": 0.8255306705832481, "num_tokens": 623444861.0, "step": 19533 }, { "entropy": 0.5895804343745112, "epoch": 1.7972352085381913, "grad_norm": 0.1531468778848648, "learning_rate": 4.0095684975618735e-05, "loss": 0.5756, "mean_token_accuracy": 0.8253632225096226, "num_tokens": 623477479.0, "step": 19534 }, { "entropy": 0.6466648187488317, "epoch": 1.7973272149096324, "grad_norm": 0.15367832779884338, "learning_rate": 4.009261814947711e-05, "loss": 0.6472, "mean_token_accuracy": 0.7987400069832802, "num_tokens": 623510167.0, "step": 19535 }, { "entropy": 0.6649334635585546, "epoch": 1.7974192212810736, "grad_norm": 0.15452130138874054, "learning_rate": 4.0089551323335484e-05, "loss": 0.6501, "mean_token_accuracy": 0.8033564761281013, "num_tokens": 623542217.0, "step": 19536 }, { "entropy": 0.6664229780435562, "epoch": 1.797511227652515, "grad_norm": 0.15730144083499908, "learning_rate": 4.008648449719385e-05, "loss": 0.6584, "mean_token_accuracy": 0.7985906712710857, "num_tokens": 623574532.0, "step": 19537 }, { "entropy": 0.6119575090706348, "epoch": 1.7976032340239563, "grad_norm": 0.15441080927848816, "learning_rate": 4.008341767105223e-05, "loss": 0.6039, "mean_token_accuracy": 0.8160217180848122, "num_tokens": 623606069.0, "step": 19538 }, { "entropy": 0.5962635865435004, "epoch": 1.7976952403953974, "grad_norm": 0.15536567568778992, "learning_rate": 4.00803508449106e-05, "loss": 0.599, "mean_token_accuracy": 0.8134813271462917, "num_tokens": 623637779.0, "step": 19539 }, { "entropy": 0.6530426423996687, "epoch": 1.7977872467668385, "grad_norm": 0.1716586947441101, "learning_rate": 4.0077284018768976e-05, "loss": 0.6513, "mean_token_accuracy": 0.8025504164397717, "num_tokens": 623669989.0, "step": 19540 }, { "entropy": 0.5111966263502836, "epoch": 1.7978792531382797, "grad_norm": 0.15230777859687805, "learning_rate": 4.007421719262735e-05, "loss": 0.507, "mean_token_accuracy": 0.8405850790441036, "num_tokens": 623702265.0, "step": 19541 }, { "entropy": 0.5346921239979565, "epoch": 1.797971259509721, "grad_norm": 0.15105454623699188, "learning_rate": 4.0071150366485725e-05, "loss": 0.5273, "mean_token_accuracy": 0.8371927738189697, "num_tokens": 623734247.0, "step": 19542 }, { "entropy": 0.58688735216856, "epoch": 1.7980632658811624, "grad_norm": 0.15754690766334534, "learning_rate": 4.00680835403441e-05, "loss": 0.5861, "mean_token_accuracy": 0.8205020651221275, "num_tokens": 623765404.0, "step": 19543 }, { "entropy": 0.6710375840775669, "epoch": 1.7981552722526035, "grad_norm": 0.15963256359100342, "learning_rate": 4.0065016714202474e-05, "loss": 0.6607, "mean_token_accuracy": 0.8012924641370773, "num_tokens": 623797351.0, "step": 19544 }, { "entropy": 0.5998558579012752, "epoch": 1.7982472786240447, "grad_norm": 0.1592186689376831, "learning_rate": 4.006194988806085e-05, "loss": 0.5989, "mean_token_accuracy": 0.816078033298254, "num_tokens": 623827714.0, "step": 19545 }, { "entropy": 0.6383824832737446, "epoch": 1.7983392849954858, "grad_norm": 0.1519862413406372, "learning_rate": 4.0058883061919224e-05, "loss": 0.639, "mean_token_accuracy": 0.8062646389007568, "num_tokens": 623859977.0, "step": 19546 }, { "entropy": 0.7073239823803306, "epoch": 1.7984312913669271, "grad_norm": 0.16713890433311462, "learning_rate": 4.005581623577759e-05, "loss": 0.7106, "mean_token_accuracy": 0.7843986079096794, "num_tokens": 623891142.0, "step": 19547 }, { "entropy": 0.5872738808393478, "epoch": 1.7985232977383685, "grad_norm": 0.15411150455474854, "learning_rate": 4.005274940963597e-05, "loss": 0.5572, "mean_token_accuracy": 0.8269380554556847, "num_tokens": 623922334.0, "step": 19548 }, { "entropy": 0.5297822570428252, "epoch": 1.7986153041098096, "grad_norm": 0.14701960980892181, "learning_rate": 4.004968258349434e-05, "loss": 0.5304, "mean_token_accuracy": 0.8387752585113049, "num_tokens": 623954740.0, "step": 19549 }, { "entropy": 0.6181171170901507, "epoch": 1.7987073104812508, "grad_norm": 0.15522141754627228, "learning_rate": 4.0046615757352715e-05, "loss": 0.598, "mean_token_accuracy": 0.8132783956825733, "num_tokens": 623985854.0, "step": 19550 }, { "entropy": 0.6166265909560025, "epoch": 1.798799316852692, "grad_norm": 0.15387164056301117, "learning_rate": 4.004354893121109e-05, "loss": 0.6192, "mean_token_accuracy": 0.8128038868308067, "num_tokens": 624016820.0, "step": 19551 }, { "entropy": 0.6101682335138321, "epoch": 1.7988913232241333, "grad_norm": 0.15374116599559784, "learning_rate": 4.0040482105069465e-05, "loss": 0.6069, "mean_token_accuracy": 0.8151930719614029, "num_tokens": 624048772.0, "step": 19552 }, { "entropy": 0.5922936163842678, "epoch": 1.7989833295955746, "grad_norm": 0.1467006504535675, "learning_rate": 4.003741527892784e-05, "loss": 0.5714, "mean_token_accuracy": 0.8240376338362694, "num_tokens": 624080407.0, "step": 19553 }, { "entropy": 0.6641650348901749, "epoch": 1.7990753359670157, "grad_norm": 0.15162305533885956, "learning_rate": 4.0034348452786214e-05, "loss": 0.6419, "mean_token_accuracy": 0.8025067076086998, "num_tokens": 624112567.0, "step": 19554 }, { "entropy": 0.5860179262235761, "epoch": 1.7991673423384569, "grad_norm": 0.15514029562473297, "learning_rate": 4.003128162664459e-05, "loss": 0.5782, "mean_token_accuracy": 0.8266749270260334, "num_tokens": 624144430.0, "step": 19555 }, { "entropy": 0.6759459618479013, "epoch": 1.799259348709898, "grad_norm": 0.16276268661022186, "learning_rate": 4.002821480050296e-05, "loss": 0.6571, "mean_token_accuracy": 0.7985553219914436, "num_tokens": 624176776.0, "step": 19556 }, { "entropy": 0.6247066939249635, "epoch": 1.7993513550813394, "grad_norm": 0.15223991870880127, "learning_rate": 4.002514797436134e-05, "loss": 0.6101, "mean_token_accuracy": 0.8117533102631569, "num_tokens": 624209072.0, "step": 19557 }, { "entropy": 0.6241557616740465, "epoch": 1.7994433614527807, "grad_norm": 0.1531524360179901, "learning_rate": 4.0022081148219706e-05, "loss": 0.6207, "mean_token_accuracy": 0.8108379766345024, "num_tokens": 624241070.0, "step": 19558 }, { "entropy": 0.6138408733531833, "epoch": 1.7995353678242219, "grad_norm": 0.1580529808998108, "learning_rate": 4.001901432207809e-05, "loss": 0.6009, "mean_token_accuracy": 0.8103660680353642, "num_tokens": 624272367.0, "step": 19559 }, { "entropy": 0.6487562209367752, "epoch": 1.799627374195663, "grad_norm": 0.1605759710073471, "learning_rate": 4.0015947495936455e-05, "loss": 0.6468, "mean_token_accuracy": 0.8023499175906181, "num_tokens": 624303978.0, "step": 19560 }, { "entropy": 0.6602863389998674, "epoch": 1.7997193805671041, "grad_norm": 0.15995705127716064, "learning_rate": 4.0012880669794837e-05, "loss": 0.6393, "mean_token_accuracy": 0.8037018924951553, "num_tokens": 624335034.0, "step": 19561 }, { "entropy": 0.5130288684740663, "epoch": 1.7998113869385455, "grad_norm": 0.14730097353458405, "learning_rate": 4.0009813843653204e-05, "loss": 0.509, "mean_token_accuracy": 0.840821273624897, "num_tokens": 624366800.0, "step": 19562 }, { "entropy": 0.6663315868936479, "epoch": 1.7999033933099868, "grad_norm": 0.16402751207351685, "learning_rate": 4.000674701751158e-05, "loss": 0.6535, "mean_token_accuracy": 0.8024434149265289, "num_tokens": 624398316.0, "step": 19563 }, { "entropy": 0.47702168207615614, "epoch": 1.799995399681428, "grad_norm": 0.14356392621994019, "learning_rate": 4.0003680191369954e-05, "loss": 0.463, "mean_token_accuracy": 0.8531092144548893, "num_tokens": 624429714.0, "step": 19564 }, { "entropy": 0.7499855384230614, "epoch": 1.800087406052869, "grad_norm": 0.16554418206214905, "learning_rate": 4.000061336522833e-05, "loss": 0.7454, "mean_token_accuracy": 0.7726123705506325, "num_tokens": 624461759.0, "step": 19565 }, { "entropy": 0.5974156931042671, "epoch": 1.8001794124243102, "grad_norm": 0.15859773755073547, "learning_rate": 3.99975465390867e-05, "loss": 0.5909, "mean_token_accuracy": 0.8180508054792881, "num_tokens": 624493704.0, "step": 19566 }, { "entropy": 0.6127894958481193, "epoch": 1.8002714187957516, "grad_norm": 0.15334713459014893, "learning_rate": 3.999447971294508e-05, "loss": 0.597, "mean_token_accuracy": 0.8160706274211407, "num_tokens": 624525523.0, "step": 19567 }, { "entropy": 0.6276132240891457, "epoch": 1.800363425167193, "grad_norm": 0.15133659541606903, "learning_rate": 3.9991412886803446e-05, "loss": 0.6202, "mean_token_accuracy": 0.8110663443803787, "num_tokens": 624557413.0, "step": 19568 }, { "entropy": 0.5487578206229955, "epoch": 1.800455431538634, "grad_norm": 0.1510002613067627, "learning_rate": 3.998834606066183e-05, "loss": 0.5197, "mean_token_accuracy": 0.8350774087011814, "num_tokens": 624588654.0, "step": 19569 }, { "entropy": 0.6931815007701516, "epoch": 1.8005474379100752, "grad_norm": 0.16227412223815918, "learning_rate": 3.9985279234520195e-05, "loss": 0.6853, "mean_token_accuracy": 0.788811270147562, "num_tokens": 624619964.0, "step": 19570 }, { "entropy": 0.5450196284800768, "epoch": 1.8006394442815163, "grad_norm": 0.15176525712013245, "learning_rate": 3.998221240837857e-05, "loss": 0.5318, "mean_token_accuracy": 0.8356047160923481, "num_tokens": 624652292.0, "step": 19571 }, { "entropy": 0.663514968007803, "epoch": 1.8007314506529577, "grad_norm": 0.15826372802257538, "learning_rate": 3.9979145582236944e-05, "loss": 0.6491, "mean_token_accuracy": 0.8020415343344212, "num_tokens": 624684101.0, "step": 19572 }, { "entropy": 0.597786265425384, "epoch": 1.800823457024399, "grad_norm": 0.16290423274040222, "learning_rate": 3.997607875609532e-05, "loss": 0.5823, "mean_token_accuracy": 0.8193294778466225, "num_tokens": 624715986.0, "step": 19573 }, { "entropy": 0.6754504726268351, "epoch": 1.8009154633958402, "grad_norm": 0.15745694935321808, "learning_rate": 3.9973011929953693e-05, "loss": 0.668, "mean_token_accuracy": 0.7902017086744308, "num_tokens": 624748071.0, "step": 19574 }, { "entropy": 0.6874187253415585, "epoch": 1.8010074697672813, "grad_norm": 0.16365402936935425, "learning_rate": 3.996994510381207e-05, "loss": 0.6828, "mean_token_accuracy": 0.79768330976367, "num_tokens": 624779732.0, "step": 19575 }, { "entropy": 0.5298658832907677, "epoch": 1.8010994761387225, "grad_norm": 0.1547670215368271, "learning_rate": 3.9966878277670436e-05, "loss": 0.5226, "mean_token_accuracy": 0.8373215571045876, "num_tokens": 624811001.0, "step": 19576 }, { "entropy": 0.5993571230210364, "epoch": 1.8011914825101638, "grad_norm": 0.14948680996894836, "learning_rate": 3.996381145152882e-05, "loss": 0.5988, "mean_token_accuracy": 0.8172869496047497, "num_tokens": 624843270.0, "step": 19577 }, { "entropy": 0.6802291015628725, "epoch": 1.8012834888816052, "grad_norm": 0.16141566634178162, "learning_rate": 3.9960744625387185e-05, "loss": 0.6676, "mean_token_accuracy": 0.7989247776567936, "num_tokens": 624874691.0, "step": 19578 }, { "entropy": 0.6192069500684738, "epoch": 1.8013754952530463, "grad_norm": 0.15775270760059357, "learning_rate": 3.995767779924556e-05, "loss": 0.6237, "mean_token_accuracy": 0.8089586496353149, "num_tokens": 624906806.0, "step": 19579 }, { "entropy": 0.5718890884891152, "epoch": 1.8014675016244874, "grad_norm": 0.15939141809940338, "learning_rate": 3.9954610973103935e-05, "loss": 0.5737, "mean_token_accuracy": 0.8279653638601303, "num_tokens": 624938077.0, "step": 19580 }, { "entropy": 0.6071142051368952, "epoch": 1.8015595079959286, "grad_norm": 0.16014541685581207, "learning_rate": 3.995154414696231e-05, "loss": 0.6099, "mean_token_accuracy": 0.8143065832555294, "num_tokens": 624969156.0, "step": 19581 }, { "entropy": 0.5630092835053802, "epoch": 1.80165151436737, "grad_norm": 0.14819765090942383, "learning_rate": 3.9948477320820684e-05, "loss": 0.5535, "mean_token_accuracy": 0.8330673314630985, "num_tokens": 625001180.0, "step": 19582 }, { "entropy": 0.7158947214484215, "epoch": 1.8017435207388113, "grad_norm": 0.16667088866233826, "learning_rate": 3.994541049467906e-05, "loss": 0.7183, "mean_token_accuracy": 0.7828992754220963, "num_tokens": 625031754.0, "step": 19583 }, { "entropy": 0.6095191389322281, "epoch": 1.8018355271102524, "grad_norm": 0.1529616415500641, "learning_rate": 3.994234366853743e-05, "loss": 0.5988, "mean_token_accuracy": 0.8185408152639866, "num_tokens": 625063777.0, "step": 19584 }, { "entropy": 0.672790015116334, "epoch": 1.8019275334816935, "grad_norm": 0.15958769619464874, "learning_rate": 3.993927684239581e-05, "loss": 0.6715, "mean_token_accuracy": 0.7940299957990646, "num_tokens": 625095369.0, "step": 19585 }, { "entropy": 0.6065562763251364, "epoch": 1.8020195398531347, "grad_norm": 0.15777720510959625, "learning_rate": 3.993621001625418e-05, "loss": 0.5866, "mean_token_accuracy": 0.8172905184328556, "num_tokens": 625126679.0, "step": 19586 }, { "entropy": 0.5015456438995898, "epoch": 1.802111546224576, "grad_norm": 0.1461149901151657, "learning_rate": 3.993314319011256e-05, "loss": 0.5003, "mean_token_accuracy": 0.8493653498589993, "num_tokens": 625158668.0, "step": 19587 }, { "entropy": 0.539461100474, "epoch": 1.8022035525960174, "grad_norm": 0.14631956815719604, "learning_rate": 3.993007636397093e-05, "loss": 0.5218, "mean_token_accuracy": 0.8375903964042664, "num_tokens": 625190881.0, "step": 19588 }, { "entropy": 0.7147765159606934, "epoch": 1.8022955589674585, "grad_norm": 0.15791048109531403, "learning_rate": 3.99270095378293e-05, "loss": 0.6943, "mean_token_accuracy": 0.7893975786864758, "num_tokens": 625222819.0, "step": 19589 }, { "entropy": 0.6514865234494209, "epoch": 1.8023875653388997, "grad_norm": 0.16120189428329468, "learning_rate": 3.992394271168768e-05, "loss": 0.6406, "mean_token_accuracy": 0.8067074492573738, "num_tokens": 625254805.0, "step": 19590 }, { "entropy": 0.6615978926420212, "epoch": 1.8024795717103408, "grad_norm": 0.15905599296092987, "learning_rate": 3.992087588554605e-05, "loss": 0.6593, "mean_token_accuracy": 0.7991819120943546, "num_tokens": 625286812.0, "step": 19591 }, { "entropy": 0.5544223207980394, "epoch": 1.8025715780817821, "grad_norm": 0.14551375806331635, "learning_rate": 3.9917809059404423e-05, "loss": 0.533, "mean_token_accuracy": 0.8314010575413704, "num_tokens": 625319142.0, "step": 19592 }, { "entropy": 0.5182607774622738, "epoch": 1.8026635844532235, "grad_norm": 0.14131920039653778, "learning_rate": 3.99147422332628e-05, "loss": 0.5019, "mean_token_accuracy": 0.8453205302357674, "num_tokens": 625351444.0, "step": 19593 }, { "entropy": 0.632507411763072, "epoch": 1.8027555908246646, "grad_norm": 0.15023396909236908, "learning_rate": 3.991167540712117e-05, "loss": 0.6263, "mean_token_accuracy": 0.8094142265617847, "num_tokens": 625383708.0, "step": 19594 }, { "entropy": 0.5880174990743399, "epoch": 1.8028475971961058, "grad_norm": 0.15325795114040375, "learning_rate": 3.990860858097955e-05, "loss": 0.5674, "mean_token_accuracy": 0.8239697925746441, "num_tokens": 625415330.0, "step": 19595 }, { "entropy": 0.6272688116878271, "epoch": 1.802939603567547, "grad_norm": 0.15488339960575104, "learning_rate": 3.990554175483792e-05, "loss": 0.6221, "mean_token_accuracy": 0.8081093318760395, "num_tokens": 625446731.0, "step": 19596 }, { "entropy": 0.5183239961043, "epoch": 1.8030316099389883, "grad_norm": 0.14913924038410187, "learning_rate": 3.990247492869629e-05, "loss": 0.5026, "mean_token_accuracy": 0.8456869311630726, "num_tokens": 625479263.0, "step": 19597 }, { "entropy": 0.6424841748084873, "epoch": 1.8031236163104296, "grad_norm": 0.15796853601932526, "learning_rate": 3.989940810255467e-05, "loss": 0.619, "mean_token_accuracy": 0.8080770559608936, "num_tokens": 625511116.0, "step": 19598 }, { "entropy": 0.675168564543128, "epoch": 1.8032156226818707, "grad_norm": 0.1622203290462494, "learning_rate": 3.989634127641304e-05, "loss": 0.6589, "mean_token_accuracy": 0.8006605543196201, "num_tokens": 625543081.0, "step": 19599 }, { "entropy": 0.7074645236134529, "epoch": 1.8033076290533119, "grad_norm": 0.1601330041885376, "learning_rate": 3.989327445027142e-05, "loss": 0.7161, "mean_token_accuracy": 0.7812425307929516, "num_tokens": 625575717.0, "step": 19600 }, { "entropy": 0.6560005284845829, "epoch": 1.803399635424753, "grad_norm": 0.16087397933006287, "learning_rate": 3.989020762412979e-05, "loss": 0.6545, "mean_token_accuracy": 0.8009996563196182, "num_tokens": 625607462.0, "step": 19601 }, { "entropy": 0.5757854152470827, "epoch": 1.8034916417961944, "grad_norm": 0.14905717968940735, "learning_rate": 3.988714079798816e-05, "loss": 0.5636, "mean_token_accuracy": 0.8219144977629185, "num_tokens": 625639008.0, "step": 19602 }, { "entropy": 0.5570674929767847, "epoch": 1.8035836481676357, "grad_norm": 0.14927050471305847, "learning_rate": 3.988407397184654e-05, "loss": 0.5428, "mean_token_accuracy": 0.8310859613120556, "num_tokens": 625670771.0, "step": 19603 }, { "entropy": 0.554690039716661, "epoch": 1.8036756545390769, "grad_norm": 0.15286876261234283, "learning_rate": 3.988100714570491e-05, "loss": 0.5428, "mean_token_accuracy": 0.8317662812769413, "num_tokens": 625702562.0, "step": 19604 }, { "entropy": 0.47013003495521843, "epoch": 1.803767660910518, "grad_norm": 0.14660879969596863, "learning_rate": 3.987794031956329e-05, "loss": 0.4404, "mean_token_accuracy": 0.8628227412700653, "num_tokens": 625734809.0, "step": 19605 }, { "entropy": 0.6892109513282776, "epoch": 1.8038596672819591, "grad_norm": 0.16299954056739807, "learning_rate": 3.987487349342166e-05, "loss": 0.6911, "mean_token_accuracy": 0.7929520793259144, "num_tokens": 625767171.0, "step": 19606 }, { "entropy": 0.6643305495381355, "epoch": 1.8039516736534005, "grad_norm": 0.157846137881279, "learning_rate": 3.987180666728003e-05, "loss": 0.6567, "mean_token_accuracy": 0.8015414103865623, "num_tokens": 625799638.0, "step": 19607 }, { "entropy": 0.699280871078372, "epoch": 1.8040436800248418, "grad_norm": 0.15580326318740845, "learning_rate": 3.986873984113841e-05, "loss": 0.6862, "mean_token_accuracy": 0.7942078970372677, "num_tokens": 625831957.0, "step": 19608 }, { "entropy": 0.6413244251161814, "epoch": 1.804135686396283, "grad_norm": 0.15481851994991302, "learning_rate": 3.986567301499678e-05, "loss": 0.6287, "mean_token_accuracy": 0.8063286989927292, "num_tokens": 625863944.0, "step": 19609 }, { "entropy": 0.6760950293391943, "epoch": 1.804227692767724, "grad_norm": 0.1623523086309433, "learning_rate": 3.9862606188855154e-05, "loss": 0.6549, "mean_token_accuracy": 0.8019720576703548, "num_tokens": 625896081.0, "step": 19610 }, { "entropy": 0.7566351378336549, "epoch": 1.8043196991391652, "grad_norm": 0.1630450338125229, "learning_rate": 3.985953936271353e-05, "loss": 0.7552, "mean_token_accuracy": 0.7727772071957588, "num_tokens": 625928004.0, "step": 19611 }, { "entropy": 0.6146023385226727, "epoch": 1.8044117055106066, "grad_norm": 0.14944912493228912, "learning_rate": 3.98564725365719e-05, "loss": 0.5992, "mean_token_accuracy": 0.8137473464012146, "num_tokens": 625960559.0, "step": 19612 }, { "entropy": 0.6159031689167023, "epoch": 1.804503711882048, "grad_norm": 0.15453773736953735, "learning_rate": 3.985340571043028e-05, "loss": 0.6068, "mean_token_accuracy": 0.812160175293684, "num_tokens": 625992321.0, "step": 19613 }, { "entropy": 0.4776503201574087, "epoch": 1.804595718253489, "grad_norm": 0.1461823433637619, "learning_rate": 3.985033888428865e-05, "loss": 0.4698, "mean_token_accuracy": 0.8493527173995972, "num_tokens": 626025089.0, "step": 19614 }, { "entropy": 0.673839008435607, "epoch": 1.8046877246249302, "grad_norm": 0.16290000081062317, "learning_rate": 3.984727205814703e-05, "loss": 0.6706, "mean_token_accuracy": 0.796706885099411, "num_tokens": 626057043.0, "step": 19615 }, { "entropy": 0.6074454747140408, "epoch": 1.8047797309963713, "grad_norm": 0.15484432876110077, "learning_rate": 3.98442052320054e-05, "loss": 0.5974, "mean_token_accuracy": 0.8138963133096695, "num_tokens": 626088755.0, "step": 19616 }, { "entropy": 0.5097125424072146, "epoch": 1.8048717373678127, "grad_norm": 0.14751915633678436, "learning_rate": 3.9841138405863776e-05, "loss": 0.5066, "mean_token_accuracy": 0.8435538895428181, "num_tokens": 626121004.0, "step": 19617 }, { "entropy": 0.6826008586212993, "epoch": 1.804963743739254, "grad_norm": 0.16046683490276337, "learning_rate": 3.9838071579722144e-05, "loss": 0.686, "mean_token_accuracy": 0.7932809069752693, "num_tokens": 626153349.0, "step": 19618 }, { "entropy": 0.6916448511183262, "epoch": 1.8050557501106952, "grad_norm": 0.15529237687587738, "learning_rate": 3.9835004753580525e-05, "loss": 0.6732, "mean_token_accuracy": 0.7955942638218403, "num_tokens": 626185337.0, "step": 19619 }, { "entropy": 0.5981101393699646, "epoch": 1.8051477564821363, "grad_norm": 0.15385101735591888, "learning_rate": 3.983193792743889e-05, "loss": 0.5984, "mean_token_accuracy": 0.8177425116300583, "num_tokens": 626216669.0, "step": 19620 }, { "entropy": 0.6912703607231379, "epoch": 1.8052397628535775, "grad_norm": 0.16498428583145142, "learning_rate": 3.9828871101297275e-05, "loss": 0.6716, "mean_token_accuracy": 0.7921780645847321, "num_tokens": 626248476.0, "step": 19621 }, { "entropy": 0.633050964679569, "epoch": 1.8053317692250188, "grad_norm": 0.16211800277233124, "learning_rate": 3.982580427515564e-05, "loss": 0.6224, "mean_token_accuracy": 0.8066808134317398, "num_tokens": 626280809.0, "step": 19622 }, { "entropy": 0.6701497733592987, "epoch": 1.8054237755964602, "grad_norm": 0.16478273272514343, "learning_rate": 3.982273744901402e-05, "loss": 0.6447, "mean_token_accuracy": 0.80359211191535, "num_tokens": 626313179.0, "step": 19623 }, { "entropy": 0.6635673306882381, "epoch": 1.8055157819679013, "grad_norm": 0.15644513070583344, "learning_rate": 3.981967062287239e-05, "loss": 0.6601, "mean_token_accuracy": 0.802894689142704, "num_tokens": 626345849.0, "step": 19624 }, { "entropy": 0.5750508429482579, "epoch": 1.8056077883393424, "grad_norm": 0.15299062430858612, "learning_rate": 3.9816603796730767e-05, "loss": 0.582, "mean_token_accuracy": 0.8222697116434574, "num_tokens": 626378057.0, "step": 19625 }, { "entropy": 0.5805551311932504, "epoch": 1.8056997947107836, "grad_norm": 0.15652501583099365, "learning_rate": 3.981353697058914e-05, "loss": 0.5596, "mean_token_accuracy": 0.8287164457142353, "num_tokens": 626409944.0, "step": 19626 }, { "entropy": 0.6467918232083321, "epoch": 1.805791801082225, "grad_norm": 0.16451458632946014, "learning_rate": 3.9810470144447516e-05, "loss": 0.6506, "mean_token_accuracy": 0.7995905987918377, "num_tokens": 626441249.0, "step": 19627 }, { "entropy": 0.460691939573735, "epoch": 1.8058838074536663, "grad_norm": 0.14370431005954742, "learning_rate": 3.9807403318305884e-05, "loss": 0.4421, "mean_token_accuracy": 0.8603102825582027, "num_tokens": 626473433.0, "step": 19628 }, { "entropy": 0.5399512257426977, "epoch": 1.8059758138251074, "grad_norm": 0.15525315701961517, "learning_rate": 3.9804336492164265e-05, "loss": 0.5381, "mean_token_accuracy": 0.8307579793035984, "num_tokens": 626504897.0, "step": 19629 }, { "entropy": 0.581140864174813, "epoch": 1.8060678201965485, "grad_norm": 0.15888144075870514, "learning_rate": 3.980126966602263e-05, "loss": 0.5676, "mean_token_accuracy": 0.8241128996014595, "num_tokens": 626537076.0, "step": 19630 }, { "entropy": 0.5243297945708036, "epoch": 1.8061598265679897, "grad_norm": 0.14551176130771637, "learning_rate": 3.979820283988101e-05, "loss": 0.5197, "mean_token_accuracy": 0.8345689959824085, "num_tokens": 626569153.0, "step": 19631 }, { "entropy": 0.603745736181736, "epoch": 1.806251832939431, "grad_norm": 0.1571008712053299, "learning_rate": 3.979513601373938e-05, "loss": 0.6019, "mean_token_accuracy": 0.8146941997110844, "num_tokens": 626601042.0, "step": 19632 }, { "entropy": 0.5433600628748536, "epoch": 1.8063438393108724, "grad_norm": 0.14887331426143646, "learning_rate": 3.979206918759776e-05, "loss": 0.5326, "mean_token_accuracy": 0.8355321288108826, "num_tokens": 626632672.0, "step": 19633 }, { "entropy": 0.5994568336755037, "epoch": 1.8064358456823135, "grad_norm": 0.15959696471691132, "learning_rate": 3.978900236145613e-05, "loss": 0.5876, "mean_token_accuracy": 0.8154003582894802, "num_tokens": 626664012.0, "step": 19634 }, { "entropy": 0.6147602105047554, "epoch": 1.8065278520537547, "grad_norm": 0.14678119122982025, "learning_rate": 3.9785935535314506e-05, "loss": 0.599, "mean_token_accuracy": 0.8151426501572132, "num_tokens": 626696341.0, "step": 19635 }, { "entropy": 0.470109979622066, "epoch": 1.8066198584251958, "grad_norm": 0.1412798911333084, "learning_rate": 3.9782868709172874e-05, "loss": 0.4635, "mean_token_accuracy": 0.8576240949332714, "num_tokens": 626727955.0, "step": 19636 }, { "entropy": 0.6685242485255003, "epoch": 1.8067118647966371, "grad_norm": 0.1619720458984375, "learning_rate": 3.9779801883031256e-05, "loss": 0.6628, "mean_token_accuracy": 0.7984933480620384, "num_tokens": 626759699.0, "step": 19637 }, { "entropy": 0.6162727857008576, "epoch": 1.8068038711680785, "grad_norm": 0.15333864092826843, "learning_rate": 3.9776735056889623e-05, "loss": 0.6099, "mean_token_accuracy": 0.8137576058506966, "num_tokens": 626791760.0, "step": 19638 }, { "entropy": 0.6832552012056112, "epoch": 1.8068958775395196, "grad_norm": 0.1612907201051712, "learning_rate": 3.9773668230748e-05, "loss": 0.6746, "mean_token_accuracy": 0.7943813353776932, "num_tokens": 626824030.0, "step": 19639 }, { "entropy": 0.5086513636633754, "epoch": 1.8069878839109608, "grad_norm": 0.14268864691257477, "learning_rate": 3.977060140460637e-05, "loss": 0.4918, "mean_token_accuracy": 0.8466499224305153, "num_tokens": 626855996.0, "step": 19640 }, { "entropy": 0.6137937810271978, "epoch": 1.807079890282402, "grad_norm": 0.15318015217781067, "learning_rate": 3.976753457846475e-05, "loss": 0.6039, "mean_token_accuracy": 0.8176166340708733, "num_tokens": 626887841.0, "step": 19641 }, { "entropy": 0.5871914685703814, "epoch": 1.8071718966538433, "grad_norm": 0.143169566988945, "learning_rate": 3.976446775232312e-05, "loss": 0.5639, "mean_token_accuracy": 0.8269250355660915, "num_tokens": 626920247.0, "step": 19642 }, { "entropy": 0.6841760510578752, "epoch": 1.8072639030252846, "grad_norm": 0.15626397728919983, "learning_rate": 3.97614009261815e-05, "loss": 0.6603, "mean_token_accuracy": 0.7970505580306053, "num_tokens": 626953015.0, "step": 19643 }, { "entropy": 0.552998268045485, "epoch": 1.8073559093967257, "grad_norm": 0.1438778191804886, "learning_rate": 3.975833410003987e-05, "loss": 0.533, "mean_token_accuracy": 0.8315803520381451, "num_tokens": 626984966.0, "step": 19644 }, { "entropy": 0.6776526905596256, "epoch": 1.8074479157681669, "grad_norm": 0.1627083420753479, "learning_rate": 3.9755267273898246e-05, "loss": 0.6657, "mean_token_accuracy": 0.7970243021845818, "num_tokens": 627016847.0, "step": 19645 }, { "entropy": 0.6516958400607109, "epoch": 1.807539922139608, "grad_norm": 0.16326472163200378, "learning_rate": 3.975220044775662e-05, "loss": 0.6408, "mean_token_accuracy": 0.8019921071827412, "num_tokens": 627049011.0, "step": 19646 }, { "entropy": 0.6041748151183128, "epoch": 1.8076319285110494, "grad_norm": 0.15012909471988678, "learning_rate": 3.9749133621614995e-05, "loss": 0.5896, "mean_token_accuracy": 0.8176882304251194, "num_tokens": 627081217.0, "step": 19647 }, { "entropy": 0.6770211942493916, "epoch": 1.8077239348824907, "grad_norm": 0.16324415802955627, "learning_rate": 3.974606679547337e-05, "loss": 0.6738, "mean_token_accuracy": 0.7923110611736774, "num_tokens": 627113378.0, "step": 19648 }, { "entropy": 0.5906978934071958, "epoch": 1.8078159412539319, "grad_norm": 0.14981310069561005, "learning_rate": 3.974299996933174e-05, "loss": 0.5909, "mean_token_accuracy": 0.8213430196046829, "num_tokens": 627145361.0, "step": 19649 }, { "entropy": 0.62324183806777, "epoch": 1.807907947625373, "grad_norm": 0.16011789441108704, "learning_rate": 3.973993314319012e-05, "loss": 0.6225, "mean_token_accuracy": 0.8065179772675037, "num_tokens": 627176645.0, "step": 19650 }, { "entropy": 0.5927658644504845, "epoch": 1.8079999539968141, "grad_norm": 0.15172302722930908, "learning_rate": 3.973686631704849e-05, "loss": 0.5878, "mean_token_accuracy": 0.8214004784822464, "num_tokens": 627209043.0, "step": 19651 }, { "entropy": 0.5895733935758471, "epoch": 1.8080919603682555, "grad_norm": 0.15902145206928253, "learning_rate": 3.973379949090686e-05, "loss": 0.5806, "mean_token_accuracy": 0.8187830932438374, "num_tokens": 627240813.0, "step": 19652 }, { "entropy": 0.5731200408190489, "epoch": 1.8081839667396968, "grad_norm": 0.1529735028743744, "learning_rate": 3.9730732664765236e-05, "loss": 0.5786, "mean_token_accuracy": 0.820721298456192, "num_tokens": 627272905.0, "step": 19653 }, { "entropy": 0.6665705479681492, "epoch": 1.808275973111138, "grad_norm": 0.15835808217525482, "learning_rate": 3.972766583862361e-05, "loss": 0.6675, "mean_token_accuracy": 0.7926051616668701, "num_tokens": 627305240.0, "step": 19654 }, { "entropy": 0.6534702572971582, "epoch": 1.808367979482579, "grad_norm": 0.1633821427822113, "learning_rate": 3.9724599012481986e-05, "loss": 0.6558, "mean_token_accuracy": 0.7964672073721886, "num_tokens": 627336937.0, "step": 19655 }, { "entropy": 0.6467355517670512, "epoch": 1.8084599858540202, "grad_norm": 0.1664830893278122, "learning_rate": 3.972153218634036e-05, "loss": 0.6409, "mean_token_accuracy": 0.8023283258080482, "num_tokens": 627368682.0, "step": 19656 }, { "entropy": 0.6302555203437805, "epoch": 1.8085519922254616, "grad_norm": 0.15854424238204956, "learning_rate": 3.971846536019873e-05, "loss": 0.6286, "mean_token_accuracy": 0.8084743730723858, "num_tokens": 627400318.0, "step": 19657 }, { "entropy": 0.6116820406168699, "epoch": 1.808643998596903, "grad_norm": 0.15676969289779663, "learning_rate": 3.971539853405711e-05, "loss": 0.607, "mean_token_accuracy": 0.8154205717146397, "num_tokens": 627432448.0, "step": 19658 }, { "entropy": 0.696822096593678, "epoch": 1.808736004968344, "grad_norm": 0.1656191200017929, "learning_rate": 3.971233170791548e-05, "loss": 0.6959, "mean_token_accuracy": 0.7916296049952507, "num_tokens": 627464248.0, "step": 19659 }, { "entropy": 0.5494493255391717, "epoch": 1.8088280113397852, "grad_norm": 0.14777375757694244, "learning_rate": 3.970926488177386e-05, "loss": 0.546, "mean_token_accuracy": 0.8331186957657337, "num_tokens": 627496277.0, "step": 19660 }, { "entropy": 0.6279708351939917, "epoch": 1.8089200177112263, "grad_norm": 0.15496326982975006, "learning_rate": 3.970619805563223e-05, "loss": 0.6122, "mean_token_accuracy": 0.8077601827681065, "num_tokens": 627527541.0, "step": 19661 }, { "entropy": 0.6444310508668423, "epoch": 1.8090120240826677, "grad_norm": 0.15678004920482635, "learning_rate": 3.97031312294906e-05, "loss": 0.624, "mean_token_accuracy": 0.8115927986800671, "num_tokens": 627559815.0, "step": 19662 }, { "entropy": 0.5789706772193313, "epoch": 1.809104030454109, "grad_norm": 0.14405949413776398, "learning_rate": 3.9700064403348976e-05, "loss": 0.573, "mean_token_accuracy": 0.8221257142722607, "num_tokens": 627591893.0, "step": 19663 }, { "entropy": 0.6454068794846535, "epoch": 1.8091960368255502, "grad_norm": 0.15753352642059326, "learning_rate": 3.969699757720735e-05, "loss": 0.631, "mean_token_accuracy": 0.8060212172567844, "num_tokens": 627623968.0, "step": 19664 }, { "entropy": 0.623670669272542, "epoch": 1.8092880431969913, "grad_norm": 0.15532860159873962, "learning_rate": 3.9693930751065725e-05, "loss": 0.6061, "mean_token_accuracy": 0.8128023259341717, "num_tokens": 627655687.0, "step": 19665 }, { "entropy": 0.5377589035779238, "epoch": 1.8093800495684325, "grad_norm": 0.14832980930805206, "learning_rate": 3.96908639249241e-05, "loss": 0.5249, "mean_token_accuracy": 0.8374062739312649, "num_tokens": 627687716.0, "step": 19666 }, { "entropy": 0.5742120947688818, "epoch": 1.8094720559398738, "grad_norm": 0.14446763694286346, "learning_rate": 3.968779709878247e-05, "loss": 0.561, "mean_token_accuracy": 0.8299418799579144, "num_tokens": 627720478.0, "step": 19667 }, { "entropy": 0.5798861859366298, "epoch": 1.8095640623113152, "grad_norm": 0.15320245921611786, "learning_rate": 3.968473027264085e-05, "loss": 0.565, "mean_token_accuracy": 0.8230891264975071, "num_tokens": 627752908.0, "step": 19668 }, { "entropy": 0.6220960305072367, "epoch": 1.8096560686827563, "grad_norm": 0.15212859213352203, "learning_rate": 3.968166344649922e-05, "loss": 0.6055, "mean_token_accuracy": 0.814737219363451, "num_tokens": 627784963.0, "step": 19669 }, { "entropy": 0.63857277110219, "epoch": 1.8097480750541974, "grad_norm": 0.1516975313425064, "learning_rate": 3.967859662035759e-05, "loss": 0.6289, "mean_token_accuracy": 0.8030969649553299, "num_tokens": 627817300.0, "step": 19670 }, { "entropy": 0.6172918742522597, "epoch": 1.8098400814256386, "grad_norm": 0.152446448802948, "learning_rate": 3.9675529794215966e-05, "loss": 0.5909, "mean_token_accuracy": 0.8175718896090984, "num_tokens": 627849008.0, "step": 19671 }, { "entropy": 0.6132394429296255, "epoch": 1.80993208779708, "grad_norm": 0.1516912281513214, "learning_rate": 3.967246296807434e-05, "loss": 0.6051, "mean_token_accuracy": 0.8129455409944057, "num_tokens": 627880924.0, "step": 19672 }, { "entropy": 0.6194743940141052, "epoch": 1.8100240941685213, "grad_norm": 0.1512969434261322, "learning_rate": 3.9669396141932716e-05, "loss": 0.614, "mean_token_accuracy": 0.8104345314204693, "num_tokens": 627912690.0, "step": 19673 }, { "entropy": 0.5985826491378248, "epoch": 1.8101161005399624, "grad_norm": 0.15292873978614807, "learning_rate": 3.966632931579109e-05, "loss": 0.5933, "mean_token_accuracy": 0.816997341811657, "num_tokens": 627945455.0, "step": 19674 }, { "entropy": 0.7187135852873325, "epoch": 1.8102081069114035, "grad_norm": 0.15833356976509094, "learning_rate": 3.966326248964946e-05, "loss": 0.7083, "mean_token_accuracy": 0.7811440266668797, "num_tokens": 627976602.0, "step": 19675 }, { "entropy": 0.6594322845339775, "epoch": 1.8103001132828447, "grad_norm": 0.16023971140384674, "learning_rate": 3.966019566350784e-05, "loss": 0.6532, "mean_token_accuracy": 0.8020622804760933, "num_tokens": 628008627.0, "step": 19676 }, { "entropy": 0.6178475208580494, "epoch": 1.810392119654286, "grad_norm": 0.15351584553718567, "learning_rate": 3.9657128837366214e-05, "loss": 0.6096, "mean_token_accuracy": 0.809376772493124, "num_tokens": 628040807.0, "step": 19677 }, { "entropy": 0.6504745595157146, "epoch": 1.8104841260257274, "grad_norm": 0.16227437555789948, "learning_rate": 3.965406201122458e-05, "loss": 0.6466, "mean_token_accuracy": 0.8042128272354603, "num_tokens": 628072879.0, "step": 19678 }, { "entropy": 0.5982335391454399, "epoch": 1.8105761323971685, "grad_norm": 0.15333744883537292, "learning_rate": 3.9650995185082964e-05, "loss": 0.5827, "mean_token_accuracy": 0.8210091292858124, "num_tokens": 628104424.0, "step": 19679 }, { "entropy": 0.6618705056607723, "epoch": 1.8106681387686097, "grad_norm": 0.1643526554107666, "learning_rate": 3.964792835894133e-05, "loss": 0.6438, "mean_token_accuracy": 0.8042960986495018, "num_tokens": 628135695.0, "step": 19680 }, { "entropy": 0.6380316540598869, "epoch": 1.8107601451400508, "grad_norm": 0.1640622913837433, "learning_rate": 3.964486153279971e-05, "loss": 0.6227, "mean_token_accuracy": 0.8093059286475182, "num_tokens": 628167939.0, "step": 19681 }, { "entropy": 0.5122465454041958, "epoch": 1.8108521515114921, "grad_norm": 0.134424090385437, "learning_rate": 3.964179470665808e-05, "loss": 0.5055, "mean_token_accuracy": 0.8434580378234386, "num_tokens": 628200171.0, "step": 19682 }, { "entropy": 0.6119568422436714, "epoch": 1.8109441578829335, "grad_norm": 0.1563064306974411, "learning_rate": 3.9638727880516455e-05, "loss": 0.5984, "mean_token_accuracy": 0.8166946992278099, "num_tokens": 628231675.0, "step": 19683 }, { "entropy": 0.6241343263536692, "epoch": 1.8110361642543746, "grad_norm": 0.1553719937801361, "learning_rate": 3.963566105437483e-05, "loss": 0.6147, "mean_token_accuracy": 0.8125998117029667, "num_tokens": 628263687.0, "step": 19684 }, { "entropy": 0.6335924118757248, "epoch": 1.8111281706258158, "grad_norm": 0.15284977853298187, "learning_rate": 3.9632594228233205e-05, "loss": 0.6301, "mean_token_accuracy": 0.8085798099637032, "num_tokens": 628296373.0, "step": 19685 }, { "entropy": 0.6521509476006031, "epoch": 1.811220176997257, "grad_norm": 0.15602418780326843, "learning_rate": 3.962952740209158e-05, "loss": 0.653, "mean_token_accuracy": 0.7963877134025097, "num_tokens": 628327894.0, "step": 19686 }, { "entropy": 0.5320874815806746, "epoch": 1.8113121833686983, "grad_norm": 0.1467352658510208, "learning_rate": 3.9626460575949954e-05, "loss": 0.5111, "mean_token_accuracy": 0.840484581887722, "num_tokens": 628358614.0, "step": 19687 }, { "entropy": 0.5231002988293767, "epoch": 1.8114041897401396, "grad_norm": 0.14479777216911316, "learning_rate": 3.962339374980832e-05, "loss": 0.5162, "mean_token_accuracy": 0.8395036980509758, "num_tokens": 628390463.0, "step": 19688 }, { "entropy": 0.5493338275700808, "epoch": 1.8114961961115807, "grad_norm": 0.1434902548789978, "learning_rate": 3.96203269236667e-05, "loss": 0.5294, "mean_token_accuracy": 0.836127232760191, "num_tokens": 628422591.0, "step": 19689 }, { "entropy": 0.6085146218538284, "epoch": 1.8115882024830219, "grad_norm": 0.15082666277885437, "learning_rate": 3.961726009752507e-05, "loss": 0.5981, "mean_token_accuracy": 0.8151587657630444, "num_tokens": 628455122.0, "step": 19690 }, { "entropy": 0.5778056536801159, "epoch": 1.811680208854463, "grad_norm": 0.1453019082546234, "learning_rate": 3.9614193271383446e-05, "loss": 0.5668, "mean_token_accuracy": 0.8242072835564613, "num_tokens": 628487139.0, "step": 19691 }, { "entropy": 0.6580625409260392, "epoch": 1.8117722152259044, "grad_norm": 0.16247721016407013, "learning_rate": 3.961112644524182e-05, "loss": 0.6388, "mean_token_accuracy": 0.8030034564435482, "num_tokens": 628518783.0, "step": 19692 }, { "entropy": 0.584586514160037, "epoch": 1.8118642215973457, "grad_norm": 0.15264011919498444, "learning_rate": 3.9608059619100195e-05, "loss": 0.5711, "mean_token_accuracy": 0.8234907798469067, "num_tokens": 628550814.0, "step": 19693 }, { "entropy": 0.602263362146914, "epoch": 1.8119562279687869, "grad_norm": 0.15396302938461304, "learning_rate": 3.960499279295857e-05, "loss": 0.6012, "mean_token_accuracy": 0.8162215650081635, "num_tokens": 628582617.0, "step": 19694 }, { "entropy": 0.5671120677143335, "epoch": 1.812048234340228, "grad_norm": 0.1575791984796524, "learning_rate": 3.9601925966816944e-05, "loss": 0.5567, "mean_token_accuracy": 0.82882134988904, "num_tokens": 628614397.0, "step": 19695 }, { "entropy": 0.5681473631411791, "epoch": 1.8121402407116691, "grad_norm": 0.14778997004032135, "learning_rate": 3.959885914067531e-05, "loss": 0.5589, "mean_token_accuracy": 0.8255801610648632, "num_tokens": 628646714.0, "step": 19696 }, { "entropy": 0.5264808405190706, "epoch": 1.8122322470831105, "grad_norm": 0.1436534970998764, "learning_rate": 3.9595792314533694e-05, "loss": 0.528, "mean_token_accuracy": 0.8375953026115894, "num_tokens": 628679131.0, "step": 19697 }, { "entropy": 0.6305881338194013, "epoch": 1.8123242534545518, "grad_norm": 0.15311592817306519, "learning_rate": 3.959272548839206e-05, "loss": 0.6264, "mean_token_accuracy": 0.8080295026302338, "num_tokens": 628711667.0, "step": 19698 }, { "entropy": 0.6151694301515818, "epoch": 1.812416259825993, "grad_norm": 0.15470287203788757, "learning_rate": 3.9589658662250436e-05, "loss": 0.6164, "mean_token_accuracy": 0.8079346679151058, "num_tokens": 628743723.0, "step": 19699 }, { "entropy": 0.5169369033537805, "epoch": 1.812508266197434, "grad_norm": 0.14927425980567932, "learning_rate": 3.958659183610881e-05, "loss": 0.5146, "mean_token_accuracy": 0.8410098776221275, "num_tokens": 628775829.0, "step": 19700 }, { "entropy": 0.568115446716547, "epoch": 1.8126002725688752, "grad_norm": 0.1524483859539032, "learning_rate": 3.9583525009967186e-05, "loss": 0.5643, "mean_token_accuracy": 0.8268774636089802, "num_tokens": 628807382.0, "step": 19701 }, { "entropy": 0.5744534619152546, "epoch": 1.8126922789403166, "grad_norm": 0.15048383176326752, "learning_rate": 3.958045818382556e-05, "loss": 0.5709, "mean_token_accuracy": 0.8240157328546047, "num_tokens": 628839324.0, "step": 19702 }, { "entropy": 0.6627124436199665, "epoch": 1.812784285311758, "grad_norm": 0.17060625553131104, "learning_rate": 3.9577391357683935e-05, "loss": 0.6608, "mean_token_accuracy": 0.7947409972548485, "num_tokens": 628869846.0, "step": 19703 }, { "entropy": 0.4791695661842823, "epoch": 1.812876291683199, "grad_norm": 0.13919039070606232, "learning_rate": 3.957432453154231e-05, "loss": 0.4589, "mean_token_accuracy": 0.8562414981424809, "num_tokens": 628902185.0, "step": 19704 }, { "entropy": 0.537745650857687, "epoch": 1.8129682980546402, "grad_norm": 0.15471796691417694, "learning_rate": 3.9571257705400684e-05, "loss": 0.5183, "mean_token_accuracy": 0.8378068171441555, "num_tokens": 628933750.0, "step": 19705 }, { "entropy": 0.6150593236088753, "epoch": 1.8130603044260813, "grad_norm": 0.15215405821800232, "learning_rate": 3.956819087925906e-05, "loss": 0.6095, "mean_token_accuracy": 0.8120644278824329, "num_tokens": 628964707.0, "step": 19706 }, { "entropy": 0.6210300559177995, "epoch": 1.8131523107975227, "grad_norm": 0.1572948545217514, "learning_rate": 3.9565124053117433e-05, "loss": 0.6184, "mean_token_accuracy": 0.8110714256763458, "num_tokens": 628996534.0, "step": 19707 }, { "entropy": 0.6500789020210505, "epoch": 1.813244317168964, "grad_norm": 0.15416067838668823, "learning_rate": 3.956205722697581e-05, "loss": 0.6414, "mean_token_accuracy": 0.8051158599555492, "num_tokens": 629028998.0, "step": 19708 }, { "entropy": 0.6662484016269445, "epoch": 1.8133363235404052, "grad_norm": 0.16312384605407715, "learning_rate": 3.9558990400834176e-05, "loss": 0.6477, "mean_token_accuracy": 0.8077716417610645, "num_tokens": 629060438.0, "step": 19709 }, { "entropy": 0.6253886353224516, "epoch": 1.8134283299118463, "grad_norm": 0.15393348038196564, "learning_rate": 3.955592357469256e-05, "loss": 0.6234, "mean_token_accuracy": 0.8142906613647938, "num_tokens": 629092716.0, "step": 19710 }, { "entropy": 0.5715093603357673, "epoch": 1.8135203362832875, "grad_norm": 0.14729921519756317, "learning_rate": 3.9552856748550925e-05, "loss": 0.5457, "mean_token_accuracy": 0.8304898962378502, "num_tokens": 629124955.0, "step": 19711 }, { "entropy": 0.743172274902463, "epoch": 1.8136123426547288, "grad_norm": 0.16798511147499084, "learning_rate": 3.95497899224093e-05, "loss": 0.7437, "mean_token_accuracy": 0.7750237509608269, "num_tokens": 629156623.0, "step": 19712 }, { "entropy": 0.6193050723522902, "epoch": 1.8137043490261702, "grad_norm": 0.16288545727729797, "learning_rate": 3.9546723096267675e-05, "loss": 0.6231, "mean_token_accuracy": 0.8078775815665722, "num_tokens": 629188171.0, "step": 19713 }, { "entropy": 0.5938343936577439, "epoch": 1.8137963553976113, "grad_norm": 0.15190906822681427, "learning_rate": 3.954365627012605e-05, "loss": 0.5792, "mean_token_accuracy": 0.8249057233333588, "num_tokens": 629219911.0, "step": 19714 }, { "entropy": 0.6478706244379282, "epoch": 1.8138883617690524, "grad_norm": 0.1607835590839386, "learning_rate": 3.9540589443984424e-05, "loss": 0.6411, "mean_token_accuracy": 0.8029736280441284, "num_tokens": 629251226.0, "step": 19715 }, { "entropy": 0.6149553749710321, "epoch": 1.8139803681404936, "grad_norm": 0.1489783674478531, "learning_rate": 3.95375226178428e-05, "loss": 0.5998, "mean_token_accuracy": 0.8143852315843105, "num_tokens": 629283187.0, "step": 19716 }, { "entropy": 0.5488078556954861, "epoch": 1.814072374511935, "grad_norm": 0.14112313091754913, "learning_rate": 3.9534455791701166e-05, "loss": 0.5344, "mean_token_accuracy": 0.8337725512683392, "num_tokens": 629315304.0, "step": 19717 }, { "entropy": 0.6854302790015936, "epoch": 1.8141643808833763, "grad_norm": 0.15913434326648712, "learning_rate": 3.953138896555955e-05, "loss": 0.6794, "mean_token_accuracy": 0.7930089384317398, "num_tokens": 629347271.0, "step": 19718 }, { "entropy": 0.5553973792120814, "epoch": 1.8142563872548174, "grad_norm": 0.1545877456665039, "learning_rate": 3.9528322139417916e-05, "loss": 0.5409, "mean_token_accuracy": 0.831506285816431, "num_tokens": 629379016.0, "step": 19719 }, { "entropy": 0.5504013886675239, "epoch": 1.8143483936262585, "grad_norm": 0.15012450516223907, "learning_rate": 3.95252553132763e-05, "loss": 0.543, "mean_token_accuracy": 0.8336714841425419, "num_tokens": 629410994.0, "step": 19720 }, { "entropy": 0.38484102254733443, "epoch": 1.8144403999976997, "grad_norm": 0.13792476058006287, "learning_rate": 3.9522188487134665e-05, "loss": 0.3584, "mean_token_accuracy": 0.8816006779670715, "num_tokens": 629442511.0, "step": 19721 }, { "entropy": 0.5453576277941465, "epoch": 1.814532406369141, "grad_norm": 0.15709304809570312, "learning_rate": 3.951912166099304e-05, "loss": 0.5461, "mean_token_accuracy": 0.8345802277326584, "num_tokens": 629473485.0, "step": 19722 }, { "entropy": 0.6637547928839922, "epoch": 1.8146244127405824, "grad_norm": 0.16025881469249725, "learning_rate": 3.9516054834851414e-05, "loss": 0.6468, "mean_token_accuracy": 0.8003109507262707, "num_tokens": 629504058.0, "step": 19723 }, { "entropy": 0.6238271147012711, "epoch": 1.8147164191120235, "grad_norm": 0.15629273653030396, "learning_rate": 3.951298800870979e-05, "loss": 0.6141, "mean_token_accuracy": 0.8134229220449924, "num_tokens": 629536494.0, "step": 19724 }, { "entropy": 0.5855920650064945, "epoch": 1.8148084254834647, "grad_norm": 0.14767485857009888, "learning_rate": 3.9509921182568164e-05, "loss": 0.5697, "mean_token_accuracy": 0.8275228329002857, "num_tokens": 629568618.0, "step": 19725 }, { "entropy": 0.7276223711669445, "epoch": 1.8149004318549058, "grad_norm": 0.15991097688674927, "learning_rate": 3.950685435642654e-05, "loss": 0.715, "mean_token_accuracy": 0.7796902917325497, "num_tokens": 629600316.0, "step": 19726 }, { "entropy": 0.5978738889098167, "epoch": 1.8149924382263471, "grad_norm": 0.15801508724689484, "learning_rate": 3.9503787530284906e-05, "loss": 0.5934, "mean_token_accuracy": 0.8232935443520546, "num_tokens": 629632126.0, "step": 19727 }, { "entropy": 0.5875893570482731, "epoch": 1.8150844445977885, "grad_norm": 0.154197558760643, "learning_rate": 3.950072070414329e-05, "loss": 0.5736, "mean_token_accuracy": 0.8197552785277367, "num_tokens": 629662380.0, "step": 19728 }, { "entropy": 0.5951430397108197, "epoch": 1.8151764509692296, "grad_norm": 0.1492380052804947, "learning_rate": 3.9497653878001655e-05, "loss": 0.5789, "mean_token_accuracy": 0.8202965930104256, "num_tokens": 629695033.0, "step": 19729 }, { "entropy": 0.5739066116511822, "epoch": 1.8152684573406708, "grad_norm": 0.15680357813835144, "learning_rate": 3.949458705186003e-05, "loss": 0.5616, "mean_token_accuracy": 0.8281660825014114, "num_tokens": 629727520.0, "step": 19730 }, { "entropy": 0.5444769635796547, "epoch": 1.815360463712112, "grad_norm": 0.14970168471336365, "learning_rate": 3.9491520225718405e-05, "loss": 0.5318, "mean_token_accuracy": 0.8353056125342846, "num_tokens": 629759324.0, "step": 19731 }, { "entropy": 0.5757051100954413, "epoch": 1.8154524700835533, "grad_norm": 0.15515469014644623, "learning_rate": 3.948845339957678e-05, "loss": 0.5653, "mean_token_accuracy": 0.8217968456447124, "num_tokens": 629791138.0, "step": 19732 }, { "entropy": 0.5892382645979524, "epoch": 1.8155444764549946, "grad_norm": 0.1542702615261078, "learning_rate": 3.9485386573435154e-05, "loss": 0.5825, "mean_token_accuracy": 0.8159847743809223, "num_tokens": 629823209.0, "step": 19733 }, { "entropy": 0.6118314862251282, "epoch": 1.8156364828264357, "grad_norm": 0.15408022701740265, "learning_rate": 3.948231974729353e-05, "loss": 0.6063, "mean_token_accuracy": 0.8118037320673466, "num_tokens": 629855803.0, "step": 19734 }, { "entropy": 0.6086890585720539, "epoch": 1.8157284891978769, "grad_norm": 0.1643252670764923, "learning_rate": 3.9479252921151896e-05, "loss": 0.614, "mean_token_accuracy": 0.8124655373394489, "num_tokens": 629887460.0, "step": 19735 }, { "entropy": 0.602963694371283, "epoch": 1.815820495569318, "grad_norm": 0.1584659367799759, "learning_rate": 3.947618609501028e-05, "loss": 0.5847, "mean_token_accuracy": 0.8210466951131821, "num_tokens": 629918422.0, "step": 19736 }, { "entropy": 0.6641138703562319, "epoch": 1.8159125019407594, "grad_norm": 0.16033942997455597, "learning_rate": 3.947311926886865e-05, "loss": 0.6699, "mean_token_accuracy": 0.798770010471344, "num_tokens": 629949515.0, "step": 19737 }, { "entropy": 0.6168871927075088, "epoch": 1.8160045083122007, "grad_norm": 0.1516742706298828, "learning_rate": 3.947005244272702e-05, "loss": 0.6101, "mean_token_accuracy": 0.8125150613486767, "num_tokens": 629981157.0, "step": 19738 }, { "entropy": 0.6687012854963541, "epoch": 1.8160965146836419, "grad_norm": 0.16222846508026123, "learning_rate": 3.94669856165854e-05, "loss": 0.6647, "mean_token_accuracy": 0.7968453094363213, "num_tokens": 630013150.0, "step": 19739 }, { "entropy": 0.5480058584362268, "epoch": 1.816188521055083, "grad_norm": 0.14838817715644836, "learning_rate": 3.946391879044377e-05, "loss": 0.5364, "mean_token_accuracy": 0.8347251154482365, "num_tokens": 630045324.0, "step": 19740 }, { "entropy": 0.5431709391996264, "epoch": 1.8162805274265241, "grad_norm": 0.15010856091976166, "learning_rate": 3.946085196430215e-05, "loss": 0.5325, "mean_token_accuracy": 0.8378129303455353, "num_tokens": 630076834.0, "step": 19741 }, { "entropy": 0.5808139871805906, "epoch": 1.8163725337979655, "grad_norm": 0.15243010222911835, "learning_rate": 3.945778513816052e-05, "loss": 0.5716, "mean_token_accuracy": 0.8200706988573074, "num_tokens": 630108566.0, "step": 19742 }, { "entropy": 0.6152374763041735, "epoch": 1.8164645401694068, "grad_norm": 0.15277312695980072, "learning_rate": 3.9454718312018894e-05, "loss": 0.6006, "mean_token_accuracy": 0.8143699280917645, "num_tokens": 630140320.0, "step": 19743 }, { "entropy": 0.6205722843296826, "epoch": 1.816556546540848, "grad_norm": 0.1509697437286377, "learning_rate": 3.945165148587727e-05, "loss": 0.6102, "mean_token_accuracy": 0.8117179200053215, "num_tokens": 630172071.0, "step": 19744 }, { "entropy": 0.5409172819927335, "epoch": 1.816648552912289, "grad_norm": 0.14332666993141174, "learning_rate": 3.944858465973564e-05, "loss": 0.5287, "mean_token_accuracy": 0.8365112394094467, "num_tokens": 630204368.0, "step": 19745 }, { "entropy": 0.5638316185213625, "epoch": 1.8167405592837302, "grad_norm": 0.14540734887123108, "learning_rate": 3.944551783359402e-05, "loss": 0.5519, "mean_token_accuracy": 0.8320231214165688, "num_tokens": 630236355.0, "step": 19746 }, { "entropy": 0.5649634597357363, "epoch": 1.8168325656551716, "grad_norm": 0.14680038392543793, "learning_rate": 3.944245100745239e-05, "loss": 0.5476, "mean_token_accuracy": 0.8306943662464619, "num_tokens": 630268486.0, "step": 19747 }, { "entropy": 0.5316953994333744, "epoch": 1.816924572026613, "grad_norm": 0.15098562836647034, "learning_rate": 3.943938418131076e-05, "loss": 0.5269, "mean_token_accuracy": 0.8316545262932777, "num_tokens": 630300300.0, "step": 19748 }, { "entropy": 0.6183298509567976, "epoch": 1.817016578398054, "grad_norm": 0.1558936983346939, "learning_rate": 3.943631735516914e-05, "loss": 0.6026, "mean_token_accuracy": 0.817649345844984, "num_tokens": 630332326.0, "step": 19749 }, { "entropy": 0.5852311942726374, "epoch": 1.8171085847694952, "grad_norm": 0.15285801887512207, "learning_rate": 3.943325052902751e-05, "loss": 0.577, "mean_token_accuracy": 0.8229865878820419, "num_tokens": 630363830.0, "step": 19750 }, { "entropy": 0.6152221150696278, "epoch": 1.8172005911409363, "grad_norm": 0.15042981505393982, "learning_rate": 3.9430183702885884e-05, "loss": 0.6083, "mean_token_accuracy": 0.809850849211216, "num_tokens": 630395727.0, "step": 19751 }, { "entropy": 0.5435171769931912, "epoch": 1.8172925975123777, "grad_norm": 0.1446521133184433, "learning_rate": 3.942711687674426e-05, "loss": 0.5213, "mean_token_accuracy": 0.8404418900609016, "num_tokens": 630428439.0, "step": 19752 }, { "entropy": 0.47208412177860737, "epoch": 1.817384603883819, "grad_norm": 0.1403018832206726, "learning_rate": 3.942405005060263e-05, "loss": 0.4532, "mean_token_accuracy": 0.8593733347952366, "num_tokens": 630460478.0, "step": 19753 }, { "entropy": 0.569549985229969, "epoch": 1.8174766102552602, "grad_norm": 0.14403308928012848, "learning_rate": 3.942098322446101e-05, "loss": 0.5512, "mean_token_accuracy": 0.8279048651456833, "num_tokens": 630492394.0, "step": 19754 }, { "entropy": 0.5783231938257813, "epoch": 1.8175686166267013, "grad_norm": 0.15060964226722717, "learning_rate": 3.941791639831938e-05, "loss": 0.5734, "mean_token_accuracy": 0.8227127008140087, "num_tokens": 630524286.0, "step": 19755 }, { "entropy": 0.5931335184723139, "epoch": 1.8176606229981425, "grad_norm": 0.15663570165634155, "learning_rate": 3.941484957217775e-05, "loss": 0.5816, "mean_token_accuracy": 0.820449236780405, "num_tokens": 630556586.0, "step": 19756 }, { "entropy": 0.6532607916742563, "epoch": 1.8177526293695838, "grad_norm": 0.1629168689250946, "learning_rate": 3.941178274603613e-05, "loss": 0.6403, "mean_token_accuracy": 0.8014426343142986, "num_tokens": 630588746.0, "step": 19757 }, { "entropy": 0.5997466575354338, "epoch": 1.8178446357410252, "grad_norm": 0.15911872684955597, "learning_rate": 3.94087159198945e-05, "loss": 0.5918, "mean_token_accuracy": 0.8203820213675499, "num_tokens": 630620413.0, "step": 19758 }, { "entropy": 0.5997819118201733, "epoch": 1.8179366421124663, "grad_norm": 0.15112343430519104, "learning_rate": 3.9405649093752874e-05, "loss": 0.5916, "mean_token_accuracy": 0.8167109377682209, "num_tokens": 630652403.0, "step": 19759 }, { "entropy": 0.5674559427425265, "epoch": 1.8180286484839074, "grad_norm": 0.14801065623760223, "learning_rate": 3.940258226761125e-05, "loss": 0.555, "mean_token_accuracy": 0.8282895050942898, "num_tokens": 630684101.0, "step": 19760 }, { "entropy": 0.580199096351862, "epoch": 1.8181206548553486, "grad_norm": 0.15430352091789246, "learning_rate": 3.9399515441469624e-05, "loss": 0.5733, "mean_token_accuracy": 0.8203308507800102, "num_tokens": 630715754.0, "step": 19761 }, { "entropy": 0.5491148428991437, "epoch": 1.81821266122679, "grad_norm": 0.14829117059707642, "learning_rate": 3.9396448615328e-05, "loss": 0.5394, "mean_token_accuracy": 0.8327841088175774, "num_tokens": 630747858.0, "step": 19762 }, { "entropy": 0.6168736033141613, "epoch": 1.8183046675982313, "grad_norm": 0.15814171731472015, "learning_rate": 3.939338178918637e-05, "loss": 0.6042, "mean_token_accuracy": 0.8158666491508484, "num_tokens": 630779570.0, "step": 19763 }, { "entropy": 0.6315469890832901, "epoch": 1.8183966739696724, "grad_norm": 0.1555919349193573, "learning_rate": 3.939031496304475e-05, "loss": 0.6204, "mean_token_accuracy": 0.810073509812355, "num_tokens": 630810464.0, "step": 19764 }, { "entropy": 0.5470310715027153, "epoch": 1.8184886803411136, "grad_norm": 0.1535697728395462, "learning_rate": 3.938724813690312e-05, "loss": 0.5272, "mean_token_accuracy": 0.8377785198390484, "num_tokens": 630842572.0, "step": 19765 }, { "entropy": 0.6067739520221949, "epoch": 1.8185806867125547, "grad_norm": 0.15352113544940948, "learning_rate": 3.938418131076149e-05, "loss": 0.6048, "mean_token_accuracy": 0.8154333755373955, "num_tokens": 630874905.0, "step": 19766 }, { "entropy": 0.6752205993980169, "epoch": 1.818672693083996, "grad_norm": 0.1548513025045395, "learning_rate": 3.938111448461987e-05, "loss": 0.6697, "mean_token_accuracy": 0.7947340160608292, "num_tokens": 630907061.0, "step": 19767 }, { "entropy": 0.5739436661824584, "epoch": 1.8187646994554374, "grad_norm": 0.15076084434986115, "learning_rate": 3.9378047658478246e-05, "loss": 0.5598, "mean_token_accuracy": 0.8275816291570663, "num_tokens": 630939073.0, "step": 19768 }, { "entropy": 0.5608623493462801, "epoch": 1.8188567058268785, "grad_norm": 0.1490159034729004, "learning_rate": 3.9374980832336614e-05, "loss": 0.543, "mean_token_accuracy": 0.8323273360729218, "num_tokens": 630971379.0, "step": 19769 }, { "entropy": 0.6533097699284554, "epoch": 1.8189487121983197, "grad_norm": 0.16116264462471008, "learning_rate": 3.9371914006194996e-05, "loss": 0.6426, "mean_token_accuracy": 0.8067579381167889, "num_tokens": 631003032.0, "step": 19770 }, { "entropy": 0.5474647684022784, "epoch": 1.8190407185697608, "grad_norm": 0.15620918571949005, "learning_rate": 3.9368847180053363e-05, "loss": 0.5443, "mean_token_accuracy": 0.8272419199347496, "num_tokens": 631034794.0, "step": 19771 }, { "entropy": 0.560555418021977, "epoch": 1.8191327249412022, "grad_norm": 0.14557693898677826, "learning_rate": 3.936578035391174e-05, "loss": 0.5526, "mean_token_accuracy": 0.8287065513432026, "num_tokens": 631066936.0, "step": 19772 }, { "entropy": 0.6116153243929148, "epoch": 1.8192247313126435, "grad_norm": 0.16047804057598114, "learning_rate": 3.936271352777011e-05, "loss": 0.6068, "mean_token_accuracy": 0.811907272785902, "num_tokens": 631098780.0, "step": 19773 }, { "entropy": 0.6443048571236432, "epoch": 1.8193167376840846, "grad_norm": 0.1587250679731369, "learning_rate": 3.935964670162849e-05, "loss": 0.6263, "mean_token_accuracy": 0.8076195232570171, "num_tokens": 631130628.0, "step": 19774 }, { "entropy": 0.6270075421780348, "epoch": 1.8194087440555258, "grad_norm": 0.16180972754955292, "learning_rate": 3.935657987548686e-05, "loss": 0.614, "mean_token_accuracy": 0.8099572733044624, "num_tokens": 631162275.0, "step": 19775 }, { "entropy": 0.5304785813204944, "epoch": 1.819500750426967, "grad_norm": 0.14700011909008026, "learning_rate": 3.935351304934524e-05, "loss": 0.5127, "mean_token_accuracy": 0.8400330506265163, "num_tokens": 631194198.0, "step": 19776 }, { "entropy": 0.6074763834476471, "epoch": 1.8195927567984083, "grad_norm": 0.1535351574420929, "learning_rate": 3.9350446223203605e-05, "loss": 0.5932, "mean_token_accuracy": 0.8197964131832123, "num_tokens": 631226043.0, "step": 19777 }, { "entropy": 0.5268052583560348, "epoch": 1.8196847631698496, "grad_norm": 0.14781434834003448, "learning_rate": 3.9347379397061986e-05, "loss": 0.5106, "mean_token_accuracy": 0.8403132744133472, "num_tokens": 631257631.0, "step": 19778 }, { "entropy": 0.6667416524142027, "epoch": 1.8197767695412908, "grad_norm": 0.15836089849472046, "learning_rate": 3.9344312570920354e-05, "loss": 0.6471, "mean_token_accuracy": 0.8061173856258392, "num_tokens": 631289346.0, "step": 19779 }, { "entropy": 0.574977919459343, "epoch": 1.8198687759127319, "grad_norm": 0.15306390821933746, "learning_rate": 3.9341245744778735e-05, "loss": 0.5588, "mean_token_accuracy": 0.8264318965375423, "num_tokens": 631320516.0, "step": 19780 }, { "entropy": 0.5773590225726366, "epoch": 1.819960782284173, "grad_norm": 0.15007390081882477, "learning_rate": 3.93381789186371e-05, "loss": 0.5695, "mean_token_accuracy": 0.8242329098284245, "num_tokens": 631352782.0, "step": 19781 }, { "entropy": 0.6126144509762526, "epoch": 1.8200527886556144, "grad_norm": 0.15867426991462708, "learning_rate": 3.933511209249548e-05, "loss": 0.6146, "mean_token_accuracy": 0.8126066662371159, "num_tokens": 631385098.0, "step": 19782 }, { "entropy": 0.589085889980197, "epoch": 1.8201447950270557, "grad_norm": 0.15244127810001373, "learning_rate": 3.933204526635385e-05, "loss": 0.5928, "mean_token_accuracy": 0.8139771334826946, "num_tokens": 631417038.0, "step": 19783 }, { "entropy": 0.4934038622304797, "epoch": 1.8202368013984969, "grad_norm": 0.14001718163490295, "learning_rate": 3.932897844021223e-05, "loss": 0.4778, "mean_token_accuracy": 0.8489920943975449, "num_tokens": 631449448.0, "step": 19784 }, { "entropy": 0.5253515001386404, "epoch": 1.820328807769938, "grad_norm": 0.14452306926250458, "learning_rate": 3.93259116140706e-05, "loss": 0.5144, "mean_token_accuracy": 0.8372367024421692, "num_tokens": 631480997.0, "step": 19785 }, { "entropy": 0.61878811288625, "epoch": 1.8204208141413791, "grad_norm": 0.15377084910869598, "learning_rate": 3.9322844787928976e-05, "loss": 0.597, "mean_token_accuracy": 0.8119247332215309, "num_tokens": 631511712.0, "step": 19786 }, { "entropy": 0.6565455701202154, "epoch": 1.8205128205128205, "grad_norm": 0.16044799983501434, "learning_rate": 3.9319777961787344e-05, "loss": 0.649, "mean_token_accuracy": 0.8013779297471046, "num_tokens": 631542451.0, "step": 19787 }, { "entropy": 0.6352641293779016, "epoch": 1.8206048268842618, "grad_norm": 0.15890547633171082, "learning_rate": 3.9316711135645726e-05, "loss": 0.6258, "mean_token_accuracy": 0.8098976537585258, "num_tokens": 631574553.0, "step": 19788 }, { "entropy": 0.701197418384254, "epoch": 1.820696833255703, "grad_norm": 0.16583281755447388, "learning_rate": 3.9313644309504094e-05, "loss": 0.7025, "mean_token_accuracy": 0.7880775481462479, "num_tokens": 631606521.0, "step": 19789 }, { "entropy": 0.530003952793777, "epoch": 1.820788839627144, "grad_norm": 0.14862646162509918, "learning_rate": 3.931057748336247e-05, "loss": 0.5255, "mean_token_accuracy": 0.8393947668373585, "num_tokens": 631638293.0, "step": 19790 }, { "entropy": 0.4715066347271204, "epoch": 1.8208808459985852, "grad_norm": 0.14435617625713348, "learning_rate": 3.930751065722084e-05, "loss": 0.4654, "mean_token_accuracy": 0.8567493371665478, "num_tokens": 631670461.0, "step": 19791 }, { "entropy": 0.5731705725193024, "epoch": 1.8209728523700266, "grad_norm": 0.15881192684173584, "learning_rate": 3.930444383107922e-05, "loss": 0.572, "mean_token_accuracy": 0.8248885497450829, "num_tokens": 631703206.0, "step": 19792 }, { "entropy": 0.46784820035099983, "epoch": 1.821064858741468, "grad_norm": 0.1445855349302292, "learning_rate": 3.930137700493759e-05, "loss": 0.4612, "mean_token_accuracy": 0.8563790954649448, "num_tokens": 631735436.0, "step": 19793 }, { "entropy": 0.5838362611830235, "epoch": 1.821156865112909, "grad_norm": 0.15169905126094818, "learning_rate": 3.929831017879597e-05, "loss": 0.5718, "mean_token_accuracy": 0.8215962648391724, "num_tokens": 631766920.0, "step": 19794 }, { "entropy": 0.60914128087461, "epoch": 1.8212488714843502, "grad_norm": 0.1730475276708603, "learning_rate": 3.9295243352654335e-05, "loss": 0.62, "mean_token_accuracy": 0.814936388283968, "num_tokens": 631798568.0, "step": 19795 }, { "entropy": 0.5722020035609603, "epoch": 1.8213408778557914, "grad_norm": 0.15139129757881165, "learning_rate": 3.9292176526512716e-05, "loss": 0.5607, "mean_token_accuracy": 0.8271509930491447, "num_tokens": 631830495.0, "step": 19796 }, { "entropy": 0.6473117806017399, "epoch": 1.8214328842272327, "grad_norm": 0.15577568113803864, "learning_rate": 3.9289109700371084e-05, "loss": 0.6309, "mean_token_accuracy": 0.8047800175845623, "num_tokens": 631862447.0, "step": 19797 }, { "entropy": 0.5784150836989284, "epoch": 1.821524890598674, "grad_norm": 0.1552949994802475, "learning_rate": 3.928604287422946e-05, "loss": 0.5697, "mean_token_accuracy": 0.8262351118028164, "num_tokens": 631894617.0, "step": 19798 }, { "entropy": 0.6174054937437177, "epoch": 1.8216168969701152, "grad_norm": 0.15573450922966003, "learning_rate": 3.928297604808784e-05, "loss": 0.5906, "mean_token_accuracy": 0.814210083335638, "num_tokens": 631925631.0, "step": 19799 }, { "entropy": 0.5745542729273438, "epoch": 1.8217089033415563, "grad_norm": 0.15601183474063873, "learning_rate": 3.927990922194621e-05, "loss": 0.5661, "mean_token_accuracy": 0.8295669369399548, "num_tokens": 631956711.0, "step": 19800 }, { "entropy": 0.6619389485567808, "epoch": 1.8218009097129975, "grad_norm": 0.15327604115009308, "learning_rate": 3.927684239580459e-05, "loss": 0.6436, "mean_token_accuracy": 0.8031568117439747, "num_tokens": 631988774.0, "step": 19801 }, { "entropy": 0.7016433756798506, "epoch": 1.8218929160844388, "grad_norm": 0.16466665267944336, "learning_rate": 3.927377556966296e-05, "loss": 0.6874, "mean_token_accuracy": 0.7918103374540806, "num_tokens": 632019393.0, "step": 19802 }, { "entropy": 0.6588362650945783, "epoch": 1.8219849224558802, "grad_norm": 0.16073262691497803, "learning_rate": 3.927070874352133e-05, "loss": 0.6484, "mean_token_accuracy": 0.8022724241018295, "num_tokens": 632051668.0, "step": 19803 }, { "entropy": 0.6217780746519566, "epoch": 1.8220769288273213, "grad_norm": 0.1528976410627365, "learning_rate": 3.9267641917379706e-05, "loss": 0.609, "mean_token_accuracy": 0.8114331029355526, "num_tokens": 632084060.0, "step": 19804 }, { "entropy": 0.6427281219512224, "epoch": 1.8221689351987624, "grad_norm": 0.15237164497375488, "learning_rate": 3.926457509123808e-05, "loss": 0.6288, "mean_token_accuracy": 0.8050901293754578, "num_tokens": 632116304.0, "step": 19805 }, { "entropy": 0.5720177507027984, "epoch": 1.8222609415702036, "grad_norm": 0.14661270380020142, "learning_rate": 3.9261508265096456e-05, "loss": 0.5592, "mean_token_accuracy": 0.8296266570687294, "num_tokens": 632148635.0, "step": 19806 }, { "entropy": 0.506156996358186, "epoch": 1.822352947941645, "grad_norm": 0.14379213750362396, "learning_rate": 3.925844143895483e-05, "loss": 0.4915, "mean_token_accuracy": 0.8497302941977978, "num_tokens": 632180883.0, "step": 19807 }, { "entropy": 0.6199362650513649, "epoch": 1.8224449543130863, "grad_norm": 0.15158961713314056, "learning_rate": 3.92553746128132e-05, "loss": 0.6001, "mean_token_accuracy": 0.8126920983195305, "num_tokens": 632213000.0, "step": 19808 }, { "entropy": 0.598214359022677, "epoch": 1.8225369606845274, "grad_norm": 0.15871447324752808, "learning_rate": 3.925230778667158e-05, "loss": 0.5861, "mean_token_accuracy": 0.82323332503438, "num_tokens": 632244640.0, "step": 19809 }, { "entropy": 0.567473204806447, "epoch": 1.8226289670559686, "grad_norm": 0.14873924851417542, "learning_rate": 3.924924096052995e-05, "loss": 0.5434, "mean_token_accuracy": 0.8330237045884132, "num_tokens": 632276671.0, "step": 19810 }, { "entropy": 0.5912908473983407, "epoch": 1.8227209734274097, "grad_norm": 0.15278007090091705, "learning_rate": 3.924617413438832e-05, "loss": 0.5843, "mean_token_accuracy": 0.8162257708609104, "num_tokens": 632308685.0, "step": 19811 }, { "entropy": 0.7012377306818962, "epoch": 1.822812979798851, "grad_norm": 0.15983538329601288, "learning_rate": 3.92431073082467e-05, "loss": 0.6768, "mean_token_accuracy": 0.7911415100097656, "num_tokens": 632339355.0, "step": 19812 }, { "entropy": 0.5798200163990259, "epoch": 1.8229049861702924, "grad_norm": 0.14966019988059998, "learning_rate": 3.924004048210507e-05, "loss": 0.5615, "mean_token_accuracy": 0.8243272118270397, "num_tokens": 632370937.0, "step": 19813 }, { "entropy": 0.4719609811436385, "epoch": 1.8229969925417335, "grad_norm": 0.14259831607341766, "learning_rate": 3.9236973655963446e-05, "loss": 0.4572, "mean_token_accuracy": 0.8610514625906944, "num_tokens": 632403502.0, "step": 19814 }, { "entropy": 0.5994810126721859, "epoch": 1.8230889989131747, "grad_norm": 0.14957883954048157, "learning_rate": 3.923390682982182e-05, "loss": 0.588, "mean_token_accuracy": 0.8223004266619682, "num_tokens": 632435741.0, "step": 19815 }, { "entropy": 0.5781439477577806, "epoch": 1.8231810052846158, "grad_norm": 0.15745790302753448, "learning_rate": 3.923084000368019e-05, "loss": 0.5824, "mean_token_accuracy": 0.8170263506472111, "num_tokens": 632467736.0, "step": 19816 }, { "entropy": 0.6174198295921087, "epoch": 1.8232730116560572, "grad_norm": 0.1556810885667801, "learning_rate": 3.922777317753857e-05, "loss": 0.6139, "mean_token_accuracy": 0.8078222721815109, "num_tokens": 632499199.0, "step": 19817 }, { "entropy": 0.6296527278609574, "epoch": 1.8233650180274985, "grad_norm": 0.16015799343585968, "learning_rate": 3.922470635139694e-05, "loss": 0.6197, "mean_token_accuracy": 0.8084740750491619, "num_tokens": 632531129.0, "step": 19818 }, { "entropy": 0.58924017008394, "epoch": 1.8234570243989396, "grad_norm": 0.14960461854934692, "learning_rate": 3.922163952525531e-05, "loss": 0.5871, "mean_token_accuracy": 0.8211496733129025, "num_tokens": 632563532.0, "step": 19819 }, { "entropy": 0.6038908092305064, "epoch": 1.8235490307703808, "grad_norm": 0.1537250131368637, "learning_rate": 3.921857269911369e-05, "loss": 0.5783, "mean_token_accuracy": 0.8182860240340233, "num_tokens": 632595677.0, "step": 19820 }, { "entropy": 0.59375792555511, "epoch": 1.823641037141822, "grad_norm": 0.15674975514411926, "learning_rate": 3.921550587297206e-05, "loss": 0.5909, "mean_token_accuracy": 0.8174643814563751, "num_tokens": 632627766.0, "step": 19821 }, { "entropy": 0.506486302241683, "epoch": 1.8237330435132633, "grad_norm": 0.14141269028186798, "learning_rate": 3.9212439046830437e-05, "loss": 0.4904, "mean_token_accuracy": 0.8436726219952106, "num_tokens": 632660132.0, "step": 19822 }, { "entropy": 0.6376088354736567, "epoch": 1.8238250498847046, "grad_norm": 0.15830039978027344, "learning_rate": 3.920937222068881e-05, "loss": 0.6343, "mean_token_accuracy": 0.8063193149864674, "num_tokens": 632691651.0, "step": 19823 }, { "entropy": 0.61360246501863, "epoch": 1.8239170562561458, "grad_norm": 0.15192550420761108, "learning_rate": 3.9206305394547186e-05, "loss": 0.6097, "mean_token_accuracy": 0.8136050328612328, "num_tokens": 632723613.0, "step": 19824 }, { "entropy": 0.6629470661282539, "epoch": 1.8240090626275869, "grad_norm": 0.1548573076725006, "learning_rate": 3.920323856840556e-05, "loss": 0.6553, "mean_token_accuracy": 0.8009595163166523, "num_tokens": 632756306.0, "step": 19825 }, { "entropy": 0.5650609638541937, "epoch": 1.824101068999028, "grad_norm": 0.14665338397026062, "learning_rate": 3.920017174226393e-05, "loss": 0.5446, "mean_token_accuracy": 0.8297947756946087, "num_tokens": 632788666.0, "step": 19826 }, { "entropy": 0.557115700095892, "epoch": 1.8241930753704694, "grad_norm": 0.1457880288362503, "learning_rate": 3.919710491612231e-05, "loss": 0.5422, "mean_token_accuracy": 0.8338144607841969, "num_tokens": 632820955.0, "step": 19827 }, { "entropy": 0.5669169519096613, "epoch": 1.8242850817419107, "grad_norm": 0.14779885113239288, "learning_rate": 3.9194038089980684e-05, "loss": 0.5572, "mean_token_accuracy": 0.8285987675189972, "num_tokens": 632853167.0, "step": 19828 }, { "entropy": 0.6293983124196529, "epoch": 1.8243770881133519, "grad_norm": 0.15935036540031433, "learning_rate": 3.919097126383905e-05, "loss": 0.6318, "mean_token_accuracy": 0.8040303289890289, "num_tokens": 632884859.0, "step": 19829 }, { "entropy": 0.6517956340685487, "epoch": 1.824469094484793, "grad_norm": 0.1603582799434662, "learning_rate": 3.9187904437697434e-05, "loss": 0.644, "mean_token_accuracy": 0.8011641651391983, "num_tokens": 632916202.0, "step": 19830 }, { "entropy": 0.6104820491746068, "epoch": 1.8245611008562341, "grad_norm": 0.15735076367855072, "learning_rate": 3.91848376115558e-05, "loss": 0.5928, "mean_token_accuracy": 0.8172875791788101, "num_tokens": 632947415.0, "step": 19831 }, { "entropy": 0.6371979210525751, "epoch": 1.8246531072276755, "grad_norm": 0.15566714107990265, "learning_rate": 3.9181770785414176e-05, "loss": 0.6271, "mean_token_accuracy": 0.8140976056456566, "num_tokens": 632979115.0, "step": 19832 }, { "entropy": 0.6685224305838346, "epoch": 1.8247451135991168, "grad_norm": 0.15916772186756134, "learning_rate": 3.917870395927255e-05, "loss": 0.6624, "mean_token_accuracy": 0.7986115403473377, "num_tokens": 633011537.0, "step": 19833 }, { "entropy": 0.5839961264282465, "epoch": 1.824837119970558, "grad_norm": 0.14988869428634644, "learning_rate": 3.9175637133130926e-05, "loss": 0.5669, "mean_token_accuracy": 0.8234565556049347, "num_tokens": 633042839.0, "step": 19834 }, { "entropy": 0.6499148011207581, "epoch": 1.824929126341999, "grad_norm": 0.1549239456653595, "learning_rate": 3.91725703069893e-05, "loss": 0.6386, "mean_token_accuracy": 0.8013083562254906, "num_tokens": 633074744.0, "step": 19835 }, { "entropy": 0.6393122347071767, "epoch": 1.8250211327134402, "grad_norm": 0.1617501825094223, "learning_rate": 3.9169503480847675e-05, "loss": 0.6362, "mean_token_accuracy": 0.8077269829809666, "num_tokens": 633107052.0, "step": 19836 }, { "entropy": 0.6474182698875666, "epoch": 1.8251131390848816, "grad_norm": 0.15906934440135956, "learning_rate": 3.916643665470604e-05, "loss": 0.6476, "mean_token_accuracy": 0.8009101487696171, "num_tokens": 633138122.0, "step": 19837 }, { "entropy": 0.6330184899270535, "epoch": 1.825205145456323, "grad_norm": 0.15777632594108582, "learning_rate": 3.9163369828564424e-05, "loss": 0.6269, "mean_token_accuracy": 0.8062306046485901, "num_tokens": 633169744.0, "step": 19838 }, { "entropy": 0.6686136908829212, "epoch": 1.825297151827764, "grad_norm": 0.16348421573638916, "learning_rate": 3.916030300242279e-05, "loss": 0.6523, "mean_token_accuracy": 0.8003730215132236, "num_tokens": 633200687.0, "step": 19839 }, { "entropy": 0.5414921282790601, "epoch": 1.8253891581992052, "grad_norm": 0.14158686995506287, "learning_rate": 3.9157236176281173e-05, "loss": 0.5288, "mean_token_accuracy": 0.8332053273916245, "num_tokens": 633232966.0, "step": 19840 }, { "entropy": 0.6112580085173249, "epoch": 1.8254811645706464, "grad_norm": 0.15773580968379974, "learning_rate": 3.915416935013954e-05, "loss": 0.5977, "mean_token_accuracy": 0.8161465860903263, "num_tokens": 633264688.0, "step": 19841 }, { "entropy": 0.5816117357462645, "epoch": 1.8255731709420877, "grad_norm": 0.15458640456199646, "learning_rate": 3.9151102523997916e-05, "loss": 0.5746, "mean_token_accuracy": 0.8242774568498135, "num_tokens": 633296042.0, "step": 19842 }, { "entropy": 0.47842342872172594, "epoch": 1.825665177313529, "grad_norm": 0.14482048153877258, "learning_rate": 3.914803569785629e-05, "loss": 0.4795, "mean_token_accuracy": 0.8497943133115768, "num_tokens": 633328600.0, "step": 19843 }, { "entropy": 0.6627462888136506, "epoch": 1.8257571836849702, "grad_norm": 0.15639446675777435, "learning_rate": 3.9144968871714665e-05, "loss": 0.6601, "mean_token_accuracy": 0.7956443354487419, "num_tokens": 633361289.0, "step": 19844 }, { "entropy": 0.5582944545894861, "epoch": 1.8258491900564113, "grad_norm": 0.14855732023715973, "learning_rate": 3.914190204557304e-05, "loss": 0.5437, "mean_token_accuracy": 0.8315523155033588, "num_tokens": 633393149.0, "step": 19845 }, { "entropy": 0.5536662675440311, "epoch": 1.8259411964278525, "grad_norm": 0.15319974720478058, "learning_rate": 3.9138835219431415e-05, "loss": 0.5535, "mean_token_accuracy": 0.8322511613368988, "num_tokens": 633424952.0, "step": 19846 }, { "entropy": 0.6775252223014832, "epoch": 1.8260332027992938, "grad_norm": 0.16197389364242554, "learning_rate": 3.913576839328978e-05, "loss": 0.6696, "mean_token_accuracy": 0.8009588681161404, "num_tokens": 633456610.0, "step": 19847 }, { "entropy": 0.6456598532386124, "epoch": 1.8261252091707352, "grad_norm": 0.15763802826404572, "learning_rate": 3.9132701567148164e-05, "loss": 0.6406, "mean_token_accuracy": 0.8091340810060501, "num_tokens": 633488602.0, "step": 19848 }, { "entropy": 0.6756261307746172, "epoch": 1.8262172155421763, "grad_norm": 0.16841869056224823, "learning_rate": 3.912963474100653e-05, "loss": 0.6775, "mean_token_accuracy": 0.7944507002830505, "num_tokens": 633520924.0, "step": 19849 }, { "entropy": 0.7124388664960861, "epoch": 1.8263092219136174, "grad_norm": 0.1615920215845108, "learning_rate": 3.9126567914864906e-05, "loss": 0.6965, "mean_token_accuracy": 0.7873638793826103, "num_tokens": 633552724.0, "step": 19850 }, { "entropy": 0.5491883372887969, "epoch": 1.8264012282850586, "grad_norm": 0.14688290655612946, "learning_rate": 3.912350108872328e-05, "loss": 0.5367, "mean_token_accuracy": 0.8352403528988361, "num_tokens": 633584658.0, "step": 19851 }, { "entropy": 0.5974816682282835, "epoch": 1.8264932346565, "grad_norm": 0.14902400970458984, "learning_rate": 3.9120434262581656e-05, "loss": 0.5773, "mean_token_accuracy": 0.8263432309031487, "num_tokens": 633616682.0, "step": 19852 }, { "entropy": 0.6016256213188171, "epoch": 1.8265852410279413, "grad_norm": 0.15757644176483154, "learning_rate": 3.911736743644003e-05, "loss": 0.5903, "mean_token_accuracy": 0.8187605068087578, "num_tokens": 633648727.0, "step": 19853 }, { "entropy": 0.6486489996314049, "epoch": 1.8266772473993824, "grad_norm": 0.15394090116024017, "learning_rate": 3.9114300610298405e-05, "loss": 0.6391, "mean_token_accuracy": 0.8033328279852867, "num_tokens": 633680878.0, "step": 19854 }, { "entropy": 0.6494254022836685, "epoch": 1.8267692537708236, "grad_norm": 0.15659460425376892, "learning_rate": 3.911123378415677e-05, "loss": 0.644, "mean_token_accuracy": 0.8040993884205818, "num_tokens": 633712924.0, "step": 19855 }, { "entropy": 0.5586623037233949, "epoch": 1.8268612601422647, "grad_norm": 0.1448449194431305, "learning_rate": 3.9108166958015154e-05, "loss": 0.5323, "mean_token_accuracy": 0.8294123783707619, "num_tokens": 633743970.0, "step": 19856 }, { "entropy": 0.5615970042999834, "epoch": 1.826953266513706, "grad_norm": 0.14378778636455536, "learning_rate": 3.910510013187352e-05, "loss": 0.5435, "mean_token_accuracy": 0.8288321010768414, "num_tokens": 633776341.0, "step": 19857 }, { "entropy": 0.5624927114695311, "epoch": 1.8270452728851474, "grad_norm": 0.1492282599210739, "learning_rate": 3.91020333057319e-05, "loss": 0.54, "mean_token_accuracy": 0.8291319757699966, "num_tokens": 633807851.0, "step": 19858 }, { "entropy": 0.6143679097294807, "epoch": 1.8271372792565885, "grad_norm": 0.15611213445663452, "learning_rate": 3.909896647959028e-05, "loss": 0.6082, "mean_token_accuracy": 0.8114490322768688, "num_tokens": 633839649.0, "step": 19859 }, { "entropy": 0.6479475721716881, "epoch": 1.8272292856280297, "grad_norm": 0.16031794250011444, "learning_rate": 3.9095899653448646e-05, "loss": 0.6419, "mean_token_accuracy": 0.8035708703100681, "num_tokens": 633871085.0, "step": 19860 }, { "entropy": 0.7030995711684227, "epoch": 1.8273212919994708, "grad_norm": 0.16671623289585114, "learning_rate": 3.909283282730703e-05, "loss": 0.6941, "mean_token_accuracy": 0.7903513014316559, "num_tokens": 633901865.0, "step": 19861 }, { "entropy": 0.5566661767661572, "epoch": 1.8274132983709122, "grad_norm": 0.15358774363994598, "learning_rate": 3.9089766001165395e-05, "loss": 0.553, "mean_token_accuracy": 0.8272085748612881, "num_tokens": 633933503.0, "step": 19862 }, { "entropy": 0.5136841328348964, "epoch": 1.8275053047423535, "grad_norm": 0.14496691524982452, "learning_rate": 3.908669917502377e-05, "loss": 0.5074, "mean_token_accuracy": 0.8413980454206467, "num_tokens": 633965299.0, "step": 19863 }, { "entropy": 0.5686427191831172, "epoch": 1.8275973111137946, "grad_norm": 0.14838187396526337, "learning_rate": 3.9083632348882145e-05, "loss": 0.5606, "mean_token_accuracy": 0.8250141404569149, "num_tokens": 633997463.0, "step": 19864 }, { "entropy": 0.6434519793838263, "epoch": 1.8276893174852358, "grad_norm": 0.15733298659324646, "learning_rate": 3.908056552274052e-05, "loss": 0.658, "mean_token_accuracy": 0.8011999577283859, "num_tokens": 634029737.0, "step": 19865 }, { "entropy": 0.5492911636829376, "epoch": 1.827781323856677, "grad_norm": 0.1483149379491806, "learning_rate": 3.9077498696598894e-05, "loss": 0.543, "mean_token_accuracy": 0.8321733139455318, "num_tokens": 634061806.0, "step": 19866 }, { "entropy": 0.5113993743434548, "epoch": 1.8278733302281183, "grad_norm": 0.15125855803489685, "learning_rate": 3.907443187045727e-05, "loss": 0.5035, "mean_token_accuracy": 0.8402430824935436, "num_tokens": 634092813.0, "step": 19867 }, { "entropy": 0.4981024111621082, "epoch": 1.8279653365995596, "grad_norm": 0.13994039595127106, "learning_rate": 3.9071365044315636e-05, "loss": 0.4839, "mean_token_accuracy": 0.848338283598423, "num_tokens": 634125226.0, "step": 19868 }, { "entropy": 0.5927440710365772, "epoch": 1.8280573429710008, "grad_norm": 0.1574888527393341, "learning_rate": 3.906829821817402e-05, "loss": 0.6008, "mean_token_accuracy": 0.8144616708159447, "num_tokens": 634157741.0, "step": 19869 }, { "entropy": 0.6052021030336618, "epoch": 1.8281493493424419, "grad_norm": 0.1574500948190689, "learning_rate": 3.9065231392032386e-05, "loss": 0.5961, "mean_token_accuracy": 0.8132549785077572, "num_tokens": 634189471.0, "step": 19870 }, { "entropy": 0.636259245686233, "epoch": 1.828241355713883, "grad_norm": 0.15421156585216522, "learning_rate": 3.906216456589076e-05, "loss": 0.6264, "mean_token_accuracy": 0.8061500899493694, "num_tokens": 634221817.0, "step": 19871 }, { "entropy": 0.6591760646551847, "epoch": 1.8283333620853244, "grad_norm": 0.15373198688030243, "learning_rate": 3.9059097739749135e-05, "loss": 0.65, "mean_token_accuracy": 0.8036130182445049, "num_tokens": 634253928.0, "step": 19872 }, { "entropy": 0.6070649232715368, "epoch": 1.8284253684567657, "grad_norm": 0.147611603140831, "learning_rate": 3.905603091360751e-05, "loss": 0.5856, "mean_token_accuracy": 0.8204986341297626, "num_tokens": 634286196.0, "step": 19873 }, { "entropy": 0.7054956052452326, "epoch": 1.8285173748282069, "grad_norm": 0.16134116053581238, "learning_rate": 3.9052964087465884e-05, "loss": 0.6893, "mean_token_accuracy": 0.7880976721644402, "num_tokens": 634317911.0, "step": 19874 }, { "entropy": 0.4933500229381025, "epoch": 1.828609381199648, "grad_norm": 0.14188970625400543, "learning_rate": 3.904989726132426e-05, "loss": 0.4836, "mean_token_accuracy": 0.8523126766085625, "num_tokens": 634349856.0, "step": 19875 }, { "entropy": 0.6059444788843393, "epoch": 1.8287013875710891, "grad_norm": 0.1579563021659851, "learning_rate": 3.904683043518263e-05, "loss": 0.5899, "mean_token_accuracy": 0.8124179765582085, "num_tokens": 634381506.0, "step": 19876 }, { "entropy": 0.5511695668101311, "epoch": 1.8287933939425305, "grad_norm": 0.15095946192741394, "learning_rate": 3.904376360904101e-05, "loss": 0.5481, "mean_token_accuracy": 0.8327987343072891, "num_tokens": 634413193.0, "step": 19877 }, { "entropy": 0.572994421236217, "epoch": 1.8288854003139718, "grad_norm": 0.14503099024295807, "learning_rate": 3.9040696782899376e-05, "loss": 0.5554, "mean_token_accuracy": 0.826188113540411, "num_tokens": 634445337.0, "step": 19878 }, { "entropy": 0.620670079253614, "epoch": 1.828977406685413, "grad_norm": 0.1527947634458542, "learning_rate": 3.903762995675775e-05, "loss": 0.6081, "mean_token_accuracy": 0.8122021853923798, "num_tokens": 634476641.0, "step": 19879 }, { "entropy": 0.7121052243746817, "epoch": 1.829069413056854, "grad_norm": 0.1664702594280243, "learning_rate": 3.9034563130616125e-05, "loss": 0.7028, "mean_token_accuracy": 0.7835039906203747, "num_tokens": 634507421.0, "step": 19880 }, { "entropy": 0.6365646850317717, "epoch": 1.8291614194282952, "grad_norm": 0.15492604672908783, "learning_rate": 3.90314963044745e-05, "loss": 0.6268, "mean_token_accuracy": 0.8068000115454197, "num_tokens": 634539894.0, "step": 19881 }, { "entropy": 0.49801459163427353, "epoch": 1.8292534257997366, "grad_norm": 0.14262603223323822, "learning_rate": 3.9028429478332875e-05, "loss": 0.4796, "mean_token_accuracy": 0.849945243448019, "num_tokens": 634571605.0, "step": 19882 }, { "entropy": 0.6985286045819521, "epoch": 1.829345432171178, "grad_norm": 0.16070663928985596, "learning_rate": 3.902536265219125e-05, "loss": 0.6765, "mean_token_accuracy": 0.7940074093639851, "num_tokens": 634603173.0, "step": 19883 }, { "entropy": 0.5424622590653598, "epoch": 1.829437438542619, "grad_norm": 0.14792658388614655, "learning_rate": 3.9022295826049624e-05, "loss": 0.5395, "mean_token_accuracy": 0.8313979208469391, "num_tokens": 634635084.0, "step": 19884 }, { "entropy": 0.5323533955961466, "epoch": 1.8295294449140602, "grad_norm": 0.14811761677265167, "learning_rate": 3.9019228999908e-05, "loss": 0.5362, "mean_token_accuracy": 0.8366335853934288, "num_tokens": 634667181.0, "step": 19885 }, { "entropy": 0.4924714853987098, "epoch": 1.8296214512855014, "grad_norm": 0.14804711937904358, "learning_rate": 3.9016162173766367e-05, "loss": 0.4917, "mean_token_accuracy": 0.8447805382311344, "num_tokens": 634698835.0, "step": 19886 }, { "entropy": 0.5339353019371629, "epoch": 1.8297134576569427, "grad_norm": 0.15032202005386353, "learning_rate": 3.901309534762475e-05, "loss": 0.5361, "mean_token_accuracy": 0.8306933417916298, "num_tokens": 634730921.0, "step": 19887 }, { "entropy": 0.6655202452093363, "epoch": 1.829805464028384, "grad_norm": 0.16846531629562378, "learning_rate": 3.9010028521483116e-05, "loss": 0.6635, "mean_token_accuracy": 0.7950512394309044, "num_tokens": 634762258.0, "step": 19888 }, { "entropy": 0.6981137059628963, "epoch": 1.8298974703998252, "grad_norm": 0.16780465841293335, "learning_rate": 3.900696169534149e-05, "loss": 0.6881, "mean_token_accuracy": 0.7906225547194481, "num_tokens": 634794517.0, "step": 19889 }, { "entropy": 0.5242338189855218, "epoch": 1.8299894767712663, "grad_norm": 0.148575097322464, "learning_rate": 3.900389486919987e-05, "loss": 0.5113, "mean_token_accuracy": 0.840966984629631, "num_tokens": 634827001.0, "step": 19890 }, { "entropy": 0.6884240098297596, "epoch": 1.8300814831427077, "grad_norm": 0.16116617619991302, "learning_rate": 3.900082804305824e-05, "loss": 0.6889, "mean_token_accuracy": 0.7962048463523388, "num_tokens": 634858829.0, "step": 19891 }, { "entropy": 0.6852407548576593, "epoch": 1.8301734895141488, "grad_norm": 0.15616671741008759, "learning_rate": 3.8997761216916614e-05, "loss": 0.6761, "mean_token_accuracy": 0.794133760035038, "num_tokens": 634891142.0, "step": 19892 }, { "entropy": 0.5297086043283343, "epoch": 1.8302654958855902, "grad_norm": 0.14439569413661957, "learning_rate": 3.899469439077499e-05, "loss": 0.5161, "mean_token_accuracy": 0.8385345488786697, "num_tokens": 634923857.0, "step": 19893 }, { "entropy": 0.7422567848116159, "epoch": 1.8303575022570313, "grad_norm": 0.16355633735656738, "learning_rate": 3.8991627564633364e-05, "loss": 0.7218, "mean_token_accuracy": 0.7823065780103207, "num_tokens": 634955701.0, "step": 19894 }, { "entropy": 0.5537389335222542, "epoch": 1.8304495086284724, "grad_norm": 0.1456032693386078, "learning_rate": 3.898856073849174e-05, "loss": 0.5429, "mean_token_accuracy": 0.8303555808961391, "num_tokens": 634987434.0, "step": 19895 }, { "entropy": 0.6102211959660053, "epoch": 1.8305415149999138, "grad_norm": 0.1483270674943924, "learning_rate": 3.898549391235011e-05, "loss": 0.595, "mean_token_accuracy": 0.8165906667709351, "num_tokens": 635019688.0, "step": 19896 }, { "entropy": 0.5811237078160048, "epoch": 1.830633521371355, "grad_norm": 0.152780681848526, "learning_rate": 3.898242708620848e-05, "loss": 0.5756, "mean_token_accuracy": 0.8199742361903191, "num_tokens": 635051255.0, "step": 19897 }, { "entropy": 0.6259737852960825, "epoch": 1.8307255277427963, "grad_norm": 0.1507588028907776, "learning_rate": 3.897936026006686e-05, "loss": 0.6069, "mean_token_accuracy": 0.8112322576344013, "num_tokens": 635083078.0, "step": 19898 }, { "entropy": 0.5214025187306106, "epoch": 1.8308175341142374, "grad_norm": 0.1449107676744461, "learning_rate": 3.897629343392523e-05, "loss": 0.497, "mean_token_accuracy": 0.8441835530102253, "num_tokens": 635114341.0, "step": 19899 }, { "entropy": 0.5563333239406347, "epoch": 1.8309095404856786, "grad_norm": 0.15792666375637054, "learning_rate": 3.897322660778361e-05, "loss": 0.5636, "mean_token_accuracy": 0.8272029533982277, "num_tokens": 635145798.0, "step": 19900 }, { "entropy": 0.6774523369967937, "epoch": 1.83100154685712, "grad_norm": 0.15626291930675507, "learning_rate": 3.897015978164198e-05, "loss": 0.6702, "mean_token_accuracy": 0.7950319424271584, "num_tokens": 635178198.0, "step": 19901 }, { "entropy": 0.5485848388634622, "epoch": 1.831093553228561, "grad_norm": 0.146332249045372, "learning_rate": 3.8967092955500354e-05, "loss": 0.5439, "mean_token_accuracy": 0.8371820971369743, "num_tokens": 635210642.0, "step": 19902 }, { "entropy": 0.5278429575264454, "epoch": 1.8311855596000024, "grad_norm": 0.15099318325519562, "learning_rate": 3.896402612935873e-05, "loss": 0.5022, "mean_token_accuracy": 0.8422920852899551, "num_tokens": 635241040.0, "step": 19903 }, { "entropy": 0.6375988777726889, "epoch": 1.8312775659714435, "grad_norm": 0.15642240643501282, "learning_rate": 3.8960959303217103e-05, "loss": 0.6274, "mean_token_accuracy": 0.8069791831076145, "num_tokens": 635272307.0, "step": 19904 }, { "entropy": 0.5606421157717705, "epoch": 1.8313695723428847, "grad_norm": 0.1502746045589447, "learning_rate": 3.895789247707548e-05, "loss": 0.5543, "mean_token_accuracy": 0.8299155794084072, "num_tokens": 635304228.0, "step": 19905 }, { "entropy": 0.5330839795060456, "epoch": 1.831461578714326, "grad_norm": 0.15060746669769287, "learning_rate": 3.895482565093385e-05, "loss": 0.5145, "mean_token_accuracy": 0.8386052921414375, "num_tokens": 635336163.0, "step": 19906 }, { "entropy": 0.6470966637134552, "epoch": 1.8315535850857672, "grad_norm": 0.1558593511581421, "learning_rate": 3.895175882479222e-05, "loss": 0.6197, "mean_token_accuracy": 0.8114648759365082, "num_tokens": 635367815.0, "step": 19907 }, { "entropy": 0.5857968553900719, "epoch": 1.8316455914572085, "grad_norm": 0.15508174896240234, "learning_rate": 3.89486919986506e-05, "loss": 0.5702, "mean_token_accuracy": 0.8255869187414646, "num_tokens": 635399867.0, "step": 19908 }, { "entropy": 0.6263441108167171, "epoch": 1.8317375978286496, "grad_norm": 0.15409457683563232, "learning_rate": 3.894562517250897e-05, "loss": 0.62, "mean_token_accuracy": 0.8082178458571434, "num_tokens": 635432242.0, "step": 19909 }, { "entropy": 0.6011911612004042, "epoch": 1.8318296042000908, "grad_norm": 0.15030334889888763, "learning_rate": 3.8942558346367345e-05, "loss": 0.5889, "mean_token_accuracy": 0.8181871436536312, "num_tokens": 635463630.0, "step": 19910 }, { "entropy": 0.6362036969512701, "epoch": 1.8319216105715321, "grad_norm": 0.16115646064281464, "learning_rate": 3.893949152022572e-05, "loss": 0.6196, "mean_token_accuracy": 0.8088785633444786, "num_tokens": 635495291.0, "step": 19911 }, { "entropy": 0.43092378904111683, "epoch": 1.8320136169429733, "grad_norm": 0.13816939294338226, "learning_rate": 3.8936424694084094e-05, "loss": 0.4243, "mean_token_accuracy": 0.8669088929891586, "num_tokens": 635528059.0, "step": 19912 }, { "entropy": 0.6273954138159752, "epoch": 1.8321056233144146, "grad_norm": 0.15417280793190002, "learning_rate": 3.893335786794247e-05, "loss": 0.6221, "mean_token_accuracy": 0.8105021975934505, "num_tokens": 635560399.0, "step": 19913 }, { "entropy": 0.5455795400775969, "epoch": 1.8321976296858558, "grad_norm": 0.14414386451244354, "learning_rate": 3.893029104180084e-05, "loss": 0.538, "mean_token_accuracy": 0.8359489440917969, "num_tokens": 635593167.0, "step": 19914 }, { "entropy": 0.6564499959349632, "epoch": 1.8322896360572969, "grad_norm": 0.1516200751066208, "learning_rate": 3.892722421565921e-05, "loss": 0.6419, "mean_token_accuracy": 0.8061893880367279, "num_tokens": 635625428.0, "step": 19915 }, { "entropy": 0.5806982866488397, "epoch": 1.8323816424287382, "grad_norm": 0.1594536453485489, "learning_rate": 3.892415738951759e-05, "loss": 0.568, "mean_token_accuracy": 0.8259316757321358, "num_tokens": 635657146.0, "step": 19916 }, { "entropy": 0.5817151898518205, "epoch": 1.8324736488001794, "grad_norm": 0.1556638479232788, "learning_rate": 3.892109056337596e-05, "loss": 0.573, "mean_token_accuracy": 0.824923150241375, "num_tokens": 635689283.0, "step": 19917 }, { "entropy": 0.5731867151334882, "epoch": 1.8325656551716207, "grad_norm": 0.15018215775489807, "learning_rate": 3.8918023737234335e-05, "loss": 0.5537, "mean_token_accuracy": 0.8280707262456417, "num_tokens": 635720546.0, "step": 19918 }, { "entropy": 0.5322421346791089, "epoch": 1.8326576615430619, "grad_norm": 0.1497965008020401, "learning_rate": 3.891495691109271e-05, "loss": 0.5294, "mean_token_accuracy": 0.8386739380657673, "num_tokens": 635752328.0, "step": 19919 }, { "entropy": 0.6055553089827299, "epoch": 1.832749667914503, "grad_norm": 0.16074508428573608, "learning_rate": 3.8911890084951084e-05, "loss": 0.5969, "mean_token_accuracy": 0.8149608820676804, "num_tokens": 635783911.0, "step": 19920 }, { "entropy": 0.524290207773447, "epoch": 1.8328416742859444, "grad_norm": 0.14358218014240265, "learning_rate": 3.8908823258809466e-05, "loss": 0.5103, "mean_token_accuracy": 0.8386290036141872, "num_tokens": 635815756.0, "step": 19921 }, { "entropy": 0.6050272230058908, "epoch": 1.8329336806573855, "grad_norm": 0.1498749852180481, "learning_rate": 3.8905756432667834e-05, "loss": 0.5987, "mean_token_accuracy": 0.8171642012894154, "num_tokens": 635848056.0, "step": 19922 }, { "entropy": 0.5768037436064333, "epoch": 1.8330256870288268, "grad_norm": 0.14696268737316132, "learning_rate": 3.890268960652621e-05, "loss": 0.5629, "mean_token_accuracy": 0.8263318277895451, "num_tokens": 635880384.0, "step": 19923 }, { "entropy": 0.5013795564882457, "epoch": 1.833117693400268, "grad_norm": 0.14353983104228973, "learning_rate": 3.889962278038458e-05, "loss": 0.4984, "mean_token_accuracy": 0.8460786752402782, "num_tokens": 635912774.0, "step": 19924 }, { "entropy": 0.7038442641496658, "epoch": 1.8332096997717091, "grad_norm": 0.1603655070066452, "learning_rate": 3.889655595424296e-05, "loss": 0.7075, "mean_token_accuracy": 0.7843307256698608, "num_tokens": 635945123.0, "step": 19925 }, { "entropy": 0.6244057454168797, "epoch": 1.8333017061431505, "grad_norm": 0.1572864055633545, "learning_rate": 3.889348912810133e-05, "loss": 0.6118, "mean_token_accuracy": 0.8114470429718494, "num_tokens": 635976759.0, "step": 19926 }, { "entropy": 0.530144490301609, "epoch": 1.8333937125145916, "grad_norm": 0.1476181298494339, "learning_rate": 3.889042230195971e-05, "loss": 0.5145, "mean_token_accuracy": 0.8369509242475033, "num_tokens": 636008200.0, "step": 19927 }, { "entropy": 0.7696761153638363, "epoch": 1.833485718886033, "grad_norm": 0.16552557051181793, "learning_rate": 3.8887355475818075e-05, "loss": 0.76, "mean_token_accuracy": 0.7722381912171841, "num_tokens": 636039828.0, "step": 19928 }, { "entropy": 0.5965676391497254, "epoch": 1.833577725257474, "grad_norm": 0.15509961545467377, "learning_rate": 3.8884288649676456e-05, "loss": 0.602, "mean_token_accuracy": 0.8134764544665813, "num_tokens": 636071163.0, "step": 19929 }, { "entropy": 0.5062624104321003, "epoch": 1.8336697316289152, "grad_norm": 0.1485663652420044, "learning_rate": 3.8881221823534824e-05, "loss": 0.4918, "mean_token_accuracy": 0.8493199124932289, "num_tokens": 636102932.0, "step": 19930 }, { "entropy": 0.6634527230635285, "epoch": 1.8337617380003566, "grad_norm": 0.15717777609825134, "learning_rate": 3.88781549973932e-05, "loss": 0.6487, "mean_token_accuracy": 0.8009742870926857, "num_tokens": 636134194.0, "step": 19931 }, { "entropy": 0.5992861613631248, "epoch": 1.8338537443717977, "grad_norm": 0.15653099119663239, "learning_rate": 3.887508817125157e-05, "loss": 0.5932, "mean_token_accuracy": 0.8201137073338032, "num_tokens": 636165787.0, "step": 19932 }, { "entropy": 0.5619413610547781, "epoch": 1.833945750743239, "grad_norm": 0.14748035371303558, "learning_rate": 3.887202134510995e-05, "loss": 0.5491, "mean_token_accuracy": 0.8323351554572582, "num_tokens": 636198090.0, "step": 19933 }, { "entropy": 0.5921482006087899, "epoch": 1.8340377571146802, "grad_norm": 0.15092812478542328, "learning_rate": 3.886895451896832e-05, "loss": 0.582, "mean_token_accuracy": 0.8148861527442932, "num_tokens": 636230212.0, "step": 19934 }, { "entropy": 0.6949867811053991, "epoch": 1.8341297634861213, "grad_norm": 0.16532468795776367, "learning_rate": 3.88658876928267e-05, "loss": 0.6946, "mean_token_accuracy": 0.7918732538819313, "num_tokens": 636262306.0, "step": 19935 }, { "entropy": 0.5365142934024334, "epoch": 1.8342217698575627, "grad_norm": 0.15413019061088562, "learning_rate": 3.8862820866685065e-05, "loss": 0.5224, "mean_token_accuracy": 0.8383426889777184, "num_tokens": 636293918.0, "step": 19936 }, { "entropy": 0.7241945769637823, "epoch": 1.8343137762290038, "grad_norm": 0.16206510365009308, "learning_rate": 3.8859754040543447e-05, "loss": 0.7081, "mean_token_accuracy": 0.7848675511777401, "num_tokens": 636324904.0, "step": 19937 }, { "entropy": 0.5981542076915503, "epoch": 1.8344057826004452, "grad_norm": 0.15417726337909698, "learning_rate": 3.8856687214401814e-05, "loss": 0.5806, "mean_token_accuracy": 0.8212191164493561, "num_tokens": 636356567.0, "step": 19938 }, { "entropy": 0.5821943753398955, "epoch": 1.8344977889718863, "grad_norm": 0.16265147924423218, "learning_rate": 3.885362038826019e-05, "loss": 0.5668, "mean_token_accuracy": 0.8273236155509949, "num_tokens": 636388623.0, "step": 19939 }, { "entropy": 0.6705471482127905, "epoch": 1.8345897953433274, "grad_norm": 0.15928290784358978, "learning_rate": 3.8850553562118564e-05, "loss": 0.6659, "mean_token_accuracy": 0.8002046123147011, "num_tokens": 636420494.0, "step": 19940 }, { "entropy": 0.5860496051609516, "epoch": 1.8346818017147688, "grad_norm": 0.15391896665096283, "learning_rate": 3.884748673597694e-05, "loss": 0.5615, "mean_token_accuracy": 0.8278233595192432, "num_tokens": 636452792.0, "step": 19941 }, { "entropy": 0.658867159858346, "epoch": 1.83477380808621, "grad_norm": 0.15264850854873657, "learning_rate": 3.884441990983531e-05, "loss": 0.6373, "mean_token_accuracy": 0.7997621223330498, "num_tokens": 636485196.0, "step": 19942 }, { "entropy": 0.5532033052295446, "epoch": 1.8348658144576513, "grad_norm": 0.15188267827033997, "learning_rate": 3.884135308369369e-05, "loss": 0.5352, "mean_token_accuracy": 0.8320564478635788, "num_tokens": 636517505.0, "step": 19943 }, { "entropy": 0.640749295707792, "epoch": 1.8349578208290924, "grad_norm": 0.1569356769323349, "learning_rate": 3.883828625755206e-05, "loss": 0.6204, "mean_token_accuracy": 0.8109818957746029, "num_tokens": 636549402.0, "step": 19944 }, { "entropy": 0.5781880440190434, "epoch": 1.8350498272005336, "grad_norm": 0.14844264090061188, "learning_rate": 3.883521943141044e-05, "loss": 0.5546, "mean_token_accuracy": 0.8271820172667503, "num_tokens": 636581285.0, "step": 19945 }, { "entropy": 0.6867942325770855, "epoch": 1.835141833571975, "grad_norm": 0.16522197425365448, "learning_rate": 3.8832152605268805e-05, "loss": 0.6715, "mean_token_accuracy": 0.79599953815341, "num_tokens": 636611936.0, "step": 19946 }, { "entropy": 0.4972334997728467, "epoch": 1.835233839943416, "grad_norm": 0.14738602936267853, "learning_rate": 3.8829085779127186e-05, "loss": 0.4955, "mean_token_accuracy": 0.8480436615645885, "num_tokens": 636643615.0, "step": 19947 }, { "entropy": 0.49734822753816843, "epoch": 1.8353258463148574, "grad_norm": 0.1446876972913742, "learning_rate": 3.8826018952985554e-05, "loss": 0.4961, "mean_token_accuracy": 0.8476453311741352, "num_tokens": 636676355.0, "step": 19948 }, { "entropy": 0.6029567485675216, "epoch": 1.8354178526862985, "grad_norm": 0.15714165568351746, "learning_rate": 3.882295212684393e-05, "loss": 0.5956, "mean_token_accuracy": 0.8154157884418964, "num_tokens": 636707682.0, "step": 19949 }, { "entropy": 0.6645949527155608, "epoch": 1.8355098590577397, "grad_norm": 0.1569555699825287, "learning_rate": 3.881988530070231e-05, "loss": 0.6578, "mean_token_accuracy": 0.8006493113934994, "num_tokens": 636740295.0, "step": 19950 }, { "entropy": 0.5662939269095659, "epoch": 1.835601865429181, "grad_norm": 0.152163565158844, "learning_rate": 3.881681847456068e-05, "loss": 0.5619, "mean_token_accuracy": 0.8252880200743675, "num_tokens": 636771614.0, "step": 19951 }, { "entropy": 0.720666790381074, "epoch": 1.8356938718006222, "grad_norm": 0.16050662100315094, "learning_rate": 3.881375164841905e-05, "loss": 0.723, "mean_token_accuracy": 0.7776171565055847, "num_tokens": 636803592.0, "step": 19952 }, { "entropy": 0.537034903652966, "epoch": 1.8357858781720635, "grad_norm": 0.15000700950622559, "learning_rate": 3.881068482227743e-05, "loss": 0.5302, "mean_token_accuracy": 0.8372335098683834, "num_tokens": 636835420.0, "step": 19953 }, { "entropy": 0.5321205202490091, "epoch": 1.8358778845435046, "grad_norm": 0.14884401857852936, "learning_rate": 3.88076179961358e-05, "loss": 0.5187, "mean_token_accuracy": 0.8395555950701237, "num_tokens": 636866872.0, "step": 19954 }, { "entropy": 0.6467593414708972, "epoch": 1.8359698909149458, "grad_norm": 0.155996635556221, "learning_rate": 3.880455116999418e-05, "loss": 0.6294, "mean_token_accuracy": 0.8080744594335556, "num_tokens": 636899121.0, "step": 19955 }, { "entropy": 0.5809578653424978, "epoch": 1.8360618972863871, "grad_norm": 0.14877894520759583, "learning_rate": 3.880148434385255e-05, "loss": 0.5791, "mean_token_accuracy": 0.8206145688891411, "num_tokens": 636931826.0, "step": 19956 }, { "entropy": 0.584531806409359, "epoch": 1.8361539036578283, "grad_norm": 0.16399161517620087, "learning_rate": 3.879841751771092e-05, "loss": 0.5846, "mean_token_accuracy": 0.8205420635640621, "num_tokens": 636963690.0, "step": 19957 }, { "entropy": 0.737165791913867, "epoch": 1.8362459100292696, "grad_norm": 0.16391362249851227, "learning_rate": 3.87953506915693e-05, "loss": 0.728, "mean_token_accuracy": 0.7789775840938091, "num_tokens": 636996002.0, "step": 19958 }, { "entropy": 0.5468871053308249, "epoch": 1.8363379164007108, "grad_norm": 0.1532467156648636, "learning_rate": 3.879228386542767e-05, "loss": 0.5376, "mean_token_accuracy": 0.8337397538125515, "num_tokens": 637027902.0, "step": 19959 }, { "entropy": 0.5514256693422794, "epoch": 1.836429922772152, "grad_norm": 0.14317433536052704, "learning_rate": 3.878921703928605e-05, "loss": 0.5427, "mean_token_accuracy": 0.8301882036030293, "num_tokens": 637060038.0, "step": 19960 }, { "entropy": 0.5842607859522104, "epoch": 1.8365219291435932, "grad_norm": 0.15345118939876556, "learning_rate": 3.878615021314442e-05, "loss": 0.5675, "mean_token_accuracy": 0.821783360093832, "num_tokens": 637090981.0, "step": 19961 }, { "entropy": 0.5854823109693825, "epoch": 1.8366139355150344, "grad_norm": 0.15327025949954987, "learning_rate": 3.878308338700279e-05, "loss": 0.5754, "mean_token_accuracy": 0.8227276839315891, "num_tokens": 637122762.0, "step": 19962 }, { "entropy": 0.6582710798829794, "epoch": 1.8367059418864757, "grad_norm": 0.16491541266441345, "learning_rate": 3.878001656086117e-05, "loss": 0.645, "mean_token_accuracy": 0.8076563365757465, "num_tokens": 637154558.0, "step": 19963 }, { "entropy": 0.5142359044402838, "epoch": 1.8367979482579169, "grad_norm": 0.14866963028907776, "learning_rate": 3.877694973471954e-05, "loss": 0.4995, "mean_token_accuracy": 0.8427528627216816, "num_tokens": 637186185.0, "step": 19964 }, { "entropy": 0.7405131850391626, "epoch": 1.836889954629358, "grad_norm": 0.1655406802892685, "learning_rate": 3.8773882908577916e-05, "loss": 0.718, "mean_token_accuracy": 0.7778990864753723, "num_tokens": 637217796.0, "step": 19965 }, { "entropy": 0.6547384429723024, "epoch": 1.8369819610007994, "grad_norm": 0.15849150717258453, "learning_rate": 3.877081608243629e-05, "loss": 0.6507, "mean_token_accuracy": 0.8002000637352467, "num_tokens": 637249551.0, "step": 19966 }, { "entropy": 0.6092281108722091, "epoch": 1.8370739673722405, "grad_norm": 0.15124788880348206, "learning_rate": 3.876774925629466e-05, "loss": 0.5943, "mean_token_accuracy": 0.8173546679317951, "num_tokens": 637282319.0, "step": 19967 }, { "entropy": 0.7372710891067982, "epoch": 1.8371659737436818, "grad_norm": 0.16100476682186127, "learning_rate": 3.876468243015304e-05, "loss": 0.7245, "mean_token_accuracy": 0.7770933620631695, "num_tokens": 637313899.0, "step": 19968 }, { "entropy": 0.7127416152507067, "epoch": 1.837257980115123, "grad_norm": 0.16429732739925385, "learning_rate": 3.876161560401141e-05, "loss": 0.6916, "mean_token_accuracy": 0.7903903014957905, "num_tokens": 637345679.0, "step": 19969 }, { "entropy": 0.6560510261915624, "epoch": 1.8373499864865641, "grad_norm": 0.15468113124370575, "learning_rate": 3.875854877786978e-05, "loss": 0.6478, "mean_token_accuracy": 0.8030033186078072, "num_tokens": 637378355.0, "step": 19970 }, { "entropy": 0.5092473179101944, "epoch": 1.8374419928580055, "grad_norm": 0.14198949933052063, "learning_rate": 3.875548195172816e-05, "loss": 0.497, "mean_token_accuracy": 0.8430809825658798, "num_tokens": 637410310.0, "step": 19971 }, { "entropy": 0.609218793688342, "epoch": 1.8375339992294466, "grad_norm": 0.14809486269950867, "learning_rate": 3.875241512558653e-05, "loss": 0.5993, "mean_token_accuracy": 0.815590787678957, "num_tokens": 637442409.0, "step": 19972 }, { "entropy": 0.6340678576380014, "epoch": 1.837626005600888, "grad_norm": 0.15688544511795044, "learning_rate": 3.874934829944491e-05, "loss": 0.6307, "mean_token_accuracy": 0.8080394044518471, "num_tokens": 637474376.0, "step": 19973 }, { "entropy": 0.6284843320026994, "epoch": 1.837718011972329, "grad_norm": 0.15765517950057983, "learning_rate": 3.874628147330328e-05, "loss": 0.6161, "mean_token_accuracy": 0.8119017891585827, "num_tokens": 637505928.0, "step": 19974 }, { "entropy": 0.6259815394878387, "epoch": 1.8378100183437702, "grad_norm": 0.15726393461227417, "learning_rate": 3.874321464716165e-05, "loss": 0.616, "mean_token_accuracy": 0.8102291040122509, "num_tokens": 637538235.0, "step": 19975 }, { "entropy": 0.559429288841784, "epoch": 1.8379020247152116, "grad_norm": 0.15151427686214447, "learning_rate": 3.874014782102003e-05, "loss": 0.5448, "mean_token_accuracy": 0.8354174047708511, "num_tokens": 637570450.0, "step": 19976 }, { "entropy": 0.6835477715358138, "epoch": 1.8379940310866527, "grad_norm": 0.1606181263923645, "learning_rate": 3.87370809948784e-05, "loss": 0.6759, "mean_token_accuracy": 0.7942614741623402, "num_tokens": 637602302.0, "step": 19977 }, { "entropy": 0.42145349248312414, "epoch": 1.838086037458094, "grad_norm": 0.1415565013885498, "learning_rate": 3.873401416873677e-05, "loss": 0.4124, "mean_token_accuracy": 0.869242038577795, "num_tokens": 637634462.0, "step": 19978 }, { "entropy": 0.6490520536899567, "epoch": 1.8381780438295352, "grad_norm": 0.153804212808609, "learning_rate": 3.873094734259515e-05, "loss": 0.644, "mean_token_accuracy": 0.8040615394711494, "num_tokens": 637666091.0, "step": 19979 }, { "entropy": 0.5510455425828695, "epoch": 1.8382700502009763, "grad_norm": 0.148776113986969, "learning_rate": 3.872788051645352e-05, "loss": 0.5545, "mean_token_accuracy": 0.8309744000434875, "num_tokens": 637698086.0, "step": 19980 }, { "entropy": 0.4866012129932642, "epoch": 1.8383620565724177, "grad_norm": 0.14091703295707703, "learning_rate": 3.8724813690311904e-05, "loss": 0.473, "mean_token_accuracy": 0.8540927655994892, "num_tokens": 637730658.0, "step": 19981 }, { "entropy": 0.5477015478536487, "epoch": 1.8384540629438588, "grad_norm": 0.160078227519989, "learning_rate": 3.872174686417027e-05, "loss": 0.5488, "mean_token_accuracy": 0.8300369828939438, "num_tokens": 637762539.0, "step": 19982 }, { "entropy": 0.6882401928305626, "epoch": 1.8385460693153002, "grad_norm": 0.16227707266807556, "learning_rate": 3.8718680038028646e-05, "loss": 0.6893, "mean_token_accuracy": 0.792876023799181, "num_tokens": 637793453.0, "step": 19983 }, { "entropy": 0.6363444493617862, "epoch": 1.8386380756867413, "grad_norm": 0.1643504798412323, "learning_rate": 3.871561321188702e-05, "loss": 0.6383, "mean_token_accuracy": 0.8034000806510448, "num_tokens": 637825100.0, "step": 19984 }, { "entropy": 0.5296730250120163, "epoch": 1.8387300820581824, "grad_norm": 0.15059718489646912, "learning_rate": 3.8712546385745396e-05, "loss": 0.5182, "mean_token_accuracy": 0.8413482755422592, "num_tokens": 637857580.0, "step": 19985 }, { "entropy": 0.7560716001316905, "epoch": 1.8388220884296238, "grad_norm": 0.16091720759868622, "learning_rate": 3.870947955960377e-05, "loss": 0.749, "mean_token_accuracy": 0.7720684632658958, "num_tokens": 637889849.0, "step": 19986 }, { "entropy": 0.7214313913136721, "epoch": 1.838914094801065, "grad_norm": 0.16007304191589355, "learning_rate": 3.8706412733462145e-05, "loss": 0.7118, "mean_token_accuracy": 0.782272681593895, "num_tokens": 637922158.0, "step": 19987 }, { "entropy": 0.5436559724621475, "epoch": 1.8390061011725063, "grad_norm": 0.14495135843753815, "learning_rate": 3.870334590732051e-05, "loss": 0.5252, "mean_token_accuracy": 0.8371280170977116, "num_tokens": 637954252.0, "step": 19988 }, { "entropy": 0.5792759377509356, "epoch": 1.8390981075439474, "grad_norm": 0.14335022866725922, "learning_rate": 3.8700279081178894e-05, "loss": 0.5703, "mean_token_accuracy": 0.8218590319156647, "num_tokens": 637986311.0, "step": 19989 }, { "entropy": 0.6402243226766586, "epoch": 1.8391901139153886, "grad_norm": 0.15451766550540924, "learning_rate": 3.869721225503726e-05, "loss": 0.6307, "mean_token_accuracy": 0.8091142028570175, "num_tokens": 638018966.0, "step": 19990 }, { "entropy": 0.651440929621458, "epoch": 1.83928212028683, "grad_norm": 0.15067271888256073, "learning_rate": 3.869414542889564e-05, "loss": 0.6331, "mean_token_accuracy": 0.8071469441056252, "num_tokens": 638051333.0, "step": 19991 }, { "entropy": 0.6781598478555679, "epoch": 1.839374126658271, "grad_norm": 0.1557474285364151, "learning_rate": 3.869107860275401e-05, "loss": 0.6693, "mean_token_accuracy": 0.7970371320843697, "num_tokens": 638082800.0, "step": 19992 }, { "entropy": 0.4963422955479473, "epoch": 1.8394661330297124, "grad_norm": 0.1458248496055603, "learning_rate": 3.8688011776612386e-05, "loss": 0.4843, "mean_token_accuracy": 0.8497533798217773, "num_tokens": 638115106.0, "step": 19993 }, { "entropy": 0.6620564442127943, "epoch": 1.8395581394011535, "grad_norm": 0.15638858079910278, "learning_rate": 3.868494495047076e-05, "loss": 0.6375, "mean_token_accuracy": 0.8026158958673477, "num_tokens": 638146448.0, "step": 19994 }, { "entropy": 0.5679172065574676, "epoch": 1.8396501457725947, "grad_norm": 0.14979702234268188, "learning_rate": 3.8681878124329135e-05, "loss": 0.5521, "mean_token_accuracy": 0.827313806861639, "num_tokens": 638178308.0, "step": 19995 }, { "entropy": 0.6565613187849522, "epoch": 1.839742152144036, "grad_norm": 0.15566855669021606, "learning_rate": 3.86788112981875e-05, "loss": 0.6328, "mean_token_accuracy": 0.805752482265234, "num_tokens": 638209336.0, "step": 19996 }, { "entropy": 0.5285169780254364, "epoch": 1.8398341585154772, "grad_norm": 0.15008683502674103, "learning_rate": 3.8675744472045885e-05, "loss": 0.5085, "mean_token_accuracy": 0.8410523347556591, "num_tokens": 638241028.0, "step": 19997 }, { "entropy": 0.5408989945426583, "epoch": 1.8399261648869185, "grad_norm": 0.1581496000289917, "learning_rate": 3.867267764590425e-05, "loss": 0.5196, "mean_token_accuracy": 0.840527381747961, "num_tokens": 638273014.0, "step": 19998 }, { "entropy": 0.6497137639671564, "epoch": 1.8400181712583596, "grad_norm": 0.15760906040668488, "learning_rate": 3.866961081976263e-05, "loss": 0.6389, "mean_token_accuracy": 0.8065091297030449, "num_tokens": 638303475.0, "step": 19999 }, { "entropy": 0.6321191396564245, "epoch": 1.8401101776298008, "grad_norm": 0.15653882920742035, "learning_rate": 3.8666543993621e-05, "loss": 0.6142, "mean_token_accuracy": 0.8131419867277145, "num_tokens": 638334947.0, "step": 20000 }, { "entropy": 0.48379048332571983, "epoch": 1.8402021840012421, "grad_norm": 0.14875201880931854, "learning_rate": 3.8663477167479377e-05, "loss": 0.4759, "mean_token_accuracy": 0.8522448278963566, "num_tokens": 638366727.0, "step": 20001 }, { "entropy": 0.6968495287001133, "epoch": 1.8402941903726833, "grad_norm": 0.16744917631149292, "learning_rate": 3.866041034133775e-05, "loss": 0.7013, "mean_token_accuracy": 0.7913552299141884, "num_tokens": 638398171.0, "step": 20002 }, { "entropy": 0.64611541852355, "epoch": 1.8403861967441246, "grad_norm": 0.15518105030059814, "learning_rate": 3.8657343515196126e-05, "loss": 0.6438, "mean_token_accuracy": 0.8029381930828094, "num_tokens": 638430761.0, "step": 20003 }, { "entropy": 0.7728232480585575, "epoch": 1.8404782031155658, "grad_norm": 0.1687997579574585, "learning_rate": 3.86542766890545e-05, "loss": 0.7696, "mean_token_accuracy": 0.766920231282711, "num_tokens": 638462493.0, "step": 20004 }, { "entropy": 0.5837087528780103, "epoch": 1.840570209487007, "grad_norm": 0.14651432633399963, "learning_rate": 3.8651209862912875e-05, "loss": 0.569, "mean_token_accuracy": 0.828155867755413, "num_tokens": 638494675.0, "step": 20005 }, { "entropy": 0.5941619104705751, "epoch": 1.8406622158584482, "grad_norm": 0.15293650329113007, "learning_rate": 3.864814303677124e-05, "loss": 0.5811, "mean_token_accuracy": 0.8213626965880394, "num_tokens": 638526337.0, "step": 20006 }, { "entropy": 0.6806563083082438, "epoch": 1.8407542222298894, "grad_norm": 0.1601821929216385, "learning_rate": 3.8645076210629624e-05, "loss": 0.6848, "mean_token_accuracy": 0.7916236557066441, "num_tokens": 638558426.0, "step": 20007 }, { "entropy": 0.6210633460432291, "epoch": 1.8408462286013307, "grad_norm": 0.15988267958164215, "learning_rate": 3.864200938448799e-05, "loss": 0.602, "mean_token_accuracy": 0.80959602445364, "num_tokens": 638590310.0, "step": 20008 }, { "entropy": 0.699476346373558, "epoch": 1.8409382349727719, "grad_norm": 0.1647486537694931, "learning_rate": 3.863894255834637e-05, "loss": 0.6969, "mean_token_accuracy": 0.7862222529947758, "num_tokens": 638621094.0, "step": 20009 }, { "entropy": 0.6244696751236916, "epoch": 1.841030241344213, "grad_norm": 0.15394794940948486, "learning_rate": 3.863587573220474e-05, "loss": 0.6202, "mean_token_accuracy": 0.807159136980772, "num_tokens": 638653203.0, "step": 20010 }, { "entropy": 0.5189372887834907, "epoch": 1.8411222477156544, "grad_norm": 0.1471371054649353, "learning_rate": 3.8632808906063116e-05, "loss": 0.5046, "mean_token_accuracy": 0.8424654304981232, "num_tokens": 638685505.0, "step": 20011 }, { "entropy": 0.7761774947866797, "epoch": 1.8412142540870955, "grad_norm": 0.17095163464546204, "learning_rate": 3.862974207992149e-05, "loss": 0.7664, "mean_token_accuracy": 0.769897323101759, "num_tokens": 638717362.0, "step": 20012 }, { "entropy": 0.6533992709591985, "epoch": 1.8413062604585368, "grad_norm": 0.14722077548503876, "learning_rate": 3.8626675253779866e-05, "loss": 0.6392, "mean_token_accuracy": 0.8013523630797863, "num_tokens": 638749658.0, "step": 20013 }, { "entropy": 0.6146052367985249, "epoch": 1.841398266829978, "grad_norm": 0.1574859917163849, "learning_rate": 3.862360842763824e-05, "loss": 0.6091, "mean_token_accuracy": 0.8118554204702377, "num_tokens": 638781085.0, "step": 20014 }, { "entropy": 0.61720778234303, "epoch": 1.8414902732014191, "grad_norm": 0.15157118439674377, "learning_rate": 3.8620541601496615e-05, "loss": 0.6163, "mean_token_accuracy": 0.8078468032181263, "num_tokens": 638813077.0, "step": 20015 }, { "entropy": 0.5553380884230137, "epoch": 1.8415822795728605, "grad_norm": 0.1482563614845276, "learning_rate": 3.861747477535499e-05, "loss": 0.5429, "mean_token_accuracy": 0.8306521885097027, "num_tokens": 638845347.0, "step": 20016 }, { "entropy": 0.5707292621955276, "epoch": 1.8416742859443016, "grad_norm": 0.1567341536283493, "learning_rate": 3.861440794921336e-05, "loss": 0.5546, "mean_token_accuracy": 0.8286782428622246, "num_tokens": 638877934.0, "step": 20017 }, { "entropy": 0.5515505305957049, "epoch": 1.841766292315743, "grad_norm": 0.1489046812057495, "learning_rate": 3.861134112307174e-05, "loss": 0.5416, "mean_token_accuracy": 0.8327934183180332, "num_tokens": 638910334.0, "step": 20018 }, { "entropy": 0.6089257514104247, "epoch": 1.841858298687184, "grad_norm": 0.16190588474273682, "learning_rate": 3.860827429693011e-05, "loss": 0.6014, "mean_token_accuracy": 0.8167511261999607, "num_tokens": 638941589.0, "step": 20019 }, { "entropy": 0.5832000952214003, "epoch": 1.8419503050586252, "grad_norm": 0.15199920535087585, "learning_rate": 3.860520747078849e-05, "loss": 0.5618, "mean_token_accuracy": 0.821981891989708, "num_tokens": 638972985.0, "step": 20020 }, { "entropy": 0.4821748062968254, "epoch": 1.8420423114300666, "grad_norm": 0.14635302126407623, "learning_rate": 3.8602140644646856e-05, "loss": 0.4743, "mean_token_accuracy": 0.8511394001543522, "num_tokens": 639004524.0, "step": 20021 }, { "entropy": 0.5064049111679196, "epoch": 1.8421343178015077, "grad_norm": 0.14813901484012604, "learning_rate": 3.859907381850523e-05, "loss": 0.4942, "mean_token_accuracy": 0.8483937717974186, "num_tokens": 639036553.0, "step": 20022 }, { "entropy": 0.5877478336915374, "epoch": 1.842226324172949, "grad_norm": 0.14988185465335846, "learning_rate": 3.8596006992363605e-05, "loss": 0.5733, "mean_token_accuracy": 0.8232003562152386, "num_tokens": 639069134.0, "step": 20023 }, { "entropy": 0.482781101251021, "epoch": 1.8423183305443902, "grad_norm": 0.1404532492160797, "learning_rate": 3.859294016622198e-05, "loss": 0.4842, "mean_token_accuracy": 0.8497029431164265, "num_tokens": 639101395.0, "step": 20024 }, { "entropy": 0.6311209108680487, "epoch": 1.8424103369158313, "grad_norm": 0.16064172983169556, "learning_rate": 3.8589873340080355e-05, "loss": 0.6201, "mean_token_accuracy": 0.8087693266570568, "num_tokens": 639133383.0, "step": 20025 }, { "entropy": 0.5869985967874527, "epoch": 1.8425023432872727, "grad_norm": 0.14873796701431274, "learning_rate": 3.858680651393873e-05, "loss": 0.5725, "mean_token_accuracy": 0.825566366314888, "num_tokens": 639165392.0, "step": 20026 }, { "entropy": 0.7062993366271257, "epoch": 1.8425943496587138, "grad_norm": 0.163631871342659, "learning_rate": 3.85837396877971e-05, "loss": 0.6914, "mean_token_accuracy": 0.7879646606743336, "num_tokens": 639196086.0, "step": 20027 }, { "entropy": 0.6606154013425112, "epoch": 1.8426863560301552, "grad_norm": 0.16266104578971863, "learning_rate": 3.858067286165548e-05, "loss": 0.6409, "mean_token_accuracy": 0.8053916096687317, "num_tokens": 639227973.0, "step": 20028 }, { "entropy": 0.6983091291040182, "epoch": 1.8427783624015963, "grad_norm": 0.16629427671432495, "learning_rate": 3.8577606035513846e-05, "loss": 0.693, "mean_token_accuracy": 0.790419451892376, "num_tokens": 639259444.0, "step": 20029 }, { "entropy": 0.5579508617520332, "epoch": 1.8428703687730374, "grad_norm": 0.15379974246025085, "learning_rate": 3.857453920937222e-05, "loss": 0.5523, "mean_token_accuracy": 0.8313245922327042, "num_tokens": 639291434.0, "step": 20030 }, { "entropy": 0.4906453341245651, "epoch": 1.8429623751444788, "grad_norm": 0.14774630963802338, "learning_rate": 3.8571472383230596e-05, "loss": 0.4817, "mean_token_accuracy": 0.8524918109178543, "num_tokens": 639323650.0, "step": 20031 }, { "entropy": 0.6741529684513807, "epoch": 1.84305438151592, "grad_norm": 0.15533782541751862, "learning_rate": 3.856840555708897e-05, "loss": 0.6656, "mean_token_accuracy": 0.7956737913191319, "num_tokens": 639355071.0, "step": 20032 }, { "entropy": 0.6453537419438362, "epoch": 1.8431463878873613, "grad_norm": 0.1521233469247818, "learning_rate": 3.8565338730947345e-05, "loss": 0.6396, "mean_token_accuracy": 0.8039830029010773, "num_tokens": 639387397.0, "step": 20033 }, { "entropy": 0.5744583886116743, "epoch": 1.8432383942588024, "grad_norm": 0.15146265923976898, "learning_rate": 3.856227190480572e-05, "loss": 0.5695, "mean_token_accuracy": 0.824590664356947, "num_tokens": 639419050.0, "step": 20034 }, { "entropy": 0.6854988895356655, "epoch": 1.8433304006302436, "grad_norm": 0.16213887929916382, "learning_rate": 3.855920507866409e-05, "loss": 0.6904, "mean_token_accuracy": 0.791279923170805, "num_tokens": 639451818.0, "step": 20035 }, { "entropy": 0.6433630920946598, "epoch": 1.843422407001685, "grad_norm": 0.16251565515995026, "learning_rate": 3.855613825252247e-05, "loss": 0.6359, "mean_token_accuracy": 0.8060469031333923, "num_tokens": 639482816.0, "step": 20036 }, { "entropy": 0.707586208358407, "epoch": 1.843514413373126, "grad_norm": 0.16038694977760315, "learning_rate": 3.855307142638084e-05, "loss": 0.7047, "mean_token_accuracy": 0.7843170613050461, "num_tokens": 639514379.0, "step": 20037 }, { "entropy": 0.6235167910344899, "epoch": 1.8436064197445674, "grad_norm": 0.16071201860904694, "learning_rate": 3.855000460023921e-05, "loss": 0.6079, "mean_token_accuracy": 0.8113139756023884, "num_tokens": 639545365.0, "step": 20038 }, { "entropy": 0.5877449214458466, "epoch": 1.8436984261160085, "grad_norm": 0.1505109816789627, "learning_rate": 3.8546937774097586e-05, "loss": 0.5728, "mean_token_accuracy": 0.82020428404212, "num_tokens": 639576822.0, "step": 20039 }, { "entropy": 0.5849296096712351, "epoch": 1.8437904324874497, "grad_norm": 0.14978206157684326, "learning_rate": 3.854387094795596e-05, "loss": 0.5638, "mean_token_accuracy": 0.8259280137717724, "num_tokens": 639608730.0, "step": 20040 }, { "entropy": 0.6383691262453794, "epoch": 1.843882438858891, "grad_norm": 0.16087374091148376, "learning_rate": 3.8540804121814335e-05, "loss": 0.6398, "mean_token_accuracy": 0.8041788525879383, "num_tokens": 639640109.0, "step": 20041 }, { "entropy": 0.6040534749627113, "epoch": 1.8439744452303322, "grad_norm": 0.15963807702064514, "learning_rate": 3.853773729567271e-05, "loss": 0.5785, "mean_token_accuracy": 0.8191026113927364, "num_tokens": 639670752.0, "step": 20042 }, { "entropy": 0.540946401655674, "epoch": 1.8440664516017735, "grad_norm": 0.15517312288284302, "learning_rate": 3.8534670469531085e-05, "loss": 0.5304, "mean_token_accuracy": 0.8367282971739769, "num_tokens": 639702695.0, "step": 20043 }, { "entropy": 0.5787505432963371, "epoch": 1.8441584579732146, "grad_norm": 0.1497597098350525, "learning_rate": 3.853160364338946e-05, "loss": 0.5589, "mean_token_accuracy": 0.8243384808301926, "num_tokens": 639735082.0, "step": 20044 }, { "entropy": 0.6307552601210773, "epoch": 1.8442504643446558, "grad_norm": 0.15550002455711365, "learning_rate": 3.8528536817247834e-05, "loss": 0.6281, "mean_token_accuracy": 0.8090693056583405, "num_tokens": 639766963.0, "step": 20045 }, { "entropy": 0.638868615962565, "epoch": 1.8443424707160971, "grad_norm": 0.15421392023563385, "learning_rate": 3.852546999110621e-05, "loss": 0.6297, "mean_token_accuracy": 0.8092930279672146, "num_tokens": 639798773.0, "step": 20046 }, { "entropy": 0.5824055131524801, "epoch": 1.8444344770875383, "grad_norm": 0.15159225463867188, "learning_rate": 3.852240316496458e-05, "loss": 0.5666, "mean_token_accuracy": 0.8252305127680302, "num_tokens": 639831234.0, "step": 20047 }, { "entropy": 0.5471841115504503, "epoch": 1.8445264834589796, "grad_norm": 0.15581117570400238, "learning_rate": 3.851933633882295e-05, "loss": 0.5351, "mean_token_accuracy": 0.8324789740145206, "num_tokens": 639863059.0, "step": 20048 }, { "entropy": 0.574886791408062, "epoch": 1.8446184898304208, "grad_norm": 0.15252411365509033, "learning_rate": 3.851626951268133e-05, "loss": 0.5433, "mean_token_accuracy": 0.8306805565953255, "num_tokens": 639894534.0, "step": 20049 }, { "entropy": 0.5742353666573763, "epoch": 1.844710496201862, "grad_norm": 0.14503611624240875, "learning_rate": 3.85132026865397e-05, "loss": 0.5651, "mean_token_accuracy": 0.8257688470184803, "num_tokens": 639927233.0, "step": 20050 }, { "entropy": 0.6208107881247997, "epoch": 1.8448025025733032, "grad_norm": 0.14891129732131958, "learning_rate": 3.8510135860398075e-05, "loss": 0.6012, "mean_token_accuracy": 0.8136306293308735, "num_tokens": 639958613.0, "step": 20051 }, { "entropy": 0.6673312969505787, "epoch": 1.8448945089447444, "grad_norm": 0.158777117729187, "learning_rate": 3.850706903425645e-05, "loss": 0.6469, "mean_token_accuracy": 0.8022806718945503, "num_tokens": 639990428.0, "step": 20052 }, { "entropy": 0.6503367051482201, "epoch": 1.8449865153161857, "grad_norm": 0.1549687683582306, "learning_rate": 3.8504002208114824e-05, "loss": 0.6387, "mean_token_accuracy": 0.8037982322275639, "num_tokens": 640022118.0, "step": 20053 }, { "entropy": 0.6687499899417162, "epoch": 1.8450785216876269, "grad_norm": 0.15978844463825226, "learning_rate": 3.85009353819732e-05, "loss": 0.6528, "mean_token_accuracy": 0.8025717586278915, "num_tokens": 640054079.0, "step": 20054 }, { "entropy": 0.7516948617994785, "epoch": 1.845170528059068, "grad_norm": 0.1609044373035431, "learning_rate": 3.8497868555831574e-05, "loss": 0.7517, "mean_token_accuracy": 0.7706064246594906, "num_tokens": 640086730.0, "step": 20055 }, { "entropy": 0.58563750423491, "epoch": 1.8452625344305094, "grad_norm": 0.14792010188102722, "learning_rate": 3.849480172968994e-05, "loss": 0.5737, "mean_token_accuracy": 0.8229446560144424, "num_tokens": 640118789.0, "step": 20056 }, { "entropy": 0.5185917129274458, "epoch": 1.8453545408019505, "grad_norm": 0.14684200286865234, "learning_rate": 3.849173490354832e-05, "loss": 0.4962, "mean_token_accuracy": 0.8429522849619389, "num_tokens": 640150618.0, "step": 20057 }, { "entropy": 0.6809114795178175, "epoch": 1.8454465471733918, "grad_norm": 0.1586151272058487, "learning_rate": 3.848866807740669e-05, "loss": 0.6829, "mean_token_accuracy": 0.7915721647441387, "num_tokens": 640183177.0, "step": 20058 }, { "entropy": 0.5132728796452284, "epoch": 1.845538553544833, "grad_norm": 0.14284110069274902, "learning_rate": 3.8485601251265065e-05, "loss": 0.506, "mean_token_accuracy": 0.8413734436035156, "num_tokens": 640215545.0, "step": 20059 }, { "entropy": 0.6633385848253965, "epoch": 1.8456305599162741, "grad_norm": 0.15769325196743011, "learning_rate": 3.848253442512344e-05, "loss": 0.6552, "mean_token_accuracy": 0.7982728704810143, "num_tokens": 640247244.0, "step": 20060 }, { "entropy": 0.6161631364375353, "epoch": 1.8457225662877155, "grad_norm": 0.14471128582954407, "learning_rate": 3.8479467598981815e-05, "loss": 0.6062, "mean_token_accuracy": 0.8095591403543949, "num_tokens": 640279796.0, "step": 20061 }, { "entropy": 0.6525340690277517, "epoch": 1.8458145726591566, "grad_norm": 0.1509903073310852, "learning_rate": 3.847640077284019e-05, "loss": 0.641, "mean_token_accuracy": 0.802724365144968, "num_tokens": 640311966.0, "step": 20062 }, { "entropy": 0.5676870511379093, "epoch": 1.845906579030598, "grad_norm": 0.15715205669403076, "learning_rate": 3.8473333946698564e-05, "loss": 0.5563, "mean_token_accuracy": 0.8283251263201237, "num_tokens": 640343328.0, "step": 20063 }, { "entropy": 0.5189276011660695, "epoch": 1.845998585402039, "grad_norm": 0.14518466591835022, "learning_rate": 3.847026712055694e-05, "loss": 0.4995, "mean_token_accuracy": 0.8447122164070606, "num_tokens": 640375219.0, "step": 20064 }, { "entropy": 0.6441161865368485, "epoch": 1.8460905917734802, "grad_norm": 0.1550215780735016, "learning_rate": 3.846720029441531e-05, "loss": 0.6419, "mean_token_accuracy": 0.803137868642807, "num_tokens": 640407470.0, "step": 20065 }, { "entropy": 0.481475530192256, "epoch": 1.8461825981449216, "grad_norm": 0.14668934047222137, "learning_rate": 3.846413346827368e-05, "loss": 0.4696, "mean_token_accuracy": 0.8544245027005672, "num_tokens": 640439758.0, "step": 20066 }, { "entropy": 0.5900414986535907, "epoch": 1.8462746045163627, "grad_norm": 0.15287159383296967, "learning_rate": 3.846106664213206e-05, "loss": 0.5735, "mean_token_accuracy": 0.8258500397205353, "num_tokens": 640471452.0, "step": 20067 }, { "entropy": 0.5445210272446275, "epoch": 1.846366610887804, "grad_norm": 0.15253916382789612, "learning_rate": 3.845799981599043e-05, "loss": 0.5325, "mean_token_accuracy": 0.8332512974739075, "num_tokens": 640503785.0, "step": 20068 }, { "entropy": 0.6024077208712697, "epoch": 1.8464586172592452, "grad_norm": 0.15702074766159058, "learning_rate": 3.8454932989848805e-05, "loss": 0.5989, "mean_token_accuracy": 0.8183034248650074, "num_tokens": 640535830.0, "step": 20069 }, { "entropy": 0.6287025567144156, "epoch": 1.8465506236306863, "grad_norm": 0.15301819145679474, "learning_rate": 3.845186616370718e-05, "loss": 0.623, "mean_token_accuracy": 0.8067066967487335, "num_tokens": 640566927.0, "step": 20070 }, { "entropy": 0.667429456487298, "epoch": 1.8466426300021277, "grad_norm": 0.16161677241325378, "learning_rate": 3.8448799337565554e-05, "loss": 0.6671, "mean_token_accuracy": 0.7949389405548573, "num_tokens": 640599083.0, "step": 20071 }, { "entropy": 0.6502394611015916, "epoch": 1.8467346363735688, "grad_norm": 0.15628035366535187, "learning_rate": 3.844573251142393e-05, "loss": 0.6494, "mean_token_accuracy": 0.8040188550949097, "num_tokens": 640631603.0, "step": 20072 }, { "entropy": 0.5886916946619749, "epoch": 1.8468266427450102, "grad_norm": 0.15738070011138916, "learning_rate": 3.8442665685282304e-05, "loss": 0.5859, "mean_token_accuracy": 0.8238221108913422, "num_tokens": 640662799.0, "step": 20073 }, { "entropy": 0.5129391849040985, "epoch": 1.8469186491164513, "grad_norm": 0.1567527949810028, "learning_rate": 3.843959885914068e-05, "loss": 0.491, "mean_token_accuracy": 0.8423788845539093, "num_tokens": 640694309.0, "step": 20074 }, { "entropy": 0.6113803246989846, "epoch": 1.8470106554878924, "grad_norm": 0.15300814807415009, "learning_rate": 3.843653203299905e-05, "loss": 0.6143, "mean_token_accuracy": 0.8147330991923809, "num_tokens": 640726805.0, "step": 20075 }, { "entropy": 0.543318668846041, "epoch": 1.8471026618593338, "grad_norm": 0.15636985003948212, "learning_rate": 3.843346520685743e-05, "loss": 0.5237, "mean_token_accuracy": 0.8388210572302341, "num_tokens": 640758457.0, "step": 20076 }, { "entropy": 0.6641465779393911, "epoch": 1.847194668230775, "grad_norm": 0.15319180488586426, "learning_rate": 3.8430398380715796e-05, "loss": 0.6525, "mean_token_accuracy": 0.7983454801142216, "num_tokens": 640790116.0, "step": 20077 }, { "entropy": 0.5714216362684965, "epoch": 1.8472866746022163, "grad_norm": 0.15205179154872894, "learning_rate": 3.842733155457418e-05, "loss": 0.565, "mean_token_accuracy": 0.827721256762743, "num_tokens": 640822054.0, "step": 20078 }, { "entropy": 0.5823385319672525, "epoch": 1.8473786809736574, "grad_norm": 0.1533077508211136, "learning_rate": 3.8424264728432545e-05, "loss": 0.5688, "mean_token_accuracy": 0.8272978439927101, "num_tokens": 640853954.0, "step": 20079 }, { "entropy": 0.58760298602283, "epoch": 1.8474706873450986, "grad_norm": 0.14955148100852966, "learning_rate": 3.8421197902290926e-05, "loss": 0.574, "mean_token_accuracy": 0.8252568133175373, "num_tokens": 640885669.0, "step": 20080 }, { "entropy": 0.6845572479069233, "epoch": 1.84756269371654, "grad_norm": 0.16520892083644867, "learning_rate": 3.8418131076149294e-05, "loss": 0.6693, "mean_token_accuracy": 0.792245402932167, "num_tokens": 640916946.0, "step": 20081 }, { "entropy": 0.6465343348681927, "epoch": 1.847654700087981, "grad_norm": 0.15773896872997284, "learning_rate": 3.841506425000767e-05, "loss": 0.6272, "mean_token_accuracy": 0.8095633238554001, "num_tokens": 640948586.0, "step": 20082 }, { "entropy": 0.6248660404235125, "epoch": 1.8477467064594224, "grad_norm": 0.15362152457237244, "learning_rate": 3.8411997423866043e-05, "loss": 0.6118, "mean_token_accuracy": 0.8109485693275928, "num_tokens": 640980824.0, "step": 20083 }, { "entropy": 0.5825074454769492, "epoch": 1.8478387128308635, "grad_norm": 0.1549200862646103, "learning_rate": 3.840893059772442e-05, "loss": 0.5498, "mean_token_accuracy": 0.8285205475986004, "num_tokens": 641010841.0, "step": 20084 }, { "entropy": 0.5585773903876543, "epoch": 1.8479307192023047, "grad_norm": 0.14915403723716736, "learning_rate": 3.840586377158279e-05, "loss": 0.5313, "mean_token_accuracy": 0.8363346345722675, "num_tokens": 641042538.0, "step": 20085 }, { "entropy": 0.6050785724073648, "epoch": 1.848022725573746, "grad_norm": 0.15522843599319458, "learning_rate": 3.840279694544117e-05, "loss": 0.5969, "mean_token_accuracy": 0.8184297941625118, "num_tokens": 641074323.0, "step": 20086 }, { "entropy": 0.5607195813208818, "epoch": 1.8481147319451872, "grad_norm": 0.1488194763660431, "learning_rate": 3.8399730119299535e-05, "loss": 0.5511, "mean_token_accuracy": 0.8285407721996307, "num_tokens": 641106392.0, "step": 20087 }, { "entropy": 0.6801619492471218, "epoch": 1.8482067383166285, "grad_norm": 0.16791808605194092, "learning_rate": 3.839666329315792e-05, "loss": 0.6749, "mean_token_accuracy": 0.7973649650812149, "num_tokens": 641137957.0, "step": 20088 }, { "entropy": 0.5675851227715611, "epoch": 1.8482987446880697, "grad_norm": 0.15577921271324158, "learning_rate": 3.8393596467016285e-05, "loss": 0.5555, "mean_token_accuracy": 0.8289405256509781, "num_tokens": 641170165.0, "step": 20089 }, { "entropy": 0.5510773230344057, "epoch": 1.8483907510595108, "grad_norm": 0.15117038786411285, "learning_rate": 3.839052964087466e-05, "loss": 0.5343, "mean_token_accuracy": 0.8341333158314228, "num_tokens": 641201371.0, "step": 20090 }, { "entropy": 0.6605174876749516, "epoch": 1.8484827574309521, "grad_norm": 0.15378673374652863, "learning_rate": 3.8387462814733034e-05, "loss": 0.6584, "mean_token_accuracy": 0.8009090200066566, "num_tokens": 641234038.0, "step": 20091 }, { "entropy": 0.48556422675028443, "epoch": 1.8485747638023933, "grad_norm": 0.14866995811462402, "learning_rate": 3.838439598859141e-05, "loss": 0.4631, "mean_token_accuracy": 0.8561174981296062, "num_tokens": 641265987.0, "step": 20092 }, { "entropy": 0.5854393243789673, "epoch": 1.8486667701738346, "grad_norm": 0.15453235805034637, "learning_rate": 3.838132916244978e-05, "loss": 0.5856, "mean_token_accuracy": 0.8195261768996716, "num_tokens": 641297934.0, "step": 20093 }, { "entropy": 0.6282234722748399, "epoch": 1.8487587765452758, "grad_norm": 0.15584510564804077, "learning_rate": 3.837826233630816e-05, "loss": 0.6271, "mean_token_accuracy": 0.810032032430172, "num_tokens": 641329837.0, "step": 20094 }, { "entropy": 0.6874830583110452, "epoch": 1.848850782916717, "grad_norm": 0.1622319221496582, "learning_rate": 3.8375195510166526e-05, "loss": 0.676, "mean_token_accuracy": 0.7943408824503422, "num_tokens": 641361289.0, "step": 20095 }, { "entropy": 0.548552704975009, "epoch": 1.8489427892881583, "grad_norm": 0.14832183718681335, "learning_rate": 3.837212868402491e-05, "loss": 0.534, "mean_token_accuracy": 0.8368270061910152, "num_tokens": 641393087.0, "step": 20096 }, { "entropy": 0.6663108896464109, "epoch": 1.8490347956595994, "grad_norm": 0.16505196690559387, "learning_rate": 3.8369061857883275e-05, "loss": 0.6618, "mean_token_accuracy": 0.7962261401116848, "num_tokens": 641424541.0, "step": 20097 }, { "entropy": 0.5329313576221466, "epoch": 1.8491268020310407, "grad_norm": 0.14129464328289032, "learning_rate": 3.836599503174165e-05, "loss": 0.5188, "mean_token_accuracy": 0.8398328609764576, "num_tokens": 641456863.0, "step": 20098 }, { "entropy": 0.5587940325494856, "epoch": 1.8492188084024819, "grad_norm": 0.14687485992908478, "learning_rate": 3.8362928205600024e-05, "loss": 0.5528, "mean_token_accuracy": 0.8294937610626221, "num_tokens": 641488777.0, "step": 20099 }, { "entropy": 0.603771198540926, "epoch": 1.849310814773923, "grad_norm": 0.15344461798667908, "learning_rate": 3.83598613794584e-05, "loss": 0.5922, "mean_token_accuracy": 0.8162858672440052, "num_tokens": 641520494.0, "step": 20100 }, { "entropy": 0.6636497573927045, "epoch": 1.8494028211453644, "grad_norm": 0.15592466294765472, "learning_rate": 3.8356794553316774e-05, "loss": 0.6567, "mean_token_accuracy": 0.7962500415742397, "num_tokens": 641552492.0, "step": 20101 }, { "entropy": 0.6527704056352377, "epoch": 1.8494948275168055, "grad_norm": 0.16189642250537872, "learning_rate": 3.835372772717515e-05, "loss": 0.6442, "mean_token_accuracy": 0.7973109222948551, "num_tokens": 641584028.0, "step": 20102 }, { "entropy": 0.6791033074259758, "epoch": 1.8495868338882469, "grad_norm": 0.16819602251052856, "learning_rate": 3.835066090103352e-05, "loss": 0.6705, "mean_token_accuracy": 0.7982393465936184, "num_tokens": 641614887.0, "step": 20103 }, { "entropy": 0.556054150685668, "epoch": 1.849678840259688, "grad_norm": 0.1634623408317566, "learning_rate": 3.83475940748919e-05, "loss": 0.5462, "mean_token_accuracy": 0.8318787813186646, "num_tokens": 641646676.0, "step": 20104 }, { "entropy": 0.6233669836074114, "epoch": 1.8497708466311291, "grad_norm": 0.15262217819690704, "learning_rate": 3.834452724875027e-05, "loss": 0.6087, "mean_token_accuracy": 0.8111688643693924, "num_tokens": 641679262.0, "step": 20105 }, { "entropy": 0.5372018800117075, "epoch": 1.8498628530025705, "grad_norm": 0.1462676227092743, "learning_rate": 3.834146042260865e-05, "loss": 0.5262, "mean_token_accuracy": 0.8372966088354588, "num_tokens": 641711318.0, "step": 20106 }, { "entropy": 0.6299753380008042, "epoch": 1.8499548593740116, "grad_norm": 0.15159940719604492, "learning_rate": 3.833839359646702e-05, "loss": 0.6191, "mean_token_accuracy": 0.8137801960110664, "num_tokens": 641743731.0, "step": 20107 }, { "entropy": 0.7089261058717966, "epoch": 1.850046865745453, "grad_norm": 0.15676048398017883, "learning_rate": 3.833532677032539e-05, "loss": 0.6924, "mean_token_accuracy": 0.7871595434844494, "num_tokens": 641775285.0, "step": 20108 }, { "entropy": 0.6745587084442377, "epoch": 1.850138872116894, "grad_norm": 0.16059044003486633, "learning_rate": 3.833225994418377e-05, "loss": 0.6803, "mean_token_accuracy": 0.7917057015001774, "num_tokens": 641807420.0, "step": 20109 }, { "entropy": 0.5919946478679776, "epoch": 1.8502308784883352, "grad_norm": 0.15327763557434082, "learning_rate": 3.832919311804214e-05, "loss": 0.5846, "mean_token_accuracy": 0.8177672699093819, "num_tokens": 641838911.0, "step": 20110 }, { "entropy": 0.6356851998716593, "epoch": 1.8503228848597766, "grad_norm": 0.16158141195774078, "learning_rate": 3.832612629190051e-05, "loss": 0.6326, "mean_token_accuracy": 0.8053868785500526, "num_tokens": 641871247.0, "step": 20111 }, { "entropy": 0.5056082927621901, "epoch": 1.8504148912312177, "grad_norm": 0.14697028696537018, "learning_rate": 3.832305946575889e-05, "loss": 0.4967, "mean_token_accuracy": 0.845918532460928, "num_tokens": 641903704.0, "step": 20112 }, { "entropy": 0.5749184507876635, "epoch": 1.850506897602659, "grad_norm": 0.15567509829998016, "learning_rate": 3.831999263961726e-05, "loss": 0.5694, "mean_token_accuracy": 0.826347392052412, "num_tokens": 641935445.0, "step": 20113 }, { "entropy": 0.49936466477811337, "epoch": 1.8505989039741002, "grad_norm": 0.1531064808368683, "learning_rate": 3.831692581347564e-05, "loss": 0.499, "mean_token_accuracy": 0.8432282209396362, "num_tokens": 641967235.0, "step": 20114 }, { "entropy": 0.6161254327744246, "epoch": 1.8506909103455413, "grad_norm": 0.1524621993303299, "learning_rate": 3.831385898733401e-05, "loss": 0.6046, "mean_token_accuracy": 0.8141258619725704, "num_tokens": 641999650.0, "step": 20115 }, { "entropy": 0.6216013869270682, "epoch": 1.8507829167169827, "grad_norm": 0.15235473215579987, "learning_rate": 3.831079216119238e-05, "loss": 0.6048, "mean_token_accuracy": 0.8154021948575974, "num_tokens": 642031773.0, "step": 20116 }, { "entropy": 0.6826407387852669, "epoch": 1.8508749230884238, "grad_norm": 0.1647946834564209, "learning_rate": 3.830772533505076e-05, "loss": 0.6748, "mean_token_accuracy": 0.7909054644405842, "num_tokens": 642063084.0, "step": 20117 }, { "entropy": 0.6363363824784756, "epoch": 1.8509669294598652, "grad_norm": 0.1586863398551941, "learning_rate": 3.830465850890913e-05, "loss": 0.6386, "mean_token_accuracy": 0.8077666833996773, "num_tokens": 642094956.0, "step": 20118 }, { "entropy": 0.6965777669101954, "epoch": 1.8510589358313063, "grad_norm": 0.16494451463222504, "learning_rate": 3.8301591682767504e-05, "loss": 0.6731, "mean_token_accuracy": 0.7952885031700134, "num_tokens": 642126602.0, "step": 20119 }, { "entropy": 0.6649625077843666, "epoch": 1.8511509422027475, "grad_norm": 0.15876929461956024, "learning_rate": 3.829852485662588e-05, "loss": 0.6627, "mean_token_accuracy": 0.796858761459589, "num_tokens": 642159034.0, "step": 20120 }, { "entropy": 0.5917795095592737, "epoch": 1.8512429485741888, "grad_norm": 0.1565108448266983, "learning_rate": 3.829545803048425e-05, "loss": 0.5761, "mean_token_accuracy": 0.8206711933016777, "num_tokens": 642190613.0, "step": 20121 }, { "entropy": 0.5543080763891339, "epoch": 1.85133495494563, "grad_norm": 0.1434730440378189, "learning_rate": 3.829239120434263e-05, "loss": 0.5518, "mean_token_accuracy": 0.8292067535221577, "num_tokens": 642223290.0, "step": 20122 }, { "entropy": 0.5594840822741389, "epoch": 1.8514269613170713, "grad_norm": 0.14533527195453644, "learning_rate": 3.8289324378201e-05, "loss": 0.541, "mean_token_accuracy": 0.8356471210718155, "num_tokens": 642255205.0, "step": 20123 }, { "entropy": 0.6274147173389792, "epoch": 1.8515189676885124, "grad_norm": 0.1540180891752243, "learning_rate": 3.828625755205938e-05, "loss": 0.6103, "mean_token_accuracy": 0.8131873607635498, "num_tokens": 642287963.0, "step": 20124 }, { "entropy": 0.5859491426963359, "epoch": 1.8516109740599536, "grad_norm": 0.15644831955432892, "learning_rate": 3.828319072591775e-05, "loss": 0.5825, "mean_token_accuracy": 0.8193375170230865, "num_tokens": 642319870.0, "step": 20125 }, { "entropy": 0.6591705027967691, "epoch": 1.851702980431395, "grad_norm": 0.15142549574375153, "learning_rate": 3.828012389977612e-05, "loss": 0.6578, "mean_token_accuracy": 0.7969162613153458, "num_tokens": 642351811.0, "step": 20126 }, { "entropy": 0.5345064932480454, "epoch": 1.851794986802836, "grad_norm": 0.14041244983673096, "learning_rate": 3.82770570736345e-05, "loss": 0.5154, "mean_token_accuracy": 0.8384746015071869, "num_tokens": 642383809.0, "step": 20127 }, { "entropy": 0.6327606067061424, "epoch": 1.8518869931742774, "grad_norm": 0.15839456021785736, "learning_rate": 3.827399024749287e-05, "loss": 0.6162, "mean_token_accuracy": 0.8105944283306599, "num_tokens": 642415128.0, "step": 20128 }, { "entropy": 0.6338675990700722, "epoch": 1.8519789995457185, "grad_norm": 0.1552390307188034, "learning_rate": 3.827092342135124e-05, "loss": 0.6294, "mean_token_accuracy": 0.8087133355438709, "num_tokens": 642445906.0, "step": 20129 }, { "entropy": 0.6021791324019432, "epoch": 1.8520710059171597, "grad_norm": 0.15313184261322021, "learning_rate": 3.826785659520962e-05, "loss": 0.5885, "mean_token_accuracy": 0.8167801983654499, "num_tokens": 642478134.0, "step": 20130 }, { "entropy": 0.6300938464701176, "epoch": 1.852163012288601, "grad_norm": 0.1607762575149536, "learning_rate": 3.826478976906799e-05, "loss": 0.639, "mean_token_accuracy": 0.8077557124197483, "num_tokens": 642509252.0, "step": 20131 }, { "entropy": 0.6383300274610519, "epoch": 1.8522550186600422, "grad_norm": 0.16055725514888763, "learning_rate": 3.826172294292637e-05, "loss": 0.6324, "mean_token_accuracy": 0.806234672665596, "num_tokens": 642541141.0, "step": 20132 }, { "entropy": 0.623403238132596, "epoch": 1.8523470250314835, "grad_norm": 0.15467093884944916, "learning_rate": 3.825865611678474e-05, "loss": 0.6178, "mean_token_accuracy": 0.8093832246959209, "num_tokens": 642573099.0, "step": 20133 }, { "entropy": 0.49085687659680843, "epoch": 1.8524390314029247, "grad_norm": 0.14813201129436493, "learning_rate": 3.8255589290643117e-05, "loss": 0.4775, "mean_token_accuracy": 0.851643793284893, "num_tokens": 642605190.0, "step": 20134 }, { "entropy": 0.5495682479813695, "epoch": 1.8525310377743658, "grad_norm": 0.1513737589120865, "learning_rate": 3.825252246450149e-05, "loss": 0.5418, "mean_token_accuracy": 0.8337811380624771, "num_tokens": 642637958.0, "step": 20135 }, { "entropy": 0.5686314832419157, "epoch": 1.8526230441458071, "grad_norm": 0.15813478827476501, "learning_rate": 3.8249455638359866e-05, "loss": 0.5677, "mean_token_accuracy": 0.8265688493847847, "num_tokens": 642669466.0, "step": 20136 }, { "entropy": 0.6740667335689068, "epoch": 1.8527150505172483, "grad_norm": 0.15247038006782532, "learning_rate": 3.8246388812218234e-05, "loss": 0.654, "mean_token_accuracy": 0.7980121187865734, "num_tokens": 642701591.0, "step": 20137 }, { "entropy": 0.6928689545020461, "epoch": 1.8528070568886896, "grad_norm": 0.15841704607009888, "learning_rate": 3.8243321986076615e-05, "loss": 0.6821, "mean_token_accuracy": 0.7887511514127254, "num_tokens": 642733706.0, "step": 20138 }, { "entropy": 0.5669419057667255, "epoch": 1.8528990632601308, "grad_norm": 0.15023601055145264, "learning_rate": 3.824025515993498e-05, "loss": 0.5544, "mean_token_accuracy": 0.832451481372118, "num_tokens": 642765156.0, "step": 20139 }, { "entropy": 0.6447481699287891, "epoch": 1.852991069631572, "grad_norm": 0.15353333950042725, "learning_rate": 3.8237188333793364e-05, "loss": 0.6183, "mean_token_accuracy": 0.8061834163963795, "num_tokens": 642796372.0, "step": 20140 }, { "entropy": 0.6456287875771523, "epoch": 1.8530830760030133, "grad_norm": 0.16346195340156555, "learning_rate": 3.823412150765173e-05, "loss": 0.6404, "mean_token_accuracy": 0.8030321523547173, "num_tokens": 642827871.0, "step": 20141 }, { "entropy": 0.4827807806432247, "epoch": 1.8531750823744544, "grad_norm": 0.13687318563461304, "learning_rate": 3.823105468151011e-05, "loss": 0.4744, "mean_token_accuracy": 0.8515429273247719, "num_tokens": 642860449.0, "step": 20142 }, { "entropy": 0.4758247225545347, "epoch": 1.8532670887458957, "grad_norm": 0.14305585622787476, "learning_rate": 3.822798785536848e-05, "loss": 0.4735, "mean_token_accuracy": 0.8544538654386997, "num_tokens": 642891955.0, "step": 20143 }, { "entropy": 0.5979050993919373, "epoch": 1.8533590951173369, "grad_norm": 0.15296417474746704, "learning_rate": 3.8224921029226856e-05, "loss": 0.5848, "mean_token_accuracy": 0.8209497071802616, "num_tokens": 642924366.0, "step": 20144 }, { "entropy": 0.5904347752220929, "epoch": 1.853451101488778, "grad_norm": 0.15604791045188904, "learning_rate": 3.822185420308523e-05, "loss": 0.5685, "mean_token_accuracy": 0.8211163394153118, "num_tokens": 642955713.0, "step": 20145 }, { "entropy": 0.5493530072271824, "epoch": 1.8535431078602194, "grad_norm": 0.14751175045967102, "learning_rate": 3.8218787376943606e-05, "loss": 0.5481, "mean_token_accuracy": 0.830479085445404, "num_tokens": 642988086.0, "step": 20146 }, { "entropy": 0.5254292306490242, "epoch": 1.8536351142316605, "grad_norm": 0.14860959351062775, "learning_rate": 3.8215720550801973e-05, "loss": 0.5114, "mean_token_accuracy": 0.8416835442185402, "num_tokens": 643019591.0, "step": 20147 }, { "entropy": 0.5208263311069459, "epoch": 1.8537271206031019, "grad_norm": 0.14888465404510498, "learning_rate": 3.8212653724660355e-05, "loss": 0.5042, "mean_token_accuracy": 0.8429956808686256, "num_tokens": 643051058.0, "step": 20148 }, { "entropy": 0.592694922350347, "epoch": 1.853819126974543, "grad_norm": 0.16000133752822876, "learning_rate": 3.820958689851872e-05, "loss": 0.5838, "mean_token_accuracy": 0.817302867770195, "num_tokens": 643081960.0, "step": 20149 }, { "entropy": 0.5742978085763752, "epoch": 1.8539111333459841, "grad_norm": 0.14845137298107147, "learning_rate": 3.82065200723771e-05, "loss": 0.5824, "mean_token_accuracy": 0.8172314576804638, "num_tokens": 643114698.0, "step": 20150 }, { "entropy": 0.7366017904132605, "epoch": 1.8540031397174255, "grad_norm": 0.16017501056194305, "learning_rate": 3.820345324623547e-05, "loss": 0.726, "mean_token_accuracy": 0.7788531742990017, "num_tokens": 643146647.0, "step": 20151 }, { "entropy": 0.6066845376044512, "epoch": 1.8540951460888666, "grad_norm": 0.15344713628292084, "learning_rate": 3.820038642009385e-05, "loss": 0.5854, "mean_token_accuracy": 0.8169460631906986, "num_tokens": 643177663.0, "step": 20152 }, { "entropy": 0.6050769994035363, "epoch": 1.854187152460308, "grad_norm": 0.16155187785625458, "learning_rate": 3.819731959395222e-05, "loss": 0.6015, "mean_token_accuracy": 0.8150060400366783, "num_tokens": 643208858.0, "step": 20153 }, { "entropy": 0.6270965822041035, "epoch": 1.854279158831749, "grad_norm": 0.15508270263671875, "learning_rate": 3.8194252767810596e-05, "loss": 0.6185, "mean_token_accuracy": 0.8088742010295391, "num_tokens": 643241360.0, "step": 20154 }, { "entropy": 0.5924027995206416, "epoch": 1.8543711652031902, "grad_norm": 0.15835346281528473, "learning_rate": 3.8191185941668964e-05, "loss": 0.5868, "mean_token_accuracy": 0.8175483085215092, "num_tokens": 643273328.0, "step": 20155 }, { "entropy": 0.5784739404916763, "epoch": 1.8544631715746316, "grad_norm": 0.1474360078573227, "learning_rate": 3.8188119115527345e-05, "loss": 0.568, "mean_token_accuracy": 0.8252287209033966, "num_tokens": 643304956.0, "step": 20156 }, { "entropy": 0.5892106450628489, "epoch": 1.8545551779460727, "grad_norm": 0.15271909534931183, "learning_rate": 3.818505228938571e-05, "loss": 0.5806, "mean_token_accuracy": 0.8207590393722057, "num_tokens": 643337362.0, "step": 20157 }, { "entropy": 0.610480927862227, "epoch": 1.854647184317514, "grad_norm": 0.15252019464969635, "learning_rate": 3.818198546324409e-05, "loss": 0.599, "mean_token_accuracy": 0.8197630159556866, "num_tokens": 643368820.0, "step": 20158 }, { "entropy": 0.572196583263576, "epoch": 1.8547391906889552, "grad_norm": 0.14287716150283813, "learning_rate": 3.817891863710246e-05, "loss": 0.5597, "mean_token_accuracy": 0.8243460766971111, "num_tokens": 643400630.0, "step": 20159 }, { "entropy": 0.5960161425173283, "epoch": 1.8548311970603963, "grad_norm": 0.15561988949775696, "learning_rate": 3.817585181096084e-05, "loss": 0.5805, "mean_token_accuracy": 0.8210885487496853, "num_tokens": 643431799.0, "step": 20160 }, { "entropy": 0.5909542944282293, "epoch": 1.8549232034318377, "grad_norm": 0.1628892868757248, "learning_rate": 3.817278498481921e-05, "loss": 0.5896, "mean_token_accuracy": 0.8181793764233589, "num_tokens": 643463689.0, "step": 20161 }, { "entropy": 0.5546099301427603, "epoch": 1.8550152098032788, "grad_norm": 0.14265261590480804, "learning_rate": 3.8169718158677586e-05, "loss": 0.5472, "mean_token_accuracy": 0.8301013074815273, "num_tokens": 643496377.0, "step": 20162 }, { "entropy": 0.5881641646847129, "epoch": 1.8551072161747202, "grad_norm": 0.15643279254436493, "learning_rate": 3.8166651332535954e-05, "loss": 0.5825, "mean_token_accuracy": 0.8213860802352428, "num_tokens": 643527609.0, "step": 20163 }, { "entropy": 0.5862077670171857, "epoch": 1.8551992225461613, "grad_norm": 0.1497085690498352, "learning_rate": 3.8163584506394336e-05, "loss": 0.5835, "mean_token_accuracy": 0.8143374882638454, "num_tokens": 643559411.0, "step": 20164 }, { "entropy": 0.6521482160314918, "epoch": 1.8552912289176025, "grad_norm": 0.15702185034751892, "learning_rate": 3.816051768025271e-05, "loss": 0.656, "mean_token_accuracy": 0.7999181114137173, "num_tokens": 643590664.0, "step": 20165 }, { "entropy": 0.5738735143095255, "epoch": 1.8553832352890438, "grad_norm": 0.14700061082839966, "learning_rate": 3.8157450854111085e-05, "loss": 0.5608, "mean_token_accuracy": 0.8261691182851791, "num_tokens": 643622797.0, "step": 20166 }, { "entropy": 0.5596347160171717, "epoch": 1.855475241660485, "grad_norm": 0.148319274187088, "learning_rate": 3.815438402796946e-05, "loss": 0.5511, "mean_token_accuracy": 0.8285940513014793, "num_tokens": 643655084.0, "step": 20167 }, { "entropy": 0.6538048684597015, "epoch": 1.8555672480319263, "grad_norm": 0.15982499718666077, "learning_rate": 3.815131720182783e-05, "loss": 0.6358, "mean_token_accuracy": 0.8041831739246845, "num_tokens": 643686724.0, "step": 20168 }, { "entropy": 0.5267978655174375, "epoch": 1.8556592544033674, "grad_norm": 0.14465680718421936, "learning_rate": 3.814825037568621e-05, "loss": 0.521, "mean_token_accuracy": 0.8382110558450222, "num_tokens": 643718845.0, "step": 20169 }, { "entropy": 0.5836936086416245, "epoch": 1.8557512607748086, "grad_norm": 0.15149220824241638, "learning_rate": 3.814518354954458e-05, "loss": 0.5657, "mean_token_accuracy": 0.8258719444274902, "num_tokens": 643751115.0, "step": 20170 }, { "entropy": 0.639935964718461, "epoch": 1.85584326714625, "grad_norm": 0.15503588318824768, "learning_rate": 3.814211672340295e-05, "loss": 0.6162, "mean_token_accuracy": 0.8075538612902164, "num_tokens": 643782716.0, "step": 20171 }, { "entropy": 0.6049822364002466, "epoch": 1.855935273517691, "grad_norm": 0.15240418910980225, "learning_rate": 3.8139049897261326e-05, "loss": 0.5899, "mean_token_accuracy": 0.8171542510390282, "num_tokens": 643815011.0, "step": 20172 }, { "entropy": 0.6382066365331411, "epoch": 1.8560272798891324, "grad_norm": 0.15895354747772217, "learning_rate": 3.81359830711197e-05, "loss": 0.6323, "mean_token_accuracy": 0.8078216090798378, "num_tokens": 643847321.0, "step": 20173 }, { "entropy": 0.5806713029742241, "epoch": 1.8561192862605735, "grad_norm": 0.15066863596439362, "learning_rate": 3.8132916244978075e-05, "loss": 0.5638, "mean_token_accuracy": 0.8235518336296082, "num_tokens": 643878613.0, "step": 20174 }, { "entropy": 0.5831570085138083, "epoch": 1.8562112926320147, "grad_norm": 0.15324629843235016, "learning_rate": 3.812984941883645e-05, "loss": 0.579, "mean_token_accuracy": 0.8207078017294407, "num_tokens": 643911083.0, "step": 20175 }, { "entropy": 0.5468734013848007, "epoch": 1.856303299003456, "grad_norm": 0.150834321975708, "learning_rate": 3.812678259269482e-05, "loss": 0.5338, "mean_token_accuracy": 0.8337765671312809, "num_tokens": 643942666.0, "step": 20176 }, { "entropy": 0.5278650792315602, "epoch": 1.8563953053748972, "grad_norm": 0.144990473985672, "learning_rate": 3.81237157665532e-05, "loss": 0.5127, "mean_token_accuracy": 0.8407311588525772, "num_tokens": 643974906.0, "step": 20177 }, { "entropy": 0.6255029533058405, "epoch": 1.8564873117463385, "grad_norm": 0.1533399075269699, "learning_rate": 3.812064894041157e-05, "loss": 0.624, "mean_token_accuracy": 0.8125024251639843, "num_tokens": 644007487.0, "step": 20178 }, { "entropy": 0.6198471691459417, "epoch": 1.8565793181177797, "grad_norm": 0.15745669603347778, "learning_rate": 3.811758211426994e-05, "loss": 0.624, "mean_token_accuracy": 0.8082638159394264, "num_tokens": 644039968.0, "step": 20179 }, { "entropy": 0.5873255394399166, "epoch": 1.8566713244892208, "grad_norm": 0.14616993069648743, "learning_rate": 3.8114515288128316e-05, "loss": 0.5768, "mean_token_accuracy": 0.8201756440103054, "num_tokens": 644072428.0, "step": 20180 }, { "entropy": 0.6213527768850327, "epoch": 1.8567633308606621, "grad_norm": 0.15586458146572113, "learning_rate": 3.811144846198669e-05, "loss": 0.6181, "mean_token_accuracy": 0.8129736632108688, "num_tokens": 644104851.0, "step": 20181 }, { "entropy": 0.49847467872314155, "epoch": 1.8568553372321033, "grad_norm": 0.14329512417316437, "learning_rate": 3.8108381635845066e-05, "loss": 0.4824, "mean_token_accuracy": 0.8481305055320263, "num_tokens": 644136546.0, "step": 20182 }, { "entropy": 0.6370272599160671, "epoch": 1.8569473436035446, "grad_norm": 0.1550871580839157, "learning_rate": 3.810531480970344e-05, "loss": 0.6391, "mean_token_accuracy": 0.8100720718502998, "num_tokens": 644168457.0, "step": 20183 }, { "entropy": 0.5816693119704723, "epoch": 1.8570393499749858, "grad_norm": 0.15793421864509583, "learning_rate": 3.8102247983561815e-05, "loss": 0.5671, "mean_token_accuracy": 0.8236556090414524, "num_tokens": 644199380.0, "step": 20184 }, { "entropy": 0.6254759691655636, "epoch": 1.857131356346427, "grad_norm": 0.15736596286296844, "learning_rate": 3.809918115742019e-05, "loss": 0.6068, "mean_token_accuracy": 0.8117800578474998, "num_tokens": 644230574.0, "step": 20185 }, { "entropy": 0.555052244104445, "epoch": 1.8572233627178683, "grad_norm": 0.1507463902235031, "learning_rate": 3.809611433127856e-05, "loss": 0.5683, "mean_token_accuracy": 0.8255070559680462, "num_tokens": 644261984.0, "step": 20186 }, { "entropy": 0.5114808119833469, "epoch": 1.8573153690893094, "grad_norm": 0.14507544040679932, "learning_rate": 3.809304750513694e-05, "loss": 0.5001, "mean_token_accuracy": 0.8444084599614143, "num_tokens": 644293994.0, "step": 20187 }, { "entropy": 0.7252793367952108, "epoch": 1.8574073754607507, "grad_norm": 0.16865509748458862, "learning_rate": 3.808998067899531e-05, "loss": 0.7462, "mean_token_accuracy": 0.7764151729643345, "num_tokens": 644325460.0, "step": 20188 }, { "entropy": 0.5888302968814969, "epoch": 1.8574993818321919, "grad_norm": 0.15637542307376862, "learning_rate": 3.808691385285368e-05, "loss": 0.5771, "mean_token_accuracy": 0.8244288489222527, "num_tokens": 644356618.0, "step": 20189 }, { "entropy": 0.7313155476003885, "epoch": 1.857591388203633, "grad_norm": 0.16373324394226074, "learning_rate": 3.8083847026712056e-05, "loss": 0.7162, "mean_token_accuracy": 0.7810565829277039, "num_tokens": 644387919.0, "step": 20190 }, { "entropy": 0.6348447855561972, "epoch": 1.8576833945750744, "grad_norm": 0.16101489961147308, "learning_rate": 3.808078020057043e-05, "loss": 0.6186, "mean_token_accuracy": 0.8079969137907028, "num_tokens": 644418999.0, "step": 20191 }, { "entropy": 0.5922735594213009, "epoch": 1.8577754009465155, "grad_norm": 0.15146638453006744, "learning_rate": 3.8077713374428805e-05, "loss": 0.5774, "mean_token_accuracy": 0.8200131356716156, "num_tokens": 644451460.0, "step": 20192 }, { "entropy": 0.6229637283831835, "epoch": 1.8578674073179569, "grad_norm": 0.1517084389925003, "learning_rate": 3.807464654828718e-05, "loss": 0.6162, "mean_token_accuracy": 0.8065945245325565, "num_tokens": 644483455.0, "step": 20193 }, { "entropy": 0.6324127987027168, "epoch": 1.857959413689398, "grad_norm": 0.16079886257648468, "learning_rate": 3.8071579722145555e-05, "loss": 0.6163, "mean_token_accuracy": 0.8115124627947807, "num_tokens": 644514704.0, "step": 20194 }, { "entropy": 0.605857552960515, "epoch": 1.8580514200608391, "grad_norm": 0.1611052006483078, "learning_rate": 3.806851289600393e-05, "loss": 0.5823, "mean_token_accuracy": 0.8186449855566025, "num_tokens": 644546071.0, "step": 20195 }, { "entropy": 0.5878856724593788, "epoch": 1.8581434264322805, "grad_norm": 0.15166962146759033, "learning_rate": 3.8065446069862304e-05, "loss": 0.5783, "mean_token_accuracy": 0.8216238580644131, "num_tokens": 644578062.0, "step": 20196 }, { "entropy": 0.6371051301248372, "epoch": 1.8582354328037216, "grad_norm": 0.1546907275915146, "learning_rate": 3.806237924372067e-05, "loss": 0.6264, "mean_token_accuracy": 0.8091386891901493, "num_tokens": 644609971.0, "step": 20197 }, { "entropy": 0.6979553550481796, "epoch": 1.858327439175163, "grad_norm": 0.1613386869430542, "learning_rate": 3.805931241757905e-05, "loss": 0.6891, "mean_token_accuracy": 0.7887177728116512, "num_tokens": 644641866.0, "step": 20198 }, { "entropy": 0.6000586245208979, "epoch": 1.858419445546604, "grad_norm": 0.1518559455871582, "learning_rate": 3.805624559143742e-05, "loss": 0.5793, "mean_token_accuracy": 0.8215757757425308, "num_tokens": 644674540.0, "step": 20199 }, { "entropy": 0.7027628421783447, "epoch": 1.8585114519180452, "grad_norm": 0.16469117999076843, "learning_rate": 3.80531787652958e-05, "loss": 0.703, "mean_token_accuracy": 0.7903471626341343, "num_tokens": 644705826.0, "step": 20200 }, { "entropy": 0.6682853177189827, "epoch": 1.8586034582894866, "grad_norm": 0.15727585554122925, "learning_rate": 3.805011193915417e-05, "loss": 0.6712, "mean_token_accuracy": 0.7949102595448494, "num_tokens": 644738200.0, "step": 20201 }, { "entropy": 0.7122803293168545, "epoch": 1.8586954646609277, "grad_norm": 0.1666327267885208, "learning_rate": 3.8047045113012545e-05, "loss": 0.7074, "mean_token_accuracy": 0.786298606544733, "num_tokens": 644769543.0, "step": 20202 }, { "entropy": 0.5248357485979795, "epoch": 1.858787471032369, "grad_norm": 0.14800043404102325, "learning_rate": 3.804397828687092e-05, "loss": 0.5222, "mean_token_accuracy": 0.8390410616993904, "num_tokens": 644802065.0, "step": 20203 }, { "entropy": 0.5965329553000629, "epoch": 1.8588794774038102, "grad_norm": 0.15865622460842133, "learning_rate": 3.8040911460729294e-05, "loss": 0.5848, "mean_token_accuracy": 0.8190498314797878, "num_tokens": 644833961.0, "step": 20204 }, { "entropy": 0.6611807020381093, "epoch": 1.8589714837752513, "grad_norm": 0.15140828490257263, "learning_rate": 3.803784463458767e-05, "loss": 0.6438, "mean_token_accuracy": 0.8037238605320454, "num_tokens": 644866142.0, "step": 20205 }, { "entropy": 0.6315493693109602, "epoch": 1.8590634901466927, "grad_norm": 0.15681375563144684, "learning_rate": 3.8034777808446044e-05, "loss": 0.6174, "mean_token_accuracy": 0.8114238865673542, "num_tokens": 644898296.0, "step": 20206 }, { "entropy": 0.5514801922254264, "epoch": 1.8591554965181338, "grad_norm": 0.15277330577373505, "learning_rate": 3.803171098230441e-05, "loss": 0.5317, "mean_token_accuracy": 0.8331925980746746, "num_tokens": 644929781.0, "step": 20207 }, { "entropy": 0.6815092326141894, "epoch": 1.8592475028895752, "grad_norm": 0.16153867542743683, "learning_rate": 3.802864415616279e-05, "loss": 0.6693, "mean_token_accuracy": 0.7933277413249016, "num_tokens": 644961914.0, "step": 20208 }, { "entropy": 0.6086123478598893, "epoch": 1.8593395092610163, "grad_norm": 0.1595204621553421, "learning_rate": 3.802557733002116e-05, "loss": 0.582, "mean_token_accuracy": 0.818330492824316, "num_tokens": 644993010.0, "step": 20209 }, { "entropy": 0.5847871480509639, "epoch": 1.8594315156324575, "grad_norm": 0.15228207409381866, "learning_rate": 3.8022510503879536e-05, "loss": 0.581, "mean_token_accuracy": 0.8198279030621052, "num_tokens": 645024691.0, "step": 20210 }, { "entropy": 0.6468964051455259, "epoch": 1.8595235220038988, "grad_norm": 0.15652546286582947, "learning_rate": 3.801944367773791e-05, "loss": 0.6376, "mean_token_accuracy": 0.8060960322618484, "num_tokens": 645056900.0, "step": 20211 }, { "entropy": 0.6322236796841025, "epoch": 1.85961552837534, "grad_norm": 0.16328980028629303, "learning_rate": 3.8016376851596285e-05, "loss": 0.6269, "mean_token_accuracy": 0.806219644844532, "num_tokens": 645088152.0, "step": 20212 }, { "entropy": 0.5940929856151342, "epoch": 1.8597075347467813, "grad_norm": 0.1501302719116211, "learning_rate": 3.801331002545466e-05, "loss": 0.5844, "mean_token_accuracy": 0.8205597102642059, "num_tokens": 645120430.0, "step": 20213 }, { "entropy": 0.6258723102509975, "epoch": 1.8597995411182224, "grad_norm": 0.15844371914863586, "learning_rate": 3.8010243199313034e-05, "loss": 0.6085, "mean_token_accuracy": 0.8155757933855057, "num_tokens": 645152951.0, "step": 20214 }, { "entropy": 0.5167998420074582, "epoch": 1.8598915474896636, "grad_norm": 0.14283926784992218, "learning_rate": 3.80071763731714e-05, "loss": 0.5069, "mean_token_accuracy": 0.8435018621385098, "num_tokens": 645185581.0, "step": 20215 }, { "entropy": 0.6207781576085836, "epoch": 1.859983553861105, "grad_norm": 0.15141962468624115, "learning_rate": 3.8004109547029783e-05, "loss": 0.6099, "mean_token_accuracy": 0.8192229904234409, "num_tokens": 645218067.0, "step": 20216 }, { "entropy": 0.5385414347983897, "epoch": 1.860075560232546, "grad_norm": 0.14527647197246552, "learning_rate": 3.800104272088815e-05, "loss": 0.5359, "mean_token_accuracy": 0.8335303924977779, "num_tokens": 645250544.0, "step": 20217 }, { "entropy": 0.6443868158385158, "epoch": 1.8601675666039874, "grad_norm": 0.1564304232597351, "learning_rate": 3.7997975894746526e-05, "loss": 0.6314, "mean_token_accuracy": 0.8057489842176437, "num_tokens": 645281830.0, "step": 20218 }, { "entropy": 0.5901691946201026, "epoch": 1.8602595729754285, "grad_norm": 0.14882604777812958, "learning_rate": 3.79949090686049e-05, "loss": 0.5812, "mean_token_accuracy": 0.8222624845802784, "num_tokens": 645314363.0, "step": 20219 }, { "entropy": 0.6935639623552561, "epoch": 1.8603515793468697, "grad_norm": 0.15529774129390717, "learning_rate": 3.7991842242463275e-05, "loss": 0.6866, "mean_token_accuracy": 0.7927219942212105, "num_tokens": 645347093.0, "step": 20220 }, { "entropy": 0.5999538563191891, "epoch": 1.860443585718311, "grad_norm": 0.15091365575790405, "learning_rate": 3.798877541632165e-05, "loss": 0.5771, "mean_token_accuracy": 0.8212966844439507, "num_tokens": 645378300.0, "step": 20221 }, { "entropy": 0.5345150413922966, "epoch": 1.8605355920897522, "grad_norm": 0.15177005529403687, "learning_rate": 3.7985708590180025e-05, "loss": 0.5207, "mean_token_accuracy": 0.839471310377121, "num_tokens": 645409864.0, "step": 20222 }, { "entropy": 0.5405553141608834, "epoch": 1.8606275984611935, "grad_norm": 0.14782263338565826, "learning_rate": 3.798264176403839e-05, "loss": 0.5385, "mean_token_accuracy": 0.8332877084612846, "num_tokens": 645442017.0, "step": 20223 }, { "entropy": 0.6185010238550603, "epoch": 1.8607196048326347, "grad_norm": 0.15256857872009277, "learning_rate": 3.7979574937896774e-05, "loss": 0.6049, "mean_token_accuracy": 0.8102580159902573, "num_tokens": 645474346.0, "step": 20224 }, { "entropy": 0.6185669489204884, "epoch": 1.8608116112040758, "grad_norm": 0.15296731889247894, "learning_rate": 3.797650811175515e-05, "loss": 0.6084, "mean_token_accuracy": 0.8082662411034107, "num_tokens": 645506298.0, "step": 20225 }, { "entropy": 0.651063296943903, "epoch": 1.8609036175755171, "grad_norm": 0.152785986661911, "learning_rate": 3.797344128561352e-05, "loss": 0.6424, "mean_token_accuracy": 0.8015863858163357, "num_tokens": 645538764.0, "step": 20226 }, { "entropy": 0.6298990743234754, "epoch": 1.8609956239469583, "grad_norm": 0.15484680235385895, "learning_rate": 3.79703744594719e-05, "loss": 0.618, "mean_token_accuracy": 0.8121781200170517, "num_tokens": 645570450.0, "step": 20227 }, { "entropy": 0.5715260356664658, "epoch": 1.8610876303183996, "grad_norm": 0.14961791038513184, "learning_rate": 3.7967307633330266e-05, "loss": 0.5547, "mean_token_accuracy": 0.8293020315468311, "num_tokens": 645602546.0, "step": 20228 }, { "entropy": 0.5587880173698068, "epoch": 1.8611796366898408, "grad_norm": 0.15061630308628082, "learning_rate": 3.796424080718865e-05, "loss": 0.5429, "mean_token_accuracy": 0.830343808978796, "num_tokens": 645634456.0, "step": 20229 }, { "entropy": 0.4921937435865402, "epoch": 1.861271643061282, "grad_norm": 0.1467963308095932, "learning_rate": 3.7961173981047015e-05, "loss": 0.4795, "mean_token_accuracy": 0.8494103662669659, "num_tokens": 645666192.0, "step": 20230 }, { "entropy": 0.5011443821713328, "epoch": 1.8613636494327233, "grad_norm": 0.14566612243652344, "learning_rate": 3.795810715490539e-05, "loss": 0.491, "mean_token_accuracy": 0.8477202616631985, "num_tokens": 645698174.0, "step": 20231 }, { "entropy": 0.5392362074926496, "epoch": 1.8614556558041644, "grad_norm": 0.14587754011154175, "learning_rate": 3.7955040328763764e-05, "loss": 0.528, "mean_token_accuracy": 0.8363351784646511, "num_tokens": 645730406.0, "step": 20232 }, { "entropy": 0.5661570429801941, "epoch": 1.8615476621756057, "grad_norm": 0.15715239942073822, "learning_rate": 3.795197350262214e-05, "loss": 0.5602, "mean_token_accuracy": 0.8298424556851387, "num_tokens": 645763174.0, "step": 20233 }, { "entropy": 0.5110070314258337, "epoch": 1.8616396685470469, "grad_norm": 0.1449805200099945, "learning_rate": 3.7948906676480514e-05, "loss": 0.5038, "mean_token_accuracy": 0.8464826606214046, "num_tokens": 645795942.0, "step": 20234 }, { "entropy": 0.6580328904092312, "epoch": 1.861731674918488, "grad_norm": 0.1569705605506897, "learning_rate": 3.794583985033889e-05, "loss": 0.654, "mean_token_accuracy": 0.7987189516425133, "num_tokens": 645827925.0, "step": 20235 }, { "entropy": 0.5492188271600753, "epoch": 1.8618236812899294, "grad_norm": 0.145441934466362, "learning_rate": 3.7942773024197256e-05, "loss": 0.5365, "mean_token_accuracy": 0.8323618322610855, "num_tokens": 645859635.0, "step": 20236 }, { "entropy": 0.6197147471830249, "epoch": 1.8619156876613705, "grad_norm": 0.15288394689559937, "learning_rate": 3.793970619805564e-05, "loss": 0.6139, "mean_token_accuracy": 0.8079299367964268, "num_tokens": 645891552.0, "step": 20237 }, { "entropy": 0.5866594221442938, "epoch": 1.8620076940328119, "grad_norm": 0.15569336712360382, "learning_rate": 3.7936639371914005e-05, "loss": 0.572, "mean_token_accuracy": 0.8277784660458565, "num_tokens": 645922795.0, "step": 20238 }, { "entropy": 0.6416776878759265, "epoch": 1.862099700404253, "grad_norm": 0.1527707278728485, "learning_rate": 3.793357254577238e-05, "loss": 0.6197, "mean_token_accuracy": 0.808171235024929, "num_tokens": 645954693.0, "step": 20239 }, { "entropy": 0.6075128316879272, "epoch": 1.8621917067756941, "grad_norm": 0.1501515507698059, "learning_rate": 3.7930505719630755e-05, "loss": 0.5982, "mean_token_accuracy": 0.8142769485712051, "num_tokens": 645986651.0, "step": 20240 }, { "entropy": 0.5770551422610879, "epoch": 1.8622837131471355, "grad_norm": 0.15230470895767212, "learning_rate": 3.792743889348913e-05, "loss": 0.566, "mean_token_accuracy": 0.8247948475182056, "num_tokens": 646018141.0, "step": 20241 }, { "entropy": 0.6433315631002188, "epoch": 1.8623757195185766, "grad_norm": 0.15834422409534454, "learning_rate": 3.7924372067347504e-05, "loss": 0.6286, "mean_token_accuracy": 0.8086157441139221, "num_tokens": 646050082.0, "step": 20242 }, { "entropy": 0.6325675984844565, "epoch": 1.862467725890018, "grad_norm": 0.15082231163978577, "learning_rate": 3.792130524120588e-05, "loss": 0.6203, "mean_token_accuracy": 0.8102931529283524, "num_tokens": 646082190.0, "step": 20243 }, { "entropy": 0.4941807631403208, "epoch": 1.862559732261459, "grad_norm": 0.14447155594825745, "learning_rate": 3.791823841506425e-05, "loss": 0.4839, "mean_token_accuracy": 0.8521003499627113, "num_tokens": 646114154.0, "step": 20244 }, { "entropy": 0.5711313467472792, "epoch": 1.8626517386329002, "grad_norm": 0.15275993943214417, "learning_rate": 3.791517158892263e-05, "loss": 0.5696, "mean_token_accuracy": 0.8205891586840153, "num_tokens": 646145809.0, "step": 20245 }, { "entropy": 0.5685192905366421, "epoch": 1.8627437450043416, "grad_norm": 0.14746713638305664, "learning_rate": 3.7912104762780996e-05, "loss": 0.5561, "mean_token_accuracy": 0.8269962854683399, "num_tokens": 646177989.0, "step": 20246 }, { "entropy": 0.6809146422892809, "epoch": 1.8628357513757827, "grad_norm": 0.1582629233598709, "learning_rate": 3.790903793663938e-05, "loss": 0.6627, "mean_token_accuracy": 0.7977814190089703, "num_tokens": 646209609.0, "step": 20247 }, { "entropy": 0.5340476045385003, "epoch": 1.862927757747224, "grad_norm": 0.14824619889259338, "learning_rate": 3.7905971110497745e-05, "loss": 0.528, "mean_token_accuracy": 0.835956584662199, "num_tokens": 646240932.0, "step": 20248 }, { "entropy": 0.6005916716530919, "epoch": 1.8630197641186652, "grad_norm": 0.15623407065868378, "learning_rate": 3.790290428435612e-05, "loss": 0.5965, "mean_token_accuracy": 0.815921388566494, "num_tokens": 646273341.0, "step": 20249 }, { "entropy": 0.5542439334094524, "epoch": 1.8631117704901063, "grad_norm": 0.15468217432498932, "learning_rate": 3.7899837458214494e-05, "loss": 0.5367, "mean_token_accuracy": 0.8332127220928669, "num_tokens": 646305284.0, "step": 20250 }, { "entropy": 0.6356377629563212, "epoch": 1.8632037768615477, "grad_norm": 0.15608367323875427, "learning_rate": 3.789677063207287e-05, "loss": 0.6177, "mean_token_accuracy": 0.8080092258751392, "num_tokens": 646336681.0, "step": 20251 }, { "entropy": 0.6113678868860006, "epoch": 1.8632957832329888, "grad_norm": 0.14713306725025177, "learning_rate": 3.7893703805931244e-05, "loss": 0.5921, "mean_token_accuracy": 0.8191657140851021, "num_tokens": 646368918.0, "step": 20252 }, { "entropy": 0.6074873739853501, "epoch": 1.8633877896044302, "grad_norm": 0.14712001383304596, "learning_rate": 3.789063697978962e-05, "loss": 0.6051, "mean_token_accuracy": 0.8168438971042633, "num_tokens": 646401348.0, "step": 20253 }, { "entropy": 0.6623212695121765, "epoch": 1.8634797959758713, "grad_norm": 0.15555505454540253, "learning_rate": 3.7887570153647986e-05, "loss": 0.6559, "mean_token_accuracy": 0.7977797761559486, "num_tokens": 646434099.0, "step": 20254 }, { "entropy": 0.5215495261363685, "epoch": 1.8635718023473125, "grad_norm": 0.14527864754199982, "learning_rate": 3.788450332750637e-05, "loss": 0.5138, "mean_token_accuracy": 0.8426460847258568, "num_tokens": 646466184.0, "step": 20255 }, { "entropy": 0.6398505177348852, "epoch": 1.8636638087187538, "grad_norm": 0.15369053184986115, "learning_rate": 3.788143650136474e-05, "loss": 0.6392, "mean_token_accuracy": 0.8046781122684479, "num_tokens": 646498613.0, "step": 20256 }, { "entropy": 0.6029981626197696, "epoch": 1.863755815090195, "grad_norm": 0.15560349822044373, "learning_rate": 3.787836967522311e-05, "loss": 0.5904, "mean_token_accuracy": 0.8190376609563828, "num_tokens": 646530283.0, "step": 20257 }, { "entropy": 0.6486782114952803, "epoch": 1.8638478214616363, "grad_norm": 0.15681372582912445, "learning_rate": 3.787530284908149e-05, "loss": 0.6307, "mean_token_accuracy": 0.8099173009395599, "num_tokens": 646561976.0, "step": 20258 }, { "entropy": 0.4943433655425906, "epoch": 1.8639398278330774, "grad_norm": 0.15138697624206543, "learning_rate": 3.787223602293986e-05, "loss": 0.4855, "mean_token_accuracy": 0.8470326028764248, "num_tokens": 646593325.0, "step": 20259 }, { "entropy": 0.6257907161489129, "epoch": 1.8640318342045186, "grad_norm": 0.1572730392217636, "learning_rate": 3.786916919679824e-05, "loss": 0.6179, "mean_token_accuracy": 0.8099597916007042, "num_tokens": 646624796.0, "step": 20260 }, { "entropy": 0.5474969877395779, "epoch": 1.86412384057596, "grad_norm": 0.14498218894004822, "learning_rate": 3.786610237065661e-05, "loss": 0.5285, "mean_token_accuracy": 0.8376217745244503, "num_tokens": 646656215.0, "step": 20261 }, { "entropy": 0.6555479122325778, "epoch": 1.864215846947401, "grad_norm": 0.16302649676799774, "learning_rate": 3.786303554451498e-05, "loss": 0.645, "mean_token_accuracy": 0.8050543777644634, "num_tokens": 646688012.0, "step": 20262 }, { "entropy": 0.6083686016499996, "epoch": 1.8643078533188424, "grad_norm": 0.15425902605056763, "learning_rate": 3.785996871837336e-05, "loss": 0.5977, "mean_token_accuracy": 0.819736909121275, "num_tokens": 646720051.0, "step": 20263 }, { "entropy": 0.581524197012186, "epoch": 1.8643998596902835, "grad_norm": 0.15265578031539917, "learning_rate": 3.785690189223173e-05, "loss": 0.5708, "mean_token_accuracy": 0.8242971114814281, "num_tokens": 646752016.0, "step": 20264 }, { "entropy": 0.5931144962087274, "epoch": 1.8644918660617247, "grad_norm": 0.15153630077838898, "learning_rate": 3.785383506609011e-05, "loss": 0.5827, "mean_token_accuracy": 0.8224877640604973, "num_tokens": 646783764.0, "step": 20265 }, { "entropy": 0.6327254511415958, "epoch": 1.864583872433166, "grad_norm": 0.15576379001140594, "learning_rate": 3.785076823994848e-05, "loss": 0.6338, "mean_token_accuracy": 0.805065780878067, "num_tokens": 646816288.0, "step": 20266 }, { "entropy": 0.5737252850085497, "epoch": 1.8646758788046072, "grad_norm": 0.14750415086746216, "learning_rate": 3.784770141380685e-05, "loss": 0.5643, "mean_token_accuracy": 0.8251942284405231, "num_tokens": 646849054.0, "step": 20267 }, { "entropy": 0.5886333901435137, "epoch": 1.8647678851760485, "grad_norm": 0.16020312905311584, "learning_rate": 3.784463458766523e-05, "loss": 0.5837, "mean_token_accuracy": 0.8216510005295277, "num_tokens": 646880537.0, "step": 20268 }, { "entropy": 0.622876176610589, "epoch": 1.8648598915474897, "grad_norm": 0.15742383897304535, "learning_rate": 3.78415677615236e-05, "loss": 0.6202, "mean_token_accuracy": 0.8128629550337791, "num_tokens": 646912051.0, "step": 20269 }, { "entropy": 0.5844016252085567, "epoch": 1.8649518979189308, "grad_norm": 0.15926016867160797, "learning_rate": 3.7838500935381974e-05, "loss": 0.5814, "mean_token_accuracy": 0.8234496042132378, "num_tokens": 646943671.0, "step": 20270 }, { "entropy": 0.5370414825156331, "epoch": 1.8650439042903721, "grad_norm": 0.1427209973335266, "learning_rate": 3.783543410924035e-05, "loss": 0.5248, "mean_token_accuracy": 0.8406646251678467, "num_tokens": 646975784.0, "step": 20271 }, { "entropy": 0.784557699225843, "epoch": 1.8651359106618133, "grad_norm": 0.16776598989963531, "learning_rate": 3.783236728309872e-05, "loss": 0.7843, "mean_token_accuracy": 0.7638371773064137, "num_tokens": 647007657.0, "step": 20272 }, { "entropy": 0.6117871711030602, "epoch": 1.8652279170332546, "grad_norm": 0.15370634198188782, "learning_rate": 3.78293004569571e-05, "loss": 0.6076, "mean_token_accuracy": 0.8154137022793293, "num_tokens": 647039804.0, "step": 20273 }, { "entropy": 0.5981995170004666, "epoch": 1.8653199234046958, "grad_norm": 0.15203747153282166, "learning_rate": 3.782623363081547e-05, "loss": 0.5866, "mean_token_accuracy": 0.82015335932374, "num_tokens": 647071919.0, "step": 20274 }, { "entropy": 0.5727057547774166, "epoch": 1.865411929776137, "grad_norm": 0.15208253264427185, "learning_rate": 3.782316680467384e-05, "loss": 0.5682, "mean_token_accuracy": 0.8255399577319622, "num_tokens": 647104068.0, "step": 20275 }, { "entropy": 0.5016544638201594, "epoch": 1.8655039361475783, "grad_norm": 0.14715895056724548, "learning_rate": 3.782009997853222e-05, "loss": 0.4903, "mean_token_accuracy": 0.8442498929798603, "num_tokens": 647136158.0, "step": 20276 }, { "entropy": 0.5040190741419792, "epoch": 1.8655959425190194, "grad_norm": 0.15116716921329498, "learning_rate": 3.781703315239059e-05, "loss": 0.4917, "mean_token_accuracy": 0.8494429849088192, "num_tokens": 647168600.0, "step": 20277 }, { "entropy": 0.5341287571936846, "epoch": 1.8656879488904607, "grad_norm": 0.14642980694770813, "learning_rate": 3.7813966326248964e-05, "loss": 0.5254, "mean_token_accuracy": 0.838009238243103, "num_tokens": 647201267.0, "step": 20278 }, { "entropy": 0.5536263789981604, "epoch": 1.8657799552619019, "grad_norm": 0.14925885200500488, "learning_rate": 3.781089950010734e-05, "loss": 0.5418, "mean_token_accuracy": 0.8311180621385574, "num_tokens": 647233565.0, "step": 20279 }, { "entropy": 0.5869045425206423, "epoch": 1.865871961633343, "grad_norm": 0.14868156611919403, "learning_rate": 3.7807832673965713e-05, "loss": 0.5721, "mean_token_accuracy": 0.8246258907020092, "num_tokens": 647265714.0, "step": 20280 }, { "entropy": 0.4696218236349523, "epoch": 1.8659639680047844, "grad_norm": 0.14237754046916962, "learning_rate": 3.780476584782409e-05, "loss": 0.4473, "mean_token_accuracy": 0.8615485951304436, "num_tokens": 647297762.0, "step": 20281 }, { "entropy": 0.5157052148133516, "epoch": 1.8660559743762255, "grad_norm": 0.13987189531326294, "learning_rate": 3.780169902168246e-05, "loss": 0.5069, "mean_token_accuracy": 0.8437850251793861, "num_tokens": 647330137.0, "step": 20282 }, { "entropy": 0.6486897836439312, "epoch": 1.8661479807476669, "grad_norm": 0.15603405237197876, "learning_rate": 3.779863219554083e-05, "loss": 0.6356, "mean_token_accuracy": 0.8036926537752151, "num_tokens": 647362019.0, "step": 20283 }, { "entropy": 0.6083865016698837, "epoch": 1.866239987119108, "grad_norm": 0.15216578543186188, "learning_rate": 3.779556536939921e-05, "loss": 0.5956, "mean_token_accuracy": 0.8182044886052608, "num_tokens": 647394275.0, "step": 20284 }, { "entropy": 0.6304816771298647, "epoch": 1.8663319934905491, "grad_norm": 0.15865975618362427, "learning_rate": 3.779249854325758e-05, "loss": 0.6182, "mean_token_accuracy": 0.8047781363129616, "num_tokens": 647425928.0, "step": 20285 }, { "entropy": 0.6534892302006483, "epoch": 1.8664239998619905, "grad_norm": 0.1622002124786377, "learning_rate": 3.778943171711596e-05, "loss": 0.6414, "mean_token_accuracy": 0.8052781522274017, "num_tokens": 647457078.0, "step": 20286 }, { "entropy": 0.5652960762381554, "epoch": 1.8665160062334316, "grad_norm": 0.14523190259933472, "learning_rate": 3.7786364890974336e-05, "loss": 0.5463, "mean_token_accuracy": 0.8342987075448036, "num_tokens": 647489586.0, "step": 20287 }, { "entropy": 0.48390603717416525, "epoch": 1.866608012604873, "grad_norm": 0.14725853502750397, "learning_rate": 3.7783298064832704e-05, "loss": 0.4738, "mean_token_accuracy": 0.8521615080535412, "num_tokens": 647521305.0, "step": 20288 }, { "entropy": 0.5178457908332348, "epoch": 1.866700018976314, "grad_norm": 0.14097563922405243, "learning_rate": 3.7780231238691085e-05, "loss": 0.5066, "mean_token_accuracy": 0.840353824198246, "num_tokens": 647553218.0, "step": 20289 }, { "entropy": 0.5697726290673018, "epoch": 1.8667920253477552, "grad_norm": 0.14763273298740387, "learning_rate": 3.777716441254945e-05, "loss": 0.5599, "mean_token_accuracy": 0.8334154263138771, "num_tokens": 647585562.0, "step": 20290 }, { "entropy": 0.6296047223731875, "epoch": 1.8668840317191966, "grad_norm": 0.16171382367610931, "learning_rate": 3.777409758640783e-05, "loss": 0.6172, "mean_token_accuracy": 0.811497375369072, "num_tokens": 647617899.0, "step": 20291 }, { "entropy": 0.5194513760507107, "epoch": 1.8669760380906377, "grad_norm": 0.14728017151355743, "learning_rate": 3.77710307602662e-05, "loss": 0.5149, "mean_token_accuracy": 0.8395626470446587, "num_tokens": 647649164.0, "step": 20292 }, { "entropy": 0.5906245689839125, "epoch": 1.867068044462079, "grad_norm": 0.1484692245721817, "learning_rate": 3.776796393412458e-05, "loss": 0.5763, "mean_token_accuracy": 0.8249156326055527, "num_tokens": 647681097.0, "step": 20293 }, { "entropy": 0.544868178665638, "epoch": 1.8671600508335202, "grad_norm": 0.14869827032089233, "learning_rate": 3.776489710798295e-05, "loss": 0.54, "mean_token_accuracy": 0.8396576680243015, "num_tokens": 647713396.0, "step": 20294 }, { "entropy": 0.6378877852112055, "epoch": 1.8672520572049613, "grad_norm": 0.15964724123477936, "learning_rate": 3.7761830281841326e-05, "loss": 0.6332, "mean_token_accuracy": 0.8072122633457184, "num_tokens": 647745415.0, "step": 20295 }, { "entropy": 0.5943547878414392, "epoch": 1.8673440635764027, "grad_norm": 0.15255357325077057, "learning_rate": 3.7758763455699694e-05, "loss": 0.5944, "mean_token_accuracy": 0.8193650133907795, "num_tokens": 647778120.0, "step": 20296 }, { "entropy": 0.8063027765601873, "epoch": 1.8674360699478438, "grad_norm": 0.1700294315814972, "learning_rate": 3.7755696629558076e-05, "loss": 0.7876, "mean_token_accuracy": 0.767342459410429, "num_tokens": 647810888.0, "step": 20297 }, { "entropy": 0.5859038224443793, "epoch": 1.8675280763192852, "grad_norm": 0.14889730513095856, "learning_rate": 3.7752629803416444e-05, "loss": 0.5693, "mean_token_accuracy": 0.8259221538901329, "num_tokens": 647842649.0, "step": 20298 }, { "entropy": 0.6019263043999672, "epoch": 1.8676200826907263, "grad_norm": 0.15576234459877014, "learning_rate": 3.7749562977274825e-05, "loss": 0.579, "mean_token_accuracy": 0.8175527900457382, "num_tokens": 647873724.0, "step": 20299 }, { "entropy": 0.6271724421530962, "epoch": 1.8677120890621675, "grad_norm": 0.15647239983081818, "learning_rate": 3.774649615113319e-05, "loss": 0.6357, "mean_token_accuracy": 0.8054239973425865, "num_tokens": 647905969.0, "step": 20300 }, { "entropy": 0.6194916032254696, "epoch": 1.8678040954336088, "grad_norm": 0.15713845193386078, "learning_rate": 3.774342932499157e-05, "loss": 0.6109, "mean_token_accuracy": 0.8118647560477257, "num_tokens": 647936997.0, "step": 20301 }, { "entropy": 0.49057427421212196, "epoch": 1.86789610180505, "grad_norm": 0.1479576677083969, "learning_rate": 3.774036249884994e-05, "loss": 0.4831, "mean_token_accuracy": 0.8501548357307911, "num_tokens": 647969287.0, "step": 20302 }, { "entropy": 0.5500474269501865, "epoch": 1.8679881081764913, "grad_norm": 0.1512787640094757, "learning_rate": 3.773729567270832e-05, "loss": 0.543, "mean_token_accuracy": 0.8331368006765842, "num_tokens": 648001554.0, "step": 20303 }, { "entropy": 0.6174688674509525, "epoch": 1.8680801145479324, "grad_norm": 0.1548098623752594, "learning_rate": 3.773422884656669e-05, "loss": 0.609, "mean_token_accuracy": 0.8179096803069115, "num_tokens": 648033598.0, "step": 20304 }, { "entropy": 0.5514998212456703, "epoch": 1.8681721209193736, "grad_norm": 0.1515912115573883, "learning_rate": 3.7731162020425066e-05, "loss": 0.5442, "mean_token_accuracy": 0.83470843359828, "num_tokens": 648065855.0, "step": 20305 }, { "entropy": 0.6612456850707531, "epoch": 1.868264127290815, "grad_norm": 0.16457542777061462, "learning_rate": 3.7728095194283434e-05, "loss": 0.6607, "mean_token_accuracy": 0.7976459786295891, "num_tokens": 648098310.0, "step": 20306 }, { "entropy": 0.4917286478448659, "epoch": 1.868356133662256, "grad_norm": 0.1423846036195755, "learning_rate": 3.7725028368141815e-05, "loss": 0.4806, "mean_token_accuracy": 0.850574005395174, "num_tokens": 648131078.0, "step": 20307 }, { "entropy": 0.6292599532753229, "epoch": 1.8684481400336974, "grad_norm": 0.1545303612947464, "learning_rate": 3.772196154200018e-05, "loss": 0.6254, "mean_token_accuracy": 0.8109968081116676, "num_tokens": 648162930.0, "step": 20308 }, { "entropy": 0.6473775543272495, "epoch": 1.8685401464051385, "grad_norm": 0.15519940853118896, "learning_rate": 3.771889471585856e-05, "loss": 0.635, "mean_token_accuracy": 0.8056828826665878, "num_tokens": 648194936.0, "step": 20309 }, { "entropy": 0.6426515765488148, "epoch": 1.8686321527765797, "grad_norm": 0.15276561677455902, "learning_rate": 3.771582788971693e-05, "loss": 0.6336, "mean_token_accuracy": 0.8048768304288387, "num_tokens": 648226870.0, "step": 20310 }, { "entropy": 0.6922327326610684, "epoch": 1.868724159148021, "grad_norm": 0.1576477289199829, "learning_rate": 3.771276106357531e-05, "loss": 0.6797, "mean_token_accuracy": 0.7935947477817535, "num_tokens": 648258803.0, "step": 20311 }, { "entropy": 0.6435654642991722, "epoch": 1.8688161655194622, "grad_norm": 0.15383493900299072, "learning_rate": 3.770969423743368e-05, "loss": 0.6246, "mean_token_accuracy": 0.8079394772648811, "num_tokens": 648291268.0, "step": 20312 }, { "entropy": 0.6236674562096596, "epoch": 1.8689081718909035, "grad_norm": 0.16026154160499573, "learning_rate": 3.7706627411292057e-05, "loss": 0.6149, "mean_token_accuracy": 0.812560647726059, "num_tokens": 648322781.0, "step": 20313 }, { "entropy": 0.7447362579405308, "epoch": 1.8690001782623447, "grad_norm": 0.1682957410812378, "learning_rate": 3.7703560585150424e-05, "loss": 0.7258, "mean_token_accuracy": 0.781266164034605, "num_tokens": 648353822.0, "step": 20314 }, { "entropy": 0.5959836775436997, "epoch": 1.8690921846337858, "grad_norm": 0.16029833257198334, "learning_rate": 3.7700493759008806e-05, "loss": 0.5916, "mean_token_accuracy": 0.8215759135782719, "num_tokens": 648385210.0, "step": 20315 }, { "entropy": 0.7347798943519592, "epoch": 1.8691841910052271, "grad_norm": 0.16252703964710236, "learning_rate": 3.769742693286718e-05, "loss": 0.7278, "mean_token_accuracy": 0.7741533890366554, "num_tokens": 648417626.0, "step": 20316 }, { "entropy": 0.6349491216242313, "epoch": 1.8692761973766683, "grad_norm": 0.16186261177062988, "learning_rate": 3.769436010672555e-05, "loss": 0.6296, "mean_token_accuracy": 0.8074848614633083, "num_tokens": 648448871.0, "step": 20317 }, { "entropy": 0.6241475897841156, "epoch": 1.8693682037481096, "grad_norm": 0.15938769280910492, "learning_rate": 3.769129328058393e-05, "loss": 0.6151, "mean_token_accuracy": 0.8106968067586422, "num_tokens": 648480603.0, "step": 20318 }, { "entropy": 0.51923543587327, "epoch": 1.8694602101195508, "grad_norm": 0.1506064087152481, "learning_rate": 3.76882264544423e-05, "loss": 0.5042, "mean_token_accuracy": 0.8442118428647518, "num_tokens": 648512631.0, "step": 20319 }, { "entropy": 0.6255223206244409, "epoch": 1.869552216490992, "grad_norm": 0.15500755608081818, "learning_rate": 3.768515962830068e-05, "loss": 0.6162, "mean_token_accuracy": 0.8114504665136337, "num_tokens": 648544813.0, "step": 20320 }, { "entropy": 0.5270634947810322, "epoch": 1.8696442228624333, "grad_norm": 0.14166511595249176, "learning_rate": 3.768209280215905e-05, "loss": 0.519, "mean_token_accuracy": 0.8398987129330635, "num_tokens": 648576476.0, "step": 20321 }, { "entropy": 0.6625029090791941, "epoch": 1.8697362292338744, "grad_norm": 0.15811687707901, "learning_rate": 3.767902597601742e-05, "loss": 0.6623, "mean_token_accuracy": 0.7995595298707485, "num_tokens": 648607795.0, "step": 20322 }, { "entropy": 0.5139205874875188, "epoch": 1.8698282356053157, "grad_norm": 0.14801622927188873, "learning_rate": 3.7675959149875796e-05, "loss": 0.4953, "mean_token_accuracy": 0.8482631482183933, "num_tokens": 648639587.0, "step": 20323 }, { "entropy": 0.6283845957368612, "epoch": 1.8699202419767569, "grad_norm": 0.15354406833648682, "learning_rate": 3.767289232373417e-05, "loss": 0.6059, "mean_token_accuracy": 0.8118734434247017, "num_tokens": 648670035.0, "step": 20324 }, { "entropy": 0.615868154913187, "epoch": 1.870012248348198, "grad_norm": 0.16277965903282166, "learning_rate": 3.7669825497592545e-05, "loss": 0.6037, "mean_token_accuracy": 0.8147959820926189, "num_tokens": 648701006.0, "step": 20325 }, { "entropy": 0.47828571451827884, "epoch": 1.8701042547196394, "grad_norm": 0.13970893621444702, "learning_rate": 3.766675867145092e-05, "loss": 0.4608, "mean_token_accuracy": 0.8547809682786465, "num_tokens": 648732988.0, "step": 20326 }, { "entropy": 0.6143448613584042, "epoch": 1.8701962610910805, "grad_norm": 0.1555081605911255, "learning_rate": 3.766369184530929e-05, "loss": 0.6082, "mean_token_accuracy": 0.8132609874010086, "num_tokens": 648764939.0, "step": 20327 }, { "entropy": 0.6527563920244575, "epoch": 1.8702882674625219, "grad_norm": 0.1594577580690384, "learning_rate": 3.766062501916767e-05, "loss": 0.6525, "mean_token_accuracy": 0.800682820379734, "num_tokens": 648796374.0, "step": 20328 }, { "entropy": 0.5852813124656677, "epoch": 1.870380273833963, "grad_norm": 0.1497090756893158, "learning_rate": 3.765755819302604e-05, "loss": 0.5832, "mean_token_accuracy": 0.8181551210582256, "num_tokens": 648827939.0, "step": 20329 }, { "entropy": 0.3839591699652374, "epoch": 1.8704722802054041, "grad_norm": 0.13552606105804443, "learning_rate": 3.765449136688441e-05, "loss": 0.3728, "mean_token_accuracy": 0.8816293179988861, "num_tokens": 648859262.0, "step": 20330 }, { "entropy": 0.6403313409537077, "epoch": 1.8705642865768455, "grad_norm": 0.1552695482969284, "learning_rate": 3.7651424540742787e-05, "loss": 0.6213, "mean_token_accuracy": 0.8114034160971642, "num_tokens": 648891507.0, "step": 20331 }, { "entropy": 0.6599928038194776, "epoch": 1.8706562929482866, "grad_norm": 0.1617809236049652, "learning_rate": 3.764835771460116e-05, "loss": 0.6517, "mean_token_accuracy": 0.8026236966252327, "num_tokens": 648923686.0, "step": 20332 }, { "entropy": 0.630007435567677, "epoch": 1.870748299319728, "grad_norm": 0.16119159758090973, "learning_rate": 3.7645290888459536e-05, "loss": 0.6303, "mean_token_accuracy": 0.8049723766744137, "num_tokens": 648955509.0, "step": 20333 }, { "entropy": 0.7270469088107347, "epoch": 1.870840305691169, "grad_norm": 0.16466432809829712, "learning_rate": 3.764222406231791e-05, "loss": 0.7182, "mean_token_accuracy": 0.7808149643242359, "num_tokens": 648986758.0, "step": 20334 }, { "entropy": 0.5166259557008743, "epoch": 1.8709323120626102, "grad_norm": 0.15282359719276428, "learning_rate": 3.763915723617628e-05, "loss": 0.5162, "mean_token_accuracy": 0.8401177451014519, "num_tokens": 649018982.0, "step": 20335 }, { "entropy": 0.70300183724612, "epoch": 1.8710243184340516, "grad_norm": 0.16350367665290833, "learning_rate": 3.763609041003466e-05, "loss": 0.6944, "mean_token_accuracy": 0.7874953337013721, "num_tokens": 649050542.0, "step": 20336 }, { "entropy": 0.5552638713270426, "epoch": 1.8711163248054927, "grad_norm": 0.14821107685565948, "learning_rate": 3.763302358389303e-05, "loss": 0.5409, "mean_token_accuracy": 0.8298650421202183, "num_tokens": 649082199.0, "step": 20337 }, { "entropy": 0.5577905466780066, "epoch": 1.871208331176934, "grad_norm": 0.1491255909204483, "learning_rate": 3.76299567577514e-05, "loss": 0.5594, "mean_token_accuracy": 0.8276870138943195, "num_tokens": 649114804.0, "step": 20338 }, { "entropy": 0.5374587094411254, "epoch": 1.8713003375483752, "grad_norm": 0.14685344696044922, "learning_rate": 3.762688993160978e-05, "loss": 0.526, "mean_token_accuracy": 0.837272122502327, "num_tokens": 649147313.0, "step": 20339 }, { "entropy": 0.6607564762234688, "epoch": 1.8713923439198163, "grad_norm": 0.16036559641361237, "learning_rate": 3.762382310546815e-05, "loss": 0.6573, "mean_token_accuracy": 0.802940770983696, "num_tokens": 649179251.0, "step": 20340 }, { "entropy": 0.6638198215514421, "epoch": 1.8714843502912577, "grad_norm": 0.1589352935552597, "learning_rate": 3.7620756279326526e-05, "loss": 0.6481, "mean_token_accuracy": 0.8031161427497864, "num_tokens": 649210562.0, "step": 20341 }, { "entropy": 0.657429775223136, "epoch": 1.8715763566626988, "grad_norm": 0.15710869431495667, "learning_rate": 3.76176894531849e-05, "loss": 0.6583, "mean_token_accuracy": 0.7950557172298431, "num_tokens": 649242884.0, "step": 20342 }, { "entropy": 0.6301285363733768, "epoch": 1.8716683630341402, "grad_norm": 0.1554500013589859, "learning_rate": 3.7614622627043276e-05, "loss": 0.6083, "mean_token_accuracy": 0.8102195747196674, "num_tokens": 649274466.0, "step": 20343 }, { "entropy": 0.5438408078625798, "epoch": 1.8717603694055813, "grad_norm": 0.1494918018579483, "learning_rate": 3.761155580090165e-05, "loss": 0.5341, "mean_token_accuracy": 0.8330769017338753, "num_tokens": 649306167.0, "step": 20344 }, { "entropy": 0.6347728529945016, "epoch": 1.8718523757770225, "grad_norm": 0.15302245318889618, "learning_rate": 3.760848897476002e-05, "loss": 0.6331, "mean_token_accuracy": 0.8049486130475998, "num_tokens": 649338141.0, "step": 20345 }, { "entropy": 0.5900555052794516, "epoch": 1.8719443821484638, "grad_norm": 0.14715631306171417, "learning_rate": 3.76054221486184e-05, "loss": 0.5699, "mean_token_accuracy": 0.8241811916232109, "num_tokens": 649369802.0, "step": 20346 }, { "entropy": 0.6400969121605158, "epoch": 1.872036388519905, "grad_norm": 0.15473461151123047, "learning_rate": 3.7602355322476774e-05, "loss": 0.6374, "mean_token_accuracy": 0.8055545836687088, "num_tokens": 649401912.0, "step": 20347 }, { "entropy": 0.5167219266295433, "epoch": 1.8721283948913463, "grad_norm": 0.1473911553621292, "learning_rate": 3.759928849633514e-05, "loss": 0.4992, "mean_token_accuracy": 0.8434219509363174, "num_tokens": 649433058.0, "step": 20348 }, { "entropy": 0.545892670750618, "epoch": 1.8722204012627874, "grad_norm": 0.15493984520435333, "learning_rate": 3.7596221670193523e-05, "loss": 0.5409, "mean_token_accuracy": 0.8340590856969357, "num_tokens": 649465419.0, "step": 20349 }, { "entropy": 0.6906795804388821, "epoch": 1.8723124076342286, "grad_norm": 0.15621165931224823, "learning_rate": 3.759315484405189e-05, "loss": 0.6881, "mean_token_accuracy": 0.7885004878044128, "num_tokens": 649497872.0, "step": 20350 }, { "entropy": 0.471608467400074, "epoch": 1.87240441400567, "grad_norm": 0.15323898196220398, "learning_rate": 3.7590088017910266e-05, "loss": 0.4553, "mean_token_accuracy": 0.8586773574352264, "num_tokens": 649529890.0, "step": 20351 }, { "entropy": 0.5810965364798903, "epoch": 1.8724964203771113, "grad_norm": 0.1542435735464096, "learning_rate": 3.758702119176864e-05, "loss": 0.5715, "mean_token_accuracy": 0.8254704959690571, "num_tokens": 649561735.0, "step": 20352 }, { "entropy": 0.6388971810229123, "epoch": 1.8725884267485524, "grad_norm": 0.16505131125450134, "learning_rate": 3.7583954365627015e-05, "loss": 0.6346, "mean_token_accuracy": 0.8085073418915272, "num_tokens": 649593924.0, "step": 20353 }, { "entropy": 0.6468667723238468, "epoch": 1.8726804331199935, "grad_norm": 0.15681084990501404, "learning_rate": 3.758088753948539e-05, "loss": 0.6277, "mean_token_accuracy": 0.8079922646284103, "num_tokens": 649625883.0, "step": 20354 }, { "entropy": 0.4788303133100271, "epoch": 1.8727724394914347, "grad_norm": 0.14052191376686096, "learning_rate": 3.7577820713343765e-05, "loss": 0.4549, "mean_token_accuracy": 0.8605225272476673, "num_tokens": 649657577.0, "step": 20355 }, { "entropy": 0.6544817015528679, "epoch": 1.872864445862876, "grad_norm": 0.16408218443393707, "learning_rate": 3.757475388720213e-05, "loss": 0.6311, "mean_token_accuracy": 0.8075063116848469, "num_tokens": 649689807.0, "step": 20356 }, { "entropy": 0.5782691109925508, "epoch": 1.8729564522343174, "grad_norm": 0.1551266312599182, "learning_rate": 3.7571687061060514e-05, "loss": 0.5662, "mean_token_accuracy": 0.829191830009222, "num_tokens": 649721563.0, "step": 20357 }, { "entropy": 0.6030059594195336, "epoch": 1.8730484586057585, "grad_norm": 0.15814675390720367, "learning_rate": 3.756862023491888e-05, "loss": 0.6023, "mean_token_accuracy": 0.8141042292118073, "num_tokens": 649753336.0, "step": 20358 }, { "entropy": 0.5903878305107355, "epoch": 1.8731404649771997, "grad_norm": 0.15391215682029724, "learning_rate": 3.756555340877726e-05, "loss": 0.5717, "mean_token_accuracy": 0.82069506123662, "num_tokens": 649784667.0, "step": 20359 }, { "entropy": 0.6197503197472543, "epoch": 1.8732324713486408, "grad_norm": 0.15232840180397034, "learning_rate": 3.756248658263563e-05, "loss": 0.5994, "mean_token_accuracy": 0.8158120810985565, "num_tokens": 649816699.0, "step": 20360 }, { "entropy": 0.5796319227665663, "epoch": 1.8733244777200821, "grad_norm": 0.1467931568622589, "learning_rate": 3.7559419756494006e-05, "loss": 0.5643, "mean_token_accuracy": 0.8277257457375526, "num_tokens": 649848749.0, "step": 20361 }, { "entropy": 0.6909361183643341, "epoch": 1.8734164840915235, "grad_norm": 0.1629001796245575, "learning_rate": 3.755635293035238e-05, "loss": 0.6866, "mean_token_accuracy": 0.7891135178506374, "num_tokens": 649880617.0, "step": 20362 }, { "entropy": 0.5950709655880928, "epoch": 1.8735084904629646, "grad_norm": 0.1557748168706894, "learning_rate": 3.7553286104210755e-05, "loss": 0.5881, "mean_token_accuracy": 0.819590050727129, "num_tokens": 649913236.0, "step": 20363 }, { "entropy": 0.7166619654744864, "epoch": 1.8736004968344058, "grad_norm": 0.162390798330307, "learning_rate": 3.755021927806913e-05, "loss": 0.7132, "mean_token_accuracy": 0.7831631153821945, "num_tokens": 649945387.0, "step": 20364 }, { "entropy": 0.5488041620701551, "epoch": 1.873692503205847, "grad_norm": 0.15180733799934387, "learning_rate": 3.7547152451927504e-05, "loss": 0.5441, "mean_token_accuracy": 0.8291279897093773, "num_tokens": 649977397.0, "step": 20365 }, { "entropy": 0.5921749006956816, "epoch": 1.8737845095772883, "grad_norm": 0.15218143165111542, "learning_rate": 3.754408562578587e-05, "loss": 0.5834, "mean_token_accuracy": 0.8204645328223705, "num_tokens": 650009505.0, "step": 20366 }, { "entropy": 0.6577141284942627, "epoch": 1.8738765159487296, "grad_norm": 0.1677580326795578, "learning_rate": 3.7541018799644254e-05, "loss": 0.6558, "mean_token_accuracy": 0.7967012077569962, "num_tokens": 650040444.0, "step": 20367 }, { "entropy": 0.5725044412538409, "epoch": 1.8739685223201707, "grad_norm": 0.15016211569309235, "learning_rate": 3.753795197350262e-05, "loss": 0.5754, "mean_token_accuracy": 0.8207443058490753, "num_tokens": 650071507.0, "step": 20368 }, { "entropy": 0.6766606047749519, "epoch": 1.8740605286916119, "grad_norm": 0.15891297161579132, "learning_rate": 3.7534885147360996e-05, "loss": 0.6691, "mean_token_accuracy": 0.7941320948302746, "num_tokens": 650103990.0, "step": 20369 }, { "entropy": 0.5884555950760841, "epoch": 1.874152535063053, "grad_norm": 0.16276805102825165, "learning_rate": 3.753181832121937e-05, "loss": 0.5826, "mean_token_accuracy": 0.8219552785158157, "num_tokens": 650135243.0, "step": 20370 }, { "entropy": 0.62554153916426, "epoch": 1.8742445414344944, "grad_norm": 0.15456685423851013, "learning_rate": 3.7528751495077745e-05, "loss": 0.6162, "mean_token_accuracy": 0.8071788810193539, "num_tokens": 650167875.0, "step": 20371 }, { "entropy": 0.597050353884697, "epoch": 1.8743365478059357, "grad_norm": 0.15204130113124847, "learning_rate": 3.752568466893612e-05, "loss": 0.5761, "mean_token_accuracy": 0.8225988671183586, "num_tokens": 650200112.0, "step": 20372 }, { "entropy": 0.561307605355978, "epoch": 1.8744285541773769, "grad_norm": 0.15098202228546143, "learning_rate": 3.7522617842794495e-05, "loss": 0.5468, "mean_token_accuracy": 0.8303666263818741, "num_tokens": 650232032.0, "step": 20373 }, { "entropy": 0.6115573327988386, "epoch": 1.874520560548818, "grad_norm": 0.14729700982570648, "learning_rate": 3.751955101665286e-05, "loss": 0.592, "mean_token_accuracy": 0.8169667050242424, "num_tokens": 650264496.0, "step": 20374 }, { "entropy": 0.6824539639055729, "epoch": 1.8746125669202591, "grad_norm": 0.15506114065647125, "learning_rate": 3.7516484190511244e-05, "loss": 0.6759, "mean_token_accuracy": 0.7933532148599625, "num_tokens": 650297063.0, "step": 20375 }, { "entropy": 0.5611634589731693, "epoch": 1.8747045732917005, "grad_norm": 0.1548604965209961, "learning_rate": 3.751341736436961e-05, "loss": 0.5547, "mean_token_accuracy": 0.8299667574465275, "num_tokens": 650329476.0, "step": 20376 }, { "entropy": 0.6652100021019578, "epoch": 1.8747965796631418, "grad_norm": 0.15925933420658112, "learning_rate": 3.7510350538227987e-05, "loss": 0.6489, "mean_token_accuracy": 0.7963706292212009, "num_tokens": 650361216.0, "step": 20377 }, { "entropy": 0.642666669562459, "epoch": 1.874888586034583, "grad_norm": 0.16292038559913635, "learning_rate": 3.750728371208637e-05, "loss": 0.6368, "mean_token_accuracy": 0.8060494959354401, "num_tokens": 650393104.0, "step": 20378 }, { "entropy": 0.5764529104344547, "epoch": 1.874980592406024, "grad_norm": 0.15200193226337433, "learning_rate": 3.7504216885944736e-05, "loss": 0.5782, "mean_token_accuracy": 0.8221861086785793, "num_tokens": 650424632.0, "step": 20379 }, { "entropy": 0.6831139903515577, "epoch": 1.8750725987774652, "grad_norm": 0.16547225415706635, "learning_rate": 3.750115005980312e-05, "loss": 0.6571, "mean_token_accuracy": 0.7964161448180676, "num_tokens": 650456028.0, "step": 20380 }, { "entropy": 0.6274551497772336, "epoch": 1.8751646051489066, "grad_norm": 0.15084737539291382, "learning_rate": 3.7498083233661485e-05, "loss": 0.6142, "mean_token_accuracy": 0.8088030777871609, "num_tokens": 650487940.0, "step": 20381 }, { "entropy": 0.6494339369237423, "epoch": 1.875256611520348, "grad_norm": 0.15484492480754852, "learning_rate": 3.749501640751986e-05, "loss": 0.6339, "mean_token_accuracy": 0.8068530932068825, "num_tokens": 650520137.0, "step": 20382 }, { "entropy": 0.4879958052188158, "epoch": 1.875348617891789, "grad_norm": 0.14090724289417267, "learning_rate": 3.7491949581378234e-05, "loss": 0.473, "mean_token_accuracy": 0.8547460287809372, "num_tokens": 650552481.0, "step": 20383 }, { "entropy": 0.591544290073216, "epoch": 1.8754406242632302, "grad_norm": 0.1524932086467743, "learning_rate": 3.748888275523661e-05, "loss": 0.5887, "mean_token_accuracy": 0.8186671808362007, "num_tokens": 650584683.0, "step": 20384 }, { "entropy": 0.5113988583907485, "epoch": 1.8755326306346713, "grad_norm": 0.1467595249414444, "learning_rate": 3.7485815929094984e-05, "loss": 0.4989, "mean_token_accuracy": 0.8442582152783871, "num_tokens": 650617167.0, "step": 20385 }, { "entropy": 0.6536541022360325, "epoch": 1.8756246370061127, "grad_norm": 0.15598855912685394, "learning_rate": 3.748274910295336e-05, "loss": 0.631, "mean_token_accuracy": 0.8079562224447727, "num_tokens": 650649376.0, "step": 20386 }, { "entropy": 0.5755582619458437, "epoch": 1.875716643377554, "grad_norm": 0.1522272378206253, "learning_rate": 3.7479682276811726e-05, "loss": 0.5699, "mean_token_accuracy": 0.823286022990942, "num_tokens": 650681179.0, "step": 20387 }, { "entropy": 0.5585754858329892, "epoch": 1.8758086497489952, "grad_norm": 0.15498991310596466, "learning_rate": 3.747661545067011e-05, "loss": 0.5411, "mean_token_accuracy": 0.8316647596657276, "num_tokens": 650713082.0, "step": 20388 }, { "entropy": 0.6285503040999174, "epoch": 1.8759006561204363, "grad_norm": 0.1629282832145691, "learning_rate": 3.7473548624528476e-05, "loss": 0.6152, "mean_token_accuracy": 0.8050252310931683, "num_tokens": 650744323.0, "step": 20389 }, { "entropy": 0.5595280658453703, "epoch": 1.8759926624918775, "grad_norm": 0.14696860313415527, "learning_rate": 3.747048179838685e-05, "loss": 0.5444, "mean_token_accuracy": 0.830630861222744, "num_tokens": 650776201.0, "step": 20390 }, { "entropy": 0.6514391675591469, "epoch": 1.8760846688633188, "grad_norm": 0.16085588932037354, "learning_rate": 3.7467414972245225e-05, "loss": 0.6401, "mean_token_accuracy": 0.8027487881481647, "num_tokens": 650807607.0, "step": 20391 }, { "entropy": 0.6412530038505793, "epoch": 1.8761766752347602, "grad_norm": 0.15129293501377106, "learning_rate": 3.74643481461036e-05, "loss": 0.6364, "mean_token_accuracy": 0.8041367642581463, "num_tokens": 650840246.0, "step": 20392 }, { "entropy": 0.6351837832480669, "epoch": 1.8762686816062013, "grad_norm": 0.1510544866323471, "learning_rate": 3.7461281319961974e-05, "loss": 0.6253, "mean_token_accuracy": 0.8067305870354176, "num_tokens": 650872788.0, "step": 20393 }, { "entropy": 0.5286234617233276, "epoch": 1.8763606879776424, "grad_norm": 0.14436407387256622, "learning_rate": 3.745821449382035e-05, "loss": 0.5199, "mean_token_accuracy": 0.8448861911892891, "num_tokens": 650904562.0, "step": 20394 }, { "entropy": 0.562138743698597, "epoch": 1.8764526943490836, "grad_norm": 0.1500539481639862, "learning_rate": 3.745514766767872e-05, "loss": 0.5499, "mean_token_accuracy": 0.8284884132444859, "num_tokens": 650936378.0, "step": 20395 }, { "entropy": 0.5583719033747911, "epoch": 1.876544700720525, "grad_norm": 0.14698946475982666, "learning_rate": 3.74520808415371e-05, "loss": 0.5493, "mean_token_accuracy": 0.8266566656529903, "num_tokens": 650968228.0, "step": 20396 }, { "entropy": 0.5782865267246962, "epoch": 1.8766367070919663, "grad_norm": 0.14777891337871552, "learning_rate": 3.7449014015395466e-05, "loss": 0.5637, "mean_token_accuracy": 0.8264338932931423, "num_tokens": 651000339.0, "step": 20397 }, { "entropy": 0.7111164554953575, "epoch": 1.8767287134634074, "grad_norm": 0.16664792597293854, "learning_rate": 3.744594718925384e-05, "loss": 0.7108, "mean_token_accuracy": 0.7844281792640686, "num_tokens": 651032160.0, "step": 20398 }, { "entropy": 0.5988824097439647, "epoch": 1.8768207198348485, "grad_norm": 0.15780000388622284, "learning_rate": 3.7442880363112215e-05, "loss": 0.5794, "mean_token_accuracy": 0.8205706290900707, "num_tokens": 651063829.0, "step": 20399 }, { "entropy": 0.5801811460405588, "epoch": 1.8769127262062897, "grad_norm": 0.1492239236831665, "learning_rate": 3.743981353697059e-05, "loss": 0.5783, "mean_token_accuracy": 0.8240360952913761, "num_tokens": 651096063.0, "step": 20400 }, { "entropy": 0.5475428926292807, "epoch": 1.877004732577731, "grad_norm": 0.14548006653785706, "learning_rate": 3.7436746710828965e-05, "loss": 0.5411, "mean_token_accuracy": 0.8321353681385517, "num_tokens": 651128336.0, "step": 20401 }, { "entropy": 0.6919078063219786, "epoch": 1.8770967389491724, "grad_norm": 0.16013756394386292, "learning_rate": 3.743367988468734e-05, "loss": 0.6925, "mean_token_accuracy": 0.7895747348666191, "num_tokens": 651160832.0, "step": 20402 }, { "entropy": 0.6008948013186455, "epoch": 1.8771887453206135, "grad_norm": 0.15780571103096008, "learning_rate": 3.7430613058545714e-05, "loss": 0.5977, "mean_token_accuracy": 0.8202020116150379, "num_tokens": 651192633.0, "step": 20403 }, { "entropy": 0.6031614579260349, "epoch": 1.8772807516920547, "grad_norm": 0.15230219066143036, "learning_rate": 3.742754623240409e-05, "loss": 0.6012, "mean_token_accuracy": 0.8166682049632072, "num_tokens": 651224097.0, "step": 20404 }, { "entropy": 0.6345590362325311, "epoch": 1.8773727580634958, "grad_norm": 0.15736564993858337, "learning_rate": 3.7424479406262456e-05, "loss": 0.6295, "mean_token_accuracy": 0.8074197508394718, "num_tokens": 651256002.0, "step": 20405 }, { "entropy": 0.5459285862743855, "epoch": 1.8774647644349372, "grad_norm": 0.1513427346944809, "learning_rate": 3.742141258012084e-05, "loss": 0.5384, "mean_token_accuracy": 0.8344030492007732, "num_tokens": 651288158.0, "step": 20406 }, { "entropy": 0.63471017498523, "epoch": 1.8775567708063785, "grad_norm": 0.15537866950035095, "learning_rate": 3.7418345753979206e-05, "loss": 0.631, "mean_token_accuracy": 0.8109998367726803, "num_tokens": 651319995.0, "step": 20407 }, { "entropy": 0.7146575069054961, "epoch": 1.8776487771778196, "grad_norm": 0.1693895310163498, "learning_rate": 3.741527892783758e-05, "loss": 0.7008, "mean_token_accuracy": 0.7854869365692139, "num_tokens": 651351931.0, "step": 20408 }, { "entropy": 0.4759451234713197, "epoch": 1.8777407835492608, "grad_norm": 0.14191670715808868, "learning_rate": 3.741221210169596e-05, "loss": 0.469, "mean_token_accuracy": 0.8577514812350273, "num_tokens": 651384069.0, "step": 20409 }, { "entropy": 0.6790676107630134, "epoch": 1.877832789920702, "grad_norm": 0.15672476589679718, "learning_rate": 3.740914527555433e-05, "loss": 0.6723, "mean_token_accuracy": 0.797436784952879, "num_tokens": 651415372.0, "step": 20410 }, { "entropy": 0.6435285042971373, "epoch": 1.8779247962921433, "grad_norm": 0.15583251416683197, "learning_rate": 3.7406078449412704e-05, "loss": 0.6255, "mean_token_accuracy": 0.806840181350708, "num_tokens": 651447201.0, "step": 20411 }, { "entropy": 0.5403334591537714, "epoch": 1.8780168026635846, "grad_norm": 0.14788533747196198, "learning_rate": 3.740301162327108e-05, "loss": 0.5214, "mean_token_accuracy": 0.8379901573061943, "num_tokens": 651478769.0, "step": 20412 }, { "entropy": 0.7045591324567795, "epoch": 1.8781088090350258, "grad_norm": 0.1656073033809662, "learning_rate": 3.7399944797129453e-05, "loss": 0.697, "mean_token_accuracy": 0.7885672338306904, "num_tokens": 651510532.0, "step": 20413 }, { "entropy": 0.6139884199947119, "epoch": 1.8782008154064669, "grad_norm": 0.15217046439647675, "learning_rate": 3.739687797098783e-05, "loss": 0.6099, "mean_token_accuracy": 0.810219332575798, "num_tokens": 651542684.0, "step": 20414 }, { "entropy": 0.6836214736104012, "epoch": 1.878292821777908, "grad_norm": 0.16192656755447388, "learning_rate": 3.73938111448462e-05, "loss": 0.6661, "mean_token_accuracy": 0.7932244949042797, "num_tokens": 651574578.0, "step": 20415 }, { "entropy": 0.5654850928112864, "epoch": 1.8783848281493494, "grad_norm": 0.14486312866210938, "learning_rate": 3.739074431870457e-05, "loss": 0.5456, "mean_token_accuracy": 0.8332360908389091, "num_tokens": 651606672.0, "step": 20416 }, { "entropy": 0.648032745346427, "epoch": 1.8784768345207907, "grad_norm": 0.1489066630601883, "learning_rate": 3.738767749256295e-05, "loss": 0.6229, "mean_token_accuracy": 0.806297592818737, "num_tokens": 651638701.0, "step": 20417 }, { "entropy": 0.7229907922446728, "epoch": 1.8785688408922319, "grad_norm": 0.15668648481369019, "learning_rate": 3.738461066642132e-05, "loss": 0.6909, "mean_token_accuracy": 0.7918341495096684, "num_tokens": 651670265.0, "step": 20418 }, { "entropy": 0.6361892875283957, "epoch": 1.878660847263673, "grad_norm": 0.1473292112350464, "learning_rate": 3.73815438402797e-05, "loss": 0.6155, "mean_token_accuracy": 0.8085280582308769, "num_tokens": 651702425.0, "step": 20419 }, { "entropy": 0.6766858492046595, "epoch": 1.8787528536351141, "grad_norm": 0.16658459603786469, "learning_rate": 3.737847701413807e-05, "loss": 0.6568, "mean_token_accuracy": 0.7990319319069386, "num_tokens": 651732793.0, "step": 20420 }, { "entropy": 0.6211369968950748, "epoch": 1.8788448600065555, "grad_norm": 0.1503210812807083, "learning_rate": 3.7375410187996444e-05, "loss": 0.6079, "mean_token_accuracy": 0.8132143244147301, "num_tokens": 651765021.0, "step": 20421 }, { "entropy": 0.5417829172220081, "epoch": 1.8789368663779968, "grad_norm": 0.1473347693681717, "learning_rate": 3.737234336185482e-05, "loss": 0.5328, "mean_token_accuracy": 0.8356819674372673, "num_tokens": 651796289.0, "step": 20422 }, { "entropy": 0.398537565022707, "epoch": 1.879028872749438, "grad_norm": 0.129128560423851, "learning_rate": 3.736927653571319e-05, "loss": 0.384, "mean_token_accuracy": 0.8776400871574879, "num_tokens": 651827966.0, "step": 20423 }, { "entropy": 0.5876167807728052, "epoch": 1.879120879120879, "grad_norm": 0.152541846036911, "learning_rate": 3.736620970957157e-05, "loss": 0.5949, "mean_token_accuracy": 0.8161150887608528, "num_tokens": 651860353.0, "step": 20424 }, { "entropy": 0.6474423818290234, "epoch": 1.8792128854923202, "grad_norm": 0.16082623600959778, "learning_rate": 3.736314288342994e-05, "loss": 0.6439, "mean_token_accuracy": 0.7971453107893467, "num_tokens": 651891422.0, "step": 20425 }, { "entropy": 0.5700470646843314, "epoch": 1.8793048918637616, "grad_norm": 0.15131287276744843, "learning_rate": 3.736007605728831e-05, "loss": 0.5584, "mean_token_accuracy": 0.8247003108263016, "num_tokens": 651923091.0, "step": 20426 }, { "entropy": 0.550682857632637, "epoch": 1.879396898235203, "grad_norm": 0.152308851480484, "learning_rate": 3.735700923114669e-05, "loss": 0.5587, "mean_token_accuracy": 0.8268433809280396, "num_tokens": 651955158.0, "step": 20427 }, { "entropy": 0.6012499807402492, "epoch": 1.879488904606644, "grad_norm": 0.16148211061954498, "learning_rate": 3.735394240500506e-05, "loss": 0.6016, "mean_token_accuracy": 0.8135002180933952, "num_tokens": 651986870.0, "step": 20428 }, { "entropy": 0.504382009152323, "epoch": 1.8795809109780852, "grad_norm": 0.1507500410079956, "learning_rate": 3.7350875578863434e-05, "loss": 0.5112, "mean_token_accuracy": 0.8444369807839394, "num_tokens": 652019638.0, "step": 20429 }, { "entropy": 0.5910447612404823, "epoch": 1.8796729173495264, "grad_norm": 0.15260113775730133, "learning_rate": 3.734780875272181e-05, "loss": 0.5818, "mean_token_accuracy": 0.8205129392445087, "num_tokens": 652051588.0, "step": 20430 }, { "entropy": 0.6465833324473351, "epoch": 1.8797649237209677, "grad_norm": 0.15735460817813873, "learning_rate": 3.7344741926580184e-05, "loss": 0.6383, "mean_token_accuracy": 0.8053355701267719, "num_tokens": 652083326.0, "step": 20431 }, { "entropy": 0.6073672166094184, "epoch": 1.879856930092409, "grad_norm": 0.1531253457069397, "learning_rate": 3.734167510043856e-05, "loss": 0.5983, "mean_token_accuracy": 0.8157905898988247, "num_tokens": 652115423.0, "step": 20432 }, { "entropy": 0.6540533974766731, "epoch": 1.8799489364638502, "grad_norm": 0.15718448162078857, "learning_rate": 3.733860827429693e-05, "loss": 0.6441, "mean_token_accuracy": 0.8025729432702065, "num_tokens": 652147402.0, "step": 20433 }, { "entropy": 0.620308228302747, "epoch": 1.8800409428352913, "grad_norm": 0.1538448929786682, "learning_rate": 3.73355414481553e-05, "loss": 0.6149, "mean_token_accuracy": 0.8092070892453194, "num_tokens": 652179340.0, "step": 20434 }, { "entropy": 0.6764511931687593, "epoch": 1.8801329492067325, "grad_norm": 0.16101180016994476, "learning_rate": 3.733247462201368e-05, "loss": 0.6635, "mean_token_accuracy": 0.7965671829879284, "num_tokens": 652210737.0, "step": 20435 }, { "entropy": 0.5727704521268606, "epoch": 1.8802249555781738, "grad_norm": 0.14690545201301575, "learning_rate": 3.732940779587205e-05, "loss": 0.564, "mean_token_accuracy": 0.826698325574398, "num_tokens": 652243158.0, "step": 20436 }, { "entropy": 0.6364552024751902, "epoch": 1.8803169619496152, "grad_norm": 0.15851859748363495, "learning_rate": 3.7326340969730425e-05, "loss": 0.6249, "mean_token_accuracy": 0.8128317818045616, "num_tokens": 652274824.0, "step": 20437 }, { "entropy": 0.5364432772621512, "epoch": 1.8804089683210563, "grad_norm": 0.14337827265262604, "learning_rate": 3.7323274143588806e-05, "loss": 0.5295, "mean_token_accuracy": 0.8364838100969791, "num_tokens": 652306642.0, "step": 20438 }, { "entropy": 0.6011263988912106, "epoch": 1.8805009746924974, "grad_norm": 0.15730087459087372, "learning_rate": 3.7320207317447174e-05, "loss": 0.5832, "mean_token_accuracy": 0.8187817484140396, "num_tokens": 652337883.0, "step": 20439 }, { "entropy": 0.7053113970905542, "epoch": 1.8805929810639386, "grad_norm": 0.1611095666885376, "learning_rate": 3.7317140491305555e-05, "loss": 0.698, "mean_token_accuracy": 0.7856894060969353, "num_tokens": 652370334.0, "step": 20440 }, { "entropy": 0.5902689406648278, "epoch": 1.88068498743538, "grad_norm": 0.1517544835805893, "learning_rate": 3.731407366516392e-05, "loss": 0.5736, "mean_token_accuracy": 0.820686612278223, "num_tokens": 652401915.0, "step": 20441 }, { "entropy": 0.7567095002159476, "epoch": 1.8807769938068213, "grad_norm": 0.16339601576328278, "learning_rate": 3.73110068390223e-05, "loss": 0.7491, "mean_token_accuracy": 0.7764552794396877, "num_tokens": 652433755.0, "step": 20442 }, { "entropy": 0.599516352172941, "epoch": 1.8808690001782624, "grad_norm": 0.15037858486175537, "learning_rate": 3.730794001288067e-05, "loss": 0.5847, "mean_token_accuracy": 0.8206273540854454, "num_tokens": 652464892.0, "step": 20443 }, { "entropy": 0.5397110478952527, "epoch": 1.8809610065497036, "grad_norm": 0.1461339294910431, "learning_rate": 3.730487318673905e-05, "loss": 0.5279, "mean_token_accuracy": 0.8353141136467457, "num_tokens": 652497340.0, "step": 20444 }, { "entropy": 0.5996588296256959, "epoch": 1.8810530129211447, "grad_norm": 0.15627048909664154, "learning_rate": 3.730180636059742e-05, "loss": 0.58, "mean_token_accuracy": 0.8208685405552387, "num_tokens": 652529426.0, "step": 20445 }, { "entropy": 0.5131772984750569, "epoch": 1.881145019292586, "grad_norm": 0.14789648354053497, "learning_rate": 3.7298739534455797e-05, "loss": 0.4989, "mean_token_accuracy": 0.8414336256682873, "num_tokens": 652561154.0, "step": 20446 }, { "entropy": 0.517800766043365, "epoch": 1.8812370256640274, "grad_norm": 0.14582054316997528, "learning_rate": 3.7295672708314164e-05, "loss": 0.5128, "mean_token_accuracy": 0.8433656208217144, "num_tokens": 652592774.0, "step": 20447 }, { "entropy": 0.5190470251254737, "epoch": 1.8813290320354685, "grad_norm": 0.15433372557163239, "learning_rate": 3.7292605882172546e-05, "loss": 0.5157, "mean_token_accuracy": 0.8402065858244896, "num_tokens": 652624863.0, "step": 20448 }, { "entropy": 0.6621332764625549, "epoch": 1.8814210384069097, "grad_norm": 0.1581066995859146, "learning_rate": 3.7289539056030914e-05, "loss": 0.6649, "mean_token_accuracy": 0.7945593222975731, "num_tokens": 652657206.0, "step": 20449 }, { "entropy": 0.5861445451155305, "epoch": 1.8815130447783508, "grad_norm": 0.1530643105506897, "learning_rate": 3.728647222988929e-05, "loss": 0.5797, "mean_token_accuracy": 0.8211613558232784, "num_tokens": 652689250.0, "step": 20450 }, { "entropy": 0.6673767319880426, "epoch": 1.8816050511497922, "grad_norm": 0.1558447629213333, "learning_rate": 3.728340540374766e-05, "loss": 0.6524, "mean_token_accuracy": 0.8024502769112587, "num_tokens": 652721072.0, "step": 20451 }, { "entropy": 0.6738601746037602, "epoch": 1.8816970575212335, "grad_norm": 0.15788327157497406, "learning_rate": 3.728033857760604e-05, "loss": 0.6692, "mean_token_accuracy": 0.7968647293746471, "num_tokens": 652753191.0, "step": 20452 }, { "entropy": 0.5640986964572221, "epoch": 1.8817890638926746, "grad_norm": 0.1498832255601883, "learning_rate": 3.727727175146441e-05, "loss": 0.5619, "mean_token_accuracy": 0.8271548338234425, "num_tokens": 652785061.0, "step": 20453 }, { "entropy": 0.5340516651049256, "epoch": 1.8818810702641158, "grad_norm": 0.14415615797042847, "learning_rate": 3.727420492532279e-05, "loss": 0.5195, "mean_token_accuracy": 0.8390040658414364, "num_tokens": 652817476.0, "step": 20454 }, { "entropy": 0.6219555214047432, "epoch": 1.881973076635557, "grad_norm": 0.15428289771080017, "learning_rate": 3.7271138099181155e-05, "loss": 0.6082, "mean_token_accuracy": 0.808771688491106, "num_tokens": 652848969.0, "step": 20455 }, { "entropy": 0.6004019882529974, "epoch": 1.8820650830069983, "grad_norm": 0.1520041823387146, "learning_rate": 3.7268071273039536e-05, "loss": 0.5878, "mean_token_accuracy": 0.820387028157711, "num_tokens": 652880815.0, "step": 20456 }, { "entropy": 0.6638024244457483, "epoch": 1.8821570893784396, "grad_norm": 0.15198981761932373, "learning_rate": 3.7265004446897904e-05, "loss": 0.6549, "mean_token_accuracy": 0.7993559911847115, "num_tokens": 652913103.0, "step": 20457 }, { "entropy": 0.5866254363209009, "epoch": 1.8822490957498808, "grad_norm": 0.15642604231834412, "learning_rate": 3.726193762075628e-05, "loss": 0.5813, "mean_token_accuracy": 0.821444358676672, "num_tokens": 652944213.0, "step": 20458 }, { "entropy": 0.6805712208151817, "epoch": 1.8823411021213219, "grad_norm": 0.1643347442150116, "learning_rate": 3.7258870794614653e-05, "loss": 0.67, "mean_token_accuracy": 0.7937572300434113, "num_tokens": 652976232.0, "step": 20459 }, { "entropy": 0.6250235480256379, "epoch": 1.882433108492763, "grad_norm": 0.1539846956729889, "learning_rate": 3.725580396847303e-05, "loss": 0.6166, "mean_token_accuracy": 0.8109009079635143, "num_tokens": 653008723.0, "step": 20460 }, { "entropy": 0.6015912462025881, "epoch": 1.8825251148642044, "grad_norm": 0.1553526669740677, "learning_rate": 3.72527371423314e-05, "loss": 0.6014, "mean_token_accuracy": 0.815595980733633, "num_tokens": 653040281.0, "step": 20461 }, { "entropy": 0.5701332376338542, "epoch": 1.8826171212356457, "grad_norm": 0.14101001620292664, "learning_rate": 3.724967031618978e-05, "loss": 0.5538, "mean_token_accuracy": 0.8290249705314636, "num_tokens": 653072318.0, "step": 20462 }, { "entropy": 0.6114246230572462, "epoch": 1.8827091276070869, "grad_norm": 0.15925225615501404, "learning_rate": 3.724660349004815e-05, "loss": 0.6078, "mean_token_accuracy": 0.8148197866976261, "num_tokens": 653103945.0, "step": 20463 }, { "entropy": 0.6496864855289459, "epoch": 1.882801133978528, "grad_norm": 0.1632925271987915, "learning_rate": 3.724353666390653e-05, "loss": 0.6342, "mean_token_accuracy": 0.8064769878983498, "num_tokens": 653135597.0, "step": 20464 }, { "entropy": 0.5273113148286939, "epoch": 1.8828931403499691, "grad_norm": 0.1464960277080536, "learning_rate": 3.7240469837764895e-05, "loss": 0.5106, "mean_token_accuracy": 0.840367991477251, "num_tokens": 653167751.0, "step": 20465 }, { "entropy": 0.5031407373026013, "epoch": 1.8829851467214105, "grad_norm": 0.1458062082529068, "learning_rate": 3.7237403011623276e-05, "loss": 0.4904, "mean_token_accuracy": 0.8480575308203697, "num_tokens": 653200292.0, "step": 20466 }, { "entropy": 0.49445758666843176, "epoch": 1.8830771530928518, "grad_norm": 0.14746254682540894, "learning_rate": 3.7234336185481644e-05, "loss": 0.4792, "mean_token_accuracy": 0.8474000915884972, "num_tokens": 653232311.0, "step": 20467 }, { "entropy": 0.5882583409547806, "epoch": 1.883169159464293, "grad_norm": 0.15392711758613586, "learning_rate": 3.723126935934002e-05, "loss": 0.5687, "mean_token_accuracy": 0.8223315328359604, "num_tokens": 653263700.0, "step": 20468 }, { "entropy": 0.5660631819628179, "epoch": 1.883261165835734, "grad_norm": 0.1420300453901291, "learning_rate": 3.72282025331984e-05, "loss": 0.5536, "mean_token_accuracy": 0.828773744404316, "num_tokens": 653296009.0, "step": 20469 }, { "entropy": 0.6667218329384923, "epoch": 1.8833531722071752, "grad_norm": 0.15561464428901672, "learning_rate": 3.722513570705677e-05, "loss": 0.6623, "mean_token_accuracy": 0.8018937222659588, "num_tokens": 653328204.0, "step": 20470 }, { "entropy": 0.5170070230960846, "epoch": 1.8834451785786166, "grad_norm": 0.14692236483097076, "learning_rate": 3.722206888091514e-05, "loss": 0.5034, "mean_token_accuracy": 0.8451326936483383, "num_tokens": 653360536.0, "step": 20471 }, { "entropy": 0.5498584350571036, "epoch": 1.883537184950058, "grad_norm": 0.14924567937850952, "learning_rate": 3.721900205477352e-05, "loss": 0.5367, "mean_token_accuracy": 0.8356159403920174, "num_tokens": 653392413.0, "step": 20472 }, { "entropy": 0.603764409199357, "epoch": 1.883629191321499, "grad_norm": 0.147426038980484, "learning_rate": 3.721593522863189e-05, "loss": 0.5891, "mean_token_accuracy": 0.8171705305576324, "num_tokens": 653424478.0, "step": 20473 }, { "entropy": 0.6513115940615535, "epoch": 1.8837211976929402, "grad_norm": 0.16280677914619446, "learning_rate": 3.7212868402490266e-05, "loss": 0.6461, "mean_token_accuracy": 0.7976936511695385, "num_tokens": 653456279.0, "step": 20474 }, { "entropy": 0.6143420580774546, "epoch": 1.8838132040643814, "grad_norm": 0.1573072224855423, "learning_rate": 3.720980157634864e-05, "loss": 0.6069, "mean_token_accuracy": 0.8182207122445107, "num_tokens": 653488585.0, "step": 20475 }, { "entropy": 0.6049470212310553, "epoch": 1.8839052104358227, "grad_norm": 0.15194042026996613, "learning_rate": 3.720673475020701e-05, "loss": 0.5833, "mean_token_accuracy": 0.8173979446291924, "num_tokens": 653519871.0, "step": 20476 }, { "entropy": 0.5460547776892781, "epoch": 1.883997216807264, "grad_norm": 0.1515328288078308, "learning_rate": 3.720366792406539e-05, "loss": 0.5302, "mean_token_accuracy": 0.836488600820303, "num_tokens": 653552042.0, "step": 20477 }, { "entropy": 0.6563340723514557, "epoch": 1.8840892231787052, "grad_norm": 0.15589654445648193, "learning_rate": 3.720060109792376e-05, "loss": 0.6437, "mean_token_accuracy": 0.8011636883020401, "num_tokens": 653583389.0, "step": 20478 }, { "entropy": 0.6649831850081682, "epoch": 1.8841812295501463, "grad_norm": 0.15901030600070953, "learning_rate": 3.719753427178214e-05, "loss": 0.666, "mean_token_accuracy": 0.7964760512113571, "num_tokens": 653615084.0, "step": 20479 }, { "entropy": 0.6197346113622189, "epoch": 1.8842732359215875, "grad_norm": 0.15624664723873138, "learning_rate": 3.719446744564051e-05, "loss": 0.6282, "mean_token_accuracy": 0.8111806362867355, "num_tokens": 653647052.0, "step": 20480 }, { "entropy": 0.6258018286898732, "epoch": 1.8843652422930288, "grad_norm": 0.15988212823867798, "learning_rate": 3.719140061949888e-05, "loss": 0.6179, "mean_token_accuracy": 0.8120639882981777, "num_tokens": 653679401.0, "step": 20481 }, { "entropy": 0.5440200716257095, "epoch": 1.8844572486644702, "grad_norm": 0.15295901894569397, "learning_rate": 3.718833379335726e-05, "loss": 0.5252, "mean_token_accuracy": 0.8405452333390713, "num_tokens": 653710689.0, "step": 20482 }, { "entropy": 0.5629430669359863, "epoch": 1.8845492550359113, "grad_norm": 0.15203119814395905, "learning_rate": 3.718526696721563e-05, "loss": 0.5594, "mean_token_accuracy": 0.8314422853291035, "num_tokens": 653743148.0, "step": 20483 }, { "entropy": 0.5469514955766499, "epoch": 1.8846412614073524, "grad_norm": 0.15377727150917053, "learning_rate": 3.7182200141074006e-05, "loss": 0.536, "mean_token_accuracy": 0.8332965783774853, "num_tokens": 653775436.0, "step": 20484 }, { "entropy": 0.6086756782606244, "epoch": 1.8847332677787936, "grad_norm": 0.15364159643650055, "learning_rate": 3.717913331493238e-05, "loss": 0.6002, "mean_token_accuracy": 0.817359060049057, "num_tokens": 653807744.0, "step": 20485 }, { "entropy": 0.6918705757707357, "epoch": 1.884825274150235, "grad_norm": 0.1600377857685089, "learning_rate": 3.717606648879075e-05, "loss": 0.6978, "mean_token_accuracy": 0.7858597747981548, "num_tokens": 653839319.0, "step": 20486 }, { "entropy": 0.6228171768598258, "epoch": 1.8849172805216763, "grad_norm": 0.14921988546848297, "learning_rate": 3.717299966264913e-05, "loss": 0.6125, "mean_token_accuracy": 0.8133954592049122, "num_tokens": 653871747.0, "step": 20487 }, { "entropy": 0.5835735471919179, "epoch": 1.8850092868931174, "grad_norm": 0.150941401720047, "learning_rate": 3.71699328365075e-05, "loss": 0.5791, "mean_token_accuracy": 0.8225232474505901, "num_tokens": 653904198.0, "step": 20488 }, { "entropy": 0.6404789220541716, "epoch": 1.8851012932645586, "grad_norm": 0.16444896161556244, "learning_rate": 3.716686601036587e-05, "loss": 0.6408, "mean_token_accuracy": 0.8059851378202438, "num_tokens": 653935523.0, "step": 20489 }, { "entropy": 0.5783604849129915, "epoch": 1.8851932996359997, "grad_norm": 0.14942364394664764, "learning_rate": 3.716379918422425e-05, "loss": 0.5563, "mean_token_accuracy": 0.8284849189221859, "num_tokens": 653967737.0, "step": 20490 }, { "entropy": 0.6474160673096776, "epoch": 1.885285306007441, "grad_norm": 0.16128745675086975, "learning_rate": 3.716073235808262e-05, "loss": 0.6353, "mean_token_accuracy": 0.802955437451601, "num_tokens": 653999618.0, "step": 20491 }, { "entropy": 0.6572075448930264, "epoch": 1.8853773123788824, "grad_norm": 0.1541927009820938, "learning_rate": 3.7157665531940996e-05, "loss": 0.641, "mean_token_accuracy": 0.8046676330268383, "num_tokens": 654031438.0, "step": 20492 }, { "entropy": 0.5928140366449952, "epoch": 1.8854693187503235, "grad_norm": 0.15593041479587555, "learning_rate": 3.715459870579937e-05, "loss": 0.5773, "mean_token_accuracy": 0.8192313872277737, "num_tokens": 654062703.0, "step": 20493 }, { "entropy": 0.6335612591356039, "epoch": 1.8855613251217647, "grad_norm": 0.15678469836711884, "learning_rate": 3.715153187965774e-05, "loss": 0.6145, "mean_token_accuracy": 0.8105778284370899, "num_tokens": 654095069.0, "step": 20494 }, { "entropy": 0.5786684132181108, "epoch": 1.8856533314932058, "grad_norm": 0.15067648887634277, "learning_rate": 3.714846505351612e-05, "loss": 0.5639, "mean_token_accuracy": 0.8227180168032646, "num_tokens": 654126607.0, "step": 20495 }, { "entropy": 0.6262596137821674, "epoch": 1.8857453378646472, "grad_norm": 0.151550754904747, "learning_rate": 3.714539822737449e-05, "loss": 0.6106, "mean_token_accuracy": 0.8124787174165249, "num_tokens": 654158609.0, "step": 20496 }, { "entropy": 0.6478900760412216, "epoch": 1.8858373442360885, "grad_norm": 0.1539705991744995, "learning_rate": 3.714233140123286e-05, "loss": 0.6377, "mean_token_accuracy": 0.8047105222940445, "num_tokens": 654190947.0, "step": 20497 }, { "entropy": 0.6324740555137396, "epoch": 1.8859293506075296, "grad_norm": 0.15252406895160675, "learning_rate": 3.713926457509124e-05, "loss": 0.6254, "mean_token_accuracy": 0.8108946867287159, "num_tokens": 654223475.0, "step": 20498 }, { "entropy": 0.43455940391868353, "epoch": 1.8860213569789708, "grad_norm": 0.14133936166763306, "learning_rate": 3.713619774894961e-05, "loss": 0.4223, "mean_token_accuracy": 0.8642280213534832, "num_tokens": 654254850.0, "step": 20499 }, { "entropy": 0.5932803191244602, "epoch": 1.886113363350412, "grad_norm": 0.1520935595035553, "learning_rate": 3.7133130922807994e-05, "loss": 0.5858, "mean_token_accuracy": 0.8192647993564606, "num_tokens": 654286833.0, "step": 20500 }, { "entropy": 0.6899553500115871, "epoch": 1.8862053697218533, "grad_norm": 0.1585550755262375, "learning_rate": 3.713006409666636e-05, "loss": 0.6722, "mean_token_accuracy": 0.7968708872795105, "num_tokens": 654318727.0, "step": 20501 }, { "entropy": 0.6348686460405588, "epoch": 1.8862973760932946, "grad_norm": 0.1608988642692566, "learning_rate": 3.7126997270524736e-05, "loss": 0.6303, "mean_token_accuracy": 0.8065533488988876, "num_tokens": 654350990.0, "step": 20502 }, { "entropy": 0.5747887268662453, "epoch": 1.8863893824647358, "grad_norm": 0.15275874733924866, "learning_rate": 3.712393044438311e-05, "loss": 0.5587, "mean_token_accuracy": 0.8236473053693771, "num_tokens": 654382743.0, "step": 20503 }, { "entropy": 0.6808136254549026, "epoch": 1.8864813888361769, "grad_norm": 0.15645244717597961, "learning_rate": 3.7120863618241485e-05, "loss": 0.6749, "mean_token_accuracy": 0.796025887131691, "num_tokens": 654414842.0, "step": 20504 }, { "entropy": 0.5765939150005579, "epoch": 1.886573395207618, "grad_norm": 0.15791554749011993, "learning_rate": 3.711779679209986e-05, "loss": 0.5612, "mean_token_accuracy": 0.8245592154562473, "num_tokens": 654445761.0, "step": 20505 }, { "entropy": 0.6751337945461273, "epoch": 1.8866654015790594, "grad_norm": 0.15831191837787628, "learning_rate": 3.7114729965958235e-05, "loss": 0.6684, "mean_token_accuracy": 0.7978342324495316, "num_tokens": 654478059.0, "step": 20506 }, { "entropy": 0.5910321185365319, "epoch": 1.8867574079505007, "grad_norm": 0.1551073044538498, "learning_rate": 3.71116631398166e-05, "loss": 0.5873, "mean_token_accuracy": 0.8204599618911743, "num_tokens": 654510195.0, "step": 20507 }, { "entropy": 0.5694260150194168, "epoch": 1.8868494143219419, "grad_norm": 0.1595672369003296, "learning_rate": 3.7108596313674984e-05, "loss": 0.5659, "mean_token_accuracy": 0.8223972246050835, "num_tokens": 654541009.0, "step": 20508 }, { "entropy": 0.588766188826412, "epoch": 1.886941420693383, "grad_norm": 0.14638744294643402, "learning_rate": 3.710552948753335e-05, "loss": 0.5718, "mean_token_accuracy": 0.8225950822234154, "num_tokens": 654573217.0, "step": 20509 }, { "entropy": 0.6144774658605456, "epoch": 1.8870334270648241, "grad_norm": 0.1592666208744049, "learning_rate": 3.7102462661391727e-05, "loss": 0.5976, "mean_token_accuracy": 0.8150769136846066, "num_tokens": 654605483.0, "step": 20510 }, { "entropy": 0.7354085147380829, "epoch": 1.8871254334362655, "grad_norm": 0.16518855094909668, "learning_rate": 3.70993958352501e-05, "loss": 0.7349, "mean_token_accuracy": 0.7797732725739479, "num_tokens": 654637447.0, "step": 20511 }, { "entropy": 0.5939891580492258, "epoch": 1.8872174398077068, "grad_norm": 0.1570463329553604, "learning_rate": 3.7096329009108476e-05, "loss": 0.581, "mean_token_accuracy": 0.8184110783040524, "num_tokens": 654668230.0, "step": 20512 }, { "entropy": 0.6080569103360176, "epoch": 1.887309446179148, "grad_norm": 0.15211409330368042, "learning_rate": 3.709326218296685e-05, "loss": 0.5961, "mean_token_accuracy": 0.8157993853092194, "num_tokens": 654700382.0, "step": 20513 }, { "entropy": 0.632908757776022, "epoch": 1.887401452550589, "grad_norm": 0.15848353505134583, "learning_rate": 3.7090195356825225e-05, "loss": 0.6367, "mean_token_accuracy": 0.8096827380359173, "num_tokens": 654732091.0, "step": 20514 }, { "entropy": 0.612649243324995, "epoch": 1.8874934589220302, "grad_norm": 0.1566445678472519, "learning_rate": 3.708712853068359e-05, "loss": 0.5959, "mean_token_accuracy": 0.8167964853346348, "num_tokens": 654763901.0, "step": 20515 }, { "entropy": 0.6467593070119619, "epoch": 1.8875854652934716, "grad_norm": 0.1536368876695633, "learning_rate": 3.7084061704541974e-05, "loss": 0.6299, "mean_token_accuracy": 0.8075779639184475, "num_tokens": 654796589.0, "step": 20516 }, { "entropy": 0.5530796777456999, "epoch": 1.887677471664913, "grad_norm": 0.15212541818618774, "learning_rate": 3.708099487840034e-05, "loss": 0.5461, "mean_token_accuracy": 0.8298387266695499, "num_tokens": 654829012.0, "step": 20517 }, { "entropy": 0.5809855968691409, "epoch": 1.887769478036354, "grad_norm": 0.15344808995723724, "learning_rate": 3.707792805225872e-05, "loss": 0.5739, "mean_token_accuracy": 0.8222090937197208, "num_tokens": 654861213.0, "step": 20518 }, { "entropy": 0.6045116689056158, "epoch": 1.8878614844077952, "grad_norm": 0.15137962996959686, "learning_rate": 3.707486122611709e-05, "loss": 0.5925, "mean_token_accuracy": 0.8196960538625717, "num_tokens": 654893902.0, "step": 20519 }, { "entropy": 0.6252966299653053, "epoch": 1.8879534907792364, "grad_norm": 0.15530413389205933, "learning_rate": 3.7071794399975466e-05, "loss": 0.6194, "mean_token_accuracy": 0.8094313964247704, "num_tokens": 654925510.0, "step": 20520 }, { "entropy": 0.5490043172612786, "epoch": 1.8880454971506777, "grad_norm": 0.14738355576992035, "learning_rate": 3.706872757383384e-05, "loss": 0.5339, "mean_token_accuracy": 0.8387524448335171, "num_tokens": 654957783.0, "step": 20521 }, { "entropy": 0.557597697712481, "epoch": 1.888137503522119, "grad_norm": 0.14915235340595245, "learning_rate": 3.7065660747692216e-05, "loss": 0.5505, "mean_token_accuracy": 0.830311119556427, "num_tokens": 654990040.0, "step": 20522 }, { "entropy": 0.613866014406085, "epoch": 1.8882295098935602, "grad_norm": 0.150363489985466, "learning_rate": 3.706259392155059e-05, "loss": 0.6117, "mean_token_accuracy": 0.8106575831770897, "num_tokens": 655022482.0, "step": 20523 }, { "entropy": 0.686033833771944, "epoch": 1.8883215162650013, "grad_norm": 0.16041375696659088, "learning_rate": 3.7059527095408965e-05, "loss": 0.6681, "mean_token_accuracy": 0.7947268933057785, "num_tokens": 655053940.0, "step": 20524 }, { "entropy": 0.6606724709272385, "epoch": 1.8884135226364425, "grad_norm": 0.15142908692359924, "learning_rate": 3.705646026926733e-05, "loss": 0.6443, "mean_token_accuracy": 0.8036284260451794, "num_tokens": 655086094.0, "step": 20525 }, { "entropy": 0.5706528034061193, "epoch": 1.8885055290078838, "grad_norm": 0.14914140105247498, "learning_rate": 3.7053393443125714e-05, "loss": 0.5621, "mean_token_accuracy": 0.8249669931828976, "num_tokens": 655118273.0, "step": 20526 }, { "entropy": 0.7065205574035645, "epoch": 1.8885975353793252, "grad_norm": 0.15727928280830383, "learning_rate": 3.705032661698408e-05, "loss": 0.7042, "mean_token_accuracy": 0.788977786898613, "num_tokens": 655150807.0, "step": 20527 }, { "entropy": 0.5143995345570147, "epoch": 1.8886895417507663, "grad_norm": 0.1504741609096527, "learning_rate": 3.704725979084246e-05, "loss": 0.5002, "mean_token_accuracy": 0.8472022414207458, "num_tokens": 655183110.0, "step": 20528 }, { "entropy": 0.515281087718904, "epoch": 1.8887815481222074, "grad_norm": 0.14576351642608643, "learning_rate": 3.704419296470083e-05, "loss": 0.5089, "mean_token_accuracy": 0.8465125858783722, "num_tokens": 655215456.0, "step": 20529 }, { "entropy": 0.680703729391098, "epoch": 1.8888735544936486, "grad_norm": 0.16101273894309998, "learning_rate": 3.7041126138559206e-05, "loss": 0.6909, "mean_token_accuracy": 0.7891299314796925, "num_tokens": 655248042.0, "step": 20530 }, { "entropy": 0.545241423882544, "epoch": 1.88896556086509, "grad_norm": 0.1439598947763443, "learning_rate": 3.703805931241758e-05, "loss": 0.5338, "mean_token_accuracy": 0.832953292876482, "num_tokens": 655279703.0, "step": 20531 }, { "entropy": 0.585349137429148, "epoch": 1.8890575672365313, "grad_norm": 0.15374755859375, "learning_rate": 3.7034992486275955e-05, "loss": 0.5794, "mean_token_accuracy": 0.8228131085634232, "num_tokens": 655311523.0, "step": 20532 }, { "entropy": 0.5472720619291067, "epoch": 1.8891495736079724, "grad_norm": 0.1524309366941452, "learning_rate": 3.703192566013433e-05, "loss": 0.5335, "mean_token_accuracy": 0.8374283649027348, "num_tokens": 655343716.0, "step": 20533 }, { "entropy": 0.6518481359817088, "epoch": 1.8892415799794136, "grad_norm": 0.15802785754203796, "learning_rate": 3.7028858833992705e-05, "loss": 0.6484, "mean_token_accuracy": 0.8087150566279888, "num_tokens": 655375363.0, "step": 20534 }, { "entropy": 0.6493612863123417, "epoch": 1.8893335863508547, "grad_norm": 0.1578502058982849, "learning_rate": 3.702579200785108e-05, "loss": 0.6361, "mean_token_accuracy": 0.8039544969797134, "num_tokens": 655407483.0, "step": 20535 }, { "entropy": 0.5573835503309965, "epoch": 1.889425592722296, "grad_norm": 0.15346018970012665, "learning_rate": 3.702272518170945e-05, "loss": 0.5497, "mean_token_accuracy": 0.8323032781481743, "num_tokens": 655438461.0, "step": 20536 }, { "entropy": 0.7437872178852558, "epoch": 1.8895175990937374, "grad_norm": 0.16417664289474487, "learning_rate": 3.701965835556783e-05, "loss": 0.7355, "mean_token_accuracy": 0.7782368361949921, "num_tokens": 655470171.0, "step": 20537 }, { "entropy": 0.5537210237234831, "epoch": 1.8896096054651785, "grad_norm": 0.14670181274414062, "learning_rate": 3.7016591529426196e-05, "loss": 0.5504, "mean_token_accuracy": 0.8307632468640804, "num_tokens": 655502610.0, "step": 20538 }, { "entropy": 0.636171318590641, "epoch": 1.8897016118366197, "grad_norm": 0.16136504709720612, "learning_rate": 3.701352470328458e-05, "loss": 0.6176, "mean_token_accuracy": 0.8118271939456463, "num_tokens": 655534978.0, "step": 20539 }, { "entropy": 0.6096402939874679, "epoch": 1.8897936182080608, "grad_norm": 0.1495138555765152, "learning_rate": 3.7010457877142946e-05, "loss": 0.5769, "mean_token_accuracy": 0.8198346793651581, "num_tokens": 655565995.0, "step": 20540 }, { "entropy": 0.6086553074419498, "epoch": 1.8898856245795022, "grad_norm": 0.1551857590675354, "learning_rate": 3.700739105100132e-05, "loss": 0.6012, "mean_token_accuracy": 0.8121207132935524, "num_tokens": 655597587.0, "step": 20541 }, { "entropy": 0.6268911277875304, "epoch": 1.8899776309509435, "grad_norm": 0.15220439434051514, "learning_rate": 3.7004324224859695e-05, "loss": 0.6186, "mean_token_accuracy": 0.8141062743961811, "num_tokens": 655629743.0, "step": 20542 }, { "entropy": 0.584410959854722, "epoch": 1.8900696373223846, "grad_norm": 0.1519598364830017, "learning_rate": 3.700125739871807e-05, "loss": 0.5638, "mean_token_accuracy": 0.823399979621172, "num_tokens": 655662140.0, "step": 20543 }, { "entropy": 0.6980295851826668, "epoch": 1.8901616436938258, "grad_norm": 0.16341710090637207, "learning_rate": 3.6998190572576444e-05, "loss": 0.6828, "mean_token_accuracy": 0.7904841639101505, "num_tokens": 655693134.0, "step": 20544 }, { "entropy": 0.5503797912970185, "epoch": 1.890253650065267, "grad_norm": 0.14742852747440338, "learning_rate": 3.699512374643482e-05, "loss": 0.5385, "mean_token_accuracy": 0.8371250182390213, "num_tokens": 655724767.0, "step": 20545 }, { "entropy": 0.6343416552990675, "epoch": 1.8903456564367083, "grad_norm": 0.16473232209682465, "learning_rate": 3.699205692029319e-05, "loss": 0.6243, "mean_token_accuracy": 0.8074632808566093, "num_tokens": 655756418.0, "step": 20546 }, { "entropy": 0.5098768984898925, "epoch": 1.8904376628081496, "grad_norm": 0.15081113576889038, "learning_rate": 3.698899009415157e-05, "loss": 0.4919, "mean_token_accuracy": 0.8431964591145515, "num_tokens": 655788618.0, "step": 20547 }, { "entropy": 0.7207122556865215, "epoch": 1.8905296691795908, "grad_norm": 0.1666545867919922, "learning_rate": 3.6985923268009936e-05, "loss": 0.7073, "mean_token_accuracy": 0.7838005125522614, "num_tokens": 655819967.0, "step": 20548 }, { "entropy": 0.6161044873297215, "epoch": 1.8906216755510319, "grad_norm": 0.15187232196331024, "learning_rate": 3.698285644186831e-05, "loss": 0.6153, "mean_token_accuracy": 0.8112354055047035, "num_tokens": 655852717.0, "step": 20549 }, { "entropy": 0.5344935627654195, "epoch": 1.890713681922473, "grad_norm": 0.14482593536376953, "learning_rate": 3.6979789615726685e-05, "loss": 0.5227, "mean_token_accuracy": 0.840659387409687, "num_tokens": 655885291.0, "step": 20550 }, { "entropy": 0.5808232207782567, "epoch": 1.8908056882939144, "grad_norm": 0.15611383318901062, "learning_rate": 3.697672278958506e-05, "loss": 0.5841, "mean_token_accuracy": 0.8207594938576221, "num_tokens": 655917661.0, "step": 20551 }, { "entropy": 0.5286053698509932, "epoch": 1.8908976946653557, "grad_norm": 0.1527092456817627, "learning_rate": 3.6973655963443435e-05, "loss": 0.5195, "mean_token_accuracy": 0.8388797678053379, "num_tokens": 655949652.0, "step": 20552 }, { "entropy": 0.6651683803647757, "epoch": 1.8909897010367969, "grad_norm": 0.1619216501712799, "learning_rate": 3.697058913730181e-05, "loss": 0.6746, "mean_token_accuracy": 0.7966857254505157, "num_tokens": 655981461.0, "step": 20553 }, { "entropy": 0.6388550121337175, "epoch": 1.891081707408238, "grad_norm": 0.15701739490032196, "learning_rate": 3.696752231116018e-05, "loss": 0.6105, "mean_token_accuracy": 0.8105076923966408, "num_tokens": 656012587.0, "step": 20554 }, { "entropy": 0.6970151290297508, "epoch": 1.8911737137796791, "grad_norm": 0.16227854788303375, "learning_rate": 3.696445548501856e-05, "loss": 0.695, "mean_token_accuracy": 0.7859952822327614, "num_tokens": 656044502.0, "step": 20555 }, { "entropy": 0.5552813149988651, "epoch": 1.8912657201511205, "grad_norm": 0.15002764761447906, "learning_rate": 3.6961388658876926e-05, "loss": 0.547, "mean_token_accuracy": 0.830603051930666, "num_tokens": 656076408.0, "step": 20556 }, { "entropy": 0.5829848237335682, "epoch": 1.8913577265225618, "grad_norm": 0.14458639919757843, "learning_rate": 3.69583218327353e-05, "loss": 0.5659, "mean_token_accuracy": 0.827257800847292, "num_tokens": 656108748.0, "step": 20557 }, { "entropy": 0.6459936685860157, "epoch": 1.891449732894003, "grad_norm": 0.1554967164993286, "learning_rate": 3.6955255006593676e-05, "loss": 0.6375, "mean_token_accuracy": 0.802279457449913, "num_tokens": 656140981.0, "step": 20558 }, { "entropy": 0.6256263228133321, "epoch": 1.891541739265444, "grad_norm": 0.15121714770793915, "learning_rate": 3.695218818045205e-05, "loss": 0.617, "mean_token_accuracy": 0.8090228289365768, "num_tokens": 656172682.0, "step": 20559 }, { "entropy": 0.5123894447460771, "epoch": 1.8916337456368852, "grad_norm": 0.14846445620059967, "learning_rate": 3.694912135431043e-05, "loss": 0.5016, "mean_token_accuracy": 0.8449485972523689, "num_tokens": 656204730.0, "step": 20560 }, { "entropy": 0.5296467309817672, "epoch": 1.8917257520083266, "grad_norm": 0.14786465466022491, "learning_rate": 3.69460545281688e-05, "loss": 0.5187, "mean_token_accuracy": 0.8400680050253868, "num_tokens": 656236907.0, "step": 20561 }, { "entropy": 0.6141238873824477, "epoch": 1.891817758379768, "grad_norm": 0.15010122954845428, "learning_rate": 3.6942987702027174e-05, "loss": 0.5948, "mean_token_accuracy": 0.8180873654782772, "num_tokens": 656268888.0, "step": 20562 }, { "entropy": 0.6551941689103842, "epoch": 1.891909764751209, "grad_norm": 0.15796145796775818, "learning_rate": 3.693992087588555e-05, "loss": 0.654, "mean_token_accuracy": 0.8008983507752419, "num_tokens": 656300916.0, "step": 20563 }, { "entropy": 0.6782443355768919, "epoch": 1.8920017711226502, "grad_norm": 0.16168242692947388, "learning_rate": 3.6936854049743924e-05, "loss": 0.6815, "mean_token_accuracy": 0.791256669908762, "num_tokens": 656332899.0, "step": 20564 }, { "entropy": 0.6071002362295985, "epoch": 1.8920937774940914, "grad_norm": 0.15578888356685638, "learning_rate": 3.69337872236023e-05, "loss": 0.6021, "mean_token_accuracy": 0.8148874416947365, "num_tokens": 656363806.0, "step": 20565 }, { "entropy": 0.5697994576767087, "epoch": 1.8921857838655327, "grad_norm": 0.14795033633708954, "learning_rate": 3.693072039746067e-05, "loss": 0.5595, "mean_token_accuracy": 0.826535128057003, "num_tokens": 656395744.0, "step": 20566 }, { "entropy": 0.5643708677962422, "epoch": 1.892277790236974, "grad_norm": 0.14621320366859436, "learning_rate": 3.692765357131904e-05, "loss": 0.5573, "mean_token_accuracy": 0.8275788985192776, "num_tokens": 656428454.0, "step": 20567 }, { "entropy": 0.6581464819610119, "epoch": 1.8923697966084152, "grad_norm": 0.16235461831092834, "learning_rate": 3.692458674517742e-05, "loss": 0.6515, "mean_token_accuracy": 0.8011713065207005, "num_tokens": 656460337.0, "step": 20568 }, { "entropy": 0.6121187657117844, "epoch": 1.8924618029798563, "grad_norm": 0.15615114569664001, "learning_rate": 3.692151991903579e-05, "loss": 0.5974, "mean_token_accuracy": 0.8187981732189655, "num_tokens": 656492204.0, "step": 20569 }, { "entropy": 0.6109717506915331, "epoch": 1.8925538093512975, "grad_norm": 0.1524396389722824, "learning_rate": 3.6918453092894165e-05, "loss": 0.5991, "mean_token_accuracy": 0.8171047456562519, "num_tokens": 656524253.0, "step": 20570 }, { "entropy": 0.6340795801952481, "epoch": 1.8926458157227388, "grad_norm": 0.1596037894487381, "learning_rate": 3.691538626675254e-05, "loss": 0.6299, "mean_token_accuracy": 0.8047255426645279, "num_tokens": 656556346.0, "step": 20571 }, { "entropy": 0.5656970990821719, "epoch": 1.8927378220941802, "grad_norm": 0.15096861124038696, "learning_rate": 3.6912319440610914e-05, "loss": 0.5519, "mean_token_accuracy": 0.8275048062205315, "num_tokens": 656587984.0, "step": 20572 }, { "entropy": 0.6876035369932652, "epoch": 1.8928298284656213, "grad_norm": 0.1639631688594818, "learning_rate": 3.690925261446929e-05, "loss": 0.6848, "mean_token_accuracy": 0.7903395034372807, "num_tokens": 656619000.0, "step": 20573 }, { "entropy": 0.583177737891674, "epoch": 1.8929218348370624, "grad_norm": 0.15072110295295715, "learning_rate": 3.690618578832766e-05, "loss": 0.5711, "mean_token_accuracy": 0.8227859288454056, "num_tokens": 656650599.0, "step": 20574 }, { "entropy": 0.6707805544137955, "epoch": 1.8930138412085036, "grad_norm": 0.16698114573955536, "learning_rate": 3.690311896218603e-05, "loss": 0.6798, "mean_token_accuracy": 0.7917990274727345, "num_tokens": 656682284.0, "step": 20575 }, { "entropy": 0.7006223136559129, "epoch": 1.893105847579945, "grad_norm": 0.16054505109786987, "learning_rate": 3.690005213604441e-05, "loss": 0.7012, "mean_token_accuracy": 0.7866602428257465, "num_tokens": 656714659.0, "step": 20576 }, { "entropy": 0.6693970318883657, "epoch": 1.8931978539513863, "grad_norm": 0.1616026759147644, "learning_rate": 3.689698530990278e-05, "loss": 0.6729, "mean_token_accuracy": 0.7968200147151947, "num_tokens": 656746485.0, "step": 20577 }, { "entropy": 0.6278382688760757, "epoch": 1.8932898603228274, "grad_norm": 0.1522424966096878, "learning_rate": 3.6893918483761155e-05, "loss": 0.6204, "mean_token_accuracy": 0.8076294139027596, "num_tokens": 656777983.0, "step": 20578 }, { "entropy": 0.5912092979997396, "epoch": 1.8933818666942686, "grad_norm": 0.15247154235839844, "learning_rate": 3.689085165761953e-05, "loss": 0.5846, "mean_token_accuracy": 0.8206098042428493, "num_tokens": 656808951.0, "step": 20579 }, { "entropy": 0.49591861851513386, "epoch": 1.8934738730657097, "grad_norm": 0.14736899733543396, "learning_rate": 3.6887784831477904e-05, "loss": 0.4787, "mean_token_accuracy": 0.8478221148252487, "num_tokens": 656840084.0, "step": 20580 }, { "entropy": 0.7196319214999676, "epoch": 1.893565879437151, "grad_norm": 0.16546989977359772, "learning_rate": 3.688471800533628e-05, "loss": 0.714, "mean_token_accuracy": 0.7835902832448483, "num_tokens": 656872058.0, "step": 20581 }, { "entropy": 0.6099151293747127, "epoch": 1.8936578858085924, "grad_norm": 0.15838827192783356, "learning_rate": 3.6881651179194654e-05, "loss": 0.607, "mean_token_accuracy": 0.8128664791584015, "num_tokens": 656903606.0, "step": 20582 }, { "entropy": 0.5752838682383299, "epoch": 1.8937498921800335, "grad_norm": 0.148825004696846, "learning_rate": 3.687858435305303e-05, "loss": 0.5586, "mean_token_accuracy": 0.8235389664769173, "num_tokens": 656934897.0, "step": 20583 }, { "entropy": 0.5780243966728449, "epoch": 1.8938418985514747, "grad_norm": 0.14996124804019928, "learning_rate": 3.68755175269114e-05, "loss": 0.5632, "mean_token_accuracy": 0.8308132067322731, "num_tokens": 656967173.0, "step": 20584 }, { "entropy": 0.5963309621438384, "epoch": 1.8939339049229158, "grad_norm": 0.15173660218715668, "learning_rate": 3.687245070076977e-05, "loss": 0.5769, "mean_token_accuracy": 0.8246921747922897, "num_tokens": 656998495.0, "step": 20585 }, { "entropy": 0.6602252200245857, "epoch": 1.8940259112943572, "grad_norm": 0.16061730682849884, "learning_rate": 3.686938387462815e-05, "loss": 0.6501, "mean_token_accuracy": 0.8017287403345108, "num_tokens": 657030451.0, "step": 20586 }, { "entropy": 0.5130877615883946, "epoch": 1.8941179176657985, "grad_norm": 0.13933368027210236, "learning_rate": 3.686631704848652e-05, "loss": 0.4945, "mean_token_accuracy": 0.8465742506086826, "num_tokens": 657063219.0, "step": 20587 }, { "entropy": 0.6361262695863843, "epoch": 1.8942099240372396, "grad_norm": 0.15245182812213898, "learning_rate": 3.6863250222344895e-05, "loss": 0.628, "mean_token_accuracy": 0.8063956201076508, "num_tokens": 657094530.0, "step": 20588 }, { "entropy": 0.5706221326254308, "epoch": 1.8943019304086808, "grad_norm": 0.1492668241262436, "learning_rate": 3.686018339620327e-05, "loss": 0.5448, "mean_token_accuracy": 0.834033876657486, "num_tokens": 657126785.0, "step": 20589 }, { "entropy": 0.6963326651602983, "epoch": 1.894393936780122, "grad_norm": 0.16347919404506683, "learning_rate": 3.6857116570061644e-05, "loss": 0.6623, "mean_token_accuracy": 0.7940581366419792, "num_tokens": 657157655.0, "step": 20590 }, { "entropy": 0.5741553902626038, "epoch": 1.8944859431515633, "grad_norm": 0.1545308381319046, "learning_rate": 3.685404974392002e-05, "loss": 0.5638, "mean_token_accuracy": 0.8254738599061966, "num_tokens": 657189629.0, "step": 20591 }, { "entropy": 0.6736860051751137, "epoch": 1.8945779495230046, "grad_norm": 0.16031275689601898, "learning_rate": 3.6850982917778393e-05, "loss": 0.6534, "mean_token_accuracy": 0.8016556650400162, "num_tokens": 657221237.0, "step": 20592 }, { "entropy": 0.6437602946534753, "epoch": 1.8946699558944458, "grad_norm": 0.15528683364391327, "learning_rate": 3.684791609163677e-05, "loss": 0.6474, "mean_token_accuracy": 0.8039398528635502, "num_tokens": 657253514.0, "step": 20593 }, { "entropy": 0.6758951134979725, "epoch": 1.894761962265887, "grad_norm": 0.15382060408592224, "learning_rate": 3.684484926549514e-05, "loss": 0.6641, "mean_token_accuracy": 0.7963695637881756, "num_tokens": 657285254.0, "step": 20594 }, { "entropy": 0.6460079196840525, "epoch": 1.894853968637328, "grad_norm": 0.1521385908126831, "learning_rate": 3.684178243935352e-05, "loss": 0.6323, "mean_token_accuracy": 0.8051769770681858, "num_tokens": 657317187.0, "step": 20595 }, { "entropy": 0.646613223478198, "epoch": 1.8949459750087694, "grad_norm": 0.16119582951068878, "learning_rate": 3.6838715613211885e-05, "loss": 0.6415, "mean_token_accuracy": 0.8043827675282955, "num_tokens": 657349084.0, "step": 20596 }, { "entropy": 0.5168444467708468, "epoch": 1.8950379813802107, "grad_norm": 0.14573803544044495, "learning_rate": 3.683564878707027e-05, "loss": 0.5079, "mean_token_accuracy": 0.840923860669136, "num_tokens": 657380615.0, "step": 20597 }, { "entropy": 0.607164403423667, "epoch": 1.8951299877516519, "grad_norm": 0.1514754593372345, "learning_rate": 3.6832581960928635e-05, "loss": 0.5913, "mean_token_accuracy": 0.818777821958065, "num_tokens": 657412900.0, "step": 20598 }, { "entropy": 0.6406329041346908, "epoch": 1.895221994123093, "grad_norm": 0.1571802794933319, "learning_rate": 3.6829515134787016e-05, "loss": 0.6213, "mean_token_accuracy": 0.808980543166399, "num_tokens": 657444621.0, "step": 20599 }, { "entropy": 0.5714195156469941, "epoch": 1.8953140004945341, "grad_norm": 0.14803491532802582, "learning_rate": 3.6826448308645384e-05, "loss": 0.5564, "mean_token_accuracy": 0.8300492390990257, "num_tokens": 657477366.0, "step": 20600 }, { "entropy": 0.47695068968459964, "epoch": 1.8954060068659755, "grad_norm": 0.13785916566848755, "learning_rate": 3.682338148250376e-05, "loss": 0.4617, "mean_token_accuracy": 0.8560302332043648, "num_tokens": 657509384.0, "step": 20601 }, { "entropy": 0.6795201189815998, "epoch": 1.8954980132374168, "grad_norm": 0.16310173273086548, "learning_rate": 3.682031465636213e-05, "loss": 0.6607, "mean_token_accuracy": 0.7947343587875366, "num_tokens": 657540202.0, "step": 20602 }, { "entropy": 0.6253451053053141, "epoch": 1.895590019608858, "grad_norm": 0.1570916622877121, "learning_rate": 3.681724783022051e-05, "loss": 0.6246, "mean_token_accuracy": 0.8087362572550774, "num_tokens": 657572543.0, "step": 20603 }, { "entropy": 0.5279541574418545, "epoch": 1.8956820259802991, "grad_norm": 0.15283572673797607, "learning_rate": 3.681418100407888e-05, "loss": 0.5288, "mean_token_accuracy": 0.8370394334197044, "num_tokens": 657603565.0, "step": 20604 }, { "entropy": 0.6149057308211923, "epoch": 1.8957740323517402, "grad_norm": 0.1563723236322403, "learning_rate": 3.681111417793726e-05, "loss": 0.615, "mean_token_accuracy": 0.8127635978162289, "num_tokens": 657635013.0, "step": 20605 }, { "entropy": 0.6933577638119459, "epoch": 1.8958660387231816, "grad_norm": 0.15890918672084808, "learning_rate": 3.6808047351795625e-05, "loss": 0.6954, "mean_token_accuracy": 0.7885665073990822, "num_tokens": 657667405.0, "step": 20606 }, { "entropy": 0.6789960525929928, "epoch": 1.895958045094623, "grad_norm": 0.15897642076015472, "learning_rate": 3.6804980525654006e-05, "loss": 0.6707, "mean_token_accuracy": 0.793330293148756, "num_tokens": 657698561.0, "step": 20607 }, { "entropy": 0.6451615514233708, "epoch": 1.896050051466064, "grad_norm": 0.1544840931892395, "learning_rate": 3.6801913699512374e-05, "loss": 0.6455, "mean_token_accuracy": 0.8045890629291534, "num_tokens": 657730999.0, "step": 20608 }, { "entropy": 0.6248176600784063, "epoch": 1.8961420578375052, "grad_norm": 0.15655291080474854, "learning_rate": 3.679884687337075e-05, "loss": 0.6212, "mean_token_accuracy": 0.8098314441740513, "num_tokens": 657762120.0, "step": 20609 }, { "entropy": 0.6178407622501254, "epoch": 1.8962340642089464, "grad_norm": 0.15537922084331512, "learning_rate": 3.6795780047229124e-05, "loss": 0.6002, "mean_token_accuracy": 0.8109054043889046, "num_tokens": 657793630.0, "step": 20610 }, { "entropy": 0.6164693366736174, "epoch": 1.8963260705803877, "grad_norm": 0.15611545741558075, "learning_rate": 3.67927132210875e-05, "loss": 0.6105, "mean_token_accuracy": 0.8168047666549683, "num_tokens": 657825750.0, "step": 20611 }, { "entropy": 0.6507544796913862, "epoch": 1.896418076951829, "grad_norm": 0.1511814445257187, "learning_rate": 3.678964639494587e-05, "loss": 0.6369, "mean_token_accuracy": 0.806624710559845, "num_tokens": 657857890.0, "step": 20612 }, { "entropy": 0.5377644123509526, "epoch": 1.8965100833232702, "grad_norm": 0.1495581865310669, "learning_rate": 3.678657956880425e-05, "loss": 0.5257, "mean_token_accuracy": 0.8358509875833988, "num_tokens": 657889872.0, "step": 20613 }, { "entropy": 0.5904602017253637, "epoch": 1.8966020896947113, "grad_norm": 0.15002769231796265, "learning_rate": 3.6783512742662615e-05, "loss": 0.5828, "mean_token_accuracy": 0.8191173449158669, "num_tokens": 657922219.0, "step": 20614 }, { "entropy": 0.5773279285058379, "epoch": 1.8966940960661525, "grad_norm": 0.15364256501197815, "learning_rate": 3.6780445916521e-05, "loss": 0.5676, "mean_token_accuracy": 0.8235106132924557, "num_tokens": 657954041.0, "step": 20615 }, { "entropy": 0.6349945981055498, "epoch": 1.8967861024375938, "grad_norm": 0.15599481761455536, "learning_rate": 3.6777379090379365e-05, "loss": 0.634, "mean_token_accuracy": 0.8014467358589172, "num_tokens": 657986315.0, "step": 20616 }, { "entropy": 0.7391075454652309, "epoch": 1.8968781088090352, "grad_norm": 0.16679231822490692, "learning_rate": 3.677431226423774e-05, "loss": 0.7366, "mean_token_accuracy": 0.7783462777733803, "num_tokens": 658018697.0, "step": 20617 }, { "entropy": 0.6503420835360885, "epoch": 1.8969701151804763, "grad_norm": 0.1608278900384903, "learning_rate": 3.6771245438096114e-05, "loss": 0.6415, "mean_token_accuracy": 0.8048616088926792, "num_tokens": 658050559.0, "step": 20618 }, { "entropy": 0.578287404961884, "epoch": 1.8970621215519174, "grad_norm": 0.14966504275798798, "learning_rate": 3.676817861195449e-05, "loss": 0.5648, "mean_token_accuracy": 0.8240439109504223, "num_tokens": 658082644.0, "step": 20619 }, { "entropy": 0.6681525073945522, "epoch": 1.8971541279233586, "grad_norm": 0.16607666015625, "learning_rate": 3.676511178581286e-05, "loss": 0.6673, "mean_token_accuracy": 0.7989933677017689, "num_tokens": 658114867.0, "step": 20620 }, { "entropy": 0.5930913500487804, "epoch": 1.8972461342948, "grad_norm": 0.15856556594371796, "learning_rate": 3.676204495967124e-05, "loss": 0.5783, "mean_token_accuracy": 0.8218420594930649, "num_tokens": 658146881.0, "step": 20621 }, { "entropy": 0.5789475180208683, "epoch": 1.8973381406662413, "grad_norm": 0.15114183723926544, "learning_rate": 3.675897813352961e-05, "loss": 0.5736, "mean_token_accuracy": 0.825593538582325, "num_tokens": 658178340.0, "step": 20622 }, { "entropy": 0.6767120314761996, "epoch": 1.8974301470376824, "grad_norm": 0.1576332300901413, "learning_rate": 3.675591130738799e-05, "loss": 0.6627, "mean_token_accuracy": 0.7985725253820419, "num_tokens": 658209889.0, "step": 20623 }, { "entropy": 0.575576912611723, "epoch": 1.8975221534091236, "grad_norm": 0.15028797090053558, "learning_rate": 3.675284448124636e-05, "loss": 0.5591, "mean_token_accuracy": 0.8325939141213894, "num_tokens": 658241942.0, "step": 20624 }, { "entropy": 0.5594172850251198, "epoch": 1.8976141597805647, "grad_norm": 0.14477330446243286, "learning_rate": 3.6749777655104736e-05, "loss": 0.5509, "mean_token_accuracy": 0.8261824399232864, "num_tokens": 658274316.0, "step": 20625 }, { "entropy": 0.5962465479969978, "epoch": 1.897706166152006, "grad_norm": 0.15351933240890503, "learning_rate": 3.674671082896311e-05, "loss": 0.5896, "mean_token_accuracy": 0.8208458460867405, "num_tokens": 658306685.0, "step": 20626 }, { "entropy": 0.6353097376413643, "epoch": 1.8977981725234474, "grad_norm": 0.16134168207645416, "learning_rate": 3.674364400282148e-05, "loss": 0.6141, "mean_token_accuracy": 0.8126231133937836, "num_tokens": 658338236.0, "step": 20627 }, { "entropy": 0.6240457827225327, "epoch": 1.8978901788948885, "grad_norm": 0.15106473863124847, "learning_rate": 3.674057717667986e-05, "loss": 0.6126, "mean_token_accuracy": 0.8119592554867268, "num_tokens": 658370509.0, "step": 20628 }, { "entropy": 0.6466499920934439, "epoch": 1.8979821852663297, "grad_norm": 0.15942838788032532, "learning_rate": 3.673751035053823e-05, "loss": 0.6384, "mean_token_accuracy": 0.801893662661314, "num_tokens": 658402172.0, "step": 20629 }, { "entropy": 0.7202057559043169, "epoch": 1.8980741916377708, "grad_norm": 0.16505067050457, "learning_rate": 3.67344435243966e-05, "loss": 0.7082, "mean_token_accuracy": 0.7858003489673138, "num_tokens": 658434046.0, "step": 20630 }, { "entropy": 0.7071021441370249, "epoch": 1.8981661980092122, "grad_norm": 0.16132567822933197, "learning_rate": 3.673137669825498e-05, "loss": 0.6951, "mean_token_accuracy": 0.7866274416446686, "num_tokens": 658466214.0, "step": 20631 }, { "entropy": 0.5914899539202452, "epoch": 1.8982582043806535, "grad_norm": 0.15282490849494934, "learning_rate": 3.672830987211335e-05, "loss": 0.5786, "mean_token_accuracy": 0.8216210529208183, "num_tokens": 658497957.0, "step": 20632 }, { "entropy": 0.552270632237196, "epoch": 1.8983502107520946, "grad_norm": 0.14646406471729279, "learning_rate": 3.672524304597173e-05, "loss": 0.5453, "mean_token_accuracy": 0.8319859579205513, "num_tokens": 658529445.0, "step": 20633 }, { "entropy": 0.5761431911960244, "epoch": 1.8984422171235358, "grad_norm": 0.1440998613834381, "learning_rate": 3.67221762198301e-05, "loss": 0.5618, "mean_token_accuracy": 0.8255277015268803, "num_tokens": 658561243.0, "step": 20634 }, { "entropy": 0.5229187640361488, "epoch": 1.898534223494977, "grad_norm": 0.1503681093454361, "learning_rate": 3.671910939368847e-05, "loss": 0.5143, "mean_token_accuracy": 0.8406769633293152, "num_tokens": 658593168.0, "step": 20635 }, { "entropy": 0.560537688434124, "epoch": 1.8986262298664183, "grad_norm": 0.15103007853031158, "learning_rate": 3.671604256754685e-05, "loss": 0.55, "mean_token_accuracy": 0.8296951465308666, "num_tokens": 658625790.0, "step": 20636 }, { "entropy": 0.6073828423395753, "epoch": 1.8987182362378596, "grad_norm": 0.1569230854511261, "learning_rate": 3.671297574140522e-05, "loss": 0.6034, "mean_token_accuracy": 0.8149823360145092, "num_tokens": 658658007.0, "step": 20637 }, { "entropy": 0.5959390513598919, "epoch": 1.8988102426093008, "grad_norm": 0.14875437319278717, "learning_rate": 3.670990891526359e-05, "loss": 0.5782, "mean_token_accuracy": 0.8198520988225937, "num_tokens": 658689909.0, "step": 20638 }, { "entropy": 0.7056759772822261, "epoch": 1.898902248980742, "grad_norm": 0.15649311244487762, "learning_rate": 3.670684208912197e-05, "loss": 0.6953, "mean_token_accuracy": 0.7897915989160538, "num_tokens": 658722406.0, "step": 20639 }, { "entropy": 0.575776819139719, "epoch": 1.898994255352183, "grad_norm": 0.15198540687561035, "learning_rate": 3.670377526298034e-05, "loss": 0.5521, "mean_token_accuracy": 0.8265110477805138, "num_tokens": 658754146.0, "step": 20640 }, { "entropy": 0.4802215229719877, "epoch": 1.8990862617236244, "grad_norm": 0.1373167783021927, "learning_rate": 3.670070843683872e-05, "loss": 0.4689, "mean_token_accuracy": 0.8545407466590405, "num_tokens": 658786639.0, "step": 20641 }, { "entropy": 0.533205577172339, "epoch": 1.8991782680950657, "grad_norm": 0.1490245759487152, "learning_rate": 3.669764161069709e-05, "loss": 0.5227, "mean_token_accuracy": 0.8347936235368252, "num_tokens": 658818334.0, "step": 20642 }, { "entropy": 0.6347825471311808, "epoch": 1.8992702744665069, "grad_norm": 0.15952257812023163, "learning_rate": 3.6694574784555467e-05, "loss": 0.6382, "mean_token_accuracy": 0.8038492314517498, "num_tokens": 658850002.0, "step": 20643 }, { "entropy": 0.6089100139215589, "epoch": 1.899362280837948, "grad_norm": 0.15627069771289825, "learning_rate": 3.669150795841384e-05, "loss": 0.6053, "mean_token_accuracy": 0.8135153502225876, "num_tokens": 658882328.0, "step": 20644 }, { "entropy": 0.5355602246709168, "epoch": 1.8994542872093891, "grad_norm": 0.15103387832641602, "learning_rate": 3.668844113227221e-05, "loss": 0.52, "mean_token_accuracy": 0.8355474658310413, "num_tokens": 658914865.0, "step": 20645 }, { "entropy": 0.5561314518563449, "epoch": 1.8995462935808305, "grad_norm": 0.14610819518566132, "learning_rate": 3.668537430613059e-05, "loss": 0.5397, "mean_token_accuracy": 0.8347977101802826, "num_tokens": 658946694.0, "step": 20646 }, { "entropy": 0.5952125675976276, "epoch": 1.8996382999522718, "grad_norm": 0.14731496572494507, "learning_rate": 3.668230747998896e-05, "loss": 0.5895, "mean_token_accuracy": 0.816066849976778, "num_tokens": 658978833.0, "step": 20647 }, { "entropy": 0.4543672427535057, "epoch": 1.899730306323713, "grad_norm": 0.14360125362873077, "learning_rate": 3.667924065384733e-05, "loss": 0.4454, "mean_token_accuracy": 0.8643513806164265, "num_tokens": 659009599.0, "step": 20648 }, { "entropy": 0.5461054155603051, "epoch": 1.8998223126951541, "grad_norm": 0.15150175988674164, "learning_rate": 3.667617382770571e-05, "loss": 0.5306, "mean_token_accuracy": 0.8399771563708782, "num_tokens": 659041158.0, "step": 20649 }, { "entropy": 0.5253457040525973, "epoch": 1.8999143190665952, "grad_norm": 0.141582652926445, "learning_rate": 3.667310700156408e-05, "loss": 0.524, "mean_token_accuracy": 0.8375244103372097, "num_tokens": 659073842.0, "step": 20650 }, { "entropy": 0.6037341915071011, "epoch": 1.9000063254380366, "grad_norm": 0.1536523848772049, "learning_rate": 3.667004017542246e-05, "loss": 0.5947, "mean_token_accuracy": 0.8180810660123825, "num_tokens": 659105508.0, "step": 20651 }, { "entropy": 0.5112867299467325, "epoch": 1.900098331809478, "grad_norm": 0.14839085936546326, "learning_rate": 3.666697334928083e-05, "loss": 0.4913, "mean_token_accuracy": 0.8466464318335056, "num_tokens": 659137845.0, "step": 20652 }, { "entropy": 0.6926206517964602, "epoch": 1.900190338180919, "grad_norm": 0.16569411754608154, "learning_rate": 3.6663906523139206e-05, "loss": 0.6848, "mean_token_accuracy": 0.7913794480264187, "num_tokens": 659168924.0, "step": 20653 }, { "entropy": 0.6296077384613454, "epoch": 1.9002823445523602, "grad_norm": 0.1521598994731903, "learning_rate": 3.666083969699758e-05, "loss": 0.6206, "mean_token_accuracy": 0.8109196238219738, "num_tokens": 659201361.0, "step": 20654 }, { "entropy": 0.6904521435499191, "epoch": 1.9003743509238014, "grad_norm": 0.1586548089981079, "learning_rate": 3.6657772870855956e-05, "loss": 0.6882, "mean_token_accuracy": 0.7914330959320068, "num_tokens": 659233394.0, "step": 20655 }, { "entropy": 0.6947105955332518, "epoch": 1.9004663572952427, "grad_norm": 0.15980742871761322, "learning_rate": 3.6654706044714323e-05, "loss": 0.696, "mean_token_accuracy": 0.7883718870580196, "num_tokens": 659265499.0, "step": 20656 }, { "entropy": 0.6438021454960108, "epoch": 1.900558363666684, "grad_norm": 0.16080279648303986, "learning_rate": 3.6651639218572705e-05, "loss": 0.631, "mean_token_accuracy": 0.8088885433971882, "num_tokens": 659297476.0, "step": 20657 }, { "entropy": 0.6416181586682796, "epoch": 1.9006503700381252, "grad_norm": 0.15341439843177795, "learning_rate": 3.664857239243107e-05, "loss": 0.6382, "mean_token_accuracy": 0.8005954697728157, "num_tokens": 659329534.0, "step": 20658 }, { "entropy": 0.6329493634402752, "epoch": 1.9007423764095663, "grad_norm": 0.15505559742450714, "learning_rate": 3.6645505566289454e-05, "loss": 0.6218, "mean_token_accuracy": 0.8111184276640415, "num_tokens": 659361390.0, "step": 20659 }, { "entropy": 0.6603962760418653, "epoch": 1.9008343827810075, "grad_norm": 0.16291923820972443, "learning_rate": 3.664243874014782e-05, "loss": 0.6379, "mean_token_accuracy": 0.8045843243598938, "num_tokens": 659393147.0, "step": 20660 }, { "entropy": 0.5856500398367643, "epoch": 1.9009263891524488, "grad_norm": 0.15249978005886078, "learning_rate": 3.66393719140062e-05, "loss": 0.5769, "mean_token_accuracy": 0.8229150772094727, "num_tokens": 659424900.0, "step": 20661 }, { "entropy": 0.5535024385899305, "epoch": 1.9010183955238902, "grad_norm": 0.14492355287075043, "learning_rate": 3.663630508786457e-05, "loss": 0.5343, "mean_token_accuracy": 0.83536496758461, "num_tokens": 659456666.0, "step": 20662 }, { "entropy": 0.556367427110672, "epoch": 1.9011104018953313, "grad_norm": 0.14870116114616394, "learning_rate": 3.6633238261722946e-05, "loss": 0.5427, "mean_token_accuracy": 0.8285738080739975, "num_tokens": 659488345.0, "step": 20663 }, { "entropy": 0.5273566003888845, "epoch": 1.9012024082667724, "grad_norm": 0.14718790352344513, "learning_rate": 3.663017143558132e-05, "loss": 0.514, "mean_token_accuracy": 0.8402637839317322, "num_tokens": 659520455.0, "step": 20664 }, { "entropy": 0.5807982143014669, "epoch": 1.9012944146382136, "grad_norm": 0.15069274604320526, "learning_rate": 3.6627104609439695e-05, "loss": 0.568, "mean_token_accuracy": 0.8238515108823776, "num_tokens": 659552114.0, "step": 20665 }, { "entropy": 0.613302806392312, "epoch": 1.901386421009655, "grad_norm": 0.16272146999835968, "learning_rate": 3.662403778329806e-05, "loss": 0.6196, "mean_token_accuracy": 0.8095227256417274, "num_tokens": 659583765.0, "step": 20666 }, { "entropy": 0.6213557980954647, "epoch": 1.9014784273810963, "grad_norm": 0.1603720635175705, "learning_rate": 3.6620970957156445e-05, "loss": 0.6149, "mean_token_accuracy": 0.8123243302106857, "num_tokens": 659614498.0, "step": 20667 }, { "entropy": 0.6320752631872892, "epoch": 1.9015704337525374, "grad_norm": 0.15560515224933624, "learning_rate": 3.661790413101481e-05, "loss": 0.6282, "mean_token_accuracy": 0.8079050406813622, "num_tokens": 659646269.0, "step": 20668 }, { "entropy": 0.5490120146423578, "epoch": 1.9016624401239786, "grad_norm": 0.14983250200748444, "learning_rate": 3.661483730487319e-05, "loss": 0.556, "mean_token_accuracy": 0.8296320885419846, "num_tokens": 659678240.0, "step": 20669 }, { "entropy": 0.5876326505094767, "epoch": 1.9017544464954197, "grad_norm": 0.15471157431602478, "learning_rate": 3.661177047873156e-05, "loss": 0.5833, "mean_token_accuracy": 0.8233029730618, "num_tokens": 659710428.0, "step": 20670 }, { "entropy": 0.5677379835397005, "epoch": 1.901846452866861, "grad_norm": 0.15011858940124512, "learning_rate": 3.6608703652589936e-05, "loss": 0.5648, "mean_token_accuracy": 0.8231402672827244, "num_tokens": 659742246.0, "step": 20671 }, { "entropy": 0.7030194029211998, "epoch": 1.9019384592383024, "grad_norm": 0.16938209533691406, "learning_rate": 3.660563682644831e-05, "loss": 0.6928, "mean_token_accuracy": 0.7926535904407501, "num_tokens": 659773551.0, "step": 20672 }, { "entropy": 0.5123208449222147, "epoch": 1.9020304656097435, "grad_norm": 0.1427135020494461, "learning_rate": 3.6602570000306686e-05, "loss": 0.4953, "mean_token_accuracy": 0.8480687513947487, "num_tokens": 659805590.0, "step": 20673 }, { "entropy": 0.6011566957458854, "epoch": 1.9021224719811847, "grad_norm": 0.15752023458480835, "learning_rate": 3.6599503174165054e-05, "loss": 0.5837, "mean_token_accuracy": 0.821788415312767, "num_tokens": 659837900.0, "step": 20674 }, { "entropy": 0.5692737204954028, "epoch": 1.9022144783526258, "grad_norm": 0.14706464111804962, "learning_rate": 3.6596436348023435e-05, "loss": 0.5608, "mean_token_accuracy": 0.828201524913311, "num_tokens": 659870229.0, "step": 20675 }, { "entropy": 0.5886263551656157, "epoch": 1.9023064847240672, "grad_norm": 0.1512494832277298, "learning_rate": 3.65933695218818e-05, "loss": 0.575, "mean_token_accuracy": 0.8222513757646084, "num_tokens": 659902362.0, "step": 20676 }, { "entropy": 0.567823420278728, "epoch": 1.9023984910955085, "grad_norm": 0.14927491545677185, "learning_rate": 3.659030269574018e-05, "loss": 0.5563, "mean_token_accuracy": 0.8273273073136806, "num_tokens": 659934327.0, "step": 20677 }, { "entropy": 0.7373795006424189, "epoch": 1.9024904974669496, "grad_norm": 0.16123835742473602, "learning_rate": 3.658723586959855e-05, "loss": 0.7378, "mean_token_accuracy": 0.7768840603530407, "num_tokens": 659966837.0, "step": 20678 }, { "entropy": 0.6424840446561575, "epoch": 1.9025825038383908, "grad_norm": 0.15028497576713562, "learning_rate": 3.658416904345693e-05, "loss": 0.6268, "mean_token_accuracy": 0.8120489045977592, "num_tokens": 659998898.0, "step": 20679 }, { "entropy": 0.6448180838488042, "epoch": 1.902674510209832, "grad_norm": 0.1590096652507782, "learning_rate": 3.65811022173153e-05, "loss": 0.6354, "mean_token_accuracy": 0.8051482029259205, "num_tokens": 660030417.0, "step": 20680 }, { "entropy": 0.4547608639113605, "epoch": 1.9027665165812733, "grad_norm": 0.13626274466514587, "learning_rate": 3.6578035391173676e-05, "loss": 0.4469, "mean_token_accuracy": 0.8614227995276451, "num_tokens": 660062812.0, "step": 20681 }, { "entropy": 0.65650365781039, "epoch": 1.9028585229527146, "grad_norm": 0.15867707133293152, "learning_rate": 3.657496856503205e-05, "loss": 0.6451, "mean_token_accuracy": 0.8053614757955074, "num_tokens": 660094564.0, "step": 20682 }, { "entropy": 0.6235310668125749, "epoch": 1.9029505293241558, "grad_norm": 0.15345096588134766, "learning_rate": 3.6571901738890425e-05, "loss": 0.6156, "mean_token_accuracy": 0.8084639385342598, "num_tokens": 660126881.0, "step": 20683 }, { "entropy": 0.6717018079943955, "epoch": 1.903042535695597, "grad_norm": 0.1627083718776703, "learning_rate": 3.65688349127488e-05, "loss": 0.6624, "mean_token_accuracy": 0.794872235506773, "num_tokens": 660158329.0, "step": 20684 }, { "entropy": 0.5326972482725978, "epoch": 1.903134542067038, "grad_norm": 0.147065207362175, "learning_rate": 3.6565768086607175e-05, "loss": 0.5135, "mean_token_accuracy": 0.8399796448647976, "num_tokens": 660190852.0, "step": 20685 }, { "entropy": 0.5514343548566103, "epoch": 1.9032265484384794, "grad_norm": 0.14574158191680908, "learning_rate": 3.656270126046555e-05, "loss": 0.5318, "mean_token_accuracy": 0.8368417657911777, "num_tokens": 660222203.0, "step": 20686 }, { "entropy": 0.5378538286313415, "epoch": 1.9033185548099207, "grad_norm": 0.1456189602613449, "learning_rate": 3.655963443432392e-05, "loss": 0.5141, "mean_token_accuracy": 0.8356646969914436, "num_tokens": 660253681.0, "step": 20687 }, { "entropy": 0.5578897651284933, "epoch": 1.9034105611813619, "grad_norm": 0.1484718918800354, "learning_rate": 3.65565676081823e-05, "loss": 0.5526, "mean_token_accuracy": 0.8314306475222111, "num_tokens": 660285659.0, "step": 20688 }, { "entropy": 0.5828864593058825, "epoch": 1.903502567552803, "grad_norm": 0.15906623005867004, "learning_rate": 3.6553500782040666e-05, "loss": 0.568, "mean_token_accuracy": 0.8206850253045559, "num_tokens": 660317511.0, "step": 20689 }, { "entropy": 0.6080256353598088, "epoch": 1.9035945739242441, "grad_norm": 0.15274332463741302, "learning_rate": 3.655043395589904e-05, "loss": 0.5916, "mean_token_accuracy": 0.816921878606081, "num_tokens": 660349698.0, "step": 20690 }, { "entropy": 0.5122081632725894, "epoch": 1.9036865802956855, "grad_norm": 0.14502263069152832, "learning_rate": 3.6547367129757416e-05, "loss": 0.4931, "mean_token_accuracy": 0.8421926125884056, "num_tokens": 660381061.0, "step": 20691 }, { "entropy": 0.5970144339371473, "epoch": 1.9037785866671268, "grad_norm": 0.17512939870357513, "learning_rate": 3.654430030361579e-05, "loss": 0.5987, "mean_token_accuracy": 0.8181188777089119, "num_tokens": 660413480.0, "step": 20692 }, { "entropy": 0.5831502266228199, "epoch": 1.903870593038568, "grad_norm": 0.15681038796901703, "learning_rate": 3.6541233477474165e-05, "loss": 0.574, "mean_token_accuracy": 0.8249235078692436, "num_tokens": 660445458.0, "step": 20693 }, { "entropy": 0.7357718329876661, "epoch": 1.9039625994100091, "grad_norm": 0.16524624824523926, "learning_rate": 3.653816665133254e-05, "loss": 0.738, "mean_token_accuracy": 0.783083364367485, "num_tokens": 660478092.0, "step": 20694 }, { "entropy": 0.7157076932489872, "epoch": 1.9040546057814502, "grad_norm": 0.16300219297409058, "learning_rate": 3.653509982519091e-05, "loss": 0.7067, "mean_token_accuracy": 0.7843960709869862, "num_tokens": 660509401.0, "step": 20695 }, { "entropy": 0.5687329545617104, "epoch": 1.9041466121528916, "grad_norm": 0.1488109529018402, "learning_rate": 3.653203299904929e-05, "loss": 0.5648, "mean_token_accuracy": 0.8292624317109585, "num_tokens": 660540033.0, "step": 20696 }, { "entropy": 0.5617192341014743, "epoch": 1.904238618524333, "grad_norm": 0.15662935376167297, "learning_rate": 3.652896617290766e-05, "loss": 0.5457, "mean_token_accuracy": 0.8276923820376396, "num_tokens": 660571630.0, "step": 20697 }, { "entropy": 0.6351551841944456, "epoch": 1.904330624895774, "grad_norm": 0.1556495875120163, "learning_rate": 3.652589934676603e-05, "loss": 0.625, "mean_token_accuracy": 0.8096549957990646, "num_tokens": 660604145.0, "step": 20698 }, { "entropy": 0.6621757531538606, "epoch": 1.9044226312672152, "grad_norm": 0.16031892597675323, "learning_rate": 3.6522832520624406e-05, "loss": 0.6479, "mean_token_accuracy": 0.8027179129421711, "num_tokens": 660636180.0, "step": 20699 }, { "entropy": 0.6600587135180831, "epoch": 1.9045146376386564, "grad_norm": 0.1523679494857788, "learning_rate": 3.651976569448278e-05, "loss": 0.6424, "mean_token_accuracy": 0.8064951971173286, "num_tokens": 660668407.0, "step": 20700 }, { "entropy": 0.6146310660988092, "epoch": 1.9046066440100977, "grad_norm": 0.15669173002243042, "learning_rate": 3.6516698868341155e-05, "loss": 0.6008, "mean_token_accuracy": 0.8150413557887077, "num_tokens": 660699864.0, "step": 20701 }, { "entropy": 0.5399672295898199, "epoch": 1.904698650381539, "grad_norm": 0.1481713503599167, "learning_rate": 3.651363204219953e-05, "loss": 0.5175, "mean_token_accuracy": 0.8374328389763832, "num_tokens": 660732057.0, "step": 20702 }, { "entropy": 0.5755283539183438, "epoch": 1.9047906567529802, "grad_norm": 0.14631886780261993, "learning_rate": 3.6510565216057905e-05, "loss": 0.5642, "mean_token_accuracy": 0.8290458396077156, "num_tokens": 660764178.0, "step": 20703 }, { "entropy": 0.6221381165087223, "epoch": 1.9048826631244213, "grad_norm": 0.15118475258350372, "learning_rate": 3.650749838991628e-05, "loss": 0.6065, "mean_token_accuracy": 0.8119752965867519, "num_tokens": 660796464.0, "step": 20704 }, { "entropy": 0.5736597869545221, "epoch": 1.9049746694958625, "grad_norm": 0.15819095075130463, "learning_rate": 3.650443156377465e-05, "loss": 0.5569, "mean_token_accuracy": 0.8227775059640408, "num_tokens": 660827767.0, "step": 20705 }, { "entropy": 0.5441023744642735, "epoch": 1.9050666758673038, "grad_norm": 0.14776651561260223, "learning_rate": 3.650136473763303e-05, "loss": 0.5236, "mean_token_accuracy": 0.8359231539070606, "num_tokens": 660859680.0, "step": 20706 }, { "entropy": 0.6618937011808157, "epoch": 1.9051586822387452, "grad_norm": 0.15246707201004028, "learning_rate": 3.6498297911491397e-05, "loss": 0.6544, "mean_token_accuracy": 0.7974699027836323, "num_tokens": 660891641.0, "step": 20707 }, { "entropy": 0.6600274667143822, "epoch": 1.9052506886101863, "grad_norm": 0.16135403513908386, "learning_rate": 3.649523108534977e-05, "loss": 0.6522, "mean_token_accuracy": 0.7970578446984291, "num_tokens": 660922984.0, "step": 20708 }, { "entropy": 0.585596589371562, "epoch": 1.9053426949816274, "grad_norm": 0.14864306151866913, "learning_rate": 3.6492164259208146e-05, "loss": 0.5666, "mean_token_accuracy": 0.8249100297689438, "num_tokens": 660954802.0, "step": 20709 }, { "entropy": 0.5879478100687265, "epoch": 1.9054347013530686, "grad_norm": 0.15778301656246185, "learning_rate": 3.648909743306652e-05, "loss": 0.5818, "mean_token_accuracy": 0.8213910236954689, "num_tokens": 660986468.0, "step": 20710 }, { "entropy": 0.6742158085107803, "epoch": 1.90552670772451, "grad_norm": 0.16355456411838531, "learning_rate": 3.6486030606924895e-05, "loss": 0.6598, "mean_token_accuracy": 0.7993843294680119, "num_tokens": 661017441.0, "step": 20711 }, { "entropy": 0.5672491025179625, "epoch": 1.9056187140959513, "grad_norm": 0.15535174310207367, "learning_rate": 3.648296378078327e-05, "loss": 0.5473, "mean_token_accuracy": 0.8297860957682133, "num_tokens": 661049375.0, "step": 20712 }, { "entropy": 0.5742563407402486, "epoch": 1.9057107204673924, "grad_norm": 0.16072697937488556, "learning_rate": 3.6479896954641644e-05, "loss": 0.5642, "mean_token_accuracy": 0.827045138925314, "num_tokens": 661079922.0, "step": 20713 }, { "entropy": 0.6488204495981336, "epoch": 1.9058027268388336, "grad_norm": 0.1551344096660614, "learning_rate": 3.647683012850002e-05, "loss": 0.6368, "mean_token_accuracy": 0.8042083159089088, "num_tokens": 661111918.0, "step": 20714 }, { "entropy": 0.568367863073945, "epoch": 1.9058947332102747, "grad_norm": 0.1577272266149521, "learning_rate": 3.6473763302358394e-05, "loss": 0.5645, "mean_token_accuracy": 0.8232818469405174, "num_tokens": 661143322.0, "step": 20715 }, { "entropy": 0.5031783208251, "epoch": 1.905986739581716, "grad_norm": 0.14773331582546234, "learning_rate": 3.647069647621676e-05, "loss": 0.4975, "mean_token_accuracy": 0.8454015552997589, "num_tokens": 661175374.0, "step": 20716 }, { "entropy": 0.5823043123818934, "epoch": 1.9060787459531574, "grad_norm": 0.15332449972629547, "learning_rate": 3.646762965007514e-05, "loss": 0.5749, "mean_token_accuracy": 0.8279526680707932, "num_tokens": 661207634.0, "step": 20717 }, { "entropy": 0.4969023400917649, "epoch": 1.9061707523245985, "grad_norm": 0.14469441771507263, "learning_rate": 3.646456282393351e-05, "loss": 0.4942, "mean_token_accuracy": 0.8481209240853786, "num_tokens": 661239648.0, "step": 20718 }, { "entropy": 0.6210073558613658, "epoch": 1.9062627586960397, "grad_norm": 0.15263481438159943, "learning_rate": 3.646149599779189e-05, "loss": 0.6115, "mean_token_accuracy": 0.8128578290343285, "num_tokens": 661271219.0, "step": 20719 }, { "entropy": 0.5953887607902288, "epoch": 1.9063547650674808, "grad_norm": 0.1461346596479416, "learning_rate": 3.645842917165026e-05, "loss": 0.5725, "mean_token_accuracy": 0.8232212737202644, "num_tokens": 661303602.0, "step": 20720 }, { "entropy": 0.6475308649241924, "epoch": 1.9064467714389222, "grad_norm": 0.1603531539440155, "learning_rate": 3.6455362345508635e-05, "loss": 0.6344, "mean_token_accuracy": 0.8023786656558514, "num_tokens": 661335561.0, "step": 20721 }, { "entropy": 0.6683901026844978, "epoch": 1.9065387778103635, "grad_norm": 0.16788670420646667, "learning_rate": 3.645229551936701e-05, "loss": 0.6683, "mean_token_accuracy": 0.7985051572322845, "num_tokens": 661367861.0, "step": 20722 }, { "entropy": 0.6816346067935228, "epoch": 1.9066307841818046, "grad_norm": 0.15687115490436554, "learning_rate": 3.6449228693225384e-05, "loss": 0.6701, "mean_token_accuracy": 0.796792957931757, "num_tokens": 661399979.0, "step": 20723 }, { "entropy": 0.5239997655153275, "epoch": 1.9067227905532458, "grad_norm": 0.14564134180545807, "learning_rate": 3.644616186708376e-05, "loss": 0.5191, "mean_token_accuracy": 0.8368933163583279, "num_tokens": 661432653.0, "step": 20724 }, { "entropy": 0.5996464090421796, "epoch": 1.906814796924687, "grad_norm": 0.15523388981819153, "learning_rate": 3.6443095040942133e-05, "loss": 0.589, "mean_token_accuracy": 0.8182047940790653, "num_tokens": 661464787.0, "step": 20725 }, { "entropy": 0.5948739424347878, "epoch": 1.9069068032961283, "grad_norm": 0.15587550401687622, "learning_rate": 3.64400282148005e-05, "loss": 0.5973, "mean_token_accuracy": 0.8165260441601276, "num_tokens": 661496868.0, "step": 20726 }, { "entropy": 0.5703207310289145, "epoch": 1.9069988096675696, "grad_norm": 0.1431388407945633, "learning_rate": 3.643696138865888e-05, "loss": 0.5645, "mean_token_accuracy": 0.8238419480621815, "num_tokens": 661529238.0, "step": 20727 }, { "entropy": 0.5147719085216522, "epoch": 1.9070908160390108, "grad_norm": 0.15045678615570068, "learning_rate": 3.643389456251725e-05, "loss": 0.502, "mean_token_accuracy": 0.8451012633740902, "num_tokens": 661561422.0, "step": 20728 }, { "entropy": 0.5446175318211317, "epoch": 1.907182822410452, "grad_norm": 0.14929194748401642, "learning_rate": 3.6430827736375625e-05, "loss": 0.5308, "mean_token_accuracy": 0.834351722151041, "num_tokens": 661593421.0, "step": 20729 }, { "entropy": 0.47889124508947134, "epoch": 1.907274828781893, "grad_norm": 0.14531297981739044, "learning_rate": 3.6427760910234e-05, "loss": 0.4729, "mean_token_accuracy": 0.8543171398341656, "num_tokens": 661625559.0, "step": 20730 }, { "entropy": 0.6025033770129085, "epoch": 1.9073668351533344, "grad_norm": 0.15299227833747864, "learning_rate": 3.6424694084092375e-05, "loss": 0.5882, "mean_token_accuracy": 0.8181763701140881, "num_tokens": 661657351.0, "step": 20731 }, { "entropy": 0.6100777573883533, "epoch": 1.9074588415247757, "grad_norm": 0.15540307760238647, "learning_rate": 3.642162725795075e-05, "loss": 0.5988, "mean_token_accuracy": 0.8095560297369957, "num_tokens": 661688501.0, "step": 20732 }, { "entropy": 0.5986000839620829, "epoch": 1.9075508478962169, "grad_norm": 0.15175263583660126, "learning_rate": 3.6418560431809124e-05, "loss": 0.5938, "mean_token_accuracy": 0.8164215572178364, "num_tokens": 661721124.0, "step": 20733 }, { "entropy": 0.57364715449512, "epoch": 1.907642854267658, "grad_norm": 0.1578178107738495, "learning_rate": 3.641549360566749e-05, "loss": 0.557, "mean_token_accuracy": 0.8273843042552471, "num_tokens": 661752833.0, "step": 20734 }, { "entropy": 0.4702920289710164, "epoch": 1.9077348606390991, "grad_norm": 0.14278081059455872, "learning_rate": 3.641242677952587e-05, "loss": 0.4595, "mean_token_accuracy": 0.8547913134098053, "num_tokens": 661784978.0, "step": 20735 }, { "entropy": 0.679161760956049, "epoch": 1.9078268670105405, "grad_norm": 0.16216504573822021, "learning_rate": 3.640935995338424e-05, "loss": 0.6842, "mean_token_accuracy": 0.790106438100338, "num_tokens": 661816224.0, "step": 20736 }, { "entropy": 0.6430536415427923, "epoch": 1.9079188733819819, "grad_norm": 0.15668848156929016, "learning_rate": 3.6406293127242616e-05, "loss": 0.6362, "mean_token_accuracy": 0.8036785870790482, "num_tokens": 661848286.0, "step": 20737 }, { "entropy": 0.606288536451757, "epoch": 1.908010879753423, "grad_norm": 0.15735051035881042, "learning_rate": 3.640322630110099e-05, "loss": 0.6019, "mean_token_accuracy": 0.8199121132493019, "num_tokens": 661880750.0, "step": 20738 }, { "entropy": 0.7157243546098471, "epoch": 1.9081028861248641, "grad_norm": 0.16286148130893707, "learning_rate": 3.6400159474959365e-05, "loss": 0.7196, "mean_token_accuracy": 0.7786234505474567, "num_tokens": 661912077.0, "step": 20739 }, { "entropy": 0.695396775379777, "epoch": 1.9081948924963053, "grad_norm": 0.16151022911071777, "learning_rate": 3.639709264881774e-05, "loss": 0.6776, "mean_token_accuracy": 0.7912869788706303, "num_tokens": 661943464.0, "step": 20740 }, { "entropy": 0.6156779676675797, "epoch": 1.9082868988677466, "grad_norm": 0.1562749594449997, "learning_rate": 3.6394025822676114e-05, "loss": 0.603, "mean_token_accuracy": 0.8156570717692375, "num_tokens": 661975487.0, "step": 20741 }, { "entropy": 0.6582894325256348, "epoch": 1.908378905239188, "grad_norm": 0.15494908392429352, "learning_rate": 3.639095899653448e-05, "loss": 0.6388, "mean_token_accuracy": 0.8047960363328457, "num_tokens": 662007656.0, "step": 20742 }, { "entropy": 0.6093619363382459, "epoch": 1.908470911610629, "grad_norm": 0.15366263687610626, "learning_rate": 3.6387892170392864e-05, "loss": 0.5919, "mean_token_accuracy": 0.817861270159483, "num_tokens": 662040062.0, "step": 20743 }, { "entropy": 0.636895002797246, "epoch": 1.9085629179820702, "grad_norm": 0.15458227694034576, "learning_rate": 3.638482534425124e-05, "loss": 0.6161, "mean_token_accuracy": 0.808959349989891, "num_tokens": 662072271.0, "step": 20744 }, { "entropy": 0.6152244871482253, "epoch": 1.9086549243535114, "grad_norm": 0.1513753980398178, "learning_rate": 3.638175851810961e-05, "loss": 0.5944, "mean_token_accuracy": 0.8181249238550663, "num_tokens": 662104470.0, "step": 20745 }, { "entropy": 0.49500284250825644, "epoch": 1.9087469307249527, "grad_norm": 0.1434074193239212, "learning_rate": 3.637869169196799e-05, "loss": 0.4708, "mean_token_accuracy": 0.8502294421195984, "num_tokens": 662135840.0, "step": 20746 }, { "entropy": 0.759597834199667, "epoch": 1.908838937096394, "grad_norm": 0.1609869748353958, "learning_rate": 3.6375624865826355e-05, "loss": 0.7479, "mean_token_accuracy": 0.7716591507196426, "num_tokens": 662167728.0, "step": 20747 }, { "entropy": 0.6643054932355881, "epoch": 1.9089309434678352, "grad_norm": 0.15835660696029663, "learning_rate": 3.637255803968474e-05, "loss": 0.6583, "mean_token_accuracy": 0.8018292337656021, "num_tokens": 662200125.0, "step": 20748 }, { "entropy": 0.5873083891347051, "epoch": 1.9090229498392763, "grad_norm": 0.15578241646289825, "learning_rate": 3.6369491213543105e-05, "loss": 0.5916, "mean_token_accuracy": 0.8213223665952682, "num_tokens": 662232099.0, "step": 20749 }, { "entropy": 0.7538289036601782, "epoch": 1.9091149562107175, "grad_norm": 0.17036183178424835, "learning_rate": 3.636642438740148e-05, "loss": 0.7402, "mean_token_accuracy": 0.7745286747813225, "num_tokens": 662263440.0, "step": 20750 }, { "entropy": 0.5630215471610427, "epoch": 1.9092069625821588, "grad_norm": 0.14950576424598694, "learning_rate": 3.6363357561259854e-05, "loss": 0.549, "mean_token_accuracy": 0.8290915824472904, "num_tokens": 662295358.0, "step": 20751 }, { "entropy": 0.6553228739649057, "epoch": 1.9092989689536002, "grad_norm": 0.16551573574543, "learning_rate": 3.636029073511823e-05, "loss": 0.65, "mean_token_accuracy": 0.7993959076702595, "num_tokens": 662326713.0, "step": 20752 }, { "entropy": 0.6528066676110029, "epoch": 1.9093909753250413, "grad_norm": 0.15152651071548462, "learning_rate": 3.63572239089766e-05, "loss": 0.6414, "mean_token_accuracy": 0.8025261722505093, "num_tokens": 662358974.0, "step": 20753 }, { "entropy": 0.6554160080850124, "epoch": 1.9094829816964825, "grad_norm": 0.16068878769874573, "learning_rate": 3.635415708283498e-05, "loss": 0.6513, "mean_token_accuracy": 0.7990160770714283, "num_tokens": 662391016.0, "step": 20754 }, { "entropy": 0.5852353116497397, "epoch": 1.9095749880679236, "grad_norm": 0.15413948893547058, "learning_rate": 3.6351090256693346e-05, "loss": 0.5605, "mean_token_accuracy": 0.8287800699472427, "num_tokens": 662423478.0, "step": 20755 }, { "entropy": 0.631497198715806, "epoch": 1.909666994439365, "grad_norm": 0.15745662152767181, "learning_rate": 3.634802343055173e-05, "loss": 0.6363, "mean_token_accuracy": 0.8084511607885361, "num_tokens": 662455603.0, "step": 20756 }, { "entropy": 0.5869254134595394, "epoch": 1.9097590008108063, "grad_norm": 0.1502452939748764, "learning_rate": 3.6344956604410095e-05, "loss": 0.5837, "mean_token_accuracy": 0.8194271512329578, "num_tokens": 662487830.0, "step": 20757 }, { "entropy": 0.5715118392836303, "epoch": 1.9098510071822474, "grad_norm": 0.14711102843284607, "learning_rate": 3.634188977826847e-05, "loss": 0.5565, "mean_token_accuracy": 0.8313761316239834, "num_tokens": 662520351.0, "step": 20758 }, { "entropy": 0.6356975547969341, "epoch": 1.9099430135536886, "grad_norm": 0.16045771539211273, "learning_rate": 3.6338822952126844e-05, "loss": 0.631, "mean_token_accuracy": 0.809759434312582, "num_tokens": 662552836.0, "step": 20759 }, { "entropy": 0.4110408639535308, "epoch": 1.9100350199251297, "grad_norm": 0.13886524736881256, "learning_rate": 3.633575612598522e-05, "loss": 0.3933, "mean_token_accuracy": 0.8754980638623238, "num_tokens": 662585111.0, "step": 20760 }, { "entropy": 0.5493309972807765, "epoch": 1.910127026296571, "grad_norm": 0.14520613849163055, "learning_rate": 3.6332689299843594e-05, "loss": 0.5331, "mean_token_accuracy": 0.8327051252126694, "num_tokens": 662616716.0, "step": 20761 }, { "entropy": 0.6639711037278175, "epoch": 1.9102190326680124, "grad_norm": 0.1614563912153244, "learning_rate": 3.632962247370197e-05, "loss": 0.6553, "mean_token_accuracy": 0.8018145374953747, "num_tokens": 662649103.0, "step": 20762 }, { "entropy": 0.5523843737319112, "epoch": 1.9103110390394535, "grad_norm": 0.14725236594676971, "learning_rate": 3.632655564756034e-05, "loss": 0.5362, "mean_token_accuracy": 0.835797481238842, "num_tokens": 662680856.0, "step": 20763 }, { "entropy": 0.5479537267237902, "epoch": 1.9104030454108947, "grad_norm": 0.1438441276550293, "learning_rate": 3.632348882141872e-05, "loss": 0.5316, "mean_token_accuracy": 0.8361682780086994, "num_tokens": 662713181.0, "step": 20764 }, { "entropy": 0.5904450742527843, "epoch": 1.9104950517823358, "grad_norm": 0.1518143117427826, "learning_rate": 3.6320421995277085e-05, "loss": 0.5831, "mean_token_accuracy": 0.8168175183236599, "num_tokens": 662744733.0, "step": 20765 }, { "entropy": 0.6305539160966873, "epoch": 1.9105870581537772, "grad_norm": 0.15854214131832123, "learning_rate": 3.631735516913547e-05, "loss": 0.63, "mean_token_accuracy": 0.8072301410138607, "num_tokens": 662776864.0, "step": 20766 }, { "entropy": 0.6112588811665773, "epoch": 1.9106790645252185, "grad_norm": 0.15522409975528717, "learning_rate": 3.6314288342993835e-05, "loss": 0.6013, "mean_token_accuracy": 0.8153468072414398, "num_tokens": 662808977.0, "step": 20767 }, { "entropy": 0.5238819057121873, "epoch": 1.9107710708966597, "grad_norm": 0.14569780230522156, "learning_rate": 3.631122151685221e-05, "loss": 0.5163, "mean_token_accuracy": 0.8412045128643513, "num_tokens": 662840498.0, "step": 20768 }, { "entropy": 0.5942734535783529, "epoch": 1.9108630772681008, "grad_norm": 0.15391118824481964, "learning_rate": 3.6308154690710584e-05, "loss": 0.5896, "mean_token_accuracy": 0.8198480606079102, "num_tokens": 662872846.0, "step": 20769 }, { "entropy": 0.65629150159657, "epoch": 1.910955083639542, "grad_norm": 0.15864552557468414, "learning_rate": 3.630508786456896e-05, "loss": 0.6536, "mean_token_accuracy": 0.7977937720716, "num_tokens": 662904500.0, "step": 20770 }, { "entropy": 0.5237622810527682, "epoch": 1.9110470900109833, "grad_norm": 0.1445273458957672, "learning_rate": 3.630202103842733e-05, "loss": 0.5187, "mean_token_accuracy": 0.8421185873448849, "num_tokens": 662937196.0, "step": 20771 }, { "entropy": 0.5261124595999718, "epoch": 1.9111390963824246, "grad_norm": 0.14491596817970276, "learning_rate": 3.629895421228571e-05, "loss": 0.5228, "mean_token_accuracy": 0.835280392318964, "num_tokens": 662968546.0, "step": 20772 }, { "entropy": 0.5673379618674517, "epoch": 1.9112311027538658, "grad_norm": 0.14730232954025269, "learning_rate": 3.6295887386144076e-05, "loss": 0.5522, "mean_token_accuracy": 0.8298962935805321, "num_tokens": 663001015.0, "step": 20773 }, { "entropy": 0.6336454371921718, "epoch": 1.911323109125307, "grad_norm": 0.15564782917499542, "learning_rate": 3.629282056000246e-05, "loss": 0.6128, "mean_token_accuracy": 0.815350204706192, "num_tokens": 663032264.0, "step": 20774 }, { "entropy": 0.6032504104077816, "epoch": 1.911415115496748, "grad_norm": 0.15602374076843262, "learning_rate": 3.628975373386083e-05, "loss": 0.5897, "mean_token_accuracy": 0.8159161098301411, "num_tokens": 663064353.0, "step": 20775 }, { "entropy": 0.609914667904377, "epoch": 1.9115071218681894, "grad_norm": 0.15022800862789154, "learning_rate": 3.62866869077192e-05, "loss": 0.5905, "mean_token_accuracy": 0.8177641965448856, "num_tokens": 663096324.0, "step": 20776 }, { "entropy": 0.5802504159510136, "epoch": 1.9115991282396307, "grad_norm": 0.1510176956653595, "learning_rate": 3.628362008157758e-05, "loss": 0.5593, "mean_token_accuracy": 0.827518105506897, "num_tokens": 663128465.0, "step": 20777 }, { "entropy": 0.6368914386257529, "epoch": 1.9116911346110719, "grad_norm": 0.15132759511470795, "learning_rate": 3.628055325543595e-05, "loss": 0.6239, "mean_token_accuracy": 0.807159561663866, "num_tokens": 663160863.0, "step": 20778 }, { "entropy": 0.6001093257218599, "epoch": 1.911783140982513, "grad_norm": 0.1466401219367981, "learning_rate": 3.627748642929433e-05, "loss": 0.5843, "mean_token_accuracy": 0.817955557256937, "num_tokens": 663193463.0, "step": 20779 }, { "entropy": 0.6670964257791638, "epoch": 1.9118751473539541, "grad_norm": 0.15641635656356812, "learning_rate": 3.62744196031527e-05, "loss": 0.6571, "mean_token_accuracy": 0.7982362359762192, "num_tokens": 663225577.0, "step": 20780 }, { "entropy": 0.6197549924254417, "epoch": 1.9119671537253955, "grad_norm": 0.15688279271125793, "learning_rate": 3.627135277701107e-05, "loss": 0.6125, "mean_token_accuracy": 0.8123319298028946, "num_tokens": 663257573.0, "step": 20781 }, { "entropy": 0.5833896473050117, "epoch": 1.9120591600968369, "grad_norm": 0.15014530718326569, "learning_rate": 3.626828595086945e-05, "loss": 0.5748, "mean_token_accuracy": 0.8205228261649609, "num_tokens": 663289059.0, "step": 20782 }, { "entropy": 0.6474110689014196, "epoch": 1.912151166468278, "grad_norm": 0.16308628022670746, "learning_rate": 3.626521912472782e-05, "loss": 0.6333, "mean_token_accuracy": 0.8017594888806343, "num_tokens": 663320204.0, "step": 20783 }, { "entropy": 0.5932575864717364, "epoch": 1.9122431728397191, "grad_norm": 0.15068233013153076, "learning_rate": 3.62621522985862e-05, "loss": 0.5877, "mean_token_accuracy": 0.8229363709688187, "num_tokens": 663352639.0, "step": 20784 }, { "entropy": 0.6903835218399763, "epoch": 1.9123351792111603, "grad_norm": 0.16816960275173187, "learning_rate": 3.625908547244457e-05, "loss": 0.6943, "mean_token_accuracy": 0.7897027991712093, "num_tokens": 663384415.0, "step": 20785 }, { "entropy": 0.594719251152128, "epoch": 1.9124271855826016, "grad_norm": 0.15275117754936218, "learning_rate": 3.625601864630294e-05, "loss": 0.5736, "mean_token_accuracy": 0.821839552372694, "num_tokens": 663416266.0, "step": 20786 }, { "entropy": 0.5895698331296444, "epoch": 1.912519191954043, "grad_norm": 0.15319792926311493, "learning_rate": 3.625295182016132e-05, "loss": 0.5737, "mean_token_accuracy": 0.822042178362608, "num_tokens": 663447961.0, "step": 20787 }, { "entropy": 0.521204493008554, "epoch": 1.912611198325484, "grad_norm": 0.14164239168167114, "learning_rate": 3.624988499401969e-05, "loss": 0.5045, "mean_token_accuracy": 0.8408844992518425, "num_tokens": 663479993.0, "step": 20788 }, { "entropy": 0.6037734467536211, "epoch": 1.9127032046969252, "grad_norm": 0.15483978390693665, "learning_rate": 3.6246818167878063e-05, "loss": 0.5895, "mean_token_accuracy": 0.8196497820317745, "num_tokens": 663511183.0, "step": 20789 }, { "entropy": 0.6406950573436916, "epoch": 1.9127952110683664, "grad_norm": 0.1583806574344635, "learning_rate": 3.624375134173644e-05, "loss": 0.6418, "mean_token_accuracy": 0.8063582144677639, "num_tokens": 663542808.0, "step": 20790 }, { "entropy": 0.6850486109033227, "epoch": 1.9128872174398077, "grad_norm": 0.16031908988952637, "learning_rate": 3.624068451559481e-05, "loss": 0.6798, "mean_token_accuracy": 0.7930860035121441, "num_tokens": 663574177.0, "step": 20791 }, { "entropy": 0.5772062949836254, "epoch": 1.912979223811249, "grad_norm": 0.15402601659297943, "learning_rate": 3.623761768945319e-05, "loss": 0.5751, "mean_token_accuracy": 0.8243962563574314, "num_tokens": 663605924.0, "step": 20792 }, { "entropy": 0.5439597126096487, "epoch": 1.9130712301826902, "grad_norm": 0.15370769798755646, "learning_rate": 3.623455086331156e-05, "loss": 0.5356, "mean_token_accuracy": 0.8324616551399231, "num_tokens": 663637444.0, "step": 20793 }, { "entropy": 0.6763143185526133, "epoch": 1.9131632365541313, "grad_norm": 0.17023012042045593, "learning_rate": 3.623148403716993e-05, "loss": 0.6715, "mean_token_accuracy": 0.7943612970411777, "num_tokens": 663667419.0, "step": 20794 }, { "entropy": 0.5223344508558512, "epoch": 1.9132552429255725, "grad_norm": 0.14668338000774384, "learning_rate": 3.622841721102831e-05, "loss": 0.5155, "mean_token_accuracy": 0.8423492349684238, "num_tokens": 663699441.0, "step": 20795 }, { "entropy": 0.6157304476946592, "epoch": 1.9133472492970138, "grad_norm": 0.14966455101966858, "learning_rate": 3.622535038488668e-05, "loss": 0.6194, "mean_token_accuracy": 0.8133971281349659, "num_tokens": 663731188.0, "step": 20796 }, { "entropy": 0.5668303892016411, "epoch": 1.9134392556684552, "grad_norm": 0.14693887531757355, "learning_rate": 3.6222283558745054e-05, "loss": 0.5575, "mean_token_accuracy": 0.826265424489975, "num_tokens": 663762840.0, "step": 20797 }, { "entropy": 0.5965250339359045, "epoch": 1.9135312620398963, "grad_norm": 0.14798180758953094, "learning_rate": 3.621921673260343e-05, "loss": 0.5805, "mean_token_accuracy": 0.825855229049921, "num_tokens": 663795544.0, "step": 20798 }, { "entropy": 0.5564404963515699, "epoch": 1.9136232684113375, "grad_norm": 0.14517885446548462, "learning_rate": 3.62161499064618e-05, "loss": 0.5324, "mean_token_accuracy": 0.8387274108827114, "num_tokens": 663828312.0, "step": 20799 }, { "entropy": 0.6099802125245333, "epoch": 1.9137152747827786, "grad_norm": 0.15677228569984436, "learning_rate": 3.621308308032018e-05, "loss": 0.5934, "mean_token_accuracy": 0.8184162862598896, "num_tokens": 663860124.0, "step": 20800 }, { "entropy": 0.5392262386158109, "epoch": 1.91380728115422, "grad_norm": 0.14580905437469482, "learning_rate": 3.621001625417855e-05, "loss": 0.5162, "mean_token_accuracy": 0.8389629386365414, "num_tokens": 663892047.0, "step": 20801 }, { "entropy": 0.6115954276174307, "epoch": 1.9138992875256613, "grad_norm": 0.1548423320055008, "learning_rate": 3.620694942803692e-05, "loss": 0.5977, "mean_token_accuracy": 0.8150379583239555, "num_tokens": 663924044.0, "step": 20802 }, { "entropy": 0.4735211683437228, "epoch": 1.9139912938971024, "grad_norm": 0.14209584891796112, "learning_rate": 3.62038826018953e-05, "loss": 0.4588, "mean_token_accuracy": 0.8585540987551212, "num_tokens": 663956103.0, "step": 20803 }, { "entropy": 0.5419161915779114, "epoch": 1.9140833002685436, "grad_norm": 0.1463947296142578, "learning_rate": 3.6200815775753676e-05, "loss": 0.5352, "mean_token_accuracy": 0.837164118885994, "num_tokens": 663988379.0, "step": 20804 }, { "entropy": 0.4378137132152915, "epoch": 1.9141753066399847, "grad_norm": 0.137457937002182, "learning_rate": 3.619774894961205e-05, "loss": 0.4144, "mean_token_accuracy": 0.867561336606741, "num_tokens": 664020657.0, "step": 20805 }, { "entropy": 0.5800305800512433, "epoch": 1.914267313011426, "grad_norm": 0.14977627992630005, "learning_rate": 3.6194682123470426e-05, "loss": 0.5618, "mean_token_accuracy": 0.827593021094799, "num_tokens": 664052519.0, "step": 20806 }, { "entropy": 0.5357607088517398, "epoch": 1.9143593193828674, "grad_norm": 0.14797943830490112, "learning_rate": 3.6191615297328794e-05, "loss": 0.5224, "mean_token_accuracy": 0.839631162583828, "num_tokens": 664084436.0, "step": 20807 }, { "entropy": 0.5903576985001564, "epoch": 1.9144513257543085, "grad_norm": 0.1583079844713211, "learning_rate": 3.6188548471187175e-05, "loss": 0.5845, "mean_token_accuracy": 0.8209549598395824, "num_tokens": 664116565.0, "step": 20808 }, { "entropy": 0.5648666471242905, "epoch": 1.9145433321257497, "grad_norm": 0.15385295450687408, "learning_rate": 3.618548164504554e-05, "loss": 0.5498, "mean_token_accuracy": 0.8279174938797951, "num_tokens": 664148599.0, "step": 20809 }, { "entropy": 0.484548585023731, "epoch": 1.9146353384971908, "grad_norm": 0.14743275940418243, "learning_rate": 3.618241481890392e-05, "loss": 0.4758, "mean_token_accuracy": 0.8479429706931114, "num_tokens": 664180255.0, "step": 20810 }, { "entropy": 0.584478129632771, "epoch": 1.9147273448686322, "grad_norm": 0.15095554292201996, "learning_rate": 3.617934799276229e-05, "loss": 0.5794, "mean_token_accuracy": 0.8245970271527767, "num_tokens": 664212051.0, "step": 20811 }, { "entropy": 0.5211787805892527, "epoch": 1.9148193512400735, "grad_norm": 0.15079954266548157, "learning_rate": 3.617628116662067e-05, "loss": 0.5175, "mean_token_accuracy": 0.8404637090861797, "num_tokens": 664244062.0, "step": 20812 }, { "entropy": 0.555401898920536, "epoch": 1.9149113576115147, "grad_norm": 0.14987237751483917, "learning_rate": 3.617321434047904e-05, "loss": 0.5469, "mean_token_accuracy": 0.8284975849092007, "num_tokens": 664276051.0, "step": 20813 }, { "entropy": 0.6222527623176575, "epoch": 1.9150033639829558, "grad_norm": 0.16163809597492218, "learning_rate": 3.6170147514337416e-05, "loss": 0.6089, "mean_token_accuracy": 0.8151163496077061, "num_tokens": 664307301.0, "step": 20814 }, { "entropy": 0.5762091763317585, "epoch": 1.915095370354397, "grad_norm": 0.14883089065551758, "learning_rate": 3.6167080688195784e-05, "loss": 0.5684, "mean_token_accuracy": 0.8247692845761776, "num_tokens": 664339557.0, "step": 20815 }, { "entropy": 0.5654682647436857, "epoch": 1.9151873767258383, "grad_norm": 0.1499491184949875, "learning_rate": 3.6164013862054165e-05, "loss": 0.5528, "mean_token_accuracy": 0.8234684988856316, "num_tokens": 664372061.0, "step": 20816 }, { "entropy": 0.6172684691846371, "epoch": 1.9152793830972796, "grad_norm": 0.1523122489452362, "learning_rate": 3.616094703591253e-05, "loss": 0.606, "mean_token_accuracy": 0.8130214065313339, "num_tokens": 664403520.0, "step": 20817 }, { "entropy": 0.5584589205682278, "epoch": 1.9153713894687208, "grad_norm": 0.1490156054496765, "learning_rate": 3.615788020977091e-05, "loss": 0.5417, "mean_token_accuracy": 0.8310836590826511, "num_tokens": 664435226.0, "step": 20818 }, { "entropy": 0.5167499617673457, "epoch": 1.915463395840162, "grad_norm": 0.14620670676231384, "learning_rate": 3.615481338362928e-05, "loss": 0.5148, "mean_token_accuracy": 0.839331604540348, "num_tokens": 664467692.0, "step": 20819 }, { "entropy": 0.5594063401222229, "epoch": 1.915555402211603, "grad_norm": 0.164520725607872, "learning_rate": 3.615174655748766e-05, "loss": 0.5491, "mean_token_accuracy": 0.8370840772986412, "num_tokens": 664499005.0, "step": 20820 }, { "entropy": 0.5210023587569594, "epoch": 1.9156474085830444, "grad_norm": 0.1468697190284729, "learning_rate": 3.614867973134603e-05, "loss": 0.5161, "mean_token_accuracy": 0.8410505689680576, "num_tokens": 664531236.0, "step": 20821 }, { "entropy": 0.6471519060432911, "epoch": 1.9157394149544857, "grad_norm": 0.15362541377544403, "learning_rate": 3.6145612905204407e-05, "loss": 0.6431, "mean_token_accuracy": 0.7996760830283165, "num_tokens": 664563767.0, "step": 20822 }, { "entropy": 0.6118771303445101, "epoch": 1.9158314213259269, "grad_norm": 0.15682508051395416, "learning_rate": 3.614254607906278e-05, "loss": 0.6066, "mean_token_accuracy": 0.8146712332963943, "num_tokens": 664595630.0, "step": 20823 }, { "entropy": 0.5934860212728381, "epoch": 1.915923427697368, "grad_norm": 0.15247978270053864, "learning_rate": 3.6139479252921156e-05, "loss": 0.5954, "mean_token_accuracy": 0.8160737603902817, "num_tokens": 664627935.0, "step": 20824 }, { "entropy": 0.5994682405143976, "epoch": 1.9160154340688091, "grad_norm": 0.15167376399040222, "learning_rate": 3.6136412426779524e-05, "loss": 0.5942, "mean_token_accuracy": 0.8168532848358154, "num_tokens": 664660088.0, "step": 20825 }, { "entropy": 0.5822318345308304, "epoch": 1.9161074404402505, "grad_norm": 0.15277962386608124, "learning_rate": 3.6133345600637905e-05, "loss": 0.5723, "mean_token_accuracy": 0.825227040797472, "num_tokens": 664691779.0, "step": 20826 }, { "entropy": 0.6235121181234717, "epoch": 1.9161994468116919, "grad_norm": 0.15359549224376678, "learning_rate": 3.613027877449627e-05, "loss": 0.621, "mean_token_accuracy": 0.8126099407672882, "num_tokens": 664724008.0, "step": 20827 }, { "entropy": 0.6732888985425234, "epoch": 1.916291453183133, "grad_norm": 0.15210644900798798, "learning_rate": 3.612721194835465e-05, "loss": 0.6675, "mean_token_accuracy": 0.7988726012408733, "num_tokens": 664755756.0, "step": 20828 }, { "entropy": 0.5079360804520547, "epoch": 1.9163834595545741, "grad_norm": 0.14227916300296783, "learning_rate": 3.612414512221302e-05, "loss": 0.4975, "mean_token_accuracy": 0.8498639203608036, "num_tokens": 664787779.0, "step": 20829 }, { "entropy": 0.5886639263480902, "epoch": 1.9164754659260153, "grad_norm": 0.16169053316116333, "learning_rate": 3.61210782960714e-05, "loss": 0.5731, "mean_token_accuracy": 0.8246727995574474, "num_tokens": 664818329.0, "step": 20830 }, { "entropy": 0.6927664789836854, "epoch": 1.9165674722974566, "grad_norm": 0.15622802078723907, "learning_rate": 3.611801146992977e-05, "loss": 0.676, "mean_token_accuracy": 0.7936620712280273, "num_tokens": 664850878.0, "step": 20831 }, { "entropy": 0.638501139357686, "epoch": 1.916659478668898, "grad_norm": 0.16090695559978485, "learning_rate": 3.6114944643788146e-05, "loss": 0.6144, "mean_token_accuracy": 0.8079972229897976, "num_tokens": 664881880.0, "step": 20832 }, { "entropy": 0.5365561787039042, "epoch": 1.916751485040339, "grad_norm": 0.15388169884681702, "learning_rate": 3.6111877817646514e-05, "loss": 0.5209, "mean_token_accuracy": 0.8421596437692642, "num_tokens": 664913684.0, "step": 20833 }, { "entropy": 0.6457265531644225, "epoch": 1.9168434914117802, "grad_norm": 0.15416528284549713, "learning_rate": 3.6108810991504896e-05, "loss": 0.6274, "mean_token_accuracy": 0.8041187301278114, "num_tokens": 664945404.0, "step": 20834 }, { "entropy": 0.5504526002332568, "epoch": 1.9169354977832214, "grad_norm": 0.1464005708694458, "learning_rate": 3.610574416536327e-05, "loss": 0.5309, "mean_token_accuracy": 0.8346189707517624, "num_tokens": 664977770.0, "step": 20835 }, { "entropy": 0.6300287414342165, "epoch": 1.9170275041546627, "grad_norm": 0.15640173852443695, "learning_rate": 3.610267733922164e-05, "loss": 0.6031, "mean_token_accuracy": 0.814479649066925, "num_tokens": 665009727.0, "step": 20836 }, { "entropy": 0.5597592638805509, "epoch": 1.917119510526104, "grad_norm": 0.15616652369499207, "learning_rate": 3.609961051308002e-05, "loss": 0.5409, "mean_token_accuracy": 0.8316142037510872, "num_tokens": 665040634.0, "step": 20837 }, { "entropy": 0.6425102506764233, "epoch": 1.9172115168975452, "grad_norm": 0.15233981609344482, "learning_rate": 3.609654368693839e-05, "loss": 0.636, "mean_token_accuracy": 0.8078685253858566, "num_tokens": 665073130.0, "step": 20838 }, { "entropy": 0.6230375533923507, "epoch": 1.9173035232689863, "grad_norm": 0.15628179907798767, "learning_rate": 3.609347686079677e-05, "loss": 0.6229, "mean_token_accuracy": 0.8081874884665012, "num_tokens": 665105331.0, "step": 20839 }, { "entropy": 0.5988241732120514, "epoch": 1.9173955296404275, "grad_norm": 0.15163782238960266, "learning_rate": 3.609041003465514e-05, "loss": 0.5778, "mean_token_accuracy": 0.822765376418829, "num_tokens": 665136461.0, "step": 20840 }, { "entropy": 0.6710358895361423, "epoch": 1.9174875360118688, "grad_norm": 0.1551017314195633, "learning_rate": 3.608734320851351e-05, "loss": 0.6604, "mean_token_accuracy": 0.7994733825325966, "num_tokens": 665168602.0, "step": 20841 }, { "entropy": 0.5572140263393521, "epoch": 1.9175795423833102, "grad_norm": 0.1527174413204193, "learning_rate": 3.6084276382371886e-05, "loss": 0.5437, "mean_token_accuracy": 0.8339335955679417, "num_tokens": 665200407.0, "step": 20842 }, { "entropy": 0.600748055614531, "epoch": 1.9176715487547513, "grad_norm": 0.15388481318950653, "learning_rate": 3.608120955623026e-05, "loss": 0.5945, "mean_token_accuracy": 0.819882545620203, "num_tokens": 665232675.0, "step": 20843 }, { "entropy": 0.6247436366975307, "epoch": 1.9177635551261925, "grad_norm": 0.15674136579036713, "learning_rate": 3.6078142730088635e-05, "loss": 0.6329, "mean_token_accuracy": 0.8038428388535976, "num_tokens": 665264676.0, "step": 20844 }, { "entropy": 0.5453500698786229, "epoch": 1.9178555614976336, "grad_norm": 0.15194694697856903, "learning_rate": 3.607507590394701e-05, "loss": 0.5341, "mean_token_accuracy": 0.8337279595434666, "num_tokens": 665295736.0, "step": 20845 }, { "entropy": 0.5042762961238623, "epoch": 1.917947567869075, "grad_norm": 0.14374405145645142, "learning_rate": 3.607200907780538e-05, "loss": 0.5029, "mean_token_accuracy": 0.8447401113808155, "num_tokens": 665327989.0, "step": 20846 }, { "entropy": 0.6180787440389395, "epoch": 1.9180395742405163, "grad_norm": 0.15728306770324707, "learning_rate": 3.606894225166376e-05, "loss": 0.6106, "mean_token_accuracy": 0.8096323385834694, "num_tokens": 665359532.0, "step": 20847 }, { "entropy": 0.578242214396596, "epoch": 1.9181315806119574, "grad_norm": 0.15148413181304932, "learning_rate": 3.606587542552213e-05, "loss": 0.573, "mean_token_accuracy": 0.8257750682532787, "num_tokens": 665391619.0, "step": 20848 }, { "entropy": 0.5979071240872145, "epoch": 1.9182235869833986, "grad_norm": 0.15478476881980896, "learning_rate": 3.60628085993805e-05, "loss": 0.5984, "mean_token_accuracy": 0.8118546344339848, "num_tokens": 665424363.0, "step": 20849 }, { "entropy": 0.6030234852805734, "epoch": 1.9183155933548397, "grad_norm": 0.1589181274175644, "learning_rate": 3.6059741773238876e-05, "loss": 0.5926, "mean_token_accuracy": 0.8154468163847923, "num_tokens": 665456210.0, "step": 20850 }, { "entropy": 0.5822359211742878, "epoch": 1.918407599726281, "grad_norm": 0.15150132775306702, "learning_rate": 3.605667494709725e-05, "loss": 0.5795, "mean_token_accuracy": 0.8200784213840961, "num_tokens": 665488615.0, "step": 20851 }, { "entropy": 0.6769286561757326, "epoch": 1.9184996060977224, "grad_norm": 0.1618957370519638, "learning_rate": 3.6053608120955626e-05, "loss": 0.6647, "mean_token_accuracy": 0.7985028922557831, "num_tokens": 665520953.0, "step": 20852 }, { "entropy": 0.538587773218751, "epoch": 1.9185916124691635, "grad_norm": 0.1470111459493637, "learning_rate": 3.6050541294814e-05, "loss": 0.5274, "mean_token_accuracy": 0.8358744382858276, "num_tokens": 665552913.0, "step": 20853 }, { "entropy": 0.6245228033512831, "epoch": 1.9186836188406047, "grad_norm": 0.1559908241033554, "learning_rate": 3.604747446867237e-05, "loss": 0.6176, "mean_token_accuracy": 0.8083319701254368, "num_tokens": 665585542.0, "step": 20854 }, { "entropy": 0.6549681276082993, "epoch": 1.9187756252120458, "grad_norm": 0.15899206697940826, "learning_rate": 3.604440764253075e-05, "loss": 0.6512, "mean_token_accuracy": 0.7954369001090527, "num_tokens": 665617693.0, "step": 20855 }, { "entropy": 0.6017654575407505, "epoch": 1.9188676315834872, "grad_norm": 0.15171384811401367, "learning_rate": 3.604134081638912e-05, "loss": 0.5976, "mean_token_accuracy": 0.8151166662573814, "num_tokens": 665649547.0, "step": 20856 }, { "entropy": 0.5798635389655828, "epoch": 1.9189596379549285, "grad_norm": 0.14947816729545593, "learning_rate": 3.603827399024749e-05, "loss": 0.5703, "mean_token_accuracy": 0.8234479315578938, "num_tokens": 665681816.0, "step": 20857 }, { "entropy": 0.6676889760419726, "epoch": 1.9190516443263697, "grad_norm": 0.16418248414993286, "learning_rate": 3.603520716410587e-05, "loss": 0.6554, "mean_token_accuracy": 0.8023300431668758, "num_tokens": 665713904.0, "step": 20858 }, { "entropy": 0.5741744562983513, "epoch": 1.9191436506978108, "grad_norm": 0.1576007455587387, "learning_rate": 3.603214033796424e-05, "loss": 0.5559, "mean_token_accuracy": 0.8273701220750809, "num_tokens": 665745598.0, "step": 20859 }, { "entropy": 0.5817370871081948, "epoch": 1.919235657069252, "grad_norm": 0.14885838329792023, "learning_rate": 3.6029073511822616e-05, "loss": 0.5802, "mean_token_accuracy": 0.8251231983304024, "num_tokens": 665777508.0, "step": 20860 }, { "entropy": 0.576451925560832, "epoch": 1.9193276634406933, "grad_norm": 0.1474623680114746, "learning_rate": 3.602600668568099e-05, "loss": 0.5595, "mean_token_accuracy": 0.8310559429228306, "num_tokens": 665809495.0, "step": 20861 }, { "entropy": 0.6478750435635448, "epoch": 1.9194196698121346, "grad_norm": 0.15215981006622314, "learning_rate": 3.602293985953936e-05, "loss": 0.6304, "mean_token_accuracy": 0.8103627189993858, "num_tokens": 665842263.0, "step": 20862 }, { "entropy": 0.6290976698510349, "epoch": 1.9195116761835758, "grad_norm": 0.15466485917568207, "learning_rate": 3.601987303339774e-05, "loss": 0.6105, "mean_token_accuracy": 0.813022967427969, "num_tokens": 665873869.0, "step": 20863 }, { "entropy": 0.5891646640375257, "epoch": 1.919603682555017, "grad_norm": 0.15686115622520447, "learning_rate": 3.601680620725611e-05, "loss": 0.5775, "mean_token_accuracy": 0.8197301216423512, "num_tokens": 665905636.0, "step": 20864 }, { "entropy": 0.5423522510100156, "epoch": 1.919695688926458, "grad_norm": 0.1490565538406372, "learning_rate": 3.601373938111449e-05, "loss": 0.5388, "mean_token_accuracy": 0.8327115513384342, "num_tokens": 665937832.0, "step": 20865 }, { "entropy": 0.6567023270763457, "epoch": 1.9197876952978994, "grad_norm": 0.15999604761600494, "learning_rate": 3.6010672554972864e-05, "loss": 0.6456, "mean_token_accuracy": 0.805592492222786, "num_tokens": 665968380.0, "step": 20866 }, { "entropy": 0.585979051887989, "epoch": 1.9198797016693407, "grad_norm": 0.15454179048538208, "learning_rate": 3.600760572883123e-05, "loss": 0.5711, "mean_token_accuracy": 0.8222269974648952, "num_tokens": 665999862.0, "step": 20867 }, { "entropy": 0.6508873570710421, "epoch": 1.9199717080407819, "grad_norm": 0.15713833272457123, "learning_rate": 3.600453890268961e-05, "loss": 0.6417, "mean_token_accuracy": 0.8056985847651958, "num_tokens": 666031563.0, "step": 20868 }, { "entropy": 0.6214977204799652, "epoch": 1.920063714412223, "grad_norm": 0.15949735045433044, "learning_rate": 3.600147207654798e-05, "loss": 0.609, "mean_token_accuracy": 0.8099955096840858, "num_tokens": 666062886.0, "step": 20869 }, { "entropy": 0.701680576428771, "epoch": 1.9201557207836641, "grad_norm": 0.16555646061897278, "learning_rate": 3.5998405250406356e-05, "loss": 0.6782, "mean_token_accuracy": 0.7933143600821495, "num_tokens": 666093776.0, "step": 20870 }, { "entropy": 0.646352575160563, "epoch": 1.9202477271551055, "grad_norm": 0.15862281620502472, "learning_rate": 3.599533842426473e-05, "loss": 0.623, "mean_token_accuracy": 0.8053168579936028, "num_tokens": 666124999.0, "step": 20871 }, { "entropy": 0.6756944507360458, "epoch": 1.9203397335265469, "grad_norm": 0.1566648632287979, "learning_rate": 3.5992271598123105e-05, "loss": 0.6631, "mean_token_accuracy": 0.7989233322441578, "num_tokens": 666157348.0, "step": 20872 }, { "entropy": 0.5201394855976105, "epoch": 1.920431739897988, "grad_norm": 0.14971667528152466, "learning_rate": 3.598920477198148e-05, "loss": 0.5101, "mean_token_accuracy": 0.838461022824049, "num_tokens": 666189595.0, "step": 20873 }, { "entropy": 0.5600634915754199, "epoch": 1.9205237462694291, "grad_norm": 0.15093764662742615, "learning_rate": 3.5986137945839854e-05, "loss": 0.5648, "mean_token_accuracy": 0.8268038593232632, "num_tokens": 666221572.0, "step": 20874 }, { "entropy": 0.7005637977272272, "epoch": 1.9206157526408703, "grad_norm": 0.16756968200206757, "learning_rate": 3.598307111969822e-05, "loss": 0.6973, "mean_token_accuracy": 0.7876463048160076, "num_tokens": 666253569.0, "step": 20875 }, { "entropy": 0.5839880704879761, "epoch": 1.9207077590123116, "grad_norm": 0.15065129101276398, "learning_rate": 3.5980004293556604e-05, "loss": 0.5935, "mean_token_accuracy": 0.8226796351373196, "num_tokens": 666286069.0, "step": 20876 }, { "entropy": 0.47559571266174316, "epoch": 1.920799765383753, "grad_norm": 0.14464011788368225, "learning_rate": 3.597693746741497e-05, "loss": 0.4654, "mean_token_accuracy": 0.854029692709446, "num_tokens": 666318035.0, "step": 20877 }, { "entropy": 0.6650223601609468, "epoch": 1.920891771755194, "grad_norm": 0.1571066975593567, "learning_rate": 3.5973870641273346e-05, "loss": 0.6714, "mean_token_accuracy": 0.7970026694238186, "num_tokens": 666350692.0, "step": 20878 }, { "entropy": 0.5471287686377764, "epoch": 1.9209837781266352, "grad_norm": 0.1530984342098236, "learning_rate": 3.597080381513172e-05, "loss": 0.5569, "mean_token_accuracy": 0.8265293501317501, "num_tokens": 666382832.0, "step": 20879 }, { "entropy": 0.6977034322917461, "epoch": 1.9210757844980764, "grad_norm": 0.15585088729858398, "learning_rate": 3.5967736988990095e-05, "loss": 0.6927, "mean_token_accuracy": 0.7870481722056866, "num_tokens": 666415005.0, "step": 20880 }, { "entropy": 0.6706019099801779, "epoch": 1.9211677908695177, "grad_norm": 0.1578443944454193, "learning_rate": 3.596467016284847e-05, "loss": 0.657, "mean_token_accuracy": 0.8017650209367275, "num_tokens": 666447161.0, "step": 20881 }, { "entropy": 0.703808257356286, "epoch": 1.921259797240959, "grad_norm": 0.16943170130252838, "learning_rate": 3.5961603336706845e-05, "loss": 0.7072, "mean_token_accuracy": 0.7887771762907505, "num_tokens": 666478671.0, "step": 20882 }, { "entropy": 0.6725028920918703, "epoch": 1.9213518036124002, "grad_norm": 0.15717479586601257, "learning_rate": 3.595853651056522e-05, "loss": 0.651, "mean_token_accuracy": 0.8014010861515999, "num_tokens": 666510994.0, "step": 20883 }, { "entropy": 0.622589779086411, "epoch": 1.9214438099838413, "grad_norm": 0.14812105894088745, "learning_rate": 3.5955469684423594e-05, "loss": 0.6103, "mean_token_accuracy": 0.8159330002963543, "num_tokens": 666543353.0, "step": 20884 }, { "entropy": 0.5718463053926826, "epoch": 1.9215358163552825, "grad_norm": 0.14987429976463318, "learning_rate": 3.595240285828196e-05, "loss": 0.5584, "mean_token_accuracy": 0.8242249637842178, "num_tokens": 666575407.0, "step": 20885 }, { "entropy": 0.6526988614350557, "epoch": 1.9216278227267238, "grad_norm": 0.15738238394260406, "learning_rate": 3.594933603214034e-05, "loss": 0.6325, "mean_token_accuracy": 0.8063186667859554, "num_tokens": 666606899.0, "step": 20886 }, { "entropy": 0.6425107177346945, "epoch": 1.9217198290981652, "grad_norm": 0.1545429229736328, "learning_rate": 3.594626920599871e-05, "loss": 0.619, "mean_token_accuracy": 0.8093093484640121, "num_tokens": 666639138.0, "step": 20887 }, { "entropy": 0.5956533951684833, "epoch": 1.9218118354696063, "grad_norm": 0.14720606803894043, "learning_rate": 3.5943202379857086e-05, "loss": 0.5682, "mean_token_accuracy": 0.8253291882574558, "num_tokens": 666671505.0, "step": 20888 }, { "entropy": 0.6075662281364202, "epoch": 1.9219038418410475, "grad_norm": 0.16209588944911957, "learning_rate": 3.594013555371546e-05, "loss": 0.5895, "mean_token_accuracy": 0.8220278918743134, "num_tokens": 666703758.0, "step": 20889 }, { "entropy": 0.4659623019397259, "epoch": 1.9219958482124886, "grad_norm": 0.15066459774971008, "learning_rate": 3.5937068727573835e-05, "loss": 0.4603, "mean_token_accuracy": 0.8581283800303936, "num_tokens": 666734692.0, "step": 20890 }, { "entropy": 0.5871344078332186, "epoch": 1.92208785458393, "grad_norm": 0.15264055132865906, "learning_rate": 3.593400190143221e-05, "loss": 0.5877, "mean_token_accuracy": 0.8169372230768204, "num_tokens": 666766319.0, "step": 20891 }, { "entropy": 0.6739100404083729, "epoch": 1.9221798609553713, "grad_norm": 0.1580684930086136, "learning_rate": 3.5930935075290584e-05, "loss": 0.6594, "mean_token_accuracy": 0.7982731461524963, "num_tokens": 666798237.0, "step": 20892 }, { "entropy": 0.6678210105746984, "epoch": 1.9222718673268124, "grad_norm": 0.1536102443933487, "learning_rate": 3.592786824914895e-05, "loss": 0.6505, "mean_token_accuracy": 0.7989983074367046, "num_tokens": 666830221.0, "step": 20893 }, { "entropy": 0.5842302022501826, "epoch": 1.9223638736982536, "grad_norm": 0.15998192131519318, "learning_rate": 3.5924801423007334e-05, "loss": 0.5797, "mean_token_accuracy": 0.8195296823978424, "num_tokens": 666862447.0, "step": 20894 }, { "entropy": 0.5858440669253469, "epoch": 1.9224558800696947, "grad_norm": 0.15449324250221252, "learning_rate": 3.59217345968657e-05, "loss": 0.5926, "mean_token_accuracy": 0.8229421116411686, "num_tokens": 666895215.0, "step": 20895 }, { "entropy": 0.6280314419418573, "epoch": 1.922547886441136, "grad_norm": 0.15748374164104462, "learning_rate": 3.5918667770724076e-05, "loss": 0.62, "mean_token_accuracy": 0.8094335459172726, "num_tokens": 666927055.0, "step": 20896 }, { "entropy": 0.6990397907793522, "epoch": 1.9226398928125774, "grad_norm": 0.15774236619472504, "learning_rate": 3.591560094458246e-05, "loss": 0.6765, "mean_token_accuracy": 0.7927207462489605, "num_tokens": 666958981.0, "step": 20897 }, { "entropy": 0.6445838818326592, "epoch": 1.9227318991840185, "grad_norm": 0.15921321511268616, "learning_rate": 3.5912534118440826e-05, "loss": 0.6323, "mean_token_accuracy": 0.8064374886453152, "num_tokens": 666990697.0, "step": 20898 }, { "entropy": 0.6628125999122858, "epoch": 1.9228239055554597, "grad_norm": 0.15936179459095, "learning_rate": 3.590946729229921e-05, "loss": 0.649, "mean_token_accuracy": 0.7988079488277435, "num_tokens": 667022200.0, "step": 20899 }, { "entropy": 0.6734493877738714, "epoch": 1.9229159119269008, "grad_norm": 0.16290967166423798, "learning_rate": 3.5906400466157575e-05, "loss": 0.6801, "mean_token_accuracy": 0.7949211597442627, "num_tokens": 667053386.0, "step": 20900 }, { "entropy": 0.6269977418705821, "epoch": 1.9230079182983422, "grad_norm": 0.15300053358078003, "learning_rate": 3.590333364001595e-05, "loss": 0.6334, "mean_token_accuracy": 0.8107634894549847, "num_tokens": 667086149.0, "step": 20901 }, { "entropy": 0.5727738267742097, "epoch": 1.9230999246697835, "grad_norm": 0.1487153023481369, "learning_rate": 3.5900266813874324e-05, "loss": 0.5675, "mean_token_accuracy": 0.8244356028735638, "num_tokens": 667117996.0, "step": 20902 }, { "entropy": 0.5952338026836514, "epoch": 1.9231919310412247, "grad_norm": 0.15904977917671204, "learning_rate": 3.58971999877327e-05, "loss": 0.5973, "mean_token_accuracy": 0.8179921805858612, "num_tokens": 667150246.0, "step": 20903 }, { "entropy": 0.6168419113382697, "epoch": 1.9232839374126658, "grad_norm": 0.15635590255260468, "learning_rate": 3.5894133161591073e-05, "loss": 0.6099, "mean_token_accuracy": 0.8119124099612236, "num_tokens": 667181851.0, "step": 20904 }, { "entropy": 0.5076748463325202, "epoch": 1.923375943784107, "grad_norm": 0.14171244204044342, "learning_rate": 3.589106633544945e-05, "loss": 0.4994, "mean_token_accuracy": 0.8411156088113785, "num_tokens": 667213919.0, "step": 20905 }, { "entropy": 0.5002440977841616, "epoch": 1.9234679501555483, "grad_norm": 0.14275656640529633, "learning_rate": 3.5887999509307816e-05, "loss": 0.4891, "mean_token_accuracy": 0.8465732522308826, "num_tokens": 667246022.0, "step": 20906 }, { "entropy": 0.6730241272598505, "epoch": 1.9235599565269896, "grad_norm": 0.15601135790348053, "learning_rate": 3.58849326831662e-05, "loss": 0.6587, "mean_token_accuracy": 0.8012006618082523, "num_tokens": 667278126.0, "step": 20907 }, { "entropy": 0.5011402876116335, "epoch": 1.9236519628984308, "grad_norm": 0.14363782107830048, "learning_rate": 3.5881865857024565e-05, "loss": 0.4916, "mean_token_accuracy": 0.8500814698636532, "num_tokens": 667310541.0, "step": 20908 }, { "entropy": 0.667830603197217, "epoch": 1.923743969269872, "grad_norm": 0.16175542771816254, "learning_rate": 3.587879903088294e-05, "loss": 0.6494, "mean_token_accuracy": 0.8015452697873116, "num_tokens": 667342267.0, "step": 20909 }, { "entropy": 0.648101401515305, "epoch": 1.923835975641313, "grad_norm": 0.15505538880825043, "learning_rate": 3.5875732204741315e-05, "loss": 0.6448, "mean_token_accuracy": 0.8027565106749535, "num_tokens": 667374168.0, "step": 20910 }, { "entropy": 0.5710237799212337, "epoch": 1.9239279820127544, "grad_norm": 0.15160386264324188, "learning_rate": 3.587266537859969e-05, "loss": 0.5643, "mean_token_accuracy": 0.8250172026455402, "num_tokens": 667406597.0, "step": 20911 }, { "entropy": 0.7045861538499594, "epoch": 1.9240199883841957, "grad_norm": 0.15752585232257843, "learning_rate": 3.5869598552458064e-05, "loss": 0.6861, "mean_token_accuracy": 0.7885650396347046, "num_tokens": 667439106.0, "step": 20912 }, { "entropy": 0.6074042599648237, "epoch": 1.9241119947556369, "grad_norm": 0.15751880407333374, "learning_rate": 3.586653172631644e-05, "loss": 0.5921, "mean_token_accuracy": 0.8181850388646126, "num_tokens": 667470972.0, "step": 20913 }, { "entropy": 0.6396322385407984, "epoch": 1.924204001127078, "grad_norm": 0.1526961773633957, "learning_rate": 3.5863464900174806e-05, "loss": 0.618, "mean_token_accuracy": 0.8087462410330772, "num_tokens": 667502484.0, "step": 20914 }, { "entropy": 0.5959991817362607, "epoch": 1.9242960074985191, "grad_norm": 0.15263204276561737, "learning_rate": 3.586039807403319e-05, "loss": 0.5863, "mean_token_accuracy": 0.8204733431339264, "num_tokens": 667534107.0, "step": 20915 }, { "entropy": 0.6767136389389634, "epoch": 1.9243880138699605, "grad_norm": 0.15726175904273987, "learning_rate": 3.5857331247891556e-05, "loss": 0.664, "mean_token_accuracy": 0.7928234823048115, "num_tokens": 667565753.0, "step": 20916 }, { "entropy": 0.6532901898026466, "epoch": 1.9244800202414019, "grad_norm": 0.15818138420581818, "learning_rate": 3.585426442174993e-05, "loss": 0.6438, "mean_token_accuracy": 0.8008339703083038, "num_tokens": 667597185.0, "step": 20917 }, { "entropy": 0.6425359230488539, "epoch": 1.924572026612843, "grad_norm": 0.1542520672082901, "learning_rate": 3.5851197595608305e-05, "loss": 0.6383, "mean_token_accuracy": 0.8090091347694397, "num_tokens": 667629107.0, "step": 20918 }, { "entropy": 0.592678714543581, "epoch": 1.9246640329842841, "grad_norm": 0.1478932648897171, "learning_rate": 3.584813076946668e-05, "loss": 0.5804, "mean_token_accuracy": 0.8226908519864082, "num_tokens": 667661196.0, "step": 20919 }, { "entropy": 0.6986059546470642, "epoch": 1.9247560393557253, "grad_norm": 0.16861440241336823, "learning_rate": 3.5845063943325054e-05, "loss": 0.6842, "mean_token_accuracy": 0.7890169583261013, "num_tokens": 667692454.0, "step": 20920 }, { "entropy": 0.579173588193953, "epoch": 1.9248480457271666, "grad_norm": 0.15622739493846893, "learning_rate": 3.584199711718343e-05, "loss": 0.5662, "mean_token_accuracy": 0.8272637315094471, "num_tokens": 667723846.0, "step": 20921 }, { "entropy": 0.548562178388238, "epoch": 1.924940052098608, "grad_norm": 0.14404547214508057, "learning_rate": 3.58389302910418e-05, "loss": 0.5345, "mean_token_accuracy": 0.832494780421257, "num_tokens": 667756445.0, "step": 20922 }, { "entropy": 0.5426093898713589, "epoch": 1.925032058470049, "grad_norm": 0.14286789298057556, "learning_rate": 3.583586346490018e-05, "loss": 0.5297, "mean_token_accuracy": 0.8359294943511486, "num_tokens": 667788611.0, "step": 20923 }, { "entropy": 0.5999702559784055, "epoch": 1.9251240648414902, "grad_norm": 0.1525174379348755, "learning_rate": 3.5832796638758546e-05, "loss": 0.5936, "mean_token_accuracy": 0.8174733705818653, "num_tokens": 667820513.0, "step": 20924 }, { "entropy": 0.6312863547354937, "epoch": 1.9252160712129314, "grad_norm": 0.15094804763793945, "learning_rate": 3.582972981261693e-05, "loss": 0.6144, "mean_token_accuracy": 0.8087395280599594, "num_tokens": 667852129.0, "step": 20925 }, { "entropy": 0.5922365104779601, "epoch": 1.9253080775843727, "grad_norm": 0.1547476351261139, "learning_rate": 3.58266629864753e-05, "loss": 0.5908, "mean_token_accuracy": 0.8203539699316025, "num_tokens": 667883708.0, "step": 20926 }, { "entropy": 0.6311000445857644, "epoch": 1.925400083955814, "grad_norm": 0.15261204540729523, "learning_rate": 3.582359616033367e-05, "loss": 0.6139, "mean_token_accuracy": 0.8088265210390091, "num_tokens": 667916249.0, "step": 20927 }, { "entropy": 0.6137969316914678, "epoch": 1.9254920903272552, "grad_norm": 0.15407289564609528, "learning_rate": 3.582052933419205e-05, "loss": 0.611, "mean_token_accuracy": 0.8162822052836418, "num_tokens": 667948291.0, "step": 20928 }, { "entropy": 0.6282985042780638, "epoch": 1.9255840966986963, "grad_norm": 0.16169489920139313, "learning_rate": 3.581746250805042e-05, "loss": 0.616, "mean_token_accuracy": 0.8133943639695644, "num_tokens": 667980720.0, "step": 20929 }, { "entropy": 0.6556427292525768, "epoch": 1.9256761030701375, "grad_norm": 0.15999507904052734, "learning_rate": 3.5814395681908794e-05, "loss": 0.6565, "mean_token_accuracy": 0.7991676367819309, "num_tokens": 668012894.0, "step": 20930 }, { "entropy": 0.5694716284051538, "epoch": 1.9257681094415788, "grad_norm": 0.14631590247154236, "learning_rate": 3.581132885576717e-05, "loss": 0.5623, "mean_token_accuracy": 0.8260504603385925, "num_tokens": 668044446.0, "step": 20931 }, { "entropy": 0.7130844723433256, "epoch": 1.9258601158130202, "grad_norm": 0.16044923663139343, "learning_rate": 3.580826202962554e-05, "loss": 0.7127, "mean_token_accuracy": 0.7807388454675674, "num_tokens": 668076283.0, "step": 20932 }, { "entropy": 0.5320655610412359, "epoch": 1.9259521221844613, "grad_norm": 0.15244226157665253, "learning_rate": 3.580519520348392e-05, "loss": 0.5151, "mean_token_accuracy": 0.8396819122135639, "num_tokens": 668107772.0, "step": 20933 }, { "entropy": 0.638291759416461, "epoch": 1.9260441285559025, "grad_norm": 0.1554151475429535, "learning_rate": 3.580212837734229e-05, "loss": 0.636, "mean_token_accuracy": 0.8064165040850639, "num_tokens": 668138795.0, "step": 20934 }, { "entropy": 0.7369159404188395, "epoch": 1.9261361349273436, "grad_norm": 0.1615416705608368, "learning_rate": 3.579906155120066e-05, "loss": 0.7254, "mean_token_accuracy": 0.781586017459631, "num_tokens": 668170804.0, "step": 20935 }, { "entropy": 0.5749469473958015, "epoch": 1.926228141298785, "grad_norm": 0.15085378289222717, "learning_rate": 3.579599472505904e-05, "loss": 0.5693, "mean_token_accuracy": 0.8231405504047871, "num_tokens": 668203214.0, "step": 20936 }, { "entropy": 0.5382599979639053, "epoch": 1.9263201476702263, "grad_norm": 0.1445733606815338, "learning_rate": 3.579292789891741e-05, "loss": 0.5276, "mean_token_accuracy": 0.84034363925457, "num_tokens": 668235749.0, "step": 20937 }, { "entropy": 0.6975209843367338, "epoch": 1.9264121540416674, "grad_norm": 0.1604008674621582, "learning_rate": 3.5789861072775784e-05, "loss": 0.6779, "mean_token_accuracy": 0.789719682186842, "num_tokens": 668268051.0, "step": 20938 }, { "entropy": 0.5501402299851179, "epoch": 1.9265041604131086, "grad_norm": 0.15154552459716797, "learning_rate": 3.578679424663416e-05, "loss": 0.5401, "mean_token_accuracy": 0.8298440128564835, "num_tokens": 668298940.0, "step": 20939 }, { "entropy": 0.6444477736949921, "epoch": 1.9265961667845497, "grad_norm": 0.15440380573272705, "learning_rate": 3.5783727420492534e-05, "loss": 0.6212, "mean_token_accuracy": 0.8031317517161369, "num_tokens": 668329713.0, "step": 20940 }, { "entropy": 0.5395638970658183, "epoch": 1.926688173155991, "grad_norm": 0.14603714644908905, "learning_rate": 3.578066059435091e-05, "loss": 0.536, "mean_token_accuracy": 0.8345241881906986, "num_tokens": 668362107.0, "step": 20941 }, { "entropy": 0.6290880478918552, "epoch": 1.9267801795274324, "grad_norm": 0.1612931340932846, "learning_rate": 3.577759376820928e-05, "loss": 0.6115, "mean_token_accuracy": 0.8095795325934887, "num_tokens": 668394185.0, "step": 20942 }, { "entropy": 0.4618234517984092, "epoch": 1.9268721858988735, "grad_norm": 0.13895907998085022, "learning_rate": 3.577452694206766e-05, "loss": 0.4423, "mean_token_accuracy": 0.8636475019156933, "num_tokens": 668426456.0, "step": 20943 }, { "entropy": 0.6416669823229313, "epoch": 1.9269641922703147, "grad_norm": 0.15270878374576569, "learning_rate": 3.577146011592603e-05, "loss": 0.6268, "mean_token_accuracy": 0.808589518070221, "num_tokens": 668458632.0, "step": 20944 }, { "entropy": 0.5720983911305666, "epoch": 1.9270561986417558, "grad_norm": 0.1476099044084549, "learning_rate": 3.57683932897844e-05, "loss": 0.5716, "mean_token_accuracy": 0.8232794143259525, "num_tokens": 668490646.0, "step": 20945 }, { "entropy": 0.5877476995810866, "epoch": 1.9271482050131972, "grad_norm": 0.15047381818294525, "learning_rate": 3.576532646364278e-05, "loss": 0.5783, "mean_token_accuracy": 0.822748064994812, "num_tokens": 668522351.0, "step": 20946 }, { "entropy": 0.5607993877492845, "epoch": 1.9272402113846385, "grad_norm": 0.15281568467617035, "learning_rate": 3.576225963750115e-05, "loss": 0.5559, "mean_token_accuracy": 0.8265345357358456, "num_tokens": 668554580.0, "step": 20947 }, { "entropy": 0.5928238686174154, "epoch": 1.9273322177560797, "grad_norm": 0.15214328467845917, "learning_rate": 3.5759192811359524e-05, "loss": 0.5986, "mean_token_accuracy": 0.8150172755122185, "num_tokens": 668587050.0, "step": 20948 }, { "entropy": 0.6097109792754054, "epoch": 1.9274242241275208, "grad_norm": 0.1547391563653946, "learning_rate": 3.57561259852179e-05, "loss": 0.5919, "mean_token_accuracy": 0.8141755424439907, "num_tokens": 668618621.0, "step": 20949 }, { "entropy": 0.642817635089159, "epoch": 1.927516230498962, "grad_norm": 0.15532290935516357, "learning_rate": 3.575305915907627e-05, "loss": 0.6155, "mean_token_accuracy": 0.8067924305796623, "num_tokens": 668649647.0, "step": 20950 }, { "entropy": 0.682373333722353, "epoch": 1.9276082368704033, "grad_norm": 0.1616903394460678, "learning_rate": 3.574999233293465e-05, "loss": 0.6736, "mean_token_accuracy": 0.7905936427414417, "num_tokens": 668681713.0, "step": 20951 }, { "entropy": 0.5752063419204205, "epoch": 1.9277002432418446, "grad_norm": 0.1484963744878769, "learning_rate": 3.574692550679302e-05, "loss": 0.57, "mean_token_accuracy": 0.8224292993545532, "num_tokens": 668713946.0, "step": 20952 }, { "entropy": 0.6355324732139707, "epoch": 1.9277922496132858, "grad_norm": 0.15481281280517578, "learning_rate": 3.574385868065139e-05, "loss": 0.6346, "mean_token_accuracy": 0.806499257683754, "num_tokens": 668745661.0, "step": 20953 }, { "entropy": 0.6137036490254104, "epoch": 1.927884255984727, "grad_norm": 0.15671919286251068, "learning_rate": 3.574079185450977e-05, "loss": 0.5996, "mean_token_accuracy": 0.8181240521371365, "num_tokens": 668777398.0, "step": 20954 }, { "entropy": 0.6307436740025878, "epoch": 1.927976262356168, "grad_norm": 0.1546757072210312, "learning_rate": 3.573772502836814e-05, "loss": 0.6237, "mean_token_accuracy": 0.8091492354869843, "num_tokens": 668809487.0, "step": 20955 }, { "entropy": 0.5078455833718181, "epoch": 1.9280682687276094, "grad_norm": 0.1432161033153534, "learning_rate": 3.5734658202226514e-05, "loss": 0.5005, "mean_token_accuracy": 0.8459009230136871, "num_tokens": 668841518.0, "step": 20956 }, { "entropy": 0.47899413947016, "epoch": 1.9281602750990507, "grad_norm": 0.14537973701953888, "learning_rate": 3.5731591376084896e-05, "loss": 0.4697, "mean_token_accuracy": 0.8544695600867271, "num_tokens": 668873672.0, "step": 20957 }, { "entropy": 0.6451385039836168, "epoch": 1.9282522814704919, "grad_norm": 0.1594550907611847, "learning_rate": 3.5728524549943264e-05, "loss": 0.638, "mean_token_accuracy": 0.803968995809555, "num_tokens": 668905891.0, "step": 20958 }, { "entropy": 0.5558997076004744, "epoch": 1.928344287841933, "grad_norm": 0.15085576474666595, "learning_rate": 3.5725457723801645e-05, "loss": 0.5505, "mean_token_accuracy": 0.8320667296648026, "num_tokens": 668937967.0, "step": 20959 }, { "entropy": 0.5247505805455148, "epoch": 1.9284362942133741, "grad_norm": 0.14740976691246033, "learning_rate": 3.572239089766001e-05, "loss": 0.4993, "mean_token_accuracy": 0.8428799659013748, "num_tokens": 668969689.0, "step": 20960 }, { "entropy": 0.5859443871304393, "epoch": 1.9285283005848155, "grad_norm": 0.1503281146287918, "learning_rate": 3.571932407151839e-05, "loss": 0.5824, "mean_token_accuracy": 0.8245326615869999, "num_tokens": 669002084.0, "step": 20961 }, { "entropy": 0.6157779823988676, "epoch": 1.9286203069562569, "grad_norm": 0.15577495098114014, "learning_rate": 3.571625724537676e-05, "loss": 0.6113, "mean_token_accuracy": 0.8132405653595924, "num_tokens": 669034458.0, "step": 20962 }, { "entropy": 0.5376713895238936, "epoch": 1.928712313327698, "grad_norm": 0.14746952056884766, "learning_rate": 3.571319041923514e-05, "loss": 0.5153, "mean_token_accuracy": 0.8426657766103745, "num_tokens": 669066106.0, "step": 20963 }, { "entropy": 0.5652703456580639, "epoch": 1.9288043196991391, "grad_norm": 0.15245884656906128, "learning_rate": 3.571012359309351e-05, "loss": 0.5561, "mean_token_accuracy": 0.8286477215588093, "num_tokens": 669098377.0, "step": 20964 }, { "entropy": 0.587549252435565, "epoch": 1.9288963260705803, "grad_norm": 0.1475956290960312, "learning_rate": 3.5707056766951886e-05, "loss": 0.5657, "mean_token_accuracy": 0.8236222080886364, "num_tokens": 669129891.0, "step": 20965 }, { "entropy": 0.5275663137435913, "epoch": 1.9289883324420216, "grad_norm": 0.14714473485946655, "learning_rate": 3.5703989940810254e-05, "loss": 0.5127, "mean_token_accuracy": 0.8385657593607903, "num_tokens": 669161983.0, "step": 20966 }, { "entropy": 0.6289474666118622, "epoch": 1.929080338813463, "grad_norm": 0.15138402581214905, "learning_rate": 3.5700923114668636e-05, "loss": 0.6088, "mean_token_accuracy": 0.8125463053584099, "num_tokens": 669193406.0, "step": 20967 }, { "entropy": 0.5558250332251191, "epoch": 1.929172345184904, "grad_norm": 0.1466681808233261, "learning_rate": 3.5697856288527003e-05, "loss": 0.546, "mean_token_accuracy": 0.8317023329436779, "num_tokens": 669225729.0, "step": 20968 }, { "entropy": 0.5249992478638887, "epoch": 1.9292643515563452, "grad_norm": 0.14425458014011383, "learning_rate": 3.569478946238538e-05, "loss": 0.507, "mean_token_accuracy": 0.8417224399745464, "num_tokens": 669257424.0, "step": 20969 }, { "entropy": 0.5410570073872805, "epoch": 1.9293563579277864, "grad_norm": 0.14298953115940094, "learning_rate": 3.569172263624375e-05, "loss": 0.5321, "mean_token_accuracy": 0.8332069739699364, "num_tokens": 669289629.0, "step": 20970 }, { "entropy": 0.6018887339159846, "epoch": 1.9294483642992277, "grad_norm": 0.15356746315956116, "learning_rate": 3.568865581010213e-05, "loss": 0.5926, "mean_token_accuracy": 0.8187834918498993, "num_tokens": 669321371.0, "step": 20971 }, { "entropy": 0.6107905870303512, "epoch": 1.929540370670669, "grad_norm": 0.15499047935009003, "learning_rate": 3.56855889839605e-05, "loss": 0.5983, "mean_token_accuracy": 0.8151769824326038, "num_tokens": 669353512.0, "step": 20972 }, { "entropy": 0.5251995422877371, "epoch": 1.9296323770421102, "grad_norm": 0.14435520768165588, "learning_rate": 3.568252215781888e-05, "loss": 0.5316, "mean_token_accuracy": 0.8367696776986122, "num_tokens": 669386022.0, "step": 20973 }, { "entropy": 0.55700902082026, "epoch": 1.9297243834135513, "grad_norm": 0.15254397690296173, "learning_rate": 3.5679455331677245e-05, "loss": 0.5413, "mean_token_accuracy": 0.8291926346719265, "num_tokens": 669417874.0, "step": 20974 }, { "entropy": 0.5676609538495541, "epoch": 1.9298163897849925, "grad_norm": 0.14636902511119843, "learning_rate": 3.5676388505535626e-05, "loss": 0.5581, "mean_token_accuracy": 0.8319153226912022, "num_tokens": 669450441.0, "step": 20975 }, { "entropy": 0.7338172253221273, "epoch": 1.9299083961564338, "grad_norm": 0.17106960713863373, "learning_rate": 3.5673321679393994e-05, "loss": 0.7307, "mean_token_accuracy": 0.7780205644667149, "num_tokens": 669481277.0, "step": 20976 }, { "entropy": 0.7154701892286539, "epoch": 1.9300004025278752, "grad_norm": 0.1675308495759964, "learning_rate": 3.567025485325237e-05, "loss": 0.714, "mean_token_accuracy": 0.7858095727860928, "num_tokens": 669513299.0, "step": 20977 }, { "entropy": 0.7292438428848982, "epoch": 1.9300924088993163, "grad_norm": 0.16732482612133026, "learning_rate": 3.566718802711074e-05, "loss": 0.741, "mean_token_accuracy": 0.7757912315428257, "num_tokens": 669544473.0, "step": 20978 }, { "entropy": 0.6367388060316443, "epoch": 1.9301844152707575, "grad_norm": 0.16199848055839539, "learning_rate": 3.566412120096912e-05, "loss": 0.646, "mean_token_accuracy": 0.801589023321867, "num_tokens": 669575771.0, "step": 20979 }, { "entropy": 0.5799961276352406, "epoch": 1.9302764216421986, "grad_norm": 0.1538671851158142, "learning_rate": 3.566105437482749e-05, "loss": 0.5712, "mean_token_accuracy": 0.8216382600367069, "num_tokens": 669607941.0, "step": 20980 }, { "entropy": 0.4660914884880185, "epoch": 1.93036842801364, "grad_norm": 0.13884887099266052, "learning_rate": 3.565798754868587e-05, "loss": 0.4603, "mean_token_accuracy": 0.8555714935064316, "num_tokens": 669640653.0, "step": 20981 }, { "entropy": 0.5163142981473356, "epoch": 1.9304604343850813, "grad_norm": 0.14280563592910767, "learning_rate": 3.5654920722544235e-05, "loss": 0.5077, "mean_token_accuracy": 0.8412291668355465, "num_tokens": 669672716.0, "step": 20982 }, { "entropy": 0.5799162834882736, "epoch": 1.9305524407565224, "grad_norm": 0.15739953517913818, "learning_rate": 3.5651853896402616e-05, "loss": 0.5908, "mean_token_accuracy": 0.8184514530003071, "num_tokens": 669704366.0, "step": 20983 }, { "entropy": 0.6266928762197495, "epoch": 1.9306444471279636, "grad_norm": 0.1550017148256302, "learning_rate": 3.5648787070260984e-05, "loss": 0.6128, "mean_token_accuracy": 0.8072903603315353, "num_tokens": 669736100.0, "step": 20984 }, { "entropy": 0.5576075012795627, "epoch": 1.9307364534994047, "grad_norm": 0.1518106907606125, "learning_rate": 3.5645720244119366e-05, "loss": 0.5562, "mean_token_accuracy": 0.8310026861727238, "num_tokens": 669768868.0, "step": 20985 }, { "entropy": 0.5733818840235472, "epoch": 1.930828459870846, "grad_norm": 0.15476973354816437, "learning_rate": 3.5642653417977734e-05, "loss": 0.571, "mean_token_accuracy": 0.8244299776852131, "num_tokens": 669800510.0, "step": 20986 }, { "entropy": 0.5854878034442663, "epoch": 1.9309204662422874, "grad_norm": 0.15328796207904816, "learning_rate": 3.563958659183611e-05, "loss": 0.5667, "mean_token_accuracy": 0.8239156194031239, "num_tokens": 669832578.0, "step": 20987 }, { "entropy": 0.6770383045077324, "epoch": 1.9310124726137285, "grad_norm": 0.15309540927410126, "learning_rate": 3.563651976569449e-05, "loss": 0.6586, "mean_token_accuracy": 0.7987090386450291, "num_tokens": 669864145.0, "step": 20988 }, { "entropy": 0.4956454678904265, "epoch": 1.9311044789851697, "grad_norm": 0.1432906687259674, "learning_rate": 3.563345293955286e-05, "loss": 0.4854, "mean_token_accuracy": 0.8496037498116493, "num_tokens": 669896150.0, "step": 20989 }, { "entropy": 0.6068426901474595, "epoch": 1.9311964853566108, "grad_norm": 0.14900290966033936, "learning_rate": 3.563038611341123e-05, "loss": 0.5838, "mean_token_accuracy": 0.8217085711658001, "num_tokens": 669928271.0, "step": 20990 }, { "entropy": 0.5315742427483201, "epoch": 1.9312884917280522, "grad_norm": 0.14841563999652863, "learning_rate": 3.562731928726961e-05, "loss": 0.5111, "mean_token_accuracy": 0.842099167406559, "num_tokens": 669959474.0, "step": 20991 }, { "entropy": 0.6512664090842009, "epoch": 1.9313804980994935, "grad_norm": 0.1543082594871521, "learning_rate": 3.562425246112798e-05, "loss": 0.6468, "mean_token_accuracy": 0.7987298592925072, "num_tokens": 669991840.0, "step": 20992 }, { "entropy": 0.5543630225583911, "epoch": 1.9314725044709347, "grad_norm": 0.14220446348190308, "learning_rate": 3.5621185634986356e-05, "loss": 0.5294, "mean_token_accuracy": 0.8322172239422798, "num_tokens": 670023708.0, "step": 20993 }, { "entropy": 0.5434652417898178, "epoch": 1.9315645108423758, "grad_norm": 0.1520615965127945, "learning_rate": 3.561811880884473e-05, "loss": 0.5327, "mean_token_accuracy": 0.8368837386369705, "num_tokens": 670055649.0, "step": 20994 }, { "entropy": 0.5048559131100774, "epoch": 1.931656517213817, "grad_norm": 0.14028844237327576, "learning_rate": 3.56150519827031e-05, "loss": 0.4983, "mean_token_accuracy": 0.8447946980595589, "num_tokens": 670087596.0, "step": 20995 }, { "entropy": 0.49495579255744815, "epoch": 1.9317485235852583, "grad_norm": 0.1499784141778946, "learning_rate": 3.561198515656148e-05, "loss": 0.4771, "mean_token_accuracy": 0.8524036966264248, "num_tokens": 670120351.0, "step": 20996 }, { "entropy": 0.679379278793931, "epoch": 1.9318405299566996, "grad_norm": 0.1596830189228058, "learning_rate": 3.560891833041985e-05, "loss": 0.6605, "mean_token_accuracy": 0.794262208044529, "num_tokens": 670152292.0, "step": 20997 }, { "entropy": 0.6148742716759443, "epoch": 1.9319325363281408, "grad_norm": 0.15246787667274475, "learning_rate": 3.560585150427822e-05, "loss": 0.6099, "mean_token_accuracy": 0.8130801133811474, "num_tokens": 670185060.0, "step": 20998 }, { "entropy": 0.6036155726760626, "epoch": 1.932024542699582, "grad_norm": 0.15156981348991394, "learning_rate": 3.56027846781366e-05, "loss": 0.5963, "mean_token_accuracy": 0.8136178776621819, "num_tokens": 670216998.0, "step": 20999 }, { "entropy": 0.5985369477421045, "epoch": 1.932116549071023, "grad_norm": 0.1520117074251175, "learning_rate": 3.559971785199497e-05, "loss": 0.5795, "mean_token_accuracy": 0.8196519948542118, "num_tokens": 670248377.0, "step": 21000 }, { "entropy": 0.5509498775936663, "epoch": 1.9322085554424644, "grad_norm": 0.1415025293827057, "learning_rate": 3.5596651025853346e-05, "loss": 0.5385, "mean_token_accuracy": 0.8350675962865353, "num_tokens": 670280722.0, "step": 21001 }, { "entropy": 0.594791192561388, "epoch": 1.9323005618139057, "grad_norm": 0.15966001152992249, "learning_rate": 3.559358419971172e-05, "loss": 0.5892, "mean_token_accuracy": 0.817914891988039, "num_tokens": 670311990.0, "step": 21002 }, { "entropy": 0.6274745669215918, "epoch": 1.9323925681853469, "grad_norm": 0.15553617477416992, "learning_rate": 3.5590517373570096e-05, "loss": 0.6281, "mean_token_accuracy": 0.8084848932921886, "num_tokens": 670344322.0, "step": 21003 }, { "entropy": 0.5447042975574732, "epoch": 1.932484574556788, "grad_norm": 0.15063922107219696, "learning_rate": 3.558745054742847e-05, "loss": 0.5365, "mean_token_accuracy": 0.8301139026880264, "num_tokens": 670376054.0, "step": 21004 }, { "entropy": 0.7164693493396044, "epoch": 1.9325765809282291, "grad_norm": 0.16180744767189026, "learning_rate": 3.558438372128684e-05, "loss": 0.7138, "mean_token_accuracy": 0.7833103910088539, "num_tokens": 670408194.0, "step": 21005 }, { "entropy": 0.6696190573275089, "epoch": 1.9326685872996705, "grad_norm": 0.15589003264904022, "learning_rate": 3.558131689514522e-05, "loss": 0.6593, "mean_token_accuracy": 0.7968557924032211, "num_tokens": 670439157.0, "step": 21006 }, { "entropy": 0.6086272895336151, "epoch": 1.9327605936711119, "grad_norm": 0.1530265212059021, "learning_rate": 3.557825006900359e-05, "loss": 0.6078, "mean_token_accuracy": 0.8166218772530556, "num_tokens": 670471925.0, "step": 21007 }, { "entropy": 0.5504309497773647, "epoch": 1.932852600042553, "grad_norm": 0.1511172652244568, "learning_rate": 3.557518324286196e-05, "loss": 0.5434, "mean_token_accuracy": 0.8351453468203545, "num_tokens": 670503775.0, "step": 21008 }, { "entropy": 0.73553048633039, "epoch": 1.9329446064139941, "grad_norm": 0.16675704717636108, "learning_rate": 3.557211641672034e-05, "loss": 0.7319, "mean_token_accuracy": 0.7767983488738537, "num_tokens": 670536246.0, "step": 21009 }, { "entropy": 0.6317906668409705, "epoch": 1.9330366127854353, "grad_norm": 0.15880967676639557, "learning_rate": 3.556904959057871e-05, "loss": 0.6301, "mean_token_accuracy": 0.8098153062164783, "num_tokens": 670567925.0, "step": 21010 }, { "entropy": 0.6552189625799656, "epoch": 1.9331286191568766, "grad_norm": 0.157531276345253, "learning_rate": 3.5565982764437086e-05, "loss": 0.6507, "mean_token_accuracy": 0.8032572343945503, "num_tokens": 670600046.0, "step": 21011 }, { "entropy": 0.6389741552993655, "epoch": 1.933220625528318, "grad_norm": 0.15603069961071014, "learning_rate": 3.556291593829546e-05, "loss": 0.6213, "mean_token_accuracy": 0.8063843622803688, "num_tokens": 670631509.0, "step": 21012 }, { "entropy": 0.6103151328861713, "epoch": 1.933312631899759, "grad_norm": 0.15107743442058563, "learning_rate": 3.555984911215383e-05, "loss": 0.6058, "mean_token_accuracy": 0.8185202926397324, "num_tokens": 670663252.0, "step": 21013 }, { "entropy": 0.46238038409501314, "epoch": 1.9334046382712002, "grad_norm": 0.13482458889484406, "learning_rate": 3.555678228601221e-05, "loss": 0.4501, "mean_token_accuracy": 0.8565055951476097, "num_tokens": 670695601.0, "step": 21014 }, { "entropy": 0.5911774653941393, "epoch": 1.9334966446426414, "grad_norm": 0.15190550684928894, "learning_rate": 3.555371545987058e-05, "loss": 0.582, "mean_token_accuracy": 0.8225640989840031, "num_tokens": 670727524.0, "step": 21015 }, { "entropy": 0.5862418878823519, "epoch": 1.9335886510140827, "grad_norm": 0.14824794232845306, "learning_rate": 3.555064863372895e-05, "loss": 0.5806, "mean_token_accuracy": 0.8187780193984509, "num_tokens": 670759445.0, "step": 21016 }, { "entropy": 0.5760104444343597, "epoch": 1.933680657385524, "grad_norm": 0.1488177627325058, "learning_rate": 3.554758180758733e-05, "loss": 0.5504, "mean_token_accuracy": 0.8320136331021786, "num_tokens": 670791529.0, "step": 21017 }, { "entropy": 0.6074622869491577, "epoch": 1.9337726637569652, "grad_norm": 0.1558322161436081, "learning_rate": 3.55445149814457e-05, "loss": 0.5973, "mean_token_accuracy": 0.8192459531128407, "num_tokens": 670823590.0, "step": 21018 }, { "entropy": 0.6034395524766296, "epoch": 1.9338646701284063, "grad_norm": 0.15149499475955963, "learning_rate": 3.554144815530408e-05, "loss": 0.5823, "mean_token_accuracy": 0.8216255158185959, "num_tokens": 670855392.0, "step": 21019 }, { "entropy": 0.5511016622185707, "epoch": 1.9339566764998475, "grad_norm": 0.14694558084011078, "learning_rate": 3.553838132916245e-05, "loss": 0.5422, "mean_token_accuracy": 0.8332310281693935, "num_tokens": 670887545.0, "step": 21020 }, { "entropy": 0.7073823679238558, "epoch": 1.9340486828712888, "grad_norm": 0.16330783069133759, "learning_rate": 3.5535314503020826e-05, "loss": 0.6869, "mean_token_accuracy": 0.7925877310335636, "num_tokens": 670919830.0, "step": 21021 }, { "entropy": 0.5590445827692747, "epoch": 1.9341406892427302, "grad_norm": 0.1483929306268692, "learning_rate": 3.55322476768792e-05, "loss": 0.5461, "mean_token_accuracy": 0.8311042562127113, "num_tokens": 670951478.0, "step": 21022 }, { "entropy": 0.5660791276022792, "epoch": 1.9342326956141713, "grad_norm": 0.15462014079093933, "learning_rate": 3.5529180850737575e-05, "loss": 0.5681, "mean_token_accuracy": 0.8216983750462532, "num_tokens": 670983660.0, "step": 21023 }, { "entropy": 0.6186610395088792, "epoch": 1.9343247019856125, "grad_norm": 0.154026061296463, "learning_rate": 3.552611402459595e-05, "loss": 0.6087, "mean_token_accuracy": 0.8163434639573097, "num_tokens": 671015278.0, "step": 21024 }, { "entropy": 0.6029504362959415, "epoch": 1.9344167083570536, "grad_norm": 0.15419615805149078, "learning_rate": 3.5523047198454324e-05, "loss": 0.5977, "mean_token_accuracy": 0.8165684752166271, "num_tokens": 671047926.0, "step": 21025 }, { "entropy": 0.6904262118041515, "epoch": 1.934508714728495, "grad_norm": 0.158382847905159, "learning_rate": 3.551998037231269e-05, "loss": 0.682, "mean_token_accuracy": 0.7924633733928204, "num_tokens": 671079577.0, "step": 21026 }, { "entropy": 0.5819196933880448, "epoch": 1.9346007210999363, "grad_norm": 0.1489962488412857, "learning_rate": 3.5516913546171074e-05, "loss": 0.5814, "mean_token_accuracy": 0.820697408169508, "num_tokens": 671111934.0, "step": 21027 }, { "entropy": 0.6817225459963083, "epoch": 1.9346927274713774, "grad_norm": 0.16290228068828583, "learning_rate": 3.551384672002944e-05, "loss": 0.68, "mean_token_accuracy": 0.7920538447797298, "num_tokens": 671143138.0, "step": 21028 }, { "entropy": 0.6105472203344107, "epoch": 1.9347847338428186, "grad_norm": 0.15334975719451904, "learning_rate": 3.5510779893887816e-05, "loss": 0.6025, "mean_token_accuracy": 0.8145626150071621, "num_tokens": 671175345.0, "step": 21029 }, { "entropy": 0.5759483375586569, "epoch": 1.9348767402142597, "grad_norm": 0.14780615270137787, "learning_rate": 3.550771306774619e-05, "loss": 0.5554, "mean_token_accuracy": 0.826749574393034, "num_tokens": 671206886.0, "step": 21030 }, { "entropy": 0.5810622721910477, "epoch": 1.934968746585701, "grad_norm": 0.15748079121112823, "learning_rate": 3.5504646241604566e-05, "loss": 0.5685, "mean_token_accuracy": 0.8249508552253246, "num_tokens": 671238617.0, "step": 21031 }, { "entropy": 0.6750452211126685, "epoch": 1.9350607529571424, "grad_norm": 0.16046632826328278, "learning_rate": 3.550157941546294e-05, "loss": 0.6742, "mean_token_accuracy": 0.7945746630430222, "num_tokens": 671270012.0, "step": 21032 }, { "entropy": 0.6634003091603518, "epoch": 1.9351527593285835, "grad_norm": 0.16093768179416656, "learning_rate": 3.5498512589321315e-05, "loss": 0.6657, "mean_token_accuracy": 0.7985420860350132, "num_tokens": 671301345.0, "step": 21033 }, { "entropy": 0.5370614770799875, "epoch": 1.9352447657000247, "grad_norm": 0.1417294442653656, "learning_rate": 3.549544576317968e-05, "loss": 0.5156, "mean_token_accuracy": 0.8378510288894176, "num_tokens": 671333395.0, "step": 21034 }, { "entropy": 0.7045867927372456, "epoch": 1.9353367720714658, "grad_norm": 0.15832467377185822, "learning_rate": 3.5492378937038064e-05, "loss": 0.6819, "mean_token_accuracy": 0.790394451469183, "num_tokens": 671365951.0, "step": 21035 }, { "entropy": 0.6366962790489197, "epoch": 1.9354287784429072, "grad_norm": 0.1576095074415207, "learning_rate": 3.548931211089643e-05, "loss": 0.6245, "mean_token_accuracy": 0.8072497509419918, "num_tokens": 671397342.0, "step": 21036 }, { "entropy": 0.5739589140284806, "epoch": 1.9355207848143485, "grad_norm": 0.14997798204421997, "learning_rate": 3.548624528475481e-05, "loss": 0.5634, "mean_token_accuracy": 0.8281136825680733, "num_tokens": 671429233.0, "step": 21037 }, { "entropy": 0.5745242740958929, "epoch": 1.9356127911857897, "grad_norm": 0.14722371101379395, "learning_rate": 3.548317845861318e-05, "loss": 0.5663, "mean_token_accuracy": 0.8280689716339111, "num_tokens": 671460961.0, "step": 21038 }, { "entropy": 0.5961984610185027, "epoch": 1.9357047975572308, "grad_norm": 0.16228623688220978, "learning_rate": 3.5480111632471556e-05, "loss": 0.5863, "mean_token_accuracy": 0.8189680986106396, "num_tokens": 671492889.0, "step": 21039 }, { "entropy": 0.5314139234833419, "epoch": 1.935796803928672, "grad_norm": 0.14354626834392548, "learning_rate": 3.547704480632993e-05, "loss": 0.508, "mean_token_accuracy": 0.8398086726665497, "num_tokens": 671524859.0, "step": 21040 }, { "entropy": 0.529807454906404, "epoch": 1.9358888103001133, "grad_norm": 0.1434502750635147, "learning_rate": 3.5473977980188305e-05, "loss": 0.5185, "mean_token_accuracy": 0.8394778706133366, "num_tokens": 671556344.0, "step": 21041 }, { "entropy": 0.5909506431780756, "epoch": 1.9359808166715546, "grad_norm": 0.1496492475271225, "learning_rate": 3.547091115404668e-05, "loss": 0.5773, "mean_token_accuracy": 0.8230418153107166, "num_tokens": 671588394.0, "step": 21042 }, { "entropy": 0.4864596966654062, "epoch": 1.9360728230429958, "grad_norm": 0.14517204463481903, "learning_rate": 3.5467844327905055e-05, "loss": 0.4648, "mean_token_accuracy": 0.8509184941649437, "num_tokens": 671620032.0, "step": 21043 }, { "entropy": 0.6890198104083538, "epoch": 1.936164829414437, "grad_norm": 0.157669335603714, "learning_rate": 3.546477750176342e-05, "loss": 0.6739, "mean_token_accuracy": 0.7937834896147251, "num_tokens": 671652338.0, "step": 21044 }, { "entropy": 0.671354933641851, "epoch": 1.936256835785878, "grad_norm": 0.16258160769939423, "learning_rate": 3.5461710675621804e-05, "loss": 0.6679, "mean_token_accuracy": 0.7967691496014595, "num_tokens": 671683954.0, "step": 21045 }, { "entropy": 0.5552721489220858, "epoch": 1.9363488421573194, "grad_norm": 0.14946427941322327, "learning_rate": 3.545864384948017e-05, "loss": 0.5434, "mean_token_accuracy": 0.8289774879813194, "num_tokens": 671714950.0, "step": 21046 }, { "entropy": 0.7620738744735718, "epoch": 1.9364408485287607, "grad_norm": 0.16499429941177368, "learning_rate": 3.5455577023338546e-05, "loss": 0.7715, "mean_token_accuracy": 0.7695983648300171, "num_tokens": 671747224.0, "step": 21047 }, { "entropy": 0.6368988025933504, "epoch": 1.9365328549002019, "grad_norm": 0.16705043613910675, "learning_rate": 3.545251019719693e-05, "loss": 0.6359, "mean_token_accuracy": 0.8042364977300167, "num_tokens": 671777133.0, "step": 21048 }, { "entropy": 0.6488419063389301, "epoch": 1.936624861271643, "grad_norm": 0.1574087142944336, "learning_rate": 3.5449443371055296e-05, "loss": 0.6474, "mean_token_accuracy": 0.8001207672059536, "num_tokens": 671809115.0, "step": 21049 }, { "entropy": 0.6558872209861875, "epoch": 1.9367168676430842, "grad_norm": 0.16187308728694916, "learning_rate": 3.544637654491367e-05, "loss": 0.6506, "mean_token_accuracy": 0.8019889071583748, "num_tokens": 671840317.0, "step": 21050 }, { "entropy": 0.7279415279626846, "epoch": 1.9368088740145255, "grad_norm": 0.16366557776927948, "learning_rate": 3.5443309718772045e-05, "loss": 0.7219, "mean_token_accuracy": 0.7809479162096977, "num_tokens": 671871621.0, "step": 21051 }, { "entropy": 0.6148368921130896, "epoch": 1.9369008803859669, "grad_norm": 0.1532166600227356, "learning_rate": 3.544024289263042e-05, "loss": 0.5924, "mean_token_accuracy": 0.8181763961911201, "num_tokens": 671903460.0, "step": 21052 }, { "entropy": 0.5535617601126432, "epoch": 1.936992886757408, "grad_norm": 0.14910238981246948, "learning_rate": 3.5437176066488794e-05, "loss": 0.5308, "mean_token_accuracy": 0.8353792205452919, "num_tokens": 671934795.0, "step": 21053 }, { "entropy": 0.5725520867854357, "epoch": 1.9370848931288491, "grad_norm": 0.14689470827579498, "learning_rate": 3.543410924034717e-05, "loss": 0.5494, "mean_token_accuracy": 0.8293032348155975, "num_tokens": 671966721.0, "step": 21054 }, { "entropy": 0.5601379035506397, "epoch": 1.9371768995002903, "grad_norm": 0.1475437432527542, "learning_rate": 3.543104241420554e-05, "loss": 0.5512, "mean_token_accuracy": 0.8300545625388622, "num_tokens": 671998592.0, "step": 21055 }, { "entropy": 0.5567045072093606, "epoch": 1.9372689058717316, "grad_norm": 0.144245445728302, "learning_rate": 3.542797558806392e-05, "loss": 0.5424, "mean_token_accuracy": 0.8314091451466084, "num_tokens": 672030987.0, "step": 21056 }, { "entropy": 0.5480721769854426, "epoch": 1.937360912243173, "grad_norm": 0.15121717751026154, "learning_rate": 3.5424908761922286e-05, "loss": 0.543, "mean_token_accuracy": 0.8334245085716248, "num_tokens": 672063551.0, "step": 21057 }, { "entropy": 0.5679698344320059, "epoch": 1.937452918614614, "grad_norm": 0.14954236149787903, "learning_rate": 3.542184193578067e-05, "loss": 0.5556, "mean_token_accuracy": 0.8290955014526844, "num_tokens": 672095831.0, "step": 21058 }, { "entropy": 0.5903918091207743, "epoch": 1.9375449249860552, "grad_norm": 0.15566781163215637, "learning_rate": 3.5418775109639035e-05, "loss": 0.5814, "mean_token_accuracy": 0.8216296173632145, "num_tokens": 672127472.0, "step": 21059 }, { "entropy": 0.680519123794511, "epoch": 1.9376369313574964, "grad_norm": 0.15862521529197693, "learning_rate": 3.541570828349741e-05, "loss": 0.6667, "mean_token_accuracy": 0.7958555594086647, "num_tokens": 672159097.0, "step": 21060 }, { "entropy": 0.6613015364855528, "epoch": 1.9377289377289377, "grad_norm": 0.16799317300319672, "learning_rate": 3.5412641457355785e-05, "loss": 0.6458, "mean_token_accuracy": 0.8024346195161343, "num_tokens": 672190145.0, "step": 21061 }, { "entropy": 0.5561405452899635, "epoch": 1.937820944100379, "grad_norm": 0.15074095129966736, "learning_rate": 3.540957463121416e-05, "loss": 0.5578, "mean_token_accuracy": 0.8277603089809418, "num_tokens": 672222586.0, "step": 21062 }, { "entropy": 0.5803225804120302, "epoch": 1.9379129504718202, "grad_norm": 0.1520179659128189, "learning_rate": 3.5406507805072534e-05, "loss": 0.5644, "mean_token_accuracy": 0.8246145322918892, "num_tokens": 672254577.0, "step": 21063 }, { "entropy": 0.5606180168688297, "epoch": 1.9380049568432614, "grad_norm": 0.1575687676668167, "learning_rate": 3.540344097893091e-05, "loss": 0.5492, "mean_token_accuracy": 0.8288042657077312, "num_tokens": 672286171.0, "step": 21064 }, { "entropy": 0.6245539095252752, "epoch": 1.9380969632147025, "grad_norm": 0.15356481075286865, "learning_rate": 3.5400374152789276e-05, "loss": 0.6112, "mean_token_accuracy": 0.8114136680960655, "num_tokens": 672318388.0, "step": 21065 }, { "entropy": 0.5305067133158445, "epoch": 1.9381889695861438, "grad_norm": 0.144336998462677, "learning_rate": 3.539730732664766e-05, "loss": 0.5315, "mean_token_accuracy": 0.8378524743020535, "num_tokens": 672350583.0, "step": 21066 }, { "entropy": 0.6018648066092283, "epoch": 1.9382809759575852, "grad_norm": 0.15473908185958862, "learning_rate": 3.5394240500506026e-05, "loss": 0.5844, "mean_token_accuracy": 0.8172145187854767, "num_tokens": 672381882.0, "step": 21067 }, { "entropy": 0.638340562582016, "epoch": 1.9383729823290263, "grad_norm": 0.1571953147649765, "learning_rate": 3.53911736743644e-05, "loss": 0.622, "mean_token_accuracy": 0.8136678971350193, "num_tokens": 672414455.0, "step": 21068 }, { "entropy": 0.5311969169415534, "epoch": 1.9384649887004675, "grad_norm": 0.14701789617538452, "learning_rate": 3.5388106848222775e-05, "loss": 0.5205, "mean_token_accuracy": 0.8391000330448151, "num_tokens": 672446552.0, "step": 21069 }, { "entropy": 0.5454166643321514, "epoch": 1.9385569950719086, "grad_norm": 0.14627376198768616, "learning_rate": 3.538504002208115e-05, "loss": 0.5306, "mean_token_accuracy": 0.8345199935138226, "num_tokens": 672478943.0, "step": 21070 }, { "entropy": 0.54716657102108, "epoch": 1.93864900144335, "grad_norm": 0.1509687602519989, "learning_rate": 3.5381973195939524e-05, "loss": 0.5366, "mean_token_accuracy": 0.8332277834415436, "num_tokens": 672511377.0, "step": 21071 }, { "entropy": 0.5992094203829765, "epoch": 1.9387410078147913, "grad_norm": 0.16002914309501648, "learning_rate": 3.53789063697979e-05, "loss": 0.6, "mean_token_accuracy": 0.8158404864370823, "num_tokens": 672543725.0, "step": 21072 }, { "entropy": 0.585513043217361, "epoch": 1.9388330141862324, "grad_norm": 0.14997336268424988, "learning_rate": 3.537583954365627e-05, "loss": 0.5764, "mean_token_accuracy": 0.8218410164117813, "num_tokens": 672576302.0, "step": 21073 }, { "entropy": 0.5962495459243655, "epoch": 1.9389250205576736, "grad_norm": 0.15920546650886536, "learning_rate": 3.537277271751465e-05, "loss": 0.5932, "mean_token_accuracy": 0.8138962276279926, "num_tokens": 672608182.0, "step": 21074 }, { "entropy": 0.6396163199096918, "epoch": 1.9390170269291147, "grad_norm": 0.15572337806224823, "learning_rate": 3.5369705891373016e-05, "loss": 0.6332, "mean_token_accuracy": 0.8037468530237675, "num_tokens": 672640420.0, "step": 21075 }, { "entropy": 0.5418031474109739, "epoch": 1.939109033300556, "grad_norm": 0.15634150803089142, "learning_rate": 3.536663906523139e-05, "loss": 0.524, "mean_token_accuracy": 0.834706474095583, "num_tokens": 672671491.0, "step": 21076 }, { "entropy": 0.7140256725251675, "epoch": 1.9392010396719974, "grad_norm": 0.1688416302204132, "learning_rate": 3.5363572239089765e-05, "loss": 0.7208, "mean_token_accuracy": 0.783384557813406, "num_tokens": 672703522.0, "step": 21077 }, { "entropy": 0.6379261612892151, "epoch": 1.9392930460434386, "grad_norm": 0.15758955478668213, "learning_rate": 3.536050541294814e-05, "loss": 0.6345, "mean_token_accuracy": 0.8029408305883408, "num_tokens": 672734902.0, "step": 21078 }, { "entropy": 0.518437503837049, "epoch": 1.9393850524148797, "grad_norm": 0.14304105937480927, "learning_rate": 3.535743858680652e-05, "loss": 0.5048, "mean_token_accuracy": 0.8418732061982155, "num_tokens": 672767376.0, "step": 21079 }, { "entropy": 0.4834328384604305, "epoch": 1.9394770587863208, "grad_norm": 0.14102478325366974, "learning_rate": 3.535437176066489e-05, "loss": 0.4824, "mean_token_accuracy": 0.8468277379870415, "num_tokens": 672799095.0, "step": 21080 }, { "entropy": 0.653508416377008, "epoch": 1.9395690651577622, "grad_norm": 0.15854927897453308, "learning_rate": 3.5351304934523264e-05, "loss": 0.6451, "mean_token_accuracy": 0.8027828857302666, "num_tokens": 672831089.0, "step": 21081 }, { "entropy": 0.5784225314855576, "epoch": 1.9396610715292035, "grad_norm": 0.1548815816640854, "learning_rate": 3.534823810838164e-05, "loss": 0.5683, "mean_token_accuracy": 0.8212367035448551, "num_tokens": 672861978.0, "step": 21082 }, { "entropy": 0.5670578982681036, "epoch": 1.9397530779006447, "grad_norm": 0.15146560966968536, "learning_rate": 3.534517128224001e-05, "loss": 0.5505, "mean_token_accuracy": 0.8315583541989326, "num_tokens": 672894314.0, "step": 21083 }, { "entropy": 0.5948806665837765, "epoch": 1.9398450842720858, "grad_norm": 0.15256443619728088, "learning_rate": 3.534210445609839e-05, "loss": 0.5793, "mean_token_accuracy": 0.8179754763841629, "num_tokens": 672926286.0, "step": 21084 }, { "entropy": 0.5539268665015697, "epoch": 1.939937090643527, "grad_norm": 0.153995543718338, "learning_rate": 3.533903762995676e-05, "loss": 0.5527, "mean_token_accuracy": 0.8308608718216419, "num_tokens": 672958701.0, "step": 21085 }, { "entropy": 0.6816992964595556, "epoch": 1.9400290970149683, "grad_norm": 0.15622027218341827, "learning_rate": 3.533597080381513e-05, "loss": 0.6777, "mean_token_accuracy": 0.7930000200867653, "num_tokens": 672991466.0, "step": 21086 }, { "entropy": 0.7099622040987015, "epoch": 1.9401211033864096, "grad_norm": 0.17000322043895721, "learning_rate": 3.533290397767351e-05, "loss": 0.7143, "mean_token_accuracy": 0.7874784842133522, "num_tokens": 673023407.0, "step": 21087 }, { "entropy": 0.6169787200633436, "epoch": 1.9402131097578508, "grad_norm": 0.1517297476530075, "learning_rate": 3.532983715153188e-05, "loss": 0.6085, "mean_token_accuracy": 0.8138560764491558, "num_tokens": 673055993.0, "step": 21088 }, { "entropy": 0.7156086452305317, "epoch": 1.940305116129292, "grad_norm": 0.16535848379135132, "learning_rate": 3.5326770325390254e-05, "loss": 0.6995, "mean_token_accuracy": 0.7916831448674202, "num_tokens": 673087795.0, "step": 21089 }, { "entropy": 0.5574422515928745, "epoch": 1.940397122500733, "grad_norm": 0.14718714356422424, "learning_rate": 3.532370349924863e-05, "loss": 0.5417, "mean_token_accuracy": 0.8302916660904884, "num_tokens": 673119677.0, "step": 21090 }, { "entropy": 0.5159404468722641, "epoch": 1.9404891288721744, "grad_norm": 0.14048920571804047, "learning_rate": 3.5320636673107004e-05, "loss": 0.4922, "mean_token_accuracy": 0.8433087207376957, "num_tokens": 673152115.0, "step": 21091 }, { "entropy": 0.4722126917913556, "epoch": 1.9405811352436158, "grad_norm": 0.1459016501903534, "learning_rate": 3.531756984696538e-05, "loss": 0.4632, "mean_token_accuracy": 0.8512912504374981, "num_tokens": 673183049.0, "step": 21092 }, { "entropy": 0.6596486642956734, "epoch": 1.9406731416150569, "grad_norm": 0.15640948712825775, "learning_rate": 3.531450302082375e-05, "loss": 0.645, "mean_token_accuracy": 0.8003394193947315, "num_tokens": 673214700.0, "step": 21093 }, { "entropy": 0.5302407231647521, "epoch": 1.940765147986498, "grad_norm": 0.14168362319469452, "learning_rate": 3.531143619468212e-05, "loss": 0.5141, "mean_token_accuracy": 0.84062360227108, "num_tokens": 673247265.0, "step": 21094 }, { "entropy": 0.6055217115208507, "epoch": 1.9408571543579392, "grad_norm": 0.1535567045211792, "learning_rate": 3.53083693685405e-05, "loss": 0.5792, "mean_token_accuracy": 0.8179774545133114, "num_tokens": 673278515.0, "step": 21095 }, { "entropy": 0.5196006121113896, "epoch": 1.9409491607293805, "grad_norm": 0.14893615245819092, "learning_rate": 3.530530254239887e-05, "loss": 0.493, "mean_token_accuracy": 0.8483791202306747, "num_tokens": 673310261.0, "step": 21096 }, { "entropy": 0.5973775889724493, "epoch": 1.9410411671008219, "grad_norm": 0.15082325041294098, "learning_rate": 3.5302235716257245e-05, "loss": 0.5746, "mean_token_accuracy": 0.8194984421133995, "num_tokens": 673342549.0, "step": 21097 }, { "entropy": 0.6213447228074074, "epoch": 1.941133173472263, "grad_norm": 0.15786127746105194, "learning_rate": 3.529916889011562e-05, "loss": 0.6115, "mean_token_accuracy": 0.813865166157484, "num_tokens": 673374008.0, "step": 21098 }, { "entropy": 0.57998260948807, "epoch": 1.9412251798437041, "grad_norm": 0.15159597992897034, "learning_rate": 3.5296102063973994e-05, "loss": 0.5671, "mean_token_accuracy": 0.8225993178784847, "num_tokens": 673406094.0, "step": 21099 }, { "entropy": 0.6760702207684517, "epoch": 1.9413171862151453, "grad_norm": 0.16838495433330536, "learning_rate": 3.529303523783237e-05, "loss": 0.665, "mean_token_accuracy": 0.7956082485616207, "num_tokens": 673437434.0, "step": 21100 }, { "entropy": 0.648907845839858, "epoch": 1.9414091925865866, "grad_norm": 0.1617743819952011, "learning_rate": 3.5289968411690743e-05, "loss": 0.6405, "mean_token_accuracy": 0.8007350526750088, "num_tokens": 673468547.0, "step": 21101 }, { "entropy": 0.6757451016455889, "epoch": 1.941501198958028, "grad_norm": 0.1610538810491562, "learning_rate": 3.528690158554912e-05, "loss": 0.6689, "mean_token_accuracy": 0.7901255562901497, "num_tokens": 673499992.0, "step": 21102 }, { "entropy": 0.620975551661104, "epoch": 1.941593205329469, "grad_norm": 0.15631914138793945, "learning_rate": 3.528383475940749e-05, "loss": 0.6111, "mean_token_accuracy": 0.8123730570077896, "num_tokens": 673532051.0, "step": 21103 }, { "entropy": 0.6451004287227988, "epoch": 1.9416852117009102, "grad_norm": 0.16381248831748962, "learning_rate": 3.528076793326586e-05, "loss": 0.6585, "mean_token_accuracy": 0.7962328419089317, "num_tokens": 673564166.0, "step": 21104 }, { "entropy": 0.5340946279466152, "epoch": 1.9417772180723514, "grad_norm": 0.15023936331272125, "learning_rate": 3.527770110712424e-05, "loss": 0.534, "mean_token_accuracy": 0.8312482796609402, "num_tokens": 673596222.0, "step": 21105 }, { "entropy": 0.6827433342114091, "epoch": 1.9418692244437927, "grad_norm": 0.16161347925662994, "learning_rate": 3.527463428098261e-05, "loss": 0.6828, "mean_token_accuracy": 0.7910895757377148, "num_tokens": 673627963.0, "step": 21106 }, { "entropy": 0.7399024683982134, "epoch": 1.941961230815234, "grad_norm": 0.17195776104927063, "learning_rate": 3.5271567454840985e-05, "loss": 0.7395, "mean_token_accuracy": 0.7784049585461617, "num_tokens": 673658147.0, "step": 21107 }, { "entropy": 0.6156222857534885, "epoch": 1.9420532371866752, "grad_norm": 0.1529000699520111, "learning_rate": 3.526850062869936e-05, "loss": 0.6095, "mean_token_accuracy": 0.811502356082201, "num_tokens": 673690253.0, "step": 21108 }, { "entropy": 0.5939344807993621, "epoch": 1.9421452435581164, "grad_norm": 0.15004222095012665, "learning_rate": 3.5265433802557734e-05, "loss": 0.5871, "mean_token_accuracy": 0.819267313927412, "num_tokens": 673722461.0, "step": 21109 }, { "entropy": 0.6097060653846711, "epoch": 1.9422372499295575, "grad_norm": 0.15976926684379578, "learning_rate": 3.526236697641611e-05, "loss": 0.5967, "mean_token_accuracy": 0.8169668726623058, "num_tokens": 673752882.0, "step": 21110 }, { "entropy": 0.6457788739353418, "epoch": 1.9423292563009988, "grad_norm": 0.1520669013261795, "learning_rate": 3.525930015027448e-05, "loss": 0.638, "mean_token_accuracy": 0.8037924133241177, "num_tokens": 673785100.0, "step": 21111 }, { "entropy": 0.5910355187952518, "epoch": 1.9424212626724402, "grad_norm": 0.15229327976703644, "learning_rate": 3.525623332413286e-05, "loss": 0.584, "mean_token_accuracy": 0.8140804953873158, "num_tokens": 673816202.0, "step": 21112 }, { "entropy": 0.5944309905171394, "epoch": 1.9425132690438813, "grad_norm": 0.15165483951568604, "learning_rate": 3.525316649799123e-05, "loss": 0.5786, "mean_token_accuracy": 0.821059089154005, "num_tokens": 673848064.0, "step": 21113 }, { "entropy": 0.6718060686253011, "epoch": 1.9426052754153225, "grad_norm": 0.1640038639307022, "learning_rate": 3.525009967184961e-05, "loss": 0.6722, "mean_token_accuracy": 0.7942634336650372, "num_tokens": 673879726.0, "step": 21114 }, { "entropy": 0.5386967118829489, "epoch": 1.9426972817867636, "grad_norm": 0.14361542463302612, "learning_rate": 3.5247032845707975e-05, "loss": 0.5271, "mean_token_accuracy": 0.838067252188921, "num_tokens": 673912401.0, "step": 21115 }, { "entropy": 0.5571354227140546, "epoch": 1.942789288158205, "grad_norm": 0.15065163373947144, "learning_rate": 3.5243966019566356e-05, "loss": 0.5519, "mean_token_accuracy": 0.8272191472351551, "num_tokens": 673944437.0, "step": 21116 }, { "entropy": 0.6177350906655192, "epoch": 1.9428812945296463, "grad_norm": 0.15302814543247223, "learning_rate": 3.5240899193424724e-05, "loss": 0.5949, "mean_token_accuracy": 0.8181536681950092, "num_tokens": 673976526.0, "step": 21117 }, { "entropy": 0.7474772818386555, "epoch": 1.9429733009010874, "grad_norm": 0.161213219165802, "learning_rate": 3.5237832367283106e-05, "loss": 0.7436, "mean_token_accuracy": 0.774564404040575, "num_tokens": 674008695.0, "step": 21118 }, { "entropy": 0.7545532565563917, "epoch": 1.9430653072725286, "grad_norm": 0.16054843366146088, "learning_rate": 3.5234765541141474e-05, "loss": 0.7553, "mean_token_accuracy": 0.7738386280834675, "num_tokens": 674040143.0, "step": 21119 }, { "entropy": 0.6749900411814451, "epoch": 1.9431573136439697, "grad_norm": 0.15499627590179443, "learning_rate": 3.523169871499985e-05, "loss": 0.6682, "mean_token_accuracy": 0.798163678497076, "num_tokens": 674072354.0, "step": 21120 }, { "entropy": 0.666409807279706, "epoch": 1.943249320015411, "grad_norm": 0.1540798544883728, "learning_rate": 3.522863188885822e-05, "loss": 0.6567, "mean_token_accuracy": 0.7996412105858326, "num_tokens": 674104746.0, "step": 21121 }, { "entropy": 0.5442041754722595, "epoch": 1.9433413263868524, "grad_norm": 0.15611013770103455, "learning_rate": 3.52255650627166e-05, "loss": 0.5279, "mean_token_accuracy": 0.8323401845991611, "num_tokens": 674136472.0, "step": 21122 }, { "entropy": 0.5975530222058296, "epoch": 1.9434333327582936, "grad_norm": 0.15374962985515594, "learning_rate": 3.522249823657497e-05, "loss": 0.6013, "mean_token_accuracy": 0.8156718872487545, "num_tokens": 674168686.0, "step": 21123 }, { "entropy": 0.6092519536614418, "epoch": 1.9435253391297347, "grad_norm": 0.1519843488931656, "learning_rate": 3.521943141043335e-05, "loss": 0.6059, "mean_token_accuracy": 0.8122321106493473, "num_tokens": 674201013.0, "step": 21124 }, { "entropy": 0.5147844322491437, "epoch": 1.9436173455011758, "grad_norm": 0.1464810073375702, "learning_rate": 3.5216364584291715e-05, "loss": 0.511, "mean_token_accuracy": 0.845318466424942, "num_tokens": 674232593.0, "step": 21125 }, { "entropy": 0.4749322235584259, "epoch": 1.9437093518726172, "grad_norm": 0.14321060478687286, "learning_rate": 3.5213297758150096e-05, "loss": 0.4568, "mean_token_accuracy": 0.8564694561064243, "num_tokens": 674264866.0, "step": 21126 }, { "entropy": 0.5724223684519529, "epoch": 1.9438013582440585, "grad_norm": 0.15480278432369232, "learning_rate": 3.5210230932008464e-05, "loss": 0.5726, "mean_token_accuracy": 0.8279247060418129, "num_tokens": 674296783.0, "step": 21127 }, { "entropy": 0.6496510626748204, "epoch": 1.9438933646154997, "grad_norm": 0.15441520512104034, "learning_rate": 3.520716410586684e-05, "loss": 0.6256, "mean_token_accuracy": 0.8053148649632931, "num_tokens": 674329047.0, "step": 21128 }, { "entropy": 0.553263945505023, "epoch": 1.9439853709869408, "grad_norm": 0.1483747810125351, "learning_rate": 3.520409727972521e-05, "loss": 0.5411, "mean_token_accuracy": 0.830707985907793, "num_tokens": 674360550.0, "step": 21129 }, { "entropy": 0.6625782288610935, "epoch": 1.944077377358382, "grad_norm": 0.15963780879974365, "learning_rate": 3.520103045358359e-05, "loss": 0.6597, "mean_token_accuracy": 0.8017937056720257, "num_tokens": 674391124.0, "step": 21130 }, { "entropy": 0.536981095559895, "epoch": 1.9441693837298233, "grad_norm": 0.14362163841724396, "learning_rate": 3.519796362744196e-05, "loss": 0.5207, "mean_token_accuracy": 0.8377651497721672, "num_tokens": 674423541.0, "step": 21131 }, { "entropy": 0.5893666096962988, "epoch": 1.9442613901012646, "grad_norm": 0.15447543561458588, "learning_rate": 3.519489680130034e-05, "loss": 0.569, "mean_token_accuracy": 0.8202257938683033, "num_tokens": 674454811.0, "step": 21132 }, { "entropy": 0.5051316637545824, "epoch": 1.9443533964727058, "grad_norm": 0.14048807322978973, "learning_rate": 3.5191829975158705e-05, "loss": 0.4869, "mean_token_accuracy": 0.8467642851173878, "num_tokens": 674486811.0, "step": 21133 }, { "entropy": 0.6028444338589907, "epoch": 1.944445402844147, "grad_norm": 0.1495034545660019, "learning_rate": 3.5188763149017087e-05, "loss": 0.6031, "mean_token_accuracy": 0.8159864619374275, "num_tokens": 674518967.0, "step": 21134 }, { "entropy": 0.442231684923172, "epoch": 1.944537409215588, "grad_norm": 0.14409038424491882, "learning_rate": 3.5185696322875454e-05, "loss": 0.4312, "mean_token_accuracy": 0.8652712255716324, "num_tokens": 674551006.0, "step": 21135 }, { "entropy": 0.5563779277727008, "epoch": 1.9446294155870294, "grad_norm": 0.1503056436777115, "learning_rate": 3.518262949673383e-05, "loss": 0.5423, "mean_token_accuracy": 0.8321196250617504, "num_tokens": 674583214.0, "step": 21136 }, { "entropy": 0.6214941469952464, "epoch": 1.9447214219584708, "grad_norm": 0.1600808948278427, "learning_rate": 3.5179562670592204e-05, "loss": 0.6062, "mean_token_accuracy": 0.8131311237812042, "num_tokens": 674615176.0, "step": 21137 }, { "entropy": 0.5862725721672177, "epoch": 1.9448134283299119, "grad_norm": 0.15820875763893127, "learning_rate": 3.517649584445058e-05, "loss": 0.5693, "mean_token_accuracy": 0.8246641382575035, "num_tokens": 674647774.0, "step": 21138 }, { "entropy": 0.6366270165890455, "epoch": 1.944905434701353, "grad_norm": 0.15203215181827545, "learning_rate": 3.517342901830895e-05, "loss": 0.6275, "mean_token_accuracy": 0.8050635941326618, "num_tokens": 674680031.0, "step": 21139 }, { "entropy": 0.5892486702650785, "epoch": 1.9449974410727942, "grad_norm": 0.15298454463481903, "learning_rate": 3.517036219216733e-05, "loss": 0.5874, "mean_token_accuracy": 0.8213777877390385, "num_tokens": 674712222.0, "step": 21140 }, { "entropy": 0.563159310258925, "epoch": 1.9450894474442355, "grad_norm": 0.15539130568504333, "learning_rate": 3.51672953660257e-05, "loss": 0.5421, "mean_token_accuracy": 0.8300041519105434, "num_tokens": 674743299.0, "step": 21141 }, { "entropy": 0.5649460600689054, "epoch": 1.9451814538156769, "grad_norm": 0.14780119061470032, "learning_rate": 3.516422853988408e-05, "loss": 0.5449, "mean_token_accuracy": 0.8303318992257118, "num_tokens": 674774666.0, "step": 21142 }, { "entropy": 0.6922942008823156, "epoch": 1.945273460187118, "grad_norm": 0.1567469835281372, "learning_rate": 3.516116171374245e-05, "loss": 0.6669, "mean_token_accuracy": 0.7952334955334663, "num_tokens": 674806662.0, "step": 21143 }, { "entropy": 0.6413060482591391, "epoch": 1.9453654665585591, "grad_norm": 0.15748682618141174, "learning_rate": 3.5158094887600826e-05, "loss": 0.631, "mean_token_accuracy": 0.8018411807715893, "num_tokens": 674838877.0, "step": 21144 }, { "entropy": 0.49851447995752096, "epoch": 1.9454574729300003, "grad_norm": 0.1481986939907074, "learning_rate": 3.51550280614592e-05, "loss": 0.4917, "mean_token_accuracy": 0.8468871302902699, "num_tokens": 674870974.0, "step": 21145 }, { "entropy": 0.5872944509610534, "epoch": 1.9455494793014416, "grad_norm": 0.14673027396202087, "learning_rate": 3.515196123531757e-05, "loss": 0.5797, "mean_token_accuracy": 0.8217665702104568, "num_tokens": 674903484.0, "step": 21146 }, { "entropy": 0.6022896114736795, "epoch": 1.945641485672883, "grad_norm": 0.15218332409858704, "learning_rate": 3.514889440917595e-05, "loss": 0.6034, "mean_token_accuracy": 0.8126121014356613, "num_tokens": 674935903.0, "step": 21147 }, { "entropy": 0.49689415376633406, "epoch": 1.945733492044324, "grad_norm": 0.14688187837600708, "learning_rate": 3.514582758303432e-05, "loss": 0.4919, "mean_token_accuracy": 0.8453241661190987, "num_tokens": 674968242.0, "step": 21148 }, { "entropy": 0.6492391750216484, "epoch": 1.9458254984157652, "grad_norm": 0.15737171471118927, "learning_rate": 3.514276075689269e-05, "loss": 0.6349, "mean_token_accuracy": 0.8067057467997074, "num_tokens": 675000701.0, "step": 21149 }, { "entropy": 0.5093914568424225, "epoch": 1.9459175047872064, "grad_norm": 0.15608787536621094, "learning_rate": 3.513969393075107e-05, "loss": 0.4932, "mean_token_accuracy": 0.8409525901079178, "num_tokens": 675032245.0, "step": 21150 }, { "entropy": 0.7050650212913752, "epoch": 1.9460095111586477, "grad_norm": 0.15808387100696564, "learning_rate": 3.513662710460944e-05, "loss": 0.6954, "mean_token_accuracy": 0.7871873341500759, "num_tokens": 675064734.0, "step": 21151 }, { "entropy": 0.5956526603549719, "epoch": 1.946101517530089, "grad_norm": 0.1496989130973816, "learning_rate": 3.5133560278467817e-05, "loss": 0.5783, "mean_token_accuracy": 0.821366623044014, "num_tokens": 675096099.0, "step": 21152 }, { "entropy": 0.7196011878550053, "epoch": 1.9461935239015302, "grad_norm": 0.16480940580368042, "learning_rate": 3.513049345232619e-05, "loss": 0.7083, "mean_token_accuracy": 0.787197720259428, "num_tokens": 675127861.0, "step": 21153 }, { "entropy": 0.6184890419244766, "epoch": 1.9462855302729714, "grad_norm": 0.16054661571979523, "learning_rate": 3.512742662618456e-05, "loss": 0.5961, "mean_token_accuracy": 0.8150029331445694, "num_tokens": 675159240.0, "step": 21154 }, { "entropy": 0.5856940457597375, "epoch": 1.9463775366444125, "grad_norm": 0.15374989807605743, "learning_rate": 3.512435980004294e-05, "loss": 0.577, "mean_token_accuracy": 0.8259494677186012, "num_tokens": 675190632.0, "step": 21155 }, { "entropy": 0.6671400079503655, "epoch": 1.9464695430158538, "grad_norm": 0.15164706110954285, "learning_rate": 3.512129297390131e-05, "loss": 0.6596, "mean_token_accuracy": 0.7945193685591221, "num_tokens": 675222892.0, "step": 21156 }, { "entropy": 0.46430599177256227, "epoch": 1.9465615493872952, "grad_norm": 0.1323835700750351, "learning_rate": 3.511822614775968e-05, "loss": 0.455, "mean_token_accuracy": 0.8569858260452747, "num_tokens": 675255660.0, "step": 21157 }, { "entropy": 0.741547167301178, "epoch": 1.9466535557587363, "grad_norm": 0.1702246069908142, "learning_rate": 3.511515932161806e-05, "loss": 0.7411, "mean_token_accuracy": 0.7773579470813274, "num_tokens": 675287620.0, "step": 21158 }, { "entropy": 0.4852101863361895, "epoch": 1.9467455621301775, "grad_norm": 0.14732863008975983, "learning_rate": 3.511209249547643e-05, "loss": 0.4692, "mean_token_accuracy": 0.8549586869776249, "num_tokens": 675319457.0, "step": 21159 }, { "entropy": 0.5897373594343662, "epoch": 1.9468375685016186, "grad_norm": 0.15191657841205597, "learning_rate": 3.510902566933481e-05, "loss": 0.5846, "mean_token_accuracy": 0.822922557592392, "num_tokens": 675351111.0, "step": 21160 }, { "entropy": 0.62624466791749, "epoch": 1.94692957487306, "grad_norm": 0.15380829572677612, "learning_rate": 3.510595884319318e-05, "loss": 0.6131, "mean_token_accuracy": 0.8113961927592754, "num_tokens": 675382583.0, "step": 21161 }, { "entropy": 0.5578221217729151, "epoch": 1.9470215812445013, "grad_norm": 0.14792168140411377, "learning_rate": 3.5102892017051556e-05, "loss": 0.5464, "mean_token_accuracy": 0.8269552029669285, "num_tokens": 675414554.0, "step": 21162 }, { "entropy": 0.5837977407500148, "epoch": 1.9471135876159424, "grad_norm": 0.14814646542072296, "learning_rate": 3.509982519090993e-05, "loss": 0.5752, "mean_token_accuracy": 0.8226541541516781, "num_tokens": 675447043.0, "step": 21163 }, { "entropy": 0.673289836384356, "epoch": 1.9472055939873836, "grad_norm": 0.16611330211162567, "learning_rate": 3.50967583647683e-05, "loss": 0.671, "mean_token_accuracy": 0.7966173961758614, "num_tokens": 675478492.0, "step": 21164 }, { "entropy": 0.542772464454174, "epoch": 1.9472976003588247, "grad_norm": 0.14890050888061523, "learning_rate": 3.509369153862668e-05, "loss": 0.5372, "mean_token_accuracy": 0.8326513916254044, "num_tokens": 675510850.0, "step": 21165 }, { "entropy": 0.6253093536943197, "epoch": 1.947389606730266, "grad_norm": 0.1569082885980606, "learning_rate": 3.509062471248505e-05, "loss": 0.6164, "mean_token_accuracy": 0.8106536455452442, "num_tokens": 675542804.0, "step": 21166 }, { "entropy": 0.6433787336573005, "epoch": 1.9474816131017074, "grad_norm": 0.1537175178527832, "learning_rate": 3.508755788634342e-05, "loss": 0.6453, "mean_token_accuracy": 0.8027309887111187, "num_tokens": 675575428.0, "step": 21167 }, { "entropy": 0.5890108235180378, "epoch": 1.9475736194731486, "grad_norm": 0.1486189216375351, "learning_rate": 3.50844910602018e-05, "loss": 0.5726, "mean_token_accuracy": 0.8213592544198036, "num_tokens": 675607209.0, "step": 21168 }, { "entropy": 0.5913401013240218, "epoch": 1.9476656258445897, "grad_norm": 0.159102663397789, "learning_rate": 3.508142423406017e-05, "loss": 0.5893, "mean_token_accuracy": 0.8160383626818657, "num_tokens": 675638561.0, "step": 21169 }, { "entropy": 0.59797528013587, "epoch": 1.9477576322160308, "grad_norm": 0.149477019906044, "learning_rate": 3.507835740791855e-05, "loss": 0.5836, "mean_token_accuracy": 0.8220556564629078, "num_tokens": 675670821.0, "step": 21170 }, { "entropy": 0.49406406469643116, "epoch": 1.9478496385874722, "grad_norm": 0.1428799033164978, "learning_rate": 3.507529058177692e-05, "loss": 0.4759, "mean_token_accuracy": 0.8494922630488873, "num_tokens": 675702860.0, "step": 21171 }, { "entropy": 0.611619686242193, "epoch": 1.9479416449589135, "grad_norm": 0.15272106230258942, "learning_rate": 3.5072223755635296e-05, "loss": 0.6026, "mean_token_accuracy": 0.8139804601669312, "num_tokens": 675734867.0, "step": 21172 }, { "entropy": 0.537699393928051, "epoch": 1.9480336513303547, "grad_norm": 0.1464865803718567, "learning_rate": 3.506915692949367e-05, "loss": 0.5312, "mean_token_accuracy": 0.8372976519167423, "num_tokens": 675766388.0, "step": 21173 }, { "entropy": 0.6376993958838284, "epoch": 1.9481256577017958, "grad_norm": 0.1539304256439209, "learning_rate": 3.5066090103352045e-05, "loss": 0.6206, "mean_token_accuracy": 0.8109608814120293, "num_tokens": 675797650.0, "step": 21174 }, { "entropy": 0.529043355025351, "epoch": 1.948217664073237, "grad_norm": 0.15068072080612183, "learning_rate": 3.506302327721041e-05, "loss": 0.5151, "mean_token_accuracy": 0.8395100347697735, "num_tokens": 675829460.0, "step": 21175 }, { "entropy": 0.5135677275247872, "epoch": 1.9483096704446783, "grad_norm": 0.14589446783065796, "learning_rate": 3.5059956451068795e-05, "loss": 0.4866, "mean_token_accuracy": 0.852164451032877, "num_tokens": 675861833.0, "step": 21176 }, { "entropy": 0.5956229725852609, "epoch": 1.9484016768161196, "grad_norm": 0.14699962735176086, "learning_rate": 3.505688962492716e-05, "loss": 0.5842, "mean_token_accuracy": 0.8198562748730183, "num_tokens": 675893931.0, "step": 21177 }, { "entropy": 0.5675919177010655, "epoch": 1.9484936831875608, "grad_norm": 0.14698660373687744, "learning_rate": 3.5053822798785544e-05, "loss": 0.5527, "mean_token_accuracy": 0.8343793004751205, "num_tokens": 675926467.0, "step": 21178 }, { "entropy": 0.472188837826252, "epoch": 1.948585689559002, "grad_norm": 0.14754116535186768, "learning_rate": 3.505075597264391e-05, "loss": 0.4691, "mean_token_accuracy": 0.8517677113413811, "num_tokens": 675957945.0, "step": 21179 }, { "entropy": 0.4716261774301529, "epoch": 1.948677695930443, "grad_norm": 0.138109490275383, "learning_rate": 3.5047689146502286e-05, "loss": 0.4578, "mean_token_accuracy": 0.8530156388878822, "num_tokens": 675989895.0, "step": 21180 }, { "entropy": 0.542541990056634, "epoch": 1.9487697023018844, "grad_norm": 0.14492376148700714, "learning_rate": 3.504462232036066e-05, "loss": 0.5383, "mean_token_accuracy": 0.8333529345691204, "num_tokens": 676021516.0, "step": 21181 }, { "entropy": 0.6487901639193296, "epoch": 1.9488617086733258, "grad_norm": 0.15455259382724762, "learning_rate": 3.5041555494219036e-05, "loss": 0.6422, "mean_token_accuracy": 0.8106396980583668, "num_tokens": 676053821.0, "step": 21182 }, { "entropy": 0.6137834191322327, "epoch": 1.9489537150447669, "grad_norm": 0.15304484963417053, "learning_rate": 3.503848866807741e-05, "loss": 0.5938, "mean_token_accuracy": 0.8150101453065872, "num_tokens": 676085131.0, "step": 21183 }, { "entropy": 0.5170519235543907, "epoch": 1.949045721416208, "grad_norm": 0.1537398248910904, "learning_rate": 3.5035421841935785e-05, "loss": 0.5101, "mean_token_accuracy": 0.8428502380847931, "num_tokens": 676116727.0, "step": 21184 }, { "entropy": 0.6346636340022087, "epoch": 1.9491377277876492, "grad_norm": 0.16223998367786407, "learning_rate": 3.503235501579415e-05, "loss": 0.6329, "mean_token_accuracy": 0.8109869584441185, "num_tokens": 676148906.0, "step": 21185 }, { "entropy": 0.7100310921669006, "epoch": 1.9492297341590905, "grad_norm": 0.16653968393802643, "learning_rate": 3.5029288189652534e-05, "loss": 0.722, "mean_token_accuracy": 0.7839757800102234, "num_tokens": 676180647.0, "step": 21186 }, { "entropy": 0.6078567039221525, "epoch": 1.9493217405305319, "grad_norm": 0.15427471697330475, "learning_rate": 3.50262213635109e-05, "loss": 0.6039, "mean_token_accuracy": 0.81739367172122, "num_tokens": 676212490.0, "step": 21187 }, { "entropy": 0.5414308458566666, "epoch": 1.949413746901973, "grad_norm": 0.14683759212493896, "learning_rate": 3.502315453736928e-05, "loss": 0.5371, "mean_token_accuracy": 0.8359721899032593, "num_tokens": 676244336.0, "step": 21188 }, { "entropy": 0.6083430470898747, "epoch": 1.9495057532734141, "grad_norm": 0.15204177796840668, "learning_rate": 3.502008771122765e-05, "loss": 0.6025, "mean_token_accuracy": 0.8184302039444447, "num_tokens": 676277006.0, "step": 21189 }, { "entropy": 0.5111573999747634, "epoch": 1.9495977596448553, "grad_norm": 0.14269046485424042, "learning_rate": 3.5017020885086026e-05, "loss": 0.4958, "mean_token_accuracy": 0.8475249223411083, "num_tokens": 676309323.0, "step": 21190 }, { "entropy": 0.6324782650917768, "epoch": 1.9496897660162966, "grad_norm": 0.15132418274879456, "learning_rate": 3.50139540589444e-05, "loss": 0.6252, "mean_token_accuracy": 0.8084431663155556, "num_tokens": 676341938.0, "step": 21191 }, { "entropy": 0.5739279799163342, "epoch": 1.949781772387738, "grad_norm": 0.15161633491516113, "learning_rate": 3.5010887232802775e-05, "loss": 0.557, "mean_token_accuracy": 0.8249202258884907, "num_tokens": 676373692.0, "step": 21192 }, { "entropy": 0.6871925899758935, "epoch": 1.949873778759179, "grad_norm": 0.16307055950164795, "learning_rate": 3.500782040666114e-05, "loss": 0.6751, "mean_token_accuracy": 0.7938744761049747, "num_tokens": 676405537.0, "step": 21193 }, { "entropy": 0.5077749695628881, "epoch": 1.9499657851306202, "grad_norm": 0.14549468457698822, "learning_rate": 3.5004753580519525e-05, "loss": 0.4946, "mean_token_accuracy": 0.8444218561053276, "num_tokens": 676437931.0, "step": 21194 }, { "entropy": 0.6611486207693815, "epoch": 1.9500577915020614, "grad_norm": 0.15591122210025787, "learning_rate": 3.500168675437789e-05, "loss": 0.6599, "mean_token_accuracy": 0.7998425029218197, "num_tokens": 676470251.0, "step": 21195 }, { "entropy": 0.5718307960778475, "epoch": 1.9501497978735027, "grad_norm": 0.14708861708641052, "learning_rate": 3.499861992823627e-05, "loss": 0.5648, "mean_token_accuracy": 0.8277875781059265, "num_tokens": 676502897.0, "step": 21196 }, { "entropy": 0.6186590623110533, "epoch": 1.950241804244944, "grad_norm": 0.1577519178390503, "learning_rate": 3.499555310209464e-05, "loss": 0.6154, "mean_token_accuracy": 0.8105944879353046, "num_tokens": 676534196.0, "step": 21197 }, { "entropy": 0.632647879421711, "epoch": 1.9503338106163852, "grad_norm": 0.15539008378982544, "learning_rate": 3.4992486275953017e-05, "loss": 0.6224, "mean_token_accuracy": 0.8094610832631588, "num_tokens": 676566579.0, "step": 21198 }, { "entropy": 0.5532479304820299, "epoch": 1.9504258169878264, "grad_norm": 0.14991913735866547, "learning_rate": 3.498941944981139e-05, "loss": 0.5452, "mean_token_accuracy": 0.833648607134819, "num_tokens": 676598114.0, "step": 21199 }, { "entropy": 0.5584917804226279, "epoch": 1.9505178233592675, "grad_norm": 0.15014797449111938, "learning_rate": 3.4986352623669766e-05, "loss": 0.5565, "mean_token_accuracy": 0.8279544673860073, "num_tokens": 676629643.0, "step": 21200 }, { "entropy": 0.6265275795012712, "epoch": 1.9506098297307088, "grad_norm": 0.15130209922790527, "learning_rate": 3.498328579752814e-05, "loss": 0.6165, "mean_token_accuracy": 0.8089497685432434, "num_tokens": 676661528.0, "step": 21201 }, { "entropy": 0.549820520915091, "epoch": 1.9507018361021502, "grad_norm": 0.14475257694721222, "learning_rate": 3.4980218971386515e-05, "loss": 0.5188, "mean_token_accuracy": 0.8376443162560463, "num_tokens": 676692815.0, "step": 21202 }, { "entropy": 0.5840404834598303, "epoch": 1.9507938424735913, "grad_norm": 0.1532512605190277, "learning_rate": 3.497715214524489e-05, "loss": 0.5778, "mean_token_accuracy": 0.8236419335007668, "num_tokens": 676725168.0, "step": 21203 }, { "entropy": 0.5563944801688194, "epoch": 1.9508858488450325, "grad_norm": 0.1493322253227234, "learning_rate": 3.4974085319103264e-05, "loss": 0.5508, "mean_token_accuracy": 0.8297654017806053, "num_tokens": 676756979.0, "step": 21204 }, { "entropy": 0.6069528949446976, "epoch": 1.9509778552164736, "grad_norm": 0.15925318002700806, "learning_rate": 3.497101849296164e-05, "loss": 0.579, "mean_token_accuracy": 0.8168859295547009, "num_tokens": 676787399.0, "step": 21205 }, { "entropy": 0.5991376873571426, "epoch": 1.951069861587915, "grad_norm": 0.15710243582725525, "learning_rate": 3.496795166682001e-05, "loss": 0.5856, "mean_token_accuracy": 0.8212700001895428, "num_tokens": 676819063.0, "step": 21206 }, { "entropy": 0.5743237130809575, "epoch": 1.9511618679593563, "grad_norm": 0.14911198616027832, "learning_rate": 3.496488484067839e-05, "loss": 0.5599, "mean_token_accuracy": 0.8241652883589268, "num_tokens": 676851310.0, "step": 21207 }, { "entropy": 0.5117264855653048, "epoch": 1.9512538743307974, "grad_norm": 0.13848719000816345, "learning_rate": 3.4961818014536756e-05, "loss": 0.498, "mean_token_accuracy": 0.8423976413905621, "num_tokens": 676883358.0, "step": 21208 }, { "entropy": 0.5458907303400338, "epoch": 1.9513458807022386, "grad_norm": 0.1522660106420517, "learning_rate": 3.495875118839513e-05, "loss": 0.5325, "mean_token_accuracy": 0.8359706439077854, "num_tokens": 676915446.0, "step": 21209 }, { "entropy": 0.48553877836093307, "epoch": 1.9514378870736797, "grad_norm": 0.14364679157733917, "learning_rate": 3.4955684362253506e-05, "loss": 0.474, "mean_token_accuracy": 0.8484277911484241, "num_tokens": 676946404.0, "step": 21210 }, { "entropy": 0.5175825217738748, "epoch": 1.951529893445121, "grad_norm": 0.1450655460357666, "learning_rate": 3.495261753611188e-05, "loss": 0.5086, "mean_token_accuracy": 0.8413665629923344, "num_tokens": 676978812.0, "step": 21211 }, { "entropy": 0.5747079723514616, "epoch": 1.9516218998165624, "grad_norm": 0.1451064944267273, "learning_rate": 3.4949550709970255e-05, "loss": 0.5645, "mean_token_accuracy": 0.8281086832284927, "num_tokens": 677011545.0, "step": 21212 }, { "entropy": 0.6787541005760431, "epoch": 1.9517139061880036, "grad_norm": 0.16250883042812347, "learning_rate": 3.494648388382863e-05, "loss": 0.6734, "mean_token_accuracy": 0.7946202792227268, "num_tokens": 677042376.0, "step": 21213 }, { "entropy": 0.5537306685000658, "epoch": 1.9518059125594447, "grad_norm": 0.15378151834011078, "learning_rate": 3.4943417057687e-05, "loss": 0.5501, "mean_token_accuracy": 0.8348008915781975, "num_tokens": 677074104.0, "step": 21214 }, { "entropy": 0.5585094783455133, "epoch": 1.9518979189308858, "grad_norm": 0.15257161855697632, "learning_rate": 3.494035023154538e-05, "loss": 0.546, "mean_token_accuracy": 0.8297864012420177, "num_tokens": 677105894.0, "step": 21215 }, { "entropy": 0.6775063620880246, "epoch": 1.9519899253023272, "grad_norm": 0.15650996565818787, "learning_rate": 3.493728340540375e-05, "loss": 0.6692, "mean_token_accuracy": 0.7961771599948406, "num_tokens": 677138481.0, "step": 21216 }, { "entropy": 0.626062486320734, "epoch": 1.9520819316737685, "grad_norm": 0.15326909720897675, "learning_rate": 3.493421657926212e-05, "loss": 0.6041, "mean_token_accuracy": 0.8138752728700638, "num_tokens": 677169502.0, "step": 21217 }, { "entropy": 0.5695986300706863, "epoch": 1.9521739380452097, "grad_norm": 0.14536736905574799, "learning_rate": 3.4931149753120496e-05, "loss": 0.5517, "mean_token_accuracy": 0.8281738720834255, "num_tokens": 677201955.0, "step": 21218 }, { "entropy": 0.5839372994378209, "epoch": 1.9522659444166508, "grad_norm": 0.15014348924160004, "learning_rate": 3.492808292697887e-05, "loss": 0.5672, "mean_token_accuracy": 0.8245483264327049, "num_tokens": 677233910.0, "step": 21219 }, { "entropy": 0.6591052152216434, "epoch": 1.952357950788092, "grad_norm": 0.1705188751220703, "learning_rate": 3.4925016100837245e-05, "loss": 0.654, "mean_token_accuracy": 0.7977685779333115, "num_tokens": 677266351.0, "step": 21220 }, { "entropy": 0.5695772133767605, "epoch": 1.9524499571595333, "grad_norm": 0.1543361395597458, "learning_rate": 3.492194927469562e-05, "loss": 0.5667, "mean_token_accuracy": 0.8257440812885761, "num_tokens": 677298591.0, "step": 21221 }, { "entropy": 0.6473557855933905, "epoch": 1.9525419635309746, "grad_norm": 0.1707785427570343, "learning_rate": 3.4918882448553995e-05, "loss": 0.6361, "mean_token_accuracy": 0.8045564591884613, "num_tokens": 677329363.0, "step": 21222 }, { "entropy": 0.5951556768268347, "epoch": 1.9526339699024158, "grad_norm": 0.1568307876586914, "learning_rate": 3.491581562241237e-05, "loss": 0.5892, "mean_token_accuracy": 0.8159884549677372, "num_tokens": 677360400.0, "step": 21223 }, { "entropy": 0.5599502557888627, "epoch": 1.952725976273857, "grad_norm": 0.15161392092704773, "learning_rate": 3.491274879627074e-05, "loss": 0.543, "mean_token_accuracy": 0.8337754271924496, "num_tokens": 677392231.0, "step": 21224 }, { "entropy": 0.6476523838937283, "epoch": 1.952817982645298, "grad_norm": 0.15757815539836884, "learning_rate": 3.490968197012912e-05, "loss": 0.6188, "mean_token_accuracy": 0.8074588440358639, "num_tokens": 677424071.0, "step": 21225 }, { "entropy": 0.6206804579123855, "epoch": 1.9529099890167394, "grad_norm": 0.15337297320365906, "learning_rate": 3.4906615143987486e-05, "loss": 0.6191, "mean_token_accuracy": 0.8105106018483639, "num_tokens": 677456260.0, "step": 21226 }, { "entropy": 0.6940821809694171, "epoch": 1.9530019953881808, "grad_norm": 0.17024868726730347, "learning_rate": 3.490354831784586e-05, "loss": 0.6932, "mean_token_accuracy": 0.7883101031184196, "num_tokens": 677487717.0, "step": 21227 }, { "entropy": 0.48105247411876917, "epoch": 1.953094001759622, "grad_norm": 0.15024365484714508, "learning_rate": 3.4900481491704236e-05, "loss": 0.4773, "mean_token_accuracy": 0.8507700935006142, "num_tokens": 677519780.0, "step": 21228 }, { "entropy": 0.48652282916009426, "epoch": 1.953186008131063, "grad_norm": 0.14300437271595, "learning_rate": 3.489741466556261e-05, "loss": 0.4782, "mean_token_accuracy": 0.849780723452568, "num_tokens": 677551788.0, "step": 21229 }, { "entropy": 0.6724676822777838, "epoch": 1.9532780145025042, "grad_norm": 0.1620689034461975, "learning_rate": 3.4894347839420985e-05, "loss": 0.6704, "mean_token_accuracy": 0.8030777834355831, "num_tokens": 677583606.0, "step": 21230 }, { "entropy": 0.5905240904539824, "epoch": 1.9533700208739455, "grad_norm": 0.1523929238319397, "learning_rate": 3.489128101327936e-05, "loss": 0.5862, "mean_token_accuracy": 0.8204774968326092, "num_tokens": 677615593.0, "step": 21231 }, { "entropy": 0.583328727632761, "epoch": 1.9534620272453869, "grad_norm": 0.14860589802265167, "learning_rate": 3.4888214187137734e-05, "loss": 0.563, "mean_token_accuracy": 0.8273405395448208, "num_tokens": 677647623.0, "step": 21232 }, { "entropy": 0.6145699378103018, "epoch": 1.953554033616828, "grad_norm": 0.1575554609298706, "learning_rate": 3.488514736099611e-05, "loss": 0.6022, "mean_token_accuracy": 0.8141400031745434, "num_tokens": 677678994.0, "step": 21233 }, { "entropy": 0.6067977864295244, "epoch": 1.9536460399882691, "grad_norm": 0.15616698563098907, "learning_rate": 3.4882080534854483e-05, "loss": 0.6117, "mean_token_accuracy": 0.8104995712637901, "num_tokens": 677710886.0, "step": 21234 }, { "entropy": 0.6834138967096806, "epoch": 1.9537380463597103, "grad_norm": 0.16220968961715698, "learning_rate": 3.487901370871285e-05, "loss": 0.6654, "mean_token_accuracy": 0.7973011396825314, "num_tokens": 677742606.0, "step": 21235 }, { "entropy": 0.5547855091281235, "epoch": 1.9538300527311516, "grad_norm": 0.1493922919034958, "learning_rate": 3.487594688257123e-05, "loss": 0.546, "mean_token_accuracy": 0.8308116160333157, "num_tokens": 677775004.0, "step": 21236 }, { "entropy": 0.5371629110304639, "epoch": 1.953922059102593, "grad_norm": 0.15950892865657806, "learning_rate": 3.48728800564296e-05, "loss": 0.5389, "mean_token_accuracy": 0.8359327428042889, "num_tokens": 677807065.0, "step": 21237 }, { "entropy": 0.6824213331565261, "epoch": 1.9540140654740341, "grad_norm": 0.16428346931934357, "learning_rate": 3.486981323028798e-05, "loss": 0.6687, "mean_token_accuracy": 0.7963108047842979, "num_tokens": 677838832.0, "step": 21238 }, { "entropy": 0.5519502102397382, "epoch": 1.9541060718454752, "grad_norm": 0.14784544706344604, "learning_rate": 3.486674640414635e-05, "loss": 0.5266, "mean_token_accuracy": 0.8371313288807869, "num_tokens": 677870816.0, "step": 21239 }, { "entropy": 0.6797834057360888, "epoch": 1.9541980782169164, "grad_norm": 0.1655811071395874, "learning_rate": 3.4863679578004725e-05, "loss": 0.6722, "mean_token_accuracy": 0.7952373884618282, "num_tokens": 677901833.0, "step": 21240 }, { "entropy": 0.6036544693633914, "epoch": 1.9542900845883577, "grad_norm": 0.15236428380012512, "learning_rate": 3.48606127518631e-05, "loss": 0.5823, "mean_token_accuracy": 0.8254096731543541, "num_tokens": 677933682.0, "step": 21241 }, { "entropy": 0.5484328456223011, "epoch": 1.954382090959799, "grad_norm": 0.14355501532554626, "learning_rate": 3.4857545925721474e-05, "loss": 0.532, "mean_token_accuracy": 0.8326819688081741, "num_tokens": 677966450.0, "step": 21242 }, { "entropy": 0.590557225048542, "epoch": 1.9544740973312402, "grad_norm": 0.14971302449703217, "learning_rate": 3.485447909957985e-05, "loss": 0.5856, "mean_token_accuracy": 0.8249207995831966, "num_tokens": 677998939.0, "step": 21243 }, { "entropy": 0.5929172728210688, "epoch": 1.9545661037026814, "grad_norm": 0.1550942063331604, "learning_rate": 3.485141227343822e-05, "loss": 0.561, "mean_token_accuracy": 0.8244663737714291, "num_tokens": 678030307.0, "step": 21244 }, { "entropy": 0.560783464461565, "epoch": 1.9546581100741225, "grad_norm": 0.1509559601545334, "learning_rate": 3.484834544729659e-05, "loss": 0.5488, "mean_token_accuracy": 0.8292842656373978, "num_tokens": 678061986.0, "step": 21245 }, { "entropy": 0.605756614357233, "epoch": 1.9547501164455638, "grad_norm": 0.15265458822250366, "learning_rate": 3.484527862115497e-05, "loss": 0.6052, "mean_token_accuracy": 0.8135075345635414, "num_tokens": 678093459.0, "step": 21246 }, { "entropy": 0.6086089685559273, "epoch": 1.9548421228170052, "grad_norm": 0.1578754037618637, "learning_rate": 3.484221179501334e-05, "loss": 0.6043, "mean_token_accuracy": 0.8119109869003296, "num_tokens": 678125868.0, "step": 21247 }, { "entropy": 0.5708864433690906, "epoch": 1.9549341291884463, "grad_norm": 0.14788368344306946, "learning_rate": 3.4839144968871715e-05, "loss": 0.5594, "mean_token_accuracy": 0.8272939510643482, "num_tokens": 678158124.0, "step": 21248 }, { "entropy": 0.5573158585466444, "epoch": 1.9550261355598875, "grad_norm": 0.1528993546962738, "learning_rate": 3.483607814273009e-05, "loss": 0.5556, "mean_token_accuracy": 0.8338116891682148, "num_tokens": 678189891.0, "step": 21249 }, { "entropy": 0.6562768314033747, "epoch": 1.9551181419313286, "grad_norm": 0.161867156624794, "learning_rate": 3.4833011316588464e-05, "loss": 0.6538, "mean_token_accuracy": 0.8050266169011593, "num_tokens": 678220953.0, "step": 21250 }, { "entropy": 0.6099745621904731, "epoch": 1.95521014830277, "grad_norm": 0.15474963188171387, "learning_rate": 3.482994449044684e-05, "loss": 0.5947, "mean_token_accuracy": 0.8168131150305271, "num_tokens": 678253024.0, "step": 21251 }, { "entropy": 0.5209232196211815, "epoch": 1.9553021546742113, "grad_norm": 0.1522378921508789, "learning_rate": 3.4826877664305214e-05, "loss": 0.5131, "mean_token_accuracy": 0.83986846357584, "num_tokens": 678284126.0, "step": 21252 }, { "entropy": 0.6224127486348152, "epoch": 1.9553941610456524, "grad_norm": 0.16225677728652954, "learning_rate": 3.482381083816358e-05, "loss": 0.6079, "mean_token_accuracy": 0.8106058351695538, "num_tokens": 678315248.0, "step": 21253 }, { "entropy": 0.599237774964422, "epoch": 1.9554861674170936, "grad_norm": 0.15027746558189392, "learning_rate": 3.482074401202196e-05, "loss": 0.5879, "mean_token_accuracy": 0.8193577267229557, "num_tokens": 678347052.0, "step": 21254 }, { "entropy": 0.6926392009481788, "epoch": 1.9555781737885347, "grad_norm": 0.1610957384109497, "learning_rate": 3.481767718588033e-05, "loss": 0.6856, "mean_token_accuracy": 0.7888110317289829, "num_tokens": 678378254.0, "step": 21255 }, { "entropy": 0.6342610856518149, "epoch": 1.955670180159976, "grad_norm": 0.1547403484582901, "learning_rate": 3.4814610359738705e-05, "loss": 0.6312, "mean_token_accuracy": 0.806495189666748, "num_tokens": 678410289.0, "step": 21256 }, { "entropy": 0.63203333504498, "epoch": 1.9557621865314174, "grad_norm": 0.15730856359004974, "learning_rate": 3.481154353359708e-05, "loss": 0.6168, "mean_token_accuracy": 0.8091539405286312, "num_tokens": 678441339.0, "step": 21257 }, { "entropy": 0.631457045674324, "epoch": 1.9558541929028586, "grad_norm": 0.14786316454410553, "learning_rate": 3.4808476707455455e-05, "loss": 0.6145, "mean_token_accuracy": 0.8114655166864395, "num_tokens": 678473572.0, "step": 21258 }, { "entropy": 0.520228173583746, "epoch": 1.9559461992742997, "grad_norm": 0.14399346709251404, "learning_rate": 3.480540988131383e-05, "loss": 0.5064, "mean_token_accuracy": 0.8420242443680763, "num_tokens": 678506323.0, "step": 21259 }, { "entropy": 0.6194788403809071, "epoch": 1.9560382056457408, "grad_norm": 0.15868139266967773, "learning_rate": 3.4802343055172204e-05, "loss": 0.6208, "mean_token_accuracy": 0.8127582482993603, "num_tokens": 678538311.0, "step": 21260 }, { "entropy": 0.5707658205647022, "epoch": 1.9561302120171822, "grad_norm": 0.14733117818832397, "learning_rate": 3.479927622903057e-05, "loss": 0.5632, "mean_token_accuracy": 0.8247598335146904, "num_tokens": 678570640.0, "step": 21261 }, { "entropy": 0.7160279713571072, "epoch": 1.9562222183886235, "grad_norm": 0.1650717705488205, "learning_rate": 3.479620940288895e-05, "loss": 0.7066, "mean_token_accuracy": 0.7844678349792957, "num_tokens": 678602261.0, "step": 21262 }, { "entropy": 0.6107361875474453, "epoch": 1.9563142247600647, "grad_norm": 0.15341658890247345, "learning_rate": 3.479314257674733e-05, "loss": 0.592, "mean_token_accuracy": 0.8189074657857418, "num_tokens": 678634659.0, "step": 21263 }, { "entropy": 0.5976233799010515, "epoch": 1.9564062311315058, "grad_norm": 0.1562172919511795, "learning_rate": 3.47900757506057e-05, "loss": 0.5805, "mean_token_accuracy": 0.8204693458974361, "num_tokens": 678667244.0, "step": 21264 }, { "entropy": 0.5614777500741184, "epoch": 1.956498237502947, "grad_norm": 0.14617934823036194, "learning_rate": 3.478700892446408e-05, "loss": 0.5418, "mean_token_accuracy": 0.8307629264891148, "num_tokens": 678699265.0, "step": 21265 }, { "entropy": 0.6613208279013634, "epoch": 1.9565902438743883, "grad_norm": 0.1574053317308426, "learning_rate": 3.4783942098322445e-05, "loss": 0.6551, "mean_token_accuracy": 0.8010853752493858, "num_tokens": 678731811.0, "step": 21266 }, { "entropy": 0.6598533852957189, "epoch": 1.9566822502458296, "grad_norm": 0.15685585141181946, "learning_rate": 3.4780875272180827e-05, "loss": 0.6533, "mean_token_accuracy": 0.8000084683299065, "num_tokens": 678764088.0, "step": 21267 }, { "entropy": 0.5065051196143031, "epoch": 1.9567742566172708, "grad_norm": 0.1507766842842102, "learning_rate": 3.4777808446039194e-05, "loss": 0.5031, "mean_token_accuracy": 0.8465737886726856, "num_tokens": 678796012.0, "step": 21268 }, { "entropy": 0.6727520525455475, "epoch": 1.956866262988712, "grad_norm": 0.15700970590114594, "learning_rate": 3.477474161989757e-05, "loss": 0.667, "mean_token_accuracy": 0.7968422770500183, "num_tokens": 678828104.0, "step": 21269 }, { "entropy": 0.5759826311841607, "epoch": 1.956958269360153, "grad_norm": 0.14591501653194427, "learning_rate": 3.4771674793755944e-05, "loss": 0.573, "mean_token_accuracy": 0.8264354318380356, "num_tokens": 678860240.0, "step": 21270 }, { "entropy": 0.5514581594616175, "epoch": 1.9570502757315944, "grad_norm": 0.15243393182754517, "learning_rate": 3.476860796761432e-05, "loss": 0.5529, "mean_token_accuracy": 0.8282387107610703, "num_tokens": 678892593.0, "step": 21271 }, { "entropy": 0.5130588728934526, "epoch": 1.9571422821030358, "grad_norm": 0.1460019052028656, "learning_rate": 3.476554114147269e-05, "loss": 0.509, "mean_token_accuracy": 0.8418891616165638, "num_tokens": 678924515.0, "step": 21272 }, { "entropy": 0.6407651118934155, "epoch": 1.957234288474477, "grad_norm": 0.15766236186027527, "learning_rate": 3.476247431533107e-05, "loss": 0.631, "mean_token_accuracy": 0.8046779185533524, "num_tokens": 678956985.0, "step": 21273 }, { "entropy": 0.5458691781386733, "epoch": 1.957326294845918, "grad_norm": 0.1486053317785263, "learning_rate": 3.4759407489189436e-05, "loss": 0.5304, "mean_token_accuracy": 0.8331080786883831, "num_tokens": 678988288.0, "step": 21274 }, { "entropy": 0.6098520131781697, "epoch": 1.9574183012173592, "grad_norm": 0.14971628785133362, "learning_rate": 3.475634066304782e-05, "loss": 0.5877, "mean_token_accuracy": 0.8160428181290627, "num_tokens": 679019974.0, "step": 21275 }, { "entropy": 0.5567984082736075, "epoch": 1.9575103075888005, "grad_norm": 0.14632569253444672, "learning_rate": 3.4753273836906185e-05, "loss": 0.5418, "mean_token_accuracy": 0.8343732096254826, "num_tokens": 679052325.0, "step": 21276 }, { "entropy": 0.6465688436292112, "epoch": 1.9576023139602419, "grad_norm": 0.161598339676857, "learning_rate": 3.475020701076456e-05, "loss": 0.6388, "mean_token_accuracy": 0.8045131713151932, "num_tokens": 679084401.0, "step": 21277 }, { "entropy": 0.5679879738017917, "epoch": 1.957694320331683, "grad_norm": 0.14986251294612885, "learning_rate": 3.4747140184622934e-05, "loss": 0.5527, "mean_token_accuracy": 0.8298144713044167, "num_tokens": 679116402.0, "step": 21278 }, { "entropy": 0.6180616759229451, "epoch": 1.9577863267031241, "grad_norm": 0.14767557382583618, "learning_rate": 3.474407335848131e-05, "loss": 0.5961, "mean_token_accuracy": 0.8162252753973007, "num_tokens": 679148815.0, "step": 21279 }, { "entropy": 0.6311952299438417, "epoch": 1.9578783330745653, "grad_norm": 0.15780040621757507, "learning_rate": 3.4741006532339683e-05, "loss": 0.632, "mean_token_accuracy": 0.8092598989605904, "num_tokens": 679181129.0, "step": 21280 }, { "entropy": 0.5653028702363372, "epoch": 1.9579703394460066, "grad_norm": 0.14662279188632965, "learning_rate": 3.473793970619806e-05, "loss": 0.5643, "mean_token_accuracy": 0.823939610272646, "num_tokens": 679213436.0, "step": 21281 }, { "entropy": 0.6156429853290319, "epoch": 1.958062345817448, "grad_norm": 0.15307755768299103, "learning_rate": 3.473487288005643e-05, "loss": 0.6025, "mean_token_accuracy": 0.8165868036448956, "num_tokens": 679245218.0, "step": 21282 }, { "entropy": 0.5706377467140555, "epoch": 1.9581543521888891, "grad_norm": 0.1494438350200653, "learning_rate": 3.473180605391481e-05, "loss": 0.5573, "mean_token_accuracy": 0.8259727470576763, "num_tokens": 679277228.0, "step": 21283 }, { "entropy": 0.6668741051107645, "epoch": 1.9582463585603302, "grad_norm": 0.16291803121566772, "learning_rate": 3.4728739227773175e-05, "loss": 0.6558, "mean_token_accuracy": 0.7985824942588806, "num_tokens": 679308476.0, "step": 21284 }, { "entropy": 0.6714517697691917, "epoch": 1.9583383649317714, "grad_norm": 0.15900953114032745, "learning_rate": 3.472567240163156e-05, "loss": 0.6539, "mean_token_accuracy": 0.8031100630760193, "num_tokens": 679339584.0, "step": 21285 }, { "entropy": 0.6384329907596111, "epoch": 1.9584303713032127, "grad_norm": 0.151958167552948, "learning_rate": 3.4722605575489925e-05, "loss": 0.6297, "mean_token_accuracy": 0.8059686683118343, "num_tokens": 679372336.0, "step": 21286 }, { "entropy": 0.5481289438903332, "epoch": 1.958522377674654, "grad_norm": 0.14974835515022278, "learning_rate": 3.47195387493483e-05, "loss": 0.5404, "mean_token_accuracy": 0.834539633244276, "num_tokens": 679404599.0, "step": 21287 }, { "entropy": 0.5909217689186335, "epoch": 1.9586143840460952, "grad_norm": 0.14868390560150146, "learning_rate": 3.4716471923206674e-05, "loss": 0.577, "mean_token_accuracy": 0.8206322863698006, "num_tokens": 679436759.0, "step": 21288 }, { "entropy": 0.609249516390264, "epoch": 1.9587063904175364, "grad_norm": 0.15404346585273743, "learning_rate": 3.471340509706505e-05, "loss": 0.6025, "mean_token_accuracy": 0.8157104402780533, "num_tokens": 679468781.0, "step": 21289 }, { "entropy": 0.6374495094642043, "epoch": 1.9587983967889775, "grad_norm": 0.16641782224178314, "learning_rate": 3.471033827092342e-05, "loss": 0.6371, "mean_token_accuracy": 0.8062924146652222, "num_tokens": 679500475.0, "step": 21290 }, { "entropy": 0.5360291213728487, "epoch": 1.9588904031604188, "grad_norm": 0.15239493548870087, "learning_rate": 3.47072714447818e-05, "loss": 0.5333, "mean_token_accuracy": 0.8373053222894669, "num_tokens": 679532425.0, "step": 21291 }, { "entropy": 0.6491107679903507, "epoch": 1.9589824095318602, "grad_norm": 0.15571239590644836, "learning_rate": 3.470420461864017e-05, "loss": 0.6373, "mean_token_accuracy": 0.8059737496078014, "num_tokens": 679564713.0, "step": 21292 }, { "entropy": 0.6373206097632647, "epoch": 1.9590744159033013, "grad_norm": 0.15556320548057556, "learning_rate": 3.470113779249855e-05, "loss": 0.6357, "mean_token_accuracy": 0.8084164969623089, "num_tokens": 679597103.0, "step": 21293 }, { "entropy": 0.5706448014825583, "epoch": 1.9591664222747425, "grad_norm": 0.1499788612127304, "learning_rate": 3.469807096635692e-05, "loss": 0.5707, "mean_token_accuracy": 0.8260926902294159, "num_tokens": 679629223.0, "step": 21294 }, { "entropy": 0.48942989110946655, "epoch": 1.9592584286461836, "grad_norm": 0.13804039359092712, "learning_rate": 3.469500414021529e-05, "loss": 0.4816, "mean_token_accuracy": 0.8513868227601051, "num_tokens": 679661720.0, "step": 21295 }, { "entropy": 0.5125891137868166, "epoch": 1.959350435017625, "grad_norm": 0.14112327992916107, "learning_rate": 3.469193731407367e-05, "loss": 0.5007, "mean_token_accuracy": 0.8415563590824604, "num_tokens": 679693758.0, "step": 21296 }, { "entropy": 0.6224912516772747, "epoch": 1.9594424413890663, "grad_norm": 0.15435956418514252, "learning_rate": 3.468887048793204e-05, "loss": 0.6032, "mean_token_accuracy": 0.8141206800937653, "num_tokens": 679725330.0, "step": 21297 }, { "entropy": 0.48347552958875895, "epoch": 1.9595344477605074, "grad_norm": 0.14763052761554718, "learning_rate": 3.468580366179042e-05, "loss": 0.4843, "mean_token_accuracy": 0.8520222194492817, "num_tokens": 679757724.0, "step": 21298 }, { "entropy": 0.7244624998420477, "epoch": 1.9596264541319486, "grad_norm": 0.16685761511325836, "learning_rate": 3.468273683564879e-05, "loss": 0.7152, "mean_token_accuracy": 0.7818176485598087, "num_tokens": 679788773.0, "step": 21299 }, { "entropy": 0.5612758104689419, "epoch": 1.9597184605033897, "grad_norm": 0.1495288759469986, "learning_rate": 3.467967000950716e-05, "loss": 0.554, "mean_token_accuracy": 0.8305947035551071, "num_tokens": 679820716.0, "step": 21300 }, { "entropy": 0.5787014588713646, "epoch": 1.959810466874831, "grad_norm": 0.14948225021362305, "learning_rate": 3.467660318336554e-05, "loss": 0.5745, "mean_token_accuracy": 0.8244138918817043, "num_tokens": 679852481.0, "step": 21301 }, { "entropy": 0.5785278105176985, "epoch": 1.9599024732462724, "grad_norm": 0.1547030359506607, "learning_rate": 3.467353635722391e-05, "loss": 0.5683, "mean_token_accuracy": 0.8264549262821674, "num_tokens": 679885246.0, "step": 21302 }, { "entropy": 0.5095519004389644, "epoch": 1.9599944796177136, "grad_norm": 0.14539030194282532, "learning_rate": 3.467046953108229e-05, "loss": 0.5033, "mean_token_accuracy": 0.8439927734434605, "num_tokens": 679916611.0, "step": 21303 }, { "entropy": 0.6593188587576151, "epoch": 1.9600864859891547, "grad_norm": 0.16093704104423523, "learning_rate": 3.466740270494066e-05, "loss": 0.66, "mean_token_accuracy": 0.8015533797442913, "num_tokens": 679947456.0, "step": 21304 }, { "entropy": 0.6076072193682194, "epoch": 1.9601784923605958, "grad_norm": 0.1548081934452057, "learning_rate": 3.466433587879903e-05, "loss": 0.595, "mean_token_accuracy": 0.8164942227303982, "num_tokens": 679980082.0, "step": 21305 }, { "entropy": 0.676135765388608, "epoch": 1.9602704987320372, "grad_norm": 0.1597762405872345, "learning_rate": 3.466126905265741e-05, "loss": 0.6691, "mean_token_accuracy": 0.7991343252360821, "num_tokens": 680012657.0, "step": 21306 }, { "entropy": 0.6089157704263926, "epoch": 1.9603625051034785, "grad_norm": 0.15165120363235474, "learning_rate": 3.465820222651578e-05, "loss": 0.6053, "mean_token_accuracy": 0.8157533593475819, "num_tokens": 680044599.0, "step": 21307 }, { "entropy": 0.6537646632641554, "epoch": 1.9604545114749197, "grad_norm": 0.1486111432313919, "learning_rate": 3.465513540037415e-05, "loss": 0.6313, "mean_token_accuracy": 0.8040067479014397, "num_tokens": 680076749.0, "step": 21308 }, { "entropy": 0.6516920812427998, "epoch": 1.9605465178463608, "grad_norm": 0.15980876982212067, "learning_rate": 3.465206857423253e-05, "loss": 0.6391, "mean_token_accuracy": 0.8042341805994511, "num_tokens": 680107483.0, "step": 21309 }, { "entropy": 0.6394985038787127, "epoch": 1.960638524217802, "grad_norm": 0.15821999311447144, "learning_rate": 3.46490017480909e-05, "loss": 0.6277, "mean_token_accuracy": 0.8074805438518524, "num_tokens": 680140042.0, "step": 21310 }, { "entropy": 0.6821497092023492, "epoch": 1.9607305305892433, "grad_norm": 0.16409088671207428, "learning_rate": 3.464593492194928e-05, "loss": 0.6698, "mean_token_accuracy": 0.7963251620531082, "num_tokens": 680170654.0, "step": 21311 }, { "entropy": 0.6324073197320104, "epoch": 1.9608225369606846, "grad_norm": 0.15644466876983643, "learning_rate": 3.464286809580765e-05, "loss": 0.6153, "mean_token_accuracy": 0.8095633536577225, "num_tokens": 680201790.0, "step": 21312 }, { "entropy": 0.6134825311601162, "epoch": 1.9609145433321258, "grad_norm": 0.15608546137809753, "learning_rate": 3.463980126966602e-05, "loss": 0.6015, "mean_token_accuracy": 0.8143600486218929, "num_tokens": 680232847.0, "step": 21313 }, { "entropy": 0.5719862459227443, "epoch": 1.961006549703567, "grad_norm": 0.1449672281742096, "learning_rate": 3.46367344435244e-05, "loss": 0.5457, "mean_token_accuracy": 0.8295288160443306, "num_tokens": 680264533.0, "step": 21314 }, { "entropy": 0.543301360681653, "epoch": 1.961098556075008, "grad_norm": 0.15336935222148895, "learning_rate": 3.463366761738277e-05, "loss": 0.5368, "mean_token_accuracy": 0.8345499411225319, "num_tokens": 680295847.0, "step": 21315 }, { "entropy": 0.7133592907339334, "epoch": 1.9611905624464494, "grad_norm": 0.16167475283145905, "learning_rate": 3.4630600791241144e-05, "loss": 0.7101, "mean_token_accuracy": 0.7846650294959545, "num_tokens": 680327538.0, "step": 21316 }, { "entropy": 0.680513403378427, "epoch": 1.9612825688178908, "grad_norm": 0.1578439623117447, "learning_rate": 3.462753396509952e-05, "loss": 0.6715, "mean_token_accuracy": 0.7940363027155399, "num_tokens": 680359659.0, "step": 21317 }, { "entropy": 0.649445541203022, "epoch": 1.961374575189332, "grad_norm": 0.15572932362556458, "learning_rate": 3.462446713895789e-05, "loss": 0.6457, "mean_token_accuracy": 0.7993712648749352, "num_tokens": 680391139.0, "step": 21318 }, { "entropy": 0.5090573215857148, "epoch": 1.961466581560773, "grad_norm": 0.14616280794143677, "learning_rate": 3.462140031281627e-05, "loss": 0.5113, "mean_token_accuracy": 0.8411387205123901, "num_tokens": 680422824.0, "step": 21319 }, { "entropy": 0.5139555558562279, "epoch": 1.9615585879322142, "grad_norm": 0.1421659141778946, "learning_rate": 3.461833348667464e-05, "loss": 0.5056, "mean_token_accuracy": 0.8441520854830742, "num_tokens": 680455243.0, "step": 21320 }, { "entropy": 0.605599083006382, "epoch": 1.9616505943036555, "grad_norm": 0.1522017866373062, "learning_rate": 3.461526666053301e-05, "loss": 0.596, "mean_token_accuracy": 0.8144602812826633, "num_tokens": 680486850.0, "step": 21321 }, { "entropy": 0.6040174718946218, "epoch": 1.9617426006750969, "grad_norm": 0.1535668969154358, "learning_rate": 3.461219983439139e-05, "loss": 0.5944, "mean_token_accuracy": 0.8189722411334515, "num_tokens": 680518958.0, "step": 21322 }, { "entropy": 0.5993740763515234, "epoch": 1.961834607046538, "grad_norm": 0.1532396376132965, "learning_rate": 3.4609133008249766e-05, "loss": 0.6041, "mean_token_accuracy": 0.8109113425016403, "num_tokens": 680550822.0, "step": 21323 }, { "entropy": 0.6341364393010736, "epoch": 1.9619266134179791, "grad_norm": 0.15152688324451447, "learning_rate": 3.460606618210814e-05, "loss": 0.6181, "mean_token_accuracy": 0.8130984269082546, "num_tokens": 680583196.0, "step": 21324 }, { "entropy": 0.6444807928055525, "epoch": 1.9620186197894203, "grad_norm": 0.15271049737930298, "learning_rate": 3.4602999355966515e-05, "loss": 0.6365, "mean_token_accuracy": 0.8064321465790272, "num_tokens": 680615562.0, "step": 21325 }, { "entropy": 0.5193238351494074, "epoch": 1.9621106261608616, "grad_norm": 0.1390783041715622, "learning_rate": 3.459993252982488e-05, "loss": 0.5077, "mean_token_accuracy": 0.8433996886014938, "num_tokens": 680647437.0, "step": 21326 }, { "entropy": 0.63511932361871, "epoch": 1.962202632532303, "grad_norm": 0.15739434957504272, "learning_rate": 3.4596865703683265e-05, "loss": 0.6321, "mean_token_accuracy": 0.8105347640812397, "num_tokens": 680678649.0, "step": 21327 }, { "entropy": 0.5955421254038811, "epoch": 1.9622946389037441, "grad_norm": 0.14818967878818512, "learning_rate": 3.459379887754163e-05, "loss": 0.5819, "mean_token_accuracy": 0.8219969980418682, "num_tokens": 680710482.0, "step": 21328 }, { "entropy": 0.5817691185511649, "epoch": 1.9623866452751852, "grad_norm": 0.1549515575170517, "learning_rate": 3.459073205140001e-05, "loss": 0.5801, "mean_token_accuracy": 0.8231864236295223, "num_tokens": 680742727.0, "step": 21329 }, { "entropy": 0.5611398126929998, "epoch": 1.9624786516466264, "grad_norm": 0.1478196233510971, "learning_rate": 3.458766522525838e-05, "loss": 0.5511, "mean_token_accuracy": 0.8293365016579628, "num_tokens": 680774740.0, "step": 21330 }, { "entropy": 0.560447359457612, "epoch": 1.9625706580180677, "grad_norm": 0.14866481721401215, "learning_rate": 3.4584598399116757e-05, "loss": 0.5525, "mean_token_accuracy": 0.8268001228570938, "num_tokens": 680806265.0, "step": 21331 }, { "entropy": 0.6059398362413049, "epoch": 1.962662664389509, "grad_norm": 0.15114794671535492, "learning_rate": 3.458153157297513e-05, "loss": 0.5931, "mean_token_accuracy": 0.8204022608697414, "num_tokens": 680838917.0, "step": 21332 }, { "entropy": 0.5281822150573134, "epoch": 1.9627546707609502, "grad_norm": 0.14811071753501892, "learning_rate": 3.4578464746833506e-05, "loss": 0.5074, "mean_token_accuracy": 0.8436845727264881, "num_tokens": 680871122.0, "step": 21333 }, { "entropy": 0.6108919596299529, "epoch": 1.9628466771323914, "grad_norm": 0.15862321853637695, "learning_rate": 3.4575397920691874e-05, "loss": 0.5929, "mean_token_accuracy": 0.8177039884030819, "num_tokens": 680902506.0, "step": 21334 }, { "entropy": 0.5826131412759423, "epoch": 1.9629386835038325, "grad_norm": 0.15619121491909027, "learning_rate": 3.4572331094550255e-05, "loss": 0.5733, "mean_token_accuracy": 0.8213238567113876, "num_tokens": 680933615.0, "step": 21335 }, { "entropy": 0.5711074601858854, "epoch": 1.9630306898752738, "grad_norm": 0.15092122554779053, "learning_rate": 3.456926426840862e-05, "loss": 0.5646, "mean_token_accuracy": 0.8257797807455063, "num_tokens": 680965499.0, "step": 21336 }, { "entropy": 0.6008878704160452, "epoch": 1.9631226962467152, "grad_norm": 0.1546105444431305, "learning_rate": 3.4566197442267e-05, "loss": 0.581, "mean_token_accuracy": 0.8200973235070705, "num_tokens": 680997478.0, "step": 21337 }, { "entropy": 0.6683178171515465, "epoch": 1.9632147026181563, "grad_norm": 0.1526942104101181, "learning_rate": 3.456313061612537e-05, "loss": 0.6606, "mean_token_accuracy": 0.7975511141121387, "num_tokens": 681029722.0, "step": 21338 }, { "entropy": 0.615163080394268, "epoch": 1.9633067089895975, "grad_norm": 0.1529007852077484, "learning_rate": 3.456006378998375e-05, "loss": 0.6027, "mean_token_accuracy": 0.8141313940286636, "num_tokens": 681061736.0, "step": 21339 }, { "entropy": 0.6213803123682737, "epoch": 1.9633987153610386, "grad_norm": 0.1533537358045578, "learning_rate": 3.455699696384212e-05, "loss": 0.6241, "mean_token_accuracy": 0.8107949793338776, "num_tokens": 681093620.0, "step": 21340 }, { "entropy": 0.6208348143845797, "epoch": 1.96349072173248, "grad_norm": 0.15056495368480682, "learning_rate": 3.4553930137700496e-05, "loss": 0.6099, "mean_token_accuracy": 0.8158344700932503, "num_tokens": 681126183.0, "step": 21341 }, { "entropy": 0.5893088094890118, "epoch": 1.9635827281039213, "grad_norm": 0.14804711937904358, "learning_rate": 3.455086331155887e-05, "loss": 0.5687, "mean_token_accuracy": 0.8224853090941906, "num_tokens": 681158090.0, "step": 21342 }, { "entropy": 0.5170803861692548, "epoch": 1.9636747344753624, "grad_norm": 0.1451568752527237, "learning_rate": 3.4547796485417246e-05, "loss": 0.52, "mean_token_accuracy": 0.839951429516077, "num_tokens": 681190379.0, "step": 21343 }, { "entropy": 0.5670495652593672, "epoch": 1.9637667408468036, "grad_norm": 0.1448916792869568, "learning_rate": 3.4544729659275613e-05, "loss": 0.5605, "mean_token_accuracy": 0.8253439217805862, "num_tokens": 681222885.0, "step": 21344 }, { "entropy": 0.5857197940349579, "epoch": 1.9638587472182447, "grad_norm": 0.15507422387599945, "learning_rate": 3.4541662833133995e-05, "loss": 0.5728, "mean_token_accuracy": 0.8239479511976242, "num_tokens": 681254945.0, "step": 21345 }, { "entropy": 0.46034914068877697, "epoch": 1.963950753589686, "grad_norm": 0.1397617757320404, "learning_rate": 3.453859600699236e-05, "loss": 0.4397, "mean_token_accuracy": 0.8638803549110889, "num_tokens": 681286447.0, "step": 21346 }, { "entropy": 0.5911430362612009, "epoch": 1.9640427599611274, "grad_norm": 0.15803444385528564, "learning_rate": 3.453552918085074e-05, "loss": 0.5674, "mean_token_accuracy": 0.8239190205931664, "num_tokens": 681318840.0, "step": 21347 }, { "entropy": 0.6496984362602234, "epoch": 1.9641347663325686, "grad_norm": 0.15744134783744812, "learning_rate": 3.453246235470911e-05, "loss": 0.6258, "mean_token_accuracy": 0.8067683428525925, "num_tokens": 681350341.0, "step": 21348 }, { "entropy": 0.5910794101655483, "epoch": 1.9642267727040097, "grad_norm": 0.14841869473457336, "learning_rate": 3.452939552856749e-05, "loss": 0.5763, "mean_token_accuracy": 0.8208978027105331, "num_tokens": 681382488.0, "step": 21349 }, { "entropy": 0.523166986182332, "epoch": 1.9643187790754508, "grad_norm": 0.14202262461185455, "learning_rate": 3.452632870242586e-05, "loss": 0.5131, "mean_token_accuracy": 0.8414236158132553, "num_tokens": 681414708.0, "step": 21350 }, { "entropy": 0.6269142404198647, "epoch": 1.9644107854468922, "grad_norm": 0.15734006464481354, "learning_rate": 3.4523261876284236e-05, "loss": 0.6231, "mean_token_accuracy": 0.8095087967813015, "num_tokens": 681445694.0, "step": 21351 }, { "entropy": 0.5600879918783903, "epoch": 1.9645027918183335, "grad_norm": 0.15250332653522491, "learning_rate": 3.4520195050142604e-05, "loss": 0.5473, "mean_token_accuracy": 0.8284119479358196, "num_tokens": 681477749.0, "step": 21352 }, { "entropy": 0.6088374871760607, "epoch": 1.9645947981897747, "grad_norm": 0.1522459238767624, "learning_rate": 3.4517128224000985e-05, "loss": 0.6041, "mean_token_accuracy": 0.8149850331246853, "num_tokens": 681508686.0, "step": 21353 }, { "entropy": 0.5721741877496243, "epoch": 1.9646868045612158, "grad_norm": 0.15807528793811798, "learning_rate": 3.451406139785936e-05, "loss": 0.5615, "mean_token_accuracy": 0.8224803991615772, "num_tokens": 681539972.0, "step": 21354 }, { "entropy": 0.6042760517448187, "epoch": 1.964778810932657, "grad_norm": 0.15928784012794495, "learning_rate": 3.451099457171773e-05, "loss": 0.5983, "mean_token_accuracy": 0.819581676274538, "num_tokens": 681571972.0, "step": 21355 }, { "entropy": 0.6632423615083098, "epoch": 1.9648708173040983, "grad_norm": 0.1606673002243042, "learning_rate": 3.450792774557611e-05, "loss": 0.6555, "mean_token_accuracy": 0.7998734898865223, "num_tokens": 681603847.0, "step": 21356 }, { "entropy": 0.4825551363173872, "epoch": 1.9649628236755396, "grad_norm": 0.14063936471939087, "learning_rate": 3.450486091943448e-05, "loss": 0.4718, "mean_token_accuracy": 0.8523786328732967, "num_tokens": 681636348.0, "step": 21357 }, { "entropy": 0.4706544578075409, "epoch": 1.9650548300469808, "grad_norm": 0.13893046975135803, "learning_rate": 3.450179409329286e-05, "loss": 0.4637, "mean_token_accuracy": 0.8565869964659214, "num_tokens": 681669069.0, "step": 21358 }, { "entropy": 0.5611624009907246, "epoch": 1.965146836418422, "grad_norm": 0.1531236618757248, "learning_rate": 3.4498727267151226e-05, "loss": 0.5588, "mean_token_accuracy": 0.8256942220032215, "num_tokens": 681700363.0, "step": 21359 }, { "entropy": 0.6286447513848543, "epoch": 1.965238842789863, "grad_norm": 0.15789838135242462, "learning_rate": 3.44956604410096e-05, "loss": 0.6222, "mean_token_accuracy": 0.8140952214598656, "num_tokens": 681732720.0, "step": 21360 }, { "entropy": 0.5804448078852147, "epoch": 1.9653308491613044, "grad_norm": 0.1491953432559967, "learning_rate": 3.4492593614867976e-05, "loss": 0.5686, "mean_token_accuracy": 0.827552855014801, "num_tokens": 681764456.0, "step": 21361 }, { "entropy": 0.5420804088935256, "epoch": 1.9654228555327458, "grad_norm": 0.14461985230445862, "learning_rate": 3.448952678872635e-05, "loss": 0.5292, "mean_token_accuracy": 0.836988303810358, "num_tokens": 681797126.0, "step": 21362 }, { "entropy": 0.6146933985874057, "epoch": 1.965514861904187, "grad_norm": 0.1561742126941681, "learning_rate": 3.4486459962584725e-05, "loss": 0.6091, "mean_token_accuracy": 0.8100478984415531, "num_tokens": 681828524.0, "step": 21363 }, { "entropy": 0.6818519607186317, "epoch": 1.965606868275628, "grad_norm": 0.16190151870250702, "learning_rate": 3.44833931364431e-05, "loss": 0.6786, "mean_token_accuracy": 0.7963639572262764, "num_tokens": 681860331.0, "step": 21364 }, { "entropy": 0.5675434209406376, "epoch": 1.9656988746470692, "grad_norm": 0.15287736058235168, "learning_rate": 3.448032631030147e-05, "loss": 0.5481, "mean_token_accuracy": 0.8299851976335049, "num_tokens": 681891967.0, "step": 21365 }, { "entropy": 0.5778332771733403, "epoch": 1.9657908810185105, "grad_norm": 0.15438541769981384, "learning_rate": 3.447725948415985e-05, "loss": 0.5653, "mean_token_accuracy": 0.822092954069376, "num_tokens": 681923635.0, "step": 21366 }, { "entropy": 0.5539723876863718, "epoch": 1.9658828873899519, "grad_norm": 0.1448909044265747, "learning_rate": 3.447419265801822e-05, "loss": 0.5386, "mean_token_accuracy": 0.8299163170158863, "num_tokens": 681955586.0, "step": 21367 }, { "entropy": 0.7175794765353203, "epoch": 1.965974893761393, "grad_norm": 0.16305571794509888, "learning_rate": 3.447112583187659e-05, "loss": 0.7128, "mean_token_accuracy": 0.7821268066763878, "num_tokens": 681987667.0, "step": 21368 }, { "entropy": 0.6467436701059341, "epoch": 1.9660669001328341, "grad_norm": 0.15374204516410828, "learning_rate": 3.4468059005734966e-05, "loss": 0.6327, "mean_token_accuracy": 0.8082457222044468, "num_tokens": 682019501.0, "step": 21369 }, { "entropy": 0.6034330800175667, "epoch": 1.9661589065042753, "grad_norm": 0.15455403923988342, "learning_rate": 3.446499217959334e-05, "loss": 0.5755, "mean_token_accuracy": 0.820607103407383, "num_tokens": 682050801.0, "step": 21370 }, { "entropy": 0.6339986026287079, "epoch": 1.9662509128757166, "grad_norm": 0.1568659245967865, "learning_rate": 3.4461925353451715e-05, "loss": 0.6314, "mean_token_accuracy": 0.8036801442503929, "num_tokens": 682082589.0, "step": 21371 }, { "entropy": 0.6121579203754663, "epoch": 1.966342919247158, "grad_norm": 0.15067189931869507, "learning_rate": 3.445885852731009e-05, "loss": 0.5959, "mean_token_accuracy": 0.8127848990261555, "num_tokens": 682114644.0, "step": 21372 }, { "entropy": 0.5865286802873015, "epoch": 1.9664349256185991, "grad_norm": 0.1485477238893509, "learning_rate": 3.445579170116846e-05, "loss": 0.5722, "mean_token_accuracy": 0.8231410048902035, "num_tokens": 682146732.0, "step": 21373 }, { "entropy": 0.5870288405567408, "epoch": 1.9665269319900403, "grad_norm": 0.14946693181991577, "learning_rate": 3.445272487502684e-05, "loss": 0.5715, "mean_token_accuracy": 0.8225001096725464, "num_tokens": 682177916.0, "step": 21374 }, { "entropy": 0.5876409010961652, "epoch": 1.9666189383614814, "grad_norm": 0.15029080212116241, "learning_rate": 3.444965804888521e-05, "loss": 0.5808, "mean_token_accuracy": 0.8230478540062904, "num_tokens": 682210036.0, "step": 21375 }, { "entropy": 0.5097418269142509, "epoch": 1.9667109447329227, "grad_norm": 0.14845702052116394, "learning_rate": 3.444659122274358e-05, "loss": 0.5079, "mean_token_accuracy": 0.8434588946402073, "num_tokens": 682242375.0, "step": 21376 }, { "entropy": 0.47766614775173366, "epoch": 1.966802951104364, "grad_norm": 0.1422491818666458, "learning_rate": 3.4443524396601956e-05, "loss": 0.4673, "mean_token_accuracy": 0.8551233857870102, "num_tokens": 682274402.0, "step": 21377 }, { "entropy": 0.5949374139308929, "epoch": 1.9668949574758052, "grad_norm": 0.15084853768348694, "learning_rate": 3.444045757046033e-05, "loss": 0.5788, "mean_token_accuracy": 0.8247289657592773, "num_tokens": 682306046.0, "step": 21378 }, { "entropy": 0.6562820840626955, "epoch": 1.9669869638472464, "grad_norm": 0.15773680806159973, "learning_rate": 3.4437390744318706e-05, "loss": 0.6552, "mean_token_accuracy": 0.8019951395690441, "num_tokens": 682337551.0, "step": 21379 }, { "entropy": 0.5650584008544683, "epoch": 1.9670789702186875, "grad_norm": 0.14844854176044464, "learning_rate": 3.443432391817708e-05, "loss": 0.5492, "mean_token_accuracy": 0.829235851764679, "num_tokens": 682369571.0, "step": 21380 }, { "entropy": 0.6184273194521666, "epoch": 1.9671709765901289, "grad_norm": 0.15808387100696564, "learning_rate": 3.443125709203545e-05, "loss": 0.6119, "mean_token_accuracy": 0.8136148788034916, "num_tokens": 682400096.0, "step": 21381 }, { "entropy": 0.5580392898991704, "epoch": 1.9672629829615702, "grad_norm": 0.14857202768325806, "learning_rate": 3.442819026589383e-05, "loss": 0.5388, "mean_token_accuracy": 0.8335470110177994, "num_tokens": 682431340.0, "step": 21382 }, { "entropy": 0.6230897661298513, "epoch": 1.9673549893330113, "grad_norm": 0.15631352365016937, "learning_rate": 3.44251234397522e-05, "loss": 0.6087, "mean_token_accuracy": 0.8090680204331875, "num_tokens": 682463009.0, "step": 21383 }, { "entropy": 0.6006581578403711, "epoch": 1.9674469957044525, "grad_norm": 0.15539997816085815, "learning_rate": 3.442205661361058e-05, "loss": 0.5981, "mean_token_accuracy": 0.8176520466804504, "num_tokens": 682495191.0, "step": 21384 }, { "entropy": 0.5669614616781473, "epoch": 1.9675390020758936, "grad_norm": 0.15764622390270233, "learning_rate": 3.4418989787468954e-05, "loss": 0.5629, "mean_token_accuracy": 0.825372438877821, "num_tokens": 682527108.0, "step": 21385 }, { "entropy": 0.49716425058431923, "epoch": 1.967631008447335, "grad_norm": 0.1374935358762741, "learning_rate": 3.441592296132732e-05, "loss": 0.486, "mean_token_accuracy": 0.8478306792676449, "num_tokens": 682559575.0, "step": 21386 }, { "entropy": 0.6569050531834364, "epoch": 1.9677230148187763, "grad_norm": 0.15916824340820312, "learning_rate": 3.44128561351857e-05, "loss": 0.6503, "mean_token_accuracy": 0.8017963692545891, "num_tokens": 682592053.0, "step": 21387 }, { "entropy": 0.5195838613435626, "epoch": 1.9678150211902175, "grad_norm": 0.1477191299200058, "learning_rate": 3.440978930904407e-05, "loss": 0.5125, "mean_token_accuracy": 0.8407791368663311, "num_tokens": 682624543.0, "step": 21388 }, { "entropy": 0.6630308008752763, "epoch": 1.9679070275616586, "grad_norm": 0.1501186192035675, "learning_rate": 3.4406722482902445e-05, "loss": 0.6425, "mean_token_accuracy": 0.8080282174050808, "num_tokens": 682657001.0, "step": 21389 }, { "entropy": 0.6182821244001389, "epoch": 1.9679990339330997, "grad_norm": 0.15415498614311218, "learning_rate": 3.440365565676082e-05, "loss": 0.6201, "mean_token_accuracy": 0.8132022470235825, "num_tokens": 682689769.0, "step": 21390 }, { "entropy": 0.696206022053957, "epoch": 1.968091040304541, "grad_norm": 0.16417478024959564, "learning_rate": 3.4400588830619195e-05, "loss": 0.6778, "mean_token_accuracy": 0.7963638752698898, "num_tokens": 682721314.0, "step": 21391 }, { "entropy": 0.6139987716451287, "epoch": 1.9681830466759824, "grad_norm": 0.1567133665084839, "learning_rate": 3.439752200447757e-05, "loss": 0.6046, "mean_token_accuracy": 0.8163300231099129, "num_tokens": 682753575.0, "step": 21392 }, { "entropy": 0.7849078522995114, "epoch": 1.9682750530474236, "grad_norm": 0.16484278440475464, "learning_rate": 3.4394455178335944e-05, "loss": 0.7651, "mean_token_accuracy": 0.7691316232085228, "num_tokens": 682785797.0, "step": 21393 }, { "entropy": 0.6398603161796927, "epoch": 1.9683670594188647, "grad_norm": 0.15703143179416656, "learning_rate": 3.439138835219431e-05, "loss": 0.6293, "mean_token_accuracy": 0.8044772520661354, "num_tokens": 682817791.0, "step": 21394 }, { "entropy": 0.5292166583240032, "epoch": 1.9684590657903058, "grad_norm": 0.14518386125564575, "learning_rate": 3.438832152605269e-05, "loss": 0.524, "mean_token_accuracy": 0.8403446897864342, "num_tokens": 682849519.0, "step": 21395 }, { "entropy": 0.6247552074491978, "epoch": 1.9685510721617472, "grad_norm": 0.15092115104198456, "learning_rate": 3.438525469991106e-05, "loss": 0.6103, "mean_token_accuracy": 0.8150033578276634, "num_tokens": 682881507.0, "step": 21396 }, { "entropy": 0.7264052554965019, "epoch": 1.9686430785331885, "grad_norm": 0.1691385954618454, "learning_rate": 3.4382187873769436e-05, "loss": 0.7207, "mean_token_accuracy": 0.780366413295269, "num_tokens": 682912899.0, "step": 21397 }, { "entropy": 0.5089506083168089, "epoch": 1.9687350849046297, "grad_norm": 0.14153747260570526, "learning_rate": 3.437912104762781e-05, "loss": 0.4988, "mean_token_accuracy": 0.8455067649483681, "num_tokens": 682945372.0, "step": 21398 }, { "entropy": 0.5406015440821648, "epoch": 1.9688270912760708, "grad_norm": 0.14724381268024445, "learning_rate": 3.4376054221486185e-05, "loss": 0.5345, "mean_token_accuracy": 0.8342194631695747, "num_tokens": 682977649.0, "step": 21399 }, { "entropy": 0.5391217388678342, "epoch": 1.968919097647512, "grad_norm": 0.14239661395549774, "learning_rate": 3.437298739534456e-05, "loss": 0.5272, "mean_token_accuracy": 0.8336374647915363, "num_tokens": 683009243.0, "step": 21400 }, { "entropy": 0.5763911362737417, "epoch": 1.9690111040189533, "grad_norm": 0.15171010792255402, "learning_rate": 3.4369920569202934e-05, "loss": 0.5702, "mean_token_accuracy": 0.8228059485554695, "num_tokens": 683041040.0, "step": 21401 }, { "entropy": 0.5524709858000278, "epoch": 1.9691031103903947, "grad_norm": 0.14801393449306488, "learning_rate": 3.436685374306131e-05, "loss": 0.5351, "mean_token_accuracy": 0.8335354961454868, "num_tokens": 683073027.0, "step": 21402 }, { "entropy": 0.5018703788518906, "epoch": 1.9691951167618358, "grad_norm": 0.14049360156059265, "learning_rate": 3.4363786916919684e-05, "loss": 0.4911, "mean_token_accuracy": 0.8480123989284039, "num_tokens": 683105666.0, "step": 21403 }, { "entropy": 0.628142761066556, "epoch": 1.969287123133277, "grad_norm": 0.15579034388065338, "learning_rate": 3.436072009077805e-05, "loss": 0.6037, "mean_token_accuracy": 0.8143339529633522, "num_tokens": 683136407.0, "step": 21404 }, { "entropy": 0.5890848147682846, "epoch": 1.969379129504718, "grad_norm": 0.15255151689052582, "learning_rate": 3.435765326463643e-05, "loss": 0.5853, "mean_token_accuracy": 0.8179485648870468, "num_tokens": 683168344.0, "step": 21405 }, { "entropy": 0.523764044046402, "epoch": 1.9694711358761594, "grad_norm": 0.1397446095943451, "learning_rate": 3.43545864384948e-05, "loss": 0.5119, "mean_token_accuracy": 0.8412925973534584, "num_tokens": 683200905.0, "step": 21406 }, { "entropy": 0.6558090252801776, "epoch": 1.9695631422476008, "grad_norm": 0.1516379415988922, "learning_rate": 3.4351519612353176e-05, "loss": 0.6506, "mean_token_accuracy": 0.8009985238313675, "num_tokens": 683233043.0, "step": 21407 }, { "entropy": 0.5633107707835734, "epoch": 1.969655148619042, "grad_norm": 0.15191525220870972, "learning_rate": 3.434845278621155e-05, "loss": 0.5544, "mean_token_accuracy": 0.8295608870685101, "num_tokens": 683264918.0, "step": 21408 }, { "entropy": 0.7106415033340454, "epoch": 1.969747154990483, "grad_norm": 0.16156697273254395, "learning_rate": 3.4345385960069925e-05, "loss": 0.7177, "mean_token_accuracy": 0.7824672870337963, "num_tokens": 683297338.0, "step": 21409 }, { "entropy": 0.7261647013947368, "epoch": 1.9698391613619242, "grad_norm": 0.16473956406116486, "learning_rate": 3.43423191339283e-05, "loss": 0.7152, "mean_token_accuracy": 0.7824422940611839, "num_tokens": 683328460.0, "step": 21410 }, { "entropy": 0.6401586122810841, "epoch": 1.9699311677333655, "grad_norm": 0.15278072655200958, "learning_rate": 3.4339252307786674e-05, "loss": 0.6282, "mean_token_accuracy": 0.8036460839211941, "num_tokens": 683360510.0, "step": 21411 }, { "entropy": 0.5895881373435259, "epoch": 1.9700231741048069, "grad_norm": 0.15190927684307098, "learning_rate": 3.433618548164504e-05, "loss": 0.5989, "mean_token_accuracy": 0.818682212382555, "num_tokens": 683392011.0, "step": 21412 }, { "entropy": 0.6137185674160719, "epoch": 1.970115180476248, "grad_norm": 0.15487445890903473, "learning_rate": 3.4333118655503423e-05, "loss": 0.6057, "mean_token_accuracy": 0.8141805306077003, "num_tokens": 683424066.0, "step": 21413 }, { "entropy": 0.5728686396032572, "epoch": 1.9702071868476891, "grad_norm": 0.15764054656028748, "learning_rate": 3.43300518293618e-05, "loss": 0.5702, "mean_token_accuracy": 0.8238586559891701, "num_tokens": 683455754.0, "step": 21414 }, { "entropy": 0.6097668446600437, "epoch": 1.9702991932191303, "grad_norm": 0.15507781505584717, "learning_rate": 3.4326985003220166e-05, "loss": 0.6026, "mean_token_accuracy": 0.8137948624789715, "num_tokens": 683486720.0, "step": 21415 }, { "entropy": 0.5318193025887012, "epoch": 1.9703911995905716, "grad_norm": 0.14574219286441803, "learning_rate": 3.432391817707855e-05, "loss": 0.5194, "mean_token_accuracy": 0.836984746158123, "num_tokens": 683518652.0, "step": 21416 }, { "entropy": 0.5497919674962759, "epoch": 1.970483205962013, "grad_norm": 0.14910760521888733, "learning_rate": 3.4320851350936915e-05, "loss": 0.5441, "mean_token_accuracy": 0.83118586987257, "num_tokens": 683551420.0, "step": 21417 }, { "entropy": 0.6441788831725717, "epoch": 1.9705752123334541, "grad_norm": 0.1571865975856781, "learning_rate": 3.43177845247953e-05, "loss": 0.6418, "mean_token_accuracy": 0.8050787821412086, "num_tokens": 683583738.0, "step": 21418 }, { "entropy": 0.663470359519124, "epoch": 1.9706672187048953, "grad_norm": 0.1586083024740219, "learning_rate": 3.4314717698653665e-05, "loss": 0.6562, "mean_token_accuracy": 0.7969927489757538, "num_tokens": 683615523.0, "step": 21419 }, { "entropy": 0.5623294413089752, "epoch": 1.9707592250763364, "grad_norm": 0.14872239530086517, "learning_rate": 3.431165087251204e-05, "loss": 0.5503, "mean_token_accuracy": 0.8291430249810219, "num_tokens": 683647245.0, "step": 21420 }, { "entropy": 0.619787291623652, "epoch": 1.9708512314477777, "grad_norm": 0.1590592861175537, "learning_rate": 3.4308584046370414e-05, "loss": 0.6165, "mean_token_accuracy": 0.8115459308028221, "num_tokens": 683679540.0, "step": 21421 }, { "entropy": 0.6372888563200831, "epoch": 1.970943237819219, "grad_norm": 0.16018228232860565, "learning_rate": 3.430551722022879e-05, "loss": 0.6356, "mean_token_accuracy": 0.8050528839230537, "num_tokens": 683711669.0, "step": 21422 }, { "entropy": 0.6113044181838632, "epoch": 1.9710352441906602, "grad_norm": 0.15173576772212982, "learning_rate": 3.430245039408716e-05, "loss": 0.5882, "mean_token_accuracy": 0.8208930268883705, "num_tokens": 683744017.0, "step": 21423 }, { "entropy": 0.6252741161733866, "epoch": 1.9711272505621014, "grad_norm": 0.14856979250907898, "learning_rate": 3.429938356794554e-05, "loss": 0.6017, "mean_token_accuracy": 0.813473392277956, "num_tokens": 683775749.0, "step": 21424 }, { "entropy": 0.5924314968287945, "epoch": 1.9712192569335425, "grad_norm": 0.15314660966396332, "learning_rate": 3.4296316741803906e-05, "loss": 0.5705, "mean_token_accuracy": 0.8231101594865322, "num_tokens": 683806446.0, "step": 21425 }, { "entropy": 0.6036200849339366, "epoch": 1.9713112633049839, "grad_norm": 0.15114718675613403, "learning_rate": 3.429324991566229e-05, "loss": 0.5881, "mean_token_accuracy": 0.8239055052399635, "num_tokens": 683838430.0, "step": 21426 }, { "entropy": 0.7704555299133062, "epoch": 1.9714032696764252, "grad_norm": 0.16827833652496338, "learning_rate": 3.4290183089520655e-05, "loss": 0.7564, "mean_token_accuracy": 0.770058162510395, "num_tokens": 683870113.0, "step": 21427 }, { "entropy": 0.5379094574600458, "epoch": 1.9714952760478663, "grad_norm": 0.14701834321022034, "learning_rate": 3.428711626337903e-05, "loss": 0.5304, "mean_token_accuracy": 0.8314428776502609, "num_tokens": 683902269.0, "step": 21428 }, { "entropy": 0.6084657143801451, "epoch": 1.9715872824193075, "grad_norm": 0.15546192228794098, "learning_rate": 3.4284049437237404e-05, "loss": 0.5874, "mean_token_accuracy": 0.8167893476784229, "num_tokens": 683933758.0, "step": 21429 }, { "entropy": 0.5665991571731865, "epoch": 1.9716792887907486, "grad_norm": 0.14716596901416779, "learning_rate": 3.428098261109578e-05, "loss": 0.5632, "mean_token_accuracy": 0.8251269124448299, "num_tokens": 683966148.0, "step": 21430 }, { "entropy": 0.6635493636131287, "epoch": 1.97177129516219, "grad_norm": 0.1603752225637436, "learning_rate": 3.4277915784954154e-05, "loss": 0.6442, "mean_token_accuracy": 0.803862065076828, "num_tokens": 683997385.0, "step": 21431 }, { "entropy": 0.6191359106451273, "epoch": 1.9718633015336313, "grad_norm": 0.15537938475608826, "learning_rate": 3.427484895881253e-05, "loss": 0.6123, "mean_token_accuracy": 0.8134285770356655, "num_tokens": 684028480.0, "step": 21432 }, { "entropy": 0.5575876105576754, "epoch": 1.9719553079050725, "grad_norm": 0.14889322221279144, "learning_rate": 3.4271782132670896e-05, "loss": 0.5299, "mean_token_accuracy": 0.8347550332546234, "num_tokens": 684060249.0, "step": 21433 }, { "entropy": 0.4755310812033713, "epoch": 1.9720473142765136, "grad_norm": 0.14476646482944489, "learning_rate": 3.426871530652928e-05, "loss": 0.4609, "mean_token_accuracy": 0.8541630543768406, "num_tokens": 684092082.0, "step": 21434 }, { "entropy": 0.6148709934204817, "epoch": 1.9721393206479547, "grad_norm": 0.15935547649860382, "learning_rate": 3.4265648480387645e-05, "loss": 0.601, "mean_token_accuracy": 0.8175532855093479, "num_tokens": 684123474.0, "step": 21435 }, { "entropy": 0.5256874412298203, "epoch": 1.972231327019396, "grad_norm": 0.14762838184833527, "learning_rate": 3.426258165424602e-05, "loss": 0.5123, "mean_token_accuracy": 0.8372753895819187, "num_tokens": 684155366.0, "step": 21436 }, { "entropy": 0.4019956816919148, "epoch": 1.9723233333908374, "grad_norm": 0.1376553326845169, "learning_rate": 3.4259514828104395e-05, "loss": 0.3882, "mean_token_accuracy": 0.8775302544236183, "num_tokens": 684187699.0, "step": 21437 }, { "entropy": 0.636507575167343, "epoch": 1.9724153397622786, "grad_norm": 0.16043657064437866, "learning_rate": 3.425644800196277e-05, "loss": 0.633, "mean_token_accuracy": 0.8075433112680912, "num_tokens": 684218530.0, "step": 21438 }, { "entropy": 0.5969919352792203, "epoch": 1.9725073461337197, "grad_norm": 0.14872904121875763, "learning_rate": 3.4253381175821144e-05, "loss": 0.5911, "mean_token_accuracy": 0.8170578926801682, "num_tokens": 684250984.0, "step": 21439 }, { "entropy": 0.537143609020859, "epoch": 1.9725993525051608, "grad_norm": 0.15040276944637299, "learning_rate": 3.425031434967952e-05, "loss": 0.5334, "mean_token_accuracy": 0.8353098407387733, "num_tokens": 684282977.0, "step": 21440 }, { "entropy": 0.5556581420823932, "epoch": 1.9726913588766022, "grad_norm": 0.15150289237499237, "learning_rate": 3.4247247523537886e-05, "loss": 0.5462, "mean_token_accuracy": 0.8252881281077862, "num_tokens": 684315030.0, "step": 21441 }, { "entropy": 0.5979395918548107, "epoch": 1.9727833652480435, "grad_norm": 0.1503228396177292, "learning_rate": 3.424418069739627e-05, "loss": 0.5924, "mean_token_accuracy": 0.8185307532548904, "num_tokens": 684347574.0, "step": 21442 }, { "entropy": 0.6895224787294865, "epoch": 1.9728753716194847, "grad_norm": 0.15701378881931305, "learning_rate": 3.4241113871254636e-05, "loss": 0.6888, "mean_token_accuracy": 0.7914458028972149, "num_tokens": 684379529.0, "step": 21443 }, { "entropy": 0.661044342443347, "epoch": 1.9729673779909258, "grad_norm": 0.15715184807777405, "learning_rate": 3.423804704511302e-05, "loss": 0.6517, "mean_token_accuracy": 0.7979865036904812, "num_tokens": 684411912.0, "step": 21444 }, { "entropy": 0.5268629882484674, "epoch": 1.973059384362367, "grad_norm": 0.14724105596542358, "learning_rate": 3.423498021897139e-05, "loss": 0.5204, "mean_token_accuracy": 0.83918521925807, "num_tokens": 684444301.0, "step": 21445 }, { "entropy": 0.530481830239296, "epoch": 1.9731513907338083, "grad_norm": 0.14606991410255432, "learning_rate": 3.423191339282976e-05, "loss": 0.5137, "mean_token_accuracy": 0.84301633015275, "num_tokens": 684476301.0, "step": 21446 }, { "entropy": 0.6506156735122204, "epoch": 1.9732433971052497, "grad_norm": 0.1604631394147873, "learning_rate": 3.422884656668814e-05, "loss": 0.6328, "mean_token_accuracy": 0.8049527704715729, "num_tokens": 684508088.0, "step": 21447 }, { "entropy": 0.7059943024069071, "epoch": 1.9733354034766908, "grad_norm": 0.16334645450115204, "learning_rate": 3.422577974054651e-05, "loss": 0.6863, "mean_token_accuracy": 0.7904835231602192, "num_tokens": 684539339.0, "step": 21448 }, { "entropy": 0.6202019285410643, "epoch": 1.973427409848132, "grad_norm": 0.1528160721063614, "learning_rate": 3.4222712914404884e-05, "loss": 0.6154, "mean_token_accuracy": 0.8126885108649731, "num_tokens": 684570828.0, "step": 21449 }, { "entropy": 0.6597518157213926, "epoch": 1.973519416219573, "grad_norm": 0.1591959297657013, "learning_rate": 3.421964608826326e-05, "loss": 0.6545, "mean_token_accuracy": 0.8021917194128036, "num_tokens": 684602901.0, "step": 21450 }, { "entropy": 0.6724513340741396, "epoch": 1.9736114225910144, "grad_norm": 0.1599515676498413, "learning_rate": 3.421657926212163e-05, "loss": 0.6635, "mean_token_accuracy": 0.7979596108198166, "num_tokens": 684635200.0, "step": 21451 }, { "entropy": 0.6633821707218885, "epoch": 1.9737034289624558, "grad_norm": 0.1577792763710022, "learning_rate": 3.421351243598001e-05, "loss": 0.6572, "mean_token_accuracy": 0.7982345074415207, "num_tokens": 684667042.0, "step": 21452 }, { "entropy": 0.6324004484340549, "epoch": 1.973795435333897, "grad_norm": 0.15697382390499115, "learning_rate": 3.421044560983838e-05, "loss": 0.6095, "mean_token_accuracy": 0.8114731721580029, "num_tokens": 684698099.0, "step": 21453 }, { "entropy": 0.6934664370492101, "epoch": 1.973887441705338, "grad_norm": 0.1628764569759369, "learning_rate": 3.420737878369675e-05, "loss": 0.709, "mean_token_accuracy": 0.7902499809861183, "num_tokens": 684729929.0, "step": 21454 }, { "entropy": 0.6516886465251446, "epoch": 1.9739794480767792, "grad_norm": 0.1647402048110962, "learning_rate": 3.420431195755513e-05, "loss": 0.6408, "mean_token_accuracy": 0.801408227533102, "num_tokens": 684761092.0, "step": 21455 }, { "entropy": 0.5911430490668863, "epoch": 1.9740714544482205, "grad_norm": 0.14874491095542908, "learning_rate": 3.42012451314135e-05, "loss": 0.5878, "mean_token_accuracy": 0.8171895779669285, "num_tokens": 684793239.0, "step": 21456 }, { "entropy": 0.7104524467140436, "epoch": 1.9741634608196619, "grad_norm": 0.1649232804775238, "learning_rate": 3.4198178305271874e-05, "loss": 0.7064, "mean_token_accuracy": 0.7871144413948059, "num_tokens": 684824423.0, "step": 21457 }, { "entropy": 0.6184809301048517, "epoch": 1.974255467191103, "grad_norm": 0.15808239579200745, "learning_rate": 3.419511147913025e-05, "loss": 0.6202, "mean_token_accuracy": 0.8070211745798588, "num_tokens": 684856240.0, "step": 21458 }, { "entropy": 0.7260202690958977, "epoch": 1.9743474735625441, "grad_norm": 0.16122473776340485, "learning_rate": 3.419204465298862e-05, "loss": 0.6961, "mean_token_accuracy": 0.785622276365757, "num_tokens": 684887347.0, "step": 21459 }, { "entropy": 0.6274260990321636, "epoch": 1.9744394799339853, "grad_norm": 0.15224699676036835, "learning_rate": 3.4188977826847e-05, "loss": 0.6126, "mean_token_accuracy": 0.8093602061271667, "num_tokens": 684918798.0, "step": 21460 }, { "entropy": 0.5422701810020953, "epoch": 1.9745314863054266, "grad_norm": 0.14964930713176727, "learning_rate": 3.418591100070537e-05, "loss": 0.5389, "mean_token_accuracy": 0.8318924568593502, "num_tokens": 684950209.0, "step": 21461 }, { "entropy": 0.533922410570085, "epoch": 1.974623492676868, "grad_norm": 0.15221822261810303, "learning_rate": 3.418284417456375e-05, "loss": 0.5292, "mean_token_accuracy": 0.8386295661330223, "num_tokens": 684982311.0, "step": 21462 }, { "entropy": 0.6028763633221388, "epoch": 1.9747154990483091, "grad_norm": 0.15538588166236877, "learning_rate": 3.417977734842212e-05, "loss": 0.5946, "mean_token_accuracy": 0.8178098127245903, "num_tokens": 685014811.0, "step": 21463 }, { "entropy": 0.7243824601173401, "epoch": 1.9748075054197503, "grad_norm": 0.16282619535923004, "learning_rate": 3.417671052228049e-05, "loss": 0.7028, "mean_token_accuracy": 0.7878199145197868, "num_tokens": 685045969.0, "step": 21464 }, { "entropy": 0.6954742046073079, "epoch": 1.9748995117911914, "grad_norm": 0.16118976473808289, "learning_rate": 3.417364369613887e-05, "loss": 0.6666, "mean_token_accuracy": 0.7944438718259335, "num_tokens": 685076997.0, "step": 21465 }, { "entropy": 0.6848119571805, "epoch": 1.9749915181626327, "grad_norm": 0.1590157300233841, "learning_rate": 3.417057686999724e-05, "loss": 0.686, "mean_token_accuracy": 0.7932498455047607, "num_tokens": 685108705.0, "step": 21466 }, { "entropy": 0.6461494071409106, "epoch": 1.975083524534074, "grad_norm": 0.1514071375131607, "learning_rate": 3.4167510043855614e-05, "loss": 0.62, "mean_token_accuracy": 0.8084757216274738, "num_tokens": 685141035.0, "step": 21467 }, { "entropy": 0.6306236321106553, "epoch": 1.9751755309055152, "grad_norm": 0.15200179815292358, "learning_rate": 3.416444321771399e-05, "loss": 0.6083, "mean_token_accuracy": 0.8121722899377346, "num_tokens": 685173009.0, "step": 21468 }, { "entropy": 0.49566339142620564, "epoch": 1.9752675372769564, "grad_norm": 0.14095085859298706, "learning_rate": 3.416137639157236e-05, "loss": 0.4855, "mean_token_accuracy": 0.8485664539039135, "num_tokens": 685205623.0, "step": 21469 }, { "entropy": 0.6087652468122542, "epoch": 1.9753595436483975, "grad_norm": 0.16513505578041077, "learning_rate": 3.415830956543074e-05, "loss": 0.6064, "mean_token_accuracy": 0.8123718574643135, "num_tokens": 685237251.0, "step": 21470 }, { "entropy": 0.6451842971146107, "epoch": 1.9754515500198389, "grad_norm": 0.15827101469039917, "learning_rate": 3.415524273928911e-05, "loss": 0.6337, "mean_token_accuracy": 0.8039448969066143, "num_tokens": 685268569.0, "step": 21471 }, { "entropy": 0.81525669246912, "epoch": 1.9755435563912802, "grad_norm": 0.17719434201717377, "learning_rate": 3.415217591314748e-05, "loss": 0.8131, "mean_token_accuracy": 0.7558621726930141, "num_tokens": 685299837.0, "step": 21472 }, { "entropy": 0.6441381014883518, "epoch": 1.9756355627627213, "grad_norm": 0.1557210385799408, "learning_rate": 3.414910908700586e-05, "loss": 0.6354, "mean_token_accuracy": 0.8053754456341267, "num_tokens": 685331528.0, "step": 21473 }, { "entropy": 0.5530406143516302, "epoch": 1.9757275691341625, "grad_norm": 0.1579904556274414, "learning_rate": 3.414604226086423e-05, "loss": 0.5402, "mean_token_accuracy": 0.8309353888034821, "num_tokens": 685362264.0, "step": 21474 }, { "entropy": 0.6118048983626068, "epoch": 1.9758195755056036, "grad_norm": 0.15499895811080933, "learning_rate": 3.4142975434722604e-05, "loss": 0.6004, "mean_token_accuracy": 0.815332368016243, "num_tokens": 685393777.0, "step": 21475 }, { "entropy": 0.6054152557626367, "epoch": 1.975911581877045, "grad_norm": 0.15262916684150696, "learning_rate": 3.4139908608580986e-05, "loss": 0.5948, "mean_token_accuracy": 0.817244429141283, "num_tokens": 685426023.0, "step": 21476 }, { "entropy": 0.612221862655133, "epoch": 1.9760035882484863, "grad_norm": 0.1554730385541916, "learning_rate": 3.4136841782439353e-05, "loss": 0.6182, "mean_token_accuracy": 0.8132283799350262, "num_tokens": 685457774.0, "step": 21477 }, { "entropy": 0.5510639250278473, "epoch": 1.9760955946199275, "grad_norm": 0.14529447257518768, "learning_rate": 3.4133774956297735e-05, "loss": 0.5404, "mean_token_accuracy": 0.8334782645106316, "num_tokens": 685490366.0, "step": 21478 }, { "entropy": 0.5817605257034302, "epoch": 1.9761876009913686, "grad_norm": 0.15216189622879028, "learning_rate": 3.41307081301561e-05, "loss": 0.5816, "mean_token_accuracy": 0.8218121789395809, "num_tokens": 685522188.0, "step": 21479 }, { "entropy": 0.5495714927092195, "epoch": 1.9762796073628097, "grad_norm": 0.1535530537366867, "learning_rate": 3.412764130401448e-05, "loss": 0.5428, "mean_token_accuracy": 0.8290602490305901, "num_tokens": 685554306.0, "step": 21480 }, { "entropy": 0.6377737009897828, "epoch": 1.976371613734251, "grad_norm": 0.15304884314537048, "learning_rate": 3.412457447787285e-05, "loss": 0.6319, "mean_token_accuracy": 0.8063328452408314, "num_tokens": 685586323.0, "step": 21481 }, { "entropy": 0.6181062357500196, "epoch": 1.9764636201056924, "grad_norm": 0.15567468106746674, "learning_rate": 3.412150765173123e-05, "loss": 0.6173, "mean_token_accuracy": 0.8105673119425774, "num_tokens": 685617640.0, "step": 21482 }, { "entropy": 0.5497356969863176, "epoch": 1.9765556264771336, "grad_norm": 0.14799633622169495, "learning_rate": 3.41184408255896e-05, "loss": 0.5316, "mean_token_accuracy": 0.8333574086427689, "num_tokens": 685649674.0, "step": 21483 }, { "entropy": 0.5169323584996164, "epoch": 1.9766476328485747, "grad_norm": 0.13725125789642334, "learning_rate": 3.4115373999447976e-05, "loss": 0.5106, "mean_token_accuracy": 0.8417587988078594, "num_tokens": 685682010.0, "step": 21484 }, { "entropy": 0.628311138600111, "epoch": 1.9767396392200158, "grad_norm": 0.16062438488006592, "learning_rate": 3.4112307173306344e-05, "loss": 0.6177, "mean_token_accuracy": 0.8119990490376949, "num_tokens": 685714266.0, "step": 21485 }, { "entropy": 0.4883853674400598, "epoch": 1.9768316455914572, "grad_norm": 0.14434432983398438, "learning_rate": 3.4109240347164725e-05, "loss": 0.4757, "mean_token_accuracy": 0.8506960906088352, "num_tokens": 685746109.0, "step": 21486 }, { "entropy": 0.5804145038127899, "epoch": 1.9769236519628985, "grad_norm": 0.14945392310619354, "learning_rate": 3.410617352102309e-05, "loss": 0.5784, "mean_token_accuracy": 0.8214714340865612, "num_tokens": 685778382.0, "step": 21487 }, { "entropy": 0.5433510094881058, "epoch": 1.9770156583343397, "grad_norm": 0.14864309132099152, "learning_rate": 3.410310669488147e-05, "loss": 0.526, "mean_token_accuracy": 0.8360878191888332, "num_tokens": 685810264.0, "step": 21488 }, { "entropy": 0.6205571787431836, "epoch": 1.9771076647057808, "grad_norm": 0.15090788900852203, "learning_rate": 3.410003986873984e-05, "loss": 0.5964, "mean_token_accuracy": 0.8148259222507477, "num_tokens": 685842912.0, "step": 21489 }, { "entropy": 0.5167519534006715, "epoch": 1.977199671077222, "grad_norm": 0.14258718490600586, "learning_rate": 3.409697304259822e-05, "loss": 0.4953, "mean_token_accuracy": 0.8431419879198074, "num_tokens": 685874482.0, "step": 21490 }, { "entropy": 0.6386698577553034, "epoch": 1.9772916774486633, "grad_norm": 0.15147005021572113, "learning_rate": 3.409390621645659e-05, "loss": 0.6204, "mean_token_accuracy": 0.8099080361425877, "num_tokens": 685906878.0, "step": 21491 }, { "entropy": 0.6865945588797331, "epoch": 1.9773836838201047, "grad_norm": 0.15694372355937958, "learning_rate": 3.4090839390314966e-05, "loss": 0.6654, "mean_token_accuracy": 0.7957076020538807, "num_tokens": 685938735.0, "step": 21492 }, { "entropy": 0.6011396278627217, "epoch": 1.9774756901915458, "grad_norm": 0.15504860877990723, "learning_rate": 3.4087772564173334e-05, "loss": 0.5916, "mean_token_accuracy": 0.8233883194625378, "num_tokens": 685970974.0, "step": 21493 }, { "entropy": 0.5582927335053682, "epoch": 1.977567696562987, "grad_norm": 0.15838909149169922, "learning_rate": 3.4084705738031716e-05, "loss": 0.5461, "mean_token_accuracy": 0.8314084969460964, "num_tokens": 686002017.0, "step": 21494 }, { "entropy": 0.5547796729952097, "epoch": 1.977659702934428, "grad_norm": 0.15038420259952545, "learning_rate": 3.4081638911890084e-05, "loss": 0.5426, "mean_token_accuracy": 0.8329500742256641, "num_tokens": 686033527.0, "step": 21495 }, { "entropy": 0.5355968866497278, "epoch": 1.9777517093058694, "grad_norm": 0.14215081930160522, "learning_rate": 3.407857208574846e-05, "loss": 0.5188, "mean_token_accuracy": 0.8360245898365974, "num_tokens": 686065576.0, "step": 21496 }, { "entropy": 0.6079967757686973, "epoch": 1.9778437156773108, "grad_norm": 0.15157043933868408, "learning_rate": 3.407550525960683e-05, "loss": 0.5939, "mean_token_accuracy": 0.8160593956708908, "num_tokens": 686097626.0, "step": 21497 }, { "entropy": 0.6355075808241963, "epoch": 1.977935722048752, "grad_norm": 0.155294269323349, "learning_rate": 3.407243843346521e-05, "loss": 0.6254, "mean_token_accuracy": 0.8051317222416401, "num_tokens": 686129238.0, "step": 21498 }, { "entropy": 0.6721584163606167, "epoch": 1.978027728420193, "grad_norm": 0.16050034761428833, "learning_rate": 3.406937160732358e-05, "loss": 0.6653, "mean_token_accuracy": 0.7959812171757221, "num_tokens": 686161316.0, "step": 21499 }, { "entropy": 0.573052872903645, "epoch": 1.9781197347916342, "grad_norm": 0.1454995721578598, "learning_rate": 3.406630478118196e-05, "loss": 0.5598, "mean_token_accuracy": 0.8256929516792297, "num_tokens": 686193580.0, "step": 21500 }, { "entropy": 0.5951954792253673, "epoch": 1.9782117411630755, "grad_norm": 0.16368550062179565, "learning_rate": 3.4063237955040325e-05, "loss": 0.5897, "mean_token_accuracy": 0.8208403997123241, "num_tokens": 686224923.0, "step": 21501 }, { "entropy": 0.5983079196885228, "epoch": 1.9783037475345169, "grad_norm": 0.1537751704454422, "learning_rate": 3.4060171128898706e-05, "loss": 0.5864, "mean_token_accuracy": 0.8176681138575077, "num_tokens": 686256876.0, "step": 21502 }, { "entropy": 0.5539435464888811, "epoch": 1.978395753905958, "grad_norm": 0.1521485596895218, "learning_rate": 3.4057104302757074e-05, "loss": 0.5452, "mean_token_accuracy": 0.8327867388725281, "num_tokens": 686288855.0, "step": 21503 }, { "entropy": 0.6980605870485306, "epoch": 1.9784877602773991, "grad_norm": 0.15677133202552795, "learning_rate": 3.4054037476615455e-05, "loss": 0.7, "mean_token_accuracy": 0.7867856845259666, "num_tokens": 686321317.0, "step": 21504 }, { "entropy": 0.5819638781249523, "epoch": 1.9785797666488403, "grad_norm": 0.150906503200531, "learning_rate": 3.405097065047382e-05, "loss": 0.5606, "mean_token_accuracy": 0.8228229209780693, "num_tokens": 686353114.0, "step": 21505 }, { "entropy": 0.5085404934361577, "epoch": 1.9786717730202816, "grad_norm": 0.14526382088661194, "learning_rate": 3.40479038243322e-05, "loss": 0.5039, "mean_token_accuracy": 0.845080491155386, "num_tokens": 686384946.0, "step": 21506 }, { "entropy": 0.575903850607574, "epoch": 1.978763779391723, "grad_norm": 0.15042744576931, "learning_rate": 3.404483699819058e-05, "loss": 0.5648, "mean_token_accuracy": 0.8259587474167347, "num_tokens": 686416611.0, "step": 21507 }, { "entropy": 0.6738393139094114, "epoch": 1.9788557857631641, "grad_norm": 0.1621755212545395, "learning_rate": 3.404177017204895e-05, "loss": 0.6709, "mean_token_accuracy": 0.7954128980636597, "num_tokens": 686448316.0, "step": 21508 }, { "entropy": 0.5759008610621095, "epoch": 1.9789477921346053, "grad_norm": 0.15160968899726868, "learning_rate": 3.403870334590732e-05, "loss": 0.5655, "mean_token_accuracy": 0.8218555264174938, "num_tokens": 686480394.0, "step": 21509 }, { "entropy": 0.5467234868556261, "epoch": 1.9790397985060464, "grad_norm": 0.14952786266803741, "learning_rate": 3.4035636519765696e-05, "loss": 0.5359, "mean_token_accuracy": 0.8323003388941288, "num_tokens": 686512373.0, "step": 21510 }, { "entropy": 0.6450721677392721, "epoch": 1.9791318048774877, "grad_norm": 0.1545727699995041, "learning_rate": 3.403256969362407e-05, "loss": 0.6438, "mean_token_accuracy": 0.7980695441365242, "num_tokens": 686544381.0, "step": 21511 }, { "entropy": 0.5437479978427291, "epoch": 1.979223811248929, "grad_norm": 0.14772140979766846, "learning_rate": 3.4029502867482446e-05, "loss": 0.5281, "mean_token_accuracy": 0.834006030112505, "num_tokens": 686576224.0, "step": 21512 }, { "entropy": 0.6454015299677849, "epoch": 1.9793158176203702, "grad_norm": 0.1532926708459854, "learning_rate": 3.402643604134082e-05, "loss": 0.6361, "mean_token_accuracy": 0.8071601390838623, "num_tokens": 686608215.0, "step": 21513 }, { "entropy": 0.5124355256557465, "epoch": 1.9794078239918114, "grad_norm": 0.15072204172611237, "learning_rate": 3.402336921519919e-05, "loss": 0.5149, "mean_token_accuracy": 0.8389008194208145, "num_tokens": 686640283.0, "step": 21514 }, { "entropy": 0.5519167389720678, "epoch": 1.9794998303632525, "grad_norm": 0.14866478741168976, "learning_rate": 3.402030238905757e-05, "loss": 0.5358, "mean_token_accuracy": 0.8309659250080585, "num_tokens": 686672104.0, "step": 21515 }, { "entropy": 0.6032457109540701, "epoch": 1.9795918367346939, "grad_norm": 0.1553364396095276, "learning_rate": 3.401723556291594e-05, "loss": 0.6047, "mean_token_accuracy": 0.8145595565438271, "num_tokens": 686704199.0, "step": 21516 }, { "entropy": 0.6021036256570369, "epoch": 1.9796838431061352, "grad_norm": 0.15096870064735413, "learning_rate": 3.401416873677431e-05, "loss": 0.6006, "mean_token_accuracy": 0.815658200532198, "num_tokens": 686735487.0, "step": 21517 }, { "entropy": 0.5227678455412388, "epoch": 1.9797758494775763, "grad_norm": 0.14845575392246246, "learning_rate": 3.401110191063269e-05, "loss": 0.5072, "mean_token_accuracy": 0.8425244353711605, "num_tokens": 686768092.0, "step": 21518 }, { "entropy": 0.6619526464492083, "epoch": 1.9798678558490175, "grad_norm": 0.15951813757419586, "learning_rate": 3.400803508449106e-05, "loss": 0.6557, "mean_token_accuracy": 0.8010454103350639, "num_tokens": 686800163.0, "step": 21519 }, { "entropy": 0.6093063494190574, "epoch": 1.9799598622204586, "grad_norm": 0.15651480853557587, "learning_rate": 3.4004968258349436e-05, "loss": 0.6018, "mean_token_accuracy": 0.8158976882696152, "num_tokens": 686832451.0, "step": 21520 }, { "entropy": 0.680887321010232, "epoch": 1.9800518685919, "grad_norm": 0.1619807630777359, "learning_rate": 3.400190143220781e-05, "loss": 0.6705, "mean_token_accuracy": 0.7969597466289997, "num_tokens": 686865064.0, "step": 21521 }, { "entropy": 0.6612665299326181, "epoch": 1.9801438749633413, "grad_norm": 0.15712182223796844, "learning_rate": 3.3998834606066185e-05, "loss": 0.6503, "mean_token_accuracy": 0.8010455146431923, "num_tokens": 686897250.0, "step": 21522 }, { "entropy": 0.6273528570309281, "epoch": 1.9802358813347825, "grad_norm": 0.15080121159553528, "learning_rate": 3.399576777992456e-05, "loss": 0.617, "mean_token_accuracy": 0.8085630647838116, "num_tokens": 686929193.0, "step": 21523 }, { "entropy": 0.6673552580177784, "epoch": 1.9803278877062236, "grad_norm": 0.15354032814502716, "learning_rate": 3.399270095378293e-05, "loss": 0.6485, "mean_token_accuracy": 0.7976608164608479, "num_tokens": 686961049.0, "step": 21524 }, { "entropy": 0.5515714343637228, "epoch": 1.9804198940776647, "grad_norm": 0.14315006136894226, "learning_rate": 3.398963412764131e-05, "loss": 0.5243, "mean_token_accuracy": 0.840230654925108, "num_tokens": 686992727.0, "step": 21525 }, { "entropy": 0.5994752231054008, "epoch": 1.980511900449106, "grad_norm": 0.15401817858219147, "learning_rate": 3.398656730149968e-05, "loss": 0.5764, "mean_token_accuracy": 0.8187536522746086, "num_tokens": 687024782.0, "step": 21526 }, { "entropy": 0.5996298585087061, "epoch": 1.9806039068205474, "grad_norm": 0.14796216785907745, "learning_rate": 3.398350047535805e-05, "loss": 0.5997, "mean_token_accuracy": 0.8153866082429886, "num_tokens": 687057194.0, "step": 21527 }, { "entropy": 0.5730878296308219, "epoch": 1.9806959131919886, "grad_norm": 0.15332931280136108, "learning_rate": 3.3980433649216427e-05, "loss": 0.5709, "mean_token_accuracy": 0.8262561038136482, "num_tokens": 687089295.0, "step": 21528 }, { "entropy": 0.5438798626419157, "epoch": 1.9807879195634297, "grad_norm": 0.1501573920249939, "learning_rate": 3.39773668230748e-05, "loss": 0.5293, "mean_token_accuracy": 0.8344556950032711, "num_tokens": 687121483.0, "step": 21529 }, { "entropy": 0.6443743966519833, "epoch": 1.9808799259348708, "grad_norm": 0.15814463794231415, "learning_rate": 3.3974299996933176e-05, "loss": 0.6323, "mean_token_accuracy": 0.805807750672102, "num_tokens": 687153789.0, "step": 21530 }, { "entropy": 0.4709599195048213, "epoch": 1.9809719323063122, "grad_norm": 0.14645789563655853, "learning_rate": 3.397123317079155e-05, "loss": 0.4566, "mean_token_accuracy": 0.8577055558562279, "num_tokens": 687186168.0, "step": 21531 }, { "entropy": 0.5115546183660626, "epoch": 1.9810639386777535, "grad_norm": 0.14533913135528564, "learning_rate": 3.396816634464992e-05, "loss": 0.5183, "mean_token_accuracy": 0.8381548374891281, "num_tokens": 687218732.0, "step": 21532 }, { "entropy": 0.5991612672805786, "epoch": 1.9811559450491947, "grad_norm": 0.1561659574508667, "learning_rate": 3.39650995185083e-05, "loss": 0.5943, "mean_token_accuracy": 0.8169876709580421, "num_tokens": 687250532.0, "step": 21533 }, { "entropy": 0.6244137678295374, "epoch": 1.9812479514206358, "grad_norm": 0.15580038726329803, "learning_rate": 3.396203269236667e-05, "loss": 0.6207, "mean_token_accuracy": 0.8101564981043339, "num_tokens": 687282132.0, "step": 21534 }, { "entropy": 0.5416905395686626, "epoch": 1.981339957792077, "grad_norm": 0.15244272351264954, "learning_rate": 3.395896586622504e-05, "loss": 0.5464, "mean_token_accuracy": 0.8304644413292408, "num_tokens": 687313502.0, "step": 21535 }, { "entropy": 0.4373997875954956, "epoch": 1.9814319641635183, "grad_norm": 0.13429971039295197, "learning_rate": 3.3955899040083424e-05, "loss": 0.425, "mean_token_accuracy": 0.8652217090129852, "num_tokens": 687345831.0, "step": 21536 }, { "entropy": 0.5907880926970392, "epoch": 1.9815239705349597, "grad_norm": 0.15270453691482544, "learning_rate": 3.395283221394179e-05, "loss": 0.5892, "mean_token_accuracy": 0.8203561455011368, "num_tokens": 687377581.0, "step": 21537 }, { "entropy": 0.5020901318639517, "epoch": 1.9816159769064008, "grad_norm": 0.1385432630777359, "learning_rate": 3.394976538780017e-05, "loss": 0.4998, "mean_token_accuracy": 0.8419103659689426, "num_tokens": 687409683.0, "step": 21538 }, { "entropy": 0.6375784110277891, "epoch": 1.981707983277842, "grad_norm": 0.15487627685070038, "learning_rate": 3.394669856165854e-05, "loss": 0.619, "mean_token_accuracy": 0.8130454458296299, "num_tokens": 687441829.0, "step": 21539 }, { "entropy": 0.5601273539941758, "epoch": 1.981799989649283, "grad_norm": 0.1475592851638794, "learning_rate": 3.3943631735516916e-05, "loss": 0.5506, "mean_token_accuracy": 0.8303366228938103, "num_tokens": 687473905.0, "step": 21540 }, { "entropy": 0.6067452523857355, "epoch": 1.9818919960207244, "grad_norm": 0.14932624995708466, "learning_rate": 3.394056490937529e-05, "loss": 0.5918, "mean_token_accuracy": 0.8152428604662418, "num_tokens": 687506421.0, "step": 21541 }, { "entropy": 0.656351663172245, "epoch": 1.9819840023921658, "grad_norm": 0.1547098606824875, "learning_rate": 3.3937498083233665e-05, "loss": 0.6431, "mean_token_accuracy": 0.8031336925923824, "num_tokens": 687538858.0, "step": 21542 }, { "entropy": 0.5865275617688894, "epoch": 1.982076008763607, "grad_norm": 0.15085817873477936, "learning_rate": 3.393443125709204e-05, "loss": 0.5732, "mean_token_accuracy": 0.8260928578674793, "num_tokens": 687569949.0, "step": 21543 }, { "entropy": 0.5647258441895247, "epoch": 1.982168015135048, "grad_norm": 0.14943087100982666, "learning_rate": 3.3931364430950414e-05, "loss": 0.5282, "mean_token_accuracy": 0.8311621882021427, "num_tokens": 687600759.0, "step": 21544 }, { "entropy": 0.6731502693146467, "epoch": 1.9822600215064892, "grad_norm": 0.15685850381851196, "learning_rate": 3.392829760480878e-05, "loss": 0.6583, "mean_token_accuracy": 0.8009099178016186, "num_tokens": 687632939.0, "step": 21545 }, { "entropy": 0.6163015654310584, "epoch": 1.9823520278779305, "grad_norm": 0.14433985948562622, "learning_rate": 3.3925230778667163e-05, "loss": 0.5958, "mean_token_accuracy": 0.8172035627067089, "num_tokens": 687664918.0, "step": 21546 }, { "entropy": 0.598819263279438, "epoch": 1.9824440342493719, "grad_norm": 0.153034970164299, "learning_rate": 3.392216395252553e-05, "loss": 0.5797, "mean_token_accuracy": 0.8217371553182602, "num_tokens": 687696316.0, "step": 21547 }, { "entropy": 0.6429418316110969, "epoch": 1.982536040620813, "grad_norm": 0.15573394298553467, "learning_rate": 3.3919097126383906e-05, "loss": 0.6302, "mean_token_accuracy": 0.8082378283143044, "num_tokens": 687727179.0, "step": 21548 }, { "entropy": 0.6416869517415762, "epoch": 1.9826280469922541, "grad_norm": 0.15500234067440033, "learning_rate": 3.391603030024228e-05, "loss": 0.6394, "mean_token_accuracy": 0.8039083182811737, "num_tokens": 687759095.0, "step": 21549 }, { "entropy": 0.6731972484849393, "epoch": 1.9827200533636953, "grad_norm": 0.1586930900812149, "learning_rate": 3.3912963474100655e-05, "loss": 0.6614, "mean_token_accuracy": 0.7987270876765251, "num_tokens": 687791113.0, "step": 21550 }, { "entropy": 0.6750628687441349, "epoch": 1.9828120597351366, "grad_norm": 0.164741650223732, "learning_rate": 3.390989664795903e-05, "loss": 0.6831, "mean_token_accuracy": 0.7940387390553951, "num_tokens": 687823279.0, "step": 21551 }, { "entropy": 0.5831459464970976, "epoch": 1.982904066106578, "grad_norm": 0.153578981757164, "learning_rate": 3.3906829821817405e-05, "loss": 0.5675, "mean_token_accuracy": 0.8222032375633717, "num_tokens": 687855426.0, "step": 21552 }, { "entropy": 0.4887913642451167, "epoch": 1.9829960724780191, "grad_norm": 0.14099721610546112, "learning_rate": 3.390376299567577e-05, "loss": 0.4762, "mean_token_accuracy": 0.8520812913775444, "num_tokens": 687887646.0, "step": 21553 }, { "entropy": 0.646588146686554, "epoch": 1.9830880788494603, "grad_norm": 0.15902946889400482, "learning_rate": 3.3900696169534154e-05, "loss": 0.6372, "mean_token_accuracy": 0.8076288960874081, "num_tokens": 687919546.0, "step": 21554 }, { "entropy": 0.5862221627030522, "epoch": 1.9831800852209014, "grad_norm": 0.1487301141023636, "learning_rate": 3.389762934339252e-05, "loss": 0.5829, "mean_token_accuracy": 0.8257103636860847, "num_tokens": 687951328.0, "step": 21555 }, { "entropy": 0.5705960094928741, "epoch": 1.9832720915923427, "grad_norm": 0.15919798612594604, "learning_rate": 3.3894562517250896e-05, "loss": 0.566, "mean_token_accuracy": 0.8273290582001209, "num_tokens": 687983687.0, "step": 21556 }, { "entropy": 0.6105326265096664, "epoch": 1.983364097963784, "grad_norm": 0.16069327294826508, "learning_rate": 3.389149569110927e-05, "loss": 0.6099, "mean_token_accuracy": 0.8114370666444302, "num_tokens": 688015923.0, "step": 21557 }, { "entropy": 0.7029568888247013, "epoch": 1.9834561043352252, "grad_norm": 0.16609472036361694, "learning_rate": 3.3888428864967646e-05, "loss": 0.7003, "mean_token_accuracy": 0.7866453714668751, "num_tokens": 688046479.0, "step": 21558 }, { "entropy": 0.49721645121462643, "epoch": 1.9835481107066664, "grad_norm": 0.14500726759433746, "learning_rate": 3.388536203882602e-05, "loss": 0.4922, "mean_token_accuracy": 0.8452561870217323, "num_tokens": 688078913.0, "step": 21559 }, { "entropy": 0.6732189487665892, "epoch": 1.9836401170781075, "grad_norm": 0.15699583292007446, "learning_rate": 3.3882295212684395e-05, "loss": 0.6806, "mean_token_accuracy": 0.7926576547324657, "num_tokens": 688111214.0, "step": 21560 }, { "entropy": 0.5305870436131954, "epoch": 1.9837321234495489, "grad_norm": 0.1476907730102539, "learning_rate": 3.387922838654276e-05, "loss": 0.5266, "mean_token_accuracy": 0.8373527601361275, "num_tokens": 688143571.0, "step": 21561 }, { "entropy": 0.5076725073158741, "epoch": 1.9838241298209902, "grad_norm": 0.14461855590343475, "learning_rate": 3.3876161560401144e-05, "loss": 0.5022, "mean_token_accuracy": 0.8429368920624256, "num_tokens": 688175691.0, "step": 21562 }, { "entropy": 0.6313925990834832, "epoch": 1.9839161361924313, "grad_norm": 0.15588980913162231, "learning_rate": 3.387309473425951e-05, "loss": 0.6198, "mean_token_accuracy": 0.8080747798085213, "num_tokens": 688207090.0, "step": 21563 }, { "entropy": 0.5483947806060314, "epoch": 1.9840081425638725, "grad_norm": 0.15127038955688477, "learning_rate": 3.3870027908117894e-05, "loss": 0.5355, "mean_token_accuracy": 0.8369836211204529, "num_tokens": 688239373.0, "step": 21564 }, { "entropy": 0.5462242132052779, "epoch": 1.9841001489353136, "grad_norm": 0.15016888082027435, "learning_rate": 3.386696108197626e-05, "loss": 0.541, "mean_token_accuracy": 0.8273280039429665, "num_tokens": 688270565.0, "step": 21565 }, { "entropy": 0.6334265256300569, "epoch": 1.984192155306755, "grad_norm": 0.16235016286373138, "learning_rate": 3.3863894255834636e-05, "loss": 0.6093, "mean_token_accuracy": 0.8103154115378857, "num_tokens": 688301993.0, "step": 21566 }, { "entropy": 0.4993603052571416, "epoch": 1.9842841616781963, "grad_norm": 0.1401498168706894, "learning_rate": 3.386082742969302e-05, "loss": 0.4934, "mean_token_accuracy": 0.8455562330782413, "num_tokens": 688334415.0, "step": 21567 }, { "entropy": 0.5698496755212545, "epoch": 1.9843761680496375, "grad_norm": 0.1513710469007492, "learning_rate": 3.3857760603551385e-05, "loss": 0.5393, "mean_token_accuracy": 0.8289843127131462, "num_tokens": 688365952.0, "step": 21568 }, { "entropy": 0.6737358178943396, "epoch": 1.9844681744210786, "grad_norm": 0.1576448529958725, "learning_rate": 3.385469377740976e-05, "loss": 0.6589, "mean_token_accuracy": 0.8019576333463192, "num_tokens": 688397433.0, "step": 21569 }, { "entropy": 0.6578704137355089, "epoch": 1.9845601807925197, "grad_norm": 0.15464374423027039, "learning_rate": 3.3851626951268135e-05, "loss": 0.6491, "mean_token_accuracy": 0.7998494543135166, "num_tokens": 688429345.0, "step": 21570 }, { "entropy": 0.4870771619025618, "epoch": 1.984652187163961, "grad_norm": 0.14496774971485138, "learning_rate": 3.384856012512651e-05, "loss": 0.4684, "mean_token_accuracy": 0.8520874567329884, "num_tokens": 688460824.0, "step": 21571 }, { "entropy": 0.6508522871881723, "epoch": 1.9847441935354024, "grad_norm": 0.16067087650299072, "learning_rate": 3.3845493298984884e-05, "loss": 0.6468, "mean_token_accuracy": 0.8000280633568764, "num_tokens": 688491895.0, "step": 21572 }, { "entropy": 0.5198565414175391, "epoch": 1.9848361999068436, "grad_norm": 0.1402553766965866, "learning_rate": 3.384242647284326e-05, "loss": 0.5016, "mean_token_accuracy": 0.8435371369123459, "num_tokens": 688524088.0, "step": 21573 }, { "entropy": 0.5349479578435421, "epoch": 1.9849282062782847, "grad_norm": 0.14995944499969482, "learning_rate": 3.3839359646701627e-05, "loss": 0.5318, "mean_token_accuracy": 0.8361690565943718, "num_tokens": 688556697.0, "step": 21574 }, { "entropy": 0.5680330265313387, "epoch": 1.9850202126497258, "grad_norm": 0.14508600533008575, "learning_rate": 3.383629282056001e-05, "loss": 0.5553, "mean_token_accuracy": 0.828470017760992, "num_tokens": 688588915.0, "step": 21575 }, { "entropy": 0.608504893258214, "epoch": 1.9851122190211672, "grad_norm": 0.148283451795578, "learning_rate": 3.3833225994418376e-05, "loss": 0.5905, "mean_token_accuracy": 0.8180308863520622, "num_tokens": 688621073.0, "step": 21576 }, { "entropy": 0.5267011551186442, "epoch": 1.9852042253926085, "grad_norm": 0.14633049070835114, "learning_rate": 3.383015916827675e-05, "loss": 0.5063, "mean_token_accuracy": 0.8422659747302532, "num_tokens": 688653047.0, "step": 21577 }, { "entropy": 0.500938355922699, "epoch": 1.9852962317640497, "grad_norm": 0.13887189328670502, "learning_rate": 3.3827092342135125e-05, "loss": 0.4887, "mean_token_accuracy": 0.8481066897511482, "num_tokens": 688685536.0, "step": 21578 }, { "entropy": 0.5487195216119289, "epoch": 1.9853882381354908, "grad_norm": 0.14617666602134705, "learning_rate": 3.38240255159935e-05, "loss": 0.5336, "mean_token_accuracy": 0.8377516195178032, "num_tokens": 688717680.0, "step": 21579 }, { "entropy": 0.634046315215528, "epoch": 1.985480244506932, "grad_norm": 0.1600792407989502, "learning_rate": 3.3820958689851874e-05, "loss": 0.6309, "mean_token_accuracy": 0.8063063435256481, "num_tokens": 688749604.0, "step": 21580 }, { "entropy": 0.544994942843914, "epoch": 1.9855722508783733, "grad_norm": 0.15017250180244446, "learning_rate": 3.381789186371025e-05, "loss": 0.5407, "mean_token_accuracy": 0.8314413800835609, "num_tokens": 688781730.0, "step": 21581 }, { "entropy": 0.6328804604709148, "epoch": 1.9856642572498147, "grad_norm": 0.16394184529781342, "learning_rate": 3.3814825037568624e-05, "loss": 0.6259, "mean_token_accuracy": 0.8081472367048264, "num_tokens": 688812414.0, "step": 21582 }, { "entropy": 0.5978228244930506, "epoch": 1.9857562636212558, "grad_norm": 0.15060105919837952, "learning_rate": 3.3811758211427e-05, "loss": 0.5877, "mean_token_accuracy": 0.8177066445350647, "num_tokens": 688844445.0, "step": 21583 }, { "entropy": 0.604547007009387, "epoch": 1.985848269992697, "grad_norm": 0.15580631792545319, "learning_rate": 3.3808691385285366e-05, "loss": 0.5942, "mean_token_accuracy": 0.8168554604053497, "num_tokens": 688875902.0, "step": 21584 }, { "entropy": 0.638314398471266, "epoch": 1.985940276364138, "grad_norm": 0.15266893804073334, "learning_rate": 3.380562455914375e-05, "loss": 0.6279, "mean_token_accuracy": 0.805937185883522, "num_tokens": 688908282.0, "step": 21585 }, { "entropy": 0.5303623951040208, "epoch": 1.9860322827355794, "grad_norm": 0.15391331911087036, "learning_rate": 3.3802557733002115e-05, "loss": 0.5271, "mean_token_accuracy": 0.837949100881815, "num_tokens": 688941048.0, "step": 21586 }, { "entropy": 0.5242257257923484, "epoch": 1.9861242891070208, "grad_norm": 0.14601916074752808, "learning_rate": 3.379949090686049e-05, "loss": 0.514, "mean_token_accuracy": 0.8375656828284264, "num_tokens": 688972433.0, "step": 21587 }, { "entropy": 0.6621140744537115, "epoch": 1.986216295478462, "grad_norm": 0.15686437487602234, "learning_rate": 3.3796424080718865e-05, "loss": 0.6517, "mean_token_accuracy": 0.799594271928072, "num_tokens": 689004540.0, "step": 21588 }, { "entropy": 0.4996066512539983, "epoch": 1.986308301849903, "grad_norm": 0.14332221448421478, "learning_rate": 3.379335725457724e-05, "loss": 0.4899, "mean_token_accuracy": 0.847476240247488, "num_tokens": 689036608.0, "step": 21589 }, { "entropy": 0.6162477135658264, "epoch": 1.9864003082213442, "grad_norm": 0.15757353603839874, "learning_rate": 3.3790290428435614e-05, "loss": 0.6105, "mean_token_accuracy": 0.8142591193318367, "num_tokens": 689069237.0, "step": 21590 }, { "entropy": 0.5310793574899435, "epoch": 1.9864923145927855, "grad_norm": 0.1508644074201584, "learning_rate": 3.378722360229399e-05, "loss": 0.5104, "mean_token_accuracy": 0.8380997329950333, "num_tokens": 689099648.0, "step": 21591 }, { "entropy": 0.609276638366282, "epoch": 1.9865843209642269, "grad_norm": 0.15119397640228271, "learning_rate": 3.3784156776152357e-05, "loss": 0.5957, "mean_token_accuracy": 0.8162188604474068, "num_tokens": 689132149.0, "step": 21592 }, { "entropy": 0.6188142346218228, "epoch": 1.986676327335668, "grad_norm": 0.15430721640586853, "learning_rate": 3.378108995001074e-05, "loss": 0.6078, "mean_token_accuracy": 0.8106958381831646, "num_tokens": 689164395.0, "step": 21593 }, { "entropy": 0.6301027042791247, "epoch": 1.9867683337071091, "grad_norm": 0.15406742691993713, "learning_rate": 3.3778023123869106e-05, "loss": 0.6161, "mean_token_accuracy": 0.8122220672667027, "num_tokens": 689195864.0, "step": 21594 }, { "entropy": 0.5935304742306471, "epoch": 1.9868603400785503, "grad_norm": 0.15276207029819489, "learning_rate": 3.377495629772748e-05, "loss": 0.5873, "mean_token_accuracy": 0.8199099265038967, "num_tokens": 689227626.0, "step": 21595 }, { "entropy": 0.5857824701815844, "epoch": 1.9869523464499916, "grad_norm": 0.15449494123458862, "learning_rate": 3.3771889471585855e-05, "loss": 0.5835, "mean_token_accuracy": 0.8191321231424809, "num_tokens": 689258972.0, "step": 21596 }, { "entropy": 0.668841416016221, "epoch": 1.987044352821433, "grad_norm": 0.16187681257724762, "learning_rate": 3.376882264544423e-05, "loss": 0.6624, "mean_token_accuracy": 0.7935694642364979, "num_tokens": 689291529.0, "step": 21597 }, { "entropy": 0.6723744664341211, "epoch": 1.9871363591928741, "grad_norm": 0.16065320372581482, "learning_rate": 3.376575581930261e-05, "loss": 0.6808, "mean_token_accuracy": 0.7935713715851307, "num_tokens": 689323884.0, "step": 21598 }, { "entropy": 0.4650551830418408, "epoch": 1.9872283655643153, "grad_norm": 0.14186760783195496, "learning_rate": 3.376268899316098e-05, "loss": 0.4608, "mean_token_accuracy": 0.8575037755072117, "num_tokens": 689356428.0, "step": 21599 }, { "entropy": 0.6936111580580473, "epoch": 1.9873203719357564, "grad_norm": 0.16536974906921387, "learning_rate": 3.3759622167019354e-05, "loss": 0.6904, "mean_token_accuracy": 0.7907715179026127, "num_tokens": 689387142.0, "step": 21600 }, { "entropy": 0.610959367826581, "epoch": 1.9874123783071977, "grad_norm": 0.15702536702156067, "learning_rate": 3.375655534087773e-05, "loss": 0.6062, "mean_token_accuracy": 0.8123453594744205, "num_tokens": 689419199.0, "step": 21601 }, { "entropy": 0.5676766550168395, "epoch": 1.987504384678639, "grad_norm": 0.14914439618587494, "learning_rate": 3.37534885147361e-05, "loss": 0.5631, "mean_token_accuracy": 0.8258108794689178, "num_tokens": 689451334.0, "step": 21602 }, { "entropy": 0.5732491500675678, "epoch": 1.9875963910500802, "grad_norm": 0.14727170765399933, "learning_rate": 3.375042168859448e-05, "loss": 0.5615, "mean_token_accuracy": 0.8206682130694389, "num_tokens": 689482468.0, "step": 21603 }, { "entropy": 0.4916043384000659, "epoch": 1.9876883974215214, "grad_norm": 0.14498493075370789, "learning_rate": 3.374735486245285e-05, "loss": 0.4944, "mean_token_accuracy": 0.8485073335468769, "num_tokens": 689515160.0, "step": 21604 }, { "entropy": 0.6103957556188107, "epoch": 1.9877804037929625, "grad_norm": 0.15276366472244263, "learning_rate": 3.374428803631122e-05, "loss": 0.5915, "mean_token_accuracy": 0.813869059085846, "num_tokens": 689547050.0, "step": 21605 }, { "entropy": 0.49915789207443595, "epoch": 1.9878724101644039, "grad_norm": 0.14544421434402466, "learning_rate": 3.37412212101696e-05, "loss": 0.4882, "mean_token_accuracy": 0.8504155054688454, "num_tokens": 689579039.0, "step": 21606 }, { "entropy": 0.6462370604276657, "epoch": 1.9879644165358452, "grad_norm": 0.15446244180202484, "learning_rate": 3.373815438402797e-05, "loss": 0.6478, "mean_token_accuracy": 0.8022974915802479, "num_tokens": 689611430.0, "step": 21607 }, { "entropy": 0.6298318151384592, "epoch": 1.9880564229072863, "grad_norm": 0.15467168390750885, "learning_rate": 3.3735087557886344e-05, "loss": 0.6087, "mean_token_accuracy": 0.812696073204279, "num_tokens": 689643319.0, "step": 21608 }, { "entropy": 0.5856251809746027, "epoch": 1.9881484292787275, "grad_norm": 0.1513008326292038, "learning_rate": 3.373202073174472e-05, "loss": 0.5758, "mean_token_accuracy": 0.826822504401207, "num_tokens": 689675355.0, "step": 21609 }, { "entropy": 0.7356169885024428, "epoch": 1.9882404356501686, "grad_norm": 0.16568268835544586, "learning_rate": 3.3728953905603093e-05, "loss": 0.7184, "mean_token_accuracy": 0.7828909382224083, "num_tokens": 689706734.0, "step": 21610 }, { "entropy": 0.7295725680887699, "epoch": 1.98833244202161, "grad_norm": 0.16898401081562042, "learning_rate": 3.372588707946147e-05, "loss": 0.7131, "mean_token_accuracy": 0.7817611321806908, "num_tokens": 689737991.0, "step": 21611 }, { "entropy": 0.6310762669891119, "epoch": 1.9884244483930513, "grad_norm": 0.1538771092891693, "learning_rate": 3.372282025331984e-05, "loss": 0.6225, "mean_token_accuracy": 0.8100895285606384, "num_tokens": 689770004.0, "step": 21612 }, { "entropy": 0.5622490923851728, "epoch": 1.9885164547644925, "grad_norm": 0.15072380006313324, "learning_rate": 3.371975342717821e-05, "loss": 0.5436, "mean_token_accuracy": 0.8279052898287773, "num_tokens": 689801699.0, "step": 21613 }, { "entropy": 0.6663888450711966, "epoch": 1.9886084611359336, "grad_norm": 0.1582961231470108, "learning_rate": 3.371668660103659e-05, "loss": 0.6396, "mean_token_accuracy": 0.8042829521000385, "num_tokens": 689832509.0, "step": 21614 }, { "entropy": 0.5687052551656961, "epoch": 1.9887004675073747, "grad_norm": 0.14525172114372253, "learning_rate": 3.371361977489496e-05, "loss": 0.5496, "mean_token_accuracy": 0.8318118825554848, "num_tokens": 689864393.0, "step": 21615 }, { "entropy": 0.653488028794527, "epoch": 1.988792473878816, "grad_norm": 0.16533468663692474, "learning_rate": 3.3710552948753335e-05, "loss": 0.6523, "mean_token_accuracy": 0.8021936863660812, "num_tokens": 689895067.0, "step": 21616 }, { "entropy": 0.60154590010643, "epoch": 1.9888844802502574, "grad_norm": 0.15773870050907135, "learning_rate": 3.370748612261171e-05, "loss": 0.5902, "mean_token_accuracy": 0.820705134421587, "num_tokens": 689926712.0, "step": 21617 }, { "entropy": 0.7187583697959781, "epoch": 1.9889764866216986, "grad_norm": 0.163474440574646, "learning_rate": 3.3704419296470084e-05, "loss": 0.7171, "mean_token_accuracy": 0.7822774536907673, "num_tokens": 689959430.0, "step": 21618 }, { "entropy": 0.5947198267094791, "epoch": 1.9890684929931397, "grad_norm": 0.15003955364227295, "learning_rate": 3.370135247032846e-05, "loss": 0.5829, "mean_token_accuracy": 0.8194454871118069, "num_tokens": 689991527.0, "step": 21619 }, { "entropy": 0.555798601359129, "epoch": 1.9891604993645808, "grad_norm": 0.15008214116096497, "learning_rate": 3.369828564418683e-05, "loss": 0.5533, "mean_token_accuracy": 0.8303950987756252, "num_tokens": 690023704.0, "step": 21620 }, { "entropy": 0.5551923734601587, "epoch": 1.9892525057360222, "grad_norm": 0.14696241915225983, "learning_rate": 3.36952188180452e-05, "loss": 0.5455, "mean_token_accuracy": 0.831668246537447, "num_tokens": 690055911.0, "step": 21621 }, { "entropy": 0.4951747157610953, "epoch": 1.9893445121074635, "grad_norm": 0.1414617896080017, "learning_rate": 3.369215199190358e-05, "loss": 0.4912, "mean_token_accuracy": 0.8441031910479069, "num_tokens": 690087865.0, "step": 21622 }, { "entropy": 0.5667181005701423, "epoch": 1.9894365184789047, "grad_norm": 0.153811514377594, "learning_rate": 3.368908516576195e-05, "loss": 0.5601, "mean_token_accuracy": 0.8251244910061359, "num_tokens": 690120179.0, "step": 21623 }, { "entropy": 0.6125516919419169, "epoch": 1.9895285248503458, "grad_norm": 0.15444634854793549, "learning_rate": 3.368601833962033e-05, "loss": 0.6064, "mean_token_accuracy": 0.8170103281736374, "num_tokens": 690151201.0, "step": 21624 }, { "entropy": 0.6505196923390031, "epoch": 1.989620531221787, "grad_norm": 0.15553905069828033, "learning_rate": 3.36829515134787e-05, "loss": 0.6502, "mean_token_accuracy": 0.8020145036280155, "num_tokens": 690182829.0, "step": 21625 }, { "entropy": 0.455946359783411, "epoch": 1.9897125375932283, "grad_norm": 0.1422642469406128, "learning_rate": 3.3679884687337074e-05, "loss": 0.441, "mean_token_accuracy": 0.8627371490001678, "num_tokens": 690215081.0, "step": 21626 }, { "entropy": 0.6004615088459104, "epoch": 1.9898045439646697, "grad_norm": 0.14370925724506378, "learning_rate": 3.367681786119545e-05, "loss": 0.5939, "mean_token_accuracy": 0.8200891055166721, "num_tokens": 690247684.0, "step": 21627 }, { "entropy": 0.6758940285071731, "epoch": 1.9898965503361108, "grad_norm": 0.15671321749687195, "learning_rate": 3.3673751035053824e-05, "loss": 0.6503, "mean_token_accuracy": 0.7974932231009007, "num_tokens": 690279369.0, "step": 21628 }, { "entropy": 0.6112273279577494, "epoch": 1.989988556707552, "grad_norm": 0.15959270298480988, "learning_rate": 3.36706842089122e-05, "loss": 0.6037, "mean_token_accuracy": 0.8128701895475388, "num_tokens": 690311146.0, "step": 21629 }, { "entropy": 0.529143454041332, "epoch": 1.990080563078993, "grad_norm": 0.14176522195339203, "learning_rate": 3.366761738277057e-05, "loss": 0.5254, "mean_token_accuracy": 0.8416041843593121, "num_tokens": 690343111.0, "step": 21630 }, { "entropy": 0.6418647989630699, "epoch": 1.9901725694504344, "grad_norm": 0.1590053141117096, "learning_rate": 3.366455055662895e-05, "loss": 0.629, "mean_token_accuracy": 0.8041764162480831, "num_tokens": 690374808.0, "step": 21631 }, { "entropy": 0.5604632603935897, "epoch": 1.9902645758218758, "grad_norm": 0.14866997301578522, "learning_rate": 3.366148373048732e-05, "loss": 0.5612, "mean_token_accuracy": 0.8307192213833332, "num_tokens": 690406846.0, "step": 21632 }, { "entropy": 0.6512761935591698, "epoch": 1.990356582193317, "grad_norm": 0.16187219321727753, "learning_rate": 3.36584169043457e-05, "loss": 0.6384, "mean_token_accuracy": 0.8047578558325768, "num_tokens": 690437784.0, "step": 21633 }, { "entropy": 0.6460897629149258, "epoch": 1.990448588564758, "grad_norm": 0.15901637077331543, "learning_rate": 3.3655350078204065e-05, "loss": 0.6401, "mean_token_accuracy": 0.801513496786356, "num_tokens": 690469794.0, "step": 21634 }, { "entropy": 0.6408135499805212, "epoch": 1.9905405949361992, "grad_norm": 0.15640439093112946, "learning_rate": 3.3652283252062446e-05, "loss": 0.6363, "mean_token_accuracy": 0.8022364526987076, "num_tokens": 690502110.0, "step": 21635 }, { "entropy": 0.5774107873439789, "epoch": 1.9906326013076405, "grad_norm": 0.15458838641643524, "learning_rate": 3.3649216425920814e-05, "loss": 0.5744, "mean_token_accuracy": 0.8232334330677986, "num_tokens": 690533493.0, "step": 21636 }, { "entropy": 0.5104016605764627, "epoch": 1.9907246076790819, "grad_norm": 0.14743506908416748, "learning_rate": 3.364614959977919e-05, "loss": 0.4964, "mean_token_accuracy": 0.8476687632501125, "num_tokens": 690564435.0, "step": 21637 }, { "entropy": 0.5313616953790188, "epoch": 1.990816614050523, "grad_norm": 0.1477167010307312, "learning_rate": 3.364308277363756e-05, "loss": 0.5294, "mean_token_accuracy": 0.833250317722559, "num_tokens": 690596354.0, "step": 21638 }, { "entropy": 0.6224566944874823, "epoch": 1.9909086204219641, "grad_norm": 0.15934686362743378, "learning_rate": 3.364001594749594e-05, "loss": 0.6106, "mean_token_accuracy": 0.815697368234396, "num_tokens": 690627641.0, "step": 21639 }, { "entropy": 0.6002692522015423, "epoch": 1.9910006267934053, "grad_norm": 0.14896894991397858, "learning_rate": 3.363694912135431e-05, "loss": 0.5919, "mean_token_accuracy": 0.8220861665904522, "num_tokens": 690659988.0, "step": 21640 }, { "entropy": 0.7069310676306486, "epoch": 1.9910926331648466, "grad_norm": 0.16403430700302124, "learning_rate": 3.363388229521269e-05, "loss": 0.684, "mean_token_accuracy": 0.7875049225986004, "num_tokens": 690691238.0, "step": 21641 }, { "entropy": 0.6021167756989598, "epoch": 1.991184639536288, "grad_norm": 0.16154751181602478, "learning_rate": 3.363081546907106e-05, "loss": 0.5996, "mean_token_accuracy": 0.8150535114109516, "num_tokens": 690722837.0, "step": 21642 }, { "entropy": 0.6118837334215641, "epoch": 1.9912766459077291, "grad_norm": 0.15402303636074066, "learning_rate": 3.3627748642929437e-05, "loss": 0.6056, "mean_token_accuracy": 0.8140365742146969, "num_tokens": 690755387.0, "step": 21643 }, { "entropy": 0.552430528216064, "epoch": 1.9913686522791703, "grad_norm": 0.14796102046966553, "learning_rate": 3.3624681816787804e-05, "loss": 0.5463, "mean_token_accuracy": 0.833213072270155, "num_tokens": 690787147.0, "step": 21644 }, { "entropy": 0.6604297980666161, "epoch": 1.9914606586506114, "grad_norm": 0.16006699204444885, "learning_rate": 3.3621614990646186e-05, "loss": 0.6431, "mean_token_accuracy": 0.8042919673025608, "num_tokens": 690819244.0, "step": 21645 }, { "entropy": 0.5961462520062923, "epoch": 1.9915526650220527, "grad_norm": 0.15272156894207, "learning_rate": 3.3618548164504554e-05, "loss": 0.5802, "mean_token_accuracy": 0.8189735859632492, "num_tokens": 690850102.0, "step": 21646 }, { "entropy": 0.6628443310037255, "epoch": 1.991644671393494, "grad_norm": 0.16032536327838898, "learning_rate": 3.361548133836293e-05, "loss": 0.66, "mean_token_accuracy": 0.799105953425169, "num_tokens": 690881598.0, "step": 21647 }, { "entropy": 0.6801207000389695, "epoch": 1.9917366777649352, "grad_norm": 0.1544838547706604, "learning_rate": 3.36124145122213e-05, "loss": 0.6561, "mean_token_accuracy": 0.7978668324649334, "num_tokens": 690913420.0, "step": 21648 }, { "entropy": 0.506829159334302, "epoch": 1.9918286841363764, "grad_norm": 0.1416950523853302, "learning_rate": 3.360934768607968e-05, "loss": 0.4933, "mean_token_accuracy": 0.8466536402702332, "num_tokens": 690945938.0, "step": 21649 }, { "entropy": 0.6540624760091305, "epoch": 1.9919206905078175, "grad_norm": 0.15121367573738098, "learning_rate": 3.360628085993805e-05, "loss": 0.6362, "mean_token_accuracy": 0.8007034100592136, "num_tokens": 690977727.0, "step": 21650 }, { "entropy": 0.6010622885078192, "epoch": 1.9920126968792589, "grad_norm": 0.15297171473503113, "learning_rate": 3.360321403379643e-05, "loss": 0.5977, "mean_token_accuracy": 0.816847700625658, "num_tokens": 691009489.0, "step": 21651 }, { "entropy": 0.6070909034460783, "epoch": 1.9921047032507002, "grad_norm": 0.15421058237552643, "learning_rate": 3.3600147207654795e-05, "loss": 0.5964, "mean_token_accuracy": 0.8170707523822784, "num_tokens": 691041079.0, "step": 21652 }, { "entropy": 0.518475916236639, "epoch": 1.9921967096221413, "grad_norm": 0.14305023849010468, "learning_rate": 3.3597080381513176e-05, "loss": 0.494, "mean_token_accuracy": 0.8490061052143574, "num_tokens": 691073251.0, "step": 21653 }, { "entropy": 0.6099980799481273, "epoch": 1.9922887159935825, "grad_norm": 0.15375573933124542, "learning_rate": 3.3594013555371544e-05, "loss": 0.6073, "mean_token_accuracy": 0.8162229508161545, "num_tokens": 691105145.0, "step": 21654 }, { "entropy": 0.6103209145367146, "epoch": 1.9923807223650236, "grad_norm": 0.15255668759346008, "learning_rate": 3.359094672922992e-05, "loss": 0.6076, "mean_token_accuracy": 0.8117245435714722, "num_tokens": 691136903.0, "step": 21655 }, { "entropy": 0.6257262546569109, "epoch": 1.992472728736465, "grad_norm": 0.15107157826423645, "learning_rate": 3.3587879903088293e-05, "loss": 0.6207, "mean_token_accuracy": 0.812111146748066, "num_tokens": 691169461.0, "step": 21656 }, { "entropy": 0.6095619844272733, "epoch": 1.9925647351079063, "grad_norm": 0.15555110573768616, "learning_rate": 3.358481307694667e-05, "loss": 0.5998, "mean_token_accuracy": 0.8134259767830372, "num_tokens": 691201529.0, "step": 21657 }, { "entropy": 0.6704163141548634, "epoch": 1.9926567414793475, "grad_norm": 0.1554785966873169, "learning_rate": 3.358174625080505e-05, "loss": 0.642, "mean_token_accuracy": 0.8021101467311382, "num_tokens": 691233055.0, "step": 21658 }, { "entropy": 0.5315172199625522, "epoch": 1.9927487478507886, "grad_norm": 0.15103593468666077, "learning_rate": 3.357867942466342e-05, "loss": 0.5209, "mean_token_accuracy": 0.8373115547001362, "num_tokens": 691264828.0, "step": 21659 }, { "entropy": 0.6389571949839592, "epoch": 1.9928407542222297, "grad_norm": 0.15286219120025635, "learning_rate": 3.357561259852179e-05, "loss": 0.635, "mean_token_accuracy": 0.8023375310003757, "num_tokens": 691297136.0, "step": 21660 }, { "entropy": 0.6988184824585915, "epoch": 1.992932760593671, "grad_norm": 0.15842704474925995, "learning_rate": 3.357254577238017e-05, "loss": 0.6916, "mean_token_accuracy": 0.7898135557770729, "num_tokens": 691329629.0, "step": 21661 }, { "entropy": 0.538586163893342, "epoch": 1.9930247669651124, "grad_norm": 0.1477169692516327, "learning_rate": 3.356947894623854e-05, "loss": 0.5332, "mean_token_accuracy": 0.8342948816716671, "num_tokens": 691361850.0, "step": 21662 }, { "entropy": 0.582433239556849, "epoch": 1.9931167733365536, "grad_norm": 0.15479552745819092, "learning_rate": 3.3566412120096916e-05, "loss": 0.5645, "mean_token_accuracy": 0.8278555311262608, "num_tokens": 691393553.0, "step": 21663 }, { "entropy": 0.613061455078423, "epoch": 1.9932087797079947, "grad_norm": 0.15271686017513275, "learning_rate": 3.356334529395529e-05, "loss": 0.6174, "mean_token_accuracy": 0.8126940503716469, "num_tokens": 691425323.0, "step": 21664 }, { "entropy": 0.7646865155547857, "epoch": 1.9933007860794358, "grad_norm": 0.1699734479188919, "learning_rate": 3.356027846781366e-05, "loss": 0.7621, "mean_token_accuracy": 0.7689073383808136, "num_tokens": 691457634.0, "step": 21665 }, { "entropy": 0.6010234728455544, "epoch": 1.9933927924508772, "grad_norm": 0.15267178416252136, "learning_rate": 3.355721164167204e-05, "loss": 0.5932, "mean_token_accuracy": 0.8183418735861778, "num_tokens": 691488900.0, "step": 21666 }, { "entropy": 0.5423195287585258, "epoch": 1.9934847988223185, "grad_norm": 0.15010161697864532, "learning_rate": 3.355414481553041e-05, "loss": 0.5219, "mean_token_accuracy": 0.8388812355697155, "num_tokens": 691519008.0, "step": 21667 }, { "entropy": 0.6909904275089502, "epoch": 1.9935768051937597, "grad_norm": 0.15879178047180176, "learning_rate": 3.355107798938878e-05, "loss": 0.689, "mean_token_accuracy": 0.7914682142436504, "num_tokens": 691551418.0, "step": 21668 }, { "entropy": 0.7018077643588185, "epoch": 1.9936688115652008, "grad_norm": 0.16131344437599182, "learning_rate": 3.354801116324716e-05, "loss": 0.6872, "mean_token_accuracy": 0.7926029525697231, "num_tokens": 691583532.0, "step": 21669 }, { "entropy": 0.5501084493007511, "epoch": 1.993760817936642, "grad_norm": 0.1525713950395584, "learning_rate": 3.354494433710553e-05, "loss": 0.5282, "mean_token_accuracy": 0.8350924104452133, "num_tokens": 691614135.0, "step": 21670 }, { "entropy": 0.5729947360232472, "epoch": 1.9938528243080833, "grad_norm": 0.14396178722381592, "learning_rate": 3.3541877510963906e-05, "loss": 0.5461, "mean_token_accuracy": 0.8320415914058685, "num_tokens": 691646579.0, "step": 21671 }, { "entropy": 0.6656774077564478, "epoch": 1.9939448306795247, "grad_norm": 0.16058586537837982, "learning_rate": 3.353881068482228e-05, "loss": 0.6659, "mean_token_accuracy": 0.7973045445978642, "num_tokens": 691678331.0, "step": 21672 }, { "entropy": 0.5353384325280786, "epoch": 1.9940368370509658, "grad_norm": 0.14365091919898987, "learning_rate": 3.353574385868065e-05, "loss": 0.5109, "mean_token_accuracy": 0.8405176065862179, "num_tokens": 691710191.0, "step": 21673 }, { "entropy": 0.5856874026358128, "epoch": 1.994128843422407, "grad_norm": 0.1520976573228836, "learning_rate": 3.353267703253903e-05, "loss": 0.5913, "mean_token_accuracy": 0.8187075108289719, "num_tokens": 691741819.0, "step": 21674 }, { "entropy": 0.6022312520071864, "epoch": 1.994220849793848, "grad_norm": 0.15967218577861786, "learning_rate": 3.35296102063974e-05, "loss": 0.6002, "mean_token_accuracy": 0.8150907307863235, "num_tokens": 691773789.0, "step": 21675 }, { "entropy": 0.685103690251708, "epoch": 1.9943128561652894, "grad_norm": 0.15458431839942932, "learning_rate": 3.352654338025577e-05, "loss": 0.6762, "mean_token_accuracy": 0.7907955460250378, "num_tokens": 691806437.0, "step": 21676 }, { "entropy": 0.6473441701382399, "epoch": 1.9944048625367308, "grad_norm": 0.1609283983707428, "learning_rate": 3.352347655411415e-05, "loss": 0.6475, "mean_token_accuracy": 0.8044667281210423, "num_tokens": 691837407.0, "step": 21677 }, { "entropy": 0.6831025928258896, "epoch": 1.994496868908172, "grad_norm": 0.16212397813796997, "learning_rate": 3.352040972797252e-05, "loss": 0.6917, "mean_token_accuracy": 0.7886796034872532, "num_tokens": 691868921.0, "step": 21678 }, { "entropy": 0.5612849676981568, "epoch": 1.994588875279613, "grad_norm": 0.14853407442569733, "learning_rate": 3.35173429018309e-05, "loss": 0.5503, "mean_token_accuracy": 0.8283043764531612, "num_tokens": 691901287.0, "step": 21679 }, { "entropy": 0.6119423070922494, "epoch": 1.9946808816510542, "grad_norm": 0.1558416485786438, "learning_rate": 3.351427607568927e-05, "loss": 0.5861, "mean_token_accuracy": 0.821190282702446, "num_tokens": 691932746.0, "step": 21680 }, { "entropy": 0.5341982804238796, "epoch": 1.9947728880224955, "grad_norm": 0.14635711908340454, "learning_rate": 3.351120924954764e-05, "loss": 0.5085, "mean_token_accuracy": 0.841052919626236, "num_tokens": 691964419.0, "step": 21681 }, { "entropy": 0.7124876640737057, "epoch": 1.9948648943939369, "grad_norm": 0.15694893896579742, "learning_rate": 3.350814242340602e-05, "loss": 0.7111, "mean_token_accuracy": 0.7791461423039436, "num_tokens": 691996696.0, "step": 21682 }, { "entropy": 0.6443781778216362, "epoch": 1.994956900765378, "grad_norm": 0.1568862646818161, "learning_rate": 3.350507559726439e-05, "loss": 0.6274, "mean_token_accuracy": 0.8050798028707504, "num_tokens": 692028014.0, "step": 21683 }, { "entropy": 0.5948461480438709, "epoch": 1.9950489071368191, "grad_norm": 0.1502501219511032, "learning_rate": 3.350200877112277e-05, "loss": 0.5871, "mean_token_accuracy": 0.8156019113957882, "num_tokens": 692060308.0, "step": 21684 }, { "entropy": 0.6629776302725077, "epoch": 1.9951409135082603, "grad_norm": 0.16202928125858307, "learning_rate": 3.349894194498114e-05, "loss": 0.6589, "mean_token_accuracy": 0.8007161132991314, "num_tokens": 692092110.0, "step": 21685 }, { "entropy": 0.6384144965559244, "epoch": 1.9952329198797016, "grad_norm": 0.15843601524829865, "learning_rate": 3.349587511883951e-05, "loss": 0.6395, "mean_token_accuracy": 0.8061299994587898, "num_tokens": 692123598.0, "step": 21686 }, { "entropy": 0.6408043019473553, "epoch": 1.995324926251143, "grad_norm": 0.15466155111789703, "learning_rate": 3.349280829269789e-05, "loss": 0.6326, "mean_token_accuracy": 0.8081676959991455, "num_tokens": 692156208.0, "step": 21687 }, { "entropy": 0.6575449146330357, "epoch": 1.9954169326225841, "grad_norm": 0.15777446329593658, "learning_rate": 3.348974146655626e-05, "loss": 0.6534, "mean_token_accuracy": 0.7960749231278896, "num_tokens": 692188070.0, "step": 21688 }, { "entropy": 0.6143891047686338, "epoch": 1.9955089389940253, "grad_norm": 0.15123817324638367, "learning_rate": 3.3486674640414636e-05, "loss": 0.5935, "mean_token_accuracy": 0.8175670616328716, "num_tokens": 692220588.0, "step": 21689 }, { "entropy": 0.6239649690687656, "epoch": 1.9956009453654664, "grad_norm": 0.15529756247997284, "learning_rate": 3.348360781427301e-05, "loss": 0.6179, "mean_token_accuracy": 0.8130023814737797, "num_tokens": 692252431.0, "step": 21690 }, { "entropy": 0.6239341823384166, "epoch": 1.9956929517369077, "grad_norm": 0.15588752925395966, "learning_rate": 3.3480540988131386e-05, "loss": 0.6096, "mean_token_accuracy": 0.8149559497833252, "num_tokens": 692284872.0, "step": 21691 }, { "entropy": 0.6449278518557549, "epoch": 1.995784958108349, "grad_norm": 0.16121719777584076, "learning_rate": 3.347747416198976e-05, "loss": 0.6428, "mean_token_accuracy": 0.8078878633677959, "num_tokens": 692316751.0, "step": 21692 }, { "entropy": 0.5629924796521664, "epoch": 1.9958769644797902, "grad_norm": 0.15052838623523712, "learning_rate": 3.3474407335848135e-05, "loss": 0.5621, "mean_token_accuracy": 0.827317338436842, "num_tokens": 692348526.0, "step": 21693 }, { "entropy": 0.6594132268801332, "epoch": 1.9959689708512314, "grad_norm": 0.15771430730819702, "learning_rate": 3.34713405097065e-05, "loss": 0.6589, "mean_token_accuracy": 0.8016374297440052, "num_tokens": 692380854.0, "step": 21694 }, { "entropy": 0.6413106489926577, "epoch": 1.9960609772226725, "grad_norm": 0.165681391954422, "learning_rate": 3.3468273683564884e-05, "loss": 0.6418, "mean_token_accuracy": 0.8005856163799763, "num_tokens": 692411905.0, "step": 21695 }, { "entropy": 0.6011346112936735, "epoch": 1.9961529835941139, "grad_norm": 0.15692993998527527, "learning_rate": 3.346520685742325e-05, "loss": 0.5943, "mean_token_accuracy": 0.8202184215188026, "num_tokens": 692444634.0, "step": 21696 }, { "entropy": 0.6842082431539893, "epoch": 1.9962449899655552, "grad_norm": 0.15861977636814117, "learning_rate": 3.346214003128163e-05, "loss": 0.6815, "mean_token_accuracy": 0.7932886891067028, "num_tokens": 692477121.0, "step": 21697 }, { "entropy": 0.5973452869802713, "epoch": 1.9963369963369964, "grad_norm": 0.1557682454586029, "learning_rate": 3.345907320514e-05, "loss": 0.586, "mean_token_accuracy": 0.818416066467762, "num_tokens": 692508465.0, "step": 21698 }, { "entropy": 0.7040898371487856, "epoch": 1.9964290027084375, "grad_norm": 0.16112545132637024, "learning_rate": 3.3456006378998376e-05, "loss": 0.6987, "mean_token_accuracy": 0.7884187549352646, "num_tokens": 692540150.0, "step": 21699 }, { "entropy": 0.5481988303363323, "epoch": 1.9965210090798786, "grad_norm": 0.15046179294586182, "learning_rate": 3.345293955285675e-05, "loss": 0.5379, "mean_token_accuracy": 0.8333075642585754, "num_tokens": 692572304.0, "step": 21700 }, { "entropy": 0.675577949732542, "epoch": 1.99661301545132, "grad_norm": 0.15812954306602478, "learning_rate": 3.3449872726715125e-05, "loss": 0.668, "mean_token_accuracy": 0.798475194722414, "num_tokens": 692604416.0, "step": 21701 }, { "entropy": 0.7184382472187281, "epoch": 1.9967050218227613, "grad_norm": 0.16136065125465393, "learning_rate": 3.34468059005735e-05, "loss": 0.7175, "mean_token_accuracy": 0.7821364738047123, "num_tokens": 692636522.0, "step": 21702 }, { "entropy": 0.6650229543447495, "epoch": 1.9967970281942025, "grad_norm": 0.15516020357608795, "learning_rate": 3.3443739074431875e-05, "loss": 0.6511, "mean_token_accuracy": 0.7980161644518375, "num_tokens": 692668274.0, "step": 21703 }, { "entropy": 0.6015467159450054, "epoch": 1.9968890345656436, "grad_norm": 0.151646688580513, "learning_rate": 3.344067224829024e-05, "loss": 0.5755, "mean_token_accuracy": 0.8207748904824257, "num_tokens": 692700532.0, "step": 21704 }, { "entropy": 0.5884369453415275, "epoch": 1.9969810409370847, "grad_norm": 0.15198391675949097, "learning_rate": 3.3437605422148624e-05, "loss": 0.579, "mean_token_accuracy": 0.8187618590891361, "num_tokens": 692732326.0, "step": 21705 }, { "entropy": 0.574674766510725, "epoch": 1.997073047308526, "grad_norm": 0.14947175979614258, "learning_rate": 3.343453859600699e-05, "loss": 0.5563, "mean_token_accuracy": 0.822684571146965, "num_tokens": 692763384.0, "step": 21706 }, { "entropy": 0.5233308924362063, "epoch": 1.9971650536799674, "grad_norm": 0.14536452293395996, "learning_rate": 3.3431471769865367e-05, "loss": 0.5153, "mean_token_accuracy": 0.8410404548048973, "num_tokens": 692795266.0, "step": 21707 }, { "entropy": 0.6585268154740334, "epoch": 1.9972570600514086, "grad_norm": 0.16209228336811066, "learning_rate": 3.342840494372374e-05, "loss": 0.6607, "mean_token_accuracy": 0.7940808683633804, "num_tokens": 692826073.0, "step": 21708 }, { "entropy": 0.556627961806953, "epoch": 1.9973490664228497, "grad_norm": 0.15085932612419128, "learning_rate": 3.3425338117582116e-05, "loss": 0.5495, "mean_token_accuracy": 0.8290518783032894, "num_tokens": 692857821.0, "step": 21709 }, { "entropy": 0.5510479933582246, "epoch": 1.9974410727942908, "grad_norm": 0.14469483494758606, "learning_rate": 3.342227129144049e-05, "loss": 0.5226, "mean_token_accuracy": 0.8381562493741512, "num_tokens": 692889049.0, "step": 21710 }, { "entropy": 0.5500463456846774, "epoch": 1.9975330791657322, "grad_norm": 0.15418295562267303, "learning_rate": 3.3419204465298865e-05, "loss": 0.5368, "mean_token_accuracy": 0.8362708725035191, "num_tokens": 692921106.0, "step": 21711 }, { "entropy": 0.6780353356152773, "epoch": 1.9976250855371736, "grad_norm": 0.1576218158006668, "learning_rate": 3.341613763915723e-05, "loss": 0.6628, "mean_token_accuracy": 0.7978283800184727, "num_tokens": 692952631.0, "step": 21712 }, { "entropy": 0.6052171946503222, "epoch": 1.9977170919086147, "grad_norm": 0.14850260317325592, "learning_rate": 3.3413070813015614e-05, "loss": 0.5815, "mean_token_accuracy": 0.8207036852836609, "num_tokens": 692985105.0, "step": 21713 }, { "entropy": 0.6552666830830276, "epoch": 1.9978090982800558, "grad_norm": 0.15985383093357086, "learning_rate": 3.341000398687398e-05, "loss": 0.6486, "mean_token_accuracy": 0.8018363416194916, "num_tokens": 693017271.0, "step": 21714 }, { "entropy": 0.622800531797111, "epoch": 1.997901104651497, "grad_norm": 0.1515122503042221, "learning_rate": 3.340693716073236e-05, "loss": 0.6146, "mean_token_accuracy": 0.8148924261331558, "num_tokens": 693049386.0, "step": 21715 }, { "entropy": 0.5310559184290469, "epoch": 1.9979931110229383, "grad_norm": 0.1487005054950714, "learning_rate": 3.340387033459073e-05, "loss": 0.5247, "mean_token_accuracy": 0.8374759443104267, "num_tokens": 693081470.0, "step": 21716 }, { "entropy": 0.6329658608883619, "epoch": 1.9980851173943797, "grad_norm": 0.1516135036945343, "learning_rate": 3.3400803508449106e-05, "loss": 0.6315, "mean_token_accuracy": 0.8071682564914227, "num_tokens": 693113888.0, "step": 21717 }, { "entropy": 0.7291287872940302, "epoch": 1.9981771237658208, "grad_norm": 0.16389015316963196, "learning_rate": 3.339773668230748e-05, "loss": 0.7274, "mean_token_accuracy": 0.7779957689344883, "num_tokens": 693145676.0, "step": 21718 }, { "entropy": 0.6804240774363279, "epoch": 1.998269130137262, "grad_norm": 0.15961642563343048, "learning_rate": 3.3394669856165856e-05, "loss": 0.6637, "mean_token_accuracy": 0.7980127409100533, "num_tokens": 693177293.0, "step": 21719 }, { "entropy": 0.5843066480010748, "epoch": 1.998361136508703, "grad_norm": 0.1555844098329544, "learning_rate": 3.339160303002423e-05, "loss": 0.5778, "mean_token_accuracy": 0.822947546839714, "num_tokens": 693209123.0, "step": 21720 }, { "entropy": 0.5528737148270011, "epoch": 1.9984531428801444, "grad_norm": 0.1438666582107544, "learning_rate": 3.3388536203882605e-05, "loss": 0.5399, "mean_token_accuracy": 0.8320121504366398, "num_tokens": 693241243.0, "step": 21721 }, { "entropy": 0.6134390160441399, "epoch": 1.9985451492515858, "grad_norm": 0.15036261081695557, "learning_rate": 3.338546937774098e-05, "loss": 0.5999, "mean_token_accuracy": 0.814147811383009, "num_tokens": 693272911.0, "step": 21722 }, { "entropy": 0.5854553310200572, "epoch": 1.998637155623027, "grad_norm": 0.15304525196552277, "learning_rate": 3.3382402551599354e-05, "loss": 0.5706, "mean_token_accuracy": 0.8237321116030216, "num_tokens": 693304589.0, "step": 21723 }, { "entropy": 0.574672095477581, "epoch": 1.998729161994468, "grad_norm": 0.15353548526763916, "learning_rate": 3.337933572545773e-05, "loss": 0.5676, "mean_token_accuracy": 0.825680635869503, "num_tokens": 693336055.0, "step": 21724 }, { "entropy": 0.5569671746343374, "epoch": 1.9988211683659092, "grad_norm": 0.14230790734291077, "learning_rate": 3.33762688993161e-05, "loss": 0.5412, "mean_token_accuracy": 0.8344012387096882, "num_tokens": 693368498.0, "step": 21725 }, { "entropy": 0.6752220382913947, "epoch": 1.9989131747373505, "grad_norm": 0.159891739487648, "learning_rate": 3.337320207317448e-05, "loss": 0.6651, "mean_token_accuracy": 0.7971754968166351, "num_tokens": 693399913.0, "step": 21726 }, { "entropy": 0.5297769294120371, "epoch": 1.9990051811087919, "grad_norm": 0.14461997151374817, "learning_rate": 3.3370135247032846e-05, "loss": 0.5115, "mean_token_accuracy": 0.84383250400424, "num_tokens": 693432387.0, "step": 21727 }, { "entropy": 0.5263453936204314, "epoch": 1.999097187480233, "grad_norm": 0.14113466441631317, "learning_rate": 3.336706842089122e-05, "loss": 0.5175, "mean_token_accuracy": 0.8407589644193649, "num_tokens": 693464219.0, "step": 21728 }, { "entropy": 0.5410955250263214, "epoch": 1.9991891938516742, "grad_norm": 0.15571404993534088, "learning_rate": 3.3364001594749595e-05, "loss": 0.5343, "mean_token_accuracy": 0.8399414643645287, "num_tokens": 693496109.0, "step": 21729 }, { "entropy": 0.633310591802001, "epoch": 1.9992812002231153, "grad_norm": 0.15777933597564697, "learning_rate": 3.336093476860797e-05, "loss": 0.6302, "mean_token_accuracy": 0.8081243261694908, "num_tokens": 693528411.0, "step": 21730 }, { "entropy": 0.6724159698933363, "epoch": 1.9993732065945566, "grad_norm": 0.1548951417207718, "learning_rate": 3.3357867942466345e-05, "loss": 0.6582, "mean_token_accuracy": 0.7935272492468357, "num_tokens": 693559872.0, "step": 21731 }, { "entropy": 0.6179715637117624, "epoch": 1.999465212965998, "grad_norm": 0.14721715450286865, "learning_rate": 3.335480111632472e-05, "loss": 0.6042, "mean_token_accuracy": 0.8184398151934147, "num_tokens": 693592423.0, "step": 21732 }, { "entropy": 0.6529521839693189, "epoch": 1.9995572193374391, "grad_norm": 0.16253310441970825, "learning_rate": 3.335173429018309e-05, "loss": 0.6375, "mean_token_accuracy": 0.8051816150546074, "num_tokens": 693623537.0, "step": 21733 }, { "entropy": 0.6867043245583773, "epoch": 1.9996492257088803, "grad_norm": 0.17611323297023773, "learning_rate": 3.334866746404147e-05, "loss": 0.6919, "mean_token_accuracy": 0.7911158353090286, "num_tokens": 693654748.0, "step": 21734 }, { "entropy": 0.6086466033011675, "epoch": 1.9997412320803214, "grad_norm": 0.15780940651893616, "learning_rate": 3.3345600637899836e-05, "loss": 0.6026, "mean_token_accuracy": 0.8209362775087357, "num_tokens": 693686376.0, "step": 21735 }, { "entropy": 0.5476636542007327, "epoch": 1.9998332384517628, "grad_norm": 0.1485259085893631, "learning_rate": 3.334253381175821e-05, "loss": 0.5456, "mean_token_accuracy": 0.8318690359592438, "num_tokens": 693718668.0, "step": 21736 }, { "entropy": 0.6743322946131229, "epoch": 1.999925244823204, "grad_norm": 0.16111235320568085, "learning_rate": 3.3339466985616586e-05, "loss": 0.6602, "mean_token_accuracy": 0.7955457232892513, "num_tokens": 693750389.0, "step": 21737 }, { "entropy": 0.6930741415574, "epoch": 2.0, "grad_norm": 0.17795565724372864, "learning_rate": 3.333640015947496e-05, "loss": 0.6822, "mean_token_accuracy": 0.79568828527744, "num_tokens": 693775524.0, "step": 21738 }, { "entropy": 0.4882159475237131, "epoch": 2.000092006371441, "grad_norm": 0.12783204019069672, "learning_rate": 3.3333333333333335e-05, "loss": 0.422, "mean_token_accuracy": 0.868078451603651, "num_tokens": 693807747.0, "step": 21739 }, { "entropy": 0.6371120791882277, "epoch": 2.0001840127428823, "grad_norm": 0.14760734140872955, "learning_rate": 3.333026650719171e-05, "loss": 0.5602, "mean_token_accuracy": 0.8248070366680622, "num_tokens": 693839569.0, "step": 21740 }, { "entropy": 0.6112168282270432, "epoch": 2.000276019114324, "grad_norm": 0.1428893357515335, "learning_rate": 3.332719968105008e-05, "loss": 0.5468, "mean_token_accuracy": 0.8306959830224514, "num_tokens": 693870904.0, "step": 21741 }, { "entropy": 0.5775752756744623, "epoch": 2.000368025485765, "grad_norm": 0.14138899743556976, "learning_rate": 3.332413285490846e-05, "loss": 0.5089, "mean_token_accuracy": 0.8388686738908291, "num_tokens": 693903506.0, "step": 21742 }, { "entropy": 0.5249866996891797, "epoch": 2.000460031857206, "grad_norm": 0.13714388012886047, "learning_rate": 3.332106602876683e-05, "loss": 0.4559, "mean_token_accuracy": 0.853901345282793, "num_tokens": 693934769.0, "step": 21743 }, { "entropy": 0.5766644878312945, "epoch": 2.0005520382286472, "grad_norm": 0.1496879905462265, "learning_rate": 3.331799920262521e-05, "loss": 0.5331, "mean_token_accuracy": 0.8347258530557156, "num_tokens": 693966670.0, "step": 21744 }, { "entropy": 0.5035528279840946, "epoch": 2.0006440446000884, "grad_norm": 0.14157654345035553, "learning_rate": 3.3314932376483576e-05, "loss": 0.4683, "mean_token_accuracy": 0.849264495074749, "num_tokens": 693998489.0, "step": 21745 }, { "entropy": 0.5656139068305492, "epoch": 2.00073605097153, "grad_norm": 0.14867889881134033, "learning_rate": 3.331186555034195e-05, "loss": 0.5223, "mean_token_accuracy": 0.833044420927763, "num_tokens": 694030461.0, "step": 21746 }, { "entropy": 0.5640584453940392, "epoch": 2.000828057342971, "grad_norm": 0.1486293524503708, "learning_rate": 3.3308798724200325e-05, "loss": 0.5232, "mean_token_accuracy": 0.8312431052327156, "num_tokens": 694062001.0, "step": 21747 }, { "entropy": 0.5130076967179775, "epoch": 2.0009200637144122, "grad_norm": 0.1492113173007965, "learning_rate": 3.33057318980587e-05, "loss": 0.4957, "mean_token_accuracy": 0.8419783972203732, "num_tokens": 694094226.0, "step": 21748 }, { "entropy": 0.5221845470368862, "epoch": 2.0010120700858534, "grad_norm": 0.1500317007303238, "learning_rate": 3.3302665071917075e-05, "loss": 0.4997, "mean_token_accuracy": 0.8450457006692886, "num_tokens": 694126764.0, "step": 21749 }, { "entropy": 0.47715382650494576, "epoch": 2.0011040764572945, "grad_norm": 0.14956553280353546, "learning_rate": 3.329959824577545e-05, "loss": 0.4606, "mean_token_accuracy": 0.8505205437541008, "num_tokens": 694157669.0, "step": 21750 }, { "entropy": 0.6195081602782011, "epoch": 2.001196082828736, "grad_norm": 0.15864986181259155, "learning_rate": 3.3296531419633824e-05, "loss": 0.5902, "mean_token_accuracy": 0.8167824111878872, "num_tokens": 694189366.0, "step": 21751 }, { "entropy": 0.5580797176808119, "epoch": 2.001288089200177, "grad_norm": 0.15758010745048523, "learning_rate": 3.32934645934922e-05, "loss": 0.5378, "mean_token_accuracy": 0.8319868892431259, "num_tokens": 694221630.0, "step": 21752 }, { "entropy": 0.4994313893839717, "epoch": 2.0013800955716183, "grad_norm": 0.1562284231185913, "learning_rate": 3.329039776735057e-05, "loss": 0.4843, "mean_token_accuracy": 0.8461102619767189, "num_tokens": 694253879.0, "step": 21753 }, { "entropy": 0.5027283830568194, "epoch": 2.0014721019430595, "grad_norm": 0.14998085796833038, "learning_rate": 3.328733094120894e-05, "loss": 0.4913, "mean_token_accuracy": 0.845512393862009, "num_tokens": 694286463.0, "step": 21754 }, { "entropy": 0.4455055904109031, "epoch": 2.0015641083145006, "grad_norm": 0.14973184466362, "learning_rate": 3.328426411506732e-05, "loss": 0.4404, "mean_token_accuracy": 0.8612036556005478, "num_tokens": 694318367.0, "step": 21755 }, { "entropy": 0.5444792024791241, "epoch": 2.001656114685942, "grad_norm": 0.15793803334236145, "learning_rate": 3.328119728892569e-05, "loss": 0.5316, "mean_token_accuracy": 0.8307078704237938, "num_tokens": 694350619.0, "step": 21756 }, { "entropy": 0.5145568400621414, "epoch": 2.0017481210573833, "grad_norm": 0.15404245257377625, "learning_rate": 3.327813046278407e-05, "loss": 0.5027, "mean_token_accuracy": 0.8385154940187931, "num_tokens": 694382608.0, "step": 21757 }, { "entropy": 0.5149971209466457, "epoch": 2.0018401274288244, "grad_norm": 0.15515607595443726, "learning_rate": 3.327506363664244e-05, "loss": 0.5044, "mean_token_accuracy": 0.8429304957389832, "num_tokens": 694415049.0, "step": 21758 }, { "entropy": 0.5047724656760693, "epoch": 2.0019321338002656, "grad_norm": 0.1600174456834793, "learning_rate": 3.3271996810500814e-05, "loss": 0.4843, "mean_token_accuracy": 0.845643911510706, "num_tokens": 694446885.0, "step": 21759 }, { "entropy": 0.5291582299396396, "epoch": 2.0020241401717067, "grad_norm": 0.1612808257341385, "learning_rate": 3.326892998435919e-05, "loss": 0.5092, "mean_token_accuracy": 0.8370389007031918, "num_tokens": 694477829.0, "step": 21760 }, { "entropy": 0.5076766419224441, "epoch": 2.0021161465431483, "grad_norm": 0.15354423224925995, "learning_rate": 3.3265863158217564e-05, "loss": 0.4791, "mean_token_accuracy": 0.8496737480163574, "num_tokens": 694509588.0, "step": 21761 }, { "entropy": 0.5342027265578508, "epoch": 2.0022081529145894, "grad_norm": 0.15935592353343964, "learning_rate": 3.326279633207594e-05, "loss": 0.5147, "mean_token_accuracy": 0.8373753502964973, "num_tokens": 694541477.0, "step": 21762 }, { "entropy": 0.4707281356677413, "epoch": 2.0023001592860306, "grad_norm": 0.15249145030975342, "learning_rate": 3.325972950593431e-05, "loss": 0.4495, "mean_token_accuracy": 0.8551596663892269, "num_tokens": 694573601.0, "step": 21763 }, { "entropy": 0.5525526441633701, "epoch": 2.0023921656574717, "grad_norm": 0.16468949615955353, "learning_rate": 3.325666267979268e-05, "loss": 0.5394, "mean_token_accuracy": 0.83228949457407, "num_tokens": 694605854.0, "step": 21764 }, { "entropy": 0.4684470994397998, "epoch": 2.002484172028913, "grad_norm": 0.1554773598909378, "learning_rate": 3.325359585365106e-05, "loss": 0.4509, "mean_token_accuracy": 0.8546244725584984, "num_tokens": 694638183.0, "step": 21765 }, { "entropy": 0.43567474093288183, "epoch": 2.0025761784003544, "grad_norm": 0.14562000334262848, "learning_rate": 3.325052902750943e-05, "loss": 0.4057, "mean_token_accuracy": 0.8677710741758347, "num_tokens": 694670885.0, "step": 21766 }, { "entropy": 0.5511590670794249, "epoch": 2.0026681847717955, "grad_norm": 0.16647884249687195, "learning_rate": 3.3247462201367805e-05, "loss": 0.5385, "mean_token_accuracy": 0.8284072130918503, "num_tokens": 694702742.0, "step": 21767 }, { "entropy": 0.6082041133195162, "epoch": 2.0027601911432367, "grad_norm": 0.1643332690000534, "learning_rate": 3.324439537522618e-05, "loss": 0.5822, "mean_token_accuracy": 0.8170853219926357, "num_tokens": 694733645.0, "step": 21768 }, { "entropy": 0.5696702264249325, "epoch": 2.002852197514678, "grad_norm": 0.15864819288253784, "learning_rate": 3.3241328549084554e-05, "loss": 0.5532, "mean_token_accuracy": 0.8233158588409424, "num_tokens": 694765288.0, "step": 21769 }, { "entropy": 0.4718777914531529, "epoch": 2.002944203886119, "grad_norm": 0.14768224954605103, "learning_rate": 3.323826172294293e-05, "loss": 0.4426, "mean_token_accuracy": 0.8603029623627663, "num_tokens": 694797708.0, "step": 21770 }, { "entropy": 0.5463611036539078, "epoch": 2.0030362102575605, "grad_norm": 0.153720885515213, "learning_rate": 3.32351948968013e-05, "loss": 0.5216, "mean_token_accuracy": 0.8331090398132801, "num_tokens": 694829382.0, "step": 21771 }, { "entropy": 0.5386064453050494, "epoch": 2.0031282166290016, "grad_norm": 0.1521752029657364, "learning_rate": 3.323212807065967e-05, "loss": 0.5107, "mean_token_accuracy": 0.8366850540041924, "num_tokens": 694861826.0, "step": 21772 }, { "entropy": 0.4450367148965597, "epoch": 2.003220223000443, "grad_norm": 0.14477549493312836, "learning_rate": 3.322906124451805e-05, "loss": 0.4271, "mean_token_accuracy": 0.8657913357019424, "num_tokens": 694894136.0, "step": 21773 }, { "entropy": 0.5866299904882908, "epoch": 2.003312229371884, "grad_norm": 0.16663230955600739, "learning_rate": 3.322599441837642e-05, "loss": 0.554, "mean_token_accuracy": 0.8281954191625118, "num_tokens": 694925130.0, "step": 21774 }, { "entropy": 0.4509043574798852, "epoch": 2.003404235743325, "grad_norm": 0.1462337076663971, "learning_rate": 3.3222927592234795e-05, "loss": 0.4303, "mean_token_accuracy": 0.8627828732132912, "num_tokens": 694957379.0, "step": 21775 }, { "entropy": 0.5189543720334768, "epoch": 2.0034962421147666, "grad_norm": 0.15347503125667572, "learning_rate": 3.321986076609317e-05, "loss": 0.4877, "mean_token_accuracy": 0.8422541730105877, "num_tokens": 694989191.0, "step": 21776 }, { "entropy": 0.47695045080035925, "epoch": 2.0035882484862078, "grad_norm": 0.15114927291870117, "learning_rate": 3.3216793939951544e-05, "loss": 0.4481, "mean_token_accuracy": 0.8602707125246525, "num_tokens": 695021588.0, "step": 21777 }, { "entropy": 0.5272474735975266, "epoch": 2.003680254857649, "grad_norm": 0.16188840568065643, "learning_rate": 3.321372711380992e-05, "loss": 0.52, "mean_token_accuracy": 0.833332784473896, "num_tokens": 695054104.0, "step": 21778 }, { "entropy": 0.516860885778442, "epoch": 2.00377226122909, "grad_norm": 0.15032705664634705, "learning_rate": 3.3210660287668294e-05, "loss": 0.5045, "mean_token_accuracy": 0.8426769264042377, "num_tokens": 695086583.0, "step": 21779 }, { "entropy": 0.457421887665987, "epoch": 2.003864267600531, "grad_norm": 0.1465654969215393, "learning_rate": 3.320759346152667e-05, "loss": 0.4368, "mean_token_accuracy": 0.8598159104585648, "num_tokens": 695118133.0, "step": 21780 }, { "entropy": 0.5303119625896215, "epoch": 2.0039562739719727, "grad_norm": 0.1599239856004715, "learning_rate": 3.320452663538504e-05, "loss": 0.507, "mean_token_accuracy": 0.8377167694270611, "num_tokens": 695149096.0, "step": 21781 }, { "entropy": 0.5678583942353725, "epoch": 2.004048280343414, "grad_norm": 0.1557624638080597, "learning_rate": 3.320145980924342e-05, "loss": 0.5465, "mean_token_accuracy": 0.8262496441602707, "num_tokens": 695181521.0, "step": 21782 }, { "entropy": 0.43308206577785313, "epoch": 2.004140286714855, "grad_norm": 0.14638152718544006, "learning_rate": 3.319839298310179e-05, "loss": 0.4186, "mean_token_accuracy": 0.8679939806461334, "num_tokens": 695213876.0, "step": 21783 }, { "entropy": 0.5031978958286345, "epoch": 2.004232293086296, "grad_norm": 0.15356332063674927, "learning_rate": 3.319532615696017e-05, "loss": 0.4863, "mean_token_accuracy": 0.8431280702352524, "num_tokens": 695245749.0, "step": 21784 }, { "entropy": 0.5282784011214972, "epoch": 2.0043242994577373, "grad_norm": 0.15452390909194946, "learning_rate": 3.3192259330818535e-05, "loss": 0.5053, "mean_token_accuracy": 0.8389118611812592, "num_tokens": 695277836.0, "step": 21785 }, { "entropy": 0.522991606965661, "epoch": 2.004416305829179, "grad_norm": 0.16025280952453613, "learning_rate": 3.3189192504676916e-05, "loss": 0.5113, "mean_token_accuracy": 0.8380349203944206, "num_tokens": 695310032.0, "step": 21786 }, { "entropy": 0.5110913054086268, "epoch": 2.00450831220062, "grad_norm": 0.1521005779504776, "learning_rate": 3.3186125678535284e-05, "loss": 0.4982, "mean_token_accuracy": 0.84282111749053, "num_tokens": 695342103.0, "step": 21787 }, { "entropy": 0.5521968451794237, "epoch": 2.004600318572061, "grad_norm": 0.16146785020828247, "learning_rate": 3.318305885239366e-05, "loss": 0.527, "mean_token_accuracy": 0.8321195058524609, "num_tokens": 695373415.0, "step": 21788 }, { "entropy": 0.49325892701745033, "epoch": 2.0046923249435022, "grad_norm": 0.15066784620285034, "learning_rate": 3.3179992026252033e-05, "loss": 0.4767, "mean_token_accuracy": 0.8478438407182693, "num_tokens": 695405587.0, "step": 21789 }, { "entropy": 0.48143270052969456, "epoch": 2.0047843313149434, "grad_norm": 0.15818528831005096, "learning_rate": 3.317692520011041e-05, "loss": 0.4671, "mean_token_accuracy": 0.8494676649570465, "num_tokens": 695436777.0, "step": 21790 }, { "entropy": 0.43631448689848185, "epoch": 2.004876337686385, "grad_norm": 0.14061501622200012, "learning_rate": 3.317385837396878e-05, "loss": 0.4164, "mean_token_accuracy": 0.8670011013746262, "num_tokens": 695469204.0, "step": 21791 }, { "entropy": 0.5834782496094704, "epoch": 2.004968344057826, "grad_norm": 0.15840859711170197, "learning_rate": 3.317079154782716e-05, "loss": 0.5573, "mean_token_accuracy": 0.823523472994566, "num_tokens": 695501308.0, "step": 21792 }, { "entropy": 0.53267777338624, "epoch": 2.0050603504292672, "grad_norm": 0.15327313542366028, "learning_rate": 3.3167724721685525e-05, "loss": 0.5025, "mean_token_accuracy": 0.8398448713123798, "num_tokens": 695533098.0, "step": 21793 }, { "entropy": 0.46262737456709146, "epoch": 2.0051523568007084, "grad_norm": 0.14989931881427765, "learning_rate": 3.316465789554391e-05, "loss": 0.4396, "mean_token_accuracy": 0.8571852296590805, "num_tokens": 695564887.0, "step": 21794 }, { "entropy": 0.6183658735826612, "epoch": 2.0052443631721495, "grad_norm": 0.16930879652500153, "learning_rate": 3.3161591069402275e-05, "loss": 0.5845, "mean_token_accuracy": 0.8198942616581917, "num_tokens": 695596722.0, "step": 21795 }, { "entropy": 0.5273523882497102, "epoch": 2.005336369543591, "grad_norm": 0.15260601043701172, "learning_rate": 3.315852424326065e-05, "loss": 0.4886, "mean_token_accuracy": 0.8443194329738617, "num_tokens": 695628531.0, "step": 21796 }, { "entropy": 0.5898381285369396, "epoch": 2.005428375915032, "grad_norm": 0.16195225715637207, "learning_rate": 3.3155457417119024e-05, "loss": 0.5538, "mean_token_accuracy": 0.8274027854204178, "num_tokens": 695660422.0, "step": 21797 }, { "entropy": 0.4698146730661392, "epoch": 2.0055203822864733, "grad_norm": 0.14967232942581177, "learning_rate": 3.31523905909774e-05, "loss": 0.4398, "mean_token_accuracy": 0.8561186529695988, "num_tokens": 695692173.0, "step": 21798 }, { "entropy": 0.5328671354800463, "epoch": 2.0056123886579145, "grad_norm": 0.157274529337883, "learning_rate": 3.314932376483577e-05, "loss": 0.5162, "mean_token_accuracy": 0.8347681015729904, "num_tokens": 695724748.0, "step": 21799 }, { "entropy": 0.5632595201022923, "epoch": 2.0057043950293556, "grad_norm": 0.16370341181755066, "learning_rate": 3.314625693869415e-05, "loss": 0.5426, "mean_token_accuracy": 0.8284100368618965, "num_tokens": 695756486.0, "step": 21800 }, { "entropy": 0.609288364648819, "epoch": 2.005796401400797, "grad_norm": 0.16969409584999084, "learning_rate": 3.314319011255252e-05, "loss": 0.5732, "mean_token_accuracy": 0.8213017731904984, "num_tokens": 695788205.0, "step": 21801 }, { "entropy": 0.5425587212666869, "epoch": 2.0058884077722383, "grad_norm": 0.15575848519802094, "learning_rate": 3.31401232864109e-05, "loss": 0.5111, "mean_token_accuracy": 0.8342747241258621, "num_tokens": 695820408.0, "step": 21802 }, { "entropy": 0.5530605753883719, "epoch": 2.0059804141436794, "grad_norm": 0.17091013491153717, "learning_rate": 3.3137056460269265e-05, "loss": 0.5455, "mean_token_accuracy": 0.8283788934350014, "num_tokens": 695852376.0, "step": 21803 }, { "entropy": 0.5839621694758534, "epoch": 2.0060724205151206, "grad_norm": 0.16118855774402618, "learning_rate": 3.3133989634127646e-05, "loss": 0.5693, "mean_token_accuracy": 0.8218055106699467, "num_tokens": 695884271.0, "step": 21804 }, { "entropy": 0.45125711150467396, "epoch": 2.0061644268865617, "grad_norm": 0.14685557782649994, "learning_rate": 3.3130922807986014e-05, "loss": 0.4414, "mean_token_accuracy": 0.8597032204270363, "num_tokens": 695917039.0, "step": 21805 }, { "entropy": 0.522493613883853, "epoch": 2.0062564332580033, "grad_norm": 0.16277502477169037, "learning_rate": 3.312785598184439e-05, "loss": 0.5109, "mean_token_accuracy": 0.8404820114374161, "num_tokens": 695948349.0, "step": 21806 }, { "entropy": 0.5554415192455053, "epoch": 2.0063484396294444, "grad_norm": 0.1633075326681137, "learning_rate": 3.3124789155702764e-05, "loss": 0.5377, "mean_token_accuracy": 0.8289578594267368, "num_tokens": 695980458.0, "step": 21807 }, { "entropy": 0.6439156383275986, "epoch": 2.0064404460008856, "grad_norm": 0.1709793508052826, "learning_rate": 3.312172232956114e-05, "loss": 0.6321, "mean_token_accuracy": 0.8004859760403633, "num_tokens": 696012069.0, "step": 21808 }, { "entropy": 0.4415588262490928, "epoch": 2.0065324523723267, "grad_norm": 0.1483413428068161, "learning_rate": 3.311865550341951e-05, "loss": 0.4307, "mean_token_accuracy": 0.8630135506391525, "num_tokens": 696044763.0, "step": 21809 }, { "entropy": 0.4597538774833083, "epoch": 2.006624458743768, "grad_norm": 0.15144884586334229, "learning_rate": 3.311558867727789e-05, "loss": 0.4435, "mean_token_accuracy": 0.8613018468022346, "num_tokens": 696076852.0, "step": 21810 }, { "entropy": 0.5529990736395121, "epoch": 2.0067164651152094, "grad_norm": 0.1621587574481964, "learning_rate": 3.311252185113626e-05, "loss": 0.5401, "mean_token_accuracy": 0.8312576301395893, "num_tokens": 696108787.0, "step": 21811 }, { "entropy": 0.5830287048593163, "epoch": 2.0068084714866505, "grad_norm": 0.16427771747112274, "learning_rate": 3.310945502499464e-05, "loss": 0.567, "mean_token_accuracy": 0.8210530541837215, "num_tokens": 696140875.0, "step": 21812 }, { "entropy": 0.5347011210396886, "epoch": 2.0069004778580917, "grad_norm": 0.15750350058078766, "learning_rate": 3.310638819885301e-05, "loss": 0.5131, "mean_token_accuracy": 0.8358508758246899, "num_tokens": 696173003.0, "step": 21813 }, { "entropy": 0.501180182211101, "epoch": 2.006992484229533, "grad_norm": 0.15853048861026764, "learning_rate": 3.310332137271138e-05, "loss": 0.4999, "mean_token_accuracy": 0.8423241563141346, "num_tokens": 696205238.0, "step": 21814 }, { "entropy": 0.6615647468715906, "epoch": 2.007084490600974, "grad_norm": 0.167110413312912, "learning_rate": 3.310025454656976e-05, "loss": 0.6235, "mean_token_accuracy": 0.8057871945202351, "num_tokens": 696237467.0, "step": 21815 }, { "entropy": 0.5101162893697619, "epoch": 2.0071764969724155, "grad_norm": 0.1502256840467453, "learning_rate": 3.309718772042813e-05, "loss": 0.4854, "mean_token_accuracy": 0.8463798239827156, "num_tokens": 696269854.0, "step": 21816 }, { "entropy": 0.5409860350191593, "epoch": 2.0072685033438566, "grad_norm": 0.15814168751239777, "learning_rate": 3.309412089428651e-05, "loss": 0.5205, "mean_token_accuracy": 0.8382706642150879, "num_tokens": 696300520.0, "step": 21817 }, { "entropy": 0.558727715164423, "epoch": 2.007360509715298, "grad_norm": 0.15900707244873047, "learning_rate": 3.309105406814488e-05, "loss": 0.5426, "mean_token_accuracy": 0.8280394598841667, "num_tokens": 696332404.0, "step": 21818 }, { "entropy": 0.6189981549978256, "epoch": 2.007452516086739, "grad_norm": 0.16536059975624084, "learning_rate": 3.308798724200325e-05, "loss": 0.6003, "mean_token_accuracy": 0.8144607543945312, "num_tokens": 696365140.0, "step": 21819 }, { "entropy": 0.5760944746434689, "epoch": 2.00754452245818, "grad_norm": 0.16956789791584015, "learning_rate": 3.308492041586163e-05, "loss": 0.5526, "mean_token_accuracy": 0.8238836228847504, "num_tokens": 696396052.0, "step": 21820 }, { "entropy": 0.6156325116753578, "epoch": 2.0076365288296216, "grad_norm": 0.16366249322891235, "learning_rate": 3.308185358972e-05, "loss": 0.5775, "mean_token_accuracy": 0.8176647461950779, "num_tokens": 696428207.0, "step": 21821 }, { "entropy": 0.5036723138764501, "epoch": 2.0077285352010628, "grad_norm": 0.15452256798744202, "learning_rate": 3.3078786763578376e-05, "loss": 0.4792, "mean_token_accuracy": 0.8465657979249954, "num_tokens": 696459840.0, "step": 21822 }, { "entropy": 0.5672266846522689, "epoch": 2.007820541572504, "grad_norm": 0.1621285080909729, "learning_rate": 3.307571993743675e-05, "loss": 0.5536, "mean_token_accuracy": 0.8273275569081306, "num_tokens": 696492035.0, "step": 21823 }, { "entropy": 0.5581860933452845, "epoch": 2.007912547943945, "grad_norm": 0.16540290415287018, "learning_rate": 3.307265311129512e-05, "loss": 0.538, "mean_token_accuracy": 0.8277989700436592, "num_tokens": 696523956.0, "step": 21824 }, { "entropy": 0.3969306359067559, "epoch": 2.008004554315386, "grad_norm": 0.14133143424987793, "learning_rate": 3.30695862851535e-05, "loss": 0.3855, "mean_token_accuracy": 0.8772581666707993, "num_tokens": 696556648.0, "step": 21825 }, { "entropy": 0.44613261334598064, "epoch": 2.0080965606868277, "grad_norm": 0.14981898665428162, "learning_rate": 3.306651945901187e-05, "loss": 0.4303, "mean_token_accuracy": 0.8610177263617516, "num_tokens": 696588034.0, "step": 21826 }, { "entropy": 0.4991959121543914, "epoch": 2.008188567058269, "grad_norm": 0.15485164523124695, "learning_rate": 3.306345263287024e-05, "loss": 0.4847, "mean_token_accuracy": 0.8451760523021221, "num_tokens": 696619674.0, "step": 21827 }, { "entropy": 0.47776742931455374, "epoch": 2.00828057342971, "grad_norm": 0.1539156436920166, "learning_rate": 3.306038580672862e-05, "loss": 0.455, "mean_token_accuracy": 0.8535896092653275, "num_tokens": 696651497.0, "step": 21828 }, { "entropy": 0.521033403230831, "epoch": 2.008372579801151, "grad_norm": 0.15609389543533325, "learning_rate": 3.305731898058699e-05, "loss": 0.5053, "mean_token_accuracy": 0.8403207175433636, "num_tokens": 696683496.0, "step": 21829 }, { "entropy": 0.5739969555288553, "epoch": 2.0084645861725923, "grad_norm": 0.16667190194129944, "learning_rate": 3.305425215444537e-05, "loss": 0.559, "mean_token_accuracy": 0.8259198069572449, "num_tokens": 696715067.0, "step": 21830 }, { "entropy": 0.45680842571891844, "epoch": 2.008556592544034, "grad_norm": 0.1429274082183838, "learning_rate": 3.305118532830374e-05, "loss": 0.4372, "mean_token_accuracy": 0.8592293597757816, "num_tokens": 696747181.0, "step": 21831 }, { "entropy": 0.47445189859718084, "epoch": 2.008648598915475, "grad_norm": 0.1516052782535553, "learning_rate": 3.304811850216211e-05, "loss": 0.4647, "mean_token_accuracy": 0.8518657498061657, "num_tokens": 696779266.0, "step": 21832 }, { "entropy": 0.4643415929749608, "epoch": 2.008740605286916, "grad_norm": 0.15627960860729218, "learning_rate": 3.304505167602049e-05, "loss": 0.4454, "mean_token_accuracy": 0.8578142002224922, "num_tokens": 696811242.0, "step": 21833 }, { "entropy": 0.5215511731803417, "epoch": 2.0088326116583572, "grad_norm": 0.1651768833398819, "learning_rate": 3.304198484987886e-05, "loss": 0.5152, "mean_token_accuracy": 0.8345527090132236, "num_tokens": 696842204.0, "step": 21834 }, { "entropy": 0.4817959205247462, "epoch": 2.0089246180297984, "grad_norm": 0.1523837149143219, "learning_rate": 3.303891802373723e-05, "loss": 0.4743, "mean_token_accuracy": 0.8491253666579723, "num_tokens": 696874008.0, "step": 21835 }, { "entropy": 0.3841371424496174, "epoch": 2.00901662440124, "grad_norm": 0.14170320332050323, "learning_rate": 3.303585119759561e-05, "loss": 0.364, "mean_token_accuracy": 0.8806306608021259, "num_tokens": 696905743.0, "step": 21836 }, { "entropy": 0.5127774372231215, "epoch": 2.009108630772681, "grad_norm": 0.15094974637031555, "learning_rate": 3.303278437145398e-05, "loss": 0.4916, "mean_token_accuracy": 0.842717107385397, "num_tokens": 696938155.0, "step": 21837 }, { "entropy": 0.49978801468387246, "epoch": 2.0092006371441222, "grad_norm": 0.15185612440109253, "learning_rate": 3.302971754531236e-05, "loss": 0.4757, "mean_token_accuracy": 0.8505255095660686, "num_tokens": 696970077.0, "step": 21838 }, { "entropy": 0.5174274891614914, "epoch": 2.0092926435155634, "grad_norm": 0.15413852035999298, "learning_rate": 3.302665071917073e-05, "loss": 0.492, "mean_token_accuracy": 0.8443313427269459, "num_tokens": 697002030.0, "step": 21839 }, { "entropy": 0.4496588371694088, "epoch": 2.0093846498870045, "grad_norm": 0.1484578400850296, "learning_rate": 3.30235838930291e-05, "loss": 0.4179, "mean_token_accuracy": 0.865664217621088, "num_tokens": 697033957.0, "step": 21840 }, { "entropy": 0.5577251110225916, "epoch": 2.009476656258446, "grad_norm": 0.16113512217998505, "learning_rate": 3.302051706688748e-05, "loss": 0.5406, "mean_token_accuracy": 0.8308097459375858, "num_tokens": 697065190.0, "step": 21841 }, { "entropy": 0.5748082427307963, "epoch": 2.009568662629887, "grad_norm": 0.15625382959842682, "learning_rate": 3.3017450240745856e-05, "loss": 0.549, "mean_token_accuracy": 0.8268111646175385, "num_tokens": 697097327.0, "step": 21842 }, { "entropy": 0.5343830568017438, "epoch": 2.0096606690013283, "grad_norm": 0.15683425962924957, "learning_rate": 3.301438341460423e-05, "loss": 0.5145, "mean_token_accuracy": 0.8405954167246819, "num_tokens": 697128282.0, "step": 21843 }, { "entropy": 0.5355354137718678, "epoch": 2.0097526753727695, "grad_norm": 0.15123149752616882, "learning_rate": 3.3011316588462605e-05, "loss": 0.5095, "mean_token_accuracy": 0.839091494679451, "num_tokens": 697160612.0, "step": 21844 }, { "entropy": 0.4467084249481559, "epoch": 2.0098446817442106, "grad_norm": 0.14296995103359222, "learning_rate": 3.300824976232097e-05, "loss": 0.4251, "mean_token_accuracy": 0.8653739765286446, "num_tokens": 697193027.0, "step": 21845 }, { "entropy": 0.5819707033224404, "epoch": 2.009936688115652, "grad_norm": 0.16959720849990845, "learning_rate": 3.3005182936179354e-05, "loss": 0.5657, "mean_token_accuracy": 0.8227125592529774, "num_tokens": 697225395.0, "step": 21846 }, { "entropy": 0.4756511216983199, "epoch": 2.0100286944870933, "grad_norm": 0.1616821140050888, "learning_rate": 3.300211611003772e-05, "loss": 0.458, "mean_token_accuracy": 0.8554836176335812, "num_tokens": 697256670.0, "step": 21847 }, { "entropy": 0.5331211630254984, "epoch": 2.0101207008585344, "grad_norm": 0.16080306470394135, "learning_rate": 3.29990492838961e-05, "loss": 0.5283, "mean_token_accuracy": 0.8341566696763039, "num_tokens": 697288783.0, "step": 21848 }, { "entropy": 0.5066978642717004, "epoch": 2.0102127072299756, "grad_norm": 0.15785419940948486, "learning_rate": 3.299598245775447e-05, "loss": 0.4873, "mean_token_accuracy": 0.847230575978756, "num_tokens": 697320626.0, "step": 21849 }, { "entropy": 0.5645683952607214, "epoch": 2.0103047136014167, "grad_norm": 0.16489414870738983, "learning_rate": 3.2992915631612846e-05, "loss": 0.5553, "mean_token_accuracy": 0.8254582472145557, "num_tokens": 697352839.0, "step": 21850 }, { "entropy": 0.4467596001923084, "epoch": 2.0103967199728583, "grad_norm": 0.14971086382865906, "learning_rate": 3.298984880547122e-05, "loss": 0.4334, "mean_token_accuracy": 0.8591008856892586, "num_tokens": 697384992.0, "step": 21851 }, { "entropy": 0.508360467851162, "epoch": 2.0104887263442994, "grad_norm": 0.15666940808296204, "learning_rate": 3.2986781979329596e-05, "loss": 0.4925, "mean_token_accuracy": 0.8423918038606644, "num_tokens": 697417081.0, "step": 21852 }, { "entropy": 0.4496310940012336, "epoch": 2.0105807327157406, "grad_norm": 0.14733023941516876, "learning_rate": 3.2983715153187963e-05, "loss": 0.4326, "mean_token_accuracy": 0.8677720203995705, "num_tokens": 697448843.0, "step": 21853 }, { "entropy": 0.5523027740418911, "epoch": 2.0106727390871817, "grad_norm": 0.15867486596107483, "learning_rate": 3.2980648327046345e-05, "loss": 0.5345, "mean_token_accuracy": 0.8312877230346203, "num_tokens": 697480527.0, "step": 21854 }, { "entropy": 0.44779312051832676, "epoch": 2.010764745458623, "grad_norm": 0.15471968054771423, "learning_rate": 3.297758150090471e-05, "loss": 0.4241, "mean_token_accuracy": 0.8659369684755802, "num_tokens": 697511540.0, "step": 21855 }, { "entropy": 0.5619842456653714, "epoch": 2.0108567518300644, "grad_norm": 0.15967847406864166, "learning_rate": 3.297451467476309e-05, "loss": 0.5413, "mean_token_accuracy": 0.8292883932590485, "num_tokens": 697544043.0, "step": 21856 }, { "entropy": 0.5746847689151764, "epoch": 2.0109487582015055, "grad_norm": 0.1639101803302765, "learning_rate": 3.297144784862146e-05, "loss": 0.5537, "mean_token_accuracy": 0.8232330307364464, "num_tokens": 697576004.0, "step": 21857 }, { "entropy": 0.5225209170021117, "epoch": 2.0110407645729467, "grad_norm": 0.15843093395233154, "learning_rate": 3.296838102247984e-05, "loss": 0.4942, "mean_token_accuracy": 0.8428549580276012, "num_tokens": 697607161.0, "step": 21858 }, { "entropy": 0.4496118454262614, "epoch": 2.011132770944388, "grad_norm": 0.14438413083553314, "learning_rate": 3.296531419633821e-05, "loss": 0.4205, "mean_token_accuracy": 0.865742851048708, "num_tokens": 697639894.0, "step": 21859 }, { "entropy": 0.4742437992244959, "epoch": 2.011224777315829, "grad_norm": 0.15444812178611755, "learning_rate": 3.2962247370196586e-05, "loss": 0.464, "mean_token_accuracy": 0.8524683453142643, "num_tokens": 697672362.0, "step": 21860 }, { "entropy": 0.41852539870887995, "epoch": 2.0113167836872705, "grad_norm": 0.1429002583026886, "learning_rate": 3.295918054405496e-05, "loss": 0.3982, "mean_token_accuracy": 0.8735326677560806, "num_tokens": 697704070.0, "step": 21861 }, { "entropy": 0.5655536763370037, "epoch": 2.0114087900587116, "grad_norm": 0.16264119744300842, "learning_rate": 3.2956113717913335e-05, "loss": 0.5419, "mean_token_accuracy": 0.8290996737778187, "num_tokens": 697736319.0, "step": 21862 }, { "entropy": 0.5511676631867886, "epoch": 2.011500796430153, "grad_norm": 0.1616804301738739, "learning_rate": 3.29530468917717e-05, "loss": 0.5123, "mean_token_accuracy": 0.8347729444503784, "num_tokens": 697767397.0, "step": 21863 }, { "entropy": 0.4978199221659452, "epoch": 2.011592802801594, "grad_norm": 0.15868128836154938, "learning_rate": 3.2949980065630085e-05, "loss": 0.4849, "mean_token_accuracy": 0.8491143360733986, "num_tokens": 697799409.0, "step": 21864 }, { "entropy": 0.4300439106300473, "epoch": 2.011684809173035, "grad_norm": 0.14910291135311127, "learning_rate": 3.294691323948845e-05, "loss": 0.4165, "mean_token_accuracy": 0.8659100048244, "num_tokens": 697832076.0, "step": 21865 }, { "entropy": 0.4631103063002229, "epoch": 2.0117768155444766, "grad_norm": 0.15466144680976868, "learning_rate": 3.294384641334683e-05, "loss": 0.456, "mean_token_accuracy": 0.8492441214621067, "num_tokens": 697864481.0, "step": 21866 }, { "entropy": 0.47835151804611087, "epoch": 2.0118688219159178, "grad_norm": 0.1487058401107788, "learning_rate": 3.29407795872052e-05, "loss": 0.4621, "mean_token_accuracy": 0.8521464318037033, "num_tokens": 697896682.0, "step": 21867 }, { "entropy": 0.5509091075509787, "epoch": 2.011960828287359, "grad_norm": 0.16296228766441345, "learning_rate": 3.2937712761063576e-05, "loss": 0.5295, "mean_token_accuracy": 0.8314329981803894, "num_tokens": 697928310.0, "step": 21868 }, { "entropy": 0.39969071513041854, "epoch": 2.0120528346588, "grad_norm": 0.14784666895866394, "learning_rate": 3.293464593492195e-05, "loss": 0.3618, "mean_token_accuracy": 0.8869266733527184, "num_tokens": 697960268.0, "step": 21869 }, { "entropy": 0.4655665857717395, "epoch": 2.012144841030241, "grad_norm": 0.14980705082416534, "learning_rate": 3.2931579108780326e-05, "loss": 0.4473, "mean_token_accuracy": 0.856971975415945, "num_tokens": 697992817.0, "step": 21870 }, { "entropy": 0.5658940281718969, "epoch": 2.0122368474016827, "grad_norm": 0.16405704617500305, "learning_rate": 3.2928512282638694e-05, "loss": 0.548, "mean_token_accuracy": 0.8210257589817047, "num_tokens": 698024347.0, "step": 21871 }, { "entropy": 0.4384296366479248, "epoch": 2.012328853773124, "grad_norm": 0.15036937594413757, "learning_rate": 3.2925445456497075e-05, "loss": 0.4226, "mean_token_accuracy": 0.8655794523656368, "num_tokens": 698056250.0, "step": 21872 }, { "entropy": 0.44609422609210014, "epoch": 2.012420860144565, "grad_norm": 0.15157048404216766, "learning_rate": 3.292237863035545e-05, "loss": 0.4312, "mean_token_accuracy": 0.8605640046298504, "num_tokens": 698087580.0, "step": 21873 }, { "entropy": 0.4891770612448454, "epoch": 2.012512866516006, "grad_norm": 0.1546977162361145, "learning_rate": 3.291931180421382e-05, "loss": 0.4705, "mean_token_accuracy": 0.848074309527874, "num_tokens": 698119342.0, "step": 21874 }, { "entropy": 0.5329309720546007, "epoch": 2.0126048728874473, "grad_norm": 0.1617574691772461, "learning_rate": 3.29162449780722e-05, "loss": 0.5281, "mean_token_accuracy": 0.8355042263865471, "num_tokens": 698151590.0, "step": 21875 }, { "entropy": 0.5580606963485479, "epoch": 2.012696879258889, "grad_norm": 0.16603437066078186, "learning_rate": 3.291317815193057e-05, "loss": 0.5378, "mean_token_accuracy": 0.82935905829072, "num_tokens": 698183934.0, "step": 21876 }, { "entropy": 0.458352071698755, "epoch": 2.01278888563033, "grad_norm": 0.1508628875017166, "learning_rate": 3.291011132578895e-05, "loss": 0.4286, "mean_token_accuracy": 0.8612022511661053, "num_tokens": 698215861.0, "step": 21877 }, { "entropy": 0.46661644661799073, "epoch": 2.012880892001771, "grad_norm": 0.1540936976671219, "learning_rate": 3.2907044499647316e-05, "loss": 0.4536, "mean_token_accuracy": 0.8567921482026577, "num_tokens": 698247840.0, "step": 21878 }, { "entropy": 0.5903770793229342, "epoch": 2.0129728983732122, "grad_norm": 0.16370974481105804, "learning_rate": 3.290397767350569e-05, "loss": 0.5655, "mean_token_accuracy": 0.8184118643403053, "num_tokens": 698280280.0, "step": 21879 }, { "entropy": 0.5370842578122392, "epoch": 2.0130649047446534, "grad_norm": 0.15803320705890656, "learning_rate": 3.2900910847364065e-05, "loss": 0.5209, "mean_token_accuracy": 0.8332810550928116, "num_tokens": 698312042.0, "step": 21880 }, { "entropy": 0.5643099872395396, "epoch": 2.013156911116095, "grad_norm": 0.16372957825660706, "learning_rate": 3.289784402122244e-05, "loss": 0.5353, "mean_token_accuracy": 0.8313204124569893, "num_tokens": 698342711.0, "step": 21881 }, { "entropy": 0.5688073094934225, "epoch": 2.013248917487536, "grad_norm": 0.16891604661941528, "learning_rate": 3.2894777195080815e-05, "loss": 0.5433, "mean_token_accuracy": 0.8263989090919495, "num_tokens": 698374031.0, "step": 21882 }, { "entropy": 0.4705533110536635, "epoch": 2.0133409238589772, "grad_norm": 0.14948664605617523, "learning_rate": 3.289171036893919e-05, "loss": 0.4535, "mean_token_accuracy": 0.854842122644186, "num_tokens": 698406470.0, "step": 21883 }, { "entropy": 0.44470289978198707, "epoch": 2.0134329302304184, "grad_norm": 0.14981485903263092, "learning_rate": 3.288864354279756e-05, "loss": 0.4264, "mean_token_accuracy": 0.8629787042737007, "num_tokens": 698438474.0, "step": 21884 }, { "entropy": 0.5309566715732217, "epoch": 2.0135249366018595, "grad_norm": 0.1631772220134735, "learning_rate": 3.288557671665594e-05, "loss": 0.5194, "mean_token_accuracy": 0.8357312381267548, "num_tokens": 698469537.0, "step": 21885 }, { "entropy": 0.5229780450463295, "epoch": 2.013616942973301, "grad_norm": 0.15328028798103333, "learning_rate": 3.2882509890514306e-05, "loss": 0.5006, "mean_token_accuracy": 0.8417806476354599, "num_tokens": 698502305.0, "step": 21886 }, { "entropy": 0.5412062909454107, "epoch": 2.013708949344742, "grad_norm": 0.16136807203292847, "learning_rate": 3.287944306437268e-05, "loss": 0.5236, "mean_token_accuracy": 0.8331842236220837, "num_tokens": 698534232.0, "step": 21887 }, { "entropy": 0.5374256148934364, "epoch": 2.0138009557161833, "grad_norm": 0.16007864475250244, "learning_rate": 3.2876376238231056e-05, "loss": 0.5204, "mean_token_accuracy": 0.8335499726235867, "num_tokens": 698565747.0, "step": 21888 }, { "entropy": 0.5185939874500036, "epoch": 2.0138929620876245, "grad_norm": 0.15811018645763397, "learning_rate": 3.287330941208943e-05, "loss": 0.5235, "mean_token_accuracy": 0.8331909030675888, "num_tokens": 698598414.0, "step": 21889 }, { "entropy": 0.5111702755093575, "epoch": 2.0139849684590656, "grad_norm": 0.15784823894500732, "learning_rate": 3.2870242585947805e-05, "loss": 0.4845, "mean_token_accuracy": 0.8475894220173359, "num_tokens": 698629131.0, "step": 21890 }, { "entropy": 0.5949757173657417, "epoch": 2.014076974830507, "grad_norm": 0.16588887572288513, "learning_rate": 3.286717575980618e-05, "loss": 0.5899, "mean_token_accuracy": 0.8165398575365543, "num_tokens": 698661498.0, "step": 21891 }, { "entropy": 0.6052792016416788, "epoch": 2.0141689812019483, "grad_norm": 0.17085577547550201, "learning_rate": 3.286410893366455e-05, "loss": 0.5861, "mean_token_accuracy": 0.8135531023144722, "num_tokens": 698692773.0, "step": 21892 }, { "entropy": 0.4608775991946459, "epoch": 2.0142609875733894, "grad_norm": 0.14848127961158752, "learning_rate": 3.286104210752293e-05, "loss": 0.4494, "mean_token_accuracy": 0.8564968481659889, "num_tokens": 698724769.0, "step": 21893 }, { "entropy": 0.5008926764130592, "epoch": 2.0143529939448306, "grad_norm": 0.16037236154079437, "learning_rate": 3.28579752813813e-05, "loss": 0.4802, "mean_token_accuracy": 0.8465452566742897, "num_tokens": 698756742.0, "step": 21894 }, { "entropy": 0.45501542976126075, "epoch": 2.0144450003162717, "grad_norm": 0.14542827010154724, "learning_rate": 3.285490845523967e-05, "loss": 0.4343, "mean_token_accuracy": 0.8581891618669033, "num_tokens": 698789418.0, "step": 21895 }, { "entropy": 0.5895303599536419, "epoch": 2.0145370066877133, "grad_norm": 0.16348877549171448, "learning_rate": 3.2851841629098046e-05, "loss": 0.5697, "mean_token_accuracy": 0.8196900859475136, "num_tokens": 698821606.0, "step": 21896 }, { "entropy": 0.5426561273634434, "epoch": 2.0146290130591544, "grad_norm": 0.1575843244791031, "learning_rate": 3.284877480295642e-05, "loss": 0.5247, "mean_token_accuracy": 0.8335892520844936, "num_tokens": 698853517.0, "step": 21897 }, { "entropy": 0.4924143732059747, "epoch": 2.0147210194305956, "grad_norm": 0.16013482213020325, "learning_rate": 3.2845707976814795e-05, "loss": 0.479, "mean_token_accuracy": 0.8457790650427341, "num_tokens": 698885593.0, "step": 21898 }, { "entropy": 0.5313021428883076, "epoch": 2.0148130258020367, "grad_norm": 0.15856529772281647, "learning_rate": 3.284264115067317e-05, "loss": 0.5179, "mean_token_accuracy": 0.8359119221568108, "num_tokens": 698917758.0, "step": 21899 }, { "entropy": 0.5434017777442932, "epoch": 2.014905032173478, "grad_norm": 0.16266342997550964, "learning_rate": 3.283957432453154e-05, "loss": 0.5256, "mean_token_accuracy": 0.8333657793700695, "num_tokens": 698950004.0, "step": 21900 }, { "entropy": 0.48279383033514023, "epoch": 2.0149970385449194, "grad_norm": 0.1554631143808365, "learning_rate": 3.283650749838992e-05, "loss": 0.4602, "mean_token_accuracy": 0.8545421585440636, "num_tokens": 698981692.0, "step": 21901 }, { "entropy": 0.54949417617172, "epoch": 2.0150890449163605, "grad_norm": 0.1586754024028778, "learning_rate": 3.2833440672248294e-05, "loss": 0.5324, "mean_token_accuracy": 0.8333414867520332, "num_tokens": 699014074.0, "step": 21902 }, { "entropy": 0.5474624177441001, "epoch": 2.0151810512878017, "grad_norm": 0.16282311081886292, "learning_rate": 3.283037384610667e-05, "loss": 0.5263, "mean_token_accuracy": 0.8367469944059849, "num_tokens": 699045444.0, "step": 21903 }, { "entropy": 0.4985347967594862, "epoch": 2.015273057659243, "grad_norm": 0.1561776101589203, "learning_rate": 3.282730701996504e-05, "loss": 0.4721, "mean_token_accuracy": 0.8484913259744644, "num_tokens": 699076390.0, "step": 21904 }, { "entropy": 0.5172533951699734, "epoch": 2.015365064030684, "grad_norm": 0.16220824420452118, "learning_rate": 3.282424019382341e-05, "loss": 0.4969, "mean_token_accuracy": 0.8405642621219158, "num_tokens": 699106962.0, "step": 21905 }, { "entropy": 0.5631919931620359, "epoch": 2.0154570704021255, "grad_norm": 0.16093340516090393, "learning_rate": 3.282117336768179e-05, "loss": 0.5333, "mean_token_accuracy": 0.8289896883070469, "num_tokens": 699138486.0, "step": 21906 }, { "entropy": 0.5220021056011319, "epoch": 2.0155490767735667, "grad_norm": 0.16057080030441284, "learning_rate": 3.281810654154016e-05, "loss": 0.5064, "mean_token_accuracy": 0.8390703462064266, "num_tokens": 699170660.0, "step": 21907 }, { "entropy": 0.6116512133739889, "epoch": 2.015641083145008, "grad_norm": 0.16695289313793182, "learning_rate": 3.2815039715398535e-05, "loss": 0.6003, "mean_token_accuracy": 0.8122610151767731, "num_tokens": 699202935.0, "step": 21908 }, { "entropy": 0.44648472033441067, "epoch": 2.015733089516449, "grad_norm": 0.1521284580230713, "learning_rate": 3.281197288925691e-05, "loss": 0.4331, "mean_token_accuracy": 0.8623563162982464, "num_tokens": 699235008.0, "step": 21909 }, { "entropy": 0.4794784407131374, "epoch": 2.01582509588789, "grad_norm": 0.15546701848506927, "learning_rate": 3.2808906063115284e-05, "loss": 0.4606, "mean_token_accuracy": 0.8529544621706009, "num_tokens": 699267095.0, "step": 21910 }, { "entropy": 0.5074496567249298, "epoch": 2.0159171022593316, "grad_norm": 0.15727479755878448, "learning_rate": 3.280583923697366e-05, "loss": 0.4958, "mean_token_accuracy": 0.8419616669416428, "num_tokens": 699299316.0, "step": 21911 }, { "entropy": 0.4831321663223207, "epoch": 2.0160091086307728, "grad_norm": 0.15280267596244812, "learning_rate": 3.2802772410832034e-05, "loss": 0.4661, "mean_token_accuracy": 0.8493027947843075, "num_tokens": 699331561.0, "step": 21912 }, { "entropy": 0.5274554211646318, "epoch": 2.016101115002214, "grad_norm": 0.16199690103530884, "learning_rate": 3.27997055846904e-05, "loss": 0.516, "mean_token_accuracy": 0.8376963250339031, "num_tokens": 699364068.0, "step": 21913 }, { "entropy": 0.4901702804490924, "epoch": 2.016193121373655, "grad_norm": 0.15402649343013763, "learning_rate": 3.279663875854878e-05, "loss": 0.4703, "mean_token_accuracy": 0.851044125854969, "num_tokens": 699395623.0, "step": 21914 }, { "entropy": 0.5160581730306149, "epoch": 2.016285127745096, "grad_norm": 0.15821383893489838, "learning_rate": 3.279357193240715e-05, "loss": 0.4977, "mean_token_accuracy": 0.8436126038432121, "num_tokens": 699428391.0, "step": 21915 }, { "entropy": 0.4971650307998061, "epoch": 2.0163771341165377, "grad_norm": 0.1521729826927185, "learning_rate": 3.2790505106265526e-05, "loss": 0.4719, "mean_token_accuracy": 0.8475264422595501, "num_tokens": 699460695.0, "step": 21916 }, { "entropy": 0.5761311212554574, "epoch": 2.016469140487979, "grad_norm": 0.15996456146240234, "learning_rate": 3.27874382801239e-05, "loss": 0.5571, "mean_token_accuracy": 0.8282892853021622, "num_tokens": 699493190.0, "step": 21917 }, { "entropy": 0.5708549693226814, "epoch": 2.01656114685942, "grad_norm": 0.1645536720752716, "learning_rate": 3.2784371453982275e-05, "loss": 0.568, "mean_token_accuracy": 0.8188611604273319, "num_tokens": 699524858.0, "step": 21918 }, { "entropy": 0.5495565999299288, "epoch": 2.016653153230861, "grad_norm": 0.1602034717798233, "learning_rate": 3.278130462784065e-05, "loss": 0.533, "mean_token_accuracy": 0.8325967825949192, "num_tokens": 699557233.0, "step": 21919 }, { "entropy": 0.6600127015262842, "epoch": 2.0167451596023023, "grad_norm": 0.17491848766803741, "learning_rate": 3.2778237801699024e-05, "loss": 0.6548, "mean_token_accuracy": 0.7970418408513069, "num_tokens": 699588898.0, "step": 21920 }, { "entropy": 0.5790367629379034, "epoch": 2.016837165973744, "grad_norm": 0.16461654007434845, "learning_rate": 3.27751709755574e-05, "loss": 0.5613, "mean_token_accuracy": 0.8215351887047291, "num_tokens": 699621046.0, "step": 21921 }, { "entropy": 0.5397985456511378, "epoch": 2.016929172345185, "grad_norm": 0.15843547880649567, "learning_rate": 3.2772104149415773e-05, "loss": 0.519, "mean_token_accuracy": 0.8372411988675594, "num_tokens": 699653443.0, "step": 21922 }, { "entropy": 0.45133344642817974, "epoch": 2.017021178716626, "grad_norm": 0.15069296956062317, "learning_rate": 3.276903732327414e-05, "loss": 0.4435, "mean_token_accuracy": 0.8584954366087914, "num_tokens": 699685967.0, "step": 21923 }, { "entropy": 0.5683680716902018, "epoch": 2.0171131850880673, "grad_norm": 0.16981211304664612, "learning_rate": 3.276597049713252e-05, "loss": 0.5599, "mean_token_accuracy": 0.8189392127096653, "num_tokens": 699717712.0, "step": 21924 }, { "entropy": 0.4816339900717139, "epoch": 2.0172051914595084, "grad_norm": 0.1547597050666809, "learning_rate": 3.276290367099089e-05, "loss": 0.4651, "mean_token_accuracy": 0.8522070609033108, "num_tokens": 699749946.0, "step": 21925 }, { "entropy": 0.5196881215088069, "epoch": 2.01729719783095, "grad_norm": 0.157619446516037, "learning_rate": 3.2759836844849265e-05, "loss": 0.5137, "mean_token_accuracy": 0.8385352976620197, "num_tokens": 699782055.0, "step": 21926 }, { "entropy": 0.5369373559951782, "epoch": 2.017389204202391, "grad_norm": 0.15796974301338196, "learning_rate": 3.275677001870764e-05, "loss": 0.5175, "mean_token_accuracy": 0.8333349004387856, "num_tokens": 699814545.0, "step": 21927 }, { "entropy": 0.486878065392375, "epoch": 2.0174812105738322, "grad_norm": 0.15405823290348053, "learning_rate": 3.2753703192566015e-05, "loss": 0.4621, "mean_token_accuracy": 0.852936502546072, "num_tokens": 699846682.0, "step": 21928 }, { "entropy": 0.5687541468068957, "epoch": 2.0175732169452734, "grad_norm": 0.1649332344532013, "learning_rate": 3.275063636642439e-05, "loss": 0.5581, "mean_token_accuracy": 0.8221318982541561, "num_tokens": 699878921.0, "step": 21929 }, { "entropy": 0.46103146811947227, "epoch": 2.0176652233167145, "grad_norm": 0.14837875962257385, "learning_rate": 3.2747569540282764e-05, "loss": 0.4376, "mean_token_accuracy": 0.8578555323183537, "num_tokens": 699910391.0, "step": 21930 }, { "entropy": 0.4897504411637783, "epoch": 2.017757229688156, "grad_norm": 0.15282028913497925, "learning_rate": 3.274450271414113e-05, "loss": 0.4558, "mean_token_accuracy": 0.8569714687764645, "num_tokens": 699942804.0, "step": 21931 }, { "entropy": 0.5843404848128557, "epoch": 2.017849236059597, "grad_norm": 0.16548296809196472, "learning_rate": 3.274143588799951e-05, "loss": 0.5527, "mean_token_accuracy": 0.824277188628912, "num_tokens": 699974874.0, "step": 21932 }, { "entropy": 0.5040371062932536, "epoch": 2.0179412424310383, "grad_norm": 0.1572290062904358, "learning_rate": 3.273836906185789e-05, "loss": 0.4815, "mean_token_accuracy": 0.8436537832021713, "num_tokens": 700006387.0, "step": 21933 }, { "entropy": 0.4619030279573053, "epoch": 2.0180332488024795, "grad_norm": 0.15418261289596558, "learning_rate": 3.2735302235716256e-05, "loss": 0.434, "mean_token_accuracy": 0.8614646196365356, "num_tokens": 700038140.0, "step": 21934 }, { "entropy": 0.44249306712299585, "epoch": 2.0181252551739206, "grad_norm": 0.14940626919269562, "learning_rate": 3.273223540957464e-05, "loss": 0.4169, "mean_token_accuracy": 0.8684713877737522, "num_tokens": 700069602.0, "step": 21935 }, { "entropy": 0.4737016437575221, "epoch": 2.018217261545362, "grad_norm": 0.15539097785949707, "learning_rate": 3.2729168583433005e-05, "loss": 0.4548, "mean_token_accuracy": 0.854354664683342, "num_tokens": 700101462.0, "step": 21936 }, { "entropy": 0.49774451553821564, "epoch": 2.0183092679168033, "grad_norm": 0.157947838306427, "learning_rate": 3.2726101757291386e-05, "loss": 0.4854, "mean_token_accuracy": 0.8434373959898949, "num_tokens": 700133565.0, "step": 21937 }, { "entropy": 0.5814980398863554, "epoch": 2.0184012742882445, "grad_norm": 0.16309361159801483, "learning_rate": 3.2723034931149754e-05, "loss": 0.5563, "mean_token_accuracy": 0.8255112357437611, "num_tokens": 700164989.0, "step": 21938 }, { "entropy": 0.497169591486454, "epoch": 2.0184932806596856, "grad_norm": 0.16414868831634521, "learning_rate": 3.271996810500813e-05, "loss": 0.4933, "mean_token_accuracy": 0.8409882970154285, "num_tokens": 700196785.0, "step": 21939 }, { "entropy": 0.5560973193496466, "epoch": 2.0185852870311267, "grad_norm": 0.16106250882148743, "learning_rate": 3.2716901278866504e-05, "loss": 0.5368, "mean_token_accuracy": 0.8265803307294846, "num_tokens": 700229030.0, "step": 21940 }, { "entropy": 0.557966710999608, "epoch": 2.0186772934025683, "grad_norm": 0.16201846301555634, "learning_rate": 3.271383445272488e-05, "loss": 0.5421, "mean_token_accuracy": 0.8268611654639244, "num_tokens": 700260633.0, "step": 21941 }, { "entropy": 0.5187567798420787, "epoch": 2.0187692997740094, "grad_norm": 0.15694975852966309, "learning_rate": 3.271076762658325e-05, "loss": 0.5067, "mean_token_accuracy": 0.8405571952462196, "num_tokens": 700292794.0, "step": 21942 }, { "entropy": 0.5764286993071437, "epoch": 2.0188613061454506, "grad_norm": 0.16642150282859802, "learning_rate": 3.270770080044163e-05, "loss": 0.5689, "mean_token_accuracy": 0.8214360065758228, "num_tokens": 700324003.0, "step": 21943 }, { "entropy": 0.5304053630679846, "epoch": 2.0189533125168917, "grad_norm": 0.1609564572572708, "learning_rate": 3.2704633974299995e-05, "loss": 0.5282, "mean_token_accuracy": 0.8323237486183643, "num_tokens": 700356176.0, "step": 21944 }, { "entropy": 0.5724618481472135, "epoch": 2.019045318888333, "grad_norm": 0.16343700885772705, "learning_rate": 3.270156714815838e-05, "loss": 0.5625, "mean_token_accuracy": 0.8221262767910957, "num_tokens": 700387873.0, "step": 21945 }, { "entropy": 0.506565916351974, "epoch": 2.0191373252597744, "grad_norm": 0.15572041273117065, "learning_rate": 3.2698500322016745e-05, "loss": 0.4984, "mean_token_accuracy": 0.839690912514925, "num_tokens": 700420058.0, "step": 21946 }, { "entropy": 0.4909514840692282, "epoch": 2.0192293316312155, "grad_norm": 0.16250190138816833, "learning_rate": 3.269543349587512e-05, "loss": 0.4884, "mean_token_accuracy": 0.8450535945594311, "num_tokens": 700451663.0, "step": 21947 }, { "entropy": 0.4598231837153435, "epoch": 2.0193213380026567, "grad_norm": 0.14808429777622223, "learning_rate": 3.2692366669733494e-05, "loss": 0.4471, "mean_token_accuracy": 0.8541004359722137, "num_tokens": 700483914.0, "step": 21948 }, { "entropy": 0.6135139930993319, "epoch": 2.019413344374098, "grad_norm": 0.16609297692775726, "learning_rate": 3.268929984359187e-05, "loss": 0.5918, "mean_token_accuracy": 0.8172815032303333, "num_tokens": 700516680.0, "step": 21949 }, { "entropy": 0.5068761520087719, "epoch": 2.019505350745539, "grad_norm": 0.15150268375873566, "learning_rate": 3.268623301745024e-05, "loss": 0.4932, "mean_token_accuracy": 0.8442077673971653, "num_tokens": 700549052.0, "step": 21950 }, { "entropy": 0.5543286520987749, "epoch": 2.0195973571169805, "grad_norm": 0.16443315148353577, "learning_rate": 3.268316619130862e-05, "loss": 0.5268, "mean_token_accuracy": 0.8318720944225788, "num_tokens": 700581055.0, "step": 21951 }, { "entropy": 0.49254854628816247, "epoch": 2.0196893634884217, "grad_norm": 0.15831932425498962, "learning_rate": 3.2680099365166986e-05, "loss": 0.4759, "mean_token_accuracy": 0.8487430699169636, "num_tokens": 700611556.0, "step": 21952 }, { "entropy": 0.5984737798571587, "epoch": 2.019781369859863, "grad_norm": 0.16587600111961365, "learning_rate": 3.267703253902537e-05, "loss": 0.5854, "mean_token_accuracy": 0.8165303729474545, "num_tokens": 700643737.0, "step": 21953 }, { "entropy": 0.5030574407428503, "epoch": 2.019873376231304, "grad_norm": 0.15843212604522705, "learning_rate": 3.2673965712883735e-05, "loss": 0.4821, "mean_token_accuracy": 0.8468196131289005, "num_tokens": 700675565.0, "step": 21954 }, { "entropy": 0.5845669638365507, "epoch": 2.019965382602745, "grad_norm": 0.16915126144886017, "learning_rate": 3.267089888674211e-05, "loss": 0.559, "mean_token_accuracy": 0.822652630507946, "num_tokens": 700706629.0, "step": 21955 }, { "entropy": 0.42907777475193143, "epoch": 2.0200573889741866, "grad_norm": 0.1534421145915985, "learning_rate": 3.2667832060600484e-05, "loss": 0.4135, "mean_token_accuracy": 0.8658148720860481, "num_tokens": 700737716.0, "step": 21956 }, { "entropy": 0.5309738367795944, "epoch": 2.0201493953456278, "grad_norm": 0.16191579401493073, "learning_rate": 3.266476523445886e-05, "loss": 0.5173, "mean_token_accuracy": 0.8393290191888809, "num_tokens": 700769413.0, "step": 21957 }, { "entropy": 0.5229270318523049, "epoch": 2.020241401717069, "grad_norm": 0.1590062528848648, "learning_rate": 3.2661698408317234e-05, "loss": 0.5042, "mean_token_accuracy": 0.8402824401855469, "num_tokens": 700800908.0, "step": 21958 }, { "entropy": 0.5400259317830205, "epoch": 2.02033340808851, "grad_norm": 0.16027195751667023, "learning_rate": 3.265863158217561e-05, "loss": 0.5167, "mean_token_accuracy": 0.8356324695050716, "num_tokens": 700832875.0, "step": 21959 }, { "entropy": 0.491018476895988, "epoch": 2.020425414459951, "grad_norm": 0.1526038497686386, "learning_rate": 3.2655564756033976e-05, "loss": 0.4706, "mean_token_accuracy": 0.8481470011174679, "num_tokens": 700865360.0, "step": 21960 }, { "entropy": 0.41165861673653126, "epoch": 2.0205174208313927, "grad_norm": 0.14734657108783722, "learning_rate": 3.265249792989236e-05, "loss": 0.3947, "mean_token_accuracy": 0.8732619062066078, "num_tokens": 700897193.0, "step": 21961 }, { "entropy": 0.5196669902652502, "epoch": 2.020609427202834, "grad_norm": 0.16814465820789337, "learning_rate": 3.2649431103750725e-05, "loss": 0.5023, "mean_token_accuracy": 0.8406430147588253, "num_tokens": 700928650.0, "step": 21962 }, { "entropy": 0.5703305187635124, "epoch": 2.020701433574275, "grad_norm": 0.16274073719978333, "learning_rate": 3.264636427760911e-05, "loss": 0.5575, "mean_token_accuracy": 0.8244023248553276, "num_tokens": 700960582.0, "step": 21963 }, { "entropy": 0.5174929751083255, "epoch": 2.020793439945716, "grad_norm": 0.15595410764217377, "learning_rate": 3.264329745146748e-05, "loss": 0.5002, "mean_token_accuracy": 0.8412653058767319, "num_tokens": 700992744.0, "step": 21964 }, { "entropy": 0.529096064157784, "epoch": 2.0208854463171573, "grad_norm": 0.1572636216878891, "learning_rate": 3.264023062532585e-05, "loss": 0.5265, "mean_token_accuracy": 0.8328158147633076, "num_tokens": 701024839.0, "step": 21965 }, { "entropy": 0.46355781331658363, "epoch": 2.020977452688599, "grad_norm": 0.14897520840168, "learning_rate": 3.263716379918423e-05, "loss": 0.4405, "mean_token_accuracy": 0.8605387732386589, "num_tokens": 701056940.0, "step": 21966 }, { "entropy": 0.5515089640393853, "epoch": 2.02106945906004, "grad_norm": 0.1561877280473709, "learning_rate": 3.26340969730426e-05, "loss": 0.5385, "mean_token_accuracy": 0.8292223587632179, "num_tokens": 701089445.0, "step": 21967 }, { "entropy": 0.5210096659138799, "epoch": 2.021161465431481, "grad_norm": 0.1593599021434784, "learning_rate": 3.263103014690097e-05, "loss": 0.4948, "mean_token_accuracy": 0.8408520296216011, "num_tokens": 701121672.0, "step": 21968 }, { "entropy": 0.4324651067145169, "epoch": 2.0212534718029223, "grad_norm": 0.15414097905158997, "learning_rate": 3.262796332075935e-05, "loss": 0.4181, "mean_token_accuracy": 0.8645920492708683, "num_tokens": 701153979.0, "step": 21969 }, { "entropy": 0.5154617382213473, "epoch": 2.0213454781743634, "grad_norm": 0.15896767377853394, "learning_rate": 3.262489649461772e-05, "loss": 0.4926, "mean_token_accuracy": 0.8461446799337864, "num_tokens": 701185790.0, "step": 21970 }, { "entropy": 0.611383177805692, "epoch": 2.021437484545805, "grad_norm": 0.1678403615951538, "learning_rate": 3.26218296684761e-05, "loss": 0.5942, "mean_token_accuracy": 0.8174673989415169, "num_tokens": 701217572.0, "step": 21971 }, { "entropy": 0.6632238812744617, "epoch": 2.021529490917246, "grad_norm": 0.17845642566680908, "learning_rate": 3.261876284233447e-05, "loss": 0.6537, "mean_token_accuracy": 0.7971382290124893, "num_tokens": 701249480.0, "step": 21972 }, { "entropy": 0.5216924538835883, "epoch": 2.0216214972886872, "grad_norm": 0.15217730402946472, "learning_rate": 3.261569601619284e-05, "loss": 0.4984, "mean_token_accuracy": 0.839003711938858, "num_tokens": 701281504.0, "step": 21973 }, { "entropy": 0.6138704447075725, "epoch": 2.0217135036601284, "grad_norm": 0.1674530804157257, "learning_rate": 3.261262919005122e-05, "loss": 0.5809, "mean_token_accuracy": 0.81784313544631, "num_tokens": 701312496.0, "step": 21974 }, { "entropy": 0.5838758703321218, "epoch": 2.0218055100315695, "grad_norm": 0.1659039407968521, "learning_rate": 3.260956236390959e-05, "loss": 0.5609, "mean_token_accuracy": 0.8190540969371796, "num_tokens": 701344119.0, "step": 21975 }, { "entropy": 0.593066981062293, "epoch": 2.021897516403011, "grad_norm": 0.16505713760852814, "learning_rate": 3.2606495537767964e-05, "loss": 0.5729, "mean_token_accuracy": 0.81995664909482, "num_tokens": 701376438.0, "step": 21976 }, { "entropy": 0.5352795054204762, "epoch": 2.021989522774452, "grad_norm": 0.15696759521961212, "learning_rate": 3.260342871162634e-05, "loss": 0.5183, "mean_token_accuracy": 0.8364660814404488, "num_tokens": 701408797.0, "step": 21977 }, { "entropy": 0.584213400259614, "epoch": 2.0220815291458933, "grad_norm": 0.16420771181583405, "learning_rate": 3.260036188548471e-05, "loss": 0.5685, "mean_token_accuracy": 0.8241406045854092, "num_tokens": 701440607.0, "step": 21978 }, { "entropy": 0.41333821625448763, "epoch": 2.0221735355173345, "grad_norm": 0.14823244512081146, "learning_rate": 3.259729505934309e-05, "loss": 0.3907, "mean_token_accuracy": 0.8756167851388454, "num_tokens": 701473164.0, "step": 21979 }, { "entropy": 0.6014729011803865, "epoch": 2.0222655418887756, "grad_norm": 0.16748958826065063, "learning_rate": 3.259422823320146e-05, "loss": 0.5882, "mean_token_accuracy": 0.8163076899945736, "num_tokens": 701505298.0, "step": 21980 }, { "entropy": 0.5222173077054322, "epoch": 2.022357548260217, "grad_norm": 0.1610279232263565, "learning_rate": 3.259116140705984e-05, "loss": 0.5107, "mean_token_accuracy": 0.8403001762926579, "num_tokens": 701536964.0, "step": 21981 }, { "entropy": 0.4631408238783479, "epoch": 2.0224495546316583, "grad_norm": 0.1497647911310196, "learning_rate": 3.258809458091821e-05, "loss": 0.451, "mean_token_accuracy": 0.8530904911458492, "num_tokens": 701568589.0, "step": 21982 }, { "entropy": 0.44898985186591744, "epoch": 2.0225415610030995, "grad_norm": 0.1552184671163559, "learning_rate": 3.258502775477658e-05, "loss": 0.443, "mean_token_accuracy": 0.8557519018650055, "num_tokens": 701600354.0, "step": 21983 }, { "entropy": 0.5048545440658927, "epoch": 2.0226335673745406, "grad_norm": 0.16229650378227234, "learning_rate": 3.258196092863496e-05, "loss": 0.4968, "mean_token_accuracy": 0.8409890681505203, "num_tokens": 701632138.0, "step": 21984 }, { "entropy": 0.5373260495252907, "epoch": 2.0227255737459817, "grad_norm": 0.16289155185222626, "learning_rate": 3.257889410249333e-05, "loss": 0.5232, "mean_token_accuracy": 0.8332479782402515, "num_tokens": 701664003.0, "step": 21985 }, { "entropy": 0.5387150114402175, "epoch": 2.0228175801174233, "grad_norm": 0.1618725061416626, "learning_rate": 3.2575827276351703e-05, "loss": 0.5206, "mean_token_accuracy": 0.8385115265846252, "num_tokens": 701696481.0, "step": 21986 }, { "entropy": 0.5463891262188554, "epoch": 2.0229095864888644, "grad_norm": 0.16290122270584106, "learning_rate": 3.257276045021008e-05, "loss": 0.544, "mean_token_accuracy": 0.8281944952905178, "num_tokens": 701727933.0, "step": 21987 }, { "entropy": 0.5884536756202579, "epoch": 2.0230015928603056, "grad_norm": 0.16735747456550598, "learning_rate": 3.256969362406845e-05, "loss": 0.5695, "mean_token_accuracy": 0.8224771469831467, "num_tokens": 701759851.0, "step": 21988 }, { "entropy": 0.57626480050385, "epoch": 2.0230935992317467, "grad_norm": 0.1566448211669922, "learning_rate": 3.256662679792683e-05, "loss": 0.5535, "mean_token_accuracy": 0.8264148756861687, "num_tokens": 701792523.0, "step": 21989 }, { "entropy": 0.48718042485415936, "epoch": 2.023185605603188, "grad_norm": 0.154062420129776, "learning_rate": 3.25635599717852e-05, "loss": 0.4571, "mean_token_accuracy": 0.8526941761374474, "num_tokens": 701824192.0, "step": 21990 }, { "entropy": 0.560528252273798, "epoch": 2.0232776119746294, "grad_norm": 0.16116732358932495, "learning_rate": 3.256049314564357e-05, "loss": 0.5459, "mean_token_accuracy": 0.8302668668329716, "num_tokens": 701856510.0, "step": 21991 }, { "entropy": 0.5235779788345098, "epoch": 2.0233696183460705, "grad_norm": 0.16407784819602966, "learning_rate": 3.255742631950195e-05, "loss": 0.5188, "mean_token_accuracy": 0.8380858525633812, "num_tokens": 701888499.0, "step": 21992 }, { "entropy": 0.5508610103279352, "epoch": 2.0234616247175117, "grad_norm": 0.17013518512248993, "learning_rate": 3.255435949336032e-05, "loss": 0.5453, "mean_token_accuracy": 0.8286716602742672, "num_tokens": 701920425.0, "step": 21993 }, { "entropy": 0.569616537541151, "epoch": 2.023553631088953, "grad_norm": 0.16194981336593628, "learning_rate": 3.2551292667218694e-05, "loss": 0.5433, "mean_token_accuracy": 0.8285768777132034, "num_tokens": 701952182.0, "step": 21994 }, { "entropy": 0.5704574529081583, "epoch": 2.023645637460394, "grad_norm": 0.16532038152217865, "learning_rate": 3.2548225841077075e-05, "loss": 0.568, "mean_token_accuracy": 0.8212864361703396, "num_tokens": 701984692.0, "step": 21995 }, { "entropy": 0.5053611807525158, "epoch": 2.0237376438318355, "grad_norm": 0.15290240943431854, "learning_rate": 3.254515901493544e-05, "loss": 0.4853, "mean_token_accuracy": 0.844261147081852, "num_tokens": 702016679.0, "step": 21996 }, { "entropy": 0.5060626203194261, "epoch": 2.0238296502032767, "grad_norm": 0.16277176141738892, "learning_rate": 3.2542092188793825e-05, "loss": 0.4979, "mean_token_accuracy": 0.8420111313462257, "num_tokens": 702048745.0, "step": 21997 }, { "entropy": 0.49060916155576706, "epoch": 2.023921656574718, "grad_norm": 0.15621024370193481, "learning_rate": 3.253902536265219e-05, "loss": 0.4566, "mean_token_accuracy": 0.8544529303908348, "num_tokens": 702079813.0, "step": 21998 }, { "entropy": 0.5375341530889273, "epoch": 2.024013662946159, "grad_norm": 0.15730109810829163, "learning_rate": 3.253595853651057e-05, "loss": 0.523, "mean_token_accuracy": 0.8333170115947723, "num_tokens": 702112150.0, "step": 21999 }, { "entropy": 0.4365040569100529, "epoch": 2.0241056693176, "grad_norm": 0.15050597488880157, "learning_rate": 3.253289171036894e-05, "loss": 0.4107, "mean_token_accuracy": 0.8666605427861214, "num_tokens": 702143687.0, "step": 22000 }, { "entropy": 0.7153935162350535, "epoch": 2.0241976756890416, "grad_norm": 0.17135122418403625, "learning_rate": 3.2529824884227316e-05, "loss": 0.6882, "mean_token_accuracy": 0.7891278974711895, "num_tokens": 702175875.0, "step": 22001 }, { "entropy": 0.4263616157695651, "epoch": 2.0242896820604828, "grad_norm": 0.14174550771713257, "learning_rate": 3.252675805808569e-05, "loss": 0.4151, "mean_token_accuracy": 0.867340374737978, "num_tokens": 702208200.0, "step": 22002 }, { "entropy": 0.5301129864528775, "epoch": 2.024381688431924, "grad_norm": 0.16096194088459015, "learning_rate": 3.2523691231944066e-05, "loss": 0.5141, "mean_token_accuracy": 0.8333553746342659, "num_tokens": 702239122.0, "step": 22003 }, { "entropy": 0.5254532461985946, "epoch": 2.024473694803365, "grad_norm": 0.1649269014596939, "learning_rate": 3.2520624405802434e-05, "loss": 0.5019, "mean_token_accuracy": 0.8403330743312836, "num_tokens": 702270414.0, "step": 22004 }, { "entropy": 0.5820904988795519, "epoch": 2.024565701174806, "grad_norm": 0.1642695516347885, "learning_rate": 3.2517557579660815e-05, "loss": 0.5558, "mean_token_accuracy": 0.8229217827320099, "num_tokens": 702301811.0, "step": 22005 }, { "entropy": 0.44959017261862755, "epoch": 2.0246577075462477, "grad_norm": 0.14688584208488464, "learning_rate": 3.251449075351918e-05, "loss": 0.4289, "mean_token_accuracy": 0.8609480671584606, "num_tokens": 702334075.0, "step": 22006 }, { "entropy": 0.5210191714577377, "epoch": 2.024749713917689, "grad_norm": 0.16258648037910461, "learning_rate": 3.251142392737756e-05, "loss": 0.4926, "mean_token_accuracy": 0.846203938126564, "num_tokens": 702365069.0, "step": 22007 }, { "entropy": 0.4956805454567075, "epoch": 2.02484172028913, "grad_norm": 0.16023555397987366, "learning_rate": 3.250835710123593e-05, "loss": 0.4863, "mean_token_accuracy": 0.8439951911568642, "num_tokens": 702397278.0, "step": 22008 }, { "entropy": 0.41435869387350976, "epoch": 2.024933726660571, "grad_norm": 0.14371919631958008, "learning_rate": 3.250529027509431e-05, "loss": 0.398, "mean_token_accuracy": 0.8705567084252834, "num_tokens": 702429666.0, "step": 22009 }, { "entropy": 0.4778852283488959, "epoch": 2.0250257330320123, "grad_norm": 0.15448041260242462, "learning_rate": 3.250222344895268e-05, "loss": 0.4486, "mean_token_accuracy": 0.8528942912817001, "num_tokens": 702461274.0, "step": 22010 }, { "entropy": 0.5880482322536409, "epoch": 2.025117739403454, "grad_norm": 0.16226473450660706, "learning_rate": 3.2499156622811056e-05, "loss": 0.5704, "mean_token_accuracy": 0.8224683254957199, "num_tokens": 702493673.0, "step": 22011 }, { "entropy": 0.5255766334012151, "epoch": 2.025209745774895, "grad_norm": 0.159864142537117, "learning_rate": 3.2496089796669424e-05, "loss": 0.5144, "mean_token_accuracy": 0.8365638963878155, "num_tokens": 702526210.0, "step": 22012 }, { "entropy": 0.499677000567317, "epoch": 2.025301752146336, "grad_norm": 0.15821723639965057, "learning_rate": 3.2493022970527805e-05, "loss": 0.4826, "mean_token_accuracy": 0.8467301651835442, "num_tokens": 702558224.0, "step": 22013 }, { "entropy": 0.5368503928184509, "epoch": 2.0253937585177773, "grad_norm": 0.16319520771503448, "learning_rate": 3.248995614438617e-05, "loss": 0.5306, "mean_token_accuracy": 0.830591581761837, "num_tokens": 702590342.0, "step": 22014 }, { "entropy": 0.5625534616410732, "epoch": 2.0254857648892184, "grad_norm": 0.169070765376091, "learning_rate": 3.248688931824455e-05, "loss": 0.5511, "mean_token_accuracy": 0.8257043957710266, "num_tokens": 702620958.0, "step": 22015 }, { "entropy": 0.47026585042476654, "epoch": 2.02557777126066, "grad_norm": 0.1561085283756256, "learning_rate": 3.248382249210292e-05, "loss": 0.4636, "mean_token_accuracy": 0.8474183715879917, "num_tokens": 702653311.0, "step": 22016 }, { "entropy": 0.507026681676507, "epoch": 2.025669777632101, "grad_norm": 0.15198597311973572, "learning_rate": 3.24807556659613e-05, "loss": 0.4981, "mean_token_accuracy": 0.8422052711248398, "num_tokens": 702685875.0, "step": 22017 }, { "entropy": 0.5144296227954328, "epoch": 2.0257617840035422, "grad_norm": 0.1582697033882141, "learning_rate": 3.247768883981967e-05, "loss": 0.508, "mean_token_accuracy": 0.8347934931516647, "num_tokens": 702718379.0, "step": 22018 }, { "entropy": 0.5237482679076493, "epoch": 2.0258537903749834, "grad_norm": 0.1578574925661087, "learning_rate": 3.2474622013678047e-05, "loss": 0.502, "mean_token_accuracy": 0.841435145586729, "num_tokens": 702751138.0, "step": 22019 }, { "entropy": 0.5513110971078277, "epoch": 2.0259457967464245, "grad_norm": 0.1692739725112915, "learning_rate": 3.2471555187536414e-05, "loss": 0.539, "mean_token_accuracy": 0.8301381729543209, "num_tokens": 702783115.0, "step": 22020 }, { "entropy": 0.5395059511065483, "epoch": 2.026037803117866, "grad_norm": 0.16456401348114014, "learning_rate": 3.2468488361394796e-05, "loss": 0.5248, "mean_token_accuracy": 0.8346368409693241, "num_tokens": 702814856.0, "step": 22021 }, { "entropy": 0.5362414829432964, "epoch": 2.026129809489307, "grad_norm": 0.16146332025527954, "learning_rate": 3.2465421535253164e-05, "loss": 0.5157, "mean_token_accuracy": 0.8365998305380344, "num_tokens": 702847336.0, "step": 22022 }, { "entropy": 0.5792262498289347, "epoch": 2.0262218158607483, "grad_norm": 0.1692376583814621, "learning_rate": 3.2462354709111545e-05, "loss": 0.5692, "mean_token_accuracy": 0.8219232857227325, "num_tokens": 702879101.0, "step": 22023 }, { "entropy": 0.49713869765400887, "epoch": 2.0263138222321895, "grad_norm": 0.15371713042259216, "learning_rate": 3.245928788296992e-05, "loss": 0.4797, "mean_token_accuracy": 0.8451791629195213, "num_tokens": 702911147.0, "step": 22024 }, { "entropy": 0.5527558871544898, "epoch": 2.0264058286036306, "grad_norm": 0.16027826070785522, "learning_rate": 3.245622105682829e-05, "loss": 0.5295, "mean_token_accuracy": 0.8339207135140896, "num_tokens": 702942890.0, "step": 22025 }, { "entropy": 0.5151871903799474, "epoch": 2.026497834975072, "grad_norm": 0.1620984971523285, "learning_rate": 3.245315423068667e-05, "loss": 0.5027, "mean_token_accuracy": 0.8408127054572105, "num_tokens": 702975156.0, "step": 22026 }, { "entropy": 0.5075470288284123, "epoch": 2.0265898413465133, "grad_norm": 0.15459664165973663, "learning_rate": 3.245008740454504e-05, "loss": 0.4734, "mean_token_accuracy": 0.8503748401999474, "num_tokens": 703007091.0, "step": 22027 }, { "entropy": 0.4494113167747855, "epoch": 2.0266818477179545, "grad_norm": 0.14935345947742462, "learning_rate": 3.244702057840341e-05, "loss": 0.4293, "mean_token_accuracy": 0.8589430190622807, "num_tokens": 703038841.0, "step": 22028 }, { "entropy": 0.6244312934577465, "epoch": 2.0267738540893956, "grad_norm": 0.1659003496170044, "learning_rate": 3.2443953752261786e-05, "loss": 0.6124, "mean_token_accuracy": 0.8090309165418148, "num_tokens": 703070931.0, "step": 22029 }, { "entropy": 0.4640434496104717, "epoch": 2.0268658604608367, "grad_norm": 0.15956364572048187, "learning_rate": 3.244088692612016e-05, "loss": 0.4484, "mean_token_accuracy": 0.8597678951919079, "num_tokens": 703102441.0, "step": 22030 }, { "entropy": 0.4477474233135581, "epoch": 2.0269578668322783, "grad_norm": 0.14844171702861786, "learning_rate": 3.2437820099978536e-05, "loss": 0.4128, "mean_token_accuracy": 0.8628518022596836, "num_tokens": 703133305.0, "step": 22031 }, { "entropy": 0.5020966343581676, "epoch": 2.0270498732037194, "grad_norm": 0.16364829242229462, "learning_rate": 3.243475327383691e-05, "loss": 0.4834, "mean_token_accuracy": 0.8440631069242954, "num_tokens": 703164628.0, "step": 22032 }, { "entropy": 0.43556978600099683, "epoch": 2.0271418795751606, "grad_norm": 0.14855855703353882, "learning_rate": 3.243168644769528e-05, "loss": 0.4172, "mean_token_accuracy": 0.8698387891054153, "num_tokens": 703196514.0, "step": 22033 }, { "entropy": 0.6213747775182128, "epoch": 2.0272338859466017, "grad_norm": 0.17315585911273956, "learning_rate": 3.242861962155366e-05, "loss": 0.6128, "mean_token_accuracy": 0.8112050890922546, "num_tokens": 703228418.0, "step": 22034 }, { "entropy": 0.5266063800081611, "epoch": 2.027325892318043, "grad_norm": 0.15834809839725494, "learning_rate": 3.242555279541203e-05, "loss": 0.5049, "mean_token_accuracy": 0.8402326330542564, "num_tokens": 703260020.0, "step": 22035 }, { "entropy": 0.5194541085511446, "epoch": 2.0274178986894844, "grad_norm": 0.15743786096572876, "learning_rate": 3.24224859692704e-05, "loss": 0.4903, "mean_token_accuracy": 0.8456260226666927, "num_tokens": 703292395.0, "step": 22036 }, { "entropy": 0.4846963668242097, "epoch": 2.0275099050609255, "grad_norm": 0.15997208654880524, "learning_rate": 3.241941914312878e-05, "loss": 0.4764, "mean_token_accuracy": 0.8464978076517582, "num_tokens": 703323515.0, "step": 22037 }, { "entropy": 0.5062412898987532, "epoch": 2.0276019114323667, "grad_norm": 0.1636219024658203, "learning_rate": 3.241635231698715e-05, "loss": 0.5089, "mean_token_accuracy": 0.8409523367881775, "num_tokens": 703355459.0, "step": 22038 }, { "entropy": 0.6303065177053213, "epoch": 2.027693917803808, "grad_norm": 0.1712161749601364, "learning_rate": 3.2413285490845526e-05, "loss": 0.6141, "mean_token_accuracy": 0.8034769631922245, "num_tokens": 703387201.0, "step": 22039 }, { "entropy": 0.5411776416003704, "epoch": 2.027785924175249, "grad_norm": 0.1707560271024704, "learning_rate": 3.24102186647039e-05, "loss": 0.5382, "mean_token_accuracy": 0.82597865909338, "num_tokens": 703418725.0, "step": 22040 }, { "entropy": 0.6043683364987373, "epoch": 2.0278779305466905, "grad_norm": 0.16711312532424927, "learning_rate": 3.2407151838562275e-05, "loss": 0.5914, "mean_token_accuracy": 0.8102822601795197, "num_tokens": 703451173.0, "step": 22041 }, { "entropy": 0.44118691701442003, "epoch": 2.0279699369181317, "grad_norm": 0.14614826440811157, "learning_rate": 3.240408501242065e-05, "loss": 0.4179, "mean_token_accuracy": 0.8660100139677525, "num_tokens": 703483215.0, "step": 22042 }, { "entropy": 0.5965199153870344, "epoch": 2.028061943289573, "grad_norm": 0.17428718507289886, "learning_rate": 3.240101818627902e-05, "loss": 0.5863, "mean_token_accuracy": 0.8140998743474483, "num_tokens": 703513626.0, "step": 22043 }, { "entropy": 0.5077769691124558, "epoch": 2.028153949661014, "grad_norm": 0.16407297551631927, "learning_rate": 3.23979513601374e-05, "loss": 0.4925, "mean_token_accuracy": 0.8430775217711926, "num_tokens": 703545167.0, "step": 22044 }, { "entropy": 0.5050848741084337, "epoch": 2.028245956032455, "grad_norm": 0.1622973382472992, "learning_rate": 3.239488453399577e-05, "loss": 0.4927, "mean_token_accuracy": 0.8405608013272285, "num_tokens": 703576685.0, "step": 22045 }, { "entropy": 0.5638315537944436, "epoch": 2.0283379624038966, "grad_norm": 0.1673995703458786, "learning_rate": 3.239181770785414e-05, "loss": 0.538, "mean_token_accuracy": 0.8308652080595493, "num_tokens": 703607995.0, "step": 22046 }, { "entropy": 0.46580384485423565, "epoch": 2.0284299687753378, "grad_norm": 0.154900461435318, "learning_rate": 3.2388750881712516e-05, "loss": 0.4504, "mean_token_accuracy": 0.8570082746446133, "num_tokens": 703639426.0, "step": 22047 }, { "entropy": 0.5760490605607629, "epoch": 2.028521975146779, "grad_norm": 0.16251355409622192, "learning_rate": 3.238568405557089e-05, "loss": 0.5605, "mean_token_accuracy": 0.8225262388586998, "num_tokens": 703671143.0, "step": 22048 }, { "entropy": 0.44086504355072975, "epoch": 2.02861398151822, "grad_norm": 0.1418934017419815, "learning_rate": 3.2382617229429266e-05, "loss": 0.4227, "mean_token_accuracy": 0.8658895529806614, "num_tokens": 703703579.0, "step": 22049 }, { "entropy": 0.4436280746012926, "epoch": 2.028705987889661, "grad_norm": 0.14546416699886322, "learning_rate": 3.237955040328764e-05, "loss": 0.4238, "mean_token_accuracy": 0.8618060685694218, "num_tokens": 703736188.0, "step": 22050 }, { "entropy": 0.5651517538353801, "epoch": 2.0287979942611027, "grad_norm": 0.16295911371707916, "learning_rate": 3.237648357714601e-05, "loss": 0.5403, "mean_token_accuracy": 0.829198744148016, "num_tokens": 703767911.0, "step": 22051 }, { "entropy": 0.5158468475565314, "epoch": 2.028890000632544, "grad_norm": 0.15849843621253967, "learning_rate": 3.237341675100439e-05, "loss": 0.4907, "mean_token_accuracy": 0.8425956554710865, "num_tokens": 703799396.0, "step": 22052 }, { "entropy": 0.42263993062078953, "epoch": 2.028982007003985, "grad_norm": 0.14479000866413116, "learning_rate": 3.237034992486276e-05, "loss": 0.3987, "mean_token_accuracy": 0.8739247098565102, "num_tokens": 703830923.0, "step": 22053 }, { "entropy": 0.5561156710609794, "epoch": 2.029074013375426, "grad_norm": 0.16634060442447662, "learning_rate": 3.236728309872113e-05, "loss": 0.5388, "mean_token_accuracy": 0.8288820274174213, "num_tokens": 703861850.0, "step": 22054 }, { "entropy": 0.47402170300483704, "epoch": 2.0291660197468673, "grad_norm": 0.15619467198848724, "learning_rate": 3.2364216272579513e-05, "loss": 0.4568, "mean_token_accuracy": 0.8522373512387276, "num_tokens": 703893959.0, "step": 22055 }, { "entropy": 0.5360939605161548, "epoch": 2.029258026118309, "grad_norm": 0.16113710403442383, "learning_rate": 3.236114944643788e-05, "loss": 0.5112, "mean_token_accuracy": 0.8413666486740112, "num_tokens": 703925340.0, "step": 22056 }, { "entropy": 0.5237952722236514, "epoch": 2.02935003248975, "grad_norm": 0.15716148912906647, "learning_rate": 3.235808262029626e-05, "loss": 0.5, "mean_token_accuracy": 0.8446027263998985, "num_tokens": 703956828.0, "step": 22057 }, { "entropy": 0.48900532349944115, "epoch": 2.029442038861191, "grad_norm": 0.15453606843948364, "learning_rate": 3.235501579415463e-05, "loss": 0.4683, "mean_token_accuracy": 0.8496895618736744, "num_tokens": 703989169.0, "step": 22058 }, { "entropy": 0.5459619294852018, "epoch": 2.0295340452326323, "grad_norm": 0.16171030700206757, "learning_rate": 3.2351948968013005e-05, "loss": 0.534, "mean_token_accuracy": 0.8297032304108143, "num_tokens": 704020734.0, "step": 22059 }, { "entropy": 0.5599976144731045, "epoch": 2.0296260516040734, "grad_norm": 0.1674814373254776, "learning_rate": 3.234888214187138e-05, "loss": 0.5539, "mean_token_accuracy": 0.8248513825237751, "num_tokens": 704052145.0, "step": 22060 }, { "entropy": 0.4790110820904374, "epoch": 2.029718057975515, "grad_norm": 0.16075019538402557, "learning_rate": 3.2345815315729755e-05, "loss": 0.4667, "mean_token_accuracy": 0.8541739732027054, "num_tokens": 704084449.0, "step": 22061 }, { "entropy": 0.5694238413125277, "epoch": 2.029810064346956, "grad_norm": 0.1690646857023239, "learning_rate": 3.234274848958813e-05, "loss": 0.5595, "mean_token_accuracy": 0.8208187073469162, "num_tokens": 704116046.0, "step": 22062 }, { "entropy": 0.43473338335752487, "epoch": 2.0299020707183972, "grad_norm": 0.14139512181282043, "learning_rate": 3.2339681663446504e-05, "loss": 0.4189, "mean_token_accuracy": 0.8670500852167606, "num_tokens": 704148370.0, "step": 22063 }, { "entropy": 0.5657348148524761, "epoch": 2.0299940770898384, "grad_norm": 0.16405728459358215, "learning_rate": 3.233661483730487e-05, "loss": 0.5444, "mean_token_accuracy": 0.8281078673899174, "num_tokens": 704180472.0, "step": 22064 }, { "entropy": 0.45036303414963186, "epoch": 2.0300860834612795, "grad_norm": 0.14755132794380188, "learning_rate": 3.233354801116325e-05, "loss": 0.4358, "mean_token_accuracy": 0.8618712052702904, "num_tokens": 704212332.0, "step": 22065 }, { "entropy": 0.5319523978978395, "epoch": 2.030178089832721, "grad_norm": 0.16560307145118713, "learning_rate": 3.233048118502162e-05, "loss": 0.5086, "mean_token_accuracy": 0.8352485299110413, "num_tokens": 704243777.0, "step": 22066 }, { "entropy": 0.566919295117259, "epoch": 2.030270096204162, "grad_norm": 0.16792082786560059, "learning_rate": 3.2327414358879996e-05, "loss": 0.5466, "mean_token_accuracy": 0.8303654156625271, "num_tokens": 704275519.0, "step": 22067 }, { "entropy": 0.48065097630023956, "epoch": 2.0303621025756033, "grad_norm": 0.16037611663341522, "learning_rate": 3.232434753273837e-05, "loss": 0.4687, "mean_token_accuracy": 0.8498300835490227, "num_tokens": 704307414.0, "step": 22068 }, { "entropy": 0.5184540636837482, "epoch": 2.0304541089470445, "grad_norm": 0.16017234325408936, "learning_rate": 3.2321280706596745e-05, "loss": 0.5014, "mean_token_accuracy": 0.8407026380300522, "num_tokens": 704338779.0, "step": 22069 }, { "entropy": 0.5068904724903405, "epoch": 2.0305461153184856, "grad_norm": 0.1603797823190689, "learning_rate": 3.231821388045512e-05, "loss": 0.4924, "mean_token_accuracy": 0.8433790281414986, "num_tokens": 704370763.0, "step": 22070 }, { "entropy": 0.543709859251976, "epoch": 2.030638121689927, "grad_norm": 0.15557587146759033, "learning_rate": 3.2315147054313494e-05, "loss": 0.5167, "mean_token_accuracy": 0.8368074484169483, "num_tokens": 704403148.0, "step": 22071 }, { "entropy": 0.6128828469663858, "epoch": 2.0307301280613683, "grad_norm": 0.17078566551208496, "learning_rate": 3.231208022817186e-05, "loss": 0.6093, "mean_token_accuracy": 0.8102190047502518, "num_tokens": 704434678.0, "step": 22072 }, { "entropy": 0.4866829104721546, "epoch": 2.0308221344328095, "grad_norm": 0.15078432857990265, "learning_rate": 3.2309013402030244e-05, "loss": 0.4651, "mean_token_accuracy": 0.8534174785017967, "num_tokens": 704466914.0, "step": 22073 }, { "entropy": 0.4502102294936776, "epoch": 2.0309141408042506, "grad_norm": 0.15309010446071625, "learning_rate": 3.230594657588861e-05, "loss": 0.4415, "mean_token_accuracy": 0.8572622239589691, "num_tokens": 704498879.0, "step": 22074 }, { "entropy": 0.46333723969291896, "epoch": 2.0310061471756917, "grad_norm": 0.15026924014091492, "learning_rate": 3.2302879749746986e-05, "loss": 0.4485, "mean_token_accuracy": 0.8584891892969608, "num_tokens": 704531283.0, "step": 22075 }, { "entropy": 0.44108018558472395, "epoch": 2.0310981535471333, "grad_norm": 0.1467704325914383, "learning_rate": 3.229981292360536e-05, "loss": 0.417, "mean_token_accuracy": 0.8656436130404472, "num_tokens": 704563716.0, "step": 22076 }, { "entropy": 0.5178970387205482, "epoch": 2.0311901599185744, "grad_norm": 0.16240434348583221, "learning_rate": 3.2296746097463735e-05, "loss": 0.4971, "mean_token_accuracy": 0.8406716249883175, "num_tokens": 704596023.0, "step": 22077 }, { "entropy": 0.40587834804318845, "epoch": 2.0312821662900156, "grad_norm": 0.1459009349346161, "learning_rate": 3.229367927132211e-05, "loss": 0.3847, "mean_token_accuracy": 0.8755914978682995, "num_tokens": 704628169.0, "step": 22078 }, { "entropy": 0.5034570274874568, "epoch": 2.0313741726614567, "grad_norm": 0.16243329644203186, "learning_rate": 3.2290612445180485e-05, "loss": 0.4814, "mean_token_accuracy": 0.8456258997321129, "num_tokens": 704659488.0, "step": 22079 }, { "entropy": 0.49809200852178037, "epoch": 2.031466179032898, "grad_norm": 0.15888778865337372, "learning_rate": 3.228754561903885e-05, "loss": 0.4828, "mean_token_accuracy": 0.8466382212936878, "num_tokens": 704691197.0, "step": 22080 }, { "entropy": 0.47455921955406666, "epoch": 2.0315581854043394, "grad_norm": 0.16561776399612427, "learning_rate": 3.2284478792897234e-05, "loss": 0.4606, "mean_token_accuracy": 0.8532640226185322, "num_tokens": 704722148.0, "step": 22081 }, { "entropy": 0.5329192047938704, "epoch": 2.0316501917757805, "grad_norm": 0.1623637080192566, "learning_rate": 3.22814119667556e-05, "loss": 0.508, "mean_token_accuracy": 0.8402612954378128, "num_tokens": 704753618.0, "step": 22082 }, { "entropy": 0.5759749570861459, "epoch": 2.0317421981472217, "grad_norm": 0.164170503616333, "learning_rate": 3.227834514061398e-05, "loss": 0.5587, "mean_token_accuracy": 0.8238427340984344, "num_tokens": 704785979.0, "step": 22083 }, { "entropy": 0.6201305538415909, "epoch": 2.031834204518663, "grad_norm": 0.16908138990402222, "learning_rate": 3.227527831447235e-05, "loss": 0.6087, "mean_token_accuracy": 0.809641145169735, "num_tokens": 704818217.0, "step": 22084 }, { "entropy": 0.5219004340469837, "epoch": 2.031926210890104, "grad_norm": 0.15956838428974152, "learning_rate": 3.2272211488330726e-05, "loss": 0.516, "mean_token_accuracy": 0.8379022143781185, "num_tokens": 704849845.0, "step": 22085 }, { "entropy": 0.5154461031779647, "epoch": 2.0320182172615455, "grad_norm": 0.16187700629234314, "learning_rate": 3.226914466218911e-05, "loss": 0.5083, "mean_token_accuracy": 0.8384222015738487, "num_tokens": 704881769.0, "step": 22086 }, { "entropy": 0.6430290825664997, "epoch": 2.0321102236329867, "grad_norm": 0.17813676595687866, "learning_rate": 3.2266077836047475e-05, "loss": 0.6437, "mean_token_accuracy": 0.8011419400572777, "num_tokens": 704913860.0, "step": 22087 }, { "entropy": 0.4888028968125582, "epoch": 2.032202230004428, "grad_norm": 0.15977774560451508, "learning_rate": 3.226301100990585e-05, "loss": 0.4805, "mean_token_accuracy": 0.8457198962569237, "num_tokens": 704944998.0, "step": 22088 }, { "entropy": 0.5570105155929923, "epoch": 2.032294236375869, "grad_norm": 0.1638607531785965, "learning_rate": 3.2259944183764224e-05, "loss": 0.5475, "mean_token_accuracy": 0.8310661241412163, "num_tokens": 704976860.0, "step": 22089 }, { "entropy": 0.5839614812284708, "epoch": 2.03238624274731, "grad_norm": 0.16121870279312134, "learning_rate": 3.22568773576226e-05, "loss": 0.5635, "mean_token_accuracy": 0.8240274526178837, "num_tokens": 705008889.0, "step": 22090 }, { "entropy": 0.5808981694281101, "epoch": 2.0324782491187516, "grad_norm": 0.16805803775787354, "learning_rate": 3.2253810531480974e-05, "loss": 0.5669, "mean_token_accuracy": 0.8215088620781898, "num_tokens": 705041017.0, "step": 22091 }, { "entropy": 0.6206187237985432, "epoch": 2.0325702554901928, "grad_norm": 0.17075183987617493, "learning_rate": 3.225074370533935e-05, "loss": 0.5981, "mean_token_accuracy": 0.8170602954924107, "num_tokens": 705072917.0, "step": 22092 }, { "entropy": 0.47157166339457035, "epoch": 2.032662261861634, "grad_norm": 0.15682323276996613, "learning_rate": 3.2247676879197716e-05, "loss": 0.4638, "mean_token_accuracy": 0.8510980047285557, "num_tokens": 705104437.0, "step": 22093 }, { "entropy": 0.4436232422012836, "epoch": 2.032754268233075, "grad_norm": 0.14062561094760895, "learning_rate": 3.22446100530561e-05, "loss": 0.4371, "mean_token_accuracy": 0.8608074449002743, "num_tokens": 705137095.0, "step": 22094 }, { "entropy": 0.5106499651446939, "epoch": 2.032846274604516, "grad_norm": 0.15905851125717163, "learning_rate": 3.2241543226914466e-05, "loss": 0.5, "mean_token_accuracy": 0.8404437899589539, "num_tokens": 705168506.0, "step": 22095 }, { "entropy": 0.5917447954416275, "epoch": 2.0329382809759577, "grad_norm": 0.1671927273273468, "learning_rate": 3.223847640077284e-05, "loss": 0.5769, "mean_token_accuracy": 0.8174739740788937, "num_tokens": 705199634.0, "step": 22096 }, { "entropy": 0.5071500167250633, "epoch": 2.033030287347399, "grad_norm": 0.16300466656684875, "learning_rate": 3.2235409574631215e-05, "loss": 0.4799, "mean_token_accuracy": 0.8433669395744801, "num_tokens": 705230445.0, "step": 22097 }, { "entropy": 0.542832164093852, "epoch": 2.03312229371884, "grad_norm": 0.16194400191307068, "learning_rate": 3.223234274848959e-05, "loss": 0.5196, "mean_token_accuracy": 0.8373375199735165, "num_tokens": 705262203.0, "step": 22098 }, { "entropy": 0.457228479674086, "epoch": 2.033214300090281, "grad_norm": 0.14982712268829346, "learning_rate": 3.2229275922347964e-05, "loss": 0.4402, "mean_token_accuracy": 0.8557300791144371, "num_tokens": 705293888.0, "step": 22099 }, { "entropy": 0.49612031131982803, "epoch": 2.0333063064617223, "grad_norm": 0.15630775690078735, "learning_rate": 3.222620909620634e-05, "loss": 0.4801, "mean_token_accuracy": 0.8508412912487984, "num_tokens": 705325070.0, "step": 22100 }, { "entropy": 0.5881086923182011, "epoch": 2.033398312833164, "grad_norm": 0.16614285111427307, "learning_rate": 3.2223142270064713e-05, "loss": 0.5621, "mean_token_accuracy": 0.8226639330387115, "num_tokens": 705356642.0, "step": 22101 }, { "entropy": 0.4277556552551687, "epoch": 2.033490319204605, "grad_norm": 0.15163718163967133, "learning_rate": 3.222007544392309e-05, "loss": 0.424, "mean_token_accuracy": 0.867221400141716, "num_tokens": 705387895.0, "step": 22102 }, { "entropy": 0.5648830607533455, "epoch": 2.033582325576046, "grad_norm": 0.16209359467029572, "learning_rate": 3.2217008617781456e-05, "loss": 0.5462, "mean_token_accuracy": 0.8278464041650295, "num_tokens": 705419831.0, "step": 22103 }, { "entropy": 0.498621073551476, "epoch": 2.0336743319474873, "grad_norm": 0.15689051151275635, "learning_rate": 3.221394179163984e-05, "loss": 0.4818, "mean_token_accuracy": 0.8497644700109959, "num_tokens": 705452227.0, "step": 22104 }, { "entropy": 0.5707465671002865, "epoch": 2.0337663383189284, "grad_norm": 0.15921595692634583, "learning_rate": 3.2210874965498205e-05, "loss": 0.5483, "mean_token_accuracy": 0.8285224065184593, "num_tokens": 705484601.0, "step": 22105 }, { "entropy": 0.5661639086902142, "epoch": 2.03385834469037, "grad_norm": 0.1647530049085617, "learning_rate": 3.220780813935658e-05, "loss": 0.554, "mean_token_accuracy": 0.8260684534907341, "num_tokens": 705516461.0, "step": 22106 }, { "entropy": 0.6335455141961575, "epoch": 2.033950351061811, "grad_norm": 0.16622702777385712, "learning_rate": 3.2204741313214955e-05, "loss": 0.6089, "mean_token_accuracy": 0.8105546273291111, "num_tokens": 705548143.0, "step": 22107 }, { "entropy": 0.5745503180660307, "epoch": 2.0340423574332522, "grad_norm": 0.1614062339067459, "learning_rate": 3.220167448707333e-05, "loss": 0.5568, "mean_token_accuracy": 0.8270040154457092, "num_tokens": 705580352.0, "step": 22108 }, { "entropy": 0.5447928495705128, "epoch": 2.0341343638046934, "grad_norm": 0.16386552155017853, "learning_rate": 3.2198607660931704e-05, "loss": 0.5243, "mean_token_accuracy": 0.8333318494260311, "num_tokens": 705612566.0, "step": 22109 }, { "entropy": 0.6790245492011309, "epoch": 2.0342263701761345, "grad_norm": 0.17660392820835114, "learning_rate": 3.219554083479008e-05, "loss": 0.6533, "mean_token_accuracy": 0.7964717634022236, "num_tokens": 705644021.0, "step": 22110 }, { "entropy": 0.48223420325666666, "epoch": 2.034318376547576, "grad_norm": 0.15663135051727295, "learning_rate": 3.2192474008648446e-05, "loss": 0.467, "mean_token_accuracy": 0.8533414974808693, "num_tokens": 705676747.0, "step": 22111 }, { "entropy": 0.5757378106936812, "epoch": 2.034410382919017, "grad_norm": 0.1617913693189621, "learning_rate": 3.218940718250683e-05, "loss": 0.5602, "mean_token_accuracy": 0.8268785588443279, "num_tokens": 705709156.0, "step": 22112 }, { "entropy": 0.49230913165956736, "epoch": 2.0345023892904583, "grad_norm": 0.16047754883766174, "learning_rate": 3.2186340356365196e-05, "loss": 0.4731, "mean_token_accuracy": 0.8486907072365284, "num_tokens": 705740202.0, "step": 22113 }, { "entropy": 0.5216591190546751, "epoch": 2.0345943956618995, "grad_norm": 0.15690891444683075, "learning_rate": 3.218327353022357e-05, "loss": 0.503, "mean_token_accuracy": 0.8390974253416061, "num_tokens": 705772072.0, "step": 22114 }, { "entropy": 0.5170350968837738, "epoch": 2.0346864020333406, "grad_norm": 0.1504867821931839, "learning_rate": 3.2180206704081945e-05, "loss": 0.497, "mean_token_accuracy": 0.840747743844986, "num_tokens": 705804271.0, "step": 22115 }, { "entropy": 0.6251952666789293, "epoch": 2.034778408404782, "grad_norm": 0.17081445455551147, "learning_rate": 3.217713987794032e-05, "loss": 0.619, "mean_token_accuracy": 0.8055742606520653, "num_tokens": 705836607.0, "step": 22116 }, { "entropy": 0.5340581983327866, "epoch": 2.0348704147762233, "grad_norm": 0.16196505725383759, "learning_rate": 3.21740730517987e-05, "loss": 0.5208, "mean_token_accuracy": 0.8385929241776466, "num_tokens": 705868427.0, "step": 22117 }, { "entropy": 0.48539130855351686, "epoch": 2.0349624211476645, "grad_norm": 0.15457932651042938, "learning_rate": 3.217100622565707e-05, "loss": 0.4819, "mean_token_accuracy": 0.8489863127470016, "num_tokens": 705901195.0, "step": 22118 }, { "entropy": 0.5440027583390474, "epoch": 2.0350544275191056, "grad_norm": 0.16129538416862488, "learning_rate": 3.2167939399515444e-05, "loss": 0.5268, "mean_token_accuracy": 0.8334593437612057, "num_tokens": 705933449.0, "step": 22119 }, { "entropy": 0.4775239937007427, "epoch": 2.0351464338905467, "grad_norm": 0.15360093116760254, "learning_rate": 3.216487257337382e-05, "loss": 0.447, "mean_token_accuracy": 0.851346917450428, "num_tokens": 705964355.0, "step": 22120 }, { "entropy": 0.5890714288689196, "epoch": 2.0352384402619883, "grad_norm": 0.17024366557598114, "learning_rate": 3.216180574723219e-05, "loss": 0.5726, "mean_token_accuracy": 0.8173647858202457, "num_tokens": 705996335.0, "step": 22121 }, { "entropy": 0.5229213191196322, "epoch": 2.0353304466334294, "grad_norm": 0.16546796262264252, "learning_rate": 3.215873892109057e-05, "loss": 0.5048, "mean_token_accuracy": 0.8392862416803837, "num_tokens": 706028339.0, "step": 22122 }, { "entropy": 0.5064074425026774, "epoch": 2.0354224530048706, "grad_norm": 0.15765008330345154, "learning_rate": 3.215567209494894e-05, "loss": 0.4882, "mean_token_accuracy": 0.844114113599062, "num_tokens": 706060119.0, "step": 22123 }, { "entropy": 0.5334240915253758, "epoch": 2.0355144593763117, "grad_norm": 0.16224811971187592, "learning_rate": 3.215260526880731e-05, "loss": 0.5374, "mean_token_accuracy": 0.8301789462566376, "num_tokens": 706091661.0, "step": 22124 }, { "entropy": 0.453858049120754, "epoch": 2.035606465747753, "grad_norm": 0.15337303280830383, "learning_rate": 3.214953844266569e-05, "loss": 0.4291, "mean_token_accuracy": 0.8665644787251949, "num_tokens": 706122561.0, "step": 22125 }, { "entropy": 0.531898039393127, "epoch": 2.0356984721191944, "grad_norm": 0.16199366748332977, "learning_rate": 3.214647161652406e-05, "loss": 0.5281, "mean_token_accuracy": 0.8367622680962086, "num_tokens": 706154143.0, "step": 22126 }, { "entropy": 0.5168326948769391, "epoch": 2.0357904784906355, "grad_norm": 0.15451842546463013, "learning_rate": 3.2143404790382434e-05, "loss": 0.5079, "mean_token_accuracy": 0.8406234048306942, "num_tokens": 706186562.0, "step": 22127 }, { "entropy": 0.5284803602844477, "epoch": 2.0358824848620767, "grad_norm": 0.16293196380138397, "learning_rate": 3.214033796424081e-05, "loss": 0.5111, "mean_token_accuracy": 0.8389191068708897, "num_tokens": 706218439.0, "step": 22128 }, { "entropy": 0.5732646386604756, "epoch": 2.035974491233518, "grad_norm": 0.16725367307662964, "learning_rate": 3.213727113809918e-05, "loss": 0.5584, "mean_token_accuracy": 0.8274198584258556, "num_tokens": 706250719.0, "step": 22129 }, { "entropy": 0.4831363223493099, "epoch": 2.036066497604959, "grad_norm": 0.16012731194496155, "learning_rate": 3.213420431195756e-05, "loss": 0.4731, "mean_token_accuracy": 0.8498907648026943, "num_tokens": 706282413.0, "step": 22130 }, { "entropy": 0.47237844951450825, "epoch": 2.0361585039764005, "grad_norm": 0.15677420794963837, "learning_rate": 3.213113748581593e-05, "loss": 0.4418, "mean_token_accuracy": 0.8524912856519222, "num_tokens": 706314330.0, "step": 22131 }, { "entropy": 0.4549933895468712, "epoch": 2.0362505103478417, "grad_norm": 0.15296770632266998, "learning_rate": 3.21280706596743e-05, "loss": 0.4418, "mean_token_accuracy": 0.8620594330132008, "num_tokens": 706346602.0, "step": 22132 }, { "entropy": 0.5018701832741499, "epoch": 2.036342516719283, "grad_norm": 0.1614002138376236, "learning_rate": 3.212500383353268e-05, "loss": 0.4877, "mean_token_accuracy": 0.8449745997786522, "num_tokens": 706378009.0, "step": 22133 }, { "entropy": 0.5423955302685499, "epoch": 2.036434523090724, "grad_norm": 0.17176416516304016, "learning_rate": 3.212193700739105e-05, "loss": 0.5247, "mean_token_accuracy": 0.8304418586194515, "num_tokens": 706408125.0, "step": 22134 }, { "entropy": 0.5070161232724786, "epoch": 2.036526529462165, "grad_norm": 0.16392935812473297, "learning_rate": 3.2118870181249424e-05, "loss": 0.4933, "mean_token_accuracy": 0.8372266441583633, "num_tokens": 706440119.0, "step": 22135 }, { "entropy": 0.4755680151283741, "epoch": 2.0366185358336066, "grad_norm": 0.15584000945091248, "learning_rate": 3.21158033551078e-05, "loss": 0.466, "mean_token_accuracy": 0.8515702933073044, "num_tokens": 706472245.0, "step": 22136 }, { "entropy": 0.6204019449651241, "epoch": 2.0367105422050478, "grad_norm": 0.16880109906196594, "learning_rate": 3.2112736528966174e-05, "loss": 0.6084, "mean_token_accuracy": 0.8091697134077549, "num_tokens": 706504324.0, "step": 22137 }, { "entropy": 0.4995537819340825, "epoch": 2.036802548576489, "grad_norm": 0.15788136422634125, "learning_rate": 3.210966970282455e-05, "loss": 0.4831, "mean_token_accuracy": 0.8455257974565029, "num_tokens": 706536136.0, "step": 22138 }, { "entropy": 0.49242488108575344, "epoch": 2.03689455494793, "grad_norm": 0.1557427942752838, "learning_rate": 3.210660287668292e-05, "loss": 0.4757, "mean_token_accuracy": 0.8480879031121731, "num_tokens": 706567711.0, "step": 22139 }, { "entropy": 0.543588362634182, "epoch": 2.036986561319371, "grad_norm": 0.1629531979560852, "learning_rate": 3.210353605054129e-05, "loss": 0.5319, "mean_token_accuracy": 0.8334037363529205, "num_tokens": 706599778.0, "step": 22140 }, { "entropy": 0.44524615863338113, "epoch": 2.0370785676908127, "grad_norm": 0.15363869071006775, "learning_rate": 3.210046922439967e-05, "loss": 0.4325, "mean_token_accuracy": 0.8641257584095001, "num_tokens": 706631690.0, "step": 22141 }, { "entropy": 0.4695296948775649, "epoch": 2.037170574062254, "grad_norm": 0.15121494233608246, "learning_rate": 3.209740239825804e-05, "loss": 0.4564, "mean_token_accuracy": 0.8546473830938339, "num_tokens": 706663536.0, "step": 22142 }, { "entropy": 0.556075875647366, "epoch": 2.037262580433695, "grad_norm": 0.16292908787727356, "learning_rate": 3.209433557211642e-05, "loss": 0.5456, "mean_token_accuracy": 0.8262713626027107, "num_tokens": 706696058.0, "step": 22143 }, { "entropy": 0.589357363525778, "epoch": 2.037354586805136, "grad_norm": 0.16523903608322144, "learning_rate": 3.209126874597479e-05, "loss": 0.5838, "mean_token_accuracy": 0.8168237693607807, "num_tokens": 706727945.0, "step": 22144 }, { "entropy": 0.6282406598329544, "epoch": 2.0374465931765773, "grad_norm": 0.16767437756061554, "learning_rate": 3.2088201919833164e-05, "loss": 0.6121, "mean_token_accuracy": 0.8077214173972607, "num_tokens": 706760643.0, "step": 22145 }, { "entropy": 0.5101437941193581, "epoch": 2.037538599548019, "grad_norm": 0.16206534206867218, "learning_rate": 3.2085135093691545e-05, "loss": 0.4848, "mean_token_accuracy": 0.8437574282288551, "num_tokens": 706792735.0, "step": 22146 }, { "entropy": 0.44808442145586014, "epoch": 2.03763060591946, "grad_norm": 0.14515787363052368, "learning_rate": 3.208206826754991e-05, "loss": 0.426, "mean_token_accuracy": 0.8608957342803478, "num_tokens": 706824149.0, "step": 22147 }, { "entropy": 0.5488352628890425, "epoch": 2.037722612290901, "grad_norm": 0.1608985811471939, "learning_rate": 3.207900144140829e-05, "loss": 0.536, "mean_token_accuracy": 0.8264982961118221, "num_tokens": 706855743.0, "step": 22148 }, { "entropy": 0.5430042995139956, "epoch": 2.0378146186623423, "grad_norm": 0.16526088118553162, "learning_rate": 3.207593461526666e-05, "loss": 0.5304, "mean_token_accuracy": 0.8329445756971836, "num_tokens": 706887053.0, "step": 22149 }, { "entropy": 0.480395830469206, "epoch": 2.0379066250337834, "grad_norm": 0.16098950803279877, "learning_rate": 3.207286778912504e-05, "loss": 0.4701, "mean_token_accuracy": 0.8498251289129257, "num_tokens": 706918124.0, "step": 22150 }, { "entropy": 0.4601527373306453, "epoch": 2.037998631405225, "grad_norm": 0.14815670251846313, "learning_rate": 3.206980096298341e-05, "loss": 0.4386, "mean_token_accuracy": 0.861958920955658, "num_tokens": 706950056.0, "step": 22151 }, { "entropy": 0.5825763950124383, "epoch": 2.038090637776666, "grad_norm": 0.1642276793718338, "learning_rate": 3.2066734136841787e-05, "loss": 0.5492, "mean_token_accuracy": 0.828833807259798, "num_tokens": 706981990.0, "step": 22152 }, { "entropy": 0.5256058052182198, "epoch": 2.0381826441481072, "grad_norm": 0.16185955703258514, "learning_rate": 3.2063667310700154e-05, "loss": 0.5127, "mean_token_accuracy": 0.8394837267696857, "num_tokens": 707013817.0, "step": 22153 }, { "entropy": 0.5053190473699942, "epoch": 2.0382746505195484, "grad_norm": 0.15581932663917542, "learning_rate": 3.2060600484558536e-05, "loss": 0.4767, "mean_token_accuracy": 0.8472164794802666, "num_tokens": 707045643.0, "step": 22154 }, { "entropy": 0.43845764081925154, "epoch": 2.0383666568909895, "grad_norm": 0.14814649522304535, "learning_rate": 3.2057533658416904e-05, "loss": 0.4171, "mean_token_accuracy": 0.8697951473295689, "num_tokens": 707077514.0, "step": 22155 }, { "entropy": 0.4921122081577778, "epoch": 2.038458663262431, "grad_norm": 0.15534210205078125, "learning_rate": 3.205446683227528e-05, "loss": 0.4709, "mean_token_accuracy": 0.8503806367516518, "num_tokens": 707108379.0, "step": 22156 }, { "entropy": 0.587845154106617, "epoch": 2.038550669633872, "grad_norm": 0.16798743605613708, "learning_rate": 3.205140000613365e-05, "loss": 0.5692, "mean_token_accuracy": 0.8201811350882053, "num_tokens": 707140442.0, "step": 22157 }, { "entropy": 0.4892706610262394, "epoch": 2.0386426760053133, "grad_norm": 0.15921266376972198, "learning_rate": 3.204833317999203e-05, "loss": 0.4758, "mean_token_accuracy": 0.8474405892193317, "num_tokens": 707172387.0, "step": 22158 }, { "entropy": 0.5381603129208088, "epoch": 2.0387346823767545, "grad_norm": 0.15882717072963715, "learning_rate": 3.20452663538504e-05, "loss": 0.5192, "mean_token_accuracy": 0.8391801826655865, "num_tokens": 707204860.0, "step": 22159 }, { "entropy": 0.5665100738406181, "epoch": 2.0388266887481956, "grad_norm": 0.16565977036952972, "learning_rate": 3.204219952770878e-05, "loss": 0.5484, "mean_token_accuracy": 0.8258659318089485, "num_tokens": 707236843.0, "step": 22160 }, { "entropy": 0.5063433796167374, "epoch": 2.038918695119637, "grad_norm": 0.15984958410263062, "learning_rate": 3.203913270156715e-05, "loss": 0.4993, "mean_token_accuracy": 0.8436550945043564, "num_tokens": 707269297.0, "step": 22161 }, { "entropy": 0.5282808467745781, "epoch": 2.0390107014910783, "grad_norm": 0.16357412934303284, "learning_rate": 3.2036065875425526e-05, "loss": 0.5197, "mean_token_accuracy": 0.8312512263655663, "num_tokens": 707301108.0, "step": 22162 }, { "entropy": 0.5217448845505714, "epoch": 2.0391027078625195, "grad_norm": 0.16391049325466156, "learning_rate": 3.2032999049283894e-05, "loss": 0.5166, "mean_token_accuracy": 0.8328217379748821, "num_tokens": 707333249.0, "step": 22163 }, { "entropy": 0.5731842741370201, "epoch": 2.0391947142339606, "grad_norm": 0.16632971167564392, "learning_rate": 3.2029932223142276e-05, "loss": 0.5411, "mean_token_accuracy": 0.8243963308632374, "num_tokens": 707364812.0, "step": 22164 }, { "entropy": 0.5635503018274903, "epoch": 2.0392867206054017, "grad_norm": 0.16201236844062805, "learning_rate": 3.2026865397000643e-05, "loss": 0.5549, "mean_token_accuracy": 0.825439278036356, "num_tokens": 707397340.0, "step": 22165 }, { "entropy": 0.43249684665352106, "epoch": 2.0393787269768433, "grad_norm": 0.15125539898872375, "learning_rate": 3.202379857085902e-05, "loss": 0.4151, "mean_token_accuracy": 0.8663834147155285, "num_tokens": 707429496.0, "step": 22166 }, { "entropy": 0.5809471067041159, "epoch": 2.0394707333482844, "grad_norm": 0.1636117547750473, "learning_rate": 3.202073174471739e-05, "loss": 0.5684, "mean_token_accuracy": 0.8165078945457935, "num_tokens": 707461973.0, "step": 22167 }, { "entropy": 0.5365654290653765, "epoch": 2.0395627397197256, "grad_norm": 0.16524562239646912, "learning_rate": 3.201766491857577e-05, "loss": 0.5253, "mean_token_accuracy": 0.8330828174948692, "num_tokens": 707493237.0, "step": 22168 }, { "entropy": 0.5280088586732745, "epoch": 2.0396547460911667, "grad_norm": 0.1574297398328781, "learning_rate": 3.201459809243414e-05, "loss": 0.5003, "mean_token_accuracy": 0.8424331322312355, "num_tokens": 707525475.0, "step": 22169 }, { "entropy": 0.5837240018881857, "epoch": 2.039746752462608, "grad_norm": 0.16718226671218872, "learning_rate": 3.201153126629252e-05, "loss": 0.5688, "mean_token_accuracy": 0.8219083547592163, "num_tokens": 707557032.0, "step": 22170 }, { "entropy": 0.6224393667653203, "epoch": 2.0398387588340494, "grad_norm": 0.1675873100757599, "learning_rate": 3.2008464440150885e-05, "loss": 0.6124, "mean_token_accuracy": 0.8089926429092884, "num_tokens": 707588944.0, "step": 22171 }, { "entropy": 0.538417843170464, "epoch": 2.0399307652054905, "grad_norm": 0.1658662110567093, "learning_rate": 3.2005397614009266e-05, "loss": 0.5273, "mean_token_accuracy": 0.8294005431234837, "num_tokens": 707620598.0, "step": 22172 }, { "entropy": 0.4485391518101096, "epoch": 2.0400227715769317, "grad_norm": 0.15084806084632874, "learning_rate": 3.2002330787867634e-05, "loss": 0.4286, "mean_token_accuracy": 0.8653685823082924, "num_tokens": 707652399.0, "step": 22173 }, { "entropy": 0.5664929216727614, "epoch": 2.040114777948373, "grad_norm": 0.16592544317245483, "learning_rate": 3.199926396172601e-05, "loss": 0.5463, "mean_token_accuracy": 0.8278035558760166, "num_tokens": 707684298.0, "step": 22174 }, { "entropy": 0.5631989203393459, "epoch": 2.040206784319814, "grad_norm": 0.1638406217098236, "learning_rate": 3.199619713558438e-05, "loss": 0.5539, "mean_token_accuracy": 0.8250185661017895, "num_tokens": 707716065.0, "step": 22175 }, { "entropy": 0.4485444901511073, "epoch": 2.0402987906912555, "grad_norm": 0.1499614268541336, "learning_rate": 3.199313030944276e-05, "loss": 0.4396, "mean_token_accuracy": 0.8574726991355419, "num_tokens": 707748544.0, "step": 22176 }, { "entropy": 0.5850379317998886, "epoch": 2.0403907970626967, "grad_norm": 0.16595551371574402, "learning_rate": 3.199006348330114e-05, "loss": 0.5752, "mean_token_accuracy": 0.8178225867450237, "num_tokens": 707780714.0, "step": 22177 }, { "entropy": 0.5627095457166433, "epoch": 2.040482803434138, "grad_norm": 0.15847739577293396, "learning_rate": 3.198699665715951e-05, "loss": 0.5403, "mean_token_accuracy": 0.8310899585485458, "num_tokens": 707812843.0, "step": 22178 }, { "entropy": 0.5563127901405096, "epoch": 2.040574809805579, "grad_norm": 0.16180691123008728, "learning_rate": 3.198392983101788e-05, "loss": 0.5259, "mean_token_accuracy": 0.8319970928132534, "num_tokens": 707844481.0, "step": 22179 }, { "entropy": 0.5721140224486589, "epoch": 2.04066681617702, "grad_norm": 0.16682536900043488, "learning_rate": 3.1980863004876256e-05, "loss": 0.5472, "mean_token_accuracy": 0.8249685056507587, "num_tokens": 707876224.0, "step": 22180 }, { "entropy": 0.6103148432448506, "epoch": 2.0407588225484616, "grad_norm": 0.16552715003490448, "learning_rate": 3.197779617873463e-05, "loss": 0.5906, "mean_token_accuracy": 0.814331229776144, "num_tokens": 707908610.0, "step": 22181 }, { "entropy": 0.6012690095230937, "epoch": 2.0408508289199028, "grad_norm": 0.16591954231262207, "learning_rate": 3.1974729352593006e-05, "loss": 0.5853, "mean_token_accuracy": 0.8135493919253349, "num_tokens": 707940666.0, "step": 22182 }, { "entropy": 0.5090197641402483, "epoch": 2.040942835291344, "grad_norm": 0.15951049327850342, "learning_rate": 3.197166252645138e-05, "loss": 0.4816, "mean_token_accuracy": 0.8471256792545319, "num_tokens": 707972500.0, "step": 22183 }, { "entropy": 0.5115538910031319, "epoch": 2.041034841662785, "grad_norm": 0.1608581840991974, "learning_rate": 3.196859570030975e-05, "loss": 0.4786, "mean_token_accuracy": 0.8452767319977283, "num_tokens": 708002769.0, "step": 22184 }, { "entropy": 0.45862232707440853, "epoch": 2.041126848034226, "grad_norm": 0.15511326491832733, "learning_rate": 3.196552887416813e-05, "loss": 0.4449, "mean_token_accuracy": 0.8550747223198414, "num_tokens": 708034330.0, "step": 22185 }, { "entropy": 0.4885637201368809, "epoch": 2.0412188544056677, "grad_norm": 0.15452250838279724, "learning_rate": 3.19624620480265e-05, "loss": 0.4673, "mean_token_accuracy": 0.8505696542561054, "num_tokens": 708066296.0, "step": 22186 }, { "entropy": 0.54736462328583, "epoch": 2.041310860777109, "grad_norm": 0.16433101892471313, "learning_rate": 3.195939522188487e-05, "loss": 0.5274, "mean_token_accuracy": 0.8327346593141556, "num_tokens": 708097598.0, "step": 22187 }, { "entropy": 0.4921016830485314, "epoch": 2.04140286714855, "grad_norm": 0.16158674657344818, "learning_rate": 3.195632839574325e-05, "loss": 0.4697, "mean_token_accuracy": 0.8515445813536644, "num_tokens": 708129519.0, "step": 22188 }, { "entropy": 0.6243175733834505, "epoch": 2.041494873519991, "grad_norm": 0.17337678372859955, "learning_rate": 3.195326156960162e-05, "loss": 0.6076, "mean_token_accuracy": 0.8095897436141968, "num_tokens": 708161182.0, "step": 22189 }, { "entropy": 0.5552289607003331, "epoch": 2.0415868798914323, "grad_norm": 0.16595503687858582, "learning_rate": 3.1950194743459996e-05, "loss": 0.5378, "mean_token_accuracy": 0.8282041661441326, "num_tokens": 708192661.0, "step": 22190 }, { "entropy": 0.5124632064253092, "epoch": 2.041678886262874, "grad_norm": 0.16341054439544678, "learning_rate": 3.194712791731837e-05, "loss": 0.5005, "mean_token_accuracy": 0.841601449996233, "num_tokens": 708223887.0, "step": 22191 }, { "entropy": 0.4026493774726987, "epoch": 2.041770892634315, "grad_norm": 0.14780457317829132, "learning_rate": 3.194406109117674e-05, "loss": 0.3872, "mean_token_accuracy": 0.87605020403862, "num_tokens": 708256385.0, "step": 22192 }, { "entropy": 0.5048577445559204, "epoch": 2.041862899005756, "grad_norm": 0.16854970157146454, "learning_rate": 3.194099426503512e-05, "loss": 0.4861, "mean_token_accuracy": 0.8398290388286114, "num_tokens": 708287755.0, "step": 22193 }, { "entropy": 0.48911193665117025, "epoch": 2.0419549053771973, "grad_norm": 0.15258610248565674, "learning_rate": 3.193792743889349e-05, "loss": 0.4807, "mean_token_accuracy": 0.8471770770847797, "num_tokens": 708320101.0, "step": 22194 }, { "entropy": 0.5607772911898792, "epoch": 2.0420469117486384, "grad_norm": 0.15776793658733368, "learning_rate": 3.193486061275186e-05, "loss": 0.5423, "mean_token_accuracy": 0.8303309641778469, "num_tokens": 708352869.0, "step": 22195 }, { "entropy": 0.5388634819537401, "epoch": 2.04213891812008, "grad_norm": 0.16815996170043945, "learning_rate": 3.193179378661024e-05, "loss": 0.5303, "mean_token_accuracy": 0.8344650827348232, "num_tokens": 708383500.0, "step": 22196 }, { "entropy": 0.48870265763252974, "epoch": 2.042230924491521, "grad_norm": 0.1540353149175644, "learning_rate": 3.192872696046861e-05, "loss": 0.4608, "mean_token_accuracy": 0.8500804528594017, "num_tokens": 708415504.0, "step": 22197 }, { "entropy": 0.5261145066469908, "epoch": 2.0423229308629622, "grad_norm": 0.1624937653541565, "learning_rate": 3.1925660134326986e-05, "loss": 0.51, "mean_token_accuracy": 0.834819708019495, "num_tokens": 708447708.0, "step": 22198 }, { "entropy": 0.5502403993159533, "epoch": 2.0424149372344034, "grad_norm": 0.16149556636810303, "learning_rate": 3.192259330818536e-05, "loss": 0.538, "mean_token_accuracy": 0.832944069057703, "num_tokens": 708479512.0, "step": 22199 }, { "entropy": 0.4772357288748026, "epoch": 2.0425069436058445, "grad_norm": 0.1522989720106125, "learning_rate": 3.191952648204373e-05, "loss": 0.4545, "mean_token_accuracy": 0.8507708832621574, "num_tokens": 708510561.0, "step": 22200 }, { "entropy": 0.5876251310110092, "epoch": 2.042598949977286, "grad_norm": 0.1685734987258911, "learning_rate": 3.191645965590211e-05, "loss": 0.5821, "mean_token_accuracy": 0.8154572024941444, "num_tokens": 708541993.0, "step": 22201 }, { "entropy": 0.5328443329781294, "epoch": 2.042690956348727, "grad_norm": 0.16073426604270935, "learning_rate": 3.191339282976048e-05, "loss": 0.5134, "mean_token_accuracy": 0.8413706757128239, "num_tokens": 708573897.0, "step": 22202 }, { "entropy": 0.4387510959059, "epoch": 2.0427829627201683, "grad_norm": 0.15148837864398956, "learning_rate": 3.191032600361886e-05, "loss": 0.4279, "mean_token_accuracy": 0.8616329021751881, "num_tokens": 708606511.0, "step": 22203 }, { "entropy": 0.5877676913514733, "epoch": 2.0428749690916095, "grad_norm": 0.16806165874004364, "learning_rate": 3.190725917747723e-05, "loss": 0.5702, "mean_token_accuracy": 0.8196521773934364, "num_tokens": 708638801.0, "step": 22204 }, { "entropy": 0.5084701348096132, "epoch": 2.0429669754630506, "grad_norm": 0.16032859683036804, "learning_rate": 3.19041923513356e-05, "loss": 0.4944, "mean_token_accuracy": 0.8428276292979717, "num_tokens": 708671422.0, "step": 22205 }, { "entropy": 0.4833346717059612, "epoch": 2.043058981834492, "grad_norm": 0.15819990634918213, "learning_rate": 3.190112552519398e-05, "loss": 0.4652, "mean_token_accuracy": 0.8513051718473434, "num_tokens": 708702593.0, "step": 22206 }, { "entropy": 0.5286937523633242, "epoch": 2.0431509882059333, "grad_norm": 0.16086506843566895, "learning_rate": 3.189805869905235e-05, "loss": 0.5188, "mean_token_accuracy": 0.8346605263650417, "num_tokens": 708734872.0, "step": 22207 }, { "entropy": 0.5474350107833743, "epoch": 2.0432429945773745, "grad_norm": 0.16610436141490936, "learning_rate": 3.1894991872910726e-05, "loss": 0.5301, "mean_token_accuracy": 0.8314799144864082, "num_tokens": 708766364.0, "step": 22208 }, { "entropy": 0.5185435054590926, "epoch": 2.0433350009488156, "grad_norm": 0.1590786576271057, "learning_rate": 3.18919250467691e-05, "loss": 0.5127, "mean_token_accuracy": 0.8398447223007679, "num_tokens": 708798712.0, "step": 22209 }, { "entropy": 0.4650513483211398, "epoch": 2.0434270073202567, "grad_norm": 0.15556694567203522, "learning_rate": 3.1888858220627475e-05, "loss": 0.461, "mean_token_accuracy": 0.8513540849089622, "num_tokens": 708830818.0, "step": 22210 }, { "entropy": 0.5666366219520569, "epoch": 2.0435190136916983, "grad_norm": 0.17013579607009888, "learning_rate": 3.188579139448585e-05, "loss": 0.5514, "mean_token_accuracy": 0.8244754076004028, "num_tokens": 708862295.0, "step": 22211 }, { "entropy": 0.5451010055840015, "epoch": 2.0436110200631394, "grad_norm": 0.1709476262331009, "learning_rate": 3.1882724568344225e-05, "loss": 0.5329, "mean_token_accuracy": 0.8287398852407932, "num_tokens": 708893263.0, "step": 22212 }, { "entropy": 0.4971720790490508, "epoch": 2.0437030264345806, "grad_norm": 0.15853410959243774, "learning_rate": 3.187965774220259e-05, "loss": 0.4839, "mean_token_accuracy": 0.8487725853919983, "num_tokens": 708926031.0, "step": 22213 }, { "entropy": 0.6194578632712364, "epoch": 2.0437950328060217, "grad_norm": 0.17468281090259552, "learning_rate": 3.1876590916060974e-05, "loss": 0.6189, "mean_token_accuracy": 0.8066319674253464, "num_tokens": 708958556.0, "step": 22214 }, { "entropy": 0.47709257528185844, "epoch": 2.043887039177463, "grad_norm": 0.15826216340065002, "learning_rate": 3.187352408991934e-05, "loss": 0.4647, "mean_token_accuracy": 0.8527910485863686, "num_tokens": 708990783.0, "step": 22215 }, { "entropy": 0.5374299006070942, "epoch": 2.0439790455489044, "grad_norm": 0.15609566867351532, "learning_rate": 3.1870457263777717e-05, "loss": 0.5167, "mean_token_accuracy": 0.8350120075047016, "num_tokens": 709022782.0, "step": 22216 }, { "entropy": 0.5873697753995657, "epoch": 2.0440710519203455, "grad_norm": 0.1697993278503418, "learning_rate": 3.186739043763609e-05, "loss": 0.5602, "mean_token_accuracy": 0.8191472813487053, "num_tokens": 709054161.0, "step": 22217 }, { "entropy": 0.46202646056190133, "epoch": 2.0441630582917867, "grad_norm": 0.1506252884864807, "learning_rate": 3.1864323611494466e-05, "loss": 0.4402, "mean_token_accuracy": 0.860959816724062, "num_tokens": 709086234.0, "step": 22218 }, { "entropy": 0.49504910968244076, "epoch": 2.044255064663228, "grad_norm": 0.14923806488513947, "learning_rate": 3.186125678535284e-05, "loss": 0.4779, "mean_token_accuracy": 0.8474649451673031, "num_tokens": 709118666.0, "step": 22219 }, { "entropy": 0.48453621100634336, "epoch": 2.044347071034669, "grad_norm": 0.1578630805015564, "learning_rate": 3.1858189959211215e-05, "loss": 0.4659, "mean_token_accuracy": 0.8477958142757416, "num_tokens": 709149731.0, "step": 22220 }, { "entropy": 0.5522200558334589, "epoch": 2.0444390774061105, "grad_norm": 0.16409263014793396, "learning_rate": 3.185512313306959e-05, "loss": 0.5306, "mean_token_accuracy": 0.8338982090353966, "num_tokens": 709181184.0, "step": 22221 }, { "entropy": 0.5531588066369295, "epoch": 2.0445310837775517, "grad_norm": 0.16466441750526428, "learning_rate": 3.1852056306927964e-05, "loss": 0.5158, "mean_token_accuracy": 0.8341558836400509, "num_tokens": 709212407.0, "step": 22222 }, { "entropy": 0.583701394032687, "epoch": 2.044623090148993, "grad_norm": 0.16830186545848846, "learning_rate": 3.184898948078633e-05, "loss": 0.5841, "mean_token_accuracy": 0.8157384470105171, "num_tokens": 709244288.0, "step": 22223 }, { "entropy": 0.5259466243442148, "epoch": 2.044715096520434, "grad_norm": 0.15523575246334076, "learning_rate": 3.1845922654644714e-05, "loss": 0.5074, "mean_token_accuracy": 0.8410928957164288, "num_tokens": 709276910.0, "step": 22224 }, { "entropy": 0.5616196258924901, "epoch": 2.044807102891875, "grad_norm": 0.16289077699184418, "learning_rate": 3.184285582850308e-05, "loss": 0.5486, "mean_token_accuracy": 0.824367094784975, "num_tokens": 709308306.0, "step": 22225 }, { "entropy": 0.48710297886282206, "epoch": 2.0448991092633166, "grad_norm": 0.1593596637248993, "learning_rate": 3.1839789002361456e-05, "loss": 0.4812, "mean_token_accuracy": 0.8460418358445168, "num_tokens": 709340208.0, "step": 22226 }, { "entropy": 0.45811999775469303, "epoch": 2.0449911156347578, "grad_norm": 0.15407045185565948, "learning_rate": 3.183672217621983e-05, "loss": 0.4568, "mean_token_accuracy": 0.8560984022915363, "num_tokens": 709371731.0, "step": 22227 }, { "entropy": 0.510600745677948, "epoch": 2.045083122006199, "grad_norm": 0.16376352310180664, "learning_rate": 3.1833655350078206e-05, "loss": 0.4957, "mean_token_accuracy": 0.8403412587940693, "num_tokens": 709403169.0, "step": 22228 }, { "entropy": 0.6058903532102704, "epoch": 2.04517512837764, "grad_norm": 0.1676870733499527, "learning_rate": 3.183058852393658e-05, "loss": 0.5869, "mean_token_accuracy": 0.8109122700989246, "num_tokens": 709434388.0, "step": 22229 }, { "entropy": 0.5134441475383937, "epoch": 2.045267134749081, "grad_norm": 0.15960560739040375, "learning_rate": 3.1827521697794955e-05, "loss": 0.5014, "mean_token_accuracy": 0.8401676677167416, "num_tokens": 709466638.0, "step": 22230 }, { "entropy": 0.5457140686921775, "epoch": 2.0453591411205228, "grad_norm": 0.16172367334365845, "learning_rate": 3.182445487165332e-05, "loss": 0.5277, "mean_token_accuracy": 0.8305648043751717, "num_tokens": 709498355.0, "step": 22231 }, { "entropy": 0.5046292888000607, "epoch": 2.045451147491964, "grad_norm": 0.15963555872440338, "learning_rate": 3.1821388045511704e-05, "loss": 0.4856, "mean_token_accuracy": 0.8449274636805058, "num_tokens": 709529735.0, "step": 22232 }, { "entropy": 0.49913851264864206, "epoch": 2.045543153863405, "grad_norm": 0.15545670688152313, "learning_rate": 3.181832121937007e-05, "loss": 0.4898, "mean_token_accuracy": 0.8430145978927612, "num_tokens": 709561754.0, "step": 22233 }, { "entropy": 0.5462800837121904, "epoch": 2.045635160234846, "grad_norm": 0.164767324924469, "learning_rate": 3.181525439322845e-05, "loss": 0.528, "mean_token_accuracy": 0.8366005085408688, "num_tokens": 709593432.0, "step": 22234 }, { "entropy": 0.5685871299356222, "epoch": 2.0457271666062873, "grad_norm": 0.16620467603206635, "learning_rate": 3.181218756708682e-05, "loss": 0.5598, "mean_token_accuracy": 0.8252325430512428, "num_tokens": 709625424.0, "step": 22235 }, { "entropy": 0.5835146782919765, "epoch": 2.045819172977729, "grad_norm": 0.17155449092388153, "learning_rate": 3.1809120740945196e-05, "loss": 0.5676, "mean_token_accuracy": 0.8235369734466076, "num_tokens": 709657309.0, "step": 22236 }, { "entropy": 0.5666239708662033, "epoch": 2.04591117934917, "grad_norm": 0.16603752970695496, "learning_rate": 3.180605391480357e-05, "loss": 0.5535, "mean_token_accuracy": 0.8226149864494801, "num_tokens": 709689235.0, "step": 22237 }, { "entropy": 0.5746387569233775, "epoch": 2.046003185720611, "grad_norm": 0.1664511114358902, "learning_rate": 3.1802987088661945e-05, "loss": 0.5392, "mean_token_accuracy": 0.8280641622841358, "num_tokens": 709720574.0, "step": 22238 }, { "entropy": 0.5426457761786878, "epoch": 2.0460951920920523, "grad_norm": 0.1698056012392044, "learning_rate": 3.179992026252032e-05, "loss": 0.535, "mean_token_accuracy": 0.8299527764320374, "num_tokens": 709752301.0, "step": 22239 }, { "entropy": 0.49552370980381966, "epoch": 2.0461871984634934, "grad_norm": 0.1615206003189087, "learning_rate": 3.1796853436378695e-05, "loss": 0.4914, "mean_token_accuracy": 0.8434023782610893, "num_tokens": 709783393.0, "step": 22240 }, { "entropy": 0.49771497026085854, "epoch": 2.046279204834935, "grad_norm": 0.15957927703857422, "learning_rate": 3.179378661023707e-05, "loss": 0.482, "mean_token_accuracy": 0.8475357182323933, "num_tokens": 709815694.0, "step": 22241 }, { "entropy": 0.6138714868575335, "epoch": 2.046371211206376, "grad_norm": 0.17092275619506836, "learning_rate": 3.1790719784095444e-05, "loss": 0.604, "mean_token_accuracy": 0.8103879652917385, "num_tokens": 709847720.0, "step": 22242 }, { "entropy": 0.6253672391176224, "epoch": 2.0464632175778172, "grad_norm": 0.18248598277568817, "learning_rate": 3.178765295795382e-05, "loss": 0.6314, "mean_token_accuracy": 0.8071197792887688, "num_tokens": 709878628.0, "step": 22243 }, { "entropy": 0.5648043733090162, "epoch": 2.0465552239492584, "grad_norm": 0.1664409637451172, "learning_rate": 3.1784586131812186e-05, "loss": 0.5457, "mean_token_accuracy": 0.827485166490078, "num_tokens": 709909951.0, "step": 22244 }, { "entropy": 0.5888278353959322, "epoch": 2.0466472303206995, "grad_norm": 0.16544140875339508, "learning_rate": 3.178151930567057e-05, "loss": 0.5631, "mean_token_accuracy": 0.8199226558208466, "num_tokens": 709941840.0, "step": 22245 }, { "entropy": 0.5317843626253307, "epoch": 2.046739236692141, "grad_norm": 0.16136445105075836, "learning_rate": 3.1778452479528936e-05, "loss": 0.5137, "mean_token_accuracy": 0.8368305787444115, "num_tokens": 709973744.0, "step": 22246 }, { "entropy": 0.44675566628575325, "epoch": 2.046831243063582, "grad_norm": 0.15191791951656342, "learning_rate": 3.177538565338731e-05, "loss": 0.4388, "mean_token_accuracy": 0.8613245934247971, "num_tokens": 710006333.0, "step": 22247 }, { "entropy": 0.6149794533848763, "epoch": 2.0469232494350234, "grad_norm": 0.16860587894916534, "learning_rate": 3.1772318827245685e-05, "loss": 0.598, "mean_token_accuracy": 0.8107277266681194, "num_tokens": 710038247.0, "step": 22248 }, { "entropy": 0.45677989441901445, "epoch": 2.0470152558064645, "grad_norm": 0.15362675487995148, "learning_rate": 3.176925200110406e-05, "loss": 0.4372, "mean_token_accuracy": 0.8607606738805771, "num_tokens": 710070591.0, "step": 22249 }, { "entropy": 0.541802741587162, "epoch": 2.0471072621779056, "grad_norm": 0.15734359622001648, "learning_rate": 3.1766185174962434e-05, "loss": 0.515, "mean_token_accuracy": 0.8354449234902859, "num_tokens": 710102322.0, "step": 22250 }, { "entropy": 0.48258778639137745, "epoch": 2.047199268549347, "grad_norm": 0.15493342280387878, "learning_rate": 3.176311834882081e-05, "loss": 0.4641, "mean_token_accuracy": 0.8529878407716751, "num_tokens": 710132997.0, "step": 22251 }, { "entropy": 0.4897809661924839, "epoch": 2.0472912749207883, "grad_norm": 0.1546148657798767, "learning_rate": 3.176005152267918e-05, "loss": 0.478, "mean_token_accuracy": 0.8478518910706043, "num_tokens": 710164235.0, "step": 22252 }, { "entropy": 0.6083122696727514, "epoch": 2.0473832812922295, "grad_norm": 0.16558252274990082, "learning_rate": 3.175698469653756e-05, "loss": 0.5733, "mean_token_accuracy": 0.8147445321083069, "num_tokens": 710196202.0, "step": 22253 }, { "entropy": 0.5217137429863214, "epoch": 2.0474752876636706, "grad_norm": 0.16595926880836487, "learning_rate": 3.1753917870395926e-05, "loss": 0.5224, "mean_token_accuracy": 0.835174236446619, "num_tokens": 710227908.0, "step": 22254 }, { "entropy": 0.5938577251508832, "epoch": 2.0475672940351117, "grad_norm": 0.17013731598854065, "learning_rate": 3.17508510442543e-05, "loss": 0.5862, "mean_token_accuracy": 0.8146470636129379, "num_tokens": 710258916.0, "step": 22255 }, { "entropy": 0.49933182867243886, "epoch": 2.0476593004065533, "grad_norm": 0.15321741998195648, "learning_rate": 3.1747784218112675e-05, "loss": 0.4894, "mean_token_accuracy": 0.8472789376974106, "num_tokens": 710291469.0, "step": 22256 }, { "entropy": 0.5745809487998486, "epoch": 2.0477513067779944, "grad_norm": 0.17473195493221283, "learning_rate": 3.174471739197105e-05, "loss": 0.5601, "mean_token_accuracy": 0.8249859809875488, "num_tokens": 710323378.0, "step": 22257 }, { "entropy": 0.4612096194177866, "epoch": 2.0478433131494356, "grad_norm": 0.1551489233970642, "learning_rate": 3.1741650565829425e-05, "loss": 0.4475, "mean_token_accuracy": 0.8545063957571983, "num_tokens": 710355711.0, "step": 22258 }, { "entropy": 0.46514591481536627, "epoch": 2.0479353195208767, "grad_norm": 0.1565844863653183, "learning_rate": 3.17385837396878e-05, "loss": 0.4484, "mean_token_accuracy": 0.8558737374842167, "num_tokens": 710387478.0, "step": 22259 }, { "entropy": 0.5523453373461962, "epoch": 2.048027325892318, "grad_norm": 0.1712452471256256, "learning_rate": 3.173551691354617e-05, "loss": 0.5507, "mean_token_accuracy": 0.8292102813720703, "num_tokens": 710418608.0, "step": 22260 }, { "entropy": 0.5124376285821199, "epoch": 2.0481193322637594, "grad_norm": 0.15877746045589447, "learning_rate": 3.173245008740455e-05, "loss": 0.5093, "mean_token_accuracy": 0.8403433561325073, "num_tokens": 710450966.0, "step": 22261 }, { "entropy": 0.378218119032681, "epoch": 2.0482113386352006, "grad_norm": 0.15270262956619263, "learning_rate": 3.1729383261262916e-05, "loss": 0.3669, "mean_token_accuracy": 0.8818269707262516, "num_tokens": 710482644.0, "step": 22262 }, { "entropy": 0.49639786314219236, "epoch": 2.0483033450066417, "grad_norm": 0.16220217943191528, "learning_rate": 3.17263164351213e-05, "loss": 0.4831, "mean_token_accuracy": 0.8467799350619316, "num_tokens": 710514443.0, "step": 22263 }, { "entropy": 0.5626691300421953, "epoch": 2.048395351378083, "grad_norm": 0.16743947565555573, "learning_rate": 3.1723249608979666e-05, "loss": 0.5537, "mean_token_accuracy": 0.8263086043298244, "num_tokens": 710546041.0, "step": 22264 }, { "entropy": 0.5101697323843837, "epoch": 2.048487357749524, "grad_norm": 0.1652420163154602, "learning_rate": 3.172018278283804e-05, "loss": 0.499, "mean_token_accuracy": 0.8395526595413685, "num_tokens": 710576861.0, "step": 22265 }, { "entropy": 0.6149094384163618, "epoch": 2.0485793641209655, "grad_norm": 0.1711847186088562, "learning_rate": 3.1717115956696415e-05, "loss": 0.608, "mean_token_accuracy": 0.8098741732537746, "num_tokens": 710608779.0, "step": 22266 }, { "entropy": 0.4721071347594261, "epoch": 2.0486713704924067, "grad_norm": 0.1586814969778061, "learning_rate": 3.171404913055479e-05, "loss": 0.4552, "mean_token_accuracy": 0.8568858616054058, "num_tokens": 710640779.0, "step": 22267 }, { "entropy": 0.46182132698595524, "epoch": 2.048763376863848, "grad_norm": 0.1538359373807907, "learning_rate": 3.1710982304413164e-05, "loss": 0.4416, "mean_token_accuracy": 0.8590615279972553, "num_tokens": 710673091.0, "step": 22268 }, { "entropy": 0.5679783839732409, "epoch": 2.048855383235289, "grad_norm": 0.1608426868915558, "learning_rate": 3.170791547827154e-05, "loss": 0.5496, "mean_token_accuracy": 0.8277580887079239, "num_tokens": 710704662.0, "step": 22269 }, { "entropy": 0.46820810995996, "epoch": 2.04894738960673, "grad_norm": 0.15091559290885925, "learning_rate": 3.1704848652129914e-05, "loss": 0.45, "mean_token_accuracy": 0.8579231016337872, "num_tokens": 710736553.0, "step": 22270 }, { "entropy": 0.4771493664011359, "epoch": 2.0490393959781716, "grad_norm": 0.15236487984657288, "learning_rate": 3.170178182598829e-05, "loss": 0.4588, "mean_token_accuracy": 0.8540616743266582, "num_tokens": 710768244.0, "step": 22271 }, { "entropy": 0.5763185434043407, "epoch": 2.0491314023496128, "grad_norm": 0.16507534682750702, "learning_rate": 3.169871499984666e-05, "loss": 0.5482, "mean_token_accuracy": 0.825927123427391, "num_tokens": 710799506.0, "step": 22272 }, { "entropy": 0.44168843887746334, "epoch": 2.049223408721054, "grad_norm": 0.15127356350421906, "learning_rate": 3.169564817370503e-05, "loss": 0.4289, "mean_token_accuracy": 0.8644929304718971, "num_tokens": 710831939.0, "step": 22273 }, { "entropy": 0.4949581753462553, "epoch": 2.049315415092495, "grad_norm": 0.15782445669174194, "learning_rate": 3.169258134756341e-05, "loss": 0.482, "mean_token_accuracy": 0.8484559692442417, "num_tokens": 710864003.0, "step": 22274 }, { "entropy": 0.5420243265107274, "epoch": 2.049407421463936, "grad_norm": 0.16120050847530365, "learning_rate": 3.168951452142178e-05, "loss": 0.5402, "mean_token_accuracy": 0.8326166532933712, "num_tokens": 710895912.0, "step": 22275 }, { "entropy": 0.5107416762039065, "epoch": 2.0494994278353778, "grad_norm": 0.15638601779937744, "learning_rate": 3.1686447695280155e-05, "loss": 0.5007, "mean_token_accuracy": 0.8409953229129314, "num_tokens": 710927835.0, "step": 22276 }, { "entropy": 0.4634348629042506, "epoch": 2.049591434206819, "grad_norm": 0.152720108628273, "learning_rate": 3.168338086913853e-05, "loss": 0.452, "mean_token_accuracy": 0.8546582646667957, "num_tokens": 710960100.0, "step": 22277 }, { "entropy": 0.5225980626419187, "epoch": 2.04968344057826, "grad_norm": 0.15674379467964172, "learning_rate": 3.1680314042996904e-05, "loss": 0.4927, "mean_token_accuracy": 0.8408317305147648, "num_tokens": 710991479.0, "step": 22278 }, { "entropy": 0.5462953047826886, "epoch": 2.049775446949701, "grad_norm": 0.1618843376636505, "learning_rate": 3.167724721685528e-05, "loss": 0.5239, "mean_token_accuracy": 0.8341438621282578, "num_tokens": 711022795.0, "step": 22279 }, { "entropy": 0.5255573689937592, "epoch": 2.0498674533211423, "grad_norm": 0.16602924466133118, "learning_rate": 3.167418039071365e-05, "loss": 0.5069, "mean_token_accuracy": 0.8389909751713276, "num_tokens": 711054501.0, "step": 22280 }, { "entropy": 0.49766627326607704, "epoch": 2.049959459692584, "grad_norm": 0.16017282009124756, "learning_rate": 3.167111356457203e-05, "loss": 0.4819, "mean_token_accuracy": 0.8444238491356373, "num_tokens": 711086507.0, "step": 22281 }, { "entropy": 0.5688009411096573, "epoch": 2.050051466064025, "grad_norm": 0.16125838458538055, "learning_rate": 3.16680467384304e-05, "loss": 0.5463, "mean_token_accuracy": 0.8265541568398476, "num_tokens": 711118149.0, "step": 22282 }, { "entropy": 0.4965203898027539, "epoch": 2.050143472435466, "grad_norm": 0.15975289046764374, "learning_rate": 3.166497991228877e-05, "loss": 0.4796, "mean_token_accuracy": 0.8486460000276566, "num_tokens": 711150020.0, "step": 22283 }, { "entropy": 0.47037561796605587, "epoch": 2.0502354788069073, "grad_norm": 0.15020105242729187, "learning_rate": 3.166191308614715e-05, "loss": 0.449, "mean_token_accuracy": 0.8549406081438065, "num_tokens": 711182425.0, "step": 22284 }, { "entropy": 0.5087796547450125, "epoch": 2.0503274851783484, "grad_norm": 0.16116270422935486, "learning_rate": 3.165884626000552e-05, "loss": 0.5145, "mean_token_accuracy": 0.8422965370118618, "num_tokens": 711213831.0, "step": 22285 }, { "entropy": 0.5224776081740856, "epoch": 2.05041949154979, "grad_norm": 0.16110599040985107, "learning_rate": 3.1655779433863894e-05, "loss": 0.5065, "mean_token_accuracy": 0.8400426991283894, "num_tokens": 711246534.0, "step": 22286 }, { "entropy": 0.45310133416205645, "epoch": 2.050511497921231, "grad_norm": 0.14958839118480682, "learning_rate": 3.165271260772227e-05, "loss": 0.438, "mean_token_accuracy": 0.8587298169732094, "num_tokens": 711279152.0, "step": 22287 }, { "entropy": 0.536817442625761, "epoch": 2.0506035042926722, "grad_norm": 0.16040430963039398, "learning_rate": 3.1649645781580644e-05, "loss": 0.52, "mean_token_accuracy": 0.8379361480474472, "num_tokens": 711311356.0, "step": 22288 }, { "entropy": 0.522719400934875, "epoch": 2.0506955106641134, "grad_norm": 0.1641213595867157, "learning_rate": 3.164657895543902e-05, "loss": 0.5132, "mean_token_accuracy": 0.8385762944817543, "num_tokens": 711342947.0, "step": 22289 }, { "entropy": 0.6005381802096963, "epoch": 2.0507875170355545, "grad_norm": 0.17304053902626038, "learning_rate": 3.164351212929739e-05, "loss": 0.5894, "mean_token_accuracy": 0.8131558410823345, "num_tokens": 711375105.0, "step": 22290 }, { "entropy": 0.5086303474381566, "epoch": 2.050879523406996, "grad_norm": 0.1633520871400833, "learning_rate": 3.164044530315576e-05, "loss": 0.4962, "mean_token_accuracy": 0.8435581810772419, "num_tokens": 711407729.0, "step": 22291 }, { "entropy": 0.5030010659247637, "epoch": 2.050971529778437, "grad_norm": 0.15969251096248627, "learning_rate": 3.163737847701414e-05, "loss": 0.4872, "mean_token_accuracy": 0.845580093562603, "num_tokens": 711438623.0, "step": 22292 }, { "entropy": 0.6143827363848686, "epoch": 2.0510635361498784, "grad_norm": 0.17163696885108948, "learning_rate": 3.163431165087251e-05, "loss": 0.6, "mean_token_accuracy": 0.8079275116324425, "num_tokens": 711471104.0, "step": 22293 }, { "entropy": 0.4742765184491873, "epoch": 2.0511555425213195, "grad_norm": 0.15868854522705078, "learning_rate": 3.1631244824730885e-05, "loss": 0.4731, "mean_token_accuracy": 0.8488551266491413, "num_tokens": 711503279.0, "step": 22294 }, { "entropy": 0.5636255387216806, "epoch": 2.0512475488927606, "grad_norm": 0.1596178114414215, "learning_rate": 3.162817799858926e-05, "loss": 0.5403, "mean_token_accuracy": 0.8271634429693222, "num_tokens": 711534767.0, "step": 22295 }, { "entropy": 0.4809952531941235, "epoch": 2.051339555264202, "grad_norm": 0.15068498253822327, "learning_rate": 3.1625111172447634e-05, "loss": 0.4484, "mean_token_accuracy": 0.8531006164848804, "num_tokens": 711566433.0, "step": 22296 }, { "entropy": 0.4478222345933318, "epoch": 2.0514315616356433, "grad_norm": 0.14522668719291687, "learning_rate": 3.162204434630601e-05, "loss": 0.4274, "mean_token_accuracy": 0.8621592372655869, "num_tokens": 711598667.0, "step": 22297 }, { "entropy": 0.44296251609921455, "epoch": 2.0515235680070845, "grad_norm": 0.1496846228837967, "learning_rate": 3.1618977520164383e-05, "loss": 0.4317, "mean_token_accuracy": 0.8617262281477451, "num_tokens": 711631139.0, "step": 22298 }, { "entropy": 0.5011398531496525, "epoch": 2.0516155743785256, "grad_norm": 0.1570652425289154, "learning_rate": 3.161591069402276e-05, "loss": 0.48, "mean_token_accuracy": 0.8433900289237499, "num_tokens": 711661931.0, "step": 22299 }, { "entropy": 0.5323756886646152, "epoch": 2.0517075807499667, "grad_norm": 0.1634872853755951, "learning_rate": 3.161284386788113e-05, "loss": 0.5227, "mean_token_accuracy": 0.8332018852233887, "num_tokens": 711693135.0, "step": 22300 }, { "entropy": 0.4950173795223236, "epoch": 2.0517995871214083, "grad_norm": 0.15384873747825623, "learning_rate": 3.160977704173951e-05, "loss": 0.4832, "mean_token_accuracy": 0.849608413875103, "num_tokens": 711725368.0, "step": 22301 }, { "entropy": 0.4926331308670342, "epoch": 2.0518915934928494, "grad_norm": 0.15786530077457428, "learning_rate": 3.160671021559788e-05, "loss": 0.491, "mean_token_accuracy": 0.8450788408517838, "num_tokens": 711757769.0, "step": 22302 }, { "entropy": 0.607310039922595, "epoch": 2.0519835998642906, "grad_norm": 0.17147782444953918, "learning_rate": 3.160364338945626e-05, "loss": 0.5918, "mean_token_accuracy": 0.8123137317597866, "num_tokens": 711789543.0, "step": 22303 }, { "entropy": 0.5290580419823527, "epoch": 2.0520756062357317, "grad_norm": 0.16156558692455292, "learning_rate": 3.1600576563314625e-05, "loss": 0.5088, "mean_token_accuracy": 0.8342626839876175, "num_tokens": 711821063.0, "step": 22304 }, { "entropy": 0.5672480908688158, "epoch": 2.052167612607173, "grad_norm": 0.16115295886993408, "learning_rate": 3.1597509737173006e-05, "loss": 0.5438, "mean_token_accuracy": 0.8294797763228416, "num_tokens": 711853186.0, "step": 22305 }, { "entropy": 0.5928765516728163, "epoch": 2.0522596189786144, "grad_norm": 0.1653222143650055, "learning_rate": 3.1594442911031374e-05, "loss": 0.5747, "mean_token_accuracy": 0.817200567573309, "num_tokens": 711885857.0, "step": 22306 }, { "entropy": 0.45726071763783693, "epoch": 2.0523516253500556, "grad_norm": 0.15694838762283325, "learning_rate": 3.159137608488975e-05, "loss": 0.4423, "mean_token_accuracy": 0.8587237671017647, "num_tokens": 711917823.0, "step": 22307 }, { "entropy": 0.5671656765043736, "epoch": 2.0524436317214967, "grad_norm": 0.16517989337444305, "learning_rate": 3.158830925874812e-05, "loss": 0.5424, "mean_token_accuracy": 0.8294703178107738, "num_tokens": 711949583.0, "step": 22308 }, { "entropy": 0.7206710372120142, "epoch": 2.052535638092938, "grad_norm": 0.1846262663602829, "learning_rate": 3.15852424326065e-05, "loss": 0.7071, "mean_token_accuracy": 0.7820555008947849, "num_tokens": 711980235.0, "step": 22309 }, { "entropy": 0.5267563834786415, "epoch": 2.052627644464379, "grad_norm": 0.16183239221572876, "learning_rate": 3.158217560646487e-05, "loss": 0.5179, "mean_token_accuracy": 0.8352445214986801, "num_tokens": 712012995.0, "step": 22310 }, { "entropy": 0.5862956522032619, "epoch": 2.0527196508358205, "grad_norm": 0.16359464824199677, "learning_rate": 3.157910878032325e-05, "loss": 0.576, "mean_token_accuracy": 0.8207691535353661, "num_tokens": 712045234.0, "step": 22311 }, { "entropy": 0.5126848667860031, "epoch": 2.0528116572072617, "grad_norm": 0.16067172586917877, "learning_rate": 3.1576041954181615e-05, "loss": 0.5031, "mean_token_accuracy": 0.8406009711325169, "num_tokens": 712077247.0, "step": 22312 }, { "entropy": 0.5373583976179361, "epoch": 2.052903663578703, "grad_norm": 0.1630997359752655, "learning_rate": 3.1572975128039996e-05, "loss": 0.5163, "mean_token_accuracy": 0.8339725881814957, "num_tokens": 712109513.0, "step": 22313 }, { "entropy": 0.5197868533432484, "epoch": 2.052995669950144, "grad_norm": 0.1610727310180664, "learning_rate": 3.1569908301898364e-05, "loss": 0.5132, "mean_token_accuracy": 0.8369336538016796, "num_tokens": 712140697.0, "step": 22314 }, { "entropy": 0.513088465668261, "epoch": 2.053087676321585, "grad_norm": 0.16151848435401917, "learning_rate": 3.156684147575674e-05, "loss": 0.4922, "mean_token_accuracy": 0.8405912108719349, "num_tokens": 712171754.0, "step": 22315 }, { "entropy": 0.4552550255320966, "epoch": 2.0531796826930266, "grad_norm": 0.15031741559505463, "learning_rate": 3.1563774649615114e-05, "loss": 0.4394, "mean_token_accuracy": 0.8596092872321606, "num_tokens": 712204271.0, "step": 22316 }, { "entropy": 0.4911436401307583, "epoch": 2.0532716890644678, "grad_norm": 0.15942201018333435, "learning_rate": 3.156070782347349e-05, "loss": 0.4731, "mean_token_accuracy": 0.8471367843449116, "num_tokens": 712235921.0, "step": 22317 }, { "entropy": 0.49578865244984627, "epoch": 2.053363695435909, "grad_norm": 0.15811485052108765, "learning_rate": 3.155764099733186e-05, "loss": 0.4785, "mean_token_accuracy": 0.8475617915391922, "num_tokens": 712268346.0, "step": 22318 }, { "entropy": 0.5398330790922046, "epoch": 2.05345570180735, "grad_norm": 0.1559225171804428, "learning_rate": 3.155457417119024e-05, "loss": 0.525, "mean_token_accuracy": 0.8380568027496338, "num_tokens": 712300114.0, "step": 22319 }, { "entropy": 0.4730836683884263, "epoch": 2.053547708178791, "grad_norm": 0.15761798620224, "learning_rate": 3.1551507345048605e-05, "loss": 0.4498, "mean_token_accuracy": 0.8554722741246223, "num_tokens": 712331746.0, "step": 22320 }, { "entropy": 0.5107381641864777, "epoch": 2.0536397145502328, "grad_norm": 0.15892736613750458, "learning_rate": 3.154844051890699e-05, "loss": 0.496, "mean_token_accuracy": 0.8405498638749123, "num_tokens": 712363818.0, "step": 22321 }, { "entropy": 0.5322193559259176, "epoch": 2.053731720921674, "grad_norm": 0.16281524300575256, "learning_rate": 3.1545373692765355e-05, "loss": 0.5205, "mean_token_accuracy": 0.8364743925631046, "num_tokens": 712396280.0, "step": 22322 }, { "entropy": 0.6851741299033165, "epoch": 2.053823727293115, "grad_norm": 0.18293538689613342, "learning_rate": 3.1542306866623736e-05, "loss": 0.6666, "mean_token_accuracy": 0.7903807125985622, "num_tokens": 712426777.0, "step": 22323 }, { "entropy": 0.5223727915436029, "epoch": 2.053915733664556, "grad_norm": 0.1626758724451065, "learning_rate": 3.1539240040482104e-05, "loss": 0.5081, "mean_token_accuracy": 0.8389591351151466, "num_tokens": 712458743.0, "step": 22324 }, { "entropy": 0.5952751412987709, "epoch": 2.0540077400359973, "grad_norm": 0.16225068271160126, "learning_rate": 3.153617321434048e-05, "loss": 0.5733, "mean_token_accuracy": 0.8199800178408623, "num_tokens": 712491096.0, "step": 22325 }, { "entropy": 0.5596644207835197, "epoch": 2.054099746407439, "grad_norm": 0.1685764491558075, "learning_rate": 3.153310638819885e-05, "loss": 0.5455, "mean_token_accuracy": 0.8272288478910923, "num_tokens": 712522985.0, "step": 22326 }, { "entropy": 0.41446660552173853, "epoch": 2.05419175277888, "grad_norm": 0.1543838381767273, "learning_rate": 3.153003956205723e-05, "loss": 0.4004, "mean_token_accuracy": 0.8717163912951946, "num_tokens": 712554863.0, "step": 22327 }, { "entropy": 0.4979524053633213, "epoch": 2.054283759150321, "grad_norm": 0.15688107907772064, "learning_rate": 3.15269727359156e-05, "loss": 0.4846, "mean_token_accuracy": 0.845314547419548, "num_tokens": 712586423.0, "step": 22328 }, { "entropy": 0.5027128728106618, "epoch": 2.0543757655217623, "grad_norm": 0.15571987628936768, "learning_rate": 3.152390590977398e-05, "loss": 0.4842, "mean_token_accuracy": 0.8475375659763813, "num_tokens": 712618633.0, "step": 22329 }, { "entropy": 0.5714610749855638, "epoch": 2.0544677718932034, "grad_norm": 0.16602808237075806, "learning_rate": 3.152083908363235e-05, "loss": 0.5525, "mean_token_accuracy": 0.8251377679407597, "num_tokens": 712650250.0, "step": 22330 }, { "entropy": 0.5174584444612265, "epoch": 2.054559778264645, "grad_norm": 0.16230623424053192, "learning_rate": 3.1517772257490726e-05, "loss": 0.5014, "mean_token_accuracy": 0.8402541242539883, "num_tokens": 712681772.0, "step": 22331 }, { "entropy": 0.4975507794879377, "epoch": 2.054651784636086, "grad_norm": 0.15283501148223877, "learning_rate": 3.15147054313491e-05, "loss": 0.4898, "mean_token_accuracy": 0.8465993590652943, "num_tokens": 712714403.0, "step": 22332 }, { "entropy": 0.5185057520866394, "epoch": 2.0547437910075272, "grad_norm": 0.1575172245502472, "learning_rate": 3.151163860520747e-05, "loss": 0.5101, "mean_token_accuracy": 0.83865150436759, "num_tokens": 712745139.0, "step": 22333 }, { "entropy": 0.46766557544469833, "epoch": 2.0548357973789684, "grad_norm": 0.15869934856891632, "learning_rate": 3.150857177906585e-05, "loss": 0.4619, "mean_token_accuracy": 0.8519315756857395, "num_tokens": 712777132.0, "step": 22334 }, { "entropy": 0.46320054261013865, "epoch": 2.0549278037504095, "grad_norm": 0.15200389921665192, "learning_rate": 3.150550495292422e-05, "loss": 0.4558, "mean_token_accuracy": 0.8527575097978115, "num_tokens": 712808852.0, "step": 22335 }, { "entropy": 0.5411114390008152, "epoch": 2.055019810121851, "grad_norm": 0.15988102555274963, "learning_rate": 3.150243812678259e-05, "loss": 0.5311, "mean_token_accuracy": 0.8351697437465191, "num_tokens": 712841313.0, "step": 22336 }, { "entropy": 0.43186100106686354, "epoch": 2.055111816493292, "grad_norm": 0.1482296735048294, "learning_rate": 3.149937130064097e-05, "loss": 0.4132, "mean_token_accuracy": 0.8689571432769299, "num_tokens": 712873522.0, "step": 22337 }, { "entropy": 0.6103125121444464, "epoch": 2.0552038228647334, "grad_norm": 0.17366889119148254, "learning_rate": 3.149630447449934e-05, "loss": 0.6, "mean_token_accuracy": 0.8122609332203865, "num_tokens": 712905037.0, "step": 22338 }, { "entropy": 0.4546457324177027, "epoch": 2.0552958292361745, "grad_norm": 0.15631404519081116, "learning_rate": 3.149323764835772e-05, "loss": 0.4404, "mean_token_accuracy": 0.8558334335684776, "num_tokens": 712937221.0, "step": 22339 }, { "entropy": 0.5181230008602142, "epoch": 2.0553878356076156, "grad_norm": 0.15683603286743164, "learning_rate": 3.149017082221609e-05, "loss": 0.5007, "mean_token_accuracy": 0.8392732851207256, "num_tokens": 712969782.0, "step": 22340 }, { "entropy": 0.5373398186638951, "epoch": 2.055479841979057, "grad_norm": 0.16866837441921234, "learning_rate": 3.1487103996074466e-05, "loss": 0.5135, "mean_token_accuracy": 0.8344261907041073, "num_tokens": 713000567.0, "step": 22341 }, { "entropy": 0.4588765911757946, "epoch": 2.0555718483504983, "grad_norm": 0.15486645698547363, "learning_rate": 3.148403716993284e-05, "loss": 0.4521, "mean_token_accuracy": 0.856891680508852, "num_tokens": 713032605.0, "step": 22342 }, { "entropy": 0.49338513729162514, "epoch": 2.0556638547219395, "grad_norm": 0.16272540390491486, "learning_rate": 3.148097034379121e-05, "loss": 0.4867, "mean_token_accuracy": 0.8446051739156246, "num_tokens": 713064649.0, "step": 22343 }, { "entropy": 0.5514032458886504, "epoch": 2.0557558610933806, "grad_norm": 0.16026878356933594, "learning_rate": 3.147790351764959e-05, "loss": 0.5328, "mean_token_accuracy": 0.8310211300849915, "num_tokens": 713096473.0, "step": 22344 }, { "entropy": 0.5738812573254108, "epoch": 2.0558478674648217, "grad_norm": 0.17650341987609863, "learning_rate": 3.147483669150796e-05, "loss": 0.5568, "mean_token_accuracy": 0.8252611346542835, "num_tokens": 713127498.0, "step": 22345 }, { "entropy": 0.4484291863627732, "epoch": 2.0559398738362633, "grad_norm": 0.15070228278636932, "learning_rate": 3.147176986536633e-05, "loss": 0.4341, "mean_token_accuracy": 0.8624399155378342, "num_tokens": 713160103.0, "step": 22346 }, { "entropy": 0.4542163070291281, "epoch": 2.0560318802077044, "grad_norm": 0.14889565110206604, "learning_rate": 3.146870303922471e-05, "loss": 0.4373, "mean_token_accuracy": 0.8599953874945641, "num_tokens": 713191713.0, "step": 22347 }, { "entropy": 0.49682241026312113, "epoch": 2.0561238865791456, "grad_norm": 0.15244349837303162, "learning_rate": 3.146563621308308e-05, "loss": 0.479, "mean_token_accuracy": 0.8472513742744923, "num_tokens": 713223713.0, "step": 22348 }, { "entropy": 0.5222070589661598, "epoch": 2.0562158929505867, "grad_norm": 0.1538969725370407, "learning_rate": 3.1462569386941457e-05, "loss": 0.498, "mean_token_accuracy": 0.8405949622392654, "num_tokens": 713255756.0, "step": 22349 }, { "entropy": 0.5455788196995854, "epoch": 2.056307899322028, "grad_norm": 0.169391468167305, "learning_rate": 3.145950256079983e-05, "loss": 0.5179, "mean_token_accuracy": 0.8342102840542793, "num_tokens": 713287312.0, "step": 22350 }, { "entropy": 0.48613745998591185, "epoch": 2.0563999056934694, "grad_norm": 0.157512828707695, "learning_rate": 3.14564357346582e-05, "loss": 0.4705, "mean_token_accuracy": 0.8498138561844826, "num_tokens": 713319537.0, "step": 22351 }, { "entropy": 0.5177052654325962, "epoch": 2.0564919120649106, "grad_norm": 0.15993933379650116, "learning_rate": 3.145336890851658e-05, "loss": 0.5003, "mean_token_accuracy": 0.8420102372765541, "num_tokens": 713351072.0, "step": 22352 }, { "entropy": 0.6028684079647064, "epoch": 2.0565839184363517, "grad_norm": 0.16620591282844543, "learning_rate": 3.145030208237495e-05, "loss": 0.581, "mean_token_accuracy": 0.8134290426969528, "num_tokens": 713382690.0, "step": 22353 }, { "entropy": 0.45637505664490163, "epoch": 2.056675924807793, "grad_norm": 0.1504899561405182, "learning_rate": 3.144723525623332e-05, "loss": 0.4351, "mean_token_accuracy": 0.8594904281198978, "num_tokens": 713414510.0, "step": 22354 }, { "entropy": 0.500659616664052, "epoch": 2.056767931179234, "grad_norm": 0.15518701076507568, "learning_rate": 3.14441684300917e-05, "loss": 0.4828, "mean_token_accuracy": 0.846913255751133, "num_tokens": 713446458.0, "step": 22355 }, { "entropy": 0.5877839513123035, "epoch": 2.0568599375506755, "grad_norm": 0.17328305542469025, "learning_rate": 3.144110160395007e-05, "loss": 0.5808, "mean_token_accuracy": 0.8173444867134094, "num_tokens": 713478338.0, "step": 22356 }, { "entropy": 0.5483754528686404, "epoch": 2.0569519439221167, "grad_norm": 0.16237527132034302, "learning_rate": 3.143803477780845e-05, "loss": 0.5288, "mean_token_accuracy": 0.8335336409509182, "num_tokens": 713509651.0, "step": 22357 }, { "entropy": 0.5019070953130722, "epoch": 2.057043950293558, "grad_norm": 0.16204094886779785, "learning_rate": 3.143496795166682e-05, "loss": 0.4965, "mean_token_accuracy": 0.8443160988390446, "num_tokens": 713541734.0, "step": 22358 }, { "entropy": 0.46500387880951166, "epoch": 2.057135956664999, "grad_norm": 0.15180405974388123, "learning_rate": 3.143190112552519e-05, "loss": 0.4515, "mean_token_accuracy": 0.8572991266846657, "num_tokens": 713573518.0, "step": 22359 }, { "entropy": 0.5873374529182911, "epoch": 2.05722796303644, "grad_norm": 0.16695812344551086, "learning_rate": 3.142883429938357e-05, "loss": 0.5857, "mean_token_accuracy": 0.8184551820158958, "num_tokens": 713606010.0, "step": 22360 }, { "entropy": 0.5083217564970255, "epoch": 2.0573199694078816, "grad_norm": 0.15355022251605988, "learning_rate": 3.1425767473241946e-05, "loss": 0.5003, "mean_token_accuracy": 0.8453508540987968, "num_tokens": 713638557.0, "step": 22361 }, { "entropy": 0.47844765335321426, "epoch": 2.0574119757793228, "grad_norm": 0.15820565819740295, "learning_rate": 3.142270064710032e-05, "loss": 0.4638, "mean_token_accuracy": 0.8490441180765629, "num_tokens": 713670559.0, "step": 22362 }, { "entropy": 0.47527928883209825, "epoch": 2.057503982150764, "grad_norm": 0.1540517657995224, "learning_rate": 3.1419633820958695e-05, "loss": 0.4576, "mean_token_accuracy": 0.8538907505571842, "num_tokens": 713701852.0, "step": 22363 }, { "entropy": 0.5140536250546575, "epoch": 2.057595988522205, "grad_norm": 0.15687260031700134, "learning_rate": 3.141656699481706e-05, "loss": 0.5022, "mean_token_accuracy": 0.840433094650507, "num_tokens": 713734088.0, "step": 22364 }, { "entropy": 0.6574119739234447, "epoch": 2.057687994893646, "grad_norm": 0.17171311378479004, "learning_rate": 3.1413500168675444e-05, "loss": 0.6412, "mean_token_accuracy": 0.7955421283841133, "num_tokens": 713765222.0, "step": 22365 }, { "entropy": 0.4744435250759125, "epoch": 2.0577800012650878, "grad_norm": 0.15272632241249084, "learning_rate": 3.141043334253381e-05, "loss": 0.4617, "mean_token_accuracy": 0.8532989025115967, "num_tokens": 713797125.0, "step": 22366 }, { "entropy": 0.4988256115466356, "epoch": 2.057872007636529, "grad_norm": 0.15915460884571075, "learning_rate": 3.140736651639219e-05, "loss": 0.4663, "mean_token_accuracy": 0.849220409989357, "num_tokens": 713829164.0, "step": 22367 }, { "entropy": 0.5270381700247526, "epoch": 2.05796401400797, "grad_norm": 0.1575097143650055, "learning_rate": 3.140429969025056e-05, "loss": 0.5114, "mean_token_accuracy": 0.8362776450812817, "num_tokens": 713861697.0, "step": 22368 }, { "entropy": 0.5356270978227258, "epoch": 2.058056020379411, "grad_norm": 0.16127923130989075, "learning_rate": 3.1401232864108936e-05, "loss": 0.5118, "mean_token_accuracy": 0.8376453183591366, "num_tokens": 713892875.0, "step": 22369 }, { "entropy": 0.5333032067865133, "epoch": 2.0581480267508523, "grad_norm": 0.17086222767829895, "learning_rate": 3.139816603796731e-05, "loss": 0.5226, "mean_token_accuracy": 0.8357493467628956, "num_tokens": 713923423.0, "step": 22370 }, { "entropy": 0.3764507779851556, "epoch": 2.058240033122294, "grad_norm": 0.14419543743133545, "learning_rate": 3.1395099211825685e-05, "loss": 0.3635, "mean_token_accuracy": 0.8839059583842754, "num_tokens": 713955331.0, "step": 22371 }, { "entropy": 0.5193637292832136, "epoch": 2.058332039493735, "grad_norm": 0.16019634902477264, "learning_rate": 3.139203238568405e-05, "loss": 0.5004, "mean_token_accuracy": 0.8419878892600536, "num_tokens": 713987662.0, "step": 22372 }, { "entropy": 0.5678440686315298, "epoch": 2.058424045865176, "grad_norm": 0.15997929871082306, "learning_rate": 3.1388965559542435e-05, "loss": 0.5531, "mean_token_accuracy": 0.8258152566850185, "num_tokens": 714020298.0, "step": 22373 }, { "entropy": 0.5265815947204828, "epoch": 2.0585160522366173, "grad_norm": 0.15669120848178864, "learning_rate": 3.13858987334008e-05, "loss": 0.5112, "mean_token_accuracy": 0.8376092799007893, "num_tokens": 714052899.0, "step": 22374 }, { "entropy": 0.5300065148621798, "epoch": 2.0586080586080584, "grad_norm": 0.16268572211265564, "learning_rate": 3.138283190725918e-05, "loss": 0.5127, "mean_token_accuracy": 0.8374750576913357, "num_tokens": 714084901.0, "step": 22375 }, { "entropy": 0.5443704430945218, "epoch": 2.0587000649795, "grad_norm": 0.16564734280109406, "learning_rate": 3.137976508111755e-05, "loss": 0.5347, "mean_token_accuracy": 0.8318536318838596, "num_tokens": 714116918.0, "step": 22376 }, { "entropy": 0.4627838407177478, "epoch": 2.058792071350941, "grad_norm": 0.14871680736541748, "learning_rate": 3.1376698254975926e-05, "loss": 0.4466, "mean_token_accuracy": 0.85694245621562, "num_tokens": 714149144.0, "step": 22377 }, { "entropy": 0.49953779205679893, "epoch": 2.0588840777223822, "grad_norm": 0.1678881049156189, "learning_rate": 3.13736314288343e-05, "loss": 0.4915, "mean_token_accuracy": 0.8440989442169666, "num_tokens": 714180575.0, "step": 22378 }, { "entropy": 0.5299974363297224, "epoch": 2.0589760840938234, "grad_norm": 0.16159985959529877, "learning_rate": 3.1370564602692676e-05, "loss": 0.5199, "mean_token_accuracy": 0.8349658995866776, "num_tokens": 714212822.0, "step": 22379 }, { "entropy": 0.49265719950199127, "epoch": 2.0590680904652645, "grad_norm": 0.15463268756866455, "learning_rate": 3.1367497776551044e-05, "loss": 0.4724, "mean_token_accuracy": 0.8503524288535118, "num_tokens": 714245166.0, "step": 22380 }, { "entropy": 0.538017145358026, "epoch": 2.059160096836706, "grad_norm": 0.1606171727180481, "learning_rate": 3.1364430950409425e-05, "loss": 0.5289, "mean_token_accuracy": 0.8328192718327045, "num_tokens": 714277147.0, "step": 22381 }, { "entropy": 0.5392560102045536, "epoch": 2.0592521032081472, "grad_norm": 0.1621427983045578, "learning_rate": 3.136136412426779e-05, "loss": 0.524, "mean_token_accuracy": 0.8344292864203453, "num_tokens": 714308516.0, "step": 22382 }, { "entropy": 0.5404833722859621, "epoch": 2.0593441095795884, "grad_norm": 0.1666218638420105, "learning_rate": 3.1358297298126174e-05, "loss": 0.5227, "mean_token_accuracy": 0.8362071812152863, "num_tokens": 714340344.0, "step": 22383 }, { "entropy": 0.5435812715440989, "epoch": 2.0594361159510295, "grad_norm": 0.16198846697807312, "learning_rate": 3.135523047198454e-05, "loss": 0.5356, "mean_token_accuracy": 0.8285306952893734, "num_tokens": 714372368.0, "step": 22384 }, { "entropy": 0.44714626856148243, "epoch": 2.0595281223224706, "grad_norm": 0.1523459553718567, "learning_rate": 3.135216364584292e-05, "loss": 0.4281, "mean_token_accuracy": 0.8608819916844368, "num_tokens": 714404888.0, "step": 22385 }, { "entropy": 0.5761854005977511, "epoch": 2.059620128693912, "grad_norm": 0.17228224873542786, "learning_rate": 3.134909681970129e-05, "loss": 0.5763, "mean_token_accuracy": 0.8204493932425976, "num_tokens": 714437274.0, "step": 22386 }, { "entropy": 0.5322483824566007, "epoch": 2.0597121350653533, "grad_norm": 0.15930204093456268, "learning_rate": 3.1346029993559666e-05, "loss": 0.5163, "mean_token_accuracy": 0.84053073823452, "num_tokens": 714469893.0, "step": 22387 }, { "entropy": 0.6048946604132652, "epoch": 2.0598041414367945, "grad_norm": 0.17062988877296448, "learning_rate": 3.134296316741804e-05, "loss": 0.6021, "mean_token_accuracy": 0.8157206326723099, "num_tokens": 714501830.0, "step": 22388 }, { "entropy": 0.616201488301158, "epoch": 2.0598961478082356, "grad_norm": 0.1724708080291748, "learning_rate": 3.1339896341276415e-05, "loss": 0.595, "mean_token_accuracy": 0.8111053109169006, "num_tokens": 714533689.0, "step": 22389 }, { "entropy": 0.4713795827701688, "epoch": 2.0599881541796767, "grad_norm": 0.15778283774852753, "learning_rate": 3.133682951513479e-05, "loss": 0.4599, "mean_token_accuracy": 0.8542724885046482, "num_tokens": 714566149.0, "step": 22390 }, { "entropy": 0.46176266111433506, "epoch": 2.0600801605511183, "grad_norm": 0.15562663972377777, "learning_rate": 3.1333762688993165e-05, "loss": 0.4501, "mean_token_accuracy": 0.8565462380647659, "num_tokens": 714598582.0, "step": 22391 }, { "entropy": 0.47603205032646656, "epoch": 2.0601721669225594, "grad_norm": 0.16039521992206573, "learning_rate": 3.133069586285154e-05, "loss": 0.4709, "mean_token_accuracy": 0.8514722771942616, "num_tokens": 714631031.0, "step": 22392 }, { "entropy": 0.4965623782481998, "epoch": 2.0602641732940006, "grad_norm": 0.15368667244911194, "learning_rate": 3.132762903670991e-05, "loss": 0.4856, "mean_token_accuracy": 0.8464513421058655, "num_tokens": 714663147.0, "step": 22393 }, { "entropy": 0.42174591962248087, "epoch": 2.0603561796654417, "grad_norm": 0.15311302244663239, "learning_rate": 3.132456221056829e-05, "loss": 0.3992, "mean_token_accuracy": 0.8706614561378956, "num_tokens": 714694795.0, "step": 22394 }, { "entropy": 0.5514352219179273, "epoch": 2.060448186036883, "grad_norm": 0.16321536898612976, "learning_rate": 3.1321495384426657e-05, "loss": 0.5332, "mean_token_accuracy": 0.8286481238901615, "num_tokens": 714726772.0, "step": 22395 }, { "entropy": 0.463690223172307, "epoch": 2.0605401924083244, "grad_norm": 0.14942805469036102, "learning_rate": 3.131842855828503e-05, "loss": 0.4453, "mean_token_accuracy": 0.8577322103083134, "num_tokens": 714759121.0, "step": 22396 }, { "entropy": 0.4775157989934087, "epoch": 2.0606321987797656, "grad_norm": 0.15647388994693756, "learning_rate": 3.1315361732143406e-05, "loss": 0.466, "mean_token_accuracy": 0.851597860455513, "num_tokens": 714791148.0, "step": 22397 }, { "entropy": 0.539890231564641, "epoch": 2.0607242051512067, "grad_norm": 0.16301660239696503, "learning_rate": 3.131229490600178e-05, "loss": 0.5145, "mean_token_accuracy": 0.8379457108676434, "num_tokens": 714822240.0, "step": 22398 }, { "entropy": 0.4976618867367506, "epoch": 2.060816211522648, "grad_norm": 0.15466903150081635, "learning_rate": 3.1309228079860155e-05, "loss": 0.4756, "mean_token_accuracy": 0.8465052023530006, "num_tokens": 714853830.0, "step": 22399 }, { "entropy": 0.564931477420032, "epoch": 2.060908217894089, "grad_norm": 0.1680838018655777, "learning_rate": 3.130616125371853e-05, "loss": 0.5513, "mean_token_accuracy": 0.824127547442913, "num_tokens": 714885231.0, "step": 22400 }, { "entropy": 0.4699125150218606, "epoch": 2.0610002242655305, "grad_norm": 0.15676212310791016, "learning_rate": 3.1303094427576904e-05, "loss": 0.4623, "mean_token_accuracy": 0.8514115549623966, "num_tokens": 714916241.0, "step": 22401 }, { "entropy": 0.4332041274756193, "epoch": 2.0610922306369717, "grad_norm": 0.15040378272533417, "learning_rate": 3.130002760143528e-05, "loss": 0.4156, "mean_token_accuracy": 0.8670358844101429, "num_tokens": 714948381.0, "step": 22402 }, { "entropy": 0.48392294999212027, "epoch": 2.061184237008413, "grad_norm": 0.15592658519744873, "learning_rate": 3.129696077529365e-05, "loss": 0.4622, "mean_token_accuracy": 0.8520380519330502, "num_tokens": 714979719.0, "step": 22403 }, { "entropy": 0.46191028971225023, "epoch": 2.061276243379854, "grad_norm": 0.16202935576438904, "learning_rate": 3.129389394915203e-05, "loss": 0.4561, "mean_token_accuracy": 0.8580752834677696, "num_tokens": 715011399.0, "step": 22404 }, { "entropy": 0.5041541596874595, "epoch": 2.061368249751295, "grad_norm": 0.1531900316476822, "learning_rate": 3.1290827123010396e-05, "loss": 0.4979, "mean_token_accuracy": 0.8439702577888966, "num_tokens": 715043876.0, "step": 22405 }, { "entropy": 0.6533028418198228, "epoch": 2.0614602561227366, "grad_norm": 0.17110490798950195, "learning_rate": 3.128776029686877e-05, "loss": 0.6325, "mean_token_accuracy": 0.8022549673914909, "num_tokens": 715075727.0, "step": 22406 }, { "entropy": 0.5354153821244836, "epoch": 2.061552262494178, "grad_norm": 0.16457177698612213, "learning_rate": 3.1284693470727145e-05, "loss": 0.5235, "mean_token_accuracy": 0.8354162462055683, "num_tokens": 715106328.0, "step": 22407 }, { "entropy": 0.4898986164480448, "epoch": 2.061644268865619, "grad_norm": 0.15566405653953552, "learning_rate": 3.128162664458552e-05, "loss": 0.4699, "mean_token_accuracy": 0.8475886397063732, "num_tokens": 715138015.0, "step": 22408 }, { "entropy": 0.6066852752119303, "epoch": 2.06173627523706, "grad_norm": 0.16813671588897705, "learning_rate": 3.1278559818443895e-05, "loss": 0.5906, "mean_token_accuracy": 0.8165213577449322, "num_tokens": 715170580.0, "step": 22409 }, { "entropy": 0.47097474336624146, "epoch": 2.061828281608501, "grad_norm": 0.15913936495780945, "learning_rate": 3.127549299230227e-05, "loss": 0.4617, "mean_token_accuracy": 0.8525538519024849, "num_tokens": 715201974.0, "step": 22410 }, { "entropy": 0.5520768128335476, "epoch": 2.0619202879799428, "grad_norm": 0.16325248777866364, "learning_rate": 3.127242616616064e-05, "loss": 0.5271, "mean_token_accuracy": 0.8305477872490883, "num_tokens": 715233348.0, "step": 22411 }, { "entropy": 0.5772763779386878, "epoch": 2.062012294351384, "grad_norm": 0.16650116443634033, "learning_rate": 3.126935934001902e-05, "loss": 0.5562, "mean_token_accuracy": 0.8254686109721661, "num_tokens": 715264715.0, "step": 22412 }, { "entropy": 0.5242034252732992, "epoch": 2.062104300722825, "grad_norm": 0.16425809264183044, "learning_rate": 3.1266292513877387e-05, "loss": 0.5024, "mean_token_accuracy": 0.8422914184629917, "num_tokens": 715296165.0, "step": 22413 }, { "entropy": 0.5704994415864348, "epoch": 2.062196307094266, "grad_norm": 0.16543048620224, "learning_rate": 3.126322568773576e-05, "loss": 0.5607, "mean_token_accuracy": 0.8272164762020111, "num_tokens": 715328231.0, "step": 22414 }, { "entropy": 0.4723540502600372, "epoch": 2.0622883134657073, "grad_norm": 0.14768525958061218, "learning_rate": 3.1260158861594136e-05, "loss": 0.4472, "mean_token_accuracy": 0.85738505423069, "num_tokens": 715360205.0, "step": 22415 }, { "entropy": 0.6029770318418741, "epoch": 2.062380319837149, "grad_norm": 0.16959869861602783, "learning_rate": 3.125709203545251e-05, "loss": 0.5809, "mean_token_accuracy": 0.8157648220658302, "num_tokens": 715391204.0, "step": 22416 }, { "entropy": 0.5301998853683472, "epoch": 2.06247232620859, "grad_norm": 0.15594902634620667, "learning_rate": 3.1254025209310885e-05, "loss": 0.5138, "mean_token_accuracy": 0.8379315696656704, "num_tokens": 715423338.0, "step": 22417 }, { "entropy": 0.4423100329004228, "epoch": 2.062564332580031, "grad_norm": 0.1494518667459488, "learning_rate": 3.125095838316926e-05, "loss": 0.4249, "mean_token_accuracy": 0.863927137106657, "num_tokens": 715455126.0, "step": 22418 }, { "entropy": 0.4877754799090326, "epoch": 2.0626563389514723, "grad_norm": 0.15600061416625977, "learning_rate": 3.124789155702763e-05, "loss": 0.4709, "mean_token_accuracy": 0.8522830531001091, "num_tokens": 715487428.0, "step": 22419 }, { "entropy": 0.5350195169448853, "epoch": 2.0627483453229134, "grad_norm": 0.17236202955245972, "learning_rate": 3.124482473088601e-05, "loss": 0.5178, "mean_token_accuracy": 0.8391848541796207, "num_tokens": 715519231.0, "step": 22420 }, { "entropy": 0.49223579885438085, "epoch": 2.062840351694355, "grad_norm": 0.1567666083574295, "learning_rate": 3.1241757904744384e-05, "loss": 0.4752, "mean_token_accuracy": 0.8483807183802128, "num_tokens": 715551186.0, "step": 22421 }, { "entropy": 0.6320508811622858, "epoch": 2.062932358065796, "grad_norm": 0.17262163758277893, "learning_rate": 3.123869107860276e-05, "loss": 0.6119, "mean_token_accuracy": 0.8107421845197678, "num_tokens": 715582470.0, "step": 22422 }, { "entropy": 0.46372546534985304, "epoch": 2.0630243644372372, "grad_norm": 0.15769639611244202, "learning_rate": 3.123562425246113e-05, "loss": 0.4502, "mean_token_accuracy": 0.85587327927351, "num_tokens": 715614279.0, "step": 22423 }, { "entropy": 0.532630623318255, "epoch": 2.0631163708086784, "grad_norm": 0.1646023541688919, "learning_rate": 3.12325574263195e-05, "loss": 0.5252, "mean_token_accuracy": 0.8330168798565865, "num_tokens": 715646157.0, "step": 22424 }, { "entropy": 0.6710794754326344, "epoch": 2.0632083771801195, "grad_norm": 0.1748478263616562, "learning_rate": 3.122949060017788e-05, "loss": 0.6624, "mean_token_accuracy": 0.7922975271940231, "num_tokens": 715678380.0, "step": 22425 }, { "entropy": 0.5451125428080559, "epoch": 2.063300383551561, "grad_norm": 0.1687472015619278, "learning_rate": 3.122642377403625e-05, "loss": 0.5375, "mean_token_accuracy": 0.8308032378554344, "num_tokens": 715710502.0, "step": 22426 }, { "entropy": 0.5512479241006076, "epoch": 2.0633923899230022, "grad_norm": 0.16555604338645935, "learning_rate": 3.1223356947894625e-05, "loss": 0.5347, "mean_token_accuracy": 0.8323218747973442, "num_tokens": 715742529.0, "step": 22427 }, { "entropy": 0.5359931606799364, "epoch": 2.0634843962944434, "grad_norm": 0.16607928276062012, "learning_rate": 3.1220290121753e-05, "loss": 0.5217, "mean_token_accuracy": 0.8346541300415993, "num_tokens": 715774856.0, "step": 22428 }, { "entropy": 0.551836259663105, "epoch": 2.0635764026658845, "grad_norm": 0.16568945348262787, "learning_rate": 3.1217223295611374e-05, "loss": 0.5497, "mean_token_accuracy": 0.8247610218822956, "num_tokens": 715806882.0, "step": 22429 }, { "entropy": 0.5384911228902638, "epoch": 2.0636684090373256, "grad_norm": 0.16016843914985657, "learning_rate": 3.121415646946975e-05, "loss": 0.5318, "mean_token_accuracy": 0.8327582515776157, "num_tokens": 715839479.0, "step": 22430 }, { "entropy": 0.5757613591849804, "epoch": 2.063760415408767, "grad_norm": 0.16266348958015442, "learning_rate": 3.1211089643328123e-05, "loss": 0.5514, "mean_token_accuracy": 0.8279937878251076, "num_tokens": 715872106.0, "step": 22431 }, { "entropy": 0.49116116669029, "epoch": 2.0638524217802083, "grad_norm": 0.1549210250377655, "learning_rate": 3.120802281718649e-05, "loss": 0.4853, "mean_token_accuracy": 0.846547219902277, "num_tokens": 715904341.0, "step": 22432 }, { "entropy": 0.5252683805301785, "epoch": 2.0639444281516495, "grad_norm": 0.16295385360717773, "learning_rate": 3.120495599104487e-05, "loss": 0.5165, "mean_token_accuracy": 0.8351657204329967, "num_tokens": 715936308.0, "step": 22433 }, { "entropy": 0.4757167221978307, "epoch": 2.0640364345230906, "grad_norm": 0.15418560802936554, "learning_rate": 3.120188916490324e-05, "loss": 0.465, "mean_token_accuracy": 0.8514380380511284, "num_tokens": 715967716.0, "step": 22434 }, { "entropy": 0.5958537571132183, "epoch": 2.0641284408945317, "grad_norm": 0.16933032870292664, "learning_rate": 3.1198822338761615e-05, "loss": 0.5795, "mean_token_accuracy": 0.8142009750008583, "num_tokens": 715999537.0, "step": 22435 }, { "entropy": 0.4005924202501774, "epoch": 2.0642204472659733, "grad_norm": 0.1485927700996399, "learning_rate": 3.119575551261999e-05, "loss": 0.3851, "mean_token_accuracy": 0.876174371689558, "num_tokens": 716032136.0, "step": 22436 }, { "entropy": 0.6353486534208059, "epoch": 2.0643124536374144, "grad_norm": 0.17552897334098816, "learning_rate": 3.1192688686478365e-05, "loss": 0.6326, "mean_token_accuracy": 0.801180075854063, "num_tokens": 716064515.0, "step": 22437 }, { "entropy": 0.5009051105007529, "epoch": 2.0644044600088556, "grad_norm": 0.1502675563097, "learning_rate": 3.118962186033674e-05, "loss": 0.4759, "mean_token_accuracy": 0.8520999886095524, "num_tokens": 716097159.0, "step": 22438 }, { "entropy": 0.5069295112043619, "epoch": 2.0644964663802967, "grad_norm": 0.15520353615283966, "learning_rate": 3.1186555034195114e-05, "loss": 0.4992, "mean_token_accuracy": 0.8453173525631428, "num_tokens": 716129707.0, "step": 22439 }, { "entropy": 0.5127569725736976, "epoch": 2.064588472751738, "grad_norm": 0.15212012827396393, "learning_rate": 3.118348820805348e-05, "loss": 0.4838, "mean_token_accuracy": 0.8439176343381405, "num_tokens": 716161034.0, "step": 22440 }, { "entropy": 0.5786544680595398, "epoch": 2.0646804791231794, "grad_norm": 0.1655971109867096, "learning_rate": 3.118042138191186e-05, "loss": 0.5509, "mean_token_accuracy": 0.8250050432980061, "num_tokens": 716192973.0, "step": 22441 }, { "entropy": 0.517729289829731, "epoch": 2.0647724854946206, "grad_norm": 0.16353149712085724, "learning_rate": 3.117735455577023e-05, "loss": 0.494, "mean_token_accuracy": 0.8395944572985172, "num_tokens": 716224173.0, "step": 22442 }, { "entropy": 0.5472362842410803, "epoch": 2.0648644918660617, "grad_norm": 0.16626796126365662, "learning_rate": 3.117428772962861e-05, "loss": 0.5333, "mean_token_accuracy": 0.8306654207408428, "num_tokens": 716255074.0, "step": 22443 }, { "entropy": 0.586895908229053, "epoch": 2.064956498237503, "grad_norm": 0.16734614968299866, "learning_rate": 3.117122090348698e-05, "loss": 0.5669, "mean_token_accuracy": 0.8173216767609119, "num_tokens": 716286450.0, "step": 22444 }, { "entropy": 0.6168718761764467, "epoch": 2.065048504608944, "grad_norm": 0.16966307163238525, "learning_rate": 3.1168154077345355e-05, "loss": 0.6046, "mean_token_accuracy": 0.813806738704443, "num_tokens": 716318156.0, "step": 22445 }, { "entropy": 0.3942455002106726, "epoch": 2.0651405109803855, "grad_norm": 0.15066441893577576, "learning_rate": 3.116508725120373e-05, "loss": 0.3695, "mean_token_accuracy": 0.879535049200058, "num_tokens": 716349694.0, "step": 22446 }, { "entropy": 0.5600652685388923, "epoch": 2.0652325173518267, "grad_norm": 0.16673022508621216, "learning_rate": 3.1162020425062104e-05, "loss": 0.5489, "mean_token_accuracy": 0.8239256739616394, "num_tokens": 716382105.0, "step": 22447 }, { "entropy": 0.5762794241309166, "epoch": 2.065324523723268, "grad_norm": 0.16761209070682526, "learning_rate": 3.115895359892048e-05, "loss": 0.5708, "mean_token_accuracy": 0.8216730579733849, "num_tokens": 716414123.0, "step": 22448 }, { "entropy": 0.46910219732671976, "epoch": 2.065416530094709, "grad_norm": 0.15513013303279877, "learning_rate": 3.1155886772778854e-05, "loss": 0.4534, "mean_token_accuracy": 0.8526709824800491, "num_tokens": 716445469.0, "step": 22449 }, { "entropy": 0.5360219292342663, "epoch": 2.06550853646615, "grad_norm": 0.16732706129550934, "learning_rate": 3.115281994663722e-05, "loss": 0.5215, "mean_token_accuracy": 0.8376056961715221, "num_tokens": 716476758.0, "step": 22450 }, { "entropy": 0.5410167938098311, "epoch": 2.0656005428375916, "grad_norm": 0.16385437548160553, "learning_rate": 3.11497531204956e-05, "loss": 0.5358, "mean_token_accuracy": 0.8321725986897945, "num_tokens": 716508802.0, "step": 22451 }, { "entropy": 0.5382761433720589, "epoch": 2.065692549209033, "grad_norm": 0.166752889752388, "learning_rate": 3.114668629435398e-05, "loss": 0.5377, "mean_token_accuracy": 0.8333863392472267, "num_tokens": 716540086.0, "step": 22452 }, { "entropy": 0.5282694026827812, "epoch": 2.065784555580474, "grad_norm": 0.16046343743801117, "learning_rate": 3.1143619468212345e-05, "loss": 0.5183, "mean_token_accuracy": 0.8386684730648994, "num_tokens": 716572163.0, "step": 22453 }, { "entropy": 0.5223869381006807, "epoch": 2.065876561951915, "grad_norm": 0.16164399683475494, "learning_rate": 3.114055264207073e-05, "loss": 0.5032, "mean_token_accuracy": 0.8424283526837826, "num_tokens": 716603951.0, "step": 22454 }, { "entropy": 0.5571662718430161, "epoch": 2.065968568323356, "grad_norm": 0.16532984375953674, "learning_rate": 3.1137485815929095e-05, "loss": 0.5321, "mean_token_accuracy": 0.8316881284117699, "num_tokens": 716635170.0, "step": 22455 }, { "entropy": 0.5594559544697404, "epoch": 2.0660605746947978, "grad_norm": 0.16906294226646423, "learning_rate": 3.1134418989787476e-05, "loss": 0.5592, "mean_token_accuracy": 0.8213167674839497, "num_tokens": 716666760.0, "step": 22456 }, { "entropy": 0.6186505607329309, "epoch": 2.066152581066239, "grad_norm": 0.17043675482273102, "learning_rate": 3.1131352163645844e-05, "loss": 0.6004, "mean_token_accuracy": 0.8117261789739132, "num_tokens": 716698769.0, "step": 22457 }, { "entropy": 0.4464999372139573, "epoch": 2.06624458743768, "grad_norm": 0.14978939294815063, "learning_rate": 3.112828533750422e-05, "loss": 0.4254, "mean_token_accuracy": 0.8637266829609871, "num_tokens": 716730616.0, "step": 22458 }, { "entropy": 0.4716324945911765, "epoch": 2.066336593809121, "grad_norm": 0.15137144923210144, "learning_rate": 3.112521851136259e-05, "loss": 0.4498, "mean_token_accuracy": 0.8571335934102535, "num_tokens": 716762696.0, "step": 22459 }, { "entropy": 0.5493847243487835, "epoch": 2.0664286001805623, "grad_norm": 0.15760335326194763, "learning_rate": 3.112215168522097e-05, "loss": 0.5301, "mean_token_accuracy": 0.8329585418105125, "num_tokens": 716795062.0, "step": 22460 }, { "entropy": 0.5917806699872017, "epoch": 2.066520606552004, "grad_norm": 0.16709668934345245, "learning_rate": 3.111908485907934e-05, "loss": 0.5773, "mean_token_accuracy": 0.8219651840627193, "num_tokens": 716827012.0, "step": 22461 }, { "entropy": 0.48587752506136894, "epoch": 2.066612612923445, "grad_norm": 0.14999912679195404, "learning_rate": 3.111601803293772e-05, "loss": 0.4648, "mean_token_accuracy": 0.850292693823576, "num_tokens": 716858998.0, "step": 22462 }, { "entropy": 0.6029048915952444, "epoch": 2.066704619294886, "grad_norm": 0.1604674607515335, "learning_rate": 3.1112951206796085e-05, "loss": 0.5791, "mean_token_accuracy": 0.8167681694030762, "num_tokens": 716891305.0, "step": 22463 }, { "entropy": 0.5323959300294518, "epoch": 2.0667966256663273, "grad_norm": 0.15953059494495392, "learning_rate": 3.1109884380654467e-05, "loss": 0.516, "mean_token_accuracy": 0.8351245671510696, "num_tokens": 716924073.0, "step": 22464 }, { "entropy": 0.5686063803732395, "epoch": 2.0668886320377684, "grad_norm": 0.16538891196250916, "learning_rate": 3.1106817554512834e-05, "loss": 0.5372, "mean_token_accuracy": 0.82938352227211, "num_tokens": 716955065.0, "step": 22465 }, { "entropy": 0.5199263854883611, "epoch": 2.06698063840921, "grad_norm": 0.16411985456943512, "learning_rate": 3.110375072837121e-05, "loss": 0.5061, "mean_token_accuracy": 0.8388587161898613, "num_tokens": 716986848.0, "step": 22466 }, { "entropy": 0.546479613520205, "epoch": 2.067072644780651, "grad_norm": 0.170152485370636, "learning_rate": 3.1100683902229584e-05, "loss": 0.5317, "mean_token_accuracy": 0.8315850682556629, "num_tokens": 717018762.0, "step": 22467 }, { "entropy": 0.5418340917676687, "epoch": 2.0671646511520922, "grad_norm": 0.1670083850622177, "learning_rate": 3.109761707608796e-05, "loss": 0.528, "mean_token_accuracy": 0.8298650272190571, "num_tokens": 717050178.0, "step": 22468 }, { "entropy": 0.4321117168292403, "epoch": 2.0672566575235334, "grad_norm": 0.15199756622314453, "learning_rate": 3.109455024994633e-05, "loss": 0.4252, "mean_token_accuracy": 0.8651282526552677, "num_tokens": 717081510.0, "step": 22469 }, { "entropy": 0.5142446858808398, "epoch": 2.0673486638949745, "grad_norm": 0.16154780983924866, "learning_rate": 3.109148342380471e-05, "loss": 0.4958, "mean_token_accuracy": 0.8410725072026253, "num_tokens": 717113951.0, "step": 22470 }, { "entropy": 0.5839595561847091, "epoch": 2.067440670266416, "grad_norm": 0.16555598378181458, "learning_rate": 3.1088416597663076e-05, "loss": 0.5648, "mean_token_accuracy": 0.8214712254703045, "num_tokens": 717145682.0, "step": 22471 }, { "entropy": 0.598362653516233, "epoch": 2.0675326766378572, "grad_norm": 0.17111924290657043, "learning_rate": 3.108534977152146e-05, "loss": 0.5882, "mean_token_accuracy": 0.8164033032953739, "num_tokens": 717176896.0, "step": 22472 }, { "entropy": 0.5165843789000064, "epoch": 2.0676246830092984, "grad_norm": 0.16060616075992584, "learning_rate": 3.1082282945379825e-05, "loss": 0.502, "mean_token_accuracy": 0.8396940380334854, "num_tokens": 717208519.0, "step": 22473 }, { "entropy": 0.49385131895542145, "epoch": 2.0677166893807395, "grad_norm": 0.16013973951339722, "learning_rate": 3.10792161192382e-05, "loss": 0.4856, "mean_token_accuracy": 0.8466161638498306, "num_tokens": 717240522.0, "step": 22474 }, { "entropy": 0.5284152792301029, "epoch": 2.0678086957521806, "grad_norm": 0.1694606989622116, "learning_rate": 3.1076149293096574e-05, "loss": 0.5219, "mean_token_accuracy": 0.8332427479326725, "num_tokens": 717272660.0, "step": 22475 }, { "entropy": 0.5280456398613751, "epoch": 2.067900702123622, "grad_norm": 0.16228750348091125, "learning_rate": 3.107308246695495e-05, "loss": 0.5228, "mean_token_accuracy": 0.8351113796234131, "num_tokens": 717304733.0, "step": 22476 }, { "entropy": 0.4900655159726739, "epoch": 2.0679927084950633, "grad_norm": 0.14869913458824158, "learning_rate": 3.1070015640813323e-05, "loss": 0.4766, "mean_token_accuracy": 0.8494806662201881, "num_tokens": 717337330.0, "step": 22477 }, { "entropy": 0.5890136391390115, "epoch": 2.0680847148665045, "grad_norm": 0.17480535805225372, "learning_rate": 3.10669488146717e-05, "loss": 0.588, "mean_token_accuracy": 0.8223715424537659, "num_tokens": 717368575.0, "step": 22478 }, { "entropy": 0.5428223749622703, "epoch": 2.0681767212379456, "grad_norm": 0.16297097504138947, "learning_rate": 3.1063881988530066e-05, "loss": 0.5207, "mean_token_accuracy": 0.8337548226118088, "num_tokens": 717400243.0, "step": 22479 }, { "entropy": 0.4358354303985834, "epoch": 2.0682687276093867, "grad_norm": 0.15011857450008392, "learning_rate": 3.106081516238845e-05, "loss": 0.4234, "mean_token_accuracy": 0.8639388494193554, "num_tokens": 717432598.0, "step": 22480 }, { "entropy": 0.5394505299627781, "epoch": 2.0683607339808283, "grad_norm": 0.1673029214143753, "learning_rate": 3.1057748336246815e-05, "loss": 0.5308, "mean_token_accuracy": 0.831534132361412, "num_tokens": 717464101.0, "step": 22481 }, { "entropy": 0.48384127859026194, "epoch": 2.0684527403522694, "grad_norm": 0.1600276678800583, "learning_rate": 3.10546815101052e-05, "loss": 0.4742, "mean_token_accuracy": 0.8501194678246975, "num_tokens": 717496122.0, "step": 22482 }, { "entropy": 0.5895882314071059, "epoch": 2.0685447467237106, "grad_norm": 0.1616256684064865, "learning_rate": 3.105161468396357e-05, "loss": 0.5733, "mean_token_accuracy": 0.8189368173480034, "num_tokens": 717528354.0, "step": 22483 }, { "entropy": 0.3987171412445605, "epoch": 2.0686367530951517, "grad_norm": 0.1442752182483673, "learning_rate": 3.104854785782194e-05, "loss": 0.3811, "mean_token_accuracy": 0.8769692145287991, "num_tokens": 717560712.0, "step": 22484 }, { "entropy": 0.5843355171382427, "epoch": 2.068728759466593, "grad_norm": 0.16552190482616425, "learning_rate": 3.104548103168032e-05, "loss": 0.5734, "mean_token_accuracy": 0.8190691694617271, "num_tokens": 717593095.0, "step": 22485 }, { "entropy": 0.5701667293906212, "epoch": 2.0688207658380344, "grad_norm": 0.16811543703079224, "learning_rate": 3.104241420553869e-05, "loss": 0.5509, "mean_token_accuracy": 0.8266247548162937, "num_tokens": 717625204.0, "step": 22486 }, { "entropy": 0.5900323418900371, "epoch": 2.0689127722094756, "grad_norm": 0.1709301471710205, "learning_rate": 3.103934737939706e-05, "loss": 0.5654, "mean_token_accuracy": 0.8208187073469162, "num_tokens": 717656229.0, "step": 22487 }, { "entropy": 0.5735253896564245, "epoch": 2.0690047785809167, "grad_norm": 0.1689765751361847, "learning_rate": 3.103628055325544e-05, "loss": 0.571, "mean_token_accuracy": 0.8206015080213547, "num_tokens": 717687881.0, "step": 22488 }, { "entropy": 0.49999058712273836, "epoch": 2.069096784952358, "grad_norm": 0.16199040412902832, "learning_rate": 3.103321372711381e-05, "loss": 0.4785, "mean_token_accuracy": 0.8448176011443138, "num_tokens": 717718402.0, "step": 22489 }, { "entropy": 0.5848490400239825, "epoch": 2.069188791323799, "grad_norm": 0.1653970181941986, "learning_rate": 3.103014690097219e-05, "loss": 0.5605, "mean_token_accuracy": 0.8270043805241585, "num_tokens": 717749669.0, "step": 22490 }, { "entropy": 0.4365455647930503, "epoch": 2.0692807976952405, "grad_norm": 0.1509149968624115, "learning_rate": 3.102708007483056e-05, "loss": 0.4145, "mean_token_accuracy": 0.8685203455388546, "num_tokens": 717782127.0, "step": 22491 }, { "entropy": 0.48995241522789, "epoch": 2.0693728040666817, "grad_norm": 0.1505817174911499, "learning_rate": 3.102401324868893e-05, "loss": 0.4749, "mean_token_accuracy": 0.8454425111413002, "num_tokens": 717814142.0, "step": 22492 }, { "entropy": 0.5432414263486862, "epoch": 2.069464810438123, "grad_norm": 0.15883338451385498, "learning_rate": 3.102094642254731e-05, "loss": 0.5251, "mean_token_accuracy": 0.8344897218048573, "num_tokens": 717845631.0, "step": 22493 }, { "entropy": 0.5272060660645366, "epoch": 2.069556816809564, "grad_norm": 0.15883173048496246, "learning_rate": 3.101787959640568e-05, "loss": 0.5046, "mean_token_accuracy": 0.8416201025247574, "num_tokens": 717877701.0, "step": 22494 }, { "entropy": 0.5643887128680944, "epoch": 2.069648823181005, "grad_norm": 0.16618569195270538, "learning_rate": 3.1014812770264053e-05, "loss": 0.5458, "mean_token_accuracy": 0.8311862722039223, "num_tokens": 717909768.0, "step": 22495 }, { "entropy": 0.6261502122506499, "epoch": 2.0697408295524466, "grad_norm": 0.17506273090839386, "learning_rate": 3.101174594412243e-05, "loss": 0.6154, "mean_token_accuracy": 0.8058929294347763, "num_tokens": 717941271.0, "step": 22496 }, { "entropy": 0.5153543595224619, "epoch": 2.069832835923888, "grad_norm": 0.16307462751865387, "learning_rate": 3.10086791179808e-05, "loss": 0.5036, "mean_token_accuracy": 0.8428578749299049, "num_tokens": 717973065.0, "step": 22497 }, { "entropy": 0.4860964473336935, "epoch": 2.069924842295329, "grad_norm": 0.15724128484725952, "learning_rate": 3.100561229183918e-05, "loss": 0.4799, "mean_token_accuracy": 0.8471849076449871, "num_tokens": 718005833.0, "step": 22498 }, { "entropy": 0.5496584116481245, "epoch": 2.07001684866677, "grad_norm": 0.16152030229568481, "learning_rate": 3.100254546569755e-05, "loss": 0.5331, "mean_token_accuracy": 0.8286403119564056, "num_tokens": 718037737.0, "step": 22499 }, { "entropy": 0.5758309923112392, "epoch": 2.070108855038211, "grad_norm": 0.16685467958450317, "learning_rate": 3.099947863955593e-05, "loss": 0.5582, "mean_token_accuracy": 0.8217999041080475, "num_tokens": 718069742.0, "step": 22500 }, { "entropy": 0.6300980467349291, "epoch": 2.0702008614096528, "grad_norm": 0.17819921672344208, "learning_rate": 3.09964118134143e-05, "loss": 0.6208, "mean_token_accuracy": 0.8024071604013443, "num_tokens": 718101920.0, "step": 22501 }, { "entropy": 0.4480118490755558, "epoch": 2.070292867781094, "grad_norm": 0.15738900005817413, "learning_rate": 3.099334498727267e-05, "loss": 0.4342, "mean_token_accuracy": 0.8601987808942795, "num_tokens": 718133607.0, "step": 22502 }, { "entropy": 0.4615822425112128, "epoch": 2.070384874152535, "grad_norm": 0.15276533365249634, "learning_rate": 3.099027816113105e-05, "loss": 0.4461, "mean_token_accuracy": 0.8593147583305836, "num_tokens": 718164955.0, "step": 22503 }, { "entropy": 0.5609776983037591, "epoch": 2.070476880523976, "grad_norm": 0.16820675134658813, "learning_rate": 3.098721133498942e-05, "loss": 0.5423, "mean_token_accuracy": 0.8299048617482185, "num_tokens": 718196612.0, "step": 22504 }, { "entropy": 0.5248153731226921, "epoch": 2.0705688868954173, "grad_norm": 0.1595345139503479, "learning_rate": 3.098414450884779e-05, "loss": 0.5109, "mean_token_accuracy": 0.8364371843636036, "num_tokens": 718228798.0, "step": 22505 }, { "entropy": 0.5986238839104772, "epoch": 2.070660893266859, "grad_norm": 0.1714630126953125, "learning_rate": 3.098107768270617e-05, "loss": 0.5871, "mean_token_accuracy": 0.8130847997963428, "num_tokens": 718260767.0, "step": 22506 }, { "entropy": 0.437597269192338, "epoch": 2.0707528996383, "grad_norm": 0.1548762172460556, "learning_rate": 3.097801085656454e-05, "loss": 0.4275, "mean_token_accuracy": 0.8650286644697189, "num_tokens": 718291952.0, "step": 22507 }, { "entropy": 0.5291469970252365, "epoch": 2.070844906009741, "grad_norm": 0.1716245859861374, "learning_rate": 3.097494403042292e-05, "loss": 0.516, "mean_token_accuracy": 0.8372568488121033, "num_tokens": 718323493.0, "step": 22508 }, { "entropy": 0.4732934460043907, "epoch": 2.0709369123811823, "grad_norm": 0.15529221296310425, "learning_rate": 3.097187720428129e-05, "loss": 0.4676, "mean_token_accuracy": 0.8509267903864384, "num_tokens": 718355370.0, "step": 22509 }, { "entropy": 0.5190760064870119, "epoch": 2.0710289187526234, "grad_norm": 0.16269822418689728, "learning_rate": 3.096881037813966e-05, "loss": 0.5066, "mean_token_accuracy": 0.8401665985584259, "num_tokens": 718387786.0, "step": 22510 }, { "entropy": 0.5523649908136576, "epoch": 2.071120925124065, "grad_norm": 0.16242070496082306, "learning_rate": 3.096574355199804e-05, "loss": 0.5503, "mean_token_accuracy": 0.8291402012109756, "num_tokens": 718420554.0, "step": 22511 }, { "entropy": 0.61929683201015, "epoch": 2.071212931495506, "grad_norm": 0.17526674270629883, "learning_rate": 3.0962676725856416e-05, "loss": 0.6141, "mean_token_accuracy": 0.808822151273489, "num_tokens": 718452655.0, "step": 22512 }, { "entropy": 0.6273379642516375, "epoch": 2.0713049378669472, "grad_norm": 0.17049720883369446, "learning_rate": 3.0959609899714784e-05, "loss": 0.6112, "mean_token_accuracy": 0.8092010729014874, "num_tokens": 718484870.0, "step": 22513 }, { "entropy": 0.5088786708656698, "epoch": 2.0713969442383884, "grad_norm": 0.15580791234970093, "learning_rate": 3.0956543073573165e-05, "loss": 0.4904, "mean_token_accuracy": 0.8454614542424679, "num_tokens": 718516951.0, "step": 22514 }, { "entropy": 0.452512483112514, "epoch": 2.0714889506098295, "grad_norm": 0.15371684730052948, "learning_rate": 3.095347624743153e-05, "loss": 0.4362, "mean_token_accuracy": 0.8617212250828743, "num_tokens": 718549014.0, "step": 22515 }, { "entropy": 0.5258276101667434, "epoch": 2.071580956981271, "grad_norm": 0.1569945365190506, "learning_rate": 3.0950409421289914e-05, "loss": 0.5033, "mean_token_accuracy": 0.8409387692809105, "num_tokens": 718580944.0, "step": 22516 }, { "entropy": 0.572980772703886, "epoch": 2.0716729633527122, "grad_norm": 0.16629423201084137, "learning_rate": 3.094734259514828e-05, "loss": 0.5584, "mean_token_accuracy": 0.8263727277517319, "num_tokens": 718612227.0, "step": 22517 }, { "entropy": 0.656570291146636, "epoch": 2.0717649697241534, "grad_norm": 0.17531004548072815, "learning_rate": 3.094427576900666e-05, "loss": 0.6237, "mean_token_accuracy": 0.8016046658158302, "num_tokens": 718643716.0, "step": 22518 }, { "entropy": 0.55153464153409, "epoch": 2.0718569760955945, "grad_norm": 0.16713915765285492, "learning_rate": 3.094120894286503e-05, "loss": 0.5386, "mean_token_accuracy": 0.8286857530474663, "num_tokens": 718674911.0, "step": 22519 }, { "entropy": 0.4894107412546873, "epoch": 2.0719489824670356, "grad_norm": 0.155349999666214, "learning_rate": 3.0938142116723406e-05, "loss": 0.4878, "mean_token_accuracy": 0.8487933278083801, "num_tokens": 718706549.0, "step": 22520 }, { "entropy": 0.53153245896101, "epoch": 2.072040988838477, "grad_norm": 0.1574290543794632, "learning_rate": 3.093507529058178e-05, "loss": 0.5186, "mean_token_accuracy": 0.8356811180710793, "num_tokens": 718738437.0, "step": 22521 }, { "entropy": 0.5922348275780678, "epoch": 2.0721329952099183, "grad_norm": 0.16618651151657104, "learning_rate": 3.0932008464440155e-05, "loss": 0.5677, "mean_token_accuracy": 0.8215662278234959, "num_tokens": 718770473.0, "step": 22522 }, { "entropy": 0.47837487049400806, "epoch": 2.0722250015813595, "grad_norm": 0.157260000705719, "learning_rate": 3.092894163829852e-05, "loss": 0.4523, "mean_token_accuracy": 0.8555097654461861, "num_tokens": 718802291.0, "step": 22523 }, { "entropy": 0.4976952946744859, "epoch": 2.0723170079528006, "grad_norm": 0.15119726955890656, "learning_rate": 3.0925874812156905e-05, "loss": 0.4745, "mean_token_accuracy": 0.8489757291972637, "num_tokens": 718834287.0, "step": 22524 }, { "entropy": 0.4965582387521863, "epoch": 2.0724090143242417, "grad_norm": 0.15735697746276855, "learning_rate": 3.092280798601527e-05, "loss": 0.4641, "mean_token_accuracy": 0.8526610843837261, "num_tokens": 718865991.0, "step": 22525 }, { "entropy": 0.5044826925732195, "epoch": 2.0725010206956833, "grad_norm": 0.1608879417181015, "learning_rate": 3.091974115987365e-05, "loss": 0.4957, "mean_token_accuracy": 0.8410166949033737, "num_tokens": 718898251.0, "step": 22526 }, { "entropy": 0.5668950788676739, "epoch": 2.0725930270671244, "grad_norm": 0.17147494852542877, "learning_rate": 3.091667433373202e-05, "loss": 0.5641, "mean_token_accuracy": 0.823049996048212, "num_tokens": 718930207.0, "step": 22527 }, { "entropy": 0.530939313583076, "epoch": 2.0726850334385656, "grad_norm": 0.16229519248008728, "learning_rate": 3.0913607507590397e-05, "loss": 0.514, "mean_token_accuracy": 0.8373416773974895, "num_tokens": 718961725.0, "step": 22528 }, { "entropy": 0.4584774738177657, "epoch": 2.0727770398100067, "grad_norm": 0.15550482273101807, "learning_rate": 3.091054068144877e-05, "loss": 0.4378, "mean_token_accuracy": 0.8574099577963352, "num_tokens": 718994225.0, "step": 22529 }, { "entropy": 0.5272893439978361, "epoch": 2.072869046181448, "grad_norm": 0.16496379673480988, "learning_rate": 3.0907473855307146e-05, "loss": 0.5088, "mean_token_accuracy": 0.8346210047602654, "num_tokens": 719026017.0, "step": 22530 }, { "entropy": 0.44138250476680696, "epoch": 2.0729610525528894, "grad_norm": 0.14939987659454346, "learning_rate": 3.0904407029165514e-05, "loss": 0.419, "mean_token_accuracy": 0.8668557740747929, "num_tokens": 719057625.0, "step": 22531 }, { "entropy": 0.5541886482387781, "epoch": 2.0730530589243306, "grad_norm": 0.15959087014198303, "learning_rate": 3.0901340203023895e-05, "loss": 0.5484, "mean_token_accuracy": 0.8277806490659714, "num_tokens": 719089978.0, "step": 22532 }, { "entropy": 0.4733476359397173, "epoch": 2.0731450652957717, "grad_norm": 0.15646299719810486, "learning_rate": 3.089827337688226e-05, "loss": 0.4701, "mean_token_accuracy": 0.8494286574423313, "num_tokens": 719122155.0, "step": 22533 }, { "entropy": 0.6280725114047527, "epoch": 2.073237071667213, "grad_norm": 0.16958780586719513, "learning_rate": 3.089520655074064e-05, "loss": 0.6227, "mean_token_accuracy": 0.8039645813405514, "num_tokens": 719154467.0, "step": 22534 }, { "entropy": 0.6322058103978634, "epoch": 2.073329078038654, "grad_norm": 0.1691163182258606, "learning_rate": 3.089213972459901e-05, "loss": 0.6134, "mean_token_accuracy": 0.8081145659089088, "num_tokens": 719186993.0, "step": 22535 }, { "entropy": 0.5669971024617553, "epoch": 2.0734210844100955, "grad_norm": 0.16824273765087128, "learning_rate": 3.088907289845739e-05, "loss": 0.543, "mean_token_accuracy": 0.8271967433393002, "num_tokens": 719218894.0, "step": 22536 }, { "entropy": 0.4245100733824074, "epoch": 2.0735130907815367, "grad_norm": 0.1477014273405075, "learning_rate": 3.088600607231576e-05, "loss": 0.4095, "mean_token_accuracy": 0.8681325316429138, "num_tokens": 719251533.0, "step": 22537 }, { "entropy": 0.4722290802747011, "epoch": 2.073605097152978, "grad_norm": 0.1517152041196823, "learning_rate": 3.0882939246174136e-05, "loss": 0.4533, "mean_token_accuracy": 0.854509100317955, "num_tokens": 719283826.0, "step": 22538 }, { "entropy": 0.5429545028600842, "epoch": 2.073697103524419, "grad_norm": 0.17009182274341583, "learning_rate": 3.0879872420032504e-05, "loss": 0.5306, "mean_token_accuracy": 0.8359270095825195, "num_tokens": 719316232.0, "step": 22539 }, { "entropy": 0.4358648834750056, "epoch": 2.07378910989586, "grad_norm": 0.15690799057483673, "learning_rate": 3.0876805593890886e-05, "loss": 0.4256, "mean_token_accuracy": 0.8621373698115349, "num_tokens": 719348275.0, "step": 22540 }, { "entropy": 0.436158403288573, "epoch": 2.0738811162673016, "grad_norm": 0.15620774030685425, "learning_rate": 3.0873738767749253e-05, "loss": 0.4238, "mean_token_accuracy": 0.8623386211693287, "num_tokens": 719380261.0, "step": 22541 }, { "entropy": 0.5600282177329063, "epoch": 2.073973122638743, "grad_norm": 0.16308076679706573, "learning_rate": 3.0870671941607635e-05, "loss": 0.544, "mean_token_accuracy": 0.8287603929638863, "num_tokens": 719412426.0, "step": 22542 }, { "entropy": 0.49678672943264246, "epoch": 2.074065129010184, "grad_norm": 0.15605904161930084, "learning_rate": 3.086760511546601e-05, "loss": 0.4815, "mean_token_accuracy": 0.8449519723653793, "num_tokens": 719444202.0, "step": 22543 }, { "entropy": 0.45340087078511715, "epoch": 2.074157135381625, "grad_norm": 0.15449485182762146, "learning_rate": 3.086453828932438e-05, "loss": 0.4423, "mean_token_accuracy": 0.8567115440964699, "num_tokens": 719476342.0, "step": 22544 }, { "entropy": 0.4043725626543164, "epoch": 2.074249141753066, "grad_norm": 0.1444244384765625, "learning_rate": 3.086147146318276e-05, "loss": 0.3671, "mean_token_accuracy": 0.8785021789371967, "num_tokens": 719506992.0, "step": 22545 }, { "entropy": 0.5464800205081701, "epoch": 2.0743411481245078, "grad_norm": 0.16348131000995636, "learning_rate": 3.085840463704113e-05, "loss": 0.5224, "mean_token_accuracy": 0.836534708738327, "num_tokens": 719538750.0, "step": 22546 }, { "entropy": 0.5504935719072819, "epoch": 2.074433154495949, "grad_norm": 0.16544227302074432, "learning_rate": 3.08553378108995e-05, "loss": 0.528, "mean_token_accuracy": 0.8326019532978535, "num_tokens": 719570260.0, "step": 22547 }, { "entropy": 0.594648003578186, "epoch": 2.07452516086739, "grad_norm": 0.1658642590045929, "learning_rate": 3.0852270984757876e-05, "loss": 0.5839, "mean_token_accuracy": 0.8184863887727261, "num_tokens": 719602573.0, "step": 22548 }, { "entropy": 0.5553689356893301, "epoch": 2.074617167238831, "grad_norm": 0.16967372596263885, "learning_rate": 3.084920415861625e-05, "loss": 0.5495, "mean_token_accuracy": 0.8286796770989895, "num_tokens": 719633889.0, "step": 22549 }, { "entropy": 0.5578251518309116, "epoch": 2.0747091736102723, "grad_norm": 0.16687436401844025, "learning_rate": 3.0846137332474625e-05, "loss": 0.5454, "mean_token_accuracy": 0.829148668795824, "num_tokens": 719666439.0, "step": 22550 }, { "entropy": 0.5057460945099592, "epoch": 2.074801179981714, "grad_norm": 0.16621002554893494, "learning_rate": 3.0843070506333e-05, "loss": 0.5024, "mean_token_accuracy": 0.840907346457243, "num_tokens": 719698004.0, "step": 22551 }, { "entropy": 0.5010785087943077, "epoch": 2.074893186353155, "grad_norm": 0.161811962723732, "learning_rate": 3.084000368019137e-05, "loss": 0.4951, "mean_token_accuracy": 0.845108263194561, "num_tokens": 719730329.0, "step": 22552 }, { "entropy": 0.5685391016304493, "epoch": 2.074985192724596, "grad_norm": 0.16631820797920227, "learning_rate": 3.083693685404975e-05, "loss": 0.5627, "mean_token_accuracy": 0.8251144029200077, "num_tokens": 719762573.0, "step": 22553 }, { "entropy": 0.5267471056431532, "epoch": 2.0750771990960373, "grad_norm": 0.16545510292053223, "learning_rate": 3.083387002790812e-05, "loss": 0.5054, "mean_token_accuracy": 0.8386750258505344, "num_tokens": 719795015.0, "step": 22554 }, { "entropy": 0.5679234396666288, "epoch": 2.0751692054674784, "grad_norm": 0.16714540123939514, "learning_rate": 3.083080320176649e-05, "loss": 0.5578, "mean_token_accuracy": 0.8273204974830151, "num_tokens": 719827286.0, "step": 22555 }, { "entropy": 0.5935678454115987, "epoch": 2.07526121183892, "grad_norm": 0.16623583436012268, "learning_rate": 3.0827736375624866e-05, "loss": 0.5583, "mean_token_accuracy": 0.8237094059586525, "num_tokens": 719859543.0, "step": 22556 }, { "entropy": 0.5299446526914835, "epoch": 2.075353218210361, "grad_norm": 0.15902763605117798, "learning_rate": 3.082466954948324e-05, "loss": 0.5155, "mean_token_accuracy": 0.8349569737911224, "num_tokens": 719891238.0, "step": 22557 }, { "entropy": 0.45986591232940555, "epoch": 2.0754452245818023, "grad_norm": 0.15679100155830383, "learning_rate": 3.0821602723341616e-05, "loss": 0.4359, "mean_token_accuracy": 0.8618350178003311, "num_tokens": 719923351.0, "step": 22558 }, { "entropy": 0.5146314166486263, "epoch": 2.0755372309532434, "grad_norm": 0.15602745115756989, "learning_rate": 3.081853589719999e-05, "loss": 0.4965, "mean_token_accuracy": 0.8418434336781502, "num_tokens": 719955244.0, "step": 22559 }, { "entropy": 0.5436616563238204, "epoch": 2.0756292373246845, "grad_norm": 0.16312162578105927, "learning_rate": 3.0815469071058365e-05, "loss": 0.5265, "mean_token_accuracy": 0.832718800753355, "num_tokens": 719987061.0, "step": 22560 }, { "entropy": 0.5123800367582589, "epoch": 2.075721243696126, "grad_norm": 0.1685447245836258, "learning_rate": 3.081240224491674e-05, "loss": 0.4945, "mean_token_accuracy": 0.8403621837496758, "num_tokens": 720018462.0, "step": 22561 }, { "entropy": 0.5181693257763982, "epoch": 2.0758132500675672, "grad_norm": 0.16140618920326233, "learning_rate": 3.080933541877511e-05, "loss": 0.4997, "mean_token_accuracy": 0.8391697742044926, "num_tokens": 720049823.0, "step": 22562 }, { "entropy": 0.5568770859390497, "epoch": 2.0759052564390084, "grad_norm": 0.16340476274490356, "learning_rate": 3.080626859263349e-05, "loss": 0.5273, "mean_token_accuracy": 0.8328065797686577, "num_tokens": 720081545.0, "step": 22563 }, { "entropy": 0.4919820027425885, "epoch": 2.0759972628104495, "grad_norm": 0.15959589183330536, "learning_rate": 3.080320176649186e-05, "loss": 0.4823, "mean_token_accuracy": 0.848013024777174, "num_tokens": 720113886.0, "step": 22564 }, { "entropy": 0.4787563467398286, "epoch": 2.0760892691818906, "grad_norm": 0.1581002175807953, "learning_rate": 3.080013494035023e-05, "loss": 0.4638, "mean_token_accuracy": 0.8548755459487438, "num_tokens": 720145538.0, "step": 22565 }, { "entropy": 0.5870666615664959, "epoch": 2.076181275553332, "grad_norm": 0.16676996648311615, "learning_rate": 3.0797068114208606e-05, "loss": 0.5698, "mean_token_accuracy": 0.8229273520410061, "num_tokens": 720177311.0, "step": 22566 }, { "entropy": 0.4627276798710227, "epoch": 2.0762732819247733, "grad_norm": 0.15415510535240173, "learning_rate": 3.079400128806698e-05, "loss": 0.4466, "mean_token_accuracy": 0.8571675643324852, "num_tokens": 720209673.0, "step": 22567 }, { "entropy": 0.5576327573508024, "epoch": 2.0763652882962145, "grad_norm": 0.15984414517879486, "learning_rate": 3.0790934461925355e-05, "loss": 0.538, "mean_token_accuracy": 0.8280765786767006, "num_tokens": 720241061.0, "step": 22568 }, { "entropy": 0.4806949719786644, "epoch": 2.0764572946676556, "grad_norm": 0.15968336164951324, "learning_rate": 3.078786763578373e-05, "loss": 0.4604, "mean_token_accuracy": 0.8499222733080387, "num_tokens": 720272598.0, "step": 22569 }, { "entropy": 0.48153159907087684, "epoch": 2.0765493010390967, "grad_norm": 0.16090616583824158, "learning_rate": 3.07848008096421e-05, "loss": 0.4711, "mean_token_accuracy": 0.8494507968425751, "num_tokens": 720303933.0, "step": 22570 }, { "entropy": 0.5023899609223008, "epoch": 2.0766413074105383, "grad_norm": 0.15855565667152405, "learning_rate": 3.078173398350048e-05, "loss": 0.4806, "mean_token_accuracy": 0.8449181020259857, "num_tokens": 720335889.0, "step": 22571 }, { "entropy": 0.5656631216406822, "epoch": 2.0767333137819795, "grad_norm": 0.16095690429210663, "learning_rate": 3.077866715735885e-05, "loss": 0.5499, "mean_token_accuracy": 0.8260751999914646, "num_tokens": 720368038.0, "step": 22572 }, { "entropy": 0.5480859586969018, "epoch": 2.0768253201534206, "grad_norm": 0.16360196471214294, "learning_rate": 3.077560033121722e-05, "loss": 0.5498, "mean_token_accuracy": 0.8264410495758057, "num_tokens": 720400150.0, "step": 22573 }, { "entropy": 0.5535930935293436, "epoch": 2.0769173265248617, "grad_norm": 0.16531498730182648, "learning_rate": 3.07725335050756e-05, "loss": 0.544, "mean_token_accuracy": 0.8260465115308762, "num_tokens": 720432625.0, "step": 22574 }, { "entropy": 0.4977374644950032, "epoch": 2.077009332896303, "grad_norm": 0.16220466792583466, "learning_rate": 3.076946667893397e-05, "loss": 0.4852, "mean_token_accuracy": 0.8414218612015247, "num_tokens": 720464313.0, "step": 22575 }, { "entropy": 0.4972231015563011, "epoch": 2.0771013392677444, "grad_norm": 0.15682946145534515, "learning_rate": 3.076639985279235e-05, "loss": 0.482, "mean_token_accuracy": 0.848536778241396, "num_tokens": 720496995.0, "step": 22576 }, { "entropy": 0.5579053526744246, "epoch": 2.0771933456391856, "grad_norm": 0.1641456037759781, "learning_rate": 3.076333302665072e-05, "loss": 0.5456, "mean_token_accuracy": 0.8283017054200172, "num_tokens": 720529333.0, "step": 22577 }, { "entropy": 0.41892953030765057, "epoch": 2.0772853520106267, "grad_norm": 0.1520862579345703, "learning_rate": 3.0760266200509095e-05, "loss": 0.4112, "mean_token_accuracy": 0.868813619017601, "num_tokens": 720561218.0, "step": 22578 }, { "entropy": 0.42933069728314877, "epoch": 2.077377358382068, "grad_norm": 0.15384574234485626, "learning_rate": 3.075719937436747e-05, "loss": 0.4105, "mean_token_accuracy": 0.8715993836522102, "num_tokens": 720593000.0, "step": 22579 }, { "entropy": 0.3838691655546427, "epoch": 2.077469364753509, "grad_norm": 0.14378710091114044, "learning_rate": 3.0754132548225844e-05, "loss": 0.3628, "mean_token_accuracy": 0.8809254318475723, "num_tokens": 720625389.0, "step": 22580 }, { "entropy": 0.4898495078086853, "epoch": 2.0775613711249505, "grad_norm": 0.15989993512630463, "learning_rate": 3.075106572208422e-05, "loss": 0.4725, "mean_token_accuracy": 0.8447154834866524, "num_tokens": 720657072.0, "step": 22581 }, { "entropy": 0.4956659357994795, "epoch": 2.0776533774963917, "grad_norm": 0.1620018482208252, "learning_rate": 3.0747998895942594e-05, "loss": 0.4811, "mean_token_accuracy": 0.8489988222718239, "num_tokens": 720689096.0, "step": 22582 }, { "entropy": 0.5219261867459863, "epoch": 2.077745383867833, "grad_norm": 0.16011540591716766, "learning_rate": 3.074493206980096e-05, "loss": 0.5062, "mean_token_accuracy": 0.8410855457186699, "num_tokens": 720721346.0, "step": 22583 }, { "entropy": 0.5880298260599375, "epoch": 2.077837390239274, "grad_norm": 0.16656021773815155, "learning_rate": 3.074186524365934e-05, "loss": 0.5598, "mean_token_accuracy": 0.8235405832529068, "num_tokens": 720752426.0, "step": 22584 }, { "entropy": 0.4441067073494196, "epoch": 2.077929396610715, "grad_norm": 0.15104345977306366, "learning_rate": 3.073879841751771e-05, "loss": 0.4297, "mean_token_accuracy": 0.8629213310778141, "num_tokens": 720784182.0, "step": 22585 }, { "entropy": 0.5278945676982403, "epoch": 2.0780214029821567, "grad_norm": 0.16231532394886017, "learning_rate": 3.0735731591376085e-05, "loss": 0.515, "mean_token_accuracy": 0.8401350975036621, "num_tokens": 720816340.0, "step": 22586 }, { "entropy": 0.5051824199035764, "epoch": 2.078113409353598, "grad_norm": 0.15923957526683807, "learning_rate": 3.073266476523446e-05, "loss": 0.4918, "mean_token_accuracy": 0.8424668461084366, "num_tokens": 720848112.0, "step": 22587 }, { "entropy": 0.4494704070966691, "epoch": 2.078205415725039, "grad_norm": 0.14671386778354645, "learning_rate": 3.0729597939092835e-05, "loss": 0.434, "mean_token_accuracy": 0.862687099725008, "num_tokens": 720880576.0, "step": 22588 }, { "entropy": 0.4987973254173994, "epoch": 2.07829742209648, "grad_norm": 0.15894679725170135, "learning_rate": 3.072653111295121e-05, "loss": 0.4865, "mean_token_accuracy": 0.8456215560436249, "num_tokens": 720912597.0, "step": 22589 }, { "entropy": 0.616643431596458, "epoch": 2.078389428467921, "grad_norm": 0.1687268167734146, "learning_rate": 3.0723464286809584e-05, "loss": 0.6011, "mean_token_accuracy": 0.8104203715920448, "num_tokens": 720945060.0, "step": 22590 }, { "entropy": 0.48653932474553585, "epoch": 2.0784814348393628, "grad_norm": 0.15622884035110474, "learning_rate": 3.072039746066795e-05, "loss": 0.4586, "mean_token_accuracy": 0.8537812940776348, "num_tokens": 720975960.0, "step": 22591 }, { "entropy": 0.54939493839629, "epoch": 2.078573441210804, "grad_norm": 0.16171397268772125, "learning_rate": 3.071733063452633e-05, "loss": 0.537, "mean_token_accuracy": 0.829080119729042, "num_tokens": 721007846.0, "step": 22592 }, { "entropy": 0.5244200103916228, "epoch": 2.078665447582245, "grad_norm": 0.16348187625408173, "learning_rate": 3.07142638083847e-05, "loss": 0.5148, "mean_token_accuracy": 0.8381061851978302, "num_tokens": 721039726.0, "step": 22593 }, { "entropy": 0.5173857798799872, "epoch": 2.078757453953686, "grad_norm": 0.1629278063774109, "learning_rate": 3.0711196982243076e-05, "loss": 0.4928, "mean_token_accuracy": 0.841568935662508, "num_tokens": 721070941.0, "step": 22594 }, { "entropy": 0.4965411841403693, "epoch": 2.0788494603251273, "grad_norm": 0.15612883865833282, "learning_rate": 3.070813015610145e-05, "loss": 0.4796, "mean_token_accuracy": 0.8459314033389091, "num_tokens": 721103109.0, "step": 22595 }, { "entropy": 0.5276910979300737, "epoch": 2.078941466696569, "grad_norm": 0.16135689616203308, "learning_rate": 3.0705063329959825e-05, "loss": 0.5101, "mean_token_accuracy": 0.8379104360938072, "num_tokens": 721134758.0, "step": 22596 }, { "entropy": 0.5196482138708234, "epoch": 2.07903347306801, "grad_norm": 0.15476740896701813, "learning_rate": 3.07019965038182e-05, "loss": 0.5038, "mean_token_accuracy": 0.8414584696292877, "num_tokens": 721166896.0, "step": 22597 }, { "entropy": 0.5542828552424908, "epoch": 2.079125479439451, "grad_norm": 0.1622430682182312, "learning_rate": 3.0698929677676574e-05, "loss": 0.5358, "mean_token_accuracy": 0.8318337351083755, "num_tokens": 721199403.0, "step": 22598 }, { "entropy": 0.5511038843542337, "epoch": 2.0792174858108923, "grad_norm": 0.1629953384399414, "learning_rate": 3.069586285153494e-05, "loss": 0.5481, "mean_token_accuracy": 0.8249555565416813, "num_tokens": 721231592.0, "step": 22599 }, { "entropy": 0.4982480965554714, "epoch": 2.0793094921823334, "grad_norm": 0.15905970335006714, "learning_rate": 3.0692796025393324e-05, "loss": 0.4865, "mean_token_accuracy": 0.8475290983915329, "num_tokens": 721262834.0, "step": 22600 }, { "entropy": 0.6363533269613981, "epoch": 2.079401498553775, "grad_norm": 0.1666005402803421, "learning_rate": 3.068972919925169e-05, "loss": 0.6139, "mean_token_accuracy": 0.8083412237465382, "num_tokens": 721294669.0, "step": 22601 }, { "entropy": 0.6211478682234883, "epoch": 2.079493504925216, "grad_norm": 0.1710897535085678, "learning_rate": 3.068666237311007e-05, "loss": 0.5932, "mean_token_accuracy": 0.8133144490420818, "num_tokens": 721327300.0, "step": 22602 }, { "entropy": 0.3932115286588669, "epoch": 2.0795855112966573, "grad_norm": 0.1415194571018219, "learning_rate": 3.068359554696844e-05, "loss": 0.3739, "mean_token_accuracy": 0.8786620646715164, "num_tokens": 721359502.0, "step": 22603 }, { "entropy": 0.5089999279007316, "epoch": 2.0796775176680984, "grad_norm": 0.16443093121051788, "learning_rate": 3.0680528720826816e-05, "loss": 0.4931, "mean_token_accuracy": 0.8438733145594597, "num_tokens": 721391144.0, "step": 22604 }, { "entropy": 0.5083377556875348, "epoch": 2.0797695240395395, "grad_norm": 0.1608549952507019, "learning_rate": 3.06774618946852e-05, "loss": 0.5069, "mean_token_accuracy": 0.8422052189707756, "num_tokens": 721422843.0, "step": 22605 }, { "entropy": 0.5706372410058975, "epoch": 2.079861530410981, "grad_norm": 0.16559307277202606, "learning_rate": 3.0674395068543565e-05, "loss": 0.5536, "mean_token_accuracy": 0.8279781751334667, "num_tokens": 721455030.0, "step": 22606 }, { "entropy": 0.5690503586083651, "epoch": 2.0799535367824222, "grad_norm": 0.16744834184646606, "learning_rate": 3.067132824240194e-05, "loss": 0.55, "mean_token_accuracy": 0.824751615524292, "num_tokens": 721486574.0, "step": 22607 }, { "entropy": 0.5074295625090599, "epoch": 2.0800455431538634, "grad_norm": 0.15577276051044464, "learning_rate": 3.0668261416260314e-05, "loss": 0.4974, "mean_token_accuracy": 0.8416871689260006, "num_tokens": 721518943.0, "step": 22608 }, { "entropy": 0.5435142358765006, "epoch": 2.0801375495253045, "grad_norm": 0.15836459398269653, "learning_rate": 3.066519459011869e-05, "loss": 0.5213, "mean_token_accuracy": 0.8371380940079689, "num_tokens": 721551185.0, "step": 22609 }, { "entropy": 0.519513338804245, "epoch": 2.0802295558967456, "grad_norm": 0.15635977685451508, "learning_rate": 3.0662127763977063e-05, "loss": 0.5086, "mean_token_accuracy": 0.8394112177193165, "num_tokens": 721583538.0, "step": 22610 }, { "entropy": 0.5454235412180424, "epoch": 2.080321562268187, "grad_norm": 0.16060446202754974, "learning_rate": 3.065906093783544e-05, "loss": 0.5329, "mean_token_accuracy": 0.8299616612493992, "num_tokens": 721615968.0, "step": 22611 }, { "entropy": 0.5396291008219123, "epoch": 2.0804135686396283, "grad_norm": 0.16797882318496704, "learning_rate": 3.0655994111693806e-05, "loss": 0.5242, "mean_token_accuracy": 0.833745714277029, "num_tokens": 721647499.0, "step": 22612 }, { "entropy": 0.5181564278900623, "epoch": 2.0805055750110695, "grad_norm": 0.16154004633426666, "learning_rate": 3.065292728555219e-05, "loss": 0.511, "mean_token_accuracy": 0.8381890207529068, "num_tokens": 721679812.0, "step": 22613 }, { "entropy": 0.42860220512375236, "epoch": 2.0805975813825106, "grad_norm": 0.14986734092235565, "learning_rate": 3.0649860459410555e-05, "loss": 0.4126, "mean_token_accuracy": 0.867897093296051, "num_tokens": 721711676.0, "step": 22614 }, { "entropy": 0.5080153634771705, "epoch": 2.0806895877539517, "grad_norm": 0.15795816481113434, "learning_rate": 3.064679363326893e-05, "loss": 0.4918, "mean_token_accuracy": 0.8425615131855011, "num_tokens": 721743555.0, "step": 22615 }, { "entropy": 0.5384909035637975, "epoch": 2.0807815941253933, "grad_norm": 0.16105018556118011, "learning_rate": 3.0643726807127305e-05, "loss": 0.5208, "mean_token_accuracy": 0.8338423930108547, "num_tokens": 721775328.0, "step": 22616 }, { "entropy": 0.4728115666657686, "epoch": 2.0808736004968345, "grad_norm": 0.15375925600528717, "learning_rate": 3.064065998098568e-05, "loss": 0.4573, "mean_token_accuracy": 0.8522279374301434, "num_tokens": 721807058.0, "step": 22617 }, { "entropy": 0.5039577260613441, "epoch": 2.0809656068682756, "grad_norm": 0.16406436264514923, "learning_rate": 3.0637593154844054e-05, "loss": 0.4995, "mean_token_accuracy": 0.8363539017736912, "num_tokens": 721839100.0, "step": 22618 }, { "entropy": 0.6069460427388549, "epoch": 2.0810576132397167, "grad_norm": 0.16717177629470825, "learning_rate": 3.063452632870243e-05, "loss": 0.5884, "mean_token_accuracy": 0.8149127513170242, "num_tokens": 721871142.0, "step": 22619 }, { "entropy": 0.5723409745842218, "epoch": 2.081149619611158, "grad_norm": 0.1679980605840683, "learning_rate": 3.06314595025608e-05, "loss": 0.5542, "mean_token_accuracy": 0.8244184292852879, "num_tokens": 721902477.0, "step": 22620 }, { "entropy": 0.4813967514783144, "epoch": 2.0812416259825994, "grad_norm": 0.1568002849817276, "learning_rate": 3.062839267641918e-05, "loss": 0.4659, "mean_token_accuracy": 0.8522522896528244, "num_tokens": 721934990.0, "step": 22621 }, { "entropy": 0.4812219990417361, "epoch": 2.0813336323540406, "grad_norm": 0.15969696640968323, "learning_rate": 3.0625325850277546e-05, "loss": 0.4764, "mean_token_accuracy": 0.8532866835594177, "num_tokens": 721966487.0, "step": 22622 }, { "entropy": 0.5934542305767536, "epoch": 2.0814256387254817, "grad_norm": 0.16744619607925415, "learning_rate": 3.062225902413593e-05, "loss": 0.5666, "mean_token_accuracy": 0.8219959400594234, "num_tokens": 721997313.0, "step": 22623 }, { "entropy": 0.5566432978957891, "epoch": 2.081517645096923, "grad_norm": 0.1668982058763504, "learning_rate": 3.0619192197994295e-05, "loss": 0.5392, "mean_token_accuracy": 0.8305371999740601, "num_tokens": 722028664.0, "step": 22624 }, { "entropy": 0.6495349267497659, "epoch": 2.081609651468364, "grad_norm": 0.1672535538673401, "learning_rate": 3.061612537185267e-05, "loss": 0.621, "mean_token_accuracy": 0.8040989451110363, "num_tokens": 722060551.0, "step": 22625 }, { "entropy": 0.5764811635017395, "epoch": 2.0817016578398055, "grad_norm": 0.1670469045639038, "learning_rate": 3.0613058545711044e-05, "loss": 0.5562, "mean_token_accuracy": 0.8233490623533726, "num_tokens": 722091870.0, "step": 22626 }, { "entropy": 0.5117785464972258, "epoch": 2.0817936642112467, "grad_norm": 0.16676920652389526, "learning_rate": 3.060999171956942e-05, "loss": 0.4919, "mean_token_accuracy": 0.8426318541169167, "num_tokens": 722123683.0, "step": 22627 }, { "entropy": 0.5314843724481761, "epoch": 2.081885670582688, "grad_norm": 0.16275812685489655, "learning_rate": 3.0606924893427794e-05, "loss": 0.5186, "mean_token_accuracy": 0.8369144350290298, "num_tokens": 722155295.0, "step": 22628 }, { "entropy": 0.4837530176155269, "epoch": 2.081977676954129, "grad_norm": 0.1564638316631317, "learning_rate": 3.060385806728617e-05, "loss": 0.4765, "mean_token_accuracy": 0.8530063144862652, "num_tokens": 722187161.0, "step": 22629 }, { "entropy": 0.481517571490258, "epoch": 2.08206968332557, "grad_norm": 0.15443682670593262, "learning_rate": 3.0600791241144536e-05, "loss": 0.4684, "mean_token_accuracy": 0.847659271210432, "num_tokens": 722219648.0, "step": 22630 }, { "entropy": 0.5376769285649061, "epoch": 2.0821616896970117, "grad_norm": 0.1591399759054184, "learning_rate": 3.059772441500292e-05, "loss": 0.5224, "mean_token_accuracy": 0.8358337879180908, "num_tokens": 722252216.0, "step": 22631 }, { "entropy": 0.515537329018116, "epoch": 2.082253696068453, "grad_norm": 0.16367511451244354, "learning_rate": 3.0594657588861285e-05, "loss": 0.5082, "mean_token_accuracy": 0.8394016064703465, "num_tokens": 722284020.0, "step": 22632 }, { "entropy": 0.5573376677930355, "epoch": 2.082345702439894, "grad_norm": 0.1605912744998932, "learning_rate": 3.059159076271966e-05, "loss": 0.5463, "mean_token_accuracy": 0.8272853940725327, "num_tokens": 722316383.0, "step": 22633 }, { "entropy": 0.4605006882920861, "epoch": 2.082437708811335, "grad_norm": 0.15049533545970917, "learning_rate": 3.058852393657804e-05, "loss": 0.4372, "mean_token_accuracy": 0.8572398945689201, "num_tokens": 722347786.0, "step": 22634 }, { "entropy": 0.6075412668287754, "epoch": 2.082529715182776, "grad_norm": 0.17069770395755768, "learning_rate": 3.058545711043641e-05, "loss": 0.5941, "mean_token_accuracy": 0.8121353462338448, "num_tokens": 722379802.0, "step": 22635 }, { "entropy": 0.5210925135761499, "epoch": 2.0826217215542178, "grad_norm": 0.1582501232624054, "learning_rate": 3.058239028429479e-05, "loss": 0.5114, "mean_token_accuracy": 0.844231266528368, "num_tokens": 722411861.0, "step": 22636 }, { "entropy": 0.4666674882173538, "epoch": 2.082713727925659, "grad_norm": 0.1527312994003296, "learning_rate": 3.057932345815316e-05, "loss": 0.4472, "mean_token_accuracy": 0.8565014824271202, "num_tokens": 722443697.0, "step": 22637 }, { "entropy": 0.4882065085694194, "epoch": 2.0828057342971, "grad_norm": 0.15531671047210693, "learning_rate": 3.057625663201153e-05, "loss": 0.4723, "mean_token_accuracy": 0.8490068130195141, "num_tokens": 722475549.0, "step": 22638 }, { "entropy": 0.5030930847860873, "epoch": 2.082897740668541, "grad_norm": 0.15955471992492676, "learning_rate": 3.057318980586991e-05, "loss": 0.4865, "mean_token_accuracy": 0.846695076674223, "num_tokens": 722507721.0, "step": 22639 }, { "entropy": 0.507505807094276, "epoch": 2.0829897470399823, "grad_norm": 0.15381258726119995, "learning_rate": 3.057012297972828e-05, "loss": 0.4949, "mean_token_accuracy": 0.8433988727629185, "num_tokens": 722540489.0, "step": 22640 }, { "entropy": 0.49395220330916345, "epoch": 2.083081753411424, "grad_norm": 0.15151914954185486, "learning_rate": 3.056705615358666e-05, "loss": 0.4641, "mean_token_accuracy": 0.8506293259561062, "num_tokens": 722572356.0, "step": 22641 }, { "entropy": 0.45433490350842476, "epoch": 2.083173759782865, "grad_norm": 0.15457969903945923, "learning_rate": 3.056398932744503e-05, "loss": 0.4373, "mean_token_accuracy": 0.86109584197402, "num_tokens": 722603649.0, "step": 22642 }, { "entropy": 0.4837009513285011, "epoch": 2.083265766154306, "grad_norm": 0.15746985375881195, "learning_rate": 3.05609225013034e-05, "loss": 0.4687, "mean_token_accuracy": 0.8524166606366634, "num_tokens": 722634209.0, "step": 22643 }, { "entropy": 0.4753837934695184, "epoch": 2.0833577725257473, "grad_norm": 0.15583892166614532, "learning_rate": 3.055785567516178e-05, "loss": 0.471, "mean_token_accuracy": 0.8500385880470276, "num_tokens": 722666616.0, "step": 22644 }, { "entropy": 0.4421670166775584, "epoch": 2.0834497788971884, "grad_norm": 0.14972972869873047, "learning_rate": 3.055478884902015e-05, "loss": 0.4278, "mean_token_accuracy": 0.8612549230456352, "num_tokens": 722699312.0, "step": 22645 }, { "entropy": 0.5609650230035186, "epoch": 2.08354178526863, "grad_norm": 0.1677136868238449, "learning_rate": 3.0551722022878524e-05, "loss": 0.546, "mean_token_accuracy": 0.8258668892085552, "num_tokens": 722731441.0, "step": 22646 }, { "entropy": 0.5044717928394675, "epoch": 2.083633791640071, "grad_norm": 0.15212129056453705, "learning_rate": 3.05486551967369e-05, "loss": 0.4773, "mean_token_accuracy": 0.849085621535778, "num_tokens": 722762927.0, "step": 22647 }, { "entropy": 0.4301251005381346, "epoch": 2.0837257980115123, "grad_norm": 0.1491972953081131, "learning_rate": 3.054558837059527e-05, "loss": 0.4167, "mean_token_accuracy": 0.8638844192028046, "num_tokens": 722795132.0, "step": 22648 }, { "entropy": 0.5323199518024921, "epoch": 2.0838178043829534, "grad_norm": 0.16089734435081482, "learning_rate": 3.054252154445365e-05, "loss": 0.5291, "mean_token_accuracy": 0.8308222815394402, "num_tokens": 722826930.0, "step": 22649 }, { "entropy": 0.4560493705794215, "epoch": 2.0839098107543945, "grad_norm": 0.15002304315567017, "learning_rate": 3.053945471831202e-05, "loss": 0.4432, "mean_token_accuracy": 0.8560800403356552, "num_tokens": 722859124.0, "step": 22650 }, { "entropy": 0.5233243987895548, "epoch": 2.084001817125836, "grad_norm": 0.16531811654567719, "learning_rate": 3.053638789217039e-05, "loss": 0.5127, "mean_token_accuracy": 0.8377574123442173, "num_tokens": 722890538.0, "step": 22651 }, { "entropy": 0.5687402095645666, "epoch": 2.0840938234972772, "grad_norm": 0.16639727354049683, "learning_rate": 3.053332106602877e-05, "loss": 0.5595, "mean_token_accuracy": 0.8233859017491341, "num_tokens": 722923032.0, "step": 22652 }, { "entropy": 0.5283712544478476, "epoch": 2.0841858298687184, "grad_norm": 0.16707593202590942, "learning_rate": 3.053025423988714e-05, "loss": 0.5134, "mean_token_accuracy": 0.8378100469708443, "num_tokens": 722955198.0, "step": 22653 }, { "entropy": 0.576538348570466, "epoch": 2.0842778362401595, "grad_norm": 0.16311787068843842, "learning_rate": 3.0527187413745514e-05, "loss": 0.572, "mean_token_accuracy": 0.8229531347751617, "num_tokens": 722987756.0, "step": 22654 }, { "entropy": 0.5351309925317764, "epoch": 2.0843698426116006, "grad_norm": 0.166739821434021, "learning_rate": 3.052412058760389e-05, "loss": 0.5143, "mean_token_accuracy": 0.8380737528204918, "num_tokens": 723018897.0, "step": 22655 }, { "entropy": 0.5629710517823696, "epoch": 2.084461848983042, "grad_norm": 0.17259447276592255, "learning_rate": 3.052105376146226e-05, "loss": 0.5557, "mean_token_accuracy": 0.8205326721072197, "num_tokens": 723049724.0, "step": 22656 }, { "entropy": 0.4622397917555645, "epoch": 2.0845538553544833, "grad_norm": 0.14931432902812958, "learning_rate": 3.051798693532064e-05, "loss": 0.4509, "mean_token_accuracy": 0.85354895144701, "num_tokens": 723081543.0, "step": 22657 }, { "entropy": 0.534039399586618, "epoch": 2.0846458617259245, "grad_norm": 0.16407673060894012, "learning_rate": 3.0514920109179013e-05, "loss": 0.5208, "mean_token_accuracy": 0.8356180377304554, "num_tokens": 723112655.0, "step": 22658 }, { "entropy": 0.5201686955988407, "epoch": 2.0847378680973656, "grad_norm": 0.16637717187404633, "learning_rate": 3.0511853283037384e-05, "loss": 0.5089, "mean_token_accuracy": 0.836250189691782, "num_tokens": 723144176.0, "step": 22659 }, { "entropy": 0.4760120874270797, "epoch": 2.0848298744688067, "grad_norm": 0.15267518162727356, "learning_rate": 3.0508786456895762e-05, "loss": 0.4632, "mean_token_accuracy": 0.8523350283503532, "num_tokens": 723176419.0, "step": 22660 }, { "entropy": 0.47486637718975544, "epoch": 2.0849218808402483, "grad_norm": 0.1592400223016739, "learning_rate": 3.0505719630754133e-05, "loss": 0.4646, "mean_token_accuracy": 0.8530729860067368, "num_tokens": 723208620.0, "step": 22661 }, { "entropy": 0.40702193742617965, "epoch": 2.0850138872116895, "grad_norm": 0.13903111219406128, "learning_rate": 3.0502652804612508e-05, "loss": 0.3934, "mean_token_accuracy": 0.8733656480908394, "num_tokens": 723241083.0, "step": 22662 }, { "entropy": 0.4997535403817892, "epoch": 2.0851058935831306, "grad_norm": 0.15692393481731415, "learning_rate": 3.049958597847088e-05, "loss": 0.4934, "mean_token_accuracy": 0.8423359207808971, "num_tokens": 723272941.0, "step": 22663 }, { "entropy": 0.4762855074368417, "epoch": 2.0851978999545717, "grad_norm": 0.15924972295761108, "learning_rate": 3.0496519152329257e-05, "loss": 0.4633, "mean_token_accuracy": 0.8516641370952129, "num_tokens": 723304777.0, "step": 22664 }, { "entropy": 0.5134716285392642, "epoch": 2.085289906326013, "grad_norm": 0.15754380822181702, "learning_rate": 3.0493452326187632e-05, "loss": 0.4889, "mean_token_accuracy": 0.8430336266756058, "num_tokens": 723337073.0, "step": 22665 }, { "entropy": 0.43394848029129207, "epoch": 2.0853819126974544, "grad_norm": 0.14966024458408356, "learning_rate": 3.0490385500046003e-05, "loss": 0.4201, "mean_token_accuracy": 0.8655837960541248, "num_tokens": 723368735.0, "step": 22666 }, { "entropy": 0.509617100469768, "epoch": 2.0854739190688956, "grad_norm": 0.15594637393951416, "learning_rate": 3.048731867390438e-05, "loss": 0.4991, "mean_token_accuracy": 0.8446916118264198, "num_tokens": 723401067.0, "step": 22667 }, { "entropy": 0.624544421210885, "epoch": 2.0855659254403367, "grad_norm": 0.1696287989616394, "learning_rate": 3.0484251847762752e-05, "loss": 0.6153, "mean_token_accuracy": 0.8060802295804024, "num_tokens": 723433267.0, "step": 22668 }, { "entropy": 0.5269936583936214, "epoch": 2.085657931811778, "grad_norm": 0.16296808421611786, "learning_rate": 3.0481185021621127e-05, "loss": 0.5075, "mean_token_accuracy": 0.8372278325259686, "num_tokens": 723464601.0, "step": 22669 }, { "entropy": 0.5009394725784659, "epoch": 2.085749938183219, "grad_norm": 0.1535264402627945, "learning_rate": 3.0478118195479498e-05, "loss": 0.484, "mean_token_accuracy": 0.8477104678750038, "num_tokens": 723496823.0, "step": 22670 }, { "entropy": 0.5335398847237229, "epoch": 2.0858419445546605, "grad_norm": 0.15759040415287018, "learning_rate": 3.0475051369337876e-05, "loss": 0.501, "mean_token_accuracy": 0.8381397873163223, "num_tokens": 723528489.0, "step": 22671 }, { "entropy": 0.5660706292837858, "epoch": 2.0859339509261017, "grad_norm": 0.1691991239786148, "learning_rate": 3.0471984543196248e-05, "loss": 0.5497, "mean_token_accuracy": 0.8232786618173122, "num_tokens": 723559657.0, "step": 22672 }, { "entropy": 0.4977656463161111, "epoch": 2.086025957297543, "grad_norm": 0.15800558030605316, "learning_rate": 3.0468917717054622e-05, "loss": 0.4796, "mean_token_accuracy": 0.8439127020537853, "num_tokens": 723592205.0, "step": 22673 }, { "entropy": 0.5732260956428945, "epoch": 2.086117963668984, "grad_norm": 0.1671362966299057, "learning_rate": 3.0465850890912993e-05, "loss": 0.5525, "mean_token_accuracy": 0.8245277591049671, "num_tokens": 723624360.0, "step": 22674 }, { "entropy": 0.5961032034829259, "epoch": 2.086209970040425, "grad_norm": 0.17145542800426483, "learning_rate": 3.046278406477137e-05, "loss": 0.5748, "mean_token_accuracy": 0.8170061632990837, "num_tokens": 723656141.0, "step": 22675 }, { "entropy": 0.5445612776093185, "epoch": 2.0863019764118667, "grad_norm": 0.16849204897880554, "learning_rate": 3.0459717238629743e-05, "loss": 0.5367, "mean_token_accuracy": 0.8312562592327595, "num_tokens": 723687520.0, "step": 22676 }, { "entropy": 0.49948121048510075, "epoch": 2.086393982783308, "grad_norm": 0.16481544077396393, "learning_rate": 3.045665041248812e-05, "loss": 0.4839, "mean_token_accuracy": 0.843768410384655, "num_tokens": 723718958.0, "step": 22677 }, { "entropy": 0.4459152175113559, "epoch": 2.086485989154749, "grad_norm": 0.15248799324035645, "learning_rate": 3.045358358634649e-05, "loss": 0.4393, "mean_token_accuracy": 0.8605087660253048, "num_tokens": 723750890.0, "step": 22678 }, { "entropy": 0.45227269921451807, "epoch": 2.08657799552619, "grad_norm": 0.15139180421829224, "learning_rate": 3.0450516760204867e-05, "loss": 0.4364, "mean_token_accuracy": 0.8615966364741325, "num_tokens": 723783382.0, "step": 22679 }, { "entropy": 0.5545263476669788, "epoch": 2.086670001897631, "grad_norm": 0.16521403193473816, "learning_rate": 3.0447449934063238e-05, "loss": 0.5465, "mean_token_accuracy": 0.8266307339072227, "num_tokens": 723814960.0, "step": 22680 }, { "entropy": 0.4401194825768471, "epoch": 2.0867620082690728, "grad_norm": 0.15268176794052124, "learning_rate": 3.0444383107921616e-05, "loss": 0.4357, "mean_token_accuracy": 0.8604314029216766, "num_tokens": 723846913.0, "step": 22681 }, { "entropy": 0.5002221604809165, "epoch": 2.086854014640514, "grad_norm": 0.1645459681749344, "learning_rate": 3.0441316281779987e-05, "loss": 0.4884, "mean_token_accuracy": 0.8439496010541916, "num_tokens": 723878907.0, "step": 22682 }, { "entropy": 0.42754787066951394, "epoch": 2.086946021011955, "grad_norm": 0.15736572444438934, "learning_rate": 3.0438249455638362e-05, "loss": 0.4162, "mean_token_accuracy": 0.8662350997328758, "num_tokens": 723911145.0, "step": 22683 }, { "entropy": 0.44708637334406376, "epoch": 2.087038027383396, "grad_norm": 0.14667744934558868, "learning_rate": 3.0435182629496733e-05, "loss": 0.4277, "mean_token_accuracy": 0.8632644005119801, "num_tokens": 723943674.0, "step": 22684 }, { "entropy": 0.5404684850946069, "epoch": 2.0871300337548373, "grad_norm": 0.16135652363300323, "learning_rate": 3.043211580335511e-05, "loss": 0.5321, "mean_token_accuracy": 0.831237580627203, "num_tokens": 723975293.0, "step": 22685 }, { "entropy": 0.5420705555006862, "epoch": 2.087222040126279, "grad_norm": 0.15903827548027039, "learning_rate": 3.0429048977213482e-05, "loss": 0.5228, "mean_token_accuracy": 0.831231027841568, "num_tokens": 724007088.0, "step": 22686 }, { "entropy": 0.5017264834605157, "epoch": 2.08731404649772, "grad_norm": 0.16742907464504242, "learning_rate": 3.0425982151071857e-05, "loss": 0.4881, "mean_token_accuracy": 0.8439029157161713, "num_tokens": 724039227.0, "step": 22687 }, { "entropy": 0.5596952829509974, "epoch": 2.087406052869161, "grad_norm": 0.16802679002285004, "learning_rate": 3.042291532493023e-05, "loss": 0.5431, "mean_token_accuracy": 0.8283824995160103, "num_tokens": 724070673.0, "step": 22688 }, { "entropy": 0.5393780088052154, "epoch": 2.0874980592406023, "grad_norm": 0.16689707338809967, "learning_rate": 3.0419848498788606e-05, "loss": 0.5221, "mean_token_accuracy": 0.8369407989084721, "num_tokens": 724103220.0, "step": 22689 }, { "entropy": 0.5420981366187334, "epoch": 2.0875900656120434, "grad_norm": 0.16236340999603271, "learning_rate": 3.0416781672646978e-05, "loss": 0.5233, "mean_token_accuracy": 0.8343356624245644, "num_tokens": 724134603.0, "step": 22690 }, { "entropy": 0.4911290151067078, "epoch": 2.087682071983485, "grad_norm": 0.15404446423053741, "learning_rate": 3.0413714846505352e-05, "loss": 0.4682, "mean_token_accuracy": 0.8532623834908009, "num_tokens": 724167070.0, "step": 22691 }, { "entropy": 0.4733845670707524, "epoch": 2.087774078354926, "grad_norm": 0.15243186056613922, "learning_rate": 3.0410648020363724e-05, "loss": 0.4559, "mean_token_accuracy": 0.8543476834893227, "num_tokens": 724199356.0, "step": 22692 }, { "entropy": 0.5780572611838579, "epoch": 2.0878660847263673, "grad_norm": 0.16774141788482666, "learning_rate": 3.04075811942221e-05, "loss": 0.5649, "mean_token_accuracy": 0.8217285424470901, "num_tokens": 724230441.0, "step": 22693 }, { "entropy": 0.5605301221366972, "epoch": 2.0879580910978084, "grad_norm": 0.16461580991744995, "learning_rate": 3.0404514368080473e-05, "loss": 0.5378, "mean_token_accuracy": 0.8303635381162167, "num_tokens": 724261818.0, "step": 22694 }, { "entropy": 0.5251771421171725, "epoch": 2.0880500974692495, "grad_norm": 0.15527576208114624, "learning_rate": 3.0401447541938847e-05, "loss": 0.5129, "mean_token_accuracy": 0.8376518599689007, "num_tokens": 724293672.0, "step": 22695 }, { "entropy": 0.5809805728495121, "epoch": 2.088142103840691, "grad_norm": 0.16780243813991547, "learning_rate": 3.0398380715797226e-05, "loss": 0.5618, "mean_token_accuracy": 0.8219581842422485, "num_tokens": 724325528.0, "step": 22696 }, { "entropy": 0.5409061787649989, "epoch": 2.0882341102121322, "grad_norm": 0.16479003429412842, "learning_rate": 3.0395313889655597e-05, "loss": 0.5249, "mean_token_accuracy": 0.8378648050129414, "num_tokens": 724358009.0, "step": 22697 }, { "entropy": 0.6085918601602316, "epoch": 2.0883261165835734, "grad_norm": 0.1707119643688202, "learning_rate": 3.0392247063513975e-05, "loss": 0.5924, "mean_token_accuracy": 0.812815960496664, "num_tokens": 724389855.0, "step": 22698 }, { "entropy": 0.5035363670904189, "epoch": 2.0884181229550145, "grad_norm": 0.16543586552143097, "learning_rate": 3.0389180237372346e-05, "loss": 0.4927, "mean_token_accuracy": 0.8451118506491184, "num_tokens": 724421828.0, "step": 22699 }, { "entropy": 0.596744691953063, "epoch": 2.0885101293264556, "grad_norm": 0.1729719489812851, "learning_rate": 3.038611341123072e-05, "loss": 0.5876, "mean_token_accuracy": 0.8135011605918407, "num_tokens": 724453850.0, "step": 22700 }, { "entropy": 0.5468511413782835, "epoch": 2.088602135697897, "grad_norm": 0.1624235212802887, "learning_rate": 3.0383046585089092e-05, "loss": 0.5364, "mean_token_accuracy": 0.8339385204017162, "num_tokens": 724485733.0, "step": 22701 }, { "entropy": 0.5210913696791977, "epoch": 2.0886941420693383, "grad_norm": 0.16847124695777893, "learning_rate": 3.037997975894747e-05, "loss": 0.4974, "mean_token_accuracy": 0.8420913331210613, "num_tokens": 724516984.0, "step": 22702 }, { "entropy": 0.4958121506497264, "epoch": 2.0887861484407795, "grad_norm": 0.15785051882266998, "learning_rate": 3.037691293280584e-05, "loss": 0.4842, "mean_token_accuracy": 0.844660434871912, "num_tokens": 724548723.0, "step": 22703 }, { "entropy": 0.4584088136907667, "epoch": 2.0888781548122206, "grad_norm": 0.15118694305419922, "learning_rate": 3.0373846106664216e-05, "loss": 0.4486, "mean_token_accuracy": 0.8595810867846012, "num_tokens": 724581491.0, "step": 22704 }, { "entropy": 0.4624634359497577, "epoch": 2.0889701611836617, "grad_norm": 0.15451878309249878, "learning_rate": 3.0370779280522587e-05, "loss": 0.4607, "mean_token_accuracy": 0.8532929234206676, "num_tokens": 724613968.0, "step": 22705 }, { "entropy": 0.4605192095041275, "epoch": 2.0890621675551033, "grad_norm": 0.16404372453689575, "learning_rate": 3.0367712454380965e-05, "loss": 0.4318, "mean_token_accuracy": 0.8580794371664524, "num_tokens": 724645861.0, "step": 22706 }, { "entropy": 0.4665903365239501, "epoch": 2.0891541739265445, "grad_norm": 0.1572660207748413, "learning_rate": 3.0364645628239336e-05, "loss": 0.4414, "mean_token_accuracy": 0.8580810762941837, "num_tokens": 724677040.0, "step": 22707 }, { "entropy": 0.5015923976898193, "epoch": 2.0892461802979856, "grad_norm": 0.1589721441268921, "learning_rate": 3.036157880209771e-05, "loss": 0.5005, "mean_token_accuracy": 0.839436337351799, "num_tokens": 724709230.0, "step": 22708 }, { "entropy": 0.5184937084559351, "epoch": 2.0893381866694267, "grad_norm": 0.15914104878902435, "learning_rate": 3.0358511975956082e-05, "loss": 0.514, "mean_token_accuracy": 0.8380148224532604, "num_tokens": 724741348.0, "step": 22709 }, { "entropy": 0.5347001999616623, "epoch": 2.089430193040868, "grad_norm": 0.16608285903930664, "learning_rate": 3.035544514981446e-05, "loss": 0.5233, "mean_token_accuracy": 0.8366141431033611, "num_tokens": 724773742.0, "step": 22710 }, { "entropy": 0.5222738794982433, "epoch": 2.0895221994123094, "grad_norm": 0.16598473489284515, "learning_rate": 3.035237832367283e-05, "loss": 0.5016, "mean_token_accuracy": 0.8449919819831848, "num_tokens": 724805844.0, "step": 22711 }, { "entropy": 0.4746474423445761, "epoch": 2.0896142057837506, "grad_norm": 0.15768009424209595, "learning_rate": 3.0349311497531206e-05, "loss": 0.4662, "mean_token_accuracy": 0.8525005169212818, "num_tokens": 724838114.0, "step": 22712 }, { "entropy": 0.5671631435398012, "epoch": 2.0897062121551917, "grad_norm": 0.1714625060558319, "learning_rate": 3.0346244671389578e-05, "loss": 0.5472, "mean_token_accuracy": 0.8267799951136112, "num_tokens": 724869234.0, "step": 22713 }, { "entropy": 0.5177236888557673, "epoch": 2.089798218526633, "grad_norm": 0.16259124875068665, "learning_rate": 3.0343177845247956e-05, "loss": 0.5073, "mean_token_accuracy": 0.8426484130322933, "num_tokens": 724901644.0, "step": 22714 }, { "entropy": 0.560981348156929, "epoch": 2.089890224898074, "grad_norm": 0.16765642166137695, "learning_rate": 3.0340111019106327e-05, "loss": 0.5459, "mean_token_accuracy": 0.8238176442682743, "num_tokens": 724933092.0, "step": 22715 }, { "entropy": 0.6301073096692562, "epoch": 2.0899822312695155, "grad_norm": 0.17237482964992523, "learning_rate": 3.03370441929647e-05, "loss": 0.613, "mean_token_accuracy": 0.8091348595917225, "num_tokens": 724965120.0, "step": 22716 }, { "entropy": 0.6148909702897072, "epoch": 2.0900742376409567, "grad_norm": 0.17390578985214233, "learning_rate": 3.0333977366823073e-05, "loss": 0.602, "mean_token_accuracy": 0.8097187504172325, "num_tokens": 724996858.0, "step": 22717 }, { "entropy": 0.4264287131372839, "epoch": 2.090166244012398, "grad_norm": 0.14364002645015717, "learning_rate": 3.033091054068145e-05, "loss": 0.4079, "mean_token_accuracy": 0.8705874048173428, "num_tokens": 725029107.0, "step": 22718 }, { "entropy": 0.5315373986959457, "epoch": 2.090258250383839, "grad_norm": 0.16393113136291504, "learning_rate": 3.0327843714539822e-05, "loss": 0.5063, "mean_token_accuracy": 0.8403581716120243, "num_tokens": 725061695.0, "step": 22719 }, { "entropy": 0.5655374191701412, "epoch": 2.09035025675528, "grad_norm": 0.16963298618793488, "learning_rate": 3.03247768883982e-05, "loss": 0.5521, "mean_token_accuracy": 0.8285065591335297, "num_tokens": 725094134.0, "step": 22720 }, { "entropy": 0.4662358155474067, "epoch": 2.0904422631267217, "grad_norm": 0.1525449901819229, "learning_rate": 3.032171006225657e-05, "loss": 0.4433, "mean_token_accuracy": 0.8546404577791691, "num_tokens": 725125976.0, "step": 22721 }, { "entropy": 0.4414218133315444, "epoch": 2.090534269498163, "grad_norm": 0.15478484332561493, "learning_rate": 3.0318643236114946e-05, "loss": 0.4244, "mean_token_accuracy": 0.8627953492105007, "num_tokens": 725157717.0, "step": 22722 }, { "entropy": 0.5869180760346353, "epoch": 2.090626275869604, "grad_norm": 0.16949094831943512, "learning_rate": 3.0315576409973317e-05, "loss": 0.566, "mean_token_accuracy": 0.821231197565794, "num_tokens": 725189525.0, "step": 22723 }, { "entropy": 0.5408402262255549, "epoch": 2.090718282241045, "grad_norm": 0.16120101511478424, "learning_rate": 3.0312509583831695e-05, "loss": 0.5184, "mean_token_accuracy": 0.8361307792365551, "num_tokens": 725221163.0, "step": 22724 }, { "entropy": 0.48542527575045824, "epoch": 2.090810288612486, "grad_norm": 0.15979181230068207, "learning_rate": 3.0309442757690067e-05, "loss": 0.4756, "mean_token_accuracy": 0.8511014617979527, "num_tokens": 725252686.0, "step": 22725 }, { "entropy": 0.521264654584229, "epoch": 2.0909022949839278, "grad_norm": 0.159068301320076, "learning_rate": 3.030637593154844e-05, "loss": 0.4997, "mean_token_accuracy": 0.8414465188980103, "num_tokens": 725284633.0, "step": 22726 }, { "entropy": 0.4642672936897725, "epoch": 2.090994301355369, "grad_norm": 0.1500619649887085, "learning_rate": 3.030330910540682e-05, "loss": 0.4467, "mean_token_accuracy": 0.8582112863659859, "num_tokens": 725317116.0, "step": 22727 }, { "entropy": 0.5879319198429585, "epoch": 2.09108630772681, "grad_norm": 0.17416249215602875, "learning_rate": 3.030024227926519e-05, "loss": 0.5791, "mean_token_accuracy": 0.8159047178924084, "num_tokens": 725348649.0, "step": 22728 }, { "entropy": 0.5167377647012472, "epoch": 2.091178314098251, "grad_norm": 0.15719400346279144, "learning_rate": 3.0297175453123565e-05, "loss": 0.5015, "mean_token_accuracy": 0.8417800031602383, "num_tokens": 725381024.0, "step": 22729 }, { "entropy": 0.41242874693125486, "epoch": 2.0912703204696923, "grad_norm": 0.14976267516613007, "learning_rate": 3.0294108626981936e-05, "loss": 0.391, "mean_token_accuracy": 0.8726533092558384, "num_tokens": 725412873.0, "step": 22730 }, { "entropy": 0.518389193341136, "epoch": 2.091362326841134, "grad_norm": 0.16177359223365784, "learning_rate": 3.0291041800840314e-05, "loss": 0.507, "mean_token_accuracy": 0.8383554108440876, "num_tokens": 725445236.0, "step": 22731 }, { "entropy": 0.5130906822159886, "epoch": 2.091454333212575, "grad_norm": 0.160519078373909, "learning_rate": 3.0287974974698686e-05, "loss": 0.4947, "mean_token_accuracy": 0.8405829332768917, "num_tokens": 725476550.0, "step": 22732 }, { "entropy": 0.53745769103989, "epoch": 2.091546339584016, "grad_norm": 0.1611226499080658, "learning_rate": 3.028490814855706e-05, "loss": 0.5358, "mean_token_accuracy": 0.8328100182116032, "num_tokens": 725508436.0, "step": 22733 }, { "entropy": 0.529321288689971, "epoch": 2.0916383459554573, "grad_norm": 0.1584537774324417, "learning_rate": 3.028184132241543e-05, "loss": 0.5119, "mean_token_accuracy": 0.8381274789571762, "num_tokens": 725540139.0, "step": 22734 }, { "entropy": 0.45231388695538044, "epoch": 2.0917303523268984, "grad_norm": 0.14934398233890533, "learning_rate": 3.027877449627381e-05, "loss": 0.4392, "mean_token_accuracy": 0.8610898852348328, "num_tokens": 725572117.0, "step": 22735 }, { "entropy": 0.4205099418759346, "epoch": 2.09182235869834, "grad_norm": 0.1551571488380432, "learning_rate": 3.027570767013218e-05, "loss": 0.393, "mean_token_accuracy": 0.8730558678507805, "num_tokens": 725603756.0, "step": 22736 }, { "entropy": 0.4747325964272022, "epoch": 2.091914365069781, "grad_norm": 0.150995135307312, "learning_rate": 3.027264084399056e-05, "loss": 0.4632, "mean_token_accuracy": 0.850848950445652, "num_tokens": 725635939.0, "step": 22737 }, { "entropy": 0.5614481642842293, "epoch": 2.0920063714412223, "grad_norm": 0.16935980319976807, "learning_rate": 3.0269574017848927e-05, "loss": 0.5423, "mean_token_accuracy": 0.8315841369330883, "num_tokens": 725667512.0, "step": 22738 }, { "entropy": 0.5068080467171967, "epoch": 2.0920983778126634, "grad_norm": 0.16277417540550232, "learning_rate": 3.0266507191707305e-05, "loss": 0.4944, "mean_token_accuracy": 0.8447112366557121, "num_tokens": 725699613.0, "step": 22739 }, { "entropy": 0.48291080724447966, "epoch": 2.0921903841841045, "grad_norm": 0.15553458034992218, "learning_rate": 3.0263440365565676e-05, "loss": 0.478, "mean_token_accuracy": 0.8487420603632927, "num_tokens": 725732381.0, "step": 22740 }, { "entropy": 0.5593564370647073, "epoch": 2.092282390555546, "grad_norm": 0.1666669100522995, "learning_rate": 3.0260373539424054e-05, "loss": 0.5405, "mean_token_accuracy": 0.8270956464111805, "num_tokens": 725763602.0, "step": 22741 }, { "entropy": 0.5113493781536818, "epoch": 2.0923743969269872, "grad_norm": 0.16114111244678497, "learning_rate": 3.0257306713282425e-05, "loss": 0.501, "mean_token_accuracy": 0.8404207564890385, "num_tokens": 725795933.0, "step": 22742 }, { "entropy": 0.539191784337163, "epoch": 2.0924664032984284, "grad_norm": 0.16552530229091644, "learning_rate": 3.02542398871408e-05, "loss": 0.5307, "mean_token_accuracy": 0.8319472409784794, "num_tokens": 725827544.0, "step": 22743 }, { "entropy": 0.4505713451653719, "epoch": 2.0925584096698695, "grad_norm": 0.15477056801319122, "learning_rate": 3.025117306099917e-05, "loss": 0.4357, "mean_token_accuracy": 0.8609679937362671, "num_tokens": 725858510.0, "step": 22744 }, { "entropy": 0.4868224994279444, "epoch": 2.0926504160413106, "grad_norm": 0.16038039326667786, "learning_rate": 3.024810623485755e-05, "loss": 0.4689, "mean_token_accuracy": 0.8476778417825699, "num_tokens": 725890231.0, "step": 22745 }, { "entropy": 0.49844879657030106, "epoch": 2.092742422412752, "grad_norm": 0.16109995543956757, "learning_rate": 3.024503940871592e-05, "loss": 0.4882, "mean_token_accuracy": 0.8424847684800625, "num_tokens": 725921561.0, "step": 22746 }, { "entropy": 0.5597710404545069, "epoch": 2.0928344287841933, "grad_norm": 0.17541047930717468, "learning_rate": 3.0241972582574295e-05, "loss": 0.5463, "mean_token_accuracy": 0.828353326767683, "num_tokens": 725952248.0, "step": 22747 }, { "entropy": 0.5031318422406912, "epoch": 2.0929264351556345, "grad_norm": 0.1620461493730545, "learning_rate": 3.0238905756432667e-05, "loss": 0.4814, "mean_token_accuracy": 0.8437480330467224, "num_tokens": 725983734.0, "step": 22748 }, { "entropy": 0.4455717750824988, "epoch": 2.0930184415270756, "grad_norm": 0.15120598673820496, "learning_rate": 3.0235838930291045e-05, "loss": 0.4186, "mean_token_accuracy": 0.8665408715605736, "num_tokens": 726015607.0, "step": 22749 }, { "entropy": 0.4590162462554872, "epoch": 2.0931104478985167, "grad_norm": 0.1534135341644287, "learning_rate": 3.0232772104149416e-05, "loss": 0.4403, "mean_token_accuracy": 0.8571567684412003, "num_tokens": 726047439.0, "step": 22750 }, { "entropy": 0.5447625732049346, "epoch": 2.0932024542699583, "grad_norm": 0.16849061846733093, "learning_rate": 3.022970527800779e-05, "loss": 0.5403, "mean_token_accuracy": 0.8319552205502987, "num_tokens": 726079153.0, "step": 22751 }, { "entropy": 0.528928394895047, "epoch": 2.0932944606413995, "grad_norm": 0.15994083881378174, "learning_rate": 3.0226638451866162e-05, "loss": 0.5129, "mean_token_accuracy": 0.8355951905250549, "num_tokens": 726110992.0, "step": 22752 }, { "entropy": 0.4619696056470275, "epoch": 2.0933864670128406, "grad_norm": 0.15334078669548035, "learning_rate": 3.022357162572454e-05, "loss": 0.4414, "mean_token_accuracy": 0.85572225227952, "num_tokens": 726143089.0, "step": 22753 }, { "entropy": 0.5737354850862175, "epoch": 2.0934784733842817, "grad_norm": 0.16592971980571747, "learning_rate": 3.022050479958291e-05, "loss": 0.5621, "mean_token_accuracy": 0.8241360671818256, "num_tokens": 726174548.0, "step": 22754 }, { "entropy": 0.5864809481427073, "epoch": 2.093570479755723, "grad_norm": 0.16963554918766022, "learning_rate": 3.0217437973441286e-05, "loss": 0.5645, "mean_token_accuracy": 0.8219408839941025, "num_tokens": 726206226.0, "step": 22755 }, { "entropy": 0.5342822279781103, "epoch": 2.0936624861271644, "grad_norm": 0.16115470230579376, "learning_rate": 3.0214371147299664e-05, "loss": 0.5196, "mean_token_accuracy": 0.8345535546541214, "num_tokens": 726238741.0, "step": 22756 }, { "entropy": 0.5567580058705062, "epoch": 2.0937544924986056, "grad_norm": 0.1572975516319275, "learning_rate": 3.0211304321158035e-05, "loss": 0.5333, "mean_token_accuracy": 0.8325914293527603, "num_tokens": 726271496.0, "step": 22757 }, { "entropy": 0.4254615264944732, "epoch": 2.0938464988700467, "grad_norm": 0.15295329689979553, "learning_rate": 3.0208237495016413e-05, "loss": 0.4163, "mean_token_accuracy": 0.8693451657891273, "num_tokens": 726303310.0, "step": 22758 }, { "entropy": 0.50486752204597, "epoch": 2.093938505241488, "grad_norm": 0.15493202209472656, "learning_rate": 3.0205170668874784e-05, "loss": 0.4898, "mean_token_accuracy": 0.8454213924705982, "num_tokens": 726335277.0, "step": 22759 }, { "entropy": 0.5534613048657775, "epoch": 2.094030511612929, "grad_norm": 0.16842637956142426, "learning_rate": 3.020210384273316e-05, "loss": 0.5443, "mean_token_accuracy": 0.8295769542455673, "num_tokens": 726366624.0, "step": 22760 }, { "entropy": 0.47043783869594336, "epoch": 2.0941225179843705, "grad_norm": 0.1613083779811859, "learning_rate": 3.019903701659153e-05, "loss": 0.4652, "mean_token_accuracy": 0.8515091426670551, "num_tokens": 726398628.0, "step": 22761 }, { "entropy": 0.50244758464396, "epoch": 2.0942145243558117, "grad_norm": 0.15617568790912628, "learning_rate": 3.0195970190449908e-05, "loss": 0.4785, "mean_token_accuracy": 0.848698191344738, "num_tokens": 726430962.0, "step": 22762 }, { "entropy": 0.5401722257956862, "epoch": 2.094306530727253, "grad_norm": 0.16417647898197174, "learning_rate": 3.019290336430828e-05, "loss": 0.5264, "mean_token_accuracy": 0.8347247429192066, "num_tokens": 726462960.0, "step": 22763 }, { "entropy": 0.6406240109354258, "epoch": 2.094398537098694, "grad_norm": 0.1755877286195755, "learning_rate": 3.0189836538166654e-05, "loss": 0.6376, "mean_token_accuracy": 0.8020535260438919, "num_tokens": 726494381.0, "step": 22764 }, { "entropy": 0.44704968109726906, "epoch": 2.094490543470135, "grad_norm": 0.1539335995912552, "learning_rate": 3.0186769712025025e-05, "loss": 0.4377, "mean_token_accuracy": 0.8620743937790394, "num_tokens": 726526607.0, "step": 22765 }, { "entropy": 0.5395822275895625, "epoch": 2.0945825498415767, "grad_norm": 0.1666349172592163, "learning_rate": 3.0183702885883403e-05, "loss": 0.5173, "mean_token_accuracy": 0.8349475376307964, "num_tokens": 726558232.0, "step": 22766 }, { "entropy": 0.48422474414110184, "epoch": 2.094674556213018, "grad_norm": 0.15357479453086853, "learning_rate": 3.0180636059741775e-05, "loss": 0.4651, "mean_token_accuracy": 0.8518160693347454, "num_tokens": 726590674.0, "step": 22767 }, { "entropy": 0.5012301858514547, "epoch": 2.094766562584459, "grad_norm": 0.1613989621400833, "learning_rate": 3.017756923360015e-05, "loss": 0.4886, "mean_token_accuracy": 0.8457377478480339, "num_tokens": 726623269.0, "step": 22768 }, { "entropy": 0.589996799826622, "epoch": 2.0948585689559, "grad_norm": 0.16999351978302002, "learning_rate": 3.017450240745852e-05, "loss": 0.5725, "mean_token_accuracy": 0.8208954818546772, "num_tokens": 726655393.0, "step": 22769 }, { "entropy": 0.6042465064674616, "epoch": 2.094950575327341, "grad_norm": 0.17603683471679688, "learning_rate": 3.01714355813169e-05, "loss": 0.5951, "mean_token_accuracy": 0.8127878345549107, "num_tokens": 726686755.0, "step": 22770 }, { "entropy": 0.46417560148984194, "epoch": 2.0950425816987828, "grad_norm": 0.15829864144325256, "learning_rate": 3.016836875517527e-05, "loss": 0.4436, "mean_token_accuracy": 0.8598888702690601, "num_tokens": 726718614.0, "step": 22771 }, { "entropy": 0.6223050132393837, "epoch": 2.095134588070224, "grad_norm": 0.17337824404239655, "learning_rate": 3.0165301929033645e-05, "loss": 0.6051, "mean_token_accuracy": 0.8094929866492748, "num_tokens": 726749441.0, "step": 22772 }, { "entropy": 0.5850254502147436, "epoch": 2.095226594441665, "grad_norm": 0.1692347228527069, "learning_rate": 3.0162235102892016e-05, "loss": 0.5751, "mean_token_accuracy": 0.8180831670761108, "num_tokens": 726780840.0, "step": 22773 }, { "entropy": 0.6068180073052645, "epoch": 2.095318600813106, "grad_norm": 0.16515642404556274, "learning_rate": 3.0159168276750394e-05, "loss": 0.5875, "mean_token_accuracy": 0.815558809787035, "num_tokens": 726813088.0, "step": 22774 }, { "entropy": 0.6274923104792833, "epoch": 2.0954106071845473, "grad_norm": 0.17787893116474152, "learning_rate": 3.0156101450608765e-05, "loss": 0.607, "mean_token_accuracy": 0.8094659708440304, "num_tokens": 726844706.0, "step": 22775 }, { "entropy": 0.4711465938016772, "epoch": 2.095502613555989, "grad_norm": 0.15222205221652985, "learning_rate": 3.015303462446714e-05, "loss": 0.4655, "mean_token_accuracy": 0.8496418930590153, "num_tokens": 726877306.0, "step": 22776 }, { "entropy": 0.44463398354128003, "epoch": 2.09559461992743, "grad_norm": 0.15467120707035065, "learning_rate": 3.014996779832551e-05, "loss": 0.4261, "mean_token_accuracy": 0.8611973039805889, "num_tokens": 726909831.0, "step": 22777 }, { "entropy": 0.4704787125810981, "epoch": 2.095686626298871, "grad_norm": 0.15672875940799713, "learning_rate": 3.014690097218389e-05, "loss": 0.448, "mean_token_accuracy": 0.8540919236838818, "num_tokens": 726940590.0, "step": 22778 }, { "entropy": 0.46362220495939255, "epoch": 2.0957786326703123, "grad_norm": 0.1572316735982895, "learning_rate": 3.014383414604226e-05, "loss": 0.447, "mean_token_accuracy": 0.8563845269382, "num_tokens": 726972582.0, "step": 22779 }, { "entropy": 0.5298021491616964, "epoch": 2.0958706390417534, "grad_norm": 0.16024187207221985, "learning_rate": 3.014076731990064e-05, "loss": 0.503, "mean_token_accuracy": 0.8418864570558071, "num_tokens": 727003965.0, "step": 22780 }, { "entropy": 0.4920317977666855, "epoch": 2.095962645413195, "grad_norm": 0.15635794401168823, "learning_rate": 3.013770049375901e-05, "loss": 0.4821, "mean_token_accuracy": 0.8433872610330582, "num_tokens": 727035572.0, "step": 22781 }, { "entropy": 0.49790505692362785, "epoch": 2.096054651784636, "grad_norm": 0.15548066794872284, "learning_rate": 3.0134633667617384e-05, "loss": 0.4798, "mean_token_accuracy": 0.8467058725655079, "num_tokens": 727067940.0, "step": 22782 }, { "entropy": 0.4875115496106446, "epoch": 2.0961466581560773, "grad_norm": 0.15644219517707825, "learning_rate": 3.0131566841475755e-05, "loss": 0.4721, "mean_token_accuracy": 0.850966565310955, "num_tokens": 727099966.0, "step": 22783 }, { "entropy": 0.5449781557545066, "epoch": 2.0962386645275184, "grad_norm": 0.1670367419719696, "learning_rate": 3.0128500015334134e-05, "loss": 0.5321, "mean_token_accuracy": 0.8313714377582073, "num_tokens": 727131041.0, "step": 22784 }, { "entropy": 0.5021190978586674, "epoch": 2.0963306708989595, "grad_norm": 0.16181211173534393, "learning_rate": 3.0125433189192505e-05, "loss": 0.4899, "mean_token_accuracy": 0.8414382077753544, "num_tokens": 727162966.0, "step": 22785 }, { "entropy": 0.46850763889960945, "epoch": 2.096422677270401, "grad_norm": 0.15296275913715363, "learning_rate": 3.012236636305088e-05, "loss": 0.4535, "mean_token_accuracy": 0.8551390804350376, "num_tokens": 727195170.0, "step": 22786 }, { "entropy": 0.4730679616332054, "epoch": 2.0965146836418422, "grad_norm": 0.16145136952400208, "learning_rate": 3.0119299536909257e-05, "loss": 0.4657, "mean_token_accuracy": 0.8490660637617111, "num_tokens": 727226695.0, "step": 22787 }, { "entropy": 0.51262859813869, "epoch": 2.0966066900132834, "grad_norm": 0.16932551562786102, "learning_rate": 3.011623271076763e-05, "loss": 0.5075, "mean_token_accuracy": 0.8381906747817993, "num_tokens": 727258534.0, "step": 22788 }, { "entropy": 0.47644015960395336, "epoch": 2.0966986963847245, "grad_norm": 0.16580671072006226, "learning_rate": 3.0113165884626003e-05, "loss": 0.4839, "mean_token_accuracy": 0.8493456952273846, "num_tokens": 727290784.0, "step": 22789 }, { "entropy": 0.578924173489213, "epoch": 2.0967907027561656, "grad_norm": 0.1758306324481964, "learning_rate": 3.0110099058484375e-05, "loss": 0.5591, "mean_token_accuracy": 0.8232092298567295, "num_tokens": 727321887.0, "step": 22790 }, { "entropy": 0.6648473348468542, "epoch": 2.096882709127607, "grad_norm": 0.1717311590909958, "learning_rate": 3.0107032232342753e-05, "loss": 0.6523, "mean_token_accuracy": 0.7961195595562458, "num_tokens": 727354242.0, "step": 22791 }, { "entropy": 0.548109445720911, "epoch": 2.0969747154990483, "grad_norm": 0.1634720116853714, "learning_rate": 3.0103965406201124e-05, "loss": 0.5383, "mean_token_accuracy": 0.8298429176211357, "num_tokens": 727385988.0, "step": 22792 }, { "entropy": 0.5945315128192306, "epoch": 2.0970667218704895, "grad_norm": 0.17371328175067902, "learning_rate": 3.01008985800595e-05, "loss": 0.5817, "mean_token_accuracy": 0.8194877095520496, "num_tokens": 727417626.0, "step": 22793 }, { "entropy": 0.47049490828067064, "epoch": 2.0971587282419306, "grad_norm": 0.14861030876636505, "learning_rate": 3.009783175391787e-05, "loss": 0.453, "mean_token_accuracy": 0.855347715318203, "num_tokens": 727450091.0, "step": 22794 }, { "entropy": 0.560358103364706, "epoch": 2.0972507346133717, "grad_norm": 0.1655351221561432, "learning_rate": 3.0094764927776248e-05, "loss": 0.5428, "mean_token_accuracy": 0.8277631215751171, "num_tokens": 727481334.0, "step": 22795 }, { "entropy": 0.6172696426510811, "epoch": 2.0973427409848133, "grad_norm": 0.17293430864810944, "learning_rate": 3.009169810163462e-05, "loss": 0.6156, "mean_token_accuracy": 0.8068746514618397, "num_tokens": 727513496.0, "step": 22796 }, { "entropy": 0.4970203940756619, "epoch": 2.0974347473562545, "grad_norm": 0.15856671333312988, "learning_rate": 3.0088631275492997e-05, "loss": 0.4824, "mean_token_accuracy": 0.847106758505106, "num_tokens": 727545717.0, "step": 22797 }, { "entropy": 0.5318001331761479, "epoch": 2.0975267537276956, "grad_norm": 0.1596866250038147, "learning_rate": 3.0085564449351365e-05, "loss": 0.5099, "mean_token_accuracy": 0.8393194302916527, "num_tokens": 727577509.0, "step": 22798 }, { "entropy": 0.4618429634720087, "epoch": 2.0976187600991367, "grad_norm": 0.15561291575431824, "learning_rate": 3.0082497623209743e-05, "loss": 0.4556, "mean_token_accuracy": 0.8560185171663761, "num_tokens": 727609070.0, "step": 22799 }, { "entropy": 0.5727133527398109, "epoch": 2.097710766470578, "grad_norm": 0.1602167934179306, "learning_rate": 3.0079430797068114e-05, "loss": 0.5557, "mean_token_accuracy": 0.8245518878102303, "num_tokens": 727641712.0, "step": 22800 }, { "entropy": 0.4449690734036267, "epoch": 2.0978027728420194, "grad_norm": 0.15932397544384003, "learning_rate": 3.0076363970926492e-05, "loss": 0.4245, "mean_token_accuracy": 0.8633051104843616, "num_tokens": 727673715.0, "step": 22801 }, { "entropy": 0.45571704767644405, "epoch": 2.0978947792134606, "grad_norm": 0.14886850118637085, "learning_rate": 3.0073297144784864e-05, "loss": 0.4287, "mean_token_accuracy": 0.8634243905544281, "num_tokens": 727706060.0, "step": 22802 }, { "entropy": 0.5007363455370069, "epoch": 2.0979867855849017, "grad_norm": 0.15520542860031128, "learning_rate": 3.0070230318643238e-05, "loss": 0.4858, "mean_token_accuracy": 0.8435437828302383, "num_tokens": 727738175.0, "step": 22803 }, { "entropy": 0.4742095749825239, "epoch": 2.098078791956343, "grad_norm": 0.1555846631526947, "learning_rate": 3.006716349250161e-05, "loss": 0.4559, "mean_token_accuracy": 0.8575369194149971, "num_tokens": 727770365.0, "step": 22804 }, { "entropy": 0.44678105087950826, "epoch": 2.098170798327784, "grad_norm": 0.15242819488048553, "learning_rate": 3.0064096666359988e-05, "loss": 0.429, "mean_token_accuracy": 0.8632726483047009, "num_tokens": 727802870.0, "step": 22805 }, { "entropy": 0.4327684957534075, "epoch": 2.0982628046992255, "grad_norm": 0.14625921845436096, "learning_rate": 3.006102984021836e-05, "loss": 0.4055, "mean_token_accuracy": 0.8698519058525562, "num_tokens": 727834879.0, "step": 22806 }, { "entropy": 0.46984450588934124, "epoch": 2.0983548110706667, "grad_norm": 0.1549854427576065, "learning_rate": 3.0057963014076733e-05, "loss": 0.4528, "mean_token_accuracy": 0.8562501780688763, "num_tokens": 727867563.0, "step": 22807 }, { "entropy": 0.49481016118079424, "epoch": 2.098446817442108, "grad_norm": 0.16619615256786346, "learning_rate": 3.0054896187935105e-05, "loss": 0.4897, "mean_token_accuracy": 0.8417747989296913, "num_tokens": 727898478.0, "step": 22808 }, { "entropy": 0.39294508192688227, "epoch": 2.098538823813549, "grad_norm": 0.1414063721895218, "learning_rate": 3.0051829361793483e-05, "loss": 0.3777, "mean_token_accuracy": 0.8813646398484707, "num_tokens": 727931157.0, "step": 22809 }, { "entropy": 0.6158612677827477, "epoch": 2.0986308301849905, "grad_norm": 0.18231932818889618, "learning_rate": 3.0048762535651854e-05, "loss": 0.5864, "mean_token_accuracy": 0.8135704882442951, "num_tokens": 727962135.0, "step": 22810 }, { "entropy": 0.5317228604108095, "epoch": 2.0987228365564317, "grad_norm": 0.16558150947093964, "learning_rate": 3.004569570951023e-05, "loss": 0.5062, "mean_token_accuracy": 0.8388153053820133, "num_tokens": 727992537.0, "step": 22811 }, { "entropy": 0.5488553047180176, "epoch": 2.098814842927873, "grad_norm": 0.16718445718288422, "learning_rate": 3.00426288833686e-05, "loss": 0.5232, "mean_token_accuracy": 0.833520133048296, "num_tokens": 728024084.0, "step": 22812 }, { "entropy": 0.6145112374797463, "epoch": 2.098906849299314, "grad_norm": 0.17228540778160095, "learning_rate": 3.0039562057226978e-05, "loss": 0.6052, "mean_token_accuracy": 0.8125412352383137, "num_tokens": 728056491.0, "step": 22813 }, { "entropy": 0.5063165100291371, "epoch": 2.098998855670755, "grad_norm": 0.16039539873600006, "learning_rate": 3.003649523108535e-05, "loss": 0.4961, "mean_token_accuracy": 0.8436312302947044, "num_tokens": 728088185.0, "step": 22814 }, { "entropy": 0.5500717260874808, "epoch": 2.0990908620421966, "grad_norm": 0.16108383238315582, "learning_rate": 3.0033428404943724e-05, "loss": 0.5465, "mean_token_accuracy": 0.8333496265113354, "num_tokens": 728120342.0, "step": 22815 }, { "entropy": 0.5204677525907755, "epoch": 2.0991828684136378, "grad_norm": 0.16094450652599335, "learning_rate": 3.0030361578802095e-05, "loss": 0.4935, "mean_token_accuracy": 0.8427911512553692, "num_tokens": 728152533.0, "step": 22816 }, { "entropy": 0.4650015039369464, "epoch": 2.099274874785079, "grad_norm": 0.1546032726764679, "learning_rate": 3.0027294752660473e-05, "loss": 0.438, "mean_token_accuracy": 0.8596246726810932, "num_tokens": 728184503.0, "step": 22817 }, { "entropy": 0.49511182121932507, "epoch": 2.09936688115652, "grad_norm": 0.1584109365940094, "learning_rate": 3.002422792651885e-05, "loss": 0.479, "mean_token_accuracy": 0.8483413681387901, "num_tokens": 728216723.0, "step": 22818 }, { "entropy": 0.6279781409539282, "epoch": 2.099458887527961, "grad_norm": 0.1706785261631012, "learning_rate": 3.0021161100377222e-05, "loss": 0.6109, "mean_token_accuracy": 0.807793878018856, "num_tokens": 728248765.0, "step": 22819 }, { "entropy": 0.4804857103154063, "epoch": 2.0995508938994027, "grad_norm": 0.148964062333107, "learning_rate": 3.0018094274235597e-05, "loss": 0.4681, "mean_token_accuracy": 0.8488687202334404, "num_tokens": 728281352.0, "step": 22820 }, { "entropy": 0.5694323647767305, "epoch": 2.099642900270844, "grad_norm": 0.1686541587114334, "learning_rate": 3.001502744809397e-05, "loss": 0.5592, "mean_token_accuracy": 0.8274555690586567, "num_tokens": 728313455.0, "step": 22821 }, { "entropy": 0.6334991417825222, "epoch": 2.099734906642285, "grad_norm": 0.17108802497386932, "learning_rate": 3.0011960621952346e-05, "loss": 0.6092, "mean_token_accuracy": 0.80689911916852, "num_tokens": 728345371.0, "step": 22822 }, { "entropy": 0.5221232855692506, "epoch": 2.099826913013726, "grad_norm": 0.16138915717601776, "learning_rate": 3.0008893795810718e-05, "loss": 0.5034, "mean_token_accuracy": 0.8376987427473068, "num_tokens": 728377001.0, "step": 22823 }, { "entropy": 0.5222785137593746, "epoch": 2.0999189193851673, "grad_norm": 0.1662609875202179, "learning_rate": 3.0005826969669092e-05, "loss": 0.5178, "mean_token_accuracy": 0.8320596851408482, "num_tokens": 728408350.0, "step": 22824 }, { "entropy": 0.5065051377750933, "epoch": 2.100010925756609, "grad_norm": 0.16608069837093353, "learning_rate": 3.0002760143527464e-05, "loss": 0.4974, "mean_token_accuracy": 0.8427172377705574, "num_tokens": 728439557.0, "step": 22825 }, { "entropy": 0.4974612542428076, "epoch": 2.10010293212805, "grad_norm": 0.15730850398540497, "learning_rate": 2.999969331738584e-05, "loss": 0.4752, "mean_token_accuracy": 0.8472037464380264, "num_tokens": 728471256.0, "step": 22826 }, { "entropy": 0.5751926386728883, "epoch": 2.100194938499491, "grad_norm": 0.16830860078334808, "learning_rate": 2.9996626491244213e-05, "loss": 0.5557, "mean_token_accuracy": 0.8214105926454067, "num_tokens": 728502211.0, "step": 22827 }, { "entropy": 0.4838026473298669, "epoch": 2.1002869448709323, "grad_norm": 0.15604358911514282, "learning_rate": 2.9993559665102588e-05, "loss": 0.4732, "mean_token_accuracy": 0.849450409412384, "num_tokens": 728534790.0, "step": 22828 }, { "entropy": 0.48582740873098373, "epoch": 2.1003789512423734, "grad_norm": 0.16317136585712433, "learning_rate": 2.999049283896096e-05, "loss": 0.4822, "mean_token_accuracy": 0.8443153090775013, "num_tokens": 728566754.0, "step": 22829 }, { "entropy": 0.5974267534911633, "epoch": 2.100470957613815, "grad_norm": 0.17140896618366241, "learning_rate": 2.9987426012819337e-05, "loss": 0.5918, "mean_token_accuracy": 0.8154514133930206, "num_tokens": 728599499.0, "step": 22830 }, { "entropy": 0.5533296698704362, "epoch": 2.100562963985256, "grad_norm": 0.16653503477573395, "learning_rate": 2.9984359186677708e-05, "loss": 0.5404, "mean_token_accuracy": 0.8274101875722408, "num_tokens": 728631179.0, "step": 22831 }, { "entropy": 0.4638023469597101, "epoch": 2.1006549703566972, "grad_norm": 0.15607069432735443, "learning_rate": 2.9981292360536083e-05, "loss": 0.454, "mean_token_accuracy": 0.8551149964332581, "num_tokens": 728663141.0, "step": 22832 }, { "entropy": 0.4655702302698046, "epoch": 2.1007469767281384, "grad_norm": 0.15590143203735352, "learning_rate": 2.9978225534394454e-05, "loss": 0.4573, "mean_token_accuracy": 0.8521529883146286, "num_tokens": 728695227.0, "step": 22833 }, { "entropy": 0.5298623144626617, "epoch": 2.1008389830995795, "grad_norm": 0.16601575911045074, "learning_rate": 2.9975158708252832e-05, "loss": 0.5156, "mean_token_accuracy": 0.8350227847695351, "num_tokens": 728727261.0, "step": 22834 }, { "entropy": 0.4704971518367529, "epoch": 2.100930989471021, "grad_norm": 0.15946736931800842, "learning_rate": 2.9972091882111203e-05, "loss": 0.4625, "mean_token_accuracy": 0.8512221351265907, "num_tokens": 728759592.0, "step": 22835 }, { "entropy": 0.5346943121403456, "epoch": 2.101022995842462, "grad_norm": 0.15744750201702118, "learning_rate": 2.9969025055969578e-05, "loss": 0.523, "mean_token_accuracy": 0.8342969082295895, "num_tokens": 728792188.0, "step": 22836 }, { "entropy": 0.5896954778581858, "epoch": 2.1011150022139033, "grad_norm": 0.17210949957370758, "learning_rate": 2.996595822982795e-05, "loss": 0.5626, "mean_token_accuracy": 0.8224927671253681, "num_tokens": 728823358.0, "step": 22837 }, { "entropy": 0.5397261781617999, "epoch": 2.1012070085853445, "grad_norm": 0.16620057821273804, "learning_rate": 2.9962891403686327e-05, "loss": 0.5212, "mean_token_accuracy": 0.8363254815340042, "num_tokens": 728855035.0, "step": 22838 }, { "entropy": 0.5936598759144545, "epoch": 2.1012990149567856, "grad_norm": 0.17262640595436096, "learning_rate": 2.99598245775447e-05, "loss": 0.573, "mean_token_accuracy": 0.8180497363209724, "num_tokens": 728886991.0, "step": 22839 }, { "entropy": 0.49348919186741114, "epoch": 2.101391021328227, "grad_norm": 0.15869322419166565, "learning_rate": 2.9956757751403077e-05, "loss": 0.4719, "mean_token_accuracy": 0.8485983461141586, "num_tokens": 728918907.0, "step": 22840 }, { "entropy": 0.5100497901439667, "epoch": 2.1014830276996683, "grad_norm": 0.16399694979190826, "learning_rate": 2.9953690925261448e-05, "loss": 0.497, "mean_token_accuracy": 0.8389025777578354, "num_tokens": 728951023.0, "step": 22841 }, { "entropy": 0.45325865503400564, "epoch": 2.1015750340711095, "grad_norm": 0.1569947451353073, "learning_rate": 2.9950624099119822e-05, "loss": 0.444, "mean_token_accuracy": 0.8587599620223045, "num_tokens": 728982152.0, "step": 22842 }, { "entropy": 0.5412753624841571, "epoch": 2.1016670404425506, "grad_norm": 0.16337072849273682, "learning_rate": 2.9947557272978194e-05, "loss": 0.5284, "mean_token_accuracy": 0.8317077048122883, "num_tokens": 729014311.0, "step": 22843 }, { "entropy": 0.4316125132609159, "epoch": 2.1017590468139917, "grad_norm": 0.15597988665103912, "learning_rate": 2.9944490446836572e-05, "loss": 0.4211, "mean_token_accuracy": 0.8672707453370094, "num_tokens": 729045938.0, "step": 22844 }, { "entropy": 0.5372802317142487, "epoch": 2.1018510531854333, "grad_norm": 0.1635502576828003, "learning_rate": 2.9941423620694943e-05, "loss": 0.5316, "mean_token_accuracy": 0.8314673081040382, "num_tokens": 729077827.0, "step": 22845 }, { "entropy": 0.5122205326333642, "epoch": 2.1019430595568744, "grad_norm": 0.16167622804641724, "learning_rate": 2.9938356794553318e-05, "loss": 0.505, "mean_token_accuracy": 0.8362935483455658, "num_tokens": 729110305.0, "step": 22846 }, { "entropy": 0.5353304017335176, "epoch": 2.1020350659283156, "grad_norm": 0.16455799341201782, "learning_rate": 2.993528996841169e-05, "loss": 0.5152, "mean_token_accuracy": 0.8372282832860947, "num_tokens": 729141678.0, "step": 22847 }, { "entropy": 0.45566285215318203, "epoch": 2.1021270722997567, "grad_norm": 0.1585477590560913, "learning_rate": 2.9932223142270067e-05, "loss": 0.4554, "mean_token_accuracy": 0.8568815216422081, "num_tokens": 729173791.0, "step": 22848 }, { "entropy": 0.49195193126797676, "epoch": 2.102219078671198, "grad_norm": 0.1633092164993286, "learning_rate": 2.992915631612844e-05, "loss": 0.4726, "mean_token_accuracy": 0.848917756229639, "num_tokens": 729205430.0, "step": 22849 }, { "entropy": 0.47965950751677155, "epoch": 2.1023110850426394, "grad_norm": 0.15432915091514587, "learning_rate": 2.9926089489986813e-05, "loss": 0.4631, "mean_token_accuracy": 0.851491667330265, "num_tokens": 729237509.0, "step": 22850 }, { "entropy": 0.49265166698023677, "epoch": 2.1024030914140805, "grad_norm": 0.1565762162208557, "learning_rate": 2.992302266384519e-05, "loss": 0.4802, "mean_token_accuracy": 0.8457052409648895, "num_tokens": 729269855.0, "step": 22851 }, { "entropy": 0.48917699418962, "epoch": 2.1024950977855217, "grad_norm": 0.16246937215328217, "learning_rate": 2.9919955837703562e-05, "loss": 0.4664, "mean_token_accuracy": 0.8488801680505276, "num_tokens": 729301076.0, "step": 22852 }, { "entropy": 0.527216924354434, "epoch": 2.102587104156963, "grad_norm": 0.15922175347805023, "learning_rate": 2.9916889011561937e-05, "loss": 0.5083, "mean_token_accuracy": 0.8391950912773609, "num_tokens": 729333056.0, "step": 22853 }, { "entropy": 0.5669365245848894, "epoch": 2.102679110528404, "grad_norm": 0.17427030205726624, "learning_rate": 2.9913822185420308e-05, "loss": 0.5584, "mean_token_accuracy": 0.82309764996171, "num_tokens": 729363362.0, "step": 22854 }, { "entropy": 0.5298520047217607, "epoch": 2.1027711168998455, "grad_norm": 0.15626566112041473, "learning_rate": 2.9910755359278686e-05, "loss": 0.5134, "mean_token_accuracy": 0.8362511359155178, "num_tokens": 729395541.0, "step": 22855 }, { "entropy": 0.5752904070541263, "epoch": 2.1028631232712867, "grad_norm": 0.16800116002559662, "learning_rate": 2.9907688533137057e-05, "loss": 0.5465, "mean_token_accuracy": 0.824533648788929, "num_tokens": 729426754.0, "step": 22856 }, { "entropy": 0.5977001572027802, "epoch": 2.102955129642728, "grad_norm": 0.16965532302856445, "learning_rate": 2.9904621706995435e-05, "loss": 0.5828, "mean_token_accuracy": 0.8162357434630394, "num_tokens": 729458489.0, "step": 22857 }, { "entropy": 0.4936964015942067, "epoch": 2.103047136014169, "grad_norm": 0.1542668342590332, "learning_rate": 2.9901554880853803e-05, "loss": 0.4822, "mean_token_accuracy": 0.8447039946913719, "num_tokens": 729490035.0, "step": 22858 }, { "entropy": 0.4712307648733258, "epoch": 2.10313914238561, "grad_norm": 0.1536760777235031, "learning_rate": 2.989848805471218e-05, "loss": 0.4489, "mean_token_accuracy": 0.8548024967312813, "num_tokens": 729522089.0, "step": 22859 }, { "entropy": 0.6110823089256883, "epoch": 2.1032311487570516, "grad_norm": 0.16808770596981049, "learning_rate": 2.9895421228570553e-05, "loss": 0.5966, "mean_token_accuracy": 0.8133853822946548, "num_tokens": 729554332.0, "step": 22860 }, { "entropy": 0.4866133201867342, "epoch": 2.1033231551284928, "grad_norm": 0.15304158627986908, "learning_rate": 2.989235440242893e-05, "loss": 0.473, "mean_token_accuracy": 0.8485248573124409, "num_tokens": 729586308.0, "step": 22861 }, { "entropy": 0.5418924633413553, "epoch": 2.103415161499934, "grad_norm": 0.16754111647605896, "learning_rate": 2.9889287576287302e-05, "loss": 0.5349, "mean_token_accuracy": 0.8297210298478603, "num_tokens": 729618349.0, "step": 22862 }, { "entropy": 0.5736800734885037, "epoch": 2.103507167871375, "grad_norm": 0.16623151302337646, "learning_rate": 2.9886220750145676e-05, "loss": 0.556, "mean_token_accuracy": 0.8218614719808102, "num_tokens": 729650746.0, "step": 22863 }, { "entropy": 0.45393372513353825, "epoch": 2.103599174242816, "grad_norm": 0.15761950612068176, "learning_rate": 2.9883153924004048e-05, "loss": 0.4508, "mean_token_accuracy": 0.8557172566652298, "num_tokens": 729682758.0, "step": 22864 }, { "entropy": 0.549815071746707, "epoch": 2.1036911806142577, "grad_norm": 0.16562722623348236, "learning_rate": 2.9880087097862426e-05, "loss": 0.5301, "mean_token_accuracy": 0.8315704725682735, "num_tokens": 729714617.0, "step": 22865 }, { "entropy": 0.5394445117563009, "epoch": 2.103783186985699, "grad_norm": 0.16210080683231354, "learning_rate": 2.9877020271720797e-05, "loss": 0.5233, "mean_token_accuracy": 0.8313228189945221, "num_tokens": 729747210.0, "step": 22866 }, { "entropy": 0.5157202437985688, "epoch": 2.10387519335714, "grad_norm": 0.15865521132946014, "learning_rate": 2.987395344557917e-05, "loss": 0.4876, "mean_token_accuracy": 0.8440041244029999, "num_tokens": 729778974.0, "step": 22867 }, { "entropy": 0.4579641930758953, "epoch": 2.103967199728581, "grad_norm": 0.15040484070777893, "learning_rate": 2.9870886619437543e-05, "loss": 0.4362, "mean_token_accuracy": 0.860031746327877, "num_tokens": 729811099.0, "step": 22868 }, { "entropy": 0.5789814125746489, "epoch": 2.1040592061000223, "grad_norm": 0.16972683370113373, "learning_rate": 2.986781979329592e-05, "loss": 0.5667, "mean_token_accuracy": 0.8232209533452988, "num_tokens": 729842730.0, "step": 22869 }, { "entropy": 0.5889539821073413, "epoch": 2.104151212471464, "grad_norm": 0.16386981308460236, "learning_rate": 2.9864752967154292e-05, "loss": 0.5753, "mean_token_accuracy": 0.8216349668800831, "num_tokens": 729874626.0, "step": 22870 }, { "entropy": 0.5510677620768547, "epoch": 2.104243218842905, "grad_norm": 0.1643325239419937, "learning_rate": 2.9861686141012667e-05, "loss": 0.5338, "mean_token_accuracy": 0.8330447860062122, "num_tokens": 729906966.0, "step": 22871 }, { "entropy": 0.5842300616204739, "epoch": 2.104335225214346, "grad_norm": 0.1647004932165146, "learning_rate": 2.9858619314871038e-05, "loss": 0.5585, "mean_token_accuracy": 0.8239427842199802, "num_tokens": 729938943.0, "step": 22872 }, { "entropy": 0.5612283004447818, "epoch": 2.1044272315857873, "grad_norm": 0.16832219064235687, "learning_rate": 2.9855552488729416e-05, "loss": 0.5453, "mean_token_accuracy": 0.8263469897210598, "num_tokens": 729971481.0, "step": 22873 }, { "entropy": 0.5423293048515916, "epoch": 2.1045192379572284, "grad_norm": 0.16181659698486328, "learning_rate": 2.9852485662587787e-05, "loss": 0.5055, "mean_token_accuracy": 0.8403125815093517, "num_tokens": 730002860.0, "step": 22874 }, { "entropy": 0.5188505714759231, "epoch": 2.10461124432867, "grad_norm": 0.16159506142139435, "learning_rate": 2.9849418836446162e-05, "loss": 0.5049, "mean_token_accuracy": 0.8377290964126587, "num_tokens": 730034465.0, "step": 22875 }, { "entropy": 0.5793077982962132, "epoch": 2.104703250700111, "grad_norm": 0.16542725265026093, "learning_rate": 2.9846352010304533e-05, "loss": 0.5659, "mean_token_accuracy": 0.8198866061866283, "num_tokens": 730066113.0, "step": 22876 }, { "entropy": 0.5694359689950943, "epoch": 2.1047952570715522, "grad_norm": 0.16624785959720612, "learning_rate": 2.984328518416291e-05, "loss": 0.5582, "mean_token_accuracy": 0.8231168501079082, "num_tokens": 730097313.0, "step": 22877 }, { "entropy": 0.44566704519093037, "epoch": 2.1048872634429934, "grad_norm": 0.15504074096679688, "learning_rate": 2.984021835802129e-05, "loss": 0.4285, "mean_token_accuracy": 0.8638571910560131, "num_tokens": 730129288.0, "step": 22878 }, { "entropy": 0.5485628694295883, "epoch": 2.1049792698144345, "grad_norm": 0.16160695254802704, "learning_rate": 2.983715153187966e-05, "loss": 0.5414, "mean_token_accuracy": 0.8293294161558151, "num_tokens": 730161808.0, "step": 22879 }, { "entropy": 0.49130330327898264, "epoch": 2.105071276185876, "grad_norm": 0.15856575965881348, "learning_rate": 2.9834084705738035e-05, "loss": 0.4857, "mean_token_accuracy": 0.8507229276001453, "num_tokens": 730194330.0, "step": 22880 }, { "entropy": 0.47883031796664, "epoch": 2.105163282557317, "grad_norm": 0.15816588699817657, "learning_rate": 2.9831017879596407e-05, "loss": 0.4703, "mean_token_accuracy": 0.8525837659835815, "num_tokens": 730225912.0, "step": 22881 }, { "entropy": 0.4281740728765726, "epoch": 2.1052552889287584, "grad_norm": 0.15217314660549164, "learning_rate": 2.9827951053454785e-05, "loss": 0.4205, "mean_token_accuracy": 0.8666140586137772, "num_tokens": 730257726.0, "step": 22882 }, { "entropy": 0.46893076598644257, "epoch": 2.1053472953001995, "grad_norm": 0.149758979678154, "learning_rate": 2.9824884227313156e-05, "loss": 0.4475, "mean_token_accuracy": 0.8581460490822792, "num_tokens": 730289822.0, "step": 22883 }, { "entropy": 0.5008244011551142, "epoch": 2.1054393016716406, "grad_norm": 0.14784234762191772, "learning_rate": 2.982181740117153e-05, "loss": 0.4867, "mean_token_accuracy": 0.8479166626930237, "num_tokens": 730322160.0, "step": 22884 }, { "entropy": 0.6074592294171453, "epoch": 2.105531308043082, "grad_norm": 0.17180633544921875, "learning_rate": 2.9818750575029902e-05, "loss": 0.5964, "mean_token_accuracy": 0.8146873861551285, "num_tokens": 730354137.0, "step": 22885 }, { "entropy": 0.5678798891603947, "epoch": 2.1056233144145233, "grad_norm": 0.16660411655902863, "learning_rate": 2.981568374888828e-05, "loss": 0.5586, "mean_token_accuracy": 0.8244721405208111, "num_tokens": 730385570.0, "step": 22886 }, { "entropy": 0.49751992896199226, "epoch": 2.1057153207859645, "grad_norm": 0.1526215821504593, "learning_rate": 2.981261692274665e-05, "loss": 0.473, "mean_token_accuracy": 0.8476595655083656, "num_tokens": 730417508.0, "step": 22887 }, { "entropy": 0.5604720022529364, "epoch": 2.1058073271574056, "grad_norm": 0.16528770327568054, "learning_rate": 2.9809550096605026e-05, "loss": 0.5434, "mean_token_accuracy": 0.828963078558445, "num_tokens": 730449505.0, "step": 22888 }, { "entropy": 0.4957893551327288, "epoch": 2.1058993335288467, "grad_norm": 0.16318276524543762, "learning_rate": 2.9806483270463397e-05, "loss": 0.4992, "mean_token_accuracy": 0.8435115218162537, "num_tokens": 730481482.0, "step": 22889 }, { "entropy": 0.49000347778201103, "epoch": 2.1059913399002883, "grad_norm": 0.1558503955602646, "learning_rate": 2.9803416444321775e-05, "loss": 0.4618, "mean_token_accuracy": 0.8492548801004887, "num_tokens": 730512934.0, "step": 22890 }, { "entropy": 0.5482386611402035, "epoch": 2.1060833462717294, "grad_norm": 0.16304998099803925, "learning_rate": 2.9800349618180146e-05, "loss": 0.5359, "mean_token_accuracy": 0.8306249901652336, "num_tokens": 730544740.0, "step": 22891 }, { "entropy": 0.5030636070296168, "epoch": 2.1061753526431706, "grad_norm": 0.16405686736106873, "learning_rate": 2.979728279203852e-05, "loss": 0.4914, "mean_token_accuracy": 0.8458584249019623, "num_tokens": 730576960.0, "step": 22892 }, { "entropy": 0.6541821081191301, "epoch": 2.1062673590146117, "grad_norm": 0.17696484923362732, "learning_rate": 2.9794215965896892e-05, "loss": 0.6297, "mean_token_accuracy": 0.8024156205356121, "num_tokens": 730608557.0, "step": 22893 }, { "entropy": 0.5632916344329715, "epoch": 2.106359365386053, "grad_norm": 0.16898813843727112, "learning_rate": 2.979114913975527e-05, "loss": 0.5464, "mean_token_accuracy": 0.8263812437653542, "num_tokens": 730640521.0, "step": 22894 }, { "entropy": 0.48309554532170296, "epoch": 2.1064513717574944, "grad_norm": 0.1601453274488449, "learning_rate": 2.978808231361364e-05, "loss": 0.4694, "mean_token_accuracy": 0.8473669588565826, "num_tokens": 730672481.0, "step": 22895 }, { "entropy": 0.4408524986356497, "epoch": 2.1065433781289356, "grad_norm": 0.1548348218202591, "learning_rate": 2.9785015487472016e-05, "loss": 0.4275, "mean_token_accuracy": 0.867288526147604, "num_tokens": 730704305.0, "step": 22896 }, { "entropy": 0.5166933527216315, "epoch": 2.1066353845003767, "grad_norm": 0.15699289739131927, "learning_rate": 2.9781948661330387e-05, "loss": 0.4931, "mean_token_accuracy": 0.8428776487708092, "num_tokens": 730736426.0, "step": 22897 }, { "entropy": 0.5544506469741464, "epoch": 2.106727390871818, "grad_norm": 0.1655285805463791, "learning_rate": 2.9778881835188765e-05, "loss": 0.5397, "mean_token_accuracy": 0.828845776617527, "num_tokens": 730768205.0, "step": 22898 }, { "entropy": 0.5833972729742527, "epoch": 2.106819397243259, "grad_norm": 0.17202189564704895, "learning_rate": 2.9775815009047137e-05, "loss": 0.5616, "mean_token_accuracy": 0.8203870058059692, "num_tokens": 730799132.0, "step": 22899 }, { "entropy": 0.5040646390989423, "epoch": 2.1069114036147005, "grad_norm": 0.15365025401115417, "learning_rate": 2.9772748182905515e-05, "loss": 0.4845, "mean_token_accuracy": 0.8477162234485149, "num_tokens": 730831834.0, "step": 22900 }, { "entropy": 0.5259168716147542, "epoch": 2.1070034099861417, "grad_norm": 0.1695622205734253, "learning_rate": 2.9769681356763886e-05, "loss": 0.5162, "mean_token_accuracy": 0.837074764072895, "num_tokens": 730864183.0, "step": 22901 }, { "entropy": 0.4893719684332609, "epoch": 2.107095416357583, "grad_norm": 0.16108983755111694, "learning_rate": 2.976661453062226e-05, "loss": 0.4665, "mean_token_accuracy": 0.8507754355669022, "num_tokens": 730895385.0, "step": 22902 }, { "entropy": 0.4435705281794071, "epoch": 2.107187422729024, "grad_norm": 0.14767614006996155, "learning_rate": 2.9763547704480632e-05, "loss": 0.4301, "mean_token_accuracy": 0.8596671223640442, "num_tokens": 730927064.0, "step": 22903 }, { "entropy": 0.48702552961185575, "epoch": 2.107279429100465, "grad_norm": 0.15799614787101746, "learning_rate": 2.976048087833901e-05, "loss": 0.4726, "mean_token_accuracy": 0.8489444181323051, "num_tokens": 730959233.0, "step": 22904 }, { "entropy": 0.476301426300779, "epoch": 2.1073714354719066, "grad_norm": 0.15075257420539856, "learning_rate": 2.975741405219738e-05, "loss": 0.4634, "mean_token_accuracy": 0.8520895056426525, "num_tokens": 730990902.0, "step": 22905 }, { "entropy": 0.6479711718857288, "epoch": 2.1074634418433478, "grad_norm": 0.17930708825588226, "learning_rate": 2.9754347226055756e-05, "loss": 0.6248, "mean_token_accuracy": 0.8045649155974388, "num_tokens": 731021962.0, "step": 22906 }, { "entropy": 0.5331138037145138, "epoch": 2.107555448214789, "grad_norm": 0.16488751769065857, "learning_rate": 2.9751280399914127e-05, "loss": 0.5152, "mean_token_accuracy": 0.8338759616017342, "num_tokens": 731054503.0, "step": 22907 }, { "entropy": 0.5236131011042744, "epoch": 2.10764745458623, "grad_norm": 0.15885446965694427, "learning_rate": 2.9748213573772505e-05, "loss": 0.5188, "mean_token_accuracy": 0.8353474549949169, "num_tokens": 731086831.0, "step": 22908 }, { "entropy": 0.5332627440802753, "epoch": 2.107739460957671, "grad_norm": 0.16411341726779938, "learning_rate": 2.974514674763088e-05, "loss": 0.516, "mean_token_accuracy": 0.8367175161838531, "num_tokens": 731118611.0, "step": 22909 }, { "entropy": 0.4725149106234312, "epoch": 2.1078314673291128, "grad_norm": 0.1582396924495697, "learning_rate": 2.974207992148925e-05, "loss": 0.4686, "mean_token_accuracy": 0.8521245568990707, "num_tokens": 731151125.0, "step": 22910 }, { "entropy": 0.4722012598067522, "epoch": 2.107923473700554, "grad_norm": 0.15430587530136108, "learning_rate": 2.973901309534763e-05, "loss": 0.4576, "mean_token_accuracy": 0.8537267670035362, "num_tokens": 731183828.0, "step": 22911 }, { "entropy": 0.5978923179209232, "epoch": 2.108015480071995, "grad_norm": 0.1722187101840973, "learning_rate": 2.9735946269206e-05, "loss": 0.5778, "mean_token_accuracy": 0.8173761516809464, "num_tokens": 731215545.0, "step": 22912 }, { "entropy": 0.5543837826699018, "epoch": 2.108107486443436, "grad_norm": 0.17256195843219757, "learning_rate": 2.9732879443064375e-05, "loss": 0.5494, "mean_token_accuracy": 0.8297157697379589, "num_tokens": 731246160.0, "step": 22913 }, { "entropy": 0.4331742827780545, "epoch": 2.1081994928148773, "grad_norm": 0.15077735483646393, "learning_rate": 2.9729812616922746e-05, "loss": 0.4225, "mean_token_accuracy": 0.8665119670331478, "num_tokens": 731278928.0, "step": 22914 }, { "entropy": 0.4621338974684477, "epoch": 2.108291499186319, "grad_norm": 0.15944808721542358, "learning_rate": 2.9726745790781124e-05, "loss": 0.4512, "mean_token_accuracy": 0.855555098503828, "num_tokens": 731310509.0, "step": 22915 }, { "entropy": 0.4833188112825155, "epoch": 2.10838350555776, "grad_norm": 0.15706463158130646, "learning_rate": 2.9723678964639496e-05, "loss": 0.4718, "mean_token_accuracy": 0.8504791595041752, "num_tokens": 731342341.0, "step": 22916 }, { "entropy": 0.5511418161913753, "epoch": 2.108475511929201, "grad_norm": 0.16523756086826324, "learning_rate": 2.9720612138497874e-05, "loss": 0.5319, "mean_token_accuracy": 0.8317261934280396, "num_tokens": 731374271.0, "step": 22917 }, { "entropy": 0.5405501844361424, "epoch": 2.1085675183006423, "grad_norm": 0.1574670672416687, "learning_rate": 2.971754531235624e-05, "loss": 0.5235, "mean_token_accuracy": 0.8302207328379154, "num_tokens": 731406753.0, "step": 22918 }, { "entropy": 0.6354760825634003, "epoch": 2.1086595246720834, "grad_norm": 0.1749548614025116, "learning_rate": 2.971447848621462e-05, "loss": 0.6138, "mean_token_accuracy": 0.8052751310169697, "num_tokens": 731438422.0, "step": 22919 }, { "entropy": 0.5334871453233063, "epoch": 2.108751531043525, "grad_norm": 0.1625843495130539, "learning_rate": 2.971141166007299e-05, "loss": 0.5184, "mean_token_accuracy": 0.8361893929541111, "num_tokens": 731470921.0, "step": 22920 }, { "entropy": 0.5262632090598345, "epoch": 2.108843537414966, "grad_norm": 0.1633625477552414, "learning_rate": 2.970834483393137e-05, "loss": 0.5263, "mean_token_accuracy": 0.8365722522139549, "num_tokens": 731503119.0, "step": 22921 }, { "entropy": 0.39742915728129447, "epoch": 2.1089355437864072, "grad_norm": 0.14609302580356598, "learning_rate": 2.970527800778974e-05, "loss": 0.387, "mean_token_accuracy": 0.8746142461895943, "num_tokens": 731534769.0, "step": 22922 }, { "entropy": 0.49015349498949945, "epoch": 2.1090275501578484, "grad_norm": 0.15681031346321106, "learning_rate": 2.9702211181648115e-05, "loss": 0.4719, "mean_token_accuracy": 0.848303098231554, "num_tokens": 731566325.0, "step": 22923 }, { "entropy": 0.5059064961969852, "epoch": 2.1091195565292895, "grad_norm": 0.1630149632692337, "learning_rate": 2.9699144355506486e-05, "loss": 0.4936, "mean_token_accuracy": 0.8438134901225567, "num_tokens": 731599015.0, "step": 22924 }, { "entropy": 0.547536700963974, "epoch": 2.109211562900731, "grad_norm": 0.1656537503004074, "learning_rate": 2.9696077529364864e-05, "loss": 0.5335, "mean_token_accuracy": 0.8305396288633347, "num_tokens": 731630957.0, "step": 22925 }, { "entropy": 0.5365731520578265, "epoch": 2.109303569272172, "grad_norm": 0.16717694699764252, "learning_rate": 2.9693010703223235e-05, "loss": 0.5197, "mean_token_accuracy": 0.8357802219688892, "num_tokens": 731662049.0, "step": 22926 }, { "entropy": 0.6050206981599331, "epoch": 2.1093955756436134, "grad_norm": 0.17099842429161072, "learning_rate": 2.968994387708161e-05, "loss": 0.5915, "mean_token_accuracy": 0.8155133686959743, "num_tokens": 731694401.0, "step": 22927 }, { "entropy": 0.521555726416409, "epoch": 2.1094875820150545, "grad_norm": 0.16959869861602783, "learning_rate": 2.968687705093998e-05, "loss": 0.5144, "mean_token_accuracy": 0.8383474983274937, "num_tokens": 731726613.0, "step": 22928 }, { "entropy": 0.5484418720006943, "epoch": 2.1095795883864956, "grad_norm": 0.16369295120239258, "learning_rate": 2.968381022479836e-05, "loss": 0.5364, "mean_token_accuracy": 0.8307933285832405, "num_tokens": 731758540.0, "step": 22929 }, { "entropy": 0.5907754525542259, "epoch": 2.109671594757937, "grad_norm": 0.16359303891658783, "learning_rate": 2.968074339865673e-05, "loss": 0.5775, "mean_token_accuracy": 0.8192752115428448, "num_tokens": 731791174.0, "step": 22930 }, { "entropy": 0.4288144023157656, "epoch": 2.1097636011293783, "grad_norm": 0.14849381148815155, "learning_rate": 2.9677676572515105e-05, "loss": 0.4124, "mean_token_accuracy": 0.8676838018000126, "num_tokens": 731823244.0, "step": 22931 }, { "entropy": 0.5415521850809455, "epoch": 2.1098556075008195, "grad_norm": 0.16122324764728546, "learning_rate": 2.9674609746373476e-05, "loss": 0.5155, "mean_token_accuracy": 0.8371446207165718, "num_tokens": 731855828.0, "step": 22932 }, { "entropy": 0.47413517627865076, "epoch": 2.1099476138722606, "grad_norm": 0.15510398149490356, "learning_rate": 2.9671542920231854e-05, "loss": 0.461, "mean_token_accuracy": 0.8544934280216694, "num_tokens": 731888581.0, "step": 22933 }, { "entropy": 0.5937707331031561, "epoch": 2.1100396202437017, "grad_norm": 0.1693655550479889, "learning_rate": 2.9668476094090226e-05, "loss": 0.5947, "mean_token_accuracy": 0.8152953162789345, "num_tokens": 731921158.0, "step": 22934 }, { "entropy": 0.6005253428593278, "epoch": 2.1101316266151433, "grad_norm": 0.17862749099731445, "learning_rate": 2.96654092679486e-05, "loss": 0.5872, "mean_token_accuracy": 0.8133177570998669, "num_tokens": 731953024.0, "step": 22935 }, { "entropy": 0.5021905628964305, "epoch": 2.1102236329865844, "grad_norm": 0.15831521153450012, "learning_rate": 2.966234244180697e-05, "loss": 0.4772, "mean_token_accuracy": 0.8471653684973717, "num_tokens": 731984412.0, "step": 22936 }, { "entropy": 0.48382079927250743, "epoch": 2.1103156393580256, "grad_norm": 0.15938976407051086, "learning_rate": 2.965927561566535e-05, "loss": 0.4854, "mean_token_accuracy": 0.8473847508430481, "num_tokens": 732016656.0, "step": 22937 }, { "entropy": 0.5863032438792288, "epoch": 2.1104076457294667, "grad_norm": 0.16499435901641846, "learning_rate": 2.965620878952372e-05, "loss": 0.5767, "mean_token_accuracy": 0.8193227127194405, "num_tokens": 732049062.0, "step": 22938 }, { "entropy": 0.5061192028224468, "epoch": 2.110499652100908, "grad_norm": 0.16198214888572693, "learning_rate": 2.96531419633821e-05, "loss": 0.4828, "mean_token_accuracy": 0.8458501882851124, "num_tokens": 732080393.0, "step": 22939 }, { "entropy": 0.46058296551927924, "epoch": 2.1105916584723494, "grad_norm": 0.15302543342113495, "learning_rate": 2.9650075137240474e-05, "loss": 0.4478, "mean_token_accuracy": 0.8576982393860817, "num_tokens": 732112846.0, "step": 22940 }, { "entropy": 0.4652694296091795, "epoch": 2.1106836648437906, "grad_norm": 0.1543063074350357, "learning_rate": 2.9647008311098845e-05, "loss": 0.4506, "mean_token_accuracy": 0.8564631454646587, "num_tokens": 732144608.0, "step": 22941 }, { "entropy": 0.4170175679028034, "epoch": 2.1107756712152317, "grad_norm": 0.1509009748697281, "learning_rate": 2.9643941484957223e-05, "loss": 0.4087, "mean_token_accuracy": 0.8694568201899529, "num_tokens": 732176436.0, "step": 22942 }, { "entropy": 0.6431980319321156, "epoch": 2.110867677586673, "grad_norm": 0.17376184463500977, "learning_rate": 2.9640874658815594e-05, "loss": 0.6333, "mean_token_accuracy": 0.7992641180753708, "num_tokens": 732208713.0, "step": 22943 }, { "entropy": 0.5146316606551409, "epoch": 2.110959683958114, "grad_norm": 0.16562321782112122, "learning_rate": 2.963780783267397e-05, "loss": 0.5067, "mean_token_accuracy": 0.8395199552178383, "num_tokens": 732240929.0, "step": 22944 }, { "entropy": 0.48471576906740665, "epoch": 2.1110516903295555, "grad_norm": 0.15856876969337463, "learning_rate": 2.963474100653234e-05, "loss": 0.4835, "mean_token_accuracy": 0.8460978753864765, "num_tokens": 732273247.0, "step": 22945 }, { "entropy": 0.5404588686069474, "epoch": 2.1111436967009967, "grad_norm": 0.16007627546787262, "learning_rate": 2.9631674180390718e-05, "loss": 0.5215, "mean_token_accuracy": 0.8348355405032635, "num_tokens": 732304862.0, "step": 22946 }, { "entropy": 0.473876534961164, "epoch": 2.111235703072438, "grad_norm": 0.15395426750183105, "learning_rate": 2.962860735424909e-05, "loss": 0.4587, "mean_token_accuracy": 0.8532060012221336, "num_tokens": 732337430.0, "step": 22947 }, { "entropy": 0.5026230048388243, "epoch": 2.111327709443879, "grad_norm": 0.15888401865959167, "learning_rate": 2.9625540528107464e-05, "loss": 0.5006, "mean_token_accuracy": 0.8399346098303795, "num_tokens": 732369834.0, "step": 22948 }, { "entropy": 0.4898689640685916, "epoch": 2.11141971581532, "grad_norm": 0.15931253135204315, "learning_rate": 2.9622473701965835e-05, "loss": 0.4673, "mean_token_accuracy": 0.8496352396905422, "num_tokens": 732401449.0, "step": 22949 }, { "entropy": 0.4265461312606931, "epoch": 2.1115117221867616, "grad_norm": 0.16635920107364655, "learning_rate": 2.9619406875824213e-05, "loss": 0.3962, "mean_token_accuracy": 0.8713601939380169, "num_tokens": 732432397.0, "step": 22950 }, { "entropy": 0.5253127161413431, "epoch": 2.1116037285582028, "grad_norm": 0.15897585451602936, "learning_rate": 2.9616340049682584e-05, "loss": 0.5143, "mean_token_accuracy": 0.8376057296991348, "num_tokens": 732464850.0, "step": 22951 }, { "entropy": 0.4850304527208209, "epoch": 2.111695734929644, "grad_norm": 0.15218375623226166, "learning_rate": 2.961327322354096e-05, "loss": 0.4673, "mean_token_accuracy": 0.8499058969318867, "num_tokens": 732497000.0, "step": 22952 }, { "entropy": 0.5367869399487972, "epoch": 2.111787741301085, "grad_norm": 0.15957021713256836, "learning_rate": 2.961020639739933e-05, "loss": 0.519, "mean_token_accuracy": 0.8363280892372131, "num_tokens": 732528522.0, "step": 22953 }, { "entropy": 0.5166562590748072, "epoch": 2.111879747672526, "grad_norm": 0.15652406215667725, "learning_rate": 2.960713957125771e-05, "loss": 0.4993, "mean_token_accuracy": 0.8416936621069908, "num_tokens": 732560759.0, "step": 22954 }, { "entropy": 0.4371368680149317, "epoch": 2.1119717540439678, "grad_norm": 0.14884580671787262, "learning_rate": 2.960407274511608e-05, "loss": 0.4167, "mean_token_accuracy": 0.8674926310777664, "num_tokens": 732592508.0, "step": 22955 }, { "entropy": 0.4468614892102778, "epoch": 2.112063760415409, "grad_norm": 0.14773398637771606, "learning_rate": 2.9601005918974454e-05, "loss": 0.4388, "mean_token_accuracy": 0.8612879030406475, "num_tokens": 732624399.0, "step": 22956 }, { "entropy": 0.46540382062084973, "epoch": 2.11215576678685, "grad_norm": 0.1595790982246399, "learning_rate": 2.9597939092832826e-05, "loss": 0.4501, "mean_token_accuracy": 0.8573299869894981, "num_tokens": 732656219.0, "step": 22957 }, { "entropy": 0.4672017516568303, "epoch": 2.112247773158291, "grad_norm": 0.15688647329807281, "learning_rate": 2.9594872266691204e-05, "loss": 0.4525, "mean_token_accuracy": 0.8587750010192394, "num_tokens": 732687237.0, "step": 22958 }, { "entropy": 0.5098302522674203, "epoch": 2.1123397795297323, "grad_norm": 0.1623287796974182, "learning_rate": 2.9591805440549575e-05, "loss": 0.505, "mean_token_accuracy": 0.8442295305430889, "num_tokens": 732717832.0, "step": 22959 }, { "entropy": 0.5751422410830855, "epoch": 2.112431785901174, "grad_norm": 0.17392219603061676, "learning_rate": 2.9588738614407953e-05, "loss": 0.5555, "mean_token_accuracy": 0.8264601975679398, "num_tokens": 732749476.0, "step": 22960 }, { "entropy": 0.4758309405297041, "epoch": 2.112523792272615, "grad_norm": 0.15474268794059753, "learning_rate": 2.9585671788266324e-05, "loss": 0.4537, "mean_token_accuracy": 0.8527866713702679, "num_tokens": 732781302.0, "step": 22961 }, { "entropy": 0.5791139714419842, "epoch": 2.112615798644056, "grad_norm": 0.1674172580242157, "learning_rate": 2.95826049621247e-05, "loss": 0.5567, "mean_token_accuracy": 0.8257323503494263, "num_tokens": 732813136.0, "step": 22962 }, { "entropy": 0.44055252079851925, "epoch": 2.1127078050154973, "grad_norm": 0.14758315682411194, "learning_rate": 2.957953813598307e-05, "loss": 0.4195, "mean_token_accuracy": 0.8674245104193687, "num_tokens": 732844960.0, "step": 22963 }, { "entropy": 0.5722184772603214, "epoch": 2.1127998113869384, "grad_norm": 0.16086113452911377, "learning_rate": 2.9576471309841448e-05, "loss": 0.548, "mean_token_accuracy": 0.8234597258269787, "num_tokens": 732877005.0, "step": 22964 }, { "entropy": 0.5165124982595444, "epoch": 2.11289181775838, "grad_norm": 0.16527393460273743, "learning_rate": 2.957340448369982e-05, "loss": 0.4923, "mean_token_accuracy": 0.8434286154806614, "num_tokens": 732908899.0, "step": 22965 }, { "entropy": 0.5845688059926033, "epoch": 2.112983824129821, "grad_norm": 0.16903910040855408, "learning_rate": 2.9570337657558194e-05, "loss": 0.5711, "mean_token_accuracy": 0.8192284479737282, "num_tokens": 732940873.0, "step": 22966 }, { "entropy": 0.5474888570606709, "epoch": 2.1130758305012622, "grad_norm": 0.16402818262577057, "learning_rate": 2.9567270831416565e-05, "loss": 0.5404, "mean_token_accuracy": 0.8284761309623718, "num_tokens": 732973258.0, "step": 22967 }, { "entropy": 0.5825364533811808, "epoch": 2.1131678368727034, "grad_norm": 0.17307820916175842, "learning_rate": 2.9564204005274943e-05, "loss": 0.5781, "mean_token_accuracy": 0.8168543428182602, "num_tokens": 733004321.0, "step": 22968 }, { "entropy": 0.44983753794804215, "epoch": 2.1132598432441445, "grad_norm": 0.15065181255340576, "learning_rate": 2.9561137179133315e-05, "loss": 0.4281, "mean_token_accuracy": 0.8635742552578449, "num_tokens": 733035890.0, "step": 22969 }, { "entropy": 0.5358957909047604, "epoch": 2.113351849615586, "grad_norm": 0.1626710295677185, "learning_rate": 2.955807035299169e-05, "loss": 0.5257, "mean_token_accuracy": 0.8373383991420269, "num_tokens": 733068139.0, "step": 22970 }, { "entropy": 0.5237115048803389, "epoch": 2.113443855987027, "grad_norm": 0.16055744886398315, "learning_rate": 2.9555003526850067e-05, "loss": 0.5184, "mean_token_accuracy": 0.8326804675161839, "num_tokens": 733099734.0, "step": 22971 }, { "entropy": 0.5466271489858627, "epoch": 2.1135358623584684, "grad_norm": 0.16336095333099365, "learning_rate": 2.955193670070844e-05, "loss": 0.5383, "mean_token_accuracy": 0.8304910138249397, "num_tokens": 733132007.0, "step": 22972 }, { "entropy": 0.5371264778077602, "epoch": 2.1136278687299095, "grad_norm": 0.16189563274383545, "learning_rate": 2.9548869874566813e-05, "loss": 0.5288, "mean_token_accuracy": 0.832602497190237, "num_tokens": 733163849.0, "step": 22973 }, { "entropy": 0.43162166653200984, "epoch": 2.1137198751013506, "grad_norm": 0.14894969761371613, "learning_rate": 2.9545803048425184e-05, "loss": 0.4129, "mean_token_accuracy": 0.8681604228913784, "num_tokens": 733195924.0, "step": 22974 }, { "entropy": 0.596395755186677, "epoch": 2.113811881472792, "grad_norm": 0.16398313641548157, "learning_rate": 2.9542736222283562e-05, "loss": 0.5807, "mean_token_accuracy": 0.8160440661013126, "num_tokens": 733227778.0, "step": 22975 }, { "entropy": 0.5451859571039677, "epoch": 2.1139038878442333, "grad_norm": 0.16372452676296234, "learning_rate": 2.9539669396141934e-05, "loss": 0.5367, "mean_token_accuracy": 0.8292380571365356, "num_tokens": 733260025.0, "step": 22976 }, { "entropy": 0.49705908773466945, "epoch": 2.1139958942156745, "grad_norm": 0.15636087954044342, "learning_rate": 2.9536602570000312e-05, "loss": 0.4862, "mean_token_accuracy": 0.8494794853031635, "num_tokens": 733291766.0, "step": 22977 }, { "entropy": 0.5729357455857098, "epoch": 2.1140879005871156, "grad_norm": 0.16622354090213776, "learning_rate": 2.953353574385868e-05, "loss": 0.5571, "mean_token_accuracy": 0.8229785859584808, "num_tokens": 733323120.0, "step": 22978 }, { "entropy": 0.5913463681936264, "epoch": 2.1141799069585567, "grad_norm": 0.16647778451442719, "learning_rate": 2.9530468917717058e-05, "loss": 0.5635, "mean_token_accuracy": 0.8207880072295666, "num_tokens": 733355148.0, "step": 22979 }, { "entropy": 0.5197525732219219, "epoch": 2.1142719133299983, "grad_norm": 0.1576247215270996, "learning_rate": 2.952740209157543e-05, "loss": 0.5001, "mean_token_accuracy": 0.8421337343752384, "num_tokens": 733387629.0, "step": 22980 }, { "entropy": 0.4866061247885227, "epoch": 2.1143639197014394, "grad_norm": 0.15138459205627441, "learning_rate": 2.9524335265433807e-05, "loss": 0.4641, "mean_token_accuracy": 0.8534373678267002, "num_tokens": 733419280.0, "step": 22981 }, { "entropy": 0.45902549382299185, "epoch": 2.1144559260728806, "grad_norm": 0.15692384541034698, "learning_rate": 2.9521268439292178e-05, "loss": 0.4492, "mean_token_accuracy": 0.8552880734205246, "num_tokens": 733450990.0, "step": 22982 }, { "entropy": 0.4976999806240201, "epoch": 2.1145479324443217, "grad_norm": 0.15750384330749512, "learning_rate": 2.9518201613150553e-05, "loss": 0.4747, "mean_token_accuracy": 0.84702393040061, "num_tokens": 733482410.0, "step": 22983 }, { "entropy": 0.5833371449261904, "epoch": 2.114639938815763, "grad_norm": 0.17145170271396637, "learning_rate": 2.9515134787008924e-05, "loss": 0.5789, "mean_token_accuracy": 0.8201572299003601, "num_tokens": 733514651.0, "step": 22984 }, { "entropy": 0.4701555445790291, "epoch": 2.1147319451872044, "grad_norm": 0.1596551388502121, "learning_rate": 2.9512067960867302e-05, "loss": 0.4516, "mean_token_accuracy": 0.8554685339331627, "num_tokens": 733546304.0, "step": 22985 }, { "entropy": 0.4587017558515072, "epoch": 2.1148239515586456, "grad_norm": 0.1545988768339157, "learning_rate": 2.9509001134725673e-05, "loss": 0.4347, "mean_token_accuracy": 0.8612982109189034, "num_tokens": 733577604.0, "step": 22986 }, { "entropy": 0.45231487043201923, "epoch": 2.1149159579300867, "grad_norm": 0.1534222662448883, "learning_rate": 2.9505934308584048e-05, "loss": 0.4462, "mean_token_accuracy": 0.8568314276635647, "num_tokens": 733609970.0, "step": 22987 }, { "entropy": 0.5386650075670332, "epoch": 2.115007964301528, "grad_norm": 0.15849736332893372, "learning_rate": 2.950286748244242e-05, "loss": 0.5301, "mean_token_accuracy": 0.8336610458791256, "num_tokens": 733642356.0, "step": 22988 }, { "entropy": 0.5897831153124571, "epoch": 2.115099970672969, "grad_norm": 0.1715707778930664, "learning_rate": 2.9499800656300797e-05, "loss": 0.5975, "mean_token_accuracy": 0.8144503310322762, "num_tokens": 733674188.0, "step": 22989 }, { "entropy": 0.50966956326738, "epoch": 2.1151919770444105, "grad_norm": 0.16328264772891998, "learning_rate": 2.949673383015917e-05, "loss": 0.4891, "mean_token_accuracy": 0.8437913618981838, "num_tokens": 733706212.0, "step": 22990 }, { "entropy": 0.5148949045687914, "epoch": 2.1152839834158517, "grad_norm": 0.1668267399072647, "learning_rate": 2.9493667004017543e-05, "loss": 0.5183, "mean_token_accuracy": 0.8385557271540165, "num_tokens": 733738149.0, "step": 22991 }, { "entropy": 0.5611559904646128, "epoch": 2.115375989787293, "grad_norm": 0.16689181327819824, "learning_rate": 2.9490600177875915e-05, "loss": 0.5577, "mean_token_accuracy": 0.8253151476383209, "num_tokens": 733769913.0, "step": 22992 }, { "entropy": 0.5238634292036295, "epoch": 2.115467996158734, "grad_norm": 0.16698522865772247, "learning_rate": 2.9487533351734293e-05, "loss": 0.519, "mean_token_accuracy": 0.8327458947896957, "num_tokens": 733802068.0, "step": 22993 }, { "entropy": 0.5479928019922227, "epoch": 2.115560002530175, "grad_norm": 0.1601426899433136, "learning_rate": 2.9484466525592664e-05, "loss": 0.5341, "mean_token_accuracy": 0.8331029824912548, "num_tokens": 733834218.0, "step": 22994 }, { "entropy": 0.47201912850141525, "epoch": 2.1156520089016166, "grad_norm": 0.16040806472301483, "learning_rate": 2.948139969945104e-05, "loss": 0.462, "mean_token_accuracy": 0.8514688722789288, "num_tokens": 733865527.0, "step": 22995 }, { "entropy": 0.5030275373719633, "epoch": 2.1157440152730578, "grad_norm": 0.16429398953914642, "learning_rate": 2.947833287330941e-05, "loss": 0.4921, "mean_token_accuracy": 0.844839196652174, "num_tokens": 733897531.0, "step": 22996 }, { "entropy": 0.5904878191649914, "epoch": 2.115836021644499, "grad_norm": 0.1738712191581726, "learning_rate": 2.9475266047167788e-05, "loss": 0.5676, "mean_token_accuracy": 0.8173486776649952, "num_tokens": 733928683.0, "step": 22997 }, { "entropy": 0.46417500264942646, "epoch": 2.11592802801594, "grad_norm": 0.15016086399555206, "learning_rate": 2.947219922102616e-05, "loss": 0.45, "mean_token_accuracy": 0.8585388362407684, "num_tokens": 733960537.0, "step": 22998 }, { "entropy": 0.5711429324001074, "epoch": 2.116020034387381, "grad_norm": 0.17055797576904297, "learning_rate": 2.9469132394884537e-05, "loss": 0.5637, "mean_token_accuracy": 0.8248819969594479, "num_tokens": 733991304.0, "step": 22999 }, { "entropy": 0.4867242481559515, "epoch": 2.1161120407588228, "grad_norm": 0.15362833440303802, "learning_rate": 2.9466065568742912e-05, "loss": 0.476, "mean_token_accuracy": 0.8511790372431278, "num_tokens": 734023435.0, "step": 23000 }, { "entropy": 0.5475149899721146, "epoch": 2.116204047130264, "grad_norm": 0.1657239943742752, "learning_rate": 2.9462998742601283e-05, "loss": 0.5305, "mean_token_accuracy": 0.8348961882293224, "num_tokens": 734055222.0, "step": 23001 }, { "entropy": 0.5073411948978901, "epoch": 2.116296053501705, "grad_norm": 0.1613200157880783, "learning_rate": 2.945993191645966e-05, "loss": 0.4756, "mean_token_accuracy": 0.8474737256765366, "num_tokens": 734087407.0, "step": 23002 }, { "entropy": 0.4744142016861588, "epoch": 2.116388059873146, "grad_norm": 0.15311206877231598, "learning_rate": 2.9456865090318032e-05, "loss": 0.4561, "mean_token_accuracy": 0.8539328873157501, "num_tokens": 734120044.0, "step": 23003 }, { "entropy": 0.5718567054718733, "epoch": 2.1164800662445873, "grad_norm": 0.16708368062973022, "learning_rate": 2.9453798264176407e-05, "loss": 0.549, "mean_token_accuracy": 0.8289631009101868, "num_tokens": 734151674.0, "step": 23004 }, { "entropy": 0.5376359988003969, "epoch": 2.116572072616029, "grad_norm": 0.16085897386074066, "learning_rate": 2.9450731438034778e-05, "loss": 0.5198, "mean_token_accuracy": 0.8383161649107933, "num_tokens": 734183431.0, "step": 23005 }, { "entropy": 0.4791726302355528, "epoch": 2.11666407898747, "grad_norm": 0.15086856484413147, "learning_rate": 2.9447664611893156e-05, "loss": 0.4649, "mean_token_accuracy": 0.8497005179524422, "num_tokens": 734215721.0, "step": 23006 }, { "entropy": 0.5074436943978071, "epoch": 2.116756085358911, "grad_norm": 0.15674111247062683, "learning_rate": 2.9444597785751527e-05, "loss": 0.4845, "mean_token_accuracy": 0.8455780111253262, "num_tokens": 734248016.0, "step": 23007 }, { "entropy": 0.40993557358160615, "epoch": 2.1168480917303523, "grad_norm": 0.14563167095184326, "learning_rate": 2.9441530959609902e-05, "loss": 0.3867, "mean_token_accuracy": 0.8709473572671413, "num_tokens": 734279642.0, "step": 23008 }, { "entropy": 0.45695146452635527, "epoch": 2.1169400981017934, "grad_norm": 0.1528284102678299, "learning_rate": 2.9438464133468273e-05, "loss": 0.438, "mean_token_accuracy": 0.8591111153364182, "num_tokens": 734311293.0, "step": 23009 }, { "entropy": 0.5417654728516936, "epoch": 2.117032104473235, "grad_norm": 0.16300764679908752, "learning_rate": 2.943539730732665e-05, "loss": 0.5277, "mean_token_accuracy": 0.8323596641421318, "num_tokens": 734343452.0, "step": 23010 }, { "entropy": 0.46153734903782606, "epoch": 2.117124110844676, "grad_norm": 0.15311802923679352, "learning_rate": 2.9432330481185023e-05, "loss": 0.4492, "mean_token_accuracy": 0.8546367697417736, "num_tokens": 734375692.0, "step": 23011 }, { "entropy": 0.5005263593047857, "epoch": 2.1172161172161172, "grad_norm": 0.1604296863079071, "learning_rate": 2.9429263655043397e-05, "loss": 0.4894, "mean_token_accuracy": 0.8435325883328915, "num_tokens": 734407969.0, "step": 23012 }, { "entropy": 0.37510207667946815, "epoch": 2.1173081235875584, "grad_norm": 0.14223834872245789, "learning_rate": 2.942619682890177e-05, "loss": 0.3604, "mean_token_accuracy": 0.8827738612890244, "num_tokens": 734440170.0, "step": 23013 }, { "entropy": 0.5248089581727982, "epoch": 2.1174001299589995, "grad_norm": 0.16018320620059967, "learning_rate": 2.9423130002760147e-05, "loss": 0.516, "mean_token_accuracy": 0.8350024372339249, "num_tokens": 734472938.0, "step": 23014 }, { "entropy": 0.5442456882447004, "epoch": 2.117492136330441, "grad_norm": 0.16131961345672607, "learning_rate": 2.9420063176618518e-05, "loss": 0.5468, "mean_token_accuracy": 0.8305110521614552, "num_tokens": 734504641.0, "step": 23015 }, { "entropy": 0.44221052853390574, "epoch": 2.117584142701882, "grad_norm": 0.14877717196941376, "learning_rate": 2.9416996350476893e-05, "loss": 0.4247, "mean_token_accuracy": 0.8639558963477612, "num_tokens": 734537203.0, "step": 23016 }, { "entropy": 0.5430961977690458, "epoch": 2.1176761490733234, "grad_norm": 0.16490846872329712, "learning_rate": 2.9413929524335264e-05, "loss": 0.5349, "mean_token_accuracy": 0.8320132941007614, "num_tokens": 734569311.0, "step": 23017 }, { "entropy": 0.5425811652094126, "epoch": 2.1177681554447645, "grad_norm": 0.1663912981748581, "learning_rate": 2.9410862698193642e-05, "loss": 0.532, "mean_token_accuracy": 0.8308934569358826, "num_tokens": 734600738.0, "step": 23018 }, { "entropy": 0.45792086934670806, "epoch": 2.1178601618162056, "grad_norm": 0.15161532163619995, "learning_rate": 2.9407795872052013e-05, "loss": 0.4462, "mean_token_accuracy": 0.8599408641457558, "num_tokens": 734632707.0, "step": 23019 }, { "entropy": 0.5229132324457169, "epoch": 2.117952168187647, "grad_norm": 0.16369308531284332, "learning_rate": 2.940472904591039e-05, "loss": 0.5115, "mean_token_accuracy": 0.8398680947721004, "num_tokens": 734664205.0, "step": 23020 }, { "entropy": 0.5877560395747423, "epoch": 2.1180441745590883, "grad_norm": 0.17134368419647217, "learning_rate": 2.9401662219768762e-05, "loss": 0.5701, "mean_token_accuracy": 0.819709800183773, "num_tokens": 734695618.0, "step": 23021 }, { "entropy": 0.44748622365295887, "epoch": 2.1181361809305295, "grad_norm": 0.15812332928180695, "learning_rate": 2.9398595393627137e-05, "loss": 0.4403, "mean_token_accuracy": 0.8559484779834747, "num_tokens": 734726970.0, "step": 23022 }, { "entropy": 0.5558976419270039, "epoch": 2.1182281873019706, "grad_norm": 0.16792817413806915, "learning_rate": 2.9395528567485508e-05, "loss": 0.5429, "mean_token_accuracy": 0.8281878307461739, "num_tokens": 734758874.0, "step": 23023 }, { "entropy": 0.5103856297209859, "epoch": 2.1183201936734117, "grad_norm": 0.15834486484527588, "learning_rate": 2.9392461741343886e-05, "loss": 0.4934, "mean_token_accuracy": 0.8440880700945854, "num_tokens": 734790788.0, "step": 23024 }, { "entropy": 0.5265940055251122, "epoch": 2.1184122000448533, "grad_norm": 0.16825734078884125, "learning_rate": 2.9389394915202258e-05, "loss": 0.5305, "mean_token_accuracy": 0.835325762629509, "num_tokens": 734823044.0, "step": 23025 }, { "entropy": 0.549311101436615, "epoch": 2.1185042064162944, "grad_norm": 0.16421177983283997, "learning_rate": 2.9386328089060632e-05, "loss": 0.5305, "mean_token_accuracy": 0.8305770084261894, "num_tokens": 734854867.0, "step": 23026 }, { "entropy": 0.5865439549088478, "epoch": 2.1185962127877356, "grad_norm": 0.16925105452537537, "learning_rate": 2.9383261262919003e-05, "loss": 0.5709, "mean_token_accuracy": 0.8176722936332226, "num_tokens": 734886792.0, "step": 23027 }, { "entropy": 0.41712150909006596, "epoch": 2.1186882191591767, "grad_norm": 0.1454523354768753, "learning_rate": 2.938019443677738e-05, "loss": 0.3936, "mean_token_accuracy": 0.8716934695839882, "num_tokens": 734919014.0, "step": 23028 }, { "entropy": 0.5758349541574717, "epoch": 2.118780225530618, "grad_norm": 0.16556179523468018, "learning_rate": 2.9377127610635753e-05, "loss": 0.5609, "mean_token_accuracy": 0.8229437209665775, "num_tokens": 734951077.0, "step": 23029 }, { "entropy": 0.5812749285250902, "epoch": 2.1188722319020594, "grad_norm": 0.17255935072898865, "learning_rate": 2.9374060784494127e-05, "loss": 0.5717, "mean_token_accuracy": 0.8209838941693306, "num_tokens": 734983158.0, "step": 23030 }, { "entropy": 0.525487856939435, "epoch": 2.1189642382735006, "grad_norm": 0.15979699790477753, "learning_rate": 2.9370993958352505e-05, "loss": 0.5008, "mean_token_accuracy": 0.8393903598189354, "num_tokens": 735015634.0, "step": 23031 }, { "entropy": 0.5785303711891174, "epoch": 2.1190562446449417, "grad_norm": 0.1714034229516983, "learning_rate": 2.9367927132210877e-05, "loss": 0.567, "mean_token_accuracy": 0.8223626092076302, "num_tokens": 735047389.0, "step": 23032 }, { "entropy": 0.5841526193544269, "epoch": 2.119148251016383, "grad_norm": 0.16327854990959167, "learning_rate": 2.936486030606925e-05, "loss": 0.5668, "mean_token_accuracy": 0.8209844753146172, "num_tokens": 735080056.0, "step": 23033 }, { "entropy": 0.5000892924144864, "epoch": 2.119240257387824, "grad_norm": 0.15553095936775208, "learning_rate": 2.9361793479927623e-05, "loss": 0.4736, "mean_token_accuracy": 0.848675861954689, "num_tokens": 735112064.0, "step": 23034 }, { "entropy": 0.5507258819416165, "epoch": 2.1193322637592655, "grad_norm": 0.16133643686771393, "learning_rate": 2.9358726653786e-05, "loss": 0.5374, "mean_token_accuracy": 0.8321410864591599, "num_tokens": 735144217.0, "step": 23035 }, { "entropy": 0.41917406767606735, "epoch": 2.1194242701307067, "grad_norm": 0.14266803860664368, "learning_rate": 2.9355659827644372e-05, "loss": 0.3938, "mean_token_accuracy": 0.8741470873355865, "num_tokens": 735176958.0, "step": 23036 }, { "entropy": 0.5852385452017188, "epoch": 2.119516276502148, "grad_norm": 0.1655765175819397, "learning_rate": 2.935259300150275e-05, "loss": 0.5677, "mean_token_accuracy": 0.8222079016268253, "num_tokens": 735209667.0, "step": 23037 }, { "entropy": 0.5375344874337316, "epoch": 2.119608282873589, "grad_norm": 0.16670112311840057, "learning_rate": 2.9349526175361118e-05, "loss": 0.523, "mean_token_accuracy": 0.8348597884178162, "num_tokens": 735240929.0, "step": 23038 }, { "entropy": 0.6200554110109806, "epoch": 2.11970028924503, "grad_norm": 0.17110662162303925, "learning_rate": 2.9346459349219496e-05, "loss": 0.6168, "mean_token_accuracy": 0.8099636361002922, "num_tokens": 735273172.0, "step": 23039 }, { "entropy": 0.5430023679509759, "epoch": 2.1197922956164716, "grad_norm": 0.1595020443201065, "learning_rate": 2.9343392523077867e-05, "loss": 0.5107, "mean_token_accuracy": 0.8364286310970783, "num_tokens": 735304944.0, "step": 23040 }, { "entropy": 0.5836303299292922, "epoch": 2.119884301987913, "grad_norm": 0.16468366980552673, "learning_rate": 2.9340325696936245e-05, "loss": 0.5663, "mean_token_accuracy": 0.8188655488193035, "num_tokens": 735336711.0, "step": 23041 }, { "entropy": 0.42961128847673535, "epoch": 2.119976308359354, "grad_norm": 0.14939260482788086, "learning_rate": 2.9337258870794616e-05, "loss": 0.4142, "mean_token_accuracy": 0.8664553463459015, "num_tokens": 735368981.0, "step": 23042 }, { "entropy": 0.5908795222640038, "epoch": 2.120068314730795, "grad_norm": 0.17588165402412415, "learning_rate": 2.933419204465299e-05, "loss": 0.5879, "mean_token_accuracy": 0.8161779008805752, "num_tokens": 735400718.0, "step": 23043 }, { "entropy": 0.5369321536272764, "epoch": 2.120160321102236, "grad_norm": 0.168581023812294, "learning_rate": 2.9331125218511362e-05, "loss": 0.5249, "mean_token_accuracy": 0.8328633829951286, "num_tokens": 735431721.0, "step": 23044 }, { "entropy": 0.40781629690900445, "epoch": 2.1202523274736778, "grad_norm": 0.1472863107919693, "learning_rate": 2.932805839236974e-05, "loss": 0.3889, "mean_token_accuracy": 0.8753341995179653, "num_tokens": 735464234.0, "step": 23045 }, { "entropy": 0.5305438935756683, "epoch": 2.120344333845119, "grad_norm": 0.16366370022296906, "learning_rate": 2.932499156622811e-05, "loss": 0.5261, "mean_token_accuracy": 0.8315334729850292, "num_tokens": 735496048.0, "step": 23046 }, { "entropy": 0.5730534344911575, "epoch": 2.12043634021656, "grad_norm": 0.16899526119232178, "learning_rate": 2.9321924740086486e-05, "loss": 0.5648, "mean_token_accuracy": 0.8210141696035862, "num_tokens": 735527868.0, "step": 23047 }, { "entropy": 0.49132755445316434, "epoch": 2.120528346588001, "grad_norm": 0.15587320923805237, "learning_rate": 2.9318857913944858e-05, "loss": 0.4753, "mean_token_accuracy": 0.8517851568758488, "num_tokens": 735559943.0, "step": 23048 }, { "entropy": 0.587442131829448, "epoch": 2.1206203529594423, "grad_norm": 0.1654042750597, "learning_rate": 2.9315791087803236e-05, "loss": 0.5799, "mean_token_accuracy": 0.8185969218611717, "num_tokens": 735592319.0, "step": 23049 }, { "entropy": 0.5434135906398296, "epoch": 2.120712359330884, "grad_norm": 0.16625817120075226, "learning_rate": 2.9312724261661607e-05, "loss": 0.5245, "mean_token_accuracy": 0.8338644430041313, "num_tokens": 735624466.0, "step": 23050 }, { "entropy": 0.4662847789004445, "epoch": 2.120804365702325, "grad_norm": 0.1578216403722763, "learning_rate": 2.930965743551998e-05, "loss": 0.453, "mean_token_accuracy": 0.8554643541574478, "num_tokens": 735656222.0, "step": 23051 }, { "entropy": 0.5618917597457767, "epoch": 2.120896372073766, "grad_norm": 0.17065247893333435, "learning_rate": 2.9306590609378353e-05, "loss": 0.5569, "mean_token_accuracy": 0.8252481110394001, "num_tokens": 735687945.0, "step": 23052 }, { "entropy": 0.515143716474995, "epoch": 2.1209883784452073, "grad_norm": 0.16408826410770416, "learning_rate": 2.930352378323673e-05, "loss": 0.4943, "mean_token_accuracy": 0.8414772227406502, "num_tokens": 735719498.0, "step": 23053 }, { "entropy": 0.4916507937014103, "epoch": 2.1210803848166484, "grad_norm": 0.1587669998407364, "learning_rate": 2.9300456957095102e-05, "loss": 0.4834, "mean_token_accuracy": 0.8470639064908028, "num_tokens": 735751554.0, "step": 23054 }, { "entropy": 0.6124073192477226, "epoch": 2.12117239118809, "grad_norm": 0.1728622317314148, "learning_rate": 2.9297390130953477e-05, "loss": 0.6085, "mean_token_accuracy": 0.8075217753648758, "num_tokens": 735783344.0, "step": 23055 }, { "entropy": 0.520302087534219, "epoch": 2.121264397559531, "grad_norm": 0.15913887321949005, "learning_rate": 2.9294323304811848e-05, "loss": 0.4993, "mean_token_accuracy": 0.8428735174238682, "num_tokens": 735815019.0, "step": 23056 }, { "entropy": 0.44701469130814075, "epoch": 2.1213564039309722, "grad_norm": 0.1521366983652115, "learning_rate": 2.9291256478670226e-05, "loss": 0.4283, "mean_token_accuracy": 0.8615834973752499, "num_tokens": 735846898.0, "step": 23057 }, { "entropy": 0.535870186984539, "epoch": 2.1214484103024134, "grad_norm": 0.15958908200263977, "learning_rate": 2.9288189652528597e-05, "loss": 0.5176, "mean_token_accuracy": 0.8351478241384029, "num_tokens": 735879237.0, "step": 23058 }, { "entropy": 0.4117091950029135, "epoch": 2.1215404166738545, "grad_norm": 0.1489616483449936, "learning_rate": 2.9285122826386975e-05, "loss": 0.3988, "mean_token_accuracy": 0.8725189529359341, "num_tokens": 735911257.0, "step": 23059 }, { "entropy": 0.5570105761289597, "epoch": 2.121632423045296, "grad_norm": 0.16827310621738434, "learning_rate": 2.9282056000245343e-05, "loss": 0.5318, "mean_token_accuracy": 0.8289528787136078, "num_tokens": 735941366.0, "step": 23060 }, { "entropy": 0.5008105663582683, "epoch": 2.1217244294167372, "grad_norm": 0.15933308005332947, "learning_rate": 2.927898917410372e-05, "loss": 0.4887, "mean_token_accuracy": 0.8480590842664242, "num_tokens": 735973772.0, "step": 23061 }, { "entropy": 0.5754896672442555, "epoch": 2.1218164357881784, "grad_norm": 0.16805700957775116, "learning_rate": 2.92759223479621e-05, "loss": 0.5538, "mean_token_accuracy": 0.8242790251970291, "num_tokens": 736006374.0, "step": 23062 }, { "entropy": 0.49993452057242393, "epoch": 2.1219084421596195, "grad_norm": 0.16231563687324524, "learning_rate": 2.927285552182047e-05, "loss": 0.4833, "mean_token_accuracy": 0.8442856669425964, "num_tokens": 736038575.0, "step": 23063 }, { "entropy": 0.5907791238278151, "epoch": 2.1220004485310606, "grad_norm": 0.1703556478023529, "learning_rate": 2.9269788695678845e-05, "loss": 0.5679, "mean_token_accuracy": 0.8202580474317074, "num_tokens": 736069995.0, "step": 23064 }, { "entropy": 0.5237251101061702, "epoch": 2.122092454902502, "grad_norm": 0.16546590626239777, "learning_rate": 2.9266721869537216e-05, "loss": 0.4922, "mean_token_accuracy": 0.8463820554316044, "num_tokens": 736101383.0, "step": 23065 }, { "entropy": 0.4811182804405689, "epoch": 2.1221844612739433, "grad_norm": 0.15421755611896515, "learning_rate": 2.9263655043395594e-05, "loss": 0.4644, "mean_token_accuracy": 0.8497050441801548, "num_tokens": 736133030.0, "step": 23066 }, { "entropy": 0.5699380896985531, "epoch": 2.1222764676453845, "grad_norm": 0.16516618430614471, "learning_rate": 2.9260588217253966e-05, "loss": 0.5544, "mean_token_accuracy": 0.8257325515151024, "num_tokens": 736165128.0, "step": 23067 }, { "entropy": 0.5359950135461986, "epoch": 2.1223684740168256, "grad_norm": 0.15846490859985352, "learning_rate": 2.925752139111234e-05, "loss": 0.5172, "mean_token_accuracy": 0.8367463871836662, "num_tokens": 736197313.0, "step": 23068 }, { "entropy": 0.5572112007066607, "epoch": 2.1224604803882667, "grad_norm": 0.16274087131023407, "learning_rate": 2.925445456497071e-05, "loss": 0.5475, "mean_token_accuracy": 0.8263343460857868, "num_tokens": 736229351.0, "step": 23069 }, { "entropy": 0.6201326660811901, "epoch": 2.1225524867597083, "grad_norm": 0.17621977627277374, "learning_rate": 2.925138773882909e-05, "loss": 0.6136, "mean_token_accuracy": 0.8084195777773857, "num_tokens": 736261298.0, "step": 23070 }, { "entropy": 0.4857295239344239, "epoch": 2.1226444931311494, "grad_norm": 0.16110165417194366, "learning_rate": 2.924832091268746e-05, "loss": 0.4728, "mean_token_accuracy": 0.8488671705126762, "num_tokens": 736292887.0, "step": 23071 }, { "entropy": 0.5270316076930612, "epoch": 2.1227364995025906, "grad_norm": 0.1647619903087616, "learning_rate": 2.9245254086545836e-05, "loss": 0.5255, "mean_token_accuracy": 0.8341190405189991, "num_tokens": 736325114.0, "step": 23072 }, { "entropy": 0.510208903811872, "epoch": 2.1228285058740317, "grad_norm": 0.1649819165468216, "learning_rate": 2.9242187260404207e-05, "loss": 0.4987, "mean_token_accuracy": 0.8408929221332073, "num_tokens": 736356077.0, "step": 23073 }, { "entropy": 0.5287308720871806, "epoch": 2.122920512245473, "grad_norm": 0.16291484236717224, "learning_rate": 2.9239120434262585e-05, "loss": 0.5152, "mean_token_accuracy": 0.8417009823024273, "num_tokens": 736387339.0, "step": 23074 }, { "entropy": 0.4330770382657647, "epoch": 2.1230125186169144, "grad_norm": 0.15034671127796173, "learning_rate": 2.9236053608120956e-05, "loss": 0.4238, "mean_token_accuracy": 0.863451074808836, "num_tokens": 736419224.0, "step": 23075 }, { "entropy": 0.4672206463292241, "epoch": 2.1231045249883556, "grad_norm": 0.15426436066627502, "learning_rate": 2.923298678197933e-05, "loss": 0.4619, "mean_token_accuracy": 0.8513228595256805, "num_tokens": 736451708.0, "step": 23076 }, { "entropy": 0.5215802881866693, "epoch": 2.1231965313597967, "grad_norm": 0.16121964156627655, "learning_rate": 2.9229919955837702e-05, "loss": 0.5212, "mean_token_accuracy": 0.8378574103116989, "num_tokens": 736483672.0, "step": 23077 }, { "entropy": 0.5579599402844906, "epoch": 2.123288537731238, "grad_norm": 0.16748046875, "learning_rate": 2.922685312969608e-05, "loss": 0.545, "mean_token_accuracy": 0.8290397599339485, "num_tokens": 736515622.0, "step": 23078 }, { "entropy": 0.5736380573362112, "epoch": 2.123380544102679, "grad_norm": 0.16761577129364014, "learning_rate": 2.922378630355445e-05, "loss": 0.5599, "mean_token_accuracy": 0.824592262506485, "num_tokens": 736547935.0, "step": 23079 }, { "entropy": 0.4704212467186153, "epoch": 2.1234725504741205, "grad_norm": 0.1582295000553131, "learning_rate": 2.922071947741283e-05, "loss": 0.4593, "mean_token_accuracy": 0.8537211641669273, "num_tokens": 736579703.0, "step": 23080 }, { "entropy": 0.5476798079907894, "epoch": 2.1235645568455617, "grad_norm": 0.1598007082939148, "learning_rate": 2.92176526512712e-05, "loss": 0.5296, "mean_token_accuracy": 0.8312407471239567, "num_tokens": 736611782.0, "step": 23081 }, { "entropy": 0.5067064072936773, "epoch": 2.123656563217003, "grad_norm": 0.16050124168395996, "learning_rate": 2.9214585825129575e-05, "loss": 0.4941, "mean_token_accuracy": 0.8425111696124077, "num_tokens": 736643365.0, "step": 23082 }, { "entropy": 0.46196133084595203, "epoch": 2.123748569588444, "grad_norm": 0.15402275323867798, "learning_rate": 2.9211518998987946e-05, "loss": 0.4454, "mean_token_accuracy": 0.8581111654639244, "num_tokens": 736675175.0, "step": 23083 }, { "entropy": 0.5093721067532897, "epoch": 2.123840575959885, "grad_norm": 0.16433660686016083, "learning_rate": 2.9208452172846325e-05, "loss": 0.4855, "mean_token_accuracy": 0.8461402207612991, "num_tokens": 736706235.0, "step": 23084 }, { "entropy": 0.41518250899389386, "epoch": 2.1239325823313266, "grad_norm": 0.14924108982086182, "learning_rate": 2.9205385346704696e-05, "loss": 0.4073, "mean_token_accuracy": 0.870349008589983, "num_tokens": 736738532.0, "step": 23085 }, { "entropy": 0.5824185134842992, "epoch": 2.124024588702768, "grad_norm": 0.16828428208827972, "learning_rate": 2.920231852056307e-05, "loss": 0.5681, "mean_token_accuracy": 0.8200098797678947, "num_tokens": 736770545.0, "step": 23086 }, { "entropy": 0.5486732888966799, "epoch": 2.124116595074209, "grad_norm": 0.16522681713104248, "learning_rate": 2.919925169442144e-05, "loss": 0.5268, "mean_token_accuracy": 0.8335902243852615, "num_tokens": 736802103.0, "step": 23087 }, { "entropy": 0.521499210037291, "epoch": 2.12420860144565, "grad_norm": 0.16007177531719208, "learning_rate": 2.919618486827982e-05, "loss": 0.5085, "mean_token_accuracy": 0.8401090763509274, "num_tokens": 736833839.0, "step": 23088 }, { "entropy": 0.5070373127236962, "epoch": 2.124300607817091, "grad_norm": 0.1634318232536316, "learning_rate": 2.919311804213819e-05, "loss": 0.5014, "mean_token_accuracy": 0.8419205099344254, "num_tokens": 736865774.0, "step": 23089 }, { "entropy": 0.5276211691088974, "epoch": 2.1243926141885328, "grad_norm": 0.1645893156528473, "learning_rate": 2.9190051215996566e-05, "loss": 0.5146, "mean_token_accuracy": 0.8393618501722813, "num_tokens": 736897557.0, "step": 23090 }, { "entropy": 0.47562431637197733, "epoch": 2.124484620559974, "grad_norm": 0.15063761174678802, "learning_rate": 2.9186984389854937e-05, "loss": 0.4565, "mean_token_accuracy": 0.8519224300980568, "num_tokens": 736929767.0, "step": 23091 }, { "entropy": 0.4971851734444499, "epoch": 2.124576626931415, "grad_norm": 0.15835461020469666, "learning_rate": 2.9183917563713315e-05, "loss": 0.4867, "mean_token_accuracy": 0.8472282961010933, "num_tokens": 736961752.0, "step": 23092 }, { "entropy": 0.5617610393092036, "epoch": 2.124668633302856, "grad_norm": 0.16655360162258148, "learning_rate": 2.918085073757169e-05, "loss": 0.5354, "mean_token_accuracy": 0.8277998752892017, "num_tokens": 736993419.0, "step": 23093 }, { "entropy": 0.5117303971201181, "epoch": 2.1247606396742973, "grad_norm": 0.17002961039543152, "learning_rate": 2.917778391143006e-05, "loss": 0.4979, "mean_token_accuracy": 0.8401886001229286, "num_tokens": 737024985.0, "step": 23094 }, { "entropy": 0.541997566819191, "epoch": 2.124852646045739, "grad_norm": 0.1622479408979416, "learning_rate": 2.917471708528844e-05, "loss": 0.5392, "mean_token_accuracy": 0.8285287581384182, "num_tokens": 737056807.0, "step": 23095 }, { "entropy": 0.5791343878954649, "epoch": 2.12494465241718, "grad_norm": 0.1673947423696518, "learning_rate": 2.917165025914681e-05, "loss": 0.5605, "mean_token_accuracy": 0.8204672522842884, "num_tokens": 737088422.0, "step": 23096 }, { "entropy": 0.4641938703134656, "epoch": 2.125036658788621, "grad_norm": 0.1531856805086136, "learning_rate": 2.9168583433005188e-05, "loss": 0.4452, "mean_token_accuracy": 0.8588254787027836, "num_tokens": 737120773.0, "step": 23097 }, { "entropy": 0.5720295757055283, "epoch": 2.1251286651600623, "grad_norm": 0.16267378628253937, "learning_rate": 2.9165516606863556e-05, "loss": 0.5564, "mean_token_accuracy": 0.8233392983675003, "num_tokens": 737152702.0, "step": 23098 }, { "entropy": 0.43390274327248335, "epoch": 2.1252206715315034, "grad_norm": 0.15816546976566315, "learning_rate": 2.9162449780721934e-05, "loss": 0.417, "mean_token_accuracy": 0.8669266477227211, "num_tokens": 737184023.0, "step": 23099 }, { "entropy": 0.5644577518105507, "epoch": 2.125312677902945, "grad_norm": 0.16323687136173248, "learning_rate": 2.9159382954580305e-05, "loss": 0.5559, "mean_token_accuracy": 0.8220818527042866, "num_tokens": 737216016.0, "step": 23100 }, { "entropy": 0.4948131060227752, "epoch": 2.125404684274386, "grad_norm": 0.15574190020561218, "learning_rate": 2.9156316128438683e-05, "loss": 0.4843, "mean_token_accuracy": 0.8479960523545742, "num_tokens": 737248305.0, "step": 23101 }, { "entropy": 0.5450270287692547, "epoch": 2.1254966906458272, "grad_norm": 0.1615413874387741, "learning_rate": 2.9153249302297055e-05, "loss": 0.5391, "mean_token_accuracy": 0.8283499218523502, "num_tokens": 737280188.0, "step": 23102 }, { "entropy": 0.5351279526948929, "epoch": 2.1255886970172684, "grad_norm": 0.16119438409805298, "learning_rate": 2.915018247615543e-05, "loss": 0.5235, "mean_token_accuracy": 0.8337506279349327, "num_tokens": 737312459.0, "step": 23103 }, { "entropy": 0.4007454114034772, "epoch": 2.1256807033887095, "grad_norm": 0.14752259850502014, "learning_rate": 2.91471156500138e-05, "loss": 0.3859, "mean_token_accuracy": 0.8753414265811443, "num_tokens": 737343898.0, "step": 23104 }, { "entropy": 0.4816243126988411, "epoch": 2.125772709760151, "grad_norm": 0.15495988726615906, "learning_rate": 2.914404882387218e-05, "loss": 0.4748, "mean_token_accuracy": 0.8492911420762539, "num_tokens": 737376224.0, "step": 23105 }, { "entropy": 0.5099633447825909, "epoch": 2.1258647161315922, "grad_norm": 0.15908849239349365, "learning_rate": 2.914098199773055e-05, "loss": 0.4962, "mean_token_accuracy": 0.8420438282191753, "num_tokens": 737408649.0, "step": 23106 }, { "entropy": 0.5679714512079954, "epoch": 2.1259567225030334, "grad_norm": 0.16722573339939117, "learning_rate": 2.9137915171588924e-05, "loss": 0.5385, "mean_token_accuracy": 0.8278626017272472, "num_tokens": 737440189.0, "step": 23107 }, { "entropy": 0.417009299620986, "epoch": 2.1260487288744745, "grad_norm": 0.14563804864883423, "learning_rate": 2.9134848345447296e-05, "loss": 0.4018, "mean_token_accuracy": 0.870477557182312, "num_tokens": 737472108.0, "step": 23108 }, { "entropy": 0.4859618442133069, "epoch": 2.1261407352459156, "grad_norm": 0.15686054527759552, "learning_rate": 2.9131781519305674e-05, "loss": 0.4842, "mean_token_accuracy": 0.846362516283989, "num_tokens": 737504395.0, "step": 23109 }, { "entropy": 0.4700957993045449, "epoch": 2.126232741617357, "grad_norm": 0.15648844838142395, "learning_rate": 2.9128714693164045e-05, "loss": 0.4614, "mean_token_accuracy": 0.855224285274744, "num_tokens": 737535955.0, "step": 23110 }, { "entropy": 0.5115641709417105, "epoch": 2.1263247479887983, "grad_norm": 0.1621590405702591, "learning_rate": 2.912564786702242e-05, "loss": 0.4898, "mean_token_accuracy": 0.8400807678699493, "num_tokens": 737567233.0, "step": 23111 }, { "entropy": 0.5852707838639617, "epoch": 2.1264167543602395, "grad_norm": 0.17055818438529968, "learning_rate": 2.912258104088079e-05, "loss": 0.5613, "mean_token_accuracy": 0.8208506628870964, "num_tokens": 737599075.0, "step": 23112 }, { "entropy": 0.6123972125351429, "epoch": 2.1265087607316806, "grad_norm": 0.18108783662319183, "learning_rate": 2.911951421473917e-05, "loss": 0.6094, "mean_token_accuracy": 0.8078703358769417, "num_tokens": 737629993.0, "step": 23113 }, { "entropy": 0.5548908356577158, "epoch": 2.1266007671031217, "grad_norm": 0.162420853972435, "learning_rate": 2.911644738859754e-05, "loss": 0.5413, "mean_token_accuracy": 0.8273819200694561, "num_tokens": 737662322.0, "step": 23114 }, { "entropy": 0.461468830704689, "epoch": 2.1266927734745633, "grad_norm": 0.15173518657684326, "learning_rate": 2.9113380562455915e-05, "loss": 0.4456, "mean_token_accuracy": 0.8590953387320042, "num_tokens": 737694464.0, "step": 23115 }, { "entropy": 0.4670701767317951, "epoch": 2.1267847798460044, "grad_norm": 0.15495409071445465, "learning_rate": 2.9110313736314286e-05, "loss": 0.4548, "mean_token_accuracy": 0.8538700826466084, "num_tokens": 737726521.0, "step": 23116 }, { "entropy": 0.5697073647752404, "epoch": 2.1268767862174456, "grad_norm": 0.16678769886493683, "learning_rate": 2.9107246910172664e-05, "loss": 0.5624, "mean_token_accuracy": 0.8234019093215466, "num_tokens": 737759247.0, "step": 23117 }, { "entropy": 0.5276269251480699, "epoch": 2.1269687925888867, "grad_norm": 0.16472765803337097, "learning_rate": 2.9104180084031035e-05, "loss": 0.508, "mean_token_accuracy": 0.8373891450464725, "num_tokens": 737791222.0, "step": 23118 }, { "entropy": 0.4632526496425271, "epoch": 2.127060798960328, "grad_norm": 0.15643922984600067, "learning_rate": 2.9101113257889413e-05, "loss": 0.457, "mean_token_accuracy": 0.8517072014510632, "num_tokens": 737823320.0, "step": 23119 }, { "entropy": 0.4257051581516862, "epoch": 2.1271528053317694, "grad_norm": 0.15044356882572174, "learning_rate": 2.909804643174778e-05, "loss": 0.4154, "mean_token_accuracy": 0.8681100979447365, "num_tokens": 737855257.0, "step": 23120 }, { "entropy": 0.5360816195607185, "epoch": 2.1272448117032106, "grad_norm": 0.16590771079063416, "learning_rate": 2.909497960560616e-05, "loss": 0.5159, "mean_token_accuracy": 0.8376205563545227, "num_tokens": 737886808.0, "step": 23121 }, { "entropy": 0.6144385663792491, "epoch": 2.1273368180746517, "grad_norm": 0.17183901369571686, "learning_rate": 2.9091912779464537e-05, "loss": 0.5954, "mean_token_accuracy": 0.8122772052884102, "num_tokens": 737918663.0, "step": 23122 }, { "entropy": 0.5673610400408506, "epoch": 2.127428824446093, "grad_norm": 0.17234794795513153, "learning_rate": 2.908884595332291e-05, "loss": 0.5586, "mean_token_accuracy": 0.8264634013175964, "num_tokens": 737949393.0, "step": 23123 }, { "entropy": 0.6006079548969865, "epoch": 2.127520830817534, "grad_norm": 0.17384953796863556, "learning_rate": 2.9085779127181283e-05, "loss": 0.5848, "mean_token_accuracy": 0.8146601170301437, "num_tokens": 737981814.0, "step": 23124 }, { "entropy": 0.5457780389115214, "epoch": 2.1276128371889755, "grad_norm": 0.16443949937820435, "learning_rate": 2.9082712301039655e-05, "loss": 0.5295, "mean_token_accuracy": 0.8325165025889874, "num_tokens": 738013545.0, "step": 23125 }, { "entropy": 0.5883706407621503, "epoch": 2.1277048435604167, "grad_norm": 0.17406214773654938, "learning_rate": 2.9079645474898033e-05, "loss": 0.5769, "mean_token_accuracy": 0.8180698491632938, "num_tokens": 738046125.0, "step": 23126 }, { "entropy": 0.5066366693936288, "epoch": 2.127796849931858, "grad_norm": 0.15535862743854523, "learning_rate": 2.9076578648756404e-05, "loss": 0.4942, "mean_token_accuracy": 0.84272351115942, "num_tokens": 738078555.0, "step": 23127 }, { "entropy": 0.46936449874192476, "epoch": 2.127888856303299, "grad_norm": 0.1558331698179245, "learning_rate": 2.907351182261478e-05, "loss": 0.4591, "mean_token_accuracy": 0.8534615524113178, "num_tokens": 738110171.0, "step": 23128 }, { "entropy": 0.5500239348039031, "epoch": 2.12798086267474, "grad_norm": 0.1640016734600067, "learning_rate": 2.907044499647315e-05, "loss": 0.519, "mean_token_accuracy": 0.8338794559240341, "num_tokens": 738141023.0, "step": 23129 }, { "entropy": 0.4671214260160923, "epoch": 2.1280728690461816, "grad_norm": 0.15607090294361115, "learning_rate": 2.9067378170331528e-05, "loss": 0.4576, "mean_token_accuracy": 0.856320284307003, "num_tokens": 738173317.0, "step": 23130 }, { "entropy": 0.5357344025978819, "epoch": 2.128164875417623, "grad_norm": 0.15860378742218018, "learning_rate": 2.90643113441899e-05, "loss": 0.5231, "mean_token_accuracy": 0.8363448530435562, "num_tokens": 738205360.0, "step": 23131 }, { "entropy": 0.4696626076474786, "epoch": 2.128256881789064, "grad_norm": 0.16033115983009338, "learning_rate": 2.9061244518048274e-05, "loss": 0.4556, "mean_token_accuracy": 0.8551836088299751, "num_tokens": 738236686.0, "step": 23132 }, { "entropy": 0.4228491666726768, "epoch": 2.128348888160505, "grad_norm": 0.1486940085887909, "learning_rate": 2.9058177691906645e-05, "loss": 0.4023, "mean_token_accuracy": 0.8705040290951729, "num_tokens": 738267771.0, "step": 23133 }, { "entropy": 0.49164372542873025, "epoch": 2.128440894531946, "grad_norm": 0.16075021028518677, "learning_rate": 2.9055110865765023e-05, "loss": 0.484, "mean_token_accuracy": 0.8475723043084145, "num_tokens": 738299626.0, "step": 23134 }, { "entropy": 0.4114604906644672, "epoch": 2.1285329009033878, "grad_norm": 0.15215224027633667, "learning_rate": 2.9052044039623394e-05, "loss": 0.3885, "mean_token_accuracy": 0.8749358467757702, "num_tokens": 738331043.0, "step": 23135 }, { "entropy": 0.4260727509390563, "epoch": 2.128624907274829, "grad_norm": 0.1460256725549698, "learning_rate": 2.904897721348177e-05, "loss": 0.4107, "mean_token_accuracy": 0.8678578212857246, "num_tokens": 738363443.0, "step": 23136 }, { "entropy": 0.5576546620577574, "epoch": 2.12871691364627, "grad_norm": 0.1642039269208908, "learning_rate": 2.904591038734014e-05, "loss": 0.5361, "mean_token_accuracy": 0.8275554440915585, "num_tokens": 738395269.0, "step": 23137 }, { "entropy": 0.4386437723878771, "epoch": 2.128808920017711, "grad_norm": 0.14692629873752594, "learning_rate": 2.9042843561198518e-05, "loss": 0.4274, "mean_token_accuracy": 0.8642529807984829, "num_tokens": 738427902.0, "step": 23138 }, { "entropy": 0.5588081683963537, "epoch": 2.1289009263891523, "grad_norm": 0.16001950204372406, "learning_rate": 2.903977673505689e-05, "loss": 0.5404, "mean_token_accuracy": 0.8292161673307419, "num_tokens": 738459708.0, "step": 23139 }, { "entropy": 0.5167047968134284, "epoch": 2.128992932760594, "grad_norm": 0.15764367580413818, "learning_rate": 2.9036709908915267e-05, "loss": 0.4966, "mean_token_accuracy": 0.8416592292487621, "num_tokens": 738491943.0, "step": 23140 }, { "entropy": 0.5800679251551628, "epoch": 2.129084939132035, "grad_norm": 0.16254058480262756, "learning_rate": 2.903364308277364e-05, "loss": 0.5533, "mean_token_accuracy": 0.8254889473319054, "num_tokens": 738523991.0, "step": 23141 }, { "entropy": 0.47325395606458187, "epoch": 2.129176945503476, "grad_norm": 0.1512448489665985, "learning_rate": 2.9030576256632013e-05, "loss": 0.4575, "mean_token_accuracy": 0.8539554551243782, "num_tokens": 738556095.0, "step": 23142 }, { "entropy": 0.4703941931948066, "epoch": 2.1292689518749173, "grad_norm": 0.15089426934719086, "learning_rate": 2.9027509430490385e-05, "loss": 0.4475, "mean_token_accuracy": 0.8583319187164307, "num_tokens": 738587757.0, "step": 23143 }, { "entropy": 0.49654505029320717, "epoch": 2.1293609582463584, "grad_norm": 0.1620703786611557, "learning_rate": 2.9024442604348763e-05, "loss": 0.482, "mean_token_accuracy": 0.8439883477985859, "num_tokens": 738619814.0, "step": 23144 }, { "entropy": 0.5572607181966305, "epoch": 2.1294529646178, "grad_norm": 0.16903874278068542, "learning_rate": 2.9021375778207134e-05, "loss": 0.5516, "mean_token_accuracy": 0.8248756900429726, "num_tokens": 738651569.0, "step": 23145 }, { "entropy": 0.4368919786065817, "epoch": 2.129544970989241, "grad_norm": 0.14948788285255432, "learning_rate": 2.901830895206551e-05, "loss": 0.4258, "mean_token_accuracy": 0.8613190464675426, "num_tokens": 738684065.0, "step": 23146 }, { "entropy": 0.5196599625051022, "epoch": 2.1296369773606822, "grad_norm": 0.16523049771785736, "learning_rate": 2.901524212592388e-05, "loss": 0.5135, "mean_token_accuracy": 0.8363409861922264, "num_tokens": 738715141.0, "step": 23147 }, { "entropy": 0.5173835977911949, "epoch": 2.1297289837321234, "grad_norm": 0.16550639271736145, "learning_rate": 2.9012175299782258e-05, "loss": 0.5048, "mean_token_accuracy": 0.8344487175345421, "num_tokens": 738746587.0, "step": 23148 }, { "entropy": 0.5505094500258565, "epoch": 2.1298209901035645, "grad_norm": 0.16703864932060242, "learning_rate": 2.900910847364063e-05, "loss": 0.544, "mean_token_accuracy": 0.8263427726924419, "num_tokens": 738777375.0, "step": 23149 }, { "entropy": 0.5032160617411137, "epoch": 2.129912996475006, "grad_norm": 0.16175596415996552, "learning_rate": 2.9006041647499004e-05, "loss": 0.4984, "mean_token_accuracy": 0.843195766210556, "num_tokens": 738809221.0, "step": 23150 }, { "entropy": 0.6610609386116266, "epoch": 2.1300050028464472, "grad_norm": 0.17484533786773682, "learning_rate": 2.9002974821357375e-05, "loss": 0.6403, "mean_token_accuracy": 0.7942878939211369, "num_tokens": 738840841.0, "step": 23151 }, { "entropy": 0.5434441491961479, "epoch": 2.1300970092178884, "grad_norm": 0.16303785145282745, "learning_rate": 2.8999907995215753e-05, "loss": 0.5328, "mean_token_accuracy": 0.8287223353981972, "num_tokens": 738872846.0, "step": 23152 }, { "entropy": 0.4490280244499445, "epoch": 2.1301890155893295, "grad_norm": 0.15160413086414337, "learning_rate": 2.8996841169074128e-05, "loss": 0.4351, "mean_token_accuracy": 0.860288493335247, "num_tokens": 738905246.0, "step": 23153 }, { "entropy": 0.5713120442815125, "epoch": 2.1302810219607706, "grad_norm": 0.16368620097637177, "learning_rate": 2.89937743429325e-05, "loss": 0.5499, "mean_token_accuracy": 0.8260593824088573, "num_tokens": 738937074.0, "step": 23154 }, { "entropy": 0.5363787207752466, "epoch": 2.130373028332212, "grad_norm": 0.1629754900932312, "learning_rate": 2.8990707516790877e-05, "loss": 0.5278, "mean_token_accuracy": 0.8309270963072777, "num_tokens": 738969381.0, "step": 23155 }, { "entropy": 0.5286064576357603, "epoch": 2.1304650347036533, "grad_norm": 0.16875731945037842, "learning_rate": 2.8987640690649248e-05, "loss": 0.515, "mean_token_accuracy": 0.8344334624707699, "num_tokens": 739001282.0, "step": 23156 }, { "entropy": 0.5137506145983934, "epoch": 2.1305570410750945, "grad_norm": 0.16652503609657288, "learning_rate": 2.8984573864507626e-05, "loss": 0.4911, "mean_token_accuracy": 0.8417786434292793, "num_tokens": 739033079.0, "step": 23157 }, { "entropy": 0.5711315595544875, "epoch": 2.1306490474465356, "grad_norm": 0.16490687429904938, "learning_rate": 2.8981507038365994e-05, "loss": 0.5482, "mean_token_accuracy": 0.8295965641736984, "num_tokens": 739064272.0, "step": 23158 }, { "entropy": 0.43296930007636547, "epoch": 2.1307410538179767, "grad_norm": 0.15052349865436554, "learning_rate": 2.8978440212224372e-05, "loss": 0.4248, "mean_token_accuracy": 0.8611982651054859, "num_tokens": 739095817.0, "step": 23159 }, { "entropy": 0.4022513744421303, "epoch": 2.1308330601894183, "grad_norm": 0.14580044150352478, "learning_rate": 2.8975373386082744e-05, "loss": 0.3982, "mean_token_accuracy": 0.8738651685416698, "num_tokens": 739128438.0, "step": 23160 }, { "entropy": 0.5895615480840206, "epoch": 2.1309250665608594, "grad_norm": 0.16335397958755493, "learning_rate": 2.897230655994112e-05, "loss": 0.5803, "mean_token_accuracy": 0.8163599036633968, "num_tokens": 739161071.0, "step": 23161 }, { "entropy": 0.5134705379605293, "epoch": 2.1310170729323006, "grad_norm": 0.1526172012090683, "learning_rate": 2.8969239733799493e-05, "loss": 0.4924, "mean_token_accuracy": 0.8435915261507034, "num_tokens": 739192983.0, "step": 23162 }, { "entropy": 0.4947184547781944, "epoch": 2.1311090793037417, "grad_norm": 0.15321196615695953, "learning_rate": 2.8966172907657867e-05, "loss": 0.4801, "mean_token_accuracy": 0.8482840731739998, "num_tokens": 739225751.0, "step": 23163 }, { "entropy": 0.4423408233560622, "epoch": 2.131201085675183, "grad_norm": 0.14929381012916565, "learning_rate": 2.896310608151624e-05, "loss": 0.4296, "mean_token_accuracy": 0.8610876463353634, "num_tokens": 739257729.0, "step": 23164 }, { "entropy": 0.5381987392902374, "epoch": 2.1312930920466244, "grad_norm": 0.16023926436901093, "learning_rate": 2.8960039255374617e-05, "loss": 0.5189, "mean_token_accuracy": 0.831583708524704, "num_tokens": 739289393.0, "step": 23165 }, { "entropy": 0.5283613502979279, "epoch": 2.1313850984180656, "grad_norm": 0.16430504620075226, "learning_rate": 2.8956972429232988e-05, "loss": 0.5187, "mean_token_accuracy": 0.8365363366901875, "num_tokens": 739321529.0, "step": 23166 }, { "entropy": 0.5268253767862916, "epoch": 2.1314771047895067, "grad_norm": 0.15846969187259674, "learning_rate": 2.8953905603091363e-05, "loss": 0.5123, "mean_token_accuracy": 0.8371001109480858, "num_tokens": 739353892.0, "step": 23167 }, { "entropy": 0.526473255828023, "epoch": 2.131569111160948, "grad_norm": 0.1613895148038864, "learning_rate": 2.8950838776949734e-05, "loss": 0.5199, "mean_token_accuracy": 0.8390063717961311, "num_tokens": 739386087.0, "step": 23168 }, { "entropy": 0.5362140005454421, "epoch": 2.131661117532389, "grad_norm": 0.1617787480354309, "learning_rate": 2.8947771950808112e-05, "loss": 0.5264, "mean_token_accuracy": 0.8336824551224709, "num_tokens": 739417833.0, "step": 23169 }, { "entropy": 0.5249716220423579, "epoch": 2.1317531239038305, "grad_norm": 0.15722611546516418, "learning_rate": 2.8944705124666483e-05, "loss": 0.5107, "mean_token_accuracy": 0.8420993573963642, "num_tokens": 739450036.0, "step": 23170 }, { "entropy": 0.6250056941062212, "epoch": 2.1318451302752717, "grad_norm": 0.17544522881507874, "learning_rate": 2.8941638298524858e-05, "loss": 0.6104, "mean_token_accuracy": 0.8070855960249901, "num_tokens": 739481998.0, "step": 23171 }, { "entropy": 0.5486632075626403, "epoch": 2.131937136646713, "grad_norm": 0.16782556474208832, "learning_rate": 2.893857147238323e-05, "loss": 0.5389, "mean_token_accuracy": 0.8296020179986954, "num_tokens": 739513342.0, "step": 23172 }, { "entropy": 0.5731514291837811, "epoch": 2.132029143018154, "grad_norm": 0.16825813055038452, "learning_rate": 2.8935504646241607e-05, "loss": 0.5495, "mean_token_accuracy": 0.8253211788833141, "num_tokens": 739544968.0, "step": 23173 }, { "entropy": 0.5253212852403522, "epoch": 2.132121149389595, "grad_norm": 0.1652776449918747, "learning_rate": 2.893243782009998e-05, "loss": 0.509, "mean_token_accuracy": 0.8395487442612648, "num_tokens": 739577730.0, "step": 23174 }, { "entropy": 0.44631416350603104, "epoch": 2.1322131557610366, "grad_norm": 0.1519445925951004, "learning_rate": 2.8929370993958353e-05, "loss": 0.4261, "mean_token_accuracy": 0.863766610622406, "num_tokens": 739609480.0, "step": 23175 }, { "entropy": 0.6046900518704206, "epoch": 2.132305162132478, "grad_norm": 0.17063267529010773, "learning_rate": 2.8926304167816724e-05, "loss": 0.5926, "mean_token_accuracy": 0.8144297450780869, "num_tokens": 739640759.0, "step": 23176 }, { "entropy": 0.4842031029984355, "epoch": 2.132397168503919, "grad_norm": 0.15509559214115143, "learning_rate": 2.8923237341675102e-05, "loss": 0.468, "mean_token_accuracy": 0.8465232625603676, "num_tokens": 739672664.0, "step": 23177 }, { "entropy": 0.6052957647480071, "epoch": 2.13248917487536, "grad_norm": 0.16966640949249268, "learning_rate": 2.8920170515533474e-05, "loss": 0.5889, "mean_token_accuracy": 0.8154178149998188, "num_tokens": 739704173.0, "step": 23178 }, { "entropy": 0.4889453402720392, "epoch": 2.132581181246801, "grad_norm": 0.15350544452667236, "learning_rate": 2.891710368939185e-05, "loss": 0.4584, "mean_token_accuracy": 0.8544853180646896, "num_tokens": 739736108.0, "step": 23179 }, { "entropy": 0.46519127674400806, "epoch": 2.1326731876182428, "grad_norm": 0.14687462151050568, "learning_rate": 2.891403686325022e-05, "loss": 0.447, "mean_token_accuracy": 0.8555873408913612, "num_tokens": 739767609.0, "step": 23180 }, { "entropy": 0.46057953406125307, "epoch": 2.132765193989684, "grad_norm": 0.1510486602783203, "learning_rate": 2.8910970037108598e-05, "loss": 0.4519, "mean_token_accuracy": 0.8559032008051872, "num_tokens": 739799977.0, "step": 23181 }, { "entropy": 0.4472826663404703, "epoch": 2.132857200361125, "grad_norm": 0.15119723975658417, "learning_rate": 2.890790321096697e-05, "loss": 0.4325, "mean_token_accuracy": 0.8628150634467602, "num_tokens": 739831421.0, "step": 23182 }, { "entropy": 0.4327140599489212, "epoch": 2.132949206732566, "grad_norm": 0.15376123785972595, "learning_rate": 2.8904836384825347e-05, "loss": 0.4281, "mean_token_accuracy": 0.8616142980754375, "num_tokens": 739863756.0, "step": 23183 }, { "entropy": 0.589990733191371, "epoch": 2.1330412131040073, "grad_norm": 0.16550227999687195, "learning_rate": 2.890176955868372e-05, "loss": 0.5777, "mean_token_accuracy": 0.8198592588305473, "num_tokens": 739896413.0, "step": 23184 }, { "entropy": 0.4660560507327318, "epoch": 2.133133219475449, "grad_norm": 0.15531937777996063, "learning_rate": 2.8898702732542093e-05, "loss": 0.4597, "mean_token_accuracy": 0.853807058185339, "num_tokens": 739928614.0, "step": 23185 }, { "entropy": 0.567310840357095, "epoch": 2.13322522584689, "grad_norm": 0.1682511568069458, "learning_rate": 2.889563590640047e-05, "loss": 0.5601, "mean_token_accuracy": 0.8246331475675106, "num_tokens": 739960761.0, "step": 23186 }, { "entropy": 0.583368961699307, "epoch": 2.133317232218331, "grad_norm": 0.1722795069217682, "learning_rate": 2.8892569080258842e-05, "loss": 0.5843, "mean_token_accuracy": 0.8170128837227821, "num_tokens": 739992709.0, "step": 23187 }, { "entropy": 0.6225786479189992, "epoch": 2.1334092385897723, "grad_norm": 0.17701001465320587, "learning_rate": 2.8889502254117217e-05, "loss": 0.6143, "mean_token_accuracy": 0.806568305939436, "num_tokens": 740024113.0, "step": 23188 }, { "entropy": 0.4883500263094902, "epoch": 2.1335012449612134, "grad_norm": 0.156542107462883, "learning_rate": 2.8886435427975588e-05, "loss": 0.4819, "mean_token_accuracy": 0.8496495336294174, "num_tokens": 740055920.0, "step": 23189 }, { "entropy": 0.4832587242126465, "epoch": 2.133593251332655, "grad_norm": 0.158723384141922, "learning_rate": 2.8883368601833966e-05, "loss": 0.4754, "mean_token_accuracy": 0.8502615317702293, "num_tokens": 740087752.0, "step": 23190 }, { "entropy": 0.549397811293602, "epoch": 2.133685257704096, "grad_norm": 0.16384625434875488, "learning_rate": 2.8880301775692337e-05, "loss": 0.5305, "mean_token_accuracy": 0.8315052948892117, "num_tokens": 740119922.0, "step": 23191 }, { "entropy": 0.5496840837877244, "epoch": 2.1337772640755372, "grad_norm": 0.160543754696846, "learning_rate": 2.8877234949550712e-05, "loss": 0.5273, "mean_token_accuracy": 0.8341890536248684, "num_tokens": 740151892.0, "step": 23192 }, { "entropy": 0.48938314989209175, "epoch": 2.1338692704469784, "grad_norm": 0.15324541926383972, "learning_rate": 2.8874168123409083e-05, "loss": 0.4769, "mean_token_accuracy": 0.8496574088931084, "num_tokens": 740184634.0, "step": 23193 }, { "entropy": 0.5195277072489262, "epoch": 2.1339612768184195, "grad_norm": 0.16720791161060333, "learning_rate": 2.887110129726746e-05, "loss": 0.5062, "mean_token_accuracy": 0.8388712517917156, "num_tokens": 740216133.0, "step": 23194 }, { "entropy": 0.500020429957658, "epoch": 2.134053283189861, "grad_norm": 0.15413036942481995, "learning_rate": 2.8868034471125832e-05, "loss": 0.4958, "mean_token_accuracy": 0.8454076573252678, "num_tokens": 740248755.0, "step": 23195 }, { "entropy": 0.4318434458691627, "epoch": 2.1341452895613022, "grad_norm": 0.14866523444652557, "learning_rate": 2.886496764498421e-05, "loss": 0.4212, "mean_token_accuracy": 0.865799468010664, "num_tokens": 740280589.0, "step": 23196 }, { "entropy": 0.5985396867617965, "epoch": 2.1342372959327434, "grad_norm": 0.16553889214992523, "learning_rate": 2.886190081884258e-05, "loss": 0.5654, "mean_token_accuracy": 0.8204158619046211, "num_tokens": 740312716.0, "step": 23197 }, { "entropy": 0.4914917969144881, "epoch": 2.1343293023041845, "grad_norm": 0.15733495354652405, "learning_rate": 2.8858833992700956e-05, "loss": 0.4764, "mean_token_accuracy": 0.8493375889956951, "num_tokens": 740344554.0, "step": 23198 }, { "entropy": 0.5315243313089013, "epoch": 2.1344213086756256, "grad_norm": 0.156772181391716, "learning_rate": 2.8855767166559328e-05, "loss": 0.5184, "mean_token_accuracy": 0.8355494663119316, "num_tokens": 740376152.0, "step": 23199 }, { "entropy": 0.5734927207231522, "epoch": 2.134513315047067, "grad_norm": 0.1613045483827591, "learning_rate": 2.8852700340417706e-05, "loss": 0.5546, "mean_token_accuracy": 0.8231820166110992, "num_tokens": 740408194.0, "step": 23200 }, { "entropy": 0.5772030688822269, "epoch": 2.1346053214185083, "grad_norm": 0.1643086075782776, "learning_rate": 2.8849633514276077e-05, "loss": 0.5537, "mean_token_accuracy": 0.8243639729917049, "num_tokens": 740439537.0, "step": 23201 }, { "entropy": 0.5171600617468357, "epoch": 2.1346973277899495, "grad_norm": 0.16526181995868683, "learning_rate": 2.884656668813445e-05, "loss": 0.5024, "mean_token_accuracy": 0.8382229544222355, "num_tokens": 740471206.0, "step": 23202 }, { "entropy": 0.4801423577591777, "epoch": 2.1347893341613906, "grad_norm": 0.15764547884464264, "learning_rate": 2.8843499861992823e-05, "loss": 0.4668, "mean_token_accuracy": 0.8504354357719421, "num_tokens": 740502653.0, "step": 23203 }, { "entropy": 0.5387161895632744, "epoch": 2.1348813405328317, "grad_norm": 0.16505186259746552, "learning_rate": 2.88404330358512e-05, "loss": 0.5263, "mean_token_accuracy": 0.8340415246784687, "num_tokens": 740534556.0, "step": 23204 }, { "entropy": 0.5531846140511334, "epoch": 2.1349733469042733, "grad_norm": 0.16499854624271393, "learning_rate": 2.8837366209709572e-05, "loss": 0.5427, "mean_token_accuracy": 0.8282453045248985, "num_tokens": 740566467.0, "step": 23205 }, { "entropy": 0.5391591317020357, "epoch": 2.1350653532757145, "grad_norm": 0.16306526958942413, "learning_rate": 2.8834299383567947e-05, "loss": 0.5267, "mean_token_accuracy": 0.835502877831459, "num_tokens": 740598101.0, "step": 23206 }, { "entropy": 0.4807076705619693, "epoch": 2.1351573596471556, "grad_norm": 0.1563183218240738, "learning_rate": 2.8831232557426318e-05, "loss": 0.461, "mean_token_accuracy": 0.8508006483316422, "num_tokens": 740630182.0, "step": 23207 }, { "entropy": 0.46794455824419856, "epoch": 2.1352493660185967, "grad_norm": 0.15438178181648254, "learning_rate": 2.8828165731284696e-05, "loss": 0.4548, "mean_token_accuracy": 0.8543593697249889, "num_tokens": 740662581.0, "step": 23208 }, { "entropy": 0.4927364466711879, "epoch": 2.135341372390038, "grad_norm": 0.15540839731693268, "learning_rate": 2.8825098905143067e-05, "loss": 0.48, "mean_token_accuracy": 0.8463354893028736, "num_tokens": 740694882.0, "step": 23209 }, { "entropy": 0.5660964213311672, "epoch": 2.1354333787614794, "grad_norm": 0.16723893582820892, "learning_rate": 2.8822032079001442e-05, "loss": 0.5457, "mean_token_accuracy": 0.8292684033513069, "num_tokens": 740726165.0, "step": 23210 }, { "entropy": 0.4682519156485796, "epoch": 2.1355253851329206, "grad_norm": 0.1580444872379303, "learning_rate": 2.8818965252859813e-05, "loss": 0.456, "mean_token_accuracy": 0.8585297651588917, "num_tokens": 740757369.0, "step": 23211 }, { "entropy": 0.5595266241580248, "epoch": 2.1356173915043617, "grad_norm": 0.16422030329704285, "learning_rate": 2.881589842671819e-05, "loss": 0.5419, "mean_token_accuracy": 0.8260028958320618, "num_tokens": 740788966.0, "step": 23212 }, { "entropy": 0.5338604832068086, "epoch": 2.135709397875803, "grad_norm": 0.15707772970199585, "learning_rate": 2.8812831600576563e-05, "loss": 0.5174, "mean_token_accuracy": 0.8373957984149456, "num_tokens": 740821646.0, "step": 23213 }, { "entropy": 0.523818401619792, "epoch": 2.135801404247244, "grad_norm": 0.16297519207000732, "learning_rate": 2.8809764774434937e-05, "loss": 0.5062, "mean_token_accuracy": 0.8394963629543781, "num_tokens": 740853177.0, "step": 23214 }, { "entropy": 0.40377596858888865, "epoch": 2.1358934106186855, "grad_norm": 0.14813987910747528, "learning_rate": 2.8806697948293315e-05, "loss": 0.4005, "mean_token_accuracy": 0.8711029849946499, "num_tokens": 740885291.0, "step": 23215 }, { "entropy": 0.5641043856739998, "epoch": 2.1359854169901267, "grad_norm": 0.17290358245372772, "learning_rate": 2.8803631122151687e-05, "loss": 0.5478, "mean_token_accuracy": 0.827203132212162, "num_tokens": 740916586.0, "step": 23216 }, { "entropy": 0.5986371105536819, "epoch": 2.136077423361568, "grad_norm": 0.17283202707767487, "learning_rate": 2.8800564296010065e-05, "loss": 0.5808, "mean_token_accuracy": 0.8170713223516941, "num_tokens": 740948114.0, "step": 23217 }, { "entropy": 0.520323564298451, "epoch": 2.136169429733009, "grad_norm": 0.1704334318637848, "learning_rate": 2.8797497469868436e-05, "loss": 0.5009, "mean_token_accuracy": 0.8432340174913406, "num_tokens": 740977528.0, "step": 23218 }, { "entropy": 0.5112226372584701, "epoch": 2.13626143610445, "grad_norm": 0.15847019851207733, "learning_rate": 2.879443064372681e-05, "loss": 0.5028, "mean_token_accuracy": 0.842116504907608, "num_tokens": 741010296.0, "step": 23219 }, { "entropy": 0.48033329914323986, "epoch": 2.1363534424758917, "grad_norm": 0.15931715071201324, "learning_rate": 2.8791363817585182e-05, "loss": 0.4602, "mean_token_accuracy": 0.851326622068882, "num_tokens": 741041171.0, "step": 23220 }, { "entropy": 0.4566344153136015, "epoch": 2.136445448847333, "grad_norm": 0.1551692932844162, "learning_rate": 2.878829699144356e-05, "loss": 0.4364, "mean_token_accuracy": 0.8578681126236916, "num_tokens": 741072945.0, "step": 23221 }, { "entropy": 0.467099504545331, "epoch": 2.136537455218774, "grad_norm": 0.15437017381191254, "learning_rate": 2.878523016530193e-05, "loss": 0.4522, "mean_token_accuracy": 0.8547022268176079, "num_tokens": 741104359.0, "step": 23222 }, { "entropy": 0.5482999477535486, "epoch": 2.136629461590215, "grad_norm": 0.16454140841960907, "learning_rate": 2.8782163339160306e-05, "loss": 0.5276, "mean_token_accuracy": 0.8288729265332222, "num_tokens": 741136061.0, "step": 23223 }, { "entropy": 0.537886512465775, "epoch": 2.136721467961656, "grad_norm": 0.16004058718681335, "learning_rate": 2.8779096513018677e-05, "loss": 0.5251, "mean_token_accuracy": 0.8349657729268074, "num_tokens": 741168559.0, "step": 23224 }, { "entropy": 0.47341970819979906, "epoch": 2.1368134743330978, "grad_norm": 0.14901894330978394, "learning_rate": 2.8776029686877055e-05, "loss": 0.4532, "mean_token_accuracy": 0.8543697521090508, "num_tokens": 741200754.0, "step": 23225 }, { "entropy": 0.4845702173188329, "epoch": 2.136905480704539, "grad_norm": 0.1526861935853958, "learning_rate": 2.8772962860735426e-05, "loss": 0.4805, "mean_token_accuracy": 0.8477672375738621, "num_tokens": 741232813.0, "step": 23226 }, { "entropy": 0.6012881500646472, "epoch": 2.13699748707598, "grad_norm": 0.17308960855007172, "learning_rate": 2.87698960345938e-05, "loss": 0.5931, "mean_token_accuracy": 0.8141300305724144, "num_tokens": 741264227.0, "step": 23227 }, { "entropy": 0.5065867304801941, "epoch": 2.137089493447421, "grad_norm": 0.15626350045204163, "learning_rate": 2.8766829208452172e-05, "loss": 0.4985, "mean_token_accuracy": 0.8428983762860298, "num_tokens": 741296292.0, "step": 23228 }, { "entropy": 0.5134672466665506, "epoch": 2.1371814998188623, "grad_norm": 0.1595616638660431, "learning_rate": 2.876376238231055e-05, "loss": 0.5074, "mean_token_accuracy": 0.8378497809171677, "num_tokens": 741327929.0, "step": 23229 }, { "entropy": 0.5295632937923074, "epoch": 2.137273506190304, "grad_norm": 0.16215066611766815, "learning_rate": 2.876069555616892e-05, "loss": 0.5036, "mean_token_accuracy": 0.8376821391284466, "num_tokens": 741359512.0, "step": 23230 }, { "entropy": 0.5927592236548662, "epoch": 2.137365512561745, "grad_norm": 0.16807647049427032, "learning_rate": 2.8757628730027296e-05, "loss": 0.5808, "mean_token_accuracy": 0.818610992282629, "num_tokens": 741391621.0, "step": 23231 }, { "entropy": 0.46619167644530535, "epoch": 2.137457518933186, "grad_norm": 0.15860453248023987, "learning_rate": 2.8754561903885667e-05, "loss": 0.4518, "mean_token_accuracy": 0.8558145277202129, "num_tokens": 741422993.0, "step": 23232 }, { "entropy": 0.43463163427077234, "epoch": 2.1375495253046273, "grad_norm": 0.14907939732074738, "learning_rate": 2.8751495077744045e-05, "loss": 0.4196, "mean_token_accuracy": 0.8638796918094158, "num_tokens": 741454382.0, "step": 23233 }, { "entropy": 0.46960093826055527, "epoch": 2.1376415316760684, "grad_norm": 0.16005456447601318, "learning_rate": 2.8748428251602417e-05, "loss": 0.459, "mean_token_accuracy": 0.8527140468358994, "num_tokens": 741486028.0, "step": 23234 }, { "entropy": 0.4237500783056021, "epoch": 2.13773353804751, "grad_norm": 0.15367291867733002, "learning_rate": 2.874536142546079e-05, "loss": 0.4135, "mean_token_accuracy": 0.8664670847356319, "num_tokens": 741517808.0, "step": 23235 }, { "entropy": 0.5791432689875364, "epoch": 2.137825544418951, "grad_norm": 0.16820672154426575, "learning_rate": 2.8742294599319163e-05, "loss": 0.5538, "mean_token_accuracy": 0.8205828070640564, "num_tokens": 741549546.0, "step": 23236 }, { "entropy": 0.5151622872799635, "epoch": 2.1379175507903923, "grad_norm": 0.16330954432487488, "learning_rate": 2.873922777317754e-05, "loss": 0.4983, "mean_token_accuracy": 0.8417632915079594, "num_tokens": 741580343.0, "step": 23237 }, { "entropy": 0.5107581140473485, "epoch": 2.1380095571618334, "grad_norm": 0.16906726360321045, "learning_rate": 2.8736160947035912e-05, "loss": 0.5008, "mean_token_accuracy": 0.8387046530842781, "num_tokens": 741612430.0, "step": 23238 }, { "entropy": 0.5947691351175308, "epoch": 2.1381015635332745, "grad_norm": 0.17352358996868134, "learning_rate": 2.873309412089429e-05, "loss": 0.5857, "mean_token_accuracy": 0.8167214877903461, "num_tokens": 741644289.0, "step": 23239 }, { "entropy": 0.5836571513209492, "epoch": 2.138193569904716, "grad_norm": 0.1644209623336792, "learning_rate": 2.873002729475266e-05, "loss": 0.5747, "mean_token_accuracy": 0.8230337090790272, "num_tokens": 741677057.0, "step": 23240 }, { "entropy": 0.5593928750604391, "epoch": 2.1382855762761572, "grad_norm": 0.16055960953235626, "learning_rate": 2.8726960468611036e-05, "loss": 0.5461, "mean_token_accuracy": 0.8260581195354462, "num_tokens": 741709434.0, "step": 23241 }, { "entropy": 0.45034509990364313, "epoch": 2.1383775826475984, "grad_norm": 0.15871365368366241, "learning_rate": 2.8723893642469407e-05, "loss": 0.4453, "mean_token_accuracy": 0.8594659678637981, "num_tokens": 741741729.0, "step": 23242 }, { "entropy": 0.514242599485442, "epoch": 2.1384695890190395, "grad_norm": 0.1591237485408783, "learning_rate": 2.8720826816327785e-05, "loss": 0.4973, "mean_token_accuracy": 0.8409486897289753, "num_tokens": 741773215.0, "step": 23243 }, { "entropy": 0.46188972145318985, "epoch": 2.1385615953904806, "grad_norm": 0.16266068816184998, "learning_rate": 2.871775999018616e-05, "loss": 0.4531, "mean_token_accuracy": 0.8578067347407341, "num_tokens": 741804450.0, "step": 23244 }, { "entropy": 0.47923386096954346, "epoch": 2.138653601761922, "grad_norm": 0.1572401076555252, "learning_rate": 2.871469316404453e-05, "loss": 0.4632, "mean_token_accuracy": 0.8565536886453629, "num_tokens": 741836178.0, "step": 23245 }, { "entropy": 0.44758116267621517, "epoch": 2.1387456081333633, "grad_norm": 0.1530957669019699, "learning_rate": 2.871162633790291e-05, "loss": 0.4317, "mean_token_accuracy": 0.8603346273303032, "num_tokens": 741868657.0, "step": 23246 }, { "entropy": 0.4986031537409872, "epoch": 2.1388376145048045, "grad_norm": 0.15781709551811218, "learning_rate": 2.870855951176128e-05, "loss": 0.4819, "mean_token_accuracy": 0.8448217958211899, "num_tokens": 741900411.0, "step": 23247 }, { "entropy": 0.5853879377245903, "epoch": 2.1389296208762456, "grad_norm": 0.16947788000106812, "learning_rate": 2.8705492685619655e-05, "loss": 0.5716, "mean_token_accuracy": 0.8196653686463833, "num_tokens": 741932553.0, "step": 23248 }, { "entropy": 0.56903469376266, "epoch": 2.1390216272476867, "grad_norm": 0.1657293140888214, "learning_rate": 2.8702425859478026e-05, "loss": 0.5448, "mean_token_accuracy": 0.8267125152051449, "num_tokens": 741964372.0, "step": 23249 }, { "entropy": 0.5952368378639221, "epoch": 2.1391136336191283, "grad_norm": 0.16940826177597046, "learning_rate": 2.8699359033336404e-05, "loss": 0.5819, "mean_token_accuracy": 0.8162714429199696, "num_tokens": 741995988.0, "step": 23250 }, { "entropy": 0.5920016448944807, "epoch": 2.1392056399905695, "grad_norm": 0.1701945811510086, "learning_rate": 2.8696292207194775e-05, "loss": 0.582, "mean_token_accuracy": 0.8183244615793228, "num_tokens": 742028006.0, "step": 23251 }, { "entropy": 0.46074866224080324, "epoch": 2.1392976463620106, "grad_norm": 0.15395094454288483, "learning_rate": 2.869322538105315e-05, "loss": 0.4588, "mean_token_accuracy": 0.8554525598883629, "num_tokens": 742060065.0, "step": 23252 }, { "entropy": 0.5675759334117174, "epoch": 2.1393896527334517, "grad_norm": 0.16949968039989471, "learning_rate": 2.869015855491152e-05, "loss": 0.5427, "mean_token_accuracy": 0.8284929096698761, "num_tokens": 742091074.0, "step": 23253 }, { "entropy": 0.5820810068398714, "epoch": 2.139481659104893, "grad_norm": 0.16943947970867157, "learning_rate": 2.86870917287699e-05, "loss": 0.5747, "mean_token_accuracy": 0.8166837766766548, "num_tokens": 742122534.0, "step": 23254 }, { "entropy": 0.5827467078343034, "epoch": 2.1395736654763344, "grad_norm": 0.16802114248275757, "learning_rate": 2.868402490262827e-05, "loss": 0.5768, "mean_token_accuracy": 0.8179222382605076, "num_tokens": 742155230.0, "step": 23255 }, { "entropy": 0.5645031007006764, "epoch": 2.1396656718477756, "grad_norm": 0.1629181206226349, "learning_rate": 2.868095807648665e-05, "loss": 0.5545, "mean_token_accuracy": 0.8277500905096531, "num_tokens": 742186974.0, "step": 23256 }, { "entropy": 0.46293772105127573, "epoch": 2.1397576782192167, "grad_norm": 0.15743663907051086, "learning_rate": 2.8677891250345017e-05, "loss": 0.4463, "mean_token_accuracy": 0.8591130338609219, "num_tokens": 742219416.0, "step": 23257 }, { "entropy": 0.5291464782785624, "epoch": 2.139849684590658, "grad_norm": 0.16238591074943542, "learning_rate": 2.8674824424203395e-05, "loss": 0.5179, "mean_token_accuracy": 0.8346298523247242, "num_tokens": 742251479.0, "step": 23258 }, { "entropy": 0.5759221320040524, "epoch": 2.139941690962099, "grad_norm": 0.17114022374153137, "learning_rate": 2.8671757598061766e-05, "loss": 0.5636, "mean_token_accuracy": 0.8227950260043144, "num_tokens": 742283222.0, "step": 23259 }, { "entropy": 0.5366431940346956, "epoch": 2.1400336973335405, "grad_norm": 0.15765857696533203, "learning_rate": 2.8668690771920144e-05, "loss": 0.5112, "mean_token_accuracy": 0.8353404812514782, "num_tokens": 742315027.0, "step": 23260 }, { "entropy": 0.5453957365825772, "epoch": 2.1401257037049817, "grad_norm": 0.1613359898328781, "learning_rate": 2.8665623945778515e-05, "loss": 0.5287, "mean_token_accuracy": 0.8319189921021461, "num_tokens": 742347586.0, "step": 23261 }, { "entropy": 0.5087412279099226, "epoch": 2.140217710076423, "grad_norm": 0.1620623916387558, "learning_rate": 2.866255711963689e-05, "loss": 0.5103, "mean_token_accuracy": 0.8378871530294418, "num_tokens": 742379861.0, "step": 23262 }, { "entropy": 0.5345679391175508, "epoch": 2.140309716447864, "grad_norm": 0.15883922576904297, "learning_rate": 2.865949029349526e-05, "loss": 0.5166, "mean_token_accuracy": 0.8368633575737476, "num_tokens": 742411971.0, "step": 23263 }, { "entropy": 0.5494063647929579, "epoch": 2.140401722819305, "grad_norm": 0.16748729348182678, "learning_rate": 2.865642346735364e-05, "loss": 0.5437, "mean_token_accuracy": 0.8334147743880749, "num_tokens": 742443875.0, "step": 23264 }, { "entropy": 0.4720749566331506, "epoch": 2.1404937291907467, "grad_norm": 0.15973810851573944, "learning_rate": 2.865335664121201e-05, "loss": 0.4609, "mean_token_accuracy": 0.8546931110322475, "num_tokens": 742476247.0, "step": 23265 }, { "entropy": 0.5167452050372958, "epoch": 2.140585735562188, "grad_norm": 0.16120529174804688, "learning_rate": 2.8650289815070385e-05, "loss": 0.5135, "mean_token_accuracy": 0.8377984315156937, "num_tokens": 742508094.0, "step": 23266 }, { "entropy": 0.5320530193857849, "epoch": 2.140677741933629, "grad_norm": 0.1622486263513565, "learning_rate": 2.8647222988928756e-05, "loss": 0.516, "mean_token_accuracy": 0.8392092362046242, "num_tokens": 742539983.0, "step": 23267 }, { "entropy": 0.5141870500519872, "epoch": 2.14076974830507, "grad_norm": 0.1596747487783432, "learning_rate": 2.8644156162787134e-05, "loss": 0.4944, "mean_token_accuracy": 0.8413038067519665, "num_tokens": 742571656.0, "step": 23268 }, { "entropy": 0.5920631410554051, "epoch": 2.140861754676511, "grad_norm": 0.1637779027223587, "learning_rate": 2.8641089336645506e-05, "loss": 0.5873, "mean_token_accuracy": 0.8151412717998028, "num_tokens": 742603991.0, "step": 23269 }, { "entropy": 0.48255777545273304, "epoch": 2.1409537610479528, "grad_norm": 0.16028910875320435, "learning_rate": 2.863802251050388e-05, "loss": 0.4595, "mean_token_accuracy": 0.8514119386672974, "num_tokens": 742634943.0, "step": 23270 }, { "entropy": 0.5863784588873386, "epoch": 2.141045767419394, "grad_norm": 0.17009790241718292, "learning_rate": 2.863495568436225e-05, "loss": 0.577, "mean_token_accuracy": 0.8167099244892597, "num_tokens": 742666013.0, "step": 23271 }, { "entropy": 0.5450926050543785, "epoch": 2.141137773790835, "grad_norm": 0.16416265070438385, "learning_rate": 2.863188885822063e-05, "loss": 0.5328, "mean_token_accuracy": 0.8315127231180668, "num_tokens": 742697961.0, "step": 23272 }, { "entropy": 0.553635070566088, "epoch": 2.141229780162276, "grad_norm": 0.15712030231952667, "learning_rate": 2.8628822032079e-05, "loss": 0.5399, "mean_token_accuracy": 0.8300972580909729, "num_tokens": 742730161.0, "step": 23273 }, { "entropy": 0.5575167797505856, "epoch": 2.1413217865337173, "grad_norm": 0.16424605250358582, "learning_rate": 2.8625755205937375e-05, "loss": 0.5466, "mean_token_accuracy": 0.8228336907923222, "num_tokens": 742762412.0, "step": 23274 }, { "entropy": 0.5153187471441925, "epoch": 2.141413792905159, "grad_norm": 0.15988574922084808, "learning_rate": 2.8622688379795753e-05, "loss": 0.5057, "mean_token_accuracy": 0.8386416099965572, "num_tokens": 742794281.0, "step": 23275 }, { "entropy": 0.6047354023903608, "epoch": 2.1415057992766, "grad_norm": 0.17021475732326508, "learning_rate": 2.8619621553654125e-05, "loss": 0.5915, "mean_token_accuracy": 0.8187010213732719, "num_tokens": 742826787.0, "step": 23276 }, { "entropy": 0.5003835996612906, "epoch": 2.141597805648041, "grad_norm": 0.15560674667358398, "learning_rate": 2.8616554727512503e-05, "loss": 0.4819, "mean_token_accuracy": 0.8444064408540726, "num_tokens": 742859555.0, "step": 23277 }, { "entropy": 0.5587190575897694, "epoch": 2.1416898120194823, "grad_norm": 0.16678424179553986, "learning_rate": 2.8613487901370874e-05, "loss": 0.5451, "mean_token_accuracy": 0.8287745788693428, "num_tokens": 742890902.0, "step": 23278 }, { "entropy": 0.5734157180413604, "epoch": 2.1417818183909234, "grad_norm": 0.16860991716384888, "learning_rate": 2.861042107522925e-05, "loss": 0.5677, "mean_token_accuracy": 0.8229945860803127, "num_tokens": 742922840.0, "step": 23279 }, { "entropy": 0.5451793801039457, "epoch": 2.141873824762365, "grad_norm": 0.17020119726657867, "learning_rate": 2.860735424908762e-05, "loss": 0.5198, "mean_token_accuracy": 0.8377978801727295, "num_tokens": 742954271.0, "step": 23280 }, { "entropy": 0.5003829095512629, "epoch": 2.141965831133806, "grad_norm": 0.15929915010929108, "learning_rate": 2.8604287422945998e-05, "loss": 0.4854, "mean_token_accuracy": 0.8440065495669842, "num_tokens": 742987038.0, "step": 23281 }, { "entropy": 0.5803697891533375, "epoch": 2.1420578375052473, "grad_norm": 0.16934019327163696, "learning_rate": 2.860122059680437e-05, "loss": 0.5659, "mean_token_accuracy": 0.8227817378938198, "num_tokens": 743019273.0, "step": 23282 }, { "entropy": 0.5406418819911778, "epoch": 2.1421498438766884, "grad_norm": 0.16356626152992249, "learning_rate": 2.8598153770662744e-05, "loss": 0.5274, "mean_token_accuracy": 0.8316172994673252, "num_tokens": 743051352.0, "step": 23283 }, { "entropy": 0.5123699251562357, "epoch": 2.1422418502481295, "grad_norm": 0.1644597351551056, "learning_rate": 2.8595086944521115e-05, "loss": 0.5033, "mean_token_accuracy": 0.8385825119912624, "num_tokens": 743083016.0, "step": 23284 }, { "entropy": 0.5811642289627343, "epoch": 2.142333856619571, "grad_norm": 0.1752173751592636, "learning_rate": 2.8592020118379493e-05, "loss": 0.5737, "mean_token_accuracy": 0.8191650211811066, "num_tokens": 743114195.0, "step": 23285 }, { "entropy": 0.5778890671208501, "epoch": 2.1424258629910122, "grad_norm": 0.17176423966884613, "learning_rate": 2.8588953292237864e-05, "loss": 0.5694, "mean_token_accuracy": 0.8216324001550674, "num_tokens": 743145911.0, "step": 23286 }, { "entropy": 0.49432759499177337, "epoch": 2.1425178693624534, "grad_norm": 0.155733123421669, "learning_rate": 2.858588646609624e-05, "loss": 0.4821, "mean_token_accuracy": 0.8495807647705078, "num_tokens": 743177750.0, "step": 23287 }, { "entropy": 0.4451605365611613, "epoch": 2.1426098757338945, "grad_norm": 0.14878761768341064, "learning_rate": 2.858281963995461e-05, "loss": 0.4272, "mean_token_accuracy": 0.8635843209922314, "num_tokens": 743210259.0, "step": 23288 }, { "entropy": 0.42310275603085756, "epoch": 2.1427018821053356, "grad_norm": 0.14516878128051758, "learning_rate": 2.857975281381299e-05, "loss": 0.4088, "mean_token_accuracy": 0.867936298251152, "num_tokens": 743242973.0, "step": 23289 }, { "entropy": 0.5305727617815137, "epoch": 2.142793888476777, "grad_norm": 0.16265623271465302, "learning_rate": 2.857668598767136e-05, "loss": 0.5177, "mean_token_accuracy": 0.8364607989788055, "num_tokens": 743275571.0, "step": 23290 }, { "entropy": 0.5431813895702362, "epoch": 2.1428858948482183, "grad_norm": 0.16909779608249664, "learning_rate": 2.8573619161529734e-05, "loss": 0.5358, "mean_token_accuracy": 0.8294406868517399, "num_tokens": 743307035.0, "step": 23291 }, { "entropy": 0.5125799672678113, "epoch": 2.1429779012196595, "grad_norm": 0.16415730118751526, "learning_rate": 2.8570552335388106e-05, "loss": 0.5116, "mean_token_accuracy": 0.8379032388329506, "num_tokens": 743338838.0, "step": 23292 }, { "entropy": 0.5115627031773329, "epoch": 2.1430699075911006, "grad_norm": 0.1635432094335556, "learning_rate": 2.8567485509246484e-05, "loss": 0.4966, "mean_token_accuracy": 0.8407481499016285, "num_tokens": 743369856.0, "step": 23293 }, { "entropy": 0.47495747928041965, "epoch": 2.1431619139625417, "grad_norm": 0.15119172632694244, "learning_rate": 2.8564418683104855e-05, "loss": 0.4672, "mean_token_accuracy": 0.8518792241811752, "num_tokens": 743402609.0, "step": 23294 }, { "entropy": 0.5412805154919624, "epoch": 2.1432539203339833, "grad_norm": 0.161237895488739, "learning_rate": 2.856135185696323e-05, "loss": 0.5253, "mean_token_accuracy": 0.8368009515106678, "num_tokens": 743434918.0, "step": 23295 }, { "entropy": 0.5597788896411657, "epoch": 2.1433459267054245, "grad_norm": 0.16045494377613068, "learning_rate": 2.85582850308216e-05, "loss": 0.5382, "mean_token_accuracy": 0.8296356908977032, "num_tokens": 743466806.0, "step": 23296 }, { "entropy": 0.5967075601220131, "epoch": 2.1434379330768656, "grad_norm": 0.16621540486812592, "learning_rate": 2.855521820467998e-05, "loss": 0.5747, "mean_token_accuracy": 0.8176578804850578, "num_tokens": 743498627.0, "step": 23297 }, { "entropy": 0.5240523186512291, "epoch": 2.1435299394483067, "grad_norm": 0.15721893310546875, "learning_rate": 2.855215137853835e-05, "loss": 0.513, "mean_token_accuracy": 0.8413031622767448, "num_tokens": 743531008.0, "step": 23298 }, { "entropy": 0.48502062633633614, "epoch": 2.143621945819748, "grad_norm": 0.1515403687953949, "learning_rate": 2.8549084552396728e-05, "loss": 0.4626, "mean_token_accuracy": 0.8538060486316681, "num_tokens": 743562940.0, "step": 23299 }, { "entropy": 0.4267255365848541, "epoch": 2.1437139521911894, "grad_norm": 0.15103428065776825, "learning_rate": 2.85460177262551e-05, "loss": 0.4094, "mean_token_accuracy": 0.8711774088442326, "num_tokens": 743595403.0, "step": 23300 }, { "entropy": 0.481189395301044, "epoch": 2.1438059585626306, "grad_norm": 0.1546238511800766, "learning_rate": 2.8542950900113474e-05, "loss": 0.4633, "mean_token_accuracy": 0.8516255356371403, "num_tokens": 743627314.0, "step": 23301 }, { "entropy": 0.4933141078799963, "epoch": 2.1438979649340717, "grad_norm": 0.1612999141216278, "learning_rate": 2.8539884073971845e-05, "loss": 0.4681, "mean_token_accuracy": 0.846443060785532, "num_tokens": 743659191.0, "step": 23302 }, { "entropy": 0.5496018771082163, "epoch": 2.143989971305513, "grad_norm": 0.16079863905906677, "learning_rate": 2.8536817247830223e-05, "loss": 0.5387, "mean_token_accuracy": 0.8295943774282932, "num_tokens": 743691159.0, "step": 23303 }, { "entropy": 0.4746436821296811, "epoch": 2.144081977676954, "grad_norm": 0.1548490971326828, "learning_rate": 2.8533750421688595e-05, "loss": 0.4523, "mean_token_accuracy": 0.856615673750639, "num_tokens": 743723294.0, "step": 23304 }, { "entropy": 0.4776165699586272, "epoch": 2.1441739840483955, "grad_norm": 0.16239579021930695, "learning_rate": 2.853068359554697e-05, "loss": 0.4685, "mean_token_accuracy": 0.8469549641013145, "num_tokens": 743754754.0, "step": 23305 }, { "entropy": 0.5417794343084097, "epoch": 2.1442659904198367, "grad_norm": 0.16278070211410522, "learning_rate": 2.8527616769405347e-05, "loss": 0.5172, "mean_token_accuracy": 0.8346157670021057, "num_tokens": 743785794.0, "step": 23306 }, { "entropy": 0.5413365326821804, "epoch": 2.144357996791278, "grad_norm": 0.16313815116882324, "learning_rate": 2.852454994326372e-05, "loss": 0.5377, "mean_token_accuracy": 0.8287230283021927, "num_tokens": 743818143.0, "step": 23307 }, { "entropy": 0.5614390913397074, "epoch": 2.144450003162719, "grad_norm": 0.165363609790802, "learning_rate": 2.8521483117122093e-05, "loss": 0.5447, "mean_token_accuracy": 0.8283136151731014, "num_tokens": 743849461.0, "step": 23308 }, { "entropy": 0.6557016633450985, "epoch": 2.14454200953416, "grad_norm": 0.17811398208141327, "learning_rate": 2.8518416290980464e-05, "loss": 0.6461, "mean_token_accuracy": 0.7985451556742191, "num_tokens": 743880535.0, "step": 23309 }, { "entropy": 0.41366380546242, "epoch": 2.1446340159056017, "grad_norm": 0.15328092873096466, "learning_rate": 2.8515349464838842e-05, "loss": 0.3998, "mean_token_accuracy": 0.8704618625342846, "num_tokens": 743912914.0, "step": 23310 }, { "entropy": 0.4756177607923746, "epoch": 2.144726022277043, "grad_norm": 0.15497943758964539, "learning_rate": 2.8512282638697214e-05, "loss": 0.4657, "mean_token_accuracy": 0.8545997031033039, "num_tokens": 743945150.0, "step": 23311 }, { "entropy": 0.5270340666174889, "epoch": 2.144818028648484, "grad_norm": 0.1667640656232834, "learning_rate": 2.8509215812555588e-05, "loss": 0.5122, "mean_token_accuracy": 0.8396582342684269, "num_tokens": 743976727.0, "step": 23312 }, { "entropy": 0.5476831952109933, "epoch": 2.144910035019925, "grad_norm": 0.1658991426229477, "learning_rate": 2.850614898641396e-05, "loss": 0.5457, "mean_token_accuracy": 0.827313095331192, "num_tokens": 744009073.0, "step": 23313 }, { "entropy": 0.4657703754492104, "epoch": 2.145002041391366, "grad_norm": 0.16185875236988068, "learning_rate": 2.8503082160272338e-05, "loss": 0.4553, "mean_token_accuracy": 0.8565440736711025, "num_tokens": 744041237.0, "step": 23314 }, { "entropy": 0.44487542659044266, "epoch": 2.1450940477628078, "grad_norm": 0.1529327929019928, "learning_rate": 2.850001533413071e-05, "loss": 0.4315, "mean_token_accuracy": 0.8642019927501678, "num_tokens": 744073551.0, "step": 23315 }, { "entropy": 0.555076646618545, "epoch": 2.145186054134249, "grad_norm": 0.16754597425460815, "learning_rate": 2.8496948507989087e-05, "loss": 0.5472, "mean_token_accuracy": 0.8266343958675861, "num_tokens": 744105437.0, "step": 23316 }, { "entropy": 0.5413127709180117, "epoch": 2.14527806050569, "grad_norm": 0.16051168739795685, "learning_rate": 2.8493881681847455e-05, "loss": 0.5259, "mean_token_accuracy": 0.8322501815855503, "num_tokens": 744137954.0, "step": 23317 }, { "entropy": 0.5161866266280413, "epoch": 2.145370066877131, "grad_norm": 0.16122625768184662, "learning_rate": 2.8490814855705833e-05, "loss": 0.5098, "mean_token_accuracy": 0.8414149880409241, "num_tokens": 744170254.0, "step": 23318 }, { "entropy": 0.5413804519921541, "epoch": 2.1454620732485723, "grad_norm": 0.16167312860488892, "learning_rate": 2.8487748029564204e-05, "loss": 0.5207, "mean_token_accuracy": 0.8342248648405075, "num_tokens": 744202499.0, "step": 23319 }, { "entropy": 0.48829830763861537, "epoch": 2.145554079620014, "grad_norm": 0.15267987549304962, "learning_rate": 2.8484681203422582e-05, "loss": 0.469, "mean_token_accuracy": 0.85326087474823, "num_tokens": 744235267.0, "step": 23320 }, { "entropy": 0.49090142315253615, "epoch": 2.145646085991455, "grad_norm": 0.16139782965183258, "learning_rate": 2.8481614377280953e-05, "loss": 0.4766, "mean_token_accuracy": 0.8506980612874031, "num_tokens": 744266908.0, "step": 23321 }, { "entropy": 0.48516367631964386, "epoch": 2.145738092362896, "grad_norm": 0.15566948056221008, "learning_rate": 2.8478547551139328e-05, "loss": 0.4751, "mean_token_accuracy": 0.8502838611602783, "num_tokens": 744298968.0, "step": 23322 }, { "entropy": 0.48936553206294775, "epoch": 2.1458300987343373, "grad_norm": 0.1515355259180069, "learning_rate": 2.84754807249977e-05, "loss": 0.4693, "mean_token_accuracy": 0.8503103703260422, "num_tokens": 744331367.0, "step": 23323 }, { "entropy": 0.5625440869480371, "epoch": 2.1459221051057784, "grad_norm": 0.16347189247608185, "learning_rate": 2.8472413898856077e-05, "loss": 0.5439, "mean_token_accuracy": 0.8269117586314678, "num_tokens": 744362813.0, "step": 23324 }, { "entropy": 0.4860346589703113, "epoch": 2.14601411147722, "grad_norm": 0.16138501465320587, "learning_rate": 2.846934707271445e-05, "loss": 0.4656, "mean_token_accuracy": 0.8492652773857117, "num_tokens": 744394277.0, "step": 23325 }, { "entropy": 0.5563548374921083, "epoch": 2.146106117848661, "grad_norm": 0.1650405079126358, "learning_rate": 2.8466280246572823e-05, "loss": 0.5424, "mean_token_accuracy": 0.8288572207093239, "num_tokens": 744426195.0, "step": 23326 }, { "entropy": 0.5205330867320299, "epoch": 2.1461981242201023, "grad_norm": 0.1643301099538803, "learning_rate": 2.8463213420431194e-05, "loss": 0.5174, "mean_token_accuracy": 0.8355981819331646, "num_tokens": 744457795.0, "step": 23327 }, { "entropy": 0.470852380618453, "epoch": 2.1462901305915434, "grad_norm": 0.15390226244926453, "learning_rate": 2.8460146594289572e-05, "loss": 0.4559, "mean_token_accuracy": 0.856119092553854, "num_tokens": 744489774.0, "step": 23328 }, { "entropy": 0.5319911446422338, "epoch": 2.1463821369629845, "grad_norm": 0.16653858125209808, "learning_rate": 2.8457079768147944e-05, "loss": 0.524, "mean_token_accuracy": 0.8320982754230499, "num_tokens": 744522012.0, "step": 23329 }, { "entropy": 0.5388133293017745, "epoch": 2.146474143334426, "grad_norm": 0.15934912860393524, "learning_rate": 2.845401294200632e-05, "loss": 0.5218, "mean_token_accuracy": 0.8351806811988354, "num_tokens": 744554426.0, "step": 23330 }, { "entropy": 0.49252062290906906, "epoch": 2.1465661497058672, "grad_norm": 0.15838932991027832, "learning_rate": 2.845094611586469e-05, "loss": 0.4814, "mean_token_accuracy": 0.8468997441232204, "num_tokens": 744586623.0, "step": 23331 }, { "entropy": 0.48293980304151773, "epoch": 2.1466581560773084, "grad_norm": 0.15305301547050476, "learning_rate": 2.8447879289723068e-05, "loss": 0.4544, "mean_token_accuracy": 0.8516116477549076, "num_tokens": 744617869.0, "step": 23332 }, { "entropy": 0.565430699614808, "epoch": 2.1467501624487495, "grad_norm": 0.16371674835681915, "learning_rate": 2.844481246358144e-05, "loss": 0.5517, "mean_token_accuracy": 0.8272948376834393, "num_tokens": 744650510.0, "step": 23333 }, { "entropy": 0.6639653164893389, "epoch": 2.1468421688201906, "grad_norm": 0.17964686453342438, "learning_rate": 2.8441745637439814e-05, "loss": 0.6582, "mean_token_accuracy": 0.7948466464877129, "num_tokens": 744682427.0, "step": 23334 }, { "entropy": 0.4515158561989665, "epoch": 2.146934175191632, "grad_norm": 0.1523595154285431, "learning_rate": 2.8438678811298185e-05, "loss": 0.4389, "mean_token_accuracy": 0.8606476560235023, "num_tokens": 744714579.0, "step": 23335 }, { "entropy": 0.5611701216548681, "epoch": 2.1470261815630733, "grad_norm": 0.163155198097229, "learning_rate": 2.8435611985156563e-05, "loss": 0.539, "mean_token_accuracy": 0.8294143937528133, "num_tokens": 744746539.0, "step": 23336 }, { "entropy": 0.6765648629516363, "epoch": 2.1471181879345145, "grad_norm": 0.1771920621395111, "learning_rate": 2.843254515901494e-05, "loss": 0.6619, "mean_token_accuracy": 0.7960396073758602, "num_tokens": 744778864.0, "step": 23337 }, { "entropy": 0.5367965158075094, "epoch": 2.1472101943059556, "grad_norm": 0.16750745475292206, "learning_rate": 2.8429478332873312e-05, "loss": 0.5192, "mean_token_accuracy": 0.8364421129226685, "num_tokens": 744810082.0, "step": 23338 }, { "entropy": 0.42194920568726957, "epoch": 2.1473022006773967, "grad_norm": 0.14876675605773926, "learning_rate": 2.8426411506731687e-05, "loss": 0.413, "mean_token_accuracy": 0.8658715412020683, "num_tokens": 744842228.0, "step": 23339 }, { "entropy": 0.5139192622154951, "epoch": 2.1473942070488383, "grad_norm": 0.16177648305892944, "learning_rate": 2.8423344680590058e-05, "loss": 0.5007, "mean_token_accuracy": 0.8409750461578369, "num_tokens": 744874395.0, "step": 23340 }, { "entropy": 0.44223692500963807, "epoch": 2.1474862134202795, "grad_norm": 0.15472617745399475, "learning_rate": 2.8420277854448436e-05, "loss": 0.4257, "mean_token_accuracy": 0.8649903051555157, "num_tokens": 744906720.0, "step": 23341 }, { "entropy": 0.5834575518965721, "epoch": 2.1475782197917206, "grad_norm": 0.16949881613254547, "learning_rate": 2.8417211028306807e-05, "loss": 0.5772, "mean_token_accuracy": 0.8187176510691643, "num_tokens": 744937726.0, "step": 23342 }, { "entropy": 0.533001497387886, "epoch": 2.1476702261631617, "grad_norm": 0.16105934977531433, "learning_rate": 2.8414144202165182e-05, "loss": 0.5222, "mean_token_accuracy": 0.8334355652332306, "num_tokens": 744969264.0, "step": 23343 }, { "entropy": 0.4946293383836746, "epoch": 2.147762232534603, "grad_norm": 0.1597868800163269, "learning_rate": 2.8411077376023553e-05, "loss": 0.482, "mean_token_accuracy": 0.8458305858075619, "num_tokens": 745000910.0, "step": 23344 }, { "entropy": 0.44934645062312484, "epoch": 2.1478542389060444, "grad_norm": 0.16374418139457703, "learning_rate": 2.840801054988193e-05, "loss": 0.4288, "mean_token_accuracy": 0.8645389266312122, "num_tokens": 745032589.0, "step": 23345 }, { "entropy": 0.585043067112565, "epoch": 2.1479462452774856, "grad_norm": 0.17250822484493256, "learning_rate": 2.8404943723740303e-05, "loss": 0.5714, "mean_token_accuracy": 0.8213891685009003, "num_tokens": 745064186.0, "step": 23346 }, { "entropy": 0.5722779808565974, "epoch": 2.1480382516489267, "grad_norm": 0.16417747735977173, "learning_rate": 2.8401876897598677e-05, "loss": 0.5526, "mean_token_accuracy": 0.8239378221333027, "num_tokens": 745095827.0, "step": 23347 }, { "entropy": 0.5602258406579494, "epoch": 2.148130258020368, "grad_norm": 0.16532060503959656, "learning_rate": 2.839881007145705e-05, "loss": 0.5483, "mean_token_accuracy": 0.8299515806138515, "num_tokens": 745128125.0, "step": 23348 }, { "entropy": 0.4140780041925609, "epoch": 2.148222264391809, "grad_norm": 0.14169922471046448, "learning_rate": 2.8395743245315427e-05, "loss": 0.3978, "mean_token_accuracy": 0.8705954365432262, "num_tokens": 745160643.0, "step": 23349 }, { "entropy": 0.629798648878932, "epoch": 2.1483142707632505, "grad_norm": 0.16992737352848053, "learning_rate": 2.8392676419173798e-05, "loss": 0.6121, "mean_token_accuracy": 0.8111282028257847, "num_tokens": 745192887.0, "step": 23350 }, { "entropy": 0.591770994476974, "epoch": 2.1484062771346917, "grad_norm": 0.17155137658119202, "learning_rate": 2.8389609593032172e-05, "loss": 0.5751, "mean_token_accuracy": 0.8200083673000336, "num_tokens": 745224654.0, "step": 23351 }, { "entropy": 0.5325293764472008, "epoch": 2.148498283506133, "grad_norm": 0.16744883358478546, "learning_rate": 2.8386542766890544e-05, "loss": 0.5234, "mean_token_accuracy": 0.8333029039204121, "num_tokens": 745256074.0, "step": 23352 }, { "entropy": 0.4655007617548108, "epoch": 2.148590289877574, "grad_norm": 0.15517228841781616, "learning_rate": 2.8383475940748922e-05, "loss": 0.4501, "mean_token_accuracy": 0.8565389551222324, "num_tokens": 745288556.0, "step": 23353 }, { "entropy": 0.539492130279541, "epoch": 2.148682296249015, "grad_norm": 0.16986508667469025, "learning_rate": 2.8380409114607293e-05, "loss": 0.522, "mean_token_accuracy": 0.8347857035696507, "num_tokens": 745320104.0, "step": 23354 }, { "entropy": 0.4927043477073312, "epoch": 2.1487743026204567, "grad_norm": 0.15661977231502533, "learning_rate": 2.8377342288465668e-05, "loss": 0.4695, "mean_token_accuracy": 0.8503851406276226, "num_tokens": 745352257.0, "step": 23355 }, { "entropy": 0.5653113499283791, "epoch": 2.148866308991898, "grad_norm": 0.1693437397480011, "learning_rate": 2.837427546232404e-05, "loss": 0.5528, "mean_token_accuracy": 0.8279324062168598, "num_tokens": 745384651.0, "step": 23356 }, { "entropy": 0.541675501037389, "epoch": 2.148958315363339, "grad_norm": 0.16446590423583984, "learning_rate": 2.8371208636182417e-05, "loss": 0.5193, "mean_token_accuracy": 0.8350731208920479, "num_tokens": 745416582.0, "step": 23357 }, { "entropy": 0.48764346167445183, "epoch": 2.14905032173478, "grad_norm": 0.15662892162799835, "learning_rate": 2.8368141810040788e-05, "loss": 0.4755, "mean_token_accuracy": 0.8501162193715572, "num_tokens": 745448971.0, "step": 23358 }, { "entropy": 0.5503964452072978, "epoch": 2.149142328106221, "grad_norm": 0.1622060090303421, "learning_rate": 2.8365074983899166e-05, "loss": 0.5401, "mean_token_accuracy": 0.8284682966768742, "num_tokens": 745480830.0, "step": 23359 }, { "entropy": 0.49450945761054754, "epoch": 2.1492343344776628, "grad_norm": 0.1605997383594513, "learning_rate": 2.8362008157757537e-05, "loss": 0.4886, "mean_token_accuracy": 0.8460445329546928, "num_tokens": 745512930.0, "step": 23360 }, { "entropy": 0.4760913043282926, "epoch": 2.149326340849104, "grad_norm": 0.15779022872447968, "learning_rate": 2.8358941331615912e-05, "loss": 0.4587, "mean_token_accuracy": 0.8521895855665207, "num_tokens": 745544582.0, "step": 23361 }, { "entropy": 0.5262236585840583, "epoch": 2.149418347220545, "grad_norm": 0.16202285885810852, "learning_rate": 2.8355874505474283e-05, "loss": 0.5011, "mean_token_accuracy": 0.8396730162203312, "num_tokens": 745576537.0, "step": 23362 }, { "entropy": 0.5123435440473258, "epoch": 2.149510353591986, "grad_norm": 0.16046592593193054, "learning_rate": 2.835280767933266e-05, "loss": 0.5071, "mean_token_accuracy": 0.8393457718193531, "num_tokens": 745608964.0, "step": 23363 }, { "entropy": 0.5030562044121325, "epoch": 2.1496023599634273, "grad_norm": 0.1650247424840927, "learning_rate": 2.8349740853191033e-05, "loss": 0.4872, "mean_token_accuracy": 0.8430608548223972, "num_tokens": 745640681.0, "step": 23364 }, { "entropy": 0.4949344899505377, "epoch": 2.149694366334869, "grad_norm": 0.16207341849803925, "learning_rate": 2.8346674027049407e-05, "loss": 0.4776, "mean_token_accuracy": 0.8486727885901928, "num_tokens": 745673078.0, "step": 23365 }, { "entropy": 0.5885431747883558, "epoch": 2.14978637270631, "grad_norm": 0.17186731100082397, "learning_rate": 2.8343607200907785e-05, "loss": 0.5795, "mean_token_accuracy": 0.8187835216522217, "num_tokens": 745704812.0, "step": 23366 }, { "entropy": 0.47343552112579346, "epoch": 2.149878379077751, "grad_norm": 0.15301495790481567, "learning_rate": 2.8340540374766157e-05, "loss": 0.4637, "mean_token_accuracy": 0.8543756976723671, "num_tokens": 745736990.0, "step": 23367 }, { "entropy": 0.5795233882963657, "epoch": 2.1499703854491923, "grad_norm": 0.16253778338432312, "learning_rate": 2.833747354862453e-05, "loss": 0.563, "mean_token_accuracy": 0.8212206587195396, "num_tokens": 745768794.0, "step": 23368 }, { "entropy": 0.5199990896508098, "epoch": 2.1500623918206334, "grad_norm": 0.16337443888187408, "learning_rate": 2.8334406722482903e-05, "loss": 0.5071, "mean_token_accuracy": 0.8375399932265282, "num_tokens": 745800852.0, "step": 23369 }, { "entropy": 0.45908898767083883, "epoch": 2.150154398192075, "grad_norm": 0.1559341698884964, "learning_rate": 2.833133989634128e-05, "loss": 0.4355, "mean_token_accuracy": 0.8634586594998837, "num_tokens": 745832510.0, "step": 23370 }, { "entropy": 0.6003435747697949, "epoch": 2.150246404563516, "grad_norm": 0.16584143042564392, "learning_rate": 2.8328273070199652e-05, "loss": 0.5877, "mean_token_accuracy": 0.8172398097813129, "num_tokens": 745865175.0, "step": 23371 }, { "entropy": 0.5217044604942203, "epoch": 2.1503384109349573, "grad_norm": 0.16251741349697113, "learning_rate": 2.8325206244058026e-05, "loss": 0.51, "mean_token_accuracy": 0.8384233675897121, "num_tokens": 745896275.0, "step": 23372 }, { "entropy": 0.5221348418854177, "epoch": 2.1504304173063984, "grad_norm": 0.15904167294502258, "learning_rate": 2.8322139417916398e-05, "loss": 0.504, "mean_token_accuracy": 0.8380654081702232, "num_tokens": 745928251.0, "step": 23373 }, { "entropy": 0.5202692188322544, "epoch": 2.1505224236778395, "grad_norm": 0.17003636062145233, "learning_rate": 2.8319072591774776e-05, "loss": 0.517, "mean_token_accuracy": 0.835818562656641, "num_tokens": 745959973.0, "step": 23374 }, { "entropy": 0.5384088875725865, "epoch": 2.150614430049281, "grad_norm": 0.16147051751613617, "learning_rate": 2.8316005765633147e-05, "loss": 0.5342, "mean_token_accuracy": 0.8330411538481712, "num_tokens": 745992331.0, "step": 23375 }, { "entropy": 0.5284120896831155, "epoch": 2.1507064364207222, "grad_norm": 0.15692491829395294, "learning_rate": 2.8312938939491525e-05, "loss": 0.5022, "mean_token_accuracy": 0.8432144299149513, "num_tokens": 746024574.0, "step": 23376 }, { "entropy": 0.4478382512461394, "epoch": 2.1507984427921634, "grad_norm": 0.15761972963809967, "learning_rate": 2.8309872113349893e-05, "loss": 0.4317, "mean_token_accuracy": 0.8627981841564178, "num_tokens": 746056330.0, "step": 23377 }, { "entropy": 0.5530404271557927, "epoch": 2.1508904491636045, "grad_norm": 0.16671758890151978, "learning_rate": 2.830680528720827e-05, "loss": 0.5475, "mean_token_accuracy": 0.8262438289821148, "num_tokens": 746088099.0, "step": 23378 }, { "entropy": 0.5254337675869465, "epoch": 2.1509824555350456, "grad_norm": 0.15958885848522186, "learning_rate": 2.8303738461066642e-05, "loss": 0.5101, "mean_token_accuracy": 0.8362896032631397, "num_tokens": 746120307.0, "step": 23379 }, { "entropy": 0.36035145772621036, "epoch": 2.151074461906487, "grad_norm": 0.1433117389678955, "learning_rate": 2.830067163492502e-05, "loss": 0.3417, "mean_token_accuracy": 0.8866857439279556, "num_tokens": 746152076.0, "step": 23380 }, { "entropy": 0.47302879113703966, "epoch": 2.1511664682779283, "grad_norm": 0.15205450356006622, "learning_rate": 2.829760480878339e-05, "loss": 0.4616, "mean_token_accuracy": 0.8584208562970161, "num_tokens": 746184844.0, "step": 23381 }, { "entropy": 0.5761929536238313, "epoch": 2.1512584746493695, "grad_norm": 0.16454672813415527, "learning_rate": 2.8294537982641766e-05, "loss": 0.5632, "mean_token_accuracy": 0.8242106288671494, "num_tokens": 746216454.0, "step": 23382 }, { "entropy": 0.5131681263446808, "epoch": 2.1513504810208106, "grad_norm": 0.15646101534366608, "learning_rate": 2.8291471156500137e-05, "loss": 0.5085, "mean_token_accuracy": 0.8388195410370827, "num_tokens": 746248559.0, "step": 23383 }, { "entropy": 0.4801428415812552, "epoch": 2.1514424873922517, "grad_norm": 0.15692241489887238, "learning_rate": 2.8288404330358515e-05, "loss": 0.4583, "mean_token_accuracy": 0.8507545180618763, "num_tokens": 746279890.0, "step": 23384 }, { "entropy": 0.4985344037413597, "epoch": 2.1515344937636933, "grad_norm": 0.1562694013118744, "learning_rate": 2.8285337504216887e-05, "loss": 0.4916, "mean_token_accuracy": 0.8470748364925385, "num_tokens": 746311637.0, "step": 23385 }, { "entropy": 0.4662233926355839, "epoch": 2.1516265001351345, "grad_norm": 0.15662403404712677, "learning_rate": 2.828227067807526e-05, "loss": 0.4563, "mean_token_accuracy": 0.8523117750883102, "num_tokens": 746343236.0, "step": 23386 }, { "entropy": 0.44371055718511343, "epoch": 2.1517185065065756, "grad_norm": 0.16483132541179657, "learning_rate": 2.8279203851933633e-05, "loss": 0.4328, "mean_token_accuracy": 0.864654365926981, "num_tokens": 746374564.0, "step": 23387 }, { "entropy": 0.5264291316270828, "epoch": 2.1518105128780167, "grad_norm": 0.16766253113746643, "learning_rate": 2.827613702579201e-05, "loss": 0.5112, "mean_token_accuracy": 0.8359456919133663, "num_tokens": 746406120.0, "step": 23388 }, { "entropy": 0.5861297058872879, "epoch": 2.151902519249458, "grad_norm": 0.17068937420845032, "learning_rate": 2.8273070199650382e-05, "loss": 0.5732, "mean_token_accuracy": 0.823046687990427, "num_tokens": 746437748.0, "step": 23389 }, { "entropy": 0.5197410015389323, "epoch": 2.1519945256208994, "grad_norm": 0.16209368407726288, "learning_rate": 2.8270003373508757e-05, "loss": 0.5142, "mean_token_accuracy": 0.8368656858801842, "num_tokens": 746470430.0, "step": 23390 }, { "entropy": 0.5434769308194518, "epoch": 2.1520865319923406, "grad_norm": 0.15948033332824707, "learning_rate": 2.8266936547367128e-05, "loss": 0.5226, "mean_token_accuracy": 0.8324911519885063, "num_tokens": 746502630.0, "step": 23391 }, { "entropy": 0.5930714784190059, "epoch": 2.1521785383637817, "grad_norm": 0.16588649153709412, "learning_rate": 2.8263869721225506e-05, "loss": 0.5747, "mean_token_accuracy": 0.8211705088615417, "num_tokens": 746534604.0, "step": 23392 }, { "entropy": 0.5728655178099871, "epoch": 2.152270544735223, "grad_norm": 0.16244839131832123, "learning_rate": 2.8260802895083877e-05, "loss": 0.5517, "mean_token_accuracy": 0.8286859318614006, "num_tokens": 746567246.0, "step": 23393 }, { "entropy": 0.48083787597715855, "epoch": 2.152362551106664, "grad_norm": 0.16034649312496185, "learning_rate": 2.8257736068942252e-05, "loss": 0.4659, "mean_token_accuracy": 0.8487491048872471, "num_tokens": 746599161.0, "step": 23394 }, { "entropy": 0.5292590521275997, "epoch": 2.1524545574781055, "grad_norm": 0.16470156610012054, "learning_rate": 2.8254669242800623e-05, "loss": 0.51, "mean_token_accuracy": 0.834989856928587, "num_tokens": 746630523.0, "step": 23395 }, { "entropy": 0.5334465857595205, "epoch": 2.1525465638495467, "grad_norm": 0.15965594351291656, "learning_rate": 2.8251602416659e-05, "loss": 0.5225, "mean_token_accuracy": 0.8337605893611908, "num_tokens": 746662706.0, "step": 23396 }, { "entropy": 0.4958984572440386, "epoch": 2.152638570220988, "grad_norm": 0.15633311867713928, "learning_rate": 2.824853559051738e-05, "loss": 0.4851, "mean_token_accuracy": 0.8484735079109669, "num_tokens": 746695044.0, "step": 23397 }, { "entropy": 0.505479458719492, "epoch": 2.152730576592429, "grad_norm": 0.1594187170267105, "learning_rate": 2.824546876437575e-05, "loss": 0.4929, "mean_token_accuracy": 0.8432479985058308, "num_tokens": 746726790.0, "step": 23398 }, { "entropy": 0.5152829196304083, "epoch": 2.15282258296387, "grad_norm": 0.1566484570503235, "learning_rate": 2.8242401938234125e-05, "loss": 0.4953, "mean_token_accuracy": 0.8432742208242416, "num_tokens": 746759120.0, "step": 23399 }, { "entropy": 0.552235959097743, "epoch": 2.1529145893353117, "grad_norm": 0.16777543723583221, "learning_rate": 2.8239335112092496e-05, "loss": 0.5366, "mean_token_accuracy": 0.8303936272859573, "num_tokens": 746790791.0, "step": 23400 }, { "entropy": 0.5020347125828266, "epoch": 2.153006595706753, "grad_norm": 0.15665961802005768, "learning_rate": 2.8236268285950874e-05, "loss": 0.4931, "mean_token_accuracy": 0.8422546088695526, "num_tokens": 746822807.0, "step": 23401 }, { "entropy": 0.5196290402673185, "epoch": 2.153098602078194, "grad_norm": 0.15953640639781952, "learning_rate": 2.8233201459809246e-05, "loss": 0.4944, "mean_token_accuracy": 0.8420410081744194, "num_tokens": 746854876.0, "step": 23402 }, { "entropy": 0.6193419918417931, "epoch": 2.153190608449635, "grad_norm": 0.16560125350952148, "learning_rate": 2.823013463366762e-05, "loss": 0.6079, "mean_token_accuracy": 0.8075143843889236, "num_tokens": 746886949.0, "step": 23403 }, { "entropy": 0.4978593732230365, "epoch": 2.153282614821076, "grad_norm": 0.15642084181308746, "learning_rate": 2.822706780752599e-05, "loss": 0.4803, "mean_token_accuracy": 0.8472082652151585, "num_tokens": 746919305.0, "step": 23404 }, { "entropy": 0.49680525064468384, "epoch": 2.1533746211925178, "grad_norm": 0.15783455967903137, "learning_rate": 2.822400098138437e-05, "loss": 0.4864, "mean_token_accuracy": 0.8444799557328224, "num_tokens": 746951286.0, "step": 23405 }, { "entropy": 0.4997322456911206, "epoch": 2.153466627563959, "grad_norm": 0.1603190004825592, "learning_rate": 2.822093415524274e-05, "loss": 0.4816, "mean_token_accuracy": 0.8441021852195263, "num_tokens": 746983252.0, "step": 23406 }, { "entropy": 0.5197136574424803, "epoch": 2.1535586339354, "grad_norm": 0.16315963864326477, "learning_rate": 2.8217867329101115e-05, "loss": 0.5042, "mean_token_accuracy": 0.8415290154516697, "num_tokens": 747014234.0, "step": 23407 }, { "entropy": 0.46837185230106115, "epoch": 2.153650640306841, "grad_norm": 0.1546141356229782, "learning_rate": 2.8214800502959487e-05, "loss": 0.4589, "mean_token_accuracy": 0.8523767478764057, "num_tokens": 747045922.0, "step": 23408 }, { "entropy": 0.519160027615726, "epoch": 2.1537426466782823, "grad_norm": 0.1622045338153839, "learning_rate": 2.8211733676817865e-05, "loss": 0.4985, "mean_token_accuracy": 0.8415082097053528, "num_tokens": 747077567.0, "step": 23409 }, { "entropy": 0.48517479561269283, "epoch": 2.153834653049724, "grad_norm": 0.1616578996181488, "learning_rate": 2.8208666850676236e-05, "loss": 0.4736, "mean_token_accuracy": 0.8503417260944843, "num_tokens": 747109303.0, "step": 23410 }, { "entropy": 0.5878372620791197, "epoch": 2.153926659421165, "grad_norm": 0.16736091673374176, "learning_rate": 2.820560002453461e-05, "loss": 0.5705, "mean_token_accuracy": 0.8206657059490681, "num_tokens": 747141957.0, "step": 23411 }, { "entropy": 0.4420473761856556, "epoch": 2.154018665792606, "grad_norm": 0.15598176419734955, "learning_rate": 2.8202533198392982e-05, "loss": 0.4298, "mean_token_accuracy": 0.8655262105166912, "num_tokens": 747174241.0, "step": 23412 }, { "entropy": 0.5103033985942602, "epoch": 2.1541106721640473, "grad_norm": 0.16166849434375763, "learning_rate": 2.819946637225136e-05, "loss": 0.4889, "mean_token_accuracy": 0.8432502821087837, "num_tokens": 747205809.0, "step": 23413 }, { "entropy": 0.617220526561141, "epoch": 2.1542026785354884, "grad_norm": 0.17003794014453888, "learning_rate": 2.819639954610973e-05, "loss": 0.6112, "mean_token_accuracy": 0.8098879344761372, "num_tokens": 747238185.0, "step": 23414 }, { "entropy": 0.5863440800458193, "epoch": 2.15429468490693, "grad_norm": 0.16486166417598724, "learning_rate": 2.8193332719968106e-05, "loss": 0.5776, "mean_token_accuracy": 0.8162607699632645, "num_tokens": 747270606.0, "step": 23415 }, { "entropy": 0.49287179857492447, "epoch": 2.154386691278371, "grad_norm": 0.15001410245895386, "learning_rate": 2.8190265893826477e-05, "loss": 0.4841, "mean_token_accuracy": 0.8452797271311283, "num_tokens": 747302679.0, "step": 23416 }, { "entropy": 0.47327770944684744, "epoch": 2.1544786976498123, "grad_norm": 0.15109902620315552, "learning_rate": 2.8187199067684855e-05, "loss": 0.4552, "mean_token_accuracy": 0.8565662875771523, "num_tokens": 747334197.0, "step": 23417 }, { "entropy": 0.5261021219193935, "epoch": 2.1545707040212534, "grad_norm": 0.164966881275177, "learning_rate": 2.8184132241543226e-05, "loss": 0.4972, "mean_token_accuracy": 0.8425910845398903, "num_tokens": 747365422.0, "step": 23418 }, { "entropy": 0.5251949857920408, "epoch": 2.1546627103926945, "grad_norm": 0.16137389838695526, "learning_rate": 2.8181065415401604e-05, "loss": 0.5112, "mean_token_accuracy": 0.8390032574534416, "num_tokens": 747397303.0, "step": 23419 }, { "entropy": 0.537420991808176, "epoch": 2.154754716764136, "grad_norm": 0.16950593888759613, "learning_rate": 2.8177998589259976e-05, "loss": 0.5238, "mean_token_accuracy": 0.8338142484426498, "num_tokens": 747429326.0, "step": 23420 }, { "entropy": 0.5573554651346058, "epoch": 2.1548467231355772, "grad_norm": 0.1644422560930252, "learning_rate": 2.817493176311835e-05, "loss": 0.5399, "mean_token_accuracy": 0.8262745216488838, "num_tokens": 747460821.0, "step": 23421 }, { "entropy": 0.4108503647148609, "epoch": 2.1549387295070184, "grad_norm": 0.1506013125181198, "learning_rate": 2.817186493697672e-05, "loss": 0.4016, "mean_token_accuracy": 0.8714293912053108, "num_tokens": 747491949.0, "step": 23422 }, { "entropy": 0.5589940054342151, "epoch": 2.1550307358784595, "grad_norm": 0.16107536852359772, "learning_rate": 2.81687981108351e-05, "loss": 0.5365, "mean_token_accuracy": 0.8329453021287918, "num_tokens": 747524357.0, "step": 23423 }, { "entropy": 0.4415067955851555, "epoch": 2.1551227422499006, "grad_norm": 0.14593109488487244, "learning_rate": 2.816573128469347e-05, "loss": 0.4279, "mean_token_accuracy": 0.8630519099533558, "num_tokens": 747556591.0, "step": 23424 }, { "entropy": 0.4936859328299761, "epoch": 2.155214748621342, "grad_norm": 0.15459118783473969, "learning_rate": 2.8162664458551846e-05, "loss": 0.4831, "mean_token_accuracy": 0.848081286996603, "num_tokens": 747588561.0, "step": 23425 }, { "entropy": 0.5956119047477841, "epoch": 2.1553067549927833, "grad_norm": 0.16258633136749268, "learning_rate": 2.8159597632410217e-05, "loss": 0.583, "mean_token_accuracy": 0.8161331824958324, "num_tokens": 747620528.0, "step": 23426 }, { "entropy": 0.460949907079339, "epoch": 2.1553987613642245, "grad_norm": 0.14850854873657227, "learning_rate": 2.8156530806268595e-05, "loss": 0.4378, "mean_token_accuracy": 0.860158309340477, "num_tokens": 747652612.0, "step": 23427 }, { "entropy": 0.5643499307334423, "epoch": 2.1554907677356656, "grad_norm": 0.1641542613506317, "learning_rate": 2.815346398012697e-05, "loss": 0.5502, "mean_token_accuracy": 0.8288532122969627, "num_tokens": 747685052.0, "step": 23428 }, { "entropy": 0.4754661079496145, "epoch": 2.1555827741071067, "grad_norm": 0.15305957198143005, "learning_rate": 2.815039715398534e-05, "loss": 0.4531, "mean_token_accuracy": 0.8522467650473118, "num_tokens": 747716189.0, "step": 23429 }, { "entropy": 0.578808382153511, "epoch": 2.1556747804785483, "grad_norm": 0.17098091542720795, "learning_rate": 2.814733032784372e-05, "loss": 0.5623, "mean_token_accuracy": 0.8214322961866856, "num_tokens": 747747380.0, "step": 23430 }, { "entropy": 0.5209644697606564, "epoch": 2.1557667868499895, "grad_norm": 0.15723134577274323, "learning_rate": 2.814426350170209e-05, "loss": 0.5109, "mean_token_accuracy": 0.8348575793206692, "num_tokens": 747780038.0, "step": 23431 }, { "entropy": 0.47949178144335747, "epoch": 2.1558587932214306, "grad_norm": 0.15120293200016022, "learning_rate": 2.8141196675560465e-05, "loss": 0.4647, "mean_token_accuracy": 0.8540831282734871, "num_tokens": 747811512.0, "step": 23432 }, { "entropy": 0.4721435662358999, "epoch": 2.1559507995928717, "grad_norm": 0.15902309119701385, "learning_rate": 2.8138129849418836e-05, "loss": 0.4698, "mean_token_accuracy": 0.8512546867132187, "num_tokens": 747842870.0, "step": 23433 }, { "entropy": 0.4948863787576556, "epoch": 2.156042805964313, "grad_norm": 0.16482451558113098, "learning_rate": 2.8135063023277214e-05, "loss": 0.48, "mean_token_accuracy": 0.8469477593898773, "num_tokens": 747874180.0, "step": 23434 }, { "entropy": 0.5718777887523174, "epoch": 2.1561348123357544, "grad_norm": 0.16566097736358643, "learning_rate": 2.8131996197135585e-05, "loss": 0.5532, "mean_token_accuracy": 0.8276202753186226, "num_tokens": 747906032.0, "step": 23435 }, { "entropy": 0.5160844754427671, "epoch": 2.1562268187071956, "grad_norm": 0.16052626073360443, "learning_rate": 2.8128929370993963e-05, "loss": 0.5089, "mean_token_accuracy": 0.8410536162555218, "num_tokens": 747937223.0, "step": 23436 }, { "entropy": 0.5655996473506093, "epoch": 2.1563188250786367, "grad_norm": 0.16484345495700836, "learning_rate": 2.812586254485233e-05, "loss": 0.5565, "mean_token_accuracy": 0.8235893324017525, "num_tokens": 747969073.0, "step": 23437 }, { "entropy": 0.5721032153815031, "epoch": 2.156410831450078, "grad_norm": 0.16624456644058228, "learning_rate": 2.812279571871071e-05, "loss": 0.5575, "mean_token_accuracy": 0.8237679116427898, "num_tokens": 748001452.0, "step": 23438 }, { "entropy": 0.4740562466904521, "epoch": 2.156502837821519, "grad_norm": 0.16284073889255524, "learning_rate": 2.811972889256908e-05, "loss": 0.4627, "mean_token_accuracy": 0.8511470779776573, "num_tokens": 748033367.0, "step": 23439 }, { "entropy": 0.4542404944077134, "epoch": 2.1565948441929605, "grad_norm": 0.15752914547920227, "learning_rate": 2.811666206642746e-05, "loss": 0.4417, "mean_token_accuracy": 0.8572495952248573, "num_tokens": 748064671.0, "step": 23440 }, { "entropy": 0.5588226020336151, "epoch": 2.1566868505644017, "grad_norm": 0.16518303751945496, "learning_rate": 2.811359524028583e-05, "loss": 0.5497, "mean_token_accuracy": 0.8267586678266525, "num_tokens": 748097439.0, "step": 23441 }, { "entropy": 0.5568671766668558, "epoch": 2.156778856935843, "grad_norm": 0.1665256917476654, "learning_rate": 2.8110528414144204e-05, "loss": 0.5485, "mean_token_accuracy": 0.8267584703862667, "num_tokens": 748129162.0, "step": 23442 }, { "entropy": 0.5326804388314486, "epoch": 2.156870863307284, "grad_norm": 0.16420000791549683, "learning_rate": 2.8107461588002576e-05, "loss": 0.5152, "mean_token_accuracy": 0.8369474746286869, "num_tokens": 748160974.0, "step": 23443 }, { "entropy": 0.5981994923204184, "epoch": 2.156962869678725, "grad_norm": 0.17135190963745117, "learning_rate": 2.8104394761860954e-05, "loss": 0.5833, "mean_token_accuracy": 0.8193386904895306, "num_tokens": 748193122.0, "step": 23444 }, { "entropy": 0.5273944046348333, "epoch": 2.1570548760501667, "grad_norm": 0.1597188264131546, "learning_rate": 2.8101327935719325e-05, "loss": 0.5106, "mean_token_accuracy": 0.8372706323862076, "num_tokens": 748225759.0, "step": 23445 }, { "entropy": 0.4858878212980926, "epoch": 2.157146882421608, "grad_norm": 0.15583285689353943, "learning_rate": 2.80982611095777e-05, "loss": 0.4778, "mean_token_accuracy": 0.8469762951135635, "num_tokens": 748257465.0, "step": 23446 }, { "entropy": 0.5329191666096449, "epoch": 2.157238888793049, "grad_norm": 0.17072145640850067, "learning_rate": 2.809519428343607e-05, "loss": 0.5228, "mean_token_accuracy": 0.8354067727923393, "num_tokens": 748289480.0, "step": 23447 }, { "entropy": 0.4226704239845276, "epoch": 2.15733089516449, "grad_norm": 0.15220436453819275, "learning_rate": 2.809212745729445e-05, "loss": 0.4038, "mean_token_accuracy": 0.86734788864851, "num_tokens": 748320618.0, "step": 23448 }, { "entropy": 0.5085692908614874, "epoch": 2.157422901535931, "grad_norm": 0.15942294895648956, "learning_rate": 2.808906063115282e-05, "loss": 0.4888, "mean_token_accuracy": 0.8449982218444347, "num_tokens": 748352405.0, "step": 23449 }, { "entropy": 0.47348846308887005, "epoch": 2.1575149079073728, "grad_norm": 0.15385514497756958, "learning_rate": 2.8085993805011195e-05, "loss": 0.4602, "mean_token_accuracy": 0.85589150339365, "num_tokens": 748384433.0, "step": 23450 }, { "entropy": 0.562282214872539, "epoch": 2.157606914278814, "grad_norm": 0.17253363132476807, "learning_rate": 2.8082926978869566e-05, "loss": 0.5468, "mean_token_accuracy": 0.8278262689709663, "num_tokens": 748416516.0, "step": 23451 }, { "entropy": 0.4324852302670479, "epoch": 2.157698920650255, "grad_norm": 0.1520569920539856, "learning_rate": 2.8079860152727944e-05, "loss": 0.4126, "mean_token_accuracy": 0.8647802583873272, "num_tokens": 748449055.0, "step": 23452 }, { "entropy": 0.5905902050435543, "epoch": 2.157790927021696, "grad_norm": 0.1687912940979004, "learning_rate": 2.8076793326586315e-05, "loss": 0.5809, "mean_token_accuracy": 0.817687351256609, "num_tokens": 748481004.0, "step": 23453 }, { "entropy": 0.5167394056916237, "epoch": 2.1578829333931373, "grad_norm": 0.16065730154514313, "learning_rate": 2.807372650044469e-05, "loss": 0.4938, "mean_token_accuracy": 0.8426745198667049, "num_tokens": 748512828.0, "step": 23454 }, { "entropy": 0.4802569013554603, "epoch": 2.157974939764579, "grad_norm": 0.15349288284778595, "learning_rate": 2.807065967430306e-05, "loss": 0.4545, "mean_token_accuracy": 0.8566337376832962, "num_tokens": 748545131.0, "step": 23455 }, { "entropy": 0.5476955231279135, "epoch": 2.15806694613602, "grad_norm": 0.15731972455978394, "learning_rate": 2.806759284816144e-05, "loss": 0.5316, "mean_token_accuracy": 0.8313037008047104, "num_tokens": 748577624.0, "step": 23456 }, { "entropy": 0.47734370082616806, "epoch": 2.158158952507461, "grad_norm": 0.1627618968486786, "learning_rate": 2.806452602201981e-05, "loss": 0.4764, "mean_token_accuracy": 0.847549568861723, "num_tokens": 748609043.0, "step": 23457 }, { "entropy": 0.5151209244504571, "epoch": 2.1582509588789023, "grad_norm": 0.16592298448085785, "learning_rate": 2.806145919587819e-05, "loss": 0.5055, "mean_token_accuracy": 0.836217287927866, "num_tokens": 748640449.0, "step": 23458 }, { "entropy": 0.5081052323803306, "epoch": 2.1583429652503434, "grad_norm": 0.1608268767595291, "learning_rate": 2.8058392369736563e-05, "loss": 0.49, "mean_token_accuracy": 0.8464403860270977, "num_tokens": 748673031.0, "step": 23459 }, { "entropy": 0.562757782638073, "epoch": 2.158434971621785, "grad_norm": 0.1679995357990265, "learning_rate": 2.8055325543594934e-05, "loss": 0.5474, "mean_token_accuracy": 0.8259842321276665, "num_tokens": 748704452.0, "step": 23460 }, { "entropy": 0.4598269126145169, "epoch": 2.158526977993226, "grad_norm": 0.16098713874816895, "learning_rate": 2.8052258717453313e-05, "loss": 0.4539, "mean_token_accuracy": 0.8555351570248604, "num_tokens": 748735488.0, "step": 23461 }, { "entropy": 0.5119688119739294, "epoch": 2.1586189843646673, "grad_norm": 0.16090920567512512, "learning_rate": 2.8049191891311684e-05, "loss": 0.4959, "mean_token_accuracy": 0.8424451053142548, "num_tokens": 748767950.0, "step": 23462 }, { "entropy": 0.6432587709277868, "epoch": 2.1587109907361084, "grad_norm": 0.17698849737644196, "learning_rate": 2.804612506517006e-05, "loss": 0.6273, "mean_token_accuracy": 0.8045528754591942, "num_tokens": 748798636.0, "step": 23463 }, { "entropy": 0.519122782163322, "epoch": 2.1588029971075495, "grad_norm": 0.16432133316993713, "learning_rate": 2.804305823902843e-05, "loss": 0.5051, "mean_token_accuracy": 0.8392215892672539, "num_tokens": 748831210.0, "step": 23464 }, { "entropy": 0.5664203120395541, "epoch": 2.158895003478991, "grad_norm": 0.16218310594558716, "learning_rate": 2.8039991412886808e-05, "loss": 0.5449, "mean_token_accuracy": 0.8293555527925491, "num_tokens": 748863784.0, "step": 23465 }, { "entropy": 0.5998277012258768, "epoch": 2.1589870098504322, "grad_norm": 0.16151203215122223, "learning_rate": 2.803692458674518e-05, "loss": 0.5705, "mean_token_accuracy": 0.8188213743269444, "num_tokens": 748896250.0, "step": 23466 }, { "entropy": 0.5173106230795383, "epoch": 2.1590790162218734, "grad_norm": 0.1617462933063507, "learning_rate": 2.8033857760603554e-05, "loss": 0.5056, "mean_token_accuracy": 0.8401215709745884, "num_tokens": 748928701.0, "step": 23467 }, { "entropy": 0.6046184748411179, "epoch": 2.1591710225933145, "grad_norm": 0.17451760172843933, "learning_rate": 2.8030790934461925e-05, "loss": 0.589, "mean_token_accuracy": 0.8127662055194378, "num_tokens": 748960487.0, "step": 23468 }, { "entropy": 0.4872327616903931, "epoch": 2.1592630289647556, "grad_norm": 0.16226331889629364, "learning_rate": 2.8027724108320303e-05, "loss": 0.4666, "mean_token_accuracy": 0.8484062664210796, "num_tokens": 748992131.0, "step": 23469 }, { "entropy": 0.5440181232988834, "epoch": 2.159355035336197, "grad_norm": 0.16622598469257355, "learning_rate": 2.8024657282178674e-05, "loss": 0.536, "mean_token_accuracy": 0.8301937319338322, "num_tokens": 749024306.0, "step": 23470 }, { "entropy": 0.5970989242196083, "epoch": 2.1594470417076383, "grad_norm": 0.17150059342384338, "learning_rate": 2.802159045603705e-05, "loss": 0.594, "mean_token_accuracy": 0.8124582879245281, "num_tokens": 749056323.0, "step": 23471 }, { "entropy": 0.4987118956632912, "epoch": 2.1595390480790795, "grad_norm": 0.15488897264003754, "learning_rate": 2.801852362989542e-05, "loss": 0.4841, "mean_token_accuracy": 0.8474741876125336, "num_tokens": 749088435.0, "step": 23472 }, { "entropy": 0.453484452329576, "epoch": 2.1596310544505206, "grad_norm": 0.15750132501125336, "learning_rate": 2.8015456803753798e-05, "loss": 0.4328, "mean_token_accuracy": 0.8586261905729771, "num_tokens": 749119965.0, "step": 23473 }, { "entropy": 0.5092305559664965, "epoch": 2.1597230608219617, "grad_norm": 0.15229874849319458, "learning_rate": 2.801238997761217e-05, "loss": 0.4918, "mean_token_accuracy": 0.8476951010525227, "num_tokens": 749152413.0, "step": 23474 }, { "entropy": 0.5601340373978019, "epoch": 2.1598150671934033, "grad_norm": 0.1686607003211975, "learning_rate": 2.8009323151470544e-05, "loss": 0.5381, "mean_token_accuracy": 0.831169605255127, "num_tokens": 749183443.0, "step": 23475 }, { "entropy": 0.4948364454321563, "epoch": 2.1599070735648445, "grad_norm": 0.15822890400886536, "learning_rate": 2.8006256325328915e-05, "loss": 0.4843, "mean_token_accuracy": 0.8477302342653275, "num_tokens": 749215591.0, "step": 23476 }, { "entropy": 0.5590088404715061, "epoch": 2.1599990799362856, "grad_norm": 0.1743963062763214, "learning_rate": 2.8003189499187293e-05, "loss": 0.5437, "mean_token_accuracy": 0.826639924198389, "num_tokens": 749246859.0, "step": 23477 }, { "entropy": 0.6311176456511021, "epoch": 2.1600910863077267, "grad_norm": 0.1759830117225647, "learning_rate": 2.8000122673045665e-05, "loss": 0.6326, "mean_token_accuracy": 0.8049275614321232, "num_tokens": 749278621.0, "step": 23478 }, { "entropy": 0.5634284242987633, "epoch": 2.160183092679168, "grad_norm": 0.16827218234539032, "learning_rate": 2.7997055846904043e-05, "loss": 0.5558, "mean_token_accuracy": 0.8241136483848095, "num_tokens": 749311078.0, "step": 23479 }, { "entropy": 0.5239962283521891, "epoch": 2.1602750990506094, "grad_norm": 0.16442693769931793, "learning_rate": 2.7993989020762414e-05, "loss": 0.5323, "mean_token_accuracy": 0.8318459205329418, "num_tokens": 749343647.0, "step": 23480 }, { "entropy": 0.5988471303135157, "epoch": 2.1603671054220506, "grad_norm": 0.17763552069664001, "learning_rate": 2.799092219462079e-05, "loss": 0.5829, "mean_token_accuracy": 0.8127665221691132, "num_tokens": 749375054.0, "step": 23481 }, { "entropy": 0.4285264974460006, "epoch": 2.1604591117934917, "grad_norm": 0.1478218138217926, "learning_rate": 2.798785536847916e-05, "loss": 0.4149, "mean_token_accuracy": 0.8682870417833328, "num_tokens": 749407289.0, "step": 23482 }, { "entropy": 0.5081928675062954, "epoch": 2.160551118164933, "grad_norm": 0.1588996797800064, "learning_rate": 2.7984788542337538e-05, "loss": 0.4849, "mean_token_accuracy": 0.8456437289714813, "num_tokens": 749438353.0, "step": 23483 }, { "entropy": 0.6321477498859167, "epoch": 2.160643124536374, "grad_norm": 0.17161470651626587, "learning_rate": 2.798172171619591e-05, "loss": 0.622, "mean_token_accuracy": 0.807765282690525, "num_tokens": 749469788.0, "step": 23484 }, { "entropy": 0.5788521599024534, "epoch": 2.1607351309078155, "grad_norm": 0.16820040345191956, "learning_rate": 2.7978654890054284e-05, "loss": 0.5688, "mean_token_accuracy": 0.8194657862186432, "num_tokens": 749502149.0, "step": 23485 }, { "entropy": 0.5486601823940873, "epoch": 2.1608271372792567, "grad_norm": 0.16890418529510498, "learning_rate": 2.7975588063912655e-05, "loss": 0.5332, "mean_token_accuracy": 0.8294647075235844, "num_tokens": 749534407.0, "step": 23486 }, { "entropy": 0.6296637393534184, "epoch": 2.160919143650698, "grad_norm": 0.17152133584022522, "learning_rate": 2.7972521237771033e-05, "loss": 0.6193, "mean_token_accuracy": 0.806844811886549, "num_tokens": 749566662.0, "step": 23487 }, { "entropy": 0.48248606733977795, "epoch": 2.161011150022139, "grad_norm": 0.15426206588745117, "learning_rate": 2.7969454411629408e-05, "loss": 0.4623, "mean_token_accuracy": 0.8508814126253128, "num_tokens": 749598449.0, "step": 23488 }, { "entropy": 0.5648638447746634, "epoch": 2.16110315639358, "grad_norm": 0.16529496014118195, "learning_rate": 2.796638758548778e-05, "loss": 0.5443, "mean_token_accuracy": 0.8312814421951771, "num_tokens": 749630372.0, "step": 23489 }, { "entropy": 0.5508358087390661, "epoch": 2.1611951627650217, "grad_norm": 0.1699836403131485, "learning_rate": 2.7963320759346157e-05, "loss": 0.5247, "mean_token_accuracy": 0.8347487263381481, "num_tokens": 749662205.0, "step": 23490 }, { "entropy": 0.5700990380719304, "epoch": 2.161287169136463, "grad_norm": 0.16638843715190887, "learning_rate": 2.7960253933204528e-05, "loss": 0.5588, "mean_token_accuracy": 0.8277051784098148, "num_tokens": 749694973.0, "step": 23491 }, { "entropy": 0.4902037354186177, "epoch": 2.161379175507904, "grad_norm": 0.16094845533370972, "learning_rate": 2.7957187107062903e-05, "loss": 0.4779, "mean_token_accuracy": 0.8480814062058926, "num_tokens": 749727111.0, "step": 23492 }, { "entropy": 0.5341913036536425, "epoch": 2.161471181879345, "grad_norm": 0.1659790724515915, "learning_rate": 2.7954120280921274e-05, "loss": 0.534, "mean_token_accuracy": 0.8338386751711369, "num_tokens": 749759372.0, "step": 23493 }, { "entropy": 0.4721449613571167, "epoch": 2.161563188250786, "grad_norm": 0.1541302353143692, "learning_rate": 2.7951053454779652e-05, "loss": 0.4589, "mean_token_accuracy": 0.8515350110828876, "num_tokens": 749791589.0, "step": 23494 }, { "entropy": 0.5275736507028341, "epoch": 2.1616551946222278, "grad_norm": 0.16493746638298035, "learning_rate": 2.7947986628638023e-05, "loss": 0.5179, "mean_token_accuracy": 0.8370985947549343, "num_tokens": 749823964.0, "step": 23495 }, { "entropy": 0.6118538305163383, "epoch": 2.161747200993669, "grad_norm": 0.16800689697265625, "learning_rate": 2.79449198024964e-05, "loss": 0.6037, "mean_token_accuracy": 0.8117980994284153, "num_tokens": 749856060.0, "step": 23496 }, { "entropy": 0.5374245215207338, "epoch": 2.16183920736511, "grad_norm": 0.1672358363866806, "learning_rate": 2.794185297635477e-05, "loss": 0.5393, "mean_token_accuracy": 0.8291180022060871, "num_tokens": 749888198.0, "step": 23497 }, { "entropy": 0.47591205313801765, "epoch": 2.161931213736551, "grad_norm": 0.15862680971622467, "learning_rate": 2.7938786150213147e-05, "loss": 0.4683, "mean_token_accuracy": 0.8524094000458717, "num_tokens": 749920007.0, "step": 23498 }, { "entropy": 0.6243852255865932, "epoch": 2.1620232201079923, "grad_norm": 0.1703382432460785, "learning_rate": 2.793571932407152e-05, "loss": 0.6007, "mean_token_accuracy": 0.8133065924048424, "num_tokens": 749952142.0, "step": 23499 }, { "entropy": 0.561554005369544, "epoch": 2.162115226479434, "grad_norm": 0.16688407957553864, "learning_rate": 2.7932652497929897e-05, "loss": 0.5342, "mean_token_accuracy": 0.8334239087998867, "num_tokens": 749984341.0, "step": 23500 }, { "entropy": 0.5580440768972039, "epoch": 2.162207232850875, "grad_norm": 0.16689492762088776, "learning_rate": 2.7929585671788268e-05, "loss": 0.5384, "mean_token_accuracy": 0.8294375538825989, "num_tokens": 750016508.0, "step": 23501 }, { "entropy": 0.423405428417027, "epoch": 2.162299239222316, "grad_norm": 0.15076297521591187, "learning_rate": 2.7926518845646643e-05, "loss": 0.4007, "mean_token_accuracy": 0.8710846193134785, "num_tokens": 750047788.0, "step": 23502 }, { "entropy": 0.5779765686020255, "epoch": 2.1623912455937573, "grad_norm": 0.16741055250167847, "learning_rate": 2.7923452019505014e-05, "loss": 0.5643, "mean_token_accuracy": 0.8234153389930725, "num_tokens": 750079465.0, "step": 23503 }, { "entropy": 0.4748081723228097, "epoch": 2.1624832519651984, "grad_norm": 0.15834365785121918, "learning_rate": 2.7920385193363392e-05, "loss": 0.4612, "mean_token_accuracy": 0.8529379554092884, "num_tokens": 750111713.0, "step": 23504 }, { "entropy": 0.584604968316853, "epoch": 2.16257525833664, "grad_norm": 0.1672312319278717, "learning_rate": 2.7917318367221763e-05, "loss": 0.5696, "mean_token_accuracy": 0.8212711922824383, "num_tokens": 750143656.0, "step": 23505 }, { "entropy": 0.559148277156055, "epoch": 2.162667264708081, "grad_norm": 0.16436123847961426, "learning_rate": 2.7914251541080138e-05, "loss": 0.5405, "mean_token_accuracy": 0.8298052214086056, "num_tokens": 750175549.0, "step": 23506 }, { "entropy": 0.440451149828732, "epoch": 2.1627592710795223, "grad_norm": 0.15696783363819122, "learning_rate": 2.791118471493851e-05, "loss": 0.4351, "mean_token_accuracy": 0.8600175194442272, "num_tokens": 750208103.0, "step": 23507 }, { "entropy": 0.48516111820936203, "epoch": 2.1628512774509634, "grad_norm": 0.15906567871570587, "learning_rate": 2.7908117888796887e-05, "loss": 0.4829, "mean_token_accuracy": 0.8442528992891312, "num_tokens": 750240182.0, "step": 23508 }, { "entropy": 0.5304940305650234, "epoch": 2.1629432838224045, "grad_norm": 0.15438278019428253, "learning_rate": 2.790505106265526e-05, "loss": 0.5095, "mean_token_accuracy": 0.8388989605009556, "num_tokens": 750272585.0, "step": 23509 }, { "entropy": 0.49388130754232407, "epoch": 2.163035290193846, "grad_norm": 0.16398444771766663, "learning_rate": 2.7901984236513633e-05, "loss": 0.4783, "mean_token_accuracy": 0.8467427082359791, "num_tokens": 750304159.0, "step": 23510 }, { "entropy": 0.5233590230345726, "epoch": 2.1631272965652872, "grad_norm": 0.1660962998867035, "learning_rate": 2.7898917410372004e-05, "loss": 0.4986, "mean_token_accuracy": 0.8424194753170013, "num_tokens": 750336117.0, "step": 23511 }, { "entropy": 0.5340472301468253, "epoch": 2.1632193029367284, "grad_norm": 0.17043374478816986, "learning_rate": 2.7895850584230382e-05, "loss": 0.5259, "mean_token_accuracy": 0.8305258080363274, "num_tokens": 750367747.0, "step": 23512 }, { "entropy": 0.5091903749853373, "epoch": 2.1633113093081695, "grad_norm": 0.1618773639202118, "learning_rate": 2.7892783758088754e-05, "loss": 0.4954, "mean_token_accuracy": 0.8426018208265305, "num_tokens": 750399673.0, "step": 23513 }, { "entropy": 0.4905216272454709, "epoch": 2.1634033156796106, "grad_norm": 0.16431476175785065, "learning_rate": 2.7889716931947128e-05, "loss": 0.485, "mean_token_accuracy": 0.8467851877212524, "num_tokens": 750430933.0, "step": 23514 }, { "entropy": 0.4730955818668008, "epoch": 2.163495322051052, "grad_norm": 0.15175168216228485, "learning_rate": 2.78866501058055e-05, "loss": 0.4612, "mean_token_accuracy": 0.8544984199106693, "num_tokens": 750462967.0, "step": 23515 }, { "entropy": 0.5519738225266337, "epoch": 2.1635873284224933, "grad_norm": 0.16438691318035126, "learning_rate": 2.7883583279663877e-05, "loss": 0.5413, "mean_token_accuracy": 0.8280327133834362, "num_tokens": 750493983.0, "step": 23516 }, { "entropy": 0.4943935563787818, "epoch": 2.1636793347939345, "grad_norm": 0.1578139066696167, "learning_rate": 2.788051645352225e-05, "loss": 0.4788, "mean_token_accuracy": 0.8513849750161171, "num_tokens": 750525891.0, "step": 23517 }, { "entropy": 0.6033784467726946, "epoch": 2.1637713411653756, "grad_norm": 0.17022839188575745, "learning_rate": 2.7877449627380627e-05, "loss": 0.5975, "mean_token_accuracy": 0.8097989186644554, "num_tokens": 750558047.0, "step": 23518 }, { "entropy": 0.4552340689115226, "epoch": 2.1638633475368168, "grad_norm": 0.15416878461837769, "learning_rate": 2.7874382801239e-05, "loss": 0.4415, "mean_token_accuracy": 0.8608532883226871, "num_tokens": 750589825.0, "step": 23519 }, { "entropy": 0.5972816254943609, "epoch": 2.1639553539082583, "grad_norm": 0.16898441314697266, "learning_rate": 2.7871315975097373e-05, "loss": 0.586, "mean_token_accuracy": 0.8127461522817612, "num_tokens": 750621378.0, "step": 23520 }, { "entropy": 0.504891854012385, "epoch": 2.1640473602796995, "grad_norm": 0.15479113161563873, "learning_rate": 2.786824914895575e-05, "loss": 0.487, "mean_token_accuracy": 0.8456603176891804, "num_tokens": 750653593.0, "step": 23521 }, { "entropy": 0.5934189278632402, "epoch": 2.1641393666511406, "grad_norm": 0.1735551804304123, "learning_rate": 2.7865182322814122e-05, "loss": 0.5716, "mean_token_accuracy": 0.8214004747569561, "num_tokens": 750684468.0, "step": 23522 }, { "entropy": 0.46584841050207615, "epoch": 2.1642313730225817, "grad_norm": 0.15624888241291046, "learning_rate": 2.7862115496672497e-05, "loss": 0.4351, "mean_token_accuracy": 0.859720092266798, "num_tokens": 750714990.0, "step": 23523 }, { "entropy": 0.5198540382552892, "epoch": 2.164323379394023, "grad_norm": 0.16089153289794922, "learning_rate": 2.7859048670530868e-05, "loss": 0.5034, "mean_token_accuracy": 0.8404314927756786, "num_tokens": 750747364.0, "step": 23524 }, { "entropy": 0.5635293060913682, "epoch": 2.1644153857654644, "grad_norm": 0.16398704051971436, "learning_rate": 2.7855981844389246e-05, "loss": 0.5446, "mean_token_accuracy": 0.8294240832328796, "num_tokens": 750779474.0, "step": 23525 }, { "entropy": 0.6432756325230002, "epoch": 2.1645073921369056, "grad_norm": 0.1761314868927002, "learning_rate": 2.7852915018247617e-05, "loss": 0.6292, "mean_token_accuracy": 0.8012751489877701, "num_tokens": 750811218.0, "step": 23526 }, { "entropy": 0.5351234171539545, "epoch": 2.1645993985083467, "grad_norm": 0.16501948237419128, "learning_rate": 2.7849848192105992e-05, "loss": 0.5267, "mean_token_accuracy": 0.8327172212302685, "num_tokens": 750842840.0, "step": 23527 }, { "entropy": 0.5127795487642288, "epoch": 2.164691404879788, "grad_norm": 0.1625514179468155, "learning_rate": 2.7846781365964363e-05, "loss": 0.4927, "mean_token_accuracy": 0.8396698571741581, "num_tokens": 750875132.0, "step": 23528 }, { "entropy": 0.47016346361488104, "epoch": 2.164783411251229, "grad_norm": 0.1551342010498047, "learning_rate": 2.784371453982274e-05, "loss": 0.4499, "mean_token_accuracy": 0.8568755015730858, "num_tokens": 750907752.0, "step": 23529 }, { "entropy": 0.4951634076423943, "epoch": 2.1648754176226706, "grad_norm": 0.15525226294994354, "learning_rate": 2.7840647713681112e-05, "loss": 0.4876, "mean_token_accuracy": 0.8452307283878326, "num_tokens": 750940093.0, "step": 23530 }, { "entropy": 0.46702174935489893, "epoch": 2.1649674239941117, "grad_norm": 0.15247321128845215, "learning_rate": 2.7837580887539487e-05, "loss": 0.4498, "mean_token_accuracy": 0.8588279262185097, "num_tokens": 750972538.0, "step": 23531 }, { "entropy": 0.4906459618359804, "epoch": 2.165059430365553, "grad_norm": 0.16153042018413544, "learning_rate": 2.7834514061397858e-05, "loss": 0.4773, "mean_token_accuracy": 0.8458117842674255, "num_tokens": 751004678.0, "step": 23532 }, { "entropy": 0.5695738568902016, "epoch": 2.165151436736994, "grad_norm": 0.16855330765247345, "learning_rate": 2.7831447235256236e-05, "loss": 0.5584, "mean_token_accuracy": 0.8246600739657879, "num_tokens": 751037110.0, "step": 23533 }, { "entropy": 0.541579857468605, "epoch": 2.165243443108435, "grad_norm": 0.16661040484905243, "learning_rate": 2.7828380409114608e-05, "loss": 0.5272, "mean_token_accuracy": 0.8339703492820263, "num_tokens": 751068432.0, "step": 23534 }, { "entropy": 0.43913757940754294, "epoch": 2.1653354494798767, "grad_norm": 0.1519843339920044, "learning_rate": 2.7825313582972982e-05, "loss": 0.4272, "mean_token_accuracy": 0.8622751012444496, "num_tokens": 751100472.0, "step": 23535 }, { "entropy": 0.4596766531467438, "epoch": 2.165427455851318, "grad_norm": 0.15301427245140076, "learning_rate": 2.7822246756831353e-05, "loss": 0.4466, "mean_token_accuracy": 0.8556118719279766, "num_tokens": 751133240.0, "step": 23536 }, { "entropy": 0.4733863342553377, "epoch": 2.165519462222759, "grad_norm": 0.15736396610736847, "learning_rate": 2.781917993068973e-05, "loss": 0.4541, "mean_token_accuracy": 0.8556984439492226, "num_tokens": 751165449.0, "step": 23537 }, { "entropy": 0.4458550000563264, "epoch": 2.1656114685942, "grad_norm": 0.14816726744174957, "learning_rate": 2.7816113104548103e-05, "loss": 0.4358, "mean_token_accuracy": 0.8589471243321896, "num_tokens": 751197365.0, "step": 23538 }, { "entropy": 0.4821312176063657, "epoch": 2.165703474965641, "grad_norm": 0.16116653382778168, "learning_rate": 2.781304627840648e-05, "loss": 0.4707, "mean_token_accuracy": 0.8546739891171455, "num_tokens": 751229033.0, "step": 23539 }, { "entropy": 0.5917608318850398, "epoch": 2.1657954813370828, "grad_norm": 0.17378973960876465, "learning_rate": 2.7809979452264852e-05, "loss": 0.5858, "mean_token_accuracy": 0.8179279081523418, "num_tokens": 751261360.0, "step": 23540 }, { "entropy": 0.5958796460181475, "epoch": 2.165887487708524, "grad_norm": 0.17511942982673645, "learning_rate": 2.7806912626123227e-05, "loss": 0.5888, "mean_token_accuracy": 0.8167043998837471, "num_tokens": 751293438.0, "step": 23541 }, { "entropy": 0.6127273426391184, "epoch": 2.165979494079965, "grad_norm": 0.1719607263803482, "learning_rate": 2.7803845799981598e-05, "loss": 0.6114, "mean_token_accuracy": 0.8111972734332085, "num_tokens": 751325499.0, "step": 23542 }, { "entropy": 0.46341103687882423, "epoch": 2.166071500451406, "grad_norm": 0.15062321722507477, "learning_rate": 2.7800778973839976e-05, "loss": 0.4501, "mean_token_accuracy": 0.8555679433047771, "num_tokens": 751357798.0, "step": 23543 }, { "entropy": 0.48495849408209324, "epoch": 2.1661635068228473, "grad_norm": 0.15872354805469513, "learning_rate": 2.7797712147698347e-05, "loss": 0.4677, "mean_token_accuracy": 0.8509110920131207, "num_tokens": 751390120.0, "step": 23544 }, { "entropy": 0.5077257994562387, "epoch": 2.166255513194289, "grad_norm": 0.16080856323242188, "learning_rate": 2.7794645321556722e-05, "loss": 0.4979, "mean_token_accuracy": 0.8398085832595825, "num_tokens": 751422411.0, "step": 23545 }, { "entropy": 0.49285715026780963, "epoch": 2.16634751956573, "grad_norm": 0.1565607786178589, "learning_rate": 2.7791578495415093e-05, "loss": 0.4688, "mean_token_accuracy": 0.8468815833330154, "num_tokens": 751454005.0, "step": 23546 }, { "entropy": 0.6039428389631212, "epoch": 2.166439525937171, "grad_norm": 0.16942164301872253, "learning_rate": 2.778851166927347e-05, "loss": 0.5887, "mean_token_accuracy": 0.8147055953741074, "num_tokens": 751485856.0, "step": 23547 }, { "entropy": 0.5052094762213528, "epoch": 2.1665315323086123, "grad_norm": 0.1626354306936264, "learning_rate": 2.7785444843131842e-05, "loss": 0.4928, "mean_token_accuracy": 0.8431329764425755, "num_tokens": 751517680.0, "step": 23548 }, { "entropy": 0.5134120220318437, "epoch": 2.1666235386800534, "grad_norm": 0.15904459357261658, "learning_rate": 2.7782378016990217e-05, "loss": 0.5034, "mean_token_accuracy": 0.8440141789615154, "num_tokens": 751550411.0, "step": 23549 }, { "entropy": 0.4526109730359167, "epoch": 2.166715545051495, "grad_norm": 0.15456737577915192, "learning_rate": 2.7779311190848595e-05, "loss": 0.4424, "mean_token_accuracy": 0.8598557412624359, "num_tokens": 751582704.0, "step": 23550 }, { "entropy": 0.475658874027431, "epoch": 2.166807551422936, "grad_norm": 0.1558513343334198, "learning_rate": 2.7776244364706966e-05, "loss": 0.4631, "mean_token_accuracy": 0.8540302254259586, "num_tokens": 751614448.0, "step": 23551 }, { "entropy": 0.5935638975352049, "epoch": 2.1668995577943773, "grad_norm": 0.16702395677566528, "learning_rate": 2.777317753856534e-05, "loss": 0.5914, "mean_token_accuracy": 0.8199920803308487, "num_tokens": 751646030.0, "step": 23552 }, { "entropy": 0.5083884038031101, "epoch": 2.1669915641658184, "grad_norm": 0.1581403613090515, "learning_rate": 2.7770110712423712e-05, "loss": 0.4972, "mean_token_accuracy": 0.8434110060334206, "num_tokens": 751678745.0, "step": 23553 }, { "entropy": 0.4632435920648277, "epoch": 2.1670835705372595, "grad_norm": 0.15580323338508606, "learning_rate": 2.776704388628209e-05, "loss": 0.4607, "mean_token_accuracy": 0.8545924536883831, "num_tokens": 751710645.0, "step": 23554 }, { "entropy": 0.5339697455056012, "epoch": 2.167175576908701, "grad_norm": 0.16268415749073029, "learning_rate": 2.776397706014046e-05, "loss": 0.5205, "mean_token_accuracy": 0.8344279415905476, "num_tokens": 751742392.0, "step": 23555 }, { "entropy": 0.5241322163492441, "epoch": 2.1672675832801422, "grad_norm": 0.16368548572063446, "learning_rate": 2.776091023399884e-05, "loss": 0.5098, "mean_token_accuracy": 0.8363889493048191, "num_tokens": 751774436.0, "step": 23556 }, { "entropy": 0.49880196806043386, "epoch": 2.1673595896515834, "grad_norm": 0.1562802791595459, "learning_rate": 2.7757843407857208e-05, "loss": 0.4809, "mean_token_accuracy": 0.845437865704298, "num_tokens": 751806592.0, "step": 23557 }, { "entropy": 0.4888417860493064, "epoch": 2.1674515960230245, "grad_norm": 0.15481430292129517, "learning_rate": 2.7754776581715586e-05, "loss": 0.4734, "mean_token_accuracy": 0.8500776626169682, "num_tokens": 751838514.0, "step": 23558 }, { "entropy": 0.5036808652803302, "epoch": 2.1675436023944656, "grad_norm": 0.1571437567472458, "learning_rate": 2.7751709755573957e-05, "loss": 0.4956, "mean_token_accuracy": 0.844167910516262, "num_tokens": 751870637.0, "step": 23559 }, { "entropy": 0.5496395418886095, "epoch": 2.167635608765907, "grad_norm": 0.1584513932466507, "learning_rate": 2.7748642929432335e-05, "loss": 0.5314, "mean_token_accuracy": 0.8335269689559937, "num_tokens": 751902835.0, "step": 23560 }, { "entropy": 0.5061427187174559, "epoch": 2.1677276151373484, "grad_norm": 0.15576350688934326, "learning_rate": 2.7745576103290706e-05, "loss": 0.4885, "mean_token_accuracy": 0.8458912633359432, "num_tokens": 751934576.0, "step": 23561 }, { "entropy": 0.5775036420673132, "epoch": 2.1678196215087895, "grad_norm": 0.16536788642406464, "learning_rate": 2.774250927714908e-05, "loss": 0.5562, "mean_token_accuracy": 0.8252453505992889, "num_tokens": 751966212.0, "step": 23562 }, { "entropy": 0.5228283302858472, "epoch": 2.1679116278802306, "grad_norm": 0.16041462123394012, "learning_rate": 2.7739442451007452e-05, "loss": 0.5035, "mean_token_accuracy": 0.8404016084969044, "num_tokens": 751997999.0, "step": 23563 }, { "entropy": 0.5577994002960622, "epoch": 2.1680036342516718, "grad_norm": 0.1628945916891098, "learning_rate": 2.773637562486583e-05, "loss": 0.541, "mean_token_accuracy": 0.8307371288537979, "num_tokens": 752029601.0, "step": 23564 }, { "entropy": 0.481044327840209, "epoch": 2.1680956406231133, "grad_norm": 0.15563496947288513, "learning_rate": 2.77333087987242e-05, "loss": 0.4686, "mean_token_accuracy": 0.8507943190634251, "num_tokens": 752060729.0, "step": 23565 }, { "entropy": 0.5850902972742915, "epoch": 2.1681876469945545, "grad_norm": 0.16668768227100372, "learning_rate": 2.7730241972582576e-05, "loss": 0.5748, "mean_token_accuracy": 0.8202607408165932, "num_tokens": 752093307.0, "step": 23566 }, { "entropy": 0.5076544571202248, "epoch": 2.1682796533659956, "grad_norm": 0.15964992344379425, "learning_rate": 2.7727175146440947e-05, "loss": 0.4843, "mean_token_accuracy": 0.8463269434869289, "num_tokens": 752125263.0, "step": 23567 }, { "entropy": 0.48034973815083504, "epoch": 2.1683716597374367, "grad_norm": 0.15666797757148743, "learning_rate": 2.7724108320299325e-05, "loss": 0.462, "mean_token_accuracy": 0.8525336794555187, "num_tokens": 752157329.0, "step": 23568 }, { "entropy": 0.550719091668725, "epoch": 2.168463666108878, "grad_norm": 0.16247797012329102, "learning_rate": 2.7721041494157697e-05, "loss": 0.5448, "mean_token_accuracy": 0.8293732292950153, "num_tokens": 752189271.0, "step": 23569 }, { "entropy": 0.5658561848104, "epoch": 2.1685556724803194, "grad_norm": 0.1633853316307068, "learning_rate": 2.771797466801607e-05, "loss": 0.5526, "mean_token_accuracy": 0.8244852349162102, "num_tokens": 752221507.0, "step": 23570 }, { "entropy": 0.5374307427555323, "epoch": 2.1686476788517606, "grad_norm": 0.16471897065639496, "learning_rate": 2.7714907841874442e-05, "loss": 0.5222, "mean_token_accuracy": 0.837516974657774, "num_tokens": 752252488.0, "step": 23571 }, { "entropy": 0.4606685386970639, "epoch": 2.1687396852232017, "grad_norm": 0.15174779295921326, "learning_rate": 2.771184101573282e-05, "loss": 0.4408, "mean_token_accuracy": 0.8556373901665211, "num_tokens": 752283050.0, "step": 23572 }, { "entropy": 0.5427520824596286, "epoch": 2.168831691594643, "grad_norm": 0.16258922219276428, "learning_rate": 2.7708774189591192e-05, "loss": 0.5334, "mean_token_accuracy": 0.8328836634755135, "num_tokens": 752314300.0, "step": 23573 }, { "entropy": 0.5243508508428931, "epoch": 2.168923697966084, "grad_norm": 0.16759620606899261, "learning_rate": 2.7705707363449566e-05, "loss": 0.5159, "mean_token_accuracy": 0.8384123258292675, "num_tokens": 752345544.0, "step": 23574 }, { "entropy": 0.5222736336290836, "epoch": 2.1690157043375256, "grad_norm": 0.16128437221050262, "learning_rate": 2.7702640537307938e-05, "loss": 0.5157, "mean_token_accuracy": 0.8388083539903164, "num_tokens": 752377376.0, "step": 23575 }, { "entropy": 0.6256542708724737, "epoch": 2.1691077107089667, "grad_norm": 0.17684078216552734, "learning_rate": 2.7699573711166316e-05, "loss": 0.6065, "mean_token_accuracy": 0.8092172406613827, "num_tokens": 752408564.0, "step": 23576 }, { "entropy": 0.5687079578638077, "epoch": 2.169199717080408, "grad_norm": 0.16914983093738556, "learning_rate": 2.7696506885024687e-05, "loss": 0.5395, "mean_token_accuracy": 0.82804299518466, "num_tokens": 752440458.0, "step": 23577 }, { "entropy": 0.5340505857020617, "epoch": 2.169291723451849, "grad_norm": 0.1701941192150116, "learning_rate": 2.7693440058883065e-05, "loss": 0.53, "mean_token_accuracy": 0.8319999910891056, "num_tokens": 752471966.0, "step": 23578 }, { "entropy": 0.43196226470172405, "epoch": 2.16938372982329, "grad_norm": 0.14686809480190277, "learning_rate": 2.7690373232741433e-05, "loss": 0.4185, "mean_token_accuracy": 0.8663381971418858, "num_tokens": 752504440.0, "step": 23579 }, { "entropy": 0.4808097742497921, "epoch": 2.1694757361947317, "grad_norm": 0.1560438573360443, "learning_rate": 2.768730640659981e-05, "loss": 0.4652, "mean_token_accuracy": 0.8530092984437943, "num_tokens": 752536973.0, "step": 23580 }, { "entropy": 0.504456015303731, "epoch": 2.169567742566173, "grad_norm": 0.16020697355270386, "learning_rate": 2.768423958045819e-05, "loss": 0.4996, "mean_token_accuracy": 0.8414736948907375, "num_tokens": 752568644.0, "step": 23581 }, { "entropy": 0.38194220303557813, "epoch": 2.169659748937614, "grad_norm": 0.15416130423545837, "learning_rate": 2.768117275431656e-05, "loss": 0.3823, "mean_token_accuracy": 0.8793069086968899, "num_tokens": 752600804.0, "step": 23582 }, { "entropy": 0.4809514218941331, "epoch": 2.169751755309055, "grad_norm": 0.16486616432666779, "learning_rate": 2.7678105928174935e-05, "loss": 0.4815, "mean_token_accuracy": 0.8490571714937687, "num_tokens": 752632988.0, "step": 23583 }, { "entropy": 0.5414765095338225, "epoch": 2.169843761680496, "grad_norm": 0.16350267827510834, "learning_rate": 2.7675039102033306e-05, "loss": 0.5276, "mean_token_accuracy": 0.8352518752217293, "num_tokens": 752664539.0, "step": 23584 }, { "entropy": 0.4331586379557848, "epoch": 2.1699357680519378, "grad_norm": 0.14891517162322998, "learning_rate": 2.7671972275891684e-05, "loss": 0.4199, "mean_token_accuracy": 0.8721631988883018, "num_tokens": 752696109.0, "step": 23585 }, { "entropy": 0.625833653844893, "epoch": 2.170027774423379, "grad_norm": 0.17495587468147278, "learning_rate": 2.7668905449750055e-05, "loss": 0.6133, "mean_token_accuracy": 0.8084212616086006, "num_tokens": 752728640.0, "step": 23586 }, { "entropy": 0.5325528653338552, "epoch": 2.17011978079482, "grad_norm": 0.1667054444551468, "learning_rate": 2.766583862360843e-05, "loss": 0.5227, "mean_token_accuracy": 0.830203715711832, "num_tokens": 752760000.0, "step": 23587 }, { "entropy": 0.5207351502031088, "epoch": 2.170211787166261, "grad_norm": 0.16123539209365845, "learning_rate": 2.76627717974668e-05, "loss": 0.4965, "mean_token_accuracy": 0.8393412940204144, "num_tokens": 752791719.0, "step": 23588 }, { "entropy": 0.49465963896363974, "epoch": 2.1703037935377023, "grad_norm": 0.15821321308612823, "learning_rate": 2.765970497132518e-05, "loss": 0.4822, "mean_token_accuracy": 0.8457254357635975, "num_tokens": 752824214.0, "step": 23589 }, { "entropy": 0.5103702694177628, "epoch": 2.170395799909144, "grad_norm": 0.15717671811580658, "learning_rate": 2.765663814518355e-05, "loss": 0.4873, "mean_token_accuracy": 0.8430751450359821, "num_tokens": 752855958.0, "step": 23590 }, { "entropy": 0.5209427010267973, "epoch": 2.170487806280585, "grad_norm": 0.15957434475421906, "learning_rate": 2.7653571319041925e-05, "loss": 0.5014, "mean_token_accuracy": 0.8397612757980824, "num_tokens": 752888030.0, "step": 23591 }, { "entropy": 0.5583063922822475, "epoch": 2.170579812652026, "grad_norm": 0.16046522557735443, "learning_rate": 2.7650504492900296e-05, "loss": 0.5434, "mean_token_accuracy": 0.8283785097301006, "num_tokens": 752919920.0, "step": 23592 }, { "entropy": 0.5243595875799656, "epoch": 2.1706718190234673, "grad_norm": 0.1608017086982727, "learning_rate": 2.7647437666758675e-05, "loss": 0.5054, "mean_token_accuracy": 0.8410822749137878, "num_tokens": 752952027.0, "step": 23593 }, { "entropy": 0.4164941553026438, "epoch": 2.1707638253949084, "grad_norm": 0.14942507445812225, "learning_rate": 2.7644370840617046e-05, "loss": 0.3958, "mean_token_accuracy": 0.8742103092372417, "num_tokens": 752984152.0, "step": 23594 }, { "entropy": 0.5318759884685278, "epoch": 2.17085583176635, "grad_norm": 0.16282311081886292, "learning_rate": 2.764130401447542e-05, "loss": 0.5234, "mean_token_accuracy": 0.8382059894502163, "num_tokens": 753016228.0, "step": 23595 }, { "entropy": 0.4418167541734874, "epoch": 2.170947838137791, "grad_norm": 0.14507968723773956, "learning_rate": 2.763823718833379e-05, "loss": 0.427, "mean_token_accuracy": 0.8653417713940144, "num_tokens": 753048883.0, "step": 23596 }, { "entropy": 0.5758184501901269, "epoch": 2.1710398445092323, "grad_norm": 0.16948561370372772, "learning_rate": 2.763517036219217e-05, "loss": 0.5719, "mean_token_accuracy": 0.8248256146907806, "num_tokens": 753081040.0, "step": 23597 }, { "entropy": 0.54065325204283, "epoch": 2.1711318508806734, "grad_norm": 0.15990611910820007, "learning_rate": 2.763210353605054e-05, "loss": 0.5295, "mean_token_accuracy": 0.83566889539361, "num_tokens": 753113626.0, "step": 23598 }, { "entropy": 0.4212795502971858, "epoch": 2.1712238572521145, "grad_norm": 0.14903590083122253, "learning_rate": 2.762903670990892e-05, "loss": 0.4025, "mean_token_accuracy": 0.8732945807278156, "num_tokens": 753145799.0, "step": 23599 }, { "entropy": 0.5420069750398397, "epoch": 2.171315863623556, "grad_norm": 0.16711321473121643, "learning_rate": 2.762596988376729e-05, "loss": 0.5219, "mean_token_accuracy": 0.8371834643185139, "num_tokens": 753177337.0, "step": 23600 }, { "entropy": 0.5062887873500586, "epoch": 2.1714078699949972, "grad_norm": 0.15727591514587402, "learning_rate": 2.7622903057625665e-05, "loss": 0.4986, "mean_token_accuracy": 0.8399352915585041, "num_tokens": 753209833.0, "step": 23601 }, { "entropy": 0.5152505617588758, "epoch": 2.1714998763664384, "grad_norm": 0.16374830901622772, "learning_rate": 2.7619836231484036e-05, "loss": 0.5049, "mean_token_accuracy": 0.8415212370455265, "num_tokens": 753241338.0, "step": 23602 }, { "entropy": 0.5765002528205514, "epoch": 2.1715918827378795, "grad_norm": 0.16678258776664734, "learning_rate": 2.7616769405342414e-05, "loss": 0.5531, "mean_token_accuracy": 0.8204906806349754, "num_tokens": 753272568.0, "step": 23603 }, { "entropy": 0.6231195833534002, "epoch": 2.1716838891093206, "grad_norm": 0.17088571190834045, "learning_rate": 2.7613702579200785e-05, "loss": 0.6147, "mean_token_accuracy": 0.8051037043333054, "num_tokens": 753304859.0, "step": 23604 }, { "entropy": 0.5844001602381468, "epoch": 2.171775895480762, "grad_norm": 0.16120746731758118, "learning_rate": 2.761063575305916e-05, "loss": 0.5686, "mean_token_accuracy": 0.8219721876084805, "num_tokens": 753337573.0, "step": 23605 }, { "entropy": 0.46525558922439814, "epoch": 2.1718679018522034, "grad_norm": 0.15840494632720947, "learning_rate": 2.760756892691753e-05, "loss": 0.4577, "mean_token_accuracy": 0.8528558574616909, "num_tokens": 753369507.0, "step": 23606 }, { "entropy": 0.4502120604738593, "epoch": 2.1719599082236445, "grad_norm": 0.15458934009075165, "learning_rate": 2.760450210077591e-05, "loss": 0.4383, "mean_token_accuracy": 0.8612516112625599, "num_tokens": 753400947.0, "step": 23607 }, { "entropy": 0.5114734824746847, "epoch": 2.1720519145950856, "grad_norm": 0.1604742407798767, "learning_rate": 2.760143527463428e-05, "loss": 0.4914, "mean_token_accuracy": 0.8473717607557774, "num_tokens": 753433343.0, "step": 23608 }, { "entropy": 0.6462052799761295, "epoch": 2.1721439209665268, "grad_norm": 0.17214074730873108, "learning_rate": 2.7598368448492655e-05, "loss": 0.6305, "mean_token_accuracy": 0.8044315502047539, "num_tokens": 753465730.0, "step": 23609 }, { "entropy": 0.5325323008000851, "epoch": 2.1722359273379683, "grad_norm": 0.15632912516593933, "learning_rate": 2.7595301622351033e-05, "loss": 0.525, "mean_token_accuracy": 0.8335222825407982, "num_tokens": 753498192.0, "step": 23610 }, { "entropy": 0.5566730219870806, "epoch": 2.1723279337094095, "grad_norm": 0.1657901108264923, "learning_rate": 2.7592234796209405e-05, "loss": 0.5356, "mean_token_accuracy": 0.8324644081294537, "num_tokens": 753530778.0, "step": 23611 }, { "entropy": 0.556927272118628, "epoch": 2.1724199400808506, "grad_norm": 0.16577273607254028, "learning_rate": 2.758916797006778e-05, "loss": 0.5417, "mean_token_accuracy": 0.829172819852829, "num_tokens": 753562137.0, "step": 23612 }, { "entropy": 0.5212503843940794, "epoch": 2.1725119464522917, "grad_norm": 0.1642051488161087, "learning_rate": 2.758610114392615e-05, "loss": 0.5095, "mean_token_accuracy": 0.8383208140730858, "num_tokens": 753594548.0, "step": 23613 }, { "entropy": 0.45521235186606646, "epoch": 2.172603952823733, "grad_norm": 0.15438783168792725, "learning_rate": 2.758303431778453e-05, "loss": 0.4426, "mean_token_accuracy": 0.8616663925349712, "num_tokens": 753626283.0, "step": 23614 }, { "entropy": 0.5498768445104361, "epoch": 2.1726959591951744, "grad_norm": 0.17022716999053955, "learning_rate": 2.75799674916429e-05, "loss": 0.5448, "mean_token_accuracy": 0.8289072960615158, "num_tokens": 753657993.0, "step": 23615 }, { "entropy": 0.49401689670048654, "epoch": 2.1727879655666156, "grad_norm": 0.1500042974948883, "learning_rate": 2.7576900665501278e-05, "loss": 0.4772, "mean_token_accuracy": 0.8507376946508884, "num_tokens": 753689841.0, "step": 23616 }, { "entropy": 0.5466302819550037, "epoch": 2.1728799719380567, "grad_norm": 0.16951067745685577, "learning_rate": 2.7573833839359646e-05, "loss": 0.5379, "mean_token_accuracy": 0.8320077024400234, "num_tokens": 753721340.0, "step": 23617 }, { "entropy": 0.4181893840432167, "epoch": 2.172971978309498, "grad_norm": 0.15029001235961914, "learning_rate": 2.7570767013218024e-05, "loss": 0.3979, "mean_token_accuracy": 0.8740543127059937, "num_tokens": 753753705.0, "step": 23618 }, { "entropy": 0.5187822002917528, "epoch": 2.173063984680939, "grad_norm": 0.160674586892128, "learning_rate": 2.7567700187076395e-05, "loss": 0.5133, "mean_token_accuracy": 0.8373040519654751, "num_tokens": 753784960.0, "step": 23619 }, { "entropy": 0.5751377055421472, "epoch": 2.1731559910523806, "grad_norm": 0.16703279316425323, "learning_rate": 2.7564633360934773e-05, "loss": 0.558, "mean_token_accuracy": 0.8223982527852058, "num_tokens": 753816394.0, "step": 23620 }, { "entropy": 0.42198326298967004, "epoch": 2.1732479974238217, "grad_norm": 0.15357249975204468, "learning_rate": 2.7561566534793144e-05, "loss": 0.4074, "mean_token_accuracy": 0.871946357190609, "num_tokens": 753848233.0, "step": 23621 }, { "entropy": 0.5169387515634298, "epoch": 2.173340003795263, "grad_norm": 0.16178731620311737, "learning_rate": 2.755849970865152e-05, "loss": 0.5032, "mean_token_accuracy": 0.8397653102874756, "num_tokens": 753880055.0, "step": 23622 }, { "entropy": 0.5355425169691443, "epoch": 2.173432010166704, "grad_norm": 0.16514749825000763, "learning_rate": 2.755543288250989e-05, "loss": 0.5076, "mean_token_accuracy": 0.8410477675497532, "num_tokens": 753911091.0, "step": 23623 }, { "entropy": 0.4867049914319068, "epoch": 2.173524016538145, "grad_norm": 0.15591517090797424, "learning_rate": 2.7552366056368268e-05, "loss": 0.4611, "mean_token_accuracy": 0.854348462074995, "num_tokens": 753943590.0, "step": 23624 }, { "entropy": 0.5500449566170573, "epoch": 2.1736160229095867, "grad_norm": 0.16047589480876923, "learning_rate": 2.754929923022664e-05, "loss": 0.5397, "mean_token_accuracy": 0.8296527154743671, "num_tokens": 753976293.0, "step": 23625 }, { "entropy": 0.45046062930487096, "epoch": 2.173708029281028, "grad_norm": 0.15236864984035492, "learning_rate": 2.7546232404085014e-05, "loss": 0.4392, "mean_token_accuracy": 0.8593600392341614, "num_tokens": 754008600.0, "step": 23626 }, { "entropy": 0.6412110682576895, "epoch": 2.173800035652469, "grad_norm": 0.18393243849277496, "learning_rate": 2.7543165577943385e-05, "loss": 0.6338, "mean_token_accuracy": 0.8057717494666576, "num_tokens": 754040329.0, "step": 23627 }, { "entropy": 0.5625120829790831, "epoch": 2.17389204202391, "grad_norm": 0.16405938565731049, "learning_rate": 2.7540098751801763e-05, "loss": 0.5686, "mean_token_accuracy": 0.8217721879482269, "num_tokens": 754072767.0, "step": 23628 }, { "entropy": 0.41654953407123685, "epoch": 2.173984048395351, "grad_norm": 0.15349501371383667, "learning_rate": 2.7537031925660135e-05, "loss": 0.3973, "mean_token_accuracy": 0.8696178607642651, "num_tokens": 754103396.0, "step": 23629 }, { "entropy": 0.48160365456715226, "epoch": 2.1740760547667928, "grad_norm": 0.15434473752975464, "learning_rate": 2.753396509951851e-05, "loss": 0.4655, "mean_token_accuracy": 0.8531176671385765, "num_tokens": 754135631.0, "step": 23630 }, { "entropy": 0.4472106748726219, "epoch": 2.174168061138234, "grad_norm": 0.15512214601039886, "learning_rate": 2.753089827337688e-05, "loss": 0.4361, "mean_token_accuracy": 0.8567681573331356, "num_tokens": 754167137.0, "step": 23631 }, { "entropy": 0.6431810557842255, "epoch": 2.174260067509675, "grad_norm": 0.1754617989063263, "learning_rate": 2.752783144723526e-05, "loss": 0.6276, "mean_token_accuracy": 0.801115732640028, "num_tokens": 754198836.0, "step": 23632 }, { "entropy": 0.4766820715740323, "epoch": 2.174352073881116, "grad_norm": 0.1534925103187561, "learning_rate": 2.752476462109363e-05, "loss": 0.4724, "mean_token_accuracy": 0.8492802046239376, "num_tokens": 754231153.0, "step": 23633 }, { "entropy": 0.46630226622801274, "epoch": 2.1744440802525573, "grad_norm": 0.15151071548461914, "learning_rate": 2.7521697794952005e-05, "loss": 0.4512, "mean_token_accuracy": 0.8550120666623116, "num_tokens": 754263041.0, "step": 23634 }, { "entropy": 0.5031613353639841, "epoch": 2.174536086623999, "grad_norm": 0.16205881536006927, "learning_rate": 2.7518630968810376e-05, "loss": 0.4931, "mean_token_accuracy": 0.8445482887327671, "num_tokens": 754295579.0, "step": 23635 }, { "entropy": 0.5471494179219007, "epoch": 2.17462809299544, "grad_norm": 0.16627241671085358, "learning_rate": 2.7515564142668754e-05, "loss": 0.5372, "mean_token_accuracy": 0.8275696784257889, "num_tokens": 754327510.0, "step": 23636 }, { "entropy": 0.5384451001882553, "epoch": 2.174720099366881, "grad_norm": 0.16546031832695007, "learning_rate": 2.7512497316527125e-05, "loss": 0.5242, "mean_token_accuracy": 0.8333648703992367, "num_tokens": 754359377.0, "step": 23637 }, { "entropy": 0.5277138622477651, "epoch": 2.1748121057383223, "grad_norm": 0.16126878559589386, "learning_rate": 2.7509430490385503e-05, "loss": 0.505, "mean_token_accuracy": 0.8414492085576057, "num_tokens": 754391008.0, "step": 23638 }, { "entropy": 0.5147755462676287, "epoch": 2.1749041121097634, "grad_norm": 0.15583324432373047, "learning_rate": 2.750636366424387e-05, "loss": 0.4919, "mean_token_accuracy": 0.8412180580198765, "num_tokens": 754423164.0, "step": 23639 }, { "entropy": 0.42716762237250805, "epoch": 2.174996118481205, "grad_norm": 0.14755681157112122, "learning_rate": 2.750329683810225e-05, "loss": 0.4091, "mean_token_accuracy": 0.8695295788347721, "num_tokens": 754455901.0, "step": 23640 }, { "entropy": 0.6091063041239977, "epoch": 2.175088124852646, "grad_norm": 0.1702122837305069, "learning_rate": 2.7500230011960627e-05, "loss": 0.5907, "mean_token_accuracy": 0.8161290511488914, "num_tokens": 754487847.0, "step": 23641 }, { "entropy": 0.49998127296566963, "epoch": 2.1751801312240873, "grad_norm": 0.1587987244129181, "learning_rate": 2.7497163185819e-05, "loss": 0.4769, "mean_token_accuracy": 0.8510236293077469, "num_tokens": 754519798.0, "step": 23642 }, { "entropy": 0.5350671885535121, "epoch": 2.1752721375955284, "grad_norm": 0.16178199648857117, "learning_rate": 2.7494096359677373e-05, "loss": 0.5203, "mean_token_accuracy": 0.8338644504547119, "num_tokens": 754551787.0, "step": 23643 }, { "entropy": 0.5535961659625173, "epoch": 2.1753641439669695, "grad_norm": 0.16331814229488373, "learning_rate": 2.7491029533535744e-05, "loss": 0.5408, "mean_token_accuracy": 0.8308929055929184, "num_tokens": 754583806.0, "step": 23644 }, { "entropy": 0.4479782283306122, "epoch": 2.175456150338411, "grad_norm": 0.15667112171649933, "learning_rate": 2.7487962707394122e-05, "loss": 0.4351, "mean_token_accuracy": 0.8602857030928135, "num_tokens": 754615957.0, "step": 23645 }, { "entropy": 0.40979383792728186, "epoch": 2.1755481567098522, "grad_norm": 0.14413221180438995, "learning_rate": 2.7484895881252494e-05, "loss": 0.398, "mean_token_accuracy": 0.8704741559922695, "num_tokens": 754648170.0, "step": 23646 }, { "entropy": 0.4250123738311231, "epoch": 2.1756401630812934, "grad_norm": 0.14771312475204468, "learning_rate": 2.7481829055110868e-05, "loss": 0.4028, "mean_token_accuracy": 0.869095928966999, "num_tokens": 754679515.0, "step": 23647 }, { "entropy": 0.5708408104255795, "epoch": 2.1757321694527345, "grad_norm": 0.17099963128566742, "learning_rate": 2.747876222896924e-05, "loss": 0.5639, "mean_token_accuracy": 0.8234424032270908, "num_tokens": 754711256.0, "step": 23648 }, { "entropy": 0.5312166027724743, "epoch": 2.1758241758241756, "grad_norm": 0.1649894118309021, "learning_rate": 2.7475695402827618e-05, "loss": 0.5212, "mean_token_accuracy": 0.8355269134044647, "num_tokens": 754743500.0, "step": 23649 }, { "entropy": 0.492201242595911, "epoch": 2.175916182195617, "grad_norm": 0.1620604395866394, "learning_rate": 2.747262857668599e-05, "loss": 0.4966, "mean_token_accuracy": 0.8428818359971046, "num_tokens": 754775684.0, "step": 23650 }, { "entropy": 0.5420641265809536, "epoch": 2.1760081885670584, "grad_norm": 0.17783626914024353, "learning_rate": 2.7469561750544363e-05, "loss": 0.5363, "mean_token_accuracy": 0.8343970887362957, "num_tokens": 754806734.0, "step": 23651 }, { "entropy": 0.4502787608653307, "epoch": 2.1761001949384995, "grad_norm": 0.1506386548280716, "learning_rate": 2.7466494924402735e-05, "loss": 0.4377, "mean_token_accuracy": 0.8600744046270847, "num_tokens": 754839036.0, "step": 23652 }, { "entropy": 0.39660344552248716, "epoch": 2.1761922013099406, "grad_norm": 0.14800776541233063, "learning_rate": 2.7463428098261113e-05, "loss": 0.3891, "mean_token_accuracy": 0.8775628954172134, "num_tokens": 754870707.0, "step": 23653 }, { "entropy": 0.4999903244897723, "epoch": 2.1762842076813818, "grad_norm": 0.15992340445518494, "learning_rate": 2.7460361272119484e-05, "loss": 0.493, "mean_token_accuracy": 0.8423458561301231, "num_tokens": 754902108.0, "step": 23654 }, { "entropy": 0.4464752534404397, "epoch": 2.1763762140528233, "grad_norm": 0.15201565623283386, "learning_rate": 2.745729444597786e-05, "loss": 0.4417, "mean_token_accuracy": 0.8613238707184792, "num_tokens": 754933590.0, "step": 23655 }, { "entropy": 0.4675380880944431, "epoch": 2.1764682204242645, "grad_norm": 0.1610657423734665, "learning_rate": 2.745422761983623e-05, "loss": 0.4552, "mean_token_accuracy": 0.854716882109642, "num_tokens": 754964887.0, "step": 23656 }, { "entropy": 0.5554149858653545, "epoch": 2.1765602267957056, "grad_norm": 0.16063281893730164, "learning_rate": 2.7451160793694608e-05, "loss": 0.5318, "mean_token_accuracy": 0.8300149701535702, "num_tokens": 754996969.0, "step": 23657 }, { "entropy": 0.6018376462161541, "epoch": 2.1766522331671467, "grad_norm": 0.17081329226493835, "learning_rate": 2.744809396755298e-05, "loss": 0.5867, "mean_token_accuracy": 0.8161436431109905, "num_tokens": 755029033.0, "step": 23658 }, { "entropy": 0.5190281253308058, "epoch": 2.176744239538588, "grad_norm": 0.15892699360847473, "learning_rate": 2.7445027141411357e-05, "loss": 0.4985, "mean_token_accuracy": 0.8373443819582462, "num_tokens": 755060572.0, "step": 23659 }, { "entropy": 0.5660033859312534, "epoch": 2.1768362459100294, "grad_norm": 0.1609937697649002, "learning_rate": 2.744196031526973e-05, "loss": 0.5482, "mean_token_accuracy": 0.8275868482887745, "num_tokens": 755092511.0, "step": 23660 }, { "entropy": 0.46296249493025243, "epoch": 2.1769282522814706, "grad_norm": 0.1536673903465271, "learning_rate": 2.7438893489128103e-05, "loss": 0.4429, "mean_token_accuracy": 0.8565155789256096, "num_tokens": 755124450.0, "step": 23661 }, { "entropy": 0.4681877428665757, "epoch": 2.1770202586529117, "grad_norm": 0.15806370973587036, "learning_rate": 2.7435826662986474e-05, "loss": 0.4554, "mean_token_accuracy": 0.858518872410059, "num_tokens": 755156687.0, "step": 23662 }, { "entropy": 0.5482941279187799, "epoch": 2.177112265024353, "grad_norm": 0.15905188024044037, "learning_rate": 2.7432759836844852e-05, "loss": 0.5387, "mean_token_accuracy": 0.8295686431229115, "num_tokens": 755189318.0, "step": 23663 }, { "entropy": 0.5985401123762131, "epoch": 2.177204271395794, "grad_norm": 0.1756173074245453, "learning_rate": 2.7429693010703224e-05, "loss": 0.5859, "mean_token_accuracy": 0.8162735588848591, "num_tokens": 755220123.0, "step": 23664 }, { "entropy": 0.5263242721557617, "epoch": 2.1772962777672356, "grad_norm": 0.1681988537311554, "learning_rate": 2.74266261845616e-05, "loss": 0.5218, "mean_token_accuracy": 0.8347374685108662, "num_tokens": 755251736.0, "step": 23665 }, { "entropy": 0.5287044737488031, "epoch": 2.1773882841386767, "grad_norm": 0.1683071106672287, "learning_rate": 2.742355935841997e-05, "loss": 0.5307, "mean_token_accuracy": 0.831595990806818, "num_tokens": 755283062.0, "step": 23666 }, { "entropy": 0.43058846495114267, "epoch": 2.177480290510118, "grad_norm": 0.153971329331398, "learning_rate": 2.7420492532278348e-05, "loss": 0.4259, "mean_token_accuracy": 0.8625807575881481, "num_tokens": 755314946.0, "step": 23667 }, { "entropy": 0.5244598165154457, "epoch": 2.177572296881559, "grad_norm": 0.16086459159851074, "learning_rate": 2.741742570613672e-05, "loss": 0.5137, "mean_token_accuracy": 0.8353030122816563, "num_tokens": 755347498.0, "step": 23668 }, { "entropy": 0.5394695568829775, "epoch": 2.177664303253, "grad_norm": 0.15550191700458527, "learning_rate": 2.7414358879995094e-05, "loss": 0.4938, "mean_token_accuracy": 0.8394173234701157, "num_tokens": 755379299.0, "step": 23669 }, { "entropy": 0.5387113862670958, "epoch": 2.1777563096244417, "grad_norm": 0.16594301164150238, "learning_rate": 2.7411292053853465e-05, "loss": 0.5409, "mean_token_accuracy": 0.8275759406387806, "num_tokens": 755411749.0, "step": 23670 }, { "entropy": 0.5279688057489693, "epoch": 2.177848315995883, "grad_norm": 0.16463351249694824, "learning_rate": 2.7408225227711843e-05, "loss": 0.5096, "mean_token_accuracy": 0.8369005806744099, "num_tokens": 755443183.0, "step": 23671 }, { "entropy": 0.5555501184426248, "epoch": 2.177940322367324, "grad_norm": 0.16248950362205505, "learning_rate": 2.7405158401570217e-05, "loss": 0.5478, "mean_token_accuracy": 0.8281326293945312, "num_tokens": 755475951.0, "step": 23672 }, { "entropy": 0.5524555463343859, "epoch": 2.178032328738765, "grad_norm": 0.16789914667606354, "learning_rate": 2.740209157542859e-05, "loss": 0.5265, "mean_token_accuracy": 0.8321347944438457, "num_tokens": 755507373.0, "step": 23673 }, { "entropy": 0.4904445484280586, "epoch": 2.178124335110206, "grad_norm": 0.1594189554452896, "learning_rate": 2.7399024749286967e-05, "loss": 0.4661, "mean_token_accuracy": 0.8505451157689095, "num_tokens": 755539375.0, "step": 23674 }, { "entropy": 0.5395829044282436, "epoch": 2.1782163414816478, "grad_norm": 0.1646948903799057, "learning_rate": 2.7395957923145338e-05, "loss": 0.5317, "mean_token_accuracy": 0.8333349302411079, "num_tokens": 755571809.0, "step": 23675 }, { "entropy": 0.3999572671018541, "epoch": 2.178308347853089, "grad_norm": 0.1482541412115097, "learning_rate": 2.7392891097003716e-05, "loss": 0.3897, "mean_token_accuracy": 0.8761523254215717, "num_tokens": 755604339.0, "step": 23676 }, { "entropy": 0.541537316981703, "epoch": 2.17840035422453, "grad_norm": 0.162479966878891, "learning_rate": 2.7389824270862084e-05, "loss": 0.5322, "mean_token_accuracy": 0.8295347429811954, "num_tokens": 755635335.0, "step": 23677 }, { "entropy": 0.5000668356660753, "epoch": 2.178492360595971, "grad_norm": 0.15999482572078705, "learning_rate": 2.7386757444720462e-05, "loss": 0.4908, "mean_token_accuracy": 0.8417363539338112, "num_tokens": 755666615.0, "step": 23678 }, { "entropy": 0.5144117884337902, "epoch": 2.1785843669674123, "grad_norm": 0.16529685258865356, "learning_rate": 2.7383690618578833e-05, "loss": 0.4993, "mean_token_accuracy": 0.8397382944822311, "num_tokens": 755698532.0, "step": 23679 }, { "entropy": 0.5023857653141022, "epoch": 2.178676373338854, "grad_norm": 0.1580500304698944, "learning_rate": 2.738062379243721e-05, "loss": 0.4794, "mean_token_accuracy": 0.8445457816123962, "num_tokens": 755730601.0, "step": 23680 }, { "entropy": 0.4384928997606039, "epoch": 2.178768379710295, "grad_norm": 0.1494482159614563, "learning_rate": 2.7377556966295583e-05, "loss": 0.4215, "mean_token_accuracy": 0.8640131056308746, "num_tokens": 755763073.0, "step": 23681 }, { "entropy": 0.5319747272878885, "epoch": 2.178860386081736, "grad_norm": 0.1652834564447403, "learning_rate": 2.7374490140153957e-05, "loss": 0.5051, "mean_token_accuracy": 0.8417803719639778, "num_tokens": 755795322.0, "step": 23682 }, { "entropy": 0.5728955660015345, "epoch": 2.1789523924531773, "grad_norm": 0.16661016643047333, "learning_rate": 2.737142331401233e-05, "loss": 0.5536, "mean_token_accuracy": 0.8268703892827034, "num_tokens": 755826730.0, "step": 23683 }, { "entropy": 0.6129090080503374, "epoch": 2.1790443988246184, "grad_norm": 0.17296428978443146, "learning_rate": 2.7368356487870706e-05, "loss": 0.593, "mean_token_accuracy": 0.8122782409191132, "num_tokens": 755858752.0, "step": 23684 }, { "entropy": 0.5951065733097494, "epoch": 2.17913640519606, "grad_norm": 0.17193515598773956, "learning_rate": 2.7365289661729078e-05, "loss": 0.5713, "mean_token_accuracy": 0.8203265033662319, "num_tokens": 755890527.0, "step": 23685 }, { "entropy": 0.5120431836694479, "epoch": 2.179228411567501, "grad_norm": 0.15959133207798004, "learning_rate": 2.7362222835587452e-05, "loss": 0.5017, "mean_token_accuracy": 0.8372985124588013, "num_tokens": 755922704.0, "step": 23686 }, { "entropy": 0.6011253856122494, "epoch": 2.1793204179389423, "grad_norm": 0.17335490882396698, "learning_rate": 2.7359156009445824e-05, "loss": 0.5851, "mean_token_accuracy": 0.8156358599662781, "num_tokens": 755953794.0, "step": 23687 }, { "entropy": 0.41471561044454575, "epoch": 2.1794124243103834, "grad_norm": 0.14206677675247192, "learning_rate": 2.73560891833042e-05, "loss": 0.4051, "mean_token_accuracy": 0.871703814715147, "num_tokens": 755985794.0, "step": 23688 }, { "entropy": 0.5063211154192686, "epoch": 2.1795044306818245, "grad_norm": 0.15711276233196259, "learning_rate": 2.7353022357162573e-05, "loss": 0.4834, "mean_token_accuracy": 0.8476003371179104, "num_tokens": 756018111.0, "step": 23689 }, { "entropy": 0.4189927885308862, "epoch": 2.179596437053266, "grad_norm": 0.1475890874862671, "learning_rate": 2.7349955531020948e-05, "loss": 0.4022, "mean_token_accuracy": 0.8710589148104191, "num_tokens": 756050680.0, "step": 23690 }, { "entropy": 0.5966987144201994, "epoch": 2.1796884434247072, "grad_norm": 0.16854235529899597, "learning_rate": 2.734688870487932e-05, "loss": 0.5731, "mean_token_accuracy": 0.8203394822776318, "num_tokens": 756082040.0, "step": 23691 }, { "entropy": 0.5516112968325615, "epoch": 2.1797804497961484, "grad_norm": 0.1707259863615036, "learning_rate": 2.7343821878737697e-05, "loss": 0.5452, "mean_token_accuracy": 0.8279221653938293, "num_tokens": 756113566.0, "step": 23692 }, { "entropy": 0.5881625171750784, "epoch": 2.1798724561675895, "grad_norm": 0.17093081772327423, "learning_rate": 2.7340755052596068e-05, "loss": 0.5865, "mean_token_accuracy": 0.8143822178244591, "num_tokens": 756144398.0, "step": 23693 }, { "entropy": 0.5076936467085034, "epoch": 2.1799644625390306, "grad_norm": 0.16094791889190674, "learning_rate": 2.7337688226454443e-05, "loss": 0.4949, "mean_token_accuracy": 0.8444409146904945, "num_tokens": 756175898.0, "step": 23694 }, { "entropy": 0.4480241434648633, "epoch": 2.1800564689104722, "grad_norm": 0.1541784703731537, "learning_rate": 2.7334621400312814e-05, "loss": 0.434, "mean_token_accuracy": 0.8615749999880791, "num_tokens": 756207136.0, "step": 23695 }, { "entropy": 0.603094672318548, "epoch": 2.1801484752819134, "grad_norm": 0.1727157086133957, "learning_rate": 2.7331554574171192e-05, "loss": 0.6062, "mean_token_accuracy": 0.8084302917122841, "num_tokens": 756238882.0, "step": 23696 }, { "entropy": 0.6289227586239576, "epoch": 2.1802404816533545, "grad_norm": 0.17701318860054016, "learning_rate": 2.7328487748029563e-05, "loss": 0.6321, "mean_token_accuracy": 0.804922204464674, "num_tokens": 756270703.0, "step": 23697 }, { "entropy": 0.4672899632714689, "epoch": 2.1803324880247956, "grad_norm": 0.15596912801265717, "learning_rate": 2.732542092188794e-05, "loss": 0.4587, "mean_token_accuracy": 0.855700183659792, "num_tokens": 756303047.0, "step": 23698 }, { "entropy": 0.576046384871006, "epoch": 2.1804244943962368, "grad_norm": 0.16864895820617676, "learning_rate": 2.732235409574631e-05, "loss": 0.5606, "mean_token_accuracy": 0.8231163844466209, "num_tokens": 756335611.0, "step": 23699 }, { "entropy": 0.4583329767920077, "epoch": 2.1805165007676783, "grad_norm": 0.15175704658031464, "learning_rate": 2.7319287269604687e-05, "loss": 0.4487, "mean_token_accuracy": 0.8590573817491531, "num_tokens": 756368205.0, "step": 23700 }, { "entropy": 0.542741796001792, "epoch": 2.1806085071391195, "grad_norm": 0.15886889398097992, "learning_rate": 2.731622044346306e-05, "loss": 0.5304, "mean_token_accuracy": 0.8320648707449436, "num_tokens": 756400549.0, "step": 23701 }, { "entropy": 0.4863789523951709, "epoch": 2.1807005135105606, "grad_norm": 0.15532748401165009, "learning_rate": 2.7313153617321437e-05, "loss": 0.4753, "mean_token_accuracy": 0.8474473431706429, "num_tokens": 756432478.0, "step": 23702 }, { "entropy": 0.5284036789089441, "epoch": 2.1807925198820017, "grad_norm": 0.16049398481845856, "learning_rate": 2.731008679117981e-05, "loss": 0.512, "mean_token_accuracy": 0.8357553370296955, "num_tokens": 756464547.0, "step": 23703 }, { "entropy": 0.47482461854815483, "epoch": 2.180884526253443, "grad_norm": 0.15597736835479736, "learning_rate": 2.7307019965038182e-05, "loss": 0.4704, "mean_token_accuracy": 0.8523507043719292, "num_tokens": 756496949.0, "step": 23704 }, { "entropy": 0.5005776295438409, "epoch": 2.1809765326248844, "grad_norm": 0.15983779728412628, "learning_rate": 2.730395313889656e-05, "loss": 0.4808, "mean_token_accuracy": 0.8476321287453175, "num_tokens": 756529054.0, "step": 23705 }, { "entropy": 0.6028060503304005, "epoch": 2.1810685389963256, "grad_norm": 0.16732577979564667, "learning_rate": 2.7300886312754932e-05, "loss": 0.591, "mean_token_accuracy": 0.8150758519768715, "num_tokens": 756561285.0, "step": 23706 }, { "entropy": 0.49774435721337795, "epoch": 2.1811605453677667, "grad_norm": 0.1566672921180725, "learning_rate": 2.7297819486613306e-05, "loss": 0.4747, "mean_token_accuracy": 0.8452741652727127, "num_tokens": 756593379.0, "step": 23707 }, { "entropy": 0.5555048389360309, "epoch": 2.181252551739208, "grad_norm": 0.16318273544311523, "learning_rate": 2.7294752660471678e-05, "loss": 0.5453, "mean_token_accuracy": 0.8321098946034908, "num_tokens": 756625771.0, "step": 23708 }, { "entropy": 0.5829039253294468, "epoch": 2.181344558110649, "grad_norm": 0.16742157936096191, "learning_rate": 2.7291685834330056e-05, "loss": 0.5724, "mean_token_accuracy": 0.8229180090129375, "num_tokens": 756658184.0, "step": 23709 }, { "entropy": 0.5194876492023468, "epoch": 2.1814365644820906, "grad_norm": 0.1624974012374878, "learning_rate": 2.7288619008188427e-05, "loss": 0.5135, "mean_token_accuracy": 0.8343985415995121, "num_tokens": 756690497.0, "step": 23710 }, { "entropy": 0.3808723045513034, "epoch": 2.1815285708535317, "grad_norm": 0.14883989095687866, "learning_rate": 2.72855521820468e-05, "loss": 0.3716, "mean_token_accuracy": 0.8801658749580383, "num_tokens": 756722072.0, "step": 23711 }, { "entropy": 0.4911482797469944, "epoch": 2.181620577224973, "grad_norm": 0.16020487248897552, "learning_rate": 2.7282485355905173e-05, "loss": 0.4696, "mean_token_accuracy": 0.8491251021623611, "num_tokens": 756753905.0, "step": 23712 }, { "entropy": 0.5430525187402964, "epoch": 2.181712583596414, "grad_norm": 0.16101200878620148, "learning_rate": 2.727941852976355e-05, "loss": 0.5317, "mean_token_accuracy": 0.8294871039688587, "num_tokens": 756786002.0, "step": 23713 }, { "entropy": 0.5730591993778944, "epoch": 2.181804589967855, "grad_norm": 0.17002741992473602, "learning_rate": 2.7276351703621922e-05, "loss": 0.5701, "mean_token_accuracy": 0.8209846504032612, "num_tokens": 756817844.0, "step": 23714 }, { "entropy": 0.597935794852674, "epoch": 2.1818965963392967, "grad_norm": 0.17075107991695404, "learning_rate": 2.7273284877480297e-05, "loss": 0.5892, "mean_token_accuracy": 0.8148635923862457, "num_tokens": 756849454.0, "step": 23715 }, { "entropy": 0.5994333205744624, "epoch": 2.181988602710738, "grad_norm": 0.17020195722579956, "learning_rate": 2.7270218051338668e-05, "loss": 0.5812, "mean_token_accuracy": 0.8154087066650391, "num_tokens": 756881945.0, "step": 23716 }, { "entropy": 0.5848719058558345, "epoch": 2.182080609082179, "grad_norm": 0.1735139638185501, "learning_rate": 2.7267151225197046e-05, "loss": 0.5746, "mean_token_accuracy": 0.8220936618745327, "num_tokens": 756913772.0, "step": 23717 }, { "entropy": 0.5142320338636637, "epoch": 2.18217261545362, "grad_norm": 0.15754184126853943, "learning_rate": 2.7264084399055417e-05, "loss": 0.4841, "mean_token_accuracy": 0.8472132347524166, "num_tokens": 756945229.0, "step": 23718 }, { "entropy": 0.5277885822579265, "epoch": 2.182264621825061, "grad_norm": 0.1618301421403885, "learning_rate": 2.7261017572913795e-05, "loss": 0.5115, "mean_token_accuracy": 0.8399118334054947, "num_tokens": 756977474.0, "step": 23719 }, { "entropy": 0.5600571124814451, "epoch": 2.182356628196503, "grad_norm": 0.1602032333612442, "learning_rate": 2.7257950746772167e-05, "loss": 0.5297, "mean_token_accuracy": 0.8326543234288692, "num_tokens": 757009495.0, "step": 23720 }, { "entropy": 0.4860941111110151, "epoch": 2.182448634567944, "grad_norm": 0.15083695948123932, "learning_rate": 2.725488392063054e-05, "loss": 0.468, "mean_token_accuracy": 0.8519751951098442, "num_tokens": 757041432.0, "step": 23721 }, { "entropy": 0.5186964082531631, "epoch": 2.182540640939385, "grad_norm": 0.16653591394424438, "learning_rate": 2.7251817094488913e-05, "loss": 0.5024, "mean_token_accuracy": 0.8395251892507076, "num_tokens": 757072876.0, "step": 23722 }, { "entropy": 0.48088933038525283, "epoch": 2.182632647310826, "grad_norm": 0.1582144796848297, "learning_rate": 2.724875026834729e-05, "loss": 0.4671, "mean_token_accuracy": 0.8496546484529972, "num_tokens": 757105449.0, "step": 23723 }, { "entropy": 0.5091195870190859, "epoch": 2.1827246536822673, "grad_norm": 0.16662262380123138, "learning_rate": 2.7245683442205662e-05, "loss": 0.4943, "mean_token_accuracy": 0.8417821303009987, "num_tokens": 757138053.0, "step": 23724 }, { "entropy": 0.4593860500026494, "epoch": 2.182816660053709, "grad_norm": 0.15090414881706238, "learning_rate": 2.7242616616064037e-05, "loss": 0.4352, "mean_token_accuracy": 0.8601684309542179, "num_tokens": 757170267.0, "step": 23725 }, { "entropy": 0.6088556349277496, "epoch": 2.18290866642515, "grad_norm": 0.17299504578113556, "learning_rate": 2.7239549789922408e-05, "loss": 0.5887, "mean_token_accuracy": 0.8171259984374046, "num_tokens": 757202382.0, "step": 23726 }, { "entropy": 0.451709499116987, "epoch": 2.183000672796591, "grad_norm": 0.14545489847660065, "learning_rate": 2.7236482963780786e-05, "loss": 0.4294, "mean_token_accuracy": 0.8637298941612244, "num_tokens": 757235003.0, "step": 23727 }, { "entropy": 0.4784110737964511, "epoch": 2.1830926791680323, "grad_norm": 0.1559625118970871, "learning_rate": 2.7233416137639157e-05, "loss": 0.4622, "mean_token_accuracy": 0.8507075533270836, "num_tokens": 757266999.0, "step": 23728 }, { "entropy": 0.5713079175911844, "epoch": 2.1831846855394734, "grad_norm": 0.16390889883041382, "learning_rate": 2.7230349311497532e-05, "loss": 0.5549, "mean_token_accuracy": 0.8254763036966324, "num_tokens": 757299767.0, "step": 23729 }, { "entropy": 0.48929715156555176, "epoch": 2.183276691910915, "grad_norm": 0.15925459563732147, "learning_rate": 2.7227282485355903e-05, "loss": 0.4803, "mean_token_accuracy": 0.8481694236397743, "num_tokens": 757331860.0, "step": 23730 }, { "entropy": 0.5413746880367398, "epoch": 2.183368698282356, "grad_norm": 0.16103363037109375, "learning_rate": 2.722421565921428e-05, "loss": 0.5288, "mean_token_accuracy": 0.8330196179449558, "num_tokens": 757364040.0, "step": 23731 }, { "entropy": 0.5330888647586107, "epoch": 2.1834607046537973, "grad_norm": 0.16140414774417877, "learning_rate": 2.7221148833072656e-05, "loss": 0.5242, "mean_token_accuracy": 0.8339665681123734, "num_tokens": 757395310.0, "step": 23732 }, { "entropy": 0.5151425404474139, "epoch": 2.1835527110252384, "grad_norm": 0.16652099788188934, "learning_rate": 2.7218082006931027e-05, "loss": 0.5004, "mean_token_accuracy": 0.8402676694095135, "num_tokens": 757427219.0, "step": 23733 }, { "entropy": 0.4931772309355438, "epoch": 2.1836447173966795, "grad_norm": 0.16293372213840485, "learning_rate": 2.7215015180789405e-05, "loss": 0.4811, "mean_token_accuracy": 0.8474881686270237, "num_tokens": 757459307.0, "step": 23734 }, { "entropy": 0.50099135376513, "epoch": 2.183736723768121, "grad_norm": 0.16221080720424652, "learning_rate": 2.7211948354647776e-05, "loss": 0.4966, "mean_token_accuracy": 0.8416542746126652, "num_tokens": 757491359.0, "step": 23735 }, { "entropy": 0.4609315637499094, "epoch": 2.1838287301395622, "grad_norm": 0.1585645228624344, "learning_rate": 2.7208881528506154e-05, "loss": 0.4496, "mean_token_accuracy": 0.8586165979504585, "num_tokens": 757523380.0, "step": 23736 }, { "entropy": 0.5385189331136644, "epoch": 2.1839207365110034, "grad_norm": 0.16594937443733215, "learning_rate": 2.7205814702364522e-05, "loss": 0.5233, "mean_token_accuracy": 0.8337184153497219, "num_tokens": 757555613.0, "step": 23737 }, { "entropy": 0.5175488889217377, "epoch": 2.1840127428824445, "grad_norm": 0.1622328907251358, "learning_rate": 2.72027478762229e-05, "loss": 0.5015, "mean_token_accuracy": 0.8419675454497337, "num_tokens": 757588009.0, "step": 23738 }, { "entropy": 0.5283892694860697, "epoch": 2.1841047492538856, "grad_norm": 0.1650855839252472, "learning_rate": 2.719968105008127e-05, "loss": 0.5115, "mean_token_accuracy": 0.8396175615489483, "num_tokens": 757619933.0, "step": 23739 }, { "entropy": 0.534344166982919, "epoch": 2.1841967556253272, "grad_norm": 0.16366459429264069, "learning_rate": 2.719661422393965e-05, "loss": 0.5206, "mean_token_accuracy": 0.8361436538398266, "num_tokens": 757652021.0, "step": 23740 }, { "entropy": 0.5384791204705834, "epoch": 2.1842887619967684, "grad_norm": 0.15946906805038452, "learning_rate": 2.719354739779802e-05, "loss": 0.5264, "mean_token_accuracy": 0.8316628709435463, "num_tokens": 757684265.0, "step": 23741 }, { "entropy": 0.47322862688452005, "epoch": 2.1843807683682095, "grad_norm": 0.1595618575811386, "learning_rate": 2.7190480571656395e-05, "loss": 0.4538, "mean_token_accuracy": 0.8520045839250088, "num_tokens": 757715847.0, "step": 23742 }, { "entropy": 0.5500846542418003, "epoch": 2.1844727747396506, "grad_norm": 0.16215692460536957, "learning_rate": 2.7187413745514767e-05, "loss": 0.5347, "mean_token_accuracy": 0.8325664810836315, "num_tokens": 757748119.0, "step": 23743 }, { "entropy": 0.4934967001900077, "epoch": 2.1845647811110918, "grad_norm": 0.15479157865047455, "learning_rate": 2.7184346919373145e-05, "loss": 0.4831, "mean_token_accuracy": 0.8484692610800266, "num_tokens": 757780199.0, "step": 23744 }, { "entropy": 0.5398937575519085, "epoch": 2.1846567874825333, "grad_norm": 0.16216106712818146, "learning_rate": 2.7181280093231516e-05, "loss": 0.5399, "mean_token_accuracy": 0.8307509906589985, "num_tokens": 757812710.0, "step": 23745 }, { "entropy": 0.6010965956375003, "epoch": 2.1847487938539745, "grad_norm": 0.16827607154846191, "learning_rate": 2.717821326708989e-05, "loss": 0.5806, "mean_token_accuracy": 0.8153496608138084, "num_tokens": 757844596.0, "step": 23746 }, { "entropy": 0.5676482012495399, "epoch": 2.1848408002254156, "grad_norm": 0.16435697674751282, "learning_rate": 2.7175146440948262e-05, "loss": 0.5543, "mean_token_accuracy": 0.8243623860180378, "num_tokens": 757876770.0, "step": 23747 }, { "entropy": 0.5399671280756593, "epoch": 2.1849328065968567, "grad_norm": 0.16695153713226318, "learning_rate": 2.717207961480664e-05, "loss": 0.5221, "mean_token_accuracy": 0.8346253708004951, "num_tokens": 757909365.0, "step": 23748 }, { "entropy": 0.5914628067985177, "epoch": 2.185024812968298, "grad_norm": 0.1654667854309082, "learning_rate": 2.716901278866501e-05, "loss": 0.5805, "mean_token_accuracy": 0.817086536437273, "num_tokens": 757941211.0, "step": 23749 }, { "entropy": 0.5942269591614604, "epoch": 2.1851168193397394, "grad_norm": 0.16724610328674316, "learning_rate": 2.7165945962523386e-05, "loss": 0.575, "mean_token_accuracy": 0.8166666254401207, "num_tokens": 757973503.0, "step": 23750 }, { "entropy": 0.5887294104322791, "epoch": 2.1852088257111806, "grad_norm": 0.16293290257453918, "learning_rate": 2.7162879136381757e-05, "loss": 0.567, "mean_token_accuracy": 0.8207765519618988, "num_tokens": 758005800.0, "step": 23751 }, { "entropy": 0.5187226086854935, "epoch": 2.1853008320826217, "grad_norm": 0.16725029051303864, "learning_rate": 2.7159812310240135e-05, "loss": 0.5119, "mean_token_accuracy": 0.835159782320261, "num_tokens": 758037601.0, "step": 23752 }, { "entropy": 0.5328169642016292, "epoch": 2.185392838454063, "grad_norm": 0.1685868501663208, "learning_rate": 2.7156745484098506e-05, "loss": 0.5196, "mean_token_accuracy": 0.8363794833421707, "num_tokens": 758069633.0, "step": 23753 }, { "entropy": 0.5469092046841979, "epoch": 2.185484844825504, "grad_norm": 0.16068069636821747, "learning_rate": 2.715367865795688e-05, "loss": 0.5386, "mean_token_accuracy": 0.8301772326231003, "num_tokens": 758101752.0, "step": 23754 }, { "entropy": 0.6085434313863516, "epoch": 2.1855768511969456, "grad_norm": 0.1719134896993637, "learning_rate": 2.7150611831815252e-05, "loss": 0.5955, "mean_token_accuracy": 0.8108835183084011, "num_tokens": 758133038.0, "step": 23755 }, { "entropy": 0.4544774852693081, "epoch": 2.1856688575683867, "grad_norm": 0.16152223944664001, "learning_rate": 2.714754500567363e-05, "loss": 0.4387, "mean_token_accuracy": 0.8558289557695389, "num_tokens": 758164242.0, "step": 23756 }, { "entropy": 0.49539794120937586, "epoch": 2.185760863939828, "grad_norm": 0.16023893654346466, "learning_rate": 2.7144478179532e-05, "loss": 0.4846, "mean_token_accuracy": 0.8434996418654919, "num_tokens": 758196243.0, "step": 23757 }, { "entropy": 0.5244387537240982, "epoch": 2.185852870311269, "grad_norm": 0.16059288382530212, "learning_rate": 2.714141135339038e-05, "loss": 0.5044, "mean_token_accuracy": 0.8378670141100883, "num_tokens": 758227858.0, "step": 23758 }, { "entropy": 0.532851202879101, "epoch": 2.18594487668271, "grad_norm": 0.1603340208530426, "learning_rate": 2.7138344527248747e-05, "loss": 0.5183, "mean_token_accuracy": 0.8359714075922966, "num_tokens": 758259472.0, "step": 23759 }, { "entropy": 0.5132010020315647, "epoch": 2.1860368830541517, "grad_norm": 0.1647665798664093, "learning_rate": 2.7135277701107125e-05, "loss": 0.5111, "mean_token_accuracy": 0.8382012359797955, "num_tokens": 758291817.0, "step": 23760 }, { "entropy": 0.5900923488661647, "epoch": 2.186128889425593, "grad_norm": 0.16724541783332825, "learning_rate": 2.7132210874965497e-05, "loss": 0.5761, "mean_token_accuracy": 0.8214148841798306, "num_tokens": 758323489.0, "step": 23761 }, { "entropy": 0.5777246858924627, "epoch": 2.186220895797034, "grad_norm": 0.17169678211212158, "learning_rate": 2.7129144048823875e-05, "loss": 0.5634, "mean_token_accuracy": 0.8190270774066448, "num_tokens": 758355213.0, "step": 23762 }, { "entropy": 0.3969243075698614, "epoch": 2.186312902168475, "grad_norm": 0.14326122403144836, "learning_rate": 2.712607722268225e-05, "loss": 0.3869, "mean_token_accuracy": 0.8723056577146053, "num_tokens": 758387665.0, "step": 23763 }, { "entropy": 0.5617887144908309, "epoch": 2.186404908539916, "grad_norm": 0.16499751806259155, "learning_rate": 2.712301039654062e-05, "loss": 0.5574, "mean_token_accuracy": 0.8224309608340263, "num_tokens": 758420010.0, "step": 23764 }, { "entropy": 0.47784499218687415, "epoch": 2.186496914911358, "grad_norm": 0.15363676846027374, "learning_rate": 2.7119943570399e-05, "loss": 0.4607, "mean_token_accuracy": 0.8526087142527103, "num_tokens": 758452506.0, "step": 23765 }, { "entropy": 0.5385084487497807, "epoch": 2.186588921282799, "grad_norm": 0.16274559497833252, "learning_rate": 2.711687674425737e-05, "loss": 0.5217, "mean_token_accuracy": 0.8334378972649574, "num_tokens": 758484578.0, "step": 23766 }, { "entropy": 0.4771590167656541, "epoch": 2.18668092765424, "grad_norm": 0.15859480202198029, "learning_rate": 2.7113809918115745e-05, "loss": 0.4567, "mean_token_accuracy": 0.852822732180357, "num_tokens": 758516251.0, "step": 23767 }, { "entropy": 0.3456671244930476, "epoch": 2.186772934025681, "grad_norm": 0.13526275753974915, "learning_rate": 2.7110743091974116e-05, "loss": 0.3312, "mean_token_accuracy": 0.8930121175944805, "num_tokens": 758548635.0, "step": 23768 }, { "entropy": 0.5031196111813188, "epoch": 2.1868649403971223, "grad_norm": 0.1598338931798935, "learning_rate": 2.7107676265832494e-05, "loss": 0.4841, "mean_token_accuracy": 0.8433161601424217, "num_tokens": 758580003.0, "step": 23769 }, { "entropy": 0.5670165481278673, "epoch": 2.186956946768564, "grad_norm": 0.1642935574054718, "learning_rate": 2.7104609439690865e-05, "loss": 0.5498, "mean_token_accuracy": 0.8267302848398685, "num_tokens": 758612016.0, "step": 23770 }, { "entropy": 0.5395582262426615, "epoch": 2.187048953140005, "grad_norm": 0.16523779928684235, "learning_rate": 2.710154261354924e-05, "loss": 0.528, "mean_token_accuracy": 0.8327017650008202, "num_tokens": 758643334.0, "step": 23771 }, { "entropy": 0.48379847314208746, "epoch": 2.187140959511446, "grad_norm": 0.1562117338180542, "learning_rate": 2.709847578740761e-05, "loss": 0.4663, "mean_token_accuracy": 0.8480079956352711, "num_tokens": 758675132.0, "step": 23772 }, { "entropy": 0.4955163775011897, "epoch": 2.1872329658828873, "grad_norm": 0.16332295536994934, "learning_rate": 2.709540896126599e-05, "loss": 0.4895, "mean_token_accuracy": 0.844387698918581, "num_tokens": 758707720.0, "step": 23773 }, { "entropy": 0.44267973862588406, "epoch": 2.1873249722543284, "grad_norm": 0.15093153715133667, "learning_rate": 2.709234213512436e-05, "loss": 0.4354, "mean_token_accuracy": 0.8608657233417034, "num_tokens": 758739803.0, "step": 23774 }, { "entropy": 0.5947998724877834, "epoch": 2.18741697862577, "grad_norm": 0.16730555891990662, "learning_rate": 2.7089275308982735e-05, "loss": 0.5813, "mean_token_accuracy": 0.8169506378471851, "num_tokens": 758771978.0, "step": 23775 }, { "entropy": 0.5383327398449183, "epoch": 2.187508984997211, "grad_norm": 0.16515058279037476, "learning_rate": 2.7086208482841106e-05, "loss": 0.5264, "mean_token_accuracy": 0.8343851380050182, "num_tokens": 758804438.0, "step": 23776 }, { "entropy": 0.521900984691456, "epoch": 2.1876009913686523, "grad_norm": 0.16535314917564392, "learning_rate": 2.7083141656699484e-05, "loss": 0.5186, "mean_token_accuracy": 0.8376488015055656, "num_tokens": 758836700.0, "step": 23777 }, { "entropy": 0.4144380586221814, "epoch": 2.1876929977400934, "grad_norm": 0.14870786666870117, "learning_rate": 2.7080074830557856e-05, "loss": 0.408, "mean_token_accuracy": 0.8694970794022083, "num_tokens": 758869194.0, "step": 23778 }, { "entropy": 0.54081907030195, "epoch": 2.1877850041115345, "grad_norm": 0.1664194017648697, "learning_rate": 2.7077008004416234e-05, "loss": 0.5267, "mean_token_accuracy": 0.830532617866993, "num_tokens": 758901421.0, "step": 23779 }, { "entropy": 0.5786362625658512, "epoch": 2.187877010482976, "grad_norm": 0.16970284283161163, "learning_rate": 2.7073941178274605e-05, "loss": 0.5637, "mean_token_accuracy": 0.8199919648468494, "num_tokens": 758933149.0, "step": 23780 }, { "entropy": 0.47469058353453875, "epoch": 2.1879690168544172, "grad_norm": 0.15678396821022034, "learning_rate": 2.707087435213298e-05, "loss": 0.4671, "mean_token_accuracy": 0.8518393710255623, "num_tokens": 758964818.0, "step": 23781 }, { "entropy": 0.5425951573997736, "epoch": 2.1880610232258584, "grad_norm": 0.16428102552890778, "learning_rate": 2.706780752599135e-05, "loss": 0.5293, "mean_token_accuracy": 0.832843229174614, "num_tokens": 758997031.0, "step": 23782 }, { "entropy": 0.6135748289525509, "epoch": 2.1881530295972995, "grad_norm": 0.1689968705177307, "learning_rate": 2.706474069984973e-05, "loss": 0.6098, "mean_token_accuracy": 0.8091376163065434, "num_tokens": 759029595.0, "step": 23783 }, { "entropy": 0.6933795106597245, "epoch": 2.1882450359687406, "grad_norm": 0.17834557592868805, "learning_rate": 2.70616738737081e-05, "loss": 0.6743, "mean_token_accuracy": 0.7953371703624725, "num_tokens": 759061272.0, "step": 23784 }, { "entropy": 0.5295474855229259, "epoch": 2.1883370423401822, "grad_norm": 0.15764114260673523, "learning_rate": 2.7058607047566475e-05, "loss": 0.5119, "mean_token_accuracy": 0.8397271819412708, "num_tokens": 759093598.0, "step": 23785 }, { "entropy": 0.5615310817956924, "epoch": 2.1884290487116234, "grad_norm": 0.16892854869365692, "learning_rate": 2.7055540221424846e-05, "loss": 0.5549, "mean_token_accuracy": 0.8211745135486126, "num_tokens": 759124690.0, "step": 23786 }, { "entropy": 0.4329511453397572, "epoch": 2.1885210550830645, "grad_norm": 0.1479867696762085, "learning_rate": 2.7052473395283224e-05, "loss": 0.4182, "mean_token_accuracy": 0.8693915456533432, "num_tokens": 759157307.0, "step": 23787 }, { "entropy": 0.5069901756942272, "epoch": 2.1886130614545056, "grad_norm": 0.1601894646883011, "learning_rate": 2.7049406569141595e-05, "loss": 0.4975, "mean_token_accuracy": 0.8421868085861206, "num_tokens": 759189189.0, "step": 23788 }, { "entropy": 0.5335832312703133, "epoch": 2.1887050678259468, "grad_norm": 0.15985576808452606, "learning_rate": 2.704633974299997e-05, "loss": 0.5136, "mean_token_accuracy": 0.8366073369979858, "num_tokens": 759221404.0, "step": 23789 }, { "entropy": 0.4734414694830775, "epoch": 2.1887970741973883, "grad_norm": 0.1573713719844818, "learning_rate": 2.704327291685834e-05, "loss": 0.4559, "mean_token_accuracy": 0.8545776158571243, "num_tokens": 759253024.0, "step": 23790 }, { "entropy": 0.4018732188269496, "epoch": 2.1888890805688295, "grad_norm": 0.14465515315532684, "learning_rate": 2.704020609071672e-05, "loss": 0.3894, "mean_token_accuracy": 0.8716009892523289, "num_tokens": 759285057.0, "step": 23791 }, { "entropy": 0.5684047918766737, "epoch": 2.1889810869402706, "grad_norm": 0.1680024415254593, "learning_rate": 2.703713926457509e-05, "loss": 0.5721, "mean_token_accuracy": 0.8208846896886826, "num_tokens": 759317673.0, "step": 23792 }, { "entropy": 0.5751814404502511, "epoch": 2.1890730933117117, "grad_norm": 0.16985486447811127, "learning_rate": 2.7034072438433465e-05, "loss": 0.5556, "mean_token_accuracy": 0.8269699364900589, "num_tokens": 759349180.0, "step": 23793 }, { "entropy": 0.5538265164941549, "epoch": 2.189165099683153, "grad_norm": 0.16595907509326935, "learning_rate": 2.7031005612291843e-05, "loss": 0.5449, "mean_token_accuracy": 0.8284485265612602, "num_tokens": 759381674.0, "step": 23794 }, { "entropy": 0.548831813968718, "epoch": 2.1892571060545944, "grad_norm": 0.1608937680721283, "learning_rate": 2.7027938786150214e-05, "loss": 0.5361, "mean_token_accuracy": 0.8305912688374519, "num_tokens": 759414167.0, "step": 23795 }, { "entropy": 0.49691994953900576, "epoch": 2.1893491124260356, "grad_norm": 0.15400315821170807, "learning_rate": 2.7024871960008592e-05, "loss": 0.4776, "mean_token_accuracy": 0.849508959800005, "num_tokens": 759446743.0, "step": 23796 }, { "entropy": 0.5878166318871081, "epoch": 2.1894411187974767, "grad_norm": 0.1675867885351181, "learning_rate": 2.702180513386696e-05, "loss": 0.5723, "mean_token_accuracy": 0.8163991831243038, "num_tokens": 759478781.0, "step": 23797 }, { "entropy": 0.5083350632339716, "epoch": 2.189533125168918, "grad_norm": 0.1582464575767517, "learning_rate": 2.701873830772534e-05, "loss": 0.4994, "mean_token_accuracy": 0.8435896672308445, "num_tokens": 759511042.0, "step": 23798 }, { "entropy": 0.5177946551702917, "epoch": 2.189625131540359, "grad_norm": 0.1595437079668045, "learning_rate": 2.701567148158371e-05, "loss": 0.4971, "mean_token_accuracy": 0.8436611406505108, "num_tokens": 759542916.0, "step": 23799 }, { "entropy": 0.5833287257701159, "epoch": 2.1897171379118006, "grad_norm": 0.1709306389093399, "learning_rate": 2.7012604655442088e-05, "loss": 0.5746, "mean_token_accuracy": 0.8164657391607761, "num_tokens": 759574831.0, "step": 23800 }, { "entropy": 0.5158677615690976, "epoch": 2.1898091442832417, "grad_norm": 0.15563532710075378, "learning_rate": 2.700953782930046e-05, "loss": 0.4934, "mean_token_accuracy": 0.8457126133143902, "num_tokens": 759607099.0, "step": 23801 }, { "entropy": 0.49806624511256814, "epoch": 2.189901150654683, "grad_norm": 0.15422919392585754, "learning_rate": 2.7006471003158834e-05, "loss": 0.4949, "mean_token_accuracy": 0.8466300517320633, "num_tokens": 759639106.0, "step": 23802 }, { "entropy": 0.6026915144175291, "epoch": 2.189993157026124, "grad_norm": 0.16635890305042267, "learning_rate": 2.7003404177017205e-05, "loss": 0.5869, "mean_token_accuracy": 0.8154717646539211, "num_tokens": 759670644.0, "step": 23803 }, { "entropy": 0.4735979549586773, "epoch": 2.190085163397565, "grad_norm": 0.15800276398658752, "learning_rate": 2.7000337350875583e-05, "loss": 0.4635, "mean_token_accuracy": 0.84751296043396, "num_tokens": 759702563.0, "step": 23804 }, { "entropy": 0.4413170637562871, "epoch": 2.1901771697690067, "grad_norm": 0.15064391493797302, "learning_rate": 2.6997270524733954e-05, "loss": 0.422, "mean_token_accuracy": 0.869357455521822, "num_tokens": 759734262.0, "step": 23805 }, { "entropy": 0.5727147958241403, "epoch": 2.190269176140448, "grad_norm": 0.162059485912323, "learning_rate": 2.699420369859233e-05, "loss": 0.5467, "mean_token_accuracy": 0.8244815208017826, "num_tokens": 759766355.0, "step": 23806 }, { "entropy": 0.5347528662532568, "epoch": 2.190361182511889, "grad_norm": 0.16541843116283417, "learning_rate": 2.69911368724507e-05, "loss": 0.5257, "mean_token_accuracy": 0.8341879621148109, "num_tokens": 759798104.0, "step": 23807 }, { "entropy": 0.4856530660763383, "epoch": 2.19045318888333, "grad_norm": 0.1525842845439911, "learning_rate": 2.6988070046309078e-05, "loss": 0.4711, "mean_token_accuracy": 0.8464928492903709, "num_tokens": 759829805.0, "step": 23808 }, { "entropy": 0.47147962381131947, "epoch": 2.190545195254771, "grad_norm": 0.1519036740064621, "learning_rate": 2.698500322016745e-05, "loss": 0.4529, "mean_token_accuracy": 0.8569317534565926, "num_tokens": 759861117.0, "step": 23809 }, { "entropy": 0.47499594278633595, "epoch": 2.190637201626213, "grad_norm": 0.1569909006357193, "learning_rate": 2.6981936394025824e-05, "loss": 0.4496, "mean_token_accuracy": 0.8536520153284073, "num_tokens": 759892505.0, "step": 23810 }, { "entropy": 0.5231226468458772, "epoch": 2.190729207997654, "grad_norm": 0.16276466846466064, "learning_rate": 2.6978869567884195e-05, "loss": 0.5038, "mean_token_accuracy": 0.8389384411275387, "num_tokens": 759925102.0, "step": 23811 }, { "entropy": 0.5669290823861957, "epoch": 2.190821214369095, "grad_norm": 0.1613745093345642, "learning_rate": 2.6975802741742573e-05, "loss": 0.5489, "mean_token_accuracy": 0.8284406252205372, "num_tokens": 759957385.0, "step": 23812 }, { "entropy": 0.4150994410738349, "epoch": 2.190913220740536, "grad_norm": 0.14834314584732056, "learning_rate": 2.6972735915600945e-05, "loss": 0.3969, "mean_token_accuracy": 0.8719798140227795, "num_tokens": 759989203.0, "step": 23813 }, { "entropy": 0.6023230478167534, "epoch": 2.1910052271119773, "grad_norm": 0.17113271355628967, "learning_rate": 2.696966908945932e-05, "loss": 0.5769, "mean_token_accuracy": 0.8174680881202221, "num_tokens": 760020481.0, "step": 23814 }, { "entropy": 0.5455618768464774, "epoch": 2.191097233483419, "grad_norm": 0.1623707115650177, "learning_rate": 2.696660226331769e-05, "loss": 0.5364, "mean_token_accuracy": 0.8298507630825043, "num_tokens": 760052579.0, "step": 23815 }, { "entropy": 0.583277290686965, "epoch": 2.19118923985486, "grad_norm": 0.17166562378406525, "learning_rate": 2.696353543717607e-05, "loss": 0.5757, "mean_token_accuracy": 0.8221931532025337, "num_tokens": 760083225.0, "step": 23816 }, { "entropy": 0.4941352792084217, "epoch": 2.191281246226301, "grad_norm": 0.1619686484336853, "learning_rate": 2.696046861103444e-05, "loss": 0.4787, "mean_token_accuracy": 0.8472783342003822, "num_tokens": 760114807.0, "step": 23817 }, { "entropy": 0.5564689505845308, "epoch": 2.1913732525977423, "grad_norm": 0.15965600311756134, "learning_rate": 2.6957401784892818e-05, "loss": 0.5433, "mean_token_accuracy": 0.8310802653431892, "num_tokens": 760147279.0, "step": 23818 }, { "entropy": 0.5595513544976711, "epoch": 2.1914652589691834, "grad_norm": 0.16577883064746857, "learning_rate": 2.6954334958751186e-05, "loss": 0.5535, "mean_token_accuracy": 0.8253929205238819, "num_tokens": 760179800.0, "step": 23819 }, { "entropy": 0.4342053709551692, "epoch": 2.191557265340625, "grad_norm": 0.14770345389842987, "learning_rate": 2.6951268132609564e-05, "loss": 0.4254, "mean_token_accuracy": 0.8642414696514606, "num_tokens": 760211846.0, "step": 23820 }, { "entropy": 0.5916228238493204, "epoch": 2.191649271712066, "grad_norm": 0.1665831357240677, "learning_rate": 2.6948201306467935e-05, "loss": 0.5782, "mean_token_accuracy": 0.8188469409942627, "num_tokens": 760244339.0, "step": 23821 }, { "entropy": 0.4869741462171078, "epoch": 2.1917412780835073, "grad_norm": 0.16294357180595398, "learning_rate": 2.6945134480326313e-05, "loss": 0.4794, "mean_token_accuracy": 0.8486057221889496, "num_tokens": 760275689.0, "step": 23822 }, { "entropy": 0.4928282715845853, "epoch": 2.1918332844549484, "grad_norm": 0.15540896356105804, "learning_rate": 2.6942067654184684e-05, "loss": 0.4742, "mean_token_accuracy": 0.8473732098937035, "num_tokens": 760307334.0, "step": 23823 }, { "entropy": 0.578589865937829, "epoch": 2.1919252908263895, "grad_norm": 0.1776258796453476, "learning_rate": 2.693900082804306e-05, "loss": 0.5719, "mean_token_accuracy": 0.8197028040885925, "num_tokens": 760339159.0, "step": 23824 }, { "entropy": 0.574146943166852, "epoch": 2.192017297197831, "grad_norm": 0.16611576080322266, "learning_rate": 2.6935934001901437e-05, "loss": 0.5544, "mean_token_accuracy": 0.8246815949678421, "num_tokens": 760371239.0, "step": 23825 }, { "entropy": 0.47126574511639774, "epoch": 2.1921093035692722, "grad_norm": 0.15437957644462585, "learning_rate": 2.6932867175759808e-05, "loss": 0.4603, "mean_token_accuracy": 0.8581824861466885, "num_tokens": 760403471.0, "step": 23826 }, { "entropy": 0.4510419415310025, "epoch": 2.1922013099407134, "grad_norm": 0.1536766141653061, "learning_rate": 2.6929800349618183e-05, "loss": 0.4299, "mean_token_accuracy": 0.857527133077383, "num_tokens": 760434560.0, "step": 23827 }, { "entropy": 0.48959570564329624, "epoch": 2.1922933163121545, "grad_norm": 0.1507236212491989, "learning_rate": 2.6926733523476554e-05, "loss": 0.4761, "mean_token_accuracy": 0.8515100888907909, "num_tokens": 760466925.0, "step": 23828 }, { "entropy": 0.5614915583282709, "epoch": 2.1923853226835956, "grad_norm": 0.15993788838386536, "learning_rate": 2.6923666697334932e-05, "loss": 0.5441, "mean_token_accuracy": 0.825629536062479, "num_tokens": 760499063.0, "step": 23829 }, { "entropy": 0.49306635558605194, "epoch": 2.1924773290550372, "grad_norm": 0.16267350316047668, "learning_rate": 2.6920599871193303e-05, "loss": 0.4698, "mean_token_accuracy": 0.8481754809617996, "num_tokens": 760530178.0, "step": 23830 }, { "entropy": 0.38733710860833526, "epoch": 2.1925693354264784, "grad_norm": 0.1470993459224701, "learning_rate": 2.6917533045051678e-05, "loss": 0.3819, "mean_token_accuracy": 0.8763630203902721, "num_tokens": 760561828.0, "step": 23831 }, { "entropy": 0.39886833261698484, "epoch": 2.1926613417979195, "grad_norm": 0.14781959354877472, "learning_rate": 2.691446621891005e-05, "loss": 0.381, "mean_token_accuracy": 0.8784703984856606, "num_tokens": 760593714.0, "step": 23832 }, { "entropy": 0.6244600862264633, "epoch": 2.1927533481693606, "grad_norm": 0.1751101315021515, "learning_rate": 2.6911399392768427e-05, "loss": 0.6063, "mean_token_accuracy": 0.8056793175637722, "num_tokens": 760624798.0, "step": 23833 }, { "entropy": 0.513577233068645, "epoch": 2.1928453545408018, "grad_norm": 0.16182841360569, "learning_rate": 2.69083325666268e-05, "loss": 0.4986, "mean_token_accuracy": 0.8442580699920654, "num_tokens": 760656653.0, "step": 23834 }, { "entropy": 0.5141155561432242, "epoch": 2.1929373609122433, "grad_norm": 0.16006620228290558, "learning_rate": 2.6905265740485173e-05, "loss": 0.4937, "mean_token_accuracy": 0.8410985544323921, "num_tokens": 760688795.0, "step": 23835 }, { "entropy": 0.4360063043422997, "epoch": 2.1930293672836845, "grad_norm": 0.15128551423549652, "learning_rate": 2.6902198914343544e-05, "loss": 0.421, "mean_token_accuracy": 0.8636649250984192, "num_tokens": 760720988.0, "step": 23836 }, { "entropy": 0.5020132027566433, "epoch": 2.1931213736551256, "grad_norm": 0.15785102546215057, "learning_rate": 2.6899132088201923e-05, "loss": 0.4984, "mean_token_accuracy": 0.8440614975988865, "num_tokens": 760753306.0, "step": 23837 }, { "entropy": 0.443241496803239, "epoch": 2.1932133800265667, "grad_norm": 0.15858392417430878, "learning_rate": 2.6896065262060294e-05, "loss": 0.4372, "mean_token_accuracy": 0.8610507734119892, "num_tokens": 760784329.0, "step": 23838 }, { "entropy": 0.48549686186015606, "epoch": 2.193305386398008, "grad_norm": 0.1593698114156723, "learning_rate": 2.6892998435918672e-05, "loss": 0.4736, "mean_token_accuracy": 0.8474798835813999, "num_tokens": 760815575.0, "step": 23839 }, { "entropy": 0.4895594324916601, "epoch": 2.1933973927694494, "grad_norm": 0.15520605444908142, "learning_rate": 2.6889931609777043e-05, "loss": 0.4658, "mean_token_accuracy": 0.849860668182373, "num_tokens": 760847412.0, "step": 23840 }, { "entropy": 0.5464309435337782, "epoch": 2.1934893991408906, "grad_norm": 0.1702042520046234, "learning_rate": 2.6886864783635418e-05, "loss": 0.5354, "mean_token_accuracy": 0.8296872079372406, "num_tokens": 760879245.0, "step": 23841 }, { "entropy": 0.5097060045227408, "epoch": 2.1935814055123317, "grad_norm": 0.16050253808498383, "learning_rate": 2.688379795749379e-05, "loss": 0.4888, "mean_token_accuracy": 0.8447592072188854, "num_tokens": 760910473.0, "step": 23842 }, { "entropy": 0.5359865557402372, "epoch": 2.193673411883773, "grad_norm": 0.15880931913852692, "learning_rate": 2.6880731131352167e-05, "loss": 0.5212, "mean_token_accuracy": 0.8334648087620735, "num_tokens": 760943061.0, "step": 23843 }, { "entropy": 0.46295816358178854, "epoch": 2.193765418255214, "grad_norm": 0.1523503214120865, "learning_rate": 2.6877664305210538e-05, "loss": 0.4518, "mean_token_accuracy": 0.8562530837953091, "num_tokens": 760975686.0, "step": 23844 }, { "entropy": 0.41816407069563866, "epoch": 2.1938574246266556, "grad_norm": 0.14919306337833405, "learning_rate": 2.6874597479068913e-05, "loss": 0.4026, "mean_token_accuracy": 0.8706895224750042, "num_tokens": 761007805.0, "step": 23845 }, { "entropy": 0.414823554456234, "epoch": 2.1939494309980967, "grad_norm": 0.1452331393957138, "learning_rate": 2.6871530652927284e-05, "loss": 0.4107, "mean_token_accuracy": 0.8696855194866657, "num_tokens": 761040542.0, "step": 23846 }, { "entropy": 0.5308820819482207, "epoch": 2.194041437369538, "grad_norm": 0.15893562138080597, "learning_rate": 2.6868463826785662e-05, "loss": 0.5199, "mean_token_accuracy": 0.8342249244451523, "num_tokens": 761072547.0, "step": 23847 }, { "entropy": 0.523789837025106, "epoch": 2.194133443740979, "grad_norm": 0.16097860038280487, "learning_rate": 2.6865397000644033e-05, "loss": 0.5182, "mean_token_accuracy": 0.8347685821354389, "num_tokens": 761104749.0, "step": 23848 }, { "entropy": 0.5926093519665301, "epoch": 2.19422545011242, "grad_norm": 0.1728430688381195, "learning_rate": 2.6862330174502408e-05, "loss": 0.5952, "mean_token_accuracy": 0.8169688582420349, "num_tokens": 761137200.0, "step": 23849 }, { "entropy": 0.5218187049031258, "epoch": 2.1943174564838617, "grad_norm": 0.16457179188728333, "learning_rate": 2.685926334836078e-05, "loss": 0.5132, "mean_token_accuracy": 0.8346878923475742, "num_tokens": 761169410.0, "step": 23850 }, { "entropy": 0.48994527477771044, "epoch": 2.194409462855303, "grad_norm": 0.15739598870277405, "learning_rate": 2.6856196522219157e-05, "loss": 0.4828, "mean_token_accuracy": 0.8452988639473915, "num_tokens": 761201983.0, "step": 23851 }, { "entropy": 0.47110319836065173, "epoch": 2.194501469226744, "grad_norm": 0.15655402839183807, "learning_rate": 2.685312969607753e-05, "loss": 0.4563, "mean_token_accuracy": 0.8560862988233566, "num_tokens": 761233198.0, "step": 23852 }, { "entropy": 0.4632733450271189, "epoch": 2.194593475598185, "grad_norm": 0.15316885709762573, "learning_rate": 2.6850062869935903e-05, "loss": 0.4499, "mean_token_accuracy": 0.853406984359026, "num_tokens": 761265235.0, "step": 23853 }, { "entropy": 0.4958559339866042, "epoch": 2.194685481969626, "grad_norm": 0.1540669947862625, "learning_rate": 2.684699604379428e-05, "loss": 0.477, "mean_token_accuracy": 0.8519904837012291, "num_tokens": 761297046.0, "step": 23854 }, { "entropy": 0.6204333212226629, "epoch": 2.194777488341068, "grad_norm": 0.174019455909729, "learning_rate": 2.6843929217652653e-05, "loss": 0.5851, "mean_token_accuracy": 0.8145680725574493, "num_tokens": 761328455.0, "step": 23855 }, { "entropy": 0.4414678995963186, "epoch": 2.194869494712509, "grad_norm": 0.14863085746765137, "learning_rate": 2.684086239151103e-05, "loss": 0.425, "mean_token_accuracy": 0.8631187528371811, "num_tokens": 761360838.0, "step": 23856 }, { "entropy": 0.5118047120049596, "epoch": 2.19496150108395, "grad_norm": 0.1559344381093979, "learning_rate": 2.68377955653694e-05, "loss": 0.4937, "mean_token_accuracy": 0.8425546735525131, "num_tokens": 761392984.0, "step": 23857 }, { "entropy": 0.4862797064706683, "epoch": 2.195053507455391, "grad_norm": 0.15256869792938232, "learning_rate": 2.6834728739227777e-05, "loss": 0.4755, "mean_token_accuracy": 0.8500564247369766, "num_tokens": 761425432.0, "step": 23858 }, { "entropy": 0.5376795576885343, "epoch": 2.1951455138268323, "grad_norm": 0.1636016070842743, "learning_rate": 2.6831661913086148e-05, "loss": 0.5288, "mean_token_accuracy": 0.8339269272983074, "num_tokens": 761457413.0, "step": 23859 }, { "entropy": 0.4756336407735944, "epoch": 2.195237520198274, "grad_norm": 0.15115591883659363, "learning_rate": 2.6828595086944526e-05, "loss": 0.4584, "mean_token_accuracy": 0.8497894406318665, "num_tokens": 761488690.0, "step": 23860 }, { "entropy": 0.6548992209136486, "epoch": 2.195329526569715, "grad_norm": 0.17501308023929596, "learning_rate": 2.6825528260802897e-05, "loss": 0.642, "mean_token_accuracy": 0.7963238134980202, "num_tokens": 761521040.0, "step": 23861 }, { "entropy": 0.6228053513914347, "epoch": 2.195421532941156, "grad_norm": 0.17163200676441193, "learning_rate": 2.6822461434661272e-05, "loss": 0.6147, "mean_token_accuracy": 0.8079055696725845, "num_tokens": 761553507.0, "step": 23862 }, { "entropy": 0.49400899559259415, "epoch": 2.1955135393125973, "grad_norm": 0.16400010883808136, "learning_rate": 2.6819394608519643e-05, "loss": 0.4928, "mean_token_accuracy": 0.8448725193738937, "num_tokens": 761585316.0, "step": 23863 }, { "entropy": 0.5198334637098014, "epoch": 2.1956055456840384, "grad_norm": 0.16318215429782867, "learning_rate": 2.681632778237802e-05, "loss": 0.5007, "mean_token_accuracy": 0.8394715636968613, "num_tokens": 761617372.0, "step": 23864 }, { "entropy": 0.5139255747199059, "epoch": 2.19569755205548, "grad_norm": 0.15948408842086792, "learning_rate": 2.6813260956236392e-05, "loss": 0.5007, "mean_token_accuracy": 0.8423855938017368, "num_tokens": 761649122.0, "step": 23865 }, { "entropy": 0.5333412932232022, "epoch": 2.195789558426921, "grad_norm": 0.16458731889724731, "learning_rate": 2.6810194130094767e-05, "loss": 0.5303, "mean_token_accuracy": 0.8305684365332127, "num_tokens": 761680909.0, "step": 23866 }, { "entropy": 0.4973894264549017, "epoch": 2.1958815647983623, "grad_norm": 0.15860086679458618, "learning_rate": 2.6807127303953138e-05, "loss": 0.485, "mean_token_accuracy": 0.844017818570137, "num_tokens": 761713121.0, "step": 23867 }, { "entropy": 0.5426563906949013, "epoch": 2.1959735711698034, "grad_norm": 0.1647251844406128, "learning_rate": 2.6804060477811516e-05, "loss": 0.5268, "mean_token_accuracy": 0.8356899917125702, "num_tokens": 761744504.0, "step": 23868 }, { "entropy": 0.5566534176468849, "epoch": 2.1960655775412445, "grad_norm": 0.16485296189785004, "learning_rate": 2.6800993651669888e-05, "loss": 0.5501, "mean_token_accuracy": 0.8278569839894772, "num_tokens": 761776790.0, "step": 23869 }, { "entropy": 0.5174671830609441, "epoch": 2.196157583912686, "grad_norm": 0.1632506102323532, "learning_rate": 2.6797926825528262e-05, "loss": 0.5057, "mean_token_accuracy": 0.8394206464290619, "num_tokens": 761808919.0, "step": 23870 }, { "entropy": 0.5077793067321181, "epoch": 2.1962495902841273, "grad_norm": 0.16226962208747864, "learning_rate": 2.6794859999386633e-05, "loss": 0.4867, "mean_token_accuracy": 0.8453873917460442, "num_tokens": 761840675.0, "step": 23871 }, { "entropy": 0.5280186019372195, "epoch": 2.1963415966555684, "grad_norm": 0.16102856397628784, "learning_rate": 2.679179317324501e-05, "loss": 0.5082, "mean_token_accuracy": 0.839551292359829, "num_tokens": 761872435.0, "step": 23872 }, { "entropy": 0.6251271329820156, "epoch": 2.1964336030270095, "grad_norm": 0.17130516469478607, "learning_rate": 2.6788726347103383e-05, "loss": 0.6098, "mean_token_accuracy": 0.8086183145642281, "num_tokens": 761904998.0, "step": 23873 }, { "entropy": 0.524519762955606, "epoch": 2.1965256093984507, "grad_norm": 0.16186025738716125, "learning_rate": 2.6785659520961757e-05, "loss": 0.5061, "mean_token_accuracy": 0.8335610739886761, "num_tokens": 761937061.0, "step": 23874 }, { "entropy": 0.5726151447743177, "epoch": 2.1966176157698922, "grad_norm": 0.16412532329559326, "learning_rate": 2.678259269482013e-05, "loss": 0.5553, "mean_token_accuracy": 0.8271565958857536, "num_tokens": 761969389.0, "step": 23875 }, { "entropy": 0.5088929338380694, "epoch": 2.1967096221413334, "grad_norm": 0.16132007539272308, "learning_rate": 2.6779525868678507e-05, "loss": 0.4909, "mean_token_accuracy": 0.8433825634419918, "num_tokens": 762001883.0, "step": 23876 }, { "entropy": 0.57261170912534, "epoch": 2.1968016285127745, "grad_norm": 0.1681133657693863, "learning_rate": 2.6776459042536878e-05, "loss": 0.5623, "mean_token_accuracy": 0.8221142627298832, "num_tokens": 762033233.0, "step": 23877 }, { "entropy": 0.5485435910522938, "epoch": 2.1968936348842156, "grad_norm": 0.163797065615654, "learning_rate": 2.6773392216395256e-05, "loss": 0.5269, "mean_token_accuracy": 0.833943534642458, "num_tokens": 762065339.0, "step": 23878 }, { "entropy": 0.5073887938633561, "epoch": 2.1969856412556568, "grad_norm": 0.1620606631040573, "learning_rate": 2.6770325390253624e-05, "loss": 0.4964, "mean_token_accuracy": 0.8434332832694054, "num_tokens": 762097512.0, "step": 23879 }, { "entropy": 0.4191779689863324, "epoch": 2.1970776476270983, "grad_norm": 0.15407699346542358, "learning_rate": 2.6767258564112002e-05, "loss": 0.4081, "mean_token_accuracy": 0.8710489645600319, "num_tokens": 762128628.0, "step": 23880 }, { "entropy": 0.4899896909482777, "epoch": 2.1971696539985395, "grad_norm": 0.1604280024766922, "learning_rate": 2.6764191737970373e-05, "loss": 0.4827, "mean_token_accuracy": 0.8500471115112305, "num_tokens": 762160814.0, "step": 23881 }, { "entropy": 0.5154887409880757, "epoch": 2.1972616603699806, "grad_norm": 0.16071002185344696, "learning_rate": 2.676112491182875e-05, "loss": 0.506, "mean_token_accuracy": 0.8373332768678665, "num_tokens": 762193426.0, "step": 23882 }, { "entropy": 0.5200560146477073, "epoch": 2.1973536667414217, "grad_norm": 0.16442076861858368, "learning_rate": 2.6758058085687122e-05, "loss": 0.5012, "mean_token_accuracy": 0.8424103930592537, "num_tokens": 762224528.0, "step": 23883 }, { "entropy": 0.5619708215817809, "epoch": 2.197445673112863, "grad_norm": 0.16523340344429016, "learning_rate": 2.6754991259545497e-05, "loss": 0.5508, "mean_token_accuracy": 0.8242597579956055, "num_tokens": 762255990.0, "step": 23884 }, { "entropy": 0.5185626614838839, "epoch": 2.1975376794843045, "grad_norm": 0.16037997603416443, "learning_rate": 2.6751924433403875e-05, "loss": 0.5048, "mean_token_accuracy": 0.8366673141717911, "num_tokens": 762288403.0, "step": 23885 }, { "entropy": 0.5906682247295976, "epoch": 2.1976296858557456, "grad_norm": 0.16833089292049408, "learning_rate": 2.6748857607262246e-05, "loss": 0.5799, "mean_token_accuracy": 0.8184047043323517, "num_tokens": 762320539.0, "step": 23886 }, { "entropy": 0.4870938416570425, "epoch": 2.1977216922271867, "grad_norm": 0.1546534299850464, "learning_rate": 2.674579078112062e-05, "loss": 0.4695, "mean_token_accuracy": 0.8503160141408443, "num_tokens": 762352623.0, "step": 23887 }, { "entropy": 0.5661062318831682, "epoch": 2.197813698598628, "grad_norm": 0.1625399887561798, "learning_rate": 2.6742723954978992e-05, "loss": 0.5402, "mean_token_accuracy": 0.8295792788267136, "num_tokens": 762384459.0, "step": 23888 }, { "entropy": 0.5174448592588305, "epoch": 2.197905704970069, "grad_norm": 0.15953534841537476, "learning_rate": 2.673965712883737e-05, "loss": 0.5089, "mean_token_accuracy": 0.8388465531170368, "num_tokens": 762417151.0, "step": 23889 }, { "entropy": 0.5060747554525733, "epoch": 2.1979977113415106, "grad_norm": 0.1666906476020813, "learning_rate": 2.673659030269574e-05, "loss": 0.5022, "mean_token_accuracy": 0.8426966853439808, "num_tokens": 762448470.0, "step": 23890 }, { "entropy": 0.5088634905405343, "epoch": 2.1980897177129517, "grad_norm": 0.16008727252483368, "learning_rate": 2.6733523476554116e-05, "loss": 0.4886, "mean_token_accuracy": 0.8445515111088753, "num_tokens": 762480682.0, "step": 23891 }, { "entropy": 0.5725460685789585, "epoch": 2.198181724084393, "grad_norm": 0.16455329954624176, "learning_rate": 2.6730456650412487e-05, "loss": 0.5625, "mean_token_accuracy": 0.8204195499420166, "num_tokens": 762512647.0, "step": 23892 }, { "entropy": 0.5988190863281488, "epoch": 2.198273730455834, "grad_norm": 0.16629591584205627, "learning_rate": 2.6727389824270866e-05, "loss": 0.5801, "mean_token_accuracy": 0.8144536800682545, "num_tokens": 762544845.0, "step": 23893 }, { "entropy": 0.514699381776154, "epoch": 2.198365736827275, "grad_norm": 0.15556223690509796, "learning_rate": 2.6724322998129237e-05, "loss": 0.5049, "mean_token_accuracy": 0.8434582874178886, "num_tokens": 762576830.0, "step": 23894 }, { "entropy": 0.5009180130437016, "epoch": 2.1984577431987167, "grad_norm": 0.15802831947803497, "learning_rate": 2.672125617198761e-05, "loss": 0.4898, "mean_token_accuracy": 0.8428050838410854, "num_tokens": 762609185.0, "step": 23895 }, { "entropy": 0.511470252647996, "epoch": 2.198549749570158, "grad_norm": 0.16059549152851105, "learning_rate": 2.6718189345845983e-05, "loss": 0.501, "mean_token_accuracy": 0.8392354175448418, "num_tokens": 762640998.0, "step": 23896 }, { "entropy": 0.5625744517892599, "epoch": 2.198641755941599, "grad_norm": 0.1707785278558731, "learning_rate": 2.671512251970436e-05, "loss": 0.5423, "mean_token_accuracy": 0.8288163915276527, "num_tokens": 762671638.0, "step": 23897 }, { "entropy": 0.5118923354893923, "epoch": 2.19873376231304, "grad_norm": 0.16253754496574402, "learning_rate": 2.6712055693562732e-05, "loss": 0.5083, "mean_token_accuracy": 0.8376931697130203, "num_tokens": 762703557.0, "step": 23898 }, { "entropy": 0.4462644997984171, "epoch": 2.198825768684481, "grad_norm": 0.1630004644393921, "learning_rate": 2.670898886742111e-05, "loss": 0.4247, "mean_token_accuracy": 0.8616640754044056, "num_tokens": 762734737.0, "step": 23899 }, { "entropy": 0.5374566707760096, "epoch": 2.198917775055923, "grad_norm": 0.15807585418224335, "learning_rate": 2.670592204127948e-05, "loss": 0.5226, "mean_token_accuracy": 0.8334488272666931, "num_tokens": 762766648.0, "step": 23900 }, { "entropy": 0.450707426876761, "epoch": 2.199009781427364, "grad_norm": 0.15249235928058624, "learning_rate": 2.6702855215137856e-05, "loss": 0.434, "mean_token_accuracy": 0.8595440723001957, "num_tokens": 762797857.0, "step": 23901 }, { "entropy": 0.5362517666071653, "epoch": 2.199101787798805, "grad_norm": 0.1631220430135727, "learning_rate": 2.6699788388996227e-05, "loss": 0.533, "mean_token_accuracy": 0.8340910114347935, "num_tokens": 762830289.0, "step": 23902 }, { "entropy": 0.42659678193740547, "epoch": 2.199193794170246, "grad_norm": 0.14866095781326294, "learning_rate": 2.6696721562854605e-05, "loss": 0.4156, "mean_token_accuracy": 0.869159284979105, "num_tokens": 762862360.0, "step": 23903 }, { "entropy": 0.5557638900354505, "epoch": 2.1992858005416873, "grad_norm": 0.17388896644115448, "learning_rate": 2.6693654736712976e-05, "loss": 0.5469, "mean_token_accuracy": 0.8271937742829323, "num_tokens": 762893477.0, "step": 23904 }, { "entropy": 0.556524976156652, "epoch": 2.199377806913129, "grad_norm": 0.1590351015329361, "learning_rate": 2.669058791057135e-05, "loss": 0.5375, "mean_token_accuracy": 0.8284084312617779, "num_tokens": 762925825.0, "step": 23905 }, { "entropy": 0.49678466469049454, "epoch": 2.19946981328457, "grad_norm": 0.1586136668920517, "learning_rate": 2.6687521084429722e-05, "loss": 0.4919, "mean_token_accuracy": 0.8442197218537331, "num_tokens": 762957902.0, "step": 23906 }, { "entropy": 0.5818054601550102, "epoch": 2.199561819656011, "grad_norm": 0.17020206153392792, "learning_rate": 2.66844542582881e-05, "loss": 0.5619, "mean_token_accuracy": 0.8249221406877041, "num_tokens": 762990175.0, "step": 23907 }, { "entropy": 0.55581618193537, "epoch": 2.1996538260274523, "grad_norm": 0.16133366525173187, "learning_rate": 2.668138743214647e-05, "loss": 0.5401, "mean_token_accuracy": 0.8312729336321354, "num_tokens": 763022537.0, "step": 23908 }, { "entropy": 0.5206970721483231, "epoch": 2.1997458323988934, "grad_norm": 0.15973475575447083, "learning_rate": 2.6678320606004846e-05, "loss": 0.5091, "mean_token_accuracy": 0.84162962064147, "num_tokens": 763054813.0, "step": 23909 }, { "entropy": 0.7162657994776964, "epoch": 2.199837838770335, "grad_norm": 0.1838168203830719, "learning_rate": 2.6675253779863218e-05, "loss": 0.692, "mean_token_accuracy": 0.7832848951220512, "num_tokens": 763086551.0, "step": 23910 }, { "entropy": 0.527633662102744, "epoch": 2.199929845141776, "grad_norm": 0.16136038303375244, "learning_rate": 2.6672186953721596e-05, "loss": 0.509, "mean_token_accuracy": 0.8349039070308208, "num_tokens": 763118482.0, "step": 23911 }, { "entropy": 0.444749849033542, "epoch": 2.2000218515132173, "grad_norm": 0.15326718986034393, "learning_rate": 2.6669120127579967e-05, "loss": 0.4206, "mean_token_accuracy": 0.8620240762829781, "num_tokens": 763150831.0, "step": 23912 }, { "entropy": 0.5400611627846956, "epoch": 2.2001138578846584, "grad_norm": 0.1656465083360672, "learning_rate": 2.666605330143834e-05, "loss": 0.5361, "mean_token_accuracy": 0.8311649262905121, "num_tokens": 763182613.0, "step": 23913 }, { "entropy": 0.4767199109774083, "epoch": 2.2002058642560995, "grad_norm": 0.15583904087543488, "learning_rate": 2.6662986475296713e-05, "loss": 0.4649, "mean_token_accuracy": 0.8539392836391926, "num_tokens": 763214147.0, "step": 23914 }, { "entropy": 0.4891490451991558, "epoch": 2.200297870627541, "grad_norm": 0.15329042077064514, "learning_rate": 2.665991964915509e-05, "loss": 0.4666, "mean_token_accuracy": 0.8502002023160458, "num_tokens": 763246682.0, "step": 23915 }, { "entropy": 0.518265746999532, "epoch": 2.2003898769989823, "grad_norm": 0.16100290417671204, "learning_rate": 2.665685282301347e-05, "loss": 0.5153, "mean_token_accuracy": 0.8397911414504051, "num_tokens": 763279110.0, "step": 23916 }, { "entropy": 0.4912858745083213, "epoch": 2.2004818833704234, "grad_norm": 0.15494999289512634, "learning_rate": 2.665378599687184e-05, "loss": 0.4836, "mean_token_accuracy": 0.8472531400620937, "num_tokens": 763310471.0, "step": 23917 }, { "entropy": 0.5667171312961727, "epoch": 2.2005738897418645, "grad_norm": 0.16204412281513214, "learning_rate": 2.6650719170730215e-05, "loss": 0.556, "mean_token_accuracy": 0.8282780051231384, "num_tokens": 763342872.0, "step": 23918 }, { "entropy": 0.47775177052244544, "epoch": 2.2006658961133057, "grad_norm": 0.16114436089992523, "learning_rate": 2.6647652344588586e-05, "loss": 0.4702, "mean_token_accuracy": 0.8494814150035381, "num_tokens": 763374470.0, "step": 23919 }, { "entropy": 0.4727697968482971, "epoch": 2.2007579024847472, "grad_norm": 0.16232417523860931, "learning_rate": 2.6644585518446964e-05, "loss": 0.4678, "mean_token_accuracy": 0.8532162383198738, "num_tokens": 763406117.0, "step": 23920 }, { "entropy": 0.5647092573344707, "epoch": 2.2008499088561884, "grad_norm": 0.16617697477340698, "learning_rate": 2.6641518692305335e-05, "loss": 0.5509, "mean_token_accuracy": 0.822596188634634, "num_tokens": 763437865.0, "step": 23921 }, { "entropy": 0.5425895480439067, "epoch": 2.2009419152276295, "grad_norm": 0.1618974506855011, "learning_rate": 2.663845186616371e-05, "loss": 0.5271, "mean_token_accuracy": 0.8319633714854717, "num_tokens": 763469254.0, "step": 23922 }, { "entropy": 0.618665736168623, "epoch": 2.2010339215990706, "grad_norm": 0.1710975617170334, "learning_rate": 2.663538504002208e-05, "loss": 0.6129, "mean_token_accuracy": 0.8110185377299786, "num_tokens": 763501579.0, "step": 23923 }, { "entropy": 0.5103622004389763, "epoch": 2.2011259279705118, "grad_norm": 0.16472594439983368, "learning_rate": 2.663231821388046e-05, "loss": 0.5035, "mean_token_accuracy": 0.8406838811933994, "num_tokens": 763532804.0, "step": 23924 }, { "entropy": 0.5852285670116544, "epoch": 2.2012179343419533, "grad_norm": 0.16992193460464478, "learning_rate": 2.662925138773883e-05, "loss": 0.5681, "mean_token_accuracy": 0.8219580352306366, "num_tokens": 763564401.0, "step": 23925 }, { "entropy": 0.5272074174135923, "epoch": 2.2013099407133945, "grad_norm": 0.16686852276325226, "learning_rate": 2.6626184561597205e-05, "loss": 0.5159, "mean_token_accuracy": 0.8348043672740459, "num_tokens": 763596236.0, "step": 23926 }, { "entropy": 0.5814924854785204, "epoch": 2.2014019470848356, "grad_norm": 0.1669013351202011, "learning_rate": 2.6623117735455576e-05, "loss": 0.5655, "mean_token_accuracy": 0.821118887513876, "num_tokens": 763628069.0, "step": 23927 }, { "entropy": 0.562896073795855, "epoch": 2.2014939534562767, "grad_norm": 0.16245561838150024, "learning_rate": 2.6620050909313954e-05, "loss": 0.5439, "mean_token_accuracy": 0.8258851021528244, "num_tokens": 763659730.0, "step": 23928 }, { "entropy": 0.49891030602157116, "epoch": 2.201585959827718, "grad_norm": 0.16121496260166168, "learning_rate": 2.6616984083172326e-05, "loss": 0.5036, "mean_token_accuracy": 0.8390556201338768, "num_tokens": 763691557.0, "step": 23929 }, { "entropy": 0.4872906804084778, "epoch": 2.2016779661991595, "grad_norm": 0.15652237832546234, "learning_rate": 2.66139172570307e-05, "loss": 0.477, "mean_token_accuracy": 0.8477944284677505, "num_tokens": 763723506.0, "step": 23930 }, { "entropy": 0.5306161171756685, "epoch": 2.2017699725706006, "grad_norm": 0.16478799283504486, "learning_rate": 2.661085043088907e-05, "loss": 0.516, "mean_token_accuracy": 0.8370342776179314, "num_tokens": 763755497.0, "step": 23931 }, { "entropy": 0.43972060456871986, "epoch": 2.2018619789420417, "grad_norm": 0.15708491206169128, "learning_rate": 2.660778360474745e-05, "loss": 0.4183, "mean_token_accuracy": 0.8633726686239243, "num_tokens": 763786954.0, "step": 23932 }, { "entropy": 0.572416833601892, "epoch": 2.201953985313483, "grad_norm": 0.1649593561887741, "learning_rate": 2.660471677860582e-05, "loss": 0.5584, "mean_token_accuracy": 0.8268798552453518, "num_tokens": 763819145.0, "step": 23933 }, { "entropy": 0.6032143402844667, "epoch": 2.202045991684924, "grad_norm": 0.1692012995481491, "learning_rate": 2.6601649952464196e-05, "loss": 0.5912, "mean_token_accuracy": 0.8137346468865871, "num_tokens": 763851004.0, "step": 23934 }, { "entropy": 0.6101683676242828, "epoch": 2.2021379980563656, "grad_norm": 0.1689339280128479, "learning_rate": 2.6598583126322567e-05, "loss": 0.5981, "mean_token_accuracy": 0.8161579482257366, "num_tokens": 763883536.0, "step": 23935 }, { "entropy": 0.5444315392524004, "epoch": 2.2022300044278067, "grad_norm": 0.16083446145057678, "learning_rate": 2.6595516300180945e-05, "loss": 0.5332, "mean_token_accuracy": 0.834735207259655, "num_tokens": 763915418.0, "step": 23936 }, { "entropy": 0.6021169815212488, "epoch": 2.202322010799248, "grad_norm": 0.16972903907299042, "learning_rate": 2.6592449474039316e-05, "loss": 0.5889, "mean_token_accuracy": 0.8146600984036922, "num_tokens": 763947388.0, "step": 23937 }, { "entropy": 0.5807130998000503, "epoch": 2.202414017170689, "grad_norm": 0.17059025168418884, "learning_rate": 2.6589382647897694e-05, "loss": 0.5716, "mean_token_accuracy": 0.8196711838245392, "num_tokens": 763978728.0, "step": 23938 }, { "entropy": 0.5204531662166119, "epoch": 2.20250602354213, "grad_norm": 0.15295737981796265, "learning_rate": 2.6586315821756065e-05, "loss": 0.5008, "mean_token_accuracy": 0.8423162512481213, "num_tokens": 764010956.0, "step": 23939 }, { "entropy": 0.4803571356460452, "epoch": 2.2025980299135717, "grad_norm": 0.1576010286808014, "learning_rate": 2.658324899561444e-05, "loss": 0.459, "mean_token_accuracy": 0.8552361726760864, "num_tokens": 764042795.0, "step": 23940 }, { "entropy": 0.5886522065848112, "epoch": 2.202690036285013, "grad_norm": 0.1711193472146988, "learning_rate": 2.658018216947281e-05, "loss": 0.5765, "mean_token_accuracy": 0.8222906067967415, "num_tokens": 764074277.0, "step": 23941 }, { "entropy": 0.5970562603324652, "epoch": 2.202782042656454, "grad_norm": 0.17231369018554688, "learning_rate": 2.657711534333119e-05, "loss": 0.5912, "mean_token_accuracy": 0.8128959015011787, "num_tokens": 764104745.0, "step": 23942 }, { "entropy": 0.5261580310761929, "epoch": 2.202874049027895, "grad_norm": 0.16394658386707306, "learning_rate": 2.657404851718956e-05, "loss": 0.5133, "mean_token_accuracy": 0.8388221971690655, "num_tokens": 764136715.0, "step": 23943 }, { "entropy": 0.5508918222039938, "epoch": 2.202966055399336, "grad_norm": 0.16913574934005737, "learning_rate": 2.6570981691047935e-05, "loss": 0.5434, "mean_token_accuracy": 0.8286602273583412, "num_tokens": 764169090.0, "step": 23944 }, { "entropy": 0.5544403516687453, "epoch": 2.203058061770778, "grad_norm": 0.16548798978328705, "learning_rate": 2.6567914864906307e-05, "loss": 0.5428, "mean_token_accuracy": 0.8301277682185173, "num_tokens": 764200946.0, "step": 23945 }, { "entropy": 0.5053687272593379, "epoch": 2.203150068142219, "grad_norm": 0.16305659711360931, "learning_rate": 2.6564848038764685e-05, "loss": 0.4884, "mean_token_accuracy": 0.8418848253786564, "num_tokens": 764232615.0, "step": 23946 }, { "entropy": 0.5848883632570505, "epoch": 2.20324207451366, "grad_norm": 0.16821731626987457, "learning_rate": 2.656178121262306e-05, "loss": 0.5615, "mean_token_accuracy": 0.8217972815036774, "num_tokens": 764263510.0, "step": 23947 }, { "entropy": 0.5273492205888033, "epoch": 2.203334080885101, "grad_norm": 0.15823791921138763, "learning_rate": 2.655871438648143e-05, "loss": 0.5122, "mean_token_accuracy": 0.8405602499842644, "num_tokens": 764295590.0, "step": 23948 }, { "entropy": 0.5648670317605138, "epoch": 2.2034260872565423, "grad_norm": 0.16587208211421967, "learning_rate": 2.655564756033981e-05, "loss": 0.559, "mean_token_accuracy": 0.8235930129885674, "num_tokens": 764327416.0, "step": 23949 }, { "entropy": 0.5772586259990931, "epoch": 2.203518093627984, "grad_norm": 0.1652827113866806, "learning_rate": 2.655258073419818e-05, "loss": 0.5736, "mean_token_accuracy": 0.8208182938396931, "num_tokens": 764359525.0, "step": 23950 }, { "entropy": 0.5854279845952988, "epoch": 2.203610099999425, "grad_norm": 0.1688268482685089, "learning_rate": 2.6549513908056554e-05, "loss": 0.5654, "mean_token_accuracy": 0.8184000179171562, "num_tokens": 764390729.0, "step": 23951 }, { "entropy": 0.562949325889349, "epoch": 2.203702106370866, "grad_norm": 0.17031051218509674, "learning_rate": 2.6546447081914926e-05, "loss": 0.5453, "mean_token_accuracy": 0.829937506467104, "num_tokens": 764422121.0, "step": 23952 }, { "entropy": 0.45465375669300556, "epoch": 2.2037941127423073, "grad_norm": 0.1521497368812561, "learning_rate": 2.6543380255773304e-05, "loss": 0.4265, "mean_token_accuracy": 0.8595958612859249, "num_tokens": 764452898.0, "step": 23953 }, { "entropy": 0.5852860864251852, "epoch": 2.2038861191137484, "grad_norm": 0.16529709100723267, "learning_rate": 2.6540313429631675e-05, "loss": 0.565, "mean_token_accuracy": 0.8235778249800205, "num_tokens": 764485139.0, "step": 23954 }, { "entropy": 0.4771058149635792, "epoch": 2.20397812548519, "grad_norm": 0.153773233294487, "learning_rate": 2.6537246603490053e-05, "loss": 0.4654, "mean_token_accuracy": 0.8516406305134296, "num_tokens": 764517148.0, "step": 23955 }, { "entropy": 0.5097680049948394, "epoch": 2.204070131856631, "grad_norm": 0.15332327783107758, "learning_rate": 2.653417977734842e-05, "loss": 0.4865, "mean_token_accuracy": 0.8446888662874699, "num_tokens": 764549310.0, "step": 23956 }, { "entropy": 0.42364570731297135, "epoch": 2.2041621382280723, "grad_norm": 0.149727463722229, "learning_rate": 2.65311129512068e-05, "loss": 0.4104, "mean_token_accuracy": 0.8679227381944656, "num_tokens": 764581425.0, "step": 23957 }, { "entropy": 0.4483633217168972, "epoch": 2.2042541445995134, "grad_norm": 0.1544465720653534, "learning_rate": 2.652804612506517e-05, "loss": 0.4411, "mean_token_accuracy": 0.864039234817028, "num_tokens": 764613894.0, "step": 23958 }, { "entropy": 0.4533162140287459, "epoch": 2.2043461509709545, "grad_norm": 0.1518765687942505, "learning_rate": 2.6524979298923548e-05, "loss": 0.4402, "mean_token_accuracy": 0.8602524399757385, "num_tokens": 764645786.0, "step": 23959 }, { "entropy": 0.5654987208545208, "epoch": 2.204438157342396, "grad_norm": 0.17083704471588135, "learning_rate": 2.652191247278192e-05, "loss": 0.5589, "mean_token_accuracy": 0.8216442130506039, "num_tokens": 764677723.0, "step": 23960 }, { "entropy": 0.5567329805344343, "epoch": 2.2045301637138373, "grad_norm": 0.16560840606689453, "learning_rate": 2.6518845646640294e-05, "loss": 0.5393, "mean_token_accuracy": 0.8321106657385826, "num_tokens": 764709579.0, "step": 23961 }, { "entropy": 0.45920155360363424, "epoch": 2.2046221700852784, "grad_norm": 0.1559060961008072, "learning_rate": 2.6515778820498665e-05, "loss": 0.4343, "mean_token_accuracy": 0.8571662679314613, "num_tokens": 764740770.0, "step": 23962 }, { "entropy": 0.43208590941503644, "epoch": 2.2047141764567195, "grad_norm": 0.15608006715774536, "learning_rate": 2.6512711994357043e-05, "loss": 0.4264, "mean_token_accuracy": 0.8672691136598587, "num_tokens": 764772688.0, "step": 23963 }, { "entropy": 0.5136819817125797, "epoch": 2.2048061828281607, "grad_norm": 0.15905331075191498, "learning_rate": 2.6509645168215415e-05, "loss": 0.5061, "mean_token_accuracy": 0.8392887338995934, "num_tokens": 764804889.0, "step": 23964 }, { "entropy": 0.6028735786676407, "epoch": 2.2048981891996022, "grad_norm": 0.16995371878147125, "learning_rate": 2.650657834207379e-05, "loss": 0.6035, "mean_token_accuracy": 0.8097134083509445, "num_tokens": 764836963.0, "step": 23965 }, { "entropy": 0.48672191333025694, "epoch": 2.2049901955710434, "grad_norm": 0.15958307683467865, "learning_rate": 2.650351151593216e-05, "loss": 0.4749, "mean_token_accuracy": 0.8476593904197216, "num_tokens": 764868612.0, "step": 23966 }, { "entropy": 0.4799659373238683, "epoch": 2.2050822019424845, "grad_norm": 0.16033105552196503, "learning_rate": 2.650044468979054e-05, "loss": 0.4732, "mean_token_accuracy": 0.8535904511809349, "num_tokens": 764899732.0, "step": 23967 }, { "entropy": 0.5242319600656629, "epoch": 2.2051742083139256, "grad_norm": 0.16019481420516968, "learning_rate": 2.649737786364891e-05, "loss": 0.5108, "mean_token_accuracy": 0.836856085807085, "num_tokens": 764931421.0, "step": 23968 }, { "entropy": 0.5513105038553476, "epoch": 2.2052662146853668, "grad_norm": 0.1662873923778534, "learning_rate": 2.6494311037507285e-05, "loss": 0.5359, "mean_token_accuracy": 0.8286644034087658, "num_tokens": 764963168.0, "step": 23969 }, { "entropy": 0.5335994530469179, "epoch": 2.2053582210568083, "grad_norm": 0.1656167358160019, "learning_rate": 2.6491244211365656e-05, "loss": 0.5118, "mean_token_accuracy": 0.8346931077539921, "num_tokens": 764994064.0, "step": 23970 }, { "entropy": 0.465512472204864, "epoch": 2.2054502274282495, "grad_norm": 0.15478602051734924, "learning_rate": 2.6488177385224034e-05, "loss": 0.4486, "mean_token_accuracy": 0.8558158539235592, "num_tokens": 765026187.0, "step": 23971 }, { "entropy": 0.5632661283016205, "epoch": 2.2055422337996906, "grad_norm": 0.16487561166286469, "learning_rate": 2.6485110559082405e-05, "loss": 0.5561, "mean_token_accuracy": 0.8245341069996357, "num_tokens": 765058211.0, "step": 23972 }, { "entropy": 0.5019720112904906, "epoch": 2.2056342401711317, "grad_norm": 0.15683336555957794, "learning_rate": 2.648204373294078e-05, "loss": 0.4827, "mean_token_accuracy": 0.8448794335126877, "num_tokens": 765089735.0, "step": 23973 }, { "entropy": 0.5615366455167532, "epoch": 2.205726246542573, "grad_norm": 0.1638963222503662, "learning_rate": 2.647897690679915e-05, "loss": 0.5393, "mean_token_accuracy": 0.8295859284698963, "num_tokens": 765121926.0, "step": 23974 }, { "entropy": 0.5336444722488523, "epoch": 2.2058182529140145, "grad_norm": 0.164345383644104, "learning_rate": 2.647591008065753e-05, "loss": 0.5151, "mean_token_accuracy": 0.8360786326229572, "num_tokens": 765154021.0, "step": 23975 }, { "entropy": 0.5615490637719631, "epoch": 2.2059102592854556, "grad_norm": 0.1597108393907547, "learning_rate": 2.6472843254515907e-05, "loss": 0.548, "mean_token_accuracy": 0.8275507651269436, "num_tokens": 765185989.0, "step": 23976 }, { "entropy": 0.5768921477720141, "epoch": 2.2060022656568967, "grad_norm": 0.16978813707828522, "learning_rate": 2.6469776428374278e-05, "loss": 0.5609, "mean_token_accuracy": 0.8230589404702187, "num_tokens": 765217337.0, "step": 23977 }, { "entropy": 0.4558490440249443, "epoch": 2.206094272028338, "grad_norm": 0.1494910567998886, "learning_rate": 2.6466709602232653e-05, "loss": 0.4463, "mean_token_accuracy": 0.8581074178218842, "num_tokens": 765249599.0, "step": 23978 }, { "entropy": 0.515255355508998, "epoch": 2.206186278399779, "grad_norm": 0.1569434404373169, "learning_rate": 2.6463642776091024e-05, "loss": 0.5083, "mean_token_accuracy": 0.8389475382864475, "num_tokens": 765281775.0, "step": 23979 }, { "entropy": 0.54369224794209, "epoch": 2.2062782847712206, "grad_norm": 0.16864365339279175, "learning_rate": 2.6460575949949402e-05, "loss": 0.5272, "mean_token_accuracy": 0.8330983221530914, "num_tokens": 765313509.0, "step": 23980 }, { "entropy": 0.5298580916132778, "epoch": 2.2063702911426617, "grad_norm": 0.16364848613739014, "learning_rate": 2.6457509123807774e-05, "loss": 0.5182, "mean_token_accuracy": 0.8369169868528843, "num_tokens": 765345256.0, "step": 23981 }, { "entropy": 0.5910944864153862, "epoch": 2.206462297514103, "grad_norm": 0.1686873435974121, "learning_rate": 2.6454442297666148e-05, "loss": 0.5918, "mean_token_accuracy": 0.8125168345868587, "num_tokens": 765377634.0, "step": 23982 }, { "entropy": 0.4699786650016904, "epoch": 2.206554303885544, "grad_norm": 0.16271041333675385, "learning_rate": 2.645137547152452e-05, "loss": 0.4604, "mean_token_accuracy": 0.8542009703814983, "num_tokens": 765409283.0, "step": 23983 }, { "entropy": 0.4875414287671447, "epoch": 2.206646310256985, "grad_norm": 0.15592241287231445, "learning_rate": 2.6448308645382897e-05, "loss": 0.4769, "mean_token_accuracy": 0.8494719602167606, "num_tokens": 765441131.0, "step": 23984 }, { "entropy": 0.5107776448130608, "epoch": 2.2067383166284267, "grad_norm": 0.15358436107635498, "learning_rate": 2.644524181924127e-05, "loss": 0.4944, "mean_token_accuracy": 0.8430284969508648, "num_tokens": 765473609.0, "step": 23985 }, { "entropy": 0.5104899303987622, "epoch": 2.206830322999868, "grad_norm": 0.15376712381839752, "learning_rate": 2.6442174993099643e-05, "loss": 0.4957, "mean_token_accuracy": 0.8415204994380474, "num_tokens": 765505836.0, "step": 23986 }, { "entropy": 0.5676135281100869, "epoch": 2.206922329371309, "grad_norm": 0.17077681422233582, "learning_rate": 2.6439108166958015e-05, "loss": 0.5576, "mean_token_accuracy": 0.8245835117995739, "num_tokens": 765537673.0, "step": 23987 }, { "entropy": 0.5258929450064898, "epoch": 2.20701433574275, "grad_norm": 0.16340123116970062, "learning_rate": 2.6436041340816393e-05, "loss": 0.519, "mean_token_accuracy": 0.8344720900058746, "num_tokens": 765569307.0, "step": 23988 }, { "entropy": 0.5771164931356907, "epoch": 2.207106342114191, "grad_norm": 0.16782891750335693, "learning_rate": 2.6432974514674764e-05, "loss": 0.5663, "mean_token_accuracy": 0.8231719397008419, "num_tokens": 765601591.0, "step": 23989 }, { "entropy": 0.5906593706458807, "epoch": 2.207198348485633, "grad_norm": 0.16488218307495117, "learning_rate": 2.642990768853314e-05, "loss": 0.5679, "mean_token_accuracy": 0.8244653642177582, "num_tokens": 765633729.0, "step": 23990 }, { "entropy": 0.5455995248630643, "epoch": 2.207290354857074, "grad_norm": 0.16211414337158203, "learning_rate": 2.642684086239151e-05, "loss": 0.5357, "mean_token_accuracy": 0.8312725648283958, "num_tokens": 765666247.0, "step": 23991 }, { "entropy": 0.5599164823070168, "epoch": 2.207382361228515, "grad_norm": 0.16332457959651947, "learning_rate": 2.6423774036249888e-05, "loss": 0.5528, "mean_token_accuracy": 0.8257576636970043, "num_tokens": 765697775.0, "step": 23992 }, { "entropy": 0.6077757123857737, "epoch": 2.207474367599956, "grad_norm": 0.1721692532300949, "learning_rate": 2.642070721010826e-05, "loss": 0.5978, "mean_token_accuracy": 0.813025064766407, "num_tokens": 765729140.0, "step": 23993 }, { "entropy": 0.49618340376764536, "epoch": 2.2075663739713973, "grad_norm": 0.15353308618068695, "learning_rate": 2.6417640383966634e-05, "loss": 0.4863, "mean_token_accuracy": 0.8452802933752537, "num_tokens": 765761760.0, "step": 23994 }, { "entropy": 0.46226145047694445, "epoch": 2.207658380342839, "grad_norm": 0.15009719133377075, "learning_rate": 2.6414573557825005e-05, "loss": 0.4485, "mean_token_accuracy": 0.8580060303211212, "num_tokens": 765794433.0, "step": 23995 }, { "entropy": 0.49155959114432335, "epoch": 2.20775038671428, "grad_norm": 0.1590820550918579, "learning_rate": 2.6411506731683383e-05, "loss": 0.4853, "mean_token_accuracy": 0.8498465940356255, "num_tokens": 765826707.0, "step": 23996 }, { "entropy": 0.5314888518769294, "epoch": 2.207842393085721, "grad_norm": 0.16655096411705017, "learning_rate": 2.6408439905541754e-05, "loss": 0.5217, "mean_token_accuracy": 0.8346432559192181, "num_tokens": 765858900.0, "step": 23997 }, { "entropy": 0.4881458142772317, "epoch": 2.2079343994571623, "grad_norm": 0.16165980696678162, "learning_rate": 2.6405373079400132e-05, "loss": 0.4804, "mean_token_accuracy": 0.8452674597501755, "num_tokens": 765890621.0, "step": 23998 }, { "entropy": 0.600182079244405, "epoch": 2.2080264058286034, "grad_norm": 0.1756221354007721, "learning_rate": 2.6402306253258504e-05, "loss": 0.5805, "mean_token_accuracy": 0.8165631592273712, "num_tokens": 765922578.0, "step": 23999 }, { "entropy": 0.5317483758553863, "epoch": 2.208118412200045, "grad_norm": 0.16364751756191254, "learning_rate": 2.6399239427116878e-05, "loss": 0.5219, "mean_token_accuracy": 0.8356156684458256, "num_tokens": 765954167.0, "step": 24000 }, { "entropy": 0.36891785194166005, "epoch": 2.208210418571486, "grad_norm": 0.1393590122461319, "learning_rate": 2.639617260097525e-05, "loss": 0.3523, "mean_token_accuracy": 0.8860837742686272, "num_tokens": 765986277.0, "step": 24001 }, { "entropy": 0.5384258171543479, "epoch": 2.2083024249429273, "grad_norm": 0.1675165295600891, "learning_rate": 2.6393105774833628e-05, "loss": 0.5227, "mean_token_accuracy": 0.8309107348322868, "num_tokens": 766017434.0, "step": 24002 }, { "entropy": 0.4380256317090243, "epoch": 2.2083944313143684, "grad_norm": 0.14572268724441528, "learning_rate": 2.6390038948692e-05, "loss": 0.4106, "mean_token_accuracy": 0.8700767420232296, "num_tokens": 766049357.0, "step": 24003 }, { "entropy": 0.49978202814236283, "epoch": 2.2084864376858095, "grad_norm": 0.15562298893928528, "learning_rate": 2.6386972122550373e-05, "loss": 0.4853, "mean_token_accuracy": 0.8456371836364269, "num_tokens": 766081313.0, "step": 24004 }, { "entropy": 0.600912207737565, "epoch": 2.208578444057251, "grad_norm": 0.16925887763500214, "learning_rate": 2.6383905296408745e-05, "loss": 0.5977, "mean_token_accuracy": 0.8079326637089252, "num_tokens": 766113139.0, "step": 24005 }, { "entropy": 0.5665336735546589, "epoch": 2.2086704504286923, "grad_norm": 0.16540034115314484, "learning_rate": 2.6380838470267123e-05, "loss": 0.545, "mean_token_accuracy": 0.8320765309035778, "num_tokens": 766144724.0, "step": 24006 }, { "entropy": 0.5072391647845507, "epoch": 2.2087624568001334, "grad_norm": 0.15450666844844818, "learning_rate": 2.6377771644125497e-05, "loss": 0.4887, "mean_token_accuracy": 0.8428581431508064, "num_tokens": 766176651.0, "step": 24007 }, { "entropy": 0.5103387013077736, "epoch": 2.2088544631715745, "grad_norm": 0.15476581454277039, "learning_rate": 2.637470481798387e-05, "loss": 0.4937, "mean_token_accuracy": 0.8417886048555374, "num_tokens": 766208804.0, "step": 24008 }, { "entropy": 0.5539711527526379, "epoch": 2.2089464695430157, "grad_norm": 0.1705973744392395, "learning_rate": 2.6371637991842247e-05, "loss": 0.5448, "mean_token_accuracy": 0.8228261321783066, "num_tokens": 766240411.0, "step": 24009 }, { "entropy": 0.5857567719649523, "epoch": 2.2090384759144572, "grad_norm": 0.1720418483018875, "learning_rate": 2.6368571165700618e-05, "loss": 0.5782, "mean_token_accuracy": 0.8193559423089027, "num_tokens": 766272550.0, "step": 24010 }, { "entropy": 0.5432122210040689, "epoch": 2.2091304822858984, "grad_norm": 0.1626383364200592, "learning_rate": 2.6365504339558993e-05, "loss": 0.5176, "mean_token_accuracy": 0.8330299369990826, "num_tokens": 766304062.0, "step": 24011 }, { "entropy": 0.5488332007080317, "epoch": 2.2092224886573395, "grad_norm": 0.16398142278194427, "learning_rate": 2.6362437513417364e-05, "loss": 0.5381, "mean_token_accuracy": 0.8294438868761063, "num_tokens": 766336431.0, "step": 24012 }, { "entropy": 0.5567692518234253, "epoch": 2.2093144950287806, "grad_norm": 0.16571888327598572, "learning_rate": 2.6359370687275742e-05, "loss": 0.5443, "mean_token_accuracy": 0.8304989486932755, "num_tokens": 766368621.0, "step": 24013 }, { "entropy": 0.4961389824748039, "epoch": 2.2094065014002218, "grad_norm": 0.1612730771303177, "learning_rate": 2.6356303861134113e-05, "loss": 0.4831, "mean_token_accuracy": 0.8472606390714645, "num_tokens": 766399962.0, "step": 24014 }, { "entropy": 0.5078646456822753, "epoch": 2.2094985077716633, "grad_norm": 0.15545666217803955, "learning_rate": 2.635323703499249e-05, "loss": 0.5042, "mean_token_accuracy": 0.8417026661336422, "num_tokens": 766431678.0, "step": 24015 }, { "entropy": 0.47606306429952383, "epoch": 2.2095905141431045, "grad_norm": 0.1533505916595459, "learning_rate": 2.635017020885086e-05, "loss": 0.4604, "mean_token_accuracy": 0.851064894348383, "num_tokens": 766464052.0, "step": 24016 }, { "entropy": 0.5527056446298957, "epoch": 2.2096825205145456, "grad_norm": 0.16247284412384033, "learning_rate": 2.6347103382709237e-05, "loss": 0.5333, "mean_token_accuracy": 0.8341569490730762, "num_tokens": 766495427.0, "step": 24017 }, { "entropy": 0.5685329944826663, "epoch": 2.2097745268859867, "grad_norm": 0.16034391522407532, "learning_rate": 2.634403655656761e-05, "loss": 0.5511, "mean_token_accuracy": 0.8258161768317223, "num_tokens": 766527551.0, "step": 24018 }, { "entropy": 0.5150396646931767, "epoch": 2.209866533257428, "grad_norm": 0.15768472850322723, "learning_rate": 2.6340969730425986e-05, "loss": 0.4967, "mean_token_accuracy": 0.8450462967157364, "num_tokens": 766559987.0, "step": 24019 }, { "entropy": 0.4948729551397264, "epoch": 2.2099585396288695, "grad_norm": 0.16389727592468262, "learning_rate": 2.6337902904284358e-05, "loss": 0.4876, "mean_token_accuracy": 0.8448190279304981, "num_tokens": 766592299.0, "step": 24020 }, { "entropy": 0.5510890800505877, "epoch": 2.2100505460003106, "grad_norm": 0.16484488546848297, "learning_rate": 2.6334836078142732e-05, "loss": 0.5383, "mean_token_accuracy": 0.8282687962055206, "num_tokens": 766624495.0, "step": 24021 }, { "entropy": 0.5893961284309626, "epoch": 2.2101425523717517, "grad_norm": 0.16874688863754272, "learning_rate": 2.6331769252001104e-05, "loss": 0.5773, "mean_token_accuracy": 0.8204452618956566, "num_tokens": 766656890.0, "step": 24022 }, { "entropy": 0.484337393194437, "epoch": 2.210234558743193, "grad_norm": 0.16068217158317566, "learning_rate": 2.632870242585948e-05, "loss": 0.4721, "mean_token_accuracy": 0.8488460630178452, "num_tokens": 766688480.0, "step": 24023 }, { "entropy": 0.4782763598486781, "epoch": 2.210326565114634, "grad_norm": 0.16014021635055542, "learning_rate": 2.6325635599717853e-05, "loss": 0.4601, "mean_token_accuracy": 0.8506838269531727, "num_tokens": 766720106.0, "step": 24024 }, { "entropy": 0.5352312009781599, "epoch": 2.2104185714860756, "grad_norm": 0.16480456292629242, "learning_rate": 2.6322568773576228e-05, "loss": 0.5319, "mean_token_accuracy": 0.8301126286387444, "num_tokens": 766752370.0, "step": 24025 }, { "entropy": 0.557702730409801, "epoch": 2.2105105778575167, "grad_norm": 0.16410891711711884, "learning_rate": 2.63195019474346e-05, "loss": 0.5484, "mean_token_accuracy": 0.8277337588369846, "num_tokens": 766784815.0, "step": 24026 }, { "entropy": 0.5436742510646582, "epoch": 2.210602584228958, "grad_norm": 0.16632165014743805, "learning_rate": 2.6316435121292977e-05, "loss": 0.5163, "mean_token_accuracy": 0.8354789018630981, "num_tokens": 766816474.0, "step": 24027 }, { "entropy": 0.5904379438143224, "epoch": 2.210694590600399, "grad_norm": 0.17232416570186615, "learning_rate": 2.6313368295151348e-05, "loss": 0.5722, "mean_token_accuracy": 0.818608608096838, "num_tokens": 766848243.0, "step": 24028 }, { "entropy": 0.48698143963702023, "epoch": 2.21078659697184, "grad_norm": 0.15377192199230194, "learning_rate": 2.6310301469009723e-05, "loss": 0.4799, "mean_token_accuracy": 0.8496409021317959, "num_tokens": 766880105.0, "step": 24029 }, { "entropy": 0.5313947191461921, "epoch": 2.2108786033432817, "grad_norm": 0.15833313763141632, "learning_rate": 2.6307234642868094e-05, "loss": 0.5198, "mean_token_accuracy": 0.831680104136467, "num_tokens": 766911256.0, "step": 24030 }, { "entropy": 0.4975805194117129, "epoch": 2.210970609714723, "grad_norm": 0.1586233377456665, "learning_rate": 2.6304167816726472e-05, "loss": 0.4759, "mean_token_accuracy": 0.8489290066063404, "num_tokens": 766942891.0, "step": 24031 }, { "entropy": 0.502127829939127, "epoch": 2.211062616086164, "grad_norm": 0.16252484917640686, "learning_rate": 2.6301100990584843e-05, "loss": 0.4963, "mean_token_accuracy": 0.8414627648890018, "num_tokens": 766975176.0, "step": 24032 }, { "entropy": 0.5865205486770719, "epoch": 2.211154622457605, "grad_norm": 0.1646774262189865, "learning_rate": 2.6298034164443218e-05, "loss": 0.5724, "mean_token_accuracy": 0.8170786909759045, "num_tokens": 767007143.0, "step": 24033 }, { "entropy": 0.5321864411234856, "epoch": 2.211246628829046, "grad_norm": 0.16295655071735382, "learning_rate": 2.629496733830159e-05, "loss": 0.5165, "mean_token_accuracy": 0.8364315889775753, "num_tokens": 767039217.0, "step": 24034 }, { "entropy": 0.4676116667687893, "epoch": 2.211338635200488, "grad_norm": 0.14963535964488983, "learning_rate": 2.6291900512159967e-05, "loss": 0.4507, "mean_token_accuracy": 0.8548535145819187, "num_tokens": 767071185.0, "step": 24035 }, { "entropy": 0.5452713733538985, "epoch": 2.211430641571929, "grad_norm": 0.1617252081632614, "learning_rate": 2.628883368601834e-05, "loss": 0.5309, "mean_token_accuracy": 0.8300256468355656, "num_tokens": 767103953.0, "step": 24036 }, { "entropy": 0.4303496638312936, "epoch": 2.21152264794337, "grad_norm": 0.1488451212644577, "learning_rate": 2.6285766859876717e-05, "loss": 0.4183, "mean_token_accuracy": 0.8622878417372704, "num_tokens": 767136508.0, "step": 24037 }, { "entropy": 0.4428932892624289, "epoch": 2.211614654314811, "grad_norm": 0.14992669224739075, "learning_rate": 2.628270003373509e-05, "loss": 0.4296, "mean_token_accuracy": 0.8629077337682247, "num_tokens": 767169014.0, "step": 24038 }, { "entropy": 0.5949867460876703, "epoch": 2.2117066606862523, "grad_norm": 0.1625298410654068, "learning_rate": 2.6279633207593462e-05, "loss": 0.5739, "mean_token_accuracy": 0.8201784417033195, "num_tokens": 767201480.0, "step": 24039 }, { "entropy": 0.5247029438614845, "epoch": 2.211798667057694, "grad_norm": 0.16338884830474854, "learning_rate": 2.627656638145184e-05, "loss": 0.5154, "mean_token_accuracy": 0.8378831371665001, "num_tokens": 767232926.0, "step": 24040 }, { "entropy": 0.4965231576934457, "epoch": 2.211890673429135, "grad_norm": 0.16057677567005157, "learning_rate": 2.6273499555310212e-05, "loss": 0.4822, "mean_token_accuracy": 0.8481227681040764, "num_tokens": 767264710.0, "step": 24041 }, { "entropy": 0.46862412616610527, "epoch": 2.211982679800576, "grad_norm": 0.1505243182182312, "learning_rate": 2.6270432729168586e-05, "loss": 0.453, "mean_token_accuracy": 0.855161726474762, "num_tokens": 767296762.0, "step": 24042 }, { "entropy": 0.5755218183621764, "epoch": 2.2120746861720173, "grad_norm": 0.176219180226326, "learning_rate": 2.6267365903026958e-05, "loss": 0.5686, "mean_token_accuracy": 0.8214490860700607, "num_tokens": 767328633.0, "step": 24043 }, { "entropy": 0.4739637959282845, "epoch": 2.2121666925434584, "grad_norm": 0.15079019963741302, "learning_rate": 2.6264299076885336e-05, "loss": 0.4592, "mean_token_accuracy": 0.8535439856350422, "num_tokens": 767360824.0, "step": 24044 }, { "entropy": 0.46660470543429255, "epoch": 2.2122586989149, "grad_norm": 0.15454262495040894, "learning_rate": 2.6261232250743707e-05, "loss": 0.446, "mean_token_accuracy": 0.8570865243673325, "num_tokens": 767392545.0, "step": 24045 }, { "entropy": 0.4369996802415699, "epoch": 2.212350705286341, "grad_norm": 0.150192990899086, "learning_rate": 2.625816542460208e-05, "loss": 0.4195, "mean_token_accuracy": 0.8631003946065903, "num_tokens": 767424444.0, "step": 24046 }, { "entropy": 0.5171256372705102, "epoch": 2.2124427116577823, "grad_norm": 0.16650909185409546, "learning_rate": 2.6255098598460453e-05, "loss": 0.4988, "mean_token_accuracy": 0.8423870541155338, "num_tokens": 767456255.0, "step": 24047 }, { "entropy": 0.5108200404793024, "epoch": 2.2125347180292234, "grad_norm": 0.16330547630786896, "learning_rate": 2.625203177231883e-05, "loss": 0.5037, "mean_token_accuracy": 0.840021125972271, "num_tokens": 767488749.0, "step": 24048 }, { "entropy": 0.5816919449716806, "epoch": 2.2126267244006645, "grad_norm": 0.16694240272045135, "learning_rate": 2.6248964946177202e-05, "loss": 0.5691, "mean_token_accuracy": 0.8177032358944416, "num_tokens": 767520996.0, "step": 24049 }, { "entropy": 0.4476510928943753, "epoch": 2.212718730772106, "grad_norm": 0.1592770367860794, "learning_rate": 2.6245898120035577e-05, "loss": 0.4355, "mean_token_accuracy": 0.8627542294561863, "num_tokens": 767552897.0, "step": 24050 }, { "entropy": 0.5284497775137424, "epoch": 2.2128107371435473, "grad_norm": 0.16278137266635895, "learning_rate": 2.6242831293893948e-05, "loss": 0.5143, "mean_token_accuracy": 0.8358217440545559, "num_tokens": 767584523.0, "step": 24051 }, { "entropy": 0.5546589283039793, "epoch": 2.2129027435149884, "grad_norm": 0.1642400473356247, "learning_rate": 2.6239764467752326e-05, "loss": 0.5384, "mean_token_accuracy": 0.8307456597685814, "num_tokens": 767616189.0, "step": 24052 }, { "entropy": 0.5767873842269182, "epoch": 2.2129947498864295, "grad_norm": 0.16769619286060333, "learning_rate": 2.6236697641610697e-05, "loss": 0.5624, "mean_token_accuracy": 0.8210429884493351, "num_tokens": 767647104.0, "step": 24053 }, { "entropy": 0.5031143622472882, "epoch": 2.2130867562578707, "grad_norm": 0.16199207305908203, "learning_rate": 2.6233630815469072e-05, "loss": 0.4951, "mean_token_accuracy": 0.8450396955013275, "num_tokens": 767679459.0, "step": 24054 }, { "entropy": 0.5046978080645204, "epoch": 2.2131787626293122, "grad_norm": 0.16178983449935913, "learning_rate": 2.6230563989327443e-05, "loss": 0.4961, "mean_token_accuracy": 0.8429437056183815, "num_tokens": 767711290.0, "step": 24055 }, { "entropy": 0.4539424069225788, "epoch": 2.2132707690007534, "grad_norm": 0.15292729437351227, "learning_rate": 2.622749716318582e-05, "loss": 0.441, "mean_token_accuracy": 0.8562205769121647, "num_tokens": 767742874.0, "step": 24056 }, { "entropy": 0.68434764072299, "epoch": 2.2133627753721945, "grad_norm": 0.17810790240764618, "learning_rate": 2.6224430337044193e-05, "loss": 0.6675, "mean_token_accuracy": 0.7910949699580669, "num_tokens": 767775065.0, "step": 24057 }, { "entropy": 0.508543549105525, "epoch": 2.2134547817436356, "grad_norm": 0.15812020003795624, "learning_rate": 2.622136351090257e-05, "loss": 0.4943, "mean_token_accuracy": 0.8404782153666019, "num_tokens": 767807554.0, "step": 24058 }, { "entropy": 0.6023032935336232, "epoch": 2.2135467881150768, "grad_norm": 0.17847855389118195, "learning_rate": 2.6218296684760942e-05, "loss": 0.5976, "mean_token_accuracy": 0.8138238973915577, "num_tokens": 767839398.0, "step": 24059 }, { "entropy": 0.37412178702652454, "epoch": 2.2136387944865183, "grad_norm": 0.14635999500751495, "learning_rate": 2.6215229858619316e-05, "loss": 0.3653, "mean_token_accuracy": 0.8801523894071579, "num_tokens": 767871966.0, "step": 24060 }, { "entropy": 0.48853588476777077, "epoch": 2.2137308008579595, "grad_norm": 0.15578199923038483, "learning_rate": 2.6212163032477688e-05, "loss": 0.4747, "mean_token_accuracy": 0.847950167953968, "num_tokens": 767904143.0, "step": 24061 }, { "entropy": 0.5254276981577277, "epoch": 2.2138228072294006, "grad_norm": 0.1589752584695816, "learning_rate": 2.6209096206336066e-05, "loss": 0.499, "mean_token_accuracy": 0.8409887626767159, "num_tokens": 767935875.0, "step": 24062 }, { "entropy": 0.49342751130461693, "epoch": 2.2139148136008417, "grad_norm": 0.15691231191158295, "learning_rate": 2.6206029380194437e-05, "loss": 0.484, "mean_token_accuracy": 0.8459076508879662, "num_tokens": 767968163.0, "step": 24063 }, { "entropy": 0.5669362563639879, "epoch": 2.214006819972283, "grad_norm": 0.1680675595998764, "learning_rate": 2.620296255405281e-05, "loss": 0.5655, "mean_token_accuracy": 0.8223720639944077, "num_tokens": 768000348.0, "step": 24064 }, { "entropy": 0.5546128805726767, "epoch": 2.2140988263437245, "grad_norm": 0.1689557135105133, "learning_rate": 2.6199895727911183e-05, "loss": 0.5488, "mean_token_accuracy": 0.8270429335534573, "num_tokens": 768031804.0, "step": 24065 }, { "entropy": 0.4492250815965235, "epoch": 2.2141908327151656, "grad_norm": 0.15291757881641388, "learning_rate": 2.619682890176956e-05, "loss": 0.4361, "mean_token_accuracy": 0.8605100363492966, "num_tokens": 768064135.0, "step": 24066 }, { "entropy": 0.5164509117603302, "epoch": 2.2142828390866067, "grad_norm": 0.156798854470253, "learning_rate": 2.6193762075627932e-05, "loss": 0.5046, "mean_token_accuracy": 0.840927466750145, "num_tokens": 768096688.0, "step": 24067 }, { "entropy": 0.5459316847845912, "epoch": 2.214374845458048, "grad_norm": 0.1636161506175995, "learning_rate": 2.6190695249486307e-05, "loss": 0.5259, "mean_token_accuracy": 0.8317046947777271, "num_tokens": 768128485.0, "step": 24068 }, { "entropy": 0.48328449577093124, "epoch": 2.214466851829489, "grad_norm": 0.1528412252664566, "learning_rate": 2.6187628423344685e-05, "loss": 0.4696, "mean_token_accuracy": 0.8505640998482704, "num_tokens": 768161231.0, "step": 24069 }, { "entropy": 0.49227343313395977, "epoch": 2.2145588582009306, "grad_norm": 0.16455641388893127, "learning_rate": 2.6184561597203056e-05, "loss": 0.4782, "mean_token_accuracy": 0.8471330627799034, "num_tokens": 768192233.0, "step": 24070 }, { "entropy": 0.5533964144997299, "epoch": 2.2146508645723717, "grad_norm": 0.16813957691192627, "learning_rate": 2.618149477106143e-05, "loss": 0.5385, "mean_token_accuracy": 0.8285398185253143, "num_tokens": 768224155.0, "step": 24071 }, { "entropy": 0.5430130725726485, "epoch": 2.214742870943813, "grad_norm": 0.1604178249835968, "learning_rate": 2.6178427944919802e-05, "loss": 0.5351, "mean_token_accuracy": 0.8287432752549648, "num_tokens": 768256923.0, "step": 24072 }, { "entropy": 0.39302029460668564, "epoch": 2.214834877315254, "grad_norm": 0.14211469888687134, "learning_rate": 2.617536111877818e-05, "loss": 0.3795, "mean_token_accuracy": 0.8776410855352879, "num_tokens": 768289525.0, "step": 24073 }, { "entropy": 0.4869801802560687, "epoch": 2.214926883686695, "grad_norm": 0.15735618770122528, "learning_rate": 2.617229429263655e-05, "loss": 0.4771, "mean_token_accuracy": 0.8490805923938751, "num_tokens": 768321857.0, "step": 24074 }, { "entropy": 0.472880607820116, "epoch": 2.2150188900581367, "grad_norm": 0.15510278940200806, "learning_rate": 2.616922746649493e-05, "loss": 0.4557, "mean_token_accuracy": 0.852123461663723, "num_tokens": 768354254.0, "step": 24075 }, { "entropy": 0.5909294448792934, "epoch": 2.215110896429578, "grad_norm": 0.1725175976753235, "learning_rate": 2.6166160640353297e-05, "loss": 0.5831, "mean_token_accuracy": 0.8170455507934093, "num_tokens": 768386109.0, "step": 24076 }, { "entropy": 0.49207106325775385, "epoch": 2.215202902801019, "grad_norm": 0.1585988700389862, "learning_rate": 2.6163093814211675e-05, "loss": 0.4864, "mean_token_accuracy": 0.8449298776686192, "num_tokens": 768418316.0, "step": 24077 }, { "entropy": 0.538598945364356, "epoch": 2.21529490917246, "grad_norm": 0.1622481346130371, "learning_rate": 2.6160026988070047e-05, "loss": 0.5262, "mean_token_accuracy": 0.8318434692919254, "num_tokens": 768450123.0, "step": 24078 }, { "entropy": 0.5110766487196088, "epoch": 2.215386915543901, "grad_norm": 0.16051459312438965, "learning_rate": 2.6156960161928425e-05, "loss": 0.5024, "mean_token_accuracy": 0.8433534689247608, "num_tokens": 768482078.0, "step": 24079 }, { "entropy": 0.4692382859066129, "epoch": 2.215478921915343, "grad_norm": 0.16236044466495514, "learning_rate": 2.6153893335786796e-05, "loss": 0.4642, "mean_token_accuracy": 0.8540223874151707, "num_tokens": 768514451.0, "step": 24080 }, { "entropy": 0.46861628256738186, "epoch": 2.215570928286784, "grad_norm": 0.1509227156639099, "learning_rate": 2.615082650964517e-05, "loss": 0.4472, "mean_token_accuracy": 0.856971126049757, "num_tokens": 768546674.0, "step": 24081 }, { "entropy": 0.570642601698637, "epoch": 2.215662934658225, "grad_norm": 0.17187529802322388, "learning_rate": 2.6147759683503542e-05, "loss": 0.5633, "mean_token_accuracy": 0.8209160752594471, "num_tokens": 768578562.0, "step": 24082 }, { "entropy": 0.4045756063424051, "epoch": 2.215754941029666, "grad_norm": 0.15134476125240326, "learning_rate": 2.614469285736192e-05, "loss": 0.3936, "mean_token_accuracy": 0.8784934803843498, "num_tokens": 768610860.0, "step": 24083 }, { "entropy": 0.5526494202204049, "epoch": 2.2158469474011073, "grad_norm": 0.16610614955425262, "learning_rate": 2.614162603122029e-05, "loss": 0.531, "mean_token_accuracy": 0.8304121755063534, "num_tokens": 768642349.0, "step": 24084 }, { "entropy": 0.5257638655602932, "epoch": 2.215938953772549, "grad_norm": 0.16973930597305298, "learning_rate": 2.6138559205078666e-05, "loss": 0.5208, "mean_token_accuracy": 0.8368773572146893, "num_tokens": 768673761.0, "step": 24085 }, { "entropy": 0.4299654527567327, "epoch": 2.21603096014399, "grad_norm": 0.14887455105781555, "learning_rate": 2.6135492378937037e-05, "loss": 0.424, "mean_token_accuracy": 0.8626262359321117, "num_tokens": 768706360.0, "step": 24086 }, { "entropy": 0.62607217207551, "epoch": 2.216122966515431, "grad_norm": 0.17458787560462952, "learning_rate": 2.6132425552795415e-05, "loss": 0.6127, "mean_token_accuracy": 0.8061243630945683, "num_tokens": 768738594.0, "step": 24087 }, { "entropy": 0.5236664013937116, "epoch": 2.2162149728868723, "grad_norm": 0.16066375374794006, "learning_rate": 2.6129358726653786e-05, "loss": 0.5014, "mean_token_accuracy": 0.8405944146215916, "num_tokens": 768769722.0, "step": 24088 }, { "entropy": 0.474781284108758, "epoch": 2.2163069792583134, "grad_norm": 0.15469864010810852, "learning_rate": 2.612629190051216e-05, "loss": 0.4533, "mean_token_accuracy": 0.8567617274820805, "num_tokens": 768801838.0, "step": 24089 }, { "entropy": 0.43614475056529045, "epoch": 2.216398985629755, "grad_norm": 0.15131434798240662, "learning_rate": 2.6123225074370532e-05, "loss": 0.4326, "mean_token_accuracy": 0.8635197840631008, "num_tokens": 768834606.0, "step": 24090 }, { "entropy": 0.4126242958009243, "epoch": 2.216490992001196, "grad_norm": 0.14551293849945068, "learning_rate": 2.612015824822891e-05, "loss": 0.3908, "mean_token_accuracy": 0.8736629784107208, "num_tokens": 768866918.0, "step": 24091 }, { "entropy": 0.5124367689713836, "epoch": 2.2165829983726373, "grad_norm": 0.1632121205329895, "learning_rate": 2.611709142208728e-05, "loss": 0.5007, "mean_token_accuracy": 0.8406545296311378, "num_tokens": 768897802.0, "step": 24092 }, { "entropy": 0.6120464410632849, "epoch": 2.2166750047440784, "grad_norm": 0.16825607419013977, "learning_rate": 2.6114024595945656e-05, "loss": 0.5973, "mean_token_accuracy": 0.8165067844092846, "num_tokens": 768930127.0, "step": 24093 }, { "entropy": 0.4345440175384283, "epoch": 2.2167670111155195, "grad_norm": 0.14337751269340515, "learning_rate": 2.6110957769804027e-05, "loss": 0.4276, "mean_token_accuracy": 0.8639183789491653, "num_tokens": 768962627.0, "step": 24094 }, { "entropy": 0.5614370983093977, "epoch": 2.216859017486961, "grad_norm": 0.16849683225154877, "learning_rate": 2.6107890943662405e-05, "loss": 0.5527, "mean_token_accuracy": 0.8263925164937973, "num_tokens": 768994305.0, "step": 24095 }, { "entropy": 0.4391382117755711, "epoch": 2.2169510238584023, "grad_norm": 0.15144671499729156, "learning_rate": 2.6104824117520777e-05, "loss": 0.4288, "mean_token_accuracy": 0.8607584461569786, "num_tokens": 769026280.0, "step": 24096 }, { "entropy": 0.5238379323855042, "epoch": 2.2170430302298434, "grad_norm": 0.16336342692375183, "learning_rate": 2.6101757291379155e-05, "loss": 0.5199, "mean_token_accuracy": 0.8407543823122978, "num_tokens": 769058355.0, "step": 24097 }, { "entropy": 0.6174629312008619, "epoch": 2.2171350366012845, "grad_norm": 0.16578218340873718, "learning_rate": 2.609869046523753e-05, "loss": 0.6036, "mean_token_accuracy": 0.8098328895866871, "num_tokens": 769090802.0, "step": 24098 }, { "entropy": 0.5270666875876486, "epoch": 2.2172270429727257, "grad_norm": 0.15411385893821716, "learning_rate": 2.60956236390959e-05, "loss": 0.515, "mean_token_accuracy": 0.8352870345115662, "num_tokens": 769123504.0, "step": 24099 }, { "entropy": 0.456963793374598, "epoch": 2.2173190493441672, "grad_norm": 0.1619601845741272, "learning_rate": 2.609255681295428e-05, "loss": 0.4542, "mean_token_accuracy": 0.855462945997715, "num_tokens": 769155306.0, "step": 24100 }, { "entropy": 0.5613561877980828, "epoch": 2.2174110557156084, "grad_norm": 0.1668044924736023, "learning_rate": 2.608948998681265e-05, "loss": 0.5544, "mean_token_accuracy": 0.8298528119921684, "num_tokens": 769186523.0, "step": 24101 }, { "entropy": 0.5321781723760068, "epoch": 2.2175030620870495, "grad_norm": 0.16078700125217438, "learning_rate": 2.6086423160671025e-05, "loss": 0.5061, "mean_token_accuracy": 0.8379521742463112, "num_tokens": 769218999.0, "step": 24102 }, { "entropy": 0.4454213213175535, "epoch": 2.2175950684584906, "grad_norm": 0.15027998387813568, "learning_rate": 2.6083356334529396e-05, "loss": 0.4218, "mean_token_accuracy": 0.8634618893265724, "num_tokens": 769251191.0, "step": 24103 }, { "entropy": 0.6184800211340189, "epoch": 2.2176870748299318, "grad_norm": 0.17652636766433716, "learning_rate": 2.6080289508387774e-05, "loss": 0.6084, "mean_token_accuracy": 0.8132140710949898, "num_tokens": 769282896.0, "step": 24104 }, { "entropy": 0.49645992647856474, "epoch": 2.2177790812013733, "grad_norm": 0.15132947266101837, "learning_rate": 2.6077222682246145e-05, "loss": 0.4794, "mean_token_accuracy": 0.8491695150732994, "num_tokens": 769315664.0, "step": 24105 }, { "entropy": 0.5156567431986332, "epoch": 2.2178710875728145, "grad_norm": 0.16544559597969055, "learning_rate": 2.607415585610452e-05, "loss": 0.503, "mean_token_accuracy": 0.8398311957716942, "num_tokens": 769347169.0, "step": 24106 }, { "entropy": 0.5340972850099206, "epoch": 2.2179630939442556, "grad_norm": 0.16743306815624237, "learning_rate": 2.607108902996289e-05, "loss": 0.5218, "mean_token_accuracy": 0.8360584154725075, "num_tokens": 769378699.0, "step": 24107 }, { "entropy": 0.5076277223415673, "epoch": 2.2180551003156967, "grad_norm": 0.16214731335639954, "learning_rate": 2.606802220382127e-05, "loss": 0.5024, "mean_token_accuracy": 0.8430681750178337, "num_tokens": 769410765.0, "step": 24108 }, { "entropy": 0.5770067945122719, "epoch": 2.218147106687138, "grad_norm": 0.17169605195522308, "learning_rate": 2.606495537767964e-05, "loss": 0.5696, "mean_token_accuracy": 0.8211358971893787, "num_tokens": 769442786.0, "step": 24109 }, { "entropy": 0.5594105487689376, "epoch": 2.2182391130585795, "grad_norm": 0.1641508936882019, "learning_rate": 2.6061888551538015e-05, "loss": 0.5479, "mean_token_accuracy": 0.8271772116422653, "num_tokens": 769475135.0, "step": 24110 }, { "entropy": 0.48537838738411665, "epoch": 2.2183311194300206, "grad_norm": 0.15699556469917297, "learning_rate": 2.6058821725396386e-05, "loss": 0.4863, "mean_token_accuracy": 0.8465825840830803, "num_tokens": 769507358.0, "step": 24111 }, { "entropy": 0.5231360197067261, "epoch": 2.2184231258014617, "grad_norm": 0.16288383305072784, "learning_rate": 2.6055754899254764e-05, "loss": 0.507, "mean_token_accuracy": 0.8396123461425304, "num_tokens": 769538760.0, "step": 24112 }, { "entropy": 0.5669701192528009, "epoch": 2.218515132172903, "grad_norm": 0.16383010149002075, "learning_rate": 2.6052688073113136e-05, "loss": 0.5457, "mean_token_accuracy": 0.8269264586269855, "num_tokens": 769570824.0, "step": 24113 }, { "entropy": 0.5126207331195474, "epoch": 2.218607138544344, "grad_norm": 0.15697240829467773, "learning_rate": 2.604962124697151e-05, "loss": 0.4949, "mean_token_accuracy": 0.8429424725472927, "num_tokens": 769603261.0, "step": 24114 }, { "entropy": 0.5271755270659924, "epoch": 2.2186991449157856, "grad_norm": 0.1598556935787201, "learning_rate": 2.604655442082988e-05, "loss": 0.5121, "mean_token_accuracy": 0.8411515317857265, "num_tokens": 769635486.0, "step": 24115 }, { "entropy": 0.5224324315786362, "epoch": 2.2187911512872267, "grad_norm": 0.15820761024951935, "learning_rate": 2.604348759468826e-05, "loss": 0.5133, "mean_token_accuracy": 0.8372800424695015, "num_tokens": 769667866.0, "step": 24116 }, { "entropy": 0.5391001706011593, "epoch": 2.218883157658668, "grad_norm": 0.16259688138961792, "learning_rate": 2.604042076854663e-05, "loss": 0.5306, "mean_token_accuracy": 0.8336918838322163, "num_tokens": 769700314.0, "step": 24117 }, { "entropy": 0.5647189691662788, "epoch": 2.218975164030109, "grad_norm": 0.16588406264781952, "learning_rate": 2.603735394240501e-05, "loss": 0.5623, "mean_token_accuracy": 0.821798350661993, "num_tokens": 769732904.0, "step": 24118 }, { "entropy": 0.5979863693937659, "epoch": 2.21906717040155, "grad_norm": 0.17053662240505219, "learning_rate": 2.603428711626338e-05, "loss": 0.5731, "mean_token_accuracy": 0.8198774382472038, "num_tokens": 769765037.0, "step": 24119 }, { "entropy": 0.5964881088584661, "epoch": 2.2191591767729917, "grad_norm": 0.17379604279994965, "learning_rate": 2.6031220290121755e-05, "loss": 0.5965, "mean_token_accuracy": 0.8134577982127666, "num_tokens": 769796942.0, "step": 24120 }, { "entropy": 0.5283995289355516, "epoch": 2.219251183144433, "grad_norm": 0.15946917235851288, "learning_rate": 2.6028153463980126e-05, "loss": 0.518, "mean_token_accuracy": 0.8352918885648251, "num_tokens": 769829231.0, "step": 24121 }, { "entropy": 0.4867911245673895, "epoch": 2.219343189515874, "grad_norm": 0.15785814821720123, "learning_rate": 2.6025086637838504e-05, "loss": 0.4753, "mean_token_accuracy": 0.848216887563467, "num_tokens": 769861997.0, "step": 24122 }, { "entropy": 0.5264019891619682, "epoch": 2.219435195887315, "grad_norm": 0.16321037709712982, "learning_rate": 2.6022019811696875e-05, "loss": 0.5141, "mean_token_accuracy": 0.8335185348987579, "num_tokens": 769892968.0, "step": 24123 }, { "entropy": 0.5249070012941957, "epoch": 2.219527202258756, "grad_norm": 0.1632147580385208, "learning_rate": 2.601895298555525e-05, "loss": 0.5186, "mean_token_accuracy": 0.8322250097990036, "num_tokens": 769925209.0, "step": 24124 }, { "entropy": 0.5725180003792048, "epoch": 2.219619208630198, "grad_norm": 0.17284472286701202, "learning_rate": 2.601588615941362e-05, "loss": 0.565, "mean_token_accuracy": 0.8242493011057377, "num_tokens": 769956599.0, "step": 24125 }, { "entropy": 0.4814272029325366, "epoch": 2.219711215001639, "grad_norm": 0.15213355422019958, "learning_rate": 2.6012819333272e-05, "loss": 0.4763, "mean_token_accuracy": 0.8485010787844658, "num_tokens": 769989329.0, "step": 24126 }, { "entropy": 0.5415396727621555, "epoch": 2.21980322137308, "grad_norm": 0.1628645360469818, "learning_rate": 2.600975250713037e-05, "loss": 0.54, "mean_token_accuracy": 0.8294633440673351, "num_tokens": 770020888.0, "step": 24127 }, { "entropy": 0.532535427249968, "epoch": 2.219895227744521, "grad_norm": 0.15922997891902924, "learning_rate": 2.6006685680988745e-05, "loss": 0.5081, "mean_token_accuracy": 0.8364602588117123, "num_tokens": 770052936.0, "step": 24128 }, { "entropy": 0.44204655243083835, "epoch": 2.2199872341159623, "grad_norm": 0.14731086790561676, "learning_rate": 2.6003618854847123e-05, "loss": 0.4252, "mean_token_accuracy": 0.8673265390098095, "num_tokens": 770084897.0, "step": 24129 }, { "entropy": 0.5431371685117483, "epoch": 2.220079240487404, "grad_norm": 0.16157712042331696, "learning_rate": 2.6000552028705494e-05, "loss": 0.5281, "mean_token_accuracy": 0.8354815244674683, "num_tokens": 770116542.0, "step": 24130 }, { "entropy": 0.44536241330206394, "epoch": 2.220171246858845, "grad_norm": 0.1555860936641693, "learning_rate": 2.599748520256387e-05, "loss": 0.4382, "mean_token_accuracy": 0.8609196953475475, "num_tokens": 770148809.0, "step": 24131 }, { "entropy": 0.5366971967741847, "epoch": 2.220263253230286, "grad_norm": 0.16002878546714783, "learning_rate": 2.599441837642224e-05, "loss": 0.5204, "mean_token_accuracy": 0.838856179267168, "num_tokens": 770180555.0, "step": 24132 }, { "entropy": 0.5412471182644367, "epoch": 2.2203552596017273, "grad_norm": 0.159589022397995, "learning_rate": 2.5991351550280618e-05, "loss": 0.5282, "mean_token_accuracy": 0.8303914591670036, "num_tokens": 770212191.0, "step": 24133 }, { "entropy": 0.5021136768627912, "epoch": 2.2204472659731684, "grad_norm": 0.159267857670784, "learning_rate": 2.598828472413899e-05, "loss": 0.4839, "mean_token_accuracy": 0.8472291715443134, "num_tokens": 770243764.0, "step": 24134 }, { "entropy": 0.5125138089060783, "epoch": 2.22053927234461, "grad_norm": 0.15979747474193573, "learning_rate": 2.5985217897997368e-05, "loss": 0.5035, "mean_token_accuracy": 0.8386246934533119, "num_tokens": 770275971.0, "step": 24135 }, { "entropy": 0.5389091959223151, "epoch": 2.220631278716051, "grad_norm": 0.1606779843568802, "learning_rate": 2.5982151071855735e-05, "loss": 0.5206, "mean_token_accuracy": 0.8349708281457424, "num_tokens": 770307557.0, "step": 24136 }, { "entropy": 0.5271124187856913, "epoch": 2.2207232850874923, "grad_norm": 0.16577214002609253, "learning_rate": 2.5979084245714113e-05, "loss": 0.5104, "mean_token_accuracy": 0.8420873731374741, "num_tokens": 770339590.0, "step": 24137 }, { "entropy": 0.6008900450542569, "epoch": 2.2208152914589334, "grad_norm": 0.16818198561668396, "learning_rate": 2.5976017419572485e-05, "loss": 0.5869, "mean_token_accuracy": 0.8177864886820316, "num_tokens": 770371766.0, "step": 24138 }, { "entropy": 0.569618072360754, "epoch": 2.2209072978303745, "grad_norm": 0.16692565381526947, "learning_rate": 2.5972950593430863e-05, "loss": 0.5327, "mean_token_accuracy": 0.8318041600286961, "num_tokens": 770403323.0, "step": 24139 }, { "entropy": 0.5514718545600772, "epoch": 2.220999304201816, "grad_norm": 0.1654246300458908, "learning_rate": 2.5969883767289234e-05, "loss": 0.534, "mean_token_accuracy": 0.8292519636452198, "num_tokens": 770435214.0, "step": 24140 }, { "entropy": 0.32402163185179234, "epoch": 2.2210913105732573, "grad_norm": 0.1364925652742386, "learning_rate": 2.596681694114761e-05, "loss": 0.3079, "mean_token_accuracy": 0.8990892134606838, "num_tokens": 770467472.0, "step": 24141 }, { "entropy": 0.510351060424, "epoch": 2.2211833169446984, "grad_norm": 0.1595855951309204, "learning_rate": 2.596375011500598e-05, "loss": 0.4975, "mean_token_accuracy": 0.839462012052536, "num_tokens": 770498740.0, "step": 24142 }, { "entropy": 0.5306610092520714, "epoch": 2.2212753233161395, "grad_norm": 0.1641390025615692, "learning_rate": 2.5960683288864358e-05, "loss": 0.5093, "mean_token_accuracy": 0.83751380443573, "num_tokens": 770530698.0, "step": 24143 }, { "entropy": 0.5125164221972227, "epoch": 2.2213673296875807, "grad_norm": 0.1620316356420517, "learning_rate": 2.595761646272273e-05, "loss": 0.5082, "mean_token_accuracy": 0.8410204201936722, "num_tokens": 770563121.0, "step": 24144 }, { "entropy": 0.5160267492756248, "epoch": 2.2214593360590222, "grad_norm": 0.16471782326698303, "learning_rate": 2.5954549636581104e-05, "loss": 0.511, "mean_token_accuracy": 0.8398899771273136, "num_tokens": 770595770.0, "step": 24145 }, { "entropy": 0.4066947717219591, "epoch": 2.2215513424304634, "grad_norm": 0.15167386829853058, "learning_rate": 2.5951482810439475e-05, "loss": 0.3948, "mean_token_accuracy": 0.8729531653225422, "num_tokens": 770628501.0, "step": 24146 }, { "entropy": 0.6126541383564472, "epoch": 2.2216433488019045, "grad_norm": 0.17583829164505005, "learning_rate": 2.5948415984297853e-05, "loss": 0.6089, "mean_token_accuracy": 0.8098628968000412, "num_tokens": 770660013.0, "step": 24147 }, { "entropy": 0.38409616658464074, "epoch": 2.2217353551733456, "grad_norm": 0.14576859772205353, "learning_rate": 2.5945349158156224e-05, "loss": 0.3721, "mean_token_accuracy": 0.8842816948890686, "num_tokens": 770691985.0, "step": 24148 }, { "entropy": 0.6210328340530396, "epoch": 2.2218273615447868, "grad_norm": 0.16729964315891266, "learning_rate": 2.59422823320146e-05, "loss": 0.6243, "mean_token_accuracy": 0.8056728318333626, "num_tokens": 770724297.0, "step": 24149 }, { "entropy": 0.5068515921011567, "epoch": 2.2219193679162283, "grad_norm": 0.15809476375579834, "learning_rate": 2.593921550587297e-05, "loss": 0.5027, "mean_token_accuracy": 0.8389965109527111, "num_tokens": 770756625.0, "step": 24150 }, { "entropy": 0.47415505442768335, "epoch": 2.2220113742876695, "grad_norm": 0.1567959189414978, "learning_rate": 2.593614867973135e-05, "loss": 0.4727, "mean_token_accuracy": 0.8508407473564148, "num_tokens": 770788184.0, "step": 24151 }, { "entropy": 0.5476826131343842, "epoch": 2.2221033806591106, "grad_norm": 0.16761381924152374, "learning_rate": 2.593308185358972e-05, "loss": 0.5377, "mean_token_accuracy": 0.8312164135277271, "num_tokens": 770820952.0, "step": 24152 }, { "entropy": 0.44882893189787865, "epoch": 2.2221953870305517, "grad_norm": 0.15038596093654633, "learning_rate": 2.5930015027448094e-05, "loss": 0.4308, "mean_token_accuracy": 0.8635087497532368, "num_tokens": 770853294.0, "step": 24153 }, { "entropy": 0.6774400509893894, "epoch": 2.222287393401993, "grad_norm": 0.17577053606510162, "learning_rate": 2.5926948201306466e-05, "loss": 0.6652, "mean_token_accuracy": 0.7928628474473953, "num_tokens": 770886050.0, "step": 24154 }, { "entropy": 0.4569920711219311, "epoch": 2.2223793997734345, "grad_norm": 0.15774744749069214, "learning_rate": 2.5923881375164844e-05, "loss": 0.4434, "mean_token_accuracy": 0.8573924526572227, "num_tokens": 770917970.0, "step": 24155 }, { "entropy": 0.449383984785527, "epoch": 2.2224714061448756, "grad_norm": 0.1473633050918579, "learning_rate": 2.5920814549023215e-05, "loss": 0.4273, "mean_token_accuracy": 0.8640789873898029, "num_tokens": 770950025.0, "step": 24156 }, { "entropy": 0.5928336856886744, "epoch": 2.2225634125163167, "grad_norm": 0.17341946065425873, "learning_rate": 2.5917747722881593e-05, "loss": 0.5851, "mean_token_accuracy": 0.8160858973860741, "num_tokens": 770981603.0, "step": 24157 }, { "entropy": 0.5164566747844219, "epoch": 2.222655418887758, "grad_norm": 0.16849513351917267, "learning_rate": 2.591468089673996e-05, "loss": 0.5097, "mean_token_accuracy": 0.8378558494150639, "num_tokens": 771013488.0, "step": 24158 }, { "entropy": 0.4392341426573694, "epoch": 2.222747425259199, "grad_norm": 0.1564790904521942, "learning_rate": 2.591161407059834e-05, "loss": 0.4353, "mean_token_accuracy": 0.864222526550293, "num_tokens": 771045418.0, "step": 24159 }, { "entropy": 0.5884446613490582, "epoch": 2.2228394316306406, "grad_norm": 0.16818274557590485, "learning_rate": 2.5908547244456717e-05, "loss": 0.5658, "mean_token_accuracy": 0.820187371224165, "num_tokens": 771077256.0, "step": 24160 }, { "entropy": 0.5775995254516602, "epoch": 2.2229314380020817, "grad_norm": 0.16729046404361725, "learning_rate": 2.5905480418315088e-05, "loss": 0.5637, "mean_token_accuracy": 0.8220489323139191, "num_tokens": 771109067.0, "step": 24161 }, { "entropy": 0.4814216438680887, "epoch": 2.223023444373523, "grad_norm": 0.1523977369070053, "learning_rate": 2.5902413592173463e-05, "loss": 0.4675, "mean_token_accuracy": 0.8497374020516872, "num_tokens": 771141202.0, "step": 24162 }, { "entropy": 0.4626414147205651, "epoch": 2.223115450744964, "grad_norm": 0.14276228845119476, "learning_rate": 2.5899346766031834e-05, "loss": 0.4409, "mean_token_accuracy": 0.8595510981976986, "num_tokens": 771173716.0, "step": 24163 }, { "entropy": 0.5447672251611948, "epoch": 2.223207457116405, "grad_norm": 0.1647256761789322, "learning_rate": 2.5896279939890212e-05, "loss": 0.5327, "mean_token_accuracy": 0.833054181188345, "num_tokens": 771205458.0, "step": 24164 }, { "entropy": 0.5558562851510942, "epoch": 2.2232994634878467, "grad_norm": 0.16975969076156616, "learning_rate": 2.5893213113748583e-05, "loss": 0.5479, "mean_token_accuracy": 0.8280544020235538, "num_tokens": 771237274.0, "step": 24165 }, { "entropy": 0.49836369417607784, "epoch": 2.223391469859288, "grad_norm": 0.15425027906894684, "learning_rate": 2.5890146287606958e-05, "loss": 0.4864, "mean_token_accuracy": 0.8465288132429123, "num_tokens": 771269119.0, "step": 24166 }, { "entropy": 0.5306888502091169, "epoch": 2.223483476230729, "grad_norm": 0.15923303365707397, "learning_rate": 2.588707946146533e-05, "loss": 0.5231, "mean_token_accuracy": 0.8345753848552704, "num_tokens": 771300540.0, "step": 24167 }, { "entropy": 0.4670058134943247, "epoch": 2.22357548260217, "grad_norm": 0.14808879792690277, "learning_rate": 2.5884012635323707e-05, "loss": 0.4573, "mean_token_accuracy": 0.8560908921062946, "num_tokens": 771333174.0, "step": 24168 }, { "entropy": 0.5321493453811854, "epoch": 2.223667488973611, "grad_norm": 0.15962429344654083, "learning_rate": 2.588094580918208e-05, "loss": 0.5126, "mean_token_accuracy": 0.8396625630557537, "num_tokens": 771365284.0, "step": 24169 }, { "entropy": 0.574725678190589, "epoch": 2.223759495345053, "grad_norm": 0.16324111819267273, "learning_rate": 2.5877878983040453e-05, "loss": 0.5565, "mean_token_accuracy": 0.8282006271183491, "num_tokens": 771397380.0, "step": 24170 }, { "entropy": 0.5360817294567823, "epoch": 2.223851501716494, "grad_norm": 0.17075231671333313, "learning_rate": 2.5874812156898824e-05, "loss": 0.5343, "mean_token_accuracy": 0.8308601267635822, "num_tokens": 771429107.0, "step": 24171 }, { "entropy": 0.5332609750330448, "epoch": 2.223943508087935, "grad_norm": 0.16448351740837097, "learning_rate": 2.5871745330757202e-05, "loss": 0.5291, "mean_token_accuracy": 0.8334911167621613, "num_tokens": 771460356.0, "step": 24172 }, { "entropy": 0.5332767898216844, "epoch": 2.224035514459376, "grad_norm": 0.16292357444763184, "learning_rate": 2.5868678504615574e-05, "loss": 0.5165, "mean_token_accuracy": 0.8363931998610497, "num_tokens": 771492597.0, "step": 24173 }, { "entropy": 0.5575981047004461, "epoch": 2.2241275208308173, "grad_norm": 0.1589953452348709, "learning_rate": 2.586561167847395e-05, "loss": 0.5454, "mean_token_accuracy": 0.8288236670196056, "num_tokens": 771525233.0, "step": 24174 }, { "entropy": 0.5755680873990059, "epoch": 2.224219527202259, "grad_norm": 0.16782258450984955, "learning_rate": 2.586254485233232e-05, "loss": 0.5746, "mean_token_accuracy": 0.815997838973999, "num_tokens": 771556781.0, "step": 24175 }, { "entropy": 0.5576616041362286, "epoch": 2.2243115335737, "grad_norm": 0.16060659289360046, "learning_rate": 2.5859478026190698e-05, "loss": 0.5443, "mean_token_accuracy": 0.8284975551068783, "num_tokens": 771589152.0, "step": 24176 }, { "entropy": 0.47238989919424057, "epoch": 2.224403539945141, "grad_norm": 0.16017372906208038, "learning_rate": 2.585641120004907e-05, "loss": 0.4621, "mean_token_accuracy": 0.8538109250366688, "num_tokens": 771620987.0, "step": 24177 }, { "entropy": 0.5230642086826265, "epoch": 2.2244955463165823, "grad_norm": 0.16441266238689423, "learning_rate": 2.5853344373907447e-05, "loss": 0.4936, "mean_token_accuracy": 0.8403279222548008, "num_tokens": 771652180.0, "step": 24178 }, { "entropy": 0.5188231791835278, "epoch": 2.2245875526880234, "grad_norm": 0.15875445306301117, "learning_rate": 2.5850277547765818e-05, "loss": 0.5062, "mean_token_accuracy": 0.8429018259048462, "num_tokens": 771683944.0, "step": 24179 }, { "entropy": 0.6160870548337698, "epoch": 2.224679559059465, "grad_norm": 0.17091815173625946, "learning_rate": 2.5847210721624193e-05, "loss": 0.6047, "mean_token_accuracy": 0.8082520514726639, "num_tokens": 771716293.0, "step": 24180 }, { "entropy": 0.5460703447461128, "epoch": 2.224771565430906, "grad_norm": 0.16684061288833618, "learning_rate": 2.5844143895482564e-05, "loss": 0.5293, "mean_token_accuracy": 0.8328435011208057, "num_tokens": 771748403.0, "step": 24181 }, { "entropy": 0.537287502666004, "epoch": 2.2248635718023473, "grad_norm": 0.16140489280223846, "learning_rate": 2.5841077069340942e-05, "loss": 0.521, "mean_token_accuracy": 0.8359015174210072, "num_tokens": 771780516.0, "step": 24182 }, { "entropy": 0.47824247647076845, "epoch": 2.2249555781737884, "grad_norm": 0.15476438403129578, "learning_rate": 2.5838010243199313e-05, "loss": 0.4549, "mean_token_accuracy": 0.8532870672643185, "num_tokens": 771812650.0, "step": 24183 }, { "entropy": 0.5063483193516731, "epoch": 2.2250475845452296, "grad_norm": 0.1568438857793808, "learning_rate": 2.5834943417057688e-05, "loss": 0.4987, "mean_token_accuracy": 0.8476503193378448, "num_tokens": 771844688.0, "step": 24184 }, { "entropy": 0.4278112929314375, "epoch": 2.225139590916671, "grad_norm": 0.1478024572134018, "learning_rate": 2.583187659091606e-05, "loss": 0.4117, "mean_token_accuracy": 0.8699154667556286, "num_tokens": 771876382.0, "step": 24185 }, { "entropy": 0.523198489099741, "epoch": 2.2252315972881123, "grad_norm": 0.16109131276607513, "learning_rate": 2.5828809764774437e-05, "loss": 0.5166, "mean_token_accuracy": 0.8356128223240376, "num_tokens": 771908725.0, "step": 24186 }, { "entropy": 0.6150384172797203, "epoch": 2.2253236036595534, "grad_norm": 0.17417985200881958, "learning_rate": 2.582574293863281e-05, "loss": 0.6096, "mean_token_accuracy": 0.807486642152071, "num_tokens": 771941261.0, "step": 24187 }, { "entropy": 0.5670816535130143, "epoch": 2.2254156100309945, "grad_norm": 0.1661311835050583, "learning_rate": 2.5822676112491183e-05, "loss": 0.5474, "mean_token_accuracy": 0.8303897231817245, "num_tokens": 771973065.0, "step": 24188 }, { "entropy": 0.5940615171566606, "epoch": 2.2255076164024357, "grad_norm": 0.17367397248744965, "learning_rate": 2.5819609286349555e-05, "loss": 0.5762, "mean_token_accuracy": 0.8178001493215561, "num_tokens": 772004090.0, "step": 24189 }, { "entropy": 0.4830694762058556, "epoch": 2.2255996227738772, "grad_norm": 0.15897896885871887, "learning_rate": 2.5816542460207933e-05, "loss": 0.4695, "mean_token_accuracy": 0.8504563868045807, "num_tokens": 772035645.0, "step": 24190 }, { "entropy": 0.46350731048732996, "epoch": 2.2256916291453184, "grad_norm": 0.15585826337337494, "learning_rate": 2.5813475634066307e-05, "loss": 0.4563, "mean_token_accuracy": 0.8525413908064365, "num_tokens": 772067535.0, "step": 24191 }, { "entropy": 0.5706895980983973, "epoch": 2.2257836355167595, "grad_norm": 0.16769146919250488, "learning_rate": 2.581040880792468e-05, "loss": 0.5615, "mean_token_accuracy": 0.820682629942894, "num_tokens": 772100068.0, "step": 24192 }, { "entropy": 0.5525089921429753, "epoch": 2.2258756418882006, "grad_norm": 0.16313698887825012, "learning_rate": 2.5807341981783056e-05, "loss": 0.5454, "mean_token_accuracy": 0.8290542811155319, "num_tokens": 772132548.0, "step": 24193 }, { "entropy": 0.5156596023589373, "epoch": 2.2259676482596418, "grad_norm": 0.15946556627750397, "learning_rate": 2.5804275155641428e-05, "loss": 0.4999, "mean_token_accuracy": 0.8418563529849052, "num_tokens": 772163755.0, "step": 24194 }, { "entropy": 0.5200337516143918, "epoch": 2.2260596546310834, "grad_norm": 0.1578545719385147, "learning_rate": 2.5801208329499806e-05, "loss": 0.4967, "mean_token_accuracy": 0.8372015208005905, "num_tokens": 772195866.0, "step": 24195 }, { "entropy": 0.5080026369541883, "epoch": 2.2261516610025245, "grad_norm": 0.15749460458755493, "learning_rate": 2.5798141503358174e-05, "loss": 0.4949, "mean_token_accuracy": 0.8402348533272743, "num_tokens": 772227352.0, "step": 24196 }, { "entropy": 0.4938706997781992, "epoch": 2.2262436673739656, "grad_norm": 0.15688635408878326, "learning_rate": 2.579507467721655e-05, "loss": 0.4836, "mean_token_accuracy": 0.8456770330667496, "num_tokens": 772259708.0, "step": 24197 }, { "entropy": 0.4143405146896839, "epoch": 2.2263356737454068, "grad_norm": 0.15118391811847687, "learning_rate": 2.5792007851074923e-05, "loss": 0.3988, "mean_token_accuracy": 0.8716897815465927, "num_tokens": 772291694.0, "step": 24198 }, { "entropy": 0.553772839717567, "epoch": 2.226427680116848, "grad_norm": 0.16173598170280457, "learning_rate": 2.57889410249333e-05, "loss": 0.5368, "mean_token_accuracy": 0.8283601924777031, "num_tokens": 772324425.0, "step": 24199 }, { "entropy": 0.6061022141948342, "epoch": 2.2265196864882895, "grad_norm": 0.1726573258638382, "learning_rate": 2.5785874198791672e-05, "loss": 0.5922, "mean_token_accuracy": 0.8177211470901966, "num_tokens": 772356516.0, "step": 24200 }, { "entropy": 0.4310205499641597, "epoch": 2.2266116928597306, "grad_norm": 0.14938883483409882, "learning_rate": 2.5782807372650047e-05, "loss": 0.4113, "mean_token_accuracy": 0.8655320778489113, "num_tokens": 772388422.0, "step": 24201 }, { "entropy": 0.49291414953768253, "epoch": 2.2267036992311717, "grad_norm": 0.15434715151786804, "learning_rate": 2.5779740546508418e-05, "loss": 0.4824, "mean_token_accuracy": 0.8449989855289459, "num_tokens": 772420416.0, "step": 24202 }, { "entropy": 0.4596136147156358, "epoch": 2.226795705602613, "grad_norm": 0.15812233090400696, "learning_rate": 2.5776673720366796e-05, "loss": 0.4602, "mean_token_accuracy": 0.8519364185631275, "num_tokens": 772452419.0, "step": 24203 }, { "entropy": 0.5959602296352386, "epoch": 2.226887711974054, "grad_norm": 0.17500127851963043, "learning_rate": 2.5773606894225167e-05, "loss": 0.5848, "mean_token_accuracy": 0.8153360225260258, "num_tokens": 772484418.0, "step": 24204 }, { "entropy": 0.5585185028612614, "epoch": 2.2269797183454956, "grad_norm": 0.15680742263793945, "learning_rate": 2.5770540068083542e-05, "loss": 0.5409, "mean_token_accuracy": 0.8327614329755306, "num_tokens": 772516521.0, "step": 24205 }, { "entropy": 0.5843577766790986, "epoch": 2.2270717247169367, "grad_norm": 0.16620823740959167, "learning_rate": 2.5767473241941913e-05, "loss": 0.5652, "mean_token_accuracy": 0.8184045515954494, "num_tokens": 772548359.0, "step": 24206 }, { "entropy": 0.5589355072006583, "epoch": 2.227163731088378, "grad_norm": 0.1671816110610962, "learning_rate": 2.576440641580029e-05, "loss": 0.5541, "mean_token_accuracy": 0.8254936523735523, "num_tokens": 772579962.0, "step": 24207 }, { "entropy": 0.5127271264791489, "epoch": 2.227255737459819, "grad_norm": 0.16154004633426666, "learning_rate": 2.5761339589658663e-05, "loss": 0.505, "mean_token_accuracy": 0.8385627493262291, "num_tokens": 772611377.0, "step": 24208 }, { "entropy": 0.5489284992218018, "epoch": 2.22734774383126, "grad_norm": 0.17002421617507935, "learning_rate": 2.5758272763517037e-05, "loss": 0.5324, "mean_token_accuracy": 0.8332307003438473, "num_tokens": 772643230.0, "step": 24209 }, { "entropy": 0.564229927957058, "epoch": 2.2274397502027017, "grad_norm": 0.16743972897529602, "learning_rate": 2.575520593737541e-05, "loss": 0.5464, "mean_token_accuracy": 0.8281581848859787, "num_tokens": 772675419.0, "step": 24210 }, { "entropy": 0.5161619298160076, "epoch": 2.227531756574143, "grad_norm": 0.16041989624500275, "learning_rate": 2.5752139111233787e-05, "loss": 0.4988, "mean_token_accuracy": 0.8428904488682747, "num_tokens": 772707458.0, "step": 24211 }, { "entropy": 0.5086976392194629, "epoch": 2.227623762945584, "grad_norm": 0.15733115375041962, "learning_rate": 2.5749072285092158e-05, "loss": 0.4803, "mean_token_accuracy": 0.8486697934567928, "num_tokens": 772739430.0, "step": 24212 }, { "entropy": 0.48994227312505245, "epoch": 2.227715769317025, "grad_norm": 0.15414069592952728, "learning_rate": 2.5746005458950533e-05, "loss": 0.4759, "mean_token_accuracy": 0.8514166921377182, "num_tokens": 772771896.0, "step": 24213 }, { "entropy": 0.5538936164230108, "epoch": 2.227807775688466, "grad_norm": 0.16866429150104523, "learning_rate": 2.5742938632808904e-05, "loss": 0.5435, "mean_token_accuracy": 0.8272120133042336, "num_tokens": 772803607.0, "step": 24214 }, { "entropy": 0.5754121374338865, "epoch": 2.227899782059908, "grad_norm": 0.16851167380809784, "learning_rate": 2.5739871806667282e-05, "loss": 0.5669, "mean_token_accuracy": 0.8201387748122215, "num_tokens": 772834918.0, "step": 24215 }, { "entropy": 0.5977393332868814, "epoch": 2.227991788431349, "grad_norm": 0.16975998878479004, "learning_rate": 2.5736804980525653e-05, "loss": 0.5889, "mean_token_accuracy": 0.8151269294321537, "num_tokens": 772866826.0, "step": 24216 }, { "entropy": 0.5858702547848225, "epoch": 2.22808379480279, "grad_norm": 0.16681984066963196, "learning_rate": 2.573373815438403e-05, "loss": 0.5785, "mean_token_accuracy": 0.817340075969696, "num_tokens": 772899349.0, "step": 24217 }, { "entropy": 0.5012794428039342, "epoch": 2.228175801174231, "grad_norm": 0.15877966582775116, "learning_rate": 2.57306713282424e-05, "loss": 0.4771, "mean_token_accuracy": 0.8487435318529606, "num_tokens": 772931146.0, "step": 24218 }, { "entropy": 0.5101269790902734, "epoch": 2.2282678075456723, "grad_norm": 0.16086624562740326, "learning_rate": 2.5727604502100777e-05, "loss": 0.5042, "mean_token_accuracy": 0.840113777667284, "num_tokens": 772963065.0, "step": 24219 }, { "entropy": 0.5012874277308583, "epoch": 2.228359813917114, "grad_norm": 0.15265828371047974, "learning_rate": 2.5724537675959155e-05, "loss": 0.4961, "mean_token_accuracy": 0.8404385633766651, "num_tokens": 772995654.0, "step": 24220 }, { "entropy": 0.5050824664067477, "epoch": 2.228451820288555, "grad_norm": 0.16120262444019318, "learning_rate": 2.5721470849817526e-05, "loss": 0.4904, "mean_token_accuracy": 0.8437262959778309, "num_tokens": 773027145.0, "step": 24221 }, { "entropy": 0.5771566163748503, "epoch": 2.228543826659996, "grad_norm": 0.16911399364471436, "learning_rate": 2.57184040236759e-05, "loss": 0.5607, "mean_token_accuracy": 0.8201207742094994, "num_tokens": 773059392.0, "step": 24222 }, { "entropy": 0.5430606752634048, "epoch": 2.2286358330314373, "grad_norm": 0.16423708200454712, "learning_rate": 2.5715337197534272e-05, "loss": 0.529, "mean_token_accuracy": 0.8337993435561657, "num_tokens": 773091392.0, "step": 24223 }, { "entropy": 0.4864490544423461, "epoch": 2.228727839402879, "grad_norm": 0.15861792862415314, "learning_rate": 2.571227037139265e-05, "loss": 0.4753, "mean_token_accuracy": 0.8489278629422188, "num_tokens": 773123459.0, "step": 24224 }, { "entropy": 0.6029484262689948, "epoch": 2.22881984577432, "grad_norm": 0.17532320320606232, "learning_rate": 2.570920354525102e-05, "loss": 0.6017, "mean_token_accuracy": 0.8108507916331291, "num_tokens": 773155223.0, "step": 24225 }, { "entropy": 0.5491222362034023, "epoch": 2.228911852145761, "grad_norm": 0.16129957139492035, "learning_rate": 2.5706136719109396e-05, "loss": 0.5349, "mean_token_accuracy": 0.8339671231806278, "num_tokens": 773187469.0, "step": 24226 }, { "entropy": 0.585704330354929, "epoch": 2.2290038585172023, "grad_norm": 0.16762952506542206, "learning_rate": 2.5703069892967767e-05, "loss": 0.5839, "mean_token_accuracy": 0.8176422454416752, "num_tokens": 773219246.0, "step": 24227 }, { "entropy": 0.5796340871602297, "epoch": 2.2290958648886434, "grad_norm": 0.1688656210899353, "learning_rate": 2.5700003066826145e-05, "loss": 0.5795, "mean_token_accuracy": 0.8189657106995583, "num_tokens": 773250555.0, "step": 24228 }, { "entropy": 0.5116355104837567, "epoch": 2.229187871260085, "grad_norm": 0.15714778006076813, "learning_rate": 2.5696936240684517e-05, "loss": 0.5009, "mean_token_accuracy": 0.8405769281089306, "num_tokens": 773282004.0, "step": 24229 }, { "entropy": 0.5378795489668846, "epoch": 2.229279877631526, "grad_norm": 0.16276484727859497, "learning_rate": 2.569386941454289e-05, "loss": 0.5243, "mean_token_accuracy": 0.8358909711241722, "num_tokens": 773314412.0, "step": 24230 }, { "entropy": 0.4740041419863701, "epoch": 2.2293718840029673, "grad_norm": 0.15510046482086182, "learning_rate": 2.5690802588401263e-05, "loss": 0.4678, "mean_token_accuracy": 0.8510599806904793, "num_tokens": 773346967.0, "step": 24231 }, { "entropy": 0.4325535265961662, "epoch": 2.2294638903744084, "grad_norm": 0.15080861747264862, "learning_rate": 2.568773576225964e-05, "loss": 0.425, "mean_token_accuracy": 0.8665114678442478, "num_tokens": 773379396.0, "step": 24232 }, { "entropy": 0.5336015238426626, "epoch": 2.2295558967458495, "grad_norm": 0.1621493697166443, "learning_rate": 2.5684668936118012e-05, "loss": 0.5228, "mean_token_accuracy": 0.8368220180273056, "num_tokens": 773411274.0, "step": 24233 }, { "entropy": 0.4344001426361501, "epoch": 2.229647903117291, "grad_norm": 0.1500534564256668, "learning_rate": 2.5681602109976387e-05, "loss": 0.4085, "mean_token_accuracy": 0.8652683570981026, "num_tokens": 773443163.0, "step": 24234 }, { "entropy": 0.493643709924072, "epoch": 2.2297399094887322, "grad_norm": 0.1514306515455246, "learning_rate": 2.5678535283834758e-05, "loss": 0.4742, "mean_token_accuracy": 0.8520896062254906, "num_tokens": 773475919.0, "step": 24235 }, { "entropy": 0.5689303362742066, "epoch": 2.2298319158601734, "grad_norm": 0.17050206661224365, "learning_rate": 2.5675468457693136e-05, "loss": 0.554, "mean_token_accuracy": 0.8232903219759464, "num_tokens": 773507598.0, "step": 24236 }, { "entropy": 0.465215896256268, "epoch": 2.2299239222316145, "grad_norm": 0.15147949755191803, "learning_rate": 2.5672401631551507e-05, "loss": 0.4522, "mean_token_accuracy": 0.8571645617485046, "num_tokens": 773540365.0, "step": 24237 }, { "entropy": 0.5292282016016543, "epoch": 2.2300159286030556, "grad_norm": 0.15871350467205048, "learning_rate": 2.5669334805409885e-05, "loss": 0.5081, "mean_token_accuracy": 0.8370634689927101, "num_tokens": 773572628.0, "step": 24238 }, { "entropy": 0.5127226365730166, "epoch": 2.230107934974497, "grad_norm": 0.15640512108802795, "learning_rate": 2.5666267979268256e-05, "loss": 0.5052, "mean_token_accuracy": 0.8419892676174641, "num_tokens": 773604617.0, "step": 24239 }, { "entropy": 0.5863154325634241, "epoch": 2.2301999413459384, "grad_norm": 0.1670151948928833, "learning_rate": 2.566320115312663e-05, "loss": 0.5794, "mean_token_accuracy": 0.8201940767467022, "num_tokens": 773636143.0, "step": 24240 }, { "entropy": 0.5516415745951235, "epoch": 2.2302919477173795, "grad_norm": 0.1717502325773239, "learning_rate": 2.5660134326985002e-05, "loss": 0.5446, "mean_token_accuracy": 0.8303071334958076, "num_tokens": 773666826.0, "step": 24241 }, { "entropy": 0.5943624414503574, "epoch": 2.2303839540888206, "grad_norm": 0.17130158841609955, "learning_rate": 2.565706750084338e-05, "loss": 0.5896, "mean_token_accuracy": 0.8159093298017979, "num_tokens": 773698723.0, "step": 24242 }, { "entropy": 0.528668228071183, "epoch": 2.2304759604602618, "grad_norm": 0.1600949466228485, "learning_rate": 2.565400067470175e-05, "loss": 0.4964, "mean_token_accuracy": 0.8370017819106579, "num_tokens": 773729921.0, "step": 24243 }, { "entropy": 0.5921947965398431, "epoch": 2.2305679668317033, "grad_norm": 0.16292038559913635, "learning_rate": 2.5650933848560126e-05, "loss": 0.5792, "mean_token_accuracy": 0.8173513859510422, "num_tokens": 773762118.0, "step": 24244 }, { "entropy": 0.5449336771853268, "epoch": 2.2306599732031445, "grad_norm": 0.1611427366733551, "learning_rate": 2.5647867022418498e-05, "loss": 0.5265, "mean_token_accuracy": 0.8338914811611176, "num_tokens": 773793992.0, "step": 24245 }, { "entropy": 0.5195654160343111, "epoch": 2.2307519795745856, "grad_norm": 0.1571577936410904, "learning_rate": 2.5644800196276876e-05, "loss": 0.5008, "mean_token_accuracy": 0.8417230173945427, "num_tokens": 773826532.0, "step": 24246 }, { "entropy": 0.39614779665134847, "epoch": 2.2308439859460267, "grad_norm": 0.14596448838710785, "learning_rate": 2.5641733370135247e-05, "loss": 0.3901, "mean_token_accuracy": 0.8746721558272839, "num_tokens": 773858251.0, "step": 24247 }, { "entropy": 0.43355192616581917, "epoch": 2.230935992317468, "grad_norm": 0.15388889610767365, "learning_rate": 2.563866654399362e-05, "loss": 0.4209, "mean_token_accuracy": 0.8657216727733612, "num_tokens": 773889227.0, "step": 24248 }, { "entropy": 0.5757452938705683, "epoch": 2.2310279986889094, "grad_norm": 0.1662476360797882, "learning_rate": 2.5635599717851993e-05, "loss": 0.5617, "mean_token_accuracy": 0.8224816918373108, "num_tokens": 773921023.0, "step": 24249 }, { "entropy": 0.5306198676116765, "epoch": 2.2311200050603506, "grad_norm": 0.16432391107082367, "learning_rate": 2.563253289171037e-05, "loss": 0.5248, "mean_token_accuracy": 0.8362682573497295, "num_tokens": 773952802.0, "step": 24250 }, { "entropy": 0.5843898681923747, "epoch": 2.2312120114317917, "grad_norm": 0.16694867610931396, "learning_rate": 2.5629466065568745e-05, "loss": 0.5731, "mean_token_accuracy": 0.8194572068750858, "num_tokens": 773984613.0, "step": 24251 }, { "entropy": 0.4977124221622944, "epoch": 2.231304017803233, "grad_norm": 0.15905877947807312, "learning_rate": 2.5626399239427117e-05, "loss": 0.4859, "mean_token_accuracy": 0.8435473926365376, "num_tokens": 774017167.0, "step": 24252 }, { "entropy": 0.513339180033654, "epoch": 2.231396024174674, "grad_norm": 0.16109547019004822, "learning_rate": 2.5623332413285495e-05, "loss": 0.4894, "mean_token_accuracy": 0.8448058068752289, "num_tokens": 774048710.0, "step": 24253 }, { "entropy": 0.560325033031404, "epoch": 2.2314880305461156, "grad_norm": 0.16057373583316803, "learning_rate": 2.5620265587143866e-05, "loss": 0.5482, "mean_token_accuracy": 0.8281800672411919, "num_tokens": 774081128.0, "step": 24254 }, { "entropy": 0.5906694158911705, "epoch": 2.2315800369175567, "grad_norm": 0.16647708415985107, "learning_rate": 2.5617198761002244e-05, "loss": 0.5815, "mean_token_accuracy": 0.8204065449535847, "num_tokens": 774112784.0, "step": 24255 }, { "entropy": 0.6054695583879948, "epoch": 2.231672043288998, "grad_norm": 0.1675838828086853, "learning_rate": 2.5614131934860612e-05, "loss": 0.5936, "mean_token_accuracy": 0.8121442943811417, "num_tokens": 774145091.0, "step": 24256 }, { "entropy": 0.49472575075924397, "epoch": 2.231764049660439, "grad_norm": 0.15979841351509094, "learning_rate": 2.561106510871899e-05, "loss": 0.4836, "mean_token_accuracy": 0.8464874811470509, "num_tokens": 774177348.0, "step": 24257 }, { "entropy": 0.5805886466987431, "epoch": 2.23185605603188, "grad_norm": 0.16818678379058838, "learning_rate": 2.560799828257736e-05, "loss": 0.5716, "mean_token_accuracy": 0.8193923197686672, "num_tokens": 774209134.0, "step": 24258 }, { "entropy": 0.57272869348526, "epoch": 2.2319480624033217, "grad_norm": 0.16775625944137573, "learning_rate": 2.560493145643574e-05, "loss": 0.563, "mean_token_accuracy": 0.8246313594281673, "num_tokens": 774240662.0, "step": 24259 }, { "entropy": 0.5190178984776139, "epoch": 2.232040068774763, "grad_norm": 0.1613803505897522, "learning_rate": 2.560186463029411e-05, "loss": 0.5094, "mean_token_accuracy": 0.8338312283158302, "num_tokens": 774272755.0, "step": 24260 }, { "entropy": 0.5484495032578707, "epoch": 2.232132075146204, "grad_norm": 0.15859757363796234, "learning_rate": 2.5598797804152485e-05, "loss": 0.536, "mean_token_accuracy": 0.8311124481260777, "num_tokens": 774304785.0, "step": 24261 }, { "entropy": 0.5121656004339457, "epoch": 2.232224081517645, "grad_norm": 0.15812642872333527, "learning_rate": 2.5595730978010856e-05, "loss": 0.4957, "mean_token_accuracy": 0.8381439261138439, "num_tokens": 774337207.0, "step": 24262 }, { "entropy": 0.6150475703179836, "epoch": 2.232316087889086, "grad_norm": 0.1715523600578308, "learning_rate": 2.5592664151869234e-05, "loss": 0.6123, "mean_token_accuracy": 0.8124958612024784, "num_tokens": 774369213.0, "step": 24263 }, { "entropy": 0.582396300509572, "epoch": 2.2324080942605278, "grad_norm": 0.17195047438144684, "learning_rate": 2.5589597325727606e-05, "loss": 0.5681, "mean_token_accuracy": 0.8239339292049408, "num_tokens": 774400969.0, "step": 24264 }, { "entropy": 0.5621020724065602, "epoch": 2.232500100631969, "grad_norm": 0.17193754017353058, "learning_rate": 2.558653049958598e-05, "loss": 0.5506, "mean_token_accuracy": 0.8252263516187668, "num_tokens": 774433312.0, "step": 24265 }, { "entropy": 0.4957766458392143, "epoch": 2.23259210700341, "grad_norm": 0.15749599039554596, "learning_rate": 2.558346367344435e-05, "loss": 0.4824, "mean_token_accuracy": 0.8445932827889919, "num_tokens": 774465675.0, "step": 24266 }, { "entropy": 0.46912147011607885, "epoch": 2.232684113374851, "grad_norm": 0.1507721245288849, "learning_rate": 2.558039684730273e-05, "loss": 0.4584, "mean_token_accuracy": 0.8548216074705124, "num_tokens": 774498229.0, "step": 24267 }, { "entropy": 0.4421043526381254, "epoch": 2.2327761197462923, "grad_norm": 0.14998717606067657, "learning_rate": 2.55773300211611e-05, "loss": 0.436, "mean_token_accuracy": 0.8635517805814743, "num_tokens": 774530361.0, "step": 24268 }, { "entropy": 0.5330431517213583, "epoch": 2.232868126117734, "grad_norm": 0.16549460589885712, "learning_rate": 2.5574263195019475e-05, "loss": 0.5246, "mean_token_accuracy": 0.8307439424097538, "num_tokens": 774562941.0, "step": 24269 }, { "entropy": 0.47594837099313736, "epoch": 2.232960132489175, "grad_norm": 0.15344706177711487, "learning_rate": 2.5571196368877847e-05, "loss": 0.456, "mean_token_accuracy": 0.8536700420081615, "num_tokens": 774595287.0, "step": 24270 }, { "entropy": 0.5945634935051203, "epoch": 2.233052138860616, "grad_norm": 0.16901706159114838, "learning_rate": 2.5568129542736225e-05, "loss": 0.5808, "mean_token_accuracy": 0.8176503479480743, "num_tokens": 774627803.0, "step": 24271 }, { "entropy": 0.5704577057622373, "epoch": 2.2331441452320573, "grad_norm": 0.16741943359375, "learning_rate": 2.5565062716594596e-05, "loss": 0.5557, "mean_token_accuracy": 0.8215742483735085, "num_tokens": 774659472.0, "step": 24272 }, { "entropy": 0.4920711163431406, "epoch": 2.2332361516034984, "grad_norm": 0.1527986079454422, "learning_rate": 2.556199589045297e-05, "loss": 0.4732, "mean_token_accuracy": 0.8486400172114372, "num_tokens": 774692212.0, "step": 24273 }, { "entropy": 0.5392793854698539, "epoch": 2.23332815797494, "grad_norm": 0.16326214373111725, "learning_rate": 2.5558929064311342e-05, "loss": 0.5273, "mean_token_accuracy": 0.8352835848927498, "num_tokens": 774723334.0, "step": 24274 }, { "entropy": 0.5053826533257961, "epoch": 2.233420164346381, "grad_norm": 0.1564423143863678, "learning_rate": 2.555586223816972e-05, "loss": 0.4837, "mean_token_accuracy": 0.8443369828164577, "num_tokens": 774755022.0, "step": 24275 }, { "entropy": 0.48460587300360203, "epoch": 2.2335121707178223, "grad_norm": 0.1601904183626175, "learning_rate": 2.555279541202809e-05, "loss": 0.4672, "mean_token_accuracy": 0.8477864861488342, "num_tokens": 774786800.0, "step": 24276 }, { "entropy": 0.5612047985196114, "epoch": 2.2336041770892634, "grad_norm": 0.16863031685352325, "learning_rate": 2.554972858588647e-05, "loss": 0.5552, "mean_token_accuracy": 0.8273339867591858, "num_tokens": 774817936.0, "step": 24277 }, { "entropy": 0.46157117327675223, "epoch": 2.2336961834607045, "grad_norm": 0.1546473503112793, "learning_rate": 2.5546661759744837e-05, "loss": 0.4509, "mean_token_accuracy": 0.855348814278841, "num_tokens": 774849605.0, "step": 24278 }, { "entropy": 0.5831308588385582, "epoch": 2.233788189832146, "grad_norm": 0.16603517532348633, "learning_rate": 2.5543594933603215e-05, "loss": 0.5669, "mean_token_accuracy": 0.8183613494038582, "num_tokens": 774881848.0, "step": 24279 }, { "entropy": 0.5458133108913898, "epoch": 2.2338801962035872, "grad_norm": 0.16122125089168549, "learning_rate": 2.5540528107461586e-05, "loss": 0.5361, "mean_token_accuracy": 0.8289372846484184, "num_tokens": 774913545.0, "step": 24280 }, { "entropy": 0.5482013402506709, "epoch": 2.2339722025750284, "grad_norm": 0.16053934395313263, "learning_rate": 2.5537461281319964e-05, "loss": 0.5347, "mean_token_accuracy": 0.8302612341940403, "num_tokens": 774945524.0, "step": 24281 }, { "entropy": 0.5434949528425932, "epoch": 2.2340642089464695, "grad_norm": 0.16506780683994293, "learning_rate": 2.553439445517834e-05, "loss": 0.5249, "mean_token_accuracy": 0.8328287079930305, "num_tokens": 774976715.0, "step": 24282 }, { "entropy": 0.5656422041356564, "epoch": 2.2341562153179106, "grad_norm": 0.16663098335266113, "learning_rate": 2.553132762903671e-05, "loss": 0.5539, "mean_token_accuracy": 0.8239072225987911, "num_tokens": 775008593.0, "step": 24283 }, { "entropy": 0.6029374152421951, "epoch": 2.234248221689352, "grad_norm": 0.17342090606689453, "learning_rate": 2.552826080289509e-05, "loss": 0.6053, "mean_token_accuracy": 0.8110905401408672, "num_tokens": 775040898.0, "step": 24284 }, { "entropy": 0.4864859892986715, "epoch": 2.2343402280607934, "grad_norm": 0.15485118329524994, "learning_rate": 2.552519397675346e-05, "loss": 0.474, "mean_token_accuracy": 0.8495302982628345, "num_tokens": 775073073.0, "step": 24285 }, { "entropy": 0.5851441640406847, "epoch": 2.2344322344322345, "grad_norm": 0.17190493643283844, "learning_rate": 2.5522127150611834e-05, "loss": 0.5672, "mean_token_accuracy": 0.8210060261189938, "num_tokens": 775104780.0, "step": 24286 }, { "entropy": 0.5287623098120093, "epoch": 2.2345242408036756, "grad_norm": 0.16459810733795166, "learning_rate": 2.5519060324470206e-05, "loss": 0.521, "mean_token_accuracy": 0.8359221778810024, "num_tokens": 775137028.0, "step": 24287 }, { "entropy": 0.5121986698359251, "epoch": 2.2346162471751168, "grad_norm": 0.1625107079744339, "learning_rate": 2.5515993498328584e-05, "loss": 0.4996, "mean_token_accuracy": 0.8438336588442326, "num_tokens": 775169518.0, "step": 24288 }, { "entropy": 0.4842740138992667, "epoch": 2.2347082535465583, "grad_norm": 0.15271642804145813, "learning_rate": 2.5512926672186955e-05, "loss": 0.4709, "mean_token_accuracy": 0.8518194742500782, "num_tokens": 775201041.0, "step": 24289 }, { "entropy": 0.48872956773266196, "epoch": 2.2348002599179995, "grad_norm": 0.15585537254810333, "learning_rate": 2.550985984604533e-05, "loss": 0.4743, "mean_token_accuracy": 0.8481236025691032, "num_tokens": 775233344.0, "step": 24290 }, { "entropy": 0.5497427005320787, "epoch": 2.2348922662894406, "grad_norm": 0.16481535136699677, "learning_rate": 2.55067930199037e-05, "loss": 0.5336, "mean_token_accuracy": 0.8313035257160664, "num_tokens": 775265026.0, "step": 24291 }, { "entropy": 0.5004975832998753, "epoch": 2.2349842726608817, "grad_norm": 0.15798068046569824, "learning_rate": 2.550372619376208e-05, "loss": 0.4902, "mean_token_accuracy": 0.8422435596585274, "num_tokens": 775296832.0, "step": 24292 }, { "entropy": 0.6179549284279346, "epoch": 2.235076279032323, "grad_norm": 0.16982732713222504, "learning_rate": 2.550065936762045e-05, "loss": 0.5949, "mean_token_accuracy": 0.8118578419089317, "num_tokens": 775328874.0, "step": 24293 }, { "entropy": 0.5319094015285373, "epoch": 2.2351682854037644, "grad_norm": 0.15892596542835236, "learning_rate": 2.5497592541478825e-05, "loss": 0.5086, "mean_token_accuracy": 0.835862472653389, "num_tokens": 775360463.0, "step": 24294 }, { "entropy": 0.5362688163295388, "epoch": 2.2352602917752056, "grad_norm": 0.16037821769714355, "learning_rate": 2.5494525715337196e-05, "loss": 0.5241, "mean_token_accuracy": 0.833959873765707, "num_tokens": 775392579.0, "step": 24295 }, { "entropy": 0.5722339199855924, "epoch": 2.2353522981466467, "grad_norm": 0.16844357550144196, "learning_rate": 2.5491458889195574e-05, "loss": 0.5557, "mean_token_accuracy": 0.8246685266494751, "num_tokens": 775424547.0, "step": 24296 }, { "entropy": 0.5404821471311152, "epoch": 2.235444304518088, "grad_norm": 0.16975654661655426, "learning_rate": 2.5488392063053945e-05, "loss": 0.5303, "mean_token_accuracy": 0.8288358375430107, "num_tokens": 775455877.0, "step": 24297 }, { "entropy": 0.6506285755895078, "epoch": 2.235536310889529, "grad_norm": 0.1706564724445343, "learning_rate": 2.5485325236912323e-05, "loss": 0.6363, "mean_token_accuracy": 0.8011028692126274, "num_tokens": 775487875.0, "step": 24298 }, { "entropy": 0.4808059260249138, "epoch": 2.2356283172609706, "grad_norm": 0.15541671216487885, "learning_rate": 2.5482258410770695e-05, "loss": 0.4611, "mean_token_accuracy": 0.8506333529949188, "num_tokens": 775519790.0, "step": 24299 }, { "entropy": 0.50106131285429, "epoch": 2.2357203236324117, "grad_norm": 0.16024284064769745, "learning_rate": 2.547919158462907e-05, "loss": 0.4917, "mean_token_accuracy": 0.8424068167805672, "num_tokens": 775551762.0, "step": 24300 }, { "entropy": 0.495174958370626, "epoch": 2.235812330003853, "grad_norm": 0.16298136115074158, "learning_rate": 2.547612475848744e-05, "loss": 0.4827, "mean_token_accuracy": 0.8485866822302341, "num_tokens": 775582818.0, "step": 24301 }, { "entropy": 0.5220433715730906, "epoch": 2.235904336375294, "grad_norm": 0.17122897505760193, "learning_rate": 2.547305793234582e-05, "loss": 0.5144, "mean_token_accuracy": 0.8308790065348148, "num_tokens": 775615076.0, "step": 24302 }, { "entropy": 0.4616565643809736, "epoch": 2.235996342746735, "grad_norm": 0.15702515840530396, "learning_rate": 2.546999110620419e-05, "loss": 0.4398, "mean_token_accuracy": 0.8569435998797417, "num_tokens": 775646447.0, "step": 24303 }, { "entropy": 0.5251553254202008, "epoch": 2.2360883491181767, "grad_norm": 0.16119636595249176, "learning_rate": 2.5466924280062564e-05, "loss": 0.5095, "mean_token_accuracy": 0.8412710428237915, "num_tokens": 775678218.0, "step": 24304 }, { "entropy": 0.5119995903223753, "epoch": 2.236180355489618, "grad_norm": 0.15722234547138214, "learning_rate": 2.5463857453920936e-05, "loss": 0.5006, "mean_token_accuracy": 0.8385735973715782, "num_tokens": 775710356.0, "step": 24305 }, { "entropy": 0.5194174293428659, "epoch": 2.236272361861059, "grad_norm": 0.1602988988161087, "learning_rate": 2.5460790627779314e-05, "loss": 0.5002, "mean_token_accuracy": 0.8397184312343597, "num_tokens": 775741908.0, "step": 24306 }, { "entropy": 0.6021772241219878, "epoch": 2.2363643682325, "grad_norm": 0.17033201456069946, "learning_rate": 2.5457723801637685e-05, "loss": 0.5825, "mean_token_accuracy": 0.819297481328249, "num_tokens": 775773881.0, "step": 24307 }, { "entropy": 0.5035825171507895, "epoch": 2.236456374603941, "grad_norm": 0.15545876324176788, "learning_rate": 2.545465697549606e-05, "loss": 0.4919, "mean_token_accuracy": 0.8446627594530582, "num_tokens": 775805793.0, "step": 24308 }, { "entropy": 0.5143731497228146, "epoch": 2.2365483809753828, "grad_norm": 0.16165082156658173, "learning_rate": 2.545159014935443e-05, "loss": 0.509, "mean_token_accuracy": 0.8400025926530361, "num_tokens": 775837419.0, "step": 24309 }, { "entropy": 0.6064698565751314, "epoch": 2.236640387346824, "grad_norm": 0.16827626526355743, "learning_rate": 2.544852332321281e-05, "loss": 0.5803, "mean_token_accuracy": 0.8159987926483154, "num_tokens": 775869253.0, "step": 24310 }, { "entropy": 0.5096973879262805, "epoch": 2.236732393718265, "grad_norm": 0.15669800341129303, "learning_rate": 2.544545649707118e-05, "loss": 0.4851, "mean_token_accuracy": 0.8466968983411789, "num_tokens": 775900950.0, "step": 24311 }, { "entropy": 0.36031862278468907, "epoch": 2.236824400089706, "grad_norm": 0.1369396299123764, "learning_rate": 2.5442389670929555e-05, "loss": 0.3466, "mean_token_accuracy": 0.8887723349034786, "num_tokens": 775933392.0, "step": 24312 }, { "entropy": 0.5206055929884315, "epoch": 2.2369164064611473, "grad_norm": 0.1572647988796234, "learning_rate": 2.5439322844787933e-05, "loss": 0.5025, "mean_token_accuracy": 0.8405206575989723, "num_tokens": 775965465.0, "step": 24313 }, { "entropy": 0.49490527040325105, "epoch": 2.237008412832589, "grad_norm": 0.1548217535018921, "learning_rate": 2.5436256018646304e-05, "loss": 0.4793, "mean_token_accuracy": 0.8490888811647892, "num_tokens": 775997520.0, "step": 24314 }, { "entropy": 0.5647716643288732, "epoch": 2.23710041920403, "grad_norm": 0.16890667378902435, "learning_rate": 2.5433189192504682e-05, "loss": 0.5592, "mean_token_accuracy": 0.8211259469389915, "num_tokens": 776030114.0, "step": 24315 }, { "entropy": 0.5357442833483219, "epoch": 2.237192425575471, "grad_norm": 0.1581505686044693, "learning_rate": 2.543012236636305e-05, "loss": 0.5181, "mean_token_accuracy": 0.8353151753544807, "num_tokens": 776062342.0, "step": 24316 }, { "entropy": 0.5412068255245686, "epoch": 2.2372844319469123, "grad_norm": 0.16845126450061798, "learning_rate": 2.5427055540221428e-05, "loss": 0.5223, "mean_token_accuracy": 0.8339249566197395, "num_tokens": 776094136.0, "step": 24317 }, { "entropy": 0.5481019765138626, "epoch": 2.2373764383183534, "grad_norm": 0.16919121146202087, "learning_rate": 2.54239887140798e-05, "loss": 0.5304, "mean_token_accuracy": 0.8315428495407104, "num_tokens": 776125166.0, "step": 24318 }, { "entropy": 0.4751322837546468, "epoch": 2.237468444689795, "grad_norm": 0.15921860933303833, "learning_rate": 2.5420921887938177e-05, "loss": 0.458, "mean_token_accuracy": 0.8537267185747623, "num_tokens": 776156927.0, "step": 24319 }, { "entropy": 0.506112705450505, "epoch": 2.237560451061236, "grad_norm": 0.15846627950668335, "learning_rate": 2.541785506179655e-05, "loss": 0.4876, "mean_token_accuracy": 0.8442728407680988, "num_tokens": 776188487.0, "step": 24320 }, { "entropy": 0.5820613242685795, "epoch": 2.2376524574326773, "grad_norm": 0.17129819095134735, "learning_rate": 2.5414788235654923e-05, "loss": 0.5792, "mean_token_accuracy": 0.8159822188317776, "num_tokens": 776220894.0, "step": 24321 }, { "entropy": 0.5045490614138544, "epoch": 2.2377444638041184, "grad_norm": 0.16366977989673615, "learning_rate": 2.5411721409513295e-05, "loss": 0.4893, "mean_token_accuracy": 0.8440272435545921, "num_tokens": 776252976.0, "step": 24322 }, { "entropy": 0.5627283174544573, "epoch": 2.2378364701755595, "grad_norm": 0.16790516674518585, "learning_rate": 2.5408654583371673e-05, "loss": 0.5539, "mean_token_accuracy": 0.823657676577568, "num_tokens": 776284690.0, "step": 24323 }, { "entropy": 0.5292501971125603, "epoch": 2.237928476547001, "grad_norm": 0.16272322833538055, "learning_rate": 2.5405587757230044e-05, "loss": 0.509, "mean_token_accuracy": 0.8403150960803032, "num_tokens": 776317458.0, "step": 24324 }, { "entropy": 0.5217741560190916, "epoch": 2.2380204829184422, "grad_norm": 0.1655840426683426, "learning_rate": 2.540252093108842e-05, "loss": 0.5136, "mean_token_accuracy": 0.8416092246770859, "num_tokens": 776349056.0, "step": 24325 }, { "entropy": 0.5828493973240256, "epoch": 2.2381124892898834, "grad_norm": 0.17143860459327698, "learning_rate": 2.539945410494679e-05, "loss": 0.5751, "mean_token_accuracy": 0.817868996411562, "num_tokens": 776381336.0, "step": 24326 }, { "entropy": 0.4871199680492282, "epoch": 2.2382044956613245, "grad_norm": 0.16225358843803406, "learning_rate": 2.5396387278805168e-05, "loss": 0.4913, "mean_token_accuracy": 0.843885026872158, "num_tokens": 776413088.0, "step": 24327 }, { "entropy": 0.5522152204066515, "epoch": 2.2382965020327656, "grad_norm": 0.1692233383655548, "learning_rate": 2.539332045266354e-05, "loss": 0.5388, "mean_token_accuracy": 0.8300964161753654, "num_tokens": 776444675.0, "step": 24328 }, { "entropy": 0.5452895136550069, "epoch": 2.2383885084042072, "grad_norm": 0.16591620445251465, "learning_rate": 2.5390253626521914e-05, "loss": 0.5407, "mean_token_accuracy": 0.8283675536513329, "num_tokens": 776476441.0, "step": 24329 }, { "entropy": 0.5817286632955074, "epoch": 2.2384805147756484, "grad_norm": 0.17347632348537445, "learning_rate": 2.5387186800380285e-05, "loss": 0.5759, "mean_token_accuracy": 0.8183329701423645, "num_tokens": 776508159.0, "step": 24330 }, { "entropy": 0.5358168045058846, "epoch": 2.2385725211470895, "grad_norm": 0.16013237833976746, "learning_rate": 2.5384119974238663e-05, "loss": 0.5318, "mean_token_accuracy": 0.8308964818716049, "num_tokens": 776540591.0, "step": 24331 }, { "entropy": 0.5316958306357265, "epoch": 2.2386645275185306, "grad_norm": 0.16230374574661255, "learning_rate": 2.5381053148097034e-05, "loss": 0.5184, "mean_token_accuracy": 0.8297245986759663, "num_tokens": 776571687.0, "step": 24332 }, { "entropy": 0.5510586407035589, "epoch": 2.2387565338899718, "grad_norm": 0.17501583695411682, "learning_rate": 2.537798632195541e-05, "loss": 0.5304, "mean_token_accuracy": 0.8324394300580025, "num_tokens": 776603634.0, "step": 24333 }, { "entropy": 0.5334829948842525, "epoch": 2.2388485402614133, "grad_norm": 0.16416391730308533, "learning_rate": 2.537491949581378e-05, "loss": 0.5245, "mean_token_accuracy": 0.8328782953321934, "num_tokens": 776635711.0, "step": 24334 }, { "entropy": 0.484164847061038, "epoch": 2.2389405466328545, "grad_norm": 0.1538373827934265, "learning_rate": 2.5371852669672158e-05, "loss": 0.4678, "mean_token_accuracy": 0.8493463285267353, "num_tokens": 776668313.0, "step": 24335 }, { "entropy": 0.47262758878059685, "epoch": 2.2390325530042956, "grad_norm": 0.15219049155712128, "learning_rate": 2.536878584353053e-05, "loss": 0.4519, "mean_token_accuracy": 0.8546391576528549, "num_tokens": 776700190.0, "step": 24336 }, { "entropy": 0.5487995930016041, "epoch": 2.2391245593757367, "grad_norm": 0.15739716589450836, "learning_rate": 2.5365719017388907e-05, "loss": 0.5285, "mean_token_accuracy": 0.8381688259541988, "num_tokens": 776732687.0, "step": 24337 }, { "entropy": 0.5696483151987195, "epoch": 2.239216565747178, "grad_norm": 0.17243815958499908, "learning_rate": 2.5362652191247275e-05, "loss": 0.5667, "mean_token_accuracy": 0.8219850175082684, "num_tokens": 776764468.0, "step": 24338 }, { "entropy": 0.5513638705015182, "epoch": 2.2393085721186194, "grad_norm": 0.1593128889799118, "learning_rate": 2.5359585365105653e-05, "loss": 0.5346, "mean_token_accuracy": 0.8316337466239929, "num_tokens": 776797010.0, "step": 24339 }, { "entropy": 0.4262244099518284, "epoch": 2.2394005784900606, "grad_norm": 0.14796385169029236, "learning_rate": 2.5356518538964025e-05, "loss": 0.4091, "mean_token_accuracy": 0.8688991665840149, "num_tokens": 776829158.0, "step": 24340 }, { "entropy": 0.48363923362921923, "epoch": 2.2394925848615017, "grad_norm": 0.1592073291540146, "learning_rate": 2.5353451712822403e-05, "loss": 0.4715, "mean_token_accuracy": 0.8520999848842621, "num_tokens": 776861767.0, "step": 24341 }, { "entropy": 0.6677848733961582, "epoch": 2.239584591232943, "grad_norm": 0.18035776913166046, "learning_rate": 2.5350384886680777e-05, "loss": 0.6548, "mean_token_accuracy": 0.790160272270441, "num_tokens": 776893197.0, "step": 24342 }, { "entropy": 0.5356016643345356, "epoch": 2.239676597604384, "grad_norm": 0.16154247522354126, "learning_rate": 2.534731806053915e-05, "loss": 0.5074, "mean_token_accuracy": 0.8373936228454113, "num_tokens": 776924823.0, "step": 24343 }, { "entropy": 0.5159068126231432, "epoch": 2.2397686039758256, "grad_norm": 0.16089223325252533, "learning_rate": 2.5344251234397527e-05, "loss": 0.5086, "mean_token_accuracy": 0.8412481993436813, "num_tokens": 776957192.0, "step": 24344 }, { "entropy": 0.5054287742823362, "epoch": 2.2398606103472667, "grad_norm": 0.1536366194486618, "learning_rate": 2.5341184408255898e-05, "loss": 0.4912, "mean_token_accuracy": 0.8435785584151745, "num_tokens": 776989706.0, "step": 24345 }, { "entropy": 0.5940820770338178, "epoch": 2.239952616718708, "grad_norm": 0.17417249083518982, "learning_rate": 2.5338117582114273e-05, "loss": 0.5912, "mean_token_accuracy": 0.8197538778185844, "num_tokens": 777021419.0, "step": 24346 }, { "entropy": 0.49537994572892785, "epoch": 2.240044623090149, "grad_norm": 0.16150154173374176, "learning_rate": 2.5335050755972644e-05, "loss": 0.4797, "mean_token_accuracy": 0.8461641930043697, "num_tokens": 777052494.0, "step": 24347 }, { "entropy": 0.5339823719114065, "epoch": 2.24013662946159, "grad_norm": 0.16548269987106323, "learning_rate": 2.5331983929831022e-05, "loss": 0.5215, "mean_token_accuracy": 0.8291599564254284, "num_tokens": 777084375.0, "step": 24348 }, { "entropy": 0.41368464194238186, "epoch": 2.2402286358330317, "grad_norm": 0.14939239621162415, "learning_rate": 2.5328917103689393e-05, "loss": 0.3997, "mean_token_accuracy": 0.8708359077572823, "num_tokens": 777116371.0, "step": 24349 }, { "entropy": 0.4702588440850377, "epoch": 2.240320642204473, "grad_norm": 0.15341639518737793, "learning_rate": 2.5325850277547768e-05, "loss": 0.4592, "mean_token_accuracy": 0.8552411906421185, "num_tokens": 777148203.0, "step": 24350 }, { "entropy": 0.4613325875252485, "epoch": 2.240412648575914, "grad_norm": 0.16294576227664948, "learning_rate": 2.532278345140614e-05, "loss": 0.4464, "mean_token_accuracy": 0.8577227406203747, "num_tokens": 777180197.0, "step": 24351 }, { "entropy": 0.5858495971187949, "epoch": 2.240504654947355, "grad_norm": 0.16987313330173492, "learning_rate": 2.5319716625264517e-05, "loss": 0.5803, "mean_token_accuracy": 0.8179271593689919, "num_tokens": 777212158.0, "step": 24352 }, { "entropy": 0.4230671380646527, "epoch": 2.240596661318796, "grad_norm": 0.1467333734035492, "learning_rate": 2.5316649799122888e-05, "loss": 0.4099, "mean_token_accuracy": 0.8649024739861488, "num_tokens": 777244697.0, "step": 24353 }, { "entropy": 0.4792892299592495, "epoch": 2.240688667690238, "grad_norm": 0.15717226266860962, "learning_rate": 2.5313582972981263e-05, "loss": 0.4685, "mean_token_accuracy": 0.8521118760108948, "num_tokens": 777276869.0, "step": 24354 }, { "entropy": 0.5828973157331347, "epoch": 2.240780674061679, "grad_norm": 0.16724304854869843, "learning_rate": 2.5310516146839634e-05, "loss": 0.5668, "mean_token_accuracy": 0.8199716433882713, "num_tokens": 777308440.0, "step": 24355 }, { "entropy": 0.43065671622753143, "epoch": 2.24087268043312, "grad_norm": 0.15203317999839783, "learning_rate": 2.5307449320698012e-05, "loss": 0.4289, "mean_token_accuracy": 0.8657919950783253, "num_tokens": 777340816.0, "step": 24356 }, { "entropy": 0.5334430038928986, "epoch": 2.240964686804561, "grad_norm": 0.16005828976631165, "learning_rate": 2.5304382494556383e-05, "loss": 0.5292, "mean_token_accuracy": 0.8323092460632324, "num_tokens": 777373370.0, "step": 24357 }, { "entropy": 0.5612389110028744, "epoch": 2.2410566931760023, "grad_norm": 0.16833429038524628, "learning_rate": 2.530131566841476e-05, "loss": 0.542, "mean_token_accuracy": 0.8265917338430882, "num_tokens": 777404648.0, "step": 24358 }, { "entropy": 0.46492713689804077, "epoch": 2.241148699547444, "grad_norm": 0.15303367376327515, "learning_rate": 2.5298248842273133e-05, "loss": 0.4521, "mean_token_accuracy": 0.8549667969346046, "num_tokens": 777436968.0, "step": 24359 }, { "entropy": 0.4836890965234488, "epoch": 2.241240705918885, "grad_norm": 0.1573108732700348, "learning_rate": 2.5295182016131507e-05, "loss": 0.4838, "mean_token_accuracy": 0.8484896086156368, "num_tokens": 777469261.0, "step": 24360 }, { "entropy": 0.5168397426605225, "epoch": 2.241332712290326, "grad_norm": 0.1639476716518402, "learning_rate": 2.529211518998988e-05, "loss": 0.4992, "mean_token_accuracy": 0.84162612631917, "num_tokens": 777500524.0, "step": 24361 }, { "entropy": 0.5430391766130924, "epoch": 2.2414247186617673, "grad_norm": 0.1646198034286499, "learning_rate": 2.5289048363848257e-05, "loss": 0.5276, "mean_token_accuracy": 0.8345617540180683, "num_tokens": 777532451.0, "step": 24362 }, { "entropy": 0.476382315158844, "epoch": 2.2415167250332084, "grad_norm": 0.16003717482089996, "learning_rate": 2.5285981537706628e-05, "loss": 0.4609, "mean_token_accuracy": 0.8531097061932087, "num_tokens": 777564273.0, "step": 24363 }, { "entropy": 0.6268751453608274, "epoch": 2.24160873140465, "grad_norm": 0.17868517339229584, "learning_rate": 2.5282914711565003e-05, "loss": 0.6191, "mean_token_accuracy": 0.8056418374180794, "num_tokens": 777596072.0, "step": 24364 }, { "entropy": 0.5439441259950399, "epoch": 2.241700737776091, "grad_norm": 0.16243098676204681, "learning_rate": 2.5279847885423374e-05, "loss": 0.5413, "mean_token_accuracy": 0.8330697789788246, "num_tokens": 777628480.0, "step": 24365 }, { "entropy": 0.49746915604919195, "epoch": 2.2417927441475323, "grad_norm": 0.15644817054271698, "learning_rate": 2.5276781059281752e-05, "loss": 0.4816, "mean_token_accuracy": 0.8452222049236298, "num_tokens": 777660763.0, "step": 24366 }, { "entropy": 0.5083156190812588, "epoch": 2.2418847505189734, "grad_norm": 0.16087040305137634, "learning_rate": 2.5273714233140123e-05, "loss": 0.4847, "mean_token_accuracy": 0.8468571379780769, "num_tokens": 777691828.0, "step": 24367 }, { "entropy": 0.5523584932088852, "epoch": 2.2419767568904145, "grad_norm": 0.1656283140182495, "learning_rate": 2.5270647406998498e-05, "loss": 0.54, "mean_token_accuracy": 0.8332433439791203, "num_tokens": 777723193.0, "step": 24368 }, { "entropy": 0.5517128221690655, "epoch": 2.242068763261856, "grad_norm": 0.16117045283317566, "learning_rate": 2.526758058085687e-05, "loss": 0.5395, "mean_token_accuracy": 0.8293881081044674, "num_tokens": 777755159.0, "step": 24369 }, { "entropy": 0.43457604572176933, "epoch": 2.2421607696332972, "grad_norm": 0.14923226833343506, "learning_rate": 2.5264513754715247e-05, "loss": 0.4246, "mean_token_accuracy": 0.8633482195436954, "num_tokens": 777787014.0, "step": 24370 }, { "entropy": 0.5166741041466594, "epoch": 2.2422527760047384, "grad_norm": 0.15770655870437622, "learning_rate": 2.526144692857362e-05, "loss": 0.4996, "mean_token_accuracy": 0.8428030759096146, "num_tokens": 777818252.0, "step": 24371 }, { "entropy": 0.5246403128840029, "epoch": 2.2423447823761795, "grad_norm": 0.1602787971496582, "learning_rate": 2.5258380102431993e-05, "loss": 0.4994, "mean_token_accuracy": 0.8391195870935917, "num_tokens": 777850635.0, "step": 24372 }, { "entropy": 0.49173396825790405, "epoch": 2.2424367887476206, "grad_norm": 0.1604403555393219, "learning_rate": 2.525531327629037e-05, "loss": 0.4795, "mean_token_accuracy": 0.8434641771018505, "num_tokens": 777881958.0, "step": 24373 }, { "entropy": 0.5485919881612062, "epoch": 2.2425287951190622, "grad_norm": 0.16202595829963684, "learning_rate": 2.5252246450148742e-05, "loss": 0.5259, "mean_token_accuracy": 0.8337739296257496, "num_tokens": 777913737.0, "step": 24374 }, { "entropy": 0.49599481746554375, "epoch": 2.2426208014905034, "grad_norm": 0.15658308565616608, "learning_rate": 2.524917962400712e-05, "loss": 0.4786, "mean_token_accuracy": 0.8478347584605217, "num_tokens": 777945670.0, "step": 24375 }, { "entropy": 0.5924332290887833, "epoch": 2.2427128078619445, "grad_norm": 0.17418518662452698, "learning_rate": 2.5246112797865488e-05, "loss": 0.5813, "mean_token_accuracy": 0.8177294619381428, "num_tokens": 777977196.0, "step": 24376 }, { "entropy": 0.4989653145894408, "epoch": 2.2428048142333856, "grad_norm": 0.16107451915740967, "learning_rate": 2.5243045971723866e-05, "loss": 0.4928, "mean_token_accuracy": 0.8466594256460667, "num_tokens": 778009415.0, "step": 24377 }, { "entropy": 0.527044277638197, "epoch": 2.2428968206048268, "grad_norm": 0.16310612857341766, "learning_rate": 2.5239979145582238e-05, "loss": 0.5184, "mean_token_accuracy": 0.8345987237989902, "num_tokens": 778040767.0, "step": 24378 }, { "entropy": 0.46537351119332016, "epoch": 2.2429888269762683, "grad_norm": 0.15448464453220367, "learning_rate": 2.5236912319440616e-05, "loss": 0.4538, "mean_token_accuracy": 0.8554851114749908, "num_tokens": 778072063.0, "step": 24379 }, { "entropy": 0.5333629101514816, "epoch": 2.2430808333477095, "grad_norm": 0.165225550532341, "learning_rate": 2.5233845493298987e-05, "loss": 0.5227, "mean_token_accuracy": 0.8333745561540127, "num_tokens": 778103892.0, "step": 24380 }, { "entropy": 0.5864412002265453, "epoch": 2.2431728397191506, "grad_norm": 0.16616566479206085, "learning_rate": 2.523077866715736e-05, "loss": 0.5766, "mean_token_accuracy": 0.8167502582073212, "num_tokens": 778136286.0, "step": 24381 }, { "entropy": 0.47023992077447474, "epoch": 2.2432648460905917, "grad_norm": 0.15855543315410614, "learning_rate": 2.5227711841015733e-05, "loss": 0.4586, "mean_token_accuracy": 0.8508500009775162, "num_tokens": 778168105.0, "step": 24382 }, { "entropy": 0.5161020485684276, "epoch": 2.243356852462033, "grad_norm": 0.15277431905269623, "learning_rate": 2.522464501487411e-05, "loss": 0.4958, "mean_token_accuracy": 0.8432872779667377, "num_tokens": 778200245.0, "step": 24383 }, { "entropy": 0.5153476647101343, "epoch": 2.2434488588334744, "grad_norm": 0.1645563542842865, "learning_rate": 2.5221578188732482e-05, "loss": 0.5044, "mean_token_accuracy": 0.840835515409708, "num_tokens": 778232158.0, "step": 24384 }, { "entropy": 0.5711097605526447, "epoch": 2.2435408652049156, "grad_norm": 0.1661444753408432, "learning_rate": 2.5218511362590857e-05, "loss": 0.5519, "mean_token_accuracy": 0.8210692182183266, "num_tokens": 778263929.0, "step": 24385 }, { "entropy": 0.5389080327004194, "epoch": 2.2436328715763567, "grad_norm": 0.16397835314273834, "learning_rate": 2.5215444536449228e-05, "loss": 0.5255, "mean_token_accuracy": 0.8336172662675381, "num_tokens": 778294888.0, "step": 24386 }, { "entropy": 0.5723375994712114, "epoch": 2.243724877947798, "grad_norm": 0.1744144856929779, "learning_rate": 2.5212377710307606e-05, "loss": 0.5548, "mean_token_accuracy": 0.8236683160066605, "num_tokens": 778326797.0, "step": 24387 }, { "entropy": 0.5896652229130268, "epoch": 2.243816884319239, "grad_norm": 0.1693420559167862, "learning_rate": 2.5209310884165977e-05, "loss": 0.58, "mean_token_accuracy": 0.8153375424444675, "num_tokens": 778359139.0, "step": 24388 }, { "entropy": 0.5235397852957249, "epoch": 2.2439088906906806, "grad_norm": 0.16081227362155914, "learning_rate": 2.5206244058024352e-05, "loss": 0.5079, "mean_token_accuracy": 0.8391230143606663, "num_tokens": 778391249.0, "step": 24389 }, { "entropy": 0.5020115179941058, "epoch": 2.2440008970621217, "grad_norm": 0.15916767716407776, "learning_rate": 2.5203177231882723e-05, "loss": 0.4789, "mean_token_accuracy": 0.8484097085893154, "num_tokens": 778422992.0, "step": 24390 }, { "entropy": 0.5840877443552017, "epoch": 2.244092903433563, "grad_norm": 0.16935677826404572, "learning_rate": 2.52001104057411e-05, "loss": 0.5759, "mean_token_accuracy": 0.8173581138253212, "num_tokens": 778455525.0, "step": 24391 }, { "entropy": 0.5147940805181861, "epoch": 2.244184909805004, "grad_norm": 0.1608891636133194, "learning_rate": 2.5197043579599472e-05, "loss": 0.5063, "mean_token_accuracy": 0.83915850892663, "num_tokens": 778487630.0, "step": 24392 }, { "entropy": 0.5169781651347876, "epoch": 2.244276916176445, "grad_norm": 0.16299013793468475, "learning_rate": 2.5193976753457847e-05, "loss": 0.497, "mean_token_accuracy": 0.836613267660141, "num_tokens": 778519234.0, "step": 24393 }, { "entropy": 0.5107710575684905, "epoch": 2.2443689225478867, "grad_norm": 0.16086171567440033, "learning_rate": 2.519090992731622e-05, "loss": 0.4934, "mean_token_accuracy": 0.8425137288868427, "num_tokens": 778550769.0, "step": 24394 }, { "entropy": 0.5328623354434967, "epoch": 2.244460928919328, "grad_norm": 0.16885226964950562, "learning_rate": 2.5187843101174596e-05, "loss": 0.5193, "mean_token_accuracy": 0.8348193950951099, "num_tokens": 778582377.0, "step": 24395 }, { "entropy": 0.4743041954934597, "epoch": 2.244552935290769, "grad_norm": 0.15618373453617096, "learning_rate": 2.5184776275032968e-05, "loss": 0.4648, "mean_token_accuracy": 0.8546303920447826, "num_tokens": 778614125.0, "step": 24396 }, { "entropy": 0.5729340286925435, "epoch": 2.24464494166221, "grad_norm": 0.1672794669866562, "learning_rate": 2.5181709448891346e-05, "loss": 0.5597, "mean_token_accuracy": 0.820523664355278, "num_tokens": 778646511.0, "step": 24397 }, { "entropy": 0.43367901910096407, "epoch": 2.244736948033651, "grad_norm": 0.15449738502502441, "learning_rate": 2.5178642622749714e-05, "loss": 0.421, "mean_token_accuracy": 0.8664235845208168, "num_tokens": 778677162.0, "step": 24398 }, { "entropy": 0.48690815502777696, "epoch": 2.244828954405093, "grad_norm": 0.15274816751480103, "learning_rate": 2.517557579660809e-05, "loss": 0.4641, "mean_token_accuracy": 0.8516839258372784, "num_tokens": 778709755.0, "step": 24399 }, { "entropy": 0.541214563883841, "epoch": 2.244920960776534, "grad_norm": 0.16176864504814148, "learning_rate": 2.5172508970466463e-05, "loss": 0.5395, "mean_token_accuracy": 0.8299031779170036, "num_tokens": 778741990.0, "step": 24400 }, { "entropy": 0.534924385137856, "epoch": 2.245012967147975, "grad_norm": 0.1629367619752884, "learning_rate": 2.516944214432484e-05, "loss": 0.5239, "mean_token_accuracy": 0.8327656723558903, "num_tokens": 778774305.0, "step": 24401 }, { "entropy": 0.4424242451786995, "epoch": 2.245104973519416, "grad_norm": 0.15352459251880646, "learning_rate": 2.5166375318183212e-05, "loss": 0.4287, "mean_token_accuracy": 0.8639959990978241, "num_tokens": 778806795.0, "step": 24402 }, { "entropy": 0.5612744097597897, "epoch": 2.2451969798908573, "grad_norm": 0.1678120493888855, "learning_rate": 2.5163308492041587e-05, "loss": 0.5422, "mean_token_accuracy": 0.828279260545969, "num_tokens": 778838043.0, "step": 24403 }, { "entropy": 0.624454703181982, "epoch": 2.245288986262299, "grad_norm": 0.1742134541273117, "learning_rate": 2.5160241665899965e-05, "loss": 0.6149, "mean_token_accuracy": 0.8054264448583126, "num_tokens": 778869888.0, "step": 24404 }, { "entropy": 0.4553936976008117, "epoch": 2.24538099263374, "grad_norm": 0.14954820275306702, "learning_rate": 2.5157174839758336e-05, "loss": 0.4424, "mean_token_accuracy": 0.8556513711810112, "num_tokens": 778902048.0, "step": 24405 }, { "entropy": 0.5423066350631416, "epoch": 2.245472999005181, "grad_norm": 0.16385459899902344, "learning_rate": 2.515410801361671e-05, "loss": 0.5252, "mean_token_accuracy": 0.8335962072014809, "num_tokens": 778933764.0, "step": 24406 }, { "entropy": 0.5633779326453805, "epoch": 2.2455650053766223, "grad_norm": 0.16928386688232422, "learning_rate": 2.5151041187475082e-05, "loss": 0.5492, "mean_token_accuracy": 0.8284667693078518, "num_tokens": 778965664.0, "step": 24407 }, { "entropy": 0.5440976684913039, "epoch": 2.2456570117480634, "grad_norm": 0.16413433849811554, "learning_rate": 2.514797436133346e-05, "loss": 0.5314, "mean_token_accuracy": 0.8332220017910004, "num_tokens": 778997309.0, "step": 24408 }, { "entropy": 0.42302100267261267, "epoch": 2.245749018119505, "grad_norm": 0.14876329898834229, "learning_rate": 2.514490753519183e-05, "loss": 0.4087, "mean_token_accuracy": 0.8708441369235516, "num_tokens": 779029692.0, "step": 24409 }, { "entropy": 0.4372321502305567, "epoch": 2.245841024490946, "grad_norm": 0.15705755352973938, "learning_rate": 2.5141840709050206e-05, "loss": 0.4257, "mean_token_accuracy": 0.8605253174901009, "num_tokens": 779061958.0, "step": 24410 }, { "entropy": 0.5268369314726442, "epoch": 2.2459330308623873, "grad_norm": 0.1642853170633316, "learning_rate": 2.5138773882908577e-05, "loss": 0.5159, "mean_token_accuracy": 0.8378218971192837, "num_tokens": 779093949.0, "step": 24411 }, { "entropy": 0.5627773851156235, "epoch": 2.2460250372338284, "grad_norm": 0.16713640093803406, "learning_rate": 2.5135707056766955e-05, "loss": 0.539, "mean_token_accuracy": 0.8283892013132572, "num_tokens": 779125237.0, "step": 24412 }, { "entropy": 0.5697733114939183, "epoch": 2.2461170436052695, "grad_norm": 0.16689471900463104, "learning_rate": 2.5132640230625326e-05, "loss": 0.5559, "mean_token_accuracy": 0.8266318514943123, "num_tokens": 779157015.0, "step": 24413 }, { "entropy": 0.5174546595662832, "epoch": 2.246209049976711, "grad_norm": 0.1619732826948166, "learning_rate": 2.51295734044837e-05, "loss": 0.4936, "mean_token_accuracy": 0.8468924798071384, "num_tokens": 779189493.0, "step": 24414 }, { "entropy": 0.5430443864315748, "epoch": 2.2463010563481522, "grad_norm": 0.1648133248090744, "learning_rate": 2.5126506578342072e-05, "loss": 0.5187, "mean_token_accuracy": 0.8351161368191242, "num_tokens": 779220934.0, "step": 24415 }, { "entropy": 0.4496206697076559, "epoch": 2.2463930627195934, "grad_norm": 0.15882469713687897, "learning_rate": 2.512343975220045e-05, "loss": 0.439, "mean_token_accuracy": 0.8610536381602287, "num_tokens": 779252469.0, "step": 24416 }, { "entropy": 0.525094854645431, "epoch": 2.2464850690910345, "grad_norm": 0.16478121280670166, "learning_rate": 2.512037292605882e-05, "loss": 0.5123, "mean_token_accuracy": 0.8357397168874741, "num_tokens": 779283898.0, "step": 24417 }, { "entropy": 0.5107376324012876, "epoch": 2.2465770754624756, "grad_norm": 0.1605338603258133, "learning_rate": 2.51173060999172e-05, "loss": 0.5048, "mean_token_accuracy": 0.8405421487987041, "num_tokens": 779316076.0, "step": 24418 }, { "entropy": 0.5582011677324772, "epoch": 2.2466690818339172, "grad_norm": 0.1673109233379364, "learning_rate": 2.511423927377557e-05, "loss": 0.5576, "mean_token_accuracy": 0.8199644796550274, "num_tokens": 779347197.0, "step": 24419 }, { "entropy": 0.4149530476424843, "epoch": 2.2467610882053584, "grad_norm": 0.15451844036579132, "learning_rate": 2.5111172447633946e-05, "loss": 0.401, "mean_token_accuracy": 0.8731045313179493, "num_tokens": 779378756.0, "step": 24420 }, { "entropy": 0.6113915294408798, "epoch": 2.2468530945767995, "grad_norm": 0.1740831881761551, "learning_rate": 2.5108105621492317e-05, "loss": 0.5984, "mean_token_accuracy": 0.8123679831624031, "num_tokens": 779410420.0, "step": 24421 }, { "entropy": 0.40971843036822975, "epoch": 2.2469451009482406, "grad_norm": 0.14400969445705414, "learning_rate": 2.5105038795350695e-05, "loss": 0.3882, "mean_token_accuracy": 0.8764366805553436, "num_tokens": 779442639.0, "step": 24422 }, { "entropy": 0.6040834290906787, "epoch": 2.2470371073196818, "grad_norm": 0.16814790666103363, "learning_rate": 2.5101971969209066e-05, "loss": 0.5946, "mean_token_accuracy": 0.815187469124794, "num_tokens": 779474526.0, "step": 24423 }, { "entropy": 0.48675424978137016, "epoch": 2.2471291136911233, "grad_norm": 0.1575809270143509, "learning_rate": 2.509890514306744e-05, "loss": 0.482, "mean_token_accuracy": 0.8450056612491608, "num_tokens": 779506149.0, "step": 24424 }, { "entropy": 0.5450378656387329, "epoch": 2.2472211200625645, "grad_norm": 0.16566257178783417, "learning_rate": 2.5095838316925812e-05, "loss": 0.5299, "mean_token_accuracy": 0.8349120728671551, "num_tokens": 779537564.0, "step": 24425 }, { "entropy": 0.4686151137575507, "epoch": 2.2473131264340056, "grad_norm": 0.1534123569726944, "learning_rate": 2.509277149078419e-05, "loss": 0.4454, "mean_token_accuracy": 0.8554322235286236, "num_tokens": 779569033.0, "step": 24426 }, { "entropy": 0.6027639470994473, "epoch": 2.2474051328054467, "grad_norm": 0.17055819928646088, "learning_rate": 2.508970466464256e-05, "loss": 0.5915, "mean_token_accuracy": 0.8152408674359322, "num_tokens": 779600843.0, "step": 24427 }, { "entropy": 0.4636322585865855, "epoch": 2.247497139176888, "grad_norm": 0.15232105553150177, "learning_rate": 2.5086637838500936e-05, "loss": 0.4532, "mean_token_accuracy": 0.8564231395721436, "num_tokens": 779633129.0, "step": 24428 }, { "entropy": 0.48747340543195605, "epoch": 2.2475891455483294, "grad_norm": 0.15097759664058685, "learning_rate": 2.5083571012359307e-05, "loss": 0.4751, "mean_token_accuracy": 0.8508109115064144, "num_tokens": 779665759.0, "step": 24429 }, { "entropy": 0.5263208476826549, "epoch": 2.2476811519197706, "grad_norm": 0.15841029584407806, "learning_rate": 2.5080504186217685e-05, "loss": 0.516, "mean_token_accuracy": 0.8361768573522568, "num_tokens": 779698372.0, "step": 24430 }, { "entropy": 0.4946761140599847, "epoch": 2.2477731582912117, "grad_norm": 0.16540172696113586, "learning_rate": 2.5077437360076057e-05, "loss": 0.482, "mean_token_accuracy": 0.8508294709026814, "num_tokens": 779729357.0, "step": 24431 }, { "entropy": 0.4124473789706826, "epoch": 2.247865164662653, "grad_norm": 0.14873120188713074, "learning_rate": 2.507437053393443e-05, "loss": 0.4015, "mean_token_accuracy": 0.8680865317583084, "num_tokens": 779761726.0, "step": 24432 }, { "entropy": 0.5100370291620493, "epoch": 2.247957171034094, "grad_norm": 0.16215935349464417, "learning_rate": 2.5071303707792803e-05, "loss": 0.5095, "mean_token_accuracy": 0.8409861102700233, "num_tokens": 779792995.0, "step": 24433 }, { "entropy": 0.4744536383077502, "epoch": 2.2480491774055356, "grad_norm": 0.15314799547195435, "learning_rate": 2.506823688165118e-05, "loss": 0.454, "mean_token_accuracy": 0.8538881242275238, "num_tokens": 779824198.0, "step": 24434 }, { "entropy": 0.5716152116656303, "epoch": 2.2481411837769767, "grad_norm": 0.16827519237995148, "learning_rate": 2.506517005550956e-05, "loss": 0.5665, "mean_token_accuracy": 0.820639468729496, "num_tokens": 779856746.0, "step": 24435 }, { "entropy": 0.5480635203421116, "epoch": 2.248233190148418, "grad_norm": 0.16142991185188293, "learning_rate": 2.5062103229367926e-05, "loss": 0.5262, "mean_token_accuracy": 0.834025152027607, "num_tokens": 779888913.0, "step": 24436 }, { "entropy": 0.44954340253025293, "epoch": 2.248325196519859, "grad_norm": 0.15123535692691803, "learning_rate": 2.5059036403226304e-05, "loss": 0.4429, "mean_token_accuracy": 0.8589532449841499, "num_tokens": 779921335.0, "step": 24437 }, { "entropy": 0.4658341915346682, "epoch": 2.2484172028913, "grad_norm": 0.15378868579864502, "learning_rate": 2.5055969577084676e-05, "loss": 0.4444, "mean_token_accuracy": 0.8579787760972977, "num_tokens": 779953459.0, "step": 24438 }, { "entropy": 0.4356749430298805, "epoch": 2.2485092092627417, "grad_norm": 0.14505207538604736, "learning_rate": 2.5052902750943054e-05, "loss": 0.4054, "mean_token_accuracy": 0.8651524260640144, "num_tokens": 779985021.0, "step": 24439 }, { "entropy": 0.5238208631053567, "epoch": 2.248601215634183, "grad_norm": 0.16008180379867554, "learning_rate": 2.5049835924801425e-05, "loss": 0.5064, "mean_token_accuracy": 0.8424661196768284, "num_tokens": 780017200.0, "step": 24440 }, { "entropy": 0.47878003399819136, "epoch": 2.248693222005624, "grad_norm": 0.15838241577148438, "learning_rate": 2.50467690986598e-05, "loss": 0.4705, "mean_token_accuracy": 0.8517659865319729, "num_tokens": 780049261.0, "step": 24441 }, { "entropy": 0.4969166601076722, "epoch": 2.248785228377065, "grad_norm": 0.158899188041687, "learning_rate": 2.504370227251817e-05, "loss": 0.4857, "mean_token_accuracy": 0.847134705632925, "num_tokens": 780081051.0, "step": 24442 }, { "entropy": 0.5447862390428782, "epoch": 2.248877234748506, "grad_norm": 0.1681572049856186, "learning_rate": 2.504063544637655e-05, "loss": 0.5358, "mean_token_accuracy": 0.82859867811203, "num_tokens": 780112425.0, "step": 24443 }, { "entropy": 0.43117644102312624, "epoch": 2.248969241119948, "grad_norm": 0.14419656991958618, "learning_rate": 2.503756862023492e-05, "loss": 0.4216, "mean_token_accuracy": 0.862595684826374, "num_tokens": 780144590.0, "step": 24444 }, { "entropy": 0.6444276459515095, "epoch": 2.249061247491389, "grad_norm": 0.1797318458557129, "learning_rate": 2.5034501794093295e-05, "loss": 0.639, "mean_token_accuracy": 0.7975261099636555, "num_tokens": 780176487.0, "step": 24445 }, { "entropy": 0.47039001155644655, "epoch": 2.24915325386283, "grad_norm": 0.15178389847278595, "learning_rate": 2.5031434967951666e-05, "loss": 0.4669, "mean_token_accuracy": 0.8556609228253365, "num_tokens": 780208494.0, "step": 24446 }, { "entropy": 0.504041506908834, "epoch": 2.249245260234271, "grad_norm": 0.1651492416858673, "learning_rate": 2.5028368141810044e-05, "loss": 0.501, "mean_token_accuracy": 0.8373551145195961, "num_tokens": 780239818.0, "step": 24447 }, { "entropy": 0.5108443954959512, "epoch": 2.2493372666057123, "grad_norm": 0.16348709166049957, "learning_rate": 2.5025301315668415e-05, "loss": 0.4974, "mean_token_accuracy": 0.8399273790419102, "num_tokens": 780271317.0, "step": 24448 }, { "entropy": 0.5257391878403723, "epoch": 2.249429272977154, "grad_norm": 0.16166585683822632, "learning_rate": 2.502223448952679e-05, "loss": 0.5168, "mean_token_accuracy": 0.8392247445881367, "num_tokens": 780302684.0, "step": 24449 }, { "entropy": 0.5033611818216741, "epoch": 2.249521279348595, "grad_norm": 0.1613195836544037, "learning_rate": 2.501916766338516e-05, "loss": 0.4801, "mean_token_accuracy": 0.8473200723528862, "num_tokens": 780334931.0, "step": 24450 }, { "entropy": 0.40127606107853353, "epoch": 2.249613285720036, "grad_norm": 0.15066500008106232, "learning_rate": 2.501610083724354e-05, "loss": 0.3885, "mean_token_accuracy": 0.8750907555222511, "num_tokens": 780367212.0, "step": 24451 }, { "entropy": 0.48405956383794546, "epoch": 2.2497052920914773, "grad_norm": 0.1550741195678711, "learning_rate": 2.501303401110191e-05, "loss": 0.4691, "mean_token_accuracy": 0.8488504700362682, "num_tokens": 780399513.0, "step": 24452 }, { "entropy": 0.5044801523908973, "epoch": 2.2497972984629184, "grad_norm": 0.15507839620113373, "learning_rate": 2.5009967184960285e-05, "loss": 0.488, "mean_token_accuracy": 0.842807050794363, "num_tokens": 780431327.0, "step": 24453 }, { "entropy": 0.5630951095372438, "epoch": 2.24988930483436, "grad_norm": 0.16077059507369995, "learning_rate": 2.5006900358818657e-05, "loss": 0.5516, "mean_token_accuracy": 0.8298156447708607, "num_tokens": 780463246.0, "step": 24454 }, { "entropy": 0.4360450751846656, "epoch": 2.249981311205801, "grad_norm": 0.1492619663476944, "learning_rate": 2.5003833532677035e-05, "loss": 0.423, "mean_token_accuracy": 0.8646026328206062, "num_tokens": 780495539.0, "step": 24455 }, { "entropy": 0.545049782609567, "epoch": 2.2500733175772423, "grad_norm": 0.16018982231616974, "learning_rate": 2.5000766706535406e-05, "loss": 0.5296, "mean_token_accuracy": 0.8372747153043747, "num_tokens": 780527880.0, "step": 24456 }, { "entropy": 0.6002118424512446, "epoch": 2.2501653239486834, "grad_norm": 0.1648840755224228, "learning_rate": 2.4997699880393784e-05, "loss": 0.5872, "mean_token_accuracy": 0.8171718716621399, "num_tokens": 780560581.0, "step": 24457 }, { "entropy": 0.45802199421450496, "epoch": 2.2502573303201245, "grad_norm": 0.14949658513069153, "learning_rate": 2.4994633054252155e-05, "loss": 0.4363, "mean_token_accuracy": 0.858353715389967, "num_tokens": 780592693.0, "step": 24458 }, { "entropy": 0.38501535763498396, "epoch": 2.250349336691566, "grad_norm": 0.14349797368049622, "learning_rate": 2.499156622811053e-05, "loss": 0.3733, "mean_token_accuracy": 0.8800480663776398, "num_tokens": 780624905.0, "step": 24459 }, { "entropy": 0.5534564238041639, "epoch": 2.2504413430630072, "grad_norm": 0.16110654175281525, "learning_rate": 2.4988499401968904e-05, "loss": 0.5576, "mean_token_accuracy": 0.8260485045611858, "num_tokens": 780657508.0, "step": 24460 }, { "entropy": 0.5246065864339471, "epoch": 2.2505333494344484, "grad_norm": 0.1625121533870697, "learning_rate": 2.498543257582728e-05, "loss": 0.5082, "mean_token_accuracy": 0.8404434099793434, "num_tokens": 780689331.0, "step": 24461 }, { "entropy": 0.5219376608729362, "epoch": 2.2506253558058895, "grad_norm": 0.16134411096572876, "learning_rate": 2.498236574968565e-05, "loss": 0.5073, "mean_token_accuracy": 0.8390005268156528, "num_tokens": 780720606.0, "step": 24462 }, { "entropy": 0.42246348038315773, "epoch": 2.2507173621773306, "grad_norm": 0.1560068130493164, "learning_rate": 2.4979298923544025e-05, "loss": 0.4057, "mean_token_accuracy": 0.8687624000012875, "num_tokens": 780752874.0, "step": 24463 }, { "entropy": 0.6125754397362471, "epoch": 2.2508093685487722, "grad_norm": 0.17022131383419037, "learning_rate": 2.49762320974024e-05, "loss": 0.5954, "mean_token_accuracy": 0.8155272156000137, "num_tokens": 780784395.0, "step": 24464 }, { "entropy": 0.5393954768078402, "epoch": 2.2509013749202134, "grad_norm": 0.15903140604496002, "learning_rate": 2.4973165271260774e-05, "loss": 0.517, "mean_token_accuracy": 0.8344217278063297, "num_tokens": 780816642.0, "step": 24465 }, { "entropy": 0.5208977954462171, "epoch": 2.2509933812916545, "grad_norm": 0.16028986871242523, "learning_rate": 2.4970098445119146e-05, "loss": 0.5075, "mean_token_accuracy": 0.8360008150339127, "num_tokens": 780848738.0, "step": 24466 }, { "entropy": 0.5296133942902088, "epoch": 2.2510853876630956, "grad_norm": 0.16917018592357635, "learning_rate": 2.496703161897752e-05, "loss": 0.5228, "mean_token_accuracy": 0.842368271201849, "num_tokens": 780880888.0, "step": 24467 }, { "entropy": 0.5753062106668949, "epoch": 2.2511773940345368, "grad_norm": 0.17010529339313507, "learning_rate": 2.4963964792835895e-05, "loss": 0.5652, "mean_token_accuracy": 0.820952046662569, "num_tokens": 780911617.0, "step": 24468 }, { "entropy": 0.41842825151979923, "epoch": 2.2512694004059783, "grad_norm": 0.15192735195159912, "learning_rate": 2.496089796669427e-05, "loss": 0.398, "mean_token_accuracy": 0.8739656396210194, "num_tokens": 780943322.0, "step": 24469 }, { "entropy": 0.4780424479395151, "epoch": 2.2513614067774195, "grad_norm": 0.1526806801557541, "learning_rate": 2.4957831140552644e-05, "loss": 0.4698, "mean_token_accuracy": 0.85159981995821, "num_tokens": 780975474.0, "step": 24470 }, { "entropy": 0.5382215604186058, "epoch": 2.2514534131488606, "grad_norm": 0.16390009224414825, "learning_rate": 2.4954764314411015e-05, "loss": 0.5092, "mean_token_accuracy": 0.8378297947347164, "num_tokens": 781007568.0, "step": 24471 }, { "entropy": 0.5613689785823226, "epoch": 2.2515454195203017, "grad_norm": 0.1624917834997177, "learning_rate": 2.495169748826939e-05, "loss": 0.5431, "mean_token_accuracy": 0.8307937569916248, "num_tokens": 781039532.0, "step": 24472 }, { "entropy": 0.5461323410272598, "epoch": 2.251637425891743, "grad_norm": 0.16408802568912506, "learning_rate": 2.4948630662127765e-05, "loss": 0.5276, "mean_token_accuracy": 0.8349205777049065, "num_tokens": 781071415.0, "step": 24473 }, { "entropy": 0.44381635589525104, "epoch": 2.2517294322631844, "grad_norm": 0.15590700507164001, "learning_rate": 2.494556383598614e-05, "loss": 0.4233, "mean_token_accuracy": 0.8623992577195168, "num_tokens": 781102286.0, "step": 24474 }, { "entropy": 0.5766895832493901, "epoch": 2.2518214386346256, "grad_norm": 0.1660001426935196, "learning_rate": 2.494249700984451e-05, "loss": 0.5736, "mean_token_accuracy": 0.8201344534754753, "num_tokens": 781134467.0, "step": 24475 }, { "entropy": 0.5389787200838327, "epoch": 2.2519134450060667, "grad_norm": 0.1606208086013794, "learning_rate": 2.4939430183702885e-05, "loss": 0.5277, "mean_token_accuracy": 0.8312935754656792, "num_tokens": 781166486.0, "step": 24476 }, { "entropy": 0.5789657924324274, "epoch": 2.252005451377508, "grad_norm": 0.17104192078113556, "learning_rate": 2.493636335756126e-05, "loss": 0.5642, "mean_token_accuracy": 0.8226261362433434, "num_tokens": 781197764.0, "step": 24477 }, { "entropy": 0.5201153568923473, "epoch": 2.252097457748949, "grad_norm": 0.16283902525901794, "learning_rate": 2.4933296531419635e-05, "loss": 0.5028, "mean_token_accuracy": 0.8411730080842972, "num_tokens": 781229997.0, "step": 24478 }, { "entropy": 0.5015730762388557, "epoch": 2.2521894641203906, "grad_norm": 0.16043440997600555, "learning_rate": 2.493022970527801e-05, "loss": 0.4904, "mean_token_accuracy": 0.845820352435112, "num_tokens": 781261867.0, "step": 24479 }, { "entropy": 0.5474381912499666, "epoch": 2.2522814704918317, "grad_norm": 0.16937081515789032, "learning_rate": 2.4927162879136384e-05, "loss": 0.5356, "mean_token_accuracy": 0.8312846198678017, "num_tokens": 781292713.0, "step": 24480 }, { "entropy": 0.5576001303270459, "epoch": 2.252373476863273, "grad_norm": 0.16416025161743164, "learning_rate": 2.492409605299476e-05, "loss": 0.5452, "mean_token_accuracy": 0.8265961073338985, "num_tokens": 781324828.0, "step": 24481 }, { "entropy": 0.6574952807277441, "epoch": 2.252465483234714, "grad_norm": 0.17643921077251434, "learning_rate": 2.4921029226853133e-05, "loss": 0.6465, "mean_token_accuracy": 0.7983353361487389, "num_tokens": 781357024.0, "step": 24482 }, { "entropy": 0.5279461070895195, "epoch": 2.252557489606155, "grad_norm": 0.15999841690063477, "learning_rate": 2.4917962400711504e-05, "loss": 0.5108, "mean_token_accuracy": 0.8401323445141315, "num_tokens": 781388436.0, "step": 24483 }, { "entropy": 0.471074684523046, "epoch": 2.2526494959775967, "grad_norm": 0.15115118026733398, "learning_rate": 2.491489557456988e-05, "loss": 0.4567, "mean_token_accuracy": 0.8565506935119629, "num_tokens": 781420330.0, "step": 24484 }, { "entropy": 0.4694964112713933, "epoch": 2.252741502349038, "grad_norm": 0.15591749548912048, "learning_rate": 2.4911828748428254e-05, "loss": 0.4634, "mean_token_accuracy": 0.8541263528168201, "num_tokens": 781452751.0, "step": 24485 }, { "entropy": 0.5175333917140961, "epoch": 2.252833508720479, "grad_norm": 0.16194859147071838, "learning_rate": 2.490876192228663e-05, "loss": 0.5133, "mean_token_accuracy": 0.8403844945132732, "num_tokens": 781484653.0, "step": 24486 }, { "entropy": 0.46133989025838673, "epoch": 2.25292551509192, "grad_norm": 0.1502697616815567, "learning_rate": 2.4905695096145003e-05, "loss": 0.4299, "mean_token_accuracy": 0.8624884113669395, "num_tokens": 781516195.0, "step": 24487 }, { "entropy": 0.6106804134324193, "epoch": 2.253017521463361, "grad_norm": 0.17013897001743317, "learning_rate": 2.4902628270003374e-05, "loss": 0.5927, "mean_token_accuracy": 0.8112868815660477, "num_tokens": 781548124.0, "step": 24488 }, { "entropy": 0.46159154525958, "epoch": 2.253109527834803, "grad_norm": 0.16044831275939941, "learning_rate": 2.489956144386175e-05, "loss": 0.4457, "mean_token_accuracy": 0.8588029332458973, "num_tokens": 781580351.0, "step": 24489 }, { "entropy": 0.520889014005661, "epoch": 2.253201534206244, "grad_norm": 0.1641312688589096, "learning_rate": 2.4896494617720124e-05, "loss": 0.5178, "mean_token_accuracy": 0.8346798755228519, "num_tokens": 781612830.0, "step": 24490 }, { "entropy": 0.6473383642733097, "epoch": 2.253293540577685, "grad_norm": 0.17889389395713806, "learning_rate": 2.4893427791578498e-05, "loss": 0.6328, "mean_token_accuracy": 0.8036094158887863, "num_tokens": 781644872.0, "step": 24491 }, { "entropy": 0.549550611525774, "epoch": 2.253385546949126, "grad_norm": 0.1616404950618744, "learning_rate": 2.489036096543687e-05, "loss": 0.5321, "mean_token_accuracy": 0.8318069986999035, "num_tokens": 781676547.0, "step": 24492 }, { "entropy": 0.45412088790908456, "epoch": 2.2534775533205673, "grad_norm": 0.1519334614276886, "learning_rate": 2.4887294139295244e-05, "loss": 0.4412, "mean_token_accuracy": 0.8587366156280041, "num_tokens": 781708628.0, "step": 24493 }, { "entropy": 0.4901073444634676, "epoch": 2.253569559692009, "grad_norm": 0.16024750471115112, "learning_rate": 2.488422731315362e-05, "loss": 0.4748, "mean_token_accuracy": 0.8471357449889183, "num_tokens": 781740297.0, "step": 24494 }, { "entropy": 0.5531571842730045, "epoch": 2.25366156606345, "grad_norm": 0.1645442545413971, "learning_rate": 2.4881160487011993e-05, "loss": 0.5372, "mean_token_accuracy": 0.8301925919950008, "num_tokens": 781771753.0, "step": 24495 }, { "entropy": 0.5918507222086191, "epoch": 2.253753572434891, "grad_norm": 0.17048805952072144, "learning_rate": 2.4878093660870365e-05, "loss": 0.5687, "mean_token_accuracy": 0.8213001601397991, "num_tokens": 781802742.0, "step": 24496 }, { "entropy": 0.501718427054584, "epoch": 2.2538455788063323, "grad_norm": 0.15854963660240173, "learning_rate": 2.487502683472874e-05, "loss": 0.4892, "mean_token_accuracy": 0.8466691970825195, "num_tokens": 781834588.0, "step": 24497 }, { "entropy": 0.4986535422503948, "epoch": 2.2539375851777734, "grad_norm": 0.1664598435163498, "learning_rate": 2.4871960008587114e-05, "loss": 0.4883, "mean_token_accuracy": 0.8417487591505051, "num_tokens": 781866257.0, "step": 24498 }, { "entropy": 0.584959477186203, "epoch": 2.254029591549215, "grad_norm": 0.16752810776233673, "learning_rate": 2.486889318244549e-05, "loss": 0.5696, "mean_token_accuracy": 0.8182439506053925, "num_tokens": 781897811.0, "step": 24499 }, { "entropy": 0.475332111120224, "epoch": 2.254121597920656, "grad_norm": 0.15829338133335114, "learning_rate": 2.4865826356303863e-05, "loss": 0.4549, "mean_token_accuracy": 0.854022353887558, "num_tokens": 781929011.0, "step": 24500 }, { "entropy": 0.48116996232420206, "epoch": 2.2542136042920973, "grad_norm": 0.16026760637760162, "learning_rate": 2.4862759530162234e-05, "loss": 0.469, "mean_token_accuracy": 0.8504132404923439, "num_tokens": 781960808.0, "step": 24501 }, { "entropy": 0.5311038568615913, "epoch": 2.2543056106635384, "grad_norm": 0.1617385596036911, "learning_rate": 2.485969270402061e-05, "loss": 0.5309, "mean_token_accuracy": 0.8295583054423332, "num_tokens": 781993376.0, "step": 24502 }, { "entropy": 0.5148683488368988, "epoch": 2.2543976170349795, "grad_norm": 0.15333020687103271, "learning_rate": 2.4856625877878984e-05, "loss": 0.5022, "mean_token_accuracy": 0.8399798423051834, "num_tokens": 782025895.0, "step": 24503 }, { "entropy": 0.47817657608538866, "epoch": 2.254489623406421, "grad_norm": 0.15285184979438782, "learning_rate": 2.485355905173736e-05, "loss": 0.4726, "mean_token_accuracy": 0.8536534532904625, "num_tokens": 782058360.0, "step": 24504 }, { "entropy": 0.5585655486211181, "epoch": 2.2545816297778623, "grad_norm": 0.170372873544693, "learning_rate": 2.485049222559573e-05, "loss": 0.5476, "mean_token_accuracy": 0.8293003253638744, "num_tokens": 782089844.0, "step": 24505 }, { "entropy": 0.6018581814132631, "epoch": 2.2546736361493034, "grad_norm": 0.17004404962062836, "learning_rate": 2.4847425399454104e-05, "loss": 0.5874, "mean_token_accuracy": 0.8147604614496231, "num_tokens": 782122152.0, "step": 24506 }, { "entropy": 0.6774228140711784, "epoch": 2.2547656425207445, "grad_norm": 0.1819961667060852, "learning_rate": 2.484435857331248e-05, "loss": 0.6551, "mean_token_accuracy": 0.7967884168028831, "num_tokens": 782153598.0, "step": 24507 }, { "entropy": 0.4220258230343461, "epoch": 2.2548576488921857, "grad_norm": 0.15510942041873932, "learning_rate": 2.4841291747170854e-05, "loss": 0.4141, "mean_token_accuracy": 0.8674763739109039, "num_tokens": 782185005.0, "step": 24508 }, { "entropy": 0.4285238836891949, "epoch": 2.2549496552636272, "grad_norm": 0.155912846326828, "learning_rate": 2.4838224921029228e-05, "loss": 0.4116, "mean_token_accuracy": 0.8656356893479824, "num_tokens": 782216040.0, "step": 24509 }, { "entropy": 0.5349156651645899, "epoch": 2.2550416616350684, "grad_norm": 0.16345177590847015, "learning_rate": 2.4835158094887603e-05, "loss": 0.5269, "mean_token_accuracy": 0.8312010541558266, "num_tokens": 782247007.0, "step": 24510 }, { "entropy": 0.5115064606070518, "epoch": 2.2551336680065095, "grad_norm": 0.15934626758098602, "learning_rate": 2.4832091268745978e-05, "loss": 0.5002, "mean_token_accuracy": 0.8407339528203011, "num_tokens": 782279710.0, "step": 24511 }, { "entropy": 0.4831138700246811, "epoch": 2.2552256743779506, "grad_norm": 0.16171862185001373, "learning_rate": 2.4829024442604352e-05, "loss": 0.476, "mean_token_accuracy": 0.8500587604939938, "num_tokens": 782311075.0, "step": 24512 }, { "entropy": 0.49334053695201874, "epoch": 2.2553176807493918, "grad_norm": 0.16397272050380707, "learning_rate": 2.4825957616462723e-05, "loss": 0.4763, "mean_token_accuracy": 0.8462398946285248, "num_tokens": 782342697.0, "step": 24513 }, { "entropy": 0.5089993346482515, "epoch": 2.2554096871208333, "grad_norm": 0.15748484432697296, "learning_rate": 2.4822890790321098e-05, "loss": 0.4926, "mean_token_accuracy": 0.8436431288719177, "num_tokens": 782375465.0, "step": 24514 }, { "entropy": 0.6928789634257555, "epoch": 2.2555016934922745, "grad_norm": 0.17472220957279205, "learning_rate": 2.4819823964179473e-05, "loss": 0.6791, "mean_token_accuracy": 0.7882322818040848, "num_tokens": 782407447.0, "step": 24515 }, { "entropy": 0.5123721659183502, "epoch": 2.2555936998637156, "grad_norm": 0.1610775589942932, "learning_rate": 2.4816757138037847e-05, "loss": 0.4915, "mean_token_accuracy": 0.8403894454240799, "num_tokens": 782439496.0, "step": 24516 }, { "entropy": 0.5833586417138577, "epoch": 2.2556857062351567, "grad_norm": 0.1626797765493393, "learning_rate": 2.4813690311896222e-05, "loss": 0.5705, "mean_token_accuracy": 0.8220996707677841, "num_tokens": 782471834.0, "step": 24517 }, { "entropy": 0.43609125819057226, "epoch": 2.255777712606598, "grad_norm": 0.15197442471981049, "learning_rate": 2.4810623485754593e-05, "loss": 0.4108, "mean_token_accuracy": 0.8651783876121044, "num_tokens": 782503200.0, "step": 24518 }, { "entropy": 0.5956856124103069, "epoch": 2.2558697189780395, "grad_norm": 0.16496317088603973, "learning_rate": 2.4807556659612968e-05, "loss": 0.5618, "mean_token_accuracy": 0.8219750337302685, "num_tokens": 782534745.0, "step": 24519 }, { "entropy": 0.5714917960576713, "epoch": 2.2559617253494806, "grad_norm": 0.16621796786785126, "learning_rate": 2.4804489833471343e-05, "loss": 0.5604, "mean_token_accuracy": 0.8245766907930374, "num_tokens": 782567335.0, "step": 24520 }, { "entropy": 0.540440620854497, "epoch": 2.2560537317209217, "grad_norm": 0.17023427784442902, "learning_rate": 2.4801423007329717e-05, "loss": 0.5379, "mean_token_accuracy": 0.8282462023198605, "num_tokens": 782598384.0, "step": 24521 }, { "entropy": 0.5564644341357052, "epoch": 2.256145738092363, "grad_norm": 0.16531458497047424, "learning_rate": 2.479835618118809e-05, "loss": 0.5532, "mean_token_accuracy": 0.8233073800802231, "num_tokens": 782630802.0, "step": 24522 }, { "entropy": 0.48090568371117115, "epoch": 2.256237744463804, "grad_norm": 0.1566942036151886, "learning_rate": 2.4795289355046463e-05, "loss": 0.4593, "mean_token_accuracy": 0.8497747778892517, "num_tokens": 782662065.0, "step": 24523 }, { "entropy": 0.51016257237643, "epoch": 2.2563297508352456, "grad_norm": 0.1648634374141693, "learning_rate": 2.4792222528904838e-05, "loss": 0.4954, "mean_token_accuracy": 0.8422924727201462, "num_tokens": 782694070.0, "step": 24524 }, { "entropy": 0.509133679792285, "epoch": 2.2564217572066867, "grad_norm": 0.17088322341442108, "learning_rate": 2.4789155702763212e-05, "loss": 0.5055, "mean_token_accuracy": 0.8401783108711243, "num_tokens": 782725425.0, "step": 24525 }, { "entropy": 0.5174186616204679, "epoch": 2.256513763578128, "grad_norm": 0.1636975109577179, "learning_rate": 2.4786088876621584e-05, "loss": 0.4949, "mean_token_accuracy": 0.8454762101173401, "num_tokens": 782757687.0, "step": 24526 }, { "entropy": 0.5669670556671917, "epoch": 2.256605769949569, "grad_norm": 0.16512200236320496, "learning_rate": 2.478302205047996e-05, "loss": 0.5519, "mean_token_accuracy": 0.8250644579529762, "num_tokens": 782790071.0, "step": 24527 }, { "entropy": 0.5113000916317105, "epoch": 2.25669777632101, "grad_norm": 0.1612825095653534, "learning_rate": 2.4779955224338333e-05, "loss": 0.5029, "mean_token_accuracy": 0.8374633640050888, "num_tokens": 782822241.0, "step": 24528 }, { "entropy": 0.46844421699643135, "epoch": 2.2567897826924517, "grad_norm": 0.1479194313287735, "learning_rate": 2.4776888398196708e-05, "loss": 0.4562, "mean_token_accuracy": 0.8551558628678322, "num_tokens": 782854623.0, "step": 24529 }, { "entropy": 0.6047173850238323, "epoch": 2.256881789063893, "grad_norm": 0.17354673147201538, "learning_rate": 2.4773821572055082e-05, "loss": 0.6004, "mean_token_accuracy": 0.8110603019595146, "num_tokens": 782886561.0, "step": 24530 }, { "entropy": 0.4990354971960187, "epoch": 2.256973795435334, "grad_norm": 0.15737511217594147, "learning_rate": 2.4770754745913454e-05, "loss": 0.4819, "mean_token_accuracy": 0.8438973352313042, "num_tokens": 782918129.0, "step": 24531 }, { "entropy": 0.5194796742871404, "epoch": 2.257065801806775, "grad_norm": 0.15906347334384918, "learning_rate": 2.4767687919771828e-05, "loss": 0.5052, "mean_token_accuracy": 0.8376389518380165, "num_tokens": 782950225.0, "step": 24532 }, { "entropy": 0.6211152318865061, "epoch": 2.257157808178216, "grad_norm": 0.17936137318611145, "learning_rate": 2.4764621093630203e-05, "loss": 0.6169, "mean_token_accuracy": 0.8096489198505878, "num_tokens": 782980816.0, "step": 24533 }, { "entropy": 0.5435153124853969, "epoch": 2.257249814549658, "grad_norm": 0.17536482214927673, "learning_rate": 2.4761554267488578e-05, "loss": 0.5153, "mean_token_accuracy": 0.8356560617685318, "num_tokens": 783012137.0, "step": 24534 }, { "entropy": 0.3533323109149933, "epoch": 2.257341820921099, "grad_norm": 0.1431332528591156, "learning_rate": 2.475848744134695e-05, "loss": 0.3393, "mean_token_accuracy": 0.891213234513998, "num_tokens": 783044064.0, "step": 24535 }, { "entropy": 0.5871488004922867, "epoch": 2.25743382729254, "grad_norm": 0.1686410903930664, "learning_rate": 2.4755420615205323e-05, "loss": 0.5875, "mean_token_accuracy": 0.816766157746315, "num_tokens": 783076146.0, "step": 24536 }, { "entropy": 0.5035870256833732, "epoch": 2.257525833663981, "grad_norm": 0.16289837658405304, "learning_rate": 2.4752353789063698e-05, "loss": 0.4946, "mean_token_accuracy": 0.8414501920342445, "num_tokens": 783108254.0, "step": 24537 }, { "entropy": 0.5140165844932199, "epoch": 2.2576178400354223, "grad_norm": 0.15949609875679016, "learning_rate": 2.4749286962922073e-05, "loss": 0.4915, "mean_token_accuracy": 0.8420959450304508, "num_tokens": 783140112.0, "step": 24538 }, { "entropy": 0.5072447564452887, "epoch": 2.257709846406864, "grad_norm": 0.155429407954216, "learning_rate": 2.4746220136780447e-05, "loss": 0.4941, "mean_token_accuracy": 0.8427579551935196, "num_tokens": 783172161.0, "step": 24539 }, { "entropy": 0.4986793613061309, "epoch": 2.257801852778305, "grad_norm": 0.15994855761528015, "learning_rate": 2.474315331063882e-05, "loss": 0.484, "mean_token_accuracy": 0.8471425473690033, "num_tokens": 783204560.0, "step": 24540 }, { "entropy": 0.5655517764389515, "epoch": 2.257893859149746, "grad_norm": 0.16681864857673645, "learning_rate": 2.4740086484497197e-05, "loss": 0.564, "mean_token_accuracy": 0.8241430595517159, "num_tokens": 783236323.0, "step": 24541 }, { "entropy": 0.549525011330843, "epoch": 2.2579858655211873, "grad_norm": 0.16640271246433258, "learning_rate": 2.473701965835557e-05, "loss": 0.5408, "mean_token_accuracy": 0.8285206146538258, "num_tokens": 783268474.0, "step": 24542 }, { "entropy": 0.4294705423526466, "epoch": 2.2580778718926284, "grad_norm": 0.145483136177063, "learning_rate": 2.4733952832213943e-05, "loss": 0.4172, "mean_token_accuracy": 0.8666560985147953, "num_tokens": 783301010.0, "step": 24543 }, { "entropy": 0.5375892482697964, "epoch": 2.25816987826407, "grad_norm": 0.16489608585834503, "learning_rate": 2.4730886006072317e-05, "loss": 0.5124, "mean_token_accuracy": 0.8383024483919144, "num_tokens": 783332217.0, "step": 24544 }, { "entropy": 0.517590269446373, "epoch": 2.258261884635511, "grad_norm": 0.16224044561386108, "learning_rate": 2.4727819179930692e-05, "loss": 0.4948, "mean_token_accuracy": 0.8458204306662083, "num_tokens": 783364052.0, "step": 24545 }, { "entropy": 0.5708387503400445, "epoch": 2.2583538910069523, "grad_norm": 0.1646776795387268, "learning_rate": 2.4724752353789067e-05, "loss": 0.5673, "mean_token_accuracy": 0.8216243125498295, "num_tokens": 783396014.0, "step": 24546 }, { "entropy": 0.5862235352396965, "epoch": 2.2584458973783934, "grad_norm": 0.16728754341602325, "learning_rate": 2.472168552764744e-05, "loss": 0.5728, "mean_token_accuracy": 0.8219691850244999, "num_tokens": 783428174.0, "step": 24547 }, { "entropy": 0.47828277200460434, "epoch": 2.2585379037498345, "grad_norm": 0.15088939666748047, "learning_rate": 2.4718618701505812e-05, "loss": 0.4569, "mean_token_accuracy": 0.851401686668396, "num_tokens": 783460694.0, "step": 24548 }, { "entropy": 0.40027841553092003, "epoch": 2.258629910121276, "grad_norm": 0.1434927135705948, "learning_rate": 2.4715551875364187e-05, "loss": 0.3884, "mean_token_accuracy": 0.8751315958797932, "num_tokens": 783493200.0, "step": 24549 }, { "entropy": 0.6109405881725252, "epoch": 2.2587219164927173, "grad_norm": 0.17207078635692596, "learning_rate": 2.4712485049222562e-05, "loss": 0.5991, "mean_token_accuracy": 0.8106729052960873, "num_tokens": 783525220.0, "step": 24550 }, { "entropy": 0.5302469884045422, "epoch": 2.2588139228641584, "grad_norm": 0.1606551706790924, "learning_rate": 2.4709418223080936e-05, "loss": 0.5122, "mean_token_accuracy": 0.8389846384525299, "num_tokens": 783557580.0, "step": 24551 }, { "entropy": 0.4937970908358693, "epoch": 2.2589059292355995, "grad_norm": 0.1588021069765091, "learning_rate": 2.4706351396939308e-05, "loss": 0.4791, "mean_token_accuracy": 0.8491972386837006, "num_tokens": 783589421.0, "step": 24552 }, { "entropy": 0.43799124751240015, "epoch": 2.2589979356070407, "grad_norm": 0.14956773817539215, "learning_rate": 2.4703284570797682e-05, "loss": 0.4218, "mean_token_accuracy": 0.8641326576471329, "num_tokens": 783620996.0, "step": 24553 }, { "entropy": 0.47200826997868717, "epoch": 2.2590899419784822, "grad_norm": 0.1518024206161499, "learning_rate": 2.4700217744656057e-05, "loss": 0.4456, "mean_token_accuracy": 0.8550765588879585, "num_tokens": 783652552.0, "step": 24554 }, { "entropy": 0.535239209420979, "epoch": 2.2591819483499234, "grad_norm": 0.16255293786525726, "learning_rate": 2.469715091851443e-05, "loss": 0.526, "mean_token_accuracy": 0.8352057933807373, "num_tokens": 783684682.0, "step": 24555 }, { "entropy": 0.6082567740231752, "epoch": 2.2592739547213645, "grad_norm": 0.17004114389419556, "learning_rate": 2.4694084092372803e-05, "loss": 0.5961, "mean_token_accuracy": 0.8115198276937008, "num_tokens": 783716548.0, "step": 24556 }, { "entropy": 0.46990737272426486, "epoch": 2.2593659610928056, "grad_norm": 0.1491926908493042, "learning_rate": 2.4691017266231177e-05, "loss": 0.4518, "mean_token_accuracy": 0.854059312492609, "num_tokens": 783748524.0, "step": 24557 }, { "entropy": 0.5267287963069975, "epoch": 2.2594579674642468, "grad_norm": 0.16830958425998688, "learning_rate": 2.4687950440089552e-05, "loss": 0.5117, "mean_token_accuracy": 0.8384485021233559, "num_tokens": 783778545.0, "step": 24558 }, { "entropy": 0.4913132069632411, "epoch": 2.2595499738356883, "grad_norm": 0.16261932253837585, "learning_rate": 2.4684883613947927e-05, "loss": 0.4742, "mean_token_accuracy": 0.8495109640061855, "num_tokens": 783810581.0, "step": 24559 }, { "entropy": 0.6566716469824314, "epoch": 2.2596419802071295, "grad_norm": 0.17744749784469604, "learning_rate": 2.46818167878063e-05, "loss": 0.6459, "mean_token_accuracy": 0.7960399203002453, "num_tokens": 783842929.0, "step": 24560 }, { "entropy": 0.6291407654061913, "epoch": 2.2597339865785706, "grad_norm": 0.17627926170825958, "learning_rate": 2.4678749961664673e-05, "loss": 0.6203, "mean_token_accuracy": 0.8053965270519257, "num_tokens": 783874552.0, "step": 24561 }, { "entropy": 0.5177642283961177, "epoch": 2.2598259929500117, "grad_norm": 0.1649087816476822, "learning_rate": 2.4675683135523047e-05, "loss": 0.5201, "mean_token_accuracy": 0.8348177187144756, "num_tokens": 783907053.0, "step": 24562 }, { "entropy": 0.5501558519899845, "epoch": 2.259917999321453, "grad_norm": 0.16829080879688263, "learning_rate": 2.4672616309381422e-05, "loss": 0.5353, "mean_token_accuracy": 0.8323058933019638, "num_tokens": 783939068.0, "step": 24563 }, { "entropy": 0.6146047962829471, "epoch": 2.2600100056928945, "grad_norm": 0.17838849127292633, "learning_rate": 2.4669549483239797e-05, "loss": 0.6069, "mean_token_accuracy": 0.810126181691885, "num_tokens": 783970776.0, "step": 24564 }, { "entropy": 0.4412050899118185, "epoch": 2.2601020120643356, "grad_norm": 0.1550249308347702, "learning_rate": 2.4666482657098168e-05, "loss": 0.4225, "mean_token_accuracy": 0.8615644536912441, "num_tokens": 784002607.0, "step": 24565 }, { "entropy": 0.5150998014723882, "epoch": 2.2601940184357767, "grad_norm": 0.161502406001091, "learning_rate": 2.4663415830956543e-05, "loss": 0.5014, "mean_token_accuracy": 0.8421926386654377, "num_tokens": 784034268.0, "step": 24566 }, { "entropy": 0.4645986035466194, "epoch": 2.260286024807218, "grad_norm": 0.15727870166301727, "learning_rate": 2.4660349004814917e-05, "loss": 0.4489, "mean_token_accuracy": 0.8566266112029552, "num_tokens": 784066159.0, "step": 24567 }, { "entropy": 0.4918628418818116, "epoch": 2.260378031178659, "grad_norm": 0.15515749156475067, "learning_rate": 2.4657282178673292e-05, "loss": 0.467, "mean_token_accuracy": 0.8513886220753193, "num_tokens": 784098088.0, "step": 24568 }, { "entropy": 0.5078882230445743, "epoch": 2.2604700375501006, "grad_norm": 0.15695063769817352, "learning_rate": 2.4654215352531666e-05, "loss": 0.4965, "mean_token_accuracy": 0.8414461426436901, "num_tokens": 784130273.0, "step": 24569 }, { "entropy": 0.5596571043133736, "epoch": 2.2605620439215417, "grad_norm": 0.16891182959079742, "learning_rate": 2.4651148526390038e-05, "loss": 0.5555, "mean_token_accuracy": 0.8246101923286915, "num_tokens": 784161672.0, "step": 24570 }, { "entropy": 0.4478213884867728, "epoch": 2.260654050292983, "grad_norm": 0.15142232179641724, "learning_rate": 2.4648081700248416e-05, "loss": 0.436, "mean_token_accuracy": 0.8658694066107273, "num_tokens": 784193681.0, "step": 24571 }, { "entropy": 0.4635441112332046, "epoch": 2.260746056664424, "grad_norm": 0.1574452966451645, "learning_rate": 2.464501487410679e-05, "loss": 0.4525, "mean_token_accuracy": 0.8526921980082989, "num_tokens": 784225383.0, "step": 24572 }, { "entropy": 0.5709956455975771, "epoch": 2.260838063035865, "grad_norm": 0.168389230966568, "learning_rate": 2.464194804796516e-05, "loss": 0.5614, "mean_token_accuracy": 0.8231245279312134, "num_tokens": 784257104.0, "step": 24573 }, { "entropy": 0.3983075665310025, "epoch": 2.2609300694073067, "grad_norm": 0.14919939637184143, "learning_rate": 2.4638881221823536e-05, "loss": 0.3853, "mean_token_accuracy": 0.8719161339104176, "num_tokens": 784288898.0, "step": 24574 }, { "entropy": 0.6055213734507561, "epoch": 2.261022075778748, "grad_norm": 0.16822756826877594, "learning_rate": 2.463581439568191e-05, "loss": 0.5921, "mean_token_accuracy": 0.8165372014045715, "num_tokens": 784320886.0, "step": 24575 }, { "entropy": 0.5183099191635847, "epoch": 2.261114082150189, "grad_norm": 0.16231697797775269, "learning_rate": 2.4632747569540286e-05, "loss": 0.5147, "mean_token_accuracy": 0.8373265005648136, "num_tokens": 784352704.0, "step": 24576 }, { "entropy": 0.39107468351721764, "epoch": 2.26120608852163, "grad_norm": 0.14610712230205536, "learning_rate": 2.462968074339866e-05, "loss": 0.3725, "mean_token_accuracy": 0.8809253200888634, "num_tokens": 784384399.0, "step": 24577 }, { "entropy": 0.48910402320325375, "epoch": 2.261298094893071, "grad_norm": 0.1570131927728653, "learning_rate": 2.462661391725703e-05, "loss": 0.4705, "mean_token_accuracy": 0.8513090088963509, "num_tokens": 784416473.0, "step": 24578 }, { "entropy": 0.5405677361413836, "epoch": 2.261390101264513, "grad_norm": 0.1630258560180664, "learning_rate": 2.4623547091115406e-05, "loss": 0.5272, "mean_token_accuracy": 0.8282141461968422, "num_tokens": 784448268.0, "step": 24579 }, { "entropy": 0.5196483638137579, "epoch": 2.261482107635954, "grad_norm": 0.16017219424247742, "learning_rate": 2.462048026497378e-05, "loss": 0.505, "mean_token_accuracy": 0.8393938057124615, "num_tokens": 784480767.0, "step": 24580 }, { "entropy": 0.5094812074676156, "epoch": 2.261574114007395, "grad_norm": 0.15653620660305023, "learning_rate": 2.4617413438832155e-05, "loss": 0.4942, "mean_token_accuracy": 0.8429575748741627, "num_tokens": 784512762.0, "step": 24581 }, { "entropy": 0.5012815929949284, "epoch": 2.261666120378836, "grad_norm": 0.15092526376247406, "learning_rate": 2.4614346612690527e-05, "loss": 0.4766, "mean_token_accuracy": 0.8474145606160164, "num_tokens": 784545051.0, "step": 24582 }, { "entropy": 0.43979067355394363, "epoch": 2.2617581267502773, "grad_norm": 0.15273168683052063, "learning_rate": 2.46112797865489e-05, "loss": 0.4277, "mean_token_accuracy": 0.8655994795262814, "num_tokens": 784576940.0, "step": 24583 }, { "entropy": 0.5013016103766859, "epoch": 2.261850133121719, "grad_norm": 0.15497753024101257, "learning_rate": 2.4608212960407276e-05, "loss": 0.495, "mean_token_accuracy": 0.8441880196332932, "num_tokens": 784609041.0, "step": 24584 }, { "entropy": 0.5041076671332121, "epoch": 2.26194213949316, "grad_norm": 0.16097766160964966, "learning_rate": 2.460514613426565e-05, "loss": 0.487, "mean_token_accuracy": 0.8423672839999199, "num_tokens": 784641016.0, "step": 24585 }, { "entropy": 0.587452826090157, "epoch": 2.262034145864601, "grad_norm": 0.1714186668395996, "learning_rate": 2.4602079308124022e-05, "loss": 0.5784, "mean_token_accuracy": 0.8200637772679329, "num_tokens": 784672738.0, "step": 24586 }, { "entropy": 0.5067586393561214, "epoch": 2.2621261522360423, "grad_norm": 0.15675923228263855, "learning_rate": 2.4599012481982397e-05, "loss": 0.4829, "mean_token_accuracy": 0.8411823511123657, "num_tokens": 784704207.0, "step": 24587 }, { "entropy": 0.39393299631774426, "epoch": 2.2622181586074834, "grad_norm": 0.1383354514837265, "learning_rate": 2.459594565584077e-05, "loss": 0.3717, "mean_token_accuracy": 0.879996944218874, "num_tokens": 784736297.0, "step": 24588 }, { "entropy": 0.506431931629777, "epoch": 2.262310164978925, "grad_norm": 0.16159066557884216, "learning_rate": 2.4592878829699146e-05, "loss": 0.4924, "mean_token_accuracy": 0.8430681303143501, "num_tokens": 784768148.0, "step": 24589 }, { "entropy": 0.507101443130523, "epoch": 2.262402171350366, "grad_norm": 0.16303688287734985, "learning_rate": 2.458981200355752e-05, "loss": 0.5026, "mean_token_accuracy": 0.8402571529150009, "num_tokens": 784800454.0, "step": 24590 }, { "entropy": 0.5112983472645283, "epoch": 2.2624941777218073, "grad_norm": 0.15917035937309265, "learning_rate": 2.4586745177415892e-05, "loss": 0.4897, "mean_token_accuracy": 0.8410499393939972, "num_tokens": 784832413.0, "step": 24591 }, { "entropy": 0.47784466156736016, "epoch": 2.2625861840932484, "grad_norm": 0.15865284204483032, "learning_rate": 2.4583678351274266e-05, "loss": 0.4647, "mean_token_accuracy": 0.8511634208261967, "num_tokens": 784864412.0, "step": 24592 }, { "entropy": 0.5040627382695675, "epoch": 2.2626781904646895, "grad_norm": 0.163718581199646, "learning_rate": 2.458061152513264e-05, "loss": 0.4961, "mean_token_accuracy": 0.8422131165862083, "num_tokens": 784895866.0, "step": 24593 }, { "entropy": 0.4755829409696162, "epoch": 2.262770196836131, "grad_norm": 0.15398292243480682, "learning_rate": 2.4577544698991016e-05, "loss": 0.4705, "mean_token_accuracy": 0.8518611155450344, "num_tokens": 784927778.0, "step": 24594 }, { "entropy": 0.48168890713714063, "epoch": 2.2628622032075723, "grad_norm": 0.15373359620571136, "learning_rate": 2.4574477872849387e-05, "loss": 0.4688, "mean_token_accuracy": 0.8520983085036278, "num_tokens": 784960176.0, "step": 24595 }, { "entropy": 0.47748640179634094, "epoch": 2.2629542095790134, "grad_norm": 0.15286210179328918, "learning_rate": 2.457141104670776e-05, "loss": 0.4676, "mean_token_accuracy": 0.8503114357590675, "num_tokens": 784991990.0, "step": 24596 }, { "entropy": 0.5999750681221485, "epoch": 2.2630462159504545, "grad_norm": 0.17166060209274292, "learning_rate": 2.4568344220566136e-05, "loss": 0.603, "mean_token_accuracy": 0.8160476870834827, "num_tokens": 785024717.0, "step": 24597 }, { "entropy": 0.5200183093547821, "epoch": 2.2631382223218957, "grad_norm": 0.15564264357089996, "learning_rate": 2.456527739442451e-05, "loss": 0.5086, "mean_token_accuracy": 0.8392484188079834, "num_tokens": 785057175.0, "step": 24598 }, { "entropy": 0.5562101055402309, "epoch": 2.2632302286933372, "grad_norm": 0.1685962826013565, "learning_rate": 2.4562210568282886e-05, "loss": 0.5463, "mean_token_accuracy": 0.8301191404461861, "num_tokens": 785089113.0, "step": 24599 }, { "entropy": 0.5113824470899999, "epoch": 2.2633222350647784, "grad_norm": 0.16472026705741882, "learning_rate": 2.4559143742141257e-05, "loss": 0.5019, "mean_token_accuracy": 0.8428995609283447, "num_tokens": 785121261.0, "step": 24600 }, { "entropy": 0.4193472333718091, "epoch": 2.2634142414362195, "grad_norm": 0.14568482339382172, "learning_rate": 2.455607691599963e-05, "loss": 0.4071, "mean_token_accuracy": 0.8696447610855103, "num_tokens": 785153231.0, "step": 24601 }, { "entropy": 0.42052369471639395, "epoch": 2.2635062478076606, "grad_norm": 0.14793668687343597, "learning_rate": 2.455301008985801e-05, "loss": 0.4145, "mean_token_accuracy": 0.8693816587328911, "num_tokens": 785185740.0, "step": 24602 }, { "entropy": 0.49737492110580206, "epoch": 2.2635982541791018, "grad_norm": 0.1608361303806305, "learning_rate": 2.454994326371638e-05, "loss": 0.4776, "mean_token_accuracy": 0.848260436207056, "num_tokens": 785217341.0, "step": 24603 }, { "entropy": 0.569516334682703, "epoch": 2.2636902605505433, "grad_norm": 0.16350765526294708, "learning_rate": 2.4546876437574755e-05, "loss": 0.5569, "mean_token_accuracy": 0.8252685368061066, "num_tokens": 785249580.0, "step": 24604 }, { "entropy": 0.47508107451722026, "epoch": 2.2637822669219845, "grad_norm": 0.15285125374794006, "learning_rate": 2.454380961143313e-05, "loss": 0.4603, "mean_token_accuracy": 0.8545135371387005, "num_tokens": 785282237.0, "step": 24605 }, { "entropy": 0.46010617911815643, "epoch": 2.2638742732934256, "grad_norm": 0.15449948608875275, "learning_rate": 2.4540742785291505e-05, "loss": 0.4393, "mean_token_accuracy": 0.8561110757291317, "num_tokens": 785314079.0, "step": 24606 }, { "entropy": 0.4993338081985712, "epoch": 2.2639662796648667, "grad_norm": 0.160341277718544, "learning_rate": 2.453767595914988e-05, "loss": 0.4821, "mean_token_accuracy": 0.8466052822768688, "num_tokens": 785345514.0, "step": 24607 }, { "entropy": 0.6441259980201721, "epoch": 2.264058286036308, "grad_norm": 0.17642800509929657, "learning_rate": 2.453460913300825e-05, "loss": 0.6249, "mean_token_accuracy": 0.8027389906346798, "num_tokens": 785377197.0, "step": 24608 }, { "entropy": 0.572479821741581, "epoch": 2.2641502924077495, "grad_norm": 0.1659451127052307, "learning_rate": 2.4531542306866625e-05, "loss": 0.5514, "mean_token_accuracy": 0.8246876671910286, "num_tokens": 785408844.0, "step": 24609 }, { "entropy": 0.4621280967257917, "epoch": 2.2642422987791906, "grad_norm": 0.1535191386938095, "learning_rate": 2.4528475480725e-05, "loss": 0.4563, "mean_token_accuracy": 0.8580085337162018, "num_tokens": 785441265.0, "step": 24610 }, { "entropy": 0.5411813259124756, "epoch": 2.2643343051506317, "grad_norm": 0.1647164225578308, "learning_rate": 2.4525408654583375e-05, "loss": 0.5257, "mean_token_accuracy": 0.8342201821506023, "num_tokens": 785473308.0, "step": 24611 }, { "entropy": 0.6243365965783596, "epoch": 2.264426311522073, "grad_norm": 0.1719638556241989, "learning_rate": 2.4522341828441746e-05, "loss": 0.6081, "mean_token_accuracy": 0.810581523925066, "num_tokens": 785506046.0, "step": 24612 }, { "entropy": 0.4782022722065449, "epoch": 2.264518317893514, "grad_norm": 0.15711839497089386, "learning_rate": 2.451927500230012e-05, "loss": 0.4565, "mean_token_accuracy": 0.8498905338346958, "num_tokens": 785537244.0, "step": 24613 }, { "entropy": 0.49029276706278324, "epoch": 2.2646103242649556, "grad_norm": 0.15835067629814148, "learning_rate": 2.4516208176158495e-05, "loss": 0.486, "mean_token_accuracy": 0.8457020558416843, "num_tokens": 785569313.0, "step": 24614 }, { "entropy": 0.48105119867250323, "epoch": 2.2647023306363967, "grad_norm": 0.152831569314003, "learning_rate": 2.451314135001687e-05, "loss": 0.4694, "mean_token_accuracy": 0.8519275635480881, "num_tokens": 785601132.0, "step": 24615 }, { "entropy": 0.5301421862095594, "epoch": 2.264794337007838, "grad_norm": 0.16604310274124146, "learning_rate": 2.451007452387524e-05, "loss": 0.5051, "mean_token_accuracy": 0.8359375968575478, "num_tokens": 785632171.0, "step": 24616 }, { "entropy": 0.5793731543235481, "epoch": 2.264886343379279, "grad_norm": 0.16653139889240265, "learning_rate": 2.4507007697733616e-05, "loss": 0.5642, "mean_token_accuracy": 0.8186024539172649, "num_tokens": 785664100.0, "step": 24617 }, { "entropy": 0.527875606669113, "epoch": 2.26497834975072, "grad_norm": 0.16406284272670746, "learning_rate": 2.450394087159199e-05, "loss": 0.5161, "mean_token_accuracy": 0.8363153375685215, "num_tokens": 785696868.0, "step": 24618 }, { "entropy": 0.5872726868838072, "epoch": 2.2650703561221617, "grad_norm": 0.170766681432724, "learning_rate": 2.4500874045450365e-05, "loss": 0.5774, "mean_token_accuracy": 0.8217771239578724, "num_tokens": 785728471.0, "step": 24619 }, { "entropy": 0.5070331515744328, "epoch": 2.265162362493603, "grad_norm": 0.15831893682479858, "learning_rate": 2.449780721930874e-05, "loss": 0.4889, "mean_token_accuracy": 0.8442956060171127, "num_tokens": 785760369.0, "step": 24620 }, { "entropy": 0.601302036549896, "epoch": 2.265254368865044, "grad_norm": 0.17003385722637177, "learning_rate": 2.449474039316711e-05, "loss": 0.5839, "mean_token_accuracy": 0.8161605671048164, "num_tokens": 785792499.0, "step": 24621 }, { "entropy": 0.4814975820481777, "epoch": 2.265346375236485, "grad_norm": 0.15550051629543304, "learning_rate": 2.4491673567025486e-05, "loss": 0.4796, "mean_token_accuracy": 0.8490251563489437, "num_tokens": 785824648.0, "step": 24622 }, { "entropy": 0.5159069839864969, "epoch": 2.265438381607926, "grad_norm": 0.15916121006011963, "learning_rate": 2.448860674088386e-05, "loss": 0.4985, "mean_token_accuracy": 0.8353670686483383, "num_tokens": 785856228.0, "step": 24623 }, { "entropy": 0.5356450527906418, "epoch": 2.265530387979368, "grad_norm": 0.1728867143392563, "learning_rate": 2.4485539914742235e-05, "loss": 0.5354, "mean_token_accuracy": 0.8308768682181835, "num_tokens": 785888252.0, "step": 24624 }, { "entropy": 0.47898038383573294, "epoch": 2.265622394350809, "grad_norm": 0.15496112406253815, "learning_rate": 2.4482473088600606e-05, "loss": 0.4717, "mean_token_accuracy": 0.8484927862882614, "num_tokens": 785920627.0, "step": 24625 }, { "entropy": 0.477760492824018, "epoch": 2.26571440072225, "grad_norm": 0.1672181487083435, "learning_rate": 2.447940626245898e-05, "loss": 0.4597, "mean_token_accuracy": 0.8529118597507477, "num_tokens": 785951744.0, "step": 24626 }, { "entropy": 0.4586123190820217, "epoch": 2.265806407093691, "grad_norm": 0.15514370799064636, "learning_rate": 2.4476339436317355e-05, "loss": 0.4498, "mean_token_accuracy": 0.8579793274402618, "num_tokens": 785983615.0, "step": 24627 }, { "entropy": 0.4541139341890812, "epoch": 2.2658984134651323, "grad_norm": 0.15295706689357758, "learning_rate": 2.447327261017573e-05, "loss": 0.4473, "mean_token_accuracy": 0.8588734157383442, "num_tokens": 786015235.0, "step": 24628 }, { "entropy": 0.498727485537529, "epoch": 2.265990419836574, "grad_norm": 0.1632532924413681, "learning_rate": 2.4470205784034105e-05, "loss": 0.4842, "mean_token_accuracy": 0.8442413993179798, "num_tokens": 786047217.0, "step": 24629 }, { "entropy": 0.4707432081922889, "epoch": 2.266082426208015, "grad_norm": 0.1528080254793167, "learning_rate": 2.4467138957892476e-05, "loss": 0.4597, "mean_token_accuracy": 0.8510444164276123, "num_tokens": 786079367.0, "step": 24630 }, { "entropy": 0.4807713436894119, "epoch": 2.266174432579456, "grad_norm": 0.1603313386440277, "learning_rate": 2.446407213175085e-05, "loss": 0.4695, "mean_token_accuracy": 0.8529511503875256, "num_tokens": 786110267.0, "step": 24631 }, { "entropy": 0.4961147643625736, "epoch": 2.2662664389508973, "grad_norm": 0.15681007504463196, "learning_rate": 2.446100530560923e-05, "loss": 0.4772, "mean_token_accuracy": 0.8486829213798046, "num_tokens": 786142168.0, "step": 24632 }, { "entropy": 0.4858971694484353, "epoch": 2.2663584453223384, "grad_norm": 0.15788188576698303, "learning_rate": 2.44579384794676e-05, "loss": 0.4605, "mean_token_accuracy": 0.8538813591003418, "num_tokens": 786173765.0, "step": 24633 }, { "entropy": 0.509690348058939, "epoch": 2.26645045169378, "grad_norm": 0.16234709322452545, "learning_rate": 2.4454871653325975e-05, "loss": 0.4932, "mean_token_accuracy": 0.8487284369766712, "num_tokens": 786205665.0, "step": 24634 }, { "entropy": 0.5065703121945262, "epoch": 2.266542458065221, "grad_norm": 0.1578988879919052, "learning_rate": 2.445180482718435e-05, "loss": 0.4986, "mean_token_accuracy": 0.8431923016905785, "num_tokens": 786237860.0, "step": 24635 }, { "entropy": 0.4165531061589718, "epoch": 2.2666344644366623, "grad_norm": 0.150763601064682, "learning_rate": 2.4448738001042724e-05, "loss": 0.4076, "mean_token_accuracy": 0.8697074055671692, "num_tokens": 786269903.0, "step": 24636 }, { "entropy": 0.43490260327234864, "epoch": 2.2667264708081034, "grad_norm": 0.15556414425373077, "learning_rate": 2.44456711749011e-05, "loss": 0.4121, "mean_token_accuracy": 0.8659689426422119, "num_tokens": 786301589.0, "step": 24637 }, { "entropy": 0.53483344335109, "epoch": 2.2668184771795445, "grad_norm": 0.16524842381477356, "learning_rate": 2.444260434875947e-05, "loss": 0.5253, "mean_token_accuracy": 0.8310314528644085, "num_tokens": 786332925.0, "step": 24638 }, { "entropy": 0.47245862893760204, "epoch": 2.266910483550986, "grad_norm": 0.15218400955200195, "learning_rate": 2.4439537522617844e-05, "loss": 0.4563, "mean_token_accuracy": 0.8557784222066402, "num_tokens": 786365363.0, "step": 24639 }, { "entropy": 0.6708200061693788, "epoch": 2.2670024899224273, "grad_norm": 0.18086713552474976, "learning_rate": 2.443647069647622e-05, "loss": 0.6603, "mean_token_accuracy": 0.7924203276634216, "num_tokens": 786397068.0, "step": 24640 }, { "entropy": 0.45811540307477117, "epoch": 2.2670944962938684, "grad_norm": 0.1534530073404312, "learning_rate": 2.4433403870334594e-05, "loss": 0.4418, "mean_token_accuracy": 0.8583534136414528, "num_tokens": 786429193.0, "step": 24641 }, { "entropy": 0.5382307795807719, "epoch": 2.2671865026653095, "grad_norm": 0.16451695561408997, "learning_rate": 2.4430337044192965e-05, "loss": 0.5278, "mean_token_accuracy": 0.8338921740651131, "num_tokens": 786461105.0, "step": 24642 }, { "entropy": 0.5458865556865931, "epoch": 2.2672785090367507, "grad_norm": 0.16304361820220947, "learning_rate": 2.442727021805134e-05, "loss": 0.5298, "mean_token_accuracy": 0.8337337970733643, "num_tokens": 786492930.0, "step": 24643 }, { "entropy": 0.5094610939268023, "epoch": 2.2673705154081922, "grad_norm": 0.15820640325546265, "learning_rate": 2.4424203391909714e-05, "loss": 0.499, "mean_token_accuracy": 0.8386369161307812, "num_tokens": 786525237.0, "step": 24644 }, { "entropy": 0.5212052734568715, "epoch": 2.2674625217796334, "grad_norm": 0.1618703007698059, "learning_rate": 2.442113656576809e-05, "loss": 0.5, "mean_token_accuracy": 0.8381835073232651, "num_tokens": 786556595.0, "step": 24645 }, { "entropy": 0.39505948266014457, "epoch": 2.2675545281510745, "grad_norm": 0.14351169764995575, "learning_rate": 2.4418069739626464e-05, "loss": 0.3747, "mean_token_accuracy": 0.8795206546783447, "num_tokens": 786588093.0, "step": 24646 }, { "entropy": 0.4508899771608412, "epoch": 2.2676465345225156, "grad_norm": 0.15223978459835052, "learning_rate": 2.4415002913484835e-05, "loss": 0.4301, "mean_token_accuracy": 0.8614583611488342, "num_tokens": 786619675.0, "step": 24647 }, { "entropy": 0.6121963113546371, "epoch": 2.2677385408939568, "grad_norm": 0.17256255447864532, "learning_rate": 2.441193608734321e-05, "loss": 0.6012, "mean_token_accuracy": 0.8087837286293507, "num_tokens": 786651855.0, "step": 24648 }, { "entropy": 0.5380998570472002, "epoch": 2.2678305472653983, "grad_norm": 0.1633450835943222, "learning_rate": 2.4408869261201584e-05, "loss": 0.5114, "mean_token_accuracy": 0.8343476988375187, "num_tokens": 786683675.0, "step": 24649 }, { "entropy": 0.6481369528919458, "epoch": 2.2679225536368395, "grad_norm": 0.17098495364189148, "learning_rate": 2.440580243505996e-05, "loss": 0.6479, "mean_token_accuracy": 0.7989391125738621, "num_tokens": 786714849.0, "step": 24650 }, { "entropy": 0.5155633063986897, "epoch": 2.2680145600082806, "grad_norm": 0.16313019394874573, "learning_rate": 2.440273560891833e-05, "loss": 0.5109, "mean_token_accuracy": 0.8378984332084656, "num_tokens": 786746570.0, "step": 24651 }, { "entropy": 0.5715627064928412, "epoch": 2.2681065663797217, "grad_norm": 0.16955482959747314, "learning_rate": 2.4399668782776705e-05, "loss": 0.5628, "mean_token_accuracy": 0.8239427506923676, "num_tokens": 786778427.0, "step": 24652 }, { "entropy": 0.519910080358386, "epoch": 2.268198572751163, "grad_norm": 0.15750010311603546, "learning_rate": 2.439660195663508e-05, "loss": 0.5064, "mean_token_accuracy": 0.8375006765127182, "num_tokens": 786810695.0, "step": 24653 }, { "entropy": 0.6179114878177643, "epoch": 2.2682905791226045, "grad_norm": 0.1727377027273178, "learning_rate": 2.4393535130493454e-05, "loss": 0.61, "mean_token_accuracy": 0.8054852075874805, "num_tokens": 786842109.0, "step": 24654 }, { "entropy": 0.4401693446561694, "epoch": 2.2683825854940456, "grad_norm": 0.14991846680641174, "learning_rate": 2.4390468304351825e-05, "loss": 0.4285, "mean_token_accuracy": 0.8627111092209816, "num_tokens": 786874554.0, "step": 24655 }, { "entropy": 0.5511954082176089, "epoch": 2.2684745918654867, "grad_norm": 0.1668449491262436, "learning_rate": 2.43874014782102e-05, "loss": 0.5499, "mean_token_accuracy": 0.8297596238553524, "num_tokens": 786906956.0, "step": 24656 }, { "entropy": 0.5152017311193049, "epoch": 2.268566598236928, "grad_norm": 0.16057193279266357, "learning_rate": 2.4384334652068574e-05, "loss": 0.5078, "mean_token_accuracy": 0.8409768156707287, "num_tokens": 786938796.0, "step": 24657 }, { "entropy": 0.3767043468542397, "epoch": 2.268658604608369, "grad_norm": 0.14043666422367096, "learning_rate": 2.438126782592695e-05, "loss": 0.3596, "mean_token_accuracy": 0.8845101669430733, "num_tokens": 786971359.0, "step": 24658 }, { "entropy": 0.5439139660447836, "epoch": 2.2687506109798106, "grad_norm": 0.16068032383918762, "learning_rate": 2.4378200999785324e-05, "loss": 0.5302, "mean_token_accuracy": 0.8337659575045109, "num_tokens": 787004117.0, "step": 24659 }, { "entropy": 0.5393258780241013, "epoch": 2.2688426173512517, "grad_norm": 0.16388250887393951, "learning_rate": 2.4375134173643695e-05, "loss": 0.528, "mean_token_accuracy": 0.8337978646159172, "num_tokens": 787036663.0, "step": 24660 }, { "entropy": 0.5403086841106415, "epoch": 2.268934623722693, "grad_norm": 0.16199447214603424, "learning_rate": 2.437206734750207e-05, "loss": 0.5216, "mean_token_accuracy": 0.83399348706007, "num_tokens": 787068492.0, "step": 24661 }, { "entropy": 0.5095596835017204, "epoch": 2.269026630094134, "grad_norm": 0.15844812989234924, "learning_rate": 2.4369000521360444e-05, "loss": 0.4915, "mean_token_accuracy": 0.8441050536930561, "num_tokens": 787100084.0, "step": 24662 }, { "entropy": 0.5616978406906128, "epoch": 2.269118636465575, "grad_norm": 0.16142219305038452, "learning_rate": 2.436593369521882e-05, "loss": 0.5353, "mean_token_accuracy": 0.8265562169253826, "num_tokens": 787131548.0, "step": 24663 }, { "entropy": 0.5133373197168112, "epoch": 2.2692106428370167, "grad_norm": 0.16376936435699463, "learning_rate": 2.4362866869077194e-05, "loss": 0.4981, "mean_token_accuracy": 0.8440220318734646, "num_tokens": 787164037.0, "step": 24664 }, { "entropy": 0.5245968773961067, "epoch": 2.269302649208458, "grad_norm": 0.15457439422607422, "learning_rate": 2.4359800042935568e-05, "loss": 0.5114, "mean_token_accuracy": 0.8374164178967476, "num_tokens": 787195675.0, "step": 24665 }, { "entropy": 0.5232439725659788, "epoch": 2.269394655579899, "grad_norm": 0.16735953092575073, "learning_rate": 2.4356733216793943e-05, "loss": 0.498, "mean_token_accuracy": 0.8407024815678596, "num_tokens": 787227317.0, "step": 24666 }, { "entropy": 0.4913551793433726, "epoch": 2.26948666195134, "grad_norm": 0.15691642463207245, "learning_rate": 2.4353666390652318e-05, "loss": 0.4747, "mean_token_accuracy": 0.8490029610693455, "num_tokens": 787258074.0, "step": 24667 }, { "entropy": 0.505562761798501, "epoch": 2.269578668322781, "grad_norm": 0.16079182922840118, "learning_rate": 2.435059956451069e-05, "loss": 0.4952, "mean_token_accuracy": 0.8409130498766899, "num_tokens": 787290285.0, "step": 24668 }, { "entropy": 0.4326065890491009, "epoch": 2.269670674694223, "grad_norm": 0.15048451721668243, "learning_rate": 2.4347532738369063e-05, "loss": 0.4246, "mean_token_accuracy": 0.8662302866578102, "num_tokens": 787322433.0, "step": 24669 }, { "entropy": 0.4891739869490266, "epoch": 2.269762681065664, "grad_norm": 0.1619122177362442, "learning_rate": 2.4344465912227438e-05, "loss": 0.4741, "mean_token_accuracy": 0.8503320701420307, "num_tokens": 787353717.0, "step": 24670 }, { "entropy": 0.5692709526047111, "epoch": 2.269854687437105, "grad_norm": 0.16790790855884552, "learning_rate": 2.4341399086085813e-05, "loss": 0.5711, "mean_token_accuracy": 0.8165594302117825, "num_tokens": 787385975.0, "step": 24671 }, { "entropy": 0.5025130156427622, "epoch": 2.269946693808546, "grad_norm": 0.16399770975112915, "learning_rate": 2.4338332259944184e-05, "loss": 0.4956, "mean_token_accuracy": 0.843120351433754, "num_tokens": 787418329.0, "step": 24672 }, { "entropy": 0.5521039087325335, "epoch": 2.2700387001799873, "grad_norm": 0.16030244529247284, "learning_rate": 2.433526543380256e-05, "loss": 0.5305, "mean_token_accuracy": 0.8329082429409027, "num_tokens": 787450480.0, "step": 24673 }, { "entropy": 0.5099990982562304, "epoch": 2.270130706551429, "grad_norm": 0.16597434878349304, "learning_rate": 2.4332198607660933e-05, "loss": 0.5012, "mean_token_accuracy": 0.8384226635098457, "num_tokens": 787482496.0, "step": 24674 }, { "entropy": 0.5740559697151184, "epoch": 2.27022271292287, "grad_norm": 0.16908711194992065, "learning_rate": 2.4329131781519308e-05, "loss": 0.5765, "mean_token_accuracy": 0.82041335105896, "num_tokens": 787514882.0, "step": 24675 }, { "entropy": 0.505657265894115, "epoch": 2.270314719294311, "grad_norm": 0.16363483667373657, "learning_rate": 2.4326064955377683e-05, "loss": 0.4891, "mean_token_accuracy": 0.8481330461800098, "num_tokens": 787546477.0, "step": 24676 }, { "entropy": 0.5014156298711896, "epoch": 2.2704067256657523, "grad_norm": 0.15535040199756622, "learning_rate": 2.4322998129236054e-05, "loss": 0.4816, "mean_token_accuracy": 0.8468810841441154, "num_tokens": 787578423.0, "step": 24677 }, { "entropy": 0.4327797684818506, "epoch": 2.2704987320371934, "grad_norm": 0.15430137515068054, "learning_rate": 2.431993130309443e-05, "loss": 0.4227, "mean_token_accuracy": 0.8645026534795761, "num_tokens": 787611108.0, "step": 24678 }, { "entropy": 0.5642021158710122, "epoch": 2.270590738408635, "grad_norm": 0.16541652381420135, "learning_rate": 2.4316864476952803e-05, "loss": 0.5561, "mean_token_accuracy": 0.8216247446835041, "num_tokens": 787643485.0, "step": 24679 }, { "entropy": 0.494864150416106, "epoch": 2.270682744780076, "grad_norm": 0.15950293838977814, "learning_rate": 2.4313797650811178e-05, "loss": 0.4878, "mean_token_accuracy": 0.8448188230395317, "num_tokens": 787675336.0, "step": 24680 }, { "entropy": 0.5247862562537193, "epoch": 2.2707747511515173, "grad_norm": 0.15846924483776093, "learning_rate": 2.431073082466955e-05, "loss": 0.5011, "mean_token_accuracy": 0.8400214724242687, "num_tokens": 787706850.0, "step": 24681 }, { "entropy": 0.6482155006378889, "epoch": 2.2708667575229584, "grad_norm": 0.18320755660533905, "learning_rate": 2.4307663998527924e-05, "loss": 0.6268, "mean_token_accuracy": 0.7994188405573368, "num_tokens": 787738075.0, "step": 24682 }, { "entropy": 0.6313112694770098, "epoch": 2.2709587638943995, "grad_norm": 0.1751837283372879, "learning_rate": 2.43045971723863e-05, "loss": 0.6158, "mean_token_accuracy": 0.8071538843214512, "num_tokens": 787769894.0, "step": 24683 }, { "entropy": 0.5671813599765301, "epoch": 2.271050770265841, "grad_norm": 0.16784368455410004, "learning_rate": 2.4301530346244673e-05, "loss": 0.5603, "mean_token_accuracy": 0.825628224760294, "num_tokens": 787801541.0, "step": 24684 }, { "entropy": 0.51019108411856, "epoch": 2.2711427766372823, "grad_norm": 0.15379920601844788, "learning_rate": 2.4298463520103044e-05, "loss": 0.489, "mean_token_accuracy": 0.848400391638279, "num_tokens": 787834280.0, "step": 24685 }, { "entropy": 0.5104866530746222, "epoch": 2.2712347830087234, "grad_norm": 0.15704908967018127, "learning_rate": 2.429539669396142e-05, "loss": 0.5045, "mean_token_accuracy": 0.8426595889031887, "num_tokens": 787866701.0, "step": 24686 }, { "entropy": 0.45555978431366384, "epoch": 2.2713267893801645, "grad_norm": 0.1517704725265503, "learning_rate": 2.4292329867819794e-05, "loss": 0.4513, "mean_token_accuracy": 0.8568983636796474, "num_tokens": 787898892.0, "step": 24687 }, { "entropy": 0.4647428523749113, "epoch": 2.2714187957516057, "grad_norm": 0.15136171877384186, "learning_rate": 2.4289263041678168e-05, "loss": 0.4513, "mean_token_accuracy": 0.8574569709599018, "num_tokens": 787931233.0, "step": 24688 }, { "entropy": 0.4809472148772329, "epoch": 2.2715108021230472, "grad_norm": 0.15752379596233368, "learning_rate": 2.4286196215536543e-05, "loss": 0.4754, "mean_token_accuracy": 0.8510449267923832, "num_tokens": 787962810.0, "step": 24689 }, { "entropy": 0.45497375912964344, "epoch": 2.2716028084944884, "grad_norm": 0.15759451687335968, "learning_rate": 2.4283129389394914e-05, "loss": 0.4358, "mean_token_accuracy": 0.8584309667348862, "num_tokens": 787994341.0, "step": 24690 }, { "entropy": 0.4803036190569401, "epoch": 2.2716948148659295, "grad_norm": 0.155232772231102, "learning_rate": 2.428006256325329e-05, "loss": 0.4741, "mean_token_accuracy": 0.8480013087391853, "num_tokens": 788026029.0, "step": 24691 }, { "entropy": 0.5106448289006948, "epoch": 2.2717868212373706, "grad_norm": 0.15337815880775452, "learning_rate": 2.4276995737111663e-05, "loss": 0.487, "mean_token_accuracy": 0.8449308685958385, "num_tokens": 788058247.0, "step": 24692 }, { "entropy": 0.5276581738144159, "epoch": 2.2718788276088118, "grad_norm": 0.1616590917110443, "learning_rate": 2.4273928910970038e-05, "loss": 0.5153, "mean_token_accuracy": 0.8378995172679424, "num_tokens": 788090237.0, "step": 24693 }, { "entropy": 0.5112798875197768, "epoch": 2.2719708339802533, "grad_norm": 0.16211561858654022, "learning_rate": 2.4270862084828413e-05, "loss": 0.5067, "mean_token_accuracy": 0.8412985280156136, "num_tokens": 788121974.0, "step": 24694 }, { "entropy": 0.5725947394967079, "epoch": 2.2720628403516945, "grad_norm": 0.16960158944129944, "learning_rate": 2.4267795258686787e-05, "loss": 0.5487, "mean_token_accuracy": 0.827119879424572, "num_tokens": 788153357.0, "step": 24695 }, { "entropy": 0.5762394834309816, "epoch": 2.2721548467231356, "grad_norm": 0.16974899172782898, "learning_rate": 2.4264728432545162e-05, "loss": 0.5762, "mean_token_accuracy": 0.8192118480801582, "num_tokens": 788184849.0, "step": 24696 }, { "entropy": 0.4883555117994547, "epoch": 2.2722468530945767, "grad_norm": 0.1641780585050583, "learning_rate": 2.4261661606403537e-05, "loss": 0.4757, "mean_token_accuracy": 0.8501360937952995, "num_tokens": 788216221.0, "step": 24697 }, { "entropy": 0.5125426761806011, "epoch": 2.272338859466018, "grad_norm": 0.16012997925281525, "learning_rate": 2.4258594780261908e-05, "loss": 0.4873, "mean_token_accuracy": 0.8447576127946377, "num_tokens": 788247878.0, "step": 24698 }, { "entropy": 0.5247767297551036, "epoch": 2.2724308658374595, "grad_norm": 0.16091695427894592, "learning_rate": 2.4255527954120283e-05, "loss": 0.5129, "mean_token_accuracy": 0.8375959806144238, "num_tokens": 788279658.0, "step": 24699 }, { "entropy": 0.4400638049701229, "epoch": 2.2725228722089006, "grad_norm": 0.15266135334968567, "learning_rate": 2.4252461127978657e-05, "loss": 0.4313, "mean_token_accuracy": 0.8658205829560757, "num_tokens": 788311716.0, "step": 24700 }, { "entropy": 0.6096321661025286, "epoch": 2.2726148785803417, "grad_norm": 0.16778643429279327, "learning_rate": 2.4249394301837032e-05, "loss": 0.6037, "mean_token_accuracy": 0.8109500482678413, "num_tokens": 788344256.0, "step": 24701 }, { "entropy": 0.5603882223367691, "epoch": 2.272706884951783, "grad_norm": 0.1633259505033493, "learning_rate": 2.4246327475695403e-05, "loss": 0.5392, "mean_token_accuracy": 0.8333852253854275, "num_tokens": 788376567.0, "step": 24702 }, { "entropy": 0.6444603614509106, "epoch": 2.272798891323224, "grad_norm": 0.17787116765975952, "learning_rate": 2.4243260649553778e-05, "loss": 0.6214, "mean_token_accuracy": 0.8037006296217442, "num_tokens": 788408283.0, "step": 24703 }, { "entropy": 0.4969226629473269, "epoch": 2.2728908976946656, "grad_norm": 0.1567903757095337, "learning_rate": 2.4240193823412152e-05, "loss": 0.4748, "mean_token_accuracy": 0.8492328077554703, "num_tokens": 788440743.0, "step": 24704 }, { "entropy": 0.6229052357375622, "epoch": 2.2729829040661067, "grad_norm": 0.17287395894527435, "learning_rate": 2.4237126997270527e-05, "loss": 0.6072, "mean_token_accuracy": 0.8125834837555885, "num_tokens": 788472363.0, "step": 24705 }, { "entropy": 0.44665378192439675, "epoch": 2.273074910437548, "grad_norm": 0.15772517025470734, "learning_rate": 2.4234060171128902e-05, "loss": 0.4299, "mean_token_accuracy": 0.8594197817146778, "num_tokens": 788504153.0, "step": 24706 }, { "entropy": 0.6565308980643749, "epoch": 2.273166916808989, "grad_norm": 0.17874042689800262, "learning_rate": 2.4230993344987273e-05, "loss": 0.6389, "mean_token_accuracy": 0.8015518113970757, "num_tokens": 788536030.0, "step": 24707 }, { "entropy": 0.5427574710920453, "epoch": 2.27325892318043, "grad_norm": 0.16160371899604797, "learning_rate": 2.4227926518845648e-05, "loss": 0.5297, "mean_token_accuracy": 0.8319182842969894, "num_tokens": 788568049.0, "step": 24708 }, { "entropy": 0.5847585126757622, "epoch": 2.2733509295518717, "grad_norm": 0.16986532509326935, "learning_rate": 2.4224859692704022e-05, "loss": 0.5738, "mean_token_accuracy": 0.8207962922751904, "num_tokens": 788599626.0, "step": 24709 }, { "entropy": 0.4527110527269542, "epoch": 2.273442935923313, "grad_norm": 0.15161454677581787, "learning_rate": 2.4221792866562397e-05, "loss": 0.4484, "mean_token_accuracy": 0.8550333082675934, "num_tokens": 788631412.0, "step": 24710 }, { "entropy": 0.5533726699650288, "epoch": 2.273534942294754, "grad_norm": 0.16623330116271973, "learning_rate": 2.4218726040420768e-05, "loss": 0.5381, "mean_token_accuracy": 0.8308702409267426, "num_tokens": 788663245.0, "step": 24711 }, { "entropy": 0.4832653347402811, "epoch": 2.273626948666195, "grad_norm": 0.1588170826435089, "learning_rate": 2.4215659214279143e-05, "loss": 0.4805, "mean_token_accuracy": 0.8479926697909832, "num_tokens": 788695335.0, "step": 24712 }, { "entropy": 0.5890488885343075, "epoch": 2.273718955037636, "grad_norm": 0.16972137987613678, "learning_rate": 2.4212592388137517e-05, "loss": 0.5776, "mean_token_accuracy": 0.8181654699146748, "num_tokens": 788727212.0, "step": 24713 }, { "entropy": 0.6064128987491131, "epoch": 2.273810961409078, "grad_norm": 0.17372669279575348, "learning_rate": 2.4209525561995892e-05, "loss": 0.5893, "mean_token_accuracy": 0.8121421784162521, "num_tokens": 788758665.0, "step": 24714 }, { "entropy": 0.5868850825354457, "epoch": 2.273902967780519, "grad_norm": 0.1651320606470108, "learning_rate": 2.4206458735854263e-05, "loss": 0.5793, "mean_token_accuracy": 0.8169956989586353, "num_tokens": 788790789.0, "step": 24715 }, { "entropy": 0.5372875593602657, "epoch": 2.27399497415196, "grad_norm": 0.1614305078983307, "learning_rate": 2.4203391909712638e-05, "loss": 0.5174, "mean_token_accuracy": 0.8357325196266174, "num_tokens": 788822804.0, "step": 24716 }, { "entropy": 0.5737000126391649, "epoch": 2.274086980523401, "grad_norm": 0.1702767014503479, "learning_rate": 2.4200325083571013e-05, "loss": 0.5652, "mean_token_accuracy": 0.8221546299755573, "num_tokens": 788855030.0, "step": 24717 }, { "entropy": 0.5665901154279709, "epoch": 2.2741789868948423, "grad_norm": 0.1649961918592453, "learning_rate": 2.4197258257429387e-05, "loss": 0.5596, "mean_token_accuracy": 0.8204909041523933, "num_tokens": 788887595.0, "step": 24718 }, { "entropy": 0.5333996484987438, "epoch": 2.274270993266284, "grad_norm": 0.16159088909626007, "learning_rate": 2.4194191431287762e-05, "loss": 0.528, "mean_token_accuracy": 0.8345103226602077, "num_tokens": 788920044.0, "step": 24719 }, { "entropy": 0.45500810677185655, "epoch": 2.274362999637725, "grad_norm": 0.1548926830291748, "learning_rate": 2.4191124605146133e-05, "loss": 0.4424, "mean_token_accuracy": 0.8585934042930603, "num_tokens": 788951819.0, "step": 24720 }, { "entropy": 0.5390315186232328, "epoch": 2.274455006009166, "grad_norm": 0.17142854630947113, "learning_rate": 2.4188057779004508e-05, "loss": 0.5255, "mean_token_accuracy": 0.8310644924640656, "num_tokens": 788983543.0, "step": 24721 }, { "entropy": 0.5121290748938918, "epoch": 2.2745470123806073, "grad_norm": 0.1675376147031784, "learning_rate": 2.4184990952862883e-05, "loss": 0.5021, "mean_token_accuracy": 0.8380309157073498, "num_tokens": 789015061.0, "step": 24722 }, { "entropy": 0.5287897065281868, "epoch": 2.2746390187520484, "grad_norm": 0.16386616230010986, "learning_rate": 2.4181924126721257e-05, "loss": 0.5159, "mean_token_accuracy": 0.8397675566375256, "num_tokens": 789046728.0, "step": 24723 }, { "entropy": 0.487330736592412, "epoch": 2.27473102512349, "grad_norm": 0.1576896458864212, "learning_rate": 2.4178857300579632e-05, "loss": 0.4728, "mean_token_accuracy": 0.8465719856321812, "num_tokens": 789079056.0, "step": 24724 }, { "entropy": 0.4926240164786577, "epoch": 2.274823031494931, "grad_norm": 0.1581512987613678, "learning_rate": 2.4175790474438006e-05, "loss": 0.4761, "mean_token_accuracy": 0.850345067679882, "num_tokens": 789110515.0, "step": 24725 }, { "entropy": 0.5417800322175026, "epoch": 2.2749150378663723, "grad_norm": 0.16554337739944458, "learning_rate": 2.417272364829638e-05, "loss": 0.5376, "mean_token_accuracy": 0.8316761329770088, "num_tokens": 789142966.0, "step": 24726 }, { "entropy": 0.5513838902115822, "epoch": 2.2750070442378134, "grad_norm": 0.1643492579460144, "learning_rate": 2.4169656822154756e-05, "loss": 0.5462, "mean_token_accuracy": 0.8293828703463078, "num_tokens": 789174275.0, "step": 24727 }, { "entropy": 0.5727893030270934, "epoch": 2.2750990506092545, "grad_norm": 0.16941767930984497, "learning_rate": 2.4166589996013127e-05, "loss": 0.5689, "mean_token_accuracy": 0.8255870975553989, "num_tokens": 789206152.0, "step": 24728 }, { "entropy": 0.5110635901801288, "epoch": 2.275191056980696, "grad_norm": 0.15954247117042542, "learning_rate": 2.41635231698715e-05, "loss": 0.5005, "mean_token_accuracy": 0.8426895253360271, "num_tokens": 789237835.0, "step": 24729 }, { "entropy": 0.5338449489790946, "epoch": 2.2752830633521373, "grad_norm": 0.15949875116348267, "learning_rate": 2.4160456343729876e-05, "loss": 0.5143, "mean_token_accuracy": 0.8359921500086784, "num_tokens": 789269851.0, "step": 24730 }, { "entropy": 0.5003840615972877, "epoch": 2.2753750697235784, "grad_norm": 0.16494962573051453, "learning_rate": 2.415738951758825e-05, "loss": 0.4823, "mean_token_accuracy": 0.8481031954288483, "num_tokens": 789301173.0, "step": 24731 }, { "entropy": 0.5488938316702843, "epoch": 2.2754670760950195, "grad_norm": 0.1665111780166626, "learning_rate": 2.4154322691446622e-05, "loss": 0.5326, "mean_token_accuracy": 0.830007329583168, "num_tokens": 789333158.0, "step": 24732 }, { "entropy": 0.4559368006885052, "epoch": 2.2755590824664607, "grad_norm": 0.15650929510593414, "learning_rate": 2.4151255865304997e-05, "loss": 0.439, "mean_token_accuracy": 0.8592418991029263, "num_tokens": 789364568.0, "step": 24733 }, { "entropy": 0.5334206586703658, "epoch": 2.2756510888379022, "grad_norm": 0.16007061302661896, "learning_rate": 2.414818903916337e-05, "loss": 0.5209, "mean_token_accuracy": 0.8377645574510098, "num_tokens": 789396758.0, "step": 24734 }, { "entropy": 0.45856356993317604, "epoch": 2.2757430952093434, "grad_norm": 0.15311352908611298, "learning_rate": 2.4145122213021746e-05, "loss": 0.4424, "mean_token_accuracy": 0.8617241084575653, "num_tokens": 789429052.0, "step": 24735 }, { "entropy": 0.5068367337808013, "epoch": 2.2758351015807845, "grad_norm": 0.16762423515319824, "learning_rate": 2.414205538688012e-05, "loss": 0.4951, "mean_token_accuracy": 0.8445855565369129, "num_tokens": 789459970.0, "step": 24736 }, { "entropy": 0.49439932126551867, "epoch": 2.2759271079522256, "grad_norm": 0.1557445526123047, "learning_rate": 2.4138988560738492e-05, "loss": 0.4835, "mean_token_accuracy": 0.8476398885250092, "num_tokens": 789492077.0, "step": 24737 }, { "entropy": 0.5180305419489741, "epoch": 2.2760191143236668, "grad_norm": 0.16046170890331268, "learning_rate": 2.4135921734596867e-05, "loss": 0.507, "mean_token_accuracy": 0.8393427021801472, "num_tokens": 789524329.0, "step": 24738 }, { "entropy": 0.5797810519579798, "epoch": 2.2761111206951083, "grad_norm": 0.16414493322372437, "learning_rate": 2.413285490845524e-05, "loss": 0.5605, "mean_token_accuracy": 0.8260746225714684, "num_tokens": 789556847.0, "step": 24739 }, { "entropy": 0.503440666012466, "epoch": 2.2762031270665495, "grad_norm": 0.16121579706668854, "learning_rate": 2.4129788082313616e-05, "loss": 0.4877, "mean_token_accuracy": 0.8484753705561161, "num_tokens": 789587864.0, "step": 24740 }, { "entropy": 0.5188147900626063, "epoch": 2.2762951334379906, "grad_norm": 0.16296526789665222, "learning_rate": 2.4126721256171987e-05, "loss": 0.5116, "mean_token_accuracy": 0.8380853310227394, "num_tokens": 789619956.0, "step": 24741 }, { "entropy": 0.5466853519901633, "epoch": 2.2763871398094317, "grad_norm": 0.16065578162670135, "learning_rate": 2.4123654430030362e-05, "loss": 0.5336, "mean_token_accuracy": 0.8291654586791992, "num_tokens": 789652388.0, "step": 24742 }, { "entropy": 0.6092647815821692, "epoch": 2.276479146180873, "grad_norm": 0.17093822360038757, "learning_rate": 2.4120587603888737e-05, "loss": 0.5961, "mean_token_accuracy": 0.8152580447494984, "num_tokens": 789684022.0, "step": 24743 }, { "entropy": 0.5746552180498838, "epoch": 2.2765711525523145, "grad_norm": 0.1667526811361313, "learning_rate": 2.411752077774711e-05, "loss": 0.5546, "mean_token_accuracy": 0.8260720558464527, "num_tokens": 789716098.0, "step": 24744 }, { "entropy": 0.46033391007222235, "epoch": 2.2766631589237556, "grad_norm": 0.1552361100912094, "learning_rate": 2.4114453951605482e-05, "loss": 0.4577, "mean_token_accuracy": 0.8559731058776379, "num_tokens": 789748575.0, "step": 24745 }, { "entropy": 0.6050232211127877, "epoch": 2.2767551652951967, "grad_norm": 0.16557703912258148, "learning_rate": 2.4111387125463857e-05, "loss": 0.586, "mean_token_accuracy": 0.8158828467130661, "num_tokens": 789780691.0, "step": 24746 }, { "entropy": 0.5554639925248921, "epoch": 2.276847171666638, "grad_norm": 0.17069777846336365, "learning_rate": 2.4108320299322232e-05, "loss": 0.5452, "mean_token_accuracy": 0.8260688409209251, "num_tokens": 789811614.0, "step": 24747 }, { "entropy": 0.45241294940933585, "epoch": 2.276939178038079, "grad_norm": 0.15671518445014954, "learning_rate": 2.4105253473180606e-05, "loss": 0.4388, "mean_token_accuracy": 0.8576531521975994, "num_tokens": 789843241.0, "step": 24748 }, { "entropy": 0.6374447923153639, "epoch": 2.2770311844095206, "grad_norm": 0.17125245928764343, "learning_rate": 2.410218664703898e-05, "loss": 0.624, "mean_token_accuracy": 0.8058015406131744, "num_tokens": 789875248.0, "step": 24749 }, { "entropy": 0.4396197374444455, "epoch": 2.2771231907809617, "grad_norm": 0.15776802599430084, "learning_rate": 2.4099119820897352e-05, "loss": 0.4324, "mean_token_accuracy": 0.8612487055361271, "num_tokens": 789906645.0, "step": 24750 }, { "entropy": 0.5224968413822353, "epoch": 2.277215197152403, "grad_norm": 0.1611693948507309, "learning_rate": 2.4096052994755727e-05, "loss": 0.5166, "mean_token_accuracy": 0.8376149721443653, "num_tokens": 789938939.0, "step": 24751 }, { "entropy": 0.5329053746536374, "epoch": 2.277307203523844, "grad_norm": 0.16787222027778625, "learning_rate": 2.40929861686141e-05, "loss": 0.5299, "mean_token_accuracy": 0.8352250680327415, "num_tokens": 789970384.0, "step": 24752 }, { "entropy": 0.49156288243830204, "epoch": 2.277399209895285, "grad_norm": 0.15600453317165375, "learning_rate": 2.4089919342472476e-05, "loss": 0.4836, "mean_token_accuracy": 0.8450821042060852, "num_tokens": 790002965.0, "step": 24753 }, { "entropy": 0.5280759800225496, "epoch": 2.2774912162667267, "grad_norm": 0.16500382125377655, "learning_rate": 2.408685251633085e-05, "loss": 0.5241, "mean_token_accuracy": 0.835914671421051, "num_tokens": 790035205.0, "step": 24754 }, { "entropy": 0.5171877667307854, "epoch": 2.277583222638168, "grad_norm": 0.15985018014907837, "learning_rate": 2.4083785690189226e-05, "loss": 0.5034, "mean_token_accuracy": 0.8441400676965714, "num_tokens": 790067535.0, "step": 24755 }, { "entropy": 0.5208772104233503, "epoch": 2.277675229009609, "grad_norm": 0.15967293083667755, "learning_rate": 2.40807188640476e-05, "loss": 0.4992, "mean_token_accuracy": 0.8392755836248398, "num_tokens": 790099764.0, "step": 24756 }, { "entropy": 0.5466566616669297, "epoch": 2.27776723538105, "grad_norm": 0.16428852081298828, "learning_rate": 2.4077652037905975e-05, "loss": 0.5377, "mean_token_accuracy": 0.8301212526857853, "num_tokens": 790131597.0, "step": 24757 }, { "entropy": 0.4885553941130638, "epoch": 2.277859241752491, "grad_norm": 0.15445972979068756, "learning_rate": 2.4074585211764346e-05, "loss": 0.474, "mean_token_accuracy": 0.8486098796129227, "num_tokens": 790163316.0, "step": 24758 }, { "entropy": 0.5435596145689487, "epoch": 2.277951248123933, "grad_norm": 0.16426284611225128, "learning_rate": 2.407151838562272e-05, "loss": 0.5336, "mean_token_accuracy": 0.8303561769425869, "num_tokens": 790195842.0, "step": 24759 }, { "entropy": 0.4474881496280432, "epoch": 2.278043254495374, "grad_norm": 0.15952454507350922, "learning_rate": 2.4068451559481095e-05, "loss": 0.4333, "mean_token_accuracy": 0.8634869270026684, "num_tokens": 790227849.0, "step": 24760 }, { "entropy": 0.4621778232976794, "epoch": 2.278135260866815, "grad_norm": 0.15532535314559937, "learning_rate": 2.406538473333947e-05, "loss": 0.4431, "mean_token_accuracy": 0.8566263169050217, "num_tokens": 790259693.0, "step": 24761 }, { "entropy": 0.5648450311273336, "epoch": 2.278227267238256, "grad_norm": 0.16556328535079956, "learning_rate": 2.406231790719784e-05, "loss": 0.5516, "mean_token_accuracy": 0.8273113965988159, "num_tokens": 790291645.0, "step": 24762 }, { "entropy": 0.4686594791710377, "epoch": 2.2783192736096973, "grad_norm": 0.1569826602935791, "learning_rate": 2.4059251081056216e-05, "loss": 0.4559, "mean_token_accuracy": 0.8555727526545525, "num_tokens": 790323926.0, "step": 24763 }, { "entropy": 0.4988693450577557, "epoch": 2.278411279981139, "grad_norm": 0.15972113609313965, "learning_rate": 2.405618425491459e-05, "loss": 0.4846, "mean_token_accuracy": 0.8492051288485527, "num_tokens": 790355736.0, "step": 24764 }, { "entropy": 0.49670882103964686, "epoch": 2.27850328635258, "grad_norm": 0.1559053212404251, "learning_rate": 2.4053117428772965e-05, "loss": 0.4813, "mean_token_accuracy": 0.8465516157448292, "num_tokens": 790387559.0, "step": 24765 }, { "entropy": 0.6653489135205746, "epoch": 2.278595292724021, "grad_norm": 0.17356657981872559, "learning_rate": 2.405005060263134e-05, "loss": 0.6491, "mean_token_accuracy": 0.7951400429010391, "num_tokens": 790419610.0, "step": 24766 }, { "entropy": 0.499685381539166, "epoch": 2.2786872990954623, "grad_norm": 0.1582302302122116, "learning_rate": 2.404698377648971e-05, "loss": 0.4966, "mean_token_accuracy": 0.8445202670991421, "num_tokens": 790450953.0, "step": 24767 }, { "entropy": 0.5271407812833786, "epoch": 2.2787793054669034, "grad_norm": 0.15532459318637848, "learning_rate": 2.4043916950348086e-05, "loss": 0.5072, "mean_token_accuracy": 0.840470477938652, "num_tokens": 790483279.0, "step": 24768 }, { "entropy": 0.6115701561793685, "epoch": 2.278871311838345, "grad_norm": 0.17567729949951172, "learning_rate": 2.404085012420646e-05, "loss": 0.6003, "mean_token_accuracy": 0.8132058680057526, "num_tokens": 790515212.0, "step": 24769 }, { "entropy": 0.5238954108208418, "epoch": 2.278963318209786, "grad_norm": 0.15969489514827728, "learning_rate": 2.4037783298064835e-05, "loss": 0.5243, "mean_token_accuracy": 0.8358677104115486, "num_tokens": 790547732.0, "step": 24770 }, { "entropy": 0.486124612390995, "epoch": 2.2790553245812273, "grad_norm": 0.15560205280780792, "learning_rate": 2.4034716471923206e-05, "loss": 0.4804, "mean_token_accuracy": 0.8488080352544785, "num_tokens": 790579984.0, "step": 24771 }, { "entropy": 0.5430626263841987, "epoch": 2.2791473309526684, "grad_norm": 0.1680562049150467, "learning_rate": 2.403164964578158e-05, "loss": 0.52, "mean_token_accuracy": 0.8333760276436806, "num_tokens": 790611844.0, "step": 24772 }, { "entropy": 0.45480002649128437, "epoch": 2.2792393373241095, "grad_norm": 0.14967656135559082, "learning_rate": 2.4028582819639956e-05, "loss": 0.4454, "mean_token_accuracy": 0.8596851043403149, "num_tokens": 790643691.0, "step": 24773 }, { "entropy": 0.5036928560584784, "epoch": 2.279331343695551, "grad_norm": 0.1573992371559143, "learning_rate": 2.402551599349833e-05, "loss": 0.4938, "mean_token_accuracy": 0.8434091471135616, "num_tokens": 790675437.0, "step": 24774 }, { "entropy": 0.5454310532659292, "epoch": 2.2794233500669923, "grad_norm": 0.1634073406457901, "learning_rate": 2.40224491673567e-05, "loss": 0.5346, "mean_token_accuracy": 0.8286334723234177, "num_tokens": 790707272.0, "step": 24775 }, { "entropy": 0.5640181768685579, "epoch": 2.2795153564384334, "grad_norm": 0.16127923130989075, "learning_rate": 2.4019382341215076e-05, "loss": 0.5543, "mean_token_accuracy": 0.8260014690458775, "num_tokens": 790739920.0, "step": 24776 }, { "entropy": 0.49141199234873056, "epoch": 2.2796073628098745, "grad_norm": 0.1588038057088852, "learning_rate": 2.401631551507345e-05, "loss": 0.4785, "mean_token_accuracy": 0.846334557980299, "num_tokens": 790771445.0, "step": 24777 }, { "entropy": 0.540071171708405, "epoch": 2.2796993691813157, "grad_norm": 0.1616222858428955, "learning_rate": 2.4013248688931826e-05, "loss": 0.5287, "mean_token_accuracy": 0.837671410292387, "num_tokens": 790803267.0, "step": 24778 }, { "entropy": 0.5126354503445327, "epoch": 2.2797913755527572, "grad_norm": 0.16327165067195892, "learning_rate": 2.40101818627902e-05, "loss": 0.5038, "mean_token_accuracy": 0.8397195860743523, "num_tokens": 790834864.0, "step": 24779 }, { "entropy": 0.4558897474780679, "epoch": 2.2798833819241984, "grad_norm": 0.15951228141784668, "learning_rate": 2.400711503664857e-05, "loss": 0.446, "mean_token_accuracy": 0.8582405410706997, "num_tokens": 790867111.0, "step": 24780 }, { "entropy": 0.5208575315773487, "epoch": 2.2799753882956395, "grad_norm": 0.15898394584655762, "learning_rate": 2.4004048210506946e-05, "loss": 0.5083, "mean_token_accuracy": 0.8396087884902954, "num_tokens": 790899216.0, "step": 24781 }, { "entropy": 0.48636922985315323, "epoch": 2.2800673946670806, "grad_norm": 0.15734192728996277, "learning_rate": 2.400098138436532e-05, "loss": 0.467, "mean_token_accuracy": 0.8505772165954113, "num_tokens": 790930047.0, "step": 24782 }, { "entropy": 0.46577146649360657, "epoch": 2.2801594010385218, "grad_norm": 0.15601052343845367, "learning_rate": 2.3997914558223695e-05, "loss": 0.4437, "mean_token_accuracy": 0.8564532808959484, "num_tokens": 790961935.0, "step": 24783 }, { "entropy": 0.37171759037300944, "epoch": 2.2802514074099633, "grad_norm": 0.13959459960460663, "learning_rate": 2.3994847732082067e-05, "loss": 0.3566, "mean_token_accuracy": 0.8843108080327511, "num_tokens": 790993647.0, "step": 24784 }, { "entropy": 0.4899860490113497, "epoch": 2.2803434137814045, "grad_norm": 0.16106028854846954, "learning_rate": 2.3991780905940445e-05, "loss": 0.4797, "mean_token_accuracy": 0.8459254540503025, "num_tokens": 791025423.0, "step": 24785 }, { "entropy": 0.5589744085446, "epoch": 2.2804354201528456, "grad_norm": 0.1688041090965271, "learning_rate": 2.398871407979882e-05, "loss": 0.548, "mean_token_accuracy": 0.8261574544012547, "num_tokens": 791056446.0, "step": 24786 }, { "entropy": 0.5728647038340569, "epoch": 2.2805274265242867, "grad_norm": 0.16749505698680878, "learning_rate": 2.3985647253657194e-05, "loss": 0.5469, "mean_token_accuracy": 0.8277237340807915, "num_tokens": 791088576.0, "step": 24787 }, { "entropy": 0.5854055266827345, "epoch": 2.280619432895728, "grad_norm": 0.17314982414245605, "learning_rate": 2.3982580427515565e-05, "loss": 0.5755, "mean_token_accuracy": 0.8199371434748173, "num_tokens": 791120047.0, "step": 24788 }, { "entropy": 0.5484726140275598, "epoch": 2.2807114392671695, "grad_norm": 0.16455323994159698, "learning_rate": 2.397951360137394e-05, "loss": 0.5382, "mean_token_accuracy": 0.8308266848325729, "num_tokens": 791151700.0, "step": 24789 }, { "entropy": 0.5946166310459375, "epoch": 2.2808034456386106, "grad_norm": 0.16933166980743408, "learning_rate": 2.3976446775232315e-05, "loss": 0.5806, "mean_token_accuracy": 0.8195050582289696, "num_tokens": 791183795.0, "step": 24790 }, { "entropy": 0.46106779482215643, "epoch": 2.2808954520100517, "grad_norm": 0.154572993516922, "learning_rate": 2.397337994909069e-05, "loss": 0.4483, "mean_token_accuracy": 0.8560198359191418, "num_tokens": 791215946.0, "step": 24791 }, { "entropy": 0.5518293082714081, "epoch": 2.280987458381493, "grad_norm": 0.1669662743806839, "learning_rate": 2.397031312294906e-05, "loss": 0.5516, "mean_token_accuracy": 0.8271403722465038, "num_tokens": 791247698.0, "step": 24792 }, { "entropy": 0.4622586041223258, "epoch": 2.281079464752934, "grad_norm": 0.1598619669675827, "learning_rate": 2.3967246296807435e-05, "loss": 0.4473, "mean_token_accuracy": 0.8568647652864456, "num_tokens": 791279556.0, "step": 24793 }, { "entropy": 0.5448378091678023, "epoch": 2.2811714711243756, "grad_norm": 0.1617441475391388, "learning_rate": 2.396417947066581e-05, "loss": 0.5341, "mean_token_accuracy": 0.8339422158896923, "num_tokens": 791311405.0, "step": 24794 }, { "entropy": 0.4678119895979762, "epoch": 2.2812634774958167, "grad_norm": 0.15835782885551453, "learning_rate": 2.3961112644524184e-05, "loss": 0.4644, "mean_token_accuracy": 0.8502156436443329, "num_tokens": 791343025.0, "step": 24795 }, { "entropy": 0.5538558587431908, "epoch": 2.281355483867258, "grad_norm": 0.17029927670955658, "learning_rate": 2.395804581838256e-05, "loss": 0.5385, "mean_token_accuracy": 0.8252853453159332, "num_tokens": 791373791.0, "step": 24796 }, { "entropy": 0.510709134163335, "epoch": 2.281447490238699, "grad_norm": 0.15592913329601288, "learning_rate": 2.395497899224093e-05, "loss": 0.4903, "mean_token_accuracy": 0.8452670387923717, "num_tokens": 791405693.0, "step": 24797 }, { "entropy": 0.4610164910554886, "epoch": 2.28153949661014, "grad_norm": 0.15347999334335327, "learning_rate": 2.3951912166099305e-05, "loss": 0.4484, "mean_token_accuracy": 0.8577833510935307, "num_tokens": 791437528.0, "step": 24798 }, { "entropy": 0.46515609370544553, "epoch": 2.2816315029815817, "grad_norm": 0.15384450554847717, "learning_rate": 2.394884533995768e-05, "loss": 0.4547, "mean_token_accuracy": 0.8565889075398445, "num_tokens": 791470296.0, "step": 24799 }, { "entropy": 0.6078530941158533, "epoch": 2.281723509353023, "grad_norm": 0.1732209026813507, "learning_rate": 2.3945778513816054e-05, "loss": 0.6064, "mean_token_accuracy": 0.8115341551601887, "num_tokens": 791502254.0, "step": 24800 }, { "entropy": 0.5344701362773776, "epoch": 2.281815515724464, "grad_norm": 0.1649043709039688, "learning_rate": 2.3942711687674425e-05, "loss": 0.5338, "mean_token_accuracy": 0.8312117159366608, "num_tokens": 791533985.0, "step": 24801 }, { "entropy": 0.6104875914752483, "epoch": 2.281907522095905, "grad_norm": 0.17123457789421082, "learning_rate": 2.39396448615328e-05, "loss": 0.5931, "mean_token_accuracy": 0.816267341375351, "num_tokens": 791564956.0, "step": 24802 }, { "entropy": 0.4413899378851056, "epoch": 2.281999528467346, "grad_norm": 0.15201131999492645, "learning_rate": 2.3936578035391175e-05, "loss": 0.4288, "mean_token_accuracy": 0.8614715933799744, "num_tokens": 791596963.0, "step": 24803 }, { "entropy": 0.5045588286593556, "epoch": 2.282091534838788, "grad_norm": 0.15923380851745605, "learning_rate": 2.393351120924955e-05, "loss": 0.4875, "mean_token_accuracy": 0.8449950590729713, "num_tokens": 791629059.0, "step": 24804 }, { "entropy": 0.47442026529461145, "epoch": 2.282183541210229, "grad_norm": 0.15318168699741364, "learning_rate": 2.393044438310792e-05, "loss": 0.4562, "mean_token_accuracy": 0.8504163809120655, "num_tokens": 791660510.0, "step": 24805 }, { "entropy": 0.4882506625726819, "epoch": 2.28227554758167, "grad_norm": 0.1615293025970459, "learning_rate": 2.3927377556966295e-05, "loss": 0.4758, "mean_token_accuracy": 0.8465575687587261, "num_tokens": 791692490.0, "step": 24806 }, { "entropy": 0.551159480586648, "epoch": 2.282367553953111, "grad_norm": 0.16946566104888916, "learning_rate": 2.392431073082467e-05, "loss": 0.5323, "mean_token_accuracy": 0.8313930593430996, "num_tokens": 791724267.0, "step": 24807 }, { "entropy": 0.5299145970493555, "epoch": 2.2824595603245523, "grad_norm": 0.16257037222385406, "learning_rate": 2.3921243904683045e-05, "loss": 0.5137, "mean_token_accuracy": 0.8339723274111748, "num_tokens": 791755991.0, "step": 24808 }, { "entropy": 0.4500005654990673, "epoch": 2.282551566695994, "grad_norm": 0.15196345746517181, "learning_rate": 2.391817707854142e-05, "loss": 0.4493, "mean_token_accuracy": 0.858436830341816, "num_tokens": 791788286.0, "step": 24809 }, { "entropy": 0.5027348008006811, "epoch": 2.282643573067435, "grad_norm": 0.1600855439901352, "learning_rate": 2.391511025239979e-05, "loss": 0.4921, "mean_token_accuracy": 0.8421994857490063, "num_tokens": 791819985.0, "step": 24810 }, { "entropy": 0.5297353584319353, "epoch": 2.282735579438876, "grad_norm": 0.16726653277873993, "learning_rate": 2.3912043426258165e-05, "loss": 0.5188, "mean_token_accuracy": 0.8369172066450119, "num_tokens": 791851793.0, "step": 24811 }, { "entropy": 0.42849821876734495, "epoch": 2.2828275858103173, "grad_norm": 0.151315838098526, "learning_rate": 2.390897660011654e-05, "loss": 0.421, "mean_token_accuracy": 0.8652885779738426, "num_tokens": 791883999.0, "step": 24812 }, { "entropy": 0.5561282448470592, "epoch": 2.2829195921817584, "grad_norm": 0.16204121708869934, "learning_rate": 2.3905909773974914e-05, "loss": 0.5273, "mean_token_accuracy": 0.8308124803006649, "num_tokens": 791915578.0, "step": 24813 }, { "entropy": 0.4788082279264927, "epoch": 2.2830115985532, "grad_norm": 0.1507711261510849, "learning_rate": 2.3902842947833286e-05, "loss": 0.4598, "mean_token_accuracy": 0.8515395745635033, "num_tokens": 791947904.0, "step": 24814 }, { "entropy": 0.4490137444809079, "epoch": 2.283103604924641, "grad_norm": 0.15423455834388733, "learning_rate": 2.3899776121691664e-05, "loss": 0.4315, "mean_token_accuracy": 0.858571495860815, "num_tokens": 791979334.0, "step": 24815 }, { "entropy": 0.43072577752172947, "epoch": 2.2831956112960823, "grad_norm": 0.14879333972930908, "learning_rate": 2.389670929555004e-05, "loss": 0.4172, "mean_token_accuracy": 0.8696215786039829, "num_tokens": 792011399.0, "step": 24816 }, { "entropy": 0.4295141980983317, "epoch": 2.2832876176675234, "grad_norm": 0.1480940878391266, "learning_rate": 2.3893642469408413e-05, "loss": 0.4162, "mean_token_accuracy": 0.8686994016170502, "num_tokens": 792043187.0, "step": 24817 }, { "entropy": 0.4499346436932683, "epoch": 2.2833796240389646, "grad_norm": 0.14978231489658356, "learning_rate": 2.3890575643266784e-05, "loss": 0.429, "mean_token_accuracy": 0.8648983612656593, "num_tokens": 792075536.0, "step": 24818 }, { "entropy": 0.5355925555340946, "epoch": 2.283471630410406, "grad_norm": 0.15664741396903992, "learning_rate": 2.388750881712516e-05, "loss": 0.5233, "mean_token_accuracy": 0.8355017006397247, "num_tokens": 792107341.0, "step": 24819 }, { "entropy": 0.5331519423052669, "epoch": 2.2835636367818473, "grad_norm": 0.1627216339111328, "learning_rate": 2.3884441990983534e-05, "loss": 0.5153, "mean_token_accuracy": 0.8328422345221043, "num_tokens": 792139357.0, "step": 24820 }, { "entropy": 0.5187115352600813, "epoch": 2.2836556431532884, "grad_norm": 0.16298623383045197, "learning_rate": 2.3881375164841908e-05, "loss": 0.5098, "mean_token_accuracy": 0.8378810435533524, "num_tokens": 792170227.0, "step": 24821 }, { "entropy": 0.4249349208548665, "epoch": 2.2837476495247295, "grad_norm": 0.15532466769218445, "learning_rate": 2.387830833870028e-05, "loss": 0.4046, "mean_token_accuracy": 0.8710414357483387, "num_tokens": 792202293.0, "step": 24822 }, { "entropy": 0.5577663253061473, "epoch": 2.2838396558961707, "grad_norm": 0.17101067304611206, "learning_rate": 2.3875241512558654e-05, "loss": 0.5539, "mean_token_accuracy": 0.8272484838962555, "num_tokens": 792234446.0, "step": 24823 }, { "entropy": 0.5460330191999674, "epoch": 2.2839316622676122, "grad_norm": 0.17109671235084534, "learning_rate": 2.387217468641703e-05, "loss": 0.5342, "mean_token_accuracy": 0.8329455070197582, "num_tokens": 792266331.0, "step": 24824 }, { "entropy": 0.47528935014270246, "epoch": 2.2840236686390534, "grad_norm": 0.1649189293384552, "learning_rate": 2.3869107860275403e-05, "loss": 0.4728, "mean_token_accuracy": 0.855821929872036, "num_tokens": 792297812.0, "step": 24825 }, { "entropy": 0.5040144175291061, "epoch": 2.2841156750104945, "grad_norm": 0.15947218239307404, "learning_rate": 2.3866041034133778e-05, "loss": 0.492, "mean_token_accuracy": 0.8391249477863312, "num_tokens": 792330003.0, "step": 24826 }, { "entropy": 0.5749142458662391, "epoch": 2.2842076813819356, "grad_norm": 0.16964176297187805, "learning_rate": 2.386297420799215e-05, "loss": 0.5673, "mean_token_accuracy": 0.8201099820435047, "num_tokens": 792362261.0, "step": 24827 }, { "entropy": 0.5782619612291455, "epoch": 2.2842996877533768, "grad_norm": 0.1663077175617218, "learning_rate": 2.3859907381850524e-05, "loss": 0.5742, "mean_token_accuracy": 0.818776935338974, "num_tokens": 792394430.0, "step": 24828 }, { "entropy": 0.4593889620155096, "epoch": 2.2843916941248184, "grad_norm": 0.1477755904197693, "learning_rate": 2.38568405557089e-05, "loss": 0.4413, "mean_token_accuracy": 0.8597980812191963, "num_tokens": 792426810.0, "step": 24829 }, { "entropy": 0.4442543718032539, "epoch": 2.2844837004962595, "grad_norm": 0.14572575688362122, "learning_rate": 2.3853773729567273e-05, "loss": 0.4312, "mean_token_accuracy": 0.8618288040161133, "num_tokens": 792459497.0, "step": 24830 }, { "entropy": 0.5595119148492813, "epoch": 2.2845757068677006, "grad_norm": 0.16482427716255188, "learning_rate": 2.3850706903425645e-05, "loss": 0.5294, "mean_token_accuracy": 0.8319618664681911, "num_tokens": 792491225.0, "step": 24831 }, { "entropy": 0.5267618531361222, "epoch": 2.2846677132391418, "grad_norm": 0.1620045006275177, "learning_rate": 2.384764007728402e-05, "loss": 0.513, "mean_token_accuracy": 0.8392653577029705, "num_tokens": 792523468.0, "step": 24832 }, { "entropy": 0.5546950157731771, "epoch": 2.284759719610583, "grad_norm": 0.1670035868883133, "learning_rate": 2.3844573251142394e-05, "loss": 0.5499, "mean_token_accuracy": 0.8272733986377716, "num_tokens": 792555101.0, "step": 24833 }, { "entropy": 0.49882730562239885, "epoch": 2.2848517259820245, "grad_norm": 0.16393402218818665, "learning_rate": 2.384150642500077e-05, "loss": 0.4902, "mean_token_accuracy": 0.8480370156466961, "num_tokens": 792586935.0, "step": 24834 }, { "entropy": 0.5304940789937973, "epoch": 2.2849437323534656, "grad_norm": 0.16163566708564758, "learning_rate": 2.383843959885914e-05, "loss": 0.518, "mean_token_accuracy": 0.8351639471948147, "num_tokens": 792618867.0, "step": 24835 }, { "entropy": 0.5405516214668751, "epoch": 2.2850357387249067, "grad_norm": 0.1640494465827942, "learning_rate": 2.3835372772717514e-05, "loss": 0.5258, "mean_token_accuracy": 0.8326949253678322, "num_tokens": 792651123.0, "step": 24836 }, { "entropy": 0.5379005651921034, "epoch": 2.285127745096348, "grad_norm": 0.16129571199417114, "learning_rate": 2.383230594657589e-05, "loss": 0.5238, "mean_token_accuracy": 0.8378556668758392, "num_tokens": 792683058.0, "step": 24837 }, { "entropy": 0.5988846025429666, "epoch": 2.285219751467789, "grad_norm": 0.1678108274936676, "learning_rate": 2.3829239120434264e-05, "loss": 0.5951, "mean_token_accuracy": 0.8139962330460548, "num_tokens": 792714637.0, "step": 24838 }, { "entropy": 0.567249515093863, "epoch": 2.2853117578392306, "grad_norm": 0.16749542951583862, "learning_rate": 2.382617229429264e-05, "loss": 0.5526, "mean_token_accuracy": 0.8248436078429222, "num_tokens": 792746782.0, "step": 24839 }, { "entropy": 0.5368151385337114, "epoch": 2.2854037642106717, "grad_norm": 0.16476984322071075, "learning_rate": 2.382310546815101e-05, "loss": 0.5176, "mean_token_accuracy": 0.8377166353166103, "num_tokens": 792777314.0, "step": 24840 }, { "entropy": 0.5799811342731118, "epoch": 2.285495770582113, "grad_norm": 0.1655520349740982, "learning_rate": 2.3820038642009384e-05, "loss": 0.5749, "mean_token_accuracy": 0.8206891976296902, "num_tokens": 792808672.0, "step": 24841 }, { "entropy": 0.4866250157356262, "epoch": 2.285587776953554, "grad_norm": 0.1513582170009613, "learning_rate": 2.381697181586776e-05, "loss": 0.4757, "mean_token_accuracy": 0.8500857129693031, "num_tokens": 792841388.0, "step": 24842 }, { "entropy": 0.4979741391725838, "epoch": 2.285679783324995, "grad_norm": 0.15846651792526245, "learning_rate": 2.3813904989726134e-05, "loss": 0.4841, "mean_token_accuracy": 0.8451021537184715, "num_tokens": 792872818.0, "step": 24843 }, { "entropy": 0.49096371699124575, "epoch": 2.2857717896964367, "grad_norm": 0.16009491682052612, "learning_rate": 2.3810838163584505e-05, "loss": 0.4749, "mean_token_accuracy": 0.8484003469347954, "num_tokens": 792905337.0, "step": 24844 }, { "entropy": 0.45691578835248947, "epoch": 2.285863796067878, "grad_norm": 0.14683660864830017, "learning_rate": 2.380777133744288e-05, "loss": 0.4482, "mean_token_accuracy": 0.8558922633528709, "num_tokens": 792937819.0, "step": 24845 }, { "entropy": 0.4566968632861972, "epoch": 2.285955802439319, "grad_norm": 0.16040609776973724, "learning_rate": 2.3804704511301258e-05, "loss": 0.4483, "mean_token_accuracy": 0.8533603362739086, "num_tokens": 792969808.0, "step": 24846 }, { "entropy": 0.5422802092507482, "epoch": 2.28604780881076, "grad_norm": 0.1609673649072647, "learning_rate": 2.3801637685159632e-05, "loss": 0.5216, "mean_token_accuracy": 0.8359594866633415, "num_tokens": 793001119.0, "step": 24847 }, { "entropy": 0.436546198092401, "epoch": 2.286139815182201, "grad_norm": 0.15388156473636627, "learning_rate": 2.3798570859018003e-05, "loss": 0.4284, "mean_token_accuracy": 0.8619458042085171, "num_tokens": 793033222.0, "step": 24848 }, { "entropy": 0.5969141526147723, "epoch": 2.286231821553643, "grad_norm": 0.16694167256355286, "learning_rate": 2.3795504032876378e-05, "loss": 0.5734, "mean_token_accuracy": 0.8169064782559872, "num_tokens": 793064889.0, "step": 24849 }, { "entropy": 0.4826177656650543, "epoch": 2.286323827925084, "grad_norm": 0.15813980996608734, "learning_rate": 2.3792437206734753e-05, "loss": 0.4697, "mean_token_accuracy": 0.8459763564169407, "num_tokens": 793095831.0, "step": 24850 }, { "entropy": 0.6163155829999596, "epoch": 2.286415834296525, "grad_norm": 0.17658652365207672, "learning_rate": 2.3789370380593127e-05, "loss": 0.6057, "mean_token_accuracy": 0.8145327270030975, "num_tokens": 793127541.0, "step": 24851 }, { "entropy": 0.48891609720885754, "epoch": 2.286507840667966, "grad_norm": 0.15677377581596375, "learning_rate": 2.37863035544515e-05, "loss": 0.4769, "mean_token_accuracy": 0.8470417633652687, "num_tokens": 793160148.0, "step": 24852 }, { "entropy": 0.5009251795709133, "epoch": 2.2865998470394073, "grad_norm": 0.15830300748348236, "learning_rate": 2.3783236728309873e-05, "loss": 0.4954, "mean_token_accuracy": 0.8442185930907726, "num_tokens": 793192624.0, "step": 24853 }, { "entropy": 0.4645731821656227, "epoch": 2.286691853410849, "grad_norm": 0.15075166523456573, "learning_rate": 2.3780169902168248e-05, "loss": 0.4506, "mean_token_accuracy": 0.8552990257740021, "num_tokens": 793224860.0, "step": 24854 }, { "entropy": 0.562318854033947, "epoch": 2.28678385978229, "grad_norm": 0.16468562185764313, "learning_rate": 2.3777103076026623e-05, "loss": 0.5578, "mean_token_accuracy": 0.8265339769423008, "num_tokens": 793257325.0, "step": 24855 }, { "entropy": 0.5233801235444844, "epoch": 2.286875866153731, "grad_norm": 0.16498275101184845, "learning_rate": 2.3774036249884997e-05, "loss": 0.4985, "mean_token_accuracy": 0.8422559536993504, "num_tokens": 793288865.0, "step": 24856 }, { "entropy": 0.39774706959724426, "epoch": 2.2869678725251723, "grad_norm": 0.14888112246990204, "learning_rate": 2.377096942374337e-05, "loss": 0.3871, "mean_token_accuracy": 0.8776350058615208, "num_tokens": 793321448.0, "step": 24857 }, { "entropy": 0.48350213887169957, "epoch": 2.2870598788966134, "grad_norm": 0.1567506343126297, "learning_rate": 2.3767902597601743e-05, "loss": 0.4657, "mean_token_accuracy": 0.8544227033853531, "num_tokens": 793353179.0, "step": 24858 }, { "entropy": 0.5305229439400136, "epoch": 2.287151885268055, "grad_norm": 0.15970700979232788, "learning_rate": 2.3764835771460118e-05, "loss": 0.5198, "mean_token_accuracy": 0.8407006859779358, "num_tokens": 793385731.0, "step": 24859 }, { "entropy": 0.5660337107256055, "epoch": 2.287243891639496, "grad_norm": 0.1712346225976944, "learning_rate": 2.3761768945318492e-05, "loss": 0.5524, "mean_token_accuracy": 0.8273665979504585, "num_tokens": 793417088.0, "step": 24860 }, { "entropy": 0.55980743188411, "epoch": 2.2873358980109373, "grad_norm": 0.16241925954818726, "learning_rate": 2.3758702119176864e-05, "loss": 0.5435, "mean_token_accuracy": 0.8272862732410431, "num_tokens": 793448938.0, "step": 24861 }, { "entropy": 0.5008371602743864, "epoch": 2.2874279043823784, "grad_norm": 0.1607091873884201, "learning_rate": 2.375563529303524e-05, "loss": 0.488, "mean_token_accuracy": 0.8471826799213886, "num_tokens": 793480849.0, "step": 24862 }, { "entropy": 0.5121421338990331, "epoch": 2.2875199107538196, "grad_norm": 0.1599029153585434, "learning_rate": 2.3752568466893613e-05, "loss": 0.4942, "mean_token_accuracy": 0.8410870581865311, "num_tokens": 793513131.0, "step": 24863 }, { "entropy": 0.5173291489481926, "epoch": 2.287611917125261, "grad_norm": 0.16081157326698303, "learning_rate": 2.3749501640751988e-05, "loss": 0.5048, "mean_token_accuracy": 0.838460274040699, "num_tokens": 793544982.0, "step": 24864 }, { "entropy": 0.4626592234708369, "epoch": 2.2877039234967023, "grad_norm": 0.15120665729045868, "learning_rate": 2.374643481461036e-05, "loss": 0.4435, "mean_token_accuracy": 0.8600866496562958, "num_tokens": 793576758.0, "step": 24865 }, { "entropy": 0.49226532503962517, "epoch": 2.2877959298681434, "grad_norm": 0.1529003083705902, "learning_rate": 2.3743367988468734e-05, "loss": 0.4845, "mean_token_accuracy": 0.8442454822361469, "num_tokens": 793608725.0, "step": 24866 }, { "entropy": 0.49319954123348, "epoch": 2.2878879362395845, "grad_norm": 0.15869943797588348, "learning_rate": 2.3740301162327108e-05, "loss": 0.4894, "mean_token_accuracy": 0.8455931283533573, "num_tokens": 793640839.0, "step": 24867 }, { "entropy": 0.5275928564369678, "epoch": 2.2879799426110257, "grad_norm": 0.16878071427345276, "learning_rate": 2.3737234336185483e-05, "loss": 0.5225, "mean_token_accuracy": 0.8354265205562115, "num_tokens": 793672334.0, "step": 24868 }, { "entropy": 0.5378963500261307, "epoch": 2.2880719489824672, "grad_norm": 0.15558236837387085, "learning_rate": 2.3734167510043857e-05, "loss": 0.5281, "mean_token_accuracy": 0.8359597064554691, "num_tokens": 793704429.0, "step": 24869 }, { "entropy": 0.5604167282581329, "epoch": 2.2881639553539084, "grad_norm": 0.1706591546535492, "learning_rate": 2.373110068390223e-05, "loss": 0.5622, "mean_token_accuracy": 0.8249838165938854, "num_tokens": 793736462.0, "step": 24870 }, { "entropy": 0.6215525325387716, "epoch": 2.2882559617253495, "grad_norm": 0.1735486388206482, "learning_rate": 2.3728033857760603e-05, "loss": 0.6094, "mean_token_accuracy": 0.8098603151738644, "num_tokens": 793767537.0, "step": 24871 }, { "entropy": 0.44446720462292433, "epoch": 2.2883479680967906, "grad_norm": 0.1616355925798416, "learning_rate": 2.3724967031618978e-05, "loss": 0.4361, "mean_token_accuracy": 0.860302560031414, "num_tokens": 793799400.0, "step": 24872 }, { "entropy": 0.5838195476680994, "epoch": 2.2884399744682318, "grad_norm": 0.1735939234495163, "learning_rate": 2.3721900205477353e-05, "loss": 0.5714, "mean_token_accuracy": 0.8199001736938953, "num_tokens": 793830307.0, "step": 24873 }, { "entropy": 0.5196483000181615, "epoch": 2.2885319808396734, "grad_norm": 0.16798022389411926, "learning_rate": 2.3718833379335724e-05, "loss": 0.5089, "mean_token_accuracy": 0.8390682078897953, "num_tokens": 793861824.0, "step": 24874 }, { "entropy": 0.49593030381947756, "epoch": 2.2886239872111145, "grad_norm": 0.1553063839673996, "learning_rate": 2.37157665531941e-05, "loss": 0.4861, "mean_token_accuracy": 0.8430583588778973, "num_tokens": 793894019.0, "step": 24875 }, { "entropy": 0.4773111455142498, "epoch": 2.2887159935825556, "grad_norm": 0.1506500542163849, "learning_rate": 2.3712699727052477e-05, "loss": 0.4547, "mean_token_accuracy": 0.8549998998641968, "num_tokens": 793925963.0, "step": 24876 }, { "entropy": 0.4746790425851941, "epoch": 2.2888079999539968, "grad_norm": 0.15540798008441925, "learning_rate": 2.370963290091085e-05, "loss": 0.4605, "mean_token_accuracy": 0.8527517132461071, "num_tokens": 793957729.0, "step": 24877 }, { "entropy": 0.4879652170930058, "epoch": 2.288900006325438, "grad_norm": 0.15284959971904755, "learning_rate": 2.3706566074769223e-05, "loss": 0.4652, "mean_token_accuracy": 0.8516496866941452, "num_tokens": 793989891.0, "step": 24878 }, { "entropy": 0.548241501674056, "epoch": 2.2889920126968795, "grad_norm": 0.16330325603485107, "learning_rate": 2.3703499248627597e-05, "loss": 0.5337, "mean_token_accuracy": 0.8324509970843792, "num_tokens": 794021365.0, "step": 24879 }, { "entropy": 0.6628760285675526, "epoch": 2.2890840190683206, "grad_norm": 0.18108564615249634, "learning_rate": 2.3700432422485972e-05, "loss": 0.6495, "mean_token_accuracy": 0.7971770539879799, "num_tokens": 794052910.0, "step": 24880 }, { "entropy": 0.5601666020229459, "epoch": 2.2891760254397617, "grad_norm": 0.1684601902961731, "learning_rate": 2.3697365596344346e-05, "loss": 0.5636, "mean_token_accuracy": 0.8236116506159306, "num_tokens": 794084922.0, "step": 24881 }, { "entropy": 0.49340156139805913, "epoch": 2.289268031811203, "grad_norm": 0.15913309156894684, "learning_rate": 2.3694298770202718e-05, "loss": 0.4821, "mean_token_accuracy": 0.8451677896082401, "num_tokens": 794117051.0, "step": 24882 }, { "entropy": 0.5375500526279211, "epoch": 2.289360038182644, "grad_norm": 0.1632024496793747, "learning_rate": 2.3691231944061092e-05, "loss": 0.5058, "mean_token_accuracy": 0.835398904979229, "num_tokens": 794148299.0, "step": 24883 }, { "entropy": 0.5176742672920227, "epoch": 2.2894520445540856, "grad_norm": 0.1611640900373459, "learning_rate": 2.3688165117919467e-05, "loss": 0.5003, "mean_token_accuracy": 0.8412742167711258, "num_tokens": 794179535.0, "step": 24884 }, { "entropy": 0.5000151889398694, "epoch": 2.2895440509255267, "grad_norm": 0.1591489464044571, "learning_rate": 2.368509829177784e-05, "loss": 0.4827, "mean_token_accuracy": 0.8456514216959476, "num_tokens": 794211121.0, "step": 24885 }, { "entropy": 0.5212646559812129, "epoch": 2.289636057296968, "grad_norm": 0.1624983847141266, "learning_rate": 2.3682031465636216e-05, "loss": 0.5112, "mean_token_accuracy": 0.8402030803263187, "num_tokens": 794243303.0, "step": 24886 }, { "entropy": 0.48617367167025805, "epoch": 2.289728063668409, "grad_norm": 0.15178504586219788, "learning_rate": 2.3678964639494588e-05, "loss": 0.4707, "mean_token_accuracy": 0.8515279218554497, "num_tokens": 794275409.0, "step": 24887 }, { "entropy": 0.5560215450823307, "epoch": 2.28982007003985, "grad_norm": 0.1634722203016281, "learning_rate": 2.3675897813352962e-05, "loss": 0.5462, "mean_token_accuracy": 0.8272469937801361, "num_tokens": 794307613.0, "step": 24888 }, { "entropy": 0.5791906900703907, "epoch": 2.2899120764112917, "grad_norm": 0.1649608165025711, "learning_rate": 2.3672830987211337e-05, "loss": 0.561, "mean_token_accuracy": 0.822334673255682, "num_tokens": 794339232.0, "step": 24889 }, { "entropy": 0.5460730958729982, "epoch": 2.290004082782733, "grad_norm": 0.1637134999036789, "learning_rate": 2.366976416106971e-05, "loss": 0.5402, "mean_token_accuracy": 0.8284619115293026, "num_tokens": 794371334.0, "step": 24890 }, { "entropy": 0.3595392741262913, "epoch": 2.290096089154174, "grad_norm": 0.13924045860767365, "learning_rate": 2.3666697334928083e-05, "loss": 0.3455, "mean_token_accuracy": 0.890695832669735, "num_tokens": 794403458.0, "step": 24891 }, { "entropy": 0.5482819201424718, "epoch": 2.290188095525615, "grad_norm": 0.17220479249954224, "learning_rate": 2.3663630508786457e-05, "loss": 0.5518, "mean_token_accuracy": 0.8342283852398396, "num_tokens": 794435305.0, "step": 24892 }, { "entropy": 0.46083150804042816, "epoch": 2.290280101897056, "grad_norm": 0.18036280572414398, "learning_rate": 2.3660563682644832e-05, "loss": 0.4496, "mean_token_accuracy": 0.8544235862791538, "num_tokens": 794466723.0, "step": 24893 }, { "entropy": 0.49965286161750555, "epoch": 2.290372108268498, "grad_norm": 0.15604689717292786, "learning_rate": 2.3657496856503207e-05, "loss": 0.4836, "mean_token_accuracy": 0.8497989289462566, "num_tokens": 794498949.0, "step": 24894 }, { "entropy": 0.5785507261753082, "epoch": 2.290464114639939, "grad_norm": 0.17067939043045044, "learning_rate": 2.3654430030361578e-05, "loss": 0.5777, "mean_token_accuracy": 0.8159575909376144, "num_tokens": 794530481.0, "step": 24895 }, { "entropy": 0.5533730015158653, "epoch": 2.29055612101138, "grad_norm": 0.163491889834404, "learning_rate": 2.3651363204219953e-05, "loss": 0.5441, "mean_token_accuracy": 0.8289369903504848, "num_tokens": 794562266.0, "step": 24896 }, { "entropy": 0.5203097239136696, "epoch": 2.290648127382821, "grad_norm": 0.16478732228279114, "learning_rate": 2.3648296378078327e-05, "loss": 0.5028, "mean_token_accuracy": 0.839831605553627, "num_tokens": 794594297.0, "step": 24897 }, { "entropy": 0.5097546866163611, "epoch": 2.2907401337542623, "grad_norm": 0.16548706591129303, "learning_rate": 2.3645229551936702e-05, "loss": 0.4889, "mean_token_accuracy": 0.8471565507352352, "num_tokens": 794626112.0, "step": 24898 }, { "entropy": 0.6701088100671768, "epoch": 2.290832140125704, "grad_norm": 0.1767224818468094, "learning_rate": 2.3642162725795077e-05, "loss": 0.6604, "mean_token_accuracy": 0.7927133813500404, "num_tokens": 794658071.0, "step": 24899 }, { "entropy": 0.49892285466194153, "epoch": 2.290924146497145, "grad_norm": 0.15428024530410767, "learning_rate": 2.3639095899653448e-05, "loss": 0.4795, "mean_token_accuracy": 0.8453267626464367, "num_tokens": 794690297.0, "step": 24900 }, { "entropy": 0.4492517402395606, "epoch": 2.291016152868586, "grad_norm": 0.14764510095119476, "learning_rate": 2.3636029073511822e-05, "loss": 0.4272, "mean_token_accuracy": 0.8607335835695267, "num_tokens": 794721980.0, "step": 24901 }, { "entropy": 0.5611344091594219, "epoch": 2.2911081592400273, "grad_norm": 0.16714975237846375, "learning_rate": 2.3632962247370197e-05, "loss": 0.5514, "mean_token_accuracy": 0.8277269601821899, "num_tokens": 794753810.0, "step": 24902 }, { "entropy": 0.5589141305536032, "epoch": 2.2912001656114684, "grad_norm": 0.16229067742824554, "learning_rate": 2.3629895421228572e-05, "loss": 0.5452, "mean_token_accuracy": 0.8296162858605385, "num_tokens": 794785872.0, "step": 24903 }, { "entropy": 0.47427027812227607, "epoch": 2.29129217198291, "grad_norm": 0.15505018830299377, "learning_rate": 2.3626828595086943e-05, "loss": 0.4635, "mean_token_accuracy": 0.8541552573442459, "num_tokens": 794817973.0, "step": 24904 }, { "entropy": 0.5825018975883722, "epoch": 2.291384178354351, "grad_norm": 0.1621822863817215, "learning_rate": 2.3623761768945318e-05, "loss": 0.5623, "mean_token_accuracy": 0.8214263580739498, "num_tokens": 794850118.0, "step": 24905 }, { "entropy": 0.4485404046718031, "epoch": 2.2914761847257923, "grad_norm": 0.14725925028324127, "learning_rate": 2.3620694942803692e-05, "loss": 0.4319, "mean_token_accuracy": 0.8630339130759239, "num_tokens": 794882369.0, "step": 24906 }, { "entropy": 0.5990163937676698, "epoch": 2.2915681910972334, "grad_norm": 0.16861175000667572, "learning_rate": 2.361762811666207e-05, "loss": 0.5749, "mean_token_accuracy": 0.8198669441044331, "num_tokens": 794914211.0, "step": 24907 }, { "entropy": 0.47966704796999693, "epoch": 2.2916601974686746, "grad_norm": 0.1593606173992157, "learning_rate": 2.361456129052044e-05, "loss": 0.4774, "mean_token_accuracy": 0.8502033576369286, "num_tokens": 794945757.0, "step": 24908 }, { "entropy": 0.5142995631322265, "epoch": 2.291752203840116, "grad_norm": 0.1601037085056305, "learning_rate": 2.3611494464378816e-05, "loss": 0.4922, "mean_token_accuracy": 0.8429182805120945, "num_tokens": 794977975.0, "step": 24909 }, { "entropy": 0.5072799725458026, "epoch": 2.2918442102115573, "grad_norm": 0.15894857048988342, "learning_rate": 2.360842763823719e-05, "loss": 0.4894, "mean_token_accuracy": 0.8451592922210693, "num_tokens": 795009550.0, "step": 24910 }, { "entropy": 0.455021345987916, "epoch": 2.2919362165829984, "grad_norm": 0.154002845287323, "learning_rate": 2.3605360812095566e-05, "loss": 0.4413, "mean_token_accuracy": 0.8605850525200367, "num_tokens": 795041747.0, "step": 24911 }, { "entropy": 0.5322994254529476, "epoch": 2.2920282229544395, "grad_norm": 0.1622229963541031, "learning_rate": 2.3602293985953937e-05, "loss": 0.5184, "mean_token_accuracy": 0.8332306668162346, "num_tokens": 795073529.0, "step": 24912 }, { "entropy": 0.5200427970848978, "epoch": 2.2921202293258807, "grad_norm": 0.1637488156557083, "learning_rate": 2.359922715981231e-05, "loss": 0.5075, "mean_token_accuracy": 0.836538553237915, "num_tokens": 795105089.0, "step": 24913 }, { "entropy": 0.4278418552130461, "epoch": 2.2922122356973222, "grad_norm": 0.1509123593568802, "learning_rate": 2.3596160333670686e-05, "loss": 0.413, "mean_token_accuracy": 0.8666439987719059, "num_tokens": 795137579.0, "step": 24914 }, { "entropy": 0.4667191943153739, "epoch": 2.2923042420687634, "grad_norm": 0.15407437086105347, "learning_rate": 2.359309350752906e-05, "loss": 0.4578, "mean_token_accuracy": 0.8538168370723724, "num_tokens": 795169549.0, "step": 24915 }, { "entropy": 0.5721341855823994, "epoch": 2.2923962484402045, "grad_norm": 0.16815850138664246, "learning_rate": 2.3590026681387435e-05, "loss": 0.5642, "mean_token_accuracy": 0.8263775780797005, "num_tokens": 795200966.0, "step": 24916 }, { "entropy": 0.5707619192544371, "epoch": 2.2924882548116456, "grad_norm": 0.17238500714302063, "learning_rate": 2.3586959855245807e-05, "loss": 0.5556, "mean_token_accuracy": 0.8277201130986214, "num_tokens": 795232603.0, "step": 24917 }, { "entropy": 0.5961763095110655, "epoch": 2.2925802611830868, "grad_norm": 0.17218802869319916, "learning_rate": 2.358389302910418e-05, "loss": 0.5899, "mean_token_accuracy": 0.8143988735973835, "num_tokens": 795264555.0, "step": 24918 }, { "entropy": 0.5173727568471804, "epoch": 2.2926722675545284, "grad_norm": 0.16452138125896454, "learning_rate": 2.3580826202962556e-05, "loss": 0.5031, "mean_token_accuracy": 0.8388156853616238, "num_tokens": 795296163.0, "step": 24919 }, { "entropy": 0.4490581825375557, "epoch": 2.2927642739259695, "grad_norm": 0.1591854840517044, "learning_rate": 2.357775937682093e-05, "loss": 0.4427, "mean_token_accuracy": 0.8585426360368729, "num_tokens": 795328191.0, "step": 24920 }, { "entropy": 0.5248182341456413, "epoch": 2.2928562802974106, "grad_norm": 0.15619227290153503, "learning_rate": 2.3574692550679302e-05, "loss": 0.5095, "mean_token_accuracy": 0.8397159390151501, "num_tokens": 795360887.0, "step": 24921 }, { "entropy": 0.48601557791698724, "epoch": 2.2929482866688518, "grad_norm": 0.16007116436958313, "learning_rate": 2.3571625724537677e-05, "loss": 0.4707, "mean_token_accuracy": 0.851886011660099, "num_tokens": 795391993.0, "step": 24922 }, { "entropy": 0.6015950590372086, "epoch": 2.293040293040293, "grad_norm": 0.16633644700050354, "learning_rate": 2.356855889839605e-05, "loss": 0.5858, "mean_token_accuracy": 0.8157526887953281, "num_tokens": 795424060.0, "step": 24923 }, { "entropy": 0.5174860870465636, "epoch": 2.2931322994117345, "grad_norm": 0.15745118260383606, "learning_rate": 2.3565492072254426e-05, "loss": 0.5182, "mean_token_accuracy": 0.8365189023315907, "num_tokens": 795456585.0, "step": 24924 }, { "entropy": 0.48351908661425114, "epoch": 2.2932243057831756, "grad_norm": 0.15613022446632385, "learning_rate": 2.3562425246112797e-05, "loss": 0.4701, "mean_token_accuracy": 0.8487137109041214, "num_tokens": 795488718.0, "step": 24925 }, { "entropy": 0.5244168797507882, "epoch": 2.2933163121546167, "grad_norm": 0.16309314966201782, "learning_rate": 2.3559358419971172e-05, "loss": 0.5204, "mean_token_accuracy": 0.8353947810828686, "num_tokens": 795521092.0, "step": 24926 }, { "entropy": 0.5111340545117855, "epoch": 2.293408318526058, "grad_norm": 0.1566571742296219, "learning_rate": 2.3556291593829546e-05, "loss": 0.4925, "mean_token_accuracy": 0.843125719577074, "num_tokens": 795553225.0, "step": 24927 }, { "entropy": 0.49534939881414175, "epoch": 2.293500324897499, "grad_norm": 0.1584838181734085, "learning_rate": 2.355322476768792e-05, "loss": 0.4865, "mean_token_accuracy": 0.8441843204200268, "num_tokens": 795584905.0, "step": 24928 }, { "entropy": 0.4930248875170946, "epoch": 2.2935923312689406, "grad_norm": 0.1552295684814453, "learning_rate": 2.3550157941546296e-05, "loss": 0.485, "mean_token_accuracy": 0.8470005393028259, "num_tokens": 795616891.0, "step": 24929 }, { "entropy": 0.5670562302693725, "epoch": 2.2936843376403817, "grad_norm": 0.1619044989347458, "learning_rate": 2.3547091115404667e-05, "loss": 0.5466, "mean_token_accuracy": 0.8271258771419525, "num_tokens": 795648767.0, "step": 24930 }, { "entropy": 0.48993699438869953, "epoch": 2.293776344011823, "grad_norm": 0.15871202945709229, "learning_rate": 2.354402428926304e-05, "loss": 0.4892, "mean_token_accuracy": 0.8455793559551239, "num_tokens": 795681010.0, "step": 24931 }, { "entropy": 0.6114970068447292, "epoch": 2.293868350383264, "grad_norm": 0.1773960441350937, "learning_rate": 2.3540957463121416e-05, "loss": 0.6077, "mean_token_accuracy": 0.8090360276401043, "num_tokens": 795712992.0, "step": 24932 }, { "entropy": 0.586564190685749, "epoch": 2.293960356754705, "grad_norm": 0.17255344986915588, "learning_rate": 2.353789063697979e-05, "loss": 0.5878, "mean_token_accuracy": 0.8187693580985069, "num_tokens": 795745009.0, "step": 24933 }, { "entropy": 0.45229259273037314, "epoch": 2.2940523631261467, "grad_norm": 0.15265166759490967, "learning_rate": 2.3534823810838162e-05, "loss": 0.4392, "mean_token_accuracy": 0.8599123284220695, "num_tokens": 795777450.0, "step": 24934 }, { "entropy": 0.5342502975836396, "epoch": 2.294144369497588, "grad_norm": 0.16088582575321198, "learning_rate": 2.3531756984696537e-05, "loss": 0.5281, "mean_token_accuracy": 0.8305434547364712, "num_tokens": 795809088.0, "step": 24935 }, { "entropy": 0.3938576662912965, "epoch": 2.294236375869029, "grad_norm": 0.1445605605840683, "learning_rate": 2.352869015855491e-05, "loss": 0.3745, "mean_token_accuracy": 0.8754732981324196, "num_tokens": 795840601.0, "step": 24936 }, { "entropy": 0.6105713210999966, "epoch": 2.29432838224047, "grad_norm": 0.17179830372333527, "learning_rate": 2.352562333241329e-05, "loss": 0.5941, "mean_token_accuracy": 0.8149853721261024, "num_tokens": 795872798.0, "step": 24937 }, { "entropy": 0.44254941027611494, "epoch": 2.294420388611911, "grad_norm": 0.1499170958995819, "learning_rate": 2.352255650627166e-05, "loss": 0.4242, "mean_token_accuracy": 0.8636000342667103, "num_tokens": 795904651.0, "step": 24938 }, { "entropy": 0.5381370261311531, "epoch": 2.294512394983353, "grad_norm": 0.16814732551574707, "learning_rate": 2.3519489680130035e-05, "loss": 0.5322, "mean_token_accuracy": 0.8310924954712391, "num_tokens": 795935845.0, "step": 24939 }, { "entropy": 0.4841436455026269, "epoch": 2.294604401354794, "grad_norm": 0.15658968687057495, "learning_rate": 2.351642285398841e-05, "loss": 0.4734, "mean_token_accuracy": 0.8511376678943634, "num_tokens": 795967812.0, "step": 24940 }, { "entropy": 0.46690370817668736, "epoch": 2.294696407726235, "grad_norm": 0.1546401083469391, "learning_rate": 2.3513356027846785e-05, "loss": 0.4569, "mean_token_accuracy": 0.8549908436834812, "num_tokens": 795999747.0, "step": 24941 }, { "entropy": 0.5135745285078883, "epoch": 2.294788414097676, "grad_norm": 0.15344947576522827, "learning_rate": 2.3510289201705156e-05, "loss": 0.4936, "mean_token_accuracy": 0.8460807986557484, "num_tokens": 796031859.0, "step": 24942 }, { "entropy": 0.5513822785578668, "epoch": 2.2948804204691173, "grad_norm": 0.16375668346881866, "learning_rate": 2.350722237556353e-05, "loss": 0.533, "mean_token_accuracy": 0.8333584107458591, "num_tokens": 796063750.0, "step": 24943 }, { "entropy": 0.5712618175894022, "epoch": 2.294972426840559, "grad_norm": 0.162966787815094, "learning_rate": 2.3504155549421905e-05, "loss": 0.5533, "mean_token_accuracy": 0.8253410346806049, "num_tokens": 796095722.0, "step": 24944 }, { "entropy": 0.5421283128671348, "epoch": 2.295064433212, "grad_norm": 0.16090109944343567, "learning_rate": 2.350108872328028e-05, "loss": 0.5266, "mean_token_accuracy": 0.8325337544083595, "num_tokens": 796128035.0, "step": 24945 }, { "entropy": 0.5856720940209925, "epoch": 2.295156439583441, "grad_norm": 0.1675437092781067, "learning_rate": 2.3498021897138655e-05, "loss": 0.57, "mean_token_accuracy": 0.8219611272215843, "num_tokens": 796160445.0, "step": 24946 }, { "entropy": 0.5179970301687717, "epoch": 2.2952484459548823, "grad_norm": 0.16377781331539154, "learning_rate": 2.3494955070997026e-05, "loss": 0.5089, "mean_token_accuracy": 0.8379718959331512, "num_tokens": 796192032.0, "step": 24947 }, { "entropy": 0.5205935016274452, "epoch": 2.2953404523263234, "grad_norm": 0.1659930944442749, "learning_rate": 2.34918882448554e-05, "loss": 0.4986, "mean_token_accuracy": 0.8413961715996265, "num_tokens": 796223252.0, "step": 24948 }, { "entropy": 0.5642033815383911, "epoch": 2.295432458697765, "grad_norm": 0.16385924816131592, "learning_rate": 2.3488821418713775e-05, "loss": 0.5441, "mean_token_accuracy": 0.8270787969231606, "num_tokens": 796254330.0, "step": 24949 }, { "entropy": 0.548665358684957, "epoch": 2.295524465069206, "grad_norm": 0.16018140316009521, "learning_rate": 2.348575459257215e-05, "loss": 0.5238, "mean_token_accuracy": 0.8301636427640915, "num_tokens": 796286009.0, "step": 24950 }, { "entropy": 0.6212998833507299, "epoch": 2.2956164714406473, "grad_norm": 0.16484177112579346, "learning_rate": 2.348268776643052e-05, "loss": 0.6066, "mean_token_accuracy": 0.8102474957704544, "num_tokens": 796318482.0, "step": 24951 }, { "entropy": 0.4676187774166465, "epoch": 2.2957084778120884, "grad_norm": 0.151743084192276, "learning_rate": 2.3479620940288896e-05, "loss": 0.4608, "mean_token_accuracy": 0.85307552292943, "num_tokens": 796350242.0, "step": 24952 }, { "entropy": 0.5809926623478532, "epoch": 2.2958004841835296, "grad_norm": 0.16832545399665833, "learning_rate": 2.347655411414727e-05, "loss": 0.5697, "mean_token_accuracy": 0.8227425813674927, "num_tokens": 796382681.0, "step": 24953 }, { "entropy": 0.43061370751820505, "epoch": 2.295892490554971, "grad_norm": 0.1485719382762909, "learning_rate": 2.3473487288005645e-05, "loss": 0.4075, "mean_token_accuracy": 0.8691484481096268, "num_tokens": 796414356.0, "step": 24954 }, { "entropy": 0.45010579109657556, "epoch": 2.2959844969264123, "grad_norm": 0.15489846467971802, "learning_rate": 2.3470420461864016e-05, "loss": 0.4494, "mean_token_accuracy": 0.8588790334761143, "num_tokens": 796446110.0, "step": 24955 }, { "entropy": 0.5378004387021065, "epoch": 2.2960765032978534, "grad_norm": 0.16193413734436035, "learning_rate": 2.346735363572239e-05, "loss": 0.5255, "mean_token_accuracy": 0.8337532803416252, "num_tokens": 796477989.0, "step": 24956 }, { "entropy": 0.5843570046126842, "epoch": 2.2961685096692945, "grad_norm": 0.1709117442369461, "learning_rate": 2.3464286809580765e-05, "loss": 0.5707, "mean_token_accuracy": 0.8208719603717327, "num_tokens": 796510001.0, "step": 24957 }, { "entropy": 0.5443071480840445, "epoch": 2.2962605160407357, "grad_norm": 0.164486825466156, "learning_rate": 2.346121998343914e-05, "loss": 0.5417, "mean_token_accuracy": 0.8305964656174183, "num_tokens": 796542194.0, "step": 24958 }, { "entropy": 0.4964566472917795, "epoch": 2.2963525224121772, "grad_norm": 0.15994606912136078, "learning_rate": 2.3458153157297515e-05, "loss": 0.473, "mean_token_accuracy": 0.8508971706032753, "num_tokens": 796573547.0, "step": 24959 }, { "entropy": 0.5075732180848718, "epoch": 2.2964445287836184, "grad_norm": 0.15976104140281677, "learning_rate": 2.3455086331155886e-05, "loss": 0.4971, "mean_token_accuracy": 0.8409221693873405, "num_tokens": 796604694.0, "step": 24960 }, { "entropy": 0.5177632849663496, "epoch": 2.2965365351550595, "grad_norm": 0.16863712668418884, "learning_rate": 2.345201950501426e-05, "loss": 0.5142, "mean_token_accuracy": 0.8387355506420135, "num_tokens": 796637005.0, "step": 24961 }, { "entropy": 0.5320279663428664, "epoch": 2.2966285415265006, "grad_norm": 0.16566243767738342, "learning_rate": 2.3448952678872635e-05, "loss": 0.5214, "mean_token_accuracy": 0.8319780826568604, "num_tokens": 796668393.0, "step": 24962 }, { "entropy": 0.5555369248613715, "epoch": 2.2967205478979418, "grad_norm": 0.16381089389324188, "learning_rate": 2.344588585273101e-05, "loss": 0.5474, "mean_token_accuracy": 0.8308431208133698, "num_tokens": 796700170.0, "step": 24963 }, { "entropy": 0.4244365638587624, "epoch": 2.2968125542693834, "grad_norm": 0.14799407124519348, "learning_rate": 2.344281902658938e-05, "loss": 0.406, "mean_token_accuracy": 0.8723683804273605, "num_tokens": 796732547.0, "step": 24964 }, { "entropy": 0.5403442396782339, "epoch": 2.2969045606408245, "grad_norm": 0.15996474027633667, "learning_rate": 2.3439752200447756e-05, "loss": 0.5282, "mean_token_accuracy": 0.8325475715100765, "num_tokens": 796764959.0, "step": 24965 }, { "entropy": 0.6044024098664522, "epoch": 2.2969965670122656, "grad_norm": 0.17677073180675507, "learning_rate": 2.343668537430613e-05, "loss": 0.5879, "mean_token_accuracy": 0.8146393075585365, "num_tokens": 796796208.0, "step": 24966 }, { "entropy": 0.5064306296408176, "epoch": 2.2970885733837068, "grad_norm": 0.16365602612495422, "learning_rate": 2.3433618548164505e-05, "loss": 0.5017, "mean_token_accuracy": 0.8391654267907143, "num_tokens": 796827898.0, "step": 24967 }, { "entropy": 0.4182888828217983, "epoch": 2.297180579755148, "grad_norm": 0.15554232895374298, "learning_rate": 2.343055172202288e-05, "loss": 0.3996, "mean_token_accuracy": 0.8720531463623047, "num_tokens": 796859430.0, "step": 24968 }, { "entropy": 0.5578549783676863, "epoch": 2.2972725861265895, "grad_norm": 0.1632823348045349, "learning_rate": 2.3427484895881254e-05, "loss": 0.5466, "mean_token_accuracy": 0.8269779570400715, "num_tokens": 796890613.0, "step": 24969 }, { "entropy": 0.5353901423513889, "epoch": 2.2973645924980306, "grad_norm": 0.16182173788547516, "learning_rate": 2.342441806973963e-05, "loss": 0.5101, "mean_token_accuracy": 0.8350053392350674, "num_tokens": 796922037.0, "step": 24970 }, { "entropy": 0.5821937825530767, "epoch": 2.2974565988694717, "grad_norm": 0.16786684095859528, "learning_rate": 2.3421351243598004e-05, "loss": 0.5757, "mean_token_accuracy": 0.8177402876317501, "num_tokens": 796953949.0, "step": 24971 }, { "entropy": 0.5102857337333262, "epoch": 2.297548605240913, "grad_norm": 0.1591046154499054, "learning_rate": 2.3418284417456375e-05, "loss": 0.5025, "mean_token_accuracy": 0.8408326357603073, "num_tokens": 796986484.0, "step": 24972 }, { "entropy": 0.5100459307432175, "epoch": 2.297640611612354, "grad_norm": 0.16351282596588135, "learning_rate": 2.341521759131475e-05, "loss": 0.5011, "mean_token_accuracy": 0.839546836912632, "num_tokens": 797018527.0, "step": 24973 }, { "entropy": 0.42257893295027316, "epoch": 2.2977326179837956, "grad_norm": 0.14713886380195618, "learning_rate": 2.3412150765173124e-05, "loss": 0.4082, "mean_token_accuracy": 0.8704797327518463, "num_tokens": 797051031.0, "step": 24974 }, { "entropy": 0.5161332236602902, "epoch": 2.2978246243552367, "grad_norm": 0.15928435325622559, "learning_rate": 2.34090839390315e-05, "loss": 0.5111, "mean_token_accuracy": 0.8382378555834293, "num_tokens": 797083099.0, "step": 24975 }, { "entropy": 0.5456962063908577, "epoch": 2.297916630726678, "grad_norm": 0.1701926290988922, "learning_rate": 2.3406017112889874e-05, "loss": 0.5356, "mean_token_accuracy": 0.832642700523138, "num_tokens": 797114713.0, "step": 24976 }, { "entropy": 0.5356310708448291, "epoch": 2.298008637098119, "grad_norm": 0.15978501737117767, "learning_rate": 2.3402950286748245e-05, "loss": 0.5281, "mean_token_accuracy": 0.8345286212861538, "num_tokens": 797147113.0, "step": 24977 }, { "entropy": 0.5568617582321167, "epoch": 2.29810064346956, "grad_norm": 0.16730789840221405, "learning_rate": 2.339988346060662e-05, "loss": 0.5468, "mean_token_accuracy": 0.8283652849495411, "num_tokens": 797179635.0, "step": 24978 }, { "entropy": 0.4626257074996829, "epoch": 2.2981926498410017, "grad_norm": 0.15678471326828003, "learning_rate": 2.3396816634464994e-05, "loss": 0.4489, "mean_token_accuracy": 0.8594992831349373, "num_tokens": 797211606.0, "step": 24979 }, { "entropy": 0.5477163000032306, "epoch": 2.298284656212443, "grad_norm": 0.16309750080108643, "learning_rate": 2.339374980832337e-05, "loss": 0.5378, "mean_token_accuracy": 0.8308718129992485, "num_tokens": 797243889.0, "step": 24980 }, { "entropy": 0.4642360284924507, "epoch": 2.298376662583884, "grad_norm": 0.15226751565933228, "learning_rate": 2.339068298218174e-05, "loss": 0.459, "mean_token_accuracy": 0.8540207669138908, "num_tokens": 797276149.0, "step": 24981 }, { "entropy": 0.5039901188574731, "epoch": 2.298468668955325, "grad_norm": 0.16104307770729065, "learning_rate": 2.3387616156040115e-05, "loss": 0.48, "mean_token_accuracy": 0.8484782315790653, "num_tokens": 797307789.0, "step": 24982 }, { "entropy": 0.49371496494859457, "epoch": 2.2985606753267662, "grad_norm": 0.16020765900611877, "learning_rate": 2.338454932989849e-05, "loss": 0.4805, "mean_token_accuracy": 0.8454725258052349, "num_tokens": 797339825.0, "step": 24983 }, { "entropy": 0.64998834207654, "epoch": 2.298652681698208, "grad_norm": 0.17353829741477966, "learning_rate": 2.3381482503756864e-05, "loss": 0.6399, "mean_token_accuracy": 0.799845028668642, "num_tokens": 797372401.0, "step": 24984 }, { "entropy": 0.5478743710555136, "epoch": 2.298744688069649, "grad_norm": 0.1593879759311676, "learning_rate": 2.3378415677615235e-05, "loss": 0.5368, "mean_token_accuracy": 0.8294363804161549, "num_tokens": 797405154.0, "step": 24985 }, { "entropy": 0.48827136820182204, "epoch": 2.29883669444109, "grad_norm": 0.15786112844944, "learning_rate": 2.337534885147361e-05, "loss": 0.469, "mean_token_accuracy": 0.8495898805558681, "num_tokens": 797437198.0, "step": 24986 }, { "entropy": 0.526643147226423, "epoch": 2.298928700812531, "grad_norm": 0.15669922530651093, "learning_rate": 2.3372282025331985e-05, "loss": 0.5006, "mean_token_accuracy": 0.8411644622683525, "num_tokens": 797469172.0, "step": 24987 }, { "entropy": 0.5383353736251593, "epoch": 2.2990207071839723, "grad_norm": 0.1556607037782669, "learning_rate": 2.336921519919036e-05, "loss": 0.5188, "mean_token_accuracy": 0.835374653339386, "num_tokens": 797501464.0, "step": 24988 }, { "entropy": 0.4339510863646865, "epoch": 2.299112713555414, "grad_norm": 0.14784646034240723, "learning_rate": 2.3366148373048734e-05, "loss": 0.4092, "mean_token_accuracy": 0.8681871369481087, "num_tokens": 797533839.0, "step": 24989 }, { "entropy": 0.6817240286618471, "epoch": 2.299204719926855, "grad_norm": 0.17683304846286774, "learning_rate": 2.3363081546907105e-05, "loss": 0.6697, "mean_token_accuracy": 0.7923115715384483, "num_tokens": 797565619.0, "step": 24990 }, { "entropy": 0.4101019313093275, "epoch": 2.299296726298296, "grad_norm": 0.14064453542232513, "learning_rate": 2.336001472076548e-05, "loss": 0.3996, "mean_token_accuracy": 0.871000237762928, "num_tokens": 797598387.0, "step": 24991 }, { "entropy": 0.46188132790848613, "epoch": 2.2993887326697373, "grad_norm": 0.15440036356449127, "learning_rate": 2.3356947894623854e-05, "loss": 0.4476, "mean_token_accuracy": 0.8589780777692795, "num_tokens": 797630488.0, "step": 24992 }, { "entropy": 0.4993925429880619, "epoch": 2.2994807390411784, "grad_norm": 0.16107048094272614, "learning_rate": 2.335388106848223e-05, "loss": 0.4883, "mean_token_accuracy": 0.8412846252322197, "num_tokens": 797661848.0, "step": 24993 }, { "entropy": 0.4820429487153888, "epoch": 2.29957274541262, "grad_norm": 0.15712673962116241, "learning_rate": 2.33508142423406e-05, "loss": 0.4747, "mean_token_accuracy": 0.8500072360038757, "num_tokens": 797693687.0, "step": 24994 }, { "entropy": 0.5412921579554677, "epoch": 2.299664751784061, "grad_norm": 0.16397319734096527, "learning_rate": 2.3347747416198975e-05, "loss": 0.5158, "mean_token_accuracy": 0.8360274732112885, "num_tokens": 797724889.0, "step": 24995 }, { "entropy": 0.5370602821931243, "epoch": 2.2997567581555023, "grad_norm": 0.16405412554740906, "learning_rate": 2.334468059005735e-05, "loss": 0.5225, "mean_token_accuracy": 0.8342984840273857, "num_tokens": 797756949.0, "step": 24996 }, { "entropy": 0.48127812519669533, "epoch": 2.2998487645269434, "grad_norm": 0.1565246731042862, "learning_rate": 2.3341613763915724e-05, "loss": 0.4744, "mean_token_accuracy": 0.84727793186903, "num_tokens": 797788854.0, "step": 24997 }, { "entropy": 0.37910995120182633, "epoch": 2.2999407708983846, "grad_norm": 0.1454056054353714, "learning_rate": 2.33385469377741e-05, "loss": 0.3646, "mean_token_accuracy": 0.8825919143855572, "num_tokens": 797820997.0, "step": 24998 }, { "entropy": 0.5743078459054232, "epoch": 2.300032777269826, "grad_norm": 0.16802534461021423, "learning_rate": 2.3335480111632474e-05, "loss": 0.5713, "mean_token_accuracy": 0.818975817412138, "num_tokens": 797852997.0, "step": 24999 }, { "entropy": 0.4522051736712456, "epoch": 2.3001247836412673, "grad_norm": 0.16167418658733368, "learning_rate": 2.3332413285490848e-05, "loss": 0.4472, "mean_token_accuracy": 0.8544017411768436, "num_tokens": 797883455.0, "step": 25000 }, { "entropy": 0.573704537935555, "epoch": 2.3002167900127084, "grad_norm": 0.16598133742809296, "learning_rate": 2.3329346459349223e-05, "loss": 0.5644, "mean_token_accuracy": 0.8259575963020325, "num_tokens": 797916019.0, "step": 25001 }, { "entropy": 0.542986296582967, "epoch": 2.3003087963841495, "grad_norm": 0.16387507319450378, "learning_rate": 2.3326279633207594e-05, "loss": 0.5336, "mean_token_accuracy": 0.8310545831918716, "num_tokens": 797947764.0, "step": 25002 }, { "entropy": 0.556487925350666, "epoch": 2.3004008027555907, "grad_norm": 0.1666967272758484, "learning_rate": 2.332321280706597e-05, "loss": 0.5461, "mean_token_accuracy": 0.8257996551692486, "num_tokens": 797979338.0, "step": 25003 }, { "entropy": 0.5515676881186664, "epoch": 2.3004928091270322, "grad_norm": 0.16238993406295776, "learning_rate": 2.3320145980924343e-05, "loss": 0.5459, "mean_token_accuracy": 0.8281550630927086, "num_tokens": 798011626.0, "step": 25004 }, { "entropy": 0.510784930549562, "epoch": 2.3005848154984734, "grad_norm": 0.16472209990024567, "learning_rate": 2.3317079154782718e-05, "loss": 0.4881, "mean_token_accuracy": 0.845031201839447, "num_tokens": 798043174.0, "step": 25005 }, { "entropy": 0.4637219519354403, "epoch": 2.3006768218699145, "grad_norm": 0.1510649174451828, "learning_rate": 2.3314012328641093e-05, "loss": 0.4487, "mean_token_accuracy": 0.8568424805998802, "num_tokens": 798075139.0, "step": 25006 }, { "entropy": 0.5221775269601494, "epoch": 2.3007688282413556, "grad_norm": 0.1573042869567871, "learning_rate": 2.3310945502499464e-05, "loss": 0.4982, "mean_token_accuracy": 0.8408615477383137, "num_tokens": 798107194.0, "step": 25007 }, { "entropy": 0.49664491415023804, "epoch": 2.300860834612797, "grad_norm": 0.15647441148757935, "learning_rate": 2.330787867635784e-05, "loss": 0.4791, "mean_token_accuracy": 0.8485538363456726, "num_tokens": 798139077.0, "step": 25008 }, { "entropy": 0.5277047120034695, "epoch": 2.3009528409842384, "grad_norm": 0.1637730747461319, "learning_rate": 2.3304811850216213e-05, "loss": 0.5145, "mean_token_accuracy": 0.8366292156279087, "num_tokens": 798170849.0, "step": 25009 }, { "entropy": 0.5406338348984718, "epoch": 2.3010448473556795, "grad_norm": 0.1575423926115036, "learning_rate": 2.3301745024074588e-05, "loss": 0.5267, "mean_token_accuracy": 0.835480272769928, "num_tokens": 798203307.0, "step": 25010 }, { "entropy": 0.5491605685092509, "epoch": 2.3011368537271206, "grad_norm": 0.1648874282836914, "learning_rate": 2.329867819793296e-05, "loss": 0.5376, "mean_token_accuracy": 0.8299431502819061, "num_tokens": 798235226.0, "step": 25011 }, { "entropy": 0.3882574064191431, "epoch": 2.3012288600985618, "grad_norm": 0.13931074738502502, "learning_rate": 2.3295611371791334e-05, "loss": 0.3831, "mean_token_accuracy": 0.8780979625880718, "num_tokens": 798267293.0, "step": 25012 }, { "entropy": 0.6018684739246964, "epoch": 2.301320866470003, "grad_norm": 0.170615553855896, "learning_rate": 2.329254454564971e-05, "loss": 0.5894, "mean_token_accuracy": 0.8134896121919155, "num_tokens": 798299409.0, "step": 25013 }, { "entropy": 0.5268351300619543, "epoch": 2.3014128728414445, "grad_norm": 0.16312454640865326, "learning_rate": 2.3289477719508083e-05, "loss": 0.5087, "mean_token_accuracy": 0.8358889706432819, "num_tokens": 798330317.0, "step": 25014 }, { "entropy": 0.4698348673991859, "epoch": 2.3015048792128856, "grad_norm": 0.1551775187253952, "learning_rate": 2.3286410893366454e-05, "loss": 0.4492, "mean_token_accuracy": 0.8586615100502968, "num_tokens": 798362371.0, "step": 25015 }, { "entropy": 0.47187452763319016, "epoch": 2.3015968855843267, "grad_norm": 0.15277709066867828, "learning_rate": 2.328334406722483e-05, "loss": 0.4486, "mean_token_accuracy": 0.8553233034908772, "num_tokens": 798394464.0, "step": 25016 }, { "entropy": 0.542584921233356, "epoch": 2.301688891955768, "grad_norm": 0.15943118929862976, "learning_rate": 2.3280277241083204e-05, "loss": 0.535, "mean_token_accuracy": 0.8331965543329716, "num_tokens": 798427171.0, "step": 25017 }, { "entropy": 0.5363751072436571, "epoch": 2.301780898327209, "grad_norm": 0.1622680276632309, "learning_rate": 2.3277210414941578e-05, "loss": 0.5281, "mean_token_accuracy": 0.8321875743567944, "num_tokens": 798459592.0, "step": 25018 }, { "entropy": 0.5356817087158561, "epoch": 2.3018729046986506, "grad_norm": 0.16223862767219543, "learning_rate": 2.3274143588799953e-05, "loss": 0.5249, "mean_token_accuracy": 0.8331377319991589, "num_tokens": 798491487.0, "step": 25019 }, { "entropy": 0.4157937918789685, "epoch": 2.3019649110700917, "grad_norm": 0.14884300529956818, "learning_rate": 2.3271076762658324e-05, "loss": 0.4043, "mean_token_accuracy": 0.8698815256357193, "num_tokens": 798523815.0, "step": 25020 }, { "entropy": 0.5230802316218615, "epoch": 2.302056917441533, "grad_norm": 0.1626794934272766, "learning_rate": 2.32680099365167e-05, "loss": 0.5255, "mean_token_accuracy": 0.8320540115237236, "num_tokens": 798556279.0, "step": 25021 }, { "entropy": 0.5540210418403149, "epoch": 2.302148923812974, "grad_norm": 0.16076040267944336, "learning_rate": 2.3264943110375074e-05, "loss": 0.5412, "mean_token_accuracy": 0.8270393945276737, "num_tokens": 798588948.0, "step": 25022 }, { "entropy": 0.5801950562745333, "epoch": 2.302240930184415, "grad_norm": 0.17590190470218658, "learning_rate": 2.3261876284233448e-05, "loss": 0.5859, "mean_token_accuracy": 0.8155939243733883, "num_tokens": 798620152.0, "step": 25023 }, { "entropy": 0.4727565599605441, "epoch": 2.3023329365558567, "grad_norm": 0.1548701822757721, "learning_rate": 2.325880945809182e-05, "loss": 0.4713, "mean_token_accuracy": 0.8519293144345284, "num_tokens": 798652754.0, "step": 25024 }, { "entropy": 0.559745317324996, "epoch": 2.302424942927298, "grad_norm": 0.16608642041683197, "learning_rate": 2.3255742631950194e-05, "loss": 0.5542, "mean_token_accuracy": 0.8266131542623043, "num_tokens": 798684257.0, "step": 25025 }, { "entropy": 0.47721599601209164, "epoch": 2.302516949298739, "grad_norm": 0.16395002603530884, "learning_rate": 2.325267580580857e-05, "loss": 0.4583, "mean_token_accuracy": 0.8517101593315601, "num_tokens": 798715523.0, "step": 25026 }, { "entropy": 0.5234392583370209, "epoch": 2.30260895567018, "grad_norm": 0.16691024601459503, "learning_rate": 2.3249608979666943e-05, "loss": 0.5067, "mean_token_accuracy": 0.8377096019685268, "num_tokens": 798746647.0, "step": 25027 }, { "entropy": 0.5228827223181725, "epoch": 2.3027009620416212, "grad_norm": 0.15966582298278809, "learning_rate": 2.3246542153525318e-05, "loss": 0.5164, "mean_token_accuracy": 0.8381769210100174, "num_tokens": 798778919.0, "step": 25028 }, { "entropy": 0.4710886203683913, "epoch": 2.302792968413063, "grad_norm": 0.15883924067020416, "learning_rate": 2.3243475327383693e-05, "loss": 0.4587, "mean_token_accuracy": 0.8528469391167164, "num_tokens": 798810842.0, "step": 25029 }, { "entropy": 0.600239546969533, "epoch": 2.302884974784504, "grad_norm": 0.17189782857894897, "learning_rate": 2.3240408501242067e-05, "loss": 0.6006, "mean_token_accuracy": 0.8126062527298927, "num_tokens": 798842369.0, "step": 25030 }, { "entropy": 0.45430911239236593, "epoch": 2.302976981155945, "grad_norm": 0.15923839807510376, "learning_rate": 2.3237341675100442e-05, "loss": 0.4292, "mean_token_accuracy": 0.8643707111477852, "num_tokens": 798873758.0, "step": 25031 }, { "entropy": 0.5584908965975046, "epoch": 2.303068987527386, "grad_norm": 0.16649048030376434, "learning_rate": 2.3234274848958813e-05, "loss": 0.5507, "mean_token_accuracy": 0.8284660913050175, "num_tokens": 798906049.0, "step": 25032 }, { "entropy": 0.5353819448500872, "epoch": 2.3031609938988273, "grad_norm": 0.16170541942119598, "learning_rate": 2.3231208022817188e-05, "loss": 0.522, "mean_token_accuracy": 0.8380618430674076, "num_tokens": 798938043.0, "step": 25033 }, { "entropy": 0.5141765307635069, "epoch": 2.303253000270269, "grad_norm": 0.16010402143001556, "learning_rate": 2.3228141196675563e-05, "loss": 0.4935, "mean_token_accuracy": 0.8468645997345448, "num_tokens": 798969508.0, "step": 25034 }, { "entropy": 0.5798582714051008, "epoch": 2.30334500664171, "grad_norm": 0.16393455862998962, "learning_rate": 2.3225074370533937e-05, "loss": 0.5652, "mean_token_accuracy": 0.8227803371846676, "num_tokens": 799001783.0, "step": 25035 }, { "entropy": 0.6525840489193797, "epoch": 2.303437013013151, "grad_norm": 0.1774030476808548, "learning_rate": 2.3222007544392312e-05, "loss": 0.6416, "mean_token_accuracy": 0.7973799519240856, "num_tokens": 799033408.0, "step": 25036 }, { "entropy": 0.5309966504573822, "epoch": 2.3035290193845923, "grad_norm": 0.1660016030073166, "learning_rate": 2.3218940718250683e-05, "loss": 0.5161, "mean_token_accuracy": 0.8362983539700508, "num_tokens": 799064881.0, "step": 25037 }, { "entropy": 0.4831692557781935, "epoch": 2.3036210257560334, "grad_norm": 0.1569977104663849, "learning_rate": 2.3215873892109058e-05, "loss": 0.4674, "mean_token_accuracy": 0.8479186743497849, "num_tokens": 799096483.0, "step": 25038 }, { "entropy": 0.543929498642683, "epoch": 2.303713032127475, "grad_norm": 0.16292299330234528, "learning_rate": 2.3212807065967432e-05, "loss": 0.5325, "mean_token_accuracy": 0.8310500755906105, "num_tokens": 799128419.0, "step": 25039 }, { "entropy": 0.45007783733308315, "epoch": 2.303805038498916, "grad_norm": 0.14647245407104492, "learning_rate": 2.3209740239825807e-05, "loss": 0.4286, "mean_token_accuracy": 0.8597122579813004, "num_tokens": 799160147.0, "step": 25040 }, { "entropy": 0.387152933049947, "epoch": 2.3038970448703573, "grad_norm": 0.14576949179172516, "learning_rate": 2.3206673413684178e-05, "loss": 0.3745, "mean_token_accuracy": 0.877670418471098, "num_tokens": 799191831.0, "step": 25041 }, { "entropy": 0.4603413389995694, "epoch": 2.3039890512417984, "grad_norm": 0.15220105648040771, "learning_rate": 2.3203606587542553e-05, "loss": 0.4576, "mean_token_accuracy": 0.857893168926239, "num_tokens": 799224175.0, "step": 25042 }, { "entropy": 0.5522324643097818, "epoch": 2.3040810576132396, "grad_norm": 0.1619063764810562, "learning_rate": 2.3200539761400928e-05, "loss": 0.5338, "mean_token_accuracy": 0.8350371718406677, "num_tokens": 799255964.0, "step": 25043 }, { "entropy": 0.5455350838601589, "epoch": 2.304173063984681, "grad_norm": 0.1603131890296936, "learning_rate": 2.3197472935259302e-05, "loss": 0.5345, "mean_token_accuracy": 0.8343108855187893, "num_tokens": 799288578.0, "step": 25044 }, { "entropy": 0.37316273991018534, "epoch": 2.3042650703561223, "grad_norm": 0.1393585205078125, "learning_rate": 2.3194406109117673e-05, "loss": 0.3603, "mean_token_accuracy": 0.883416473865509, "num_tokens": 799320758.0, "step": 25045 }, { "entropy": 0.5099205302540213, "epoch": 2.3043570767275634, "grad_norm": 0.15679709613323212, "learning_rate": 2.3191339282976048e-05, "loss": 0.4958, "mean_token_accuracy": 0.8415416143834591, "num_tokens": 799352318.0, "step": 25046 }, { "entropy": 0.5192297101020813, "epoch": 2.3044490830990045, "grad_norm": 0.1596827656030655, "learning_rate": 2.3188272456834423e-05, "loss": 0.5166, "mean_token_accuracy": 0.8366102576255798, "num_tokens": 799384920.0, "step": 25047 }, { "entropy": 0.5520058549009264, "epoch": 2.3045410894704457, "grad_norm": 0.15722572803497314, "learning_rate": 2.3185205630692797e-05, "loss": 0.5373, "mean_token_accuracy": 0.8331661336123943, "num_tokens": 799417505.0, "step": 25048 }, { "entropy": 0.5144195463508368, "epoch": 2.3046330958418872, "grad_norm": 0.15668156743049622, "learning_rate": 2.3182138804551172e-05, "loss": 0.4997, "mean_token_accuracy": 0.8419928625226021, "num_tokens": 799449747.0, "step": 25049 }, { "entropy": 0.5897178892046213, "epoch": 2.3047251022133284, "grad_norm": 0.1691664755344391, "learning_rate": 2.3179071978409543e-05, "loss": 0.5822, "mean_token_accuracy": 0.8187034912407398, "num_tokens": 799481460.0, "step": 25050 }, { "entropy": 0.5493861918803304, "epoch": 2.3048171085847695, "grad_norm": 0.1646900773048401, "learning_rate": 2.3176005152267918e-05, "loss": 0.5392, "mean_token_accuracy": 0.8321338444948196, "num_tokens": 799513740.0, "step": 25051 }, { "entropy": 0.5462896656244993, "epoch": 2.3049091149562106, "grad_norm": 0.1628929078578949, "learning_rate": 2.3172938326126293e-05, "loss": 0.5379, "mean_token_accuracy": 0.827936127781868, "num_tokens": 799546246.0, "step": 25052 }, { "entropy": 0.5287166219204664, "epoch": 2.305001121327652, "grad_norm": 0.16077464818954468, "learning_rate": 2.3169871499984667e-05, "loss": 0.5092, "mean_token_accuracy": 0.8366714529693127, "num_tokens": 799577385.0, "step": 25053 }, { "entropy": 0.5033347178250551, "epoch": 2.3050931276990934, "grad_norm": 0.15845108032226562, "learning_rate": 2.316680467384304e-05, "loss": 0.4924, "mean_token_accuracy": 0.8442805707454681, "num_tokens": 799609878.0, "step": 25054 }, { "entropy": 0.5419230042025447, "epoch": 2.3051851340705345, "grad_norm": 0.16616208851337433, "learning_rate": 2.3163737847701413e-05, "loss": 0.5287, "mean_token_accuracy": 0.8347177654504776, "num_tokens": 799641214.0, "step": 25055 }, { "entropy": 0.5240773819386959, "epoch": 2.3052771404419756, "grad_norm": 0.16346341371536255, "learning_rate": 2.3160671021559788e-05, "loss": 0.5037, "mean_token_accuracy": 0.837718065828085, "num_tokens": 799672945.0, "step": 25056 }, { "entropy": 0.5986852869391441, "epoch": 2.3053691468134168, "grad_norm": 0.181003138422966, "learning_rate": 2.3157604195418162e-05, "loss": 0.589, "mean_token_accuracy": 0.8176357969641685, "num_tokens": 799703430.0, "step": 25057 }, { "entropy": 0.5232339166104794, "epoch": 2.305461153184858, "grad_norm": 0.16287831962108612, "learning_rate": 2.3154537369276537e-05, "loss": 0.5057, "mean_token_accuracy": 0.838965866714716, "num_tokens": 799734722.0, "step": 25058 }, { "entropy": 0.4712341530248523, "epoch": 2.3055531595562995, "grad_norm": 0.161799818277359, "learning_rate": 2.3151470543134912e-05, "loss": 0.4533, "mean_token_accuracy": 0.8530858419835567, "num_tokens": 799765759.0, "step": 25059 }, { "entropy": 0.4813461899757385, "epoch": 2.3056451659277406, "grad_norm": 0.15115392208099365, "learning_rate": 2.3148403716993286e-05, "loss": 0.4678, "mean_token_accuracy": 0.8520457074046135, "num_tokens": 799798162.0, "step": 25060 }, { "entropy": 0.5240558022633195, "epoch": 2.3057371722991817, "grad_norm": 0.15972061455249786, "learning_rate": 2.314533689085166e-05, "loss": 0.5174, "mean_token_accuracy": 0.8384142406284809, "num_tokens": 799829834.0, "step": 25061 }, { "entropy": 0.5789448907598853, "epoch": 2.305829178670623, "grad_norm": 0.16523559391498566, "learning_rate": 2.3142270064710032e-05, "loss": 0.5721, "mean_token_accuracy": 0.8228581845760345, "num_tokens": 799861815.0, "step": 25062 }, { "entropy": 0.5336922565475106, "epoch": 2.305921185042064, "grad_norm": 0.16176500916481018, "learning_rate": 2.3139203238568407e-05, "loss": 0.5191, "mean_token_accuracy": 0.8370240330696106, "num_tokens": 799893604.0, "step": 25063 }, { "entropy": 0.5950111523270607, "epoch": 2.3060131914135056, "grad_norm": 0.16951261460781097, "learning_rate": 2.313613641242678e-05, "loss": 0.5812, "mean_token_accuracy": 0.8161422237753868, "num_tokens": 799925663.0, "step": 25064 }, { "entropy": 0.4868598263710737, "epoch": 2.3061051977849467, "grad_norm": 0.15983861684799194, "learning_rate": 2.3133069586285156e-05, "loss": 0.474, "mean_token_accuracy": 0.8496010638773441, "num_tokens": 799956959.0, "step": 25065 }, { "entropy": 0.5109472097828984, "epoch": 2.306197204156388, "grad_norm": 0.16228094696998596, "learning_rate": 2.313000276014353e-05, "loss": 0.5098, "mean_token_accuracy": 0.8389973305165768, "num_tokens": 799988907.0, "step": 25066 }, { "entropy": 0.579601775854826, "epoch": 2.306289210527829, "grad_norm": 0.17023198306560516, "learning_rate": 2.3126935934001902e-05, "loss": 0.5702, "mean_token_accuracy": 0.8230413384735584, "num_tokens": 800020298.0, "step": 25067 }, { "entropy": 0.4476083414629102, "epoch": 2.30638121689927, "grad_norm": 0.1545162945985794, "learning_rate": 2.3123869107860277e-05, "loss": 0.4352, "mean_token_accuracy": 0.8632548376917839, "num_tokens": 800052260.0, "step": 25068 }, { "entropy": 0.44923875480890274, "epoch": 2.3064732232707117, "grad_norm": 0.1523221880197525, "learning_rate": 2.312080228171865e-05, "loss": 0.4321, "mean_token_accuracy": 0.8623043410480022, "num_tokens": 800084019.0, "step": 25069 }, { "entropy": 0.5078659197315574, "epoch": 2.306565229642153, "grad_norm": 0.16141262650489807, "learning_rate": 2.3117735455577026e-05, "loss": 0.5129, "mean_token_accuracy": 0.8392600379884243, "num_tokens": 800115153.0, "step": 25070 }, { "entropy": 0.573445507325232, "epoch": 2.306657236013594, "grad_norm": 0.16501395404338837, "learning_rate": 2.3114668629435397e-05, "loss": 0.5594, "mean_token_accuracy": 0.8241289518773556, "num_tokens": 800147833.0, "step": 25071 }, { "entropy": 0.4892126675695181, "epoch": 2.306749242385035, "grad_norm": 0.15432143211364746, "learning_rate": 2.3111601803293772e-05, "loss": 0.4603, "mean_token_accuracy": 0.8525551110506058, "num_tokens": 800179859.0, "step": 25072 }, { "entropy": 0.5024746144190431, "epoch": 2.3068412487564762, "grad_norm": 0.1525515913963318, "learning_rate": 2.3108534977152147e-05, "loss": 0.4902, "mean_token_accuracy": 0.8433887846767902, "num_tokens": 800212259.0, "step": 25073 }, { "entropy": 0.5817473966162652, "epoch": 2.306933255127918, "grad_norm": 0.1677529215812683, "learning_rate": 2.310546815101052e-05, "loss": 0.5732, "mean_token_accuracy": 0.8226475566625595, "num_tokens": 800244247.0, "step": 25074 }, { "entropy": 0.5047985324636102, "epoch": 2.307025261499359, "grad_norm": 0.16188642382621765, "learning_rate": 2.3102401324868893e-05, "loss": 0.4948, "mean_token_accuracy": 0.8449255600571632, "num_tokens": 800276872.0, "step": 25075 }, { "entropy": 0.4642277415841818, "epoch": 2.3071172678708, "grad_norm": 0.15810075402259827, "learning_rate": 2.3099334498727267e-05, "loss": 0.4519, "mean_token_accuracy": 0.8553129583597183, "num_tokens": 800309001.0, "step": 25076 }, { "entropy": 0.5177392568439245, "epoch": 2.307209274242241, "grad_norm": 0.1612432599067688, "learning_rate": 2.3096267672585642e-05, "loss": 0.5031, "mean_token_accuracy": 0.8415494300425053, "num_tokens": 800340835.0, "step": 25077 }, { "entropy": 0.587585206143558, "epoch": 2.3073012806136823, "grad_norm": 0.16672943532466888, "learning_rate": 2.3093200846444017e-05, "loss": 0.5692, "mean_token_accuracy": 0.8212103135883808, "num_tokens": 800372630.0, "step": 25078 }, { "entropy": 0.5232138806022704, "epoch": 2.307393286985124, "grad_norm": 0.16347703337669373, "learning_rate": 2.309013402030239e-05, "loss": 0.4969, "mean_token_accuracy": 0.8420384041965008, "num_tokens": 800403015.0, "step": 25079 }, { "entropy": 0.5059494571760297, "epoch": 2.307485293356565, "grad_norm": 0.15956419706344604, "learning_rate": 2.3087067194160762e-05, "loss": 0.4844, "mean_token_accuracy": 0.8477950878441334, "num_tokens": 800435129.0, "step": 25080 }, { "entropy": 0.508128747344017, "epoch": 2.307577299728006, "grad_norm": 0.15494941174983978, "learning_rate": 2.3084000368019137e-05, "loss": 0.4852, "mean_token_accuracy": 0.8470318280160427, "num_tokens": 800467327.0, "step": 25081 }, { "entropy": 0.5307963148225099, "epoch": 2.3076693060994473, "grad_norm": 0.1641799807548523, "learning_rate": 2.3080933541877512e-05, "loss": 0.5222, "mean_token_accuracy": 0.8385047502815723, "num_tokens": 800500029.0, "step": 25082 }, { "entropy": 0.5780248083174229, "epoch": 2.3077613124708884, "grad_norm": 0.17292927205562592, "learning_rate": 2.3077866715735886e-05, "loss": 0.5761, "mean_token_accuracy": 0.818902276456356, "num_tokens": 800531696.0, "step": 25083 }, { "entropy": 0.5908965896815062, "epoch": 2.30785331884233, "grad_norm": 0.16733981668949127, "learning_rate": 2.3074799889594258e-05, "loss": 0.5864, "mean_token_accuracy": 0.819146353751421, "num_tokens": 800564307.0, "step": 25084 }, { "entropy": 0.5115935318171978, "epoch": 2.307945325213771, "grad_norm": 0.1645452231168747, "learning_rate": 2.3071733063452632e-05, "loss": 0.5111, "mean_token_accuracy": 0.8378673121333122, "num_tokens": 800596455.0, "step": 25085 }, { "entropy": 0.5613667014986277, "epoch": 2.3080373315852123, "grad_norm": 0.16661587357521057, "learning_rate": 2.3068666237311007e-05, "loss": 0.5434, "mean_token_accuracy": 0.8261423707008362, "num_tokens": 800627911.0, "step": 25086 }, { "entropy": 0.4991748573957011, "epoch": 2.3081293379566534, "grad_norm": 0.15190881490707397, "learning_rate": 2.306559941116938e-05, "loss": 0.4841, "mean_token_accuracy": 0.8465716391801834, "num_tokens": 800660619.0, "step": 25087 }, { "entropy": 0.5211432576179504, "epoch": 2.3082213443280946, "grad_norm": 0.15366488695144653, "learning_rate": 2.3062532585027756e-05, "loss": 0.4984, "mean_token_accuracy": 0.842158630490303, "num_tokens": 800692873.0, "step": 25088 }, { "entropy": 0.5556977866217494, "epoch": 2.308313350699536, "grad_norm": 0.16464035212993622, "learning_rate": 2.3059465758886127e-05, "loss": 0.546, "mean_token_accuracy": 0.8315174728631973, "num_tokens": 800725033.0, "step": 25089 }, { "entropy": 0.5368934394791722, "epoch": 2.3084053570709773, "grad_norm": 0.17196635901927948, "learning_rate": 2.3056398932744505e-05, "loss": 0.5108, "mean_token_accuracy": 0.8340272195637226, "num_tokens": 800755925.0, "step": 25090 }, { "entropy": 0.487304525449872, "epoch": 2.3084973634424184, "grad_norm": 0.15760914981365204, "learning_rate": 2.305333210660288e-05, "loss": 0.4726, "mean_token_accuracy": 0.8506973460316658, "num_tokens": 800788062.0, "step": 25091 }, { "entropy": 0.4125743641052395, "epoch": 2.3085893698138595, "grad_norm": 0.15316878259181976, "learning_rate": 2.305026528046125e-05, "loss": 0.4069, "mean_token_accuracy": 0.8708319216966629, "num_tokens": 800820008.0, "step": 25092 }, { "entropy": 0.5863271867856383, "epoch": 2.3086813761853007, "grad_norm": 0.17088709771633148, "learning_rate": 2.3047198454319626e-05, "loss": 0.58, "mean_token_accuracy": 0.8173819109797478, "num_tokens": 800851608.0, "step": 25093 }, { "entropy": 0.5544433481991291, "epoch": 2.3087733825567422, "grad_norm": 0.1634879857301712, "learning_rate": 2.3044131628178e-05, "loss": 0.5451, "mean_token_accuracy": 0.8315256498754025, "num_tokens": 800883184.0, "step": 25094 }, { "entropy": 0.5332716917619109, "epoch": 2.3088653889281834, "grad_norm": 0.16836494207382202, "learning_rate": 2.3041064802036375e-05, "loss": 0.518, "mean_token_accuracy": 0.8355391174554825, "num_tokens": 800915060.0, "step": 25095 }, { "entropy": 0.42099947039969265, "epoch": 2.3089573952996245, "grad_norm": 0.15256524085998535, "learning_rate": 2.303799797589475e-05, "loss": 0.4178, "mean_token_accuracy": 0.8670454695820808, "num_tokens": 800947423.0, "step": 25096 }, { "entropy": 0.560181487351656, "epoch": 2.3090494016710656, "grad_norm": 0.16556091606616974, "learning_rate": 2.303493114975312e-05, "loss": 0.5477, "mean_token_accuracy": 0.82674690335989, "num_tokens": 800978251.0, "step": 25097 }, { "entropy": 0.592619638890028, "epoch": 2.309141408042507, "grad_norm": 0.16346384584903717, "learning_rate": 2.3031864323611496e-05, "loss": 0.5796, "mean_token_accuracy": 0.8168842270970345, "num_tokens": 801010785.0, "step": 25098 }, { "entropy": 0.5172713659703732, "epoch": 2.3092334144139484, "grad_norm": 0.16130173206329346, "learning_rate": 2.302879749746987e-05, "loss": 0.4954, "mean_token_accuracy": 0.8435904085636139, "num_tokens": 801042731.0, "step": 25099 }, { "entropy": 0.5633503054268658, "epoch": 2.3093254207853895, "grad_norm": 0.16621722280979156, "learning_rate": 2.3025730671328245e-05, "loss": 0.5537, "mean_token_accuracy": 0.8241169229149818, "num_tokens": 801075496.0, "step": 25100 }, { "entropy": 0.38763618003576994, "epoch": 2.3094174271568306, "grad_norm": 0.1506165713071823, "learning_rate": 2.3022663845186616e-05, "loss": 0.3681, "mean_token_accuracy": 0.8817378431558609, "num_tokens": 801106738.0, "step": 25101 }, { "entropy": 0.4778105393052101, "epoch": 2.3095094335282718, "grad_norm": 0.15745659172534943, "learning_rate": 2.301959701904499e-05, "loss": 0.4673, "mean_token_accuracy": 0.8532241769134998, "num_tokens": 801138297.0, "step": 25102 }, { "entropy": 0.5135765101294965, "epoch": 2.309601439899713, "grad_norm": 0.15642371773719788, "learning_rate": 2.3016530192903366e-05, "loss": 0.5046, "mean_token_accuracy": 0.8423734568059444, "num_tokens": 801170430.0, "step": 25103 }, { "entropy": 0.5253404015675187, "epoch": 2.3096934462711545, "grad_norm": 0.1604124754667282, "learning_rate": 2.301346336676174e-05, "loss": 0.5162, "mean_token_accuracy": 0.8347527533769608, "num_tokens": 801202246.0, "step": 25104 }, { "entropy": 0.5203108263667673, "epoch": 2.3097854526425956, "grad_norm": 0.165006622672081, "learning_rate": 2.301039654062011e-05, "loss": 0.5128, "mean_token_accuracy": 0.8386775590479374, "num_tokens": 801234595.0, "step": 25105 }, { "entropy": 0.5568141918629408, "epoch": 2.3098774590140367, "grad_norm": 0.1689203828573227, "learning_rate": 2.3007329714478486e-05, "loss": 0.5585, "mean_token_accuracy": 0.8231970071792603, "num_tokens": 801267070.0, "step": 25106 }, { "entropy": 0.5561237297952175, "epoch": 2.309969465385478, "grad_norm": 0.16523069143295288, "learning_rate": 2.300426288833686e-05, "loss": 0.5443, "mean_token_accuracy": 0.8281629048287868, "num_tokens": 801298704.0, "step": 25107 }, { "entropy": 0.5211903001181781, "epoch": 2.310061471756919, "grad_norm": 0.16045738756656647, "learning_rate": 2.3001196062195236e-05, "loss": 0.5136, "mean_token_accuracy": 0.8400757722556591, "num_tokens": 801330956.0, "step": 25108 }, { "entropy": 0.5183837926015258, "epoch": 2.3101534781283606, "grad_norm": 0.16051141917705536, "learning_rate": 2.299812923605361e-05, "loss": 0.507, "mean_token_accuracy": 0.8391328193247318, "num_tokens": 801362088.0, "step": 25109 }, { "entropy": 0.6264244932681322, "epoch": 2.3102454844998017, "grad_norm": 0.17164823412895203, "learning_rate": 2.299506240991198e-05, "loss": 0.6106, "mean_token_accuracy": 0.8078250661492348, "num_tokens": 801394228.0, "step": 25110 }, { "entropy": 0.47894513607025146, "epoch": 2.310337490871243, "grad_norm": 0.15480270981788635, "learning_rate": 2.2991995583770356e-05, "loss": 0.477, "mean_token_accuracy": 0.8480948358774185, "num_tokens": 801426931.0, "step": 25111 }, { "entropy": 0.5370767810381949, "epoch": 2.310429497242684, "grad_norm": 0.16356615722179413, "learning_rate": 2.298892875762873e-05, "loss": 0.5267, "mean_token_accuracy": 0.836113266646862, "num_tokens": 801458767.0, "step": 25112 }, { "entropy": 0.521291671320796, "epoch": 2.310521503614125, "grad_norm": 0.16527247428894043, "learning_rate": 2.2985861931487105e-05, "loss": 0.5113, "mean_token_accuracy": 0.8367268815636635, "num_tokens": 801489833.0, "step": 25113 }, { "entropy": 0.5205995147116482, "epoch": 2.3106135099855667, "grad_norm": 0.16198702156543732, "learning_rate": 2.2982795105345477e-05, "loss": 0.5053, "mean_token_accuracy": 0.839653629809618, "num_tokens": 801521860.0, "step": 25114 }, { "entropy": 0.603307643905282, "epoch": 2.310705516357008, "grad_norm": 0.16802026331424713, "learning_rate": 2.297972827920385e-05, "loss": 0.5796, "mean_token_accuracy": 0.8132590837776661, "num_tokens": 801553436.0, "step": 25115 }, { "entropy": 0.5241159675642848, "epoch": 2.310797522728449, "grad_norm": 0.17274372279644012, "learning_rate": 2.2976661453062226e-05, "loss": 0.5209, "mean_token_accuracy": 0.8352809324860573, "num_tokens": 801584959.0, "step": 25116 }, { "entropy": 0.4449713643407449, "epoch": 2.31088952909989, "grad_norm": 0.15693499147891998, "learning_rate": 2.29735946269206e-05, "loss": 0.4321, "mean_token_accuracy": 0.8596192747354507, "num_tokens": 801616342.0, "step": 25117 }, { "entropy": 0.5675513260066509, "epoch": 2.3109815354713312, "grad_norm": 0.16450296342372894, "learning_rate": 2.2970527800778975e-05, "loss": 0.5535, "mean_token_accuracy": 0.8245981074869633, "num_tokens": 801648615.0, "step": 25118 }, { "entropy": 0.5148673821240664, "epoch": 2.311073541842773, "grad_norm": 0.16148169338703156, "learning_rate": 2.2967460974637347e-05, "loss": 0.5075, "mean_token_accuracy": 0.8366937376558781, "num_tokens": 801680512.0, "step": 25119 }, { "entropy": 0.48999247048050165, "epoch": 2.311165548214214, "grad_norm": 0.16096745431423187, "learning_rate": 2.2964394148495725e-05, "loss": 0.4754, "mean_token_accuracy": 0.8475928716361523, "num_tokens": 801712677.0, "step": 25120 }, { "entropy": 0.5093931341543794, "epoch": 2.311257554585655, "grad_norm": 0.15802393853664398, "learning_rate": 2.29613273223541e-05, "loss": 0.4894, "mean_token_accuracy": 0.8453201241791248, "num_tokens": 801745279.0, "step": 25121 }, { "entropy": 0.5526436194777489, "epoch": 2.311349560957096, "grad_norm": 0.16581712663173676, "learning_rate": 2.295826049621247e-05, "loss": 0.5388, "mean_token_accuracy": 0.8307658173143864, "num_tokens": 801776957.0, "step": 25122 }, { "entropy": 0.5462177693843842, "epoch": 2.3114415673285373, "grad_norm": 0.16720299422740936, "learning_rate": 2.2955193670070845e-05, "loss": 0.533, "mean_token_accuracy": 0.8345778696238995, "num_tokens": 801809073.0, "step": 25123 }, { "entropy": 0.5126902544870973, "epoch": 2.311533573699979, "grad_norm": 0.15832528471946716, "learning_rate": 2.295212684392922e-05, "loss": 0.4942, "mean_token_accuracy": 0.8422737047076225, "num_tokens": 801840428.0, "step": 25124 }, { "entropy": 0.5468550957739353, "epoch": 2.31162558007142, "grad_norm": 0.16504491865634918, "learning_rate": 2.2949060017787594e-05, "loss": 0.5362, "mean_token_accuracy": 0.8308915793895721, "num_tokens": 801872018.0, "step": 25125 }, { "entropy": 0.48075492307543755, "epoch": 2.311717586442861, "grad_norm": 0.1567101925611496, "learning_rate": 2.294599319164597e-05, "loss": 0.4779, "mean_token_accuracy": 0.847786296159029, "num_tokens": 801903866.0, "step": 25126 }, { "entropy": 0.4677213979884982, "epoch": 2.3118095928143023, "grad_norm": 0.15359170734882355, "learning_rate": 2.294292636550434e-05, "loss": 0.4563, "mean_token_accuracy": 0.85204141959548, "num_tokens": 801935714.0, "step": 25127 }, { "entropy": 0.5399137884378433, "epoch": 2.3119015991857434, "grad_norm": 0.16316568851470947, "learning_rate": 2.2939859539362715e-05, "loss": 0.5188, "mean_token_accuracy": 0.835649199783802, "num_tokens": 801966680.0, "step": 25128 }, { "entropy": 0.5589268300682306, "epoch": 2.311993605557185, "grad_norm": 0.16556961834430695, "learning_rate": 2.293679271322109e-05, "loss": 0.5482, "mean_token_accuracy": 0.8262122198939323, "num_tokens": 801998420.0, "step": 25129 }, { "entropy": 0.5071427263319492, "epoch": 2.312085611928626, "grad_norm": 0.15784604847431183, "learning_rate": 2.2933725887079464e-05, "loss": 0.4929, "mean_token_accuracy": 0.8423387296497822, "num_tokens": 802030869.0, "step": 25130 }, { "entropy": 0.47032454796135426, "epoch": 2.3121776183000673, "grad_norm": 0.15408097207546234, "learning_rate": 2.2930659060937836e-05, "loss": 0.4578, "mean_token_accuracy": 0.8562861308455467, "num_tokens": 802063347.0, "step": 25131 }, { "entropy": 0.5528808543458581, "epoch": 2.3122696246715084, "grad_norm": 0.16859236359596252, "learning_rate": 2.292759223479621e-05, "loss": 0.5568, "mean_token_accuracy": 0.8311533033847809, "num_tokens": 802094586.0, "step": 25132 }, { "entropy": 0.5495193712413311, "epoch": 2.3123616310429496, "grad_norm": 0.16659700870513916, "learning_rate": 2.2924525408654585e-05, "loss": 0.5445, "mean_token_accuracy": 0.8276583068072796, "num_tokens": 802127157.0, "step": 25133 }, { "entropy": 0.5940435333177447, "epoch": 2.312453637414391, "grad_norm": 0.1683439314365387, "learning_rate": 2.292145858251296e-05, "loss": 0.5763, "mean_token_accuracy": 0.81727085262537, "num_tokens": 802159008.0, "step": 25134 }, { "entropy": 0.550460031372495, "epoch": 2.3125456437858323, "grad_norm": 0.155048668384552, "learning_rate": 2.291839175637133e-05, "loss": 0.5374, "mean_token_accuracy": 0.8316154293715954, "num_tokens": 802191446.0, "step": 25135 }, { "entropy": 0.5777712520211935, "epoch": 2.3126376501572734, "grad_norm": 0.16863323748111725, "learning_rate": 2.2915324930229705e-05, "loss": 0.5529, "mean_token_accuracy": 0.8207007758319378, "num_tokens": 802223340.0, "step": 25136 }, { "entropy": 0.5270719965919852, "epoch": 2.3127296565287145, "grad_norm": 0.15947872400283813, "learning_rate": 2.291225810408808e-05, "loss": 0.5108, "mean_token_accuracy": 0.8391508534550667, "num_tokens": 802255406.0, "step": 25137 }, { "entropy": 0.5631100181490183, "epoch": 2.3128216629001557, "grad_norm": 0.16693232953548431, "learning_rate": 2.2909191277946455e-05, "loss": 0.5525, "mean_token_accuracy": 0.8253905475139618, "num_tokens": 802287187.0, "step": 25138 }, { "entropy": 0.4276406718418002, "epoch": 2.3129136692715973, "grad_norm": 0.14336615800857544, "learning_rate": 2.290612445180483e-05, "loss": 0.4112, "mean_token_accuracy": 0.8653998672962189, "num_tokens": 802319313.0, "step": 25139 }, { "entropy": 0.5831938814371824, "epoch": 2.3130056756430384, "grad_norm": 0.16829758882522583, "learning_rate": 2.29030576256632e-05, "loss": 0.5635, "mean_token_accuracy": 0.8225157931447029, "num_tokens": 802349933.0, "step": 25140 }, { "entropy": 0.3779500452801585, "epoch": 2.3130976820144795, "grad_norm": 0.13876792788505554, "learning_rate": 2.2899990799521575e-05, "loss": 0.361, "mean_token_accuracy": 0.8832645788788795, "num_tokens": 802381776.0, "step": 25141 }, { "entropy": 0.5711993556469679, "epoch": 2.3131896883859207, "grad_norm": 0.1650266945362091, "learning_rate": 2.289692397337995e-05, "loss": 0.5652, "mean_token_accuracy": 0.8223155215382576, "num_tokens": 802413891.0, "step": 25142 }, { "entropy": 0.5325160175561905, "epoch": 2.313281694757362, "grad_norm": 0.16441422700881958, "learning_rate": 2.2893857147238325e-05, "loss": 0.5239, "mean_token_accuracy": 0.839646726846695, "num_tokens": 802445629.0, "step": 25143 }, { "entropy": 0.4805815778672695, "epoch": 2.3133737011288034, "grad_norm": 0.15367460250854492, "learning_rate": 2.2890790321096696e-05, "loss": 0.4632, "mean_token_accuracy": 0.8484525382518768, "num_tokens": 802478052.0, "step": 25144 }, { "entropy": 0.5247154654935002, "epoch": 2.3134657075002445, "grad_norm": 0.15713748335838318, "learning_rate": 2.288772349495507e-05, "loss": 0.508, "mean_token_accuracy": 0.8384093306958675, "num_tokens": 802510271.0, "step": 25145 }, { "entropy": 0.5391512140631676, "epoch": 2.3135577138716856, "grad_norm": 0.17083293199539185, "learning_rate": 2.2884656668813445e-05, "loss": 0.5387, "mean_token_accuracy": 0.8292112201452255, "num_tokens": 802541798.0, "step": 25146 }, { "entropy": 0.5033819107338786, "epoch": 2.3136497202431268, "grad_norm": 0.1632751226425171, "learning_rate": 2.288158984267182e-05, "loss": 0.4997, "mean_token_accuracy": 0.8437625132501125, "num_tokens": 802573206.0, "step": 25147 }, { "entropy": 0.47403513081371784, "epoch": 2.313741726614568, "grad_norm": 0.15363970398902893, "learning_rate": 2.2878523016530194e-05, "loss": 0.4654, "mean_token_accuracy": 0.8484965600073338, "num_tokens": 802605438.0, "step": 25148 }, { "entropy": 0.5413219192996621, "epoch": 2.3138337329860095, "grad_norm": 0.17305922508239746, "learning_rate": 2.2875456190388566e-05, "loss": 0.5371, "mean_token_accuracy": 0.8319943808019161, "num_tokens": 802636881.0, "step": 25149 }, { "entropy": 0.44457135756965727, "epoch": 2.3139257393574506, "grad_norm": 0.14872771501541138, "learning_rate": 2.287238936424694e-05, "loss": 0.4349, "mean_token_accuracy": 0.8625831939280033, "num_tokens": 802668905.0, "step": 25150 }, { "entropy": 0.5673285154625773, "epoch": 2.3140177457288917, "grad_norm": 0.1656716912984848, "learning_rate": 2.286932253810532e-05, "loss": 0.5505, "mean_token_accuracy": 0.8265413828194141, "num_tokens": 802701415.0, "step": 25151 }, { "entropy": 0.5186083680018783, "epoch": 2.314109752100333, "grad_norm": 0.16621993482112885, "learning_rate": 2.286625571196369e-05, "loss": 0.5051, "mean_token_accuracy": 0.8398144245147705, "num_tokens": 802732939.0, "step": 25152 }, { "entropy": 0.6011839937418699, "epoch": 2.314201758471774, "grad_norm": 0.17094004154205322, "learning_rate": 2.2863188885822064e-05, "loss": 0.5848, "mean_token_accuracy": 0.8159437291324139, "num_tokens": 802765217.0, "step": 25153 }, { "entropy": 0.4336349132936448, "epoch": 2.3142937648432156, "grad_norm": 0.15089410543441772, "learning_rate": 2.286012205968044e-05, "loss": 0.4191, "mean_token_accuracy": 0.8659469448029995, "num_tokens": 802797179.0, "step": 25154 }, { "entropy": 0.4773937058635056, "epoch": 2.3143857712146567, "grad_norm": 0.1634649783372879, "learning_rate": 2.2857055233538814e-05, "loss": 0.4689, "mean_token_accuracy": 0.8531189672648907, "num_tokens": 802829365.0, "step": 25155 }, { "entropy": 0.4303214121609926, "epoch": 2.314477777586098, "grad_norm": 0.14404502511024475, "learning_rate": 2.2853988407397188e-05, "loss": 0.4182, "mean_token_accuracy": 0.8676212020218372, "num_tokens": 802861608.0, "step": 25156 }, { "entropy": 0.4928422295488417, "epoch": 2.314569783957539, "grad_norm": 0.1635335385799408, "learning_rate": 2.285092158125556e-05, "loss": 0.4898, "mean_token_accuracy": 0.8466669730842113, "num_tokens": 802893066.0, "step": 25157 }, { "entropy": 0.4756348291411996, "epoch": 2.31466179032898, "grad_norm": 0.15469782054424286, "learning_rate": 2.2847854755113934e-05, "loss": 0.4665, "mean_token_accuracy": 0.853121105581522, "num_tokens": 802925287.0, "step": 25158 }, { "entropy": 0.48440923262387514, "epoch": 2.3147537967004217, "grad_norm": 0.15464279055595398, "learning_rate": 2.284478792897231e-05, "loss": 0.4668, "mean_token_accuracy": 0.8514199703931808, "num_tokens": 802957099.0, "step": 25159 }, { "entropy": 0.3486238259356469, "epoch": 2.314845803071863, "grad_norm": 0.1383250206708908, "learning_rate": 2.2841721102830683e-05, "loss": 0.335, "mean_token_accuracy": 0.8914608024060726, "num_tokens": 802989323.0, "step": 25160 }, { "entropy": 0.5298748761415482, "epoch": 2.314937809443304, "grad_norm": 0.17019428312778473, "learning_rate": 2.2838654276689055e-05, "loss": 0.5002, "mean_token_accuracy": 0.8377180993556976, "num_tokens": 803020205.0, "step": 25161 }, { "entropy": 0.5788375707343221, "epoch": 2.315029815814745, "grad_norm": 0.16985264420509338, "learning_rate": 2.283558745054743e-05, "loss": 0.5614, "mean_token_accuracy": 0.8222916126251221, "num_tokens": 803051067.0, "step": 25162 }, { "entropy": 0.5745835993438959, "epoch": 2.3151218221861862, "grad_norm": 0.16652950644493103, "learning_rate": 2.2832520624405804e-05, "loss": 0.5595, "mean_token_accuracy": 0.8271581195294857, "num_tokens": 803082708.0, "step": 25163 }, { "entropy": 0.5139192901551723, "epoch": 2.315213828557628, "grad_norm": 0.16506099700927734, "learning_rate": 2.282945379826418e-05, "loss": 0.5094, "mean_token_accuracy": 0.836444303393364, "num_tokens": 803114570.0, "step": 25164 }, { "entropy": 0.5005513913929462, "epoch": 2.315305834929069, "grad_norm": 0.15524831414222717, "learning_rate": 2.282638697212255e-05, "loss": 0.4969, "mean_token_accuracy": 0.8409740440547466, "num_tokens": 803146766.0, "step": 25165 }, { "entropy": 0.49887625221163034, "epoch": 2.31539784130051, "grad_norm": 0.15886279940605164, "learning_rate": 2.2823320145980925e-05, "loss": 0.4782, "mean_token_accuracy": 0.8482112735509872, "num_tokens": 803178880.0, "step": 25166 }, { "entropy": 0.521731112152338, "epoch": 2.315489847671951, "grad_norm": 0.1641351282596588, "learning_rate": 2.28202533198393e-05, "loss": 0.5015, "mean_token_accuracy": 0.8404214754700661, "num_tokens": 803210312.0, "step": 25167 }, { "entropy": 0.4901375784538686, "epoch": 2.3155818540433923, "grad_norm": 0.16230282187461853, "learning_rate": 2.2817186493697674e-05, "loss": 0.4781, "mean_token_accuracy": 0.8490314856171608, "num_tokens": 803242447.0, "step": 25168 }, { "entropy": 0.5237335981801152, "epoch": 2.315673860414834, "grad_norm": 0.16495417058467865, "learning_rate": 2.281411966755605e-05, "loss": 0.5167, "mean_token_accuracy": 0.8387499488890171, "num_tokens": 803273794.0, "step": 25169 }, { "entropy": 0.5307688377797604, "epoch": 2.315765866786275, "grad_norm": 0.17171306908130646, "learning_rate": 2.281105284141442e-05, "loss": 0.52, "mean_token_accuracy": 0.8317863047122955, "num_tokens": 803304733.0, "step": 25170 }, { "entropy": 0.5729847783222795, "epoch": 2.315857873157716, "grad_norm": 0.16252827644348145, "learning_rate": 2.2807986015272794e-05, "loss": 0.562, "mean_token_accuracy": 0.8230206407606602, "num_tokens": 803336977.0, "step": 25171 }, { "entropy": 0.521293324418366, "epoch": 2.3159498795291573, "grad_norm": 0.15487059950828552, "learning_rate": 2.280491918913117e-05, "loss": 0.4917, "mean_token_accuracy": 0.8405033349990845, "num_tokens": 803368507.0, "step": 25172 }, { "entropy": 0.482604016084224, "epoch": 2.3160418859005985, "grad_norm": 0.15437108278274536, "learning_rate": 2.2801852362989544e-05, "loss": 0.4771, "mean_token_accuracy": 0.8489557802677155, "num_tokens": 803400582.0, "step": 25173 }, { "entropy": 0.4989618135150522, "epoch": 2.31613389227204, "grad_norm": 0.15195603668689728, "learning_rate": 2.2798785536847915e-05, "loss": 0.4905, "mean_token_accuracy": 0.8433856666088104, "num_tokens": 803433335.0, "step": 25174 }, { "entropy": 0.5777119947597384, "epoch": 2.316225898643481, "grad_norm": 0.1696212887763977, "learning_rate": 2.279571871070629e-05, "loss": 0.5701, "mean_token_accuracy": 0.8216627277433872, "num_tokens": 803464546.0, "step": 25175 }, { "entropy": 0.45725591108202934, "epoch": 2.3163179050149223, "grad_norm": 0.15522736310958862, "learning_rate": 2.2792651884564664e-05, "loss": 0.4451, "mean_token_accuracy": 0.8574786894023418, "num_tokens": 803496500.0, "step": 25176 }, { "entropy": 0.5501332115381956, "epoch": 2.3164099113863634, "grad_norm": 0.16792437434196472, "learning_rate": 2.278958505842304e-05, "loss": 0.5383, "mean_token_accuracy": 0.8301997557282448, "num_tokens": 803526963.0, "step": 25177 }, { "entropy": 0.5353647300507873, "epoch": 2.3165019177578046, "grad_norm": 0.16323302686214447, "learning_rate": 2.2786518232281413e-05, "loss": 0.5157, "mean_token_accuracy": 0.8381466493010521, "num_tokens": 803558953.0, "step": 25178 }, { "entropy": 0.5830913949757814, "epoch": 2.316593924129246, "grad_norm": 0.1709592640399933, "learning_rate": 2.2783451406139785e-05, "loss": 0.5775, "mean_token_accuracy": 0.8214461989700794, "num_tokens": 803590811.0, "step": 25179 }, { "entropy": 0.5657001622021198, "epoch": 2.3166859305006873, "grad_norm": 0.17079155147075653, "learning_rate": 2.278038457999816e-05, "loss": 0.5608, "mean_token_accuracy": 0.8216197565197945, "num_tokens": 803622542.0, "step": 25180 }, { "entropy": 0.4258003393188119, "epoch": 2.3167779368721284, "grad_norm": 0.14782236516475677, "learning_rate": 2.2777317753856537e-05, "loss": 0.4164, "mean_token_accuracy": 0.8702001012861729, "num_tokens": 803654499.0, "step": 25181 }, { "entropy": 0.5043971594423056, "epoch": 2.3168699432435695, "grad_norm": 0.1560724377632141, "learning_rate": 2.277425092771491e-05, "loss": 0.4849, "mean_token_accuracy": 0.8443129844963551, "num_tokens": 803685567.0, "step": 25182 }, { "entropy": 0.47293971106410027, "epoch": 2.3169619496150107, "grad_norm": 0.1504366248846054, "learning_rate": 2.2771184101573283e-05, "loss": 0.4618, "mean_token_accuracy": 0.8570609018206596, "num_tokens": 803718032.0, "step": 25183 }, { "entropy": 0.49766878224909306, "epoch": 2.3170539559864523, "grad_norm": 0.16081944108009338, "learning_rate": 2.2768117275431658e-05, "loss": 0.479, "mean_token_accuracy": 0.8464933075010777, "num_tokens": 803749261.0, "step": 25184 }, { "entropy": 0.5400229971855879, "epoch": 2.3171459623578934, "grad_norm": 0.16796182096004486, "learning_rate": 2.2765050449290033e-05, "loss": 0.5241, "mean_token_accuracy": 0.8304631374776363, "num_tokens": 803780801.0, "step": 25185 }, { "entropy": 0.4860871620476246, "epoch": 2.3172379687293345, "grad_norm": 0.16589924693107605, "learning_rate": 2.2761983623148407e-05, "loss": 0.4709, "mean_token_accuracy": 0.8508602678775787, "num_tokens": 803812379.0, "step": 25186 }, { "entropy": 0.46558887138962746, "epoch": 2.3173299751007757, "grad_norm": 0.15394796431064606, "learning_rate": 2.275891679700678e-05, "loss": 0.4496, "mean_token_accuracy": 0.8549349345266819, "num_tokens": 803844505.0, "step": 25187 }, { "entropy": 0.5054906373843551, "epoch": 2.317421981472217, "grad_norm": 0.15732145309448242, "learning_rate": 2.2755849970865153e-05, "loss": 0.4883, "mean_token_accuracy": 0.8428374566137791, "num_tokens": 803876752.0, "step": 25188 }, { "entropy": 0.5174683043733239, "epoch": 2.3175139878436584, "grad_norm": 0.16533352434635162, "learning_rate": 2.2752783144723528e-05, "loss": 0.5048, "mean_token_accuracy": 0.841178122907877, "num_tokens": 803908067.0, "step": 25189 }, { "entropy": 0.541555866599083, "epoch": 2.3176059942150995, "grad_norm": 0.16224367916584015, "learning_rate": 2.2749716318581902e-05, "loss": 0.5259, "mean_token_accuracy": 0.8345691710710526, "num_tokens": 803940302.0, "step": 25190 }, { "entropy": 0.48255342547781765, "epoch": 2.3176980005865406, "grad_norm": 0.1609201282262802, "learning_rate": 2.2746649492440274e-05, "loss": 0.4737, "mean_token_accuracy": 0.8529666215181351, "num_tokens": 803971945.0, "step": 25191 }, { "entropy": 0.503317579627037, "epoch": 2.3177900069579818, "grad_norm": 0.160977303981781, "learning_rate": 2.274358266629865e-05, "loss": 0.4948, "mean_token_accuracy": 0.8402017876505852, "num_tokens": 804003426.0, "step": 25192 }, { "entropy": 0.5029942309483886, "epoch": 2.317882013329423, "grad_norm": 0.16202040016651154, "learning_rate": 2.2740515840157023e-05, "loss": 0.5008, "mean_token_accuracy": 0.8405500985682011, "num_tokens": 804035715.0, "step": 25193 }, { "entropy": 0.555846506729722, "epoch": 2.3179740197008645, "grad_norm": 0.16355912387371063, "learning_rate": 2.2737449014015398e-05, "loss": 0.5381, "mean_token_accuracy": 0.8291481770575047, "num_tokens": 804067936.0, "step": 25194 }, { "entropy": 0.567995335906744, "epoch": 2.3180660260723056, "grad_norm": 0.17002061009407043, "learning_rate": 2.273438218787377e-05, "loss": 0.5621, "mean_token_accuracy": 0.8217899091541767, "num_tokens": 804099982.0, "step": 25195 }, { "entropy": 0.5723052378743887, "epoch": 2.3181580324437467, "grad_norm": 0.17129474878311157, "learning_rate": 2.2731315361732144e-05, "loss": 0.5629, "mean_token_accuracy": 0.8216893412172794, "num_tokens": 804131660.0, "step": 25196 }, { "entropy": 0.5043212556047365, "epoch": 2.318250038815188, "grad_norm": 0.16054761409759521, "learning_rate": 2.2728248535590518e-05, "loss": 0.4969, "mean_token_accuracy": 0.84087048843503, "num_tokens": 804163288.0, "step": 25197 }, { "entropy": 0.566611603833735, "epoch": 2.318342045186629, "grad_norm": 0.16592496633529663, "learning_rate": 2.2725181709448893e-05, "loss": 0.5455, "mean_token_accuracy": 0.8283709958195686, "num_tokens": 804195427.0, "step": 25198 }, { "entropy": 0.5048708296380937, "epoch": 2.3184340515580706, "grad_norm": 0.16156592965126038, "learning_rate": 2.2722114883307268e-05, "loss": 0.4923, "mean_token_accuracy": 0.8451996073126793, "num_tokens": 804226971.0, "step": 25199 }, { "entropy": 0.5387132558971643, "epoch": 2.3185260579295117, "grad_norm": 0.16572754085063934, "learning_rate": 2.271904805716564e-05, "loss": 0.521, "mean_token_accuracy": 0.8344298861920834, "num_tokens": 804258376.0, "step": 25200 }, { "entropy": 0.5559044014662504, "epoch": 2.318618064300953, "grad_norm": 0.16048184037208557, "learning_rate": 2.2715981231024013e-05, "loss": 0.5399, "mean_token_accuracy": 0.8287432864308357, "num_tokens": 804291144.0, "step": 25201 }, { "entropy": 0.5248086391948164, "epoch": 2.318710070672394, "grad_norm": 0.1595417559146881, "learning_rate": 2.2712914404882388e-05, "loss": 0.5104, "mean_token_accuracy": 0.8378454335033894, "num_tokens": 804323607.0, "step": 25202 }, { "entropy": 0.4534313874319196, "epoch": 2.318802077043835, "grad_norm": 0.15389803051948547, "learning_rate": 2.2709847578740763e-05, "loss": 0.4479, "mean_token_accuracy": 0.8574574515223503, "num_tokens": 804356009.0, "step": 25203 }, { "entropy": 0.6064914558082819, "epoch": 2.3188940834152767, "grad_norm": 0.17053990066051483, "learning_rate": 2.2706780752599134e-05, "loss": 0.5913, "mean_token_accuracy": 0.8114228844642639, "num_tokens": 804387665.0, "step": 25204 }, { "entropy": 0.5652018263936043, "epoch": 2.318986089786718, "grad_norm": 0.16565604507923126, "learning_rate": 2.270371392645751e-05, "loss": 0.5608, "mean_token_accuracy": 0.8259492926299572, "num_tokens": 804419995.0, "step": 25205 }, { "entropy": 0.47455823980271816, "epoch": 2.319078096158159, "grad_norm": 0.15407375991344452, "learning_rate": 2.2700647100315883e-05, "loss": 0.4627, "mean_token_accuracy": 0.8539148680865765, "num_tokens": 804451619.0, "step": 25206 }, { "entropy": 0.4750592513009906, "epoch": 2.3191701025296, "grad_norm": 0.15382924675941467, "learning_rate": 2.2697580274174258e-05, "loss": 0.4693, "mean_token_accuracy": 0.8519616574048996, "num_tokens": 804483518.0, "step": 25207 }, { "entropy": 0.5098492819815874, "epoch": 2.3192621089010412, "grad_norm": 0.16363582015037537, "learning_rate": 2.2694513448032633e-05, "loss": 0.4993, "mean_token_accuracy": 0.8387256860733032, "num_tokens": 804515426.0, "step": 25208 }, { "entropy": 0.5752709470689297, "epoch": 2.319354115272483, "grad_norm": 0.17038366198539734, "learning_rate": 2.2691446621891004e-05, "loss": 0.5647, "mean_token_accuracy": 0.8205769583582878, "num_tokens": 804547617.0, "step": 25209 }, { "entropy": 0.5358101788442582, "epoch": 2.319446121643924, "grad_norm": 0.1612497866153717, "learning_rate": 2.268837979574938e-05, "loss": 0.5244, "mean_token_accuracy": 0.8357739374041557, "num_tokens": 804580225.0, "step": 25210 }, { "entropy": 0.4933468885719776, "epoch": 2.319538128015365, "grad_norm": 0.1575235277414322, "learning_rate": 2.2685312969607753e-05, "loss": 0.4739, "mean_token_accuracy": 0.8487297296524048, "num_tokens": 804612556.0, "step": 25211 }, { "entropy": 0.4131561703979969, "epoch": 2.319630134386806, "grad_norm": 0.1419726312160492, "learning_rate": 2.2682246143466128e-05, "loss": 0.4021, "mean_token_accuracy": 0.8745204694569111, "num_tokens": 804645232.0, "step": 25212 }, { "entropy": 0.5612348727881908, "epoch": 2.3197221407582473, "grad_norm": 0.16777609288692474, "learning_rate": 2.2679179317324502e-05, "loss": 0.5525, "mean_token_accuracy": 0.8262250982224941, "num_tokens": 804677516.0, "step": 25213 }, { "entropy": 0.464638854842633, "epoch": 2.319814147129689, "grad_norm": 0.1539989858865738, "learning_rate": 2.2676112491182877e-05, "loss": 0.4485, "mean_token_accuracy": 0.8553230725228786, "num_tokens": 804709772.0, "step": 25214 }, { "entropy": 0.55633051879704, "epoch": 2.31990615350113, "grad_norm": 0.16518056392669678, "learning_rate": 2.2673045665041252e-05, "loss": 0.5431, "mean_token_accuracy": 0.8306923322379589, "num_tokens": 804742159.0, "step": 25215 }, { "entropy": 0.6377935139462352, "epoch": 2.319998159872571, "grad_norm": 0.17439530789852142, "learning_rate": 2.2669978838899626e-05, "loss": 0.6311, "mean_token_accuracy": 0.8020104803144932, "num_tokens": 804774737.0, "step": 25216 }, { "entropy": 0.5594222955405712, "epoch": 2.3200901662440123, "grad_norm": 0.16630472242832184, "learning_rate": 2.2666912012757998e-05, "loss": 0.5527, "mean_token_accuracy": 0.8242732994258404, "num_tokens": 804807182.0, "step": 25217 }, { "entropy": 0.5390727538615465, "epoch": 2.3201821726154535, "grad_norm": 0.1583838313817978, "learning_rate": 2.2663845186616372e-05, "loss": 0.5182, "mean_token_accuracy": 0.8355869799852371, "num_tokens": 804839347.0, "step": 25218 }, { "entropy": 0.5026420904323459, "epoch": 2.320274178986895, "grad_norm": 0.1621468961238861, "learning_rate": 2.2660778360474747e-05, "loss": 0.4871, "mean_token_accuracy": 0.843279805034399, "num_tokens": 804871331.0, "step": 25219 }, { "entropy": 0.5730227753520012, "epoch": 2.320366185358336, "grad_norm": 0.1693664938211441, "learning_rate": 2.265771153433312e-05, "loss": 0.5604, "mean_token_accuracy": 0.8244024887681007, "num_tokens": 804903709.0, "step": 25220 }, { "entropy": 0.5221093064174056, "epoch": 2.3204581917297773, "grad_norm": 0.16093853116035461, "learning_rate": 2.2654644708191493e-05, "loss": 0.5115, "mean_token_accuracy": 0.8386682122945786, "num_tokens": 804935082.0, "step": 25221 }, { "entropy": 0.46300294902175665, "epoch": 2.3205501981012184, "grad_norm": 0.1518557220697403, "learning_rate": 2.2651577882049867e-05, "loss": 0.4483, "mean_token_accuracy": 0.8565740138292313, "num_tokens": 804967206.0, "step": 25222 }, { "entropy": 0.4746914766728878, "epoch": 2.3206422044726596, "grad_norm": 0.15734148025512695, "learning_rate": 2.2648511055908242e-05, "loss": 0.4626, "mean_token_accuracy": 0.8528572730720043, "num_tokens": 804999239.0, "step": 25223 }, { "entropy": 0.4472365779802203, "epoch": 2.320734210844101, "grad_norm": 0.14559955894947052, "learning_rate": 2.2645444229766617e-05, "loss": 0.4282, "mean_token_accuracy": 0.8642861023545265, "num_tokens": 805031346.0, "step": 25224 }, { "entropy": 0.5803207764402032, "epoch": 2.3208262172155423, "grad_norm": 0.17105905711650848, "learning_rate": 2.2642377403624988e-05, "loss": 0.5736, "mean_token_accuracy": 0.8174317255616188, "num_tokens": 805063179.0, "step": 25225 }, { "entropy": 0.5662807431071997, "epoch": 2.3209182235869834, "grad_norm": 0.16659127175807953, "learning_rate": 2.2639310577483363e-05, "loss": 0.5446, "mean_token_accuracy": 0.8260573744773865, "num_tokens": 805094570.0, "step": 25226 }, { "entropy": 0.5299295638687909, "epoch": 2.3210102299584245, "grad_norm": 0.15694959461688995, "learning_rate": 2.2636243751341737e-05, "loss": 0.5161, "mean_token_accuracy": 0.8376584127545357, "num_tokens": 805126859.0, "step": 25227 }, { "entropy": 0.6318655046634376, "epoch": 2.3211022363298657, "grad_norm": 0.1709318906068802, "learning_rate": 2.2633176925200112e-05, "loss": 0.6103, "mean_token_accuracy": 0.8089192993938923, "num_tokens": 805158935.0, "step": 25228 }, { "entropy": 0.5166059620678425, "epoch": 2.3211942427013073, "grad_norm": 0.16296926140785217, "learning_rate": 2.2630110099058487e-05, "loss": 0.4988, "mean_token_accuracy": 0.8398605845868587, "num_tokens": 805191586.0, "step": 25229 }, { "entropy": 0.5596910640597343, "epoch": 2.3212862490727484, "grad_norm": 0.16387653350830078, "learning_rate": 2.2627043272916858e-05, "loss": 0.5374, "mean_token_accuracy": 0.831169381737709, "num_tokens": 805223804.0, "step": 25230 }, { "entropy": 0.42087836319115013, "epoch": 2.3213782554441895, "grad_norm": 0.14565923810005188, "learning_rate": 2.2623976446775233e-05, "loss": 0.4008, "mean_token_accuracy": 0.8735095374286175, "num_tokens": 805255204.0, "step": 25231 }, { "entropy": 0.5071633188053966, "epoch": 2.3214702618156307, "grad_norm": 0.16076688468456268, "learning_rate": 2.2620909620633607e-05, "loss": 0.4906, "mean_token_accuracy": 0.8414338231086731, "num_tokens": 805287167.0, "step": 25232 }, { "entropy": 0.522416764870286, "epoch": 2.321562268187072, "grad_norm": 0.16898776590824127, "learning_rate": 2.2617842794491982e-05, "loss": 0.5189, "mean_token_accuracy": 0.8345462158322334, "num_tokens": 805318488.0, "step": 25233 }, { "entropy": 0.464611092582345, "epoch": 2.3216542745585134, "grad_norm": 0.15734177827835083, "learning_rate": 2.2614775968350353e-05, "loss": 0.4563, "mean_token_accuracy": 0.8551323600113392, "num_tokens": 805350167.0, "step": 25234 }, { "entropy": 0.5167939066886902, "epoch": 2.3217462809299545, "grad_norm": 0.15985943377017975, "learning_rate": 2.2611709142208728e-05, "loss": 0.5147, "mean_token_accuracy": 0.8363000825047493, "num_tokens": 805382094.0, "step": 25235 }, { "entropy": 0.46233461587689817, "epoch": 2.3218382873013956, "grad_norm": 0.15320970118045807, "learning_rate": 2.2608642316067102e-05, "loss": 0.4452, "mean_token_accuracy": 0.8590850755572319, "num_tokens": 805413661.0, "step": 25236 }, { "entropy": 0.46655827295035124, "epoch": 2.3219302936728368, "grad_norm": 0.15763907134532928, "learning_rate": 2.2605575489925477e-05, "loss": 0.4597, "mean_token_accuracy": 0.8527010269463062, "num_tokens": 805445766.0, "step": 25237 }, { "entropy": 0.4692130731418729, "epoch": 2.322022300044278, "grad_norm": 0.15447746217250824, "learning_rate": 2.260250866378385e-05, "loss": 0.4583, "mean_token_accuracy": 0.85067493095994, "num_tokens": 805477474.0, "step": 25238 }, { "entropy": 0.5769457519054413, "epoch": 2.3221143064157195, "grad_norm": 0.1706840842962265, "learning_rate": 2.2599441837642223e-05, "loss": 0.568, "mean_token_accuracy": 0.8169513642787933, "num_tokens": 805508783.0, "step": 25239 }, { "entropy": 0.4845670238137245, "epoch": 2.3222063127871606, "grad_norm": 0.15856824815273285, "learning_rate": 2.2596375011500598e-05, "loss": 0.4738, "mean_token_accuracy": 0.8478328511118889, "num_tokens": 805541023.0, "step": 25240 }, { "entropy": 0.5740445703268051, "epoch": 2.3222983191586017, "grad_norm": 0.16654926538467407, "learning_rate": 2.2593308185358972e-05, "loss": 0.5642, "mean_token_accuracy": 0.8246989548206329, "num_tokens": 805572815.0, "step": 25241 }, { "entropy": 0.45032198866829276, "epoch": 2.322390325530043, "grad_norm": 0.15144847333431244, "learning_rate": 2.2590241359217347e-05, "loss": 0.4343, "mean_token_accuracy": 0.8597037196159363, "num_tokens": 805605149.0, "step": 25242 }, { "entropy": 0.53102639131248, "epoch": 2.322482331901484, "grad_norm": 0.16614970564842224, "learning_rate": 2.258717453307572e-05, "loss": 0.528, "mean_token_accuracy": 0.8312471136450768, "num_tokens": 805636056.0, "step": 25243 }, { "entropy": 0.5520358122885227, "epoch": 2.3225743382729256, "grad_norm": 0.1632205694913864, "learning_rate": 2.2584107706934096e-05, "loss": 0.5366, "mean_token_accuracy": 0.8308334536850452, "num_tokens": 805667739.0, "step": 25244 }, { "entropy": 0.4419072913005948, "epoch": 2.3226663446443667, "grad_norm": 0.15129660069942474, "learning_rate": 2.258104088079247e-05, "loss": 0.4364, "mean_token_accuracy": 0.8613159954547882, "num_tokens": 805699346.0, "step": 25245 }, { "entropy": 0.49611949105747044, "epoch": 2.322758351015808, "grad_norm": 0.1576724648475647, "learning_rate": 2.2577974054650845e-05, "loss": 0.4932, "mean_token_accuracy": 0.8436410874128342, "num_tokens": 805731996.0, "step": 25246 }, { "entropy": 0.5840349914506078, "epoch": 2.322850357387249, "grad_norm": 0.17149372398853302, "learning_rate": 2.2574907228509217e-05, "loss": 0.5726, "mean_token_accuracy": 0.8171418569982052, "num_tokens": 805763362.0, "step": 25247 }, { "entropy": 0.5203036088496447, "epoch": 2.32294236375869, "grad_norm": 0.1557326763868332, "learning_rate": 2.257184040236759e-05, "loss": 0.4937, "mean_token_accuracy": 0.8417237140238285, "num_tokens": 805795778.0, "step": 25248 }, { "entropy": 0.36814146023243666, "epoch": 2.3230343701301317, "grad_norm": 0.13802173733711243, "learning_rate": 2.2568773576225966e-05, "loss": 0.3492, "mean_token_accuracy": 0.8866328820586205, "num_tokens": 805828546.0, "step": 25249 }, { "entropy": 0.48979244008660316, "epoch": 2.323126376501573, "grad_norm": 0.15016281604766846, "learning_rate": 2.256570675008434e-05, "loss": 0.4841, "mean_token_accuracy": 0.844223253428936, "num_tokens": 805861314.0, "step": 25250 }, { "entropy": 0.435586123727262, "epoch": 2.323218382873014, "grad_norm": 0.15053527057170868, "learning_rate": 2.2562639923942712e-05, "loss": 0.426, "mean_token_accuracy": 0.865400493144989, "num_tokens": 805893389.0, "step": 25251 }, { "entropy": 0.49870393809396774, "epoch": 2.323310389244455, "grad_norm": 0.15321825444698334, "learning_rate": 2.2559573097801087e-05, "loss": 0.481, "mean_token_accuracy": 0.8471186980605125, "num_tokens": 805925752.0, "step": 25252 }, { "entropy": 0.5479178335517645, "epoch": 2.3234023956158962, "grad_norm": 0.1635541468858719, "learning_rate": 2.255650627165946e-05, "loss": 0.5372, "mean_token_accuracy": 0.8283802904188633, "num_tokens": 805958041.0, "step": 25253 }, { "entropy": 0.5665535856969655, "epoch": 2.323494401987338, "grad_norm": 0.1662689447402954, "learning_rate": 2.2553439445517836e-05, "loss": 0.5365, "mean_token_accuracy": 0.8308361023664474, "num_tokens": 805989540.0, "step": 25254 }, { "entropy": 0.6274078041315079, "epoch": 2.323586408358779, "grad_norm": 0.17443795502185822, "learning_rate": 2.2550372619376207e-05, "loss": 0.6215, "mean_token_accuracy": 0.805731613188982, "num_tokens": 806021566.0, "step": 25255 }, { "entropy": 0.46160740591585636, "epoch": 2.32367841473022, "grad_norm": 0.15064309537410736, "learning_rate": 2.2547305793234582e-05, "loss": 0.4492, "mean_token_accuracy": 0.8563450872898102, "num_tokens": 806053227.0, "step": 25256 }, { "entropy": 0.6326303295791149, "epoch": 2.323770421101661, "grad_norm": 0.1777363270521164, "learning_rate": 2.2544238967092956e-05, "loss": 0.6302, "mean_token_accuracy": 0.7998597174882889, "num_tokens": 806084596.0, "step": 25257 }, { "entropy": 0.5275838477537036, "epoch": 2.3238624274731023, "grad_norm": 0.15417209267616272, "learning_rate": 2.254117214095133e-05, "loss": 0.5032, "mean_token_accuracy": 0.8420024998486042, "num_tokens": 806116976.0, "step": 25258 }, { "entropy": 0.5397563241422176, "epoch": 2.323954433844544, "grad_norm": 0.15948766469955444, "learning_rate": 2.2538105314809706e-05, "loss": 0.5128, "mean_token_accuracy": 0.8353096209466457, "num_tokens": 806148722.0, "step": 25259 }, { "entropy": 0.5337205659598112, "epoch": 2.324046440215985, "grad_norm": 0.1616434007883072, "learning_rate": 2.2535038488668077e-05, "loss": 0.5261, "mean_token_accuracy": 0.8327205292880535, "num_tokens": 806181256.0, "step": 25260 }, { "entropy": 0.5627286774106324, "epoch": 2.324138446587426, "grad_norm": 0.16881346702575684, "learning_rate": 2.253197166252645e-05, "loss": 0.5463, "mean_token_accuracy": 0.8255730718374252, "num_tokens": 806211952.0, "step": 25261 }, { "entropy": 0.5993702607229352, "epoch": 2.3242304529588673, "grad_norm": 0.1677011251449585, "learning_rate": 2.2528904836384826e-05, "loss": 0.5724, "mean_token_accuracy": 0.8206595927476883, "num_tokens": 806243457.0, "step": 25262 }, { "entropy": 0.5014312716666609, "epoch": 2.3243224593303085, "grad_norm": 0.16331541538238525, "learning_rate": 2.25258380102432e-05, "loss": 0.4943, "mean_token_accuracy": 0.8437696397304535, "num_tokens": 806275829.0, "step": 25263 }, { "entropy": 0.5875299340113997, "epoch": 2.32441446570175, "grad_norm": 0.17071625590324402, "learning_rate": 2.2522771184101572e-05, "loss": 0.5769, "mean_token_accuracy": 0.8170618042349815, "num_tokens": 806307893.0, "step": 25264 }, { "entropy": 0.5991534586064517, "epoch": 2.324506472073191, "grad_norm": 0.17375700175762177, "learning_rate": 2.2519704357959947e-05, "loss": 0.5892, "mean_token_accuracy": 0.8186375424265862, "num_tokens": 806339788.0, "step": 25265 }, { "entropy": 0.5850745467469096, "epoch": 2.3245984784446323, "grad_norm": 0.1685900241136551, "learning_rate": 2.251663753181832e-05, "loss": 0.5908, "mean_token_accuracy": 0.8155606500804424, "num_tokens": 806371516.0, "step": 25266 }, { "entropy": 0.5905821146443486, "epoch": 2.3246904848160734, "grad_norm": 0.170180544257164, "learning_rate": 2.2513570705676696e-05, "loss": 0.5837, "mean_token_accuracy": 0.8147497475147247, "num_tokens": 806403263.0, "step": 25267 }, { "entropy": 0.5744648696854711, "epoch": 2.3247824911875146, "grad_norm": 0.1662142276763916, "learning_rate": 2.251050387953507e-05, "loss": 0.57, "mean_token_accuracy": 0.8175493255257607, "num_tokens": 806434870.0, "step": 25268 }, { "entropy": 0.46060498245060444, "epoch": 2.324874497558956, "grad_norm": 0.1557784229516983, "learning_rate": 2.2507437053393442e-05, "loss": 0.4459, "mean_token_accuracy": 0.8559170812368393, "num_tokens": 806466763.0, "step": 25269 }, { "entropy": 0.5618395917117596, "epoch": 2.3249665039303973, "grad_norm": 0.1663181483745575, "learning_rate": 2.2504370227251817e-05, "loss": 0.5354, "mean_token_accuracy": 0.827781118452549, "num_tokens": 806498566.0, "step": 25270 }, { "entropy": 0.517556032165885, "epoch": 2.3250585103018384, "grad_norm": 0.15603850781917572, "learning_rate": 2.250130340111019e-05, "loss": 0.505, "mean_token_accuracy": 0.8395987264811993, "num_tokens": 806530673.0, "step": 25271 }, { "entropy": 0.5302988439798355, "epoch": 2.3251505166732795, "grad_norm": 0.16300927102565765, "learning_rate": 2.2498236574968566e-05, "loss": 0.5194, "mean_token_accuracy": 0.8366815745830536, "num_tokens": 806562806.0, "step": 25272 }, { "entropy": 0.46990113286301494, "epoch": 2.3252425230447207, "grad_norm": 0.1551915407180786, "learning_rate": 2.249516974882694e-05, "loss": 0.4545, "mean_token_accuracy": 0.8520937263965607, "num_tokens": 806594685.0, "step": 25273 }, { "entropy": 0.6602779142558575, "epoch": 2.3253345294161623, "grad_norm": 0.17204445600509644, "learning_rate": 2.2492102922685315e-05, "loss": 0.6493, "mean_token_accuracy": 0.7993394732475281, "num_tokens": 806627367.0, "step": 25274 }, { "entropy": 0.49688850925303996, "epoch": 2.3254265357876034, "grad_norm": 0.16139920055866241, "learning_rate": 2.248903609654369e-05, "loss": 0.4861, "mean_token_accuracy": 0.8481481336057186, "num_tokens": 806659751.0, "step": 25275 }, { "entropy": 0.585121663287282, "epoch": 2.3255185421590445, "grad_norm": 0.1731739044189453, "learning_rate": 2.2485969270402065e-05, "loss": 0.5755, "mean_token_accuracy": 0.8209249973297119, "num_tokens": 806691958.0, "step": 25276 }, { "entropy": 0.5589048620313406, "epoch": 2.3256105485304857, "grad_norm": 0.1637868732213974, "learning_rate": 2.2482902444260436e-05, "loss": 0.5399, "mean_token_accuracy": 0.8304075486958027, "num_tokens": 806723980.0, "step": 25277 }, { "entropy": 0.4906876692548394, "epoch": 2.325702554901927, "grad_norm": 0.15873867273330688, "learning_rate": 2.247983561811881e-05, "loss": 0.4889, "mean_token_accuracy": 0.8460990339517593, "num_tokens": 806756387.0, "step": 25278 }, { "entropy": 0.49782656878232956, "epoch": 2.3257945612733684, "grad_norm": 0.15222205221652985, "learning_rate": 2.2476768791977185e-05, "loss": 0.483, "mean_token_accuracy": 0.847039233893156, "num_tokens": 806787822.0, "step": 25279 }, { "entropy": 0.5107954195700586, "epoch": 2.3258865676448095, "grad_norm": 0.15749944746494293, "learning_rate": 2.247370196583556e-05, "loss": 0.482, "mean_token_accuracy": 0.8484946340322495, "num_tokens": 806819775.0, "step": 25280 }, { "entropy": 0.4805318620055914, "epoch": 2.3259785740162506, "grad_norm": 0.15720731019973755, "learning_rate": 2.247063513969393e-05, "loss": 0.457, "mean_token_accuracy": 0.8536339625716209, "num_tokens": 806851719.0, "step": 25281 }, { "entropy": 0.4913817858323455, "epoch": 2.3260705803876918, "grad_norm": 0.15927647054195404, "learning_rate": 2.2467568313552306e-05, "loss": 0.4803, "mean_token_accuracy": 0.8485964499413967, "num_tokens": 806884158.0, "step": 25282 }, { "entropy": 0.5139999995008111, "epoch": 2.326162586759133, "grad_norm": 0.1595560610294342, "learning_rate": 2.246450148741068e-05, "loss": 0.4842, "mean_token_accuracy": 0.8421072699129581, "num_tokens": 806915829.0, "step": 25283 }, { "entropy": 0.43805744498968124, "epoch": 2.3262545931305745, "grad_norm": 0.1503380537033081, "learning_rate": 2.2461434661269055e-05, "loss": 0.4241, "mean_token_accuracy": 0.8636017814278603, "num_tokens": 806947835.0, "step": 25284 }, { "entropy": 0.4500849745236337, "epoch": 2.3263465995020156, "grad_norm": 0.1552901715040207, "learning_rate": 2.2458367835127426e-05, "loss": 0.4426, "mean_token_accuracy": 0.8570306897163391, "num_tokens": 806979513.0, "step": 25285 }, { "entropy": 0.5296015292406082, "epoch": 2.3264386058734567, "grad_norm": 0.1633971929550171, "learning_rate": 2.24553010089858e-05, "loss": 0.5243, "mean_token_accuracy": 0.8338333889842033, "num_tokens": 807011910.0, "step": 25286 }, { "entropy": 0.4961011167615652, "epoch": 2.326530612244898, "grad_norm": 0.1619192361831665, "learning_rate": 2.2452234182844176e-05, "loss": 0.4924, "mean_token_accuracy": 0.8443731442093849, "num_tokens": 807043734.0, "step": 25287 }, { "entropy": 0.47992356820032, "epoch": 2.326622618616339, "grad_norm": 0.15655048191547394, "learning_rate": 2.244916735670255e-05, "loss": 0.4556, "mean_token_accuracy": 0.8539511151611805, "num_tokens": 807074867.0, "step": 25288 }, { "entropy": 0.4702442013658583, "epoch": 2.3267146249877806, "grad_norm": 0.1598350554704666, "learning_rate": 2.2446100530560925e-05, "loss": 0.4545, "mean_token_accuracy": 0.8560150377452374, "num_tokens": 807106802.0, "step": 25289 }, { "entropy": 0.549662621691823, "epoch": 2.3268066313592217, "grad_norm": 0.17233514785766602, "learning_rate": 2.2443033704419296e-05, "loss": 0.5534, "mean_token_accuracy": 0.8245845809578896, "num_tokens": 807137421.0, "step": 25290 }, { "entropy": 0.5134260524064302, "epoch": 2.326898637730663, "grad_norm": 0.15803903341293335, "learning_rate": 2.243996687827767e-05, "loss": 0.4993, "mean_token_accuracy": 0.840189665555954, "num_tokens": 807169435.0, "step": 25291 }, { "entropy": 0.5787823712453246, "epoch": 2.326990644102104, "grad_norm": 0.16712325811386108, "learning_rate": 2.2436900052136045e-05, "loss": 0.5741, "mean_token_accuracy": 0.8169124685227871, "num_tokens": 807201830.0, "step": 25292 }, { "entropy": 0.4480204628780484, "epoch": 2.327082650473545, "grad_norm": 0.14973084628582, "learning_rate": 2.243383322599442e-05, "loss": 0.4384, "mean_token_accuracy": 0.8609937280416489, "num_tokens": 807234014.0, "step": 25293 }, { "entropy": 0.5487115727737546, "epoch": 2.3271746568449867, "grad_norm": 0.16410048305988312, "learning_rate": 2.243076639985279e-05, "loss": 0.5214, "mean_token_accuracy": 0.8376666754484177, "num_tokens": 807266226.0, "step": 25294 }, { "entropy": 0.4467361057177186, "epoch": 2.327266663216428, "grad_norm": 0.15358476340770721, "learning_rate": 2.2427699573711166e-05, "loss": 0.4315, "mean_token_accuracy": 0.8608063459396362, "num_tokens": 807298622.0, "step": 25295 }, { "entropy": 0.42931118328124285, "epoch": 2.327358669587869, "grad_norm": 0.14715297520160675, "learning_rate": 2.242463274756954e-05, "loss": 0.4118, "mean_token_accuracy": 0.8691650964319706, "num_tokens": 807330827.0, "step": 25296 }, { "entropy": 0.5383354439400136, "epoch": 2.32745067595931, "grad_norm": 0.16130311787128448, "learning_rate": 2.2421565921427915e-05, "loss": 0.5215, "mean_token_accuracy": 0.8363952040672302, "num_tokens": 807362676.0, "step": 25297 }, { "entropy": 0.5635715089738369, "epoch": 2.3275426823307512, "grad_norm": 0.16118952631950378, "learning_rate": 2.241849909528629e-05, "loss": 0.5427, "mean_token_accuracy": 0.8258894607424736, "num_tokens": 807394581.0, "step": 25298 }, { "entropy": 0.4670289261266589, "epoch": 2.327634688702193, "grad_norm": 0.15736955404281616, "learning_rate": 2.241543226914466e-05, "loss": 0.4528, "mean_token_accuracy": 0.8580460734665394, "num_tokens": 807426988.0, "step": 25299 }, { "entropy": 0.5363371041603386, "epoch": 2.327726695073634, "grad_norm": 0.16444867849349976, "learning_rate": 2.2412365443003036e-05, "loss": 0.5234, "mean_token_accuracy": 0.8357298225164413, "num_tokens": 807458734.0, "step": 25300 }, { "entropy": 0.5020619736751541, "epoch": 2.327818701445075, "grad_norm": 0.15556035935878754, "learning_rate": 2.240929861686141e-05, "loss": 0.4932, "mean_token_accuracy": 0.844909630715847, "num_tokens": 807490823.0, "step": 25301 }, { "entropy": 0.5483325943350792, "epoch": 2.327910707816516, "grad_norm": 0.16969871520996094, "learning_rate": 2.2406231790719785e-05, "loss": 0.5338, "mean_token_accuracy": 0.8270541094243526, "num_tokens": 807521997.0, "step": 25302 }, { "entropy": 0.5333770802244544, "epoch": 2.3280027141879573, "grad_norm": 0.15837524831295013, "learning_rate": 2.240316496457816e-05, "loss": 0.5245, "mean_token_accuracy": 0.8366302251815796, "num_tokens": 807554234.0, "step": 25303 }, { "entropy": 0.45480289217084646, "epoch": 2.328094720559399, "grad_norm": 0.15819667279720306, "learning_rate": 2.2400098138436534e-05, "loss": 0.45, "mean_token_accuracy": 0.8545272536575794, "num_tokens": 807585234.0, "step": 25304 }, { "entropy": 0.5847405027598143, "epoch": 2.32818672693084, "grad_norm": 0.16886873543262482, "learning_rate": 2.239703131229491e-05, "loss": 0.5687, "mean_token_accuracy": 0.8190629854798317, "num_tokens": 807616071.0, "step": 25305 }, { "entropy": 0.5408702362328768, "epoch": 2.328278733302281, "grad_norm": 0.16609954833984375, "learning_rate": 2.2393964486153284e-05, "loss": 0.525, "mean_token_accuracy": 0.8323307037353516, "num_tokens": 807647932.0, "step": 25306 }, { "entropy": 0.49477491015568376, "epoch": 2.3283707396737223, "grad_norm": 0.16345322132110596, "learning_rate": 2.2390897660011655e-05, "loss": 0.4851, "mean_token_accuracy": 0.8461481966078281, "num_tokens": 807680209.0, "step": 25307 }, { "entropy": 0.5070097837597132, "epoch": 2.3284627460451635, "grad_norm": 0.15643036365509033, "learning_rate": 2.238783083387003e-05, "loss": 0.5011, "mean_token_accuracy": 0.8401672020554543, "num_tokens": 807712159.0, "step": 25308 }, { "entropy": 0.5581168457865715, "epoch": 2.328554752416605, "grad_norm": 0.1660395711660385, "learning_rate": 2.2384764007728404e-05, "loss": 0.5628, "mean_token_accuracy": 0.8240561932325363, "num_tokens": 807744676.0, "step": 25309 }, { "entropy": 0.4071207600645721, "epoch": 2.328646758788046, "grad_norm": 0.14500415325164795, "learning_rate": 2.238169718158678e-05, "loss": 0.3892, "mean_token_accuracy": 0.8767443001270294, "num_tokens": 807777304.0, "step": 25310 }, { "entropy": 0.4869092870503664, "epoch": 2.3287387651594873, "grad_norm": 0.15456517040729523, "learning_rate": 2.237863035544515e-05, "loss": 0.4759, "mean_token_accuracy": 0.848826453089714, "num_tokens": 807809651.0, "step": 25311 }, { "entropy": 0.5094773955643177, "epoch": 2.3288307715309284, "grad_norm": 0.16163499653339386, "learning_rate": 2.2375563529303525e-05, "loss": 0.4939, "mean_token_accuracy": 0.8399196974933147, "num_tokens": 807841247.0, "step": 25312 }, { "entropy": 0.575840862467885, "epoch": 2.3289227779023696, "grad_norm": 0.17067740857601166, "learning_rate": 2.23724967031619e-05, "loss": 0.5682, "mean_token_accuracy": 0.8171841613948345, "num_tokens": 807872791.0, "step": 25313 }, { "entropy": 0.5593357558827847, "epoch": 2.329014784273811, "grad_norm": 0.1648123413324356, "learning_rate": 2.2369429877020274e-05, "loss": 0.5444, "mean_token_accuracy": 0.8280944675207138, "num_tokens": 807905035.0, "step": 25314 }, { "entropy": 0.4431611364707351, "epoch": 2.3291067906452523, "grad_norm": 0.15308372676372528, "learning_rate": 2.2366363050878645e-05, "loss": 0.4415, "mean_token_accuracy": 0.8569737486541271, "num_tokens": 807937155.0, "step": 25315 }, { "entropy": 0.5644648743327707, "epoch": 2.3291987970166934, "grad_norm": 0.16794084012508392, "learning_rate": 2.236329622473702e-05, "loss": 0.5537, "mean_token_accuracy": 0.8266159072518349, "num_tokens": 807969498.0, "step": 25316 }, { "entropy": 0.5713472636416554, "epoch": 2.3292908033881345, "grad_norm": 0.1684800237417221, "learning_rate": 2.2360229398595395e-05, "loss": 0.5476, "mean_token_accuracy": 0.8260368779301643, "num_tokens": 808000570.0, "step": 25317 }, { "entropy": 0.5063774100271985, "epoch": 2.3293828097595757, "grad_norm": 0.15399779379367828, "learning_rate": 2.235716257245377e-05, "loss": 0.491, "mean_token_accuracy": 0.8444665297865868, "num_tokens": 808032815.0, "step": 25318 }, { "entropy": 0.5249217413365841, "epoch": 2.3294748161310173, "grad_norm": 0.16622602939605713, "learning_rate": 2.2354095746312144e-05, "loss": 0.5075, "mean_token_accuracy": 0.839534804224968, "num_tokens": 808064367.0, "step": 25319 }, { "entropy": 0.416641958989203, "epoch": 2.3295668225024584, "grad_norm": 0.14809897541999817, "learning_rate": 2.2351028920170515e-05, "loss": 0.4077, "mean_token_accuracy": 0.8688831925392151, "num_tokens": 808096915.0, "step": 25320 }, { "entropy": 0.5357289109379053, "epoch": 2.3296588288738995, "grad_norm": 0.16331736743450165, "learning_rate": 2.234796209402889e-05, "loss": 0.526, "mean_token_accuracy": 0.8367569670081139, "num_tokens": 808128833.0, "step": 25321 }, { "entropy": 0.4891517765354365, "epoch": 2.3297508352453407, "grad_norm": 0.15299789607524872, "learning_rate": 2.2344895267887264e-05, "loss": 0.4746, "mean_token_accuracy": 0.8517029881477356, "num_tokens": 808161076.0, "step": 25322 }, { "entropy": 0.5391707429662347, "epoch": 2.329842841616782, "grad_norm": 0.16708478331565857, "learning_rate": 2.234182844174564e-05, "loss": 0.5272, "mean_token_accuracy": 0.8332529813051224, "num_tokens": 808192582.0, "step": 25323 }, { "entropy": 0.5286461990326643, "epoch": 2.3299348479882234, "grad_norm": 0.1602764129638672, "learning_rate": 2.233876161560401e-05, "loss": 0.5182, "mean_token_accuracy": 0.8338894844055176, "num_tokens": 808224546.0, "step": 25324 }, { "entropy": 0.4832066148519516, "epoch": 2.3300268543596645, "grad_norm": 0.16078431904315948, "learning_rate": 2.2335694789462385e-05, "loss": 0.4615, "mean_token_accuracy": 0.8501732908189297, "num_tokens": 808256797.0, "step": 25325 }, { "entropy": 0.5751765272580087, "epoch": 2.3301188607311056, "grad_norm": 0.16568978130817413, "learning_rate": 2.233262796332076e-05, "loss": 0.5459, "mean_token_accuracy": 0.8269211649894714, "num_tokens": 808288730.0, "step": 25326 }, { "entropy": 0.4904527524486184, "epoch": 2.3302108671025468, "grad_norm": 0.15781332552433014, "learning_rate": 2.2329561137179134e-05, "loss": 0.4753, "mean_token_accuracy": 0.8472790978848934, "num_tokens": 808320857.0, "step": 25327 }, { "entropy": 0.42806294839829206, "epoch": 2.330302873473988, "grad_norm": 0.14415407180786133, "learning_rate": 2.232649431103751e-05, "loss": 0.4163, "mean_token_accuracy": 0.8684568926692009, "num_tokens": 808352604.0, "step": 25328 }, { "entropy": 0.5315435491502285, "epoch": 2.3303948798454295, "grad_norm": 0.16653040051460266, "learning_rate": 2.232342748489588e-05, "loss": 0.522, "mean_token_accuracy": 0.8374136686325073, "num_tokens": 808383966.0, "step": 25329 }, { "entropy": 0.5064332010224462, "epoch": 2.3304868862168706, "grad_norm": 0.16007103025913239, "learning_rate": 2.2320360658754255e-05, "loss": 0.5024, "mean_token_accuracy": 0.8436578214168549, "num_tokens": 808415095.0, "step": 25330 }, { "entropy": 0.4797869324684143, "epoch": 2.3305788925883117, "grad_norm": 0.15531232953071594, "learning_rate": 2.231729383261263e-05, "loss": 0.4711, "mean_token_accuracy": 0.8483793921768665, "num_tokens": 808446886.0, "step": 25331 }, { "entropy": 0.5590710081160069, "epoch": 2.330670898959753, "grad_norm": 0.16561336815357208, "learning_rate": 2.2314227006471004e-05, "loss": 0.5493, "mean_token_accuracy": 0.8264541961252689, "num_tokens": 808479486.0, "step": 25332 }, { "entropy": 0.5168212484568357, "epoch": 2.330762905331194, "grad_norm": 0.16343890130519867, "learning_rate": 2.2311160180329375e-05, "loss": 0.5063, "mean_token_accuracy": 0.8373972326517105, "num_tokens": 808510748.0, "step": 25333 }, { "entropy": 0.423238436691463, "epoch": 2.3308549117026356, "grad_norm": 0.15363101661205292, "learning_rate": 2.2308093354187753e-05, "loss": 0.4098, "mean_token_accuracy": 0.8679915741086006, "num_tokens": 808542447.0, "step": 25334 }, { "entropy": 0.5928523931652308, "epoch": 2.3309469180740767, "grad_norm": 0.17440451681613922, "learning_rate": 2.2305026528046128e-05, "loss": 0.5816, "mean_token_accuracy": 0.8182483315467834, "num_tokens": 808573959.0, "step": 25335 }, { "entropy": 0.5032478733919561, "epoch": 2.331038924445518, "grad_norm": 0.15593670308589935, "learning_rate": 2.2301959701904503e-05, "loss": 0.4896, "mean_token_accuracy": 0.8469676226377487, "num_tokens": 808606494.0, "step": 25336 }, { "entropy": 0.5383511018007994, "epoch": 2.331130930816959, "grad_norm": 0.16243354976177216, "learning_rate": 2.2298892875762874e-05, "loss": 0.5218, "mean_token_accuracy": 0.8356500826776028, "num_tokens": 808638252.0, "step": 25337 }, { "entropy": 0.5903336480259895, "epoch": 2.3312229371884, "grad_norm": 0.16714531183242798, "learning_rate": 2.229582604962125e-05, "loss": 0.58, "mean_token_accuracy": 0.816331047564745, "num_tokens": 808670261.0, "step": 25338 }, { "entropy": 0.5442987084388733, "epoch": 2.3313149435598417, "grad_norm": 0.1654207557439804, "learning_rate": 2.2292759223479623e-05, "loss": 0.529, "mean_token_accuracy": 0.8294319473206997, "num_tokens": 808701414.0, "step": 25339 }, { "entropy": 0.45419708639383316, "epoch": 2.331406949931283, "grad_norm": 0.15650704503059387, "learning_rate": 2.2289692397337998e-05, "loss": 0.4451, "mean_token_accuracy": 0.8606525361537933, "num_tokens": 808733469.0, "step": 25340 }, { "entropy": 0.5726649798452854, "epoch": 2.331498956302724, "grad_norm": 0.16959552466869354, "learning_rate": 2.228662557119637e-05, "loss": 0.5549, "mean_token_accuracy": 0.8255394995212555, "num_tokens": 808765394.0, "step": 25341 }, { "entropy": 0.6474495809525251, "epoch": 2.331590962674165, "grad_norm": 0.1769135296344757, "learning_rate": 2.2283558745054744e-05, "loss": 0.6354, "mean_token_accuracy": 0.8012820519506931, "num_tokens": 808796782.0, "step": 25342 }, { "entropy": 0.5383284753188491, "epoch": 2.3316829690456062, "grad_norm": 0.1604040414094925, "learning_rate": 2.228049191891312e-05, "loss": 0.5293, "mean_token_accuracy": 0.835674699395895, "num_tokens": 808829076.0, "step": 25343 }, { "entropy": 0.5642052702605724, "epoch": 2.331774975417048, "grad_norm": 0.1644805669784546, "learning_rate": 2.2277425092771493e-05, "loss": 0.545, "mean_token_accuracy": 0.8250079825520515, "num_tokens": 808861455.0, "step": 25344 }, { "entropy": 0.5498912213370204, "epoch": 2.331866981788489, "grad_norm": 0.1664866954088211, "learning_rate": 2.2274358266629864e-05, "loss": 0.5394, "mean_token_accuracy": 0.829914141446352, "num_tokens": 808893518.0, "step": 25345 }, { "entropy": 0.514979163184762, "epoch": 2.33195898815993, "grad_norm": 0.16262291371822357, "learning_rate": 2.227129144048824e-05, "loss": 0.5041, "mean_token_accuracy": 0.8392904661595821, "num_tokens": 808925504.0, "step": 25346 }, { "entropy": 0.44679208798334, "epoch": 2.332050994531371, "grad_norm": 0.15193161368370056, "learning_rate": 2.2268224614346614e-05, "loss": 0.4291, "mean_token_accuracy": 0.8596961908042431, "num_tokens": 808956983.0, "step": 25347 }, { "entropy": 0.5265334276482463, "epoch": 2.3321430009028123, "grad_norm": 0.1626061499118805, "learning_rate": 2.226515778820499e-05, "loss": 0.5206, "mean_token_accuracy": 0.8345176242291927, "num_tokens": 808988507.0, "step": 25348 }, { "entropy": 0.6713176537305117, "epoch": 2.332235007274254, "grad_norm": 0.17828331887722015, "learning_rate": 2.2262090962063363e-05, "loss": 0.6505, "mean_token_accuracy": 0.7966595105826855, "num_tokens": 809020676.0, "step": 25349 }, { "entropy": 0.4456854937598109, "epoch": 2.332327013645695, "grad_norm": 0.15659014880657196, "learning_rate": 2.2259024135921734e-05, "loss": 0.4374, "mean_token_accuracy": 0.8563956245779991, "num_tokens": 809053166.0, "step": 25350 }, { "entropy": 0.5930092064663768, "epoch": 2.332419020017136, "grad_norm": 0.1771264374256134, "learning_rate": 2.225595730978011e-05, "loss": 0.5741, "mean_token_accuracy": 0.8199868462979794, "num_tokens": 809084763.0, "step": 25351 }, { "entropy": 0.517909569432959, "epoch": 2.3325110263885773, "grad_norm": 0.15808482468128204, "learning_rate": 2.2252890483638484e-05, "loss": 0.5021, "mean_token_accuracy": 0.8414645977318287, "num_tokens": 809116452.0, "step": 25352 }, { "entropy": 0.5196388768963516, "epoch": 2.3326030327600185, "grad_norm": 0.16216881573200226, "learning_rate": 2.2249823657496858e-05, "loss": 0.5006, "mean_token_accuracy": 0.8424673825502396, "num_tokens": 809147859.0, "step": 25353 }, { "entropy": 0.5933863110840321, "epoch": 2.33269503913146, "grad_norm": 0.16252820193767548, "learning_rate": 2.224675683135523e-05, "loss": 0.5791, "mean_token_accuracy": 0.8159246481955051, "num_tokens": 809179983.0, "step": 25354 }, { "entropy": 0.5924408752471209, "epoch": 2.332787045502901, "grad_norm": 0.17183955013751984, "learning_rate": 2.2243690005213604e-05, "loss": 0.5885, "mean_token_accuracy": 0.8159428536891937, "num_tokens": 809211887.0, "step": 25355 }, { "entropy": 0.4902804708108306, "epoch": 2.3328790518743423, "grad_norm": 0.1584063172340393, "learning_rate": 2.224062317907198e-05, "loss": 0.4814, "mean_token_accuracy": 0.8458381555974483, "num_tokens": 809243399.0, "step": 25356 }, { "entropy": 0.5489346319809556, "epoch": 2.3329710582457834, "grad_norm": 0.16161008179187775, "learning_rate": 2.2237556352930353e-05, "loss": 0.5335, "mean_token_accuracy": 0.8309973515570164, "num_tokens": 809275028.0, "step": 25357 }, { "entropy": 0.4841193223837763, "epoch": 2.3330630646172246, "grad_norm": 0.15996302664279938, "learning_rate": 2.2234489526788728e-05, "loss": 0.4746, "mean_token_accuracy": 0.8467593230307102, "num_tokens": 809306659.0, "step": 25358 }, { "entropy": 0.509845266584307, "epoch": 2.333155070988666, "grad_norm": 0.15811485052108765, "learning_rate": 2.22314227006471e-05, "loss": 0.5047, "mean_token_accuracy": 0.8421486653387547, "num_tokens": 809338421.0, "step": 25359 }, { "entropy": 0.5511269182898104, "epoch": 2.3332470773601073, "grad_norm": 0.16930364072322845, "learning_rate": 2.2228355874505474e-05, "loss": 0.5461, "mean_token_accuracy": 0.8281344510614872, "num_tokens": 809370595.0, "step": 25360 }, { "entropy": 0.5358506661141291, "epoch": 2.3333390837315484, "grad_norm": 0.16399674117565155, "learning_rate": 2.222528904836385e-05, "loss": 0.519, "mean_token_accuracy": 0.8380574956536293, "num_tokens": 809402535.0, "step": 25361 }, { "entropy": 0.5191839272156358, "epoch": 2.3334310901029895, "grad_norm": 0.16718804836273193, "learning_rate": 2.2222222222222223e-05, "loss": 0.5007, "mean_token_accuracy": 0.838709183037281, "num_tokens": 809434340.0, "step": 25362 }, { "entropy": 0.501044737175107, "epoch": 2.3335230964744307, "grad_norm": 0.15425239503383636, "learning_rate": 2.2219155396080595e-05, "loss": 0.485, "mean_token_accuracy": 0.8459467440843582, "num_tokens": 809466781.0, "step": 25363 }, { "entropy": 0.5082686692476273, "epoch": 2.3336151028458723, "grad_norm": 0.15831731259822845, "learning_rate": 2.2216088569938973e-05, "loss": 0.4978, "mean_token_accuracy": 0.8415742330253124, "num_tokens": 809499090.0, "step": 25364 }, { "entropy": 0.5153149180114269, "epoch": 2.3337071092173134, "grad_norm": 0.16209851205348969, "learning_rate": 2.2213021743797347e-05, "loss": 0.5116, "mean_token_accuracy": 0.8381311967968941, "num_tokens": 809530582.0, "step": 25365 }, { "entropy": 0.43162071448750794, "epoch": 2.3337991155887545, "grad_norm": 0.14309921860694885, "learning_rate": 2.2209954917655722e-05, "loss": 0.4186, "mean_token_accuracy": 0.8683476746082306, "num_tokens": 809563277.0, "step": 25366 }, { "entropy": 0.5854429062455893, "epoch": 2.3338911219601957, "grad_norm": 0.16789411008358002, "learning_rate": 2.2206888091514093e-05, "loss": 0.574, "mean_token_accuracy": 0.8204487711191177, "num_tokens": 809594721.0, "step": 25367 }, { "entropy": 0.5583984591066837, "epoch": 2.333983128331637, "grad_norm": 0.17682942748069763, "learning_rate": 2.2203821265372468e-05, "loss": 0.5509, "mean_token_accuracy": 0.827939223498106, "num_tokens": 809625191.0, "step": 25368 }, { "entropy": 0.4724930548109114, "epoch": 2.3340751347030784, "grad_norm": 0.1547667235136032, "learning_rate": 2.2200754439230842e-05, "loss": 0.4613, "mean_token_accuracy": 0.85739840939641, "num_tokens": 809656911.0, "step": 25369 }, { "entropy": 0.49017384089529514, "epoch": 2.3341671410745195, "grad_norm": 0.15827412903308868, "learning_rate": 2.2197687613089217e-05, "loss": 0.4735, "mean_token_accuracy": 0.8467213846743107, "num_tokens": 809688767.0, "step": 25370 }, { "entropy": 0.5495691411197186, "epoch": 2.3342591474459606, "grad_norm": 0.1615716964006424, "learning_rate": 2.219462078694759e-05, "loss": 0.5293, "mean_token_accuracy": 0.8338403254747391, "num_tokens": 809720731.0, "step": 25371 }, { "entropy": 0.47419248055666685, "epoch": 2.3343511538174018, "grad_norm": 0.15711133182048798, "learning_rate": 2.2191553960805963e-05, "loss": 0.4609, "mean_token_accuracy": 0.8539056032896042, "num_tokens": 809752150.0, "step": 25372 }, { "entropy": 0.5296588987112045, "epoch": 2.334443160188843, "grad_norm": 0.1701837033033371, "learning_rate": 2.2188487134664338e-05, "loss": 0.5144, "mean_token_accuracy": 0.839866403490305, "num_tokens": 809783345.0, "step": 25373 }, { "entropy": 0.5614342270419002, "epoch": 2.3345351665602845, "grad_norm": 0.16531306505203247, "learning_rate": 2.2185420308522712e-05, "loss": 0.5505, "mean_token_accuracy": 0.8242644406855106, "num_tokens": 809815202.0, "step": 25374 }, { "entropy": 0.48042873200029135, "epoch": 2.3346271729317256, "grad_norm": 0.1559966802597046, "learning_rate": 2.2182353482381087e-05, "loss": 0.4681, "mean_token_accuracy": 0.8495835177600384, "num_tokens": 809846966.0, "step": 25375 }, { "entropy": 0.5087133548222482, "epoch": 2.3347191793031667, "grad_norm": 0.15831904113292694, "learning_rate": 2.2179286656239458e-05, "loss": 0.4966, "mean_token_accuracy": 0.8448728993535042, "num_tokens": 809879123.0, "step": 25376 }, { "entropy": 0.4935970762744546, "epoch": 2.334811185674608, "grad_norm": 0.15882745385169983, "learning_rate": 2.2176219830097833e-05, "loss": 0.486, "mean_token_accuracy": 0.8468896709382534, "num_tokens": 809910907.0, "step": 25377 }, { "entropy": 0.5879342462867498, "epoch": 2.334903192046049, "grad_norm": 0.1708189696073532, "learning_rate": 2.2173153003956207e-05, "loss": 0.5734, "mean_token_accuracy": 0.8189339265227318, "num_tokens": 809942580.0, "step": 25378 }, { "entropy": 0.661884868517518, "epoch": 2.3349951984174906, "grad_norm": 0.17488619685173035, "learning_rate": 2.2170086177814582e-05, "loss": 0.6476, "mean_token_accuracy": 0.8001497387886047, "num_tokens": 809974892.0, "step": 25379 }, { "entropy": 0.5646666269749403, "epoch": 2.3350872047889317, "grad_norm": 0.16706274449825287, "learning_rate": 2.2167019351672953e-05, "loss": 0.5471, "mean_token_accuracy": 0.8231784962117672, "num_tokens": 810006408.0, "step": 25380 }, { "entropy": 0.42927661957219243, "epoch": 2.335179211160373, "grad_norm": 0.15657413005828857, "learning_rate": 2.2163952525531328e-05, "loss": 0.4141, "mean_token_accuracy": 0.8687731809914112, "num_tokens": 810038748.0, "step": 25381 }, { "entropy": 0.3863818140234798, "epoch": 2.335271217531814, "grad_norm": 0.146961510181427, "learning_rate": 2.2160885699389703e-05, "loss": 0.3837, "mean_token_accuracy": 0.8756027743220329, "num_tokens": 810070160.0, "step": 25382 }, { "entropy": 0.5541303360369056, "epoch": 2.335363223903255, "grad_norm": 0.16087929904460907, "learning_rate": 2.2157818873248077e-05, "loss": 0.5409, "mean_token_accuracy": 0.831233125180006, "num_tokens": 810102467.0, "step": 25383 }, { "entropy": 0.5994098596274853, "epoch": 2.3354552302746967, "grad_norm": 0.17329667508602142, "learning_rate": 2.215475204710645e-05, "loss": 0.5964, "mean_token_accuracy": 0.8143153078854084, "num_tokens": 810134130.0, "step": 25384 }, { "entropy": 0.5080065354704857, "epoch": 2.335547236646138, "grad_norm": 0.16281749308109283, "learning_rate": 2.2151685220964823e-05, "loss": 0.4859, "mean_token_accuracy": 0.8428653217852116, "num_tokens": 810165292.0, "step": 25385 }, { "entropy": 0.5478651546873152, "epoch": 2.335639243017579, "grad_norm": 0.1620418280363083, "learning_rate": 2.2148618394823198e-05, "loss": 0.5368, "mean_token_accuracy": 0.8291626311838627, "num_tokens": 810197670.0, "step": 25386 }, { "entropy": 0.5432215761393309, "epoch": 2.33573124938902, "grad_norm": 0.16133522987365723, "learning_rate": 2.2145551568681573e-05, "loss": 0.5418, "mean_token_accuracy": 0.8310026824474335, "num_tokens": 810230438.0, "step": 25387 }, { "entropy": 0.5593562228605151, "epoch": 2.3358232557604612, "grad_norm": 0.16469722986221313, "learning_rate": 2.2142484742539947e-05, "loss": 0.5506, "mean_token_accuracy": 0.8262763693928719, "num_tokens": 810261890.0, "step": 25388 }, { "entropy": 0.5262035776395351, "epoch": 2.335915262131903, "grad_norm": 0.162392720580101, "learning_rate": 2.213941791639832e-05, "loss": 0.5113, "mean_token_accuracy": 0.8388334214687347, "num_tokens": 810293768.0, "step": 25389 }, { "entropy": 0.5778560787439346, "epoch": 2.336007268503344, "grad_norm": 0.164114847779274, "learning_rate": 2.2136351090256693e-05, "loss": 0.5609, "mean_token_accuracy": 0.8216534145176411, "num_tokens": 810325200.0, "step": 25390 }, { "entropy": 0.6122992150485516, "epoch": 2.336099274874785, "grad_norm": 0.1751924455165863, "learning_rate": 2.2133284264115068e-05, "loss": 0.6049, "mean_token_accuracy": 0.807255070656538, "num_tokens": 810356275.0, "step": 25391 }, { "entropy": 0.559012109413743, "epoch": 2.336191281246226, "grad_norm": 0.16548509895801544, "learning_rate": 2.2130217437973442e-05, "loss": 0.5366, "mean_token_accuracy": 0.8277681022882462, "num_tokens": 810386808.0, "step": 25392 }, { "entropy": 0.5149222216568887, "epoch": 2.3362832876176673, "grad_norm": 0.1554878056049347, "learning_rate": 2.2127150611831814e-05, "loss": 0.5029, "mean_token_accuracy": 0.8422015905380249, "num_tokens": 810419165.0, "step": 25393 }, { "entropy": 0.530878460034728, "epoch": 2.336375293989109, "grad_norm": 0.1633700132369995, "learning_rate": 2.2124083785690188e-05, "loss": 0.5239, "mean_token_accuracy": 0.8351241610944271, "num_tokens": 810451585.0, "step": 25394 }, { "entropy": 0.661050459370017, "epoch": 2.33646730036055, "grad_norm": 0.17766764760017395, "learning_rate": 2.2121016959548566e-05, "loss": 0.6541, "mean_token_accuracy": 0.7957199364900589, "num_tokens": 810483480.0, "step": 25395 }, { "entropy": 0.49432891327887774, "epoch": 2.336559306731991, "grad_norm": 0.16211602091789246, "learning_rate": 2.211795013340694e-05, "loss": 0.4802, "mean_token_accuracy": 0.8497466035187244, "num_tokens": 810515221.0, "step": 25396 }, { "entropy": 0.6577170696109533, "epoch": 2.3366513131034323, "grad_norm": 0.17422159016132355, "learning_rate": 2.2114883307265312e-05, "loss": 0.6354, "mean_token_accuracy": 0.80268394947052, "num_tokens": 810546936.0, "step": 25397 }, { "entropy": 0.47450566850602627, "epoch": 2.3367433194748735, "grad_norm": 0.15509864687919617, "learning_rate": 2.2111816481123687e-05, "loss": 0.4628, "mean_token_accuracy": 0.8525736704468727, "num_tokens": 810579039.0, "step": 25398 }, { "entropy": 0.5263293832540512, "epoch": 2.336835325846315, "grad_norm": 0.1551290899515152, "learning_rate": 2.210874965498206e-05, "loss": 0.5051, "mean_token_accuracy": 0.8410601131618023, "num_tokens": 810610896.0, "step": 25399 }, { "entropy": 0.5451594609767199, "epoch": 2.336927332217756, "grad_norm": 0.16618581116199493, "learning_rate": 2.2105682828840436e-05, "loss": 0.5274, "mean_token_accuracy": 0.8338431306183338, "num_tokens": 810643133.0, "step": 25400 }, { "entropy": 0.6198538462631404, "epoch": 2.3370193385891973, "grad_norm": 0.1716468185186386, "learning_rate": 2.2102616002698807e-05, "loss": 0.6001, "mean_token_accuracy": 0.8098901100456715, "num_tokens": 810674454.0, "step": 25401 }, { "entropy": 0.4519251622259617, "epoch": 2.3371113449606384, "grad_norm": 0.15167509019374847, "learning_rate": 2.2099549176557182e-05, "loss": 0.4412, "mean_token_accuracy": 0.8592911139130592, "num_tokens": 810706545.0, "step": 25402 }, { "entropy": 0.5339863658882678, "epoch": 2.3372033513320796, "grad_norm": 0.1649412363767624, "learning_rate": 2.2096482350415557e-05, "loss": 0.5174, "mean_token_accuracy": 0.8351983316242695, "num_tokens": 810738677.0, "step": 25403 }, { "entropy": 0.4812779682688415, "epoch": 2.337295357703521, "grad_norm": 0.15745431184768677, "learning_rate": 2.209341552427393e-05, "loss": 0.4689, "mean_token_accuracy": 0.8551194258034229, "num_tokens": 810770520.0, "step": 25404 }, { "entropy": 0.5391188897192478, "epoch": 2.3373873640749623, "grad_norm": 0.16303743422031403, "learning_rate": 2.2090348698132306e-05, "loss": 0.53, "mean_token_accuracy": 0.8308138214051723, "num_tokens": 810802343.0, "step": 25405 }, { "entropy": 0.5197692699730396, "epoch": 2.3374793704464034, "grad_norm": 0.15881691873073578, "learning_rate": 2.2087281871990677e-05, "loss": 0.5093, "mean_token_accuracy": 0.8400153405964375, "num_tokens": 810834668.0, "step": 25406 }, { "entropy": 0.42456015234347433, "epoch": 2.3375713768178445, "grad_norm": 0.15566720068454742, "learning_rate": 2.2084215045849052e-05, "loss": 0.4122, "mean_token_accuracy": 0.868404284119606, "num_tokens": 810866906.0, "step": 25407 }, { "entropy": 0.5600406974554062, "epoch": 2.3376633831892857, "grad_norm": 0.16733990609645844, "learning_rate": 2.2081148219707427e-05, "loss": 0.5514, "mean_token_accuracy": 0.8253092244267464, "num_tokens": 810898928.0, "step": 25408 }, { "entropy": 0.5697155520319939, "epoch": 2.3377553895607273, "grad_norm": 0.16769443452358246, "learning_rate": 2.20780813935658e-05, "loss": 0.56, "mean_token_accuracy": 0.8209701664745808, "num_tokens": 810930936.0, "step": 25409 }, { "entropy": 0.5508955083787441, "epoch": 2.3378473959321684, "grad_norm": 0.1737731546163559, "learning_rate": 2.2075014567424172e-05, "loss": 0.5336, "mean_token_accuracy": 0.828195258975029, "num_tokens": 810961992.0, "step": 25410 }, { "entropy": 0.3904349207878113, "epoch": 2.3379394023036095, "grad_norm": 0.14454500377178192, "learning_rate": 2.2071947741282547e-05, "loss": 0.3828, "mean_token_accuracy": 0.8799998946487904, "num_tokens": 810994372.0, "step": 25411 }, { "entropy": 0.49359708873089403, "epoch": 2.3380314086750507, "grad_norm": 0.15281426906585693, "learning_rate": 2.2068880915140922e-05, "loss": 0.4729, "mean_token_accuracy": 0.8473955243825912, "num_tokens": 811026534.0, "step": 25412 }, { "entropy": 0.5524979662150145, "epoch": 2.338123415046492, "grad_norm": 0.16228929162025452, "learning_rate": 2.2065814088999296e-05, "loss": 0.5448, "mean_token_accuracy": 0.8275744095444679, "num_tokens": 811058779.0, "step": 25413 }, { "entropy": 0.44330946961417794, "epoch": 2.3382154214179334, "grad_norm": 0.15368399024009705, "learning_rate": 2.2062747262857668e-05, "loss": 0.4269, "mean_token_accuracy": 0.8616804853081703, "num_tokens": 811090210.0, "step": 25414 }, { "entropy": 0.5080028939992189, "epoch": 2.3383074277893745, "grad_norm": 0.1572154015302658, "learning_rate": 2.2059680436716042e-05, "loss": 0.5036, "mean_token_accuracy": 0.8395472019910812, "num_tokens": 811122156.0, "step": 25415 }, { "entropy": 0.541153128258884, "epoch": 2.3383994341608156, "grad_norm": 0.1660388708114624, "learning_rate": 2.2056613610574417e-05, "loss": 0.5317, "mean_token_accuracy": 0.8290988095104694, "num_tokens": 811153268.0, "step": 25416 }, { "entropy": 0.5438232850283384, "epoch": 2.3384914405322568, "grad_norm": 0.1609288454055786, "learning_rate": 2.205354678443279e-05, "loss": 0.5313, "mean_token_accuracy": 0.831424206495285, "num_tokens": 811185342.0, "step": 25417 }, { "entropy": 0.4951083578635007, "epoch": 2.338583446903698, "grad_norm": 0.1562614142894745, "learning_rate": 2.2050479958291166e-05, "loss": 0.4757, "mean_token_accuracy": 0.8472444824874401, "num_tokens": 811216640.0, "step": 25418 }, { "entropy": 0.540538027882576, "epoch": 2.3386754532751395, "grad_norm": 0.16533933579921722, "learning_rate": 2.2047413132149538e-05, "loss": 0.5241, "mean_token_accuracy": 0.831847008317709, "num_tokens": 811248230.0, "step": 25419 }, { "entropy": 0.46537014364730567, "epoch": 2.3387674596465806, "grad_norm": 0.15307505428791046, "learning_rate": 2.2044346306007912e-05, "loss": 0.4594, "mean_token_accuracy": 0.8551991395652294, "num_tokens": 811280278.0, "step": 25420 }, { "entropy": 0.5274637173861265, "epoch": 2.3388594660180217, "grad_norm": 0.16397203505039215, "learning_rate": 2.2041279479866287e-05, "loss": 0.5142, "mean_token_accuracy": 0.8382059410214424, "num_tokens": 811312293.0, "step": 25421 }, { "entropy": 0.43726425245404243, "epoch": 2.338951472389463, "grad_norm": 0.14984266459941864, "learning_rate": 2.203821265372466e-05, "loss": 0.4267, "mean_token_accuracy": 0.8659623898565769, "num_tokens": 811345061.0, "step": 25422 }, { "entropy": 0.5168485045433044, "epoch": 2.339043478760904, "grad_norm": 0.1667502373456955, "learning_rate": 2.2035145827583033e-05, "loss": 0.5055, "mean_token_accuracy": 0.8407119363546371, "num_tokens": 811375793.0, "step": 25423 }, { "entropy": 0.5930346995592117, "epoch": 2.3391354851323456, "grad_norm": 0.1653212606906891, "learning_rate": 2.2032079001441407e-05, "loss": 0.5728, "mean_token_accuracy": 0.8171431235969067, "num_tokens": 811407945.0, "step": 25424 }, { "entropy": 0.49350348860025406, "epoch": 2.3392274915037867, "grad_norm": 0.1610638052225113, "learning_rate": 2.2029012175299785e-05, "loss": 0.4709, "mean_token_accuracy": 0.8530236631631851, "num_tokens": 811439992.0, "step": 25425 }, { "entropy": 0.5119087938219309, "epoch": 2.339319497875228, "grad_norm": 0.15948383510112762, "learning_rate": 2.202594534915816e-05, "loss": 0.509, "mean_token_accuracy": 0.8398580774664879, "num_tokens": 811471891.0, "step": 25426 }, { "entropy": 0.499005775898695, "epoch": 2.339411504246669, "grad_norm": 0.15573816001415253, "learning_rate": 2.202287852301653e-05, "loss": 0.4968, "mean_token_accuracy": 0.8448676876723766, "num_tokens": 811503862.0, "step": 25427 }, { "entropy": 0.49761854857206345, "epoch": 2.33950351061811, "grad_norm": 0.1672133058309555, "learning_rate": 2.2019811696874906e-05, "loss": 0.5043, "mean_token_accuracy": 0.8427280634641647, "num_tokens": 811536251.0, "step": 25428 }, { "entropy": 0.5498074200004339, "epoch": 2.3395955169895517, "grad_norm": 0.1738906353712082, "learning_rate": 2.201674487073328e-05, "loss": 0.5487, "mean_token_accuracy": 0.8275480717420578, "num_tokens": 811568956.0, "step": 25429 }, { "entropy": 0.41655429173260927, "epoch": 2.339687523360993, "grad_norm": 0.14953108131885529, "learning_rate": 2.2013678044591655e-05, "loss": 0.4036, "mean_token_accuracy": 0.8714198470115662, "num_tokens": 811600875.0, "step": 25430 }, { "entropy": 0.5338136777281761, "epoch": 2.339779529732434, "grad_norm": 0.16223539412021637, "learning_rate": 2.2010611218450027e-05, "loss": 0.5142, "mean_token_accuracy": 0.8340826891362667, "num_tokens": 811632623.0, "step": 25431 }, { "entropy": 0.5747783575206995, "epoch": 2.339871536103875, "grad_norm": 0.17155613005161285, "learning_rate": 2.20075443923084e-05, "loss": 0.5653, "mean_token_accuracy": 0.8242207430303097, "num_tokens": 811663956.0, "step": 25432 }, { "entropy": 0.5507668852806091, "epoch": 2.3399635424753162, "grad_norm": 0.16591843962669373, "learning_rate": 2.2004477566166776e-05, "loss": 0.5266, "mean_token_accuracy": 0.8347701393067837, "num_tokens": 811695292.0, "step": 25433 }, { "entropy": 0.4765307195484638, "epoch": 2.340055548846758, "grad_norm": 0.15455569326877594, "learning_rate": 2.200141074002515e-05, "loss": 0.4556, "mean_token_accuracy": 0.8539902605116367, "num_tokens": 811727082.0, "step": 25434 }, { "entropy": 0.6213620640337467, "epoch": 2.340147555218199, "grad_norm": 0.17301611602306366, "learning_rate": 2.1998343913883525e-05, "loss": 0.5974, "mean_token_accuracy": 0.8117490820586681, "num_tokens": 811758286.0, "step": 25435 }, { "entropy": 0.5135159976780415, "epoch": 2.34023956158964, "grad_norm": 0.16138634085655212, "learning_rate": 2.1995277087741896e-05, "loss": 0.5039, "mean_token_accuracy": 0.8432753644883633, "num_tokens": 811790530.0, "step": 25436 }, { "entropy": 0.4588173530064523, "epoch": 2.340331567961081, "grad_norm": 0.15356647968292236, "learning_rate": 2.199221026160027e-05, "loss": 0.4493, "mean_token_accuracy": 0.858758557587862, "num_tokens": 811822867.0, "step": 25437 }, { "entropy": 0.535624336451292, "epoch": 2.3404235743325223, "grad_norm": 0.15989632904529572, "learning_rate": 2.1989143435458646e-05, "loss": 0.5284, "mean_token_accuracy": 0.8327978514134884, "num_tokens": 811854894.0, "step": 25438 }, { "entropy": 0.5066377860493958, "epoch": 2.340515580703964, "grad_norm": 0.15985655784606934, "learning_rate": 2.198607660931702e-05, "loss": 0.4905, "mean_token_accuracy": 0.8415816687047482, "num_tokens": 811886987.0, "step": 25439 }, { "entropy": 0.5810728194192052, "epoch": 2.340607587075405, "grad_norm": 0.17275995016098022, "learning_rate": 2.198300978317539e-05, "loss": 0.5656, "mean_token_accuracy": 0.823616623878479, "num_tokens": 811919460.0, "step": 25440 }, { "entropy": 0.5020916284993291, "epoch": 2.340699593446846, "grad_norm": 0.1567457914352417, "learning_rate": 2.1979942957033766e-05, "loss": 0.5022, "mean_token_accuracy": 0.8424880169332027, "num_tokens": 811951909.0, "step": 25441 }, { "entropy": 0.5182893760502338, "epoch": 2.3407915998182873, "grad_norm": 0.16413837671279907, "learning_rate": 2.197687613089214e-05, "loss": 0.5072, "mean_token_accuracy": 0.8377948887646198, "num_tokens": 811983519.0, "step": 25442 }, { "entropy": 0.5976263815537095, "epoch": 2.3408836061897285, "grad_norm": 0.17083729803562164, "learning_rate": 2.1973809304750516e-05, "loss": 0.5924, "mean_token_accuracy": 0.8131902106106281, "num_tokens": 812015837.0, "step": 25443 }, { "entropy": 0.5735164266079664, "epoch": 2.34097561256117, "grad_norm": 0.16816578805446625, "learning_rate": 2.1970742478608887e-05, "loss": 0.5715, "mean_token_accuracy": 0.8206540308892727, "num_tokens": 812047850.0, "step": 25444 }, { "entropy": 0.5177031904459, "epoch": 2.341067618932611, "grad_norm": 0.15826773643493652, "learning_rate": 2.196767565246726e-05, "loss": 0.5039, "mean_token_accuracy": 0.8379562273621559, "num_tokens": 812080185.0, "step": 25445 }, { "entropy": 0.6199878486804664, "epoch": 2.3411596253040523, "grad_norm": 0.1714019626379013, "learning_rate": 2.1964608826325636e-05, "loss": 0.6113, "mean_token_accuracy": 0.8069978058338165, "num_tokens": 812112131.0, "step": 25446 }, { "entropy": 0.5224768058396876, "epoch": 2.3412516316754934, "grad_norm": 0.16532304883003235, "learning_rate": 2.196154200018401e-05, "loss": 0.5123, "mean_token_accuracy": 0.8372174762189388, "num_tokens": 812142294.0, "step": 25447 }, { "entropy": 0.5454733148217201, "epoch": 2.3413436380469346, "grad_norm": 0.1639668196439743, "learning_rate": 2.1958475174042385e-05, "loss": 0.5406, "mean_token_accuracy": 0.8288232609629631, "num_tokens": 812174380.0, "step": 25448 }, { "entropy": 0.5418479833751917, "epoch": 2.341435644418376, "grad_norm": 0.1584101915359497, "learning_rate": 2.1955408347900757e-05, "loss": 0.5226, "mean_token_accuracy": 0.8346309699118137, "num_tokens": 812206361.0, "step": 25449 }, { "entropy": 0.5203007548116148, "epoch": 2.3415276507898173, "grad_norm": 0.16085536777973175, "learning_rate": 2.195234152175913e-05, "loss": 0.5165, "mean_token_accuracy": 0.8319733627140522, "num_tokens": 812238566.0, "step": 25450 }, { "entropy": 0.4998633998911828, "epoch": 2.3416196571612584, "grad_norm": 0.1556505560874939, "learning_rate": 2.1949274695617506e-05, "loss": 0.481, "mean_token_accuracy": 0.8480337485671043, "num_tokens": 812270495.0, "step": 25451 }, { "entropy": 0.4017998707713559, "epoch": 2.3417116635326995, "grad_norm": 0.1394970715045929, "learning_rate": 2.194620786947588e-05, "loss": 0.3807, "mean_token_accuracy": 0.8769436553120613, "num_tokens": 812302297.0, "step": 25452 }, { "entropy": 0.5944263525307178, "epoch": 2.3418036699041407, "grad_norm": 0.1681579202413559, "learning_rate": 2.1943141043334252e-05, "loss": 0.582, "mean_token_accuracy": 0.8182437345385551, "num_tokens": 812334181.0, "step": 25453 }, { "entropy": 0.42600085120648146, "epoch": 2.3418956762755823, "grad_norm": 0.14524385333061218, "learning_rate": 2.1940074217192626e-05, "loss": 0.4072, "mean_token_accuracy": 0.8663834519684315, "num_tokens": 812366115.0, "step": 25454 }, { "entropy": 0.5549150509759784, "epoch": 2.3419876826470234, "grad_norm": 0.16258782148361206, "learning_rate": 2.1937007391051e-05, "loss": 0.5439, "mean_token_accuracy": 0.8301172442734241, "num_tokens": 812398883.0, "step": 25455 }, { "entropy": 0.42173649184405804, "epoch": 2.3420796890184645, "grad_norm": 0.144321471452713, "learning_rate": 2.193394056490938e-05, "loss": 0.4096, "mean_token_accuracy": 0.8691992536187172, "num_tokens": 812430459.0, "step": 25456 }, { "entropy": 0.5079072220250964, "epoch": 2.3421716953899057, "grad_norm": 0.15350230038166046, "learning_rate": 2.193087373876775e-05, "loss": 0.4948, "mean_token_accuracy": 0.8424523696303368, "num_tokens": 812463227.0, "step": 25457 }, { "entropy": 0.5823821667581797, "epoch": 2.342263701761347, "grad_norm": 0.17033424973487854, "learning_rate": 2.1927806912626125e-05, "loss": 0.5782, "mean_token_accuracy": 0.818702831864357, "num_tokens": 812495181.0, "step": 25458 }, { "entropy": 0.5308910086750984, "epoch": 2.3423557081327884, "grad_norm": 0.1621832549571991, "learning_rate": 2.19247400864845e-05, "loss": 0.5271, "mean_token_accuracy": 0.8366891220211983, "num_tokens": 812527038.0, "step": 25459 }, { "entropy": 0.548253545537591, "epoch": 2.3424477145042295, "grad_norm": 0.1677302122116089, "learning_rate": 2.1921673260342874e-05, "loss": 0.5371, "mean_token_accuracy": 0.8302614837884903, "num_tokens": 812559574.0, "step": 25460 }, { "entropy": 0.5586397424340248, "epoch": 2.3425397208756706, "grad_norm": 0.17447374761104584, "learning_rate": 2.1918606434201246e-05, "loss": 0.5419, "mean_token_accuracy": 0.8244168795645237, "num_tokens": 812589056.0, "step": 25461 }, { "entropy": 0.4807878490537405, "epoch": 2.3426317272471118, "grad_norm": 0.16216105222702026, "learning_rate": 2.191553960805962e-05, "loss": 0.4833, "mean_token_accuracy": 0.8459464237093925, "num_tokens": 812621391.0, "step": 25462 }, { "entropy": 0.5951250642538071, "epoch": 2.342723733618553, "grad_norm": 0.16795437037944794, "learning_rate": 2.1912472781917995e-05, "loss": 0.592, "mean_token_accuracy": 0.81300925090909, "num_tokens": 812653615.0, "step": 25463 }, { "entropy": 0.540901679545641, "epoch": 2.3428157399899945, "grad_norm": 0.15949152410030365, "learning_rate": 2.190940595577637e-05, "loss": 0.5201, "mean_token_accuracy": 0.8353219628334045, "num_tokens": 812685842.0, "step": 25464 }, { "entropy": 0.6479253461584449, "epoch": 2.3429077463614356, "grad_norm": 0.18218378722667694, "learning_rate": 2.1906339129634744e-05, "loss": 0.6355, "mean_token_accuracy": 0.8030321076512337, "num_tokens": 812717335.0, "step": 25465 }, { "entropy": 0.6048780828714371, "epoch": 2.3429997527328768, "grad_norm": 0.16796055436134338, "learning_rate": 2.1903272303493115e-05, "loss": 0.5977, "mean_token_accuracy": 0.8125480636954308, "num_tokens": 812749515.0, "step": 25466 }, { "entropy": 0.5847743395715952, "epoch": 2.343091759104318, "grad_norm": 0.16210268437862396, "learning_rate": 2.190020547735149e-05, "loss": 0.5685, "mean_token_accuracy": 0.8220599256455898, "num_tokens": 812781825.0, "step": 25467 }, { "entropy": 0.5010995636694133, "epoch": 2.343183765475759, "grad_norm": 0.15597756206989288, "learning_rate": 2.1897138651209865e-05, "loss": 0.4955, "mean_token_accuracy": 0.8420792371034622, "num_tokens": 812813740.0, "step": 25468 }, { "entropy": 0.46909144427627325, "epoch": 2.3432757718472006, "grad_norm": 0.15258149802684784, "learning_rate": 2.189407182506824e-05, "loss": 0.4456, "mean_token_accuracy": 0.856033630669117, "num_tokens": 812845589.0, "step": 25469 }, { "entropy": 0.5849519092589617, "epoch": 2.3433677782186417, "grad_norm": 0.16907817125320435, "learning_rate": 2.189100499892661e-05, "loss": 0.5788, "mean_token_accuracy": 0.819702785462141, "num_tokens": 812878002.0, "step": 25470 }, { "entropy": 0.4791831113398075, "epoch": 2.343459784590083, "grad_norm": 0.15499307215213776, "learning_rate": 2.1887938172784985e-05, "loss": 0.4666, "mean_token_accuracy": 0.8488266356289387, "num_tokens": 812909744.0, "step": 25471 }, { "entropy": 0.5931985691422597, "epoch": 2.343551790961524, "grad_norm": 0.1661878526210785, "learning_rate": 2.188487134664336e-05, "loss": 0.5884, "mean_token_accuracy": 0.8178095668554306, "num_tokens": 812942272.0, "step": 25472 }, { "entropy": 0.4364624600857496, "epoch": 2.343643797332965, "grad_norm": 0.1471676379442215, "learning_rate": 2.1881804520501735e-05, "loss": 0.4212, "mean_token_accuracy": 0.8646317385137081, "num_tokens": 812974429.0, "step": 25473 }, { "entropy": 0.5968209709972143, "epoch": 2.3437358037044067, "grad_norm": 0.16855081915855408, "learning_rate": 2.1878737694360106e-05, "loss": 0.5866, "mean_token_accuracy": 0.814894150942564, "num_tokens": 813006050.0, "step": 25474 }, { "entropy": 0.46720799524337053, "epoch": 2.343827810075848, "grad_norm": 0.15784315764904022, "learning_rate": 2.187567086821848e-05, "loss": 0.4638, "mean_token_accuracy": 0.8521753400564194, "num_tokens": 813038005.0, "step": 25475 }, { "entropy": 0.5766229946166277, "epoch": 2.343919816447289, "grad_norm": 0.16480837762355804, "learning_rate": 2.1872604042076855e-05, "loss": 0.5537, "mean_token_accuracy": 0.8236271068453789, "num_tokens": 813069879.0, "step": 25476 }, { "entropy": 0.5192772122099996, "epoch": 2.34401182281873, "grad_norm": 0.16236136853694916, "learning_rate": 2.186953721593523e-05, "loss": 0.5018, "mean_token_accuracy": 0.8390846401453018, "num_tokens": 813101466.0, "step": 25477 }, { "entropy": 0.4606723878532648, "epoch": 2.3441038291901712, "grad_norm": 0.1524319350719452, "learning_rate": 2.1866470389793604e-05, "loss": 0.4503, "mean_token_accuracy": 0.8538313545286655, "num_tokens": 813133343.0, "step": 25478 }, { "entropy": 0.4967601280659437, "epoch": 2.344195835561613, "grad_norm": 0.16239438951015472, "learning_rate": 2.1863403563651976e-05, "loss": 0.4907, "mean_token_accuracy": 0.8446178585290909, "num_tokens": 813165547.0, "step": 25479 }, { "entropy": 0.41867832792922854, "epoch": 2.344287841933054, "grad_norm": 0.14488038420677185, "learning_rate": 2.186033673751035e-05, "loss": 0.4057, "mean_token_accuracy": 0.8691241145133972, "num_tokens": 813197629.0, "step": 25480 }, { "entropy": 0.5686537232249975, "epoch": 2.344379848304495, "grad_norm": 0.1667676866054535, "learning_rate": 2.1857269911368725e-05, "loss": 0.5615, "mean_token_accuracy": 0.826090432703495, "num_tokens": 813229091.0, "step": 25481 }, { "entropy": 0.5186142884194851, "epoch": 2.344471854675936, "grad_norm": 0.16285906732082367, "learning_rate": 2.18542030852271e-05, "loss": 0.5165, "mean_token_accuracy": 0.8337593525648117, "num_tokens": 813260911.0, "step": 25482 }, { "entropy": 0.4975816700607538, "epoch": 2.3445638610473774, "grad_norm": 0.16110311448574066, "learning_rate": 2.185113625908547e-05, "loss": 0.4782, "mean_token_accuracy": 0.8495219573378563, "num_tokens": 813291858.0, "step": 25483 }, { "entropy": 0.5528094246983528, "epoch": 2.344655867418819, "grad_norm": 0.16456927359104156, "learning_rate": 2.1848069432943846e-05, "loss": 0.547, "mean_token_accuracy": 0.8264799863100052, "num_tokens": 813324056.0, "step": 25484 }, { "entropy": 0.4648997550830245, "epoch": 2.34474787379026, "grad_norm": 0.15551625192165375, "learning_rate": 2.184500260680222e-05, "loss": 0.4573, "mean_token_accuracy": 0.8555510379374027, "num_tokens": 813356099.0, "step": 25485 }, { "entropy": 0.5076014376245439, "epoch": 2.344839880161701, "grad_norm": 0.16184164583683014, "learning_rate": 2.1841935780660598e-05, "loss": 0.4952, "mean_token_accuracy": 0.8434931002557278, "num_tokens": 813386974.0, "step": 25486 }, { "entropy": 0.5601502731442451, "epoch": 2.3449318865331423, "grad_norm": 0.16461370885372162, "learning_rate": 2.183886895451897e-05, "loss": 0.5417, "mean_token_accuracy": 0.8263065554201603, "num_tokens": 813418985.0, "step": 25487 }, { "entropy": 0.44750552135519683, "epoch": 2.3450238929045835, "grad_norm": 0.15027721226215363, "learning_rate": 2.1835802128377344e-05, "loss": 0.4305, "mean_token_accuracy": 0.8621895685791969, "num_tokens": 813451709.0, "step": 25488 }, { "entropy": 0.5464363377541304, "epoch": 2.345115899276025, "grad_norm": 0.1684400588274002, "learning_rate": 2.183273530223572e-05, "loss": 0.5281, "mean_token_accuracy": 0.8321278877556324, "num_tokens": 813483577.0, "step": 25489 }, { "entropy": 0.429918747395277, "epoch": 2.345207905647466, "grad_norm": 0.14907759428024292, "learning_rate": 2.1829668476094093e-05, "loss": 0.4145, "mean_token_accuracy": 0.866951160132885, "num_tokens": 813515318.0, "step": 25490 }, { "entropy": 0.5515653565526009, "epoch": 2.3452999120189073, "grad_norm": 0.16412052512168884, "learning_rate": 2.1826601649952465e-05, "loss": 0.5381, "mean_token_accuracy": 0.8276832774281502, "num_tokens": 813547927.0, "step": 25491 }, { "entropy": 0.49337410973384976, "epoch": 2.3453919183903484, "grad_norm": 0.1568285971879959, "learning_rate": 2.182353482381084e-05, "loss": 0.4781, "mean_token_accuracy": 0.8458174802362919, "num_tokens": 813579667.0, "step": 25492 }, { "entropy": 0.5295086628757417, "epoch": 2.3454839247617896, "grad_norm": 0.1575102061033249, "learning_rate": 2.1820467997669214e-05, "loss": 0.5229, "mean_token_accuracy": 0.837444469332695, "num_tokens": 813611643.0, "step": 25493 }, { "entropy": 0.538065099157393, "epoch": 2.345575931133231, "grad_norm": 0.1723933219909668, "learning_rate": 2.181740117152759e-05, "loss": 0.5356, "mean_token_accuracy": 0.8311313688755035, "num_tokens": 813642795.0, "step": 25494 }, { "entropy": 0.5819179248064756, "epoch": 2.3456679375046723, "grad_norm": 0.17238649725914001, "learning_rate": 2.1814334345385963e-05, "loss": 0.581, "mean_token_accuracy": 0.8195812441408634, "num_tokens": 813674826.0, "step": 25495 }, { "entropy": 0.504918853752315, "epoch": 2.3457599438761134, "grad_norm": 0.16363511979579926, "learning_rate": 2.1811267519244335e-05, "loss": 0.4902, "mean_token_accuracy": 0.8464325591921806, "num_tokens": 813706278.0, "step": 25496 }, { "entropy": 0.44699965324252844, "epoch": 2.3458519502475546, "grad_norm": 0.1540464162826538, "learning_rate": 2.180820069310271e-05, "loss": 0.4316, "mean_token_accuracy": 0.8659435659646988, "num_tokens": 813738413.0, "step": 25497 }, { "entropy": 0.4806839635130018, "epoch": 2.3459439566189957, "grad_norm": 0.1576417088508606, "learning_rate": 2.1805133866961084e-05, "loss": 0.466, "mean_token_accuracy": 0.8492762558162212, "num_tokens": 813770122.0, "step": 25498 }, { "entropy": 0.5260245096869767, "epoch": 2.3460359629904373, "grad_norm": 0.15833289921283722, "learning_rate": 2.180206704081946e-05, "loss": 0.4861, "mean_token_accuracy": 0.8439675159752369, "num_tokens": 813801452.0, "step": 25499 }, { "entropy": 0.45166791416704655, "epoch": 2.3461279693618784, "grad_norm": 0.157806396484375, "learning_rate": 2.179900021467783e-05, "loss": 0.4563, "mean_token_accuracy": 0.8558870479464531, "num_tokens": 813832875.0, "step": 25500 }, { "entropy": 0.5454323943704367, "epoch": 2.3462199757333195, "grad_norm": 0.16502529382705688, "learning_rate": 2.1795933388536204e-05, "loss": 0.5354, "mean_token_accuracy": 0.8300463147461414, "num_tokens": 813864819.0, "step": 25501 }, { "entropy": 0.5114821959286928, "epoch": 2.3463119821047607, "grad_norm": 0.15662096440792084, "learning_rate": 2.179286656239458e-05, "loss": 0.4963, "mean_token_accuracy": 0.8400674127042294, "num_tokens": 813896102.0, "step": 25502 }, { "entropy": 0.5863871518522501, "epoch": 2.346403988476202, "grad_norm": 0.1707482635974884, "learning_rate": 2.1789799736252954e-05, "loss": 0.5772, "mean_token_accuracy": 0.8152374438941479, "num_tokens": 813927884.0, "step": 25503 }, { "entropy": 0.5480751488357782, "epoch": 2.3464959948476434, "grad_norm": 0.15938855707645416, "learning_rate": 2.1786732910111325e-05, "loss": 0.533, "mean_token_accuracy": 0.8294633589684963, "num_tokens": 813959993.0, "step": 25504 }, { "entropy": 0.5175322098657489, "epoch": 2.3465880012190845, "grad_norm": 0.16832582652568817, "learning_rate": 2.17836660839697e-05, "loss": 0.5107, "mean_token_accuracy": 0.8397419862449169, "num_tokens": 813991485.0, "step": 25505 }, { "entropy": 0.49229856487363577, "epoch": 2.3466800075905256, "grad_norm": 0.16168928146362305, "learning_rate": 2.1780599257828074e-05, "loss": 0.4863, "mean_token_accuracy": 0.8445522449910641, "num_tokens": 814024079.0, "step": 25506 }, { "entropy": 0.4584890897385776, "epoch": 2.3467720139619668, "grad_norm": 0.15089643001556396, "learning_rate": 2.177753243168645e-05, "loss": 0.4346, "mean_token_accuracy": 0.8629095293581486, "num_tokens": 814056386.0, "step": 25507 }, { "entropy": 0.5919065279886127, "epoch": 2.346864020333408, "grad_norm": 0.16207517683506012, "learning_rate": 2.1774465605544824e-05, "loss": 0.5744, "mean_token_accuracy": 0.8202410787343979, "num_tokens": 814088800.0, "step": 25508 }, { "entropy": 0.5766503922641277, "epoch": 2.3469560267048495, "grad_norm": 0.166274756193161, "learning_rate": 2.1771398779403195e-05, "loss": 0.5572, "mean_token_accuracy": 0.8196210414171219, "num_tokens": 814120521.0, "step": 25509 }, { "entropy": 0.4965647291392088, "epoch": 2.3470480330762906, "grad_norm": 0.155220627784729, "learning_rate": 2.176833195326157e-05, "loss": 0.4929, "mean_token_accuracy": 0.8464587591588497, "num_tokens": 814152641.0, "step": 25510 }, { "entropy": 0.5957510583102703, "epoch": 2.3471400394477318, "grad_norm": 0.16803795099258423, "learning_rate": 2.1765265127119944e-05, "loss": 0.5842, "mean_token_accuracy": 0.8155211731791496, "num_tokens": 814184243.0, "step": 25511 }, { "entropy": 0.4789503887295723, "epoch": 2.347232045819173, "grad_norm": 0.15982306003570557, "learning_rate": 2.176219830097832e-05, "loss": 0.4703, "mean_token_accuracy": 0.8534240648150444, "num_tokens": 814214871.0, "step": 25512 }, { "entropy": 0.5084677087143064, "epoch": 2.347324052190614, "grad_norm": 0.1533605456352234, "learning_rate": 2.175913147483669e-05, "loss": 0.4967, "mean_token_accuracy": 0.8430599272251129, "num_tokens": 814247481.0, "step": 25513 }, { "entropy": 0.592767708003521, "epoch": 2.3474160585620556, "grad_norm": 0.17453302443027496, "learning_rate": 2.1756064648695065e-05, "loss": 0.5785, "mean_token_accuracy": 0.8209718130528927, "num_tokens": 814278566.0, "step": 25514 }, { "entropy": 0.4881215086206794, "epoch": 2.3475080649334967, "grad_norm": 0.16354061663150787, "learning_rate": 2.175299782255344e-05, "loss": 0.4777, "mean_token_accuracy": 0.8462105765938759, "num_tokens": 814309567.0, "step": 25515 }, { "entropy": 0.5215962994843721, "epoch": 2.347600071304938, "grad_norm": 0.16851472854614258, "learning_rate": 2.1749930996411814e-05, "loss": 0.5056, "mean_token_accuracy": 0.8378285691142082, "num_tokens": 814341699.0, "step": 25516 }, { "entropy": 0.48173865489661694, "epoch": 2.347692077676379, "grad_norm": 0.15348295867443085, "learning_rate": 2.174686417027019e-05, "loss": 0.4665, "mean_token_accuracy": 0.8547941297292709, "num_tokens": 814373809.0, "step": 25517 }, { "entropy": 0.4607549086213112, "epoch": 2.34778408404782, "grad_norm": 0.15383747220039368, "learning_rate": 2.1743797344128563e-05, "loss": 0.4478, "mean_token_accuracy": 0.8569968976080418, "num_tokens": 814405576.0, "step": 25518 }, { "entropy": 0.4503728412091732, "epoch": 2.3478760904192617, "grad_norm": 0.1508798748254776, "learning_rate": 2.1740730517986938e-05, "loss": 0.4282, "mean_token_accuracy": 0.8628590814769268, "num_tokens": 814437756.0, "step": 25519 }, { "entropy": 0.511397959664464, "epoch": 2.347968096790703, "grad_norm": 0.16012464463710785, "learning_rate": 2.1737663691845313e-05, "loss": 0.4877, "mean_token_accuracy": 0.8447330221533775, "num_tokens": 814468867.0, "step": 25520 }, { "entropy": 0.5165605563670397, "epoch": 2.348060103162144, "grad_norm": 0.1656806617975235, "learning_rate": 2.1734596865703684e-05, "loss": 0.5086, "mean_token_accuracy": 0.8389580100774765, "num_tokens": 814501288.0, "step": 25521 }, { "entropy": 0.5659691393375397, "epoch": 2.348152109533585, "grad_norm": 0.16268502175807953, "learning_rate": 2.173153003956206e-05, "loss": 0.552, "mean_token_accuracy": 0.8266013823449612, "num_tokens": 814533416.0, "step": 25522 }, { "entropy": 0.47721230145543814, "epoch": 2.3482441159050262, "grad_norm": 0.15361928939819336, "learning_rate": 2.1728463213420433e-05, "loss": 0.4749, "mean_token_accuracy": 0.8488469272851944, "num_tokens": 814565689.0, "step": 25523 }, { "entropy": 0.42556167021393776, "epoch": 2.348336122276468, "grad_norm": 0.14613181352615356, "learning_rate": 2.1725396387278808e-05, "loss": 0.4092, "mean_token_accuracy": 0.8679407723248005, "num_tokens": 814598440.0, "step": 25524 }, { "entropy": 0.47475553129334, "epoch": 2.348428128647909, "grad_norm": 0.16238601505756378, "learning_rate": 2.1722329561137182e-05, "loss": 0.4543, "mean_token_accuracy": 0.8514968678355217, "num_tokens": 814629646.0, "step": 25525 }, { "entropy": 0.5209665801376104, "epoch": 2.34852013501935, "grad_norm": 0.16322912275791168, "learning_rate": 2.1719262734995554e-05, "loss": 0.5105, "mean_token_accuracy": 0.8381665386259556, "num_tokens": 814661503.0, "step": 25526 }, { "entropy": 0.4956805529072881, "epoch": 2.348612141390791, "grad_norm": 0.16124330461025238, "learning_rate": 2.171619590885393e-05, "loss": 0.4952, "mean_token_accuracy": 0.8402320146560669, "num_tokens": 814693059.0, "step": 25527 }, { "entropy": 0.47757432656362653, "epoch": 2.3487041477622324, "grad_norm": 0.15168911218643188, "learning_rate": 2.1713129082712303e-05, "loss": 0.4674, "mean_token_accuracy": 0.8503033556044102, "num_tokens": 814725325.0, "step": 25528 }, { "entropy": 0.491467522457242, "epoch": 2.348796154133674, "grad_norm": 0.15819840133190155, "learning_rate": 2.1710062256570678e-05, "loss": 0.4772, "mean_token_accuracy": 0.8510497473180294, "num_tokens": 814757647.0, "step": 25529 }, { "entropy": 0.5125586902722716, "epoch": 2.348888160505115, "grad_norm": 0.15860676765441895, "learning_rate": 2.170699543042905e-05, "loss": 0.5016, "mean_token_accuracy": 0.8412727862596512, "num_tokens": 814789333.0, "step": 25530 }, { "entropy": 0.4345680670812726, "epoch": 2.348980166876556, "grad_norm": 0.15004311501979828, "learning_rate": 2.1703928604287424e-05, "loss": 0.4251, "mean_token_accuracy": 0.8621978163719177, "num_tokens": 814821717.0, "step": 25531 }, { "entropy": 0.4730522462632507, "epoch": 2.3490721732479973, "grad_norm": 0.15879642963409424, "learning_rate": 2.1700861778145798e-05, "loss": 0.4703, "mean_token_accuracy": 0.851311594247818, "num_tokens": 814853722.0, "step": 25532 }, { "entropy": 0.48284289706498384, "epoch": 2.3491641796194385, "grad_norm": 0.15561191737651825, "learning_rate": 2.1697794952004173e-05, "loss": 0.4706, "mean_token_accuracy": 0.8506996184587479, "num_tokens": 814885627.0, "step": 25533 }, { "entropy": 0.49128034338355064, "epoch": 2.34925618599088, "grad_norm": 0.1576792448759079, "learning_rate": 2.1694728125862544e-05, "loss": 0.4823, "mean_token_accuracy": 0.8460208922624588, "num_tokens": 814918173.0, "step": 25534 }, { "entropy": 0.5760758807882667, "epoch": 2.349348192362321, "grad_norm": 0.1724141240119934, "learning_rate": 2.169166129972092e-05, "loss": 0.5636, "mean_token_accuracy": 0.8246931992471218, "num_tokens": 814950030.0, "step": 25535 }, { "entropy": 0.47429997799918056, "epoch": 2.3494401987337623, "grad_norm": 0.15622468292713165, "learning_rate": 2.1688594473579293e-05, "loss": 0.4676, "mean_token_accuracy": 0.8498798124492168, "num_tokens": 814981339.0, "step": 25536 }, { "entropy": 0.5182853741571307, "epoch": 2.3495322051052034, "grad_norm": 0.16080935299396515, "learning_rate": 2.1685527647437668e-05, "loss": 0.4945, "mean_token_accuracy": 0.8387531638145447, "num_tokens": 815013185.0, "step": 25537 }, { "entropy": 0.482073143357411, "epoch": 2.3496242114766446, "grad_norm": 0.15685586631298065, "learning_rate": 2.1682460821296043e-05, "loss": 0.4657, "mean_token_accuracy": 0.8518820479512215, "num_tokens": 815045159.0, "step": 25538 }, { "entropy": 0.49934902880340815, "epoch": 2.349716217848086, "grad_norm": 0.1566418558359146, "learning_rate": 2.1679393995154414e-05, "loss": 0.4852, "mean_token_accuracy": 0.8424873054027557, "num_tokens": 815077428.0, "step": 25539 }, { "entropy": 0.5621266420930624, "epoch": 2.3498082242195273, "grad_norm": 0.16520380973815918, "learning_rate": 2.167632716901279e-05, "loss": 0.5406, "mean_token_accuracy": 0.8268767930567265, "num_tokens": 815109239.0, "step": 25540 }, { "entropy": 0.4683609385974705, "epoch": 2.3499002305909684, "grad_norm": 0.15029147267341614, "learning_rate": 2.1673260342871163e-05, "loss": 0.4486, "mean_token_accuracy": 0.8527080044150352, "num_tokens": 815141673.0, "step": 25541 }, { "entropy": 0.5546943414956331, "epoch": 2.3499922369624096, "grad_norm": 0.16309970617294312, "learning_rate": 2.1670193516729538e-05, "loss": 0.5348, "mean_token_accuracy": 0.8336633369326591, "num_tokens": 815173647.0, "step": 25542 }, { "entropy": 0.5259770657867193, "epoch": 2.3500842433338507, "grad_norm": 0.16887277364730835, "learning_rate": 2.166712669058791e-05, "loss": 0.5171, "mean_token_accuracy": 0.8369038291275501, "num_tokens": 815205197.0, "step": 25543 }, { "entropy": 0.4926290474832058, "epoch": 2.3501762497052923, "grad_norm": 0.15843896567821503, "learning_rate": 2.1664059864446284e-05, "loss": 0.4766, "mean_token_accuracy": 0.8489904142916203, "num_tokens": 815237319.0, "step": 25544 }, { "entropy": 0.48088109493255615, "epoch": 2.3502682560767334, "grad_norm": 0.15523850917816162, "learning_rate": 2.166099303830466e-05, "loss": 0.4657, "mean_token_accuracy": 0.8518723025918007, "num_tokens": 815268535.0, "step": 25545 }, { "entropy": 0.45389842335134745, "epoch": 2.3503602624481745, "grad_norm": 0.15607406198978424, "learning_rate": 2.1657926212163033e-05, "loss": 0.4393, "mean_token_accuracy": 0.8589620925486088, "num_tokens": 815301036.0, "step": 25546 }, { "entropy": 0.51224719802849, "epoch": 2.3504522688196157, "grad_norm": 0.1598283052444458, "learning_rate": 2.1654859386021408e-05, "loss": 0.5027, "mean_token_accuracy": 0.8421202674508095, "num_tokens": 815332764.0, "step": 25547 }, { "entropy": 0.4872558615170419, "epoch": 2.350544275191057, "grad_norm": 0.1564982831478119, "learning_rate": 2.1651792559879782e-05, "loss": 0.4745, "mean_token_accuracy": 0.8510568663477898, "num_tokens": 815364815.0, "step": 25548 }, { "entropy": 0.5222828332334757, "epoch": 2.3506362815624984, "grad_norm": 0.16078375279903412, "learning_rate": 2.1648725733738157e-05, "loss": 0.5213, "mean_token_accuracy": 0.8376134000718594, "num_tokens": 815396931.0, "step": 25549 }, { "entropy": 0.5678416937589645, "epoch": 2.3507282879339395, "grad_norm": 0.16722029447555542, "learning_rate": 2.164565890759653e-05, "loss": 0.5619, "mean_token_accuracy": 0.8236617892980576, "num_tokens": 815428765.0, "step": 25550 }, { "entropy": 0.5564559602644295, "epoch": 2.3508202943053806, "grad_norm": 0.16449666023254395, "learning_rate": 2.1642592081454903e-05, "loss": 0.5406, "mean_token_accuracy": 0.8328217566013336, "num_tokens": 815461189.0, "step": 25551 }, { "entropy": 0.6568860225379467, "epoch": 2.3509123006768218, "grad_norm": 0.18105565011501312, "learning_rate": 2.1639525255313278e-05, "loss": 0.6464, "mean_token_accuracy": 0.7991916909813881, "num_tokens": 815492685.0, "step": 25552 }, { "entropy": 0.5091654974967241, "epoch": 2.351004307048263, "grad_norm": 0.15962937474250793, "learning_rate": 2.1636458429171652e-05, "loss": 0.4924, "mean_token_accuracy": 0.8437994681298733, "num_tokens": 815525028.0, "step": 25553 }, { "entropy": 0.5127290720120072, "epoch": 2.3510963134197045, "grad_norm": 0.15479204058647156, "learning_rate": 2.1633391603030027e-05, "loss": 0.5022, "mean_token_accuracy": 0.8405519053339958, "num_tokens": 815557151.0, "step": 25554 }, { "entropy": 0.5216312250122428, "epoch": 2.3511883197911456, "grad_norm": 0.16369125247001648, "learning_rate": 2.16303247768884e-05, "loss": 0.512, "mean_token_accuracy": 0.8362464383244514, "num_tokens": 815587898.0, "step": 25555 }, { "entropy": 0.4512544125318527, "epoch": 2.3512803261625868, "grad_norm": 0.14999957382678986, "learning_rate": 2.1627257950746773e-05, "loss": 0.439, "mean_token_accuracy": 0.8572876080870628, "num_tokens": 815620365.0, "step": 25556 }, { "entropy": 0.5173904364928603, "epoch": 2.351372332534028, "grad_norm": 0.1531398445367813, "learning_rate": 2.1624191124605147e-05, "loss": 0.5122, "mean_token_accuracy": 0.8372313007712364, "num_tokens": 815653133.0, "step": 25557 }, { "entropy": 0.5663134381175041, "epoch": 2.351464338905469, "grad_norm": 0.17110680043697357, "learning_rate": 2.1621124298463522e-05, "loss": 0.5577, "mean_token_accuracy": 0.8219251595437527, "num_tokens": 815683968.0, "step": 25558 }, { "entropy": 0.5994828175753355, "epoch": 2.3515563452769106, "grad_norm": 0.1700032353401184, "learning_rate": 2.1618057472321897e-05, "loss": 0.5806, "mean_token_accuracy": 0.8138868138194084, "num_tokens": 815715592.0, "step": 25559 }, { "entropy": 0.6028104955330491, "epoch": 2.3516483516483517, "grad_norm": 0.17332342267036438, "learning_rate": 2.1614990646180268e-05, "loss": 0.5983, "mean_token_accuracy": 0.8103469535708427, "num_tokens": 815747399.0, "step": 25560 }, { "entropy": 0.46437558624893427, "epoch": 2.351740358019793, "grad_norm": 0.15734434127807617, "learning_rate": 2.1611923820038643e-05, "loss": 0.4576, "mean_token_accuracy": 0.8530928008258343, "num_tokens": 815779496.0, "step": 25561 }, { "entropy": 0.6076374407857656, "epoch": 2.351832364391234, "grad_norm": 0.17800669372081757, "learning_rate": 2.1608856993897017e-05, "loss": 0.5965, "mean_token_accuracy": 0.8121157363057137, "num_tokens": 815811242.0, "step": 25562 }, { "entropy": 0.6045909151434898, "epoch": 2.351924370762675, "grad_norm": 0.17616799473762512, "learning_rate": 2.1605790167755392e-05, "loss": 0.5988, "mean_token_accuracy": 0.8118979968130589, "num_tokens": 815842706.0, "step": 25563 }, { "entropy": 0.4663533801212907, "epoch": 2.3520163771341167, "grad_norm": 0.15826363861560822, "learning_rate": 2.1602723341613763e-05, "loss": 0.4576, "mean_token_accuracy": 0.8530286252498627, "num_tokens": 815874274.0, "step": 25564 }, { "entropy": 0.5749657060950994, "epoch": 2.352108383505558, "grad_norm": 0.16476579010486603, "learning_rate": 2.1599656515472138e-05, "loss": 0.5662, "mean_token_accuracy": 0.8197138495743275, "num_tokens": 815906434.0, "step": 25565 }, { "entropy": 0.5309097203426063, "epoch": 2.352200389876999, "grad_norm": 0.16898392140865326, "learning_rate": 2.1596589689330512e-05, "loss": 0.5233, "mean_token_accuracy": 0.837357122451067, "num_tokens": 815938046.0, "step": 25566 }, { "entropy": 0.43522981321439147, "epoch": 2.35229239624844, "grad_norm": 0.1541394144296646, "learning_rate": 2.1593522863188887e-05, "loss": 0.4198, "mean_token_accuracy": 0.8650204986333847, "num_tokens": 815970110.0, "step": 25567 }, { "entropy": 0.4052933019120246, "epoch": 2.3523844026198812, "grad_norm": 0.14180152118206024, "learning_rate": 2.1590456037047262e-05, "loss": 0.3875, "mean_token_accuracy": 0.8753866739571095, "num_tokens": 816002544.0, "step": 25568 }, { "entropy": 0.5516154859215021, "epoch": 2.352476408991323, "grad_norm": 0.16606026887893677, "learning_rate": 2.1587389210905633e-05, "loss": 0.5338, "mean_token_accuracy": 0.8358344919979572, "num_tokens": 816034626.0, "step": 25569 }, { "entropy": 0.6056702909991145, "epoch": 2.352568415362764, "grad_norm": 0.1668311506509781, "learning_rate": 2.1584322384764008e-05, "loss": 0.5869, "mean_token_accuracy": 0.818265225738287, "num_tokens": 816066660.0, "step": 25570 }, { "entropy": 0.4883196750888601, "epoch": 2.352660421734205, "grad_norm": 0.15798375010490417, "learning_rate": 2.1581255558622382e-05, "loss": 0.472, "mean_token_accuracy": 0.8503862135112286, "num_tokens": 816098492.0, "step": 25571 }, { "entropy": 0.5110103543847799, "epoch": 2.352752428105646, "grad_norm": 0.15466390550136566, "learning_rate": 2.1578188732480757e-05, "loss": 0.5043, "mean_token_accuracy": 0.8422628752887249, "num_tokens": 816131200.0, "step": 25572 }, { "entropy": 0.4767919606529176, "epoch": 2.3528444344770874, "grad_norm": 0.15888220071792603, "learning_rate": 2.1575121906339128e-05, "loss": 0.462, "mean_token_accuracy": 0.8547418713569641, "num_tokens": 816163572.0, "step": 25573 }, { "entropy": 0.5476997280493379, "epoch": 2.352936440848529, "grad_norm": 0.16318702697753906, "learning_rate": 2.1572055080197503e-05, "loss": 0.5332, "mean_token_accuracy": 0.8341124504804611, "num_tokens": 816195469.0, "step": 25574 }, { "entropy": 0.5669013652950525, "epoch": 2.35302844721997, "grad_norm": 0.16905243694782257, "learning_rate": 2.1568988254055878e-05, "loss": 0.5556, "mean_token_accuracy": 0.824676651507616, "num_tokens": 816226974.0, "step": 25575 }, { "entropy": 0.49102861247956753, "epoch": 2.353120453591411, "grad_norm": 0.15948379039764404, "learning_rate": 2.1565921427914252e-05, "loss": 0.4764, "mean_token_accuracy": 0.8489497527480125, "num_tokens": 816257993.0, "step": 25576 }, { "entropy": 0.5559776686131954, "epoch": 2.3532124599628523, "grad_norm": 0.1703823357820511, "learning_rate": 2.1562854601772627e-05, "loss": 0.5645, "mean_token_accuracy": 0.8217390589416027, "num_tokens": 816290541.0, "step": 25577 }, { "entropy": 0.4941693707369268, "epoch": 2.3533044663342935, "grad_norm": 0.15395547449588776, "learning_rate": 2.1559787775631e-05, "loss": 0.475, "mean_token_accuracy": 0.8487050831317902, "num_tokens": 816322879.0, "step": 25578 }, { "entropy": 0.5545475562103093, "epoch": 2.353396472705735, "grad_norm": 0.16893307864665985, "learning_rate": 2.1556720949489376e-05, "loss": 0.5444, "mean_token_accuracy": 0.8308612927794456, "num_tokens": 816354823.0, "step": 25579 }, { "entropy": 0.47842646134085953, "epoch": 2.353488479077176, "grad_norm": 0.1566786766052246, "learning_rate": 2.155365412334775e-05, "loss": 0.4614, "mean_token_accuracy": 0.8542296215891838, "num_tokens": 816386792.0, "step": 25580 }, { "entropy": 0.5240861345082521, "epoch": 2.3535804854486173, "grad_norm": 0.1621512770652771, "learning_rate": 2.1550587297206122e-05, "loss": 0.5093, "mean_token_accuracy": 0.841554056853056, "num_tokens": 816417915.0, "step": 25581 }, { "entropy": 0.4336992676835507, "epoch": 2.3536724918200584, "grad_norm": 0.14858101308345795, "learning_rate": 2.1547520471064497e-05, "loss": 0.4281, "mean_token_accuracy": 0.8604051545262337, "num_tokens": 816449582.0, "step": 25582 }, { "entropy": 0.5198017777875066, "epoch": 2.3537644981914996, "grad_norm": 0.16624000668525696, "learning_rate": 2.154445364492287e-05, "loss": 0.5128, "mean_token_accuracy": 0.8378312066197395, "num_tokens": 816481962.0, "step": 25583 }, { "entropy": 0.44757992774248123, "epoch": 2.353856504562941, "grad_norm": 0.14780934154987335, "learning_rate": 2.1541386818781246e-05, "loss": 0.4271, "mean_token_accuracy": 0.862838875502348, "num_tokens": 816513524.0, "step": 25584 }, { "entropy": 0.5664929980412126, "epoch": 2.3539485109343823, "grad_norm": 0.1639649122953415, "learning_rate": 2.153831999263962e-05, "loss": 0.5532, "mean_token_accuracy": 0.8272959515452385, "num_tokens": 816545916.0, "step": 25585 }, { "entropy": 0.582987162284553, "epoch": 2.3540405173058234, "grad_norm": 0.16679075360298157, "learning_rate": 2.1535253166497992e-05, "loss": 0.5684, "mean_token_accuracy": 0.8194297179579735, "num_tokens": 816578333.0, "step": 25586 }, { "entropy": 0.5221044742502272, "epoch": 2.3541325236772646, "grad_norm": 0.15885941684246063, "learning_rate": 2.1532186340356367e-05, "loss": 0.5091, "mean_token_accuracy": 0.8361896984279156, "num_tokens": 816610057.0, "step": 25587 }, { "entropy": 0.44473579013720155, "epoch": 2.3542245300487057, "grad_norm": 0.1488819569349289, "learning_rate": 2.152911951421474e-05, "loss": 0.4275, "mean_token_accuracy": 0.8619626276195049, "num_tokens": 816642825.0, "step": 25588 }, { "entropy": 0.5917569305747747, "epoch": 2.3543165364201473, "grad_norm": 0.16910360753536224, "learning_rate": 2.1526052688073116e-05, "loss": 0.5703, "mean_token_accuracy": 0.8195075578987598, "num_tokens": 816673935.0, "step": 25589 }, { "entropy": 0.4920499362051487, "epoch": 2.3544085427915884, "grad_norm": 0.1546858698129654, "learning_rate": 2.1522985861931487e-05, "loss": 0.4832, "mean_token_accuracy": 0.8429812155663967, "num_tokens": 816705699.0, "step": 25590 }, { "entropy": 0.5875488426536322, "epoch": 2.3545005491630295, "grad_norm": 0.1708909571170807, "learning_rate": 2.1519919035789862e-05, "loss": 0.5777, "mean_token_accuracy": 0.8203585632145405, "num_tokens": 816737839.0, "step": 25591 }, { "entropy": 0.4680969570763409, "epoch": 2.3545925555344707, "grad_norm": 0.15661120414733887, "learning_rate": 2.1516852209648236e-05, "loss": 0.4583, "mean_token_accuracy": 0.852925144135952, "num_tokens": 816769647.0, "step": 25592 }, { "entropy": 0.45414275932125747, "epoch": 2.354684561905912, "grad_norm": 0.14919233322143555, "learning_rate": 2.151378538350661e-05, "loss": 0.4491, "mean_token_accuracy": 0.8569858334958553, "num_tokens": 816802415.0, "step": 25593 }, { "entropy": 0.4731817925348878, "epoch": 2.3547765682773534, "grad_norm": 0.15471072494983673, "learning_rate": 2.1510718557364982e-05, "loss": 0.4698, "mean_token_accuracy": 0.8501587361097336, "num_tokens": 816834802.0, "step": 25594 }, { "entropy": 0.4534338731318712, "epoch": 2.3548685746487945, "grad_norm": 0.15989159047603607, "learning_rate": 2.1507651731223357e-05, "loss": 0.4417, "mean_token_accuracy": 0.857146292924881, "num_tokens": 816866650.0, "step": 25595 }, { "entropy": 0.5043223090469837, "epoch": 2.3549605810202356, "grad_norm": 0.15697763860225677, "learning_rate": 2.150458490508173e-05, "loss": 0.4982, "mean_token_accuracy": 0.8417927771806717, "num_tokens": 816898848.0, "step": 25596 }, { "entropy": 0.5263870419003069, "epoch": 2.3550525873916768, "grad_norm": 0.17125031352043152, "learning_rate": 2.1501518078940106e-05, "loss": 0.5047, "mean_token_accuracy": 0.840131115168333, "num_tokens": 816929934.0, "step": 25597 }, { "entropy": 0.49979779589921236, "epoch": 2.355144593763118, "grad_norm": 0.1604481339454651, "learning_rate": 2.149845125279848e-05, "loss": 0.477, "mean_token_accuracy": 0.8461016342043877, "num_tokens": 816960787.0, "step": 25598 }, { "entropy": 0.5557303186506033, "epoch": 2.3552366001345595, "grad_norm": 0.16758623719215393, "learning_rate": 2.1495384426656852e-05, "loss": 0.5433, "mean_token_accuracy": 0.8315826915204525, "num_tokens": 816992090.0, "step": 25599 }, { "entropy": 0.5300596617162228, "epoch": 2.3553286065060006, "grad_norm": 0.1611204892396927, "learning_rate": 2.1492317600515227e-05, "loss": 0.5169, "mean_token_accuracy": 0.834592416882515, "num_tokens": 817024702.0, "step": 25600 }, { "entropy": 0.5046031130477786, "epoch": 2.3554206128774418, "grad_norm": 0.1574343591928482, "learning_rate": 2.14892507743736e-05, "loss": 0.4979, "mean_token_accuracy": 0.8427225165069103, "num_tokens": 817056690.0, "step": 25601 }, { "entropy": 0.5126386061310768, "epoch": 2.355512619248883, "grad_norm": 0.162128746509552, "learning_rate": 2.1486183948231976e-05, "loss": 0.4922, "mean_token_accuracy": 0.8402947336435318, "num_tokens": 817087777.0, "step": 25602 }, { "entropy": 0.5058175707235932, "epoch": 2.355604625620324, "grad_norm": 0.15806211531162262, "learning_rate": 2.1483117122090347e-05, "loss": 0.4846, "mean_token_accuracy": 0.8425051495432854, "num_tokens": 817119012.0, "step": 25603 }, { "entropy": 0.5649839667603374, "epoch": 2.3556966319917656, "grad_norm": 0.16771627962589264, "learning_rate": 2.1480050295948722e-05, "loss": 0.5438, "mean_token_accuracy": 0.8253143057227135, "num_tokens": 817150397.0, "step": 25604 }, { "entropy": 0.5660046618431807, "epoch": 2.3557886383632067, "grad_norm": 0.17099477350711823, "learning_rate": 2.1476983469807097e-05, "loss": 0.544, "mean_token_accuracy": 0.8274915181100368, "num_tokens": 817182293.0, "step": 25605 }, { "entropy": 0.5316700395196676, "epoch": 2.355880644734648, "grad_norm": 0.16503159701824188, "learning_rate": 2.147391664366547e-05, "loss": 0.5231, "mean_token_accuracy": 0.8363272920250893, "num_tokens": 817214170.0, "step": 25606 }, { "entropy": 0.5452999756671488, "epoch": 2.355972651106089, "grad_norm": 0.1652543842792511, "learning_rate": 2.1470849817523846e-05, "loss": 0.5383, "mean_token_accuracy": 0.8308203332126141, "num_tokens": 817246729.0, "step": 25607 }, { "entropy": 0.5357951140031219, "epoch": 2.35606465747753, "grad_norm": 0.16268602013587952, "learning_rate": 2.146778299138222e-05, "loss": 0.5266, "mean_token_accuracy": 0.8359585143625736, "num_tokens": 817278576.0, "step": 25608 }, { "entropy": 0.5215537939220667, "epoch": 2.3561566638489717, "grad_norm": 0.16082532703876495, "learning_rate": 2.1464716165240595e-05, "loss": 0.5085, "mean_token_accuracy": 0.8383247777819633, "num_tokens": 817310690.0, "step": 25609 }, { "entropy": 0.5294525735080242, "epoch": 2.356248670220413, "grad_norm": 0.1600373238325119, "learning_rate": 2.146164933909897e-05, "loss": 0.5238, "mean_token_accuracy": 0.8371956571936607, "num_tokens": 817343236.0, "step": 25610 }, { "entropy": 0.5656447308138013, "epoch": 2.356340676591854, "grad_norm": 0.16117241978645325, "learning_rate": 2.145858251295734e-05, "loss": 0.5475, "mean_token_accuracy": 0.8306212536990643, "num_tokens": 817375568.0, "step": 25611 }, { "entropy": 0.48194982297718525, "epoch": 2.356432682963295, "grad_norm": 0.15366755425930023, "learning_rate": 2.1455515686815716e-05, "loss": 0.4721, "mean_token_accuracy": 0.8473949432373047, "num_tokens": 817407555.0, "step": 25612 }, { "entropy": 0.5648027565330267, "epoch": 2.3565246893347362, "grad_norm": 0.17056074738502502, "learning_rate": 2.145244886067409e-05, "loss": 0.5592, "mean_token_accuracy": 0.8233402110636234, "num_tokens": 817439453.0, "step": 25613 }, { "entropy": 0.4962919168174267, "epoch": 2.356616695706178, "grad_norm": 0.1594206690788269, "learning_rate": 2.1449382034532465e-05, "loss": 0.4711, "mean_token_accuracy": 0.8511606268584728, "num_tokens": 817471678.0, "step": 25614 }, { "entropy": 0.5171406408771873, "epoch": 2.356708702077619, "grad_norm": 0.16713212430477142, "learning_rate": 2.144631520839084e-05, "loss": 0.5128, "mean_token_accuracy": 0.8375032395124435, "num_tokens": 817502897.0, "step": 25615 }, { "entropy": 0.54277806263417, "epoch": 2.35680070844906, "grad_norm": 0.16235610842704773, "learning_rate": 2.144324838224921e-05, "loss": 0.5338, "mean_token_accuracy": 0.8296985700726509, "num_tokens": 817534324.0, "step": 25616 }, { "entropy": 0.5825234055519104, "epoch": 2.3568927148205012, "grad_norm": 0.17670093476772308, "learning_rate": 2.1440181556107586e-05, "loss": 0.5694, "mean_token_accuracy": 0.8185390345752239, "num_tokens": 817565683.0, "step": 25617 }, { "entropy": 0.5691337902098894, "epoch": 2.3569847211919424, "grad_norm": 0.16679124534130096, "learning_rate": 2.143711472996596e-05, "loss": 0.5565, "mean_token_accuracy": 0.8257592432200909, "num_tokens": 817598091.0, "step": 25618 }, { "entropy": 0.4139093500562012, "epoch": 2.357076727563384, "grad_norm": 0.1456737220287323, "learning_rate": 2.1434047903824335e-05, "loss": 0.4076, "mean_token_accuracy": 0.8706641644239426, "num_tokens": 817630016.0, "step": 25619 }, { "entropy": 0.5804222822189331, "epoch": 2.357168733934825, "grad_norm": 0.16375882923603058, "learning_rate": 2.1430981077682706e-05, "loss": 0.5564, "mean_token_accuracy": 0.8216579481959343, "num_tokens": 817661997.0, "step": 25620 }, { "entropy": 0.5324945393949747, "epoch": 2.357260740306266, "grad_norm": 0.159685879945755, "learning_rate": 2.142791425154108e-05, "loss": 0.5215, "mean_token_accuracy": 0.8338510654866695, "num_tokens": 817694164.0, "step": 25621 }, { "entropy": 0.5544083118438721, "epoch": 2.3573527466777073, "grad_norm": 0.15835680067539215, "learning_rate": 2.1424847425399455e-05, "loss": 0.5366, "mean_token_accuracy": 0.8290276080369949, "num_tokens": 817726635.0, "step": 25622 }, { "entropy": 0.5337888263165951, "epoch": 2.3574447530491485, "grad_norm": 0.1615951508283615, "learning_rate": 2.142178059925783e-05, "loss": 0.5203, "mean_token_accuracy": 0.8379697278141975, "num_tokens": 817759077.0, "step": 25623 }, { "entropy": 0.5940871611237526, "epoch": 2.35753675942059, "grad_norm": 0.1735890507698059, "learning_rate": 2.14187137731162e-05, "loss": 0.581, "mean_token_accuracy": 0.8143941722810268, "num_tokens": 817789969.0, "step": 25624 }, { "entropy": 0.4898594841361046, "epoch": 2.357628765792031, "grad_norm": 0.15761186182498932, "learning_rate": 2.1415646946974576e-05, "loss": 0.4742, "mean_token_accuracy": 0.8472796343266964, "num_tokens": 817821580.0, "step": 25625 }, { "entropy": 0.5220054658129811, "epoch": 2.3577207721634723, "grad_norm": 0.16297467052936554, "learning_rate": 2.141258012083295e-05, "loss": 0.516, "mean_token_accuracy": 0.8359979130327702, "num_tokens": 817853039.0, "step": 25626 }, { "entropy": 0.5490161459892988, "epoch": 2.3578127785349134, "grad_norm": 0.163652703166008, "learning_rate": 2.1409513294691325e-05, "loss": 0.5412, "mean_token_accuracy": 0.8304113484919071, "num_tokens": 817884450.0, "step": 25627 }, { "entropy": 0.6573353987187147, "epoch": 2.3579047849063546, "grad_norm": 0.172237828373909, "learning_rate": 2.14064464685497e-05, "loss": 0.6494, "mean_token_accuracy": 0.7953173629939556, "num_tokens": 817916576.0, "step": 25628 }, { "entropy": 0.5610318090766668, "epoch": 2.357996791277796, "grad_norm": 0.16545654833316803, "learning_rate": 2.140337964240807e-05, "loss": 0.5454, "mean_token_accuracy": 0.8292854055762291, "num_tokens": 817948513.0, "step": 25629 }, { "entropy": 0.5298922244692221, "epoch": 2.3580887976492373, "grad_norm": 0.16303971409797668, "learning_rate": 2.1400312816266446e-05, "loss": 0.5178, "mean_token_accuracy": 0.8384078964591026, "num_tokens": 817980596.0, "step": 25630 }, { "entropy": 0.460639710072428, "epoch": 2.3581808040206784, "grad_norm": 0.15715622901916504, "learning_rate": 2.139724599012482e-05, "loss": 0.446, "mean_token_accuracy": 0.8567503541707993, "num_tokens": 818012772.0, "step": 25631 }, { "entropy": 0.401648523285985, "epoch": 2.3582728103921196, "grad_norm": 0.142316073179245, "learning_rate": 2.1394179163983195e-05, "loss": 0.3913, "mean_token_accuracy": 0.8743421919643879, "num_tokens": 818044612.0, "step": 25632 }, { "entropy": 0.5347359925508499, "epoch": 2.3583648167635607, "grad_norm": 0.15815231204032898, "learning_rate": 2.1391112337841566e-05, "loss": 0.5181, "mean_token_accuracy": 0.835111066699028, "num_tokens": 818076602.0, "step": 25633 }, { "entropy": 0.5849387049674988, "epoch": 2.3584568231350023, "grad_norm": 0.16727787256240845, "learning_rate": 2.138804551169994e-05, "loss": 0.5641, "mean_token_accuracy": 0.8232447691261768, "num_tokens": 818109265.0, "step": 25634 }, { "entropy": 0.5144660184159875, "epoch": 2.3585488295064434, "grad_norm": 0.1582108736038208, "learning_rate": 2.1384978685558316e-05, "loss": 0.4994, "mean_token_accuracy": 0.8391495235264301, "num_tokens": 818141230.0, "step": 25635 }, { "entropy": 0.5226442022249103, "epoch": 2.3586408358778845, "grad_norm": 0.16378837823867798, "learning_rate": 2.138191185941669e-05, "loss": 0.5119, "mean_token_accuracy": 0.8377886787056923, "num_tokens": 818173588.0, "step": 25636 }, { "entropy": 0.5374631192535162, "epoch": 2.3587328422493257, "grad_norm": 0.1631178855895996, "learning_rate": 2.1378845033275065e-05, "loss": 0.5347, "mean_token_accuracy": 0.8322190791368484, "num_tokens": 818205575.0, "step": 25637 }, { "entropy": 0.5249018846079707, "epoch": 2.358824848620767, "grad_norm": 0.16055016219615936, "learning_rate": 2.1375778207133436e-05, "loss": 0.5255, "mean_token_accuracy": 0.8373996093869209, "num_tokens": 818238190.0, "step": 25638 }, { "entropy": 0.5441759722307324, "epoch": 2.3589168549922084, "grad_norm": 0.17094209790229797, "learning_rate": 2.1372711380991814e-05, "loss": 0.5369, "mean_token_accuracy": 0.8314224034547806, "num_tokens": 818269098.0, "step": 25639 }, { "entropy": 0.4835845325142145, "epoch": 2.3590088613636495, "grad_norm": 0.15487952530384064, "learning_rate": 2.136964455485019e-05, "loss": 0.4822, "mean_token_accuracy": 0.844808503985405, "num_tokens": 818301795.0, "step": 25640 }, { "entropy": 0.5010161623358727, "epoch": 2.3591008677350906, "grad_norm": 0.16197998821735382, "learning_rate": 2.136657772870856e-05, "loss": 0.4946, "mean_token_accuracy": 0.8422890529036522, "num_tokens": 818333782.0, "step": 25641 }, { "entropy": 0.5555134043097496, "epoch": 2.359192874106532, "grad_norm": 0.1638532429933548, "learning_rate": 2.1363510902566935e-05, "loss": 0.5392, "mean_token_accuracy": 0.8296592645347118, "num_tokens": 818366550.0, "step": 25642 }, { "entropy": 0.6334232771769166, "epoch": 2.359284880477973, "grad_norm": 0.16914691030979156, "learning_rate": 2.136044407642531e-05, "loss": 0.611, "mean_token_accuracy": 0.8073679208755493, "num_tokens": 818398237.0, "step": 25643 }, { "entropy": 0.5169970709830523, "epoch": 2.3593768868494145, "grad_norm": 0.16125227510929108, "learning_rate": 2.1357377250283684e-05, "loss": 0.5047, "mean_token_accuracy": 0.8393509462475777, "num_tokens": 818430331.0, "step": 25644 }, { "entropy": 0.44453758536837995, "epoch": 2.3594688932208556, "grad_norm": 0.15885335206985474, "learning_rate": 2.135431042414206e-05, "loss": 0.4307, "mean_token_accuracy": 0.8641091249883175, "num_tokens": 818462205.0, "step": 25645 }, { "entropy": 0.5509883603081107, "epoch": 2.3595608995922968, "grad_norm": 0.1672956496477127, "learning_rate": 2.135124359800043e-05, "loss": 0.5385, "mean_token_accuracy": 0.8308926783502102, "num_tokens": 818493631.0, "step": 25646 }, { "entropy": 0.5632276467513293, "epoch": 2.359652905963738, "grad_norm": 0.1640898883342743, "learning_rate": 2.1348176771858805e-05, "loss": 0.5545, "mean_token_accuracy": 0.8273324333131313, "num_tokens": 818526280.0, "step": 25647 }, { "entropy": 0.5299253519624472, "epoch": 2.359744912335179, "grad_norm": 0.16112419962882996, "learning_rate": 2.134510994571718e-05, "loss": 0.5144, "mean_token_accuracy": 0.836261685937643, "num_tokens": 818558421.0, "step": 25648 }, { "entropy": 0.46059264382347465, "epoch": 2.3598369187066206, "grad_norm": 0.15030542016029358, "learning_rate": 2.1342043119575554e-05, "loss": 0.4565, "mean_token_accuracy": 0.8574669621884823, "num_tokens": 818590597.0, "step": 25649 }, { "entropy": 0.4746459466405213, "epoch": 2.3599289250780617, "grad_norm": 0.15569260716438293, "learning_rate": 2.1338976293433925e-05, "loss": 0.4564, "mean_token_accuracy": 0.8553053475916386, "num_tokens": 818622011.0, "step": 25650 }, { "entropy": 0.6289124339818954, "epoch": 2.360020931449503, "grad_norm": 0.17097528278827667, "learning_rate": 2.13359094672923e-05, "loss": 0.6182, "mean_token_accuracy": 0.8076122365891933, "num_tokens": 818653828.0, "step": 25651 }, { "entropy": 0.5224725855514407, "epoch": 2.360112937820944, "grad_norm": 0.16148005425930023, "learning_rate": 2.1332842641150675e-05, "loss": 0.5062, "mean_token_accuracy": 0.8363118916749954, "num_tokens": 818685098.0, "step": 25652 }, { "entropy": 0.533381421584636, "epoch": 2.360204944192385, "grad_norm": 0.1621686965227127, "learning_rate": 2.132977581500905e-05, "loss": 0.5182, "mean_token_accuracy": 0.8366015180945396, "num_tokens": 818716788.0, "step": 25653 }, { "entropy": 0.5374051239341497, "epoch": 2.3602969505638267, "grad_norm": 0.16353850066661835, "learning_rate": 2.132670898886742e-05, "loss": 0.5297, "mean_token_accuracy": 0.8333742171525955, "num_tokens": 818748376.0, "step": 25654 }, { "entropy": 0.46046037413179874, "epoch": 2.360388956935268, "grad_norm": 0.1600683331489563, "learning_rate": 2.1323642162725795e-05, "loss": 0.4629, "mean_token_accuracy": 0.853199802339077, "num_tokens": 818781144.0, "step": 25655 }, { "entropy": 0.5612894715741277, "epoch": 2.360480963306709, "grad_norm": 0.16403280198574066, "learning_rate": 2.132057533658417e-05, "loss": 0.5589, "mean_token_accuracy": 0.8253719843924046, "num_tokens": 818813276.0, "step": 25656 }, { "entropy": 0.46353160217404366, "epoch": 2.36057296967815, "grad_norm": 0.16003288328647614, "learning_rate": 2.1317508510442544e-05, "loss": 0.4592, "mean_token_accuracy": 0.8582835346460342, "num_tokens": 818844326.0, "step": 25657 }, { "entropy": 0.42991546797566116, "epoch": 2.3606649760495912, "grad_norm": 0.14212660491466522, "learning_rate": 2.131444168430092e-05, "loss": 0.4166, "mean_token_accuracy": 0.8707194477319717, "num_tokens": 818877008.0, "step": 25658 }, { "entropy": 0.5596249103546143, "epoch": 2.360756982421033, "grad_norm": 0.16710585355758667, "learning_rate": 2.131137485815929e-05, "loss": 0.5388, "mean_token_accuracy": 0.8286410495638847, "num_tokens": 818908099.0, "step": 25659 }, { "entropy": 0.44677979312837124, "epoch": 2.360848988792474, "grad_norm": 0.1460222452878952, "learning_rate": 2.1308308032017665e-05, "loss": 0.4213, "mean_token_accuracy": 0.8643835596740246, "num_tokens": 818940044.0, "step": 25660 }, { "entropy": 0.4947759071364999, "epoch": 2.360940995163915, "grad_norm": 0.15829357504844666, "learning_rate": 2.130524120587604e-05, "loss": 0.475, "mean_token_accuracy": 0.8470585867762566, "num_tokens": 818970547.0, "step": 25661 }, { "entropy": 0.5952994700055569, "epoch": 2.3610330015353562, "grad_norm": 0.1643376499414444, "learning_rate": 2.1302174379734414e-05, "loss": 0.583, "mean_token_accuracy": 0.8134019114077091, "num_tokens": 819002541.0, "step": 25662 }, { "entropy": 0.5006870506331325, "epoch": 2.3611250079067974, "grad_norm": 0.16173996031284332, "learning_rate": 2.1299107553592786e-05, "loss": 0.5003, "mean_token_accuracy": 0.8452001288533211, "num_tokens": 819034298.0, "step": 25663 }, { "entropy": 0.5105008780956268, "epoch": 2.361217014278239, "grad_norm": 0.16085775196552277, "learning_rate": 2.129604072745116e-05, "loss": 0.5024, "mean_token_accuracy": 0.8398134522140026, "num_tokens": 819066283.0, "step": 25664 }, { "entropy": 0.4614974050782621, "epoch": 2.36130902064968, "grad_norm": 0.14666885137557983, "learning_rate": 2.1292973901309535e-05, "loss": 0.4519, "mean_token_accuracy": 0.8545823283493519, "num_tokens": 819098889.0, "step": 25665 }, { "entropy": 0.42232658877037466, "epoch": 2.361401027021121, "grad_norm": 0.14723412692546844, "learning_rate": 2.128990707516791e-05, "loss": 0.4066, "mean_token_accuracy": 0.8671836778521538, "num_tokens": 819131657.0, "step": 25666 }, { "entropy": 0.4784840438514948, "epoch": 2.3614930333925623, "grad_norm": 0.1547611504793167, "learning_rate": 2.1286840249026284e-05, "loss": 0.4493, "mean_token_accuracy": 0.8534877337515354, "num_tokens": 819163054.0, "step": 25667 }, { "entropy": 0.49005863768979907, "epoch": 2.3615850397640035, "grad_norm": 0.1549265831708908, "learning_rate": 2.1283773422884655e-05, "loss": 0.466, "mean_token_accuracy": 0.8526225723326206, "num_tokens": 819195313.0, "step": 25668 }, { "entropy": 0.5051598283462226, "epoch": 2.361677046135445, "grad_norm": 0.16190890967845917, "learning_rate": 2.1280706596743033e-05, "loss": 0.488, "mean_token_accuracy": 0.8460114970803261, "num_tokens": 819227554.0, "step": 25669 }, { "entropy": 0.638963496312499, "epoch": 2.361769052506886, "grad_norm": 0.17847022414207458, "learning_rate": 2.1277639770601408e-05, "loss": 0.6368, "mean_token_accuracy": 0.7999412454664707, "num_tokens": 819259394.0, "step": 25670 }, { "entropy": 0.5083031887188554, "epoch": 2.3618610588783273, "grad_norm": 0.15887418389320374, "learning_rate": 2.127457294445978e-05, "loss": 0.4944, "mean_token_accuracy": 0.841127060353756, "num_tokens": 819290809.0, "step": 25671 }, { "entropy": 0.5590608641505241, "epoch": 2.3619530652497684, "grad_norm": 0.1602736860513687, "learning_rate": 2.1271506118318154e-05, "loss": 0.5441, "mean_token_accuracy": 0.8290139250457287, "num_tokens": 819323285.0, "step": 25672 }, { "entropy": 0.5235464442521334, "epoch": 2.3620450716212096, "grad_norm": 0.15893037617206573, "learning_rate": 2.126843929217653e-05, "loss": 0.5072, "mean_token_accuracy": 0.8405635990202427, "num_tokens": 819355759.0, "step": 25673 }, { "entropy": 0.6533501651138067, "epoch": 2.362137077992651, "grad_norm": 0.17175954580307007, "learning_rate": 2.1265372466034903e-05, "loss": 0.6301, "mean_token_accuracy": 0.8030939064919949, "num_tokens": 819387577.0, "step": 25674 }, { "entropy": 0.5248013073578477, "epoch": 2.3622290843640923, "grad_norm": 0.16137653589248657, "learning_rate": 2.1262305639893278e-05, "loss": 0.5097, "mean_token_accuracy": 0.8388189747929573, "num_tokens": 819419267.0, "step": 25675 }, { "entropy": 0.49896268686279655, "epoch": 2.3623210907355334, "grad_norm": 0.1542089730501175, "learning_rate": 2.125923881375165e-05, "loss": 0.4787, "mean_token_accuracy": 0.8495366387069225, "num_tokens": 819451457.0, "step": 25676 }, { "entropy": 0.624297708272934, "epoch": 2.3624130971069746, "grad_norm": 0.16729743778705597, "learning_rate": 2.1256171987610024e-05, "loss": 0.619, "mean_token_accuracy": 0.8054996095597744, "num_tokens": 819483776.0, "step": 25677 }, { "entropy": 0.5003483658656478, "epoch": 2.3625051034784157, "grad_norm": 0.15463362634181976, "learning_rate": 2.12531051614684e-05, "loss": 0.4951, "mean_token_accuracy": 0.8446212187409401, "num_tokens": 819515914.0, "step": 25678 }, { "entropy": 0.5193071626126766, "epoch": 2.3625971098498573, "grad_norm": 0.1633939892053604, "learning_rate": 2.1250038335326773e-05, "loss": 0.5197, "mean_token_accuracy": 0.8377560786902905, "num_tokens": 819547817.0, "step": 25679 }, { "entropy": 0.5015627518296242, "epoch": 2.3626891162212984, "grad_norm": 0.1577436327934265, "learning_rate": 2.1246971509185144e-05, "loss": 0.4919, "mean_token_accuracy": 0.8430968709290028, "num_tokens": 819580289.0, "step": 25680 }, { "entropy": 0.46181901544332504, "epoch": 2.3627811225927395, "grad_norm": 0.15437297523021698, "learning_rate": 2.124390468304352e-05, "loss": 0.4528, "mean_token_accuracy": 0.855523195117712, "num_tokens": 819612715.0, "step": 25681 }, { "entropy": 0.57676991680637, "epoch": 2.3628731289641807, "grad_norm": 0.17351803183555603, "learning_rate": 2.1240837856901894e-05, "loss": 0.5764, "mean_token_accuracy": 0.8182020671665668, "num_tokens": 819644264.0, "step": 25682 }, { "entropy": 0.621406284160912, "epoch": 2.362965135335622, "grad_norm": 0.18057160079479218, "learning_rate": 2.123777103076027e-05, "loss": 0.6194, "mean_token_accuracy": 0.8055323250591755, "num_tokens": 819675640.0, "step": 25683 }, { "entropy": 0.4766353666782379, "epoch": 2.3630571417070634, "grad_norm": 0.15681780874729156, "learning_rate": 2.123470420461864e-05, "loss": 0.465, "mean_token_accuracy": 0.8488666154444218, "num_tokens": 819707710.0, "step": 25684 }, { "entropy": 0.5231007458642125, "epoch": 2.3631491480785045, "grad_norm": 0.16033191978931427, "learning_rate": 2.1231637378477014e-05, "loss": 0.5042, "mean_token_accuracy": 0.8387314714491367, "num_tokens": 819739524.0, "step": 25685 }, { "entropy": 0.5677141463384032, "epoch": 2.3632411544499456, "grad_norm": 0.16525471210479736, "learning_rate": 2.122857055233539e-05, "loss": 0.5568, "mean_token_accuracy": 0.8246969468891621, "num_tokens": 819771317.0, "step": 25686 }, { "entropy": 0.48540474474430084, "epoch": 2.363333160821387, "grad_norm": 0.1610558032989502, "learning_rate": 2.1225503726193764e-05, "loss": 0.4695, "mean_token_accuracy": 0.849683340638876, "num_tokens": 819802320.0, "step": 25687 }, { "entropy": 0.46347806276753545, "epoch": 2.363425167192828, "grad_norm": 0.1558840125799179, "learning_rate": 2.1222436900052138e-05, "loss": 0.4508, "mean_token_accuracy": 0.8561744876205921, "num_tokens": 819834090.0, "step": 25688 }, { "entropy": 0.4966772710904479, "epoch": 2.3635171735642695, "grad_norm": 0.15858572721481323, "learning_rate": 2.121937007391051e-05, "loss": 0.4776, "mean_token_accuracy": 0.846134789288044, "num_tokens": 819865492.0, "step": 25689 }, { "entropy": 0.518487511202693, "epoch": 2.3636091799357106, "grad_norm": 0.16446553170681, "learning_rate": 2.1216303247768884e-05, "loss": 0.5117, "mean_token_accuracy": 0.8384512104094028, "num_tokens": 819897260.0, "step": 25690 }, { "entropy": 0.5513265877962112, "epoch": 2.3637011863071518, "grad_norm": 0.1671285629272461, "learning_rate": 2.121323642162726e-05, "loss": 0.5322, "mean_token_accuracy": 0.8311706222593784, "num_tokens": 819929235.0, "step": 25691 }, { "entropy": 0.4713011793792248, "epoch": 2.363793192678593, "grad_norm": 0.16054388880729675, "learning_rate": 2.1210169595485633e-05, "loss": 0.46, "mean_token_accuracy": 0.853533186018467, "num_tokens": 819961103.0, "step": 25692 }, { "entropy": 0.5084033980965614, "epoch": 2.363885199050034, "grad_norm": 0.15687546133995056, "learning_rate": 2.1207102769344005e-05, "loss": 0.496, "mean_token_accuracy": 0.8401130512356758, "num_tokens": 819993610.0, "step": 25693 }, { "entropy": 0.45735959336161613, "epoch": 2.3639772054214756, "grad_norm": 0.15858663618564606, "learning_rate": 2.120403594320238e-05, "loss": 0.442, "mean_token_accuracy": 0.855887345969677, "num_tokens": 820025509.0, "step": 25694 }, { "entropy": 0.519312085583806, "epoch": 2.3640692117929167, "grad_norm": 0.16093553602695465, "learning_rate": 2.1200969117060754e-05, "loss": 0.5113, "mean_token_accuracy": 0.8392850756645203, "num_tokens": 820057552.0, "step": 25695 }, { "entropy": 0.5251762792468071, "epoch": 2.364161218164358, "grad_norm": 0.1660960614681244, "learning_rate": 2.119790229091913e-05, "loss": 0.5065, "mean_token_accuracy": 0.8390705399215221, "num_tokens": 820089332.0, "step": 25696 }, { "entropy": 0.4591878242790699, "epoch": 2.364253224535799, "grad_norm": 0.15737462043762207, "learning_rate": 2.1194835464777503e-05, "loss": 0.439, "mean_token_accuracy": 0.8595554605126381, "num_tokens": 820120902.0, "step": 25697 }, { "entropy": 0.5101629449054599, "epoch": 2.36434523090724, "grad_norm": 0.15462233126163483, "learning_rate": 2.1191768638635874e-05, "loss": 0.4985, "mean_token_accuracy": 0.8450489826500416, "num_tokens": 820153603.0, "step": 25698 }, { "entropy": 0.3972784634679556, "epoch": 2.3644372372786817, "grad_norm": 0.1425456404685974, "learning_rate": 2.118870181249425e-05, "loss": 0.3785, "mean_token_accuracy": 0.8772687613964081, "num_tokens": 820186144.0, "step": 25699 }, { "entropy": 0.3983548451215029, "epoch": 2.364529243650123, "grad_norm": 0.14440011978149414, "learning_rate": 2.1185634986352627e-05, "loss": 0.3839, "mean_token_accuracy": 0.8776392042636871, "num_tokens": 820218145.0, "step": 25700 }, { "entropy": 0.3993650730699301, "epoch": 2.364621250021564, "grad_norm": 0.14652124047279358, "learning_rate": 2.1182568160211e-05, "loss": 0.3904, "mean_token_accuracy": 0.8724453300237656, "num_tokens": 820249809.0, "step": 25701 }, { "entropy": 0.6127847479656339, "epoch": 2.364713256393005, "grad_norm": 0.1674865186214447, "learning_rate": 2.1179501334069373e-05, "loss": 0.5941, "mean_token_accuracy": 0.8152335546910763, "num_tokens": 820281994.0, "step": 25702 }, { "entropy": 0.5431090565398335, "epoch": 2.3648052627644462, "grad_norm": 0.16304847598075867, "learning_rate": 2.1176434507927748e-05, "loss": 0.516, "mean_token_accuracy": 0.8318220749497414, "num_tokens": 820313870.0, "step": 25703 }, { "entropy": 0.48913456685841084, "epoch": 2.364897269135888, "grad_norm": 0.15445482730865479, "learning_rate": 2.1173367681786122e-05, "loss": 0.4711, "mean_token_accuracy": 0.8512603640556335, "num_tokens": 820345824.0, "step": 25704 }, { "entropy": 0.5507302349433303, "epoch": 2.364989275507329, "grad_norm": 0.15819138288497925, "learning_rate": 2.1170300855644497e-05, "loss": 0.5343, "mean_token_accuracy": 0.8305819109082222, "num_tokens": 820378538.0, "step": 25705 }, { "entropy": 0.5327284382656217, "epoch": 2.36508128187877, "grad_norm": 0.1635805368423462, "learning_rate": 2.1167234029502868e-05, "loss": 0.5195, "mean_token_accuracy": 0.834996659308672, "num_tokens": 820410404.0, "step": 25706 }, { "entropy": 0.45610903261695057, "epoch": 2.3651732882502112, "grad_norm": 0.15121060609817505, "learning_rate": 2.1164167203361243e-05, "loss": 0.4489, "mean_token_accuracy": 0.8549386449158192, "num_tokens": 820442157.0, "step": 25707 }, { "entropy": 0.5540971765294671, "epoch": 2.3652652946216524, "grad_norm": 0.17320837080478668, "learning_rate": 2.1161100377219618e-05, "loss": 0.5532, "mean_token_accuracy": 0.8223690651357174, "num_tokens": 820473672.0, "step": 25708 }, { "entropy": 0.5366207342594862, "epoch": 2.365357300993094, "grad_norm": 0.164528027176857, "learning_rate": 2.1158033551077992e-05, "loss": 0.5137, "mean_token_accuracy": 0.8383371941745281, "num_tokens": 820505173.0, "step": 25709 }, { "entropy": 0.5115102855488658, "epoch": 2.365449307364535, "grad_norm": 0.1559453010559082, "learning_rate": 2.1154966724936363e-05, "loss": 0.4983, "mean_token_accuracy": 0.8370702043175697, "num_tokens": 820536849.0, "step": 25710 }, { "entropy": 0.5211611315608025, "epoch": 2.365541313735976, "grad_norm": 0.16512273252010345, "learning_rate": 2.1151899898794738e-05, "loss": 0.5165, "mean_token_accuracy": 0.8386046960949898, "num_tokens": 820568476.0, "step": 25711 }, { "entropy": 0.46911942306905985, "epoch": 2.3656333201074173, "grad_norm": 0.15767036378383636, "learning_rate": 2.1148833072653113e-05, "loss": 0.4473, "mean_token_accuracy": 0.8553788475692272, "num_tokens": 820600692.0, "step": 25712 }, { "entropy": 0.5009477629791945, "epoch": 2.3657253264788585, "grad_norm": 0.15735265612602234, "learning_rate": 2.1145766246511487e-05, "loss": 0.4914, "mean_token_accuracy": 0.8470648750662804, "num_tokens": 820633254.0, "step": 25713 }, { "entropy": 0.5646863337606192, "epoch": 2.3658173328503, "grad_norm": 0.16394087672233582, "learning_rate": 2.114269942036986e-05, "loss": 0.545, "mean_token_accuracy": 0.8259791918098927, "num_tokens": 820665668.0, "step": 25714 }, { "entropy": 0.4941774997860193, "epoch": 2.365909339221741, "grad_norm": 0.16051506996154785, "learning_rate": 2.1139632594228233e-05, "loss": 0.4819, "mean_token_accuracy": 0.8436015024781227, "num_tokens": 820697902.0, "step": 25715 }, { "entropy": 0.5625868830829859, "epoch": 2.3660013455931823, "grad_norm": 0.1665610522031784, "learning_rate": 2.1136565768086608e-05, "loss": 0.5583, "mean_token_accuracy": 0.8265301026403904, "num_tokens": 820729987.0, "step": 25716 }, { "entropy": 0.5923120174556971, "epoch": 2.3660933519646234, "grad_norm": 0.17234516143798828, "learning_rate": 2.1133498941944983e-05, "loss": 0.5906, "mean_token_accuracy": 0.8129290044307709, "num_tokens": 820761655.0, "step": 25717 }, { "entropy": 0.4919923224952072, "epoch": 2.3661853583360646, "grad_norm": 0.15724758803844452, "learning_rate": 2.1130432115803357e-05, "loss": 0.4829, "mean_token_accuracy": 0.8461174182593822, "num_tokens": 820794258.0, "step": 25718 }, { "entropy": 0.5572485327720642, "epoch": 2.366277364707506, "grad_norm": 0.1654139906167984, "learning_rate": 2.112736528966173e-05, "loss": 0.5552, "mean_token_accuracy": 0.8240667097270489, "num_tokens": 820826792.0, "step": 25719 }, { "entropy": 0.5475485995411873, "epoch": 2.3663693710789473, "grad_norm": 0.15797550976276398, "learning_rate": 2.1124298463520103e-05, "loss": 0.5386, "mean_token_accuracy": 0.8271421790122986, "num_tokens": 820859187.0, "step": 25720 }, { "entropy": 0.5447046568151563, "epoch": 2.3664613774503884, "grad_norm": 0.16315098106861115, "learning_rate": 2.1121231637378478e-05, "loss": 0.5327, "mean_token_accuracy": 0.8312439173460007, "num_tokens": 820891627.0, "step": 25721 }, { "entropy": 0.5018086759373546, "epoch": 2.3665533838218296, "grad_norm": 0.1548866182565689, "learning_rate": 2.1118164811236852e-05, "loss": 0.4881, "mean_token_accuracy": 0.8459268286824226, "num_tokens": 820923931.0, "step": 25722 }, { "entropy": 0.46130844112485647, "epoch": 2.3666453901932707, "grad_norm": 0.15595075488090515, "learning_rate": 2.1115097985095224e-05, "loss": 0.45, "mean_token_accuracy": 0.8600748255848885, "num_tokens": 820955883.0, "step": 25723 }, { "entropy": 0.5311868879944086, "epoch": 2.3667373965647123, "grad_norm": 0.16379398107528687, "learning_rate": 2.11120311589536e-05, "loss": 0.5266, "mean_token_accuracy": 0.8339813239872456, "num_tokens": 820988180.0, "step": 25724 }, { "entropy": 0.7057678773999214, "epoch": 2.3668294029361534, "grad_norm": 0.17664511501789093, "learning_rate": 2.1108964332811973e-05, "loss": 0.6934, "mean_token_accuracy": 0.7831022776663303, "num_tokens": 821020137.0, "step": 25725 }, { "entropy": 0.49022599845193326, "epoch": 2.3669214093075945, "grad_norm": 0.15472368896007538, "learning_rate": 2.1105897506670348e-05, "loss": 0.4786, "mean_token_accuracy": 0.8507877290248871, "num_tokens": 821052905.0, "step": 25726 }, { "entropy": 0.632229994982481, "epoch": 2.3670134156790357, "grad_norm": 0.1712760180234909, "learning_rate": 2.1102830680528722e-05, "loss": 0.614, "mean_token_accuracy": 0.8100426942110062, "num_tokens": 821084823.0, "step": 25727 }, { "entropy": 0.43960240576416254, "epoch": 2.367105422050477, "grad_norm": 0.1508485972881317, "learning_rate": 2.1099763854387094e-05, "loss": 0.4228, "mean_token_accuracy": 0.8635807037353516, "num_tokens": 821117295.0, "step": 25728 }, { "entropy": 0.5663454092573375, "epoch": 2.3671974284219184, "grad_norm": 0.16131986677646637, "learning_rate": 2.1096697028245468e-05, "loss": 0.5511, "mean_token_accuracy": 0.8291001580655575, "num_tokens": 821150035.0, "step": 25729 }, { "entropy": 0.4654030150268227, "epoch": 2.3672894347933595, "grad_norm": 0.15320336818695068, "learning_rate": 2.1093630202103846e-05, "loss": 0.4608, "mean_token_accuracy": 0.85289566218853, "num_tokens": 821182386.0, "step": 25730 }, { "entropy": 0.6025048941373825, "epoch": 2.3673814411648006, "grad_norm": 0.16826917231082916, "learning_rate": 2.1090563375962218e-05, "loss": 0.581, "mean_token_accuracy": 0.8149486295878887, "num_tokens": 821214062.0, "step": 25731 }, { "entropy": 0.44275127351284027, "epoch": 2.367473447536242, "grad_norm": 0.14690594375133514, "learning_rate": 2.1087496549820592e-05, "loss": 0.427, "mean_token_accuracy": 0.8633382879197598, "num_tokens": 821246354.0, "step": 25732 }, { "entropy": 0.4502996081719175, "epoch": 2.367565453907683, "grad_norm": 0.1591474860906601, "learning_rate": 2.1084429723678967e-05, "loss": 0.4487, "mean_token_accuracy": 0.8599514588713646, "num_tokens": 821278732.0, "step": 25733 }, { "entropy": 0.5489085335284472, "epoch": 2.3676574602791245, "grad_norm": 0.16640715301036835, "learning_rate": 2.108136289753734e-05, "loss": 0.5551, "mean_token_accuracy": 0.8282125815749168, "num_tokens": 821310264.0, "step": 25734 }, { "entropy": 0.4252933629322797, "epoch": 2.3677494666505656, "grad_norm": 0.1503095179796219, "learning_rate": 2.1078296071395716e-05, "loss": 0.4061, "mean_token_accuracy": 0.871965903788805, "num_tokens": 821342381.0, "step": 25735 }, { "entropy": 0.4762898162007332, "epoch": 2.3678414730220068, "grad_norm": 0.15629935264587402, "learning_rate": 2.1075229245254087e-05, "loss": 0.4583, "mean_token_accuracy": 0.8514681309461594, "num_tokens": 821373393.0, "step": 25736 }, { "entropy": 0.615411045961082, "epoch": 2.367933479393448, "grad_norm": 0.17545926570892334, "learning_rate": 2.1072162419112462e-05, "loss": 0.6062, "mean_token_accuracy": 0.8088439367711544, "num_tokens": 821404891.0, "step": 25737 }, { "entropy": 0.5738867959007621, "epoch": 2.368025485764889, "grad_norm": 0.1639767587184906, "learning_rate": 2.1069095592970837e-05, "loss": 0.5696, "mean_token_accuracy": 0.8225175738334656, "num_tokens": 821437561.0, "step": 25738 }, { "entropy": 0.5439132479950786, "epoch": 2.3681174921363306, "grad_norm": 0.16632649302482605, "learning_rate": 2.106602876682921e-05, "loss": 0.5418, "mean_token_accuracy": 0.8274118453264236, "num_tokens": 821469566.0, "step": 25739 }, { "entropy": 0.59254165366292, "epoch": 2.3682094985077717, "grad_norm": 0.17250853776931763, "learning_rate": 2.1062961940687583e-05, "loss": 0.5854, "mean_token_accuracy": 0.8174435868859291, "num_tokens": 821500709.0, "step": 25740 }, { "entropy": 0.6052577868103981, "epoch": 2.368301504879213, "grad_norm": 0.16715696454048157, "learning_rate": 2.1059895114545957e-05, "loss": 0.5936, "mean_token_accuracy": 0.8149029575288296, "num_tokens": 821532354.0, "step": 25741 }, { "entropy": 0.4406666802242398, "epoch": 2.368393511250654, "grad_norm": 0.1513926088809967, "learning_rate": 2.1056828288404332e-05, "loss": 0.4289, "mean_token_accuracy": 0.863419346511364, "num_tokens": 821564470.0, "step": 25742 }, { "entropy": 0.5535288397222757, "epoch": 2.368485517622095, "grad_norm": 0.16873767971992493, "learning_rate": 2.1053761462262707e-05, "loss": 0.5486, "mean_token_accuracy": 0.8300113826990128, "num_tokens": 821595767.0, "step": 25743 }, { "entropy": 0.4975919555872679, "epoch": 2.3685775239935367, "grad_norm": 0.15390226244926453, "learning_rate": 2.1050694636121078e-05, "loss": 0.4858, "mean_token_accuracy": 0.8465742543339729, "num_tokens": 821628535.0, "step": 25744 }, { "entropy": 0.42307151947170496, "epoch": 2.368669530364978, "grad_norm": 0.14770573377609253, "learning_rate": 2.1047627809979452e-05, "loss": 0.4066, "mean_token_accuracy": 0.8709238357841969, "num_tokens": 821660577.0, "step": 25745 }, { "entropy": 0.5529237352311611, "epoch": 2.368761536736419, "grad_norm": 0.16631963849067688, "learning_rate": 2.1044560983837827e-05, "loss": 0.5381, "mean_token_accuracy": 0.8297855518758297, "num_tokens": 821692017.0, "step": 25746 }, { "entropy": 0.4851539172232151, "epoch": 2.36885354310786, "grad_norm": 0.15580929815769196, "learning_rate": 2.1041494157696202e-05, "loss": 0.4654, "mean_token_accuracy": 0.8546341173350811, "num_tokens": 821724265.0, "step": 25747 }, { "entropy": 0.49888229090720415, "epoch": 2.3689455494793012, "grad_norm": 0.1576162576675415, "learning_rate": 2.1038427331554576e-05, "loss": 0.4761, "mean_token_accuracy": 0.8494114577770233, "num_tokens": 821756021.0, "step": 25748 }, { "entropy": 0.4295121030882001, "epoch": 2.369037555850743, "grad_norm": 0.1448814868927002, "learning_rate": 2.1035360505412948e-05, "loss": 0.4222, "mean_token_accuracy": 0.8654438890516758, "num_tokens": 821788333.0, "step": 25749 }, { "entropy": 0.5018582521006465, "epoch": 2.369129562222184, "grad_norm": 0.15734438598155975, "learning_rate": 2.1032293679271322e-05, "loss": 0.4929, "mean_token_accuracy": 0.8447303138673306, "num_tokens": 821820078.0, "step": 25750 }, { "entropy": 0.6123523069545627, "epoch": 2.369221568593625, "grad_norm": 0.17347833514213562, "learning_rate": 2.1029226853129697e-05, "loss": 0.6028, "mean_token_accuracy": 0.808652650564909, "num_tokens": 821851927.0, "step": 25751 }, { "entropy": 0.5102202082052827, "epoch": 2.3693135749650662, "grad_norm": 0.15544728934764862, "learning_rate": 2.102616002698807e-05, "loss": 0.4864, "mean_token_accuracy": 0.8464146107435226, "num_tokens": 821884349.0, "step": 25752 }, { "entropy": 0.6474671652540565, "epoch": 2.3694055813365074, "grad_norm": 0.17152109742164612, "learning_rate": 2.1023093200846443e-05, "loss": 0.6275, "mean_token_accuracy": 0.807854488492012, "num_tokens": 821916161.0, "step": 25753 }, { "entropy": 0.5141332177445292, "epoch": 2.369497587707949, "grad_norm": 0.16125135123729706, "learning_rate": 2.1020026374704817e-05, "loss": 0.5013, "mean_token_accuracy": 0.8418369889259338, "num_tokens": 821948348.0, "step": 25754 }, { "entropy": 0.6355437748134136, "epoch": 2.36958959407939, "grad_norm": 0.1789812594652176, "learning_rate": 2.1016959548563192e-05, "loss": 0.6219, "mean_token_accuracy": 0.8049910068511963, "num_tokens": 821979734.0, "step": 25755 }, { "entropy": 0.5301446299999952, "epoch": 2.369681600450831, "grad_norm": 0.1577194184064865, "learning_rate": 2.1013892722421567e-05, "loss": 0.5127, "mean_token_accuracy": 0.8351097963750362, "num_tokens": 822011694.0, "step": 25756 }, { "entropy": 0.5065490459091961, "epoch": 2.3697736068222723, "grad_norm": 0.15539376437664032, "learning_rate": 2.101082589627994e-05, "loss": 0.4965, "mean_token_accuracy": 0.842429019510746, "num_tokens": 822044255.0, "step": 25757 }, { "entropy": 0.52814756706357, "epoch": 2.3698656131937135, "grad_norm": 0.16112078726291656, "learning_rate": 2.1007759070138313e-05, "loss": 0.514, "mean_token_accuracy": 0.8381861560046673, "num_tokens": 822076758.0, "step": 25758 }, { "entropy": 0.49259378761053085, "epoch": 2.369957619565155, "grad_norm": 0.15316623449325562, "learning_rate": 2.1004692243996687e-05, "loss": 0.4805, "mean_token_accuracy": 0.8473135493695736, "num_tokens": 822108404.0, "step": 25759 }, { "entropy": 0.6340024191886187, "epoch": 2.370049625936596, "grad_norm": 0.17773103713989258, "learning_rate": 2.1001625417855062e-05, "loss": 0.6207, "mean_token_accuracy": 0.8034694641828537, "num_tokens": 822139920.0, "step": 25760 }, { "entropy": 0.5585168699035421, "epoch": 2.3701416323080373, "grad_norm": 0.1671450287103653, "learning_rate": 2.0998558591713437e-05, "loss": 0.5432, "mean_token_accuracy": 0.8271000497043133, "num_tokens": 822171239.0, "step": 25761 }, { "entropy": 0.4308317070826888, "epoch": 2.3702336386794784, "grad_norm": 0.14764322340488434, "learning_rate": 2.099549176557181e-05, "loss": 0.4178, "mean_token_accuracy": 0.866690456867218, "num_tokens": 822203868.0, "step": 25762 }, { "entropy": 0.5015133824199438, "epoch": 2.3703256450509196, "grad_norm": 0.16467086970806122, "learning_rate": 2.0992424939430186e-05, "loss": 0.4891, "mean_token_accuracy": 0.8456373326480389, "num_tokens": 822235435.0, "step": 25763 }, { "entropy": 0.46878791879862547, "epoch": 2.370417651422361, "grad_norm": 0.15808166563510895, "learning_rate": 2.098935811328856e-05, "loss": 0.4617, "mean_token_accuracy": 0.8524835035204887, "num_tokens": 822267370.0, "step": 25764 }, { "entropy": 0.4563261987641454, "epoch": 2.3705096577938023, "grad_norm": 0.15550126135349274, "learning_rate": 2.0986291287146935e-05, "loss": 0.4361, "mean_token_accuracy": 0.8568753451108932, "num_tokens": 822298522.0, "step": 25765 }, { "entropy": 0.4650128213688731, "epoch": 2.3706016641652434, "grad_norm": 0.1558605283498764, "learning_rate": 2.0983224461005306e-05, "loss": 0.4448, "mean_token_accuracy": 0.8556360937654972, "num_tokens": 822330526.0, "step": 25766 }, { "entropy": 0.48758196271955967, "epoch": 2.3706936705366846, "grad_norm": 0.1632997691631317, "learning_rate": 2.098015763486368e-05, "loss": 0.472, "mean_token_accuracy": 0.8490259796380997, "num_tokens": 822363014.0, "step": 25767 }, { "entropy": 0.49846268631517887, "epoch": 2.3707856769081257, "grad_norm": 0.15963609516620636, "learning_rate": 2.0977090808722056e-05, "loss": 0.4828, "mean_token_accuracy": 0.8436748273670673, "num_tokens": 822395047.0, "step": 25768 }, { "entropy": 0.524173797108233, "epoch": 2.3708776832795673, "grad_norm": 0.16565746068954468, "learning_rate": 2.097402398258043e-05, "loss": 0.5066, "mean_token_accuracy": 0.8362104259431362, "num_tokens": 822426556.0, "step": 25769 }, { "entropy": 0.4732971340417862, "epoch": 2.3709696896510084, "grad_norm": 0.15661479532718658, "learning_rate": 2.09709571564388e-05, "loss": 0.4645, "mean_token_accuracy": 0.8528907150030136, "num_tokens": 822458805.0, "step": 25770 }, { "entropy": 0.5379225313663483, "epoch": 2.3710616960224495, "grad_norm": 0.1667531579732895, "learning_rate": 2.0967890330297176e-05, "loss": 0.5321, "mean_token_accuracy": 0.8310831859707832, "num_tokens": 822490365.0, "step": 25771 }, { "entropy": 0.5540529433637857, "epoch": 2.3711537023938907, "grad_norm": 0.16614598035812378, "learning_rate": 2.096482350415555e-05, "loss": 0.5465, "mean_token_accuracy": 0.8259942829608917, "num_tokens": 822522504.0, "step": 25772 }, { "entropy": 0.5293927513994277, "epoch": 2.371245708765332, "grad_norm": 0.16049982607364655, "learning_rate": 2.0961756678013926e-05, "loss": 0.5247, "mean_token_accuracy": 0.8361855000257492, "num_tokens": 822555183.0, "step": 25773 }, { "entropy": 0.36347160884179175, "epoch": 2.3713377151367734, "grad_norm": 0.13626256585121155, "learning_rate": 2.0958689851872297e-05, "loss": 0.3496, "mean_token_accuracy": 0.8878738582134247, "num_tokens": 822587691.0, "step": 25774 }, { "entropy": 0.4831793177872896, "epoch": 2.3714297215082145, "grad_norm": 0.15644410252571106, "learning_rate": 2.095562302573067e-05, "loss": 0.4716, "mean_token_accuracy": 0.8474988453090191, "num_tokens": 822619775.0, "step": 25775 }, { "entropy": 0.464958727825433, "epoch": 2.3715217278796556, "grad_norm": 0.15172705054283142, "learning_rate": 2.0952556199589046e-05, "loss": 0.4499, "mean_token_accuracy": 0.8537873961031437, "num_tokens": 822652295.0, "step": 25776 }, { "entropy": 0.5472142514772713, "epoch": 2.371613734251097, "grad_norm": 0.16517634689807892, "learning_rate": 2.094948937344742e-05, "loss": 0.5356, "mean_token_accuracy": 0.8326831869781017, "num_tokens": 822684382.0, "step": 25777 }, { "entropy": 0.5856922988314182, "epoch": 2.371705740622538, "grad_norm": 0.16783694922924042, "learning_rate": 2.0946422547305795e-05, "loss": 0.5658, "mean_token_accuracy": 0.8187438398599625, "num_tokens": 822716205.0, "step": 25778 }, { "entropy": 0.5471664359793067, "epoch": 2.3717977469939795, "grad_norm": 0.17399492859840393, "learning_rate": 2.0943355721164167e-05, "loss": 0.5437, "mean_token_accuracy": 0.8277795426547527, "num_tokens": 822747792.0, "step": 25779 }, { "entropy": 0.5556042492389679, "epoch": 2.3718897533654206, "grad_norm": 0.16423919796943665, "learning_rate": 2.094028889502254e-05, "loss": 0.5479, "mean_token_accuracy": 0.8266471214592457, "num_tokens": 822779970.0, "step": 25780 }, { "entropy": 0.49559195432811975, "epoch": 2.3719817597368618, "grad_norm": 0.16297782957553864, "learning_rate": 2.0937222068880916e-05, "loss": 0.4873, "mean_token_accuracy": 0.8459451422095299, "num_tokens": 822811538.0, "step": 25781 }, { "entropy": 0.46217478066682816, "epoch": 2.372073766108303, "grad_norm": 0.151994988322258, "learning_rate": 2.093415524273929e-05, "loss": 0.4527, "mean_token_accuracy": 0.852303072810173, "num_tokens": 822843470.0, "step": 25782 }, { "entropy": 0.5444091716781259, "epoch": 2.372165772479744, "grad_norm": 0.16675707697868347, "learning_rate": 2.0931088416597662e-05, "loss": 0.5412, "mean_token_accuracy": 0.8296445608139038, "num_tokens": 822875748.0, "step": 25783 }, { "entropy": 0.5583274615928531, "epoch": 2.3722577788511856, "grad_norm": 0.16313278675079346, "learning_rate": 2.0928021590456037e-05, "loss": 0.539, "mean_token_accuracy": 0.8289195895195007, "num_tokens": 822907782.0, "step": 25784 }, { "entropy": 0.514779285993427, "epoch": 2.3723497852226267, "grad_norm": 0.1597016602754593, "learning_rate": 2.092495476431441e-05, "loss": 0.5004, "mean_token_accuracy": 0.8421835787594318, "num_tokens": 822939760.0, "step": 25785 }, { "entropy": 0.6073905350640416, "epoch": 2.372441791594068, "grad_norm": 0.16992001235485077, "learning_rate": 2.0921887938172786e-05, "loss": 0.5959, "mean_token_accuracy": 0.8083424009382725, "num_tokens": 822971495.0, "step": 25786 }, { "entropy": 0.452839570119977, "epoch": 2.372533797965509, "grad_norm": 0.15459652245044708, "learning_rate": 2.091882111203116e-05, "loss": 0.4408, "mean_token_accuracy": 0.8574892058968544, "num_tokens": 823003774.0, "step": 25787 }, { "entropy": 0.4943582871928811, "epoch": 2.37262580433695, "grad_norm": 0.15920698642730713, "learning_rate": 2.0915754285889532e-05, "loss": 0.478, "mean_token_accuracy": 0.8465146608650684, "num_tokens": 823035035.0, "step": 25788 }, { "entropy": 0.4447372378781438, "epoch": 2.3727178107083917, "grad_norm": 0.1505594551563263, "learning_rate": 2.0912687459747906e-05, "loss": 0.4359, "mean_token_accuracy": 0.8595007695257664, "num_tokens": 823066899.0, "step": 25789 }, { "entropy": 0.38903853157535195, "epoch": 2.372809817079833, "grad_norm": 0.14110662043094635, "learning_rate": 2.090962063360628e-05, "loss": 0.3694, "mean_token_accuracy": 0.8823918662965298, "num_tokens": 823099354.0, "step": 25790 }, { "entropy": 0.42990896943956614, "epoch": 2.372901823451274, "grad_norm": 0.1478475034236908, "learning_rate": 2.0906553807464656e-05, "loss": 0.417, "mean_token_accuracy": 0.8650495409965515, "num_tokens": 823131076.0, "step": 25791 }, { "entropy": 0.4521518498659134, "epoch": 2.372993829822715, "grad_norm": 0.15019738674163818, "learning_rate": 2.090348698132303e-05, "loss": 0.4427, "mean_token_accuracy": 0.8603444024920464, "num_tokens": 823163844.0, "step": 25792 }, { "entropy": 0.5570888975635171, "epoch": 2.3730858361941563, "grad_norm": 0.16687080264091492, "learning_rate": 2.0900420155181405e-05, "loss": 0.552, "mean_token_accuracy": 0.8276279680430889, "num_tokens": 823196054.0, "step": 25793 }, { "entropy": 0.5491012707352638, "epoch": 2.373177842565598, "grad_norm": 0.16072969138622284, "learning_rate": 2.089735332903978e-05, "loss": 0.5324, "mean_token_accuracy": 0.8311360627412796, "num_tokens": 823227885.0, "step": 25794 }, { "entropy": 0.5041112243197858, "epoch": 2.373269848937039, "grad_norm": 0.16113553941249847, "learning_rate": 2.0894286502898154e-05, "loss": 0.4842, "mean_token_accuracy": 0.8435670956969261, "num_tokens": 823259473.0, "step": 25795 }, { "entropy": 0.4806255176663399, "epoch": 2.37336185530848, "grad_norm": 0.1556052714586258, "learning_rate": 2.0891219676756526e-05, "loss": 0.4848, "mean_token_accuracy": 0.851337306201458, "num_tokens": 823290788.0, "step": 25796 }, { "entropy": 0.4963030191138387, "epoch": 2.3734538616799212, "grad_norm": 0.15276473760604858, "learning_rate": 2.08881528506149e-05, "loss": 0.4892, "mean_token_accuracy": 0.8470772244036198, "num_tokens": 823323280.0, "step": 25797 }, { "entropy": 0.6217903196811676, "epoch": 2.3735458680513624, "grad_norm": 0.16540300846099854, "learning_rate": 2.0885086024473275e-05, "loss": 0.6112, "mean_token_accuracy": 0.8108683452010155, "num_tokens": 823355408.0, "step": 25798 }, { "entropy": 0.513604924082756, "epoch": 2.373637874422804, "grad_norm": 0.15936753153800964, "learning_rate": 2.088201919833165e-05, "loss": 0.5014, "mean_token_accuracy": 0.8409341163933277, "num_tokens": 823387868.0, "step": 25799 }, { "entropy": 0.6281321458518505, "epoch": 2.373729880794245, "grad_norm": 0.1737850308418274, "learning_rate": 2.087895237219002e-05, "loss": 0.6137, "mean_token_accuracy": 0.8116971589624882, "num_tokens": 823420219.0, "step": 25800 }, { "entropy": 0.5248638954944909, "epoch": 2.373821887165686, "grad_norm": 0.16005992889404297, "learning_rate": 2.0875885546048395e-05, "loss": 0.5097, "mean_token_accuracy": 0.8409692868590355, "num_tokens": 823452106.0, "step": 25801 }, { "entropy": 0.6044590920209885, "epoch": 2.3739138935371273, "grad_norm": 0.17443960905075073, "learning_rate": 2.087281871990677e-05, "loss": 0.5851, "mean_token_accuracy": 0.8149963766336441, "num_tokens": 823484037.0, "step": 25802 }, { "entropy": 0.5352978371083736, "epoch": 2.3740058999085685, "grad_norm": 0.16177284717559814, "learning_rate": 2.0869751893765145e-05, "loss": 0.5187, "mean_token_accuracy": 0.8346748873591423, "num_tokens": 823515044.0, "step": 25803 }, { "entropy": 0.5031782519072294, "epoch": 2.37409790628001, "grad_norm": 0.1568748950958252, "learning_rate": 2.0866685067623516e-05, "loss": 0.4902, "mean_token_accuracy": 0.8418217822909355, "num_tokens": 823547382.0, "step": 25804 }, { "entropy": 0.5692551359534264, "epoch": 2.374189912651451, "grad_norm": 0.1723451316356659, "learning_rate": 2.086361824148189e-05, "loss": 0.5543, "mean_token_accuracy": 0.8291160687804222, "num_tokens": 823579964.0, "step": 25805 }, { "entropy": 0.45489203627221286, "epoch": 2.3742819190228923, "grad_norm": 0.15250860154628754, "learning_rate": 2.0860551415340265e-05, "loss": 0.4445, "mean_token_accuracy": 0.8625864833593369, "num_tokens": 823611059.0, "step": 25806 }, { "entropy": 0.561831939034164, "epoch": 2.3743739253943335, "grad_norm": 0.1703481823205948, "learning_rate": 2.085748458919864e-05, "loss": 0.5441, "mean_token_accuracy": 0.8242750279605389, "num_tokens": 823642416.0, "step": 25807 }, { "entropy": 0.5133491074666381, "epoch": 2.3744659317657746, "grad_norm": 0.1615981161594391, "learning_rate": 2.0854417763057015e-05, "loss": 0.5085, "mean_token_accuracy": 0.8375977016985416, "num_tokens": 823675184.0, "step": 25808 }, { "entropy": 0.5209038117900491, "epoch": 2.374557938137216, "grad_norm": 0.1559821367263794, "learning_rate": 2.0851350936915386e-05, "loss": 0.5113, "mean_token_accuracy": 0.8386948518455029, "num_tokens": 823706802.0, "step": 25809 }, { "entropy": 0.6093788053840399, "epoch": 2.3746499445086573, "grad_norm": 0.1648399531841278, "learning_rate": 2.084828411077376e-05, "loss": 0.5897, "mean_token_accuracy": 0.815287534147501, "num_tokens": 823738715.0, "step": 25810 }, { "entropy": 0.5051299049519002, "epoch": 2.3747419508800984, "grad_norm": 0.16083866357803345, "learning_rate": 2.0845217284632135e-05, "loss": 0.4891, "mean_token_accuracy": 0.846304003149271, "num_tokens": 823770260.0, "step": 25811 }, { "entropy": 0.5385047430172563, "epoch": 2.3748339572515396, "grad_norm": 0.16397373378276825, "learning_rate": 2.084215045849051e-05, "loss": 0.531, "mean_token_accuracy": 0.8300644569098949, "num_tokens": 823802593.0, "step": 25812 }, { "entropy": 0.5011907620355487, "epoch": 2.3749259636229807, "grad_norm": 0.1585693210363388, "learning_rate": 2.083908363234888e-05, "loss": 0.4848, "mean_token_accuracy": 0.8440257906913757, "num_tokens": 823834390.0, "step": 25813 }, { "entropy": 0.48879929911345243, "epoch": 2.3750179699944223, "grad_norm": 0.1602981686592102, "learning_rate": 2.0836016806207256e-05, "loss": 0.4711, "mean_token_accuracy": 0.8475508689880371, "num_tokens": 823866160.0, "step": 25814 }, { "entropy": 0.4711970016360283, "epoch": 2.3751099763658634, "grad_norm": 0.1609192043542862, "learning_rate": 2.083294998006563e-05, "loss": 0.4712, "mean_token_accuracy": 0.8505725264549255, "num_tokens": 823898338.0, "step": 25815 }, { "entropy": 0.5266372212208807, "epoch": 2.3752019827373045, "grad_norm": 0.15724918246269226, "learning_rate": 2.0829883153924005e-05, "loss": 0.52, "mean_token_accuracy": 0.833451509475708, "num_tokens": 823930660.0, "step": 25816 }, { "entropy": 0.5191068975254893, "epoch": 2.3752939891087457, "grad_norm": 0.1605096012353897, "learning_rate": 2.082681632778238e-05, "loss": 0.5019, "mean_token_accuracy": 0.841172605752945, "num_tokens": 823962558.0, "step": 25817 }, { "entropy": 0.5154095208272338, "epoch": 2.375385995480187, "grad_norm": 0.16898825764656067, "learning_rate": 2.082374950164075e-05, "loss": 0.5175, "mean_token_accuracy": 0.834997795522213, "num_tokens": 823993681.0, "step": 25818 }, { "entropy": 0.510389216709882, "epoch": 2.3754780018516284, "grad_norm": 0.1633961796760559, "learning_rate": 2.0820682675499126e-05, "loss": 0.5128, "mean_token_accuracy": 0.8385244682431221, "num_tokens": 824026072.0, "step": 25819 }, { "entropy": 0.546795504167676, "epoch": 2.3755700082230695, "grad_norm": 0.1623736321926117, "learning_rate": 2.08176158493575e-05, "loss": 0.5266, "mean_token_accuracy": 0.8368657864630222, "num_tokens": 824057878.0, "step": 25820 }, { "entropy": 0.5266191866248846, "epoch": 2.3756620145945107, "grad_norm": 0.16650384664535522, "learning_rate": 2.0814549023215875e-05, "loss": 0.5191, "mean_token_accuracy": 0.8360488601028919, "num_tokens": 824089873.0, "step": 25821 }, { "entropy": 0.4439473347738385, "epoch": 2.375754020965952, "grad_norm": 0.1518225371837616, "learning_rate": 2.081148219707425e-05, "loss": 0.4322, "mean_token_accuracy": 0.8638092130422592, "num_tokens": 824121989.0, "step": 25822 }, { "entropy": 0.4985537799075246, "epoch": 2.375846027337393, "grad_norm": 0.15935808420181274, "learning_rate": 2.0808415370932624e-05, "loss": 0.4856, "mean_token_accuracy": 0.8474927172064781, "num_tokens": 824153603.0, "step": 25823 }, { "entropy": 0.49546638736501336, "epoch": 2.3759380337088345, "grad_norm": 0.16280370950698853, "learning_rate": 2.0805348544791e-05, "loss": 0.4894, "mean_token_accuracy": 0.8460226431488991, "num_tokens": 824185464.0, "step": 25824 }, { "entropy": 0.5156042613089085, "epoch": 2.3760300400802756, "grad_norm": 0.16080118715763092, "learning_rate": 2.0802281718649373e-05, "loss": 0.5001, "mean_token_accuracy": 0.8387511745095253, "num_tokens": 824217821.0, "step": 25825 }, { "entropy": 0.5073393601924181, "epoch": 2.3761220464517168, "grad_norm": 0.15903666615486145, "learning_rate": 2.0799214892507745e-05, "loss": 0.4774, "mean_token_accuracy": 0.8442962542176247, "num_tokens": 824248859.0, "step": 25826 }, { "entropy": 0.4591219602152705, "epoch": 2.376214052823158, "grad_norm": 0.1497235745191574, "learning_rate": 2.079614806636612e-05, "loss": 0.4397, "mean_token_accuracy": 0.8598162904381752, "num_tokens": 824280756.0, "step": 25827 }, { "entropy": 0.5608613919466734, "epoch": 2.376306059194599, "grad_norm": 0.1694476157426834, "learning_rate": 2.0793081240224494e-05, "loss": 0.5508, "mean_token_accuracy": 0.8247724510729313, "num_tokens": 824311874.0, "step": 25828 }, { "entropy": 0.5635760352015495, "epoch": 2.3763980655660406, "grad_norm": 0.16263307631015778, "learning_rate": 2.079001441408287e-05, "loss": 0.552, "mean_token_accuracy": 0.8235451467335224, "num_tokens": 824344189.0, "step": 25829 }, { "entropy": 0.5442386139184237, "epoch": 2.3764900719374817, "grad_norm": 0.16632680594921112, "learning_rate": 2.078694758794124e-05, "loss": 0.5327, "mean_token_accuracy": 0.8324128873646259, "num_tokens": 824375602.0, "step": 25830 }, { "entropy": 0.6126197027042508, "epoch": 2.376582078308923, "grad_norm": 0.17415748536586761, "learning_rate": 2.0783880761799615e-05, "loss": 0.5882, "mean_token_accuracy": 0.817116491496563, "num_tokens": 824406831.0, "step": 25831 }, { "entropy": 0.5734748244285583, "epoch": 2.376674084680364, "grad_norm": 0.16452011466026306, "learning_rate": 2.078081393565799e-05, "loss": 0.5594, "mean_token_accuracy": 0.8210068233311176, "num_tokens": 824438840.0, "step": 25832 }, { "entropy": 0.48877802793867886, "epoch": 2.376766091051805, "grad_norm": 0.15810152888298035, "learning_rate": 2.0777747109516364e-05, "loss": 0.4818, "mean_token_accuracy": 0.8498333245515823, "num_tokens": 824470030.0, "step": 25833 }, { "entropy": 0.5695974947884679, "epoch": 2.3768580974232467, "grad_norm": 0.16661344468593597, "learning_rate": 2.0774680283374735e-05, "loss": 0.5554, "mean_token_accuracy": 0.8224705681204796, "num_tokens": 824501905.0, "step": 25834 }, { "entropy": 0.49095697957091033, "epoch": 2.376950103794688, "grad_norm": 0.15634861588478088, "learning_rate": 2.077161345723311e-05, "loss": 0.4838, "mean_token_accuracy": 0.8466938734054565, "num_tokens": 824534050.0, "step": 25835 }, { "entropy": 0.5745888072997332, "epoch": 2.377042110166129, "grad_norm": 0.16464343667030334, "learning_rate": 2.0768546631091484e-05, "loss": 0.5698, "mean_token_accuracy": 0.8163165599107742, "num_tokens": 824566818.0, "step": 25836 }, { "entropy": 0.47202992625534534, "epoch": 2.37713411653757, "grad_norm": 0.15492796897888184, "learning_rate": 2.076547980494986e-05, "loss": 0.4615, "mean_token_accuracy": 0.853841420263052, "num_tokens": 824599409.0, "step": 25837 }, { "entropy": 0.4600107320584357, "epoch": 2.3772261229090113, "grad_norm": 0.1580265760421753, "learning_rate": 2.0762412978808234e-05, "loss": 0.4531, "mean_token_accuracy": 0.8573556132614613, "num_tokens": 824631685.0, "step": 25838 }, { "entropy": 0.5093472097069025, "epoch": 2.377318129280453, "grad_norm": 0.16146047413349152, "learning_rate": 2.0759346152666605e-05, "loss": 0.4946, "mean_token_accuracy": 0.8458077311515808, "num_tokens": 824663610.0, "step": 25839 }, { "entropy": 0.46023987978696823, "epoch": 2.377410135651894, "grad_norm": 0.151123508810997, "learning_rate": 2.075627932652498e-05, "loss": 0.4576, "mean_token_accuracy": 0.8564922623336315, "num_tokens": 824695959.0, "step": 25840 }, { "entropy": 0.5622863054741174, "epoch": 2.377502142023335, "grad_norm": 0.16520239412784576, "learning_rate": 2.0753212500383354e-05, "loss": 0.546, "mean_token_accuracy": 0.8281807377934456, "num_tokens": 824727901.0, "step": 25841 }, { "entropy": 0.5312357593793422, "epoch": 2.3775941483947762, "grad_norm": 0.16383448243141174, "learning_rate": 2.075014567424173e-05, "loss": 0.5139, "mean_token_accuracy": 0.8413306064903736, "num_tokens": 824759693.0, "step": 25842 }, { "entropy": 0.5781342200934887, "epoch": 2.3776861547662174, "grad_norm": 0.16884425282478333, "learning_rate": 2.07470788481001e-05, "loss": 0.5713, "mean_token_accuracy": 0.8172883540391922, "num_tokens": 824790956.0, "step": 25843 }, { "entropy": 0.5668205972760916, "epoch": 2.377778161137659, "grad_norm": 0.16102944314479828, "learning_rate": 2.0744012021958475e-05, "loss": 0.551, "mean_token_accuracy": 0.8260858729481697, "num_tokens": 824823544.0, "step": 25844 }, { "entropy": 0.5133787859231234, "epoch": 2.3778701675091, "grad_norm": 0.16599534451961517, "learning_rate": 2.074094519581685e-05, "loss": 0.503, "mean_token_accuracy": 0.8387409225106239, "num_tokens": 824855545.0, "step": 25845 }, { "entropy": 0.4233817118220031, "epoch": 2.377962173880541, "grad_norm": 0.1526292860507965, "learning_rate": 2.0737878369675224e-05, "loss": 0.4199, "mean_token_accuracy": 0.8617386743426323, "num_tokens": 824887356.0, "step": 25846 }, { "entropy": 0.5533284395933151, "epoch": 2.3780541802519823, "grad_norm": 0.15558716654777527, "learning_rate": 2.07348115435336e-05, "loss": 0.5233, "mean_token_accuracy": 0.833095196634531, "num_tokens": 824918843.0, "step": 25847 }, { "entropy": 0.524910387583077, "epoch": 2.3781461866234235, "grad_norm": 0.15965649485588074, "learning_rate": 2.073174471739197e-05, "loss": 0.5181, "mean_token_accuracy": 0.8353317901492119, "num_tokens": 824950268.0, "step": 25848 }, { "entropy": 0.5302088316529989, "epoch": 2.378238192994865, "grad_norm": 0.1693081259727478, "learning_rate": 2.0728677891250345e-05, "loss": 0.5162, "mean_token_accuracy": 0.832400631159544, "num_tokens": 824981040.0, "step": 25849 }, { "entropy": 0.4801434511318803, "epoch": 2.378330199366306, "grad_norm": 0.15709340572357178, "learning_rate": 2.072561106510872e-05, "loss": 0.479, "mean_token_accuracy": 0.8490546867251396, "num_tokens": 825013375.0, "step": 25850 }, { "entropy": 0.47138975467532873, "epoch": 2.3784222057377473, "grad_norm": 0.15363475680351257, "learning_rate": 2.0722544238967094e-05, "loss": 0.4551, "mean_token_accuracy": 0.8543913178145885, "num_tokens": 825045568.0, "step": 25851 }, { "entropy": 0.4998994735069573, "epoch": 2.3785142121091885, "grad_norm": 0.15593880414962769, "learning_rate": 2.071947741282547e-05, "loss": 0.4916, "mean_token_accuracy": 0.8487939387559891, "num_tokens": 825077607.0, "step": 25852 }, { "entropy": 0.3991223117336631, "epoch": 2.3786062184806296, "grad_norm": 0.14233161509037018, "learning_rate": 2.0716410586683843e-05, "loss": 0.3864, "mean_token_accuracy": 0.8750565350055695, "num_tokens": 825109851.0, "step": 25853 }, { "entropy": 0.5227622790262103, "epoch": 2.378698224852071, "grad_norm": 0.15641175210475922, "learning_rate": 2.0713343760542218e-05, "loss": 0.5148, "mean_token_accuracy": 0.8384633287787437, "num_tokens": 825141927.0, "step": 25854 }, { "entropy": 0.51039969176054, "epoch": 2.3787902312235123, "grad_norm": 0.1605255901813507, "learning_rate": 2.0710276934400593e-05, "loss": 0.513, "mean_token_accuracy": 0.8412904590368271, "num_tokens": 825173653.0, "step": 25855 }, { "entropy": 0.525703689083457, "epoch": 2.3788822375949534, "grad_norm": 0.1616133451461792, "learning_rate": 2.0707210108258964e-05, "loss": 0.5151, "mean_token_accuracy": 0.8352042362093925, "num_tokens": 825205946.0, "step": 25856 }, { "entropy": 0.5758435390889645, "epoch": 2.3789742439663946, "grad_norm": 0.16650500893592834, "learning_rate": 2.070414328211734e-05, "loss": 0.5657, "mean_token_accuracy": 0.8225490376353264, "num_tokens": 825238074.0, "step": 25857 }, { "entropy": 0.5174146029166877, "epoch": 2.3790662503378357, "grad_norm": 0.16120734810829163, "learning_rate": 2.0701076455975713e-05, "loss": 0.5022, "mean_token_accuracy": 0.8386805467307568, "num_tokens": 825269664.0, "step": 25858 }, { "entropy": 0.39651605440303683, "epoch": 2.3791582567092773, "grad_norm": 0.14601902663707733, "learning_rate": 2.0698009629834088e-05, "loss": 0.3916, "mean_token_accuracy": 0.8745321370661259, "num_tokens": 825302008.0, "step": 25859 }, { "entropy": 0.4729943023994565, "epoch": 2.3792502630807184, "grad_norm": 0.15114152431488037, "learning_rate": 2.069494280369246e-05, "loss": 0.4501, "mean_token_accuracy": 0.8587107919156551, "num_tokens": 825334558.0, "step": 25860 }, { "entropy": 0.6731477044522762, "epoch": 2.3793422694521595, "grad_norm": 0.17072172462940216, "learning_rate": 2.0691875977550834e-05, "loss": 0.6503, "mean_token_accuracy": 0.7962285540997982, "num_tokens": 825367014.0, "step": 25861 }, { "entropy": 0.5252726580947638, "epoch": 2.3794342758236007, "grad_norm": 0.16014456748962402, "learning_rate": 2.0688809151409208e-05, "loss": 0.5147, "mean_token_accuracy": 0.8373378366231918, "num_tokens": 825399731.0, "step": 25862 }, { "entropy": 0.5416075633838773, "epoch": 2.379526282195042, "grad_norm": 0.16116903722286224, "learning_rate": 2.0685742325267583e-05, "loss": 0.5194, "mean_token_accuracy": 0.8347915820777416, "num_tokens": 825431137.0, "step": 25863 }, { "entropy": 0.5712365116924047, "epoch": 2.3796182885664834, "grad_norm": 0.16396665573120117, "learning_rate": 2.0682675499125954e-05, "loss": 0.5497, "mean_token_accuracy": 0.8279120326042175, "num_tokens": 825463205.0, "step": 25864 }, { "entropy": 0.47906726598739624, "epoch": 2.3797102949379245, "grad_norm": 0.15877453982830048, "learning_rate": 2.067960867298433e-05, "loss": 0.4719, "mean_token_accuracy": 0.8490740917623043, "num_tokens": 825494932.0, "step": 25865 }, { "entropy": 0.5789443185785785, "epoch": 2.3798023013093657, "grad_norm": 0.16969341039657593, "learning_rate": 2.0676541846842703e-05, "loss": 0.5585, "mean_token_accuracy": 0.8215925544500351, "num_tokens": 825526185.0, "step": 25866 }, { "entropy": 0.5045758378691971, "epoch": 2.379894307680807, "grad_norm": 0.15824896097183228, "learning_rate": 2.0673475020701078e-05, "loss": 0.4903, "mean_token_accuracy": 0.8447554782032967, "num_tokens": 825557725.0, "step": 25867 }, { "entropy": 0.46349386032670736, "epoch": 2.379986314052248, "grad_norm": 0.15214894711971283, "learning_rate": 2.0670408194559453e-05, "loss": 0.4463, "mean_token_accuracy": 0.8557786010205746, "num_tokens": 825589986.0, "step": 25868 }, { "entropy": 0.507754372432828, "epoch": 2.3800783204236895, "grad_norm": 0.15921451151371002, "learning_rate": 2.0667341368417824e-05, "loss": 0.4892, "mean_token_accuracy": 0.8436979092657566, "num_tokens": 825621781.0, "step": 25869 }, { "entropy": 0.4974041630048305, "epoch": 2.3801703267951306, "grad_norm": 0.1597600281238556, "learning_rate": 2.06642745422762e-05, "loss": 0.4781, "mean_token_accuracy": 0.8486153483390808, "num_tokens": 825653160.0, "step": 25870 }, { "entropy": 0.5472579477354884, "epoch": 2.3802623331665718, "grad_norm": 0.16791489720344543, "learning_rate": 2.0661207716134573e-05, "loss": 0.5421, "mean_token_accuracy": 0.8297888077795506, "num_tokens": 825685277.0, "step": 25871 }, { "entropy": 0.5718789957463741, "epoch": 2.380354339538013, "grad_norm": 0.16938020288944244, "learning_rate": 2.0658140889992948e-05, "loss": 0.562, "mean_token_accuracy": 0.8221174515783787, "num_tokens": 825717041.0, "step": 25872 }, { "entropy": 0.555017426609993, "epoch": 2.380446345909454, "grad_norm": 0.16075724363327026, "learning_rate": 2.065507406385132e-05, "loss": 0.538, "mean_token_accuracy": 0.8289935365319252, "num_tokens": 825748553.0, "step": 25873 }, { "entropy": 0.49509680178016424, "epoch": 2.3805383522808956, "grad_norm": 0.15924659371376038, "learning_rate": 2.0652007237709694e-05, "loss": 0.4816, "mean_token_accuracy": 0.845067135989666, "num_tokens": 825780483.0, "step": 25874 }, { "entropy": 0.47908139368519187, "epoch": 2.3806303586523367, "grad_norm": 0.1543668806552887, "learning_rate": 2.064894041156807e-05, "loss": 0.4713, "mean_token_accuracy": 0.8498321585357189, "num_tokens": 825813033.0, "step": 25875 }, { "entropy": 0.5066130328923464, "epoch": 2.380722365023778, "grad_norm": 0.16175256669521332, "learning_rate": 2.0645873585426443e-05, "loss": 0.4971, "mean_token_accuracy": 0.8430140689015388, "num_tokens": 825845125.0, "step": 25876 }, { "entropy": 0.568053275346756, "epoch": 2.380814371395219, "grad_norm": 0.16927622258663177, "learning_rate": 2.0642806759284818e-05, "loss": 0.5636, "mean_token_accuracy": 0.8226006254553795, "num_tokens": 825876435.0, "step": 25877 }, { "entropy": 0.5931488643400371, "epoch": 2.38090637776666, "grad_norm": 0.16693143546581268, "learning_rate": 2.063973993314319e-05, "loss": 0.5869, "mean_token_accuracy": 0.8163832388818264, "num_tokens": 825908268.0, "step": 25878 }, { "entropy": 0.5475636799819767, "epoch": 2.3809983841381017, "grad_norm": 0.16924087703227997, "learning_rate": 2.0636673107001564e-05, "loss": 0.5465, "mean_token_accuracy": 0.8292589224874973, "num_tokens": 825939524.0, "step": 25879 }, { "entropy": 0.5204731160774827, "epoch": 2.381090390509543, "grad_norm": 0.16391995549201965, "learning_rate": 2.063360628085994e-05, "loss": 0.5188, "mean_token_accuracy": 0.8394138142466545, "num_tokens": 825970816.0, "step": 25880 }, { "entropy": 0.5219220295548439, "epoch": 2.381182396880984, "grad_norm": 0.1562340408563614, "learning_rate": 2.0630539454718313e-05, "loss": 0.5084, "mean_token_accuracy": 0.8403976410627365, "num_tokens": 826003036.0, "step": 25881 }, { "entropy": 0.5775115136057138, "epoch": 2.381274403252425, "grad_norm": 0.1696782410144806, "learning_rate": 2.0627472628576684e-05, "loss": 0.5705, "mean_token_accuracy": 0.8203858509659767, "num_tokens": 826035183.0, "step": 25882 }, { "entropy": 0.5678508169949055, "epoch": 2.3813664096238663, "grad_norm": 0.16177619993686676, "learning_rate": 2.0624405802435062e-05, "loss": 0.5533, "mean_token_accuracy": 0.8243931084871292, "num_tokens": 826067279.0, "step": 25883 }, { "entropy": 0.5427110437303782, "epoch": 2.381458415995308, "grad_norm": 0.16702044010162354, "learning_rate": 2.0621338976293437e-05, "loss": 0.5378, "mean_token_accuracy": 0.8319164216518402, "num_tokens": 826098474.0, "step": 25884 }, { "entropy": 0.42329040821641684, "epoch": 2.381550422366749, "grad_norm": 0.14473743736743927, "learning_rate": 2.061827215015181e-05, "loss": 0.4088, "mean_token_accuracy": 0.8679927960038185, "num_tokens": 826130749.0, "step": 25885 }, { "entropy": 0.45802905410528183, "epoch": 2.38164242873819, "grad_norm": 0.15500357747077942, "learning_rate": 2.0615205324010183e-05, "loss": 0.4481, "mean_token_accuracy": 0.8589239455759525, "num_tokens": 826162938.0, "step": 25886 }, { "entropy": 0.49927312368527055, "epoch": 2.3817344351096312, "grad_norm": 0.15867415070533752, "learning_rate": 2.0612138497868558e-05, "loss": 0.4845, "mean_token_accuracy": 0.8445011004805565, "num_tokens": 826195404.0, "step": 25887 }, { "entropy": 0.5473742266185582, "epoch": 2.3818264414810724, "grad_norm": 0.16004277765750885, "learning_rate": 2.0609071671726932e-05, "loss": 0.5287, "mean_token_accuracy": 0.8310508988797665, "num_tokens": 826227550.0, "step": 25888 }, { "entropy": 0.5131469331681728, "epoch": 2.381918447852514, "grad_norm": 0.15568168461322784, "learning_rate": 2.0606004845585307e-05, "loss": 0.4999, "mean_token_accuracy": 0.8396494537591934, "num_tokens": 826259927.0, "step": 25889 }, { "entropy": 0.5377856781706214, "epoch": 2.382010454223955, "grad_norm": 0.16173651814460754, "learning_rate": 2.0602938019443678e-05, "loss": 0.5163, "mean_token_accuracy": 0.8364325650036335, "num_tokens": 826291978.0, "step": 25890 }, { "entropy": 0.46619252022355795, "epoch": 2.382102460595396, "grad_norm": 0.15599152445793152, "learning_rate": 2.0599871193302053e-05, "loss": 0.4592, "mean_token_accuracy": 0.8530080057680607, "num_tokens": 826324229.0, "step": 25891 }, { "entropy": 0.6853569112718105, "epoch": 2.3821944669668373, "grad_norm": 0.18118664622306824, "learning_rate": 2.0596804367160427e-05, "loss": 0.6756, "mean_token_accuracy": 0.7858183681964874, "num_tokens": 826355807.0, "step": 25892 }, { "entropy": 0.5088647180236876, "epoch": 2.3822864733382785, "grad_norm": 0.16011229157447815, "learning_rate": 2.0593737541018802e-05, "loss": 0.4943, "mean_token_accuracy": 0.8424270749092102, "num_tokens": 826386982.0, "step": 25893 }, { "entropy": 0.5582432728260756, "epoch": 2.38237847970972, "grad_norm": 0.1750139594078064, "learning_rate": 2.0590670714877173e-05, "loss": 0.5607, "mean_token_accuracy": 0.8225109502673149, "num_tokens": 826418875.0, "step": 25894 }, { "entropy": 0.5631539290770888, "epoch": 2.382470486081161, "grad_norm": 0.16580963134765625, "learning_rate": 2.0587603888735548e-05, "loss": 0.5567, "mean_token_accuracy": 0.8264936096966267, "num_tokens": 826450746.0, "step": 25895 }, { "entropy": 0.4684787499718368, "epoch": 2.3825624924526023, "grad_norm": 0.17025139927864075, "learning_rate": 2.0584537062593923e-05, "loss": 0.4599, "mean_token_accuracy": 0.849850632250309, "num_tokens": 826481945.0, "step": 25896 }, { "entropy": 0.5394230782985687, "epoch": 2.3826544988240435, "grad_norm": 0.1638023406267166, "learning_rate": 2.0581470236452297e-05, "loss": 0.5352, "mean_token_accuracy": 0.8331033326685429, "num_tokens": 826514396.0, "step": 25897 }, { "entropy": 0.5824037007987499, "epoch": 2.3827465051954846, "grad_norm": 0.17241357266902924, "learning_rate": 2.0578403410310672e-05, "loss": 0.5731, "mean_token_accuracy": 0.8194015771150589, "num_tokens": 826545808.0, "step": 25898 }, { "entropy": 0.5612873532809317, "epoch": 2.382838511566926, "grad_norm": 0.17056867480278015, "learning_rate": 2.0575336584169043e-05, "loss": 0.5462, "mean_token_accuracy": 0.826900340616703, "num_tokens": 826576548.0, "step": 25899 }, { "entropy": 0.5581387337297201, "epoch": 2.3829305179383673, "grad_norm": 0.16734643280506134, "learning_rate": 2.0572269758027418e-05, "loss": 0.5564, "mean_token_accuracy": 0.8249708041548729, "num_tokens": 826608930.0, "step": 25900 }, { "entropy": 0.5873732529580593, "epoch": 2.3830225243098084, "grad_norm": 0.1713734120130539, "learning_rate": 2.0569202931885792e-05, "loss": 0.5686, "mean_token_accuracy": 0.8185121640563011, "num_tokens": 826640007.0, "step": 25901 }, { "entropy": 0.5119242733344436, "epoch": 2.3831145306812496, "grad_norm": 0.1574266254901886, "learning_rate": 2.0566136105744167e-05, "loss": 0.4907, "mean_token_accuracy": 0.8412097133696079, "num_tokens": 826671941.0, "step": 25902 }, { "entropy": 0.5301620168611407, "epoch": 2.3832065370526907, "grad_norm": 0.1615232229232788, "learning_rate": 2.056306927960254e-05, "loss": 0.5171, "mean_token_accuracy": 0.8362441919744015, "num_tokens": 826703868.0, "step": 25903 }, { "entropy": 0.5355892949737608, "epoch": 2.3832985434241323, "grad_norm": 0.1556517779827118, "learning_rate": 2.0560002453460913e-05, "loss": 0.5081, "mean_token_accuracy": 0.8397416025400162, "num_tokens": 826735961.0, "step": 25904 }, { "entropy": 0.5464420272037387, "epoch": 2.3833905497955734, "grad_norm": 0.16142752766609192, "learning_rate": 2.0556935627319288e-05, "loss": 0.5199, "mean_token_accuracy": 0.8350022546947002, "num_tokens": 826767957.0, "step": 25905 }, { "entropy": 0.5104989111423492, "epoch": 2.3834825561670145, "grad_norm": 0.16456343233585358, "learning_rate": 2.0553868801177662e-05, "loss": 0.4943, "mean_token_accuracy": 0.8419021442532539, "num_tokens": 826800287.0, "step": 25906 }, { "entropy": 0.5672890618443489, "epoch": 2.3835745625384557, "grad_norm": 0.16622059047222137, "learning_rate": 2.0550801975036037e-05, "loss": 0.5544, "mean_token_accuracy": 0.82893967628479, "num_tokens": 826832426.0, "step": 25907 }, { "entropy": 0.5227971961721778, "epoch": 2.383666568909897, "grad_norm": 0.161079540848732, "learning_rate": 2.0547735148894408e-05, "loss": 0.5146, "mean_token_accuracy": 0.8371739946305752, "num_tokens": 826864581.0, "step": 25908 }, { "entropy": 0.496181447757408, "epoch": 2.3837585752813384, "grad_norm": 0.15435706079006195, "learning_rate": 2.0544668322752783e-05, "loss": 0.4782, "mean_token_accuracy": 0.849008996039629, "num_tokens": 826897207.0, "step": 25909 }, { "entropy": 0.4524620436131954, "epoch": 2.3838505816527795, "grad_norm": 0.14914052188396454, "learning_rate": 2.0541601496611157e-05, "loss": 0.4333, "mean_token_accuracy": 0.861801877617836, "num_tokens": 826929417.0, "step": 25910 }, { "entropy": 0.5379295321181417, "epoch": 2.3839425880242207, "grad_norm": 0.16358782351016998, "learning_rate": 2.0538534670469532e-05, "loss": 0.5327, "mean_token_accuracy": 0.831787459552288, "num_tokens": 826961608.0, "step": 25911 }, { "entropy": 0.5400712471455336, "epoch": 2.384034594395662, "grad_norm": 0.16207663714885712, "learning_rate": 2.0535467844327903e-05, "loss": 0.5319, "mean_token_accuracy": 0.8283062428236008, "num_tokens": 826994017.0, "step": 25912 }, { "entropy": 0.5749440554063767, "epoch": 2.384126600767103, "grad_norm": 0.16806796193122864, "learning_rate": 2.053240101818628e-05, "loss": 0.5634, "mean_token_accuracy": 0.8208496533334255, "num_tokens": 827025707.0, "step": 25913 }, { "entropy": 0.5727726984769106, "epoch": 2.3842186071385445, "grad_norm": 0.17198924720287323, "learning_rate": 2.0529334192044656e-05, "loss": 0.5648, "mean_token_accuracy": 0.8233381845057011, "num_tokens": 827057205.0, "step": 25914 }, { "entropy": 0.4825392896309495, "epoch": 2.3843106135099856, "grad_norm": 0.15945225954055786, "learning_rate": 2.052626736590303e-05, "loss": 0.4688, "mean_token_accuracy": 0.8477211706340313, "num_tokens": 827089182.0, "step": 25915 }, { "entropy": 0.4957933556288481, "epoch": 2.3844026198814268, "grad_norm": 0.16051021218299866, "learning_rate": 2.0523200539761402e-05, "loss": 0.4895, "mean_token_accuracy": 0.8457416743040085, "num_tokens": 827120712.0, "step": 25916 }, { "entropy": 0.47375369165092707, "epoch": 2.384494626252868, "grad_norm": 0.1528744101524353, "learning_rate": 2.0520133713619777e-05, "loss": 0.4622, "mean_token_accuracy": 0.8504408448934555, "num_tokens": 827153208.0, "step": 25917 }, { "entropy": 0.4149596532806754, "epoch": 2.384586632624309, "grad_norm": 0.14634756743907928, "learning_rate": 2.051706688747815e-05, "loss": 0.3959, "mean_token_accuracy": 0.8714150972664356, "num_tokens": 827185571.0, "step": 25918 }, { "entropy": 0.6283595031127334, "epoch": 2.3846786389957506, "grad_norm": 0.17380118370056152, "learning_rate": 2.0514000061336526e-05, "loss": 0.6283, "mean_token_accuracy": 0.8046891242265701, "num_tokens": 827217375.0, "step": 25919 }, { "entropy": 0.6556400395929813, "epoch": 2.3847706453671917, "grad_norm": 0.1769297868013382, "learning_rate": 2.0510933235194897e-05, "loss": 0.6453, "mean_token_accuracy": 0.7988788336515427, "num_tokens": 827249582.0, "step": 25920 }, { "entropy": 0.5786352567374706, "epoch": 2.384862651738633, "grad_norm": 0.16963008046150208, "learning_rate": 2.0507866409053272e-05, "loss": 0.5761, "mean_token_accuracy": 0.8210183680057526, "num_tokens": 827281614.0, "step": 25921 }, { "entropy": 0.5124780032783747, "epoch": 2.384954658110074, "grad_norm": 0.1610480397939682, "learning_rate": 2.0504799582911646e-05, "loss": 0.4999, "mean_token_accuracy": 0.8410065174102783, "num_tokens": 827312826.0, "step": 25922 }, { "entropy": 0.5059288162738085, "epoch": 2.385046664481515, "grad_norm": 0.16461288928985596, "learning_rate": 2.050173275677002e-05, "loss": 0.4866, "mean_token_accuracy": 0.8455861508846283, "num_tokens": 827344626.0, "step": 25923 }, { "entropy": 0.5014519435353577, "epoch": 2.3851386708529567, "grad_norm": 0.1577492654323578, "learning_rate": 2.0498665930628392e-05, "loss": 0.4894, "mean_token_accuracy": 0.8489733561873436, "num_tokens": 827376363.0, "step": 25924 }, { "entropy": 0.5778761389665306, "epoch": 2.385230677224398, "grad_norm": 0.16530567407608032, "learning_rate": 2.0495599104486767e-05, "loss": 0.5642, "mean_token_accuracy": 0.8256405740976334, "num_tokens": 827407888.0, "step": 25925 }, { "entropy": 0.47645785426720977, "epoch": 2.385322683595839, "grad_norm": 0.1539819985628128, "learning_rate": 2.049253227834514e-05, "loss": 0.4559, "mean_token_accuracy": 0.8531432747840881, "num_tokens": 827440022.0, "step": 25926 }, { "entropy": 0.4857247518375516, "epoch": 2.38541468996728, "grad_norm": 0.15596149861812592, "learning_rate": 2.0489465452203516e-05, "loss": 0.4845, "mean_token_accuracy": 0.8452218733727932, "num_tokens": 827472327.0, "step": 25927 }, { "entropy": 0.5775676919147372, "epoch": 2.3855066963387213, "grad_norm": 0.1651666909456253, "learning_rate": 2.048639862606189e-05, "loss": 0.5656, "mean_token_accuracy": 0.8215981163084507, "num_tokens": 827504235.0, "step": 25928 }, { "entropy": 0.46402856428176165, "epoch": 2.385598702710163, "grad_norm": 0.1551714986562729, "learning_rate": 2.0483331799920262e-05, "loss": 0.4523, "mean_token_accuracy": 0.8568431250751019, "num_tokens": 827536254.0, "step": 25929 }, { "entropy": 0.5684116929769516, "epoch": 2.385690709081604, "grad_norm": 0.1703130304813385, "learning_rate": 2.0480264973778637e-05, "loss": 0.5445, "mean_token_accuracy": 0.8243907988071442, "num_tokens": 827567736.0, "step": 25930 }, { "entropy": 0.5204666946083307, "epoch": 2.385782715453045, "grad_norm": 0.1596682369709015, "learning_rate": 2.047719814763701e-05, "loss": 0.4934, "mean_token_accuracy": 0.8443445786833763, "num_tokens": 827599920.0, "step": 25931 }, { "entropy": 0.5063245352357626, "epoch": 2.3858747218244862, "grad_norm": 0.15960073471069336, "learning_rate": 2.0474131321495386e-05, "loss": 0.4894, "mean_token_accuracy": 0.8431854695081711, "num_tokens": 827631902.0, "step": 25932 }, { "entropy": 0.5391277363523841, "epoch": 2.3859667281959274, "grad_norm": 0.16594447195529938, "learning_rate": 2.0471064495353757e-05, "loss": 0.5273, "mean_token_accuracy": 0.835563912987709, "num_tokens": 827663497.0, "step": 25933 }, { "entropy": 0.5754137029871345, "epoch": 2.386058734567369, "grad_norm": 0.17548662424087524, "learning_rate": 2.0467997669212132e-05, "loss": 0.5673, "mean_token_accuracy": 0.8226985409855843, "num_tokens": 827694299.0, "step": 25934 }, { "entropy": 0.5554325599223375, "epoch": 2.38615074093881, "grad_norm": 0.1627846211194992, "learning_rate": 2.0464930843070507e-05, "loss": 0.5304, "mean_token_accuracy": 0.8340284712612629, "num_tokens": 827726255.0, "step": 25935 }, { "entropy": 0.5705868266522884, "epoch": 2.386242747310251, "grad_norm": 0.17726194858551025, "learning_rate": 2.046186401692888e-05, "loss": 0.5551, "mean_token_accuracy": 0.8250541873276234, "num_tokens": 827758061.0, "step": 25936 }, { "entropy": 0.5847843773663044, "epoch": 2.3863347536816923, "grad_norm": 0.16787011921405792, "learning_rate": 2.0458797190787256e-05, "loss": 0.5648, "mean_token_accuracy": 0.8227411732077599, "num_tokens": 827789915.0, "step": 25937 }, { "entropy": 0.5205550193786621, "epoch": 2.3864267600531335, "grad_norm": 0.1665075570344925, "learning_rate": 2.0455730364645627e-05, "loss": 0.5132, "mean_token_accuracy": 0.8374015651643276, "num_tokens": 827821696.0, "step": 25938 }, { "entropy": 0.5709926299750805, "epoch": 2.386518766424575, "grad_norm": 0.16650979220867157, "learning_rate": 2.0452663538504002e-05, "loss": 0.5529, "mean_token_accuracy": 0.8233049996197224, "num_tokens": 827853647.0, "step": 25939 }, { "entropy": 0.5375868659466505, "epoch": 2.386610772796016, "grad_norm": 0.16289108991622925, "learning_rate": 2.0449596712362377e-05, "loss": 0.5212, "mean_token_accuracy": 0.8340267464518547, "num_tokens": 827885804.0, "step": 25940 }, { "entropy": 0.521522032096982, "epoch": 2.3867027791674573, "grad_norm": 0.15588133037090302, "learning_rate": 2.044652988622075e-05, "loss": 0.5071, "mean_token_accuracy": 0.8394428193569183, "num_tokens": 827917655.0, "step": 25941 }, { "entropy": 0.5363154988735914, "epoch": 2.3867947855388985, "grad_norm": 0.16259761154651642, "learning_rate": 2.0443463060079122e-05, "loss": 0.5303, "mean_token_accuracy": 0.8343390971422195, "num_tokens": 827949767.0, "step": 25942 }, { "entropy": 0.6084919176064432, "epoch": 2.3868867919103396, "grad_norm": 0.17493607103824615, "learning_rate": 2.0440396233937497e-05, "loss": 0.6015, "mean_token_accuracy": 0.8135214485228062, "num_tokens": 827981504.0, "step": 25943 }, { "entropy": 0.4520797664299607, "epoch": 2.386978798281781, "grad_norm": 0.1522778421640396, "learning_rate": 2.0437329407795875e-05, "loss": 0.4471, "mean_token_accuracy": 0.8573425561189651, "num_tokens": 828013130.0, "step": 25944 }, { "entropy": 0.49557905830442905, "epoch": 2.3870708046532223, "grad_norm": 0.15854886174201965, "learning_rate": 2.043426258165425e-05, "loss": 0.4844, "mean_token_accuracy": 0.8479817025363445, "num_tokens": 828044856.0, "step": 25945 }, { "entropy": 0.5634048748761415, "epoch": 2.3871628110246634, "grad_norm": 0.16232487559318542, "learning_rate": 2.043119575551262e-05, "loss": 0.5426, "mean_token_accuracy": 0.829259816557169, "num_tokens": 828077367.0, "step": 25946 }, { "entropy": 0.5560693722218275, "epoch": 2.3872548173961046, "grad_norm": 0.17319342494010925, "learning_rate": 2.0428128929370996e-05, "loss": 0.5599, "mean_token_accuracy": 0.8217028677463531, "num_tokens": 828108330.0, "step": 25947 }, { "entropy": 0.5228100321255624, "epoch": 2.3873468237675457, "grad_norm": 0.1639045923948288, "learning_rate": 2.042506210322937e-05, "loss": 0.5158, "mean_token_accuracy": 0.8382198289036751, "num_tokens": 828140179.0, "step": 25948 }, { "entropy": 0.5802959706634283, "epoch": 2.3874388301389873, "grad_norm": 0.16733771562576294, "learning_rate": 2.0421995277087745e-05, "loss": 0.5596, "mean_token_accuracy": 0.8207046687602997, "num_tokens": 828172140.0, "step": 25949 }, { "entropy": 0.4287662226706743, "epoch": 2.3875308365104284, "grad_norm": 0.14804145693778992, "learning_rate": 2.0418928450946116e-05, "loss": 0.4104, "mean_token_accuracy": 0.8659519590437412, "num_tokens": 828204454.0, "step": 25950 }, { "entropy": 0.5848167268559337, "epoch": 2.3876228428818695, "grad_norm": 0.17001955211162567, "learning_rate": 2.041586162480449e-05, "loss": 0.5658, "mean_token_accuracy": 0.8193349055945873, "num_tokens": 828235765.0, "step": 25951 }, { "entropy": 0.5612141815945506, "epoch": 2.3877148492533107, "grad_norm": 0.1649446040391922, "learning_rate": 2.0412794798662866e-05, "loss": 0.5517, "mean_token_accuracy": 0.8267367742955685, "num_tokens": 828267836.0, "step": 25952 }, { "entropy": 0.4998874068260193, "epoch": 2.387806855624752, "grad_norm": 0.15527430176734924, "learning_rate": 2.040972797252124e-05, "loss": 0.483, "mean_token_accuracy": 0.8470882773399353, "num_tokens": 828299801.0, "step": 25953 }, { "entropy": 0.5662987995892763, "epoch": 2.3878988619961934, "grad_norm": 0.16614367067813873, "learning_rate": 2.040666114637961e-05, "loss": 0.559, "mean_token_accuracy": 0.8231033943593502, "num_tokens": 828332014.0, "step": 25954 }, { "entropy": 0.5497546368278563, "epoch": 2.3879908683676345, "grad_norm": 0.16762377321720123, "learning_rate": 2.0403594320237986e-05, "loss": 0.5262, "mean_token_accuracy": 0.8340549916028976, "num_tokens": 828363888.0, "step": 25955 }, { "entropy": 0.5041825827211142, "epoch": 2.3880828747390757, "grad_norm": 0.16508695483207703, "learning_rate": 2.040052749409636e-05, "loss": 0.4959, "mean_token_accuracy": 0.8427244946360588, "num_tokens": 828395550.0, "step": 25956 }, { "entropy": 0.459914137609303, "epoch": 2.388174881110517, "grad_norm": 0.14749710261821747, "learning_rate": 2.0397460667954735e-05, "loss": 0.441, "mean_token_accuracy": 0.8578957505524158, "num_tokens": 828427565.0, "step": 25957 }, { "entropy": 0.4936188291758299, "epoch": 2.388266887481958, "grad_norm": 0.15920810401439667, "learning_rate": 2.039439384181311e-05, "loss": 0.4899, "mean_token_accuracy": 0.8462695069611073, "num_tokens": 828459584.0, "step": 25958 }, { "entropy": 0.5253527651075274, "epoch": 2.3883588938533995, "grad_norm": 0.16093593835830688, "learning_rate": 2.039132701567148e-05, "loss": 0.5206, "mean_token_accuracy": 0.8351276442408562, "num_tokens": 828492231.0, "step": 25959 }, { "entropy": 0.47681043297052383, "epoch": 2.3884509002248406, "grad_norm": 0.15361493825912476, "learning_rate": 2.0388260189529856e-05, "loss": 0.4708, "mean_token_accuracy": 0.8511020354926586, "num_tokens": 828524417.0, "step": 25960 }, { "entropy": 0.43319614813663065, "epoch": 2.3885429065962818, "grad_norm": 0.1468287855386734, "learning_rate": 2.038519336338823e-05, "loss": 0.4155, "mean_token_accuracy": 0.86770274117589, "num_tokens": 828557185.0, "step": 25961 }, { "entropy": 0.5625443886965513, "epoch": 2.388634912967723, "grad_norm": 0.1716351956129074, "learning_rate": 2.0382126537246605e-05, "loss": 0.5518, "mean_token_accuracy": 0.8264727778732777, "num_tokens": 828588789.0, "step": 25962 }, { "entropy": 0.5238080332055688, "epoch": 2.388726919339164, "grad_norm": 0.16157086193561554, "learning_rate": 2.0379059711104977e-05, "loss": 0.5079, "mean_token_accuracy": 0.8389193415641785, "num_tokens": 828620012.0, "step": 25963 }, { "entropy": 0.6511806193739176, "epoch": 2.3888189257106056, "grad_norm": 0.18082129955291748, "learning_rate": 2.037599288496335e-05, "loss": 0.6414, "mean_token_accuracy": 0.7999005056917667, "num_tokens": 828651808.0, "step": 25964 }, { "entropy": 0.4939250126481056, "epoch": 2.3889109320820467, "grad_norm": 0.15600308775901794, "learning_rate": 2.0372926058821726e-05, "loss": 0.478, "mean_token_accuracy": 0.8490507453680038, "num_tokens": 828683906.0, "step": 25965 }, { "entropy": 0.4829183118417859, "epoch": 2.389002938453488, "grad_norm": 0.16200979053974152, "learning_rate": 2.03698592326801e-05, "loss": 0.4655, "mean_token_accuracy": 0.8496218919754028, "num_tokens": 828715561.0, "step": 25966 }, { "entropy": 0.46850717812776566, "epoch": 2.389094944824929, "grad_norm": 0.16013586521148682, "learning_rate": 2.0366792406538475e-05, "loss": 0.4624, "mean_token_accuracy": 0.853613842278719, "num_tokens": 828747195.0, "step": 25967 }, { "entropy": 0.4238426419906318, "epoch": 2.38918695119637, "grad_norm": 0.14450369775295258, "learning_rate": 2.0363725580396846e-05, "loss": 0.4061, "mean_token_accuracy": 0.8696884214878082, "num_tokens": 828779475.0, "step": 25968 }, { "entropy": 0.5405379133298993, "epoch": 2.3892789575678117, "grad_norm": 0.16569910943508148, "learning_rate": 2.036065875425522e-05, "loss": 0.5217, "mean_token_accuracy": 0.8358982391655445, "num_tokens": 828811866.0, "step": 25969 }, { "entropy": 0.4457728024572134, "epoch": 2.389370963939253, "grad_norm": 0.14337733387947083, "learning_rate": 2.0357591928113596e-05, "loss": 0.4309, "mean_token_accuracy": 0.8648624047636986, "num_tokens": 828844301.0, "step": 25970 }, { "entropy": 0.5555729288607836, "epoch": 2.389462970310694, "grad_norm": 0.16829638183116913, "learning_rate": 2.035452510197197e-05, "loss": 0.5512, "mean_token_accuracy": 0.8251438140869141, "num_tokens": 828876505.0, "step": 25971 }, { "entropy": 0.4454543311148882, "epoch": 2.389554976682135, "grad_norm": 0.15433885157108307, "learning_rate": 2.035145827583034e-05, "loss": 0.4305, "mean_token_accuracy": 0.8636614345014095, "num_tokens": 828908550.0, "step": 25972 }, { "entropy": 0.5468928655609488, "epoch": 2.3896469830535763, "grad_norm": 0.1668354570865631, "learning_rate": 2.0348391449688716e-05, "loss": 0.5461, "mean_token_accuracy": 0.8249831311404705, "num_tokens": 828940908.0, "step": 25973 }, { "entropy": 0.4693896872922778, "epoch": 2.389738989425018, "grad_norm": 0.157209575176239, "learning_rate": 2.0345324623547094e-05, "loss": 0.4595, "mean_token_accuracy": 0.855934701859951, "num_tokens": 828972803.0, "step": 25974 }, { "entropy": 0.5413063913583755, "epoch": 2.389830995796459, "grad_norm": 0.16679294407367706, "learning_rate": 2.034225779740547e-05, "loss": 0.5307, "mean_token_accuracy": 0.8343832418322563, "num_tokens": 829004880.0, "step": 25975 }, { "entropy": 0.5235282918438315, "epoch": 2.3899230021679, "grad_norm": 0.15967299044132233, "learning_rate": 2.033919097126384e-05, "loss": 0.5094, "mean_token_accuracy": 0.8419100046157837, "num_tokens": 829036908.0, "step": 25976 }, { "entropy": 0.5553384206723422, "epoch": 2.3900150085393412, "grad_norm": 0.16670413315296173, "learning_rate": 2.0336124145122215e-05, "loss": 0.5524, "mean_token_accuracy": 0.8246643766760826, "num_tokens": 829068704.0, "step": 25977 }, { "entropy": 0.5355185903608799, "epoch": 2.3901070149107824, "grad_norm": 0.16209276020526886, "learning_rate": 2.033305731898059e-05, "loss": 0.5342, "mean_token_accuracy": 0.8301995657384396, "num_tokens": 829100997.0, "step": 25978 }, { "entropy": 0.45862957648932934, "epoch": 2.390199021282224, "grad_norm": 0.14864620566368103, "learning_rate": 2.0329990492838964e-05, "loss": 0.4404, "mean_token_accuracy": 0.8586868606507778, "num_tokens": 829133289.0, "step": 25979 }, { "entropy": 0.5359608186408877, "epoch": 2.390291027653665, "grad_norm": 0.16002649068832397, "learning_rate": 2.0326923666697335e-05, "loss": 0.5248, "mean_token_accuracy": 0.8338039517402649, "num_tokens": 829165652.0, "step": 25980 }, { "entropy": 0.48572508222423494, "epoch": 2.390383034025106, "grad_norm": 0.15606780350208282, "learning_rate": 2.032385684055571e-05, "loss": 0.4803, "mean_token_accuracy": 0.8507938347756863, "num_tokens": 829197164.0, "step": 25981 }, { "entropy": 0.514821095392108, "epoch": 2.3904750403965473, "grad_norm": 0.16127437353134155, "learning_rate": 2.0320790014414085e-05, "loss": 0.505, "mean_token_accuracy": 0.8415593914687634, "num_tokens": 829229066.0, "step": 25982 }, { "entropy": 0.389470461755991, "epoch": 2.3905670467679885, "grad_norm": 0.13980945944786072, "learning_rate": 2.031772318827246e-05, "loss": 0.3688, "mean_token_accuracy": 0.8796819224953651, "num_tokens": 829261197.0, "step": 25983 }, { "entropy": 0.5615594908595085, "epoch": 2.39065905313943, "grad_norm": 0.16774606704711914, "learning_rate": 2.031465636213083e-05, "loss": 0.5513, "mean_token_accuracy": 0.8229242525994778, "num_tokens": 829292680.0, "step": 25984 }, { "entropy": 0.4209254572633654, "epoch": 2.390751059510871, "grad_norm": 0.1478249877691269, "learning_rate": 2.0311589535989205e-05, "loss": 0.4089, "mean_token_accuracy": 0.8707721531391144, "num_tokens": 829325373.0, "step": 25985 }, { "entropy": 0.5015450706705451, "epoch": 2.3908430658823123, "grad_norm": 0.15949799120426178, "learning_rate": 2.030852270984758e-05, "loss": 0.484, "mean_token_accuracy": 0.8452342599630356, "num_tokens": 829356944.0, "step": 25986 }, { "entropy": 0.5119337262585759, "epoch": 2.3909350722537535, "grad_norm": 0.15163353085517883, "learning_rate": 2.0305455883705955e-05, "loss": 0.4965, "mean_token_accuracy": 0.8452849313616753, "num_tokens": 829389514.0, "step": 25987 }, { "entropy": 0.5045875515788794, "epoch": 2.3910270786251946, "grad_norm": 0.15627942979335785, "learning_rate": 2.030238905756433e-05, "loss": 0.4865, "mean_token_accuracy": 0.8434302359819412, "num_tokens": 829421215.0, "step": 25988 }, { "entropy": 0.5984203098341823, "epoch": 2.391119084996636, "grad_norm": 0.16595697402954102, "learning_rate": 2.02993222314227e-05, "loss": 0.5858, "mean_token_accuracy": 0.8175735026597977, "num_tokens": 829453733.0, "step": 25989 }, { "entropy": 0.3967403012793511, "epoch": 2.3912110913680773, "grad_norm": 0.15017975866794586, "learning_rate": 2.0296255405281075e-05, "loss": 0.3891, "mean_token_accuracy": 0.8715414255857468, "num_tokens": 829486138.0, "step": 25990 }, { "entropy": 0.5349061954766512, "epoch": 2.3913030977395184, "grad_norm": 0.16029107570648193, "learning_rate": 2.029318857913945e-05, "loss": 0.5126, "mean_token_accuracy": 0.8351424336433411, "num_tokens": 829518101.0, "step": 25991 }, { "entropy": 0.5353635335341096, "epoch": 2.3913951041109596, "grad_norm": 0.1637115627527237, "learning_rate": 2.0290121752997824e-05, "loss": 0.5126, "mean_token_accuracy": 0.8371891602873802, "num_tokens": 829549765.0, "step": 25992 }, { "entropy": 0.5096214506775141, "epoch": 2.3914871104824007, "grad_norm": 0.1658657342195511, "learning_rate": 2.0287054926856196e-05, "loss": 0.4966, "mean_token_accuracy": 0.8417334407567978, "num_tokens": 829580996.0, "step": 25993 }, { "entropy": 0.5203851251862943, "epoch": 2.3915791168538423, "grad_norm": 0.16244234144687653, "learning_rate": 2.028398810071457e-05, "loss": 0.5017, "mean_token_accuracy": 0.842563945800066, "num_tokens": 829612554.0, "step": 25994 }, { "entropy": 0.5352746592834592, "epoch": 2.3916711232252834, "grad_norm": 0.16451333463191986, "learning_rate": 2.0280921274572945e-05, "loss": 0.5278, "mean_token_accuracy": 0.8288369253277779, "num_tokens": 829644192.0, "step": 25995 }, { "entropy": 0.6423499248921871, "epoch": 2.3917631295967245, "grad_norm": 0.17205002903938293, "learning_rate": 2.027785444843132e-05, "loss": 0.6297, "mean_token_accuracy": 0.8003743104636669, "num_tokens": 829676518.0, "step": 25996 }, { "entropy": 0.5219212556257844, "epoch": 2.3918551359681657, "grad_norm": 0.1623709499835968, "learning_rate": 2.0274787622289694e-05, "loss": 0.5051, "mean_token_accuracy": 0.8404171988368034, "num_tokens": 829708722.0, "step": 25997 }, { "entropy": 0.44460027548484504, "epoch": 2.391947142339607, "grad_norm": 0.1540852189064026, "learning_rate": 2.0271720796148065e-05, "loss": 0.4419, "mean_token_accuracy": 0.8592716827988625, "num_tokens": 829741443.0, "step": 25998 }, { "entropy": 0.5686722584068775, "epoch": 2.3920391487110484, "grad_norm": 0.17085030674934387, "learning_rate": 2.026865397000644e-05, "loss": 0.5564, "mean_token_accuracy": 0.8237248249351978, "num_tokens": 829772217.0, "step": 25999 }, { "entropy": 0.6125963572412729, "epoch": 2.3921311550824895, "grad_norm": 0.17265217006206512, "learning_rate": 2.0265587143864815e-05, "loss": 0.6069, "mean_token_accuracy": 0.8084175996482372, "num_tokens": 829804070.0, "step": 26000 }, { "entropy": 0.631151108071208, "epoch": 2.3922231614539307, "grad_norm": 0.1747327595949173, "learning_rate": 2.026252031772319e-05, "loss": 0.6192, "mean_token_accuracy": 0.8055436126887798, "num_tokens": 829835861.0, "step": 26001 }, { "entropy": 0.4415526366792619, "epoch": 2.392315167825372, "grad_norm": 0.1539824903011322, "learning_rate": 2.025945349158156e-05, "loss": 0.4376, "mean_token_accuracy": 0.8608113937079906, "num_tokens": 829868190.0, "step": 26002 }, { "entropy": 0.6312031988054514, "epoch": 2.392407174196813, "grad_norm": 0.16892504692077637, "learning_rate": 2.0256386665439935e-05, "loss": 0.6188, "mean_token_accuracy": 0.8072929680347443, "num_tokens": 829900349.0, "step": 26003 }, { "entropy": 0.41552689159289, "epoch": 2.3924991805682545, "grad_norm": 0.15337488055229187, "learning_rate": 2.025331983929831e-05, "loss": 0.405, "mean_token_accuracy": 0.8721739165484905, "num_tokens": 829932299.0, "step": 26004 }, { "entropy": 0.45775606483221054, "epoch": 2.3925911869396956, "grad_norm": 0.15683186054229736, "learning_rate": 2.0250253013156688e-05, "loss": 0.4447, "mean_token_accuracy": 0.8584898598492146, "num_tokens": 829964399.0, "step": 26005 }, { "entropy": 0.48467146046459675, "epoch": 2.3926831933111368, "grad_norm": 0.1550440788269043, "learning_rate": 2.024718618701506e-05, "loss": 0.4696, "mean_token_accuracy": 0.8477933444082737, "num_tokens": 829996585.0, "step": 26006 }, { "entropy": 0.4871612377464771, "epoch": 2.392775199682578, "grad_norm": 0.15604333579540253, "learning_rate": 2.0244119360873434e-05, "loss": 0.4785, "mean_token_accuracy": 0.8451092578470707, "num_tokens": 830029062.0, "step": 26007 }, { "entropy": 0.5411425498314202, "epoch": 2.392867206054019, "grad_norm": 0.1585625559091568, "learning_rate": 2.024105253473181e-05, "loss": 0.5168, "mean_token_accuracy": 0.8345232643187046, "num_tokens": 830061010.0, "step": 26008 }, { "entropy": 0.6369503866881132, "epoch": 2.3929592124254606, "grad_norm": 0.17015612125396729, "learning_rate": 2.0237985708590183e-05, "loss": 0.62, "mean_token_accuracy": 0.8057003878057003, "num_tokens": 830093234.0, "step": 26009 }, { "entropy": 0.564261592226103, "epoch": 2.3930512187969017, "grad_norm": 0.16829314827919006, "learning_rate": 2.0234918882448554e-05, "loss": 0.5524, "mean_token_accuracy": 0.8266493417322636, "num_tokens": 830125416.0, "step": 26010 }, { "entropy": 0.4938578298315406, "epoch": 2.393143225168343, "grad_norm": 0.15025709569454193, "learning_rate": 2.023185205630693e-05, "loss": 0.4816, "mean_token_accuracy": 0.844615675508976, "num_tokens": 830158029.0, "step": 26011 }, { "entropy": 0.6126210764050484, "epoch": 2.393235231539784, "grad_norm": 0.16685135662555695, "learning_rate": 2.0228785230165304e-05, "loss": 0.594, "mean_token_accuracy": 0.8149754293262959, "num_tokens": 830190419.0, "step": 26012 }, { "entropy": 0.5106895379722118, "epoch": 2.393327237911225, "grad_norm": 0.1553761065006256, "learning_rate": 2.022571840402368e-05, "loss": 0.4982, "mean_token_accuracy": 0.8458468578755856, "num_tokens": 830222780.0, "step": 26013 }, { "entropy": 0.3954031402245164, "epoch": 2.3934192442826667, "grad_norm": 0.14773251116275787, "learning_rate": 2.022265157788205e-05, "loss": 0.3853, "mean_token_accuracy": 0.8756941705942154, "num_tokens": 830254430.0, "step": 26014 }, { "entropy": 0.5372840855270624, "epoch": 2.393511250654108, "grad_norm": 0.16037417948246002, "learning_rate": 2.0219584751740424e-05, "loss": 0.5239, "mean_token_accuracy": 0.8333330415189266, "num_tokens": 830286069.0, "step": 26015 }, { "entropy": 0.5037840246222913, "epoch": 2.393603257025549, "grad_norm": 0.1600358784198761, "learning_rate": 2.02165179255988e-05, "loss": 0.4915, "mean_token_accuracy": 0.8460173606872559, "num_tokens": 830317786.0, "step": 26016 }, { "entropy": 0.6054597403854132, "epoch": 2.39369526339699, "grad_norm": 0.1694025993347168, "learning_rate": 2.0213451099457174e-05, "loss": 0.59, "mean_token_accuracy": 0.8158861622214317, "num_tokens": 830350076.0, "step": 26017 }, { "entropy": 0.5644578342325985, "epoch": 2.3937872697684313, "grad_norm": 0.16162483394145966, "learning_rate": 2.0210384273315548e-05, "loss": 0.5496, "mean_token_accuracy": 0.8278141617774963, "num_tokens": 830382721.0, "step": 26018 }, { "entropy": 0.5219134036451578, "epoch": 2.393879276139873, "grad_norm": 0.16227301955223083, "learning_rate": 2.020731744717392e-05, "loss": 0.5019, "mean_token_accuracy": 0.8411712422966957, "num_tokens": 830414894.0, "step": 26019 }, { "entropy": 0.4884016253054142, "epoch": 2.393971282511314, "grad_norm": 0.1604190319776535, "learning_rate": 2.0204250621032294e-05, "loss": 0.48, "mean_token_accuracy": 0.8480271100997925, "num_tokens": 830447266.0, "step": 26020 }, { "entropy": 0.49672401137650013, "epoch": 2.394063288882755, "grad_norm": 0.15787571668624878, "learning_rate": 2.020118379489067e-05, "loss": 0.4985, "mean_token_accuracy": 0.8441519923508167, "num_tokens": 830479373.0, "step": 26021 }, { "entropy": 0.4772544445004314, "epoch": 2.3941552952541962, "grad_norm": 0.15719541907310486, "learning_rate": 2.0198116968749043e-05, "loss": 0.4681, "mean_token_accuracy": 0.849816057831049, "num_tokens": 830510975.0, "step": 26022 }, { "entropy": 0.42917713103815913, "epoch": 2.3942473016256374, "grad_norm": 0.14540989696979523, "learning_rate": 2.0195050142607415e-05, "loss": 0.4236, "mean_token_accuracy": 0.8670025281608105, "num_tokens": 830543481.0, "step": 26023 }, { "entropy": 0.476001750677824, "epoch": 2.394339307997079, "grad_norm": 0.16162504255771637, "learning_rate": 2.019198331646579e-05, "loss": 0.4728, "mean_token_accuracy": 0.8480260446667671, "num_tokens": 830575515.0, "step": 26024 }, { "entropy": 0.5613339236006141, "epoch": 2.39443131436852, "grad_norm": 0.1646254062652588, "learning_rate": 2.0188916490324164e-05, "loss": 0.5401, "mean_token_accuracy": 0.8268464803695679, "num_tokens": 830606950.0, "step": 26025 }, { "entropy": 0.5033455537632108, "epoch": 2.394523320739961, "grad_norm": 0.16159473359584808, "learning_rate": 2.018584966418254e-05, "loss": 0.4937, "mean_token_accuracy": 0.8418337926268578, "num_tokens": 830638379.0, "step": 26026 }, { "entropy": 0.5357796642929316, "epoch": 2.3946153271114023, "grad_norm": 0.1678950935602188, "learning_rate": 2.0182782838040913e-05, "loss": 0.519, "mean_token_accuracy": 0.8345823660492897, "num_tokens": 830670287.0, "step": 26027 }, { "entropy": 0.5352880721911788, "epoch": 2.3947073334828435, "grad_norm": 0.16914556920528412, "learning_rate": 2.0179716011899285e-05, "loss": 0.5262, "mean_token_accuracy": 0.8347442746162415, "num_tokens": 830701518.0, "step": 26028 }, { "entropy": 0.5537536963820457, "epoch": 2.394799339854285, "grad_norm": 0.16302576661109924, "learning_rate": 2.017664918575766e-05, "loss": 0.5362, "mean_token_accuracy": 0.8331256695091724, "num_tokens": 830733575.0, "step": 26029 }, { "entropy": 0.42856897972524166, "epoch": 2.394891346225726, "grad_norm": 0.15741080045700073, "learning_rate": 2.0173582359616034e-05, "loss": 0.4193, "mean_token_accuracy": 0.8647625222802162, "num_tokens": 830763719.0, "step": 26030 }, { "entropy": 0.6199511354789138, "epoch": 2.3949833525971673, "grad_norm": 0.1676214188337326, "learning_rate": 2.017051553347441e-05, "loss": 0.5902, "mean_token_accuracy": 0.8135969750583172, "num_tokens": 830795100.0, "step": 26031 }, { "entropy": 0.5524960933253169, "epoch": 2.3950753589686085, "grad_norm": 0.1656792312860489, "learning_rate": 2.016744870733278e-05, "loss": 0.5404, "mean_token_accuracy": 0.8289933279156685, "num_tokens": 830826196.0, "step": 26032 }, { "entropy": 0.524589660577476, "epoch": 2.3951673653400496, "grad_norm": 0.16759037971496582, "learning_rate": 2.0164381881191154e-05, "loss": 0.5136, "mean_token_accuracy": 0.8368616737425327, "num_tokens": 830857847.0, "step": 26033 }, { "entropy": 0.49963274598121643, "epoch": 2.395259371711491, "grad_norm": 0.1541866809129715, "learning_rate": 2.016131505504953e-05, "loss": 0.491, "mean_token_accuracy": 0.8448562957346439, "num_tokens": 830889521.0, "step": 26034 }, { "entropy": 0.5411881469190121, "epoch": 2.3953513780829323, "grad_norm": 0.16285382211208344, "learning_rate": 2.0158248228907907e-05, "loss": 0.5345, "mean_token_accuracy": 0.8328080326318741, "num_tokens": 830921455.0, "step": 26035 }, { "entropy": 0.47807369637303054, "epoch": 2.3954433844543734, "grad_norm": 0.15694136917591095, "learning_rate": 2.015518140276628e-05, "loss": 0.4815, "mean_token_accuracy": 0.8492404222488403, "num_tokens": 830953340.0, "step": 26036 }, { "entropy": 0.4745467712637037, "epoch": 2.3955353908258146, "grad_norm": 0.15193109214305878, "learning_rate": 2.0152114576624653e-05, "loss": 0.4572, "mean_token_accuracy": 0.8540313877165318, "num_tokens": 830985839.0, "step": 26037 }, { "entropy": 0.47539366595447063, "epoch": 2.3956273971972557, "grad_norm": 0.1577988862991333, "learning_rate": 2.0149047750483028e-05, "loss": 0.4687, "mean_token_accuracy": 0.8513781428337097, "num_tokens": 831017755.0, "step": 26038 }, { "entropy": 0.638854943215847, "epoch": 2.3957194035686973, "grad_norm": 0.17587482929229736, "learning_rate": 2.0145980924341402e-05, "loss": 0.6281, "mean_token_accuracy": 0.8009896129369736, "num_tokens": 831049808.0, "step": 26039 }, { "entropy": 0.5787035822868347, "epoch": 2.3958114099401384, "grad_norm": 0.16511185467243195, "learning_rate": 2.0142914098199774e-05, "loss": 0.5645, "mean_token_accuracy": 0.8236297704279423, "num_tokens": 831082052.0, "step": 26040 }, { "entropy": 0.4850322543643415, "epoch": 2.3959034163115795, "grad_norm": 0.15112094581127167, "learning_rate": 2.0139847272058148e-05, "loss": 0.4594, "mean_token_accuracy": 0.8500274196267128, "num_tokens": 831113662.0, "step": 26041 }, { "entropy": 0.5151265431195498, "epoch": 2.3959954226830207, "grad_norm": 0.15440376102924347, "learning_rate": 2.0136780445916523e-05, "loss": 0.5034, "mean_token_accuracy": 0.8400571011006832, "num_tokens": 831146294.0, "step": 26042 }, { "entropy": 0.5492872213944793, "epoch": 2.396087429054462, "grad_norm": 0.15888239443302155, "learning_rate": 2.0133713619774897e-05, "loss": 0.5291, "mean_token_accuracy": 0.8325620889663696, "num_tokens": 831178096.0, "step": 26043 }, { "entropy": 0.4910870515741408, "epoch": 2.3961794354259034, "grad_norm": 0.1558455228805542, "learning_rate": 2.013064679363327e-05, "loss": 0.4785, "mean_token_accuracy": 0.8485259339213371, "num_tokens": 831210016.0, "step": 26044 }, { "entropy": 0.5429586675018072, "epoch": 2.3962714417973445, "grad_norm": 0.16100266575813293, "learning_rate": 2.0127579967491643e-05, "loss": 0.5273, "mean_token_accuracy": 0.8338323533535004, "num_tokens": 831241680.0, "step": 26045 }, { "entropy": 0.4339414285495877, "epoch": 2.3963634481687857, "grad_norm": 0.1477964073419571, "learning_rate": 2.0124513141350018e-05, "loss": 0.41, "mean_token_accuracy": 0.8669713661074638, "num_tokens": 831273785.0, "step": 26046 }, { "entropy": 0.5567432390525937, "epoch": 2.396455454540227, "grad_norm": 0.16522106528282166, "learning_rate": 2.0121446315208393e-05, "loss": 0.5415, "mean_token_accuracy": 0.826456680893898, "num_tokens": 831305413.0, "step": 26047 }, { "entropy": 0.5010709688067436, "epoch": 2.396547460911668, "grad_norm": 0.15987305343151093, "learning_rate": 2.0118379489066767e-05, "loss": 0.4993, "mean_token_accuracy": 0.8411732241511345, "num_tokens": 831338047.0, "step": 26048 }, { "entropy": 0.4972944725304842, "epoch": 2.3966394672831095, "grad_norm": 0.1550826132297516, "learning_rate": 2.011531266292514e-05, "loss": 0.4746, "mean_token_accuracy": 0.8495016731321812, "num_tokens": 831370181.0, "step": 26049 }, { "entropy": 0.6000113915652037, "epoch": 2.3967314736545506, "grad_norm": 0.17149531841278076, "learning_rate": 2.0112245836783513e-05, "loss": 0.6045, "mean_token_accuracy": 0.8102115504443645, "num_tokens": 831402457.0, "step": 26050 }, { "entropy": 0.582507386803627, "epoch": 2.3968234800259918, "grad_norm": 0.16604025661945343, "learning_rate": 2.0109179010641888e-05, "loss": 0.576, "mean_token_accuracy": 0.8197656609117985, "num_tokens": 831433862.0, "step": 26051 }, { "entropy": 0.5095523027703166, "epoch": 2.396915486397433, "grad_norm": 0.1601039469242096, "learning_rate": 2.0106112184500263e-05, "loss": 0.4978, "mean_token_accuracy": 0.8420360162854195, "num_tokens": 831466297.0, "step": 26052 }, { "entropy": 0.46695517376065254, "epoch": 2.397007492768874, "grad_norm": 0.15426020324230194, "learning_rate": 2.0103045358358634e-05, "loss": 0.461, "mean_token_accuracy": 0.852199163287878, "num_tokens": 831498717.0, "step": 26053 }, { "entropy": 0.5336021007969975, "epoch": 2.3970994991403156, "grad_norm": 0.15991365909576416, "learning_rate": 2.009997853221701e-05, "loss": 0.5232, "mean_token_accuracy": 0.8353327624499798, "num_tokens": 831530335.0, "step": 26054 }, { "entropy": 0.435227551497519, "epoch": 2.3971915055117567, "grad_norm": 0.14951059222221375, "learning_rate": 2.0096911706075383e-05, "loss": 0.421, "mean_token_accuracy": 0.866148978471756, "num_tokens": 831562407.0, "step": 26055 }, { "entropy": 0.5544738452881575, "epoch": 2.397283511883198, "grad_norm": 0.16901527345180511, "learning_rate": 2.0093844879933758e-05, "loss": 0.5537, "mean_token_accuracy": 0.8287201970815659, "num_tokens": 831593548.0, "step": 26056 }, { "entropy": 0.6090597701258957, "epoch": 2.397375518254639, "grad_norm": 0.16974718868732452, "learning_rate": 2.0090778053792132e-05, "loss": 0.5971, "mean_token_accuracy": 0.814228992909193, "num_tokens": 831625485.0, "step": 26057 }, { "entropy": 0.602286834269762, "epoch": 2.39746752462608, "grad_norm": 0.17154717445373535, "learning_rate": 2.0087711227650504e-05, "loss": 0.5961, "mean_token_accuracy": 0.8139681443572044, "num_tokens": 831657851.0, "step": 26058 }, { "entropy": 0.5114651108160615, "epoch": 2.3975595309975217, "grad_norm": 0.15650378167629242, "learning_rate": 2.0084644401508878e-05, "loss": 0.475, "mean_token_accuracy": 0.8454479612410069, "num_tokens": 831688811.0, "step": 26059 }, { "entropy": 0.44123004481662065, "epoch": 2.397651537368963, "grad_norm": 0.14725413918495178, "learning_rate": 2.0081577575367253e-05, "loss": 0.4178, "mean_token_accuracy": 0.8650633059442043, "num_tokens": 831720559.0, "step": 26060 }, { "entropy": 0.48839156702160835, "epoch": 2.397743543740404, "grad_norm": 0.15455183386802673, "learning_rate": 2.0078510749225628e-05, "loss": 0.4703, "mean_token_accuracy": 0.8496154807507992, "num_tokens": 831752794.0, "step": 26061 }, { "entropy": 0.5635333973914385, "epoch": 2.397835550111845, "grad_norm": 0.16796444356441498, "learning_rate": 2.0075443923084e-05, "loss": 0.5503, "mean_token_accuracy": 0.826041653752327, "num_tokens": 831784155.0, "step": 26062 }, { "entropy": 0.5845639547333121, "epoch": 2.3979275564832863, "grad_norm": 0.16981001198291779, "learning_rate": 2.0072377096942374e-05, "loss": 0.5798, "mean_token_accuracy": 0.8187268003821373, "num_tokens": 831815231.0, "step": 26063 }, { "entropy": 0.4572769245132804, "epoch": 2.398019562854728, "grad_norm": 0.1607714295387268, "learning_rate": 2.0069310270800748e-05, "loss": 0.457, "mean_token_accuracy": 0.8573579043149948, "num_tokens": 831847024.0, "step": 26064 }, { "entropy": 0.515961455181241, "epoch": 2.398111569226169, "grad_norm": 0.1711684912443161, "learning_rate": 2.0066243444659123e-05, "loss": 0.5008, "mean_token_accuracy": 0.8393827266991138, "num_tokens": 831877338.0, "step": 26065 }, { "entropy": 0.38748012529686093, "epoch": 2.39820357559761, "grad_norm": 0.14191259443759918, "learning_rate": 2.0063176618517497e-05, "loss": 0.3679, "mean_token_accuracy": 0.8788479715585709, "num_tokens": 831909669.0, "step": 26066 }, { "entropy": 0.4345169821754098, "epoch": 2.3982955819690512, "grad_norm": 0.15276393294334412, "learning_rate": 2.0060109792375872e-05, "loss": 0.4187, "mean_token_accuracy": 0.8650760762393475, "num_tokens": 831941807.0, "step": 26067 }, { "entropy": 0.4727937269490212, "epoch": 2.3983875883404924, "grad_norm": 0.1570163518190384, "learning_rate": 2.0057042966234247e-05, "loss": 0.468, "mean_token_accuracy": 0.8527010269463062, "num_tokens": 831973914.0, "step": 26068 }, { "entropy": 0.5157396048307419, "epoch": 2.398479594711934, "grad_norm": 0.16414761543273926, "learning_rate": 2.005397614009262e-05, "loss": 0.5074, "mean_token_accuracy": 0.8370530717074871, "num_tokens": 832004825.0, "step": 26069 }, { "entropy": 0.5410838504321873, "epoch": 2.398571601083375, "grad_norm": 0.15947595238685608, "learning_rate": 2.0050909313950993e-05, "loss": 0.5233, "mean_token_accuracy": 0.8358268141746521, "num_tokens": 832037593.0, "step": 26070 }, { "entropy": 0.6262516146525741, "epoch": 2.398663607454816, "grad_norm": 0.17468278110027313, "learning_rate": 2.0047842487809367e-05, "loss": 0.6236, "mean_token_accuracy": 0.8077353835105896, "num_tokens": 832070017.0, "step": 26071 }, { "entropy": 0.594214990735054, "epoch": 2.3987556138262573, "grad_norm": 0.16980233788490295, "learning_rate": 2.0044775661667742e-05, "loss": 0.5849, "mean_token_accuracy": 0.8172344602644444, "num_tokens": 832101996.0, "step": 26072 }, { "entropy": 0.5990521935746074, "epoch": 2.3988476201976985, "grad_norm": 0.17134879529476166, "learning_rate": 2.0041708835526117e-05, "loss": 0.5862, "mean_token_accuracy": 0.8159698359668255, "num_tokens": 832134096.0, "step": 26073 }, { "entropy": 0.5055799977853894, "epoch": 2.39893962656914, "grad_norm": 0.156584233045578, "learning_rate": 2.0038642009384488e-05, "loss": 0.4916, "mean_token_accuracy": 0.847769882529974, "num_tokens": 832166675.0, "step": 26074 }, { "entropy": 0.47438438422977924, "epoch": 2.399031632940581, "grad_norm": 0.15551209449768066, "learning_rate": 2.0035575183242863e-05, "loss": 0.4659, "mean_token_accuracy": 0.8521674014627934, "num_tokens": 832198554.0, "step": 26075 }, { "entropy": 0.4772354420274496, "epoch": 2.3991236393120223, "grad_norm": 0.15391185879707336, "learning_rate": 2.0032508357101237e-05, "loss": 0.4668, "mean_token_accuracy": 0.8517738804221153, "num_tokens": 832230242.0, "step": 26076 }, { "entropy": 0.5492698438465595, "epoch": 2.3992156456834635, "grad_norm": 0.16723167896270752, "learning_rate": 2.0029441530959612e-05, "loss": 0.5389, "mean_token_accuracy": 0.8271316811442375, "num_tokens": 832262550.0, "step": 26077 }, { "entropy": 0.4909756500273943, "epoch": 2.3993076520549046, "grad_norm": 0.15995779633522034, "learning_rate": 2.0026374704817986e-05, "loss": 0.4867, "mean_token_accuracy": 0.8455169722437859, "num_tokens": 832294646.0, "step": 26078 }, { "entropy": 0.4712241441011429, "epoch": 2.399399658426346, "grad_norm": 0.15777873992919922, "learning_rate": 2.0023307878676358e-05, "loss": 0.461, "mean_token_accuracy": 0.8531881980597973, "num_tokens": 832325830.0, "step": 26079 }, { "entropy": 0.5320056870114058, "epoch": 2.3994916647977873, "grad_norm": 0.1623464673757553, "learning_rate": 2.0020241052534732e-05, "loss": 0.511, "mean_token_accuracy": 0.8359527960419655, "num_tokens": 832358075.0, "step": 26080 }, { "entropy": 0.5347991976886988, "epoch": 2.3995836711692284, "grad_norm": 0.16618967056274414, "learning_rate": 2.0017174226393107e-05, "loss": 0.5226, "mean_token_accuracy": 0.8344014324247837, "num_tokens": 832389188.0, "step": 26081 }, { "entropy": 0.5000804769806564, "epoch": 2.3996756775406696, "grad_norm": 0.16082650423049927, "learning_rate": 2.001410740025148e-05, "loss": 0.4938, "mean_token_accuracy": 0.8428866043686867, "num_tokens": 832421126.0, "step": 26082 }, { "entropy": 0.5239094155840576, "epoch": 2.3997676839121107, "grad_norm": 0.16319337487220764, "learning_rate": 2.0011040574109853e-05, "loss": 0.5065, "mean_token_accuracy": 0.8374990187585354, "num_tokens": 832452785.0, "step": 26083 }, { "entropy": 0.4970861207693815, "epoch": 2.3998596902835523, "grad_norm": 0.15907536447048187, "learning_rate": 2.0007973747968228e-05, "loss": 0.4867, "mean_token_accuracy": 0.8465884141623974, "num_tokens": 832484017.0, "step": 26084 }, { "entropy": 0.5909769013524055, "epoch": 2.3999516966549934, "grad_norm": 0.1674467772245407, "learning_rate": 2.0004906921826602e-05, "loss": 0.5699, "mean_token_accuracy": 0.8224213160574436, "num_tokens": 832516097.0, "step": 26085 }, { "entropy": 0.5012580053880811, "epoch": 2.4000437030264345, "grad_norm": 0.16471418738365173, "learning_rate": 2.0001840095684977e-05, "loss": 0.4971, "mean_token_accuracy": 0.8449340686202049, "num_tokens": 832547951.0, "step": 26086 }, { "entropy": 0.44026640336960554, "epoch": 2.4001357093978757, "grad_norm": 0.1512013077735901, "learning_rate": 1.999877326954335e-05, "loss": 0.4282, "mean_token_accuracy": 0.8637932389974594, "num_tokens": 832579869.0, "step": 26087 }, { "entropy": 0.6022867802530527, "epoch": 2.400227715769317, "grad_norm": 0.17311398684978485, "learning_rate": 1.9995706443401723e-05, "loss": 0.6024, "mean_token_accuracy": 0.8110047616064548, "num_tokens": 832611696.0, "step": 26088 }, { "entropy": 0.5694153411313891, "epoch": 2.4003197221407584, "grad_norm": 0.16551218926906586, "learning_rate": 1.9992639617260097e-05, "loss": 0.5621, "mean_token_accuracy": 0.8224677927792072, "num_tokens": 832643784.0, "step": 26089 }, { "entropy": 0.5503042470663786, "epoch": 2.4004117285121995, "grad_norm": 0.16678497195243835, "learning_rate": 1.9989572791118472e-05, "loss": 0.5448, "mean_token_accuracy": 0.829307921230793, "num_tokens": 832676107.0, "step": 26090 }, { "entropy": 0.5087526831775904, "epoch": 2.4005037348836407, "grad_norm": 0.15966349840164185, "learning_rate": 1.9986505964976847e-05, "loss": 0.4928, "mean_token_accuracy": 0.8428131490945816, "num_tokens": 832708353.0, "step": 26091 }, { "entropy": 0.5795220043510199, "epoch": 2.400595741255082, "grad_norm": 0.1752215176820755, "learning_rate": 1.9983439138835218e-05, "loss": 0.581, "mean_token_accuracy": 0.8173481896519661, "num_tokens": 832740599.0, "step": 26092 }, { "entropy": 0.5285606784746051, "epoch": 2.400687747626523, "grad_norm": 0.15765516459941864, "learning_rate": 1.9980372312693593e-05, "loss": 0.5036, "mean_token_accuracy": 0.8392071351408958, "num_tokens": 832772480.0, "step": 26093 }, { "entropy": 0.4194494115654379, "epoch": 2.4007797539979645, "grad_norm": 0.14045113325119019, "learning_rate": 1.9977305486551967e-05, "loss": 0.4012, "mean_token_accuracy": 0.8710881657898426, "num_tokens": 832804580.0, "step": 26094 }, { "entropy": 0.5413951482623816, "epoch": 2.4008717603694056, "grad_norm": 0.16552762687206268, "learning_rate": 1.9974238660410342e-05, "loss": 0.5294, "mean_token_accuracy": 0.8332085013389587, "num_tokens": 832835749.0, "step": 26095 }, { "entropy": 0.49575994070619345, "epoch": 2.4009637667408468, "grad_norm": 0.1549571305513382, "learning_rate": 1.9971171834268717e-05, "loss": 0.4782, "mean_token_accuracy": 0.84889742359519, "num_tokens": 832868062.0, "step": 26096 }, { "entropy": 0.4575978491920978, "epoch": 2.401055773112288, "grad_norm": 0.15514639019966125, "learning_rate": 1.996810500812709e-05, "loss": 0.4555, "mean_token_accuracy": 0.855836670845747, "num_tokens": 832900104.0, "step": 26097 }, { "entropy": 0.5550529574975371, "epoch": 2.401147779483729, "grad_norm": 0.16236792504787445, "learning_rate": 1.9965038181985466e-05, "loss": 0.5425, "mean_token_accuracy": 0.8275897316634655, "num_tokens": 832932662.0, "step": 26098 }, { "entropy": 0.5399184301495552, "epoch": 2.4012397858551706, "grad_norm": 0.16672390699386597, "learning_rate": 1.996197135584384e-05, "loss": 0.5336, "mean_token_accuracy": 0.8341385237872601, "num_tokens": 832965177.0, "step": 26099 }, { "entropy": 0.4806796833872795, "epoch": 2.4013317922266117, "grad_norm": 0.16162320971488953, "learning_rate": 1.9958904529702212e-05, "loss": 0.4617, "mean_token_accuracy": 0.8509945310652256, "num_tokens": 832996419.0, "step": 26100 }, { "entropy": 0.47941113635897636, "epoch": 2.401423798598053, "grad_norm": 0.1553298383951187, "learning_rate": 1.9955837703560586e-05, "loss": 0.4668, "mean_token_accuracy": 0.850041076540947, "num_tokens": 833028455.0, "step": 26101 }, { "entropy": 0.5035446118563414, "epoch": 2.401515804969494, "grad_norm": 0.15632563829421997, "learning_rate": 1.995277087741896e-05, "loss": 0.4956, "mean_token_accuracy": 0.8473674319684505, "num_tokens": 833059959.0, "step": 26102 }, { "entropy": 0.5461089480668306, "epoch": 2.401607811340935, "grad_norm": 0.16495907306671143, "learning_rate": 1.9949704051277336e-05, "loss": 0.5288, "mean_token_accuracy": 0.8287323564291, "num_tokens": 833091401.0, "step": 26103 }, { "entropy": 0.5941068064421415, "epoch": 2.4016998177123767, "grad_norm": 0.1709076315164566, "learning_rate": 1.994663722513571e-05, "loss": 0.589, "mean_token_accuracy": 0.8160570599138737, "num_tokens": 833123717.0, "step": 26104 }, { "entropy": 0.6024346249178052, "epoch": 2.401791824083818, "grad_norm": 0.169118270277977, "learning_rate": 1.994357039899408e-05, "loss": 0.5913, "mean_token_accuracy": 0.8134704791009426, "num_tokens": 833155720.0, "step": 26105 }, { "entropy": 0.4916317854076624, "epoch": 2.401883830455259, "grad_norm": 0.15778358280658722, "learning_rate": 1.9940503572852456e-05, "loss": 0.4856, "mean_token_accuracy": 0.8499465435743332, "num_tokens": 833187435.0, "step": 26106 }, { "entropy": 0.5366482578683645, "epoch": 2.4019758368267, "grad_norm": 0.15745733678340912, "learning_rate": 1.993743674671083e-05, "loss": 0.5198, "mean_token_accuracy": 0.8396179154515266, "num_tokens": 833219347.0, "step": 26107 }, { "entropy": 0.4741659788414836, "epoch": 2.4020678431981413, "grad_norm": 0.15432728826999664, "learning_rate": 1.9934369920569206e-05, "loss": 0.4717, "mean_token_accuracy": 0.850059274584055, "num_tokens": 833251285.0, "step": 26108 }, { "entropy": 0.5376030448824167, "epoch": 2.402159849569583, "grad_norm": 0.16487079858779907, "learning_rate": 1.9931303094427577e-05, "loss": 0.5207, "mean_token_accuracy": 0.8361648432910442, "num_tokens": 833282862.0, "step": 26109 }, { "entropy": 0.5739565994590521, "epoch": 2.402251855941024, "grad_norm": 0.16851800680160522, "learning_rate": 1.992823626828595e-05, "loss": 0.5742, "mean_token_accuracy": 0.8213236592710018, "num_tokens": 833315317.0, "step": 26110 }, { "entropy": 0.5439188005402684, "epoch": 2.402343862312465, "grad_norm": 0.16193464398384094, "learning_rate": 1.9925169442144326e-05, "loss": 0.5317, "mean_token_accuracy": 0.8327164314687252, "num_tokens": 833347002.0, "step": 26111 }, { "entropy": 0.4639369649812579, "epoch": 2.4024358686839062, "grad_norm": 0.15510104596614838, "learning_rate": 1.99221026160027e-05, "loss": 0.4488, "mean_token_accuracy": 0.8557242080569267, "num_tokens": 833378581.0, "step": 26112 }, { "entropy": 0.4847737681120634, "epoch": 2.4025278750553474, "grad_norm": 0.1554267555475235, "learning_rate": 1.9919035789861072e-05, "loss": 0.4787, "mean_token_accuracy": 0.8461725004017353, "num_tokens": 833410353.0, "step": 26113 }, { "entropy": 0.5539296194911003, "epoch": 2.402619881426789, "grad_norm": 0.16433024406433105, "learning_rate": 1.9915968963719447e-05, "loss": 0.5406, "mean_token_accuracy": 0.8298123702406883, "num_tokens": 833442056.0, "step": 26114 }, { "entropy": 0.36323997378349304, "epoch": 2.40271188779823, "grad_norm": 0.13966476917266846, "learning_rate": 1.991290213757782e-05, "loss": 0.3527, "mean_token_accuracy": 0.8868836499750614, "num_tokens": 833474264.0, "step": 26115 }, { "entropy": 0.5284060705453157, "epoch": 2.402803894169671, "grad_norm": 0.16864274442195892, "learning_rate": 1.9909835311436196e-05, "loss": 0.5311, "mean_token_accuracy": 0.830018911510706, "num_tokens": 833505948.0, "step": 26116 }, { "entropy": 0.6270012836903334, "epoch": 2.4028959005411124, "grad_norm": 0.17528985440731049, "learning_rate": 1.990676848529457e-05, "loss": 0.6145, "mean_token_accuracy": 0.8056369461119175, "num_tokens": 833537091.0, "step": 26117 }, { "entropy": 0.5678366255015135, "epoch": 2.4029879069125535, "grad_norm": 0.16650883853435516, "learning_rate": 1.9903701659152942e-05, "loss": 0.5627, "mean_token_accuracy": 0.8218117095530033, "num_tokens": 833569493.0, "step": 26118 }, { "entropy": 0.626291430555284, "epoch": 2.403079913283995, "grad_norm": 0.1736854761838913, "learning_rate": 1.9900634833011317e-05, "loss": 0.6171, "mean_token_accuracy": 0.807959470897913, "num_tokens": 833601546.0, "step": 26119 }, { "entropy": 0.5429552933201194, "epoch": 2.403171919655436, "grad_norm": 0.15873397886753082, "learning_rate": 1.989756800686969e-05, "loss": 0.522, "mean_token_accuracy": 0.8342181071639061, "num_tokens": 833633807.0, "step": 26120 }, { "entropy": 0.4651013354305178, "epoch": 2.4032639260268773, "grad_norm": 0.1522996723651886, "learning_rate": 1.9894501180728066e-05, "loss": 0.4508, "mean_token_accuracy": 0.8560621291399002, "num_tokens": 833665199.0, "step": 26121 }, { "entropy": 0.4650922240689397, "epoch": 2.4033559323983185, "grad_norm": 0.1523481011390686, "learning_rate": 1.9891434354586437e-05, "loss": 0.4585, "mean_token_accuracy": 0.8545737601816654, "num_tokens": 833697967.0, "step": 26122 }, { "entropy": 0.4189236257225275, "epoch": 2.4034479387697596, "grad_norm": 0.14493297040462494, "learning_rate": 1.9888367528444812e-05, "loss": 0.4104, "mean_token_accuracy": 0.8700653202831745, "num_tokens": 833730221.0, "step": 26123 }, { "entropy": 0.496920840931125, "epoch": 2.403539945141201, "grad_norm": 0.1605994999408722, "learning_rate": 1.9885300702303186e-05, "loss": 0.4929, "mean_token_accuracy": 0.8424192108213902, "num_tokens": 833762238.0, "step": 26124 }, { "entropy": 0.44246829207986593, "epoch": 2.4036319515126423, "grad_norm": 0.15260624885559082, "learning_rate": 1.988223387616156e-05, "loss": 0.4352, "mean_token_accuracy": 0.8599189482629299, "num_tokens": 833793753.0, "step": 26125 }, { "entropy": 0.5027832518098876, "epoch": 2.4037239578840834, "grad_norm": 0.15351541340351105, "learning_rate": 1.9879167050019936e-05, "loss": 0.4803, "mean_token_accuracy": 0.8464512266218662, "num_tokens": 833825351.0, "step": 26126 }, { "entropy": 0.5465493770316243, "epoch": 2.4038159642555246, "grad_norm": 0.16686376929283142, "learning_rate": 1.987610022387831e-05, "loss": 0.5439, "mean_token_accuracy": 0.825518611818552, "num_tokens": 833857545.0, "step": 26127 }, { "entropy": 0.4970105937682092, "epoch": 2.4039079706269657, "grad_norm": 0.15429702401161194, "learning_rate": 1.9873033397736685e-05, "loss": 0.4811, "mean_token_accuracy": 0.8487188555300236, "num_tokens": 833889873.0, "step": 26128 }, { "entropy": 0.5495276441797614, "epoch": 2.4039999769984073, "grad_norm": 0.16619472205638885, "learning_rate": 1.986996657159506e-05, "loss": 0.534, "mean_token_accuracy": 0.834750808775425, "num_tokens": 833921788.0, "step": 26129 }, { "entropy": 0.4298303509131074, "epoch": 2.4040919833698484, "grad_norm": 0.1441943198442459, "learning_rate": 1.986689974545343e-05, "loss": 0.4123, "mean_token_accuracy": 0.8696460500359535, "num_tokens": 833954442.0, "step": 26130 }, { "entropy": 0.5636512143537402, "epoch": 2.4041839897412896, "grad_norm": 0.16196200251579285, "learning_rate": 1.9863832919311805e-05, "loss": 0.552, "mean_token_accuracy": 0.8253497071564198, "num_tokens": 833986423.0, "step": 26131 }, { "entropy": 0.5076626902446151, "epoch": 2.4042759961127307, "grad_norm": 0.1628219485282898, "learning_rate": 1.986076609317018e-05, "loss": 0.4944, "mean_token_accuracy": 0.8428264148533344, "num_tokens": 834018115.0, "step": 26132 }, { "entropy": 0.5878603615565225, "epoch": 2.404368002484172, "grad_norm": 0.1691756248474121, "learning_rate": 1.9857699267028555e-05, "loss": 0.573, "mean_token_accuracy": 0.8193567991256714, "num_tokens": 834049315.0, "step": 26133 }, { "entropy": 0.5436814215499908, "epoch": 2.4044600088556134, "grad_norm": 0.1635713279247284, "learning_rate": 1.985463244088693e-05, "loss": 0.5203, "mean_token_accuracy": 0.8322717286646366, "num_tokens": 834081443.0, "step": 26134 }, { "entropy": 0.47472541593015194, "epoch": 2.4045520152270545, "grad_norm": 0.1513386368751526, "learning_rate": 1.98515656147453e-05, "loss": 0.4508, "mean_token_accuracy": 0.8545581512153149, "num_tokens": 834113637.0, "step": 26135 }, { "entropy": 0.48759076464921236, "epoch": 2.4046440215984957, "grad_norm": 0.1574689894914627, "learning_rate": 1.9848498788603675e-05, "loss": 0.4742, "mean_token_accuracy": 0.8483472131192684, "num_tokens": 834144860.0, "step": 26136 }, { "entropy": 0.4218065803870559, "epoch": 2.404736027969937, "grad_norm": 0.1552276313304901, "learning_rate": 1.984543196246205e-05, "loss": 0.4167, "mean_token_accuracy": 0.867742508649826, "num_tokens": 834175925.0, "step": 26137 }, { "entropy": 0.436872529797256, "epoch": 2.404828034341378, "grad_norm": 0.1534586399793625, "learning_rate": 1.9842365136320425e-05, "loss": 0.4221, "mean_token_accuracy": 0.8676673844456673, "num_tokens": 834207294.0, "step": 26138 }, { "entropy": 0.47464714432135224, "epoch": 2.4049200407128195, "grad_norm": 0.155690997838974, "learning_rate": 1.9839298310178796e-05, "loss": 0.4601, "mean_token_accuracy": 0.8528567291796207, "num_tokens": 834239017.0, "step": 26139 }, { "entropy": 0.5511893527582288, "epoch": 2.4050120470842606, "grad_norm": 0.17076759040355682, "learning_rate": 1.983623148403717e-05, "loss": 0.5412, "mean_token_accuracy": 0.8312119916081429, "num_tokens": 834270901.0, "step": 26140 }, { "entropy": 0.43868565070442855, "epoch": 2.4051040534557018, "grad_norm": 0.15244068205356598, "learning_rate": 1.9833164657895545e-05, "loss": 0.4181, "mean_token_accuracy": 0.8628141582012177, "num_tokens": 834301310.0, "step": 26141 }, { "entropy": 0.6227294616401196, "epoch": 2.405196059827143, "grad_norm": 0.17622262239456177, "learning_rate": 1.983009783175392e-05, "loss": 0.6135, "mean_token_accuracy": 0.808188185095787, "num_tokens": 834332780.0, "step": 26142 }, { "entropy": 0.5099688521586359, "epoch": 2.405288066198584, "grad_norm": 0.15865379571914673, "learning_rate": 1.982703100561229e-05, "loss": 0.4842, "mean_token_accuracy": 0.8486400693655014, "num_tokens": 834364374.0, "step": 26143 }, { "entropy": 0.5395197607576847, "epoch": 2.4053800725700256, "grad_norm": 0.16220954060554504, "learning_rate": 1.9823964179470666e-05, "loss": 0.5277, "mean_token_accuracy": 0.8307577706873417, "num_tokens": 834396286.0, "step": 26144 }, { "entropy": 0.6877842843532562, "epoch": 2.4054720789414668, "grad_norm": 0.17906774580478668, "learning_rate": 1.982089735332904e-05, "loss": 0.6704, "mean_token_accuracy": 0.7893979251384735, "num_tokens": 834427694.0, "step": 26145 }, { "entropy": 0.5318983281031251, "epoch": 2.405564085312908, "grad_norm": 0.15839402377605438, "learning_rate": 1.9817830527187415e-05, "loss": 0.5073, "mean_token_accuracy": 0.8388624750077724, "num_tokens": 834459434.0, "step": 26146 }, { "entropy": 0.5946611035615206, "epoch": 2.405656091684349, "grad_norm": 0.17635153234004974, "learning_rate": 1.981476370104579e-05, "loss": 0.5837, "mean_token_accuracy": 0.8179574571549892, "num_tokens": 834490452.0, "step": 26147 }, { "entropy": 0.5721626002341509, "epoch": 2.40574809805579, "grad_norm": 0.16793763637542725, "learning_rate": 1.981169687490416e-05, "loss": 0.559, "mean_token_accuracy": 0.8260501138865948, "num_tokens": 834522469.0, "step": 26148 }, { "entropy": 0.5004021525382996, "epoch": 2.4058401044272317, "grad_norm": 0.15997838973999023, "learning_rate": 1.9808630048762536e-05, "loss": 0.5017, "mean_token_accuracy": 0.8457598946988583, "num_tokens": 834554204.0, "step": 26149 }, { "entropy": 0.5237903948873281, "epoch": 2.405932110798673, "grad_norm": 0.16037040948867798, "learning_rate": 1.980556322262091e-05, "loss": 0.5036, "mean_token_accuracy": 0.8432026617228985, "num_tokens": 834585533.0, "step": 26150 }, { "entropy": 0.6057842951267958, "epoch": 2.406024117170114, "grad_norm": 0.16564974188804626, "learning_rate": 1.9802496396479285e-05, "loss": 0.6012, "mean_token_accuracy": 0.8129435889422894, "num_tokens": 834617718.0, "step": 26151 }, { "entropy": 0.4399915081448853, "epoch": 2.406116123541555, "grad_norm": 0.15008413791656494, "learning_rate": 1.9799429570337656e-05, "loss": 0.4305, "mean_token_accuracy": 0.8626795075833797, "num_tokens": 834650101.0, "step": 26152 }, { "entropy": 0.5862985905259848, "epoch": 2.4062081299129963, "grad_norm": 0.17090533673763275, "learning_rate": 1.979636274419603e-05, "loss": 0.5728, "mean_token_accuracy": 0.8190912716090679, "num_tokens": 834681654.0, "step": 26153 }, { "entropy": 0.4691485594958067, "epoch": 2.406300136284438, "grad_norm": 0.15388737618923187, "learning_rate": 1.9793295918054405e-05, "loss": 0.4607, "mean_token_accuracy": 0.8517224825918674, "num_tokens": 834713891.0, "step": 26154 }, { "entropy": 0.49331429693847895, "epoch": 2.406392142655879, "grad_norm": 0.16268716752529144, "learning_rate": 1.979022909191278e-05, "loss": 0.4906, "mean_token_accuracy": 0.844536304473877, "num_tokens": 834745788.0, "step": 26155 }, { "entropy": 0.5126431211829185, "epoch": 2.40648414902732, "grad_norm": 0.1587390899658203, "learning_rate": 1.9787162265771155e-05, "loss": 0.5008, "mean_token_accuracy": 0.8396257646381855, "num_tokens": 834778287.0, "step": 26156 }, { "entropy": 0.4907363534439355, "epoch": 2.4065761553987612, "grad_norm": 0.1556762009859085, "learning_rate": 1.978409543962953e-05, "loss": 0.4792, "mean_token_accuracy": 0.8444112874567509, "num_tokens": 834810716.0, "step": 26157 }, { "entropy": 0.5506733329966664, "epoch": 2.4066681617702024, "grad_norm": 0.16224651038646698, "learning_rate": 1.9781028613487904e-05, "loss": 0.5374, "mean_token_accuracy": 0.8298027329146862, "num_tokens": 834842798.0, "step": 26158 }, { "entropy": 0.5488789435476065, "epoch": 2.406760168141644, "grad_norm": 0.16026923060417175, "learning_rate": 1.977796178734628e-05, "loss": 0.5447, "mean_token_accuracy": 0.8285291530191898, "num_tokens": 834875374.0, "step": 26159 }, { "entropy": 0.5143155134283006, "epoch": 2.406852174513085, "grad_norm": 0.15929286181926727, "learning_rate": 1.977489496120465e-05, "loss": 0.5123, "mean_token_accuracy": 0.8370455056428909, "num_tokens": 834907977.0, "step": 26160 }, { "entropy": 0.6576433531008661, "epoch": 2.406944180884526, "grad_norm": 0.17253950238227844, "learning_rate": 1.9771828135063025e-05, "loss": 0.641, "mean_token_accuracy": 0.7985675372183323, "num_tokens": 834939677.0, "step": 26161 }, { "entropy": 0.5176816359162331, "epoch": 2.4070361872559674, "grad_norm": 0.15900221467018127, "learning_rate": 1.97687613089214e-05, "loss": 0.4913, "mean_token_accuracy": 0.8420113995671272, "num_tokens": 834970339.0, "step": 26162 }, { "entropy": 0.5000947397202253, "epoch": 2.4071281936274085, "grad_norm": 0.15268085896968842, "learning_rate": 1.9765694482779774e-05, "loss": 0.4955, "mean_token_accuracy": 0.841589018702507, "num_tokens": 835002899.0, "step": 26163 }, { "entropy": 0.5173370828852057, "epoch": 2.40722019999885, "grad_norm": 0.1608669012784958, "learning_rate": 1.976262765663815e-05, "loss": 0.5024, "mean_token_accuracy": 0.8419556468725204, "num_tokens": 835035366.0, "step": 26164 }, { "entropy": 0.5583915486931801, "epoch": 2.407312206370291, "grad_norm": 0.16267837584018707, "learning_rate": 1.975956083049652e-05, "loss": 0.549, "mean_token_accuracy": 0.823723278939724, "num_tokens": 835067219.0, "step": 26165 }, { "entropy": 0.5034133521839976, "epoch": 2.4074042127417323, "grad_norm": 0.1596042960882187, "learning_rate": 1.9756494004354894e-05, "loss": 0.4938, "mean_token_accuracy": 0.8444642052054405, "num_tokens": 835099154.0, "step": 26166 }, { "entropy": 0.5700008072890341, "epoch": 2.4074962191131735, "grad_norm": 0.16875316202640533, "learning_rate": 1.975342717821327e-05, "loss": 0.5604, "mean_token_accuracy": 0.822108656167984, "num_tokens": 835130114.0, "step": 26167 }, { "entropy": 0.5504864891991019, "epoch": 2.4075882254846146, "grad_norm": 0.16675639152526855, "learning_rate": 1.9750360352071644e-05, "loss": 0.5285, "mean_token_accuracy": 0.831296369433403, "num_tokens": 835161729.0, "step": 26168 }, { "entropy": 0.5486484654247761, "epoch": 2.407680231856056, "grad_norm": 0.1598239690065384, "learning_rate": 1.9747293525930015e-05, "loss": 0.5402, "mean_token_accuracy": 0.82812275364995, "num_tokens": 835193620.0, "step": 26169 }, { "entropy": 0.4946651067584753, "epoch": 2.4077722382274973, "grad_norm": 0.16039347648620605, "learning_rate": 1.974422669978839e-05, "loss": 0.4873, "mean_token_accuracy": 0.8481707572937012, "num_tokens": 835225332.0, "step": 26170 }, { "entropy": 0.4504698282107711, "epoch": 2.4078642445989384, "grad_norm": 0.14583466947078705, "learning_rate": 1.9741159873646764e-05, "loss": 0.4456, "mean_token_accuracy": 0.8579606600105762, "num_tokens": 835257847.0, "step": 26171 }, { "entropy": 0.6095360778272152, "epoch": 2.4079562509703796, "grad_norm": 0.1684550791978836, "learning_rate": 1.973809304750514e-05, "loss": 0.6032, "mean_token_accuracy": 0.8112558573484421, "num_tokens": 835290024.0, "step": 26172 }, { "entropy": 0.49461911898106337, "epoch": 2.4080482573418207, "grad_norm": 0.16005763411521912, "learning_rate": 1.973502622136351e-05, "loss": 0.476, "mean_token_accuracy": 0.8483422957360744, "num_tokens": 835321847.0, "step": 26173 }, { "entropy": 0.47998157516121864, "epoch": 2.4081402637132623, "grad_norm": 0.15577924251556396, "learning_rate": 1.9731959395221885e-05, "loss": 0.4594, "mean_token_accuracy": 0.8542527668178082, "num_tokens": 835354220.0, "step": 26174 }, { "entropy": 0.5700126104056835, "epoch": 2.4082322700847034, "grad_norm": 0.16442428529262543, "learning_rate": 1.972889256908026e-05, "loss": 0.5603, "mean_token_accuracy": 0.8235969990491867, "num_tokens": 835386126.0, "step": 26175 }, { "entropy": 0.5441691167652607, "epoch": 2.4083242764561446, "grad_norm": 0.1586681753396988, "learning_rate": 1.9725825742938634e-05, "loss": 0.5267, "mean_token_accuracy": 0.83403554931283, "num_tokens": 835417793.0, "step": 26176 }, { "entropy": 0.5227386876940727, "epoch": 2.4084162828275857, "grad_norm": 0.16068100929260254, "learning_rate": 1.972275891679701e-05, "loss": 0.5086, "mean_token_accuracy": 0.8380877450108528, "num_tokens": 835449930.0, "step": 26177 }, { "entropy": 0.5156838037073612, "epoch": 2.408508289199027, "grad_norm": 0.15904264152050018, "learning_rate": 1.971969209065538e-05, "loss": 0.4953, "mean_token_accuracy": 0.8407746180891991, "num_tokens": 835481911.0, "step": 26178 }, { "entropy": 0.5745915872976184, "epoch": 2.4086002955704684, "grad_norm": 0.17171798646450043, "learning_rate": 1.9716625264513755e-05, "loss": 0.5604, "mean_token_accuracy": 0.8248511105775833, "num_tokens": 835513630.0, "step": 26179 }, { "entropy": 0.47537724394351244, "epoch": 2.4086923019419095, "grad_norm": 0.15335410833358765, "learning_rate": 1.971355843837213e-05, "loss": 0.46, "mean_token_accuracy": 0.8520065881311893, "num_tokens": 835546084.0, "step": 26180 }, { "entropy": 0.5490869274362922, "epoch": 2.4087843083133507, "grad_norm": 0.16218088567256927, "learning_rate": 1.9710491612230504e-05, "loss": 0.5314, "mean_token_accuracy": 0.8301462382078171, "num_tokens": 835578442.0, "step": 26181 }, { "entropy": 0.532496533356607, "epoch": 2.408876314684792, "grad_norm": 0.1585909128189087, "learning_rate": 1.9707424786088875e-05, "loss": 0.5119, "mean_token_accuracy": 0.8368688896298409, "num_tokens": 835610684.0, "step": 26182 }, { "entropy": 0.5496211852878332, "epoch": 2.408968321056233, "grad_norm": 0.16562092304229736, "learning_rate": 1.970435795994725e-05, "loss": 0.5357, "mean_token_accuracy": 0.8300470225512981, "num_tokens": 835643111.0, "step": 26183 }, { "entropy": 0.5724078798666596, "epoch": 2.4090603274276745, "grad_norm": 0.16878551244735718, "learning_rate": 1.9701291133805625e-05, "loss": 0.5631, "mean_token_accuracy": 0.8233716115355492, "num_tokens": 835675508.0, "step": 26184 }, { "entropy": 0.5177913485094905, "epoch": 2.4091523337991156, "grad_norm": 0.1622123122215271, "learning_rate": 1.9698224307664e-05, "loss": 0.5161, "mean_token_accuracy": 0.8366907685995102, "num_tokens": 835708067.0, "step": 26185 }, { "entropy": 0.5193694923073053, "epoch": 2.4092443401705568, "grad_norm": 0.16082893311977386, "learning_rate": 1.9695157481522374e-05, "loss": 0.5057, "mean_token_accuracy": 0.8390460312366486, "num_tokens": 835740410.0, "step": 26186 }, { "entropy": 0.5525753665715456, "epoch": 2.409336346541998, "grad_norm": 0.16915076971054077, "learning_rate": 1.9692090655380745e-05, "loss": 0.5427, "mean_token_accuracy": 0.8278582692146301, "num_tokens": 835772428.0, "step": 26187 }, { "entropy": 0.45162942819297314, "epoch": 2.409428352913439, "grad_norm": 0.1585538387298584, "learning_rate": 1.9689023829239123e-05, "loss": 0.4509, "mean_token_accuracy": 0.8564438000321388, "num_tokens": 835804399.0, "step": 26188 }, { "entropy": 0.501739751547575, "epoch": 2.4095203592848806, "grad_norm": 0.1637091040611267, "learning_rate": 1.9685957003097498e-05, "loss": 0.4816, "mean_token_accuracy": 0.8451672196388245, "num_tokens": 835835111.0, "step": 26189 }, { "entropy": 0.44216250255703926, "epoch": 2.4096123656563218, "grad_norm": 0.15736733376979828, "learning_rate": 1.968289017695587e-05, "loss": 0.433, "mean_token_accuracy": 0.8595384918153286, "num_tokens": 835866916.0, "step": 26190 }, { "entropy": 0.551089646993205, "epoch": 2.409704372027763, "grad_norm": 0.16787447035312653, "learning_rate": 1.9679823350814244e-05, "loss": 0.5478, "mean_token_accuracy": 0.8304443284869194, "num_tokens": 835898661.0, "step": 26191 }, { "entropy": 0.5683368127793074, "epoch": 2.409796378399204, "grad_norm": 0.1675398200750351, "learning_rate": 1.967675652467262e-05, "loss": 0.5559, "mean_token_accuracy": 0.8201028406620026, "num_tokens": 835930228.0, "step": 26192 }, { "entropy": 0.566498314961791, "epoch": 2.409888384770645, "grad_norm": 0.17167754471302032, "learning_rate": 1.9673689698530993e-05, "loss": 0.57, "mean_token_accuracy": 0.8234076611697674, "num_tokens": 835962006.0, "step": 26193 }, { "entropy": 0.5258171856403351, "epoch": 2.4099803911420867, "grad_norm": 0.163818821310997, "learning_rate": 1.9670622872389368e-05, "loss": 0.5183, "mean_token_accuracy": 0.8332011476159096, "num_tokens": 835993018.0, "step": 26194 }, { "entropy": 0.4401315273717046, "epoch": 2.410072397513528, "grad_norm": 0.15250156819820404, "learning_rate": 1.966755604624774e-05, "loss": 0.4294, "mean_token_accuracy": 0.8632313907146454, "num_tokens": 836025135.0, "step": 26195 }, { "entropy": 0.666875347495079, "epoch": 2.410164403884969, "grad_norm": 0.17506107687950134, "learning_rate": 1.9664489220106114e-05, "loss": 0.6572, "mean_token_accuracy": 0.7939229756593704, "num_tokens": 836057052.0, "step": 26196 }, { "entropy": 0.5516678839921951, "epoch": 2.41025641025641, "grad_norm": 0.16834084689617157, "learning_rate": 1.9661422393964488e-05, "loss": 0.5439, "mean_token_accuracy": 0.830030370503664, "num_tokens": 836088471.0, "step": 26197 }, { "entropy": 0.622870909050107, "epoch": 2.4103484166278513, "grad_norm": 0.1728067249059677, "learning_rate": 1.9658355567822863e-05, "loss": 0.6164, "mean_token_accuracy": 0.8089278824627399, "num_tokens": 836120396.0, "step": 26198 }, { "entropy": 0.5281568029895425, "epoch": 2.410440422999293, "grad_norm": 0.16271060705184937, "learning_rate": 1.9655288741681234e-05, "loss": 0.5151, "mean_token_accuracy": 0.8392013944685459, "num_tokens": 836152039.0, "step": 26199 }, { "entropy": 0.4584257567767054, "epoch": 2.410532429370734, "grad_norm": 0.15068168938159943, "learning_rate": 1.965222191553961e-05, "loss": 0.4505, "mean_token_accuracy": 0.8554592095315456, "num_tokens": 836184807.0, "step": 26200 }, { "entropy": 0.5838647969067097, "epoch": 2.410624435742175, "grad_norm": 0.16621986031532288, "learning_rate": 1.9649155089397983e-05, "loss": 0.552, "mean_token_accuracy": 0.8249569609761238, "num_tokens": 836216360.0, "step": 26201 }, { "entropy": 0.47963701747357845, "epoch": 2.4107164421136162, "grad_norm": 0.15339843928813934, "learning_rate": 1.9646088263256358e-05, "loss": 0.4753, "mean_token_accuracy": 0.8487159945070744, "num_tokens": 836248730.0, "step": 26202 }, { "entropy": 0.5093176877126098, "epoch": 2.4108084484850574, "grad_norm": 0.15838785469532013, "learning_rate": 1.964302143711473e-05, "loss": 0.4908, "mean_token_accuracy": 0.8415728993713856, "num_tokens": 836279994.0, "step": 26203 }, { "entropy": 0.6068449057638645, "epoch": 2.410900454856499, "grad_norm": 0.17246170341968536, "learning_rate": 1.9639954610973104e-05, "loss": 0.5964, "mean_token_accuracy": 0.8141794428229332, "num_tokens": 836311335.0, "step": 26204 }, { "entropy": 0.5046912579564378, "epoch": 2.41099246122794, "grad_norm": 0.15430116653442383, "learning_rate": 1.963688778483148e-05, "loss": 0.4892, "mean_token_accuracy": 0.845535159111023, "num_tokens": 836343201.0, "step": 26205 }, { "entropy": 0.41667114570736885, "epoch": 2.411084467599381, "grad_norm": 0.14496630430221558, "learning_rate": 1.9633820958689853e-05, "loss": 0.4049, "mean_token_accuracy": 0.8703527823090553, "num_tokens": 836375533.0, "step": 26206 }, { "entropy": 0.5194742735475302, "epoch": 2.4111764739708224, "grad_norm": 0.15884047746658325, "learning_rate": 1.9630754132548228e-05, "loss": 0.501, "mean_token_accuracy": 0.8421749472618103, "num_tokens": 836406969.0, "step": 26207 }, { "entropy": 0.5766948256641626, "epoch": 2.4112684803422635, "grad_norm": 0.16393762826919556, "learning_rate": 1.96276873064066e-05, "loss": 0.5562, "mean_token_accuracy": 0.8228850141167641, "num_tokens": 836439259.0, "step": 26208 }, { "entropy": 0.5128860948607326, "epoch": 2.411360486713705, "grad_norm": 0.15301668643951416, "learning_rate": 1.9624620480264974e-05, "loss": 0.4882, "mean_token_accuracy": 0.8453052118420601, "num_tokens": 836471744.0, "step": 26209 }, { "entropy": 0.5737331677228212, "epoch": 2.411452493085146, "grad_norm": 0.1653514951467514, "learning_rate": 1.962155365412335e-05, "loss": 0.5685, "mean_token_accuracy": 0.8214019648730755, "num_tokens": 836503354.0, "step": 26210 }, { "entropy": 0.4689354752190411, "epoch": 2.4115444994565873, "grad_norm": 0.14921784400939941, "learning_rate": 1.9618486827981723e-05, "loss": 0.4531, "mean_token_accuracy": 0.8552605472505093, "num_tokens": 836535044.0, "step": 26211 }, { "entropy": 0.4962885696440935, "epoch": 2.4116365058280285, "grad_norm": 0.15298448503017426, "learning_rate": 1.9615420001840094e-05, "loss": 0.4788, "mean_token_accuracy": 0.8470564819872379, "num_tokens": 836567112.0, "step": 26212 }, { "entropy": 0.5189344292739406, "epoch": 2.4117285121994696, "grad_norm": 0.15814140439033508, "learning_rate": 1.961235317569847e-05, "loss": 0.5116, "mean_token_accuracy": 0.8401139415800571, "num_tokens": 836599576.0, "step": 26213 }, { "entropy": 0.5883199721574783, "epoch": 2.411820518570911, "grad_norm": 0.1666446030139923, "learning_rate": 1.9609286349556844e-05, "loss": 0.5734, "mean_token_accuracy": 0.8196572922170162, "num_tokens": 836632123.0, "step": 26214 }, { "entropy": 0.4568587576504797, "epoch": 2.4119125249423523, "grad_norm": 0.1491430252790451, "learning_rate": 1.9606219523415218e-05, "loss": 0.4556, "mean_token_accuracy": 0.856887012720108, "num_tokens": 836664316.0, "step": 26215 }, { "entropy": 0.5194780062884092, "epoch": 2.4120045313137934, "grad_norm": 0.16833798587322235, "learning_rate": 1.9603152697273593e-05, "loss": 0.5142, "mean_token_accuracy": 0.8405493274331093, "num_tokens": 836695865.0, "step": 26216 }, { "entropy": 0.51119440398179, "epoch": 2.4120965376852346, "grad_norm": 0.1624678373336792, "learning_rate": 1.9600085871131964e-05, "loss": 0.5092, "mean_token_accuracy": 0.834086462855339, "num_tokens": 836728633.0, "step": 26217 }, { "entropy": 0.5044340533204377, "epoch": 2.4121885440566757, "grad_norm": 0.15620867908000946, "learning_rate": 1.9597019044990342e-05, "loss": 0.4969, "mean_token_accuracy": 0.84138373285532, "num_tokens": 836761401.0, "step": 26218 }, { "entropy": 0.48979128058999777, "epoch": 2.4122805504281173, "grad_norm": 0.1661367267370224, "learning_rate": 1.9593952218848717e-05, "loss": 0.4834, "mean_token_accuracy": 0.8487119600176811, "num_tokens": 836793080.0, "step": 26219 }, { "entropy": 0.47969215526245534, "epoch": 2.4123725567995584, "grad_norm": 0.15215742588043213, "learning_rate": 1.9590885392707088e-05, "loss": 0.4768, "mean_token_accuracy": 0.8511816598474979, "num_tokens": 836825266.0, "step": 26220 }, { "entropy": 0.5266117288265377, "epoch": 2.4124645631709996, "grad_norm": 0.15478961169719696, "learning_rate": 1.9587818566565463e-05, "loss": 0.5142, "mean_token_accuracy": 0.840375192463398, "num_tokens": 836857596.0, "step": 26221 }, { "entropy": 0.4685056898742914, "epoch": 2.4125565695424407, "grad_norm": 0.15298953652381897, "learning_rate": 1.9584751740423837e-05, "loss": 0.4518, "mean_token_accuracy": 0.8557789288461208, "num_tokens": 836888944.0, "step": 26222 }, { "entropy": 0.49530377658084035, "epoch": 2.412648575913882, "grad_norm": 0.15873616933822632, "learning_rate": 1.9581684914282212e-05, "loss": 0.4823, "mean_token_accuracy": 0.846111610531807, "num_tokens": 836921074.0, "step": 26223 }, { "entropy": 0.48755086911842227, "epoch": 2.4127405822853234, "grad_norm": 0.16097377240657806, "learning_rate": 1.9578618088140587e-05, "loss": 0.4846, "mean_token_accuracy": 0.8461832217872143, "num_tokens": 836953374.0, "step": 26224 }, { "entropy": 0.374448636546731, "epoch": 2.4128325886567645, "grad_norm": 0.14283087849617004, "learning_rate": 1.9575551261998958e-05, "loss": 0.3548, "mean_token_accuracy": 0.8830354921519756, "num_tokens": 836984767.0, "step": 26225 }, { "entropy": 0.5134054301306605, "epoch": 2.4129245950282057, "grad_norm": 0.15771128237247467, "learning_rate": 1.9572484435857333e-05, "loss": 0.5064, "mean_token_accuracy": 0.8412019498646259, "num_tokens": 837016962.0, "step": 26226 }, { "entropy": 0.5094224133063108, "epoch": 2.413016601399647, "grad_norm": 0.16338026523590088, "learning_rate": 1.9569417609715707e-05, "loss": 0.5121, "mean_token_accuracy": 0.8366847932338715, "num_tokens": 837048740.0, "step": 26227 }, { "entropy": 0.4351937265601009, "epoch": 2.413108607771088, "grad_norm": 0.1448437124490738, "learning_rate": 1.9566350783574082e-05, "loss": 0.4137, "mean_token_accuracy": 0.866161897778511, "num_tokens": 837080753.0, "step": 26228 }, { "entropy": 0.4966364190913737, "epoch": 2.4132006141425295, "grad_norm": 0.15721730887889862, "learning_rate": 1.9563283957432453e-05, "loss": 0.4759, "mean_token_accuracy": 0.8491725437343121, "num_tokens": 837112097.0, "step": 26229 }, { "entropy": 0.5031116493046284, "epoch": 2.4132926205139706, "grad_norm": 0.15266487002372742, "learning_rate": 1.9560217131290828e-05, "loss": 0.4954, "mean_token_accuracy": 0.8447023220360279, "num_tokens": 837144035.0, "step": 26230 }, { "entropy": 0.5095049720257521, "epoch": 2.4133846268854118, "grad_norm": 0.15993425250053406, "learning_rate": 1.9557150305149202e-05, "loss": 0.4909, "mean_token_accuracy": 0.8416613079607487, "num_tokens": 837175340.0, "step": 26231 }, { "entropy": 0.4963711479213089, "epoch": 2.413476633256853, "grad_norm": 0.15718436241149902, "learning_rate": 1.9554083479007577e-05, "loss": 0.469, "mean_token_accuracy": 0.8469946458935738, "num_tokens": 837206839.0, "step": 26232 }, { "entropy": 0.4963783025741577, "epoch": 2.413568639628294, "grad_norm": 0.1561092734336853, "learning_rate": 1.955101665286595e-05, "loss": 0.4777, "mean_token_accuracy": 0.8472450375556946, "num_tokens": 837239082.0, "step": 26233 }, { "entropy": 0.5451268125325441, "epoch": 2.4136606459997356, "grad_norm": 0.16140303015708923, "learning_rate": 1.9547949826724323e-05, "loss": 0.5248, "mean_token_accuracy": 0.833341583609581, "num_tokens": 837270538.0, "step": 26234 }, { "entropy": 0.4405608088709414, "epoch": 2.4137526523711768, "grad_norm": 0.14937783777713776, "learning_rate": 1.9544883000582698e-05, "loss": 0.415, "mean_token_accuracy": 0.8660451211035252, "num_tokens": 837301891.0, "step": 26235 }, { "entropy": 0.4849679758772254, "epoch": 2.413844658742618, "grad_norm": 0.1526428461074829, "learning_rate": 1.9541816174441072e-05, "loss": 0.4679, "mean_token_accuracy": 0.8496525138616562, "num_tokens": 837334010.0, "step": 26236 }, { "entropy": 0.5278410203754902, "epoch": 2.413936665114059, "grad_norm": 0.15299832820892334, "learning_rate": 1.9538749348299447e-05, "loss": 0.5127, "mean_token_accuracy": 0.8361075595021248, "num_tokens": 837366491.0, "step": 26237 }, { "entropy": 0.5269639454782009, "epoch": 2.4140286714855, "grad_norm": 0.16160568594932556, "learning_rate": 1.9535682522157818e-05, "loss": 0.5207, "mean_token_accuracy": 0.8348600007593632, "num_tokens": 837398490.0, "step": 26238 }, { "entropy": 0.4363840511068702, "epoch": 2.4141206778569417, "grad_norm": 0.14537681639194489, "learning_rate": 1.9532615696016193e-05, "loss": 0.4225, "mean_token_accuracy": 0.8637517169117928, "num_tokens": 837430143.0, "step": 26239 }, { "entropy": 0.5347416959702969, "epoch": 2.414212684228383, "grad_norm": 0.1654449850320816, "learning_rate": 1.9529548869874568e-05, "loss": 0.5295, "mean_token_accuracy": 0.8276915214955807, "num_tokens": 837462104.0, "step": 26240 }, { "entropy": 0.4142713313922286, "epoch": 2.414304690599824, "grad_norm": 0.14597363770008087, "learning_rate": 1.9526482043732942e-05, "loss": 0.4136, "mean_token_accuracy": 0.8677781820297241, "num_tokens": 837494613.0, "step": 26241 }, { "entropy": 0.4071981282904744, "epoch": 2.414396696971265, "grad_norm": 0.14257872104644775, "learning_rate": 1.9523415217591313e-05, "loss": 0.3829, "mean_token_accuracy": 0.8753468729555607, "num_tokens": 837526558.0, "step": 26242 }, { "entropy": 0.5490435119718313, "epoch": 2.4144887033427063, "grad_norm": 0.16245099902153015, "learning_rate": 1.9520348391449688e-05, "loss": 0.5288, "mean_token_accuracy": 0.8306854590773582, "num_tokens": 837558264.0, "step": 26243 }, { "entropy": 0.4843086190521717, "epoch": 2.414580709714148, "grad_norm": 0.15672263503074646, "learning_rate": 1.9517281565308063e-05, "loss": 0.4742, "mean_token_accuracy": 0.8486210815608501, "num_tokens": 837590336.0, "step": 26244 }, { "entropy": 0.4871514793485403, "epoch": 2.414672716085589, "grad_norm": 0.15796081721782684, "learning_rate": 1.9514214739166437e-05, "loss": 0.4755, "mean_token_accuracy": 0.8500645458698273, "num_tokens": 837622658.0, "step": 26245 }, { "entropy": 0.5504066585563123, "epoch": 2.41476472245703, "grad_norm": 0.1652960628271103, "learning_rate": 1.9511147913024812e-05, "loss": 0.5359, "mean_token_accuracy": 0.8318702280521393, "num_tokens": 837654661.0, "step": 26246 }, { "entropy": 0.5364550221711397, "epoch": 2.4148567288284712, "grad_norm": 0.1655900478363037, "learning_rate": 1.9508081086883183e-05, "loss": 0.5205, "mean_token_accuracy": 0.8359216004610062, "num_tokens": 837686727.0, "step": 26247 }, { "entropy": 0.46874054009094834, "epoch": 2.4149487351999124, "grad_norm": 0.15939263999462128, "learning_rate": 1.9505014260741558e-05, "loss": 0.4523, "mean_token_accuracy": 0.8539531454443932, "num_tokens": 837718393.0, "step": 26248 }, { "entropy": 0.60346167255193, "epoch": 2.415040741571354, "grad_norm": 0.16616109013557434, "learning_rate": 1.9501947434599936e-05, "loss": 0.5865, "mean_token_accuracy": 0.8175468854606152, "num_tokens": 837750519.0, "step": 26249 }, { "entropy": 0.5907868351787329, "epoch": 2.415132747942795, "grad_norm": 0.1695909947156906, "learning_rate": 1.9498880608458307e-05, "loss": 0.5772, "mean_token_accuracy": 0.8177648894488811, "num_tokens": 837782909.0, "step": 26250 }, { "entropy": 0.5797215385828167, "epoch": 2.415224754314236, "grad_norm": 0.17291800677776337, "learning_rate": 1.9495813782316682e-05, "loss": 0.5764, "mean_token_accuracy": 0.8179140500724316, "num_tokens": 837814751.0, "step": 26251 }, { "entropy": 0.5038789468817413, "epoch": 2.4153167606856774, "grad_norm": 0.15576066076755524, "learning_rate": 1.9492746956175057e-05, "loss": 0.4962, "mean_token_accuracy": 0.8391447253525257, "num_tokens": 837847189.0, "step": 26252 }, { "entropy": 0.5486738737672567, "epoch": 2.4154087670571185, "grad_norm": 0.16350534558296204, "learning_rate": 1.948968013003343e-05, "loss": 0.5286, "mean_token_accuracy": 0.831985104829073, "num_tokens": 837879482.0, "step": 26253 }, { "entropy": 0.5130103859119117, "epoch": 2.41550077342856, "grad_norm": 0.16125698387622833, "learning_rate": 1.9486613303891806e-05, "loss": 0.4964, "mean_token_accuracy": 0.8415835909545422, "num_tokens": 837911869.0, "step": 26254 }, { "entropy": 0.5280800107866526, "epoch": 2.415592779800001, "grad_norm": 0.16021665930747986, "learning_rate": 1.9483546477750177e-05, "loss": 0.5149, "mean_token_accuracy": 0.834221500903368, "num_tokens": 837944212.0, "step": 26255 }, { "entropy": 0.49560053646564484, "epoch": 2.4156847861714423, "grad_norm": 0.16074839234352112, "learning_rate": 1.9480479651608552e-05, "loss": 0.4839, "mean_token_accuracy": 0.8436659686267376, "num_tokens": 837976623.0, "step": 26256 }, { "entropy": 0.5105428099632263, "epoch": 2.4157767925428835, "grad_norm": 0.1597680300474167, "learning_rate": 1.9477412825466926e-05, "loss": 0.5012, "mean_token_accuracy": 0.842586163431406, "num_tokens": 838009155.0, "step": 26257 }, { "entropy": 0.5455433391034603, "epoch": 2.4158687989143246, "grad_norm": 0.1604437679052353, "learning_rate": 1.94743459993253e-05, "loss": 0.5351, "mean_token_accuracy": 0.8323696702718735, "num_tokens": 838041322.0, "step": 26258 }, { "entropy": 0.5649656597524881, "epoch": 2.415960805285766, "grad_norm": 0.17108139395713806, "learning_rate": 1.9471279173183672e-05, "loss": 0.5526, "mean_token_accuracy": 0.8233682923018932, "num_tokens": 838072371.0, "step": 26259 }, { "entropy": 0.5935495449230075, "epoch": 2.4160528116572073, "grad_norm": 0.1693616658449173, "learning_rate": 1.9468212347042047e-05, "loss": 0.5825, "mean_token_accuracy": 0.8144504241645336, "num_tokens": 838104874.0, "step": 26260 }, { "entropy": 0.5206452924758196, "epoch": 2.4161448180286484, "grad_norm": 0.16266000270843506, "learning_rate": 1.946514552090042e-05, "loss": 0.5132, "mean_token_accuracy": 0.8383431136608124, "num_tokens": 838137125.0, "step": 26261 }, { "entropy": 0.5258727641776204, "epoch": 2.4162368244000896, "grad_norm": 0.16262578964233398, "learning_rate": 1.9462078694758796e-05, "loss": 0.5135, "mean_token_accuracy": 0.8365604355931282, "num_tokens": 838169201.0, "step": 26262 }, { "entropy": 0.3992266012355685, "epoch": 2.4163288307715307, "grad_norm": 0.14321324229240417, "learning_rate": 1.9459011868617167e-05, "loss": 0.3823, "mean_token_accuracy": 0.8778442852199078, "num_tokens": 838201056.0, "step": 26263 }, { "entropy": 0.4539053849875927, "epoch": 2.4164208371429723, "grad_norm": 0.1485748440027237, "learning_rate": 1.9455945042475542e-05, "loss": 0.4384, "mean_token_accuracy": 0.8596286587417126, "num_tokens": 838233084.0, "step": 26264 }, { "entropy": 0.48178022948559374, "epoch": 2.4165128435144134, "grad_norm": 0.15234102308750153, "learning_rate": 1.9452878216333917e-05, "loss": 0.4681, "mean_token_accuracy": 0.8518524393439293, "num_tokens": 838265085.0, "step": 26265 }, { "entropy": 0.43587500136345625, "epoch": 2.4166048498858546, "grad_norm": 0.15751948952674866, "learning_rate": 1.944981139019229e-05, "loss": 0.4283, "mean_token_accuracy": 0.8612751476466656, "num_tokens": 838297285.0, "step": 26266 }, { "entropy": 0.4866376486606896, "epoch": 2.4166968562572957, "grad_norm": 0.1580386608839035, "learning_rate": 1.9446744564050666e-05, "loss": 0.4734, "mean_token_accuracy": 0.8514489755034447, "num_tokens": 838329457.0, "step": 26267 }, { "entropy": 0.5845548287034035, "epoch": 2.416788862628737, "grad_norm": 0.16486333310604095, "learning_rate": 1.9443677737909037e-05, "loss": 0.5712, "mean_token_accuracy": 0.8231195397675037, "num_tokens": 838361985.0, "step": 26268 }, { "entropy": 0.6318444134667516, "epoch": 2.4168808690001784, "grad_norm": 0.1778215765953064, "learning_rate": 1.9440610911767412e-05, "loss": 0.6133, "mean_token_accuracy": 0.8071498870849609, "num_tokens": 838392833.0, "step": 26269 }, { "entropy": 0.576216472312808, "epoch": 2.4169728753716195, "grad_norm": 0.16798865795135498, "learning_rate": 1.9437544085625787e-05, "loss": 0.573, "mean_token_accuracy": 0.8225463666021824, "num_tokens": 838423548.0, "step": 26270 }, { "entropy": 0.5432569282129407, "epoch": 2.4170648817430607, "grad_norm": 0.16493427753448486, "learning_rate": 1.943447725948416e-05, "loss": 0.5411, "mean_token_accuracy": 0.8316544778645039, "num_tokens": 838456028.0, "step": 26271 }, { "entropy": 0.5122611143160611, "epoch": 2.417156888114502, "grad_norm": 0.16457322239875793, "learning_rate": 1.9431410433342533e-05, "loss": 0.5117, "mean_token_accuracy": 0.839708000421524, "num_tokens": 838486545.0, "step": 26272 }, { "entropy": 0.5224698625970632, "epoch": 2.417248894485943, "grad_norm": 0.16017672419548035, "learning_rate": 1.9428343607200907e-05, "loss": 0.521, "mean_token_accuracy": 0.8359888158738613, "num_tokens": 838519187.0, "step": 26273 }, { "entropy": 0.4691917123273015, "epoch": 2.4173409008573845, "grad_norm": 0.15059880912303925, "learning_rate": 1.9425276781059282e-05, "loss": 0.46, "mean_token_accuracy": 0.8541224114596844, "num_tokens": 838551275.0, "step": 26274 }, { "entropy": 0.40597254363819957, "epoch": 2.4174329072288256, "grad_norm": 0.14573422074317932, "learning_rate": 1.9422209954917656e-05, "loss": 0.3962, "mean_token_accuracy": 0.8742405325174332, "num_tokens": 838584024.0, "step": 26275 }, { "entropy": 0.4990108795464039, "epoch": 2.417524913600267, "grad_norm": 0.1601148098707199, "learning_rate": 1.941914312877603e-05, "loss": 0.4776, "mean_token_accuracy": 0.8464471437036991, "num_tokens": 838614863.0, "step": 26276 }, { "entropy": 0.5564038935117424, "epoch": 2.417616919971708, "grad_norm": 0.1664597988128662, "learning_rate": 1.9416076302634402e-05, "loss": 0.5511, "mean_token_accuracy": 0.8248379528522491, "num_tokens": 838647146.0, "step": 26277 }, { "entropy": 0.5277552148327231, "epoch": 2.417708926343149, "grad_norm": 0.162570521235466, "learning_rate": 1.9413009476492777e-05, "loss": 0.518, "mean_token_accuracy": 0.8336757607758045, "num_tokens": 838678830.0, "step": 26278 }, { "entropy": 0.46087318286299706, "epoch": 2.4178009327145906, "grad_norm": 0.15471142530441284, "learning_rate": 1.9409942650351155e-05, "loss": 0.4488, "mean_token_accuracy": 0.8599086925387383, "num_tokens": 838711211.0, "step": 26279 }, { "entropy": 0.5195219875313342, "epoch": 2.4178929390860318, "grad_norm": 0.16375814378261566, "learning_rate": 1.9406875824209526e-05, "loss": 0.5115, "mean_token_accuracy": 0.839448805898428, "num_tokens": 838742215.0, "step": 26280 }, { "entropy": 0.4953533988445997, "epoch": 2.417984945457473, "grad_norm": 0.1612648069858551, "learning_rate": 1.94038089980679e-05, "loss": 0.4925, "mean_token_accuracy": 0.8422178849577904, "num_tokens": 838773952.0, "step": 26281 }, { "entropy": 0.48253753781318665, "epoch": 2.418076951828914, "grad_norm": 0.15085934102535248, "learning_rate": 1.9400742171926276e-05, "loss": 0.4694, "mean_token_accuracy": 0.8506710156798363, "num_tokens": 838806371.0, "step": 26282 }, { "entropy": 0.586578294634819, "epoch": 2.418168958200355, "grad_norm": 0.16372935473918915, "learning_rate": 1.939767534578465e-05, "loss": 0.579, "mean_token_accuracy": 0.8224802725017071, "num_tokens": 838838784.0, "step": 26283 }, { "entropy": 0.5037675146013498, "epoch": 2.4182609645717967, "grad_norm": 0.1605452597141266, "learning_rate": 1.9394608519643025e-05, "loss": 0.4895, "mean_token_accuracy": 0.8462951444089413, "num_tokens": 838870483.0, "step": 26284 }, { "entropy": 0.6188630312681198, "epoch": 2.418352970943238, "grad_norm": 0.17192287743091583, "learning_rate": 1.9391541693501396e-05, "loss": 0.6148, "mean_token_accuracy": 0.8068852312862873, "num_tokens": 838902262.0, "step": 26285 }, { "entropy": 0.5354252075776458, "epoch": 2.418444977314679, "grad_norm": 0.16095364093780518, "learning_rate": 1.938847486735977e-05, "loss": 0.5294, "mean_token_accuracy": 0.8334634825587273, "num_tokens": 838934463.0, "step": 26286 }, { "entropy": 0.4959522243589163, "epoch": 2.41853698368612, "grad_norm": 0.15910163521766663, "learning_rate": 1.9385408041218145e-05, "loss": 0.4911, "mean_token_accuracy": 0.8425245471298695, "num_tokens": 838966872.0, "step": 26287 }, { "entropy": 0.4486150350421667, "epoch": 2.4186289900575613, "grad_norm": 0.1495533138513565, "learning_rate": 1.938234121507652e-05, "loss": 0.4306, "mean_token_accuracy": 0.8633880726993084, "num_tokens": 838998199.0, "step": 26288 }, { "entropy": 0.5216753333806992, "epoch": 2.418720996429003, "grad_norm": 0.16135196387767792, "learning_rate": 1.937927438893489e-05, "loss": 0.4961, "mean_token_accuracy": 0.8464280739426613, "num_tokens": 839030086.0, "step": 26289 }, { "entropy": 0.6740218196064234, "epoch": 2.418813002800444, "grad_norm": 0.1789267212152481, "learning_rate": 1.9376207562793266e-05, "loss": 0.6744, "mean_token_accuracy": 0.7941544204950333, "num_tokens": 839062110.0, "step": 26290 }, { "entropy": 0.6040378306061029, "epoch": 2.418905009171885, "grad_norm": 10.45012378692627, "learning_rate": 1.937314073665164e-05, "loss": 1.1112, "mean_token_accuracy": 0.7924032777082175, "num_tokens": 839094132.0, "step": 26291 }, { "entropy": 0.5089667178690434, "epoch": 2.4189970155433262, "grad_norm": 0.16180169582366943, "learning_rate": 1.9370073910510015e-05, "loss": 0.4984, "mean_token_accuracy": 0.8395521901547909, "num_tokens": 839125837.0, "step": 26292 }, { "entropy": 0.5547654805704951, "epoch": 2.4190890219147674, "grad_norm": 0.16854777932167053, "learning_rate": 1.9367007084368387e-05, "loss": 0.5461, "mean_token_accuracy": 0.8266929276287556, "num_tokens": 839156976.0, "step": 26293 }, { "entropy": 0.5767091549932957, "epoch": 2.419181028286209, "grad_norm": 0.17813105881214142, "learning_rate": 1.936394025822676e-05, "loss": 0.5754, "mean_token_accuracy": 0.8186828680336475, "num_tokens": 839187918.0, "step": 26294 }, { "entropy": 0.4951028909999877, "epoch": 2.41927303465765, "grad_norm": 0.16786326467990875, "learning_rate": 1.9360873432085136e-05, "loss": 0.4788, "mean_token_accuracy": 0.8490370661020279, "num_tokens": 839219937.0, "step": 26295 }, { "entropy": 0.5835617445409298, "epoch": 2.4193650410290912, "grad_norm": 0.19421608746051788, "learning_rate": 1.935780660594351e-05, "loss": 0.5577, "mean_token_accuracy": 0.8246928118169308, "num_tokens": 839251023.0, "step": 26296 }, { "entropy": 0.5719884280115366, "epoch": 2.4194570474005324, "grad_norm": 0.19049908220767975, "learning_rate": 1.9354739779801885e-05, "loss": 0.5552, "mean_token_accuracy": 0.8271919265389442, "num_tokens": 839283016.0, "step": 26297 }, { "entropy": 0.5573744382709265, "epoch": 2.4195490537719735, "grad_norm": 0.18793749809265137, "learning_rate": 1.9351672953660256e-05, "loss": 0.5379, "mean_token_accuracy": 0.8311035893857479, "num_tokens": 839314958.0, "step": 26298 }, { "entropy": 0.46159248938784003, "epoch": 2.419641060143415, "grad_norm": 0.17295727133750916, "learning_rate": 1.934860612751863e-05, "loss": 0.4523, "mean_token_accuracy": 0.8545262552797794, "num_tokens": 839347188.0, "step": 26299 }, { "entropy": 0.49550957046449184, "epoch": 2.419733066514856, "grad_norm": 0.16879190504550934, "learning_rate": 1.9345539301377006e-05, "loss": 0.4741, "mean_token_accuracy": 0.8458736091852188, "num_tokens": 839379386.0, "step": 26300 }, { "entropy": 0.5345104052685201, "epoch": 2.4198250728862973, "grad_norm": 0.16282372176647186, "learning_rate": 1.934247247523538e-05, "loss": 0.5115, "mean_token_accuracy": 0.8390679359436035, "num_tokens": 839411314.0, "step": 26301 }, { "entropy": 0.389999620616436, "epoch": 2.4199170792577385, "grad_norm": 0.15068212151527405, "learning_rate": 1.933940564909375e-05, "loss": 0.3794, "mean_token_accuracy": 0.8826135359704494, "num_tokens": 839444075.0, "step": 26302 }, { "entropy": 0.657831272110343, "epoch": 2.4200090856291796, "grad_norm": 0.17597220838069916, "learning_rate": 1.9336338822952126e-05, "loss": 0.6447, "mean_token_accuracy": 0.7984032034873962, "num_tokens": 839475342.0, "step": 26303 }, { "entropy": 0.4946559313684702, "epoch": 2.420101092000621, "grad_norm": 0.15183591842651367, "learning_rate": 1.93332719968105e-05, "loss": 0.4797, "mean_token_accuracy": 0.8491266593337059, "num_tokens": 839508071.0, "step": 26304 }, { "entropy": 0.48641214426606894, "epoch": 2.4201930983720623, "grad_norm": 0.15804404020309448, "learning_rate": 1.9330205170668876e-05, "loss": 0.4648, "mean_token_accuracy": 0.8554648794233799, "num_tokens": 839539078.0, "step": 26305 }, { "entropy": 0.5438044406473637, "epoch": 2.4202851047435034, "grad_norm": 0.17167679965496063, "learning_rate": 1.932713834452725e-05, "loss": 0.5238, "mean_token_accuracy": 0.8335687108337879, "num_tokens": 839569912.0, "step": 26306 }, { "entropy": 0.5968007082119584, "epoch": 2.4203771111149446, "grad_norm": 0.16878047585487366, "learning_rate": 1.932407151838562e-05, "loss": 0.5913, "mean_token_accuracy": 0.813680037856102, "num_tokens": 839600794.0, "step": 26307 }, { "entropy": 0.4875752925872803, "epoch": 2.4204691174863857, "grad_norm": 0.16011981666088104, "learning_rate": 1.9321004692243996e-05, "loss": 0.4796, "mean_token_accuracy": 0.8438336290419102, "num_tokens": 839632160.0, "step": 26308 }, { "entropy": 0.5507159680128098, "epoch": 2.4205611238578273, "grad_norm": 0.16587483882904053, "learning_rate": 1.931793786610237e-05, "loss": 0.5447, "mean_token_accuracy": 0.827044915407896, "num_tokens": 839664427.0, "step": 26309 }, { "entropy": 0.43580812541767955, "epoch": 2.4206531302292684, "grad_norm": 0.1451251357793808, "learning_rate": 1.9314871039960745e-05, "loss": 0.4295, "mean_token_accuracy": 0.8655190914869308, "num_tokens": 839696999.0, "step": 26310 }, { "entropy": 0.43587171379476786, "epoch": 2.4207451366007096, "grad_norm": 0.1448565572500229, "learning_rate": 1.931180421381912e-05, "loss": 0.4202, "mean_token_accuracy": 0.8658527433872223, "num_tokens": 839728788.0, "step": 26311 }, { "entropy": 0.5595165975391865, "epoch": 2.4208371429721507, "grad_norm": 0.16860570013523102, "learning_rate": 1.9308737387677495e-05, "loss": 0.5465, "mean_token_accuracy": 0.823134396225214, "num_tokens": 839759095.0, "step": 26312 }, { "entropy": 0.4763611676171422, "epoch": 2.420929149343592, "grad_norm": 0.15162308514118195, "learning_rate": 1.930567056153587e-05, "loss": 0.4693, "mean_token_accuracy": 0.8516562767326832, "num_tokens": 839791664.0, "step": 26313 }, { "entropy": 0.5556436481419951, "epoch": 2.4210211557150334, "grad_norm": 0.16727206110954285, "learning_rate": 1.9302603735394244e-05, "loss": 0.5455, "mean_token_accuracy": 0.829166367650032, "num_tokens": 839823729.0, "step": 26314 }, { "entropy": 0.5841872552409768, "epoch": 2.4211131620864745, "grad_norm": 0.16811227798461914, "learning_rate": 1.9299536909252615e-05, "loss": 0.5696, "mean_token_accuracy": 0.8195250518620014, "num_tokens": 839855675.0, "step": 26315 }, { "entropy": 0.5547017231583595, "epoch": 2.4212051684579157, "grad_norm": 0.16645769774913788, "learning_rate": 1.929647008311099e-05, "loss": 0.5501, "mean_token_accuracy": 0.824868880212307, "num_tokens": 839887335.0, "step": 26316 }, { "entropy": 0.4835600731894374, "epoch": 2.421297174829357, "grad_norm": 0.1551358699798584, "learning_rate": 1.9293403256969365e-05, "loss": 0.4711, "mean_token_accuracy": 0.8484980836510658, "num_tokens": 839919588.0, "step": 26317 }, { "entropy": 0.5331715727224946, "epoch": 2.421389181200798, "grad_norm": 0.16595174372196198, "learning_rate": 1.929033643082774e-05, "loss": 0.5188, "mean_token_accuracy": 0.8327179662883282, "num_tokens": 839951310.0, "step": 26318 }, { "entropy": 0.5180539861321449, "epoch": 2.4214811875722395, "grad_norm": 0.1615906059741974, "learning_rate": 1.928726960468611e-05, "loss": 0.5061, "mean_token_accuracy": 0.8400950580835342, "num_tokens": 839983330.0, "step": 26319 }, { "entropy": 0.5798068698495626, "epoch": 2.4215731939436806, "grad_norm": 0.16968697309494019, "learning_rate": 1.9284202778544485e-05, "loss": 0.5672, "mean_token_accuracy": 0.8202954865992069, "num_tokens": 840015404.0, "step": 26320 }, { "entropy": 0.5356476390734315, "epoch": 2.421665200315122, "grad_norm": 0.16196531057357788, "learning_rate": 1.928113595240286e-05, "loss": 0.5167, "mean_token_accuracy": 0.8376455083489418, "num_tokens": 840046976.0, "step": 26321 }, { "entropy": 0.4743208307772875, "epoch": 2.421757206686563, "grad_norm": 0.15581205487251282, "learning_rate": 1.9278069126261234e-05, "loss": 0.462, "mean_token_accuracy": 0.8588723428547382, "num_tokens": 840078882.0, "step": 26322 }, { "entropy": 0.4132991652004421, "epoch": 2.421849213058004, "grad_norm": 0.14434105157852173, "learning_rate": 1.9275002300119606e-05, "loss": 0.4097, "mean_token_accuracy": 0.8691697120666504, "num_tokens": 840111318.0, "step": 26323 }, { "entropy": 0.5746529959142208, "epoch": 2.4219412194294456, "grad_norm": 0.16632752120494843, "learning_rate": 1.927193547397798e-05, "loss": 0.5607, "mean_token_accuracy": 0.8223824575543404, "num_tokens": 840143659.0, "step": 26324 }, { "entropy": 0.5318578006699681, "epoch": 2.4220332258008868, "grad_norm": 0.15949025750160217, "learning_rate": 1.9268868647836355e-05, "loss": 0.5065, "mean_token_accuracy": 0.8406442366540432, "num_tokens": 840175192.0, "step": 26325 }, { "entropy": 0.56197215244174, "epoch": 2.422125232172328, "grad_norm": 0.1632312685251236, "learning_rate": 1.926580182169473e-05, "loss": 0.5483, "mean_token_accuracy": 0.8245162777602673, "num_tokens": 840206686.0, "step": 26326 }, { "entropy": 0.4964063595980406, "epoch": 2.422217238543769, "grad_norm": 0.15511052310466766, "learning_rate": 1.9262734995553104e-05, "loss": 0.4848, "mean_token_accuracy": 0.8461114354431629, "num_tokens": 840238557.0, "step": 26327 }, { "entropy": 0.5429633241146803, "epoch": 2.42230924491521, "grad_norm": 0.16501085460186005, "learning_rate": 1.9259668169411476e-05, "loss": 0.5262, "mean_token_accuracy": 0.8321288786828518, "num_tokens": 840270545.0, "step": 26328 }, { "entropy": 0.6148453839123249, "epoch": 2.4224012512866517, "grad_norm": 0.17230193316936493, "learning_rate": 1.925660134326985e-05, "loss": 0.61, "mean_token_accuracy": 0.8078610450029373, "num_tokens": 840302013.0, "step": 26329 }, { "entropy": 0.4358662061858922, "epoch": 2.422493257658093, "grad_norm": 0.14612968266010284, "learning_rate": 1.9253534517128225e-05, "loss": 0.4301, "mean_token_accuracy": 0.8629809059202671, "num_tokens": 840334473.0, "step": 26330 }, { "entropy": 0.5274232737720013, "epoch": 2.422585264029534, "grad_norm": 0.15932336449623108, "learning_rate": 1.92504676909866e-05, "loss": 0.5119, "mean_token_accuracy": 0.8373482748866081, "num_tokens": 840366697.0, "step": 26331 }, { "entropy": 0.4525425508618355, "epoch": 2.422677270400975, "grad_norm": 0.1557856798171997, "learning_rate": 1.924740086484497e-05, "loss": 0.4474, "mean_token_accuracy": 0.8532012067735195, "num_tokens": 840397935.0, "step": 26332 }, { "entropy": 0.4880889384075999, "epoch": 2.4227692767724163, "grad_norm": 0.157795712351799, "learning_rate": 1.9244334038703345e-05, "loss": 0.4766, "mean_token_accuracy": 0.8479533717036247, "num_tokens": 840429663.0, "step": 26333 }, { "entropy": 0.5967187080532312, "epoch": 2.422861283143858, "grad_norm": 0.17415113747119904, "learning_rate": 1.924126721256172e-05, "loss": 0.5823, "mean_token_accuracy": 0.8167623430490494, "num_tokens": 840461460.0, "step": 26334 }, { "entropy": 0.5609104856848717, "epoch": 2.422953289515299, "grad_norm": 0.16638244688510895, "learning_rate": 1.9238200386420095e-05, "loss": 0.5503, "mean_token_accuracy": 0.8219676241278648, "num_tokens": 840493465.0, "step": 26335 }, { "entropy": 0.5286913220770657, "epoch": 2.42304529588674, "grad_norm": 0.16410218179225922, "learning_rate": 1.923513356027847e-05, "loss": 0.5172, "mean_token_accuracy": 0.8338008970022202, "num_tokens": 840524789.0, "step": 26336 }, { "entropy": 0.5106750782579184, "epoch": 2.4231373022581812, "grad_norm": 0.16160902380943298, "learning_rate": 1.923206673413684e-05, "loss": 0.5097, "mean_token_accuracy": 0.8403234221041203, "num_tokens": 840556961.0, "step": 26337 }, { "entropy": 0.5146306026726961, "epoch": 2.4232293086296224, "grad_norm": 0.15796782076358795, "learning_rate": 1.9228999907995215e-05, "loss": 0.5073, "mean_token_accuracy": 0.8385555222630501, "num_tokens": 840589378.0, "step": 26338 }, { "entropy": 0.4060762315057218, "epoch": 2.423321315001064, "grad_norm": 0.14326047897338867, "learning_rate": 1.922593308185359e-05, "loss": 0.3844, "mean_token_accuracy": 0.8773957192897797, "num_tokens": 840621300.0, "step": 26339 }, { "entropy": 0.5279860757291317, "epoch": 2.423413321372505, "grad_norm": 0.16410650312900543, "learning_rate": 1.9222866255711965e-05, "loss": 0.5177, "mean_token_accuracy": 0.8360258676111698, "num_tokens": 840653274.0, "step": 26340 }, { "entropy": 0.40760072926059365, "epoch": 2.4235053277439462, "grad_norm": 0.14673586189746857, "learning_rate": 1.921979942957034e-05, "loss": 0.3914, "mean_token_accuracy": 0.8723608441650867, "num_tokens": 840685424.0, "step": 26341 }, { "entropy": 0.421301880851388, "epoch": 2.4235973341153874, "grad_norm": 0.14882725477218628, "learning_rate": 1.9216732603428714e-05, "loss": 0.4168, "mean_token_accuracy": 0.8660787008702755, "num_tokens": 840717849.0, "step": 26342 }, { "entropy": 0.5670976042747498, "epoch": 2.4236893404868285, "grad_norm": 0.16972021758556366, "learning_rate": 1.921366577728709e-05, "loss": 0.5579, "mean_token_accuracy": 0.8225084878504276, "num_tokens": 840749757.0, "step": 26343 }, { "entropy": 0.4893368138000369, "epoch": 2.42378134685827, "grad_norm": 0.1591264307498932, "learning_rate": 1.9210598951145463e-05, "loss": 0.4803, "mean_token_accuracy": 0.8493402190506458, "num_tokens": 840781934.0, "step": 26344 }, { "entropy": 0.575337715446949, "epoch": 2.423873353229711, "grad_norm": 0.16453485190868378, "learning_rate": 1.9207532125003834e-05, "loss": 0.5691, "mean_token_accuracy": 0.823400691151619, "num_tokens": 840814017.0, "step": 26345 }, { "entropy": 0.5361615028232336, "epoch": 2.4239653596011523, "grad_norm": 0.16516035795211792, "learning_rate": 1.920446529886221e-05, "loss": 0.5264, "mean_token_accuracy": 0.8344879001379013, "num_tokens": 840846076.0, "step": 26346 }, { "entropy": 0.5026085898280144, "epoch": 2.4240573659725935, "grad_norm": 0.15369142591953278, "learning_rate": 1.9201398472720584e-05, "loss": 0.4916, "mean_token_accuracy": 0.8439575806260109, "num_tokens": 840878714.0, "step": 26347 }, { "entropy": 0.473145738709718, "epoch": 2.4241493723440346, "grad_norm": 0.15297989547252655, "learning_rate": 1.919833164657896e-05, "loss": 0.4547, "mean_token_accuracy": 0.8570959568023682, "num_tokens": 840910555.0, "step": 26348 }, { "entropy": 0.6095546903088689, "epoch": 2.424241378715476, "grad_norm": 0.1695767343044281, "learning_rate": 1.919526482043733e-05, "loss": 0.6042, "mean_token_accuracy": 0.8085300885140896, "num_tokens": 840942336.0, "step": 26349 }, { "entropy": 0.5817014295607805, "epoch": 2.4243333850869173, "grad_norm": 0.17307670414447784, "learning_rate": 1.9192197994295704e-05, "loss": 0.5729, "mean_token_accuracy": 0.8197600431740284, "num_tokens": 840972476.0, "step": 26350 }, { "entropy": 0.5080250641331077, "epoch": 2.4244253914583584, "grad_norm": 0.15726302564144135, "learning_rate": 1.918913116815408e-05, "loss": 0.4975, "mean_token_accuracy": 0.8448506034910679, "num_tokens": 841004988.0, "step": 26351 }, { "entropy": 0.4861973123624921, "epoch": 2.4245173978297996, "grad_norm": 0.15373507142066956, "learning_rate": 1.9186064342012454e-05, "loss": 0.4689, "mean_token_accuracy": 0.8505481071770191, "num_tokens": 841036401.0, "step": 26352 }, { "entropy": 0.5454591382294893, "epoch": 2.4246094042012407, "grad_norm": 0.1616116613149643, "learning_rate": 1.9182997515870825e-05, "loss": 0.5274, "mean_token_accuracy": 0.8312272652983665, "num_tokens": 841068069.0, "step": 26353 }, { "entropy": 0.5528915505856276, "epoch": 2.4247014105726823, "grad_norm": 0.16695833206176758, "learning_rate": 1.91799306897292e-05, "loss": 0.5378, "mean_token_accuracy": 0.8290524370968342, "num_tokens": 841100571.0, "step": 26354 }, { "entropy": 0.48408691957592964, "epoch": 2.4247934169441234, "grad_norm": 0.15844298899173737, "learning_rate": 1.9176863863587574e-05, "loss": 0.4697, "mean_token_accuracy": 0.8455912508070469, "num_tokens": 841131254.0, "step": 26355 }, { "entropy": 0.4846726432442665, "epoch": 2.4248854233155646, "grad_norm": 0.15361535549163818, "learning_rate": 1.917379703744595e-05, "loss": 0.4803, "mean_token_accuracy": 0.8491148576140404, "num_tokens": 841163547.0, "step": 26356 }, { "entropy": 0.5472778268158436, "epoch": 2.4249774296870057, "grad_norm": 0.16259868443012238, "learning_rate": 1.9170730211304323e-05, "loss": 0.5332, "mean_token_accuracy": 0.8293956778943539, "num_tokens": 841195453.0, "step": 26357 }, { "entropy": 0.5021707371342927, "epoch": 2.425069436058447, "grad_norm": 0.1496133804321289, "learning_rate": 1.9167663385162695e-05, "loss": 0.4871, "mean_token_accuracy": 0.8482457548379898, "num_tokens": 841227768.0, "step": 26358 }, { "entropy": 0.4832816356793046, "epoch": 2.4251614424298884, "grad_norm": 0.15204863250255585, "learning_rate": 1.916459655902107e-05, "loss": 0.4659, "mean_token_accuracy": 0.8531017974019051, "num_tokens": 841260333.0, "step": 26359 }, { "entropy": 0.4839537162333727, "epoch": 2.4252534488013295, "grad_norm": 0.146095871925354, "learning_rate": 1.9161529732879444e-05, "loss": 0.4643, "mean_token_accuracy": 0.8549401499330997, "num_tokens": 841293101.0, "step": 26360 }, { "entropy": 0.6112568713724613, "epoch": 2.4253454551727707, "grad_norm": 0.17255249619483948, "learning_rate": 1.915846290673782e-05, "loss": 0.603, "mean_token_accuracy": 0.8122915364801884, "num_tokens": 841325573.0, "step": 26361 }, { "entropy": 0.5215438511222601, "epoch": 2.425437461544212, "grad_norm": 0.1624741554260254, "learning_rate": 1.915539608059619e-05, "loss": 0.5104, "mean_token_accuracy": 0.8418176285922527, "num_tokens": 841357317.0, "step": 26362 }, { "entropy": 0.41702471766620874, "epoch": 2.425529467915653, "grad_norm": 0.14958316087722778, "learning_rate": 1.9152329254454564e-05, "loss": 0.4041, "mean_token_accuracy": 0.8690393008291721, "num_tokens": 841389430.0, "step": 26363 }, { "entropy": 0.4647013349458575, "epoch": 2.4256214742870945, "grad_norm": 0.1514224112033844, "learning_rate": 1.914926242831294e-05, "loss": 0.44, "mean_token_accuracy": 0.8574097454547882, "num_tokens": 841421116.0, "step": 26364 }, { "entropy": 0.4363692350452766, "epoch": 2.4257134806585356, "grad_norm": 0.15051701664924622, "learning_rate": 1.9146195602171314e-05, "loss": 0.4236, "mean_token_accuracy": 0.8645518682897091, "num_tokens": 841452917.0, "step": 26365 }, { "entropy": 0.5218030971009284, "epoch": 2.425805487029977, "grad_norm": 0.1602536141872406, "learning_rate": 1.914312877602969e-05, "loss": 0.5087, "mean_token_accuracy": 0.8407766073942184, "num_tokens": 841485071.0, "step": 26366 }, { "entropy": 0.524603858590126, "epoch": 2.425897493401418, "grad_norm": 0.16175797581672668, "learning_rate": 1.914006194988806e-05, "loss": 0.5133, "mean_token_accuracy": 0.8360143005847931, "num_tokens": 841516269.0, "step": 26367 }, { "entropy": 0.6892434675246477, "epoch": 2.425989499772859, "grad_norm": 0.17600466310977936, "learning_rate": 1.9136995123746434e-05, "loss": 0.6733, "mean_token_accuracy": 0.789639126509428, "num_tokens": 841547730.0, "step": 26368 }, { "entropy": 0.5450124656781554, "epoch": 2.4260815061443006, "grad_norm": 0.16644905507564545, "learning_rate": 1.913392829760481e-05, "loss": 0.5438, "mean_token_accuracy": 0.8332631997764111, "num_tokens": 841578909.0, "step": 26369 }, { "entropy": 0.5328117804601789, "epoch": 2.4261735125157418, "grad_norm": 0.15999124944210052, "learning_rate": 1.9130861471463184e-05, "loss": 0.5102, "mean_token_accuracy": 0.836312785744667, "num_tokens": 841610536.0, "step": 26370 }, { "entropy": 0.561974854208529, "epoch": 2.426265518887183, "grad_norm": 0.1708362102508545, "learning_rate": 1.9127794645321558e-05, "loss": 0.5495, "mean_token_accuracy": 0.8253428116440773, "num_tokens": 841641767.0, "step": 26371 }, { "entropy": 0.5242815129458904, "epoch": 2.426357525258624, "grad_norm": 0.16083751618862152, "learning_rate": 1.9124727819179933e-05, "loss": 0.5157, "mean_token_accuracy": 0.8369554951786995, "num_tokens": 841674198.0, "step": 26372 }, { "entropy": 0.47312218917068094, "epoch": 2.426449531630065, "grad_norm": 0.1545485258102417, "learning_rate": 1.9121660993038308e-05, "loss": 0.4659, "mean_token_accuracy": 0.8522380851209164, "num_tokens": 841705908.0, "step": 26373 }, { "entropy": 0.5107283480465412, "epoch": 2.4265415380015067, "grad_norm": 0.15571485459804535, "learning_rate": 1.9118594166896682e-05, "loss": 0.4953, "mean_token_accuracy": 0.8428943939507008, "num_tokens": 841737928.0, "step": 26374 }, { "entropy": 0.5068120462819934, "epoch": 2.426633544372948, "grad_norm": 0.16164450347423553, "learning_rate": 1.9115527340755053e-05, "loss": 0.5094, "mean_token_accuracy": 0.8390782438218594, "num_tokens": 841769925.0, "step": 26375 }, { "entropy": 0.556636082008481, "epoch": 2.426725550744389, "grad_norm": 0.16601517796516418, "learning_rate": 1.9112460514613428e-05, "loss": 0.5446, "mean_token_accuracy": 0.8268909119069576, "num_tokens": 841802116.0, "step": 26376 }, { "entropy": 0.5831893775612116, "epoch": 2.42681755711583, "grad_norm": 0.16955973207950592, "learning_rate": 1.9109393688471803e-05, "loss": 0.5759, "mean_token_accuracy": 0.821335643529892, "num_tokens": 841833925.0, "step": 26377 }, { "entropy": 0.6095866337418556, "epoch": 2.4269095634872713, "grad_norm": 0.17298276722431183, "learning_rate": 1.9106326862330177e-05, "loss": 0.5893, "mean_token_accuracy": 0.8152382262051105, "num_tokens": 841864904.0, "step": 26378 }, { "entropy": 0.43289319332689047, "epoch": 2.427001569858713, "grad_norm": 0.14972637593746185, "learning_rate": 1.910326003618855e-05, "loss": 0.4131, "mean_token_accuracy": 0.8667226918041706, "num_tokens": 841896659.0, "step": 26379 }, { "entropy": 0.6117396298795938, "epoch": 2.427093576230154, "grad_norm": 0.17140159010887146, "learning_rate": 1.9100193210046923e-05, "loss": 0.6036, "mean_token_accuracy": 0.8164207227528095, "num_tokens": 841928970.0, "step": 26380 }, { "entropy": 0.5028997287154198, "epoch": 2.427185582601595, "grad_norm": 0.15785446763038635, "learning_rate": 1.9097126383905298e-05, "loss": 0.4928, "mean_token_accuracy": 0.8475314378738403, "num_tokens": 841961067.0, "step": 26381 }, { "entropy": 0.4985145041719079, "epoch": 2.4272775889730362, "grad_norm": 0.15591523051261902, "learning_rate": 1.9094059557763673e-05, "loss": 0.4778, "mean_token_accuracy": 0.8486734516918659, "num_tokens": 841993508.0, "step": 26382 }, { "entropy": 0.42063776310533285, "epoch": 2.4273695953444774, "grad_norm": 0.1461179256439209, "learning_rate": 1.9090992731622044e-05, "loss": 0.4028, "mean_token_accuracy": 0.8686473071575165, "num_tokens": 842025756.0, "step": 26383 }, { "entropy": 0.5267479866743088, "epoch": 2.427461601715919, "grad_norm": 0.15950500965118408, "learning_rate": 1.908792590548042e-05, "loss": 0.5164, "mean_token_accuracy": 0.8344012312591076, "num_tokens": 842057188.0, "step": 26384 }, { "entropy": 0.5571404322981834, "epoch": 2.42755360808736, "grad_norm": 0.16616354882717133, "learning_rate": 1.9084859079338793e-05, "loss": 0.5437, "mean_token_accuracy": 0.826896671205759, "num_tokens": 842088934.0, "step": 26385 }, { "entropy": 0.5691304467618465, "epoch": 2.4276456144588012, "grad_norm": 0.16632886230945587, "learning_rate": 1.9081792253197168e-05, "loss": 0.5508, "mean_token_accuracy": 0.8259717747569084, "num_tokens": 842120243.0, "step": 26386 }, { "entropy": 0.508428543806076, "epoch": 2.4277376208302424, "grad_norm": 0.16031059622764587, "learning_rate": 1.9078725427055542e-05, "loss": 0.4942, "mean_token_accuracy": 0.8438622392714024, "num_tokens": 842151851.0, "step": 26387 }, { "entropy": 0.5717435176484287, "epoch": 2.4278296272016835, "grad_norm": 0.16833116114139557, "learning_rate": 1.9075658600913914e-05, "loss": 0.551, "mean_token_accuracy": 0.8261377476155758, "num_tokens": 842183111.0, "step": 26388 }, { "entropy": 0.5365288658067584, "epoch": 2.427921633573125, "grad_norm": 0.16139355301856995, "learning_rate": 1.907259177477229e-05, "loss": 0.5268, "mean_token_accuracy": 0.833586785942316, "num_tokens": 842215528.0, "step": 26389 }, { "entropy": 0.6250439547002316, "epoch": 2.428013639944566, "grad_norm": 0.16856400668621063, "learning_rate": 1.9069524948630663e-05, "loss": 0.6045, "mean_token_accuracy": 0.8095130696892738, "num_tokens": 842247638.0, "step": 26390 }, { "entropy": 0.4381772964261472, "epoch": 2.4281056463160073, "grad_norm": 0.14924092590808868, "learning_rate": 1.9066458122489038e-05, "loss": 0.4273, "mean_token_accuracy": 0.8644360639154911, "num_tokens": 842279644.0, "step": 26391 }, { "entropy": 0.49508773209527135, "epoch": 2.4281976526874485, "grad_norm": 0.15561601519584656, "learning_rate": 1.906339129634741e-05, "loss": 0.4767, "mean_token_accuracy": 0.8456987403333187, "num_tokens": 842311808.0, "step": 26392 }, { "entropy": 0.4532238414976746, "epoch": 2.4282896590588896, "grad_norm": 0.1533341258764267, "learning_rate": 1.9060324470205784e-05, "loss": 0.4377, "mean_token_accuracy": 0.8597273267805576, "num_tokens": 842343885.0, "step": 26393 }, { "entropy": 0.5414810217916965, "epoch": 2.428381665430331, "grad_norm": 0.15368421375751495, "learning_rate": 1.9057257644064158e-05, "loss": 0.5216, "mean_token_accuracy": 0.8376041576266289, "num_tokens": 842376181.0, "step": 26394 }, { "entropy": 0.506747517734766, "epoch": 2.4284736718017723, "grad_norm": 0.15920305252075195, "learning_rate": 1.9054190817922533e-05, "loss": 0.4966, "mean_token_accuracy": 0.8436495773494244, "num_tokens": 842408705.0, "step": 26395 }, { "entropy": 0.47378688491880894, "epoch": 2.4285656781732134, "grad_norm": 0.1599651426076889, "learning_rate": 1.9051123991780908e-05, "loss": 0.4643, "mean_token_accuracy": 0.8542438261210918, "num_tokens": 842440158.0, "step": 26396 }, { "entropy": 0.49952477449551225, "epoch": 2.4286576845446546, "grad_norm": 0.15906760096549988, "learning_rate": 1.904805716563928e-05, "loss": 0.4856, "mean_token_accuracy": 0.846155509352684, "num_tokens": 842471549.0, "step": 26397 }, { "entropy": 0.4464201182126999, "epoch": 2.4287496909160957, "grad_norm": 0.15717452764511108, "learning_rate": 1.9044990339497653e-05, "loss": 0.446, "mean_token_accuracy": 0.856938436627388, "num_tokens": 842503292.0, "step": 26398 }, { "entropy": 0.5538794696331024, "epoch": 2.4288416972875373, "grad_norm": 0.1660597175359726, "learning_rate": 1.9041923513356028e-05, "loss": 0.5466, "mean_token_accuracy": 0.829655222594738, "num_tokens": 842535945.0, "step": 26399 }, { "entropy": 0.5141926323994994, "epoch": 2.4289337036589784, "grad_norm": 0.15657979249954224, "learning_rate": 1.9038856687214403e-05, "loss": 0.5046, "mean_token_accuracy": 0.84077313169837, "num_tokens": 842568696.0, "step": 26400 }, { "entropy": 0.5303751819301397, "epoch": 2.4290257100304196, "grad_norm": 0.1648673266172409, "learning_rate": 1.9035789861072777e-05, "loss": 0.5204, "mean_token_accuracy": 0.8345928974449635, "num_tokens": 842600231.0, "step": 26401 }, { "entropy": 0.5350354071706533, "epoch": 2.4291177164018607, "grad_norm": 0.16497959196567535, "learning_rate": 1.9032723034931152e-05, "loss": 0.5281, "mean_token_accuracy": 0.8318389356136322, "num_tokens": 842632328.0, "step": 26402 }, { "entropy": 0.37780476873740554, "epoch": 2.429209722773302, "grad_norm": 0.14543357491493225, "learning_rate": 1.9029656208789527e-05, "loss": 0.3698, "mean_token_accuracy": 0.8807399049401283, "num_tokens": 842664647.0, "step": 26403 }, { "entropy": 0.5304428953677416, "epoch": 2.4293017291447434, "grad_norm": 0.15875627100467682, "learning_rate": 1.90265893826479e-05, "loss": 0.5274, "mean_token_accuracy": 0.8308022655546665, "num_tokens": 842696642.0, "step": 26404 }, { "entropy": 0.5234688948839903, "epoch": 2.4293937355161845, "grad_norm": 0.16220252215862274, "learning_rate": 1.9023522556506273e-05, "loss": 0.509, "mean_token_accuracy": 0.8381756283342838, "num_tokens": 842728904.0, "step": 26405 }, { "entropy": 0.549917901866138, "epoch": 2.4294857418876257, "grad_norm": 0.16036202013492584, "learning_rate": 1.9020455730364647e-05, "loss": 0.54, "mean_token_accuracy": 0.8286069892346859, "num_tokens": 842761447.0, "step": 26406 }, { "entropy": 0.596154348924756, "epoch": 2.429577748259067, "grad_norm": 0.1686651110649109, "learning_rate": 1.9017388904223022e-05, "loss": 0.5909, "mean_token_accuracy": 0.8129147887229919, "num_tokens": 842794114.0, "step": 26407 }, { "entropy": 0.5150248715654016, "epoch": 2.429669754630508, "grad_norm": 0.16301317512989044, "learning_rate": 1.9014322078081397e-05, "loss": 0.5073, "mean_token_accuracy": 0.8377518616616726, "num_tokens": 842825700.0, "step": 26408 }, { "entropy": 0.5705765541642904, "epoch": 2.4297617610019495, "grad_norm": 0.1686079055070877, "learning_rate": 1.9011255251939768e-05, "loss": 0.5602, "mean_token_accuracy": 0.8229309618473053, "num_tokens": 842857627.0, "step": 26409 }, { "entropy": 0.5022929066326469, "epoch": 2.4298537673733906, "grad_norm": 0.15603461861610413, "learning_rate": 1.9008188425798142e-05, "loss": 0.4898, "mean_token_accuracy": 0.8436843231320381, "num_tokens": 842889402.0, "step": 26410 }, { "entropy": 0.573685297742486, "epoch": 2.429945773744832, "grad_norm": 0.16710203886032104, "learning_rate": 1.9005121599656517e-05, "loss": 0.5694, "mean_token_accuracy": 0.819542795419693, "num_tokens": 842921560.0, "step": 26411 }, { "entropy": 0.5560936955735087, "epoch": 2.430037780116273, "grad_norm": 0.16854842007160187, "learning_rate": 1.9002054773514892e-05, "loss": 0.5463, "mean_token_accuracy": 0.8338998705148697, "num_tokens": 842953572.0, "step": 26412 }, { "entropy": 0.554400846362114, "epoch": 2.430129786487714, "grad_norm": 0.16289512813091278, "learning_rate": 1.8998987947373263e-05, "loss": 0.5372, "mean_token_accuracy": 0.8312795460224152, "num_tokens": 842985480.0, "step": 26413 }, { "entropy": 0.5135478805750608, "epoch": 2.4302217928591556, "grad_norm": 0.15819278359413147, "learning_rate": 1.8995921121231638e-05, "loss": 0.4947, "mean_token_accuracy": 0.8432147204875946, "num_tokens": 843016900.0, "step": 26414 }, { "entropy": 0.4479727717116475, "epoch": 2.4303137992305968, "grad_norm": 0.15225189924240112, "learning_rate": 1.8992854295090012e-05, "loss": 0.43, "mean_token_accuracy": 0.8657206669449806, "num_tokens": 843049277.0, "step": 26415 }, { "entropy": 0.5782917588949203, "epoch": 2.430405805602038, "grad_norm": 0.17283381521701813, "learning_rate": 1.8989787468948387e-05, "loss": 0.5685, "mean_token_accuracy": 0.8221362084150314, "num_tokens": 843080418.0, "step": 26416 }, { "entropy": 0.5114531894214451, "epoch": 2.430497811973479, "grad_norm": 0.15788137912750244, "learning_rate": 1.898672064280676e-05, "loss": 0.4993, "mean_token_accuracy": 0.8424296900629997, "num_tokens": 843112912.0, "step": 26417 }, { "entropy": 0.3926129201427102, "epoch": 2.43058981834492, "grad_norm": 0.14834360778331757, "learning_rate": 1.8983653816665133e-05, "loss": 0.3794, "mean_token_accuracy": 0.878724966198206, "num_tokens": 843145680.0, "step": 26418 }, { "entropy": 0.5368717974051833, "epoch": 2.4306818247163617, "grad_norm": 0.16566133499145508, "learning_rate": 1.8980586990523507e-05, "loss": 0.5285, "mean_token_accuracy": 0.8354651071131229, "num_tokens": 843177865.0, "step": 26419 }, { "entropy": 0.5447157649323344, "epoch": 2.430773831087803, "grad_norm": 0.1624753624200821, "learning_rate": 1.8977520164381882e-05, "loss": 0.524, "mean_token_accuracy": 0.8318611867725849, "num_tokens": 843209261.0, "step": 26420 }, { "entropy": 0.567595798522234, "epoch": 2.430865837459244, "grad_norm": 0.16578657925128937, "learning_rate": 1.8974453338240257e-05, "loss": 0.5605, "mean_token_accuracy": 0.8258330188691616, "num_tokens": 843241422.0, "step": 26421 }, { "entropy": 0.5479961773380637, "epoch": 2.430957843830685, "grad_norm": 0.16514690220355988, "learning_rate": 1.8971386512098628e-05, "loss": 0.537, "mean_token_accuracy": 0.8337521106004715, "num_tokens": 843273714.0, "step": 26422 }, { "entropy": 0.5945105161517859, "epoch": 2.4310498502021263, "grad_norm": 0.17239640653133392, "learning_rate": 1.8968319685957003e-05, "loss": 0.5919, "mean_token_accuracy": 0.818091943860054, "num_tokens": 843304820.0, "step": 26423 }, { "entropy": 0.5287240501493216, "epoch": 2.431141856573568, "grad_norm": 0.1622384637594223, "learning_rate": 1.8965252859815377e-05, "loss": 0.519, "mean_token_accuracy": 0.8352304548025131, "num_tokens": 843336577.0, "step": 26424 }, { "entropy": 0.5531487744301558, "epoch": 2.431233862945009, "grad_norm": 0.16076220571994781, "learning_rate": 1.8962186033673752e-05, "loss": 0.5401, "mean_token_accuracy": 0.8312461711466312, "num_tokens": 843368569.0, "step": 26425 }, { "entropy": 0.545215705409646, "epoch": 2.43132586931645, "grad_norm": 0.16423870623111725, "learning_rate": 1.8959119207532127e-05, "loss": 0.5378, "mean_token_accuracy": 0.8273362629115582, "num_tokens": 843400492.0, "step": 26426 }, { "entropy": 0.4097695597447455, "epoch": 2.4314178756878913, "grad_norm": 0.14655855298042297, "learning_rate": 1.8956052381390498e-05, "loss": 0.3943, "mean_token_accuracy": 0.8706651665270329, "num_tokens": 843432500.0, "step": 26427 }, { "entropy": 0.5229513943195343, "epoch": 2.4315098820593324, "grad_norm": 0.15998803079128265, "learning_rate": 1.8952985555248873e-05, "loss": 0.522, "mean_token_accuracy": 0.8374555706977844, "num_tokens": 843464937.0, "step": 26428 }, { "entropy": 0.46127200801856816, "epoch": 2.431601888430774, "grad_norm": 0.15474075078964233, "learning_rate": 1.8949918729107247e-05, "loss": 0.447, "mean_token_accuracy": 0.857968408614397, "num_tokens": 843496608.0, "step": 26429 }, { "entropy": 0.4721459543798119, "epoch": 2.431693894802215, "grad_norm": 0.1557067185640335, "learning_rate": 1.8946851902965622e-05, "loss": 0.4655, "mean_token_accuracy": 0.8511115200817585, "num_tokens": 843528867.0, "step": 26430 }, { "entropy": 0.5286300405859947, "epoch": 2.4317859011736562, "grad_norm": 0.15563124418258667, "learning_rate": 1.8943785076823993e-05, "loss": 0.5145, "mean_token_accuracy": 0.8385481052100658, "num_tokens": 843560786.0, "step": 26431 }, { "entropy": 0.5302146538160741, "epoch": 2.4318779075450974, "grad_norm": 0.16369450092315674, "learning_rate": 1.894071825068237e-05, "loss": 0.5182, "mean_token_accuracy": 0.8400898650288582, "num_tokens": 843592044.0, "step": 26432 }, { "entropy": 0.4862352660857141, "epoch": 2.4319699139165385, "grad_norm": 0.15705712139606476, "learning_rate": 1.8937651424540746e-05, "loss": 0.4741, "mean_token_accuracy": 0.8494297973811626, "num_tokens": 843623524.0, "step": 26433 }, { "entropy": 0.5613699499517679, "epoch": 2.43206192028798, "grad_norm": 0.1665760725736618, "learning_rate": 1.893458459839912e-05, "loss": 0.5433, "mean_token_accuracy": 0.8258237689733505, "num_tokens": 843655545.0, "step": 26434 }, { "entropy": 0.42755202297121286, "epoch": 2.432153926659421, "grad_norm": 0.1533334106206894, "learning_rate": 1.893151777225749e-05, "loss": 0.4226, "mean_token_accuracy": 0.8642271682620049, "num_tokens": 843687486.0, "step": 26435 }, { "entropy": 0.5508307926356792, "epoch": 2.4322459330308623, "grad_norm": 0.16363604366779327, "learning_rate": 1.8928450946115866e-05, "loss": 0.5385, "mean_token_accuracy": 0.8295532837510109, "num_tokens": 843719251.0, "step": 26436 }, { "entropy": 0.5750130980741233, "epoch": 2.4323379394023035, "grad_norm": 0.16031308472156525, "learning_rate": 1.892538411997424e-05, "loss": 0.5592, "mean_token_accuracy": 0.8231790438294411, "num_tokens": 843751394.0, "step": 26437 }, { "entropy": 0.4593544630333781, "epoch": 2.4324299457737446, "grad_norm": 0.15498818457126617, "learning_rate": 1.8922317293832616e-05, "loss": 0.4532, "mean_token_accuracy": 0.8535800576210022, "num_tokens": 843783580.0, "step": 26438 }, { "entropy": 0.5168400052934885, "epoch": 2.432521952145186, "grad_norm": 0.16212111711502075, "learning_rate": 1.8919250467690987e-05, "loss": 0.5017, "mean_token_accuracy": 0.8405255749821663, "num_tokens": 843815015.0, "step": 26439 }, { "entropy": 0.5107456017285585, "epoch": 2.4326139585166273, "grad_norm": 0.16426922380924225, "learning_rate": 1.891618364154936e-05, "loss": 0.4968, "mean_token_accuracy": 0.8407432772219181, "num_tokens": 843845044.0, "step": 26440 }, { "entropy": 0.4860374005511403, "epoch": 2.4327059648880685, "grad_norm": 0.15542003512382507, "learning_rate": 1.8913116815407736e-05, "loss": 0.4699, "mean_token_accuracy": 0.8473839834332466, "num_tokens": 843877127.0, "step": 26441 }, { "entropy": 0.48779444582760334, "epoch": 2.4327979712595096, "grad_norm": 0.16310851275920868, "learning_rate": 1.891004998926611e-05, "loss": 0.4774, "mean_token_accuracy": 0.8500749878585339, "num_tokens": 843908707.0, "step": 26442 }, { "entropy": 0.4257013383321464, "epoch": 2.4328899776309507, "grad_norm": 0.1475527137517929, "learning_rate": 1.8906983163124482e-05, "loss": 0.4153, "mean_token_accuracy": 0.8676545917987823, "num_tokens": 843940406.0, "step": 26443 }, { "entropy": 0.6361409611999989, "epoch": 2.4329819840023923, "grad_norm": 0.1715574562549591, "learning_rate": 1.8903916336982857e-05, "loss": 0.6249, "mean_token_accuracy": 0.8055192977190018, "num_tokens": 843972539.0, "step": 26444 }, { "entropy": 0.5862561732064933, "epoch": 2.4330739903738334, "grad_norm": 0.1692807376384735, "learning_rate": 1.890084951084123e-05, "loss": 0.5685, "mean_token_accuracy": 0.8204825483262539, "num_tokens": 844004705.0, "step": 26445 }, { "entropy": 0.5151276690885425, "epoch": 2.4331659967452746, "grad_norm": 0.15311890840530396, "learning_rate": 1.8897782684699606e-05, "loss": 0.5025, "mean_token_accuracy": 0.8371082954108715, "num_tokens": 844036916.0, "step": 26446 }, { "entropy": 0.46743960375897586, "epoch": 2.4332580031167157, "grad_norm": 0.15214215219020844, "learning_rate": 1.889471585855798e-05, "loss": 0.4544, "mean_token_accuracy": 0.85458604991436, "num_tokens": 844069523.0, "step": 26447 }, { "entropy": 0.6020403634756804, "epoch": 2.433350009488157, "grad_norm": 0.1714521050453186, "learning_rate": 1.8891649032416352e-05, "loss": 0.5899, "mean_token_accuracy": 0.8170080929994583, "num_tokens": 844100879.0, "step": 26448 }, { "entropy": 0.5461707198992372, "epoch": 2.4334420158595984, "grad_norm": 0.16169370710849762, "learning_rate": 1.8888582206274727e-05, "loss": 0.5293, "mean_token_accuracy": 0.8302256613969803, "num_tokens": 844132471.0, "step": 26449 }, { "entropy": 0.4733623117208481, "epoch": 2.4335340222310395, "grad_norm": 0.15563073754310608, "learning_rate": 1.88855153801331e-05, "loss": 0.4628, "mean_token_accuracy": 0.8500926643610001, "num_tokens": 844164596.0, "step": 26450 }, { "entropy": 0.6047813650220633, "epoch": 2.4336260286024807, "grad_norm": 0.1689334660768509, "learning_rate": 1.8882448553991476e-05, "loss": 0.5995, "mean_token_accuracy": 0.8123579025268555, "num_tokens": 844196471.0, "step": 26451 }, { "entropy": 0.5000590747222304, "epoch": 2.433718034973922, "grad_norm": 0.15501920878887177, "learning_rate": 1.8879381727849847e-05, "loss": 0.485, "mean_token_accuracy": 0.8449008204042912, "num_tokens": 844228403.0, "step": 26452 }, { "entropy": 0.4718670751899481, "epoch": 2.433810041345363, "grad_norm": 0.1533588171005249, "learning_rate": 1.8876314901708222e-05, "loss": 0.4634, "mean_token_accuracy": 0.8522845543920994, "num_tokens": 844260509.0, "step": 26453 }, { "entropy": 0.4753407584503293, "epoch": 2.4339020477168045, "grad_norm": 0.16576911509037018, "learning_rate": 1.8873248075566596e-05, "loss": 0.4732, "mean_token_accuracy": 0.852683812379837, "num_tokens": 844291882.0, "step": 26454 }, { "entropy": 0.5143645610660315, "epoch": 2.4339940540882457, "grad_norm": 0.1663440316915512, "learning_rate": 1.887018124942497e-05, "loss": 0.5134, "mean_token_accuracy": 0.8357102982699871, "num_tokens": 844323145.0, "step": 26455 }, { "entropy": 0.5303510185331106, "epoch": 2.434086060459687, "grad_norm": 0.1562710702419281, "learning_rate": 1.8867114423283346e-05, "loss": 0.5157, "mean_token_accuracy": 0.8377726599574089, "num_tokens": 844355860.0, "step": 26456 }, { "entropy": 0.4617764725117013, "epoch": 2.434178066831128, "grad_norm": 0.14857591688632965, "learning_rate": 1.8864047597141717e-05, "loss": 0.4384, "mean_token_accuracy": 0.859980009496212, "num_tokens": 844387609.0, "step": 26457 }, { "entropy": 0.638699708506465, "epoch": 2.434270073202569, "grad_norm": 0.1664532870054245, "learning_rate": 1.886098077100009e-05, "loss": 0.6198, "mean_token_accuracy": 0.8027259930968285, "num_tokens": 844419949.0, "step": 26458 }, { "entropy": 0.6290216073393822, "epoch": 2.4343620795740106, "grad_norm": 0.17070871591567993, "learning_rate": 1.8857913944858466e-05, "loss": 0.6161, "mean_token_accuracy": 0.8056963346898556, "num_tokens": 844451625.0, "step": 26459 }, { "entropy": 0.5285453386604786, "epoch": 2.4344540859454518, "grad_norm": 0.1584034413099289, "learning_rate": 1.885484711871684e-05, "loss": 0.5028, "mean_token_accuracy": 0.8389306478202343, "num_tokens": 844484142.0, "step": 26460 }, { "entropy": 0.5351865887641907, "epoch": 2.434546092316893, "grad_norm": 0.15800069272518158, "learning_rate": 1.8851780292575212e-05, "loss": 0.5145, "mean_token_accuracy": 0.838535126298666, "num_tokens": 844515944.0, "step": 26461 }, { "entropy": 0.4629022506996989, "epoch": 2.434638098688334, "grad_norm": 0.1551232784986496, "learning_rate": 1.884871346643359e-05, "loss": 0.4432, "mean_token_accuracy": 0.8574996516108513, "num_tokens": 844548348.0, "step": 26462 }, { "entropy": 0.4913308206014335, "epoch": 2.434730105059775, "grad_norm": 0.15265750885009766, "learning_rate": 1.8845646640291965e-05, "loss": 0.4768, "mean_token_accuracy": 0.8479638397693634, "num_tokens": 844580275.0, "step": 26463 }, { "entropy": 0.5030977018177509, "epoch": 2.4348221114312167, "grad_norm": 0.15846049785614014, "learning_rate": 1.884257981415034e-05, "loss": 0.5006, "mean_token_accuracy": 0.842519111931324, "num_tokens": 844612561.0, "step": 26464 }, { "entropy": 0.4636552897281945, "epoch": 2.434914117802658, "grad_norm": 0.155861034989357, "learning_rate": 1.883951298800871e-05, "loss": 0.454, "mean_token_accuracy": 0.8542433604598045, "num_tokens": 844644480.0, "step": 26465 }, { "entropy": 0.47915175650268793, "epoch": 2.435006124174099, "grad_norm": 0.15424738824367523, "learning_rate": 1.8836446161867085e-05, "loss": 0.4689, "mean_token_accuracy": 0.850907240062952, "num_tokens": 844676434.0, "step": 26466 }, { "entropy": 0.5463482774794102, "epoch": 2.43509813054554, "grad_norm": 0.16593477129936218, "learning_rate": 1.883337933572546e-05, "loss": 0.5311, "mean_token_accuracy": 0.8315225541591644, "num_tokens": 844708413.0, "step": 26467 }, { "entropy": 0.4098454536870122, "epoch": 2.4351901369169813, "grad_norm": 0.1455949991941452, "learning_rate": 1.8830312509583835e-05, "loss": 0.4067, "mean_token_accuracy": 0.8714805319905281, "num_tokens": 844740773.0, "step": 26468 }, { "entropy": 0.5783689767122269, "epoch": 2.435282143288423, "grad_norm": 0.17196060717105865, "learning_rate": 1.8827245683442206e-05, "loss": 0.575, "mean_token_accuracy": 0.8173173815011978, "num_tokens": 844772315.0, "step": 26469 }, { "entropy": 0.6020664116367698, "epoch": 2.435374149659864, "grad_norm": 0.1746930032968521, "learning_rate": 1.882417885730058e-05, "loss": 0.5813, "mean_token_accuracy": 0.8197579421103001, "num_tokens": 844804389.0, "step": 26470 }, { "entropy": 0.5247920528054237, "epoch": 2.435466156031305, "grad_norm": 0.16272498667240143, "learning_rate": 1.8821112031158955e-05, "loss": 0.5131, "mean_token_accuracy": 0.8363627940416336, "num_tokens": 844836012.0, "step": 26471 }, { "entropy": 0.4948287596926093, "epoch": 2.4355581624027463, "grad_norm": 0.15564745664596558, "learning_rate": 1.881804520501733e-05, "loss": 0.4917, "mean_token_accuracy": 0.8448917642235756, "num_tokens": 844868610.0, "step": 26472 }, { "entropy": 0.5656816326081753, "epoch": 2.4356501687741874, "grad_norm": 0.16754937171936035, "learning_rate": 1.88149783788757e-05, "loss": 0.5508, "mean_token_accuracy": 0.8234576359391212, "num_tokens": 844900323.0, "step": 26473 }, { "entropy": 0.49773271195590496, "epoch": 2.435742175145629, "grad_norm": 0.16508732736110687, "learning_rate": 1.8811911552734076e-05, "loss": 0.4802, "mean_token_accuracy": 0.8476957455277443, "num_tokens": 844932137.0, "step": 26474 }, { "entropy": 0.5422661025077105, "epoch": 2.43583418151707, "grad_norm": 0.1658744364976883, "learning_rate": 1.880884472659245e-05, "loss": 0.5326, "mean_token_accuracy": 0.8339910767972469, "num_tokens": 844964196.0, "step": 26475 }, { "entropy": 0.5437895683571696, "epoch": 2.4359261878885112, "grad_norm": 0.1624656319618225, "learning_rate": 1.8805777900450825e-05, "loss": 0.5239, "mean_token_accuracy": 0.8326182700693607, "num_tokens": 844995715.0, "step": 26476 }, { "entropy": 0.5690386928617954, "epoch": 2.4360181942599524, "grad_norm": 0.17032332718372345, "learning_rate": 1.88027110743092e-05, "loss": 0.5524, "mean_token_accuracy": 0.8262107968330383, "num_tokens": 845026792.0, "step": 26477 }, { "entropy": 0.5519465850666165, "epoch": 2.4361102006313935, "grad_norm": 0.16518859565258026, "learning_rate": 1.879964424816757e-05, "loss": 0.5455, "mean_token_accuracy": 0.8290327861905098, "num_tokens": 845059210.0, "step": 26478 }, { "entropy": 0.47338774241507053, "epoch": 2.436202207002835, "grad_norm": 0.15412692725658417, "learning_rate": 1.8796577422025946e-05, "loss": 0.462, "mean_token_accuracy": 0.8546199277043343, "num_tokens": 845091817.0, "step": 26479 }, { "entropy": 0.524635139037855, "epoch": 2.436294213374276, "grad_norm": 0.16146455705165863, "learning_rate": 1.879351059588432e-05, "loss": 0.5134, "mean_token_accuracy": 0.8363635316491127, "num_tokens": 845124190.0, "step": 26480 }, { "entropy": 0.5402294341474771, "epoch": 2.4363862197457173, "grad_norm": 0.16220276057720184, "learning_rate": 1.8790443769742695e-05, "loss": 0.5239, "mean_token_accuracy": 0.8318869210779667, "num_tokens": 845156057.0, "step": 26481 }, { "entropy": 0.5197883658111095, "epoch": 2.4364782261171585, "grad_norm": 0.1596360206604004, "learning_rate": 1.8787376943601066e-05, "loss": 0.5034, "mean_token_accuracy": 0.8405693657696247, "num_tokens": 845187318.0, "step": 26482 }, { "entropy": 0.5468781930394471, "epoch": 2.4365702324885996, "grad_norm": 0.1661984920501709, "learning_rate": 1.878431011745944e-05, "loss": 0.5421, "mean_token_accuracy": 0.8321387581527233, "num_tokens": 845218358.0, "step": 26483 }, { "entropy": 0.5472626704722643, "epoch": 2.436662238860041, "grad_norm": 0.16631589829921722, "learning_rate": 1.8781243291317816e-05, "loss": 0.5302, "mean_token_accuracy": 0.8267102800309658, "num_tokens": 845249973.0, "step": 26484 }, { "entropy": 0.5261906404048204, "epoch": 2.4367542452314823, "grad_norm": 0.16010895371437073, "learning_rate": 1.877817646517619e-05, "loss": 0.5212, "mean_token_accuracy": 0.8382529765367508, "num_tokens": 845281753.0, "step": 26485 }, { "entropy": 0.48264792934060097, "epoch": 2.4368462516029235, "grad_norm": 0.1557435393333435, "learning_rate": 1.8775109639034565e-05, "loss": 0.4601, "mean_token_accuracy": 0.8497750423848629, "num_tokens": 845313378.0, "step": 26486 }, { "entropy": 0.488568427041173, "epoch": 2.4369382579743646, "grad_norm": 0.1631707400083542, "learning_rate": 1.8772042812892936e-05, "loss": 0.4691, "mean_token_accuracy": 0.8506179004907608, "num_tokens": 845344827.0, "step": 26487 }, { "entropy": 0.5453840913251042, "epoch": 2.4370302643458057, "grad_norm": 0.1584467589855194, "learning_rate": 1.876897598675131e-05, "loss": 0.5399, "mean_token_accuracy": 0.8334460519254208, "num_tokens": 845377360.0, "step": 26488 }, { "entropy": 0.4876393638551235, "epoch": 2.4371222707172473, "grad_norm": 0.16365781426429749, "learning_rate": 1.8765909160609685e-05, "loss": 0.4829, "mean_token_accuracy": 0.8473892137408257, "num_tokens": 845409360.0, "step": 26489 }, { "entropy": 0.5414368342608213, "epoch": 2.4372142770886884, "grad_norm": 0.16447220742702484, "learning_rate": 1.876284233446806e-05, "loss": 0.5337, "mean_token_accuracy": 0.8305318132042885, "num_tokens": 845441147.0, "step": 26490 }, { "entropy": 0.5782316578552127, "epoch": 2.4373062834601296, "grad_norm": 0.16601069271564484, "learning_rate": 1.875977550832643e-05, "loss": 0.5739, "mean_token_accuracy": 0.8213752619922161, "num_tokens": 845473026.0, "step": 26491 }, { "entropy": 0.49231055565178394, "epoch": 2.4373982898315707, "grad_norm": 0.15700644254684448, "learning_rate": 1.8756708682184806e-05, "loss": 0.4785, "mean_token_accuracy": 0.849011555314064, "num_tokens": 845504530.0, "step": 26492 }, { "entropy": 0.4998061787337065, "epoch": 2.437490296203012, "grad_norm": 0.15807406604290009, "learning_rate": 1.8753641856043184e-05, "loss": 0.4989, "mean_token_accuracy": 0.8426844142377377, "num_tokens": 845537041.0, "step": 26493 }, { "entropy": 0.6192526295781136, "epoch": 2.4375823025744534, "grad_norm": 0.18288707733154297, "learning_rate": 1.875057502990156e-05, "loss": 0.6122, "mean_token_accuracy": 0.8030492588877678, "num_tokens": 845567567.0, "step": 26494 }, { "entropy": 0.47695410531014204, "epoch": 2.4376743089458945, "grad_norm": 0.15891367197036743, "learning_rate": 1.874750820375993e-05, "loss": 0.4666, "mean_token_accuracy": 0.8482069484889507, "num_tokens": 845598994.0, "step": 26495 }, { "entropy": 0.5384460296481848, "epoch": 2.4377663153173357, "grad_norm": 0.16200774908065796, "learning_rate": 1.8744441377618305e-05, "loss": 0.5179, "mean_token_accuracy": 0.8359892033040524, "num_tokens": 845631091.0, "step": 26496 }, { "entropy": 0.49195805145427585, "epoch": 2.437858321688777, "grad_norm": 0.15244647860527039, "learning_rate": 1.874137455147668e-05, "loss": 0.4766, "mean_token_accuracy": 0.8495751358568668, "num_tokens": 845662752.0, "step": 26497 }, { "entropy": 0.5205183275975287, "epoch": 2.437950328060218, "grad_norm": 0.1555410921573639, "learning_rate": 1.8738307725335054e-05, "loss": 0.5085, "mean_token_accuracy": 0.8398414701223373, "num_tokens": 845694743.0, "step": 26498 }, { "entropy": 0.511821857187897, "epoch": 2.4380423344316595, "grad_norm": 0.15946052968502045, "learning_rate": 1.8735240899193425e-05, "loss": 0.5009, "mean_token_accuracy": 0.8396888561546803, "num_tokens": 845726338.0, "step": 26499 }, { "entropy": 0.41497904784046113, "epoch": 2.4381343408031007, "grad_norm": 0.14245451986789703, "learning_rate": 1.87321740730518e-05, "loss": 0.3902, "mean_token_accuracy": 0.8756228312849998, "num_tokens": 845758377.0, "step": 26500 }, { "entropy": 0.5169788710772991, "epoch": 2.438226347174542, "grad_norm": 0.16340816020965576, "learning_rate": 1.8729107246910174e-05, "loss": 0.5086, "mean_token_accuracy": 0.8389957398176193, "num_tokens": 845790255.0, "step": 26501 }, { "entropy": 0.5493694730103016, "epoch": 2.438318353545983, "grad_norm": 0.16670432686805725, "learning_rate": 1.872604042076855e-05, "loss": 0.5238, "mean_token_accuracy": 0.832218274474144, "num_tokens": 845822147.0, "step": 26502 }, { "entropy": 0.4774694324005395, "epoch": 2.438410359917424, "grad_norm": 0.1491498202085495, "learning_rate": 1.872297359462692e-05, "loss": 0.4666, "mean_token_accuracy": 0.8514072336256504, "num_tokens": 845854307.0, "step": 26503 }, { "entropy": 0.5310746151953936, "epoch": 2.4385023662888656, "grad_norm": 0.16522721946239471, "learning_rate": 1.8719906768485295e-05, "loss": 0.5201, "mean_token_accuracy": 0.8338141441345215, "num_tokens": 845885552.0, "step": 26504 }, { "entropy": 0.5195554653182626, "epoch": 2.4385943726603068, "grad_norm": 0.1566237211227417, "learning_rate": 1.871683994234367e-05, "loss": 0.5087, "mean_token_accuracy": 0.8346198089420795, "num_tokens": 845917831.0, "step": 26505 }, { "entropy": 0.5313415955752134, "epoch": 2.438686379031748, "grad_norm": 0.1642470359802246, "learning_rate": 1.8713773116202044e-05, "loss": 0.5202, "mean_token_accuracy": 0.8337301909923553, "num_tokens": 845949089.0, "step": 26506 }, { "entropy": 0.49356034910306334, "epoch": 2.438778385403189, "grad_norm": 0.16136328876018524, "learning_rate": 1.871070629006042e-05, "loss": 0.4874, "mean_token_accuracy": 0.8455701768398285, "num_tokens": 845981400.0, "step": 26507 }, { "entropy": 0.5154252250213176, "epoch": 2.43887039177463, "grad_norm": 0.15491247177124023, "learning_rate": 1.870763946391879e-05, "loss": 0.4954, "mean_token_accuracy": 0.8396467231214046, "num_tokens": 846012928.0, "step": 26508 }, { "entropy": 0.5044732703827322, "epoch": 2.4389623981460717, "grad_norm": 0.1599520444869995, "learning_rate": 1.8704572637777165e-05, "loss": 0.4928, "mean_token_accuracy": 0.8442720361053944, "num_tokens": 846044880.0, "step": 26509 }, { "entropy": 0.4822880318388343, "epoch": 2.439054404517513, "grad_norm": 0.15488900244235992, "learning_rate": 1.870150581163554e-05, "loss": 0.4635, "mean_token_accuracy": 0.8504889123141766, "num_tokens": 846076670.0, "step": 26510 }, { "entropy": 0.540128780528903, "epoch": 2.439146410888954, "grad_norm": 0.16053970158100128, "learning_rate": 1.8698438985493914e-05, "loss": 0.545, "mean_token_accuracy": 0.8284750655293465, "num_tokens": 846108836.0, "step": 26511 }, { "entropy": 0.5499727576971054, "epoch": 2.439238417260395, "grad_norm": 0.16191799938678741, "learning_rate": 1.8695372159352285e-05, "loss": 0.5414, "mean_token_accuracy": 0.8284496963024139, "num_tokens": 846141349.0, "step": 26512 }, { "entropy": 0.6557327751070261, "epoch": 2.4393304236318363, "grad_norm": 0.17283737659454346, "learning_rate": 1.869230533321066e-05, "loss": 0.6344, "mean_token_accuracy": 0.8007085993885994, "num_tokens": 846173331.0, "step": 26513 }, { "entropy": 0.5511623192578554, "epoch": 2.439422430003278, "grad_norm": 0.1614423543214798, "learning_rate": 1.8689238507069035e-05, "loss": 0.5373, "mean_token_accuracy": 0.8338131196796894, "num_tokens": 846205753.0, "step": 26514 }, { "entropy": 0.5472668316215277, "epoch": 2.439514436374719, "grad_norm": 0.16540482640266418, "learning_rate": 1.868617168092741e-05, "loss": 0.53, "mean_token_accuracy": 0.82961181178689, "num_tokens": 846238089.0, "step": 26515 }, { "entropy": 0.5349667863920331, "epoch": 2.43960644274616, "grad_norm": 0.16307352483272552, "learning_rate": 1.8683104854785784e-05, "loss": 0.5204, "mean_token_accuracy": 0.8363047614693642, "num_tokens": 846270644.0, "step": 26516 }, { "entropy": 0.5070954160764813, "epoch": 2.4396984491176013, "grad_norm": 0.15420368313789368, "learning_rate": 1.8680038028644155e-05, "loss": 0.5001, "mean_token_accuracy": 0.8454757779836655, "num_tokens": 846302804.0, "step": 26517 }, { "entropy": 0.4562827639747411, "epoch": 2.4397904554890424, "grad_norm": 0.1511267125606537, "learning_rate": 1.867697120250253e-05, "loss": 0.4467, "mean_token_accuracy": 0.8579824827611446, "num_tokens": 846334333.0, "step": 26518 }, { "entropy": 0.44073343463242054, "epoch": 2.439882461860484, "grad_norm": 0.1525479257106781, "learning_rate": 1.8673904376360904e-05, "loss": 0.4385, "mean_token_accuracy": 0.8606233932077885, "num_tokens": 846366695.0, "step": 26519 }, { "entropy": 0.39282661490142345, "epoch": 2.439974468231925, "grad_norm": 0.14507198333740234, "learning_rate": 1.867083755021928e-05, "loss": 0.3863, "mean_token_accuracy": 0.8741831444203854, "num_tokens": 846398550.0, "step": 26520 }, { "entropy": 0.38844721973873675, "epoch": 2.4400664746033662, "grad_norm": 0.1407991498708725, "learning_rate": 1.866777072407765e-05, "loss": 0.3758, "mean_token_accuracy": 0.8799747042357922, "num_tokens": 846430552.0, "step": 26521 }, { "entropy": 0.5819631181657314, "epoch": 2.4401584809748074, "grad_norm": 0.16496753692626953, "learning_rate": 1.8664703897936025e-05, "loss": 0.5632, "mean_token_accuracy": 0.8219483718276024, "num_tokens": 846461523.0, "step": 26522 }, { "entropy": 0.43176891142502427, "epoch": 2.4402504873462485, "grad_norm": 0.14567537605762482, "learning_rate": 1.8661637071794403e-05, "loss": 0.4173, "mean_token_accuracy": 0.8682219386100769, "num_tokens": 846493722.0, "step": 26523 }, { "entropy": 0.4924029354006052, "epoch": 2.44034249371769, "grad_norm": 0.15720777213573456, "learning_rate": 1.8658570245652778e-05, "loss": 0.468, "mean_token_accuracy": 0.8488271608948708, "num_tokens": 846524664.0, "step": 26524 }, { "entropy": 0.4213243881240487, "epoch": 2.440434500089131, "grad_norm": 0.1468995213508606, "learning_rate": 1.865550341951115e-05, "loss": 0.4135, "mean_token_accuracy": 0.8669003024697304, "num_tokens": 846557017.0, "step": 26525 }, { "entropy": 0.5388267934322357, "epoch": 2.4405265064605723, "grad_norm": 0.17223197221755981, "learning_rate": 1.8652436593369524e-05, "loss": 0.5381, "mean_token_accuracy": 0.8316255211830139, "num_tokens": 846587986.0, "step": 26526 }, { "entropy": 0.4349020039662719, "epoch": 2.4406185128320135, "grad_norm": 0.14473088085651398, "learning_rate": 1.8649369767227898e-05, "loss": 0.4115, "mean_token_accuracy": 0.8665308393537998, "num_tokens": 846619896.0, "step": 26527 }, { "entropy": 0.45154910162091255, "epoch": 2.4407105192034546, "grad_norm": 0.1572769433259964, "learning_rate": 1.8646302941086273e-05, "loss": 0.4411, "mean_token_accuracy": 0.8557233437895775, "num_tokens": 846650581.0, "step": 26528 }, { "entropy": 0.4533130875788629, "epoch": 2.440802525574896, "grad_norm": 0.15467266738414764, "learning_rate": 1.8643236114944644e-05, "loss": 0.435, "mean_token_accuracy": 0.8618859462440014, "num_tokens": 846682294.0, "step": 26529 }, { "entropy": 0.4429628795478493, "epoch": 2.4408945319463373, "grad_norm": 0.15145574510097504, "learning_rate": 1.864016928880302e-05, "loss": 0.4337, "mean_token_accuracy": 0.8602314181625843, "num_tokens": 846714089.0, "step": 26530 }, { "entropy": 0.6347021656110883, "epoch": 2.4409865383177785, "grad_norm": 0.16981753706932068, "learning_rate": 1.8637102462661393e-05, "loss": 0.6202, "mean_token_accuracy": 0.8065297938883305, "num_tokens": 846746030.0, "step": 26531 }, { "entropy": 0.42200299235992134, "epoch": 2.4410785446892196, "grad_norm": 0.14808374643325806, "learning_rate": 1.8634035636519768e-05, "loss": 0.4156, "mean_token_accuracy": 0.8659582883119583, "num_tokens": 846778451.0, "step": 26532 }, { "entropy": 0.5413486175239086, "epoch": 2.4411705510606607, "grad_norm": 0.16413143277168274, "learning_rate": 1.863096881037814e-05, "loss": 0.5257, "mean_token_accuracy": 0.8328112326562405, "num_tokens": 846810739.0, "step": 26533 }, { "entropy": 0.5335094649344683, "epoch": 2.4412625574321023, "grad_norm": 0.1587821990251541, "learning_rate": 1.8627901984236514e-05, "loss": 0.5131, "mean_token_accuracy": 0.8365808017551899, "num_tokens": 846843413.0, "step": 26534 }, { "entropy": 0.5175756961107254, "epoch": 2.4413545638035434, "grad_norm": 0.1583515703678131, "learning_rate": 1.862483515809489e-05, "loss": 0.5076, "mean_token_accuracy": 0.8406030647456646, "num_tokens": 846874984.0, "step": 26535 }, { "entropy": 0.5304574258625507, "epoch": 2.4414465701749846, "grad_norm": 0.16338886320590973, "learning_rate": 1.8621768331953263e-05, "loss": 0.5144, "mean_token_accuracy": 0.8395533300936222, "num_tokens": 846906689.0, "step": 26536 }, { "entropy": 0.5373472105711699, "epoch": 2.4415385765464257, "grad_norm": 0.16789962351322174, "learning_rate": 1.8618701505811638e-05, "loss": 0.5328, "mean_token_accuracy": 0.8308085612952709, "num_tokens": 846938289.0, "step": 26537 }, { "entropy": 0.6227989178150892, "epoch": 2.441630582917867, "grad_norm": 0.1679866760969162, "learning_rate": 1.861563467967001e-05, "loss": 0.6055, "mean_token_accuracy": 0.8090629801154137, "num_tokens": 846970349.0, "step": 26538 }, { "entropy": 0.5029485132545233, "epoch": 2.4417225892893084, "grad_norm": 0.16299989819526672, "learning_rate": 1.8612567853528384e-05, "loss": 0.482, "mean_token_accuracy": 0.8489068225026131, "num_tokens": 847001935.0, "step": 26539 }, { "entropy": 0.5236786124296486, "epoch": 2.4418145956607495, "grad_norm": 0.15963660180568695, "learning_rate": 1.860950102738676e-05, "loss": 0.5097, "mean_token_accuracy": 0.8383860103785992, "num_tokens": 847034275.0, "step": 26540 }, { "entropy": 0.5901141837239265, "epoch": 2.4419066020321907, "grad_norm": 0.16785979270935059, "learning_rate": 1.8606434201245133e-05, "loss": 0.571, "mean_token_accuracy": 0.8217617459595203, "num_tokens": 847065849.0, "step": 26541 }, { "entropy": 0.4914428163319826, "epoch": 2.441998608403632, "grad_norm": 0.1599930077791214, "learning_rate": 1.8603367375103504e-05, "loss": 0.4878, "mean_token_accuracy": 0.8465044014155865, "num_tokens": 847098077.0, "step": 26542 }, { "entropy": 0.4647759674116969, "epoch": 2.442090614775073, "grad_norm": 0.1463533341884613, "learning_rate": 1.860030054896188e-05, "loss": 0.4587, "mean_token_accuracy": 0.8540050536394119, "num_tokens": 847130002.0, "step": 26543 }, { "entropy": 0.5541572635993361, "epoch": 2.4421826211465145, "grad_norm": 0.1613193154335022, "learning_rate": 1.8597233722820254e-05, "loss": 0.5469, "mean_token_accuracy": 0.8318381644785404, "num_tokens": 847162461.0, "step": 26544 }, { "entropy": 0.49421111587435007, "epoch": 2.4422746275179557, "grad_norm": 0.15455909073352814, "learning_rate": 1.859416689667863e-05, "loss": 0.4826, "mean_token_accuracy": 0.8452801629900932, "num_tokens": 847194668.0, "step": 26545 }, { "entropy": 0.5922011351212859, "epoch": 2.442366633889397, "grad_norm": 0.17172591388225555, "learning_rate": 1.8591100070537003e-05, "loss": 0.5867, "mean_token_accuracy": 0.8158132284879684, "num_tokens": 847225709.0, "step": 26546 }, { "entropy": 0.5173297170549631, "epoch": 2.442458640260838, "grad_norm": 0.15712973475456238, "learning_rate": 1.8588033244395374e-05, "loss": 0.5084, "mean_token_accuracy": 0.8414908200502396, "num_tokens": 847258037.0, "step": 26547 }, { "entropy": 0.5343514382839203, "epoch": 2.442550646632279, "grad_norm": 0.15706805884838104, "learning_rate": 1.858496641825375e-05, "loss": 0.5189, "mean_token_accuracy": 0.8373443819582462, "num_tokens": 847290452.0, "step": 26548 }, { "entropy": 0.5377911385148764, "epoch": 2.4426426530037206, "grad_norm": 0.16441108286380768, "learning_rate": 1.8581899592112124e-05, "loss": 0.5239, "mean_token_accuracy": 0.8327508606016636, "num_tokens": 847321619.0, "step": 26549 }, { "entropy": 0.41248698672279716, "epoch": 2.4427346593751618, "grad_norm": 0.1459769308567047, "learning_rate": 1.8578832765970498e-05, "loss": 0.4012, "mean_token_accuracy": 0.8700261153280735, "num_tokens": 847353788.0, "step": 26550 }, { "entropy": 0.5519882179796696, "epoch": 2.442826665746603, "grad_norm": 0.16373786330223083, "learning_rate": 1.857576593982887e-05, "loss": 0.5371, "mean_token_accuracy": 0.8310258500277996, "num_tokens": 847385859.0, "step": 26551 }, { "entropy": 0.5501159597188234, "epoch": 2.442918672118044, "grad_norm": 0.1640264093875885, "learning_rate": 1.8572699113687244e-05, "loss": 0.5373, "mean_token_accuracy": 0.8310233131051064, "num_tokens": 847418088.0, "step": 26552 }, { "entropy": 0.5150203483644873, "epoch": 2.443010678489485, "grad_norm": 0.15921460092067719, "learning_rate": 1.856963228754562e-05, "loss": 0.5156, "mean_token_accuracy": 0.8378450945019722, "num_tokens": 847450147.0, "step": 26553 }, { "entropy": 0.5041139628738165, "epoch": 2.4431026848609267, "grad_norm": 0.15283288061618805, "learning_rate": 1.8566565461403997e-05, "loss": 0.4829, "mean_token_accuracy": 0.8467734977602959, "num_tokens": 847482018.0, "step": 26554 }, { "entropy": 0.4531585378572345, "epoch": 2.443194691232368, "grad_norm": 0.1494520604610443, "learning_rate": 1.8563498635262368e-05, "loss": 0.4415, "mean_token_accuracy": 0.8578243441879749, "num_tokens": 847514370.0, "step": 26555 }, { "entropy": 0.5547129884362221, "epoch": 2.443286697603809, "grad_norm": 0.1631826013326645, "learning_rate": 1.8560431809120743e-05, "loss": 0.5362, "mean_token_accuracy": 0.8308441787958145, "num_tokens": 847545947.0, "step": 26556 }, { "entropy": 0.7005666960030794, "epoch": 2.44337870397525, "grad_norm": 0.17866073548793793, "learning_rate": 1.8557364982979117e-05, "loss": 0.6849, "mean_token_accuracy": 0.7881284281611443, "num_tokens": 847578143.0, "step": 26557 }, { "entropy": 0.48899462539702654, "epoch": 2.4434707103466913, "grad_norm": 0.16010811924934387, "learning_rate": 1.8554298156837492e-05, "loss": 0.4761, "mean_token_accuracy": 0.8502323105931282, "num_tokens": 847610237.0, "step": 26558 }, { "entropy": 0.48509029392153025, "epoch": 2.443562716718133, "grad_norm": 0.15294532477855682, "learning_rate": 1.8551231330695863e-05, "loss": 0.4645, "mean_token_accuracy": 0.8499435894191265, "num_tokens": 847641773.0, "step": 26559 }, { "entropy": 0.5185509445145726, "epoch": 2.443654723089574, "grad_norm": 0.16138572990894318, "learning_rate": 1.8548164504554238e-05, "loss": 0.5131, "mean_token_accuracy": 0.8374294117093086, "num_tokens": 847673293.0, "step": 26560 }, { "entropy": 0.4501164183020592, "epoch": 2.443746729461015, "grad_norm": 0.1519862711429596, "learning_rate": 1.8545097678412613e-05, "loss": 0.4436, "mean_token_accuracy": 0.8592123799026012, "num_tokens": 847705511.0, "step": 26561 }, { "entropy": 0.5280965778511018, "epoch": 2.4438387358324563, "grad_norm": 0.1617654412984848, "learning_rate": 1.8542030852270987e-05, "loss": 0.5103, "mean_token_accuracy": 0.8345306478440762, "num_tokens": 847737582.0, "step": 26562 }, { "entropy": 0.47611571941524744, "epoch": 2.4439307422038974, "grad_norm": 0.15460152924060822, "learning_rate": 1.853896402612936e-05, "loss": 0.47, "mean_token_accuracy": 0.8539528883993626, "num_tokens": 847769809.0, "step": 26563 }, { "entropy": 0.5439370591193438, "epoch": 2.444022748575339, "grad_norm": 0.1604483425617218, "learning_rate": 1.8535897199987733e-05, "loss": 0.5365, "mean_token_accuracy": 0.830622635781765, "num_tokens": 847801746.0, "step": 26564 }, { "entropy": 0.5139882926596329, "epoch": 2.44411475494678, "grad_norm": 0.16074596345424652, "learning_rate": 1.8532830373846108e-05, "loss": 0.5003, "mean_token_accuracy": 0.840091809630394, "num_tokens": 847834003.0, "step": 26565 }, { "entropy": 0.4616657104343176, "epoch": 2.4442067613182212, "grad_norm": 0.15460404753684998, "learning_rate": 1.8529763547704482e-05, "loss": 0.4624, "mean_token_accuracy": 0.8538376465439796, "num_tokens": 847865804.0, "step": 26566 }, { "entropy": 0.5517394915223122, "epoch": 2.4442987676896624, "grad_norm": 0.16331028938293457, "learning_rate": 1.8526696721562857e-05, "loss": 0.5424, "mean_token_accuracy": 0.827212031930685, "num_tokens": 847898070.0, "step": 26567 }, { "entropy": 0.5868012211285532, "epoch": 2.4443907740611035, "grad_norm": 0.16604594886302948, "learning_rate": 1.852362989542123e-05, "loss": 0.5642, "mean_token_accuracy": 0.8245608061552048, "num_tokens": 847929459.0, "step": 26568 }, { "entropy": 0.4744437262415886, "epoch": 2.444482780432545, "grad_norm": 0.15514987707138062, "learning_rate": 1.8520563069279603e-05, "loss": 0.4674, "mean_token_accuracy": 0.8498916663229465, "num_tokens": 847961536.0, "step": 26569 }, { "entropy": 0.5998685900121927, "epoch": 2.444574786803986, "grad_norm": 0.1696644127368927, "learning_rate": 1.8517496243137978e-05, "loss": 0.5869, "mean_token_accuracy": 0.811835415661335, "num_tokens": 847993279.0, "step": 26570 }, { "entropy": 0.5342165417969227, "epoch": 2.4446667931754273, "grad_norm": 0.16029515862464905, "learning_rate": 1.8514429416996352e-05, "loss": 0.5322, "mean_token_accuracy": 0.8338080123066902, "num_tokens": 848025715.0, "step": 26571 }, { "entropy": 0.5813234527595341, "epoch": 2.4447587995468685, "grad_norm": 0.1703179031610489, "learning_rate": 1.8511362590854724e-05, "loss": 0.5687, "mean_token_accuracy": 0.8238332010805607, "num_tokens": 848058408.0, "step": 26572 }, { "entropy": 0.4018043056130409, "epoch": 2.4448508059183096, "grad_norm": 0.1455545425415039, "learning_rate": 1.8508295764713098e-05, "loss": 0.3879, "mean_token_accuracy": 0.87525350227952, "num_tokens": 848090578.0, "step": 26573 }, { "entropy": 0.5184605638496578, "epoch": 2.444942812289751, "grad_norm": 0.159664586186409, "learning_rate": 1.8505228938571473e-05, "loss": 0.5075, "mean_token_accuracy": 0.8413572981953621, "num_tokens": 848122145.0, "step": 26574 }, { "entropy": 0.5383615307509899, "epoch": 2.4450348186611923, "grad_norm": 0.15957333147525787, "learning_rate": 1.8502162112429847e-05, "loss": 0.5128, "mean_token_accuracy": 0.8380520045757294, "num_tokens": 848153879.0, "step": 26575 }, { "entropy": 0.4609917178750038, "epoch": 2.4451268250326335, "grad_norm": 0.1536044478416443, "learning_rate": 1.8499095286288222e-05, "loss": 0.4468, "mean_token_accuracy": 0.8539705313742161, "num_tokens": 848185763.0, "step": 26576 }, { "entropy": 0.566728160250932, "epoch": 2.4452188314040746, "grad_norm": 0.16566285490989685, "learning_rate": 1.8496028460146593e-05, "loss": 0.5555, "mean_token_accuracy": 0.8239620104432106, "num_tokens": 848218281.0, "step": 26577 }, { "entropy": 0.5345778530463576, "epoch": 2.4453108377755157, "grad_norm": 0.1628141701221466, "learning_rate": 1.8492961634004968e-05, "loss": 0.5279, "mean_token_accuracy": 0.8314963020384312, "num_tokens": 848250468.0, "step": 26578 }, { "entropy": 0.531460126163438, "epoch": 2.4454028441469573, "grad_norm": 0.15633848309516907, "learning_rate": 1.8489894807863343e-05, "loss": 0.5126, "mean_token_accuracy": 0.8389285914599895, "num_tokens": 848282303.0, "step": 26579 }, { "entropy": 0.574982182122767, "epoch": 2.4454948505183984, "grad_norm": 0.16380955278873444, "learning_rate": 1.8486827981721717e-05, "loss": 0.5491, "mean_token_accuracy": 0.8260463699698448, "num_tokens": 848314472.0, "step": 26580 }, { "entropy": 0.5172215141355991, "epoch": 2.4455868568898396, "grad_norm": 0.15760117769241333, "learning_rate": 1.848376115558009e-05, "loss": 0.51, "mean_token_accuracy": 0.8389918133616447, "num_tokens": 848347013.0, "step": 26581 }, { "entropy": 0.5220510261133313, "epoch": 2.4456788632612807, "grad_norm": 0.16193220019340515, "learning_rate": 1.8480694329438463e-05, "loss": 0.5149, "mean_token_accuracy": 0.8384122885763645, "num_tokens": 848379167.0, "step": 26582 }, { "entropy": 0.537972828373313, "epoch": 2.445770869632722, "grad_norm": 0.15981072187423706, "learning_rate": 1.8477627503296838e-05, "loss": 0.5258, "mean_token_accuracy": 0.8354108817875385, "num_tokens": 848411317.0, "step": 26583 }, { "entropy": 0.49579527974128723, "epoch": 2.4458628760041634, "grad_norm": 0.1548408418893814, "learning_rate": 1.8474560677155216e-05, "loss": 0.4788, "mean_token_accuracy": 0.846980944275856, "num_tokens": 848443226.0, "step": 26584 }, { "entropy": 0.5450845267623663, "epoch": 2.4459548823756045, "grad_norm": 0.16129811108112335, "learning_rate": 1.8471493851013587e-05, "loss": 0.5177, "mean_token_accuracy": 0.8383013233542442, "num_tokens": 848474958.0, "step": 26585 }, { "entropy": 0.4706589002162218, "epoch": 2.4460468887470457, "grad_norm": 0.1517769992351532, "learning_rate": 1.8468427024871962e-05, "loss": 0.4568, "mean_token_accuracy": 0.8533821105957031, "num_tokens": 848507445.0, "step": 26586 }, { "entropy": 0.5429400773718953, "epoch": 2.446138895118487, "grad_norm": 0.16439801454544067, "learning_rate": 1.8465360198730336e-05, "loss": 0.5358, "mean_token_accuracy": 0.8307908624410629, "num_tokens": 848539321.0, "step": 26587 }, { "entropy": 0.5241084042936563, "epoch": 2.446230901489928, "grad_norm": 0.15635375678539276, "learning_rate": 1.846229337258871e-05, "loss": 0.5142, "mean_token_accuracy": 0.8372743837535381, "num_tokens": 848571648.0, "step": 26588 }, { "entropy": 0.5669491980224848, "epoch": 2.4463229078613695, "grad_norm": 0.16445651650428772, "learning_rate": 1.8459226546447082e-05, "loss": 0.5476, "mean_token_accuracy": 0.8216875307261944, "num_tokens": 848603373.0, "step": 26589 }, { "entropy": 0.4266950888559222, "epoch": 2.4464149142328107, "grad_norm": 0.1524423211812973, "learning_rate": 1.8456159720305457e-05, "loss": 0.4133, "mean_token_accuracy": 0.8675834126770496, "num_tokens": 848635630.0, "step": 26590 }, { "entropy": 0.5247887363657355, "epoch": 2.446506920604252, "grad_norm": 0.16030281782150269, "learning_rate": 1.845309289416383e-05, "loss": 0.5073, "mean_token_accuracy": 0.8391844630241394, "num_tokens": 848667669.0, "step": 26591 }, { "entropy": 0.5212376099079847, "epoch": 2.446598926975693, "grad_norm": 0.15966767072677612, "learning_rate": 1.8450026068022206e-05, "loss": 0.5129, "mean_token_accuracy": 0.8404590673744678, "num_tokens": 848699438.0, "step": 26592 }, { "entropy": 0.47433702554553747, "epoch": 2.446690933347134, "grad_norm": 0.15560553967952728, "learning_rate": 1.8446959241880578e-05, "loss": 0.4689, "mean_token_accuracy": 0.8492574170231819, "num_tokens": 848731479.0, "step": 26593 }, { "entropy": 0.4825132703408599, "epoch": 2.4467829397185756, "grad_norm": 0.15179699659347534, "learning_rate": 1.8443892415738952e-05, "loss": 0.475, "mean_token_accuracy": 0.8496580347418785, "num_tokens": 848764247.0, "step": 26594 }, { "entropy": 0.4690811721375212, "epoch": 2.4468749460900168, "grad_norm": 0.15746818482875824, "learning_rate": 1.8440825589597327e-05, "loss": 0.4606, "mean_token_accuracy": 0.8546302728354931, "num_tokens": 848796583.0, "step": 26595 }, { "entropy": 0.5154937696643174, "epoch": 2.446966952461458, "grad_norm": 0.15818707644939423, "learning_rate": 1.84377587634557e-05, "loss": 0.5069, "mean_token_accuracy": 0.8404110036790371, "num_tokens": 848828578.0, "step": 26596 }, { "entropy": 0.5618832837790251, "epoch": 2.447058958832899, "grad_norm": 0.16608327627182007, "learning_rate": 1.8434691937314076e-05, "loss": 0.561, "mean_token_accuracy": 0.8210473693907261, "num_tokens": 848860654.0, "step": 26597 }, { "entropy": 0.3980123372748494, "epoch": 2.44715096520434, "grad_norm": 0.1460348218679428, "learning_rate": 1.8431625111172447e-05, "loss": 0.3929, "mean_token_accuracy": 0.8726183101534843, "num_tokens": 848892895.0, "step": 26598 }, { "entropy": 0.5493304282426834, "epoch": 2.4472429715757817, "grad_norm": 0.16480591893196106, "learning_rate": 1.8428558285030822e-05, "loss": 0.5434, "mean_token_accuracy": 0.8281089402735233, "num_tokens": 848925253.0, "step": 26599 }, { "entropy": 0.5258596912026405, "epoch": 2.447334977947223, "grad_norm": 0.15846146643161774, "learning_rate": 1.8425491458889197e-05, "loss": 0.5113, "mean_token_accuracy": 0.8363987915217876, "num_tokens": 848957005.0, "step": 26600 }, { "entropy": 0.48861092515289783, "epoch": 2.447426984318664, "grad_norm": 0.16220547258853912, "learning_rate": 1.842242463274757e-05, "loss": 0.4798, "mean_token_accuracy": 0.8477108031511307, "num_tokens": 848987939.0, "step": 26601 }, { "entropy": 0.4353056442923844, "epoch": 2.447518990690105, "grad_norm": 0.1486930549144745, "learning_rate": 1.8419357806605943e-05, "loss": 0.4302, "mean_token_accuracy": 0.8606814332306385, "num_tokens": 849019844.0, "step": 26602 }, { "entropy": 0.5149758821353316, "epoch": 2.4476109970615463, "grad_norm": 0.1578935831785202, "learning_rate": 1.8416290980464317e-05, "loss": 0.4983, "mean_token_accuracy": 0.8389247097074986, "num_tokens": 849052362.0, "step": 26603 }, { "entropy": 0.6458366475999355, "epoch": 2.447703003432988, "grad_norm": 0.17619992792606354, "learning_rate": 1.8413224154322692e-05, "loss": 0.6363, "mean_token_accuracy": 0.8030641637742519, "num_tokens": 849084659.0, "step": 26604 }, { "entropy": 0.5401275549083948, "epoch": 2.447795009804429, "grad_norm": 0.16348546743392944, "learning_rate": 1.8410157328181067e-05, "loss": 0.5292, "mean_token_accuracy": 0.832720447331667, "num_tokens": 849116504.0, "step": 26605 }, { "entropy": 0.3973962508607656, "epoch": 2.44788701617587, "grad_norm": 0.1375880241394043, "learning_rate": 1.840709050203944e-05, "loss": 0.3929, "mean_token_accuracy": 0.8759637959301472, "num_tokens": 849148493.0, "step": 26606 }, { "entropy": 0.6075845239683986, "epoch": 2.4479790225473113, "grad_norm": 0.17244426906108856, "learning_rate": 1.8404023675897812e-05, "loss": 0.5849, "mean_token_accuracy": 0.8166434280574322, "num_tokens": 849180306.0, "step": 26607 }, { "entropy": 0.4023278448730707, "epoch": 2.4480710289187524, "grad_norm": 0.1409095972776413, "learning_rate": 1.8400956849756187e-05, "loss": 0.3783, "mean_token_accuracy": 0.8758637607097626, "num_tokens": 849212342.0, "step": 26608 }, { "entropy": 0.527533614076674, "epoch": 2.448163035290194, "grad_norm": 0.15658335387706757, "learning_rate": 1.8397890023614562e-05, "loss": 0.5096, "mean_token_accuracy": 0.8376094214618206, "num_tokens": 849244506.0, "step": 26609 }, { "entropy": 0.48238059505820274, "epoch": 2.448255041661635, "grad_norm": 0.1516648828983307, "learning_rate": 1.8394823197472936e-05, "loss": 0.4629, "mean_token_accuracy": 0.8520570434629917, "num_tokens": 849277147.0, "step": 26610 }, { "entropy": 0.6266539767384529, "epoch": 2.4483470480330762, "grad_norm": 0.17544278502464294, "learning_rate": 1.8391756371331308e-05, "loss": 0.6206, "mean_token_accuracy": 0.8074145205318928, "num_tokens": 849309015.0, "step": 26611 }, { "entropy": 0.5171671421267092, "epoch": 2.4484390544045174, "grad_norm": 0.16321054100990295, "learning_rate": 1.8388689545189682e-05, "loss": 0.5047, "mean_token_accuracy": 0.8424532674252987, "num_tokens": 849340987.0, "step": 26612 }, { "entropy": 0.4390060221776366, "epoch": 2.4485310607759585, "grad_norm": 0.14845627546310425, "learning_rate": 1.8385622719048057e-05, "loss": 0.4191, "mean_token_accuracy": 0.8667279481887817, "num_tokens": 849372995.0, "step": 26613 }, { "entropy": 0.5557491881772876, "epoch": 2.4486230671474, "grad_norm": 0.16660597920417786, "learning_rate": 1.838255589290643e-05, "loss": 0.5504, "mean_token_accuracy": 0.8232576064765453, "num_tokens": 849404889.0, "step": 26614 }, { "entropy": 0.4619093043729663, "epoch": 2.448715073518841, "grad_norm": 0.1471141129732132, "learning_rate": 1.8379489066764806e-05, "loss": 0.4436, "mean_token_accuracy": 0.8574857823550701, "num_tokens": 849436710.0, "step": 26615 }, { "entropy": 0.48294012201949954, "epoch": 2.4488070798902823, "grad_norm": 0.15415653586387634, "learning_rate": 1.837642224062318e-05, "loss": 0.4713, "mean_token_accuracy": 0.8471771851181984, "num_tokens": 849469075.0, "step": 26616 }, { "entropy": 0.4923661109060049, "epoch": 2.4488990862617235, "grad_norm": 0.15711908042430878, "learning_rate": 1.8373355414481556e-05, "loss": 0.4846, "mean_token_accuracy": 0.8443669676780701, "num_tokens": 849501422.0, "step": 26617 }, { "entropy": 0.5673062652349472, "epoch": 2.4489910926331646, "grad_norm": 0.16419053077697754, "learning_rate": 1.837028858833993e-05, "loss": 0.5515, "mean_token_accuracy": 0.8237439692020416, "num_tokens": 849533905.0, "step": 26618 }, { "entropy": 0.49948814837262034, "epoch": 2.449083099004606, "grad_norm": 0.1522749662399292, "learning_rate": 1.83672217621983e-05, "loss": 0.4846, "mean_token_accuracy": 0.847310334444046, "num_tokens": 849566148.0, "step": 26619 }, { "entropy": 0.4398367127869278, "epoch": 2.4491751053760473, "grad_norm": 0.14836078882217407, "learning_rate": 1.8364154936056676e-05, "loss": 0.4197, "mean_token_accuracy": 0.8672992326319218, "num_tokens": 849598738.0, "step": 26620 }, { "entropy": 0.4484964357689023, "epoch": 2.4492671117474885, "grad_norm": 0.14300374686717987, "learning_rate": 1.836108810991505e-05, "loss": 0.437, "mean_token_accuracy": 0.8605951555073261, "num_tokens": 849631120.0, "step": 26621 }, { "entropy": 0.5023294860729948, "epoch": 2.4493591181189296, "grad_norm": 0.156409353017807, "learning_rate": 1.8358021283773425e-05, "loss": 0.4843, "mean_token_accuracy": 0.8480755425989628, "num_tokens": 849662446.0, "step": 26622 }, { "entropy": 0.4597419190686196, "epoch": 2.4494511244903707, "grad_norm": 0.15369774401187897, "learning_rate": 1.8354954457631797e-05, "loss": 0.4434, "mean_token_accuracy": 0.857905350625515, "num_tokens": 849694609.0, "step": 26623 }, { "entropy": 0.5570343043655157, "epoch": 2.4495431308618123, "grad_norm": 0.16687346994876862, "learning_rate": 1.835188763149017e-05, "loss": 0.5501, "mean_token_accuracy": 0.8290382809937, "num_tokens": 849726820.0, "step": 26624 }, { "entropy": 0.5187474526464939, "epoch": 2.4496351372332534, "grad_norm": 0.15541744232177734, "learning_rate": 1.8348820805348546e-05, "loss": 0.5146, "mean_token_accuracy": 0.8396404311060905, "num_tokens": 849759437.0, "step": 26625 }, { "entropy": 0.4302801387384534, "epoch": 2.4497271436046946, "grad_norm": 0.14984720945358276, "learning_rate": 1.834575397920692e-05, "loss": 0.4239, "mean_token_accuracy": 0.8648076318204403, "num_tokens": 849791338.0, "step": 26626 }, { "entropy": 0.5130422245711088, "epoch": 2.4498191499761357, "grad_norm": 0.15678462386131287, "learning_rate": 1.8342687153065295e-05, "loss": 0.5048, "mean_token_accuracy": 0.8371996134519577, "num_tokens": 849823386.0, "step": 26627 }, { "entropy": 0.5348533252254128, "epoch": 2.449911156347577, "grad_norm": 0.1592174768447876, "learning_rate": 1.8339620326923667e-05, "loss": 0.5234, "mean_token_accuracy": 0.8365197740495205, "num_tokens": 849855789.0, "step": 26628 }, { "entropy": 0.5241115968674421, "epoch": 2.4500031627190184, "grad_norm": 0.16492266952991486, "learning_rate": 1.833655350078204e-05, "loss": 0.5149, "mean_token_accuracy": 0.8350529298186302, "num_tokens": 849887425.0, "step": 26629 }, { "entropy": 0.5576102510094643, "epoch": 2.4500951690904595, "grad_norm": 0.1678747832775116, "learning_rate": 1.8333486674640416e-05, "loss": 0.5664, "mean_token_accuracy": 0.8267012350261211, "num_tokens": 849919740.0, "step": 26630 }, { "entropy": 0.53632936719805, "epoch": 2.4501871754619007, "grad_norm": 0.15803293883800507, "learning_rate": 1.833041984849879e-05, "loss": 0.5233, "mean_token_accuracy": 0.830446470528841, "num_tokens": 849951513.0, "step": 26631 }, { "entropy": 0.5141473961994052, "epoch": 2.450279181833342, "grad_norm": 0.1638219803571701, "learning_rate": 1.8327353022357162e-05, "loss": 0.5086, "mean_token_accuracy": 0.8406458832323551, "num_tokens": 849983202.0, "step": 26632 }, { "entropy": 0.5346006322652102, "epoch": 2.450371188204783, "grad_norm": 0.16242893040180206, "learning_rate": 1.8324286196215536e-05, "loss": 0.5178, "mean_token_accuracy": 0.8362992480397224, "num_tokens": 850015393.0, "step": 26633 }, { "entropy": 0.5016578882932663, "epoch": 2.4504631945762245, "grad_norm": 0.15883463621139526, "learning_rate": 1.832121937007391e-05, "loss": 0.4942, "mean_token_accuracy": 0.8421708419919014, "num_tokens": 850047171.0, "step": 26634 }, { "entropy": 0.5165531504899263, "epoch": 2.4505552009476657, "grad_norm": 0.15952220559120178, "learning_rate": 1.8318152543932286e-05, "loss": 0.5018, "mean_token_accuracy": 0.8418941386044025, "num_tokens": 850079425.0, "step": 26635 }, { "entropy": 0.5966058429330587, "epoch": 2.450647207319107, "grad_norm": 0.16664338111877441, "learning_rate": 1.831508571779066e-05, "loss": 0.5781, "mean_token_accuracy": 0.8228876739740372, "num_tokens": 850111550.0, "step": 26636 }, { "entropy": 0.5782178714871407, "epoch": 2.450739213690548, "grad_norm": 0.17323993146419525, "learning_rate": 1.831201889164903e-05, "loss": 0.5643, "mean_token_accuracy": 0.8209275715053082, "num_tokens": 850143245.0, "step": 26637 }, { "entropy": 0.5477541852742434, "epoch": 2.450831220061989, "grad_norm": 0.16175755858421326, "learning_rate": 1.8308952065507406e-05, "loss": 0.5322, "mean_token_accuracy": 0.8288710229098797, "num_tokens": 850175360.0, "step": 26638 }, { "entropy": 0.5801816135644913, "epoch": 2.4509232264334306, "grad_norm": 0.17866311967372894, "learning_rate": 1.830588523936578e-05, "loss": 0.5894, "mean_token_accuracy": 0.813357125967741, "num_tokens": 850205406.0, "step": 26639 }, { "entropy": 0.5890486594289541, "epoch": 2.4510152328048718, "grad_norm": 0.1675492376089096, "learning_rate": 1.8302818413224156e-05, "loss": 0.5646, "mean_token_accuracy": 0.8204379752278328, "num_tokens": 850237446.0, "step": 26640 }, { "entropy": 0.5006236946210265, "epoch": 2.451107239176313, "grad_norm": 0.15162739157676697, "learning_rate": 1.8299751587082527e-05, "loss": 0.4918, "mean_token_accuracy": 0.8433481156826019, "num_tokens": 850269229.0, "step": 26641 }, { "entropy": 0.47729366400744766, "epoch": 2.451199245547754, "grad_norm": 0.15656541287899017, "learning_rate": 1.82966847609409e-05, "loss": 0.4742, "mean_token_accuracy": 0.8501835279166698, "num_tokens": 850301603.0, "step": 26642 }, { "entropy": 0.6119969002902508, "epoch": 2.451291251919195, "grad_norm": 0.17023608088493347, "learning_rate": 1.8293617934799276e-05, "loss": 0.5981, "mean_token_accuracy": 0.8128780797123909, "num_tokens": 850333806.0, "step": 26643 }, { "entropy": 0.48245594184845686, "epoch": 2.4513832582906367, "grad_norm": 0.15760329365730286, "learning_rate": 1.829055110865765e-05, "loss": 0.46, "mean_token_accuracy": 0.8535502105951309, "num_tokens": 850365668.0, "step": 26644 }, { "entropy": 0.6097371838986874, "epoch": 2.451475264662078, "grad_norm": 0.1691809743642807, "learning_rate": 1.8287484282516025e-05, "loss": 0.5966, "mean_token_accuracy": 0.8132809400558472, "num_tokens": 850397206.0, "step": 26645 }, { "entropy": 0.6163602918386459, "epoch": 2.451567271033519, "grad_norm": 0.17404916882514954, "learning_rate": 1.82844174563744e-05, "loss": 0.6077, "mean_token_accuracy": 0.8106948919594288, "num_tokens": 850428919.0, "step": 26646 }, { "entropy": 0.4850107138045132, "epoch": 2.45165927740496, "grad_norm": 0.15107597410678864, "learning_rate": 1.8281350630232775e-05, "loss": 0.4679, "mean_token_accuracy": 0.8530442416667938, "num_tokens": 850461635.0, "step": 26647 }, { "entropy": 0.4895791634917259, "epoch": 2.4517512837764013, "grad_norm": 0.1525314599275589, "learning_rate": 1.827828380409115e-05, "loss": 0.477, "mean_token_accuracy": 0.8437366299331188, "num_tokens": 850493773.0, "step": 26648 }, { "entropy": 0.4906221032142639, "epoch": 2.451843290147843, "grad_norm": 0.15880268812179565, "learning_rate": 1.827521697794952e-05, "loss": 0.4763, "mean_token_accuracy": 0.8499248251318932, "num_tokens": 850525648.0, "step": 26649 }, { "entropy": 0.5160438632592559, "epoch": 2.451935296519284, "grad_norm": 0.1600552797317505, "learning_rate": 1.8272150151807895e-05, "loss": 0.514, "mean_token_accuracy": 0.836430698633194, "num_tokens": 850557897.0, "step": 26650 }, { "entropy": 0.48010733001865447, "epoch": 2.452027302890725, "grad_norm": 0.15512505173683167, "learning_rate": 1.826908332566627e-05, "loss": 0.4608, "mean_token_accuracy": 0.8499287962913513, "num_tokens": 850589095.0, "step": 26651 }, { "entropy": 0.5288979751057923, "epoch": 2.4521193092621663, "grad_norm": 0.15992572903633118, "learning_rate": 1.8266016499524645e-05, "loss": 0.5218, "mean_token_accuracy": 0.8359533995389938, "num_tokens": 850621150.0, "step": 26652 }, { "entropy": 0.5486281882040203, "epoch": 2.4522113156336074, "grad_norm": 0.16535386443138123, "learning_rate": 1.8262949673383016e-05, "loss": 0.5328, "mean_token_accuracy": 0.8297893181443214, "num_tokens": 850653169.0, "step": 26653 }, { "entropy": 0.6205538287758827, "epoch": 2.452303322005049, "grad_norm": 0.1680159568786621, "learning_rate": 1.825988284724139e-05, "loss": 0.5963, "mean_token_accuracy": 0.8105881661176682, "num_tokens": 850684777.0, "step": 26654 }, { "entropy": 0.532672893255949, "epoch": 2.45239532837649, "grad_norm": 0.16393299400806427, "learning_rate": 1.8256816021099765e-05, "loss": 0.5293, "mean_token_accuracy": 0.8308009244501591, "num_tokens": 850716639.0, "step": 26655 }, { "entropy": 0.4736121064051986, "epoch": 2.4524873347479312, "grad_norm": 0.16489970684051514, "learning_rate": 1.825374919495814e-05, "loss": 0.4701, "mean_token_accuracy": 0.8545492105185986, "num_tokens": 850748088.0, "step": 26656 }, { "entropy": 0.49915322568267584, "epoch": 2.4525793411193724, "grad_norm": 0.15290111303329468, "learning_rate": 1.8250682368816514e-05, "loss": 0.4805, "mean_token_accuracy": 0.8480291180312634, "num_tokens": 850780280.0, "step": 26657 }, { "entropy": 0.4356419234536588, "epoch": 2.4526713474908135, "grad_norm": 0.1475526988506317, "learning_rate": 1.8247615542674886e-05, "loss": 0.4184, "mean_token_accuracy": 0.8662915863096714, "num_tokens": 850811826.0, "step": 26658 }, { "entropy": 0.5162115348502994, "epoch": 2.452763353862255, "grad_norm": 0.16063323616981506, "learning_rate": 1.824454871653326e-05, "loss": 0.5107, "mean_token_accuracy": 0.8386348225176334, "num_tokens": 850843850.0, "step": 26659 }, { "entropy": 0.5408323155716062, "epoch": 2.452855360233696, "grad_norm": 0.16425886750221252, "learning_rate": 1.8241481890391635e-05, "loss": 0.5258, "mean_token_accuracy": 0.8336763866245747, "num_tokens": 850876177.0, "step": 26660 }, { "entropy": 0.47622725926339626, "epoch": 2.4529473666051373, "grad_norm": 0.15521526336669922, "learning_rate": 1.823841506425001e-05, "loss": 0.4576, "mean_token_accuracy": 0.851473655551672, "num_tokens": 850907563.0, "step": 26661 }, { "entropy": 0.45898999366909266, "epoch": 2.4530393729765785, "grad_norm": 0.15123850107192993, "learning_rate": 1.823534823810838e-05, "loss": 0.4508, "mean_token_accuracy": 0.8556359671056271, "num_tokens": 850939366.0, "step": 26662 }, { "entropy": 0.46173661202192307, "epoch": 2.4531313793480196, "grad_norm": 0.1504283994436264, "learning_rate": 1.8232281411966755e-05, "loss": 0.441, "mean_token_accuracy": 0.8549915365874767, "num_tokens": 850970424.0, "step": 26663 }, { "entropy": 0.5588316535577178, "epoch": 2.453223385719461, "grad_norm": 0.16327565908432007, "learning_rate": 1.822921458582513e-05, "loss": 0.5558, "mean_token_accuracy": 0.8255641125142574, "num_tokens": 851002537.0, "step": 26664 }, { "entropy": 0.4861026583239436, "epoch": 2.4533153920909023, "grad_norm": 0.15591205656528473, "learning_rate": 1.8226147759683505e-05, "loss": 0.467, "mean_token_accuracy": 0.8539020605385303, "num_tokens": 851034506.0, "step": 26665 }, { "entropy": 0.4768067253753543, "epoch": 2.4534073984623435, "grad_norm": 0.1638830453157425, "learning_rate": 1.822308093354188e-05, "loss": 0.4626, "mean_token_accuracy": 0.8551753610372543, "num_tokens": 851065962.0, "step": 26666 }, { "entropy": 0.5423914436250925, "epoch": 2.4534994048337846, "grad_norm": 0.16700656712055206, "learning_rate": 1.822001410740025e-05, "loss": 0.531, "mean_token_accuracy": 0.8303971067070961, "num_tokens": 851098185.0, "step": 26667 }, { "entropy": 0.4485407853499055, "epoch": 2.4535914112052257, "grad_norm": 0.14700640738010406, "learning_rate": 1.8216947281258625e-05, "loss": 0.4294, "mean_token_accuracy": 0.8599894754588604, "num_tokens": 851130517.0, "step": 26668 }, { "entropy": 0.5294692534953356, "epoch": 2.4536834175766673, "grad_norm": 0.16288946568965912, "learning_rate": 1.8213880455117e-05, "loss": 0.5149, "mean_token_accuracy": 0.8357882760465145, "num_tokens": 851163146.0, "step": 26669 }, { "entropy": 0.5092012835666537, "epoch": 2.4537754239481084, "grad_norm": 0.15332794189453125, "learning_rate": 1.8210813628975375e-05, "loss": 0.5114, "mean_token_accuracy": 0.8427055925130844, "num_tokens": 851195022.0, "step": 26670 }, { "entropy": 0.527759918011725, "epoch": 2.4538674303195496, "grad_norm": 0.1608283370733261, "learning_rate": 1.8207746802833746e-05, "loss": 0.5184, "mean_token_accuracy": 0.8360292315483093, "num_tokens": 851227167.0, "step": 26671 }, { "entropy": 0.4430248262360692, "epoch": 2.4539594366909907, "grad_norm": 0.15134674310684204, "learning_rate": 1.820467997669212e-05, "loss": 0.4326, "mean_token_accuracy": 0.8624053336679935, "num_tokens": 851258495.0, "step": 26672 }, { "entropy": 0.6080379590857774, "epoch": 2.454051443062432, "grad_norm": 0.16836650669574738, "learning_rate": 1.8201613150550495e-05, "loss": 0.5915, "mean_token_accuracy": 0.812820740044117, "num_tokens": 851290244.0, "step": 26673 }, { "entropy": 0.43579821940511465, "epoch": 2.4541434494338734, "grad_norm": 0.14855755865573883, "learning_rate": 1.819854632440887e-05, "loss": 0.4166, "mean_token_accuracy": 0.8644827157258987, "num_tokens": 851322610.0, "step": 26674 }, { "entropy": 0.5651506949216127, "epoch": 2.4542354558053145, "grad_norm": 0.16688032448291779, "learning_rate": 1.819547949826724e-05, "loss": 0.5607, "mean_token_accuracy": 0.8252209238708019, "num_tokens": 851354353.0, "step": 26675 }, { "entropy": 0.6190228052437305, "epoch": 2.4543274621767557, "grad_norm": 0.175596222281456, "learning_rate": 1.819241267212562e-05, "loss": 0.6157, "mean_token_accuracy": 0.807651162147522, "num_tokens": 851385803.0, "step": 26676 }, { "entropy": 0.5624864392448217, "epoch": 2.454419468548197, "grad_norm": 0.16449807584285736, "learning_rate": 1.8189345845983994e-05, "loss": 0.5525, "mean_token_accuracy": 0.82438775151968, "num_tokens": 851417890.0, "step": 26677 }, { "entropy": 0.5055980309844017, "epoch": 2.454511474919638, "grad_norm": 0.15972024202346802, "learning_rate": 1.818627901984237e-05, "loss": 0.4909, "mean_token_accuracy": 0.8445568978786469, "num_tokens": 851449919.0, "step": 26678 }, { "entropy": 0.446243685670197, "epoch": 2.4546034812910795, "grad_norm": 0.14770659804344177, "learning_rate": 1.818321219370074e-05, "loss": 0.4221, "mean_token_accuracy": 0.864593718200922, "num_tokens": 851482420.0, "step": 26679 }, { "entropy": 0.49311858462169766, "epoch": 2.4546954876625207, "grad_norm": 0.15495805442333221, "learning_rate": 1.8180145367559114e-05, "loss": 0.4789, "mean_token_accuracy": 0.8479847311973572, "num_tokens": 851514698.0, "step": 26680 }, { "entropy": 0.4553789743222296, "epoch": 2.454787494033962, "grad_norm": 0.15230512619018555, "learning_rate": 1.817707854141749e-05, "loss": 0.4364, "mean_token_accuracy": 0.8601022846996784, "num_tokens": 851545127.0, "step": 26681 }, { "entropy": 0.5119462627917528, "epoch": 2.454879500405403, "grad_norm": 0.16018636524677277, "learning_rate": 1.8174011715275864e-05, "loss": 0.4921, "mean_token_accuracy": 0.8426245860755444, "num_tokens": 851577038.0, "step": 26682 }, { "entropy": 0.41922272252850235, "epoch": 2.454971506776844, "grad_norm": 0.14464543759822845, "learning_rate": 1.8170944889134235e-05, "loss": 0.3991, "mean_token_accuracy": 0.8717711456120014, "num_tokens": 851608731.0, "step": 26683 }, { "entropy": 0.36261895718052983, "epoch": 2.4550635131482856, "grad_norm": 0.13733772933483124, "learning_rate": 1.816787806299261e-05, "loss": 0.3518, "mean_token_accuracy": 0.8826399929821491, "num_tokens": 851641421.0, "step": 26684 }, { "entropy": 0.4856330493930727, "epoch": 2.4551555195197268, "grad_norm": 0.15526016056537628, "learning_rate": 1.8164811236850984e-05, "loss": 0.484, "mean_token_accuracy": 0.8458799421787262, "num_tokens": 851673415.0, "step": 26685 }, { "entropy": 0.42934050410985947, "epoch": 2.455247525891168, "grad_norm": 0.15277506411075592, "learning_rate": 1.816174441070936e-05, "loss": 0.4172, "mean_token_accuracy": 0.8641983009874821, "num_tokens": 851705659.0, "step": 26686 }, { "entropy": 0.5026910174638033, "epoch": 2.455339532262609, "grad_norm": 0.157871276140213, "learning_rate": 1.8158677584567733e-05, "loss": 0.4749, "mean_token_accuracy": 0.8446915969252586, "num_tokens": 851737080.0, "step": 26687 }, { "entropy": 0.45160098746418953, "epoch": 2.45543153863405, "grad_norm": 0.15597669780254364, "learning_rate": 1.8155610758426105e-05, "loss": 0.4406, "mean_token_accuracy": 0.859335046261549, "num_tokens": 851768339.0, "step": 26688 }, { "entropy": 0.6569693312048912, "epoch": 2.4555235450054917, "grad_norm": 0.1791491061449051, "learning_rate": 1.815254393228448e-05, "loss": 0.6483, "mean_token_accuracy": 0.7957662679255009, "num_tokens": 851800054.0, "step": 26689 }, { "entropy": 0.4677579812705517, "epoch": 2.455615551376933, "grad_norm": 0.15788649022579193, "learning_rate": 1.8149477106142854e-05, "loss": 0.4569, "mean_token_accuracy": 0.8536218293011189, "num_tokens": 851831702.0, "step": 26690 }, { "entropy": 0.49566161073744297, "epoch": 2.455707557748374, "grad_norm": 0.15777134895324707, "learning_rate": 1.814641028000123e-05, "loss": 0.4666, "mean_token_accuracy": 0.8499150760471821, "num_tokens": 851863531.0, "step": 26691 }, { "entropy": 0.5081593114882708, "epoch": 2.455799564119815, "grad_norm": 0.15334776043891907, "learning_rate": 1.81433434538596e-05, "loss": 0.4941, "mean_token_accuracy": 0.8430546671152115, "num_tokens": 851895615.0, "step": 26692 }, { "entropy": 0.4558687340468168, "epoch": 2.4558915704912563, "grad_norm": 0.15579569339752197, "learning_rate": 1.8140276627717975e-05, "loss": 0.4502, "mean_token_accuracy": 0.8546346798539162, "num_tokens": 851927685.0, "step": 26693 }, { "entropy": 0.5025640479288995, "epoch": 2.455983576862698, "grad_norm": 0.15983597934246063, "learning_rate": 1.813720980157635e-05, "loss": 0.493, "mean_token_accuracy": 0.8434934616088867, "num_tokens": 851959860.0, "step": 26694 }, { "entropy": 0.5305973794311285, "epoch": 2.456075583234139, "grad_norm": 0.16246291995048523, "learning_rate": 1.8134142975434724e-05, "loss": 0.5198, "mean_token_accuracy": 0.8328907266259193, "num_tokens": 851991377.0, "step": 26695 }, { "entropy": 0.5934715969488025, "epoch": 2.45616758960558, "grad_norm": 0.16497336328029633, "learning_rate": 1.81310761492931e-05, "loss": 0.579, "mean_token_accuracy": 0.815651960670948, "num_tokens": 852023213.0, "step": 26696 }, { "entropy": 0.4537722086533904, "epoch": 2.4562595959770213, "grad_norm": 0.15099771320819855, "learning_rate": 1.812800932315147e-05, "loss": 0.4553, "mean_token_accuracy": 0.8551701568067074, "num_tokens": 852055870.0, "step": 26697 }, { "entropy": 0.5311544728465378, "epoch": 2.4563516023484624, "grad_norm": 0.1595541536808014, "learning_rate": 1.8124942497009844e-05, "loss": 0.5133, "mean_token_accuracy": 0.8350011892616749, "num_tokens": 852087789.0, "step": 26698 }, { "entropy": 0.5630695624276996, "epoch": 2.456443608719904, "grad_norm": 0.16634723544120789, "learning_rate": 1.812187567086822e-05, "loss": 0.5408, "mean_token_accuracy": 0.8290241360664368, "num_tokens": 852119483.0, "step": 26699 }, { "entropy": 0.48798003140836954, "epoch": 2.456535615091345, "grad_norm": 0.16048696637153625, "learning_rate": 1.8118808844726594e-05, "loss": 0.4711, "mean_token_accuracy": 0.8491269499063492, "num_tokens": 852151676.0, "step": 26700 }, { "entropy": 0.5845205751247704, "epoch": 2.4566276214627862, "grad_norm": 0.17067702114582062, "learning_rate": 1.8115742018584965e-05, "loss": 0.5685, "mean_token_accuracy": 0.8196885138750076, "num_tokens": 852182534.0, "step": 26701 }, { "entropy": 0.5995588628575206, "epoch": 2.4567196278342274, "grad_norm": 0.1783478856086731, "learning_rate": 1.811267519244334e-05, "loss": 0.6009, "mean_token_accuracy": 0.8134289309382439, "num_tokens": 852213820.0, "step": 26702 }, { "entropy": 0.5246204454451799, "epoch": 2.4568116342056685, "grad_norm": 0.16415666043758392, "learning_rate": 1.8109608366301714e-05, "loss": 0.5162, "mean_token_accuracy": 0.8343973383307457, "num_tokens": 852245964.0, "step": 26703 }, { "entropy": 0.6430352907627821, "epoch": 2.45690364057711, "grad_norm": 0.17001774907112122, "learning_rate": 1.810654154016009e-05, "loss": 0.6275, "mean_token_accuracy": 0.8045362830162048, "num_tokens": 852278298.0, "step": 26704 }, { "entropy": 0.5694993976503611, "epoch": 2.456995646948551, "grad_norm": 0.17255952954292297, "learning_rate": 1.810347471401846e-05, "loss": 0.5655, "mean_token_accuracy": 0.8233221918344498, "num_tokens": 852309822.0, "step": 26705 }, { "entropy": 0.43820713460445404, "epoch": 2.4570876533199923, "grad_norm": 0.14748454093933105, "learning_rate": 1.8100407887876838e-05, "loss": 0.429, "mean_token_accuracy": 0.8663835115730762, "num_tokens": 852342217.0, "step": 26706 }, { "entropy": 0.6123045235872269, "epoch": 2.4571796596914335, "grad_norm": 0.1682884693145752, "learning_rate": 1.8097341061735213e-05, "loss": 0.5992, "mean_token_accuracy": 0.8143976368010044, "num_tokens": 852373154.0, "step": 26707 }, { "entropy": 0.6145134642720222, "epoch": 2.4572716660628746, "grad_norm": 0.1663305163383484, "learning_rate": 1.8094274235593588e-05, "loss": 0.6022, "mean_token_accuracy": 0.8102940917015076, "num_tokens": 852405405.0, "step": 26708 }, { "entropy": 0.6022633938118815, "epoch": 2.457363672434316, "grad_norm": 0.17172478139400482, "learning_rate": 1.809120740945196e-05, "loss": 0.5897, "mean_token_accuracy": 0.8107917569577694, "num_tokens": 852437413.0, "step": 26709 }, { "entropy": 0.5525014596059918, "epoch": 2.4574556788057573, "grad_norm": 0.16728727519512177, "learning_rate": 1.8088140583310333e-05, "loss": 0.5355, "mean_token_accuracy": 0.8310388773679733, "num_tokens": 852469153.0, "step": 26710 }, { "entropy": 0.5729895541444421, "epoch": 2.4575476851771985, "grad_norm": 0.1634235382080078, "learning_rate": 1.8085073757168708e-05, "loss": 0.5656, "mean_token_accuracy": 0.8212672285735607, "num_tokens": 852501033.0, "step": 26711 }, { "entropy": 0.47050097468309104, "epoch": 2.4576396915486396, "grad_norm": 0.15247073769569397, "learning_rate": 1.8082006931027083e-05, "loss": 0.46, "mean_token_accuracy": 0.853355024009943, "num_tokens": 852533417.0, "step": 26712 }, { "entropy": 0.5216265879571438, "epoch": 2.4577316979200807, "grad_norm": 0.16547437012195587, "learning_rate": 1.8078940104885454e-05, "loss": 0.5159, "mean_token_accuracy": 0.8352895565330982, "num_tokens": 852565966.0, "step": 26713 }, { "entropy": 0.4880653088912368, "epoch": 2.4578237042915223, "grad_norm": 0.1566626876592636, "learning_rate": 1.807587327874383e-05, "loss": 0.4777, "mean_token_accuracy": 0.8434318602085114, "num_tokens": 852597390.0, "step": 26714 }, { "entropy": 0.5128579456359148, "epoch": 2.4579157106629634, "grad_norm": 0.16322767734527588, "learning_rate": 1.8072806452602203e-05, "loss": 0.4942, "mean_token_accuracy": 0.8462017104029655, "num_tokens": 852628156.0, "step": 26715 }, { "entropy": 0.42936704820021987, "epoch": 2.4580077170344046, "grad_norm": 0.14796796441078186, "learning_rate": 1.8069739626460578e-05, "loss": 0.4164, "mean_token_accuracy": 0.8631087690591812, "num_tokens": 852660092.0, "step": 26716 }, { "entropy": 0.5159088959917426, "epoch": 2.4580997234058457, "grad_norm": 0.16678783297538757, "learning_rate": 1.8066672800318953e-05, "loss": 0.5125, "mean_token_accuracy": 0.8378639109432697, "num_tokens": 852692226.0, "step": 26717 }, { "entropy": 0.5114379739388824, "epoch": 2.458191729777287, "grad_norm": 0.16231435537338257, "learning_rate": 1.8063605974177324e-05, "loss": 0.5146, "mean_token_accuracy": 0.8386014848947525, "num_tokens": 852723864.0, "step": 26718 }, { "entropy": 0.4634872036986053, "epoch": 2.4582837361487284, "grad_norm": 0.14810463786125183, "learning_rate": 1.80605391480357e-05, "loss": 0.4509, "mean_token_accuracy": 0.8565805926918983, "num_tokens": 852756152.0, "step": 26719 }, { "entropy": 0.4298457899130881, "epoch": 2.4583757425201695, "grad_norm": 0.14503352344036102, "learning_rate": 1.8057472321894073e-05, "loss": 0.4184, "mean_token_accuracy": 0.8666068241000175, "num_tokens": 852788142.0, "step": 26720 }, { "entropy": 0.4879705375060439, "epoch": 2.4584677488916107, "grad_norm": 0.15059098601341248, "learning_rate": 1.8054405495752448e-05, "loss": 0.476, "mean_token_accuracy": 0.8498167991638184, "num_tokens": 852820210.0, "step": 26721 }, { "entropy": 0.5096382941119373, "epoch": 2.458559755263052, "grad_norm": 0.15862701833248138, "learning_rate": 1.805133866961082e-05, "loss": 0.5042, "mean_token_accuracy": 0.8418942913413048, "num_tokens": 852852695.0, "step": 26722 }, { "entropy": 0.4454883683938533, "epoch": 2.458651761634493, "grad_norm": 0.15139663219451904, "learning_rate": 1.8048271843469194e-05, "loss": 0.4173, "mean_token_accuracy": 0.8678354769945145, "num_tokens": 852883397.0, "step": 26723 }, { "entropy": 0.44497907534241676, "epoch": 2.4587437680059345, "grad_norm": 0.147821843624115, "learning_rate": 1.804520501732757e-05, "loss": 0.4173, "mean_token_accuracy": 0.8664252609014511, "num_tokens": 852915929.0, "step": 26724 }, { "entropy": 0.5095361424610019, "epoch": 2.4588357743773757, "grad_norm": 0.15944302082061768, "learning_rate": 1.8042138191185943e-05, "loss": 0.4987, "mean_token_accuracy": 0.840814184397459, "num_tokens": 852947990.0, "step": 26725 }, { "entropy": 0.6025244239717722, "epoch": 2.458927780748817, "grad_norm": 0.16754144430160522, "learning_rate": 1.8039071365044318e-05, "loss": 0.5861, "mean_token_accuracy": 0.8159728683531284, "num_tokens": 852980213.0, "step": 26726 }, { "entropy": 0.5284077962860465, "epoch": 2.459019787120258, "grad_norm": 0.1559409350156784, "learning_rate": 1.803600453890269e-05, "loss": 0.5088, "mean_token_accuracy": 0.8398403599858284, "num_tokens": 853012446.0, "step": 26727 }, { "entropy": 0.5296865440905094, "epoch": 2.459111793491699, "grad_norm": 0.16249507665634155, "learning_rate": 1.8032937712761064e-05, "loss": 0.5318, "mean_token_accuracy": 0.8315144069492817, "num_tokens": 853044269.0, "step": 26728 }, { "entropy": 0.48009470745455474, "epoch": 2.4592037998631406, "grad_norm": 0.1498861014842987, "learning_rate": 1.8029870886619438e-05, "loss": 0.4518, "mean_token_accuracy": 0.8549606688320637, "num_tokens": 853075713.0, "step": 26729 }, { "entropy": 0.5870454981923103, "epoch": 2.4592958062345818, "grad_norm": 0.1674538105726242, "learning_rate": 1.8026804060477813e-05, "loss": 0.5722, "mean_token_accuracy": 0.8201033920049667, "num_tokens": 853107871.0, "step": 26730 }, { "entropy": 0.5668134419247508, "epoch": 2.459387812606023, "grad_norm": 0.16688548028469086, "learning_rate": 1.8023737234336184e-05, "loss": 0.5608, "mean_token_accuracy": 0.8239430338144302, "num_tokens": 853139988.0, "step": 26731 }, { "entropy": 0.5039502409053966, "epoch": 2.459479818977464, "grad_norm": 0.15526799857616425, "learning_rate": 1.802067040819456e-05, "loss": 0.4891, "mean_token_accuracy": 0.8447184711694717, "num_tokens": 853171087.0, "step": 26732 }, { "entropy": 0.4422299196012318, "epoch": 2.459571825348905, "grad_norm": 0.14757326245307922, "learning_rate": 1.8017603582052933e-05, "loss": 0.4248, "mean_token_accuracy": 0.8628758192062378, "num_tokens": 853203342.0, "step": 26733 }, { "entropy": 0.4698693500831723, "epoch": 2.4596638317203467, "grad_norm": 0.15778930485248566, "learning_rate": 1.8014536755911308e-05, "loss": 0.4627, "mean_token_accuracy": 0.8521520085632801, "num_tokens": 853235338.0, "step": 26734 }, { "entropy": 0.5559359593316913, "epoch": 2.459755838091788, "grad_norm": 0.16219988465309143, "learning_rate": 1.801146992976968e-05, "loss": 0.5292, "mean_token_accuracy": 0.8319410532712936, "num_tokens": 853266491.0, "step": 26735 }, { "entropy": 0.5654996447265148, "epoch": 2.459847844463229, "grad_norm": 0.17074260115623474, "learning_rate": 1.8008403103628054e-05, "loss": 0.5538, "mean_token_accuracy": 0.8229511417448521, "num_tokens": 853297917.0, "step": 26736 }, { "entropy": 0.5397288338281214, "epoch": 2.45993985083467, "grad_norm": 0.15816287696361542, "learning_rate": 1.8005336277486432e-05, "loss": 0.5314, "mean_token_accuracy": 0.8303338401019573, "num_tokens": 853329914.0, "step": 26737 }, { "entropy": 0.5077033713459969, "epoch": 2.4600318572061113, "grad_norm": 0.16032427549362183, "learning_rate": 1.8002269451344807e-05, "loss": 0.4831, "mean_token_accuracy": 0.8457691632211208, "num_tokens": 853361944.0, "step": 26738 }, { "entropy": 0.5758383786305785, "epoch": 2.460123863577553, "grad_norm": 0.16921909153461456, "learning_rate": 1.7999202625203178e-05, "loss": 0.5614, "mean_token_accuracy": 0.8210838846862316, "num_tokens": 853393364.0, "step": 26739 }, { "entropy": 0.49434982892125845, "epoch": 2.460215869948994, "grad_norm": 0.15700605511665344, "learning_rate": 1.7996135799061553e-05, "loss": 0.4838, "mean_token_accuracy": 0.849987305700779, "num_tokens": 853425917.0, "step": 26740 }, { "entropy": 0.5575208757072687, "epoch": 2.460307876320435, "grad_norm": 0.16908203065395355, "learning_rate": 1.7993068972919927e-05, "loss": 0.5525, "mean_token_accuracy": 0.8248108439147472, "num_tokens": 853458070.0, "step": 26741 }, { "entropy": 0.42944913264364004, "epoch": 2.4603998826918763, "grad_norm": 0.15262503921985626, "learning_rate": 1.7990002146778302e-05, "loss": 0.4256, "mean_token_accuracy": 0.865144319832325, "num_tokens": 853489718.0, "step": 26742 }, { "entropy": 0.5572548545897007, "epoch": 2.4604918890633174, "grad_norm": 0.17130818963050842, "learning_rate": 1.7986935320636673e-05, "loss": 0.5491, "mean_token_accuracy": 0.8275665417313576, "num_tokens": 853521123.0, "step": 26743 }, { "entropy": 0.541086355689913, "epoch": 2.460583895434759, "grad_norm": 0.16585274040699005, "learning_rate": 1.7983868494495048e-05, "loss": 0.5289, "mean_token_accuracy": 0.8331703953444958, "num_tokens": 853552789.0, "step": 26744 }, { "entropy": 0.4416524115949869, "epoch": 2.4606759018062, "grad_norm": 0.15015777945518494, "learning_rate": 1.7980801668353422e-05, "loss": 0.4382, "mean_token_accuracy": 0.8603246323764324, "num_tokens": 853585492.0, "step": 26745 }, { "entropy": 0.47589577082544565, "epoch": 2.4607679081776412, "grad_norm": 0.15468673408031464, "learning_rate": 1.7977734842211797e-05, "loss": 0.4734, "mean_token_accuracy": 0.8507549874484539, "num_tokens": 853618003.0, "step": 26746 }, { "entropy": 0.5205119354650378, "epoch": 2.4608599145490824, "grad_norm": 0.1628328114748001, "learning_rate": 1.797466801607017e-05, "loss": 0.51, "mean_token_accuracy": 0.8406395614147186, "num_tokens": 853649672.0, "step": 26747 }, { "entropy": 0.5196724133566022, "epoch": 2.4609519209205235, "grad_norm": 0.15883246064186096, "learning_rate": 1.7971601189928543e-05, "loss": 0.5031, "mean_token_accuracy": 0.8413500972092152, "num_tokens": 853681980.0, "step": 26748 }, { "entropy": 0.4974817130714655, "epoch": 2.461043927291965, "grad_norm": 0.16113708913326263, "learning_rate": 1.7968534363786918e-05, "loss": 0.4847, "mean_token_accuracy": 0.8438088856637478, "num_tokens": 853713022.0, "step": 26749 }, { "entropy": 0.4701250554062426, "epoch": 2.461135933663406, "grad_norm": 0.1585799604654312, "learning_rate": 1.7965467537645292e-05, "loss": 0.4521, "mean_token_accuracy": 0.8541697971522808, "num_tokens": 853744197.0, "step": 26750 }, { "entropy": 0.40619861287996173, "epoch": 2.4612279400348474, "grad_norm": 0.14809933304786682, "learning_rate": 1.7962400711503667e-05, "loss": 0.3988, "mean_token_accuracy": 0.8691612631082535, "num_tokens": 853776488.0, "step": 26751 }, { "entropy": 0.4671705085784197, "epoch": 2.4613199464062885, "grad_norm": 0.14678601920604706, "learning_rate": 1.7959333885362038e-05, "loss": 0.4497, "mean_token_accuracy": 0.8544729575514793, "num_tokens": 853808681.0, "step": 26752 }, { "entropy": 0.5273145223036408, "epoch": 2.4614119527777296, "grad_norm": 0.15582334995269775, "learning_rate": 1.7956267059220413e-05, "loss": 0.5125, "mean_token_accuracy": 0.8389767222106457, "num_tokens": 853840684.0, "step": 26753 }, { "entropy": 0.44650526950135827, "epoch": 2.461503959149171, "grad_norm": 0.15448634326457977, "learning_rate": 1.7953200233078787e-05, "loss": 0.4347, "mean_token_accuracy": 0.8547153547406197, "num_tokens": 853872477.0, "step": 26754 }, { "entropy": 0.49122015945613384, "epoch": 2.4615959655206123, "grad_norm": 0.15399539470672607, "learning_rate": 1.7950133406937162e-05, "loss": 0.4726, "mean_token_accuracy": 0.8498180396854877, "num_tokens": 853904114.0, "step": 26755 }, { "entropy": 0.4990622114855796, "epoch": 2.4616879718920535, "grad_norm": 0.15320375561714172, "learning_rate": 1.7947066580795537e-05, "loss": 0.478, "mean_token_accuracy": 0.8468683958053589, "num_tokens": 853935746.0, "step": 26756 }, { "entropy": 0.5828517116606236, "epoch": 2.4617799782634946, "grad_norm": 0.17054755985736847, "learning_rate": 1.7943999754653908e-05, "loss": 0.5847, "mean_token_accuracy": 0.8172935917973518, "num_tokens": 853968514.0, "step": 26757 }, { "entropy": 0.5114091522991657, "epoch": 2.4618719846349357, "grad_norm": 0.1600644290447235, "learning_rate": 1.7940932928512283e-05, "loss": 0.4935, "mean_token_accuracy": 0.842549379914999, "num_tokens": 854000715.0, "step": 26758 }, { "entropy": 0.47866894002072513, "epoch": 2.4619639910063773, "grad_norm": 0.15746648609638214, "learning_rate": 1.7937866102370657e-05, "loss": 0.4648, "mean_token_accuracy": 0.8499566800892353, "num_tokens": 854032676.0, "step": 26759 }, { "entropy": 0.5750427972525358, "epoch": 2.4620559973778184, "grad_norm": 0.16626141965389252, "learning_rate": 1.7934799276229032e-05, "loss": 0.5664, "mean_token_accuracy": 0.8254901729524136, "num_tokens": 854065120.0, "step": 26760 }, { "entropy": 0.5391187081113458, "epoch": 2.4621480037492596, "grad_norm": 0.16305436193943024, "learning_rate": 1.7931732450087403e-05, "loss": 0.5333, "mean_token_accuracy": 0.8318696655333042, "num_tokens": 854096713.0, "step": 26761 }, { "entropy": 0.5070473055820912, "epoch": 2.4622400101207007, "grad_norm": 0.15650096535682678, "learning_rate": 1.7928665623945778e-05, "loss": 0.4873, "mean_token_accuracy": 0.8449875079095364, "num_tokens": 854128276.0, "step": 26762 }, { "entropy": 0.6317997016012669, "epoch": 2.462332016492142, "grad_norm": 0.1696479320526123, "learning_rate": 1.7925598797804152e-05, "loss": 0.6162, "mean_token_accuracy": 0.8063080683350563, "num_tokens": 854160606.0, "step": 26763 }, { "entropy": 0.5073451511561871, "epoch": 2.4624240228635834, "grad_norm": 0.16625508666038513, "learning_rate": 1.7922531971662527e-05, "loss": 0.4999, "mean_token_accuracy": 0.8463749028742313, "num_tokens": 854192865.0, "step": 26764 }, { "entropy": 0.5083900894969702, "epoch": 2.4625160292350246, "grad_norm": 0.16229355335235596, "learning_rate": 1.79194651455209e-05, "loss": 0.4879, "mean_token_accuracy": 0.8426254913210869, "num_tokens": 854224770.0, "step": 26765 }, { "entropy": 0.47985936515033245, "epoch": 2.4626080356064657, "grad_norm": 0.15406718850135803, "learning_rate": 1.7916398319379273e-05, "loss": 0.4668, "mean_token_accuracy": 0.8493351712822914, "num_tokens": 854257004.0, "step": 26766 }, { "entropy": 0.510482863523066, "epoch": 2.462700041977907, "grad_norm": 0.15946565568447113, "learning_rate": 1.791333149323765e-05, "loss": 0.4839, "mean_token_accuracy": 0.8439178541302681, "num_tokens": 854287521.0, "step": 26767 }, { "entropy": 0.4842119636014104, "epoch": 2.462792048349348, "grad_norm": 0.15466271340847015, "learning_rate": 1.7910264667096026e-05, "loss": 0.4769, "mean_token_accuracy": 0.8495886214077473, "num_tokens": 854319648.0, "step": 26768 }, { "entropy": 0.49842571280896664, "epoch": 2.4628840547207895, "grad_norm": 0.15572020411491394, "learning_rate": 1.7907197840954397e-05, "loss": 0.4856, "mean_token_accuracy": 0.846385546028614, "num_tokens": 854351747.0, "step": 26769 }, { "entropy": 0.47517778910696507, "epoch": 2.4629760610922307, "grad_norm": 0.15338382124900818, "learning_rate": 1.790413101481277e-05, "loss": 0.4638, "mean_token_accuracy": 0.8530594184994698, "num_tokens": 854384502.0, "step": 26770 }, { "entropy": 0.6280003990978003, "epoch": 2.463068067463672, "grad_norm": 0.16850262880325317, "learning_rate": 1.7901064188671146e-05, "loss": 0.611, "mean_token_accuracy": 0.8076197728514671, "num_tokens": 854416710.0, "step": 26771 }, { "entropy": 0.5230775522068143, "epoch": 2.463160073835113, "grad_norm": 0.16641362011432648, "learning_rate": 1.789799736252952e-05, "loss": 0.5132, "mean_token_accuracy": 0.83647620677948, "num_tokens": 854448067.0, "step": 26772 }, { "entropy": 0.5027418369427323, "epoch": 2.463252080206554, "grad_norm": 0.1619746834039688, "learning_rate": 1.7894930536387892e-05, "loss": 0.4922, "mean_token_accuracy": 0.8413928486406803, "num_tokens": 854480055.0, "step": 26773 }, { "entropy": 0.5062570357695222, "epoch": 2.4633440865779956, "grad_norm": 0.15692052245140076, "learning_rate": 1.7891863710246267e-05, "loss": 0.4975, "mean_token_accuracy": 0.8425074107944965, "num_tokens": 854512474.0, "step": 26774 }, { "entropy": 0.5411133859306574, "epoch": 2.4634360929494368, "grad_norm": 0.16477133333683014, "learning_rate": 1.788879688410464e-05, "loss": 0.537, "mean_token_accuracy": 0.8276866786181927, "num_tokens": 854544264.0, "step": 26775 }, { "entropy": 0.6088929194957018, "epoch": 2.463528099320878, "grad_norm": 0.17120255529880524, "learning_rate": 1.7885730057963016e-05, "loss": 0.593, "mean_token_accuracy": 0.8119924701750278, "num_tokens": 854576180.0, "step": 26776 }, { "entropy": 0.5429066261276603, "epoch": 2.463620105692319, "grad_norm": 0.16181637346744537, "learning_rate": 1.788266323182139e-05, "loss": 0.5287, "mean_token_accuracy": 0.8287947177886963, "num_tokens": 854608475.0, "step": 26777 }, { "entropy": 0.5277280155569315, "epoch": 2.46371211206376, "grad_norm": 0.16398608684539795, "learning_rate": 1.7879596405679762e-05, "loss": 0.5129, "mean_token_accuracy": 0.8373169302940369, "num_tokens": 854640516.0, "step": 26778 }, { "entropy": 0.544672878459096, "epoch": 2.4638041184352018, "grad_norm": 0.1708213984966278, "learning_rate": 1.7876529579538137e-05, "loss": 0.5427, "mean_token_accuracy": 0.8303838558495045, "num_tokens": 854671912.0, "step": 26779 }, { "entropy": 0.4967766311019659, "epoch": 2.463896124806643, "grad_norm": 0.1548825353384018, "learning_rate": 1.787346275339651e-05, "loss": 0.4913, "mean_token_accuracy": 0.841691829264164, "num_tokens": 854703895.0, "step": 26780 }, { "entropy": 0.5725725200027227, "epoch": 2.463988131178084, "grad_norm": 0.1697545200586319, "learning_rate": 1.7870395927254886e-05, "loss": 0.5596, "mean_token_accuracy": 0.8214158862829208, "num_tokens": 854735731.0, "step": 26781 }, { "entropy": 0.5847976990044117, "epoch": 2.464080137549525, "grad_norm": 0.16844215989112854, "learning_rate": 1.7867329101113257e-05, "loss": 0.5767, "mean_token_accuracy": 0.8168876431882381, "num_tokens": 854767079.0, "step": 26782 }, { "entropy": 0.5666276002302766, "epoch": 2.4641721439209663, "grad_norm": 0.17095205187797546, "learning_rate": 1.7864262274971632e-05, "loss": 0.5626, "mean_token_accuracy": 0.8197958990931511, "num_tokens": 854799341.0, "step": 26783 }, { "entropy": 0.43518006429076195, "epoch": 2.464264150292408, "grad_norm": 0.14805176854133606, "learning_rate": 1.7861195448830007e-05, "loss": 0.4246, "mean_token_accuracy": 0.8650886788964272, "num_tokens": 854831402.0, "step": 26784 }, { "entropy": 0.4661131100729108, "epoch": 2.464356156663849, "grad_norm": 0.15333832800388336, "learning_rate": 1.785812862268838e-05, "loss": 0.4557, "mean_token_accuracy": 0.8535229153931141, "num_tokens": 854863738.0, "step": 26785 }, { "entropy": 0.5533495144918561, "epoch": 2.46444816303529, "grad_norm": 0.16644369065761566, "learning_rate": 1.7855061796546756e-05, "loss": 0.5301, "mean_token_accuracy": 0.8330163285136223, "num_tokens": 854895318.0, "step": 26786 }, { "entropy": 0.5866133654490113, "epoch": 2.4645401694067313, "grad_norm": 0.1635887622833252, "learning_rate": 1.7851994970405127e-05, "loss": 0.5705, "mean_token_accuracy": 0.8220289498567581, "num_tokens": 854927917.0, "step": 26787 }, { "entropy": 0.547867439687252, "epoch": 2.4646321757781724, "grad_norm": 0.1587936133146286, "learning_rate": 1.7848928144263502e-05, "loss": 0.5412, "mean_token_accuracy": 0.8324003517627716, "num_tokens": 854960395.0, "step": 26788 }, { "entropy": 0.5298930983990431, "epoch": 2.464724182149614, "grad_norm": 0.16291746497154236, "learning_rate": 1.7845861318121876e-05, "loss": 0.5208, "mean_token_accuracy": 0.8359316810965538, "num_tokens": 854991796.0, "step": 26789 }, { "entropy": 0.5475696511566639, "epoch": 2.464816188521055, "grad_norm": 0.1635655164718628, "learning_rate": 1.784279449198025e-05, "loss": 0.5418, "mean_token_accuracy": 0.8322382867336273, "num_tokens": 855024331.0, "step": 26790 }, { "entropy": 0.4737059115432203, "epoch": 2.4649081948924962, "grad_norm": 0.1570877730846405, "learning_rate": 1.7839727665838622e-05, "loss": 0.4568, "mean_token_accuracy": 0.8535628654062748, "num_tokens": 855055816.0, "step": 26791 }, { "entropy": 0.5730172470211983, "epoch": 2.4650002012639374, "grad_norm": 0.16424442827701569, "learning_rate": 1.7836660839696997e-05, "loss": 0.5617, "mean_token_accuracy": 0.8215620703995228, "num_tokens": 855088399.0, "step": 26792 }, { "entropy": 0.4840606590732932, "epoch": 2.4650922076353785, "grad_norm": 0.15537512302398682, "learning_rate": 1.783359401355537e-05, "loss": 0.479, "mean_token_accuracy": 0.8468677625060081, "num_tokens": 855121003.0, "step": 26793 }, { "entropy": 0.54824208188802, "epoch": 2.46518421400682, "grad_norm": 0.16380780935287476, "learning_rate": 1.7830527187413746e-05, "loss": 0.5469, "mean_token_accuracy": 0.830609604716301, "num_tokens": 855153585.0, "step": 26794 }, { "entropy": 0.45554118510335684, "epoch": 2.465276220378261, "grad_norm": 0.15032505989074707, "learning_rate": 1.7827460361272117e-05, "loss": 0.4438, "mean_token_accuracy": 0.8568514063954353, "num_tokens": 855186044.0, "step": 26795 }, { "entropy": 0.5311324959620833, "epoch": 2.4653682267497024, "grad_norm": 0.1627340465784073, "learning_rate": 1.7824393535130492e-05, "loss": 0.5214, "mean_token_accuracy": 0.8329229801893234, "num_tokens": 855217767.0, "step": 26796 }, { "entropy": 0.6566183101385832, "epoch": 2.4654602331211435, "grad_norm": 0.17668990790843964, "learning_rate": 1.7821326708988867e-05, "loss": 0.6514, "mean_token_accuracy": 0.7951206639409065, "num_tokens": 855249523.0, "step": 26797 }, { "entropy": 0.504728083498776, "epoch": 2.4655522394925846, "grad_norm": 0.16358482837677002, "learning_rate": 1.7818259882847245e-05, "loss": 0.4881, "mean_token_accuracy": 0.8418394960463047, "num_tokens": 855281505.0, "step": 26798 }, { "entropy": 0.5268937461078167, "epoch": 2.465644245864026, "grad_norm": 0.16519950330257416, "learning_rate": 1.7815193056705616e-05, "loss": 0.515, "mean_token_accuracy": 0.8362377323210239, "num_tokens": 855313326.0, "step": 26799 }, { "entropy": 0.643142681568861, "epoch": 2.4657362522354673, "grad_norm": 0.1701156497001648, "learning_rate": 1.781212623056399e-05, "loss": 0.6199, "mean_token_accuracy": 0.8033558875322342, "num_tokens": 855345168.0, "step": 26800 }, { "entropy": 0.5145516963675618, "epoch": 2.4658282586069085, "grad_norm": 0.1631576120853424, "learning_rate": 1.7809059404422365e-05, "loss": 0.4986, "mean_token_accuracy": 0.8403853438794613, "num_tokens": 855376327.0, "step": 26801 }, { "entropy": 0.46397147607058287, "epoch": 2.4659202649783496, "grad_norm": 0.15421009063720703, "learning_rate": 1.780599257828074e-05, "loss": 0.4595, "mean_token_accuracy": 0.8528709448873997, "num_tokens": 855408130.0, "step": 26802 }, { "entropy": 0.5533314580097795, "epoch": 2.4660122713497907, "grad_norm": 0.16541776061058044, "learning_rate": 1.780292575213911e-05, "loss": 0.5449, "mean_token_accuracy": 0.8289039097726345, "num_tokens": 855440129.0, "step": 26803 }, { "entropy": 0.5536783412098885, "epoch": 2.4661042777212323, "grad_norm": 0.17046047747135162, "learning_rate": 1.7799858925997486e-05, "loss": 0.541, "mean_token_accuracy": 0.8250796012580395, "num_tokens": 855471553.0, "step": 26804 }, { "entropy": 0.615309719927609, "epoch": 2.4661962840926734, "grad_norm": 0.17470000684261322, "learning_rate": 1.779679209985586e-05, "loss": 0.6123, "mean_token_accuracy": 0.8098565638065338, "num_tokens": 855502540.0, "step": 26805 }, { "entropy": 0.4959853107575327, "epoch": 2.4662882904641146, "grad_norm": 0.14972001314163208, "learning_rate": 1.7793725273714235e-05, "loss": 0.4796, "mean_token_accuracy": 0.8507314547896385, "num_tokens": 855535089.0, "step": 26806 }, { "entropy": 0.5359093081206083, "epoch": 2.4663802968355557, "grad_norm": 0.1625102311372757, "learning_rate": 1.779065844757261e-05, "loss": 0.5153, "mean_token_accuracy": 0.8353929854929447, "num_tokens": 855566933.0, "step": 26807 }, { "entropy": 0.5724209994077682, "epoch": 2.466472303206997, "grad_norm": 0.16647639870643616, "learning_rate": 1.778759162143098e-05, "loss": 0.5623, "mean_token_accuracy": 0.8217633590102196, "num_tokens": 855598378.0, "step": 26808 }, { "entropy": 0.5279050897806883, "epoch": 2.4665643095784384, "grad_norm": 0.16215939819812775, "learning_rate": 1.7784524795289356e-05, "loss": 0.5136, "mean_token_accuracy": 0.8395560085773468, "num_tokens": 855630001.0, "step": 26809 }, { "entropy": 0.4911066599888727, "epoch": 2.4666563159498796, "grad_norm": 0.15347404778003693, "learning_rate": 1.778145796914773e-05, "loss": 0.4725, "mean_token_accuracy": 0.8510889373719692, "num_tokens": 855661800.0, "step": 26810 }, { "entropy": 0.5129545191302896, "epoch": 2.4667483223213207, "grad_norm": 0.15787404775619507, "learning_rate": 1.7778391143006105e-05, "loss": 0.5084, "mean_token_accuracy": 0.8364833071827888, "num_tokens": 855693752.0, "step": 26811 }, { "entropy": 0.585635619238019, "epoch": 2.466840328692762, "grad_norm": 0.16540351510047913, "learning_rate": 1.7775324316864476e-05, "loss": 0.5772, "mean_token_accuracy": 0.8187939487397671, "num_tokens": 855726146.0, "step": 26812 }, { "entropy": 0.4776221443898976, "epoch": 2.466932335064203, "grad_norm": 0.15724334120750427, "learning_rate": 1.777225749072285e-05, "loss": 0.4792, "mean_token_accuracy": 0.8500911593437195, "num_tokens": 855758071.0, "step": 26813 }, { "entropy": 0.49374441197142005, "epoch": 2.4670243414356445, "grad_norm": 0.15939593315124512, "learning_rate": 1.7769190664581226e-05, "loss": 0.4736, "mean_token_accuracy": 0.8482744619250298, "num_tokens": 855789330.0, "step": 26814 }, { "entropy": 0.5852363333106041, "epoch": 2.4671163478070857, "grad_norm": 0.17163397371768951, "learning_rate": 1.77661238384396e-05, "loss": 0.5796, "mean_token_accuracy": 0.8146022483706474, "num_tokens": 855820889.0, "step": 26815 }, { "entropy": 0.38054176000878215, "epoch": 2.467208354178527, "grad_norm": 0.14373750984668732, "learning_rate": 1.7763057012297975e-05, "loss": 0.3725, "mean_token_accuracy": 0.8822458535432816, "num_tokens": 855852980.0, "step": 26816 }, { "entropy": 0.4795304290018976, "epoch": 2.467300360549968, "grad_norm": 0.15225303173065186, "learning_rate": 1.7759990186156346e-05, "loss": 0.4691, "mean_token_accuracy": 0.8526782505214214, "num_tokens": 855885299.0, "step": 26817 }, { "entropy": 0.5317700689192861, "epoch": 2.467392366921409, "grad_norm": 0.15999403595924377, "learning_rate": 1.775692336001472e-05, "loss": 0.5195, "mean_token_accuracy": 0.8345112912356853, "num_tokens": 855916728.0, "step": 26818 }, { "entropy": 0.5544528216123581, "epoch": 2.4674843732928506, "grad_norm": 0.16487745940685272, "learning_rate": 1.7753856533873095e-05, "loss": 0.5488, "mean_token_accuracy": 0.8272390030324459, "num_tokens": 855947948.0, "step": 26819 }, { "entropy": 0.5277422210201621, "epoch": 2.4675763796642918, "grad_norm": 0.16429874300956726, "learning_rate": 1.775078970773147e-05, "loss": 0.5186, "mean_token_accuracy": 0.836632139980793, "num_tokens": 855979719.0, "step": 26820 }, { "entropy": 0.48772989632561803, "epoch": 2.467668386035733, "grad_norm": 0.15765351057052612, "learning_rate": 1.774772288158984e-05, "loss": 0.4783, "mean_token_accuracy": 0.8474642634391785, "num_tokens": 856011819.0, "step": 26821 }, { "entropy": 0.5292754014953971, "epoch": 2.467760392407174, "grad_norm": 0.1641819328069687, "learning_rate": 1.7744656055448216e-05, "loss": 0.5148, "mean_token_accuracy": 0.8372265249490738, "num_tokens": 856043942.0, "step": 26822 }, { "entropy": 0.47202615067362785, "epoch": 2.467852398778615, "grad_norm": 0.15231028199195862, "learning_rate": 1.774158922930659e-05, "loss": 0.4548, "mean_token_accuracy": 0.85714515671134, "num_tokens": 856075925.0, "step": 26823 }, { "entropy": 0.5043285945430398, "epoch": 2.4679444051500568, "grad_norm": 0.16083568334579468, "learning_rate": 1.7738522403164965e-05, "loss": 0.4959, "mean_token_accuracy": 0.8408990725874901, "num_tokens": 856107212.0, "step": 26824 }, { "entropy": 0.5750737767666578, "epoch": 2.468036411521498, "grad_norm": 0.16571129858493805, "learning_rate": 1.773545557702334e-05, "loss": 0.565, "mean_token_accuracy": 0.8227071389555931, "num_tokens": 856139087.0, "step": 26825 }, { "entropy": 0.5122892577201128, "epoch": 2.468128417892939, "grad_norm": 0.15795673429965973, "learning_rate": 1.773238875088171e-05, "loss": 0.5008, "mean_token_accuracy": 0.8403066918253899, "num_tokens": 856171409.0, "step": 26826 }, { "entropy": 0.5542438719421625, "epoch": 2.46822042426438, "grad_norm": 0.16375865042209625, "learning_rate": 1.7729321924740086e-05, "loss": 0.5435, "mean_token_accuracy": 0.8271817266941071, "num_tokens": 856203950.0, "step": 26827 }, { "entropy": 0.5793125480413437, "epoch": 2.4683124306358213, "grad_norm": 0.16501984000205994, "learning_rate": 1.7726255098598464e-05, "loss": 0.5616, "mean_token_accuracy": 0.8237934224307537, "num_tokens": 856235978.0, "step": 26828 }, { "entropy": 0.5205903127789497, "epoch": 2.468404437007263, "grad_norm": 0.1639954149723053, "learning_rate": 1.7723188272456835e-05, "loss": 0.4956, "mean_token_accuracy": 0.8447838164865971, "num_tokens": 856267504.0, "step": 26829 }, { "entropy": 0.504973940551281, "epoch": 2.468496443378704, "grad_norm": 0.16268205642700195, "learning_rate": 1.772012144631521e-05, "loss": 0.4937, "mean_token_accuracy": 0.8424904569983482, "num_tokens": 856299819.0, "step": 26830 }, { "entropy": 0.5243184873834252, "epoch": 2.468588449750145, "grad_norm": 0.1647782325744629, "learning_rate": 1.7717054620173584e-05, "loss": 0.5064, "mean_token_accuracy": 0.8386669717729092, "num_tokens": 856331984.0, "step": 26831 }, { "entropy": 0.5613729069009423, "epoch": 2.4686804561215863, "grad_norm": 0.1722932904958725, "learning_rate": 1.771398779403196e-05, "loss": 0.5447, "mean_token_accuracy": 0.827180240303278, "num_tokens": 856363746.0, "step": 26832 }, { "entropy": 0.4844993338920176, "epoch": 2.4687724624930274, "grad_norm": 0.15362945199012756, "learning_rate": 1.7710920967890334e-05, "loss": 0.4676, "mean_token_accuracy": 0.8497374504804611, "num_tokens": 856395763.0, "step": 26833 }, { "entropy": 0.5378889236599207, "epoch": 2.468864468864469, "grad_norm": 0.1664133220911026, "learning_rate": 1.7707854141748705e-05, "loss": 0.5235, "mean_token_accuracy": 0.8322470225393772, "num_tokens": 856427860.0, "step": 26834 }, { "entropy": 0.5713976714760065, "epoch": 2.46895647523591, "grad_norm": 0.16656608879566193, "learning_rate": 1.770478731560708e-05, "loss": 0.559, "mean_token_accuracy": 0.8263789862394333, "num_tokens": 856460241.0, "step": 26835 }, { "entropy": 0.40388107392936945, "epoch": 2.4690484816073512, "grad_norm": 0.13700446486473083, "learning_rate": 1.7701720489465454e-05, "loss": 0.3864, "mean_token_accuracy": 0.8778172470629215, "num_tokens": 856492085.0, "step": 26836 }, { "entropy": 0.4982284919824451, "epoch": 2.4691404879787924, "grad_norm": 0.16251473128795624, "learning_rate": 1.769865366332383e-05, "loss": 0.4909, "mean_token_accuracy": 0.8412791155278683, "num_tokens": 856522849.0, "step": 26837 }, { "entropy": 0.378075132612139, "epoch": 2.4692324943502335, "grad_norm": 0.1376480758190155, "learning_rate": 1.76955868371822e-05, "loss": 0.3573, "mean_token_accuracy": 0.882509671151638, "num_tokens": 856554764.0, "step": 26838 }, { "entropy": 0.5312943514436483, "epoch": 2.469324500721675, "grad_norm": 0.16029033064842224, "learning_rate": 1.7692520011040575e-05, "loss": 0.5165, "mean_token_accuracy": 0.8349984176456928, "num_tokens": 856586911.0, "step": 26839 }, { "entropy": 0.4998412299901247, "epoch": 2.469416507093116, "grad_norm": 0.1555105596780777, "learning_rate": 1.768945318489895e-05, "loss": 0.4885, "mean_token_accuracy": 0.8433176688849926, "num_tokens": 856618569.0, "step": 26840 }, { "entropy": 0.4931703981710598, "epoch": 2.4695085134645574, "grad_norm": 0.1579950600862503, "learning_rate": 1.7686386358757324e-05, "loss": 0.4822, "mean_token_accuracy": 0.844871811568737, "num_tokens": 856650605.0, "step": 26841 }, { "entropy": 0.5284779686480761, "epoch": 2.4696005198359985, "grad_norm": 0.1639154553413391, "learning_rate": 1.7683319532615695e-05, "loss": 0.5152, "mean_token_accuracy": 0.8344172164797783, "num_tokens": 856681845.0, "step": 26842 }, { "entropy": 0.36085614119656384, "epoch": 2.4696925262074396, "grad_norm": 0.13846448063850403, "learning_rate": 1.768025270647407e-05, "loss": 0.347, "mean_token_accuracy": 0.8877190798521042, "num_tokens": 856714239.0, "step": 26843 }, { "entropy": 0.49424982629716396, "epoch": 2.469784532578881, "grad_norm": 0.16110427677631378, "learning_rate": 1.7677185880332445e-05, "loss": 0.491, "mean_token_accuracy": 0.8399295583367348, "num_tokens": 856745898.0, "step": 26844 }, { "entropy": 0.49334901105612516, "epoch": 2.4698765389503223, "grad_norm": 0.15201137959957123, "learning_rate": 1.767411905419082e-05, "loss": 0.4805, "mean_token_accuracy": 0.8473118953406811, "num_tokens": 856778352.0, "step": 26845 }, { "entropy": 0.5110820913687348, "epoch": 2.4699685453217635, "grad_norm": 0.15845634043216705, "learning_rate": 1.7671052228049194e-05, "loss": 0.5061, "mean_token_accuracy": 0.8370517082512379, "num_tokens": 856810445.0, "step": 26846 }, { "entropy": 0.433079665992409, "epoch": 2.4700605516932046, "grad_norm": 0.1469019055366516, "learning_rate": 1.7667985401907565e-05, "loss": 0.4179, "mean_token_accuracy": 0.8657020814716816, "num_tokens": 856842177.0, "step": 26847 }, { "entropy": 0.43781242007389665, "epoch": 2.4701525580646457, "grad_norm": 0.14736665785312653, "learning_rate": 1.766491857576594e-05, "loss": 0.4245, "mean_token_accuracy": 0.8655923902988434, "num_tokens": 856874778.0, "step": 26848 }, { "entropy": 0.5167842591181397, "epoch": 2.4702445644360873, "grad_norm": 0.15385569632053375, "learning_rate": 1.7661851749624315e-05, "loss": 0.5063, "mean_token_accuracy": 0.8389474712312222, "num_tokens": 856907065.0, "step": 26849 }, { "entropy": 0.5185169437900186, "epoch": 2.4703365708075284, "grad_norm": 0.15908579528331757, "learning_rate": 1.765878492348269e-05, "loss": 0.5119, "mean_token_accuracy": 0.8371010199189186, "num_tokens": 856939380.0, "step": 26850 }, { "entropy": 0.5756661877967417, "epoch": 2.4704285771789696, "grad_norm": 0.16491323709487915, "learning_rate": 1.765571809734106e-05, "loss": 0.56, "mean_token_accuracy": 0.8220053240656853, "num_tokens": 856971196.0, "step": 26851 }, { "entropy": 0.5825381129980087, "epoch": 2.4705205835504107, "grad_norm": 0.16729949414730072, "learning_rate": 1.7652651271199435e-05, "loss": 0.5639, "mean_token_accuracy": 0.8206972442567348, "num_tokens": 857002171.0, "step": 26852 }, { "entropy": 0.5776198515668511, "epoch": 2.470612589921852, "grad_norm": 0.1713983118534088, "learning_rate": 1.764958444505781e-05, "loss": 0.5711, "mean_token_accuracy": 0.8190323896706104, "num_tokens": 857034382.0, "step": 26853 }, { "entropy": 0.5582004999741912, "epoch": 2.4707045962932934, "grad_norm": 0.16391275823116302, "learning_rate": 1.7646517618916184e-05, "loss": 0.5576, "mean_token_accuracy": 0.8244739510118961, "num_tokens": 857066822.0, "step": 26854 }, { "entropy": 0.54944814927876, "epoch": 2.4707966026647346, "grad_norm": 0.1637251228094101, "learning_rate": 1.764345079277456e-05, "loss": 0.5346, "mean_token_accuracy": 0.8291910588741302, "num_tokens": 857099161.0, "step": 26855 }, { "entropy": 0.5392610523849726, "epoch": 2.4708886090361757, "grad_norm": 0.1610684096813202, "learning_rate": 1.764038396663293e-05, "loss": 0.5315, "mean_token_accuracy": 0.8312616050243378, "num_tokens": 857130839.0, "step": 26856 }, { "entropy": 0.40309116896241903, "epoch": 2.470980615407617, "grad_norm": 0.14797434210777283, "learning_rate": 1.7637317140491305e-05, "loss": 0.3892, "mean_token_accuracy": 0.8739227056503296, "num_tokens": 857162805.0, "step": 26857 }, { "entropy": 0.617240134626627, "epoch": 2.471072621779058, "grad_norm": 0.16941772401332855, "learning_rate": 1.763425031434968e-05, "loss": 0.6089, "mean_token_accuracy": 0.8095221631228924, "num_tokens": 857195256.0, "step": 26858 }, { "entropy": 0.5587872546166182, "epoch": 2.4711646281504995, "grad_norm": 0.1703302413225174, "learning_rate": 1.7631183488208054e-05, "loss": 0.548, "mean_token_accuracy": 0.8235754035413265, "num_tokens": 857227423.0, "step": 26859 }, { "entropy": 0.6001679757609963, "epoch": 2.4712566345219407, "grad_norm": 0.16930729150772095, "learning_rate": 1.762811666206643e-05, "loss": 0.5838, "mean_token_accuracy": 0.8155282139778137, "num_tokens": 857259834.0, "step": 26860 }, { "entropy": 0.464911344810389, "epoch": 2.471348640893382, "grad_norm": 0.1493925005197525, "learning_rate": 1.7625049835924804e-05, "loss": 0.451, "mean_token_accuracy": 0.8586611747741699, "num_tokens": 857292228.0, "step": 26861 }, { "entropy": 0.4495681303087622, "epoch": 2.471440647264823, "grad_norm": 0.15550467371940613, "learning_rate": 1.7621983009783178e-05, "loss": 0.4407, "mean_token_accuracy": 0.8592879213392735, "num_tokens": 857323735.0, "step": 26862 }, { "entropy": 0.5394686833024025, "epoch": 2.471532653636264, "grad_norm": 0.16567540168762207, "learning_rate": 1.7618916183641553e-05, "loss": 0.5432, "mean_token_accuracy": 0.8341378830373287, "num_tokens": 857355799.0, "step": 26863 }, { "entropy": 0.5799036622047424, "epoch": 2.4716246600077056, "grad_norm": 0.1687679886817932, "learning_rate": 1.7615849357499924e-05, "loss": 0.5668, "mean_token_accuracy": 0.8211125954985619, "num_tokens": 857387844.0, "step": 26864 }, { "entropy": 0.5607181619852781, "epoch": 2.4717166663791468, "grad_norm": 0.16650834679603577, "learning_rate": 1.76127825313583e-05, "loss": 0.5457, "mean_token_accuracy": 0.8290707804262638, "num_tokens": 857419317.0, "step": 26865 }, { "entropy": 0.5486329551786184, "epoch": 2.471808672750588, "grad_norm": 0.16197045147418976, "learning_rate": 1.7609715705216673e-05, "loss": 0.5276, "mean_token_accuracy": 0.8324611335992813, "num_tokens": 857451498.0, "step": 26866 }, { "entropy": 0.6059907842427492, "epoch": 2.471900679122029, "grad_norm": 0.17655432224273682, "learning_rate": 1.7606648879075048e-05, "loss": 0.5976, "mean_token_accuracy": 0.813653226941824, "num_tokens": 857482792.0, "step": 26867 }, { "entropy": 0.5520404493436217, "epoch": 2.47199268549347, "grad_norm": 0.16970349848270416, "learning_rate": 1.760358205293342e-05, "loss": 0.5424, "mean_token_accuracy": 0.8284584507346153, "num_tokens": 857514076.0, "step": 26868 }, { "entropy": 0.5436621569097042, "epoch": 2.4720846918649118, "grad_norm": 0.1599084585905075, "learning_rate": 1.7600515226791794e-05, "loss": 0.5374, "mean_token_accuracy": 0.8282278552651405, "num_tokens": 857546208.0, "step": 26869 }, { "entropy": 0.5761981420218945, "epoch": 2.472176698236353, "grad_norm": 0.16658565402030945, "learning_rate": 1.759744840065017e-05, "loss": 0.5595, "mean_token_accuracy": 0.8237046599388123, "num_tokens": 857578299.0, "step": 26870 }, { "entropy": 0.5674995081499219, "epoch": 2.472268704607794, "grad_norm": 0.16436941921710968, "learning_rate": 1.7594381574508543e-05, "loss": 0.5586, "mean_token_accuracy": 0.8225355967879295, "num_tokens": 857610687.0, "step": 26871 }, { "entropy": 0.5219568219035864, "epoch": 2.472360710979235, "grad_norm": 0.1590382605791092, "learning_rate": 1.7591314748366915e-05, "loss": 0.517, "mean_token_accuracy": 0.8366209305822849, "num_tokens": 857642927.0, "step": 26872 }, { "entropy": 0.5504006333649158, "epoch": 2.4724527173506763, "grad_norm": 0.1660768687725067, "learning_rate": 1.758824792222529e-05, "loss": 0.5416, "mean_token_accuracy": 0.8294902220368385, "num_tokens": 857675164.0, "step": 26873 }, { "entropy": 0.5456795445643365, "epoch": 2.472544723722118, "grad_norm": 0.16013352572917938, "learning_rate": 1.7585181096083664e-05, "loss": 0.5331, "mean_token_accuracy": 0.8357034511864185, "num_tokens": 857707708.0, "step": 26874 }, { "entropy": 0.4097641110420227, "epoch": 2.472636730093559, "grad_norm": 0.14573509991168976, "learning_rate": 1.758211426994204e-05, "loss": 0.404, "mean_token_accuracy": 0.8708170503377914, "num_tokens": 857740476.0, "step": 26875 }, { "entropy": 0.5197221552953124, "epoch": 2.472728736465, "grad_norm": 0.1615038514137268, "learning_rate": 1.7579047443800413e-05, "loss": 0.5053, "mean_token_accuracy": 0.8427731096744537, "num_tokens": 857771729.0, "step": 26876 }, { "entropy": 0.5779394768178463, "epoch": 2.4728207428364413, "grad_norm": 0.16897493600845337, "learning_rate": 1.7575980617658784e-05, "loss": 0.5744, "mean_token_accuracy": 0.8222194314002991, "num_tokens": 857803111.0, "step": 26877 }, { "entropy": 0.5326984254643321, "epoch": 2.4729127492078824, "grad_norm": 0.16437916457653046, "learning_rate": 1.757291379151716e-05, "loss": 0.5197, "mean_token_accuracy": 0.8346062377095222, "num_tokens": 857834323.0, "step": 26878 }, { "entropy": 0.48159098718315363, "epoch": 2.473004755579324, "grad_norm": 0.15267778933048248, "learning_rate": 1.7569846965375534e-05, "loss": 0.4697, "mean_token_accuracy": 0.8545452244579792, "num_tokens": 857866127.0, "step": 26879 }, { "entropy": 0.5861514067510143, "epoch": 2.473096761950765, "grad_norm": 0.17217664420604706, "learning_rate": 1.7566780139233908e-05, "loss": 0.5839, "mean_token_accuracy": 0.8178610503673553, "num_tokens": 857897513.0, "step": 26880 }, { "entropy": 0.568843842484057, "epoch": 2.4731887683222062, "grad_norm": 0.1694268435239792, "learning_rate": 1.756371331309228e-05, "loss": 0.5599, "mean_token_accuracy": 0.824450146406889, "num_tokens": 857928809.0, "step": 26881 }, { "entropy": 0.5587967485189438, "epoch": 2.4732807746936474, "grad_norm": 0.16616378724575043, "learning_rate": 1.7560646486950654e-05, "loss": 0.547, "mean_token_accuracy": 0.8285246826708317, "num_tokens": 857960764.0, "step": 26882 }, { "entropy": 0.48086500354111195, "epoch": 2.4733727810650885, "grad_norm": 0.15146487951278687, "learning_rate": 1.755757966080903e-05, "loss": 0.47, "mean_token_accuracy": 0.8501364029943943, "num_tokens": 857993171.0, "step": 26883 }, { "entropy": 0.47325235418975353, "epoch": 2.47346478743653, "grad_norm": 0.15795767307281494, "learning_rate": 1.7554512834667404e-05, "loss": 0.4617, "mean_token_accuracy": 0.8550068326294422, "num_tokens": 858025136.0, "step": 26884 }, { "entropy": 0.3901876574382186, "epoch": 2.473556793807971, "grad_norm": 0.14583104848861694, "learning_rate": 1.7551446008525778e-05, "loss": 0.3855, "mean_token_accuracy": 0.8733292035758495, "num_tokens": 858057357.0, "step": 26885 }, { "entropy": 0.5254912730306387, "epoch": 2.4736488001794124, "grad_norm": 0.16282010078430176, "learning_rate": 1.754837918238415e-05, "loss": 0.5056, "mean_token_accuracy": 0.8372178412973881, "num_tokens": 858089257.0, "step": 26886 }, { "entropy": 0.5618502739816904, "epoch": 2.4737408065508535, "grad_norm": 0.16059257090091705, "learning_rate": 1.7545312356242524e-05, "loss": 0.5393, "mean_token_accuracy": 0.8301367498934269, "num_tokens": 858121298.0, "step": 26887 }, { "entropy": 0.560957585927099, "epoch": 2.4738328129222946, "grad_norm": 0.17034606635570526, "learning_rate": 1.75422455301009e-05, "loss": 0.5533, "mean_token_accuracy": 0.8218100629746914, "num_tokens": 858153348.0, "step": 26888 }, { "entropy": 0.49748319014906883, "epoch": 2.473924819293736, "grad_norm": 0.1501895934343338, "learning_rate": 1.7539178703959273e-05, "loss": 0.4878, "mean_token_accuracy": 0.846405602991581, "num_tokens": 858185443.0, "step": 26889 }, { "entropy": 0.528194825630635, "epoch": 2.4740168256651773, "grad_norm": 0.16769009828567505, "learning_rate": 1.7536111877817648e-05, "loss": 0.5216, "mean_token_accuracy": 0.8341872468590736, "num_tokens": 858217706.0, "step": 26890 }, { "entropy": 0.4874874157831073, "epoch": 2.4741088320366185, "grad_norm": 0.15502001345157623, "learning_rate": 1.7533045051676023e-05, "loss": 0.468, "mean_token_accuracy": 0.8524917960166931, "num_tokens": 858249588.0, "step": 26891 }, { "entropy": 0.42766309226863086, "epoch": 2.4742008384080596, "grad_norm": 0.15220196545124054, "learning_rate": 1.7529978225534397e-05, "loss": 0.4076, "mean_token_accuracy": 0.8681859821081161, "num_tokens": 858280935.0, "step": 26892 }, { "entropy": 0.5191182196140289, "epoch": 2.4742928447795007, "grad_norm": 0.15727479755878448, "learning_rate": 1.7526911399392772e-05, "loss": 0.5006, "mean_token_accuracy": 0.8431180715560913, "num_tokens": 858313154.0, "step": 26893 }, { "entropy": 0.41885285964235663, "epoch": 2.4743848511509423, "grad_norm": 0.14525897800922394, "learning_rate": 1.7523844573251143e-05, "loss": 0.4025, "mean_token_accuracy": 0.8709408454596996, "num_tokens": 858345555.0, "step": 26894 }, { "entropy": 0.5175558412447572, "epoch": 2.4744768575223834, "grad_norm": 0.15602128207683563, "learning_rate": 1.7520777747109518e-05, "loss": 0.4978, "mean_token_accuracy": 0.8396695517003536, "num_tokens": 858377592.0, "step": 26895 }, { "entropy": 0.5226951043587178, "epoch": 2.4745688638938246, "grad_norm": 0.16184349358081818, "learning_rate": 1.7517710920967893e-05, "loss": 0.5097, "mean_token_accuracy": 0.8397239856421947, "num_tokens": 858408677.0, "step": 26896 }, { "entropy": 0.5727191986516118, "epoch": 2.4746608702652657, "grad_norm": 0.16859398782253265, "learning_rate": 1.7514644094826267e-05, "loss": 0.5623, "mean_token_accuracy": 0.8238265663385391, "num_tokens": 858440325.0, "step": 26897 }, { "entropy": 0.5509033761918545, "epoch": 2.474752876636707, "grad_norm": 0.16900534927845, "learning_rate": 1.751157726868464e-05, "loss": 0.531, "mean_token_accuracy": 0.8347379229962826, "num_tokens": 858471177.0, "step": 26898 }, { "entropy": 0.6518062688410282, "epoch": 2.4748448830081484, "grad_norm": 0.17649728059768677, "learning_rate": 1.7508510442543013e-05, "loss": 0.6468, "mean_token_accuracy": 0.7947249934077263, "num_tokens": 858502520.0, "step": 26899 }, { "entropy": 0.42798755515832454, "epoch": 2.4749368893795896, "grad_norm": 0.15218780934810638, "learning_rate": 1.7505443616401388e-05, "loss": 0.4215, "mean_token_accuracy": 0.8613183610141277, "num_tokens": 858534307.0, "step": 26900 }, { "entropy": 0.5374296670779586, "epoch": 2.4750288957510307, "grad_norm": 0.17063893377780914, "learning_rate": 1.7502376790259762e-05, "loss": 0.5291, "mean_token_accuracy": 0.8339495174586773, "num_tokens": 858565758.0, "step": 26901 }, { "entropy": 0.49855064041912556, "epoch": 2.475120902122472, "grad_norm": 0.15981481969356537, "learning_rate": 1.7499309964118134e-05, "loss": 0.4917, "mean_token_accuracy": 0.8440459854900837, "num_tokens": 858598037.0, "step": 26902 }, { "entropy": 0.4491792665794492, "epoch": 2.475212908493913, "grad_norm": 0.14915569126605988, "learning_rate": 1.7496243137976508e-05, "loss": 0.4314, "mean_token_accuracy": 0.8598180413246155, "num_tokens": 858630023.0, "step": 26903 }, { "entropy": 0.5649998364970088, "epoch": 2.4753049148653545, "grad_norm": 0.16467978060245514, "learning_rate": 1.7493176311834883e-05, "loss": 0.5461, "mean_token_accuracy": 0.8245684988796711, "num_tokens": 858661845.0, "step": 26904 }, { "entropy": 0.4296649405732751, "epoch": 2.4753969212367957, "grad_norm": 0.1443108469247818, "learning_rate": 1.7490109485693258e-05, "loss": 0.411, "mean_token_accuracy": 0.8693005330860615, "num_tokens": 858693665.0, "step": 26905 }, { "entropy": 0.47125783283263445, "epoch": 2.475488927608237, "grad_norm": 0.14712795615196228, "learning_rate": 1.7487042659551632e-05, "loss": 0.4678, "mean_token_accuracy": 0.8540919423103333, "num_tokens": 858725869.0, "step": 26906 }, { "entropy": 0.5417893612757325, "epoch": 2.475580933979678, "grad_norm": 0.16314905881881714, "learning_rate": 1.7483975833410003e-05, "loss": 0.5375, "mean_token_accuracy": 0.8304567635059357, "num_tokens": 858756820.0, "step": 26907 }, { "entropy": 0.5669939089566469, "epoch": 2.475672940351119, "grad_norm": 0.16951246559619904, "learning_rate": 1.7480909007268378e-05, "loss": 0.5577, "mean_token_accuracy": 0.8226274251937866, "num_tokens": 858787933.0, "step": 26908 }, { "entropy": 0.5582329891622066, "epoch": 2.4757649467225606, "grad_norm": 0.16367681324481964, "learning_rate": 1.7477842181126753e-05, "loss": 0.5482, "mean_token_accuracy": 0.8238886930048466, "num_tokens": 858820015.0, "step": 26909 }, { "entropy": 0.5295727988705039, "epoch": 2.4758569530940018, "grad_norm": 0.16150425374507904, "learning_rate": 1.7474775354985127e-05, "loss": 0.5109, "mean_token_accuracy": 0.8359940648078918, "num_tokens": 858851521.0, "step": 26910 }, { "entropy": 0.5421970430761576, "epoch": 2.475948959465443, "grad_norm": 0.16410060226917267, "learning_rate": 1.74717085288435e-05, "loss": 0.5231, "mean_token_accuracy": 0.8334031291306019, "num_tokens": 858883271.0, "step": 26911 }, { "entropy": 0.48472131229937077, "epoch": 2.476040965836884, "grad_norm": 0.15406233072280884, "learning_rate": 1.7468641702701873e-05, "loss": 0.4636, "mean_token_accuracy": 0.852374579757452, "num_tokens": 858915524.0, "step": 26912 }, { "entropy": 0.53501280490309, "epoch": 2.476132972208325, "grad_norm": 0.16956265270709991, "learning_rate": 1.7465574876560248e-05, "loss": 0.5341, "mean_token_accuracy": 0.8336951434612274, "num_tokens": 858947014.0, "step": 26913 }, { "entropy": 0.4566282966407016, "epoch": 2.4762249785797668, "grad_norm": 0.15425030887126923, "learning_rate": 1.7462508050418623e-05, "loss": 0.4634, "mean_token_accuracy": 0.8529374450445175, "num_tokens": 858979143.0, "step": 26914 }, { "entropy": 0.6143694585189223, "epoch": 2.476316984951208, "grad_norm": 0.17202623188495636, "learning_rate": 1.7459441224276997e-05, "loss": 0.6143, "mean_token_accuracy": 0.8074575997889042, "num_tokens": 859011696.0, "step": 26915 }, { "entropy": 0.4735669884830713, "epoch": 2.476408991322649, "grad_norm": 0.15966814756393433, "learning_rate": 1.745637439813537e-05, "loss": 0.4622, "mean_token_accuracy": 0.8532616645097733, "num_tokens": 859043771.0, "step": 26916 }, { "entropy": 0.5719269178807735, "epoch": 2.47650099769409, "grad_norm": 0.1689932644367218, "learning_rate": 1.7453307571993743e-05, "loss": 0.5599, "mean_token_accuracy": 0.8231121078133583, "num_tokens": 859075822.0, "step": 26917 }, { "entropy": 0.52149080298841, "epoch": 2.4765930040655313, "grad_norm": 0.16087189316749573, "learning_rate": 1.7450240745852118e-05, "loss": 0.5137, "mean_token_accuracy": 0.8385207019746304, "num_tokens": 859108111.0, "step": 26918 }, { "entropy": 0.49253156408667564, "epoch": 2.476685010436973, "grad_norm": 0.155195951461792, "learning_rate": 1.7447173919710492e-05, "loss": 0.4712, "mean_token_accuracy": 0.8494621440768242, "num_tokens": 859139236.0, "step": 26919 }, { "entropy": 0.4212112558307126, "epoch": 2.476777016808414, "grad_norm": 0.14378121495246887, "learning_rate": 1.7444107093568867e-05, "loss": 0.4071, "mean_token_accuracy": 0.8686141334474087, "num_tokens": 859171357.0, "step": 26920 }, { "entropy": 0.48249124246649444, "epoch": 2.476869023179855, "grad_norm": 0.15084858238697052, "learning_rate": 1.7441040267427242e-05, "loss": 0.4679, "mean_token_accuracy": 0.8500818610191345, "num_tokens": 859203059.0, "step": 26921 }, { "entropy": 0.548901482950896, "epoch": 2.4769610295512963, "grad_norm": 0.1609858125448227, "learning_rate": 1.7437973441285616e-05, "loss": 0.5275, "mean_token_accuracy": 0.8306460902094841, "num_tokens": 859235253.0, "step": 26922 }, { "entropy": 0.42490996117703617, "epoch": 2.4770530359227374, "grad_norm": 0.14630474150180817, "learning_rate": 1.743490661514399e-05, "loss": 0.4034, "mean_token_accuracy": 0.8716843388974667, "num_tokens": 859267316.0, "step": 26923 }, { "entropy": 0.5814698841422796, "epoch": 2.477145042294179, "grad_norm": 0.16827258467674255, "learning_rate": 1.7431839789002362e-05, "loss": 0.5666, "mean_token_accuracy": 0.8206615969538689, "num_tokens": 859299018.0, "step": 26924 }, { "entropy": 0.571176050696522, "epoch": 2.47723704866562, "grad_norm": 0.16400475800037384, "learning_rate": 1.7428772962860737e-05, "loss": 0.5532, "mean_token_accuracy": 0.8226020038127899, "num_tokens": 859331128.0, "step": 26925 }, { "entropy": 0.47766655031591654, "epoch": 2.4773290550370612, "grad_norm": 0.15814684331417084, "learning_rate": 1.742570613671911e-05, "loss": 0.4619, "mean_token_accuracy": 0.8506523184478283, "num_tokens": 859363215.0, "step": 26926 }, { "entropy": 0.5787805637810379, "epoch": 2.4774210614085024, "grad_norm": 0.17185969650745392, "learning_rate": 1.7422639310577486e-05, "loss": 0.5562, "mean_token_accuracy": 0.8235506750643253, "num_tokens": 859394007.0, "step": 26927 }, { "entropy": 0.5253278631716967, "epoch": 2.4775130677799435, "grad_norm": 0.1607929766178131, "learning_rate": 1.7419572484435858e-05, "loss": 0.5132, "mean_token_accuracy": 0.8375841751694679, "num_tokens": 859425503.0, "step": 26928 }, { "entropy": 0.5332245398312807, "epoch": 2.477605074151385, "grad_norm": 0.16239577531814575, "learning_rate": 1.7416505658294232e-05, "loss": 0.5256, "mean_token_accuracy": 0.8326383084058762, "num_tokens": 859458206.0, "step": 26929 }, { "entropy": 0.5594249069690704, "epoch": 2.4776970805228262, "grad_norm": 0.16563861072063446, "learning_rate": 1.7413438832152607e-05, "loss": 0.5501, "mean_token_accuracy": 0.8272388353943825, "num_tokens": 859490319.0, "step": 26930 }, { "entropy": 0.39747579500544816, "epoch": 2.4777890868942674, "grad_norm": 0.14387792348861694, "learning_rate": 1.741037200601098e-05, "loss": 0.3969, "mean_token_accuracy": 0.8750868737697601, "num_tokens": 859522055.0, "step": 26931 }, { "entropy": 0.4974163235165179, "epoch": 2.4778810932657085, "grad_norm": 0.1592860370874405, "learning_rate": 1.7407305179869353e-05, "loss": 0.4835, "mean_token_accuracy": 0.8474000208079815, "num_tokens": 859553645.0, "step": 26932 }, { "entropy": 0.5033198448363692, "epoch": 2.4779730996371496, "grad_norm": 0.1589294970035553, "learning_rate": 1.7404238353727727e-05, "loss": 0.4904, "mean_token_accuracy": 0.8427360877394676, "num_tokens": 859585480.0, "step": 26933 }, { "entropy": 0.4552988560171798, "epoch": 2.478065106008591, "grad_norm": 0.14758813381195068, "learning_rate": 1.7401171527586102e-05, "loss": 0.4443, "mean_token_accuracy": 0.8580373674631119, "num_tokens": 859617485.0, "step": 26934 }, { "entropy": 0.439623243175447, "epoch": 2.4781571123800323, "grad_norm": 0.1517437845468521, "learning_rate": 1.7398104701444477e-05, "loss": 0.4349, "mean_token_accuracy": 0.8617992326617241, "num_tokens": 859649824.0, "step": 26935 }, { "entropy": 0.46485308883711696, "epoch": 2.4782491187514735, "grad_norm": 0.15629561245441437, "learning_rate": 1.739503787530285e-05, "loss": 0.4557, "mean_token_accuracy": 0.8516733795404434, "num_tokens": 859681484.0, "step": 26936 }, { "entropy": 0.4735565008595586, "epoch": 2.4783411251229146, "grad_norm": 0.1575748175382614, "learning_rate": 1.7391971049161223e-05, "loss": 0.4696, "mean_token_accuracy": 0.8465184308588505, "num_tokens": 859713834.0, "step": 26937 }, { "entropy": 0.49542104080319405, "epoch": 2.4784331314943557, "grad_norm": 0.16034021973609924, "learning_rate": 1.7388904223019597e-05, "loss": 0.4854, "mean_token_accuracy": 0.8460045456886292, "num_tokens": 859745614.0, "step": 26938 }, { "entropy": 0.5810815510340035, "epoch": 2.4785251378657973, "grad_norm": 0.16318392753601074, "learning_rate": 1.7385837396877972e-05, "loss": 0.5689, "mean_token_accuracy": 0.820832148194313, "num_tokens": 859777841.0, "step": 26939 }, { "entropy": 0.5193031877279282, "epoch": 2.4786171442372384, "grad_norm": 0.15935878455638885, "learning_rate": 1.7382770570736347e-05, "loss": 0.5117, "mean_token_accuracy": 0.8386777155101299, "num_tokens": 859809936.0, "step": 26940 }, { "entropy": 0.5050076702609658, "epoch": 2.4787091506086796, "grad_norm": 0.15987487137317657, "learning_rate": 1.7379703744594718e-05, "loss": 0.4961, "mean_token_accuracy": 0.8357764072716236, "num_tokens": 859841338.0, "step": 26941 }, { "entropy": 0.5507608335465193, "epoch": 2.4788011569801207, "grad_norm": 0.16349279880523682, "learning_rate": 1.7376636918453092e-05, "loss": 0.5342, "mean_token_accuracy": 0.8309077471494675, "num_tokens": 859873146.0, "step": 26942 }, { "entropy": 0.47251275926828384, "epoch": 2.4788931633515623, "grad_norm": 0.14741279184818268, "learning_rate": 1.7373570092311467e-05, "loss": 0.4635, "mean_token_accuracy": 0.8521113768219948, "num_tokens": 859905229.0, "step": 26943 }, { "entropy": 0.5479840952903032, "epoch": 2.4789851697230034, "grad_norm": 0.16725380718708038, "learning_rate": 1.7370503266169842e-05, "loss": 0.5462, "mean_token_accuracy": 0.8271041065454483, "num_tokens": 859937286.0, "step": 26944 }, { "entropy": 0.5543686989694834, "epoch": 2.4790771760944446, "grad_norm": 0.1641460508108139, "learning_rate": 1.7367436440028216e-05, "loss": 0.5396, "mean_token_accuracy": 0.8302730359137058, "num_tokens": 859968875.0, "step": 26945 }, { "entropy": 0.5524492124095559, "epoch": 2.4791691824658857, "grad_norm": 0.16643942892551422, "learning_rate": 1.7364369613886588e-05, "loss": 0.5389, "mean_token_accuracy": 0.8275033533573151, "num_tokens": 860001089.0, "step": 26946 }, { "entropy": 0.5381143372505903, "epoch": 2.479261188837327, "grad_norm": 0.1652940958738327, "learning_rate": 1.7361302787744962e-05, "loss": 0.5353, "mean_token_accuracy": 0.8339348249137402, "num_tokens": 860032773.0, "step": 26947 }, { "entropy": 0.4232986280694604, "epoch": 2.4793531952087684, "grad_norm": 0.14630965888500214, "learning_rate": 1.7358235961603337e-05, "loss": 0.4047, "mean_token_accuracy": 0.8701019696891308, "num_tokens": 860065445.0, "step": 26948 }, { "entropy": 0.4639157960191369, "epoch": 2.4794452015802095, "grad_norm": 0.1486344337463379, "learning_rate": 1.735516913546171e-05, "loss": 0.4515, "mean_token_accuracy": 0.8548243977129459, "num_tokens": 860098101.0, "step": 26949 }, { "entropy": 0.4810981876216829, "epoch": 2.4795372079516507, "grad_norm": 0.15256111323833466, "learning_rate": 1.7352102309320086e-05, "loss": 0.4641, "mean_token_accuracy": 0.855274610221386, "num_tokens": 860129781.0, "step": 26950 }, { "entropy": 0.4935913719236851, "epoch": 2.479629214323092, "grad_norm": 0.15695206820964813, "learning_rate": 1.734903548317846e-05, "loss": 0.485, "mean_token_accuracy": 0.8445572033524513, "num_tokens": 860162342.0, "step": 26951 }, { "entropy": 0.5717246271669865, "epoch": 2.479721220694533, "grad_norm": 0.1603814661502838, "learning_rate": 1.7345968657036835e-05, "loss": 0.553, "mean_token_accuracy": 0.8248050399124622, "num_tokens": 860194605.0, "step": 26952 }, { "entropy": 0.4775671996176243, "epoch": 2.4798132270659745, "grad_norm": 0.15853220224380493, "learning_rate": 1.734290183089521e-05, "loss": 0.4647, "mean_token_accuracy": 0.8476717062294483, "num_tokens": 860226658.0, "step": 26953 }, { "entropy": 0.4029160104691982, "epoch": 2.4799052334374156, "grad_norm": 0.14485609531402588, "learning_rate": 1.733983500475358e-05, "loss": 0.4007, "mean_token_accuracy": 0.8702585510909557, "num_tokens": 860258524.0, "step": 26954 }, { "entropy": 0.6188083402812481, "epoch": 2.479997239808857, "grad_norm": 0.17128701508045197, "learning_rate": 1.7336768178611956e-05, "loss": 0.6055, "mean_token_accuracy": 0.8094347007572651, "num_tokens": 860290402.0, "step": 26955 }, { "entropy": 0.535370359197259, "epoch": 2.480089246180298, "grad_norm": 0.16176313161849976, "learning_rate": 1.733370135247033e-05, "loss": 0.5283, "mean_token_accuracy": 0.832008358091116, "num_tokens": 860321844.0, "step": 26956 }, { "entropy": 0.5229994086548686, "epoch": 2.480181252551739, "grad_norm": 0.1544422209262848, "learning_rate": 1.7330634526328705e-05, "loss": 0.5084, "mean_token_accuracy": 0.8401156365871429, "num_tokens": 860353830.0, "step": 26957 }, { "entropy": 0.5449258533772081, "epoch": 2.4802732589231806, "grad_norm": 0.15684296190738678, "learning_rate": 1.7327567700187077e-05, "loss": 0.5281, "mean_token_accuracy": 0.8333967663347721, "num_tokens": 860386085.0, "step": 26958 }, { "entropy": 0.5302501674741507, "epoch": 2.4803652652946218, "grad_norm": 0.16288265585899353, "learning_rate": 1.732450087404545e-05, "loss": 0.518, "mean_token_accuracy": 0.836209163069725, "num_tokens": 860418504.0, "step": 26959 }, { "entropy": 0.41889889538288116, "epoch": 2.480457271666063, "grad_norm": 0.1515583097934723, "learning_rate": 1.7321434047903826e-05, "loss": 0.3994, "mean_token_accuracy": 0.8674222193658352, "num_tokens": 860449732.0, "step": 26960 }, { "entropy": 0.5706712789833546, "epoch": 2.480549278037504, "grad_norm": 0.1701822280883789, "learning_rate": 1.73183672217622e-05, "loss": 0.5493, "mean_token_accuracy": 0.8266528137028217, "num_tokens": 860481249.0, "step": 26961 }, { "entropy": 0.4655493386089802, "epoch": 2.480641284408945, "grad_norm": 0.15649761259555817, "learning_rate": 1.7315300395620572e-05, "loss": 0.456, "mean_token_accuracy": 0.8525662049651146, "num_tokens": 860512939.0, "step": 26962 }, { "entropy": 0.5455471444875002, "epoch": 2.4807332907803867, "grad_norm": 0.16575659811496735, "learning_rate": 1.7312233569478946e-05, "loss": 0.5362, "mean_token_accuracy": 0.8301913514733315, "num_tokens": 860544330.0, "step": 26963 }, { "entropy": 0.6250993013381958, "epoch": 2.480825297151828, "grad_norm": 0.17238470911979675, "learning_rate": 1.730916674333732e-05, "loss": 0.6224, "mean_token_accuracy": 0.8080897144973278, "num_tokens": 860575786.0, "step": 26964 }, { "entropy": 0.5031236596405506, "epoch": 2.480917303523269, "grad_norm": 0.15727289021015167, "learning_rate": 1.7306099917195696e-05, "loss": 0.4881, "mean_token_accuracy": 0.8425105698406696, "num_tokens": 860608374.0, "step": 26965 }, { "entropy": 0.5339007419534028, "epoch": 2.48100930989471, "grad_norm": 0.16280002892017365, "learning_rate": 1.730303309105407e-05, "loss": 0.5174, "mean_token_accuracy": 0.8325917460024357, "num_tokens": 860640028.0, "step": 26966 }, { "entropy": 0.6077867140993476, "epoch": 2.4811013162661513, "grad_norm": 0.17506177723407745, "learning_rate": 1.729996626491244e-05, "loss": 0.5939, "mean_token_accuracy": 0.8089856691658497, "num_tokens": 860671161.0, "step": 26967 }, { "entropy": 0.49621977284550667, "epoch": 2.481193322637593, "grad_norm": 0.15869340300559998, "learning_rate": 1.7296899438770816e-05, "loss": 0.4776, "mean_token_accuracy": 0.8466026745736599, "num_tokens": 860702880.0, "step": 26968 }, { "entropy": 0.49089630506932735, "epoch": 2.481285329009034, "grad_norm": 0.1546841263771057, "learning_rate": 1.729383261262919e-05, "loss": 0.4789, "mean_token_accuracy": 0.8503386564552784, "num_tokens": 860734180.0, "step": 26969 }, { "entropy": 0.5542250201106071, "epoch": 2.481377335380475, "grad_norm": 0.16443796455860138, "learning_rate": 1.7290765786487566e-05, "loss": 0.5542, "mean_token_accuracy": 0.8242576941847801, "num_tokens": 860766603.0, "step": 26970 }, { "entropy": 0.5040615806356072, "epoch": 2.4814693417519162, "grad_norm": 0.15747833251953125, "learning_rate": 1.7287698960345937e-05, "loss": 0.4977, "mean_token_accuracy": 0.8409611880779266, "num_tokens": 860798824.0, "step": 26971 }, { "entropy": 0.5029306774958968, "epoch": 2.4815613481233574, "grad_norm": 0.15502245724201202, "learning_rate": 1.728463213420431e-05, "loss": 0.5003, "mean_token_accuracy": 0.8444384671747684, "num_tokens": 860830415.0, "step": 26972 }, { "entropy": 0.5095021799206734, "epoch": 2.481653354494799, "grad_norm": 0.15646550059318542, "learning_rate": 1.7281565308062686e-05, "loss": 0.5023, "mean_token_accuracy": 0.8436222672462463, "num_tokens": 860861818.0, "step": 26973 }, { "entropy": 0.5105061733629555, "epoch": 2.48174536086624, "grad_norm": 0.15952664613723755, "learning_rate": 1.727849848192106e-05, "loss": 0.4963, "mean_token_accuracy": 0.8429428897798061, "num_tokens": 860892865.0, "step": 26974 }, { "entropy": 0.5476577170193195, "epoch": 2.4818373672376812, "grad_norm": 0.16642603278160095, "learning_rate": 1.7275431655779435e-05, "loss": 0.5315, "mean_token_accuracy": 0.8315054439008236, "num_tokens": 860924412.0, "step": 26975 }, { "entropy": 0.4414223888888955, "epoch": 2.4819293736091224, "grad_norm": 0.1515299528837204, "learning_rate": 1.7272364829637807e-05, "loss": 0.4295, "mean_token_accuracy": 0.8606608994305134, "num_tokens": 860956441.0, "step": 26976 }, { "entropy": 0.5463256519287825, "epoch": 2.4820213799805635, "grad_norm": 0.1627928912639618, "learning_rate": 1.726929800349618e-05, "loss": 0.5344, "mean_token_accuracy": 0.8313192203640938, "num_tokens": 860988565.0, "step": 26977 }, { "entropy": 0.4818577696569264, "epoch": 2.482113386352005, "grad_norm": 0.15512391924858093, "learning_rate": 1.7266231177354556e-05, "loss": 0.4597, "mean_token_accuracy": 0.8526559323072433, "num_tokens": 861019628.0, "step": 26978 }, { "entropy": 0.5658346163108945, "epoch": 2.482205392723446, "grad_norm": 0.16812972724437714, "learning_rate": 1.726316435121293e-05, "loss": 0.5483, "mean_token_accuracy": 0.8255239315330982, "num_tokens": 861051988.0, "step": 26979 }, { "entropy": 0.5890794731676579, "epoch": 2.4822973990948873, "grad_norm": 0.16808244585990906, "learning_rate": 1.7260097525071302e-05, "loss": 0.5767, "mean_token_accuracy": 0.8197214193642139, "num_tokens": 861083899.0, "step": 26980 }, { "entropy": 0.5229503409937024, "epoch": 2.4823894054663285, "grad_norm": 0.15749293565750122, "learning_rate": 1.725703069892968e-05, "loss": 0.5165, "mean_token_accuracy": 0.8353167064487934, "num_tokens": 861116424.0, "step": 26981 }, { "entropy": 0.43585914466530085, "epoch": 2.4824814118377696, "grad_norm": 0.14775380492210388, "learning_rate": 1.7253963872788055e-05, "loss": 0.4278, "mean_token_accuracy": 0.8621797040104866, "num_tokens": 861147443.0, "step": 26982 }, { "entropy": 0.5564222801476717, "epoch": 2.482573418209211, "grad_norm": 0.1639942079782486, "learning_rate": 1.725089704664643e-05, "loss": 0.5423, "mean_token_accuracy": 0.8302844502031803, "num_tokens": 861179324.0, "step": 26983 }, { "entropy": 0.5518215019255877, "epoch": 2.4826654245806523, "grad_norm": 0.16775870323181152, "learning_rate": 1.72478302205048e-05, "loss": 0.5412, "mean_token_accuracy": 0.8272621408104897, "num_tokens": 861210668.0, "step": 26984 }, { "entropy": 0.5067162488121539, "epoch": 2.4827574309520934, "grad_norm": 0.1546330600976944, "learning_rate": 1.7244763394363175e-05, "loss": 0.4916, "mean_token_accuracy": 0.8432163074612617, "num_tokens": 861242830.0, "step": 26985 }, { "entropy": 0.4554701577872038, "epoch": 2.4828494373235346, "grad_norm": 0.15165317058563232, "learning_rate": 1.724169656822155e-05, "loss": 0.4425, "mean_token_accuracy": 0.8576950579881668, "num_tokens": 861274505.0, "step": 26986 }, { "entropy": 0.5715316031128168, "epoch": 2.4829414436949757, "grad_norm": 0.1682204306125641, "learning_rate": 1.7238629742079924e-05, "loss": 0.5739, "mean_token_accuracy": 0.8198893554508686, "num_tokens": 861306781.0, "step": 26987 }, { "entropy": 0.4721391573548317, "epoch": 2.4830334500664173, "grad_norm": 0.15285834670066833, "learning_rate": 1.7235562915938296e-05, "loss": 0.4541, "mean_token_accuracy": 0.8527084924280643, "num_tokens": 861337879.0, "step": 26988 }, { "entropy": 0.4749219361692667, "epoch": 2.4831254564378584, "grad_norm": 0.15464140474796295, "learning_rate": 1.723249608979667e-05, "loss": 0.4621, "mean_token_accuracy": 0.8535813391208649, "num_tokens": 861369966.0, "step": 26989 }, { "entropy": 0.5904120150953531, "epoch": 2.4832174628092996, "grad_norm": 0.16876843571662903, "learning_rate": 1.7229429263655045e-05, "loss": 0.5871, "mean_token_accuracy": 0.8175771571695805, "num_tokens": 861401569.0, "step": 26990 }, { "entropy": 0.4414580473676324, "epoch": 2.4833094691807407, "grad_norm": 0.15360529720783234, "learning_rate": 1.722636243751342e-05, "loss": 0.4342, "mean_token_accuracy": 0.8583322465419769, "num_tokens": 861433142.0, "step": 26991 }, { "entropy": 0.4842554032802582, "epoch": 2.483401475552182, "grad_norm": 0.1523999571800232, "learning_rate": 1.722329561137179e-05, "loss": 0.4726, "mean_token_accuracy": 0.8498064763844013, "num_tokens": 861465279.0, "step": 26992 }, { "entropy": 0.5499645015224814, "epoch": 2.4834934819236234, "grad_norm": 0.1609460860490799, "learning_rate": 1.7220228785230166e-05, "loss": 0.5203, "mean_token_accuracy": 0.8362118154764175, "num_tokens": 861496216.0, "step": 26993 }, { "entropy": 0.4922052752226591, "epoch": 2.4835854882950645, "grad_norm": 0.16383549571037292, "learning_rate": 1.721716195908854e-05, "loss": 0.4831, "mean_token_accuracy": 0.8449182920157909, "num_tokens": 861528116.0, "step": 26994 }, { "entropy": 0.5937807131558657, "epoch": 2.4836774946665057, "grad_norm": 0.16900883615016937, "learning_rate": 1.7214095132946915e-05, "loss": 0.5809, "mean_token_accuracy": 0.817290086299181, "num_tokens": 861559475.0, "step": 26995 }, { "entropy": 0.524427080526948, "epoch": 2.483769501037947, "grad_norm": 0.15570838749408722, "learning_rate": 1.721102830680529e-05, "loss": 0.5102, "mean_token_accuracy": 0.8377375304698944, "num_tokens": 861591629.0, "step": 26996 }, { "entropy": 0.5600094515830278, "epoch": 2.483861507409388, "grad_norm": 0.169827401638031, "learning_rate": 1.720796148066366e-05, "loss": 0.5437, "mean_token_accuracy": 0.8311080411076546, "num_tokens": 861623289.0, "step": 26997 }, { "entropy": 0.45230552973225713, "epoch": 2.4839535137808295, "grad_norm": 0.1534481942653656, "learning_rate": 1.7204894654522035e-05, "loss": 0.4404, "mean_token_accuracy": 0.8615865781903267, "num_tokens": 861655398.0, "step": 26998 }, { "entropy": 0.47870420571416616, "epoch": 2.4840455201522706, "grad_norm": 0.15304110944271088, "learning_rate": 1.720182782838041e-05, "loss": 0.4639, "mean_token_accuracy": 0.8512802235782146, "num_tokens": 861687581.0, "step": 26999 }, { "entropy": 0.5543196313083172, "epoch": 2.484137526523712, "grad_norm": 0.1684611737728119, "learning_rate": 1.7198761002238785e-05, "loss": 0.5386, "mean_token_accuracy": 0.8313134834170341, "num_tokens": 861719267.0, "step": 27000 }, { "entropy": 0.4095446215942502, "epoch": 2.484229532895153, "grad_norm": 0.14926382899284363, "learning_rate": 1.7195694176097156e-05, "loss": 0.3946, "mean_token_accuracy": 0.8723492175340652, "num_tokens": 861750845.0, "step": 27001 }, { "entropy": 0.534051826223731, "epoch": 2.484321539266594, "grad_norm": 0.1564432978630066, "learning_rate": 1.719262734995553e-05, "loss": 0.5197, "mean_token_accuracy": 0.837386392056942, "num_tokens": 861783108.0, "step": 27002 }, { "entropy": 0.5271534575149417, "epoch": 2.4844135456380356, "grad_norm": 0.1638278216123581, "learning_rate": 1.7189560523813905e-05, "loss": 0.5233, "mean_token_accuracy": 0.8355094343423843, "num_tokens": 861814937.0, "step": 27003 }, { "entropy": 0.33123617712408304, "epoch": 2.4845055520094768, "grad_norm": 0.12957432866096497, "learning_rate": 1.718649369767228e-05, "loss": 0.3154, "mean_token_accuracy": 0.8984794802963734, "num_tokens": 861847705.0, "step": 27004 }, { "entropy": 0.5733647001907229, "epoch": 2.484597558380918, "grad_norm": 0.17083929479122162, "learning_rate": 1.7183426871530655e-05, "loss": 0.5618, "mean_token_accuracy": 0.8214659467339516, "num_tokens": 861879063.0, "step": 27005 }, { "entropy": 0.5521057639271021, "epoch": 2.484689564752359, "grad_norm": 0.1645837426185608, "learning_rate": 1.7180360045389026e-05, "loss": 0.5409, "mean_token_accuracy": 0.8319636881351471, "num_tokens": 861911082.0, "step": 27006 }, { "entropy": 0.5452729053795338, "epoch": 2.4847815711238, "grad_norm": 0.16488100588321686, "learning_rate": 1.71772932192474e-05, "loss": 0.5391, "mean_token_accuracy": 0.8280398808419704, "num_tokens": 861942902.0, "step": 27007 }, { "entropy": 0.5422455202788115, "epoch": 2.4848735774952417, "grad_norm": 0.16800974309444427, "learning_rate": 1.7174226393105775e-05, "loss": 0.5379, "mean_token_accuracy": 0.8284241519868374, "num_tokens": 861975193.0, "step": 27008 }, { "entropy": 0.6086358781903982, "epoch": 2.484965583866683, "grad_norm": 0.17170852422714233, "learning_rate": 1.717115956696415e-05, "loss": 0.6033, "mean_token_accuracy": 0.8103258088231087, "num_tokens": 862006879.0, "step": 27009 }, { "entropy": 0.42874744441360235, "epoch": 2.485057590238124, "grad_norm": 0.14701233804225922, "learning_rate": 1.716809274082252e-05, "loss": 0.414, "mean_token_accuracy": 0.8628704957664013, "num_tokens": 862038830.0, "step": 27010 }, { "entropy": 0.49673283752053976, "epoch": 2.485149596609565, "grad_norm": 0.15420666337013245, "learning_rate": 1.71650259146809e-05, "loss": 0.4817, "mean_token_accuracy": 0.8449597619473934, "num_tokens": 862071164.0, "step": 27011 }, { "entropy": 0.5750799868255854, "epoch": 2.4852416029810063, "grad_norm": 0.16511820256710052, "learning_rate": 1.7161959088539274e-05, "loss": 0.5649, "mean_token_accuracy": 0.8195070363581181, "num_tokens": 862102727.0, "step": 27012 }, { "entropy": 0.5196877233684063, "epoch": 2.485333609352448, "grad_norm": 0.15979669988155365, "learning_rate": 1.715889226239765e-05, "loss": 0.5112, "mean_token_accuracy": 0.835473321378231, "num_tokens": 862135434.0, "step": 27013 }, { "entropy": 0.4570322511717677, "epoch": 2.485425615723889, "grad_norm": 0.15357311069965363, "learning_rate": 1.715582543625602e-05, "loss": 0.4462, "mean_token_accuracy": 0.8583311140537262, "num_tokens": 862167277.0, "step": 27014 }, { "entropy": 0.5371008664369583, "epoch": 2.48551762209533, "grad_norm": 0.15382297337055206, "learning_rate": 1.7152758610114394e-05, "loss": 0.5234, "mean_token_accuracy": 0.8360143676400185, "num_tokens": 862199640.0, "step": 27015 }, { "entropy": 0.5411534085869789, "epoch": 2.4856096284667712, "grad_norm": 0.1612299233675003, "learning_rate": 1.714969178397277e-05, "loss": 0.5307, "mean_token_accuracy": 0.8299450613558292, "num_tokens": 862231741.0, "step": 27016 }, { "entropy": 0.5126406261697412, "epoch": 2.4857016348382124, "grad_norm": 0.16124093532562256, "learning_rate": 1.7146624957831144e-05, "loss": 0.4963, "mean_token_accuracy": 0.841754361987114, "num_tokens": 862262719.0, "step": 27017 }, { "entropy": 0.6381918415427208, "epoch": 2.485793641209654, "grad_norm": 0.17615698277950287, "learning_rate": 1.7143558131689515e-05, "loss": 0.6343, "mean_token_accuracy": 0.8042179569602013, "num_tokens": 862295306.0, "step": 27018 }, { "entropy": 0.5011485880240798, "epoch": 2.485885647581095, "grad_norm": 0.15339751541614532, "learning_rate": 1.714049130554789e-05, "loss": 0.4754, "mean_token_accuracy": 0.8465350680053234, "num_tokens": 862326473.0, "step": 27019 }, { "entropy": 0.6382611803710461, "epoch": 2.4859776539525362, "grad_norm": 0.1777593493461609, "learning_rate": 1.7137424479406264e-05, "loss": 0.6272, "mean_token_accuracy": 0.8024968020617962, "num_tokens": 862357821.0, "step": 27020 }, { "entropy": 0.5336139444261789, "epoch": 2.4860696603239774, "grad_norm": 0.16941116750240326, "learning_rate": 1.713435765326464e-05, "loss": 0.5211, "mean_token_accuracy": 0.8368829935789108, "num_tokens": 862388657.0, "step": 27021 }, { "entropy": 0.5768440105021, "epoch": 2.4861616666954185, "grad_norm": 0.16376826167106628, "learning_rate": 1.713129082712301e-05, "loss": 0.5697, "mean_token_accuracy": 0.8220066353678703, "num_tokens": 862420727.0, "step": 27022 }, { "entropy": 0.5410972470417619, "epoch": 2.48625367306686, "grad_norm": 0.1640252321958542, "learning_rate": 1.7128224000981385e-05, "loss": 0.5266, "mean_token_accuracy": 0.8318216614425182, "num_tokens": 862452163.0, "step": 27023 }, { "entropy": 0.4896414680406451, "epoch": 2.486345679438301, "grad_norm": 0.1584080159664154, "learning_rate": 1.712515717483976e-05, "loss": 0.4882, "mean_token_accuracy": 0.8445382490754128, "num_tokens": 862483974.0, "step": 27024 }, { "entropy": 0.44797405879944563, "epoch": 2.4864376858097423, "grad_norm": 0.15135911107063293, "learning_rate": 1.7122090348698134e-05, "loss": 0.4321, "mean_token_accuracy": 0.8593875728547573, "num_tokens": 862515719.0, "step": 27025 }, { "entropy": 0.5680500315502286, "epoch": 2.4865296921811835, "grad_norm": 0.16470970213413239, "learning_rate": 1.711902352255651e-05, "loss": 0.5612, "mean_token_accuracy": 0.8234197162091732, "num_tokens": 862547869.0, "step": 27026 }, { "entropy": 0.6229239087551832, "epoch": 2.4866216985526246, "grad_norm": 0.17031888663768768, "learning_rate": 1.711595669641488e-05, "loss": 0.5991, "mean_token_accuracy": 0.8119718693196774, "num_tokens": 862580602.0, "step": 27027 }, { "entropy": 0.4024381865747273, "epoch": 2.486713704924066, "grad_norm": 0.1460733562707901, "learning_rate": 1.7112889870273254e-05, "loss": 0.3885, "mean_token_accuracy": 0.8726622015237808, "num_tokens": 862612602.0, "step": 27028 }, { "entropy": 0.5889940671622753, "epoch": 2.4868057112955073, "grad_norm": 0.1713707447052002, "learning_rate": 1.710982304413163e-05, "loss": 0.5754, "mean_token_accuracy": 0.8189929574728012, "num_tokens": 862644792.0, "step": 27029 }, { "entropy": 0.5252693500369787, "epoch": 2.4868977176669484, "grad_norm": 0.167427197098732, "learning_rate": 1.7106756217990004e-05, "loss": 0.5162, "mean_token_accuracy": 0.8389829881489277, "num_tokens": 862677046.0, "step": 27030 }, { "entropy": 0.6199880540370941, "epoch": 2.4869897240383896, "grad_norm": 0.17175409197807312, "learning_rate": 1.7103689391848375e-05, "loss": 0.612, "mean_token_accuracy": 0.8111811093986034, "num_tokens": 862708662.0, "step": 27031 }, { "entropy": 0.6114432495087385, "epoch": 2.4870817304098307, "grad_norm": 0.17210939526557922, "learning_rate": 1.710062256570675e-05, "loss": 0.6011, "mean_token_accuracy": 0.8079631105065346, "num_tokens": 862740680.0, "step": 27032 }, { "entropy": 0.5122226849198341, "epoch": 2.4871737367812723, "grad_norm": 0.1628570556640625, "learning_rate": 1.7097555739565124e-05, "loss": 0.5075, "mean_token_accuracy": 0.8407013081014156, "num_tokens": 862771924.0, "step": 27033 }, { "entropy": 0.5159757458604872, "epoch": 2.4872657431527134, "grad_norm": 0.15380726754665375, "learning_rate": 1.70944889134235e-05, "loss": 0.5003, "mean_token_accuracy": 0.8426057025790215, "num_tokens": 862803713.0, "step": 27034 }, { "entropy": 0.49932063929736614, "epoch": 2.4873577495241546, "grad_norm": 0.15687288343906403, "learning_rate": 1.7091422087281874e-05, "loss": 0.4773, "mean_token_accuracy": 0.8470751270651817, "num_tokens": 862835448.0, "step": 27035 }, { "entropy": 0.5545489061623812, "epoch": 2.4874497558955957, "grad_norm": 0.1637856364250183, "learning_rate": 1.7088355261140245e-05, "loss": 0.5408, "mean_token_accuracy": 0.8301152288913727, "num_tokens": 862867358.0, "step": 27036 }, { "entropy": 0.5651116725057364, "epoch": 2.487541762267037, "grad_norm": 0.16468088328838348, "learning_rate": 1.708528843499862e-05, "loss": 0.5523, "mean_token_accuracy": 0.8264228142797947, "num_tokens": 862900126.0, "step": 27037 }, { "entropy": 0.5082933218218386, "epoch": 2.4876337686384784, "grad_norm": 0.1571376919746399, "learning_rate": 1.7082221608856994e-05, "loss": 0.5003, "mean_token_accuracy": 0.8418377488851547, "num_tokens": 862932639.0, "step": 27038 }, { "entropy": 0.5254828240722418, "epoch": 2.4877257750099195, "grad_norm": 0.16113637387752533, "learning_rate": 1.707915478271537e-05, "loss": 0.5203, "mean_token_accuracy": 0.834993701428175, "num_tokens": 862964878.0, "step": 27039 }, { "entropy": 0.5856927931308746, "epoch": 2.4878177813813607, "grad_norm": 0.16932478547096252, "learning_rate": 1.707608795657374e-05, "loss": 0.5756, "mean_token_accuracy": 0.8216099590063095, "num_tokens": 862996215.0, "step": 27040 }, { "entropy": 0.48061622702516615, "epoch": 2.487909787752802, "grad_norm": 0.1501913070678711, "learning_rate": 1.7073021130432115e-05, "loss": 0.4655, "mean_token_accuracy": 0.8511023409664631, "num_tokens": 863028198.0, "step": 27041 }, { "entropy": 0.498581413179636, "epoch": 2.488001794124243, "grad_norm": 0.16153207421302795, "learning_rate": 1.7069954304290493e-05, "loss": 0.4893, "mean_token_accuracy": 0.845245249569416, "num_tokens": 863060424.0, "step": 27042 }, { "entropy": 0.520514382282272, "epoch": 2.4880938004956845, "grad_norm": 0.156950905919075, "learning_rate": 1.7066887478148867e-05, "loss": 0.5114, "mean_token_accuracy": 0.8337589800357819, "num_tokens": 863092251.0, "step": 27043 }, { "entropy": 0.5721728727221489, "epoch": 2.4881858068671256, "grad_norm": 0.16869403421878815, "learning_rate": 1.706382065200724e-05, "loss": 0.5613, "mean_token_accuracy": 0.8278770335018635, "num_tokens": 863124440.0, "step": 27044 }, { "entropy": 0.4560974187916145, "epoch": 2.488277813238567, "grad_norm": 0.14984993636608124, "learning_rate": 1.7060753825865613e-05, "loss": 0.4434, "mean_token_accuracy": 0.8623925410211086, "num_tokens": 863156654.0, "step": 27045 }, { "entropy": 0.4636584408581257, "epoch": 2.488369819610008, "grad_norm": 0.1586962640285492, "learning_rate": 1.7057686999723988e-05, "loss": 0.4543, "mean_token_accuracy": 0.8524904884397984, "num_tokens": 863189095.0, "step": 27046 }, { "entropy": 0.5113141434267163, "epoch": 2.488461825981449, "grad_norm": 0.15960216522216797, "learning_rate": 1.7054620173582363e-05, "loss": 0.4912, "mean_token_accuracy": 0.8418457023799419, "num_tokens": 863220617.0, "step": 27047 }, { "entropy": 0.5954549638554454, "epoch": 2.4885538323528906, "grad_norm": 0.17196395993232727, "learning_rate": 1.7051553347440734e-05, "loss": 0.5757, "mean_token_accuracy": 0.8174654617905617, "num_tokens": 863252799.0, "step": 27048 }, { "entropy": 0.5678101485827938, "epoch": 2.4886458387243318, "grad_norm": 0.16757822036743164, "learning_rate": 1.704848652129911e-05, "loss": 0.5474, "mean_token_accuracy": 0.8302439302206039, "num_tokens": 863285092.0, "step": 27049 }, { "entropy": 0.5816477024927735, "epoch": 2.488737845095773, "grad_norm": 0.17043234407901764, "learning_rate": 1.7045419695157483e-05, "loss": 0.5709, "mean_token_accuracy": 0.8245456181466579, "num_tokens": 863316179.0, "step": 27050 }, { "entropy": 0.49046191573143005, "epoch": 2.488829851467214, "grad_norm": 0.16502012312412262, "learning_rate": 1.7042352869015858e-05, "loss": 0.4886, "mean_token_accuracy": 0.8474429734051228, "num_tokens": 863348527.0, "step": 27051 }, { "entropy": 0.5734926522709429, "epoch": 2.488921857838655, "grad_norm": 0.16239479184150696, "learning_rate": 1.703928604287423e-05, "loss": 0.5559, "mean_token_accuracy": 0.826150793582201, "num_tokens": 863380182.0, "step": 27052 }, { "entropy": 0.44396356493234634, "epoch": 2.4890138642100967, "grad_norm": 0.1547837108373642, "learning_rate": 1.7036219216732604e-05, "loss": 0.4373, "mean_token_accuracy": 0.8610099852085114, "num_tokens": 863412387.0, "step": 27053 }, { "entropy": 0.4536458239890635, "epoch": 2.489105870581538, "grad_norm": 0.15396054089069366, "learning_rate": 1.703315239059098e-05, "loss": 0.4484, "mean_token_accuracy": 0.8577491380274296, "num_tokens": 863444384.0, "step": 27054 }, { "entropy": 0.5124621465802193, "epoch": 2.489197876952979, "grad_norm": 0.15948541462421417, "learning_rate": 1.7030085564449353e-05, "loss": 0.5026, "mean_token_accuracy": 0.8382447920739651, "num_tokens": 863476694.0, "step": 27055 }, { "entropy": 0.5835613375529647, "epoch": 2.48928988332442, "grad_norm": 0.1784055233001709, "learning_rate": 1.7027018738307728e-05, "loss": 0.5818, "mean_token_accuracy": 0.8176175951957703, "num_tokens": 863508100.0, "step": 27056 }, { "entropy": 0.5677222292870283, "epoch": 2.4893818896958613, "grad_norm": 0.16950908303260803, "learning_rate": 1.70239519121661e-05, "loss": 0.5562, "mean_token_accuracy": 0.8238963931798935, "num_tokens": 863539855.0, "step": 27057 }, { "entropy": 0.48247809056192636, "epoch": 2.489473896067303, "grad_norm": 0.15459443628787994, "learning_rate": 1.7020885086024474e-05, "loss": 0.4713, "mean_token_accuracy": 0.8466948680579662, "num_tokens": 863571443.0, "step": 27058 }, { "entropy": 0.599893250502646, "epoch": 2.489565902438744, "grad_norm": 0.16596205532550812, "learning_rate": 1.7017818259882848e-05, "loss": 0.5991, "mean_token_accuracy": 0.8148441910743713, "num_tokens": 863603989.0, "step": 27059 }, { "entropy": 0.5778701901435852, "epoch": 2.489657908810185, "grad_norm": 0.17175792157649994, "learning_rate": 1.7014751433741223e-05, "loss": 0.5765, "mean_token_accuracy": 0.8151457570493221, "num_tokens": 863636362.0, "step": 27060 }, { "entropy": 0.4363351615611464, "epoch": 2.4897499151816262, "grad_norm": 0.150569349527359, "learning_rate": 1.7011684607599594e-05, "loss": 0.431, "mean_token_accuracy": 0.8635459281504154, "num_tokens": 863668785.0, "step": 27061 }, { "entropy": 0.5150648010894656, "epoch": 2.4898419215530674, "grad_norm": 0.16270124912261963, "learning_rate": 1.700861778145797e-05, "loss": 0.513, "mean_token_accuracy": 0.8354131616652012, "num_tokens": 863700549.0, "step": 27062 }, { "entropy": 0.501937665976584, "epoch": 2.489933927924509, "grad_norm": 0.1579204499721527, "learning_rate": 1.7005550955316343e-05, "loss": 0.4925, "mean_token_accuracy": 0.8421862609684467, "num_tokens": 863732871.0, "step": 27063 }, { "entropy": 0.48978302569594234, "epoch": 2.49002593429595, "grad_norm": 0.15665733814239502, "learning_rate": 1.7002484129174718e-05, "loss": 0.4803, "mean_token_accuracy": 0.8481318913400173, "num_tokens": 863763871.0, "step": 27064 }, { "entropy": 0.5086800919380039, "epoch": 2.4901179406673912, "grad_norm": 0.16115927696228027, "learning_rate": 1.6999417303033093e-05, "loss": 0.5045, "mean_token_accuracy": 0.8387540467083454, "num_tokens": 863795976.0, "step": 27065 }, { "entropy": 0.545621263794601, "epoch": 2.4902099470388324, "grad_norm": 0.16510282456874847, "learning_rate": 1.6996350476891464e-05, "loss": 0.5265, "mean_token_accuracy": 0.836009468883276, "num_tokens": 863827878.0, "step": 27066 }, { "entropy": 0.5374722965061665, "epoch": 2.4903019534102735, "grad_norm": 0.163176029920578, "learning_rate": 1.699328365074984e-05, "loss": 0.5335, "mean_token_accuracy": 0.8340047188103199, "num_tokens": 863859238.0, "step": 27067 }, { "entropy": 0.5590057019144297, "epoch": 2.490393959781715, "grad_norm": 0.16405555605888367, "learning_rate": 1.6990216824608213e-05, "loss": 0.5389, "mean_token_accuracy": 0.829185176640749, "num_tokens": 863891187.0, "step": 27068 }, { "entropy": 0.5406850930303335, "epoch": 2.490485966153156, "grad_norm": 0.1527196615934372, "learning_rate": 1.6987149998466588e-05, "loss": 0.5156, "mean_token_accuracy": 0.8371396139264107, "num_tokens": 863922776.0, "step": 27069 }, { "entropy": 0.5408521969802678, "epoch": 2.4905779725245973, "grad_norm": 0.15824396908283234, "learning_rate": 1.698408317232496e-05, "loss": 0.5216, "mean_token_accuracy": 0.8369349129498005, "num_tokens": 863954988.0, "step": 27070 }, { "entropy": 0.5941262962296605, "epoch": 2.4906699788960385, "grad_norm": 0.1679355651140213, "learning_rate": 1.6981016346183334e-05, "loss": 0.576, "mean_token_accuracy": 0.8196395225822926, "num_tokens": 863987072.0, "step": 27071 }, { "entropy": 0.5492814308963716, "epoch": 2.4907619852674796, "grad_norm": 0.1605878472328186, "learning_rate": 1.6977949520041712e-05, "loss": 0.534, "mean_token_accuracy": 0.8316535241901875, "num_tokens": 864019391.0, "step": 27072 }, { "entropy": 0.45814819168299437, "epoch": 2.490853991638921, "grad_norm": 0.1484450101852417, "learning_rate": 1.6974882693900087e-05, "loss": 0.4367, "mean_token_accuracy": 0.8607558310031891, "num_tokens": 864051543.0, "step": 27073 }, { "entropy": 0.5582690881565213, "epoch": 2.4909459980103623, "grad_norm": 0.16145147383213043, "learning_rate": 1.6971815867758458e-05, "loss": 0.5431, "mean_token_accuracy": 0.8259296007454395, "num_tokens": 864083398.0, "step": 27074 }, { "entropy": 0.5266843067947775, "epoch": 2.4910380043818035, "grad_norm": 0.15592758357524872, "learning_rate": 1.6968749041616832e-05, "loss": 0.5182, "mean_token_accuracy": 0.8349461555480957, "num_tokens": 864115540.0, "step": 27075 }, { "entropy": 0.5164959083776921, "epoch": 2.4911300107532446, "grad_norm": 0.1620248258113861, "learning_rate": 1.6965682215475207e-05, "loss": 0.4963, "mean_token_accuracy": 0.8414074629545212, "num_tokens": 864146421.0, "step": 27076 }, { "entropy": 0.5649430891498923, "epoch": 2.4912220171246857, "grad_norm": 0.16819241642951965, "learning_rate": 1.6962615389333582e-05, "loss": 0.5561, "mean_token_accuracy": 0.8263146989047527, "num_tokens": 864177559.0, "step": 27077 }, { "entropy": 0.5143844978883862, "epoch": 2.4913140234961273, "grad_norm": 0.16109462082386017, "learning_rate": 1.6959548563191953e-05, "loss": 0.5078, "mean_token_accuracy": 0.8401812128722668, "num_tokens": 864209635.0, "step": 27078 }, { "entropy": 0.5596768893301487, "epoch": 2.4914060298675684, "grad_norm": 0.16155818104743958, "learning_rate": 1.6956481737050328e-05, "loss": 0.5449, "mean_token_accuracy": 0.8273086473345757, "num_tokens": 864241602.0, "step": 27079 }, { "entropy": 0.5281992387026548, "epoch": 2.4914980362390096, "grad_norm": 0.15943922102451324, "learning_rate": 1.6953414910908702e-05, "loss": 0.5178, "mean_token_accuracy": 0.8361123949289322, "num_tokens": 864273965.0, "step": 27080 }, { "entropy": 0.5370630798861384, "epoch": 2.4915900426104507, "grad_norm": 0.15945008397102356, "learning_rate": 1.6950348084767077e-05, "loss": 0.5264, "mean_token_accuracy": 0.8312040083110332, "num_tokens": 864306244.0, "step": 27081 }, { "entropy": 0.49420143687166274, "epoch": 2.491682048981892, "grad_norm": 0.16097983717918396, "learning_rate": 1.6947281258625448e-05, "loss": 0.4864, "mean_token_accuracy": 0.8478344157338142, "num_tokens": 864337481.0, "step": 27082 }, { "entropy": 0.5978228021413088, "epoch": 2.4917740553533334, "grad_norm": 0.17153562605381012, "learning_rate": 1.6944214432483823e-05, "loss": 0.5975, "mean_token_accuracy": 0.8108211532235146, "num_tokens": 864369150.0, "step": 27083 }, { "entropy": 0.544031661003828, "epoch": 2.4918660617247745, "grad_norm": 0.1634170114994049, "learning_rate": 1.6941147606342197e-05, "loss": 0.5396, "mean_token_accuracy": 0.8314764685928822, "num_tokens": 864400459.0, "step": 27084 }, { "entropy": 0.46968803624622524, "epoch": 2.4919580680962157, "grad_norm": 0.1533164083957672, "learning_rate": 1.6938080780200572e-05, "loss": 0.457, "mean_token_accuracy": 0.8537419475615025, "num_tokens": 864432166.0, "step": 27085 }, { "entropy": 0.47280273772776127, "epoch": 2.492050074467657, "grad_norm": 0.1559423804283142, "learning_rate": 1.6935013954058947e-05, "loss": 0.4596, "mean_token_accuracy": 0.8538725227117538, "num_tokens": 864464366.0, "step": 27086 }, { "entropy": 0.49060697108507156, "epoch": 2.492142080839098, "grad_norm": 0.153002068400383, "learning_rate": 1.6931947127917318e-05, "loss": 0.4784, "mean_token_accuracy": 0.8475185707211494, "num_tokens": 864496499.0, "step": 27087 }, { "entropy": 0.5394955398514867, "epoch": 2.4922340872105395, "grad_norm": 0.1620476096868515, "learning_rate": 1.6928880301775693e-05, "loss": 0.5157, "mean_token_accuracy": 0.8357813097536564, "num_tokens": 864528258.0, "step": 27088 }, { "entropy": 0.4758501220494509, "epoch": 2.4923260935819807, "grad_norm": 0.15504099428653717, "learning_rate": 1.6925813475634067e-05, "loss": 0.4707, "mean_token_accuracy": 0.8534991629421711, "num_tokens": 864559796.0, "step": 27089 }, { "entropy": 0.5118056247010827, "epoch": 2.492418099953422, "grad_norm": 0.16243471205234528, "learning_rate": 1.6922746649492442e-05, "loss": 0.4863, "mean_token_accuracy": 0.8438524901866913, "num_tokens": 864591737.0, "step": 27090 }, { "entropy": 0.5400791494175792, "epoch": 2.492510106324863, "grad_norm": 0.15601591765880585, "learning_rate": 1.6919679823350813e-05, "loss": 0.5257, "mean_token_accuracy": 0.833458174020052, "num_tokens": 864623993.0, "step": 27091 }, { "entropy": 0.5235188659280539, "epoch": 2.492602112696304, "grad_norm": 0.1628274917602539, "learning_rate": 1.6916612997209188e-05, "loss": 0.5043, "mean_token_accuracy": 0.8380469866096973, "num_tokens": 864655218.0, "step": 27092 }, { "entropy": 0.5666271345689893, "epoch": 2.4926941190677456, "grad_norm": 0.16934143006801605, "learning_rate": 1.6913546171067563e-05, "loss": 0.5615, "mean_token_accuracy": 0.8216351307928562, "num_tokens": 864685975.0, "step": 27093 }, { "entropy": 0.4400050528347492, "epoch": 2.4927861254391868, "grad_norm": 0.14829832315444946, "learning_rate": 1.6910479344925937e-05, "loss": 0.4353, "mean_token_accuracy": 0.8606753535568714, "num_tokens": 864717828.0, "step": 27094 }, { "entropy": 0.5179439205676317, "epoch": 2.492878131810628, "grad_norm": 0.1664547622203827, "learning_rate": 1.6907412518784312e-05, "loss": 0.5092, "mean_token_accuracy": 0.8355581760406494, "num_tokens": 864749827.0, "step": 27095 }, { "entropy": 0.45895533822476864, "epoch": 2.492970138182069, "grad_norm": 0.15343932807445526, "learning_rate": 1.6904345692642683e-05, "loss": 0.4501, "mean_token_accuracy": 0.8538447953760624, "num_tokens": 864781845.0, "step": 27096 }, { "entropy": 0.450878219678998, "epoch": 2.49306214455351, "grad_norm": 0.15507271885871887, "learning_rate": 1.6901278866501058e-05, "loss": 0.4401, "mean_token_accuracy": 0.8573752529919147, "num_tokens": 864812436.0, "step": 27097 }, { "entropy": 0.6275463495403528, "epoch": 2.4931541509249517, "grad_norm": 0.17292697727680206, "learning_rate": 1.6898212040359432e-05, "loss": 0.6111, "mean_token_accuracy": 0.8052139356732368, "num_tokens": 864843178.0, "step": 27098 }, { "entropy": 0.5026400880888104, "epoch": 2.493246157296393, "grad_norm": 0.15847846865653992, "learning_rate": 1.6895145214217807e-05, "loss": 0.4749, "mean_token_accuracy": 0.8475413583219051, "num_tokens": 864874282.0, "step": 27099 }, { "entropy": 0.5207033324986696, "epoch": 2.493338163667834, "grad_norm": 0.1593378633260727, "learning_rate": 1.6892078388076178e-05, "loss": 0.5076, "mean_token_accuracy": 0.839575283229351, "num_tokens": 864906427.0, "step": 27100 }, { "entropy": 0.459060488268733, "epoch": 2.493430170039275, "grad_norm": 0.157873272895813, "learning_rate": 1.6889011561934553e-05, "loss": 0.4526, "mean_token_accuracy": 0.8548579514026642, "num_tokens": 864938088.0, "step": 27101 }, { "entropy": 0.5621326379477978, "epoch": 2.4935221764107163, "grad_norm": 0.16284795105457306, "learning_rate": 1.6885944735792928e-05, "loss": 0.5459, "mean_token_accuracy": 0.8279316686093807, "num_tokens": 864969943.0, "step": 27102 }, { "entropy": 0.5266023413278162, "epoch": 2.493614182782158, "grad_norm": 0.1617995798587799, "learning_rate": 1.6882877909651306e-05, "loss": 0.514, "mean_token_accuracy": 0.8395575322210789, "num_tokens": 865001281.0, "step": 27103 }, { "entropy": 0.4999895775690675, "epoch": 2.493706189153599, "grad_norm": 0.1566380262374878, "learning_rate": 1.6879811083509677e-05, "loss": 0.483, "mean_token_accuracy": 0.8453840054571629, "num_tokens": 865032696.0, "step": 27104 }, { "entropy": 0.6032780492678285, "epoch": 2.49379819552504, "grad_norm": 0.16454647481441498, "learning_rate": 1.687674425736805e-05, "loss": 0.592, "mean_token_accuracy": 0.8153151348233223, "num_tokens": 865065262.0, "step": 27105 }, { "entropy": 0.5375175811350346, "epoch": 2.4938902018964813, "grad_norm": 0.16507229208946228, "learning_rate": 1.6873677431226426e-05, "loss": 0.5302, "mean_token_accuracy": 0.8291197158396244, "num_tokens": 865097499.0, "step": 27106 }, { "entropy": 0.517656734213233, "epoch": 2.4939822082679224, "grad_norm": 0.15659821033477783, "learning_rate": 1.68706106050848e-05, "loss": 0.5066, "mean_token_accuracy": 0.8390302993357182, "num_tokens": 865130132.0, "step": 27107 }, { "entropy": 0.5919643845409155, "epoch": 2.494074214639364, "grad_norm": 0.1675519496202469, "learning_rate": 1.6867543778943172e-05, "loss": 0.5785, "mean_token_accuracy": 0.8139462918043137, "num_tokens": 865161963.0, "step": 27108 }, { "entropy": 0.5537127107381821, "epoch": 2.494166221010805, "grad_norm": 0.16293387115001678, "learning_rate": 1.6864476952801547e-05, "loss": 0.5385, "mean_token_accuracy": 0.8273540213704109, "num_tokens": 865193600.0, "step": 27109 }, { "entropy": 0.6373244696296751, "epoch": 2.4942582273822462, "grad_norm": 0.1667211353778839, "learning_rate": 1.686141012665992e-05, "loss": 0.6228, "mean_token_accuracy": 0.8015719205141068, "num_tokens": 865226129.0, "step": 27110 }, { "entropy": 0.5757580529898405, "epoch": 2.4943502337536874, "grad_norm": 0.16969501972198486, "learning_rate": 1.6858343300518296e-05, "loss": 0.5646, "mean_token_accuracy": 0.8181070871651173, "num_tokens": 865257689.0, "step": 27111 }, { "entropy": 0.5657982612028718, "epoch": 2.4944422401251285, "grad_norm": 0.16968843340873718, "learning_rate": 1.6855276474376667e-05, "loss": 0.5577, "mean_token_accuracy": 0.8216737136244774, "num_tokens": 865289221.0, "step": 27112 }, { "entropy": 0.5599340950138867, "epoch": 2.49453424649657, "grad_norm": 0.16316258907318115, "learning_rate": 1.6852209648235042e-05, "loss": 0.5488, "mean_token_accuracy": 0.8276719860732555, "num_tokens": 865321094.0, "step": 27113 }, { "entropy": 0.5150175783783197, "epoch": 2.494626252868011, "grad_norm": 0.16107231378555298, "learning_rate": 1.6849142822093417e-05, "loss": 0.5006, "mean_token_accuracy": 0.8398143574595451, "num_tokens": 865352728.0, "step": 27114 }, { "entropy": 0.4961637333035469, "epoch": 2.4947182592394523, "grad_norm": 0.16020193696022034, "learning_rate": 1.684607599595179e-05, "loss": 0.4817, "mean_token_accuracy": 0.848249863833189, "num_tokens": 865383902.0, "step": 27115 }, { "entropy": 0.46083161793649197, "epoch": 2.4948102656108935, "grad_norm": 0.15364105999469757, "learning_rate": 1.6843009169810166e-05, "loss": 0.4537, "mean_token_accuracy": 0.854517288506031, "num_tokens": 865416296.0, "step": 27116 }, { "entropy": 0.5239020606968552, "epoch": 2.4949022719823346, "grad_norm": 0.15786245465278625, "learning_rate": 1.6839942343668537e-05, "loss": 0.5221, "mean_token_accuracy": 0.8364038057625294, "num_tokens": 865448429.0, "step": 27117 }, { "entropy": 0.45509192906320095, "epoch": 2.494994278353776, "grad_norm": 0.153212770819664, "learning_rate": 1.6836875517526912e-05, "loss": 0.4435, "mean_token_accuracy": 0.8627060726284981, "num_tokens": 865480860.0, "step": 27118 }, { "entropy": 0.5718605152796954, "epoch": 2.4950862847252173, "grad_norm": 0.1691250503063202, "learning_rate": 1.6833808691385286e-05, "loss": 0.5746, "mean_token_accuracy": 0.8207387700676918, "num_tokens": 865512814.0, "step": 27119 }, { "entropy": 0.4831044254824519, "epoch": 2.4951782910966585, "grad_norm": 0.1569659411907196, "learning_rate": 1.683074186524366e-05, "loss": 0.4817, "mean_token_accuracy": 0.8485098108649254, "num_tokens": 865544997.0, "step": 27120 }, { "entropy": 0.5525877326726913, "epoch": 2.4952702974680996, "grad_norm": 0.1600838303565979, "learning_rate": 1.6827675039102032e-05, "loss": 0.5435, "mean_token_accuracy": 0.8279799707233906, "num_tokens": 865577765.0, "step": 27121 }, { "entropy": 0.40581033658236265, "epoch": 2.4953623038395407, "grad_norm": 0.14633455872535706, "learning_rate": 1.6824608212960407e-05, "loss": 0.4051, "mean_token_accuracy": 0.8691484853625298, "num_tokens": 865610423.0, "step": 27122 }, { "entropy": 0.4635687004774809, "epoch": 2.4954543102109823, "grad_norm": 0.1435624659061432, "learning_rate": 1.682154138681878e-05, "loss": 0.4484, "mean_token_accuracy": 0.8581909947097301, "num_tokens": 865643185.0, "step": 27123 }, { "entropy": 0.5430573839694262, "epoch": 2.4955463165824234, "grad_norm": 0.1549793928861618, "learning_rate": 1.6818474560677156e-05, "loss": 0.5193, "mean_token_accuracy": 0.8368456140160561, "num_tokens": 865675346.0, "step": 27124 }, { "entropy": 0.5090134828351438, "epoch": 2.4956383229538646, "grad_norm": 0.1602858603000641, "learning_rate": 1.681540773453553e-05, "loss": 0.4894, "mean_token_accuracy": 0.847517766058445, "num_tokens": 865706964.0, "step": 27125 }, { "entropy": 0.40901371696963906, "epoch": 2.4957303293253057, "grad_norm": 0.1428505927324295, "learning_rate": 1.6812340908393902e-05, "loss": 0.4041, "mean_token_accuracy": 0.8705340996384621, "num_tokens": 865739168.0, "step": 27126 }, { "entropy": 0.41968059726059437, "epoch": 2.495822335696747, "grad_norm": 0.14425048232078552, "learning_rate": 1.6809274082252277e-05, "loss": 0.4057, "mean_token_accuracy": 0.8703207597136497, "num_tokens": 865771915.0, "step": 27127 }, { "entropy": 0.5657970085740089, "epoch": 2.4959143420681884, "grad_norm": 0.1649303287267685, "learning_rate": 1.680620725611065e-05, "loss": 0.558, "mean_token_accuracy": 0.8271622471511364, "num_tokens": 865804471.0, "step": 27128 }, { "entropy": 0.46038202568888664, "epoch": 2.4960063484396295, "grad_norm": 0.1488354206085205, "learning_rate": 1.6803140429969026e-05, "loss": 0.4473, "mean_token_accuracy": 0.8562032766640186, "num_tokens": 865837035.0, "step": 27129 }, { "entropy": 0.5566859398968518, "epoch": 2.4960983548110707, "grad_norm": 0.16660431027412415, "learning_rate": 1.6800073603827397e-05, "loss": 0.5351, "mean_token_accuracy": 0.8303965032100677, "num_tokens": 865869413.0, "step": 27130 }, { "entropy": 0.5753195148427039, "epoch": 2.496190361182512, "grad_norm": 0.16764578223228455, "learning_rate": 1.6797006777685772e-05, "loss": 0.5633, "mean_token_accuracy": 0.8259486705064774, "num_tokens": 865901743.0, "step": 27131 }, { "entropy": 0.5165434945374727, "epoch": 2.496282367553953, "grad_norm": 0.15619045495986938, "learning_rate": 1.6793939951544147e-05, "loss": 0.5061, "mean_token_accuracy": 0.838468573987484, "num_tokens": 865933911.0, "step": 27132 }, { "entropy": 0.4970728103071451, "epoch": 2.4963743739253945, "grad_norm": 0.15970014035701752, "learning_rate": 1.6790873125402525e-05, "loss": 0.4816, "mean_token_accuracy": 0.8463414944708347, "num_tokens": 865966324.0, "step": 27133 }, { "entropy": 0.4791879206895828, "epoch": 2.4964663802968357, "grad_norm": 0.15429987013339996, "learning_rate": 1.6787806299260896e-05, "loss": 0.4628, "mean_token_accuracy": 0.8509766198694706, "num_tokens": 865998307.0, "step": 27134 }, { "entropy": 0.5571706090122461, "epoch": 2.496558386668277, "grad_norm": 0.1684926301240921, "learning_rate": 1.678473947311927e-05, "loss": 0.548, "mean_token_accuracy": 0.8277069106698036, "num_tokens": 866030376.0, "step": 27135 }, { "entropy": 0.454028460662812, "epoch": 2.496650393039718, "grad_norm": 0.15068258345127106, "learning_rate": 1.6781672646977645e-05, "loss": 0.441, "mean_token_accuracy": 0.8604592010378838, "num_tokens": 866062133.0, "step": 27136 }, { "entropy": 0.4871986676007509, "epoch": 2.496742399411159, "grad_norm": 0.1606561243534088, "learning_rate": 1.677860582083602e-05, "loss": 0.4801, "mean_token_accuracy": 0.846719354391098, "num_tokens": 866094586.0, "step": 27137 }, { "entropy": 0.5425303189549595, "epoch": 2.4968344057826006, "grad_norm": 0.16421514749526978, "learning_rate": 1.677553899469439e-05, "loss": 0.5417, "mean_token_accuracy": 0.8329952172935009, "num_tokens": 866126628.0, "step": 27138 }, { "entropy": 0.5335106775164604, "epoch": 2.4969264121540418, "grad_norm": 0.16206233203411102, "learning_rate": 1.6772472168552766e-05, "loss": 0.5136, "mean_token_accuracy": 0.8365765623748302, "num_tokens": 866158567.0, "step": 27139 }, { "entropy": 0.5806295676156878, "epoch": 2.497018418525483, "grad_norm": 0.16627387702465057, "learning_rate": 1.676940534241114e-05, "loss": 0.5592, "mean_token_accuracy": 0.8214837498962879, "num_tokens": 866190325.0, "step": 27140 }, { "entropy": 0.4637767574749887, "epoch": 2.497110424896924, "grad_norm": 0.15355604887008667, "learning_rate": 1.6766338516269515e-05, "loss": 0.4574, "mean_token_accuracy": 0.8528719656169415, "num_tokens": 866222736.0, "step": 27141 }, { "entropy": 0.5822288449853659, "epoch": 2.497202431268365, "grad_norm": 0.16672061383724213, "learning_rate": 1.6763271690127886e-05, "loss": 0.5678, "mean_token_accuracy": 0.8172484710812569, "num_tokens": 866254810.0, "step": 27142 }, { "entropy": 0.5135874757543206, "epoch": 2.4972944376398067, "grad_norm": 0.16142438352108002, "learning_rate": 1.676020486398626e-05, "loss": 0.5076, "mean_token_accuracy": 0.8430912792682648, "num_tokens": 866287228.0, "step": 27143 }, { "entropy": 0.5122102051973343, "epoch": 2.497386444011248, "grad_norm": 0.1590030938386917, "learning_rate": 1.6757138037844636e-05, "loss": 0.495, "mean_token_accuracy": 0.8396421447396278, "num_tokens": 866319168.0, "step": 27144 }, { "entropy": 0.45932399574667215, "epoch": 2.497478450382689, "grad_norm": 0.15379150211811066, "learning_rate": 1.675407121170301e-05, "loss": 0.4496, "mean_token_accuracy": 0.8565047457814217, "num_tokens": 866351250.0, "step": 27145 }, { "entropy": 0.5249312845990062, "epoch": 2.49757045675413, "grad_norm": 0.15952827036380768, "learning_rate": 1.6751004385561385e-05, "loss": 0.5192, "mean_token_accuracy": 0.8318683244287968, "num_tokens": 866383964.0, "step": 27146 }, { "entropy": 0.5339622460305691, "epoch": 2.4976624631255713, "grad_norm": 0.16286110877990723, "learning_rate": 1.6747937559419756e-05, "loss": 0.5224, "mean_token_accuracy": 0.8335576951503754, "num_tokens": 866416002.0, "step": 27147 }, { "entropy": 0.44001844711601734, "epoch": 2.497754469497013, "grad_norm": 0.15054334700107574, "learning_rate": 1.674487073327813e-05, "loss": 0.4293, "mean_token_accuracy": 0.863052487373352, "num_tokens": 866447167.0, "step": 27148 }, { "entropy": 0.5769801829010248, "epoch": 2.497846475868454, "grad_norm": 0.16717112064361572, "learning_rate": 1.6741803907136506e-05, "loss": 0.5611, "mean_token_accuracy": 0.8204253539443016, "num_tokens": 866478354.0, "step": 27149 }, { "entropy": 0.4637340164044872, "epoch": 2.497938482239895, "grad_norm": 0.15791107714176178, "learning_rate": 1.673873708099488e-05, "loss": 0.4509, "mean_token_accuracy": 0.8585390672087669, "num_tokens": 866509080.0, "step": 27150 }, { "entropy": 0.5115574449300766, "epoch": 2.4980304886113363, "grad_norm": 0.16080188751220703, "learning_rate": 1.673567025485325e-05, "loss": 0.4983, "mean_token_accuracy": 0.8435153886675835, "num_tokens": 866540930.0, "step": 27151 }, { "entropy": 0.5486213993281126, "epoch": 2.4981224949827774, "grad_norm": 0.160066619515419, "learning_rate": 1.6732603428711626e-05, "loss": 0.5249, "mean_token_accuracy": 0.8303378745913506, "num_tokens": 866572240.0, "step": 27152 }, { "entropy": 0.45785934943705797, "epoch": 2.498214501354219, "grad_norm": 0.15622860193252563, "learning_rate": 1.672953660257e-05, "loss": 0.451, "mean_token_accuracy": 0.8534194603562355, "num_tokens": 866603876.0, "step": 27153 }, { "entropy": 0.5610766243189573, "epoch": 2.49830650772566, "grad_norm": 0.1655724197626114, "learning_rate": 1.6726469776428375e-05, "loss": 0.5516, "mean_token_accuracy": 0.8253033719956875, "num_tokens": 866635998.0, "step": 27154 }, { "entropy": 0.47404667316004634, "epoch": 2.4983985140971012, "grad_norm": 0.1584269106388092, "learning_rate": 1.672340295028675e-05, "loss": 0.4664, "mean_token_accuracy": 0.8512740582227707, "num_tokens": 866667753.0, "step": 27155 }, { "entropy": 0.4983358010649681, "epoch": 2.4984905204685424, "grad_norm": 0.15714895725250244, "learning_rate": 1.672033612414512e-05, "loss": 0.4853, "mean_token_accuracy": 0.8460053615272045, "num_tokens": 866699868.0, "step": 27156 }, { "entropy": 0.5599870393052697, "epoch": 2.4985825268399835, "grad_norm": 0.16484574973583221, "learning_rate": 1.6717269298003496e-05, "loss": 0.5517, "mean_token_accuracy": 0.8277806676924229, "num_tokens": 866730828.0, "step": 27157 }, { "entropy": 0.5762367686256766, "epoch": 2.498674533211425, "grad_norm": 0.1716500222682953, "learning_rate": 1.671420247186187e-05, "loss": 0.5628, "mean_token_accuracy": 0.820235975086689, "num_tokens": 866761826.0, "step": 27158 }, { "entropy": 0.6198794357478619, "epoch": 2.498766539582866, "grad_norm": 0.17072942852973938, "learning_rate": 1.6711135645720245e-05, "loss": 0.6105, "mean_token_accuracy": 0.806977067142725, "num_tokens": 866794294.0, "step": 27159 }, { "entropy": 0.45156453270465136, "epoch": 2.4988585459543073, "grad_norm": 0.14723259210586548, "learning_rate": 1.6708068819578616e-05, "loss": 0.4393, "mean_token_accuracy": 0.8593243807554245, "num_tokens": 866826665.0, "step": 27160 }, { "entropy": 0.4082418151665479, "epoch": 2.4989505523257485, "grad_norm": 0.14660592377185822, "learning_rate": 1.670500199343699e-05, "loss": 0.4002, "mean_token_accuracy": 0.8737996853888035, "num_tokens": 866858458.0, "step": 27161 }, { "entropy": 0.5212910510599613, "epoch": 2.4990425586971896, "grad_norm": 0.16355876624584198, "learning_rate": 1.6701935167295366e-05, "loss": 0.512, "mean_token_accuracy": 0.8354893438518047, "num_tokens": 866891007.0, "step": 27162 }, { "entropy": 0.4749809140339494, "epoch": 2.499134565068631, "grad_norm": 0.15686818957328796, "learning_rate": 1.669886834115374e-05, "loss": 0.4634, "mean_token_accuracy": 0.855939507484436, "num_tokens": 866922443.0, "step": 27163 }, { "entropy": 0.45315312198363245, "epoch": 2.4992265714400723, "grad_norm": 0.15194858610630035, "learning_rate": 1.6695801515012115e-05, "loss": 0.4472, "mean_token_accuracy": 0.8597737364470959, "num_tokens": 866954415.0, "step": 27164 }, { "entropy": 0.5481878411956131, "epoch": 2.4993185778115135, "grad_norm": 0.15810824930667877, "learning_rate": 1.669273468887049e-05, "loss": 0.5469, "mean_token_accuracy": 0.8284385055303574, "num_tokens": 866986344.0, "step": 27165 }, { "entropy": 0.5592481608036906, "epoch": 2.4994105841829546, "grad_norm": 0.16588523983955383, "learning_rate": 1.6689667862728864e-05, "loss": 0.5508, "mean_token_accuracy": 0.8263690620660782, "num_tokens": 867018755.0, "step": 27166 }, { "entropy": 0.52544039580971, "epoch": 2.4995025905543957, "grad_norm": 0.1615496724843979, "learning_rate": 1.668660103658724e-05, "loss": 0.5151, "mean_token_accuracy": 0.8386763408780098, "num_tokens": 867050984.0, "step": 27167 }, { "entropy": 0.4255006015300751, "epoch": 2.4995945969258373, "grad_norm": 0.1453103870153427, "learning_rate": 1.668353421044561e-05, "loss": 0.4128, "mean_token_accuracy": 0.8672592677175999, "num_tokens": 867083382.0, "step": 27168 }, { "entropy": 0.5395193789154291, "epoch": 2.4996866032972784, "grad_norm": 0.1601058393716812, "learning_rate": 1.6680467384303985e-05, "loss": 0.5326, "mean_token_accuracy": 0.8306919224560261, "num_tokens": 867115440.0, "step": 27169 }, { "entropy": 0.5995480660349131, "epoch": 2.4997786096687196, "grad_norm": 0.17216284573078156, "learning_rate": 1.667740055816236e-05, "loss": 0.5828, "mean_token_accuracy": 0.8177907876670361, "num_tokens": 867147647.0, "step": 27170 }, { "entropy": 0.5491877375170588, "epoch": 2.4998706160401607, "grad_norm": 0.16508464515209198, "learning_rate": 1.6674333732020734e-05, "loss": 0.5471, "mean_token_accuracy": 0.8302570320665836, "num_tokens": 867179705.0, "step": 27171 }, { "entropy": 0.45571235893294215, "epoch": 2.499962622411602, "grad_norm": 0.15475133061408997, "learning_rate": 1.6671266905879105e-05, "loss": 0.4452, "mean_token_accuracy": 0.8589723221957684, "num_tokens": 867211115.0, "step": 27172 }, { "entropy": 0.5214428342878819, "epoch": 2.500054628783043, "grad_norm": 0.16274124383926392, "learning_rate": 1.666820007973748e-05, "loss": 0.5152, "mean_token_accuracy": 0.8395552523434162, "num_tokens": 867242566.0, "step": 27173 }, { "entropy": 0.4188756311777979, "epoch": 2.5001466351544845, "grad_norm": 0.1460035890340805, "learning_rate": 1.6665133253595855e-05, "loss": 0.4023, "mean_token_accuracy": 0.8675454743206501, "num_tokens": 867274512.0, "step": 27174 }, { "entropy": 0.5405476200394332, "epoch": 2.5002386415259257, "grad_norm": 0.1552581489086151, "learning_rate": 1.666206642745423e-05, "loss": 0.5214, "mean_token_accuracy": 0.8326511234045029, "num_tokens": 867306741.0, "step": 27175 }, { "entropy": 0.44116888102144003, "epoch": 2.500330647897367, "grad_norm": 0.14957819879055023, "learning_rate": 1.6658999601312604e-05, "loss": 0.4202, "mean_token_accuracy": 0.8664242848753929, "num_tokens": 867338937.0, "step": 27176 }, { "entropy": 0.4983610026538372, "epoch": 2.5004226542688084, "grad_norm": 0.15699787437915802, "learning_rate": 1.6655932775170975e-05, "loss": 0.4853, "mean_token_accuracy": 0.8465467318892479, "num_tokens": 867371093.0, "step": 27177 }, { "entropy": 0.48897640127688646, "epoch": 2.500514660640249, "grad_norm": 0.15488770604133606, "learning_rate": 1.665286594902935e-05, "loss": 0.4617, "mean_token_accuracy": 0.8497091829776764, "num_tokens": 867402575.0, "step": 27178 }, { "entropy": 0.4356646682135761, "epoch": 2.5006066670116907, "grad_norm": 0.15653081238269806, "learning_rate": 1.6649799122887725e-05, "loss": 0.4233, "mean_token_accuracy": 0.8641145117580891, "num_tokens": 867434481.0, "step": 27179 }, { "entropy": 0.5926628322340548, "epoch": 2.500698673383132, "grad_norm": 0.1677621454000473, "learning_rate": 1.66467322967461e-05, "loss": 0.58, "mean_token_accuracy": 0.8153310976922512, "num_tokens": 867466067.0, "step": 27180 }, { "entropy": 0.4615567720029503, "epoch": 2.500790679754573, "grad_norm": 0.1514979749917984, "learning_rate": 1.664366547060447e-05, "loss": 0.4528, "mean_token_accuracy": 0.8549078404903412, "num_tokens": 867498336.0, "step": 27181 }, { "entropy": 0.49097431916743517, "epoch": 2.5008826861260145, "grad_norm": 0.154726043343544, "learning_rate": 1.6640598644462845e-05, "loss": 0.4759, "mean_token_accuracy": 0.8457979634404182, "num_tokens": 867529886.0, "step": 27182 }, { "entropy": 0.5473486250266433, "epoch": 2.500974692497455, "grad_norm": 0.16107168793678284, "learning_rate": 1.663753181832122e-05, "loss": 0.5386, "mean_token_accuracy": 0.8303739130496979, "num_tokens": 867562243.0, "step": 27183 }, { "entropy": 0.46222113259136677, "epoch": 2.5010666988688968, "grad_norm": 0.1541031450033188, "learning_rate": 1.6634464992179594e-05, "loss": 0.4538, "mean_token_accuracy": 0.8545008152723312, "num_tokens": 867594316.0, "step": 27184 }, { "entropy": 0.523082516156137, "epoch": 2.501158705240338, "grad_norm": 0.16368021070957184, "learning_rate": 1.663139816603797e-05, "loss": 0.5146, "mean_token_accuracy": 0.83724519982934, "num_tokens": 867625973.0, "step": 27185 }, { "entropy": 0.4521826785057783, "epoch": 2.501250711611779, "grad_norm": 0.14688967168331146, "learning_rate": 1.662833133989634e-05, "loss": 0.4284, "mean_token_accuracy": 0.8599988706409931, "num_tokens": 867657844.0, "step": 27186 }, { "entropy": 0.5034706555306911, "epoch": 2.5013427179832206, "grad_norm": 0.15955419838428497, "learning_rate": 1.6625264513754715e-05, "loss": 0.4936, "mean_token_accuracy": 0.8434852585196495, "num_tokens": 867690270.0, "step": 27187 }, { "entropy": 0.5499849766492844, "epoch": 2.5014347243546613, "grad_norm": 0.16850323975086212, "learning_rate": 1.662219768761309e-05, "loss": 0.5449, "mean_token_accuracy": 0.8327248990535736, "num_tokens": 867722049.0, "step": 27188 }, { "entropy": 0.5543526688124985, "epoch": 2.501526730726103, "grad_norm": 0.16273263096809387, "learning_rate": 1.6619130861471464e-05, "loss": 0.5412, "mean_token_accuracy": 0.8270731866359711, "num_tokens": 867754178.0, "step": 27189 }, { "entropy": 0.5463441082974896, "epoch": 2.501618737097544, "grad_norm": 0.16081711649894714, "learning_rate": 1.6616064035329836e-05, "loss": 0.5324, "mean_token_accuracy": 0.8347094319760799, "num_tokens": 867786401.0, "step": 27190 }, { "entropy": 0.47751805651932955, "epoch": 2.501710743468985, "grad_norm": 0.15125037729740143, "learning_rate": 1.661299720918821e-05, "loss": 0.4648, "mean_token_accuracy": 0.8526227474212646, "num_tokens": 867818797.0, "step": 27191 }, { "entropy": 0.4284177925437689, "epoch": 2.5018027498404267, "grad_norm": 0.14597339928150177, "learning_rate": 1.6609930383046585e-05, "loss": 0.416, "mean_token_accuracy": 0.8652424812316895, "num_tokens": 867851009.0, "step": 27192 }, { "entropy": 0.5386719331145287, "epoch": 2.5018947562118674, "grad_norm": 0.17016077041625977, "learning_rate": 1.660686355690496e-05, "loss": 0.516, "mean_token_accuracy": 0.8372123129665852, "num_tokens": 867882793.0, "step": 27193 }, { "entropy": 0.5725612607784569, "epoch": 2.501986762583309, "grad_norm": 0.17113164067268372, "learning_rate": 1.6603796730763334e-05, "loss": 0.568, "mean_token_accuracy": 0.8227527812123299, "num_tokens": 867915359.0, "step": 27194 }, { "entropy": 0.5540238628163934, "epoch": 2.50207876895475, "grad_norm": 0.16032251715660095, "learning_rate": 1.660072990462171e-05, "loss": 0.5463, "mean_token_accuracy": 0.832856759428978, "num_tokens": 867947608.0, "step": 27195 }, { "entropy": 0.4960636291652918, "epoch": 2.5021707753261913, "grad_norm": 0.15690167248249054, "learning_rate": 1.6597663078480083e-05, "loss": 0.483, "mean_token_accuracy": 0.8452126011252403, "num_tokens": 867980024.0, "step": 27196 }, { "entropy": 0.515373133122921, "epoch": 2.502262781697633, "grad_norm": 0.1545892357826233, "learning_rate": 1.6594596252338458e-05, "loss": 0.5025, "mean_token_accuracy": 0.8421556502580643, "num_tokens": 868012401.0, "step": 27197 }, { "entropy": 0.4873743765056133, "epoch": 2.5023547880690735, "grad_norm": 0.1558798998594284, "learning_rate": 1.659152942619683e-05, "loss": 0.4762, "mean_token_accuracy": 0.8473915718495846, "num_tokens": 868044877.0, "step": 27198 }, { "entropy": 0.49649125477299094, "epoch": 2.502446794440515, "grad_norm": 0.1572885364294052, "learning_rate": 1.6588462600055204e-05, "loss": 0.4871, "mean_token_accuracy": 0.843066856265068, "num_tokens": 868077105.0, "step": 27199 }, { "entropy": 0.469110275618732, "epoch": 2.5025388008119562, "grad_norm": 0.15132303535938263, "learning_rate": 1.658539577391358e-05, "loss": 0.4587, "mean_token_accuracy": 0.8545210473239422, "num_tokens": 868109477.0, "step": 27200 }, { "entropy": 0.610972736030817, "epoch": 2.5026308071833974, "grad_norm": 0.17030414938926697, "learning_rate": 1.6582328947771953e-05, "loss": 0.6038, "mean_token_accuracy": 0.810700461268425, "num_tokens": 868141254.0, "step": 27201 }, { "entropy": 0.5912487674504519, "epoch": 2.502722813554839, "grad_norm": 0.17055192589759827, "learning_rate": 1.6579262121630325e-05, "loss": 0.5784, "mean_token_accuracy": 0.8194355219602585, "num_tokens": 868173288.0, "step": 27202 }, { "entropy": 0.44947826862335205, "epoch": 2.5028148199262796, "grad_norm": 0.1527615338563919, "learning_rate": 1.65761952954887e-05, "loss": 0.4338, "mean_token_accuracy": 0.864036463201046, "num_tokens": 868205430.0, "step": 27203 }, { "entropy": 0.633103309199214, "epoch": 2.502906826297721, "grad_norm": 0.1740143597126007, "learning_rate": 1.6573128469347074e-05, "loss": 0.6225, "mean_token_accuracy": 0.8051256500184536, "num_tokens": 868236128.0, "step": 27204 }, { "entropy": 0.5247269282117486, "epoch": 2.5029988326691623, "grad_norm": 0.16000588238239288, "learning_rate": 1.657006164320545e-05, "loss": 0.5084, "mean_token_accuracy": 0.8390000909566879, "num_tokens": 868267631.0, "step": 27205 }, { "entropy": 0.4466683503706008, "epoch": 2.5030908390406035, "grad_norm": 0.14977194368839264, "learning_rate": 1.6566994817063823e-05, "loss": 0.4336, "mean_token_accuracy": 0.8590404614806175, "num_tokens": 868299480.0, "step": 27206 }, { "entropy": 0.5427457811310887, "epoch": 2.503182845412045, "grad_norm": 0.1676873415708542, "learning_rate": 1.6563927990922194e-05, "loss": 0.5338, "mean_token_accuracy": 0.8305167518556118, "num_tokens": 868331563.0, "step": 27207 }, { "entropy": 0.5999596510082483, "epoch": 2.5032748517834857, "grad_norm": 0.17381757497787476, "learning_rate": 1.656086116478057e-05, "loss": 0.5997, "mean_token_accuracy": 0.8114734478294849, "num_tokens": 868362345.0, "step": 27208 }, { "entropy": 0.44535367749631405, "epoch": 2.5033668581549273, "grad_norm": 0.15063001215457916, "learning_rate": 1.6557794338638944e-05, "loss": 0.431, "mean_token_accuracy": 0.8647404089570045, "num_tokens": 868393847.0, "step": 27209 }, { "entropy": 0.42902555502951145, "epoch": 2.5034588645263685, "grad_norm": 0.15312828123569489, "learning_rate": 1.655472751249732e-05, "loss": 0.4213, "mean_token_accuracy": 0.8670597113668919, "num_tokens": 868426420.0, "step": 27210 }, { "entropy": 0.6062885411083698, "epoch": 2.5035508708978096, "grad_norm": 0.1725195199251175, "learning_rate": 1.655166068635569e-05, "loss": 0.5962, "mean_token_accuracy": 0.811867605894804, "num_tokens": 868458258.0, "step": 27211 }, { "entropy": 0.524228603579104, "epoch": 2.503642877269251, "grad_norm": 0.1595715880393982, "learning_rate": 1.6548593860214064e-05, "loss": 0.5258, "mean_token_accuracy": 0.835303008556366, "num_tokens": 868490347.0, "step": 27212 }, { "entropy": 0.5637189541012049, "epoch": 2.503734883640692, "grad_norm": 0.16344305872917175, "learning_rate": 1.654552703407244e-05, "loss": 0.5545, "mean_token_accuracy": 0.8230182603001595, "num_tokens": 868522404.0, "step": 27213 }, { "entropy": 0.6300210282206535, "epoch": 2.5038268900121334, "grad_norm": 0.17643220722675323, "learning_rate": 1.6542460207930814e-05, "loss": 0.6139, "mean_token_accuracy": 0.8084288015961647, "num_tokens": 868553683.0, "step": 27214 }, { "entropy": 0.44790993025526404, "epoch": 2.5039188963835746, "grad_norm": 0.14721418917179108, "learning_rate": 1.6539393381789188e-05, "loss": 0.4283, "mean_token_accuracy": 0.8625769950449467, "num_tokens": 868585809.0, "step": 27215 }, { "entropy": 0.43055208306759596, "epoch": 2.5040109027550157, "grad_norm": 0.14952488243579865, "learning_rate": 1.653632655564756e-05, "loss": 0.4195, "mean_token_accuracy": 0.8647691980004311, "num_tokens": 868617795.0, "step": 27216 }, { "entropy": 0.5518979295156896, "epoch": 2.5041029091264573, "grad_norm": 0.16420741379261017, "learning_rate": 1.6533259729505934e-05, "loss": 0.5419, "mean_token_accuracy": 0.8314022682607174, "num_tokens": 868649991.0, "step": 27217 }, { "entropy": 0.48623468540608883, "epoch": 2.504194915497898, "grad_norm": 0.15891915559768677, "learning_rate": 1.653019290336431e-05, "loss": 0.4758, "mean_token_accuracy": 0.8462763763964176, "num_tokens": 868680926.0, "step": 27218 }, { "entropy": 0.46594120655208826, "epoch": 2.5042869218693395, "grad_norm": 0.15907537937164307, "learning_rate": 1.6527126077222683e-05, "loss": 0.4656, "mean_token_accuracy": 0.8507650531828403, "num_tokens": 868713089.0, "step": 27219 }, { "entropy": 0.5162785425782204, "epoch": 2.5043789282407807, "grad_norm": 0.15826886892318726, "learning_rate": 1.6524059251081055e-05, "loss": 0.5043, "mean_token_accuracy": 0.8383590616285801, "num_tokens": 868744771.0, "step": 27220 }, { "entropy": 0.46331943944096565, "epoch": 2.504470934612222, "grad_norm": 0.15549786388874054, "learning_rate": 1.652099242493943e-05, "loss": 0.4633, "mean_token_accuracy": 0.8538318388164043, "num_tokens": 868776332.0, "step": 27221 }, { "entropy": 0.5150128616951406, "epoch": 2.5045629409836634, "grad_norm": 0.16042156517505646, "learning_rate": 1.6517925598797804e-05, "loss": 0.5058, "mean_token_accuracy": 0.8401549682021141, "num_tokens": 868808532.0, "step": 27222 }, { "entropy": 0.5596203710883856, "epoch": 2.504654947355104, "grad_norm": 0.16918465495109558, "learning_rate": 1.651485877265618e-05, "loss": 0.5503, "mean_token_accuracy": 0.8233125805854797, "num_tokens": 868839503.0, "step": 27223 }, { "entropy": 0.4826796390116215, "epoch": 2.5047469537265457, "grad_norm": 0.1537577360868454, "learning_rate": 1.651179194651455e-05, "loss": 0.4648, "mean_token_accuracy": 0.8512575067579746, "num_tokens": 868871620.0, "step": 27224 }, { "entropy": 0.570859344676137, "epoch": 2.504838960097987, "grad_norm": 0.16557712852954865, "learning_rate": 1.6508725120372928e-05, "loss": 0.5662, "mean_token_accuracy": 0.8224595747888088, "num_tokens": 868903827.0, "step": 27225 }, { "entropy": 0.53622901532799, "epoch": 2.504930966469428, "grad_norm": 0.16242194175720215, "learning_rate": 1.6505658294231303e-05, "loss": 0.5188, "mean_token_accuracy": 0.8345791772007942, "num_tokens": 868936053.0, "step": 27226 }, { "entropy": 0.4236547858454287, "epoch": 2.5050229728408695, "grad_norm": 0.14361628890037537, "learning_rate": 1.6502591468089677e-05, "loss": 0.4055, "mean_token_accuracy": 0.870853029191494, "num_tokens": 868967476.0, "step": 27227 }, { "entropy": 0.5694685354828835, "epoch": 2.50511497921231, "grad_norm": 0.1625366508960724, "learning_rate": 1.649952464194805e-05, "loss": 0.5618, "mean_token_accuracy": 0.8238913267850876, "num_tokens": 868999795.0, "step": 27228 }, { "entropy": 0.47845237189903855, "epoch": 2.5052069855837518, "grad_norm": 0.15244247019290924, "learning_rate": 1.6496457815806423e-05, "loss": 0.4603, "mean_token_accuracy": 0.8522653952240944, "num_tokens": 869031402.0, "step": 27229 }, { "entropy": 0.5360496900975704, "epoch": 2.505298991955193, "grad_norm": 0.16595807671546936, "learning_rate": 1.6493390989664798e-05, "loss": 0.5311, "mean_token_accuracy": 0.8306511901319027, "num_tokens": 869062869.0, "step": 27230 }, { "entropy": 0.48203565925359726, "epoch": 2.505390998326634, "grad_norm": 0.1620766669511795, "learning_rate": 1.6490324163523172e-05, "loss": 0.4582, "mean_token_accuracy": 0.8506702184677124, "num_tokens": 869093867.0, "step": 27231 }, { "entropy": 0.5465827472507954, "epoch": 2.5054830046980756, "grad_norm": 0.16295498609542847, "learning_rate": 1.6487257337381544e-05, "loss": 0.5379, "mean_token_accuracy": 0.8282242268323898, "num_tokens": 869126635.0, "step": 27232 }, { "entropy": 0.5694139888510108, "epoch": 2.5055750110695163, "grad_norm": 0.16509808599948883, "learning_rate": 1.648419051123992e-05, "loss": 0.5492, "mean_token_accuracy": 0.8253688327968121, "num_tokens": 869158504.0, "step": 27233 }, { "entropy": 0.4623823086731136, "epoch": 2.505667017440958, "grad_norm": 0.15618398785591125, "learning_rate": 1.6481123685098293e-05, "loss": 0.4527, "mean_token_accuracy": 0.8537643998861313, "num_tokens": 869190464.0, "step": 27234 }, { "entropy": 0.6014164164662361, "epoch": 2.505759023812399, "grad_norm": 0.17194025218486786, "learning_rate": 1.6478056858956668e-05, "loss": 0.6041, "mean_token_accuracy": 0.8092698715627193, "num_tokens": 869222764.0, "step": 27235 }, { "entropy": 0.5530129047110677, "epoch": 2.50585103018384, "grad_norm": 0.16558867692947388, "learning_rate": 1.6474990032815042e-05, "loss": 0.5487, "mean_token_accuracy": 0.8314695172011852, "num_tokens": 869254196.0, "step": 27236 }, { "entropy": 0.5361601561307907, "epoch": 2.5059430365552817, "grad_norm": 0.1612609177827835, "learning_rate": 1.6471923206673414e-05, "loss": 0.5209, "mean_token_accuracy": 0.8370138667523861, "num_tokens": 869286686.0, "step": 27237 }, { "entropy": 0.5449646092019975, "epoch": 2.5060350429267224, "grad_norm": 0.16229864954948425, "learning_rate": 1.6468856380531788e-05, "loss": 0.5363, "mean_token_accuracy": 0.8307640440762043, "num_tokens": 869319071.0, "step": 27238 }, { "entropy": 0.5302569391205907, "epoch": 2.506127049298164, "grad_norm": 0.15917547047138214, "learning_rate": 1.6465789554390163e-05, "loss": 0.5195, "mean_token_accuracy": 0.837843980640173, "num_tokens": 869350895.0, "step": 27239 }, { "entropy": 0.4770815437659621, "epoch": 2.506219055669605, "grad_norm": 0.15550585091114044, "learning_rate": 1.6462722728248537e-05, "loss": 0.4661, "mean_token_accuracy": 0.8537984862923622, "num_tokens": 869383306.0, "step": 27240 }, { "entropy": 0.5791897168383002, "epoch": 2.5063110620410463, "grad_norm": 0.16181965172290802, "learning_rate": 1.645965590210691e-05, "loss": 0.5477, "mean_token_accuracy": 0.8256833031773567, "num_tokens": 869414946.0, "step": 27241 }, { "entropy": 0.563239187002182, "epoch": 2.506403068412488, "grad_norm": 0.16495740413665771, "learning_rate": 1.6456589075965283e-05, "loss": 0.5541, "mean_token_accuracy": 0.8281440958380699, "num_tokens": 869447106.0, "step": 27242 }, { "entropy": 0.5943867992609739, "epoch": 2.5064950747839285, "grad_norm": 0.166884183883667, "learning_rate": 1.6453522249823658e-05, "loss": 0.5735, "mean_token_accuracy": 0.8186848387122154, "num_tokens": 869479610.0, "step": 27243 }, { "entropy": 0.4643085291609168, "epoch": 2.50658708115537, "grad_norm": 0.1582583487033844, "learning_rate": 1.6450455423682033e-05, "loss": 0.455, "mean_token_accuracy": 0.8573878891766071, "num_tokens": 869510676.0, "step": 27244 }, { "entropy": 0.5262798070907593, "epoch": 2.5066790875268112, "grad_norm": 0.16078925132751465, "learning_rate": 1.6447388597540407e-05, "loss": 0.5173, "mean_token_accuracy": 0.8357656300067902, "num_tokens": 869542736.0, "step": 27245 }, { "entropy": 0.5114972814917564, "epoch": 2.5067710938982524, "grad_norm": 0.15387606620788574, "learning_rate": 1.644432177139878e-05, "loss": 0.5038, "mean_token_accuracy": 0.8400791697204113, "num_tokens": 869575174.0, "step": 27246 }, { "entropy": 0.51633754465729, "epoch": 2.506863100269694, "grad_norm": 0.16329076886177063, "learning_rate": 1.6441254945257153e-05, "loss": 0.4944, "mean_token_accuracy": 0.8409492634236813, "num_tokens": 869606458.0, "step": 27247 }, { "entropy": 0.6231646183878183, "epoch": 2.5069551066411346, "grad_norm": 0.17134925723075867, "learning_rate": 1.6438188119115528e-05, "loss": 0.6035, "mean_token_accuracy": 0.8139513358473778, "num_tokens": 869638535.0, "step": 27248 }, { "entropy": 0.5380160007625818, "epoch": 2.507047113012576, "grad_norm": 0.15896500647068024, "learning_rate": 1.6435121292973903e-05, "loss": 0.5155, "mean_token_accuracy": 0.8378744833171368, "num_tokens": 869670940.0, "step": 27249 }, { "entropy": 0.5141032373066992, "epoch": 2.5071391193840173, "grad_norm": 0.15968142449855804, "learning_rate": 1.6432054466832274e-05, "loss": 0.4951, "mean_token_accuracy": 0.8421454094350338, "num_tokens": 869702992.0, "step": 27250 }, { "entropy": 0.5119600370526314, "epoch": 2.5072311257554585, "grad_norm": 0.16182978451251984, "learning_rate": 1.642898764069065e-05, "loss": 0.5018, "mean_token_accuracy": 0.8395995572209358, "num_tokens": 869734743.0, "step": 27251 }, { "entropy": 0.43412564881145954, "epoch": 2.5073231321269, "grad_norm": 0.15559828281402588, "learning_rate": 1.6425920814549023e-05, "loss": 0.4231, "mean_token_accuracy": 0.8642477840185165, "num_tokens": 869767100.0, "step": 27252 }, { "entropy": 0.5653922986239195, "epoch": 2.5074151384983407, "grad_norm": 0.16697345674037933, "learning_rate": 1.6422853988407398e-05, "loss": 0.5614, "mean_token_accuracy": 0.8200481869280338, "num_tokens": 869798457.0, "step": 27253 }, { "entropy": 0.5355486460030079, "epoch": 2.5075071448697823, "grad_norm": 0.1650409698486328, "learning_rate": 1.641978716226577e-05, "loss": 0.5262, "mean_token_accuracy": 0.8339042514562607, "num_tokens": 869830280.0, "step": 27254 }, { "entropy": 0.48371898382902145, "epoch": 2.5075991512412235, "grad_norm": 0.15929394960403442, "learning_rate": 1.6416720336124147e-05, "loss": 0.4673, "mean_token_accuracy": 0.8517575711011887, "num_tokens": 869861152.0, "step": 27255 }, { "entropy": 0.43803169298917055, "epoch": 2.5076911576126646, "grad_norm": 0.1540970504283905, "learning_rate": 1.641365350998252e-05, "loss": 0.4373, "mean_token_accuracy": 0.8609082922339439, "num_tokens": 869893303.0, "step": 27256 }, { "entropy": 0.5019344985485077, "epoch": 2.507783163984106, "grad_norm": 0.16099002957344055, "learning_rate": 1.6410586683840896e-05, "loss": 0.4925, "mean_token_accuracy": 0.8427834287285805, "num_tokens": 869925567.0, "step": 27257 }, { "entropy": 0.5677878288552165, "epoch": 2.507875170355547, "grad_norm": 0.1632666140794754, "learning_rate": 1.6407519857699268e-05, "loss": 0.5584, "mean_token_accuracy": 0.8241563700139523, "num_tokens": 869957030.0, "step": 27258 }, { "entropy": 0.44450607150793076, "epoch": 2.5079671767269884, "grad_norm": 0.15050168335437775, "learning_rate": 1.6404453031557642e-05, "loss": 0.437, "mean_token_accuracy": 0.8614283911883831, "num_tokens": 869989374.0, "step": 27259 }, { "entropy": 0.4490528148598969, "epoch": 2.5080591830984296, "grad_norm": 0.15214599668979645, "learning_rate": 1.6401386205416017e-05, "loss": 0.435, "mean_token_accuracy": 0.8603278808295727, "num_tokens": 870021518.0, "step": 27260 }, { "entropy": 0.5749696269631386, "epoch": 2.5081511894698707, "grad_norm": 0.16733598709106445, "learning_rate": 1.639831937927439e-05, "loss": 0.5698, "mean_token_accuracy": 0.8210006766021252, "num_tokens": 870054181.0, "step": 27261 }, { "entropy": 0.4882448147982359, "epoch": 2.5082431958413123, "grad_norm": 0.1556159406900406, "learning_rate": 1.6395252553132763e-05, "loss": 0.469, "mean_token_accuracy": 0.8482438959181309, "num_tokens": 870086463.0, "step": 27262 }, { "entropy": 0.5256573054939508, "epoch": 2.508335202212753, "grad_norm": 0.1626521348953247, "learning_rate": 1.6392185726991137e-05, "loss": 0.5119, "mean_token_accuracy": 0.8378248624503613, "num_tokens": 870119038.0, "step": 27263 }, { "entropy": 0.4960642894729972, "epoch": 2.5084272085841945, "grad_norm": 0.1582111120223999, "learning_rate": 1.6389118900849512e-05, "loss": 0.4835, "mean_token_accuracy": 0.8484436795115471, "num_tokens": 870150869.0, "step": 27264 }, { "entropy": 0.5658022165298462, "epoch": 2.5085192149556357, "grad_norm": 0.16643761098384857, "learning_rate": 1.6386052074707887e-05, "loss": 0.5544, "mean_token_accuracy": 0.821894109249115, "num_tokens": 870182242.0, "step": 27265 }, { "entropy": 0.5016528405249119, "epoch": 2.508611221327077, "grad_norm": 0.1582150012254715, "learning_rate": 1.638298524856626e-05, "loss": 0.492, "mean_token_accuracy": 0.8421121686697006, "num_tokens": 870214452.0, "step": 27266 }, { "entropy": 0.5860534822568297, "epoch": 2.5087032276985184, "grad_norm": 0.17070937156677246, "learning_rate": 1.6379918422424633e-05, "loss": 0.5765, "mean_token_accuracy": 0.822305653244257, "num_tokens": 870245880.0, "step": 27267 }, { "entropy": 0.45323833264410496, "epoch": 2.508795234069959, "grad_norm": 0.14953738451004028, "learning_rate": 1.6376851596283007e-05, "loss": 0.4381, "mean_token_accuracy": 0.8581569269299507, "num_tokens": 870278542.0, "step": 27268 }, { "entropy": 0.4557606466114521, "epoch": 2.5088872404414007, "grad_norm": 0.15327931940555573, "learning_rate": 1.6373784770141382e-05, "loss": 0.4487, "mean_token_accuracy": 0.8580162227153778, "num_tokens": 870310725.0, "step": 27269 }, { "entropy": 0.44891584501601756, "epoch": 2.508979246812842, "grad_norm": 0.14626148343086243, "learning_rate": 1.6370717943999757e-05, "loss": 0.4282, "mean_token_accuracy": 0.865389995276928, "num_tokens": 870342594.0, "step": 27270 }, { "entropy": 0.543222757987678, "epoch": 2.509071253184283, "grad_norm": 0.16039639711380005, "learning_rate": 1.6367651117858128e-05, "loss": 0.5262, "mean_token_accuracy": 0.8306580260396004, "num_tokens": 870374532.0, "step": 27271 }, { "entropy": 0.5473461616784334, "epoch": 2.5091632595557245, "grad_norm": 0.1682865023612976, "learning_rate": 1.6364584291716502e-05, "loss": 0.5366, "mean_token_accuracy": 0.830856192857027, "num_tokens": 870406532.0, "step": 27272 }, { "entropy": 0.5398308141157031, "epoch": 2.509255265927165, "grad_norm": 0.16247177124023438, "learning_rate": 1.6361517465574877e-05, "loss": 0.528, "mean_token_accuracy": 0.8351245671510696, "num_tokens": 870439300.0, "step": 27273 }, { "entropy": 0.4691578187048435, "epoch": 2.5093472722986068, "grad_norm": 0.15207727253437042, "learning_rate": 1.6358450639433252e-05, "loss": 0.4491, "mean_token_accuracy": 0.8548619747161865, "num_tokens": 870471139.0, "step": 27274 }, { "entropy": 0.502510279417038, "epoch": 2.509439278670048, "grad_norm": 0.16719263792037964, "learning_rate": 1.6355383813291626e-05, "loss": 0.4974, "mean_token_accuracy": 0.8413188494741917, "num_tokens": 870502380.0, "step": 27275 }, { "entropy": 0.4761591460555792, "epoch": 2.509531285041489, "grad_norm": 0.15221677720546722, "learning_rate": 1.6352316987149998e-05, "loss": 0.4623, "mean_token_accuracy": 0.8524927571415901, "num_tokens": 870534712.0, "step": 27276 }, { "entropy": 0.5524165194947273, "epoch": 2.5096232914129306, "grad_norm": 0.16413874924182892, "learning_rate": 1.6349250161008372e-05, "loss": 0.542, "mean_token_accuracy": 0.8293341808021069, "num_tokens": 870565918.0, "step": 27277 }, { "entropy": 0.4848499083891511, "epoch": 2.5097152977843713, "grad_norm": 0.1566833108663559, "learning_rate": 1.6346183334866747e-05, "loss": 0.4739, "mean_token_accuracy": 0.8458973504602909, "num_tokens": 870598113.0, "step": 27278 }, { "entropy": 0.532508990727365, "epoch": 2.509807304155813, "grad_norm": 0.16592878103256226, "learning_rate": 1.634311650872512e-05, "loss": 0.5216, "mean_token_accuracy": 0.8354321829974651, "num_tokens": 870630216.0, "step": 27279 }, { "entropy": 0.5699373371899128, "epoch": 2.509899310527254, "grad_norm": 0.16476163268089294, "learning_rate": 1.6340049682583493e-05, "loss": 0.5707, "mean_token_accuracy": 0.8167874924838543, "num_tokens": 870662467.0, "step": 27280 }, { "entropy": 0.5184783507138491, "epoch": 2.509991316898695, "grad_norm": 0.15912941098213196, "learning_rate": 1.6336982856441868e-05, "loss": 0.514, "mean_token_accuracy": 0.8378495499491692, "num_tokens": 870694839.0, "step": 27281 }, { "entropy": 0.5815288871526718, "epoch": 2.5100833232701367, "grad_norm": 0.16371795535087585, "learning_rate": 1.6333916030300242e-05, "loss": 0.5671, "mean_token_accuracy": 0.8213624358177185, "num_tokens": 870727410.0, "step": 27282 }, { "entropy": 0.49952840618789196, "epoch": 2.5101753296415774, "grad_norm": 0.16089484095573425, "learning_rate": 1.6330849204158617e-05, "loss": 0.4988, "mean_token_accuracy": 0.8431074358522892, "num_tokens": 870759788.0, "step": 27283 }, { "entropy": 0.41906084935180843, "epoch": 2.510267336013019, "grad_norm": 0.15122567117214203, "learning_rate": 1.6327782378016988e-05, "loss": 0.4135, "mean_token_accuracy": 0.8683419860899448, "num_tokens": 870791293.0, "step": 27284 }, { "entropy": 0.5078394776210189, "epoch": 2.51035934238446, "grad_norm": 0.16225160658359528, "learning_rate": 1.6324715551875363e-05, "loss": 0.4991, "mean_token_accuracy": 0.8425630442798138, "num_tokens": 870823866.0, "step": 27285 }, { "entropy": 0.548699707724154, "epoch": 2.5104513487559013, "grad_norm": 0.1592131406068802, "learning_rate": 1.632164872573374e-05, "loss": 0.5425, "mean_token_accuracy": 0.8277553543448448, "num_tokens": 870856389.0, "step": 27286 }, { "entropy": 0.5389552935957909, "epoch": 2.510543355127343, "grad_norm": 0.1606113612651825, "learning_rate": 1.6318581899592115e-05, "loss": 0.5306, "mean_token_accuracy": 0.8366191610693932, "num_tokens": 870888845.0, "step": 27287 }, { "entropy": 0.5620732298120856, "epoch": 2.5106353614987835, "grad_norm": 0.16411571204662323, "learning_rate": 1.6315515073450487e-05, "loss": 0.549, "mean_token_accuracy": 0.8269773460924625, "num_tokens": 870920577.0, "step": 27288 }, { "entropy": 0.6551814991980791, "epoch": 2.510727367870225, "grad_norm": 0.17015638947486877, "learning_rate": 1.631244824730886e-05, "loss": 0.6421, "mean_token_accuracy": 0.7971304878592491, "num_tokens": 870952785.0, "step": 27289 }, { "entropy": 0.5268676816485822, "epoch": 2.5108193742416662, "grad_norm": 0.16712723672389984, "learning_rate": 1.6309381421167236e-05, "loss": 0.5246, "mean_token_accuracy": 0.8340361677110195, "num_tokens": 870985016.0, "step": 27290 }, { "entropy": 0.4494405922014266, "epoch": 2.5109113806131074, "grad_norm": 0.15136274695396423, "learning_rate": 1.630631459502561e-05, "loss": 0.4338, "mean_token_accuracy": 0.863076277077198, "num_tokens": 871016565.0, "step": 27291 }, { "entropy": 0.5559796467423439, "epoch": 2.511003386984549, "grad_norm": 0.16534116864204407, "learning_rate": 1.6303247768883982e-05, "loss": 0.5271, "mean_token_accuracy": 0.8352772295475006, "num_tokens": 871049333.0, "step": 27292 }, { "entropy": 0.46432723570615053, "epoch": 2.5110953933559896, "grad_norm": 0.15152141451835632, "learning_rate": 1.6300180942742357e-05, "loss": 0.4532, "mean_token_accuracy": 0.8527020923793316, "num_tokens": 871081783.0, "step": 27293 }, { "entropy": 0.5716440845280886, "epoch": 2.511187399727431, "grad_norm": 0.1655314564704895, "learning_rate": 1.629711411660073e-05, "loss": 0.5587, "mean_token_accuracy": 0.8270396552979946, "num_tokens": 871114124.0, "step": 27294 }, { "entropy": 0.5733606070280075, "epoch": 2.5112794060988723, "grad_norm": 0.1718057245016098, "learning_rate": 1.6294047290459106e-05, "loss": 0.579, "mean_token_accuracy": 0.8167405761778355, "num_tokens": 871145649.0, "step": 27295 }, { "entropy": 0.5469632185995579, "epoch": 2.5113714124703135, "grad_norm": 0.16190919280052185, "learning_rate": 1.629098046431748e-05, "loss": 0.5395, "mean_token_accuracy": 0.8282879665493965, "num_tokens": 871178115.0, "step": 27296 }, { "entropy": 0.5115541024133563, "epoch": 2.511463418841755, "grad_norm": 0.1609124094247818, "learning_rate": 1.6287913638175852e-05, "loss": 0.4961, "mean_token_accuracy": 0.8440234288573265, "num_tokens": 871210668.0, "step": 27297 }, { "entropy": 0.5065490796696395, "epoch": 2.5115554252131957, "grad_norm": 0.16211511194705963, "learning_rate": 1.6284846812034226e-05, "loss": 0.5011, "mean_token_accuracy": 0.8393410183489323, "num_tokens": 871242507.0, "step": 27298 }, { "entropy": 0.5115646347403526, "epoch": 2.5116474315846373, "grad_norm": 0.16170728206634521, "learning_rate": 1.62817799858926e-05, "loss": 0.4912, "mean_token_accuracy": 0.8399313613772392, "num_tokens": 871273925.0, "step": 27299 }, { "entropy": 0.42442187294363976, "epoch": 2.5117394379560785, "grad_norm": 0.14864636957645416, "learning_rate": 1.6278713159750976e-05, "loss": 0.4153, "mean_token_accuracy": 0.8681810274720192, "num_tokens": 871305745.0, "step": 27300 }, { "entropy": 0.516277099493891, "epoch": 2.5118314443275196, "grad_norm": 0.15707072615623474, "learning_rate": 1.6275646333609347e-05, "loss": 0.5023, "mean_token_accuracy": 0.8410394042730331, "num_tokens": 871337783.0, "step": 27301 }, { "entropy": 0.5621011666953564, "epoch": 2.511923450698961, "grad_norm": 0.1666930615901947, "learning_rate": 1.627257950746772e-05, "loss": 0.5534, "mean_token_accuracy": 0.8272883035242558, "num_tokens": 871369163.0, "step": 27302 }, { "entropy": 0.6234706649556756, "epoch": 2.512015457070402, "grad_norm": 0.1702185869216919, "learning_rate": 1.6269512681326096e-05, "loss": 0.6183, "mean_token_accuracy": 0.8090721257030964, "num_tokens": 871401070.0, "step": 27303 }, { "entropy": 0.4289499609731138, "epoch": 2.5121074634418434, "grad_norm": 0.14284799993038177, "learning_rate": 1.626644585518447e-05, "loss": 0.4105, "mean_token_accuracy": 0.8695724159479141, "num_tokens": 871433481.0, "step": 27304 }, { "entropy": 0.6088764481246471, "epoch": 2.5121994698132846, "grad_norm": 0.1720663160085678, "learning_rate": 1.6263379029042846e-05, "loss": 0.5972, "mean_token_accuracy": 0.8124589063227177, "num_tokens": 871464148.0, "step": 27305 }, { "entropy": 0.4875169894658029, "epoch": 2.5122914761847257, "grad_norm": 0.15151870250701904, "learning_rate": 1.6260312202901217e-05, "loss": 0.464, "mean_token_accuracy": 0.8519046977162361, "num_tokens": 871496313.0, "step": 27306 }, { "entropy": 0.5110763711854815, "epoch": 2.5123834825561673, "grad_norm": 0.15804500877857208, "learning_rate": 1.625724537675959e-05, "loss": 0.5033, "mean_token_accuracy": 0.8406185172498226, "num_tokens": 871528338.0, "step": 27307 }, { "entropy": 0.4311844832263887, "epoch": 2.512475488927608, "grad_norm": 0.14220060408115387, "learning_rate": 1.6254178550617966e-05, "loss": 0.4148, "mean_token_accuracy": 0.8680256754159927, "num_tokens": 871560952.0, "step": 27308 }, { "entropy": 0.5216938182711601, "epoch": 2.5125674952990495, "grad_norm": 0.16328288614749908, "learning_rate": 1.625111172447634e-05, "loss": 0.5202, "mean_token_accuracy": 0.8370471745729446, "num_tokens": 871593110.0, "step": 27309 }, { "entropy": 0.4894604757428169, "epoch": 2.5126595016704907, "grad_norm": 0.15125149488449097, "learning_rate": 1.6248044898334712e-05, "loss": 0.4785, "mean_token_accuracy": 0.8468519374728203, "num_tokens": 871624890.0, "step": 27310 }, { "entropy": 0.42757780384272337, "epoch": 2.512751508041932, "grad_norm": 0.1472858190536499, "learning_rate": 1.6244978072193087e-05, "loss": 0.4205, "mean_token_accuracy": 0.8637354001402855, "num_tokens": 871656741.0, "step": 27311 }, { "entropy": 0.5550139313563704, "epoch": 2.5128435144133734, "grad_norm": 0.16487830877304077, "learning_rate": 1.624191124605146e-05, "loss": 0.5489, "mean_token_accuracy": 0.8287834860384464, "num_tokens": 871688499.0, "step": 27312 }, { "entropy": 0.5586722590960562, "epoch": 2.512935520784814, "grad_norm": 0.16693705320358276, "learning_rate": 1.6238844419909836e-05, "loss": 0.5528, "mean_token_accuracy": 0.8246204480528831, "num_tokens": 871721095.0, "step": 27313 }, { "entropy": 0.559432290494442, "epoch": 2.5130275271562557, "grad_norm": 0.1637842357158661, "learning_rate": 1.6235777593768207e-05, "loss": 0.5439, "mean_token_accuracy": 0.8273477479815483, "num_tokens": 871752031.0, "step": 27314 }, { "entropy": 0.5904718916863203, "epoch": 2.513119533527697, "grad_norm": 0.17185701429843903, "learning_rate": 1.6232710767626582e-05, "loss": 0.5816, "mean_token_accuracy": 0.8124543018639088, "num_tokens": 871783598.0, "step": 27315 }, { "entropy": 0.5569889564067125, "epoch": 2.513211539899138, "grad_norm": 0.16683340072631836, "learning_rate": 1.622964394148496e-05, "loss": 0.5486, "mean_token_accuracy": 0.8208978995680809, "num_tokens": 871815122.0, "step": 27316 }, { "entropy": 0.5561720747500658, "epoch": 2.5133035462705795, "grad_norm": 0.16686441004276276, "learning_rate": 1.6226577115343335e-05, "loss": 0.5532, "mean_token_accuracy": 0.8236128687858582, "num_tokens": 871846936.0, "step": 27317 }, { "entropy": 0.5621066745370626, "epoch": 2.51339555264202, "grad_norm": 0.16629917919635773, "learning_rate": 1.6223510289201706e-05, "loss": 0.5489, "mean_token_accuracy": 0.8290707431733608, "num_tokens": 871878945.0, "step": 27318 }, { "entropy": 0.48783658538013697, "epoch": 2.5134875590134618, "grad_norm": 0.1563485860824585, "learning_rate": 1.622044346306008e-05, "loss": 0.4753, "mean_token_accuracy": 0.8465032987296581, "num_tokens": 871911031.0, "step": 27319 }, { "entropy": 0.5503398990258574, "epoch": 2.513579565384903, "grad_norm": 0.16624018549919128, "learning_rate": 1.6217376636918455e-05, "loss": 0.5416, "mean_token_accuracy": 0.8276874385774136, "num_tokens": 871942680.0, "step": 27320 }, { "entropy": 0.5188472752925009, "epoch": 2.513671571756344, "grad_norm": 0.16028647124767303, "learning_rate": 1.621430981077683e-05, "loss": 0.5105, "mean_token_accuracy": 0.8392045758664608, "num_tokens": 871974248.0, "step": 27321 }, { "entropy": 0.5068162400275469, "epoch": 2.5137635781277856, "grad_norm": 0.15573029220104218, "learning_rate": 1.62112429846352e-05, "loss": 0.4851, "mean_token_accuracy": 0.844241552054882, "num_tokens": 872006518.0, "step": 27322 }, { "entropy": 0.5400262624025345, "epoch": 2.5138555844992263, "grad_norm": 0.16604219377040863, "learning_rate": 1.6208176158493576e-05, "loss": 0.5222, "mean_token_accuracy": 0.8328912146389484, "num_tokens": 872038189.0, "step": 27323 }, { "entropy": 0.6170321833342314, "epoch": 2.513947590870668, "grad_norm": 0.16937682032585144, "learning_rate": 1.620510933235195e-05, "loss": 0.6012, "mean_token_accuracy": 0.8109753280878067, "num_tokens": 872070555.0, "step": 27324 }, { "entropy": 0.4336993810720742, "epoch": 2.514039597242109, "grad_norm": 0.15100562572479248, "learning_rate": 1.6202042506210325e-05, "loss": 0.4183, "mean_token_accuracy": 0.8655639477074146, "num_tokens": 872102475.0, "step": 27325 }, { "entropy": 0.5380606083199382, "epoch": 2.51413160361355, "grad_norm": 0.16286827623844147, "learning_rate": 1.61989756800687e-05, "loss": 0.5251, "mean_token_accuracy": 0.8315814733505249, "num_tokens": 872133696.0, "step": 27326 }, { "entropy": 0.5224732924252748, "epoch": 2.5142236099849917, "grad_norm": 0.16622228920459747, "learning_rate": 1.619590885392707e-05, "loss": 0.5204, "mean_token_accuracy": 0.8371834047138691, "num_tokens": 872166053.0, "step": 27327 }, { "entropy": 0.4530913205817342, "epoch": 2.5143156163564324, "grad_norm": 0.15323829650878906, "learning_rate": 1.6192842027785445e-05, "loss": 0.4388, "mean_token_accuracy": 0.8594505824148655, "num_tokens": 872198362.0, "step": 27328 }, { "entropy": 0.4774752839002758, "epoch": 2.514407622727874, "grad_norm": 0.1532161384820938, "learning_rate": 1.618977520164382e-05, "loss": 0.4566, "mean_token_accuracy": 0.852659847587347, "num_tokens": 872230319.0, "step": 27329 }, { "entropy": 0.5511252209544182, "epoch": 2.514499629099315, "grad_norm": 0.1621730923652649, "learning_rate": 1.6186708375502195e-05, "loss": 0.5446, "mean_token_accuracy": 0.8271098956465721, "num_tokens": 872262824.0, "step": 27330 }, { "entropy": 0.6171340271830559, "epoch": 2.5145916354707563, "grad_norm": 0.17404523491859436, "learning_rate": 1.6183641549360566e-05, "loss": 0.6037, "mean_token_accuracy": 0.8085016310214996, "num_tokens": 872294169.0, "step": 27331 }, { "entropy": 0.5040015261620283, "epoch": 2.514683641842198, "grad_norm": 0.15880663692951202, "learning_rate": 1.618057472321894e-05, "loss": 0.4922, "mean_token_accuracy": 0.8426836095750332, "num_tokens": 872325596.0, "step": 27332 }, { "entropy": 0.3912375245708972, "epoch": 2.5147756482136385, "grad_norm": 0.1427338868379593, "learning_rate": 1.6177507897077315e-05, "loss": 0.3769, "mean_token_accuracy": 0.8761796616017818, "num_tokens": 872356550.0, "step": 27333 }, { "entropy": 0.5545766651630402, "epoch": 2.51486765458508, "grad_norm": 0.16699329018592834, "learning_rate": 1.617444107093569e-05, "loss": 0.55, "mean_token_accuracy": 0.8274734616279602, "num_tokens": 872388368.0, "step": 27334 }, { "entropy": 0.5144259417429566, "epoch": 2.5149596609565212, "grad_norm": 0.15882156789302826, "learning_rate": 1.6171374244794065e-05, "loss": 0.5161, "mean_token_accuracy": 0.8359752297401428, "num_tokens": 872420279.0, "step": 27335 }, { "entropy": 0.47829891461879015, "epoch": 2.5150516673279624, "grad_norm": 0.15179988741874695, "learning_rate": 1.6168307418652436e-05, "loss": 0.4581, "mean_token_accuracy": 0.852763470262289, "num_tokens": 872452394.0, "step": 27336 }, { "entropy": 0.48446539393626153, "epoch": 2.515143673699404, "grad_norm": 0.15410739183425903, "learning_rate": 1.616524059251081e-05, "loss": 0.4713, "mean_token_accuracy": 0.8511681035161018, "num_tokens": 872484390.0, "step": 27337 }, { "entropy": 0.6038760058581829, "epoch": 2.5152356800708446, "grad_norm": 0.1744147092103958, "learning_rate": 1.6162173766369185e-05, "loss": 0.5967, "mean_token_accuracy": 0.8121825009584427, "num_tokens": 872515556.0, "step": 27338 }, { "entropy": 0.5212838733568788, "epoch": 2.515327686442286, "grad_norm": 0.16570964455604553, "learning_rate": 1.615910694022756e-05, "loss": 0.5196, "mean_token_accuracy": 0.8344423696398735, "num_tokens": 872548042.0, "step": 27339 }, { "entropy": 0.4989027122501284, "epoch": 2.5154196928137273, "grad_norm": 0.1627015322446823, "learning_rate": 1.615604011408593e-05, "loss": 0.4928, "mean_token_accuracy": 0.8422199860215187, "num_tokens": 872579230.0, "step": 27340 }, { "entropy": 0.5882809516042471, "epoch": 2.5155116991851685, "grad_norm": 0.1685372292995453, "learning_rate": 1.6152973287944306e-05, "loss": 0.5843, "mean_token_accuracy": 0.8154678791761398, "num_tokens": 872611209.0, "step": 27341 }, { "entropy": 0.4851894788444042, "epoch": 2.51560370555661, "grad_norm": 0.15407022833824158, "learning_rate": 1.614990646180268e-05, "loss": 0.4766, "mean_token_accuracy": 0.8493667654693127, "num_tokens": 872643610.0, "step": 27342 }, { "entropy": 0.6322556678205729, "epoch": 2.5156957119280507, "grad_norm": 0.16994355618953705, "learning_rate": 1.6146839635661055e-05, "loss": 0.619, "mean_token_accuracy": 0.8054135739803314, "num_tokens": 872676035.0, "step": 27343 }, { "entropy": 0.49711337708868086, "epoch": 2.5157877182994923, "grad_norm": 0.15733668208122253, "learning_rate": 1.6143772809519426e-05, "loss": 0.4786, "mean_token_accuracy": 0.8445518985390663, "num_tokens": 872708411.0, "step": 27344 }, { "entropy": 0.5649159047752619, "epoch": 2.5158797246709335, "grad_norm": 0.1627017855644226, "learning_rate": 1.61407059833778e-05, "loss": 0.5511, "mean_token_accuracy": 0.8270583786070347, "num_tokens": 872740056.0, "step": 27345 }, { "entropy": 0.5081013040617108, "epoch": 2.5159717310423746, "grad_norm": 0.1561659872531891, "learning_rate": 1.6137639157236176e-05, "loss": 0.4924, "mean_token_accuracy": 0.8439699299633503, "num_tokens": 872771617.0, "step": 27346 }, { "entropy": 0.44329064060002565, "epoch": 2.516063737413816, "grad_norm": 0.15429925918579102, "learning_rate": 1.6134572331094554e-05, "loss": 0.431, "mean_token_accuracy": 0.8579886257648468, "num_tokens": 872802607.0, "step": 27347 }, { "entropy": 0.562725548632443, "epoch": 2.516155743785257, "grad_norm": 0.16414380073547363, "learning_rate": 1.6131505504952925e-05, "loss": 0.5582, "mean_token_accuracy": 0.8239606730639935, "num_tokens": 872834837.0, "step": 27348 }, { "entropy": 0.5327634224668145, "epoch": 2.5162477501566984, "grad_norm": 0.16787871718406677, "learning_rate": 1.61284386788113e-05, "loss": 0.5343, "mean_token_accuracy": 0.8359359391033649, "num_tokens": 872866374.0, "step": 27349 }, { "entropy": 0.4403064213693142, "epoch": 2.5163397565281396, "grad_norm": 0.14938019216060638, "learning_rate": 1.6125371852669674e-05, "loss": 0.4196, "mean_token_accuracy": 0.8648174740374088, "num_tokens": 872897742.0, "step": 27350 }, { "entropy": 0.48852445650845766, "epoch": 2.5164317628995807, "grad_norm": 0.15427175164222717, "learning_rate": 1.612230502652805e-05, "loss": 0.4754, "mean_token_accuracy": 0.8537684790790081, "num_tokens": 872929458.0, "step": 27351 }, { "entropy": 0.4400868574157357, "epoch": 2.5165237692710223, "grad_norm": 0.15252923965454102, "learning_rate": 1.611923820038642e-05, "loss": 0.4272, "mean_token_accuracy": 0.8647445812821388, "num_tokens": 872961347.0, "step": 27352 }, { "entropy": 0.553059303201735, "epoch": 2.516615775642463, "grad_norm": 0.16863089799880981, "learning_rate": 1.6116171374244795e-05, "loss": 0.5479, "mean_token_accuracy": 0.828367080539465, "num_tokens": 872993153.0, "step": 27353 }, { "entropy": 0.5393837792798877, "epoch": 2.5167077820139045, "grad_norm": 0.1609755903482437, "learning_rate": 1.611310454810317e-05, "loss": 0.5297, "mean_token_accuracy": 0.8306908048689365, "num_tokens": 873025215.0, "step": 27354 }, { "entropy": 0.4486816180869937, "epoch": 2.5167997883853457, "grad_norm": 0.1500260978937149, "learning_rate": 1.6110037721961544e-05, "loss": 0.4233, "mean_token_accuracy": 0.8623133860528469, "num_tokens": 873057442.0, "step": 27355 }, { "entropy": 0.49229345843195915, "epoch": 2.516891794756787, "grad_norm": 0.15831784904003143, "learning_rate": 1.610697089581992e-05, "loss": 0.4756, "mean_token_accuracy": 0.8508256860077381, "num_tokens": 873088670.0, "step": 27356 }, { "entropy": 0.5817677639424801, "epoch": 2.5169838011282284, "grad_norm": 0.17289134860038757, "learning_rate": 1.610390406967829e-05, "loss": 0.5613, "mean_token_accuracy": 0.8210476748645306, "num_tokens": 873119035.0, "step": 27357 }, { "entropy": 0.499105891212821, "epoch": 2.517075807499669, "grad_norm": 0.15032711625099182, "learning_rate": 1.6100837243536665e-05, "loss": 0.4755, "mean_token_accuracy": 0.8501176051795483, "num_tokens": 873151312.0, "step": 27358 }, { "entropy": 0.6008208636194468, "epoch": 2.5171678138711107, "grad_norm": 0.16836901009082794, "learning_rate": 1.609777041739504e-05, "loss": 0.5917, "mean_token_accuracy": 0.810894925147295, "num_tokens": 873183279.0, "step": 27359 }, { "entropy": 0.48385611653793603, "epoch": 2.517259820242552, "grad_norm": 0.15739081799983978, "learning_rate": 1.6094703591253414e-05, "loss": 0.4834, "mean_token_accuracy": 0.8458703719079494, "num_tokens": 873215067.0, "step": 27360 }, { "entropy": 0.47587295714765787, "epoch": 2.517351826613993, "grad_norm": 0.15448878705501556, "learning_rate": 1.6091636765111785e-05, "loss": 0.4727, "mean_token_accuracy": 0.847880195826292, "num_tokens": 873247020.0, "step": 27361 }, { "entropy": 0.48009174410253763, "epoch": 2.5174438329854345, "grad_norm": 0.15720973908901215, "learning_rate": 1.608856993897016e-05, "loss": 0.4545, "mean_token_accuracy": 0.8523613773286343, "num_tokens": 873277627.0, "step": 27362 }, { "entropy": 0.41928697749972343, "epoch": 2.517535839356875, "grad_norm": 0.1470060497522354, "learning_rate": 1.6085503112828534e-05, "loss": 0.4103, "mean_token_accuracy": 0.8690248541533947, "num_tokens": 873310215.0, "step": 27363 }, { "entropy": 0.5179541986435652, "epoch": 2.5176278457283168, "grad_norm": 0.15831492841243744, "learning_rate": 1.608243628668691e-05, "loss": 0.5099, "mean_token_accuracy": 0.8403728306293488, "num_tokens": 873342471.0, "step": 27364 }, { "entropy": 0.5830502640455961, "epoch": 2.517719852099758, "grad_norm": 0.1656288355588913, "learning_rate": 1.6079369460545284e-05, "loss": 0.5747, "mean_token_accuracy": 0.818856094032526, "num_tokens": 873374813.0, "step": 27365 }, { "entropy": 0.4498228342272341, "epoch": 2.517811858471199, "grad_norm": 0.14895884692668915, "learning_rate": 1.6076302634403655e-05, "loss": 0.4321, "mean_token_accuracy": 0.8636327013373375, "num_tokens": 873407078.0, "step": 27366 }, { "entropy": 0.5148942060768604, "epoch": 2.5179038648426406, "grad_norm": 0.15631800889968872, "learning_rate": 1.607323580826203e-05, "loss": 0.5013, "mean_token_accuracy": 0.8439406491816044, "num_tokens": 873439485.0, "step": 27367 }, { "entropy": 0.5353624848648906, "epoch": 2.5179958712140813, "grad_norm": 0.1622074842453003, "learning_rate": 1.6070168982120404e-05, "loss": 0.5152, "mean_token_accuracy": 0.8355393782258034, "num_tokens": 873470881.0, "step": 27368 }, { "entropy": 0.5478932117111981, "epoch": 2.518087877585523, "grad_norm": 0.16138894855976105, "learning_rate": 1.606710215597878e-05, "loss": 0.542, "mean_token_accuracy": 0.828082200139761, "num_tokens": 873502843.0, "step": 27369 }, { "entropy": 0.5139928865246475, "epoch": 2.518179883956964, "grad_norm": 0.16412080824375153, "learning_rate": 1.606403532983715e-05, "loss": 0.5096, "mean_token_accuracy": 0.8381833843886852, "num_tokens": 873535087.0, "step": 27370 }, { "entropy": 0.5086610638536513, "epoch": 2.518271890328405, "grad_norm": 0.15716910362243652, "learning_rate": 1.6060968503695525e-05, "loss": 0.493, "mean_token_accuracy": 0.8428498990833759, "num_tokens": 873567438.0, "step": 27371 }, { "entropy": 0.4617308476008475, "epoch": 2.5183638966998467, "grad_norm": 0.15141859650611877, "learning_rate": 1.60579016775539e-05, "loss": 0.4484, "mean_token_accuracy": 0.8557691872119904, "num_tokens": 873599697.0, "step": 27372 }, { "entropy": 0.6098173260688782, "epoch": 2.5184559030712874, "grad_norm": 0.1756729930639267, "learning_rate": 1.6054834851412274e-05, "loss": 0.5947, "mean_token_accuracy": 0.8125628940761089, "num_tokens": 873631910.0, "step": 27373 }, { "entropy": 0.6165027506649494, "epoch": 2.518547909442729, "grad_norm": 0.17201462388038635, "learning_rate": 1.6051768025270645e-05, "loss": 0.6039, "mean_token_accuracy": 0.8072566762566566, "num_tokens": 873663529.0, "step": 27374 }, { "entropy": 0.5262299086898565, "epoch": 2.51863991581417, "grad_norm": 0.16517052054405212, "learning_rate": 1.604870119912902e-05, "loss": 0.5029, "mean_token_accuracy": 0.8392763212323189, "num_tokens": 873694463.0, "step": 27375 }, { "entropy": 0.5126118683256209, "epoch": 2.5187319221856113, "grad_norm": 0.16343125700950623, "learning_rate": 1.6045634372987395e-05, "loss": 0.498, "mean_token_accuracy": 0.8387521579861641, "num_tokens": 873726252.0, "step": 27376 }, { "entropy": 0.4579858845099807, "epoch": 2.518823928557053, "grad_norm": 0.15232136845588684, "learning_rate": 1.6042567546845773e-05, "loss": 0.4419, "mean_token_accuracy": 0.8565392717719078, "num_tokens": 873758492.0, "step": 27377 }, { "entropy": 0.5461467448621988, "epoch": 2.5189159349284935, "grad_norm": 0.16369883716106415, "learning_rate": 1.6039500720704144e-05, "loss": 0.5308, "mean_token_accuracy": 0.8312388397753239, "num_tokens": 873790317.0, "step": 27378 }, { "entropy": 0.43956895684823394, "epoch": 2.519007941299935, "grad_norm": 0.15131250023841858, "learning_rate": 1.603643389456252e-05, "loss": 0.4314, "mean_token_accuracy": 0.8628479726612568, "num_tokens": 873822002.0, "step": 27379 }, { "entropy": 0.38500533858314157, "epoch": 2.5190999476713762, "grad_norm": 0.13957661390304565, "learning_rate": 1.6033367068420893e-05, "loss": 0.3696, "mean_token_accuracy": 0.8820347562432289, "num_tokens": 873853742.0, "step": 27380 }, { "entropy": 0.40893311984837055, "epoch": 2.5191919540428174, "grad_norm": 0.14826303720474243, "learning_rate": 1.6030300242279268e-05, "loss": 0.3961, "mean_token_accuracy": 0.8738729543983936, "num_tokens": 873886263.0, "step": 27381 }, { "entropy": 0.5157372066751122, "epoch": 2.519283960414259, "grad_norm": 0.16359320282936096, "learning_rate": 1.602723341613764e-05, "loss": 0.512, "mean_token_accuracy": 0.8394507206976414, "num_tokens": 873917829.0, "step": 27382 }, { "entropy": 0.5357468519359827, "epoch": 2.5193759667856996, "grad_norm": 0.15807276964187622, "learning_rate": 1.6024166589996014e-05, "loss": 0.5251, "mean_token_accuracy": 0.8325831666588783, "num_tokens": 873950059.0, "step": 27383 }, { "entropy": 0.4871191466227174, "epoch": 2.519467973157141, "grad_norm": 0.1547524482011795, "learning_rate": 1.602109976385439e-05, "loss": 0.4608, "mean_token_accuracy": 0.8510080799460411, "num_tokens": 873981332.0, "step": 27384 }, { "entropy": 0.5828242935240269, "epoch": 2.5195599795285823, "grad_norm": 0.16879898309707642, "learning_rate": 1.6018032937712763e-05, "loss": 0.5721, "mean_token_accuracy": 0.8195721432566643, "num_tokens": 874012996.0, "step": 27385 }, { "entropy": 0.497200945392251, "epoch": 2.5196519859000235, "grad_norm": 0.1545996069908142, "learning_rate": 1.6014966111571138e-05, "loss": 0.4859, "mean_token_accuracy": 0.8461237587034702, "num_tokens": 874045192.0, "step": 27386 }, { "entropy": 0.5487806918099523, "epoch": 2.519743992271465, "grad_norm": 0.16419769823551178, "learning_rate": 1.601189928542951e-05, "loss": 0.5286, "mean_token_accuracy": 0.8321946375072002, "num_tokens": 874077186.0, "step": 27387 }, { "entropy": 0.5343973506242037, "epoch": 2.5198359986429057, "grad_norm": 0.16236022114753723, "learning_rate": 1.6008832459287884e-05, "loss": 0.5247, "mean_token_accuracy": 0.8338335603475571, "num_tokens": 874108309.0, "step": 27388 }, { "entropy": 0.4682199206436053, "epoch": 2.5199280050143473, "grad_norm": 0.1570669561624527, "learning_rate": 1.600576563314626e-05, "loss": 0.4582, "mean_token_accuracy": 0.8546743765473366, "num_tokens": 874140537.0, "step": 27389 }, { "entropy": 0.4792602742090821, "epoch": 2.5200200113857885, "grad_norm": 0.1492931842803955, "learning_rate": 1.6002698807004633e-05, "loss": 0.4699, "mean_token_accuracy": 0.8502393923699856, "num_tokens": 874172792.0, "step": 27390 }, { "entropy": 0.4895400167442858, "epoch": 2.5201120177572296, "grad_norm": 0.1574285924434662, "learning_rate": 1.5999631980863004e-05, "loss": 0.4765, "mean_token_accuracy": 0.8484074138104916, "num_tokens": 874205005.0, "step": 27391 }, { "entropy": 0.6324395909905434, "epoch": 2.520204024128671, "grad_norm": 0.1738874465227127, "learning_rate": 1.599656515472138e-05, "loss": 0.6226, "mean_token_accuracy": 0.8037400245666504, "num_tokens": 874236541.0, "step": 27392 }, { "entropy": 0.5708115622401237, "epoch": 2.520296030500112, "grad_norm": 0.1638810634613037, "learning_rate": 1.5993498328579754e-05, "loss": 0.5532, "mean_token_accuracy": 0.8257911391556263, "num_tokens": 874268938.0, "step": 27393 }, { "entropy": 0.6009352440014482, "epoch": 2.5203880368715534, "grad_norm": 0.16584403812885284, "learning_rate": 1.5990431502438128e-05, "loss": 0.5847, "mean_token_accuracy": 0.8160592913627625, "num_tokens": 874301261.0, "step": 27394 }, { "entropy": 0.5669063422828913, "epoch": 2.5204800432429946, "grad_norm": 0.16362112760543823, "learning_rate": 1.5987364676296503e-05, "loss": 0.5613, "mean_token_accuracy": 0.820243775844574, "num_tokens": 874333512.0, "step": 27395 }, { "entropy": 0.44478536397218704, "epoch": 2.5205720496144357, "grad_norm": 0.1522369235754013, "learning_rate": 1.5984297850154874e-05, "loss": 0.4293, "mean_token_accuracy": 0.8635677434504032, "num_tokens": 874365812.0, "step": 27396 }, { "entropy": 0.4694756790995598, "epoch": 2.5206640559858773, "grad_norm": 0.15832118690013885, "learning_rate": 1.598123102401325e-05, "loss": 0.4684, "mean_token_accuracy": 0.8543919026851654, "num_tokens": 874397905.0, "step": 27397 }, { "entropy": 0.5247847940772772, "epoch": 2.520756062357318, "grad_norm": 0.16309210658073425, "learning_rate": 1.5978164197871623e-05, "loss": 0.5188, "mean_token_accuracy": 0.8340024538338184, "num_tokens": 874429853.0, "step": 27398 }, { "entropy": 0.48008991219103336, "epoch": 2.5208480687287596, "grad_norm": 0.15751798450946808, "learning_rate": 1.5975097371729998e-05, "loss": 0.4652, "mean_token_accuracy": 0.8515659123659134, "num_tokens": 874461491.0, "step": 27399 }, { "entropy": 0.47537325602024794, "epoch": 2.5209400751002007, "grad_norm": 0.15624359250068665, "learning_rate": 1.597203054558837e-05, "loss": 0.4665, "mean_token_accuracy": 0.8493224009871483, "num_tokens": 874493734.0, "step": 27400 }, { "entropy": 0.5270224148407578, "epoch": 2.521032081471642, "grad_norm": 0.16454975306987762, "learning_rate": 1.5968963719446744e-05, "loss": 0.5287, "mean_token_accuracy": 0.8329074494540691, "num_tokens": 874526036.0, "step": 27401 }, { "entropy": 0.5470715090632439, "epoch": 2.5211240878430834, "grad_norm": 0.16190378367900848, "learning_rate": 1.596589689330512e-05, "loss": 0.5404, "mean_token_accuracy": 0.8290186487138271, "num_tokens": 874557799.0, "step": 27402 }, { "entropy": 0.4984541479498148, "epoch": 2.521216094214524, "grad_norm": 0.15699659287929535, "learning_rate": 1.5962830067163493e-05, "loss": 0.4797, "mean_token_accuracy": 0.845769289880991, "num_tokens": 874589797.0, "step": 27403 }, { "entropy": 0.48988337349146605, "epoch": 2.5213081005859657, "grad_norm": 0.16161449253559113, "learning_rate": 1.5959763241021864e-05, "loss": 0.4862, "mean_token_accuracy": 0.8481257036328316, "num_tokens": 874621382.0, "step": 27404 }, { "entropy": 0.5123094888404012, "epoch": 2.521400106957407, "grad_norm": 0.1672327071428299, "learning_rate": 1.595669641488024e-05, "loss": 0.5085, "mean_token_accuracy": 0.8372073695063591, "num_tokens": 874652786.0, "step": 27405 }, { "entropy": 0.5565647054463625, "epoch": 2.521492113328848, "grad_norm": 0.16806094348430634, "learning_rate": 1.5953629588738614e-05, "loss": 0.5519, "mean_token_accuracy": 0.8226103819906712, "num_tokens": 874684617.0, "step": 27406 }, { "entropy": 0.5002845535054803, "epoch": 2.5215841197002895, "grad_norm": 0.15713122487068176, "learning_rate": 1.595056276259699e-05, "loss": 0.4893, "mean_token_accuracy": 0.8422419093549252, "num_tokens": 874716711.0, "step": 27407 }, { "entropy": 0.5224656462669373, "epoch": 2.52167612607173, "grad_norm": 0.16447943449020386, "learning_rate": 1.5947495936455363e-05, "loss": 0.5142, "mean_token_accuracy": 0.8351786844432354, "num_tokens": 874748813.0, "step": 27408 }, { "entropy": 0.587095096707344, "epoch": 2.5217681324431718, "grad_norm": 0.16795964539051056, "learning_rate": 1.5944429110313738e-05, "loss": 0.5673, "mean_token_accuracy": 0.8163065277040005, "num_tokens": 874780072.0, "step": 27409 }, { "entropy": 0.5127437796909362, "epoch": 2.521860138814613, "grad_norm": 0.16352304816246033, "learning_rate": 1.5941362284172112e-05, "loss": 0.5018, "mean_token_accuracy": 0.844820462167263, "num_tokens": 874811669.0, "step": 27410 }, { "entropy": 0.48183506075292826, "epoch": 2.521952145186054, "grad_norm": 0.15877023339271545, "learning_rate": 1.5938295458030487e-05, "loss": 0.4704, "mean_token_accuracy": 0.8491338044404984, "num_tokens": 874844050.0, "step": 27411 }, { "entropy": 0.4896266176365316, "epoch": 2.5220441515574956, "grad_norm": 0.15315556526184082, "learning_rate": 1.5935228631888858e-05, "loss": 0.4809, "mean_token_accuracy": 0.8464682027697563, "num_tokens": 874876281.0, "step": 27412 }, { "entropy": 0.43802048824727535, "epoch": 2.5221361579289363, "grad_norm": 0.15659768879413605, "learning_rate": 1.5932161805747233e-05, "loss": 0.4297, "mean_token_accuracy": 0.8632519133388996, "num_tokens": 874907412.0, "step": 27413 }, { "entropy": 0.4858498042449355, "epoch": 2.522228164300378, "grad_norm": 0.15265125036239624, "learning_rate": 1.5929094979605608e-05, "loss": 0.478, "mean_token_accuracy": 0.8477685339748859, "num_tokens": 874939584.0, "step": 27414 }, { "entropy": 0.5436322437599301, "epoch": 2.522320170671819, "grad_norm": 0.16111387312412262, "learning_rate": 1.5926028153463982e-05, "loss": 0.5344, "mean_token_accuracy": 0.8334721848368645, "num_tokens": 874972041.0, "step": 27415 }, { "entropy": 0.48557755071669817, "epoch": 2.52241217704326, "grad_norm": 0.15844425559043884, "learning_rate": 1.5922961327322357e-05, "loss": 0.4722, "mean_token_accuracy": 0.8456205353140831, "num_tokens": 875003990.0, "step": 27416 }, { "entropy": 0.5152215557172894, "epoch": 2.5225041834147017, "grad_norm": 0.16447441279888153, "learning_rate": 1.5919894501180728e-05, "loss": 0.5034, "mean_token_accuracy": 0.8388889171183109, "num_tokens": 875035901.0, "step": 27417 }, { "entropy": 0.5126299284165725, "epoch": 2.5225961897861424, "grad_norm": 0.1571342647075653, "learning_rate": 1.5916827675039103e-05, "loss": 0.4912, "mean_token_accuracy": 0.8452944941818714, "num_tokens": 875068496.0, "step": 27418 }, { "entropy": 0.5165267731063068, "epoch": 2.522688196157584, "grad_norm": 0.15632468461990356, "learning_rate": 1.5913760848897477e-05, "loss": 0.4942, "mean_token_accuracy": 0.8446237593889236, "num_tokens": 875100420.0, "step": 27419 }, { "entropy": 0.5491517521440983, "epoch": 2.522780202529025, "grad_norm": 0.1606752723455429, "learning_rate": 1.5910694022755852e-05, "loss": 0.5326, "mean_token_accuracy": 0.8309700153768063, "num_tokens": 875132040.0, "step": 27420 }, { "entropy": 0.5190220223739743, "epoch": 2.5228722089004663, "grad_norm": 0.15830779075622559, "learning_rate": 1.5907627196614223e-05, "loss": 0.5112, "mean_token_accuracy": 0.8377459086477757, "num_tokens": 875164699.0, "step": 27421 }, { "entropy": 0.5430251490324736, "epoch": 2.522964215271908, "grad_norm": 0.1629553735256195, "learning_rate": 1.5904560370472598e-05, "loss": 0.5302, "mean_token_accuracy": 0.8348071984946728, "num_tokens": 875196209.0, "step": 27422 }, { "entropy": 0.47360848635435104, "epoch": 2.5230562216433485, "grad_norm": 0.15489597618579865, "learning_rate": 1.5901493544330973e-05, "loss": 0.4657, "mean_token_accuracy": 0.8528396598994732, "num_tokens": 875228204.0, "step": 27423 }, { "entropy": 0.5196735952049494, "epoch": 2.52314822801479, "grad_norm": 0.16496476531028748, "learning_rate": 1.5898426718189347e-05, "loss": 0.5176, "mean_token_accuracy": 0.8400709331035614, "num_tokens": 875259762.0, "step": 27424 }, { "entropy": 0.5847544841235504, "epoch": 2.5232402343862312, "grad_norm": 0.164348766207695, "learning_rate": 1.5895359892047722e-05, "loss": 0.575, "mean_token_accuracy": 0.8207120969891548, "num_tokens": 875292000.0, "step": 27425 }, { "entropy": 0.5561698793899268, "epoch": 2.5233322407576724, "grad_norm": 0.17496031522750854, "learning_rate": 1.5892293065906093e-05, "loss": 0.5596, "mean_token_accuracy": 0.8232961259782314, "num_tokens": 875323933.0, "step": 27426 }, { "entropy": 0.5137750906869769, "epoch": 2.523424247129114, "grad_norm": 0.16097278892993927, "learning_rate": 1.5889226239764468e-05, "loss": 0.5111, "mean_token_accuracy": 0.8392200469970703, "num_tokens": 875355926.0, "step": 27427 }, { "entropy": 0.520591888576746, "epoch": 2.5235162535005546, "grad_norm": 0.15591204166412354, "learning_rate": 1.5886159413622842e-05, "loss": 0.5152, "mean_token_accuracy": 0.83790597692132, "num_tokens": 875388530.0, "step": 27428 }, { "entropy": 0.5471139415167272, "epoch": 2.523608259871996, "grad_norm": 0.16030386090278625, "learning_rate": 1.5883092587481217e-05, "loss": 0.5317, "mean_token_accuracy": 0.8331948034465313, "num_tokens": 875419995.0, "step": 27429 }, { "entropy": 0.5092904400080442, "epoch": 2.5237002662434374, "grad_norm": 0.16275154054164886, "learning_rate": 1.588002576133959e-05, "loss": 0.4821, "mean_token_accuracy": 0.8422192074358463, "num_tokens": 875451516.0, "step": 27430 }, { "entropy": 0.538079890422523, "epoch": 2.5237922726148785, "grad_norm": 0.1626659333705902, "learning_rate": 1.5876958935197963e-05, "loss": 0.5364, "mean_token_accuracy": 0.8309925049543381, "num_tokens": 875484106.0, "step": 27431 }, { "entropy": 0.6103739340323955, "epoch": 2.52388427898632, "grad_norm": 0.16759122908115387, "learning_rate": 1.5873892109056338e-05, "loss": 0.5978, "mean_token_accuracy": 0.8119603954255581, "num_tokens": 875516234.0, "step": 27432 }, { "entropy": 0.5045324107632041, "epoch": 2.5239762853577608, "grad_norm": 0.15990100800991058, "learning_rate": 1.5870825282914712e-05, "loss": 0.5049, "mean_token_accuracy": 0.8405160307884216, "num_tokens": 875548622.0, "step": 27433 }, { "entropy": 0.55286521371454, "epoch": 2.5240682917292023, "grad_norm": 0.1586671769618988, "learning_rate": 1.5867758456773084e-05, "loss": 0.545, "mean_token_accuracy": 0.8285384848713875, "num_tokens": 875580888.0, "step": 27434 }, { "entropy": 0.4328466239385307, "epoch": 2.5241602981006435, "grad_norm": 0.14809869229793549, "learning_rate": 1.5864691630631458e-05, "loss": 0.4167, "mean_token_accuracy": 0.86696857213974, "num_tokens": 875613251.0, "step": 27435 }, { "entropy": 0.47596043860539794, "epoch": 2.5242523044720846, "grad_norm": 0.14769789576530457, "learning_rate": 1.5861624804489833e-05, "loss": 0.461, "mean_token_accuracy": 0.8540057763457298, "num_tokens": 875645316.0, "step": 27436 }, { "entropy": 0.5226264391094446, "epoch": 2.524344310843526, "grad_norm": 0.1602407991886139, "learning_rate": 1.5858557978348208e-05, "loss": 0.5147, "mean_token_accuracy": 0.8393892012536526, "num_tokens": 875677251.0, "step": 27437 }, { "entropy": 0.4491984536871314, "epoch": 2.524436317214967, "grad_norm": 0.1431845724582672, "learning_rate": 1.5855491152206582e-05, "loss": 0.4323, "mean_token_accuracy": 0.8617666624486446, "num_tokens": 875709297.0, "step": 27438 }, { "entropy": 0.480281338095665, "epoch": 2.5245283235864084, "grad_norm": 0.15728360414505005, "learning_rate": 1.5852424326064957e-05, "loss": 0.4696, "mean_token_accuracy": 0.8523573614656925, "num_tokens": 875741502.0, "step": 27439 }, { "entropy": 0.4958770480006933, "epoch": 2.5246203299578496, "grad_norm": 0.15608327090740204, "learning_rate": 1.584935749992333e-05, "loss": 0.4872, "mean_token_accuracy": 0.8426183462142944, "num_tokens": 875773455.0, "step": 27440 }, { "entropy": 0.5277892239391804, "epoch": 2.5247123363292907, "grad_norm": 0.1560017168521881, "learning_rate": 1.5846290673781706e-05, "loss": 0.5056, "mean_token_accuracy": 0.8387358821928501, "num_tokens": 875805027.0, "step": 27441 }, { "entropy": 0.46134413219988346, "epoch": 2.5248043427007323, "grad_norm": 0.1477513611316681, "learning_rate": 1.5843223847640077e-05, "loss": 0.4468, "mean_token_accuracy": 0.8559309840202332, "num_tokens": 875837128.0, "step": 27442 }, { "entropy": 0.5144088473170996, "epoch": 2.524896349072173, "grad_norm": 0.15814988315105438, "learning_rate": 1.5840157021498452e-05, "loss": 0.5007, "mean_token_accuracy": 0.8428749702870846, "num_tokens": 875868640.0, "step": 27443 }, { "entropy": 0.4711019927635789, "epoch": 2.5249883554436146, "grad_norm": 0.15537592768669128, "learning_rate": 1.5837090195356827e-05, "loss": 0.4656, "mean_token_accuracy": 0.8519451692700386, "num_tokens": 875900921.0, "step": 27444 }, { "entropy": 0.44539497466757894, "epoch": 2.5250803618150557, "grad_norm": 0.1476946324110031, "learning_rate": 1.58340233692152e-05, "loss": 0.4266, "mean_token_accuracy": 0.8592703007161617, "num_tokens": 875932902.0, "step": 27445 }, { "entropy": 0.5789714399725199, "epoch": 2.525172368186497, "grad_norm": 0.1657513529062271, "learning_rate": 1.5830956543073576e-05, "loss": 0.5694, "mean_token_accuracy": 0.8237077705562115, "num_tokens": 875965547.0, "step": 27446 }, { "entropy": 0.6030786978080869, "epoch": 2.5252643745579384, "grad_norm": 0.16530683636665344, "learning_rate": 1.5827889716931947e-05, "loss": 0.5869, "mean_token_accuracy": 0.8166493698954582, "num_tokens": 875997748.0, "step": 27447 }, { "entropy": 0.533460165373981, "epoch": 2.525356380929379, "grad_norm": 0.16507165133953094, "learning_rate": 1.5824822890790322e-05, "loss": 0.5163, "mean_token_accuracy": 0.8365520611405373, "num_tokens": 876029263.0, "step": 27448 }, { "entropy": 0.5153732653707266, "epoch": 2.5254483873008207, "grad_norm": 0.1589367538690567, "learning_rate": 1.5821756064648697e-05, "loss": 0.5133, "mean_token_accuracy": 0.8401929587125778, "num_tokens": 876062031.0, "step": 27449 }, { "entropy": 0.4786268789321184, "epoch": 2.525540393672262, "grad_norm": 0.14933931827545166, "learning_rate": 1.581868923850707e-05, "loss": 0.4633, "mean_token_accuracy": 0.8536046929657459, "num_tokens": 876094124.0, "step": 27450 }, { "entropy": 0.4765734316315502, "epoch": 2.525632400043703, "grad_norm": 0.15111184120178223, "learning_rate": 1.5815622412365442e-05, "loss": 0.464, "mean_token_accuracy": 0.8547043800354004, "num_tokens": 876126474.0, "step": 27451 }, { "entropy": 0.4707715711556375, "epoch": 2.5257244064151445, "grad_norm": 0.15071971714496613, "learning_rate": 1.5812555586223817e-05, "loss": 0.4527, "mean_token_accuracy": 0.8558223694562912, "num_tokens": 876158901.0, "step": 27452 }, { "entropy": 0.5306273940950632, "epoch": 2.525816412786585, "grad_norm": 0.1573346108198166, "learning_rate": 1.5809488760082192e-05, "loss": 0.5114, "mean_token_accuracy": 0.8396140336990356, "num_tokens": 876191262.0, "step": 27453 }, { "entropy": 0.5021675489842892, "epoch": 2.5259084191580268, "grad_norm": 0.16539280116558075, "learning_rate": 1.5806421933940566e-05, "loss": 0.5041, "mean_token_accuracy": 0.8412122093141079, "num_tokens": 876223065.0, "step": 27454 }, { "entropy": 0.5648883078247309, "epoch": 2.526000425529468, "grad_norm": 0.16555853188037872, "learning_rate": 1.580335510779894e-05, "loss": 0.5539, "mean_token_accuracy": 0.8233447447419167, "num_tokens": 876254750.0, "step": 27455 }, { "entropy": 0.5124786077067256, "epoch": 2.526092431900909, "grad_norm": 0.16242370009422302, "learning_rate": 1.5800288281657312e-05, "loss": 0.501, "mean_token_accuracy": 0.8422171026468277, "num_tokens": 876286556.0, "step": 27456 }, { "entropy": 0.46018351381644607, "epoch": 2.5261844382723506, "grad_norm": 0.15337993204593658, "learning_rate": 1.5797221455515687e-05, "loss": 0.4563, "mean_token_accuracy": 0.8555104061961174, "num_tokens": 876317892.0, "step": 27457 }, { "entropy": 0.5231654159724712, "epoch": 2.5262764446437913, "grad_norm": 0.15943196415901184, "learning_rate": 1.579415462937406e-05, "loss": 0.4956, "mean_token_accuracy": 0.838602177798748, "num_tokens": 876348555.0, "step": 27458 }, { "entropy": 0.46921875327825546, "epoch": 2.526368451015233, "grad_norm": 0.1530439555644989, "learning_rate": 1.5791087803232436e-05, "loss": 0.4598, "mean_token_accuracy": 0.8528440818190575, "num_tokens": 876380190.0, "step": 27459 }, { "entropy": 0.5228902316885069, "epoch": 2.526460457386674, "grad_norm": 0.16136863827705383, "learning_rate": 1.5788020977090807e-05, "loss": 0.5003, "mean_token_accuracy": 0.8399910256266594, "num_tokens": 876411694.0, "step": 27460 }, { "entropy": 0.44269856717437506, "epoch": 2.526552463758115, "grad_norm": 0.1454673707485199, "learning_rate": 1.5784954150949182e-05, "loss": 0.4181, "mean_token_accuracy": 0.8657635524868965, "num_tokens": 876444034.0, "step": 27461 }, { "entropy": 0.4654745073057711, "epoch": 2.5266444701295567, "grad_norm": 0.15138272941112518, "learning_rate": 1.5781887324807557e-05, "loss": 0.4454, "mean_token_accuracy": 0.859241783618927, "num_tokens": 876476366.0, "step": 27462 }, { "entropy": 0.493172368966043, "epoch": 2.5267364765009974, "grad_norm": 0.15462853014469147, "learning_rate": 1.577882049866593e-05, "loss": 0.4785, "mean_token_accuracy": 0.8462599217891693, "num_tokens": 876508913.0, "step": 27463 }, { "entropy": 0.5222478155046701, "epoch": 2.526828482872439, "grad_norm": 0.1633201688528061, "learning_rate": 1.5775753672524303e-05, "loss": 0.5166, "mean_token_accuracy": 0.8364397324621677, "num_tokens": 876540372.0, "step": 27464 }, { "entropy": 0.5099381704349071, "epoch": 2.52692048924388, "grad_norm": 0.16216552257537842, "learning_rate": 1.5772686846382677e-05, "loss": 0.4963, "mean_token_accuracy": 0.8413417264819145, "num_tokens": 876571680.0, "step": 27465 }, { "entropy": 0.625681210309267, "epoch": 2.5270124956153213, "grad_norm": 0.16886277496814728, "learning_rate": 1.5769620020241052e-05, "loss": 0.6094, "mean_token_accuracy": 0.8118008188903332, "num_tokens": 876604031.0, "step": 27466 }, { "entropy": 0.5147204101085663, "epoch": 2.527104501986763, "grad_norm": 0.15502889454364777, "learning_rate": 1.5766553194099427e-05, "loss": 0.506, "mean_token_accuracy": 0.8406480476260185, "num_tokens": 876635800.0, "step": 27467 }, { "entropy": 0.5153487864881754, "epoch": 2.5271965083582035, "grad_norm": 0.1647031158208847, "learning_rate": 1.57634863679578e-05, "loss": 0.5095, "mean_token_accuracy": 0.8342233933508396, "num_tokens": 876666976.0, "step": 27468 }, { "entropy": 0.5815051114186645, "epoch": 2.527288514729645, "grad_norm": 0.1691960245370865, "learning_rate": 1.5760419541816176e-05, "loss": 0.5752, "mean_token_accuracy": 0.8184362053871155, "num_tokens": 876699167.0, "step": 27469 }, { "entropy": 0.5391943622380495, "epoch": 2.5273805211010862, "grad_norm": 0.16202569007873535, "learning_rate": 1.575735271567455e-05, "loss": 0.523, "mean_token_accuracy": 0.833130493760109, "num_tokens": 876730671.0, "step": 27470 }, { "entropy": 0.5108699491247535, "epoch": 2.5274725274725274, "grad_norm": 0.16196583211421967, "learning_rate": 1.5754285889532925e-05, "loss": 0.5043, "mean_token_accuracy": 0.8409392274916172, "num_tokens": 876761538.0, "step": 27471 }, { "entropy": 0.5552132949233055, "epoch": 2.527564533843969, "grad_norm": 0.16806524991989136, "learning_rate": 1.5751219063391296e-05, "loss": 0.5389, "mean_token_accuracy": 0.8274839222431183, "num_tokens": 876792149.0, "step": 27472 }, { "entropy": 0.5076961545273662, "epoch": 2.5276565402154096, "grad_norm": 0.16317634284496307, "learning_rate": 1.574815223724967e-05, "loss": 0.496, "mean_token_accuracy": 0.8409505859017372, "num_tokens": 876823970.0, "step": 27473 }, { "entropy": 0.453724421095103, "epoch": 2.527748546586851, "grad_norm": 0.15111248195171356, "learning_rate": 1.5745085411108046e-05, "loss": 0.4433, "mean_token_accuracy": 0.8595317415893078, "num_tokens": 876856069.0, "step": 27474 }, { "entropy": 0.5249647868331522, "epoch": 2.5278405529582924, "grad_norm": 0.16227839887142181, "learning_rate": 1.574201858496642e-05, "loss": 0.5135, "mean_token_accuracy": 0.8368845656514168, "num_tokens": 876888118.0, "step": 27475 }, { "entropy": 0.4838700145483017, "epoch": 2.5279325593297335, "grad_norm": 0.15410631895065308, "learning_rate": 1.5738951758824795e-05, "loss": 0.4684, "mean_token_accuracy": 0.8504349552094936, "num_tokens": 876920159.0, "step": 27476 }, { "entropy": 0.46903597144410014, "epoch": 2.528024565701175, "grad_norm": 0.15238124132156372, "learning_rate": 1.5735884932683166e-05, "loss": 0.4576, "mean_token_accuracy": 0.8526997230947018, "num_tokens": 876951636.0, "step": 27477 }, { "entropy": 0.48863217420876026, "epoch": 2.5281165720726158, "grad_norm": 0.1586627960205078, "learning_rate": 1.573281810654154e-05, "loss": 0.4728, "mean_token_accuracy": 0.8480163365602493, "num_tokens": 876984137.0, "step": 27478 }, { "entropy": 0.43411816586740315, "epoch": 2.5282085784440573, "grad_norm": 0.15043844282627106, "learning_rate": 1.5729751280399916e-05, "loss": 0.4115, "mean_token_accuracy": 0.8660272471606731, "num_tokens": 877015447.0, "step": 27479 }, { "entropy": 0.4489554844330996, "epoch": 2.5283005848154985, "grad_norm": 0.16131889820098877, "learning_rate": 1.572668445425829e-05, "loss": 0.4336, "mean_token_accuracy": 0.8609674721956253, "num_tokens": 877046771.0, "step": 27480 }, { "entropy": 0.5008474923670292, "epoch": 2.5283925911869396, "grad_norm": 0.1575571447610855, "learning_rate": 1.572361762811666e-05, "loss": 0.5018, "mean_token_accuracy": 0.838309857994318, "num_tokens": 877079026.0, "step": 27481 }, { "entropy": 0.4680535839870572, "epoch": 2.528484597558381, "grad_norm": 0.16808687150478363, "learning_rate": 1.5720550801975036e-05, "loss": 0.46, "mean_token_accuracy": 0.8578804023563862, "num_tokens": 877111037.0, "step": 27482 }, { "entropy": 0.5068857748992741, "epoch": 2.528576603929822, "grad_norm": 0.16557247936725616, "learning_rate": 1.571748397583341e-05, "loss": 0.5014, "mean_token_accuracy": 0.842196736484766, "num_tokens": 877143118.0, "step": 27483 }, { "entropy": 0.48419783008284867, "epoch": 2.5286686103012634, "grad_norm": 0.1551390290260315, "learning_rate": 1.5714417149691785e-05, "loss": 0.4658, "mean_token_accuracy": 0.8538440093398094, "num_tokens": 877175208.0, "step": 27484 }, { "entropy": 0.5375168737955391, "epoch": 2.5287606166727046, "grad_norm": 0.1604606807231903, "learning_rate": 1.571135032355016e-05, "loss": 0.524, "mean_token_accuracy": 0.8342262208461761, "num_tokens": 877206741.0, "step": 27485 }, { "entropy": 0.4998793713748455, "epoch": 2.5288526230441457, "grad_norm": 0.16161492466926575, "learning_rate": 1.570828349740853e-05, "loss": 0.4875, "mean_token_accuracy": 0.8448375500738621, "num_tokens": 877238768.0, "step": 27486 }, { "entropy": 0.5300751263275743, "epoch": 2.5289446294155873, "grad_norm": 0.1596415936946869, "learning_rate": 1.5705216671266906e-05, "loss": 0.5284, "mean_token_accuracy": 0.8318420648574829, "num_tokens": 877270753.0, "step": 27487 }, { "entropy": 0.4440357219427824, "epoch": 2.529036635787028, "grad_norm": 0.1501729041337967, "learning_rate": 1.570214984512528e-05, "loss": 0.434, "mean_token_accuracy": 0.8629393614828587, "num_tokens": 877302879.0, "step": 27488 }, { "entropy": 0.5181625299155712, "epoch": 2.5291286421584696, "grad_norm": 0.16118228435516357, "learning_rate": 1.5699083018983655e-05, "loss": 0.5009, "mean_token_accuracy": 0.8412109948694706, "num_tokens": 877334869.0, "step": 27489 }, { "entropy": 0.552944028750062, "epoch": 2.5292206485299107, "grad_norm": 0.161992609500885, "learning_rate": 1.5696016192842027e-05, "loss": 0.5393, "mean_token_accuracy": 0.8309062458574772, "num_tokens": 877366678.0, "step": 27490 }, { "entropy": 0.5928023848682642, "epoch": 2.529312654901352, "grad_norm": 0.17848412692546844, "learning_rate": 1.56929493667004e-05, "loss": 0.5804, "mean_token_accuracy": 0.8165985345840454, "num_tokens": 877397246.0, "step": 27491 }, { "entropy": 0.5797601705417037, "epoch": 2.5294046612727934, "grad_norm": 0.16510623693466187, "learning_rate": 1.5689882540558776e-05, "loss": 0.5638, "mean_token_accuracy": 0.8205288536846638, "num_tokens": 877429168.0, "step": 27492 }, { "entropy": 0.44320044107735157, "epoch": 2.529496667644234, "grad_norm": 0.15158165991306305, "learning_rate": 1.568681571441715e-05, "loss": 0.4354, "mean_token_accuracy": 0.8613980151712894, "num_tokens": 877461511.0, "step": 27493 }, { "entropy": 0.5069229165092111, "epoch": 2.5295886740156757, "grad_norm": 0.15264293551445007, "learning_rate": 1.5683748888275522e-05, "loss": 0.4961, "mean_token_accuracy": 0.8441086485981941, "num_tokens": 877494272.0, "step": 27494 }, { "entropy": 0.4640063834376633, "epoch": 2.529680680387117, "grad_norm": 0.14968790113925934, "learning_rate": 1.5680682062133896e-05, "loss": 0.4555, "mean_token_accuracy": 0.8573169037699699, "num_tokens": 877526801.0, "step": 27495 }, { "entropy": 0.5228749876841903, "epoch": 2.529772686758558, "grad_norm": 0.16092586517333984, "learning_rate": 1.567761523599227e-05, "loss": 0.5145, "mean_token_accuracy": 0.8384511545300484, "num_tokens": 877558630.0, "step": 27496 }, { "entropy": 0.5488126617856324, "epoch": 2.5298646931299995, "grad_norm": 0.16779932379722595, "learning_rate": 1.5674548409850646e-05, "loss": 0.5274, "mean_token_accuracy": 0.8311196751892567, "num_tokens": 877589590.0, "step": 27497 }, { "entropy": 0.5185813987627625, "epoch": 2.52995669950144, "grad_norm": 0.1639403998851776, "learning_rate": 1.567148158370902e-05, "loss": 0.5223, "mean_token_accuracy": 0.8365667760372162, "num_tokens": 877621462.0, "step": 27498 }, { "entropy": 0.576180106960237, "epoch": 2.5300487058728818, "grad_norm": 0.16273555159568787, "learning_rate": 1.5668414757567395e-05, "loss": 0.5661, "mean_token_accuracy": 0.8178860172629356, "num_tokens": 877653920.0, "step": 27499 }, { "entropy": 0.542471868917346, "epoch": 2.530140712244323, "grad_norm": 0.16057731211185455, "learning_rate": 1.566534793142577e-05, "loss": 0.5241, "mean_token_accuracy": 0.8355162926018238, "num_tokens": 877686269.0, "step": 27500 }, { "entropy": 0.4237325391732156, "epoch": 2.530232718615764, "grad_norm": 0.14807851612567902, "learning_rate": 1.5662281105284144e-05, "loss": 0.4168, "mean_token_accuracy": 0.8690475597977638, "num_tokens": 877717913.0, "step": 27501 }, { "entropy": 0.47112299501895905, "epoch": 2.5303247249872056, "grad_norm": 0.15171673893928528, "learning_rate": 1.5659214279142516e-05, "loss": 0.4696, "mean_token_accuracy": 0.8484062030911446, "num_tokens": 877750681.0, "step": 27502 }, { "entropy": 0.40473176073282957, "epoch": 2.5304167313586463, "grad_norm": 0.14488790929317474, "learning_rate": 1.565614745300089e-05, "loss": 0.3877, "mean_token_accuracy": 0.8756334781646729, "num_tokens": 877782772.0, "step": 27503 }, { "entropy": 0.6737252986058593, "epoch": 2.530508737730088, "grad_norm": 0.17597152292728424, "learning_rate": 1.5653080626859265e-05, "loss": 0.6573, "mean_token_accuracy": 0.7949530892074108, "num_tokens": 877815010.0, "step": 27504 }, { "entropy": 0.5384599673561752, "epoch": 2.530600744101529, "grad_norm": 0.15801332890987396, "learning_rate": 1.565001380071764e-05, "loss": 0.5381, "mean_token_accuracy": 0.8340439237654209, "num_tokens": 877847285.0, "step": 27505 }, { "entropy": 0.5098370928317308, "epoch": 2.53069275047297, "grad_norm": 0.15762268006801605, "learning_rate": 1.5646946974576014e-05, "loss": 0.4873, "mean_token_accuracy": 0.8451930955052376, "num_tokens": 877879727.0, "step": 27506 }, { "entropy": 0.572915150783956, "epoch": 2.5307847568444117, "grad_norm": 0.16928155720233917, "learning_rate": 1.5643880148434385e-05, "loss": 0.5535, "mean_token_accuracy": 0.8245499096810818, "num_tokens": 877911218.0, "step": 27507 }, { "entropy": 0.5638852482661605, "epoch": 2.5308767632158524, "grad_norm": 0.1634128987789154, "learning_rate": 1.564081332229276e-05, "loss": 0.5506, "mean_token_accuracy": 0.8265179917216301, "num_tokens": 877943828.0, "step": 27508 }, { "entropy": 0.4954165145754814, "epoch": 2.530968769587294, "grad_norm": 0.15369915962219238, "learning_rate": 1.5637746496151135e-05, "loss": 0.4759, "mean_token_accuracy": 0.8478402085602283, "num_tokens": 877975606.0, "step": 27509 }, { "entropy": 0.5969237210229039, "epoch": 2.531060775958735, "grad_norm": 0.16503946483135223, "learning_rate": 1.563467967000951e-05, "loss": 0.5844, "mean_token_accuracy": 0.8156669810414314, "num_tokens": 878007543.0, "step": 27510 }, { "entropy": 0.47843778133392334, "epoch": 2.5311527823301763, "grad_norm": 0.15193508565425873, "learning_rate": 1.563161284386788e-05, "loss": 0.4572, "mean_token_accuracy": 0.8544701933860779, "num_tokens": 878039478.0, "step": 27511 }, { "entropy": 0.5255174972116947, "epoch": 2.531244788701618, "grad_norm": 0.15960155427455902, "learning_rate": 1.5628546017726255e-05, "loss": 0.5133, "mean_token_accuracy": 0.8393499813973904, "num_tokens": 878071432.0, "step": 27512 }, { "entropy": 0.490228065289557, "epoch": 2.5313367950730585, "grad_norm": 0.1575915664434433, "learning_rate": 1.562547919158463e-05, "loss": 0.4714, "mean_token_accuracy": 0.8486229069530964, "num_tokens": 878102628.0, "step": 27513 }, { "entropy": 0.6649123206734657, "epoch": 2.5314288014445, "grad_norm": 0.174725741147995, "learning_rate": 1.5622412365443005e-05, "loss": 0.6497, "mean_token_accuracy": 0.7932644970715046, "num_tokens": 878134261.0, "step": 27514 }, { "entropy": 0.44295182218775153, "epoch": 2.5315208078159412, "grad_norm": 0.15164050459861755, "learning_rate": 1.561934553930138e-05, "loss": 0.436, "mean_token_accuracy": 0.8584431186318398, "num_tokens": 878166182.0, "step": 27515 }, { "entropy": 0.5781790313776582, "epoch": 2.5316128141873824, "grad_norm": 0.16627256572246552, "learning_rate": 1.561627871315975e-05, "loss": 0.5697, "mean_token_accuracy": 0.8182057961821556, "num_tokens": 878197981.0, "step": 27516 }, { "entropy": 0.5150677300989628, "epoch": 2.531704820558824, "grad_norm": 0.16079694032669067, "learning_rate": 1.5613211887018125e-05, "loss": 0.4922, "mean_token_accuracy": 0.8475242964923382, "num_tokens": 878229392.0, "step": 27517 }, { "entropy": 0.4259915598668158, "epoch": 2.5317968269302646, "grad_norm": 0.1483437418937683, "learning_rate": 1.56101450608765e-05, "loss": 0.4203, "mean_token_accuracy": 0.8679146505892277, "num_tokens": 878261636.0, "step": 27518 }, { "entropy": 0.39985561871435493, "epoch": 2.531888833301706, "grad_norm": 0.1446811556816101, "learning_rate": 1.5607078234734874e-05, "loss": 0.3929, "mean_token_accuracy": 0.8754244074225426, "num_tokens": 878293344.0, "step": 27519 }, { "entropy": 0.49615045823156834, "epoch": 2.5319808396731474, "grad_norm": 0.15605440735816956, "learning_rate": 1.5604011408593246e-05, "loss": 0.4991, "mean_token_accuracy": 0.8433062136173248, "num_tokens": 878325826.0, "step": 27520 }, { "entropy": 0.5003594653680921, "epoch": 2.5320728460445885, "grad_norm": 0.15684251487255096, "learning_rate": 1.560094458245162e-05, "loss": 0.4882, "mean_token_accuracy": 0.8449111469089985, "num_tokens": 878357838.0, "step": 27521 }, { "entropy": 0.5873441081494093, "epoch": 2.53216485241603, "grad_norm": 0.1657245010137558, "learning_rate": 1.5597877756309995e-05, "loss": 0.5634, "mean_token_accuracy": 0.8229261711239815, "num_tokens": 878389677.0, "step": 27522 }, { "entropy": 0.42485205084085464, "epoch": 2.532256858787471, "grad_norm": 0.15110670030117035, "learning_rate": 1.559481093016837e-05, "loss": 0.421, "mean_token_accuracy": 0.8659634590148926, "num_tokens": 878422111.0, "step": 27523 }, { "entropy": 0.5182520179077983, "epoch": 2.5323488651589123, "grad_norm": 0.1598394215106964, "learning_rate": 1.559174410402674e-05, "loss": 0.5069, "mean_token_accuracy": 0.8393749222159386, "num_tokens": 878453637.0, "step": 27524 }, { "entropy": 0.49528797157108784, "epoch": 2.5324408715303535, "grad_norm": 0.1520298570394516, "learning_rate": 1.5588677277885116e-05, "loss": 0.4826, "mean_token_accuracy": 0.8451217748224735, "num_tokens": 878485625.0, "step": 27525 }, { "entropy": 0.49750399589538574, "epoch": 2.5325328779017946, "grad_norm": 0.1577782779932022, "learning_rate": 1.558561045174349e-05, "loss": 0.4793, "mean_token_accuracy": 0.8461775258183479, "num_tokens": 878517458.0, "step": 27526 }, { "entropy": 0.4178681466728449, "epoch": 2.532624884273236, "grad_norm": 0.147279292345047, "learning_rate": 1.5582543625601865e-05, "loss": 0.4093, "mean_token_accuracy": 0.867997832596302, "num_tokens": 878549771.0, "step": 27527 }, { "entropy": 0.5520017528906465, "epoch": 2.5327168906446773, "grad_norm": 0.16381411254405975, "learning_rate": 1.557947679946024e-05, "loss": 0.5359, "mean_token_accuracy": 0.8294366076588631, "num_tokens": 878581632.0, "step": 27528 }, { "entropy": 0.5695761777460575, "epoch": 2.5328088970161184, "grad_norm": 0.17003528773784637, "learning_rate": 1.557640997331861e-05, "loss": 0.562, "mean_token_accuracy": 0.8219980448484421, "num_tokens": 878613468.0, "step": 27529 }, { "entropy": 0.5030977847054601, "epoch": 2.5329009033875596, "grad_norm": 0.16191866993904114, "learning_rate": 1.557334314717699e-05, "loss": 0.4994, "mean_token_accuracy": 0.8451092131435871, "num_tokens": 878645871.0, "step": 27530 }, { "entropy": 0.5385425696149468, "epoch": 2.5329929097590007, "grad_norm": 0.16157513856887817, "learning_rate": 1.5570276321035363e-05, "loss": 0.5325, "mean_token_accuracy": 0.8316142112016678, "num_tokens": 878677993.0, "step": 27531 }, { "entropy": 0.4577763946726918, "epoch": 2.5330849161304423, "grad_norm": 0.15643025934696198, "learning_rate": 1.5567209494893738e-05, "loss": 0.4534, "mean_token_accuracy": 0.8573017753660679, "num_tokens": 878709796.0, "step": 27532 }, { "entropy": 0.48095822241157293, "epoch": 2.5331769225018834, "grad_norm": 0.15646705031394958, "learning_rate": 1.556414266875211e-05, "loss": 0.4762, "mean_token_accuracy": 0.8464099317789078, "num_tokens": 878741509.0, "step": 27533 }, { "entropy": 0.6192661803215742, "epoch": 2.5332689288733246, "grad_norm": 0.1668761968612671, "learning_rate": 1.5561075842610484e-05, "loss": 0.5979, "mean_token_accuracy": 0.8127796463668346, "num_tokens": 878773413.0, "step": 27534 }, { "entropy": 0.5826269127428532, "epoch": 2.5333609352447657, "grad_norm": 0.1697874218225479, "learning_rate": 1.555800901646886e-05, "loss": 0.5747, "mean_token_accuracy": 0.8180871568620205, "num_tokens": 878805909.0, "step": 27535 }, { "entropy": 0.49278664239682257, "epoch": 2.533452941616207, "grad_norm": 0.15947306156158447, "learning_rate": 1.5554942190327233e-05, "loss": 0.479, "mean_token_accuracy": 0.8430229350924492, "num_tokens": 878837740.0, "step": 27536 }, { "entropy": 0.46095906267873943, "epoch": 2.5335449479876484, "grad_norm": 0.1497519612312317, "learning_rate": 1.5551875364185605e-05, "loss": 0.4466, "mean_token_accuracy": 0.8584785647690296, "num_tokens": 878869100.0, "step": 27537 }, { "entropy": 0.5220719871576875, "epoch": 2.5336369543590895, "grad_norm": 0.15664254128932953, "learning_rate": 1.554880853804398e-05, "loss": 0.4975, "mean_token_accuracy": 0.8403407670557499, "num_tokens": 878900300.0, "step": 27538 }, { "entropy": 0.5680605680681765, "epoch": 2.5337289607305307, "grad_norm": 0.16802409291267395, "learning_rate": 1.5545741711902354e-05, "loss": 0.5637, "mean_token_accuracy": 0.8237234465777874, "num_tokens": 878932278.0, "step": 27539 }, { "entropy": 0.4819596279412508, "epoch": 2.533820967101972, "grad_norm": 0.15234801173210144, "learning_rate": 1.554267488576073e-05, "loss": 0.4734, "mean_token_accuracy": 0.8489962443709373, "num_tokens": 878964777.0, "step": 27540 }, { "entropy": 0.47601051442325115, "epoch": 2.533912973473413, "grad_norm": 0.1551257222890854, "learning_rate": 1.55396080596191e-05, "loss": 0.4613, "mean_token_accuracy": 0.8511253818869591, "num_tokens": 878997254.0, "step": 27541 }, { "entropy": 0.43455787654966116, "epoch": 2.5340049798448545, "grad_norm": 0.15138036012649536, "learning_rate": 1.5536541233477474e-05, "loss": 0.422, "mean_token_accuracy": 0.8654058538377285, "num_tokens": 879029446.0, "step": 27542 }, { "entropy": 0.4964918391779065, "epoch": 2.5340969862162956, "grad_norm": 0.15689831972122192, "learning_rate": 1.553347440733585e-05, "loss": 0.48, "mean_token_accuracy": 0.8476653210818768, "num_tokens": 879061652.0, "step": 27543 }, { "entropy": 0.44688510918058455, "epoch": 2.5341889925877368, "grad_norm": 0.1521461009979248, "learning_rate": 1.5530407581194224e-05, "loss": 0.4355, "mean_token_accuracy": 0.8606016784906387, "num_tokens": 879093484.0, "step": 27544 }, { "entropy": 0.6105732526630163, "epoch": 2.534280998959178, "grad_norm": 0.1743333786725998, "learning_rate": 1.55273407550526e-05, "loss": 0.5954, "mean_token_accuracy": 0.8116840310394764, "num_tokens": 879125414.0, "step": 27545 }, { "entropy": 0.5325533449649811, "epoch": 2.534373005330619, "grad_norm": 0.16030284762382507, "learning_rate": 1.552427392891097e-05, "loss": 0.5314, "mean_token_accuracy": 0.8320506699383259, "num_tokens": 879157581.0, "step": 27546 }, { "entropy": 0.5078556090593338, "epoch": 2.5344650117020606, "grad_norm": 0.15770936012268066, "learning_rate": 1.5521207102769344e-05, "loss": 0.4962, "mean_token_accuracy": 0.8423919565975666, "num_tokens": 879189121.0, "step": 27547 }, { "entropy": 0.5171134134288877, "epoch": 2.5345570180735018, "grad_norm": 0.16259197890758514, "learning_rate": 1.551814027662772e-05, "loss": 0.4995, "mean_token_accuracy": 0.8397371433675289, "num_tokens": 879220875.0, "step": 27548 }, { "entropy": 0.5924079604446888, "epoch": 2.534649024444943, "grad_norm": 0.16614876687526703, "learning_rate": 1.5515073450486094e-05, "loss": 0.581, "mean_token_accuracy": 0.8182885572314262, "num_tokens": 879252868.0, "step": 27549 }, { "entropy": 0.4132724069058895, "epoch": 2.534741030816384, "grad_norm": 0.14562633633613586, "learning_rate": 1.5512006624344465e-05, "loss": 0.3927, "mean_token_accuracy": 0.8751840628683567, "num_tokens": 879285206.0, "step": 27550 }, { "entropy": 0.4482438648119569, "epoch": 2.534833037187825, "grad_norm": 0.1495952308177948, "learning_rate": 1.550893979820284e-05, "loss": 0.4324, "mean_token_accuracy": 0.8601407743990421, "num_tokens": 879316985.0, "step": 27551 }, { "entropy": 0.4974362001521513, "epoch": 2.5349250435592667, "grad_norm": 0.16023565828800201, "learning_rate": 1.5505872972061214e-05, "loss": 0.4872, "mean_token_accuracy": 0.8446488752961159, "num_tokens": 879349128.0, "step": 27552 }, { "entropy": 0.6484391037374735, "epoch": 2.535017049930708, "grad_norm": 0.1748078167438507, "learning_rate": 1.550280614591959e-05, "loss": 0.6325, "mean_token_accuracy": 0.7991555705666542, "num_tokens": 879381131.0, "step": 27553 }, { "entropy": 0.556187467649579, "epoch": 2.535109056302149, "grad_norm": 0.1685553342103958, "learning_rate": 1.5499739319777963e-05, "loss": 0.5388, "mean_token_accuracy": 0.8274469263851643, "num_tokens": 879412710.0, "step": 27554 }, { "entropy": 0.4634636649861932, "epoch": 2.53520106267359, "grad_norm": 0.15074095129966736, "learning_rate": 1.5496672493636335e-05, "loss": 0.4587, "mean_token_accuracy": 0.8564459793269634, "num_tokens": 879444738.0, "step": 27555 }, { "entropy": 0.5726642394438386, "epoch": 2.5352930690450313, "grad_norm": 0.17194893956184387, "learning_rate": 1.549360566749471e-05, "loss": 0.5585, "mean_token_accuracy": 0.8237759731709957, "num_tokens": 879476297.0, "step": 27556 }, { "entropy": 0.5030915401875973, "epoch": 2.535385075416473, "grad_norm": 0.16449514031410217, "learning_rate": 1.5490538841353084e-05, "loss": 0.4966, "mean_token_accuracy": 0.8420294709503651, "num_tokens": 879507560.0, "step": 27557 }, { "entropy": 0.5641990602016449, "epoch": 2.535477081787914, "grad_norm": 0.1598387062549591, "learning_rate": 1.548747201521146e-05, "loss": 0.5462, "mean_token_accuracy": 0.8265436068177223, "num_tokens": 879539635.0, "step": 27558 }, { "entropy": 0.55881267786026, "epoch": 2.535569088159355, "grad_norm": 0.1656816303730011, "learning_rate": 1.548440518906983e-05, "loss": 0.5521, "mean_token_accuracy": 0.829938679933548, "num_tokens": 879571067.0, "step": 27559 }, { "entropy": 0.592491302639246, "epoch": 2.5356610945307962, "grad_norm": 0.17507268488407135, "learning_rate": 1.5481338362928208e-05, "loss": 0.5869, "mean_token_accuracy": 0.8149746581912041, "num_tokens": 879603106.0, "step": 27560 }, { "entropy": 0.5665137921459973, "epoch": 2.5357531009022374, "grad_norm": 0.16712796688079834, "learning_rate": 1.5478271536786583e-05, "loss": 0.5536, "mean_token_accuracy": 0.8244073204696178, "num_tokens": 879635058.0, "step": 27561 }, { "entropy": 0.5120168013963848, "epoch": 2.535845107273679, "grad_norm": 0.15688923001289368, "learning_rate": 1.5475204710644957e-05, "loss": 0.4979, "mean_token_accuracy": 0.8450286947190762, "num_tokens": 879667509.0, "step": 27562 }, { "entropy": 0.42200299352407455, "epoch": 2.53593711364512, "grad_norm": 0.15220847725868225, "learning_rate": 1.547213788450333e-05, "loss": 0.404, "mean_token_accuracy": 0.8693712130188942, "num_tokens": 879699080.0, "step": 27563 }, { "entropy": 0.4918134310282767, "epoch": 2.5360291200165612, "grad_norm": 0.15450309216976166, "learning_rate": 1.5469071058361703e-05, "loss": 0.4783, "mean_token_accuracy": 0.849661149084568, "num_tokens": 879731678.0, "step": 27564 }, { "entropy": 0.4454573525581509, "epoch": 2.5361211263880024, "grad_norm": 0.14972184598445892, "learning_rate": 1.5466004232220078e-05, "loss": 0.4386, "mean_token_accuracy": 0.8607419654726982, "num_tokens": 879763784.0, "step": 27565 }, { "entropy": 0.5695819184184074, "epoch": 2.5362131327594435, "grad_norm": 0.17401635646820068, "learning_rate": 1.5462937406078452e-05, "loss": 0.5725, "mean_token_accuracy": 0.8204970583319664, "num_tokens": 879794525.0, "step": 27566 }, { "entropy": 0.4679831634275615, "epoch": 2.536305139130885, "grad_norm": 0.1520656943321228, "learning_rate": 1.5459870579936824e-05, "loss": 0.4528, "mean_token_accuracy": 0.8548391051590443, "num_tokens": 879826518.0, "step": 27567 }, { "entropy": 0.5511993379332125, "epoch": 2.536397145502326, "grad_norm": 0.1631087064743042, "learning_rate": 1.5456803753795198e-05, "loss": 0.544, "mean_token_accuracy": 0.8275901675224304, "num_tokens": 879858876.0, "step": 27568 }, { "entropy": 0.6095849238336086, "epoch": 2.5364891518737673, "grad_norm": 0.17546944320201874, "learning_rate": 1.5453736927653573e-05, "loss": 0.6059, "mean_token_accuracy": 0.8076796308159828, "num_tokens": 879891192.0, "step": 27569 }, { "entropy": 0.5584848560392857, "epoch": 2.5365811582452085, "grad_norm": 0.16083188354969025, "learning_rate": 1.5450670101511948e-05, "loss": 0.5426, "mean_token_accuracy": 0.8324565067887306, "num_tokens": 879922921.0, "step": 27570 }, { "entropy": 0.5324679296463728, "epoch": 2.5366731646166496, "grad_norm": 0.16278637945652008, "learning_rate": 1.544760327537032e-05, "loss": 0.5208, "mean_token_accuracy": 0.8348008207976818, "num_tokens": 879955471.0, "step": 27571 }, { "entropy": 0.5917774718254805, "epoch": 2.536765170988091, "grad_norm": 0.17060159146785736, "learning_rate": 1.5444536449228693e-05, "loss": 0.5818, "mean_token_accuracy": 0.8204889670014381, "num_tokens": 879986094.0, "step": 27572 }, { "entropy": 0.5651383483782411, "epoch": 2.5368571773595323, "grad_norm": 0.16964417695999146, "learning_rate": 1.5441469623087068e-05, "loss": 0.5609, "mean_token_accuracy": 0.8207869678735733, "num_tokens": 880017796.0, "step": 27573 }, { "entropy": 0.5171219250187278, "epoch": 2.5369491837309734, "grad_norm": 0.16469840705394745, "learning_rate": 1.5438402796945443e-05, "loss": 0.5088, "mean_token_accuracy": 0.8382349088788033, "num_tokens": 880049642.0, "step": 27574 }, { "entropy": 0.48037294670939445, "epoch": 2.5370411901024146, "grad_norm": 0.15556667745113373, "learning_rate": 1.5435335970803817e-05, "loss": 0.473, "mean_token_accuracy": 0.8509038984775543, "num_tokens": 880081875.0, "step": 27575 }, { "entropy": 0.5542248438578099, "epoch": 2.5371331964738557, "grad_norm": 0.16164276003837585, "learning_rate": 1.543226914466219e-05, "loss": 0.5343, "mean_token_accuracy": 0.8298530802130699, "num_tokens": 880113769.0, "step": 27576 }, { "entropy": 0.577095303684473, "epoch": 2.5372252028452973, "grad_norm": 0.16826091706752777, "learning_rate": 1.5429202318520563e-05, "loss": 0.5779, "mean_token_accuracy": 0.8186462260782719, "num_tokens": 880145559.0, "step": 27577 }, { "entropy": 0.5374100394546986, "epoch": 2.5373172092167384, "grad_norm": 0.15742158889770508, "learning_rate": 1.5426135492378938e-05, "loss": 0.5165, "mean_token_accuracy": 0.8357390463352203, "num_tokens": 880177903.0, "step": 27578 }, { "entropy": 0.5325026493519545, "epoch": 2.5374092155881796, "grad_norm": 0.16090092062950134, "learning_rate": 1.5423068666237313e-05, "loss": 0.4951, "mean_token_accuracy": 0.8386152908205986, "num_tokens": 880208805.0, "step": 27579 }, { "entropy": 0.5763975875452161, "epoch": 2.5375012219596207, "grad_norm": 0.16586683690547943, "learning_rate": 1.5420001840095684e-05, "loss": 0.5641, "mean_token_accuracy": 0.8241145461797714, "num_tokens": 880241488.0, "step": 27580 }, { "entropy": 0.5022317287512124, "epoch": 2.537593228331062, "grad_norm": 0.15440583229064941, "learning_rate": 1.541693501395406e-05, "loss": 0.4871, "mean_token_accuracy": 0.8490348570048809, "num_tokens": 880273497.0, "step": 27581 }, { "entropy": 0.5608067186549306, "epoch": 2.5376852347025034, "grad_norm": 0.16230450570583344, "learning_rate": 1.5413868187812433e-05, "loss": 0.5375, "mean_token_accuracy": 0.8317755833268166, "num_tokens": 880305892.0, "step": 27582 }, { "entropy": 0.5164709901437163, "epoch": 2.5377772410739445, "grad_norm": 0.16382327675819397, "learning_rate": 1.5410801361670808e-05, "loss": 0.5097, "mean_token_accuracy": 0.8391444645822048, "num_tokens": 880338198.0, "step": 27583 }, { "entropy": 0.540534595027566, "epoch": 2.5378692474453857, "grad_norm": 0.15782086551189423, "learning_rate": 1.5407734535529182e-05, "loss": 0.5182, "mean_token_accuracy": 0.8355664946138859, "num_tokens": 880370706.0, "step": 27584 }, { "entropy": 0.5245020408183336, "epoch": 2.537961253816827, "grad_norm": 0.16070646047592163, "learning_rate": 1.5404667709387554e-05, "loss": 0.5147, "mean_token_accuracy": 0.8381564021110535, "num_tokens": 880402728.0, "step": 27585 }, { "entropy": 0.4959778403863311, "epoch": 2.538053260188268, "grad_norm": 0.15590156614780426, "learning_rate": 1.540160088324593e-05, "loss": 0.4804, "mean_token_accuracy": 0.8509062193334103, "num_tokens": 880434561.0, "step": 27586 }, { "entropy": 0.5044985897839069, "epoch": 2.5381452665597095, "grad_norm": 0.15616223216056824, "learning_rate": 1.5398534057104303e-05, "loss": 0.4892, "mean_token_accuracy": 0.8459640517830849, "num_tokens": 880466211.0, "step": 27587 }, { "entropy": 0.5006192899309099, "epoch": 2.5382372729311506, "grad_norm": 0.15885084867477417, "learning_rate": 1.5395467230962678e-05, "loss": 0.4815, "mean_token_accuracy": 0.8494201749563217, "num_tokens": 880498475.0, "step": 27588 }, { "entropy": 0.4662532676011324, "epoch": 2.538329279302592, "grad_norm": 0.16017118096351624, "learning_rate": 1.539240040482105e-05, "loss": 0.4514, "mean_token_accuracy": 0.8550592958927155, "num_tokens": 880530014.0, "step": 27589 }, { "entropy": 0.42780629452317953, "epoch": 2.538421285674033, "grad_norm": 0.1468440443277359, "learning_rate": 1.5389333578679424e-05, "loss": 0.4266, "mean_token_accuracy": 0.8644977025687695, "num_tokens": 880562512.0, "step": 27590 }, { "entropy": 0.6039804928004742, "epoch": 2.538513292045474, "grad_norm": 0.174861878156662, "learning_rate": 1.53862667525378e-05, "loss": 0.5931, "mean_token_accuracy": 0.8096238560974598, "num_tokens": 880593771.0, "step": 27591 }, { "entropy": 0.46193862380459905, "epoch": 2.5386052984169156, "grad_norm": 0.14949513971805573, "learning_rate": 1.5383199926396176e-05, "loss": 0.4478, "mean_token_accuracy": 0.8536109663546085, "num_tokens": 880625498.0, "step": 27592 }, { "entropy": 0.587189300917089, "epoch": 2.5386973047883568, "grad_norm": 0.16569775342941284, "learning_rate": 1.5380133100254548e-05, "loss": 0.5803, "mean_token_accuracy": 0.8186362870037556, "num_tokens": 880657794.0, "step": 27593 }, { "entropy": 0.5107993260025978, "epoch": 2.538789311159798, "grad_norm": 0.16070953011512756, "learning_rate": 1.5377066274112922e-05, "loss": 0.5116, "mean_token_accuracy": 0.8375945501029491, "num_tokens": 880690247.0, "step": 27594 }, { "entropy": 0.5958576677367091, "epoch": 2.538881317531239, "grad_norm": 0.17351379990577698, "learning_rate": 1.5373999447971297e-05, "loss": 0.5863, "mean_token_accuracy": 0.8158215060830116, "num_tokens": 880721902.0, "step": 27595 }, { "entropy": 0.5418737009167671, "epoch": 2.53897332390268, "grad_norm": 0.16524630784988403, "learning_rate": 1.537093262182967e-05, "loss": 0.5358, "mean_token_accuracy": 0.8324750624597073, "num_tokens": 880754032.0, "step": 27596 }, { "entropy": 0.519491643179208, "epoch": 2.5390653302741217, "grad_norm": 0.1593904048204422, "learning_rate": 1.5367865795688043e-05, "loss": 0.4954, "mean_token_accuracy": 0.840717040002346, "num_tokens": 880785718.0, "step": 27597 }, { "entropy": 0.4727132199332118, "epoch": 2.539157336645563, "grad_norm": 0.14594265818595886, "learning_rate": 1.5364798969546417e-05, "loss": 0.4594, "mean_token_accuracy": 0.853216215968132, "num_tokens": 880817395.0, "step": 27598 }, { "entropy": 0.5041998354718089, "epoch": 2.539249343017004, "grad_norm": 0.15838584303855896, "learning_rate": 1.5361732143404792e-05, "loss": 0.4951, "mean_token_accuracy": 0.8466919250786304, "num_tokens": 880849427.0, "step": 27599 }, { "entropy": 0.5518663665279746, "epoch": 2.539341349388445, "grad_norm": 0.1661151945590973, "learning_rate": 1.5358665317263167e-05, "loss": 0.5428, "mean_token_accuracy": 0.8301492221653461, "num_tokens": 880880506.0, "step": 27600 }, { "entropy": 0.5378349586389959, "epoch": 2.5394333557598863, "grad_norm": 0.1616792380809784, "learning_rate": 1.5355598491121538e-05, "loss": 0.5324, "mean_token_accuracy": 0.8320276662707329, "num_tokens": 880912779.0, "step": 27601 }, { "entropy": 0.5390320625156164, "epoch": 2.539525362131328, "grad_norm": 0.1616346538066864, "learning_rate": 1.5352531664979913e-05, "loss": 0.5314, "mean_token_accuracy": 0.8320247940719128, "num_tokens": 880944644.0, "step": 27602 }, { "entropy": 0.5486834719777107, "epoch": 2.539617368502769, "grad_norm": 0.16791708767414093, "learning_rate": 1.5349464838838287e-05, "loss": 0.5523, "mean_token_accuracy": 0.827607586979866, "num_tokens": 880977199.0, "step": 27603 }, { "entropy": 0.6612535305321217, "epoch": 2.53970937487421, "grad_norm": 0.17400343716144562, "learning_rate": 1.5346398012696662e-05, "loss": 0.6621, "mean_token_accuracy": 0.7962509542703629, "num_tokens": 881009567.0, "step": 27604 }, { "entropy": 0.4916988154873252, "epoch": 2.5398013812456512, "grad_norm": 0.16051647067070007, "learning_rate": 1.5343331186555037e-05, "loss": 0.4738, "mean_token_accuracy": 0.8481092974543571, "num_tokens": 881041274.0, "step": 27605 }, { "entropy": 0.5378235802054405, "epoch": 2.5398933876170924, "grad_norm": 0.16192492842674255, "learning_rate": 1.5340264360413408e-05, "loss": 0.5308, "mean_token_accuracy": 0.8343631029129028, "num_tokens": 881074031.0, "step": 27606 }, { "entropy": 0.5712324315682054, "epoch": 2.539985393988534, "grad_norm": 0.16152586042881012, "learning_rate": 1.5337197534271782e-05, "loss": 0.5611, "mean_token_accuracy": 0.8243147544562817, "num_tokens": 881106629.0, "step": 27607 }, { "entropy": 0.4254491897299886, "epoch": 2.540077400359975, "grad_norm": 0.16030927002429962, "learning_rate": 1.5334130708130157e-05, "loss": 0.4167, "mean_token_accuracy": 0.8682979121804237, "num_tokens": 881139160.0, "step": 27608 }, { "entropy": 0.5812245756387711, "epoch": 2.5401694067314162, "grad_norm": 0.16320791840553284, "learning_rate": 1.5331063881988532e-05, "loss": 0.5584, "mean_token_accuracy": 0.8247861489653587, "num_tokens": 881171000.0, "step": 27609 }, { "entropy": 0.40353567618876696, "epoch": 2.5402614131028574, "grad_norm": 0.13975918292999268, "learning_rate": 1.5327997055846903e-05, "loss": 0.3834, "mean_token_accuracy": 0.8747483417391777, "num_tokens": 881203117.0, "step": 27610 }, { "entropy": 0.484322932548821, "epoch": 2.5403534194742985, "grad_norm": 0.15319587290287018, "learning_rate": 1.5324930229705278e-05, "loss": 0.4678, "mean_token_accuracy": 0.8512351773679256, "num_tokens": 881234879.0, "step": 27611 }, { "entropy": 0.48105441592633724, "epoch": 2.54044542584574, "grad_norm": 0.15590880811214447, "learning_rate": 1.5321863403563652e-05, "loss": 0.4662, "mean_token_accuracy": 0.8525304831564426, "num_tokens": 881266454.0, "step": 27612 }, { "entropy": 0.5996843408793211, "epoch": 2.540537432217181, "grad_norm": 0.16865409910678864, "learning_rate": 1.5318796577422027e-05, "loss": 0.5891, "mean_token_accuracy": 0.8144354484975338, "num_tokens": 881298342.0, "step": 27613 }, { "entropy": 0.6294915173202753, "epoch": 2.5406294385886223, "grad_norm": 0.16483493149280548, "learning_rate": 1.53157297512804e-05, "loss": 0.6197, "mean_token_accuracy": 0.8052841275930405, "num_tokens": 881330516.0, "step": 27614 }, { "entropy": 0.4838863480836153, "epoch": 2.5407214449600635, "grad_norm": 0.1554408073425293, "learning_rate": 1.5312662925138773e-05, "loss": 0.4716, "mean_token_accuracy": 0.8507682234048843, "num_tokens": 881362050.0, "step": 27615 }, { "entropy": 0.5000070165842772, "epoch": 2.5408134513315046, "grad_norm": 0.1569204330444336, "learning_rate": 1.5309596098997147e-05, "loss": 0.4803, "mean_token_accuracy": 0.8468875698745251, "num_tokens": 881393982.0, "step": 27616 }, { "entropy": 0.4828872215002775, "epoch": 2.540905457702946, "grad_norm": 0.16240853071212769, "learning_rate": 1.5306529272855522e-05, "loss": 0.4723, "mean_token_accuracy": 0.8478628918528557, "num_tokens": 881425101.0, "step": 27617 }, { "entropy": 0.4736256320029497, "epoch": 2.5409974640743873, "grad_norm": 0.15643422305583954, "learning_rate": 1.5303462446713897e-05, "loss": 0.4647, "mean_token_accuracy": 0.8548098206520081, "num_tokens": 881456617.0, "step": 27618 }, { "entropy": 0.6145694516599178, "epoch": 2.5410894704458284, "grad_norm": 0.17511725425720215, "learning_rate": 1.5300395620572268e-05, "loss": 0.6041, "mean_token_accuracy": 0.8060619086027145, "num_tokens": 881488004.0, "step": 27619 }, { "entropy": 0.46118696592748165, "epoch": 2.5411814768172696, "grad_norm": 0.1564871221780777, "learning_rate": 1.5297328794430643e-05, "loss": 0.4514, "mean_token_accuracy": 0.8558289706707001, "num_tokens": 881519576.0, "step": 27620 }, { "entropy": 0.4322966740000993, "epoch": 2.5412734831887107, "grad_norm": 0.14540880918502808, "learning_rate": 1.529426196828902e-05, "loss": 0.4198, "mean_token_accuracy": 0.8691730499267578, "num_tokens": 881551809.0, "step": 27621 }, { "entropy": 0.4932854790240526, "epoch": 2.5413654895601523, "grad_norm": 0.15650662779808044, "learning_rate": 1.5291195142147395e-05, "loss": 0.4868, "mean_token_accuracy": 0.8480531759560108, "num_tokens": 881583303.0, "step": 27622 }, { "entropy": 0.4855492733186111, "epoch": 2.5414574959315934, "grad_norm": 0.15547356009483337, "learning_rate": 1.5288128316005767e-05, "loss": 0.4817, "mean_token_accuracy": 0.8484455943107605, "num_tokens": 881615438.0, "step": 27623 }, { "entropy": 0.5438357023522258, "epoch": 2.5415495023030346, "grad_norm": 0.15946733951568604, "learning_rate": 1.528506148986414e-05, "loss": 0.5249, "mean_token_accuracy": 0.8334803469479084, "num_tokens": 881647057.0, "step": 27624 }, { "entropy": 0.5175397987477481, "epoch": 2.5416415086744757, "grad_norm": 0.15492013096809387, "learning_rate": 1.5281994663722516e-05, "loss": 0.5042, "mean_token_accuracy": 0.8414860516786575, "num_tokens": 881678880.0, "step": 27625 }, { "entropy": 0.5837755016982555, "epoch": 2.541733515045917, "grad_norm": 0.16832557320594788, "learning_rate": 1.527892783758089e-05, "loss": 0.5807, "mean_token_accuracy": 0.8181545846164227, "num_tokens": 881711415.0, "step": 27626 }, { "entropy": 0.414990259334445, "epoch": 2.5418255214173584, "grad_norm": 0.1459352970123291, "learning_rate": 1.5275861011439262e-05, "loss": 0.404, "mean_token_accuracy": 0.8716326989233494, "num_tokens": 881743135.0, "step": 27627 }, { "entropy": 0.37271126406267285, "epoch": 2.5419175277887995, "grad_norm": 0.14419855177402496, "learning_rate": 1.5272794185297636e-05, "loss": 0.3564, "mean_token_accuracy": 0.8843738548457623, "num_tokens": 881775072.0, "step": 27628 }, { "entropy": 0.5359947262331843, "epoch": 2.5420095341602407, "grad_norm": 0.15866884589195251, "learning_rate": 1.526972735915601e-05, "loss": 0.5302, "mean_token_accuracy": 0.8351451717317104, "num_tokens": 881807106.0, "step": 27629 }, { "entropy": 0.4790884441463277, "epoch": 2.542101540531682, "grad_norm": 0.1480739414691925, "learning_rate": 1.5266660533014386e-05, "loss": 0.4655, "mean_token_accuracy": 0.8512066230177879, "num_tokens": 881839159.0, "step": 27630 }, { "entropy": 0.5484141367487609, "epoch": 2.542193546903123, "grad_norm": 0.1642666459083557, "learning_rate": 1.5263593706872757e-05, "loss": 0.535, "mean_token_accuracy": 0.8318750634789467, "num_tokens": 881870994.0, "step": 27631 }, { "entropy": 0.456122612580657, "epoch": 2.5422855532745645, "grad_norm": 0.14888611435890198, "learning_rate": 1.526052688073113e-05, "loss": 0.4455, "mean_token_accuracy": 0.8594580180943012, "num_tokens": 881903707.0, "step": 27632 }, { "entropy": 0.4448514273390174, "epoch": 2.5423775596460056, "grad_norm": 0.1463066041469574, "learning_rate": 1.5257460054589506e-05, "loss": 0.4328, "mean_token_accuracy": 0.8592074066400528, "num_tokens": 881936373.0, "step": 27633 }, { "entropy": 0.5865797456353903, "epoch": 2.542469566017447, "grad_norm": 0.16663552820682526, "learning_rate": 1.5254393228447881e-05, "loss": 0.5748, "mean_token_accuracy": 0.819670170545578, "num_tokens": 881968817.0, "step": 27634 }, { "entropy": 0.5715001868084073, "epoch": 2.542561572388888, "grad_norm": 0.17100225389003754, "learning_rate": 1.5251326402306254e-05, "loss": 0.5667, "mean_token_accuracy": 0.8257244452834129, "num_tokens": 881999498.0, "step": 27635 }, { "entropy": 0.48100972454994917, "epoch": 2.542653578760329, "grad_norm": 0.1591428965330124, "learning_rate": 1.5248259576164629e-05, "loss": 0.4698, "mean_token_accuracy": 0.8500593453645706, "num_tokens": 882031481.0, "step": 27636 }, { "entropy": 0.4632652651052922, "epoch": 2.5427455851317706, "grad_norm": 0.1554369032382965, "learning_rate": 1.5245192750023002e-05, "loss": 0.443, "mean_token_accuracy": 0.856769721955061, "num_tokens": 882063025.0, "step": 27637 }, { "entropy": 0.4711194187402725, "epoch": 2.5428375915032118, "grad_norm": 0.15287770330905914, "learning_rate": 1.5242125923881376e-05, "loss": 0.4655, "mean_token_accuracy": 0.8524800054728985, "num_tokens": 882095605.0, "step": 27638 }, { "entropy": 0.3816979117691517, "epoch": 2.542929597874653, "grad_norm": 0.14613725244998932, "learning_rate": 1.5239059097739749e-05, "loss": 0.3606, "mean_token_accuracy": 0.882670059800148, "num_tokens": 882127768.0, "step": 27639 }, { "entropy": 0.4706883653998375, "epoch": 2.543021604246094, "grad_norm": 0.15378955006599426, "learning_rate": 1.5235992271598124e-05, "loss": 0.461, "mean_token_accuracy": 0.8514585569500923, "num_tokens": 882159463.0, "step": 27640 }, { "entropy": 0.45682069938629866, "epoch": 2.543113610617535, "grad_norm": 0.14885985851287842, "learning_rate": 1.5232925445456497e-05, "loss": 0.449, "mean_token_accuracy": 0.8553495965898037, "num_tokens": 882191257.0, "step": 27641 }, { "entropy": 0.46481182146817446, "epoch": 2.5432056169889767, "grad_norm": 0.15679949522018433, "learning_rate": 1.5229858619314871e-05, "loss": 0.4524, "mean_token_accuracy": 0.8555116355419159, "num_tokens": 882223379.0, "step": 27642 }, { "entropy": 0.4973567221313715, "epoch": 2.543297623360418, "grad_norm": 0.1645544320344925, "learning_rate": 1.5226791793173244e-05, "loss": 0.4942, "mean_token_accuracy": 0.8421605825424194, "num_tokens": 882255427.0, "step": 27643 }, { "entropy": 0.5071465545333922, "epoch": 2.543389629731859, "grad_norm": 0.15661394596099854, "learning_rate": 1.5223724967031619e-05, "loss": 0.5007, "mean_token_accuracy": 0.8397937454283237, "num_tokens": 882287685.0, "step": 27644 }, { "entropy": 0.5200637567322701, "epoch": 2.5434816361033, "grad_norm": 0.15958978235721588, "learning_rate": 1.5220658140889994e-05, "loss": 0.5216, "mean_token_accuracy": 0.8396167904138565, "num_tokens": 882319355.0, "step": 27645 }, { "entropy": 0.47612641751766205, "epoch": 2.5435736424747413, "grad_norm": 0.16073229908943176, "learning_rate": 1.5217591314748367e-05, "loss": 0.4697, "mean_token_accuracy": 0.8521409928798676, "num_tokens": 882350760.0, "step": 27646 }, { "entropy": 0.48938733292743564, "epoch": 2.543665648846183, "grad_norm": 0.15779033303260803, "learning_rate": 1.5214524488606741e-05, "loss": 0.483, "mean_token_accuracy": 0.8463448844850063, "num_tokens": 882382440.0, "step": 27647 }, { "entropy": 0.5351384109817445, "epoch": 2.543757655217624, "grad_norm": 0.16190457344055176, "learning_rate": 1.5211457662465114e-05, "loss": 0.5295, "mean_token_accuracy": 0.8329937048256397, "num_tokens": 882415072.0, "step": 27648 }, { "entropy": 0.5712194899097085, "epoch": 2.543849661589065, "grad_norm": 0.1640690714120865, "learning_rate": 1.5208390836323489e-05, "loss": 0.5458, "mean_token_accuracy": 0.826498381793499, "num_tokens": 882446527.0, "step": 27649 }, { "entropy": 0.4808695064857602, "epoch": 2.5439416679605062, "grad_norm": 0.15501739084720612, "learning_rate": 1.5205324010181862e-05, "loss": 0.4689, "mean_token_accuracy": 0.8497772216796875, "num_tokens": 882479121.0, "step": 27650 }, { "entropy": 0.5875524487346411, "epoch": 2.5440336743319474, "grad_norm": 0.17261596024036407, "learning_rate": 1.5202257184040236e-05, "loss": 0.5685, "mean_token_accuracy": 0.8195032104849815, "num_tokens": 882509729.0, "step": 27651 }, { "entropy": 0.5906483344733715, "epoch": 2.544125680703389, "grad_norm": 0.1680452972650528, "learning_rate": 1.5199190357898613e-05, "loss": 0.5716, "mean_token_accuracy": 0.822510939091444, "num_tokens": 882541964.0, "step": 27652 }, { "entropy": 0.6016996037214994, "epoch": 2.54421768707483, "grad_norm": 0.1692807972431183, "learning_rate": 1.5196123531756987e-05, "loss": 0.5899, "mean_token_accuracy": 0.8143683932721615, "num_tokens": 882574121.0, "step": 27653 }, { "entropy": 0.5400411169975996, "epoch": 2.5443096934462712, "grad_norm": 0.15754322707653046, "learning_rate": 1.519305670561536e-05, "loss": 0.5268, "mean_token_accuracy": 0.8362237401306629, "num_tokens": 882606889.0, "step": 27654 }, { "entropy": 0.5507265077903867, "epoch": 2.5444016998177124, "grad_norm": 0.1657557338476181, "learning_rate": 1.5189989879473735e-05, "loss": 0.5377, "mean_token_accuracy": 0.8315714225172997, "num_tokens": 882639016.0, "step": 27655 }, { "entropy": 0.43328365636989474, "epoch": 2.5444937061891535, "grad_norm": 0.14698739349842072, "learning_rate": 1.5186923053332108e-05, "loss": 0.411, "mean_token_accuracy": 0.8670594468712807, "num_tokens": 882670864.0, "step": 27656 }, { "entropy": 0.4921927673276514, "epoch": 2.544585712560595, "grad_norm": 0.16347628831863403, "learning_rate": 1.5183856227190483e-05, "loss": 0.4724, "mean_token_accuracy": 0.8477768935263157, "num_tokens": 882700837.0, "step": 27657 }, { "entropy": 0.5769752059131861, "epoch": 2.544677718932036, "grad_norm": 0.16618666052818298, "learning_rate": 1.5180789401048856e-05, "loss": 0.5666, "mean_token_accuracy": 0.8216676488518715, "num_tokens": 882733042.0, "step": 27658 }, { "entropy": 0.6747205704450607, "epoch": 2.5447697253034773, "grad_norm": 0.17546407878398895, "learning_rate": 1.517772257490723e-05, "loss": 0.6552, "mean_token_accuracy": 0.7939896062016487, "num_tokens": 882765621.0, "step": 27659 }, { "entropy": 0.5731069166213274, "epoch": 2.5448617316749185, "grad_norm": 0.16207976639270782, "learning_rate": 1.5174655748765603e-05, "loss": 0.5596, "mean_token_accuracy": 0.8270155116915703, "num_tokens": 882797737.0, "step": 27660 }, { "entropy": 0.5248086946085095, "epoch": 2.5449537380463596, "grad_norm": 0.16124695539474487, "learning_rate": 1.5171588922623978e-05, "loss": 0.5132, "mean_token_accuracy": 0.8399439118802547, "num_tokens": 882829607.0, "step": 27661 }, { "entropy": 0.4980604201555252, "epoch": 2.545045744417801, "grad_norm": 0.1572699099779129, "learning_rate": 1.516852209648235e-05, "loss": 0.489, "mean_token_accuracy": 0.8469434380531311, "num_tokens": 882861326.0, "step": 27662 }, { "entropy": 0.49094394501298666, "epoch": 2.5451377507892423, "grad_norm": 0.15669693052768707, "learning_rate": 1.5165455270340725e-05, "loss": 0.4843, "mean_token_accuracy": 0.844034917652607, "num_tokens": 882893420.0, "step": 27663 }, { "entropy": 0.49598605185747147, "epoch": 2.5452297571606834, "grad_norm": 0.15671327710151672, "learning_rate": 1.51623884441991e-05, "loss": 0.4835, "mean_token_accuracy": 0.8440848737955093, "num_tokens": 882925541.0, "step": 27664 }, { "entropy": 0.5782316736876965, "epoch": 2.5453217635321246, "grad_norm": 0.16821768879890442, "learning_rate": 1.5159321618057473e-05, "loss": 0.5698, "mean_token_accuracy": 0.8204251453280449, "num_tokens": 882957434.0, "step": 27665 }, { "entropy": 0.46625447552651167, "epoch": 2.5454137699035657, "grad_norm": 0.15165011584758759, "learning_rate": 1.5156254791915848e-05, "loss": 0.4531, "mean_token_accuracy": 0.8532943390309811, "num_tokens": 882989712.0, "step": 27666 }, { "entropy": 0.5302077196538448, "epoch": 2.5455057762750073, "grad_norm": 0.1612682342529297, "learning_rate": 1.515318796577422e-05, "loss": 0.5121, "mean_token_accuracy": 0.83967674523592, "num_tokens": 883021739.0, "step": 27667 }, { "entropy": 0.5098563252249733, "epoch": 2.5455977826464484, "grad_norm": 0.16462430357933044, "learning_rate": 1.5150121139632595e-05, "loss": 0.5067, "mean_token_accuracy": 0.8403122685849667, "num_tokens": 883053245.0, "step": 27668 }, { "entropy": 0.4558375533670187, "epoch": 2.5456897890178896, "grad_norm": 0.15979450941085815, "learning_rate": 1.5147054313490968e-05, "loss": 0.4496, "mean_token_accuracy": 0.8535011298954487, "num_tokens": 883084493.0, "step": 27669 }, { "entropy": 0.5252083130180836, "epoch": 2.5457817953893307, "grad_norm": 0.15840044617652893, "learning_rate": 1.5143987487349343e-05, "loss": 0.5137, "mean_token_accuracy": 0.83977385237813, "num_tokens": 883115950.0, "step": 27670 }, { "entropy": 0.5275250906124711, "epoch": 2.545873801760772, "grad_norm": 0.16272282600402832, "learning_rate": 1.5140920661207716e-05, "loss": 0.5226, "mean_token_accuracy": 0.8351394832134247, "num_tokens": 883147872.0, "step": 27671 }, { "entropy": 0.6298133935779333, "epoch": 2.5459658081322134, "grad_norm": 0.1693442016839981, "learning_rate": 1.513785383506609e-05, "loss": 0.6256, "mean_token_accuracy": 0.8069794289767742, "num_tokens": 883180175.0, "step": 27672 }, { "entropy": 0.37436226033605635, "epoch": 2.5460578145036545, "grad_norm": 0.14015918970108032, "learning_rate": 1.5134787008924463e-05, "loss": 0.3702, "mean_token_accuracy": 0.8801637589931488, "num_tokens": 883212444.0, "step": 27673 }, { "entropy": 0.4701484120450914, "epoch": 2.5461498208750957, "grad_norm": 0.15522275865077972, "learning_rate": 1.5131720182782838e-05, "loss": 0.4648, "mean_token_accuracy": 0.8532895408570766, "num_tokens": 883244368.0, "step": 27674 }, { "entropy": 0.4761611260473728, "epoch": 2.546241827246537, "grad_norm": 0.14935174584388733, "learning_rate": 1.5128653356641213e-05, "loss": 0.4649, "mean_token_accuracy": 0.8530998043715954, "num_tokens": 883275861.0, "step": 27675 }, { "entropy": 0.4456908777356148, "epoch": 2.546333833617978, "grad_norm": 0.15045729279518127, "learning_rate": 1.5125586530499586e-05, "loss": 0.4323, "mean_token_accuracy": 0.8575461879372597, "num_tokens": 883307334.0, "step": 27676 }, { "entropy": 0.5503247156739235, "epoch": 2.5464258399894195, "grad_norm": 0.16390793025493622, "learning_rate": 1.512251970435796e-05, "loss": 0.5423, "mean_token_accuracy": 0.8299512043595314, "num_tokens": 883339247.0, "step": 27677 }, { "entropy": 0.5142579115927219, "epoch": 2.5465178463608606, "grad_norm": 0.15751567482948303, "learning_rate": 1.5119452878216333e-05, "loss": 0.4955, "mean_token_accuracy": 0.8437977135181427, "num_tokens": 883371518.0, "step": 27678 }, { "entropy": 0.39990393444895744, "epoch": 2.546609852732302, "grad_norm": 0.14463910460472107, "learning_rate": 1.5116386052074708e-05, "loss": 0.38, "mean_token_accuracy": 0.8759371712803841, "num_tokens": 883403805.0, "step": 27679 }, { "entropy": 0.45045374101027846, "epoch": 2.546701859103743, "grad_norm": 0.14948813617229462, "learning_rate": 1.5113319225933081e-05, "loss": 0.4452, "mean_token_accuracy": 0.8580624014139175, "num_tokens": 883436242.0, "step": 27680 }, { "entropy": 0.4950899323448539, "epoch": 2.546793865475184, "grad_norm": 0.15720021724700928, "learning_rate": 1.5110252399791456e-05, "loss": 0.4795, "mean_token_accuracy": 0.8465541079640388, "num_tokens": 883467680.0, "step": 27681 }, { "entropy": 0.5504188863560557, "epoch": 2.5468858718466256, "grad_norm": 0.1645773947238922, "learning_rate": 1.5107185573649832e-05, "loss": 0.5379, "mean_token_accuracy": 0.8325052224099636, "num_tokens": 883499787.0, "step": 27682 }, { "entropy": 0.4403890995308757, "epoch": 2.5469778782180668, "grad_norm": 0.1476656049489975, "learning_rate": 1.5104118747508207e-05, "loss": 0.4213, "mean_token_accuracy": 0.8657332994043827, "num_tokens": 883532003.0, "step": 27683 }, { "entropy": 0.5192102687433362, "epoch": 2.547069884589508, "grad_norm": 0.1577121764421463, "learning_rate": 1.510105192136658e-05, "loss": 0.5053, "mean_token_accuracy": 0.836200375109911, "num_tokens": 883564370.0, "step": 27684 }, { "entropy": 0.5424979861127213, "epoch": 2.547161890960949, "grad_norm": 0.16129513084888458, "learning_rate": 1.5097985095224954e-05, "loss": 0.5328, "mean_token_accuracy": 0.8315893076360226, "num_tokens": 883596715.0, "step": 27685 }, { "entropy": 0.591575350612402, "epoch": 2.54725389733239, "grad_norm": 0.1719299554824829, "learning_rate": 1.5094918269083327e-05, "loss": 0.5798, "mean_token_accuracy": 0.8183831498026848, "num_tokens": 883627797.0, "step": 27686 }, { "entropy": 0.5281448570312932, "epoch": 2.5473459037038317, "grad_norm": 0.1575048714876175, "learning_rate": 1.5091851442941702e-05, "loss": 0.5188, "mean_token_accuracy": 0.8374450355768204, "num_tokens": 883660565.0, "step": 27687 }, { "entropy": 0.6146832313388586, "epoch": 2.547437910075273, "grad_norm": 0.17131373286247253, "learning_rate": 1.5088784616800075e-05, "loss": 0.6032, "mean_token_accuracy": 0.8088557980954647, "num_tokens": 883692088.0, "step": 27688 }, { "entropy": 0.4561497438699007, "epoch": 2.547529916446714, "grad_norm": 0.14994852244853973, "learning_rate": 1.508571779065845e-05, "loss": 0.4368, "mean_token_accuracy": 0.8623461201786995, "num_tokens": 883724455.0, "step": 27689 }, { "entropy": 0.5531552815809846, "epoch": 2.547621922818155, "grad_norm": 0.16235841810703278, "learning_rate": 1.5082650964516822e-05, "loss": 0.5388, "mean_token_accuracy": 0.833192240446806, "num_tokens": 883756668.0, "step": 27690 }, { "entropy": 0.5186484940350056, "epoch": 2.5477139291895963, "grad_norm": 0.16591286659240723, "learning_rate": 1.5079584138375197e-05, "loss": 0.5083, "mean_token_accuracy": 0.8351085782051086, "num_tokens": 883788017.0, "step": 27691 }, { "entropy": 0.5916822236031294, "epoch": 2.547805935561038, "grad_norm": 0.16518187522888184, "learning_rate": 1.507651731223357e-05, "loss": 0.5661, "mean_token_accuracy": 0.8214198350906372, "num_tokens": 883819919.0, "step": 27692 }, { "entropy": 0.5419466681778431, "epoch": 2.547897941932479, "grad_norm": 0.16373533010482788, "learning_rate": 1.5073450486091945e-05, "loss": 0.5289, "mean_token_accuracy": 0.834194328635931, "num_tokens": 883852262.0, "step": 27693 }, { "entropy": 0.4906820834148675, "epoch": 2.54798994830392, "grad_norm": 0.15690240263938904, "learning_rate": 1.507038365995032e-05, "loss": 0.477, "mean_token_accuracy": 0.8469250872731209, "num_tokens": 883883928.0, "step": 27694 }, { "entropy": 0.5429922584444284, "epoch": 2.5480819546753612, "grad_norm": 0.16006812453269958, "learning_rate": 1.5067316833808692e-05, "loss": 0.5248, "mean_token_accuracy": 0.8331958949565887, "num_tokens": 883916046.0, "step": 27695 }, { "entropy": 0.631509416969493, "epoch": 2.5481739610468024, "grad_norm": 0.17517608404159546, "learning_rate": 1.5064250007667067e-05, "loss": 0.6227, "mean_token_accuracy": 0.8064495548605919, "num_tokens": 883947346.0, "step": 27696 }, { "entropy": 0.5645633719395846, "epoch": 2.548265967418244, "grad_norm": 0.1647799164056778, "learning_rate": 1.506118318152544e-05, "loss": 0.5505, "mean_token_accuracy": 0.8247751630842686, "num_tokens": 883979454.0, "step": 27697 }, { "entropy": 0.5427409196272492, "epoch": 2.548357973789685, "grad_norm": 0.1623416244983673, "learning_rate": 1.5058116355383814e-05, "loss": 0.5366, "mean_token_accuracy": 0.8292931355535984, "num_tokens": 884011598.0, "step": 27698 }, { "entropy": 0.4525714414194226, "epoch": 2.5484499801611262, "grad_norm": 0.15621042251586914, "learning_rate": 1.5055049529242187e-05, "loss": 0.4491, "mean_token_accuracy": 0.8547332771122456, "num_tokens": 884043513.0, "step": 27699 }, { "entropy": 0.41818296490237117, "epoch": 2.5485419865325674, "grad_norm": 0.14266522228717804, "learning_rate": 1.5051982703100562e-05, "loss": 0.403, "mean_token_accuracy": 0.8712203130126, "num_tokens": 884075059.0, "step": 27700 }, { "entropy": 0.5264016296714544, "epoch": 2.5486339929040085, "grad_norm": 0.16427545249462128, "learning_rate": 1.5048915876958935e-05, "loss": 0.5093, "mean_token_accuracy": 0.8354694098234177, "num_tokens": 884106461.0, "step": 27701 }, { "entropy": 0.5689514947589487, "epoch": 2.54872599927545, "grad_norm": 0.1717558056116104, "learning_rate": 1.504584905081731e-05, "loss": 0.5585, "mean_token_accuracy": 0.8228549472987652, "num_tokens": 884137588.0, "step": 27702 }, { "entropy": 0.4773866757750511, "epoch": 2.548818005646891, "grad_norm": 0.1550758183002472, "learning_rate": 1.5042782224675683e-05, "loss": 0.4668, "mean_token_accuracy": 0.8496535569429398, "num_tokens": 884169623.0, "step": 27703 }, { "entropy": 0.5115660452283919, "epoch": 2.5489100120183323, "grad_norm": 0.1610226184129715, "learning_rate": 1.5039715398534057e-05, "loss": 0.5166, "mean_token_accuracy": 0.8397250771522522, "num_tokens": 884201698.0, "step": 27704 }, { "entropy": 0.5571389012038708, "epoch": 2.5490020183897735, "grad_norm": 0.1656779795885086, "learning_rate": 1.5036648572392432e-05, "loss": 0.5456, "mean_token_accuracy": 0.8253315761685371, "num_tokens": 884233635.0, "step": 27705 }, { "entropy": 0.5251869540661573, "epoch": 2.5490940247612146, "grad_norm": 0.15756836533546448, "learning_rate": 1.5033581746250805e-05, "loss": 0.5163, "mean_token_accuracy": 0.8380354829132557, "num_tokens": 884265073.0, "step": 27706 }, { "entropy": 0.5591123346239328, "epoch": 2.549186031132656, "grad_norm": 0.16779546439647675, "learning_rate": 1.503051492010918e-05, "loss": 0.5536, "mean_token_accuracy": 0.8259154222905636, "num_tokens": 884297224.0, "step": 27707 }, { "entropy": 0.3905683499760926, "epoch": 2.5492780375040973, "grad_norm": 0.1450902819633484, "learning_rate": 1.5027448093967552e-05, "loss": 0.3731, "mean_token_accuracy": 0.880497831851244, "num_tokens": 884329697.0, "step": 27708 }, { "entropy": 0.5285640666261315, "epoch": 2.5493700438755384, "grad_norm": 0.15985360741615295, "learning_rate": 1.5024381267825927e-05, "loss": 0.5213, "mean_token_accuracy": 0.8351783119142056, "num_tokens": 884361705.0, "step": 27709 }, { "entropy": 0.527408305555582, "epoch": 2.5494620502469796, "grad_norm": 0.16175666451454163, "learning_rate": 1.50213144416843e-05, "loss": 0.528, "mean_token_accuracy": 0.833770576864481, "num_tokens": 884393984.0, "step": 27710 }, { "entropy": 0.43171686585992575, "epoch": 2.5495540566184207, "grad_norm": 0.14957678318023682, "learning_rate": 1.5018247615542675e-05, "loss": 0.4067, "mean_token_accuracy": 0.8668294847011566, "num_tokens": 884425135.0, "step": 27711 }, { "entropy": 0.5000221645459533, "epoch": 2.5496460629898623, "grad_norm": 0.15814247727394104, "learning_rate": 1.5015180789401048e-05, "loss": 0.4908, "mean_token_accuracy": 0.8432847820222378, "num_tokens": 884457052.0, "step": 27712 }, { "entropy": 0.5703133661299944, "epoch": 2.5497380693613034, "grad_norm": 0.16516362130641937, "learning_rate": 1.5012113963259426e-05, "loss": 0.5622, "mean_token_accuracy": 0.8231674917042255, "num_tokens": 884489053.0, "step": 27713 }, { "entropy": 0.5836523398756981, "epoch": 2.5498300757327446, "grad_norm": 0.16543829441070557, "learning_rate": 1.5009047137117799e-05, "loss": 0.5707, "mean_token_accuracy": 0.8208726309239864, "num_tokens": 884521320.0, "step": 27714 }, { "entropy": 0.5715703098103404, "epoch": 2.5499220821041857, "grad_norm": 0.165090411901474, "learning_rate": 1.5005980310976173e-05, "loss": 0.5519, "mean_token_accuracy": 0.824004303663969, "num_tokens": 884552419.0, "step": 27715 }, { "entropy": 0.6489811353385448, "epoch": 2.550014088475627, "grad_norm": 0.17258404195308685, "learning_rate": 1.5002913484834546e-05, "loss": 0.6514, "mean_token_accuracy": 0.7966431975364685, "num_tokens": 884584950.0, "step": 27716 }, { "entropy": 0.5383151625283062, "epoch": 2.5501060948470684, "grad_norm": 0.1648622304201126, "learning_rate": 1.499984665869292e-05, "loss": 0.5347, "mean_token_accuracy": 0.8276506215333939, "num_tokens": 884616352.0, "step": 27717 }, { "entropy": 0.5217035785317421, "epoch": 2.5501981012185095, "grad_norm": 0.16287560760974884, "learning_rate": 1.4996779832551294e-05, "loss": 0.5073, "mean_token_accuracy": 0.8377256095409393, "num_tokens": 884647777.0, "step": 27718 }, { "entropy": 0.5155427530407906, "epoch": 2.5502901075899507, "grad_norm": 0.15150584280490875, "learning_rate": 1.4993713006409668e-05, "loss": 0.4965, "mean_token_accuracy": 0.8443825840950012, "num_tokens": 884679144.0, "step": 27719 }, { "entropy": 0.49809969402849674, "epoch": 2.550382113961392, "grad_norm": 0.1596212238073349, "learning_rate": 1.4990646180268041e-05, "loss": 0.4914, "mean_token_accuracy": 0.8431305959820747, "num_tokens": 884711234.0, "step": 27720 }, { "entropy": 0.5329316803254187, "epoch": 2.550474120332833, "grad_norm": 0.16413739323616028, "learning_rate": 1.4987579354126416e-05, "loss": 0.5257, "mean_token_accuracy": 0.8306985832750797, "num_tokens": 884743472.0, "step": 27721 }, { "entropy": 0.5332930502481759, "epoch": 2.5505661267042745, "grad_norm": 0.1614294797182083, "learning_rate": 1.4984512527984789e-05, "loss": 0.5098, "mean_token_accuracy": 0.8367998488247395, "num_tokens": 884774928.0, "step": 27722 }, { "entropy": 0.6395904310047626, "epoch": 2.5506581330757157, "grad_norm": 0.1737910658121109, "learning_rate": 1.4981445701843164e-05, "loss": 0.6248, "mean_token_accuracy": 0.804528683423996, "num_tokens": 884806889.0, "step": 27723 }, { "entropy": 0.6315637035295367, "epoch": 2.550750139447157, "grad_norm": 0.1734548658132553, "learning_rate": 1.4978378875701538e-05, "loss": 0.6094, "mean_token_accuracy": 0.8087538070976734, "num_tokens": 884838420.0, "step": 27724 }, { "entropy": 0.5086083812639117, "epoch": 2.550842145818598, "grad_norm": 0.1531190723180771, "learning_rate": 1.4975312049559911e-05, "loss": 0.4967, "mean_token_accuracy": 0.8417605087161064, "num_tokens": 884870951.0, "step": 27725 }, { "entropy": 0.5208493256941438, "epoch": 2.550934152190039, "grad_norm": 0.15686511993408203, "learning_rate": 1.4972245223418286e-05, "loss": 0.507, "mean_token_accuracy": 0.8368440419435501, "num_tokens": 884903323.0, "step": 27726 }, { "entropy": 0.5600712988525629, "epoch": 2.5510261585614806, "grad_norm": 0.1628686934709549, "learning_rate": 1.4969178397276659e-05, "loss": 0.538, "mean_token_accuracy": 0.8296018801629543, "num_tokens": 884934498.0, "step": 27727 }, { "entropy": 0.5323799178004265, "epoch": 2.5511181649329218, "grad_norm": 0.16600818932056427, "learning_rate": 1.4966111571135033e-05, "loss": 0.5266, "mean_token_accuracy": 0.8329383879899979, "num_tokens": 884966453.0, "step": 27728 }, { "entropy": 0.5542880687862635, "epoch": 2.551210171304363, "grad_norm": 0.16105802357196808, "learning_rate": 1.4963044744993406e-05, "loss": 0.5422, "mean_token_accuracy": 0.8317885994911194, "num_tokens": 884998010.0, "step": 27729 }, { "entropy": 0.5101466439664364, "epoch": 2.551302177675804, "grad_norm": 0.15874165296554565, "learning_rate": 1.4959977918851781e-05, "loss": 0.4939, "mean_token_accuracy": 0.8430039547383785, "num_tokens": 885030248.0, "step": 27730 }, { "entropy": 0.5649687722325325, "epoch": 2.551394184047245, "grad_norm": 0.16379885375499725, "learning_rate": 1.4956911092710154e-05, "loss": 0.5461, "mean_token_accuracy": 0.8297393396496773, "num_tokens": 885062558.0, "step": 27731 }, { "entropy": 0.49666882539168, "epoch": 2.5514861904186867, "grad_norm": 0.15951892733573914, "learning_rate": 1.4953844266568529e-05, "loss": 0.4811, "mean_token_accuracy": 0.8440837822854519, "num_tokens": 885094011.0, "step": 27732 }, { "entropy": 0.5438062530010939, "epoch": 2.551578196790128, "grad_norm": 0.16852104663848877, "learning_rate": 1.4950777440426902e-05, "loss": 0.5398, "mean_token_accuracy": 0.8278269544243813, "num_tokens": 885126313.0, "step": 27733 }, { "entropy": 0.5579853085801005, "epoch": 2.551670203161569, "grad_norm": 0.1653009057044983, "learning_rate": 1.4947710614285276e-05, "loss": 0.5482, "mean_token_accuracy": 0.8273465558886528, "num_tokens": 885158011.0, "step": 27734 }, { "entropy": 0.4353275840403512, "epoch": 2.55176220953301, "grad_norm": 0.15073804557323456, "learning_rate": 1.4944643788143651e-05, "loss": 0.4327, "mean_token_accuracy": 0.8640369474887848, "num_tokens": 885189971.0, "step": 27735 }, { "entropy": 0.4771358754951507, "epoch": 2.5518542159044513, "grad_norm": 0.15354929864406586, "learning_rate": 1.4941576962002024e-05, "loss": 0.4565, "mean_token_accuracy": 0.8569183386862278, "num_tokens": 885221567.0, "step": 27736 }, { "entropy": 0.5536472499370575, "epoch": 2.551946222275893, "grad_norm": 0.17027287185192108, "learning_rate": 1.4938510135860399e-05, "loss": 0.5553, "mean_token_accuracy": 0.823649451136589, "num_tokens": 885253242.0, "step": 27737 }, { "entropy": 0.45511845126748085, "epoch": 2.552038228647334, "grad_norm": 0.15681378543376923, "learning_rate": 1.4935443309718771e-05, "loss": 0.4453, "mean_token_accuracy": 0.858614481985569, "num_tokens": 885285128.0, "step": 27738 }, { "entropy": 0.5428127218037844, "epoch": 2.552130235018775, "grad_norm": 0.16012707352638245, "learning_rate": 1.4932376483577146e-05, "loss": 0.5372, "mean_token_accuracy": 0.8290605284273624, "num_tokens": 885317158.0, "step": 27739 }, { "entropy": 0.5762438047677279, "epoch": 2.5522222413902163, "grad_norm": 0.16844969987869263, "learning_rate": 1.4929309657435519e-05, "loss": 0.5703, "mean_token_accuracy": 0.8189755529165268, "num_tokens": 885349034.0, "step": 27740 }, { "entropy": 0.5175189767032862, "epoch": 2.5523142477616574, "grad_norm": 0.16157466173171997, "learning_rate": 1.4926242831293894e-05, "loss": 0.5059, "mean_token_accuracy": 0.8412058502435684, "num_tokens": 885380466.0, "step": 27741 }, { "entropy": 0.5354978828690946, "epoch": 2.552406254133099, "grad_norm": 0.16393831372261047, "learning_rate": 1.4923176005152267e-05, "loss": 0.5203, "mean_token_accuracy": 0.833407212048769, "num_tokens": 885411714.0, "step": 27742 }, { "entropy": 0.49221176374703646, "epoch": 2.55249826050454, "grad_norm": 0.1597551554441452, "learning_rate": 1.4920109179010645e-05, "loss": 0.484, "mean_token_accuracy": 0.8447730205953121, "num_tokens": 885444101.0, "step": 27743 }, { "entropy": 0.5830982020124793, "epoch": 2.5525902668759812, "grad_norm": 0.16880843043327332, "learning_rate": 1.4917042352869018e-05, "loss": 0.5716, "mean_token_accuracy": 0.820639681071043, "num_tokens": 885475644.0, "step": 27744 }, { "entropy": 0.5684425716754049, "epoch": 2.5526822732474224, "grad_norm": 0.16082458198070526, "learning_rate": 1.4913975526727392e-05, "loss": 0.5539, "mean_token_accuracy": 0.8259568624198437, "num_tokens": 885507924.0, "step": 27745 }, { "entropy": 0.5679094363003969, "epoch": 2.5527742796188635, "grad_norm": 0.16368436813354492, "learning_rate": 1.4910908700585765e-05, "loss": 0.5577, "mean_token_accuracy": 0.8234690316021442, "num_tokens": 885540526.0, "step": 27746 }, { "entropy": 0.3927176110446453, "epoch": 2.552866285990305, "grad_norm": 0.13851258158683777, "learning_rate": 1.490784187444414e-05, "loss": 0.3758, "mean_token_accuracy": 0.8781523816287518, "num_tokens": 885572739.0, "step": 27747 }, { "entropy": 0.526117155328393, "epoch": 2.552958292361746, "grad_norm": 0.1678411364555359, "learning_rate": 1.4904775048302513e-05, "loss": 0.5204, "mean_token_accuracy": 0.8297394663095474, "num_tokens": 885604769.0, "step": 27748 }, { "entropy": 0.5353841832838953, "epoch": 2.5530502987331873, "grad_norm": 0.16350361704826355, "learning_rate": 1.4901708222160888e-05, "loss": 0.5242, "mean_token_accuracy": 0.8354743905365467, "num_tokens": 885636537.0, "step": 27749 }, { "entropy": 0.528598939999938, "epoch": 2.5531423051046285, "grad_norm": 0.1606869101524353, "learning_rate": 1.489864139601926e-05, "loss": 0.5181, "mean_token_accuracy": 0.8372217267751694, "num_tokens": 885668559.0, "step": 27750 }, { "entropy": 0.5287343803793192, "epoch": 2.5532343114760696, "grad_norm": 0.16111688315868378, "learning_rate": 1.4895574569877635e-05, "loss": 0.5114, "mean_token_accuracy": 0.8357821218669415, "num_tokens": 885700006.0, "step": 27751 }, { "entropy": 0.5696492679417133, "epoch": 2.553326317847511, "grad_norm": 0.16724130511283875, "learning_rate": 1.4892507743736008e-05, "loss": 0.5542, "mean_token_accuracy": 0.8267586305737495, "num_tokens": 885732251.0, "step": 27752 }, { "entropy": 0.47766492620576173, "epoch": 2.5534183242189523, "grad_norm": 0.1576155573129654, "learning_rate": 1.4889440917594383e-05, "loss": 0.4708, "mean_token_accuracy": 0.8500845730304718, "num_tokens": 885764258.0, "step": 27753 }, { "entropy": 0.6552340369671583, "epoch": 2.5535103305903935, "grad_norm": 0.17102935910224915, "learning_rate": 1.4886374091452757e-05, "loss": 0.6346, "mean_token_accuracy": 0.80001625046134, "num_tokens": 885796179.0, "step": 27754 }, { "entropy": 0.5267332335934043, "epoch": 2.5536023369618346, "grad_norm": 0.1568525731563568, "learning_rate": 1.488330726531113e-05, "loss": 0.5142, "mean_token_accuracy": 0.8362331539392471, "num_tokens": 885828678.0, "step": 27755 }, { "entropy": 0.5306254178285599, "epoch": 2.5536943433332757, "grad_norm": 0.159245565533638, "learning_rate": 1.4880240439169505e-05, "loss": 0.5167, "mean_token_accuracy": 0.8346015587449074, "num_tokens": 885861103.0, "step": 27756 }, { "entropy": 0.4968811646103859, "epoch": 2.5537863497047173, "grad_norm": 0.15916156768798828, "learning_rate": 1.4877173613027878e-05, "loss": 0.4865, "mean_token_accuracy": 0.8442533314228058, "num_tokens": 885892992.0, "step": 27757 }, { "entropy": 0.5249291025102139, "epoch": 2.5538783560761584, "grad_norm": 0.1648005098104477, "learning_rate": 1.4874106786886253e-05, "loss": 0.5212, "mean_token_accuracy": 0.8330894224345684, "num_tokens": 885924737.0, "step": 27758 }, { "entropy": 0.5890296436846256, "epoch": 2.5539703624475996, "grad_norm": 0.16680529713630676, "learning_rate": 1.4871039960744626e-05, "loss": 0.5777, "mean_token_accuracy": 0.8210273757576942, "num_tokens": 885957359.0, "step": 27759 }, { "entropy": 0.4557779091410339, "epoch": 2.5540623688190407, "grad_norm": 0.15289485454559326, "learning_rate": 1.4867973134603e-05, "loss": 0.4452, "mean_token_accuracy": 0.8552682138979435, "num_tokens": 885988897.0, "step": 27760 }, { "entropy": 0.5904393931850791, "epoch": 2.554154375190482, "grad_norm": 0.17368769645690918, "learning_rate": 1.4864906308461373e-05, "loss": 0.5845, "mean_token_accuracy": 0.8165866881608963, "num_tokens": 886020401.0, "step": 27761 }, { "entropy": 0.49112062714993954, "epoch": 2.5542463815619234, "grad_norm": 0.15660755336284637, "learning_rate": 1.4861839482319748e-05, "loss": 0.4898, "mean_token_accuracy": 0.8450849652290344, "num_tokens": 886052661.0, "step": 27762 }, { "entropy": 0.4900333760306239, "epoch": 2.5543383879333645, "grad_norm": 0.16091032326221466, "learning_rate": 1.485877265617812e-05, "loss": 0.4796, "mean_token_accuracy": 0.8469375297427177, "num_tokens": 886084173.0, "step": 27763 }, { "entropy": 0.518279604613781, "epoch": 2.5544303943048057, "grad_norm": 0.16013164818286896, "learning_rate": 1.4855705830036495e-05, "loss": 0.5065, "mean_token_accuracy": 0.8421951457858086, "num_tokens": 886116659.0, "step": 27764 }, { "entropy": 0.45587009843438864, "epoch": 2.554522400676247, "grad_norm": 0.15145806968212128, "learning_rate": 1.485263900389487e-05, "loss": 0.4464, "mean_token_accuracy": 0.8584715984761715, "num_tokens": 886149152.0, "step": 27765 }, { "entropy": 0.4309831289574504, "epoch": 2.554614407047688, "grad_norm": 0.1470658779144287, "learning_rate": 1.4849572177753243e-05, "loss": 0.4192, "mean_token_accuracy": 0.8645019233226776, "num_tokens": 886180982.0, "step": 27766 }, { "entropy": 0.5371537450700998, "epoch": 2.5547064134191295, "grad_norm": 0.16050411760807037, "learning_rate": 1.4846505351611618e-05, "loss": 0.5354, "mean_token_accuracy": 0.8303024247288704, "num_tokens": 886212837.0, "step": 27767 }, { "entropy": 0.5060637947171926, "epoch": 2.5547984197905707, "grad_norm": 0.16177740693092346, "learning_rate": 1.484343852546999e-05, "loss": 0.4951, "mean_token_accuracy": 0.8402470648288727, "num_tokens": 886244963.0, "step": 27768 }, { "entropy": 0.5621495940722525, "epoch": 2.554890426162012, "grad_norm": 0.16222575306892395, "learning_rate": 1.4840371699328365e-05, "loss": 0.5518, "mean_token_accuracy": 0.8256402276456356, "num_tokens": 886276895.0, "step": 27769 }, { "entropy": 0.5369127169251442, "epoch": 2.554982432533453, "grad_norm": 0.16498851776123047, "learning_rate": 1.4837304873186738e-05, "loss": 0.5133, "mean_token_accuracy": 0.8361133709549904, "num_tokens": 886308326.0, "step": 27770 }, { "entropy": 0.547296442091465, "epoch": 2.555074438904894, "grad_norm": 0.16616180539131165, "learning_rate": 1.4834238047045113e-05, "loss": 0.5294, "mean_token_accuracy": 0.8330785259604454, "num_tokens": 886339538.0, "step": 27771 }, { "entropy": 0.46630820352584124, "epoch": 2.5551664452763356, "grad_norm": 0.14981180429458618, "learning_rate": 1.4831171220903486e-05, "loss": 0.4553, "mean_token_accuracy": 0.8542746528983116, "num_tokens": 886371894.0, "step": 27772 }, { "entropy": 0.5252022780478001, "epoch": 2.5552584516477768, "grad_norm": 0.156199648976326, "learning_rate": 1.482810439476186e-05, "loss": 0.507, "mean_token_accuracy": 0.8368638753890991, "num_tokens": 886403903.0, "step": 27773 }, { "entropy": 0.4671247978694737, "epoch": 2.555350458019218, "grad_norm": 0.15423937141895294, "learning_rate": 1.4825037568620237e-05, "loss": 0.459, "mean_token_accuracy": 0.8578252010047436, "num_tokens": 886435021.0, "step": 27774 }, { "entropy": 0.5901870913803577, "epoch": 2.555442464390659, "grad_norm": 0.1700919270515442, "learning_rate": 1.4821970742478611e-05, "loss": 0.5731, "mean_token_accuracy": 0.8190192170441151, "num_tokens": 886467190.0, "step": 27775 }, { "entropy": 0.605309035629034, "epoch": 2.5555344707621, "grad_norm": 0.17214706540107727, "learning_rate": 1.4818903916336984e-05, "loss": 0.5853, "mean_token_accuracy": 0.8155617974698544, "num_tokens": 886497917.0, "step": 27776 }, { "entropy": 0.4988372949883342, "epoch": 2.5556264771335417, "grad_norm": 0.15481148660182953, "learning_rate": 1.4815837090195359e-05, "loss": 0.4935, "mean_token_accuracy": 0.8411728590726852, "num_tokens": 886530474.0, "step": 27777 }, { "entropy": 0.4624803503975272, "epoch": 2.555718483504983, "grad_norm": 0.15218305587768555, "learning_rate": 1.4812770264053732e-05, "loss": 0.4478, "mean_token_accuracy": 0.8555657751858234, "num_tokens": 886561819.0, "step": 27778 }, { "entropy": 0.5440258197486401, "epoch": 2.555810489876424, "grad_norm": 0.1658957600593567, "learning_rate": 1.4809703437912107e-05, "loss": 0.5275, "mean_token_accuracy": 0.8299906067550182, "num_tokens": 886593440.0, "step": 27779 }, { "entropy": 0.5813372144475579, "epoch": 2.555902496247865, "grad_norm": 0.17095547914505005, "learning_rate": 1.480663661177048e-05, "loss": 0.5691, "mean_token_accuracy": 0.8190394267439842, "num_tokens": 886624753.0, "step": 27780 }, { "entropy": 0.5823286827653646, "epoch": 2.5559945026193063, "grad_norm": 0.16710956394672394, "learning_rate": 1.4803569785628854e-05, "loss": 0.5712, "mean_token_accuracy": 0.8201703876256943, "num_tokens": 886656023.0, "step": 27781 }, { "entropy": 0.5901878038421273, "epoch": 2.556086508990748, "grad_norm": 0.16583047807216644, "learning_rate": 1.4800502959487227e-05, "loss": 0.5743, "mean_token_accuracy": 0.8203124217689037, "num_tokens": 886687570.0, "step": 27782 }, { "entropy": 0.5283182030543685, "epoch": 2.556178515362189, "grad_norm": 0.15974834561347961, "learning_rate": 1.4797436133345602e-05, "loss": 0.5198, "mean_token_accuracy": 0.8378865867853165, "num_tokens": 886720113.0, "step": 27783 }, { "entropy": 0.5651879943907261, "epoch": 2.55627052173363, "grad_norm": 0.16526579856872559, "learning_rate": 1.4794369307203976e-05, "loss": 0.5454, "mean_token_accuracy": 0.8277808092534542, "num_tokens": 886752166.0, "step": 27784 }, { "entropy": 0.4477510657161474, "epoch": 2.5563625281050713, "grad_norm": 0.15678711235523224, "learning_rate": 1.479130248106235e-05, "loss": 0.4345, "mean_token_accuracy": 0.8629728741943836, "num_tokens": 886783576.0, "step": 27785 }, { "entropy": 0.5726585905067623, "epoch": 2.5564545344765124, "grad_norm": 0.16683216392993927, "learning_rate": 1.4788235654920724e-05, "loss": 0.553, "mean_token_accuracy": 0.8239772953093052, "num_tokens": 886815665.0, "step": 27786 }, { "entropy": 0.5099908832926303, "epoch": 2.556546540847954, "grad_norm": 0.15408439934253693, "learning_rate": 1.4785168828779097e-05, "loss": 0.4938, "mean_token_accuracy": 0.8418035060167313, "num_tokens": 886847972.0, "step": 27787 }, { "entropy": 0.5157418835442513, "epoch": 2.556638547219395, "grad_norm": 0.16059982776641846, "learning_rate": 1.4782102002637472e-05, "loss": 0.5004, "mean_token_accuracy": 0.8414102271199226, "num_tokens": 886879427.0, "step": 27788 }, { "entropy": 0.5860890292096883, "epoch": 2.5567305535908362, "grad_norm": 0.167585089802742, "learning_rate": 1.4779035176495845e-05, "loss": 0.57, "mean_token_accuracy": 0.8204044699668884, "num_tokens": 886910842.0, "step": 27789 }, { "entropy": 0.512324913404882, "epoch": 2.5568225599622774, "grad_norm": 0.15909262001514435, "learning_rate": 1.477596835035422e-05, "loss": 0.4904, "mean_token_accuracy": 0.843363881111145, "num_tokens": 886942383.0, "step": 27790 }, { "entropy": 0.5283442046493292, "epoch": 2.5569145663337185, "grad_norm": 0.1602851003408432, "learning_rate": 1.4772901524212592e-05, "loss": 0.5245, "mean_token_accuracy": 0.8345499001443386, "num_tokens": 886974212.0, "step": 27791 }, { "entropy": 0.3772775400429964, "epoch": 2.55700657270516, "grad_norm": 0.13854117691516876, "learning_rate": 1.4769834698070967e-05, "loss": 0.3712, "mean_token_accuracy": 0.8810323588550091, "num_tokens": 887006839.0, "step": 27792 }, { "entropy": 0.4803765807300806, "epoch": 2.557098579076601, "grad_norm": 0.15746766328811646, "learning_rate": 1.476676787192934e-05, "loss": 0.477, "mean_token_accuracy": 0.8439763188362122, "num_tokens": 887038921.0, "step": 27793 }, { "entropy": 0.4840179421007633, "epoch": 2.5571905854480423, "grad_norm": 0.15849323570728302, "learning_rate": 1.4763701045787714e-05, "loss": 0.4828, "mean_token_accuracy": 0.8470689579844475, "num_tokens": 887070924.0, "step": 27794 }, { "entropy": 0.5456590093672276, "epoch": 2.5572825918194835, "grad_norm": 0.16252852976322174, "learning_rate": 1.4760634219646089e-05, "loss": 0.54, "mean_token_accuracy": 0.8292318023741245, "num_tokens": 887103692.0, "step": 27795 }, { "entropy": 0.5617377441376448, "epoch": 2.5573745981909246, "grad_norm": 0.16844724118709564, "learning_rate": 1.4757567393504462e-05, "loss": 0.5605, "mean_token_accuracy": 0.823931660503149, "num_tokens": 887134893.0, "step": 27796 }, { "entropy": 0.44587725459132344, "epoch": 2.557466604562366, "grad_norm": 0.14778925478458405, "learning_rate": 1.4754500567362837e-05, "loss": 0.4358, "mean_token_accuracy": 0.8617678955197334, "num_tokens": 887167264.0, "step": 27797 }, { "entropy": 0.5428641214966774, "epoch": 2.5575586109338073, "grad_norm": 0.15973928570747375, "learning_rate": 1.475143374122121e-05, "loss": 0.5252, "mean_token_accuracy": 0.8323867619037628, "num_tokens": 887199669.0, "step": 27798 }, { "entropy": 0.4899164019152522, "epoch": 2.5576506173052485, "grad_norm": 0.15903529524803162, "learning_rate": 1.4748366915079584e-05, "loss": 0.4732, "mean_token_accuracy": 0.846773486584425, "num_tokens": 887231325.0, "step": 27799 }, { "entropy": 0.46498246071860194, "epoch": 2.5577426236766896, "grad_norm": 0.15194833278656006, "learning_rate": 1.4745300088937957e-05, "loss": 0.4564, "mean_token_accuracy": 0.8587567061185837, "num_tokens": 887264093.0, "step": 27800 }, { "entropy": 0.5373880341649055, "epoch": 2.5578346300481307, "grad_norm": 0.15766221284866333, "learning_rate": 1.4742233262796332e-05, "loss": 0.5225, "mean_token_accuracy": 0.8322029113769531, "num_tokens": 887295570.0, "step": 27801 }, { "entropy": 0.5575330965220928, "epoch": 2.5579266364195723, "grad_norm": 0.16105259954929352, "learning_rate": 1.4739166436654705e-05, "loss": 0.5471, "mean_token_accuracy": 0.8266910724341869, "num_tokens": 887327071.0, "step": 27802 }, { "entropy": 0.49906399939209223, "epoch": 2.5580186427910134, "grad_norm": 0.1539108157157898, "learning_rate": 1.473609961051308e-05, "loss": 0.4892, "mean_token_accuracy": 0.845823023468256, "num_tokens": 887358741.0, "step": 27803 }, { "entropy": 0.5466690696775913, "epoch": 2.5581106491624546, "grad_norm": 0.16603243350982666, "learning_rate": 1.4733032784371456e-05, "loss": 0.5441, "mean_token_accuracy": 0.8276195861399174, "num_tokens": 887389424.0, "step": 27804 }, { "entropy": 0.43679719883948565, "epoch": 2.5582026555338957, "grad_norm": 0.15233413875102997, "learning_rate": 1.472996595822983e-05, "loss": 0.4302, "mean_token_accuracy": 0.8649149462580681, "num_tokens": 887421170.0, "step": 27805 }, { "entropy": 0.601218743249774, "epoch": 2.558294661905337, "grad_norm": 0.16703346371650696, "learning_rate": 1.4726899132088203e-05, "loss": 0.5775, "mean_token_accuracy": 0.817918311804533, "num_tokens": 887453385.0, "step": 27806 }, { "entropy": 0.5322594717144966, "epoch": 2.5583866682767784, "grad_norm": 0.16671733558177948, "learning_rate": 1.4723832305946578e-05, "loss": 0.5193, "mean_token_accuracy": 0.8326730541884899, "num_tokens": 887484820.0, "step": 27807 }, { "entropy": 0.5309737483039498, "epoch": 2.5584786746482195, "grad_norm": 0.16037388145923615, "learning_rate": 1.4720765479804951e-05, "loss": 0.5196, "mean_token_accuracy": 0.8378827162086964, "num_tokens": 887517274.0, "step": 27808 }, { "entropy": 0.6406680773943663, "epoch": 2.5585706810196607, "grad_norm": 0.17626477777957916, "learning_rate": 1.4717698653663326e-05, "loss": 0.6286, "mean_token_accuracy": 0.8043615967035294, "num_tokens": 887549030.0, "step": 27809 }, { "entropy": 0.428845944814384, "epoch": 2.558662687391102, "grad_norm": 0.14507938921451569, "learning_rate": 1.4714631827521699e-05, "loss": 0.41, "mean_token_accuracy": 0.8665057048201561, "num_tokens": 887581057.0, "step": 27810 }, { "entropy": 0.5006661741062999, "epoch": 2.558754693762543, "grad_norm": 0.16100528836250305, "learning_rate": 1.4711565001380073e-05, "loss": 0.487, "mean_token_accuracy": 0.8450873605906963, "num_tokens": 887613177.0, "step": 27811 }, { "entropy": 0.5714829489588737, "epoch": 2.5588467001339845, "grad_norm": 0.16638785600662231, "learning_rate": 1.4708498175238446e-05, "loss": 0.5657, "mean_token_accuracy": 0.8210067749023438, "num_tokens": 887645696.0, "step": 27812 }, { "entropy": 0.5064878668636084, "epoch": 2.5589387065054257, "grad_norm": 0.15981778502464294, "learning_rate": 1.4705431349096821e-05, "loss": 0.4971, "mean_token_accuracy": 0.8393071852624416, "num_tokens": 887678086.0, "step": 27813 }, { "entropy": 0.5264242519624531, "epoch": 2.559030712876867, "grad_norm": 0.15909576416015625, "learning_rate": 1.4702364522955196e-05, "loss": 0.517, "mean_token_accuracy": 0.836851567029953, "num_tokens": 887710481.0, "step": 27814 }, { "entropy": 0.538302956148982, "epoch": 2.559122719248308, "grad_norm": 0.16370894014835358, "learning_rate": 1.4699297696813569e-05, "loss": 0.5168, "mean_token_accuracy": 0.8348500169813633, "num_tokens": 887741994.0, "step": 27815 }, { "entropy": 0.5216371230781078, "epoch": 2.559214725619749, "grad_norm": 0.1634582281112671, "learning_rate": 1.4696230870671943e-05, "loss": 0.5163, "mean_token_accuracy": 0.8379722572863102, "num_tokens": 887773801.0, "step": 27816 }, { "entropy": 0.5115515114739537, "epoch": 2.5593067319911906, "grad_norm": 0.16425460577011108, "learning_rate": 1.4693164044530316e-05, "loss": 0.5021, "mean_token_accuracy": 0.8375984579324722, "num_tokens": 887805498.0, "step": 27817 }, { "entropy": 0.5274952184408903, "epoch": 2.5593987383626318, "grad_norm": 0.1602727472782135, "learning_rate": 1.469009721838869e-05, "loss": 0.5091, "mean_token_accuracy": 0.8355798609554768, "num_tokens": 887837532.0, "step": 27818 }, { "entropy": 0.5182161012198776, "epoch": 2.559490744734073, "grad_norm": 0.15567757189273834, "learning_rate": 1.4687030392247064e-05, "loss": 0.5025, "mean_token_accuracy": 0.839700497686863, "num_tokens": 887869195.0, "step": 27819 }, { "entropy": 0.48612394789233804, "epoch": 2.559582751105514, "grad_norm": 0.15481944382190704, "learning_rate": 1.4683963566105438e-05, "loss": 0.4766, "mean_token_accuracy": 0.8494624197483063, "num_tokens": 887901684.0, "step": 27820 }, { "entropy": 0.5048131123185158, "epoch": 2.559674757476955, "grad_norm": 0.15967464447021484, "learning_rate": 1.4680896739963811e-05, "loss": 0.4956, "mean_token_accuracy": 0.8403472453355789, "num_tokens": 887934000.0, "step": 27821 }, { "entropy": 0.5459638591855764, "epoch": 2.5597667638483967, "grad_norm": 0.15926826000213623, "learning_rate": 1.4677829913822186e-05, "loss": 0.5377, "mean_token_accuracy": 0.828897912055254, "num_tokens": 887966464.0, "step": 27822 }, { "entropy": 0.5767986536957324, "epoch": 2.559858770219838, "grad_norm": 0.17316672205924988, "learning_rate": 1.4674763087680559e-05, "loss": 0.5685, "mean_token_accuracy": 0.8184676803648472, "num_tokens": 887997112.0, "step": 27823 }, { "entropy": 0.5808033626526594, "epoch": 2.559950776591279, "grad_norm": 0.17102862894535065, "learning_rate": 1.4671696261538934e-05, "loss": 0.5729, "mean_token_accuracy": 0.8221135474741459, "num_tokens": 888028090.0, "step": 27824 }, { "entropy": 0.5417574988678098, "epoch": 2.56004278296272, "grad_norm": 0.16101601719856262, "learning_rate": 1.4668629435397308e-05, "loss": 0.5296, "mean_token_accuracy": 0.833260428160429, "num_tokens": 888060192.0, "step": 27825 }, { "entropy": 0.5546387368813157, "epoch": 2.5601347893341613, "grad_norm": 0.15997368097305298, "learning_rate": 1.4665562609255681e-05, "loss": 0.5367, "mean_token_accuracy": 0.8328613787889481, "num_tokens": 888092503.0, "step": 27826 }, { "entropy": 0.3551357811084017, "epoch": 2.560226795705603, "grad_norm": 0.1365368366241455, "learning_rate": 1.4662495783114056e-05, "loss": 0.3504, "mean_token_accuracy": 0.8876235969364643, "num_tokens": 888125057.0, "step": 27827 }, { "entropy": 0.5122458040714264, "epoch": 2.560318802077044, "grad_norm": 0.16444221138954163, "learning_rate": 1.4659428956972429e-05, "loss": 0.5134, "mean_token_accuracy": 0.8377237878739834, "num_tokens": 888157636.0, "step": 27828 }, { "entropy": 0.6029087835922837, "epoch": 2.560410808448485, "grad_norm": 0.1636374443769455, "learning_rate": 1.4656362130830803e-05, "loss": 0.5905, "mean_token_accuracy": 0.8145636729896069, "num_tokens": 888190244.0, "step": 27829 }, { "entropy": 0.5383347311289981, "epoch": 2.5605028148199263, "grad_norm": 0.1603499948978424, "learning_rate": 1.4653295304689176e-05, "loss": 0.513, "mean_token_accuracy": 0.8372562862932682, "num_tokens": 888222258.0, "step": 27830 }, { "entropy": 0.47993308538571, "epoch": 2.5605948211913674, "grad_norm": 0.15628361701965332, "learning_rate": 1.4650228478547551e-05, "loss": 0.4728, "mean_token_accuracy": 0.8521546870470047, "num_tokens": 888254549.0, "step": 27831 }, { "entropy": 0.582900358363986, "epoch": 2.560686827562809, "grad_norm": 0.17308922111988068, "learning_rate": 1.4647161652405924e-05, "loss": 0.5771, "mean_token_accuracy": 0.8182068690657616, "num_tokens": 888285892.0, "step": 27832 }, { "entropy": 0.5466966489329934, "epoch": 2.56077883393425, "grad_norm": 0.16441458463668823, "learning_rate": 1.4644094826264299e-05, "loss": 0.5379, "mean_token_accuracy": 0.8298460021615028, "num_tokens": 888317543.0, "step": 27833 }, { "entropy": 0.5271537695080042, "epoch": 2.5608708403056912, "grad_norm": 0.16171178221702576, "learning_rate": 1.4641028000122672e-05, "loss": 0.5234, "mean_token_accuracy": 0.835220854729414, "num_tokens": 888349469.0, "step": 27834 }, { "entropy": 0.6165052093565464, "epoch": 2.5609628466771324, "grad_norm": 0.1666002869606018, "learning_rate": 1.463796117398105e-05, "loss": 0.6053, "mean_token_accuracy": 0.8115911893546581, "num_tokens": 888381728.0, "step": 27835 }, { "entropy": 0.4981239391490817, "epoch": 2.5610548530485735, "grad_norm": 0.15907466411590576, "learning_rate": 1.4634894347839423e-05, "loss": 0.4798, "mean_token_accuracy": 0.8433601297438145, "num_tokens": 888412535.0, "step": 27836 }, { "entropy": 0.5324130854569376, "epoch": 2.561146859420015, "grad_norm": 0.16032002866268158, "learning_rate": 1.4631827521697797e-05, "loss": 0.5251, "mean_token_accuracy": 0.8331669494509697, "num_tokens": 888444367.0, "step": 27837 }, { "entropy": 0.5325604192912579, "epoch": 2.561238865791456, "grad_norm": 0.16300001740455627, "learning_rate": 1.462876069555617e-05, "loss": 0.5227, "mean_token_accuracy": 0.83275056630373, "num_tokens": 888476802.0, "step": 27838 }, { "entropy": 0.5162738936487585, "epoch": 2.5613308721628973, "grad_norm": 0.1602936089038849, "learning_rate": 1.4625693869414545e-05, "loss": 0.4934, "mean_token_accuracy": 0.8406838178634644, "num_tokens": 888508901.0, "step": 27839 }, { "entropy": 0.494780297158286, "epoch": 2.5614228785343385, "grad_norm": 0.15688611567020416, "learning_rate": 1.4622627043272918e-05, "loss": 0.4811, "mean_token_accuracy": 0.8422750048339367, "num_tokens": 888539960.0, "step": 27840 }, { "entropy": 0.6469319062307477, "epoch": 2.5615148849057796, "grad_norm": 0.1704064905643463, "learning_rate": 1.4619560217131292e-05, "loss": 0.6282, "mean_token_accuracy": 0.8037957437336445, "num_tokens": 888571950.0, "step": 27841 }, { "entropy": 0.5351004488766193, "epoch": 2.561606891277221, "grad_norm": 0.16993722319602966, "learning_rate": 1.4616493390989665e-05, "loss": 0.5267, "mean_token_accuracy": 0.8335268460214138, "num_tokens": 888603296.0, "step": 27842 }, { "entropy": 0.47536539332941175, "epoch": 2.5616988976486623, "grad_norm": 0.14958961308002472, "learning_rate": 1.461342656484804e-05, "loss": 0.4491, "mean_token_accuracy": 0.8554249182343483, "num_tokens": 888635100.0, "step": 27843 }, { "entropy": 0.5117098689079285, "epoch": 2.5617909040201035, "grad_norm": 0.15677207708358765, "learning_rate": 1.4610359738706415e-05, "loss": 0.4911, "mean_token_accuracy": 0.8455525562167168, "num_tokens": 888667366.0, "step": 27844 }, { "entropy": 0.4725087732076645, "epoch": 2.5618829103915446, "grad_norm": 0.16034062206745148, "learning_rate": 1.4607292912564788e-05, "loss": 0.4699, "mean_token_accuracy": 0.8521531634032726, "num_tokens": 888698870.0, "step": 27845 }, { "entropy": 0.5575875760987401, "epoch": 2.5619749167629857, "grad_norm": 0.16378040611743927, "learning_rate": 1.4604226086423162e-05, "loss": 0.5445, "mean_token_accuracy": 0.8263400606811047, "num_tokens": 888731006.0, "step": 27846 }, { "entropy": 0.4786405535414815, "epoch": 2.5620669231344273, "grad_norm": 0.15467435121536255, "learning_rate": 1.4601159260281535e-05, "loss": 0.4593, "mean_token_accuracy": 0.8527017347514629, "num_tokens": 888762814.0, "step": 27847 }, { "entropy": 0.5489912610501051, "epoch": 2.5621589295058684, "grad_norm": 0.16342693567276, "learning_rate": 1.459809243413991e-05, "loss": 0.5266, "mean_token_accuracy": 0.8314567543566227, "num_tokens": 888794501.0, "step": 27848 }, { "entropy": 0.5573507295921445, "epoch": 2.5622509358773096, "grad_norm": 0.1655006855726242, "learning_rate": 1.4595025607998283e-05, "loss": 0.5472, "mean_token_accuracy": 0.8278288803994656, "num_tokens": 888825745.0, "step": 27849 }, { "entropy": 0.47378135146573186, "epoch": 2.5623429422487507, "grad_norm": 0.15245293080806732, "learning_rate": 1.4591958781856657e-05, "loss": 0.4727, "mean_token_accuracy": 0.8533378317952156, "num_tokens": 888857931.0, "step": 27850 }, { "entropy": 0.5632905717939138, "epoch": 2.562434948620192, "grad_norm": 0.16033044457435608, "learning_rate": 1.458889195571503e-05, "loss": 0.5534, "mean_token_accuracy": 0.825084775686264, "num_tokens": 888890598.0, "step": 27851 }, { "entropy": 0.5382906589657068, "epoch": 2.5625269549916334, "grad_norm": 0.1653214991092682, "learning_rate": 1.4585825129573405e-05, "loss": 0.5347, "mean_token_accuracy": 0.8311030976474285, "num_tokens": 888922669.0, "step": 27852 }, { "entropy": 0.6000905721448362, "epoch": 2.5626189613630745, "grad_norm": 0.17090415954589844, "learning_rate": 1.4582758303431778e-05, "loss": 0.5883, "mean_token_accuracy": 0.8148649297654629, "num_tokens": 888954816.0, "step": 27853 }, { "entropy": 0.48878972604870796, "epoch": 2.5627109677345157, "grad_norm": 0.15494948625564575, "learning_rate": 1.4579691477290153e-05, "loss": 0.4789, "mean_token_accuracy": 0.845712173730135, "num_tokens": 888987076.0, "step": 27854 }, { "entropy": 0.6123590935021639, "epoch": 2.562802974105957, "grad_norm": 0.1697036772966385, "learning_rate": 1.4576624651148527e-05, "loss": 0.5946, "mean_token_accuracy": 0.813482403755188, "num_tokens": 889018377.0, "step": 27855 }, { "entropy": 0.5683414898812771, "epoch": 2.562894980477398, "grad_norm": 0.167542964220047, "learning_rate": 1.45735578250069e-05, "loss": 0.5497, "mean_token_accuracy": 0.8251914978027344, "num_tokens": 889049118.0, "step": 27856 }, { "entropy": 0.5318475123494864, "epoch": 2.5629869868488395, "grad_norm": 0.1650393009185791, "learning_rate": 1.4570490998865275e-05, "loss": 0.5305, "mean_token_accuracy": 0.8300949558615685, "num_tokens": 889080364.0, "step": 27857 }, { "entropy": 0.44798939966131, "epoch": 2.5630789932202807, "grad_norm": 0.1469188779592514, "learning_rate": 1.4567424172723648e-05, "loss": 0.431, "mean_token_accuracy": 0.8624731115996838, "num_tokens": 889112083.0, "step": 27858 }, { "entropy": 0.4814284862950444, "epoch": 2.563170999591722, "grad_norm": 0.16060402989387512, "learning_rate": 1.4564357346582023e-05, "loss": 0.4853, "mean_token_accuracy": 0.8498095236718655, "num_tokens": 889143623.0, "step": 27859 }, { "entropy": 0.4664325970225036, "epoch": 2.563263005963163, "grad_norm": 0.14877617359161377, "learning_rate": 1.4561290520440395e-05, "loss": 0.4484, "mean_token_accuracy": 0.8603771589696407, "num_tokens": 889174857.0, "step": 27860 }, { "entropy": 0.5134729743003845, "epoch": 2.563355012334604, "grad_norm": 0.15820728242397308, "learning_rate": 1.455822369429877e-05, "loss": 0.49, "mean_token_accuracy": 0.8420812487602234, "num_tokens": 889206575.0, "step": 27861 }, { "entropy": 0.6237915866076946, "epoch": 2.5634470187060456, "grad_norm": 0.1696142554283142, "learning_rate": 1.4555156868157143e-05, "loss": 0.6247, "mean_token_accuracy": 0.8067450858652592, "num_tokens": 889237957.0, "step": 27862 }, { "entropy": 0.4692017314955592, "epoch": 2.5635390250774868, "grad_norm": 0.16030259430408478, "learning_rate": 1.4552090042015518e-05, "loss": 0.4476, "mean_token_accuracy": 0.8550448529422283, "num_tokens": 889269683.0, "step": 27863 }, { "entropy": 0.4753136490471661, "epoch": 2.563631031448928, "grad_norm": 0.15714691579341888, "learning_rate": 1.454902321587389e-05, "loss": 0.4737, "mean_token_accuracy": 0.8508700132369995, "num_tokens": 889302249.0, "step": 27864 }, { "entropy": 0.5452870037406683, "epoch": 2.563723037820369, "grad_norm": 0.16334322094917297, "learning_rate": 1.4545956389732269e-05, "loss": 0.5259, "mean_token_accuracy": 0.8343821465969086, "num_tokens": 889334052.0, "step": 27865 }, { "entropy": 0.5938349515199661, "epoch": 2.56381504419181, "grad_norm": 0.17447532713413239, "learning_rate": 1.4542889563590642e-05, "loss": 0.5785, "mean_token_accuracy": 0.8184165209531784, "num_tokens": 889364974.0, "step": 27866 }, { "entropy": 0.5730845178477466, "epoch": 2.5639070505632517, "grad_norm": 0.16482044756412506, "learning_rate": 1.4539822737449016e-05, "loss": 0.5529, "mean_token_accuracy": 0.8261397331953049, "num_tokens": 889397185.0, "step": 27867 }, { "entropy": 0.6023056246340275, "epoch": 2.563999056934693, "grad_norm": 0.17303699254989624, "learning_rate": 1.453675591130739e-05, "loss": 0.593, "mean_token_accuracy": 0.8110248073935509, "num_tokens": 889428826.0, "step": 27868 }, { "entropy": 0.5335569866001606, "epoch": 2.564091063306134, "grad_norm": 0.16373461484909058, "learning_rate": 1.4533689085165764e-05, "loss": 0.5275, "mean_token_accuracy": 0.8352944888174534, "num_tokens": 889460913.0, "step": 27869 }, { "entropy": 0.4197855624370277, "epoch": 2.564183069677575, "grad_norm": 0.1521814614534378, "learning_rate": 1.4530622259024137e-05, "loss": 0.411, "mean_token_accuracy": 0.8684376999735832, "num_tokens": 889492716.0, "step": 27870 }, { "entropy": 0.533538306131959, "epoch": 2.5642750760490163, "grad_norm": 0.16324461996555328, "learning_rate": 1.4527555432882511e-05, "loss": 0.5281, "mean_token_accuracy": 0.8314023651182652, "num_tokens": 889524954.0, "step": 27871 }, { "entropy": 0.6063045430928469, "epoch": 2.564367082420458, "grad_norm": 0.17043331265449524, "learning_rate": 1.4524488606740884e-05, "loss": 0.5989, "mean_token_accuracy": 0.8107070252299309, "num_tokens": 889556751.0, "step": 27872 }, { "entropy": 0.46632667747326195, "epoch": 2.564459088791899, "grad_norm": 0.1534368246793747, "learning_rate": 1.4521421780599259e-05, "loss": 0.4489, "mean_token_accuracy": 0.856281004846096, "num_tokens": 889588891.0, "step": 27873 }, { "entropy": 0.5348928431048989, "epoch": 2.56455109516334, "grad_norm": 0.16574068367481232, "learning_rate": 1.4518354954457634e-05, "loss": 0.5373, "mean_token_accuracy": 0.8301669284701347, "num_tokens": 889620836.0, "step": 27874 }, { "entropy": 0.5206764228641987, "epoch": 2.5646431015347813, "grad_norm": 0.16734468936920166, "learning_rate": 1.4515288128316007e-05, "loss": 0.5199, "mean_token_accuracy": 0.8417988941073418, "num_tokens": 889652457.0, "step": 27875 }, { "entropy": 0.5094137957785279, "epoch": 2.5647351079062224, "grad_norm": 0.16394419968128204, "learning_rate": 1.4512221302174381e-05, "loss": 0.5015, "mean_token_accuracy": 0.8410102427005768, "num_tokens": 889684621.0, "step": 27876 }, { "entropy": 0.6297375410795212, "epoch": 2.564827114277664, "grad_norm": 0.17136503756046295, "learning_rate": 1.4509154476032754e-05, "loss": 0.6167, "mean_token_accuracy": 0.8095829598605633, "num_tokens": 889716718.0, "step": 27877 }, { "entropy": 0.5473395772278309, "epoch": 2.564919120649105, "grad_norm": 0.16379334032535553, "learning_rate": 1.4506087649891129e-05, "loss": 0.5355, "mean_token_accuracy": 0.8299798220396042, "num_tokens": 889749056.0, "step": 27878 }, { "entropy": 0.4561429196037352, "epoch": 2.5650111270205462, "grad_norm": 0.15654133260250092, "learning_rate": 1.4503020823749502e-05, "loss": 0.4389, "mean_token_accuracy": 0.8588622882962227, "num_tokens": 889781027.0, "step": 27879 }, { "entropy": 0.5182159543037415, "epoch": 2.5651031333919874, "grad_norm": 0.15516060590744019, "learning_rate": 1.4499953997607877e-05, "loss": 0.4997, "mean_token_accuracy": 0.8424523696303368, "num_tokens": 889813795.0, "step": 27880 }, { "entropy": 0.49399156332947314, "epoch": 2.5651951397634285, "grad_norm": 0.15769687294960022, "learning_rate": 1.449688717146625e-05, "loss": 0.4847, "mean_token_accuracy": 0.844147015362978, "num_tokens": 889845399.0, "step": 27881 }, { "entropy": 0.44974307995289564, "epoch": 2.56528714613487, "grad_norm": 0.1489635854959488, "learning_rate": 1.4493820345324624e-05, "loss": 0.4379, "mean_token_accuracy": 0.8596273586153984, "num_tokens": 889878122.0, "step": 27882 }, { "entropy": 0.46560955699533224, "epoch": 2.565379152506311, "grad_norm": 0.15070955455303192, "learning_rate": 1.4490753519182997e-05, "loss": 0.4658, "mean_token_accuracy": 0.8542206771671772, "num_tokens": 889910209.0, "step": 27883 }, { "entropy": 0.49511122051626444, "epoch": 2.5654711588777523, "grad_norm": 0.16124238073825836, "learning_rate": 1.4487686693041372e-05, "loss": 0.4775, "mean_token_accuracy": 0.8507728055119514, "num_tokens": 889941661.0, "step": 27884 }, { "entropy": 0.5767561495304108, "epoch": 2.5655631652491935, "grad_norm": 0.16619133949279785, "learning_rate": 1.4484619866899746e-05, "loss": 0.572, "mean_token_accuracy": 0.8232764266431332, "num_tokens": 889973419.0, "step": 27885 }, { "entropy": 0.532209494151175, "epoch": 2.5656551716206346, "grad_norm": 0.15903155505657196, "learning_rate": 1.448155304075812e-05, "loss": 0.5133, "mean_token_accuracy": 0.8364720046520233, "num_tokens": 890005246.0, "step": 27886 }, { "entropy": 0.5512922070920467, "epoch": 2.565747177992076, "grad_norm": 0.1695273071527481, "learning_rate": 1.4478486214616494e-05, "loss": 0.5403, "mean_token_accuracy": 0.8300509266555309, "num_tokens": 890037247.0, "step": 27887 }, { "entropy": 0.5209516631439328, "epoch": 2.5658391843635173, "grad_norm": 0.16033266484737396, "learning_rate": 1.4475419388474867e-05, "loss": 0.5026, "mean_token_accuracy": 0.8375773504376411, "num_tokens": 890068920.0, "step": 27888 }, { "entropy": 0.5310101704671979, "epoch": 2.5659311907349585, "grad_norm": 0.1596701294183731, "learning_rate": 1.4472352562333242e-05, "loss": 0.5084, "mean_token_accuracy": 0.8396229967474937, "num_tokens": 890100649.0, "step": 27889 }, { "entropy": 0.5616439003497362, "epoch": 2.5660231971063996, "grad_norm": 0.1641140878200531, "learning_rate": 1.4469285736191615e-05, "loss": 0.5504, "mean_token_accuracy": 0.8252043500542641, "num_tokens": 890133179.0, "step": 27890 }, { "entropy": 0.6011888366192579, "epoch": 2.5661152034778407, "grad_norm": 0.17165352404117584, "learning_rate": 1.446621891004999e-05, "loss": 0.5831, "mean_token_accuracy": 0.816658403724432, "num_tokens": 890165223.0, "step": 27891 }, { "entropy": 0.5172638213261962, "epoch": 2.5662072098492823, "grad_norm": 0.1586354374885559, "learning_rate": 1.4463152083908362e-05, "loss": 0.4912, "mean_token_accuracy": 0.8406181558966637, "num_tokens": 890196297.0, "step": 27892 }, { "entropy": 0.5345943979918957, "epoch": 2.5662992162207234, "grad_norm": 0.16026243567466736, "learning_rate": 1.4460085257766737e-05, "loss": 0.5214, "mean_token_accuracy": 0.833476360887289, "num_tokens": 890227801.0, "step": 27893 }, { "entropy": 0.521923704771325, "epoch": 2.5663912225921646, "grad_norm": 0.16030490398406982, "learning_rate": 1.445701843162511e-05, "loss": 0.5025, "mean_token_accuracy": 0.8403667584061623, "num_tokens": 890259558.0, "step": 27894 }, { "entropy": 0.504649979993701, "epoch": 2.5664832289636057, "grad_norm": 0.15870200097560883, "learning_rate": 1.4453951605483484e-05, "loss": 0.4888, "mean_token_accuracy": 0.8442210890352726, "num_tokens": 890291310.0, "step": 27895 }, { "entropy": 0.49154115468263626, "epoch": 2.566575235335047, "grad_norm": 0.15989382565021515, "learning_rate": 1.445088477934186e-05, "loss": 0.4858, "mean_token_accuracy": 0.8469670601189137, "num_tokens": 890322711.0, "step": 27896 }, { "entropy": 0.4657503969501704, "epoch": 2.5666672417064884, "grad_norm": 0.16215190291404724, "learning_rate": 1.4447817953200235e-05, "loss": 0.4631, "mean_token_accuracy": 0.8538453616201878, "num_tokens": 890354992.0, "step": 27897 }, { "entropy": 0.5114262253046036, "epoch": 2.5667592480779295, "grad_norm": 0.1566595733165741, "learning_rate": 1.4444751127058608e-05, "loss": 0.5091, "mean_token_accuracy": 0.839518591761589, "num_tokens": 890387141.0, "step": 27898 }, { "entropy": 0.5422809245064855, "epoch": 2.5668512544493707, "grad_norm": 0.17023839056491852, "learning_rate": 1.4441684300916983e-05, "loss": 0.5383, "mean_token_accuracy": 0.829098779708147, "num_tokens": 890418791.0, "step": 27899 }, { "entropy": 0.5237382017076015, "epoch": 2.566943260820812, "grad_norm": 0.1589289903640747, "learning_rate": 1.4438617474775356e-05, "loss": 0.5177, "mean_token_accuracy": 0.8309347294270992, "num_tokens": 890451173.0, "step": 27900 }, { "entropy": 0.47765825781971216, "epoch": 2.567035267192253, "grad_norm": 0.15448039770126343, "learning_rate": 1.443555064863373e-05, "loss": 0.4677, "mean_token_accuracy": 0.851276807487011, "num_tokens": 890483055.0, "step": 27901 }, { "entropy": 0.5215599630028009, "epoch": 2.5671272735636945, "grad_norm": 0.16228656470775604, "learning_rate": 1.4432483822492105e-05, "loss": 0.5118, "mean_token_accuracy": 0.842516828328371, "num_tokens": 890515329.0, "step": 27902 }, { "entropy": 0.4064003434032202, "epoch": 2.5672192799351357, "grad_norm": 0.1492644101381302, "learning_rate": 1.4429416996350478e-05, "loss": 0.3927, "mean_token_accuracy": 0.874494556337595, "num_tokens": 890546705.0, "step": 27903 }, { "entropy": 0.5215918309986591, "epoch": 2.567311286306577, "grad_norm": 0.1602553278207779, "learning_rate": 1.4426350170208853e-05, "loss": 0.5108, "mean_token_accuracy": 0.8388034850358963, "num_tokens": 890578193.0, "step": 27904 }, { "entropy": 0.4414088404737413, "epoch": 2.567403292678018, "grad_norm": 0.14945168793201447, "learning_rate": 1.4423283344067226e-05, "loss": 0.4289, "mean_token_accuracy": 0.8634303770959377, "num_tokens": 890610522.0, "step": 27905 }, { "entropy": 0.4641931760124862, "epoch": 2.567495299049459, "grad_norm": 0.15173378586769104, "learning_rate": 1.44202165179256e-05, "loss": 0.4564, "mean_token_accuracy": 0.8575015477836132, "num_tokens": 890642724.0, "step": 27906 }, { "entropy": 0.5507060494273901, "epoch": 2.5675873054209006, "grad_norm": 0.16607901453971863, "learning_rate": 1.4417149691783973e-05, "loss": 0.5359, "mean_token_accuracy": 0.8318368121981621, "num_tokens": 890674035.0, "step": 27907 }, { "entropy": 0.6044289562851191, "epoch": 2.5676793117923418, "grad_norm": 0.17256629467010498, "learning_rate": 1.4414082865642348e-05, "loss": 0.5948, "mean_token_accuracy": 0.8129830248653889, "num_tokens": 890706376.0, "step": 27908 }, { "entropy": 0.5428751036524773, "epoch": 2.567771318163783, "grad_norm": 0.15897738933563232, "learning_rate": 1.4411016039500721e-05, "loss": 0.5227, "mean_token_accuracy": 0.8328123651444912, "num_tokens": 890738025.0, "step": 27909 }, { "entropy": 0.5205864548915997, "epoch": 2.567863324535224, "grad_norm": 0.15454499423503876, "learning_rate": 1.4407949213359096e-05, "loss": 0.5078, "mean_token_accuracy": 0.8403965197503567, "num_tokens": 890770192.0, "step": 27910 }, { "entropy": 0.4612108822911978, "epoch": 2.567955330906665, "grad_norm": 0.1529073417186737, "learning_rate": 1.4404882387217469e-05, "loss": 0.4397, "mean_token_accuracy": 0.8587606847286224, "num_tokens": 890801672.0, "step": 27911 }, { "entropy": 0.5042638145387173, "epoch": 2.5680473372781067, "grad_norm": 0.15878555178642273, "learning_rate": 1.4401815561075843e-05, "loss": 0.4953, "mean_token_accuracy": 0.8441482894122601, "num_tokens": 890833118.0, "step": 27912 }, { "entropy": 0.540640595369041, "epoch": 2.568139343649548, "grad_norm": 0.1652693748474121, "learning_rate": 1.4398748734934218e-05, "loss": 0.5215, "mean_token_accuracy": 0.8314888216555119, "num_tokens": 890865062.0, "step": 27913 }, { "entropy": 0.5210956952068955, "epoch": 2.568231350020989, "grad_norm": 0.1580081731081009, "learning_rate": 1.4395681908792591e-05, "loss": 0.5054, "mean_token_accuracy": 0.8407536931335926, "num_tokens": 890897001.0, "step": 27914 }, { "entropy": 0.5674803256988525, "epoch": 2.56832335639243, "grad_norm": 0.1709328144788742, "learning_rate": 1.4392615082650965e-05, "loss": 0.5693, "mean_token_accuracy": 0.8193533942103386, "num_tokens": 890929296.0, "step": 27915 }, { "entropy": 0.506020219065249, "epoch": 2.5684153627638713, "grad_norm": 0.1615322381258011, "learning_rate": 1.4389548256509338e-05, "loss": 0.5009, "mean_token_accuracy": 0.8420915938913822, "num_tokens": 890961530.0, "step": 27916 }, { "entropy": 0.4512096121907234, "epoch": 2.568507369135313, "grad_norm": 0.15390193462371826, "learning_rate": 1.4386481430367713e-05, "loss": 0.4431, "mean_token_accuracy": 0.8565356358885765, "num_tokens": 890993393.0, "step": 27917 }, { "entropy": 0.5454994011670351, "epoch": 2.568599375506754, "grad_norm": 0.16397245228290558, "learning_rate": 1.4383414604226086e-05, "loss": 0.5331, "mean_token_accuracy": 0.8291516676545143, "num_tokens": 891025557.0, "step": 27918 }, { "entropy": 0.48944673500955105, "epoch": 2.568691381878195, "grad_norm": 0.1569342315196991, "learning_rate": 1.438034777808446e-05, "loss": 0.4734, "mean_token_accuracy": 0.8537531718611717, "num_tokens": 891056936.0, "step": 27919 }, { "entropy": 0.541633314685896, "epoch": 2.5687833882496363, "grad_norm": 0.16377580165863037, "learning_rate": 1.4377280951942834e-05, "loss": 0.5271, "mean_token_accuracy": 0.8346587121486664, "num_tokens": 891088123.0, "step": 27920 }, { "entropy": 0.48458522465080023, "epoch": 2.5688753946210774, "grad_norm": 0.1546747386455536, "learning_rate": 1.4374214125801208e-05, "loss": 0.4727, "mean_token_accuracy": 0.8488334827125072, "num_tokens": 891119665.0, "step": 27921 }, { "entropy": 0.601488090120256, "epoch": 2.568967400992519, "grad_norm": 0.17582696676254272, "learning_rate": 1.4371147299659581e-05, "loss": 0.6183, "mean_token_accuracy": 0.8100145496428013, "num_tokens": 891151787.0, "step": 27922 }, { "entropy": 0.582222499884665, "epoch": 2.56905940736396, "grad_norm": 0.16696660220623016, "learning_rate": 1.4368080473517956e-05, "loss": 0.5745, "mean_token_accuracy": 0.8200456015765667, "num_tokens": 891183528.0, "step": 27923 }, { "entropy": 0.4184448285959661, "epoch": 2.5691514137354012, "grad_norm": 0.15064118802547455, "learning_rate": 1.436501364737633e-05, "loss": 0.4138, "mean_token_accuracy": 0.8663708083331585, "num_tokens": 891214402.0, "step": 27924 }, { "entropy": 0.4309857194311917, "epoch": 2.5692434201068424, "grad_norm": 0.1533035784959793, "learning_rate": 1.4361946821234704e-05, "loss": 0.4223, "mean_token_accuracy": 0.8674250245094299, "num_tokens": 891245961.0, "step": 27925 }, { "entropy": 0.6238070651888847, "epoch": 2.5693354264782835, "grad_norm": 0.17144104838371277, "learning_rate": 1.435887999509308e-05, "loss": 0.6124, "mean_token_accuracy": 0.8099132440984249, "num_tokens": 891277943.0, "step": 27926 }, { "entropy": 0.5005157166160643, "epoch": 2.569427432849725, "grad_norm": 0.1505272537469864, "learning_rate": 1.4355813168951454e-05, "loss": 0.4786, "mean_token_accuracy": 0.8468839600682259, "num_tokens": 891309748.0, "step": 27927 }, { "entropy": 0.47201241995207965, "epoch": 2.569519439221166, "grad_norm": 0.1567259579896927, "learning_rate": 1.4352746342809827e-05, "loss": 0.4571, "mean_token_accuracy": 0.8554319441318512, "num_tokens": 891341456.0, "step": 27928 }, { "entropy": 0.49358425475656986, "epoch": 2.5696114455926073, "grad_norm": 0.15991173684597015, "learning_rate": 1.4349679516668202e-05, "loss": 0.4868, "mean_token_accuracy": 0.8440550602972507, "num_tokens": 891372425.0, "step": 27929 }, { "entropy": 0.45905011892318726, "epoch": 2.5697034519640485, "grad_norm": 0.15137462317943573, "learning_rate": 1.4346612690526575e-05, "loss": 0.4459, "mean_token_accuracy": 0.8572192899882793, "num_tokens": 891404973.0, "step": 27930 }, { "entropy": 0.46790698275435716, "epoch": 2.5697954583354896, "grad_norm": 0.1551733762025833, "learning_rate": 1.434354586438495e-05, "loss": 0.4586, "mean_token_accuracy": 0.8525911755859852, "num_tokens": 891436655.0, "step": 27931 }, { "entropy": 0.4668181296437979, "epoch": 2.569887464706931, "grad_norm": 0.15075097978115082, "learning_rate": 1.4340479038243324e-05, "loss": 0.4544, "mean_token_accuracy": 0.8565689884126186, "num_tokens": 891468617.0, "step": 27932 }, { "entropy": 0.4341719662770629, "epoch": 2.5699794710783723, "grad_norm": 0.15051254630088806, "learning_rate": 1.4337412212101697e-05, "loss": 0.4233, "mean_token_accuracy": 0.86410191655159, "num_tokens": 891500101.0, "step": 27933 }, { "entropy": 0.5104367267340422, "epoch": 2.5700714774498135, "grad_norm": 0.16301214694976807, "learning_rate": 1.4334345385960072e-05, "loss": 0.4979, "mean_token_accuracy": 0.8400785177946091, "num_tokens": 891531907.0, "step": 27934 }, { "entropy": 0.5294713648036122, "epoch": 2.5701634838212546, "grad_norm": 0.1629306972026825, "learning_rate": 1.4331278559818445e-05, "loss": 0.5182, "mean_token_accuracy": 0.8357228711247444, "num_tokens": 891563213.0, "step": 27935 }, { "entropy": 0.6247416734695435, "epoch": 2.5702554901926957, "grad_norm": 0.1726834923028946, "learning_rate": 1.432821173367682e-05, "loss": 0.6172, "mean_token_accuracy": 0.8084314316511154, "num_tokens": 891594480.0, "step": 27936 }, { "entropy": 0.5382180279120803, "epoch": 2.5703474965641373, "grad_norm": 0.16155965626239777, "learning_rate": 1.4325144907535192e-05, "loss": 0.5224, "mean_token_accuracy": 0.8326293230056763, "num_tokens": 891626359.0, "step": 27937 }, { "entropy": 0.4651665575802326, "epoch": 2.5704395029355784, "grad_norm": 0.1553574502468109, "learning_rate": 1.4322078081393567e-05, "loss": 0.451, "mean_token_accuracy": 0.8573754988610744, "num_tokens": 891658274.0, "step": 27938 }, { "entropy": 0.3787343465955928, "epoch": 2.5705315093070196, "grad_norm": 0.13580022752285004, "learning_rate": 1.431901125525194e-05, "loss": 0.3732, "mean_token_accuracy": 0.8803141005337238, "num_tokens": 891690995.0, "step": 27939 }, { "entropy": 0.5816492736339569, "epoch": 2.5706235156784607, "grad_norm": 0.16726025938987732, "learning_rate": 1.4315944429110315e-05, "loss": 0.5637, "mean_token_accuracy": 0.8252270594239235, "num_tokens": 891722710.0, "step": 27940 }, { "entropy": 0.537945793941617, "epoch": 2.570715522049902, "grad_norm": 0.16247297823429108, "learning_rate": 1.4312877602968688e-05, "loss": 0.524, "mean_token_accuracy": 0.8325440213084221, "num_tokens": 891754670.0, "step": 27941 }, { "entropy": 0.5387726090848446, "epoch": 2.5708075284213434, "grad_norm": 0.16100311279296875, "learning_rate": 1.4309810776827062e-05, "loss": 0.5187, "mean_token_accuracy": 0.8372866921126842, "num_tokens": 891786711.0, "step": 27942 }, { "entropy": 0.5143225025385618, "epoch": 2.5708995347927845, "grad_norm": 0.15586625039577484, "learning_rate": 1.4306743950685437e-05, "loss": 0.5038, "mean_token_accuracy": 0.8410951383411884, "num_tokens": 891819250.0, "step": 27943 }, { "entropy": 0.5333003047853708, "epoch": 2.5709915411642257, "grad_norm": 0.16351240873336792, "learning_rate": 1.430367712454381e-05, "loss": 0.508, "mean_token_accuracy": 0.8379179984331131, "num_tokens": 891850122.0, "step": 27944 }, { "entropy": 0.6330971722491086, "epoch": 2.571083547535667, "grad_norm": 0.17854207754135132, "learning_rate": 1.4300610298402185e-05, "loss": 0.6235, "mean_token_accuracy": 0.8047675788402557, "num_tokens": 891881832.0, "step": 27945 }, { "entropy": 0.5742170177400112, "epoch": 2.571175553907108, "grad_norm": 0.17309479415416718, "learning_rate": 1.4297543472260558e-05, "loss": 0.5836, "mean_token_accuracy": 0.8182850927114487, "num_tokens": 891913552.0, "step": 27946 }, { "entropy": 0.6018597669899464, "epoch": 2.5712675602785495, "grad_norm": 0.16819734871387482, "learning_rate": 1.4294476646118932e-05, "loss": 0.597, "mean_token_accuracy": 0.8130269832909107, "num_tokens": 891945902.0, "step": 27947 }, { "entropy": 0.5878912128973752, "epoch": 2.5713595666499907, "grad_norm": 0.16594251990318298, "learning_rate": 1.4291409819977305e-05, "loss": 0.5764, "mean_token_accuracy": 0.8172858133912086, "num_tokens": 891978295.0, "step": 27948 }, { "entropy": 0.4467625254765153, "epoch": 2.571451573021432, "grad_norm": 0.15175814926624298, "learning_rate": 1.428834299383568e-05, "loss": 0.4387, "mean_token_accuracy": 0.8598435185849667, "num_tokens": 892010907.0, "step": 27949 }, { "entropy": 0.5819784719496965, "epoch": 2.571543579392873, "grad_norm": 0.1679498702287674, "learning_rate": 1.4285276167694053e-05, "loss": 0.5642, "mean_token_accuracy": 0.8216334991157055, "num_tokens": 892041866.0, "step": 27950 }, { "entropy": 0.48603968881070614, "epoch": 2.571635585764314, "grad_norm": 0.1575077921152115, "learning_rate": 1.4282209341552427e-05, "loss": 0.4762, "mean_token_accuracy": 0.8486887067556381, "num_tokens": 892074026.0, "step": 27951 }, { "entropy": 0.4267250762786716, "epoch": 2.5717275921357556, "grad_norm": 0.14348386228084564, "learning_rate": 1.42791425154108e-05, "loss": 0.4074, "mean_token_accuracy": 0.8695660009980202, "num_tokens": 892105667.0, "step": 27952 }, { "entropy": 0.5797330029308796, "epoch": 2.5718195985071968, "grad_norm": 0.17026041448116302, "learning_rate": 1.4276075689269175e-05, "loss": 0.5765, "mean_token_accuracy": 0.8201380595564842, "num_tokens": 892136430.0, "step": 27953 }, { "entropy": 0.44579151505604386, "epoch": 2.571911604878638, "grad_norm": 0.14512144029140472, "learning_rate": 1.427300886312755e-05, "loss": 0.4233, "mean_token_accuracy": 0.8665755614638329, "num_tokens": 892168413.0, "step": 27954 }, { "entropy": 0.4508739758748561, "epoch": 2.572003611250079, "grad_norm": 0.1470937579870224, "learning_rate": 1.4269942036985923e-05, "loss": 0.4423, "mean_token_accuracy": 0.8604704774916172, "num_tokens": 892200830.0, "step": 27955 }, { "entropy": 0.5190306855365634, "epoch": 2.57209561762152, "grad_norm": 0.15772563219070435, "learning_rate": 1.4266875210844297e-05, "loss": 0.5, "mean_token_accuracy": 0.8398125693202019, "num_tokens": 892233060.0, "step": 27956 }, { "entropy": 0.5204372890293598, "epoch": 2.5721876239929617, "grad_norm": 0.16527044773101807, "learning_rate": 1.4263808384702674e-05, "loss": 0.4996, "mean_token_accuracy": 0.8387764133512974, "num_tokens": 892263580.0, "step": 27957 }, { "entropy": 0.5502995015121996, "epoch": 2.572279630364403, "grad_norm": 0.16883869469165802, "learning_rate": 1.4260741558561047e-05, "loss": 0.5366, "mean_token_accuracy": 0.8335638605058193, "num_tokens": 892294064.0, "step": 27958 }, { "entropy": 0.5449499050155282, "epoch": 2.572371636735844, "grad_norm": 0.16496989130973816, "learning_rate": 1.4257674732419421e-05, "loss": 0.5423, "mean_token_accuracy": 0.8264891691505909, "num_tokens": 892325748.0, "step": 27959 }, { "entropy": 0.585951704531908, "epoch": 2.572463643107285, "grad_norm": 0.16865162551403046, "learning_rate": 1.4254607906277794e-05, "loss": 0.5718, "mean_token_accuracy": 0.8210691027343273, "num_tokens": 892358460.0, "step": 27960 }, { "entropy": 0.5394858997315168, "epoch": 2.5725556494787263, "grad_norm": 0.16654163599014282, "learning_rate": 1.4251541080136169e-05, "loss": 0.5309, "mean_token_accuracy": 0.833041999489069, "num_tokens": 892390292.0, "step": 27961 }, { "entropy": 0.5797751042991877, "epoch": 2.572647655850168, "grad_norm": 0.16374480724334717, "learning_rate": 1.4248474253994543e-05, "loss": 0.5641, "mean_token_accuracy": 0.8234448656439781, "num_tokens": 892421399.0, "step": 27962 }, { "entropy": 0.4477890655398369, "epoch": 2.572739662221609, "grad_norm": 0.15384066104888916, "learning_rate": 1.4245407427852916e-05, "loss": 0.44, "mean_token_accuracy": 0.8585681170225143, "num_tokens": 892453504.0, "step": 27963 }, { "entropy": 0.566740179201588, "epoch": 2.57283166859305, "grad_norm": 0.16396564245224, "learning_rate": 1.4242340601711291e-05, "loss": 0.5531, "mean_token_accuracy": 0.8260596171021461, "num_tokens": 892485457.0, "step": 27964 }, { "entropy": 0.5266492031514645, "epoch": 2.5729236749644913, "grad_norm": 0.15938343107700348, "learning_rate": 1.4239273775569664e-05, "loss": 0.5132, "mean_token_accuracy": 0.8355799652636051, "num_tokens": 892517235.0, "step": 27965 }, { "entropy": 0.47260626405477524, "epoch": 2.5730156813359324, "grad_norm": 0.14840881526470184, "learning_rate": 1.4236206949428039e-05, "loss": 0.4671, "mean_token_accuracy": 0.8506514020264149, "num_tokens": 892549934.0, "step": 27966 }, { "entropy": 0.5682886471040547, "epoch": 2.573107687707374, "grad_norm": 0.17377158999443054, "learning_rate": 1.4233140123286412e-05, "loss": 0.576, "mean_token_accuracy": 0.8214317932724953, "num_tokens": 892581091.0, "step": 27967 }, { "entropy": 0.6179476827383041, "epoch": 2.573199694078815, "grad_norm": 0.17039507627487183, "learning_rate": 1.4230073297144786e-05, "loss": 0.6064, "mean_token_accuracy": 0.8122630566358566, "num_tokens": 892613241.0, "step": 27968 }, { "entropy": 0.5347497602924705, "epoch": 2.5732917004502562, "grad_norm": 0.15969495475292206, "learning_rate": 1.422700647100316e-05, "loss": 0.5147, "mean_token_accuracy": 0.8367887176573277, "num_tokens": 892645195.0, "step": 27969 }, { "entropy": 0.572668831795454, "epoch": 2.5733837068216974, "grad_norm": 0.16911834478378296, "learning_rate": 1.4223939644861534e-05, "loss": 0.5692, "mean_token_accuracy": 0.8216797187924385, "num_tokens": 892676485.0, "step": 27970 }, { "entropy": 0.47128820046782494, "epoch": 2.5734757131931385, "grad_norm": 0.15517233312129974, "learning_rate": 1.4220872818719907e-05, "loss": 0.4579, "mean_token_accuracy": 0.8525437265634537, "num_tokens": 892708663.0, "step": 27971 }, { "entropy": 0.5485154001507908, "epoch": 2.57356771956458, "grad_norm": 0.1662643998861313, "learning_rate": 1.4217805992578281e-05, "loss": 0.54, "mean_token_accuracy": 0.8284154906868935, "num_tokens": 892740576.0, "step": 27972 }, { "entropy": 0.4673970816656947, "epoch": 2.573659725936021, "grad_norm": 0.15898621082305908, "learning_rate": 1.4214739166436656e-05, "loss": 0.4524, "mean_token_accuracy": 0.8545256033539772, "num_tokens": 892772163.0, "step": 27973 }, { "entropy": 0.4881863612681627, "epoch": 2.5737517323074623, "grad_norm": 0.1552416831254959, "learning_rate": 1.4211672340295029e-05, "loss": 0.4839, "mean_token_accuracy": 0.8461059853434563, "num_tokens": 892804738.0, "step": 27974 }, { "entropy": 0.4985124636441469, "epoch": 2.5738437386789035, "grad_norm": 0.15757279098033905, "learning_rate": 1.4208605514153404e-05, "loss": 0.4839, "mean_token_accuracy": 0.8467116020619869, "num_tokens": 892836457.0, "step": 27975 }, { "entropy": 0.5355193605646491, "epoch": 2.5739357450503446, "grad_norm": 0.1630270779132843, "learning_rate": 1.4205538688011777e-05, "loss": 0.5259, "mean_token_accuracy": 0.8332093134522438, "num_tokens": 892868325.0, "step": 27976 }, { "entropy": 0.5753793502226472, "epoch": 2.574027751421786, "grad_norm": 0.16550315916538239, "learning_rate": 1.4202471861870151e-05, "loss": 0.5646, "mean_token_accuracy": 0.8195796050131321, "num_tokens": 892900910.0, "step": 27977 }, { "entropy": 0.48852985352277756, "epoch": 2.5741197577932273, "grad_norm": 0.1520439237356186, "learning_rate": 1.4199405035728524e-05, "loss": 0.4711, "mean_token_accuracy": 0.850315771996975, "num_tokens": 892932528.0, "step": 27978 }, { "entropy": 0.5241702296771109, "epoch": 2.5742117641646685, "grad_norm": 0.16382461786270142, "learning_rate": 1.4196338209586899e-05, "loss": 0.52, "mean_token_accuracy": 0.8350472934544086, "num_tokens": 892964242.0, "step": 27979 }, { "entropy": 0.6076832562685013, "epoch": 2.5743037705361096, "grad_norm": 0.1683720350265503, "learning_rate": 1.4193271383445272e-05, "loss": 0.6059, "mean_token_accuracy": 0.8105281740427017, "num_tokens": 892996445.0, "step": 27980 }, { "entropy": 0.3992165403906256, "epoch": 2.5743957769075507, "grad_norm": 0.1423865407705307, "learning_rate": 1.4190204557303646e-05, "loss": 0.3845, "mean_token_accuracy": 0.8742060773074627, "num_tokens": 893028470.0, "step": 27981 }, { "entropy": 0.5328290089964867, "epoch": 2.5744877832789923, "grad_norm": 0.16029511392116547, "learning_rate": 1.418713773116202e-05, "loss": 0.5187, "mean_token_accuracy": 0.8399805352091789, "num_tokens": 893060277.0, "step": 27982 }, { "entropy": 0.6083287103101611, "epoch": 2.5745797896504334, "grad_norm": 0.16923151910305023, "learning_rate": 1.4184070905020394e-05, "loss": 0.5962, "mean_token_accuracy": 0.8094798624515533, "num_tokens": 893092525.0, "step": 27983 }, { "entropy": 0.4960946086794138, "epoch": 2.5746717960218746, "grad_norm": 0.15495114028453827, "learning_rate": 1.4181004078878769e-05, "loss": 0.4832, "mean_token_accuracy": 0.8498216904699802, "num_tokens": 893123611.0, "step": 27984 }, { "entropy": 0.5684484029188752, "epoch": 2.5747638023933157, "grad_norm": 0.16752584278583527, "learning_rate": 1.4177937252737142e-05, "loss": 0.551, "mean_token_accuracy": 0.8275458067655563, "num_tokens": 893154823.0, "step": 27985 }, { "entropy": 0.5321900248527527, "epoch": 2.574855808764757, "grad_norm": 0.16383430361747742, "learning_rate": 1.4174870426595516e-05, "loss": 0.5099, "mean_token_accuracy": 0.837520994246006, "num_tokens": 893186491.0, "step": 27986 }, { "entropy": 0.5863673416897655, "epoch": 2.5749478151361984, "grad_norm": 0.16512398421764374, "learning_rate": 1.4171803600453893e-05, "loss": 0.5506, "mean_token_accuracy": 0.8236427269876003, "num_tokens": 893218147.0, "step": 27987 }, { "entropy": 0.49433601275086403, "epoch": 2.5750398215076395, "grad_norm": 0.15927410125732422, "learning_rate": 1.4168736774312266e-05, "loss": 0.4908, "mean_token_accuracy": 0.8426626473665237, "num_tokens": 893250040.0, "step": 27988 }, { "entropy": 0.6210692934691906, "epoch": 2.5751318278790807, "grad_norm": 0.17827650904655457, "learning_rate": 1.416566994817064e-05, "loss": 0.5967, "mean_token_accuracy": 0.8138885423541069, "num_tokens": 893280888.0, "step": 27989 }, { "entropy": 0.4726563999429345, "epoch": 2.575223834250522, "grad_norm": 0.15044964849948883, "learning_rate": 1.4162603122029013e-05, "loss": 0.4652, "mean_token_accuracy": 0.852663554251194, "num_tokens": 893313385.0, "step": 27990 }, { "entropy": 0.42193164909258485, "epoch": 2.575315840621963, "grad_norm": 0.14595040678977966, "learning_rate": 1.4159536295887388e-05, "loss": 0.409, "mean_token_accuracy": 0.8694382086396217, "num_tokens": 893345026.0, "step": 27991 }, { "entropy": 0.5711971721611917, "epoch": 2.5754078469934045, "grad_norm": 0.17088863253593445, "learning_rate": 1.4156469469745763e-05, "loss": 0.5668, "mean_token_accuracy": 0.823500283062458, "num_tokens": 893376745.0, "step": 27992 }, { "entropy": 0.5254887195769697, "epoch": 2.5754998533648457, "grad_norm": 0.15623155236244202, "learning_rate": 1.4153402643604135e-05, "loss": 0.5217, "mean_token_accuracy": 0.8368417955935001, "num_tokens": 893409465.0, "step": 27993 }, { "entropy": 0.5764715578407049, "epoch": 2.575591859736287, "grad_norm": 0.17355838418006897, "learning_rate": 1.415033581746251e-05, "loss": 0.5728, "mean_token_accuracy": 0.8203565627336502, "num_tokens": 893441075.0, "step": 27994 }, { "entropy": 0.4576921174302697, "epoch": 2.575683866107728, "grad_norm": 0.15359675884246826, "learning_rate": 1.4147268991320883e-05, "loss": 0.4466, "mean_token_accuracy": 0.8576577752828598, "num_tokens": 893473161.0, "step": 27995 }, { "entropy": 0.47995081346016377, "epoch": 2.575775872479169, "grad_norm": 0.1641051322221756, "learning_rate": 1.4144202165179258e-05, "loss": 0.4696, "mean_token_accuracy": 0.8505962565541267, "num_tokens": 893505242.0, "step": 27996 }, { "entropy": 0.5468443230492994, "epoch": 2.5758678788506106, "grad_norm": 0.15815015137195587, "learning_rate": 1.414113533903763e-05, "loss": 0.5381, "mean_token_accuracy": 0.8299625106155872, "num_tokens": 893537028.0, "step": 27997 }, { "entropy": 0.5327145135961473, "epoch": 2.5759598852220518, "grad_norm": 0.16608621180057526, "learning_rate": 1.4138068512896005e-05, "loss": 0.5326, "mean_token_accuracy": 0.8321197666227818, "num_tokens": 893568610.0, "step": 27998 }, { "entropy": 0.5097421179525554, "epoch": 2.576051891593493, "grad_norm": 0.1641908586025238, "learning_rate": 1.4135001686754378e-05, "loss": 0.5105, "mean_token_accuracy": 0.837648581713438, "num_tokens": 893600187.0, "step": 27999 }, { "entropy": 0.5280960937961936, "epoch": 2.576143897964934, "grad_norm": 0.16367585957050323, "learning_rate": 1.4131934860612753e-05, "loss": 0.5181, "mean_token_accuracy": 0.8380425907671452, "num_tokens": 893631731.0, "step": 28000 }, { "entropy": 0.46761382184922695, "epoch": 2.576235904336375, "grad_norm": 0.15425077080726624, "learning_rate": 1.4128868034471126e-05, "loss": 0.4582, "mean_token_accuracy": 0.8562113270163536, "num_tokens": 893664271.0, "step": 28001 }, { "entropy": 0.5099545361008495, "epoch": 2.5763279107078167, "grad_norm": 0.1539985090494156, "learning_rate": 1.41258012083295e-05, "loss": 0.4947, "mean_token_accuracy": 0.845317430794239, "num_tokens": 893696719.0, "step": 28002 }, { "entropy": 0.49378079548478127, "epoch": 2.576419917079258, "grad_norm": 0.15479028224945068, "learning_rate": 1.4122734382187875e-05, "loss": 0.4884, "mean_token_accuracy": 0.8424283042550087, "num_tokens": 893728966.0, "step": 28003 }, { "entropy": 0.4477776982821524, "epoch": 2.576511923450699, "grad_norm": 0.14910836517810822, "learning_rate": 1.4119667556046248e-05, "loss": 0.4335, "mean_token_accuracy": 0.8643188662827015, "num_tokens": 893761036.0, "step": 28004 }, { "entropy": 0.49823045264929533, "epoch": 2.57660392982214, "grad_norm": 0.15850380063056946, "learning_rate": 1.4116600729904623e-05, "loss": 0.4785, "mean_token_accuracy": 0.8467671163380146, "num_tokens": 893793086.0, "step": 28005 }, { "entropy": 0.5128929421771318, "epoch": 2.5766959361935813, "grad_norm": 0.15778645873069763, "learning_rate": 1.4113533903762996e-05, "loss": 0.4968, "mean_token_accuracy": 0.8429163172841072, "num_tokens": 893825191.0, "step": 28006 }, { "entropy": 0.5254715019837022, "epoch": 2.576787942565023, "grad_norm": 0.15423521399497986, "learning_rate": 1.411046707762137e-05, "loss": 0.5105, "mean_token_accuracy": 0.839458879083395, "num_tokens": 893857757.0, "step": 28007 }, { "entropy": 0.4875939078629017, "epoch": 2.576879948936464, "grad_norm": 0.1548987776041031, "learning_rate": 1.4107400251479743e-05, "loss": 0.4702, "mean_token_accuracy": 0.8485518917441368, "num_tokens": 893889610.0, "step": 28008 }, { "entropy": 0.5285850875079632, "epoch": 2.576971955307905, "grad_norm": 0.1592375934123993, "learning_rate": 1.4104333425338118e-05, "loss": 0.5179, "mean_token_accuracy": 0.8365970589220524, "num_tokens": 893921794.0, "step": 28009 }, { "entropy": 0.44693043315783143, "epoch": 2.5770639616793463, "grad_norm": 0.14636920392513275, "learning_rate": 1.4101266599196491e-05, "loss": 0.4222, "mean_token_accuracy": 0.863738413900137, "num_tokens": 893953875.0, "step": 28010 }, { "entropy": 0.6529879234731197, "epoch": 2.5771559680507874, "grad_norm": 0.1740485578775406, "learning_rate": 1.4098199773054866e-05, "loss": 0.6311, "mean_token_accuracy": 0.8008840940892696, "num_tokens": 893985531.0, "step": 28011 }, { "entropy": 0.49650157149881124, "epoch": 2.577247974422229, "grad_norm": 0.16046440601348877, "learning_rate": 1.4095132946913239e-05, "loss": 0.4853, "mean_token_accuracy": 0.8461982794106007, "num_tokens": 894017056.0, "step": 28012 }, { "entropy": 0.4409843790344894, "epoch": 2.57733998079367, "grad_norm": 0.14743086695671082, "learning_rate": 1.4092066120771613e-05, "loss": 0.4232, "mean_token_accuracy": 0.8634797409176826, "num_tokens": 894049449.0, "step": 28013 }, { "entropy": 0.5761608453467488, "epoch": 2.5774319871651112, "grad_norm": 0.17306651175022125, "learning_rate": 1.4088999294629988e-05, "loss": 0.5659, "mean_token_accuracy": 0.8190472535789013, "num_tokens": 894081319.0, "step": 28014 }, { "entropy": 0.4575481144711375, "epoch": 2.5775239935365524, "grad_norm": 0.15013161301612854, "learning_rate": 1.408593246848836e-05, "loss": 0.4522, "mean_token_accuracy": 0.8567826002836227, "num_tokens": 894113950.0, "step": 28015 }, { "entropy": 0.40556412760633975, "epoch": 2.5776159999079935, "grad_norm": 0.14475876092910767, "learning_rate": 1.4082865642346735e-05, "loss": 0.4006, "mean_token_accuracy": 0.8729747198522091, "num_tokens": 894146480.0, "step": 28016 }, { "entropy": 0.5303142722696066, "epoch": 2.577708006279435, "grad_norm": 0.15840694308280945, "learning_rate": 1.4079798816205108e-05, "loss": 0.5201, "mean_token_accuracy": 0.8344940394163132, "num_tokens": 894178947.0, "step": 28017 }, { "entropy": 0.548601046204567, "epoch": 2.577800012650876, "grad_norm": 0.15955029428005219, "learning_rate": 1.4076731990063485e-05, "loss": 0.5459, "mean_token_accuracy": 0.8294293992221355, "num_tokens": 894210736.0, "step": 28018 }, { "entropy": 0.567031092941761, "epoch": 2.5778920190223173, "grad_norm": 0.17104852199554443, "learning_rate": 1.407366516392186e-05, "loss": 0.5577, "mean_token_accuracy": 0.8228063471615314, "num_tokens": 894242489.0, "step": 28019 }, { "entropy": 0.46259811613708735, "epoch": 2.5779840253937585, "grad_norm": 0.1579248607158661, "learning_rate": 1.4070598337780232e-05, "loss": 0.4478, "mean_token_accuracy": 0.85654691234231, "num_tokens": 894273668.0, "step": 28020 }, { "entropy": 0.5618950752541423, "epoch": 2.5780760317651996, "grad_norm": 0.16269555687904358, "learning_rate": 1.4067531511638607e-05, "loss": 0.5478, "mean_token_accuracy": 0.8284578993916512, "num_tokens": 894305637.0, "step": 28021 }, { "entropy": 0.5584892840124667, "epoch": 2.578168038136641, "grad_norm": 0.1630474179983139, "learning_rate": 1.4064464685496982e-05, "loss": 0.5398, "mean_token_accuracy": 0.8286743722856045, "num_tokens": 894337661.0, "step": 28022 }, { "entropy": 0.5518420310690999, "epoch": 2.5782600445080823, "grad_norm": 0.16632410883903503, "learning_rate": 1.4061397859355355e-05, "loss": 0.5385, "mean_token_accuracy": 0.830918226391077, "num_tokens": 894370158.0, "step": 28023 }, { "entropy": 0.4765683338046074, "epoch": 2.5783520508795235, "grad_norm": 0.15273383259773254, "learning_rate": 1.405833103321373e-05, "loss": 0.459, "mean_token_accuracy": 0.8532802127301693, "num_tokens": 894402413.0, "step": 28024 }, { "entropy": 0.5149699486792088, "epoch": 2.5784440572509646, "grad_norm": 0.16384385526180267, "learning_rate": 1.4055264207072102e-05, "loss": 0.5089, "mean_token_accuracy": 0.8372618556022644, "num_tokens": 894434952.0, "step": 28025 }, { "entropy": 0.4480103952810168, "epoch": 2.5785360636224057, "grad_norm": 0.14666347205638885, "learning_rate": 1.4052197380930477e-05, "loss": 0.4333, "mean_token_accuracy": 0.8605801872909069, "num_tokens": 894467179.0, "step": 28026 }, { "entropy": 0.5688767426181585, "epoch": 2.5786280699938473, "grad_norm": 0.16006797552108765, "learning_rate": 1.404913055478885e-05, "loss": 0.5544, "mean_token_accuracy": 0.8252676874399185, "num_tokens": 894499538.0, "step": 28027 }, { "entropy": 0.5012903790920973, "epoch": 2.5787200763652884, "grad_norm": 0.15825559198856354, "learning_rate": 1.4046063728647224e-05, "loss": 0.4848, "mean_token_accuracy": 0.8452689796686172, "num_tokens": 894531119.0, "step": 28028 }, { "entropy": 0.45808917097747326, "epoch": 2.5788120827367296, "grad_norm": 0.15159830451011658, "learning_rate": 1.4042996902505597e-05, "loss": 0.454, "mean_token_accuracy": 0.8575312532484531, "num_tokens": 894563512.0, "step": 28029 }, { "entropy": 0.5253060106188059, "epoch": 2.5789040891081707, "grad_norm": 0.1662156581878662, "learning_rate": 1.4039930076363972e-05, "loss": 0.5256, "mean_token_accuracy": 0.8311821445822716, "num_tokens": 894595498.0, "step": 28030 }, { "entropy": 0.617335207760334, "epoch": 2.578996095479612, "grad_norm": 0.17269033193588257, "learning_rate": 1.4036863250222345e-05, "loss": 0.604, "mean_token_accuracy": 0.8085249923169613, "num_tokens": 894627428.0, "step": 28031 }, { "entropy": 0.5327573111280799, "epoch": 2.5790881018510534, "grad_norm": 0.162765234708786, "learning_rate": 1.403379642408072e-05, "loss": 0.5159, "mean_token_accuracy": 0.8333285488188267, "num_tokens": 894659192.0, "step": 28032 }, { "entropy": 0.4672937449067831, "epoch": 2.5791801082224945, "grad_norm": 0.15355198085308075, "learning_rate": 1.4030729597939094e-05, "loss": 0.455, "mean_token_accuracy": 0.8541759476065636, "num_tokens": 894691108.0, "step": 28033 }, { "entropy": 0.5125269778072834, "epoch": 2.5792721145939357, "grad_norm": 0.15701064467430115, "learning_rate": 1.4027662771797467e-05, "loss": 0.5058, "mean_token_accuracy": 0.8382247723639011, "num_tokens": 894723500.0, "step": 28034 }, { "entropy": 0.530600979924202, "epoch": 2.579364120965377, "grad_norm": 0.1569787710905075, "learning_rate": 1.4024595945655842e-05, "loss": 0.5163, "mean_token_accuracy": 0.8370745964348316, "num_tokens": 894755953.0, "step": 28035 }, { "entropy": 0.5259737521409988, "epoch": 2.579456127336818, "grad_norm": 0.16097977757453918, "learning_rate": 1.4021529119514215e-05, "loss": 0.5183, "mean_token_accuracy": 0.835309911519289, "num_tokens": 894788210.0, "step": 28036 }, { "entropy": 0.5013599419035017, "epoch": 2.5795481337082595, "grad_norm": 0.15994258224964142, "learning_rate": 1.401846229337259e-05, "loss": 0.4822, "mean_token_accuracy": 0.8475572392344475, "num_tokens": 894820192.0, "step": 28037 }, { "entropy": 0.5411869417876005, "epoch": 2.5796401400797007, "grad_norm": 0.16388799250125885, "learning_rate": 1.4015395467230962e-05, "loss": 0.5279, "mean_token_accuracy": 0.8322090208530426, "num_tokens": 894851924.0, "step": 28038 }, { "entropy": 0.44918955489993095, "epoch": 2.579732146451142, "grad_norm": 0.1528763473033905, "learning_rate": 1.4012328641089337e-05, "loss": 0.4465, "mean_token_accuracy": 0.8597537465393543, "num_tokens": 894883471.0, "step": 28039 }, { "entropy": 0.5932127479463816, "epoch": 2.579824152822583, "grad_norm": 0.16600914299488068, "learning_rate": 1.400926181494771e-05, "loss": 0.5811, "mean_token_accuracy": 0.8202552497386932, "num_tokens": 894916239.0, "step": 28040 }, { "entropy": 0.47842860128730536, "epoch": 2.579916159194024, "grad_norm": 0.1614256650209427, "learning_rate": 1.4006194988806085e-05, "loss": 0.4714, "mean_token_accuracy": 0.8490541577339172, "num_tokens": 894948281.0, "step": 28041 }, { "entropy": 0.5092188407434151, "epoch": 2.5800081655654656, "grad_norm": 0.1572858989238739, "learning_rate": 1.4003128162664458e-05, "loss": 0.5042, "mean_token_accuracy": 0.8431836068630219, "num_tokens": 894979877.0, "step": 28042 }, { "entropy": 0.5527383973821998, "epoch": 2.5801001719369068, "grad_norm": 0.16820071637630463, "learning_rate": 1.4000061336522832e-05, "loss": 0.5491, "mean_token_accuracy": 0.8279079608619213, "num_tokens": 895010759.0, "step": 28043 }, { "entropy": 0.4994149599224329, "epoch": 2.580192178308348, "grad_norm": 0.16527633368968964, "learning_rate": 1.3996994510381207e-05, "loss": 0.4826, "mean_token_accuracy": 0.8458071835339069, "num_tokens": 895041655.0, "step": 28044 }, { "entropy": 0.5584120508283377, "epoch": 2.580284184679789, "grad_norm": 0.16187557578086853, "learning_rate": 1.399392768423958e-05, "loss": 0.5379, "mean_token_accuracy": 0.829451572149992, "num_tokens": 895073684.0, "step": 28045 }, { "entropy": 0.49890464171767235, "epoch": 2.58037619105123, "grad_norm": 0.1551336795091629, "learning_rate": 1.3990860858097955e-05, "loss": 0.4827, "mean_token_accuracy": 0.845428816974163, "num_tokens": 895105384.0, "step": 28046 }, { "entropy": 0.5740240644663572, "epoch": 2.5804681974226718, "grad_norm": 0.1656956672668457, "learning_rate": 1.3987794031956327e-05, "loss": 0.5694, "mean_token_accuracy": 0.8206941671669483, "num_tokens": 895137525.0, "step": 28047 }, { "entropy": 0.4401195142418146, "epoch": 2.580560203794113, "grad_norm": 0.15228302776813507, "learning_rate": 1.3984727205814704e-05, "loss": 0.434, "mean_token_accuracy": 0.8617787212133408, "num_tokens": 895169216.0, "step": 28048 }, { "entropy": 0.5691486829891801, "epoch": 2.580652210165554, "grad_norm": 0.16528752446174622, "learning_rate": 1.3981660379673078e-05, "loss": 0.5497, "mean_token_accuracy": 0.8303701281547546, "num_tokens": 895200921.0, "step": 28049 }, { "entropy": 0.44684648187831044, "epoch": 2.580744216536995, "grad_norm": 0.1512184590101242, "learning_rate": 1.3978593553531451e-05, "loss": 0.4323, "mean_token_accuracy": 0.8594813123345375, "num_tokens": 895232731.0, "step": 28050 }, { "entropy": 0.49879721738398075, "epoch": 2.5808362229084363, "grad_norm": 0.154293954372406, "learning_rate": 1.3975526727389826e-05, "loss": 0.4816, "mean_token_accuracy": 0.8442563377320766, "num_tokens": 895264577.0, "step": 28051 }, { "entropy": 0.5690373368561268, "epoch": 2.580928229279878, "grad_norm": 0.16318269073963165, "learning_rate": 1.39724599012482e-05, "loss": 0.5514, "mean_token_accuracy": 0.8246102631092072, "num_tokens": 895296135.0, "step": 28052 }, { "entropy": 0.5370885087177157, "epoch": 2.581020235651319, "grad_norm": 0.1633731722831726, "learning_rate": 1.3969393075106574e-05, "loss": 0.5282, "mean_token_accuracy": 0.834173571318388, "num_tokens": 895327846.0, "step": 28053 }, { "entropy": 0.5426714075729251, "epoch": 2.58111224202276, "grad_norm": 0.16365137696266174, "learning_rate": 1.3966326248964948e-05, "loss": 0.5297, "mean_token_accuracy": 0.834359809756279, "num_tokens": 895360229.0, "step": 28054 }, { "entropy": 0.5628036791458726, "epoch": 2.5812042483942013, "grad_norm": 0.16550210118293762, "learning_rate": 1.3963259422823321e-05, "loss": 0.5474, "mean_token_accuracy": 0.8286402076482773, "num_tokens": 895391749.0, "step": 28055 }, { "entropy": 0.5132559109479189, "epoch": 2.5812962547656424, "grad_norm": 0.15644866228103638, "learning_rate": 1.3960192596681696e-05, "loss": 0.4832, "mean_token_accuracy": 0.8438626416027546, "num_tokens": 895423007.0, "step": 28056 }, { "entropy": 0.5613206876441836, "epoch": 2.581388261137084, "grad_norm": 0.16741624474525452, "learning_rate": 1.3957125770540069e-05, "loss": 0.5462, "mean_token_accuracy": 0.8287477120757103, "num_tokens": 895454983.0, "step": 28057 }, { "entropy": 0.5484776608645916, "epoch": 2.581480267508525, "grad_norm": 0.16045522689819336, "learning_rate": 1.3954058944398444e-05, "loss": 0.5398, "mean_token_accuracy": 0.8281908743083477, "num_tokens": 895487156.0, "step": 28058 }, { "entropy": 0.45663213124498725, "epoch": 2.5815722738799662, "grad_norm": 0.14967641234397888, "learning_rate": 1.3950992118256816e-05, "loss": 0.4375, "mean_token_accuracy": 0.8627949580550194, "num_tokens": 895518476.0, "step": 28059 }, { "entropy": 0.5138166444376111, "epoch": 2.5816642802514074, "grad_norm": 0.16146288812160492, "learning_rate": 1.3947925292115191e-05, "loss": 0.5143, "mean_token_accuracy": 0.8354360088706017, "num_tokens": 895549980.0, "step": 28060 }, { "entropy": 0.6107199843972921, "epoch": 2.5817562866228485, "grad_norm": 0.17424191534519196, "learning_rate": 1.3944858465973564e-05, "loss": 0.5997, "mean_token_accuracy": 0.8119589425623417, "num_tokens": 895581238.0, "step": 28061 }, { "entropy": 0.4666599901393056, "epoch": 2.58184829299429, "grad_norm": 0.1558225452899933, "learning_rate": 1.3941791639831939e-05, "loss": 0.4539, "mean_token_accuracy": 0.8580175787210464, "num_tokens": 895613500.0, "step": 28062 }, { "entropy": 0.5009625111706555, "epoch": 2.581940299365731, "grad_norm": 0.15377472341060638, "learning_rate": 1.3938724813690313e-05, "loss": 0.4932, "mean_token_accuracy": 0.8433098755776882, "num_tokens": 895645660.0, "step": 28063 }, { "entropy": 0.4537616418674588, "epoch": 2.5820323057371724, "grad_norm": 0.15725396573543549, "learning_rate": 1.3935657987548686e-05, "loss": 0.4559, "mean_token_accuracy": 0.8542776256799698, "num_tokens": 895677626.0, "step": 28064 }, { "entropy": 0.5768604654585943, "epoch": 2.5821243121086135, "grad_norm": 0.16634249687194824, "learning_rate": 1.3932591161407061e-05, "loss": 0.5577, "mean_token_accuracy": 0.8256123140454292, "num_tokens": 895708527.0, "step": 28065 }, { "entropy": 0.5477834455668926, "epoch": 2.5822163184800546, "grad_norm": 0.1684585064649582, "learning_rate": 1.3929524335265434e-05, "loss": 0.5433, "mean_token_accuracy": 0.8296691551804543, "num_tokens": 895740048.0, "step": 28066 }, { "entropy": 0.5007168147712946, "epoch": 2.582308324851496, "grad_norm": 0.15485863387584686, "learning_rate": 1.3926457509123809e-05, "loss": 0.4949, "mean_token_accuracy": 0.8430708199739456, "num_tokens": 895772485.0, "step": 28067 }, { "entropy": 0.4835200789384544, "epoch": 2.5824003312229373, "grad_norm": 0.1594993621110916, "learning_rate": 1.3923390682982182e-05, "loss": 0.4731, "mean_token_accuracy": 0.8510464914143085, "num_tokens": 895803593.0, "step": 28068 }, { "entropy": 0.49811689369380474, "epoch": 2.5824923375943785, "grad_norm": 0.15580376982688904, "learning_rate": 1.3920323856840556e-05, "loss": 0.49, "mean_token_accuracy": 0.8403738141059875, "num_tokens": 895835871.0, "step": 28069 }, { "entropy": 0.5030825799331069, "epoch": 2.5825843439658196, "grad_norm": 0.15520499646663666, "learning_rate": 1.3917257030698929e-05, "loss": 0.494, "mean_token_accuracy": 0.838165108114481, "num_tokens": 895868213.0, "step": 28070 }, { "entropy": 0.6250587496906519, "epoch": 2.5826763503372607, "grad_norm": 0.17217500507831573, "learning_rate": 1.3914190204557304e-05, "loss": 0.6135, "mean_token_accuracy": 0.8040158823132515, "num_tokens": 895899689.0, "step": 28071 }, { "entropy": 0.44586161943152547, "epoch": 2.5827683567087023, "grad_norm": 0.15170100331306458, "learning_rate": 1.3911123378415677e-05, "loss": 0.4337, "mean_token_accuracy": 0.8598935939371586, "num_tokens": 895931813.0, "step": 28072 }, { "entropy": 0.552742762491107, "epoch": 2.5828603630801434, "grad_norm": 0.16675831377506256, "learning_rate": 1.3908056552274051e-05, "loss": 0.5392, "mean_token_accuracy": 0.8291565328836441, "num_tokens": 895963845.0, "step": 28073 }, { "entropy": 0.5019473361317068, "epoch": 2.5829523694515846, "grad_norm": 0.1564164012670517, "learning_rate": 1.3904989726132426e-05, "loss": 0.4966, "mean_token_accuracy": 0.8430112674832344, "num_tokens": 895995699.0, "step": 28074 }, { "entropy": 0.5156774874776602, "epoch": 2.5830443758230257, "grad_norm": 0.1638736128807068, "learning_rate": 1.3901922899990799e-05, "loss": 0.5014, "mean_token_accuracy": 0.8388731926679611, "num_tokens": 896027535.0, "step": 28075 }, { "entropy": 0.4858387657441199, "epoch": 2.583136382194467, "grad_norm": 0.15691940486431122, "learning_rate": 1.3898856073849174e-05, "loss": 0.4647, "mean_token_accuracy": 0.8493615463376045, "num_tokens": 896058674.0, "step": 28076 }, { "entropy": 0.5867675887420774, "epoch": 2.5832283885659084, "grad_norm": 0.16761384904384613, "learning_rate": 1.3895789247707547e-05, "loss": 0.5672, "mean_token_accuracy": 0.8213761299848557, "num_tokens": 896090089.0, "step": 28077 }, { "entropy": 0.5303914789110422, "epoch": 2.5833203949373496, "grad_norm": 0.1650618016719818, "learning_rate": 1.3892722421565921e-05, "loss": 0.508, "mean_token_accuracy": 0.8380478881299496, "num_tokens": 896122245.0, "step": 28078 }, { "entropy": 0.5416120456065983, "epoch": 2.5834124013087907, "grad_norm": 0.16243262588977814, "learning_rate": 1.3889655595424298e-05, "loss": 0.5313, "mean_token_accuracy": 0.8304809369146824, "num_tokens": 896154255.0, "step": 28079 }, { "entropy": 0.535273402929306, "epoch": 2.583504407680232, "grad_norm": 0.16514497995376587, "learning_rate": 1.388658876928267e-05, "loss": 0.5322, "mean_token_accuracy": 0.8342354819178581, "num_tokens": 896186237.0, "step": 28080 }, { "entropy": 0.5277675869874656, "epoch": 2.583596414051673, "grad_norm": 0.1613447368144989, "learning_rate": 1.3883521943141045e-05, "loss": 0.5072, "mean_token_accuracy": 0.8410305120050907, "num_tokens": 896217201.0, "step": 28081 }, { "entropy": 0.5497281309217215, "epoch": 2.5836884204231145, "grad_norm": 0.16616424918174744, "learning_rate": 1.388045511699942e-05, "loss": 0.5419, "mean_token_accuracy": 0.8245006501674652, "num_tokens": 896248840.0, "step": 28082 }, { "entropy": 0.5969899748452008, "epoch": 2.5837804267945557, "grad_norm": 0.16799160838127136, "learning_rate": 1.3877388290857793e-05, "loss": 0.5944, "mean_token_accuracy": 0.8156821355223656, "num_tokens": 896280003.0, "step": 28083 }, { "entropy": 0.5058542157057673, "epoch": 2.583872433165997, "grad_norm": 0.1537942737340927, "learning_rate": 1.3874321464716167e-05, "loss": 0.4966, "mean_token_accuracy": 0.8445666991174221, "num_tokens": 896312431.0, "step": 28084 }, { "entropy": 0.5488592023029923, "epoch": 2.583964439537438, "grad_norm": 0.16077148914337158, "learning_rate": 1.387125463857454e-05, "loss": 0.5392, "mean_token_accuracy": 0.8325539454817772, "num_tokens": 896345063.0, "step": 28085 }, { "entropy": 0.464961220510304, "epoch": 2.584056445908879, "grad_norm": 0.15706725418567657, "learning_rate": 1.3868187812432915e-05, "loss": 0.4464, "mean_token_accuracy": 0.8547363430261612, "num_tokens": 896376588.0, "step": 28086 }, { "entropy": 0.5551435314118862, "epoch": 2.5841484522803206, "grad_norm": 0.16575460135936737, "learning_rate": 1.3865120986291288e-05, "loss": 0.5511, "mean_token_accuracy": 0.8250127770006657, "num_tokens": 896408750.0, "step": 28087 }, { "entropy": 0.5103156855329871, "epoch": 2.5842404586517618, "grad_norm": 0.16284950077533722, "learning_rate": 1.3862054160149663e-05, "loss": 0.4995, "mean_token_accuracy": 0.840576309710741, "num_tokens": 896439889.0, "step": 28088 }, { "entropy": 0.44389857165515423, "epoch": 2.584332465023203, "grad_norm": 0.153767928481102, "learning_rate": 1.3858987334008036e-05, "loss": 0.4254, "mean_token_accuracy": 0.8643326684832573, "num_tokens": 896470931.0, "step": 28089 }, { "entropy": 0.5983151625841856, "epoch": 2.584424471394644, "grad_norm": 0.17362891137599945, "learning_rate": 1.385592050786641e-05, "loss": 0.5863, "mean_token_accuracy": 0.8162340596318245, "num_tokens": 896502164.0, "step": 28090 }, { "entropy": 0.6161685101687908, "epoch": 2.584516477766085, "grad_norm": 0.1797454059123993, "learning_rate": 1.3852853681724783e-05, "loss": 0.6161, "mean_token_accuracy": 0.8070651218295097, "num_tokens": 896534138.0, "step": 28091 }, { "entropy": 0.5018267226405442, "epoch": 2.5846084841375268, "grad_norm": 0.16087229549884796, "learning_rate": 1.3849786855583158e-05, "loss": 0.4999, "mean_token_accuracy": 0.839452650398016, "num_tokens": 896566395.0, "step": 28092 }, { "entropy": 0.5283719295402989, "epoch": 2.584700490508968, "grad_norm": 0.1634930521249771, "learning_rate": 1.3846720029441532e-05, "loss": 0.5233, "mean_token_accuracy": 0.8328247405588627, "num_tokens": 896598285.0, "step": 28093 }, { "entropy": 0.5347304202150553, "epoch": 2.584792496880409, "grad_norm": 0.16230642795562744, "learning_rate": 1.3843653203299905e-05, "loss": 0.5224, "mean_token_accuracy": 0.8382368944585323, "num_tokens": 896630008.0, "step": 28094 }, { "entropy": 0.48325309669598937, "epoch": 2.58488450325185, "grad_norm": 0.16389983892440796, "learning_rate": 1.384058637715828e-05, "loss": 0.474, "mean_token_accuracy": 0.8491056561470032, "num_tokens": 896661805.0, "step": 28095 }, { "entropy": 0.5282084187492728, "epoch": 2.5849765096232913, "grad_norm": 0.16492009162902832, "learning_rate": 1.3837519551016653e-05, "loss": 0.5102, "mean_token_accuracy": 0.8386507146060467, "num_tokens": 896693849.0, "step": 28096 }, { "entropy": 0.41410330520011485, "epoch": 2.585068515994733, "grad_norm": 0.14329518377780914, "learning_rate": 1.3834452724875028e-05, "loss": 0.3985, "mean_token_accuracy": 0.8704049624502659, "num_tokens": 896726345.0, "step": 28097 }, { "entropy": 0.5864086654037237, "epoch": 2.585160522366174, "grad_norm": 0.16220389306545258, "learning_rate": 1.38313858987334e-05, "loss": 0.5726, "mean_token_accuracy": 0.8194712549448013, "num_tokens": 896758698.0, "step": 28098 }, { "entropy": 0.4630719097331166, "epoch": 2.585252528737615, "grad_norm": 0.15829399228096008, "learning_rate": 1.3828319072591775e-05, "loss": 0.4449, "mean_token_accuracy": 0.8604946956038475, "num_tokens": 896790262.0, "step": 28099 }, { "entropy": 0.5013225907459855, "epoch": 2.5853445351090563, "grad_norm": 0.15748651325702667, "learning_rate": 1.3825252246450148e-05, "loss": 0.48, "mean_token_accuracy": 0.8459813185036182, "num_tokens": 896821688.0, "step": 28100 }, { "entropy": 0.5188251626677811, "epoch": 2.5854365414804974, "grad_norm": 0.1605345904827118, "learning_rate": 1.3822185420308523e-05, "loss": 0.5023, "mean_token_accuracy": 0.8405962251126766, "num_tokens": 896853386.0, "step": 28101 }, { "entropy": 0.49952845973894, "epoch": 2.585528547851939, "grad_norm": 0.15931960940361023, "learning_rate": 1.3819118594166896e-05, "loss": 0.4878, "mean_token_accuracy": 0.8438686653971672, "num_tokens": 896885172.0, "step": 28102 }, { "entropy": 0.5064111277461052, "epoch": 2.58562055422338, "grad_norm": 0.15768472850322723, "learning_rate": 1.381605176802527e-05, "loss": 0.4964, "mean_token_accuracy": 0.8408503048121929, "num_tokens": 896916640.0, "step": 28103 }, { "entropy": 0.5204603523015976, "epoch": 2.5857125605948212, "grad_norm": 0.1631646305322647, "learning_rate": 1.3812984941883645e-05, "loss": 0.5114, "mean_token_accuracy": 0.8391935117542744, "num_tokens": 896947309.0, "step": 28104 }, { "entropy": 0.46427122689783573, "epoch": 2.5858045669662624, "grad_norm": 0.15113654732704163, "learning_rate": 1.3809918115742018e-05, "loss": 0.4539, "mean_token_accuracy": 0.8600696101784706, "num_tokens": 896980077.0, "step": 28105 }, { "entropy": 0.48281023371964693, "epoch": 2.5858965733377035, "grad_norm": 0.15038348734378815, "learning_rate": 1.3806851289600393e-05, "loss": 0.475, "mean_token_accuracy": 0.8516939133405685, "num_tokens": 897012803.0, "step": 28106 }, { "entropy": 0.5519025269895792, "epoch": 2.585988579709145, "grad_norm": 0.16055670380592346, "learning_rate": 1.3803784463458766e-05, "loss": 0.5363, "mean_token_accuracy": 0.831156499683857, "num_tokens": 897044971.0, "step": 28107 }, { "entropy": 0.5863764397799969, "epoch": 2.586080586080586, "grad_norm": 0.16670836508274078, "learning_rate": 1.380071763731714e-05, "loss": 0.5721, "mean_token_accuracy": 0.820870291441679, "num_tokens": 897076689.0, "step": 28108 }, { "entropy": 0.5244038774399087, "epoch": 2.5861725924520274, "grad_norm": 0.1596129685640335, "learning_rate": 1.3797650811175517e-05, "loss": 0.5024, "mean_token_accuracy": 0.8401795886456966, "num_tokens": 897108195.0, "step": 28109 }, { "entropy": 0.4624980300432071, "epoch": 2.5862645988234685, "grad_norm": 0.15080475807189941, "learning_rate": 1.379458398503389e-05, "loss": 0.447, "mean_token_accuracy": 0.8591403551399708, "num_tokens": 897140241.0, "step": 28110 }, { "entropy": 0.47069514042232186, "epoch": 2.5863566051949096, "grad_norm": 0.1544683575630188, "learning_rate": 1.3791517158892264e-05, "loss": 0.446, "mean_token_accuracy": 0.8575402423739433, "num_tokens": 897172398.0, "step": 28111 }, { "entropy": 0.4854198950342834, "epoch": 2.586448611566351, "grad_norm": 0.15724247694015503, "learning_rate": 1.3788450332750639e-05, "loss": 0.4725, "mean_token_accuracy": 0.8511341214179993, "num_tokens": 897204402.0, "step": 28112 }, { "entropy": 0.5423777238465846, "epoch": 2.5865406179377923, "grad_norm": 0.16587205231189728, "learning_rate": 1.3785383506609012e-05, "loss": 0.535, "mean_token_accuracy": 0.8304918520152569, "num_tokens": 897236310.0, "step": 28113 }, { "entropy": 0.4974405742250383, "epoch": 2.5866326243092335, "grad_norm": 0.1653268188238144, "learning_rate": 1.3782316680467387e-05, "loss": 0.4929, "mean_token_accuracy": 0.8451525419950485, "num_tokens": 897268097.0, "step": 28114 }, { "entropy": 0.5960065769031644, "epoch": 2.5867246306806746, "grad_norm": 0.16792698204517365, "learning_rate": 1.377924985432576e-05, "loss": 0.5749, "mean_token_accuracy": 0.8247969336807728, "num_tokens": 897299720.0, "step": 28115 }, { "entropy": 0.4636851381510496, "epoch": 2.5868166370521157, "grad_norm": 0.15643127262592316, "learning_rate": 1.3776183028184134e-05, "loss": 0.4581, "mean_token_accuracy": 0.854543287307024, "num_tokens": 897332298.0, "step": 28116 }, { "entropy": 0.48482141736894846, "epoch": 2.5869086434235573, "grad_norm": 0.15834233164787292, "learning_rate": 1.3773116202042507e-05, "loss": 0.4778, "mean_token_accuracy": 0.8460519425570965, "num_tokens": 897363875.0, "step": 28117 }, { "entropy": 0.5701260324567556, "epoch": 2.5870006497949984, "grad_norm": 0.1660914421081543, "learning_rate": 1.3770049375900882e-05, "loss": 0.5547, "mean_token_accuracy": 0.8225078135728836, "num_tokens": 897395204.0, "step": 28118 }, { "entropy": 0.5696051390841603, "epoch": 2.5870926561664396, "grad_norm": 0.16522985696792603, "learning_rate": 1.3766982549759255e-05, "loss": 0.5482, "mean_token_accuracy": 0.8240825720131397, "num_tokens": 897426934.0, "step": 28119 }, { "entropy": 0.5934390742331743, "epoch": 2.5871846625378807, "grad_norm": 0.16817884147167206, "learning_rate": 1.376391572361763e-05, "loss": 0.5783, "mean_token_accuracy": 0.8148620091378689, "num_tokens": 897458417.0, "step": 28120 }, { "entropy": 0.4974275156855583, "epoch": 2.587276668909322, "grad_norm": 0.17376306653022766, "learning_rate": 1.3760848897476002e-05, "loss": 0.4992, "mean_token_accuracy": 0.8439159318804741, "num_tokens": 897490985.0, "step": 28121 }, { "entropy": 0.464869195362553, "epoch": 2.5873686752807634, "grad_norm": 0.1588217169046402, "learning_rate": 1.3757782071334377e-05, "loss": 0.4484, "mean_token_accuracy": 0.8579414188861847, "num_tokens": 897522398.0, "step": 28122 }, { "entropy": 0.5667077712714672, "epoch": 2.5874606816522046, "grad_norm": 0.16997811198234558, "learning_rate": 1.3754715245192752e-05, "loss": 0.5511, "mean_token_accuracy": 0.8262869380414486, "num_tokens": 897554567.0, "step": 28123 }, { "entropy": 0.5091244354844093, "epoch": 2.5875526880236457, "grad_norm": 0.16101105511188507, "learning_rate": 1.3751648419051125e-05, "loss": 0.4979, "mean_token_accuracy": 0.8402592316269875, "num_tokens": 897586791.0, "step": 28124 }, { "entropy": 0.4045887663960457, "epoch": 2.587644694395087, "grad_norm": 0.14107507467269897, "learning_rate": 1.37485815929095e-05, "loss": 0.3951, "mean_token_accuracy": 0.8773943148553371, "num_tokens": 897618317.0, "step": 28125 }, { "entropy": 0.5108676645904779, "epoch": 2.587736700766528, "grad_norm": 0.15767265856266022, "learning_rate": 1.3745514766767872e-05, "loss": 0.5005, "mean_token_accuracy": 0.8423679657280445, "num_tokens": 897650410.0, "step": 28126 }, { "entropy": 0.5567603493109345, "epoch": 2.5878287071379695, "grad_norm": 0.16422688961029053, "learning_rate": 1.3742447940626247e-05, "loss": 0.5525, "mean_token_accuracy": 0.8255249485373497, "num_tokens": 897682797.0, "step": 28127 }, { "entropy": 0.4329135335283354, "epoch": 2.5879207135094107, "grad_norm": 0.14689917862415314, "learning_rate": 1.373938111448462e-05, "loss": 0.4213, "mean_token_accuracy": 0.8637078516185284, "num_tokens": 897715346.0, "step": 28128 }, { "entropy": 0.5837183799594641, "epoch": 2.588012719880852, "grad_norm": 0.17107032239437103, "learning_rate": 1.3736314288342994e-05, "loss": 0.5821, "mean_token_accuracy": 0.8135190904140472, "num_tokens": 897746979.0, "step": 28129 }, { "entropy": 0.5025389771908522, "epoch": 2.588104726252293, "grad_norm": 0.15824845433235168, "learning_rate": 1.3733247462201367e-05, "loss": 0.5032, "mean_token_accuracy": 0.8419886641204357, "num_tokens": 897778862.0, "step": 28130 }, { "entropy": 0.5912769790738821, "epoch": 2.588196732623734, "grad_norm": 0.16942313313484192, "learning_rate": 1.3730180636059742e-05, "loss": 0.5831, "mean_token_accuracy": 0.8139793500304222, "num_tokens": 897811078.0, "step": 28131 }, { "entropy": 0.5327993538230658, "epoch": 2.5882887389951756, "grad_norm": 0.16603243350982666, "learning_rate": 1.3727113809918115e-05, "loss": 0.5274, "mean_token_accuracy": 0.8303708881139755, "num_tokens": 897842140.0, "step": 28132 }, { "entropy": 0.4971094075590372, "epoch": 2.5883807453666168, "grad_norm": 0.1539725959300995, "learning_rate": 1.372404698377649e-05, "loss": 0.4823, "mean_token_accuracy": 0.84947245195508, "num_tokens": 897873106.0, "step": 28133 }, { "entropy": 0.5547632835805416, "epoch": 2.588472751738058, "grad_norm": 0.16235966980457306, "learning_rate": 1.3720980157634864e-05, "loss": 0.541, "mean_token_accuracy": 0.830459713935852, "num_tokens": 897905672.0, "step": 28134 }, { "entropy": 0.5603301357477903, "epoch": 2.588564758109499, "grad_norm": 0.17296938598155975, "learning_rate": 1.3717913331493237e-05, "loss": 0.5479, "mean_token_accuracy": 0.8271014504134655, "num_tokens": 897936876.0, "step": 28135 }, { "entropy": 0.41916465293616056, "epoch": 2.58865676448094, "grad_norm": 0.15447041392326355, "learning_rate": 1.3714846505351612e-05, "loss": 0.4061, "mean_token_accuracy": 0.8687751404941082, "num_tokens": 897967767.0, "step": 28136 }, { "entropy": 0.575323473662138, "epoch": 2.5887487708523818, "grad_norm": 0.16727571189403534, "learning_rate": 1.3711779679209985e-05, "loss": 0.5669, "mean_token_accuracy": 0.8223921284079552, "num_tokens": 897999399.0, "step": 28137 }, { "entropy": 0.5494572427123785, "epoch": 2.588840777223823, "grad_norm": 0.16156508028507233, "learning_rate": 1.370871285306836e-05, "loss": 0.5269, "mean_token_accuracy": 0.8315045349299908, "num_tokens": 898031156.0, "step": 28138 }, { "entropy": 0.44597647804766893, "epoch": 2.588932783595264, "grad_norm": 0.15466099977493286, "learning_rate": 1.3705646026926732e-05, "loss": 0.4272, "mean_token_accuracy": 0.8612591326236725, "num_tokens": 898062707.0, "step": 28139 }, { "entropy": 0.5774722527712584, "epoch": 2.589024789966705, "grad_norm": 0.1713021993637085, "learning_rate": 1.3702579200785109e-05, "loss": 0.5747, "mean_token_accuracy": 0.820287611335516, "num_tokens": 898094137.0, "step": 28140 }, { "entropy": 0.512925012037158, "epoch": 2.5891167963381463, "grad_norm": 0.15929171442985535, "learning_rate": 1.3699512374643483e-05, "loss": 0.4929, "mean_token_accuracy": 0.8410739414393902, "num_tokens": 898125743.0, "step": 28141 }, { "entropy": 0.5342249721288681, "epoch": 2.589208802709588, "grad_norm": 0.15747946500778198, "learning_rate": 1.3696445548501858e-05, "loss": 0.5197, "mean_token_accuracy": 0.837272584438324, "num_tokens": 898157283.0, "step": 28142 }, { "entropy": 0.6254636561498046, "epoch": 2.589300809081029, "grad_norm": 0.17150095105171204, "learning_rate": 1.3693378722360231e-05, "loss": 0.6137, "mean_token_accuracy": 0.8090913705527782, "num_tokens": 898189139.0, "step": 28143 }, { "entropy": 0.4516850453801453, "epoch": 2.58939281545247, "grad_norm": 0.15073958039283752, "learning_rate": 1.3690311896218606e-05, "loss": 0.4391, "mean_token_accuracy": 0.8601688668131828, "num_tokens": 898220924.0, "step": 28144 }, { "entropy": 0.5217934674583375, "epoch": 2.5894848218239113, "grad_norm": 0.15693868696689606, "learning_rate": 1.3687245070076979e-05, "loss": 0.5068, "mean_token_accuracy": 0.8364897966384888, "num_tokens": 898252840.0, "step": 28145 }, { "entropy": 0.4867479018867016, "epoch": 2.5895768281953524, "grad_norm": 0.15914104878902435, "learning_rate": 1.3684178243935353e-05, "loss": 0.4746, "mean_token_accuracy": 0.8493016473948956, "num_tokens": 898284441.0, "step": 28146 }, { "entropy": 0.5367108695209026, "epoch": 2.589668834566794, "grad_norm": 0.16238528490066528, "learning_rate": 1.3681111417793726e-05, "loss": 0.5233, "mean_token_accuracy": 0.8332536220550537, "num_tokens": 898316233.0, "step": 28147 }, { "entropy": 0.49243561178445816, "epoch": 2.589760840938235, "grad_norm": 0.16090337932109833, "learning_rate": 1.36780445916521e-05, "loss": 0.4747, "mean_token_accuracy": 0.8500645980238914, "num_tokens": 898347815.0, "step": 28148 }, { "entropy": 0.44714033510535955, "epoch": 2.5898528473096762, "grad_norm": 0.15217120945453644, "learning_rate": 1.3674977765510474e-05, "loss": 0.4371, "mean_token_accuracy": 0.8610686883330345, "num_tokens": 898379465.0, "step": 28149 }, { "entropy": 0.5721219377592206, "epoch": 2.5899448536811174, "grad_norm": 0.16374215483665466, "learning_rate": 1.3671910939368848e-05, "loss": 0.564, "mean_token_accuracy": 0.8244470059871674, "num_tokens": 898411680.0, "step": 28150 }, { "entropy": 0.48351468332111835, "epoch": 2.5900368600525585, "grad_norm": 0.1577019840478897, "learning_rate": 1.3668844113227221e-05, "loss": 0.4739, "mean_token_accuracy": 0.8491157963871956, "num_tokens": 898443178.0, "step": 28151 }, { "entropy": 0.4174171332269907, "epoch": 2.590128866424, "grad_norm": 0.15485750138759613, "learning_rate": 1.3665777287085596e-05, "loss": 0.4053, "mean_token_accuracy": 0.8692650832235813, "num_tokens": 898474128.0, "step": 28152 }, { "entropy": 0.5354734202846885, "epoch": 2.590220872795441, "grad_norm": 0.1623038351535797, "learning_rate": 1.366271046094397e-05, "loss": 0.5224, "mean_token_accuracy": 0.8334096930921078, "num_tokens": 898505604.0, "step": 28153 }, { "entropy": 0.5390862431377172, "epoch": 2.5903128791668824, "grad_norm": 0.16440820693969727, "learning_rate": 1.3659643634802344e-05, "loss": 0.5257, "mean_token_accuracy": 0.8328700885176659, "num_tokens": 898537504.0, "step": 28154 }, { "entropy": 0.4648183537647128, "epoch": 2.5904048855383235, "grad_norm": 0.15299957990646362, "learning_rate": 1.3656576808660718e-05, "loss": 0.4497, "mean_token_accuracy": 0.8596135564148426, "num_tokens": 898569502.0, "step": 28155 }, { "entropy": 0.573387511074543, "epoch": 2.5904968919097646, "grad_norm": 0.16137684881687164, "learning_rate": 1.3653509982519091e-05, "loss": 0.5441, "mean_token_accuracy": 0.8308342099189758, "num_tokens": 898601921.0, "step": 28156 }, { "entropy": 0.5649403017014265, "epoch": 2.590588898281206, "grad_norm": 0.165973499417305, "learning_rate": 1.3650443156377466e-05, "loss": 0.5511, "mean_token_accuracy": 0.8287822566926479, "num_tokens": 898633111.0, "step": 28157 }, { "entropy": 0.4600669788196683, "epoch": 2.5906809046526473, "grad_norm": 0.15107321739196777, "learning_rate": 1.3647376330235839e-05, "loss": 0.4318, "mean_token_accuracy": 0.8614717200398445, "num_tokens": 898664945.0, "step": 28158 }, { "entropy": 0.48311526887118816, "epoch": 2.5907729110240885, "grad_norm": 0.1498389095067978, "learning_rate": 1.3644309504094213e-05, "loss": 0.4825, "mean_token_accuracy": 0.848312608897686, "num_tokens": 898697155.0, "step": 28159 }, { "entropy": 0.48804345913231373, "epoch": 2.5908649173955296, "grad_norm": 0.16024306416511536, "learning_rate": 1.3641242677952586e-05, "loss": 0.4797, "mean_token_accuracy": 0.8455849140882492, "num_tokens": 898728532.0, "step": 28160 }, { "entropy": 0.5466662580147386, "epoch": 2.5909569237669707, "grad_norm": 0.16228656470775604, "learning_rate": 1.3638175851810961e-05, "loss": 0.5376, "mean_token_accuracy": 0.8273472487926483, "num_tokens": 898760791.0, "step": 28161 }, { "entropy": 0.4722052961587906, "epoch": 2.5910489301384123, "grad_norm": 0.1551559716463089, "learning_rate": 1.3635109025669334e-05, "loss": 0.4646, "mean_token_accuracy": 0.8519289195537567, "num_tokens": 898792923.0, "step": 28162 }, { "entropy": 0.5833615465089679, "epoch": 2.5911409365098534, "grad_norm": 0.1672520488500595, "learning_rate": 1.3632042199527709e-05, "loss": 0.5809, "mean_token_accuracy": 0.8210913278162479, "num_tokens": 898824985.0, "step": 28163 }, { "entropy": 0.5385571904480457, "epoch": 2.5912329428812946, "grad_norm": 0.1642249971628189, "learning_rate": 1.3628975373386083e-05, "loss": 0.5296, "mean_token_accuracy": 0.8338269926607609, "num_tokens": 898857579.0, "step": 28164 }, { "entropy": 0.5614807680249214, "epoch": 2.5913249492527357, "grad_norm": 0.16910722851753235, "learning_rate": 1.3625908547244456e-05, "loss": 0.5628, "mean_token_accuracy": 0.8274957202374935, "num_tokens": 898889733.0, "step": 28165 }, { "entropy": 0.49419688433408737, "epoch": 2.591416955624177, "grad_norm": 0.1620074063539505, "learning_rate": 1.3622841721102831e-05, "loss": 0.495, "mean_token_accuracy": 0.8445340134203434, "num_tokens": 898921819.0, "step": 28166 }, { "entropy": 0.46933995094150305, "epoch": 2.5915089619956184, "grad_norm": 0.15486064553260803, "learning_rate": 1.3619774894961204e-05, "loss": 0.4616, "mean_token_accuracy": 0.8528038784861565, "num_tokens": 898953451.0, "step": 28167 }, { "entropy": 0.48801031708717346, "epoch": 2.5916009683670596, "grad_norm": 0.15753374993801117, "learning_rate": 1.3616708068819579e-05, "loss": 0.4789, "mean_token_accuracy": 0.847422331571579, "num_tokens": 898985263.0, "step": 28168 }, { "entropy": 0.5413882434368134, "epoch": 2.5916929747385007, "grad_norm": 0.16110074520111084, "learning_rate": 1.3613641242677951e-05, "loss": 0.5297, "mean_token_accuracy": 0.8364978469908237, "num_tokens": 899016668.0, "step": 28169 }, { "entropy": 0.4558967687189579, "epoch": 2.591784981109942, "grad_norm": 0.15647286176681519, "learning_rate": 1.3610574416536328e-05, "loss": 0.4427, "mean_token_accuracy": 0.855718769133091, "num_tokens": 899048527.0, "step": 28170 }, { "entropy": 0.5605791937559843, "epoch": 2.591876987481383, "grad_norm": 0.16647058725357056, "learning_rate": 1.3607507590394702e-05, "loss": 0.5521, "mean_token_accuracy": 0.8282223492860794, "num_tokens": 899080515.0, "step": 28171 }, { "entropy": 0.5588134815916419, "epoch": 2.5919689938528245, "grad_norm": 0.16883176565170288, "learning_rate": 1.3604440764253077e-05, "loss": 0.5494, "mean_token_accuracy": 0.8244894966483116, "num_tokens": 899112549.0, "step": 28172 }, { "entropy": 0.5100271739065647, "epoch": 2.5920610002242657, "grad_norm": 0.16155996918678284, "learning_rate": 1.360137393811145e-05, "loss": 0.5044, "mean_token_accuracy": 0.8370888456702232, "num_tokens": 899144849.0, "step": 28173 }, { "entropy": 0.603611383587122, "epoch": 2.592153006595707, "grad_norm": 0.16687989234924316, "learning_rate": 1.3598307111969825e-05, "loss": 0.5833, "mean_token_accuracy": 0.8169094249606133, "num_tokens": 899176885.0, "step": 28174 }, { "entropy": 0.48200383968651295, "epoch": 2.592245012967148, "grad_norm": 0.15411663055419922, "learning_rate": 1.3595240285828198e-05, "loss": 0.4706, "mean_token_accuracy": 0.848433792591095, "num_tokens": 899208810.0, "step": 28175 }, { "entropy": 0.5518632438033819, "epoch": 2.592337019338589, "grad_norm": 0.16824276745319366, "learning_rate": 1.3592173459686572e-05, "loss": 0.5493, "mean_token_accuracy": 0.8276809677481651, "num_tokens": 899240082.0, "step": 28176 }, { "entropy": 0.5179026098921895, "epoch": 2.5924290257100306, "grad_norm": 0.16075196862220764, "learning_rate": 1.3589106633544945e-05, "loss": 0.5074, "mean_token_accuracy": 0.8395738080143929, "num_tokens": 899272135.0, "step": 28177 }, { "entropy": 0.4734937287867069, "epoch": 2.5925210320814718, "grad_norm": 0.15077966451644897, "learning_rate": 1.358603980740332e-05, "loss": 0.4572, "mean_token_accuracy": 0.8590503819286823, "num_tokens": 899304003.0, "step": 28178 }, { "entropy": 0.4526001433841884, "epoch": 2.592613038452913, "grad_norm": 0.14906980097293854, "learning_rate": 1.3582972981261693e-05, "loss": 0.4367, "mean_token_accuracy": 0.8620250672101974, "num_tokens": 899336439.0, "step": 28179 }, { "entropy": 0.4167113252915442, "epoch": 2.592705044824354, "grad_norm": 0.14895063638687134, "learning_rate": 1.3579906155120068e-05, "loss": 0.4078, "mean_token_accuracy": 0.8695353344082832, "num_tokens": 899368207.0, "step": 28180 }, { "entropy": 0.5163977155461907, "epoch": 2.592797051195795, "grad_norm": 0.16566097736358643, "learning_rate": 1.357683932897844e-05, "loss": 0.508, "mean_token_accuracy": 0.8393443450331688, "num_tokens": 899399480.0, "step": 28181 }, { "entropy": 0.5245807319879532, "epoch": 2.5928890575672368, "grad_norm": 0.15991081297397614, "learning_rate": 1.3573772502836815e-05, "loss": 0.5124, "mean_token_accuracy": 0.837839275598526, "num_tokens": 899431676.0, "step": 28182 }, { "entropy": 0.5013318620622158, "epoch": 2.592981063938678, "grad_norm": 0.1551700383424759, "learning_rate": 1.357070567669519e-05, "loss": 0.4857, "mean_token_accuracy": 0.8481391407549381, "num_tokens": 899464082.0, "step": 28183 }, { "entropy": 0.6254508709535003, "epoch": 2.593073070310119, "grad_norm": 0.17042875289916992, "learning_rate": 1.3567638850553563e-05, "loss": 0.6057, "mean_token_accuracy": 0.8060975335538387, "num_tokens": 899496193.0, "step": 28184 }, { "entropy": 0.4252132297260687, "epoch": 2.59316507668156, "grad_norm": 0.14606761932373047, "learning_rate": 1.3564572024411937e-05, "loss": 0.4133, "mean_token_accuracy": 0.8685783334076405, "num_tokens": 899528107.0, "step": 28185 }, { "entropy": 0.5891430203337222, "epoch": 2.5932570830530013, "grad_norm": 0.16900193691253662, "learning_rate": 1.356150519827031e-05, "loss": 0.5731, "mean_token_accuracy": 0.8215434588491917, "num_tokens": 899560118.0, "step": 28186 }, { "entropy": 0.49114694725722075, "epoch": 2.593349089424443, "grad_norm": 0.15849576890468597, "learning_rate": 1.3558438372128685e-05, "loss": 0.4835, "mean_token_accuracy": 0.8433583527803421, "num_tokens": 899592270.0, "step": 28187 }, { "entropy": 0.5042822284158319, "epoch": 2.593441095795884, "grad_norm": 0.16005440056324005, "learning_rate": 1.3555371545987058e-05, "loss": 0.4905, "mean_token_accuracy": 0.845712311565876, "num_tokens": 899623907.0, "step": 28188 }, { "entropy": 0.505175887607038, "epoch": 2.593533102167325, "grad_norm": 0.1555652618408203, "learning_rate": 1.3552304719845433e-05, "loss": 0.4945, "mean_token_accuracy": 0.8479849733412266, "num_tokens": 899656202.0, "step": 28189 }, { "entropy": 0.5058012725785375, "epoch": 2.5936251085387663, "grad_norm": 0.1571321040391922, "learning_rate": 1.3549237893703806e-05, "loss": 0.497, "mean_token_accuracy": 0.8428276367485523, "num_tokens": 899688185.0, "step": 28190 }, { "entropy": 0.522138400003314, "epoch": 2.5937171149102074, "grad_norm": 0.15878257155418396, "learning_rate": 1.354617106756218e-05, "loss": 0.4972, "mean_token_accuracy": 0.8420529924333096, "num_tokens": 899720461.0, "step": 28191 }, { "entropy": 0.5119656955357641, "epoch": 2.593809121281649, "grad_norm": 0.16038256883621216, "learning_rate": 1.3543104241420553e-05, "loss": 0.5072, "mean_token_accuracy": 0.8403251990675926, "num_tokens": 899752158.0, "step": 28192 }, { "entropy": 0.42020841408520937, "epoch": 2.59390112765309, "grad_norm": 0.14307236671447754, "learning_rate": 1.3540037415278928e-05, "loss": 0.4089, "mean_token_accuracy": 0.8706205002963543, "num_tokens": 899784866.0, "step": 28193 }, { "entropy": 0.5028666644357145, "epoch": 2.5939931340245312, "grad_norm": 0.15848112106323242, "learning_rate": 1.3536970589137302e-05, "loss": 0.4976, "mean_token_accuracy": 0.8438576459884644, "num_tokens": 899817470.0, "step": 28194 }, { "entropy": 0.48216399690136313, "epoch": 2.5940851403959724, "grad_norm": 0.15333041548728943, "learning_rate": 1.3533903762995675e-05, "loss": 0.4736, "mean_token_accuracy": 0.8504428267478943, "num_tokens": 899849671.0, "step": 28195 }, { "entropy": 0.5440030032768846, "epoch": 2.5941771467674135, "grad_norm": 0.1580871045589447, "learning_rate": 1.353083693685405e-05, "loss": 0.529, "mean_token_accuracy": 0.833004217594862, "num_tokens": 899882141.0, "step": 28196 }, { "entropy": 0.5240934062749147, "epoch": 2.594269153138855, "grad_norm": 0.16619625687599182, "learning_rate": 1.3527770110712423e-05, "loss": 0.5134, "mean_token_accuracy": 0.8399271108210087, "num_tokens": 899914055.0, "step": 28197 }, { "entropy": 0.5195866646245122, "epoch": 2.594361159510296, "grad_norm": 0.155541330575943, "learning_rate": 1.3524703284570798e-05, "loss": 0.51, "mean_token_accuracy": 0.8403289057314396, "num_tokens": 899946375.0, "step": 28198 }, { "entropy": 0.515073130838573, "epoch": 2.5944531658817374, "grad_norm": 0.15843354165554047, "learning_rate": 1.352163645842917e-05, "loss": 0.5051, "mean_token_accuracy": 0.8381139226257801, "num_tokens": 899977818.0, "step": 28199 }, { "entropy": 0.5451608709990978, "epoch": 2.5945451722531785, "grad_norm": 0.16475257277488708, "learning_rate": 1.3518569632287545e-05, "loss": 0.5433, "mean_token_accuracy": 0.8310026749968529, "num_tokens": 900010586.0, "step": 28200 }, { "entropy": 0.5621136538684368, "epoch": 2.5946371786246196, "grad_norm": 0.17094337940216064, "learning_rate": 1.3515502806145922e-05, "loss": 0.5458, "mean_token_accuracy": 0.8298199512064457, "num_tokens": 900041221.0, "step": 28201 }, { "entropy": 0.5056634447537363, "epoch": 2.594729184996061, "grad_norm": 0.15655094385147095, "learning_rate": 1.3512435980004296e-05, "loss": 0.4952, "mean_token_accuracy": 0.8425271362066269, "num_tokens": 900073363.0, "step": 28202 }, { "entropy": 0.5983701115474105, "epoch": 2.5948211913675023, "grad_norm": 0.1645904779434204, "learning_rate": 1.350936915386267e-05, "loss": 0.5744, "mean_token_accuracy": 0.8158334046602249, "num_tokens": 900104860.0, "step": 28203 }, { "entropy": 0.5792715735733509, "epoch": 2.5949131977389435, "grad_norm": 0.16293327510356903, "learning_rate": 1.3506302327721044e-05, "loss": 0.5662, "mean_token_accuracy": 0.8190562948584557, "num_tokens": 900137245.0, "step": 28204 }, { "entropy": 0.4802171002374962, "epoch": 2.5950052041103846, "grad_norm": 0.15637987852096558, "learning_rate": 1.3503235501579417e-05, "loss": 0.4793, "mean_token_accuracy": 0.8458282947540283, "num_tokens": 900169316.0, "step": 28205 }, { "entropy": 0.4413651907816529, "epoch": 2.5950972104818257, "grad_norm": 0.1529817283153534, "learning_rate": 1.3500168675437791e-05, "loss": 0.4302, "mean_token_accuracy": 0.865674301981926, "num_tokens": 900201017.0, "step": 28206 }, { "entropy": 0.5161902965046465, "epoch": 2.5951892168532673, "grad_norm": 0.16122885048389435, "learning_rate": 1.3497101849296164e-05, "loss": 0.5033, "mean_token_accuracy": 0.8373831138014793, "num_tokens": 900233229.0, "step": 28207 }, { "entropy": 0.47774090711027384, "epoch": 2.5952812232247084, "grad_norm": 0.1560545265674591, "learning_rate": 1.3494035023154539e-05, "loss": 0.4624, "mean_token_accuracy": 0.8524090014398098, "num_tokens": 900265661.0, "step": 28208 }, { "entropy": 0.5589319528080523, "epoch": 2.5953732295961496, "grad_norm": 0.16351665556430817, "learning_rate": 1.3490968197012912e-05, "loss": 0.5429, "mean_token_accuracy": 0.8294409215450287, "num_tokens": 900296646.0, "step": 28209 }, { "entropy": 0.5001609358005226, "epoch": 2.5954652359675907, "grad_norm": 0.15497621893882751, "learning_rate": 1.3487901370871287e-05, "loss": 0.4856, "mean_token_accuracy": 0.8459895364940166, "num_tokens": 900328730.0, "step": 28210 }, { "entropy": 0.5521027408540249, "epoch": 2.595557242339032, "grad_norm": 0.16432277858257294, "learning_rate": 1.348483454472966e-05, "loss": 0.5485, "mean_token_accuracy": 0.8286941386759281, "num_tokens": 900360696.0, "step": 28211 }, { "entropy": 0.5150715298950672, "epoch": 2.5956492487104734, "grad_norm": 0.15542414784431458, "learning_rate": 1.3481767718588034e-05, "loss": 0.5043, "mean_token_accuracy": 0.8401632159948349, "num_tokens": 900392322.0, "step": 28212 }, { "entropy": 0.570399955380708, "epoch": 2.5957412550819146, "grad_norm": 0.16782821714878082, "learning_rate": 1.3478700892446409e-05, "loss": 0.5627, "mean_token_accuracy": 0.8225649297237396, "num_tokens": 900424377.0, "step": 28213 }, { "entropy": 0.518876095302403, "epoch": 2.5958332614533557, "grad_norm": 0.1627325713634491, "learning_rate": 1.3475634066304782e-05, "loss": 0.5118, "mean_token_accuracy": 0.8393551781773567, "num_tokens": 900456358.0, "step": 28214 }, { "entropy": 0.50574248470366, "epoch": 2.595925267824797, "grad_norm": 0.1632971614599228, "learning_rate": 1.3472567240163156e-05, "loss": 0.5015, "mean_token_accuracy": 0.838752020150423, "num_tokens": 900487713.0, "step": 28215 }, { "entropy": 0.569315355271101, "epoch": 2.596017274196238, "grad_norm": 0.1690404862165451, "learning_rate": 1.346950041402153e-05, "loss": 0.5621, "mean_token_accuracy": 0.8167094402015209, "num_tokens": 900519447.0, "step": 28216 }, { "entropy": 0.4674865137785673, "epoch": 2.5961092805676795, "grad_norm": 0.15104569494724274, "learning_rate": 1.3466433587879904e-05, "loss": 0.4653, "mean_token_accuracy": 0.8522581718862057, "num_tokens": 900551711.0, "step": 28217 }, { "entropy": 0.5380520345643163, "epoch": 2.5962012869391207, "grad_norm": 0.16196700930595398, "learning_rate": 1.3463366761738277e-05, "loss": 0.5165, "mean_token_accuracy": 0.8356987610459328, "num_tokens": 900583957.0, "step": 28218 }, { "entropy": 0.5046512531116605, "epoch": 2.596293293310562, "grad_norm": 0.15215645730495453, "learning_rate": 1.3460299935596652e-05, "loss": 0.4905, "mean_token_accuracy": 0.8443394005298615, "num_tokens": 900616217.0, "step": 28219 }, { "entropy": 0.517803056165576, "epoch": 2.596385299682003, "grad_norm": 0.1577947735786438, "learning_rate": 1.3457233109455025e-05, "loss": 0.5103, "mean_token_accuracy": 0.8405432924628258, "num_tokens": 900648622.0, "step": 28220 }, { "entropy": 0.5476500056684017, "epoch": 2.596477306053444, "grad_norm": 0.16586948931217194, "learning_rate": 1.34541662833134e-05, "loss": 0.5307, "mean_token_accuracy": 0.8284727931022644, "num_tokens": 900680799.0, "step": 28221 }, { "entropy": 0.5147372949868441, "epoch": 2.5965693124248856, "grad_norm": 0.15780910849571228, "learning_rate": 1.3451099457171772e-05, "loss": 0.5025, "mean_token_accuracy": 0.8404557108879089, "num_tokens": 900712629.0, "step": 28222 }, { "entropy": 0.5480255950242281, "epoch": 2.596661318796327, "grad_norm": 0.17110292613506317, "learning_rate": 1.3448032631030147e-05, "loss": 0.5427, "mean_token_accuracy": 0.8290177583694458, "num_tokens": 900744838.0, "step": 28223 }, { "entropy": 0.569641973823309, "epoch": 2.596753325167768, "grad_norm": 0.16144204139709473, "learning_rate": 1.3444965804888522e-05, "loss": 0.5582, "mean_token_accuracy": 0.8258572667837143, "num_tokens": 900777311.0, "step": 28224 }, { "entropy": 0.5949212089180946, "epoch": 2.596845331539209, "grad_norm": 0.17667809128761292, "learning_rate": 1.3441898978746894e-05, "loss": 0.5896, "mean_token_accuracy": 0.8115385621786118, "num_tokens": 900807622.0, "step": 28225 }, { "entropy": 0.5355099383741617, "epoch": 2.59693733791065, "grad_norm": 0.159736767411232, "learning_rate": 1.3438832152605269e-05, "loss": 0.5246, "mean_token_accuracy": 0.832745224237442, "num_tokens": 900840022.0, "step": 28226 }, { "entropy": 0.6095592640340328, "epoch": 2.5970293442820918, "grad_norm": 0.17110280692577362, "learning_rate": 1.3435765326463642e-05, "loss": 0.5935, "mean_token_accuracy": 0.8136614859104156, "num_tokens": 900871882.0, "step": 28227 }, { "entropy": 0.44097559805959463, "epoch": 2.597121350653533, "grad_norm": 0.15193869173526764, "learning_rate": 1.3432698500322017e-05, "loss": 0.4356, "mean_token_accuracy": 0.8616142980754375, "num_tokens": 900904051.0, "step": 28228 }, { "entropy": 0.5749397296458483, "epoch": 2.597213357024974, "grad_norm": 0.16740682721138, "learning_rate": 1.342963167418039e-05, "loss": 0.5597, "mean_token_accuracy": 0.8279673606157303, "num_tokens": 900935745.0, "step": 28229 }, { "entropy": 0.4730112454853952, "epoch": 2.597305363396415, "grad_norm": 0.15478718280792236, "learning_rate": 1.3426564848038764e-05, "loss": 0.458, "mean_token_accuracy": 0.8573456928133965, "num_tokens": 900967359.0, "step": 28230 }, { "entropy": 0.462701587472111, "epoch": 2.5973973697678563, "grad_norm": 0.15016965568065643, "learning_rate": 1.342349802189714e-05, "loss": 0.4411, "mean_token_accuracy": 0.8597429394721985, "num_tokens": 900998928.0, "step": 28231 }, { "entropy": 0.49225260503590107, "epoch": 2.597489376139298, "grad_norm": 0.1558152735233307, "learning_rate": 1.3420431195755515e-05, "loss": 0.4902, "mean_token_accuracy": 0.8452869318425655, "num_tokens": 901031151.0, "step": 28232 }, { "entropy": 0.653489300981164, "epoch": 2.597581382510739, "grad_norm": 0.17147962749004364, "learning_rate": 1.3417364369613888e-05, "loss": 0.6431, "mean_token_accuracy": 0.8001320250332355, "num_tokens": 901063761.0, "step": 28233 }, { "entropy": 0.4428385307546705, "epoch": 2.59767338888218, "grad_norm": 0.15672539174556732, "learning_rate": 1.3414297543472263e-05, "loss": 0.4479, "mean_token_accuracy": 0.85982895642519, "num_tokens": 901095446.0, "step": 28234 }, { "entropy": 0.5638486817479134, "epoch": 2.5977653952536213, "grad_norm": 0.17140094935894012, "learning_rate": 1.3411230717330636e-05, "loss": 0.5554, "mean_token_accuracy": 0.8238424845039845, "num_tokens": 901127111.0, "step": 28235 }, { "entropy": 0.5179489627480507, "epoch": 2.5978574016250624, "grad_norm": 0.16132666170597076, "learning_rate": 1.340816389118901e-05, "loss": 0.5075, "mean_token_accuracy": 0.8355398327112198, "num_tokens": 901159023.0, "step": 28236 }, { "entropy": 0.5508319400250912, "epoch": 2.597949407996504, "grad_norm": 0.16155362129211426, "learning_rate": 1.3405097065047383e-05, "loss": 0.5386, "mean_token_accuracy": 0.8279087357223034, "num_tokens": 901190959.0, "step": 28237 }, { "entropy": 0.41799213271588087, "epoch": 2.598041414367945, "grad_norm": 0.14920322597026825, "learning_rate": 1.3402030238905758e-05, "loss": 0.4072, "mean_token_accuracy": 0.8669858239591122, "num_tokens": 901223207.0, "step": 28238 }, { "entropy": 0.5421827007085085, "epoch": 2.5981334207393862, "grad_norm": 0.1634903997182846, "learning_rate": 1.3398963412764131e-05, "loss": 0.5422, "mean_token_accuracy": 0.8298310413956642, "num_tokens": 901255259.0, "step": 28239 }, { "entropy": 0.46925269439816475, "epoch": 2.5982254271108274, "grad_norm": 0.15718407928943634, "learning_rate": 1.3395896586622506e-05, "loss": 0.4628, "mean_token_accuracy": 0.8524570763111115, "num_tokens": 901287135.0, "step": 28240 }, { "entropy": 0.4399890740169212, "epoch": 2.5983174334822685, "grad_norm": 0.1490848809480667, "learning_rate": 1.3392829760480879e-05, "loss": 0.4286, "mean_token_accuracy": 0.8667112775146961, "num_tokens": 901318846.0, "step": 28241 }, { "entropy": 0.6308501586318016, "epoch": 2.59840943985371, "grad_norm": 0.16982804238796234, "learning_rate": 1.3389762934339253e-05, "loss": 0.612, "mean_token_accuracy": 0.8049821332097054, "num_tokens": 901350325.0, "step": 28242 }, { "entropy": 0.5401952210813761, "epoch": 2.5985014462251512, "grad_norm": 0.16271084547042847, "learning_rate": 1.3386696108197628e-05, "loss": 0.529, "mean_token_accuracy": 0.8321045711636543, "num_tokens": 901382003.0, "step": 28243 }, { "entropy": 0.4635147023946047, "epoch": 2.5985934525965924, "grad_norm": 0.15142486989498138, "learning_rate": 1.3383629282056001e-05, "loss": 0.459, "mean_token_accuracy": 0.8541868403553963, "num_tokens": 901414589.0, "step": 28244 }, { "entropy": 0.5840107770636678, "epoch": 2.5986854589680335, "grad_norm": 0.16944913566112518, "learning_rate": 1.3380562455914376e-05, "loss": 0.5839, "mean_token_accuracy": 0.8147887475788593, "num_tokens": 901445891.0, "step": 28245 }, { "entropy": 0.5430951435118914, "epoch": 2.5987774653394746, "grad_norm": 0.1593707799911499, "learning_rate": 1.3377495629772749e-05, "loss": 0.5209, "mean_token_accuracy": 0.8308185040950775, "num_tokens": 901477437.0, "step": 28246 }, { "entropy": 0.48058329988271, "epoch": 2.598869471710916, "grad_norm": 0.15347611904144287, "learning_rate": 1.3374428803631123e-05, "loss": 0.4658, "mean_token_accuracy": 0.8546812906861305, "num_tokens": 901509194.0, "step": 28247 }, { "entropy": 0.5709867104887962, "epoch": 2.5989614780823573, "grad_norm": 0.1666181981563568, "learning_rate": 1.3371361977489496e-05, "loss": 0.5542, "mean_token_accuracy": 0.8210254907608032, "num_tokens": 901540633.0, "step": 28248 }, { "entropy": 0.5300663784146309, "epoch": 2.5990534844537985, "grad_norm": 0.16059331595897675, "learning_rate": 1.336829515134787e-05, "loss": 0.5164, "mean_token_accuracy": 0.8381140977144241, "num_tokens": 901572884.0, "step": 28249 }, { "entropy": 0.3744340199045837, "epoch": 2.5991454908252396, "grad_norm": 0.13875164091587067, "learning_rate": 1.3365228325206244e-05, "loss": 0.3717, "mean_token_accuracy": 0.8823367655277252, "num_tokens": 901605430.0, "step": 28250 }, { "entropy": 0.4794623088091612, "epoch": 2.5992374971966807, "grad_norm": 0.15675584971904755, "learning_rate": 1.3362161499064618e-05, "loss": 0.4753, "mean_token_accuracy": 0.8462494909763336, "num_tokens": 901637361.0, "step": 28251 }, { "entropy": 0.42129123234190047, "epoch": 2.5993295035681223, "grad_norm": 0.1510845571756363, "learning_rate": 1.3359094672922991e-05, "loss": 0.4125, "mean_token_accuracy": 0.8678025230765343, "num_tokens": 901669299.0, "step": 28252 }, { "entropy": 0.5704724481329322, "epoch": 2.5994215099395634, "grad_norm": 0.17035643756389618, "learning_rate": 1.3356027846781366e-05, "loss": 0.5557, "mean_token_accuracy": 0.8246455751359463, "num_tokens": 901701471.0, "step": 28253 }, { "entropy": 0.521621155552566, "epoch": 2.5995135163110046, "grad_norm": 0.1600295901298523, "learning_rate": 1.335296102063974e-05, "loss": 0.5095, "mean_token_accuracy": 0.8403059579432011, "num_tokens": 901732891.0, "step": 28254 }, { "entropy": 0.40151338931173086, "epoch": 2.5996055226824457, "grad_norm": 0.14326894283294678, "learning_rate": 1.3349894194498114e-05, "loss": 0.3772, "mean_token_accuracy": 0.8765738680958748, "num_tokens": 901763902.0, "step": 28255 }, { "entropy": 0.5494592888280749, "epoch": 2.599697529053887, "grad_norm": 0.1664787083864212, "learning_rate": 1.3346827368356488e-05, "loss": 0.5365, "mean_token_accuracy": 0.8310879953205585, "num_tokens": 901796046.0, "step": 28256 }, { "entropy": 0.518883396871388, "epoch": 2.5997895354253284, "grad_norm": 0.1676834225654602, "learning_rate": 1.3343760542214861e-05, "loss": 0.5152, "mean_token_accuracy": 0.8381627462804317, "num_tokens": 901828012.0, "step": 28257 }, { "entropy": 0.6034623710438609, "epoch": 2.5998815417967696, "grad_norm": 0.17131009697914124, "learning_rate": 1.3340693716073236e-05, "loss": 0.5981, "mean_token_accuracy": 0.8165554963052273, "num_tokens": 901860467.0, "step": 28258 }, { "entropy": 0.47298349207267165, "epoch": 2.5999735481682107, "grad_norm": 0.1486651599407196, "learning_rate": 1.3337626889931609e-05, "loss": 0.4534, "mean_token_accuracy": 0.8531575463712215, "num_tokens": 901892457.0, "step": 28259 }, { "entropy": 0.5221669524908066, "epoch": 2.600065554539652, "grad_norm": 0.17288808524608612, "learning_rate": 1.3334560063789983e-05, "loss": 0.5131, "mean_token_accuracy": 0.8364674188196659, "num_tokens": 901922603.0, "step": 28260 }, { "entropy": 0.4750172607600689, "epoch": 2.600157560911093, "grad_norm": 0.14863191545009613, "learning_rate": 1.3331493237648356e-05, "loss": 0.452, "mean_token_accuracy": 0.8551495037972927, "num_tokens": 901954748.0, "step": 28261 }, { "entropy": 0.5160471303388476, "epoch": 2.6002495672825345, "grad_norm": 0.15873827040195465, "learning_rate": 1.3328426411506734e-05, "loss": 0.4941, "mean_token_accuracy": 0.8445414341986179, "num_tokens": 901986755.0, "step": 28262 }, { "entropy": 0.43847398925572634, "epoch": 2.6003415736539757, "grad_norm": 0.15617112815380096, "learning_rate": 1.3325359585365107e-05, "loss": 0.4278, "mean_token_accuracy": 0.8637622408568859, "num_tokens": 902018665.0, "step": 28263 }, { "entropy": 0.5217633470892906, "epoch": 2.600433580025417, "grad_norm": 0.1611657589673996, "learning_rate": 1.3322292759223482e-05, "loss": 0.5146, "mean_token_accuracy": 0.8353440426290035, "num_tokens": 902051047.0, "step": 28264 }, { "entropy": 0.4964370774105191, "epoch": 2.600525586396858, "grad_norm": 0.8510679602622986, "learning_rate": 1.3319225933081855e-05, "loss": 0.5077, "mean_token_accuracy": 0.8462406732141972, "num_tokens": 902083525.0, "step": 28265 }, { "entropy": 0.506592015735805, "epoch": 2.600617592768299, "grad_norm": 0.15731316804885864, "learning_rate": 1.331615910694023e-05, "loss": 0.4938, "mean_token_accuracy": 0.8424609191715717, "num_tokens": 902115607.0, "step": 28266 }, { "entropy": 0.5884567648172379, "epoch": 2.6007095991397406, "grad_norm": 0.16928353905677795, "learning_rate": 1.3313092280798603e-05, "loss": 0.5833, "mean_token_accuracy": 0.8204018510878086, "num_tokens": 902147375.0, "step": 28267 }, { "entropy": 0.4821149678900838, "epoch": 2.600801605511182, "grad_norm": 0.1512814313173294, "learning_rate": 1.3310025454656977e-05, "loss": 0.4717, "mean_token_accuracy": 0.852284375578165, "num_tokens": 902179696.0, "step": 28268 }, { "entropy": 0.4868776313960552, "epoch": 2.600893611882623, "grad_norm": 0.15651291608810425, "learning_rate": 1.330695862851535e-05, "loss": 0.4713, "mean_token_accuracy": 0.8468835428357124, "num_tokens": 902212118.0, "step": 28269 }, { "entropy": 0.5535234156996012, "epoch": 2.600985618254064, "grad_norm": 0.16153469681739807, "learning_rate": 1.3303891802373725e-05, "loss": 0.5439, "mean_token_accuracy": 0.8269290402531624, "num_tokens": 902244751.0, "step": 28270 }, { "entropy": 0.5130287623032928, "epoch": 2.601077624625505, "grad_norm": 0.15925456583499908, "learning_rate": 1.3300824976232098e-05, "loss": 0.5064, "mean_token_accuracy": 0.8397430628538132, "num_tokens": 902277388.0, "step": 28271 }, { "entropy": 0.4269328167429194, "epoch": 2.6011696309969468, "grad_norm": 0.15334734320640564, "learning_rate": 1.3297758150090472e-05, "loss": 0.4069, "mean_token_accuracy": 0.868051465600729, "num_tokens": 902308379.0, "step": 28272 }, { "entropy": 0.5427501546218991, "epoch": 2.601261637368388, "grad_norm": 0.16449619829654694, "learning_rate": 1.3294691323948847e-05, "loss": 0.5335, "mean_token_accuracy": 0.8297178000211716, "num_tokens": 902339946.0, "step": 28273 }, { "entropy": 0.5185576044023037, "epoch": 2.601353643739829, "grad_norm": 0.16293582320213318, "learning_rate": 1.329162449780722e-05, "loss": 0.5041, "mean_token_accuracy": 0.8467773608863354, "num_tokens": 902371826.0, "step": 28274 }, { "entropy": 0.5317453574389219, "epoch": 2.60144565011127, "grad_norm": 0.15658046305179596, "learning_rate": 1.3288557671665595e-05, "loss": 0.5264, "mean_token_accuracy": 0.8361733146011829, "num_tokens": 902404530.0, "step": 28275 }, { "entropy": 0.5071073612198234, "epoch": 2.6015376564827113, "grad_norm": 0.1635550707578659, "learning_rate": 1.3285490845523968e-05, "loss": 0.4952, "mean_token_accuracy": 0.8464798554778099, "num_tokens": 902436025.0, "step": 28276 }, { "entropy": 0.5960611011832952, "epoch": 2.601629662854153, "grad_norm": 0.17304284870624542, "learning_rate": 1.3282424019382342e-05, "loss": 0.5797, "mean_token_accuracy": 0.8178924284875393, "num_tokens": 902467476.0, "step": 28277 }, { "entropy": 0.39300623442977667, "epoch": 2.601721669225594, "grad_norm": 0.14043250679969788, "learning_rate": 1.3279357193240715e-05, "loss": 0.3874, "mean_token_accuracy": 0.876569103449583, "num_tokens": 902499836.0, "step": 28278 }, { "entropy": 0.5378907155245543, "epoch": 2.601813675597035, "grad_norm": 0.1680966168642044, "learning_rate": 1.327629036709909e-05, "loss": 0.5323, "mean_token_accuracy": 0.8316112644970417, "num_tokens": 902531703.0, "step": 28279 }, { "entropy": 0.5530280373059213, "epoch": 2.6019056819684763, "grad_norm": 0.1654997020959854, "learning_rate": 1.3273223540957463e-05, "loss": 0.5437, "mean_token_accuracy": 0.8259734623134136, "num_tokens": 902563382.0, "step": 28280 }, { "entropy": 0.48441638331860304, "epoch": 2.6019976883399174, "grad_norm": 0.15357182919979095, "learning_rate": 1.3270156714815837e-05, "loss": 0.4713, "mean_token_accuracy": 0.8510797843337059, "num_tokens": 902595853.0, "step": 28281 }, { "entropy": 0.42462270334362984, "epoch": 2.602089694711359, "grad_norm": 0.1469718962907791, "learning_rate": 1.326708988867421e-05, "loss": 0.4066, "mean_token_accuracy": 0.8678762689232826, "num_tokens": 902627692.0, "step": 28282 }, { "entropy": 0.475219386164099, "epoch": 2.6021817010828, "grad_norm": 0.15417665243148804, "learning_rate": 1.3264023062532585e-05, "loss": 0.4433, "mean_token_accuracy": 0.8569832034409046, "num_tokens": 902659347.0, "step": 28283 }, { "entropy": 0.4839251828379929, "epoch": 2.6022737074542412, "grad_norm": 0.15723395347595215, "learning_rate": 1.326095623639096e-05, "loss": 0.4584, "mean_token_accuracy": 0.8518504165112972, "num_tokens": 902690567.0, "step": 28284 }, { "entropy": 0.5176213551312685, "epoch": 2.6023657138256824, "grad_norm": 0.16094659268856049, "learning_rate": 1.3257889410249333e-05, "loss": 0.5072, "mean_token_accuracy": 0.8386893682181835, "num_tokens": 902722855.0, "step": 28285 }, { "entropy": 0.4889058042317629, "epoch": 2.6024577201971235, "grad_norm": 0.15278498828411102, "learning_rate": 1.3254822584107707e-05, "loss": 0.4831, "mean_token_accuracy": 0.8503392785787582, "num_tokens": 902754797.0, "step": 28286 }, { "entropy": 0.4511449821293354, "epoch": 2.602549726568565, "grad_norm": 0.15287111699581146, "learning_rate": 1.325175575796608e-05, "loss": 0.446, "mean_token_accuracy": 0.8533364608883858, "num_tokens": 902787363.0, "step": 28287 }, { "entropy": 0.5256030266173184, "epoch": 2.6026417329400062, "grad_norm": 0.15790365636348724, "learning_rate": 1.3248688931824455e-05, "loss": 0.5148, "mean_token_accuracy": 0.8339271657168865, "num_tokens": 902819222.0, "step": 28288 }, { "entropy": 0.4206531059462577, "epoch": 2.6027337393114474, "grad_norm": 0.14611801505088806, "learning_rate": 1.3245622105682828e-05, "loss": 0.405, "mean_token_accuracy": 0.8706445321440697, "num_tokens": 902850908.0, "step": 28289 }, { "entropy": 0.499949905090034, "epoch": 2.6028257456828885, "grad_norm": 0.15330809354782104, "learning_rate": 1.3242555279541203e-05, "loss": 0.4824, "mean_token_accuracy": 0.8457708545029163, "num_tokens": 902883070.0, "step": 28290 }, { "entropy": 0.5768110912758857, "epoch": 2.6029177520543296, "grad_norm": 0.16935767233371735, "learning_rate": 1.3239488453399575e-05, "loss": 0.5583, "mean_token_accuracy": 0.8240936808288097, "num_tokens": 902914772.0, "step": 28291 }, { "entropy": 0.45919525530189276, "epoch": 2.603009758425771, "grad_norm": 0.15374140441417694, "learning_rate": 1.3236421627257954e-05, "loss": 0.4597, "mean_token_accuracy": 0.8558897078037262, "num_tokens": 902945807.0, "step": 28292 }, { "entropy": 0.5114441206678748, "epoch": 2.6031017647972123, "grad_norm": 0.15868070721626282, "learning_rate": 1.3233354801116326e-05, "loss": 0.4935, "mean_token_accuracy": 0.8408354036509991, "num_tokens": 902977252.0, "step": 28293 }, { "entropy": 0.6229985933750868, "epoch": 2.6031937711686535, "grad_norm": 0.16956183314323425, "learning_rate": 1.3230287974974701e-05, "loss": 0.6121, "mean_token_accuracy": 0.8077124655246735, "num_tokens": 903008980.0, "step": 28294 }, { "entropy": 0.5544647350907326, "epoch": 2.6032857775400946, "grad_norm": 0.16108737885951996, "learning_rate": 1.3227221148833074e-05, "loss": 0.5436, "mean_token_accuracy": 0.8310847766697407, "num_tokens": 903040670.0, "step": 28295 }, { "entropy": 0.5403539557009935, "epoch": 2.6033777839115357, "grad_norm": 0.16175585985183716, "learning_rate": 1.3224154322691449e-05, "loss": 0.5349, "mean_token_accuracy": 0.8315732479095459, "num_tokens": 903073180.0, "step": 28296 }, { "entropy": 0.5035894960165024, "epoch": 2.6034697902829773, "grad_norm": 0.15753431618213654, "learning_rate": 1.3221087496549822e-05, "loss": 0.4945, "mean_token_accuracy": 0.8444164879620075, "num_tokens": 903104907.0, "step": 28297 }, { "entropy": 0.6202764566987753, "epoch": 2.6035617966544184, "grad_norm": 0.1707228720188141, "learning_rate": 1.3218020670408196e-05, "loss": 0.6097, "mean_token_accuracy": 0.8066837936639786, "num_tokens": 903136705.0, "step": 28298 }, { "entropy": 0.5299674794077873, "epoch": 2.6036538030258596, "grad_norm": 0.16136720776557922, "learning_rate": 1.321495384426657e-05, "loss": 0.521, "mean_token_accuracy": 0.8349180929362774, "num_tokens": 903168307.0, "step": 28299 }, { "entropy": 0.5113131222315133, "epoch": 2.6037458093973007, "grad_norm": 0.15340976417064667, "learning_rate": 1.3211887018124944e-05, "loss": 0.493, "mean_token_accuracy": 0.8426394872367382, "num_tokens": 903199757.0, "step": 28300 }, { "entropy": 0.5137890707701445, "epoch": 2.603837815768742, "grad_norm": 0.16551907360553741, "learning_rate": 1.3208820191983317e-05, "loss": 0.5061, "mean_token_accuracy": 0.8418612331151962, "num_tokens": 903231894.0, "step": 28301 }, { "entropy": 0.4812477696686983, "epoch": 2.6039298221401834, "grad_norm": 0.15200616419315338, "learning_rate": 1.3205753365841692e-05, "loss": 0.463, "mean_token_accuracy": 0.8467263653874397, "num_tokens": 903262672.0, "step": 28302 }, { "entropy": 0.5290214559063315, "epoch": 2.6040218285116246, "grad_norm": 0.16483215987682343, "learning_rate": 1.3202686539700066e-05, "loss": 0.5286, "mean_token_accuracy": 0.834223035722971, "num_tokens": 903294041.0, "step": 28303 }, { "entropy": 0.5562193039804697, "epoch": 2.6041138348830657, "grad_norm": 0.16365139186382294, "learning_rate": 1.3199619713558439e-05, "loss": 0.5525, "mean_token_accuracy": 0.8252218440175056, "num_tokens": 903326274.0, "step": 28304 }, { "entropy": 0.5862515051849186, "epoch": 2.604205841254507, "grad_norm": 0.1682736873626709, "learning_rate": 1.3196552887416814e-05, "loss": 0.5651, "mean_token_accuracy": 0.8181197419762611, "num_tokens": 903358338.0, "step": 28305 }, { "entropy": 0.6012823134660721, "epoch": 2.604297847625948, "grad_norm": 0.16544298827648163, "learning_rate": 1.3193486061275187e-05, "loss": 0.5746, "mean_token_accuracy": 0.8188791908323765, "num_tokens": 903390392.0, "step": 28306 }, { "entropy": 0.5014185199979693, "epoch": 2.6043898539973895, "grad_norm": 0.15588803589344025, "learning_rate": 1.3190419235133561e-05, "loss": 0.4821, "mean_token_accuracy": 0.8448521085083485, "num_tokens": 903422882.0, "step": 28307 }, { "entropy": 0.5936824064701796, "epoch": 2.6044818603688307, "grad_norm": 0.16672374308109283, "learning_rate": 1.3187352408991934e-05, "loss": 0.5779, "mean_token_accuracy": 0.8195785991847515, "num_tokens": 903455037.0, "step": 28308 }, { "entropy": 0.5796952340751886, "epoch": 2.604573866740272, "grad_norm": 0.15720731019973755, "learning_rate": 1.3184285582850309e-05, "loss": 0.5584, "mean_token_accuracy": 0.8217977024614811, "num_tokens": 903487799.0, "step": 28309 }, { "entropy": 0.5514019792899489, "epoch": 2.604665873111713, "grad_norm": 0.1628049910068512, "learning_rate": 1.3181218756708682e-05, "loss": 0.5461, "mean_token_accuracy": 0.8305836543440819, "num_tokens": 903519659.0, "step": 28310 }, { "entropy": 0.5301405536010861, "epoch": 2.604757879483154, "grad_norm": 0.1608152836561203, "learning_rate": 1.3178151930567057e-05, "loss": 0.5197, "mean_token_accuracy": 0.8354477621614933, "num_tokens": 903551475.0, "step": 28311 }, { "entropy": 0.5785166118294001, "epoch": 2.6048498858545956, "grad_norm": 0.16207890212535858, "learning_rate": 1.317508510442543e-05, "loss": 0.553, "mean_token_accuracy": 0.8272100351750851, "num_tokens": 903584044.0, "step": 28312 }, { "entropy": 0.46515848487615585, "epoch": 2.604941892226037, "grad_norm": 0.15557970106601715, "learning_rate": 1.3172018278283804e-05, "loss": 0.4613, "mean_token_accuracy": 0.8553241267800331, "num_tokens": 903616261.0, "step": 28313 }, { "entropy": 0.5638889092952013, "epoch": 2.605033898597478, "grad_norm": 0.1632772833108902, "learning_rate": 1.3168951452142179e-05, "loss": 0.5627, "mean_token_accuracy": 0.8210031650960445, "num_tokens": 903648457.0, "step": 28314 }, { "entropy": 0.46164507418870926, "epoch": 2.605125904968919, "grad_norm": 0.1451621800661087, "learning_rate": 1.3165884626000552e-05, "loss": 0.4489, "mean_token_accuracy": 0.8578712679445744, "num_tokens": 903681225.0, "step": 28315 }, { "entropy": 0.48515452118590474, "epoch": 2.60521791134036, "grad_norm": 0.15751944482326508, "learning_rate": 1.3162817799858926e-05, "loss": 0.4705, "mean_token_accuracy": 0.8491312861442566, "num_tokens": 903713395.0, "step": 28316 }, { "entropy": 0.43777802772819996, "epoch": 2.6053099177118018, "grad_norm": 0.14396627247333527, "learning_rate": 1.31597509737173e-05, "loss": 0.4231, "mean_token_accuracy": 0.8637995086610317, "num_tokens": 903745892.0, "step": 28317 }, { "entropy": 0.5319998059421778, "epoch": 2.605401924083243, "grad_norm": 0.16491840779781342, "learning_rate": 1.3156684147575674e-05, "loss": 0.5112, "mean_token_accuracy": 0.8348898142576218, "num_tokens": 903777256.0, "step": 28318 }, { "entropy": 0.598953009583056, "epoch": 2.605493930454684, "grad_norm": 0.16713352501392365, "learning_rate": 1.3153617321434047e-05, "loss": 0.586, "mean_token_accuracy": 0.8186911009252071, "num_tokens": 903809216.0, "step": 28319 }, { "entropy": 0.6284565310925245, "epoch": 2.605585936826125, "grad_norm": 0.18103814125061035, "learning_rate": 1.3150550495292422e-05, "loss": 0.6139, "mean_token_accuracy": 0.8031970076262951, "num_tokens": 903839945.0, "step": 28320 }, { "entropy": 0.6037060415837914, "epoch": 2.6056779431975663, "grad_norm": 0.16884230077266693, "learning_rate": 1.3147483669150795e-05, "loss": 0.593, "mean_token_accuracy": 0.8162972629070282, "num_tokens": 903872521.0, "step": 28321 }, { "entropy": 0.4517563576810062, "epoch": 2.605769949569008, "grad_norm": 0.1671735793352127, "learning_rate": 1.314441684300917e-05, "loss": 0.4375, "mean_token_accuracy": 0.8594395071268082, "num_tokens": 903903848.0, "step": 28322 }, { "entropy": 0.5462042037397623, "epoch": 2.605861955940449, "grad_norm": 0.17185059189796448, "learning_rate": 1.3141350016867546e-05, "loss": 0.5427, "mean_token_accuracy": 0.8292316682636738, "num_tokens": 903935383.0, "step": 28323 }, { "entropy": 0.5346918134018779, "epoch": 2.60595396231189, "grad_norm": 0.1606139987707138, "learning_rate": 1.313828319072592e-05, "loss": 0.5318, "mean_token_accuracy": 0.8306994773447514, "num_tokens": 903967129.0, "step": 28324 }, { "entropy": 0.43864279706031084, "epoch": 2.6060459686833313, "grad_norm": 0.15191034972667694, "learning_rate": 1.3135216364584293e-05, "loss": 0.4312, "mean_token_accuracy": 0.8595203906297684, "num_tokens": 903999532.0, "step": 28325 }, { "entropy": 0.4920670511201024, "epoch": 2.6061379750547724, "grad_norm": 0.15922629833221436, "learning_rate": 1.3132149538442668e-05, "loss": 0.489, "mean_token_accuracy": 0.8456680476665497, "num_tokens": 904031384.0, "step": 28326 }, { "entropy": 0.5252240691334009, "epoch": 2.606229981426214, "grad_norm": 0.16592803597450256, "learning_rate": 1.312908271230104e-05, "loss": 0.5217, "mean_token_accuracy": 0.8341379314661026, "num_tokens": 904063214.0, "step": 28327 }, { "entropy": 0.6303208852186799, "epoch": 2.606321987797655, "grad_norm": 0.17247822880744934, "learning_rate": 1.3126015886159415e-05, "loss": 0.6214, "mean_token_accuracy": 0.8078691326081753, "num_tokens": 904094443.0, "step": 28328 }, { "entropy": 0.5370352249592543, "epoch": 2.6064139941690962, "grad_norm": 0.154293954372406, "learning_rate": 1.3122949060017788e-05, "loss": 0.5128, "mean_token_accuracy": 0.8342380970716476, "num_tokens": 904126484.0, "step": 28329 }, { "entropy": 0.5660886317491531, "epoch": 2.6065060005405374, "grad_norm": 0.1669246405363083, "learning_rate": 1.3119882233876163e-05, "loss": 0.5486, "mean_token_accuracy": 0.8243119120597839, "num_tokens": 904157958.0, "step": 28330 }, { "entropy": 0.5854050479829311, "epoch": 2.6065980069119785, "grad_norm": 0.17219731211662292, "learning_rate": 1.3116815407734536e-05, "loss": 0.5774, "mean_token_accuracy": 0.8160492070019245, "num_tokens": 904188770.0, "step": 28331 }, { "entropy": 0.49717781599611044, "epoch": 2.60669001328342, "grad_norm": 0.15709663927555084, "learning_rate": 1.311374858159291e-05, "loss": 0.4793, "mean_token_accuracy": 0.8458669297397137, "num_tokens": 904220669.0, "step": 28332 }, { "entropy": 0.6321200234815478, "epoch": 2.6067820196548612, "grad_norm": 0.17484086751937866, "learning_rate": 1.3110681755451285e-05, "loss": 0.6273, "mean_token_accuracy": 0.8045862391591072, "num_tokens": 904252429.0, "step": 28333 }, { "entropy": 0.4589832443743944, "epoch": 2.6068740260263024, "grad_norm": 0.1568067967891693, "learning_rate": 1.3107614929309658e-05, "loss": 0.4349, "mean_token_accuracy": 0.8614049218595028, "num_tokens": 904283242.0, "step": 28334 }, { "entropy": 0.46912096976302564, "epoch": 2.6069660323977435, "grad_norm": 0.1547614187002182, "learning_rate": 1.3104548103168033e-05, "loss": 0.4551, "mean_token_accuracy": 0.8561983183026314, "num_tokens": 904315101.0, "step": 28335 }, { "entropy": 0.5045256251469254, "epoch": 2.6070580387691846, "grad_norm": 0.15626545250415802, "learning_rate": 1.3101481277026406e-05, "loss": 0.4889, "mean_token_accuracy": 0.844804372638464, "num_tokens": 904347494.0, "step": 28336 }, { "entropy": 0.5116377202793956, "epoch": 2.607150045140626, "grad_norm": 0.1570601612329483, "learning_rate": 1.309841445088478e-05, "loss": 0.4967, "mean_token_accuracy": 0.8409989103674889, "num_tokens": 904379467.0, "step": 28337 }, { "entropy": 0.5054028565064073, "epoch": 2.6072420515120673, "grad_norm": 0.154592826962471, "learning_rate": 1.3095347624743153e-05, "loss": 0.4977, "mean_token_accuracy": 0.8430786617100239, "num_tokens": 904411880.0, "step": 28338 }, { "entropy": 0.5233326777815819, "epoch": 2.6073340578835085, "grad_norm": 0.15749706327915192, "learning_rate": 1.3092280798601528e-05, "loss": 0.5098, "mean_token_accuracy": 0.8398164436221123, "num_tokens": 904444645.0, "step": 28339 }, { "entropy": 0.5656864824704826, "epoch": 2.6074260642549496, "grad_norm": 0.16307906806468964, "learning_rate": 1.3089213972459901e-05, "loss": 0.5455, "mean_token_accuracy": 0.8257585801184177, "num_tokens": 904476566.0, "step": 28340 }, { "entropy": 0.6505445586517453, "epoch": 2.6075180706263907, "grad_norm": 0.17280250787734985, "learning_rate": 1.3086147146318276e-05, "loss": 0.6398, "mean_token_accuracy": 0.797905471175909, "num_tokens": 904508685.0, "step": 28341 }, { "entropy": 0.548507702536881, "epoch": 2.6076100769978323, "grad_norm": 0.1623714715242386, "learning_rate": 1.3083080320176649e-05, "loss": 0.5398, "mean_token_accuracy": 0.8315539285540581, "num_tokens": 904541202.0, "step": 28342 }, { "entropy": 0.43674240773543715, "epoch": 2.6077020833692734, "grad_norm": 0.15180759131908417, "learning_rate": 1.3080013494035023e-05, "loss": 0.4256, "mean_token_accuracy": 0.864042017608881, "num_tokens": 904573547.0, "step": 28343 }, { "entropy": 0.5441841860301793, "epoch": 2.6077940897407146, "grad_norm": 0.16298438608646393, "learning_rate": 1.3076946667893398e-05, "loss": 0.529, "mean_token_accuracy": 0.8314981199800968, "num_tokens": 904606126.0, "step": 28344 }, { "entropy": 0.49475818895734847, "epoch": 2.6078860961121557, "grad_norm": 0.15917466580867767, "learning_rate": 1.3073879841751771e-05, "loss": 0.4881, "mean_token_accuracy": 0.8475888483226299, "num_tokens": 904637905.0, "step": 28345 }, { "entropy": 0.5239962125197053, "epoch": 2.607978102483597, "grad_norm": 0.1600116342306137, "learning_rate": 1.3070813015610146e-05, "loss": 0.508, "mean_token_accuracy": 0.8372312448918819, "num_tokens": 904670056.0, "step": 28346 }, { "entropy": 0.5213222680613399, "epoch": 2.6080701088550384, "grad_norm": 0.16327176988124847, "learning_rate": 1.3067746189468518e-05, "loss": 0.5041, "mean_token_accuracy": 0.839937150478363, "num_tokens": 904701166.0, "step": 28347 }, { "entropy": 0.5286225089803338, "epoch": 2.6081621152264796, "grad_norm": 0.1623900979757309, "learning_rate": 1.3064679363326893e-05, "loss": 0.5116, "mean_token_accuracy": 0.8394653350114822, "num_tokens": 904732247.0, "step": 28348 }, { "entropy": 0.4474559426307678, "epoch": 2.6082541215979207, "grad_norm": 0.15163986384868622, "learning_rate": 1.3061612537185266e-05, "loss": 0.4489, "mean_token_accuracy": 0.8605047129094601, "num_tokens": 904763357.0, "step": 28349 }, { "entropy": 0.6489016357809305, "epoch": 2.608346127969362, "grad_norm": 0.17236848175525665, "learning_rate": 1.305854571104364e-05, "loss": 0.6324, "mean_token_accuracy": 0.802093643695116, "num_tokens": 904795468.0, "step": 28350 }, { "entropy": 0.4636388423386961, "epoch": 2.608438134340803, "grad_norm": 0.1514209806919098, "learning_rate": 1.3055478884902014e-05, "loss": 0.4552, "mean_token_accuracy": 0.8553577065467834, "num_tokens": 904827795.0, "step": 28351 }, { "entropy": 0.5101281721144915, "epoch": 2.6085301407122445, "grad_norm": 0.1591917723417282, "learning_rate": 1.3052412058760388e-05, "loss": 0.4845, "mean_token_accuracy": 0.8426341414451599, "num_tokens": 904859154.0, "step": 28352 }, { "entropy": 0.5887274602428079, "epoch": 2.6086221470836857, "grad_norm": 0.16981323063373566, "learning_rate": 1.3049345232618765e-05, "loss": 0.5806, "mean_token_accuracy": 0.8184574171900749, "num_tokens": 904890765.0, "step": 28353 }, { "entropy": 0.43994106352329254, "epoch": 2.608714153455127, "grad_norm": 0.15104492008686066, "learning_rate": 1.304627840647714e-05, "loss": 0.4365, "mean_token_accuracy": 0.858371376991272, "num_tokens": 904922952.0, "step": 28354 }, { "entropy": 0.526735388673842, "epoch": 2.608806159826568, "grad_norm": 0.16187414526939392, "learning_rate": 1.3043211580335512e-05, "loss": 0.5193, "mean_token_accuracy": 0.8355785608291626, "num_tokens": 904954855.0, "step": 28355 }, { "entropy": 0.63600654900074, "epoch": 2.608898166198009, "grad_norm": 0.16589877009391785, "learning_rate": 1.3040144754193887e-05, "loss": 0.6297, "mean_token_accuracy": 0.8094808422029018, "num_tokens": 904986875.0, "step": 28356 }, { "entropy": 0.44948428007774055, "epoch": 2.6089901725694506, "grad_norm": 0.14481844007968903, "learning_rate": 1.303707792805226e-05, "loss": 0.4471, "mean_token_accuracy": 0.8601429350674152, "num_tokens": 905019470.0, "step": 28357 }, { "entropy": 0.46023148437961936, "epoch": 2.609082178940892, "grad_norm": 0.15091006457805634, "learning_rate": 1.3034011101910635e-05, "loss": 0.4562, "mean_token_accuracy": 0.8532326333224773, "num_tokens": 905051738.0, "step": 28358 }, { "entropy": 0.5158172380179167, "epoch": 2.609174185312333, "grad_norm": 0.1635555922985077, "learning_rate": 1.3030944275769007e-05, "loss": 0.511, "mean_token_accuracy": 0.8366108536720276, "num_tokens": 905084219.0, "step": 28359 }, { "entropy": 0.6018341388553381, "epoch": 2.609266191683774, "grad_norm": 0.16956281661987305, "learning_rate": 1.3027877449627382e-05, "loss": 0.5949, "mean_token_accuracy": 0.8119612783193588, "num_tokens": 905116700.0, "step": 28360 }, { "entropy": 0.48768760170787573, "epoch": 2.609358198055215, "grad_norm": 0.15172818303108215, "learning_rate": 1.3024810623485755e-05, "loss": 0.4736, "mean_token_accuracy": 0.8474522531032562, "num_tokens": 905148303.0, "step": 28361 }, { "entropy": 0.6051319167017937, "epoch": 2.6094502044266568, "grad_norm": 0.16769322752952576, "learning_rate": 1.302174379734413e-05, "loss": 0.5742, "mean_token_accuracy": 0.8185567259788513, "num_tokens": 905179075.0, "step": 28362 }, { "entropy": 0.5569892087951303, "epoch": 2.609542210798098, "grad_norm": 0.16070696711540222, "learning_rate": 1.3018676971202504e-05, "loss": 0.5473, "mean_token_accuracy": 0.8239555433392525, "num_tokens": 905210919.0, "step": 28363 }, { "entropy": 0.4555729627609253, "epoch": 2.609634217169539, "grad_norm": 0.151001438498497, "learning_rate": 1.3015610145060877e-05, "loss": 0.4477, "mean_token_accuracy": 0.8538888283073902, "num_tokens": 905243129.0, "step": 28364 }, { "entropy": 0.5702556045725942, "epoch": 2.60972622354098, "grad_norm": 0.1661531925201416, "learning_rate": 1.3012543318919252e-05, "loss": 0.542, "mean_token_accuracy": 0.8279397450387478, "num_tokens": 905274688.0, "step": 28365 }, { "entropy": 0.4867382328957319, "epoch": 2.6098182299124213, "grad_norm": 0.15781421959400177, "learning_rate": 1.3009476492777625e-05, "loss": 0.4746, "mean_token_accuracy": 0.8477033711969852, "num_tokens": 905306564.0, "step": 28366 }, { "entropy": 0.501534512732178, "epoch": 2.609910236283863, "grad_norm": 0.15479372441768646, "learning_rate": 1.3006409666636e-05, "loss": 0.4866, "mean_token_accuracy": 0.8454982787370682, "num_tokens": 905338778.0, "step": 28367 }, { "entropy": 0.49042975064367056, "epoch": 2.610002242655304, "grad_norm": 0.15344715118408203, "learning_rate": 1.3003342840494373e-05, "loss": 0.4745, "mean_token_accuracy": 0.8496611751616001, "num_tokens": 905371126.0, "step": 28368 }, { "entropy": 0.5401394236832857, "epoch": 2.610094249026745, "grad_norm": 0.16993792355060577, "learning_rate": 1.3000276014352747e-05, "loss": 0.5457, "mean_token_accuracy": 0.8260634355247021, "num_tokens": 905402811.0, "step": 28369 }, { "entropy": 0.46417327458038926, "epoch": 2.6101862553981863, "grad_norm": 0.15596391260623932, "learning_rate": 1.299720918821112e-05, "loss": 0.4547, "mean_token_accuracy": 0.8569624200463295, "num_tokens": 905435052.0, "step": 28370 }, { "entropy": 0.4800503448350355, "epoch": 2.6102782617696274, "grad_norm": 0.15207639336585999, "learning_rate": 1.2994142362069495e-05, "loss": 0.4575, "mean_token_accuracy": 0.8542159460484982, "num_tokens": 905466266.0, "step": 28371 }, { "entropy": 0.5743696615099907, "epoch": 2.610370268141069, "grad_norm": 0.16394104063510895, "learning_rate": 1.2991075535927868e-05, "loss": 0.5605, "mean_token_accuracy": 0.821817371994257, "num_tokens": 905498334.0, "step": 28372 }, { "entropy": 0.5432433411478996, "epoch": 2.61046227451251, "grad_norm": 0.16909398138523102, "learning_rate": 1.2988008709786242e-05, "loss": 0.5436, "mean_token_accuracy": 0.828057125210762, "num_tokens": 905530697.0, "step": 28373 }, { "entropy": 0.4852940384298563, "epoch": 2.6105542808839513, "grad_norm": 0.15646135807037354, "learning_rate": 1.2984941883644617e-05, "loss": 0.4607, "mean_token_accuracy": 0.8523574434220791, "num_tokens": 905561855.0, "step": 28374 }, { "entropy": 0.46901047322899103, "epoch": 2.6106462872553924, "grad_norm": 0.14844255149364471, "learning_rate": 1.298187505750299e-05, "loss": 0.4619, "mean_token_accuracy": 0.854230560362339, "num_tokens": 905593982.0, "step": 28375 }, { "entropy": 0.4322726195678115, "epoch": 2.6107382936268335, "grad_norm": 0.15258347988128662, "learning_rate": 1.2978808231361365e-05, "loss": 0.4135, "mean_token_accuracy": 0.8647962771356106, "num_tokens": 905625854.0, "step": 28376 }, { "entropy": 0.39859637524932623, "epoch": 2.610830299998275, "grad_norm": 0.1435329169034958, "learning_rate": 1.2975741405219738e-05, "loss": 0.3859, "mean_token_accuracy": 0.8740363605320454, "num_tokens": 905657992.0, "step": 28377 }, { "entropy": 0.5051388142164797, "epoch": 2.6109223063697162, "grad_norm": 0.15514451265335083, "learning_rate": 1.2972674579078112e-05, "loss": 0.4911, "mean_token_accuracy": 0.845084223896265, "num_tokens": 905689985.0, "step": 28378 }, { "entropy": 0.6106614880263805, "epoch": 2.6110143127411574, "grad_norm": 0.17078816890716553, "learning_rate": 1.2969607752936485e-05, "loss": 0.5984, "mean_token_accuracy": 0.813265647739172, "num_tokens": 905721689.0, "step": 28379 }, { "entropy": 0.4662431748583913, "epoch": 2.6111063191125985, "grad_norm": 0.15506166219711304, "learning_rate": 1.296654092679486e-05, "loss": 0.4622, "mean_token_accuracy": 0.8535302318632603, "num_tokens": 905753337.0, "step": 28380 }, { "entropy": 0.5413099071010947, "epoch": 2.6111983254840396, "grad_norm": 0.16088257730007172, "learning_rate": 1.2963474100653233e-05, "loss": 0.5293, "mean_token_accuracy": 0.8309621028602123, "num_tokens": 905785241.0, "step": 28381 }, { "entropy": 0.43651029164902866, "epoch": 2.611290331855481, "grad_norm": 0.1536710560321808, "learning_rate": 1.2960407274511607e-05, "loss": 0.4145, "mean_token_accuracy": 0.8654760420322418, "num_tokens": 905816391.0, "step": 28382 }, { "entropy": 0.529251717031002, "epoch": 2.6113823382269223, "grad_norm": 0.1600816398859024, "learning_rate": 1.295734044836998e-05, "loss": 0.516, "mean_token_accuracy": 0.8305042199790478, "num_tokens": 905848159.0, "step": 28383 }, { "entropy": 0.4901947192847729, "epoch": 2.6114743445983635, "grad_norm": 0.16048192977905273, "learning_rate": 1.2954273622228358e-05, "loss": 0.4792, "mean_token_accuracy": 0.8430610299110413, "num_tokens": 905880217.0, "step": 28384 }, { "entropy": 0.4864494316279888, "epoch": 2.6115663509698046, "grad_norm": 0.15533064305782318, "learning_rate": 1.2951206796086731e-05, "loss": 0.4725, "mean_token_accuracy": 0.8485313914716244, "num_tokens": 905912702.0, "step": 28385 }, { "entropy": 0.504498478025198, "epoch": 2.6116583573412457, "grad_norm": 0.16060665249824524, "learning_rate": 1.2948139969945106e-05, "loss": 0.4997, "mean_token_accuracy": 0.8374770320951939, "num_tokens": 905945195.0, "step": 28386 }, { "entropy": 0.5254383044084534, "epoch": 2.6117503637126873, "grad_norm": 0.1577567458152771, "learning_rate": 1.2945073143803479e-05, "loss": 0.5215, "mean_token_accuracy": 0.8364589735865593, "num_tokens": 905977133.0, "step": 28387 }, { "entropy": 0.5506015210412443, "epoch": 2.6118423700841285, "grad_norm": 0.16985046863555908, "learning_rate": 1.2942006317661854e-05, "loss": 0.5439, "mean_token_accuracy": 0.8350461907684803, "num_tokens": 906009012.0, "step": 28388 }, { "entropy": 0.4494668892584741, "epoch": 2.6119343764555696, "grad_norm": 0.14876632392406464, "learning_rate": 1.2938939491520227e-05, "loss": 0.4338, "mean_token_accuracy": 0.8614015243947506, "num_tokens": 906040549.0, "step": 28389 }, { "entropy": 0.436582894064486, "epoch": 2.6120263828270107, "grad_norm": 0.14660252630710602, "learning_rate": 1.2935872665378601e-05, "loss": 0.431, "mean_token_accuracy": 0.8657973445951939, "num_tokens": 906072774.0, "step": 28390 }, { "entropy": 0.5749768873210996, "epoch": 2.612118389198452, "grad_norm": 0.16928085684776306, "learning_rate": 1.2932805839236974e-05, "loss": 0.5569, "mean_token_accuracy": 0.8247369416058064, "num_tokens": 906104458.0, "step": 28391 }, { "entropy": 0.5502224704250693, "epoch": 2.6122103955698934, "grad_norm": 0.16417285799980164, "learning_rate": 1.2929739013095349e-05, "loss": 0.5448, "mean_token_accuracy": 0.8284425772726536, "num_tokens": 906136293.0, "step": 28392 }, { "entropy": 0.6164088556542993, "epoch": 2.6123024019413346, "grad_norm": 0.17010629177093506, "learning_rate": 1.2926672186953723e-05, "loss": 0.6058, "mean_token_accuracy": 0.809988472610712, "num_tokens": 906168358.0, "step": 28393 }, { "entropy": 0.5851517580449581, "epoch": 2.6123944083127757, "grad_norm": 0.16688279807567596, "learning_rate": 1.2923605360812096e-05, "loss": 0.5644, "mean_token_accuracy": 0.8209769800305367, "num_tokens": 906199780.0, "step": 28394 }, { "entropy": 0.5865766904316843, "epoch": 2.612486414684217, "grad_norm": 0.16549886763095856, "learning_rate": 1.2920538534670471e-05, "loss": 0.5746, "mean_token_accuracy": 0.8189774416387081, "num_tokens": 906230930.0, "step": 28395 }, { "entropy": 0.4475047034211457, "epoch": 2.612578421055658, "grad_norm": 0.14966677129268646, "learning_rate": 1.2917471708528844e-05, "loss": 0.4336, "mean_token_accuracy": 0.8587244562804699, "num_tokens": 906262580.0, "step": 28396 }, { "entropy": 0.5353839974850416, "epoch": 2.6126704274270995, "grad_norm": 0.16502976417541504, "learning_rate": 1.2914404882387219e-05, "loss": 0.5326, "mean_token_accuracy": 0.8314050994813442, "num_tokens": 906294313.0, "step": 28397 }, { "entropy": 0.5237410767003894, "epoch": 2.6127624337985407, "grad_norm": 0.15732704102993011, "learning_rate": 1.2911338056245592e-05, "loss": 0.497, "mean_token_accuracy": 0.8385354094207287, "num_tokens": 906326821.0, "step": 28398 }, { "entropy": 0.5319394934922457, "epoch": 2.612854440169982, "grad_norm": 0.1623082011938095, "learning_rate": 1.2908271230103966e-05, "loss": 0.5253, "mean_token_accuracy": 0.8306932859122753, "num_tokens": 906358981.0, "step": 28399 }, { "entropy": 0.5501943994313478, "epoch": 2.612946446541423, "grad_norm": 0.1658920794725418, "learning_rate": 1.290520440396234e-05, "loss": 0.533, "mean_token_accuracy": 0.8310543037950993, "num_tokens": 906390365.0, "step": 28400 }, { "entropy": 0.5399463837966323, "epoch": 2.613038452912864, "grad_norm": 0.16711640357971191, "learning_rate": 1.2902137577820714e-05, "loss": 0.533, "mean_token_accuracy": 0.829064279794693, "num_tokens": 906422524.0, "step": 28401 }, { "entropy": 0.4728966448456049, "epoch": 2.6131304592843057, "grad_norm": 0.1559445559978485, "learning_rate": 1.2899070751679087e-05, "loss": 0.4637, "mean_token_accuracy": 0.8551277816295624, "num_tokens": 906454790.0, "step": 28402 }, { "entropy": 0.43484435556456447, "epoch": 2.613222465655747, "grad_norm": 0.15371328592300415, "learning_rate": 1.2896003925537461e-05, "loss": 0.4283, "mean_token_accuracy": 0.8659226410090923, "num_tokens": 906487151.0, "step": 28403 }, { "entropy": 0.4842186700552702, "epoch": 2.613314472027188, "grad_norm": 0.15425963699817657, "learning_rate": 1.2892937099395836e-05, "loss": 0.478, "mean_token_accuracy": 0.8467161245644093, "num_tokens": 906519029.0, "step": 28404 }, { "entropy": 0.5729449857026339, "epoch": 2.613406478398629, "grad_norm": 0.15991947054862976, "learning_rate": 1.2889870273254209e-05, "loss": 0.542, "mean_token_accuracy": 0.8307716548442841, "num_tokens": 906551586.0, "step": 28405 }, { "entropy": 0.49834209866821766, "epoch": 2.61349848477007, "grad_norm": 0.16002613306045532, "learning_rate": 1.2886803447112584e-05, "loss": 0.4889, "mean_token_accuracy": 0.8442013747990131, "num_tokens": 906582783.0, "step": 28406 }, { "entropy": 0.5567482211627066, "epoch": 2.6135904911415118, "grad_norm": 0.16171160340309143, "learning_rate": 1.2883736620970957e-05, "loss": 0.5448, "mean_token_accuracy": 0.8256620950996876, "num_tokens": 906614935.0, "step": 28407 }, { "entropy": 0.47619082941673696, "epoch": 2.613682497512953, "grad_norm": 0.14954189956188202, "learning_rate": 1.2880669794829331e-05, "loss": 0.4648, "mean_token_accuracy": 0.8513820059597492, "num_tokens": 906647472.0, "step": 28408 }, { "entropy": 0.5053963495884091, "epoch": 2.613774503884394, "grad_norm": 0.15807569026947021, "learning_rate": 1.2877602968687704e-05, "loss": 0.496, "mean_token_accuracy": 0.8442303463816643, "num_tokens": 906678842.0, "step": 28409 }, { "entropy": 0.500546651892364, "epoch": 2.613866510255835, "grad_norm": 0.1568690687417984, "learning_rate": 1.2874536142546079e-05, "loss": 0.4915, "mean_token_accuracy": 0.8433375470340252, "num_tokens": 906710844.0, "step": 28410 }, { "entropy": 0.4633509134873748, "epoch": 2.6139585166272763, "grad_norm": 0.14797885715961456, "learning_rate": 1.2871469316404452e-05, "loss": 0.4499, "mean_token_accuracy": 0.8583218529820442, "num_tokens": 906743576.0, "step": 28411 }, { "entropy": 0.44704198942054063, "epoch": 2.614050522998718, "grad_norm": 0.14615003764629364, "learning_rate": 1.2868402490262827e-05, "loss": 0.4203, "mean_token_accuracy": 0.8623773753643036, "num_tokens": 906775133.0, "step": 28412 }, { "entropy": 0.46132844872772694, "epoch": 2.614142529370159, "grad_norm": 0.1512235701084137, "learning_rate": 1.28653356641212e-05, "loss": 0.4433, "mean_token_accuracy": 0.8579444140195847, "num_tokens": 906807311.0, "step": 28413 }, { "entropy": 0.4887592336162925, "epoch": 2.6142345357416, "grad_norm": 0.15811842679977417, "learning_rate": 1.2862268837979578e-05, "loss": 0.4774, "mean_token_accuracy": 0.8474787101149559, "num_tokens": 906838835.0, "step": 28414 }, { "entropy": 0.46245009219273925, "epoch": 2.6143265421130413, "grad_norm": 0.1515703797340393, "learning_rate": 1.285920201183795e-05, "loss": 0.4416, "mean_token_accuracy": 0.8599442131817341, "num_tokens": 906870572.0, "step": 28415 }, { "entropy": 0.5012618713080883, "epoch": 2.6144185484844824, "grad_norm": 0.16449959576129913, "learning_rate": 1.2856135185696325e-05, "loss": 0.496, "mean_token_accuracy": 0.8398482464253902, "num_tokens": 906902703.0, "step": 28416 }, { "entropy": 0.5157023975625634, "epoch": 2.614510554855924, "grad_norm": 0.15683375298976898, "learning_rate": 1.2853068359554698e-05, "loss": 0.5089, "mean_token_accuracy": 0.8415536917746067, "num_tokens": 906935212.0, "step": 28417 }, { "entropy": 0.49589983001351357, "epoch": 2.614602561227365, "grad_norm": 0.15687665343284607, "learning_rate": 1.2850001533413073e-05, "loss": 0.4787, "mean_token_accuracy": 0.8488186523318291, "num_tokens": 906966929.0, "step": 28418 }, { "entropy": 0.48341296426951885, "epoch": 2.6146945675988063, "grad_norm": 0.15189354121685028, "learning_rate": 1.2846934707271446e-05, "loss": 0.4718, "mean_token_accuracy": 0.8491763211786747, "num_tokens": 906998950.0, "step": 28419 }, { "entropy": 0.5115440357476473, "epoch": 2.6147865739702474, "grad_norm": 0.1626502275466919, "learning_rate": 1.284386788112982e-05, "loss": 0.4982, "mean_token_accuracy": 0.8405604623258114, "num_tokens": 907030060.0, "step": 28420 }, { "entropy": 0.49542979476973414, "epoch": 2.6148785803416885, "grad_norm": 0.16216541826725006, "learning_rate": 1.2840801054988193e-05, "loss": 0.485, "mean_token_accuracy": 0.8488692343235016, "num_tokens": 907062342.0, "step": 28421 }, { "entropy": 0.5223367316648364, "epoch": 2.61497058671313, "grad_norm": 0.15909169614315033, "learning_rate": 1.2837734228846568e-05, "loss": 0.5161, "mean_token_accuracy": 0.8400824405252934, "num_tokens": 907093655.0, "step": 28422 }, { "entropy": 0.4810067377984524, "epoch": 2.6150625930845712, "grad_norm": 0.1540018916130066, "learning_rate": 1.2834667402704943e-05, "loss": 0.4651, "mean_token_accuracy": 0.8500803038477898, "num_tokens": 907125301.0, "step": 28423 }, { "entropy": 0.5024853395298123, "epoch": 2.6151545994560124, "grad_norm": 0.15908902883529663, "learning_rate": 1.2831600576563316e-05, "loss": 0.4996, "mean_token_accuracy": 0.8425003550946712, "num_tokens": 907157674.0, "step": 28424 }, { "entropy": 0.49803860671818256, "epoch": 2.6152466058274535, "grad_norm": 0.15546174347400665, "learning_rate": 1.282853375042169e-05, "loss": 0.4855, "mean_token_accuracy": 0.8431130908429623, "num_tokens": 907189309.0, "step": 28425 }, { "entropy": 0.5554602444171906, "epoch": 2.6153386121988946, "grad_norm": 0.16560494899749756, "learning_rate": 1.2825466924280063e-05, "loss": 0.5309, "mean_token_accuracy": 0.8296909593045712, "num_tokens": 907220802.0, "step": 28426 }, { "entropy": 0.4486215626820922, "epoch": 2.615430618570336, "grad_norm": 0.15424714982509613, "learning_rate": 1.2822400098138438e-05, "loss": 0.442, "mean_token_accuracy": 0.8586292751133442, "num_tokens": 907253159.0, "step": 28427 }, { "entropy": 0.5954408594407141, "epoch": 2.6155226249417773, "grad_norm": 0.17455174028873444, "learning_rate": 1.281933327199681e-05, "loss": 0.5916, "mean_token_accuracy": 0.812520831823349, "num_tokens": 907284712.0, "step": 28428 }, { "entropy": 0.4724067132920027, "epoch": 2.6156146313132185, "grad_norm": 0.15753591060638428, "learning_rate": 1.2816266445855185e-05, "loss": 0.4656, "mean_token_accuracy": 0.851701233536005, "num_tokens": 907316987.0, "step": 28429 }, { "entropy": 0.47951302770525217, "epoch": 2.6157066376846596, "grad_norm": 0.1570725440979004, "learning_rate": 1.2813199619713558e-05, "loss": 0.4743, "mean_token_accuracy": 0.8493788056075573, "num_tokens": 907349004.0, "step": 28430 }, { "entropy": 0.6451071090996265, "epoch": 2.6157986440561007, "grad_norm": 0.17924527823925018, "learning_rate": 1.2810132793571933e-05, "loss": 0.6296, "mean_token_accuracy": 0.8062796853482723, "num_tokens": 907379898.0, "step": 28431 }, { "entropy": 0.5338063463568687, "epoch": 2.6158906504275423, "grad_norm": 0.16097848117351532, "learning_rate": 1.2807065967430306e-05, "loss": 0.5347, "mean_token_accuracy": 0.83221635222435, "num_tokens": 907412007.0, "step": 28432 }, { "entropy": 0.5264148423448205, "epoch": 2.6159826567989835, "grad_norm": 0.16407915949821472, "learning_rate": 1.280399914128868e-05, "loss": 0.5213, "mean_token_accuracy": 0.8373141400516033, "num_tokens": 907443236.0, "step": 28433 }, { "entropy": 0.41364247631281614, "epoch": 2.6160746631704246, "grad_norm": 0.14656567573547363, "learning_rate": 1.2800932315147055e-05, "loss": 0.4035, "mean_token_accuracy": 0.8709007129073143, "num_tokens": 907475420.0, "step": 28434 }, { "entropy": 0.5258886618539691, "epoch": 2.6161666695418657, "grad_norm": 0.16052483022212982, "learning_rate": 1.2797865489005428e-05, "loss": 0.5115, "mean_token_accuracy": 0.8382388837635517, "num_tokens": 907508188.0, "step": 28435 }, { "entropy": 0.4918973036110401, "epoch": 2.616258675913307, "grad_norm": 0.15632718801498413, "learning_rate": 1.2794798662863803e-05, "loss": 0.4753, "mean_token_accuracy": 0.8500227630138397, "num_tokens": 907540203.0, "step": 28436 }, { "entropy": 0.5370103530585766, "epoch": 2.6163506822847484, "grad_norm": 0.16664482653141022, "learning_rate": 1.2791731836722176e-05, "loss": 0.5138, "mean_token_accuracy": 0.839014895260334, "num_tokens": 907571209.0, "step": 28437 }, { "entropy": 0.5033542960882187, "epoch": 2.6164426886561896, "grad_norm": 0.16290391981601715, "learning_rate": 1.278866501058055e-05, "loss": 0.4887, "mean_token_accuracy": 0.8476892188191414, "num_tokens": 907602556.0, "step": 28438 }, { "entropy": 0.48884293297305703, "epoch": 2.6165346950276307, "grad_norm": 0.15996211767196655, "learning_rate": 1.2785598184438923e-05, "loss": 0.4853, "mean_token_accuracy": 0.8453663438558578, "num_tokens": 907634288.0, "step": 28439 }, { "entropy": 0.4135146589251235, "epoch": 2.616626701399072, "grad_norm": 0.14101813733577728, "learning_rate": 1.2782531358297298e-05, "loss": 0.4099, "mean_token_accuracy": 0.8733113780617714, "num_tokens": 907665419.0, "step": 28440 }, { "entropy": 0.4985527840908617, "epoch": 2.616718707770513, "grad_norm": 0.15886470675468445, "learning_rate": 1.2779464532155671e-05, "loss": 0.4946, "mean_token_accuracy": 0.8455152288079262, "num_tokens": 907697563.0, "step": 28441 }, { "entropy": 0.5607749689370394, "epoch": 2.6168107141419545, "grad_norm": 0.16200730204582214, "learning_rate": 1.2776397706014046e-05, "loss": 0.5431, "mean_token_accuracy": 0.8284430876374245, "num_tokens": 907729385.0, "step": 28442 }, { "entropy": 0.5021861912682652, "epoch": 2.6169027205133957, "grad_norm": 0.15785303711891174, "learning_rate": 1.2773330879872419e-05, "loss": 0.4863, "mean_token_accuracy": 0.8454691357910633, "num_tokens": 907760286.0, "step": 28443 }, { "entropy": 0.5360706835053861, "epoch": 2.616994726884837, "grad_norm": 0.1592334657907486, "learning_rate": 1.2770264053730793e-05, "loss": 0.5275, "mean_token_accuracy": 0.8317881859838963, "num_tokens": 907792540.0, "step": 28444 }, { "entropy": 0.5118840970098972, "epoch": 2.617086733256278, "grad_norm": 0.16009996831417084, "learning_rate": 1.276719722758917e-05, "loss": 0.5026, "mean_token_accuracy": 0.8422753624618053, "num_tokens": 907824346.0, "step": 28445 }, { "entropy": 0.6588235311210155, "epoch": 2.617178739627719, "grad_norm": 0.17193010449409485, "learning_rate": 1.2764130401447544e-05, "loss": 0.6413, "mean_token_accuracy": 0.8020341359078884, "num_tokens": 907856745.0, "step": 28446 }, { "entropy": 0.45205259323120117, "epoch": 2.6172707459991607, "grad_norm": 0.15321390330791473, "learning_rate": 1.2761063575305917e-05, "loss": 0.4419, "mean_token_accuracy": 0.8590777665376663, "num_tokens": 907889136.0, "step": 28447 }, { "entropy": 0.42336865002289414, "epoch": 2.617362752370602, "grad_norm": 0.14363306760787964, "learning_rate": 1.2757996749164292e-05, "loss": 0.4128, "mean_token_accuracy": 0.8683639019727707, "num_tokens": 907921172.0, "step": 28448 }, { "entropy": 0.5566326575353742, "epoch": 2.617454758742043, "grad_norm": 0.16328108310699463, "learning_rate": 1.2754929923022665e-05, "loss": 0.5386, "mean_token_accuracy": 0.82868792116642, "num_tokens": 907952799.0, "step": 28449 }, { "entropy": 0.6068343855440617, "epoch": 2.617546765113484, "grad_norm": 0.16864800453186035, "learning_rate": 1.275186309688104e-05, "loss": 0.593, "mean_token_accuracy": 0.8140186779201031, "num_tokens": 907985167.0, "step": 28450 }, { "entropy": 0.5557889677584171, "epoch": 2.617638771484925, "grad_norm": 0.16484126448631287, "learning_rate": 1.2748796270739412e-05, "loss": 0.5439, "mean_token_accuracy": 0.8275740146636963, "num_tokens": 908017102.0, "step": 28451 }, { "entropy": 0.5070758489891887, "epoch": 2.6177307778563668, "grad_norm": 0.16289915144443512, "learning_rate": 1.2745729444597787e-05, "loss": 0.5026, "mean_token_accuracy": 0.8434283509850502, "num_tokens": 908049151.0, "step": 28452 }, { "entropy": 0.5777725242078304, "epoch": 2.617822784227808, "grad_norm": 0.1661575883626938, "learning_rate": 1.2742662618456162e-05, "loss": 0.5707, "mean_token_accuracy": 0.8190091513097286, "num_tokens": 908081368.0, "step": 28453 }, { "entropy": 0.48892054753378034, "epoch": 2.617914790599249, "grad_norm": 0.15345042943954468, "learning_rate": 1.2739595792314535e-05, "loss": 0.4796, "mean_token_accuracy": 0.8483445309102535, "num_tokens": 908114028.0, "step": 28454 }, { "entropy": 0.5136599512770772, "epoch": 2.61800679697069, "grad_norm": 0.16322869062423706, "learning_rate": 1.273652896617291e-05, "loss": 0.5012, "mean_token_accuracy": 0.8400295116007328, "num_tokens": 908146000.0, "step": 28455 }, { "entropy": 0.4791378388181329, "epoch": 2.6180988033421313, "grad_norm": 0.15779080986976624, "learning_rate": 1.2733462140031282e-05, "loss": 0.4751, "mean_token_accuracy": 0.8508458696305752, "num_tokens": 908177736.0, "step": 28456 }, { "entropy": 0.5632055713795125, "epoch": 2.618190809713573, "grad_norm": 0.1633732169866562, "learning_rate": 1.2730395313889657e-05, "loss": 0.5552, "mean_token_accuracy": 0.8246521055698395, "num_tokens": 908209839.0, "step": 28457 }, { "entropy": 0.38095034926664084, "epoch": 2.618282816085014, "grad_norm": 0.14072102308273315, "learning_rate": 1.272732848774803e-05, "loss": 0.3692, "mean_token_accuracy": 0.8807026296854019, "num_tokens": 908242413.0, "step": 28458 }, { "entropy": 0.498297048965469, "epoch": 2.618374822456455, "grad_norm": 0.15376953780651093, "learning_rate": 1.2724261661606404e-05, "loss": 0.4809, "mean_token_accuracy": 0.8489378243684769, "num_tokens": 908274903.0, "step": 28459 }, { "entropy": 0.3838048311881721, "epoch": 2.6184668288278963, "grad_norm": 0.13801896572113037, "learning_rate": 1.2721194835464777e-05, "loss": 0.3648, "mean_token_accuracy": 0.8794453218579292, "num_tokens": 908306599.0, "step": 28460 }, { "entropy": 0.5244917031377554, "epoch": 2.6185588351993374, "grad_norm": 0.16318616271018982, "learning_rate": 1.2718128009323152e-05, "loss": 0.5147, "mean_token_accuracy": 0.8366780616343021, "num_tokens": 908337787.0, "step": 28461 }, { "entropy": 0.5346933221444488, "epoch": 2.618650841570779, "grad_norm": 0.16216933727264404, "learning_rate": 1.2715061183181525e-05, "loss": 0.5255, "mean_token_accuracy": 0.8331102691590786, "num_tokens": 908369789.0, "step": 28462 }, { "entropy": 0.482264406979084, "epoch": 2.61874284794222, "grad_norm": 0.15435141324996948, "learning_rate": 1.27119943570399e-05, "loss": 0.4684, "mean_token_accuracy": 0.8480692058801651, "num_tokens": 908401869.0, "step": 28463 }, { "entropy": 0.47835629142355174, "epoch": 2.6188348543136613, "grad_norm": 0.1558331847190857, "learning_rate": 1.2708927530898274e-05, "loss": 0.4699, "mean_token_accuracy": 0.848251648247242, "num_tokens": 908434019.0, "step": 28464 }, { "entropy": 0.42468306282535195, "epoch": 2.6189268606851024, "grad_norm": 0.14721408486366272, "learning_rate": 1.2705860704756647e-05, "loss": 0.4151, "mean_token_accuracy": 0.8668523021042347, "num_tokens": 908466415.0, "step": 28465 }, { "entropy": 0.49472368881106377, "epoch": 2.6190188670565435, "grad_norm": 0.1566745638847351, "learning_rate": 1.2702793878615022e-05, "loss": 0.4866, "mean_token_accuracy": 0.8430545069277287, "num_tokens": 908498360.0, "step": 28466 }, { "entropy": 0.5221660695970058, "epoch": 2.619110873427985, "grad_norm": 0.15889960527420044, "learning_rate": 1.2699727052473395e-05, "loss": 0.5185, "mean_token_accuracy": 0.8386930003762245, "num_tokens": 908530600.0, "step": 28467 }, { "entropy": 0.5127821303904057, "epoch": 2.6192028797994262, "grad_norm": 0.15742892026901245, "learning_rate": 1.269666022633177e-05, "loss": 0.4991, "mean_token_accuracy": 0.8411935642361641, "num_tokens": 908563311.0, "step": 28468 }, { "entropy": 0.5143163669854403, "epoch": 2.6192948861708674, "grad_norm": 0.15325585007667542, "learning_rate": 1.2693593400190142e-05, "loss": 0.5019, "mean_token_accuracy": 0.8418286740779877, "num_tokens": 908595232.0, "step": 28469 }, { "entropy": 0.5345236957073212, "epoch": 2.6193868925423085, "grad_norm": 0.16296404600143433, "learning_rate": 1.2690526574048517e-05, "loss": 0.5241, "mean_token_accuracy": 0.834111500531435, "num_tokens": 908626737.0, "step": 28470 }, { "entropy": 0.4779608938843012, "epoch": 2.6194788989137496, "grad_norm": 0.15375496447086334, "learning_rate": 1.268745974790689e-05, "loss": 0.4664, "mean_token_accuracy": 0.8513433448970318, "num_tokens": 908659463.0, "step": 28471 }, { "entropy": 0.5440509393811226, "epoch": 2.619570905285191, "grad_norm": 0.16337433457374573, "learning_rate": 1.2684392921765265e-05, "loss": 0.5273, "mean_token_accuracy": 0.8320069797337055, "num_tokens": 908690743.0, "step": 28472 }, { "entropy": 0.5408680494874716, "epoch": 2.6196629116566323, "grad_norm": 0.16085512936115265, "learning_rate": 1.2681326095623638e-05, "loss": 0.5359, "mean_token_accuracy": 0.8369738571345806, "num_tokens": 908722759.0, "step": 28473 }, { "entropy": 0.5228444319218397, "epoch": 2.6197549180280735, "grad_norm": 0.16351266205310822, "learning_rate": 1.2678259269482012e-05, "loss": 0.5227, "mean_token_accuracy": 0.8354945294559002, "num_tokens": 908754798.0, "step": 28474 }, { "entropy": 0.5711441356688738, "epoch": 2.6198469243995146, "grad_norm": 0.1688336879014969, "learning_rate": 1.2675192443340389e-05, "loss": 0.5551, "mean_token_accuracy": 0.8212306275963783, "num_tokens": 908786437.0, "step": 28475 }, { "entropy": 0.524002205580473, "epoch": 2.6199389307709557, "grad_norm": 0.15644104778766632, "learning_rate": 1.2672125617198763e-05, "loss": 0.5044, "mean_token_accuracy": 0.8397137448191643, "num_tokens": 908818304.0, "step": 28476 }, { "entropy": 0.5047356188297272, "epoch": 2.6200309371423973, "grad_norm": 0.16436022520065308, "learning_rate": 1.2669058791057136e-05, "loss": 0.4883, "mean_token_accuracy": 0.8462070412933826, "num_tokens": 908849751.0, "step": 28477 }, { "entropy": 0.5387488435953856, "epoch": 2.6201229435138385, "grad_norm": 0.1655491292476654, "learning_rate": 1.2665991964915511e-05, "loss": 0.5288, "mean_token_accuracy": 0.8303409032523632, "num_tokens": 908881943.0, "step": 28478 }, { "entropy": 0.5604548715054989, "epoch": 2.6202149498852796, "grad_norm": 0.1673886924982071, "learning_rate": 1.2662925138773884e-05, "loss": 0.5469, "mean_token_accuracy": 0.830522958189249, "num_tokens": 908912874.0, "step": 28479 }, { "entropy": 0.5543185919523239, "epoch": 2.6203069562567207, "grad_norm": 0.16283747553825378, "learning_rate": 1.2659858312632259e-05, "loss": 0.5411, "mean_token_accuracy": 0.8297442831099033, "num_tokens": 908945130.0, "step": 28480 }, { "entropy": 0.4837535433471203, "epoch": 2.620398962628162, "grad_norm": 0.150950625538826, "learning_rate": 1.2656791486490631e-05, "loss": 0.472, "mean_token_accuracy": 0.8494665399193764, "num_tokens": 908977794.0, "step": 28481 }, { "entropy": 0.4738158513791859, "epoch": 2.6204909689996034, "grad_norm": 0.15606895089149475, "learning_rate": 1.2653724660349006e-05, "loss": 0.4722, "mean_token_accuracy": 0.8520720712840557, "num_tokens": 909010253.0, "step": 28482 }, { "entropy": 0.49421994574368, "epoch": 2.6205829753710446, "grad_norm": 0.1562282294034958, "learning_rate": 1.265065783420738e-05, "loss": 0.486, "mean_token_accuracy": 0.8459124341607094, "num_tokens": 909042750.0, "step": 28483 }, { "entropy": 0.5929732173681259, "epoch": 2.6206749817424857, "grad_norm": 0.17257288098335266, "learning_rate": 1.2647591008065754e-05, "loss": 0.5779, "mean_token_accuracy": 0.817989245057106, "num_tokens": 909074465.0, "step": 28484 }, { "entropy": 0.5664968844503164, "epoch": 2.620766988113927, "grad_norm": 0.16820858418941498, "learning_rate": 1.2644524181924128e-05, "loss": 0.5566, "mean_token_accuracy": 0.8242388479411602, "num_tokens": 909106422.0, "step": 28485 }, { "entropy": 0.5690034702420235, "epoch": 2.620858994485368, "grad_norm": 0.1657455712556839, "learning_rate": 1.2641457355782501e-05, "loss": 0.5662, "mean_token_accuracy": 0.8257196843624115, "num_tokens": 909138261.0, "step": 28486 }, { "entropy": 0.4818933103233576, "epoch": 2.6209510008568095, "grad_norm": 0.15625199675559998, "learning_rate": 1.2638390529640876e-05, "loss": 0.4708, "mean_token_accuracy": 0.8512884043157101, "num_tokens": 909170663.0, "step": 28487 }, { "entropy": 0.5068693542852998, "epoch": 2.6210430072282507, "grad_norm": 0.15528902411460876, "learning_rate": 1.2635323703499249e-05, "loss": 0.4849, "mean_token_accuracy": 0.8405085690319538, "num_tokens": 909202720.0, "step": 28488 }, { "entropy": 0.4948064526543021, "epoch": 2.621135013599692, "grad_norm": 0.1528751403093338, "learning_rate": 1.2632256877357624e-05, "loss": 0.4796, "mean_token_accuracy": 0.8479301668703556, "num_tokens": 909235473.0, "step": 28489 }, { "entropy": 0.3873220491223037, "epoch": 2.621227019971133, "grad_norm": 0.14144539833068848, "learning_rate": 1.2629190051215997e-05, "loss": 0.3775, "mean_token_accuracy": 0.8792976886034012, "num_tokens": 909267956.0, "step": 28490 }, { "entropy": 0.5360137457028031, "epoch": 2.621319026342574, "grad_norm": 0.16267043352127075, "learning_rate": 1.2626123225074371e-05, "loss": 0.5276, "mean_token_accuracy": 0.8304232880473137, "num_tokens": 909299523.0, "step": 28491 }, { "entropy": 0.5213509043678641, "epoch": 2.6214110327140157, "grad_norm": 0.15897294878959656, "learning_rate": 1.2623056398932744e-05, "loss": 0.5042, "mean_token_accuracy": 0.8385782688856125, "num_tokens": 909331035.0, "step": 28492 }, { "entropy": 0.6062155552208424, "epoch": 2.621503039085457, "grad_norm": 0.17889709770679474, "learning_rate": 1.2619989572791119e-05, "loss": 0.6088, "mean_token_accuracy": 0.8101099990308285, "num_tokens": 909362576.0, "step": 28493 }, { "entropy": 0.4252196728484705, "epoch": 2.621595045456898, "grad_norm": 0.147322878241539, "learning_rate": 1.2616922746649493e-05, "loss": 0.42, "mean_token_accuracy": 0.8632954619824886, "num_tokens": 909394789.0, "step": 28494 }, { "entropy": 0.44485970865935087, "epoch": 2.621687051828339, "grad_norm": 0.14916880428791046, "learning_rate": 1.2613855920507866e-05, "loss": 0.4392, "mean_token_accuracy": 0.8628986924886703, "num_tokens": 909426681.0, "step": 28495 }, { "entropy": 0.5007022339850664, "epoch": 2.62177905819978, "grad_norm": 0.15526622533798218, "learning_rate": 1.2610789094366241e-05, "loss": 0.4933, "mean_token_accuracy": 0.8436300083994865, "num_tokens": 909458679.0, "step": 28496 }, { "entropy": 0.6268287152051926, "epoch": 2.6218710645712218, "grad_norm": 0.17665192484855652, "learning_rate": 1.2607722268224614e-05, "loss": 0.6182, "mean_token_accuracy": 0.8074675314128399, "num_tokens": 909490362.0, "step": 28497 }, { "entropy": 0.41092888195998967, "epoch": 2.621963070942663, "grad_norm": 0.14891405403614044, "learning_rate": 1.2604655442082989e-05, "loss": 0.3922, "mean_token_accuracy": 0.8730983957648277, "num_tokens": 909522170.0, "step": 28498 }, { "entropy": 0.5330140530131757, "epoch": 2.622055077314104, "grad_norm": 0.15926608443260193, "learning_rate": 1.2601588615941362e-05, "loss": 0.5202, "mean_token_accuracy": 0.8379279710352421, "num_tokens": 909554440.0, "step": 28499 }, { "entropy": 0.5314505696296692, "epoch": 2.622147083685545, "grad_norm": 0.16115252673625946, "learning_rate": 1.2598521789799736e-05, "loss": 0.5237, "mean_token_accuracy": 0.8341157548129559, "num_tokens": 909586804.0, "step": 28500 }, { "entropy": 0.5366870099678636, "epoch": 2.6222390900569863, "grad_norm": 0.1597682535648346, "learning_rate": 1.259545496365811e-05, "loss": 0.5197, "mean_token_accuracy": 0.8375460766255856, "num_tokens": 909619169.0, "step": 28501 }, { "entropy": 0.5617544185370207, "epoch": 2.622331096428428, "grad_norm": 0.16366322338581085, "learning_rate": 1.2592388137516484e-05, "loss": 0.5529, "mean_token_accuracy": 0.8261037692427635, "num_tokens": 909650981.0, "step": 28502 }, { "entropy": 0.5216597551479936, "epoch": 2.622423102799869, "grad_norm": 0.16000941395759583, "learning_rate": 1.2589321311374857e-05, "loss": 0.5184, "mean_token_accuracy": 0.835395734757185, "num_tokens": 909682493.0, "step": 28503 }, { "entropy": 0.4814471129793674, "epoch": 2.62251510917131, "grad_norm": 0.16095900535583496, "learning_rate": 1.2586254485233231e-05, "loss": 0.4743, "mean_token_accuracy": 0.8474032990634441, "num_tokens": 909713333.0, "step": 28504 }, { "entropy": 0.5617058463394642, "epoch": 2.6226071155427513, "grad_norm": 0.16708411276340485, "learning_rate": 1.2583187659091606e-05, "loss": 0.5474, "mean_token_accuracy": 0.8267879113554955, "num_tokens": 909745036.0, "step": 28505 }, { "entropy": 0.3730037701316178, "epoch": 2.6226991219141924, "grad_norm": 0.13812437653541565, "learning_rate": 1.2580120832949982e-05, "loss": 0.3527, "mean_token_accuracy": 0.8897558860480785, "num_tokens": 909777338.0, "step": 28506 }, { "entropy": 0.5804052408784628, "epoch": 2.622791128285634, "grad_norm": 0.17149604856967926, "learning_rate": 1.2577054006808355e-05, "loss": 0.5736, "mean_token_accuracy": 0.8216411471366882, "num_tokens": 909809228.0, "step": 28507 }, { "entropy": 0.5940721482038498, "epoch": 2.622883134657075, "grad_norm": 0.1713334172964096, "learning_rate": 1.257398718066673e-05, "loss": 0.5848, "mean_token_accuracy": 0.8168213032186031, "num_tokens": 909841432.0, "step": 28508 }, { "entropy": 0.46102297119796276, "epoch": 2.6229751410285163, "grad_norm": 0.1497265100479126, "learning_rate": 1.2570920354525103e-05, "loss": 0.4403, "mean_token_accuracy": 0.8599500507116318, "num_tokens": 909873495.0, "step": 28509 }, { "entropy": 0.5436926037073135, "epoch": 2.6230671473999574, "grad_norm": 0.1631515473127365, "learning_rate": 1.2567853528383478e-05, "loss": 0.5259, "mean_token_accuracy": 0.8337978422641754, "num_tokens": 909904753.0, "step": 28510 }, { "entropy": 0.5530586948152632, "epoch": 2.6231591537713985, "grad_norm": 0.16940023005008698, "learning_rate": 1.256478670224185e-05, "loss": 0.5535, "mean_token_accuracy": 0.8281528055667877, "num_tokens": 909936537.0, "step": 28511 }, { "entropy": 0.4494082210585475, "epoch": 2.62325116014284, "grad_norm": 0.1540544331073761, "learning_rate": 1.2561719876100225e-05, "loss": 0.4327, "mean_token_accuracy": 0.8594697788357735, "num_tokens": 909967720.0, "step": 28512 }, { "entropy": 0.47317842207849026, "epoch": 2.6233431665142812, "grad_norm": 0.15196582674980164, "learning_rate": 1.25586530499586e-05, "loss": 0.459, "mean_token_accuracy": 0.8547214232385159, "num_tokens": 909999763.0, "step": 28513 }, { "entropy": 0.45542778354138136, "epoch": 2.6234351728857224, "grad_norm": 0.15048037469387054, "learning_rate": 1.2555586223816973e-05, "loss": 0.4468, "mean_token_accuracy": 0.856327198445797, "num_tokens": 910031543.0, "step": 28514 }, { "entropy": 0.5694261705502868, "epoch": 2.6235271792571635, "grad_norm": 0.1678486317396164, "learning_rate": 1.2552519397675347e-05, "loss": 0.568, "mean_token_accuracy": 0.8234347701072693, "num_tokens": 910063513.0, "step": 28515 }, { "entropy": 0.499284902587533, "epoch": 2.6236191856286046, "grad_norm": 0.15782564878463745, "learning_rate": 1.254945257153372e-05, "loss": 0.4909, "mean_token_accuracy": 0.8450203947722912, "num_tokens": 910095970.0, "step": 28516 }, { "entropy": 0.5371801825240254, "epoch": 2.623711192000046, "grad_norm": 0.1604076623916626, "learning_rate": 1.2546385745392095e-05, "loss": 0.5158, "mean_token_accuracy": 0.8355583027005196, "num_tokens": 910127613.0, "step": 28517 }, { "entropy": 0.513969898223877, "epoch": 2.6238031983714873, "grad_norm": 0.16042852401733398, "learning_rate": 1.2543318919250468e-05, "loss": 0.5011, "mean_token_accuracy": 0.8431829139590263, "num_tokens": 910159491.0, "step": 28518 }, { "entropy": 0.55396209936589, "epoch": 2.6238952047429285, "grad_norm": 0.16199259459972382, "learning_rate": 1.2540252093108843e-05, "loss": 0.5361, "mean_token_accuracy": 0.8288876600563526, "num_tokens": 910191339.0, "step": 28519 }, { "entropy": 0.5131684388034046, "epoch": 2.6239872111143696, "grad_norm": 0.15849533677101135, "learning_rate": 1.2537185266967216e-05, "loss": 0.5021, "mean_token_accuracy": 0.8414049409329891, "num_tokens": 910223045.0, "step": 28520 }, { "entropy": 0.5176697261631489, "epoch": 2.6240792174858107, "grad_norm": 0.15737298130989075, "learning_rate": 1.253411844082559e-05, "loss": 0.5059, "mean_token_accuracy": 0.8413655571639538, "num_tokens": 910255436.0, "step": 28521 }, { "entropy": 0.6155740115791559, "epoch": 2.6241712238572523, "grad_norm": 0.17158713936805725, "learning_rate": 1.2531051614683963e-05, "loss": 0.616, "mean_token_accuracy": 0.8070162795484066, "num_tokens": 910287653.0, "step": 28522 }, { "entropy": 0.5141018580179662, "epoch": 2.6242632302286935, "grad_norm": 0.162644162774086, "learning_rate": 1.2527984788542338e-05, "loss": 0.5006, "mean_token_accuracy": 0.842426173388958, "num_tokens": 910319542.0, "step": 28523 }, { "entropy": 0.567445233464241, "epoch": 2.6243552366001346, "grad_norm": 0.164028599858284, "learning_rate": 1.2524917962400713e-05, "loss": 0.5529, "mean_token_accuracy": 0.8246996849775314, "num_tokens": 910351745.0, "step": 28524 }, { "entropy": 0.496801502071321, "epoch": 2.6244472429715757, "grad_norm": 0.15600475668907166, "learning_rate": 1.2521851136259085e-05, "loss": 0.4873, "mean_token_accuracy": 0.844851978123188, "num_tokens": 910383767.0, "step": 28525 }, { "entropy": 0.5084137581288815, "epoch": 2.624539249343017, "grad_norm": 0.16170063614845276, "learning_rate": 1.251878431011746e-05, "loss": 0.4982, "mean_token_accuracy": 0.8408761322498322, "num_tokens": 910414823.0, "step": 28526 }, { "entropy": 0.5111992815509439, "epoch": 2.6246312557144584, "grad_norm": 0.16149649024009705, "learning_rate": 1.2515717483975833e-05, "loss": 0.501, "mean_token_accuracy": 0.8425846174359322, "num_tokens": 910447132.0, "step": 28527 }, { "entropy": 0.5480661736801267, "epoch": 2.6247232620858996, "grad_norm": 0.1616198569536209, "learning_rate": 1.2512650657834208e-05, "loss": 0.525, "mean_token_accuracy": 0.8291350081562996, "num_tokens": 910479517.0, "step": 28528 }, { "entropy": 0.5186334270983934, "epoch": 2.6248152684573407, "grad_norm": 0.15554706752300262, "learning_rate": 1.250958383169258e-05, "loss": 0.5009, "mean_token_accuracy": 0.8424593545496464, "num_tokens": 910511275.0, "step": 28529 }, { "entropy": 0.5764536680653691, "epoch": 2.624907274828782, "grad_norm": 0.16977976262569427, "learning_rate": 1.2506517005550955e-05, "loss": 0.5649, "mean_token_accuracy": 0.8217010237276554, "num_tokens": 910543549.0, "step": 28530 }, { "entropy": 0.5186513913795352, "epoch": 2.624999281200223, "grad_norm": 0.1605854332447052, "learning_rate": 1.2503450179409328e-05, "loss": 0.5066, "mean_token_accuracy": 0.8414211869239807, "num_tokens": 910574898.0, "step": 28531 }, { "entropy": 0.5553284180350602, "epoch": 2.6250912875716645, "grad_norm": 0.16237714886665344, "learning_rate": 1.2500383353267703e-05, "loss": 0.5418, "mean_token_accuracy": 0.8299385234713554, "num_tokens": 910607450.0, "step": 28532 }, { "entropy": 0.4845200404524803, "epoch": 2.6251832939431057, "grad_norm": 0.15616071224212646, "learning_rate": 1.2497316527126078e-05, "loss": 0.4808, "mean_token_accuracy": 0.8481142073869705, "num_tokens": 910639326.0, "step": 28533 }, { "entropy": 0.5600051619112492, "epoch": 2.625275300314547, "grad_norm": 0.16279670596122742, "learning_rate": 1.2494249700984452e-05, "loss": 0.5479, "mean_token_accuracy": 0.8242406696081161, "num_tokens": 910671653.0, "step": 28534 }, { "entropy": 0.4894434022717178, "epoch": 2.625367306685988, "grad_norm": 0.156472846865654, "learning_rate": 1.2491182874842825e-05, "loss": 0.4813, "mean_token_accuracy": 0.8480213098227978, "num_tokens": 910704289.0, "step": 28535 }, { "entropy": 0.537836816161871, "epoch": 2.625459313057429, "grad_norm": 0.16133864223957062, "learning_rate": 1.24881160487012e-05, "loss": 0.5238, "mean_token_accuracy": 0.8319959416985512, "num_tokens": 910736100.0, "step": 28536 }, { "entropy": 0.5233118981122971, "epoch": 2.6255513194288707, "grad_norm": 0.16240036487579346, "learning_rate": 1.2485049222559573e-05, "loss": 0.5188, "mean_token_accuracy": 0.8362764231860638, "num_tokens": 910768429.0, "step": 28537 }, { "entropy": 0.4872579025104642, "epoch": 2.625643325800312, "grad_norm": 0.15521834790706635, "learning_rate": 1.2481982396417947e-05, "loss": 0.4779, "mean_token_accuracy": 0.8483130484819412, "num_tokens": 910800648.0, "step": 28538 }, { "entropy": 0.4909574221819639, "epoch": 2.625735332171753, "grad_norm": 0.1665601134300232, "learning_rate": 1.2478915570276322e-05, "loss": 0.4848, "mean_token_accuracy": 0.8451548032462597, "num_tokens": 910831711.0, "step": 28539 }, { "entropy": 0.45170272258110344, "epoch": 2.625827338543194, "grad_norm": 0.150875523686409, "learning_rate": 1.2475848744134695e-05, "loss": 0.4407, "mean_token_accuracy": 0.8609897829592228, "num_tokens": 910863821.0, "step": 28540 }, { "entropy": 0.5403865985572338, "epoch": 2.625919344914635, "grad_norm": 0.15916447341442108, "learning_rate": 1.247278191799307e-05, "loss": 0.5337, "mean_token_accuracy": 0.8330178260803223, "num_tokens": 910896589.0, "step": 28541 }, { "entropy": 0.5980436131358147, "epoch": 2.6260113512860768, "grad_norm": 0.16868269443511963, "learning_rate": 1.2469715091851443e-05, "loss": 0.5871, "mean_token_accuracy": 0.8150036633014679, "num_tokens": 910929357.0, "step": 28542 }, { "entropy": 0.5129138827323914, "epoch": 2.626103357657518, "grad_norm": 0.1567656546831131, "learning_rate": 1.2466648265709817e-05, "loss": 0.499, "mean_token_accuracy": 0.8407339565455914, "num_tokens": 910960886.0, "step": 28543 }, { "entropy": 0.5706590935587883, "epoch": 2.626195364028959, "grad_norm": 0.1746145784854889, "learning_rate": 1.2463581439568192e-05, "loss": 0.547, "mean_token_accuracy": 0.8289773017168045, "num_tokens": 910991300.0, "step": 28544 }, { "entropy": 0.4650898033287376, "epoch": 2.6262873704004, "grad_norm": 0.15345853567123413, "learning_rate": 1.2460514613426567e-05, "loss": 0.4569, "mean_token_accuracy": 0.8553797975182533, "num_tokens": 911023669.0, "step": 28545 }, { "entropy": 0.4541083090007305, "epoch": 2.6263793767718413, "grad_norm": 0.14705635607242584, "learning_rate": 1.245744778728494e-05, "loss": 0.4361, "mean_token_accuracy": 0.8600986450910568, "num_tokens": 911055451.0, "step": 28546 }, { "entropy": 0.4954109200043604, "epoch": 2.626471383143283, "grad_norm": 0.1577785164117813, "learning_rate": 1.2454380961143314e-05, "loss": 0.4742, "mean_token_accuracy": 0.8491893336176872, "num_tokens": 911087471.0, "step": 28547 }, { "entropy": 0.5003651399165392, "epoch": 2.626563389514724, "grad_norm": 0.1613709032535553, "learning_rate": 1.2451314135001687e-05, "loss": 0.4944, "mean_token_accuracy": 0.8443612642586231, "num_tokens": 911119660.0, "step": 28548 }, { "entropy": 0.5053484085947275, "epoch": 2.626655395886165, "grad_norm": 0.15981048345565796, "learning_rate": 1.2448247308860062e-05, "loss": 0.4861, "mean_token_accuracy": 0.8455283716320992, "num_tokens": 911151447.0, "step": 28549 }, { "entropy": 0.5855758637189865, "epoch": 2.6267474022576063, "grad_norm": 0.16911378502845764, "learning_rate": 1.2445180482718435e-05, "loss": 0.5707, "mean_token_accuracy": 0.8184811063110828, "num_tokens": 911183502.0, "step": 28550 }, { "entropy": 0.4718944523483515, "epoch": 2.6268394086290474, "grad_norm": 0.148982971906662, "learning_rate": 1.244211365657681e-05, "loss": 0.4579, "mean_token_accuracy": 0.8527277447283268, "num_tokens": 911215307.0, "step": 28551 }, { "entropy": 0.5139386653900146, "epoch": 2.626931415000489, "grad_norm": 0.16033627092838287, "learning_rate": 1.2439046830435182e-05, "loss": 0.4956, "mean_token_accuracy": 0.8422981798648834, "num_tokens": 911247303.0, "step": 28552 }, { "entropy": 0.6352408118546009, "epoch": 2.62702342137193, "grad_norm": 0.17630094289779663, "learning_rate": 1.2435980004293557e-05, "loss": 0.6265, "mean_token_accuracy": 0.8024583086371422, "num_tokens": 911279411.0, "step": 28553 }, { "entropy": 0.5294088255614042, "epoch": 2.6271154277433713, "grad_norm": 0.15857642889022827, "learning_rate": 1.2432913178151932e-05, "loss": 0.5201, "mean_token_accuracy": 0.8348797932267189, "num_tokens": 911311985.0, "step": 28554 }, { "entropy": 0.4637564830482006, "epoch": 2.6272074341148124, "grad_norm": 0.15329892933368683, "learning_rate": 1.2429846352010305e-05, "loss": 0.4528, "mean_token_accuracy": 0.8558578342199326, "num_tokens": 911344420.0, "step": 28555 }, { "entropy": 0.6116641452535987, "epoch": 2.6272994404862535, "grad_norm": 0.17414043843746185, "learning_rate": 1.242677952586868e-05, "loss": 0.6037, "mean_token_accuracy": 0.8109176903963089, "num_tokens": 911375303.0, "step": 28556 }, { "entropy": 0.6246916577219963, "epoch": 2.627391446857695, "grad_norm": 0.1716972142457962, "learning_rate": 1.2423712699727052e-05, "loss": 0.6069, "mean_token_accuracy": 0.8083512149751186, "num_tokens": 911407589.0, "step": 28557 }, { "entropy": 0.5644073477014899, "epoch": 2.6274834532291362, "grad_norm": 0.16585354506969452, "learning_rate": 1.2420645873585427e-05, "loss": 0.5573, "mean_token_accuracy": 0.8239283710718155, "num_tokens": 911439429.0, "step": 28558 }, { "entropy": 0.4956664964556694, "epoch": 2.6275754596005774, "grad_norm": 0.16180679202079773, "learning_rate": 1.2417579047443801e-05, "loss": 0.4905, "mean_token_accuracy": 0.8459570780396461, "num_tokens": 911471470.0, "step": 28559 }, { "entropy": 0.43547868449240923, "epoch": 2.6276674659720185, "grad_norm": 0.15112583339214325, "learning_rate": 1.2414512221302176e-05, "loss": 0.4214, "mean_token_accuracy": 0.8664674200117588, "num_tokens": 911503271.0, "step": 28560 }, { "entropy": 0.5239966185763478, "epoch": 2.6277594723434596, "grad_norm": 0.15615028142929077, "learning_rate": 1.2411445395160549e-05, "loss": 0.5028, "mean_token_accuracy": 0.8412287533283234, "num_tokens": 911535497.0, "step": 28561 }, { "entropy": 0.47705564415082335, "epoch": 2.627851478714901, "grad_norm": 0.15544342994689941, "learning_rate": 1.2408378569018924e-05, "loss": 0.4758, "mean_token_accuracy": 0.8476710170507431, "num_tokens": 911567715.0, "step": 28562 }, { "entropy": 0.4100033761933446, "epoch": 2.6279434850863423, "grad_norm": 0.14335478842258453, "learning_rate": 1.2405311742877297e-05, "loss": 0.4071, "mean_token_accuracy": 0.8694578483700752, "num_tokens": 911600168.0, "step": 28563 }, { "entropy": 0.4856917345896363, "epoch": 2.6280354914577835, "grad_norm": 0.1560276597738266, "learning_rate": 1.2402244916735671e-05, "loss": 0.4761, "mean_token_accuracy": 0.8456128053367138, "num_tokens": 911631947.0, "step": 28564 }, { "entropy": 0.47189877461642027, "epoch": 2.6281274978292246, "grad_norm": 0.15571415424346924, "learning_rate": 1.2399178090594044e-05, "loss": 0.4768, "mean_token_accuracy": 0.8497630022466183, "num_tokens": 911664076.0, "step": 28565 }, { "entropy": 0.5563971027731895, "epoch": 2.6282195042006657, "grad_norm": 0.1650611311197281, "learning_rate": 1.2396111264452419e-05, "loss": 0.5491, "mean_token_accuracy": 0.8276997767388821, "num_tokens": 911695103.0, "step": 28566 }, { "entropy": 0.5116386252921075, "epoch": 2.6283115105721073, "grad_norm": 0.1618286818265915, "learning_rate": 1.2393044438310792e-05, "loss": 0.5033, "mean_token_accuracy": 0.8366227559745312, "num_tokens": 911727102.0, "step": 28567 }, { "entropy": 0.4910493600182235, "epoch": 2.6284035169435485, "grad_norm": 0.1514262557029724, "learning_rate": 1.2389977612169167e-05, "loss": 0.4737, "mean_token_accuracy": 0.8486412614583969, "num_tokens": 911759106.0, "step": 28568 }, { "entropy": 0.4091968354769051, "epoch": 2.6284955233149896, "grad_norm": 0.14538267254829407, "learning_rate": 1.2386910786027541e-05, "loss": 0.3944, "mean_token_accuracy": 0.8718268647789955, "num_tokens": 911791312.0, "step": 28569 }, { "entropy": 0.536121972836554, "epoch": 2.6285875296864307, "grad_norm": 0.16432958841323853, "learning_rate": 1.2383843959885914e-05, "loss": 0.5245, "mean_token_accuracy": 0.8351909294724464, "num_tokens": 911823652.0, "step": 28570 }, { "entropy": 0.5049331216141582, "epoch": 2.628679536057872, "grad_norm": 0.15896442532539368, "learning_rate": 1.2380777133744289e-05, "loss": 0.4906, "mean_token_accuracy": 0.8424909710884094, "num_tokens": 911855600.0, "step": 28571 }, { "entropy": 0.4787717889994383, "epoch": 2.6287715424293134, "grad_norm": 0.1521003246307373, "learning_rate": 1.2377710307602662e-05, "loss": 0.466, "mean_token_accuracy": 0.8520636148750782, "num_tokens": 911887406.0, "step": 28572 }, { "entropy": 0.46929718274623156, "epoch": 2.6288635488007546, "grad_norm": 0.15671516954898834, "learning_rate": 1.2374643481461036e-05, "loss": 0.4608, "mean_token_accuracy": 0.853322971612215, "num_tokens": 911919739.0, "step": 28573 }, { "entropy": 0.5110970617970452, "epoch": 2.6289555551721957, "grad_norm": 0.16353271901607513, "learning_rate": 1.237157665531941e-05, "loss": 0.5031, "mean_token_accuracy": 0.8383074067533016, "num_tokens": 911951437.0, "step": 28574 }, { "entropy": 0.4601063234731555, "epoch": 2.629047561543637, "grad_norm": 0.14891265332698822, "learning_rate": 1.2368509829177786e-05, "loss": 0.4416, "mean_token_accuracy": 0.8587493225932121, "num_tokens": 911984135.0, "step": 28575 }, { "entropy": 0.5104622785001993, "epoch": 2.629139567915078, "grad_norm": 0.15701836347579956, "learning_rate": 1.2365443003036159e-05, "loss": 0.4928, "mean_token_accuracy": 0.8459290750324726, "num_tokens": 912015756.0, "step": 28576 }, { "entropy": 0.4538408201187849, "epoch": 2.6292315742865195, "grad_norm": 0.16003666818141937, "learning_rate": 1.2362376176894533e-05, "loss": 0.4545, "mean_token_accuracy": 0.8580581583082676, "num_tokens": 912047021.0, "step": 28577 }, { "entropy": 0.45707631204277277, "epoch": 2.6293235806579607, "grad_norm": 0.15060614049434662, "learning_rate": 1.2359309350752906e-05, "loss": 0.4382, "mean_token_accuracy": 0.8595397509634495, "num_tokens": 912078773.0, "step": 28578 }, { "entropy": 0.4524241331964731, "epoch": 2.629415587029402, "grad_norm": 0.15686911344528198, "learning_rate": 1.2356242524611281e-05, "loss": 0.4469, "mean_token_accuracy": 0.8569027073681355, "num_tokens": 912109482.0, "step": 28579 }, { "entropy": 0.4540207046084106, "epoch": 2.629507593400843, "grad_norm": 0.14522230625152588, "learning_rate": 1.2353175698469654e-05, "loss": 0.4434, "mean_token_accuracy": 0.8584813103079796, "num_tokens": 912141351.0, "step": 28580 }, { "entropy": 0.6053234441205859, "epoch": 2.629599599772284, "grad_norm": 0.17207637429237366, "learning_rate": 1.2350108872328028e-05, "loss": 0.6021, "mean_token_accuracy": 0.8123660422861576, "num_tokens": 912173307.0, "step": 28581 }, { "entropy": 0.5751323889708146, "epoch": 2.6296916061437257, "grad_norm": 0.16826951503753662, "learning_rate": 1.2347042046186401e-05, "loss": 0.573, "mean_token_accuracy": 0.8216591142117977, "num_tokens": 912205083.0, "step": 28582 }, { "entropy": 0.5375095382332802, "epoch": 2.629783612515167, "grad_norm": 0.15906129777431488, "learning_rate": 1.2343975220044776e-05, "loss": 0.5242, "mean_token_accuracy": 0.8377721160650253, "num_tokens": 912237564.0, "step": 28583 }, { "entropy": 0.4391329335048795, "epoch": 2.629875618886608, "grad_norm": 0.15186254680156708, "learning_rate": 1.234090839390315e-05, "loss": 0.4321, "mean_token_accuracy": 0.8609147556126118, "num_tokens": 912270109.0, "step": 28584 }, { "entropy": 0.4653241718187928, "epoch": 2.629967625258049, "grad_norm": 0.1556038111448288, "learning_rate": 1.2337841567761524e-05, "loss": 0.4481, "mean_token_accuracy": 0.8578742146492004, "num_tokens": 912301791.0, "step": 28585 }, { "entropy": 0.4352906006388366, "epoch": 2.63005963162949, "grad_norm": 0.14776505529880524, "learning_rate": 1.2334774741619898e-05, "loss": 0.4233, "mean_token_accuracy": 0.8656348437070847, "num_tokens": 912334213.0, "step": 28586 }, { "entropy": 0.46918365452438593, "epoch": 2.6301516380009318, "grad_norm": 0.15779194235801697, "learning_rate": 1.2331707915478271e-05, "loss": 0.4569, "mean_token_accuracy": 0.8526128940284252, "num_tokens": 912366305.0, "step": 28587 }, { "entropy": 0.4603905864059925, "epoch": 2.630243644372373, "grad_norm": 0.15165023505687714, "learning_rate": 1.2328641089336646e-05, "loss": 0.4555, "mean_token_accuracy": 0.8555167131125927, "num_tokens": 912398763.0, "step": 28588 }, { "entropy": 0.4277596287429333, "epoch": 2.630335650743814, "grad_norm": 0.14655253291130066, "learning_rate": 1.2325574263195019e-05, "loss": 0.4245, "mean_token_accuracy": 0.862170085310936, "num_tokens": 912430958.0, "step": 28589 }, { "entropy": 0.4322954537346959, "epoch": 2.630427657115255, "grad_norm": 0.15128499269485474, "learning_rate": 1.2322507437053395e-05, "loss": 0.4131, "mean_token_accuracy": 0.8687357343733311, "num_tokens": 912461954.0, "step": 28590 }, { "entropy": 0.506429186090827, "epoch": 2.6305196634866963, "grad_norm": 0.1584501713514328, "learning_rate": 1.2319440610911768e-05, "loss": 0.4994, "mean_token_accuracy": 0.8392626009881496, "num_tokens": 912494488.0, "step": 28591 }, { "entropy": 0.5021169641986489, "epoch": 2.630611669858138, "grad_norm": 0.16065984964370728, "learning_rate": 1.2316373784770143e-05, "loss": 0.4876, "mean_token_accuracy": 0.842839241027832, "num_tokens": 912526171.0, "step": 28592 }, { "entropy": 0.47020148672163486, "epoch": 2.630703676229579, "grad_norm": 0.15363813936710358, "learning_rate": 1.2313306958628516e-05, "loss": 0.45, "mean_token_accuracy": 0.8577128164470196, "num_tokens": 912558334.0, "step": 28593 }, { "entropy": 0.5284405751153827, "epoch": 2.63079568260102, "grad_norm": 0.16013756394386292, "learning_rate": 1.231024013248689e-05, "loss": 0.5134, "mean_token_accuracy": 0.8419649079442024, "num_tokens": 912590481.0, "step": 28594 }, { "entropy": 0.5410975497215986, "epoch": 2.6308876889724613, "grad_norm": 0.1606651097536087, "learning_rate": 1.2307173306345263e-05, "loss": 0.5226, "mean_token_accuracy": 0.8337205611169338, "num_tokens": 912622524.0, "step": 28595 }, { "entropy": 0.5391063410788774, "epoch": 2.6309796953439024, "grad_norm": 0.16173085570335388, "learning_rate": 1.2304106480203638e-05, "loss": 0.5245, "mean_token_accuracy": 0.8355992026627064, "num_tokens": 912654422.0, "step": 28596 }, { "entropy": 0.4827126571908593, "epoch": 2.631071701715344, "grad_norm": 0.1509770005941391, "learning_rate": 1.2301039654062011e-05, "loss": 0.4659, "mean_token_accuracy": 0.8522718250751495, "num_tokens": 912686629.0, "step": 28597 }, { "entropy": 0.49157942552119493, "epoch": 2.631163708086785, "grad_norm": 0.1556216925382614, "learning_rate": 1.2297972827920386e-05, "loss": 0.4653, "mean_token_accuracy": 0.8502452336251736, "num_tokens": 912718270.0, "step": 28598 }, { "entropy": 0.508763862773776, "epoch": 2.6312557144582263, "grad_norm": 0.15805764496326447, "learning_rate": 1.229490600177876e-05, "loss": 0.4915, "mean_token_accuracy": 0.8410438746213913, "num_tokens": 912749785.0, "step": 28599 }, { "entropy": 0.5045461116824299, "epoch": 2.6313477208296674, "grad_norm": 0.15511780977249146, "learning_rate": 1.2291839175637133e-05, "loss": 0.4896, "mean_token_accuracy": 0.8415942080318928, "num_tokens": 912781453.0, "step": 28600 }, { "entropy": 0.4521800703369081, "epoch": 2.6314397272011085, "grad_norm": 0.14504878222942352, "learning_rate": 1.2288772349495508e-05, "loss": 0.4393, "mean_token_accuracy": 0.8612515442073345, "num_tokens": 912813644.0, "step": 28601 }, { "entropy": 0.5460655130445957, "epoch": 2.63153173357255, "grad_norm": 0.16475966572761536, "learning_rate": 1.228570552335388e-05, "loss": 0.5333, "mean_token_accuracy": 0.8328141942620277, "num_tokens": 912845158.0, "step": 28602 }, { "entropy": 0.47386425780132413, "epoch": 2.6316237399439912, "grad_norm": 0.1569187343120575, "learning_rate": 1.2282638697212255e-05, "loss": 0.4655, "mean_token_accuracy": 0.8532017692923546, "num_tokens": 912877349.0, "step": 28603 }, { "entropy": 0.5145244905725121, "epoch": 2.6317157463154324, "grad_norm": 0.16082414984703064, "learning_rate": 1.2279571871070628e-05, "loss": 0.5084, "mean_token_accuracy": 0.8401907719671726, "num_tokens": 912909163.0, "step": 28604 }, { "entropy": 0.5160381626337767, "epoch": 2.6318077526868735, "grad_norm": 0.15804605185985565, "learning_rate": 1.2276505044929005e-05, "loss": 0.5091, "mean_token_accuracy": 0.8372455462813377, "num_tokens": 912941329.0, "step": 28605 }, { "entropy": 0.5272350406739861, "epoch": 2.6318997590583146, "grad_norm": 0.1592501401901245, "learning_rate": 1.2273438218787378e-05, "loss": 0.5078, "mean_token_accuracy": 0.8355843611061573, "num_tokens": 912972878.0, "step": 28606 }, { "entropy": 0.4913364630192518, "epoch": 2.631991765429756, "grad_norm": 0.15935121476650238, "learning_rate": 1.2270371392645752e-05, "loss": 0.4755, "mean_token_accuracy": 0.8486678525805473, "num_tokens": 913004833.0, "step": 28607 }, { "entropy": 0.5692519368603826, "epoch": 2.6320837718011973, "grad_norm": 0.16408900916576385, "learning_rate": 1.2267304566504125e-05, "loss": 0.5638, "mean_token_accuracy": 0.8215127810835838, "num_tokens": 913036607.0, "step": 28608 }, { "entropy": 0.5902875307947397, "epoch": 2.6321757781726385, "grad_norm": 0.1621289700269699, "learning_rate": 1.22642377403625e-05, "loss": 0.5837, "mean_token_accuracy": 0.813748937100172, "num_tokens": 913068997.0, "step": 28609 }, { "entropy": 0.5056842090561986, "epoch": 2.6322677845440796, "grad_norm": 0.16847075521945953, "learning_rate": 1.2261170914220873e-05, "loss": 0.5092, "mean_token_accuracy": 0.8378872722387314, "num_tokens": 913100845.0, "step": 28610 }, { "entropy": 0.5966239403933287, "epoch": 2.6323597909155207, "grad_norm": 0.17228548228740692, "learning_rate": 1.2258104088079248e-05, "loss": 0.5897, "mean_token_accuracy": 0.8145753107964993, "num_tokens": 913133245.0, "step": 28611 }, { "entropy": 0.5339623668696731, "epoch": 2.6324517972869623, "grad_norm": 0.16009674966335297, "learning_rate": 1.225503726193762e-05, "loss": 0.5177, "mean_token_accuracy": 0.8321410827338696, "num_tokens": 913165549.0, "step": 28612 }, { "entropy": 0.5511091686785221, "epoch": 2.6325438036584035, "grad_norm": 0.16465221345424652, "learning_rate": 1.2251970435795995e-05, "loss": 0.5518, "mean_token_accuracy": 0.8275998868048191, "num_tokens": 913197179.0, "step": 28613 }, { "entropy": 0.49789247289299965, "epoch": 2.6326358100298446, "grad_norm": 0.15641701221466064, "learning_rate": 1.224890360965437e-05, "loss": 0.4852, "mean_token_accuracy": 0.8454481400549412, "num_tokens": 913227907.0, "step": 28614 }, { "entropy": 0.44562257546931505, "epoch": 2.6327278164012857, "grad_norm": 0.14820128679275513, "learning_rate": 1.2245836783512743e-05, "loss": 0.4295, "mean_token_accuracy": 0.8596498630940914, "num_tokens": 913259874.0, "step": 28615 }, { "entropy": 0.4945051344111562, "epoch": 2.632819822772727, "grad_norm": 0.1566253900527954, "learning_rate": 1.2242769957371117e-05, "loss": 0.4777, "mean_token_accuracy": 0.8493862152099609, "num_tokens": 913292301.0, "step": 28616 }, { "entropy": 0.5335224866867065, "epoch": 2.6329118291441684, "grad_norm": 0.1600417047739029, "learning_rate": 1.223970313122949e-05, "loss": 0.527, "mean_token_accuracy": 0.8301540240645409, "num_tokens": 913324430.0, "step": 28617 }, { "entropy": 0.6241622297093272, "epoch": 2.6330038355156096, "grad_norm": 0.16417378187179565, "learning_rate": 1.2236636305087865e-05, "loss": 0.609, "mean_token_accuracy": 0.8124510943889618, "num_tokens": 913356533.0, "step": 28618 }, { "entropy": 0.5263983175391331, "epoch": 2.6330958418870507, "grad_norm": 0.15708452463150024, "learning_rate": 1.2233569478946238e-05, "loss": 0.5086, "mean_token_accuracy": 0.8413613699376583, "num_tokens": 913388910.0, "step": 28619 }, { "entropy": 0.4708123989403248, "epoch": 2.633187848258492, "grad_norm": 0.15308718383312225, "learning_rate": 1.2230502652804614e-05, "loss": 0.4439, "mean_token_accuracy": 0.8583148568868637, "num_tokens": 913420689.0, "step": 28620 }, { "entropy": 0.37921970430761576, "epoch": 2.633279854629933, "grad_norm": 0.14159007370471954, "learning_rate": 1.2227435826662987e-05, "loss": 0.3575, "mean_token_accuracy": 0.8825314454734325, "num_tokens": 913451892.0, "step": 28621 }, { "entropy": 0.5044188071042299, "epoch": 2.6333718610013745, "grad_norm": 0.1515602320432663, "learning_rate": 1.2224369000521362e-05, "loss": 0.48, "mean_token_accuracy": 0.8466701023280621, "num_tokens": 913484139.0, "step": 28622 }, { "entropy": 0.4714450119063258, "epoch": 2.6334638673728157, "grad_norm": 0.15663963556289673, "learning_rate": 1.2221302174379735e-05, "loss": 0.4669, "mean_token_accuracy": 0.8511637933552265, "num_tokens": 913516218.0, "step": 28623 }, { "entropy": 0.5538614522665739, "epoch": 2.633555873744257, "grad_norm": 0.16249226033687592, "learning_rate": 1.221823534823811e-05, "loss": 0.5351, "mean_token_accuracy": 0.8297479040920734, "num_tokens": 913547912.0, "step": 28624 }, { "entropy": 0.48067272757180035, "epoch": 2.633647880115698, "grad_norm": 0.1525970697402954, "learning_rate": 1.2215168522096482e-05, "loss": 0.4708, "mean_token_accuracy": 0.8550583273172379, "num_tokens": 913580341.0, "step": 28625 }, { "entropy": 0.5278767812997103, "epoch": 2.633739886487139, "grad_norm": 0.15337324142456055, "learning_rate": 1.2212101695954857e-05, "loss": 0.5096, "mean_token_accuracy": 0.841212585568428, "num_tokens": 913612699.0, "step": 28626 }, { "entropy": 0.5017067492008209, "epoch": 2.6338318928585807, "grad_norm": 0.1567663848400116, "learning_rate": 1.2209034869813232e-05, "loss": 0.4843, "mean_token_accuracy": 0.8456486724317074, "num_tokens": 913644794.0, "step": 28627 }, { "entropy": 0.4580888282507658, "epoch": 2.633923899230022, "grad_norm": 0.15004228055477142, "learning_rate": 1.2205968043671605e-05, "loss": 0.4538, "mean_token_accuracy": 0.8549588583409786, "num_tokens": 913676366.0, "step": 28628 }, { "entropy": 0.5716516887769103, "epoch": 2.634015905601463, "grad_norm": 0.1703519970178604, "learning_rate": 1.220290121752998e-05, "loss": 0.5539, "mean_token_accuracy": 0.8260673321783543, "num_tokens": 913707917.0, "step": 28629 }, { "entropy": 0.5148067679256201, "epoch": 2.634107911972904, "grad_norm": 0.16320723295211792, "learning_rate": 1.2199834391388352e-05, "loss": 0.5129, "mean_token_accuracy": 0.8348728157579899, "num_tokens": 913739898.0, "step": 28630 }, { "entropy": 0.47068816632963717, "epoch": 2.634199918344345, "grad_norm": 0.1567334234714508, "learning_rate": 1.2196767565246727e-05, "loss": 0.4711, "mean_token_accuracy": 0.8509709648787975, "num_tokens": 913771874.0, "step": 28631 }, { "entropy": 0.4694254552014172, "epoch": 2.6342919247157868, "grad_norm": 0.15408442914485931, "learning_rate": 1.21937007391051e-05, "loss": 0.4596, "mean_token_accuracy": 0.8533555120229721, "num_tokens": 913803919.0, "step": 28632 }, { "entropy": 0.47191645484417677, "epoch": 2.634383931087228, "grad_norm": 0.15448342263698578, "learning_rate": 1.2190633912963475e-05, "loss": 0.4697, "mean_token_accuracy": 0.850891437381506, "num_tokens": 913835956.0, "step": 28633 }, { "entropy": 0.5111611969769001, "epoch": 2.634475937458669, "grad_norm": 0.16253215074539185, "learning_rate": 1.2187567086821848e-05, "loss": 0.5077, "mean_token_accuracy": 0.8437350764870644, "num_tokens": 913867590.0, "step": 28634 }, { "entropy": 0.4555645710788667, "epoch": 2.63456794383011, "grad_norm": 0.14639632403850555, "learning_rate": 1.2184500260680222e-05, "loss": 0.4472, "mean_token_accuracy": 0.8596943952143192, "num_tokens": 913899737.0, "step": 28635 }, { "entropy": 0.553125720936805, "epoch": 2.6346599502015513, "grad_norm": 0.16311384737491608, "learning_rate": 1.2181433434538597e-05, "loss": 0.5342, "mean_token_accuracy": 0.8321746215224266, "num_tokens": 913932299.0, "step": 28636 }, { "entropy": 0.5119761545211077, "epoch": 2.634751956572993, "grad_norm": 0.15925249457359314, "learning_rate": 1.2178366608396971e-05, "loss": 0.5088, "mean_token_accuracy": 0.8410978838801384, "num_tokens": 913964092.0, "step": 28637 }, { "entropy": 0.5187060004100204, "epoch": 2.634843962944434, "grad_norm": 0.1561824530363083, "learning_rate": 1.2175299782255344e-05, "loss": 0.5017, "mean_token_accuracy": 0.8420940116047859, "num_tokens": 913996130.0, "step": 28638 }, { "entropy": 0.488407573197037, "epoch": 2.634935969315875, "grad_norm": 0.1541203111410141, "learning_rate": 1.2172232956113719e-05, "loss": 0.4788, "mean_token_accuracy": 0.8481008782982826, "num_tokens": 914028898.0, "step": 28639 }, { "entropy": 0.5323407724499702, "epoch": 2.6350279756873163, "grad_norm": 0.1621667593717575, "learning_rate": 1.2169166129972092e-05, "loss": 0.527, "mean_token_accuracy": 0.8347547575831413, "num_tokens": 914060708.0, "step": 28640 }, { "entropy": 0.49367957888171077, "epoch": 2.6351199820587574, "grad_norm": 0.15868385136127472, "learning_rate": 1.2166099303830467e-05, "loss": 0.4903, "mean_token_accuracy": 0.8440229520201683, "num_tokens": 914092580.0, "step": 28641 }, { "entropy": 0.5347346218768507, "epoch": 2.635211988430199, "grad_norm": 0.16089105606079102, "learning_rate": 1.2163032477688841e-05, "loss": 0.5252, "mean_token_accuracy": 0.8356204256415367, "num_tokens": 914124308.0, "step": 28642 }, { "entropy": 0.5284842997789383, "epoch": 2.63530399480164, "grad_norm": 0.1619178205728531, "learning_rate": 1.2159965651547214e-05, "loss": 0.5146, "mean_token_accuracy": 0.8355135470628738, "num_tokens": 914156427.0, "step": 28643 }, { "entropy": 0.4795700889080763, "epoch": 2.6353960011730813, "grad_norm": 0.1530798226594925, "learning_rate": 1.2156898825405589e-05, "loss": 0.4703, "mean_token_accuracy": 0.850367546081543, "num_tokens": 914188165.0, "step": 28644 }, { "entropy": 0.4731675097718835, "epoch": 2.6354880075445224, "grad_norm": 0.15164361894130707, "learning_rate": 1.2153831999263962e-05, "loss": 0.4555, "mean_token_accuracy": 0.8561969324946404, "num_tokens": 914219863.0, "step": 28645 }, { "entropy": 0.5643332004547119, "epoch": 2.6355800139159635, "grad_norm": 0.1664910763502121, "learning_rate": 1.2150765173122337e-05, "loss": 0.5605, "mean_token_accuracy": 0.8235351406037807, "num_tokens": 914251882.0, "step": 28646 }, { "entropy": 0.4297560774721205, "epoch": 2.635672020287405, "grad_norm": 0.14667996764183044, "learning_rate": 1.214769834698071e-05, "loss": 0.4189, "mean_token_accuracy": 0.8649828992784023, "num_tokens": 914283712.0, "step": 28647 }, { "entropy": 0.451479161856696, "epoch": 2.6357640266588462, "grad_norm": 0.14531712234020233, "learning_rate": 1.2144631520839084e-05, "loss": 0.4405, "mean_token_accuracy": 0.8627183549106121, "num_tokens": 914316408.0, "step": 28648 }, { "entropy": 0.382114814594388, "epoch": 2.6358560330302874, "grad_norm": 0.1451830118894577, "learning_rate": 1.2141564694697457e-05, "loss": 0.3608, "mean_token_accuracy": 0.8807479180395603, "num_tokens": 914347698.0, "step": 28649 }, { "entropy": 0.5457235984504223, "epoch": 2.6359480394017285, "grad_norm": 0.16355405747890472, "learning_rate": 1.2138497868555832e-05, "loss": 0.5364, "mean_token_accuracy": 0.8305564858019352, "num_tokens": 914380255.0, "step": 28650 }, { "entropy": 0.49246585415676236, "epoch": 2.6360400457731696, "grad_norm": 0.154081329703331, "learning_rate": 1.2135431042414206e-05, "loss": 0.4816, "mean_token_accuracy": 0.8461637757718563, "num_tokens": 914412008.0, "step": 28651 }, { "entropy": 0.4709891490638256, "epoch": 2.636132052144611, "grad_norm": 0.15678434073925018, "learning_rate": 1.2132364216272581e-05, "loss": 0.4513, "mean_token_accuracy": 0.8549642637372017, "num_tokens": 914443978.0, "step": 28652 }, { "entropy": 0.45426404755562544, "epoch": 2.6362240585160523, "grad_norm": 0.15250816941261292, "learning_rate": 1.2129297390130954e-05, "loss": 0.4342, "mean_token_accuracy": 0.8591504134237766, "num_tokens": 914475215.0, "step": 28653 }, { "entropy": 0.5107673909515142, "epoch": 2.6363160648874935, "grad_norm": 0.16292515397071838, "learning_rate": 1.2126230563989329e-05, "loss": 0.4915, "mean_token_accuracy": 0.8430817127227783, "num_tokens": 914506334.0, "step": 28654 }, { "entropy": 0.5037338696420193, "epoch": 2.6364080712589346, "grad_norm": 0.16360820829868317, "learning_rate": 1.2123163737847702e-05, "loss": 0.4947, "mean_token_accuracy": 0.8416365161538124, "num_tokens": 914537577.0, "step": 28655 }, { "entropy": 0.4954179518390447, "epoch": 2.6365000776303757, "grad_norm": 0.15586809813976288, "learning_rate": 1.2120096911706076e-05, "loss": 0.4801, "mean_token_accuracy": 0.8475687429308891, "num_tokens": 914570014.0, "step": 28656 }, { "entropy": 0.46375011652708054, "epoch": 2.6365920840018173, "grad_norm": 0.15344689786434174, "learning_rate": 1.2117030085564451e-05, "loss": 0.4445, "mean_token_accuracy": 0.8597763255238533, "num_tokens": 914601895.0, "step": 28657 }, { "entropy": 0.46026141569018364, "epoch": 2.6366840903732585, "grad_norm": 0.14772282540798187, "learning_rate": 1.2113963259422824e-05, "loss": 0.4394, "mean_token_accuracy": 0.8604514934122562, "num_tokens": 914634025.0, "step": 28658 }, { "entropy": 0.5655161570757627, "epoch": 2.6367760967446996, "grad_norm": 0.16885288059711456, "learning_rate": 1.2110896433281198e-05, "loss": 0.5602, "mean_token_accuracy": 0.823468666523695, "num_tokens": 914665321.0, "step": 28659 }, { "entropy": 0.4891632830258459, "epoch": 2.6368681031161407, "grad_norm": 0.155489981174469, "learning_rate": 1.2107829607139571e-05, "loss": 0.4699, "mean_token_accuracy": 0.8485580794513226, "num_tokens": 914697123.0, "step": 28660 }, { "entropy": 0.5023351395502687, "epoch": 2.636960109487582, "grad_norm": 0.15603794157505035, "learning_rate": 1.2104762780997946e-05, "loss": 0.4894, "mean_token_accuracy": 0.842864416539669, "num_tokens": 914728875.0, "step": 28661 }, { "entropy": 0.479888089816086, "epoch": 2.6370521158590234, "grad_norm": 0.15327800810337067, "learning_rate": 1.2101695954856319e-05, "loss": 0.4617, "mean_token_accuracy": 0.8523014597594738, "num_tokens": 914761233.0, "step": 28662 }, { "entropy": 0.5032297978177667, "epoch": 2.6371441222304646, "grad_norm": 0.1567544788122177, "learning_rate": 1.2098629128714694e-05, "loss": 0.5078, "mean_token_accuracy": 0.8399947844445705, "num_tokens": 914793367.0, "step": 28663 }, { "entropy": 0.5482601011171937, "epoch": 2.6372361286019057, "grad_norm": 0.16465702652931213, "learning_rate": 1.2095562302573067e-05, "loss": 0.5361, "mean_token_accuracy": 0.824896514415741, "num_tokens": 914824357.0, "step": 28664 }, { "entropy": 0.4967560237273574, "epoch": 2.637328134973347, "grad_norm": 0.1543126106262207, "learning_rate": 1.2092495476431441e-05, "loss": 0.4894, "mean_token_accuracy": 0.8473295755684376, "num_tokens": 914856753.0, "step": 28665 }, { "entropy": 0.5365856606513262, "epoch": 2.637420141344788, "grad_norm": 0.16769391298294067, "learning_rate": 1.2089428650289816e-05, "loss": 0.5243, "mean_token_accuracy": 0.8334989249706268, "num_tokens": 914888837.0, "step": 28666 }, { "entropy": 0.5465413338970393, "epoch": 2.6375121477162295, "grad_norm": 0.16421394050121307, "learning_rate": 1.208636182414819e-05, "loss": 0.5259, "mean_token_accuracy": 0.8354062512516975, "num_tokens": 914920521.0, "step": 28667 }, { "entropy": 0.43226418690755963, "epoch": 2.6376041540876707, "grad_norm": 0.14735333621501923, "learning_rate": 1.2083294998006564e-05, "loss": 0.4138, "mean_token_accuracy": 0.8653730377554893, "num_tokens": 914952695.0, "step": 28668 }, { "entropy": 0.4807998398318887, "epoch": 2.637696160459112, "grad_norm": 0.156986266374588, "learning_rate": 1.2080228171864938e-05, "loss": 0.4748, "mean_token_accuracy": 0.8507204204797745, "num_tokens": 914984564.0, "step": 28669 }, { "entropy": 0.44357173843309283, "epoch": 2.637788166830553, "grad_norm": 0.14767543971538544, "learning_rate": 1.2077161345723311e-05, "loss": 0.4339, "mean_token_accuracy": 0.8601766005158424, "num_tokens": 915016959.0, "step": 28670 }, { "entropy": 0.4816328752785921, "epoch": 2.637880173201994, "grad_norm": 0.14919748902320862, "learning_rate": 1.2074094519581686e-05, "loss": 0.4789, "mean_token_accuracy": 0.8508860617876053, "num_tokens": 915049446.0, "step": 28671 }, { "entropy": 0.527363820001483, "epoch": 2.6379721795734357, "grad_norm": 0.162318617105484, "learning_rate": 1.207102769344006e-05, "loss": 0.5168, "mean_token_accuracy": 0.8380953781306744, "num_tokens": 915081343.0, "step": 28672 }, { "entropy": 0.5223362548276782, "epoch": 2.638064185944877, "grad_norm": 0.15868447721004486, "learning_rate": 1.2067960867298433e-05, "loss": 0.5112, "mean_token_accuracy": 0.8385086953639984, "num_tokens": 915113400.0, "step": 28673 }, { "entropy": 0.5521485069766641, "epoch": 2.638156192316318, "grad_norm": 0.1599341630935669, "learning_rate": 1.2064894041156808e-05, "loss": 0.5435, "mean_token_accuracy": 0.8264448754489422, "num_tokens": 915145395.0, "step": 28674 }, { "entropy": 0.4374299393966794, "epoch": 2.638248198687759, "grad_norm": 0.14537492394447327, "learning_rate": 1.2061827215015181e-05, "loss": 0.4277, "mean_token_accuracy": 0.864080548286438, "num_tokens": 915177228.0, "step": 28675 }, { "entropy": 0.5022753523662686, "epoch": 2.6383402050592, "grad_norm": 0.1575349122285843, "learning_rate": 1.2058760388873556e-05, "loss": 0.4895, "mean_token_accuracy": 0.8424826078116894, "num_tokens": 915209419.0, "step": 28676 }, { "entropy": 0.47795495204627514, "epoch": 2.6384322114306418, "grad_norm": 0.15496739745140076, "learning_rate": 1.2055693562731929e-05, "loss": 0.4687, "mean_token_accuracy": 0.8528564907610416, "num_tokens": 915240943.0, "step": 28677 }, { "entropy": 0.551458794856444, "epoch": 2.638524217802083, "grad_norm": 0.16731947660446167, "learning_rate": 1.2052626736590303e-05, "loss": 0.535, "mean_token_accuracy": 0.8293592855334282, "num_tokens": 915272740.0, "step": 28678 }, { "entropy": 0.5104059539735317, "epoch": 2.638616224173524, "grad_norm": 0.1610843986272812, "learning_rate": 1.2049559910448676e-05, "loss": 0.494, "mean_token_accuracy": 0.84089295566082, "num_tokens": 915304109.0, "step": 28679 }, { "entropy": 0.5430484728422016, "epoch": 2.638708230544965, "grad_norm": 0.1638769507408142, "learning_rate": 1.204649308430705e-05, "loss": 0.5381, "mean_token_accuracy": 0.8296103067696095, "num_tokens": 915336232.0, "step": 28680 }, { "entropy": 0.50894256378524, "epoch": 2.6388002369164063, "grad_norm": 0.1582222282886505, "learning_rate": 1.2043426258165425e-05, "loss": 0.4913, "mean_token_accuracy": 0.8438608720898628, "num_tokens": 915368147.0, "step": 28681 }, { "entropy": 0.5296443430706859, "epoch": 2.638892243287848, "grad_norm": 0.16124950349330902, "learning_rate": 1.20403594320238e-05, "loss": 0.526, "mean_token_accuracy": 0.8329767771065235, "num_tokens": 915399599.0, "step": 28682 }, { "entropy": 0.6747983023524284, "epoch": 2.638984249659289, "grad_norm": 0.17265664041042328, "learning_rate": 1.2037292605882173e-05, "loss": 0.6616, "mean_token_accuracy": 0.7964690960943699, "num_tokens": 915430918.0, "step": 28683 }, { "entropy": 0.4428250160999596, "epoch": 2.63907625603073, "grad_norm": 0.14719000458717346, "learning_rate": 1.2034225779740548e-05, "loss": 0.4335, "mean_token_accuracy": 0.8595421127974987, "num_tokens": 915463161.0, "step": 28684 }, { "entropy": 0.44934767205268145, "epoch": 2.6391682624021713, "grad_norm": 0.15042106807231903, "learning_rate": 1.203115895359892e-05, "loss": 0.4388, "mean_token_accuracy": 0.8591836057603359, "num_tokens": 915495912.0, "step": 28685 }, { "entropy": 0.5410271044820547, "epoch": 2.6392602687736124, "grad_norm": 0.15928450226783752, "learning_rate": 1.2028092127457295e-05, "loss": 0.5249, "mean_token_accuracy": 0.8342343755066395, "num_tokens": 915527708.0, "step": 28686 }, { "entropy": 0.5400179112330079, "epoch": 2.639352275145054, "grad_norm": 0.1625330150127411, "learning_rate": 1.202502530131567e-05, "loss": 0.5254, "mean_token_accuracy": 0.8311465680599213, "num_tokens": 915560018.0, "step": 28687 }, { "entropy": 0.4925200887955725, "epoch": 2.639444281516495, "grad_norm": 0.15376417338848114, "learning_rate": 1.2021958475174043e-05, "loss": 0.4774, "mean_token_accuracy": 0.8470969498157501, "num_tokens": 915592013.0, "step": 28688 }, { "entropy": 0.43722056597471237, "epoch": 2.6395362878879363, "grad_norm": 0.1488792896270752, "learning_rate": 1.2018891649032418e-05, "loss": 0.4255, "mean_token_accuracy": 0.8638069219887257, "num_tokens": 915623909.0, "step": 28689 }, { "entropy": 0.5624607861973345, "epoch": 2.6396282942593774, "grad_norm": 0.1653810441493988, "learning_rate": 1.201582482289079e-05, "loss": 0.5499, "mean_token_accuracy": 0.8247704394161701, "num_tokens": 915655462.0, "step": 28690 }, { "entropy": 0.5387973133474588, "epoch": 2.6397203006308185, "grad_norm": 0.1650090217590332, "learning_rate": 1.2012757996749165e-05, "loss": 0.5358, "mean_token_accuracy": 0.831901665776968, "num_tokens": 915686800.0, "step": 28691 }, { "entropy": 0.5210605440661311, "epoch": 2.63981230700226, "grad_norm": 0.16561861336231232, "learning_rate": 1.2009691170607538e-05, "loss": 0.5129, "mean_token_accuracy": 0.8404230624437332, "num_tokens": 915718807.0, "step": 28692 }, { "entropy": 0.5639687571674585, "epoch": 2.6399043133737012, "grad_norm": 0.16414682567119598, "learning_rate": 1.2006624344465913e-05, "loss": 0.548, "mean_token_accuracy": 0.8253084495663643, "num_tokens": 915750610.0, "step": 28693 }, { "entropy": 0.5216516562504694, "epoch": 2.6399963197451424, "grad_norm": 0.1623098999261856, "learning_rate": 1.2003557518324286e-05, "loss": 0.5051, "mean_token_accuracy": 0.838804118335247, "num_tokens": 915782122.0, "step": 28694 }, { "entropy": 0.6576777137815952, "epoch": 2.6400883261165835, "grad_norm": 0.17309968173503876, "learning_rate": 1.200049069218266e-05, "loss": 0.6444, "mean_token_accuracy": 0.7974741086363792, "num_tokens": 915814716.0, "step": 28695 }, { "entropy": 0.44874109560623765, "epoch": 2.6401803324880246, "grad_norm": 0.1463397890329361, "learning_rate": 1.1997423866041033e-05, "loss": 0.4329, "mean_token_accuracy": 0.8619155809283257, "num_tokens": 915846904.0, "step": 28696 }, { "entropy": 0.6037288028746843, "epoch": 2.640272338859466, "grad_norm": 0.16955585777759552, "learning_rate": 1.199435703989941e-05, "loss": 0.5889, "mean_token_accuracy": 0.8158805891871452, "num_tokens": 915878268.0, "step": 28697 }, { "entropy": 0.450613658875227, "epoch": 2.6403643452309074, "grad_norm": 0.15663570165634155, "learning_rate": 1.1991290213757783e-05, "loss": 0.4429, "mean_token_accuracy": 0.8566193245351315, "num_tokens": 915910072.0, "step": 28698 }, { "entropy": 0.551824807189405, "epoch": 2.6404563516023485, "grad_norm": 0.16353870928287506, "learning_rate": 1.1988223387616157e-05, "loss": 0.5494, "mean_token_accuracy": 0.8278278149664402, "num_tokens": 915942254.0, "step": 28699 }, { "entropy": 0.576007526833564, "epoch": 2.6405483579737896, "grad_norm": 0.16426634788513184, "learning_rate": 1.198515656147453e-05, "loss": 0.5625, "mean_token_accuracy": 0.820383083075285, "num_tokens": 915974688.0, "step": 28700 }, { "entropy": 0.47162360325455666, "epoch": 2.6406403643452308, "grad_norm": 0.15340620279312134, "learning_rate": 1.1982089735332905e-05, "loss": 0.4619, "mean_token_accuracy": 0.8527082726359367, "num_tokens": 916006818.0, "step": 28701 }, { "entropy": 0.5743863042443991, "epoch": 2.6407323707166723, "grad_norm": 0.1683151125907898, "learning_rate": 1.197902290919128e-05, "loss": 0.563, "mean_token_accuracy": 0.8196663297712803, "num_tokens": 916038305.0, "step": 28702 }, { "entropy": 0.4428181266412139, "epoch": 2.6408243770881135, "grad_norm": 0.15414251387119293, "learning_rate": 1.1975956083049652e-05, "loss": 0.4362, "mean_token_accuracy": 0.860013585537672, "num_tokens": 916070867.0, "step": 28703 }, { "entropy": 0.4947105944156647, "epoch": 2.6409163834595546, "grad_norm": 0.15398941934108734, "learning_rate": 1.1972889256908027e-05, "loss": 0.4788, "mean_token_accuracy": 0.8445515632629395, "num_tokens": 916102463.0, "step": 28704 }, { "entropy": 0.5848026536405087, "epoch": 2.6410083898309957, "grad_norm": 0.1703334003686905, "learning_rate": 1.19698224307664e-05, "loss": 0.5741, "mean_token_accuracy": 0.8206021711230278, "num_tokens": 916134576.0, "step": 28705 }, { "entropy": 0.5481984866783023, "epoch": 2.641100396202437, "grad_norm": 0.1631060093641281, "learning_rate": 1.1966755604624775e-05, "loss": 0.5341, "mean_token_accuracy": 0.8295287303626537, "num_tokens": 916166418.0, "step": 28706 }, { "entropy": 0.6077791005373001, "epoch": 2.6411924025738784, "grad_norm": 0.16836275160312653, "learning_rate": 1.1963688778483148e-05, "loss": 0.5995, "mean_token_accuracy": 0.8107065744698048, "num_tokens": 916198977.0, "step": 28707 }, { "entropy": 0.5903102494776249, "epoch": 2.6412844089453196, "grad_norm": 0.16368727385997772, "learning_rate": 1.1960621952341522e-05, "loss": 0.5707, "mean_token_accuracy": 0.8209252990782261, "num_tokens": 916231316.0, "step": 28708 }, { "entropy": 0.5249427612870932, "epoch": 2.6413764153167607, "grad_norm": 0.16190902888774872, "learning_rate": 1.1957555126199895e-05, "loss": 0.5187, "mean_token_accuracy": 0.8389367572963238, "num_tokens": 916263197.0, "step": 28709 }, { "entropy": 0.4519673166796565, "epoch": 2.641468421688202, "grad_norm": 0.15553665161132812, "learning_rate": 1.195448830005827e-05, "loss": 0.4349, "mean_token_accuracy": 0.8574640490114689, "num_tokens": 916295086.0, "step": 28710 }, { "entropy": 0.5193753466010094, "epoch": 2.641560428059643, "grad_norm": 0.15434221923351288, "learning_rate": 1.1951421473916643e-05, "loss": 0.5098, "mean_token_accuracy": 0.8394358307123184, "num_tokens": 916327694.0, "step": 28711 }, { "entropy": 0.43044165801256895, "epoch": 2.6416524344310846, "grad_norm": 0.14685273170471191, "learning_rate": 1.194835464777502e-05, "loss": 0.4092, "mean_token_accuracy": 0.8655962832272053, "num_tokens": 916358900.0, "step": 28712 }, { "entropy": 0.48076781164854765, "epoch": 2.6417444408025257, "grad_norm": 0.15149952471256256, "learning_rate": 1.1945287821633392e-05, "loss": 0.4692, "mean_token_accuracy": 0.85091907158494, "num_tokens": 916391200.0, "step": 28713 }, { "entropy": 0.48505083564668894, "epoch": 2.641836447173967, "grad_norm": 0.15910124778747559, "learning_rate": 1.1942220995491767e-05, "loss": 0.4772, "mean_token_accuracy": 0.847379595041275, "num_tokens": 916423282.0, "step": 28714 }, { "entropy": 0.5461906623095274, "epoch": 2.641928453545408, "grad_norm": 0.15962575376033783, "learning_rate": 1.193915416935014e-05, "loss": 0.5333, "mean_token_accuracy": 0.8299951106309891, "num_tokens": 916456050.0, "step": 28715 }, { "entropy": 0.5445179091766477, "epoch": 2.642020459916849, "grad_norm": 0.16701623797416687, "learning_rate": 1.1936087343208514e-05, "loss": 0.5382, "mean_token_accuracy": 0.8286100886762142, "num_tokens": 916487723.0, "step": 28716 }, { "entropy": 0.5648876866325736, "epoch": 2.6421124662882907, "grad_norm": 0.16855500638484955, "learning_rate": 1.1933020517066889e-05, "loss": 0.5587, "mean_token_accuracy": 0.8231771662831306, "num_tokens": 916520101.0, "step": 28717 }, { "entropy": 0.5309122176840901, "epoch": 2.642204472659732, "grad_norm": 0.16155970096588135, "learning_rate": 1.1929953690925262e-05, "loss": 0.518, "mean_token_accuracy": 0.8358974456787109, "num_tokens": 916551702.0, "step": 28718 }, { "entropy": 0.5218608391005546, "epoch": 2.642296479031173, "grad_norm": 0.16502362489700317, "learning_rate": 1.1926886864783637e-05, "loss": 0.5083, "mean_token_accuracy": 0.8405493162572384, "num_tokens": 916582622.0, "step": 28719 }, { "entropy": 0.5691910209134221, "epoch": 2.642388485402614, "grad_norm": 0.16565950214862823, "learning_rate": 1.192382003864201e-05, "loss": 0.5573, "mean_token_accuracy": 0.823294498026371, "num_tokens": 916614633.0, "step": 28720 }, { "entropy": 0.5187561514321715, "epoch": 2.642480491774055, "grad_norm": 0.16246090829372406, "learning_rate": 1.1920753212500384e-05, "loss": 0.5015, "mean_token_accuracy": 0.8400212861597538, "num_tokens": 916646588.0, "step": 28721 }, { "entropy": 0.5660877898335457, "epoch": 2.6425724981454968, "grad_norm": 0.1688360869884491, "learning_rate": 1.1917686386358757e-05, "loss": 0.5502, "mean_token_accuracy": 0.8233065493404865, "num_tokens": 916677505.0, "step": 28722 }, { "entropy": 0.5032457374036312, "epoch": 2.642664504516938, "grad_norm": 0.15619178116321564, "learning_rate": 1.1914619560217132e-05, "loss": 0.4866, "mean_token_accuracy": 0.8416066952049732, "num_tokens": 916709707.0, "step": 28723 }, { "entropy": 0.5168939866125584, "epoch": 2.642756510888379, "grad_norm": 0.15955623984336853, "learning_rate": 1.1911552734075505e-05, "loss": 0.5036, "mean_token_accuracy": 0.8388096429407597, "num_tokens": 916742463.0, "step": 28724 }, { "entropy": 0.4938740571960807, "epoch": 2.64284851725982, "grad_norm": 0.1576274186372757, "learning_rate": 1.190848590793388e-05, "loss": 0.4756, "mean_token_accuracy": 0.8467928841710091, "num_tokens": 916774424.0, "step": 28725 }, { "entropy": 0.5460786619223654, "epoch": 2.6429405236312613, "grad_norm": 0.16650350391864777, "learning_rate": 1.1905419081792252e-05, "loss": 0.5294, "mean_token_accuracy": 0.8337629921734333, "num_tokens": 916806708.0, "step": 28726 }, { "entropy": 0.450283863581717, "epoch": 2.643032530002703, "grad_norm": 0.1570683717727661, "learning_rate": 1.1902352255650629e-05, "loss": 0.4406, "mean_token_accuracy": 0.8583840280771255, "num_tokens": 916837746.0, "step": 28727 }, { "entropy": 0.5423043705523014, "epoch": 2.643124536374144, "grad_norm": 0.1591174304485321, "learning_rate": 1.1899285429509002e-05, "loss": 0.5349, "mean_token_accuracy": 0.8327744603157043, "num_tokens": 916870064.0, "step": 28728 }, { "entropy": 0.5176257387502119, "epoch": 2.643216542745585, "grad_norm": 0.16263383626937866, "learning_rate": 1.1896218603367376e-05, "loss": 0.5045, "mean_token_accuracy": 0.8391883820295334, "num_tokens": 916901289.0, "step": 28729 }, { "entropy": 0.5711814947426319, "epoch": 2.6433085491170263, "grad_norm": 0.16446271538734436, "learning_rate": 1.189315177722575e-05, "loss": 0.5567, "mean_token_accuracy": 0.8275195807218552, "num_tokens": 916933334.0, "step": 28730 }, { "entropy": 0.4891539169475436, "epoch": 2.6434005554884674, "grad_norm": 0.14920546114444733, "learning_rate": 1.1890084951084124e-05, "loss": 0.4719, "mean_token_accuracy": 0.8509667478501797, "num_tokens": 916965457.0, "step": 28731 }, { "entropy": 0.5676079783588648, "epoch": 2.643492561859909, "grad_norm": 0.16256743669509888, "learning_rate": 1.1887018124942499e-05, "loss": 0.5535, "mean_token_accuracy": 0.8210791647434235, "num_tokens": 916997258.0, "step": 28732 }, { "entropy": 0.5616206261329353, "epoch": 2.64358456823135, "grad_norm": 0.16387788951396942, "learning_rate": 1.1883951298800872e-05, "loss": 0.5469, "mean_token_accuracy": 0.8278694823384285, "num_tokens": 917029436.0, "step": 28733 }, { "entropy": 0.4360199784860015, "epoch": 2.6436765746027913, "grad_norm": 0.14802837371826172, "learning_rate": 1.1880884472659246e-05, "loss": 0.4207, "mean_token_accuracy": 0.8631043173372746, "num_tokens": 917061638.0, "step": 28734 }, { "entropy": 0.5782526088878512, "epoch": 2.6437685809742324, "grad_norm": 0.1686486452817917, "learning_rate": 1.187781764651762e-05, "loss": 0.5628, "mean_token_accuracy": 0.8201399892568588, "num_tokens": 917093514.0, "step": 28735 }, { "entropy": 0.5347378002479672, "epoch": 2.6438605873456735, "grad_norm": 0.1572728157043457, "learning_rate": 1.1874750820375994e-05, "loss": 0.5286, "mean_token_accuracy": 0.8357962891459465, "num_tokens": 917126282.0, "step": 28736 }, { "entropy": 0.5432971119880676, "epoch": 2.643952593717115, "grad_norm": 0.1614292562007904, "learning_rate": 1.1871683994234367e-05, "loss": 0.5282, "mean_token_accuracy": 0.8323640413582325, "num_tokens": 917157712.0, "step": 28737 }, { "entropy": 0.4599590487778187, "epoch": 2.6440446000885562, "grad_norm": 0.15011891722679138, "learning_rate": 1.1868617168092741e-05, "loss": 0.4449, "mean_token_accuracy": 0.8590729795396328, "num_tokens": 917190225.0, "step": 28738 }, { "entropy": 0.49229812901467085, "epoch": 2.6441366064599974, "grad_norm": 0.16212211549282074, "learning_rate": 1.1865550341951114e-05, "loss": 0.481, "mean_token_accuracy": 0.8481987453997135, "num_tokens": 917221935.0, "step": 28739 }, { "entropy": 0.5894629051908851, "epoch": 2.6442286128314385, "grad_norm": 0.171724334359169, "learning_rate": 1.1862483515809489e-05, "loss": 0.5879, "mean_token_accuracy": 0.8207655400037766, "num_tokens": 917253735.0, "step": 28740 }, { "entropy": 0.48553915321826935, "epoch": 2.6443206192028796, "grad_norm": 0.15779630839824677, "learning_rate": 1.1859416689667862e-05, "loss": 0.4707, "mean_token_accuracy": 0.8496101945638657, "num_tokens": 917285070.0, "step": 28741 }, { "entropy": 0.44285490922629833, "epoch": 2.644412625574321, "grad_norm": 0.15820729732513428, "learning_rate": 1.1856349863526238e-05, "loss": 0.4404, "mean_token_accuracy": 0.8607286773622036, "num_tokens": 917316104.0, "step": 28742 }, { "entropy": 0.5720550827682018, "epoch": 2.6445046319457624, "grad_norm": 0.16918738186359406, "learning_rate": 1.1853283037384611e-05, "loss": 0.5563, "mean_token_accuracy": 0.8226659670472145, "num_tokens": 917347740.0, "step": 28743 }, { "entropy": 0.5650491919368505, "epoch": 2.6445966383172035, "grad_norm": 0.1689033806324005, "learning_rate": 1.1850216211242986e-05, "loss": 0.557, "mean_token_accuracy": 0.8217707723379135, "num_tokens": 917380021.0, "step": 28744 }, { "entropy": 0.48541940259747207, "epoch": 2.6446886446886446, "grad_norm": 0.15377512574195862, "learning_rate": 1.1847149385101359e-05, "loss": 0.4763, "mean_token_accuracy": 0.8485992066562176, "num_tokens": 917412357.0, "step": 28745 }, { "entropy": 0.5046316729858518, "epoch": 2.6447806510600858, "grad_norm": 0.1541416496038437, "learning_rate": 1.1844082558959734e-05, "loss": 0.4918, "mean_token_accuracy": 0.8452470265328884, "num_tokens": 917444936.0, "step": 28746 }, { "entropy": 0.5592861492186785, "epoch": 2.6448726574315273, "grad_norm": 0.1636001169681549, "learning_rate": 1.1841015732818108e-05, "loss": 0.5517, "mean_token_accuracy": 0.8224000558257103, "num_tokens": 917477170.0, "step": 28747 }, { "entropy": 0.6077331360429525, "epoch": 2.6449646638029685, "grad_norm": 0.1659483164548874, "learning_rate": 1.1837948906676481e-05, "loss": 0.5827, "mean_token_accuracy": 0.8124859742820263, "num_tokens": 917508987.0, "step": 28748 }, { "entropy": 0.4933638027869165, "epoch": 2.6450566701744096, "grad_norm": 0.1599252074956894, "learning_rate": 1.1834882080534856e-05, "loss": 0.4808, "mean_token_accuracy": 0.8494591154158115, "num_tokens": 917540800.0, "step": 28749 }, { "entropy": 0.45821675239130855, "epoch": 2.6451486765458507, "grad_norm": 0.1484488844871521, "learning_rate": 1.1831815254393229e-05, "loss": 0.4367, "mean_token_accuracy": 0.8599652610719204, "num_tokens": 917572591.0, "step": 28750 }, { "entropy": 0.5651336358860135, "epoch": 2.645240682917292, "grad_norm": 0.16901636123657227, "learning_rate": 1.1828748428251603e-05, "loss": 0.5579, "mean_token_accuracy": 0.8241643495857716, "num_tokens": 917604020.0, "step": 28751 }, { "entropy": 0.43582000490278006, "epoch": 2.6453326892887334, "grad_norm": 0.14402498304843903, "learning_rate": 1.1825681602109976e-05, "loss": 0.4002, "mean_token_accuracy": 0.8705267235636711, "num_tokens": 917635761.0, "step": 28752 }, { "entropy": 0.50933325313963, "epoch": 2.6454246956601746, "grad_norm": 0.15699726343154907, "learning_rate": 1.1822614775968351e-05, "loss": 0.4995, "mean_token_accuracy": 0.8430102430284023, "num_tokens": 917667728.0, "step": 28753 }, { "entropy": 0.4877262907102704, "epoch": 2.6455167020316157, "grad_norm": 0.15796180069446564, "learning_rate": 1.1819547949826724e-05, "loss": 0.4809, "mean_token_accuracy": 0.8485519029200077, "num_tokens": 917699296.0, "step": 28754 }, { "entropy": 0.5044262949377298, "epoch": 2.645608708403057, "grad_norm": 0.15644749999046326, "learning_rate": 1.1816481123685099e-05, "loss": 0.4832, "mean_token_accuracy": 0.8484356440603733, "num_tokens": 917731258.0, "step": 28755 }, { "entropy": 0.5726930049713701, "epoch": 2.645700714774498, "grad_norm": 0.16766828298568726, "learning_rate": 1.1813414297543472e-05, "loss": 0.5545, "mean_token_accuracy": 0.8242572844028473, "num_tokens": 917762878.0, "step": 28756 }, { "entropy": 0.45696032606065273, "epoch": 2.6457927211459396, "grad_norm": 0.151239812374115, "learning_rate": 1.1810347471401846e-05, "loss": 0.4487, "mean_token_accuracy": 0.8582161776721478, "num_tokens": 917794907.0, "step": 28757 }, { "entropy": 0.5076521569862962, "epoch": 2.6458847275173807, "grad_norm": 0.1636541187763214, "learning_rate": 1.180728064526022e-05, "loss": 0.5038, "mean_token_accuracy": 0.8403318300843239, "num_tokens": 917826431.0, "step": 28758 }, { "entropy": 0.5672588739544153, "epoch": 2.645976733888822, "grad_norm": 0.17682620882987976, "learning_rate": 1.1804213819118595e-05, "loss": 0.5651, "mean_token_accuracy": 0.8215513788163662, "num_tokens": 917856558.0, "step": 28759 }, { "entropy": 0.5077988058328629, "epoch": 2.646068740260263, "grad_norm": 0.15480971336364746, "learning_rate": 1.1801146992976968e-05, "loss": 0.4925, "mean_token_accuracy": 0.841511856764555, "num_tokens": 917888952.0, "step": 28760 }, { "entropy": 0.4400537293404341, "epoch": 2.646160746631704, "grad_norm": 0.14975959062576294, "learning_rate": 1.1798080166835343e-05, "loss": 0.4245, "mean_token_accuracy": 0.8640811778604984, "num_tokens": 917921142.0, "step": 28761 }, { "entropy": 0.48222067300230265, "epoch": 2.6462527530031457, "grad_norm": 0.15726697444915771, "learning_rate": 1.1795013340693718e-05, "loss": 0.4672, "mean_token_accuracy": 0.8538305908441544, "num_tokens": 917953492.0, "step": 28762 }, { "entropy": 0.5213451911695302, "epoch": 2.646344759374587, "grad_norm": 0.15594537556171417, "learning_rate": 1.179194651455209e-05, "loss": 0.5155, "mean_token_accuracy": 0.8387743793427944, "num_tokens": 917986059.0, "step": 28763 }, { "entropy": 0.5434514908120036, "epoch": 2.646436765746028, "grad_norm": 0.1633596569299698, "learning_rate": 1.1788879688410465e-05, "loss": 0.5321, "mean_token_accuracy": 0.8317719399929047, "num_tokens": 918018322.0, "step": 28764 }, { "entropy": 0.5603891015052795, "epoch": 2.646528772117469, "grad_norm": 0.16518478095531464, "learning_rate": 1.1785812862268838e-05, "loss": 0.5509, "mean_token_accuracy": 0.8272021375596523, "num_tokens": 918050581.0, "step": 28765 }, { "entropy": 0.5149916561786085, "epoch": 2.64662077848891, "grad_norm": 0.15552841126918793, "learning_rate": 1.1782746036127213e-05, "loss": 0.5002, "mean_token_accuracy": 0.8422429449856281, "num_tokens": 918083000.0, "step": 28766 }, { "entropy": 0.4137429613620043, "epoch": 2.6467127848603518, "grad_norm": 0.14596933126449585, "learning_rate": 1.1779679209985586e-05, "loss": 0.402, "mean_token_accuracy": 0.8716600984334946, "num_tokens": 918114421.0, "step": 28767 }, { "entropy": 0.5230800965800881, "epoch": 2.646804791231793, "grad_norm": 0.1563464254140854, "learning_rate": 1.177661238384396e-05, "loss": 0.5031, "mean_token_accuracy": 0.8395993672311306, "num_tokens": 918146511.0, "step": 28768 }, { "entropy": 0.5640877950936556, "epoch": 2.646896797603234, "grad_norm": 0.1742185354232788, "learning_rate": 1.1773545557702333e-05, "loss": 0.5679, "mean_token_accuracy": 0.8234096616506577, "num_tokens": 918178082.0, "step": 28769 }, { "entropy": 0.5843622091924772, "epoch": 2.646988803974675, "grad_norm": 0.1697610318660736, "learning_rate": 1.1770478731560708e-05, "loss": 0.5697, "mean_token_accuracy": 0.8212429359555244, "num_tokens": 918210289.0, "step": 28770 }, { "entropy": 0.5266028195619583, "epoch": 2.6470808103461163, "grad_norm": 0.15974664688110352, "learning_rate": 1.1767411905419081e-05, "loss": 0.5226, "mean_token_accuracy": 0.8385157659649849, "num_tokens": 918242023.0, "step": 28771 }, { "entropy": 0.5560938399285078, "epoch": 2.647172816717558, "grad_norm": 0.1614796221256256, "learning_rate": 1.1764345079277456e-05, "loss": 0.5355, "mean_token_accuracy": 0.8326404392719269, "num_tokens": 918274412.0, "step": 28772 }, { "entropy": 0.5337304044514894, "epoch": 2.647264823088999, "grad_norm": 0.1659715324640274, "learning_rate": 1.176127825313583e-05, "loss": 0.5234, "mean_token_accuracy": 0.8335300423204899, "num_tokens": 918305760.0, "step": 28773 }, { "entropy": 0.5875033475458622, "epoch": 2.64735682946044, "grad_norm": 0.17049695551395416, "learning_rate": 1.1758211426994205e-05, "loss": 0.5738, "mean_token_accuracy": 0.8194296173751354, "num_tokens": 918336804.0, "step": 28774 }, { "entropy": 0.5057355854660273, "epoch": 2.6474488358318813, "grad_norm": 0.1593417525291443, "learning_rate": 1.1755144600852578e-05, "loss": 0.4998, "mean_token_accuracy": 0.8445032238960266, "num_tokens": 918368488.0, "step": 28775 }, { "entropy": 0.43819689378142357, "epoch": 2.6475408422033224, "grad_norm": 0.14694347977638245, "learning_rate": 1.1752077774710953e-05, "loss": 0.4187, "mean_token_accuracy": 0.8661615774035454, "num_tokens": 918400441.0, "step": 28776 }, { "entropy": 0.461835247464478, "epoch": 2.647632848574764, "grad_norm": 0.1542579084634781, "learning_rate": 1.1749010948569327e-05, "loss": 0.4548, "mean_token_accuracy": 0.856860276311636, "num_tokens": 918432458.0, "step": 28777 }, { "entropy": 0.5682737324386835, "epoch": 2.647724854946205, "grad_norm": 0.17067085206508636, "learning_rate": 1.17459441224277e-05, "loss": 0.556, "mean_token_accuracy": 0.8235663138329983, "num_tokens": 918463360.0, "step": 28778 }, { "entropy": 0.5833244975656271, "epoch": 2.6478168613176463, "grad_norm": 0.17005330324172974, "learning_rate": 1.1742877296286075e-05, "loss": 0.5855, "mean_token_accuracy": 0.8155643194913864, "num_tokens": 918495029.0, "step": 28779 }, { "entropy": 0.5389425428584218, "epoch": 2.6479088676890874, "grad_norm": 0.15924480557441711, "learning_rate": 1.1739810470144448e-05, "loss": 0.5335, "mean_token_accuracy": 0.831562701612711, "num_tokens": 918527044.0, "step": 28780 }, { "entropy": 0.5666505191475153, "epoch": 2.6480008740605285, "grad_norm": 0.16455380618572235, "learning_rate": 1.1736743644002822e-05, "loss": 0.5564, "mean_token_accuracy": 0.8241432160139084, "num_tokens": 918558963.0, "step": 28781 }, { "entropy": 0.41722196247428656, "epoch": 2.64809288043197, "grad_norm": 0.148321732878685, "learning_rate": 1.1733676817861195e-05, "loss": 0.4055, "mean_token_accuracy": 0.867571733891964, "num_tokens": 918590763.0, "step": 28782 }, { "entropy": 0.5554351955652237, "epoch": 2.6481848868034112, "grad_norm": 0.16216270625591278, "learning_rate": 1.173060999171957e-05, "loss": 0.551, "mean_token_accuracy": 0.8274241015315056, "num_tokens": 918622648.0, "step": 28783 }, { "entropy": 0.49259709008038044, "epoch": 2.6482768931748524, "grad_norm": 0.16039922833442688, "learning_rate": 1.1727543165577943e-05, "loss": 0.4865, "mean_token_accuracy": 0.8430407010018826, "num_tokens": 918655205.0, "step": 28784 }, { "entropy": 0.4696511793881655, "epoch": 2.6483688995462935, "grad_norm": 0.15261246263980865, "learning_rate": 1.1724476339436318e-05, "loss": 0.4567, "mean_token_accuracy": 0.8511829562485218, "num_tokens": 918686591.0, "step": 28785 }, { "entropy": 0.47440471430309117, "epoch": 2.6484609059177346, "grad_norm": 0.15576942265033722, "learning_rate": 1.172140951329469e-05, "loss": 0.4638, "mean_token_accuracy": 0.8534597791731358, "num_tokens": 918718123.0, "step": 28786 }, { "entropy": 0.5218381993472576, "epoch": 2.648552912289176, "grad_norm": 0.1551813781261444, "learning_rate": 1.1718342687153065e-05, "loss": 0.5126, "mean_token_accuracy": 0.8372680135071278, "num_tokens": 918750538.0, "step": 28787 }, { "entropy": 0.5330056045204401, "epoch": 2.6486449186606174, "grad_norm": 0.16664695739746094, "learning_rate": 1.171527586101144e-05, "loss": 0.5238, "mean_token_accuracy": 0.8307797834277153, "num_tokens": 918781553.0, "step": 28788 }, { "entropy": 0.6427152808755636, "epoch": 2.6487369250320585, "grad_norm": 0.17343418300151825, "learning_rate": 1.1712209034869815e-05, "loss": 0.6273, "mean_token_accuracy": 0.8057025782763958, "num_tokens": 918813714.0, "step": 28789 }, { "entropy": 0.5866692755371332, "epoch": 2.6488289314034996, "grad_norm": 0.1644899696111679, "learning_rate": 1.1709142208728188e-05, "loss": 0.5741, "mean_token_accuracy": 0.8181932717561722, "num_tokens": 918845720.0, "step": 28790 }, { "entropy": 0.5473570069298148, "epoch": 2.6489209377749408, "grad_norm": 0.15876436233520508, "learning_rate": 1.1706075382586562e-05, "loss": 0.5323, "mean_token_accuracy": 0.8341119438409805, "num_tokens": 918877990.0, "step": 28791 }, { "entropy": 0.5324613144621253, "epoch": 2.6490129441463823, "grad_norm": 0.16195109486579895, "learning_rate": 1.1703008556444937e-05, "loss": 0.5261, "mean_token_accuracy": 0.8361369110643864, "num_tokens": 918910165.0, "step": 28792 }, { "entropy": 0.5300194807350636, "epoch": 2.6491049505178235, "grad_norm": 0.16201086342334747, "learning_rate": 1.169994173030331e-05, "loss": 0.5262, "mean_token_accuracy": 0.8309770785272121, "num_tokens": 918942435.0, "step": 28793 }, { "entropy": 0.5785079002380371, "epoch": 2.6491969568892646, "grad_norm": 0.1642068475484848, "learning_rate": 1.1696874904161684e-05, "loss": 0.5575, "mean_token_accuracy": 0.8220583759248257, "num_tokens": 918974250.0, "step": 28794 }, { "entropy": 0.4624935849569738, "epoch": 2.6492889632607057, "grad_norm": 0.1514480859041214, "learning_rate": 1.1693808078020057e-05, "loss": 0.4443, "mean_token_accuracy": 0.8580941371619701, "num_tokens": 919006255.0, "step": 28795 }, { "entropy": 0.6029708441346884, "epoch": 2.649380969632147, "grad_norm": 0.16807787120342255, "learning_rate": 1.1690741251878432e-05, "loss": 0.5766, "mean_token_accuracy": 0.8142900727689266, "num_tokens": 919037662.0, "step": 28796 }, { "entropy": 0.4673174303025007, "epoch": 2.6494729760035884, "grad_norm": 0.1571856439113617, "learning_rate": 1.1687674425736805e-05, "loss": 0.4576, "mean_token_accuracy": 0.8541359826922417, "num_tokens": 919069870.0, "step": 28797 }, { "entropy": 0.48800642881542444, "epoch": 2.6495649823750296, "grad_norm": 0.15790994465351105, "learning_rate": 1.168460759959518e-05, "loss": 0.4843, "mean_token_accuracy": 0.8450450412929058, "num_tokens": 919102618.0, "step": 28798 }, { "entropy": 0.6250187903642654, "epoch": 2.6496569887464707, "grad_norm": 0.16792535781860352, "learning_rate": 1.1681540773453553e-05, "loss": 0.6229, "mean_token_accuracy": 0.806537851691246, "num_tokens": 919134748.0, "step": 28799 }, { "entropy": 0.5083028310909867, "epoch": 2.649748995117912, "grad_norm": 0.16409993171691895, "learning_rate": 1.1678473947311927e-05, "loss": 0.4995, "mean_token_accuracy": 0.8409009538590908, "num_tokens": 919166083.0, "step": 28800 }, { "entropy": 0.6117040030658245, "epoch": 2.649841001489353, "grad_norm": 0.1708724945783615, "learning_rate": 1.16754071211703e-05, "loss": 0.5982, "mean_token_accuracy": 0.8129551745951176, "num_tokens": 919197757.0, "step": 28801 }, { "entropy": 0.5502398982644081, "epoch": 2.6499330078607946, "grad_norm": 0.16080158948898315, "learning_rate": 1.1672340295028675e-05, "loss": 0.532, "mean_token_accuracy": 0.8323500491678715, "num_tokens": 919230138.0, "step": 28802 }, { "entropy": 0.47903060261160135, "epoch": 2.6500250142322357, "grad_norm": 0.1572715789079666, "learning_rate": 1.166927346888705e-05, "loss": 0.4544, "mean_token_accuracy": 0.8538713753223419, "num_tokens": 919261585.0, "step": 28803 }, { "entropy": 0.48921376012731344, "epoch": 2.650117020603677, "grad_norm": 0.15673480927944183, "learning_rate": 1.1666206642745424e-05, "loss": 0.4818, "mean_token_accuracy": 0.8477040342986584, "num_tokens": 919294012.0, "step": 28804 }, { "entropy": 0.5180733636952937, "epoch": 2.650209026975118, "grad_norm": 0.15873152017593384, "learning_rate": 1.1663139816603797e-05, "loss": 0.5134, "mean_token_accuracy": 0.8371925167739391, "num_tokens": 919325589.0, "step": 28805 }, { "entropy": 0.5249496595934033, "epoch": 2.650301033346559, "grad_norm": 0.15606962144374847, "learning_rate": 1.1660072990462172e-05, "loss": 0.5123, "mean_token_accuracy": 0.8380061499774456, "num_tokens": 919357728.0, "step": 28806 }, { "entropy": 0.6388131342828274, "epoch": 2.6503930397180007, "grad_norm": 0.17528894543647766, "learning_rate": 1.1657006164320546e-05, "loss": 0.6252, "mean_token_accuracy": 0.803727000951767, "num_tokens": 919389901.0, "step": 28807 }, { "entropy": 0.42379310447722673, "epoch": 2.650485046089442, "grad_norm": 0.14504177868366241, "learning_rate": 1.165393933817892e-05, "loss": 0.4083, "mean_token_accuracy": 0.8720941171050072, "num_tokens": 919421930.0, "step": 28808 }, { "entropy": 0.48740063048899174, "epoch": 2.650577052460883, "grad_norm": 0.15799453854560852, "learning_rate": 1.1650872512037294e-05, "loss": 0.488, "mean_token_accuracy": 0.8480444177985191, "num_tokens": 919453817.0, "step": 28809 }, { "entropy": 0.4098177789710462, "epoch": 2.650669058832324, "grad_norm": 0.1424012929201126, "learning_rate": 1.1647805685895667e-05, "loss": 0.4001, "mean_token_accuracy": 0.8725295104086399, "num_tokens": 919485540.0, "step": 28810 }, { "entropy": 0.39254640880972147, "epoch": 2.650761065203765, "grad_norm": 0.14500655233860016, "learning_rate": 1.1644738859754042e-05, "loss": 0.378, "mean_token_accuracy": 0.8753307349979877, "num_tokens": 919517335.0, "step": 28811 }, { "entropy": 0.548517391551286, "epoch": 2.6508530715752068, "grad_norm": 0.15955474972724915, "learning_rate": 1.1641672033612415e-05, "loss": 0.5413, "mean_token_accuracy": 0.831128466874361, "num_tokens": 919549808.0, "step": 28812 }, { "entropy": 0.5489461291581392, "epoch": 2.650945077946648, "grad_norm": 0.16356602311134338, "learning_rate": 1.1638605207470789e-05, "loss": 0.5451, "mean_token_accuracy": 0.8268807902932167, "num_tokens": 919582576.0, "step": 28813 }, { "entropy": 0.5003098761662841, "epoch": 2.651037084318089, "grad_norm": 0.160952627658844, "learning_rate": 1.1635538381329162e-05, "loss": 0.4895, "mean_token_accuracy": 0.8432111367583275, "num_tokens": 919614098.0, "step": 28814 }, { "entropy": 0.4538921982748434, "epoch": 2.65112909068953, "grad_norm": 0.1483657956123352, "learning_rate": 1.1632471555187537e-05, "loss": 0.4453, "mean_token_accuracy": 0.8583572767674923, "num_tokens": 919646352.0, "step": 28815 }, { "entropy": 0.483564087189734, "epoch": 2.6512210970609713, "grad_norm": 0.15381929278373718, "learning_rate": 1.162940472904591e-05, "loss": 0.4835, "mean_token_accuracy": 0.8496550470590591, "num_tokens": 919677923.0, "step": 28816 }, { "entropy": 0.5270320668350905, "epoch": 2.651313103432413, "grad_norm": 0.15517547726631165, "learning_rate": 1.1626337902904284e-05, "loss": 0.5076, "mean_token_accuracy": 0.8417076282203197, "num_tokens": 919710024.0, "step": 28817 }, { "entropy": 0.4876444151159376, "epoch": 2.651405109803854, "grad_norm": 0.15330296754837036, "learning_rate": 1.1623271076762659e-05, "loss": 0.4741, "mean_token_accuracy": 0.8511433154344559, "num_tokens": 919742243.0, "step": 28818 }, { "entropy": 0.522134805098176, "epoch": 2.651497116175295, "grad_norm": 0.16429181396961212, "learning_rate": 1.1620204250621034e-05, "loss": 0.5051, "mean_token_accuracy": 0.8360271789133549, "num_tokens": 919773367.0, "step": 28819 }, { "entropy": 0.5751425940543413, "epoch": 2.6515891225467363, "grad_norm": 0.17196537554264069, "learning_rate": 1.1617137424479407e-05, "loss": 0.5593, "mean_token_accuracy": 0.821364015340805, "num_tokens": 919804148.0, "step": 28820 }, { "entropy": 0.4761507138609886, "epoch": 2.6516811289181774, "grad_norm": 0.15233781933784485, "learning_rate": 1.1614070598337781e-05, "loss": 0.4727, "mean_token_accuracy": 0.8483154848217964, "num_tokens": 919836403.0, "step": 28821 }, { "entropy": 0.4733266527764499, "epoch": 2.651773135289619, "grad_norm": 0.15399260818958282, "learning_rate": 1.1611003772196156e-05, "loss": 0.4615, "mean_token_accuracy": 0.8517880365252495, "num_tokens": 919868179.0, "step": 28822 }, { "entropy": 0.520445916801691, "epoch": 2.65186514166106, "grad_norm": 0.15567605197429657, "learning_rate": 1.1607936946054529e-05, "loss": 0.501, "mean_token_accuracy": 0.8413637727499008, "num_tokens": 919900411.0, "step": 28823 }, { "entropy": 0.4973383608739823, "epoch": 2.6519571480325013, "grad_norm": 0.16196182370185852, "learning_rate": 1.1604870119912903e-05, "loss": 0.4781, "mean_token_accuracy": 0.8476026505231857, "num_tokens": 919932459.0, "step": 28824 }, { "entropy": 0.5009486861526966, "epoch": 2.6520491544039424, "grad_norm": 0.16490040719509125, "learning_rate": 1.1601803293771276e-05, "loss": 0.484, "mean_token_accuracy": 0.8435639031231403, "num_tokens": 919963071.0, "step": 28825 }, { "entropy": 0.4292986420914531, "epoch": 2.6521411607753835, "grad_norm": 0.1510550081729889, "learning_rate": 1.1598736467629651e-05, "loss": 0.4207, "mean_token_accuracy": 0.8654972203075886, "num_tokens": 919995159.0, "step": 28826 }, { "entropy": 0.5045467801392078, "epoch": 2.652233167146825, "grad_norm": 0.1620698869228363, "learning_rate": 1.1595669641488024e-05, "loss": 0.4922, "mean_token_accuracy": 0.8431127406656742, "num_tokens": 920025517.0, "step": 28827 }, { "entropy": 0.40826261416077614, "epoch": 2.6523251735182662, "grad_norm": 0.14985404908657074, "learning_rate": 1.1592602815346399e-05, "loss": 0.3979, "mean_token_accuracy": 0.8736971691250801, "num_tokens": 920058183.0, "step": 28828 }, { "entropy": 0.48144004703499377, "epoch": 2.6524171798897074, "grad_norm": 0.15618333220481873, "learning_rate": 1.1589535989204772e-05, "loss": 0.4807, "mean_token_accuracy": 0.8494706340134144, "num_tokens": 920090133.0, "step": 28829 }, { "entropy": 0.5454852096736431, "epoch": 2.6525091862611485, "grad_norm": 0.16406214237213135, "learning_rate": 1.1586469163063146e-05, "loss": 0.5441, "mean_token_accuracy": 0.8288193941116333, "num_tokens": 920122225.0, "step": 28830 }, { "entropy": 0.5285872649401426, "epoch": 2.6526011926325896, "grad_norm": 0.16437029838562012, "learning_rate": 1.158340233692152e-05, "loss": 0.5084, "mean_token_accuracy": 0.8407761678099632, "num_tokens": 920153442.0, "step": 28831 }, { "entropy": 0.457078842446208, "epoch": 2.652693199004031, "grad_norm": 0.15769025683403015, "learning_rate": 1.1580335510779894e-05, "loss": 0.4497, "mean_token_accuracy": 0.8558338545262814, "num_tokens": 920185075.0, "step": 28832 }, { "entropy": 0.5321084551978856, "epoch": 2.6527852053754724, "grad_norm": 0.15660378336906433, "learning_rate": 1.1577268684638269e-05, "loss": 0.52, "mean_token_accuracy": 0.8344325944781303, "num_tokens": 920217373.0, "step": 28833 }, { "entropy": 0.5211480623111129, "epoch": 2.6528772117469135, "grad_norm": 0.15766727924346924, "learning_rate": 1.1574201858496643e-05, "loss": 0.5085, "mean_token_accuracy": 0.8375481143593788, "num_tokens": 920249460.0, "step": 28834 }, { "entropy": 0.46499805990606546, "epoch": 2.6529692181183546, "grad_norm": 0.1509428471326828, "learning_rate": 1.1571135032355016e-05, "loss": 0.4662, "mean_token_accuracy": 0.8557081259787083, "num_tokens": 920281445.0, "step": 28835 }, { "entropy": 0.5339729944244027, "epoch": 2.6530612244897958, "grad_norm": 0.16355639696121216, "learning_rate": 1.156806820621339e-05, "loss": 0.5211, "mean_token_accuracy": 0.8354386016726494, "num_tokens": 920313210.0, "step": 28836 }, { "entropy": 0.5060730203986168, "epoch": 2.6531532308612373, "grad_norm": 0.1599336564540863, "learning_rate": 1.1565001380071765e-05, "loss": 0.4984, "mean_token_accuracy": 0.842818059027195, "num_tokens": 920345455.0, "step": 28837 }, { "entropy": 0.5193018034333363, "epoch": 2.6532452372326785, "grad_norm": 0.15960797667503357, "learning_rate": 1.1561934553930138e-05, "loss": 0.4958, "mean_token_accuracy": 0.8408625237643719, "num_tokens": 920376268.0, "step": 28838 }, { "entropy": 0.5366523768752813, "epoch": 2.6533372436041196, "grad_norm": 0.15814200043678284, "learning_rate": 1.1558867727788513e-05, "loss": 0.5288, "mean_token_accuracy": 0.8361287489533424, "num_tokens": 920408165.0, "step": 28839 }, { "entropy": 0.4937323946505785, "epoch": 2.6534292499755607, "grad_norm": 0.1560867875814438, "learning_rate": 1.1555800901646886e-05, "loss": 0.4801, "mean_token_accuracy": 0.8499038815498352, "num_tokens": 920440293.0, "step": 28840 }, { "entropy": 0.46452000830322504, "epoch": 2.653521256347002, "grad_norm": 0.14980503916740417, "learning_rate": 1.155273407550526e-05, "loss": 0.4447, "mean_token_accuracy": 0.8583895340561867, "num_tokens": 920472301.0, "step": 28841 }, { "entropy": 0.38741540629416704, "epoch": 2.6536132627184434, "grad_norm": 0.1445481777191162, "learning_rate": 1.1549667249363634e-05, "loss": 0.3725, "mean_token_accuracy": 0.8811756446957588, "num_tokens": 920503712.0, "step": 28842 }, { "entropy": 0.5556134432554245, "epoch": 2.6537052690898846, "grad_norm": 0.16922315955162048, "learning_rate": 1.1546600423222008e-05, "loss": 0.543, "mean_token_accuracy": 0.826539546251297, "num_tokens": 920535377.0, "step": 28843 }, { "entropy": 0.5630683926865458, "epoch": 2.6537972754613257, "grad_norm": 0.16208823025226593, "learning_rate": 1.1543533597080381e-05, "loss": 0.5571, "mean_token_accuracy": 0.8237583935260773, "num_tokens": 920567646.0, "step": 28844 }, { "entropy": 0.45545705361291766, "epoch": 2.653889281832767, "grad_norm": 0.14963293075561523, "learning_rate": 1.1540466770938756e-05, "loss": 0.4397, "mean_token_accuracy": 0.860712468624115, "num_tokens": 920600273.0, "step": 28845 }, { "entropy": 0.49978402629494667, "epoch": 2.653981288204208, "grad_norm": 0.1617150604724884, "learning_rate": 1.1537399944797129e-05, "loss": 0.4869, "mean_token_accuracy": 0.8457084223628044, "num_tokens": 920631121.0, "step": 28846 }, { "entropy": 0.5586301786825061, "epoch": 2.6540732945756496, "grad_norm": 0.1589001566171646, "learning_rate": 1.1534333118655503e-05, "loss": 0.5388, "mean_token_accuracy": 0.8352234549820423, "num_tokens": 920662957.0, "step": 28847 }, { "entropy": 0.541945880278945, "epoch": 2.6541653009470907, "grad_norm": 0.16378414630889893, "learning_rate": 1.1531266292513878e-05, "loss": 0.5383, "mean_token_accuracy": 0.8277011029422283, "num_tokens": 920694585.0, "step": 28848 }, { "entropy": 0.5226876251399517, "epoch": 2.654257307318532, "grad_norm": 0.16085118055343628, "learning_rate": 1.1528199466372253e-05, "loss": 0.5083, "mean_token_accuracy": 0.8404539227485657, "num_tokens": 920725256.0, "step": 28849 }, { "entropy": 0.6017829105257988, "epoch": 2.654349313689973, "grad_norm": 0.1672353744506836, "learning_rate": 1.1525132640230626e-05, "loss": 0.5878, "mean_token_accuracy": 0.8135151080787182, "num_tokens": 920757338.0, "step": 28850 }, { "entropy": 0.4616660689935088, "epoch": 2.654441320061414, "grad_norm": 0.1490236520767212, "learning_rate": 1.1522065814089e-05, "loss": 0.4557, "mean_token_accuracy": 0.8589731231331825, "num_tokens": 920789711.0, "step": 28851 }, { "entropy": 0.5110806245356798, "epoch": 2.6545333264328557, "grad_norm": 0.14901046454906464, "learning_rate": 1.1518998987947375e-05, "loss": 0.4891, "mean_token_accuracy": 0.8483474105596542, "num_tokens": 920822137.0, "step": 28852 }, { "entropy": 0.5296273855492473, "epoch": 2.654625332804297, "grad_norm": 0.16277827322483063, "learning_rate": 1.1515932161805748e-05, "loss": 0.5157, "mean_token_accuracy": 0.835829459130764, "num_tokens": 920853749.0, "step": 28853 }, { "entropy": 0.5225535118952394, "epoch": 2.654717339175738, "grad_norm": 0.16000565886497498, "learning_rate": 1.1512865335664123e-05, "loss": 0.5191, "mean_token_accuracy": 0.8352160751819611, "num_tokens": 920886056.0, "step": 28854 }, { "entropy": 0.5061300825327635, "epoch": 2.654809345547179, "grad_norm": 0.15158826112747192, "learning_rate": 1.1509798509522496e-05, "loss": 0.496, "mean_token_accuracy": 0.8445197232067585, "num_tokens": 920918063.0, "step": 28855 }, { "entropy": 0.44864368974231184, "epoch": 2.65490135191862, "grad_norm": 0.14974841475486755, "learning_rate": 1.150673168338087e-05, "loss": 0.435, "mean_token_accuracy": 0.8592342399060726, "num_tokens": 920950090.0, "step": 28856 }, { "entropy": 0.4751388542354107, "epoch": 2.6549933582900618, "grad_norm": 0.15677814185619354, "learning_rate": 1.1503664857239243e-05, "loss": 0.4644, "mean_token_accuracy": 0.8536449559032917, "num_tokens": 920982278.0, "step": 28857 }, { "entropy": 0.46455737645737827, "epoch": 2.655085364661503, "grad_norm": 0.14931508898735046, "learning_rate": 1.1500598031097618e-05, "loss": 0.4484, "mean_token_accuracy": 0.8552791886031628, "num_tokens": 921013899.0, "step": 28858 }, { "entropy": 0.49210391752421856, "epoch": 2.655177371032944, "grad_norm": 0.16435809433460236, "learning_rate": 1.149753120495599e-05, "loss": 0.4829, "mean_token_accuracy": 0.8460629545152187, "num_tokens": 921045590.0, "step": 28859 }, { "entropy": 0.46547913015820086, "epoch": 2.655269377404385, "grad_norm": 0.15756583213806152, "learning_rate": 1.1494464378814365e-05, "loss": 0.4569, "mean_token_accuracy": 0.8550718352198601, "num_tokens": 921077956.0, "step": 28860 }, { "entropy": 0.4948320398107171, "epoch": 2.6553613837758263, "grad_norm": 0.1554858535528183, "learning_rate": 1.1491397552672738e-05, "loss": 0.4767, "mean_token_accuracy": 0.8448416739702225, "num_tokens": 921109709.0, "step": 28861 }, { "entropy": 0.5655826134607196, "epoch": 2.655453390147268, "grad_norm": 0.17152836918830872, "learning_rate": 1.1488330726531113e-05, "loss": 0.5597, "mean_token_accuracy": 0.8233070783317089, "num_tokens": 921141483.0, "step": 28862 }, { "entropy": 0.4513467224314809, "epoch": 2.655545396518709, "grad_norm": 0.14878158271312714, "learning_rate": 1.1485263900389488e-05, "loss": 0.4335, "mean_token_accuracy": 0.8566168546676636, "num_tokens": 921172679.0, "step": 28863 }, { "entropy": 0.5855150055140257, "epoch": 2.65563740289015, "grad_norm": 0.16604682803153992, "learning_rate": 1.1482197074247862e-05, "loss": 0.5721, "mean_token_accuracy": 0.8177433498203754, "num_tokens": 921204402.0, "step": 28864 }, { "entropy": 0.4818029007874429, "epoch": 2.6557294092615913, "grad_norm": 0.15875160694122314, "learning_rate": 1.1479130248106235e-05, "loss": 0.4739, "mean_token_accuracy": 0.848325464874506, "num_tokens": 921236836.0, "step": 28865 }, { "entropy": 0.4644493702799082, "epoch": 2.6558214156330324, "grad_norm": 0.14881344139575958, "learning_rate": 1.147606342196461e-05, "loss": 0.4476, "mean_token_accuracy": 0.8580477200448513, "num_tokens": 921269095.0, "step": 28866 }, { "entropy": 0.5065218202071264, "epoch": 2.655913422004474, "grad_norm": 0.15947562456130981, "learning_rate": 1.1472996595822985e-05, "loss": 0.4895, "mean_token_accuracy": 0.8429708480834961, "num_tokens": 921299978.0, "step": 28867 }, { "entropy": 0.6082346495240927, "epoch": 2.656005428375915, "grad_norm": 0.17224891483783722, "learning_rate": 1.1469929769681357e-05, "loss": 0.6, "mean_token_accuracy": 0.8080989085137844, "num_tokens": 921331671.0, "step": 28868 }, { "entropy": 0.48745962092652917, "epoch": 2.6560974347473563, "grad_norm": 0.15119503438472748, "learning_rate": 1.1466862943539732e-05, "loss": 0.4787, "mean_token_accuracy": 0.8457644954323769, "num_tokens": 921364131.0, "step": 28869 }, { "entropy": 0.610381655395031, "epoch": 2.6561894411187974, "grad_norm": 0.17574764788150787, "learning_rate": 1.1463796117398105e-05, "loss": 0.597, "mean_token_accuracy": 0.8120545670390129, "num_tokens": 921395366.0, "step": 28870 }, { "entropy": 0.46397441904991865, "epoch": 2.6562814474902385, "grad_norm": 0.15029343962669373, "learning_rate": 1.146072929125648e-05, "loss": 0.4506, "mean_token_accuracy": 0.8553931452333927, "num_tokens": 921427699.0, "step": 28871 }, { "entropy": 0.5122597478330135, "epoch": 2.65637345386168, "grad_norm": 0.15980160236358643, "learning_rate": 1.1457662465114853e-05, "loss": 0.5031, "mean_token_accuracy": 0.8384366892278194, "num_tokens": 921459777.0, "step": 28872 }, { "entropy": 0.5007306970655918, "epoch": 2.6564654602331212, "grad_norm": 0.1584997922182083, "learning_rate": 1.1454595638973227e-05, "loss": 0.4796, "mean_token_accuracy": 0.8449828438460827, "num_tokens": 921491214.0, "step": 28873 }, { "entropy": 0.4075529705733061, "epoch": 2.6565574666045624, "grad_norm": 0.14543195068836212, "learning_rate": 1.14515288128316e-05, "loss": 0.3913, "mean_token_accuracy": 0.8704181052744389, "num_tokens": 921523624.0, "step": 28874 }, { "entropy": 0.5641326643526554, "epoch": 2.6566494729760035, "grad_norm": 0.16436617076396942, "learning_rate": 1.1448461986689975e-05, "loss": 0.5436, "mean_token_accuracy": 0.8282583057880402, "num_tokens": 921555408.0, "step": 28875 }, { "entropy": 0.5708536002784967, "epoch": 2.6567414793474446, "grad_norm": 0.1640792340040207, "learning_rate": 1.1445395160548348e-05, "loss": 0.5538, "mean_token_accuracy": 0.822257824242115, "num_tokens": 921587401.0, "step": 28876 }, { "entropy": 0.5666517075151205, "epoch": 2.6568334857188862, "grad_norm": 0.16982007026672363, "learning_rate": 1.1442328334406723e-05, "loss": 0.5521, "mean_token_accuracy": 0.8223383538424969, "num_tokens": 921618345.0, "step": 28877 }, { "entropy": 0.5700540179386735, "epoch": 2.6569254920903274, "grad_norm": 0.16704261302947998, "learning_rate": 1.1439261508265097e-05, "loss": 0.5597, "mean_token_accuracy": 0.822387345135212, "num_tokens": 921649914.0, "step": 28878 }, { "entropy": 0.5816276972182095, "epoch": 2.6570174984617685, "grad_norm": 0.16332949697971344, "learning_rate": 1.143619468212347e-05, "loss": 0.5735, "mean_token_accuracy": 0.8216975815594196, "num_tokens": 921682580.0, "step": 28879 }, { "entropy": 0.41573788598179817, "epoch": 2.6571095048332096, "grad_norm": 0.13832968473434448, "learning_rate": 1.1433127855981845e-05, "loss": 0.4013, "mean_token_accuracy": 0.8709391802549362, "num_tokens": 921715348.0, "step": 28880 }, { "entropy": 0.48941375222057104, "epoch": 2.6572015112046508, "grad_norm": 0.16032738983631134, "learning_rate": 1.143006102984022e-05, "loss": 0.4917, "mean_token_accuracy": 0.8448325358331203, "num_tokens": 921746974.0, "step": 28881 }, { "entropy": 0.4746137438341975, "epoch": 2.6572935175760923, "grad_norm": 0.15737198293209076, "learning_rate": 1.1426994203698594e-05, "loss": 0.4732, "mean_token_accuracy": 0.8505882620811462, "num_tokens": 921779362.0, "step": 28882 }, { "entropy": 0.41488434188067913, "epoch": 2.6573855239475335, "grad_norm": 0.149521142244339, "learning_rate": 1.1423927377556967e-05, "loss": 0.3907, "mean_token_accuracy": 0.8720037154853344, "num_tokens": 921810408.0, "step": 28883 }, { "entropy": 0.5074068661779165, "epoch": 2.6574775303189746, "grad_norm": 0.15648092329502106, "learning_rate": 1.1420860551415342e-05, "loss": 0.4883, "mean_token_accuracy": 0.845851369202137, "num_tokens": 921842187.0, "step": 28884 }, { "entropy": 0.5140665543731302, "epoch": 2.6575695366904157, "grad_norm": 0.15848307311534882, "learning_rate": 1.1417793725273715e-05, "loss": 0.4983, "mean_token_accuracy": 0.8425961919128895, "num_tokens": 921874343.0, "step": 28885 }, { "entropy": 0.48225456196814775, "epoch": 2.657661543061857, "grad_norm": 0.15924705564975739, "learning_rate": 1.141472689913209e-05, "loss": 0.4798, "mean_token_accuracy": 0.8480853922665119, "num_tokens": 921906281.0, "step": 28886 }, { "entropy": 0.5341044524684548, "epoch": 2.6577535494332984, "grad_norm": 0.1596551239490509, "learning_rate": 1.1411660072990462e-05, "loss": 0.5223, "mean_token_accuracy": 0.8334156572818756, "num_tokens": 921938704.0, "step": 28887 }, { "entropy": 0.579834305215627, "epoch": 2.6578455558047396, "grad_norm": 0.17013633251190186, "learning_rate": 1.1408593246848837e-05, "loss": 0.5663, "mean_token_accuracy": 0.8207336813211441, "num_tokens": 921970898.0, "step": 28888 }, { "entropy": 0.4263748312368989, "epoch": 2.6579375621761807, "grad_norm": 0.14461533725261688, "learning_rate": 1.140552642070721e-05, "loss": 0.412, "mean_token_accuracy": 0.8686658926308155, "num_tokens": 922003533.0, "step": 28889 }, { "entropy": 0.4736303063109517, "epoch": 2.658029568547622, "grad_norm": 0.15496008098125458, "learning_rate": 1.1402459594565584e-05, "loss": 0.4568, "mean_token_accuracy": 0.8532443232834339, "num_tokens": 922035487.0, "step": 28890 }, { "entropy": 0.4361442094668746, "epoch": 2.658121574919063, "grad_norm": 0.15027831494808197, "learning_rate": 1.1399392768423957e-05, "loss": 0.4211, "mean_token_accuracy": 0.8633706718683243, "num_tokens": 922067369.0, "step": 28891 }, { "entropy": 0.5184051217511296, "epoch": 2.6582135812905046, "grad_norm": 0.15850141644477844, "learning_rate": 1.1396325942282332e-05, "loss": 0.5075, "mean_token_accuracy": 0.8395510278642178, "num_tokens": 922099345.0, "step": 28892 }, { "entropy": 0.6079401150345802, "epoch": 2.6583055876619457, "grad_norm": 0.17237356305122375, "learning_rate": 1.1393259116140707e-05, "loss": 0.6083, "mean_token_accuracy": 0.8101743087172508, "num_tokens": 922131261.0, "step": 28893 }, { "entropy": 0.5557158151641488, "epoch": 2.658397594033387, "grad_norm": 0.160530224442482, "learning_rate": 1.139019228999908e-05, "loss": 0.5409, "mean_token_accuracy": 0.8289968594908714, "num_tokens": 922163060.0, "step": 28894 }, { "entropy": 0.45073823537677526, "epoch": 2.658489600404828, "grad_norm": 0.15137948095798492, "learning_rate": 1.1387125463857454e-05, "loss": 0.4426, "mean_token_accuracy": 0.8568217195570469, "num_tokens": 922195483.0, "step": 28895 }, { "entropy": 0.43022868363186717, "epoch": 2.658581606776269, "grad_norm": 0.14816391468048096, "learning_rate": 1.1384058637715829e-05, "loss": 0.417, "mean_token_accuracy": 0.8633828684687614, "num_tokens": 922226366.0, "step": 28896 }, { "entropy": 0.47373247891664505, "epoch": 2.6586736131477107, "grad_norm": 0.15252232551574707, "learning_rate": 1.1380991811574204e-05, "loss": 0.4614, "mean_token_accuracy": 0.8513346500694752, "num_tokens": 922258106.0, "step": 28897 }, { "entropy": 0.5090431307908148, "epoch": 2.658765619519152, "grad_norm": 0.1535559445619583, "learning_rate": 1.1377924985432577e-05, "loss": 0.4906, "mean_token_accuracy": 0.8464592024683952, "num_tokens": 922290201.0, "step": 28898 }, { "entropy": 0.5336899869143963, "epoch": 2.658857625890593, "grad_norm": 0.16209274530410767, "learning_rate": 1.1374858159290951e-05, "loss": 0.5286, "mean_token_accuracy": 0.8336113542318344, "num_tokens": 922321750.0, "step": 28899 }, { "entropy": 0.42937108036130667, "epoch": 2.658949632262034, "grad_norm": 0.1516285091638565, "learning_rate": 1.1371791333149324e-05, "loss": 0.4224, "mean_token_accuracy": 0.8660693317651749, "num_tokens": 922353813.0, "step": 28900 }, { "entropy": 0.4567582723684609, "epoch": 2.659041638633475, "grad_norm": 0.15385836362838745, "learning_rate": 1.1368724507007699e-05, "loss": 0.4339, "mean_token_accuracy": 0.8593482598662376, "num_tokens": 922384895.0, "step": 28901 }, { "entropy": 0.4387959958985448, "epoch": 2.659133645004917, "grad_norm": 0.14873863756656647, "learning_rate": 1.1365657680866072e-05, "loss": 0.4207, "mean_token_accuracy": 0.8615534342825413, "num_tokens": 922416249.0, "step": 28902 }, { "entropy": 0.581670249812305, "epoch": 2.659225651376358, "grad_norm": 0.168462872505188, "learning_rate": 1.1362590854724446e-05, "loss": 0.5727, "mean_token_accuracy": 0.819544117897749, "num_tokens": 922448300.0, "step": 28903 }, { "entropy": 0.5099145423155278, "epoch": 2.659317657747799, "grad_norm": 0.1533019244670868, "learning_rate": 1.135952402858282e-05, "loss": 0.4927, "mean_token_accuracy": 0.8440049923956394, "num_tokens": 922480507.0, "step": 28904 }, { "entropy": 0.4658008674159646, "epoch": 2.65940966411924, "grad_norm": 0.1546488255262375, "learning_rate": 1.1356457202441194e-05, "loss": 0.4573, "mean_token_accuracy": 0.8538052029907703, "num_tokens": 922512021.0, "step": 28905 }, { "entropy": 0.4960828395560384, "epoch": 2.6595016704906813, "grad_norm": 0.1549452692270279, "learning_rate": 1.1353390376299567e-05, "loss": 0.4833, "mean_token_accuracy": 0.8460543528199196, "num_tokens": 922544015.0, "step": 28906 }, { "entropy": 0.45159418880939484, "epoch": 2.659593676862123, "grad_norm": 0.14671696722507477, "learning_rate": 1.1350323550157942e-05, "loss": 0.4388, "mean_token_accuracy": 0.8609045967459679, "num_tokens": 922576777.0, "step": 28907 }, { "entropy": 0.47090710140764713, "epoch": 2.659685683233564, "grad_norm": 0.15732842683792114, "learning_rate": 1.1347256724016316e-05, "loss": 0.4552, "mean_token_accuracy": 0.8545369990170002, "num_tokens": 922608146.0, "step": 28908 }, { "entropy": 0.5424673091620207, "epoch": 2.659777689605005, "grad_norm": 0.16100727021694183, "learning_rate": 1.134418989787469e-05, "loss": 0.5372, "mean_token_accuracy": 0.8302918262779713, "num_tokens": 922640450.0, "step": 28909 }, { "entropy": 0.48831286933273077, "epoch": 2.6598696959764463, "grad_norm": 0.15724864602088928, "learning_rate": 1.1341123071733064e-05, "loss": 0.4801, "mean_token_accuracy": 0.8466470204293728, "num_tokens": 922671810.0, "step": 28910 }, { "entropy": 0.4829055778682232, "epoch": 2.6599617023478874, "grad_norm": 0.1476743221282959, "learning_rate": 1.1338056245591439e-05, "loss": 0.4623, "mean_token_accuracy": 0.8529555089771748, "num_tokens": 922703351.0, "step": 28911 }, { "entropy": 0.48307639081031084, "epoch": 2.660053708719329, "grad_norm": 0.15661859512329102, "learning_rate": 1.1334989419449813e-05, "loss": 0.4714, "mean_token_accuracy": 0.8516211286187172, "num_tokens": 922735345.0, "step": 28912 }, { "entropy": 0.4895117487758398, "epoch": 2.66014571509077, "grad_norm": 0.16114845871925354, "learning_rate": 1.1331922593308186e-05, "loss": 0.4848, "mean_token_accuracy": 0.8439592756330967, "num_tokens": 922767464.0, "step": 28913 }, { "entropy": 0.43370328308083117, "epoch": 2.6602377214622113, "grad_norm": 0.15138430893421173, "learning_rate": 1.132885576716656e-05, "loss": 0.4228, "mean_token_accuracy": 0.8636542931199074, "num_tokens": 922798151.0, "step": 28914 }, { "entropy": 0.5000717239454389, "epoch": 2.6603297278336524, "grad_norm": 0.15432488918304443, "learning_rate": 1.1325788941024934e-05, "loss": 0.489, "mean_token_accuracy": 0.8409427553415298, "num_tokens": 922830642.0, "step": 28915 }, { "entropy": 0.5173124726861715, "epoch": 2.6604217342050935, "grad_norm": 0.15670529007911682, "learning_rate": 1.1322722114883308e-05, "loss": 0.5026, "mean_token_accuracy": 0.8383710794150829, "num_tokens": 922862693.0, "step": 28916 }, { "entropy": 0.5426669083535671, "epoch": 2.660513740576535, "grad_norm": 0.1609540581703186, "learning_rate": 1.1319655288741681e-05, "loss": 0.5257, "mean_token_accuracy": 0.832837350666523, "num_tokens": 922894530.0, "step": 28917 }, { "entropy": 0.47859931737184525, "epoch": 2.6606057469479762, "grad_norm": 0.15739698708057404, "learning_rate": 1.1316588462600056e-05, "loss": 0.4767, "mean_token_accuracy": 0.8518793247640133, "num_tokens": 922926322.0, "step": 28918 }, { "entropy": 0.48703186167404056, "epoch": 2.6606977533194174, "grad_norm": 0.15671654045581818, "learning_rate": 1.1313521636458429e-05, "loss": 0.4747, "mean_token_accuracy": 0.8481920436024666, "num_tokens": 922958804.0, "step": 28919 }, { "entropy": 0.560217110440135, "epoch": 2.6607897596908585, "grad_norm": 0.1642894595861435, "learning_rate": 1.1310454810316804e-05, "loss": 0.546, "mean_token_accuracy": 0.8296286836266518, "num_tokens": 922990981.0, "step": 28920 }, { "entropy": 0.49745198618620634, "epoch": 2.6608817660622996, "grad_norm": 0.1539844125509262, "learning_rate": 1.1307387984175177e-05, "loss": 0.4838, "mean_token_accuracy": 0.8477859571576118, "num_tokens": 923023140.0, "step": 28921 }, { "entropy": 0.488957014400512, "epoch": 2.6609737724337412, "grad_norm": 0.15478923916816711, "learning_rate": 1.1304321158033551e-05, "loss": 0.4753, "mean_token_accuracy": 0.8487455509603024, "num_tokens": 923054850.0, "step": 28922 }, { "entropy": 0.5700964061543345, "epoch": 2.6610657788051824, "grad_norm": 0.16471901535987854, "learning_rate": 1.1301254331891926e-05, "loss": 0.5551, "mean_token_accuracy": 0.8205985464155674, "num_tokens": 923087256.0, "step": 28923 }, { "entropy": 0.47995313070714474, "epoch": 2.6611577851766235, "grad_norm": 0.15384256839752197, "learning_rate": 1.1298187505750299e-05, "loss": 0.4701, "mean_token_accuracy": 0.8519251644611359, "num_tokens": 923119681.0, "step": 28924 }, { "entropy": 0.44236196018755436, "epoch": 2.6612497915480646, "grad_norm": 0.14812269806861877, "learning_rate": 1.1295120679608673e-05, "loss": 0.436, "mean_token_accuracy": 0.8631572797894478, "num_tokens": 923151309.0, "step": 28925 }, { "entropy": 0.5062760766595602, "epoch": 2.6613417979195058, "grad_norm": 0.15461573004722595, "learning_rate": 1.1292053853467048e-05, "loss": 0.503, "mean_token_accuracy": 0.8404699973762035, "num_tokens": 923183217.0, "step": 28926 }, { "entropy": 0.5116226691752672, "epoch": 2.6614338042909473, "grad_norm": 0.160628542304039, "learning_rate": 1.1288987027325423e-05, "loss": 0.5035, "mean_token_accuracy": 0.8397082686424255, "num_tokens": 923214728.0, "step": 28927 }, { "entropy": 0.5115415155887604, "epoch": 2.6615258106623885, "grad_norm": 0.16249744594097137, "learning_rate": 1.1285920201183796e-05, "loss": 0.5021, "mean_token_accuracy": 0.8400112837553024, "num_tokens": 923246426.0, "step": 28928 }, { "entropy": 0.5428371282760054, "epoch": 2.6616178170338296, "grad_norm": 0.1628090888261795, "learning_rate": 1.128285337504217e-05, "loss": 0.5282, "mean_token_accuracy": 0.8349001184105873, "num_tokens": 923277437.0, "step": 28929 }, { "entropy": 0.4685824781190604, "epoch": 2.6617098234052707, "grad_norm": 0.1525561511516571, "learning_rate": 1.1279786548900543e-05, "loss": 0.4499, "mean_token_accuracy": 0.8568253889679909, "num_tokens": 923309084.0, "step": 28930 }, { "entropy": 0.4966426435858011, "epoch": 2.661801829776712, "grad_norm": 0.15444599092006683, "learning_rate": 1.1276719722758918e-05, "loss": 0.4831, "mean_token_accuracy": 0.8470142707228661, "num_tokens": 923340894.0, "step": 28931 }, { "entropy": 0.5290924794971943, "epoch": 2.6618938361481534, "grad_norm": 0.16040512919425964, "learning_rate": 1.1273652896617291e-05, "loss": 0.5245, "mean_token_accuracy": 0.8340050876140594, "num_tokens": 923373406.0, "step": 28932 }, { "entropy": 0.5312575548887253, "epoch": 2.6619858425195946, "grad_norm": 0.16461235284805298, "learning_rate": 1.1270586070475666e-05, "loss": 0.5282, "mean_token_accuracy": 0.8341732025146484, "num_tokens": 923405443.0, "step": 28933 }, { "entropy": 0.46409989334642887, "epoch": 2.6620778488910357, "grad_norm": 0.15342390537261963, "learning_rate": 1.1267519244334038e-05, "loss": 0.4525, "mean_token_accuracy": 0.8557058349251747, "num_tokens": 923437999.0, "step": 28934 }, { "entropy": 0.5511206295341253, "epoch": 2.662169855262477, "grad_norm": 0.16294333338737488, "learning_rate": 1.1264452418192413e-05, "loss": 0.536, "mean_token_accuracy": 0.8331990540027618, "num_tokens": 923469078.0, "step": 28935 }, { "entropy": 0.518022982403636, "epoch": 2.662261861633918, "grad_norm": 0.16216179728507996, "learning_rate": 1.1261385592050786e-05, "loss": 0.5049, "mean_token_accuracy": 0.8391892798244953, "num_tokens": 923501376.0, "step": 28936 }, { "entropy": 0.570892134681344, "epoch": 2.6623538680053596, "grad_norm": 0.16574759781360626, "learning_rate": 1.125831876590916e-05, "loss": 0.5568, "mean_token_accuracy": 0.821075763553381, "num_tokens": 923533125.0, "step": 28937 }, { "entropy": 0.49072714522480965, "epoch": 2.6624458743768007, "grad_norm": 0.15988412499427795, "learning_rate": 1.1255251939767535e-05, "loss": 0.4833, "mean_token_accuracy": 0.8454981110990047, "num_tokens": 923565450.0, "step": 28938 }, { "entropy": 0.5231800805777311, "epoch": 2.662537880748242, "grad_norm": 0.161393404006958, "learning_rate": 1.1252185113625908e-05, "loss": 0.5194, "mean_token_accuracy": 0.837826069444418, "num_tokens": 923597686.0, "step": 28939 }, { "entropy": 0.4748257640749216, "epoch": 2.662629887119683, "grad_norm": 0.15582625567913055, "learning_rate": 1.1249118287484283e-05, "loss": 0.4746, "mean_token_accuracy": 0.8511350117623806, "num_tokens": 923630354.0, "step": 28940 }, { "entropy": 0.546711812261492, "epoch": 2.662721893491124, "grad_norm": 0.1615271419286728, "learning_rate": 1.1246051461342658e-05, "loss": 0.5411, "mean_token_accuracy": 0.8304548859596252, "num_tokens": 923662685.0, "step": 28941 }, { "entropy": 0.5310400873422623, "epoch": 2.6628138998625657, "grad_norm": 0.1579841822385788, "learning_rate": 1.1242984635201032e-05, "loss": 0.5162, "mean_token_accuracy": 0.8366258218884468, "num_tokens": 923694195.0, "step": 28942 }, { "entropy": 0.5774425230920315, "epoch": 2.662905906234007, "grad_norm": 0.16462105512619019, "learning_rate": 1.1239917809059405e-05, "loss": 0.5547, "mean_token_accuracy": 0.8247920051217079, "num_tokens": 923726050.0, "step": 28943 }, { "entropy": 0.42559211514890194, "epoch": 2.662997912605448, "grad_norm": 0.14829978346824646, "learning_rate": 1.123685098291778e-05, "loss": 0.4132, "mean_token_accuracy": 0.8639443628489971, "num_tokens": 923758613.0, "step": 28944 }, { "entropy": 0.5231024813838303, "epoch": 2.663089918976889, "grad_norm": 0.1589096039533615, "learning_rate": 1.1233784156776153e-05, "loss": 0.5039, "mean_token_accuracy": 0.8426373340189457, "num_tokens": 923790333.0, "step": 28945 }, { "entropy": 0.5026270970702171, "epoch": 2.66318192534833, "grad_norm": 0.156727597117424, "learning_rate": 1.1230717330634527e-05, "loss": 0.4919, "mean_token_accuracy": 0.8454154655337334, "num_tokens": 923821996.0, "step": 28946 }, { "entropy": 0.47761406376957893, "epoch": 2.663273931719772, "grad_norm": 0.15646043419837952, "learning_rate": 1.12276505044929e-05, "loss": 0.466, "mean_token_accuracy": 0.8498580753803253, "num_tokens": 923852810.0, "step": 28947 }, { "entropy": 0.5417598355561495, "epoch": 2.663365938091213, "grad_norm": 0.16505737602710724, "learning_rate": 1.1224583678351275e-05, "loss": 0.5273, "mean_token_accuracy": 0.8321891874074936, "num_tokens": 923884367.0, "step": 28948 }, { "entropy": 0.49484779592603445, "epoch": 2.663457944462654, "grad_norm": 0.15653371810913086, "learning_rate": 1.1221516852209648e-05, "loss": 0.4812, "mean_token_accuracy": 0.8496362753212452, "num_tokens": 923916783.0, "step": 28949 }, { "entropy": 0.5768809113651514, "epoch": 2.663549950834095, "grad_norm": 0.16701634228229523, "learning_rate": 1.1218450026068023e-05, "loss": 0.569, "mean_token_accuracy": 0.8215111494064331, "num_tokens": 923948701.0, "step": 28950 }, { "entropy": 0.493265223223716, "epoch": 2.6636419572055363, "grad_norm": 0.15907634794712067, "learning_rate": 1.1215383199926396e-05, "loss": 0.4883, "mean_token_accuracy": 0.8486412391066551, "num_tokens": 923980044.0, "step": 28951 }, { "entropy": 0.5081691481173038, "epoch": 2.663733963576978, "grad_norm": 0.16195401549339294, "learning_rate": 1.121231637378477e-05, "loss": 0.4943, "mean_token_accuracy": 0.8420471772551537, "num_tokens": 924011328.0, "step": 28952 }, { "entropy": 0.46467008988838643, "epoch": 2.663825969948419, "grad_norm": 0.14548516273498535, "learning_rate": 1.1209249547643145e-05, "loss": 0.4484, "mean_token_accuracy": 0.857046902179718, "num_tokens": 924044096.0, "step": 28953 }, { "entropy": 0.4756378170568496, "epoch": 2.66391797631986, "grad_norm": 0.16125261783599854, "learning_rate": 1.1206182721501518e-05, "loss": 0.4708, "mean_token_accuracy": 0.8479539565742016, "num_tokens": 924075525.0, "step": 28954 }, { "entropy": 0.49428918305784464, "epoch": 2.6640099826913013, "grad_norm": 0.1546645164489746, "learning_rate": 1.1203115895359893e-05, "loss": 0.477, "mean_token_accuracy": 0.8505925536155701, "num_tokens": 924106923.0, "step": 28955 }, { "entropy": 0.4964769734069705, "epoch": 2.6641019890627424, "grad_norm": 0.15028329193592072, "learning_rate": 1.1200049069218267e-05, "loss": 0.4841, "mean_token_accuracy": 0.8454445451498032, "num_tokens": 924139691.0, "step": 28956 }, { "entropy": 0.650342158973217, "epoch": 2.664193995434184, "grad_norm": 0.17911112308502197, "learning_rate": 1.1196982243076642e-05, "loss": 0.6469, "mean_token_accuracy": 0.8007591180503368, "num_tokens": 924170969.0, "step": 28957 }, { "entropy": 0.5576014537364244, "epoch": 2.664286001805625, "grad_norm": 0.16908691823482513, "learning_rate": 1.1193915416935015e-05, "loss": 0.5536, "mean_token_accuracy": 0.8247827850282192, "num_tokens": 924202085.0, "step": 28958 }, { "entropy": 0.44817351165693253, "epoch": 2.6643780081770663, "grad_norm": 0.1482875496149063, "learning_rate": 1.119084859079339e-05, "loss": 0.4309, "mean_token_accuracy": 0.8606200069189072, "num_tokens": 924233948.0, "step": 28959 }, { "entropy": 0.438562348484993, "epoch": 2.6644700145485074, "grad_norm": 0.15333305299282074, "learning_rate": 1.1187781764651762e-05, "loss": 0.4361, "mean_token_accuracy": 0.8633116334676743, "num_tokens": 924266013.0, "step": 28960 }, { "entropy": 0.5276313810609281, "epoch": 2.6645620209199485, "grad_norm": 0.1591552346944809, "learning_rate": 1.1184714938510137e-05, "loss": 0.5159, "mean_token_accuracy": 0.8364941217005253, "num_tokens": 924298254.0, "step": 28961 }, { "entropy": 0.5370555780827999, "epoch": 2.66465402729139, "grad_norm": 0.16106939315795898, "learning_rate": 1.118164811236851e-05, "loss": 0.5193, "mean_token_accuracy": 0.8360434249043465, "num_tokens": 924330051.0, "step": 28962 }, { "entropy": 0.41765765147283673, "epoch": 2.6647460336628312, "grad_norm": 0.14001674950122833, "learning_rate": 1.1178581286226885e-05, "loss": 0.4058, "mean_token_accuracy": 0.8734435774385929, "num_tokens": 924362603.0, "step": 28963 }, { "entropy": 0.38977866526693106, "epoch": 2.6648380400342724, "grad_norm": 0.14650143682956696, "learning_rate": 1.1175514460085258e-05, "loss": 0.3808, "mean_token_accuracy": 0.8768176361918449, "num_tokens": 924394952.0, "step": 28964 }, { "entropy": 0.48052484448999166, "epoch": 2.6649300464057135, "grad_norm": 0.1559106856584549, "learning_rate": 1.1172447633943632e-05, "loss": 0.4628, "mean_token_accuracy": 0.8533286601305008, "num_tokens": 924427164.0, "step": 28965 }, { "entropy": 0.5243033645674586, "epoch": 2.6650220527771546, "grad_norm": 0.16775502264499664, "learning_rate": 1.1169380807802005e-05, "loss": 0.5055, "mean_token_accuracy": 0.8395177535712719, "num_tokens": 924458741.0, "step": 28966 }, { "entropy": 0.509163673967123, "epoch": 2.6651140591485962, "grad_norm": 0.16050565242767334, "learning_rate": 1.116631398166038e-05, "loss": 0.4989, "mean_token_accuracy": 0.8392348699271679, "num_tokens": 924490176.0, "step": 28967 }, { "entropy": 0.5119332000613213, "epoch": 2.6652060655200374, "grad_norm": 0.16130468249320984, "learning_rate": 1.1163247155518754e-05, "loss": 0.4991, "mean_token_accuracy": 0.840829785913229, "num_tokens": 924521829.0, "step": 28968 }, { "entropy": 0.5025908355601132, "epoch": 2.6652980718914785, "grad_norm": 0.15594322979450226, "learning_rate": 1.1160180329377127e-05, "loss": 0.4956, "mean_token_accuracy": 0.8433061204850674, "num_tokens": 924553886.0, "step": 28969 }, { "entropy": 0.5218906933441758, "epoch": 2.6653900782629196, "grad_norm": 0.1625770628452301, "learning_rate": 1.1157113503235502e-05, "loss": 0.513, "mean_token_accuracy": 0.8384376056492329, "num_tokens": 924585700.0, "step": 28970 }, { "entropy": 0.599573103711009, "epoch": 2.6654820846343608, "grad_norm": 0.16805797815322876, "learning_rate": 1.1154046677093877e-05, "loss": 0.584, "mean_token_accuracy": 0.8190628327429295, "num_tokens": 924618229.0, "step": 28971 }, { "entropy": 0.5106224594637752, "epoch": 2.6655740910058023, "grad_norm": 0.1591033637523651, "learning_rate": 1.1150979850952251e-05, "loss": 0.4969, "mean_token_accuracy": 0.8401020877063274, "num_tokens": 924650372.0, "step": 28972 }, { "entropy": 0.45761388330720365, "epoch": 2.6656660973772435, "grad_norm": 0.15524649620056152, "learning_rate": 1.1147913024810624e-05, "loss": 0.4379, "mean_token_accuracy": 0.8608170822262764, "num_tokens": 924682073.0, "step": 28973 }, { "entropy": 0.49422946013510227, "epoch": 2.6657581037486846, "grad_norm": 0.14990702271461487, "learning_rate": 1.1144846198668999e-05, "loss": 0.4728, "mean_token_accuracy": 0.8493291139602661, "num_tokens": 924714161.0, "step": 28974 }, { "entropy": 0.5521335415542126, "epoch": 2.6658501101201257, "grad_norm": 0.16157270967960358, "learning_rate": 1.1141779372527372e-05, "loss": 0.5411, "mean_token_accuracy": 0.8318251296877861, "num_tokens": 924745973.0, "step": 28975 }, { "entropy": 0.5220079682767391, "epoch": 2.665942116491567, "grad_norm": 0.15784096717834473, "learning_rate": 1.1138712546385747e-05, "loss": 0.5007, "mean_token_accuracy": 0.8413025327026844, "num_tokens": 924778162.0, "step": 28976 }, { "entropy": 0.5169216124340892, "epoch": 2.6660341228630084, "grad_norm": 0.15561740100383759, "learning_rate": 1.113564572024412e-05, "loss": 0.5065, "mean_token_accuracy": 0.8420862071216106, "num_tokens": 924810475.0, "step": 28977 }, { "entropy": 0.440541296149604, "epoch": 2.6661261292344496, "grad_norm": 0.14763256907463074, "learning_rate": 1.1132578894102494e-05, "loss": 0.4295, "mean_token_accuracy": 0.8610527142882347, "num_tokens": 924842776.0, "step": 28978 }, { "entropy": 0.6521985046565533, "epoch": 2.6662181356058907, "grad_norm": 0.17497724294662476, "learning_rate": 1.1129512067960867e-05, "loss": 0.6477, "mean_token_accuracy": 0.8013451360166073, "num_tokens": 924874352.0, "step": 28979 }, { "entropy": 0.5369883477687836, "epoch": 2.666310141977332, "grad_norm": 0.16219791769981384, "learning_rate": 1.1126445241819242e-05, "loss": 0.5188, "mean_token_accuracy": 0.8345106616616249, "num_tokens": 924905349.0, "step": 28980 }, { "entropy": 0.5402338672429323, "epoch": 2.666402148348773, "grad_norm": 0.1617148369550705, "learning_rate": 1.1123378415677615e-05, "loss": 0.5278, "mean_token_accuracy": 0.8314130082726479, "num_tokens": 924936899.0, "step": 28981 }, { "entropy": 0.6083605196326971, "epoch": 2.6664941547202146, "grad_norm": 0.16574402153491974, "learning_rate": 1.112031158953599e-05, "loss": 0.6052, "mean_token_accuracy": 0.8122185431420803, "num_tokens": 924969078.0, "step": 28982 }, { "entropy": 0.4812767152907327, "epoch": 2.6665861610916557, "grad_norm": 0.15250396728515625, "learning_rate": 1.1117244763394364e-05, "loss": 0.4667, "mean_token_accuracy": 0.8528083153069019, "num_tokens": 925001335.0, "step": 28983 }, { "entropy": 0.5397818330675364, "epoch": 2.666678167463097, "grad_norm": 0.1622508317232132, "learning_rate": 1.1114177937252737e-05, "loss": 0.5334, "mean_token_accuracy": 0.8318691812455654, "num_tokens": 925033496.0, "step": 28984 }, { "entropy": 0.5339321317151189, "epoch": 2.666770173834538, "grad_norm": 0.1607717126607895, "learning_rate": 1.1111111111111112e-05, "loss": 0.5173, "mean_token_accuracy": 0.8337206915020943, "num_tokens": 925065556.0, "step": 28985 }, { "entropy": 0.5835020188242197, "epoch": 2.666862180205979, "grad_norm": 0.16324159502983093, "learning_rate": 1.1108044284969486e-05, "loss": 0.57, "mean_token_accuracy": 0.8209860622882843, "num_tokens": 925098295.0, "step": 28986 }, { "entropy": 0.49358377081807703, "epoch": 2.6669541865774207, "grad_norm": 0.1533805876970291, "learning_rate": 1.1104977458827861e-05, "loss": 0.4828, "mean_token_accuracy": 0.8459164015948772, "num_tokens": 925130588.0, "step": 28987 }, { "entropy": 0.5120349284261465, "epoch": 2.667046192948862, "grad_norm": 0.15795230865478516, "learning_rate": 1.1101910632686234e-05, "loss": 0.4997, "mean_token_accuracy": 0.8420257307589054, "num_tokens": 925163205.0, "step": 28988 }, { "entropy": 0.6037245132029057, "epoch": 2.667138199320303, "grad_norm": 0.16950905323028564, "learning_rate": 1.1098843806544609e-05, "loss": 0.606, "mean_token_accuracy": 0.8110016584396362, "num_tokens": 925195382.0, "step": 28989 }, { "entropy": 0.5511310165748, "epoch": 2.667230205691744, "grad_norm": 0.16071748733520508, "learning_rate": 1.1095776980402981e-05, "loss": 0.5407, "mean_token_accuracy": 0.8323222398757935, "num_tokens": 925227685.0, "step": 28990 }, { "entropy": 0.556705204769969, "epoch": 2.667322212063185, "grad_norm": 0.16261722147464752, "learning_rate": 1.1092710154261356e-05, "loss": 0.5395, "mean_token_accuracy": 0.8338330201804638, "num_tokens": 925259691.0, "step": 28991 }, { "entropy": 0.4655759728047997, "epoch": 2.667414218434627, "grad_norm": 0.15510036051273346, "learning_rate": 1.1089643328119729e-05, "loss": 0.4562, "mean_token_accuracy": 0.8534000813961029, "num_tokens": 925291655.0, "step": 28992 }, { "entropy": 0.5545994117856026, "epoch": 2.667506224806068, "grad_norm": 0.1610172986984253, "learning_rate": 1.1086576501978104e-05, "loss": 0.548, "mean_token_accuracy": 0.8286736272275448, "num_tokens": 925324217.0, "step": 28993 }, { "entropy": 0.5525425337255001, "epoch": 2.667598231177509, "grad_norm": 0.1642543375492096, "learning_rate": 1.1083509675836477e-05, "loss": 0.5375, "mean_token_accuracy": 0.8288926742970943, "num_tokens": 925356226.0, "step": 28994 }, { "entropy": 0.5158248571678996, "epoch": 2.66769023754895, "grad_norm": 0.1586715430021286, "learning_rate": 1.1080442849694851e-05, "loss": 0.5021, "mean_token_accuracy": 0.8415617123246193, "num_tokens": 925388448.0, "step": 28995 }, { "entropy": 0.4734045206569135, "epoch": 2.6677822439203913, "grad_norm": 0.15068365633487701, "learning_rate": 1.1077376023553224e-05, "loss": 0.4673, "mean_token_accuracy": 0.8512603081762791, "num_tokens": 925420485.0, "step": 28996 }, { "entropy": 0.534235917031765, "epoch": 2.667874250291833, "grad_norm": 0.16652213037014008, "learning_rate": 1.1074309197411599e-05, "loss": 0.5314, "mean_token_accuracy": 0.8322240971028805, "num_tokens": 925452038.0, "step": 28997 }, { "entropy": 0.5999002158641815, "epoch": 2.667966256663274, "grad_norm": 0.16932782530784607, "learning_rate": 1.1071242371269974e-05, "loss": 0.597, "mean_token_accuracy": 0.8103773631155491, "num_tokens": 925484176.0, "step": 28998 }, { "entropy": 0.5531786326318979, "epoch": 2.668058263034715, "grad_norm": 0.1621103584766388, "learning_rate": 1.1068175545128347e-05, "loss": 0.5535, "mean_token_accuracy": 0.8269114382565022, "num_tokens": 925516118.0, "step": 28999 }, { "entropy": 0.5450896313413978, "epoch": 2.6681502694061563, "grad_norm": 0.15771810710430145, "learning_rate": 1.1065108718986721e-05, "loss": 0.5336, "mean_token_accuracy": 0.8344024568796158, "num_tokens": 925548332.0, "step": 29000 }, { "entropy": 0.42841882072389126, "epoch": 2.6682422757775974, "grad_norm": 0.14848016202449799, "learning_rate": 1.1062041892845094e-05, "loss": 0.4204, "mean_token_accuracy": 0.8643499873578548, "num_tokens": 925580899.0, "step": 29001 }, { "entropy": 0.5997496405616403, "epoch": 2.668334282149039, "grad_norm": 0.16600824892520905, "learning_rate": 1.105897506670347e-05, "loss": 0.5791, "mean_token_accuracy": 0.8195013925433159, "num_tokens": 925613253.0, "step": 29002 }, { "entropy": 0.5914025008678436, "epoch": 2.66842628852048, "grad_norm": 0.1685250848531723, "learning_rate": 1.1055908240561843e-05, "loss": 0.5734, "mean_token_accuracy": 0.819195207208395, "num_tokens": 925645700.0, "step": 29003 }, { "entropy": 0.30611313495319337, "epoch": 2.6685182948919213, "grad_norm": 0.13365530967712402, "learning_rate": 1.1052841414420218e-05, "loss": 0.2925, "mean_token_accuracy": 0.9050306044518948, "num_tokens": 925678015.0, "step": 29004 }, { "entropy": 0.5618971846997738, "epoch": 2.6686103012633624, "grad_norm": 0.16466428339481354, "learning_rate": 1.1049774588278591e-05, "loss": 0.5481, "mean_token_accuracy": 0.8251046501100063, "num_tokens": 925710166.0, "step": 29005 }, { "entropy": 0.43030161084607244, "epoch": 2.6687023076348035, "grad_norm": 0.153135746717453, "learning_rate": 1.1046707762136966e-05, "loss": 0.4261, "mean_token_accuracy": 0.8647133968770504, "num_tokens": 925741635.0, "step": 29006 }, { "entropy": 0.5349757205694914, "epoch": 2.668794314006245, "grad_norm": 0.1569041907787323, "learning_rate": 1.1043640935995339e-05, "loss": 0.5201, "mean_token_accuracy": 0.8347212187945843, "num_tokens": 925773872.0, "step": 29007 }, { "entropy": 0.6193781588226557, "epoch": 2.6688863203776862, "grad_norm": 0.17353689670562744, "learning_rate": 1.1040574109853713e-05, "loss": 0.6044, "mean_token_accuracy": 0.8108654506504536, "num_tokens": 925805553.0, "step": 29008 }, { "entropy": 0.6077210605144501, "epoch": 2.6689783267491274, "grad_norm": 0.1678159534931183, "learning_rate": 1.1037507283712086e-05, "loss": 0.5932, "mean_token_accuracy": 0.8137641288340092, "num_tokens": 925837298.0, "step": 29009 }, { "entropy": 0.6296145925298333, "epoch": 2.6690703331205685, "grad_norm": 0.17105787992477417, "learning_rate": 1.1034440457570461e-05, "loss": 0.6249, "mean_token_accuracy": 0.8032599575817585, "num_tokens": 925869356.0, "step": 29010 }, { "entropy": 0.5117077101022005, "epoch": 2.6691623394920097, "grad_norm": 0.1557774394750595, "learning_rate": 1.1031373631428834e-05, "loss": 0.5026, "mean_token_accuracy": 0.8448669016361237, "num_tokens": 925901459.0, "step": 29011 }, { "entropy": 0.5559321288019419, "epoch": 2.6692543458634512, "grad_norm": 0.16427622735500336, "learning_rate": 1.1028306805287208e-05, "loss": 0.5371, "mean_token_accuracy": 0.8263683393597603, "num_tokens": 925932301.0, "step": 29012 }, { "entropy": 0.44523279275745153, "epoch": 2.6693463522348924, "grad_norm": 0.15177235007286072, "learning_rate": 1.1025239979145583e-05, "loss": 0.4339, "mean_token_accuracy": 0.858484324067831, "num_tokens": 925963901.0, "step": 29013 }, { "entropy": 0.512452770024538, "epoch": 2.6694383586063335, "grad_norm": 0.15783990919589996, "learning_rate": 1.1022173153003956e-05, "loss": 0.4938, "mean_token_accuracy": 0.8451763913035393, "num_tokens": 925995317.0, "step": 29014 }, { "entropy": 0.4814047934487462, "epoch": 2.6695303649777746, "grad_norm": 0.15452581644058228, "learning_rate": 1.101910632686233e-05, "loss": 0.4691, "mean_token_accuracy": 0.8488652296364307, "num_tokens": 926027087.0, "step": 29015 }, { "entropy": 0.6016160231083632, "epoch": 2.6696223713492158, "grad_norm": 0.16350087523460388, "learning_rate": 1.1016039500720704e-05, "loss": 0.5823, "mean_token_accuracy": 0.8179098591208458, "num_tokens": 926059203.0, "step": 29016 }, { "entropy": 0.5663523990660906, "epoch": 2.6697143777206573, "grad_norm": 0.16379503905773163, "learning_rate": 1.101297267457908e-05, "loss": 0.5593, "mean_token_accuracy": 0.8259646371006966, "num_tokens": 926091468.0, "step": 29017 }, { "entropy": 0.500247348099947, "epoch": 2.6698063840920985, "grad_norm": 0.1549312025308609, "learning_rate": 1.1009905848437453e-05, "loss": 0.4902, "mean_token_accuracy": 0.8451252169907093, "num_tokens": 926122950.0, "step": 29018 }, { "entropy": 0.5183204850181937, "epoch": 2.6698983904635396, "grad_norm": 0.16201159358024597, "learning_rate": 1.1006839022295828e-05, "loss": 0.5057, "mean_token_accuracy": 0.8365412205457687, "num_tokens": 926155041.0, "step": 29019 }, { "entropy": 0.6044253166764975, "epoch": 2.6699903968349807, "grad_norm": 0.16372638940811157, "learning_rate": 1.10037721961542e-05, "loss": 0.5921, "mean_token_accuracy": 0.8163632974028587, "num_tokens": 926187365.0, "step": 29020 }, { "entropy": 0.5107974810525775, "epoch": 2.670082403206422, "grad_norm": 0.15672288835048676, "learning_rate": 1.1000705370012575e-05, "loss": 0.4994, "mean_token_accuracy": 0.8428320549428463, "num_tokens": 926219917.0, "step": 29021 }, { "entropy": 0.37289436196442693, "epoch": 2.6701744095778635, "grad_norm": 0.13316692411899567, "learning_rate": 1.0997638543870948e-05, "loss": 0.367, "mean_token_accuracy": 0.8835142776370049, "num_tokens": 926252303.0, "step": 29022 }, { "entropy": 0.569499246776104, "epoch": 2.6702664159493046, "grad_norm": 0.16618198156356812, "learning_rate": 1.0994571717729323e-05, "loss": 0.5508, "mean_token_accuracy": 0.8238895758986473, "num_tokens": 926284342.0, "step": 29023 }, { "entropy": 0.4474105993285775, "epoch": 2.6703584223207457, "grad_norm": 0.15356937050819397, "learning_rate": 1.0991504891587696e-05, "loss": 0.4399, "mean_token_accuracy": 0.8587850593030453, "num_tokens": 926316656.0, "step": 29024 }, { "entropy": 0.49287514202296734, "epoch": 2.670450428692187, "grad_norm": 0.15802668035030365, "learning_rate": 1.098843806544607e-05, "loss": 0.4698, "mean_token_accuracy": 0.8507375530898571, "num_tokens": 926348326.0, "step": 29025 }, { "entropy": 0.5274893287569284, "epoch": 2.670542435063628, "grad_norm": 0.1630822718143463, "learning_rate": 1.0985371239304443e-05, "loss": 0.5135, "mean_token_accuracy": 0.8351799622178078, "num_tokens": 926380365.0, "step": 29026 }, { "entropy": 0.5584040405228734, "epoch": 2.6706344414350696, "grad_norm": 0.16657142341136932, "learning_rate": 1.0982304413162818e-05, "loss": 0.5492, "mean_token_accuracy": 0.8254241980612278, "num_tokens": 926412227.0, "step": 29027 }, { "entropy": 0.4538695691153407, "epoch": 2.6707264478065107, "grad_norm": 0.15353335440158844, "learning_rate": 1.0979237587021193e-05, "loss": 0.4397, "mean_token_accuracy": 0.8580325096845627, "num_tokens": 926444562.0, "step": 29028 }, { "entropy": 0.4798260619863868, "epoch": 2.670818454177952, "grad_norm": 0.15533462166786194, "learning_rate": 1.0976170760879566e-05, "loss": 0.4743, "mean_token_accuracy": 0.8509709276258945, "num_tokens": 926477330.0, "step": 29029 }, { "entropy": 0.4301416538655758, "epoch": 2.670910460549393, "grad_norm": 0.14955803751945496, "learning_rate": 1.097310393473794e-05, "loss": 0.4218, "mean_token_accuracy": 0.8640177063643932, "num_tokens": 926509414.0, "step": 29030 }, { "entropy": 0.6249440498650074, "epoch": 2.671002466920834, "grad_norm": 0.17913365364074707, "learning_rate": 1.0970037108596313e-05, "loss": 0.6234, "mean_token_accuracy": 0.8069103918969631, "num_tokens": 926540749.0, "step": 29031 }, { "entropy": 0.5327433794736862, "epoch": 2.6710944732922757, "grad_norm": 0.16176027059555054, "learning_rate": 1.096697028245469e-05, "loss": 0.5178, "mean_token_accuracy": 0.8373197987675667, "num_tokens": 926572443.0, "step": 29032 }, { "entropy": 0.45493238652125, "epoch": 2.671186479663717, "grad_norm": 0.15138272941112518, "learning_rate": 1.0963903456313063e-05, "loss": 0.4521, "mean_token_accuracy": 0.8548189401626587, "num_tokens": 926604614.0, "step": 29033 }, { "entropy": 0.5542008746415377, "epoch": 2.671278486035158, "grad_norm": 0.1637515425682068, "learning_rate": 1.0960836630171437e-05, "loss": 0.5469, "mean_token_accuracy": 0.8317673802375793, "num_tokens": 926636963.0, "step": 29034 }, { "entropy": 0.39702135510742664, "epoch": 2.671370492406599, "grad_norm": 0.14265549182891846, "learning_rate": 1.095776980402981e-05, "loss": 0.3829, "mean_token_accuracy": 0.8759907782077789, "num_tokens": 926668927.0, "step": 29035 }, { "entropy": 0.5477992929518223, "epoch": 2.67146249877804, "grad_norm": 0.16643674671649933, "learning_rate": 1.0954702977888185e-05, "loss": 0.5303, "mean_token_accuracy": 0.8283722177147865, "num_tokens": 926701059.0, "step": 29036 }, { "entropy": 0.4260215174872428, "epoch": 2.671554505149482, "grad_norm": 0.1459444910287857, "learning_rate": 1.0951636151746558e-05, "loss": 0.4171, "mean_token_accuracy": 0.8669386059045792, "num_tokens": 926733444.0, "step": 29037 }, { "entropy": 0.48572428803890944, "epoch": 2.671646511520923, "grad_norm": 0.15319594740867615, "learning_rate": 1.0948569325604932e-05, "loss": 0.485, "mean_token_accuracy": 0.8468580581247807, "num_tokens": 926765510.0, "step": 29038 }, { "entropy": 0.5966038608457893, "epoch": 2.671738517892364, "grad_norm": 0.16364480555057526, "learning_rate": 1.0945502499463305e-05, "loss": 0.5798, "mean_token_accuracy": 0.8175028972327709, "num_tokens": 926797455.0, "step": 29039 }, { "entropy": 0.4783415552228689, "epoch": 2.671830524263805, "grad_norm": 0.15561488270759583, "learning_rate": 1.094243567332168e-05, "loss": 0.4635, "mean_token_accuracy": 0.8500254675745964, "num_tokens": 926829173.0, "step": 29040 }, { "entropy": 0.5334785301238298, "epoch": 2.6719225306352463, "grad_norm": 0.16136260330677032, "learning_rate": 1.0939368847180053e-05, "loss": 0.5344, "mean_token_accuracy": 0.8321207873523235, "num_tokens": 926860678.0, "step": 29041 }, { "entropy": 0.5602055545896292, "epoch": 2.672014537006688, "grad_norm": 0.17394712567329407, "learning_rate": 1.0936302021038428e-05, "loss": 0.5425, "mean_token_accuracy": 0.8265578933060169, "num_tokens": 926891274.0, "step": 29042 }, { "entropy": 0.41469179652631283, "epoch": 2.672106543378129, "grad_norm": 0.15083208680152893, "learning_rate": 1.0933235194896802e-05, "loss": 0.4108, "mean_token_accuracy": 0.8712309375405312, "num_tokens": 926922953.0, "step": 29043 }, { "entropy": 0.563254477456212, "epoch": 2.67219854974957, "grad_norm": 0.16624847054481506, "learning_rate": 1.0930168368755175e-05, "loss": 0.5516, "mean_token_accuracy": 0.8277704864740372, "num_tokens": 926954380.0, "step": 29044 }, { "entropy": 0.5423695407807827, "epoch": 2.6722905561210113, "grad_norm": 0.160902738571167, "learning_rate": 1.092710154261355e-05, "loss": 0.5338, "mean_token_accuracy": 0.8309063240885735, "num_tokens": 926986716.0, "step": 29045 }, { "entropy": 0.5668747562449425, "epoch": 2.6723825624924524, "grad_norm": 0.1620187610387802, "learning_rate": 1.0924034716471923e-05, "loss": 0.5531, "mean_token_accuracy": 0.8331626616418362, "num_tokens": 927018982.0, "step": 29046 }, { "entropy": 0.5314799649640918, "epoch": 2.672474568863894, "grad_norm": 0.1597129851579666, "learning_rate": 1.0920967890330299e-05, "loss": 0.515, "mean_token_accuracy": 0.8365638442337513, "num_tokens": 927051255.0, "step": 29047 }, { "entropy": 0.5341995162889361, "epoch": 2.672566575235335, "grad_norm": 0.16147178411483765, "learning_rate": 1.0917901064188672e-05, "loss": 0.5325, "mean_token_accuracy": 0.8315125480294228, "num_tokens": 927082480.0, "step": 29048 }, { "entropy": 0.49803900020197034, "epoch": 2.6726585816067763, "grad_norm": 0.15724505484104156, "learning_rate": 1.0914834238047047e-05, "loss": 0.4804, "mean_token_accuracy": 0.8502714745700359, "num_tokens": 927114444.0, "step": 29049 }, { "entropy": 0.5630996113177389, "epoch": 2.6727505879782174, "grad_norm": 0.1631740927696228, "learning_rate": 1.091176741190542e-05, "loss": 0.5436, "mean_token_accuracy": 0.8274103365838528, "num_tokens": 927146158.0, "step": 29050 }, { "entropy": 0.47229135665111244, "epoch": 2.6728425943496585, "grad_norm": 0.15443281829357147, "learning_rate": 1.0908700585763794e-05, "loss": 0.4602, "mean_token_accuracy": 0.8521202839910984, "num_tokens": 927177156.0, "step": 29051 }, { "entropy": 0.47152706515043974, "epoch": 2.6729346007211, "grad_norm": 0.15628035366535187, "learning_rate": 1.0905633759622167e-05, "loss": 0.4569, "mean_token_accuracy": 0.8539664410054684, "num_tokens": 927209387.0, "step": 29052 }, { "entropy": 0.4994216449558735, "epoch": 2.6730266070925413, "grad_norm": 0.15587659180164337, "learning_rate": 1.0902566933480542e-05, "loss": 0.4831, "mean_token_accuracy": 0.845450758934021, "num_tokens": 927240846.0, "step": 29053 }, { "entropy": 0.5427825478836894, "epoch": 2.6731186134639824, "grad_norm": 0.1632988452911377, "learning_rate": 1.0899500107338915e-05, "loss": 0.5321, "mean_token_accuracy": 0.8316160105168819, "num_tokens": 927273099.0, "step": 29054 }, { "entropy": 0.5494410386309028, "epoch": 2.6732106198354235, "grad_norm": 0.1579010933637619, "learning_rate": 1.089643328119729e-05, "loss": 0.5391, "mean_token_accuracy": 0.8309660628437996, "num_tokens": 927305181.0, "step": 29055 }, { "entropy": 0.4748719008639455, "epoch": 2.6733026262068647, "grad_norm": 0.15362945199012756, "learning_rate": 1.0893366455055662e-05, "loss": 0.4697, "mean_token_accuracy": 0.8525586128234863, "num_tokens": 927337949.0, "step": 29056 }, { "entropy": 0.5893669743090868, "epoch": 2.6733946325783062, "grad_norm": 0.16860277950763702, "learning_rate": 1.0890299628914037e-05, "loss": 0.5746, "mean_token_accuracy": 0.8208395726978779, "num_tokens": 927369928.0, "step": 29057 }, { "entropy": 0.5217621009796858, "epoch": 2.6734866389497474, "grad_norm": 0.16414669156074524, "learning_rate": 1.0887232802772412e-05, "loss": 0.513, "mean_token_accuracy": 0.8366881757974625, "num_tokens": 927401984.0, "step": 29058 }, { "entropy": 0.48885321232955903, "epoch": 2.6735786453211885, "grad_norm": 0.15178456902503967, "learning_rate": 1.0884165976630785e-05, "loss": 0.4733, "mean_token_accuracy": 0.8508575707674026, "num_tokens": 927433889.0, "step": 29059 }, { "entropy": 0.621235903352499, "epoch": 2.6736706516926296, "grad_norm": 0.17128174006938934, "learning_rate": 1.088109915048916e-05, "loss": 0.6075, "mean_token_accuracy": 0.8108186237514019, "num_tokens": 927466260.0, "step": 29060 }, { "entropy": 0.50721391197294, "epoch": 2.6737626580640708, "grad_norm": 0.15768827497959137, "learning_rate": 1.0878032324347532e-05, "loss": 0.502, "mean_token_accuracy": 0.8418320901691914, "num_tokens": 927498205.0, "step": 29061 }, { "entropy": 0.5924313496798277, "epoch": 2.6738546644355123, "grad_norm": 0.1726992428302765, "learning_rate": 1.0874965498205907e-05, "loss": 0.5751, "mean_token_accuracy": 0.8157818801701069, "num_tokens": 927529310.0, "step": 29062 }, { "entropy": 0.5859056878834963, "epoch": 2.6739466708069535, "grad_norm": 0.16258889436721802, "learning_rate": 1.0871898672064282e-05, "loss": 0.5786, "mean_token_accuracy": 0.8159196302294731, "num_tokens": 927562078.0, "step": 29063 }, { "entropy": 0.46865563560277224, "epoch": 2.6740386771783946, "grad_norm": 0.15828044712543488, "learning_rate": 1.0868831845922656e-05, "loss": 0.4564, "mean_token_accuracy": 0.851958766579628, "num_tokens": 927594400.0, "step": 29064 }, { "entropy": 0.5302251763641834, "epoch": 2.6741306835498357, "grad_norm": 0.16796985268592834, "learning_rate": 1.086576501978103e-05, "loss": 0.5192, "mean_token_accuracy": 0.8346922993659973, "num_tokens": 927625873.0, "step": 29065 }, { "entropy": 0.48586096335202456, "epoch": 2.674222689921277, "grad_norm": 0.15882723033428192, "learning_rate": 1.0862698193639404e-05, "loss": 0.47, "mean_token_accuracy": 0.8480932898819447, "num_tokens": 927657735.0, "step": 29066 }, { "entropy": 0.5043757744133472, "epoch": 2.6743146962927185, "grad_norm": 0.15849190950393677, "learning_rate": 1.0859631367497777e-05, "loss": 0.4921, "mean_token_accuracy": 0.8437571413815022, "num_tokens": 927689604.0, "step": 29067 }, { "entropy": 0.5230314498767257, "epoch": 2.6744067026641596, "grad_norm": 0.1593746840953827, "learning_rate": 1.0856564541356151e-05, "loss": 0.5086, "mean_token_accuracy": 0.8406845442950726, "num_tokens": 927721135.0, "step": 29068 }, { "entropy": 0.5274232272058725, "epoch": 2.6744987090356007, "grad_norm": 0.1585666537284851, "learning_rate": 1.0853497715214524e-05, "loss": 0.5164, "mean_token_accuracy": 0.8371040783822536, "num_tokens": 927752915.0, "step": 29069 }, { "entropy": 0.47639091219753027, "epoch": 2.674590715407042, "grad_norm": 0.14903821051120758, "learning_rate": 1.0850430889072899e-05, "loss": 0.4755, "mean_token_accuracy": 0.8517163693904877, "num_tokens": 927785598.0, "step": 29070 }, { "entropy": 0.4126891549676657, "epoch": 2.674682721778483, "grad_norm": 0.14858806133270264, "learning_rate": 1.0847364062931272e-05, "loss": 0.4027, "mean_token_accuracy": 0.8693737499415874, "num_tokens": 927817774.0, "step": 29071 }, { "entropy": 0.45480431988835335, "epoch": 2.6747747281499246, "grad_norm": 0.15132366120815277, "learning_rate": 1.0844297236789647e-05, "loss": 0.4334, "mean_token_accuracy": 0.8579801954329014, "num_tokens": 927849848.0, "step": 29072 }, { "entropy": 0.5652332995086908, "epoch": 2.6748667345213657, "grad_norm": 0.17098771035671234, "learning_rate": 1.0841230410648021e-05, "loss": 0.5529, "mean_token_accuracy": 0.8240426816046238, "num_tokens": 927881732.0, "step": 29073 }, { "entropy": 0.5371096171438694, "epoch": 2.674958740892807, "grad_norm": 0.159988671541214, "learning_rate": 1.0838163584506394e-05, "loss": 0.526, "mean_token_accuracy": 0.8337366320192814, "num_tokens": 927913234.0, "step": 29074 }, { "entropy": 0.4687415543012321, "epoch": 2.675050747264248, "grad_norm": 0.14962151646614075, "learning_rate": 1.0835096758364769e-05, "loss": 0.4656, "mean_token_accuracy": 0.8531821556389332, "num_tokens": 927945196.0, "step": 29075 }, { "entropy": 0.5872183423489332, "epoch": 2.675142753635689, "grad_norm": 0.16805188357830048, "learning_rate": 1.0832029932223142e-05, "loss": 0.5814, "mean_token_accuracy": 0.8183182552456856, "num_tokens": 927977560.0, "step": 29076 }, { "entropy": 0.596471106633544, "epoch": 2.6752347600071307, "grad_norm": 0.1703442931175232, "learning_rate": 1.0828963106081517e-05, "loss": 0.592, "mean_token_accuracy": 0.8125852830708027, "num_tokens": 928009525.0, "step": 29077 }, { "entropy": 0.48598845349624753, "epoch": 2.675326766378572, "grad_norm": 0.15490247309207916, "learning_rate": 1.0825896279939891e-05, "loss": 0.4696, "mean_token_accuracy": 0.8475095555186272, "num_tokens": 928041458.0, "step": 29078 }, { "entropy": 0.42429623659700155, "epoch": 2.675418772750013, "grad_norm": 0.14690105617046356, "learning_rate": 1.0822829453798266e-05, "loss": 0.419, "mean_token_accuracy": 0.8650667928159237, "num_tokens": 928073781.0, "step": 29079 }, { "entropy": 0.44496242702007294, "epoch": 2.675510779121454, "grad_norm": 0.154465913772583, "learning_rate": 1.0819762627656639e-05, "loss": 0.4292, "mean_token_accuracy": 0.8597441203892231, "num_tokens": 928105052.0, "step": 29080 }, { "entropy": 0.5285639325156808, "epoch": 2.675602785492895, "grad_norm": 0.1609007716178894, "learning_rate": 1.0816695801515013e-05, "loss": 0.5191, "mean_token_accuracy": 0.8375102393329144, "num_tokens": 928137557.0, "step": 29081 }, { "entropy": 0.4373868564143777, "epoch": 2.675694791864337, "grad_norm": 0.15063731372356415, "learning_rate": 1.0813628975373386e-05, "loss": 0.4248, "mean_token_accuracy": 0.8606906421482563, "num_tokens": 928169460.0, "step": 29082 }, { "entropy": 0.45949739404022694, "epoch": 2.675786798235778, "grad_norm": 0.15404659509658813, "learning_rate": 1.0810562149231761e-05, "loss": 0.4524, "mean_token_accuracy": 0.8543753251433372, "num_tokens": 928201400.0, "step": 29083 }, { "entropy": 0.5622122902423143, "epoch": 2.675878804607219, "grad_norm": 0.16408319771289825, "learning_rate": 1.0807495323090134e-05, "loss": 0.5527, "mean_token_accuracy": 0.8234252035617828, "num_tokens": 928233371.0, "step": 29084 }, { "entropy": 0.5560120809823275, "epoch": 2.67597081097866, "grad_norm": 0.16728386282920837, "learning_rate": 1.0804428496948509e-05, "loss": 0.551, "mean_token_accuracy": 0.8255364149808884, "num_tokens": 928264895.0, "step": 29085 }, { "entropy": 0.5014004707336426, "epoch": 2.6760628173501013, "grad_norm": 0.1614663451910019, "learning_rate": 1.0801361670806882e-05, "loss": 0.4879, "mean_token_accuracy": 0.8418073058128357, "num_tokens": 928296639.0, "step": 29086 }, { "entropy": 0.527387554757297, "epoch": 2.676154823721543, "grad_norm": 0.15904060006141663, "learning_rate": 1.0798294844665256e-05, "loss": 0.5155, "mean_token_accuracy": 0.8354627452790737, "num_tokens": 928329099.0, "step": 29087 }, { "entropy": 0.5219119358807802, "epoch": 2.676246830092984, "grad_norm": 0.1582222729921341, "learning_rate": 1.0795228018523631e-05, "loss": 0.5168, "mean_token_accuracy": 0.8371809273958206, "num_tokens": 928361464.0, "step": 29088 }, { "entropy": 0.5011910413159057, "epoch": 2.676338836464425, "grad_norm": 0.16050921380519867, "learning_rate": 1.0792161192382004e-05, "loss": 0.4844, "mean_token_accuracy": 0.8480429463088512, "num_tokens": 928392724.0, "step": 29089 }, { "entropy": 0.5175329046323895, "epoch": 2.6764308428358663, "grad_norm": 0.16624395549297333, "learning_rate": 1.0789094366240378e-05, "loss": 0.5065, "mean_token_accuracy": 0.8375846594572067, "num_tokens": 928424155.0, "step": 29090 }, { "entropy": 0.512175839394331, "epoch": 2.6765228492073074, "grad_norm": 0.16082221269607544, "learning_rate": 1.0786027540098751e-05, "loss": 0.5006, "mean_token_accuracy": 0.839100543409586, "num_tokens": 928455663.0, "step": 29091 }, { "entropy": 0.5224656986538321, "epoch": 2.676614855578749, "grad_norm": 0.16018705070018768, "learning_rate": 1.0782960713957126e-05, "loss": 0.5043, "mean_token_accuracy": 0.8393914327025414, "num_tokens": 928486422.0, "step": 29092 }, { "entropy": 0.5067157819867134, "epoch": 2.67670686195019, "grad_norm": 0.16118581593036652, "learning_rate": 1.07798938878155e-05, "loss": 0.5033, "mean_token_accuracy": 0.8393560498952866, "num_tokens": 928517931.0, "step": 29093 }, { "entropy": 0.5299272239208221, "epoch": 2.6767988683216313, "grad_norm": 0.1606595516204834, "learning_rate": 1.0776827061673875e-05, "loss": 0.5213, "mean_token_accuracy": 0.8382042311131954, "num_tokens": 928550388.0, "step": 29094 }, { "entropy": 0.646138571202755, "epoch": 2.6768908746930724, "grad_norm": 0.17283493280410767, "learning_rate": 1.0773760235532248e-05, "loss": 0.635, "mean_token_accuracy": 0.8021733909845352, "num_tokens": 928582825.0, "step": 29095 }, { "entropy": 0.5576494336128235, "epoch": 2.6769828810645135, "grad_norm": 0.16224925220012665, "learning_rate": 1.0770693409390623e-05, "loss": 0.5425, "mean_token_accuracy": 0.8322168737649918, "num_tokens": 928615271.0, "step": 29096 }, { "entropy": 0.5102053992450237, "epoch": 2.677074887435955, "grad_norm": 0.15824055671691895, "learning_rate": 1.0767626583248996e-05, "loss": 0.4955, "mean_token_accuracy": 0.8422297835350037, "num_tokens": 928646757.0, "step": 29097 }, { "entropy": 0.38365119183436036, "epoch": 2.6771668938073963, "grad_norm": 0.1392364799976349, "learning_rate": 1.076455975710737e-05, "loss": 0.3676, "mean_token_accuracy": 0.8829145804047585, "num_tokens": 928679067.0, "step": 29098 }, { "entropy": 0.48673626594245434, "epoch": 2.6772589001788374, "grad_norm": 0.15697930753231049, "learning_rate": 1.0761492930965744e-05, "loss": 0.4747, "mean_token_accuracy": 0.8490366563200951, "num_tokens": 928711559.0, "step": 29099 }, { "entropy": 0.544989001005888, "epoch": 2.6773509065502785, "grad_norm": 0.1608366221189499, "learning_rate": 1.0758426104824118e-05, "loss": 0.5273, "mean_token_accuracy": 0.8326971083879471, "num_tokens": 928744112.0, "step": 29100 }, { "entropy": 0.5064699854701757, "epoch": 2.6774429129217197, "grad_norm": 0.15664240717887878, "learning_rate": 1.0755359278682491e-05, "loss": 0.4894, "mean_token_accuracy": 0.8426880650222301, "num_tokens": 928775756.0, "step": 29101 }, { "entropy": 0.5348106152378023, "epoch": 2.6775349192931612, "grad_norm": 0.15972189605236053, "learning_rate": 1.0752292452540866e-05, "loss": 0.5131, "mean_token_accuracy": 0.8348997160792351, "num_tokens": 928807705.0, "step": 29102 }, { "entropy": 0.41262307576835155, "epoch": 2.6776269256646024, "grad_norm": 0.15042343735694885, "learning_rate": 1.074922562639924e-05, "loss": 0.4041, "mean_token_accuracy": 0.869668610394001, "num_tokens": 928838799.0, "step": 29103 }, { "entropy": 0.5619925716891885, "epoch": 2.6777189320360435, "grad_norm": 0.16356538236141205, "learning_rate": 1.0746158800257613e-05, "loss": 0.5434, "mean_token_accuracy": 0.8237308748066425, "num_tokens": 928870097.0, "step": 29104 }, { "entropy": 0.5053810402750969, "epoch": 2.6778109384074846, "grad_norm": 0.16145078837871552, "learning_rate": 1.0743091974115988e-05, "loss": 0.495, "mean_token_accuracy": 0.8428517319262028, "num_tokens": 928902066.0, "step": 29105 }, { "entropy": 0.6307931579649448, "epoch": 2.6779029447789258, "grad_norm": 0.16719917953014374, "learning_rate": 1.0740025147974361e-05, "loss": 0.6126, "mean_token_accuracy": 0.8083166033029556, "num_tokens": 928934012.0, "step": 29106 }, { "entropy": 0.5955058457329869, "epoch": 2.6779949511503673, "grad_norm": 0.17121584713459015, "learning_rate": 1.0736958321832736e-05, "loss": 0.5975, "mean_token_accuracy": 0.8129660524427891, "num_tokens": 928965616.0, "step": 29107 }, { "entropy": 0.4579356829635799, "epoch": 2.6780869575218085, "grad_norm": 0.1500275731086731, "learning_rate": 1.073389149569111e-05, "loss": 0.4583, "mean_token_accuracy": 0.8584516234695911, "num_tokens": 928997452.0, "step": 29108 }, { "entropy": 0.38030233420431614, "epoch": 2.6781789638932496, "grad_norm": 0.14044588804244995, "learning_rate": 1.0730824669549485e-05, "loss": 0.3723, "mean_token_accuracy": 0.8813891001045704, "num_tokens": 929029917.0, "step": 29109 }, { "entropy": 0.46930020255967975, "epoch": 2.6782709702646907, "grad_norm": 0.1578858196735382, "learning_rate": 1.0727757843407858e-05, "loss": 0.4519, "mean_token_accuracy": 0.8578573986887932, "num_tokens": 929062050.0, "step": 29110 }, { "entropy": 0.5661107383202761, "epoch": 2.678362976636132, "grad_norm": 0.1660747230052948, "learning_rate": 1.0724691017266233e-05, "loss": 0.5583, "mean_token_accuracy": 0.8234492428600788, "num_tokens": 929093876.0, "step": 29111 }, { "entropy": 0.46070524491369724, "epoch": 2.6784549830075735, "grad_norm": 0.1519545018672943, "learning_rate": 1.0721624191124605e-05, "loss": 0.4478, "mean_token_accuracy": 0.8561176769435406, "num_tokens": 929126038.0, "step": 29112 }, { "entropy": 0.4608921455219388, "epoch": 2.6785469893790146, "grad_norm": 0.15386143326759338, "learning_rate": 1.071855736498298e-05, "loss": 0.4534, "mean_token_accuracy": 0.8545432314276695, "num_tokens": 929158806.0, "step": 29113 }, { "entropy": 0.5500083081424236, "epoch": 2.6786389957504557, "grad_norm": 0.16210201382637024, "learning_rate": 1.0715490538841353e-05, "loss": 0.5425, "mean_token_accuracy": 0.8254607208073139, "num_tokens": 929190904.0, "step": 29114 }, { "entropy": 0.573618158698082, "epoch": 2.678731002121897, "grad_norm": 0.168463334441185, "learning_rate": 1.0712423712699728e-05, "loss": 0.5698, "mean_token_accuracy": 0.8217159993946552, "num_tokens": 929222338.0, "step": 29115 }, { "entropy": 0.5029428512789309, "epoch": 2.678823008493338, "grad_norm": 0.15573178231716156, "learning_rate": 1.07093568865581e-05, "loss": 0.4861, "mean_token_accuracy": 0.8464356474578381, "num_tokens": 929254866.0, "step": 29116 }, { "entropy": 0.35925727675203234, "epoch": 2.6789150148647796, "grad_norm": 0.1368696093559265, "learning_rate": 1.0706290060416475e-05, "loss": 0.3505, "mean_token_accuracy": 0.8856182582676411, "num_tokens": 929287351.0, "step": 29117 }, { "entropy": 0.5319208633154631, "epoch": 2.6790070212362207, "grad_norm": 0.16686195135116577, "learning_rate": 1.070322323427485e-05, "loss": 0.5296, "mean_token_accuracy": 0.8324883058667183, "num_tokens": 929319648.0, "step": 29118 }, { "entropy": 0.594547163695097, "epoch": 2.679099027607662, "grad_norm": 0.1634790301322937, "learning_rate": 1.0700156408133223e-05, "loss": 0.5863, "mean_token_accuracy": 0.8168011717498302, "num_tokens": 929351806.0, "step": 29119 }, { "entropy": 0.47385852597653866, "epoch": 2.679191033979103, "grad_norm": 0.1546432077884674, "learning_rate": 1.0697089581991598e-05, "loss": 0.4791, "mean_token_accuracy": 0.8488203808665276, "num_tokens": 929383977.0, "step": 29120 }, { "entropy": 0.5531051428988576, "epoch": 2.679283040350544, "grad_norm": 0.16782991588115692, "learning_rate": 1.069402275584997e-05, "loss": 0.5514, "mean_token_accuracy": 0.824126847088337, "num_tokens": 929415999.0, "step": 29121 }, { "entropy": 0.5793291609734297, "epoch": 2.6793750467219857, "grad_norm": 0.16907919943332672, "learning_rate": 1.0690955929708345e-05, "loss": 0.5662, "mean_token_accuracy": 0.8204370327293873, "num_tokens": 929447357.0, "step": 29122 }, { "entropy": 0.5481646647676826, "epoch": 2.679467053093427, "grad_norm": 0.1667831838130951, "learning_rate": 1.0687889103566718e-05, "loss": 0.5476, "mean_token_accuracy": 0.8270633071660995, "num_tokens": 929479443.0, "step": 29123 }, { "entropy": 0.595465637743473, "epoch": 2.679559059464868, "grad_norm": 0.17061728239059448, "learning_rate": 1.0684822277425094e-05, "loss": 0.587, "mean_token_accuracy": 0.819617249071598, "num_tokens": 929510786.0, "step": 29124 }, { "entropy": 0.4347485499456525, "epoch": 2.679651065836309, "grad_norm": 0.14587590098381042, "learning_rate": 1.0681755451283467e-05, "loss": 0.4199, "mean_token_accuracy": 0.8663195297122002, "num_tokens": 929542715.0, "step": 29125 }, { "entropy": 0.5318776601925492, "epoch": 2.67974307220775, "grad_norm": 0.1604166328907013, "learning_rate": 1.0678688625141842e-05, "loss": 0.5216, "mean_token_accuracy": 0.8357809148728848, "num_tokens": 929574968.0, "step": 29126 }, { "entropy": 0.47246203012764454, "epoch": 2.679835078579192, "grad_norm": 0.1556895673274994, "learning_rate": 1.0675621799000215e-05, "loss": 0.4583, "mean_token_accuracy": 0.8520087599754333, "num_tokens": 929607192.0, "step": 29127 }, { "entropy": 0.5288028009235859, "epoch": 2.679927084950633, "grad_norm": 0.1554131805896759, "learning_rate": 1.067255497285859e-05, "loss": 0.5057, "mean_token_accuracy": 0.8420649766921997, "num_tokens": 929639954.0, "step": 29128 }, { "entropy": 0.5561697371304035, "epoch": 2.680019091322074, "grad_norm": 0.16249243915081024, "learning_rate": 1.0669488146716963e-05, "loss": 0.5399, "mean_token_accuracy": 0.8298728615045547, "num_tokens": 929671925.0, "step": 29129 }, { "entropy": 0.4830034370534122, "epoch": 2.680111097693515, "grad_norm": 0.154496967792511, "learning_rate": 1.0666421320575337e-05, "loss": 0.4648, "mean_token_accuracy": 0.8485722504556179, "num_tokens": 929704071.0, "step": 29130 }, { "entropy": 0.5358920525759459, "epoch": 2.6802031040649563, "grad_norm": 0.15904296934604645, "learning_rate": 1.066335449443371e-05, "loss": 0.5235, "mean_token_accuracy": 0.8352605439722538, "num_tokens": 929736499.0, "step": 29131 }, { "entropy": 0.4520348464138806, "epoch": 2.680295110436398, "grad_norm": 0.14313974976539612, "learning_rate": 1.0660287668292085e-05, "loss": 0.4378, "mean_token_accuracy": 0.8617584928870201, "num_tokens": 929768871.0, "step": 29132 }, { "entropy": 0.5348973907530308, "epoch": 2.680387116807839, "grad_norm": 0.1622764617204666, "learning_rate": 1.065722084215046e-05, "loss": 0.518, "mean_token_accuracy": 0.8343714699149132, "num_tokens": 929800900.0, "step": 29133 }, { "entropy": 0.47016852581873536, "epoch": 2.68047912317928, "grad_norm": 0.15587309002876282, "learning_rate": 1.0654154016008832e-05, "loss": 0.4583, "mean_token_accuracy": 0.8541034385561943, "num_tokens": 929832472.0, "step": 29134 }, { "entropy": 0.5553345214575529, "epoch": 2.6805711295507213, "grad_norm": 0.16228236258029938, "learning_rate": 1.0651087189867207e-05, "loss": 0.5398, "mean_token_accuracy": 0.8282219283282757, "num_tokens": 929864424.0, "step": 29135 }, { "entropy": 0.5990844871848822, "epoch": 2.6806631359221624, "grad_norm": 0.1693442165851593, "learning_rate": 1.064802036372558e-05, "loss": 0.574, "mean_token_accuracy": 0.8180391639471054, "num_tokens": 929896517.0, "step": 29136 }, { "entropy": 0.45786064118146896, "epoch": 2.680755142293604, "grad_norm": 0.14791707694530487, "learning_rate": 1.0644953537583955e-05, "loss": 0.4365, "mean_token_accuracy": 0.8595118224620819, "num_tokens": 929928385.0, "step": 29137 }, { "entropy": 0.49356373585760593, "epoch": 2.680847148665045, "grad_norm": 0.15694810450077057, "learning_rate": 1.0641886711442328e-05, "loss": 0.4871, "mean_token_accuracy": 0.8453834317624569, "num_tokens": 929960490.0, "step": 29138 }, { "entropy": 0.5553853365126997, "epoch": 2.6809391550364863, "grad_norm": 0.16550230979919434, "learning_rate": 1.0638819885300704e-05, "loss": 0.5368, "mean_token_accuracy": 0.8312368057668209, "num_tokens": 929992254.0, "step": 29139 }, { "entropy": 0.47371022403240204, "epoch": 2.6810311614079274, "grad_norm": 0.1482934206724167, "learning_rate": 1.0635753059159077e-05, "loss": 0.4561, "mean_token_accuracy": 0.8553846590220928, "num_tokens": 930023179.0, "step": 29140 }, { "entropy": 0.4495510929264128, "epoch": 2.6811231677793685, "grad_norm": 0.15371932089328766, "learning_rate": 1.0632686233017452e-05, "loss": 0.4367, "mean_token_accuracy": 0.8578386344015598, "num_tokens": 930054573.0, "step": 29141 }, { "entropy": 0.5373139139264822, "epoch": 2.68121517415081, "grad_norm": 0.16416522860527039, "learning_rate": 1.0629619406875825e-05, "loss": 0.5234, "mean_token_accuracy": 0.8332402184605598, "num_tokens": 930086329.0, "step": 29142 }, { "entropy": 0.5201195292174816, "epoch": 2.6813071805222513, "grad_norm": 0.1630067378282547, "learning_rate": 1.06265525807342e-05, "loss": 0.5209, "mean_token_accuracy": 0.8356684297323227, "num_tokens": 930118395.0, "step": 29143 }, { "entropy": 0.48565093986690044, "epoch": 2.6813991868936924, "grad_norm": 0.15940214693546295, "learning_rate": 1.0623485754592572e-05, "loss": 0.4697, "mean_token_accuracy": 0.8473000638186932, "num_tokens": 930149757.0, "step": 29144 }, { "entropy": 0.6158801969140768, "epoch": 2.6814911932651335, "grad_norm": 0.1714402437210083, "learning_rate": 1.0620418928450947e-05, "loss": 0.6098, "mean_token_accuracy": 0.8082390651106834, "num_tokens": 930182371.0, "step": 29145 }, { "entropy": 0.4878916386514902, "epoch": 2.6815831996365747, "grad_norm": 0.1546008139848709, "learning_rate": 1.061735210230932e-05, "loss": 0.4672, "mean_token_accuracy": 0.8509546779096127, "num_tokens": 930214207.0, "step": 29146 }, { "entropy": 0.4891133231576532, "epoch": 2.6816752060080162, "grad_norm": 0.15509751439094543, "learning_rate": 1.0614285276167694e-05, "loss": 0.4699, "mean_token_accuracy": 0.8504340164363384, "num_tokens": 930245529.0, "step": 29147 }, { "entropy": 0.5240641534328461, "epoch": 2.6817672123794574, "grad_norm": 0.16279830038547516, "learning_rate": 1.0611218450026069e-05, "loss": 0.508, "mean_token_accuracy": 0.8422892801463604, "num_tokens": 930277807.0, "step": 29148 }, { "entropy": 0.5042914152145386, "epoch": 2.6818592187508985, "grad_norm": 0.16222591698169708, "learning_rate": 1.0608151623884442e-05, "loss": 0.4995, "mean_token_accuracy": 0.837932612746954, "num_tokens": 930309811.0, "step": 29149 }, { "entropy": 0.41874908935278654, "epoch": 2.6819512251223396, "grad_norm": 0.14813268184661865, "learning_rate": 1.0605084797742817e-05, "loss": 0.4135, "mean_token_accuracy": 0.8675798997282982, "num_tokens": 930342518.0, "step": 29150 }, { "entropy": 0.4741004379466176, "epoch": 2.6820432314937808, "grad_norm": 0.15445643663406372, "learning_rate": 1.060201797160119e-05, "loss": 0.4677, "mean_token_accuracy": 0.8506585955619812, "num_tokens": 930373906.0, "step": 29151 }, { "entropy": 0.4328105580061674, "epoch": 2.6821352378652223, "grad_norm": 0.1471056342124939, "learning_rate": 1.0598951145459564e-05, "loss": 0.4181, "mean_token_accuracy": 0.8645714148879051, "num_tokens": 930405673.0, "step": 29152 }, { "entropy": 0.5199329340830445, "epoch": 2.6822272442366635, "grad_norm": 0.1641828864812851, "learning_rate": 1.0595884319317937e-05, "loss": 0.52, "mean_token_accuracy": 0.8364401198923588, "num_tokens": 930438170.0, "step": 29153 }, { "entropy": 0.4421904543414712, "epoch": 2.6823192506081046, "grad_norm": 0.15187741816043854, "learning_rate": 1.0592817493176314e-05, "loss": 0.4249, "mean_token_accuracy": 0.863849338144064, "num_tokens": 930469716.0, "step": 29154 }, { "entropy": 0.5360309602692723, "epoch": 2.6824112569795457, "grad_norm": 0.16610382497310638, "learning_rate": 1.0589750667034687e-05, "loss": 0.5278, "mean_token_accuracy": 0.8327465951442719, "num_tokens": 930501127.0, "step": 29155 }, { "entropy": 0.5386762591078877, "epoch": 2.682503263350987, "grad_norm": 0.15999069809913635, "learning_rate": 1.0586683840893061e-05, "loss": 0.5268, "mean_token_accuracy": 0.8314958028495312, "num_tokens": 930532824.0, "step": 29156 }, { "entropy": 0.593650040216744, "epoch": 2.6825952697224285, "grad_norm": 0.1655336618423462, "learning_rate": 1.0583617014751434e-05, "loss": 0.5848, "mean_token_accuracy": 0.8164054192602634, "num_tokens": 930565420.0, "step": 29157 }, { "entropy": 0.4554415475577116, "epoch": 2.6826872760938696, "grad_norm": 0.1535850614309311, "learning_rate": 1.0580550188609809e-05, "loss": 0.4402, "mean_token_accuracy": 0.8595408983528614, "num_tokens": 930597522.0, "step": 29158 }, { "entropy": 0.4689847733825445, "epoch": 2.6827792824653107, "grad_norm": 0.15773405134677887, "learning_rate": 1.0577483362468182e-05, "loss": 0.4593, "mean_token_accuracy": 0.8508142456412315, "num_tokens": 930628352.0, "step": 29159 }, { "entropy": 0.4597216220572591, "epoch": 2.682871288836752, "grad_norm": 0.14590951800346375, "learning_rate": 1.0574416536326556e-05, "loss": 0.4361, "mean_token_accuracy": 0.8629725985229015, "num_tokens": 930660619.0, "step": 29160 }, { "entropy": 0.5306468876078725, "epoch": 2.682963295208193, "grad_norm": 0.16176149249076843, "learning_rate": 1.057134971018493e-05, "loss": 0.5195, "mean_token_accuracy": 0.8318662792444229, "num_tokens": 930692712.0, "step": 29161 }, { "entropy": 0.532287654466927, "epoch": 2.6830553015796346, "grad_norm": 0.1568252295255661, "learning_rate": 1.0568282884043304e-05, "loss": 0.5228, "mean_token_accuracy": 0.8337809890508652, "num_tokens": 930725469.0, "step": 29162 }, { "entropy": 0.47119265422225, "epoch": 2.6831473079510757, "grad_norm": 0.1575099676847458, "learning_rate": 1.0565216057901679e-05, "loss": 0.4491, "mean_token_accuracy": 0.853806160390377, "num_tokens": 930756450.0, "step": 29163 }, { "entropy": 0.4610559307038784, "epoch": 2.683239314322517, "grad_norm": 0.15256956219673157, "learning_rate": 1.0562149231760052e-05, "loss": 0.4487, "mean_token_accuracy": 0.854041825979948, "num_tokens": 930788520.0, "step": 29164 }, { "entropy": 0.4662434486672282, "epoch": 2.683331320693958, "grad_norm": 0.1550869345664978, "learning_rate": 1.0559082405618426e-05, "loss": 0.4527, "mean_token_accuracy": 0.8551915287971497, "num_tokens": 930819585.0, "step": 29165 }, { "entropy": 0.46269620675593615, "epoch": 2.683423327065399, "grad_norm": 0.15052516758441925, "learning_rate": 1.05560155794768e-05, "loss": 0.4525, "mean_token_accuracy": 0.8547797910869122, "num_tokens": 930851699.0, "step": 29166 }, { "entropy": 0.5121003407984972, "epoch": 2.6835153334368407, "grad_norm": 0.16183879971504211, "learning_rate": 1.0552948753335174e-05, "loss": 0.5002, "mean_token_accuracy": 0.8393609933555126, "num_tokens": 930883661.0, "step": 29167 }, { "entropy": 0.5157331274822354, "epoch": 2.683607339808282, "grad_norm": 0.1587165892124176, "learning_rate": 1.0549881927193547e-05, "loss": 0.5002, "mean_token_accuracy": 0.8406166359782219, "num_tokens": 930915592.0, "step": 29168 }, { "entropy": 0.4556115595623851, "epoch": 2.683699346179723, "grad_norm": 0.15376439690589905, "learning_rate": 1.0546815101051923e-05, "loss": 0.4525, "mean_token_accuracy": 0.8548634573817253, "num_tokens": 930947364.0, "step": 29169 }, { "entropy": 0.5781977456063032, "epoch": 2.683791352551164, "grad_norm": 0.1667540818452835, "learning_rate": 1.0543748274910296e-05, "loss": 0.5685, "mean_token_accuracy": 0.8180397339165211, "num_tokens": 930979384.0, "step": 29170 }, { "entropy": 0.4638390429317951, "epoch": 2.683883358922605, "grad_norm": 0.15932855010032654, "learning_rate": 1.054068144876867e-05, "loss": 0.456, "mean_token_accuracy": 0.8555225655436516, "num_tokens": 931010651.0, "step": 29171 }, { "entropy": 0.4594523645937443, "epoch": 2.683975365294047, "grad_norm": 0.14927269518375397, "learning_rate": 1.0537614622627044e-05, "loss": 0.4399, "mean_token_accuracy": 0.8600919619202614, "num_tokens": 931043038.0, "step": 29172 }, { "entropy": 0.42161701200529933, "epoch": 2.684067371665488, "grad_norm": 0.15132659673690796, "learning_rate": 1.0534547796485418e-05, "loss": 0.4149, "mean_token_accuracy": 0.8661377541720867, "num_tokens": 931075530.0, "step": 29173 }, { "entropy": 0.5341358855366707, "epoch": 2.684159378036929, "grad_norm": 0.164937824010849, "learning_rate": 1.0531480970343791e-05, "loss": 0.5227, "mean_token_accuracy": 0.8354602456092834, "num_tokens": 931107604.0, "step": 29174 }, { "entropy": 0.5312693770974874, "epoch": 2.68425138440837, "grad_norm": 0.16425643861293793, "learning_rate": 1.0528414144202166e-05, "loss": 0.5289, "mean_token_accuracy": 0.8349555283784866, "num_tokens": 931139989.0, "step": 29175 }, { "entropy": 0.48352982057258487, "epoch": 2.6843433907798113, "grad_norm": 0.15033091604709625, "learning_rate": 1.0525347318060539e-05, "loss": 0.4697, "mean_token_accuracy": 0.8520390428602695, "num_tokens": 931172513.0, "step": 29176 }, { "entropy": 0.5099924076348543, "epoch": 2.684435397151253, "grad_norm": 0.1599452793598175, "learning_rate": 1.0522280491918914e-05, "loss": 0.5087, "mean_token_accuracy": 0.8408362120389938, "num_tokens": 931204571.0, "step": 29177 }, { "entropy": 0.5303939636796713, "epoch": 2.684527403522694, "grad_norm": 0.1587020307779312, "learning_rate": 1.0519213665777288e-05, "loss": 0.5097, "mean_token_accuracy": 0.8401521556079388, "num_tokens": 931236823.0, "step": 29178 }, { "entropy": 0.48370025563053787, "epoch": 2.684619409894135, "grad_norm": 0.15752677619457245, "learning_rate": 1.0516146839635661e-05, "loss": 0.482, "mean_token_accuracy": 0.8464307375252247, "num_tokens": 931267352.0, "step": 29179 }, { "entropy": 0.476715630851686, "epoch": 2.6847114162655763, "grad_norm": 0.15768879652023315, "learning_rate": 1.0513080013494036e-05, "loss": 0.4613, "mean_token_accuracy": 0.8508002534508705, "num_tokens": 931299089.0, "step": 29180 }, { "entropy": 0.5810837391763926, "epoch": 2.6848034226370174, "grad_norm": 0.16606183350086212, "learning_rate": 1.0510013187352409e-05, "loss": 0.5717, "mean_token_accuracy": 0.8185322992503643, "num_tokens": 931331191.0, "step": 29181 }, { "entropy": 0.49023588839918375, "epoch": 2.684895429008459, "grad_norm": 0.16253307461738586, "learning_rate": 1.0506946361210783e-05, "loss": 0.4809, "mean_token_accuracy": 0.8482393175363541, "num_tokens": 931362063.0, "step": 29182 }, { "entropy": 0.5249946867115796, "epoch": 2.6849874353799, "grad_norm": 0.15699920058250427, "learning_rate": 1.0503879535069156e-05, "loss": 0.5094, "mean_token_accuracy": 0.84017763286829, "num_tokens": 931394293.0, "step": 29183 }, { "entropy": 0.47583037056028843, "epoch": 2.6850794417513413, "grad_norm": 0.163823664188385, "learning_rate": 1.0500812708927531e-05, "loss": 0.4557, "mean_token_accuracy": 0.8554549105465412, "num_tokens": 931426379.0, "step": 29184 }, { "entropy": 0.45616112649440765, "epoch": 2.6851714481227824, "grad_norm": 0.1521030068397522, "learning_rate": 1.0497745882785906e-05, "loss": 0.4467, "mean_token_accuracy": 0.8573392070829868, "num_tokens": 931458607.0, "step": 29185 }, { "entropy": 0.42048403806984425, "epoch": 2.6852634544942235, "grad_norm": 0.1516328901052475, "learning_rate": 1.049467905664428e-05, "loss": 0.4117, "mean_token_accuracy": 0.8668138645589352, "num_tokens": 931488982.0, "step": 29186 }, { "entropy": 0.5259637981653214, "epoch": 2.685355460865665, "grad_norm": 0.1587507575750351, "learning_rate": 1.0491612230502653e-05, "loss": 0.5124, "mean_token_accuracy": 0.8379965424537659, "num_tokens": 931521052.0, "step": 29187 }, { "entropy": 0.554237593896687, "epoch": 2.6854474672371063, "grad_norm": 0.16007307171821594, "learning_rate": 1.0488545404361028e-05, "loss": 0.5405, "mean_token_accuracy": 0.8316040970385075, "num_tokens": 931553549.0, "step": 29188 }, { "entropy": 0.57468924485147, "epoch": 2.6855394736085474, "grad_norm": 0.167453333735466, "learning_rate": 1.04854785782194e-05, "loss": 0.5623, "mean_token_accuracy": 0.8221227638423443, "num_tokens": 931585516.0, "step": 29189 }, { "entropy": 0.5478267576545477, "epoch": 2.6856314799799885, "grad_norm": 0.16341184079647064, "learning_rate": 1.0482411752077775e-05, "loss": 0.5435, "mean_token_accuracy": 0.8273701816797256, "num_tokens": 931617089.0, "step": 29190 }, { "entropy": 0.3538625380024314, "epoch": 2.6857234863514297, "grad_norm": 0.12997561693191528, "learning_rate": 1.0479344925936148e-05, "loss": 0.3355, "mean_token_accuracy": 0.8947465755045414, "num_tokens": 931649855.0, "step": 29191 }, { "entropy": 0.42961936071515083, "epoch": 2.6858154927228712, "grad_norm": 0.146204873919487, "learning_rate": 1.0476278099794523e-05, "loss": 0.4106, "mean_token_accuracy": 0.8689808398485184, "num_tokens": 931682055.0, "step": 29192 }, { "entropy": 0.5563770895823836, "epoch": 2.6859074990943124, "grad_norm": 0.1651734858751297, "learning_rate": 1.0473211273652898e-05, "loss": 0.5421, "mean_token_accuracy": 0.8261435516178608, "num_tokens": 931713456.0, "step": 29193 }, { "entropy": 0.5897287412080914, "epoch": 2.6859995054657535, "grad_norm": 0.16699784994125366, "learning_rate": 1.047014444751127e-05, "loss": 0.5739, "mean_token_accuracy": 0.8192525058984756, "num_tokens": 931745556.0, "step": 29194 }, { "entropy": 0.5634769015014172, "epoch": 2.6860915118371946, "grad_norm": 0.16329412162303925, "learning_rate": 1.0467077621369645e-05, "loss": 0.5573, "mean_token_accuracy": 0.8205353319644928, "num_tokens": 931777506.0, "step": 29195 }, { "entropy": 0.48265912011265755, "epoch": 2.6861835182086358, "grad_norm": 0.15263448655605316, "learning_rate": 1.0464010795228018e-05, "loss": 0.477, "mean_token_accuracy": 0.84885049238801, "num_tokens": 931809824.0, "step": 29196 }, { "entropy": 0.5616848934441805, "epoch": 2.6862755245800773, "grad_norm": 0.16630133986473083, "learning_rate": 1.0460943969086393e-05, "loss": 0.554, "mean_token_accuracy": 0.8219681568443775, "num_tokens": 931842401.0, "step": 29197 }, { "entropy": 0.519709394313395, "epoch": 2.6863675309515185, "grad_norm": 0.1570175141096115, "learning_rate": 1.0457877142944766e-05, "loss": 0.5072, "mean_token_accuracy": 0.8369040377438068, "num_tokens": 931874329.0, "step": 29198 }, { "entropy": 0.41380641411524266, "epoch": 2.6864595373229596, "grad_norm": 0.14811186492443085, "learning_rate": 1.045481031680314e-05, "loss": 0.3994, "mean_token_accuracy": 0.8711238577961922, "num_tokens": 931904949.0, "step": 29199 }, { "entropy": 0.49824707116931677, "epoch": 2.6865515436944007, "grad_norm": 0.1575956642627716, "learning_rate": 1.0451743490661515e-05, "loss": 0.4937, "mean_token_accuracy": 0.8424588590860367, "num_tokens": 931937285.0, "step": 29200 }, { "entropy": 0.5025965366512537, "epoch": 2.686643550065842, "grad_norm": 0.15761882066726685, "learning_rate": 1.044867666451989e-05, "loss": 0.4969, "mean_token_accuracy": 0.842497456818819, "num_tokens": 931969752.0, "step": 29201 }, { "entropy": 0.45869811810553074, "epoch": 2.6867355564372835, "grad_norm": 0.1525208204984665, "learning_rate": 1.0445609838378263e-05, "loss": 0.4509, "mean_token_accuracy": 0.8538332842290401, "num_tokens": 932002118.0, "step": 29202 }, { "entropy": 0.45185094280168414, "epoch": 2.6868275628087246, "grad_norm": 0.15199853479862213, "learning_rate": 1.0442543012236637e-05, "loss": 0.4376, "mean_token_accuracy": 0.8594338968396187, "num_tokens": 932034236.0, "step": 29203 }, { "entropy": 0.5359283443540335, "epoch": 2.6869195691801657, "grad_norm": 0.16200707852840424, "learning_rate": 1.043947618609501e-05, "loss": 0.5315, "mean_token_accuracy": 0.833140417933464, "num_tokens": 932065886.0, "step": 29204 }, { "entropy": 0.6102082431316376, "epoch": 2.687011575551607, "grad_norm": 0.1674414873123169, "learning_rate": 1.0436409359953385e-05, "loss": 0.5981, "mean_token_accuracy": 0.813978049904108, "num_tokens": 932097901.0, "step": 29205 }, { "entropy": 0.49558766931295395, "epoch": 2.687103581923048, "grad_norm": 0.15967105329036713, "learning_rate": 1.0433342533811758e-05, "loss": 0.4875, "mean_token_accuracy": 0.8407452628016472, "num_tokens": 932129809.0, "step": 29206 }, { "entropy": 0.4618663275614381, "epoch": 2.6871955882944896, "grad_norm": 0.15839552879333496, "learning_rate": 1.0430275707670133e-05, "loss": 0.4591, "mean_token_accuracy": 0.8548517301678658, "num_tokens": 932160589.0, "step": 29207 }, { "entropy": 0.5364617584273219, "epoch": 2.6872875946659307, "grad_norm": 0.16180817782878876, "learning_rate": 1.0427208881528507e-05, "loss": 0.5196, "mean_token_accuracy": 0.8365568332374096, "num_tokens": 932192372.0, "step": 29208 }, { "entropy": 0.5138307837769389, "epoch": 2.687379601037372, "grad_norm": 0.15898793935775757, "learning_rate": 1.042414205538688e-05, "loss": 0.5093, "mean_token_accuracy": 0.838036298751831, "num_tokens": 932223728.0, "step": 29209 }, { "entropy": 0.49181393743492663, "epoch": 2.687471607408813, "grad_norm": 0.1563669592142105, "learning_rate": 1.0421075229245255e-05, "loss": 0.4746, "mean_token_accuracy": 0.8454081676900387, "num_tokens": 932255601.0, "step": 29210 }, { "entropy": 0.5184032276738435, "epoch": 2.687563613780254, "grad_norm": 0.15870460867881775, "learning_rate": 1.0418008403103628e-05, "loss": 0.5172, "mean_token_accuracy": 0.8364261835813522, "num_tokens": 932287834.0, "step": 29211 }, { "entropy": 0.48366621788591146, "epoch": 2.6876556201516957, "grad_norm": 0.1534072607755661, "learning_rate": 1.0414941576962002e-05, "loss": 0.473, "mean_token_accuracy": 0.8492547124624252, "num_tokens": 932320150.0, "step": 29212 }, { "entropy": 0.5285006952472031, "epoch": 2.687747626523137, "grad_norm": 0.16130995750427246, "learning_rate": 1.0411874750820375e-05, "loss": 0.5242, "mean_token_accuracy": 0.833349134773016, "num_tokens": 932352211.0, "step": 29213 }, { "entropy": 0.5567338466644287, "epoch": 2.687839632894578, "grad_norm": 0.16166143119335175, "learning_rate": 1.040880792467875e-05, "loss": 0.5354, "mean_token_accuracy": 0.8277596272528172, "num_tokens": 932383444.0, "step": 29214 }, { "entropy": 0.5008131205104291, "epoch": 2.687931639266019, "grad_norm": 0.15822719037532806, "learning_rate": 1.0405741098537125e-05, "loss": 0.4935, "mean_token_accuracy": 0.8426543138921261, "num_tokens": 932415838.0, "step": 29215 }, { "entropy": 0.47025738283991814, "epoch": 2.68802364563746, "grad_norm": 0.15469326078891754, "learning_rate": 1.04026742723955e-05, "loss": 0.458, "mean_token_accuracy": 0.854619923979044, "num_tokens": 932447561.0, "step": 29216 }, { "entropy": 0.6187727358192205, "epoch": 2.688115652008902, "grad_norm": 0.1760704666376114, "learning_rate": 1.0399607446253872e-05, "loss": 0.6131, "mean_token_accuracy": 0.8068516664206982, "num_tokens": 932479684.0, "step": 29217 }, { "entropy": 0.5422026957385242, "epoch": 2.688207658380343, "grad_norm": 0.1611599624156952, "learning_rate": 1.0396540620112247e-05, "loss": 0.5353, "mean_token_accuracy": 0.8283149003982544, "num_tokens": 932511555.0, "step": 29218 }, { "entropy": 0.5372706586495042, "epoch": 2.688299664751784, "grad_norm": 0.1655971109867096, "learning_rate": 1.039347379397062e-05, "loss": 0.5359, "mean_token_accuracy": 0.8308033123612404, "num_tokens": 932543669.0, "step": 29219 }, { "entropy": 0.534299430437386, "epoch": 2.688391671123225, "grad_norm": 0.16598068177700043, "learning_rate": 1.0390406967828995e-05, "loss": 0.5238, "mean_token_accuracy": 0.8326968438923359, "num_tokens": 932574828.0, "step": 29220 }, { "entropy": 0.5304202325642109, "epoch": 2.6884836774946663, "grad_norm": 0.15341132879257202, "learning_rate": 1.0387340141687368e-05, "loss": 0.5155, "mean_token_accuracy": 0.8400706201791763, "num_tokens": 932607034.0, "step": 29221 }, { "entropy": 0.552578903734684, "epoch": 2.688575683866108, "grad_norm": 0.16766001284122467, "learning_rate": 1.0384273315545742e-05, "loss": 0.544, "mean_token_accuracy": 0.8306054063141346, "num_tokens": 932638523.0, "step": 29222 }, { "entropy": 0.5097727319225669, "epoch": 2.688667690237549, "grad_norm": 0.157258078455925, "learning_rate": 1.0381206489404117e-05, "loss": 0.4974, "mean_token_accuracy": 0.84267782792449, "num_tokens": 932670819.0, "step": 29223 }, { "entropy": 0.4941113879904151, "epoch": 2.68875969660899, "grad_norm": 0.15117241442203522, "learning_rate": 1.037813966326249e-05, "loss": 0.4838, "mean_token_accuracy": 0.8462105318903923, "num_tokens": 932703138.0, "step": 29224 }, { "entropy": 0.5106331431306899, "epoch": 2.6888517029804313, "grad_norm": 0.15935012698173523, "learning_rate": 1.0375072837120864e-05, "loss": 0.4959, "mean_token_accuracy": 0.8430171571671963, "num_tokens": 932735177.0, "step": 29225 }, { "entropy": 0.5450330693274736, "epoch": 2.6889437093518724, "grad_norm": 0.1594918966293335, "learning_rate": 1.0372006010979237e-05, "loss": 0.5186, "mean_token_accuracy": 0.8367652706801891, "num_tokens": 932766859.0, "step": 29226 }, { "entropy": 0.4473277712240815, "epoch": 2.689035715723314, "grad_norm": 0.1485416740179062, "learning_rate": 1.0368939184837612e-05, "loss": 0.4303, "mean_token_accuracy": 0.8613817468285561, "num_tokens": 932798686.0, "step": 29227 }, { "entropy": 0.5004839859902859, "epoch": 2.689127722094755, "grad_norm": 0.16257615387439728, "learning_rate": 1.0365872358695985e-05, "loss": 0.5005, "mean_token_accuracy": 0.8431133069097996, "num_tokens": 932830641.0, "step": 29228 }, { "entropy": 0.4821107944007963, "epoch": 2.6892197284661963, "grad_norm": 0.14819711446762085, "learning_rate": 1.036280553255436e-05, "loss": 0.4708, "mean_token_accuracy": 0.8519523218274117, "num_tokens": 932863018.0, "step": 29229 }, { "entropy": 0.5859891446307302, "epoch": 2.6893117348376374, "grad_norm": 0.17136679589748383, "learning_rate": 1.0359738706412734e-05, "loss": 0.5744, "mean_token_accuracy": 0.8170598894357681, "num_tokens": 932894407.0, "step": 29230 }, { "entropy": 0.5631163055077195, "epoch": 2.6894037412090785, "grad_norm": 0.17085671424865723, "learning_rate": 1.0356671880271109e-05, "loss": 0.5612, "mean_token_accuracy": 0.8197073973715305, "num_tokens": 932926017.0, "step": 29231 }, { "entropy": 0.40431200130842626, "epoch": 2.68949574758052, "grad_norm": 0.1428239941596985, "learning_rate": 1.0353605054129482e-05, "loss": 0.3881, "mean_token_accuracy": 0.8773490339517593, "num_tokens": 932958336.0, "step": 29232 }, { "entropy": 0.4892857843078673, "epoch": 2.6895877539519613, "grad_norm": 0.15441784262657166, "learning_rate": 1.0350538227987857e-05, "loss": 0.4655, "mean_token_accuracy": 0.8497432433068752, "num_tokens": 932990074.0, "step": 29233 }, { "entropy": 0.4864336410537362, "epoch": 2.6896797603234024, "grad_norm": 0.1514364778995514, "learning_rate": 1.034747140184623e-05, "loss": 0.479, "mean_token_accuracy": 0.8494936600327492, "num_tokens": 933022597.0, "step": 29234 }, { "entropy": 0.5343848336488008, "epoch": 2.6897717666948435, "grad_norm": 0.1568438559770584, "learning_rate": 1.0344404575704604e-05, "loss": 0.5239, "mean_token_accuracy": 0.836336437612772, "num_tokens": 933054571.0, "step": 29235 }, { "entropy": 0.5983282793313265, "epoch": 2.6898637730662847, "grad_norm": 0.17190830409526825, "learning_rate": 1.0341337749562977e-05, "loss": 0.5869, "mean_token_accuracy": 0.8149010241031647, "num_tokens": 933086526.0, "step": 29236 }, { "entropy": 0.42800000845454633, "epoch": 2.6899557794377262, "grad_norm": 0.142505943775177, "learning_rate": 1.0338270923421352e-05, "loss": 0.4133, "mean_token_accuracy": 0.8669461496174335, "num_tokens": 933119095.0, "step": 29237 }, { "entropy": 0.43528796965256333, "epoch": 2.6900477858091674, "grad_norm": 0.143795907497406, "learning_rate": 1.0335204097279726e-05, "loss": 0.4213, "mean_token_accuracy": 0.8699073120951653, "num_tokens": 933150951.0, "step": 29238 }, { "entropy": 0.5073248483240604, "epoch": 2.6901397921806085, "grad_norm": 0.16037467122077942, "learning_rate": 1.03321372711381e-05, "loss": 0.5013, "mean_token_accuracy": 0.8410360030829906, "num_tokens": 933181846.0, "step": 29239 }, { "entropy": 0.5555861964821815, "epoch": 2.6902317985520496, "grad_norm": 0.17449334263801575, "learning_rate": 1.0329070444996474e-05, "loss": 0.5448, "mean_token_accuracy": 0.8314309120178223, "num_tokens": 933212769.0, "step": 29240 }, { "entropy": 0.5482701808214188, "epoch": 2.6903238049234908, "grad_norm": 0.16627824306488037, "learning_rate": 1.0326003618854847e-05, "loss": 0.5477, "mean_token_accuracy": 0.8271259926259518, "num_tokens": 933245242.0, "step": 29241 }, { "entropy": 0.510365679860115, "epoch": 2.6904158112949323, "grad_norm": 0.15781646966934204, "learning_rate": 1.0322936792713222e-05, "loss": 0.4996, "mean_token_accuracy": 0.8407725542783737, "num_tokens": 933277066.0, "step": 29242 }, { "entropy": 0.5702436752617359, "epoch": 2.6905078176663735, "grad_norm": 0.15824002027511597, "learning_rate": 1.0319869966571595e-05, "loss": 0.5502, "mean_token_accuracy": 0.827984482049942, "num_tokens": 933309179.0, "step": 29243 }, { "entropy": 0.5268140025436878, "epoch": 2.6905998240378146, "grad_norm": 0.15891633927822113, "learning_rate": 1.031680314042997e-05, "loss": 0.5107, "mean_token_accuracy": 0.8403922244906425, "num_tokens": 933341278.0, "step": 29244 }, { "entropy": 0.49587623961269855, "epoch": 2.6906918304092557, "grad_norm": 0.15981720387935638, "learning_rate": 1.0313736314288342e-05, "loss": 0.4932, "mean_token_accuracy": 0.8417462781071663, "num_tokens": 933373731.0, "step": 29245 }, { "entropy": 0.518040619790554, "epoch": 2.690783836780697, "grad_norm": 0.16233490407466888, "learning_rate": 1.0310669488146718e-05, "loss": 0.5006, "mean_token_accuracy": 0.8418398387730122, "num_tokens": 933405504.0, "step": 29246 }, { "entropy": 0.5555720273405313, "epoch": 2.6908758431521385, "grad_norm": 0.16458448767662048, "learning_rate": 1.0307602662005091e-05, "loss": 0.5425, "mean_token_accuracy": 0.8283699154853821, "num_tokens": 933437475.0, "step": 29247 }, { "entropy": 0.5346228247508407, "epoch": 2.6909678495235796, "grad_norm": 0.1597287803888321, "learning_rate": 1.0304535835863466e-05, "loss": 0.5307, "mean_token_accuracy": 0.8310592509806156, "num_tokens": 933469140.0, "step": 29248 }, { "entropy": 0.5550370384007692, "epoch": 2.6910598558950207, "grad_norm": 0.16513359546661377, "learning_rate": 1.0301469009721839e-05, "loss": 0.5499, "mean_token_accuracy": 0.8256226666271687, "num_tokens": 933501413.0, "step": 29249 }, { "entropy": 0.5071633299812675, "epoch": 2.691151862266462, "grad_norm": 0.16313818097114563, "learning_rate": 1.0298402183580214e-05, "loss": 0.5096, "mean_token_accuracy": 0.8412250094115734, "num_tokens": 933533103.0, "step": 29250 }, { "entropy": 0.60232337936759, "epoch": 2.691243868637903, "grad_norm": 0.173886239528656, "learning_rate": 1.0295335357438587e-05, "loss": 0.6033, "mean_token_accuracy": 0.8146075718104839, "num_tokens": 933565134.0, "step": 29251 }, { "entropy": 0.48569254484027624, "epoch": 2.6913358750093446, "grad_norm": 0.15934066474437714, "learning_rate": 1.0292268531296961e-05, "loss": 0.4737, "mean_token_accuracy": 0.8508830964565277, "num_tokens": 933597187.0, "step": 29252 }, { "entropy": 0.47687705513089895, "epoch": 2.6914278813807857, "grad_norm": 0.15277011692523956, "learning_rate": 1.0289201705155336e-05, "loss": 0.4592, "mean_token_accuracy": 0.8512817621231079, "num_tokens": 933629075.0, "step": 29253 }, { "entropy": 0.37141164403874427, "epoch": 2.691519887752227, "grad_norm": 0.1368979960680008, "learning_rate": 1.0286134879013709e-05, "loss": 0.3566, "mean_token_accuracy": 0.8841270618140697, "num_tokens": 933661404.0, "step": 29254 }, { "entropy": 0.5811316892504692, "epoch": 2.691611894123668, "grad_norm": 0.17139452695846558, "learning_rate": 1.0283068052872084e-05, "loss": 0.586, "mean_token_accuracy": 0.8131551370024681, "num_tokens": 933692767.0, "step": 29255 }, { "entropy": 0.45868054404854774, "epoch": 2.691703900495109, "grad_norm": 0.14548203349113464, "learning_rate": 1.0280001226730456e-05, "loss": 0.4408, "mean_token_accuracy": 0.8589348271489143, "num_tokens": 933724424.0, "step": 29256 }, { "entropy": 0.5850515849888325, "epoch": 2.6917959068665507, "grad_norm": 0.1612038016319275, "learning_rate": 1.0276934400588831e-05, "loss": 0.5684, "mean_token_accuracy": 0.8213752545416355, "num_tokens": 933756475.0, "step": 29257 }, { "entropy": 0.5507652759552002, "epoch": 2.691887913237992, "grad_norm": 0.1655668169260025, "learning_rate": 1.0273867574447204e-05, "loss": 0.5486, "mean_token_accuracy": 0.8281443789601326, "num_tokens": 933788658.0, "step": 29258 }, { "entropy": 0.6450867229141295, "epoch": 2.691979919609433, "grad_norm": 0.17874585092067719, "learning_rate": 1.0270800748305579e-05, "loss": 0.6459, "mean_token_accuracy": 0.8029948063194752, "num_tokens": 933820262.0, "step": 29259 }, { "entropy": 0.5223426083102822, "epoch": 2.692071925980874, "grad_norm": 0.1629902571439743, "learning_rate": 1.0267733922163952e-05, "loss": 0.5096, "mean_token_accuracy": 0.8392631895840168, "num_tokens": 933851834.0, "step": 29260 }, { "entropy": 0.4628622807795182, "epoch": 2.692163932352315, "grad_norm": 0.14695358276367188, "learning_rate": 1.0264667096022328e-05, "loss": 0.4478, "mean_token_accuracy": 0.858478344976902, "num_tokens": 933884456.0, "step": 29261 }, { "entropy": 0.535019769333303, "epoch": 2.692255938723757, "grad_norm": 0.1577288955450058, "learning_rate": 1.0261600269880701e-05, "loss": 0.5279, "mean_token_accuracy": 0.8318020030856133, "num_tokens": 933916924.0, "step": 29262 }, { "entropy": 0.4686298565939069, "epoch": 2.692347945095198, "grad_norm": 0.15950049459934235, "learning_rate": 1.0258533443739076e-05, "loss": 0.4663, "mean_token_accuracy": 0.8527521416544914, "num_tokens": 933947813.0, "step": 29263 }, { "entropy": 0.5709699224680662, "epoch": 2.692439951466639, "grad_norm": 0.16633421182632446, "learning_rate": 1.0255466617597449e-05, "loss": 0.5593, "mean_token_accuracy": 0.822895485907793, "num_tokens": 933979384.0, "step": 29264 }, { "entropy": 0.5360171068459749, "epoch": 2.69253195783808, "grad_norm": 0.1618087738752365, "learning_rate": 1.0252399791455823e-05, "loss": 0.5258, "mean_token_accuracy": 0.8334452770650387, "num_tokens": 934012152.0, "step": 29265 }, { "entropy": 0.5278794299811125, "epoch": 2.6926239642095213, "grad_norm": 0.16169984638690948, "learning_rate": 1.0249332965314196e-05, "loss": 0.5193, "mean_token_accuracy": 0.8367498405277729, "num_tokens": 934044431.0, "step": 29266 }, { "entropy": 0.4804694256745279, "epoch": 2.692715970580963, "grad_norm": 0.15806612372398376, "learning_rate": 1.024626613917257e-05, "loss": 0.467, "mean_token_accuracy": 0.8492913208901882, "num_tokens": 934076542.0, "step": 29267 }, { "entropy": 0.6422549495473504, "epoch": 2.692807976952404, "grad_norm": 0.17093196511268616, "learning_rate": 1.0243199313030945e-05, "loss": 0.6397, "mean_token_accuracy": 0.8019002825021744, "num_tokens": 934109179.0, "step": 29268 }, { "entropy": 0.5431663766503334, "epoch": 2.692899983323845, "grad_norm": 0.16097547113895416, "learning_rate": 1.0240132486889318e-05, "loss": 0.525, "mean_token_accuracy": 0.8342290557920933, "num_tokens": 934140959.0, "step": 29269 }, { "entropy": 0.43664622120559216, "epoch": 2.6929919896952863, "grad_norm": 0.1497269868850708, "learning_rate": 1.0237065660747693e-05, "loss": 0.4134, "mean_token_accuracy": 0.8659596368670464, "num_tokens": 934172587.0, "step": 29270 }, { "entropy": 0.5644866973161697, "epoch": 2.6930839960667274, "grad_norm": 0.16387256979942322, "learning_rate": 1.0233998834606066e-05, "loss": 0.537, "mean_token_accuracy": 0.8282393552362919, "num_tokens": 934204407.0, "step": 29271 }, { "entropy": 0.5997779173776507, "epoch": 2.693176002438169, "grad_norm": 0.16815908253192902, "learning_rate": 1.023093200846444e-05, "loss": 0.583, "mean_token_accuracy": 0.8165357820689678, "num_tokens": 934235771.0, "step": 29272 }, { "entropy": 0.6439721006900072, "epoch": 2.69326800880961, "grad_norm": 0.1735810935497284, "learning_rate": 1.0227865182322814e-05, "loss": 0.6232, "mean_token_accuracy": 0.8018937930464745, "num_tokens": 934267654.0, "step": 29273 }, { "entropy": 0.5736661432310939, "epoch": 2.6933600151810513, "grad_norm": 0.16475088894367218, "learning_rate": 1.0224798356181188e-05, "loss": 0.5467, "mean_token_accuracy": 0.8233439065515995, "num_tokens": 934300080.0, "step": 29274 }, { "entropy": 0.47275217343121767, "epoch": 2.6934520215524924, "grad_norm": 0.1559646725654602, "learning_rate": 1.0221731530039561e-05, "loss": 0.468, "mean_token_accuracy": 0.8500835597515106, "num_tokens": 934332524.0, "step": 29275 }, { "entropy": 0.40725937858223915, "epoch": 2.6935440279239335, "grad_norm": 0.14856041967868805, "learning_rate": 1.0218664703897938e-05, "loss": 0.3992, "mean_token_accuracy": 0.8724894411861897, "num_tokens": 934364518.0, "step": 29276 }, { "entropy": 0.5186889842152596, "epoch": 2.693636034295375, "grad_norm": 0.162931427359581, "learning_rate": 1.021559787775631e-05, "loss": 0.5045, "mean_token_accuracy": 0.8397401869297028, "num_tokens": 934396491.0, "step": 29277 }, { "entropy": 0.5282134972512722, "epoch": 2.6937280406668163, "grad_norm": 0.16095460951328278, "learning_rate": 1.0212531051614685e-05, "loss": 0.5134, "mean_token_accuracy": 0.8366091139614582, "num_tokens": 934428761.0, "step": 29278 }, { "entropy": 0.5203552655875683, "epoch": 2.6938200470382574, "grad_norm": 0.15762664377689362, "learning_rate": 1.0209464225473058e-05, "loss": 0.5151, "mean_token_accuracy": 0.8325729370117188, "num_tokens": 934460680.0, "step": 29279 }, { "entropy": 0.5200632582418621, "epoch": 2.6939120534096985, "grad_norm": 0.15929864346981049, "learning_rate": 1.0206397399331433e-05, "loss": 0.5032, "mean_token_accuracy": 0.8359840773046017, "num_tokens": 934492260.0, "step": 29280 }, { "entropy": 0.474159381701611, "epoch": 2.6940040597811397, "grad_norm": 0.15485979616641998, "learning_rate": 1.0203330573189806e-05, "loss": 0.4493, "mean_token_accuracy": 0.8531528860330582, "num_tokens": 934524158.0, "step": 29281 }, { "entropy": 0.4106456348672509, "epoch": 2.6940960661525812, "grad_norm": 0.14859503507614136, "learning_rate": 1.020026374704818e-05, "loss": 0.4011, "mean_token_accuracy": 0.8721068315207958, "num_tokens": 934555886.0, "step": 29282 }, { "entropy": 0.5009104963392019, "epoch": 2.6941880725240224, "grad_norm": 0.16386637091636658, "learning_rate": 1.0197196920906555e-05, "loss": 0.5, "mean_token_accuracy": 0.8383962549269199, "num_tokens": 934587675.0, "step": 29283 }, { "entropy": 0.49638534570112824, "epoch": 2.6942800788954635, "grad_norm": 0.15661326050758362, "learning_rate": 1.0194130094764928e-05, "loss": 0.4946, "mean_token_accuracy": 0.8429328538477421, "num_tokens": 934620068.0, "step": 29284 }, { "entropy": 0.5027894247323275, "epoch": 2.6943720852669046, "grad_norm": 0.15924623608589172, "learning_rate": 1.0191063268623303e-05, "loss": 0.4869, "mean_token_accuracy": 0.8428780101239681, "num_tokens": 934651480.0, "step": 29285 }, { "entropy": 0.5733790118247271, "epoch": 2.6944640916383458, "grad_norm": 0.16390696167945862, "learning_rate": 1.0187996442481676e-05, "loss": 0.556, "mean_token_accuracy": 0.8246089443564415, "num_tokens": 934682993.0, "step": 29286 }, { "entropy": 0.526812769472599, "epoch": 2.6945560980097873, "grad_norm": 0.15940111875534058, "learning_rate": 1.018492961634005e-05, "loss": 0.5278, "mean_token_accuracy": 0.836966760456562, "num_tokens": 934715154.0, "step": 29287 }, { "entropy": 0.5589410967659205, "epoch": 2.6946481043812285, "grad_norm": 0.16743184626102448, "learning_rate": 1.0181862790198423e-05, "loss": 0.5517, "mean_token_accuracy": 0.8238426074385643, "num_tokens": 934746945.0, "step": 29288 }, { "entropy": 0.496250297408551, "epoch": 2.6947401107526696, "grad_norm": 0.1585020124912262, "learning_rate": 1.0178795964056798e-05, "loss": 0.4996, "mean_token_accuracy": 0.8408766649663448, "num_tokens": 934779263.0, "step": 29289 }, { "entropy": 0.4492460200563073, "epoch": 2.6948321171241107, "grad_norm": 0.1538180261850357, "learning_rate": 1.017572913791517e-05, "loss": 0.4523, "mean_token_accuracy": 0.858694177120924, "num_tokens": 934811285.0, "step": 29290 }, { "entropy": 0.5488769058138132, "epoch": 2.694924123495552, "grad_norm": 0.16300375759601593, "learning_rate": 1.0172662311773547e-05, "loss": 0.5435, "mean_token_accuracy": 0.8323991373181343, "num_tokens": 934843217.0, "step": 29291 }, { "entropy": 0.5101597065804526, "epoch": 2.6950161298669935, "grad_norm": 0.15797731280326843, "learning_rate": 1.016959548563192e-05, "loss": 0.5, "mean_token_accuracy": 0.8414421044290066, "num_tokens": 934875077.0, "step": 29292 }, { "entropy": 0.4859344754368067, "epoch": 2.6951081362384346, "grad_norm": 0.15103112161159515, "learning_rate": 1.0166528659490295e-05, "loss": 0.467, "mean_token_accuracy": 0.8546303138136864, "num_tokens": 934907247.0, "step": 29293 }, { "entropy": 0.6186782345175743, "epoch": 2.6952001426098757, "grad_norm": 0.16795091331005096, "learning_rate": 1.0163461833348668e-05, "loss": 0.6004, "mean_token_accuracy": 0.8135189078748226, "num_tokens": 934939120.0, "step": 29294 }, { "entropy": 0.4623869275674224, "epoch": 2.695292148981317, "grad_norm": 0.15116751194000244, "learning_rate": 1.0160395007207042e-05, "loss": 0.4523, "mean_token_accuracy": 0.8593169450759888, "num_tokens": 934970931.0, "step": 29295 }, { "entropy": 0.5080476179718971, "epoch": 2.695384155352758, "grad_norm": 0.1542121171951294, "learning_rate": 1.0157328181065415e-05, "loss": 0.494, "mean_token_accuracy": 0.8430944122374058, "num_tokens": 935003014.0, "step": 29296 }, { "entropy": 0.5281639085151255, "epoch": 2.6954761617241996, "grad_norm": 0.16205093264579773, "learning_rate": 1.015426135492379e-05, "loss": 0.5153, "mean_token_accuracy": 0.8344109356403351, "num_tokens": 935034969.0, "step": 29297 }, { "entropy": 0.6280229687690735, "epoch": 2.6955681680956407, "grad_norm": 0.17421941459178925, "learning_rate": 1.0151194528782165e-05, "loss": 0.6143, "mean_token_accuracy": 0.80893250182271, "num_tokens": 935066831.0, "step": 29298 }, { "entropy": 0.4604650381952524, "epoch": 2.695660174467082, "grad_norm": 0.1499304473400116, "learning_rate": 1.0148127702640538e-05, "loss": 0.4497, "mean_token_accuracy": 0.8573344424366951, "num_tokens": 935098918.0, "step": 29299 }, { "entropy": 0.5345950499176979, "epoch": 2.695752180838523, "grad_norm": 0.16396000981330872, "learning_rate": 1.0145060876498912e-05, "loss": 0.526, "mean_token_accuracy": 0.8360309451818466, "num_tokens": 935128722.0, "step": 29300 }, { "entropy": 0.4808238008990884, "epoch": 2.695844187209964, "grad_norm": 0.1537773162126541, "learning_rate": 1.0141994050357285e-05, "loss": 0.4586, "mean_token_accuracy": 0.8518048524856567, "num_tokens": 935160925.0, "step": 29301 }, { "entropy": 0.5016135852783918, "epoch": 2.6959361935814057, "grad_norm": 0.15233628451824188, "learning_rate": 1.013892722421566e-05, "loss": 0.4844, "mean_token_accuracy": 0.8432054631412029, "num_tokens": 935193614.0, "step": 29302 }, { "entropy": 0.4921155631309375, "epoch": 2.696028199952847, "grad_norm": 0.15247498452663422, "learning_rate": 1.0135860398074033e-05, "loss": 0.4862, "mean_token_accuracy": 0.8502289578318596, "num_tokens": 935225739.0, "step": 29303 }, { "entropy": 0.5378830004483461, "epoch": 2.696120206324288, "grad_norm": 0.1639513075351715, "learning_rate": 1.0132793571932407e-05, "loss": 0.5239, "mean_token_accuracy": 0.8323432765901089, "num_tokens": 935257128.0, "step": 29304 }, { "entropy": 0.44813902862370014, "epoch": 2.696212212695729, "grad_norm": 0.14500311017036438, "learning_rate": 1.012972674579078e-05, "loss": 0.436, "mean_token_accuracy": 0.8592525646090508, "num_tokens": 935289257.0, "step": 29305 }, { "entropy": 0.4699680022895336, "epoch": 2.69630421906717, "grad_norm": 0.1515929102897644, "learning_rate": 1.0126659919649155e-05, "loss": 0.4547, "mean_token_accuracy": 0.8548545651137829, "num_tokens": 935321545.0, "step": 29306 }, { "entropy": 0.40512541262432933, "epoch": 2.696396225438612, "grad_norm": 0.14594095945358276, "learning_rate": 1.012359309350753e-05, "loss": 0.3909, "mean_token_accuracy": 0.8768077827990055, "num_tokens": 935353625.0, "step": 29307 }, { "entropy": 0.5207513328641653, "epoch": 2.696488231810053, "grad_norm": 0.16635651886463165, "learning_rate": 1.0120526267365904e-05, "loss": 0.512, "mean_token_accuracy": 0.8344907946884632, "num_tokens": 935385128.0, "step": 29308 }, { "entropy": 0.5989111829549074, "epoch": 2.696580238181494, "grad_norm": 0.17599612474441528, "learning_rate": 1.0117459441224277e-05, "loss": 0.605, "mean_token_accuracy": 0.8136353194713593, "num_tokens": 935417238.0, "step": 29309 }, { "entropy": 0.4947807937860489, "epoch": 2.696672244552935, "grad_norm": 0.1599906086921692, "learning_rate": 1.0114392615082652e-05, "loss": 0.4746, "mean_token_accuracy": 0.847552478313446, "num_tokens": 935448375.0, "step": 29310 }, { "entropy": 0.5953299980610609, "epoch": 2.6967642509243763, "grad_norm": 0.16735689342021942, "learning_rate": 1.0111325788941025e-05, "loss": 0.5822, "mean_token_accuracy": 0.8163962438702583, "num_tokens": 935480602.0, "step": 29311 }, { "entropy": 0.5017325319349766, "epoch": 2.696856257295818, "grad_norm": 0.16154660284519196, "learning_rate": 1.01082589627994e-05, "loss": 0.4867, "mean_token_accuracy": 0.8454618118703365, "num_tokens": 935512533.0, "step": 29312 }, { "entropy": 0.639034416526556, "epoch": 2.696948263667259, "grad_norm": 0.1763482689857483, "learning_rate": 1.0105192136657774e-05, "loss": 0.6321, "mean_token_accuracy": 0.805263988673687, "num_tokens": 935544416.0, "step": 29313 }, { "entropy": 0.5961203556507826, "epoch": 2.6970402700387, "grad_norm": 0.16802315413951874, "learning_rate": 1.0102125310516147e-05, "loss": 0.5836, "mean_token_accuracy": 0.8204915672540665, "num_tokens": 935576901.0, "step": 29314 }, { "entropy": 0.4793361518532038, "epoch": 2.6971322764101413, "grad_norm": 0.15654417872428894, "learning_rate": 1.0099058484374522e-05, "loss": 0.4685, "mean_token_accuracy": 0.850000012665987, "num_tokens": 935608740.0, "step": 29315 }, { "entropy": 0.4411387490108609, "epoch": 2.6972242827815824, "grad_norm": 0.14349143207073212, "learning_rate": 1.0095991658232895e-05, "loss": 0.4245, "mean_token_accuracy": 0.8641449399292469, "num_tokens": 935641239.0, "step": 29316 }, { "entropy": 0.5698456950485706, "epoch": 2.697316289153024, "grad_norm": 0.17418710887432098, "learning_rate": 1.009292483209127e-05, "loss": 0.5623, "mean_token_accuracy": 0.8229559808969498, "num_tokens": 935672199.0, "step": 29317 }, { "entropy": 0.48822549264878035, "epoch": 2.697408295524465, "grad_norm": 0.16012275218963623, "learning_rate": 1.0089858005949642e-05, "loss": 0.4808, "mean_token_accuracy": 0.8508561514317989, "num_tokens": 935703673.0, "step": 29318 }, { "entropy": 0.628047950565815, "epoch": 2.6975003018959063, "grad_norm": 0.1738138496875763, "learning_rate": 1.0086791179808017e-05, "loss": 0.6198, "mean_token_accuracy": 0.8084590137004852, "num_tokens": 935735212.0, "step": 29319 }, { "entropy": 0.4194897774141282, "epoch": 2.6975923082673474, "grad_norm": 0.1497780978679657, "learning_rate": 1.008372435366639e-05, "loss": 0.4068, "mean_token_accuracy": 0.8692225255072117, "num_tokens": 935766944.0, "step": 29320 }, { "entropy": 0.5341077925404534, "epoch": 2.6976843146387885, "grad_norm": 0.15964257717132568, "learning_rate": 1.0080657527524765e-05, "loss": 0.5277, "mean_token_accuracy": 0.8326819725334644, "num_tokens": 935799712.0, "step": 29321 }, { "entropy": 0.4829802393214777, "epoch": 2.69777632101023, "grad_norm": 0.15683172643184662, "learning_rate": 1.007759070138314e-05, "loss": 0.4745, "mean_token_accuracy": 0.8548086769878864, "num_tokens": 935831987.0, "step": 29322 }, { "entropy": 0.5455260407179594, "epoch": 2.6978683273816713, "grad_norm": 0.16412056982517242, "learning_rate": 1.0074523875241514e-05, "loss": 0.5356, "mean_token_accuracy": 0.8306802660226822, "num_tokens": 935864383.0, "step": 29323 }, { "entropy": 0.5145674999803305, "epoch": 2.6979603337531124, "grad_norm": 0.1619911789894104, "learning_rate": 1.0071457049099887e-05, "loss": 0.5082, "mean_token_accuracy": 0.8377228938043118, "num_tokens": 935895789.0, "step": 29324 }, { "entropy": 0.4727522018365562, "epoch": 2.6980523401245535, "grad_norm": 0.15108971297740936, "learning_rate": 1.0068390222958261e-05, "loss": 0.4703, "mean_token_accuracy": 0.8522473685443401, "num_tokens": 935927496.0, "step": 29325 }, { "entropy": 0.558165455237031, "epoch": 2.6981443464959947, "grad_norm": 0.16445815563201904, "learning_rate": 1.0065323396816634e-05, "loss": 0.5399, "mean_token_accuracy": 0.8291667811572552, "num_tokens": 935959666.0, "step": 29326 }, { "entropy": 0.4538397123105824, "epoch": 2.6982363528674362, "grad_norm": 0.14985014498233795, "learning_rate": 1.0062256570675009e-05, "loss": 0.4504, "mean_token_accuracy": 0.858635064214468, "num_tokens": 935992053.0, "step": 29327 }, { "entropy": 0.5303164835786447, "epoch": 2.6983283592388774, "grad_norm": 0.16237477958202362, "learning_rate": 1.0059189744533384e-05, "loss": 0.5251, "mean_token_accuracy": 0.8381507843732834, "num_tokens": 936023418.0, "step": 29328 }, { "entropy": 0.5147393317893147, "epoch": 2.6984203656103185, "grad_norm": 0.15718267858028412, "learning_rate": 1.0056122918391757e-05, "loss": 0.5036, "mean_token_accuracy": 0.8405371159315109, "num_tokens": 936055831.0, "step": 29329 }, { "entropy": 0.5365991545841098, "epoch": 2.6985123719817596, "grad_norm": 0.16277290880680084, "learning_rate": 1.0053056092250131e-05, "loss": 0.5271, "mean_token_accuracy": 0.8347295559942722, "num_tokens": 936088297.0, "step": 29330 }, { "entropy": 0.4439056321280077, "epoch": 2.6986043783532008, "grad_norm": 0.15226441621780396, "learning_rate": 1.0049989266108504e-05, "loss": 0.4336, "mean_token_accuracy": 0.8591758944094181, "num_tokens": 936120509.0, "step": 29331 }, { "entropy": 0.5112483464181423, "epoch": 2.6986963847246423, "grad_norm": 0.16206610202789307, "learning_rate": 1.0046922439966879e-05, "loss": 0.4954, "mean_token_accuracy": 0.8421998657286167, "num_tokens": 936153087.0, "step": 29332 }, { "entropy": 0.539549482986331, "epoch": 2.6987883910960835, "grad_norm": 0.16464123129844666, "learning_rate": 1.0043855613825252e-05, "loss": 0.5263, "mean_token_accuracy": 0.8330859541893005, "num_tokens": 936184832.0, "step": 29333 }, { "entropy": 0.541611310094595, "epoch": 2.6988803974675246, "grad_norm": 0.15987667441368103, "learning_rate": 1.0040788787683626e-05, "loss": 0.5365, "mean_token_accuracy": 0.8294240348041058, "num_tokens": 936217038.0, "step": 29334 }, { "entropy": 0.5179210482165217, "epoch": 2.6989724038389658, "grad_norm": 0.16068647801876068, "learning_rate": 1.0037721961542e-05, "loss": 0.5011, "mean_token_accuracy": 0.8401544727385044, "num_tokens": 936248593.0, "step": 29335 }, { "entropy": 0.5126949598779902, "epoch": 2.699064410210407, "grad_norm": 0.15327002108097076, "learning_rate": 1.0034655135400374e-05, "loss": 0.499, "mean_token_accuracy": 0.840752437710762, "num_tokens": 936280711.0, "step": 29336 }, { "entropy": 0.5069447001442313, "epoch": 2.6991564165818485, "grad_norm": 0.15479129552841187, "learning_rate": 1.0031588309258749e-05, "loss": 0.5084, "mean_token_accuracy": 0.8432827368378639, "num_tokens": 936313241.0, "step": 29337 }, { "entropy": 0.48754640691913664, "epoch": 2.6992484229532896, "grad_norm": 0.15597228705883026, "learning_rate": 1.0028521483117123e-05, "loss": 0.4812, "mean_token_accuracy": 0.8466726765036583, "num_tokens": 936345188.0, "step": 29338 }, { "entropy": 0.46410259790718555, "epoch": 2.6993404293247307, "grad_norm": 0.1543119102716446, "learning_rate": 1.0025454656975496e-05, "loss": 0.4531, "mean_token_accuracy": 0.8586948737502098, "num_tokens": 936376354.0, "step": 29339 }, { "entropy": 0.448815296869725, "epoch": 2.699432435696172, "grad_norm": 0.14958883821964264, "learning_rate": 1.0022387830833871e-05, "loss": 0.4433, "mean_token_accuracy": 0.8585947975516319, "num_tokens": 936407677.0, "step": 29340 }, { "entropy": 0.5721731744706631, "epoch": 2.699524442067613, "grad_norm": 0.1653864085674286, "learning_rate": 1.0019321004692244e-05, "loss": 0.563, "mean_token_accuracy": 0.8194924928247929, "num_tokens": 936440306.0, "step": 29341 }, { "entropy": 0.48406486213207245, "epoch": 2.6996164484390546, "grad_norm": 0.15035246312618256, "learning_rate": 1.0016254178550619e-05, "loss": 0.476, "mean_token_accuracy": 0.8515755534172058, "num_tokens": 936473013.0, "step": 29342 }, { "entropy": 0.5872911727055907, "epoch": 2.6997084548104957, "grad_norm": 0.1623915731906891, "learning_rate": 1.0013187352408993e-05, "loss": 0.5693, "mean_token_accuracy": 0.8229823224246502, "num_tokens": 936505690.0, "step": 29343 }, { "entropy": 0.5574037684127688, "epoch": 2.699800461181937, "grad_norm": 0.1629973202943802, "learning_rate": 1.0010120526267366e-05, "loss": 0.5421, "mean_token_accuracy": 0.8276013061404228, "num_tokens": 936537824.0, "step": 29344 }, { "entropy": 0.6027119942009449, "epoch": 2.699892467553378, "grad_norm": 0.16948752105236053, "learning_rate": 1.000705370012574e-05, "loss": 0.597, "mean_token_accuracy": 0.8108774833381176, "num_tokens": 936570137.0, "step": 29345 }, { "entropy": 0.5648125521838665, "epoch": 2.699984473924819, "grad_norm": 0.1640758365392685, "learning_rate": 1.0003986873984114e-05, "loss": 0.5619, "mean_token_accuracy": 0.8234650753438473, "num_tokens": 936602500.0, "step": 29346 }, { "entropy": 0.5782465906813741, "epoch": 2.7000764802962607, "grad_norm": 0.16841883957386017, "learning_rate": 1.0000920047842488e-05, "loss": 0.57, "mean_token_accuracy": 0.8189262337982655, "num_tokens": 936634270.0, "step": 29347 }, { "entropy": 0.5019076853059232, "epoch": 2.700168486667702, "grad_norm": 0.14939065277576447, "learning_rate": 9.997853221700861e-06, "loss": 0.4801, "mean_token_accuracy": 0.8479167073965073, "num_tokens": 936666864.0, "step": 29348 }, { "entropy": 0.5524340188130736, "epoch": 2.700260493039143, "grad_norm": 0.15751487016677856, "learning_rate": 9.994786395559236e-06, "loss": 0.5376, "mean_token_accuracy": 0.8326072283089161, "num_tokens": 936698780.0, "step": 29349 }, { "entropy": 0.49350841250270605, "epoch": 2.700352499410584, "grad_norm": 0.15732933580875397, "learning_rate": 9.991719569417609e-06, "loss": 0.4774, "mean_token_accuracy": 0.8489820808172226, "num_tokens": 936730882.0, "step": 29350 }, { "entropy": 0.582108081318438, "epoch": 2.700444505782025, "grad_norm": 0.170335590839386, "learning_rate": 9.988652743275984e-06, "loss": 0.5708, "mean_token_accuracy": 0.8227995373308659, "num_tokens": 936763195.0, "step": 29351 }, { "entropy": 0.5442016310989857, "epoch": 2.700536512153467, "grad_norm": 0.16261053085327148, "learning_rate": 9.985585917134358e-06, "loss": 0.5202, "mean_token_accuracy": 0.832390408962965, "num_tokens": 936794982.0, "step": 29352 }, { "entropy": 0.5241976389661431, "epoch": 2.700628518524908, "grad_norm": 0.1617092788219452, "learning_rate": 9.982519090992733e-06, "loss": 0.5091, "mean_token_accuracy": 0.837374821305275, "num_tokens": 936827316.0, "step": 29353 }, { "entropy": 0.6319542303681374, "epoch": 2.700720524896349, "grad_norm": 0.17153164744377136, "learning_rate": 9.979452264851106e-06, "loss": 0.6218, "mean_token_accuracy": 0.804300382733345, "num_tokens": 936859096.0, "step": 29354 }, { "entropy": 0.5125544313341379, "epoch": 2.70081253126779, "grad_norm": 0.16197149455547333, "learning_rate": 9.97638543870948e-06, "loss": 0.5115, "mean_token_accuracy": 0.8370142132043839, "num_tokens": 936890835.0, "step": 29355 }, { "entropy": 0.5953981054481119, "epoch": 2.7009045376392313, "grad_norm": 0.1647098958492279, "learning_rate": 9.973318612567855e-06, "loss": 0.5804, "mean_token_accuracy": 0.8195687346160412, "num_tokens": 936923114.0, "step": 29356 }, { "entropy": 0.6408691201359034, "epoch": 2.700996544010673, "grad_norm": 0.17704324424266815, "learning_rate": 9.970251786426228e-06, "loss": 0.6318, "mean_token_accuracy": 0.8066873624920845, "num_tokens": 936955490.0, "step": 29357 }, { "entropy": 0.45240854751318693, "epoch": 2.701088550382114, "grad_norm": 0.1564779281616211, "learning_rate": 9.967184960284603e-06, "loss": 0.4488, "mean_token_accuracy": 0.8604023233056068, "num_tokens": 936987196.0, "step": 29358 }, { "entropy": 0.48583093378692865, "epoch": 2.701180556753555, "grad_norm": 0.15944457054138184, "learning_rate": 9.964118134142976e-06, "loss": 0.4841, "mean_token_accuracy": 0.8456533700227737, "num_tokens": 937019645.0, "step": 29359 }, { "entropy": 0.6104130689054728, "epoch": 2.7012725631249963, "grad_norm": 0.1719786524772644, "learning_rate": 9.96105130800135e-06, "loss": 0.6046, "mean_token_accuracy": 0.8114256896078587, "num_tokens": 937050804.0, "step": 29360 }, { "entropy": 0.4498669309541583, "epoch": 2.7013645694964374, "grad_norm": 0.14553077518939972, "learning_rate": 9.957984481859723e-06, "loss": 0.4469, "mean_token_accuracy": 0.8582300879061222, "num_tokens": 937083241.0, "step": 29361 }, { "entropy": 0.5460790442302823, "epoch": 2.701456575867879, "grad_norm": 0.1605178266763687, "learning_rate": 9.954917655718098e-06, "loss": 0.5367, "mean_token_accuracy": 0.8331321999430656, "num_tokens": 937115850.0, "step": 29362 }, { "entropy": 0.6025282419286668, "epoch": 2.70154858223932, "grad_norm": 0.1671980321407318, "learning_rate": 9.951850829576471e-06, "loss": 0.5874, "mean_token_accuracy": 0.8180631548166275, "num_tokens": 937148502.0, "step": 29363 }, { "entropy": 0.4540129570523277, "epoch": 2.7016405886107613, "grad_norm": 0.14830252528190613, "learning_rate": 9.948784003434846e-06, "loss": 0.4387, "mean_token_accuracy": 0.8615332432091236, "num_tokens": 937180334.0, "step": 29364 }, { "entropy": 0.5438662255182862, "epoch": 2.7017325949822024, "grad_norm": 0.16113518178462982, "learning_rate": 9.945717177293219e-06, "loss": 0.5373, "mean_token_accuracy": 0.8298593126237392, "num_tokens": 937212290.0, "step": 29365 }, { "entropy": 0.5354088172316551, "epoch": 2.7018246013536436, "grad_norm": 0.1616266518831253, "learning_rate": 9.942650351151593e-06, "loss": 0.5251, "mean_token_accuracy": 0.8349455334246159, "num_tokens": 937243759.0, "step": 29366 }, { "entropy": 0.553856423124671, "epoch": 2.701916607725085, "grad_norm": 0.15925364196300507, "learning_rate": 9.939583525009968e-06, "loss": 0.5374, "mean_token_accuracy": 0.8291758708655834, "num_tokens": 937275888.0, "step": 29367 }, { "entropy": 0.5515732131898403, "epoch": 2.7020086140965263, "grad_norm": 0.16218259930610657, "learning_rate": 9.936516698868342e-06, "loss": 0.5426, "mean_token_accuracy": 0.8274191431701183, "num_tokens": 937308238.0, "step": 29368 }, { "entropy": 0.477737913839519, "epoch": 2.7021006204679674, "grad_norm": 0.15401750802993774, "learning_rate": 9.933449872726715e-06, "loss": 0.4729, "mean_token_accuracy": 0.8534387350082397, "num_tokens": 937340326.0, "step": 29369 }, { "entropy": 0.5286146439611912, "epoch": 2.7021926268394085, "grad_norm": 0.16661345958709717, "learning_rate": 9.93038304658509e-06, "loss": 0.5135, "mean_token_accuracy": 0.8374861292541027, "num_tokens": 937372196.0, "step": 29370 }, { "entropy": 0.5245604193769395, "epoch": 2.7022846332108497, "grad_norm": 0.16082888841629028, "learning_rate": 9.927316220443465e-06, "loss": 0.5091, "mean_token_accuracy": 0.8383408673107624, "num_tokens": 937403873.0, "step": 29371 }, { "entropy": 0.5551385600119829, "epoch": 2.7023766395822912, "grad_norm": 0.16664505004882812, "learning_rate": 9.924249394301838e-06, "loss": 0.5428, "mean_token_accuracy": 0.8315611369907856, "num_tokens": 937436086.0, "step": 29372 }, { "entropy": 0.5501063913106918, "epoch": 2.7024686459537324, "grad_norm": 0.16222886741161346, "learning_rate": 9.921182568160212e-06, "loss": 0.5438, "mean_token_accuracy": 0.8316133320331573, "num_tokens": 937468854.0, "step": 29373 }, { "entropy": 0.5024053398519754, "epoch": 2.7025606523251735, "grad_norm": 0.1567261964082718, "learning_rate": 9.918115742018585e-06, "loss": 0.4953, "mean_token_accuracy": 0.8411301225423813, "num_tokens": 937500825.0, "step": 29374 }, { "entropy": 0.5207972470670938, "epoch": 2.7026526586966146, "grad_norm": 0.15516284108161926, "learning_rate": 9.91504891587696e-06, "loss": 0.5147, "mean_token_accuracy": 0.8370453454554081, "num_tokens": 937533265.0, "step": 29375 }, { "entropy": 0.4299504575319588, "epoch": 2.7027446650680558, "grad_norm": 0.1483698934316635, "learning_rate": 9.911982089735333e-06, "loss": 0.4197, "mean_token_accuracy": 0.8679557293653488, "num_tokens": 937565340.0, "step": 29376 }, { "entropy": 0.5052733849734068, "epoch": 2.7028366714394974, "grad_norm": 0.15659210085868835, "learning_rate": 9.908915263593708e-06, "loss": 0.4956, "mean_token_accuracy": 0.8409812748432159, "num_tokens": 937597653.0, "step": 29377 }, { "entropy": 0.4234911169623956, "epoch": 2.7029286778109385, "grad_norm": 0.15037141740322113, "learning_rate": 9.90584843745208e-06, "loss": 0.4042, "mean_token_accuracy": 0.8686421252787113, "num_tokens": 937629732.0, "step": 29378 }, { "entropy": 0.4873985331505537, "epoch": 2.7030206841823796, "grad_norm": 0.15745662152767181, "learning_rate": 9.902781611310455e-06, "loss": 0.4726, "mean_token_accuracy": 0.8468092083930969, "num_tokens": 937661799.0, "step": 29379 }, { "entropy": 0.5100061446428299, "epoch": 2.7031126905538208, "grad_norm": 0.15508915483951569, "learning_rate": 9.899714785168828e-06, "loss": 0.492, "mean_token_accuracy": 0.8427337519824505, "num_tokens": 937694223.0, "step": 29380 }, { "entropy": 0.4590681530535221, "epoch": 2.703204696925262, "grad_norm": 0.15507547557353973, "learning_rate": 9.896647959027203e-06, "loss": 0.4543, "mean_token_accuracy": 0.8528527729213238, "num_tokens": 937725766.0, "step": 29381 }, { "entropy": 0.6861466346308589, "epoch": 2.7032967032967035, "grad_norm": 0.1772272288799286, "learning_rate": 9.893581132885577e-06, "loss": 0.6789, "mean_token_accuracy": 0.7886240184307098, "num_tokens": 937757721.0, "step": 29382 }, { "entropy": 0.5384507086127996, "epoch": 2.7033887096681446, "grad_norm": 0.16690897941589355, "learning_rate": 9.890514306743952e-06, "loss": 0.5291, "mean_token_accuracy": 0.8327729664742947, "num_tokens": 937789924.0, "step": 29383 }, { "entropy": 0.48587938002310693, "epoch": 2.7034807160395857, "grad_norm": 0.15432921051979065, "learning_rate": 9.887447480602325e-06, "loss": 0.471, "mean_token_accuracy": 0.8491583541035652, "num_tokens": 937822168.0, "step": 29384 }, { "entropy": 0.4909462258219719, "epoch": 2.703572722411027, "grad_norm": 0.15527735650539398, "learning_rate": 9.8843806544607e-06, "loss": 0.4863, "mean_token_accuracy": 0.8478978909552097, "num_tokens": 937853705.0, "step": 29385 }, { "entropy": 0.5231052367016673, "epoch": 2.703664728782468, "grad_norm": 0.1597105860710144, "learning_rate": 9.881313828319074e-06, "loss": 0.5104, "mean_token_accuracy": 0.8361719362437725, "num_tokens": 937885931.0, "step": 29386 }, { "entropy": 0.5375697854906321, "epoch": 2.7037567351539096, "grad_norm": 0.1643153876066208, "learning_rate": 9.878247002177447e-06, "loss": 0.5307, "mean_token_accuracy": 0.8302570693194866, "num_tokens": 937918128.0, "step": 29387 }, { "entropy": 0.5565922930836678, "epoch": 2.7038487415253507, "grad_norm": 0.1636824905872345, "learning_rate": 9.875180176035822e-06, "loss": 0.5301, "mean_token_accuracy": 0.8309844955801964, "num_tokens": 937949587.0, "step": 29388 }, { "entropy": 0.49582137912511826, "epoch": 2.703940747896792, "grad_norm": 0.15249787271022797, "learning_rate": 9.872113349894195e-06, "loss": 0.4712, "mean_token_accuracy": 0.8462495170533657, "num_tokens": 937982020.0, "step": 29389 }, { "entropy": 0.5770727219060063, "epoch": 2.704032754268233, "grad_norm": 0.1633729338645935, "learning_rate": 9.86904652375257e-06, "loss": 0.5599, "mean_token_accuracy": 0.8251688033342361, "num_tokens": 938013793.0, "step": 29390 }, { "entropy": 0.5003590872511268, "epoch": 2.704124760639674, "grad_norm": 0.15249069035053253, "learning_rate": 9.865979697610942e-06, "loss": 0.4925, "mean_token_accuracy": 0.8434446454048157, "num_tokens": 938046300.0, "step": 29391 }, { "entropy": 0.6516155544668436, "epoch": 2.7042167670111157, "grad_norm": 0.17720083892345428, "learning_rate": 9.862912871469317e-06, "loss": 0.6404, "mean_token_accuracy": 0.7989145219326019, "num_tokens": 938077542.0, "step": 29392 }, { "entropy": 0.4613434877246618, "epoch": 2.704308773382557, "grad_norm": 0.1497536599636078, "learning_rate": 9.85984604532769e-06, "loss": 0.4403, "mean_token_accuracy": 0.8579260595142841, "num_tokens": 938108792.0, "step": 29393 }, { "entropy": 0.5079781468957663, "epoch": 2.704400779753998, "grad_norm": 0.16309358179569244, "learning_rate": 9.856779219186065e-06, "loss": 0.4948, "mean_token_accuracy": 0.8436512313783169, "num_tokens": 938140311.0, "step": 29394 }, { "entropy": 0.5620687324553728, "epoch": 2.704492786125439, "grad_norm": 0.16218163073062897, "learning_rate": 9.853712393044438e-06, "loss": 0.5498, "mean_token_accuracy": 0.8268061764538288, "num_tokens": 938172385.0, "step": 29395 }, { "entropy": 0.5631493758410215, "epoch": 2.70458479249688, "grad_norm": 0.16778185963630676, "learning_rate": 9.850645566902812e-06, "loss": 0.5566, "mean_token_accuracy": 0.8261303193867207, "num_tokens": 938204306.0, "step": 29396 }, { "entropy": 0.5508441627025604, "epoch": 2.704676798868322, "grad_norm": 0.16050627827644348, "learning_rate": 9.847578740761187e-06, "loss": 0.5394, "mean_token_accuracy": 0.8313274048268795, "num_tokens": 938236533.0, "step": 29397 }, { "entropy": 0.4759468100965023, "epoch": 2.704768805239763, "grad_norm": 0.15325377881526947, "learning_rate": 9.844511914619562e-06, "loss": 0.4534, "mean_token_accuracy": 0.8558849841356277, "num_tokens": 938267797.0, "step": 29398 }, { "entropy": 0.5543584958650172, "epoch": 2.704860811611204, "grad_norm": 0.16013149917125702, "learning_rate": 9.841445088477935e-06, "loss": 0.5387, "mean_token_accuracy": 0.8285940922796726, "num_tokens": 938299916.0, "step": 29399 }, { "entropy": 0.465151762124151, "epoch": 2.704952817982645, "grad_norm": 0.14346881210803986, "learning_rate": 9.83837826233631e-06, "loss": 0.459, "mean_token_accuracy": 0.8548204302787781, "num_tokens": 938331995.0, "step": 29400 }, { "entropy": 0.46698769088834524, "epoch": 2.7050448243540863, "grad_norm": 0.15566866099834442, "learning_rate": 9.835311436194684e-06, "loss": 0.4594, "mean_token_accuracy": 0.8551886267960072, "num_tokens": 938363604.0, "step": 29401 }, { "entropy": 0.43752288969699293, "epoch": 2.705136830725528, "grad_norm": 0.14855535328388214, "learning_rate": 9.832244610053057e-06, "loss": 0.4178, "mean_token_accuracy": 0.8652308732271194, "num_tokens": 938395659.0, "step": 29402 }, { "entropy": 0.4888839013874531, "epoch": 2.705228837096969, "grad_norm": 0.15580210089683533, "learning_rate": 9.829177783911431e-06, "loss": 0.4886, "mean_token_accuracy": 0.8469050377607346, "num_tokens": 938427377.0, "step": 29403 }, { "entropy": 0.35514259489718825, "epoch": 2.70532084346841, "grad_norm": 0.13633719086647034, "learning_rate": 9.826110957769804e-06, "loss": 0.3377, "mean_token_accuracy": 0.8915996141731739, "num_tokens": 938459665.0, "step": 29404 }, { "entropy": 0.47176229301840067, "epoch": 2.7054128498398513, "grad_norm": 0.14863130450248718, "learning_rate": 9.823044131628179e-06, "loss": 0.4563, "mean_token_accuracy": 0.8543741703033447, "num_tokens": 938491665.0, "step": 29405 }, { "entropy": 0.5612962665036321, "epoch": 2.7055048562112924, "grad_norm": 0.1677524298429489, "learning_rate": 9.819977305486552e-06, "loss": 0.5527, "mean_token_accuracy": 0.8312431983649731, "num_tokens": 938523957.0, "step": 29406 }, { "entropy": 0.5797065868973732, "epoch": 2.705596862582734, "grad_norm": 0.16639162600040436, "learning_rate": 9.816910479344927e-06, "loss": 0.5668, "mean_token_accuracy": 0.818696990609169, "num_tokens": 938555800.0, "step": 29407 }, { "entropy": 0.5321558655705303, "epoch": 2.705688868954175, "grad_norm": 0.16388115286827087, "learning_rate": 9.8138436532033e-06, "loss": 0.5303, "mean_token_accuracy": 0.8324672468006611, "num_tokens": 938587436.0, "step": 29408 }, { "entropy": 0.4656363414833322, "epoch": 2.7057808753256163, "grad_norm": 0.15690837800502777, "learning_rate": 9.810776827061674e-06, "loss": 0.4657, "mean_token_accuracy": 0.8555343486368656, "num_tokens": 938618459.0, "step": 29409 }, { "entropy": 0.5708893472328782, "epoch": 2.7058728816970574, "grad_norm": 0.16330111026763916, "learning_rate": 9.807710000920047e-06, "loss": 0.5537, "mean_token_accuracy": 0.8261488229036331, "num_tokens": 938650176.0, "step": 29410 }, { "entropy": 0.4382666046731174, "epoch": 2.7059648880684986, "grad_norm": 0.14505666494369507, "learning_rate": 9.804643174778422e-06, "loss": 0.43, "mean_token_accuracy": 0.8629513867199421, "num_tokens": 938682861.0, "step": 29411 }, { "entropy": 0.5752275623381138, "epoch": 2.70605689443994, "grad_norm": 0.160879448056221, "learning_rate": 9.801576348636796e-06, "loss": 0.5607, "mean_token_accuracy": 0.8252692557871342, "num_tokens": 938714445.0, "step": 29412 }, { "entropy": 0.5175880566239357, "epoch": 2.7061489008113813, "grad_norm": 0.15693826973438263, "learning_rate": 9.798509522495171e-06, "loss": 0.4999, "mean_token_accuracy": 0.8394310548901558, "num_tokens": 938746602.0, "step": 29413 }, { "entropy": 0.4699143124744296, "epoch": 2.7062409071828224, "grad_norm": 0.15468525886535645, "learning_rate": 9.795442696353544e-06, "loss": 0.4702, "mean_token_accuracy": 0.8524227291345596, "num_tokens": 938779234.0, "step": 29414 }, { "entropy": 0.4286231347359717, "epoch": 2.7063329135542635, "grad_norm": 0.14524734020233154, "learning_rate": 9.792375870211919e-06, "loss": 0.4097, "mean_token_accuracy": 0.8679923228919506, "num_tokens": 938811141.0, "step": 29415 }, { "entropy": 0.5766457635909319, "epoch": 2.7064249199257047, "grad_norm": 0.17183011770248413, "learning_rate": 9.789309044070293e-06, "loss": 0.5681, "mean_token_accuracy": 0.8195791356265545, "num_tokens": 938842398.0, "step": 29416 }, { "entropy": 0.5697886997368187, "epoch": 2.7065169262971462, "grad_norm": 0.1634502410888672, "learning_rate": 9.786242217928666e-06, "loss": 0.557, "mean_token_accuracy": 0.8270718194544315, "num_tokens": 938873889.0, "step": 29417 }, { "entropy": 0.4184475615620613, "epoch": 2.7066089326685874, "grad_norm": 0.14318981766700745, "learning_rate": 9.783175391787041e-06, "loss": 0.4036, "mean_token_accuracy": 0.8711049556732178, "num_tokens": 938906226.0, "step": 29418 }, { "entropy": 0.5520606897771358, "epoch": 2.7067009390400285, "grad_norm": 0.16796471178531647, "learning_rate": 9.780108565645414e-06, "loss": 0.5428, "mean_token_accuracy": 0.8273700997233391, "num_tokens": 938938111.0, "step": 29419 }, { "entropy": 0.5111600207164884, "epoch": 2.7067929454114696, "grad_norm": 0.15550380945205688, "learning_rate": 9.777041739503789e-06, "loss": 0.493, "mean_token_accuracy": 0.8434503376483917, "num_tokens": 938970642.0, "step": 29420 }, { "entropy": 0.4784617021214217, "epoch": 2.7068849517829108, "grad_norm": 0.15212011337280273, "learning_rate": 9.773974913362162e-06, "loss": 0.465, "mean_token_accuracy": 0.854128997772932, "num_tokens": 939003054.0, "step": 29421 }, { "entropy": 0.571298761293292, "epoch": 2.7069769581543524, "grad_norm": 0.16017569601535797, "learning_rate": 9.770908087220536e-06, "loss": 0.554, "mean_token_accuracy": 0.8272219300270081, "num_tokens": 939035124.0, "step": 29422 }, { "entropy": 0.41312379331793636, "epoch": 2.7070689645257935, "grad_norm": 0.1452677994966507, "learning_rate": 9.767841261078909e-06, "loss": 0.3995, "mean_token_accuracy": 0.8761035054922104, "num_tokens": 939067433.0, "step": 29423 }, { "entropy": 0.5276785865426064, "epoch": 2.7071609708972346, "grad_norm": 0.16054177284240723, "learning_rate": 9.764774434937284e-06, "loss": 0.5129, "mean_token_accuracy": 0.8353130184113979, "num_tokens": 939099269.0, "step": 29424 }, { "entropy": 0.4896886860951781, "epoch": 2.7072529772686758, "grad_norm": 0.1540607511997223, "learning_rate": 9.761707608795657e-06, "loss": 0.4755, "mean_token_accuracy": 0.8473938032984734, "num_tokens": 939131826.0, "step": 29425 }, { "entropy": 0.557830547913909, "epoch": 2.707344983640117, "grad_norm": 0.16258573532104492, "learning_rate": 9.758640782654031e-06, "loss": 0.545, "mean_token_accuracy": 0.828764520585537, "num_tokens": 939164067.0, "step": 29426 }, { "entropy": 0.5077865980565548, "epoch": 2.7074369900115585, "grad_norm": 0.15440073609352112, "learning_rate": 9.755573956512406e-06, "loss": 0.4946, "mean_token_accuracy": 0.8444103635847569, "num_tokens": 939196700.0, "step": 29427 }, { "entropy": 0.5684558711946011, "epoch": 2.7075289963829996, "grad_norm": 0.16620001196861267, "learning_rate": 9.752507130370779e-06, "loss": 0.5454, "mean_token_accuracy": 0.8250827975571156, "num_tokens": 939227735.0, "step": 29428 }, { "entropy": 0.5109077161177993, "epoch": 2.7076210027544407, "grad_norm": 0.16117508709430695, "learning_rate": 9.749440304229154e-06, "loss": 0.4924, "mean_token_accuracy": 0.8450235724449158, "num_tokens": 939258840.0, "step": 29429 }, { "entropy": 0.5733043737709522, "epoch": 2.707713009125882, "grad_norm": 0.16416355967521667, "learning_rate": 9.746373478087528e-06, "loss": 0.562, "mean_token_accuracy": 0.824303425848484, "num_tokens": 939290636.0, "step": 29430 }, { "entropy": 0.47080767154693604, "epoch": 2.707805015497323, "grad_norm": 0.15052123367786407, "learning_rate": 9.743306651945903e-06, "loss": 0.4588, "mean_token_accuracy": 0.8532594367861748, "num_tokens": 939322966.0, "step": 29431 }, { "entropy": 0.5255593103356659, "epoch": 2.7078970218687646, "grad_norm": 0.15839508175849915, "learning_rate": 9.740239825804276e-06, "loss": 0.5018, "mean_token_accuracy": 0.8348117135465145, "num_tokens": 939353344.0, "step": 29432 }, { "entropy": 0.43154837749898434, "epoch": 2.7079890282402057, "grad_norm": 0.14521931111812592, "learning_rate": 9.73717299966265e-06, "loss": 0.4251, "mean_token_accuracy": 0.8665536306798458, "num_tokens": 939385729.0, "step": 29433 }, { "entropy": 0.4863505130633712, "epoch": 2.708081034611647, "grad_norm": 0.15736228227615356, "learning_rate": 9.734106173521023e-06, "loss": 0.4765, "mean_token_accuracy": 0.8495798408985138, "num_tokens": 939417711.0, "step": 29434 }, { "entropy": 0.5763491718098521, "epoch": 2.708173040983088, "grad_norm": 0.16466297209262848, "learning_rate": 9.731039347379398e-06, "loss": 0.5599, "mean_token_accuracy": 0.8242186717689037, "num_tokens": 939449307.0, "step": 29435 }, { "entropy": 0.607537966221571, "epoch": 2.708265047354529, "grad_norm": 0.17340034246444702, "learning_rate": 9.727972521237771e-06, "loss": 0.5962, "mean_token_accuracy": 0.8112117946147919, "num_tokens": 939481057.0, "step": 29436 }, { "entropy": 0.48483996372669935, "epoch": 2.7083570537259707, "grad_norm": 0.1575736701488495, "learning_rate": 9.724905695096146e-06, "loss": 0.4896, "mean_token_accuracy": 0.8446231670677662, "num_tokens": 939513015.0, "step": 29437 }, { "entropy": 0.46433541364967823, "epoch": 2.708449060097412, "grad_norm": 0.1545678973197937, "learning_rate": 9.721838868954519e-06, "loss": 0.4572, "mean_token_accuracy": 0.8543913550674915, "num_tokens": 939544212.0, "step": 29438 }, { "entropy": 0.5254005650058389, "epoch": 2.708541066468853, "grad_norm": 0.15690162777900696, "learning_rate": 9.718772042812893e-06, "loss": 0.5155, "mean_token_accuracy": 0.8365977965295315, "num_tokens": 939576845.0, "step": 29439 }, { "entropy": 0.3672088396269828, "epoch": 2.708633072840294, "grad_norm": 0.1367589384317398, "learning_rate": 9.715705216671266e-06, "loss": 0.357, "mean_token_accuracy": 0.8853903152048588, "num_tokens": 939609384.0, "step": 29440 }, { "entropy": 0.4853379875421524, "epoch": 2.708725079211735, "grad_norm": 0.15914711356163025, "learning_rate": 9.712638390529641e-06, "loss": 0.4845, "mean_token_accuracy": 0.8483827374875546, "num_tokens": 939641122.0, "step": 29441 }, { "entropy": 0.5711753210052848, "epoch": 2.708817085583177, "grad_norm": 0.16455940902233124, "learning_rate": 9.709571564388016e-06, "loss": 0.554, "mean_token_accuracy": 0.8265811391174793, "num_tokens": 939673545.0, "step": 29442 }, { "entropy": 0.5637918524444103, "epoch": 2.708909091954618, "grad_norm": 0.16659268736839294, "learning_rate": 9.706504738246389e-06, "loss": 0.5461, "mean_token_accuracy": 0.8259214051067829, "num_tokens": 939705579.0, "step": 29443 }, { "entropy": 0.49789175391197205, "epoch": 2.709001098326059, "grad_norm": 0.15348005294799805, "learning_rate": 9.703437912104763e-06, "loss": 0.4945, "mean_token_accuracy": 0.8447283394634724, "num_tokens": 939737891.0, "step": 29444 }, { "entropy": 0.5009822975844145, "epoch": 2.7090931046975, "grad_norm": 0.15856173634529114, "learning_rate": 9.700371085963138e-06, "loss": 0.4891, "mean_token_accuracy": 0.84312679246068, "num_tokens": 939769981.0, "step": 29445 }, { "entropy": 0.5203333215322345, "epoch": 2.7091851110689413, "grad_norm": 0.16351637244224548, "learning_rate": 9.697304259821512e-06, "loss": 0.5028, "mean_token_accuracy": 0.8383921571075916, "num_tokens": 939801247.0, "step": 29446 }, { "entropy": 0.42796873673796654, "epoch": 2.709277117440383, "grad_norm": 0.1473221629858017, "learning_rate": 9.694237433679885e-06, "loss": 0.4156, "mean_token_accuracy": 0.8650663308799267, "num_tokens": 939833373.0, "step": 29447 }, { "entropy": 0.4377625910565257, "epoch": 2.709369123811824, "grad_norm": 0.14916308224201202, "learning_rate": 9.69117060753826e-06, "loss": 0.4412, "mean_token_accuracy": 0.8606175929307938, "num_tokens": 939865867.0, "step": 29448 }, { "entropy": 0.5729145864024758, "epoch": 2.709461130183265, "grad_norm": 0.15976038575172424, "learning_rate": 9.688103781396633e-06, "loss": 0.55, "mean_token_accuracy": 0.8242787979543209, "num_tokens": 939898192.0, "step": 29449 }, { "entropy": 0.5036901757121086, "epoch": 2.7095531365547063, "grad_norm": 0.1546286791563034, "learning_rate": 9.685036955255008e-06, "loss": 0.4955, "mean_token_accuracy": 0.8392785936594009, "num_tokens": 939930507.0, "step": 29450 }, { "entropy": 0.4300869591534138, "epoch": 2.7096451429261474, "grad_norm": 0.1472901552915573, "learning_rate": 9.68197012911338e-06, "loss": 0.4248, "mean_token_accuracy": 0.8629915490746498, "num_tokens": 939962436.0, "step": 29451 }, { "entropy": 0.5139665454626083, "epoch": 2.709737149297589, "grad_norm": 0.15648040175437927, "learning_rate": 9.678903302971755e-06, "loss": 0.5075, "mean_token_accuracy": 0.8421732597053051, "num_tokens": 939994282.0, "step": 29452 }, { "entropy": 0.4963014516979456, "epoch": 2.70982915566903, "grad_norm": 0.1609032303094864, "learning_rate": 9.675836476830128e-06, "loss": 0.4916, "mean_token_accuracy": 0.8422653861343861, "num_tokens": 940025446.0, "step": 29453 }, { "entropy": 0.43595309369266033, "epoch": 2.7099211620404713, "grad_norm": 0.15129326283931732, "learning_rate": 9.672769650688503e-06, "loss": 0.4175, "mean_token_accuracy": 0.8643510155379772, "num_tokens": 940056689.0, "step": 29454 }, { "entropy": 0.520951533690095, "epoch": 2.7100131684119124, "grad_norm": 0.15824109315872192, "learning_rate": 9.669702824546876e-06, "loss": 0.5042, "mean_token_accuracy": 0.8383250422775745, "num_tokens": 940088351.0, "step": 29455 }, { "entropy": 0.5071330908685923, "epoch": 2.7101051747833536, "grad_norm": 0.16029204428195953, "learning_rate": 9.66663599840525e-06, "loss": 0.4931, "mean_token_accuracy": 0.8432639539241791, "num_tokens": 940119402.0, "step": 29456 }, { "entropy": 0.4565302263945341, "epoch": 2.710197181154795, "grad_norm": 0.15240882337093353, "learning_rate": 9.663569172263625e-06, "loss": 0.4401, "mean_token_accuracy": 0.8583897650241852, "num_tokens": 940151413.0, "step": 29457 }, { "entropy": 0.4756838120520115, "epoch": 2.7102891875262363, "grad_norm": 0.15586267411708832, "learning_rate": 9.660502346121998e-06, "loss": 0.457, "mean_token_accuracy": 0.8535886593163013, "num_tokens": 940182704.0, "step": 29458 }, { "entropy": 0.5403930461034179, "epoch": 2.7103811938976774, "grad_norm": 0.1680208295583725, "learning_rate": 9.657435519980373e-06, "loss": 0.523, "mean_token_accuracy": 0.8345128931105137, "num_tokens": 940213396.0, "step": 29459 }, { "entropy": 0.5304553527384996, "epoch": 2.7104732002691185, "grad_norm": 0.15435703098773956, "learning_rate": 9.654368693838747e-06, "loss": 0.5085, "mean_token_accuracy": 0.840153306722641, "num_tokens": 940245838.0, "step": 29460 }, { "entropy": 0.4818395311012864, "epoch": 2.7105652066405597, "grad_norm": 0.15371173620224, "learning_rate": 9.651301867697122e-06, "loss": 0.4602, "mean_token_accuracy": 0.8554067239165306, "num_tokens": 940277856.0, "step": 29461 }, { "entropy": 0.5673356857150793, "epoch": 2.7106572130120012, "grad_norm": 0.16269373893737793, "learning_rate": 9.648235041555495e-06, "loss": 0.5531, "mean_token_accuracy": 0.8220394253730774, "num_tokens": 940310452.0, "step": 29462 }, { "entropy": 0.579140611924231, "epoch": 2.7107492193834424, "grad_norm": 0.16885478794574738, "learning_rate": 9.64516821541387e-06, "loss": 0.5778, "mean_token_accuracy": 0.8188778795301914, "num_tokens": 940341652.0, "step": 29463 }, { "entropy": 0.453948883805424, "epoch": 2.7108412257548835, "grad_norm": 0.15291471779346466, "learning_rate": 9.642101389272243e-06, "loss": 0.4466, "mean_token_accuracy": 0.8579147905111313, "num_tokens": 940374160.0, "step": 29464 }, { "entropy": 0.45679567754268646, "epoch": 2.7109332321263246, "grad_norm": 0.15003487467765808, "learning_rate": 9.639034563130617e-06, "loss": 0.4502, "mean_token_accuracy": 0.8556800968945026, "num_tokens": 940405525.0, "step": 29465 }, { "entropy": 0.5194982485845685, "epoch": 2.7110252384977658, "grad_norm": 0.15723580121994019, "learning_rate": 9.63596773698899e-06, "loss": 0.506, "mean_token_accuracy": 0.8367626704275608, "num_tokens": 940437134.0, "step": 29466 }, { "entropy": 0.5619834503158927, "epoch": 2.7111172448692074, "grad_norm": 0.16230976581573486, "learning_rate": 9.632900910847365e-06, "loss": 0.5434, "mean_token_accuracy": 0.82707279920578, "num_tokens": 940469200.0, "step": 29467 }, { "entropy": 0.5053897053003311, "epoch": 2.7112092512406485, "grad_norm": 0.16113726794719696, "learning_rate": 9.629834084705738e-06, "loss": 0.4964, "mean_token_accuracy": 0.8430382646620274, "num_tokens": 940500549.0, "step": 29468 }, { "entropy": 0.4651757264509797, "epoch": 2.7113012576120896, "grad_norm": 0.14883168041706085, "learning_rate": 9.626767258564112e-06, "loss": 0.462, "mean_token_accuracy": 0.8554973527789116, "num_tokens": 940533103.0, "step": 29469 }, { "entropy": 0.46917093778029084, "epoch": 2.7113932639835308, "grad_norm": 0.14386573433876038, "learning_rate": 9.623700432422485e-06, "loss": 0.4548, "mean_token_accuracy": 0.859482616186142, "num_tokens": 940565588.0, "step": 29470 }, { "entropy": 0.5867243511602283, "epoch": 2.711485270354972, "grad_norm": 0.1689629703760147, "learning_rate": 9.62063360628086e-06, "loss": 0.5788, "mean_token_accuracy": 0.8190339505672455, "num_tokens": 940598356.0, "step": 29471 }, { "entropy": 0.625205010175705, "epoch": 2.7115772767264135, "grad_norm": 0.17049282789230347, "learning_rate": 9.617566780139235e-06, "loss": 0.6145, "mean_token_accuracy": 0.8068715482950211, "num_tokens": 940630621.0, "step": 29472 }, { "entropy": 0.5346143897622824, "epoch": 2.7116692830978546, "grad_norm": 0.16651523113250732, "learning_rate": 9.614499953997608e-06, "loss": 0.5289, "mean_token_accuracy": 0.8310666084289551, "num_tokens": 940661973.0, "step": 29473 }, { "entropy": 0.48114430834539235, "epoch": 2.7117612894692957, "grad_norm": 0.16007710993289948, "learning_rate": 9.611433127855982e-06, "loss": 0.4767, "mean_token_accuracy": 0.8505708687007427, "num_tokens": 940693775.0, "step": 29474 }, { "entropy": 0.5090610315091908, "epoch": 2.711853295840737, "grad_norm": 0.15451683104038239, "learning_rate": 9.608366301714357e-06, "loss": 0.4866, "mean_token_accuracy": 0.842536099255085, "num_tokens": 940725067.0, "step": 29475 }, { "entropy": 0.44627729849889874, "epoch": 2.711945302212178, "grad_norm": 0.14641118049621582, "learning_rate": 9.605299475572732e-06, "loss": 0.4311, "mean_token_accuracy": 0.8604666069149971, "num_tokens": 940757197.0, "step": 29476 }, { "entropy": 0.5837078290060163, "epoch": 2.7120373085836196, "grad_norm": 0.16325725615024567, "learning_rate": 9.602232649431105e-06, "loss": 0.5629, "mean_token_accuracy": 0.8251640237867832, "num_tokens": 940789963.0, "step": 29477 }, { "entropy": 0.44595308415591717, "epoch": 2.7121293149550607, "grad_norm": 0.1492750346660614, "learning_rate": 9.59916582328948e-06, "loss": 0.4378, "mean_token_accuracy": 0.8616411089897156, "num_tokens": 940821822.0, "step": 29478 }, { "entropy": 0.5667116101831198, "epoch": 2.712221321326502, "grad_norm": 0.1638147085905075, "learning_rate": 9.596098997147852e-06, "loss": 0.5622, "mean_token_accuracy": 0.8212725855410099, "num_tokens": 940854425.0, "step": 29479 }, { "entropy": 0.46278367657214403, "epoch": 2.712313327697943, "grad_norm": 0.15870465338230133, "learning_rate": 9.593032171006227e-06, "loss": 0.4481, "mean_token_accuracy": 0.8553985953330994, "num_tokens": 940886101.0, "step": 29480 }, { "entropy": 0.5029043778777122, "epoch": 2.712405334069384, "grad_norm": 0.1567719578742981, "learning_rate": 9.5899653448646e-06, "loss": 0.4976, "mean_token_accuracy": 0.843014795333147, "num_tokens": 940918713.0, "step": 29481 }, { "entropy": 0.514163332991302, "epoch": 2.7124973404408257, "grad_norm": 0.16221195459365845, "learning_rate": 9.586898518722974e-06, "loss": 0.5055, "mean_token_accuracy": 0.8397840708494186, "num_tokens": 940950812.0, "step": 29482 }, { "entropy": 0.43724628211930394, "epoch": 2.712589346812267, "grad_norm": 0.1565748155117035, "learning_rate": 9.583831692581347e-06, "loss": 0.4389, "mean_token_accuracy": 0.8557043261826038, "num_tokens": 940982340.0, "step": 29483 }, { "entropy": 0.5420735906809568, "epoch": 2.712681353183708, "grad_norm": 0.16747403144836426, "learning_rate": 9.580764866439722e-06, "loss": 0.5321, "mean_token_accuracy": 0.8331629671156406, "num_tokens": 941014155.0, "step": 29484 }, { "entropy": 0.4624431747943163, "epoch": 2.712773359555149, "grad_norm": 0.15119031071662903, "learning_rate": 9.577698040298095e-06, "loss": 0.4548, "mean_token_accuracy": 0.8551188074052334, "num_tokens": 941045616.0, "step": 29485 }, { "entropy": 0.555675673764199, "epoch": 2.7128653659265902, "grad_norm": 0.15616805851459503, "learning_rate": 9.57463121415647e-06, "loss": 0.5386, "mean_token_accuracy": 0.8319585397839546, "num_tokens": 941078189.0, "step": 29486 }, { "entropy": 0.5368008371442556, "epoch": 2.712957372298032, "grad_norm": 0.15680216252803802, "learning_rate": 9.571564388014844e-06, "loss": 0.5301, "mean_token_accuracy": 0.8331286199390888, "num_tokens": 941110941.0, "step": 29487 }, { "entropy": 0.494827467831783, "epoch": 2.713049378669473, "grad_norm": 0.156403049826622, "learning_rate": 9.568497561873217e-06, "loss": 0.4864, "mean_token_accuracy": 0.8444091565907001, "num_tokens": 941142959.0, "step": 29488 }, { "entropy": 0.487176226451993, "epoch": 2.713141385040914, "grad_norm": 0.15636087954044342, "learning_rate": 9.565430735731592e-06, "loss": 0.48, "mean_token_accuracy": 0.8476056270301342, "num_tokens": 941175058.0, "step": 29489 }, { "entropy": 0.5763474958948791, "epoch": 2.713233391412355, "grad_norm": 0.16623680293560028, "learning_rate": 9.562363909589966e-06, "loss": 0.5673, "mean_token_accuracy": 0.8227771036326885, "num_tokens": 941207521.0, "step": 29490 }, { "entropy": 0.5081065036356449, "epoch": 2.7133253977837963, "grad_norm": 0.15773585438728333, "learning_rate": 9.559297083448341e-06, "loss": 0.5069, "mean_token_accuracy": 0.8436964824795723, "num_tokens": 941239735.0, "step": 29491 }, { "entropy": 0.474165519233793, "epoch": 2.713417404155238, "grad_norm": 0.15304265916347504, "learning_rate": 9.556230257306714e-06, "loss": 0.4765, "mean_token_accuracy": 0.8493592068552971, "num_tokens": 941272211.0, "step": 29492 }, { "entropy": 0.41087288537528366, "epoch": 2.713509410526679, "grad_norm": 0.14176598191261292, "learning_rate": 9.553163431165089e-06, "loss": 0.3978, "mean_token_accuracy": 0.874092485755682, "num_tokens": 941304589.0, "step": 29493 }, { "entropy": 0.5401728320866823, "epoch": 2.71360141689812, "grad_norm": 0.162898451089859, "learning_rate": 9.550096605023462e-06, "loss": 0.5286, "mean_token_accuracy": 0.8334130682051182, "num_tokens": 941337243.0, "step": 29494 }, { "entropy": 0.5644473303109407, "epoch": 2.7136934232695613, "grad_norm": 0.16374875605106354, "learning_rate": 9.547029778881836e-06, "loss": 0.5505, "mean_token_accuracy": 0.8284657038748264, "num_tokens": 941368874.0, "step": 29495 }, { "entropy": 0.5110219726338983, "epoch": 2.7137854296410024, "grad_norm": 0.16040107607841492, "learning_rate": 9.54396295274021e-06, "loss": 0.4925, "mean_token_accuracy": 0.841670598834753, "num_tokens": 941400592.0, "step": 29496 }, { "entropy": 0.5601012473925948, "epoch": 2.713877436012444, "grad_norm": 0.16122746467590332, "learning_rate": 9.540896126598584e-06, "loss": 0.5346, "mean_token_accuracy": 0.830735981464386, "num_tokens": 941432722.0, "step": 29497 }, { "entropy": 0.5917423032224178, "epoch": 2.713969442383885, "grad_norm": 0.16675250232219696, "learning_rate": 9.537829300456957e-06, "loss": 0.5793, "mean_token_accuracy": 0.8176718056201935, "num_tokens": 941464510.0, "step": 29498 }, { "entropy": 0.5512966085225344, "epoch": 2.7140614487553263, "grad_norm": 0.1591653674840927, "learning_rate": 9.534762474315332e-06, "loss": 0.5482, "mean_token_accuracy": 0.8276122882962227, "num_tokens": 941496601.0, "step": 29499 }, { "entropy": 0.4531576024601236, "epoch": 2.7141534551267674, "grad_norm": 0.14627064764499664, "learning_rate": 9.531695648173704e-06, "loss": 0.4356, "mean_token_accuracy": 0.8602516762912273, "num_tokens": 941528713.0, "step": 29500 }, { "entropy": 0.544558972120285, "epoch": 2.7142454614982086, "grad_norm": 0.1682693511247635, "learning_rate": 9.528628822032079e-06, "loss": 0.5489, "mean_token_accuracy": 0.8284273818135262, "num_tokens": 941560864.0, "step": 29501 }, { "entropy": 0.49616995453834534, "epoch": 2.71433746786965, "grad_norm": 0.15120266377925873, "learning_rate": 9.525561995890454e-06, "loss": 0.4846, "mean_token_accuracy": 0.8440384343266487, "num_tokens": 941593218.0, "step": 29502 }, { "entropy": 0.49774342868477106, "epoch": 2.7144294742410913, "grad_norm": 0.15805427730083466, "learning_rate": 9.522495169748827e-06, "loss": 0.4882, "mean_token_accuracy": 0.843717411160469, "num_tokens": 941625309.0, "step": 29503 }, { "entropy": 0.5208279844373465, "epoch": 2.7145214806125324, "grad_norm": 0.16161228716373444, "learning_rate": 9.519428343607201e-06, "loss": 0.5107, "mean_token_accuracy": 0.8412415310740471, "num_tokens": 941656664.0, "step": 29504 }, { "entropy": 0.5599145963788033, "epoch": 2.7146134869839735, "grad_norm": 0.17367525398731232, "learning_rate": 9.516361517465576e-06, "loss": 0.5524, "mean_token_accuracy": 0.8244989663362503, "num_tokens": 941687139.0, "step": 29505 }, { "entropy": 0.5424892473965883, "epoch": 2.7147054933554147, "grad_norm": 0.1627299189567566, "learning_rate": 9.51329469132395e-06, "loss": 0.5356, "mean_token_accuracy": 0.8296914361417294, "num_tokens": 941719526.0, "step": 29506 }, { "entropy": 0.48204999417066574, "epoch": 2.7147974997268562, "grad_norm": 0.15063752233982086, "learning_rate": 9.510227865182324e-06, "loss": 0.4688, "mean_token_accuracy": 0.8485689796507359, "num_tokens": 941751341.0, "step": 29507 }, { "entropy": 0.45657989056780934, "epoch": 2.7148895060982974, "grad_norm": 0.14914539456367493, "learning_rate": 9.507161039040698e-06, "loss": 0.4412, "mean_token_accuracy": 0.8568937964737415, "num_tokens": 941783482.0, "step": 29508 }, { "entropy": 0.46702362853102386, "epoch": 2.7149815124697385, "grad_norm": 0.1557740718126297, "learning_rate": 9.504094212899071e-06, "loss": 0.4669, "mean_token_accuracy": 0.8492706157267094, "num_tokens": 941815698.0, "step": 29509 }, { "entropy": 0.44602674152702093, "epoch": 2.7150735188411796, "grad_norm": 0.14620231091976166, "learning_rate": 9.501027386757446e-06, "loss": 0.4472, "mean_token_accuracy": 0.8600101806223392, "num_tokens": 941848205.0, "step": 29510 }, { "entropy": 0.5066583938896656, "epoch": 2.715165525212621, "grad_norm": 0.16547957062721252, "learning_rate": 9.497960560615819e-06, "loss": 0.4961, "mean_token_accuracy": 0.839994840323925, "num_tokens": 941879487.0, "step": 29511 }, { "entropy": 0.6098740380257368, "epoch": 2.7152575315840624, "grad_norm": 0.1694057285785675, "learning_rate": 9.494893734474193e-06, "loss": 0.598, "mean_token_accuracy": 0.8154836520552635, "num_tokens": 941911538.0, "step": 29512 }, { "entropy": 0.5227645514532924, "epoch": 2.7153495379555035, "grad_norm": 0.16043415665626526, "learning_rate": 9.491826908332566e-06, "loss": 0.512, "mean_token_accuracy": 0.84015978500247, "num_tokens": 941943773.0, "step": 29513 }, { "entropy": 0.47369934571906924, "epoch": 2.7154415443269446, "grad_norm": 0.14708305895328522, "learning_rate": 9.488760082190941e-06, "loss": 0.4524, "mean_token_accuracy": 0.8558394722640514, "num_tokens": 941976067.0, "step": 29514 }, { "entropy": 0.5469330567866564, "epoch": 2.7155335506983858, "grad_norm": 0.15744276344776154, "learning_rate": 9.485693256049314e-06, "loss": 0.5244, "mean_token_accuracy": 0.8328103981912136, "num_tokens": 942008805.0, "step": 29515 }, { "entropy": 0.5345748402178288, "epoch": 2.715625557069827, "grad_norm": 0.15962496399879456, "learning_rate": 9.482626429907689e-06, "loss": 0.525, "mean_token_accuracy": 0.832987803965807, "num_tokens": 942040888.0, "step": 29516 }, { "entropy": 0.4384117814479396, "epoch": 2.7157175634412685, "grad_norm": 0.14387518167495728, "learning_rate": 9.479559603766063e-06, "loss": 0.4222, "mean_token_accuracy": 0.8671610727906227, "num_tokens": 942073623.0, "step": 29517 }, { "entropy": 0.5424384325742722, "epoch": 2.7158095698127096, "grad_norm": 0.1689295619726181, "learning_rate": 9.476492777624436e-06, "loss": 0.5309, "mean_token_accuracy": 0.8277655579149723, "num_tokens": 942104737.0, "step": 29518 }, { "entropy": 0.4583223136141896, "epoch": 2.7159015761841507, "grad_norm": 0.1451146900653839, "learning_rate": 9.473425951482811e-06, "loss": 0.4435, "mean_token_accuracy": 0.8571815304458141, "num_tokens": 942137057.0, "step": 29519 }, { "entropy": 0.5224432507529855, "epoch": 2.715993582555592, "grad_norm": 0.15666259825229645, "learning_rate": 9.470359125341186e-06, "loss": 0.5078, "mean_token_accuracy": 0.8414540514349937, "num_tokens": 942169271.0, "step": 29520 }, { "entropy": 0.5231816272716969, "epoch": 2.716085588927033, "grad_norm": 0.16425912082195282, "learning_rate": 9.46729229919956e-06, "loss": 0.5169, "mean_token_accuracy": 0.8334907814860344, "num_tokens": 942201179.0, "step": 29521 }, { "entropy": 0.4906005463562906, "epoch": 2.7161775952984746, "grad_norm": 0.15223179757595062, "learning_rate": 9.464225473057933e-06, "loss": 0.4741, "mean_token_accuracy": 0.8489337489008904, "num_tokens": 942233053.0, "step": 29522 }, { "entropy": 0.4826858504675329, "epoch": 2.7162696016699157, "grad_norm": 0.1527739018201828, "learning_rate": 9.461158646916308e-06, "loss": 0.4634, "mean_token_accuracy": 0.8548373468220234, "num_tokens": 942264858.0, "step": 29523 }, { "entropy": 0.5523564352188259, "epoch": 2.716361608041357, "grad_norm": 0.16184939444065094, "learning_rate": 9.45809182077468e-06, "loss": 0.5395, "mean_token_accuracy": 0.8357576429843903, "num_tokens": 942296917.0, "step": 29524 }, { "entropy": 0.6424685698002577, "epoch": 2.716453614412798, "grad_norm": 0.17792563140392303, "learning_rate": 9.455024994633055e-06, "loss": 0.6433, "mean_token_accuracy": 0.7972246296703815, "num_tokens": 942328589.0, "step": 29525 }, { "entropy": 0.5362963755615056, "epoch": 2.716545620784239, "grad_norm": 0.15598426759243011, "learning_rate": 9.451958168491428e-06, "loss": 0.5227, "mean_token_accuracy": 0.8332065306603909, "num_tokens": 942360861.0, "step": 29526 }, { "entropy": 0.5242857616394758, "epoch": 2.7166376271556807, "grad_norm": 0.16002561151981354, "learning_rate": 9.448891342349803e-06, "loss": 0.5026, "mean_token_accuracy": 0.8376519940793514, "num_tokens": 942392857.0, "step": 29527 }, { "entropy": 0.45163861382752657, "epoch": 2.716729633527122, "grad_norm": 0.15507030487060547, "learning_rate": 9.445824516208176e-06, "loss": 0.4502, "mean_token_accuracy": 0.8554118536412716, "num_tokens": 942425088.0, "step": 29528 }, { "entropy": 0.5544029891025275, "epoch": 2.716821639898563, "grad_norm": 0.16259752213954926, "learning_rate": 9.44275769006655e-06, "loss": 0.5253, "mean_token_accuracy": 0.8313968293368816, "num_tokens": 942456638.0, "step": 29529 }, { "entropy": 0.4911020901054144, "epoch": 2.716913646270004, "grad_norm": 0.1552354246377945, "learning_rate": 9.439690863924924e-06, "loss": 0.4866, "mean_token_accuracy": 0.8487954027950764, "num_tokens": 942488873.0, "step": 29530 }, { "entropy": 0.4854115080088377, "epoch": 2.7170056526414452, "grad_norm": 0.1588830053806305, "learning_rate": 9.436624037783298e-06, "loss": 0.4708, "mean_token_accuracy": 0.8479112721979618, "num_tokens": 942520817.0, "step": 29531 }, { "entropy": 0.5107281575910747, "epoch": 2.717097659012887, "grad_norm": 0.15638074278831482, "learning_rate": 9.433557211641673e-06, "loss": 0.5113, "mean_token_accuracy": 0.8371774852275848, "num_tokens": 942553161.0, "step": 29532 }, { "entropy": 0.4180474542081356, "epoch": 2.717189665384328, "grad_norm": 0.14483997225761414, "learning_rate": 9.430490385500046e-06, "loss": 0.4106, "mean_token_accuracy": 0.8683444410562515, "num_tokens": 942585189.0, "step": 29533 }, { "entropy": 0.46075727697461843, "epoch": 2.717281671755769, "grad_norm": 0.16033774614334106, "learning_rate": 9.42742355935842e-06, "loss": 0.4441, "mean_token_accuracy": 0.8556770980358124, "num_tokens": 942615837.0, "step": 29534 }, { "entropy": 0.48927901219576597, "epoch": 2.71737367812721, "grad_norm": 0.1564558893442154, "learning_rate": 9.424356733216795e-06, "loss": 0.4793, "mean_token_accuracy": 0.8512209020555019, "num_tokens": 942647691.0, "step": 29535 }, { "entropy": 0.5523123014718294, "epoch": 2.7174656844986513, "grad_norm": 0.16063927114009857, "learning_rate": 9.42128990707517e-06, "loss": 0.5383, "mean_token_accuracy": 0.8307310044765472, "num_tokens": 942679318.0, "step": 29536 }, { "entropy": 0.5385976769030094, "epoch": 2.717557690870093, "grad_norm": 0.16457320749759674, "learning_rate": 9.418223080933543e-06, "loss": 0.5263, "mean_token_accuracy": 0.8288463950157166, "num_tokens": 942711369.0, "step": 29537 }, { "entropy": 0.5359412990510464, "epoch": 2.717649697241534, "grad_norm": 0.16201885044574738, "learning_rate": 9.415156254791917e-06, "loss": 0.5168, "mean_token_accuracy": 0.8345944434404373, "num_tokens": 942742965.0, "step": 29538 }, { "entropy": 0.5387691725045443, "epoch": 2.717741703612975, "grad_norm": 0.16312868893146515, "learning_rate": 9.41208942865029e-06, "loss": 0.5335, "mean_token_accuracy": 0.8304332979023457, "num_tokens": 942775455.0, "step": 29539 }, { "entropy": 0.5182561255060136, "epoch": 2.7178337099844163, "grad_norm": 0.1548660546541214, "learning_rate": 9.409022602508665e-06, "loss": 0.5012, "mean_token_accuracy": 0.8387514464557171, "num_tokens": 942807964.0, "step": 29540 }, { "entropy": 0.5114080628845841, "epoch": 2.7179257163558574, "grad_norm": 0.16080592572689056, "learning_rate": 9.405955776367038e-06, "loss": 0.5009, "mean_token_accuracy": 0.8407025523483753, "num_tokens": 942839712.0, "step": 29541 }, { "entropy": 0.5532078746473417, "epoch": 2.718017722727299, "grad_norm": 0.16597752273082733, "learning_rate": 9.402888950225413e-06, "loss": 0.5402, "mean_token_accuracy": 0.8278957940638065, "num_tokens": 942871094.0, "step": 29542 }, { "entropy": 0.5576238073408604, "epoch": 2.71810972909874, "grad_norm": 0.16924643516540527, "learning_rate": 9.399822124083786e-06, "loss": 0.5389, "mean_token_accuracy": 0.830027524381876, "num_tokens": 942902546.0, "step": 29543 }, { "entropy": 0.42738837841898203, "epoch": 2.7182017354701813, "grad_norm": 0.15169306099414825, "learning_rate": 9.39675529794216e-06, "loss": 0.4247, "mean_token_accuracy": 0.8623219132423401, "num_tokens": 942934042.0, "step": 29544 }, { "entropy": 0.5157542433589697, "epoch": 2.7182937418416224, "grad_norm": 0.15863071382045746, "learning_rate": 9.393688471800533e-06, "loss": 0.5002, "mean_token_accuracy": 0.8408646769821644, "num_tokens": 942966810.0, "step": 29545 }, { "entropy": 0.5631628390401602, "epoch": 2.7183857482130636, "grad_norm": 0.16536839306354523, "learning_rate": 9.390621645658908e-06, "loss": 0.5559, "mean_token_accuracy": 0.8265970535576344, "num_tokens": 942997990.0, "step": 29546 }, { "entropy": 0.5431593470275402, "epoch": 2.718477754584505, "grad_norm": 0.1622903198003769, "learning_rate": 9.387554819517282e-06, "loss": 0.533, "mean_token_accuracy": 0.8326757177710533, "num_tokens": 943029443.0, "step": 29547 }, { "entropy": 0.46254440664779395, "epoch": 2.7185697609559463, "grad_norm": 0.1527068316936493, "learning_rate": 9.384487993375655e-06, "loss": 0.4558, "mean_token_accuracy": 0.857398334890604, "num_tokens": 943062069.0, "step": 29548 }, { "entropy": 0.5279805868631229, "epoch": 2.7186617673273874, "grad_norm": 0.16338324546813965, "learning_rate": 9.38142116723403e-06, "loss": 0.5173, "mean_token_accuracy": 0.8377890177071095, "num_tokens": 943093878.0, "step": 29549 }, { "entropy": 0.45413206052035093, "epoch": 2.7187537736988285, "grad_norm": 0.15075397491455078, "learning_rate": 9.378354341092403e-06, "loss": 0.4465, "mean_token_accuracy": 0.857798270881176, "num_tokens": 943126490.0, "step": 29550 }, { "entropy": 0.5252186730504036, "epoch": 2.7188457800702697, "grad_norm": 0.16004788875579834, "learning_rate": 9.37528751495078e-06, "loss": 0.5089, "mean_token_accuracy": 0.8375021629035473, "num_tokens": 943158261.0, "step": 29551 }, { "entropy": 0.5398185262456536, "epoch": 2.7189377864417112, "grad_norm": 0.16436520218849182, "learning_rate": 9.372220688809152e-06, "loss": 0.524, "mean_token_accuracy": 0.8316056616604328, "num_tokens": 943190103.0, "step": 29552 }, { "entropy": 0.5539820622652769, "epoch": 2.7190297928131524, "grad_norm": 0.16734415292739868, "learning_rate": 9.369153862667527e-06, "loss": 0.5361, "mean_token_accuracy": 0.8313120454549789, "num_tokens": 943221264.0, "step": 29553 }, { "entropy": 0.5067363493144512, "epoch": 2.7191217991845935, "grad_norm": 0.16446061432361603, "learning_rate": 9.3660870365259e-06, "loss": 0.4959, "mean_token_accuracy": 0.8414928838610649, "num_tokens": 943252517.0, "step": 29554 }, { "entropy": 0.5138954482972622, "epoch": 2.7192138055560346, "grad_norm": 0.15598028898239136, "learning_rate": 9.363020210384275e-06, "loss": 0.4926, "mean_token_accuracy": 0.845769289880991, "num_tokens": 943284742.0, "step": 29555 }, { "entropy": 0.5439396165311337, "epoch": 2.719305811927476, "grad_norm": 0.1606169492006302, "learning_rate": 9.359953384242647e-06, "loss": 0.538, "mean_token_accuracy": 0.831633884459734, "num_tokens": 943316754.0, "step": 29556 }, { "entropy": 0.5103464722633362, "epoch": 2.7193978182989174, "grad_norm": 0.1588754802942276, "learning_rate": 9.356886558101022e-06, "loss": 0.5023, "mean_token_accuracy": 0.8359794802963734, "num_tokens": 943349522.0, "step": 29557 }, { "entropy": 0.5343229081481695, "epoch": 2.7194898246703585, "grad_norm": 0.15927842259407043, "learning_rate": 9.353819731959395e-06, "loss": 0.5255, "mean_token_accuracy": 0.8321388885378838, "num_tokens": 943381865.0, "step": 29558 }, { "entropy": 0.5423755906522274, "epoch": 2.7195818310417996, "grad_norm": 0.1671418845653534, "learning_rate": 9.35075290581777e-06, "loss": 0.5328, "mean_token_accuracy": 0.8316516689956188, "num_tokens": 943414348.0, "step": 29559 }, { "entropy": 0.5668250471353531, "epoch": 2.7196738374132408, "grad_norm": 0.17067091166973114, "learning_rate": 9.347686079676143e-06, "loss": 0.5556, "mean_token_accuracy": 0.8275418356060982, "num_tokens": 943446668.0, "step": 29560 }, { "entropy": 0.5010566059499979, "epoch": 2.719765843784682, "grad_norm": 0.1612321138381958, "learning_rate": 9.344619253534517e-06, "loss": 0.4856, "mean_token_accuracy": 0.8445966765284538, "num_tokens": 943479013.0, "step": 29561 }, { "entropy": 0.35792711144313216, "epoch": 2.7198578501561235, "grad_norm": 0.13356424868106842, "learning_rate": 9.341552427392892e-06, "loss": 0.3472, "mean_token_accuracy": 0.8886379711329937, "num_tokens": 943510420.0, "step": 29562 }, { "entropy": 0.47766319708898664, "epoch": 2.7199498565275646, "grad_norm": 0.1505100578069687, "learning_rate": 9.338485601251265e-06, "loss": 0.4725, "mean_token_accuracy": 0.8503442853689194, "num_tokens": 943543023.0, "step": 29563 }, { "entropy": 0.54867840744555, "epoch": 2.7200418628990057, "grad_norm": 0.1679849773645401, "learning_rate": 9.33541877510964e-06, "loss": 0.5396, "mean_token_accuracy": 0.8305001147091389, "num_tokens": 943575289.0, "step": 29564 }, { "entropy": 0.546886382624507, "epoch": 2.720133869270447, "grad_norm": 0.16200384497642517, "learning_rate": 9.332351948968013e-06, "loss": 0.5339, "mean_token_accuracy": 0.8319043032824993, "num_tokens": 943606542.0, "step": 29565 }, { "entropy": 0.5371547788381577, "epoch": 2.720225875641888, "grad_norm": 0.16876019537448883, "learning_rate": 9.329285122826389e-06, "loss": 0.5171, "mean_token_accuracy": 0.8359006568789482, "num_tokens": 943637532.0, "step": 29566 }, { "entropy": 0.6683938857167959, "epoch": 2.7203178820133296, "grad_norm": 0.18114031851291656, "learning_rate": 9.326218296684762e-06, "loss": 0.6704, "mean_token_accuracy": 0.7952069826424122, "num_tokens": 943669915.0, "step": 29567 }, { "entropy": 0.5274489168077707, "epoch": 2.7204098883847707, "grad_norm": 0.15835559368133545, "learning_rate": 9.323151470543136e-06, "loss": 0.5096, "mean_token_accuracy": 0.8375577814877033, "num_tokens": 943701581.0, "step": 29568 }, { "entropy": 0.5554957399144769, "epoch": 2.720501894756212, "grad_norm": 0.1650552898645401, "learning_rate": 9.32008464440151e-06, "loss": 0.5424, "mean_token_accuracy": 0.8292694836854935, "num_tokens": 943734239.0, "step": 29569 }, { "entropy": 0.4652759227901697, "epoch": 2.720593901127653, "grad_norm": 0.1521858125925064, "learning_rate": 9.317017818259884e-06, "loss": 0.4513, "mean_token_accuracy": 0.8579746969044209, "num_tokens": 943766805.0, "step": 29570 }, { "entropy": 0.5553964730352163, "epoch": 2.720685907499094, "grad_norm": 0.16752220690250397, "learning_rate": 9.313950992118257e-06, "loss": 0.5447, "mean_token_accuracy": 0.8255958892405033, "num_tokens": 943798456.0, "step": 29571 }, { "entropy": 0.41632277332246304, "epoch": 2.7207779138705357, "grad_norm": 0.1443548947572708, "learning_rate": 9.310884165976632e-06, "loss": 0.3925, "mean_token_accuracy": 0.8712684214115143, "num_tokens": 943829689.0, "step": 29572 }, { "entropy": 0.5260162218473852, "epoch": 2.720869920241977, "grad_norm": 0.1588772088289261, "learning_rate": 9.307817339835005e-06, "loss": 0.5153, "mean_token_accuracy": 0.8370610512793064, "num_tokens": 943862277.0, "step": 29573 }, { "entropy": 0.5115332221612334, "epoch": 2.720961926613418, "grad_norm": 0.1620284616947174, "learning_rate": 9.30475051369338e-06, "loss": 0.5111, "mean_token_accuracy": 0.8342828340828419, "num_tokens": 943894458.0, "step": 29574 }, { "entropy": 0.5179223215673119, "epoch": 2.721053932984859, "grad_norm": 0.15561611950397491, "learning_rate": 9.301683687551752e-06, "loss": 0.5055, "mean_token_accuracy": 0.8421340323984623, "num_tokens": 943926760.0, "step": 29575 }, { "entropy": 0.5905134528875351, "epoch": 2.7211459393563002, "grad_norm": 0.16326211392879486, "learning_rate": 9.298616861410127e-06, "loss": 0.5711, "mean_token_accuracy": 0.8190884664654732, "num_tokens": 943958722.0, "step": 29576 }, { "entropy": 0.5799779482185841, "epoch": 2.721237945727742, "grad_norm": 0.16340073943138123, "learning_rate": 9.295550035268502e-06, "loss": 0.5591, "mean_token_accuracy": 0.8236204236745834, "num_tokens": 943990701.0, "step": 29577 }, { "entropy": 0.4383192863315344, "epoch": 2.721329952099183, "grad_norm": 0.1499021053314209, "learning_rate": 9.292483209126874e-06, "loss": 0.4295, "mean_token_accuracy": 0.8624138161540031, "num_tokens": 944022224.0, "step": 29578 }, { "entropy": 0.6219814382493496, "epoch": 2.721421958470624, "grad_norm": 0.17073261737823486, "learning_rate": 9.289416382985249e-06, "loss": 0.6049, "mean_token_accuracy": 0.8129013441503048, "num_tokens": 944053468.0, "step": 29579 }, { "entropy": 0.5641612745821476, "epoch": 2.721513964842065, "grad_norm": 0.1620301902294159, "learning_rate": 9.286349556843622e-06, "loss": 0.5532, "mean_token_accuracy": 0.8276461437344551, "num_tokens": 944086153.0, "step": 29580 }, { "entropy": 0.5627747625112534, "epoch": 2.7216059712135063, "grad_norm": 0.16287249326705933, "learning_rate": 9.283282730701998e-06, "loss": 0.5515, "mean_token_accuracy": 0.828267827630043, "num_tokens": 944117198.0, "step": 29581 }, { "entropy": 0.478362335357815, "epoch": 2.721697977584948, "grad_norm": 0.15343336760997772, "learning_rate": 9.280215904560371e-06, "loss": 0.4681, "mean_token_accuracy": 0.851282462477684, "num_tokens": 944149404.0, "step": 29582 }, { "entropy": 0.5806732960045338, "epoch": 2.721789983956389, "grad_norm": 0.16574163734912872, "learning_rate": 9.277149078418746e-06, "loss": 0.5682, "mean_token_accuracy": 0.8210759460926056, "num_tokens": 944181673.0, "step": 29583 }, { "entropy": 0.5358434771187603, "epoch": 2.72188199032783, "grad_norm": 0.16628021001815796, "learning_rate": 9.274082252277119e-06, "loss": 0.534, "mean_token_accuracy": 0.8356897756457329, "num_tokens": 944213539.0, "step": 29584 }, { "entropy": 0.49048814503476024, "epoch": 2.7219739966992713, "grad_norm": 0.15433037281036377, "learning_rate": 9.271015426135494e-06, "loss": 0.472, "mean_token_accuracy": 0.8496713936328888, "num_tokens": 944245838.0, "step": 29585 }, { "entropy": 0.5455464627593756, "epoch": 2.7220660030707124, "grad_norm": 0.1654725819826126, "learning_rate": 9.267948599993867e-06, "loss": 0.5377, "mean_token_accuracy": 0.8290515691041946, "num_tokens": 944276686.0, "step": 29586 }, { "entropy": 0.4717392046004534, "epoch": 2.722158009442154, "grad_norm": 0.15325377881526947, "learning_rate": 9.264881773852241e-06, "loss": 0.4539, "mean_token_accuracy": 0.8525349870324135, "num_tokens": 944308268.0, "step": 29587 }, { "entropy": 0.5656623216345906, "epoch": 2.722250015813595, "grad_norm": 0.15836845338344574, "learning_rate": 9.261814947710614e-06, "loss": 0.5501, "mean_token_accuracy": 0.8287531547248363, "num_tokens": 944340683.0, "step": 29588 }, { "entropy": 0.5388770815916359, "epoch": 2.7223420221850363, "grad_norm": 0.1647321730852127, "learning_rate": 9.258748121568989e-06, "loss": 0.5252, "mean_token_accuracy": 0.8346909768879414, "num_tokens": 944372532.0, "step": 29589 }, { "entropy": 0.5045567732304335, "epoch": 2.7224340285564774, "grad_norm": 0.16110534965991974, "learning_rate": 9.255681295427362e-06, "loss": 0.4907, "mean_token_accuracy": 0.8453636020421982, "num_tokens": 944403528.0, "step": 29590 }, { "entropy": 0.6255577560514212, "epoch": 2.7225260349279186, "grad_norm": 0.17016375064849854, "learning_rate": 9.252614469285736e-06, "loss": 0.6129, "mean_token_accuracy": 0.8092350289225578, "num_tokens": 944435604.0, "step": 29591 }, { "entropy": 0.5915053673088551, "epoch": 2.72261804129936, "grad_norm": 0.16589447855949402, "learning_rate": 9.249547643144111e-06, "loss": 0.5856, "mean_token_accuracy": 0.8225565254688263, "num_tokens": 944467205.0, "step": 29592 }, { "entropy": 0.523325590416789, "epoch": 2.7227100476708013, "grad_norm": 0.15910154581069946, "learning_rate": 9.246480817002484e-06, "loss": 0.5154, "mean_token_accuracy": 0.834106270223856, "num_tokens": 944499065.0, "step": 29593 }, { "entropy": 0.5059903683140874, "epoch": 2.7228020540422424, "grad_norm": 0.1624099761247635, "learning_rate": 9.243413990860859e-06, "loss": 0.4904, "mean_token_accuracy": 0.8406122997403145, "num_tokens": 944530718.0, "step": 29594 }, { "entropy": 0.6068455390632153, "epoch": 2.7228940604136835, "grad_norm": 0.17373625934123993, "learning_rate": 9.240347164719232e-06, "loss": 0.603, "mean_token_accuracy": 0.8137147463858128, "num_tokens": 944562284.0, "step": 29595 }, { "entropy": 0.544063737615943, "epoch": 2.7229860667851247, "grad_norm": 0.16134260594844818, "learning_rate": 9.237280338577608e-06, "loss": 0.5419, "mean_token_accuracy": 0.8275137208402157, "num_tokens": 944594764.0, "step": 29596 }, { "entropy": 0.5224260212853551, "epoch": 2.7230780731565662, "grad_norm": 0.15844261646270752, "learning_rate": 9.234213512435981e-06, "loss": 0.5108, "mean_token_accuracy": 0.8368390649557114, "num_tokens": 944627206.0, "step": 29597 }, { "entropy": 0.491854777559638, "epoch": 2.7231700795280074, "grad_norm": 0.1501895934343338, "learning_rate": 9.231146686294356e-06, "loss": 0.476, "mean_token_accuracy": 0.8496314324438572, "num_tokens": 944658837.0, "step": 29598 }, { "entropy": 0.4588767299428582, "epoch": 2.7232620858994485, "grad_norm": 0.15485963225364685, "learning_rate": 9.228079860152729e-06, "loss": 0.4429, "mean_token_accuracy": 0.857433658093214, "num_tokens": 944690246.0, "step": 29599 }, { "entropy": 0.5965428585186601, "epoch": 2.7233540922708896, "grad_norm": 0.16626432538032532, "learning_rate": 9.225013034011103e-06, "loss": 0.5922, "mean_token_accuracy": 0.8124168515205383, "num_tokens": 944722496.0, "step": 29600 }, { "entropy": 0.5655619772151113, "epoch": 2.723446098642331, "grad_norm": 0.16734246909618378, "learning_rate": 9.221946207869476e-06, "loss": 0.5595, "mean_token_accuracy": 0.8255213685333729, "num_tokens": 944754982.0, "step": 29601 }, { "entropy": 0.4914613279979676, "epoch": 2.7235381050137724, "grad_norm": 0.1506175696849823, "learning_rate": 9.21887938172785e-06, "loss": 0.4798, "mean_token_accuracy": 0.8513742946088314, "num_tokens": 944787349.0, "step": 29602 }, { "entropy": 0.5020689582452178, "epoch": 2.7236301113852135, "grad_norm": 0.15416616201400757, "learning_rate": 9.215812555586224e-06, "loss": 0.487, "mean_token_accuracy": 0.8413862995803356, "num_tokens": 944819557.0, "step": 29603 }, { "entropy": 0.47908373083919287, "epoch": 2.7237221177566546, "grad_norm": 0.16314207017421722, "learning_rate": 9.212745729444598e-06, "loss": 0.4582, "mean_token_accuracy": 0.8527943715453148, "num_tokens": 944850638.0, "step": 29604 }, { "entropy": 0.5113273030146956, "epoch": 2.7238141241280958, "grad_norm": 0.1660563200712204, "learning_rate": 9.209678903302971e-06, "loss": 0.5137, "mean_token_accuracy": 0.8379736989736557, "num_tokens": 944882466.0, "step": 29605 }, { "entropy": 0.5325425281189382, "epoch": 2.723906130499537, "grad_norm": 0.15420767664909363, "learning_rate": 9.206612077161346e-06, "loss": 0.5128, "mean_token_accuracy": 0.8374937959015369, "num_tokens": 944914196.0, "step": 29606 }, { "entropy": 0.4571570996195078, "epoch": 2.7239981368709785, "grad_norm": 0.1509828418493271, "learning_rate": 9.20354525101972e-06, "loss": 0.4512, "mean_token_accuracy": 0.8560076467692852, "num_tokens": 944946570.0, "step": 29607 }, { "entropy": 0.5470130164176226, "epoch": 2.7240901432424196, "grad_norm": 0.17037256062030792, "learning_rate": 9.200478424878094e-06, "loss": 0.5442, "mean_token_accuracy": 0.8284795470535755, "num_tokens": 944978870.0, "step": 29608 }, { "entropy": 0.5072325430810452, "epoch": 2.7241821496138607, "grad_norm": 0.15575610101222992, "learning_rate": 9.197411598736468e-06, "loss": 0.4863, "mean_token_accuracy": 0.8434260450303555, "num_tokens": 945010766.0, "step": 29609 }, { "entropy": 0.5017226468771696, "epoch": 2.724274155985302, "grad_norm": 0.16015559434890747, "learning_rate": 9.194344772594841e-06, "loss": 0.4946, "mean_token_accuracy": 0.8427359834313393, "num_tokens": 945043046.0, "step": 29610 }, { "entropy": 0.4881234308704734, "epoch": 2.724366162356743, "grad_norm": 0.1513863056898117, "learning_rate": 9.191277946453216e-06, "loss": 0.4727, "mean_token_accuracy": 0.8514093048870564, "num_tokens": 945075707.0, "step": 29611 }, { "entropy": 0.5280466098338366, "epoch": 2.7244581687281846, "grad_norm": 0.15362980961799622, "learning_rate": 9.18821112031159e-06, "loss": 0.5106, "mean_token_accuracy": 0.8383424244821072, "num_tokens": 945107495.0, "step": 29612 }, { "entropy": 0.5880910232663155, "epoch": 2.7245501750996257, "grad_norm": 0.1752110868692398, "learning_rate": 9.185144294169965e-06, "loss": 0.5764, "mean_token_accuracy": 0.8172674663364887, "num_tokens": 945138147.0, "step": 29613 }, { "entropy": 0.5487697292119265, "epoch": 2.724642181471067, "grad_norm": 0.16463971138000488, "learning_rate": 9.182077468028338e-06, "loss": 0.5333, "mean_token_accuracy": 0.8296995311975479, "num_tokens": 945169287.0, "step": 29614 }, { "entropy": 0.4627640414983034, "epoch": 2.724734187842508, "grad_norm": 0.15024037659168243, "learning_rate": 9.179010641886713e-06, "loss": 0.4444, "mean_token_accuracy": 0.8637184426188469, "num_tokens": 945201197.0, "step": 29615 }, { "entropy": 0.5321301613003016, "epoch": 2.724826194213949, "grad_norm": 0.15857335925102234, "learning_rate": 9.175943815745086e-06, "loss": 0.5095, "mean_token_accuracy": 0.8351636305451393, "num_tokens": 945233144.0, "step": 29616 }, { "entropy": 0.46153287030756474, "epoch": 2.7249182005853907, "grad_norm": 0.15090329945087433, "learning_rate": 9.17287698960346e-06, "loss": 0.4513, "mean_token_accuracy": 0.8557507693767548, "num_tokens": 945265662.0, "step": 29617 }, { "entropy": 0.6073259972035885, "epoch": 2.725010206956832, "grad_norm": 0.17131538689136505, "learning_rate": 9.169810163461833e-06, "loss": 0.5914, "mean_token_accuracy": 0.811681654304266, "num_tokens": 945298231.0, "step": 29618 }, { "entropy": 0.5692326985299587, "epoch": 2.725102213328273, "grad_norm": 0.16512183845043182, "learning_rate": 9.166743337320208e-06, "loss": 0.5608, "mean_token_accuracy": 0.8208355270326138, "num_tokens": 945330743.0, "step": 29619 }, { "entropy": 0.5473707169294357, "epoch": 2.725194219699714, "grad_norm": 0.16075965762138367, "learning_rate": 9.163676511178581e-06, "loss": 0.5305, "mean_token_accuracy": 0.831938125193119, "num_tokens": 945362362.0, "step": 29620 }, { "entropy": 0.5730983943212777, "epoch": 2.7252862260711552, "grad_norm": 0.16847656667232513, "learning_rate": 9.160609685036956e-06, "loss": 0.5705, "mean_token_accuracy": 0.8205975592136383, "num_tokens": 945394498.0, "step": 29621 }, { "entropy": 0.4838448923546821, "epoch": 2.725378232442597, "grad_norm": 0.1524457037448883, "learning_rate": 9.15754285889533e-06, "loss": 0.4586, "mean_token_accuracy": 0.8515657186508179, "num_tokens": 945425241.0, "step": 29622 }, { "entropy": 0.5278131365776062, "epoch": 2.725470238814038, "grad_norm": 0.15466158092021942, "learning_rate": 9.154476032753703e-06, "loss": 0.5244, "mean_token_accuracy": 0.8332024626433849, "num_tokens": 945457275.0, "step": 29623 }, { "entropy": 0.5265529118478298, "epoch": 2.725562245185479, "grad_norm": 0.16076140105724335, "learning_rate": 9.151409206612078e-06, "loss": 0.5201, "mean_token_accuracy": 0.8349849097430706, "num_tokens": 945488933.0, "step": 29624 }, { "entropy": 0.5538908811286092, "epoch": 2.72565425155692, "grad_norm": 0.1656368374824524, "learning_rate": 9.14834238047045e-06, "loss": 0.5493, "mean_token_accuracy": 0.8297204710543156, "num_tokens": 945521173.0, "step": 29625 }, { "entropy": 0.5572622418403625, "epoch": 2.7257462579283613, "grad_norm": 0.16058403253555298, "learning_rate": 9.145275554328825e-06, "loss": 0.5467, "mean_token_accuracy": 0.8299688287079334, "num_tokens": 945553490.0, "step": 29626 }, { "entropy": 0.4449320264393464, "epoch": 2.725838264299803, "grad_norm": 0.14714503288269043, "learning_rate": 9.1422087281872e-06, "loss": 0.435, "mean_token_accuracy": 0.8646619133651257, "num_tokens": 945585898.0, "step": 29627 }, { "entropy": 0.4982102755457163, "epoch": 2.725930270671244, "grad_norm": 0.15423038601875305, "learning_rate": 9.139141902045575e-06, "loss": 0.4848, "mean_token_accuracy": 0.8454103618860245, "num_tokens": 945617259.0, "step": 29628 }, { "entropy": 0.4518044125288725, "epoch": 2.726022277042685, "grad_norm": 0.150223970413208, "learning_rate": 9.136075075903948e-06, "loss": 0.4335, "mean_token_accuracy": 0.8599684461951256, "num_tokens": 945649886.0, "step": 29629 }, { "entropy": 0.562741881236434, "epoch": 2.7261142834141263, "grad_norm": 0.16020908951759338, "learning_rate": 9.133008249762322e-06, "loss": 0.5402, "mean_token_accuracy": 0.8319278582930565, "num_tokens": 945682343.0, "step": 29630 }, { "entropy": 0.5059346472844481, "epoch": 2.7262062897855674, "grad_norm": 0.1632010042667389, "learning_rate": 9.129941423620695e-06, "loss": 0.495, "mean_token_accuracy": 0.837911743670702, "num_tokens": 945713081.0, "step": 29631 }, { "entropy": 0.48245511669665575, "epoch": 2.726298296157009, "grad_norm": 0.15377482771873474, "learning_rate": 9.12687459747907e-06, "loss": 0.4662, "mean_token_accuracy": 0.8501903712749481, "num_tokens": 945744629.0, "step": 29632 }, { "entropy": 0.6072153551504016, "epoch": 2.72639030252845, "grad_norm": 0.17108480632305145, "learning_rate": 9.123807771337443e-06, "loss": 0.6005, "mean_token_accuracy": 0.8114023245871067, "num_tokens": 945776271.0, "step": 29633 }, { "entropy": 0.4780431610997766, "epoch": 2.7264823088998913, "grad_norm": 0.1555602103471756, "learning_rate": 9.120740945195817e-06, "loss": 0.4669, "mean_token_accuracy": 0.8521171994507313, "num_tokens": 945807731.0, "step": 29634 }, { "entropy": 0.5444823000580072, "epoch": 2.7265743152713324, "grad_norm": 0.1612011343240738, "learning_rate": 9.11767411905419e-06, "loss": 0.527, "mean_token_accuracy": 0.8308761194348335, "num_tokens": 945839498.0, "step": 29635 }, { "entropy": 0.4331234690034762, "epoch": 2.7266663216427736, "grad_norm": 0.15041349828243256, "learning_rate": 9.114607292912565e-06, "loss": 0.4197, "mean_token_accuracy": 0.8628703095018864, "num_tokens": 945871037.0, "step": 29636 }, { "entropy": 0.4784895800985396, "epoch": 2.726758328014215, "grad_norm": 0.15221376717090607, "learning_rate": 9.11154046677094e-06, "loss": 0.4635, "mean_token_accuracy": 0.8526449277997017, "num_tokens": 945902837.0, "step": 29637 }, { "entropy": 0.5712425988167524, "epoch": 2.7268503343856563, "grad_norm": 0.1692131608724594, "learning_rate": 9.108473640629313e-06, "loss": 0.5567, "mean_token_accuracy": 0.8232521563768387, "num_tokens": 945933572.0, "step": 29638 }, { "entropy": 0.5125413937494159, "epoch": 2.7269423407570974, "grad_norm": 0.15870437026023865, "learning_rate": 9.105406814487687e-06, "loss": 0.5094, "mean_token_accuracy": 0.8373524993658066, "num_tokens": 945965234.0, "step": 29639 }, { "entropy": 0.35252045025117695, "epoch": 2.7270343471285385, "grad_norm": 0.13403166830539703, "learning_rate": 9.10233998834606e-06, "loss": 0.3363, "mean_token_accuracy": 0.8886059559881687, "num_tokens": 945997383.0, "step": 29640 }, { "entropy": 0.5206352174282074, "epoch": 2.7271263534999797, "grad_norm": 0.15982162952423096, "learning_rate": 9.099273162204435e-06, "loss": 0.5183, "mean_token_accuracy": 0.8346998505294323, "num_tokens": 946029761.0, "step": 29641 }, { "entropy": 0.5015395674854517, "epoch": 2.7272183598714212, "grad_norm": 0.15844011306762695, "learning_rate": 9.09620633606281e-06, "loss": 0.4964, "mean_token_accuracy": 0.8426038324832916, "num_tokens": 946061123.0, "step": 29642 }, { "entropy": 0.46899318508803844, "epoch": 2.7273103662428624, "grad_norm": 0.1528700590133667, "learning_rate": 9.093139509921184e-06, "loss": 0.4531, "mean_token_accuracy": 0.856156513094902, "num_tokens": 946092597.0, "step": 29643 }, { "entropy": 0.6497541591525078, "epoch": 2.7274023726143035, "grad_norm": 0.1736035943031311, "learning_rate": 9.090072683779557e-06, "loss": 0.6428, "mean_token_accuracy": 0.7998178713023663, "num_tokens": 946124500.0, "step": 29644 }, { "entropy": 0.4862982486374676, "epoch": 2.7274943789857446, "grad_norm": 0.14830432832241058, "learning_rate": 9.087005857637932e-06, "loss": 0.4653, "mean_token_accuracy": 0.8542132005095482, "num_tokens": 946157012.0, "step": 29645 }, { "entropy": 0.4169713295996189, "epoch": 2.727586385357186, "grad_norm": 0.1404447853565216, "learning_rate": 9.083939031496305e-06, "loss": 0.407, "mean_token_accuracy": 0.8699168264865875, "num_tokens": 946189708.0, "step": 29646 }, { "entropy": 0.3984082117676735, "epoch": 2.7276783917286274, "grad_norm": 0.14666955173015594, "learning_rate": 9.08087220535468e-06, "loss": 0.391, "mean_token_accuracy": 0.8751269020140171, "num_tokens": 946221238.0, "step": 29647 }, { "entropy": 0.562229766510427, "epoch": 2.7277703981000685, "grad_norm": 0.16269834339618683, "learning_rate": 9.077805379213052e-06, "loss": 0.5563, "mean_token_accuracy": 0.8216497376561165, "num_tokens": 946253696.0, "step": 29648 }, { "entropy": 0.5213762372732162, "epoch": 2.7278624044715096, "grad_norm": 0.15899838507175446, "learning_rate": 9.074738553071427e-06, "loss": 0.5101, "mean_token_accuracy": 0.8374737501144409, "num_tokens": 946285837.0, "step": 29649 }, { "entropy": 0.5038363942876458, "epoch": 2.7279544108429508, "grad_norm": 0.15644441545009613, "learning_rate": 9.0716717269298e-06, "loss": 0.4972, "mean_token_accuracy": 0.8448715135455132, "num_tokens": 946318208.0, "step": 29650 }, { "entropy": 0.5465747127309442, "epoch": 2.728046417214392, "grad_norm": 0.15730251371860504, "learning_rate": 9.068604900788175e-06, "loss": 0.5251, "mean_token_accuracy": 0.833989854902029, "num_tokens": 946350432.0, "step": 29651 }, { "entropy": 0.4940732913091779, "epoch": 2.7281384235858335, "grad_norm": 0.15579551458358765, "learning_rate": 9.06553807464655e-06, "loss": 0.4734, "mean_token_accuracy": 0.8458579108119011, "num_tokens": 946382463.0, "step": 29652 }, { "entropy": 0.4700454145204276, "epoch": 2.7282304299572746, "grad_norm": 0.15088273584842682, "learning_rate": 9.062471248504922e-06, "loss": 0.4486, "mean_token_accuracy": 0.857672818005085, "num_tokens": 946414123.0, "step": 29653 }, { "entropy": 0.46988254878669977, "epoch": 2.7283224363287157, "grad_norm": 0.15839172899723053, "learning_rate": 9.059404422363297e-06, "loss": 0.4644, "mean_token_accuracy": 0.8489965088665485, "num_tokens": 946446267.0, "step": 29654 }, { "entropy": 0.5595105644315481, "epoch": 2.728414442700157, "grad_norm": 0.16320227086544037, "learning_rate": 9.05633759622167e-06, "loss": 0.5568, "mean_token_accuracy": 0.824364498257637, "num_tokens": 946478989.0, "step": 29655 }, { "entropy": 0.510800359188579, "epoch": 2.728506449071598, "grad_norm": 0.15667425096035004, "learning_rate": 9.053270770080044e-06, "loss": 0.4986, "mean_token_accuracy": 0.8424556478857994, "num_tokens": 946511122.0, "step": 29656 }, { "entropy": 0.557733491063118, "epoch": 2.7285984554430396, "grad_norm": 0.16074101626873016, "learning_rate": 9.050203943938419e-06, "loss": 0.5474, "mean_token_accuracy": 0.8256632536649704, "num_tokens": 946542930.0, "step": 29657 }, { "entropy": 0.45842165779322386, "epoch": 2.7286904618144807, "grad_norm": 0.1572568416595459, "learning_rate": 9.047137117796794e-06, "loss": 0.4568, "mean_token_accuracy": 0.8554851375520229, "num_tokens": 946574861.0, "step": 29658 }, { "entropy": 0.5045018158853054, "epoch": 2.728782468185922, "grad_norm": 0.1541786640882492, "learning_rate": 9.044070291655167e-06, "loss": 0.4994, "mean_token_accuracy": 0.8425640724599361, "num_tokens": 946607550.0, "step": 29659 }, { "entropy": 0.5821663793176413, "epoch": 2.728874474557363, "grad_norm": 0.17253249883651733, "learning_rate": 9.041003465513541e-06, "loss": 0.5712, "mean_token_accuracy": 0.8220116570591927, "num_tokens": 946637746.0, "step": 29660 }, { "entropy": 0.48069442715495825, "epoch": 2.728966480928804, "grad_norm": 0.15614914894104004, "learning_rate": 9.037936639371914e-06, "loss": 0.4685, "mean_token_accuracy": 0.8524994738399982, "num_tokens": 946670148.0, "step": 29661 }, { "entropy": 0.5232077967375517, "epoch": 2.7290584873002457, "grad_norm": 0.1619570404291153, "learning_rate": 9.034869813230289e-06, "loss": 0.5108, "mean_token_accuracy": 0.836569469422102, "num_tokens": 946701665.0, "step": 29662 }, { "entropy": 0.5841966653242707, "epoch": 2.729150493671687, "grad_norm": 0.17451192438602448, "learning_rate": 9.031802987088662e-06, "loss": 0.5757, "mean_token_accuracy": 0.8168530464172363, "num_tokens": 946733960.0, "step": 29663 }, { "entropy": 0.5330538162961602, "epoch": 2.729242500043128, "grad_norm": 0.16109608113765717, "learning_rate": 9.028736160947037e-06, "loss": 0.5259, "mean_token_accuracy": 0.835358053445816, "num_tokens": 946765523.0, "step": 29664 }, { "entropy": 0.5015799840912223, "epoch": 2.729334506414569, "grad_norm": 0.16183944046497345, "learning_rate": 9.02566933480541e-06, "loss": 0.4935, "mean_token_accuracy": 0.8453164398670197, "num_tokens": 946796982.0, "step": 29665 }, { "entropy": 0.531371034681797, "epoch": 2.7294265127860102, "grad_norm": 0.16691473126411438, "learning_rate": 9.022602508663784e-06, "loss": 0.5212, "mean_token_accuracy": 0.8338959142565727, "num_tokens": 946828652.0, "step": 29666 }, { "entropy": 0.5451765488833189, "epoch": 2.729518519157452, "grad_norm": 0.16108354926109314, "learning_rate": 9.019535682522159e-06, "loss": 0.5337, "mean_token_accuracy": 0.8278539553284645, "num_tokens": 946860336.0, "step": 29667 }, { "entropy": 0.4484567269682884, "epoch": 2.729610525528893, "grad_norm": 0.1560751050710678, "learning_rate": 9.016468856380532e-06, "loss": 0.4324, "mean_token_accuracy": 0.8569641783833504, "num_tokens": 946891521.0, "step": 29668 }, { "entropy": 0.6048677014186978, "epoch": 2.729702531900334, "grad_norm": 0.16965310275554657, "learning_rate": 9.013402030238906e-06, "loss": 0.5828, "mean_token_accuracy": 0.813883937895298, "num_tokens": 946923435.0, "step": 29669 }, { "entropy": 0.4610969563946128, "epoch": 2.729794538271775, "grad_norm": 0.15348432958126068, "learning_rate": 9.01033520409728e-06, "loss": 0.4493, "mean_token_accuracy": 0.8568824604153633, "num_tokens": 946955245.0, "step": 29670 }, { "entropy": 0.5938501637428999, "epoch": 2.7298865446432163, "grad_norm": 0.1730017364025116, "learning_rate": 9.007268377955654e-06, "loss": 0.5847, "mean_token_accuracy": 0.8161864876747131, "num_tokens": 946986355.0, "step": 29671 }, { "entropy": 0.5165241155773401, "epoch": 2.729978551014658, "grad_norm": 0.16181670129299164, "learning_rate": 9.004201551814027e-06, "loss": 0.5057, "mean_token_accuracy": 0.8407588787376881, "num_tokens": 947018350.0, "step": 29672 }, { "entropy": 0.495699810795486, "epoch": 2.730070557386099, "grad_norm": 0.15789002180099487, "learning_rate": 9.001134725672403e-06, "loss": 0.4916, "mean_token_accuracy": 0.8454557582736015, "num_tokens": 947050453.0, "step": 29673 }, { "entropy": 0.5260754683986306, "epoch": 2.73016256375754, "grad_norm": 0.16036228835582733, "learning_rate": 8.998067899530776e-06, "loss": 0.518, "mean_token_accuracy": 0.8372959047555923, "num_tokens": 947082309.0, "step": 29674 }, { "entropy": 0.5182987693697214, "epoch": 2.7302545701289813, "grad_norm": 0.16141530871391296, "learning_rate": 8.995001073389151e-06, "loss": 0.5007, "mean_token_accuracy": 0.8398929722607136, "num_tokens": 947113178.0, "step": 29675 }, { "entropy": 0.4182682844111696, "epoch": 2.7303465765004225, "grad_norm": 0.1494060605764389, "learning_rate": 8.991934247247524e-06, "loss": 0.413, "mean_token_accuracy": 0.8691479079425335, "num_tokens": 947144560.0, "step": 29676 }, { "entropy": 0.48311814945191145, "epoch": 2.730438582871864, "grad_norm": 0.15918053686618805, "learning_rate": 8.988867421105899e-06, "loss": 0.4799, "mean_token_accuracy": 0.8507554158568382, "num_tokens": 947176264.0, "step": 29677 }, { "entropy": 0.5889873504638672, "epoch": 2.730530589243305, "grad_norm": 0.17376001179218292, "learning_rate": 8.985800594964271e-06, "loss": 0.6019, "mean_token_accuracy": 0.8137708567082882, "num_tokens": 947208141.0, "step": 29678 }, { "entropy": 0.4593990119174123, "epoch": 2.7306225956147463, "grad_norm": 0.15310770273208618, "learning_rate": 8.982733768822646e-06, "loss": 0.4576, "mean_token_accuracy": 0.8534647934138775, "num_tokens": 947240117.0, "step": 29679 }, { "entropy": 0.5318596782162786, "epoch": 2.7307146019861874, "grad_norm": 0.16113431751728058, "learning_rate": 8.979666942681019e-06, "loss": 0.5141, "mean_token_accuracy": 0.8378210179507732, "num_tokens": 947272221.0, "step": 29680 }, { "entropy": 0.5062451157718897, "epoch": 2.7308066083576286, "grad_norm": 0.15780429542064667, "learning_rate": 8.976600116539394e-06, "loss": 0.4927, "mean_token_accuracy": 0.84061698615551, "num_tokens": 947304364.0, "step": 29681 }, { "entropy": 0.47126693185418844, "epoch": 2.73089861472907, "grad_norm": 0.15135739743709564, "learning_rate": 8.973533290397768e-06, "loss": 0.4565, "mean_token_accuracy": 0.853811539709568, "num_tokens": 947336197.0, "step": 29682 }, { "entropy": 0.4164144368842244, "epoch": 2.7309906211005113, "grad_norm": 0.14283674955368042, "learning_rate": 8.970466464256141e-06, "loss": 0.4026, "mean_token_accuracy": 0.8748201839625835, "num_tokens": 947368799.0, "step": 29683 }, { "entropy": 0.5494669992476702, "epoch": 2.7310826274719524, "grad_norm": 0.15570317208766937, "learning_rate": 8.967399638114516e-06, "loss": 0.5372, "mean_token_accuracy": 0.8330225273966789, "num_tokens": 947400484.0, "step": 29684 }, { "entropy": 0.5498641487210989, "epoch": 2.7311746338433935, "grad_norm": 0.16060389578342438, "learning_rate": 8.964332811972889e-06, "loss": 0.534, "mean_token_accuracy": 0.8328036516904831, "num_tokens": 947433111.0, "step": 29685 }, { "entropy": 0.48224139027297497, "epoch": 2.7312666402148347, "grad_norm": 0.1510043740272522, "learning_rate": 8.961265985831264e-06, "loss": 0.4634, "mean_token_accuracy": 0.8531440570950508, "num_tokens": 947465411.0, "step": 29686 }, { "entropy": 0.5464857313781977, "epoch": 2.7313586465862763, "grad_norm": 0.16498233377933502, "learning_rate": 8.958199159689637e-06, "loss": 0.5376, "mean_token_accuracy": 0.8303550258278847, "num_tokens": 947497526.0, "step": 29687 }, { "entropy": 0.5220046187750995, "epoch": 2.7314506529577174, "grad_norm": 0.16038405895233154, "learning_rate": 8.955132333548013e-06, "loss": 0.5042, "mean_token_accuracy": 0.8392077796161175, "num_tokens": 947529408.0, "step": 29688 }, { "entropy": 0.409396936185658, "epoch": 2.7315426593291585, "grad_norm": 0.14925898611545563, "learning_rate": 8.952065507406386e-06, "loss": 0.3949, "mean_token_accuracy": 0.8723459765315056, "num_tokens": 947561748.0, "step": 29689 }, { "entropy": 0.5248338924720883, "epoch": 2.7316346657005997, "grad_norm": 0.1570858657360077, "learning_rate": 8.94899868126476e-06, "loss": 0.5124, "mean_token_accuracy": 0.839169554412365, "num_tokens": 947593682.0, "step": 29690 }, { "entropy": 0.5638986201956868, "epoch": 2.731726672072041, "grad_norm": 0.16075275838375092, "learning_rate": 8.945931855123133e-06, "loss": 0.5559, "mean_token_accuracy": 0.8248899355530739, "num_tokens": 947625926.0, "step": 29691 }, { "entropy": 0.5168521133018658, "epoch": 2.7318186784434824, "grad_norm": 0.16104188561439514, "learning_rate": 8.942865028981508e-06, "loss": 0.4989, "mean_token_accuracy": 0.840355034917593, "num_tokens": 947657644.0, "step": 29692 }, { "entropy": 0.45424635522067547, "epoch": 2.7319106848149235, "grad_norm": 0.14881649613380432, "learning_rate": 8.939798202839881e-06, "loss": 0.4339, "mean_token_accuracy": 0.8614268526434898, "num_tokens": 947689799.0, "step": 29693 }, { "entropy": 0.49677198752760887, "epoch": 2.7320026911863646, "grad_norm": 0.1588214933872223, "learning_rate": 8.936731376698256e-06, "loss": 0.491, "mean_token_accuracy": 0.8431148529052734, "num_tokens": 947721957.0, "step": 29694 }, { "entropy": 0.42685484304092824, "epoch": 2.7320946975578058, "grad_norm": 0.14598415791988373, "learning_rate": 8.933664550556629e-06, "loss": 0.4119, "mean_token_accuracy": 0.8723443262279034, "num_tokens": 947754565.0, "step": 29695 }, { "entropy": 0.5363648477941751, "epoch": 2.732186703929247, "grad_norm": 0.16256003081798553, "learning_rate": 8.930597724415003e-06, "loss": 0.5308, "mean_token_accuracy": 0.8335241340100765, "num_tokens": 947786647.0, "step": 29696 }, { "entropy": 0.4372754734940827, "epoch": 2.7322787103006885, "grad_norm": 0.14441999793052673, "learning_rate": 8.927530898273378e-06, "loss": 0.4227, "mean_token_accuracy": 0.8667516298592091, "num_tokens": 947818660.0, "step": 29697 }, { "entropy": 0.5185881545767188, "epoch": 2.7323707166721296, "grad_norm": 0.1609731912612915, "learning_rate": 8.924464072131751e-06, "loss": 0.4922, "mean_token_accuracy": 0.842311929911375, "num_tokens": 947850516.0, "step": 29698 }, { "entropy": 0.5564189217984676, "epoch": 2.7324627230435707, "grad_norm": 0.16546325385570526, "learning_rate": 8.921397245990126e-06, "loss": 0.5392, "mean_token_accuracy": 0.8290635198354721, "num_tokens": 947882629.0, "step": 29699 }, { "entropy": 0.5391829870641232, "epoch": 2.732554729415012, "grad_norm": 0.16195236146450043, "learning_rate": 8.918330419848498e-06, "loss": 0.5355, "mean_token_accuracy": 0.8347656950354576, "num_tokens": 947914368.0, "step": 29700 }, { "entropy": 0.459289756603539, "epoch": 2.732646735786453, "grad_norm": 0.14544479548931122, "learning_rate": 8.915263593706873e-06, "loss": 0.4453, "mean_token_accuracy": 0.858172569423914, "num_tokens": 947946055.0, "step": 29701 }, { "entropy": 0.4647158104926348, "epoch": 2.7327387421578946, "grad_norm": 0.14549556374549866, "learning_rate": 8.912196767565246e-06, "loss": 0.4487, "mean_token_accuracy": 0.8579197824001312, "num_tokens": 947977532.0, "step": 29702 }, { "entropy": 0.5393298380076885, "epoch": 2.7328307485293357, "grad_norm": 0.16053301095962524, "learning_rate": 8.909129941423622e-06, "loss": 0.5183, "mean_token_accuracy": 0.8374634310603142, "num_tokens": 948010151.0, "step": 29703 }, { "entropy": 0.5600323937833309, "epoch": 2.732922754900777, "grad_norm": 0.1649934947490692, "learning_rate": 8.906063115281995e-06, "loss": 0.5407, "mean_token_accuracy": 0.8272761031985283, "num_tokens": 948041742.0, "step": 29704 }, { "entropy": 0.530765051022172, "epoch": 2.733014761272218, "grad_norm": 0.1632613241672516, "learning_rate": 8.90299628914037e-06, "loss": 0.5248, "mean_token_accuracy": 0.8297032080590725, "num_tokens": 948073687.0, "step": 29705 }, { "entropy": 0.5167020196095109, "epoch": 2.733106767643659, "grad_norm": 0.1519050896167755, "learning_rate": 8.899929462998743e-06, "loss": 0.4902, "mean_token_accuracy": 0.8390440493822098, "num_tokens": 948105012.0, "step": 29706 }, { "entropy": 0.5207621455192566, "epoch": 2.7331987740151007, "grad_norm": 0.1598518341779709, "learning_rate": 8.896862636857118e-06, "loss": 0.5083, "mean_token_accuracy": 0.8392688781023026, "num_tokens": 948136677.0, "step": 29707 }, { "entropy": 0.5559862535446882, "epoch": 2.733290780386542, "grad_norm": 0.16873471438884735, "learning_rate": 8.89379581071549e-06, "loss": 0.5494, "mean_token_accuracy": 0.8279499746859074, "num_tokens": 948168514.0, "step": 29708 }, { "entropy": 0.5025760885328054, "epoch": 2.733382786757983, "grad_norm": 0.15659832954406738, "learning_rate": 8.890728984573865e-06, "loss": 0.4903, "mean_token_accuracy": 0.8440040722489357, "num_tokens": 948201069.0, "step": 29709 }, { "entropy": 0.5077698063105345, "epoch": 2.733474793129424, "grad_norm": 0.1586487889289856, "learning_rate": 8.887662158432238e-06, "loss": 0.4952, "mean_token_accuracy": 0.840911254286766, "num_tokens": 948233226.0, "step": 29710 }, { "entropy": 0.5772319613024592, "epoch": 2.7335667995008652, "grad_norm": 0.16661123931407928, "learning_rate": 8.884595332290613e-06, "loss": 0.5724, "mean_token_accuracy": 0.8208019435405731, "num_tokens": 948265337.0, "step": 29711 }, { "entropy": 0.45450114738196135, "epoch": 2.733658805872307, "grad_norm": 0.15197837352752686, "learning_rate": 8.881528506148987e-06, "loss": 0.4342, "mean_token_accuracy": 0.8555973283946514, "num_tokens": 948297414.0, "step": 29712 }, { "entropy": 0.46844939794391394, "epoch": 2.733750812243748, "grad_norm": 0.1582678109407425, "learning_rate": 8.87846168000736e-06, "loss": 0.4591, "mean_token_accuracy": 0.8543141931295395, "num_tokens": 948329132.0, "step": 29713 }, { "entropy": 0.3771265564719215, "epoch": 2.733842818615189, "grad_norm": 0.1443898230791092, "learning_rate": 8.875394853865735e-06, "loss": 0.3666, "mean_token_accuracy": 0.8809162527322769, "num_tokens": 948360728.0, "step": 29714 }, { "entropy": 0.6520879659801722, "epoch": 2.73393482498663, "grad_norm": 0.17005608975887299, "learning_rate": 8.872328027724108e-06, "loss": 0.6401, "mean_token_accuracy": 0.8012840338051319, "num_tokens": 948393377.0, "step": 29715 }, { "entropy": 0.4702159631997347, "epoch": 2.7340268313580713, "grad_norm": 0.15159469842910767, "learning_rate": 8.869261201582483e-06, "loss": 0.4636, "mean_token_accuracy": 0.8519427888095379, "num_tokens": 948425208.0, "step": 29716 }, { "entropy": 0.5341153517365456, "epoch": 2.734118837729513, "grad_norm": 0.16582848131656647, "learning_rate": 8.866194375440856e-06, "loss": 0.5348, "mean_token_accuracy": 0.833034098148346, "num_tokens": 948457256.0, "step": 29717 }, { "entropy": 0.48267011693678796, "epoch": 2.734210844100954, "grad_norm": 0.1558607965707779, "learning_rate": 8.863127549299232e-06, "loss": 0.4716, "mean_token_accuracy": 0.8520090505480766, "num_tokens": 948489426.0, "step": 29718 }, { "entropy": 0.5500828567892313, "epoch": 2.734302850472395, "grad_norm": 0.16568076610565186, "learning_rate": 8.860060723157605e-06, "loss": 0.5452, "mean_token_accuracy": 0.8298346325755119, "num_tokens": 948521468.0, "step": 29719 }, { "entropy": 0.49002915155142546, "epoch": 2.7343948568438363, "grad_norm": 0.15762795507907867, "learning_rate": 8.85699389701598e-06, "loss": 0.48, "mean_token_accuracy": 0.8458360284566879, "num_tokens": 948552965.0, "step": 29720 }, { "entropy": 0.40952274575829506, "epoch": 2.7344868632152775, "grad_norm": 0.14609012007713318, "learning_rate": 8.853927070874353e-06, "loss": 0.393, "mean_token_accuracy": 0.8705171756446362, "num_tokens": 948583929.0, "step": 29721 }, { "entropy": 0.5015375185757875, "epoch": 2.734578869586719, "grad_norm": 0.15915794670581818, "learning_rate": 8.850860244732727e-06, "loss": 0.4849, "mean_token_accuracy": 0.8454880453646183, "num_tokens": 948615379.0, "step": 29722 }, { "entropy": 0.5630862824618816, "epoch": 2.73467087595816, "grad_norm": 0.162466898560524, "learning_rate": 8.8477934185911e-06, "loss": 0.5508, "mean_token_accuracy": 0.8244043663144112, "num_tokens": 948646975.0, "step": 29723 }, { "entropy": 0.4876579977571964, "epoch": 2.7347628823296013, "grad_norm": 0.15589261054992676, "learning_rate": 8.844726592449475e-06, "loss": 0.472, "mean_token_accuracy": 0.8480603136122227, "num_tokens": 948678070.0, "step": 29724 }, { "entropy": 0.50002544245217, "epoch": 2.7348548887010424, "grad_norm": 0.15871009230613708, "learning_rate": 8.841659766307848e-06, "loss": 0.4941, "mean_token_accuracy": 0.8414862640202045, "num_tokens": 948710174.0, "step": 29725 }, { "entropy": 0.6030991058796644, "epoch": 2.7349468950724836, "grad_norm": 0.16913099586963654, "learning_rate": 8.838592940166222e-06, "loss": 0.5899, "mean_token_accuracy": 0.8122539035975933, "num_tokens": 948742458.0, "step": 29726 }, { "entropy": 0.5123933907598257, "epoch": 2.735038901443925, "grad_norm": 0.16436265408992767, "learning_rate": 8.835526114024597e-06, "loss": 0.5059, "mean_token_accuracy": 0.8403882943093777, "num_tokens": 948773664.0, "step": 29727 }, { "entropy": 0.45256040059030056, "epoch": 2.7351309078153663, "grad_norm": 0.15249809622764587, "learning_rate": 8.83245928788297e-06, "loss": 0.4489, "mean_token_accuracy": 0.8579544834792614, "num_tokens": 948805838.0, "step": 29728 }, { "entropy": 0.5103991902433336, "epoch": 2.7352229141868074, "grad_norm": 0.16238893568515778, "learning_rate": 8.829392461741345e-06, "loss": 0.5022, "mean_token_accuracy": 0.8418130576610565, "num_tokens": 948837268.0, "step": 29729 }, { "entropy": 0.43892902962397784, "epoch": 2.7353149205582485, "grad_norm": 0.15477997064590454, "learning_rate": 8.826325635599718e-06, "loss": 0.4263, "mean_token_accuracy": 0.8634524047374725, "num_tokens": 948867680.0, "step": 29730 }, { "entropy": 0.4813126539811492, "epoch": 2.7354069269296897, "grad_norm": 0.14998285472393036, "learning_rate": 8.823258809458092e-06, "loss": 0.4673, "mean_token_accuracy": 0.8549396209418774, "num_tokens": 948899795.0, "step": 29731 }, { "entropy": 0.6173803005367517, "epoch": 2.7354989333011313, "grad_norm": 0.17155764997005463, "learning_rate": 8.820191983316465e-06, "loss": 0.6076, "mean_token_accuracy": 0.8072191029787064, "num_tokens": 948931325.0, "step": 29732 }, { "entropy": 0.5580280935391784, "epoch": 2.7355909396725724, "grad_norm": 0.1617814302444458, "learning_rate": 8.81712515717484e-06, "loss": 0.5431, "mean_token_accuracy": 0.8296086937189102, "num_tokens": 948963407.0, "step": 29733 }, { "entropy": 0.5761484047397971, "epoch": 2.7356829460440135, "grad_norm": 0.17121823132038116, "learning_rate": 8.814058331033214e-06, "loss": 0.5673, "mean_token_accuracy": 0.8189651221036911, "num_tokens": 948994867.0, "step": 29734 }, { "entropy": 0.6046598041430116, "epoch": 2.7357749524154547, "grad_norm": 0.17239098250865936, "learning_rate": 8.810991504891589e-06, "loss": 0.6005, "mean_token_accuracy": 0.8124038018286228, "num_tokens": 949026360.0, "step": 29735 }, { "entropy": 0.4984410787001252, "epoch": 2.735866958786896, "grad_norm": 0.15488840639591217, "learning_rate": 8.807924678749962e-06, "loss": 0.4841, "mean_token_accuracy": 0.8442746102809906, "num_tokens": 949058164.0, "step": 29736 }, { "entropy": 0.50642299791798, "epoch": 2.7359589651583374, "grad_norm": 0.15562666952610016, "learning_rate": 8.804857852608337e-06, "loss": 0.4975, "mean_token_accuracy": 0.8441889360547066, "num_tokens": 949090743.0, "step": 29737 }, { "entropy": 0.48437863611616194, "epoch": 2.7360509715297785, "grad_norm": 0.15529213845729828, "learning_rate": 8.80179102646671e-06, "loss": 0.4644, "mean_token_accuracy": 0.8497821502387524, "num_tokens": 949122925.0, "step": 29738 }, { "entropy": 0.46888180542737246, "epoch": 2.7361429779012196, "grad_norm": 0.15111590921878815, "learning_rate": 8.798724200325084e-06, "loss": 0.4528, "mean_token_accuracy": 0.8546062186360359, "num_tokens": 949155357.0, "step": 29739 }, { "entropy": 0.4251591460779309, "epoch": 2.7362349842726608, "grad_norm": 0.14615067839622498, "learning_rate": 8.795657374183457e-06, "loss": 0.409, "mean_token_accuracy": 0.8654298968613148, "num_tokens": 949186736.0, "step": 29740 }, { "entropy": 0.566661411896348, "epoch": 2.736326990644102, "grad_norm": 0.1622890681028366, "learning_rate": 8.792590548041832e-06, "loss": 0.5424, "mean_token_accuracy": 0.8301825933158398, "num_tokens": 949218494.0, "step": 29741 }, { "entropy": 0.5251003657467663, "epoch": 2.7364189970155435, "grad_norm": 0.15896426141262054, "learning_rate": 8.789523721900207e-06, "loss": 0.5178, "mean_token_accuracy": 0.8410209305584431, "num_tokens": 949250630.0, "step": 29742 }, { "entropy": 0.5956835187971592, "epoch": 2.7365110033869846, "grad_norm": 0.17447932064533234, "learning_rate": 8.78645689575858e-06, "loss": 0.5851, "mean_token_accuracy": 0.8145308457314968, "num_tokens": 949282223.0, "step": 29743 }, { "entropy": 0.5379074215888977, "epoch": 2.7366030097584257, "grad_norm": 0.15924303233623505, "learning_rate": 8.783390069616954e-06, "loss": 0.5219, "mean_token_accuracy": 0.8364526852965355, "num_tokens": 949313768.0, "step": 29744 }, { "entropy": 0.5110720186494291, "epoch": 2.736695016129867, "grad_norm": 0.15512362122535706, "learning_rate": 8.780323243475327e-06, "loss": 0.4992, "mean_token_accuracy": 0.839885950088501, "num_tokens": 949346111.0, "step": 29745 }, { "entropy": 0.4914244554238394, "epoch": 2.736787022501308, "grad_norm": 0.15787605941295624, "learning_rate": 8.777256417333702e-06, "loss": 0.4868, "mean_token_accuracy": 0.8439326249063015, "num_tokens": 949378086.0, "step": 29746 }, { "entropy": 0.4943243721500039, "epoch": 2.7368790288727496, "grad_norm": 0.15682265162467957, "learning_rate": 8.774189591192075e-06, "loss": 0.487, "mean_token_accuracy": 0.8436163365840912, "num_tokens": 949409738.0, "step": 29747 }, { "entropy": 0.7021925076842308, "epoch": 2.7369710352441907, "grad_norm": 0.18535901606082916, "learning_rate": 8.77112276505045e-06, "loss": 0.6976, "mean_token_accuracy": 0.7822442799806595, "num_tokens": 949440632.0, "step": 29748 }, { "entropy": 0.5078120147809386, "epoch": 2.737063041615632, "grad_norm": 0.15920060873031616, "learning_rate": 8.768055938908824e-06, "loss": 0.4875, "mean_token_accuracy": 0.8448071703314781, "num_tokens": 949472489.0, "step": 29749 }, { "entropy": 0.5278116384288296, "epoch": 2.737155047987073, "grad_norm": 0.19658522307872772, "learning_rate": 8.764989112767199e-06, "loss": 0.5102, "mean_token_accuracy": 0.83689871057868, "num_tokens": 949503865.0, "step": 29750 }, { "entropy": 0.5002274033613503, "epoch": 2.737247054358514, "grad_norm": 0.155319944024086, "learning_rate": 8.761922286625572e-06, "loss": 0.4905, "mean_token_accuracy": 0.846098106354475, "num_tokens": 949535922.0, "step": 29751 }, { "entropy": 0.6396995382383466, "epoch": 2.7373390607299557, "grad_norm": 0.17142027616500854, "learning_rate": 8.758855460483946e-06, "loss": 0.6295, "mean_token_accuracy": 0.8047962598502636, "num_tokens": 949568141.0, "step": 29752 }, { "entropy": 0.5070598069578409, "epoch": 2.737431067101397, "grad_norm": 0.15862925350666046, "learning_rate": 8.75578863434232e-06, "loss": 0.4948, "mean_token_accuracy": 0.84397342056036, "num_tokens": 949599927.0, "step": 29753 }, { "entropy": 0.41775191109627485, "epoch": 2.737523073472838, "grad_norm": 0.1473851352930069, "learning_rate": 8.752721808200694e-06, "loss": 0.4077, "mean_token_accuracy": 0.8684256747364998, "num_tokens": 949631489.0, "step": 29754 }, { "entropy": 0.508635482750833, "epoch": 2.737615079844279, "grad_norm": 0.15490971505641937, "learning_rate": 8.749654982059067e-06, "loss": 0.5002, "mean_token_accuracy": 0.8459382094442844, "num_tokens": 949663233.0, "step": 29755 }, { "entropy": 0.5193772744387388, "epoch": 2.7377070862157202, "grad_norm": 0.16357359290122986, "learning_rate": 8.746588155917441e-06, "loss": 0.5097, "mean_token_accuracy": 0.8391096256673336, "num_tokens": 949694723.0, "step": 29756 }, { "entropy": 0.5184723809361458, "epoch": 2.737799092587162, "grad_norm": 0.15812785923480988, "learning_rate": 8.743521329775816e-06, "loss": 0.5078, "mean_token_accuracy": 0.8414072245359421, "num_tokens": 949726900.0, "step": 29757 }, { "entropy": 0.5216969978064299, "epoch": 2.737891098958603, "grad_norm": 0.16108869016170502, "learning_rate": 8.740454503634189e-06, "loss": 0.511, "mean_token_accuracy": 0.83957190066576, "num_tokens": 949758280.0, "step": 29758 }, { "entropy": 0.4976958893239498, "epoch": 2.737983105330044, "grad_norm": 0.1606035828590393, "learning_rate": 8.737387677492564e-06, "loss": 0.4875, "mean_token_accuracy": 0.8458096161484718, "num_tokens": 949789830.0, "step": 29759 }, { "entropy": 0.5206500692293048, "epoch": 2.738075111701485, "grad_norm": 0.16381175816059113, "learning_rate": 8.734320851350937e-06, "loss": 0.5111, "mean_token_accuracy": 0.8389561399817467, "num_tokens": 949821472.0, "step": 29760 }, { "entropy": 0.5352764381095767, "epoch": 2.7381671180729263, "grad_norm": 0.1599886119365692, "learning_rate": 8.731254025209311e-06, "loss": 0.5313, "mean_token_accuracy": 0.8316836804151535, "num_tokens": 949853014.0, "step": 29761 }, { "entropy": 0.4357988827396184, "epoch": 2.738259124444368, "grad_norm": 0.14565686881542206, "learning_rate": 8.728187199067684e-06, "loss": 0.4173, "mean_token_accuracy": 0.8648367524147034, "num_tokens": 949884644.0, "step": 29762 }, { "entropy": 0.4722837167792022, "epoch": 2.738351130815809, "grad_norm": 0.15063776075839996, "learning_rate": 8.725120372926059e-06, "loss": 0.4621, "mean_token_accuracy": 0.857559148222208, "num_tokens": 949916760.0, "step": 29763 }, { "entropy": 0.4965417878702283, "epoch": 2.73844313718725, "grad_norm": 0.15401345491409302, "learning_rate": 8.722053546784434e-06, "loss": 0.4892, "mean_token_accuracy": 0.8449222892522812, "num_tokens": 949948712.0, "step": 29764 }, { "entropy": 0.4776016091927886, "epoch": 2.7385351435586913, "grad_norm": 0.1513943374156952, "learning_rate": 8.718986720642808e-06, "loss": 0.4624, "mean_token_accuracy": 0.8514331877231598, "num_tokens": 949980662.0, "step": 29765 }, { "entropy": 0.49673878960311413, "epoch": 2.7386271499301325, "grad_norm": 0.15532302856445312, "learning_rate": 8.715919894501181e-06, "loss": 0.4842, "mean_token_accuracy": 0.8472764976322651, "num_tokens": 950013430.0, "step": 29766 }, { "entropy": 0.3987413505092263, "epoch": 2.738719156301574, "grad_norm": 0.14307580888271332, "learning_rate": 8.712853068359556e-06, "loss": 0.3801, "mean_token_accuracy": 0.8768569193780422, "num_tokens": 950045141.0, "step": 29767 }, { "entropy": 0.44978486048057675, "epoch": 2.738811162673015, "grad_norm": 0.14943525195121765, "learning_rate": 8.709786242217929e-06, "loss": 0.4323, "mean_token_accuracy": 0.8636938482522964, "num_tokens": 950077283.0, "step": 29768 }, { "entropy": 0.5797551330178976, "epoch": 2.7389031690444563, "grad_norm": 0.1692013442516327, "learning_rate": 8.706719416076303e-06, "loss": 0.5767, "mean_token_accuracy": 0.822377547621727, "num_tokens": 950109352.0, "step": 29769 }, { "entropy": 0.5465391222387552, "epoch": 2.7389951754158974, "grad_norm": 0.16675549745559692, "learning_rate": 8.703652589934676e-06, "loss": 0.5392, "mean_token_accuracy": 0.8327789008617401, "num_tokens": 950141649.0, "step": 29770 }, { "entropy": 0.4624445326626301, "epoch": 2.7390871817873386, "grad_norm": 0.1575317680835724, "learning_rate": 8.700585763793051e-06, "loss": 0.4528, "mean_token_accuracy": 0.8559983596205711, "num_tokens": 950173178.0, "step": 29771 }, { "entropy": 0.42594234831631184, "epoch": 2.73917918815878, "grad_norm": 0.14489507675170898, "learning_rate": 8.697518937651426e-06, "loss": 0.404, "mean_token_accuracy": 0.8678559064865112, "num_tokens": 950204999.0, "step": 29772 }, { "entropy": 0.4284608233720064, "epoch": 2.7392711945302213, "grad_norm": 0.14953382313251495, "learning_rate": 8.694452111509799e-06, "loss": 0.4125, "mean_token_accuracy": 0.8683576360344887, "num_tokens": 950237108.0, "step": 29773 }, { "entropy": 0.45553160458803177, "epoch": 2.7393632009016624, "grad_norm": 0.15483097732067108, "learning_rate": 8.691385285368173e-06, "loss": 0.4357, "mean_token_accuracy": 0.8601999208331108, "num_tokens": 950268143.0, "step": 29774 }, { "entropy": 0.6304994728416204, "epoch": 2.7394552072731035, "grad_norm": 0.16802816092967987, "learning_rate": 8.688318459226546e-06, "loss": 0.6137, "mean_token_accuracy": 0.8093439936637878, "num_tokens": 950300401.0, "step": 29775 }, { "entropy": 0.5356822777539492, "epoch": 2.7395472136445447, "grad_norm": 0.15965233743190765, "learning_rate": 8.685251633084921e-06, "loss": 0.5285, "mean_token_accuracy": 0.8322530016303062, "num_tokens": 950332286.0, "step": 29776 }, { "entropy": 0.5074060028418899, "epoch": 2.7396392200159863, "grad_norm": 0.15723563730716705, "learning_rate": 8.682184806943294e-06, "loss": 0.4969, "mean_token_accuracy": 0.8442843109369278, "num_tokens": 950365054.0, "step": 29777 }, { "entropy": 0.5590926837176085, "epoch": 2.7397312263874274, "grad_norm": 0.16088365018367767, "learning_rate": 8.679117980801668e-06, "loss": 0.5493, "mean_token_accuracy": 0.8275367580354214, "num_tokens": 950397798.0, "step": 29778 }, { "entropy": 0.5865186117589474, "epoch": 2.7398232327588685, "grad_norm": 0.167989119887352, "learning_rate": 8.676051154660043e-06, "loss": 0.5893, "mean_token_accuracy": 0.8168699406087399, "num_tokens": 950430145.0, "step": 29779 }, { "entropy": 0.4315749607048929, "epoch": 2.7399152391303097, "grad_norm": 0.14247071743011475, "learning_rate": 8.672984328518418e-06, "loss": 0.4266, "mean_token_accuracy": 0.8667731992900372, "num_tokens": 950462681.0, "step": 29780 }, { "entropy": 0.48795633716508746, "epoch": 2.740007245501751, "grad_norm": 0.15490563213825226, "learning_rate": 8.66991750237679e-06, "loss": 0.471, "mean_token_accuracy": 0.8488265462219715, "num_tokens": 950494893.0, "step": 29781 }, { "entropy": 0.5417912444099784, "epoch": 2.7400992518731924, "grad_norm": 0.16475032269954681, "learning_rate": 8.666850676235165e-06, "loss": 0.5213, "mean_token_accuracy": 0.8374390564858913, "num_tokens": 950525689.0, "step": 29782 }, { "entropy": 0.5469980230554938, "epoch": 2.7401912582446335, "grad_norm": 0.16867457330226898, "learning_rate": 8.663783850093538e-06, "loss": 0.5407, "mean_token_accuracy": 0.8291767500340939, "num_tokens": 950558158.0, "step": 29783 }, { "entropy": 0.5526163908652961, "epoch": 2.7402832646160746, "grad_norm": 0.16582666337490082, "learning_rate": 8.660717023951913e-06, "loss": 0.5492, "mean_token_accuracy": 0.8275523446500301, "num_tokens": 950590475.0, "step": 29784 }, { "entropy": 0.486100060865283, "epoch": 2.7403752709875158, "grad_norm": 0.151006817817688, "learning_rate": 8.657650197810286e-06, "loss": 0.4729, "mean_token_accuracy": 0.8511312827467918, "num_tokens": 950622712.0, "step": 29785 }, { "entropy": 0.49382913392037153, "epoch": 2.740467277358957, "grad_norm": 0.15331199765205383, "learning_rate": 8.65458337166866e-06, "loss": 0.4842, "mean_token_accuracy": 0.8464754559099674, "num_tokens": 950655309.0, "step": 29786 }, { "entropy": 0.5699039734899998, "epoch": 2.7405592837303985, "grad_norm": 0.1661149561405182, "learning_rate": 8.651516545527035e-06, "loss": 0.5515, "mean_token_accuracy": 0.8240410722792149, "num_tokens": 950687297.0, "step": 29787 }, { "entropy": 0.4212853880599141, "epoch": 2.7406512901018396, "grad_norm": 0.14403675496578217, "learning_rate": 8.648449719385408e-06, "loss": 0.41, "mean_token_accuracy": 0.8680632635951042, "num_tokens": 950719380.0, "step": 29788 }, { "entropy": 0.6275374984834343, "epoch": 2.7407432964732807, "grad_norm": 0.17950782179832458, "learning_rate": 8.645382893243783e-06, "loss": 0.6088, "mean_token_accuracy": 0.8102058172225952, "num_tokens": 950751141.0, "step": 29789 }, { "entropy": 0.518241023644805, "epoch": 2.740835302844722, "grad_norm": 0.15293507277965546, "learning_rate": 8.642316067102156e-06, "loss": 0.5052, "mean_token_accuracy": 0.8390567898750305, "num_tokens": 950783505.0, "step": 29790 }, { "entropy": 0.43557193875312805, "epoch": 2.740927309216163, "grad_norm": 0.14542019367218018, "learning_rate": 8.63924924096053e-06, "loss": 0.4219, "mean_token_accuracy": 0.862947303801775, "num_tokens": 950815970.0, "step": 29791 }, { "entropy": 0.5507159605622292, "epoch": 2.7410193155876046, "grad_norm": 0.1668883115053177, "learning_rate": 8.636182414818903e-06, "loss": 0.5448, "mean_token_accuracy": 0.8261811211705208, "num_tokens": 950847958.0, "step": 29792 }, { "entropy": 0.5481104422360659, "epoch": 2.7411113219590457, "grad_norm": 0.16097183525562286, "learning_rate": 8.633115588677278e-06, "loss": 0.5312, "mean_token_accuracy": 0.8326223790645599, "num_tokens": 950879572.0, "step": 29793 }, { "entropy": 0.4134828308597207, "epoch": 2.741203328330487, "grad_norm": 0.14108514785766602, "learning_rate": 8.630048762535651e-06, "loss": 0.395, "mean_token_accuracy": 0.8760953396558762, "num_tokens": 950911876.0, "step": 29794 }, { "entropy": 0.5849418118596077, "epoch": 2.741295334701928, "grad_norm": 0.17262206971645355, "learning_rate": 8.626981936394027e-06, "loss": 0.5625, "mean_token_accuracy": 0.8245776407420635, "num_tokens": 950944005.0, "step": 29795 }, { "entropy": 0.5816346239298582, "epoch": 2.741387341073369, "grad_norm": 0.16631831228733063, "learning_rate": 8.6239151102524e-06, "loss": 0.5711, "mean_token_accuracy": 0.818681787699461, "num_tokens": 950976283.0, "step": 29796 }, { "entropy": 0.5370321981608868, "epoch": 2.7414793474448107, "grad_norm": 0.16019798815250397, "learning_rate": 8.620848284110775e-06, "loss": 0.5243, "mean_token_accuracy": 0.8365601561963558, "num_tokens": 951007921.0, "step": 29797 }, { "entropy": 0.5428119776770473, "epoch": 2.741571353816252, "grad_norm": 0.16359782218933105, "learning_rate": 8.617781457969148e-06, "loss": 0.5412, "mean_token_accuracy": 0.826892789453268, "num_tokens": 951040456.0, "step": 29798 }, { "entropy": 0.4877526720520109, "epoch": 2.741663360187693, "grad_norm": 0.15292952954769135, "learning_rate": 8.614714631827522e-06, "loss": 0.4617, "mean_token_accuracy": 0.8503101579844952, "num_tokens": 951072328.0, "step": 29799 }, { "entropy": 0.5024811350740492, "epoch": 2.741755366559134, "grad_norm": 0.15402616560459137, "learning_rate": 8.611647805685895e-06, "loss": 0.5025, "mean_token_accuracy": 0.8398952186107635, "num_tokens": 951104658.0, "step": 29800 }, { "entropy": 0.5766304852440953, "epoch": 2.7418473729305752, "grad_norm": 0.1668563336133957, "learning_rate": 8.60858097954427e-06, "loss": 0.5557, "mean_token_accuracy": 0.8232330940663815, "num_tokens": 951136246.0, "step": 29801 }, { "entropy": 0.6106442902237177, "epoch": 2.741939379302017, "grad_norm": 0.1675887256860733, "learning_rate": 8.605514153402645e-06, "loss": 0.5941, "mean_token_accuracy": 0.8125488348305225, "num_tokens": 951168700.0, "step": 29802 }, { "entropy": 0.5496670491993427, "epoch": 2.742031385673458, "grad_norm": 0.160951629281044, "learning_rate": 8.602447327261018e-06, "loss": 0.5367, "mean_token_accuracy": 0.8287177234888077, "num_tokens": 951200345.0, "step": 29803 }, { "entropy": 0.49490869883447886, "epoch": 2.742123392044899, "grad_norm": 0.1562563180923462, "learning_rate": 8.599380501119392e-06, "loss": 0.4741, "mean_token_accuracy": 0.8472774885594845, "num_tokens": 951232139.0, "step": 29804 }, { "entropy": 0.5193608738481998, "epoch": 2.74221539841634, "grad_norm": 0.1601220965385437, "learning_rate": 8.596313674977765e-06, "loss": 0.5081, "mean_token_accuracy": 0.8379615508019924, "num_tokens": 951264756.0, "step": 29805 }, { "entropy": 0.475275800563395, "epoch": 2.7423074047877813, "grad_norm": 0.1550729125738144, "learning_rate": 8.59324684883614e-06, "loss": 0.4551, "mean_token_accuracy": 0.8560411632061005, "num_tokens": 951297213.0, "step": 29806 }, { "entropy": 0.5710607413202524, "epoch": 2.742399411159223, "grad_norm": 0.1660557985305786, "learning_rate": 8.590180022694513e-06, "loss": 0.5686, "mean_token_accuracy": 0.8226867988705635, "num_tokens": 951328847.0, "step": 29807 }, { "entropy": 0.5473036961629987, "epoch": 2.742491417530664, "grad_norm": 0.16090825200080872, "learning_rate": 8.587113196552888e-06, "loss": 0.5357, "mean_token_accuracy": 0.8315405398607254, "num_tokens": 951360875.0, "step": 29808 }, { "entropy": 0.5520725265378132, "epoch": 2.742583423902105, "grad_norm": 0.16410641372203827, "learning_rate": 8.58404637041126e-06, "loss": 0.5484, "mean_token_accuracy": 0.8264982998371124, "num_tokens": 951392810.0, "step": 29809 }, { "entropy": 0.3970319477375597, "epoch": 2.7426754302735463, "grad_norm": 0.14071689546108246, "learning_rate": 8.580979544269637e-06, "loss": 0.3912, "mean_token_accuracy": 0.8735337518155575, "num_tokens": 951424359.0, "step": 29810 }, { "entropy": 0.5945173371583223, "epoch": 2.7427674366449875, "grad_norm": 0.1715121567249298, "learning_rate": 8.57791271812801e-06, "loss": 0.5828, "mean_token_accuracy": 0.8186716102063656, "num_tokens": 951456250.0, "step": 29811 }, { "entropy": 0.43948868894949555, "epoch": 2.742859443016429, "grad_norm": 0.1428239494562149, "learning_rate": 8.574845891986384e-06, "loss": 0.4225, "mean_token_accuracy": 0.8627882041037083, "num_tokens": 951488331.0, "step": 29812 }, { "entropy": 0.5358815337531269, "epoch": 2.74295144938787, "grad_norm": 0.15889889001846313, "learning_rate": 8.571779065844757e-06, "loss": 0.5283, "mean_token_accuracy": 0.8355214931070805, "num_tokens": 951521099.0, "step": 29813 }, { "entropy": 0.5337805254384875, "epoch": 2.7430434557593113, "grad_norm": 0.16564732789993286, "learning_rate": 8.568712239703132e-06, "loss": 0.5266, "mean_token_accuracy": 0.835698164999485, "num_tokens": 951552673.0, "step": 29814 }, { "entropy": 0.5938585624098778, "epoch": 2.7431354621307524, "grad_norm": 0.1641736775636673, "learning_rate": 8.565645413561505e-06, "loss": 0.5745, "mean_token_accuracy": 0.8230671137571335, "num_tokens": 951585096.0, "step": 29815 }, { "entropy": 0.5583896404132247, "epoch": 2.7432274685021936, "grad_norm": 0.1688401699066162, "learning_rate": 8.56257858741988e-06, "loss": 0.5388, "mean_token_accuracy": 0.8246811963617802, "num_tokens": 951615461.0, "step": 29816 }, { "entropy": 0.6342075746506453, "epoch": 2.743319474873635, "grad_norm": 0.17831368744373322, "learning_rate": 8.559511761278254e-06, "loss": 0.6154, "mean_token_accuracy": 0.8060485310852528, "num_tokens": 951646748.0, "step": 29817 }, { "entropy": 0.446335406973958, "epoch": 2.7434114812450763, "grad_norm": 0.15236543118953705, "learning_rate": 8.556444935136627e-06, "loss": 0.4375, "mean_token_accuracy": 0.8597828447818756, "num_tokens": 951678361.0, "step": 29818 }, { "entropy": 0.444293767795898, "epoch": 2.7435034876165174, "grad_norm": 0.14956897497177124, "learning_rate": 8.553378108995002e-06, "loss": 0.4316, "mean_token_accuracy": 0.861313421279192, "num_tokens": 951710369.0, "step": 29819 }, { "entropy": 0.49820326268672943, "epoch": 2.7435954939879585, "grad_norm": 0.14822177588939667, "learning_rate": 8.550311282853375e-06, "loss": 0.4796, "mean_token_accuracy": 0.8511219061911106, "num_tokens": 951742762.0, "step": 29820 }, { "entropy": 0.46298938523977995, "epoch": 2.7436875003593997, "grad_norm": 0.14613881707191467, "learning_rate": 8.54724445671175e-06, "loss": 0.4536, "mean_token_accuracy": 0.8555386923253536, "num_tokens": 951774539.0, "step": 29821 }, { "entropy": 0.4809515653178096, "epoch": 2.7437795067308413, "grad_norm": 0.15036801993846893, "learning_rate": 8.544177630570122e-06, "loss": 0.4674, "mean_token_accuracy": 0.8499081917107105, "num_tokens": 951806582.0, "step": 29822 }, { "entropy": 0.4999999813735485, "epoch": 2.7438715131022824, "grad_norm": 0.1578885167837143, "learning_rate": 8.541110804428497e-06, "loss": 0.493, "mean_token_accuracy": 0.8437510579824448, "num_tokens": 951838472.0, "step": 29823 }, { "entropy": 0.4678043080493808, "epoch": 2.7439635194737235, "grad_norm": 0.15548323094844818, "learning_rate": 8.53804397828687e-06, "loss": 0.4559, "mean_token_accuracy": 0.8525876067578793, "num_tokens": 951870169.0, "step": 29824 }, { "entropy": 0.5137793319299817, "epoch": 2.7440555258451647, "grad_norm": 0.15954971313476562, "learning_rate": 8.534977152145246e-06, "loss": 0.5038, "mean_token_accuracy": 0.841392956674099, "num_tokens": 951902742.0, "step": 29825 }, { "entropy": 0.49813865311443806, "epoch": 2.744147532216606, "grad_norm": 0.15691590309143066, "learning_rate": 8.53191032600362e-06, "loss": 0.4974, "mean_token_accuracy": 0.8423232063651085, "num_tokens": 951934686.0, "step": 29826 }, { "entropy": 0.4511820753104985, "epoch": 2.7442395385880474, "grad_norm": 0.14414982497692108, "learning_rate": 8.528843499861994e-06, "loss": 0.4354, "mean_token_accuracy": 0.8588355928659439, "num_tokens": 951966887.0, "step": 29827 }, { "entropy": 0.5535839479416609, "epoch": 2.7443315449594885, "grad_norm": 0.161504864692688, "learning_rate": 8.525776673720367e-06, "loss": 0.536, "mean_token_accuracy": 0.8253700733184814, "num_tokens": 951998520.0, "step": 29828 }, { "entropy": 0.5809453371912241, "epoch": 2.7444235513309296, "grad_norm": 0.17767831683158875, "learning_rate": 8.522709847578742e-06, "loss": 0.5758, "mean_token_accuracy": 0.8155608363449574, "num_tokens": 952029444.0, "step": 29829 }, { "entropy": 0.5802275231108069, "epoch": 2.7445155577023708, "grad_norm": 0.16458871960639954, "learning_rate": 8.519643021437115e-06, "loss": 0.5693, "mean_token_accuracy": 0.822482768446207, "num_tokens": 952061864.0, "step": 29830 }, { "entropy": 0.49002619134262204, "epoch": 2.744607564073812, "grad_norm": 0.16071631014347076, "learning_rate": 8.51657619529549e-06, "loss": 0.4844, "mean_token_accuracy": 0.8438724614679813, "num_tokens": 952093701.0, "step": 29831 }, { "entropy": 0.4831971190869808, "epoch": 2.7446995704452535, "grad_norm": 0.15958617627620697, "learning_rate": 8.513509369153864e-06, "loss": 0.4729, "mean_token_accuracy": 0.8511350713670254, "num_tokens": 952124328.0, "step": 29832 }, { "entropy": 0.5044770250096917, "epoch": 2.7447915768166946, "grad_norm": 0.1527552306652069, "learning_rate": 8.510442543012237e-06, "loss": 0.4882, "mean_token_accuracy": 0.8472300358116627, "num_tokens": 952156448.0, "step": 29833 }, { "entropy": 0.5208719987422228, "epoch": 2.7448835831881357, "grad_norm": 0.16126419603824615, "learning_rate": 8.507375716870611e-06, "loss": 0.5175, "mean_token_accuracy": 0.8347701691091061, "num_tokens": 952188685.0, "step": 29834 }, { "entropy": 0.38837127946317196, "epoch": 2.744975589559577, "grad_norm": 0.1424439400434494, "learning_rate": 8.504308890728984e-06, "loss": 0.3753, "mean_token_accuracy": 0.8770179562270641, "num_tokens": 952220524.0, "step": 29835 }, { "entropy": 0.5246855267323554, "epoch": 2.745067595931018, "grad_norm": 0.15890417993068695, "learning_rate": 8.501242064587359e-06, "loss": 0.5045, "mean_token_accuracy": 0.8389492705464363, "num_tokens": 952252285.0, "step": 29836 }, { "entropy": 0.5551725588738918, "epoch": 2.7451596023024596, "grad_norm": 0.16146761178970337, "learning_rate": 8.498175238445732e-06, "loss": 0.5374, "mean_token_accuracy": 0.8293983228504658, "num_tokens": 952283392.0, "step": 29837 }, { "entropy": 0.509796941652894, "epoch": 2.7452516086739007, "grad_norm": 0.1564122438430786, "learning_rate": 8.495108412304107e-06, "loss": 0.4915, "mean_token_accuracy": 0.843498982489109, "num_tokens": 952315320.0, "step": 29838 }, { "entropy": 0.5118236988782883, "epoch": 2.745343615045342, "grad_norm": 0.16056139767169952, "learning_rate": 8.49204158616248e-06, "loss": 0.507, "mean_token_accuracy": 0.8356741033494473, "num_tokens": 952346717.0, "step": 29839 }, { "entropy": 0.47022003401070833, "epoch": 2.745435621416783, "grad_norm": 0.15500885248184204, "learning_rate": 8.488974760020856e-06, "loss": 0.4638, "mean_token_accuracy": 0.8534465581178665, "num_tokens": 952378296.0, "step": 29840 }, { "entropy": 0.4732345283264294, "epoch": 2.745527627788224, "grad_norm": 0.15154309570789337, "learning_rate": 8.485907933879229e-06, "loss": 0.4588, "mean_token_accuracy": 0.8535477109253407, "num_tokens": 952410355.0, "step": 29841 }, { "entropy": 0.5463935134466738, "epoch": 2.7456196341596657, "grad_norm": 0.1650286614894867, "learning_rate": 8.482841107737604e-06, "loss": 0.5343, "mean_token_accuracy": 0.8331177644431591, "num_tokens": 952441855.0, "step": 29842 }, { "entropy": 0.4246778469532728, "epoch": 2.745711640531107, "grad_norm": 0.14875276386737823, "learning_rate": 8.479774281595976e-06, "loss": 0.4194, "mean_token_accuracy": 0.8683489635586739, "num_tokens": 952473523.0, "step": 29843 }, { "entropy": 0.41965573793277144, "epoch": 2.745803646902548, "grad_norm": 0.14325596392154694, "learning_rate": 8.476707455454351e-06, "loss": 0.4108, "mean_token_accuracy": 0.8693655990064144, "num_tokens": 952505724.0, "step": 29844 }, { "entropy": 0.49061125703155994, "epoch": 2.745895653273989, "grad_norm": 0.15463563799858093, "learning_rate": 8.473640629312724e-06, "loss": 0.4864, "mean_token_accuracy": 0.8497263826429844, "num_tokens": 952537664.0, "step": 29845 }, { "entropy": 0.4693219354376197, "epoch": 2.7459876596454302, "grad_norm": 0.15412358939647675, "learning_rate": 8.470573803171099e-06, "loss": 0.4608, "mean_token_accuracy": 0.8524628803133965, "num_tokens": 952570050.0, "step": 29846 }, { "entropy": 0.5661384742707014, "epoch": 2.746079666016872, "grad_norm": 0.1623048484325409, "learning_rate": 8.467506977029473e-06, "loss": 0.5457, "mean_token_accuracy": 0.829676903784275, "num_tokens": 952602454.0, "step": 29847 }, { "entropy": 0.557768763974309, "epoch": 2.746171672388313, "grad_norm": 0.1648833304643631, "learning_rate": 8.464440150887846e-06, "loss": 0.5476, "mean_token_accuracy": 0.8280590325593948, "num_tokens": 952633936.0, "step": 29848 }, { "entropy": 0.43711232452187687, "epoch": 2.746263678759754, "grad_norm": 0.14796023070812225, "learning_rate": 8.461373324746221e-06, "loss": 0.4349, "mean_token_accuracy": 0.8611042201519012, "num_tokens": 952666509.0, "step": 29849 }, { "entropy": 0.5307588940486312, "epoch": 2.746355685131195, "grad_norm": 0.15724295377731323, "learning_rate": 8.458306498604594e-06, "loss": 0.5176, "mean_token_accuracy": 0.835557222366333, "num_tokens": 952698670.0, "step": 29850 }, { "entropy": 0.4913252405822277, "epoch": 2.7464476915026363, "grad_norm": 0.15201154351234436, "learning_rate": 8.455239672462969e-06, "loss": 0.479, "mean_token_accuracy": 0.8467991501092911, "num_tokens": 952730885.0, "step": 29851 }, { "entropy": 0.5532092275097966, "epoch": 2.746539697874078, "grad_norm": 0.16366852819919586, "learning_rate": 8.452172846321342e-06, "loss": 0.5405, "mean_token_accuracy": 0.8296989724040031, "num_tokens": 952763412.0, "step": 29852 }, { "entropy": 0.5256673917174339, "epoch": 2.746631704245519, "grad_norm": 0.16003625094890594, "learning_rate": 8.449106020179716e-06, "loss": 0.503, "mean_token_accuracy": 0.8398831151425838, "num_tokens": 952795374.0, "step": 29853 }, { "entropy": 0.5356819955632091, "epoch": 2.74672371061696, "grad_norm": 0.1612854152917862, "learning_rate": 8.446039194038089e-06, "loss": 0.529, "mean_token_accuracy": 0.8317254446446896, "num_tokens": 952827518.0, "step": 29854 }, { "entropy": 0.5348044413840398, "epoch": 2.7468157169884013, "grad_norm": 0.16727179288864136, "learning_rate": 8.442972367896464e-06, "loss": 0.5251, "mean_token_accuracy": 0.835742462426424, "num_tokens": 952858734.0, "step": 29855 }, { "entropy": 0.4606066504493356, "epoch": 2.7469077233598425, "grad_norm": 0.1524716466665268, "learning_rate": 8.439905541754838e-06, "loss": 0.4469, "mean_token_accuracy": 0.8559241630136967, "num_tokens": 952891063.0, "step": 29856 }, { "entropy": 0.5436388868838549, "epoch": 2.746999729731284, "grad_norm": 0.16324421763420105, "learning_rate": 8.436838715613213e-06, "loss": 0.5357, "mean_token_accuracy": 0.8320626877248287, "num_tokens": 952922755.0, "step": 29857 }, { "entropy": 0.3760492210276425, "epoch": 2.747091736102725, "grad_norm": 0.13970047235488892, "learning_rate": 8.433771889471586e-06, "loss": 0.3632, "mean_token_accuracy": 0.8828036785125732, "num_tokens": 952955387.0, "step": 29858 }, { "entropy": 0.5742250513285398, "epoch": 2.7471837424741663, "grad_norm": 0.16877342760562897, "learning_rate": 8.43070506332996e-06, "loss": 0.5684, "mean_token_accuracy": 0.8160293474793434, "num_tokens": 952986382.0, "step": 29859 }, { "entropy": 0.5065213311463594, "epoch": 2.7472757488456074, "grad_norm": 0.15982168912887573, "learning_rate": 8.427638237188334e-06, "loss": 0.503, "mean_token_accuracy": 0.8394764736294746, "num_tokens": 953018348.0, "step": 29860 }, { "entropy": 0.6211793422698975, "epoch": 2.7473677552170486, "grad_norm": 0.17675945162773132, "learning_rate": 8.424571411046708e-06, "loss": 0.6189, "mean_token_accuracy": 0.8072381094098091, "num_tokens": 953049912.0, "step": 29861 }, { "entropy": 0.4625325163360685, "epoch": 2.74745976158849, "grad_norm": 0.1594417542219162, "learning_rate": 8.421504584905083e-06, "loss": 0.4454, "mean_token_accuracy": 0.85829633846879, "num_tokens": 953081806.0, "step": 29862 }, { "entropy": 0.5493579925969243, "epoch": 2.7475517679599313, "grad_norm": 0.16409724950790405, "learning_rate": 8.418437758763456e-06, "loss": 0.5422, "mean_token_accuracy": 0.8294456079602242, "num_tokens": 953113565.0, "step": 29863 }, { "entropy": 0.4911146762315184, "epoch": 2.7476437743313724, "grad_norm": 0.15636686980724335, "learning_rate": 8.41537093262183e-06, "loss": 0.4862, "mean_token_accuracy": 0.8460001423954964, "num_tokens": 953145926.0, "step": 29864 }, { "entropy": 0.501208608970046, "epoch": 2.7477357807028135, "grad_norm": 0.1624017357826233, "learning_rate": 8.412304106480203e-06, "loss": 0.493, "mean_token_accuracy": 0.8427589312195778, "num_tokens": 953177227.0, "step": 29865 }, { "entropy": 0.6122909476980567, "epoch": 2.7478277870742547, "grad_norm": 0.16891533136367798, "learning_rate": 8.409237280338578e-06, "loss": 0.6013, "mean_token_accuracy": 0.8114463090896606, "num_tokens": 953209869.0, "step": 29866 }, { "entropy": 0.485756317502819, "epoch": 2.7479197934456963, "grad_norm": 0.15583524107933044, "learning_rate": 8.406170454196951e-06, "loss": 0.472, "mean_token_accuracy": 0.8521500825881958, "num_tokens": 953241732.0, "step": 29867 }, { "entropy": 0.4426771025173366, "epoch": 2.7480117998171374, "grad_norm": 0.1436615139245987, "learning_rate": 8.403103628055326e-06, "loss": 0.4266, "mean_token_accuracy": 0.8654484190046787, "num_tokens": 953273851.0, "step": 29868 }, { "entropy": 0.5083072218112648, "epoch": 2.7481038061885785, "grad_norm": 0.15721231698989868, "learning_rate": 8.400036801913699e-06, "loss": 0.4927, "mean_token_accuracy": 0.8430715203285217, "num_tokens": 953305801.0, "step": 29869 }, { "entropy": 0.4087734576314688, "epoch": 2.7481958125600197, "grad_norm": 0.14562328159809113, "learning_rate": 8.396969975772073e-06, "loss": 0.4029, "mean_token_accuracy": 0.8708922117948532, "num_tokens": 953337820.0, "step": 29870 }, { "entropy": 0.5296937085222453, "epoch": 2.748287818931461, "grad_norm": 0.1564520299434662, "learning_rate": 8.393903149630448e-06, "loss": 0.5096, "mean_token_accuracy": 0.8341477885842323, "num_tokens": 953370020.0, "step": 29871 }, { "entropy": 0.5268379021435976, "epoch": 2.7483798253029024, "grad_norm": 0.1563519835472107, "learning_rate": 8.390836323488823e-06, "loss": 0.5133, "mean_token_accuracy": 0.8402279950678349, "num_tokens": 953402452.0, "step": 29872 }, { "entropy": 0.4785333704203367, "epoch": 2.7484718316743435, "grad_norm": 0.15639616549015045, "learning_rate": 8.387769497347196e-06, "loss": 0.459, "mean_token_accuracy": 0.8525321446359158, "num_tokens": 953434142.0, "step": 29873 }, { "entropy": 0.5469945883378386, "epoch": 2.7485638380457846, "grad_norm": 0.16496935486793518, "learning_rate": 8.38470267120557e-06, "loss": 0.5301, "mean_token_accuracy": 0.8307308666408062, "num_tokens": 953465036.0, "step": 29874 }, { "entropy": 0.4253496043384075, "epoch": 2.7486558444172258, "grad_norm": 0.1533622443675995, "learning_rate": 8.381635845063943e-06, "loss": 0.4281, "mean_token_accuracy": 0.8634563870728016, "num_tokens": 953496184.0, "step": 29875 }, { "entropy": 0.5241974634118378, "epoch": 2.748747850788667, "grad_norm": 0.15698570013046265, "learning_rate": 8.378569018922318e-06, "loss": 0.5049, "mean_token_accuracy": 0.8379737548530102, "num_tokens": 953528043.0, "step": 29876 }, { "entropy": 0.5330012869089842, "epoch": 2.7488398571601085, "grad_norm": 0.1609855741262436, "learning_rate": 8.375502192780692e-06, "loss": 0.5239, "mean_token_accuracy": 0.8302181139588356, "num_tokens": 953560148.0, "step": 29877 }, { "entropy": 0.4823675339575857, "epoch": 2.7489318635315496, "grad_norm": 0.15915653109550476, "learning_rate": 8.372435366639065e-06, "loss": 0.469, "mean_token_accuracy": 0.8486844152212143, "num_tokens": 953592201.0, "step": 29878 }, { "entropy": 0.5526532083749771, "epoch": 2.7490238699029907, "grad_norm": 0.16542606055736542, "learning_rate": 8.36936854049744e-06, "loss": 0.5554, "mean_token_accuracy": 0.8275087028741837, "num_tokens": 953624258.0, "step": 29879 }, { "entropy": 0.5480890208855271, "epoch": 2.749115876274432, "grad_norm": 0.160817489027977, "learning_rate": 8.366301714355813e-06, "loss": 0.5326, "mean_token_accuracy": 0.8294398859143257, "num_tokens": 953655757.0, "step": 29880 }, { "entropy": 0.4936072123236954, "epoch": 2.749207882645873, "grad_norm": 0.15660275518894196, "learning_rate": 8.363234888214188e-06, "loss": 0.4746, "mean_token_accuracy": 0.8505503349006176, "num_tokens": 953687633.0, "step": 29881 }, { "entropy": 0.5101351551711559, "epoch": 2.7492998890173146, "grad_norm": 0.15316718816757202, "learning_rate": 8.36016806207256e-06, "loss": 0.4945, "mean_token_accuracy": 0.8451264724135399, "num_tokens": 953720008.0, "step": 29882 }, { "entropy": 0.5895947907119989, "epoch": 2.7493918953887557, "grad_norm": 0.1696222871541977, "learning_rate": 8.357101235930935e-06, "loss": 0.5773, "mean_token_accuracy": 0.81939847022295, "num_tokens": 953752305.0, "step": 29883 }, { "entropy": 0.45081869151908904, "epoch": 2.749483901760197, "grad_norm": 0.15467002987861633, "learning_rate": 8.354034409789308e-06, "loss": 0.4409, "mean_token_accuracy": 0.8575029075145721, "num_tokens": 953784378.0, "step": 29884 }, { "entropy": 0.5630247052758932, "epoch": 2.749575908131638, "grad_norm": 0.1688479781150818, "learning_rate": 8.350967583647683e-06, "loss": 0.5573, "mean_token_accuracy": 0.824380949139595, "num_tokens": 953816549.0, "step": 29885 }, { "entropy": 0.487217896617949, "epoch": 2.749667914503079, "grad_norm": 0.15885990858078003, "learning_rate": 8.347900757506058e-06, "loss": 0.4773, "mean_token_accuracy": 0.8504114300012589, "num_tokens": 953848560.0, "step": 29886 }, { "entropy": 0.5216638566926122, "epoch": 2.7497599208745207, "grad_norm": 0.1565675437450409, "learning_rate": 8.344833931364432e-06, "loss": 0.5046, "mean_token_accuracy": 0.841695137321949, "num_tokens": 953880602.0, "step": 29887 }, { "entropy": 0.6122578866779804, "epoch": 2.749851927245962, "grad_norm": 0.1693347990512848, "learning_rate": 8.341767105222805e-06, "loss": 0.6013, "mean_token_accuracy": 0.8111914321780205, "num_tokens": 953912862.0, "step": 29888 }, { "entropy": 0.4168141661211848, "epoch": 2.749943933617403, "grad_norm": 0.14338746666908264, "learning_rate": 8.33870027908118e-06, "loss": 0.4081, "mean_token_accuracy": 0.8715683035552502, "num_tokens": 953944867.0, "step": 29889 }, { "entropy": 0.5375016210600734, "epoch": 2.750035939988844, "grad_norm": 0.1630726158618927, "learning_rate": 8.335633452939553e-06, "loss": 0.5274, "mean_token_accuracy": 0.831487849354744, "num_tokens": 953976969.0, "step": 29890 }, { "entropy": 0.5745323738083243, "epoch": 2.7501279463602852, "grad_norm": 0.16619180142879486, "learning_rate": 8.332566626797927e-06, "loss": 0.5572, "mean_token_accuracy": 0.8231817446649075, "num_tokens": 954007983.0, "step": 29891 }, { "entropy": 0.453215173445642, "epoch": 2.750219952731727, "grad_norm": 0.155622199177742, "learning_rate": 8.329499800656302e-06, "loss": 0.4404, "mean_token_accuracy": 0.8607611805200577, "num_tokens": 954039949.0, "step": 29892 }, { "entropy": 0.48515474889427423, "epoch": 2.750311959103168, "grad_norm": 0.15466073155403137, "learning_rate": 8.326432974514675e-06, "loss": 0.4678, "mean_token_accuracy": 0.8466136865317822, "num_tokens": 954072013.0, "step": 29893 }, { "entropy": 0.624629270285368, "epoch": 2.750403965474609, "grad_norm": 0.17273223400115967, "learning_rate": 8.32336614837305e-06, "loss": 0.607, "mean_token_accuracy": 0.811398945748806, "num_tokens": 954104212.0, "step": 29894 }, { "entropy": 0.5277472399175167, "epoch": 2.75049597184605, "grad_norm": 0.16570086777210236, "learning_rate": 8.320299322231423e-06, "loss": 0.5167, "mean_token_accuracy": 0.8362935818731785, "num_tokens": 954135791.0, "step": 29895 }, { "entropy": 0.5253546088933945, "epoch": 2.7505879782174913, "grad_norm": 0.1592235267162323, "learning_rate": 8.317232496089797e-06, "loss": 0.52, "mean_token_accuracy": 0.8366604968905449, "num_tokens": 954168138.0, "step": 29896 }, { "entropy": 0.5063671027310193, "epoch": 2.750679984588933, "grad_norm": 0.15741270780563354, "learning_rate": 8.31416566994817e-06, "loss": 0.4955, "mean_token_accuracy": 0.8458127677440643, "num_tokens": 954200158.0, "step": 29897 }, { "entropy": 0.5436564590781927, "epoch": 2.750771990960374, "grad_norm": 0.15634529292583466, "learning_rate": 8.311098843806545e-06, "loss": 0.532, "mean_token_accuracy": 0.8311962932348251, "num_tokens": 954232415.0, "step": 29898 }, { "entropy": 0.42985750269144773, "epoch": 2.750863997331815, "grad_norm": 0.14584971964359283, "learning_rate": 8.308032017664918e-06, "loss": 0.42, "mean_token_accuracy": 0.8656830005347729, "num_tokens": 954264746.0, "step": 29899 }, { "entropy": 0.5699399495497346, "epoch": 2.7509560037032563, "grad_norm": 0.16208450496196747, "learning_rate": 8.304965191523292e-06, "loss": 0.5522, "mean_token_accuracy": 0.826047308743, "num_tokens": 954296598.0, "step": 29900 }, { "entropy": 0.586231246124953, "epoch": 2.7510480100746975, "grad_norm": 0.16333167254924774, "learning_rate": 8.301898365381667e-06, "loss": 0.5586, "mean_token_accuracy": 0.8217355497181416, "num_tokens": 954328513.0, "step": 29901 }, { "entropy": 0.5490612182766199, "epoch": 2.751140016446139, "grad_norm": 0.1583280861377716, "learning_rate": 8.298831539240042e-06, "loss": 0.5443, "mean_token_accuracy": 0.8297588638961315, "num_tokens": 954360917.0, "step": 29902 }, { "entropy": 0.46810030937194824, "epoch": 2.75123202281758, "grad_norm": 0.15111318230628967, "learning_rate": 8.295764713098415e-06, "loss": 0.4561, "mean_token_accuracy": 0.8541420176625252, "num_tokens": 954392618.0, "step": 29903 }, { "entropy": 0.46090863179415464, "epoch": 2.7513240291890213, "grad_norm": 0.14962004125118256, "learning_rate": 8.29269788695679e-06, "loss": 0.4361, "mean_token_accuracy": 0.8582993261516094, "num_tokens": 954424116.0, "step": 29904 }, { "entropy": 0.4546239646151662, "epoch": 2.7514160355604624, "grad_norm": 0.15293273329734802, "learning_rate": 8.289631060815162e-06, "loss": 0.4486, "mean_token_accuracy": 0.858315221965313, "num_tokens": 954456208.0, "step": 29905 }, { "entropy": 0.49875031039118767, "epoch": 2.7515080419319036, "grad_norm": 0.15945155918598175, "learning_rate": 8.286564234673537e-06, "loss": 0.5006, "mean_token_accuracy": 0.8407943062484264, "num_tokens": 954488724.0, "step": 29906 }, { "entropy": 0.5467359987087548, "epoch": 2.751600048303345, "grad_norm": 0.1633516252040863, "learning_rate": 8.283497408531912e-06, "loss": 0.5296, "mean_token_accuracy": 0.8338988237082958, "num_tokens": 954520490.0, "step": 29907 }, { "entropy": 0.5184823302552104, "epoch": 2.7516920546747863, "grad_norm": 0.16022615134716034, "learning_rate": 8.280430582390285e-06, "loss": 0.52, "mean_token_accuracy": 0.8359988406300545, "num_tokens": 954552646.0, "step": 29908 }, { "entropy": 0.39673815108835697, "epoch": 2.7517840610462274, "grad_norm": 0.15093879401683807, "learning_rate": 8.27736375624866e-06, "loss": 0.3933, "mean_token_accuracy": 0.8704471290111542, "num_tokens": 954583884.0, "step": 29909 }, { "entropy": 0.5663810428231955, "epoch": 2.7518760674176685, "grad_norm": 0.16541293263435364, "learning_rate": 8.274296930107032e-06, "loss": 0.5602, "mean_token_accuracy": 0.8197520300745964, "num_tokens": 954615693.0, "step": 29910 }, { "entropy": 0.45247078931424767, "epoch": 2.7519680737891097, "grad_norm": 0.14884358644485474, "learning_rate": 8.271230103965407e-06, "loss": 0.4356, "mean_token_accuracy": 0.8567561060190201, "num_tokens": 954647453.0, "step": 29911 }, { "entropy": 0.5781666450202465, "epoch": 2.7520600801605513, "grad_norm": 0.16765184700489044, "learning_rate": 8.26816327782378e-06, "loss": 0.56, "mean_token_accuracy": 0.8216214999556541, "num_tokens": 954678642.0, "step": 29912 }, { "entropy": 0.4630758622661233, "epoch": 2.7521520865319924, "grad_norm": 0.15344280004501343, "learning_rate": 8.265096451682154e-06, "loss": 0.4475, "mean_token_accuracy": 0.8528466038405895, "num_tokens": 954709720.0, "step": 29913 }, { "entropy": 0.49755996838212013, "epoch": 2.7522440929034335, "grad_norm": 0.15638577938079834, "learning_rate": 8.262029625540527e-06, "loss": 0.4801, "mean_token_accuracy": 0.845756184309721, "num_tokens": 954741938.0, "step": 29914 }, { "entropy": 0.4520229157060385, "epoch": 2.7523360992748747, "grad_norm": 0.15171663463115692, "learning_rate": 8.258962799398902e-06, "loss": 0.4355, "mean_token_accuracy": 0.8616002202033997, "num_tokens": 954773729.0, "step": 29915 }, { "entropy": 0.4313311045989394, "epoch": 2.752428105646316, "grad_norm": 0.14570854604244232, "learning_rate": 8.255895973257275e-06, "loss": 0.4119, "mean_token_accuracy": 0.8664082735776901, "num_tokens": 954805870.0, "step": 29916 }, { "entropy": 0.5683401841670275, "epoch": 2.7525201120177574, "grad_norm": 0.1683129072189331, "learning_rate": 8.252829147115651e-06, "loss": 0.5619, "mean_token_accuracy": 0.8238731324672699, "num_tokens": 954837396.0, "step": 29917 }, { "entropy": 0.5043704101117328, "epoch": 2.7526121183891985, "grad_norm": 0.15496030449867249, "learning_rate": 8.249762320974024e-06, "loss": 0.4881, "mean_token_accuracy": 0.8442598134279251, "num_tokens": 954869764.0, "step": 29918 }, { "entropy": 0.4758687005378306, "epoch": 2.7527041247606396, "grad_norm": 0.1577085554599762, "learning_rate": 8.246695494832399e-06, "loss": 0.4538, "mean_token_accuracy": 0.8557295240461826, "num_tokens": 954901269.0, "step": 29919 }, { "entropy": 0.42573520296718925, "epoch": 2.7527961311320808, "grad_norm": 0.146132230758667, "learning_rate": 8.243628668690772e-06, "loss": 0.4094, "mean_token_accuracy": 0.8684781827032566, "num_tokens": 954933805.0, "step": 29920 }, { "entropy": 0.4694071786943823, "epoch": 2.752888137503522, "grad_norm": 0.14953818917274475, "learning_rate": 8.240561842549146e-06, "loss": 0.4521, "mean_token_accuracy": 0.8548642657697201, "num_tokens": 954966222.0, "step": 29921 }, { "entropy": 0.5065359212458134, "epoch": 2.7529801438749635, "grad_norm": 0.15289221704006195, "learning_rate": 8.237495016407521e-06, "loss": 0.4967, "mean_token_accuracy": 0.8442559950053692, "num_tokens": 954997969.0, "step": 29922 }, { "entropy": 0.5780081851407886, "epoch": 2.7530721502464046, "grad_norm": 0.16768166422843933, "learning_rate": 8.234428190265894e-06, "loss": 0.5636, "mean_token_accuracy": 0.8250781856477261, "num_tokens": 955030578.0, "step": 29923 }, { "entropy": 0.5231542307883501, "epoch": 2.7531641566178457, "grad_norm": 0.15522919595241547, "learning_rate": 8.231361364124269e-06, "loss": 0.5097, "mean_token_accuracy": 0.840232253074646, "num_tokens": 955062229.0, "step": 29924 }, { "entropy": 0.6343635059893131, "epoch": 2.753256162989287, "grad_norm": 0.17550310492515564, "learning_rate": 8.228294537982642e-06, "loss": 0.626, "mean_token_accuracy": 0.805464930832386, "num_tokens": 955093286.0, "step": 29925 }, { "entropy": 0.48859353736042976, "epoch": 2.753348169360728, "grad_norm": 0.15812505781650543, "learning_rate": 8.225227711841016e-06, "loss": 0.4683, "mean_token_accuracy": 0.8510548770427704, "num_tokens": 955124313.0, "step": 29926 }, { "entropy": 0.5145634142681956, "epoch": 2.7534401757321696, "grad_norm": 0.1549079716205597, "learning_rate": 8.22216088569939e-06, "loss": 0.5014, "mean_token_accuracy": 0.8450781553983688, "num_tokens": 955157081.0, "step": 29927 }, { "entropy": 0.4860286461189389, "epoch": 2.7535321821036107, "grad_norm": 0.15422485768795013, "learning_rate": 8.219094059557764e-06, "loss": 0.4674, "mean_token_accuracy": 0.8548025563359261, "num_tokens": 955188459.0, "step": 29928 }, { "entropy": 0.5004647611640394, "epoch": 2.753624188475052, "grad_norm": 0.1539938896894455, "learning_rate": 8.216027233416137e-06, "loss": 0.4758, "mean_token_accuracy": 0.8469872921705246, "num_tokens": 955220733.0, "step": 29929 }, { "entropy": 0.4815553901717067, "epoch": 2.753716194846493, "grad_norm": 0.15450213849544525, "learning_rate": 8.212960407274512e-06, "loss": 0.4659, "mean_token_accuracy": 0.8499859347939491, "num_tokens": 955253052.0, "step": 29930 }, { "entropy": 0.46525106206536293, "epoch": 2.753808201217934, "grad_norm": 0.1596013903617859, "learning_rate": 8.209893581132884e-06, "loss": 0.4604, "mean_token_accuracy": 0.8521596826612949, "num_tokens": 955284646.0, "step": 29931 }, { "entropy": 0.5033528245985508, "epoch": 2.7539002075893757, "grad_norm": 0.1633491963148117, "learning_rate": 8.20682675499126e-06, "loss": 0.4965, "mean_token_accuracy": 0.8394935056567192, "num_tokens": 955316715.0, "step": 29932 }, { "entropy": 0.4193509453907609, "epoch": 2.753992213960817, "grad_norm": 0.14777927100658417, "learning_rate": 8.203759928849634e-06, "loss": 0.4121, "mean_token_accuracy": 0.8655530512332916, "num_tokens": 955349158.0, "step": 29933 }, { "entropy": 0.5262940805405378, "epoch": 2.754084220332258, "grad_norm": 0.16387522220611572, "learning_rate": 8.200693102708008e-06, "loss": 0.5186, "mean_token_accuracy": 0.8376646153628826, "num_tokens": 955380639.0, "step": 29934 }, { "entropy": 0.48397127352654934, "epoch": 2.754176226703699, "grad_norm": 0.1569935828447342, "learning_rate": 8.197626276566381e-06, "loss": 0.4836, "mean_token_accuracy": 0.8471134528517723, "num_tokens": 955412737.0, "step": 29935 }, { "entropy": 0.5262636094121262, "epoch": 2.7542682330751402, "grad_norm": 0.1579839587211609, "learning_rate": 8.194559450424756e-06, "loss": 0.5014, "mean_token_accuracy": 0.8368801176548004, "num_tokens": 955444588.0, "step": 29936 }, { "entropy": 0.47667461074888706, "epoch": 2.754360239446582, "grad_norm": 0.1525801718235016, "learning_rate": 8.19149262428313e-06, "loss": 0.4576, "mean_token_accuracy": 0.8544154204428196, "num_tokens": 955476305.0, "step": 29937 }, { "entropy": 0.4622123222798109, "epoch": 2.754452245818023, "grad_norm": 0.15595756471157074, "learning_rate": 8.188425798141504e-06, "loss": 0.4536, "mean_token_accuracy": 0.8527952246367931, "num_tokens": 955508571.0, "step": 29938 }, { "entropy": 0.4665300268679857, "epoch": 2.754544252189464, "grad_norm": 0.15452489256858826, "learning_rate": 8.185358971999878e-06, "loss": 0.4607, "mean_token_accuracy": 0.8537804484367371, "num_tokens": 955540465.0, "step": 29939 }, { "entropy": 0.457061312161386, "epoch": 2.754636258560905, "grad_norm": 0.15511681139469147, "learning_rate": 8.182292145858251e-06, "loss": 0.4433, "mean_token_accuracy": 0.8551973886787891, "num_tokens": 955571694.0, "step": 29940 }, { "entropy": 0.6086422819644213, "epoch": 2.7547282649323463, "grad_norm": 0.16367682814598083, "learning_rate": 8.179225319716626e-06, "loss": 0.5848, "mean_token_accuracy": 0.8137224093079567, "num_tokens": 955603233.0, "step": 29941 }, { "entropy": 0.4560956433415413, "epoch": 2.754820271303788, "grad_norm": 0.1490427553653717, "learning_rate": 8.176158493574999e-06, "loss": 0.4448, "mean_token_accuracy": 0.8577105440199375, "num_tokens": 955634413.0, "step": 29942 }, { "entropy": 0.5703168753534555, "epoch": 2.754912277675229, "grad_norm": 0.16225220263004303, "learning_rate": 8.173091667433373e-06, "loss": 0.5682, "mean_token_accuracy": 0.8215284049510956, "num_tokens": 955666713.0, "step": 29943 }, { "entropy": 0.4713336252607405, "epoch": 2.75500428404667, "grad_norm": 0.1546478122472763, "learning_rate": 8.170024841291746e-06, "loss": 0.4657, "mean_token_accuracy": 0.8510037250816822, "num_tokens": 955698492.0, "step": 29944 }, { "entropy": 0.5418167682364583, "epoch": 2.7550962904181113, "grad_norm": 0.16377010941505432, "learning_rate": 8.166958015150121e-06, "loss": 0.5269, "mean_token_accuracy": 0.8324913755059242, "num_tokens": 955730435.0, "step": 29945 }, { "entropy": 0.4862560583278537, "epoch": 2.7551882967895525, "grad_norm": 0.15338708460330963, "learning_rate": 8.163891189008494e-06, "loss": 0.4727, "mean_token_accuracy": 0.8488144613802433, "num_tokens": 955762405.0, "step": 29946 }, { "entropy": 0.4867588556371629, "epoch": 2.755280303160994, "grad_norm": 0.1575908362865448, "learning_rate": 8.16082436286687e-06, "loss": 0.4787, "mean_token_accuracy": 0.8466619849205017, "num_tokens": 955794600.0, "step": 29947 }, { "entropy": 0.5512390192598104, "epoch": 2.755372309532435, "grad_norm": 0.16230526566505432, "learning_rate": 8.157757536725243e-06, "loss": 0.534, "mean_token_accuracy": 0.8308676034212112, "num_tokens": 955826402.0, "step": 29948 }, { "entropy": 0.584863927680999, "epoch": 2.7554643159038763, "grad_norm": 0.17120496928691864, "learning_rate": 8.154690710583618e-06, "loss": 0.581, "mean_token_accuracy": 0.818032406270504, "num_tokens": 955858093.0, "step": 29949 }, { "entropy": 0.5689740860834718, "epoch": 2.7555563222753174, "grad_norm": 0.16406755149364471, "learning_rate": 8.151623884441991e-06, "loss": 0.5582, "mean_token_accuracy": 0.8273940421640873, "num_tokens": 955889896.0, "step": 29950 }, { "entropy": 0.4581419052556157, "epoch": 2.7556483286467586, "grad_norm": 0.15169581770896912, "learning_rate": 8.148557058300366e-06, "loss": 0.455, "mean_token_accuracy": 0.8549972251057625, "num_tokens": 955922234.0, "step": 29951 }, { "entropy": 0.5677355462685227, "epoch": 2.7557403350182, "grad_norm": 0.1667482554912567, "learning_rate": 8.14549023215874e-06, "loss": 0.5542, "mean_token_accuracy": 0.8231690190732479, "num_tokens": 955953750.0, "step": 29952 }, { "entropy": 0.5532951643690467, "epoch": 2.7558323413896413, "grad_norm": 0.17316986620426178, "learning_rate": 8.142423406017113e-06, "loss": 0.5486, "mean_token_accuracy": 0.8302580304443836, "num_tokens": 955986116.0, "step": 29953 }, { "entropy": 0.5199444768950343, "epoch": 2.7559243477610824, "grad_norm": 0.16208039224147797, "learning_rate": 8.139356579875488e-06, "loss": 0.5101, "mean_token_accuracy": 0.8348654210567474, "num_tokens": 956017370.0, "step": 29954 }, { "entropy": 0.5232006749138236, "epoch": 2.7560163541325235, "grad_norm": 0.1616925597190857, "learning_rate": 8.13628975373386e-06, "loss": 0.5178, "mean_token_accuracy": 0.8370995037257671, "num_tokens": 956049532.0, "step": 29955 }, { "entropy": 0.4926131833344698, "epoch": 2.7561083605039647, "grad_norm": 0.15945963561534882, "learning_rate": 8.133222927592235e-06, "loss": 0.4849, "mean_token_accuracy": 0.8437083847820759, "num_tokens": 956081687.0, "step": 29956 }, { "entropy": 0.4818327100947499, "epoch": 2.7562003668754063, "grad_norm": 0.15753427147865295, "learning_rate": 8.130156101450608e-06, "loss": 0.4617, "mean_token_accuracy": 0.8534070178866386, "num_tokens": 956113607.0, "step": 29957 }, { "entropy": 0.538609629496932, "epoch": 2.7562923732468474, "grad_norm": 0.17000383138656616, "learning_rate": 8.127089275308983e-06, "loss": 0.5265, "mean_token_accuracy": 0.8344250433146954, "num_tokens": 956144852.0, "step": 29958 }, { "entropy": 0.580878890119493, "epoch": 2.7563843796182885, "grad_norm": 0.16475720703601837, "learning_rate": 8.124022449167356e-06, "loss": 0.5768, "mean_token_accuracy": 0.8210177831351757, "num_tokens": 956176218.0, "step": 29959 }, { "entropy": 0.557244660332799, "epoch": 2.7564763859897297, "grad_norm": 0.1659681349992752, "learning_rate": 8.12095562302573e-06, "loss": 0.5465, "mean_token_accuracy": 0.8234551921486855, "num_tokens": 956207447.0, "step": 29960 }, { "entropy": 0.5054826210252941, "epoch": 2.756568392361171, "grad_norm": 0.15759997069835663, "learning_rate": 8.117888796884104e-06, "loss": 0.5047, "mean_token_accuracy": 0.8424173258244991, "num_tokens": 956239379.0, "step": 29961 }, { "entropy": 0.5825619995594025, "epoch": 2.7566603987326124, "grad_norm": 0.16596652567386627, "learning_rate": 8.11482197074248e-06, "loss": 0.5809, "mean_token_accuracy": 0.8195425197482109, "num_tokens": 956271602.0, "step": 29962 }, { "entropy": 0.43189507722854614, "epoch": 2.7567524051040535, "grad_norm": 0.14668886363506317, "learning_rate": 8.111755144600853e-06, "loss": 0.4248, "mean_token_accuracy": 0.8634703606367111, "num_tokens": 956302906.0, "step": 29963 }, { "entropy": 0.5032129995524883, "epoch": 2.7568444114754946, "grad_norm": 0.1605684906244278, "learning_rate": 8.108688318459228e-06, "loss": 0.4955, "mean_token_accuracy": 0.8441488668322563, "num_tokens": 956335006.0, "step": 29964 }, { "entropy": 0.5360419261269271, "epoch": 2.7569364178469358, "grad_norm": 0.15390412509441376, "learning_rate": 8.1056214923176e-06, "loss": 0.535, "mean_token_accuracy": 0.8333363197743893, "num_tokens": 956367613.0, "step": 29965 }, { "entropy": 0.49133007042109966, "epoch": 2.757028424218377, "grad_norm": 0.15632499754428864, "learning_rate": 8.102554666175975e-06, "loss": 0.4833, "mean_token_accuracy": 0.8466712310910225, "num_tokens": 956399774.0, "step": 29966 }, { "entropy": 0.48156578885391355, "epoch": 2.7571204305898185, "grad_norm": 0.1590673178434372, "learning_rate": 8.09948784003435e-06, "loss": 0.4774, "mean_token_accuracy": 0.8454879075288773, "num_tokens": 956430672.0, "step": 29967 }, { "entropy": 0.5677047939971089, "epoch": 2.7572124369612596, "grad_norm": 0.16338308155536652, "learning_rate": 8.096421013892723e-06, "loss": 0.5468, "mean_token_accuracy": 0.8282833956182003, "num_tokens": 956463076.0, "step": 29968 }, { "entropy": 0.4989089658483863, "epoch": 2.7573044433327007, "grad_norm": 0.1558338850736618, "learning_rate": 8.093354187751097e-06, "loss": 0.4875, "mean_token_accuracy": 0.842915765941143, "num_tokens": 956495316.0, "step": 29969 }, { "entropy": 0.5394431825261563, "epoch": 2.757396449704142, "grad_norm": 0.1568731814622879, "learning_rate": 8.09028736160947e-06, "loss": 0.5239, "mean_token_accuracy": 0.8359987437725067, "num_tokens": 956527745.0, "step": 29970 }, { "entropy": 0.5145496279001236, "epoch": 2.757488456075583, "grad_norm": 0.15942978858947754, "learning_rate": 8.087220535467845e-06, "loss": 0.5116, "mean_token_accuracy": 0.8397008292376995, "num_tokens": 956559831.0, "step": 29971 }, { "entropy": 0.4574698054930195, "epoch": 2.7575804624470246, "grad_norm": 0.15112997591495514, "learning_rate": 8.084153709326218e-06, "loss": 0.4497, "mean_token_accuracy": 0.8577198684215546, "num_tokens": 956592190.0, "step": 29972 }, { "entropy": 0.6055217105895281, "epoch": 2.7576724688184657, "grad_norm": 0.1697261780500412, "learning_rate": 8.081086883184593e-06, "loss": 0.6058, "mean_token_accuracy": 0.8109300397336483, "num_tokens": 956623711.0, "step": 29973 }, { "entropy": 0.3608243577182293, "epoch": 2.757764475189907, "grad_norm": 0.14309993386268616, "learning_rate": 8.078020057042966e-06, "loss": 0.3457, "mean_token_accuracy": 0.8879228234291077, "num_tokens": 956655428.0, "step": 29974 }, { "entropy": 0.546369576593861, "epoch": 2.757856481561348, "grad_norm": 0.16606903076171875, "learning_rate": 8.07495323090134e-06, "loss": 0.5288, "mean_token_accuracy": 0.8281718343496323, "num_tokens": 956686439.0, "step": 29975 }, { "entropy": 0.5558987748809159, "epoch": 2.757948487932789, "grad_norm": 0.16123764216899872, "learning_rate": 8.071886404759713e-06, "loss": 0.5346, "mean_token_accuracy": 0.8341857232153416, "num_tokens": 956718435.0, "step": 29976 }, { "entropy": 0.5043607288971543, "epoch": 2.7580404943042307, "grad_norm": 0.15260519087314606, "learning_rate": 8.068819578618088e-06, "loss": 0.4846, "mean_token_accuracy": 0.847457330673933, "num_tokens": 956750627.0, "step": 29977 }, { "entropy": 0.5202036374248564, "epoch": 2.758132500675672, "grad_norm": 0.15871688723564148, "learning_rate": 8.065752752476462e-06, "loss": 0.5005, "mean_token_accuracy": 0.8431636765599251, "num_tokens": 956782701.0, "step": 29978 }, { "entropy": 0.4805075703188777, "epoch": 2.758224507047113, "grad_norm": 0.1570717990398407, "learning_rate": 8.062685926334837e-06, "loss": 0.4638, "mean_token_accuracy": 0.8510277643799782, "num_tokens": 956813989.0, "step": 29979 }, { "entropy": 0.6427954100072384, "epoch": 2.758316513418554, "grad_norm": 0.1758672446012497, "learning_rate": 8.05961910019321e-06, "loss": 0.6223, "mean_token_accuracy": 0.8025556281208992, "num_tokens": 956846742.0, "step": 29980 }, { "entropy": 0.5265904229599983, "epoch": 2.7584085197899952, "grad_norm": 0.15786905586719513, "learning_rate": 8.056552274051585e-06, "loss": 0.5186, "mean_token_accuracy": 0.8361459635198116, "num_tokens": 956879014.0, "step": 29981 }, { "entropy": 0.5224381545558572, "epoch": 2.758500526161437, "grad_norm": 0.15745466947555542, "learning_rate": 8.05348544790996e-06, "loss": 0.5082, "mean_token_accuracy": 0.8368084952235222, "num_tokens": 956911472.0, "step": 29982 }, { "entropy": 0.49257446359843016, "epoch": 2.758592532532878, "grad_norm": 0.15990914404392242, "learning_rate": 8.050418621768332e-06, "loss": 0.4907, "mean_token_accuracy": 0.8467266298830509, "num_tokens": 956944227.0, "step": 29983 }, { "entropy": 0.5316358301788568, "epoch": 2.758684538904319, "grad_norm": 0.1654881089925766, "learning_rate": 8.047351795626707e-06, "loss": 0.5171, "mean_token_accuracy": 0.8355995863676071, "num_tokens": 956975295.0, "step": 29984 }, { "entropy": 0.5200402631890029, "epoch": 2.75877654527576, "grad_norm": 0.15804210305213928, "learning_rate": 8.04428496948508e-06, "loss": 0.4996, "mean_token_accuracy": 0.8363706469535828, "num_tokens": 957007116.0, "step": 29985 }, { "entropy": 0.5774671975523233, "epoch": 2.7588685516472014, "grad_norm": 0.16376914083957672, "learning_rate": 8.041218143343455e-06, "loss": 0.5699, "mean_token_accuracy": 0.8205686956644058, "num_tokens": 957039360.0, "step": 29986 }, { "entropy": 0.5137473111972213, "epoch": 2.758960558018643, "grad_norm": 0.1592244803905487, "learning_rate": 8.038151317201827e-06, "loss": 0.4949, "mean_token_accuracy": 0.8405691012740135, "num_tokens": 957070931.0, "step": 29987 }, { "entropy": 0.5160310240462422, "epoch": 2.759052564390084, "grad_norm": 0.16481052339076996, "learning_rate": 8.035084491060202e-06, "loss": 0.51, "mean_token_accuracy": 0.8380220234394073, "num_tokens": 957102966.0, "step": 29988 }, { "entropy": 0.4787656953558326, "epoch": 2.759144570761525, "grad_norm": 0.15379749238491058, "learning_rate": 8.032017664918575e-06, "loss": 0.4708, "mean_token_accuracy": 0.8497967571020126, "num_tokens": 957134852.0, "step": 29989 }, { "entropy": 0.4987211977131665, "epoch": 2.7592365771329663, "grad_norm": 0.15036554634571075, "learning_rate": 8.02895083877695e-06, "loss": 0.4844, "mean_token_accuracy": 0.8475356474518776, "num_tokens": 957166638.0, "step": 29990 }, { "entropy": 0.5079495012760162, "epoch": 2.7593285835044075, "grad_norm": 0.15850390493869781, "learning_rate": 8.025884012635323e-06, "loss": 0.4954, "mean_token_accuracy": 0.8398894518613815, "num_tokens": 957198439.0, "step": 29991 }, { "entropy": 0.554020157083869, "epoch": 2.759420589875849, "grad_norm": 0.16787739098072052, "learning_rate": 8.022817186493697e-06, "loss": 0.5242, "mean_token_accuracy": 0.8330074846744537, "num_tokens": 957229768.0, "step": 29992 }, { "entropy": 0.46518607810139656, "epoch": 2.75951259624729, "grad_norm": 0.16126543283462524, "learning_rate": 8.019750360352072e-06, "loss": 0.4373, "mean_token_accuracy": 0.8582842350006104, "num_tokens": 957258903.0, "step": 29993 }, { "entropy": 0.5858683865517378, "epoch": 2.7596046026187313, "grad_norm": 0.1705801784992218, "learning_rate": 8.016683534210447e-06, "loss": 0.5875, "mean_token_accuracy": 0.8169808499515057, "num_tokens": 957290817.0, "step": 29994 }, { "entropy": 0.5801620036363602, "epoch": 2.7596966089901724, "grad_norm": 0.17069722712039948, "learning_rate": 8.01361670806882e-06, "loss": 0.5747, "mean_token_accuracy": 0.8167169578373432, "num_tokens": 957323043.0, "step": 29995 }, { "entropy": 0.5760022159665823, "epoch": 2.7597886153616136, "grad_norm": 0.17278152704238892, "learning_rate": 8.010549881927194e-06, "loss": 0.5745, "mean_token_accuracy": 0.8192017041146755, "num_tokens": 957354048.0, "step": 29996 }, { "entropy": 0.4517498202621937, "epoch": 2.759880621733055, "grad_norm": 0.15319111943244934, "learning_rate": 8.007483055785569e-06, "loss": 0.4425, "mean_token_accuracy": 0.8572277426719666, "num_tokens": 957385724.0, "step": 29997 }, { "entropy": 0.49849338736385107, "epoch": 2.7599726281044963, "grad_norm": 0.15751083195209503, "learning_rate": 8.004416229643942e-06, "loss": 0.4874, "mean_token_accuracy": 0.8450451605021954, "num_tokens": 957417911.0, "step": 29998 }, { "entropy": 0.38173471996560693, "epoch": 2.7600646344759374, "grad_norm": 0.14470283687114716, "learning_rate": 8.001349403502316e-06, "loss": 0.3753, "mean_token_accuracy": 0.8804504200816154, "num_tokens": 957449546.0, "step": 29999 }, { "entropy": 0.6176809147000313, "epoch": 2.7601566408473786, "grad_norm": 0.1742590367794037, "learning_rate": 7.99828257736069e-06, "loss": 0.6143, "mean_token_accuracy": 0.8057381026446819, "num_tokens": 957481244.0, "step": 30000 }, { "entropy": 0.48474519653245807, "epoch": 2.7602486472188197, "grad_norm": 0.15339761972427368, "learning_rate": 7.995215751219064e-06, "loss": 0.4684, "mean_token_accuracy": 0.8524862229824066, "num_tokens": 957512942.0, "step": 30001 }, { "entropy": 0.4393643712392077, "epoch": 2.7603406535902613, "grad_norm": 0.14836761355400085, "learning_rate": 7.992148925077437e-06, "loss": 0.4297, "mean_token_accuracy": 0.8633408024907112, "num_tokens": 957545249.0, "step": 30002 }, { "entropy": 0.5136038148775697, "epoch": 2.7604326599617024, "grad_norm": 0.16176770627498627, "learning_rate": 7.989082098935812e-06, "loss": 0.5073, "mean_token_accuracy": 0.8431277945637703, "num_tokens": 957576916.0, "step": 30003 }, { "entropy": 0.5843825936317444, "epoch": 2.7605246663331435, "grad_norm": 0.16813863813877106, "learning_rate": 7.986015272794185e-06, "loss": 0.5732, "mean_token_accuracy": 0.819862850010395, "num_tokens": 957609178.0, "step": 30004 }, { "entropy": 0.570758868008852, "epoch": 2.7606166727045847, "grad_norm": 0.1675911396741867, "learning_rate": 7.98294844665256e-06, "loss": 0.55, "mean_token_accuracy": 0.8253574557602406, "num_tokens": 957640941.0, "step": 30005 }, { "entropy": 0.5549767389893532, "epoch": 2.760708679076026, "grad_norm": 0.16776308417320251, "learning_rate": 7.979881620510932e-06, "loss": 0.5369, "mean_token_accuracy": 0.8290496505796909, "num_tokens": 957671887.0, "step": 30006 }, { "entropy": 0.4716509454883635, "epoch": 2.7608006854474674, "grad_norm": 0.14672057330608368, "learning_rate": 7.976814794369307e-06, "loss": 0.4636, "mean_token_accuracy": 0.8557397276163101, "num_tokens": 957704606.0, "step": 30007 }, { "entropy": 0.49375022761523724, "epoch": 2.7608926918189085, "grad_norm": 0.1542114019393921, "learning_rate": 7.973747968227682e-06, "loss": 0.4821, "mean_token_accuracy": 0.8495172448456287, "num_tokens": 957737017.0, "step": 30008 }, { "entropy": 0.5009888093918562, "epoch": 2.7609846981903496, "grad_norm": 0.15470799803733826, "learning_rate": 7.970681142086056e-06, "loss": 0.4792, "mean_token_accuracy": 0.8454946279525757, "num_tokens": 957769032.0, "step": 30009 }, { "entropy": 0.5195128517225385, "epoch": 2.7610767045617908, "grad_norm": 0.15714654326438904, "learning_rate": 7.967614315944429e-06, "loss": 0.4997, "mean_token_accuracy": 0.8390345461666584, "num_tokens": 957800484.0, "step": 30010 }, { "entropy": 0.5079778889194131, "epoch": 2.761168710933232, "grad_norm": 0.16601811349391937, "learning_rate": 7.964547489802804e-06, "loss": 0.5015, "mean_token_accuracy": 0.8453154340386391, "num_tokens": 957832148.0, "step": 30011 }, { "entropy": 0.5134195704013109, "epoch": 2.7612607173046735, "grad_norm": 0.15933555364608765, "learning_rate": 7.961480663661178e-06, "loss": 0.4922, "mean_token_accuracy": 0.8426645696163177, "num_tokens": 957863779.0, "step": 30012 }, { "entropy": 0.5911111757159233, "epoch": 2.7613527236761146, "grad_norm": 0.1685418337583542, "learning_rate": 7.958413837519551e-06, "loss": 0.5737, "mean_token_accuracy": 0.8183853775262833, "num_tokens": 957894818.0, "step": 30013 }, { "entropy": 0.5372423976659775, "epoch": 2.7614447300475558, "grad_norm": 0.16031751036643982, "learning_rate": 7.955347011377926e-06, "loss": 0.527, "mean_token_accuracy": 0.8353006131947041, "num_tokens": 957927470.0, "step": 30014 }, { "entropy": 0.4720791387371719, "epoch": 2.761536736418997, "grad_norm": 0.14923764765262604, "learning_rate": 7.952280185236299e-06, "loss": 0.4657, "mean_token_accuracy": 0.8507525771856308, "num_tokens": 957959947.0, "step": 30015 }, { "entropy": 0.48819294082932174, "epoch": 2.761628742790438, "grad_norm": 0.15845395624637604, "learning_rate": 7.949213359094674e-06, "loss": 0.4758, "mean_token_accuracy": 0.8473623469471931, "num_tokens": 957991681.0, "step": 30016 }, { "entropy": 0.5139734854456037, "epoch": 2.7617207491618796, "grad_norm": 0.16216206550598145, "learning_rate": 7.946146532953047e-06, "loss": 0.5007, "mean_token_accuracy": 0.840963888913393, "num_tokens": 958023377.0, "step": 30017 }, { "entropy": 0.5770497601479292, "epoch": 2.7618127555333207, "grad_norm": 0.17251715064048767, "learning_rate": 7.943079706811421e-06, "loss": 0.5675, "mean_token_accuracy": 0.8222204856574535, "num_tokens": 958054709.0, "step": 30018 }, { "entropy": 0.4508885871618986, "epoch": 2.761904761904762, "grad_norm": 0.15066035091876984, "learning_rate": 7.940012880669794e-06, "loss": 0.4522, "mean_token_accuracy": 0.8573912717401981, "num_tokens": 958086436.0, "step": 30019 }, { "entropy": 0.5124559011310339, "epoch": 2.761996768276203, "grad_norm": 0.1635720282793045, "learning_rate": 7.936946054528169e-06, "loss": 0.4949, "mean_token_accuracy": 0.841806560754776, "num_tokens": 958117570.0, "step": 30020 }, { "entropy": 0.4637379082851112, "epoch": 2.762088774647644, "grad_norm": 0.1593906730413437, "learning_rate": 7.933879228386542e-06, "loss": 0.4638, "mean_token_accuracy": 0.8496413975954056, "num_tokens": 958149803.0, "step": 30021 }, { "entropy": 0.5997186279855669, "epoch": 2.7621807810190857, "grad_norm": 0.17051395773887634, "learning_rate": 7.930812402244916e-06, "loss": 0.591, "mean_token_accuracy": 0.8163600862026215, "num_tokens": 958182196.0, "step": 30022 }, { "entropy": 0.47363984026014805, "epoch": 2.762272787390527, "grad_norm": 0.1601383239030838, "learning_rate": 7.927745576103291e-06, "loss": 0.4603, "mean_token_accuracy": 0.8557040207087994, "num_tokens": 958213126.0, "step": 30023 }, { "entropy": 0.45697830989956856, "epoch": 2.762364793761968, "grad_norm": 0.14891980588436127, "learning_rate": 7.924678749961666e-06, "loss": 0.438, "mean_token_accuracy": 0.8577915243804455, "num_tokens": 958245371.0, "step": 30024 }, { "entropy": 0.441016661003232, "epoch": 2.762456800133409, "grad_norm": 0.14732810854911804, "learning_rate": 7.921611923820039e-06, "loss": 0.4266, "mean_token_accuracy": 0.8631072528660297, "num_tokens": 958277898.0, "step": 30025 }, { "entropy": 0.5536710806190968, "epoch": 2.7625488065048502, "grad_norm": 0.16535864770412445, "learning_rate": 7.918545097678413e-06, "loss": 0.5411, "mean_token_accuracy": 0.8304311782121658, "num_tokens": 958310140.0, "step": 30026 }, { "entropy": 0.4070487869903445, "epoch": 2.762640812876292, "grad_norm": 0.14777085185050964, "learning_rate": 7.915478271536788e-06, "loss": 0.3949, "mean_token_accuracy": 0.8723949640989304, "num_tokens": 958342047.0, "step": 30027 }, { "entropy": 0.5267861019819975, "epoch": 2.762732819247733, "grad_norm": 0.16180473566055298, "learning_rate": 7.912411445395161e-06, "loss": 0.5147, "mean_token_accuracy": 0.8379891589283943, "num_tokens": 958373407.0, "step": 30028 }, { "entropy": 0.40946019859984517, "epoch": 2.762824825619174, "grad_norm": 0.14804024994373322, "learning_rate": 7.909344619253536e-06, "loss": 0.4056, "mean_token_accuracy": 0.8710776530206203, "num_tokens": 958404968.0, "step": 30029 }, { "entropy": 0.4431001003831625, "epoch": 2.762916831990615, "grad_norm": 0.15147672593593597, "learning_rate": 7.906277793111909e-06, "loss": 0.4349, "mean_token_accuracy": 0.8612251505255699, "num_tokens": 958436592.0, "step": 30030 }, { "entropy": 0.5236626900732517, "epoch": 2.7630088383620564, "grad_norm": 0.16286858916282654, "learning_rate": 7.903210966970283e-06, "loss": 0.5133, "mean_token_accuracy": 0.8353176638484001, "num_tokens": 958468466.0, "step": 30031 }, { "entropy": 0.519100128673017, "epoch": 2.763100844733498, "grad_norm": 0.15544646978378296, "learning_rate": 7.900144140828656e-06, "loss": 0.499, "mean_token_accuracy": 0.8397225588560104, "num_tokens": 958500635.0, "step": 30032 }, { "entropy": 0.5416872424539179, "epoch": 2.763192851104939, "grad_norm": 0.1617060750722885, "learning_rate": 7.89707731468703e-06, "loss": 0.533, "mean_token_accuracy": 0.8311657570302486, "num_tokens": 958532372.0, "step": 30033 }, { "entropy": 0.4714395422488451, "epoch": 2.76328485747638, "grad_norm": 0.15377452969551086, "learning_rate": 7.894010488545404e-06, "loss": 0.4615, "mean_token_accuracy": 0.853739358484745, "num_tokens": 958564569.0, "step": 30034 }, { "entropy": 0.4843179890885949, "epoch": 2.7633768638478213, "grad_norm": 0.1592552661895752, "learning_rate": 7.890943662403778e-06, "loss": 0.4743, "mean_token_accuracy": 0.85071861743927, "num_tokens": 958596572.0, "step": 30035 }, { "entropy": 0.5703213345259428, "epoch": 2.7634688702192625, "grad_norm": 0.16432732343673706, "learning_rate": 7.887876836262151e-06, "loss": 0.5648, "mean_token_accuracy": 0.8241181261837482, "num_tokens": 958629033.0, "step": 30036 }, { "entropy": 0.5296684503555298, "epoch": 2.763560876590704, "grad_norm": 0.15728779137134552, "learning_rate": 7.884810010120526e-06, "loss": 0.5077, "mean_token_accuracy": 0.8361679278314114, "num_tokens": 958661139.0, "step": 30037 }, { "entropy": 0.4992525177076459, "epoch": 2.763652882962145, "grad_norm": 0.1563761979341507, "learning_rate": 7.8817431839789e-06, "loss": 0.4893, "mean_token_accuracy": 0.850221324712038, "num_tokens": 958692899.0, "step": 30038 }, { "entropy": 0.6164165968075395, "epoch": 2.7637448893335863, "grad_norm": 0.1701485961675644, "learning_rate": 7.878676357837275e-06, "loss": 0.6122, "mean_token_accuracy": 0.8068667612969875, "num_tokens": 958725282.0, "step": 30039 }, { "entropy": 0.4431082755327225, "epoch": 2.7638368957050274, "grad_norm": 0.15064550936222076, "learning_rate": 7.875609531695648e-06, "loss": 0.4256, "mean_token_accuracy": 0.8662699945271015, "num_tokens": 958757534.0, "step": 30040 }, { "entropy": 0.4146465518279001, "epoch": 2.7639289020764686, "grad_norm": 0.15072540938854218, "learning_rate": 7.872542705554023e-06, "loss": 0.4151, "mean_token_accuracy": 0.8649309426546097, "num_tokens": 958789767.0, "step": 30041 }, { "entropy": 0.5449247335782275, "epoch": 2.76402090844791, "grad_norm": 0.16225561499595642, "learning_rate": 7.869475879412398e-06, "loss": 0.5337, "mean_token_accuracy": 0.8327939994633198, "num_tokens": 958821276.0, "step": 30042 }, { "entropy": 0.4947303617373109, "epoch": 2.7641129148193513, "grad_norm": 0.15905845165252686, "learning_rate": 7.86640905327077e-06, "loss": 0.4821, "mean_token_accuracy": 0.8472255282104015, "num_tokens": 958853036.0, "step": 30043 }, { "entropy": 0.5035746432840824, "epoch": 2.7642049211907924, "grad_norm": 0.15641196072101593, "learning_rate": 7.863342227129145e-06, "loss": 0.4848, "mean_token_accuracy": 0.8465834818780422, "num_tokens": 958884968.0, "step": 30044 }, { "entropy": 0.578776319976896, "epoch": 2.7642969275622336, "grad_norm": 0.15779681503772736, "learning_rate": 7.860275400987518e-06, "loss": 0.5636, "mean_token_accuracy": 0.823757067322731, "num_tokens": 958917119.0, "step": 30045 }, { "entropy": 0.547251008450985, "epoch": 2.7643889339336747, "grad_norm": 0.1627039909362793, "learning_rate": 7.857208574845893e-06, "loss": 0.5475, "mean_token_accuracy": 0.8266423307359219, "num_tokens": 958949367.0, "step": 30046 }, { "entropy": 0.5273563181981444, "epoch": 2.7644809403051163, "grad_norm": 0.1608188897371292, "learning_rate": 7.854141748704266e-06, "loss": 0.5216, "mean_token_accuracy": 0.8365434668958187, "num_tokens": 958981855.0, "step": 30047 }, { "entropy": 0.4781040921807289, "epoch": 2.7645729466765574, "grad_norm": 0.1503126323223114, "learning_rate": 7.85107492256264e-06, "loss": 0.4603, "mean_token_accuracy": 0.8537978157401085, "num_tokens": 959013921.0, "step": 30048 }, { "entropy": 0.558137378655374, "epoch": 2.7646649530479985, "grad_norm": 0.16375525295734406, "learning_rate": 7.848008096421013e-06, "loss": 0.5416, "mean_token_accuracy": 0.8271457552909851, "num_tokens": 959046297.0, "step": 30049 }, { "entropy": 0.44291747873649, "epoch": 2.7647569594194397, "grad_norm": 0.14678139984607697, "learning_rate": 7.844941270279388e-06, "loss": 0.4236, "mean_token_accuracy": 0.8637195713818073, "num_tokens": 959078161.0, "step": 30050 }, { "entropy": 0.5329619823023677, "epoch": 2.764848965790881, "grad_norm": 0.16190147399902344, "learning_rate": 7.841874444137761e-06, "loss": 0.5166, "mean_token_accuracy": 0.8367320224642754, "num_tokens": 959109617.0, "step": 30051 }, { "entropy": 0.5082565452903509, "epoch": 2.7649409721623224, "grad_norm": 0.16024036705493927, "learning_rate": 7.838807617996136e-06, "loss": 0.5004, "mean_token_accuracy": 0.8388808071613312, "num_tokens": 959141467.0, "step": 30052 }, { "entropy": 0.5319426797796041, "epoch": 2.7650329785337635, "grad_norm": 0.1594778448343277, "learning_rate": 7.83574079185451e-06, "loss": 0.5227, "mean_token_accuracy": 0.8356972225010395, "num_tokens": 959173864.0, "step": 30053 }, { "entropy": 0.5697488989681005, "epoch": 2.7651249849052046, "grad_norm": 0.1646081805229187, "learning_rate": 7.832673965712885e-06, "loss": 0.5624, "mean_token_accuracy": 0.8234316222369671, "num_tokens": 959205434.0, "step": 30054 }, { "entropy": 0.5074060568585992, "epoch": 2.7652169912766458, "grad_norm": 0.15950417518615723, "learning_rate": 7.829607139571258e-06, "loss": 0.4993, "mean_token_accuracy": 0.8427050188183784, "num_tokens": 959236709.0, "step": 30055 }, { "entropy": 0.4954108679667115, "epoch": 2.765308997648087, "grad_norm": 0.1509591042995453, "learning_rate": 7.826540313429632e-06, "loss": 0.4766, "mean_token_accuracy": 0.8495860397815704, "num_tokens": 959268989.0, "step": 30056 }, { "entropy": 0.4670657478272915, "epoch": 2.7654010040195285, "grad_norm": 0.15351584553718567, "learning_rate": 7.823473487288007e-06, "loss": 0.4646, "mean_token_accuracy": 0.8535315170884132, "num_tokens": 959301482.0, "step": 30057 }, { "entropy": 0.5240169770549983, "epoch": 2.7654930103909696, "grad_norm": 0.1628950983285904, "learning_rate": 7.82040666114638e-06, "loss": 0.5145, "mean_token_accuracy": 0.8370962366461754, "num_tokens": 959333457.0, "step": 30058 }, { "entropy": 0.45888426434248686, "epoch": 2.7655850167624108, "grad_norm": 0.14986972510814667, "learning_rate": 7.817339835004755e-06, "loss": 0.4404, "mean_token_accuracy": 0.8576328456401825, "num_tokens": 959365209.0, "step": 30059 }, { "entropy": 0.45558553468436, "epoch": 2.765677023133852, "grad_norm": 0.1507546752691269, "learning_rate": 7.814273008863128e-06, "loss": 0.4331, "mean_token_accuracy": 0.8596733659505844, "num_tokens": 959396445.0, "step": 30060 }, { "entropy": 0.4997830595821142, "epoch": 2.765769029505293, "grad_norm": 0.1545708328485489, "learning_rate": 7.811206182721502e-06, "loss": 0.4819, "mean_token_accuracy": 0.8439701199531555, "num_tokens": 959428236.0, "step": 30061 }, { "entropy": 0.45794543880037963, "epoch": 2.7658610358767346, "grad_norm": 0.15208609402179718, "learning_rate": 7.808139356579875e-06, "loss": 0.4442, "mean_token_accuracy": 0.8608723245561123, "num_tokens": 959460323.0, "step": 30062 }, { "entropy": 0.4510920997709036, "epoch": 2.7659530422481757, "grad_norm": 0.1522589921951294, "learning_rate": 7.80507253043825e-06, "loss": 0.4313, "mean_token_accuracy": 0.857331920415163, "num_tokens": 959491791.0, "step": 30063 }, { "entropy": 0.477485170122236, "epoch": 2.766045048619617, "grad_norm": 0.15296617150306702, "learning_rate": 7.802005704296623e-06, "loss": 0.4728, "mean_token_accuracy": 0.8503394201397896, "num_tokens": 959523776.0, "step": 30064 }, { "entropy": 0.5312938038259745, "epoch": 2.766137054991058, "grad_norm": 0.17254239320755005, "learning_rate": 7.798938878154997e-06, "loss": 0.5243, "mean_token_accuracy": 0.8335315249860287, "num_tokens": 959555493.0, "step": 30065 }, { "entropy": 0.44461636152118444, "epoch": 2.766229061362499, "grad_norm": 0.1537042111158371, "learning_rate": 7.79587205201337e-06, "loss": 0.4417, "mean_token_accuracy": 0.8571821562945843, "num_tokens": 959586424.0, "step": 30066 }, { "entropy": 0.47284030821174383, "epoch": 2.7663210677339407, "grad_norm": 0.15120626986026764, "learning_rate": 7.792805225871745e-06, "loss": 0.4612, "mean_token_accuracy": 0.8517753556370735, "num_tokens": 959618622.0, "step": 30067 }, { "entropy": 0.5021800515241921, "epoch": 2.766413074105382, "grad_norm": 0.1554509699344635, "learning_rate": 7.78973839973012e-06, "loss": 0.4967, "mean_token_accuracy": 0.8417912498116493, "num_tokens": 959650219.0, "step": 30068 }, { "entropy": 0.48746518418192863, "epoch": 2.766505080476823, "grad_norm": 0.15820634365081787, "learning_rate": 7.786671573588494e-06, "loss": 0.4735, "mean_token_accuracy": 0.8483477421104908, "num_tokens": 959681659.0, "step": 30069 }, { "entropy": 0.43425661930814385, "epoch": 2.766597086848264, "grad_norm": 0.14974509179592133, "learning_rate": 7.783604747446869e-06, "loss": 0.42, "mean_token_accuracy": 0.8658670149743557, "num_tokens": 959713063.0, "step": 30070 }, { "entropy": 0.5571286845952272, "epoch": 2.7666890932197052, "grad_norm": 0.16694536805152893, "learning_rate": 7.780537921305242e-06, "loss": 0.5372, "mean_token_accuracy": 0.8303327076137066, "num_tokens": 959744977.0, "step": 30071 }, { "entropy": 0.4246750958263874, "epoch": 2.766781099591147, "grad_norm": 0.14307403564453125, "learning_rate": 7.777471095163617e-06, "loss": 0.4043, "mean_token_accuracy": 0.8715818114578724, "num_tokens": 959776910.0, "step": 30072 }, { "entropy": 0.5462467791512609, "epoch": 2.766873105962588, "grad_norm": 0.16461490094661713, "learning_rate": 7.77440426902199e-06, "loss": 0.5266, "mean_token_accuracy": 0.8364521339535713, "num_tokens": 959808026.0, "step": 30073 }, { "entropy": 0.46860216837376356, "epoch": 2.766965112334029, "grad_norm": 0.1529827117919922, "learning_rate": 7.771337442880364e-06, "loss": 0.46, "mean_token_accuracy": 0.8540273867547512, "num_tokens": 959839698.0, "step": 30074 }, { "entropy": 0.4985158839263022, "epoch": 2.76705711870547, "grad_norm": 0.15241900086402893, "learning_rate": 7.768270616738737e-06, "loss": 0.4893, "mean_token_accuracy": 0.8409603498876095, "num_tokens": 959871826.0, "step": 30075 }, { "entropy": 0.5314660102594644, "epoch": 2.7671491250769114, "grad_norm": 0.16169479489326477, "learning_rate": 7.765203790597112e-06, "loss": 0.5209, "mean_token_accuracy": 0.8362267166376114, "num_tokens": 959903863.0, "step": 30076 }, { "entropy": 0.5312954029068351, "epoch": 2.767241131448353, "grad_norm": 0.15705808997154236, "learning_rate": 7.762136964455485e-06, "loss": 0.5193, "mean_token_accuracy": 0.8358719125390053, "num_tokens": 959935745.0, "step": 30077 }, { "entropy": 0.4771018708124757, "epoch": 2.767333137819794, "grad_norm": 0.1555468887090683, "learning_rate": 7.75907013831386e-06, "loss": 0.4692, "mean_token_accuracy": 0.8483719117939472, "num_tokens": 959967614.0, "step": 30078 }, { "entropy": 0.474789930973202, "epoch": 2.767425144191235, "grad_norm": 0.1465718001127243, "learning_rate": 7.756003312172232e-06, "loss": 0.4557, "mean_token_accuracy": 0.8546957522630692, "num_tokens": 960000104.0, "step": 30079 }, { "entropy": 0.4436786463484168, "epoch": 2.7675171505626763, "grad_norm": 0.15779127180576324, "learning_rate": 7.752936486030607e-06, "loss": 0.4361, "mean_token_accuracy": 0.8598615601658821, "num_tokens": 960030647.0, "step": 30080 }, { "entropy": 0.49642858328297734, "epoch": 2.7676091569341175, "grad_norm": 0.1592485010623932, "learning_rate": 7.749869659888982e-06, "loss": 0.4859, "mean_token_accuracy": 0.8439243882894516, "num_tokens": 960061732.0, "step": 30081 }, { "entropy": 0.6079172100871801, "epoch": 2.767701163305559, "grad_norm": 0.1669425070285797, "learning_rate": 7.746802833747355e-06, "loss": 0.5952, "mean_token_accuracy": 0.8129167295992374, "num_tokens": 960093917.0, "step": 30082 }, { "entropy": 0.47738480754196644, "epoch": 2.767793169677, "grad_norm": 0.1542140543460846, "learning_rate": 7.74373600760573e-06, "loss": 0.4725, "mean_token_accuracy": 0.8509101942181587, "num_tokens": 960125577.0, "step": 30083 }, { "entropy": 0.5317522054538131, "epoch": 2.7678851760484413, "grad_norm": 0.16063496470451355, "learning_rate": 7.740669181464104e-06, "loss": 0.5134, "mean_token_accuracy": 0.834821842610836, "num_tokens": 960157983.0, "step": 30084 }, { "entropy": 0.5827318169176579, "epoch": 2.7679771824198824, "grad_norm": 0.17105095088481903, "learning_rate": 7.737602355322479e-06, "loss": 0.5694, "mean_token_accuracy": 0.8197539187967777, "num_tokens": 960189197.0, "step": 30085 }, { "entropy": 0.5049424264580011, "epoch": 2.7680691887913236, "grad_norm": 0.14799146354198456, "learning_rate": 7.734535529180852e-06, "loss": 0.4845, "mean_token_accuracy": 0.8483883738517761, "num_tokens": 960221871.0, "step": 30086 }, { "entropy": 0.5591127034276724, "epoch": 2.768161195162765, "grad_norm": 0.16333241760730743, "learning_rate": 7.731468703039226e-06, "loss": 0.5486, "mean_token_accuracy": 0.829078059643507, "num_tokens": 960254386.0, "step": 30087 }, { "entropy": 0.5397195667028427, "epoch": 2.7682532015342063, "grad_norm": 0.1579403579235077, "learning_rate": 7.728401876897599e-06, "loss": 0.5279, "mean_token_accuracy": 0.8351899832487106, "num_tokens": 960286300.0, "step": 30088 }, { "entropy": 0.5981874521821737, "epoch": 2.7683452079056474, "grad_norm": 0.174805149435997, "learning_rate": 7.725335050755974e-06, "loss": 0.5934, "mean_token_accuracy": 0.8125674277544022, "num_tokens": 960317255.0, "step": 30089 }, { "entropy": 0.5725357127375901, "epoch": 2.7684372142770886, "grad_norm": 0.16081970930099487, "learning_rate": 7.722268224614347e-06, "loss": 0.5609, "mean_token_accuracy": 0.8234420977532864, "num_tokens": 960349474.0, "step": 30090 }, { "entropy": 0.544660521671176, "epoch": 2.7685292206485297, "grad_norm": 0.1628876030445099, "learning_rate": 7.719201398472721e-06, "loss": 0.5258, "mean_token_accuracy": 0.83529132604599, "num_tokens": 960381279.0, "step": 30091 }, { "entropy": 0.46898289024829865, "epoch": 2.7686212270199713, "grad_norm": 0.15369200706481934, "learning_rate": 7.716134572331094e-06, "loss": 0.4621, "mean_token_accuracy": 0.8535637520253658, "num_tokens": 960413284.0, "step": 30092 }, { "entropy": 0.3799782444257289, "epoch": 2.7687132333914124, "grad_norm": 0.14065004885196686, "learning_rate": 7.713067746189469e-06, "loss": 0.3706, "mean_token_accuracy": 0.8803708218038082, "num_tokens": 960445566.0, "step": 30093 }, { "entropy": 0.5373425912111998, "epoch": 2.7688052397628535, "grad_norm": 0.1614452749490738, "learning_rate": 7.710000920047842e-06, "loss": 0.5325, "mean_token_accuracy": 0.8343115635216236, "num_tokens": 960478303.0, "step": 30094 }, { "entropy": 0.618566494435072, "epoch": 2.7688972461342947, "grad_norm": 0.17293521761894226, "learning_rate": 7.706934093906217e-06, "loss": 0.6126, "mean_token_accuracy": 0.8084633201360703, "num_tokens": 960509505.0, "step": 30095 }, { "entropy": 0.45195197430439293, "epoch": 2.768989252505736, "grad_norm": 0.15112872421741486, "learning_rate": 7.703867267764591e-06, "loss": 0.4446, "mean_token_accuracy": 0.8621690347790718, "num_tokens": 960541841.0, "step": 30096 }, { "entropy": 0.4985244544222951, "epoch": 2.7690812588771774, "grad_norm": 0.16164082288742065, "learning_rate": 7.700800441622964e-06, "loss": 0.4967, "mean_token_accuracy": 0.8454005941748619, "num_tokens": 960573410.0, "step": 30097 }, { "entropy": 0.48411201674025506, "epoch": 2.7691732652486185, "grad_norm": 0.1577129364013672, "learning_rate": 7.697733615481339e-06, "loss": 0.4739, "mean_token_accuracy": 0.8464302718639374, "num_tokens": 960605554.0, "step": 30098 }, { "entropy": 0.4497814476490021, "epoch": 2.7692652716200596, "grad_norm": 0.15145446360111237, "learning_rate": 7.694666789339712e-06, "loss": 0.4386, "mean_token_accuracy": 0.8569777607917786, "num_tokens": 960637927.0, "step": 30099 }, { "entropy": 0.4598412432242185, "epoch": 2.7693572779915008, "grad_norm": 0.14844313263893127, "learning_rate": 7.691599963198088e-06, "loss": 0.4451, "mean_token_accuracy": 0.8608082123100758, "num_tokens": 960670395.0, "step": 30100 }, { "entropy": 0.4575711116194725, "epoch": 2.769449284362942, "grad_norm": 0.1502234786748886, "learning_rate": 7.688533137056461e-06, "loss": 0.4452, "mean_token_accuracy": 0.8557686246931553, "num_tokens": 960702945.0, "step": 30101 }, { "entropy": 0.5411399099975824, "epoch": 2.7695412907343835, "grad_norm": 0.16386887431144714, "learning_rate": 7.685466310914836e-06, "loss": 0.5274, "mean_token_accuracy": 0.8317503593862057, "num_tokens": 960734368.0, "step": 30102 }, { "entropy": 0.5905276145786047, "epoch": 2.7696332971058246, "grad_norm": 0.17647685110569, "learning_rate": 7.682399484773209e-06, "loss": 0.5734, "mean_token_accuracy": 0.8171955868601799, "num_tokens": 960764490.0, "step": 30103 }, { "entropy": 0.5593867730349302, "epoch": 2.7697253034772658, "grad_norm": 0.17242586612701416, "learning_rate": 7.679332658631583e-06, "loss": 0.548, "mean_token_accuracy": 0.825010385364294, "num_tokens": 960795733.0, "step": 30104 }, { "entropy": 0.5482597695663571, "epoch": 2.769817309848707, "grad_norm": 0.1601020097732544, "learning_rate": 7.676265832489956e-06, "loss": 0.5383, "mean_token_accuracy": 0.8295603543519974, "num_tokens": 960828500.0, "step": 30105 }, { "entropy": 0.5967402551323175, "epoch": 2.769909316220148, "grad_norm": 0.16882774233818054, "learning_rate": 7.673199006348331e-06, "loss": 0.5805, "mean_token_accuracy": 0.8186974786221981, "num_tokens": 960859633.0, "step": 30106 }, { "entropy": 0.5308121517300606, "epoch": 2.7700013225915896, "grad_norm": 0.15880228579044342, "learning_rate": 7.670132180206704e-06, "loss": 0.5166, "mean_token_accuracy": 0.8377617448568344, "num_tokens": 960891690.0, "step": 30107 }, { "entropy": 0.5584489731118083, "epoch": 2.7700933289630307, "grad_norm": 0.16274955868721008, "learning_rate": 7.667065354065079e-06, "loss": 0.5482, "mean_token_accuracy": 0.8254114575684071, "num_tokens": 960923595.0, "step": 30108 }, { "entropy": 0.5679116537794471, "epoch": 2.770185335334472, "grad_norm": 0.1640646904706955, "learning_rate": 7.663998527923451e-06, "loss": 0.5733, "mean_token_accuracy": 0.8205646425485611, "num_tokens": 960955316.0, "step": 30109 }, { "entropy": 0.5328402773011476, "epoch": 2.770277341705913, "grad_norm": 0.15464037656784058, "learning_rate": 7.660931701781826e-06, "loss": 0.5146, "mean_token_accuracy": 0.8353264629840851, "num_tokens": 960987542.0, "step": 30110 }, { "entropy": 0.5474590891972184, "epoch": 2.770369348077354, "grad_norm": 0.17020855844020844, "learning_rate": 7.6578648756402e-06, "loss": 0.5459, "mean_token_accuracy": 0.8308403603732586, "num_tokens": 961018428.0, "step": 30111 }, { "entropy": 0.5312814535573125, "epoch": 2.7704613544487957, "grad_norm": 0.1591482311487198, "learning_rate": 7.654798049498574e-06, "loss": 0.5142, "mean_token_accuracy": 0.8349974080920219, "num_tokens": 961050103.0, "step": 30112 }, { "entropy": 0.4967648321762681, "epoch": 2.770553360820237, "grad_norm": 0.15291793644428253, "learning_rate": 7.651731223356948e-06, "loss": 0.4829, "mean_token_accuracy": 0.8478329256176949, "num_tokens": 961082639.0, "step": 30113 }, { "entropy": 0.44045969750732183, "epoch": 2.770645367191678, "grad_norm": 0.15030217170715332, "learning_rate": 7.648664397215321e-06, "loss": 0.438, "mean_token_accuracy": 0.8607475981116295, "num_tokens": 961114814.0, "step": 30114 }, { "entropy": 0.4709740597754717, "epoch": 2.770737373563119, "grad_norm": 0.15674304962158203, "learning_rate": 7.645597571073698e-06, "loss": 0.464, "mean_token_accuracy": 0.855041392147541, "num_tokens": 961147095.0, "step": 30115 }, { "entropy": 0.5020008618012071, "epoch": 2.7708293799345602, "grad_norm": 0.15775451064109802, "learning_rate": 7.64253074493207e-06, "loss": 0.4916, "mean_token_accuracy": 0.8475651778280735, "num_tokens": 961179438.0, "step": 30116 }, { "entropy": 0.45951219368726015, "epoch": 2.770921386306002, "grad_norm": 0.15820825099945068, "learning_rate": 7.639463918790445e-06, "loss": 0.4521, "mean_token_accuracy": 0.8545589745044708, "num_tokens": 961211240.0, "step": 30117 }, { "entropy": 0.4877900304272771, "epoch": 2.771013392677443, "grad_norm": 0.15465344488620758, "learning_rate": 7.636397092648818e-06, "loss": 0.4719, "mean_token_accuracy": 0.8534874022006989, "num_tokens": 961243147.0, "step": 30118 }, { "entropy": 0.616034097969532, "epoch": 2.771105399048884, "grad_norm": 0.17276206612586975, "learning_rate": 7.633330266507193e-06, "loss": 0.6042, "mean_token_accuracy": 0.809585478156805, "num_tokens": 961274972.0, "step": 30119 }, { "entropy": 0.5134818106889725, "epoch": 2.771197405420325, "grad_norm": 0.1640978753566742, "learning_rate": 7.630263440365566e-06, "loss": 0.506, "mean_token_accuracy": 0.8401167690753937, "num_tokens": 961306557.0, "step": 30120 }, { "entropy": 0.3888130243867636, "epoch": 2.7712894117917664, "grad_norm": 0.14123201370239258, "learning_rate": 7.6271966142239405e-06, "loss": 0.3809, "mean_token_accuracy": 0.8772269859910011, "num_tokens": 961338854.0, "step": 30121 }, { "entropy": 0.6092704478651285, "epoch": 2.771381418163208, "grad_norm": 0.17262588441371918, "learning_rate": 7.624129788082314e-06, "loss": 0.5965, "mean_token_accuracy": 0.81248864158988, "num_tokens": 961370835.0, "step": 30122 }, { "entropy": 0.4776209418196231, "epoch": 2.771473424534649, "grad_norm": 0.15470457077026367, "learning_rate": 7.621062961940688e-06, "loss": 0.4566, "mean_token_accuracy": 0.8520879447460175, "num_tokens": 961402793.0, "step": 30123 }, { "entropy": 0.5453309919685125, "epoch": 2.77156543090609, "grad_norm": 0.16032670438289642, "learning_rate": 7.617996135799062e-06, "loss": 0.5258, "mean_token_accuracy": 0.8363240845501423, "num_tokens": 961434951.0, "step": 30124 }, { "entropy": 0.5720095941796899, "epoch": 2.7716574372775313, "grad_norm": 0.1607406884431839, "learning_rate": 7.614929309657436e-06, "loss": 0.5638, "mean_token_accuracy": 0.8213072009384632, "num_tokens": 961467474.0, "step": 30125 }, { "entropy": 0.5760832540690899, "epoch": 2.7717494436489725, "grad_norm": 0.17169930040836334, "learning_rate": 7.6118624835158095e-06, "loss": 0.5727, "mean_token_accuracy": 0.8189746476709843, "num_tokens": 961499188.0, "step": 30126 }, { "entropy": 0.5180882681161165, "epoch": 2.771841450020414, "grad_norm": 0.15851587057113647, "learning_rate": 7.608795657374183e-06, "loss": 0.5041, "mean_token_accuracy": 0.8436696156859398, "num_tokens": 961531445.0, "step": 30127 }, { "entropy": 0.4494654922746122, "epoch": 2.771933456391855, "grad_norm": 0.14811749756336212, "learning_rate": 7.605728831232557e-06, "loss": 0.4417, "mean_token_accuracy": 0.8608969449996948, "num_tokens": 961563882.0, "step": 30128 }, { "entropy": 0.5981818032450974, "epoch": 2.7720254627632963, "grad_norm": 0.1720881164073944, "learning_rate": 7.602662005090931e-06, "loss": 0.588, "mean_token_accuracy": 0.81603067740798, "num_tokens": 961595769.0, "step": 30129 }, { "entropy": 0.5621543901506811, "epoch": 2.7721174691347374, "grad_norm": 0.16507165133953094, "learning_rate": 7.599595178949306e-06, "loss": 0.5485, "mean_token_accuracy": 0.8310214355587959, "num_tokens": 961627864.0, "step": 30130 }, { "entropy": 0.4864246482029557, "epoch": 2.7722094755061786, "grad_norm": 0.1601085066795349, "learning_rate": 7.59652835280768e-06, "loss": 0.4757, "mean_token_accuracy": 0.8477525152266026, "num_tokens": 961659768.0, "step": 30131 }, { "entropy": 0.4337195814587176, "epoch": 2.77230148187762, "grad_norm": 0.14900055527687073, "learning_rate": 7.593461526666054e-06, "loss": 0.4342, "mean_token_accuracy": 0.8624806366860867, "num_tokens": 961692386.0, "step": 30132 }, { "entropy": 0.45071278885006905, "epoch": 2.7723934882490613, "grad_norm": 0.15443088114261627, "learning_rate": 7.590394700524428e-06, "loss": 0.4357, "mean_token_accuracy": 0.8599382489919662, "num_tokens": 961724817.0, "step": 30133 }, { "entropy": 0.5164574556984007, "epoch": 2.7724854946205024, "grad_norm": 0.1600361466407776, "learning_rate": 7.587327874382802e-06, "loss": 0.4904, "mean_token_accuracy": 0.8431217223405838, "num_tokens": 961755924.0, "step": 30134 }, { "entropy": 0.5456388090969995, "epoch": 2.7725775009919436, "grad_norm": 0.16571730375289917, "learning_rate": 7.584261048241175e-06, "loss": 0.5393, "mean_token_accuracy": 0.833349771797657, "num_tokens": 961786625.0, "step": 30135 }, { "entropy": 0.5090715894475579, "epoch": 2.7726695073633847, "grad_norm": 0.16041484475135803, "learning_rate": 7.58119422209955e-06, "loss": 0.5022, "mean_token_accuracy": 0.8414842300117016, "num_tokens": 961817883.0, "step": 30136 }, { "entropy": 0.5417686172295362, "epoch": 2.7727615137348263, "grad_norm": 0.16650491952896118, "learning_rate": 7.578127395957924e-06, "loss": 0.5438, "mean_token_accuracy": 0.8278916142880917, "num_tokens": 961850040.0, "step": 30137 }, { "entropy": 0.5481363078579307, "epoch": 2.7728535201062674, "grad_norm": 0.16506806015968323, "learning_rate": 7.575060569816298e-06, "loss": 0.5373, "mean_token_accuracy": 0.8301356546580791, "num_tokens": 961881777.0, "step": 30138 }, { "entropy": 0.4776026784675196, "epoch": 2.7729455264777085, "grad_norm": 0.15072974562644958, "learning_rate": 7.5719937436746714e-06, "loss": 0.4545, "mean_token_accuracy": 0.8557584099471569, "num_tokens": 961914163.0, "step": 30139 }, { "entropy": 0.5529961062129587, "epoch": 2.7730375328491497, "grad_norm": 0.16241300106048584, "learning_rate": 7.568926917533045e-06, "loss": 0.5419, "mean_token_accuracy": 0.8268226385116577, "num_tokens": 961945736.0, "step": 30140 }, { "entropy": 0.4368950469652191, "epoch": 2.773129539220591, "grad_norm": 0.14588132500648499, "learning_rate": 7.565860091391419e-06, "loss": 0.4197, "mean_token_accuracy": 0.865342278033495, "num_tokens": 961978045.0, "step": 30141 }, { "entropy": 0.5126914056017995, "epoch": 2.7732215455920324, "grad_norm": 0.16245803236961365, "learning_rate": 7.562793265249793e-06, "loss": 0.5109, "mean_token_accuracy": 0.8357092216610909, "num_tokens": 962009564.0, "step": 30142 }, { "entropy": 0.4612105544656515, "epoch": 2.7733135519634735, "grad_norm": 0.15134043991565704, "learning_rate": 7.559726439108167e-06, "loss": 0.4535, "mean_token_accuracy": 0.8537138812243938, "num_tokens": 962041766.0, "step": 30143 }, { "entropy": 0.5731869013980031, "epoch": 2.7734055583349146, "grad_norm": 0.16914604604244232, "learning_rate": 7.5566596129665404e-06, "loss": 0.5515, "mean_token_accuracy": 0.8232237920165062, "num_tokens": 962072915.0, "step": 30144 }, { "entropy": 0.44520464539527893, "epoch": 2.773497564706356, "grad_norm": 0.15309633314609528, "learning_rate": 7.553592786824916e-06, "loss": 0.4338, "mean_token_accuracy": 0.862535510212183, "num_tokens": 962104748.0, "step": 30145 }, { "entropy": 0.6381418006494641, "epoch": 2.773589571077797, "grad_norm": 0.17498357594013214, "learning_rate": 7.55052596068329e-06, "loss": 0.6225, "mean_token_accuracy": 0.8030645065009594, "num_tokens": 962136123.0, "step": 30146 }, { "entropy": 0.5370819671079516, "epoch": 2.7736815774492385, "grad_norm": 0.1641584187746048, "learning_rate": 7.5474591345416635e-06, "loss": 0.5364, "mean_token_accuracy": 0.8312121331691742, "num_tokens": 962167883.0, "step": 30147 }, { "entropy": 0.46103311236947775, "epoch": 2.7737735838206796, "grad_norm": 0.1550750434398651, "learning_rate": 7.544392308400037e-06, "loss": 0.4496, "mean_token_accuracy": 0.8588683940470219, "num_tokens": 962200006.0, "step": 30148 }, { "entropy": 0.4717797467019409, "epoch": 2.7738655901921208, "grad_norm": 0.15585917234420776, "learning_rate": 7.541325482258411e-06, "loss": 0.4632, "mean_token_accuracy": 0.8510122373700142, "num_tokens": 962232299.0, "step": 30149 }, { "entropy": 0.5431217034347355, "epoch": 2.773957596563562, "grad_norm": 0.15874168276786804, "learning_rate": 7.538258656116785e-06, "loss": 0.5157, "mean_token_accuracy": 0.830884825438261, "num_tokens": 962263699.0, "step": 30150 }, { "entropy": 0.5018594323191792, "epoch": 2.774049602935003, "grad_norm": 0.1509477198123932, "learning_rate": 7.53519182997516e-06, "loss": 0.4889, "mean_token_accuracy": 0.8459714725613594, "num_tokens": 962296220.0, "step": 30151 }, { "entropy": 0.5741939581930637, "epoch": 2.7741416093064446, "grad_norm": 0.16467346251010895, "learning_rate": 7.532125003833533e-06, "loss": 0.5689, "mean_token_accuracy": 0.8253219202160835, "num_tokens": 962328033.0, "step": 30152 }, { "entropy": 0.4772661894094199, "epoch": 2.7742336156778857, "grad_norm": 0.14806906878948212, "learning_rate": 7.529058177691907e-06, "loss": 0.4641, "mean_token_accuracy": 0.8530820310115814, "num_tokens": 962360522.0, "step": 30153 }, { "entropy": 0.5128633584827185, "epoch": 2.774325622049327, "grad_norm": 0.15550173819065094, "learning_rate": 7.525991351550281e-06, "loss": 0.498, "mean_token_accuracy": 0.8420321121811867, "num_tokens": 962392515.0, "step": 30154 }, { "entropy": 0.5179773396812379, "epoch": 2.774417628420768, "grad_norm": 0.1571410447359085, "learning_rate": 7.522924525408655e-06, "loss": 0.5055, "mean_token_accuracy": 0.8388318754732609, "num_tokens": 962424579.0, "step": 30155 }, { "entropy": 0.5652625244110823, "epoch": 2.774509634792209, "grad_norm": 0.16821259260177612, "learning_rate": 7.519857699267029e-06, "loss": 0.555, "mean_token_accuracy": 0.8248301856219769, "num_tokens": 962456317.0, "step": 30156 }, { "entropy": 0.44014307018369436, "epoch": 2.7746016411636507, "grad_norm": 0.14918428659439087, "learning_rate": 7.516790873125402e-06, "loss": 0.4337, "mean_token_accuracy": 0.8608517162501812, "num_tokens": 962488770.0, "step": 30157 }, { "entropy": 0.5108698960393667, "epoch": 2.774693647535092, "grad_norm": 0.15893830358982086, "learning_rate": 7.513724046983776e-06, "loss": 0.5008, "mean_token_accuracy": 0.8399659991264343, "num_tokens": 962520064.0, "step": 30158 }, { "entropy": 0.409782649949193, "epoch": 2.774785653906533, "grad_norm": 0.1438545137643814, "learning_rate": 7.51065722084215e-06, "loss": 0.3926, "mean_token_accuracy": 0.873170331120491, "num_tokens": 962552042.0, "step": 30159 }, { "entropy": 0.5585016654804349, "epoch": 2.774877660277974, "grad_norm": 0.16587771475315094, "learning_rate": 7.507590394700524e-06, "loss": 0.5454, "mean_token_accuracy": 0.8288860954344273, "num_tokens": 962583879.0, "step": 30160 }, { "entropy": 0.5395308425650001, "epoch": 2.7749696666494152, "grad_norm": 0.16116905212402344, "learning_rate": 7.504523568558899e-06, "loss": 0.5351, "mean_token_accuracy": 0.8317674659192562, "num_tokens": 962615419.0, "step": 30161 }, { "entropy": 0.5080512026324868, "epoch": 2.775061673020857, "grad_norm": 0.15993373095989227, "learning_rate": 7.501456742417273e-06, "loss": 0.4966, "mean_token_accuracy": 0.8407741971313953, "num_tokens": 962646956.0, "step": 30162 }, { "entropy": 0.4959452087059617, "epoch": 2.775153679392298, "grad_norm": 0.16478511691093445, "learning_rate": 7.498389916275647e-06, "loss": 0.4902, "mean_token_accuracy": 0.8415189757943153, "num_tokens": 962678972.0, "step": 30163 }, { "entropy": 0.5165138747543097, "epoch": 2.775245685763739, "grad_norm": 0.16010916233062744, "learning_rate": 7.495323090134021e-06, "loss": 0.5098, "mean_token_accuracy": 0.8369176350533962, "num_tokens": 962711014.0, "step": 30164 }, { "entropy": 0.4998969929292798, "epoch": 2.7753376921351802, "grad_norm": 0.15684524178504944, "learning_rate": 7.4922562639923945e-06, "loss": 0.4832, "mean_token_accuracy": 0.8411190062761307, "num_tokens": 962742216.0, "step": 30165 }, { "entropy": 0.4070316720753908, "epoch": 2.7754296985066214, "grad_norm": 0.14582602679729462, "learning_rate": 7.489189437850769e-06, "loss": 0.3999, "mean_token_accuracy": 0.8730569258332253, "num_tokens": 962773605.0, "step": 30166 }, { "entropy": 0.41355462465435266, "epoch": 2.775521704878063, "grad_norm": 0.14229656755924225, "learning_rate": 7.486122611709143e-06, "loss": 0.3911, "mean_token_accuracy": 0.8732373453676701, "num_tokens": 962805884.0, "step": 30167 }, { "entropy": 0.479584245942533, "epoch": 2.775613711249504, "grad_norm": 0.1595303863286972, "learning_rate": 7.483055785567517e-06, "loss": 0.4779, "mean_token_accuracy": 0.8469848223030567, "num_tokens": 962838174.0, "step": 30168 }, { "entropy": 0.43994728999678046, "epoch": 2.775705717620945, "grad_norm": 0.14525434374809265, "learning_rate": 7.4799889594258905e-06, "loss": 0.4229, "mean_token_accuracy": 0.8660310991108418, "num_tokens": 962870627.0, "step": 30169 }, { "entropy": 0.5471788384020329, "epoch": 2.7757977239923863, "grad_norm": 0.17115166783332825, "learning_rate": 7.476922133284264e-06, "loss": 0.5448, "mean_token_accuracy": 0.824146531522274, "num_tokens": 962901400.0, "step": 30170 }, { "entropy": 0.5363881383091211, "epoch": 2.7758897303638275, "grad_norm": 0.16021664440631866, "learning_rate": 7.473855307142638e-06, "loss": 0.5264, "mean_token_accuracy": 0.8362605608999729, "num_tokens": 962932809.0, "step": 30171 }, { "entropy": 0.5775961745530367, "epoch": 2.775981736735269, "grad_norm": 0.1741124987602234, "learning_rate": 7.470788481001012e-06, "loss": 0.5789, "mean_token_accuracy": 0.8181728422641754, "num_tokens": 962963665.0, "step": 30172 }, { "entropy": 0.5629171495093033, "epoch": 2.77607374310671, "grad_norm": 0.1630399078130722, "learning_rate": 7.467721654859386e-06, "loss": 0.564, "mean_token_accuracy": 0.8194240219891071, "num_tokens": 962995818.0, "step": 30173 }, { "entropy": 0.6260162685066462, "epoch": 2.7761657494781513, "grad_norm": 0.16996872425079346, "learning_rate": 7.4646548287177595e-06, "loss": 0.617, "mean_token_accuracy": 0.8071018569171429, "num_tokens": 963027963.0, "step": 30174 }, { "entropy": 0.5603058841079473, "epoch": 2.7762577558495924, "grad_norm": 0.1598076969385147, "learning_rate": 7.461588002576133e-06, "loss": 0.5531, "mean_token_accuracy": 0.8285120576620102, "num_tokens": 963059709.0, "step": 30175 }, { "entropy": 0.6541766654700041, "epoch": 2.7763497622210336, "grad_norm": 0.1742902547121048, "learning_rate": 7.458521176434509e-06, "loss": 0.6295, "mean_token_accuracy": 0.8022371456027031, "num_tokens": 963090375.0, "step": 30176 }, { "entropy": 0.5632693893276155, "epoch": 2.776441768592475, "grad_norm": 0.16292855143547058, "learning_rate": 7.455454350292883e-06, "loss": 0.548, "mean_token_accuracy": 0.8264997340738773, "num_tokens": 963121731.0, "step": 30177 }, { "entropy": 0.5391836911439896, "epoch": 2.7765337749639163, "grad_norm": 0.16310860216617584, "learning_rate": 7.4523875241512564e-06, "loss": 0.5258, "mean_token_accuracy": 0.8328126557171345, "num_tokens": 963153450.0, "step": 30178 }, { "entropy": 0.48508715629577637, "epoch": 2.7766257813353574, "grad_norm": 0.1502898782491684, "learning_rate": 7.44932069800963e-06, "loss": 0.4724, "mean_token_accuracy": 0.849189143627882, "num_tokens": 963185980.0, "step": 30179 }, { "entropy": 0.4216093705035746, "epoch": 2.7767177877067986, "grad_norm": 0.1458195447921753, "learning_rate": 7.446253871868004e-06, "loss": 0.4129, "mean_token_accuracy": 0.8683932535350323, "num_tokens": 963218016.0, "step": 30180 }, { "entropy": 0.44914725003764033, "epoch": 2.7768097940782397, "grad_norm": 0.1493915468454361, "learning_rate": 7.443187045726379e-06, "loss": 0.4296, "mean_token_accuracy": 0.8628692626953125, "num_tokens": 963249774.0, "step": 30181 }, { "entropy": 0.5806281166151166, "epoch": 2.7769018004496813, "grad_norm": 0.16578975319862366, "learning_rate": 7.4401202195847525e-06, "loss": 0.5676, "mean_token_accuracy": 0.8185931481420994, "num_tokens": 963281623.0, "step": 30182 }, { "entropy": 0.5914466353133321, "epoch": 2.7769938068211224, "grad_norm": 0.1725785732269287, "learning_rate": 7.437053393443126e-06, "loss": 0.5884, "mean_token_accuracy": 0.8153646178543568, "num_tokens": 963314053.0, "step": 30183 }, { "entropy": 0.48391136061400175, "epoch": 2.7770858131925635, "grad_norm": 0.15843309462070465, "learning_rate": 7.4339865673015e-06, "loss": 0.4711, "mean_token_accuracy": 0.8478245623409748, "num_tokens": 963346211.0, "step": 30184 }, { "entropy": 0.47382583329454064, "epoch": 2.7771778195640047, "grad_norm": 0.15393872559070587, "learning_rate": 7.430919741159874e-06, "loss": 0.4646, "mean_token_accuracy": 0.8509871028363705, "num_tokens": 963378763.0, "step": 30185 }, { "entropy": 0.5307508653495461, "epoch": 2.777269825935446, "grad_norm": 0.15959204733371735, "learning_rate": 7.427852915018248e-06, "loss": 0.5233, "mean_token_accuracy": 0.8351945877075195, "num_tokens": 963411387.0, "step": 30186 }, { "entropy": 0.5093901269137859, "epoch": 2.7773618323068874, "grad_norm": 0.15609899163246155, "learning_rate": 7.4247860888766215e-06, "loss": 0.4868, "mean_token_accuracy": 0.8389490768313408, "num_tokens": 963442642.0, "step": 30187 }, { "entropy": 0.5936266761273146, "epoch": 2.7774538386783285, "grad_norm": 0.16244499385356903, "learning_rate": 7.421719262734995e-06, "loss": 0.5808, "mean_token_accuracy": 0.8163107521831989, "num_tokens": 963474750.0, "step": 30188 }, { "entropy": 0.5114194257184863, "epoch": 2.7775458450497696, "grad_norm": 0.15402820706367493, "learning_rate": 7.418652436593369e-06, "loss": 0.4995, "mean_token_accuracy": 0.8428052514791489, "num_tokens": 963507113.0, "step": 30189 }, { "entropy": 0.5158021040260792, "epoch": 2.777637851421211, "grad_norm": 0.16295546293258667, "learning_rate": 7.415585610451743e-06, "loss": 0.5096, "mean_token_accuracy": 0.8369320333003998, "num_tokens": 963538301.0, "step": 30190 }, { "entropy": 0.4419727437198162, "epoch": 2.777729857792652, "grad_norm": 0.14854229986667633, "learning_rate": 7.412518784310118e-06, "loss": 0.4314, "mean_token_accuracy": 0.8630095459520817, "num_tokens": 963570313.0, "step": 30191 }, { "entropy": 0.4240782540291548, "epoch": 2.7778218641640935, "grad_norm": 0.14779651165008545, "learning_rate": 7.409451958168492e-06, "loss": 0.4068, "mean_token_accuracy": 0.8651255704462528, "num_tokens": 963602046.0, "step": 30192 }, { "entropy": 0.4923437489196658, "epoch": 2.7779138705355346, "grad_norm": 0.15356415510177612, "learning_rate": 7.406385132026866e-06, "loss": 0.4719, "mean_token_accuracy": 0.8518034070730209, "num_tokens": 963634139.0, "step": 30193 }, { "entropy": 0.5523361964151263, "epoch": 2.7780058769069758, "grad_norm": 0.16432617604732513, "learning_rate": 7.40331830588524e-06, "loss": 0.5511, "mean_token_accuracy": 0.8259831294417381, "num_tokens": 963665574.0, "step": 30194 }, { "entropy": 0.49316915310919285, "epoch": 2.778097883278417, "grad_norm": 0.15447719395160675, "learning_rate": 7.400251479743614e-06, "loss": 0.476, "mean_token_accuracy": 0.8481652624905109, "num_tokens": 963697546.0, "step": 30195 }, { "entropy": 0.5209617149084806, "epoch": 2.778189889649858, "grad_norm": 0.16003194451332092, "learning_rate": 7.397184653601988e-06, "loss": 0.5027, "mean_token_accuracy": 0.843558955937624, "num_tokens": 963730234.0, "step": 30196 }, { "entropy": 0.4825946483761072, "epoch": 2.7782818960212996, "grad_norm": 0.15402637422084808, "learning_rate": 7.394117827460362e-06, "loss": 0.4683, "mean_token_accuracy": 0.8502178341150284, "num_tokens": 963761953.0, "step": 30197 }, { "entropy": 0.45032392628490925, "epoch": 2.7783739023927407, "grad_norm": 0.15132655203342438, "learning_rate": 7.391051001318736e-06, "loss": 0.4419, "mean_token_accuracy": 0.8580700010061264, "num_tokens": 963794210.0, "step": 30198 }, { "entropy": 0.4964128518477082, "epoch": 2.778465908764182, "grad_norm": 0.15600095689296722, "learning_rate": 7.38798417517711e-06, "loss": 0.4925, "mean_token_accuracy": 0.8480581976473331, "num_tokens": 963826283.0, "step": 30199 }, { "entropy": 0.45562771055847406, "epoch": 2.778557915135623, "grad_norm": 0.153010755777359, "learning_rate": 7.3849173490354834e-06, "loss": 0.4487, "mean_token_accuracy": 0.8576132990419865, "num_tokens": 963858376.0, "step": 30200 }, { "entropy": 0.465802135062404, "epoch": 2.778649921507064, "grad_norm": 0.14996182918548584, "learning_rate": 7.381850522893857e-06, "loss": 0.447, "mean_token_accuracy": 0.8610555082559586, "num_tokens": 963890590.0, "step": 30201 }, { "entropy": 0.5179488565772772, "epoch": 2.7787419278785057, "grad_norm": 0.152180016040802, "learning_rate": 7.378783696752231e-06, "loss": 0.4998, "mean_token_accuracy": 0.8401413969695568, "num_tokens": 963922903.0, "step": 30202 }, { "entropy": 0.5416790703311563, "epoch": 2.778833934249947, "grad_norm": 0.16073167324066162, "learning_rate": 7.375716870610605e-06, "loss": 0.534, "mean_token_accuracy": 0.8320708051323891, "num_tokens": 963955414.0, "step": 30203 }, { "entropy": 0.49289532098919153, "epoch": 2.778925940621388, "grad_norm": 0.15420010685920715, "learning_rate": 7.372650044468979e-06, "loss": 0.4783, "mean_token_accuracy": 0.8495307043194771, "num_tokens": 963987450.0, "step": 30204 }, { "entropy": 0.4943456156179309, "epoch": 2.779017946992829, "grad_norm": 0.15993814170360565, "learning_rate": 7.3695832183273524e-06, "loss": 0.4903, "mean_token_accuracy": 0.8460084795951843, "num_tokens": 964018527.0, "step": 30205 }, { "entropy": 0.49539165012538433, "epoch": 2.7791099533642702, "grad_norm": 0.15868693590164185, "learning_rate": 7.366516392185728e-06, "loss": 0.4889, "mean_token_accuracy": 0.8440982587635517, "num_tokens": 964050039.0, "step": 30206 }, { "entropy": 0.4475355315953493, "epoch": 2.779201959735712, "grad_norm": 0.15052904188632965, "learning_rate": 7.363449566044102e-06, "loss": 0.4433, "mean_token_accuracy": 0.8591947630047798, "num_tokens": 964082284.0, "step": 30207 }, { "entropy": 0.5013934560120106, "epoch": 2.779293966107153, "grad_norm": 0.1533956229686737, "learning_rate": 7.3603827399024755e-06, "loss": 0.4911, "mean_token_accuracy": 0.8458231985569, "num_tokens": 964114535.0, "step": 30208 }, { "entropy": 0.5395748885348439, "epoch": 2.779385972478594, "grad_norm": 0.1638399213552475, "learning_rate": 7.357315913760849e-06, "loss": 0.531, "mean_token_accuracy": 0.8327121287584305, "num_tokens": 964146928.0, "step": 30209 }, { "entropy": 0.6122716274112463, "epoch": 2.7794779788500352, "grad_norm": 0.17003817856311798, "learning_rate": 7.354249087619223e-06, "loss": 0.6063, "mean_token_accuracy": 0.8109495714306831, "num_tokens": 964178968.0, "step": 30210 }, { "entropy": 0.4864313034340739, "epoch": 2.7795699852214764, "grad_norm": 0.15327675640583038, "learning_rate": 7.351182261477598e-06, "loss": 0.4686, "mean_token_accuracy": 0.8483983092010021, "num_tokens": 964211260.0, "step": 30211 }, { "entropy": 0.44525654474273324, "epoch": 2.779661991592918, "grad_norm": 0.14571832120418549, "learning_rate": 7.348115435335972e-06, "loss": 0.4324, "mean_token_accuracy": 0.8639616034924984, "num_tokens": 964243710.0, "step": 30212 }, { "entropy": 0.5085922749713063, "epoch": 2.779753997964359, "grad_norm": 0.1567225158214569, "learning_rate": 7.345048609194345e-06, "loss": 0.4954, "mean_token_accuracy": 0.8407198116183281, "num_tokens": 964275215.0, "step": 30213 }, { "entropy": 0.5151178520172834, "epoch": 2.7798460043358, "grad_norm": 0.16316024959087372, "learning_rate": 7.341981783052719e-06, "loss": 0.5003, "mean_token_accuracy": 0.8391397595405579, "num_tokens": 964306633.0, "step": 30214 }, { "entropy": 0.45568674383684993, "epoch": 2.7799380107072413, "grad_norm": 0.14779268205165863, "learning_rate": 7.338914956911093e-06, "loss": 0.4516, "mean_token_accuracy": 0.8593921139836311, "num_tokens": 964339088.0, "step": 30215 }, { "entropy": 0.4099721135571599, "epoch": 2.7800300170786825, "grad_norm": 0.14640162885189056, "learning_rate": 7.335848130769467e-06, "loss": 0.3975, "mean_token_accuracy": 0.8714005649089813, "num_tokens": 964370812.0, "step": 30216 }, { "entropy": 0.5262605315074325, "epoch": 2.780122023450124, "grad_norm": 0.157334566116333, "learning_rate": 7.332781304627841e-06, "loss": 0.5142, "mean_token_accuracy": 0.8375514857470989, "num_tokens": 964402664.0, "step": 30217 }, { "entropy": 0.611907402984798, "epoch": 2.780214029821565, "grad_norm": 0.16840872168540955, "learning_rate": 7.329714478486214e-06, "loss": 0.5984, "mean_token_accuracy": 0.8159163556993008, "num_tokens": 964435135.0, "step": 30218 }, { "entropy": 0.5383710730820894, "epoch": 2.7803060361930063, "grad_norm": 0.16568809747695923, "learning_rate": 7.326647652344588e-06, "loss": 0.5294, "mean_token_accuracy": 0.8303337953984737, "num_tokens": 964466144.0, "step": 30219 }, { "entropy": 0.4715210283175111, "epoch": 2.7803980425644474, "grad_norm": 0.15024176239967346, "learning_rate": 7.323580826202962e-06, "loss": 0.4615, "mean_token_accuracy": 0.8519033268094063, "num_tokens": 964498798.0, "step": 30220 }, { "entropy": 0.45935837586876005, "epoch": 2.7804900489358886, "grad_norm": 0.1501939594745636, "learning_rate": 7.320514000061336e-06, "loss": 0.4513, "mean_token_accuracy": 0.8565562777221203, "num_tokens": 964530833.0, "step": 30221 }, { "entropy": 0.5271190698258579, "epoch": 2.78058205530733, "grad_norm": 0.16582287847995758, "learning_rate": 7.317447173919711e-06, "loss": 0.5143, "mean_token_accuracy": 0.8341496139764786, "num_tokens": 964562536.0, "step": 30222 }, { "entropy": 0.5166603324469179, "epoch": 2.7806740616787713, "grad_norm": 0.1526193469762802, "learning_rate": 7.314380347778085e-06, "loss": 0.506, "mean_token_accuracy": 0.8392908908426762, "num_tokens": 964595078.0, "step": 30223 }, { "entropy": 0.5048483200371265, "epoch": 2.7807660680502124, "grad_norm": 0.15595589578151703, "learning_rate": 7.311313521636459e-06, "loss": 0.4815, "mean_token_accuracy": 0.846055407077074, "num_tokens": 964627339.0, "step": 30224 }, { "entropy": 0.6568488907068968, "epoch": 2.7808580744216536, "grad_norm": 0.1759415715932846, "learning_rate": 7.308246695494833e-06, "loss": 0.6404, "mean_token_accuracy": 0.798169918358326, "num_tokens": 964659294.0, "step": 30225 }, { "entropy": 0.4227371287997812, "epoch": 2.7809500807930947, "grad_norm": 0.15098223090171814, "learning_rate": 7.305179869353207e-06, "loss": 0.4143, "mean_token_accuracy": 0.8671567663550377, "num_tokens": 964691279.0, "step": 30226 }, { "entropy": 0.4894923307001591, "epoch": 2.7810420871645363, "grad_norm": 0.15657517313957214, "learning_rate": 7.302113043211581e-06, "loss": 0.4735, "mean_token_accuracy": 0.8498629406094551, "num_tokens": 964723594.0, "step": 30227 }, { "entropy": 0.5681836158037186, "epoch": 2.7811340935359774, "grad_norm": 0.1658194661140442, "learning_rate": 7.299046217069955e-06, "loss": 0.5533, "mean_token_accuracy": 0.8244877718389034, "num_tokens": 964755099.0, "step": 30228 }, { "entropy": 0.5263226144015789, "epoch": 2.7812260999074185, "grad_norm": 0.1646527796983719, "learning_rate": 7.295979390928329e-06, "loss": 0.5212, "mean_token_accuracy": 0.8329965732991695, "num_tokens": 964787501.0, "step": 30229 }, { "entropy": 0.4485214948654175, "epoch": 2.7813181062788597, "grad_norm": 0.14598335325717926, "learning_rate": 7.2929125647867025e-06, "loss": 0.4266, "mean_token_accuracy": 0.8610577471554279, "num_tokens": 964819630.0, "step": 30230 }, { "entropy": 0.49204091913998127, "epoch": 2.781410112650301, "grad_norm": 0.15743084251880646, "learning_rate": 7.289845738645076e-06, "loss": 0.478, "mean_token_accuracy": 0.8465085476636887, "num_tokens": 964851632.0, "step": 30231 }, { "entropy": 0.5761807914823294, "epoch": 2.7815021190217424, "grad_norm": 0.16958054900169373, "learning_rate": 7.28677891250345e-06, "loss": 0.5713, "mean_token_accuracy": 0.8201095387339592, "num_tokens": 964883760.0, "step": 30232 }, { "entropy": 0.4558483371511102, "epoch": 2.7815941253931835, "grad_norm": 0.1491902470588684, "learning_rate": 7.283712086361824e-06, "loss": 0.4351, "mean_token_accuracy": 0.8607774041593075, "num_tokens": 964915477.0, "step": 30233 }, { "entropy": 0.5514753963798285, "epoch": 2.7816861317646246, "grad_norm": 0.16228321194648743, "learning_rate": 7.280645260220198e-06, "loss": 0.5342, "mean_token_accuracy": 0.8331453278660774, "num_tokens": 964947763.0, "step": 30234 }, { "entropy": 0.42571119125932455, "epoch": 2.781778138136066, "grad_norm": 0.1449476182460785, "learning_rate": 7.2775784340785715e-06, "loss": 0.4039, "mean_token_accuracy": 0.8680808916687965, "num_tokens": 964979631.0, "step": 30235 }, { "entropy": 0.43936879374086857, "epoch": 2.781870144507507, "grad_norm": 0.15097101032733917, "learning_rate": 7.274511607936945e-06, "loss": 0.4324, "mean_token_accuracy": 0.864876601845026, "num_tokens": 965010997.0, "step": 30236 }, { "entropy": 0.5466020051389933, "epoch": 2.7819621508789485, "grad_norm": 0.16216735541820526, "learning_rate": 7.271444781795321e-06, "loss": 0.5213, "mean_token_accuracy": 0.8341222368180752, "num_tokens": 965042312.0, "step": 30237 }, { "entropy": 0.500641911290586, "epoch": 2.7820541572503896, "grad_norm": 0.15934781730175018, "learning_rate": 7.268377955653695e-06, "loss": 0.486, "mean_token_accuracy": 0.8436008878052235, "num_tokens": 965073740.0, "step": 30238 }, { "entropy": 0.5412944238632917, "epoch": 2.7821461636218308, "grad_norm": 0.16222301125526428, "learning_rate": 7.2653111295120684e-06, "loss": 0.5336, "mean_token_accuracy": 0.8300242610275745, "num_tokens": 965106122.0, "step": 30239 }, { "entropy": 0.4922706625657156, "epoch": 2.782238169993272, "grad_norm": 0.15368923544883728, "learning_rate": 7.262244303370442e-06, "loss": 0.4862, "mean_token_accuracy": 0.8446784131228924, "num_tokens": 965138671.0, "step": 30240 }, { "entropy": 0.5046289414167404, "epoch": 2.782330176364713, "grad_norm": 0.15900491178035736, "learning_rate": 7.259177477228817e-06, "loss": 0.4905, "mean_token_accuracy": 0.8407155871391296, "num_tokens": 965170496.0, "step": 30241 }, { "entropy": 0.553275722078979, "epoch": 2.7824221827361546, "grad_norm": 0.17009155452251434, "learning_rate": 7.256110651087191e-06, "loss": 0.5515, "mean_token_accuracy": 0.824972927570343, "num_tokens": 965202877.0, "step": 30242 }, { "entropy": 0.5231585232540965, "epoch": 2.7825141891075957, "grad_norm": 0.1599549800157547, "learning_rate": 7.2530438249455645e-06, "loss": 0.5123, "mean_token_accuracy": 0.8377735503017902, "num_tokens": 965234170.0, "step": 30243 }, { "entropy": 0.5024600913748145, "epoch": 2.782606195479037, "grad_norm": 0.1582275778055191, "learning_rate": 7.249976998803938e-06, "loss": 0.4942, "mean_token_accuracy": 0.8443539217114449, "num_tokens": 965265710.0, "step": 30244 }, { "entropy": 0.542324785143137, "epoch": 2.782698201850478, "grad_norm": 0.16042287647724152, "learning_rate": 7.246910172662312e-06, "loss": 0.5351, "mean_token_accuracy": 0.8336152583360672, "num_tokens": 965297359.0, "step": 30245 }, { "entropy": 0.598588889464736, "epoch": 2.782790208221919, "grad_norm": 0.16633491218090057, "learning_rate": 7.243843346520686e-06, "loss": 0.5844, "mean_token_accuracy": 0.8133337274193764, "num_tokens": 965329135.0, "step": 30246 }, { "entropy": 0.5390091594308615, "epoch": 2.7828822145933607, "grad_norm": 0.16140398383140564, "learning_rate": 7.24077652037906e-06, "loss": 0.5225, "mean_token_accuracy": 0.8330464288592339, "num_tokens": 965360972.0, "step": 30247 }, { "entropy": 0.5590539360418916, "epoch": 2.782974220964802, "grad_norm": 0.15989433228969574, "learning_rate": 7.2377096942374335e-06, "loss": 0.5378, "mean_token_accuracy": 0.828291542828083, "num_tokens": 965393236.0, "step": 30248 }, { "entropy": 0.512221448123455, "epoch": 2.783066227336243, "grad_norm": 0.16235677897930145, "learning_rate": 7.234642868095807e-06, "loss": 0.4989, "mean_token_accuracy": 0.837503869086504, "num_tokens": 965424720.0, "step": 30249 }, { "entropy": 0.5263779917731881, "epoch": 2.783158233707684, "grad_norm": 0.16317065060138702, "learning_rate": 7.231576041954181e-06, "loss": 0.5217, "mean_token_accuracy": 0.8354438580572605, "num_tokens": 965456335.0, "step": 30250 }, { "entropy": 0.4172086585313082, "epoch": 2.7832502400791252, "grad_norm": 0.14185094833374023, "learning_rate": 7.228509215812555e-06, "loss": 0.3933, "mean_token_accuracy": 0.8704573288559914, "num_tokens": 965487929.0, "step": 30251 }, { "entropy": 0.5241026007570326, "epoch": 2.783342246450567, "grad_norm": 0.15860992670059204, "learning_rate": 7.22544238967093e-06, "loss": 0.5072, "mean_token_accuracy": 0.8384174257516861, "num_tokens": 965520295.0, "step": 30252 }, { "entropy": 0.46265684999525547, "epoch": 2.783434252822008, "grad_norm": 0.15270346403121948, "learning_rate": 7.222375563529304e-06, "loss": 0.4576, "mean_token_accuracy": 0.8519965969026089, "num_tokens": 965552967.0, "step": 30253 }, { "entropy": 0.46915148198604584, "epoch": 2.783526259193449, "grad_norm": 0.15144194662570953, "learning_rate": 7.219308737387678e-06, "loss": 0.4545, "mean_token_accuracy": 0.8569889143109322, "num_tokens": 965584935.0, "step": 30254 }, { "entropy": 0.5407870803028345, "epoch": 2.7836182655648902, "grad_norm": 0.1631370633840561, "learning_rate": 7.216241911246053e-06, "loss": 0.5359, "mean_token_accuracy": 0.8316774964332581, "num_tokens": 965616791.0, "step": 30255 }, { "entropy": 0.45625869650393724, "epoch": 2.7837102719363314, "grad_norm": 0.1513875275850296, "learning_rate": 7.213175085104426e-06, "loss": 0.4455, "mean_token_accuracy": 0.8583700060844421, "num_tokens": 965649028.0, "step": 30256 }, { "entropy": 0.49979985412210226, "epoch": 2.783802278307773, "grad_norm": 0.15705819427967072, "learning_rate": 7.2101082589628e-06, "loss": 0.4789, "mean_token_accuracy": 0.8491889983415604, "num_tokens": 965680603.0, "step": 30257 }, { "entropy": 0.5119588486850262, "epoch": 2.783894284679214, "grad_norm": 0.15476655960083008, "learning_rate": 7.207041432821174e-06, "loss": 0.4986, "mean_token_accuracy": 0.8424711301922798, "num_tokens": 965712731.0, "step": 30258 }, { "entropy": 0.5298051137942821, "epoch": 2.783986291050655, "grad_norm": 0.16469040513038635, "learning_rate": 7.203974606679548e-06, "loss": 0.5165, "mean_token_accuracy": 0.8366053812205791, "num_tokens": 965744724.0, "step": 30259 }, { "entropy": 0.503009500913322, "epoch": 2.7840782974220963, "grad_norm": 0.15950484573841095, "learning_rate": 7.200907780537922e-06, "loss": 0.4897, "mean_token_accuracy": 0.8394712135195732, "num_tokens": 965776669.0, "step": 30260 }, { "entropy": 0.5021192748099566, "epoch": 2.7841703037935375, "grad_norm": 0.16066166758537292, "learning_rate": 7.1978409543962954e-06, "loss": 0.4998, "mean_token_accuracy": 0.8437079638242722, "num_tokens": 965809285.0, "step": 30261 }, { "entropy": 0.5317448070272803, "epoch": 2.784262310164979, "grad_norm": 0.16345150768756866, "learning_rate": 7.194774128254669e-06, "loss": 0.5157, "mean_token_accuracy": 0.8347119502723217, "num_tokens": 965840636.0, "step": 30262 }, { "entropy": 0.5141883622854948, "epoch": 2.78435431653642, "grad_norm": 0.16144680976867676, "learning_rate": 7.191707302113043e-06, "loss": 0.5097, "mean_token_accuracy": 0.8411217890679836, "num_tokens": 965872635.0, "step": 30263 }, { "entropy": 0.5559287164360285, "epoch": 2.7844463229078613, "grad_norm": 0.1665806770324707, "learning_rate": 7.188640475971417e-06, "loss": 0.5479, "mean_token_accuracy": 0.8280952833592892, "num_tokens": 965903445.0, "step": 30264 }, { "entropy": 0.49351329635828733, "epoch": 2.7845383292793024, "grad_norm": 0.154694065451622, "learning_rate": 7.185573649829791e-06, "loss": 0.4765, "mean_token_accuracy": 0.8508049361407757, "num_tokens": 965935011.0, "step": 30265 }, { "entropy": 0.5328414086252451, "epoch": 2.7846303356507436, "grad_norm": 0.16077297925949097, "learning_rate": 7.182506823688165e-06, "loss": 0.5291, "mean_token_accuracy": 0.8348809741437435, "num_tokens": 965967484.0, "step": 30266 }, { "entropy": 0.5729996245354414, "epoch": 2.784722342022185, "grad_norm": 0.16843487322330475, "learning_rate": 7.17943999754654e-06, "loss": 0.5577, "mean_token_accuracy": 0.8239931091666222, "num_tokens": 965999650.0, "step": 30267 }, { "entropy": 0.5827785306610167, "epoch": 2.7848143483936263, "grad_norm": 0.17420215904712677, "learning_rate": 7.176373171404914e-06, "loss": 0.5764, "mean_token_accuracy": 0.8183167465031147, "num_tokens": 966030522.0, "step": 30268 }, { "entropy": 0.5178136005997658, "epoch": 2.7849063547650674, "grad_norm": 0.16450895369052887, "learning_rate": 7.1733063452632875e-06, "loss": 0.5091, "mean_token_accuracy": 0.8355848528444767, "num_tokens": 966061204.0, "step": 30269 }, { "entropy": 0.45958715211600065, "epoch": 2.7849983611365086, "grad_norm": 0.1539660394191742, "learning_rate": 7.170239519121662e-06, "loss": 0.4352, "mean_token_accuracy": 0.8602490611374378, "num_tokens": 966092262.0, "step": 30270 }, { "entropy": 0.5310485903173685, "epoch": 2.7850903675079497, "grad_norm": 0.16152919828891754, "learning_rate": 7.167172692980036e-06, "loss": 0.5128, "mean_token_accuracy": 0.8392962366342545, "num_tokens": 966123823.0, "step": 30271 }, { "entropy": 0.5636040782555938, "epoch": 2.7851823738793913, "grad_norm": 0.16419200599193573, "learning_rate": 7.16410586683841e-06, "loss": 0.5467, "mean_token_accuracy": 0.826422818005085, "num_tokens": 966156591.0, "step": 30272 }, { "entropy": 0.5103673273697495, "epoch": 2.7852743802508324, "grad_norm": 0.1623699814081192, "learning_rate": 7.1610390406967836e-06, "loss": 0.5077, "mean_token_accuracy": 0.8384028375148773, "num_tokens": 966188670.0, "step": 30273 }, { "entropy": 0.47381957806646824, "epoch": 2.7853663866222735, "grad_norm": 0.15250609815120697, "learning_rate": 7.157972214555157e-06, "loss": 0.4628, "mean_token_accuracy": 0.8541064970195293, "num_tokens": 966220643.0, "step": 30274 }, { "entropy": 0.5097229750826955, "epoch": 2.7854583929937147, "grad_norm": 0.15880899131298065, "learning_rate": 7.154905388413531e-06, "loss": 0.494, "mean_token_accuracy": 0.8464817702770233, "num_tokens": 966252663.0, "step": 30275 }, { "entropy": 0.4841288619209081, "epoch": 2.785550399365156, "grad_norm": 0.1561661958694458, "learning_rate": 7.151838562271905e-06, "loss": 0.4761, "mean_token_accuracy": 0.8450148440897465, "num_tokens": 966284674.0, "step": 30276 }, { "entropy": 0.6129122413694859, "epoch": 2.7856424057365974, "grad_norm": 0.17195503413677216, "learning_rate": 7.148771736130279e-06, "loss": 0.6052, "mean_token_accuracy": 0.8100777938961983, "num_tokens": 966316102.0, "step": 30277 }, { "entropy": 0.5886732190847397, "epoch": 2.7857344121080385, "grad_norm": 0.17241120338439941, "learning_rate": 7.1457049099886526e-06, "loss": 0.5749, "mean_token_accuracy": 0.8187889121472836, "num_tokens": 966347010.0, "step": 30278 }, { "entropy": 0.533258717507124, "epoch": 2.7858264184794796, "grad_norm": 0.16373614966869354, "learning_rate": 7.142638083847026e-06, "loss": 0.5291, "mean_token_accuracy": 0.8342349119484425, "num_tokens": 966379491.0, "step": 30279 }, { "entropy": 0.5570449670776725, "epoch": 2.785918424850921, "grad_norm": 0.17085832357406616, "learning_rate": 7.1395712577054e-06, "loss": 0.5601, "mean_token_accuracy": 0.8237059898674488, "num_tokens": 966410710.0, "step": 30280 }, { "entropy": 0.5350626558065414, "epoch": 2.786010431222362, "grad_norm": 0.16022086143493652, "learning_rate": 7.136504431563775e-06, "loss": 0.5165, "mean_token_accuracy": 0.834605511277914, "num_tokens": 966443478.0, "step": 30281 }, { "entropy": 0.5329596875235438, "epoch": 2.7861024375938035, "grad_norm": 0.15945065021514893, "learning_rate": 7.133437605422149e-06, "loss": 0.5165, "mean_token_accuracy": 0.8346828892827034, "num_tokens": 966475064.0, "step": 30282 }, { "entropy": 0.38815377675928175, "epoch": 2.7861944439652446, "grad_norm": 0.1462884545326233, "learning_rate": 7.130370779280523e-06, "loss": 0.3792, "mean_token_accuracy": 0.8773762583732605, "num_tokens": 966506930.0, "step": 30283 }, { "entropy": 0.47672743164002895, "epoch": 2.7862864503366858, "grad_norm": 0.1502138376235962, "learning_rate": 7.127303953138897e-06, "loss": 0.4669, "mean_token_accuracy": 0.8525011315941811, "num_tokens": 966539073.0, "step": 30284 }, { "entropy": 0.45923598296940327, "epoch": 2.786378456708127, "grad_norm": 0.15299546718597412, "learning_rate": 7.124237126997272e-06, "loss": 0.4557, "mean_token_accuracy": 0.8523550294339657, "num_tokens": 966571325.0, "step": 30285 }, { "entropy": 0.5298438519239426, "epoch": 2.786470463079568, "grad_norm": 0.16314175724983215, "learning_rate": 7.1211703008556455e-06, "loss": 0.5126, "mean_token_accuracy": 0.8342049606144428, "num_tokens": 966602396.0, "step": 30286 }, { "entropy": 0.42983323708176613, "epoch": 2.7865624694510096, "grad_norm": 0.14308632910251617, "learning_rate": 7.118103474714019e-06, "loss": 0.4165, "mean_token_accuracy": 0.8663491234183311, "num_tokens": 966634621.0, "step": 30287 }, { "entropy": 0.5161064621061087, "epoch": 2.7866544758224507, "grad_norm": 0.1625148206949234, "learning_rate": 7.115036648572393e-06, "loss": 0.5064, "mean_token_accuracy": 0.8335371911525726, "num_tokens": 966666385.0, "step": 30288 }, { "entropy": 0.4067091625183821, "epoch": 2.786746482193892, "grad_norm": 0.14439593255519867, "learning_rate": 7.111969822430767e-06, "loss": 0.3957, "mean_token_accuracy": 0.8735237270593643, "num_tokens": 966697962.0, "step": 30289 }, { "entropy": 0.5686957787256688, "epoch": 2.786838488565333, "grad_norm": 0.16312240064144135, "learning_rate": 7.108902996289141e-06, "loss": 0.5442, "mean_token_accuracy": 0.8298355117440224, "num_tokens": 966729362.0, "step": 30290 }, { "entropy": 0.5196643006056547, "epoch": 2.786930494936774, "grad_norm": 0.15932367742061615, "learning_rate": 7.1058361701475145e-06, "loss": 0.5087, "mean_token_accuracy": 0.8403480015695095, "num_tokens": 966760689.0, "step": 30291 }, { "entropy": 0.48436892591416836, "epoch": 2.7870225013082157, "grad_norm": 0.15615706145763397, "learning_rate": 7.102769344005888e-06, "loss": 0.4783, "mean_token_accuracy": 0.8461810573935509, "num_tokens": 966793337.0, "step": 30292 }, { "entropy": 0.46222922019660473, "epoch": 2.787114507679657, "grad_norm": 0.15333063900470734, "learning_rate": 7.099702517864262e-06, "loss": 0.4492, "mean_token_accuracy": 0.8555613681674004, "num_tokens": 966825167.0, "step": 30293 }, { "entropy": 0.5653870906680822, "epoch": 2.787206514051098, "grad_norm": 0.1650901436805725, "learning_rate": 7.096635691722636e-06, "loss": 0.5482, "mean_token_accuracy": 0.8228617459535599, "num_tokens": 966856646.0, "step": 30294 }, { "entropy": 0.3780062347650528, "epoch": 2.787298520422539, "grad_norm": 0.14050297439098358, "learning_rate": 7.09356886558101e-06, "loss": 0.3589, "mean_token_accuracy": 0.8825604096055031, "num_tokens": 966887898.0, "step": 30295 }, { "entropy": 0.41827560123056173, "epoch": 2.7873905267939802, "grad_norm": 0.1463109254837036, "learning_rate": 7.090502039439384e-06, "loss": 0.4068, "mean_token_accuracy": 0.8722957819700241, "num_tokens": 966919365.0, "step": 30296 }, { "entropy": 0.45035182125866413, "epoch": 2.787482533165422, "grad_norm": 0.1496853530406952, "learning_rate": 7.087435213297758e-06, "loss": 0.4468, "mean_token_accuracy": 0.8543733768165112, "num_tokens": 966951849.0, "step": 30297 }, { "entropy": 0.5756077873520553, "epoch": 2.787574539536863, "grad_norm": 0.1688118875026703, "learning_rate": 7.084368387156133e-06, "loss": 0.5709, "mean_token_accuracy": 0.8213941566646099, "num_tokens": 966984312.0, "step": 30298 }, { "entropy": 0.4935845392756164, "epoch": 2.787666545908304, "grad_norm": 0.14866232872009277, "learning_rate": 7.081301561014507e-06, "loss": 0.4741, "mean_token_accuracy": 0.8493607901036739, "num_tokens": 967016517.0, "step": 30299 }, { "entropy": 0.491499213501811, "epoch": 2.7877585522797452, "grad_norm": 0.15752016007900238, "learning_rate": 7.078234734872881e-06, "loss": 0.4805, "mean_token_accuracy": 0.844586681574583, "num_tokens": 967048961.0, "step": 30300 }, { "entropy": 0.615341316908598, "epoch": 2.7878505586511864, "grad_norm": 0.17295821011066437, "learning_rate": 7.075167908731255e-06, "loss": 0.6002, "mean_token_accuracy": 0.8111138269305229, "num_tokens": 967080349.0, "step": 30301 }, { "entropy": 0.510491332039237, "epoch": 2.787942565022628, "grad_norm": 0.16156497597694397, "learning_rate": 7.072101082589629e-06, "loss": 0.5014, "mean_token_accuracy": 0.8401804305613041, "num_tokens": 967111521.0, "step": 30302 }, { "entropy": 0.5212997838389128, "epoch": 2.788034571394069, "grad_norm": 0.16217923164367676, "learning_rate": 7.069034256448003e-06, "loss": 0.507, "mean_token_accuracy": 0.8396548219025135, "num_tokens": 967142677.0, "step": 30303 }, { "entropy": 0.6143985623493791, "epoch": 2.78812657776551, "grad_norm": 0.16584938764572144, "learning_rate": 7.0659674303063765e-06, "loss": 0.6001, "mean_token_accuracy": 0.8093461692333221, "num_tokens": 967175032.0, "step": 30304 }, { "entropy": 0.4788594446144998, "epoch": 2.7882185841369513, "grad_norm": 0.1507328599691391, "learning_rate": 7.06290060416475e-06, "loss": 0.4725, "mean_token_accuracy": 0.8497954644262791, "num_tokens": 967207467.0, "step": 30305 }, { "entropy": 0.465347183868289, "epoch": 2.7883105905083925, "grad_norm": 0.14736071228981018, "learning_rate": 7.059833778023124e-06, "loss": 0.4514, "mean_token_accuracy": 0.8547915183007717, "num_tokens": 967239408.0, "step": 30306 }, { "entropy": 0.4507964998483658, "epoch": 2.788402596879834, "grad_norm": 0.1501973420381546, "learning_rate": 7.056766951881498e-06, "loss": 0.4276, "mean_token_accuracy": 0.8620311580598354, "num_tokens": 967271242.0, "step": 30307 }, { "entropy": 0.5575670525431633, "epoch": 2.788494603251275, "grad_norm": 0.16592587530612946, "learning_rate": 7.053700125739872e-06, "loss": 0.549, "mean_token_accuracy": 0.8294631913304329, "num_tokens": 967303708.0, "step": 30308 }, { "entropy": 0.4218650236725807, "epoch": 2.7885866096227163, "grad_norm": 0.15157130360603333, "learning_rate": 7.0506332995982455e-06, "loss": 0.4202, "mean_token_accuracy": 0.8633149415254593, "num_tokens": 967335882.0, "step": 30309 }, { "entropy": 0.5076815187931061, "epoch": 2.7886786159941575, "grad_norm": 0.1557626575231552, "learning_rate": 7.047566473456619e-06, "loss": 0.5055, "mean_token_accuracy": 0.8385738655924797, "num_tokens": 967367780.0, "step": 30310 }, { "entropy": 0.5268616951070726, "epoch": 2.7887706223655986, "grad_norm": 0.1680838167667389, "learning_rate": 7.044499647314994e-06, "loss": 0.522, "mean_token_accuracy": 0.8352295681834221, "num_tokens": 967398794.0, "step": 30311 }, { "entropy": 0.5379558000713587, "epoch": 2.78886262873704, "grad_norm": 0.16563692688941956, "learning_rate": 7.041432821173368e-06, "loss": 0.5285, "mean_token_accuracy": 0.834385734051466, "num_tokens": 967430563.0, "step": 30312 }, { "entropy": 0.5237719425931573, "epoch": 2.7889546351084813, "grad_norm": 0.16403980553150177, "learning_rate": 7.038365995031742e-06, "loss": 0.5083, "mean_token_accuracy": 0.8368545733392239, "num_tokens": 967462326.0, "step": 30313 }, { "entropy": 0.5562916975468397, "epoch": 2.7890466414799224, "grad_norm": 0.16821689903736115, "learning_rate": 7.035299168890116e-06, "loss": 0.5474, "mean_token_accuracy": 0.8273765854537487, "num_tokens": 967493566.0, "step": 30314 }, { "entropy": 0.579927358776331, "epoch": 2.7891386478513636, "grad_norm": 0.16547125577926636, "learning_rate": 7.032232342748491e-06, "loss": 0.5689, "mean_token_accuracy": 0.8174983039498329, "num_tokens": 967525086.0, "step": 30315 }, { "entropy": 0.4579476658254862, "epoch": 2.7892306542228047, "grad_norm": 0.15775203704833984, "learning_rate": 7.029165516606865e-06, "loss": 0.4403, "mean_token_accuracy": 0.8614107482135296, "num_tokens": 967556840.0, "step": 30316 }, { "entropy": 0.5079697398468852, "epoch": 2.7893226605942463, "grad_norm": 0.1660676896572113, "learning_rate": 7.026098690465238e-06, "loss": 0.4958, "mean_token_accuracy": 0.8424001149833202, "num_tokens": 967587918.0, "step": 30317 }, { "entropy": 0.49896018020808697, "epoch": 2.7894146669656874, "grad_norm": 0.16246213018894196, "learning_rate": 7.023031864323612e-06, "loss": 0.4936, "mean_token_accuracy": 0.8421701490879059, "num_tokens": 967619872.0, "step": 30318 }, { "entropy": 0.5956637170165777, "epoch": 2.7895066733371285, "grad_norm": 0.17724211513996124, "learning_rate": 7.019965038181986e-06, "loss": 0.5744, "mean_token_accuracy": 0.8146865107119083, "num_tokens": 967650615.0, "step": 30319 }, { "entropy": 0.4555215183645487, "epoch": 2.7895986797085697, "grad_norm": 0.1572321653366089, "learning_rate": 7.01689821204036e-06, "loss": 0.4576, "mean_token_accuracy": 0.8525288850069046, "num_tokens": 967682415.0, "step": 30320 }, { "entropy": 0.5582897309213877, "epoch": 2.789690686080011, "grad_norm": 0.16098687052726746, "learning_rate": 7.013831385898734e-06, "loss": 0.5482, "mean_token_accuracy": 0.8281438797712326, "num_tokens": 967715126.0, "step": 30321 }, { "entropy": 0.40480585931800306, "epoch": 2.7897826924514524, "grad_norm": 0.14267472922801971, "learning_rate": 7.010764559757107e-06, "loss": 0.3898, "mean_token_accuracy": 0.8733921907842159, "num_tokens": 967747195.0, "step": 30322 }, { "entropy": 0.43898750096559525, "epoch": 2.7898746988228935, "grad_norm": 0.14689897000789642, "learning_rate": 7.007697733615481e-06, "loss": 0.4289, "mean_token_accuracy": 0.8622898831963539, "num_tokens": 967779271.0, "step": 30323 }, { "entropy": 0.5133932465687394, "epoch": 2.7899667051943347, "grad_norm": 0.15855391323566437, "learning_rate": 7.004630907473855e-06, "loss": 0.4993, "mean_token_accuracy": 0.8428266830742359, "num_tokens": 967811085.0, "step": 30324 }, { "entropy": 0.5005833636969328, "epoch": 2.790058711565776, "grad_norm": 0.16321426630020142, "learning_rate": 7.001564081332229e-06, "loss": 0.4906, "mean_token_accuracy": 0.8448703922331333, "num_tokens": 967842251.0, "step": 30325 }, { "entropy": 0.5009878054261208, "epoch": 2.790150717937217, "grad_norm": 0.15157580375671387, "learning_rate": 6.9984972551906035e-06, "loss": 0.4814, "mean_token_accuracy": 0.8460533805191517, "num_tokens": 967874372.0, "step": 30326 }, { "entropy": 0.5771335856989026, "epoch": 2.7902427243086585, "grad_norm": 0.1678728461265564, "learning_rate": 6.995430429048977e-06, "loss": 0.5737, "mean_token_accuracy": 0.8199764154851437, "num_tokens": 967906495.0, "step": 30327 }, { "entropy": 0.47447878774255514, "epoch": 2.7903347306800996, "grad_norm": 0.1504228115081787, "learning_rate": 6.992363602907352e-06, "loss": 0.4485, "mean_token_accuracy": 0.8559262529015541, "num_tokens": 967937578.0, "step": 30328 }, { "entropy": 0.45528230955824256, "epoch": 2.7904267370515408, "grad_norm": 0.1483854204416275, "learning_rate": 6.989296776765726e-06, "loss": 0.4375, "mean_token_accuracy": 0.8608361259102821, "num_tokens": 967969933.0, "step": 30329 }, { "entropy": 0.5498452009633183, "epoch": 2.790518743422982, "grad_norm": 0.16105566918849945, "learning_rate": 6.9862299506241e-06, "loss": 0.5298, "mean_token_accuracy": 0.8320799544453621, "num_tokens": 968001172.0, "step": 30330 }, { "entropy": 0.5079976366832852, "epoch": 2.790610749794423, "grad_norm": 0.16417087614536285, "learning_rate": 6.983163124482474e-06, "loss": 0.4901, "mean_token_accuracy": 0.8446247577667236, "num_tokens": 968032778.0, "step": 30331 }, { "entropy": 0.47192604932934046, "epoch": 2.7907027561658646, "grad_norm": 0.15204721689224243, "learning_rate": 6.980096298340848e-06, "loss": 0.4588, "mean_token_accuracy": 0.8524315506219864, "num_tokens": 968065023.0, "step": 30332 }, { "entropy": 0.5982149131596088, "epoch": 2.7907947625373057, "grad_norm": 0.16502586007118225, "learning_rate": 6.977029472199222e-06, "loss": 0.5841, "mean_token_accuracy": 0.8167938888072968, "num_tokens": 968097126.0, "step": 30333 }, { "entropy": 0.5471823262050748, "epoch": 2.790886768908747, "grad_norm": 0.1624172329902649, "learning_rate": 6.9739626460575956e-06, "loss": 0.5295, "mean_token_accuracy": 0.8325113728642464, "num_tokens": 968128308.0, "step": 30334 }, { "entropy": 0.5833583064377308, "epoch": 2.790978775280188, "grad_norm": 0.1664908230304718, "learning_rate": 6.970895819915969e-06, "loss": 0.574, "mean_token_accuracy": 0.8190548904240131, "num_tokens": 968160586.0, "step": 30335 }, { "entropy": 0.507770768366754, "epoch": 2.791070781651629, "grad_norm": 0.15012748539447784, "learning_rate": 6.967828993774343e-06, "loss": 0.4858, "mean_token_accuracy": 0.8443861715495586, "num_tokens": 968192657.0, "step": 30336 }, { "entropy": 0.4388193088816479, "epoch": 2.7911627880230707, "grad_norm": 0.15123145282268524, "learning_rate": 6.964762167632717e-06, "loss": 0.4195, "mean_token_accuracy": 0.864846833050251, "num_tokens": 968224563.0, "step": 30337 }, { "entropy": 0.5338312461972237, "epoch": 2.791254794394512, "grad_norm": 0.15812712907791138, "learning_rate": 6.961695341491091e-06, "loss": 0.524, "mean_token_accuracy": 0.833313349634409, "num_tokens": 968257273.0, "step": 30338 }, { "entropy": 0.5330096771940589, "epoch": 2.791346800765953, "grad_norm": 0.16310472786426544, "learning_rate": 6.9586285153494646e-06, "loss": 0.5236, "mean_token_accuracy": 0.8350229971110821, "num_tokens": 968289145.0, "step": 30339 }, { "entropy": 0.4940840685740113, "epoch": 2.791438807137394, "grad_norm": 0.1572066992521286, "learning_rate": 6.955561689207838e-06, "loss": 0.4855, "mean_token_accuracy": 0.8459118381142616, "num_tokens": 968321242.0, "step": 30340 }, { "entropy": 0.4350016973912716, "epoch": 2.7915308135088353, "grad_norm": 0.14814776182174683, "learning_rate": 6.952494863066213e-06, "loss": 0.4249, "mean_token_accuracy": 0.8625238016247749, "num_tokens": 968352972.0, "step": 30341 }, { "entropy": 0.5113232145085931, "epoch": 2.791622819880277, "grad_norm": 0.15832068026065826, "learning_rate": 6.949428036924587e-06, "loss": 0.4955, "mean_token_accuracy": 0.8428733050823212, "num_tokens": 968384496.0, "step": 30342 }, { "entropy": 0.45792324701324105, "epoch": 2.791714826251718, "grad_norm": 0.1546132117509842, "learning_rate": 6.946361210782961e-06, "loss": 0.4476, "mean_token_accuracy": 0.855613861232996, "num_tokens": 968415557.0, "step": 30343 }, { "entropy": 0.5281066475436091, "epoch": 2.791806832623159, "grad_norm": 0.16735102236270905, "learning_rate": 6.943294384641335e-06, "loss": 0.5163, "mean_token_accuracy": 0.8390797227621078, "num_tokens": 968446192.0, "step": 30344 }, { "entropy": 0.5183103801682591, "epoch": 2.7918988389946002, "grad_norm": 0.1598062813282013, "learning_rate": 6.94022755849971e-06, "loss": 0.5074, "mean_token_accuracy": 0.8391121551394463, "num_tokens": 968477957.0, "step": 30345 }, { "entropy": 0.4327929480932653, "epoch": 2.7919908453660414, "grad_norm": 0.1478293240070343, "learning_rate": 6.937160732358084e-06, "loss": 0.4241, "mean_token_accuracy": 0.8653839267790318, "num_tokens": 968509842.0, "step": 30346 }, { "entropy": 0.45610855519771576, "epoch": 2.792082851737483, "grad_norm": 0.14879803359508514, "learning_rate": 6.9340939062164575e-06, "loss": 0.4502, "mean_token_accuracy": 0.8598269559442997, "num_tokens": 968541573.0, "step": 30347 }, { "entropy": 0.5542249362915754, "epoch": 2.792174858108924, "grad_norm": 0.16092157363891602, "learning_rate": 6.931027080074831e-06, "loss": 0.539, "mean_token_accuracy": 0.82866171002388, "num_tokens": 968573615.0, "step": 30348 }, { "entropy": 0.4690396236255765, "epoch": 2.792266864480365, "grad_norm": 0.1595858484506607, "learning_rate": 6.927960253933205e-06, "loss": 0.4523, "mean_token_accuracy": 0.8525061793625355, "num_tokens": 968605675.0, "step": 30349 }, { "entropy": 0.49374050833284855, "epoch": 2.7923588708518063, "grad_norm": 0.15264396369457245, "learning_rate": 6.924893427791579e-06, "loss": 0.4717, "mean_token_accuracy": 0.8512186259031296, "num_tokens": 968637030.0, "step": 30350 }, { "entropy": 0.5607643527910113, "epoch": 2.7924508772232475, "grad_norm": 0.16839735209941864, "learning_rate": 6.921826601649953e-06, "loss": 0.5487, "mean_token_accuracy": 0.8259950093924999, "num_tokens": 968668603.0, "step": 30351 }, { "entropy": 0.47327105700969696, "epoch": 2.792542883594689, "grad_norm": 0.14868304133415222, "learning_rate": 6.9187597755083265e-06, "loss": 0.4644, "mean_token_accuracy": 0.8515675701200962, "num_tokens": 968701294.0, "step": 30352 }, { "entropy": 0.4781795386224985, "epoch": 2.79263488996613, "grad_norm": 0.16086208820343018, "learning_rate": 6.9156929493667e-06, "loss": 0.4757, "mean_token_accuracy": 0.8479765094816685, "num_tokens": 968732722.0, "step": 30353 }, { "entropy": 0.4901031870394945, "epoch": 2.7927268963375713, "grad_norm": 0.15874476730823517, "learning_rate": 6.912626123225074e-06, "loss": 0.4891, "mean_token_accuracy": 0.8432901799678802, "num_tokens": 968764759.0, "step": 30354 }, { "entropy": 0.5683524836786091, "epoch": 2.7928189027090125, "grad_norm": 0.1709047108888626, "learning_rate": 6.909559297083448e-06, "loss": 0.5584, "mean_token_accuracy": 0.8261676840484142, "num_tokens": 968796357.0, "step": 30355 }, { "entropy": 0.49389295105356723, "epoch": 2.7929109090804536, "grad_norm": 0.15814827382564545, "learning_rate": 6.9064924709418226e-06, "loss": 0.486, "mean_token_accuracy": 0.8477791175246239, "num_tokens": 968828613.0, "step": 30356 }, { "entropy": 0.3787026877980679, "epoch": 2.793002915451895, "grad_norm": 0.1341909021139145, "learning_rate": 6.903425644800196e-06, "loss": 0.365, "mean_token_accuracy": 0.8836290650069714, "num_tokens": 968861232.0, "step": 30357 }, { "entropy": 0.5641222255071625, "epoch": 2.7930949218233363, "grad_norm": 0.1612086445093155, "learning_rate": 6.90035881865857e-06, "loss": 0.5459, "mean_token_accuracy": 0.8246105499565601, "num_tokens": 968893473.0, "step": 30358 }, { "entropy": 0.5795238045975566, "epoch": 2.7931869281947774, "grad_norm": 0.16418848931789398, "learning_rate": 6.897291992516945e-06, "loss": 0.5721, "mean_token_accuracy": 0.8222954943776131, "num_tokens": 968925672.0, "step": 30359 }, { "entropy": 0.4580790160689503, "epoch": 2.7932789345662186, "grad_norm": 0.1439974308013916, "learning_rate": 6.8942251663753195e-06, "loss": 0.4386, "mean_token_accuracy": 0.8589066453278065, "num_tokens": 968957330.0, "step": 30360 }, { "entropy": 0.5169559605419636, "epoch": 2.7933709409376597, "grad_norm": 0.1575789600610733, "learning_rate": 6.891158340233693e-06, "loss": 0.5065, "mean_token_accuracy": 0.8384739682078362, "num_tokens": 968989683.0, "step": 30361 }, { "entropy": 0.5136721034068614, "epoch": 2.7934629473091013, "grad_norm": 0.16202287375926971, "learning_rate": 6.888091514092067e-06, "loss": 0.5033, "mean_token_accuracy": 0.8392628021538258, "num_tokens": 969021370.0, "step": 30362 }, { "entropy": 0.48711987771093845, "epoch": 2.7935549536805424, "grad_norm": 0.15561635792255402, "learning_rate": 6.885024687950441e-06, "loss": 0.4787, "mean_token_accuracy": 0.8453319892287254, "num_tokens": 969053640.0, "step": 30363 }, { "entropy": 0.5174467579927295, "epoch": 2.7936469600519835, "grad_norm": 0.15631291270256042, "learning_rate": 6.881957861808815e-06, "loss": 0.5112, "mean_token_accuracy": 0.8379488922655582, "num_tokens": 969086331.0, "step": 30364 }, { "entropy": 0.46958582662045956, "epoch": 2.7937389664234247, "grad_norm": 0.1526488959789276, "learning_rate": 6.8788910356671885e-06, "loss": 0.4573, "mean_token_accuracy": 0.8533000312745571, "num_tokens": 969117757.0, "step": 30365 }, { "entropy": 0.45339890010654926, "epoch": 2.793830972794866, "grad_norm": 0.1502118855714798, "learning_rate": 6.875824209525562e-06, "loss": 0.4505, "mean_token_accuracy": 0.8571437671780586, "num_tokens": 969150024.0, "step": 30366 }, { "entropy": 0.5368926851078868, "epoch": 2.7939229791663074, "grad_norm": 0.16401025652885437, "learning_rate": 6.872757383383936e-06, "loss": 0.5293, "mean_token_accuracy": 0.8333758302032948, "num_tokens": 969181445.0, "step": 30367 }, { "entropy": 0.5168677056208253, "epoch": 2.7940149855377485, "grad_norm": 0.1619430035352707, "learning_rate": 6.86969055724231e-06, "loss": 0.5152, "mean_token_accuracy": 0.8423116095364094, "num_tokens": 969213958.0, "step": 30368 }, { "entropy": 0.4788007866591215, "epoch": 2.7941069919091897, "grad_norm": 0.15773333609104156, "learning_rate": 6.866623731100684e-06, "loss": 0.4727, "mean_token_accuracy": 0.847547248005867, "num_tokens": 969246206.0, "step": 30369 }, { "entropy": 0.5142628103494644, "epoch": 2.794198998280631, "grad_norm": 0.1563393771648407, "learning_rate": 6.8635569049590575e-06, "loss": 0.4999, "mean_token_accuracy": 0.8415386453270912, "num_tokens": 969278286.0, "step": 30370 }, { "entropy": 0.3807888670125976, "epoch": 2.794291004652072, "grad_norm": 0.14266978204250336, "learning_rate": 6.860490078817432e-06, "loss": 0.3569, "mean_token_accuracy": 0.880191370844841, "num_tokens": 969309164.0, "step": 30371 }, { "entropy": 0.546147920191288, "epoch": 2.7943830110235135, "grad_norm": 0.16168411076068878, "learning_rate": 6.857423252675806e-06, "loss": 0.5296, "mean_token_accuracy": 0.831158921122551, "num_tokens": 969341176.0, "step": 30372 }, { "entropy": 0.5269591575488448, "epoch": 2.7944750173949546, "grad_norm": 0.15546397864818573, "learning_rate": 6.85435642653418e-06, "loss": 0.5185, "mean_token_accuracy": 0.8411579579114914, "num_tokens": 969373241.0, "step": 30373 }, { "entropy": 0.4313344385009259, "epoch": 2.7945670237663958, "grad_norm": 0.14621761441230774, "learning_rate": 6.851289600392554e-06, "loss": 0.4146, "mean_token_accuracy": 0.8649147190153599, "num_tokens": 969405273.0, "step": 30374 }, { "entropy": 0.5878950878977776, "epoch": 2.794659030137837, "grad_norm": 0.16521503031253815, "learning_rate": 6.848222774250929e-06, "loss": 0.5773, "mean_token_accuracy": 0.8218938522040844, "num_tokens": 969437587.0, "step": 30375 }, { "entropy": 0.6236993838101625, "epoch": 2.794751036509278, "grad_norm": 0.17345942556858063, "learning_rate": 6.845155948109303e-06, "loss": 0.6011, "mean_token_accuracy": 0.8098805882036686, "num_tokens": 969469459.0, "step": 30376 }, { "entropy": 0.4789785323664546, "epoch": 2.7948430428807196, "grad_norm": 0.1585644632577896, "learning_rate": 6.842089121967677e-06, "loss": 0.4662, "mean_token_accuracy": 0.8481402397155762, "num_tokens": 969501244.0, "step": 30377 }, { "entropy": 0.47029204946011305, "epoch": 2.7949350492521607, "grad_norm": 0.15126247704029083, "learning_rate": 6.83902229582605e-06, "loss": 0.4537, "mean_token_accuracy": 0.8569206781685352, "num_tokens": 969533898.0, "step": 30378 }, { "entropy": 0.4729101210832596, "epoch": 2.795027055623602, "grad_norm": 0.15626832842826843, "learning_rate": 6.835955469684424e-06, "loss": 0.4721, "mean_token_accuracy": 0.8467074632644653, "num_tokens": 969565903.0, "step": 30379 }, { "entropy": 0.507772452197969, "epoch": 2.795119061995043, "grad_norm": 0.15970028936862946, "learning_rate": 6.832888643542798e-06, "loss": 0.5024, "mean_token_accuracy": 0.8422327153384686, "num_tokens": 969598140.0, "step": 30380 }, { "entropy": 0.5276551449205726, "epoch": 2.795211068366484, "grad_norm": 0.15350089967250824, "learning_rate": 6.829821817401172e-06, "loss": 0.5204, "mean_token_accuracy": 0.8372143693268299, "num_tokens": 969630580.0, "step": 30381 }, { "entropy": 0.5963455941528082, "epoch": 2.7953030747379257, "grad_norm": 0.166901096701622, "learning_rate": 6.826754991259546e-06, "loss": 0.5777, "mean_token_accuracy": 0.8210935518145561, "num_tokens": 969661644.0, "step": 30382 }, { "entropy": 0.5752166183665395, "epoch": 2.795395081109367, "grad_norm": 0.17256911098957062, "learning_rate": 6.823688165117919e-06, "loss": 0.564, "mean_token_accuracy": 0.8217352479696274, "num_tokens": 969692683.0, "step": 30383 }, { "entropy": 0.535552715882659, "epoch": 2.795487087480808, "grad_norm": 0.1604394018650055, "learning_rate": 6.820621338976293e-06, "loss": 0.5178, "mean_token_accuracy": 0.8342668563127518, "num_tokens": 969723982.0, "step": 30384 }, { "entropy": 0.48563607316464186, "epoch": 2.795579093852249, "grad_norm": 0.15830132365226746, "learning_rate": 6.817554512834667e-06, "loss": 0.4678, "mean_token_accuracy": 0.8498246558010578, "num_tokens": 969755771.0, "step": 30385 }, { "entropy": 0.5388203621841967, "epoch": 2.7956711002236903, "grad_norm": 0.15676848590373993, "learning_rate": 6.814487686693042e-06, "loss": 0.5216, "mean_token_accuracy": 0.836349081248045, "num_tokens": 969787527.0, "step": 30386 }, { "entropy": 0.4405926277395338, "epoch": 2.795763106595132, "grad_norm": 0.14556138217449188, "learning_rate": 6.8114208605514155e-06, "loss": 0.4312, "mean_token_accuracy": 0.8603208884596825, "num_tokens": 969819264.0, "step": 30387 }, { "entropy": 0.3650618444662541, "epoch": 2.795855112966573, "grad_norm": 0.13713742792606354, "learning_rate": 6.808354034409789e-06, "loss": 0.3567, "mean_token_accuracy": 0.885112963616848, "num_tokens": 969851766.0, "step": 30388 }, { "entropy": 0.5988733544945717, "epoch": 2.795947119338014, "grad_norm": 0.16739380359649658, "learning_rate": 6.805287208268164e-06, "loss": 0.5838, "mean_token_accuracy": 0.818601980805397, "num_tokens": 969883250.0, "step": 30389 }, { "entropy": 0.4029083363711834, "epoch": 2.7960391257094552, "grad_norm": 0.1429937183856964, "learning_rate": 6.8022203821265386e-06, "loss": 0.3941, "mean_token_accuracy": 0.8748399280011654, "num_tokens": 969915778.0, "step": 30390 }, { "entropy": 0.5245955451391637, "epoch": 2.7961311320808964, "grad_norm": 0.15919898450374603, "learning_rate": 6.799153555984912e-06, "loss": 0.5182, "mean_token_accuracy": 0.8390928544104099, "num_tokens": 969948194.0, "step": 30391 }, { "entropy": 0.46634463872760534, "epoch": 2.796223138452338, "grad_norm": 0.1545812338590622, "learning_rate": 6.796086729843286e-06, "loss": 0.4653, "mean_token_accuracy": 0.8526017181575298, "num_tokens": 969980684.0, "step": 30392 }, { "entropy": 0.44166831113398075, "epoch": 2.796315144823779, "grad_norm": 0.14417871832847595, "learning_rate": 6.79301990370166e-06, "loss": 0.4275, "mean_token_accuracy": 0.8643584102392197, "num_tokens": 970012940.0, "step": 30393 }, { "entropy": 0.5519832530990243, "epoch": 2.79640715119522, "grad_norm": 0.158479705452919, "learning_rate": 6.789953077560034e-06, "loss": 0.5333, "mean_token_accuracy": 0.8291753977537155, "num_tokens": 970045063.0, "step": 30394 }, { "entropy": 0.5590811362490058, "epoch": 2.7964991575666613, "grad_norm": 0.1630871295928955, "learning_rate": 6.7868862514184076e-06, "loss": 0.5355, "mean_token_accuracy": 0.8329234421253204, "num_tokens": 970076360.0, "step": 30395 }, { "entropy": 0.4868656983599067, "epoch": 2.7965911639381025, "grad_norm": 0.1544070541858673, "learning_rate": 6.783819425276781e-06, "loss": 0.4772, "mean_token_accuracy": 0.8503972217440605, "num_tokens": 970108718.0, "step": 30396 }, { "entropy": 0.5175743289291859, "epoch": 2.796683170309544, "grad_norm": 0.1590314507484436, "learning_rate": 6.780752599135155e-06, "loss": 0.514, "mean_token_accuracy": 0.8364177905023098, "num_tokens": 970140920.0, "step": 30397 }, { "entropy": 0.49359590257517993, "epoch": 2.796775176680985, "grad_norm": 0.15960852801799774, "learning_rate": 6.777685772993529e-06, "loss": 0.4818, "mean_token_accuracy": 0.8463058210909367, "num_tokens": 970172679.0, "step": 30398 }, { "entropy": 0.5461814273148775, "epoch": 2.7968671830524263, "grad_norm": 0.1692432463169098, "learning_rate": 6.774618946851903e-06, "loss": 0.5435, "mean_token_accuracy": 0.8292045406997204, "num_tokens": 970204607.0, "step": 30399 }, { "entropy": 0.5546057485044003, "epoch": 2.7969591894238675, "grad_norm": 0.16649964451789856, "learning_rate": 6.7715521207102766e-06, "loss": 0.5517, "mean_token_accuracy": 0.8262736089527607, "num_tokens": 970237052.0, "step": 30400 }, { "entropy": 0.5764221679419279, "epoch": 2.7970511957953086, "grad_norm": 0.16502591967582703, "learning_rate": 6.768485294568651e-06, "loss": 0.5642, "mean_token_accuracy": 0.8237424157559872, "num_tokens": 970269305.0, "step": 30401 }, { "entropy": 0.5026948237791657, "epoch": 2.79714320216675, "grad_norm": 0.15459416806697845, "learning_rate": 6.765418468427025e-06, "loss": 0.4885, "mean_token_accuracy": 0.8415291085839272, "num_tokens": 970301438.0, "step": 30402 }, { "entropy": 0.4559685802087188, "epoch": 2.7972352085381913, "grad_norm": 0.152982696890831, "learning_rate": 6.762351642285399e-06, "loss": 0.4456, "mean_token_accuracy": 0.8585472218692303, "num_tokens": 970332597.0, "step": 30403 }, { "entropy": 0.4674659182783216, "epoch": 2.7973272149096324, "grad_norm": 0.15376034379005432, "learning_rate": 6.759284816143773e-06, "loss": 0.4656, "mean_token_accuracy": 0.853414312005043, "num_tokens": 970364572.0, "step": 30404 }, { "entropy": 0.5465095858089626, "epoch": 2.7974192212810736, "grad_norm": 0.16200688481330872, "learning_rate": 6.756217990002148e-06, "loss": 0.5406, "mean_token_accuracy": 0.8255648463964462, "num_tokens": 970396532.0, "step": 30405 }, { "entropy": 0.4997724243439734, "epoch": 2.7975112276525147, "grad_norm": 0.15717960894107819, "learning_rate": 6.753151163860522e-06, "loss": 0.4728, "mean_token_accuracy": 0.8499767184257507, "num_tokens": 970428397.0, "step": 30406 }, { "entropy": 0.5109283435158432, "epoch": 2.7976032340239563, "grad_norm": 0.15684561431407928, "learning_rate": 6.750084337718896e-06, "loss": 0.4989, "mean_token_accuracy": 0.8416594043374062, "num_tokens": 970460708.0, "step": 30407 }, { "entropy": 0.3899828674038872, "epoch": 2.7976952403953974, "grad_norm": 0.14018234610557556, "learning_rate": 6.7470175115772695e-06, "loss": 0.3763, "mean_token_accuracy": 0.8787373378872871, "num_tokens": 970492925.0, "step": 30408 }, { "entropy": 0.554346976801753, "epoch": 2.7977872467668385, "grad_norm": 0.1591276377439499, "learning_rate": 6.743950685435643e-06, "loss": 0.5308, "mean_token_accuracy": 0.8322495706379414, "num_tokens": 970524858.0, "step": 30409 }, { "entropy": 0.3822424354730174, "epoch": 2.7978792531382797, "grad_norm": 0.13349848985671997, "learning_rate": 6.740883859294017e-06, "loss": 0.3719, "mean_token_accuracy": 0.8817722871899605, "num_tokens": 970557501.0, "step": 30410 }, { "entropy": 0.5444119875319302, "epoch": 2.797971259509721, "grad_norm": 0.1620083600282669, "learning_rate": 6.737817033152391e-06, "loss": 0.5299, "mean_token_accuracy": 0.8306681402027607, "num_tokens": 970589337.0, "step": 30411 }, { "entropy": 0.5723017565906048, "epoch": 2.7980632658811624, "grad_norm": 0.169440358877182, "learning_rate": 6.734750207010765e-06, "loss": 0.5597, "mean_token_accuracy": 0.8247070647776127, "num_tokens": 970621334.0, "step": 30412 }, { "entropy": 0.4374276986345649, "epoch": 2.7981552722526035, "grad_norm": 0.1511225700378418, "learning_rate": 6.7316833808691385e-06, "loss": 0.4283, "mean_token_accuracy": 0.862023688852787, "num_tokens": 970654102.0, "step": 30413 }, { "entropy": 0.5517580267041922, "epoch": 2.7982472786240447, "grad_norm": 0.17361736297607422, "learning_rate": 6.728616554727512e-06, "loss": 0.5463, "mean_token_accuracy": 0.8207810446619987, "num_tokens": 970685112.0, "step": 30414 }, { "entropy": 0.44111364614218473, "epoch": 2.798339284995486, "grad_norm": 0.15212002396583557, "learning_rate": 6.725549728585886e-06, "loss": 0.4329, "mean_token_accuracy": 0.8618534952402115, "num_tokens": 970716739.0, "step": 30415 }, { "entropy": 0.5458918698132038, "epoch": 2.798431291366927, "grad_norm": 0.15688586235046387, "learning_rate": 6.722482902444261e-06, "loss": 0.5254, "mean_token_accuracy": 0.8348374702036381, "num_tokens": 970748845.0, "step": 30416 }, { "entropy": 0.5723035559058189, "epoch": 2.7985232977383685, "grad_norm": 0.1651974469423294, "learning_rate": 6.7194160763026346e-06, "loss": 0.5529, "mean_token_accuracy": 0.8288425207138062, "num_tokens": 970781111.0, "step": 30417 }, { "entropy": 0.46552191860973835, "epoch": 2.7986153041098096, "grad_norm": 0.15378262102603912, "learning_rate": 6.716349250161008e-06, "loss": 0.456, "mean_token_accuracy": 0.8521288186311722, "num_tokens": 970812556.0, "step": 30418 }, { "entropy": 0.5143972039222717, "epoch": 2.7987073104812508, "grad_norm": 0.1592797338962555, "learning_rate": 6.713282424019382e-06, "loss": 0.5115, "mean_token_accuracy": 0.839690487831831, "num_tokens": 970844461.0, "step": 30419 }, { "entropy": 0.5346896860282868, "epoch": 2.798799316852692, "grad_norm": 0.1582200676202774, "learning_rate": 6.710215597877758e-06, "loss": 0.5255, "mean_token_accuracy": 0.8339126668870449, "num_tokens": 970876739.0, "step": 30420 }, { "entropy": 0.4718807879835367, "epoch": 2.798891323224133, "grad_norm": 0.15245452523231506, "learning_rate": 6.7071487717361315e-06, "loss": 0.4708, "mean_token_accuracy": 0.8514221981167793, "num_tokens": 970909212.0, "step": 30421 }, { "entropy": 0.5915031172335148, "epoch": 2.7989833295955746, "grad_norm": 0.16949743032455444, "learning_rate": 6.704081945594505e-06, "loss": 0.573, "mean_token_accuracy": 0.816857110708952, "num_tokens": 970940565.0, "step": 30422 }, { "entropy": 0.4598831102484837, "epoch": 2.7990753359670157, "grad_norm": 0.152483731508255, "learning_rate": 6.701015119452879e-06, "loss": 0.4411, "mean_token_accuracy": 0.8600709289312363, "num_tokens": 970971675.0, "step": 30423 }, { "entropy": 0.5235786717385054, "epoch": 2.799167342338457, "grad_norm": 0.15520192682743073, "learning_rate": 6.697948293311253e-06, "loss": 0.5115, "mean_token_accuracy": 0.8384796716272831, "num_tokens": 971004339.0, "step": 30424 }, { "entropy": 0.4771978436037898, "epoch": 2.799259348709898, "grad_norm": 0.15424175560474396, "learning_rate": 6.694881467169627e-06, "loss": 0.4674, "mean_token_accuracy": 0.8505446314811707, "num_tokens": 971035743.0, "step": 30425 }, { "entropy": 0.5055127213709056, "epoch": 2.799351355081339, "grad_norm": 0.1597302258014679, "learning_rate": 6.6918146410280005e-06, "loss": 0.4923, "mean_token_accuracy": 0.8437057323753834, "num_tokens": 971067829.0, "step": 30426 }, { "entropy": 0.5376382418908179, "epoch": 2.7994433614527807, "grad_norm": 0.15918926894664764, "learning_rate": 6.688747814886374e-06, "loss": 0.5246, "mean_token_accuracy": 0.8330714628100395, "num_tokens": 971099290.0, "step": 30427 }, { "entropy": 0.5394625980407, "epoch": 2.799535367824222, "grad_norm": 0.15870702266693115, "learning_rate": 6.685680988744748e-06, "loss": 0.535, "mean_token_accuracy": 0.8315107859671116, "num_tokens": 971131335.0, "step": 30428 }, { "entropy": 0.5317857135087252, "epoch": 2.799627374195663, "grad_norm": 0.15651960670948029, "learning_rate": 6.682614162603122e-06, "loss": 0.518, "mean_token_accuracy": 0.8330998830497265, "num_tokens": 971163007.0, "step": 30429 }, { "entropy": 0.5793699477799237, "epoch": 2.799719380567104, "grad_norm": 0.17161577939987183, "learning_rate": 6.679547336461496e-06, "loss": 0.5815, "mean_token_accuracy": 0.819656565785408, "num_tokens": 971194388.0, "step": 30430 }, { "entropy": 0.4323836388066411, "epoch": 2.7998113869385453, "grad_norm": 0.1453924924135208, "learning_rate": 6.67648051031987e-06, "loss": 0.4248, "mean_token_accuracy": 0.8628164939582348, "num_tokens": 971226419.0, "step": 30431 }, { "entropy": 0.4233992053195834, "epoch": 2.799903393309987, "grad_norm": 0.14413870871067047, "learning_rate": 6.673413684178244e-06, "loss": 0.3992, "mean_token_accuracy": 0.8728900328278542, "num_tokens": 971258169.0, "step": 30432 }, { "entropy": 0.5064394064247608, "epoch": 2.799995399681428, "grad_norm": 0.15747787058353424, "learning_rate": 6.670346858036618e-06, "loss": 0.4923, "mean_token_accuracy": 0.845728013664484, "num_tokens": 971290455.0, "step": 30433 }, { "entropy": 0.5409872699528933, "epoch": 2.800087406052869, "grad_norm": 0.16058823466300964, "learning_rate": 6.667280031894992e-06, "loss": 0.5211, "mean_token_accuracy": 0.8337398394942284, "num_tokens": 971322891.0, "step": 30434 }, { "entropy": 0.4452425049385056, "epoch": 2.8001794124243102, "grad_norm": 0.15119628608226776, "learning_rate": 6.664213205753367e-06, "loss": 0.426, "mean_token_accuracy": 0.8630553372204304, "num_tokens": 971354234.0, "step": 30435 }, { "entropy": 0.5000236453488469, "epoch": 2.8002714187957514, "grad_norm": 0.15931101143360138, "learning_rate": 6.661146379611741e-06, "loss": 0.4984, "mean_token_accuracy": 0.8455277755856514, "num_tokens": 971386911.0, "step": 30436 }, { "entropy": 0.44963734271004796, "epoch": 2.800363425167193, "grad_norm": 0.1500099003314972, "learning_rate": 6.658079553470115e-06, "loss": 0.4305, "mean_token_accuracy": 0.8604603707790375, "num_tokens": 971418328.0, "step": 30437 }, { "entropy": 0.5444144096691161, "epoch": 2.800455431538634, "grad_norm": 0.16181644797325134, "learning_rate": 6.655012727328489e-06, "loss": 0.5344, "mean_token_accuracy": 0.8307526223361492, "num_tokens": 971450318.0, "step": 30438 }, { "entropy": 0.4765969570726156, "epoch": 2.800547437910075, "grad_norm": 0.15627625584602356, "learning_rate": 6.651945901186862e-06, "loss": 0.4629, "mean_token_accuracy": 0.849282618612051, "num_tokens": 971482865.0, "step": 30439 }, { "entropy": 0.5478823781013489, "epoch": 2.8006394442815163, "grad_norm": 0.16560038924217224, "learning_rate": 6.648879075045236e-06, "loss": 0.5327, "mean_token_accuracy": 0.8309085518121719, "num_tokens": 971514767.0, "step": 30440 }, { "entropy": 0.5312973856925964, "epoch": 2.8007314506529575, "grad_norm": 0.16494449973106384, "learning_rate": 6.64581224890361e-06, "loss": 0.5292, "mean_token_accuracy": 0.8340912610292435, "num_tokens": 971546133.0, "step": 30441 }, { "entropy": 0.41684141964651644, "epoch": 2.800823457024399, "grad_norm": 0.1450413465499878, "learning_rate": 6.642745422761984e-06, "loss": 0.4068, "mean_token_accuracy": 0.8685093373060226, "num_tokens": 971578121.0, "step": 30442 }, { "entropy": 0.4819603208452463, "epoch": 2.80091546339584, "grad_norm": 0.15848664939403534, "learning_rate": 6.639678596620358e-06, "loss": 0.473, "mean_token_accuracy": 0.8523603267967701, "num_tokens": 971610365.0, "step": 30443 }, { "entropy": 0.5599838870111853, "epoch": 2.8010074697672813, "grad_norm": 0.16826626658439636, "learning_rate": 6.636611770478731e-06, "loss": 0.5507, "mean_token_accuracy": 0.8261385634541512, "num_tokens": 971642233.0, "step": 30444 }, { "entropy": 0.5382668664678931, "epoch": 2.8010994761387225, "grad_norm": 0.16835641860961914, "learning_rate": 6.633544944337105e-06, "loss": 0.5173, "mean_token_accuracy": 0.8352462910115719, "num_tokens": 971673221.0, "step": 30445 }, { "entropy": 0.5232848906889558, "epoch": 2.8011914825101636, "grad_norm": 0.1617826223373413, "learning_rate": 6.63047811819548e-06, "loss": 0.5027, "mean_token_accuracy": 0.8380308896303177, "num_tokens": 971704938.0, "step": 30446 }, { "entropy": 0.5306102419272065, "epoch": 2.801283488881605, "grad_norm": 0.1628749519586563, "learning_rate": 6.627411292053854e-06, "loss": 0.523, "mean_token_accuracy": 0.835022933781147, "num_tokens": 971737195.0, "step": 30447 }, { "entropy": 0.4485223377123475, "epoch": 2.8013754952530463, "grad_norm": 0.15683552622795105, "learning_rate": 6.6243444659122275e-06, "loss": 0.4499, "mean_token_accuracy": 0.8560801222920418, "num_tokens": 971768710.0, "step": 30448 }, { "entropy": 0.4591483920812607, "epoch": 2.8014675016244874, "grad_norm": 0.16052459180355072, "learning_rate": 6.621277639770601e-06, "loss": 0.4497, "mean_token_accuracy": 0.8565316423773766, "num_tokens": 971800498.0, "step": 30449 }, { "entropy": 0.5496203750371933, "epoch": 2.8015595079959286, "grad_norm": 0.16439813375473022, "learning_rate": 6.618210813628977e-06, "loss": 0.5381, "mean_token_accuracy": 0.8279398940503597, "num_tokens": 971832324.0, "step": 30450 }, { "entropy": 0.5049692243337631, "epoch": 2.8016515143673697, "grad_norm": 0.15890571475028992, "learning_rate": 6.6151439874873506e-06, "loss": 0.4999, "mean_token_accuracy": 0.8432640172541142, "num_tokens": 971864922.0, "step": 30451 }, { "entropy": 0.4525249404832721, "epoch": 2.8017435207388113, "grad_norm": 0.15022626519203186, "learning_rate": 6.612077161345724e-06, "loss": 0.439, "mean_token_accuracy": 0.8595802672207355, "num_tokens": 971896217.0, "step": 30452 }, { "entropy": 0.5511234177974984, "epoch": 2.8018355271102524, "grad_norm": 0.1612405776977539, "learning_rate": 6.609010335204098e-06, "loss": 0.5323, "mean_token_accuracy": 0.8312811590731144, "num_tokens": 971927532.0, "step": 30453 }, { "entropy": 0.42735681124031544, "epoch": 2.8019275334816935, "grad_norm": 0.14764010906219482, "learning_rate": 6.605943509062472e-06, "loss": 0.4178, "mean_token_accuracy": 0.8666453137993813, "num_tokens": 971959182.0, "step": 30454 }, { "entropy": 0.4494820907711983, "epoch": 2.8020195398531347, "grad_norm": 0.15336695313453674, "learning_rate": 6.602876682920846e-06, "loss": 0.4404, "mean_token_accuracy": 0.8563925474882126, "num_tokens": 971991147.0, "step": 30455 }, { "entropy": 0.4860591231845319, "epoch": 2.802111546224576, "grad_norm": 0.15043209493160248, "learning_rate": 6.5998098567792196e-06, "loss": 0.4677, "mean_token_accuracy": 0.8530218601226807, "num_tokens": 972023255.0, "step": 30456 }, { "entropy": 0.47580219246447086, "epoch": 2.8022035525960174, "grad_norm": 0.15609833598136902, "learning_rate": 6.596743030637593e-06, "loss": 0.4711, "mean_token_accuracy": 0.8484720401465893, "num_tokens": 972055684.0, "step": 30457 }, { "entropy": 0.5829398930072784, "epoch": 2.8022955589674585, "grad_norm": 0.17041437327861786, "learning_rate": 6.593676204495967e-06, "loss": 0.5743, "mean_token_accuracy": 0.8180903270840645, "num_tokens": 972087997.0, "step": 30458 }, { "entropy": 0.47399924509227276, "epoch": 2.8023875653388997, "grad_norm": 0.15162284672260284, "learning_rate": 6.590609378354341e-06, "loss": 0.4708, "mean_token_accuracy": 0.8475430905818939, "num_tokens": 972120581.0, "step": 30459 }, { "entropy": 0.40237674047239125, "epoch": 2.802479571710341, "grad_norm": 0.14483578503131866, "learning_rate": 6.587542552212715e-06, "loss": 0.3971, "mean_token_accuracy": 0.8716989904642105, "num_tokens": 972152947.0, "step": 30460 }, { "entropy": 0.539516176097095, "epoch": 2.802571578081782, "grad_norm": 0.16848914325237274, "learning_rate": 6.584475726071089e-06, "loss": 0.5272, "mean_token_accuracy": 0.8327960707247257, "num_tokens": 972183727.0, "step": 30461 }, { "entropy": 0.5709201411809772, "epoch": 2.8026635844532235, "grad_norm": 0.16604192554950714, "learning_rate": 6.581408899929463e-06, "loss": 0.5434, "mean_token_accuracy": 0.8246339075267315, "num_tokens": 972214687.0, "step": 30462 }, { "entropy": 0.555259732529521, "epoch": 2.8027555908246646, "grad_norm": 0.1643468737602234, "learning_rate": 6.578342073787837e-06, "loss": 0.5434, "mean_token_accuracy": 0.8304022029042244, "num_tokens": 972246209.0, "step": 30463 }, { "entropy": 0.5013059973716736, "epoch": 2.8028475971961058, "grad_norm": 0.15843918919563293, "learning_rate": 6.575275247646211e-06, "loss": 0.4877, "mean_token_accuracy": 0.8432217426598072, "num_tokens": 972277339.0, "step": 30464 }, { "entropy": 0.46792725287377834, "epoch": 2.802939603567547, "grad_norm": 0.15347181260585785, "learning_rate": 6.572208421504585e-06, "loss": 0.4651, "mean_token_accuracy": 0.8523520305752754, "num_tokens": 972309493.0, "step": 30465 }, { "entropy": 0.44304906390607357, "epoch": 2.803031609938988, "grad_norm": 0.14832434058189392, "learning_rate": 6.56914159536296e-06, "loss": 0.4265, "mean_token_accuracy": 0.8630924485623837, "num_tokens": 972341247.0, "step": 30466 }, { "entropy": 0.44591879891231656, "epoch": 2.8031236163104296, "grad_norm": 0.15284158289432526, "learning_rate": 6.566074769221334e-06, "loss": 0.4399, "mean_token_accuracy": 0.8588831573724747, "num_tokens": 972373242.0, "step": 30467 }, { "entropy": 0.5061817332170904, "epoch": 2.8032156226818707, "grad_norm": 0.15151607990264893, "learning_rate": 6.563007943079708e-06, "loss": 0.4905, "mean_token_accuracy": 0.8414368964731693, "num_tokens": 972405346.0, "step": 30468 }, { "entropy": 0.5180935747921467, "epoch": 2.803307629053312, "grad_norm": 0.15541726350784302, "learning_rate": 6.5599411169380815e-06, "loss": 0.511, "mean_token_accuracy": 0.8383944407105446, "num_tokens": 972437147.0, "step": 30469 }, { "entropy": 0.5622882889583707, "epoch": 2.803399635424753, "grad_norm": 0.16524575650691986, "learning_rate": 6.556874290796455e-06, "loss": 0.5486, "mean_token_accuracy": 0.8322235606610775, "num_tokens": 972469444.0, "step": 30470 }, { "entropy": 0.4654612001031637, "epoch": 2.803491641796194, "grad_norm": 0.15020887553691864, "learning_rate": 6.553807464654829e-06, "loss": 0.4533, "mean_token_accuracy": 0.8572098426520824, "num_tokens": 972501475.0, "step": 30471 }, { "entropy": 0.669417698867619, "epoch": 2.8035836481676357, "grad_norm": 0.18078412115573883, "learning_rate": 6.550740638513203e-06, "loss": 0.6506, "mean_token_accuracy": 0.7982288971543312, "num_tokens": 972531915.0, "step": 30472 }, { "entropy": 0.3834473055321723, "epoch": 2.803675654539077, "grad_norm": 0.1383625864982605, "learning_rate": 6.547673812371577e-06, "loss": 0.3751, "mean_token_accuracy": 0.8798303194344044, "num_tokens": 972564237.0, "step": 30473 }, { "entropy": 0.557874963618815, "epoch": 2.803767660910518, "grad_norm": 0.16620750725269318, "learning_rate": 6.5446069862299505e-06, "loss": 0.5376, "mean_token_accuracy": 0.8304154388606548, "num_tokens": 972596222.0, "step": 30474 }, { "entropy": 0.5108117586933076, "epoch": 2.803859667281959, "grad_norm": 0.16131913661956787, "learning_rate": 6.541540160088324e-06, "loss": 0.5033, "mean_token_accuracy": 0.8385573774576187, "num_tokens": 972627317.0, "step": 30475 }, { "entropy": 0.5306404074653983, "epoch": 2.8039516736534003, "grad_norm": 0.16037771105766296, "learning_rate": 6.538473333946699e-06, "loss": 0.5142, "mean_token_accuracy": 0.8345720618963242, "num_tokens": 972659013.0, "step": 30476 }, { "entropy": 0.6024982165545225, "epoch": 2.804043680024842, "grad_norm": 0.16544075310230255, "learning_rate": 6.535406507805073e-06, "loss": 0.592, "mean_token_accuracy": 0.8144619539380074, "num_tokens": 972691157.0, "step": 30477 }, { "entropy": 0.5179563809651881, "epoch": 2.804135686396283, "grad_norm": 0.16129447519779205, "learning_rate": 6.5323396816634466e-06, "loss": 0.5049, "mean_token_accuracy": 0.8387492783367634, "num_tokens": 972723173.0, "step": 30478 }, { "entropy": 0.5905110910534859, "epoch": 2.804227692767724, "grad_norm": 0.16741496324539185, "learning_rate": 6.52927285552182e-06, "loss": 0.5758, "mean_token_accuracy": 0.8172625228762627, "num_tokens": 972754559.0, "step": 30479 }, { "entropy": 0.43406166858039796, "epoch": 2.8043196991391652, "grad_norm": 0.14966526627540588, "learning_rate": 6.526206029380194e-06, "loss": 0.4279, "mean_token_accuracy": 0.8617645353078842, "num_tokens": 972787146.0, "step": 30480 }, { "entropy": 0.5529153328388929, "epoch": 2.8044117055106064, "grad_norm": 0.15997135639190674, "learning_rate": 6.52313920323857e-06, "loss": 0.5327, "mean_token_accuracy": 0.8325431384146214, "num_tokens": 972819116.0, "step": 30481 }, { "entropy": 0.49908547289669514, "epoch": 2.804503711882048, "grad_norm": 0.1530493199825287, "learning_rate": 6.5200723770969435e-06, "loss": 0.4899, "mean_token_accuracy": 0.8448295369744301, "num_tokens": 972851336.0, "step": 30482 }, { "entropy": 0.4645526260137558, "epoch": 2.804595718253489, "grad_norm": 0.15149617195129395, "learning_rate": 6.517005550955317e-06, "loss": 0.4624, "mean_token_accuracy": 0.8524939157068729, "num_tokens": 972883776.0, "step": 30483 }, { "entropy": 0.45810688857454807, "epoch": 2.80468772462493, "grad_norm": 0.15644383430480957, "learning_rate": 6.513938724813691e-06, "loss": 0.4459, "mean_token_accuracy": 0.8594631403684616, "num_tokens": 972915365.0, "step": 30484 }, { "entropy": 0.44710139429662377, "epoch": 2.8047797309963713, "grad_norm": 0.14910268783569336, "learning_rate": 6.510871898672065e-06, "loss": 0.4348, "mean_token_accuracy": 0.8624435178935528, "num_tokens": 972947334.0, "step": 30485 }, { "entropy": 0.5708191487938166, "epoch": 2.8048717373678125, "grad_norm": 0.1654990315437317, "learning_rate": 6.507805072530439e-06, "loss": 0.5579, "mean_token_accuracy": 0.8243352361023426, "num_tokens": 972979074.0, "step": 30486 }, { "entropy": 0.5076065510511398, "epoch": 2.804963743739254, "grad_norm": 0.15596745908260345, "learning_rate": 6.5047382463888125e-06, "loss": 0.5007, "mean_token_accuracy": 0.8439218141138554, "num_tokens": 973011829.0, "step": 30487 }, { "entropy": 0.5421864164527506, "epoch": 2.805055750110695, "grad_norm": 0.16121059656143188, "learning_rate": 6.501671420247186e-06, "loss": 0.5285, "mean_token_accuracy": 0.8344056159257889, "num_tokens": 973044052.0, "step": 30488 }, { "entropy": 0.5598785893525928, "epoch": 2.8051477564821363, "grad_norm": 0.16331914067268372, "learning_rate": 6.49860459410556e-06, "loss": 0.5506, "mean_token_accuracy": 0.8291593194007874, "num_tokens": 973075813.0, "step": 30489 }, { "entropy": 0.4097729285713285, "epoch": 2.8052397628535775, "grad_norm": 0.14326457679271698, "learning_rate": 6.495537767963934e-06, "loss": 0.4014, "mean_token_accuracy": 0.8711020052433014, "num_tokens": 973107488.0, "step": 30490 }, { "entropy": 0.513747138902545, "epoch": 2.8053317692250186, "grad_norm": 0.16067026555538177, "learning_rate": 6.4924709418223085e-06, "loss": 0.5019, "mean_token_accuracy": 0.8406629972159863, "num_tokens": 973139401.0, "step": 30491 }, { "entropy": 0.5105814291164279, "epoch": 2.80542377559646, "grad_norm": 0.15965856611728668, "learning_rate": 6.489404115680682e-06, "loss": 0.4987, "mean_token_accuracy": 0.838354978710413, "num_tokens": 973171331.0, "step": 30492 }, { "entropy": 0.6165071688592434, "epoch": 2.8055157819679013, "grad_norm": 0.17489244043827057, "learning_rate": 6.486337289539056e-06, "loss": 0.6075, "mean_token_accuracy": 0.8100163228809834, "num_tokens": 973202948.0, "step": 30493 }, { "entropy": 0.5349739408120513, "epoch": 2.8056077883393424, "grad_norm": 0.15802495181560516, "learning_rate": 6.48327046339743e-06, "loss": 0.5277, "mean_token_accuracy": 0.8343314900994301, "num_tokens": 973235445.0, "step": 30494 }, { "entropy": 0.49301846884191036, "epoch": 2.8056997947107836, "grad_norm": 0.15502195060253143, "learning_rate": 6.480203637255804e-06, "loss": 0.4787, "mean_token_accuracy": 0.8497648313641548, "num_tokens": 973267672.0, "step": 30495 }, { "entropy": 0.5762944426387548, "epoch": 2.8057918010822247, "grad_norm": 0.1601577252149582, "learning_rate": 6.477136811114179e-06, "loss": 0.5613, "mean_token_accuracy": 0.8202486410737038, "num_tokens": 973300252.0, "step": 30496 }, { "entropy": 0.5215287493774667, "epoch": 2.8058838074536663, "grad_norm": 0.1599845588207245, "learning_rate": 6.474069984972553e-06, "loss": 0.5071, "mean_token_accuracy": 0.8412021175026894, "num_tokens": 973332492.0, "step": 30497 }, { "entropy": 0.5390173280611634, "epoch": 2.8059758138251074, "grad_norm": 0.1628226339817047, "learning_rate": 6.471003158830927e-06, "loss": 0.5256, "mean_token_accuracy": 0.8315355516970158, "num_tokens": 973364525.0, "step": 30498 }, { "entropy": 0.5316117564216256, "epoch": 2.8060678201965485, "grad_norm": 0.15606757998466492, "learning_rate": 6.467936332689301e-06, "loss": 0.5232, "mean_token_accuracy": 0.8370052017271519, "num_tokens": 973396979.0, "step": 30499 }, { "entropy": 0.40914997179061174, "epoch": 2.8061598265679897, "grad_norm": 0.14255282282829285, "learning_rate": 6.464869506547674e-06, "loss": 0.3928, "mean_token_accuracy": 0.876232098788023, "num_tokens": 973428917.0, "step": 30500 }, { "entropy": 0.4161196493078023, "epoch": 2.806251832939431, "grad_norm": 0.14334042370319366, "learning_rate": 6.461802680406048e-06, "loss": 0.411, "mean_token_accuracy": 0.8679492771625519, "num_tokens": 973460610.0, "step": 30501 }, { "entropy": 0.4899792140349746, "epoch": 2.8063438393108724, "grad_norm": 0.1526852250099182, "learning_rate": 6.458735854264422e-06, "loss": 0.4862, "mean_token_accuracy": 0.8487161360681057, "num_tokens": 973492638.0, "step": 30502 }, { "entropy": 0.473813614808023, "epoch": 2.8064358456823135, "grad_norm": 0.15518473088741302, "learning_rate": 6.455669028122796e-06, "loss": 0.454, "mean_token_accuracy": 0.8521016277372837, "num_tokens": 973524632.0, "step": 30503 }, { "entropy": 0.5865078419446945, "epoch": 2.8065278520537547, "grad_norm": 0.17410552501678467, "learning_rate": 6.45260220198117e-06, "loss": 0.5831, "mean_token_accuracy": 0.8173665031790733, "num_tokens": 973556830.0, "step": 30504 }, { "entropy": 0.5460788663476706, "epoch": 2.806619858425196, "grad_norm": 0.1607493907213211, "learning_rate": 6.449535375839543e-06, "loss": 0.5274, "mean_token_accuracy": 0.8309501595795155, "num_tokens": 973588603.0, "step": 30505 }, { "entropy": 0.38505503279156983, "epoch": 2.806711864796637, "grad_norm": 0.1338462382555008, "learning_rate": 6.446468549697918e-06, "loss": 0.373, "mean_token_accuracy": 0.8784095980226994, "num_tokens": 973621304.0, "step": 30506 }, { "entropy": 0.5286556538194418, "epoch": 2.8068038711680785, "grad_norm": 0.16406309604644775, "learning_rate": 6.443401723556292e-06, "loss": 0.5258, "mean_token_accuracy": 0.8337962739169598, "num_tokens": 973653125.0, "step": 30507 }, { "entropy": 0.4332569227553904, "epoch": 2.8068958775395196, "grad_norm": 0.1484663486480713, "learning_rate": 6.440334897414666e-06, "loss": 0.4206, "mean_token_accuracy": 0.8650980219244957, "num_tokens": 973685302.0, "step": 30508 }, { "entropy": 0.5521515840664506, "epoch": 2.8069878839109608, "grad_norm": 0.164997398853302, "learning_rate": 6.4372680712730395e-06, "loss": 0.5415, "mean_token_accuracy": 0.8298868201673031, "num_tokens": 973716786.0, "step": 30509 }, { "entropy": 0.5733310673385859, "epoch": 2.807079890282402, "grad_norm": 0.1633637398481369, "learning_rate": 6.434201245131413e-06, "loss": 0.5605, "mean_token_accuracy": 0.8224911838769913, "num_tokens": 973748738.0, "step": 30510 }, { "entropy": 0.47113856533542275, "epoch": 2.807171896653843, "grad_norm": 0.15312598645687103, "learning_rate": 6.431134418989789e-06, "loss": 0.4431, "mean_token_accuracy": 0.8558329045772552, "num_tokens": 973779225.0, "step": 30511 }, { "entropy": 0.4913472547195852, "epoch": 2.8072639030252846, "grad_norm": 0.1496400386095047, "learning_rate": 6.4280675928481626e-06, "loss": 0.4691, "mean_token_accuracy": 0.8463104739785194, "num_tokens": 973811452.0, "step": 30512 }, { "entropy": 0.6547150444239378, "epoch": 2.8073559093967257, "grad_norm": 0.1780930906534195, "learning_rate": 6.425000766706536e-06, "loss": 0.6432, "mean_token_accuracy": 0.8005599789321423, "num_tokens": 973843222.0, "step": 30513 }, { "entropy": 0.4745524504687637, "epoch": 2.807447915768167, "grad_norm": 0.1487613320350647, "learning_rate": 6.42193394056491e-06, "loss": 0.4575, "mean_token_accuracy": 0.8511054217815399, "num_tokens": 973875245.0, "step": 30514 }, { "entropy": 0.5789120635017753, "epoch": 2.807539922139608, "grad_norm": 0.1718229204416275, "learning_rate": 6.418867114423284e-06, "loss": 0.5635, "mean_token_accuracy": 0.8185384273529053, "num_tokens": 973906789.0, "step": 30515 }, { "entropy": 0.4542483971454203, "epoch": 2.807631928511049, "grad_norm": 0.15284189581871033, "learning_rate": 6.415800288281658e-06, "loss": 0.4435, "mean_token_accuracy": 0.8576742708683014, "num_tokens": 973939135.0, "step": 30516 }, { "entropy": 0.42598086409270763, "epoch": 2.8077239348824907, "grad_norm": 0.14874184131622314, "learning_rate": 6.4127334621400316e-06, "loss": 0.418, "mean_token_accuracy": 0.8649560622870922, "num_tokens": 973970912.0, "step": 30517 }, { "entropy": 0.5373815149068832, "epoch": 2.807815941253932, "grad_norm": 0.16300587356090546, "learning_rate": 6.409666635998405e-06, "loss": 0.527, "mean_token_accuracy": 0.8289806097745895, "num_tokens": 974002517.0, "step": 30518 }, { "entropy": 0.36156840925104916, "epoch": 2.807907947625373, "grad_norm": 0.13701185584068298, "learning_rate": 6.406599809856779e-06, "loss": 0.3478, "mean_token_accuracy": 0.884867824614048, "num_tokens": 974034352.0, "step": 30519 }, { "entropy": 0.4349507298320532, "epoch": 2.807999953996814, "grad_norm": 0.1527503877878189, "learning_rate": 6.403532983715153e-06, "loss": 0.4322, "mean_token_accuracy": 0.8618253357708454, "num_tokens": 974065731.0, "step": 30520 }, { "entropy": 0.5650129290297627, "epoch": 2.8080919603682553, "grad_norm": 0.17180147767066956, "learning_rate": 6.400466157573528e-06, "loss": 0.5504, "mean_token_accuracy": 0.82822410389781, "num_tokens": 974097758.0, "step": 30521 }, { "entropy": 0.44568252097815275, "epoch": 2.808183966739697, "grad_norm": 0.15803413093090057, "learning_rate": 6.397399331431901e-06, "loss": 0.4471, "mean_token_accuracy": 0.857530515640974, "num_tokens": 974130391.0, "step": 30522 }, { "entropy": 0.5297908931970596, "epoch": 2.808275973111138, "grad_norm": 0.16486890614032745, "learning_rate": 6.394332505290275e-06, "loss": 0.5212, "mean_token_accuracy": 0.8361472450196743, "num_tokens": 974161756.0, "step": 30523 }, { "entropy": 0.5321033101063222, "epoch": 2.808367979482579, "grad_norm": 0.158965066075325, "learning_rate": 6.391265679148649e-06, "loss": 0.52, "mean_token_accuracy": 0.8358894251286983, "num_tokens": 974193151.0, "step": 30524 }, { "entropy": 0.4531360436230898, "epoch": 2.8084599858540202, "grad_norm": 0.1558816283941269, "learning_rate": 6.388198853007023e-06, "loss": 0.4452, "mean_token_accuracy": 0.8540102988481522, "num_tokens": 974224678.0, "step": 30525 }, { "entropy": 0.5738856215029955, "epoch": 2.8085519922254614, "grad_norm": 0.16288766264915466, "learning_rate": 6.385132026865397e-06, "loss": 0.5609, "mean_token_accuracy": 0.8214993961155415, "num_tokens": 974256898.0, "step": 30526 }, { "entropy": 0.46217628428712487, "epoch": 2.808643998596903, "grad_norm": 0.15170352160930634, "learning_rate": 6.382065200723772e-06, "loss": 0.4433, "mean_token_accuracy": 0.8608363941311836, "num_tokens": 974288989.0, "step": 30527 }, { "entropy": 0.4893840057775378, "epoch": 2.808736004968344, "grad_norm": 0.15427544713020325, "learning_rate": 6.378998374582146e-06, "loss": 0.4781, "mean_token_accuracy": 0.8475771397352219, "num_tokens": 974320898.0, "step": 30528 }, { "entropy": 0.5080059226602316, "epoch": 2.808828011339785, "grad_norm": 0.16039161384105682, "learning_rate": 6.37593154844052e-06, "loss": 0.497, "mean_token_accuracy": 0.8431824035942554, "num_tokens": 974352020.0, "step": 30529 }, { "entropy": 0.5967588741332293, "epoch": 2.8089200177112263, "grad_norm": 0.1749284714460373, "learning_rate": 6.3728647222988935e-06, "loss": 0.5799, "mean_token_accuracy": 0.8170932345092297, "num_tokens": 974383814.0, "step": 30530 }, { "entropy": 0.5324973645620048, "epoch": 2.8090120240826675, "grad_norm": 0.15994790196418762, "learning_rate": 6.369797896157267e-06, "loss": 0.5112, "mean_token_accuracy": 0.8364770151674747, "num_tokens": 974415679.0, "step": 30531 }, { "entropy": 0.6299627907574177, "epoch": 2.809104030454109, "grad_norm": 0.17419545352458954, "learning_rate": 6.366731070015641e-06, "loss": 0.6236, "mean_token_accuracy": 0.8079745918512344, "num_tokens": 974447526.0, "step": 30532 }, { "entropy": 0.5057573450030759, "epoch": 2.80919603682555, "grad_norm": 0.15170718729496002, "learning_rate": 6.363664243874015e-06, "loss": 0.4869, "mean_token_accuracy": 0.8442255295813084, "num_tokens": 974479742.0, "step": 30533 }, { "entropy": 0.5682681584730744, "epoch": 2.8092880431969913, "grad_norm": 0.16579660773277283, "learning_rate": 6.360597417732389e-06, "loss": 0.5568, "mean_token_accuracy": 0.8246041275560856, "num_tokens": 974512081.0, "step": 30534 }, { "entropy": 0.5191947878338397, "epoch": 2.8093800495684325, "grad_norm": 0.15461841225624084, "learning_rate": 6.3575305915907625e-06, "loss": 0.5079, "mean_token_accuracy": 0.8396650366485119, "num_tokens": 974544556.0, "step": 30535 }, { "entropy": 0.47446395037695765, "epoch": 2.8094720559398736, "grad_norm": 0.15822021663188934, "learning_rate": 6.354463765449137e-06, "loss": 0.4606, "mean_token_accuracy": 0.8541994765400887, "num_tokens": 974575383.0, "step": 30536 }, { "entropy": 0.3824410680681467, "epoch": 2.809564062311315, "grad_norm": 0.13534924387931824, "learning_rate": 6.351396939307511e-06, "loss": 0.3648, "mean_token_accuracy": 0.8840357251465321, "num_tokens": 974607194.0, "step": 30537 }, { "entropy": 0.6272602025419474, "epoch": 2.8096560686827563, "grad_norm": 0.17090007662773132, "learning_rate": 6.348330113165885e-06, "loss": 0.6237, "mean_token_accuracy": 0.8067593760788441, "num_tokens": 974639525.0, "step": 30538 }, { "entropy": 0.41993342339992523, "epoch": 2.8097480750541974, "grad_norm": 0.1471415013074875, "learning_rate": 6.3452632870242586e-06, "loss": 0.4111, "mean_token_accuracy": 0.867431029677391, "num_tokens": 974671800.0, "step": 30539 }, { "entropy": 0.5096746571362019, "epoch": 2.8098400814256386, "grad_norm": 0.16002404689788818, "learning_rate": 6.342196460882632e-06, "loss": 0.4963, "mean_token_accuracy": 0.8392217345535755, "num_tokens": 974703468.0, "step": 30540 }, { "entropy": 0.4092093533836305, "epoch": 2.8099320877970797, "grad_norm": 0.14510340988636017, "learning_rate": 6.339129634741006e-06, "loss": 0.3936, "mean_token_accuracy": 0.8721749931573868, "num_tokens": 974735321.0, "step": 30541 }, { "entropy": 0.4826081623323262, "epoch": 2.8100240941685213, "grad_norm": 0.15498802065849304, "learning_rate": 6.336062808599382e-06, "loss": 0.4814, "mean_token_accuracy": 0.8475674688816071, "num_tokens": 974767745.0, "step": 30542 }, { "entropy": 0.47660670429468155, "epoch": 2.8101161005399624, "grad_norm": 0.15716411173343658, "learning_rate": 6.3329959824577555e-06, "loss": 0.4752, "mean_token_accuracy": 0.8513933680951595, "num_tokens": 974799541.0, "step": 30543 }, { "entropy": 0.5275083808228374, "epoch": 2.8102081069114035, "grad_norm": 0.16032074391841888, "learning_rate": 6.329929156316129e-06, "loss": 0.5229, "mean_token_accuracy": 0.8340963162481785, "num_tokens": 974831523.0, "step": 30544 }, { "entropy": 0.5268382877111435, "epoch": 2.8103001132828447, "grad_norm": 0.1618504375219345, "learning_rate": 6.326862330174503e-06, "loss": 0.525, "mean_token_accuracy": 0.8365030400454998, "num_tokens": 974863795.0, "step": 30545 }, { "entropy": 0.48919318709522486, "epoch": 2.810392119654286, "grad_norm": 0.15361575782299042, "learning_rate": 6.323795504032877e-06, "loss": 0.4766, "mean_token_accuracy": 0.84586276486516, "num_tokens": 974896108.0, "step": 30546 }, { "entropy": 0.45609473600052297, "epoch": 2.8104841260257274, "grad_norm": 0.15118886530399323, "learning_rate": 6.320728677891251e-06, "loss": 0.4381, "mean_token_accuracy": 0.8567127250134945, "num_tokens": 974927626.0, "step": 30547 }, { "entropy": 0.5528857354074717, "epoch": 2.8105761323971685, "grad_norm": 0.1628599315881729, "learning_rate": 6.3176618517496245e-06, "loss": 0.5416, "mean_token_accuracy": 0.8248345851898193, "num_tokens": 974959650.0, "step": 30548 }, { "entropy": 0.5465880837291479, "epoch": 2.8106681387686097, "grad_norm": 0.16052532196044922, "learning_rate": 6.314595025607998e-06, "loss": 0.5379, "mean_token_accuracy": 0.8306493796408176, "num_tokens": 974991876.0, "step": 30549 }, { "entropy": 0.5224515339359641, "epoch": 2.810760145140051, "grad_norm": 0.1626156121492386, "learning_rate": 6.311528199466372e-06, "loss": 0.5059, "mean_token_accuracy": 0.8403061889111996, "num_tokens": 975023224.0, "step": 30550 }, { "entropy": 0.520873511210084, "epoch": 2.810852151511492, "grad_norm": 0.16045694053173065, "learning_rate": 6.308461373324747e-06, "loss": 0.4969, "mean_token_accuracy": 0.839028388261795, "num_tokens": 975055035.0, "step": 30551 }, { "entropy": 0.5976796858012676, "epoch": 2.8109441578829335, "grad_norm": 0.17149606347084045, "learning_rate": 6.3053945471831205e-06, "loss": 0.5834, "mean_token_accuracy": 0.8170138038694859, "num_tokens": 975086750.0, "step": 30552 }, { "entropy": 0.577871510758996, "epoch": 2.8110361642543746, "grad_norm": 0.1686127930879593, "learning_rate": 6.302327721041494e-06, "loss": 0.5625, "mean_token_accuracy": 0.8229619599878788, "num_tokens": 975117630.0, "step": 30553 }, { "entropy": 0.59995355643332, "epoch": 2.8111281706258158, "grad_norm": 0.17028404772281647, "learning_rate": 6.299260894899868e-06, "loss": 0.5875, "mean_token_accuracy": 0.8160918541252613, "num_tokens": 975149764.0, "step": 30554 }, { "entropy": 0.49974226858466864, "epoch": 2.811220176997257, "grad_norm": 0.15034693479537964, "learning_rate": 6.296194068758242e-06, "loss": 0.4807, "mean_token_accuracy": 0.8449908867478371, "num_tokens": 975181908.0, "step": 30555 }, { "entropy": 0.4952424429357052, "epoch": 2.811312183368698, "grad_norm": 0.15825584530830383, "learning_rate": 6.293127242616616e-06, "loss": 0.478, "mean_token_accuracy": 0.8482599146664143, "num_tokens": 975213523.0, "step": 30556 }, { "entropy": 0.5044479952193797, "epoch": 2.8114041897401396, "grad_norm": 0.158309668302536, "learning_rate": 6.290060416474991e-06, "loss": 0.4991, "mean_token_accuracy": 0.8419233746826649, "num_tokens": 975245222.0, "step": 30557 }, { "entropy": 0.3638612092472613, "epoch": 2.8114961961115807, "grad_norm": 0.1405401974916458, "learning_rate": 6.286993590333365e-06, "loss": 0.3575, "mean_token_accuracy": 0.8830577731132507, "num_tokens": 975276892.0, "step": 30558 }, { "entropy": 0.421908188611269, "epoch": 2.811588202483022, "grad_norm": 0.146645188331604, "learning_rate": 6.283926764191739e-06, "loss": 0.4107, "mean_token_accuracy": 0.8704155050218105, "num_tokens": 975308969.0, "step": 30559 }, { "entropy": 0.45622160751372576, "epoch": 2.811680208854463, "grad_norm": 0.14992298185825348, "learning_rate": 6.280859938050113e-06, "loss": 0.44, "mean_token_accuracy": 0.8607391715049744, "num_tokens": 975341475.0, "step": 30560 }, { "entropy": 0.5847187796607614, "epoch": 2.811772215225904, "grad_norm": 0.16999424993991852, "learning_rate": 6.277793111908486e-06, "loss": 0.5711, "mean_token_accuracy": 0.8204625174403191, "num_tokens": 975373824.0, "step": 30561 }, { "entropy": 0.5357662634924054, "epoch": 2.8118642215973457, "grad_norm": 0.16248150169849396, "learning_rate": 6.27472628576686e-06, "loss": 0.5312, "mean_token_accuracy": 0.830376498401165, "num_tokens": 975405652.0, "step": 30562 }, { "entropy": 0.5876124799251556, "epoch": 2.811956227968787, "grad_norm": 0.1673559993505478, "learning_rate": 6.271659459625234e-06, "loss": 0.5615, "mean_token_accuracy": 0.8236293271183968, "num_tokens": 975436842.0, "step": 30563 }, { "entropy": 0.6007164511829615, "epoch": 2.812048234340228, "grad_norm": 0.16999749839305878, "learning_rate": 6.268592633483608e-06, "loss": 0.5846, "mean_token_accuracy": 0.8170763999223709, "num_tokens": 975468933.0, "step": 30564 }, { "entropy": 0.5476798582822084, "epoch": 2.812140240711669, "grad_norm": 0.16513966023921967, "learning_rate": 6.265525807341982e-06, "loss": 0.5326, "mean_token_accuracy": 0.8318161331117153, "num_tokens": 975499664.0, "step": 30565 }, { "entropy": 0.5733172260224819, "epoch": 2.8122322470831103, "grad_norm": 0.1642134040594101, "learning_rate": 6.262458981200356e-06, "loss": 0.5584, "mean_token_accuracy": 0.8256812989711761, "num_tokens": 975531870.0, "step": 30566 }, { "entropy": 0.5404245764948428, "epoch": 2.812324253454552, "grad_norm": 0.16019585728645325, "learning_rate": 6.25939215505873e-06, "loss": 0.5265, "mean_token_accuracy": 0.8359227105975151, "num_tokens": 975563596.0, "step": 30567 }, { "entropy": 0.5448697226820514, "epoch": 2.812416259825993, "grad_norm": 0.16039006412029266, "learning_rate": 6.256325328917104e-06, "loss": 0.5408, "mean_token_accuracy": 0.8341628052294254, "num_tokens": 975596286.0, "step": 30568 }, { "entropy": 0.529661450535059, "epoch": 2.812508266197434, "grad_norm": 0.15533694624900818, "learning_rate": 6.253258502775478e-06, "loss": 0.5262, "mean_token_accuracy": 0.836797684431076, "num_tokens": 975628689.0, "step": 30569 }, { "entropy": 0.5740058501251042, "epoch": 2.8126002725688752, "grad_norm": 0.16604425013065338, "learning_rate": 6.2501916766338515e-06, "loss": 0.5622, "mean_token_accuracy": 0.8226158916950226, "num_tokens": 975659945.0, "step": 30570 }, { "entropy": 0.48708884743973613, "epoch": 2.8126922789403164, "grad_norm": 0.153049498796463, "learning_rate": 6.247124850492226e-06, "loss": 0.467, "mean_token_accuracy": 0.8526181168854237, "num_tokens": 975692165.0, "step": 30571 }, { "entropy": 0.5373837625375018, "epoch": 2.812784285311758, "grad_norm": 0.16174614429473877, "learning_rate": 6.2440580243506e-06, "loss": 0.5237, "mean_token_accuracy": 0.8345158323645592, "num_tokens": 975724312.0, "step": 30572 }, { "entropy": 0.5237835487350821, "epoch": 2.812876291683199, "grad_norm": 0.16366064548492432, "learning_rate": 6.240991198208974e-06, "loss": 0.5168, "mean_token_accuracy": 0.8389166481792927, "num_tokens": 975756403.0, "step": 30573 }, { "entropy": 0.5129001159220934, "epoch": 2.81296829805464, "grad_norm": 0.1582709103822708, "learning_rate": 6.2379243720673475e-06, "loss": 0.5014, "mean_token_accuracy": 0.8433110304176807, "num_tokens": 975787523.0, "step": 30574 }, { "entropy": 0.4954087296500802, "epoch": 2.8130603044260813, "grad_norm": 0.15678392350673676, "learning_rate": 6.234857545925721e-06, "loss": 0.4838, "mean_token_accuracy": 0.8423198014497757, "num_tokens": 975820017.0, "step": 30575 }, { "entropy": 0.5541054457426071, "epoch": 2.8131523107975225, "grad_norm": 0.16090060770511627, "learning_rate": 6.231790719784096e-06, "loss": 0.5404, "mean_token_accuracy": 0.8289679735898972, "num_tokens": 975852098.0, "step": 30576 }, { "entropy": 0.5941604059189558, "epoch": 2.813244317168964, "grad_norm": 0.17034459114074707, "learning_rate": 6.22872389364247e-06, "loss": 0.5856, "mean_token_accuracy": 0.8147741593420506, "num_tokens": 975883897.0, "step": 30577 }, { "entropy": 0.4598654934670776, "epoch": 2.813336323540405, "grad_norm": 0.1435524821281433, "learning_rate": 6.2256570675008436e-06, "loss": 0.4408, "mean_token_accuracy": 0.8618306778371334, "num_tokens": 975915340.0, "step": 30578 }, { "entropy": 0.5497800500597805, "epoch": 2.8134283299118463, "grad_norm": 0.16436651349067688, "learning_rate": 6.222590241359217e-06, "loss": 0.5412, "mean_token_accuracy": 0.8306715004146099, "num_tokens": 975946970.0, "step": 30579 }, { "entropy": 0.4540921268053353, "epoch": 2.8135203362832875, "grad_norm": 0.15405505895614624, "learning_rate": 6.219523415217591e-06, "loss": 0.4547, "mean_token_accuracy": 0.8544642440974712, "num_tokens": 975978999.0, "step": 30580 }, { "entropy": 0.5394385904073715, "epoch": 2.8136123426547286, "grad_norm": 0.16567854583263397, "learning_rate": 6.216456589075966e-06, "loss": 0.5294, "mean_token_accuracy": 0.830023005604744, "num_tokens": 976010182.0, "step": 30581 }, { "entropy": 0.5284359073266387, "epoch": 2.81370434902617, "grad_norm": 0.15754467248916626, "learning_rate": 6.21338976293434e-06, "loss": 0.5189, "mean_token_accuracy": 0.8359335511922836, "num_tokens": 976042709.0, "step": 30582 }, { "entropy": 0.531605800613761, "epoch": 2.8137963553976113, "grad_norm": 0.1636608988046646, "learning_rate": 6.210322936792713e-06, "loss": 0.5216, "mean_token_accuracy": 0.8337466828525066, "num_tokens": 976074641.0, "step": 30583 }, { "entropy": 0.6225151065737009, "epoch": 2.8138883617690524, "grad_norm": 0.17730122804641724, "learning_rate": 6.207256110651088e-06, "loss": 0.622, "mean_token_accuracy": 0.8037230633199215, "num_tokens": 976105987.0, "step": 30584 }, { "entropy": 0.5222407476976514, "epoch": 2.8139803681404936, "grad_norm": 0.15795321762561798, "learning_rate": 6.204189284509462e-06, "loss": 0.5144, "mean_token_accuracy": 0.8375210836529732, "num_tokens": 976137806.0, "step": 30585 }, { "entropy": 0.48523419722914696, "epoch": 2.8140723745119347, "grad_norm": 0.15166863799095154, "learning_rate": 6.201122458367836e-06, "loss": 0.4759, "mean_token_accuracy": 0.8505929037928581, "num_tokens": 976169985.0, "step": 30586 }, { "entropy": 0.4768767524510622, "epoch": 2.8141643808833763, "grad_norm": 0.15969082713127136, "learning_rate": 6.1980556322262095e-06, "loss": 0.4641, "mean_token_accuracy": 0.852387759834528, "num_tokens": 976201683.0, "step": 30587 }, { "entropy": 0.3732161740772426, "epoch": 2.8142563872548174, "grad_norm": 0.14166145026683807, "learning_rate": 6.194988806084583e-06, "loss": 0.3627, "mean_token_accuracy": 0.8836814425885677, "num_tokens": 976233271.0, "step": 30588 }, { "entropy": 0.5905681643635035, "epoch": 2.8143483936262585, "grad_norm": 0.16886158287525177, "learning_rate": 6.191921979942957e-06, "loss": 0.572, "mean_token_accuracy": 0.8231450691819191, "num_tokens": 976263953.0, "step": 30589 }, { "entropy": 0.5280918944627047, "epoch": 2.8144403999976997, "grad_norm": 0.1537124514579773, "learning_rate": 6.188855153801331e-06, "loss": 0.5086, "mean_token_accuracy": 0.8367123007774353, "num_tokens": 976296196.0, "step": 30590 }, { "entropy": 0.35394806833937764, "epoch": 2.814532406369141, "grad_norm": 0.13188716769218445, "learning_rate": 6.185788327659705e-06, "loss": 0.3388, "mean_token_accuracy": 0.8904109112918377, "num_tokens": 976328545.0, "step": 30591 }, { "entropy": 0.4816479869186878, "epoch": 2.8146244127405824, "grad_norm": 0.15249046683311462, "learning_rate": 6.182721501518079e-06, "loss": 0.476, "mean_token_accuracy": 0.8484517000615597, "num_tokens": 976360802.0, "step": 30592 }, { "entropy": 0.46905397810041904, "epoch": 2.8147164191120235, "grad_norm": 0.14950576424598694, "learning_rate": 6.179654675376453e-06, "loss": 0.4428, "mean_token_accuracy": 0.8605567999184132, "num_tokens": 976392206.0, "step": 30593 }, { "entropy": 0.5477710049599409, "epoch": 2.8148084254834647, "grad_norm": 0.16508282721042633, "learning_rate": 6.176587849234827e-06, "loss": 0.5201, "mean_token_accuracy": 0.832053005695343, "num_tokens": 976423216.0, "step": 30594 }, { "entropy": 0.47884791996330023, "epoch": 2.814900431854906, "grad_norm": 0.15202106535434723, "learning_rate": 6.173521023093201e-06, "loss": 0.4659, "mean_token_accuracy": 0.8520701043307781, "num_tokens": 976455984.0, "step": 30595 }, { "entropy": 0.5651941522955894, "epoch": 2.814992438226347, "grad_norm": 0.16482514142990112, "learning_rate": 6.170454196951575e-06, "loss": 0.5537, "mean_token_accuracy": 0.8261648938059807, "num_tokens": 976488377.0, "step": 30596 }, { "entropy": 0.5399523265659809, "epoch": 2.8150844445977885, "grad_norm": 0.163997083902359, "learning_rate": 6.167387370809949e-06, "loss": 0.5202, "mean_token_accuracy": 0.83495057746768, "num_tokens": 976519877.0, "step": 30597 }, { "entropy": 0.5108399530872703, "epoch": 2.8151764509692296, "grad_norm": 0.16301363706588745, "learning_rate": 6.164320544668323e-06, "loss": 0.5038, "mean_token_accuracy": 0.8391782604157925, "num_tokens": 976551430.0, "step": 30598 }, { "entropy": 0.48760390223469585, "epoch": 2.8152684573406708, "grad_norm": 0.15239116549491882, "learning_rate": 6.161253718526698e-06, "loss": 0.4808, "mean_token_accuracy": 0.8485977202653885, "num_tokens": 976583659.0, "step": 30599 }, { "entropy": 0.47892950754612684, "epoch": 2.815360463712112, "grad_norm": 0.15406838059425354, "learning_rate": 6.158186892385071e-06, "loss": 0.4638, "mean_token_accuracy": 0.8516927361488342, "num_tokens": 976615564.0, "step": 30600 }, { "entropy": 0.5372488854918629, "epoch": 2.815452470083553, "grad_norm": 0.16344454884529114, "learning_rate": 6.155120066243445e-06, "loss": 0.5246, "mean_token_accuracy": 0.8362475819885731, "num_tokens": 976646151.0, "step": 30601 }, { "entropy": 0.4620950189419091, "epoch": 2.8155444764549946, "grad_norm": 0.14144816994667053, "learning_rate": 6.152053240101819e-06, "loss": 0.4441, "mean_token_accuracy": 0.8562042266130447, "num_tokens": 976678398.0, "step": 30602 }, { "entropy": 0.4115473818965256, "epoch": 2.8156364828264357, "grad_norm": 0.1469084471464157, "learning_rate": 6.148986413960193e-06, "loss": 0.4048, "mean_token_accuracy": 0.8674778640270233, "num_tokens": 976710482.0, "step": 30603 }, { "entropy": 0.5700972899794579, "epoch": 2.815728489197877, "grad_norm": 0.16296955943107605, "learning_rate": 6.145919587818567e-06, "loss": 0.5642, "mean_token_accuracy": 0.824481438845396, "num_tokens": 976742954.0, "step": 30604 }, { "entropy": 0.4053597906604409, "epoch": 2.815820495569318, "grad_norm": 0.14520293474197388, "learning_rate": 6.14285276167694e-06, "loss": 0.3951, "mean_token_accuracy": 0.8740951381623745, "num_tokens": 976775190.0, "step": 30605 }, { "entropy": 0.49051460553891957, "epoch": 2.815912501940759, "grad_norm": 0.15284942090511322, "learning_rate": 6.139785935535314e-06, "loss": 0.483, "mean_token_accuracy": 0.8497637175023556, "num_tokens": 976807194.0, "step": 30606 }, { "entropy": 0.43303670873865485, "epoch": 2.8160045083122007, "grad_norm": 0.1499023735523224, "learning_rate": 6.136719109393689e-06, "loss": 0.4282, "mean_token_accuracy": 0.8633654564619064, "num_tokens": 976839783.0, "step": 30607 }, { "entropy": 0.5602650297805667, "epoch": 2.816096514683642, "grad_norm": 0.16833338141441345, "learning_rate": 6.133652283252063e-06, "loss": 0.5517, "mean_token_accuracy": 0.8242268338799477, "num_tokens": 976871950.0, "step": 30608 }, { "entropy": 0.4998796796426177, "epoch": 2.816188521055083, "grad_norm": 0.15484003722667694, "learning_rate": 6.1305854571104365e-06, "loss": 0.4952, "mean_token_accuracy": 0.841492772102356, "num_tokens": 976904236.0, "step": 30609 }, { "entropy": 0.5057190358638763, "epoch": 2.816280527426524, "grad_norm": 0.1583196520805359, "learning_rate": 6.12751863096881e-06, "loss": 0.4886, "mean_token_accuracy": 0.8444086760282516, "num_tokens": 976936398.0, "step": 30610 }, { "entropy": 0.47754121106117964, "epoch": 2.8163725337979653, "grad_norm": 0.15268497169017792, "learning_rate": 6.124451804827185e-06, "loss": 0.463, "mean_token_accuracy": 0.8491850644350052, "num_tokens": 976968383.0, "step": 30611 }, { "entropy": 0.4804488494992256, "epoch": 2.816464540169407, "grad_norm": 0.1499428153038025, "learning_rate": 6.121384978685559e-06, "loss": 0.4684, "mean_token_accuracy": 0.8498909436166286, "num_tokens": 976999939.0, "step": 30612 }, { "entropy": 0.528547041118145, "epoch": 2.816556546540848, "grad_norm": 0.16160105168819427, "learning_rate": 6.1183181525439325e-06, "loss": 0.5161, "mean_token_accuracy": 0.8347940519452095, "num_tokens": 977032163.0, "step": 30613 }, { "entropy": 0.5593496770597994, "epoch": 2.816648552912289, "grad_norm": 0.1627102643251419, "learning_rate": 6.115251326402307e-06, "loss": 0.5412, "mean_token_accuracy": 0.8308653645217419, "num_tokens": 977064044.0, "step": 30614 }, { "entropy": 0.4850474721752107, "epoch": 2.8167405592837302, "grad_norm": 0.1571303755044937, "learning_rate": 6.112184500260681e-06, "loss": 0.4624, "mean_token_accuracy": 0.8520283810794353, "num_tokens": 977095271.0, "step": 30615 }, { "entropy": 0.5488944035023451, "epoch": 2.8168325656551714, "grad_norm": 0.16232644021511078, "learning_rate": 6.109117674119055e-06, "loss": 0.5353, "mean_token_accuracy": 0.8305374719202518, "num_tokens": 977126575.0, "step": 30616 }, { "entropy": 0.4830475226044655, "epoch": 2.816924572026613, "grad_norm": 0.14927938580513, "learning_rate": 6.1060508479774286e-06, "loss": 0.4678, "mean_token_accuracy": 0.8494472242891788, "num_tokens": 977158561.0, "step": 30617 }, { "entropy": 0.4679707339964807, "epoch": 2.817016578398054, "grad_norm": 0.15289753675460815, "learning_rate": 6.102984021835802e-06, "loss": 0.4596, "mean_token_accuracy": 0.8529548645019531, "num_tokens": 977190403.0, "step": 30618 }, { "entropy": 0.49682356184348464, "epoch": 2.817108584769495, "grad_norm": 0.15474095940589905, "learning_rate": 6.099917195694176e-06, "loss": 0.4798, "mean_token_accuracy": 0.8478069715201855, "num_tokens": 977221785.0, "step": 30619 }, { "entropy": 0.5313549304846674, "epoch": 2.8172005911409363, "grad_norm": 0.15935954451560974, "learning_rate": 6.09685036955255e-06, "loss": 0.526, "mean_token_accuracy": 0.8359923958778381, "num_tokens": 977254316.0, "step": 30620 }, { "entropy": 0.4055721468757838, "epoch": 2.8172925975123775, "grad_norm": 0.14211955666542053, "learning_rate": 6.093783543410924e-06, "loss": 0.3939, "mean_token_accuracy": 0.8727536983788013, "num_tokens": 977286108.0, "step": 30621 }, { "entropy": 0.5418731113895774, "epoch": 2.817384603883819, "grad_norm": 0.1685665100812912, "learning_rate": 6.090716717269298e-06, "loss": 0.5342, "mean_token_accuracy": 0.8309857584536076, "num_tokens": 977318339.0, "step": 30622 }, { "entropy": 0.5756905619055033, "epoch": 2.81747661025526, "grad_norm": 0.16749845445156097, "learning_rate": 6.087649891127672e-06, "loss": 0.5693, "mean_token_accuracy": 0.8198658637702465, "num_tokens": 977350049.0, "step": 30623 }, { "entropy": 0.484671363607049, "epoch": 2.8175686166267013, "grad_norm": 0.15778625011444092, "learning_rate": 6.084583064986046e-06, "loss": 0.4738, "mean_token_accuracy": 0.847363792359829, "num_tokens": 977381751.0, "step": 30624 }, { "entropy": 0.5980933830142021, "epoch": 2.8176606229981425, "grad_norm": 0.1707300990819931, "learning_rate": 6.081516238844421e-06, "loss": 0.5873, "mean_token_accuracy": 0.81221654266119, "num_tokens": 977413197.0, "step": 30625 }, { "entropy": 0.45952247735112906, "epoch": 2.8177526293695836, "grad_norm": 0.1519535481929779, "learning_rate": 6.0784494127027945e-06, "loss": 0.444, "mean_token_accuracy": 0.8573103845119476, "num_tokens": 977445591.0, "step": 30626 }, { "entropy": 0.4743762742727995, "epoch": 2.817844635741025, "grad_norm": 0.15159961581230164, "learning_rate": 6.075382586561168e-06, "loss": 0.453, "mean_token_accuracy": 0.8539119213819504, "num_tokens": 977477389.0, "step": 30627 }, { "entropy": 0.5430637616664171, "epoch": 2.8179366421124663, "grad_norm": 0.16340947151184082, "learning_rate": 6.072315760419542e-06, "loss": 0.5265, "mean_token_accuracy": 0.8314450532197952, "num_tokens": 977509380.0, "step": 30628 }, { "entropy": 0.5582068469375372, "epoch": 2.8180286484839074, "grad_norm": 0.166301891207695, "learning_rate": 6.069248934277916e-06, "loss": 0.5548, "mean_token_accuracy": 0.8236098885536194, "num_tokens": 977541761.0, "step": 30629 }, { "entropy": 0.5260424492880702, "epoch": 2.8181206548553486, "grad_norm": 0.16500163078308105, "learning_rate": 6.0661821081362905e-06, "loss": 0.5132, "mean_token_accuracy": 0.8361476473510265, "num_tokens": 977573343.0, "step": 30630 }, { "entropy": 0.4140526270493865, "epoch": 2.8182126612267897, "grad_norm": 0.14589501917362213, "learning_rate": 6.063115281994664e-06, "loss": 0.4065, "mean_token_accuracy": 0.8705046884715557, "num_tokens": 977605643.0, "step": 30631 }, { "entropy": 0.5593183445744216, "epoch": 2.8183046675982313, "grad_norm": 0.1625441461801529, "learning_rate": 6.060048455853038e-06, "loss": 0.5468, "mean_token_accuracy": 0.8266198039054871, "num_tokens": 977637444.0, "step": 30632 }, { "entropy": 0.45993457781150937, "epoch": 2.8183966739696724, "grad_norm": 0.14925260841846466, "learning_rate": 6.056981629711412e-06, "loss": 0.4558, "mean_token_accuracy": 0.854380551725626, "num_tokens": 977669597.0, "step": 30633 }, { "entropy": 0.4902703892439604, "epoch": 2.8184886803411136, "grad_norm": 0.15527135133743286, "learning_rate": 6.053914803569786e-06, "loss": 0.4759, "mean_token_accuracy": 0.8498076163232327, "num_tokens": 977702185.0, "step": 30634 }, { "entropy": 0.5540941786020994, "epoch": 2.8185806867125547, "grad_norm": 0.16514402627944946, "learning_rate": 6.0508479774281595e-06, "loss": 0.5421, "mean_token_accuracy": 0.82966398447752, "num_tokens": 977734522.0, "step": 30635 }, { "entropy": 0.39599848352372646, "epoch": 2.818672693083996, "grad_norm": 0.14575470983982086, "learning_rate": 6.047781151286533e-06, "loss": 0.384, "mean_token_accuracy": 0.877319198101759, "num_tokens": 977766129.0, "step": 30636 }, { "entropy": 0.5458386926911771, "epoch": 2.8187646994554374, "grad_norm": 0.16284386813640594, "learning_rate": 6.044714325144908e-06, "loss": 0.5352, "mean_token_accuracy": 0.8312662653625011, "num_tokens": 977798037.0, "step": 30637 }, { "entropy": 0.45873565319925547, "epoch": 2.8188567058268785, "grad_norm": 0.15293405950069427, "learning_rate": 6.041647499003282e-06, "loss": 0.4527, "mean_token_accuracy": 0.8547204807400703, "num_tokens": 977829693.0, "step": 30638 }, { "entropy": 0.5577714201062918, "epoch": 2.8189487121983197, "grad_norm": 0.16721096634864807, "learning_rate": 6.0385806728616556e-06, "loss": 0.5485, "mean_token_accuracy": 0.8234479129314423, "num_tokens": 977861141.0, "step": 30639 }, { "entropy": 0.4087636498734355, "epoch": 2.819040718569761, "grad_norm": 0.1476532369852066, "learning_rate": 6.03551384672003e-06, "loss": 0.4037, "mean_token_accuracy": 0.8695716038346291, "num_tokens": 977893241.0, "step": 30640 }, { "entropy": 0.49195212777704, "epoch": 2.819132724941202, "grad_norm": 0.15762200951576233, "learning_rate": 6.032447020578404e-06, "loss": 0.4905, "mean_token_accuracy": 0.8480879478156567, "num_tokens": 977924926.0, "step": 30641 }, { "entropy": 0.559745498932898, "epoch": 2.8192247313126435, "grad_norm": 0.17023922502994537, "learning_rate": 6.029380194436778e-06, "loss": 0.5542, "mean_token_accuracy": 0.8248878605663776, "num_tokens": 977956302.0, "step": 30642 }, { "entropy": 0.5832675248384476, "epoch": 2.8193167376840846, "grad_norm": 0.16549210250377655, "learning_rate": 6.026313368295152e-06, "loss": 0.5774, "mean_token_accuracy": 0.8206571564078331, "num_tokens": 977988596.0, "step": 30643 }, { "entropy": 0.48908940656110644, "epoch": 2.8194087440555258, "grad_norm": 0.1568450778722763, "learning_rate": 6.023246542153525e-06, "loss": 0.4848, "mean_token_accuracy": 0.8484173342585564, "num_tokens": 978020456.0, "step": 30644 }, { "entropy": 0.5093068955466151, "epoch": 2.819500750426967, "grad_norm": 0.16369087994098663, "learning_rate": 6.0201797160119e-06, "loss": 0.4937, "mean_token_accuracy": 0.8423797972500324, "num_tokens": 978051607.0, "step": 30645 }, { "entropy": 0.46174316853284836, "epoch": 2.819592756798408, "grad_norm": 0.15093007683753967, "learning_rate": 6.017112889870274e-06, "loss": 0.4305, "mean_token_accuracy": 0.8596860691905022, "num_tokens": 978082978.0, "step": 30646 }, { "entropy": 0.5529978442937136, "epoch": 2.8196847631698496, "grad_norm": 0.16279812157154083, "learning_rate": 6.014046063728648e-06, "loss": 0.5488, "mean_token_accuracy": 0.8297162689268589, "num_tokens": 978115124.0, "step": 30647 }, { "entropy": 0.5570217184722424, "epoch": 2.8197767695412908, "grad_norm": 0.16482499241828918, "learning_rate": 6.0109792375870215e-06, "loss": 0.5341, "mean_token_accuracy": 0.8315592706203461, "num_tokens": 978146734.0, "step": 30648 }, { "entropy": 0.458372121443972, "epoch": 2.819868775912732, "grad_norm": 0.14857804775238037, "learning_rate": 6.007912411445395e-06, "loss": 0.4434, "mean_token_accuracy": 0.8577955849468708, "num_tokens": 978179051.0, "step": 30649 }, { "entropy": 0.5656350441277027, "epoch": 2.819960782284173, "grad_norm": 0.16013361513614655, "learning_rate": 6.004845585303769e-06, "loss": 0.5528, "mean_token_accuracy": 0.826419934630394, "num_tokens": 978211459.0, "step": 30650 }, { "entropy": 0.4806794570758939, "epoch": 2.820052788655614, "grad_norm": 0.15092401206493378, "learning_rate": 6.001778759162143e-06, "loss": 0.4584, "mean_token_accuracy": 0.852159459143877, "num_tokens": 978242864.0, "step": 30651 }, { "entropy": 0.5691798310726881, "epoch": 2.8201447950270557, "grad_norm": 0.1737612783908844, "learning_rate": 5.998711933020517e-06, "loss": 0.5608, "mean_token_accuracy": 0.8215178735554218, "num_tokens": 978274719.0, "step": 30652 }, { "entropy": 0.5629078503698111, "epoch": 2.820236801398497, "grad_norm": 0.16663892567157745, "learning_rate": 5.995645106878891e-06, "loss": 0.5526, "mean_token_accuracy": 0.8264601044356823, "num_tokens": 978306452.0, "step": 30653 }, { "entropy": 0.4681504787877202, "epoch": 2.820328807769938, "grad_norm": 0.1508292406797409, "learning_rate": 5.992578280737265e-06, "loss": 0.4602, "mean_token_accuracy": 0.8528414778411388, "num_tokens": 978339184.0, "step": 30654 }, { "entropy": 0.44807169679552317, "epoch": 2.820420814141379, "grad_norm": 0.1519341617822647, "learning_rate": 5.98951145459564e-06, "loss": 0.4236, "mean_token_accuracy": 0.8615587018430233, "num_tokens": 978370662.0, "step": 30655 }, { "entropy": 0.4535581097006798, "epoch": 2.8205128205128203, "grad_norm": 0.15608444809913635, "learning_rate": 5.9864446284540136e-06, "loss": 0.4462, "mean_token_accuracy": 0.8545732647180557, "num_tokens": 978402763.0, "step": 30656 }, { "entropy": 0.4843961736187339, "epoch": 2.820604826884262, "grad_norm": 0.1524607539176941, "learning_rate": 5.983377802312387e-06, "loss": 0.4703, "mean_token_accuracy": 0.8516100198030472, "num_tokens": 978434862.0, "step": 30657 }, { "entropy": 0.4768097852356732, "epoch": 2.820696833255703, "grad_norm": 0.15593256056308746, "learning_rate": 5.980310976170761e-06, "loss": 0.4668, "mean_token_accuracy": 0.8507202230393887, "num_tokens": 978466913.0, "step": 30658 }, { "entropy": 0.5530218966305256, "epoch": 2.820788839627144, "grad_norm": 0.1661440134048462, "learning_rate": 5.977244150029135e-06, "loss": 0.539, "mean_token_accuracy": 0.8295857571065426, "num_tokens": 978497993.0, "step": 30659 }, { "entropy": 0.49552164878696203, "epoch": 2.8208808459985852, "grad_norm": 0.16452491283416748, "learning_rate": 5.97417732388751e-06, "loss": 0.4894, "mean_token_accuracy": 0.8442538417875767, "num_tokens": 978529387.0, "step": 30660 }, { "entropy": 0.49210032168775797, "epoch": 2.8209728523700264, "grad_norm": 0.15056224167346954, "learning_rate": 5.971110497745883e-06, "loss": 0.4805, "mean_token_accuracy": 0.8469334878027439, "num_tokens": 978561714.0, "step": 30661 }, { "entropy": 0.45718653686344624, "epoch": 2.821064858741468, "grad_norm": 0.15081390738487244, "learning_rate": 5.968043671604257e-06, "loss": 0.4466, "mean_token_accuracy": 0.8584586009383202, "num_tokens": 978593653.0, "step": 30662 }, { "entropy": 0.48523078951984644, "epoch": 2.821156865112909, "grad_norm": 0.15714320540428162, "learning_rate": 5.964976845462631e-06, "loss": 0.4759, "mean_token_accuracy": 0.846836507320404, "num_tokens": 978626158.0, "step": 30663 }, { "entropy": 0.4891779227182269, "epoch": 2.82124887148435, "grad_norm": 0.151772141456604, "learning_rate": 5.961910019321005e-06, "loss": 0.475, "mean_token_accuracy": 0.849338211119175, "num_tokens": 978658467.0, "step": 30664 }, { "entropy": 0.45531059242784977, "epoch": 2.8213408778557914, "grad_norm": 0.1504693478345871, "learning_rate": 5.958843193179379e-06, "loss": 0.4516, "mean_token_accuracy": 0.8567344881594181, "num_tokens": 978690543.0, "step": 30665 }, { "entropy": 0.49697323562577367, "epoch": 2.8214328842272325, "grad_norm": 0.15830782055854797, "learning_rate": 5.955776367037752e-06, "loss": 0.4904, "mean_token_accuracy": 0.8482373580336571, "num_tokens": 978722401.0, "step": 30666 }, { "entropy": 0.5956569365225732, "epoch": 2.821524890598674, "grad_norm": 0.16733293235301971, "learning_rate": 5.952709540896126e-06, "loss": 0.5688, "mean_token_accuracy": 0.8145471140742302, "num_tokens": 978754092.0, "step": 30667 }, { "entropy": 0.4350906666368246, "epoch": 2.821616896970115, "grad_norm": 0.14930814504623413, "learning_rate": 5.949642714754501e-06, "loss": 0.4346, "mean_token_accuracy": 0.8616169281303883, "num_tokens": 978786380.0, "step": 30668 }, { "entropy": 0.4654869828373194, "epoch": 2.8217089033415563, "grad_norm": 0.15123142302036285, "learning_rate": 5.946575888612875e-06, "loss": 0.4497, "mean_token_accuracy": 0.8546097837388515, "num_tokens": 978817452.0, "step": 30669 }, { "entropy": 0.5336575880646706, "epoch": 2.8218009097129975, "grad_norm": 0.1579148918390274, "learning_rate": 5.943509062471249e-06, "loss": 0.52, "mean_token_accuracy": 0.836739644408226, "num_tokens": 978849709.0, "step": 30670 }, { "entropy": 0.5384118296205997, "epoch": 2.8218929160844386, "grad_norm": 0.1677444875240326, "learning_rate": 5.940442236329623e-06, "loss": 0.5289, "mean_token_accuracy": 0.8312722817063332, "num_tokens": 978881345.0, "step": 30671 }, { "entropy": 0.5322920456528664, "epoch": 2.82198492245588, "grad_norm": 0.16749367117881775, "learning_rate": 5.937375410187997e-06, "loss": 0.5176, "mean_token_accuracy": 0.8350643254816532, "num_tokens": 978912251.0, "step": 30672 }, { "entropy": 0.4112345587927848, "epoch": 2.8220769288273213, "grad_norm": 0.14138060808181763, "learning_rate": 5.934308584046371e-06, "loss": 0.3908, "mean_token_accuracy": 0.8753745630383492, "num_tokens": 978944298.0, "step": 30673 }, { "entropy": 0.5393845830112696, "epoch": 2.8221689351987624, "grad_norm": 0.1641545593738556, "learning_rate": 5.9312417579047445e-06, "loss": 0.5121, "mean_token_accuracy": 0.8356085531413555, "num_tokens": 978975461.0, "step": 30674 }, { "entropy": 0.45645564375445247, "epoch": 2.8222609415702036, "grad_norm": 0.15081220865249634, "learning_rate": 5.928174931763119e-06, "loss": 0.4458, "mean_token_accuracy": 0.8568639829754829, "num_tokens": 979007923.0, "step": 30675 }, { "entropy": 0.531689414056018, "epoch": 2.8223529479416447, "grad_norm": 0.16138485074043274, "learning_rate": 5.925108105621493e-06, "loss": 0.5304, "mean_token_accuracy": 0.8343422673642635, "num_tokens": 979040234.0, "step": 30676 }, { "entropy": 0.5289607830345631, "epoch": 2.8224449543130863, "grad_norm": 0.1556061953306198, "learning_rate": 5.922041279479867e-06, "loss": 0.5185, "mean_token_accuracy": 0.8316984623670578, "num_tokens": 979072363.0, "step": 30677 }, { "entropy": 0.5056796036660671, "epoch": 2.8225369606845274, "grad_norm": 0.15761838853359222, "learning_rate": 5.9189744533382406e-06, "loss": 0.492, "mean_token_accuracy": 0.8428798913955688, "num_tokens": 979104010.0, "step": 30678 }, { "entropy": 0.6055741814197972, "epoch": 2.8226289670559686, "grad_norm": 0.17062623798847198, "learning_rate": 5.915907627196614e-06, "loss": 0.5912, "mean_token_accuracy": 0.8162107095122337, "num_tokens": 979135707.0, "step": 30679 }, { "entropy": 0.5713395345956087, "epoch": 2.8227209734274097, "grad_norm": 0.1690729260444641, "learning_rate": 5.912840801054988e-06, "loss": 0.5748, "mean_token_accuracy": 0.8176518157124519, "num_tokens": 979167279.0, "step": 30680 }, { "entropy": 0.48549505416303873, "epoch": 2.822812979798851, "grad_norm": 0.1551162749528885, "learning_rate": 5.909773974913362e-06, "loss": 0.4814, "mean_token_accuracy": 0.8485466502606869, "num_tokens": 979199179.0, "step": 30681 }, { "entropy": 0.48792925383895636, "epoch": 2.8229049861702924, "grad_norm": 0.15174415707588196, "learning_rate": 5.906707148771736e-06, "loss": 0.4679, "mean_token_accuracy": 0.8481421507894993, "num_tokens": 979230719.0, "step": 30682 }, { "entropy": 0.4484820021316409, "epoch": 2.8229969925417335, "grad_norm": 0.14732269942760468, "learning_rate": 5.90364032263011e-06, "loss": 0.4347, "mean_token_accuracy": 0.8600813709199429, "num_tokens": 979262722.0, "step": 30683 }, { "entropy": 0.5712294429540634, "epoch": 2.8230889989131747, "grad_norm": 0.16825266182422638, "learning_rate": 5.900573496488484e-06, "loss": 0.5684, "mean_token_accuracy": 0.8211793601512909, "num_tokens": 979295443.0, "step": 30684 }, { "entropy": 0.5309921456500888, "epoch": 2.823181005284616, "grad_norm": 0.16232801973819733, "learning_rate": 5.897506670346859e-06, "loss": 0.5179, "mean_token_accuracy": 0.8348929733037949, "num_tokens": 979327822.0, "step": 30685 }, { "entropy": 0.5215324927121401, "epoch": 2.823273011656057, "grad_norm": 0.16012616455554962, "learning_rate": 5.894439844205233e-06, "loss": 0.5116, "mean_token_accuracy": 0.8391219116747379, "num_tokens": 979359854.0, "step": 30686 }, { "entropy": 0.4457060443237424, "epoch": 2.8233650180274985, "grad_norm": 0.14728757739067078, "learning_rate": 5.8913730180636065e-06, "loss": 0.4328, "mean_token_accuracy": 0.8615280538797379, "num_tokens": 979392549.0, "step": 30687 }, { "entropy": 0.4765072828158736, "epoch": 2.8234570243989396, "grad_norm": 0.15808729827404022, "learning_rate": 5.88830619192198e-06, "loss": 0.4696, "mean_token_accuracy": 0.8497406505048275, "num_tokens": 979424161.0, "step": 30688 }, { "entropy": 0.5553435208275914, "epoch": 2.8235490307703808, "grad_norm": 0.16468647122383118, "learning_rate": 5.885239365780354e-06, "loss": 0.5411, "mean_token_accuracy": 0.8318768814206123, "num_tokens": 979455348.0, "step": 30689 }, { "entropy": 0.5105995927006006, "epoch": 2.823641037141822, "grad_norm": 0.1550377607345581, "learning_rate": 5.882172539638728e-06, "loss": 0.4985, "mean_token_accuracy": 0.8385362289845943, "num_tokens": 979487877.0, "step": 30690 }, { "entropy": 0.45496634766459465, "epoch": 2.823733043513263, "grad_norm": 0.14992964267730713, "learning_rate": 5.8791057134971025e-06, "loss": 0.4435, "mean_token_accuracy": 0.8586935251951218, "num_tokens": 979520175.0, "step": 30691 }, { "entropy": 0.46663113962858915, "epoch": 2.8238250498847046, "grad_norm": 0.1533048152923584, "learning_rate": 5.876038887355476e-06, "loss": 0.459, "mean_token_accuracy": 0.8565846011042595, "num_tokens": 979551611.0, "step": 30692 }, { "entropy": 0.3910221103578806, "epoch": 2.8239170562561458, "grad_norm": 0.1443222016096115, "learning_rate": 5.87297206121385e-06, "loss": 0.3657, "mean_token_accuracy": 0.8778267987072468, "num_tokens": 979582566.0, "step": 30693 }, { "entropy": 0.5123604238033295, "epoch": 2.824009062627587, "grad_norm": 0.16390658915042877, "learning_rate": 5.869905235072224e-06, "loss": 0.5024, "mean_token_accuracy": 0.8394579701125622, "num_tokens": 979614496.0, "step": 30694 }, { "entropy": 0.49132039677351713, "epoch": 2.824101068999028, "grad_norm": 0.15964899957180023, "learning_rate": 5.866838408930598e-06, "loss": 0.4814, "mean_token_accuracy": 0.8464353196322918, "num_tokens": 979646079.0, "step": 30695 }, { "entropy": 0.4842971384059638, "epoch": 2.824193075370469, "grad_norm": 0.15781472623348236, "learning_rate": 5.8637715827889715e-06, "loss": 0.48, "mean_token_accuracy": 0.8479972220957279, "num_tokens": 979677858.0, "step": 30696 }, { "entropy": 0.47871224395930767, "epoch": 2.8242850817419107, "grad_norm": 0.15414239466190338, "learning_rate": 5.860704756647345e-06, "loss": 0.4634, "mean_token_accuracy": 0.8513352684676647, "num_tokens": 979710382.0, "step": 30697 }, { "entropy": 0.40267108799889684, "epoch": 2.824377088113352, "grad_norm": 0.14055156707763672, "learning_rate": 5.85763793050572e-06, "loss": 0.3873, "mean_token_accuracy": 0.8752901628613472, "num_tokens": 979742314.0, "step": 30698 }, { "entropy": 0.46483452804386616, "epoch": 2.824469094484793, "grad_norm": 0.1485041081905365, "learning_rate": 5.854571104364094e-06, "loss": 0.4485, "mean_token_accuracy": 0.8561561703681946, "num_tokens": 979774268.0, "step": 30699 }, { "entropy": 0.5460274163633585, "epoch": 2.824561100856234, "grad_norm": 0.16521137952804565, "learning_rate": 5.851504278222468e-06, "loss": 0.537, "mean_token_accuracy": 0.8278980478644371, "num_tokens": 979806555.0, "step": 30700 }, { "entropy": 0.4754151524975896, "epoch": 2.8246531072276753, "grad_norm": 0.15530316531658173, "learning_rate": 5.848437452080842e-06, "loss": 0.4712, "mean_token_accuracy": 0.8513538874685764, "num_tokens": 979838564.0, "step": 30701 }, { "entropy": 0.5357860047370195, "epoch": 2.824745113599117, "grad_norm": 0.15577299892902374, "learning_rate": 5.845370625939216e-06, "loss": 0.5205, "mean_token_accuracy": 0.8366206586360931, "num_tokens": 979871332.0, "step": 30702 }, { "entropy": 0.5206956584006548, "epoch": 2.824837119970558, "grad_norm": 0.16263645887374878, "learning_rate": 5.84230379979759e-06, "loss": 0.5206, "mean_token_accuracy": 0.8364713713526726, "num_tokens": 979903755.0, "step": 30703 }, { "entropy": 0.510059641674161, "epoch": 2.824929126341999, "grad_norm": 0.16078579425811768, "learning_rate": 5.839236973655964e-06, "loss": 0.5146, "mean_token_accuracy": 0.8377950228750706, "num_tokens": 979936168.0, "step": 30704 }, { "entropy": 0.45015039574354887, "epoch": 2.8250211327134402, "grad_norm": 0.155058354139328, "learning_rate": 5.836170147514337e-06, "loss": 0.4447, "mean_token_accuracy": 0.8579364977777004, "num_tokens": 979968398.0, "step": 30705 }, { "entropy": 0.45773681811988354, "epoch": 2.8251131390848814, "grad_norm": 0.14887858927249908, "learning_rate": 5.833103321372712e-06, "loss": 0.4501, "mean_token_accuracy": 0.85500717908144, "num_tokens": 980000624.0, "step": 30706 }, { "entropy": 0.523702540434897, "epoch": 2.825205145456323, "grad_norm": 0.158290833234787, "learning_rate": 5.830036495231086e-06, "loss": 0.5105, "mean_token_accuracy": 0.8394437283277512, "num_tokens": 980032665.0, "step": 30707 }, { "entropy": 0.5575965833850205, "epoch": 2.825297151827764, "grad_norm": 0.16496066749095917, "learning_rate": 5.82696966908946e-06, "loss": 0.5397, "mean_token_accuracy": 0.8280420750379562, "num_tokens": 980064392.0, "step": 30708 }, { "entropy": 0.5103539302945137, "epoch": 2.825389158199205, "grad_norm": 0.15585334599018097, "learning_rate": 5.8239028429478335e-06, "loss": 0.4943, "mean_token_accuracy": 0.8448812067508698, "num_tokens": 980096662.0, "step": 30709 }, { "entropy": 0.4790516151115298, "epoch": 2.8254811645706464, "grad_norm": 0.1572667360305786, "learning_rate": 5.820836016806207e-06, "loss": 0.4696, "mean_token_accuracy": 0.848761536180973, "num_tokens": 980128356.0, "step": 30710 }, { "entropy": 0.5093629863113165, "epoch": 2.8255731709420875, "grad_norm": 0.1586901843547821, "learning_rate": 5.817769190664581e-06, "loss": 0.4943, "mean_token_accuracy": 0.8446452654898167, "num_tokens": 980160068.0, "step": 30711 }, { "entropy": 0.4468823978677392, "epoch": 2.825665177313529, "grad_norm": 0.15353244543075562, "learning_rate": 5.814702364522955e-06, "loss": 0.4335, "mean_token_accuracy": 0.860167745500803, "num_tokens": 980191569.0, "step": 30712 }, { "entropy": 0.49982450250536203, "epoch": 2.82575718368497, "grad_norm": 0.15122289955615997, "learning_rate": 5.8116355383813295e-06, "loss": 0.4937, "mean_token_accuracy": 0.8459341712296009, "num_tokens": 980224112.0, "step": 30713 }, { "entropy": 0.4808986969292164, "epoch": 2.8258491900564113, "grad_norm": 0.1572885811328888, "learning_rate": 5.808568712239703e-06, "loss": 0.4654, "mean_token_accuracy": 0.8493192754685879, "num_tokens": 980255724.0, "step": 30714 }, { "entropy": 0.6167458230629563, "epoch": 2.8259411964278525, "grad_norm": 0.17475128173828125, "learning_rate": 5.805501886098078e-06, "loss": 0.6012, "mean_token_accuracy": 0.8123305551707745, "num_tokens": 980287463.0, "step": 30715 }, { "entropy": 0.5052719851955771, "epoch": 2.8260332027992936, "grad_norm": 0.15749770402908325, "learning_rate": 5.802435059956452e-06, "loss": 0.4955, "mean_token_accuracy": 0.8425124622881413, "num_tokens": 980319375.0, "step": 30716 }, { "entropy": 0.5469092973507941, "epoch": 2.826125209170735, "grad_norm": 0.15767431259155273, "learning_rate": 5.7993682338148256e-06, "loss": 0.5364, "mean_token_accuracy": 0.8292575404047966, "num_tokens": 980351549.0, "step": 30717 }, { "entropy": 0.6190937533974648, "epoch": 2.8262172155421763, "grad_norm": 0.17760969698429108, "learning_rate": 5.796301407673199e-06, "loss": 0.6122, "mean_token_accuracy": 0.8080600127577782, "num_tokens": 980383164.0, "step": 30718 }, { "entropy": 0.5352273555472493, "epoch": 2.8263092219136174, "grad_norm": 0.1586073487997055, "learning_rate": 5.793234581531573e-06, "loss": 0.5203, "mean_token_accuracy": 0.8365787453949451, "num_tokens": 980415225.0, "step": 30719 }, { "entropy": 0.5370484218001366, "epoch": 2.8264012282850586, "grad_norm": 0.16470053791999817, "learning_rate": 5.790167755389947e-06, "loss": 0.5336, "mean_token_accuracy": 0.8288317993283272, "num_tokens": 980446624.0, "step": 30720 }, { "entropy": 0.5479905591346323, "epoch": 2.8264932346564997, "grad_norm": 0.1580156832933426, "learning_rate": 5.787100929248322e-06, "loss": 0.5341, "mean_token_accuracy": 0.8325903676450253, "num_tokens": 980479392.0, "step": 30721 }, { "entropy": 0.4404736696742475, "epoch": 2.8265852410279413, "grad_norm": 0.15573161840438843, "learning_rate": 5.784034103106695e-06, "loss": 0.4298, "mean_token_accuracy": 0.8627054654061794, "num_tokens": 980510336.0, "step": 30722 }, { "entropy": 0.44932823348790407, "epoch": 2.8266772473993824, "grad_norm": 0.1459510624408722, "learning_rate": 5.780967276965069e-06, "loss": 0.4362, "mean_token_accuracy": 0.8612214289605618, "num_tokens": 980542422.0, "step": 30723 }, { "entropy": 0.4759682109579444, "epoch": 2.8267692537708236, "grad_norm": 0.15419597923755646, "learning_rate": 5.777900450823443e-06, "loss": 0.4636, "mean_token_accuracy": 0.854646809399128, "num_tokens": 980574750.0, "step": 30724 }, { "entropy": 0.49297099094837904, "epoch": 2.8268612601422647, "grad_norm": 0.16193923354148865, "learning_rate": 5.774833624681817e-06, "loss": 0.4804, "mean_token_accuracy": 0.8438408747315407, "num_tokens": 980606235.0, "step": 30725 }, { "entropy": 0.4897456313483417, "epoch": 2.826953266513706, "grad_norm": 0.16127702593803406, "learning_rate": 5.771766798540191e-06, "loss": 0.4837, "mean_token_accuracy": 0.8459902592003345, "num_tokens": 980638160.0, "step": 30726 }, { "entropy": 0.4363760482519865, "epoch": 2.8270452728851474, "grad_norm": 0.14531256258487701, "learning_rate": 5.768699972398564e-06, "loss": 0.4254, "mean_token_accuracy": 0.8637722693383694, "num_tokens": 980670151.0, "step": 30727 }, { "entropy": 0.4884539758786559, "epoch": 2.8271372792565885, "grad_norm": 0.156505286693573, "learning_rate": 5.765633146256939e-06, "loss": 0.4786, "mean_token_accuracy": 0.846405565738678, "num_tokens": 980702358.0, "step": 30728 }, { "entropy": 0.4709008689969778, "epoch": 2.8272292856280297, "grad_norm": 0.15103039145469666, "learning_rate": 5.762566320115313e-06, "loss": 0.4551, "mean_token_accuracy": 0.8566405475139618, "num_tokens": 980734491.0, "step": 30729 }, { "entropy": 0.5427050925791264, "epoch": 2.827321291999471, "grad_norm": 0.1649104803800583, "learning_rate": 5.7594994939736875e-06, "loss": 0.5261, "mean_token_accuracy": 0.8339856080710888, "num_tokens": 980765008.0, "step": 30730 }, { "entropy": 0.43452922254800797, "epoch": 2.827413298370912, "grad_norm": 0.14713752269744873, "learning_rate": 5.756432667832061e-06, "loss": 0.4283, "mean_token_accuracy": 0.8626778982579708, "num_tokens": 980796492.0, "step": 30731 }, { "entropy": 0.5952228512614965, "epoch": 2.8275053047423535, "grad_norm": 0.17106515169143677, "learning_rate": 5.753365841690435e-06, "loss": 0.5828, "mean_token_accuracy": 0.8185066394507885, "num_tokens": 980827575.0, "step": 30732 }, { "entropy": 0.4049360987264663, "epoch": 2.8275973111137946, "grad_norm": 0.1453365832567215, "learning_rate": 5.750299015548809e-06, "loss": 0.3899, "mean_token_accuracy": 0.8727223202586174, "num_tokens": 980859536.0, "step": 30733 }, { "entropy": 0.4245196804404259, "epoch": 2.8276893174852358, "grad_norm": 0.1474565863609314, "learning_rate": 5.747232189407183e-06, "loss": 0.4071, "mean_token_accuracy": 0.8671754561364651, "num_tokens": 980891007.0, "step": 30734 }, { "entropy": 0.5188368950039148, "epoch": 2.827781323856677, "grad_norm": 0.1607431024312973, "learning_rate": 5.7441653632655565e-06, "loss": 0.5022, "mean_token_accuracy": 0.8392727598547935, "num_tokens": 980922549.0, "step": 30735 }, { "entropy": 0.45021918904967606, "epoch": 2.827873330228118, "grad_norm": 0.1432957798242569, "learning_rate": 5.741098537123931e-06, "loss": 0.4338, "mean_token_accuracy": 0.8629451803863049, "num_tokens": 980954876.0, "step": 30736 }, { "entropy": 0.4375721737742424, "epoch": 2.8279653365995596, "grad_norm": 0.15015611052513123, "learning_rate": 5.738031710982305e-06, "loss": 0.4233, "mean_token_accuracy": 0.862211998552084, "num_tokens": 980986301.0, "step": 30737 }, { "entropy": 0.4759975429624319, "epoch": 2.8280573429710008, "grad_norm": 0.1553383767604828, "learning_rate": 5.734964884840679e-06, "loss": 0.4787, "mean_token_accuracy": 0.8461357913911343, "num_tokens": 981018712.0, "step": 30738 }, { "entropy": 0.5220368313603103, "epoch": 2.828149349342442, "grad_norm": 0.16791073977947235, "learning_rate": 5.7318980586990526e-06, "loss": 0.5174, "mean_token_accuracy": 0.8349144719541073, "num_tokens": 981050760.0, "step": 30739 }, { "entropy": 0.4760425901040435, "epoch": 2.828241355713883, "grad_norm": 0.15850703418254852, "learning_rate": 5.728831232557426e-06, "loss": 0.4659, "mean_token_accuracy": 0.8493364974856377, "num_tokens": 981083289.0, "step": 30740 }, { "entropy": 0.4491696336772293, "epoch": 2.828333362085324, "grad_norm": 0.14644743502140045, "learning_rate": 5.7257644064158e-06, "loss": 0.4273, "mean_token_accuracy": 0.8628015965223312, "num_tokens": 981115793.0, "step": 30741 }, { "entropy": 0.6213086172938347, "epoch": 2.8284253684567657, "grad_norm": 0.16849030554294586, "learning_rate": 5.722697580274174e-06, "loss": 0.6113, "mean_token_accuracy": 0.8081787303090096, "num_tokens": 981148423.0, "step": 30742 }, { "entropy": 0.5609804578125477, "epoch": 2.828517374828207, "grad_norm": 0.16737361252307892, "learning_rate": 5.719630754132549e-06, "loss": 0.5475, "mean_token_accuracy": 0.8244437538087368, "num_tokens": 981180005.0, "step": 30743 }, { "entropy": 0.5187018159776926, "epoch": 2.828609381199648, "grad_norm": 0.15968452394008636, "learning_rate": 5.716563927990922e-06, "loss": 0.5121, "mean_token_accuracy": 0.8402453511953354, "num_tokens": 981211838.0, "step": 30744 }, { "entropy": 0.586634092964232, "epoch": 2.828701387571089, "grad_norm": 0.16855624318122864, "learning_rate": 5.713497101849297e-06, "loss": 0.5741, "mean_token_accuracy": 0.81878811866045, "num_tokens": 981243754.0, "step": 30745 }, { "entropy": 0.43090315256267786, "epoch": 2.8287933939425303, "grad_norm": 0.1496388465166092, "learning_rate": 5.710430275707671e-06, "loss": 0.4303, "mean_token_accuracy": 0.8641488552093506, "num_tokens": 981275772.0, "step": 30746 }, { "entropy": 0.6209806464612484, "epoch": 2.828885400313972, "grad_norm": 0.1730778068304062, "learning_rate": 5.707363449566045e-06, "loss": 0.6024, "mean_token_accuracy": 0.8111903332173824, "num_tokens": 981308122.0, "step": 30747 }, { "entropy": 0.4652902130037546, "epoch": 2.828977406685413, "grad_norm": 0.15498612821102142, "learning_rate": 5.7042966234244184e-06, "loss": 0.451, "mean_token_accuracy": 0.8565200828015804, "num_tokens": 981340019.0, "step": 30748 }, { "entropy": 0.42890664935112, "epoch": 2.829069413056854, "grad_norm": 0.15043799579143524, "learning_rate": 5.701229797282792e-06, "loss": 0.4225, "mean_token_accuracy": 0.8667032867670059, "num_tokens": 981371788.0, "step": 30749 }, { "entropy": 0.5188657604157925, "epoch": 2.8291614194282952, "grad_norm": 0.15568311512470245, "learning_rate": 5.698162971141166e-06, "loss": 0.5044, "mean_token_accuracy": 0.8392857648432255, "num_tokens": 981403497.0, "step": 30750 }, { "entropy": 0.5107304895063862, "epoch": 2.8292534257997364, "grad_norm": 0.1557496339082718, "learning_rate": 5.69509614499954e-06, "loss": 0.4931, "mean_token_accuracy": 0.8449386209249496, "num_tokens": 981435991.0, "step": 30751 }, { "entropy": 0.524192813783884, "epoch": 2.829345432171178, "grad_norm": 0.15437975525856018, "learning_rate": 5.6920293188579145e-06, "loss": 0.5035, "mean_token_accuracy": 0.8398679830133915, "num_tokens": 981467448.0, "step": 30752 }, { "entropy": 0.44923115335404873, "epoch": 2.829437438542619, "grad_norm": 0.14449234306812286, "learning_rate": 5.688962492716288e-06, "loss": 0.4313, "mean_token_accuracy": 0.8649622239172459, "num_tokens": 981499919.0, "step": 30753 }, { "entropy": 0.5067380275577307, "epoch": 2.82952944491406, "grad_norm": 0.16109438240528107, "learning_rate": 5.685895666574662e-06, "loss": 0.496, "mean_token_accuracy": 0.8415318913757801, "num_tokens": 981531832.0, "step": 30754 }, { "entropy": 0.5012020859867334, "epoch": 2.8296214512855014, "grad_norm": 0.15479475259780884, "learning_rate": 5.682828840433036e-06, "loss": 0.4912, "mean_token_accuracy": 0.8451342694461346, "num_tokens": 981563829.0, "step": 30755 }, { "entropy": 0.5161574184894562, "epoch": 2.8297134576569425, "grad_norm": 0.16147741675376892, "learning_rate": 5.67976201429141e-06, "loss": 0.514, "mean_token_accuracy": 0.8377743512392044, "num_tokens": 981595930.0, "step": 30756 }, { "entropy": 0.5944633092731237, "epoch": 2.829805464028384, "grad_norm": 0.1678607016801834, "learning_rate": 5.6766951881497835e-06, "loss": 0.5938, "mean_token_accuracy": 0.8154339790344238, "num_tokens": 981628114.0, "step": 30757 }, { "entropy": 0.5006955247372389, "epoch": 2.829897470399825, "grad_norm": 0.15470664203166962, "learning_rate": 5.673628362008158e-06, "loss": 0.491, "mean_token_accuracy": 0.844619557261467, "num_tokens": 981660876.0, "step": 30758 }, { "entropy": 0.48524318542331457, "epoch": 2.8299894767712663, "grad_norm": 0.15498578548431396, "learning_rate": 5.670561535866532e-06, "loss": 0.4715, "mean_token_accuracy": 0.8480599410831928, "num_tokens": 981692596.0, "step": 30759 }, { "entropy": 0.4613969293422997, "epoch": 2.830081483142708, "grad_norm": 0.1473885476589203, "learning_rate": 5.667494709724907e-06, "loss": 0.4474, "mean_token_accuracy": 0.8591958619654179, "num_tokens": 981725136.0, "step": 30760 }, { "entropy": 0.5209539271891117, "epoch": 2.8301734895141486, "grad_norm": 0.15895788371562958, "learning_rate": 5.66442788358328e-06, "loss": 0.5114, "mean_token_accuracy": 0.839583832770586, "num_tokens": 981757245.0, "step": 30761 }, { "entropy": 0.49122844776138663, "epoch": 2.83026549588559, "grad_norm": 0.15494033694267273, "learning_rate": 5.661361057441654e-06, "loss": 0.4809, "mean_token_accuracy": 0.8475398011505604, "num_tokens": 981789940.0, "step": 30762 }, { "entropy": 0.608969546854496, "epoch": 2.8303575022570313, "grad_norm": 0.17324140667915344, "learning_rate": 5.658294231300028e-06, "loss": 0.6086, "mean_token_accuracy": 0.8110148310661316, "num_tokens": 981821839.0, "step": 30763 }, { "entropy": 0.44588272273540497, "epoch": 2.8304495086284724, "grad_norm": 0.14703841507434845, "learning_rate": 5.655227405158402e-06, "loss": 0.4309, "mean_token_accuracy": 0.8622820265591145, "num_tokens": 981853763.0, "step": 30764 }, { "entropy": 0.5390018466860056, "epoch": 2.830541514999914, "grad_norm": 0.1574896275997162, "learning_rate": 5.652160579016776e-06, "loss": 0.518, "mean_token_accuracy": 0.8372841849923134, "num_tokens": 981886191.0, "step": 30765 }, { "entropy": 0.5335904574021697, "epoch": 2.8306335213713547, "grad_norm": 0.16236627101898193, "learning_rate": 5.649093752875149e-06, "loss": 0.5206, "mean_token_accuracy": 0.8329044654965401, "num_tokens": 981918004.0, "step": 30766 }, { "entropy": 0.4184075314551592, "epoch": 2.8307255277427963, "grad_norm": 0.14028549194335938, "learning_rate": 5.646026926733524e-06, "loss": 0.4029, "mean_token_accuracy": 0.8719499818980694, "num_tokens": 981950183.0, "step": 30767 }, { "entropy": 0.5258149644359946, "epoch": 2.8308175341142374, "grad_norm": 0.15707919001579285, "learning_rate": 5.642960100591898e-06, "loss": 0.5048, "mean_token_accuracy": 0.8410048969089985, "num_tokens": 981982293.0, "step": 30768 }, { "entropy": 0.6177536565810442, "epoch": 2.8309095404856786, "grad_norm": 0.17158116400241852, "learning_rate": 5.639893274450272e-06, "loss": 0.611, "mean_token_accuracy": 0.8087483271956444, "num_tokens": 982014171.0, "step": 30769 }, { "entropy": 0.4836545465514064, "epoch": 2.83100154685712, "grad_norm": 0.15162163972854614, "learning_rate": 5.6368264483086454e-06, "loss": 0.4706, "mean_token_accuracy": 0.8528161570429802, "num_tokens": 982045789.0, "step": 30770 }, { "entropy": 0.5584819592768326, "epoch": 2.831093553228561, "grad_norm": 0.1608712375164032, "learning_rate": 5.633759622167019e-06, "loss": 0.5357, "mean_token_accuracy": 0.8294152952730656, "num_tokens": 982077469.0, "step": 30771 }, { "entropy": 0.49154803063720465, "epoch": 2.8311855596000024, "grad_norm": 0.15500931441783905, "learning_rate": 5.630692796025393e-06, "loss": 0.4855, "mean_token_accuracy": 0.84512098133564, "num_tokens": 982109392.0, "step": 30772 }, { "entropy": 0.4140441018389538, "epoch": 2.8312775659714435, "grad_norm": 0.14062243700027466, "learning_rate": 5.627625969883768e-06, "loss": 0.3939, "mean_token_accuracy": 0.8749253042042255, "num_tokens": 982141276.0, "step": 30773 }, { "entropy": 0.4587291283532977, "epoch": 2.8313695723428847, "grad_norm": 0.15371759235858917, "learning_rate": 5.6245591437421415e-06, "loss": 0.4525, "mean_token_accuracy": 0.852049745619297, "num_tokens": 982172876.0, "step": 30774 }, { "entropy": 0.4937840709462762, "epoch": 2.8314615787143262, "grad_norm": 0.153734028339386, "learning_rate": 5.621492317600516e-06, "loss": 0.4855, "mean_token_accuracy": 0.8437619470059872, "num_tokens": 982204810.0, "step": 30775 }, { "entropy": 0.5473852527793497, "epoch": 2.831553585085767, "grad_norm": 0.16592560708522797, "learning_rate": 5.61842549145889e-06, "loss": 0.529, "mean_token_accuracy": 0.8318765349686146, "num_tokens": 982236525.0, "step": 30776 }, { "entropy": 0.48574246698990464, "epoch": 2.8316455914572085, "grad_norm": 0.15510044991970062, "learning_rate": 5.615358665317264e-06, "loss": 0.4801, "mean_token_accuracy": 0.8495673947036266, "num_tokens": 982268097.0, "step": 30777 }, { "entropy": 0.5177850658074021, "epoch": 2.8317375978286496, "grad_norm": 0.16456636786460876, "learning_rate": 5.6122918391756375e-06, "loss": 0.5035, "mean_token_accuracy": 0.8403764627873898, "num_tokens": 982299263.0, "step": 30778 }, { "entropy": 0.5911246575415134, "epoch": 2.8318296042000908, "grad_norm": 0.1706560105085373, "learning_rate": 5.609225013034011e-06, "loss": 0.5908, "mean_token_accuracy": 0.8173394091427326, "num_tokens": 982330927.0, "step": 30779 }, { "entropy": 0.518230794928968, "epoch": 2.8319216105715324, "grad_norm": 0.15378785133361816, "learning_rate": 5.606158186892385e-06, "loss": 0.5098, "mean_token_accuracy": 0.8395098634064198, "num_tokens": 982363070.0, "step": 30780 }, { "entropy": 0.42597562773153186, "epoch": 2.832013616942973, "grad_norm": 0.1502479612827301, "learning_rate": 5.603091360750759e-06, "loss": 0.4164, "mean_token_accuracy": 0.8639299273490906, "num_tokens": 982394313.0, "step": 30781 }, { "entropy": 0.5301134269684553, "epoch": 2.8321056233144146, "grad_norm": 0.16273942589759827, "learning_rate": 5.600024534609134e-06, "loss": 0.5292, "mean_token_accuracy": 0.8342523835599422, "num_tokens": 982425662.0, "step": 30782 }, { "entropy": 0.5227723009884357, "epoch": 2.8321976296858558, "grad_norm": 0.1636069118976593, "learning_rate": 5.596957708467507e-06, "loss": 0.5087, "mean_token_accuracy": 0.8381098732352257, "num_tokens": 982457496.0, "step": 30783 }, { "entropy": 0.5127747878432274, "epoch": 2.832289636057297, "grad_norm": 0.15973149240016937, "learning_rate": 5.593890882325881e-06, "loss": 0.497, "mean_token_accuracy": 0.8423040993511677, "num_tokens": 982488416.0, "step": 30784 }, { "entropy": 0.4870662880130112, "epoch": 2.8323816424287385, "grad_norm": 0.15169215202331543, "learning_rate": 5.590824056184255e-06, "loss": 0.4864, "mean_token_accuracy": 0.8509495630860329, "num_tokens": 982520594.0, "step": 30785 }, { "entropy": 0.4763760860078037, "epoch": 2.832473648800179, "grad_norm": 0.15279942750930786, "learning_rate": 5.587757230042629e-06, "loss": 0.4658, "mean_token_accuracy": 0.8526883125305176, "num_tokens": 982552689.0, "step": 30786 }, { "entropy": 0.5011884350096807, "epoch": 2.8325656551716207, "grad_norm": 0.1542358696460724, "learning_rate": 5.584690403901003e-06, "loss": 0.4893, "mean_token_accuracy": 0.842780590057373, "num_tokens": 982584257.0, "step": 30787 }, { "entropy": 0.4408895878586918, "epoch": 2.832657661543062, "grad_norm": 0.15300388634204865, "learning_rate": 5.581623577759377e-06, "loss": 0.4333, "mean_token_accuracy": 0.862041600048542, "num_tokens": 982615330.0, "step": 30788 }, { "entropy": 0.536591898300685, "epoch": 2.832749667914503, "grad_norm": 0.16071471571922302, "learning_rate": 5.578556751617751e-06, "loss": 0.5226, "mean_token_accuracy": 0.8355703055858612, "num_tokens": 982647339.0, "step": 30789 }, { "entropy": 0.509639548137784, "epoch": 2.8328416742859446, "grad_norm": 0.16082000732421875, "learning_rate": 5.575489925476126e-06, "loss": 0.4922, "mean_token_accuracy": 0.8435748256742954, "num_tokens": 982678813.0, "step": 30790 }, { "entropy": 0.5434460481628776, "epoch": 2.8329336806573853, "grad_norm": 0.1637696474790573, "learning_rate": 5.5724230993344995e-06, "loss": 0.5312, "mean_token_accuracy": 0.8329576253890991, "num_tokens": 982710511.0, "step": 30791 }, { "entropy": 0.5874759647995234, "epoch": 2.833025687028827, "grad_norm": 0.17405186593532562, "learning_rate": 5.569356273192873e-06, "loss": 0.5871, "mean_token_accuracy": 0.8143781535327435, "num_tokens": 982742550.0, "step": 30792 }, { "entropy": 0.5521581941284239, "epoch": 2.833117693400268, "grad_norm": 0.16535548865795135, "learning_rate": 5.566289447051247e-06, "loss": 0.5314, "mean_token_accuracy": 0.8317292332649231, "num_tokens": 982774032.0, "step": 30793 }, { "entropy": 0.42204171791672707, "epoch": 2.833209699771709, "grad_norm": 0.14864133298397064, "learning_rate": 5.563222620909621e-06, "loss": 0.3973, "mean_token_accuracy": 0.8727068826556206, "num_tokens": 982804849.0, "step": 30794 }, { "entropy": 0.45346603682264686, "epoch": 2.8333017061431507, "grad_norm": 0.1511583775281906, "learning_rate": 5.560155794767995e-06, "loss": 0.4397, "mean_token_accuracy": 0.8585865013301373, "num_tokens": 982836626.0, "step": 30795 }, { "entropy": 0.4778182804584503, "epoch": 2.8333937125145914, "grad_norm": 0.15419700741767883, "learning_rate": 5.5570889686263685e-06, "loss": 0.4754, "mean_token_accuracy": 0.8499455563724041, "num_tokens": 982868487.0, "step": 30796 }, { "entropy": 0.5770160835236311, "epoch": 2.833485718886033, "grad_norm": 0.16805121302604675, "learning_rate": 5.554022142484743e-06, "loss": 0.5578, "mean_token_accuracy": 0.8229421488940716, "num_tokens": 982900361.0, "step": 30797 }, { "entropy": 0.4690220768097788, "epoch": 2.833577725257474, "grad_norm": 0.15200263261795044, "learning_rate": 5.550955316343117e-06, "loss": 0.4526, "mean_token_accuracy": 0.8551665842533112, "num_tokens": 982932274.0, "step": 30798 }, { "entropy": 0.586215203627944, "epoch": 2.8336697316289152, "grad_norm": 0.16454531252384186, "learning_rate": 5.547888490201491e-06, "loss": 0.5652, "mean_token_accuracy": 0.8193839080631733, "num_tokens": 982964182.0, "step": 30799 }, { "entropy": 0.5674469098448753, "epoch": 2.833761738000357, "grad_norm": 0.16725873947143555, "learning_rate": 5.5448216640598645e-06, "loss": 0.5469, "mean_token_accuracy": 0.8226227574050426, "num_tokens": 982995695.0, "step": 30800 }, { "entropy": 0.5352579923346639, "epoch": 2.8338537443717975, "grad_norm": 0.16175317764282227, "learning_rate": 5.541754837918238e-06, "loss": 0.5171, "mean_token_accuracy": 0.8371655084192753, "num_tokens": 983026829.0, "step": 30801 }, { "entropy": 0.4755205390974879, "epoch": 2.833945750743239, "grad_norm": 0.15058408677577972, "learning_rate": 5.538688011776612e-06, "loss": 0.4557, "mean_token_accuracy": 0.8557251617312431, "num_tokens": 983058837.0, "step": 30802 }, { "entropy": 0.5963310617953539, "epoch": 2.83403775711468, "grad_norm": 0.16825750470161438, "learning_rate": 5.535621185634987e-06, "loss": 0.591, "mean_token_accuracy": 0.8169018737971783, "num_tokens": 983091254.0, "step": 30803 }, { "entropy": 0.47828649263828993, "epoch": 2.8341297634861213, "grad_norm": 0.15391774475574493, "learning_rate": 5.532554359493361e-06, "loss": 0.4661, "mean_token_accuracy": 0.8499655500054359, "num_tokens": 983123783.0, "step": 30804 }, { "entropy": 0.527013260871172, "epoch": 2.834221769857563, "grad_norm": 0.1651645302772522, "learning_rate": 5.529487533351735e-06, "loss": 0.5155, "mean_token_accuracy": 0.8345692865550518, "num_tokens": 983155469.0, "step": 30805 }, { "entropy": 0.5635727867484093, "epoch": 2.8343137762290036, "grad_norm": 0.16516827046871185, "learning_rate": 5.526420707210109e-06, "loss": 0.5454, "mean_token_accuracy": 0.8252821639180183, "num_tokens": 983187468.0, "step": 30806 }, { "entropy": 0.49112529028207064, "epoch": 2.834405782600445, "grad_norm": 0.15268383920192719, "learning_rate": 5.523353881068483e-06, "loss": 0.4683, "mean_token_accuracy": 0.8483290150761604, "num_tokens": 983219522.0, "step": 30807 }, { "entropy": 0.520997291430831, "epoch": 2.8344977889718863, "grad_norm": 0.1592126190662384, "learning_rate": 5.520287054926857e-06, "loss": 0.5106, "mean_token_accuracy": 0.8360397182404995, "num_tokens": 983251722.0, "step": 30808 }, { "entropy": 0.6253173900768161, "epoch": 2.8345897953433274, "grad_norm": 0.17194989323616028, "learning_rate": 5.5172202287852304e-06, "loss": 0.6101, "mean_token_accuracy": 0.8083648346364498, "num_tokens": 983284249.0, "step": 30809 }, { "entropy": 0.44241382472682744, "epoch": 2.834681801714769, "grad_norm": 0.1517944484949112, "learning_rate": 5.514153402643604e-06, "loss": 0.426, "mean_token_accuracy": 0.8608533143997192, "num_tokens": 983315779.0, "step": 30810 }, { "entropy": 0.49941227841190994, "epoch": 2.8347738080862097, "grad_norm": 0.1526833027601242, "learning_rate": 5.511086576501978e-06, "loss": 0.4813, "mean_token_accuracy": 0.8490854650735855, "num_tokens": 983348277.0, "step": 30811 }, { "entropy": 0.5026094671338797, "epoch": 2.8348658144576513, "grad_norm": 0.15999311208724976, "learning_rate": 5.508019750360352e-06, "loss": 0.4903, "mean_token_accuracy": 0.8446546159684658, "num_tokens": 983379736.0, "step": 30812 }, { "entropy": 0.4463031133636832, "epoch": 2.8349578208290924, "grad_norm": 0.150692880153656, "learning_rate": 5.5049529242187265e-06, "loss": 0.4335, "mean_token_accuracy": 0.8610712923109531, "num_tokens": 983410912.0, "step": 30813 }, { "entropy": 0.5710107535123825, "epoch": 2.8350498272005336, "grad_norm": 0.16533899307250977, "learning_rate": 5.5018860980771e-06, "loss": 0.5541, "mean_token_accuracy": 0.8267124071717262, "num_tokens": 983442798.0, "step": 30814 }, { "entropy": 0.4289022843586281, "epoch": 2.835141833571975, "grad_norm": 0.1757938414812088, "learning_rate": 5.498819271935474e-06, "loss": 0.4216, "mean_token_accuracy": 0.865375205874443, "num_tokens": 983474611.0, "step": 30815 }, { "entropy": 0.5481075886636972, "epoch": 2.835233839943416, "grad_norm": 0.16558592021465302, "learning_rate": 5.495752445793848e-06, "loss": 0.5406, "mean_token_accuracy": 0.8269090056419373, "num_tokens": 983506404.0, "step": 30816 }, { "entropy": 0.4304634225554764, "epoch": 2.8353258463148574, "grad_norm": 0.15343423187732697, "learning_rate": 5.492685619652222e-06, "loss": 0.4256, "mean_token_accuracy": 0.8654625490307808, "num_tokens": 983538381.0, "step": 30817 }, { "entropy": 0.5104298209771514, "epoch": 2.8354178526862985, "grad_norm": 0.1613747924566269, "learning_rate": 5.489618793510596e-06, "loss": 0.5046, "mean_token_accuracy": 0.8360678032040596, "num_tokens": 983570139.0, "step": 30818 }, { "entropy": 0.5624992307275534, "epoch": 2.8355098590577397, "grad_norm": 0.1656021922826767, "learning_rate": 5.48655196736897e-06, "loss": 0.5457, "mean_token_accuracy": 0.8245978988707066, "num_tokens": 983601981.0, "step": 30819 }, { "entropy": 0.4794329348951578, "epoch": 2.8356018654291812, "grad_norm": 0.15124276280403137, "learning_rate": 5.483485141227345e-06, "loss": 0.4717, "mean_token_accuracy": 0.8483744151890278, "num_tokens": 983634388.0, "step": 30820 }, { "entropy": 0.5022896807640791, "epoch": 2.835693871800622, "grad_norm": 0.15884463489055634, "learning_rate": 5.480418315085719e-06, "loss": 0.4976, "mean_token_accuracy": 0.8404826149344444, "num_tokens": 983666303.0, "step": 30821 }, { "entropy": 0.5057252375409007, "epoch": 2.8357858781720635, "grad_norm": 0.15863195061683655, "learning_rate": 5.477351488944092e-06, "loss": 0.5015, "mean_token_accuracy": 0.8388830795884132, "num_tokens": 983698720.0, "step": 30822 }, { "entropy": 0.557211431208998, "epoch": 2.8358778845435046, "grad_norm": 0.15912842750549316, "learning_rate": 5.474284662802466e-06, "loss": 0.5437, "mean_token_accuracy": 0.8294980525970459, "num_tokens": 983731360.0, "step": 30823 }, { "entropy": 0.6040778309106827, "epoch": 2.835969890914946, "grad_norm": 0.17241698503494263, "learning_rate": 5.47121783666084e-06, "loss": 0.59, "mean_token_accuracy": 0.8125056810677052, "num_tokens": 983763236.0, "step": 30824 }, { "entropy": 0.3882106754463166, "epoch": 2.8360618972863874, "grad_norm": 0.13855735957622528, "learning_rate": 5.468151010519214e-06, "loss": 0.3801, "mean_token_accuracy": 0.8772694654762745, "num_tokens": 983795804.0, "step": 30825 }, { "entropy": 0.4634431889280677, "epoch": 2.836153903657828, "grad_norm": 0.15315233170986176, "learning_rate": 5.465084184377588e-06, "loss": 0.4584, "mean_token_accuracy": 0.853467658162117, "num_tokens": 983827596.0, "step": 30826 }, { "entropy": 0.42409518733620644, "epoch": 2.8362459100292696, "grad_norm": 0.1391432136297226, "learning_rate": 5.462017358235961e-06, "loss": 0.4128, "mean_token_accuracy": 0.8681178018450737, "num_tokens": 983860070.0, "step": 30827 }, { "entropy": 0.5633469466120005, "epoch": 2.8363379164007108, "grad_norm": 0.15990519523620605, "learning_rate": 5.458950532094336e-06, "loss": 0.5374, "mean_token_accuracy": 0.8252794705331326, "num_tokens": 983891915.0, "step": 30828 }, { "entropy": 0.4976943600922823, "epoch": 2.836429922772152, "grad_norm": 0.15326306223869324, "learning_rate": 5.45588370595271e-06, "loss": 0.4834, "mean_token_accuracy": 0.84910948574543, "num_tokens": 983923919.0, "step": 30829 }, { "entropy": 0.46072495402768254, "epoch": 2.8365219291435935, "grad_norm": 0.15576298534870148, "learning_rate": 5.452816879811084e-06, "loss": 0.4517, "mean_token_accuracy": 0.8585781343281269, "num_tokens": 983955871.0, "step": 30830 }, { "entropy": 0.49939229153096676, "epoch": 2.836613935515034, "grad_norm": 0.15964554250240326, "learning_rate": 5.4497500536694574e-06, "loss": 0.4927, "mean_token_accuracy": 0.8454192914068699, "num_tokens": 983986992.0, "step": 30831 }, { "entropy": 0.3800981077365577, "epoch": 2.8367059418864757, "grad_norm": 0.137970432639122, "learning_rate": 5.446683227527831e-06, "loss": 0.3718, "mean_token_accuracy": 0.8810350149869919, "num_tokens": 984019614.0, "step": 30832 }, { "entropy": 0.534972257912159, "epoch": 2.836797948257917, "grad_norm": 0.1629253774881363, "learning_rate": 5.443616401386206e-06, "loss": 0.5143, "mean_token_accuracy": 0.8350354135036469, "num_tokens": 984051238.0, "step": 30833 }, { "entropy": 0.5459138974547386, "epoch": 2.836889954629358, "grad_norm": 0.17034128308296204, "learning_rate": 5.44054957524458e-06, "loss": 0.5363, "mean_token_accuracy": 0.8293285295367241, "num_tokens": 984082547.0, "step": 30834 }, { "entropy": 0.5584123432636261, "epoch": 2.8369819610007996, "grad_norm": 0.16808563470840454, "learning_rate": 5.4374827491029535e-06, "loss": 0.5558, "mean_token_accuracy": 0.824787862598896, "num_tokens": 984114018.0, "step": 30835 }, { "entropy": 0.4689779947511852, "epoch": 2.8370739673722403, "grad_norm": 0.1503787785768509, "learning_rate": 5.434415922961328e-06, "loss": 0.4575, "mean_token_accuracy": 0.8545525185763836, "num_tokens": 984145967.0, "step": 30836 }, { "entropy": 0.48147964011877775, "epoch": 2.837165973743682, "grad_norm": 0.15791285037994385, "learning_rate": 5.431349096819702e-06, "loss": 0.4778, "mean_token_accuracy": 0.8497544303536415, "num_tokens": 984177439.0, "step": 30837 }, { "entropy": 0.48829318629577756, "epoch": 2.837257980115123, "grad_norm": 0.15887834131717682, "learning_rate": 5.428282270678076e-06, "loss": 0.4871, "mean_token_accuracy": 0.8466715067625046, "num_tokens": 984209427.0, "step": 30838 }, { "entropy": 0.49491854361258447, "epoch": 2.837349986486564, "grad_norm": 0.1535016894340515, "learning_rate": 5.4252154445364495e-06, "loss": 0.4706, "mean_token_accuracy": 0.8489282205700874, "num_tokens": 984240960.0, "step": 30839 }, { "entropy": 0.5371818579733372, "epoch": 2.8374419928580057, "grad_norm": 0.1647314429283142, "learning_rate": 5.422148618394823e-06, "loss": 0.5176, "mean_token_accuracy": 0.8363812267780304, "num_tokens": 984272531.0, "step": 30840 }, { "entropy": 0.5293594840914011, "epoch": 2.8375339992294464, "grad_norm": 0.16063489019870758, "learning_rate": 5.419081792253197e-06, "loss": 0.5164, "mean_token_accuracy": 0.8418919444084167, "num_tokens": 984304957.0, "step": 30841 }, { "entropy": 0.4951758135575801, "epoch": 2.837626005600888, "grad_norm": 0.1538560837507248, "learning_rate": 5.416014966111571e-06, "loss": 0.479, "mean_token_accuracy": 0.847920186817646, "num_tokens": 984337206.0, "step": 30842 }, { "entropy": 0.5270031600957736, "epoch": 2.837718011972329, "grad_norm": 0.158014714717865, "learning_rate": 5.412948139969946e-06, "loss": 0.5089, "mean_token_accuracy": 0.8370269723236561, "num_tokens": 984368767.0, "step": 30843 }, { "entropy": 0.4940642435103655, "epoch": 2.8378100183437702, "grad_norm": 0.16319096088409424, "learning_rate": 5.409881313828319e-06, "loss": 0.4906, "mean_token_accuracy": 0.8397546410560608, "num_tokens": 984400375.0, "step": 30844 }, { "entropy": 0.46044142078608274, "epoch": 2.837902024715212, "grad_norm": 0.1514016091823578, "learning_rate": 5.406814487686693e-06, "loss": 0.439, "mean_token_accuracy": 0.8595194406807423, "num_tokens": 984431930.0, "step": 30845 }, { "entropy": 0.5612105466425419, "epoch": 2.8379940310866525, "grad_norm": 0.16407941281795502, "learning_rate": 5.403747661545067e-06, "loss": 0.5465, "mean_token_accuracy": 0.8267320692539215, "num_tokens": 984464224.0, "step": 30846 }, { "entropy": 0.5810034102760255, "epoch": 2.838086037458094, "grad_norm": 0.167433962225914, "learning_rate": 5.400680835403441e-06, "loss": 0.5575, "mean_token_accuracy": 0.8251894041895866, "num_tokens": 984496207.0, "step": 30847 }, { "entropy": 0.42753190733492374, "epoch": 2.838178043829535, "grad_norm": 0.14843961596488953, "learning_rate": 5.3976140092618154e-06, "loss": 0.4127, "mean_token_accuracy": 0.8655072003602982, "num_tokens": 984527511.0, "step": 30848 }, { "entropy": 0.5212423019111156, "epoch": 2.8382700502009763, "grad_norm": 0.16146595776081085, "learning_rate": 5.394547183120189e-06, "loss": 0.5017, "mean_token_accuracy": 0.8393901698291302, "num_tokens": 984558851.0, "step": 30849 }, { "entropy": 0.5399132360471413, "epoch": 2.838362056572418, "grad_norm": 0.1587369441986084, "learning_rate": 5.391480356978563e-06, "loss": 0.5284, "mean_token_accuracy": 0.8352274857461452, "num_tokens": 984591305.0, "step": 30850 }, { "entropy": 0.5359340030699968, "epoch": 2.8384540629438586, "grad_norm": 0.16005000472068787, "learning_rate": 5.388413530836938e-06, "loss": 0.5173, "mean_token_accuracy": 0.8351939804852009, "num_tokens": 984623528.0, "step": 30851 }, { "entropy": 0.527529438957572, "epoch": 2.8385460693153, "grad_norm": 0.16297169029712677, "learning_rate": 5.3853467046953115e-06, "loss": 0.5143, "mean_token_accuracy": 0.8373116739094257, "num_tokens": 984655293.0, "step": 30852 }, { "entropy": 0.5705566597171128, "epoch": 2.8386380756867413, "grad_norm": 0.15724313259124756, "learning_rate": 5.382279878553685e-06, "loss": 0.5606, "mean_token_accuracy": 0.8246529437601566, "num_tokens": 984687739.0, "step": 30853 }, { "entropy": 0.4970882300985977, "epoch": 2.8387300820581824, "grad_norm": 0.1491517722606659, "learning_rate": 5.379213052412059e-06, "loss": 0.4781, "mean_token_accuracy": 0.8475197814404964, "num_tokens": 984720248.0, "step": 30854 }, { "entropy": 0.4941301168873906, "epoch": 2.838822088429624, "grad_norm": 0.1604161411523819, "learning_rate": 5.376146226270433e-06, "loss": 0.4924, "mean_token_accuracy": 0.844475619494915, "num_tokens": 984752440.0, "step": 30855 }, { "entropy": 0.5075097922235727, "epoch": 2.8389140948010647, "grad_norm": 0.164576455950737, "learning_rate": 5.373079400128807e-06, "loss": 0.5022, "mean_token_accuracy": 0.8386057503521442, "num_tokens": 984784519.0, "step": 30856 }, { "entropy": 0.5314411390572786, "epoch": 2.8390061011725063, "grad_norm": 0.16011282801628113, "learning_rate": 5.3700125739871805e-06, "loss": 0.5175, "mean_token_accuracy": 0.8336268737912178, "num_tokens": 984816629.0, "step": 30857 }, { "entropy": 0.45366244832985103, "epoch": 2.8390981075439474, "grad_norm": 0.14830008149147034, "learning_rate": 5.366945747845555e-06, "loss": 0.4356, "mean_token_accuracy": 0.8624216578900814, "num_tokens": 984849103.0, "step": 30858 }, { "entropy": 0.4796434943564236, "epoch": 2.8391901139153886, "grad_norm": 0.1494174301624298, "learning_rate": 5.363878921703929e-06, "loss": 0.4627, "mean_token_accuracy": 0.8535391800105572, "num_tokens": 984881123.0, "step": 30859 }, { "entropy": 0.5433413553982973, "epoch": 2.83928212028683, "grad_norm": 0.16520258784294128, "learning_rate": 5.360812095562303e-06, "loss": 0.533, "mean_token_accuracy": 0.8298856355249882, "num_tokens": 984912743.0, "step": 30860 }, { "entropy": 0.4592350609600544, "epoch": 2.839374126658271, "grad_norm": 0.15304315090179443, "learning_rate": 5.3577452694206765e-06, "loss": 0.4489, "mean_token_accuracy": 0.856724925339222, "num_tokens": 984944623.0, "step": 30861 }, { "entropy": 0.6013162657618523, "epoch": 2.8394661330297124, "grad_norm": 0.17073333263397217, "learning_rate": 5.35467844327905e-06, "loss": 0.5803, "mean_token_accuracy": 0.8167915046215057, "num_tokens": 984976336.0, "step": 30862 }, { "entropy": 0.5308603877201676, "epoch": 2.8395581394011535, "grad_norm": 0.1597377061843872, "learning_rate": 5.351611617137425e-06, "loss": 0.5198, "mean_token_accuracy": 0.8363183736801147, "num_tokens": 985008017.0, "step": 30863 }, { "entropy": 0.47947958670556545, "epoch": 2.8396501457725947, "grad_norm": 0.15353946387767792, "learning_rate": 5.348544790995799e-06, "loss": 0.475, "mean_token_accuracy": 0.8483670055866241, "num_tokens": 985040095.0, "step": 30864 }, { "entropy": 0.4408190846443176, "epoch": 2.8397421521440362, "grad_norm": 0.15143945813179016, "learning_rate": 5.345477964854173e-06, "loss": 0.4324, "mean_token_accuracy": 0.8591712638735771, "num_tokens": 985072477.0, "step": 30865 }, { "entropy": 0.5290170609951019, "epoch": 2.839834158515477, "grad_norm": 0.1588984578847885, "learning_rate": 5.342411138712547e-06, "loss": 0.5291, "mean_token_accuracy": 0.833920031785965, "num_tokens": 985104703.0, "step": 30866 }, { "entropy": 0.43374165962450206, "epoch": 2.8399261648869185, "grad_norm": 0.14418205618858337, "learning_rate": 5.339344312570921e-06, "loss": 0.4155, "mean_token_accuracy": 0.8628778979182243, "num_tokens": 985136570.0, "step": 30867 }, { "entropy": 0.4934403607621789, "epoch": 2.8400181712583596, "grad_norm": 0.16149728000164032, "learning_rate": 5.336277486429295e-06, "loss": 0.478, "mean_token_accuracy": 0.8476103954017162, "num_tokens": 985167692.0, "step": 30868 }, { "entropy": 0.5222466886043549, "epoch": 2.840110177629801, "grad_norm": 0.1635347306728363, "learning_rate": 5.333210660287669e-06, "loss": 0.5206, "mean_token_accuracy": 0.8337588049471378, "num_tokens": 985199251.0, "step": 30869 }, { "entropy": 0.5570830339565873, "epoch": 2.8402021840012424, "grad_norm": 0.1663794070482254, "learning_rate": 5.3301438341460424e-06, "loss": 0.5532, "mean_token_accuracy": 0.8280361369252205, "num_tokens": 985230979.0, "step": 30870 }, { "entropy": 0.41675170324742794, "epoch": 2.840294190372683, "grad_norm": 0.1422896534204483, "learning_rate": 5.327077008004416e-06, "loss": 0.4034, "mean_token_accuracy": 0.8700130991637707, "num_tokens": 985263076.0, "step": 30871 }, { "entropy": 0.4790400620549917, "epoch": 2.8403861967441246, "grad_norm": 0.15478971600532532, "learning_rate": 5.32401018186279e-06, "loss": 0.4752, "mean_token_accuracy": 0.8490935042500496, "num_tokens": 985295819.0, "step": 30872 }, { "entropy": 0.4652027147822082, "epoch": 2.8404782031155658, "grad_norm": 0.14859072864055634, "learning_rate": 5.320943355721164e-06, "loss": 0.4475, "mean_token_accuracy": 0.8566161766648293, "num_tokens": 985327841.0, "step": 30873 }, { "entropy": 0.4955671103671193, "epoch": 2.840570209487007, "grad_norm": 0.1579618602991104, "learning_rate": 5.3178765295795385e-06, "loss": 0.4874, "mean_token_accuracy": 0.8436746075749397, "num_tokens": 985360215.0, "step": 30874 }, { "entropy": 0.3789389943704009, "epoch": 2.8406622158584485, "grad_norm": 0.1437903195619583, "learning_rate": 5.314809703437912e-06, "loss": 0.367, "mean_token_accuracy": 0.8805196173489094, "num_tokens": 985392552.0, "step": 30875 }, { "entropy": 0.4424340189434588, "epoch": 2.840754222229889, "grad_norm": 0.14925776422023773, "learning_rate": 5.311742877296286e-06, "loss": 0.4318, "mean_token_accuracy": 0.862743467092514, "num_tokens": 985425062.0, "step": 30876 }, { "entropy": 0.5175318804103881, "epoch": 2.8408462286013307, "grad_norm": 0.15535707771778107, "learning_rate": 5.30867605115466e-06, "loss": 0.5089, "mean_token_accuracy": 0.8397960364818573, "num_tokens": 985457830.0, "step": 30877 }, { "entropy": 0.49720079731196165, "epoch": 2.840938234972772, "grad_norm": 0.1578425168991089, "learning_rate": 5.3056092250130345e-06, "loss": 0.4887, "mean_token_accuracy": 0.8409937135875225, "num_tokens": 985489507.0, "step": 30878 }, { "entropy": 0.47129555616993457, "epoch": 2.841030241344213, "grad_norm": 0.15585801005363464, "learning_rate": 5.302542398871408e-06, "loss": 0.4617, "mean_token_accuracy": 0.8519791662693024, "num_tokens": 985521878.0, "step": 30879 }, { "entropy": 0.5054392227903008, "epoch": 2.8411222477156546, "grad_norm": 0.15958043932914734, "learning_rate": 5.299475572729782e-06, "loss": 0.4976, "mean_token_accuracy": 0.8411745801568031, "num_tokens": 985554006.0, "step": 30880 }, { "entropy": 0.46018961491063237, "epoch": 2.8412142540870953, "grad_norm": 0.15228869020938873, "learning_rate": 5.296408746588157e-06, "loss": 0.4494, "mean_token_accuracy": 0.8533428981900215, "num_tokens": 985586636.0, "step": 30881 }, { "entropy": 0.4683815920725465, "epoch": 2.841306260458537, "grad_norm": 0.15300822257995605, "learning_rate": 5.293341920446531e-06, "loss": 0.4571, "mean_token_accuracy": 0.8526016995310783, "num_tokens": 985618466.0, "step": 30882 }, { "entropy": 0.475822564214468, "epoch": 2.841398266829978, "grad_norm": 0.15564963221549988, "learning_rate": 5.290275094304904e-06, "loss": 0.4691, "mean_token_accuracy": 0.8523133657872677, "num_tokens": 985649599.0, "step": 30883 }, { "entropy": 0.4281503828242421, "epoch": 2.841490273201419, "grad_norm": 0.1476971060037613, "learning_rate": 5.287208268163278e-06, "loss": 0.41, "mean_token_accuracy": 0.8666361384093761, "num_tokens": 985681685.0, "step": 30884 }, { "entropy": 0.5234494532924145, "epoch": 2.8415822795728607, "grad_norm": 0.16155987977981567, "learning_rate": 5.284141442021652e-06, "loss": 0.5058, "mean_token_accuracy": 0.83685302734375, "num_tokens": 985713616.0, "step": 30885 }, { "entropy": 0.5307904845103621, "epoch": 2.8416742859443014, "grad_norm": 0.1602986752986908, "learning_rate": 5.281074615880026e-06, "loss": 0.5078, "mean_token_accuracy": 0.8379770070314407, "num_tokens": 985745375.0, "step": 30886 }, { "entropy": 0.5739568546414375, "epoch": 2.841766292315743, "grad_norm": 0.16715571284294128, "learning_rate": 5.2780077897384e-06, "loss": 0.5594, "mean_token_accuracy": 0.8215081468224525, "num_tokens": 985777385.0, "step": 30887 }, { "entropy": 0.5530880724545568, "epoch": 2.841858298687184, "grad_norm": 0.16279549896717072, "learning_rate": 5.274940963596773e-06, "loss": 0.5417, "mean_token_accuracy": 0.8283645361661911, "num_tokens": 985808973.0, "step": 30888 }, { "entropy": 0.4878236148506403, "epoch": 2.8419503050586252, "grad_norm": 0.15519340336322784, "learning_rate": 5.271874137455148e-06, "loss": 0.4858, "mean_token_accuracy": 0.847225695848465, "num_tokens": 985841385.0, "step": 30889 }, { "entropy": 0.4705556258559227, "epoch": 2.842042311430067, "grad_norm": 0.15141384303569794, "learning_rate": 5.268807311313522e-06, "loss": 0.4653, "mean_token_accuracy": 0.8534190505743027, "num_tokens": 985873994.0, "step": 30890 }, { "entropy": 0.49640288669615984, "epoch": 2.8421343178015075, "grad_norm": 0.15788842737674713, "learning_rate": 5.265740485171896e-06, "loss": 0.4917, "mean_token_accuracy": 0.843115258961916, "num_tokens": 985906428.0, "step": 30891 }, { "entropy": 0.5168431680649519, "epoch": 2.842226324172949, "grad_norm": 0.16373948752880096, "learning_rate": 5.2626736590302694e-06, "loss": 0.5009, "mean_token_accuracy": 0.8369100615382195, "num_tokens": 985937461.0, "step": 30892 }, { "entropy": 0.48473438527435064, "epoch": 2.84231833054439, "grad_norm": 0.1585601568222046, "learning_rate": 5.259606832888644e-06, "loss": 0.4771, "mean_token_accuracy": 0.8513865992426872, "num_tokens": 985969735.0, "step": 30893 }, { "entropy": 0.4906923243543133, "epoch": 2.8424103369158313, "grad_norm": 0.15813089907169342, "learning_rate": 5.256540006747018e-06, "loss": 0.482, "mean_token_accuracy": 0.8468774147331715, "num_tokens": 986001238.0, "step": 30894 }, { "entropy": 0.5434903912246227, "epoch": 2.842502343287273, "grad_norm": 0.16837534308433533, "learning_rate": 5.253473180605392e-06, "loss": 0.5208, "mean_token_accuracy": 0.8322231359779835, "num_tokens": 986032111.0, "step": 30895 }, { "entropy": 0.49585324991494417, "epoch": 2.8425943496587136, "grad_norm": 0.15829573571681976, "learning_rate": 5.2504063544637655e-06, "loss": 0.4862, "mean_token_accuracy": 0.8474205620586872, "num_tokens": 986064866.0, "step": 30896 }, { "entropy": 0.4420115730026737, "epoch": 2.842686356030155, "grad_norm": 0.14652545750141144, "learning_rate": 5.24733952832214e-06, "loss": 0.431, "mean_token_accuracy": 0.8621942959725857, "num_tokens": 986096833.0, "step": 30897 }, { "entropy": 0.5189852137118578, "epoch": 2.8427783624015963, "grad_norm": 0.1617887169122696, "learning_rate": 5.244272702180514e-06, "loss": 0.5131, "mean_token_accuracy": 0.836378138512373, "num_tokens": 986129523.0, "step": 30898 }, { "entropy": 0.3598820809274912, "epoch": 2.8428703687730374, "grad_norm": 0.13089272379875183, "learning_rate": 5.241205876038888e-06, "loss": 0.3476, "mean_token_accuracy": 0.8878457099199295, "num_tokens": 986161940.0, "step": 30899 }, { "entropy": 0.5555359926074743, "epoch": 2.842962375144479, "grad_norm": 0.16475778818130493, "learning_rate": 5.2381390498972615e-06, "loss": 0.5414, "mean_token_accuracy": 0.8293236494064331, "num_tokens": 986194508.0, "step": 30900 }, { "entropy": 0.5294822948053479, "epoch": 2.8430543815159197, "grad_norm": 0.1601799577474594, "learning_rate": 5.235072223755635e-06, "loss": 0.5288, "mean_token_accuracy": 0.8348379842936993, "num_tokens": 986226420.0, "step": 30901 }, { "entropy": 0.5299427639693022, "epoch": 2.8431463878873613, "grad_norm": 0.1584051549434662, "learning_rate": 5.232005397614009e-06, "loss": 0.5147, "mean_token_accuracy": 0.8383761830627918, "num_tokens": 986258011.0, "step": 30902 }, { "entropy": 0.4870434086769819, "epoch": 2.8432383942588024, "grad_norm": 0.16269761323928833, "learning_rate": 5.228938571472383e-06, "loss": 0.4726, "mean_token_accuracy": 0.8482878804206848, "num_tokens": 986289692.0, "step": 30903 }, { "entropy": 0.49538907315582037, "epoch": 2.8433304006302436, "grad_norm": 0.1512833684682846, "learning_rate": 5.225871745330758e-06, "loss": 0.4791, "mean_token_accuracy": 0.8473032638430595, "num_tokens": 986321732.0, "step": 30904 }, { "entropy": 0.5336834050249308, "epoch": 2.843422407001685, "grad_norm": 0.16373132169246674, "learning_rate": 5.222804919189131e-06, "loss": 0.5296, "mean_token_accuracy": 0.8323710970580578, "num_tokens": 986352878.0, "step": 30905 }, { "entropy": 0.5076505020260811, "epoch": 2.843514413373126, "grad_norm": 0.15562652051448822, "learning_rate": 5.219738093047505e-06, "loss": 0.4937, "mean_token_accuracy": 0.8458886742591858, "num_tokens": 986384613.0, "step": 30906 }, { "entropy": 0.5148686291649938, "epoch": 2.8436064197445674, "grad_norm": 0.16533437371253967, "learning_rate": 5.216671266905879e-06, "loss": 0.5088, "mean_token_accuracy": 0.8387455157935619, "num_tokens": 986416581.0, "step": 30907 }, { "entropy": 0.5498736230656505, "epoch": 2.8436984261160085, "grad_norm": 0.16610053181648254, "learning_rate": 5.213604440764254e-06, "loss": 0.5451, "mean_token_accuracy": 0.828874833881855, "num_tokens": 986448338.0, "step": 30908 }, { "entropy": 0.5550685534253716, "epoch": 2.8437904324874497, "grad_norm": 0.16254404187202454, "learning_rate": 5.2105376146226274e-06, "loss": 0.5451, "mean_token_accuracy": 0.8274310231208801, "num_tokens": 986480732.0, "step": 30909 }, { "entropy": 0.4777596453204751, "epoch": 2.8438824388588912, "grad_norm": 0.152607724070549, "learning_rate": 5.207470788481001e-06, "loss": 0.4683, "mean_token_accuracy": 0.8494230695068836, "num_tokens": 986512912.0, "step": 30910 }, { "entropy": 0.5303374119102955, "epoch": 2.843974445230332, "grad_norm": 0.15608102083206177, "learning_rate": 5.204403962339375e-06, "loss": 0.5228, "mean_token_accuracy": 0.8348559774458408, "num_tokens": 986545092.0, "step": 30911 }, { "entropy": 0.418519401922822, "epoch": 2.8440664516017735, "grad_norm": 0.14442569017410278, "learning_rate": 5.20133713619775e-06, "loss": 0.406, "mean_token_accuracy": 0.8695583194494247, "num_tokens": 986577108.0, "step": 30912 }, { "entropy": 0.5478366203606129, "epoch": 2.8441584579732146, "grad_norm": 0.16322208940982819, "learning_rate": 5.1982703100561235e-06, "loss": 0.5327, "mean_token_accuracy": 0.8307689689099789, "num_tokens": 986608352.0, "step": 30913 }, { "entropy": 0.4998806118965149, "epoch": 2.844250464344656, "grad_norm": 0.1552649289369583, "learning_rate": 5.195203483914497e-06, "loss": 0.4845, "mean_token_accuracy": 0.842898715287447, "num_tokens": 986640069.0, "step": 30914 }, { "entropy": 0.5605117594823241, "epoch": 2.8443424707160974, "grad_norm": 0.1633223444223404, "learning_rate": 5.192136657772871e-06, "loss": 0.5455, "mean_token_accuracy": 0.8252279572188854, "num_tokens": 986672421.0, "step": 30915 }, { "entropy": 0.3671462256461382, "epoch": 2.844434477087538, "grad_norm": 0.14037632942199707, "learning_rate": 5.189069831631245e-06, "loss": 0.3574, "mean_token_accuracy": 0.8840219713747501, "num_tokens": 986704556.0, "step": 30916 }, { "entropy": 0.45863037556409836, "epoch": 2.8445264834589796, "grad_norm": 0.1446625292301178, "learning_rate": 5.186003005489619e-06, "loss": 0.4368, "mean_token_accuracy": 0.8565450720489025, "num_tokens": 986736083.0, "step": 30917 }, { "entropy": 0.4322343006497249, "epoch": 2.8446184898304208, "grad_norm": 0.14237858355045319, "learning_rate": 5.1829361793479925e-06, "loss": 0.4094, "mean_token_accuracy": 0.8683502189815044, "num_tokens": 986768636.0, "step": 30918 }, { "entropy": 0.49322031904011965, "epoch": 2.844710496201862, "grad_norm": 0.15391692519187927, "learning_rate": 5.179869353206367e-06, "loss": 0.4687, "mean_token_accuracy": 0.8538631796836853, "num_tokens": 986800129.0, "step": 30919 }, { "entropy": 0.6043797917664051, "epoch": 2.8448025025733035, "grad_norm": 0.17508727312088013, "learning_rate": 5.176802527064741e-06, "loss": 0.5975, "mean_token_accuracy": 0.8155517242848873, "num_tokens": 986831516.0, "step": 30920 }, { "entropy": 0.5689660022035241, "epoch": 2.844894508944744, "grad_norm": 0.15918119251728058, "learning_rate": 5.173735700923115e-06, "loss": 0.5526, "mean_token_accuracy": 0.8272027857601643, "num_tokens": 986863867.0, "step": 30921 }, { "entropy": 0.49544854555279016, "epoch": 2.8449865153161857, "grad_norm": 0.1521468311548233, "learning_rate": 5.1706688747814885e-06, "loss": 0.483, "mean_token_accuracy": 0.8484451174736023, "num_tokens": 986896489.0, "step": 30922 }, { "entropy": 0.43608041014522314, "epoch": 2.845078521687627, "grad_norm": 0.14520937204360962, "learning_rate": 5.167602048639863e-06, "loss": 0.4274, "mean_token_accuracy": 0.8659699819982052, "num_tokens": 986928775.0, "step": 30923 }, { "entropy": 0.5859024822711945, "epoch": 2.845170528059068, "grad_norm": 0.1691850870847702, "learning_rate": 5.164535222498237e-06, "loss": 0.5759, "mean_token_accuracy": 0.8203875757753849, "num_tokens": 986961177.0, "step": 30924 }, { "entropy": 0.5790256522595882, "epoch": 2.8452625344305096, "grad_norm": 0.1717074066400528, "learning_rate": 5.161468396356611e-06, "loss": 0.57, "mean_token_accuracy": 0.825512308627367, "num_tokens": 986992468.0, "step": 30925 }, { "entropy": 0.5047995245549828, "epoch": 2.8453545408019503, "grad_norm": 0.15309076011180878, "learning_rate": 5.158401570214985e-06, "loss": 0.4831, "mean_token_accuracy": 0.8499044515192509, "num_tokens": 987023992.0, "step": 30926 }, { "entropy": 0.5357163043227047, "epoch": 2.845446547173392, "grad_norm": 0.16288264095783234, "learning_rate": 5.155334744073359e-06, "loss": 0.5249, "mean_token_accuracy": 0.8346902057528496, "num_tokens": 987056108.0, "step": 30927 }, { "entropy": 0.4718465209007263, "epoch": 2.845538553544833, "grad_norm": 0.15146972239017487, "learning_rate": 5.152267917931733e-06, "loss": 0.4685, "mean_token_accuracy": 0.8510568290948868, "num_tokens": 987087937.0, "step": 30928 }, { "entropy": 0.5852206218987703, "epoch": 2.845630559916274, "grad_norm": 0.1632966846227646, "learning_rate": 5.149201091790107e-06, "loss": 0.5765, "mean_token_accuracy": 0.8181763477623463, "num_tokens": 987119482.0, "step": 30929 }, { "entropy": 0.4988195765763521, "epoch": 2.8457225662877157, "grad_norm": 0.15552230179309845, "learning_rate": 5.146134265648481e-06, "loss": 0.4875, "mean_token_accuracy": 0.8453903719782829, "num_tokens": 987151896.0, "step": 30930 }, { "entropy": 0.5835787113755941, "epoch": 2.8458145726591564, "grad_norm": 0.1694699078798294, "learning_rate": 5.1430674395068544e-06, "loss": 0.5707, "mean_token_accuracy": 0.8210051394999027, "num_tokens": 987182791.0, "step": 30931 }, { "entropy": 0.6017418252304196, "epoch": 2.845906579030598, "grad_norm": 0.16753119230270386, "learning_rate": 5.140000613365228e-06, "loss": 0.5903, "mean_token_accuracy": 0.8125535808503628, "num_tokens": 987214994.0, "step": 30932 }, { "entropy": 0.5366645725443959, "epoch": 2.845998585402039, "grad_norm": 0.1604587435722351, "learning_rate": 5.136933787223602e-06, "loss": 0.5168, "mean_token_accuracy": 0.8338412158191204, "num_tokens": 987247184.0, "step": 30933 }, { "entropy": 0.5451708417385817, "epoch": 2.8460905917734802, "grad_norm": 0.15881657600402832, "learning_rate": 5.133866961081976e-06, "loss": 0.5347, "mean_token_accuracy": 0.829517800360918, "num_tokens": 987278827.0, "step": 30934 }, { "entropy": 0.5620360802859068, "epoch": 2.846182598144922, "grad_norm": 0.16636639833450317, "learning_rate": 5.1308001349403505e-06, "loss": 0.5529, "mean_token_accuracy": 0.8254901245236397, "num_tokens": 987310035.0, "step": 30935 }, { "entropy": 0.5448927078396082, "epoch": 2.8462746045163625, "grad_norm": 0.16362300515174866, "learning_rate": 5.127733308798724e-06, "loss": 0.5433, "mean_token_accuracy": 0.8271367363631725, "num_tokens": 987342059.0, "step": 30936 }, { "entropy": 0.5151621089316905, "epoch": 2.846366610887804, "grad_norm": 0.15852448344230652, "learning_rate": 5.124666482657098e-06, "loss": 0.5053, "mean_token_accuracy": 0.8430433496832848, "num_tokens": 987373748.0, "step": 30937 }, { "entropy": 0.5332212708890438, "epoch": 2.846458617259245, "grad_norm": 0.16177698969841003, "learning_rate": 5.121599656515473e-06, "loss": 0.5166, "mean_token_accuracy": 0.8350173644721508, "num_tokens": 987405437.0, "step": 30938 }, { "entropy": 0.5447258832864463, "epoch": 2.8465506236306863, "grad_norm": 0.15943299233913422, "learning_rate": 5.1185328303738465e-06, "loss": 0.5257, "mean_token_accuracy": 0.8329392112791538, "num_tokens": 987437512.0, "step": 30939 }, { "entropy": 0.47161909751594067, "epoch": 2.846642630002128, "grad_norm": 0.146324023604393, "learning_rate": 5.11546600423222e-06, "loss": 0.4593, "mean_token_accuracy": 0.8541536256670952, "num_tokens": 987469559.0, "step": 30940 }, { "entropy": 0.5182045237161219, "epoch": 2.8467346363735686, "grad_norm": 0.16193273663520813, "learning_rate": 5.112399178090594e-06, "loss": 0.5113, "mean_token_accuracy": 0.8382688499987125, "num_tokens": 987501241.0, "step": 30941 }, { "entropy": 0.5425730175338686, "epoch": 2.84682664274501, "grad_norm": 0.16503208875656128, "learning_rate": 5.109332351948969e-06, "loss": 0.5327, "mean_token_accuracy": 0.8332066163420677, "num_tokens": 987532666.0, "step": 30942 }, { "entropy": 0.4345288500189781, "epoch": 2.8469186491164513, "grad_norm": 0.15165652334690094, "learning_rate": 5.106265525807343e-06, "loss": 0.4325, "mean_token_accuracy": 0.8638653680682182, "num_tokens": 987564174.0, "step": 30943 }, { "entropy": 0.4642467638477683, "epoch": 2.8470106554878924, "grad_norm": 0.1521826535463333, "learning_rate": 5.103198699665716e-06, "loss": 0.4474, "mean_token_accuracy": 0.8550541624426842, "num_tokens": 987595953.0, "step": 30944 }, { "entropy": 0.44902859162539244, "epoch": 2.847102661859334, "grad_norm": 0.14838410913944244, "learning_rate": 5.10013187352409e-06, "loss": 0.4252, "mean_token_accuracy": 0.858080729842186, "num_tokens": 987628017.0, "step": 30945 }, { "entropy": 0.4555679988116026, "epoch": 2.8471946682307747, "grad_norm": 0.1471869796514511, "learning_rate": 5.097065047382464e-06, "loss": 0.4289, "mean_token_accuracy": 0.8645266890525818, "num_tokens": 987659796.0, "step": 30946 }, { "entropy": 0.47185801167506725, "epoch": 2.8472866746022163, "grad_norm": 0.15087087452411652, "learning_rate": 5.093998221240838e-06, "loss": 0.4614, "mean_token_accuracy": 0.8550442755222321, "num_tokens": 987691228.0, "step": 30947 }, { "entropy": 0.5119786942377687, "epoch": 2.8473786809736574, "grad_norm": 0.15457601845264435, "learning_rate": 5.090931395099212e-06, "loss": 0.5043, "mean_token_accuracy": 0.8430260121822357, "num_tokens": 987723184.0, "step": 30948 }, { "entropy": 0.555682064499706, "epoch": 2.8474706873450986, "grad_norm": 0.16228033602237701, "learning_rate": 5.087864568957585e-06, "loss": 0.5457, "mean_token_accuracy": 0.8324959874153137, "num_tokens": 987755352.0, "step": 30949 }, { "entropy": 0.4850449487566948, "epoch": 2.84756269371654, "grad_norm": 0.15572834014892578, "learning_rate": 5.08479774281596e-06, "loss": 0.4746, "mean_token_accuracy": 0.8506049290299416, "num_tokens": 987787563.0, "step": 30950 }, { "entropy": 0.49568894726689905, "epoch": 2.847654700087981, "grad_norm": 0.1580287665128708, "learning_rate": 5.081730916674334e-06, "loss": 0.4866, "mean_token_accuracy": 0.8468748964369297, "num_tokens": 987819122.0, "step": 30951 }, { "entropy": 0.4447654103860259, "epoch": 2.8477467064594224, "grad_norm": 0.14885559678077698, "learning_rate": 5.078664090532708e-06, "loss": 0.4356, "mean_token_accuracy": 0.8592921048402786, "num_tokens": 987851684.0, "step": 30952 }, { "entropy": 0.49678147956728935, "epoch": 2.8478387128308635, "grad_norm": 0.1541690230369568, "learning_rate": 5.075597264391082e-06, "loss": 0.4832, "mean_token_accuracy": 0.8468656986951828, "num_tokens": 987884289.0, "step": 30953 }, { "entropy": 0.590606851503253, "epoch": 2.8479307192023047, "grad_norm": 0.1719757616519928, "learning_rate": 5.072530438249456e-06, "loss": 0.5811, "mean_token_accuracy": 0.818294957280159, "num_tokens": 987916240.0, "step": 30954 }, { "entropy": 0.5339004555717111, "epoch": 2.8480227255737462, "grad_norm": 0.1610279530286789, "learning_rate": 5.06946361210783e-06, "loss": 0.5258, "mean_token_accuracy": 0.8295700736343861, "num_tokens": 987947907.0, "step": 30955 }, { "entropy": 0.40451743081212044, "epoch": 2.848114731945187, "grad_norm": 0.13980720937252045, "learning_rate": 5.066396785966204e-06, "loss": 0.396, "mean_token_accuracy": 0.8732596524059772, "num_tokens": 987980675.0, "step": 30956 }, { "entropy": 0.46836667507886887, "epoch": 2.8482067383166285, "grad_norm": 0.15199804306030273, "learning_rate": 5.0633299598245775e-06, "loss": 0.4526, "mean_token_accuracy": 0.8558648712933064, "num_tokens": 988012120.0, "step": 30957 }, { "entropy": 0.5636201724410057, "epoch": 2.8482987446880697, "grad_norm": 0.16473819315433502, "learning_rate": 5.060263133682952e-06, "loss": 0.5623, "mean_token_accuracy": 0.8230922780930996, "num_tokens": 988043646.0, "step": 30958 }, { "entropy": 0.5025576129555702, "epoch": 2.848390751059511, "grad_norm": 0.15208904445171356, "learning_rate": 5.057196307541326e-06, "loss": 0.4875, "mean_token_accuracy": 0.8409582041203976, "num_tokens": 988075628.0, "step": 30959 }, { "entropy": 0.5817444082349539, "epoch": 2.8484827574309524, "grad_norm": 0.16693459451198578, "learning_rate": 5.0541294813997e-06, "loss": 0.5679, "mean_token_accuracy": 0.8183943592011929, "num_tokens": 988107135.0, "step": 30960 }, { "entropy": 0.5069543402642012, "epoch": 2.848574763802393, "grad_norm": 0.1566770374774933, "learning_rate": 5.0510626552580735e-06, "loss": 0.4837, "mean_token_accuracy": 0.8444923497736454, "num_tokens": 988138876.0, "step": 30961 }, { "entropy": 0.5277909748256207, "epoch": 2.8486667701738346, "grad_norm": 0.15918530523777008, "learning_rate": 5.047995829116447e-06, "loss": 0.5061, "mean_token_accuracy": 0.8349845036864281, "num_tokens": 988170867.0, "step": 30962 }, { "entropy": 0.4899155432358384, "epoch": 2.8487587765452758, "grad_norm": 0.15858207643032074, "learning_rate": 5.044929002974821e-06, "loss": 0.4801, "mean_token_accuracy": 0.8491893857717514, "num_tokens": 988202572.0, "step": 30963 }, { "entropy": 0.49879045132547617, "epoch": 2.848850782916717, "grad_norm": 0.16158771514892578, "learning_rate": 5.041862176833195e-06, "loss": 0.4939, "mean_token_accuracy": 0.845827229321003, "num_tokens": 988234632.0, "step": 30964 }, { "entropy": 0.48824515054002404, "epoch": 2.8489427892881585, "grad_norm": 0.16657011210918427, "learning_rate": 5.03879535069157e-06, "loss": 0.4853, "mean_token_accuracy": 0.8425556682050228, "num_tokens": 988265719.0, "step": 30965 }, { "entropy": 0.5493351863697171, "epoch": 2.849034795659599, "grad_norm": 0.15933960676193237, "learning_rate": 5.035728524549943e-06, "loss": 0.5384, "mean_token_accuracy": 0.8306088484823704, "num_tokens": 988298122.0, "step": 30966 }, { "entropy": 0.48818809166550636, "epoch": 2.8491268020310407, "grad_norm": 0.1564672589302063, "learning_rate": 5.032661698408317e-06, "loss": 0.4915, "mean_token_accuracy": 0.8440530970692635, "num_tokens": 988330430.0, "step": 30967 }, { "entropy": 0.42426119931042194, "epoch": 2.849218808402482, "grad_norm": 0.14728973805904388, "learning_rate": 5.029594872266692e-06, "loss": 0.4142, "mean_token_accuracy": 0.8686725236475468, "num_tokens": 988362607.0, "step": 30968 }, { "entropy": 0.6076685329899192, "epoch": 2.849310814773923, "grad_norm": 0.16505587100982666, "learning_rate": 5.026528046125066e-06, "loss": 0.5937, "mean_token_accuracy": 0.8123616315424442, "num_tokens": 988393799.0, "step": 30969 }, { "entropy": 0.5727687645703554, "epoch": 2.8494028211453646, "grad_norm": 0.16834169626235962, "learning_rate": 5.0234612199834394e-06, "loss": 0.5694, "mean_token_accuracy": 0.8192884735763073, "num_tokens": 988425609.0, "step": 30970 }, { "entropy": 0.4965915381908417, "epoch": 2.8494948275168053, "grad_norm": 0.1580386608839035, "learning_rate": 5.020394393841813e-06, "loss": 0.4892, "mean_token_accuracy": 0.8463782332837582, "num_tokens": 988456860.0, "step": 30971 }, { "entropy": 0.4282669806852937, "epoch": 2.849586833888247, "grad_norm": 0.14606338739395142, "learning_rate": 5.017327567700187e-06, "loss": 0.4223, "mean_token_accuracy": 0.8611077778041363, "num_tokens": 988489426.0, "step": 30972 }, { "entropy": 0.41844259668141603, "epoch": 2.849678840259688, "grad_norm": 0.15240681171417236, "learning_rate": 5.014260741558562e-06, "loss": 0.4156, "mean_token_accuracy": 0.8686834275722504, "num_tokens": 988520977.0, "step": 30973 }, { "entropy": 0.44983058515936136, "epoch": 2.849770846631129, "grad_norm": 0.1518130600452423, "learning_rate": 5.0111939154169355e-06, "loss": 0.4425, "mean_token_accuracy": 0.8563351817429066, "num_tokens": 988552509.0, "step": 30974 }, { "entropy": 0.5058556734584272, "epoch": 2.8498628530025707, "grad_norm": 0.15145958960056305, "learning_rate": 5.008127089275309e-06, "loss": 0.4925, "mean_token_accuracy": 0.8445240743458271, "num_tokens": 988584772.0, "step": 30975 }, { "entropy": 0.4838848179206252, "epoch": 2.8499548593740114, "grad_norm": 0.15281254053115845, "learning_rate": 5.005060263133683e-06, "loss": 0.4662, "mean_token_accuracy": 0.8526947759091854, "num_tokens": 988616796.0, "step": 30976 }, { "entropy": 0.5094943647272885, "epoch": 2.850046865745453, "grad_norm": 0.15584596991539001, "learning_rate": 5.001993436992057e-06, "loss": 0.505, "mean_token_accuracy": 0.8395688496530056, "num_tokens": 988648724.0, "step": 30977 }, { "entropy": 0.516405462520197, "epoch": 2.850138872116894, "grad_norm": 0.15906773507595062, "learning_rate": 4.998926610850431e-06, "loss": 0.5149, "mean_token_accuracy": 0.8400152772665024, "num_tokens": 988680021.0, "step": 30978 }, { "entropy": 0.44866085052490234, "epoch": 2.8502308784883352, "grad_norm": 0.15027713775634766, "learning_rate": 4.9958597847088045e-06, "loss": 0.424, "mean_token_accuracy": 0.8598613999783993, "num_tokens": 988711407.0, "step": 30979 }, { "entropy": 0.4459956674836576, "epoch": 2.850322884859777, "grad_norm": 0.14503946900367737, "learning_rate": 4.992792958567179e-06, "loss": 0.438, "mean_token_accuracy": 0.8609614074230194, "num_tokens": 988744009.0, "step": 30980 }, { "entropy": 0.5184634160250425, "epoch": 2.8504148912312175, "grad_norm": 0.1629553735256195, "learning_rate": 4.989726132425553e-06, "loss": 0.5128, "mean_token_accuracy": 0.8374007977545261, "num_tokens": 988776109.0, "step": 30981 }, { "entropy": 0.4347132823895663, "epoch": 2.850506897602659, "grad_norm": 0.1492612361907959, "learning_rate": 4.986659306283928e-06, "loss": 0.4275, "mean_token_accuracy": 0.8636230900883675, "num_tokens": 988808820.0, "step": 30982 }, { "entropy": 0.4928192272782326, "epoch": 2.8505989039741, "grad_norm": 0.15638679265975952, "learning_rate": 4.983592480142301e-06, "loss": 0.4753, "mean_token_accuracy": 0.8473424054682255, "num_tokens": 988840248.0, "step": 30983 }, { "entropy": 0.564812446013093, "epoch": 2.8506909103455413, "grad_norm": 0.1661076694726944, "learning_rate": 4.980525654000675e-06, "loss": 0.5584, "mean_token_accuracy": 0.8257232010364532, "num_tokens": 988872248.0, "step": 30984 }, { "entropy": 0.542037351988256, "epoch": 2.850782916716983, "grad_norm": 0.16199475526809692, "learning_rate": 4.977458827859049e-06, "loss": 0.533, "mean_token_accuracy": 0.8304618746042252, "num_tokens": 988903989.0, "step": 30985 }, { "entropy": 0.7007123343646526, "epoch": 2.8508749230884236, "grad_norm": 0.18664203584194183, "learning_rate": 4.974392001717423e-06, "loss": 0.7075, "mean_token_accuracy": 0.7781974896788597, "num_tokens": 988935964.0, "step": 30986 }, { "entropy": 0.5133791503030807, "epoch": 2.850966929459865, "grad_norm": 0.15529251098632812, "learning_rate": 4.971325175575797e-06, "loss": 0.4818, "mean_token_accuracy": 0.8447114452719688, "num_tokens": 988966961.0, "step": 30987 }, { "entropy": 0.48227667063474655, "epoch": 2.8510589358313063, "grad_norm": 0.15338031947612762, "learning_rate": 4.968258349434171e-06, "loss": 0.4664, "mean_token_accuracy": 0.849270187318325, "num_tokens": 988999270.0, "step": 30988 }, { "entropy": 0.44166705664247274, "epoch": 2.8511509422027475, "grad_norm": 0.1461368352174759, "learning_rate": 4.965191523292545e-06, "loss": 0.4257, "mean_token_accuracy": 0.8642513677477837, "num_tokens": 989031324.0, "step": 30989 }, { "entropy": 0.5405570198781788, "epoch": 2.851242948574189, "grad_norm": 0.16022464632987976, "learning_rate": 4.962124697150919e-06, "loss": 0.5319, "mean_token_accuracy": 0.8302718214690685, "num_tokens": 989063957.0, "step": 30990 }, { "entropy": 0.5208493387326598, "epoch": 2.8513349549456297, "grad_norm": 0.15868328511714935, "learning_rate": 4.959057871009293e-06, "loss": 0.5149, "mean_token_accuracy": 0.8352275602519512, "num_tokens": 989096151.0, "step": 30991 }, { "entropy": 0.4704625648446381, "epoch": 2.8514269613170713, "grad_norm": 0.15079152584075928, "learning_rate": 4.9559910448676664e-06, "loss": 0.4572, "mean_token_accuracy": 0.8557249791920185, "num_tokens": 989128419.0, "step": 30992 }, { "entropy": 0.48116118647158146, "epoch": 2.8515189676885124, "grad_norm": 0.1550997644662857, "learning_rate": 4.95292421872604e-06, "loss": 0.4704, "mean_token_accuracy": 0.8506804816424847, "num_tokens": 989160611.0, "step": 30993 }, { "entropy": 0.5284871580079198, "epoch": 2.8516109740599536, "grad_norm": 0.16408339142799377, "learning_rate": 4.949857392584414e-06, "loss": 0.5256, "mean_token_accuracy": 0.8342362232506275, "num_tokens": 989192188.0, "step": 30994 }, { "entropy": 0.5326850857818499, "epoch": 2.851702980431395, "grad_norm": 0.15678586065769196, "learning_rate": 4.946790566442789e-06, "loss": 0.534, "mean_token_accuracy": 0.8343392834067345, "num_tokens": 989224744.0, "step": 30995 }, { "entropy": 0.5608168123289943, "epoch": 2.851794986802836, "grad_norm": 0.16908927261829376, "learning_rate": 4.9437237403011625e-06, "loss": 0.5578, "mean_token_accuracy": 0.8277950137853622, "num_tokens": 989256373.0, "step": 30996 }, { "entropy": 0.4758100116159767, "epoch": 2.8518869931742774, "grad_norm": 0.15511730313301086, "learning_rate": 4.940656914159537e-06, "loss": 0.4597, "mean_token_accuracy": 0.8566987477242947, "num_tokens": 989288219.0, "step": 30997 }, { "entropy": 0.5371631495654583, "epoch": 2.8519789995457185, "grad_norm": 0.16640642285346985, "learning_rate": 4.937590088017911e-06, "loss": 0.5261, "mean_token_accuracy": 0.8319735303521156, "num_tokens": 989320623.0, "step": 30998 }, { "entropy": 0.5837738886475563, "epoch": 2.8520710059171597, "grad_norm": 0.1705716848373413, "learning_rate": 4.934523261876285e-06, "loss": 0.5787, "mean_token_accuracy": 0.8154936023056507, "num_tokens": 989351927.0, "step": 30999 }, { "entropy": 0.5337894465774298, "epoch": 2.8521630122886013, "grad_norm": 0.1649247258901596, "learning_rate": 4.9314564357346585e-06, "loss": 0.5265, "mean_token_accuracy": 0.8330414034426212, "num_tokens": 989383573.0, "step": 31000 }, { "entropy": 0.47054633870720863, "epoch": 2.852255018660042, "grad_norm": 0.1527155339717865, "learning_rate": 4.928389609593032e-06, "loss": 0.4471, "mean_token_accuracy": 0.8545568659901619, "num_tokens": 989415890.0, "step": 31001 }, { "entropy": 0.4349274127744138, "epoch": 2.8523470250314835, "grad_norm": 0.1423732489347458, "learning_rate": 4.925322783451406e-06, "loss": 0.429, "mean_token_accuracy": 0.8642898686230183, "num_tokens": 989448473.0, "step": 31002 }, { "entropy": 0.49536374385934323, "epoch": 2.8524390314029247, "grad_norm": 0.1519639641046524, "learning_rate": 4.922255957309781e-06, "loss": 0.4768, "mean_token_accuracy": 0.8498359359800816, "num_tokens": 989480949.0, "step": 31003 }, { "entropy": 0.5244959879200906, "epoch": 2.852531037774366, "grad_norm": 0.15993647277355194, "learning_rate": 4.919189131168155e-06, "loss": 0.5047, "mean_token_accuracy": 0.8383530899882317, "num_tokens": 989512822.0, "step": 31004 }, { "entropy": 0.550473777577281, "epoch": 2.8526230441458074, "grad_norm": 0.16677889227867126, "learning_rate": 4.916122305026528e-06, "loss": 0.5449, "mean_token_accuracy": 0.8306699357926846, "num_tokens": 989545152.0, "step": 31005 }, { "entropy": 0.4639761494472623, "epoch": 2.852715050517248, "grad_norm": 0.15079861879348755, "learning_rate": 4.913055478884902e-06, "loss": 0.4497, "mean_token_accuracy": 0.8565508350729942, "num_tokens": 989576719.0, "step": 31006 }, { "entropy": 0.47761829756200314, "epoch": 2.8528070568886896, "grad_norm": 0.15250733494758606, "learning_rate": 4.909988652743276e-06, "loss": 0.4545, "mean_token_accuracy": 0.855520274490118, "num_tokens": 989609487.0, "step": 31007 }, { "entropy": 0.5068490550620481, "epoch": 2.8528990632601308, "grad_norm": 0.15620796382427216, "learning_rate": 4.90692182660165e-06, "loss": 0.5012, "mean_token_accuracy": 0.8407004624605179, "num_tokens": 989642253.0, "step": 31008 }, { "entropy": 0.5676681715995073, "epoch": 2.852991069631572, "grad_norm": 0.16637800633907318, "learning_rate": 4.903855000460024e-06, "loss": 0.5497, "mean_token_accuracy": 0.8289338052272797, "num_tokens": 989673700.0, "step": 31009 }, { "entropy": 0.5209064157679677, "epoch": 2.8530830760030135, "grad_norm": 0.16022342443466187, "learning_rate": 4.900788174318398e-06, "loss": 0.515, "mean_token_accuracy": 0.8407990112900734, "num_tokens": 989705584.0, "step": 31010 }, { "entropy": 0.5709184929728508, "epoch": 2.853175082374454, "grad_norm": 0.1630183458328247, "learning_rate": 4.897721348176772e-06, "loss": 0.5493, "mean_token_accuracy": 0.826214287430048, "num_tokens": 989737779.0, "step": 31011 }, { "entropy": 0.48557083681225777, "epoch": 2.8532670887458957, "grad_norm": 0.1536952704191208, "learning_rate": 4.894654522035147e-06, "loss": 0.4739, "mean_token_accuracy": 0.8514500185847282, "num_tokens": 989770120.0, "step": 31012 }, { "entropy": 0.48349877819418907, "epoch": 2.853359095117337, "grad_norm": 0.1499452441930771, "learning_rate": 4.8915876958935205e-06, "loss": 0.4661, "mean_token_accuracy": 0.8506691604852676, "num_tokens": 989802243.0, "step": 31013 }, { "entropy": 0.5177935091778636, "epoch": 2.853451101488778, "grad_norm": 0.1593460738658905, "learning_rate": 4.888520869751894e-06, "loss": 0.5045, "mean_token_accuracy": 0.8400457799434662, "num_tokens": 989834395.0, "step": 31014 }, { "entropy": 0.46877338574267924, "epoch": 2.8535431078602196, "grad_norm": 0.15125198662281036, "learning_rate": 4.885454043610268e-06, "loss": 0.4584, "mean_token_accuracy": 0.8545791171491146, "num_tokens": 989866403.0, "step": 31015 }, { "entropy": 0.5276855169795454, "epoch": 2.8536351142316603, "grad_norm": 0.16113774478435516, "learning_rate": 4.882387217468642e-06, "loss": 0.5196, "mean_token_accuracy": 0.8347262106835842, "num_tokens": 989898406.0, "step": 31016 }, { "entropy": 0.5382525231689215, "epoch": 2.853727120603102, "grad_norm": 0.16379743814468384, "learning_rate": 4.879320391327016e-06, "loss": 0.5266, "mean_token_accuracy": 0.8322954326868057, "num_tokens": 989929245.0, "step": 31017 }, { "entropy": 0.5652036406099796, "epoch": 2.853819126974543, "grad_norm": 0.16694508492946625, "learning_rate": 4.8762535651853895e-06, "loss": 0.5534, "mean_token_accuracy": 0.8266158439218998, "num_tokens": 989961475.0, "step": 31018 }, { "entropy": 0.529891368933022, "epoch": 2.853911133345984, "grad_norm": 0.15801899135112762, "learning_rate": 4.873186739043764e-06, "loss": 0.5002, "mean_token_accuracy": 0.8413974568247795, "num_tokens": 989993377.0, "step": 31019 }, { "entropy": 0.43529437901452184, "epoch": 2.8540031397174257, "grad_norm": 0.1470368355512619, "learning_rate": 4.870119912902138e-06, "loss": 0.4313, "mean_token_accuracy": 0.8646189533174038, "num_tokens": 990026145.0, "step": 31020 }, { "entropy": 0.5089855331461877, "epoch": 2.8540951460888664, "grad_norm": 0.1588105857372284, "learning_rate": 4.867053086760512e-06, "loss": 0.5019, "mean_token_accuracy": 0.8424705676734447, "num_tokens": 990058372.0, "step": 31021 }, { "entropy": 0.6070628929883242, "epoch": 2.854187152460308, "grad_norm": 0.17573325335979462, "learning_rate": 4.8639862606188855e-06, "loss": 0.6024, "mean_token_accuracy": 0.811151310801506, "num_tokens": 990089884.0, "step": 31022 }, { "entropy": 0.5363995172083378, "epoch": 2.854279158831749, "grad_norm": 0.16120144724845886, "learning_rate": 4.860919434477259e-06, "loss": 0.5256, "mean_token_accuracy": 0.831540934741497, "num_tokens": 990121482.0, "step": 31023 }, { "entropy": 0.5268956637009978, "epoch": 2.8543711652031902, "grad_norm": 0.162922203540802, "learning_rate": 4.857852608335633e-06, "loss": 0.5203, "mean_token_accuracy": 0.838768444955349, "num_tokens": 990152898.0, "step": 31024 }, { "entropy": 0.44974452443420887, "epoch": 2.854463171574632, "grad_norm": 0.15155944228172302, "learning_rate": 4.854785782194008e-06, "loss": 0.4464, "mean_token_accuracy": 0.8577988594770432, "num_tokens": 990184574.0, "step": 31025 }, { "entropy": 0.45087254513055086, "epoch": 2.8545551779460725, "grad_norm": 0.15316691994667053, "learning_rate": 4.851718956052382e-06, "loss": 0.4375, "mean_token_accuracy": 0.8587225005030632, "num_tokens": 990215894.0, "step": 31026 }, { "entropy": 0.42683859425596893, "epoch": 2.854647184317514, "grad_norm": 0.14729750156402588, "learning_rate": 4.848652129910756e-06, "loss": 0.4192, "mean_token_accuracy": 0.8670236356556416, "num_tokens": 990248167.0, "step": 31027 }, { "entropy": 0.41029771510511637, "epoch": 2.854739190688955, "grad_norm": 0.14160679280757904, "learning_rate": 4.84558530376913e-06, "loss": 0.388, "mean_token_accuracy": 0.8735663741827011, "num_tokens": 990280373.0, "step": 31028 }, { "entropy": 0.5127438995987177, "epoch": 2.8548311970603963, "grad_norm": 0.15565705299377441, "learning_rate": 4.842518477627504e-06, "loss": 0.5031, "mean_token_accuracy": 0.8390130624175072, "num_tokens": 990312595.0, "step": 31029 }, { "entropy": 0.532985508441925, "epoch": 2.854923203431838, "grad_norm": 0.15982523560523987, "learning_rate": 4.839451651485878e-06, "loss": 0.5299, "mean_token_accuracy": 0.8316979371011257, "num_tokens": 990344797.0, "step": 31030 }, { "entropy": 0.46515205316245556, "epoch": 2.8550152098032786, "grad_norm": 0.1586884707212448, "learning_rate": 4.8363848253442514e-06, "loss": 0.4537, "mean_token_accuracy": 0.8521144203841686, "num_tokens": 990376880.0, "step": 31031 }, { "entropy": 0.4768691072240472, "epoch": 2.85510721617472, "grad_norm": 0.15294261276721954, "learning_rate": 4.833317999202625e-06, "loss": 0.4619, "mean_token_accuracy": 0.8527505435049534, "num_tokens": 990409034.0, "step": 31032 }, { "entropy": 0.5586417652666569, "epoch": 2.8551992225461613, "grad_norm": 0.16204988956451416, "learning_rate": 4.830251173060999e-06, "loss": 0.5364, "mean_token_accuracy": 0.8289080485701561, "num_tokens": 990440561.0, "step": 31033 }, { "entropy": 0.4531955267302692, "epoch": 2.8552912289176025, "grad_norm": 0.15317480266094208, "learning_rate": 4.827184346919374e-06, "loss": 0.4352, "mean_token_accuracy": 0.8622684441506863, "num_tokens": 990471482.0, "step": 31034 }, { "entropy": 0.41689923498779535, "epoch": 2.855383235289044, "grad_norm": 0.1493026465177536, "learning_rate": 4.8241175207777475e-06, "loss": 0.4005, "mean_token_accuracy": 0.8671316765248775, "num_tokens": 990502795.0, "step": 31035 }, { "entropy": 0.39969280431978405, "epoch": 2.8554752416604847, "grad_norm": 0.13844136893749237, "learning_rate": 4.821050694636121e-06, "loss": 0.3841, "mean_token_accuracy": 0.8759171925485134, "num_tokens": 990535312.0, "step": 31036 }, { "entropy": 0.5316884499043226, "epoch": 2.8555672480319263, "grad_norm": 0.16577835381031036, "learning_rate": 4.817983868494495e-06, "loss": 0.5187, "mean_token_accuracy": 0.8345972932875156, "num_tokens": 990566791.0, "step": 31037 }, { "entropy": 0.4995403364300728, "epoch": 2.8556592544033674, "grad_norm": 0.15834350883960724, "learning_rate": 4.814917042352869e-06, "loss": 0.4814, "mean_token_accuracy": 0.8478107750415802, "num_tokens": 990598415.0, "step": 31038 }, { "entropy": 0.539911475032568, "epoch": 2.8557512607748086, "grad_norm": 0.17101843655109406, "learning_rate": 4.811850216211243e-06, "loss": 0.5266, "mean_token_accuracy": 0.8289022408425808, "num_tokens": 990628964.0, "step": 31039 }, { "entropy": 0.5456389095634222, "epoch": 2.85584326714625, "grad_norm": 0.16339664161205292, "learning_rate": 4.808783390069617e-06, "loss": 0.5274, "mean_token_accuracy": 0.8318040743470192, "num_tokens": 990660778.0, "step": 31040 }, { "entropy": 0.5112208109349012, "epoch": 2.855935273517691, "grad_norm": 0.1541031152009964, "learning_rate": 4.805716563927991e-06, "loss": 0.4994, "mean_token_accuracy": 0.8402377590537071, "num_tokens": 990693099.0, "step": 31041 }, { "entropy": 0.559214262291789, "epoch": 2.8560272798891324, "grad_norm": 0.16210679709911346, "learning_rate": 4.802649737786366e-06, "loss": 0.5457, "mean_token_accuracy": 0.8268850184977055, "num_tokens": 990725008.0, "step": 31042 }, { "entropy": 0.5670617558062077, "epoch": 2.8561192862605735, "grad_norm": 0.16493651270866394, "learning_rate": 4.79958291164474e-06, "loss": 0.5587, "mean_token_accuracy": 0.8237275816500187, "num_tokens": 990757017.0, "step": 31043 }, { "entropy": 0.4385327701456845, "epoch": 2.8562112926320147, "grad_norm": 0.14834432303905487, "learning_rate": 4.796516085503113e-06, "loss": 0.4206, "mean_token_accuracy": 0.8611421510577202, "num_tokens": 990789228.0, "step": 31044 }, { "entropy": 0.4921995420008898, "epoch": 2.8563032990034563, "grad_norm": 0.15579791367053986, "learning_rate": 4.793449259361487e-06, "loss": 0.4878, "mean_token_accuracy": 0.8433990739285946, "num_tokens": 990820911.0, "step": 31045 }, { "entropy": 0.5400874204933643, "epoch": 2.856395305374897, "grad_norm": 0.16348996758460999, "learning_rate": 4.790382433219861e-06, "loss": 0.5264, "mean_token_accuracy": 0.83069122210145, "num_tokens": 990852864.0, "step": 31046 }, { "entropy": 0.5013998160138726, "epoch": 2.8564873117463385, "grad_norm": 0.15576520562171936, "learning_rate": 4.787315607078235e-06, "loss": 0.4946, "mean_token_accuracy": 0.8436354026198387, "num_tokens": 990885404.0, "step": 31047 }, { "entropy": 0.5068009868264198, "epoch": 2.8565793181177797, "grad_norm": 0.1578468382358551, "learning_rate": 4.784248780936609e-06, "loss": 0.496, "mean_token_accuracy": 0.8452158756554127, "num_tokens": 990917670.0, "step": 31048 }, { "entropy": 0.5806452482938766, "epoch": 2.856671324489221, "grad_norm": 0.17427457869052887, "learning_rate": 4.781181954794983e-06, "loss": 0.5744, "mean_token_accuracy": 0.8220440968871117, "num_tokens": 990949488.0, "step": 31049 }, { "entropy": 0.4546896982938051, "epoch": 2.8567633308606624, "grad_norm": 0.15475232899188995, "learning_rate": 4.778115128653357e-06, "loss": 0.4363, "mean_token_accuracy": 0.858076985925436, "num_tokens": 990981487.0, "step": 31050 }, { "entropy": 0.5254027608316392, "epoch": 2.856855337232103, "grad_norm": 0.1589546650648117, "learning_rate": 4.775048302511731e-06, "loss": 0.5187, "mean_token_accuracy": 0.8371860012412071, "num_tokens": 991013227.0, "step": 31051 }, { "entropy": 0.5268791913986206, "epoch": 2.8569473436035446, "grad_norm": 0.16174374520778656, "learning_rate": 4.771981476370105e-06, "loss": 0.5258, "mean_token_accuracy": 0.8310419246554375, "num_tokens": 991044697.0, "step": 31052 }, { "entropy": 0.4813780691474676, "epoch": 2.8570393499749858, "grad_norm": 0.15142759680747986, "learning_rate": 4.7689146502284784e-06, "loss": 0.4688, "mean_token_accuracy": 0.8499045707285404, "num_tokens": 991077021.0, "step": 31053 }, { "entropy": 0.5461976602673531, "epoch": 2.857131356346427, "grad_norm": 0.1635885387659073, "learning_rate": 4.765847824086852e-06, "loss": 0.5229, "mean_token_accuracy": 0.8356252126395702, "num_tokens": 991108209.0, "step": 31054 }, { "entropy": 0.4847530536353588, "epoch": 2.8572233627178685, "grad_norm": 0.15683631598949432, "learning_rate": 4.762780997945227e-06, "loss": 0.4732, "mean_token_accuracy": 0.8481242917478085, "num_tokens": 991140643.0, "step": 31055 }, { "entropy": 0.511363735422492, "epoch": 2.857315369089309, "grad_norm": 0.15451449155807495, "learning_rate": 4.759714171803601e-06, "loss": 0.4878, "mean_token_accuracy": 0.8420250900089741, "num_tokens": 991172413.0, "step": 31056 }, { "entropy": 0.5301727056503296, "epoch": 2.8574073754607507, "grad_norm": 0.16422878205776215, "learning_rate": 4.756647345661975e-06, "loss": 0.5242, "mean_token_accuracy": 0.8341356478631496, "num_tokens": 991203574.0, "step": 31057 }, { "entropy": 0.5401285728439689, "epoch": 2.857499381832192, "grad_norm": 0.16268035769462585, "learning_rate": 4.753580519520349e-06, "loss": 0.5302, "mean_token_accuracy": 0.8344483859837055, "num_tokens": 991235849.0, "step": 31058 }, { "entropy": 0.4797625527717173, "epoch": 2.857591388203633, "grad_norm": 0.1543111354112625, "learning_rate": 4.750513693378723e-06, "loss": 0.4648, "mean_token_accuracy": 0.8515814542770386, "num_tokens": 991267678.0, "step": 31059 }, { "entropy": 0.49122488335706294, "epoch": 2.8576833945750746, "grad_norm": 0.16026058793067932, "learning_rate": 4.747446867237097e-06, "loss": 0.4822, "mean_token_accuracy": 0.8479299694299698, "num_tokens": 991298893.0, "step": 31060 }, { "entropy": 0.46189178340137005, "epoch": 2.8577754009465153, "grad_norm": 0.1461651474237442, "learning_rate": 4.7443800410954705e-06, "loss": 0.4459, "mean_token_accuracy": 0.8580897264182568, "num_tokens": 991330954.0, "step": 31061 }, { "entropy": 0.527945261914283, "epoch": 2.857867407317957, "grad_norm": 0.1572139859199524, "learning_rate": 4.741313214953844e-06, "loss": 0.5125, "mean_token_accuracy": 0.8394239470362663, "num_tokens": 991362884.0, "step": 31062 }, { "entropy": 0.6012300318107009, "epoch": 2.857959413689398, "grad_norm": 0.17082789540290833, "learning_rate": 4.738246388812218e-06, "loss": 0.594, "mean_token_accuracy": 0.8129290267825127, "num_tokens": 991394091.0, "step": 31063 }, { "entropy": 0.4055753326974809, "epoch": 2.858051420060839, "grad_norm": 0.14148376882076263, "learning_rate": 4.735179562670593e-06, "loss": 0.3879, "mean_token_accuracy": 0.8746793009340763, "num_tokens": 991425423.0, "step": 31064 }, { "entropy": 0.5383847178891301, "epoch": 2.8581434264322807, "grad_norm": 0.16192257404327393, "learning_rate": 4.732112736528967e-06, "loss": 0.5257, "mean_token_accuracy": 0.8354639410972595, "num_tokens": 991456202.0, "step": 31065 }, { "entropy": 0.5089679416269064, "epoch": 2.8582354328037214, "grad_norm": 0.1575816571712494, "learning_rate": 4.72904591038734e-06, "loss": 0.5084, "mean_token_accuracy": 0.8414457477629185, "num_tokens": 991488709.0, "step": 31066 }, { "entropy": 0.5890535376966, "epoch": 2.858327439175163, "grad_norm": 0.16368858516216278, "learning_rate": 4.725979084245714e-06, "loss": 0.5803, "mean_token_accuracy": 0.818593941628933, "num_tokens": 991521212.0, "step": 31067 }, { "entropy": 0.5104729700833559, "epoch": 2.858419445546604, "grad_norm": 0.15910600125789642, "learning_rate": 4.722912258104088e-06, "loss": 0.5078, "mean_token_accuracy": 0.8388135954737663, "num_tokens": 991553530.0, "step": 31068 }, { "entropy": 0.4688290925696492, "epoch": 2.8585114519180452, "grad_norm": 0.1553010195493698, "learning_rate": 4.719845431962462e-06, "loss": 0.4563, "mean_token_accuracy": 0.8510657399892807, "num_tokens": 991585379.0, "step": 31069 }, { "entropy": 0.5829480839893222, "epoch": 2.858603458289487, "grad_norm": 0.16891026496887207, "learning_rate": 4.7167786058208364e-06, "loss": 0.5726, "mean_token_accuracy": 0.821544948965311, "num_tokens": 991617337.0, "step": 31070 }, { "entropy": 0.5818604566156864, "epoch": 2.8586954646609275, "grad_norm": 0.1699824184179306, "learning_rate": 4.71371177967921e-06, "loss": 0.5745, "mean_token_accuracy": 0.8150949478149414, "num_tokens": 991648513.0, "step": 31071 }, { "entropy": 0.55419209622778, "epoch": 2.858787471032369, "grad_norm": 0.16863074898719788, "learning_rate": 4.710644953537585e-06, "loss": 0.5488, "mean_token_accuracy": 0.8261091485619545, "num_tokens": 991680157.0, "step": 31072 }, { "entropy": 0.48226687405258417, "epoch": 2.85887947740381, "grad_norm": 0.15463723242282867, "learning_rate": 4.707578127395959e-06, "loss": 0.4684, "mean_token_accuracy": 0.8517268858850002, "num_tokens": 991711819.0, "step": 31073 }, { "entropy": 0.4477140768431127, "epoch": 2.8589714837752513, "grad_norm": 0.1507241278886795, "learning_rate": 4.7045113012543325e-06, "loss": 0.4395, "mean_token_accuracy": 0.8612537086009979, "num_tokens": 991743750.0, "step": 31074 }, { "entropy": 0.577746294438839, "epoch": 2.859063490146693, "grad_norm": 0.16514775156974792, "learning_rate": 4.701444475112706e-06, "loss": 0.5598, "mean_token_accuracy": 0.8224420882761478, "num_tokens": 991775804.0, "step": 31075 }, { "entropy": 0.39578627794981003, "epoch": 2.8591554965181336, "grad_norm": 0.14046919345855713, "learning_rate": 4.69837764897108e-06, "loss": 0.3817, "mean_token_accuracy": 0.8788251988589764, "num_tokens": 991808317.0, "step": 31076 }, { "entropy": 0.4970679492689669, "epoch": 2.859247502889575, "grad_norm": 0.14795717597007751, "learning_rate": 4.695310822829454e-06, "loss": 0.4777, "mean_token_accuracy": 0.8515340201556683, "num_tokens": 991840445.0, "step": 31077 }, { "entropy": 0.4163001247216016, "epoch": 2.8593395092610163, "grad_norm": 0.1454896181821823, "learning_rate": 4.692243996687828e-06, "loss": 0.4079, "mean_token_accuracy": 0.8700380958616734, "num_tokens": 991872421.0, "step": 31078 }, { "entropy": 0.4247060150373727, "epoch": 2.8594315156324575, "grad_norm": 0.148522287607193, "learning_rate": 4.6891771705462015e-06, "loss": 0.4144, "mean_token_accuracy": 0.8662765510380268, "num_tokens": 991904554.0, "step": 31079 }, { "entropy": 0.4947613161057234, "epoch": 2.859523522003899, "grad_norm": 0.154581218957901, "learning_rate": 4.686110344404576e-06, "loss": 0.4757, "mean_token_accuracy": 0.8493479155004025, "num_tokens": 991936181.0, "step": 31080 }, { "entropy": 0.37764533795416355, "epoch": 2.8596155283753397, "grad_norm": 0.13984721899032593, "learning_rate": 4.68304351826295e-06, "loss": 0.3663, "mean_token_accuracy": 0.880608294159174, "num_tokens": 991968060.0, "step": 31081 }, { "entropy": 0.5015263753011823, "epoch": 2.8597075347467813, "grad_norm": 0.157615527510643, "learning_rate": 4.679976692121324e-06, "loss": 0.4948, "mean_token_accuracy": 0.8437376581132412, "num_tokens": 992000089.0, "step": 31082 }, { "entropy": 0.6554372403770685, "epoch": 2.8597995411182224, "grad_norm": 0.17785866558551788, "learning_rate": 4.6769098659796975e-06, "loss": 0.6423, "mean_token_accuracy": 0.7967857718467712, "num_tokens": 992031946.0, "step": 31083 }, { "entropy": 0.4786383459577337, "epoch": 2.8598915474896636, "grad_norm": 0.1474701464176178, "learning_rate": 4.673843039838071e-06, "loss": 0.4588, "mean_token_accuracy": 0.851359162479639, "num_tokens": 992064366.0, "step": 31084 }, { "entropy": 0.44758815318346024, "epoch": 2.859983553861105, "grad_norm": 0.14628925919532776, "learning_rate": 4.670776213696446e-06, "loss": 0.4388, "mean_token_accuracy": 0.8613411784172058, "num_tokens": 992096566.0, "step": 31085 }, { "entropy": 0.479907903354615, "epoch": 2.860075560232546, "grad_norm": 0.15366660058498383, "learning_rate": 4.66770938755482e-06, "loss": 0.4662, "mean_token_accuracy": 0.8539710268378258, "num_tokens": 992128503.0, "step": 31086 }, { "entropy": 0.5056688347831368, "epoch": 2.8601675666039874, "grad_norm": 0.1561715453863144, "learning_rate": 4.6646425614131944e-06, "loss": 0.5055, "mean_token_accuracy": 0.8381306678056717, "num_tokens": 992160426.0, "step": 31087 }, { "entropy": 0.4940162915736437, "epoch": 2.8602595729754285, "grad_norm": 0.1572146862745285, "learning_rate": 4.661575735271568e-06, "loss": 0.4849, "mean_token_accuracy": 0.8457158729434013, "num_tokens": 992192590.0, "step": 31088 }, { "entropy": 0.5595698347315192, "epoch": 2.8603515793468697, "grad_norm": 0.16504010558128357, "learning_rate": 4.658508909129942e-06, "loss": 0.5529, "mean_token_accuracy": 0.8253695592284203, "num_tokens": 992224203.0, "step": 31089 }, { "entropy": 0.5342556359246373, "epoch": 2.8604435857183113, "grad_norm": 0.15780609846115112, "learning_rate": 4.655442082988316e-06, "loss": 0.5207, "mean_token_accuracy": 0.837006215006113, "num_tokens": 992256534.0, "step": 31090 }, { "entropy": 0.5168205564841628, "epoch": 2.860535592089752, "grad_norm": 0.1552872359752655, "learning_rate": 4.65237525684669e-06, "loss": 0.5081, "mean_token_accuracy": 0.8377760760486126, "num_tokens": 992288946.0, "step": 31091 }, { "entropy": 0.5286414548754692, "epoch": 2.8606275984611935, "grad_norm": 0.1570819616317749, "learning_rate": 4.6493084307050634e-06, "loss": 0.5139, "mean_token_accuracy": 0.8386033177375793, "num_tokens": 992321300.0, "step": 31092 }, { "entropy": 0.46595456916838884, "epoch": 2.8607196048326347, "grad_norm": 0.15313021838665009, "learning_rate": 4.646241604563437e-06, "loss": 0.4512, "mean_token_accuracy": 0.8555036336183548, "num_tokens": 992353534.0, "step": 31093 }, { "entropy": 0.4778445940464735, "epoch": 2.860811611204076, "grad_norm": 0.15471641719341278, "learning_rate": 4.643174778421811e-06, "loss": 0.4772, "mean_token_accuracy": 0.8490543626248837, "num_tokens": 992385431.0, "step": 31094 }, { "entropy": 0.5399540718644857, "epoch": 2.8609036175755174, "grad_norm": 0.16406121850013733, "learning_rate": 4.640107952280186e-06, "loss": 0.5238, "mean_token_accuracy": 0.8323011882603168, "num_tokens": 992417624.0, "step": 31095 }, { "entropy": 0.5136526860296726, "epoch": 2.860995623946958, "grad_norm": 0.15497708320617676, "learning_rate": 4.6370411261385595e-06, "loss": 0.4922, "mean_token_accuracy": 0.8455179333686829, "num_tokens": 992450319.0, "step": 31096 }, { "entropy": 0.5173973073251545, "epoch": 2.8610876303183996, "grad_norm": 0.15912386775016785, "learning_rate": 4.633974299996933e-06, "loss": 0.5022, "mean_token_accuracy": 0.838664073497057, "num_tokens": 992482150.0, "step": 31097 }, { "entropy": 0.4514890182763338, "epoch": 2.8611796366898408, "grad_norm": 0.14864304661750793, "learning_rate": 4.630907473855307e-06, "loss": 0.4376, "mean_token_accuracy": 0.8562837950885296, "num_tokens": 992514067.0, "step": 31098 }, { "entropy": 0.5334462523460388, "epoch": 2.861271643061282, "grad_norm": 0.16807545721530914, "learning_rate": 4.627840647713681e-06, "loss": 0.5375, "mean_token_accuracy": 0.830092404037714, "num_tokens": 992545099.0, "step": 31099 }, { "entropy": 0.578710999339819, "epoch": 2.8613636494327235, "grad_norm": 0.16759027540683746, "learning_rate": 4.6247738215720555e-06, "loss": 0.5742, "mean_token_accuracy": 0.8195499517023563, "num_tokens": 992576925.0, "step": 31100 }, { "entropy": 0.4867170648649335, "epoch": 2.861455655804164, "grad_norm": 0.15763068199157715, "learning_rate": 4.621706995430429e-06, "loss": 0.476, "mean_token_accuracy": 0.8452002815902233, "num_tokens": 992609693.0, "step": 31101 }, { "entropy": 0.4876565276645124, "epoch": 2.8615476621756057, "grad_norm": 0.1544945389032364, "learning_rate": 4.618640169288804e-06, "loss": 0.4752, "mean_token_accuracy": 0.847437396645546, "num_tokens": 992642051.0, "step": 31102 }, { "entropy": 0.49015711434185505, "epoch": 2.861639668547047, "grad_norm": 0.15285071730613708, "learning_rate": 4.615573343147178e-06, "loss": 0.4824, "mean_token_accuracy": 0.8486115597188473, "num_tokens": 992674526.0, "step": 31103 }, { "entropy": 0.46890577115118504, "epoch": 2.861731674918488, "grad_norm": 0.15765032172203064, "learning_rate": 4.612506517005552e-06, "loss": 0.4565, "mean_token_accuracy": 0.8535914793610573, "num_tokens": 992705662.0, "step": 31104 }, { "entropy": 0.4732665382325649, "epoch": 2.8618236812899296, "grad_norm": 0.16020740568637848, "learning_rate": 4.609439690863925e-06, "loss": 0.4729, "mean_token_accuracy": 0.8488015234470367, "num_tokens": 992737201.0, "step": 31105 }, { "entropy": 0.5188466385006905, "epoch": 2.8619156876613703, "grad_norm": 0.16173464059829712, "learning_rate": 4.606372864722299e-06, "loss": 0.5077, "mean_token_accuracy": 0.8360721357166767, "num_tokens": 992768992.0, "step": 31106 }, { "entropy": 0.518133794888854, "epoch": 2.862007694032812, "grad_norm": 0.15939296782016754, "learning_rate": 4.603306038580673e-06, "loss": 0.5163, "mean_token_accuracy": 0.835816103965044, "num_tokens": 992800859.0, "step": 31107 }, { "entropy": 0.42818605387583375, "epoch": 2.862099700404253, "grad_norm": 0.14099228382110596, "learning_rate": 4.600239212439047e-06, "loss": 0.4086, "mean_token_accuracy": 0.8696761354804039, "num_tokens": 992833063.0, "step": 31108 }, { "entropy": 0.5008003041148186, "epoch": 2.862191706775694, "grad_norm": 0.16431300342082977, "learning_rate": 4.597172386297421e-06, "loss": 0.5028, "mean_token_accuracy": 0.8391229510307312, "num_tokens": 992864127.0, "step": 31109 }, { "entropy": 0.4711577710695565, "epoch": 2.8622837131471357, "grad_norm": 0.15447933971881866, "learning_rate": 4.594105560155795e-06, "loss": 0.453, "mean_token_accuracy": 0.8542061634361744, "num_tokens": 992896468.0, "step": 31110 }, { "entropy": 0.6042974080191925, "epoch": 2.8623757195185764, "grad_norm": 0.17175105214118958, "learning_rate": 4.591038734014169e-06, "loss": 0.5854, "mean_token_accuracy": 0.8174034915864468, "num_tokens": 992927174.0, "step": 31111 }, { "entropy": 0.5080666914582253, "epoch": 2.862467725890018, "grad_norm": 0.15924930572509766, "learning_rate": 4.587971907872543e-06, "loss": 0.4957, "mean_token_accuracy": 0.8456603959202766, "num_tokens": 992958794.0, "step": 31112 }, { "entropy": 0.4161553392186761, "epoch": 2.862559732261459, "grad_norm": 0.14455954730510712, "learning_rate": 4.584905081730917e-06, "loss": 0.4071, "mean_token_accuracy": 0.8701988309621811, "num_tokens": 992991218.0, "step": 31113 }, { "entropy": 0.5811319500207901, "epoch": 2.8626517386329002, "grad_norm": 0.16908983886241913, "learning_rate": 4.5818382555892904e-06, "loss": 0.563, "mean_token_accuracy": 0.8198605068027973, "num_tokens": 993022738.0, "step": 31114 }, { "entropy": 0.53909044386819, "epoch": 2.862743745004342, "grad_norm": 0.15696609020233154, "learning_rate": 4.578771429447665e-06, "loss": 0.5284, "mean_token_accuracy": 0.8317051120102406, "num_tokens": 993054941.0, "step": 31115 }, { "entropy": 0.5518376813270152, "epoch": 2.8628357513757825, "grad_norm": 0.16156868636608124, "learning_rate": 4.575704603306039e-06, "loss": 0.5457, "mean_token_accuracy": 0.8265420533716679, "num_tokens": 993087224.0, "step": 31116 }, { "entropy": 0.5016796831041574, "epoch": 2.862927757747224, "grad_norm": 0.1540202796459198, "learning_rate": 4.572637777164413e-06, "loss": 0.4902, "mean_token_accuracy": 0.8461192958056927, "num_tokens": 993119011.0, "step": 31117 }, { "entropy": 0.5113821607083082, "epoch": 2.863019764118665, "grad_norm": 0.1583355963230133, "learning_rate": 4.569570951022787e-06, "loss": 0.5019, "mean_token_accuracy": 0.8418862260878086, "num_tokens": 993150888.0, "step": 31118 }, { "entropy": 0.46798832388594747, "epoch": 2.8631117704901063, "grad_norm": 0.14965605735778809, "learning_rate": 4.566504124881161e-06, "loss": 0.457, "mean_token_accuracy": 0.8539325781166553, "num_tokens": 993183656.0, "step": 31119 }, { "entropy": 0.4314656755886972, "epoch": 2.863203776861548, "grad_norm": 0.1493433564901352, "learning_rate": 4.563437298739535e-06, "loss": 0.429, "mean_token_accuracy": 0.8610068745911121, "num_tokens": 993216095.0, "step": 31120 }, { "entropy": 0.4943870007991791, "epoch": 2.8632957832329886, "grad_norm": 0.1554824411869049, "learning_rate": 4.560370472597909e-06, "loss": 0.476, "mean_token_accuracy": 0.8500502593815327, "num_tokens": 993247777.0, "step": 31121 }, { "entropy": 0.5167360045015812, "epoch": 2.86338778960443, "grad_norm": 0.15812593698501587, "learning_rate": 4.5573036464562825e-06, "loss": 0.5102, "mean_token_accuracy": 0.8362532742321491, "num_tokens": 993279980.0, "step": 31122 }, { "entropy": 0.5195717420428991, "epoch": 2.8634797959758713, "grad_norm": 0.15769334137439728, "learning_rate": 4.554236820314656e-06, "loss": 0.4931, "mean_token_accuracy": 0.8387519903481007, "num_tokens": 993311769.0, "step": 31123 }, { "entropy": 0.47329605533741415, "epoch": 2.8635718023473125, "grad_norm": 0.1518731266260147, "learning_rate": 4.55116999417303e-06, "loss": 0.4617, "mean_token_accuracy": 0.8523741774260998, "num_tokens": 993343841.0, "step": 31124 }, { "entropy": 0.5027115782722831, "epoch": 2.863663808718754, "grad_norm": 0.15586495399475098, "learning_rate": 4.548103168031405e-06, "loss": 0.4754, "mean_token_accuracy": 0.8463596925139427, "num_tokens": 993375987.0, "step": 31125 }, { "entropy": 0.522064640186727, "epoch": 2.8637558150901947, "grad_norm": 0.16448117792606354, "learning_rate": 4.545036341889779e-06, "loss": 0.5178, "mean_token_accuracy": 0.8369849286973476, "num_tokens": 993407598.0, "step": 31126 }, { "entropy": 0.5601519662886858, "epoch": 2.8638478214616363, "grad_norm": 0.16386888921260834, "learning_rate": 4.541969515748152e-06, "loss": 0.5499, "mean_token_accuracy": 0.829575277864933, "num_tokens": 993440115.0, "step": 31127 }, { "entropy": 0.527539744740352, "epoch": 2.8639398278330774, "grad_norm": 0.16112814843654633, "learning_rate": 4.538902689606526e-06, "loss": 0.5189, "mean_token_accuracy": 0.8361978530883789, "num_tokens": 993471930.0, "step": 31128 }, { "entropy": 0.4574029939249158, "epoch": 2.8640318342045186, "grad_norm": 0.14385585486888885, "learning_rate": 4.5358358634649e-06, "loss": 0.4383, "mean_token_accuracy": 0.8613579720258713, "num_tokens": 993503719.0, "step": 31129 }, { "entropy": 0.36533514596521854, "epoch": 2.86412384057596, "grad_norm": 0.14026188850402832, "learning_rate": 4.532769037323275e-06, "loss": 0.3657, "mean_token_accuracy": 0.8835528157651424, "num_tokens": 993535917.0, "step": 31130 }, { "entropy": 0.4742334047332406, "epoch": 2.864215846947401, "grad_norm": 0.1567487120628357, "learning_rate": 4.5297022111816484e-06, "loss": 0.4683, "mean_token_accuracy": 0.8514313064515591, "num_tokens": 993567550.0, "step": 31131 }, { "entropy": 0.5481370938941836, "epoch": 2.8643078533188424, "grad_norm": 0.16437716782093048, "learning_rate": 4.526635385040022e-06, "loss": 0.5425, "mean_token_accuracy": 0.8300848342478275, "num_tokens": 993599143.0, "step": 31132 }, { "entropy": 0.5107259079813957, "epoch": 2.8643998596902835, "grad_norm": 0.160638228058815, "learning_rate": 4.523568558898397e-06, "loss": 0.4959, "mean_token_accuracy": 0.8417050838470459, "num_tokens": 993630587.0, "step": 31133 }, { "entropy": 0.45521863643079996, "epoch": 2.8644918660617247, "grad_norm": 0.1571221500635147, "learning_rate": 4.520501732756771e-06, "loss": 0.4446, "mean_token_accuracy": 0.8572830483317375, "num_tokens": 993661961.0, "step": 31134 }, { "entropy": 0.4654705449938774, "epoch": 2.8645838724331663, "grad_norm": 0.14726361632347107, "learning_rate": 4.5174349066151445e-06, "loss": 0.4424, "mean_token_accuracy": 0.8602954223752022, "num_tokens": 993693932.0, "step": 31135 }, { "entropy": 0.5180297889746726, "epoch": 2.864675878804607, "grad_norm": 0.15924593806266785, "learning_rate": 4.514368080473518e-06, "loss": 0.5102, "mean_token_accuracy": 0.8414258025586605, "num_tokens": 993726035.0, "step": 31136 }, { "entropy": 0.43400405254215, "epoch": 2.8647678851760485, "grad_norm": 0.1457241028547287, "learning_rate": 4.511301254331892e-06, "loss": 0.4206, "mean_token_accuracy": 0.8638955913484097, "num_tokens": 993757846.0, "step": 31137 }, { "entropy": 0.5512167329434305, "epoch": 2.8648598915474897, "grad_norm": 0.16050654649734497, "learning_rate": 4.508234428190266e-06, "loss": 0.5358, "mean_token_accuracy": 0.8343472927808762, "num_tokens": 993790431.0, "step": 31138 }, { "entropy": 0.5514167062938213, "epoch": 2.864951897918931, "grad_norm": 0.1644747257232666, "learning_rate": 4.50516760204864e-06, "loss": 0.5464, "mean_token_accuracy": 0.8261870332062244, "num_tokens": 993822891.0, "step": 31139 }, { "entropy": 0.5609780326485634, "epoch": 2.8650439042903724, "grad_norm": 0.1693408340215683, "learning_rate": 4.5021007759070135e-06, "loss": 0.5472, "mean_token_accuracy": 0.824471477419138, "num_tokens": 993854872.0, "step": 31140 }, { "entropy": 0.44001428748015314, "epoch": 2.865135910661813, "grad_norm": 0.1517821103334427, "learning_rate": 4.499033949765388e-06, "loss": 0.4264, "mean_token_accuracy": 0.864250160753727, "num_tokens": 993886162.0, "step": 31141 }, { "entropy": 0.37735517090186477, "epoch": 2.8652279170332546, "grad_norm": 0.13976401090621948, "learning_rate": 4.495967123623762e-06, "loss": 0.3655, "mean_token_accuracy": 0.8838309645652771, "num_tokens": 993918159.0, "step": 31142 }, { "entropy": 0.43241212412249297, "epoch": 2.8653199234046958, "grad_norm": 0.1511191427707672, "learning_rate": 4.492900297482136e-06, "loss": 0.4232, "mean_token_accuracy": 0.8703251741826534, "num_tokens": 993950545.0, "step": 31143 }, { "entropy": 0.540729841333814, "epoch": 2.865411929776137, "grad_norm": 0.15910036861896515, "learning_rate": 4.4898334713405095e-06, "loss": 0.532, "mean_token_accuracy": 0.8308380097150803, "num_tokens": 993982648.0, "step": 31144 }, { "entropy": 0.3794414948206395, "epoch": 2.8655039361475785, "grad_norm": 0.14573197066783905, "learning_rate": 4.486766645198884e-06, "loss": 0.373, "mean_token_accuracy": 0.8784600049257278, "num_tokens": 994014705.0, "step": 31145 }, { "entropy": 0.4002938694320619, "epoch": 2.865595942519019, "grad_norm": 0.14101608097553253, "learning_rate": 4.483699819057258e-06, "loss": 0.3889, "mean_token_accuracy": 0.8715782053768635, "num_tokens": 994046939.0, "step": 31146 }, { "entropy": 0.5030062645673752, "epoch": 2.8656879488904607, "grad_norm": 0.15754054486751556, "learning_rate": 4.480632992915632e-06, "loss": 0.4944, "mean_token_accuracy": 0.8429109454154968, "num_tokens": 994078188.0, "step": 31147 }, { "entropy": 0.450618636328727, "epoch": 2.865779955261902, "grad_norm": 0.14844457805156708, "learning_rate": 4.4775661667740064e-06, "loss": 0.4353, "mean_token_accuracy": 0.8599964007735252, "num_tokens": 994110221.0, "step": 31148 }, { "entropy": 0.5733611546456814, "epoch": 2.865871961633343, "grad_norm": 0.1643732637166977, "learning_rate": 4.47449934063238e-06, "loss": 0.5621, "mean_token_accuracy": 0.8271585702896118, "num_tokens": 994142462.0, "step": 31149 }, { "entropy": 0.501433159224689, "epoch": 2.8659639680047846, "grad_norm": 0.15726013481616974, "learning_rate": 4.471432514490754e-06, "loss": 0.489, "mean_token_accuracy": 0.8437099829316139, "num_tokens": 994174056.0, "step": 31150 }, { "entropy": 0.46389450691640377, "epoch": 2.8660559743762253, "grad_norm": 0.14622513949871063, "learning_rate": 4.468365688349128e-06, "loss": 0.4511, "mean_token_accuracy": 0.8568523600697517, "num_tokens": 994206764.0, "step": 31151 }, { "entropy": 0.4379460201598704, "epoch": 2.866147980747667, "grad_norm": 0.14367727935314178, "learning_rate": 4.465298862207502e-06, "loss": 0.4211, "mean_token_accuracy": 0.8637102730572224, "num_tokens": 994238903.0, "step": 31152 }, { "entropy": 0.4665264915674925, "epoch": 2.866239987119108, "grad_norm": 0.1532783806324005, "learning_rate": 4.4622320360658754e-06, "loss": 0.4633, "mean_token_accuracy": 0.8527999669313431, "num_tokens": 994271224.0, "step": 31153 }, { "entropy": 0.5307346172630787, "epoch": 2.866331993490549, "grad_norm": 0.15931133925914764, "learning_rate": 4.459165209924249e-06, "loss": 0.5107, "mean_token_accuracy": 0.8375858552753925, "num_tokens": 994303418.0, "step": 31154 }, { "entropy": 0.48048109002411366, "epoch": 2.8664239998619907, "grad_norm": 0.15326614677906036, "learning_rate": 4.456098383782623e-06, "loss": 0.475, "mean_token_accuracy": 0.8488607481122017, "num_tokens": 994335267.0, "step": 31155 }, { "entropy": 0.5773802220355719, "epoch": 2.8665160062334314, "grad_norm": 0.16777516901493073, "learning_rate": 4.453031557640998e-06, "loss": 0.5702, "mean_token_accuracy": 0.8209003508090973, "num_tokens": 994366776.0, "step": 31156 }, { "entropy": 0.5791630540043116, "epoch": 2.866608012604873, "grad_norm": 0.16563016176223755, "learning_rate": 4.4499647314993715e-06, "loss": 0.5784, "mean_token_accuracy": 0.8174149245023727, "num_tokens": 994398653.0, "step": 31157 }, { "entropy": 0.5244216402061284, "epoch": 2.866700018976314, "grad_norm": 0.16178365051746368, "learning_rate": 4.446897905357745e-06, "loss": 0.5068, "mean_token_accuracy": 0.8354716412723064, "num_tokens": 994429796.0, "step": 31158 }, { "entropy": 0.5638384632766247, "epoch": 2.8667920253477552, "grad_norm": 0.1631016731262207, "learning_rate": 4.443831079216119e-06, "loss": 0.5471, "mean_token_accuracy": 0.8272509276866913, "num_tokens": 994461905.0, "step": 31159 }, { "entropy": 0.4813322573900223, "epoch": 2.866884031719197, "grad_norm": 0.1603105366230011, "learning_rate": 4.440764253074494e-06, "loss": 0.4743, "mean_token_accuracy": 0.8495865911245346, "num_tokens": 994494071.0, "step": 31160 }, { "entropy": 0.4825950332451612, "epoch": 2.8669760380906375, "grad_norm": 0.15436050295829773, "learning_rate": 4.4376974269328675e-06, "loss": 0.4717, "mean_token_accuracy": 0.8527932092547417, "num_tokens": 994525955.0, "step": 31161 }, { "entropy": 0.5472350250929594, "epoch": 2.867068044462079, "grad_norm": 0.16501256823539734, "learning_rate": 4.434630600791241e-06, "loss": 0.5379, "mean_token_accuracy": 0.827666699886322, "num_tokens": 994558001.0, "step": 31162 }, { "entropy": 0.5730064231902361, "epoch": 2.86716005083352, "grad_norm": 0.1604122519493103, "learning_rate": 4.431563774649616e-06, "loss": 0.5524, "mean_token_accuracy": 0.8250283002853394, "num_tokens": 994589950.0, "step": 31163 }, { "entropy": 0.4792739152908325, "epoch": 2.8672520572049613, "grad_norm": 0.15368078649044037, "learning_rate": 4.42849694850799e-06, "loss": 0.4654, "mean_token_accuracy": 0.8541169352829456, "num_tokens": 994622159.0, "step": 31164 }, { "entropy": 0.4364418974146247, "epoch": 2.867344063576403, "grad_norm": 0.1481766402721405, "learning_rate": 4.4254301223663636e-06, "loss": 0.4134, "mean_token_accuracy": 0.864356990903616, "num_tokens": 994653390.0, "step": 31165 }, { "entropy": 0.5446920283138752, "epoch": 2.8674360699478436, "grad_norm": 0.16236884891986847, "learning_rate": 4.422363296224737e-06, "loss": 0.5348, "mean_token_accuracy": 0.8290444500744343, "num_tokens": 994685661.0, "step": 31166 }, { "entropy": 0.5005400106310844, "epoch": 2.867528076319285, "grad_norm": 0.15641766786575317, "learning_rate": 4.419296470083111e-06, "loss": 0.4922, "mean_token_accuracy": 0.843978438526392, "num_tokens": 994717707.0, "step": 31167 }, { "entropy": 0.4922049278393388, "epoch": 2.8676200826907263, "grad_norm": 0.1563546359539032, "learning_rate": 4.416229643941485e-06, "loss": 0.4723, "mean_token_accuracy": 0.849853090941906, "num_tokens": 994749893.0, "step": 31168 }, { "entropy": 0.49468292854726315, "epoch": 2.8677120890621675, "grad_norm": 0.1550363004207611, "learning_rate": 4.413162817799859e-06, "loss": 0.4757, "mean_token_accuracy": 0.8507157452404499, "num_tokens": 994781442.0, "step": 31169 }, { "entropy": 0.4466555565595627, "epoch": 2.867804095433609, "grad_norm": 0.15237437188625336, "learning_rate": 4.410095991658233e-06, "loss": 0.4328, "mean_token_accuracy": 0.859869722276926, "num_tokens": 994812958.0, "step": 31170 }, { "entropy": 0.5645270240493119, "epoch": 2.8678961018050497, "grad_norm": 0.16049183905124664, "learning_rate": 4.407029165516607e-06, "loss": 0.5479, "mean_token_accuracy": 0.8274504467844963, "num_tokens": 994845222.0, "step": 31171 }, { "entropy": 0.46273063588887453, "epoch": 2.8679881081764913, "grad_norm": 0.1511777639389038, "learning_rate": 4.403962339374981e-06, "loss": 0.4429, "mean_token_accuracy": 0.8588530272245407, "num_tokens": 994877613.0, "step": 31172 }, { "entropy": 0.4332657316699624, "epoch": 2.8680801145479324, "grad_norm": 0.14450110495090485, "learning_rate": 4.400895513233355e-06, "loss": 0.4155, "mean_token_accuracy": 0.8659929595887661, "num_tokens": 994909330.0, "step": 31173 }, { "entropy": 0.3774621128104627, "epoch": 2.8681721209193736, "grad_norm": 0.13700631260871887, "learning_rate": 4.397828687091729e-06, "loss": 0.3672, "mean_token_accuracy": 0.8801240846514702, "num_tokens": 994941215.0, "step": 31174 }, { "entropy": 0.49674852658063173, "epoch": 2.868264127290815, "grad_norm": 0.15518184006214142, "learning_rate": 4.394761860950103e-06, "loss": 0.4913, "mean_token_accuracy": 0.841999888420105, "num_tokens": 994973475.0, "step": 31175 }, { "entropy": 0.6033667726442218, "epoch": 2.868356133662256, "grad_norm": 0.1724766194820404, "learning_rate": 4.391695034808477e-06, "loss": 0.5903, "mean_token_accuracy": 0.8144565187394619, "num_tokens": 995005240.0, "step": 31176 }, { "entropy": 0.5294983700150624, "epoch": 2.8684481400336974, "grad_norm": 0.15795862674713135, "learning_rate": 4.388628208666851e-06, "loss": 0.517, "mean_token_accuracy": 0.8394545949995518, "num_tokens": 995037639.0, "step": 31177 }, { "entropy": 0.438827978214249, "epoch": 2.8685401464051385, "grad_norm": 0.14420434832572937, "learning_rate": 4.385561382525225e-06, "loss": 0.4262, "mean_token_accuracy": 0.8635871820151806, "num_tokens": 995070114.0, "step": 31178 }, { "entropy": 0.5736258905380964, "epoch": 2.8686321527765797, "grad_norm": 0.16471712291240692, "learning_rate": 4.382494556383599e-06, "loss": 0.5547, "mean_token_accuracy": 0.8254453167319298, "num_tokens": 995102280.0, "step": 31179 }, { "entropy": 0.5775042856112123, "epoch": 2.8687241591480213, "grad_norm": 0.15810614824295044, "learning_rate": 4.379427730241973e-06, "loss": 0.5541, "mean_token_accuracy": 0.822974544018507, "num_tokens": 995134125.0, "step": 31180 }, { "entropy": 0.538669393863529, "epoch": 2.868816165519462, "grad_norm": 0.164259135723114, "learning_rate": 4.376360904100347e-06, "loss": 0.5316, "mean_token_accuracy": 0.8351107649505138, "num_tokens": 995165442.0, "step": 31181 }, { "entropy": 0.602238648571074, "epoch": 2.8689081718909035, "grad_norm": 0.17015811800956726, "learning_rate": 4.373294077958721e-06, "loss": 0.5991, "mean_token_accuracy": 0.8162700310349464, "num_tokens": 995197266.0, "step": 31182 }, { "entropy": 0.4945082003250718, "epoch": 2.8690001782623447, "grad_norm": 0.1572244018316269, "learning_rate": 4.3702272518170945e-06, "loss": 0.4887, "mean_token_accuracy": 0.8445051237940788, "num_tokens": 995229067.0, "step": 31183 }, { "entropy": 0.45686858240514994, "epoch": 2.869092184633786, "grad_norm": 0.15147337317466736, "learning_rate": 4.367160425675468e-06, "loss": 0.4559, "mean_token_accuracy": 0.8547775708138943, "num_tokens": 995261517.0, "step": 31184 }, { "entropy": 0.523355164565146, "epoch": 2.8691841910052274, "grad_norm": 0.1593364179134369, "learning_rate": 4.364093599533842e-06, "loss": 0.5132, "mean_token_accuracy": 0.8389433361589909, "num_tokens": 995293418.0, "step": 31185 }, { "entropy": 0.46084903134033084, "epoch": 2.869276197376668, "grad_norm": 0.14749407768249512, "learning_rate": 4.361026773392217e-06, "loss": 0.4513, "mean_token_accuracy": 0.8561536781489849, "num_tokens": 995325667.0, "step": 31186 }, { "entropy": 0.5364325419068336, "epoch": 2.8693682037481096, "grad_norm": 0.16770818829536438, "learning_rate": 4.3579599472505906e-06, "loss": 0.5222, "mean_token_accuracy": 0.8316379189491272, "num_tokens": 995357402.0, "step": 31187 }, { "entropy": 0.4593327927868813, "epoch": 2.8694602101195508, "grad_norm": 0.14878985285758972, "learning_rate": 4.354893121108964e-06, "loss": 0.4478, "mean_token_accuracy": 0.856392253190279, "num_tokens": 995389426.0, "step": 31188 }, { "entropy": 0.5622357139363885, "epoch": 2.869552216490992, "grad_norm": 0.16093938052654266, "learning_rate": 4.351826294967338e-06, "loss": 0.5519, "mean_token_accuracy": 0.8292459100484848, "num_tokens": 995421673.0, "step": 31189 }, { "entropy": 0.5136206168681383, "epoch": 2.8696442228624335, "grad_norm": 0.15643104910850525, "learning_rate": 4.348759468825713e-06, "loss": 0.5036, "mean_token_accuracy": 0.8409014604985714, "num_tokens": 995453532.0, "step": 31190 }, { "entropy": 0.4840678363107145, "epoch": 2.869736229233874, "grad_norm": 0.15183672308921814, "learning_rate": 4.345692642684087e-06, "loss": 0.4731, "mean_token_accuracy": 0.849112655967474, "num_tokens": 995485562.0, "step": 31191 }, { "entropy": 0.5525637315586209, "epoch": 2.8698282356053157, "grad_norm": 0.1678321361541748, "learning_rate": 4.3426258165424604e-06, "loss": 0.5385, "mean_token_accuracy": 0.8281722739338875, "num_tokens": 995516478.0, "step": 31192 }, { "entropy": 0.5738853290677071, "epoch": 2.869920241976757, "grad_norm": 0.1682407259941101, "learning_rate": 4.339558990400834e-06, "loss": 0.5646, "mean_token_accuracy": 0.8226166591048241, "num_tokens": 995548660.0, "step": 31193 }, { "entropy": 0.5057942103594542, "epoch": 2.870012248348198, "grad_norm": 0.1583353877067566, "learning_rate": 4.336492164259209e-06, "loss": 0.4943, "mean_token_accuracy": 0.8384686186909676, "num_tokens": 995580717.0, "step": 31194 }, { "entropy": 0.4865074912086129, "epoch": 2.8701042547196396, "grad_norm": 0.1570555716753006, "learning_rate": 4.333425338117583e-06, "loss": 0.4768, "mean_token_accuracy": 0.8499159775674343, "num_tokens": 995612708.0, "step": 31195 }, { "entropy": 0.5578481141710654, "epoch": 2.8701962610910803, "grad_norm": 0.1603919416666031, "learning_rate": 4.3303585119759565e-06, "loss": 0.5427, "mean_token_accuracy": 0.82754822447896, "num_tokens": 995644743.0, "step": 31196 }, { "entropy": 0.5155012449249625, "epoch": 2.870288267462522, "grad_norm": 0.16049902141094208, "learning_rate": 4.32729168583433e-06, "loss": 0.5023, "mean_token_accuracy": 0.8417127393186092, "num_tokens": 995676776.0, "step": 31197 }, { "entropy": 0.4790263641625643, "epoch": 2.870380273833963, "grad_norm": 0.15070278942584991, "learning_rate": 4.324224859692704e-06, "loss": 0.4586, "mean_token_accuracy": 0.853542648255825, "num_tokens": 995708696.0, "step": 31198 }, { "entropy": 0.413134076166898, "epoch": 2.870472280205404, "grad_norm": 0.14436504244804382, "learning_rate": 4.321158033551078e-06, "loss": 0.4019, "mean_token_accuracy": 0.8676903620362282, "num_tokens": 995740531.0, "step": 31199 }, { "entropy": 0.39088229509070516, "epoch": 2.8705642865768457, "grad_norm": 0.14023731648921967, "learning_rate": 4.318091207409452e-06, "loss": 0.3806, "mean_token_accuracy": 0.87609026953578, "num_tokens": 995772920.0, "step": 31200 }, { "entropy": 0.49430989602115005, "epoch": 2.8706562929482864, "grad_norm": 0.15551888942718506, "learning_rate": 4.3150243812678255e-06, "loss": 0.476, "mean_token_accuracy": 0.8490261808037758, "num_tokens": 995804663.0, "step": 31201 }, { "entropy": 0.52553017786704, "epoch": 2.870748299319728, "grad_norm": 0.15745334327220917, "learning_rate": 4.3119575551262e-06, "loss": 0.5113, "mean_token_accuracy": 0.8358984179794788, "num_tokens": 995836627.0, "step": 31202 }, { "entropy": 0.44715092750266194, "epoch": 2.870840305691169, "grad_norm": 0.14927688241004944, "learning_rate": 4.308890728984574e-06, "loss": 0.4302, "mean_token_accuracy": 0.8637816272675991, "num_tokens": 995868071.0, "step": 31203 }, { "entropy": 0.45800512097775936, "epoch": 2.8709323120626102, "grad_norm": 0.1475718468427658, "learning_rate": 4.305823902842948e-06, "loss": 0.4377, "mean_token_accuracy": 0.857784878462553, "num_tokens": 995899551.0, "step": 31204 }, { "entropy": 0.5379366278648376, "epoch": 2.871024318434052, "grad_norm": 0.1620662808418274, "learning_rate": 4.302757076701322e-06, "loss": 0.5303, "mean_token_accuracy": 0.8328554220497608, "num_tokens": 995931572.0, "step": 31205 }, { "entropy": 0.4652764042839408, "epoch": 2.8711163248054925, "grad_norm": 0.15103226900100708, "learning_rate": 4.299690250559696e-06, "loss": 0.4538, "mean_token_accuracy": 0.8524115905165672, "num_tokens": 995963612.0, "step": 31206 }, { "entropy": 0.5590747017413378, "epoch": 2.871208331176934, "grad_norm": 0.16561615467071533, "learning_rate": 4.29662342441807e-06, "loss": 0.546, "mean_token_accuracy": 0.8259571045637131, "num_tokens": 995995419.0, "step": 31207 }, { "entropy": 0.49856501538306475, "epoch": 2.871300337548375, "grad_norm": 0.1621222347021103, "learning_rate": 4.293556598276444e-06, "loss": 0.4879, "mean_token_accuracy": 0.8480130322277546, "num_tokens": 996026946.0, "step": 31208 }, { "entropy": 0.5491717983968556, "epoch": 2.8713923439198163, "grad_norm": 0.1648215800523758, "learning_rate": 4.290489772134818e-06, "loss": 0.5312, "mean_token_accuracy": 0.8291566446423531, "num_tokens": 996057895.0, "step": 31209 }, { "entropy": 0.5520942201837897, "epoch": 2.871484350291258, "grad_norm": 0.16221830248832703, "learning_rate": 4.287422945993192e-06, "loss": 0.5392, "mean_token_accuracy": 0.8292748108506203, "num_tokens": 996090112.0, "step": 31210 }, { "entropy": 0.6238908190280199, "epoch": 2.8715763566626986, "grad_norm": 0.16874873638153076, "learning_rate": 4.284356119851566e-06, "loss": 0.6177, "mean_token_accuracy": 0.8025118373334408, "num_tokens": 996121778.0, "step": 31211 }, { "entropy": 0.5588373923674226, "epoch": 2.87166836303414, "grad_norm": 0.16055719554424286, "learning_rate": 4.28128929370994e-06, "loss": 0.5473, "mean_token_accuracy": 0.828247245401144, "num_tokens": 996153927.0, "step": 31212 }, { "entropy": 0.5264856908470392, "epoch": 2.8717603694055813, "grad_norm": 0.15518039464950562, "learning_rate": 4.278222467568314e-06, "loss": 0.5064, "mean_token_accuracy": 0.8416153118014336, "num_tokens": 996186408.0, "step": 31213 }, { "entropy": 0.5317849311977625, "epoch": 2.8718523757770225, "grad_norm": 0.16391511261463165, "learning_rate": 4.2751556414266874e-06, "loss": 0.5242, "mean_token_accuracy": 0.8332283087074757, "num_tokens": 996218047.0, "step": 31214 }, { "entropy": 0.5392787461169064, "epoch": 2.871944382148464, "grad_norm": 0.16367653012275696, "learning_rate": 4.272088815285061e-06, "loss": 0.5297, "mean_token_accuracy": 0.8310276195406914, "num_tokens": 996248828.0, "step": 31215 }, { "entropy": 0.43933171639218926, "epoch": 2.8720363885199047, "grad_norm": 0.15139394998550415, "learning_rate": 4.269021989143435e-06, "loss": 0.4239, "mean_token_accuracy": 0.8609170690178871, "num_tokens": 996280489.0, "step": 31216 }, { "entropy": 0.5655048210173845, "epoch": 2.8721283948913463, "grad_norm": 0.16033893823623657, "learning_rate": 4.26595516300181e-06, "loss": 0.5529, "mean_token_accuracy": 0.8285175822675228, "num_tokens": 996312612.0, "step": 31217 }, { "entropy": 0.4265790390782058, "epoch": 2.8722204012627874, "grad_norm": 0.1493423581123352, "learning_rate": 4.2628883368601835e-06, "loss": 0.4206, "mean_token_accuracy": 0.8661077208817005, "num_tokens": 996344750.0, "step": 31218 }, { "entropy": 0.4763551829382777, "epoch": 2.8723124076342286, "grad_norm": 0.1558840274810791, "learning_rate": 4.259821510718557e-06, "loss": 0.4698, "mean_token_accuracy": 0.8481355607509613, "num_tokens": 996376183.0, "step": 31219 }, { "entropy": 0.4970233915373683, "epoch": 2.87240441400567, "grad_norm": 0.15635336935520172, "learning_rate": 4.256754684576932e-06, "loss": 0.4903, "mean_token_accuracy": 0.8435080423951149, "num_tokens": 996408576.0, "step": 31220 }, { "entropy": 0.4794151643291116, "epoch": 2.8724964203771113, "grad_norm": 0.15485717356204987, "learning_rate": 4.253687858435306e-06, "loss": 0.4617, "mean_token_accuracy": 0.8531177155673504, "num_tokens": 996441021.0, "step": 31221 }, { "entropy": 0.45831229351460934, "epoch": 2.8725884267485524, "grad_norm": 0.14997999370098114, "learning_rate": 4.2506210322936795e-06, "loss": 0.4485, "mean_token_accuracy": 0.8541617952287197, "num_tokens": 996473249.0, "step": 31222 }, { "entropy": 0.6029296461492777, "epoch": 2.8726804331199935, "grad_norm": 0.1659042090177536, "learning_rate": 4.247554206152053e-06, "loss": 0.5927, "mean_token_accuracy": 0.8156997710466385, "num_tokens": 996505697.0, "step": 31223 }, { "entropy": 0.5786794554442167, "epoch": 2.8727724394914347, "grad_norm": 0.16864532232284546, "learning_rate": 4.244487380010428e-06, "loss": 0.5655, "mean_token_accuracy": 0.8222114406526089, "num_tokens": 996537664.0, "step": 31224 }, { "entropy": 0.5361781022511423, "epoch": 2.8728644458628763, "grad_norm": 0.15700846910476685, "learning_rate": 4.241420553868802e-06, "loss": 0.5254, "mean_token_accuracy": 0.8306274004280567, "num_tokens": 996569915.0, "step": 31225 }, { "entropy": 0.4807998249307275, "epoch": 2.8729564522343174, "grad_norm": 0.15181167423725128, "learning_rate": 4.2383537277271756e-06, "loss": 0.4699, "mean_token_accuracy": 0.8478300496935844, "num_tokens": 996601892.0, "step": 31226 }, { "entropy": 0.4857446225360036, "epoch": 2.8730484586057585, "grad_norm": 0.15585225820541382, "learning_rate": 4.235286901585549e-06, "loss": 0.4812, "mean_token_accuracy": 0.8457190692424774, "num_tokens": 996633974.0, "step": 31227 }, { "entropy": 0.5513904355466366, "epoch": 2.8731404649771997, "grad_norm": 0.16239911317825317, "learning_rate": 4.232220075443923e-06, "loss": 0.5556, "mean_token_accuracy": 0.8291348218917847, "num_tokens": 996666479.0, "step": 31228 }, { "entropy": 0.594289917498827, "epoch": 2.873232471348641, "grad_norm": 0.17117489874362946, "learning_rate": 4.229153249302297e-06, "loss": 0.5982, "mean_token_accuracy": 0.8122495785355568, "num_tokens": 996698991.0, "step": 31229 }, { "entropy": 0.43455158127471805, "epoch": 2.8733244777200824, "grad_norm": 0.14761847257614136, "learning_rate": 4.226086423160671e-06, "loss": 0.4233, "mean_token_accuracy": 0.8634544536471367, "num_tokens": 996731180.0, "step": 31230 }, { "entropy": 0.4865298082586378, "epoch": 2.8734164840915235, "grad_norm": 0.15601183474063873, "learning_rate": 4.2230195970190446e-06, "loss": 0.4792, "mean_token_accuracy": 0.8450096361339092, "num_tokens": 996763258.0, "step": 31231 }, { "entropy": 0.3780389765743166, "epoch": 2.8735084904629646, "grad_norm": 0.13284042477607727, "learning_rate": 4.219952770877419e-06, "loss": 0.3704, "mean_token_accuracy": 0.8820306845009327, "num_tokens": 996795878.0, "step": 31232 }, { "entropy": 0.4830935993231833, "epoch": 2.8736004968344058, "grad_norm": 0.1589847356081009, "learning_rate": 4.216885944735793e-06, "loss": 0.4805, "mean_token_accuracy": 0.8485394828021526, "num_tokens": 996828050.0, "step": 31233 }, { "entropy": 0.5342163443565369, "epoch": 2.873692503205847, "grad_norm": 0.1621285229921341, "learning_rate": 4.213819118594167e-06, "loss": 0.5256, "mean_token_accuracy": 0.8334249034523964, "num_tokens": 996859820.0, "step": 31234 }, { "entropy": 0.45839804131537676, "epoch": 2.8737845095772885, "grad_norm": 0.15086272358894348, "learning_rate": 4.2107522924525415e-06, "loss": 0.4402, "mean_token_accuracy": 0.8574959337711334, "num_tokens": 996891738.0, "step": 31235 }, { "entropy": 0.492339376360178, "epoch": 2.8738765159487296, "grad_norm": 0.15063709020614624, "learning_rate": 4.207685466310915e-06, "loss": 0.48, "mean_token_accuracy": 0.8476428911089897, "num_tokens": 996924506.0, "step": 31236 }, { "entropy": 0.5705893728882074, "epoch": 2.8739685223201707, "grad_norm": 0.16704565286636353, "learning_rate": 4.204618640169289e-06, "loss": 0.5667, "mean_token_accuracy": 0.819702573120594, "num_tokens": 996956025.0, "step": 31237 }, { "entropy": 0.42346640583127737, "epoch": 2.874060528691612, "grad_norm": 0.14510485529899597, "learning_rate": 4.201551814027663e-06, "loss": 0.408, "mean_token_accuracy": 0.867692906409502, "num_tokens": 996988227.0, "step": 31238 }, { "entropy": 0.614421758800745, "epoch": 2.874152535063053, "grad_norm": 0.16994427144527435, "learning_rate": 4.198484987886037e-06, "loss": 0.6025, "mean_token_accuracy": 0.8106539286673069, "num_tokens": 997020437.0, "step": 31239 }, { "entropy": 0.5144102121703327, "epoch": 2.8742445414344946, "grad_norm": 0.15147651731967926, "learning_rate": 4.195418161744411e-06, "loss": 0.5023, "mean_token_accuracy": 0.8406936638057232, "num_tokens": 997052267.0, "step": 31240 }, { "entropy": 0.521929457783699, "epoch": 2.8743365478059357, "grad_norm": 0.16289810836315155, "learning_rate": 4.192351335602785e-06, "loss": 0.5048, "mean_token_accuracy": 0.8410388678312302, "num_tokens": 997082941.0, "step": 31241 }, { "entropy": 0.5551186744123697, "epoch": 2.874428554177377, "grad_norm": 0.15773098170757294, "learning_rate": 4.189284509461159e-06, "loss": 0.5418, "mean_token_accuracy": 0.8300276771187782, "num_tokens": 997114897.0, "step": 31242 }, { "entropy": 0.6316133057698607, "epoch": 2.874520560548818, "grad_norm": 0.1747281700372696, "learning_rate": 4.186217683319533e-06, "loss": 0.6107, "mean_token_accuracy": 0.8068725913763046, "num_tokens": 997146321.0, "step": 31243 }, { "entropy": 0.523737951181829, "epoch": 2.874612566920259, "grad_norm": 0.1602228879928589, "learning_rate": 4.1831508571779065e-06, "loss": 0.5027, "mean_token_accuracy": 0.8405417539179325, "num_tokens": 997177729.0, "step": 31244 }, { "entropy": 0.5394886825233698, "epoch": 2.8747045732917007, "grad_norm": 0.16572622954845428, "learning_rate": 4.18008403103628e-06, "loss": 0.5248, "mean_token_accuracy": 0.831692535430193, "num_tokens": 997208984.0, "step": 31245 }, { "entropy": 0.4060301352292299, "epoch": 2.874796579663142, "grad_norm": 0.14368648827075958, "learning_rate": 4.177017204894654e-06, "loss": 0.3993, "mean_token_accuracy": 0.8690629042685032, "num_tokens": 997240649.0, "step": 31246 }, { "entropy": 0.5048107001930475, "epoch": 2.874888586034583, "grad_norm": 0.15899351239204407, "learning_rate": 4.173950378753029e-06, "loss": 0.4843, "mean_token_accuracy": 0.8425822965800762, "num_tokens": 997272892.0, "step": 31247 }, { "entropy": 0.4615498948842287, "epoch": 2.874980592406024, "grad_norm": 0.15122875571250916, "learning_rate": 4.1708835526114026e-06, "loss": 0.4505, "mean_token_accuracy": 0.8548302948474884, "num_tokens": 997305272.0, "step": 31248 }, { "entropy": 0.5335235139355063, "epoch": 2.8750725987774652, "grad_norm": 0.15999968349933624, "learning_rate": 4.167816726469776e-06, "loss": 0.5291, "mean_token_accuracy": 0.8336076363921165, "num_tokens": 997337462.0, "step": 31249 }, { "entropy": 0.5110153055284172, "epoch": 2.875164605148907, "grad_norm": 0.15331892669200897, "learning_rate": 4.164749900328151e-06, "loss": 0.5054, "mean_token_accuracy": 0.8400247246026993, "num_tokens": 997369633.0, "step": 31250 }, { "entropy": 0.5344690689817071, "epoch": 2.875256611520348, "grad_norm": 0.15900681912899017, "learning_rate": 4.161683074186525e-06, "loss": 0.5308, "mean_token_accuracy": 0.8355192691087723, "num_tokens": 997401871.0, "step": 31251 }, { "entropy": 0.5533622878137976, "epoch": 2.875348617891789, "grad_norm": 0.16592776775360107, "learning_rate": 4.158616248044899e-06, "loss": 0.543, "mean_token_accuracy": 0.8315554298460484, "num_tokens": 997433562.0, "step": 31252 }, { "entropy": 0.49935809848830104, "epoch": 2.87544062426323, "grad_norm": 0.15741579234600067, "learning_rate": 4.155549421903272e-06, "loss": 0.4809, "mean_token_accuracy": 0.8469501435756683, "num_tokens": 997465598.0, "step": 31253 }, { "entropy": 0.5242416225373745, "epoch": 2.8755326306346713, "grad_norm": 0.1573609560728073, "learning_rate": 4.152482595761646e-06, "loss": 0.5095, "mean_token_accuracy": 0.8376751691102982, "num_tokens": 997497696.0, "step": 31254 }, { "entropy": 0.5249722963199019, "epoch": 2.875624637006113, "grad_norm": 0.15829946100711823, "learning_rate": 4.149415769620021e-06, "loss": 0.5163, "mean_token_accuracy": 0.8352988213300705, "num_tokens": 997530023.0, "step": 31255 }, { "entropy": 0.4910608073696494, "epoch": 2.875716643377554, "grad_norm": 0.1577412486076355, "learning_rate": 4.146348943478395e-06, "loss": 0.4817, "mean_token_accuracy": 0.8453929089009762, "num_tokens": 997562710.0, "step": 31256 }, { "entropy": 0.5786822235677391, "epoch": 2.875808649748995, "grad_norm": 0.1627744734287262, "learning_rate": 4.1432821173367685e-06, "loss": 0.5563, "mean_token_accuracy": 0.8235183916985989, "num_tokens": 997594825.0, "step": 31257 }, { "entropy": 0.48405909165740013, "epoch": 2.8759006561204363, "grad_norm": 0.15072619915008545, "learning_rate": 4.140215291195142e-06, "loss": 0.4774, "mean_token_accuracy": 0.8466893769800663, "num_tokens": 997626689.0, "step": 31258 }, { "entropy": 0.46814881917089224, "epoch": 2.8759926624918775, "grad_norm": 0.15089735388755798, "learning_rate": 4.137148465053516e-06, "loss": 0.4584, "mean_token_accuracy": 0.8526739776134491, "num_tokens": 997659050.0, "step": 31259 }, { "entropy": 0.545580554753542, "epoch": 2.876084668863319, "grad_norm": 0.16800086200237274, "learning_rate": 4.13408163891189e-06, "loss": 0.5224, "mean_token_accuracy": 0.8328114710748196, "num_tokens": 997688686.0, "step": 31260 }, { "entropy": 0.5433481093496084, "epoch": 2.87617667523476, "grad_norm": 0.1642759144306183, "learning_rate": 4.131014812770264e-06, "loss": 0.5345, "mean_token_accuracy": 0.8278446905314922, "num_tokens": 997720316.0, "step": 31261 }, { "entropy": 0.4900012437719852, "epoch": 2.8762686816062013, "grad_norm": 0.15345865488052368, "learning_rate": 4.1279479866286375e-06, "loss": 0.4823, "mean_token_accuracy": 0.8492505773901939, "num_tokens": 997753037.0, "step": 31262 }, { "entropy": 0.5303038069978356, "epoch": 2.8763606879776424, "grad_norm": 0.1529984027147293, "learning_rate": 4.124881160487012e-06, "loss": 0.5129, "mean_token_accuracy": 0.836335513740778, "num_tokens": 997785549.0, "step": 31263 }, { "entropy": 0.532194547355175, "epoch": 2.8764526943490836, "grad_norm": 0.1619383543729782, "learning_rate": 4.121814334345386e-06, "loss": 0.5262, "mean_token_accuracy": 0.8371518403291702, "num_tokens": 997817568.0, "step": 31264 }, { "entropy": 0.5595115553587675, "epoch": 2.876544700720525, "grad_norm": 0.16682428121566772, "learning_rate": 4.1187475082037606e-06, "loss": 0.547, "mean_token_accuracy": 0.825828094035387, "num_tokens": 997848823.0, "step": 31265 }, { "entropy": 0.5054666826035827, "epoch": 2.8766367070919663, "grad_norm": 0.1596326231956482, "learning_rate": 4.115680682062134e-06, "loss": 0.4892, "mean_token_accuracy": 0.8446760252118111, "num_tokens": 997880056.0, "step": 31266 }, { "entropy": 0.5175486076623201, "epoch": 2.8767287134634074, "grad_norm": 0.1595136672258377, "learning_rate": 4.112613855920508e-06, "loss": 0.5062, "mean_token_accuracy": 0.8411890715360641, "num_tokens": 997911531.0, "step": 31267 }, { "entropy": 0.4841271201148629, "epoch": 2.8768207198348485, "grad_norm": 0.14960187673568726, "learning_rate": 4.109547029778882e-06, "loss": 0.4636, "mean_token_accuracy": 0.8519152849912643, "num_tokens": 997942973.0, "step": 31268 }, { "entropy": 0.622483154758811, "epoch": 2.8769127262062897, "grad_norm": 0.17019395530223846, "learning_rate": 4.106480203637256e-06, "loss": 0.614, "mean_token_accuracy": 0.8099816590547562, "num_tokens": 997975120.0, "step": 31269 }, { "entropy": 0.5041049437131733, "epoch": 2.8770047325777313, "grad_norm": 0.1555529534816742, "learning_rate": 4.10341337749563e-06, "loss": 0.49, "mean_token_accuracy": 0.8449587300419807, "num_tokens": 998007447.0, "step": 31270 }, { "entropy": 0.5493228696286678, "epoch": 2.8770967389491724, "grad_norm": 0.16898302733898163, "learning_rate": 4.100346551354004e-06, "loss": 0.5459, "mean_token_accuracy": 0.8244623057544231, "num_tokens": 998039631.0, "step": 31271 }, { "entropy": 0.44119550473988056, "epoch": 2.8771887453206135, "grad_norm": 0.15223196148872375, "learning_rate": 4.097279725212378e-06, "loss": 0.4317, "mean_token_accuracy": 0.8603708446025848, "num_tokens": 998071152.0, "step": 31272 }, { "entropy": 0.5013704965822399, "epoch": 2.8772807516920547, "grad_norm": 0.15424032509326935, "learning_rate": 4.094212899070752e-06, "loss": 0.4875, "mean_token_accuracy": 0.8437557145953178, "num_tokens": 998103227.0, "step": 31273 }, { "entropy": 0.5156728029251099, "epoch": 2.877372758063496, "grad_norm": 0.15906314551830292, "learning_rate": 4.091146072929126e-06, "loss": 0.5059, "mean_token_accuracy": 0.8392297364771366, "num_tokens": 998134561.0, "step": 31274 }, { "entropy": 0.4793338980525732, "epoch": 2.8774647644349374, "grad_norm": 0.15442131459712982, "learning_rate": 4.088079246787499e-06, "loss": 0.4732, "mean_token_accuracy": 0.8495701476931572, "num_tokens": 998166986.0, "step": 31275 }, { "entropy": 0.4848207300528884, "epoch": 2.8775567708063785, "grad_norm": 0.15594668686389923, "learning_rate": 4.085012420645873e-06, "loss": 0.4747, "mean_token_accuracy": 0.8464813865721226, "num_tokens": 998199307.0, "step": 31276 }, { "entropy": 0.5108547806739807, "epoch": 2.8776487771778196, "grad_norm": 0.1633753776550293, "learning_rate": 4.081945594504247e-06, "loss": 0.5095, "mean_token_accuracy": 0.8395392522215843, "num_tokens": 998230344.0, "step": 31277 }, { "entropy": 0.5361057259142399, "epoch": 2.8777407835492608, "grad_norm": 0.15970903635025024, "learning_rate": 4.078878768362622e-06, "loss": 0.5251, "mean_token_accuracy": 0.8326511159539223, "num_tokens": 998262280.0, "step": 31278 }, { "entropy": 0.49110369582194835, "epoch": 2.877832789920702, "grad_norm": 0.1559518426656723, "learning_rate": 4.0758119422209955e-06, "loss": 0.4868, "mean_token_accuracy": 0.8460261411964893, "num_tokens": 998294620.0, "step": 31279 }, { "entropy": 0.5236918982118368, "epoch": 2.8779247962921435, "grad_norm": 0.16085156798362732, "learning_rate": 4.07274511607937e-06, "loss": 0.5029, "mean_token_accuracy": 0.8396500535309315, "num_tokens": 998326142.0, "step": 31280 }, { "entropy": 0.5397739774780348, "epoch": 2.8780168026635846, "grad_norm": 0.17064109444618225, "learning_rate": 4.069678289937744e-06, "loss": 0.5441, "mean_token_accuracy": 0.8240397460758686, "num_tokens": 998357001.0, "step": 31281 }, { "entropy": 0.4082274080719799, "epoch": 2.8781088090350258, "grad_norm": 0.14522093534469604, "learning_rate": 4.066611463796118e-06, "loss": 0.3878, "mean_token_accuracy": 0.8740737922489643, "num_tokens": 998388616.0, "step": 31282 }, { "entropy": 0.4451181956101209, "epoch": 2.878200815406467, "grad_norm": 0.14908266067504883, "learning_rate": 4.0635446376544915e-06, "loss": 0.4262, "mean_token_accuracy": 0.8633779212832451, "num_tokens": 998419858.0, "step": 31283 }, { "entropy": 0.5758809766266495, "epoch": 2.878292821777908, "grad_norm": 0.16633547842502594, "learning_rate": 4.060477811512865e-06, "loss": 0.5685, "mean_token_accuracy": 0.8231260403990746, "num_tokens": 998452465.0, "step": 31284 }, { "entropy": 0.5311901327222586, "epoch": 2.8783848281493496, "grad_norm": 0.16250966489315033, "learning_rate": 4.05741098537124e-06, "loss": 0.5135, "mean_token_accuracy": 0.8371080793440342, "num_tokens": 998484450.0, "step": 31285 }, { "entropy": 0.4894248126074672, "epoch": 2.8784768345207907, "grad_norm": 0.15893715620040894, "learning_rate": 4.054344159229614e-06, "loss": 0.4754, "mean_token_accuracy": 0.8495708480477333, "num_tokens": 998515953.0, "step": 31286 }, { "entropy": 0.508858148008585, "epoch": 2.878568840892232, "grad_norm": 0.17616601288318634, "learning_rate": 4.0512773330879876e-06, "loss": 0.4837, "mean_token_accuracy": 0.8445065282285213, "num_tokens": 998547715.0, "step": 31287 }, { "entropy": 0.5803709756582975, "epoch": 2.878660847263673, "grad_norm": 0.16744501888751984, "learning_rate": 4.048210506946361e-06, "loss": 0.5573, "mean_token_accuracy": 0.8238446712493896, "num_tokens": 998579640.0, "step": 31288 }, { "entropy": 0.5555455880239606, "epoch": 2.878752853635114, "grad_norm": 0.16587890684604645, "learning_rate": 4.045143680804735e-06, "loss": 0.5423, "mean_token_accuracy": 0.8310403451323509, "num_tokens": 998611098.0, "step": 31289 }, { "entropy": 0.4406985864043236, "epoch": 2.8788448600065557, "grad_norm": 0.15021689236164093, "learning_rate": 4.042076854663109e-06, "loss": 0.437, "mean_token_accuracy": 0.8579268045723438, "num_tokens": 998642633.0, "step": 31290 }, { "entropy": 0.5502172168344259, "epoch": 2.878936866377997, "grad_norm": 0.16164661943912506, "learning_rate": 4.039010028521483e-06, "loss": 0.5375, "mean_token_accuracy": 0.8305261731147766, "num_tokens": 998674457.0, "step": 31291 }, { "entropy": 0.5258241882547736, "epoch": 2.879028872749438, "grad_norm": 0.15715518593788147, "learning_rate": 4.0359432023798566e-06, "loss": 0.5065, "mean_token_accuracy": 0.8353083357214928, "num_tokens": 998706919.0, "step": 31292 }, { "entropy": 0.5435229651629925, "epoch": 2.879120879120879, "grad_norm": 0.1662316918373108, "learning_rate": 4.032876376238231e-06, "loss": 0.5303, "mean_token_accuracy": 0.8336584493517876, "num_tokens": 998738590.0, "step": 31293 }, { "entropy": 0.4696411266922951, "epoch": 2.8792128854923202, "grad_norm": 0.1491681933403015, "learning_rate": 4.029809550096605e-06, "loss": 0.4606, "mean_token_accuracy": 0.8496014550328255, "num_tokens": 998770591.0, "step": 31294 }, { "entropy": 0.604468896985054, "epoch": 2.879304891863762, "grad_norm": 0.16786432266235352, "learning_rate": 4.02674272395498e-06, "loss": 0.5858, "mean_token_accuracy": 0.8188901618123055, "num_tokens": 998802652.0, "step": 31295 }, { "entropy": 0.5545415785163641, "epoch": 2.879396898235203, "grad_norm": 0.16648411750793457, "learning_rate": 4.0236758978133535e-06, "loss": 0.5522, "mean_token_accuracy": 0.825324285775423, "num_tokens": 998834014.0, "step": 31296 }, { "entropy": 0.6097477450966835, "epoch": 2.879488904606644, "grad_norm": 0.17000553011894226, "learning_rate": 4.020609071671727e-06, "loss": 0.5937, "mean_token_accuracy": 0.8139801695942879, "num_tokens": 998866099.0, "step": 31297 }, { "entropy": 0.5811591614037752, "epoch": 2.879580910978085, "grad_norm": 0.1662900447845459, "learning_rate": 4.017542245530101e-06, "loss": 0.5609, "mean_token_accuracy": 0.8229537457227707, "num_tokens": 998897243.0, "step": 31298 }, { "entropy": 0.5647624358534813, "epoch": 2.8796729173495264, "grad_norm": 0.16905628144741058, "learning_rate": 4.014475419388475e-06, "loss": 0.5419, "mean_token_accuracy": 0.826876986771822, "num_tokens": 998928649.0, "step": 31299 }, { "entropy": 0.4643087845761329, "epoch": 2.879764923720968, "grad_norm": 0.15087509155273438, "learning_rate": 4.011408593246849e-06, "loss": 0.4544, "mean_token_accuracy": 0.8560409694910049, "num_tokens": 998960390.0, "step": 31300 }, { "entropy": 0.44931311602704227, "epoch": 2.879856930092409, "grad_norm": 0.15146410465240479, "learning_rate": 4.008341767105223e-06, "loss": 0.4406, "mean_token_accuracy": 0.8609739057719707, "num_tokens": 998992865.0, "step": 31301 }, { "entropy": 0.5031686236616224, "epoch": 2.87994893646385, "grad_norm": 0.15608350932598114, "learning_rate": 4.005274940963597e-06, "loss": 0.495, "mean_token_accuracy": 0.8457356914877892, "num_tokens": 999025031.0, "step": 31302 }, { "entropy": 0.5622586570680141, "epoch": 2.8800409428352913, "grad_norm": 0.17077511548995972, "learning_rate": 4.002208114821971e-06, "loss": 0.5659, "mean_token_accuracy": 0.8260948359966278, "num_tokens": 999057391.0, "step": 31303 }, { "entropy": 0.593403865583241, "epoch": 2.8801329492067325, "grad_norm": 0.17045412957668304, "learning_rate": 3.999141288680345e-06, "loss": 0.5871, "mean_token_accuracy": 0.8152286410331726, "num_tokens": 999089019.0, "step": 31304 }, { "entropy": 0.5495115965604782, "epoch": 2.880224955578174, "grad_norm": 0.16491472721099854, "learning_rate": 3.9960744625387185e-06, "loss": 0.5249, "mean_token_accuracy": 0.8317015320062637, "num_tokens": 999119695.0, "step": 31305 }, { "entropy": 0.5110496655106544, "epoch": 2.880316961949615, "grad_norm": 0.1539221704006195, "learning_rate": 3.993007636397092e-06, "loss": 0.5007, "mean_token_accuracy": 0.84166194871068, "num_tokens": 999152330.0, "step": 31306 }, { "entropy": 0.5230075367726386, "epoch": 2.8804089683210563, "grad_norm": 0.15523354709148407, "learning_rate": 3.989940810255466e-06, "loss": 0.5001, "mean_token_accuracy": 0.8382917307317257, "num_tokens": 999183847.0, "step": 31307 }, { "entropy": 0.4677544068545103, "epoch": 2.8805009746924974, "grad_norm": 0.1548316478729248, "learning_rate": 3.986873984113841e-06, "loss": 0.4489, "mean_token_accuracy": 0.8529916852712631, "num_tokens": 999215277.0, "step": 31308 }, { "entropy": 0.4481594869866967, "epoch": 2.8805929810639386, "grad_norm": 0.14918948709964752, "learning_rate": 3.9838071579722146e-06, "loss": 0.4373, "mean_token_accuracy": 0.8586076013743877, "num_tokens": 999247419.0, "step": 31309 }, { "entropy": 0.5124827465042472, "epoch": 2.88068498743538, "grad_norm": 0.1658295840024948, "learning_rate": 3.980740331830589e-06, "loss": 0.5071, "mean_token_accuracy": 0.8435980528593063, "num_tokens": 999278156.0, "step": 31310 }, { "entropy": 0.4436284340918064, "epoch": 2.8807769938068213, "grad_norm": 0.14569304883480072, "learning_rate": 3.977673505688963e-06, "loss": 0.4335, "mean_token_accuracy": 0.8613918088376522, "num_tokens": 999310415.0, "step": 31311 }, { "entropy": 0.45013231597840786, "epoch": 2.8808690001782624, "grad_norm": 0.14795148372650146, "learning_rate": 3.974606679547337e-06, "loss": 0.4257, "mean_token_accuracy": 0.8614009618759155, "num_tokens": 999342456.0, "step": 31312 }, { "entropy": 0.4766194950789213, "epoch": 2.8809610065497036, "grad_norm": 0.15573373436927795, "learning_rate": 3.971539853405711e-06, "loss": 0.4539, "mean_token_accuracy": 0.8555333130061626, "num_tokens": 999373784.0, "step": 31313 }, { "entropy": 0.4738125381991267, "epoch": 2.8810530129211447, "grad_norm": 0.15539449453353882, "learning_rate": 3.968473027264084e-06, "loss": 0.4606, "mean_token_accuracy": 0.8538845479488373, "num_tokens": 999405798.0, "step": 31314 }, { "entropy": 0.4475711612030864, "epoch": 2.8811450192925863, "grad_norm": 0.14801909029483795, "learning_rate": 3.965406201122458e-06, "loss": 0.4304, "mean_token_accuracy": 0.8617581874132156, "num_tokens": 999437991.0, "step": 31315 }, { "entropy": 0.4664712288649753, "epoch": 2.8812370256640274, "grad_norm": 0.1557716578245163, "learning_rate": 3.962339374980833e-06, "loss": 0.4567, "mean_token_accuracy": 0.8547178879380226, "num_tokens": 999469598.0, "step": 31316 }, { "entropy": 0.544954190030694, "epoch": 2.8813290320354685, "grad_norm": 0.16157203912734985, "learning_rate": 3.959272548839207e-06, "loss": 0.5388, "mean_token_accuracy": 0.8309501595795155, "num_tokens": 999501360.0, "step": 31317 }, { "entropy": 0.5481997635215521, "epoch": 2.8814210384069097, "grad_norm": 0.16234320402145386, "learning_rate": 3.9562057226975805e-06, "loss": 0.5454, "mean_token_accuracy": 0.8268891796469688, "num_tokens": 999533312.0, "step": 31318 }, { "entropy": 0.5121154161170125, "epoch": 2.881513044778351, "grad_norm": 0.15037237107753754, "learning_rate": 3.953138896555954e-06, "loss": 0.4977, "mean_token_accuracy": 0.8433976769447327, "num_tokens": 999565804.0, "step": 31319 }, { "entropy": 0.5800366662442684, "epoch": 2.8816050511497924, "grad_norm": 0.1651807725429535, "learning_rate": 3.950072070414328e-06, "loss": 0.5578, "mean_token_accuracy": 0.8218883015215397, "num_tokens": 999597968.0, "step": 31320 }, { "entropy": 0.49190973676741123, "epoch": 2.8816970575212335, "grad_norm": 0.15593954920768738, "learning_rate": 3.947005244272702e-06, "loss": 0.4916, "mean_token_accuracy": 0.8460346348583698, "num_tokens": 999630528.0, "step": 31321 }, { "entropy": 0.5653857411816716, "epoch": 2.8817890638926746, "grad_norm": 0.16716259717941284, "learning_rate": 3.943938418131076e-06, "loss": 0.5452, "mean_token_accuracy": 0.8266244679689407, "num_tokens": 999662048.0, "step": 31322 }, { "entropy": 0.5570958770113066, "epoch": 2.8818810702641158, "grad_norm": 0.16258499026298523, "learning_rate": 3.94087159198945e-06, "loss": 0.5456, "mean_token_accuracy": 0.8289714269340038, "num_tokens": 999693789.0, "step": 31323 }, { "entropy": 0.53520926553756, "epoch": 2.881973076635557, "grad_norm": 0.1612854152917862, "learning_rate": 3.937804765847824e-06, "loss": 0.5331, "mean_token_accuracy": 0.8303773477673531, "num_tokens": 999725874.0, "step": 31324 }, { "entropy": 0.41958001954481006, "epoch": 2.8820650830069985, "grad_norm": 0.15103179216384888, "learning_rate": 3.934737939706199e-06, "loss": 0.4132, "mean_token_accuracy": 0.8642576038837433, "num_tokens": 999757720.0, "step": 31325 }, { "entropy": 0.3282533483579755, "epoch": 2.8821570893784396, "grad_norm": 0.12896113097667694, "learning_rate": 3.9316711135645726e-06, "loss": 0.3171, "mean_token_accuracy": 0.8975245393812656, "num_tokens": 999790075.0, "step": 31326 }, { "entropy": 0.4618805437348783, "epoch": 2.8822490957498808, "grad_norm": 0.1543899029493332, "learning_rate": 3.928604287422946e-06, "loss": 0.4426, "mean_token_accuracy": 0.8573475480079651, "num_tokens": 999821761.0, "step": 31327 }, { "entropy": 0.48334518168121576, "epoch": 2.882341102121322, "grad_norm": 0.15031851828098297, "learning_rate": 3.92553746128132e-06, "loss": 0.458, "mean_token_accuracy": 0.8510084263980389, "num_tokens": 999853816.0, "step": 31328 }, { "entropy": 0.5076165767386556, "epoch": 2.882433108492763, "grad_norm": 0.15211182832717896, "learning_rate": 3.922470635139694e-06, "loss": 0.5014, "mean_token_accuracy": 0.8421941362321377, "num_tokens": 999885981.0, "step": 31329 }, { "entropy": 0.46056328620761633, "epoch": 2.8825251148642046, "grad_norm": 0.15504871308803558, "learning_rate": 3.919403808998068e-06, "loss": 0.4537, "mean_token_accuracy": 0.8555531539022923, "num_tokens": 999918291.0, "step": 31330 }, { "entropy": 0.5924987886101007, "epoch": 2.8826171212356457, "grad_norm": 0.16703715920448303, "learning_rate": 3.916336982856442e-06, "loss": 0.5718, "mean_token_accuracy": 0.819462563842535, "num_tokens": 999949743.0, "step": 31331 }, { "entropy": 0.5743249375373125, "epoch": 2.882709127607087, "grad_norm": 0.1661352962255478, "learning_rate": 3.913270156714816e-06, "loss": 0.5641, "mean_token_accuracy": 0.8220742046833038, "num_tokens": 999981227.0, "step": 31332 }, { "entropy": 0.5035208500921726, "epoch": 2.882801133978528, "grad_norm": 0.1529919058084488, "learning_rate": 3.91020333057319e-06, "loss": 0.4884, "mean_token_accuracy": 0.8453472293913364, "num_tokens": 1000013251.0, "step": 31333 }, { "entropy": 0.42084903991781175, "epoch": 2.882893140349969, "grad_norm": 0.1475006639957428, "learning_rate": 3.907136504431564e-06, "loss": 0.4042, "mean_token_accuracy": 0.8713021986186504, "num_tokens": 1000045441.0, "step": 31334 }, { "entropy": 0.5573714142665267, "epoch": 2.8829851467214107, "grad_norm": 0.16773557662963867, "learning_rate": 3.904069678289938e-06, "loss": 0.5392, "mean_token_accuracy": 0.8296543546020985, "num_tokens": 1000076379.0, "step": 31335 }, { "entropy": 0.4662314420565963, "epoch": 2.883077153092852, "grad_norm": 0.15170705318450928, "learning_rate": 3.901002852148311e-06, "loss": 0.4515, "mean_token_accuracy": 0.8557563535869122, "num_tokens": 1000107872.0, "step": 31336 }, { "entropy": 0.4783631367608905, "epoch": 2.883169159464293, "grad_norm": 0.14803795516490936, "learning_rate": 3.897936026006685e-06, "loss": 0.4576, "mean_token_accuracy": 0.8552236594259739, "num_tokens": 1000139544.0, "step": 31337 }, { "entropy": 0.49596782051958144, "epoch": 2.883261165835734, "grad_norm": 0.1585795283317566, "learning_rate": 3.89486919986506e-06, "loss": 0.4796, "mean_token_accuracy": 0.8471024073660374, "num_tokens": 1000171168.0, "step": 31338 }, { "entropy": 0.48750976473093033, "epoch": 2.8833531722071752, "grad_norm": 0.16297228634357452, "learning_rate": 3.8918023737234345e-06, "loss": 0.4898, "mean_token_accuracy": 0.8465131968259811, "num_tokens": 1000203049.0, "step": 31339 }, { "entropy": 0.4553116918541491, "epoch": 2.883445178578617, "grad_norm": 0.1473173350095749, "learning_rate": 3.888735547581808e-06, "loss": 0.4457, "mean_token_accuracy": 0.8573811165988445, "num_tokens": 1000235465.0, "step": 31340 }, { "entropy": 0.5577451396966353, "epoch": 2.883537184950058, "grad_norm": 0.16841186583042145, "learning_rate": 3.885668721440182e-06, "loss": 0.5542, "mean_token_accuracy": 0.8279734887182713, "num_tokens": 1000266833.0, "step": 31341 }, { "entropy": 0.4646059329388663, "epoch": 2.883629191321499, "grad_norm": 0.1496892273426056, "learning_rate": 3.882601895298556e-06, "loss": 0.4539, "mean_token_accuracy": 0.8533219881355762, "num_tokens": 1000299011.0, "step": 31342 }, { "entropy": 0.4529569330625236, "epoch": 2.88372119769294, "grad_norm": 0.15390510857105255, "learning_rate": 3.87953506915693e-06, "loss": 0.445, "mean_token_accuracy": 0.8580760769546032, "num_tokens": 1000331297.0, "step": 31343 }, { "entropy": 0.5762043062131852, "epoch": 2.8838132040643814, "grad_norm": 0.1669618934392929, "learning_rate": 3.8764682430153035e-06, "loss": 0.5682, "mean_token_accuracy": 0.8216305561363697, "num_tokens": 1000363167.0, "step": 31344 }, { "entropy": 0.5664607379585505, "epoch": 2.883905210435823, "grad_norm": 0.16429747641086578, "learning_rate": 3.873401416873677e-06, "loss": 0.5595, "mean_token_accuracy": 0.823222778737545, "num_tokens": 1000394953.0, "step": 31345 }, { "entropy": 0.4658992630429566, "epoch": 2.883997216807264, "grad_norm": 0.15182535350322723, "learning_rate": 3.870334590732052e-06, "loss": 0.4546, "mean_token_accuracy": 0.8552075885236263, "num_tokens": 1000426819.0, "step": 31346 }, { "entropy": 0.5108497987966985, "epoch": 2.884089223178705, "grad_norm": 0.1574421375989914, "learning_rate": 3.867267764590426e-06, "loss": 0.4931, "mean_token_accuracy": 0.8432298712432384, "num_tokens": 1000458269.0, "step": 31347 }, { "entropy": 0.5094836074858904, "epoch": 2.8841812295501463, "grad_norm": 0.16614863276481628, "learning_rate": 3.8642009384487996e-06, "loss": 0.5016, "mean_token_accuracy": 0.8414914645254612, "num_tokens": 1000489863.0, "step": 31348 }, { "entropy": 0.5228829374536872, "epoch": 2.8842732359215875, "grad_norm": 0.15995804965496063, "learning_rate": 3.861134112307173e-06, "loss": 0.5051, "mean_token_accuracy": 0.8373846486210823, "num_tokens": 1000521197.0, "step": 31349 }, { "entropy": 0.5211272407323122, "epoch": 2.884365242293029, "grad_norm": 0.1603499948978424, "learning_rate": 3.858067286165547e-06, "loss": 0.5164, "mean_token_accuracy": 0.8354693613946438, "num_tokens": 1000553773.0, "step": 31350 }, { "entropy": 0.5542767755687237, "epoch": 2.88445724866447, "grad_norm": 0.1696052998304367, "learning_rate": 3.855000460023921e-06, "loss": 0.5465, "mean_token_accuracy": 0.8246998600661755, "num_tokens": 1000584721.0, "step": 31351 }, { "entropy": 0.512807235121727, "epoch": 2.8845492550359113, "grad_norm": 0.15926523506641388, "learning_rate": 3.851933633882296e-06, "loss": 0.504, "mean_token_accuracy": 0.8391728177666664, "num_tokens": 1000616797.0, "step": 31352 }, { "entropy": 0.5093614235520363, "epoch": 2.8846412614073524, "grad_norm": 0.16057150065898895, "learning_rate": 3.848866807740669e-06, "loss": 0.4857, "mean_token_accuracy": 0.8470631390810013, "num_tokens": 1000648424.0, "step": 31353 }, { "entropy": 0.464734866283834, "epoch": 2.8847332677787936, "grad_norm": 0.15297754108905792, "learning_rate": 3.845799981599044e-06, "loss": 0.4499, "mean_token_accuracy": 0.8583525456488132, "num_tokens": 1000680399.0, "step": 31354 }, { "entropy": 0.46068653278052807, "epoch": 2.884825274150235, "grad_norm": 0.15263864398002625, "learning_rate": 3.842733155457418e-06, "loss": 0.4446, "mean_token_accuracy": 0.8562167808413506, "num_tokens": 1000712477.0, "step": 31355 }, { "entropy": 0.4661556165665388, "epoch": 2.8849172805216763, "grad_norm": 0.1605611890554428, "learning_rate": 3.839666329315792e-06, "loss": 0.4595, "mean_token_accuracy": 0.8492453619837761, "num_tokens": 1000743830.0, "step": 31356 }, { "entropy": 0.5090312091633677, "epoch": 2.8850092868931174, "grad_norm": 0.15661554038524628, "learning_rate": 3.8365995031741655e-06, "loss": 0.5025, "mean_token_accuracy": 0.8369695730507374, "num_tokens": 1000776216.0, "step": 31357 }, { "entropy": 0.3857209477573633, "epoch": 2.8851012932645586, "grad_norm": 0.13816706836223602, "learning_rate": 3.833532677032539e-06, "loss": 0.3632, "mean_token_accuracy": 0.8802574388682842, "num_tokens": 1000807934.0, "step": 31358 }, { "entropy": 0.5808370588347316, "epoch": 2.8851932996359997, "grad_norm": 0.16279934346675873, "learning_rate": 3.830465850890913e-06, "loss": 0.5701, "mean_token_accuracy": 0.8214392922818661, "num_tokens": 1000840016.0, "step": 31359 }, { "entropy": 0.5106098770629615, "epoch": 2.8852853060074413, "grad_norm": 0.16140003502368927, "learning_rate": 3.827399024749287e-06, "loss": 0.5024, "mean_token_accuracy": 0.8398513346910477, "num_tokens": 1000871696.0, "step": 31360 }, { "entropy": 0.46563585940748453, "epoch": 2.8853773123788824, "grad_norm": 0.1532893031835556, "learning_rate": 3.824332198607661e-06, "loss": 0.4594, "mean_token_accuracy": 0.8528696484863758, "num_tokens": 1000904363.0, "step": 31361 }, { "entropy": 0.4816677989438176, "epoch": 2.8854693187503235, "grad_norm": 0.15487657487392426, "learning_rate": 3.821265372466035e-06, "loss": 0.4713, "mean_token_accuracy": 0.8489088229835033, "num_tokens": 1000936351.0, "step": 31362 }, { "entropy": 0.5624307952821255, "epoch": 2.8855613251217647, "grad_norm": 0.1681782603263855, "learning_rate": 3.818198546324409e-06, "loss": 0.5512, "mean_token_accuracy": 0.8256294839084148, "num_tokens": 1000967619.0, "step": 31363 }, { "entropy": 0.4686747780069709, "epoch": 2.885653331493206, "grad_norm": 0.1544167846441269, "learning_rate": 3.815131720182783e-06, "loss": 0.461, "mean_token_accuracy": 0.850154560059309, "num_tokens": 1000999308.0, "step": 31364 }, { "entropy": 0.5132130272686481, "epoch": 2.8857453378646474, "grad_norm": 0.1666790246963501, "learning_rate": 3.812064894041157e-06, "loss": 0.5092, "mean_token_accuracy": 0.836430586874485, "num_tokens": 1001030560.0, "step": 31365 }, { "entropy": 0.49101167684420943, "epoch": 2.8858373442360885, "grad_norm": 0.15393921732902527, "learning_rate": 3.808998067899531e-06, "loss": 0.4764, "mean_token_accuracy": 0.8484195284545422, "num_tokens": 1001062629.0, "step": 31366 }, { "entropy": 0.5380766540765762, "epoch": 2.8859293506075296, "grad_norm": 0.15993227064609528, "learning_rate": 3.8059312417579047e-06, "loss": 0.5223, "mean_token_accuracy": 0.8329933993518353, "num_tokens": 1001094710.0, "step": 31367 }, { "entropy": 0.48656788654625416, "epoch": 2.8860213569789708, "grad_norm": 0.1501987725496292, "learning_rate": 3.8028644156162785e-06, "loss": 0.4717, "mean_token_accuracy": 0.8506922647356987, "num_tokens": 1001127111.0, "step": 31368 }, { "entropy": 0.6098427753895521, "epoch": 2.886113363350412, "grad_norm": 0.16997799277305603, "learning_rate": 3.799797589474653e-06, "loss": 0.5871, "mean_token_accuracy": 0.8132799379527569, "num_tokens": 1001159024.0, "step": 31369 }, { "entropy": 0.5503489375114441, "epoch": 2.8862053697218535, "grad_norm": 0.16186712682247162, "learning_rate": 3.796730763333027e-06, "loss": 0.534, "mean_token_accuracy": 0.8261216878890991, "num_tokens": 1001190619.0, "step": 31370 }, { "entropy": 0.503169001895003, "epoch": 2.8862973760932946, "grad_norm": 0.15461675822734833, "learning_rate": 3.793663937191401e-06, "loss": 0.4869, "mean_token_accuracy": 0.8446392677724361, "num_tokens": 1001221526.0, "step": 31371 }, { "entropy": 0.5247924281284213, "epoch": 2.8863893824647358, "grad_norm": 0.16046680510044098, "learning_rate": 3.790597111049775e-06, "loss": 0.5149, "mean_token_accuracy": 0.8352019116282463, "num_tokens": 1001253686.0, "step": 31372 }, { "entropy": 0.5046870270743966, "epoch": 2.886481388836177, "grad_norm": 0.15839765965938568, "learning_rate": 3.787530284908149e-06, "loss": 0.4956, "mean_token_accuracy": 0.843292623758316, "num_tokens": 1001285598.0, "step": 31373 }, { "entropy": 0.5196921182796359, "epoch": 2.886573395207618, "grad_norm": 0.15511275827884674, "learning_rate": 3.7844634587665226e-06, "loss": 0.5105, "mean_token_accuracy": 0.8378648199141026, "num_tokens": 1001317792.0, "step": 31374 }, { "entropy": 0.5631193569861352, "epoch": 2.8866654015790596, "grad_norm": 0.1625712811946869, "learning_rate": 3.7813966326248964e-06, "loss": 0.5553, "mean_token_accuracy": 0.8249815180897713, "num_tokens": 1001349615.0, "step": 31375 }, { "entropy": 0.5516986083239317, "epoch": 2.8867574079505007, "grad_norm": 0.15986981987953186, "learning_rate": 3.7783298064832702e-06, "loss": 0.5428, "mean_token_accuracy": 0.8297471404075623, "num_tokens": 1001382328.0, "step": 31376 }, { "entropy": 0.511344657978043, "epoch": 2.886849414321942, "grad_norm": 0.1553650200366974, "learning_rate": 3.775262980341645e-06, "loss": 0.4991, "mean_token_accuracy": 0.8409059606492519, "num_tokens": 1001414459.0, "step": 31377 }, { "entropy": 0.4381791641935706, "epoch": 2.886941420693383, "grad_norm": 0.15026284754276276, "learning_rate": 3.7721961542000187e-06, "loss": 0.4302, "mean_token_accuracy": 0.8625035807490349, "num_tokens": 1001446067.0, "step": 31378 }, { "entropy": 0.5384059250354767, "epoch": 2.887033427064824, "grad_norm": 0.1585063338279724, "learning_rate": 3.7691293280583925e-06, "loss": 0.5275, "mean_token_accuracy": 0.836004976183176, "num_tokens": 1001477794.0, "step": 31379 }, { "entropy": 0.5951441891957074, "epoch": 2.8871254334362657, "grad_norm": 0.16913282871246338, "learning_rate": 3.7660625019167667e-06, "loss": 0.5829, "mean_token_accuracy": 0.8182841800153255, "num_tokens": 1001509883.0, "step": 31380 }, { "entropy": 0.4776777299121022, "epoch": 2.887217439807707, "grad_norm": 0.1571924239397049, "learning_rate": 3.7629956757751405e-06, "loss": 0.467, "mean_token_accuracy": 0.8536336459219456, "num_tokens": 1001541305.0, "step": 31381 }, { "entropy": 0.5162696205079556, "epoch": 2.887309446179148, "grad_norm": 0.16026538610458374, "learning_rate": 3.7599288496335143e-06, "loss": 0.5103, "mean_token_accuracy": 0.8378934748470783, "num_tokens": 1001573178.0, "step": 31382 }, { "entropy": 0.5158943072892725, "epoch": 2.887401452550589, "grad_norm": 0.1601237654685974, "learning_rate": 3.756862023491888e-06, "loss": 0.5039, "mean_token_accuracy": 0.8383112996816635, "num_tokens": 1001605035.0, "step": 31383 }, { "entropy": 0.4422268131747842, "epoch": 2.8874934589220302, "grad_norm": 0.15306456387043, "learning_rate": 3.753795197350262e-06, "loss": 0.4259, "mean_token_accuracy": 0.8643792159855366, "num_tokens": 1001637163.0, "step": 31384 }, { "entropy": 0.43683998100459576, "epoch": 2.887585465293472, "grad_norm": 0.14901979267597198, "learning_rate": 3.7507283712086365e-06, "loss": 0.4307, "mean_token_accuracy": 0.8611868321895599, "num_tokens": 1001669111.0, "step": 31385 }, { "entropy": 0.46248890832066536, "epoch": 2.887677471664913, "grad_norm": 0.147746741771698, "learning_rate": 3.7476615450670103e-06, "loss": 0.4537, "mean_token_accuracy": 0.856044489890337, "num_tokens": 1001701493.0, "step": 31386 }, { "entropy": 0.5017292750999331, "epoch": 2.887769478036354, "grad_norm": 0.15307417511940002, "learning_rate": 3.7445947189253846e-06, "loss": 0.4905, "mean_token_accuracy": 0.8460048250854015, "num_tokens": 1001734050.0, "step": 31387 }, { "entropy": 0.4977693387772888, "epoch": 2.887861484407795, "grad_norm": 0.1597558557987213, "learning_rate": 3.7415278927837584e-06, "loss": 0.4894, "mean_token_accuracy": 0.8431467711925507, "num_tokens": 1001765569.0, "step": 31388 }, { "entropy": 0.5096885403618217, "epoch": 2.8879534907792364, "grad_norm": 0.16646552085876465, "learning_rate": 3.738461066642132e-06, "loss": 0.5076, "mean_token_accuracy": 0.8379825763404369, "num_tokens": 1001797104.0, "step": 31389 }, { "entropy": 0.3985362323001027, "epoch": 2.888045497150678, "grad_norm": 0.14728254079818726, "learning_rate": 3.735394240500506e-06, "loss": 0.393, "mean_token_accuracy": 0.874590776860714, "num_tokens": 1001829369.0, "step": 31390 }, { "entropy": 0.5517448550090194, "epoch": 2.888137503522119, "grad_norm": 0.1642114371061325, "learning_rate": 3.7323274143588798e-06, "loss": 0.5446, "mean_token_accuracy": 0.8282720297574997, "num_tokens": 1001860855.0, "step": 31391 }, { "entropy": 0.48244852921925485, "epoch": 2.88822950989356, "grad_norm": 0.14956510066986084, "learning_rate": 3.7292605882172544e-06, "loss": 0.4717, "mean_token_accuracy": 0.8516433872282505, "num_tokens": 1001893533.0, "step": 31392 }, { "entropy": 0.505201761610806, "epoch": 2.8883215162650013, "grad_norm": 0.15419992804527283, "learning_rate": 3.7261937620756282e-06, "loss": 0.4983, "mean_token_accuracy": 0.841070294380188, "num_tokens": 1001926263.0, "step": 31393 }, { "entropy": 0.5100685218349099, "epoch": 2.8884135226364425, "grad_norm": 0.15466824173927307, "learning_rate": 3.723126935934002e-06, "loss": 0.4948, "mean_token_accuracy": 0.8405955471098423, "num_tokens": 1001958271.0, "step": 31394 }, { "entropy": 0.5117922476492822, "epoch": 2.888505529007884, "grad_norm": 0.16041138768196106, "learning_rate": 3.7200601097923762e-06, "loss": 0.4939, "mean_token_accuracy": 0.8398463949561119, "num_tokens": 1001989788.0, "step": 31395 }, { "entropy": 0.4336009216494858, "epoch": 2.888597535379325, "grad_norm": 0.14785951375961304, "learning_rate": 3.71699328365075e-06, "loss": 0.4182, "mean_token_accuracy": 0.8662091419100761, "num_tokens": 1002021715.0, "step": 31396 }, { "entropy": 0.5075069894082844, "epoch": 2.8886895417507663, "grad_norm": 0.15695008635520935, "learning_rate": 3.713926457509124e-06, "loss": 0.4944, "mean_token_accuracy": 0.8432704955339432, "num_tokens": 1002053135.0, "step": 31397 }, { "entropy": 0.48345300182700157, "epoch": 2.8887815481222074, "grad_norm": 0.1501331478357315, "learning_rate": 3.7108596313674976e-06, "loss": 0.4674, "mean_token_accuracy": 0.8495795242488384, "num_tokens": 1002085563.0, "step": 31398 }, { "entropy": 0.48772477079182863, "epoch": 2.8888735544936486, "grad_norm": 0.1581398844718933, "learning_rate": 3.7077928052258714e-06, "loss": 0.4744, "mean_token_accuracy": 0.8479868769645691, "num_tokens": 1002117662.0, "step": 31399 }, { "entropy": 0.5710143679752946, "epoch": 2.88896556086509, "grad_norm": 0.16097256541252136, "learning_rate": 3.704725979084246e-06, "loss": 0.562, "mean_token_accuracy": 0.8219433277845383, "num_tokens": 1002150119.0, "step": 31400 }, { "entropy": 0.522172839846462, "epoch": 2.8890575672365313, "grad_norm": 0.16085419058799744, "learning_rate": 3.70165915294262e-06, "loss": 0.5094, "mean_token_accuracy": 0.8389863967895508, "num_tokens": 1002182056.0, "step": 31401 }, { "entropy": 0.5290586017072201, "epoch": 2.8891495736079724, "grad_norm": 0.16602900624275208, "learning_rate": 3.698592326800994e-06, "loss": 0.4997, "mean_token_accuracy": 0.8388316221535206, "num_tokens": 1002213166.0, "step": 31402 }, { "entropy": 0.48118123901076615, "epoch": 2.8892415799794136, "grad_norm": 0.15226192772388458, "learning_rate": 3.695525500659368e-06, "loss": 0.4701, "mean_token_accuracy": 0.8514592722058296, "num_tokens": 1002244505.0, "step": 31403 }, { "entropy": 0.6509510334581137, "epoch": 2.8893335863508547, "grad_norm": 0.1733172982931137, "learning_rate": 3.6924586745177417e-06, "loss": 0.6416, "mean_token_accuracy": 0.8004279509186745, "num_tokens": 1002276175.0, "step": 31404 }, { "entropy": 0.5067733414471149, "epoch": 2.8894255927222963, "grad_norm": 0.15357652306556702, "learning_rate": 3.6893918483761155e-06, "loss": 0.4963, "mean_token_accuracy": 0.844310101121664, "num_tokens": 1002308231.0, "step": 31405 }, { "entropy": 0.4892267594113946, "epoch": 2.8895175990937374, "grad_norm": 0.15652510523796082, "learning_rate": 3.6863250222344893e-06, "loss": 0.4801, "mean_token_accuracy": 0.8473416976630688, "num_tokens": 1002340506.0, "step": 31406 }, { "entropy": 0.44451572734396905, "epoch": 2.8896096054651785, "grad_norm": 0.14501510560512543, "learning_rate": 3.683258196092864e-06, "loss": 0.4319, "mean_token_accuracy": 0.8633502461016178, "num_tokens": 1002372769.0, "step": 31407 }, { "entropy": 0.47519912384450436, "epoch": 2.8897016118366197, "grad_norm": 0.1565016508102417, "learning_rate": 3.6801913699512378e-06, "loss": 0.4708, "mean_token_accuracy": 0.8497588597238064, "num_tokens": 1002405264.0, "step": 31408 }, { "entropy": 0.5011252053081989, "epoch": 2.889793618208061, "grad_norm": 0.15708979964256287, "learning_rate": 3.6771245438096116e-06, "loss": 0.4916, "mean_token_accuracy": 0.8453945927321911, "num_tokens": 1002437368.0, "step": 31409 }, { "entropy": 0.513928635045886, "epoch": 2.8898856245795024, "grad_norm": 0.15674932301044464, "learning_rate": 3.674057717667986e-06, "loss": 0.5121, "mean_token_accuracy": 0.8388689495623112, "num_tokens": 1002469541.0, "step": 31410 }, { "entropy": 0.45488819014281034, "epoch": 2.8899776309509435, "grad_norm": 0.1531049758195877, "learning_rate": 3.6709908915263596e-06, "loss": 0.4522, "mean_token_accuracy": 0.8529062084853649, "num_tokens": 1002501926.0, "step": 31411 }, { "entropy": 0.537932613864541, "epoch": 2.8900696373223846, "grad_norm": 0.16157276928424835, "learning_rate": 3.6679240653847334e-06, "loss": 0.5268, "mean_token_accuracy": 0.8350026346743107, "num_tokens": 1002534112.0, "step": 31412 }, { "entropy": 0.5625253198668361, "epoch": 2.8901616436938258, "grad_norm": 0.16584038734436035, "learning_rate": 3.664857239243107e-06, "loss": 0.554, "mean_token_accuracy": 0.824642613530159, "num_tokens": 1002565650.0, "step": 31413 }, { "entropy": 0.4968835115432739, "epoch": 2.890253650065267, "grad_norm": 0.15069250762462616, "learning_rate": 3.661790413101481e-06, "loss": 0.4716, "mean_token_accuracy": 0.8468423262238503, "num_tokens": 1002596980.0, "step": 31414 }, { "entropy": 0.5340477274730802, "epoch": 2.8903456564367085, "grad_norm": 0.15777333080768585, "learning_rate": 3.6587235869598556e-06, "loss": 0.533, "mean_token_accuracy": 0.8347911536693573, "num_tokens": 1002629335.0, "step": 31415 }, { "entropy": 0.49387452472001314, "epoch": 2.8904376628081496, "grad_norm": 0.1500483751296997, "learning_rate": 3.6556567608182294e-06, "loss": 0.4805, "mean_token_accuracy": 0.8465676121413708, "num_tokens": 1002661618.0, "step": 31416 }, { "entropy": 0.4829049437539652, "epoch": 2.8905296691795908, "grad_norm": 0.1503726840019226, "learning_rate": 3.6525899346766037e-06, "loss": 0.4643, "mean_token_accuracy": 0.852664839476347, "num_tokens": 1002694175.0, "step": 31417 }, { "entropy": 0.5031869634985924, "epoch": 2.890621675551032, "grad_norm": 0.15836825966835022, "learning_rate": 3.6495231085349775e-06, "loss": 0.4897, "mean_token_accuracy": 0.8438434787094593, "num_tokens": 1002725569.0, "step": 31418 }, { "entropy": 0.4622834464535117, "epoch": 2.890713681922473, "grad_norm": 0.1568465232849121, "learning_rate": 3.6464562823933513e-06, "loss": 0.4594, "mean_token_accuracy": 0.8542176559567451, "num_tokens": 1002756901.0, "step": 31419 }, { "entropy": 0.6260617077350616, "epoch": 2.8908056882939146, "grad_norm": 0.17840272188186646, "learning_rate": 3.643389456251725e-06, "loss": 0.6219, "mean_token_accuracy": 0.8080848418176174, "num_tokens": 1002788612.0, "step": 31420 }, { "entropy": 0.4950318248011172, "epoch": 2.8908976946653557, "grad_norm": 0.1537701040506363, "learning_rate": 3.640322630110099e-06, "loss": 0.472, "mean_token_accuracy": 0.8509997949004173, "num_tokens": 1002821038.0, "step": 31421 }, { "entropy": 0.44409867841750383, "epoch": 2.890989701036797, "grad_norm": 0.14568454027175903, "learning_rate": 3.6372558039684727e-06, "loss": 0.4201, "mean_token_accuracy": 0.8657036647200584, "num_tokens": 1002852403.0, "step": 31422 }, { "entropy": 0.42540982784703374, "epoch": 2.891081707408238, "grad_norm": 0.14956136047840118, "learning_rate": 3.6341889778268473e-06, "loss": 0.4032, "mean_token_accuracy": 0.8699908629059792, "num_tokens": 1002883644.0, "step": 31423 }, { "entropy": 0.5404672054573894, "epoch": 2.891173713779679, "grad_norm": 0.15890230238437653, "learning_rate": 3.631122151685221e-06, "loss": 0.5289, "mean_token_accuracy": 0.8326514363288879, "num_tokens": 1002916412.0, "step": 31424 }, { "entropy": 0.48919372796081007, "epoch": 2.8912657201511207, "grad_norm": 0.1582607924938202, "learning_rate": 3.6280553255435953e-06, "loss": 0.4719, "mean_token_accuracy": 0.8503203615546227, "num_tokens": 1002948017.0, "step": 31425 }, { "entropy": 0.5582905365154147, "epoch": 2.891357726522562, "grad_norm": 0.16295886039733887, "learning_rate": 3.624988499401969e-06, "loss": 0.5483, "mean_token_accuracy": 0.8269627094268799, "num_tokens": 1002980244.0, "step": 31426 }, { "entropy": 0.48498890828341246, "epoch": 2.891449732894003, "grad_norm": 0.15405738353729248, "learning_rate": 3.621921673260343e-06, "loss": 0.4727, "mean_token_accuracy": 0.8493396900594234, "num_tokens": 1003012236.0, "step": 31427 }, { "entropy": 0.5003170417621732, "epoch": 2.891541739265444, "grad_norm": 0.157309427857399, "learning_rate": 3.6188548471187167e-06, "loss": 0.491, "mean_token_accuracy": 0.8404478318989277, "num_tokens": 1003044693.0, "step": 31428 }, { "entropy": 0.5694604888558388, "epoch": 2.8916337456368852, "grad_norm": 0.16275560855865479, "learning_rate": 3.6157880209770905e-06, "loss": 0.5466, "mean_token_accuracy": 0.8278425745666027, "num_tokens": 1003077032.0, "step": 31429 }, { "entropy": 0.5891969371587038, "epoch": 2.891725752008327, "grad_norm": 0.16790063679218292, "learning_rate": 3.612721194835465e-06, "loss": 0.5765, "mean_token_accuracy": 0.8145990185439587, "num_tokens": 1003107949.0, "step": 31430 }, { "entropy": 0.40249595255590975, "epoch": 2.891817758379768, "grad_norm": 0.13478687405586243, "learning_rate": 3.609654368693839e-06, "loss": 0.3828, "mean_token_accuracy": 0.8783187419176102, "num_tokens": 1003140358.0, "step": 31431 }, { "entropy": 0.42680397361982614, "epoch": 2.891909764751209, "grad_norm": 0.14363539218902588, "learning_rate": 3.606587542552213e-06, "loss": 0.4114, "mean_token_accuracy": 0.8674963675439358, "num_tokens": 1003172364.0, "step": 31432 }, { "entropy": 0.4301823005080223, "epoch": 2.8920017711226502, "grad_norm": 0.14176124334335327, "learning_rate": 3.603520716410587e-06, "loss": 0.4126, "mean_token_accuracy": 0.8653039187192917, "num_tokens": 1003203716.0, "step": 31433 }, { "entropy": 0.4788942816667259, "epoch": 2.8920937774940914, "grad_norm": 0.1608441323041916, "learning_rate": 3.600453890268961e-06, "loss": 0.4534, "mean_token_accuracy": 0.8531585037708282, "num_tokens": 1003234080.0, "step": 31434 }, { "entropy": 0.49124930147081614, "epoch": 2.892185783865533, "grad_norm": 0.15743164718151093, "learning_rate": 3.5973870641273346e-06, "loss": 0.4846, "mean_token_accuracy": 0.8474209271371365, "num_tokens": 1003266031.0, "step": 31435 }, { "entropy": 0.40799681190401316, "epoch": 2.892277790236974, "grad_norm": 0.13928256928920746, "learning_rate": 3.5943202379857084e-06, "loss": 0.3911, "mean_token_accuracy": 0.8729040399193764, "num_tokens": 1003298333.0, "step": 31436 }, { "entropy": 0.5381042174994946, "epoch": 2.892369796608415, "grad_norm": 0.16535069048404694, "learning_rate": 3.5912534118440826e-06, "loss": 0.5489, "mean_token_accuracy": 0.8254694603383541, "num_tokens": 1003329982.0, "step": 31437 }, { "entropy": 0.5597025286406279, "epoch": 2.8924618029798563, "grad_norm": 0.16233958303928375, "learning_rate": 3.588186585702457e-06, "loss": 0.5481, "mean_token_accuracy": 0.8313385471701622, "num_tokens": 1003362750.0, "step": 31438 }, { "entropy": 0.570269487798214, "epoch": 2.8925538093512975, "grad_norm": 0.16756050288677216, "learning_rate": 3.585119759560831e-06, "loss": 0.5606, "mean_token_accuracy": 0.8215921334922314, "num_tokens": 1003394070.0, "step": 31439 }, { "entropy": 0.5149770537391305, "epoch": 2.892645815722739, "grad_norm": 0.15986886620521545, "learning_rate": 3.582052933419205e-06, "loss": 0.4919, "mean_token_accuracy": 0.8402603901922703, "num_tokens": 1003425763.0, "step": 31440 }, { "entropy": 0.544053903548047, "epoch": 2.89273782209418, "grad_norm": 0.16100646555423737, "learning_rate": 3.5789861072775787e-06, "loss": 0.5267, "mean_token_accuracy": 0.8326406069099903, "num_tokens": 1003457674.0, "step": 31441 }, { "entropy": 0.49620294920168817, "epoch": 2.8928298284656213, "grad_norm": 0.15950819849967957, "learning_rate": 3.5759192811359525e-06, "loss": 0.4903, "mean_token_accuracy": 0.8441822677850723, "num_tokens": 1003489315.0, "step": 31442 }, { "entropy": 0.5168964308686554, "epoch": 2.8929218348370624, "grad_norm": 0.16527850925922394, "learning_rate": 3.5728524549943263e-06, "loss": 0.5036, "mean_token_accuracy": 0.8391883112490177, "num_tokens": 1003520806.0, "step": 31443 }, { "entropy": 0.43447909387759864, "epoch": 2.8930138412085036, "grad_norm": 0.14191457629203796, "learning_rate": 3.5697856288527e-06, "loss": 0.4228, "mean_token_accuracy": 0.8636290989816189, "num_tokens": 1003553117.0, "step": 31444 }, { "entropy": 0.5820436631329358, "epoch": 2.893105847579945, "grad_norm": 0.173892080783844, "learning_rate": 3.5667188027110743e-06, "loss": 0.5824, "mean_token_accuracy": 0.8206462524831295, "num_tokens": 1003584887.0, "step": 31445 }, { "entropy": 0.6369138238951564, "epoch": 2.8931978539513863, "grad_norm": 0.17237398028373718, "learning_rate": 3.5636519765694485e-06, "loss": 0.6248, "mean_token_accuracy": 0.8048393055796623, "num_tokens": 1003616244.0, "step": 31446 }, { "entropy": 0.5213831551373005, "epoch": 2.8932898603228274, "grad_norm": 0.16239586472511292, "learning_rate": 3.5605851504278228e-06, "loss": 0.5129, "mean_token_accuracy": 0.8356528058648109, "num_tokens": 1003647987.0, "step": 31447 }, { "entropy": 0.5931692346930504, "epoch": 2.8933818666942686, "grad_norm": 0.17045553028583527, "learning_rate": 3.5575183242861966e-06, "loss": 0.5908, "mean_token_accuracy": 0.81211381778121, "num_tokens": 1003679745.0, "step": 31448 }, { "entropy": 0.5652593169361353, "epoch": 2.8934738730657097, "grad_norm": 0.16631245613098145, "learning_rate": 3.5544514981445704e-06, "loss": 0.5538, "mean_token_accuracy": 0.8225578665733337, "num_tokens": 1003711169.0, "step": 31449 }, { "entropy": 0.4714051093906164, "epoch": 2.8935658794371513, "grad_norm": 0.15750011801719666, "learning_rate": 3.551384672002944e-06, "loss": 0.4541, "mean_token_accuracy": 0.8540040068328381, "num_tokens": 1003743043.0, "step": 31450 }, { "entropy": 0.47640044428408146, "epoch": 2.8936578858085924, "grad_norm": 0.15523454546928406, "learning_rate": 3.548317845861318e-06, "loss": 0.4667, "mean_token_accuracy": 0.8522394746541977, "num_tokens": 1003775300.0, "step": 31451 }, { "entropy": 0.49469313584268093, "epoch": 2.8937498921800335, "grad_norm": 0.159311905503273, "learning_rate": 3.545251019719692e-06, "loss": 0.4945, "mean_token_accuracy": 0.8452989123761654, "num_tokens": 1003807168.0, "step": 31452 }, { "entropy": 0.48751228069886565, "epoch": 2.8938418985514747, "grad_norm": 0.15745943784713745, "learning_rate": 3.5421841935780664e-06, "loss": 0.476, "mean_token_accuracy": 0.8491556458175182, "num_tokens": 1003839101.0, "step": 31453 }, { "entropy": 0.5262865088880062, "epoch": 2.893933904922916, "grad_norm": 0.1604430079460144, "learning_rate": 3.5391173674364406e-06, "loss": 0.5096, "mean_token_accuracy": 0.8422942869365215, "num_tokens": 1003870859.0, "step": 31454 }, { "entropy": 0.5074722487479448, "epoch": 2.8940259112943574, "grad_norm": 0.1624491810798645, "learning_rate": 3.5360505412948144e-06, "loss": 0.4993, "mean_token_accuracy": 0.843735683709383, "num_tokens": 1003901889.0, "step": 31455 }, { "entropy": 0.5866063805297017, "epoch": 2.8941179176657985, "grad_norm": 0.1728864163160324, "learning_rate": 3.5329837151531882e-06, "loss": 0.5772, "mean_token_accuracy": 0.82065225020051, "num_tokens": 1003932943.0, "step": 31456 }, { "entropy": 0.4986608596518636, "epoch": 2.8942099240372396, "grad_norm": 0.15117351710796356, "learning_rate": 3.529916889011562e-06, "loss": 0.4838, "mean_token_accuracy": 0.8490350916981697, "num_tokens": 1003964996.0, "step": 31457 }, { "entropy": 0.574238421395421, "epoch": 2.894301930408681, "grad_norm": 0.16488461196422577, "learning_rate": 3.526850062869936e-06, "loss": 0.5629, "mean_token_accuracy": 0.8217437081038952, "num_tokens": 1003997143.0, "step": 31458 }, { "entropy": 0.5145159258972853, "epoch": 2.894393936780122, "grad_norm": 0.15862447023391724, "learning_rate": 3.5237832367283096e-06, "loss": 0.4996, "mean_token_accuracy": 0.8428985141217709, "num_tokens": 1004029006.0, "step": 31459 }, { "entropy": 0.5200365888886154, "epoch": 2.8944859431515635, "grad_norm": 0.16047672927379608, "learning_rate": 3.520716410586684e-06, "loss": 0.5071, "mean_token_accuracy": 0.8404472693800926, "num_tokens": 1004060629.0, "step": 31460 }, { "entropy": 0.49377044290304184, "epoch": 2.8945779495230046, "grad_norm": 0.14921662211418152, "learning_rate": 3.517649584445058e-06, "loss": 0.474, "mean_token_accuracy": 0.8487715721130371, "num_tokens": 1004092425.0, "step": 31461 }, { "entropy": 0.4701189836487174, "epoch": 2.8946699558944458, "grad_norm": 0.1598646640777588, "learning_rate": 3.5145827583034323e-06, "loss": 0.4635, "mean_token_accuracy": 0.850188884884119, "num_tokens": 1004123667.0, "step": 31462 }, { "entropy": 0.5139106521382928, "epoch": 2.894761962265887, "grad_norm": 0.15997561812400818, "learning_rate": 3.511515932161806e-06, "loss": 0.5009, "mean_token_accuracy": 0.8415982276201248, "num_tokens": 1004155441.0, "step": 31463 }, { "entropy": 0.48181752336677164, "epoch": 2.894853968637328, "grad_norm": 0.15753374993801117, "learning_rate": 3.50844910602018e-06, "loss": 0.4684, "mean_token_accuracy": 0.8491030670702457, "num_tokens": 1004185737.0, "step": 31464 }, { "entropy": 0.5684602558612823, "epoch": 2.8949459750087696, "grad_norm": 0.16624915599822998, "learning_rate": 3.5053822798785537e-06, "loss": 0.5604, "mean_token_accuracy": 0.8248395547270775, "num_tokens": 1004217290.0, "step": 31465 }, { "entropy": 0.4672912092646584, "epoch": 2.8950379813802107, "grad_norm": 0.15614759922027588, "learning_rate": 3.5023154537369275e-06, "loss": 0.4596, "mean_token_accuracy": 0.850574005395174, "num_tokens": 1004250058.0, "step": 31466 }, { "entropy": 0.5873409165069461, "epoch": 2.895129987751652, "grad_norm": 0.16640928387641907, "learning_rate": 3.4992486275953017e-06, "loss": 0.5843, "mean_token_accuracy": 0.8205162882804871, "num_tokens": 1004282121.0, "step": 31467 }, { "entropy": 0.5506027890369296, "epoch": 2.895221994123093, "grad_norm": 0.16523128747940063, "learning_rate": 3.496181801453676e-06, "loss": 0.5354, "mean_token_accuracy": 0.8287897035479546, "num_tokens": 1004313368.0, "step": 31468 }, { "entropy": 0.5385595336556435, "epoch": 2.895314000494534, "grad_norm": 0.1638544201850891, "learning_rate": 3.49311497531205e-06, "loss": 0.5277, "mean_token_accuracy": 0.831238642334938, "num_tokens": 1004345243.0, "step": 31469 }, { "entropy": 0.4957367032766342, "epoch": 2.8954060068659757, "grad_norm": 0.15717288851737976, "learning_rate": 3.490048149170424e-06, "loss": 0.4864, "mean_token_accuracy": 0.8457636646926403, "num_tokens": 1004377683.0, "step": 31470 }, { "entropy": 0.5205638613551855, "epoch": 2.895498013237417, "grad_norm": 0.16606296598911285, "learning_rate": 3.4869813230287978e-06, "loss": 0.5111, "mean_token_accuracy": 0.8370200358331203, "num_tokens": 1004409528.0, "step": 31471 }, { "entropy": 0.6240067146718502, "epoch": 2.895590019608858, "grad_norm": 0.17197352647781372, "learning_rate": 3.4839144968871716e-06, "loss": 0.615, "mean_token_accuracy": 0.8089226521551609, "num_tokens": 1004441231.0, "step": 31472 }, { "entropy": 0.5934379026293755, "epoch": 2.895682025980299, "grad_norm": 0.1703081876039505, "learning_rate": 3.4808476707455454e-06, "loss": 0.5881, "mean_token_accuracy": 0.8170631639659405, "num_tokens": 1004473127.0, "step": 31473 }, { "entropy": 0.4973849318921566, "epoch": 2.8957740323517402, "grad_norm": 0.15945293009281158, "learning_rate": 3.477780844603919e-06, "loss": 0.488, "mean_token_accuracy": 0.8433755598962307, "num_tokens": 1004504472.0, "step": 31474 }, { "entropy": 0.45920765958726406, "epoch": 2.895866038723182, "grad_norm": 0.1554589718580246, "learning_rate": 3.4747140184622934e-06, "loss": 0.4546, "mean_token_accuracy": 0.8529760800302029, "num_tokens": 1004536454.0, "step": 31475 }, { "entropy": 0.6398505847901106, "epoch": 2.895958045094623, "grad_norm": 0.1746576577425003, "learning_rate": 3.4716471923206676e-06, "loss": 0.6334, "mean_token_accuracy": 0.8001558147370815, "num_tokens": 1004569216.0, "step": 31476 }, { "entropy": 0.5014181775040925, "epoch": 2.896050051466064, "grad_norm": 0.1670459359884262, "learning_rate": 3.468580366179042e-06, "loss": 0.4914, "mean_token_accuracy": 0.841837901622057, "num_tokens": 1004600990.0, "step": 31477 }, { "entropy": 0.5014363462105393, "epoch": 2.8961420578375052, "grad_norm": 0.1614161878824234, "learning_rate": 3.4655135400374157e-06, "loss": 0.4927, "mean_token_accuracy": 0.8437250927090645, "num_tokens": 1004632278.0, "step": 31478 }, { "entropy": 0.47857082821428776, "epoch": 2.8962340642089464, "grad_norm": 0.15312601625919342, "learning_rate": 3.4624467138957895e-06, "loss": 0.4628, "mean_token_accuracy": 0.8550199531018734, "num_tokens": 1004663944.0, "step": 31479 }, { "entropy": 0.4588276371359825, "epoch": 2.896326070580388, "grad_norm": 0.1522202491760254, "learning_rate": 3.4593798877541633e-06, "loss": 0.4489, "mean_token_accuracy": 0.8568122871220112, "num_tokens": 1004695529.0, "step": 31480 }, { "entropy": 0.5075106052681804, "epoch": 2.896418076951829, "grad_norm": 0.1620834618806839, "learning_rate": 3.456313061612537e-06, "loss": 0.4903, "mean_token_accuracy": 0.8449946716427803, "num_tokens": 1004726474.0, "step": 31481 }, { "entropy": 0.4788057536352426, "epoch": 2.89651008332327, "grad_norm": 0.15635384619235992, "learning_rate": 3.4532462354709113e-06, "loss": 0.4643, "mean_token_accuracy": 0.8506386466324329, "num_tokens": 1004757854.0, "step": 31482 }, { "entropy": 0.5670123863965273, "epoch": 2.8966020896947113, "grad_norm": 0.16267086565494537, "learning_rate": 3.450179409329285e-06, "loss": 0.5512, "mean_token_accuracy": 0.8249162845313549, "num_tokens": 1004789766.0, "step": 31483 }, { "entropy": 0.555198878981173, "epoch": 2.8966940960661525, "grad_norm": 0.16142535209655762, "learning_rate": 3.4471125831876597e-06, "loss": 0.5278, "mean_token_accuracy": 0.831569392234087, "num_tokens": 1004821506.0, "step": 31484 }, { "entropy": 0.5400498835369945, "epoch": 2.896786102437594, "grad_norm": 0.15953858196735382, "learning_rate": 3.4440457570460335e-06, "loss": 0.5172, "mean_token_accuracy": 0.8372411206364632, "num_tokens": 1004854048.0, "step": 31485 }, { "entropy": 0.45697123266290873, "epoch": 2.896878108809035, "grad_norm": 0.15463407337665558, "learning_rate": 3.4409789309044073e-06, "loss": 0.4384, "mean_token_accuracy": 0.8589780367910862, "num_tokens": 1004885133.0, "step": 31486 }, { "entropy": 0.6256903917528689, "epoch": 2.8969701151804763, "grad_norm": 0.17397968471050262, "learning_rate": 3.437912104762781e-06, "loss": 0.6046, "mean_token_accuracy": 0.8086534328758717, "num_tokens": 1004916325.0, "step": 31487 }, { "entropy": 0.5263466984033585, "epoch": 2.8970621215519174, "grad_norm": 0.15930941700935364, "learning_rate": 3.434845278621155e-06, "loss": 0.5168, "mean_token_accuracy": 0.8362919762730598, "num_tokens": 1004948547.0, "step": 31488 }, { "entropy": 0.5120844226330519, "epoch": 2.8971541279233586, "grad_norm": 0.15620924532413483, "learning_rate": 3.4317784524795287e-06, "loss": 0.4983, "mean_token_accuracy": 0.8432424440979958, "num_tokens": 1004980789.0, "step": 31489 }, { "entropy": 0.5290216105058789, "epoch": 2.8972461342948, "grad_norm": 0.1621103286743164, "learning_rate": 3.428711626337903e-06, "loss": 0.5159, "mean_token_accuracy": 0.8338179811835289, "num_tokens": 1005012563.0, "step": 31490 }, { "entropy": 0.5951716173440218, "epoch": 2.8973381406662413, "grad_norm": 0.1697954535484314, "learning_rate": 3.425644800196277e-06, "loss": 0.5831, "mean_token_accuracy": 0.8190478757023811, "num_tokens": 1005043593.0, "step": 31491 }, { "entropy": 0.5352549459785223, "epoch": 2.8974301470376824, "grad_norm": 0.16027900576591492, "learning_rate": 3.4225779740546514e-06, "loss": 0.5161, "mean_token_accuracy": 0.8334017768502235, "num_tokens": 1005075379.0, "step": 31492 }, { "entropy": 0.503842013888061, "epoch": 2.8975221534091236, "grad_norm": 0.15924477577209473, "learning_rate": 3.419511147913025e-06, "loss": 0.4914, "mean_token_accuracy": 0.8411090523004532, "num_tokens": 1005106441.0, "step": 31493 }, { "entropy": 0.4432165178004652, "epoch": 2.8976141597805647, "grad_norm": 0.1521245390176773, "learning_rate": 3.416444321771399e-06, "loss": 0.4282, "mean_token_accuracy": 0.864767499268055, "num_tokens": 1005138745.0, "step": 31494 }, { "entropy": 0.5419009979814291, "epoch": 2.8977061661520063, "grad_norm": 0.159159854054451, "learning_rate": 3.413377495629773e-06, "loss": 0.5315, "mean_token_accuracy": 0.8339160345494747, "num_tokens": 1005171120.0, "step": 31495 }, { "entropy": 0.5486129922792315, "epoch": 2.8977981725234474, "grad_norm": 0.1584559977054596, "learning_rate": 3.4103106694881466e-06, "loss": 0.546, "mean_token_accuracy": 0.8292376212775707, "num_tokens": 1005203759.0, "step": 31496 }, { "entropy": 0.4189792168326676, "epoch": 2.8978901788948885, "grad_norm": 0.14391793310642242, "learning_rate": 3.407243843346521e-06, "loss": 0.411, "mean_token_accuracy": 0.8677356392145157, "num_tokens": 1005235821.0, "step": 31497 }, { "entropy": 0.5458352100104094, "epoch": 2.8979821852663297, "grad_norm": 0.16536052525043488, "learning_rate": 3.4041770172048946e-06, "loss": 0.524, "mean_token_accuracy": 0.835627842694521, "num_tokens": 1005267539.0, "step": 31498 }, { "entropy": 0.5822840565815568, "epoch": 2.898074191637771, "grad_norm": 0.16359061002731323, "learning_rate": 3.4011101910632693e-06, "loss": 0.568, "mean_token_accuracy": 0.8223526254296303, "num_tokens": 1005299410.0, "step": 31499 }, { "entropy": 0.5821058712899685, "epoch": 2.8981661980092124, "grad_norm": 0.16895368695259094, "learning_rate": 3.398043364921643e-06, "loss": 0.5697, "mean_token_accuracy": 0.8189950846135616, "num_tokens": 1005331214.0, "step": 31500 }, { "entropy": 0.5653657764196396, "epoch": 2.8982582043806535, "grad_norm": 0.16370351612567902, "learning_rate": 3.394976538780017e-06, "loss": 0.56, "mean_token_accuracy": 0.8274785093963146, "num_tokens": 1005363444.0, "step": 31501 }, { "entropy": 0.527248153463006, "epoch": 2.8983502107520946, "grad_norm": 0.1592574566602707, "learning_rate": 3.3919097126383907e-06, "loss": 0.5161, "mean_token_accuracy": 0.8364933468401432, "num_tokens": 1005395474.0, "step": 31502 }, { "entropy": 0.4925485122948885, "epoch": 2.898442217123536, "grad_norm": 0.1532878428697586, "learning_rate": 3.3888428864967645e-06, "loss": 0.4838, "mean_token_accuracy": 0.8461514785885811, "num_tokens": 1005427584.0, "step": 31503 }, { "entropy": 0.49550397938583046, "epoch": 2.898534223494977, "grad_norm": 0.1560148447751999, "learning_rate": 3.3857760603551383e-06, "loss": 0.4817, "mean_token_accuracy": 0.8447991274297237, "num_tokens": 1005459730.0, "step": 31504 }, { "entropy": 0.4551802477799356, "epoch": 2.8986262298664185, "grad_norm": 0.15141625702381134, "learning_rate": 3.3827092342135125e-06, "loss": 0.4432, "mean_token_accuracy": 0.8581014014780521, "num_tokens": 1005491991.0, "step": 31505 }, { "entropy": 0.5203266041353345, "epoch": 2.8987182362378596, "grad_norm": 0.1576836109161377, "learning_rate": 3.3796424080718863e-06, "loss": 0.5116, "mean_token_accuracy": 0.8378792516887188, "num_tokens": 1005524185.0, "step": 31506 }, { "entropy": 0.38026899471879005, "epoch": 2.8988102426093008, "grad_norm": 0.1426028311252594, "learning_rate": 3.376575581930261e-06, "loss": 0.3703, "mean_token_accuracy": 0.8783901296555996, "num_tokens": 1005555763.0, "step": 31507 }, { "entropy": 0.5132184284739196, "epoch": 2.898902248980742, "grad_norm": 0.1583632081747055, "learning_rate": 3.3735087557886348e-06, "loss": 0.5091, "mean_token_accuracy": 0.8382533974945545, "num_tokens": 1005587695.0, "step": 31508 }, { "entropy": 0.5810971856117249, "epoch": 2.898994255352183, "grad_norm": 0.16650788486003876, "learning_rate": 3.3704419296470086e-06, "loss": 0.5651, "mean_token_accuracy": 0.8169837631285191, "num_tokens": 1005619132.0, "step": 31509 }, { "entropy": 0.4931301986798644, "epoch": 2.8990862617236246, "grad_norm": 0.1533353328704834, "learning_rate": 3.3673751035053824e-06, "loss": 0.4769, "mean_token_accuracy": 0.848039548844099, "num_tokens": 1005651240.0, "step": 31510 }, { "entropy": 0.5519805829972029, "epoch": 2.8991782680950657, "grad_norm": 0.1597803682088852, "learning_rate": 3.364308277363756e-06, "loss": 0.5442, "mean_token_accuracy": 0.8317958489060402, "num_tokens": 1005683563.0, "step": 31511 }, { "entropy": 0.5850732959806919, "epoch": 2.899270274466507, "grad_norm": 0.16327480971813202, "learning_rate": 3.3612414512221304e-06, "loss": 0.5793, "mean_token_accuracy": 0.8161827623844147, "num_tokens": 1005715325.0, "step": 31512 }, { "entropy": 0.4079348719678819, "epoch": 2.899362280837948, "grad_norm": 0.1405681073665619, "learning_rate": 3.358174625080504e-06, "loss": 0.3935, "mean_token_accuracy": 0.8711353093385696, "num_tokens": 1005747459.0, "step": 31513 }, { "entropy": 0.5239689331501722, "epoch": 2.899454287209389, "grad_norm": 0.15909230709075928, "learning_rate": 3.355107798938879e-06, "loss": 0.5086, "mean_token_accuracy": 0.8395080827176571, "num_tokens": 1005779129.0, "step": 31514 }, { "entropy": 0.5109254075214267, "epoch": 2.8995462935808307, "grad_norm": 0.15587447583675385, "learning_rate": 3.3520409727972526e-06, "loss": 0.4963, "mean_token_accuracy": 0.8442014344036579, "num_tokens": 1005811020.0, "step": 31515 }, { "entropy": 0.5857046023011208, "epoch": 2.899638299952272, "grad_norm": 0.16929425299167633, "learning_rate": 3.3489741466556264e-06, "loss": 0.5728, "mean_token_accuracy": 0.8211199752986431, "num_tokens": 1005842819.0, "step": 31516 }, { "entropy": 0.4423145179171115, "epoch": 2.899730306323713, "grad_norm": 0.1510288417339325, "learning_rate": 3.3459073205140002e-06, "loss": 0.422, "mean_token_accuracy": 0.8650008887052536, "num_tokens": 1005874629.0, "step": 31517 }, { "entropy": 0.5482199238613248, "epoch": 2.899822312695154, "grad_norm": 0.16713447868824005, "learning_rate": 3.342840494372374e-06, "loss": 0.5493, "mean_token_accuracy": 0.8302322551608086, "num_tokens": 1005906761.0, "step": 31518 }, { "entropy": 0.47212606738321483, "epoch": 2.8999143190665952, "grad_norm": 0.15082073211669922, "learning_rate": 3.339773668230748e-06, "loss": 0.4655, "mean_token_accuracy": 0.8486284986138344, "num_tokens": 1005939249.0, "step": 31519 }, { "entropy": 0.4616201496683061, "epoch": 2.900006325438037, "grad_norm": 0.15026533603668213, "learning_rate": 3.336706842089122e-06, "loss": 0.4407, "mean_token_accuracy": 0.8573712147772312, "num_tokens": 1005970817.0, "step": 31520 }, { "entropy": 0.4645165540277958, "epoch": 2.900098331809478, "grad_norm": 0.1521545946598053, "learning_rate": 3.333640015947496e-06, "loss": 0.4477, "mean_token_accuracy": 0.8537127003073692, "num_tokens": 1006002532.0, "step": 31521 }, { "entropy": 0.4636175250634551, "epoch": 2.900190338180919, "grad_norm": 0.15337876975536346, "learning_rate": 3.3305731898058705e-06, "loss": 0.4439, "mean_token_accuracy": 0.8583484999835491, "num_tokens": 1006034109.0, "step": 31522 }, { "entropy": 0.5437806975096464, "epoch": 2.9002823445523602, "grad_norm": 0.15615496039390564, "learning_rate": 3.3275063636642443e-06, "loss": 0.5321, "mean_token_accuracy": 0.831374604254961, "num_tokens": 1006066746.0, "step": 31523 }, { "entropy": 0.5185043624369428, "epoch": 2.9003743509238014, "grad_norm": 0.15772078931331635, "learning_rate": 3.324439537522618e-06, "loss": 0.5054, "mean_token_accuracy": 0.8407393284142017, "num_tokens": 1006099009.0, "step": 31524 }, { "entropy": 0.4412778550758958, "epoch": 2.900466357295243, "grad_norm": 0.15362468361854553, "learning_rate": 3.321372711380992e-06, "loss": 0.4333, "mean_token_accuracy": 0.8602082170546055, "num_tokens": 1006130748.0, "step": 31525 }, { "entropy": 0.4118336362298578, "epoch": 2.900558363666684, "grad_norm": 0.1428271234035492, "learning_rate": 3.3183058852393657e-06, "loss": 0.4012, "mean_token_accuracy": 0.871694665402174, "num_tokens": 1006162378.0, "step": 31526 }, { "entropy": 0.5337100885808468, "epoch": 2.900650370038125, "grad_norm": 0.15661467611789703, "learning_rate": 3.31523905909774e-06, "loss": 0.5139, "mean_token_accuracy": 0.8401233442127705, "num_tokens": 1006193974.0, "step": 31527 }, { "entropy": 0.4894585858564824, "epoch": 2.9007423764095663, "grad_norm": 0.1558380275964737, "learning_rate": 3.3121722329561137e-06, "loss": 0.4879, "mean_token_accuracy": 0.8465963788330555, "num_tokens": 1006226437.0, "step": 31528 }, { "entropy": 0.5211427100002766, "epoch": 2.9008343827810075, "grad_norm": 0.15813888609409332, "learning_rate": 3.3091054068144884e-06, "loss": 0.4975, "mean_token_accuracy": 0.8419184125959873, "num_tokens": 1006258469.0, "step": 31529 }, { "entropy": 0.5192622151225805, "epoch": 2.900926389152449, "grad_norm": 0.16047906875610352, "learning_rate": 3.306038580672862e-06, "loss": 0.5057, "mean_token_accuracy": 0.8367398418486118, "num_tokens": 1006290458.0, "step": 31530 }, { "entropy": 0.46523651760071516, "epoch": 2.90101839552389, "grad_norm": 0.14959746599197388, "learning_rate": 3.302971754531236e-06, "loss": 0.4577, "mean_token_accuracy": 0.8548380173742771, "num_tokens": 1006322782.0, "step": 31531 }, { "entropy": 0.44858345040120184, "epoch": 2.9011104018953313, "grad_norm": 0.15546540915966034, "learning_rate": 3.2999049283896098e-06, "loss": 0.4347, "mean_token_accuracy": 0.8588090427219868, "num_tokens": 1006354618.0, "step": 31532 }, { "entropy": 0.5626152222976089, "epoch": 2.9012024082667724, "grad_norm": 0.16569732129573822, "learning_rate": 3.2968381022479836e-06, "loss": 0.5546, "mean_token_accuracy": 0.8255561701953411, "num_tokens": 1006387011.0, "step": 31533 }, { "entropy": 0.5801016166806221, "epoch": 2.9012944146382136, "grad_norm": 0.16973631083965302, "learning_rate": 3.2937712761063574e-06, "loss": 0.5804, "mean_token_accuracy": 0.820213820785284, "num_tokens": 1006418036.0, "step": 31534 }, { "entropy": 0.5505087310448289, "epoch": 2.901386421009655, "grad_norm": 0.16412346065044403, "learning_rate": 3.2907044499647316e-06, "loss": 0.5457, "mean_token_accuracy": 0.8279671594500542, "num_tokens": 1006449827.0, "step": 31535 }, { "entropy": 0.5310875079594553, "epoch": 2.9014784273810963, "grad_norm": 0.15910454094409943, "learning_rate": 3.2876376238231054e-06, "loss": 0.5223, "mean_token_accuracy": 0.8332143202424049, "num_tokens": 1006481702.0, "step": 31536 }, { "entropy": 0.5936904605478048, "epoch": 2.9015704337525374, "grad_norm": 0.16947390139102936, "learning_rate": 3.28457079768148e-06, "loss": 0.5844, "mean_token_accuracy": 0.8160713464021683, "num_tokens": 1006513545.0, "step": 31537 }, { "entropy": 0.528499536216259, "epoch": 2.9016624401239786, "grad_norm": 0.15993405878543854, "learning_rate": 3.281503971539854e-06, "loss": 0.5142, "mean_token_accuracy": 0.8366597443819046, "num_tokens": 1006545757.0, "step": 31538 }, { "entropy": 0.5646276418119669, "epoch": 2.9017544464954197, "grad_norm": 0.15994174778461456, "learning_rate": 3.2784371453982277e-06, "loss": 0.5512, "mean_token_accuracy": 0.82488664239645, "num_tokens": 1006577568.0, "step": 31539 }, { "entropy": 0.49315325543284416, "epoch": 2.9018464528668613, "grad_norm": 0.15184767544269562, "learning_rate": 3.2753703192566015e-06, "loss": 0.4702, "mean_token_accuracy": 0.8473564386367798, "num_tokens": 1006609353.0, "step": 31540 }, { "entropy": 0.49224151112139225, "epoch": 2.9019384592383024, "grad_norm": 0.16077107191085815, "learning_rate": 3.2723034931149753e-06, "loss": 0.4814, "mean_token_accuracy": 0.8456478528678417, "num_tokens": 1006640494.0, "step": 31541 }, { "entropy": 0.5203180620446801, "epoch": 2.9020304656097435, "grad_norm": 0.16169868409633636, "learning_rate": 3.2692366669733495e-06, "loss": 0.5106, "mean_token_accuracy": 0.8374363072216511, "num_tokens": 1006672577.0, "step": 31542 }, { "entropy": 0.4805606543086469, "epoch": 2.9021224719811847, "grad_norm": 0.15165621042251587, "learning_rate": 3.2661698408317233e-06, "loss": 0.4711, "mean_token_accuracy": 0.8482798710465431, "num_tokens": 1006704794.0, "step": 31543 }, { "entropy": 0.4363651215098798, "epoch": 2.902214478352626, "grad_norm": 0.14829368889331818, "learning_rate": 3.263103014690097e-06, "loss": 0.4236, "mean_token_accuracy": 0.8663235455751419, "num_tokens": 1006737156.0, "step": 31544 }, { "entropy": 0.44634343427605927, "epoch": 2.9023064847240674, "grad_norm": 0.1487882137298584, "learning_rate": 3.2600361885484717e-06, "loss": 0.4368, "mean_token_accuracy": 0.8630665056407452, "num_tokens": 1006769564.0, "step": 31545 }, { "entropy": 0.3983557624742389, "epoch": 2.9023984910955085, "grad_norm": 0.14082013070583344, "learning_rate": 3.2569693624068455e-06, "loss": 0.3898, "mean_token_accuracy": 0.874240018427372, "num_tokens": 1006802190.0, "step": 31546 }, { "entropy": 0.5517287468537688, "epoch": 2.9024904974669496, "grad_norm": 0.167547807097435, "learning_rate": 3.2539025362652193e-06, "loss": 0.542, "mean_token_accuracy": 0.826974093914032, "num_tokens": 1006834788.0, "step": 31547 }, { "entropy": 0.48695842223241925, "epoch": 2.902582503838391, "grad_norm": 0.15513822436332703, "learning_rate": 3.250835710123593e-06, "loss": 0.4788, "mean_token_accuracy": 0.850761853158474, "num_tokens": 1006866406.0, "step": 31548 }, { "entropy": 0.4774362873286009, "epoch": 2.902674510209832, "grad_norm": 0.1580434888601303, "learning_rate": 3.247768883981967e-06, "loss": 0.4659, "mean_token_accuracy": 0.8486513793468475, "num_tokens": 1006898755.0, "step": 31549 }, { "entropy": 0.5447227703407407, "epoch": 2.9027665165812735, "grad_norm": 0.16247224807739258, "learning_rate": 3.244702057840341e-06, "loss": 0.5258, "mean_token_accuracy": 0.8319791480898857, "num_tokens": 1006930676.0, "step": 31550 }, { "entropy": 0.5153209650889039, "epoch": 2.9028585229527146, "grad_norm": 0.16143395006656647, "learning_rate": 3.241635231698715e-06, "loss": 0.5084, "mean_token_accuracy": 0.8381151780486107, "num_tokens": 1006962402.0, "step": 31551 }, { "entropy": 0.5157618727535009, "epoch": 2.9029505293241558, "grad_norm": 0.1645643264055252, "learning_rate": 3.2385684055570896e-06, "loss": 0.5155, "mean_token_accuracy": 0.8378011956810951, "num_tokens": 1006994289.0, "step": 31552 }, { "entropy": 0.5140593273099512, "epoch": 2.903042535695597, "grad_norm": 0.15574456751346588, "learning_rate": 3.2355015794154634e-06, "loss": 0.5009, "mean_token_accuracy": 0.8430406861007214, "num_tokens": 1007025705.0, "step": 31553 }, { "entropy": 0.44442208111286163, "epoch": 2.903134542067038, "grad_norm": 0.15221352875232697, "learning_rate": 3.232434753273837e-06, "loss": 0.4339, "mean_token_accuracy": 0.8613984175026417, "num_tokens": 1007057996.0, "step": 31554 }, { "entropy": 0.5976265127537772, "epoch": 2.9032265484384796, "grad_norm": 0.16906780004501343, "learning_rate": 3.229367927132211e-06, "loss": 0.5859, "mean_token_accuracy": 0.8168173618614674, "num_tokens": 1007090113.0, "step": 31555 }, { "entropy": 0.42008482583332807, "epoch": 2.9033185548099207, "grad_norm": 0.15009652078151703, "learning_rate": 3.226301100990585e-06, "loss": 0.4087, "mean_token_accuracy": 0.8696645349264145, "num_tokens": 1007122075.0, "step": 31556 }, { "entropy": 0.4837853229837492, "epoch": 2.903410561181362, "grad_norm": 0.1521686613559723, "learning_rate": 3.223234274848959e-06, "loss": 0.4691, "mean_token_accuracy": 0.8499681241810322, "num_tokens": 1007154085.0, "step": 31557 }, { "entropy": 0.5702483151108027, "epoch": 2.903502567552803, "grad_norm": 0.1626317948102951, "learning_rate": 3.220167448707333e-06, "loss": 0.5547, "mean_token_accuracy": 0.824523564428091, "num_tokens": 1007186492.0, "step": 31558 }, { "entropy": 0.5154353734105825, "epoch": 2.903594573924244, "grad_norm": 0.15318149328231812, "learning_rate": 3.2171006225657066e-06, "loss": 0.5076, "mean_token_accuracy": 0.8394853994250298, "num_tokens": 1007218819.0, "step": 31559 }, { "entropy": 0.5383674055337906, "epoch": 2.9036865802956857, "grad_norm": 0.16433897614479065, "learning_rate": 3.2140337964240813e-06, "loss": 0.5302, "mean_token_accuracy": 0.8298264853656292, "num_tokens": 1007250460.0, "step": 31560 }, { "entropy": 0.5043973792344332, "epoch": 2.903778586667127, "grad_norm": 0.16186104714870453, "learning_rate": 3.210966970282455e-06, "loss": 0.4832, "mean_token_accuracy": 0.8456127643585205, "num_tokens": 1007281344.0, "step": 31561 }, { "entropy": 0.5687700640410185, "epoch": 2.903870593038568, "grad_norm": 0.16750314831733704, "learning_rate": 3.207900144140829e-06, "loss": 0.5557, "mean_token_accuracy": 0.8209189362823963, "num_tokens": 1007312178.0, "step": 31562 }, { "entropy": 0.4772051442414522, "epoch": 2.903962599410009, "grad_norm": 0.15277297794818878, "learning_rate": 3.2048333179992027e-06, "loss": 0.4686, "mean_token_accuracy": 0.852705430239439, "num_tokens": 1007344411.0, "step": 31563 }, { "entropy": 0.5629870644770563, "epoch": 2.9040546057814502, "grad_norm": 0.15945376455783844, "learning_rate": 3.2017664918575765e-06, "loss": 0.5502, "mean_token_accuracy": 0.8277216777205467, "num_tokens": 1007376551.0, "step": 31564 }, { "entropy": 0.5501813343726099, "epoch": 2.904146612152892, "grad_norm": 0.16777487099170685, "learning_rate": 3.1986996657159507e-06, "loss": 0.5405, "mean_token_accuracy": 0.8289535008370876, "num_tokens": 1007408468.0, "step": 31565 }, { "entropy": 0.42640900146216154, "epoch": 2.904238618524333, "grad_norm": 0.14660978317260742, "learning_rate": 3.1956328395743245e-06, "loss": 0.4059, "mean_token_accuracy": 0.8707652613520622, "num_tokens": 1007440400.0, "step": 31566 }, { "entropy": 0.426222356967628, "epoch": 2.904330624895774, "grad_norm": 0.14701193571090698, "learning_rate": 3.1925660134326983e-06, "loss": 0.4144, "mean_token_accuracy": 0.8651508241891861, "num_tokens": 1007472256.0, "step": 31567 }, { "entropy": 0.5582355819642544, "epoch": 2.9044226312672152, "grad_norm": 0.16503295302391052, "learning_rate": 3.189499187291073e-06, "loss": 0.5539, "mean_token_accuracy": 0.8249890953302383, "num_tokens": 1007504310.0, "step": 31568 }, { "entropy": 0.485361160710454, "epoch": 2.9045146376386564, "grad_norm": 0.15477268397808075, "learning_rate": 3.1864323611494468e-06, "loss": 0.4726, "mean_token_accuracy": 0.8486686050891876, "num_tokens": 1007536309.0, "step": 31569 }, { "entropy": 0.5523416865617037, "epoch": 2.904606644010098, "grad_norm": 0.16727662086486816, "learning_rate": 3.1833655350078206e-06, "loss": 0.5472, "mean_token_accuracy": 0.8275586292147636, "num_tokens": 1007568573.0, "step": 31570 }, { "entropy": 0.5313183572143316, "epoch": 2.904698650381539, "grad_norm": 0.15975676476955414, "learning_rate": 3.1802987088661944e-06, "loss": 0.52, "mean_token_accuracy": 0.8332741968333721, "num_tokens": 1007600118.0, "step": 31571 }, { "entropy": 0.5841391105204821, "epoch": 2.90479065675298, "grad_norm": 0.16703222692012787, "learning_rate": 3.1772318827245686e-06, "loss": 0.5634, "mean_token_accuracy": 0.8201775662600994, "num_tokens": 1007632088.0, "step": 31572 }, { "entropy": 0.6021374445408583, "epoch": 2.9048826631244213, "grad_norm": 0.16688482463359833, "learning_rate": 3.1741650565829424e-06, "loss": 0.5897, "mean_token_accuracy": 0.8147394917905331, "num_tokens": 1007664319.0, "step": 31573 }, { "entropy": 0.5454305512830615, "epoch": 2.9049746694958625, "grad_norm": 0.16014398634433746, "learning_rate": 3.171098230441316e-06, "loss": 0.534, "mean_token_accuracy": 0.8307584263384342, "num_tokens": 1007697087.0, "step": 31574 }, { "entropy": 0.4904369255527854, "epoch": 2.905066675867304, "grad_norm": 0.15288996696472168, "learning_rate": 3.168031404299691e-06, "loss": 0.4751, "mean_token_accuracy": 0.8490511178970337, "num_tokens": 1007729533.0, "step": 31575 }, { "entropy": 0.5232648253440857, "epoch": 2.905158682238745, "grad_norm": 0.15664124488830566, "learning_rate": 3.1649645781580646e-06, "loss": 0.517, "mean_token_accuracy": 0.8378329128026962, "num_tokens": 1007761759.0, "step": 31576 }, { "entropy": 0.4304900458082557, "epoch": 2.9052506886101863, "grad_norm": 0.143419548869133, "learning_rate": 3.1618977520164384e-06, "loss": 0.4272, "mean_token_accuracy": 0.8625184558331966, "num_tokens": 1007794374.0, "step": 31577 }, { "entropy": 0.5753717888146639, "epoch": 2.9053426949816274, "grad_norm": 0.16931338608264923, "learning_rate": 3.1588309258748122e-06, "loss": 0.5635, "mean_token_accuracy": 0.8203911669552326, "num_tokens": 1007826484.0, "step": 31578 }, { "entropy": 0.4707006346434355, "epoch": 2.9054347013530686, "grad_norm": 0.15341539680957794, "learning_rate": 3.155764099733186e-06, "loss": 0.4599, "mean_token_accuracy": 0.8533500507473946, "num_tokens": 1007858436.0, "step": 31579 }, { "entropy": 0.48521264689043164, "epoch": 2.90552670772451, "grad_norm": 0.15396103262901306, "learning_rate": 3.1526972735915603e-06, "loss": 0.4725, "mean_token_accuracy": 0.8531202338635921, "num_tokens": 1007889677.0, "step": 31580 }, { "entropy": 0.5183248305693269, "epoch": 2.9056187140959513, "grad_norm": 0.1544097512960434, "learning_rate": 3.149630447449934e-06, "loss": 0.5129, "mean_token_accuracy": 0.8386948518455029, "num_tokens": 1007922206.0, "step": 31581 }, { "entropy": 0.5512849506922066, "epoch": 2.9057107204673924, "grad_norm": 0.16731055080890656, "learning_rate": 3.146563621308308e-06, "loss": 0.5313, "mean_token_accuracy": 0.8321472108364105, "num_tokens": 1007953375.0, "step": 31582 }, { "entropy": 0.48357674677390605, "epoch": 2.9058027268388336, "grad_norm": 0.15476591885089874, "learning_rate": 3.1434967951666825e-06, "loss": 0.462, "mean_token_accuracy": 0.854445319622755, "num_tokens": 1007984286.0, "step": 31583 }, { "entropy": 0.44135486718732864, "epoch": 2.9058947332102747, "grad_norm": 0.14640596508979797, "learning_rate": 3.1404299690250563e-06, "loss": 0.4345, "mean_token_accuracy": 0.8573675341904163, "num_tokens": 1008016445.0, "step": 31584 }, { "entropy": 0.44826501328498125, "epoch": 2.9059867395817163, "grad_norm": 0.14845646917819977, "learning_rate": 3.13736314288343e-06, "loss": 0.4288, "mean_token_accuracy": 0.8602013476192951, "num_tokens": 1008048478.0, "step": 31585 }, { "entropy": 0.5641799729783088, "epoch": 2.9060787459531574, "grad_norm": 0.1607801616191864, "learning_rate": 3.134296316741804e-06, "loss": 0.5546, "mean_token_accuracy": 0.826539658010006, "num_tokens": 1008080284.0, "step": 31586 }, { "entropy": 0.38239237666130066, "epoch": 2.9061707523245985, "grad_norm": 0.14188101887702942, "learning_rate": 3.131229490600178e-06, "loss": 0.3774, "mean_token_accuracy": 0.8783796317875385, "num_tokens": 1008112622.0, "step": 31587 }, { "entropy": 0.45367622282356024, "epoch": 2.9062627586960397, "grad_norm": 0.15234455466270447, "learning_rate": 3.128162664458552e-06, "loss": 0.4502, "mean_token_accuracy": 0.8561719246208668, "num_tokens": 1008144393.0, "step": 31588 }, { "entropy": 0.5354903251864016, "epoch": 2.906354765067481, "grad_norm": 0.16315287351608276, "learning_rate": 3.1250958383169257e-06, "loss": 0.5329, "mean_token_accuracy": 0.8304736651480198, "num_tokens": 1008176406.0, "step": 31589 }, { "entropy": 0.523020414635539, "epoch": 2.9064467714389224, "grad_norm": 0.14952205121517181, "learning_rate": 3.1220290121753e-06, "loss": 0.5062, "mean_token_accuracy": 0.8380216136574745, "num_tokens": 1008208994.0, "step": 31590 }, { "entropy": 0.4147814222378656, "epoch": 2.9065387778103635, "grad_norm": 0.14092965424060822, "learning_rate": 3.1189621860336738e-06, "loss": 0.4012, "mean_token_accuracy": 0.8715152516961098, "num_tokens": 1008240996.0, "step": 31591 }, { "entropy": 0.5402420293539762, "epoch": 2.9066307841818046, "grad_norm": 0.1651100218296051, "learning_rate": 3.115895359892048e-06, "loss": 0.5275, "mean_token_accuracy": 0.8329867795109749, "num_tokens": 1008272053.0, "step": 31592 }, { "entropy": 0.467072163708508, "epoch": 2.906722790553246, "grad_norm": 0.15561813116073608, "learning_rate": 3.1128285337504218e-06, "loss": 0.4606, "mean_token_accuracy": 0.8503327332437038, "num_tokens": 1008303540.0, "step": 31593 }, { "entropy": 0.5088983926689252, "epoch": 2.906814796924687, "grad_norm": 0.1508224904537201, "learning_rate": 3.1097617076087956e-06, "loss": 0.4873, "mean_token_accuracy": 0.8431078344583511, "num_tokens": 1008335539.0, "step": 31594 }, { "entropy": 0.5376829076558352, "epoch": 2.9069068032961285, "grad_norm": 0.1598944216966629, "learning_rate": 3.10669488146717e-06, "loss": 0.5393, "mean_token_accuracy": 0.8318348787724972, "num_tokens": 1008367649.0, "step": 31595 }, { "entropy": 0.5486671943217516, "epoch": 2.9069988096675696, "grad_norm": 0.1632557213306427, "learning_rate": 3.103628055325544e-06, "loss": 0.5438, "mean_token_accuracy": 0.8290096558630466, "num_tokens": 1008400096.0, "step": 31596 }, { "entropy": 0.5329328905791044, "epoch": 2.9070908160390108, "grad_norm": 0.1665772944688797, "learning_rate": 3.100561229183918e-06, "loss": 0.5318, "mean_token_accuracy": 0.8359791226685047, "num_tokens": 1008431966.0, "step": 31597 }, { "entropy": 0.5627332236617804, "epoch": 2.907182822410452, "grad_norm": 0.16651403903961182, "learning_rate": 3.0974944030422916e-06, "loss": 0.5449, "mean_token_accuracy": 0.8278806582093239, "num_tokens": 1008463366.0, "step": 31598 }, { "entropy": 0.4963144166395068, "epoch": 2.907274828781893, "grad_norm": 0.15680305659770966, "learning_rate": 3.0944275769006654e-06, "loss": 0.4993, "mean_token_accuracy": 0.8424457423388958, "num_tokens": 1008495824.0, "step": 31599 }, { "entropy": 0.49684586841613054, "epoch": 2.9073668351533346, "grad_norm": 0.15986284613609314, "learning_rate": 3.0913607507590397e-06, "loss": 0.4832, "mean_token_accuracy": 0.8449944332242012, "num_tokens": 1008526688.0, "step": 31600 }, { "entropy": 0.4465630556223914, "epoch": 2.9074588415247757, "grad_norm": 0.15352092683315277, "learning_rate": 3.0882939246174135e-06, "loss": 0.4371, "mean_token_accuracy": 0.859958179295063, "num_tokens": 1008558371.0, "step": 31601 }, { "entropy": 0.5683343876153231, "epoch": 2.907550847896217, "grad_norm": 0.16791731119155884, "learning_rate": 3.0852270984757877e-06, "loss": 0.5479, "mean_token_accuracy": 0.8253293819725513, "num_tokens": 1008590056.0, "step": 31602 }, { "entropy": 0.47182382084429264, "epoch": 2.907642854267658, "grad_norm": 0.1548403948545456, "learning_rate": 3.0821602723341615e-06, "loss": 0.4582, "mean_token_accuracy": 0.8579439520835876, "num_tokens": 1008621538.0, "step": 31603 }, { "entropy": 0.5265463758260012, "epoch": 2.907734860639099, "grad_norm": 0.16188135743141174, "learning_rate": 3.0790934461925357e-06, "loss": 0.5078, "mean_token_accuracy": 0.8370391577482224, "num_tokens": 1008653089.0, "step": 31604 }, { "entropy": 0.50462656468153, "epoch": 2.9078268670105407, "grad_norm": 0.1613793820142746, "learning_rate": 3.0760266200509095e-06, "loss": 0.4977, "mean_token_accuracy": 0.8408206887543201, "num_tokens": 1008685235.0, "step": 31605 }, { "entropy": 0.5778474592370912, "epoch": 2.907918873381982, "grad_norm": 0.1656084656715393, "learning_rate": 3.0729597939092833e-06, "loss": 0.5714, "mean_token_accuracy": 0.8184494152665138, "num_tokens": 1008716820.0, "step": 31606 }, { "entropy": 0.5489211669191718, "epoch": 2.908010879753423, "grad_norm": 0.15710194408893585, "learning_rate": 3.069892967767657e-06, "loss": 0.5348, "mean_token_accuracy": 0.8354113735258579, "num_tokens": 1008748529.0, "step": 31607 }, { "entropy": 0.5889763366430998, "epoch": 2.908102886124864, "grad_norm": 0.16712027788162231, "learning_rate": 3.0668261416260313e-06, "loss": 0.576, "mean_token_accuracy": 0.8192365430295467, "num_tokens": 1008780638.0, "step": 31608 }, { "entropy": 0.5734177827835083, "epoch": 2.9081948924963053, "grad_norm": 0.16682463884353638, "learning_rate": 3.063759315484405e-06, "loss": 0.5614, "mean_token_accuracy": 0.8195853754878044, "num_tokens": 1008812375.0, "step": 31609 }, { "entropy": 0.4877708191052079, "epoch": 2.908286898867747, "grad_norm": 0.15251833200454712, "learning_rate": 3.0606924893427794e-06, "loss": 0.4744, "mean_token_accuracy": 0.8501756452023983, "num_tokens": 1008844696.0, "step": 31610 }, { "entropy": 0.5730983931571245, "epoch": 2.908378905239188, "grad_norm": 0.16584867238998413, "learning_rate": 3.0576256632011536e-06, "loss": 0.5637, "mean_token_accuracy": 0.8238728120923042, "num_tokens": 1008876030.0, "step": 31611 }, { "entropy": 0.5097004637354985, "epoch": 2.908470911610629, "grad_norm": 0.1519850343465805, "learning_rate": 3.0545588370595274e-06, "loss": 0.5002, "mean_token_accuracy": 0.8448539115488529, "num_tokens": 1008908652.0, "step": 31612 }, { "entropy": 0.5208407770842314, "epoch": 2.9085629179820702, "grad_norm": 0.15480978786945343, "learning_rate": 3.051492010917901e-06, "loss": 0.5068, "mean_token_accuracy": 0.8413561061024666, "num_tokens": 1008940765.0, "step": 31613 }, { "entropy": 0.4764237739145756, "epoch": 2.9086549243535114, "grad_norm": 0.15402160584926605, "learning_rate": 3.048425184776275e-06, "loss": 0.4638, "mean_token_accuracy": 0.851925864815712, "num_tokens": 1008971962.0, "step": 31614 }, { "entropy": 0.474448140244931, "epoch": 2.908746930724953, "grad_norm": 0.15485703945159912, "learning_rate": 3.045358358634649e-06, "loss": 0.4722, "mean_token_accuracy": 0.8528354056179523, "num_tokens": 1009003957.0, "step": 31615 }, { "entropy": 0.5162083068862557, "epoch": 2.908838937096394, "grad_norm": 0.15733757615089417, "learning_rate": 3.042291532493023e-06, "loss": 0.5048, "mean_token_accuracy": 0.8399391658604145, "num_tokens": 1009036581.0, "step": 31616 }, { "entropy": 0.6146967275999486, "epoch": 2.908930943467835, "grad_norm": 0.174052432179451, "learning_rate": 3.0392247063513972e-06, "loss": 0.6107, "mean_token_accuracy": 0.8150640837848186, "num_tokens": 1009067504.0, "step": 31617 }, { "entropy": 0.5351252045948058, "epoch": 2.9090229498392763, "grad_norm": 0.1624765694141388, "learning_rate": 3.036157880209771e-06, "loss": 0.5258, "mean_token_accuracy": 0.8374026976525784, "num_tokens": 1009099049.0, "step": 31618 }, { "entropy": 0.5386321740224957, "epoch": 2.9091149562107175, "grad_norm": 0.16007831692695618, "learning_rate": 3.0330910540681453e-06, "loss": 0.5181, "mean_token_accuracy": 0.8370063751935959, "num_tokens": 1009130916.0, "step": 31619 }, { "entropy": 0.5071009285748005, "epoch": 2.909206962582159, "grad_norm": 0.1553984433412552, "learning_rate": 3.030024227926519e-06, "loss": 0.4916, "mean_token_accuracy": 0.8436948098242283, "num_tokens": 1009163342.0, "step": 31620 }, { "entropy": 0.5736031970009208, "epoch": 2.9092989689536, "grad_norm": 0.16804218292236328, "learning_rate": 3.026957401784893e-06, "loss": 0.5484, "mean_token_accuracy": 0.8233486972749233, "num_tokens": 1009195056.0, "step": 31621 }, { "entropy": 0.49400392500683665, "epoch": 2.9093909753250413, "grad_norm": 0.15106551349163055, "learning_rate": 3.0238905756432667e-06, "loss": 0.4827, "mean_token_accuracy": 0.8447491750121117, "num_tokens": 1009226796.0, "step": 31622 }, { "entropy": 0.5841475054621696, "epoch": 2.9094829816964825, "grad_norm": 0.1668873280286789, "learning_rate": 3.020823749501641e-06, "loss": 0.5775, "mean_token_accuracy": 0.8199221938848495, "num_tokens": 1009259029.0, "step": 31623 }, { "entropy": 0.45760053861886263, "epoch": 2.9095749880679236, "grad_norm": 0.15325871109962463, "learning_rate": 3.017756923360015e-06, "loss": 0.4452, "mean_token_accuracy": 0.8581708446145058, "num_tokens": 1009291372.0, "step": 31624 }, { "entropy": 0.5139081878587604, "epoch": 2.909666994439365, "grad_norm": 0.1532834768295288, "learning_rate": 3.014690097218389e-06, "loss": 0.5024, "mean_token_accuracy": 0.8392605371773243, "num_tokens": 1009323857.0, "step": 31625 }, { "entropy": 0.4610051040071994, "epoch": 2.9097590008108063, "grad_norm": 0.14767156541347504, "learning_rate": 3.0116232710767627e-06, "loss": 0.4436, "mean_token_accuracy": 0.8603173233568668, "num_tokens": 1009355377.0, "step": 31626 }, { "entropy": 0.4651310946792364, "epoch": 2.9098510071822474, "grad_norm": 0.14925280213356018, "learning_rate": 3.008556444935137e-06, "loss": 0.4434, "mean_token_accuracy": 0.8560331836342812, "num_tokens": 1009387501.0, "step": 31627 }, { "entropy": 0.5012597348541021, "epoch": 2.9099430135536886, "grad_norm": 0.15255172550678253, "learning_rate": 3.0054896187935107e-06, "loss": 0.4808, "mean_token_accuracy": 0.8470074981451035, "num_tokens": 1009419178.0, "step": 31628 }, { "entropy": 0.5060306899249554, "epoch": 2.9100350199251297, "grad_norm": 0.15836448967456818, "learning_rate": 3.0024227926518845e-06, "loss": 0.4865, "mean_token_accuracy": 0.8448220826685429, "num_tokens": 1009449372.0, "step": 31629 }, { "entropy": 0.5651253085816279, "epoch": 2.9101270262965713, "grad_norm": 0.17296932637691498, "learning_rate": 2.9993559665102583e-06, "loss": 0.5501, "mean_token_accuracy": 0.8253622390329838, "num_tokens": 1009480711.0, "step": 31630 }, { "entropy": 0.4658669624477625, "epoch": 2.9102190326680124, "grad_norm": 0.14268329739570618, "learning_rate": 2.9962891403686326e-06, "loss": 0.4487, "mean_token_accuracy": 0.8566499724984169, "num_tokens": 1009513479.0, "step": 31631 }, { "entropy": 0.5145214814692736, "epoch": 2.9103110390394535, "grad_norm": 0.15145088732242584, "learning_rate": 2.9932223142270068e-06, "loss": 0.4994, "mean_token_accuracy": 0.8436353839933872, "num_tokens": 1009545699.0, "step": 31632 }, { "entropy": 0.597349239513278, "epoch": 2.9104030454108947, "grad_norm": 0.16990788280963898, "learning_rate": 2.9901554880853806e-06, "loss": 0.5872, "mean_token_accuracy": 0.8133483491837978, "num_tokens": 1009577332.0, "step": 31633 }, { "entropy": 0.42105412809178233, "epoch": 2.910495051782336, "grad_norm": 0.14672738313674927, "learning_rate": 2.987088661943755e-06, "loss": 0.4202, "mean_token_accuracy": 0.8680449463427067, "num_tokens": 1009609189.0, "step": 31634 }, { "entropy": 0.44890528451651335, "epoch": 2.9105870581537774, "grad_norm": 0.15114480257034302, "learning_rate": 2.9840218358021286e-06, "loss": 0.4385, "mean_token_accuracy": 0.8588906191289425, "num_tokens": 1009640403.0, "step": 31635 }, { "entropy": 0.54056769865565, "epoch": 2.9106790645252185, "grad_norm": 0.1671488732099533, "learning_rate": 2.9809550096605024e-06, "loss": 0.5266, "mean_token_accuracy": 0.8316262289881706, "num_tokens": 1009671175.0, "step": 31636 }, { "entropy": 0.48831605073064566, "epoch": 2.9107710708966597, "grad_norm": 0.15273576974868774, "learning_rate": 2.977888183518876e-06, "loss": 0.4731, "mean_token_accuracy": 0.8499517627060413, "num_tokens": 1009703404.0, "step": 31637 }, { "entropy": 0.5255767293274403, "epoch": 2.910863077268101, "grad_norm": 0.16143545508384705, "learning_rate": 2.9748213573772504e-06, "loss": 0.5207, "mean_token_accuracy": 0.8391364812850952, "num_tokens": 1009735496.0, "step": 31638 }, { "entropy": 0.4433043079916388, "epoch": 2.910955083639542, "grad_norm": 0.14718285202980042, "learning_rate": 2.9717545312356247e-06, "loss": 0.428, "mean_token_accuracy": 0.8628178425133228, "num_tokens": 1009767302.0, "step": 31639 }, { "entropy": 0.48239945131354034, "epoch": 2.9110470900109835, "grad_norm": 0.15507185459136963, "learning_rate": 2.9686877050939985e-06, "loss": 0.4646, "mean_token_accuracy": 0.8497467152774334, "num_tokens": 1009797807.0, "step": 31640 }, { "entropy": 0.5009360015392303, "epoch": 2.9111390963824246, "grad_norm": 0.1556379348039627, "learning_rate": 2.9656208789523723e-06, "loss": 0.4908, "mean_token_accuracy": 0.8442758470773697, "num_tokens": 1009829309.0, "step": 31641 }, { "entropy": 0.5162770971655846, "epoch": 2.9112311027538658, "grad_norm": 0.1584232896566391, "learning_rate": 2.9625540528107465e-06, "loss": 0.5134, "mean_token_accuracy": 0.8397867940366268, "num_tokens": 1009861638.0, "step": 31642 }, { "entropy": 0.4839450251311064, "epoch": 2.911323109125307, "grad_norm": 0.15905074775218964, "learning_rate": 2.9594872266691203e-06, "loss": 0.473, "mean_token_accuracy": 0.8480511084198952, "num_tokens": 1009894121.0, "step": 31643 }, { "entropy": 0.5286220572888851, "epoch": 2.911415115496748, "grad_norm": 0.15655481815338135, "learning_rate": 2.956420400527494e-06, "loss": 0.5124, "mean_token_accuracy": 0.8372854292392731, "num_tokens": 1009925597.0, "step": 31644 }, { "entropy": 0.5160848796367645, "epoch": 2.9115071218681896, "grad_norm": 0.1584775447845459, "learning_rate": 2.953353574385868e-06, "loss": 0.5079, "mean_token_accuracy": 0.8367670737206936, "num_tokens": 1009958064.0, "step": 31645 }, { "entropy": 0.6534235496073961, "epoch": 2.9115991282396307, "grad_norm": 0.17550985515117645, "learning_rate": 2.950286748244242e-06, "loss": 0.64, "mean_token_accuracy": 0.7986322306096554, "num_tokens": 1009990485.0, "step": 31646 }, { "entropy": 0.5132122915238142, "epoch": 2.911691134611072, "grad_norm": 0.1604534387588501, "learning_rate": 2.9472199221026163e-06, "loss": 0.513, "mean_token_accuracy": 0.8361475095152855, "num_tokens": 1010022753.0, "step": 31647 }, { "entropy": 0.5409465436823666, "epoch": 2.911783140982513, "grad_norm": 0.15687209367752075, "learning_rate": 2.94415309596099e-06, "loss": 0.526, "mean_token_accuracy": 0.8322770409286022, "num_tokens": 1010055360.0, "step": 31648 }, { "entropy": 0.5523829339072108, "epoch": 2.911875147353954, "grad_norm": 0.16190841794013977, "learning_rate": 2.941086269819364e-06, "loss": 0.5464, "mean_token_accuracy": 0.8304870240390301, "num_tokens": 1010087520.0, "step": 31649 }, { "entropy": 0.41511599090881646, "epoch": 2.9119671537253957, "grad_norm": 0.14611946046352386, "learning_rate": 2.938019443677738e-06, "loss": 0.4076, "mean_token_accuracy": 0.8696324005723, "num_tokens": 1010119107.0, "step": 31650 }, { "entropy": 0.49565735552459955, "epoch": 2.912059160096837, "grad_norm": 0.1546175181865692, "learning_rate": 2.934952617536112e-06, "loss": 0.4759, "mean_token_accuracy": 0.8512743040919304, "num_tokens": 1010151012.0, "step": 31651 }, { "entropy": 0.5509389787912369, "epoch": 2.912151166468278, "grad_norm": 0.16450297832489014, "learning_rate": 2.9318857913944858e-06, "loss": 0.5312, "mean_token_accuracy": 0.832123164087534, "num_tokens": 1010182932.0, "step": 31652 }, { "entropy": 0.5375024452805519, "epoch": 2.912243172839719, "grad_norm": 0.16287247836589813, "learning_rate": 2.92881896525286e-06, "loss": 0.5258, "mean_token_accuracy": 0.8361030966043472, "num_tokens": 1010214255.0, "step": 31653 }, { "entropy": 0.4236013904446736, "epoch": 2.9123351792111603, "grad_norm": 0.15103203058242798, "learning_rate": 2.925752139111234e-06, "loss": 0.425, "mean_token_accuracy": 0.8668359071016312, "num_tokens": 1010246360.0, "step": 31654 }, { "entropy": 0.45108175836503506, "epoch": 2.912427185582602, "grad_norm": 0.14598585665225983, "learning_rate": 2.922685312969608e-06, "loss": 0.436, "mean_token_accuracy": 0.8573505394160748, "num_tokens": 1010278690.0, "step": 31655 }, { "entropy": 0.4998539686203003, "epoch": 2.912519191954043, "grad_norm": 0.1612376570701599, "learning_rate": 2.919618486827982e-06, "loss": 0.4863, "mean_token_accuracy": 0.8435728549957275, "num_tokens": 1010310936.0, "step": 31656 }, { "entropy": 0.5131943188607693, "epoch": 2.912611198325484, "grad_norm": 0.15934942662715912, "learning_rate": 2.916551660686356e-06, "loss": 0.498, "mean_token_accuracy": 0.8429062999784946, "num_tokens": 1010343256.0, "step": 31657 }, { "entropy": 0.5321753183379769, "epoch": 2.9127032046969252, "grad_norm": 0.16112186014652252, "learning_rate": 2.91348483454473e-06, "loss": 0.5192, "mean_token_accuracy": 0.8335392735898495, "num_tokens": 1010375069.0, "step": 31658 }, { "entropy": 0.4927747920155525, "epoch": 2.9127952110683664, "grad_norm": 0.15587098896503448, "learning_rate": 2.9104180084031036e-06, "loss": 0.4793, "mean_token_accuracy": 0.8482653498649597, "num_tokens": 1010406957.0, "step": 31659 }, { "entropy": 0.5061252880841494, "epoch": 2.912887217439808, "grad_norm": 0.15851615369319916, "learning_rate": 2.9073511822614774e-06, "loss": 0.4971, "mean_token_accuracy": 0.8420426174998283, "num_tokens": 1010438593.0, "step": 31660 }, { "entropy": 0.4822808550670743, "epoch": 2.912979223811249, "grad_norm": 0.14951299130916595, "learning_rate": 2.9042843561198517e-06, "loss": 0.4641, "mean_token_accuracy": 0.8513177409768105, "num_tokens": 1010470791.0, "step": 31661 }, { "entropy": 0.5065961740911007, "epoch": 2.91307123018269, "grad_norm": 0.1535574495792389, "learning_rate": 2.901217529978226e-06, "loss": 0.483, "mean_token_accuracy": 0.84660205245018, "num_tokens": 1010503047.0, "step": 31662 }, { "entropy": 0.52178855240345, "epoch": 2.9131632365541313, "grad_norm": 0.16166672110557556, "learning_rate": 2.8981507038365997e-06, "loss": 0.5141, "mean_token_accuracy": 0.8348442874848843, "num_tokens": 1010534532.0, "step": 31663 }, { "entropy": 0.5033799186348915, "epoch": 2.9132552429255725, "grad_norm": 0.15941636264324188, "learning_rate": 2.8950838776949735e-06, "loss": 0.5016, "mean_token_accuracy": 0.8387733176350594, "num_tokens": 1010567204.0, "step": 31664 }, { "entropy": 0.6181393302977085, "epoch": 2.913347249297014, "grad_norm": 0.1771569401025772, "learning_rate": 2.8920170515533477e-06, "loss": 0.6033, "mean_token_accuracy": 0.8109242916107178, "num_tokens": 1010598945.0, "step": 31665 }, { "entropy": 0.41257854271680117, "epoch": 2.913439255668455, "grad_norm": 0.14270257949829102, "learning_rate": 2.8889502254117215e-06, "loss": 0.3988, "mean_token_accuracy": 0.8723224177956581, "num_tokens": 1010630978.0, "step": 31666 }, { "entropy": 0.5051873670890927, "epoch": 2.9135312620398963, "grad_norm": 0.1536223292350769, "learning_rate": 2.8858833992700953e-06, "loss": 0.4938, "mean_token_accuracy": 0.8453224152326584, "num_tokens": 1010663746.0, "step": 31667 }, { "entropy": 0.5252764374017715, "epoch": 2.9136232684113375, "grad_norm": 0.15574558079242706, "learning_rate": 2.8828165731284695e-06, "loss": 0.5002, "mean_token_accuracy": 0.8394999839365482, "num_tokens": 1010696338.0, "step": 31668 }, { "entropy": 0.4795083049684763, "epoch": 2.9137152747827786, "grad_norm": 0.15101025998592377, "learning_rate": 2.8797497469868437e-06, "loss": 0.4751, "mean_token_accuracy": 0.8502002954483032, "num_tokens": 1010728525.0, "step": 31669 }, { "entropy": 0.4987202435731888, "epoch": 2.91380728115422, "grad_norm": 0.15657947957515717, "learning_rate": 2.8766829208452175e-06, "loss": 0.4711, "mean_token_accuracy": 0.8452239595353603, "num_tokens": 1010760052.0, "step": 31670 }, { "entropy": 0.5420360490679741, "epoch": 2.9138992875256613, "grad_norm": 0.16103225946426392, "learning_rate": 2.8736160947035914e-06, "loss": 0.5287, "mean_token_accuracy": 0.830456081777811, "num_tokens": 1010792753.0, "step": 31671 }, { "entropy": 0.5478196805343032, "epoch": 2.9139912938971024, "grad_norm": 0.16446156799793243, "learning_rate": 2.8705492685619656e-06, "loss": 0.5268, "mean_token_accuracy": 0.8366538919508457, "num_tokens": 1010824423.0, "step": 31672 }, { "entropy": 0.5007362198084593, "epoch": 2.9140833002685436, "grad_norm": 0.16428814828395844, "learning_rate": 2.8674824424203394e-06, "loss": 0.4965, "mean_token_accuracy": 0.8386535234749317, "num_tokens": 1010855863.0, "step": 31673 }, { "entropy": 0.4766214694827795, "epoch": 2.9141753066399847, "grad_norm": 0.1498776227235794, "learning_rate": 2.864415616278713e-06, "loss": 0.466, "mean_token_accuracy": 0.8534175343811512, "num_tokens": 1010888142.0, "step": 31674 }, { "entropy": 0.4307875777594745, "epoch": 2.9142673130114263, "grad_norm": 0.14174772799015045, "learning_rate": 2.861348790137087e-06, "loss": 0.4173, "mean_token_accuracy": 0.8691376373171806, "num_tokens": 1010920523.0, "step": 31675 }, { "entropy": 0.5977502670139074, "epoch": 2.9143593193828674, "grad_norm": 0.16539889574050903, "learning_rate": 2.858281963995461e-06, "loss": 0.576, "mean_token_accuracy": 0.8184392563998699, "num_tokens": 1010952670.0, "step": 31676 }, { "entropy": 0.4964477811008692, "epoch": 2.9144513257543085, "grad_norm": 0.15655851364135742, "learning_rate": 2.8552151378538354e-06, "loss": 0.486, "mean_token_accuracy": 0.8424384295940399, "num_tokens": 1010984902.0, "step": 31677 }, { "entropy": 0.5024928720667958, "epoch": 2.9145433321257497, "grad_norm": 0.161249577999115, "learning_rate": 2.8521483117122092e-06, "loss": 0.497, "mean_token_accuracy": 0.8391375690698624, "num_tokens": 1011016421.0, "step": 31678 }, { "entropy": 0.48950728750787675, "epoch": 2.914635338497191, "grad_norm": 0.14951542019844055, "learning_rate": 2.849081485570583e-06, "loss": 0.4795, "mean_token_accuracy": 0.8512056581676006, "num_tokens": 1011048763.0, "step": 31679 }, { "entropy": 0.6742918267846107, "epoch": 2.9147273448686324, "grad_norm": 0.1776774376630783, "learning_rate": 2.8460146594289572e-06, "loss": 0.6599, "mean_token_accuracy": 0.7956428043544292, "num_tokens": 1011081286.0, "step": 31680 }, { "entropy": 0.4860797682777047, "epoch": 2.9148193512400735, "grad_norm": 0.15313833951950073, "learning_rate": 2.842947833287331e-06, "loss": 0.4818, "mean_token_accuracy": 0.8454750776290894, "num_tokens": 1011114054.0, "step": 31681 }, { "entropy": 0.43394132889807224, "epoch": 2.9149113576115147, "grad_norm": 0.14794811606407166, "learning_rate": 2.839881007145705e-06, "loss": 0.4193, "mean_token_accuracy": 0.8624856323003769, "num_tokens": 1011145834.0, "step": 31682 }, { "entropy": 0.5178061127662659, "epoch": 2.915003363982956, "grad_norm": 0.16045522689819336, "learning_rate": 2.836814181004079e-06, "loss": 0.5101, "mean_token_accuracy": 0.8405504040420055, "num_tokens": 1011177790.0, "step": 31683 }, { "entropy": 0.565799793228507, "epoch": 2.915095370354397, "grad_norm": 0.1662212610244751, "learning_rate": 2.8337473548624533e-06, "loss": 0.5531, "mean_token_accuracy": 0.8223086856305599, "num_tokens": 1011209842.0, "step": 31684 }, { "entropy": 0.4792796600377187, "epoch": 2.9151873767258385, "grad_norm": 0.15776340663433075, "learning_rate": 2.830680528720827e-06, "loss": 0.4685, "mean_token_accuracy": 0.8477111756801605, "num_tokens": 1011241947.0, "step": 31685 }, { "entropy": 0.49656126741319895, "epoch": 2.9152793830972796, "grad_norm": 0.1588110774755478, "learning_rate": 2.827613702579201e-06, "loss": 0.4877, "mean_token_accuracy": 0.8425460010766983, "num_tokens": 1011273465.0, "step": 31686 }, { "entropy": 0.5098253623582423, "epoch": 2.9153713894687208, "grad_norm": 0.16245092451572418, "learning_rate": 2.8245468764375747e-06, "loss": 0.4882, "mean_token_accuracy": 0.842391312122345, "num_tokens": 1011304409.0, "step": 31687 }, { "entropy": 0.49966050893999636, "epoch": 2.915463395840162, "grad_norm": 0.15349076688289642, "learning_rate": 2.821480050295949e-06, "loss": 0.4789, "mean_token_accuracy": 0.8466973677277565, "num_tokens": 1011336336.0, "step": 31688 }, { "entropy": 0.4444881835952401, "epoch": 2.915555402211603, "grad_norm": 0.15310357511043549, "learning_rate": 2.8184132241543227e-06, "loss": 0.432, "mean_token_accuracy": 0.8578585162758827, "num_tokens": 1011368492.0, "step": 31689 }, { "entropy": 0.4998810840770602, "epoch": 2.9156474085830446, "grad_norm": 0.153120756149292, "learning_rate": 2.8153463980126965e-06, "loss": 0.486, "mean_token_accuracy": 0.8432980589568615, "num_tokens": 1011401203.0, "step": 31690 }, { "entropy": 0.5195723855867982, "epoch": 2.9157394149544857, "grad_norm": 0.16672664880752563, "learning_rate": 2.8122795718710707e-06, "loss": 0.5163, "mean_token_accuracy": 0.8379898928105831, "num_tokens": 1011432849.0, "step": 31691 }, { "entropy": 0.4694164600223303, "epoch": 2.915831421325927, "grad_norm": 0.1520937830209732, "learning_rate": 2.809212745729445e-06, "loss": 0.4594, "mean_token_accuracy": 0.8534672595560551, "num_tokens": 1011465228.0, "step": 31692 }, { "entropy": 0.4728469140827656, "epoch": 2.915923427697368, "grad_norm": 0.14774729311466217, "learning_rate": 2.8061459195878188e-06, "loss": 0.459, "mean_token_accuracy": 0.8531510643661022, "num_tokens": 1011497536.0, "step": 31693 }, { "entropy": 0.4884731210768223, "epoch": 2.916015434068809, "grad_norm": 0.15448133647441864, "learning_rate": 2.8030790934461926e-06, "loss": 0.4789, "mean_token_accuracy": 0.8463282585144043, "num_tokens": 1011529536.0, "step": 31694 }, { "entropy": 0.5279954876750708, "epoch": 2.9161074404402507, "grad_norm": 0.15788273513317108, "learning_rate": 2.800012267304567e-06, "loss": 0.5282, "mean_token_accuracy": 0.8332233093678951, "num_tokens": 1011561428.0, "step": 31695 }, { "entropy": 0.5783958751708269, "epoch": 2.916199446811692, "grad_norm": 0.1663161963224411, "learning_rate": 2.7969454411629406e-06, "loss": 0.5704, "mean_token_accuracy": 0.8201868906617165, "num_tokens": 1011593783.0, "step": 31696 }, { "entropy": 0.5686865085735917, "epoch": 2.916291453183133, "grad_norm": 0.1749512106180191, "learning_rate": 2.7938786150213144e-06, "loss": 0.5664, "mean_token_accuracy": 0.8209868296980858, "num_tokens": 1011624135.0, "step": 31697 }, { "entropy": 0.5910235308110714, "epoch": 2.916383459554574, "grad_norm": 0.1704583615064621, "learning_rate": 2.7908117888796886e-06, "loss": 0.5788, "mean_token_accuracy": 0.8196577839553356, "num_tokens": 1011655850.0, "step": 31698 }, { "entropy": 0.5581608153879642, "epoch": 2.9164754659260153, "grad_norm": 0.16311725974082947, "learning_rate": 2.787744962738063e-06, "loss": 0.5475, "mean_token_accuracy": 0.8263854719698429, "num_tokens": 1011687832.0, "step": 31699 }, { "entropy": 0.5480462908744812, "epoch": 2.916567472297457, "grad_norm": 0.16277042031288147, "learning_rate": 2.7846781365964366e-06, "loss": 0.5346, "mean_token_accuracy": 0.829914677888155, "num_tokens": 1011719673.0, "step": 31700 }, { "entropy": 0.47436994686722755, "epoch": 2.916659478668898, "grad_norm": 0.15067608654499054, "learning_rate": 2.7816113104548104e-06, "loss": 0.4578, "mean_token_accuracy": 0.8542046882212162, "num_tokens": 1011752171.0, "step": 31701 }, { "entropy": 0.5510345678776503, "epoch": 2.916751485040339, "grad_norm": 0.16556870937347412, "learning_rate": 2.7785444843131842e-06, "loss": 0.554, "mean_token_accuracy": 0.8255844116210938, "num_tokens": 1011784349.0, "step": 31702 }, { "entropy": 0.5588245241669938, "epoch": 2.9168434914117802, "grad_norm": 0.16403868794441223, "learning_rate": 2.7754776581715585e-06, "loss": 0.5506, "mean_token_accuracy": 0.8235465101897717, "num_tokens": 1011815859.0, "step": 31703 }, { "entropy": 0.5596060156822205, "epoch": 2.9169354977832214, "grad_norm": 0.16525335609912872, "learning_rate": 2.7724108320299323e-06, "loss": 0.5511, "mean_token_accuracy": 0.826134692877531, "num_tokens": 1011847705.0, "step": 31704 }, { "entropy": 0.4598851501941681, "epoch": 2.917027504154663, "grad_norm": 0.15391482412815094, "learning_rate": 2.769344005888306e-06, "loss": 0.444, "mean_token_accuracy": 0.8560588248074055, "num_tokens": 1011879174.0, "step": 31705 }, { "entropy": 0.5082038203254342, "epoch": 2.917119510526104, "grad_norm": 0.16376687586307526, "learning_rate": 2.7662771797466803e-06, "loss": 0.4956, "mean_token_accuracy": 0.8411647006869316, "num_tokens": 1011910749.0, "step": 31706 }, { "entropy": 0.4546252158470452, "epoch": 2.917211516897545, "grad_norm": 0.14843203127384186, "learning_rate": 2.7632103536050545e-06, "loss": 0.4408, "mean_token_accuracy": 0.8593180403113365, "num_tokens": 1011942708.0, "step": 31707 }, { "entropy": 0.5021251305006444, "epoch": 2.9173035232689863, "grad_norm": 0.15559092164039612, "learning_rate": 2.7601435274634283e-06, "loss": 0.4948, "mean_token_accuracy": 0.841538991779089, "num_tokens": 1011974680.0, "step": 31708 }, { "entropy": 0.5452813692390919, "epoch": 2.9173955296404275, "grad_norm": 0.16383862495422363, "learning_rate": 2.757076701321802e-06, "loss": 0.5366, "mean_token_accuracy": 0.8311031237244606, "num_tokens": 1012006598.0, "step": 31709 }, { "entropy": 0.4255920685827732, "epoch": 2.917487536011869, "grad_norm": 0.15354737639427185, "learning_rate": 2.754009875180176e-06, "loss": 0.4166, "mean_token_accuracy": 0.8657374195754528, "num_tokens": 1012037816.0, "step": 31710 }, { "entropy": 0.4680136349052191, "epoch": 2.91757954238331, "grad_norm": 0.1565343588590622, "learning_rate": 2.75094304903855e-06, "loss": 0.4535, "mean_token_accuracy": 0.8556649498641491, "num_tokens": 1012069540.0, "step": 31711 }, { "entropy": 0.5196498169098049, "epoch": 2.9176715487547513, "grad_norm": 0.1571260243654251, "learning_rate": 2.747876222896924e-06, "loss": 0.4929, "mean_token_accuracy": 0.8431192450225353, "num_tokens": 1012101180.0, "step": 31712 }, { "entropy": 0.6111965454183519, "epoch": 2.9177635551261925, "grad_norm": 0.16694658994674683, "learning_rate": 2.744809396755298e-06, "loss": 0.5949, "mean_token_accuracy": 0.8137258514761925, "num_tokens": 1012133396.0, "step": 31713 }, { "entropy": 0.5639216550625861, "epoch": 2.9178555614976336, "grad_norm": 0.16423092782497406, "learning_rate": 2.7417425706136724e-06, "loss": 0.5495, "mean_token_accuracy": 0.82720036059618, "num_tokens": 1012165121.0, "step": 31714 }, { "entropy": 0.5340166375972331, "epoch": 2.917947567869075, "grad_norm": 0.15981276333332062, "learning_rate": 2.738675744472046e-06, "loss": 0.5301, "mean_token_accuracy": 0.8331610560417175, "num_tokens": 1012197444.0, "step": 31715 }, { "entropy": 0.5216633211821318, "epoch": 2.9180395742405163, "grad_norm": 0.1639036238193512, "learning_rate": 2.73560891833042e-06, "loss": 0.5099, "mean_token_accuracy": 0.8344588875770569, "num_tokens": 1012228779.0, "step": 31716 }, { "entropy": 0.5645678099244833, "epoch": 2.9181315806119574, "grad_norm": 0.16350406408309937, "learning_rate": 2.732542092188794e-06, "loss": 0.5607, "mean_token_accuracy": 0.8233195096254349, "num_tokens": 1012261098.0, "step": 31717 }, { "entropy": 0.43952575605362654, "epoch": 2.9182235869833986, "grad_norm": 0.14854522049427032, "learning_rate": 2.729475266047168e-06, "loss": 0.4264, "mean_token_accuracy": 0.8633929155766964, "num_tokens": 1012293373.0, "step": 31718 }, { "entropy": 0.517444709315896, "epoch": 2.9183155933548397, "grad_norm": 0.1599203497171402, "learning_rate": 2.726408439905542e-06, "loss": 0.5045, "mean_token_accuracy": 0.8397021777927876, "num_tokens": 1012324478.0, "step": 31719 }, { "entropy": 0.5666746674105525, "epoch": 2.9184075997262813, "grad_norm": 0.16495554149150848, "learning_rate": 2.7233416137639156e-06, "loss": 0.5611, "mean_token_accuracy": 0.823512826114893, "num_tokens": 1012356114.0, "step": 31720 }, { "entropy": 0.5228293491527438, "epoch": 2.9184996060977224, "grad_norm": 0.16306181252002716, "learning_rate": 2.72027478762229e-06, "loss": 0.5246, "mean_token_accuracy": 0.8342958875000477, "num_tokens": 1012387693.0, "step": 31721 }, { "entropy": 0.5537099950015545, "epoch": 2.9185916124691635, "grad_norm": 0.16126035153865814, "learning_rate": 2.717207961480664e-06, "loss": 0.5405, "mean_token_accuracy": 0.8287349790334702, "num_tokens": 1012420058.0, "step": 31722 }, { "entropy": 0.5478099884930998, "epoch": 2.9186836188406047, "grad_norm": 0.16461244225502014, "learning_rate": 2.714141135339038e-06, "loss": 0.5353, "mean_token_accuracy": 0.8318675570189953, "num_tokens": 1012452358.0, "step": 31723 }, { "entropy": 0.48316869465634227, "epoch": 2.918775625212046, "grad_norm": 0.15521939098834991, "learning_rate": 2.7110743091974117e-06, "loss": 0.4685, "mean_token_accuracy": 0.8527202531695366, "num_tokens": 1012484165.0, "step": 31724 }, { "entropy": 0.46900575049221516, "epoch": 2.9188676315834874, "grad_norm": 0.15264862775802612, "learning_rate": 2.7080074830557855e-06, "loss": 0.4666, "mean_token_accuracy": 0.8548115082085133, "num_tokens": 1012516273.0, "step": 31725 }, { "entropy": 0.5851594191044569, "epoch": 2.9189596379549285, "grad_norm": 0.16812758147716522, "learning_rate": 2.7049406569141597e-06, "loss": 0.5679, "mean_token_accuracy": 0.8210597150027752, "num_tokens": 1012547127.0, "step": 31726 }, { "entropy": 0.5330981398001313, "epoch": 2.9190516443263697, "grad_norm": 0.160051167011261, "learning_rate": 2.7018738307725335e-06, "loss": 0.518, "mean_token_accuracy": 0.8380129151046276, "num_tokens": 1012578984.0, "step": 31727 }, { "entropy": 0.4813415170647204, "epoch": 2.919143650697811, "grad_norm": 0.14841102063655853, "learning_rate": 2.6988070046309077e-06, "loss": 0.4764, "mean_token_accuracy": 0.8462304584681988, "num_tokens": 1012611341.0, "step": 31728 }, { "entropy": 0.4679763885214925, "epoch": 2.919235657069252, "grad_norm": 0.1500910222530365, "learning_rate": 2.6957401784892815e-06, "loss": 0.4556, "mean_token_accuracy": 0.8509758487343788, "num_tokens": 1012643866.0, "step": 31729 }, { "entropy": 0.5588549552485347, "epoch": 2.9193276634406935, "grad_norm": 0.16787482798099518, "learning_rate": 2.6926733523476557e-06, "loss": 0.5482, "mean_token_accuracy": 0.8302885480225086, "num_tokens": 1012675391.0, "step": 31730 }, { "entropy": 0.4668615674600005, "epoch": 2.9194196698121346, "grad_norm": 0.14733274281024933, "learning_rate": 2.6896065262060295e-06, "loss": 0.4473, "mean_token_accuracy": 0.858049251139164, "num_tokens": 1012707827.0, "step": 31731 }, { "entropy": 0.5227158665657043, "epoch": 2.9195116761835758, "grad_norm": 0.1593148410320282, "learning_rate": 2.6865397000644033e-06, "loss": 0.5106, "mean_token_accuracy": 0.8368420042097569, "num_tokens": 1012739632.0, "step": 31732 }, { "entropy": 0.5090091931633651, "epoch": 2.919603682555017, "grad_norm": 0.1593145877122879, "learning_rate": 2.6834728739227776e-06, "loss": 0.4922, "mean_token_accuracy": 0.8413753993809223, "num_tokens": 1012771210.0, "step": 31733 }, { "entropy": 0.5637792246416211, "epoch": 2.919695688926458, "grad_norm": 0.16283030807971954, "learning_rate": 2.6804060477811514e-06, "loss": 0.5503, "mean_token_accuracy": 0.825458500534296, "num_tokens": 1012802132.0, "step": 31734 }, { "entropy": 0.43047125078737736, "epoch": 2.9197876952978996, "grad_norm": 0.14735275506973267, "learning_rate": 2.677339221639525e-06, "loss": 0.4172, "mean_token_accuracy": 0.8686269000172615, "num_tokens": 1012834072.0, "step": 31735 }, { "entropy": 0.47237207437865436, "epoch": 2.9198797016693407, "grad_norm": 0.1524677723646164, "learning_rate": 2.6742723954978994e-06, "loss": 0.457, "mean_token_accuracy": 0.8523063696920872, "num_tokens": 1012866407.0, "step": 31736 }, { "entropy": 0.5321150254458189, "epoch": 2.919971708040782, "grad_norm": 0.1592411994934082, "learning_rate": 2.6712055693562736e-06, "loss": 0.5148, "mean_token_accuracy": 0.8357622511684895, "num_tokens": 1012898877.0, "step": 31737 }, { "entropy": 0.495721897110343, "epoch": 2.920063714412223, "grad_norm": 0.15538723766803741, "learning_rate": 2.6681387432146474e-06, "loss": 0.483, "mean_token_accuracy": 0.8448802568018436, "num_tokens": 1012931045.0, "step": 31738 }, { "entropy": 0.5231772544793785, "epoch": 2.920155720783664, "grad_norm": 0.16151833534240723, "learning_rate": 2.6650719170730212e-06, "loss": 0.5245, "mean_token_accuracy": 0.8328370228409767, "num_tokens": 1012962839.0, "step": 31739 }, { "entropy": 0.447361066006124, "epoch": 2.9202477271551057, "grad_norm": 0.14922600984573364, "learning_rate": 2.662005090931395e-06, "loss": 0.4374, "mean_token_accuracy": 0.8579003065824509, "num_tokens": 1012995213.0, "step": 31740 }, { "entropy": 0.5960277887061238, "epoch": 2.920339733526547, "grad_norm": 0.16524837911128998, "learning_rate": 2.6589382647897692e-06, "loss": 0.5834, "mean_token_accuracy": 0.8176283687353134, "num_tokens": 1013027543.0, "step": 31741 }, { "entropy": 0.4791737413033843, "epoch": 2.920431739897988, "grad_norm": 0.15334735810756683, "learning_rate": 2.655871438648143e-06, "loss": 0.4665, "mean_token_accuracy": 0.8485603220760822, "num_tokens": 1013059359.0, "step": 31742 }, { "entropy": 0.4899951908737421, "epoch": 2.920523746269429, "grad_norm": 0.15800726413726807, "learning_rate": 2.6528046125065173e-06, "loss": 0.4882, "mean_token_accuracy": 0.8491741381585598, "num_tokens": 1013090997.0, "step": 31743 }, { "entropy": 0.543082382529974, "epoch": 2.9206157526408703, "grad_norm": 0.16081850230693817, "learning_rate": 2.649737786364891e-06, "loss": 0.5401, "mean_token_accuracy": 0.8263990841805935, "num_tokens": 1013123736.0, "step": 31744 }, { "entropy": 0.5319846458733082, "epoch": 2.920707759012312, "grad_norm": 0.16519789397716522, "learning_rate": 2.6466709602232653e-06, "loss": 0.5251, "mean_token_accuracy": 0.8353897966444492, "num_tokens": 1013154733.0, "step": 31745 }, { "entropy": 0.5868540713563561, "epoch": 2.920799765383753, "grad_norm": 0.17321357131004333, "learning_rate": 2.643604134081639e-06, "loss": 0.5816, "mean_token_accuracy": 0.8198974616825581, "num_tokens": 1013186579.0, "step": 31746 }, { "entropy": 0.5349886901676655, "epoch": 2.920891771755194, "grad_norm": 0.1631455272436142, "learning_rate": 2.640537307940013e-06, "loss": 0.5212, "mean_token_accuracy": 0.8333188220858574, "num_tokens": 1013219003.0, "step": 31747 }, { "entropy": 0.5630631241947412, "epoch": 2.9209837781266352, "grad_norm": 0.16576986014842987, "learning_rate": 2.6374704817983867e-06, "loss": 0.5382, "mean_token_accuracy": 0.8292986042797565, "num_tokens": 1013250740.0, "step": 31748 }, { "entropy": 0.460366805549711, "epoch": 2.9210757844980764, "grad_norm": 0.15208236873149872, "learning_rate": 2.634403655656761e-06, "loss": 0.4419, "mean_token_accuracy": 0.8564093001186848, "num_tokens": 1013282329.0, "step": 31749 }, { "entropy": 0.6067542713135481, "epoch": 2.921167790869518, "grad_norm": 0.17222054302692413, "learning_rate": 2.6313368295151347e-06, "loss": 0.5911, "mean_token_accuracy": 0.8121697790920734, "num_tokens": 1013313249.0, "step": 31750 }, { "entropy": 0.43379749567247927, "epoch": 2.921259797240959, "grad_norm": 0.14759962260723114, "learning_rate": 2.628270003373509e-06, "loss": 0.4171, "mean_token_accuracy": 0.8641929924488068, "num_tokens": 1013344753.0, "step": 31751 }, { "entropy": 0.5435611456632614, "epoch": 2.9213518036124, "grad_norm": 0.16250555217266083, "learning_rate": 2.6252031772318827e-06, "loss": 0.535, "mean_token_accuracy": 0.8276898339390755, "num_tokens": 1013376932.0, "step": 31752 }, { "entropy": 0.49098570458590984, "epoch": 2.9214438099838413, "grad_norm": 0.15270814299583435, "learning_rate": 2.622136351090257e-06, "loss": 0.4817, "mean_token_accuracy": 0.8461875580251217, "num_tokens": 1013408873.0, "step": 31753 }, { "entropy": 0.46455681463703513, "epoch": 2.9215358163552825, "grad_norm": 0.15764877200126648, "learning_rate": 2.6190695249486308e-06, "loss": 0.4501, "mean_token_accuracy": 0.8556985445320606, "num_tokens": 1013439388.0, "step": 31754 }, { "entropy": 0.5712600275874138, "epoch": 2.921627822726724, "grad_norm": 0.1652008444070816, "learning_rate": 2.6160026988070046e-06, "loss": 0.5611, "mean_token_accuracy": 0.8227217458188534, "num_tokens": 1013471217.0, "step": 31755 }, { "entropy": 0.45485780760645866, "epoch": 2.921719829098165, "grad_norm": 0.150771826505661, "learning_rate": 2.612935872665379e-06, "loss": 0.4501, "mean_token_accuracy": 0.8554886877536774, "num_tokens": 1013503604.0, "step": 31756 }, { "entropy": 0.5274342028424144, "epoch": 2.9218118354696063, "grad_norm": 0.16336211562156677, "learning_rate": 2.6098690465237526e-06, "loss": 0.5096, "mean_token_accuracy": 0.8381139822304249, "num_tokens": 1013535575.0, "step": 31757 }, { "entropy": 0.49456009827554226, "epoch": 2.9219038418410475, "grad_norm": 0.15537448227405548, "learning_rate": 2.606802220382127e-06, "loss": 0.4835, "mean_token_accuracy": 0.8459806255996227, "num_tokens": 1013567995.0, "step": 31758 }, { "entropy": 0.5206192089244723, "epoch": 2.9219958482124886, "grad_norm": 0.16146180033683777, "learning_rate": 2.6037353942405006e-06, "loss": 0.5099, "mean_token_accuracy": 0.8402730971574783, "num_tokens": 1013600215.0, "step": 31759 }, { "entropy": 0.4393008681945503, "epoch": 2.92208785458393, "grad_norm": 0.14802145957946777, "learning_rate": 2.600668568098875e-06, "loss": 0.427, "mean_token_accuracy": 0.8644580878317356, "num_tokens": 1013632459.0, "step": 31760 }, { "entropy": 0.46326209767721593, "epoch": 2.9221798609553713, "grad_norm": 0.14769063889980316, "learning_rate": 2.5976017419572486e-06, "loss": 0.4526, "mean_token_accuracy": 0.856969378888607, "num_tokens": 1013664458.0, "step": 31761 }, { "entropy": 0.5483143255114555, "epoch": 2.9222718673268124, "grad_norm": 0.17152808606624603, "learning_rate": 2.5945349158156224e-06, "loss": 0.5481, "mean_token_accuracy": 0.8327157609164715, "num_tokens": 1013695495.0, "step": 31762 }, { "entropy": 0.5452362280339003, "epoch": 2.9223638736982536, "grad_norm": 0.16819968819618225, "learning_rate": 2.5914680896739962e-06, "loss": 0.5368, "mean_token_accuracy": 0.8307125680148602, "num_tokens": 1013727404.0, "step": 31763 }, { "entropy": 0.472548789344728, "epoch": 2.9224558800696947, "grad_norm": 0.1591678410768509, "learning_rate": 2.5884012635323705e-06, "loss": 0.4623, "mean_token_accuracy": 0.8502104803919792, "num_tokens": 1013759215.0, "step": 31764 }, { "entropy": 0.5980387711897492, "epoch": 2.9225478864411363, "grad_norm": 0.16690655052661896, "learning_rate": 2.5853344373907443e-06, "loss": 0.587, "mean_token_accuracy": 0.8169295750558376, "num_tokens": 1013791646.0, "step": 31765 }, { "entropy": 0.48281127121299505, "epoch": 2.9226398928125774, "grad_norm": 0.1530444473028183, "learning_rate": 2.5822676112491185e-06, "loss": 0.4735, "mean_token_accuracy": 0.8492398522794247, "num_tokens": 1013823802.0, "step": 31766 }, { "entropy": 0.5759454239159822, "epoch": 2.9227318991840185, "grad_norm": 0.1642029881477356, "learning_rate": 2.5792007851074923e-06, "loss": 0.5712, "mean_token_accuracy": 0.8224954307079315, "num_tokens": 1013855914.0, "step": 31767 }, { "entropy": 0.4334556922549382, "epoch": 2.9228239055554597, "grad_norm": 0.14723919332027435, "learning_rate": 2.5761339589658665e-06, "loss": 0.419, "mean_token_accuracy": 0.8644561991095543, "num_tokens": 1013888172.0, "step": 31768 }, { "entropy": 0.6005426216870546, "epoch": 2.922915911926901, "grad_norm": 0.17307747900485992, "learning_rate": 2.5730671328242403e-06, "loss": 0.6048, "mean_token_accuracy": 0.8136522956192493, "num_tokens": 1013919466.0, "step": 31769 }, { "entropy": 0.6403626021929085, "epoch": 2.9230079182983424, "grad_norm": 0.17645008862018585, "learning_rate": 2.570000306682614e-06, "loss": 0.6218, "mean_token_accuracy": 0.8029905259609222, "num_tokens": 1013951173.0, "step": 31770 }, { "entropy": 0.5787704344838858, "epoch": 2.9230999246697835, "grad_norm": 0.1703077107667923, "learning_rate": 2.566933480540988e-06, "loss": 0.5728, "mean_token_accuracy": 0.8222888894379139, "num_tokens": 1013982491.0, "step": 31771 }, { "entropy": 0.5150749702006578, "epoch": 2.9231919310412247, "grad_norm": 0.15702736377716064, "learning_rate": 2.563866654399362e-06, "loss": 0.503, "mean_token_accuracy": 0.8420481458306313, "num_tokens": 1014014532.0, "step": 31772 }, { "entropy": 0.526671452447772, "epoch": 2.923283937412666, "grad_norm": 0.16156889498233795, "learning_rate": 2.5607998282577364e-06, "loss": 0.5132, "mean_token_accuracy": 0.8332667015492916, "num_tokens": 1014046139.0, "step": 31773 }, { "entropy": 0.5016065519303083, "epoch": 2.923375943784107, "grad_norm": 0.16201089322566986, "learning_rate": 2.55773300211611e-06, "loss": 0.4956, "mean_token_accuracy": 0.8429101593792439, "num_tokens": 1014077553.0, "step": 31774 }, { "entropy": 0.5188759043812752, "epoch": 2.9234679501555485, "grad_norm": 0.16235889494419098, "learning_rate": 2.5546661759744844e-06, "loss": 0.5179, "mean_token_accuracy": 0.838822990655899, "num_tokens": 1014109215.0, "step": 31775 }, { "entropy": 0.5142664834856987, "epoch": 2.9235599565269896, "grad_norm": 0.16145849227905273, "learning_rate": 2.551599349832858e-06, "loss": 0.5017, "mean_token_accuracy": 0.8422900699079037, "num_tokens": 1014141705.0, "step": 31776 }, { "entropy": 0.46680191811174154, "epoch": 2.9236519628984308, "grad_norm": 0.15135565400123596, "learning_rate": 2.548532523691232e-06, "loss": 0.4495, "mean_token_accuracy": 0.8556445091962814, "num_tokens": 1014173508.0, "step": 31777 }, { "entropy": 0.617265859618783, "epoch": 2.923743969269872, "grad_norm": 0.17530739307403564, "learning_rate": 2.545465697549606e-06, "loss": 0.6089, "mean_token_accuracy": 0.810190986841917, "num_tokens": 1014204926.0, "step": 31778 }, { "entropy": 0.4179935157299042, "epoch": 2.923835975641313, "grad_norm": 0.1424587219953537, "learning_rate": 2.54239887140798e-06, "loss": 0.4033, "mean_token_accuracy": 0.8702496737241745, "num_tokens": 1014236758.0, "step": 31779 }, { "entropy": 0.5649140737950802, "epoch": 2.9239279820127546, "grad_norm": 0.16688962280750275, "learning_rate": 2.539332045266354e-06, "loss": 0.5495, "mean_token_accuracy": 0.8246295191347599, "num_tokens": 1014267864.0, "step": 31780 }, { "entropy": 0.6308311996981502, "epoch": 2.9240199883841957, "grad_norm": 0.1783447563648224, "learning_rate": 2.536265219124728e-06, "loss": 0.6245, "mean_token_accuracy": 0.8049199432134628, "num_tokens": 1014299580.0, "step": 31781 }, { "entropy": 0.4563632905483246, "epoch": 2.924111994755637, "grad_norm": 0.15261642634868622, "learning_rate": 2.533198392983102e-06, "loss": 0.4476, "mean_token_accuracy": 0.8585711009800434, "num_tokens": 1014330681.0, "step": 31782 }, { "entropy": 0.537350345402956, "epoch": 2.924204001127078, "grad_norm": 0.16106557846069336, "learning_rate": 2.530131566841476e-06, "loss": 0.5247, "mean_token_accuracy": 0.8357470221817493, "num_tokens": 1014362396.0, "step": 31783 }, { "entropy": 0.5359706999734044, "epoch": 2.924296007498519, "grad_norm": 0.1584431231021881, "learning_rate": 2.52706474069985e-06, "loss": 0.526, "mean_token_accuracy": 0.8323953002691269, "num_tokens": 1014394724.0, "step": 31784 }, { "entropy": 0.4857017621397972, "epoch": 2.9243880138699607, "grad_norm": 0.15865299105644226, "learning_rate": 2.5239979145582237e-06, "loss": 0.4633, "mean_token_accuracy": 0.8488707691431046, "num_tokens": 1014425812.0, "step": 31785 }, { "entropy": 0.5502953995019197, "epoch": 2.924480020241402, "grad_norm": 0.16354504227638245, "learning_rate": 2.5209310884165975e-06, "loss": 0.5344, "mean_token_accuracy": 0.829794391989708, "num_tokens": 1014457374.0, "step": 31786 }, { "entropy": 0.47881444077938795, "epoch": 2.924572026612843, "grad_norm": 0.15266768634319305, "learning_rate": 2.5178642622749717e-06, "loss": 0.4564, "mean_token_accuracy": 0.8548004105687141, "num_tokens": 1014489630.0, "step": 31787 }, { "entropy": 0.5685544870793819, "epoch": 2.924664032984284, "grad_norm": 0.16803540289402008, "learning_rate": 2.514797436133346e-06, "loss": 0.5508, "mean_token_accuracy": 0.826168067753315, "num_tokens": 1014520984.0, "step": 31788 }, { "entropy": 0.539248077198863, "epoch": 2.9247560393557253, "grad_norm": 0.1693422645330429, "learning_rate": 2.5117306099917197e-06, "loss": 0.5337, "mean_token_accuracy": 0.8310528621077538, "num_tokens": 1014552773.0, "step": 31789 }, { "entropy": 0.4506468018516898, "epoch": 2.924848045727167, "grad_norm": 0.15235792100429535, "learning_rate": 2.5086637838500935e-06, "loss": 0.442, "mean_token_accuracy": 0.8562762700021267, "num_tokens": 1014584647.0, "step": 31790 }, { "entropy": 0.4318255139514804, "epoch": 2.924940052098608, "grad_norm": 0.14643001556396484, "learning_rate": 2.5055969577084677e-06, "loss": 0.405, "mean_token_accuracy": 0.8677957430481911, "num_tokens": 1014615496.0, "step": 31791 }, { "entropy": 0.4590385966002941, "epoch": 2.925032058470049, "grad_norm": 0.1489037275314331, "learning_rate": 2.5025301315668415e-06, "loss": 0.4569, "mean_token_accuracy": 0.853086918592453, "num_tokens": 1014647728.0, "step": 31792 }, { "entropy": 0.5555484155192971, "epoch": 2.9251240648414902, "grad_norm": 0.16631750762462616, "learning_rate": 2.4994633054252153e-06, "loss": 0.5373, "mean_token_accuracy": 0.8330865316092968, "num_tokens": 1014678288.0, "step": 31793 }, { "entropy": 0.4374724659137428, "epoch": 2.9252160712129314, "grad_norm": 0.14767484366893768, "learning_rate": 2.4963964792835896e-06, "loss": 0.4267, "mean_token_accuracy": 0.8637932576239109, "num_tokens": 1014711030.0, "step": 31794 }, { "entropy": 0.4648166475817561, "epoch": 2.925308077584373, "grad_norm": 0.14528243243694305, "learning_rate": 2.493329653141964e-06, "loss": 0.4575, "mean_token_accuracy": 0.8571274094283581, "num_tokens": 1014743370.0, "step": 31795 }, { "entropy": 0.4918287182226777, "epoch": 2.925400083955814, "grad_norm": 0.15668189525604248, "learning_rate": 2.4902628270003376e-06, "loss": 0.4836, "mean_token_accuracy": 0.8477023169398308, "num_tokens": 1014775343.0, "step": 31796 }, { "entropy": 0.5489394282922149, "epoch": 2.925492090327255, "grad_norm": 0.16053560376167297, "learning_rate": 2.4871960008587114e-06, "loss": 0.5426, "mean_token_accuracy": 0.8299192190170288, "num_tokens": 1014807336.0, "step": 31797 }, { "entropy": 0.4948321571573615, "epoch": 2.9255840966986963, "grad_norm": 0.15627391636371613, "learning_rate": 2.4841291747170856e-06, "loss": 0.4891, "mean_token_accuracy": 0.843318585306406, "num_tokens": 1014839706.0, "step": 31798 }, { "entropy": 0.47013200260698795, "epoch": 2.9256761030701375, "grad_norm": 0.1515626758337021, "learning_rate": 2.4810623485754594e-06, "loss": 0.4634, "mean_token_accuracy": 0.8526234850287437, "num_tokens": 1014872028.0, "step": 31799 }, { "entropy": 0.5503885867074132, "epoch": 2.925768109441579, "grad_norm": 0.16112937033176422, "learning_rate": 2.4779955224338332e-06, "loss": 0.5427, "mean_token_accuracy": 0.8269736617803574, "num_tokens": 1014903847.0, "step": 31800 }, { "entropy": 0.49100455455482006, "epoch": 2.92586011581302, "grad_norm": 0.15130679309368134, "learning_rate": 2.474928696292207e-06, "loss": 0.4807, "mean_token_accuracy": 0.848766952753067, "num_tokens": 1014936510.0, "step": 31801 }, { "entropy": 0.5589046903187409, "epoch": 2.9259521221844613, "grad_norm": 0.1722332239151001, "learning_rate": 2.4718618701505812e-06, "loss": 0.5503, "mean_token_accuracy": 0.8290222659707069, "num_tokens": 1014968261.0, "step": 31802 }, { "entropy": 0.5001875625457615, "epoch": 2.9260441285559025, "grad_norm": 0.15268993377685547, "learning_rate": 2.4687950440089555e-06, "loss": 0.4811, "mean_token_accuracy": 0.8459999822080135, "num_tokens": 1014999727.0, "step": 31803 }, { "entropy": 0.43762048962526023, "epoch": 2.9261361349273436, "grad_norm": 0.1456039994955063, "learning_rate": 2.4657282178673293e-06, "loss": 0.4181, "mean_token_accuracy": 0.864673875272274, "num_tokens": 1015031949.0, "step": 31804 }, { "entropy": 0.5127415955066681, "epoch": 2.926228141298785, "grad_norm": 0.16095797717571259, "learning_rate": 2.462661391725703e-06, "loss": 0.5028, "mean_token_accuracy": 0.8417551852762699, "num_tokens": 1015063980.0, "step": 31805 }, { "entropy": 0.5326036754995584, "epoch": 2.9263201476702263, "grad_norm": 0.16137591004371643, "learning_rate": 2.4595945655840773e-06, "loss": 0.5244, "mean_token_accuracy": 0.8328909575939178, "num_tokens": 1015096253.0, "step": 31806 }, { "entropy": 0.49617819767445326, "epoch": 2.9264121540416674, "grad_norm": 0.16500011086463928, "learning_rate": 2.456527739442451e-06, "loss": 0.4946, "mean_token_accuracy": 0.8406014963984489, "num_tokens": 1015128295.0, "step": 31807 }, { "entropy": 0.5766541510820389, "epoch": 2.9265041604131086, "grad_norm": 0.17179319262504578, "learning_rate": 2.453460913300825e-06, "loss": 0.5695, "mean_token_accuracy": 0.8218878097832203, "num_tokens": 1015159861.0, "step": 31808 }, { "entropy": 0.5356638766825199, "epoch": 2.9265961667845497, "grad_norm": 0.15949773788452148, "learning_rate": 2.450394087159199e-06, "loss": 0.5339, "mean_token_accuracy": 0.8332209438085556, "num_tokens": 1015191411.0, "step": 31809 }, { "entropy": 0.5301405349746346, "epoch": 2.9266881731559913, "grad_norm": 0.1594104915857315, "learning_rate": 2.4473272610175733e-06, "loss": 0.5167, "mean_token_accuracy": 0.8357100710272789, "num_tokens": 1015223144.0, "step": 31810 }, { "entropy": 0.5070986058562994, "epoch": 2.9267801795274324, "grad_norm": 0.15827055275440216, "learning_rate": 2.444260434875947e-06, "loss": 0.4986, "mean_token_accuracy": 0.8407880179584026, "num_tokens": 1015255340.0, "step": 31811 }, { "entropy": 0.46296371042262763, "epoch": 2.9268721858988735, "grad_norm": 0.15943875908851624, "learning_rate": 2.441193608734321e-06, "loss": 0.4605, "mean_token_accuracy": 0.8571669831871986, "num_tokens": 1015286464.0, "step": 31812 }, { "entropy": 0.571125216782093, "epoch": 2.9269641922703147, "grad_norm": 0.1653498411178589, "learning_rate": 2.4381267825926947e-06, "loss": 0.5587, "mean_token_accuracy": 0.8260752633213997, "num_tokens": 1015318219.0, "step": 31813 }, { "entropy": 0.4638118236325681, "epoch": 2.927056198641756, "grad_norm": 0.15019658207893372, "learning_rate": 2.435059956451069e-06, "loss": 0.4551, "mean_token_accuracy": 0.8536990135908127, "num_tokens": 1015349920.0, "step": 31814 }, { "entropy": 0.5400100033730268, "epoch": 2.9271482050131974, "grad_norm": 0.16151654720306396, "learning_rate": 2.4319931303094428e-06, "loss": 0.5226, "mean_token_accuracy": 0.8301758542656898, "num_tokens": 1015382218.0, "step": 31815 }, { "entropy": 0.4884088281542063, "epoch": 2.9272402113846385, "grad_norm": 0.1525789052248001, "learning_rate": 2.4289263041678166e-06, "loss": 0.4689, "mean_token_accuracy": 0.8469706699252129, "num_tokens": 1015414761.0, "step": 31816 }, { "entropy": 0.39252142142504454, "epoch": 2.9273322177560797, "grad_norm": 0.149458110332489, "learning_rate": 2.425859478026191e-06, "loss": 0.3802, "mean_token_accuracy": 0.8733635991811752, "num_tokens": 1015446447.0, "step": 31817 }, { "entropy": 0.5429373476654291, "epoch": 2.927424224127521, "grad_norm": 0.15866073966026306, "learning_rate": 2.422792651884565e-06, "loss": 0.5152, "mean_token_accuracy": 0.8338942416012287, "num_tokens": 1015478491.0, "step": 31818 }, { "entropy": 0.42760237911716104, "epoch": 2.927516230498962, "grad_norm": 0.1449303776025772, "learning_rate": 2.419725825742939e-06, "loss": 0.4166, "mean_token_accuracy": 0.8710307739675045, "num_tokens": 1015511259.0, "step": 31819 }, { "entropy": 0.5001507932320237, "epoch": 2.9276082368704035, "grad_norm": 0.15767452120780945, "learning_rate": 2.4166589996013126e-06, "loss": 0.4891, "mean_token_accuracy": 0.8442264460027218, "num_tokens": 1015543091.0, "step": 31820 }, { "entropy": 0.4908609064295888, "epoch": 2.9277002432418446, "grad_norm": 0.14977192878723145, "learning_rate": 2.413592173459687e-06, "loss": 0.4793, "mean_token_accuracy": 0.8474039360880852, "num_tokens": 1015575693.0, "step": 31821 }, { "entropy": 0.4660340053960681, "epoch": 2.9277922496132858, "grad_norm": 0.1547018140554428, "learning_rate": 2.4105253473180606e-06, "loss": 0.437, "mean_token_accuracy": 0.8573995046317577, "num_tokens": 1015606609.0, "step": 31822 }, { "entropy": 0.5500672478228807, "epoch": 2.927884255984727, "grad_norm": 0.1719299703836441, "learning_rate": 2.4074585211764344e-06, "loss": 0.5466, "mean_token_accuracy": 0.8295006118714809, "num_tokens": 1015637266.0, "step": 31823 }, { "entropy": 0.48989981785416603, "epoch": 2.927976262356168, "grad_norm": 0.15497882664203644, "learning_rate": 2.4043916950348087e-06, "loss": 0.4817, "mean_token_accuracy": 0.8470989428460598, "num_tokens": 1015669567.0, "step": 31824 }, { "entropy": 0.48269051779061556, "epoch": 2.9280682687276096, "grad_norm": 0.15256471931934357, "learning_rate": 2.401324868893183e-06, "loss": 0.47, "mean_token_accuracy": 0.8491369038820267, "num_tokens": 1015700913.0, "step": 31825 }, { "entropy": 0.4689708719961345, "epoch": 2.9281602750990507, "grad_norm": 0.14997228980064392, "learning_rate": 2.3982580427515567e-06, "loss": 0.4518, "mean_token_accuracy": 0.8554032072424889, "num_tokens": 1015733261.0, "step": 31826 }, { "entropy": 0.42702114023268223, "epoch": 2.928252281470492, "grad_norm": 0.14362786710262299, "learning_rate": 2.3951912166099305e-06, "loss": 0.4178, "mean_token_accuracy": 0.8678942136466503, "num_tokens": 1015765806.0, "step": 31827 }, { "entropy": 0.5394585598260164, "epoch": 2.928344287841933, "grad_norm": 0.16322395205497742, "learning_rate": 2.3921243904683043e-06, "loss": 0.5238, "mean_token_accuracy": 0.8355248235166073, "num_tokens": 1015797894.0, "step": 31828 }, { "entropy": 0.5181923108175397, "epoch": 2.928436294213374, "grad_norm": 0.15478505194187164, "learning_rate": 2.3890575643266785e-06, "loss": 0.4989, "mean_token_accuracy": 0.8383127637207508, "num_tokens": 1015830057.0, "step": 31829 }, { "entropy": 0.44628699868917465, "epoch": 2.9285283005848157, "grad_norm": 0.14917904138565063, "learning_rate": 2.3859907381850523e-06, "loss": 0.4369, "mean_token_accuracy": 0.8625404313206673, "num_tokens": 1015862300.0, "step": 31830 }, { "entropy": 0.5413677834440023, "epoch": 2.928620306956257, "grad_norm": 0.16025298833847046, "learning_rate": 2.382923912043426e-06, "loss": 0.5281, "mean_token_accuracy": 0.831074807792902, "num_tokens": 1015894406.0, "step": 31831 }, { "entropy": 0.4865019442513585, "epoch": 2.928712313327698, "grad_norm": 0.1532217264175415, "learning_rate": 2.3798570859018003e-06, "loss": 0.4723, "mean_token_accuracy": 0.8482651822268963, "num_tokens": 1015926421.0, "step": 31832 }, { "entropy": 0.4352242548484355, "epoch": 2.928804319699139, "grad_norm": 0.14681288599967957, "learning_rate": 2.3767902597601746e-06, "loss": 0.4234, "mean_token_accuracy": 0.864451490342617, "num_tokens": 1015958117.0, "step": 31833 }, { "entropy": 0.48680308647453785, "epoch": 2.9288963260705803, "grad_norm": 0.15219087898731232, "learning_rate": 2.3737234336185484e-06, "loss": 0.4835, "mean_token_accuracy": 0.847474280744791, "num_tokens": 1015990377.0, "step": 31834 }, { "entropy": 0.5819701449945569, "epoch": 2.928988332442022, "grad_norm": 0.1646842211484909, "learning_rate": 2.370656607476922e-06, "loss": 0.5628, "mean_token_accuracy": 0.821190133690834, "num_tokens": 1016022447.0, "step": 31835 }, { "entropy": 0.5504291709512472, "epoch": 2.929080338813463, "grad_norm": 0.16576990485191345, "learning_rate": 2.3675897813352964e-06, "loss": 0.5362, "mean_token_accuracy": 0.8304933980107307, "num_tokens": 1016053160.0, "step": 31836 }, { "entropy": 0.5270520886406302, "epoch": 2.929172345184904, "grad_norm": 0.1611815094947815, "learning_rate": 2.36452295519367e-06, "loss": 0.5194, "mean_token_accuracy": 0.8346703983843327, "num_tokens": 1016085789.0, "step": 31837 }, { "entropy": 0.46977974101901054, "epoch": 2.9292643515563452, "grad_norm": 0.15456072986125946, "learning_rate": 2.361456129052044e-06, "loss": 0.4496, "mean_token_accuracy": 0.8560431450605392, "num_tokens": 1016117516.0, "step": 31838 }, { "entropy": 0.46722599025815725, "epoch": 2.9293563579277864, "grad_norm": 0.15276995301246643, "learning_rate": 2.3583893029104182e-06, "loss": 0.457, "mean_token_accuracy": 0.8547835759818554, "num_tokens": 1016149603.0, "step": 31839 }, { "entropy": 0.43160336883738637, "epoch": 2.929448364299228, "grad_norm": 0.1421881765127182, "learning_rate": 2.3553224767687924e-06, "loss": 0.4194, "mean_token_accuracy": 0.8671656735241413, "num_tokens": 1016182173.0, "step": 31840 }, { "entropy": 0.4081073310226202, "epoch": 2.929540370670669, "grad_norm": 0.14026784896850586, "learning_rate": 2.3522556506271662e-06, "loss": 0.3933, "mean_token_accuracy": 0.871900774538517, "num_tokens": 1016214527.0, "step": 31841 }, { "entropy": 0.5853007724508643, "epoch": 2.92963237704211, "grad_norm": 0.17149214446544647, "learning_rate": 2.34918882448554e-06, "loss": 0.5793, "mean_token_accuracy": 0.8194554410874844, "num_tokens": 1016246405.0, "step": 31842 }, { "entropy": 0.46794142527505755, "epoch": 2.9297243834135513, "grad_norm": 0.15217973291873932, "learning_rate": 2.346121998343914e-06, "loss": 0.4542, "mean_token_accuracy": 0.8568478785455227, "num_tokens": 1016278580.0, "step": 31843 }, { "entropy": 0.5532304411754012, "epoch": 2.9298163897849925, "grad_norm": 0.1631949096918106, "learning_rate": 2.343055172202288e-06, "loss": 0.5455, "mean_token_accuracy": 0.8295558094978333, "num_tokens": 1016310655.0, "step": 31844 }, { "entropy": 0.5575850736349821, "epoch": 2.929908396156434, "grad_norm": 0.16690362989902496, "learning_rate": 2.339988346060662e-06, "loss": 0.5457, "mean_token_accuracy": 0.8255917355418205, "num_tokens": 1016342294.0, "step": 31845 }, { "entropy": 0.4923320454545319, "epoch": 2.930000402527875, "grad_norm": 0.15967340767383575, "learning_rate": 2.3369215199190357e-06, "loss": 0.4859, "mean_token_accuracy": 0.8460588492453098, "num_tokens": 1016373688.0, "step": 31846 }, { "entropy": 0.5929568894207478, "epoch": 2.9300924088993163, "grad_norm": 0.1681520938873291, "learning_rate": 2.33385469377741e-06, "loss": 0.5741, "mean_token_accuracy": 0.8208691105246544, "num_tokens": 1016405893.0, "step": 31847 }, { "entropy": 0.43029348459094763, "epoch": 2.9301844152707575, "grad_norm": 0.1487070769071579, "learning_rate": 2.330787867635784e-06, "loss": 0.4219, "mean_token_accuracy": 0.8672554604709148, "num_tokens": 1016438536.0, "step": 31848 }, { "entropy": 0.5267316764220595, "epoch": 2.9302764216421986, "grad_norm": 0.16183118522167206, "learning_rate": 2.327721041494158e-06, "loss": 0.5195, "mean_token_accuracy": 0.8369435705244541, "num_tokens": 1016470656.0, "step": 31849 }, { "entropy": 0.4299102472141385, "epoch": 2.93036842801364, "grad_norm": 0.14371545612812042, "learning_rate": 2.3246542153525317e-06, "loss": 0.4152, "mean_token_accuracy": 0.8650827035307884, "num_tokens": 1016503218.0, "step": 31850 }, { "entropy": 0.5304584968835115, "epoch": 2.9304604343850813, "grad_norm": 0.15858617424964905, "learning_rate": 2.3215873892109055e-06, "loss": 0.5157, "mean_token_accuracy": 0.8360789008438587, "num_tokens": 1016535254.0, "step": 31851 }, { "entropy": 0.5005966820754111, "epoch": 2.9305524407565224, "grad_norm": 0.15687420964241028, "learning_rate": 2.3185205630692797e-06, "loss": 0.491, "mean_token_accuracy": 0.8464709334075451, "num_tokens": 1016566805.0, "step": 31852 }, { "entropy": 0.40490155667066574, "epoch": 2.9306444471279636, "grad_norm": 0.14237353205680847, "learning_rate": 2.3154537369276535e-06, "loss": 0.3941, "mean_token_accuracy": 0.8747315816581249, "num_tokens": 1016599260.0, "step": 31853 }, { "entropy": 0.47504247003234923, "epoch": 2.9307364534994047, "grad_norm": 0.14704562723636627, "learning_rate": 2.3123869107860278e-06, "loss": 0.4642, "mean_token_accuracy": 0.8563927449285984, "num_tokens": 1016631679.0, "step": 31854 }, { "entropy": 0.46811259374953806, "epoch": 2.9308284598708463, "grad_norm": 0.1544298380613327, "learning_rate": 2.309320084644402e-06, "loss": 0.46, "mean_token_accuracy": 0.8514516614377499, "num_tokens": 1016663167.0, "step": 31855 }, { "entropy": 0.45336119877174497, "epoch": 2.9309204662422874, "grad_norm": 0.15037164092063904, "learning_rate": 2.306253258502776e-06, "loss": 0.4453, "mean_token_accuracy": 0.8586073368787766, "num_tokens": 1016695248.0, "step": 31856 }, { "entropy": 0.4624192325863987, "epoch": 2.9310124726137285, "grad_norm": 0.1511041671037674, "learning_rate": 2.3031864323611496e-06, "loss": 0.4403, "mean_token_accuracy": 0.8563654087483883, "num_tokens": 1016726608.0, "step": 31857 }, { "entropy": 0.4411197677254677, "epoch": 2.9311044789851697, "grad_norm": 0.14751146733760834, "learning_rate": 2.3001196062195234e-06, "loss": 0.4279, "mean_token_accuracy": 0.8632020354270935, "num_tokens": 1016758397.0, "step": 31858 }, { "entropy": 0.4658185434527695, "epoch": 2.931196485356611, "grad_norm": 0.14946973323822021, "learning_rate": 2.2970527800778976e-06, "loss": 0.458, "mean_token_accuracy": 0.8566535264253616, "num_tokens": 1016790899.0, "step": 31859 }, { "entropy": 0.4889997225254774, "epoch": 2.9312884917280524, "grad_norm": 0.15636591613292694, "learning_rate": 2.2939859539362714e-06, "loss": 0.4752, "mean_token_accuracy": 0.8498530499637127, "num_tokens": 1016822578.0, "step": 31860 }, { "entropy": 0.533542257733643, "epoch": 2.9313804980994935, "grad_norm": 0.16283245384693146, "learning_rate": 2.2909191277946452e-06, "loss": 0.5169, "mean_token_accuracy": 0.8373825699090958, "num_tokens": 1016853589.0, "step": 31861 }, { "entropy": 0.5873375153169036, "epoch": 2.9314725044709347, "grad_norm": 0.16492138803005219, "learning_rate": 2.2878523016530194e-06, "loss": 0.5761, "mean_token_accuracy": 0.8214927613735199, "num_tokens": 1016885567.0, "step": 31862 }, { "entropy": 0.4200665820389986, "epoch": 2.931564510842376, "grad_norm": 0.1489538997411728, "learning_rate": 2.2847854755113937e-06, "loss": 0.4086, "mean_token_accuracy": 0.869022898375988, "num_tokens": 1016917858.0, "step": 31863 }, { "entropy": 0.5721034584566951, "epoch": 2.931656517213817, "grad_norm": 0.16578391194343567, "learning_rate": 2.2817186493697675e-06, "loss": 0.5663, "mean_token_accuracy": 0.8239295668900013, "num_tokens": 1016949917.0, "step": 31864 }, { "entropy": 0.5113514279946685, "epoch": 2.9317485235852585, "grad_norm": 0.1570456176996231, "learning_rate": 2.2786518232281413e-06, "loss": 0.5081, "mean_token_accuracy": 0.8411736451089382, "num_tokens": 1016982320.0, "step": 31865 }, { "entropy": 0.4037983138114214, "epoch": 2.9318405299566996, "grad_norm": 0.14378871023654938, "learning_rate": 2.275584997086515e-06, "loss": 0.3845, "mean_token_accuracy": 0.8742812052369118, "num_tokens": 1017014320.0, "step": 31866 }, { "entropy": 0.4946711426600814, "epoch": 2.9319325363281408, "grad_norm": 0.15392398834228516, "learning_rate": 2.2725181709448893e-06, "loss": 0.4894, "mean_token_accuracy": 0.8431714773178101, "num_tokens": 1017046775.0, "step": 31867 }, { "entropy": 0.5698843076825142, "epoch": 2.932024542699582, "grad_norm": 0.16984274983406067, "learning_rate": 2.269451344803263e-06, "loss": 0.5511, "mean_token_accuracy": 0.8229168355464935, "num_tokens": 1017078184.0, "step": 31868 }, { "entropy": 0.41875117737799883, "epoch": 2.932116549071023, "grad_norm": 0.14541591703891754, "learning_rate": 2.2663845186616373e-06, "loss": 0.4133, "mean_token_accuracy": 0.867579497396946, "num_tokens": 1017110380.0, "step": 31869 }, { "entropy": 0.4859205358661711, "epoch": 2.9322085554424646, "grad_norm": 0.15406835079193115, "learning_rate": 2.263317692520011e-06, "loss": 0.472, "mean_token_accuracy": 0.8505454994738102, "num_tokens": 1017142136.0, "step": 31870 }, { "entropy": 0.43754747277125716, "epoch": 2.9323005618139057, "grad_norm": 0.15280751883983612, "learning_rate": 2.2602508663783853e-06, "loss": 0.4223, "mean_token_accuracy": 0.8616149798035622, "num_tokens": 1017174263.0, "step": 31871 }, { "entropy": 0.43586302921175957, "epoch": 2.932392568185347, "grad_norm": 0.14607171714305878, "learning_rate": 2.257184040236759e-06, "loss": 0.4288, "mean_token_accuracy": 0.8644662909209728, "num_tokens": 1017207031.0, "step": 31872 }, { "entropy": 0.5491888727992773, "epoch": 2.932484574556788, "grad_norm": 0.16220644116401672, "learning_rate": 2.254117214095133e-06, "loss": 0.5378, "mean_token_accuracy": 0.8285768665373325, "num_tokens": 1017238753.0, "step": 31873 }, { "entropy": 0.39852727856487036, "epoch": 2.932576580928229, "grad_norm": 0.1423807144165039, "learning_rate": 2.2510503879535067e-06, "loss": 0.3867, "mean_token_accuracy": 0.8707529343664646, "num_tokens": 1017271083.0, "step": 31874 }, { "entropy": 0.4635793917113915, "epoch": 2.9326685872996707, "grad_norm": 0.147701233625412, "learning_rate": 2.247983561811881e-06, "loss": 0.4453, "mean_token_accuracy": 0.8577213808894157, "num_tokens": 1017303023.0, "step": 31875 }, { "entropy": 0.49756394140422344, "epoch": 2.932760593671112, "grad_norm": 0.15468250215053558, "learning_rate": 2.2449167356702548e-06, "loss": 0.4875, "mean_token_accuracy": 0.8485403805971146, "num_tokens": 1017335214.0, "step": 31876 }, { "entropy": 0.4109184518456459, "epoch": 2.932852600042553, "grad_norm": 0.14459457993507385, "learning_rate": 2.241849909528629e-06, "loss": 0.3961, "mean_token_accuracy": 0.8724530301988125, "num_tokens": 1017365963.0, "step": 31877 }, { "entropy": 0.4461100082844496, "epoch": 2.932944606413994, "grad_norm": 0.14786817133426666, "learning_rate": 2.2387830833870032e-06, "loss": 0.428, "mean_token_accuracy": 0.8647199459373951, "num_tokens": 1017398132.0, "step": 31878 }, { "entropy": 0.38667009002529085, "epoch": 2.9330366127854353, "grad_norm": 0.14079909026622772, "learning_rate": 2.235716257245377e-06, "loss": 0.3783, "mean_token_accuracy": 0.8779804594814777, "num_tokens": 1017430451.0, "step": 31879 }, { "entropy": 0.4658886604011059, "epoch": 2.933128619156877, "grad_norm": 0.14897577464580536, "learning_rate": 2.232649431103751e-06, "loss": 0.4549, "mean_token_accuracy": 0.8562872409820557, "num_tokens": 1017462310.0, "step": 31880 }, { "entropy": 0.5524609591811895, "epoch": 2.933220625528318, "grad_norm": 0.16645626723766327, "learning_rate": 2.2295826049621246e-06, "loss": 0.541, "mean_token_accuracy": 0.8286476880311966, "num_tokens": 1017493552.0, "step": 31881 }, { "entropy": 0.5730965109542012, "epoch": 2.933312631899759, "grad_norm": 0.16319330036640167, "learning_rate": 2.226515778820499e-06, "loss": 0.5623, "mean_token_accuracy": 0.8210746422410011, "num_tokens": 1017525762.0, "step": 31882 }, { "entropy": 0.4656250597909093, "epoch": 2.9334046382712002, "grad_norm": 0.15613210201263428, "learning_rate": 2.2234489526788726e-06, "loss": 0.4565, "mean_token_accuracy": 0.8527276329696178, "num_tokens": 1017558363.0, "step": 31883 }, { "entropy": 0.4432260962203145, "epoch": 2.9334966446426414, "grad_norm": 0.14654192328453064, "learning_rate": 2.220382126537247e-06, "loss": 0.4383, "mean_token_accuracy": 0.86286611109972, "num_tokens": 1017590742.0, "step": 31884 }, { "entropy": 0.5554750873707235, "epoch": 2.933588651014083, "grad_norm": 0.16290423274040222, "learning_rate": 2.2173153003956207e-06, "loss": 0.5451, "mean_token_accuracy": 0.8270453847944736, "num_tokens": 1017622650.0, "step": 31885 }, { "entropy": 0.5064868237823248, "epoch": 2.933680657385524, "grad_norm": 0.16115662455558777, "learning_rate": 2.214248474253995e-06, "loss": 0.5012, "mean_token_accuracy": 0.839052002876997, "num_tokens": 1017654531.0, "step": 31886 }, { "entropy": 0.4720356110483408, "epoch": 2.933772663756965, "grad_norm": 0.1598621904850006, "learning_rate": 2.2111816481123687e-06, "loss": 0.4682, "mean_token_accuracy": 0.8536981604993343, "num_tokens": 1017686147.0, "step": 31887 }, { "entropy": 0.5446380572393537, "epoch": 2.9338646701284063, "grad_norm": 0.1617157906293869, "learning_rate": 2.2081148219707425e-06, "loss": 0.5241, "mean_token_accuracy": 0.8324738256633282, "num_tokens": 1017717704.0, "step": 31888 }, { "entropy": 0.46494124084711075, "epoch": 2.9339566764998475, "grad_norm": 0.14464975893497467, "learning_rate": 2.2050479958291163e-06, "loss": 0.4534, "mean_token_accuracy": 0.8603070601820946, "num_tokens": 1017749996.0, "step": 31889 }, { "entropy": 0.47443937323987484, "epoch": 2.934048682871289, "grad_norm": 0.1562570333480835, "learning_rate": 2.2019811696874905e-06, "loss": 0.463, "mean_token_accuracy": 0.8572038114070892, "num_tokens": 1017782171.0, "step": 31890 }, { "entropy": 0.5013790428638458, "epoch": 2.93414068924273, "grad_norm": 0.15703104436397552, "learning_rate": 2.1989143435458643e-06, "loss": 0.4905, "mean_token_accuracy": 0.8445847369730473, "num_tokens": 1017813889.0, "step": 31891 }, { "entropy": 0.48756731837056577, "epoch": 2.9342326956141713, "grad_norm": 0.15677174925804138, "learning_rate": 2.1958475174042385e-06, "loss": 0.4687, "mean_token_accuracy": 0.849238283932209, "num_tokens": 1017845091.0, "step": 31892 }, { "entropy": 0.472154650837183, "epoch": 2.9343247019856125, "grad_norm": 0.1529429405927658, "learning_rate": 2.1927806912626123e-06, "loss": 0.4576, "mean_token_accuracy": 0.8535237237811089, "num_tokens": 1017877005.0, "step": 31893 }, { "entropy": 0.40906788129359484, "epoch": 2.9344167083570536, "grad_norm": 0.14156168699264526, "learning_rate": 2.1897138651209866e-06, "loss": 0.3954, "mean_token_accuracy": 0.8749310821294785, "num_tokens": 1017909264.0, "step": 31894 }, { "entropy": 0.6190978744998574, "epoch": 2.934508714728495, "grad_norm": 0.17588181793689728, "learning_rate": 2.1866470389793604e-06, "loss": 0.6063, "mean_token_accuracy": 0.80882802978158, "num_tokens": 1017941230.0, "step": 31895 }, { "entropy": 0.4447037121281028, "epoch": 2.9346007210999363, "grad_norm": 0.1497122198343277, "learning_rate": 2.183580212837734e-06, "loss": 0.4315, "mean_token_accuracy": 0.8604005686938763, "num_tokens": 1017973123.0, "step": 31896 }, { "entropy": 0.4718636814504862, "epoch": 2.9346927274713774, "grad_norm": 0.1539813131093979, "learning_rate": 2.1805133866961084e-06, "loss": 0.4609, "mean_token_accuracy": 0.8514469675719738, "num_tokens": 1018004008.0, "step": 31897 }, { "entropy": 0.5197385204955935, "epoch": 2.9347847338428186, "grad_norm": 0.16423337161540985, "learning_rate": 2.177446560554482e-06, "loss": 0.5036, "mean_token_accuracy": 0.8390932157635689, "num_tokens": 1018035464.0, "step": 31898 }, { "entropy": 0.47312190849334, "epoch": 2.9348767402142597, "grad_norm": 0.15302179753780365, "learning_rate": 2.1743797344128564e-06, "loss": 0.4649, "mean_token_accuracy": 0.8504030033946037, "num_tokens": 1018068052.0, "step": 31899 }, { "entropy": 0.6004688208922744, "epoch": 2.9349687465857013, "grad_norm": 0.16812525689601898, "learning_rate": 2.1713129082712302e-06, "loss": 0.5883, "mean_token_accuracy": 0.8129074089229107, "num_tokens": 1018100529.0, "step": 31900 }, { "entropy": 0.5673424479318783, "epoch": 2.9350607529571424, "grad_norm": 0.1645883172750473, "learning_rate": 2.1682460821296044e-06, "loss": 0.5538, "mean_token_accuracy": 0.8259999975562096, "num_tokens": 1018132562.0, "step": 31901 }, { "entropy": 0.5119147077202797, "epoch": 2.9351527593285835, "grad_norm": 0.15730255842208862, "learning_rate": 2.1651792559879782e-06, "loss": 0.5049, "mean_token_accuracy": 0.8409453257918358, "num_tokens": 1018164973.0, "step": 31902 }, { "entropy": 0.4768095528706908, "epoch": 2.9352447657000247, "grad_norm": 0.15072426199913025, "learning_rate": 2.162112429846352e-06, "loss": 0.4711, "mean_token_accuracy": 0.8506843112409115, "num_tokens": 1018197018.0, "step": 31903 }, { "entropy": 0.5233382740989327, "epoch": 2.935336772071466, "grad_norm": 0.15660379827022552, "learning_rate": 2.159045603704726e-06, "loss": 0.5167, "mean_token_accuracy": 0.8381690122187138, "num_tokens": 1018229499.0, "step": 31904 }, { "entropy": 0.538415415212512, "epoch": 2.9354287784429074, "grad_norm": 0.1662788689136505, "learning_rate": 2.1559787775631e-06, "loss": 0.5376, "mean_token_accuracy": 0.8341865167021751, "num_tokens": 1018261659.0, "step": 31905 }, { "entropy": 0.4987659747712314, "epoch": 2.9355207848143485, "grad_norm": 0.16008035838603973, "learning_rate": 2.152911951421474e-06, "loss": 0.4926, "mean_token_accuracy": 0.8429819494485855, "num_tokens": 1018294251.0, "step": 31906 }, { "entropy": 0.5199867910705507, "epoch": 2.9356127911857897, "grad_norm": 0.16211873292922974, "learning_rate": 2.149845125279848e-06, "loss": 0.5106, "mean_token_accuracy": 0.8378139808773994, "num_tokens": 1018325691.0, "step": 31907 }, { "entropy": 0.6080751121044159, "epoch": 2.935704797557231, "grad_norm": 0.17172957956790924, "learning_rate": 2.146778299138222e-06, "loss": 0.6003, "mean_token_accuracy": 0.811909768730402, "num_tokens": 1018357845.0, "step": 31908 }, { "entropy": 0.5615025609731674, "epoch": 2.935796803928672, "grad_norm": 0.1625656634569168, "learning_rate": 2.143711472996596e-06, "loss": 0.5461, "mean_token_accuracy": 0.8275767415761948, "num_tokens": 1018389877.0, "step": 31909 }, { "entropy": 0.534761302638799, "epoch": 2.9358888103001135, "grad_norm": 0.16178590059280396, "learning_rate": 2.14064464685497e-06, "loss": 0.518, "mean_token_accuracy": 0.8350806683301926, "num_tokens": 1018422113.0, "step": 31910 }, { "entropy": 0.4741458436474204, "epoch": 2.9359808166715546, "grad_norm": 0.14809750020503998, "learning_rate": 2.1375778207133437e-06, "loss": 0.4539, "mean_token_accuracy": 0.8539791889488697, "num_tokens": 1018454698.0, "step": 31911 }, { "entropy": 0.4986515175551176, "epoch": 2.9360728230429958, "grad_norm": 0.16071145236492157, "learning_rate": 2.1345109945717175e-06, "loss": 0.4981, "mean_token_accuracy": 0.8394823558628559, "num_tokens": 1018487292.0, "step": 31912 }, { "entropy": 0.5362431388348341, "epoch": 2.936164829414437, "grad_norm": 0.16190539300441742, "learning_rate": 2.1314441684300917e-06, "loss": 0.5307, "mean_token_accuracy": 0.8347228579223156, "num_tokens": 1018519121.0, "step": 31913 }, { "entropy": 0.5180257251486182, "epoch": 2.936256835785878, "grad_norm": 0.16082654893398285, "learning_rate": 2.128377342288466e-06, "loss": 0.5059, "mean_token_accuracy": 0.8385635763406754, "num_tokens": 1018550807.0, "step": 31914 }, { "entropy": 0.5561826550401747, "epoch": 2.9363488421573196, "grad_norm": 0.16613531112670898, "learning_rate": 2.1253105161468398e-06, "loss": 0.5414, "mean_token_accuracy": 0.8299732506275177, "num_tokens": 1018581663.0, "step": 31915 }, { "entropy": 0.48910319060087204, "epoch": 2.9364408485287607, "grad_norm": 0.15152607858181, "learning_rate": 2.122243690005214e-06, "loss": 0.4788, "mean_token_accuracy": 0.8492613211274147, "num_tokens": 1018614283.0, "step": 31916 }, { "entropy": 0.48720199055969715, "epoch": 2.936532854900202, "grad_norm": 0.15599492192268372, "learning_rate": 2.1191768638635878e-06, "loss": 0.4828, "mean_token_accuracy": 0.8451715260744095, "num_tokens": 1018646362.0, "step": 31917 }, { "entropy": 0.46120519982650876, "epoch": 2.936624861271643, "grad_norm": 0.15213419497013092, "learning_rate": 2.1161100377219616e-06, "loss": 0.4569, "mean_token_accuracy": 0.8596899323165417, "num_tokens": 1018678792.0, "step": 31918 }, { "entropy": 0.4917578902095556, "epoch": 2.936716867643084, "grad_norm": 0.15303394198417664, "learning_rate": 2.1130432115803354e-06, "loss": 0.4709, "mean_token_accuracy": 0.8489046171307564, "num_tokens": 1018710488.0, "step": 31919 }, { "entropy": 0.4953863089904189, "epoch": 2.9368088740145257, "grad_norm": 0.15746837854385376, "learning_rate": 2.1099763854387096e-06, "loss": 0.4777, "mean_token_accuracy": 0.8457692973315716, "num_tokens": 1018742446.0, "step": 31920 }, { "entropy": 0.4861604515463114, "epoch": 2.936900880385967, "grad_norm": 0.15808406472206116, "learning_rate": 2.1069095592970834e-06, "loss": 0.4696, "mean_token_accuracy": 0.8482159227132797, "num_tokens": 1018774116.0, "step": 31921 }, { "entropy": 0.45176790095865726, "epoch": 2.936992886757408, "grad_norm": 0.15432070195674896, "learning_rate": 2.1038427331554576e-06, "loss": 0.4544, "mean_token_accuracy": 0.8580611199140549, "num_tokens": 1018805532.0, "step": 31922 }, { "entropy": 0.5721796322613955, "epoch": 2.937084893128849, "grad_norm": 0.16700537502765656, "learning_rate": 2.1007759070138314e-06, "loss": 0.558, "mean_token_accuracy": 0.8254141248762608, "num_tokens": 1018837566.0, "step": 31923 }, { "entropy": 0.4811301724985242, "epoch": 2.9371768995002903, "grad_norm": 0.15677954256534576, "learning_rate": 2.0977090808722057e-06, "loss": 0.4682, "mean_token_accuracy": 0.8495360352098942, "num_tokens": 1018868893.0, "step": 31924 }, { "entropy": 0.4324828233802691, "epoch": 2.937268905871732, "grad_norm": 0.14781829714775085, "learning_rate": 2.0946422547305795e-06, "loss": 0.4202, "mean_token_accuracy": 0.8672522492706776, "num_tokens": 1018901295.0, "step": 31925 }, { "entropy": 0.4908102182671428, "epoch": 2.937360912243173, "grad_norm": 0.154385045170784, "learning_rate": 2.0915754285889533e-06, "loss": 0.4851, "mean_token_accuracy": 0.8428973779082298, "num_tokens": 1018933102.0, "step": 31926 }, { "entropy": 0.508835673565045, "epoch": 2.937452918614614, "grad_norm": 0.1602274477481842, "learning_rate": 2.088508602447327e-06, "loss": 0.4947, "mean_token_accuracy": 0.8447184190154076, "num_tokens": 1018964839.0, "step": 31927 }, { "entropy": 0.4033956313505769, "epoch": 2.9375449249860552, "grad_norm": 0.1468179076910019, "learning_rate": 2.0854417763057013e-06, "loss": 0.3971, "mean_token_accuracy": 0.87021454423666, "num_tokens": 1018997071.0, "step": 31928 }, { "entropy": 0.423188557382673, "epoch": 2.9376369313574964, "grad_norm": 0.14218716323375702, "learning_rate": 2.0823749501640755e-06, "loss": 0.4144, "mean_token_accuracy": 0.8681578151881695, "num_tokens": 1019029441.0, "step": 31929 }, { "entropy": 0.3939781042281538, "epoch": 2.937728937728938, "grad_norm": 0.13439029455184937, "learning_rate": 2.0793081240224493e-06, "loss": 0.3789, "mean_token_accuracy": 0.8791588023304939, "num_tokens": 1019061591.0, "step": 31930 }, { "entropy": 0.509125585667789, "epoch": 2.937820944100379, "grad_norm": 0.160905659198761, "learning_rate": 2.076241297880823e-06, "loss": 0.504, "mean_token_accuracy": 0.8411611206829548, "num_tokens": 1019093680.0, "step": 31931 }, { "entropy": 0.5803996045142412, "epoch": 2.93791295047182, "grad_norm": 0.16711175441741943, "learning_rate": 2.0731744717391973e-06, "loss": 0.5772, "mean_token_accuracy": 0.8174074962735176, "num_tokens": 1019125338.0, "step": 31932 }, { "entropy": 0.5352561729960144, "epoch": 2.9380049568432614, "grad_norm": 0.16871005296707153, "learning_rate": 2.070107645597571e-06, "loss": 0.5313, "mean_token_accuracy": 0.8312118761241436, "num_tokens": 1019157448.0, "step": 31933 }, { "entropy": 0.5473991613835096, "epoch": 2.9380969632147025, "grad_norm": 0.16102084517478943, "learning_rate": 2.067040819455945e-06, "loss": 0.5379, "mean_token_accuracy": 0.8287815302610397, "num_tokens": 1019189539.0, "step": 31934 }, { "entropy": 0.4857138483785093, "epoch": 2.938188969586144, "grad_norm": 0.15841029584407806, "learning_rate": 2.0639739933143187e-06, "loss": 0.4741, "mean_token_accuracy": 0.8510875627398491, "num_tokens": 1019221583.0, "step": 31935 }, { "entropy": 0.4938088618218899, "epoch": 2.938280975957585, "grad_norm": 0.15819412469863892, "learning_rate": 2.060907167172693e-06, "loss": 0.4816, "mean_token_accuracy": 0.8437407910823822, "num_tokens": 1019253303.0, "step": 31936 }, { "entropy": 0.5426892507821321, "epoch": 2.9383729823290263, "grad_norm": 0.1624724268913269, "learning_rate": 2.057840341031067e-06, "loss": 0.5324, "mean_token_accuracy": 0.8297702074050903, "num_tokens": 1019285225.0, "step": 31937 }, { "entropy": 0.5545469224452972, "epoch": 2.9384649887004675, "grad_norm": 0.16594456136226654, "learning_rate": 2.054773514889441e-06, "loss": 0.5468, "mean_token_accuracy": 0.8253882974386215, "num_tokens": 1019316620.0, "step": 31938 }, { "entropy": 0.518985079601407, "epoch": 2.9385569950719086, "grad_norm": 0.1555393934249878, "learning_rate": 2.051706688747815e-06, "loss": 0.5032, "mean_token_accuracy": 0.8398794308304787, "num_tokens": 1019348761.0, "step": 31939 }, { "entropy": 0.4573060004040599, "epoch": 2.93864900144335, "grad_norm": 0.15427973866462708, "learning_rate": 2.048639862606189e-06, "loss": 0.4482, "mean_token_accuracy": 0.8571955785155296, "num_tokens": 1019380729.0, "step": 31940 }, { "entropy": 0.45194597356021404, "epoch": 2.9387410078147913, "grad_norm": 0.14913706481456757, "learning_rate": 2.045573036464563e-06, "loss": 0.4421, "mean_token_accuracy": 0.8615854680538177, "num_tokens": 1019412898.0, "step": 31941 }, { "entropy": 0.4467101311311126, "epoch": 2.9388330141862324, "grad_norm": 0.14669372141361237, "learning_rate": 2.0425062103229366e-06, "loss": 0.4413, "mean_token_accuracy": 0.8592363558709621, "num_tokens": 1019444311.0, "step": 31942 }, { "entropy": 0.4392906394787133, "epoch": 2.9389250205576736, "grad_norm": 0.15395939350128174, "learning_rate": 2.039439384181311e-06, "loss": 0.4232, "mean_token_accuracy": 0.8646626695990562, "num_tokens": 1019476168.0, "step": 31943 }, { "entropy": 0.37580857425928116, "epoch": 2.9390170269291147, "grad_norm": 0.13512523472309113, "learning_rate": 2.036372558039685e-06, "loss": 0.3622, "mean_token_accuracy": 0.8868941441178322, "num_tokens": 1019507832.0, "step": 31944 }, { "entropy": 0.4393664738163352, "epoch": 2.9391090333005563, "grad_norm": 0.14297644793987274, "learning_rate": 2.033305731898059e-06, "loss": 0.4215, "mean_token_accuracy": 0.8616402931511402, "num_tokens": 1019540005.0, "step": 31945 }, { "entropy": 0.555123059079051, "epoch": 2.9392010396719974, "grad_norm": 0.15868264436721802, "learning_rate": 2.0302389057564327e-06, "loss": 0.5453, "mean_token_accuracy": 0.8288728147745132, "num_tokens": 1019572037.0, "step": 31946 }, { "entropy": 0.6390635315328836, "epoch": 2.9392930460434386, "grad_norm": 0.17135673761367798, "learning_rate": 2.027172079614807e-06, "loss": 0.6185, "mean_token_accuracy": 0.8048166930675507, "num_tokens": 1019603562.0, "step": 31947 }, { "entropy": 0.47182036750018597, "epoch": 2.9393850524148797, "grad_norm": 0.15016598999500275, "learning_rate": 2.0241052534731807e-06, "loss": 0.4633, "mean_token_accuracy": 0.8520496226847172, "num_tokens": 1019636006.0, "step": 31948 }, { "entropy": 0.5663012843579054, "epoch": 2.939477058786321, "grad_norm": 0.16705691814422607, "learning_rate": 2.0210384273315545e-06, "loss": 0.553, "mean_token_accuracy": 0.8249349817633629, "num_tokens": 1019668753.0, "step": 31949 }, { "entropy": 0.5315374284982681, "epoch": 2.9395690651577624, "grad_norm": 0.1622197926044464, "learning_rate": 2.0179716011899283e-06, "loss": 0.5212, "mean_token_accuracy": 0.8364822193980217, "num_tokens": 1019701153.0, "step": 31950 }, { "entropy": 0.5174348065629601, "epoch": 2.9396610715292035, "grad_norm": 0.1576225608587265, "learning_rate": 2.0149047750483025e-06, "loss": 0.5192, "mean_token_accuracy": 0.8375776000320911, "num_tokens": 1019733195.0, "step": 31951 }, { "entropy": 0.5265309382230043, "epoch": 2.9397530779006447, "grad_norm": 0.16323190927505493, "learning_rate": 2.0118379489066767e-06, "loss": 0.5075, "mean_token_accuracy": 0.8403994180262089, "num_tokens": 1019764925.0, "step": 31952 }, { "entropy": 0.5687125702388585, "epoch": 2.939845084272086, "grad_norm": 0.16301199793815613, "learning_rate": 2.0087711227650505e-06, "loss": 0.5611, "mean_token_accuracy": 0.8221835866570473, "num_tokens": 1019797419.0, "step": 31953 }, { "entropy": 0.485572159755975, "epoch": 2.939937090643527, "grad_norm": 0.15235209465026855, "learning_rate": 2.0057042966234243e-06, "loss": 0.4744, "mean_token_accuracy": 0.8502679690718651, "num_tokens": 1019829351.0, "step": 31954 }, { "entropy": 0.5704564843326807, "epoch": 2.9400290970149685, "grad_norm": 0.15847253799438477, "learning_rate": 2.0026374704817986e-06, "loss": 0.5619, "mean_token_accuracy": 0.8246534019708633, "num_tokens": 1019861337.0, "step": 31955 }, { "entropy": 0.47834829427301884, "epoch": 2.9401211033864096, "grad_norm": 0.1490108221769333, "learning_rate": 1.9995706443401724e-06, "loss": 0.4762, "mean_token_accuracy": 0.8494736477732658, "num_tokens": 1019893639.0, "step": 31956 }, { "entropy": 0.5128578385338187, "epoch": 2.9402131097578508, "grad_norm": 0.15852339565753937, "learning_rate": 1.996503818198546e-06, "loss": 0.5055, "mean_token_accuracy": 0.8419775888323784, "num_tokens": 1019925676.0, "step": 31957 }, { "entropy": 0.5101419743150473, "epoch": 2.940305116129292, "grad_norm": 0.16361133754253387, "learning_rate": 1.9934369920569204e-06, "loss": 0.5031, "mean_token_accuracy": 0.8430198654532433, "num_tokens": 1019957634.0, "step": 31958 }, { "entropy": 0.5437237769365311, "epoch": 2.940397122500733, "grad_norm": 0.16524960100650787, "learning_rate": 1.9903701659152946e-06, "loss": 0.5354, "mean_token_accuracy": 0.8364427946507931, "num_tokens": 1019989284.0, "step": 31959 }, { "entropy": 0.46125171054154634, "epoch": 2.9404891288721746, "grad_norm": 0.1491917073726654, "learning_rate": 1.9873033397736684e-06, "loss": 0.4623, "mean_token_accuracy": 0.8572357073426247, "num_tokens": 1020021741.0, "step": 31960 }, { "entropy": 0.4808612987399101, "epoch": 2.9405811352436158, "grad_norm": 0.15878628194332123, "learning_rate": 1.984236513632042e-06, "loss": 0.4747, "mean_token_accuracy": 0.8457922637462616, "num_tokens": 1020053859.0, "step": 31961 }, { "entropy": 0.5046213453169912, "epoch": 2.940673141615057, "grad_norm": 0.15946100652217865, "learning_rate": 1.9811696874904164e-06, "loss": 0.4822, "mean_token_accuracy": 0.8450268507003784, "num_tokens": 1020084468.0, "step": 31962 }, { "entropy": 0.5428722156211734, "epoch": 2.940765147986498, "grad_norm": 0.16222497820854187, "learning_rate": 1.9781028613487902e-06, "loss": 0.5249, "mean_token_accuracy": 0.8349394388496876, "num_tokens": 1020116809.0, "step": 31963 }, { "entropy": 0.5355948433279991, "epoch": 2.940857154357939, "grad_norm": 0.17156736552715302, "learning_rate": 1.975036035207164e-06, "loss": 0.5334, "mean_token_accuracy": 0.8311324566602707, "num_tokens": 1020147909.0, "step": 31964 }, { "entropy": 0.4891096008941531, "epoch": 2.9409491607293807, "grad_norm": 0.158516526222229, "learning_rate": 1.971969209065538e-06, "loss": 0.4909, "mean_token_accuracy": 0.8482609875500202, "num_tokens": 1020180131.0, "step": 31965 }, { "entropy": 0.5630268603563309, "epoch": 2.941041167100822, "grad_norm": 0.16060471534729004, "learning_rate": 1.968902382923912e-06, "loss": 0.5366, "mean_token_accuracy": 0.8284397199749947, "num_tokens": 1020211488.0, "step": 31966 }, { "entropy": 0.5075676329433918, "epoch": 2.941133173472263, "grad_norm": 0.15860339999198914, "learning_rate": 1.9658355567822863e-06, "loss": 0.5144, "mean_token_accuracy": 0.8355743959546089, "num_tokens": 1020243736.0, "step": 31967 }, { "entropy": 0.5553919449448586, "epoch": 2.941225179843704, "grad_norm": 0.16270217299461365, "learning_rate": 1.96276873064066e-06, "loss": 0.5428, "mean_token_accuracy": 0.8306823149323463, "num_tokens": 1020275869.0, "step": 31968 }, { "entropy": 0.6557868253439665, "epoch": 2.9413171862151453, "grad_norm": 0.17865192890167236, "learning_rate": 1.959701904499034e-06, "loss": 0.6478, "mean_token_accuracy": 0.7975081689655781, "num_tokens": 1020307267.0, "step": 31969 }, { "entropy": 0.5009624073281884, "epoch": 2.941409192586587, "grad_norm": 0.1575886458158493, "learning_rate": 1.956635078357408e-06, "loss": 0.4855, "mean_token_accuracy": 0.8460453525185585, "num_tokens": 1020338986.0, "step": 31970 }, { "entropy": 0.39392140367999673, "epoch": 2.941501198958028, "grad_norm": 0.1421598494052887, "learning_rate": 1.953568252215782e-06, "loss": 0.3811, "mean_token_accuracy": 0.8762484900653362, "num_tokens": 1020370772.0, "step": 31971 }, { "entropy": 0.590209168381989, "epoch": 2.941593205329469, "grad_norm": 0.16156364977359772, "learning_rate": 1.9505014260741557e-06, "loss": 0.5756, "mean_token_accuracy": 0.8216020986437798, "num_tokens": 1020403183.0, "step": 31972 }, { "entropy": 0.5084224883466959, "epoch": 2.9416852117009102, "grad_norm": 0.1538233608007431, "learning_rate": 1.94743459993253e-06, "loss": 0.5037, "mean_token_accuracy": 0.8386480025947094, "num_tokens": 1020435388.0, "step": 31973 }, { "entropy": 0.5619555814191699, "epoch": 2.9417772180723514, "grad_norm": 0.1634993702173233, "learning_rate": 1.944367773790904e-06, "loss": 0.5483, "mean_token_accuracy": 0.8277643732726574, "num_tokens": 1020467783.0, "step": 31974 }, { "entropy": 0.4370388473616913, "epoch": 2.941869224443793, "grad_norm": 0.14769479632377625, "learning_rate": 1.941300947649278e-06, "loss": 0.4221, "mean_token_accuracy": 0.8678931072354317, "num_tokens": 1020499967.0, "step": 31975 }, { "entropy": 0.4761411380022764, "epoch": 2.941961230815234, "grad_norm": 0.15274930000305176, "learning_rate": 1.9382341215076518e-06, "loss": 0.4585, "mean_token_accuracy": 0.8546558544039726, "num_tokens": 1020531482.0, "step": 31976 }, { "entropy": 0.45077611692249775, "epoch": 2.942053237186675, "grad_norm": 0.15243691205978394, "learning_rate": 1.935167295366026e-06, "loss": 0.4407, "mean_token_accuracy": 0.8592940531671047, "num_tokens": 1020562929.0, "step": 31977 }, { "entropy": 0.5961405634880066, "epoch": 2.9421452435581164, "grad_norm": 0.16715380549430847, "learning_rate": 1.9321004692243998e-06, "loss": 0.5832, "mean_token_accuracy": 0.8175336718559265, "num_tokens": 1020595498.0, "step": 31978 }, { "entropy": 0.492584609426558, "epoch": 2.9422372499295575, "grad_norm": 0.1549905389547348, "learning_rate": 1.9290336430827736e-06, "loss": 0.4795, "mean_token_accuracy": 0.8467886745929718, "num_tokens": 1020627293.0, "step": 31979 }, { "entropy": 0.5295019363984466, "epoch": 2.942329256300999, "grad_norm": 0.162834033370018, "learning_rate": 1.925966816941148e-06, "loss": 0.5118, "mean_token_accuracy": 0.8392284773290157, "num_tokens": 1020658708.0, "step": 31980 }, { "entropy": 0.5036382814869285, "epoch": 2.94242126267244, "grad_norm": 0.15531177818775177, "learning_rate": 1.922899990799522e-06, "loss": 0.4951, "mean_token_accuracy": 0.8409178107976913, "num_tokens": 1020691001.0, "step": 31981 }, { "entropy": 0.4928086744621396, "epoch": 2.9425132690438813, "grad_norm": 0.1493474543094635, "learning_rate": 1.919833164657896e-06, "loss": 0.4651, "mean_token_accuracy": 0.8516578935086727, "num_tokens": 1020723272.0, "step": 31982 }, { "entropy": 0.5098895560950041, "epoch": 2.9426052754153225, "grad_norm": 0.1623993068933487, "learning_rate": 1.9167663385162696e-06, "loss": 0.4981, "mean_token_accuracy": 0.8463074490427971, "num_tokens": 1020754168.0, "step": 31983 }, { "entropy": 0.4811521675437689, "epoch": 2.9426972817867636, "grad_norm": 0.15236471593379974, "learning_rate": 1.9136995123746434e-06, "loss": 0.4711, "mean_token_accuracy": 0.8505706414580345, "num_tokens": 1020786191.0, "step": 31984 }, { "entropy": 0.5725087560713291, "epoch": 2.942789288158205, "grad_norm": 0.16299721598625183, "learning_rate": 1.9106326862330177e-06, "loss": 0.5502, "mean_token_accuracy": 0.8266764096915722, "num_tokens": 1020817895.0, "step": 31985 }, { "entropy": 0.48213307186961174, "epoch": 2.9428812945296463, "grad_norm": 0.15550991892814636, "learning_rate": 1.9075658600913915e-06, "loss": 0.4676, "mean_token_accuracy": 0.8489363379776478, "num_tokens": 1020850078.0, "step": 31986 }, { "entropy": 0.5216829327400774, "epoch": 2.9429733009010874, "grad_norm": 0.16087330877780914, "learning_rate": 1.9044990339497655e-06, "loss": 0.5155, "mean_token_accuracy": 0.8366078808903694, "num_tokens": 1020882233.0, "step": 31987 }, { "entropy": 0.520468776114285, "epoch": 2.9430653072725286, "grad_norm": 0.15558743476867676, "learning_rate": 1.9014322078081393e-06, "loss": 0.5037, "mean_token_accuracy": 0.8416167348623276, "num_tokens": 1020913961.0, "step": 31988 }, { "entropy": 0.46504425816237926, "epoch": 2.9431573136439697, "grad_norm": 0.1508774310350418, "learning_rate": 1.8983653816665135e-06, "loss": 0.457, "mean_token_accuracy": 0.8562387563288212, "num_tokens": 1020945840.0, "step": 31989 }, { "entropy": 0.4513892778195441, "epoch": 2.9432493200154113, "grad_norm": 0.15510691702365875, "learning_rate": 1.8952985555248875e-06, "loss": 0.4476, "mean_token_accuracy": 0.859651118516922, "num_tokens": 1020978199.0, "step": 31990 }, { "entropy": 0.5149519834667444, "epoch": 2.9433413263868524, "grad_norm": 0.15727512538433075, "learning_rate": 1.8922317293832613e-06, "loss": 0.5118, "mean_token_accuracy": 0.838647373020649, "num_tokens": 1021010305.0, "step": 31991 }, { "entropy": 0.6678859069943428, "epoch": 2.9434333327582936, "grad_norm": 0.18249724805355072, "learning_rate": 1.8891649032416351e-06, "loss": 0.6632, "mean_token_accuracy": 0.7918914370238781, "num_tokens": 1021041583.0, "step": 31992 }, { "entropy": 0.5164060877868906, "epoch": 2.9435253391297347, "grad_norm": 0.15865927934646606, "learning_rate": 1.8860980771000093e-06, "loss": 0.4858, "mean_token_accuracy": 0.8421055041253567, "num_tokens": 1021072776.0, "step": 31993 }, { "entropy": 0.49164728727191687, "epoch": 2.943617345501176, "grad_norm": 0.15799832344055176, "learning_rate": 1.8830312509583833e-06, "loss": 0.4814, "mean_token_accuracy": 0.8454901874065399, "num_tokens": 1021105422.0, "step": 31994 }, { "entropy": 0.520497826859355, "epoch": 2.9437093518726174, "grad_norm": 0.15764658153057098, "learning_rate": 1.8799644248167571e-06, "loss": 0.5086, "mean_token_accuracy": 0.8395322486758232, "num_tokens": 1021136978.0, "step": 31995 }, { "entropy": 0.5600766744464636, "epoch": 2.9438013582440585, "grad_norm": 0.16577602922916412, "learning_rate": 1.876897598675131e-06, "loss": 0.5476, "mean_token_accuracy": 0.8277389593422413, "num_tokens": 1021168660.0, "step": 31996 }, { "entropy": 0.5510672628879547, "epoch": 2.9438933646154997, "grad_norm": 0.16110859811306, "learning_rate": 1.8738307725335052e-06, "loss": 0.5352, "mean_token_accuracy": 0.8302560374140739, "num_tokens": 1021200000.0, "step": 31997 }, { "entropy": 0.44621425005607307, "epoch": 2.943985370986941, "grad_norm": 0.15109704434871674, "learning_rate": 1.8707639463918792e-06, "loss": 0.4287, "mean_token_accuracy": 0.8611067533493042, "num_tokens": 1021231353.0, "step": 31998 }, { "entropy": 0.49877991038374603, "epoch": 2.944077377358382, "grad_norm": 0.15681718289852142, "learning_rate": 1.867697120250253e-06, "loss": 0.482, "mean_token_accuracy": 0.8475156687200069, "num_tokens": 1021262914.0, "step": 31999 }, { "entropy": 0.471724275033921, "epoch": 2.9441693837298235, "grad_norm": 0.15491081774234772, "learning_rate": 1.8646302941086272e-06, "loss": 0.4694, "mean_token_accuracy": 0.8504035025835037, "num_tokens": 1021295206.0, "step": 32000 }, { "entropy": 0.47871334513183683, "epoch": 2.9442613901012646, "grad_norm": 0.15486633777618408, "learning_rate": 1.861563467967001e-06, "loss": 0.465, "mean_token_accuracy": 0.8489585779607296, "num_tokens": 1021326771.0, "step": 32001 }, { "entropy": 0.47682512551546097, "epoch": 2.9443533964727058, "grad_norm": 0.1561036854982376, "learning_rate": 1.858496641825375e-06, "loss": 0.4715, "mean_token_accuracy": 0.8515845462679863, "num_tokens": 1021358741.0, "step": 32002 }, { "entropy": 0.531024269759655, "epoch": 2.944445402844147, "grad_norm": 0.15916797518730164, "learning_rate": 1.8554298156837488e-06, "loss": 0.5173, "mean_token_accuracy": 0.8359980694949627, "num_tokens": 1021390793.0, "step": 32003 }, { "entropy": 0.555805429816246, "epoch": 2.944537409215588, "grad_norm": 0.16437286138534546, "learning_rate": 1.852362989542123e-06, "loss": 0.5406, "mean_token_accuracy": 0.8320870921015739, "num_tokens": 1021422565.0, "step": 32004 }, { "entropy": 0.5230866353958845, "epoch": 2.9446294155870296, "grad_norm": 0.16016480326652527, "learning_rate": 1.849296163400497e-06, "loss": 0.5165, "mean_token_accuracy": 0.8357190638780594, "num_tokens": 1021454530.0, "step": 32005 }, { "entropy": 0.48805062659084797, "epoch": 2.9447214219584708, "grad_norm": 0.15109466016292572, "learning_rate": 1.8462293372588709e-06, "loss": 0.4757, "mean_token_accuracy": 0.8486891128122807, "num_tokens": 1021486902.0, "step": 32006 }, { "entropy": 0.4402818668168038, "epoch": 2.944813428329912, "grad_norm": 0.14382225275039673, "learning_rate": 1.8431625111172447e-06, "loss": 0.4271, "mean_token_accuracy": 0.8639349341392517, "num_tokens": 1021518124.0, "step": 32007 }, { "entropy": 0.5210155099630356, "epoch": 2.944905434701353, "grad_norm": 0.1614706665277481, "learning_rate": 1.8400956849756189e-06, "loss": 0.5066, "mean_token_accuracy": 0.8380300812423229, "num_tokens": 1021550874.0, "step": 32008 }, { "entropy": 0.5141850588843226, "epoch": 2.944997441072794, "grad_norm": 0.1572600156068802, "learning_rate": 1.837028858833993e-06, "loss": 0.5091, "mean_token_accuracy": 0.8398799784481525, "num_tokens": 1021583221.0, "step": 32009 }, { "entropy": 0.5633502686396241, "epoch": 2.9450894474442357, "grad_norm": 0.15806856751441956, "learning_rate": 1.8339620326923667e-06, "loss": 0.5439, "mean_token_accuracy": 0.8274615332484245, "num_tokens": 1021614735.0, "step": 32010 }, { "entropy": 0.5825268477201462, "epoch": 2.945181453815677, "grad_norm": 0.1656578928232193, "learning_rate": 1.8308952065507405e-06, "loss": 0.5745, "mean_token_accuracy": 0.8162197098135948, "num_tokens": 1021646534.0, "step": 32011 }, { "entropy": 0.5827208627015352, "epoch": 2.945273460187118, "grad_norm": 0.16733285784721375, "learning_rate": 1.8278283804091147e-06, "loss": 0.5811, "mean_token_accuracy": 0.818036887794733, "num_tokens": 1021679145.0, "step": 32012 }, { "entropy": 0.5251020831055939, "epoch": 2.945365466558559, "grad_norm": 0.1566496193408966, "learning_rate": 1.8247615542674887e-06, "loss": 0.5029, "mean_token_accuracy": 0.8387703932821751, "num_tokens": 1021710551.0, "step": 32013 }, { "entropy": 0.4720872766338289, "epoch": 2.9454574729300003, "grad_norm": 0.14991794526576996, "learning_rate": 1.8216947281258625e-06, "loss": 0.4617, "mean_token_accuracy": 0.8523674942553043, "num_tokens": 1021743170.0, "step": 32014 }, { "entropy": 0.5709024844691157, "epoch": 2.945549479301442, "grad_norm": 0.16305890679359436, "learning_rate": 1.8186279019842363e-06, "loss": 0.5589, "mean_token_accuracy": 0.8253582194447517, "num_tokens": 1021775494.0, "step": 32015 }, { "entropy": 0.4091324951732531, "epoch": 2.945641485672883, "grad_norm": 0.1446717381477356, "learning_rate": 1.8155610758426106e-06, "loss": 0.3979, "mean_token_accuracy": 0.8702147603034973, "num_tokens": 1021807959.0, "step": 32016 }, { "entropy": 0.5715493466705084, "epoch": 2.945733492044324, "grad_norm": 0.16328151524066925, "learning_rate": 1.8124942497009846e-06, "loss": 0.5588, "mean_token_accuracy": 0.8211340233683586, "num_tokens": 1021840295.0, "step": 32017 }, { "entropy": 0.4816752327606082, "epoch": 2.9458254984157652, "grad_norm": 0.15810498595237732, "learning_rate": 1.8094274235593584e-06, "loss": 0.4618, "mean_token_accuracy": 0.8486754819750786, "num_tokens": 1021870928.0, "step": 32018 }, { "entropy": 0.41182148549705744, "epoch": 2.9459175047872064, "grad_norm": 0.14631237089633942, "learning_rate": 1.8063605974177326e-06, "loss": 0.4064, "mean_token_accuracy": 0.8727832362055779, "num_tokens": 1021902700.0, "step": 32019 }, { "entropy": 0.46645348239690065, "epoch": 2.946009511158648, "grad_norm": 0.15099821984767914, "learning_rate": 1.8032937712761066e-06, "loss": 0.4571, "mean_token_accuracy": 0.8538354374468327, "num_tokens": 1021934465.0, "step": 32020 }, { "entropy": 0.5275453981012106, "epoch": 2.946101517530089, "grad_norm": 0.1620856523513794, "learning_rate": 1.8002269451344804e-06, "loss": 0.5037, "mean_token_accuracy": 0.8402669727802277, "num_tokens": 1021965186.0, "step": 32021 }, { "entropy": 0.4796474170871079, "epoch": 2.94619352390153, "grad_norm": 0.15633587539196014, "learning_rate": 1.7971601189928542e-06, "loss": 0.4777, "mean_token_accuracy": 0.8509690538048744, "num_tokens": 1021997225.0, "step": 32022 }, { "entropy": 0.5303644026862457, "epoch": 2.9462855302729714, "grad_norm": 0.1595885455608368, "learning_rate": 1.7940932928512284e-06, "loss": 0.5226, "mean_token_accuracy": 0.8353297486901283, "num_tokens": 1022028743.0, "step": 32023 }, { "entropy": 0.47556094476021826, "epoch": 2.9463775366444125, "grad_norm": 0.1545715183019638, "learning_rate": 1.7910264667096024e-06, "loss": 0.4717, "mean_token_accuracy": 0.8512580506503582, "num_tokens": 1022061064.0, "step": 32024 }, { "entropy": 0.4590216185897589, "epoch": 2.946469543015854, "grad_norm": 0.15045039355754852, "learning_rate": 1.7879596405679762e-06, "loss": 0.4486, "mean_token_accuracy": 0.8550000563263893, "num_tokens": 1022092965.0, "step": 32025 }, { "entropy": 0.4432495441287756, "epoch": 2.946561549387295, "grad_norm": 0.1514224410057068, "learning_rate": 1.78489281442635e-06, "loss": 0.4298, "mean_token_accuracy": 0.863517876714468, "num_tokens": 1022124833.0, "step": 32026 }, { "entropy": 0.49868031160440296, "epoch": 2.9466535557587363, "grad_norm": 0.14945445954799652, "learning_rate": 1.7818259882847243e-06, "loss": 0.4758, "mean_token_accuracy": 0.8470295071601868, "num_tokens": 1022157165.0, "step": 32027 }, { "entropy": 0.5536439437419176, "epoch": 2.9467455621301775, "grad_norm": 0.16675163805484772, "learning_rate": 1.7787591621430983e-06, "loss": 0.5471, "mean_token_accuracy": 0.8291610926389694, "num_tokens": 1022188681.0, "step": 32028 }, { "entropy": 0.588651554659009, "epoch": 2.9468375685016186, "grad_norm": 0.1682382971048355, "learning_rate": 1.775692336001472e-06, "loss": 0.5701, "mean_token_accuracy": 0.8184392787516117, "num_tokens": 1022219899.0, "step": 32029 }, { "entropy": 0.4674591748043895, "epoch": 2.94692957487306, "grad_norm": 0.16140124201774597, "learning_rate": 1.772625509859846e-06, "loss": 0.4564, "mean_token_accuracy": 0.8553835712373257, "num_tokens": 1022251233.0, "step": 32030 }, { "entropy": 0.3981453189626336, "epoch": 2.9470215812445013, "grad_norm": 0.14344538748264313, "learning_rate": 1.7695586837182203e-06, "loss": 0.3825, "mean_token_accuracy": 0.873452939093113, "num_tokens": 1022282489.0, "step": 32031 }, { "entropy": 0.4871666565304622, "epoch": 2.9471135876159424, "grad_norm": 0.15472137928009033, "learning_rate": 1.7664918575765941e-06, "loss": 0.4787, "mean_token_accuracy": 0.8514176942408085, "num_tokens": 1022314723.0, "step": 32032 }, { "entropy": 0.6001225216314197, "epoch": 2.9472055939873836, "grad_norm": 0.17099878191947937, "learning_rate": 1.763425031434968e-06, "loss": 0.5921, "mean_token_accuracy": 0.8140510469675064, "num_tokens": 1022346479.0, "step": 32033 }, { "entropy": 0.49765645805746317, "epoch": 2.9472976003588247, "grad_norm": 0.15389849245548248, "learning_rate": 1.760358205293342e-06, "loss": 0.4817, "mean_token_accuracy": 0.8469386100769043, "num_tokens": 1022378822.0, "step": 32034 }, { "entropy": 0.5383893437683582, "epoch": 2.9473896067302663, "grad_norm": 0.1614699512720108, "learning_rate": 1.7572913791517162e-06, "loss": 0.5288, "mean_token_accuracy": 0.8325440436601639, "num_tokens": 1022410670.0, "step": 32035 }, { "entropy": 0.5185810755938292, "epoch": 2.9474816131017074, "grad_norm": 0.15802454948425293, "learning_rate": 1.75422455301009e-06, "loss": 0.506, "mean_token_accuracy": 0.8381531424820423, "num_tokens": 1022442617.0, "step": 32036 }, { "entropy": 0.4612330002710223, "epoch": 2.9475736194731486, "grad_norm": 0.15022945404052734, "learning_rate": 1.7511577268684638e-06, "loss": 0.4491, "mean_token_accuracy": 0.854473914951086, "num_tokens": 1022474785.0, "step": 32037 }, { "entropy": 0.4516699503874406, "epoch": 2.9476656258445897, "grad_norm": 0.15046828985214233, "learning_rate": 1.748090900726838e-06, "loss": 0.4334, "mean_token_accuracy": 0.8622746057808399, "num_tokens": 1022506272.0, "step": 32038 }, { "entropy": 0.5059669008478522, "epoch": 2.947757632216031, "grad_norm": 0.15916675329208374, "learning_rate": 1.745024074585212e-06, "loss": 0.4915, "mean_token_accuracy": 0.8431802950799465, "num_tokens": 1022537192.0, "step": 32039 }, { "entropy": 0.5717412373051047, "epoch": 2.9478496385874724, "grad_norm": 0.16423852741718292, "learning_rate": 1.7419572484435858e-06, "loss": 0.5594, "mean_token_accuracy": 0.8223466835916042, "num_tokens": 1022568820.0, "step": 32040 }, { "entropy": 0.5304757783887908, "epoch": 2.9479416449589135, "grad_norm": 0.15705609321594238, "learning_rate": 1.7388904223019596e-06, "loss": 0.5151, "mean_token_accuracy": 0.8345508649945259, "num_tokens": 1022601024.0, "step": 32041 }, { "entropy": 0.4774935278110206, "epoch": 2.9480336513303547, "grad_norm": 0.1533011794090271, "learning_rate": 1.7358235961603338e-06, "loss": 0.4626, "mean_token_accuracy": 0.8516473397612572, "num_tokens": 1022633385.0, "step": 32042 }, { "entropy": 0.5113905053585768, "epoch": 2.948125657701796, "grad_norm": 0.15856024622917175, "learning_rate": 1.7327567700187078e-06, "loss": 0.4886, "mean_token_accuracy": 0.8422679416835308, "num_tokens": 1022665240.0, "step": 32043 }, { "entropy": 0.4200936835259199, "epoch": 2.948217664073237, "grad_norm": 0.14325745403766632, "learning_rate": 1.7296899438770816e-06, "loss": 0.4108, "mean_token_accuracy": 0.8672145158052444, "num_tokens": 1022697781.0, "step": 32044 }, { "entropy": 0.6066513620316982, "epoch": 2.9483096704446785, "grad_norm": 0.16882896423339844, "learning_rate": 1.7266231177354556e-06, "loss": 0.587, "mean_token_accuracy": 0.8111228197813034, "num_tokens": 1022729668.0, "step": 32045 }, { "entropy": 0.47235419414937496, "epoch": 2.9484016768161196, "grad_norm": 0.1562238186597824, "learning_rate": 1.7235562915938299e-06, "loss": 0.4663, "mean_token_accuracy": 0.8528483137488365, "num_tokens": 1022761391.0, "step": 32046 }, { "entropy": 0.5160524137318134, "epoch": 2.9484936831875608, "grad_norm": 0.1563263237476349, "learning_rate": 1.7204894654522037e-06, "loss": 0.501, "mean_token_accuracy": 0.8425595834851265, "num_tokens": 1022793679.0, "step": 32047 }, { "entropy": 0.5142077663913369, "epoch": 2.948585689559002, "grad_norm": 0.16063007712364197, "learning_rate": 1.7174226393105775e-06, "loss": 0.5, "mean_token_accuracy": 0.8394503332674503, "num_tokens": 1022826025.0, "step": 32048 }, { "entropy": 0.49256439693272114, "epoch": 2.948677695930443, "grad_norm": 0.16108223795890808, "learning_rate": 1.7143558131689515e-06, "loss": 0.4881, "mean_token_accuracy": 0.8416983895003796, "num_tokens": 1022857810.0, "step": 32049 }, { "entropy": 0.4533622907474637, "epoch": 2.9487697023018846, "grad_norm": 0.1495075821876526, "learning_rate": 1.7112889870273257e-06, "loss": 0.4442, "mean_token_accuracy": 0.8605195358395576, "num_tokens": 1022889725.0, "step": 32050 }, { "entropy": 0.517442811280489, "epoch": 2.9488617086733258, "grad_norm": 0.16024482250213623, "learning_rate": 1.7082221608856995e-06, "loss": 0.5009, "mean_token_accuracy": 0.8437106572091579, "num_tokens": 1022920944.0, "step": 32051 }, { "entropy": 0.5585487530333921, "epoch": 2.948953715044767, "grad_norm": 0.16070464253425598, "learning_rate": 1.7051553347440733e-06, "loss": 0.5515, "mean_token_accuracy": 0.8249349594116211, "num_tokens": 1022953240.0, "step": 32052 }, { "entropy": 0.48702805768698454, "epoch": 2.949045721416208, "grad_norm": 0.1525048166513443, "learning_rate": 1.7020885086024473e-06, "loss": 0.4802, "mean_token_accuracy": 0.8481351062655449, "num_tokens": 1022985619.0, "step": 32053 }, { "entropy": 0.5730780400335789, "epoch": 2.949137727787649, "grad_norm": 0.16286219656467438, "learning_rate": 1.6990216824608215e-06, "loss": 0.5569, "mean_token_accuracy": 0.8267212994396687, "num_tokens": 1023017643.0, "step": 32054 }, { "entropy": 0.5428705539088696, "epoch": 2.9492297341590907, "grad_norm": 0.15559892356395721, "learning_rate": 1.6959548563191953e-06, "loss": 0.5162, "mean_token_accuracy": 0.8352856636047363, "num_tokens": 1023049330.0, "step": 32055 }, { "entropy": 0.5044092936441302, "epoch": 2.949321740530532, "grad_norm": 0.15781475603580475, "learning_rate": 1.6928880301775691e-06, "loss": 0.4802, "mean_token_accuracy": 0.846137274056673, "num_tokens": 1023080669.0, "step": 32056 }, { "entropy": 0.55393385887146, "epoch": 2.949413746901973, "grad_norm": 0.16678392887115479, "learning_rate": 1.6898212040359432e-06, "loss": 0.5371, "mean_token_accuracy": 0.8269033096730709, "num_tokens": 1023112505.0, "step": 32057 }, { "entropy": 0.6327042561024427, "epoch": 2.949505753273414, "grad_norm": 0.17736920714378357, "learning_rate": 1.6867543778943174e-06, "loss": 0.6183, "mean_token_accuracy": 0.8035491928458214, "num_tokens": 1023144481.0, "step": 32058 }, { "entropy": 0.4713002562057227, "epoch": 2.9495977596448553, "grad_norm": 0.14944423735141754, "learning_rate": 1.6836875517526912e-06, "loss": 0.4608, "mean_token_accuracy": 0.8533292748034, "num_tokens": 1023176790.0, "step": 32059 }, { "entropy": 0.5729109533131123, "epoch": 2.949689766016297, "grad_norm": 0.16674169898033142, "learning_rate": 1.6806207256110652e-06, "loss": 0.5602, "mean_token_accuracy": 0.8246070966124535, "num_tokens": 1023207710.0, "step": 32060 }, { "entropy": 0.5587168168276548, "epoch": 2.949781772387738, "grad_norm": 0.165485680103302, "learning_rate": 1.6775538994694394e-06, "loss": 0.5524, "mean_token_accuracy": 0.8275048136711121, "num_tokens": 1023239324.0, "step": 32061 }, { "entropy": 0.4867154147941619, "epoch": 2.949873778759179, "grad_norm": 0.1481008380651474, "learning_rate": 1.6744870733278132e-06, "loss": 0.4746, "mean_token_accuracy": 0.8509980849921703, "num_tokens": 1023271730.0, "step": 32062 }, { "entropy": 0.5063167167827487, "epoch": 2.9499657851306202, "grad_norm": 0.1655537635087967, "learning_rate": 1.671420247186187e-06, "loss": 0.4862, "mean_token_accuracy": 0.8431991934776306, "num_tokens": 1023302222.0, "step": 32063 }, { "entropy": 0.5466684214770794, "epoch": 2.9500577915020614, "grad_norm": 0.16203589737415314, "learning_rate": 1.668353421044561e-06, "loss": 0.5296, "mean_token_accuracy": 0.8308196291327477, "num_tokens": 1023334025.0, "step": 32064 }, { "entropy": 0.4555301498621702, "epoch": 2.950149797873503, "grad_norm": 0.15245801210403442, "learning_rate": 1.6652865949029353e-06, "loss": 0.4469, "mean_token_accuracy": 0.8598806038498878, "num_tokens": 1023366293.0, "step": 32065 }, { "entropy": 0.5543874781578779, "epoch": 2.950241804244944, "grad_norm": 0.16234268248081207, "learning_rate": 1.662219768761309e-06, "loss": 0.5434, "mean_token_accuracy": 0.8288470059633255, "num_tokens": 1023398255.0, "step": 32066 }, { "entropy": 0.4060304887825623, "epoch": 2.950333810616385, "grad_norm": 0.14277814328670502, "learning_rate": 1.6591529426196829e-06, "loss": 0.3961, "mean_token_accuracy": 0.874453216791153, "num_tokens": 1023430352.0, "step": 32067 }, { "entropy": 0.4283428159542382, "epoch": 2.9504258169878264, "grad_norm": 0.14313577115535736, "learning_rate": 1.6560861164780569e-06, "loss": 0.4162, "mean_token_accuracy": 0.8661682307720184, "num_tokens": 1023462735.0, "step": 32068 }, { "entropy": 0.6277387626469135, "epoch": 2.9505178233592675, "grad_norm": 0.16729682683944702, "learning_rate": 1.653019290336431e-06, "loss": 0.6185, "mean_token_accuracy": 0.806989811360836, "num_tokens": 1023494943.0, "step": 32069 }, { "entropy": 0.5365962591022253, "epoch": 2.950609829730709, "grad_norm": 0.15940140187740326, "learning_rate": 1.6499524641948049e-06, "loss": 0.5317, "mean_token_accuracy": 0.8320334441959858, "num_tokens": 1023527648.0, "step": 32070 }, { "entropy": 0.5623654434457421, "epoch": 2.95070183610215, "grad_norm": 0.16232500970363617, "learning_rate": 1.6468856380531787e-06, "loss": 0.544, "mean_token_accuracy": 0.8257686831057072, "num_tokens": 1023560195.0, "step": 32071 }, { "entropy": 0.49811084661632776, "epoch": 2.9507938424735913, "grad_norm": 0.15430380403995514, "learning_rate": 1.6438188119115527e-06, "loss": 0.4852, "mean_token_accuracy": 0.8491408787667751, "num_tokens": 1023591837.0, "step": 32072 }, { "entropy": 0.46247350983321667, "epoch": 2.9508858488450325, "grad_norm": 0.15126203000545502, "learning_rate": 1.640751985769927e-06, "loss": 0.4502, "mean_token_accuracy": 0.8544009476900101, "num_tokens": 1023624343.0, "step": 32073 }, { "entropy": 0.50666319206357, "epoch": 2.9509778552164736, "grad_norm": 0.1611812561750412, "learning_rate": 1.6376851596283007e-06, "loss": 0.5057, "mean_token_accuracy": 0.8406178541481495, "num_tokens": 1023655981.0, "step": 32074 }, { "entropy": 0.4416622156277299, "epoch": 2.951069861587915, "grad_norm": 0.15430979430675507, "learning_rate": 1.6346183334866747e-06, "loss": 0.432, "mean_token_accuracy": 0.8593244440853596, "num_tokens": 1023687797.0, "step": 32075 }, { "entropy": 0.4395762253552675, "epoch": 2.9511618679593563, "grad_norm": 0.14907792210578918, "learning_rate": 1.6315515073450485e-06, "loss": 0.4259, "mean_token_accuracy": 0.8666926883161068, "num_tokens": 1023719899.0, "step": 32076 }, { "entropy": 0.5043083671480417, "epoch": 2.9512538743307974, "grad_norm": 0.1570325642824173, "learning_rate": 1.6284846812034228e-06, "loss": 0.4979, "mean_token_accuracy": 0.8421953395009041, "num_tokens": 1023751864.0, "step": 32077 }, { "entropy": 0.5467188712209463, "epoch": 2.9513458807022386, "grad_norm": 0.1710360199213028, "learning_rate": 1.6254178550617966e-06, "loss": 0.5409, "mean_token_accuracy": 0.82618722692132, "num_tokens": 1023782466.0, "step": 32078 }, { "entropy": 0.411650444380939, "epoch": 2.9514378870736797, "grad_norm": 0.14429031312465668, "learning_rate": 1.6223510289201706e-06, "loss": 0.3994, "mean_token_accuracy": 0.8703246675431728, "num_tokens": 1023814982.0, "step": 32079 }, { "entropy": 0.5142369475215673, "epoch": 2.9515298934451213, "grad_norm": 0.15606611967086792, "learning_rate": 1.6192842027785448e-06, "loss": 0.5048, "mean_token_accuracy": 0.8437004238367081, "num_tokens": 1023847509.0, "step": 32080 }, { "entropy": 0.475602216552943, "epoch": 2.9516218998165624, "grad_norm": 0.15950143337249756, "learning_rate": 1.6162173766369186e-06, "loss": 0.4586, "mean_token_accuracy": 0.8483615107834339, "num_tokens": 1023878426.0, "step": 32081 }, { "entropy": 0.5056816097348928, "epoch": 2.9517139061880036, "grad_norm": 0.1620495766401291, "learning_rate": 1.6131505504952924e-06, "loss": 0.4934, "mean_token_accuracy": 0.8419463373720646, "num_tokens": 1023909878.0, "step": 32082 }, { "entropy": 0.549053393304348, "epoch": 2.9518059125594447, "grad_norm": 0.1627330780029297, "learning_rate": 1.6100837243536664e-06, "loss": 0.5355, "mean_token_accuracy": 0.8285077624022961, "num_tokens": 1023941796.0, "step": 32083 }, { "entropy": 0.5110219726338983, "epoch": 2.951897918930886, "grad_norm": 0.16155202686786652, "learning_rate": 1.6070168982120406e-06, "loss": 0.4967, "mean_token_accuracy": 0.8417469039559364, "num_tokens": 1023973450.0, "step": 32084 }, { "entropy": 0.47363340063020587, "epoch": 2.9519899253023274, "grad_norm": 0.15047572553157806, "learning_rate": 1.6039500720704144e-06, "loss": 0.4625, "mean_token_accuracy": 0.8521812669932842, "num_tokens": 1024006054.0, "step": 32085 }, { "entropy": 0.5091374581679702, "epoch": 2.9520819316737685, "grad_norm": 0.15549054741859436, "learning_rate": 1.6008832459287882e-06, "loss": 0.4984, "mean_token_accuracy": 0.8398714624345303, "num_tokens": 1024038740.0, "step": 32086 }, { "entropy": 0.51521797478199, "epoch": 2.9521739380452097, "grad_norm": 0.15543623268604279, "learning_rate": 1.5978164197871623e-06, "loss": 0.5051, "mean_token_accuracy": 0.8380301147699356, "num_tokens": 1024070391.0, "step": 32087 }, { "entropy": 0.42569743073545396, "epoch": 2.952265944416651, "grad_norm": 0.14212332665920258, "learning_rate": 1.5947495936455365e-06, "loss": 0.4076, "mean_token_accuracy": 0.8679503574967384, "num_tokens": 1024102722.0, "step": 32088 }, { "entropy": 0.45321388076990843, "epoch": 2.952357950788092, "grad_norm": 0.15107361972332, "learning_rate": 1.5916827675039103e-06, "loss": 0.4436, "mean_token_accuracy": 0.8549899831414223, "num_tokens": 1024135394.0, "step": 32089 }, { "entropy": 0.5920851714909077, "epoch": 2.9524499571595335, "grad_norm": 0.16591697931289673, "learning_rate": 1.5886159413622843e-06, "loss": 0.5773, "mean_token_accuracy": 0.8171552792191505, "num_tokens": 1024167413.0, "step": 32090 }, { "entropy": 0.5401100683957338, "epoch": 2.9525419635309746, "grad_norm": 0.16052784025669098, "learning_rate": 1.585549115220658e-06, "loss": 0.5293, "mean_token_accuracy": 0.8358100913465023, "num_tokens": 1024199253.0, "step": 32091 }, { "entropy": 0.46808263566344976, "epoch": 2.952633969902416, "grad_norm": 0.15246528387069702, "learning_rate": 1.5824822890790323e-06, "loss": 0.4553, "mean_token_accuracy": 0.8543905504047871, "num_tokens": 1024231273.0, "step": 32092 }, { "entropy": 0.46675979532301426, "epoch": 2.952725976273857, "grad_norm": 0.15517331659793854, "learning_rate": 1.5794154629374061e-06, "loss": 0.4575, "mean_token_accuracy": 0.8543650060892105, "num_tokens": 1024263539.0, "step": 32093 }, { "entropy": 0.5527291148900986, "epoch": 2.952817982645298, "grad_norm": 0.1664735972881317, "learning_rate": 1.5763486367957801e-06, "loss": 0.5415, "mean_token_accuracy": 0.8291473910212517, "num_tokens": 1024295738.0, "step": 32094 }, { "entropy": 0.6268958374857903, "epoch": 2.9529099890167396, "grad_norm": 0.17405569553375244, "learning_rate": 1.573281810654154e-06, "loss": 0.6087, "mean_token_accuracy": 0.8101629503071308, "num_tokens": 1024327151.0, "step": 32095 }, { "entropy": 0.5489833950996399, "epoch": 2.9530019953881808, "grad_norm": 0.1620088517665863, "learning_rate": 1.5702149845125282e-06, "loss": 0.5391, "mean_token_accuracy": 0.8278182148933411, "num_tokens": 1024358648.0, "step": 32096 }, { "entropy": 0.4869064884260297, "epoch": 2.953094001759622, "grad_norm": 0.15508903563022614, "learning_rate": 1.567148158370902e-06, "loss": 0.4617, "mean_token_accuracy": 0.8492361716926098, "num_tokens": 1024389879.0, "step": 32097 }, { "entropy": 0.4064714387059212, "epoch": 2.953186008131063, "grad_norm": 0.1470608115196228, "learning_rate": 1.564081332229276e-06, "loss": 0.3963, "mean_token_accuracy": 0.8713431730866432, "num_tokens": 1024421944.0, "step": 32098 }, { "entropy": 0.4560503140091896, "epoch": 2.953278014502504, "grad_norm": 0.14830683171749115, "learning_rate": 1.56101450608765e-06, "loss": 0.4467, "mean_token_accuracy": 0.8549391441047192, "num_tokens": 1024453978.0, "step": 32099 }, { "entropy": 0.4978223480284214, "epoch": 2.9533700208739457, "grad_norm": 0.19851292669773102, "learning_rate": 1.557947679946024e-06, "loss": 0.496, "mean_token_accuracy": 0.8390278294682503, "num_tokens": 1024485380.0, "step": 32100 }, { "entropy": 0.38617671001702547, "epoch": 2.953462027245387, "grad_norm": 0.13890519738197327, "learning_rate": 1.5548808538043978e-06, "loss": 0.3746, "mean_token_accuracy": 0.8811933882534504, "num_tokens": 1024517724.0, "step": 32101 }, { "entropy": 0.5296175442636013, "epoch": 2.953554033616828, "grad_norm": 0.16449956595897675, "learning_rate": 1.551814027662772e-06, "loss": 0.5288, "mean_token_accuracy": 0.8318645618855953, "num_tokens": 1024549132.0, "step": 32102 }, { "entropy": 0.5238952077925205, "epoch": 2.953646039988269, "grad_norm": 0.15745387971401215, "learning_rate": 1.5487472015211458e-06, "loss": 0.5092, "mean_token_accuracy": 0.8366127163171768, "num_tokens": 1024581440.0, "step": 32103 }, { "entropy": 0.5547643639147282, "epoch": 2.9537380463597103, "grad_norm": 0.16425205767154694, "learning_rate": 1.5456803753795198e-06, "loss": 0.5569, "mean_token_accuracy": 0.8248942270874977, "num_tokens": 1024613239.0, "step": 32104 }, { "entropy": 0.4981997311115265, "epoch": 2.953830052731152, "grad_norm": 0.16166137158870697, "learning_rate": 1.5426135492378938e-06, "loss": 0.4929, "mean_token_accuracy": 0.8433126918971539, "num_tokens": 1024645345.0, "step": 32105 }, { "entropy": 0.5229432266205549, "epoch": 2.953922059102593, "grad_norm": 0.16673579812049866, "learning_rate": 1.5395467230962679e-06, "loss": 0.509, "mean_token_accuracy": 0.8352012783288956, "num_tokens": 1024676462.0, "step": 32106 }, { "entropy": 0.5540642724372447, "epoch": 2.954014065474034, "grad_norm": 0.16453394293785095, "learning_rate": 1.5364798969546417e-06, "loss": 0.539, "mean_token_accuracy": 0.8298035971820354, "num_tokens": 1024707480.0, "step": 32107 }, { "entropy": 0.4991475101560354, "epoch": 2.9541060718454752, "grad_norm": 0.15959177911281586, "learning_rate": 1.5334130708130157e-06, "loss": 0.4957, "mean_token_accuracy": 0.8409345857799053, "num_tokens": 1024739795.0, "step": 32108 }, { "entropy": 0.41893932421226054, "epoch": 2.9541980782169164, "grad_norm": 0.1526029407978058, "learning_rate": 1.5303462446713897e-06, "loss": 0.4077, "mean_token_accuracy": 0.8669273555278778, "num_tokens": 1024771288.0, "step": 32109 }, { "entropy": 0.31831643206533045, "epoch": 2.954290084588358, "grad_norm": 0.13009651005268097, "learning_rate": 1.5272794185297637e-06, "loss": 0.3114, "mean_token_accuracy": 0.9010227583348751, "num_tokens": 1024803029.0, "step": 32110 }, { "entropy": 0.49491268023848534, "epoch": 2.954382090959799, "grad_norm": 0.15674211084842682, "learning_rate": 1.5242125923881375e-06, "loss": 0.4871, "mean_token_accuracy": 0.8462946861982346, "num_tokens": 1024834607.0, "step": 32111 }, { "entropy": 0.4987502368167043, "epoch": 2.9544740973312402, "grad_norm": 0.16448472440242767, "learning_rate": 1.5211457662465115e-06, "loss": 0.5051, "mean_token_accuracy": 0.8410846665501595, "num_tokens": 1024866723.0, "step": 32112 }, { "entropy": 0.5324021484702826, "epoch": 2.9545661037026814, "grad_norm": 0.16374778747558594, "learning_rate": 1.5180789401048855e-06, "loss": 0.5239, "mean_token_accuracy": 0.8359346762299538, "num_tokens": 1024898907.0, "step": 32113 }, { "entropy": 0.4280213990714401, "epoch": 2.9546581100741225, "grad_norm": 0.14140717685222626, "learning_rate": 1.5150121139632595e-06, "loss": 0.4144, "mean_token_accuracy": 0.8658622428774834, "num_tokens": 1024931641.0, "step": 32114 }, { "entropy": 0.4846067032776773, "epoch": 2.954750116445564, "grad_norm": 0.15348568558692932, "learning_rate": 1.5119452878216333e-06, "loss": 0.472, "mean_token_accuracy": 0.8525438793003559, "num_tokens": 1024963725.0, "step": 32115 }, { "entropy": 0.4926098622381687, "epoch": 2.954842122817005, "grad_norm": 0.16045933961868286, "learning_rate": 1.5088784616800076e-06, "loss": 0.4784, "mean_token_accuracy": 0.8464617766439915, "num_tokens": 1024995556.0, "step": 32116 }, { "entropy": 0.49587690585758537, "epoch": 2.9549341291884463, "grad_norm": 0.1569909006357193, "learning_rate": 1.5058116355383814e-06, "loss": 0.4828, "mean_token_accuracy": 0.8449804075062275, "num_tokens": 1025027804.0, "step": 32117 }, { "entropy": 0.486534146592021, "epoch": 2.9550261355598875, "grad_norm": 0.15565821528434753, "learning_rate": 1.5027448093967554e-06, "loss": 0.4771, "mean_token_accuracy": 0.8471653833985329, "num_tokens": 1025060153.0, "step": 32118 }, { "entropy": 0.507850406691432, "epoch": 2.9551181419313286, "grad_norm": 0.15904587507247925, "learning_rate": 1.4996779832551292e-06, "loss": 0.4964, "mean_token_accuracy": 0.8408239558339119, "num_tokens": 1025092593.0, "step": 32119 }, { "entropy": 0.5162360183894634, "epoch": 2.95521014830277, "grad_norm": 0.1561402827501297, "learning_rate": 1.4966111571135034e-06, "loss": 0.52, "mean_token_accuracy": 0.8378500267863274, "num_tokens": 1025124061.0, "step": 32120 }, { "entropy": 0.49067461397498846, "epoch": 2.9553021546742113, "grad_norm": 0.15528561174869537, "learning_rate": 1.4935443309718774e-06, "loss": 0.4813, "mean_token_accuracy": 0.8463025167584419, "num_tokens": 1025156048.0, "step": 32121 }, { "entropy": 0.5012251646257937, "epoch": 2.9553941610456524, "grad_norm": 0.15054619312286377, "learning_rate": 1.4904775048302512e-06, "loss": 0.4911, "mean_token_accuracy": 0.8467920757830143, "num_tokens": 1025187984.0, "step": 32122 }, { "entropy": 0.5082824714481831, "epoch": 2.9554861674170936, "grad_norm": 0.15580356121063232, "learning_rate": 1.4874106786886252e-06, "loss": 0.4893, "mean_token_accuracy": 0.8446563184261322, "num_tokens": 1025220630.0, "step": 32123 }, { "entropy": 0.529580669477582, "epoch": 2.9555781737885347, "grad_norm": 0.1584487408399582, "learning_rate": 1.4843438525469992e-06, "loss": 0.525, "mean_token_accuracy": 0.8312206044793129, "num_tokens": 1025253282.0, "step": 32124 }, { "entropy": 0.46369996992871165, "epoch": 2.9556701801599763, "grad_norm": 0.1482163667678833, "learning_rate": 1.4812770264053732e-06, "loss": 0.4274, "mean_token_accuracy": 0.8585988469421864, "num_tokens": 1025284459.0, "step": 32125 }, { "entropy": 0.5839184671640396, "epoch": 2.9557621865314174, "grad_norm": 0.17080338299274445, "learning_rate": 1.478210200263747e-06, "loss": 0.5753, "mean_token_accuracy": 0.8179742060601711, "num_tokens": 1025315842.0, "step": 32126 }, { "entropy": 0.5567651093006134, "epoch": 2.9558541929028586, "grad_norm": 0.16160748898983002, "learning_rate": 1.475143374122121e-06, "loss": 0.5414, "mean_token_accuracy": 0.8266993910074234, "num_tokens": 1025347347.0, "step": 32127 }, { "entropy": 0.4437043946236372, "epoch": 2.9559461992742997, "grad_norm": 0.15042132139205933, "learning_rate": 1.472076547980495e-06, "loss": 0.4302, "mean_token_accuracy": 0.863942239433527, "num_tokens": 1025379538.0, "step": 32128 }, { "entropy": 0.47782915737479925, "epoch": 2.956038205645741, "grad_norm": 0.14957338571548462, "learning_rate": 1.469009721838869e-06, "loss": 0.4678, "mean_token_accuracy": 0.8497806899249554, "num_tokens": 1025411850.0, "step": 32129 }, { "entropy": 0.5127208782359958, "epoch": 2.9561302120171824, "grad_norm": 0.16234825551509857, "learning_rate": 1.4659428956972429e-06, "loss": 0.5003, "mean_token_accuracy": 0.840380672365427, "num_tokens": 1025444040.0, "step": 32130 }, { "entropy": 0.48038568440824747, "epoch": 2.9562222183886235, "grad_norm": 0.15291796624660492, "learning_rate": 1.462876069555617e-06, "loss": 0.4616, "mean_token_accuracy": 0.8494956009089947, "num_tokens": 1025476310.0, "step": 32131 }, { "entropy": 0.5410595064749941, "epoch": 2.9563142247600647, "grad_norm": 0.1622391790151596, "learning_rate": 1.459809243413991e-06, "loss": 0.5325, "mean_token_accuracy": 0.833068460226059, "num_tokens": 1025508825.0, "step": 32132 }, { "entropy": 0.4125160709954798, "epoch": 2.956406231131506, "grad_norm": 0.14752492308616638, "learning_rate": 1.456742417272365e-06, "loss": 0.399, "mean_token_accuracy": 0.8700212202966213, "num_tokens": 1025540209.0, "step": 32133 }, { "entropy": 0.5455748019739985, "epoch": 2.956498237502947, "grad_norm": 0.16009493172168732, "learning_rate": 1.4536755911307387e-06, "loss": 0.5375, "mean_token_accuracy": 0.832282941788435, "num_tokens": 1025572919.0, "step": 32134 }, { "entropy": 0.552881333976984, "epoch": 2.9565902438743885, "grad_norm": 0.16032804548740387, "learning_rate": 1.450608764989113e-06, "loss": 0.5373, "mean_token_accuracy": 0.8295330256223679, "num_tokens": 1025604631.0, "step": 32135 }, { "entropy": 0.5388886230066419, "epoch": 2.9566822502458296, "grad_norm": 0.16372396051883698, "learning_rate": 1.4475419388474867e-06, "loss": 0.5254, "mean_token_accuracy": 0.8338641971349716, "num_tokens": 1025635658.0, "step": 32136 }, { "entropy": 0.4884359007701278, "epoch": 2.956774256617271, "grad_norm": 0.15563179552555084, "learning_rate": 1.4444751127058608e-06, "loss": 0.4833, "mean_token_accuracy": 0.8475779481232166, "num_tokens": 1025667474.0, "step": 32137 }, { "entropy": 0.4584669219329953, "epoch": 2.956866262988712, "grad_norm": 0.14840856194496155, "learning_rate": 1.4414082865642348e-06, "loss": 0.4378, "mean_token_accuracy": 0.8594172075390816, "num_tokens": 1025699306.0, "step": 32138 }, { "entropy": 0.498941233381629, "epoch": 2.956958269360153, "grad_norm": 0.15657860040664673, "learning_rate": 1.4383414604226088e-06, "loss": 0.4931, "mean_token_accuracy": 0.843257799744606, "num_tokens": 1025731383.0, "step": 32139 }, { "entropy": 0.46949294907972217, "epoch": 2.9570502757315946, "grad_norm": 0.1514056921005249, "learning_rate": 1.4352746342809828e-06, "loss": 0.4558, "mean_token_accuracy": 0.855690211057663, "num_tokens": 1025763639.0, "step": 32140 }, { "entropy": 0.5381053145974874, "epoch": 2.9571422821030358, "grad_norm": 0.15675802528858185, "learning_rate": 1.4322078081393566e-06, "loss": 0.5201, "mean_token_accuracy": 0.8333076201379299, "num_tokens": 1025795543.0, "step": 32141 }, { "entropy": 0.49452594155445695, "epoch": 2.957234288474477, "grad_norm": 0.15388061106204987, "learning_rate": 1.4291409819977306e-06, "loss": 0.4866, "mean_token_accuracy": 0.8447450511157513, "num_tokens": 1025827679.0, "step": 32142 }, { "entropy": 0.5159891527146101, "epoch": 2.957326294845918, "grad_norm": 0.15855970978736877, "learning_rate": 1.4260741558561046e-06, "loss": 0.4996, "mean_token_accuracy": 0.8419123664498329, "num_tokens": 1025859031.0, "step": 32143 }, { "entropy": 0.45709094731137156, "epoch": 2.957418301217359, "grad_norm": 0.1489274650812149, "learning_rate": 1.4230073297144786e-06, "loss": 0.4443, "mean_token_accuracy": 0.8564713001251221, "num_tokens": 1025891088.0, "step": 32144 }, { "entropy": 0.3917133458890021, "epoch": 2.9575103075888007, "grad_norm": 0.1433103382587433, "learning_rate": 1.4199405035728524e-06, "loss": 0.3814, "mean_token_accuracy": 0.8775855824351311, "num_tokens": 1025923210.0, "step": 32145 }, { "entropy": 0.47424285113811493, "epoch": 2.957602313960242, "grad_norm": 0.15345770120620728, "learning_rate": 1.4168736774312266e-06, "loss": 0.4612, "mean_token_accuracy": 0.8496404588222504, "num_tokens": 1025955528.0, "step": 32146 }, { "entropy": 0.5740520413964987, "epoch": 2.957694320331683, "grad_norm": 0.16449284553527832, "learning_rate": 1.4138068512896004e-06, "loss": 0.561, "mean_token_accuracy": 0.8213963061571121, "num_tokens": 1025987578.0, "step": 32147 }, { "entropy": 0.6640539206564426, "epoch": 2.957786326703124, "grad_norm": 0.17401687800884247, "learning_rate": 1.4107400251479745e-06, "loss": 0.6683, "mean_token_accuracy": 0.7948333211243153, "num_tokens": 1026019496.0, "step": 32148 }, { "entropy": 0.5027279881760478, "epoch": 2.9578783330745653, "grad_norm": 0.15286917984485626, "learning_rate": 1.4076731990063483e-06, "loss": 0.4889, "mean_token_accuracy": 0.845367219299078, "num_tokens": 1026051307.0, "step": 32149 }, { "entropy": 0.4867476299405098, "epoch": 2.957970339446007, "grad_norm": 0.15362298488616943, "learning_rate": 1.4046063728647225e-06, "loss": 0.4794, "mean_token_accuracy": 0.8464484103024006, "num_tokens": 1026083611.0, "step": 32150 }, { "entropy": 0.5108291778014973, "epoch": 2.958062345817448, "grad_norm": 0.15658453106880188, "learning_rate": 1.4015395467230963e-06, "loss": 0.4956, "mean_token_accuracy": 0.8464674465358257, "num_tokens": 1026115447.0, "step": 32151 }, { "entropy": 0.46302385069429874, "epoch": 2.958154352188889, "grad_norm": 0.15076103806495667, "learning_rate": 1.3984727205814703e-06, "loss": 0.4562, "mean_token_accuracy": 0.8539990186691284, "num_tokens": 1026147147.0, "step": 32152 }, { "entropy": 0.5379674723371863, "epoch": 2.9582463585603302, "grad_norm": 0.16108600795269012, "learning_rate": 1.3954058944398443e-06, "loss": 0.5197, "mean_token_accuracy": 0.832439485937357, "num_tokens": 1026179393.0, "step": 32153 }, { "entropy": 0.43599938321858644, "epoch": 2.9583383649317714, "grad_norm": 0.1502433717250824, "learning_rate": 1.3923390682982183e-06, "loss": 0.4246, "mean_token_accuracy": 0.8616433888673782, "num_tokens": 1026210807.0, "step": 32154 }, { "entropy": 0.5898248217999935, "epoch": 2.958430371303213, "grad_norm": 0.16890326142311096, "learning_rate": 1.3892722421565921e-06, "loss": 0.5649, "mean_token_accuracy": 0.822101179510355, "num_tokens": 1026241096.0, "step": 32155 }, { "entropy": 0.5304880636977032, "epoch": 2.958522377674654, "grad_norm": 0.16140949726104736, "learning_rate": 1.3862054160149661e-06, "loss": 0.5104, "mean_token_accuracy": 0.8374636620283127, "num_tokens": 1026272198.0, "step": 32156 }, { "entropy": 0.5033831093460321, "epoch": 2.9586143840460952, "grad_norm": 0.15634848177433014, "learning_rate": 1.3831385898733401e-06, "loss": 0.4905, "mean_token_accuracy": 0.8439279869198799, "num_tokens": 1026303812.0, "step": 32157 }, { "entropy": 0.4949455726891756, "epoch": 2.9587063904175364, "grad_norm": 0.1596129685640335, "learning_rate": 1.3800717637317142e-06, "loss": 0.4816, "mean_token_accuracy": 0.845242328941822, "num_tokens": 1026335848.0, "step": 32158 }, { "entropy": 0.49176677456125617, "epoch": 2.9587983967889775, "grad_norm": 0.15386638045310974, "learning_rate": 1.377004937590088e-06, "loss": 0.4766, "mean_token_accuracy": 0.8487289696931839, "num_tokens": 1026368305.0, "step": 32159 }, { "entropy": 0.3728747391141951, "epoch": 2.958890403160419, "grad_norm": 0.13231050968170166, "learning_rate": 1.373938111448462e-06, "loss": 0.3478, "mean_token_accuracy": 0.8851602040231228, "num_tokens": 1026399463.0, "step": 32160 }, { "entropy": 0.5105081875808537, "epoch": 2.95898240953186, "grad_norm": 0.1584860384464264, "learning_rate": 1.3708712853068362e-06, "loss": 0.5015, "mean_token_accuracy": 0.8407845683395863, "num_tokens": 1026431534.0, "step": 32161 }, { "entropy": 0.4713140120729804, "epoch": 2.9590744159033013, "grad_norm": 0.15292374789714813, "learning_rate": 1.36780445916521e-06, "loss": 0.4617, "mean_token_accuracy": 0.8540832027792931, "num_tokens": 1026463727.0, "step": 32162 }, { "entropy": 0.4621247057802975, "epoch": 2.9591664222747425, "grad_norm": 0.14858265221118927, "learning_rate": 1.364737633023584e-06, "loss": 0.4478, "mean_token_accuracy": 0.8549796305596828, "num_tokens": 1026496098.0, "step": 32163 }, { "entropy": 0.480269139748998, "epoch": 2.9592584286461836, "grad_norm": 0.1557343304157257, "learning_rate": 1.3616708068819578e-06, "loss": 0.4627, "mean_token_accuracy": 0.8509322479367256, "num_tokens": 1026528139.0, "step": 32164 }, { "entropy": 0.4869471685960889, "epoch": 2.959350435017625, "grad_norm": 0.1563590168952942, "learning_rate": 1.358603980740332e-06, "loss": 0.4727, "mean_token_accuracy": 0.8500192016363144, "num_tokens": 1026559279.0, "step": 32165 }, { "entropy": 0.5209658220410347, "epoch": 2.9594424413890663, "grad_norm": 0.16062255203723907, "learning_rate": 1.3555371545987058e-06, "loss": 0.506, "mean_token_accuracy": 0.8388379067182541, "num_tokens": 1026590741.0, "step": 32166 }, { "entropy": 0.46857895981520414, "epoch": 2.9595344477605074, "grad_norm": 0.15343818068504333, "learning_rate": 1.3524703284570798e-06, "loss": 0.4623, "mean_token_accuracy": 0.8512794263660908, "num_tokens": 1026622359.0, "step": 32167 }, { "entropy": 0.5222775117726997, "epoch": 2.9596264541319486, "grad_norm": 0.15388107299804688, "learning_rate": 1.3494035023154539e-06, "loss": 0.508, "mean_token_accuracy": 0.8371779248118401, "num_tokens": 1026654316.0, "step": 32168 }, { "entropy": 0.4162462083622813, "epoch": 2.9597184605033897, "grad_norm": 0.14207181334495544, "learning_rate": 1.3463366761738279e-06, "loss": 0.4073, "mean_token_accuracy": 0.8675755336880684, "num_tokens": 1026686862.0, "step": 32169 }, { "entropy": 0.48497254867106676, "epoch": 2.9598104668748313, "grad_norm": 0.15527844429016113, "learning_rate": 1.3432698500322017e-06, "loss": 0.4806, "mean_token_accuracy": 0.8479638434946537, "num_tokens": 1026718497.0, "step": 32170 }, { "entropy": 0.41607017535716295, "epoch": 2.9599024732462724, "grad_norm": 0.14560146629810333, "learning_rate": 1.3402030238905757e-06, "loss": 0.3959, "mean_token_accuracy": 0.8693778961896896, "num_tokens": 1026749711.0, "step": 32171 }, { "entropy": 0.5368530713021755, "epoch": 2.9599944796177136, "grad_norm": 0.1667083203792572, "learning_rate": 1.3371361977489497e-06, "loss": 0.5319, "mean_token_accuracy": 0.8336309790611267, "num_tokens": 1026780704.0, "step": 32172 }, { "entropy": 0.4556618304923177, "epoch": 2.9600864859891547, "grad_norm": 0.15745742619037628, "learning_rate": 1.3340693716073237e-06, "loss": 0.4519, "mean_token_accuracy": 0.8554634377360344, "num_tokens": 1026811781.0, "step": 32173 }, { "entropy": 0.5101319309324026, "epoch": 2.960178492360596, "grad_norm": 0.15975606441497803, "learning_rate": 1.3310025454656975e-06, "loss": 0.5074, "mean_token_accuracy": 0.8418052494525909, "num_tokens": 1026844055.0, "step": 32174 }, { "entropy": 0.4389064854476601, "epoch": 2.9602704987320374, "grad_norm": 0.15010394155979156, "learning_rate": 1.3279357193240715e-06, "loss": 0.4266, "mean_token_accuracy": 0.861704271286726, "num_tokens": 1026875898.0, "step": 32175 }, { "entropy": 0.46137698646634817, "epoch": 2.9603625051034785, "grad_norm": 0.1495361030101776, "learning_rate": 1.3248688931824455e-06, "loss": 0.4508, "mean_token_accuracy": 0.8552439101040363, "num_tokens": 1026908155.0, "step": 32176 }, { "entropy": 0.4547022597398609, "epoch": 2.9604545114749197, "grad_norm": 0.14605996012687683, "learning_rate": 1.3218020670408195e-06, "loss": 0.4458, "mean_token_accuracy": 0.8576490841805935, "num_tokens": 1026940422.0, "step": 32177 }, { "entropy": 0.5036822138354182, "epoch": 2.960546517846361, "grad_norm": 0.15844276547431946, "learning_rate": 1.3187352408991933e-06, "loss": 0.4979, "mean_token_accuracy": 0.8403379842638969, "num_tokens": 1026972484.0, "step": 32178 }, { "entropy": 0.5441761258989573, "epoch": 2.960638524217802, "grad_norm": 0.16015556454658508, "learning_rate": 1.3156684147575674e-06, "loss": 0.5331, "mean_token_accuracy": 0.8332786224782467, "num_tokens": 1027004915.0, "step": 32179 }, { "entropy": 0.4693728066049516, "epoch": 2.9607305305892435, "grad_norm": 0.14986476302146912, "learning_rate": 1.3126015886159414e-06, "loss": 0.4652, "mean_token_accuracy": 0.8535972833633423, "num_tokens": 1027037542.0, "step": 32180 }, { "entropy": 0.5053011057898402, "epoch": 2.9608225369606846, "grad_norm": 0.15692894160747528, "learning_rate": 1.3095347624743154e-06, "loss": 0.4922, "mean_token_accuracy": 0.8477112203836441, "num_tokens": 1027069465.0, "step": 32181 }, { "entropy": 0.5286132507026196, "epoch": 2.960914543332126, "grad_norm": 0.1553308218717575, "learning_rate": 1.3064679363326894e-06, "loss": 0.5127, "mean_token_accuracy": 0.8364853858947754, "num_tokens": 1027101598.0, "step": 32182 }, { "entropy": 0.5233627147972584, "epoch": 2.961006549703567, "grad_norm": 0.16082240641117096, "learning_rate": 1.3034011101910634e-06, "loss": 0.5052, "mean_token_accuracy": 0.8381575681269169, "num_tokens": 1027133367.0, "step": 32183 }, { "entropy": 0.5760040739551187, "epoch": 2.961098556075008, "grad_norm": 0.16582943499088287, "learning_rate": 1.3003342840494374e-06, "loss": 0.5641, "mean_token_accuracy": 0.8285480961203575, "num_tokens": 1027165760.0, "step": 32184 }, { "entropy": 0.4899447616189718, "epoch": 2.9611905624464496, "grad_norm": 0.15206165611743927, "learning_rate": 1.2972674579078112e-06, "loss": 0.4822, "mean_token_accuracy": 0.8482298962771893, "num_tokens": 1027198390.0, "step": 32185 }, { "entropy": 0.6119703082367778, "epoch": 2.9612825688178908, "grad_norm": 0.16799677908420563, "learning_rate": 1.2942006317661852e-06, "loss": 0.5982, "mean_token_accuracy": 0.8105991445481777, "num_tokens": 1027229890.0, "step": 32186 }, { "entropy": 0.5092736128717661, "epoch": 2.961374575189332, "grad_norm": 0.16003268957138062, "learning_rate": 1.2911338056245592e-06, "loss": 0.4953, "mean_token_accuracy": 0.8414034731686115, "num_tokens": 1027261816.0, "step": 32187 }, { "entropy": 0.4424059501616284, "epoch": 2.961466581560773, "grad_norm": 0.14868855476379395, "learning_rate": 1.2880669794829333e-06, "loss": 0.4297, "mean_token_accuracy": 0.8636302761733532, "num_tokens": 1027294398.0, "step": 32188 }, { "entropy": 0.5371302170678973, "epoch": 2.961558587932214, "grad_norm": 0.16063261032104492, "learning_rate": 1.285000153341307e-06, "loss": 0.5239, "mean_token_accuracy": 0.833907674998045, "num_tokens": 1027326420.0, "step": 32189 }, { "entropy": 0.5680709425359964, "epoch": 2.9616505943036557, "grad_norm": 0.16657346487045288, "learning_rate": 1.281933327199681e-06, "loss": 0.5585, "mean_token_accuracy": 0.8248233683407307, "num_tokens": 1027358536.0, "step": 32190 }, { "entropy": 0.45749491825699806, "epoch": 2.961742600675097, "grad_norm": 0.15120932459831238, "learning_rate": 1.278866501058055e-06, "loss": 0.4461, "mean_token_accuracy": 0.8540220260620117, "num_tokens": 1027390431.0, "step": 32191 }, { "entropy": 0.5421678200364113, "epoch": 2.961834607046538, "grad_norm": 0.16130249202251434, "learning_rate": 1.275799674916429e-06, "loss": 0.5283, "mean_token_accuracy": 0.8294514678418636, "num_tokens": 1027422133.0, "step": 32192 }, { "entropy": 0.4712884873151779, "epoch": 2.961926613417979, "grad_norm": 0.15288913249969482, "learning_rate": 1.272732848774803e-06, "loss": 0.4561, "mean_token_accuracy": 0.8542916178703308, "num_tokens": 1027453975.0, "step": 32193 }, { "entropy": 0.4341368577443063, "epoch": 2.9620186197894203, "grad_norm": 0.14743490517139435, "learning_rate": 1.269666022633177e-06, "loss": 0.422, "mean_token_accuracy": 0.8630747497081757, "num_tokens": 1027485919.0, "step": 32194 }, { "entropy": 0.43911546072922647, "epoch": 2.962110626160862, "grad_norm": 0.14401715993881226, "learning_rate": 1.266599196491551e-06, "loss": 0.4308, "mean_token_accuracy": 0.8632588535547256, "num_tokens": 1027518497.0, "step": 32195 }, { "entropy": 0.5145508456043899, "epoch": 2.962202632532303, "grad_norm": 0.15365834534168243, "learning_rate": 1.263532370349925e-06, "loss": 0.4942, "mean_token_accuracy": 0.8411691002547741, "num_tokens": 1027550962.0, "step": 32196 }, { "entropy": 0.5349120412720367, "epoch": 2.962294638903744, "grad_norm": 0.1607525795698166, "learning_rate": 1.2604655442082987e-06, "loss": 0.5255, "mean_token_accuracy": 0.8339854292571545, "num_tokens": 1027582798.0, "step": 32197 }, { "entropy": 0.5410489998757839, "epoch": 2.9623866452751852, "grad_norm": 0.158787801861763, "learning_rate": 1.257398718066673e-06, "loss": 0.534, "mean_token_accuracy": 0.8311082683503628, "num_tokens": 1027615371.0, "step": 32198 }, { "entropy": 0.6508749919012189, "epoch": 2.9624786516466264, "grad_norm": 0.17725370824337006, "learning_rate": 1.2543318919250468e-06, "loss": 0.6482, "mean_token_accuracy": 0.7959261834621429, "num_tokens": 1027647116.0, "step": 32199 }, { "entropy": 0.4036416760645807, "epoch": 2.962570658018068, "grad_norm": 0.14039799571037292, "learning_rate": 1.2512650657834208e-06, "loss": 0.3879, "mean_token_accuracy": 0.8743336349725723, "num_tokens": 1027679525.0, "step": 32200 }, { "entropy": 0.4751293668523431, "epoch": 2.962662664389509, "grad_norm": 0.1512291431427002, "learning_rate": 1.2481982396417948e-06, "loss": 0.4658, "mean_token_accuracy": 0.8523337431252003, "num_tokens": 1027711424.0, "step": 32201 }, { "entropy": 0.5074322801083326, "epoch": 2.9627546707609502, "grad_norm": 0.158411905169487, "learning_rate": 1.2451314135001688e-06, "loss": 0.4891, "mean_token_accuracy": 0.8390339724719524, "num_tokens": 1027742732.0, "step": 32202 }, { "entropy": 0.5934736803174019, "epoch": 2.9628466771323914, "grad_norm": 0.16786357760429382, "learning_rate": 1.2420645873585428e-06, "loss": 0.5835, "mean_token_accuracy": 0.8169018961489201, "num_tokens": 1027774126.0, "step": 32203 }, { "entropy": 0.45876084454357624, "epoch": 2.9629386835038325, "grad_norm": 0.14989948272705078, "learning_rate": 1.2389977612169166e-06, "loss": 0.4542, "mean_token_accuracy": 0.8539936430752277, "num_tokens": 1027806894.0, "step": 32204 }, { "entropy": 0.5713170422241092, "epoch": 2.963030689875274, "grad_norm": 0.1652839034795761, "learning_rate": 1.2359309350752906e-06, "loss": 0.5569, "mean_token_accuracy": 0.8253287896513939, "num_tokens": 1027838546.0, "step": 32205 }, { "entropy": 0.4859502734616399, "epoch": 2.963122696246715, "grad_norm": 0.15280002355575562, "learning_rate": 1.2328641089336646e-06, "loss": 0.4676, "mean_token_accuracy": 0.8497059233486652, "num_tokens": 1027870139.0, "step": 32206 }, { "entropy": 0.496772401034832, "epoch": 2.9632147026181563, "grad_norm": 0.15090107917785645, "learning_rate": 1.2297972827920386e-06, "loss": 0.4812, "mean_token_accuracy": 0.8481771275401115, "num_tokens": 1027901551.0, "step": 32207 }, { "entropy": 0.47774574742652476, "epoch": 2.9633067089895975, "grad_norm": 0.15030384063720703, "learning_rate": 1.2267304566504124e-06, "loss": 0.4617, "mean_token_accuracy": 0.8517349064350128, "num_tokens": 1027933330.0, "step": 32208 }, { "entropy": 0.4785393534693867, "epoch": 2.9633987153610386, "grad_norm": 0.16054844856262207, "learning_rate": 1.2236636305087867e-06, "loss": 0.4746, "mean_token_accuracy": 0.8485161289572716, "num_tokens": 1027964504.0, "step": 32209 }, { "entropy": 0.5811847420409322, "epoch": 2.96349072173248, "grad_norm": 0.16586431860923767, "learning_rate": 1.2205968043671605e-06, "loss": 0.5701, "mean_token_accuracy": 0.8214950002729893, "num_tokens": 1027995979.0, "step": 32210 }, { "entropy": 0.4645373895764351, "epoch": 2.9635827281039213, "grad_norm": 0.14885200560092926, "learning_rate": 1.2175299782255345e-06, "loss": 0.4579, "mean_token_accuracy": 0.856586329638958, "num_tokens": 1028028103.0, "step": 32211 }, { "entropy": 0.44452530494891107, "epoch": 2.9636747344753624, "grad_norm": 0.1482878178358078, "learning_rate": 1.2144631520839083e-06, "loss": 0.432, "mean_token_accuracy": 0.8584084287285805, "num_tokens": 1028059933.0, "step": 32212 }, { "entropy": 0.5291555039584637, "epoch": 2.9637667408468036, "grad_norm": 0.1606413722038269, "learning_rate": 1.2113963259422825e-06, "loss": 0.5258, "mean_token_accuracy": 0.8364062197506428, "num_tokens": 1028092127.0, "step": 32213 }, { "entropy": 0.5480206599459052, "epoch": 2.9638587472182447, "grad_norm": 0.16281239688396454, "learning_rate": 1.2083294998006563e-06, "loss": 0.5285, "mean_token_accuracy": 0.8335162065923214, "num_tokens": 1028123437.0, "step": 32214 }, { "entropy": 0.5166218504309654, "epoch": 2.9639507535896863, "grad_norm": 0.1600278913974762, "learning_rate": 1.2052626736590303e-06, "loss": 0.5094, "mean_token_accuracy": 0.8360125310719013, "num_tokens": 1028155005.0, "step": 32215 }, { "entropy": 0.4945978485047817, "epoch": 2.9640427599611274, "grad_norm": 0.1527179628610611, "learning_rate": 1.2021958475174043e-06, "loss": 0.4823, "mean_token_accuracy": 0.8499787822365761, "num_tokens": 1028187193.0, "step": 32216 }, { "entropy": 0.5621816357597709, "epoch": 2.9641347663325686, "grad_norm": 0.1692175418138504, "learning_rate": 1.1991290213757783e-06, "loss": 0.5475, "mean_token_accuracy": 0.8268318697810173, "num_tokens": 1028218383.0, "step": 32217 }, { "entropy": 0.49210862442851067, "epoch": 2.9642267727040097, "grad_norm": 0.15707719326019287, "learning_rate": 1.1960621952341521e-06, "loss": 0.4788, "mean_token_accuracy": 0.8475061468780041, "num_tokens": 1028250702.0, "step": 32218 }, { "entropy": 0.39643796207383275, "epoch": 2.964318779075451, "grad_norm": 0.14288893342018127, "learning_rate": 1.1929953690925262e-06, "loss": 0.3771, "mean_token_accuracy": 0.8763169795274734, "num_tokens": 1028282897.0, "step": 32219 }, { "entropy": 0.5067685376852751, "epoch": 2.9644107854468924, "grad_norm": 0.16005070507526398, "learning_rate": 1.1899285429509002e-06, "loss": 0.4942, "mean_token_accuracy": 0.8415132462978363, "num_tokens": 1028314686.0, "step": 32220 }, { "entropy": 0.44491367042064667, "epoch": 2.9645027918183335, "grad_norm": 0.15109634399414062, "learning_rate": 1.1868617168092742e-06, "loss": 0.43, "mean_token_accuracy": 0.863400649279356, "num_tokens": 1028346005.0, "step": 32221 }, { "entropy": 0.6148242987692356, "epoch": 2.9645947981897747, "grad_norm": 0.17442777752876282, "learning_rate": 1.1837948906676482e-06, "loss": 0.6126, "mean_token_accuracy": 0.8091343231499195, "num_tokens": 1028378269.0, "step": 32222 }, { "entropy": 0.4815577024128288, "epoch": 2.964686804561216, "grad_norm": 0.15044893324375153, "learning_rate": 1.180728064526022e-06, "loss": 0.4585, "mean_token_accuracy": 0.8527756370604038, "num_tokens": 1028410290.0, "step": 32223 }, { "entropy": 0.5370516823604703, "epoch": 2.964778810932657, "grad_norm": 0.1617552638053894, "learning_rate": 1.1776612383843962e-06, "loss": 0.5345, "mean_token_accuracy": 0.8327954560518265, "num_tokens": 1028442570.0, "step": 32224 }, { "entropy": 0.5937168318778276, "epoch": 2.9648708173040985, "grad_norm": 0.1657361388206482, "learning_rate": 1.17459441224277e-06, "loss": 0.5853, "mean_token_accuracy": 0.8159993216395378, "num_tokens": 1028474454.0, "step": 32225 }, { "entropy": 0.6148591972887516, "epoch": 2.9649628236755396, "grad_norm": 0.1753617525100708, "learning_rate": 1.171527586101144e-06, "loss": 0.6039, "mean_token_accuracy": 0.8116931729018688, "num_tokens": 1028505278.0, "step": 32226 }, { "entropy": 0.6037893537431955, "epoch": 2.965054830046981, "grad_norm": 0.16961492598056793, "learning_rate": 1.1684607599595178e-06, "loss": 0.595, "mean_token_accuracy": 0.8125064224004745, "num_tokens": 1028537288.0, "step": 32227 }, { "entropy": 0.5022375863045454, "epoch": 2.965146836418422, "grad_norm": 0.1629834622144699, "learning_rate": 1.165393933817892e-06, "loss": 0.4918, "mean_token_accuracy": 0.8382101953029633, "num_tokens": 1028568621.0, "step": 32228 }, { "entropy": 0.46327031310647726, "epoch": 2.965238842789863, "grad_norm": 0.15633659064769745, "learning_rate": 1.1623271076762659e-06, "loss": 0.458, "mean_token_accuracy": 0.8550660163164139, "num_tokens": 1028600399.0, "step": 32229 }, { "entropy": 0.4248107271268964, "epoch": 2.9653308491613046, "grad_norm": 0.14194607734680176, "learning_rate": 1.1592602815346399e-06, "loss": 0.4071, "mean_token_accuracy": 0.8690138533711433, "num_tokens": 1028632831.0, "step": 32230 }, { "entropy": 0.45262608560733497, "epoch": 2.9654228555327458, "grad_norm": 0.14771734178066254, "learning_rate": 1.1561934553930139e-06, "loss": 0.447, "mean_token_accuracy": 0.8591305799782276, "num_tokens": 1028665267.0, "step": 32231 }, { "entropy": 0.5536364782601595, "epoch": 2.965514861904187, "grad_norm": 0.1677790880203247, "learning_rate": 1.153126629251388e-06, "loss": 0.5453, "mean_token_accuracy": 0.8274675607681274, "num_tokens": 1028697089.0, "step": 32232 }, { "entropy": 0.5402936162427068, "epoch": 2.965606868275628, "grad_norm": 0.16764578223228455, "learning_rate": 1.1500598031097617e-06, "loss": 0.5239, "mean_token_accuracy": 0.8338696509599686, "num_tokens": 1028728726.0, "step": 32233 }, { "entropy": 0.5449135070666671, "epoch": 2.965698874647069, "grad_norm": 0.1608424335718155, "learning_rate": 1.1469929769681357e-06, "loss": 0.5305, "mean_token_accuracy": 0.8317479901015759, "num_tokens": 1028760212.0, "step": 32234 }, { "entropy": 0.42924045177642256, "epoch": 2.9657908810185107, "grad_norm": 0.14362475275993347, "learning_rate": 1.1439261508265097e-06, "loss": 0.4215, "mean_token_accuracy": 0.8666749857366085, "num_tokens": 1028792767.0, "step": 32235 }, { "entropy": 0.5043237628415227, "epoch": 2.965882887389952, "grad_norm": 0.16164515912532806, "learning_rate": 1.1408593246848837e-06, "loss": 0.5062, "mean_token_accuracy": 0.8404127918183804, "num_tokens": 1028824438.0, "step": 32236 }, { "entropy": 0.5222768876701593, "epoch": 2.965974893761393, "grad_norm": 0.15482006967067719, "learning_rate": 1.1377924985432575e-06, "loss": 0.5103, "mean_token_accuracy": 0.8380273766815662, "num_tokens": 1028856352.0, "step": 32237 }, { "entropy": 0.5299500059336424, "epoch": 2.966066900132834, "grad_norm": 0.1622035950422287, "learning_rate": 1.1347256724016315e-06, "loss": 0.5156, "mean_token_accuracy": 0.8354271650314331, "num_tokens": 1028888400.0, "step": 32238 }, { "entropy": 0.5285862870514393, "epoch": 2.9661589065042753, "grad_norm": 0.16351303458213806, "learning_rate": 1.1316588462600056e-06, "loss": 0.5175, "mean_token_accuracy": 0.8372374549508095, "num_tokens": 1028920434.0, "step": 32239 }, { "entropy": 0.5247831866145134, "epoch": 2.966250912875717, "grad_norm": 0.16410815715789795, "learning_rate": 1.1285920201183796e-06, "loss": 0.5205, "mean_token_accuracy": 0.8351546861231327, "num_tokens": 1028952269.0, "step": 32240 }, { "entropy": 0.5091661503538489, "epoch": 2.966342919247158, "grad_norm": 0.1565173715353012, "learning_rate": 1.1255251939767534e-06, "loss": 0.4957, "mean_token_accuracy": 0.8427984192967415, "num_tokens": 1028983974.0, "step": 32241 }, { "entropy": 0.5696617811918259, "epoch": 2.966434925618599, "grad_norm": 0.16693848371505737, "learning_rate": 1.1224583678351274e-06, "loss": 0.5663, "mean_token_accuracy": 0.8202609680593014, "num_tokens": 1029016711.0, "step": 32242 }, { "entropy": 0.4965949389152229, "epoch": 2.9665269319900403, "grad_norm": 0.15437646210193634, "learning_rate": 1.1193915416935016e-06, "loss": 0.483, "mean_token_accuracy": 0.8470289707183838, "num_tokens": 1029048504.0, "step": 32243 }, { "entropy": 0.43484185775741935, "epoch": 2.9666189383614814, "grad_norm": 0.14570844173431396, "learning_rate": 1.1163247155518754e-06, "loss": 0.423, "mean_token_accuracy": 0.8674041219055653, "num_tokens": 1029080279.0, "step": 32244 }, { "entropy": 0.4722154795890674, "epoch": 2.966710944732923, "grad_norm": 0.14788436889648438, "learning_rate": 1.1132578894102494e-06, "loss": 0.4632, "mean_token_accuracy": 0.8555599227547646, "num_tokens": 1029112796.0, "step": 32245 }, { "entropy": 0.47404505126178265, "epoch": 2.966802951104364, "grad_norm": 0.15292181074619293, "learning_rate": 1.1101910632686234e-06, "loss": 0.4646, "mean_token_accuracy": 0.8521328307688236, "num_tokens": 1029145027.0, "step": 32246 }, { "entropy": 0.4610542682930827, "epoch": 2.9668949574758052, "grad_norm": 0.14932456612586975, "learning_rate": 1.1071242371269974e-06, "loss": 0.4521, "mean_token_accuracy": 0.8563302271068096, "num_tokens": 1029177273.0, "step": 32247 }, { "entropy": 0.5482483403757215, "epoch": 2.9669869638472464, "grad_norm": 0.16578851640224457, "learning_rate": 1.1040574109853712e-06, "loss": 0.5411, "mean_token_accuracy": 0.8278865329921246, "num_tokens": 1029209069.0, "step": 32248 }, { "entropy": 0.4314740113914013, "epoch": 2.9670789702186875, "grad_norm": 0.14661312103271484, "learning_rate": 1.1009905848437453e-06, "loss": 0.413, "mean_token_accuracy": 0.8662921339273453, "num_tokens": 1029241056.0, "step": 32249 }, { "entropy": 0.5531725380569696, "epoch": 2.967170976590129, "grad_norm": 0.1635354459285736, "learning_rate": 1.0979237587021193e-06, "loss": 0.5445, "mean_token_accuracy": 0.8258672170341015, "num_tokens": 1029273310.0, "step": 32250 }, { "entropy": 0.5185016300529242, "epoch": 2.96726298296157, "grad_norm": 0.16595251858234406, "learning_rate": 1.0948569325604933e-06, "loss": 0.5115, "mean_token_accuracy": 0.8353414796292782, "num_tokens": 1029305324.0, "step": 32251 }, { "entropy": 0.35556650650687516, "epoch": 2.9673549893330113, "grad_norm": 0.1330936849117279, "learning_rate": 1.091790106418867e-06, "loss": 0.3385, "mean_token_accuracy": 0.8898858763277531, "num_tokens": 1029337777.0, "step": 32252 }, { "entropy": 0.4980971257900819, "epoch": 2.9674469957044525, "grad_norm": 0.15334518253803253, "learning_rate": 1.088723280277241e-06, "loss": 0.4859, "mean_token_accuracy": 0.8444637395441532, "num_tokens": 1029370185.0, "step": 32253 }, { "entropy": 0.5761081799864769, "epoch": 2.9675390020758936, "grad_norm": 0.16821280121803284, "learning_rate": 1.0856564541356151e-06, "loss": 0.5772, "mean_token_accuracy": 0.8167408853769302, "num_tokens": 1029402001.0, "step": 32254 }, { "entropy": 0.5062299938872457, "epoch": 2.967631008447335, "grad_norm": 0.15301500260829926, "learning_rate": 1.0825896279939891e-06, "loss": 0.4948, "mean_token_accuracy": 0.8407672643661499, "num_tokens": 1029433981.0, "step": 32255 }, { "entropy": 0.5006883158348501, "epoch": 2.9677230148187763, "grad_norm": 0.15740962326526642, "learning_rate": 1.079522801852363e-06, "loss": 0.4898, "mean_token_accuracy": 0.8423534072935581, "num_tokens": 1029465969.0, "step": 32256 }, { "entropy": 0.42812182079069316, "epoch": 2.9678150211902175, "grad_norm": 0.14088882505893707, "learning_rate": 1.076455975710737e-06, "loss": 0.4193, "mean_token_accuracy": 0.8684586212038994, "num_tokens": 1029498253.0, "step": 32257 }, { "entropy": 0.46068246476352215, "epoch": 2.9679070275616586, "grad_norm": 0.15039314329624176, "learning_rate": 1.073389149569111e-06, "loss": 0.4534, "mean_token_accuracy": 0.8572991564869881, "num_tokens": 1029530498.0, "step": 32258 }, { "entropy": 0.43031419976614416, "epoch": 2.9679990339330997, "grad_norm": 0.14304468035697937, "learning_rate": 1.070322323427485e-06, "loss": 0.41, "mean_token_accuracy": 0.8665422536432743, "num_tokens": 1029562001.0, "step": 32259 }, { "entropy": 0.4980227751657367, "epoch": 2.9680910403045413, "grad_norm": 0.16005510091781616, "learning_rate": 1.0672554972858588e-06, "loss": 0.4985, "mean_token_accuracy": 0.8424009867012501, "num_tokens": 1029594010.0, "step": 32260 }, { "entropy": 0.5509489849209785, "epoch": 2.9681830466759824, "grad_norm": 0.16820791363716125, "learning_rate": 1.064188671144233e-06, "loss": 0.5381, "mean_token_accuracy": 0.8310459852218628, "num_tokens": 1029625278.0, "step": 32261 }, { "entropy": 0.5007706279866397, "epoch": 2.9682750530474236, "grad_norm": 0.1547941267490387, "learning_rate": 1.061121845002607e-06, "loss": 0.4855, "mean_token_accuracy": 0.8424835726618767, "num_tokens": 1029657939.0, "step": 32262 }, { "entropy": 0.51571992225945, "epoch": 2.9683670594188647, "grad_norm": 0.16049888730049133, "learning_rate": 1.0580550188609808e-06, "loss": 0.4968, "mean_token_accuracy": 0.8385275267064571, "num_tokens": 1029689849.0, "step": 32263 }, { "entropy": 0.5489074420183897, "epoch": 2.968459065790306, "grad_norm": 0.16203747689723969, "learning_rate": 1.0549881927193548e-06, "loss": 0.5414, "mean_token_accuracy": 0.8281932771205902, "num_tokens": 1029721661.0, "step": 32264 }, { "entropy": 0.5232167541980743, "epoch": 2.9685510721617474, "grad_norm": 0.15995238721370697, "learning_rate": 1.0519213665777288e-06, "loss": 0.5061, "mean_token_accuracy": 0.8389117680490017, "num_tokens": 1029753364.0, "step": 32265 }, { "entropy": 0.5950754433870316, "epoch": 2.9686430785331885, "grad_norm": 0.16580048203468323, "learning_rate": 1.0488545404361028e-06, "loss": 0.583, "mean_token_accuracy": 0.8161311969161034, "num_tokens": 1029784758.0, "step": 32266 }, { "entropy": 0.4085292899981141, "epoch": 2.9687350849046297, "grad_norm": 0.14219669997692108, "learning_rate": 1.0457877142944766e-06, "loss": 0.3936, "mean_token_accuracy": 0.8714838549494743, "num_tokens": 1029817106.0, "step": 32267 }, { "entropy": 0.45228573121130466, "epoch": 2.968827091276071, "grad_norm": 0.14983730018138885, "learning_rate": 1.0427208881528506e-06, "loss": 0.4337, "mean_token_accuracy": 0.8598489090800285, "num_tokens": 1029848848.0, "step": 32268 }, { "entropy": 0.4294070064788684, "epoch": 2.968919097647512, "grad_norm": 0.14000093936920166, "learning_rate": 1.0396540620112247e-06, "loss": 0.4136, "mean_token_accuracy": 0.8661414086818695, "num_tokens": 1029880410.0, "step": 32269 }, { "entropy": 0.5045245578512549, "epoch": 2.9690111040189535, "grad_norm": 0.1550406515598297, "learning_rate": 1.0365872358695987e-06, "loss": 0.4888, "mean_token_accuracy": 0.8443292267620564, "num_tokens": 1029912261.0, "step": 32270 }, { "entropy": 0.4676247730385512, "epoch": 2.9691031103903947, "grad_norm": 0.15253852307796478, "learning_rate": 1.0335204097279725e-06, "loss": 0.4516, "mean_token_accuracy": 0.8540171273052692, "num_tokens": 1029943806.0, "step": 32271 }, { "entropy": 0.40541810216382146, "epoch": 2.969195116761836, "grad_norm": 0.14437323808670044, "learning_rate": 1.0304535835863465e-06, "loss": 0.3938, "mean_token_accuracy": 0.8775572627782822, "num_tokens": 1029975276.0, "step": 32272 }, { "entropy": 0.5264608999714255, "epoch": 2.969287123133277, "grad_norm": 0.16128945350646973, "learning_rate": 1.0273867574447205e-06, "loss": 0.5042, "mean_token_accuracy": 0.839641347527504, "num_tokens": 1030007027.0, "step": 32273 }, { "entropy": 0.5501187220215797, "epoch": 2.969379129504718, "grad_norm": 0.1580071598291397, "learning_rate": 1.0243199313030945e-06, "loss": 0.5406, "mean_token_accuracy": 0.8288349136710167, "num_tokens": 1030039391.0, "step": 32274 }, { "entropy": 0.45394227746874094, "epoch": 2.9694711358761596, "grad_norm": 0.15236036479473114, "learning_rate": 1.0212531051614683e-06, "loss": 0.442, "mean_token_accuracy": 0.8600396066904068, "num_tokens": 1030071104.0, "step": 32275 }, { "entropy": 0.5335117280483246, "epoch": 2.9695631422476008, "grad_norm": 0.15689371526241302, "learning_rate": 1.0181862790198425e-06, "loss": 0.5193, "mean_token_accuracy": 0.833508487790823, "num_tokens": 1030103615.0, "step": 32276 }, { "entropy": 0.5819128947332501, "epoch": 2.969655148619042, "grad_norm": 0.16442255675792694, "learning_rate": 1.0151194528782163e-06, "loss": 0.5691, "mean_token_accuracy": 0.8198184594511986, "num_tokens": 1030135485.0, "step": 32277 }, { "entropy": 0.4877621568739414, "epoch": 2.969747154990483, "grad_norm": 0.1575632244348526, "learning_rate": 1.0120526267365903e-06, "loss": 0.478, "mean_token_accuracy": 0.8475013300776482, "num_tokens": 1030167207.0, "step": 32278 }, { "entropy": 0.5135930581018329, "epoch": 2.969839161361924, "grad_norm": 0.15113763511180878, "learning_rate": 1.0089858005949641e-06, "loss": 0.503, "mean_token_accuracy": 0.8409087434411049, "num_tokens": 1030199780.0, "step": 32279 }, { "entropy": 0.5483936425298452, "epoch": 2.9699311677333657, "grad_norm": 0.168921560049057, "learning_rate": 1.0059189744533384e-06, "loss": 0.5321, "mean_token_accuracy": 0.8322047963738441, "num_tokens": 1030230687.0, "step": 32280 }, { "entropy": 0.41649895580485463, "epoch": 2.970023174104807, "grad_norm": 0.14903345704078674, "learning_rate": 1.0028521483117122e-06, "loss": 0.4063, "mean_token_accuracy": 0.8654147461056709, "num_tokens": 1030262073.0, "step": 32281 }, { "entropy": 0.5496848258189857, "epoch": 2.970115180476248, "grad_norm": 0.15801699459552765, "learning_rate": 9.997853221700862e-07, "loss": 0.5382, "mean_token_accuracy": 0.829232532531023, "num_tokens": 1030293880.0, "step": 32282 }, { "entropy": 0.4454535283148289, "epoch": 2.970207186847689, "grad_norm": 0.14812766015529633, "learning_rate": 9.967184960284602e-07, "loss": 0.4289, "mean_token_accuracy": 0.8632466569542885, "num_tokens": 1030326194.0, "step": 32283 }, { "entropy": 0.5558443069458008, "epoch": 2.9702991932191303, "grad_norm": 0.16517774760723114, "learning_rate": 9.936516698868342e-07, "loss": 0.5466, "mean_token_accuracy": 0.8288338780403137, "num_tokens": 1030358037.0, "step": 32284 }, { "entropy": 0.46605911757797003, "epoch": 2.970391199590572, "grad_norm": 0.14746522903442383, "learning_rate": 9.905848437452082e-07, "loss": 0.4512, "mean_token_accuracy": 0.8572420068085194, "num_tokens": 1030390474.0, "step": 32285 }, { "entropy": 0.5149324899539351, "epoch": 2.970483205962013, "grad_norm": 0.1622145175933838, "learning_rate": 9.87518017603582e-07, "loss": 0.5125, "mean_token_accuracy": 0.8392997533082962, "num_tokens": 1030421922.0, "step": 32286 }, { "entropy": 0.4715610947459936, "epoch": 2.970575212333454, "grad_norm": 0.15142831206321716, "learning_rate": 9.84451191461956e-07, "loss": 0.4598, "mean_token_accuracy": 0.8522660322487354, "num_tokens": 1030453803.0, "step": 32287 }, { "entropy": 0.49365594796836376, "epoch": 2.9706672187048953, "grad_norm": 0.15785880386829376, "learning_rate": 9.8138436532033e-07, "loss": 0.4838, "mean_token_accuracy": 0.8443404771387577, "num_tokens": 1030485725.0, "step": 32288 }, { "entropy": 0.4799515618942678, "epoch": 2.9707592250763364, "grad_norm": 0.15208406746387482, "learning_rate": 9.78317539178704e-07, "loss": 0.4743, "mean_token_accuracy": 0.8500353246927261, "num_tokens": 1030518291.0, "step": 32289 }, { "entropy": 0.4619027730077505, "epoch": 2.970851231447778, "grad_norm": 0.1607932597398758, "learning_rate": 9.752507130370779e-07, "loss": 0.4544, "mean_token_accuracy": 0.8538635484874249, "num_tokens": 1030548653.0, "step": 32290 }, { "entropy": 0.5363004859536886, "epoch": 2.970943237819219, "grad_norm": 0.16112969815731049, "learning_rate": 9.72183886895452e-07, "loss": 0.5215, "mean_token_accuracy": 0.8366954512894154, "num_tokens": 1030580825.0, "step": 32291 }, { "entropy": 0.47714396100491285, "epoch": 2.9710352441906602, "grad_norm": 0.15193746984004974, "learning_rate": 9.691170607538259e-07, "loss": 0.4661, "mean_token_accuracy": 0.8505403064191341, "num_tokens": 1030612776.0, "step": 32292 }, { "entropy": 0.5251020456198603, "epoch": 2.9711272505621014, "grad_norm": 0.16026192903518677, "learning_rate": 9.660502346121999e-07, "loss": 0.518, "mean_token_accuracy": 0.8400356136262417, "num_tokens": 1030644381.0, "step": 32293 }, { "entropy": 0.42331167683005333, "epoch": 2.9712192569335425, "grad_norm": 0.1502801477909088, "learning_rate": 9.62983408470574e-07, "loss": 0.4176, "mean_token_accuracy": 0.8643608652055264, "num_tokens": 1030676296.0, "step": 32294 }, { "entropy": 0.44222155038733035, "epoch": 2.971311263304984, "grad_norm": 0.1472693830728531, "learning_rate": 9.59916582328948e-07, "loss": 0.4363, "mean_token_accuracy": 0.8599495962262154, "num_tokens": 1030708844.0, "step": 32295 }, { "entropy": 0.5177637487649918, "epoch": 2.971403269676425, "grad_norm": 0.15887722373008728, "learning_rate": 9.568497561873217e-07, "loss": 0.5102, "mean_token_accuracy": 0.8389346525073051, "num_tokens": 1030741197.0, "step": 32296 }, { "entropy": 0.4232736211270094, "epoch": 2.9714952760478663, "grad_norm": 0.14480677247047424, "learning_rate": 9.537829300456957e-07, "loss": 0.4074, "mean_token_accuracy": 0.8695213012397289, "num_tokens": 1030773573.0, "step": 32297 }, { "entropy": 0.5612757280468941, "epoch": 2.9715872824193075, "grad_norm": 0.16232788562774658, "learning_rate": 9.507161039040696e-07, "loss": 0.5587, "mean_token_accuracy": 0.8253078386187553, "num_tokens": 1030805827.0, "step": 32298 }, { "entropy": 0.5419466532766819, "epoch": 2.9716792887907486, "grad_norm": 0.16176539659500122, "learning_rate": 9.476492777624438e-07, "loss": 0.5346, "mean_token_accuracy": 0.8329378627240658, "num_tokens": 1030838063.0, "step": 32299 }, { "entropy": 0.500976949930191, "epoch": 2.97177129516219, "grad_norm": 0.15940485894680023, "learning_rate": 9.445824516208176e-07, "loss": 0.4954, "mean_token_accuracy": 0.8424787223339081, "num_tokens": 1030869453.0, "step": 32300 }, { "entropy": 0.4606150649487972, "epoch": 2.9718633015336313, "grad_norm": 0.15324339270591736, "learning_rate": 9.415156254791917e-07, "loss": 0.4486, "mean_token_accuracy": 0.8541411273181438, "num_tokens": 1030901751.0, "step": 32301 }, { "entropy": 0.46865101251751184, "epoch": 2.9719553079050725, "grad_norm": 0.15266941487789154, "learning_rate": 9.384487993375655e-07, "loss": 0.4589, "mean_token_accuracy": 0.8527810238301754, "num_tokens": 1030933871.0, "step": 32302 }, { "entropy": 0.6276939585804939, "epoch": 2.9720473142765136, "grad_norm": 0.1736716479063034, "learning_rate": 9.353819731959396e-07, "loss": 0.6158, "mean_token_accuracy": 0.8075175508856773, "num_tokens": 1030965214.0, "step": 32303 }, { "entropy": 0.5850006602704525, "epoch": 2.9721393206479547, "grad_norm": 0.170444518327713, "learning_rate": 9.323151470543136e-07, "loss": 0.5735, "mean_token_accuracy": 0.8197363317012787, "num_tokens": 1030997134.0, "step": 32304 }, { "entropy": 0.4010355811333284, "epoch": 2.9722313270193963, "grad_norm": 0.1364968866109848, "learning_rate": 9.292483209126875e-07, "loss": 0.3849, "mean_token_accuracy": 0.8745917715132236, "num_tokens": 1031029565.0, "step": 32305 }, { "entropy": 0.5124551327899098, "epoch": 2.9723233333908374, "grad_norm": 0.15803663432598114, "learning_rate": 9.261814947710615e-07, "loss": 0.5104, "mean_token_accuracy": 0.8374841026961803, "num_tokens": 1031061512.0, "step": 32306 }, { "entropy": 0.5323857488110662, "epoch": 2.9724153397622786, "grad_norm": 0.1536620408296585, "learning_rate": 9.231146686294354e-07, "loss": 0.5196, "mean_token_accuracy": 0.8364644683897495, "num_tokens": 1031093536.0, "step": 32307 }, { "entropy": 0.47805634408723563, "epoch": 2.9725073461337197, "grad_norm": 0.15168625116348267, "learning_rate": 9.200478424878094e-07, "loss": 0.4643, "mean_token_accuracy": 0.8508875519037247, "num_tokens": 1031124627.0, "step": 32308 }, { "entropy": 0.45635552424937487, "epoch": 2.972599352505161, "grad_norm": 0.15315008163452148, "learning_rate": 9.169810163461833e-07, "loss": 0.4436, "mean_token_accuracy": 0.855119314044714, "num_tokens": 1031156753.0, "step": 32309 }, { "entropy": 0.5963024543598294, "epoch": 2.9726913588766024, "grad_norm": 0.16816383600234985, "learning_rate": 9.139141902045574e-07, "loss": 0.5859, "mean_token_accuracy": 0.8183597587049007, "num_tokens": 1031188687.0, "step": 32310 }, { "entropy": 0.45074520632624626, "epoch": 2.9727833652480435, "grad_norm": 0.15000170469284058, "learning_rate": 9.108473640629313e-07, "loss": 0.4397, "mean_token_accuracy": 0.8584470599889755, "num_tokens": 1031221187.0, "step": 32311 }, { "entropy": 0.5712340641766787, "epoch": 2.9728753716194847, "grad_norm": 0.1732204407453537, "learning_rate": 9.077805379213053e-07, "loss": 0.5563, "mean_token_accuracy": 0.8247973844408989, "num_tokens": 1031251796.0, "step": 32312 }, { "entropy": 0.5764369145035744, "epoch": 2.972967377990926, "grad_norm": 0.16801726818084717, "learning_rate": 9.047137117796792e-07, "loss": 0.5666, "mean_token_accuracy": 0.8197418823838234, "num_tokens": 1031283645.0, "step": 32313 }, { "entropy": 0.45279229059815407, "epoch": 2.973059384362367, "grad_norm": 0.1452091783285141, "learning_rate": 9.016468856380533e-07, "loss": 0.4375, "mean_token_accuracy": 0.8607050627470016, "num_tokens": 1031315692.0, "step": 32314 }, { "entropy": 0.499296513851732, "epoch": 2.9731513907338085, "grad_norm": 0.1547030657529831, "learning_rate": 8.985800594964271e-07, "loss": 0.4873, "mean_token_accuracy": 0.8444201275706291, "num_tokens": 1031347044.0, "step": 32315 }, { "entropy": 0.6162654850631952, "epoch": 2.9732433971052497, "grad_norm": 0.17113548517227173, "learning_rate": 8.955132333548012e-07, "loss": 0.5959, "mean_token_accuracy": 0.8156956471502781, "num_tokens": 1031378694.0, "step": 32316 }, { "entropy": 0.4789689276367426, "epoch": 2.973335403476691, "grad_norm": 0.15136702358722687, "learning_rate": 8.92446407213175e-07, "loss": 0.4573, "mean_token_accuracy": 0.8521506637334824, "num_tokens": 1031410587.0, "step": 32317 }, { "entropy": 0.518044475466013, "epoch": 2.973427409848132, "grad_norm": 0.15921765565872192, "learning_rate": 8.893795810715491e-07, "loss": 0.5034, "mean_token_accuracy": 0.8422594927251339, "num_tokens": 1031442558.0, "step": 32318 }, { "entropy": 0.5500902403146029, "epoch": 2.973519416219573, "grad_norm": 0.17061297595500946, "learning_rate": 8.86312754929923e-07, "loss": 0.5407, "mean_token_accuracy": 0.8276944644749165, "num_tokens": 1031474377.0, "step": 32319 }, { "entropy": 0.4846153296530247, "epoch": 2.9736114225910146, "grad_norm": 0.15910638868808746, "learning_rate": 8.832459287882971e-07, "loss": 0.4831, "mean_token_accuracy": 0.8490417823195457, "num_tokens": 1031505818.0, "step": 32320 }, { "entropy": 0.49742671847343445, "epoch": 2.9737034289624558, "grad_norm": 0.1544404923915863, "learning_rate": 8.80179102646671e-07, "loss": 0.4818, "mean_token_accuracy": 0.8438292555510998, "num_tokens": 1031538054.0, "step": 32321 }, { "entropy": 0.5028064800426364, "epoch": 2.973795435333897, "grad_norm": 0.15509334206581116, "learning_rate": 8.77112276505045e-07, "loss": 0.4829, "mean_token_accuracy": 0.8460366651415825, "num_tokens": 1031570583.0, "step": 32322 }, { "entropy": 0.49886561650782824, "epoch": 2.973887441705338, "grad_norm": 0.1553271859884262, "learning_rate": 8.74045450363419e-07, "loss": 0.4908, "mean_token_accuracy": 0.8419875018298626, "num_tokens": 1031602973.0, "step": 32323 }, { "entropy": 0.4858549414202571, "epoch": 2.973979448076779, "grad_norm": 0.15522648394107819, "learning_rate": 8.709786242217929e-07, "loss": 0.4685, "mean_token_accuracy": 0.8480829112231731, "num_tokens": 1031634405.0, "step": 32324 }, { "entropy": 0.44577604345977306, "epoch": 2.9740714544482207, "grad_norm": 0.15098726749420166, "learning_rate": 8.679117980801669e-07, "loss": 0.4438, "mean_token_accuracy": 0.8601540885865688, "num_tokens": 1031666155.0, "step": 32325 }, { "entropy": 0.4369589372072369, "epoch": 2.974163460819662, "grad_norm": 0.1435539275407791, "learning_rate": 8.648449719385408e-07, "loss": 0.4261, "mean_token_accuracy": 0.8662040121853352, "num_tokens": 1031698423.0, "step": 32326 }, { "entropy": 0.5370141549501568, "epoch": 2.974255467191103, "grad_norm": 0.1610584706068039, "learning_rate": 8.617781457969149e-07, "loss": 0.5191, "mean_token_accuracy": 0.8351154699921608, "num_tokens": 1031728717.0, "step": 32327 }, { "entropy": 0.5342743480578065, "epoch": 2.974347473562544, "grad_norm": 0.15936657786369324, "learning_rate": 8.587113196552887e-07, "loss": 0.5174, "mean_token_accuracy": 0.8394401147961617, "num_tokens": 1031761078.0, "step": 32328 }, { "entropy": 0.5164936259388924, "epoch": 2.9744394799339853, "grad_norm": 0.15595905482769012, "learning_rate": 8.556444935136629e-07, "loss": 0.5056, "mean_token_accuracy": 0.8379749990999699, "num_tokens": 1031793399.0, "step": 32329 }, { "entropy": 0.5761733530089259, "epoch": 2.974531486305427, "grad_norm": 0.16754569113254547, "learning_rate": 8.525776673720367e-07, "loss": 0.5499, "mean_token_accuracy": 0.8243238478899002, "num_tokens": 1031824858.0, "step": 32330 }, { "entropy": 0.41128361877053976, "epoch": 2.974623492676868, "grad_norm": 0.14305199682712555, "learning_rate": 8.495108412304108e-07, "loss": 0.407, "mean_token_accuracy": 0.8700186088681221, "num_tokens": 1031856985.0, "step": 32331 }, { "entropy": 0.48043999820947647, "epoch": 2.974715499048309, "grad_norm": 0.15493130683898926, "learning_rate": 8.464440150887846e-07, "loss": 0.4696, "mean_token_accuracy": 0.8499801158905029, "num_tokens": 1031888817.0, "step": 32332 }, { "entropy": 0.4739791937172413, "epoch": 2.9748075054197503, "grad_norm": 0.1523011475801468, "learning_rate": 8.433771889471587e-07, "loss": 0.4678, "mean_token_accuracy": 0.8515085652470589, "num_tokens": 1031920891.0, "step": 32333 }, { "entropy": 0.5341730555519462, "epoch": 2.9748995117911914, "grad_norm": 0.15774112939834595, "learning_rate": 8.403103628055326e-07, "loss": 0.5242, "mean_token_accuracy": 0.8354517817497253, "num_tokens": 1031953598.0, "step": 32334 }, { "entropy": 0.47701889742165804, "epoch": 2.974991518162633, "grad_norm": 0.15166401863098145, "learning_rate": 8.372435366639066e-07, "loss": 0.4643, "mean_token_accuracy": 0.8515617214143276, "num_tokens": 1031986007.0, "step": 32335 }, { "entropy": 0.49997374787926674, "epoch": 2.975083524534074, "grad_norm": 0.15843361616134644, "learning_rate": 8.341767105222805e-07, "loss": 0.4863, "mean_token_accuracy": 0.8472138307988644, "num_tokens": 1032017323.0, "step": 32336 }, { "entropy": 0.42298223660327494, "epoch": 2.9751755309055152, "grad_norm": 0.1464833766222, "learning_rate": 8.311098843806545e-07, "loss": 0.41, "mean_token_accuracy": 0.8684764243662357, "num_tokens": 1032048784.0, "step": 32337 }, { "entropy": 0.47787413001060486, "epoch": 2.9752675372769564, "grad_norm": 0.1536768525838852, "learning_rate": 8.280430582390284e-07, "loss": 0.4654, "mean_token_accuracy": 0.8477063588798046, "num_tokens": 1032080169.0, "step": 32338 }, { "entropy": 0.4532371307723224, "epoch": 2.9753595436483975, "grad_norm": 0.14752760529518127, "learning_rate": 8.249762320974024e-07, "loss": 0.4265, "mean_token_accuracy": 0.8600115329027176, "num_tokens": 1032111714.0, "step": 32339 }, { "entropy": 0.48838580353185534, "epoch": 2.975451550019839, "grad_norm": 0.15293598175048828, "learning_rate": 8.219094059557764e-07, "loss": 0.4782, "mean_token_accuracy": 0.848510030657053, "num_tokens": 1032144201.0, "step": 32340 }, { "entropy": 0.47638132236897945, "epoch": 2.97554355639128, "grad_norm": 0.15861710906028748, "learning_rate": 8.188425798141504e-07, "loss": 0.4606, "mean_token_accuracy": 0.851166345179081, "num_tokens": 1032175276.0, "step": 32341 }, { "entropy": 0.539448247407563, "epoch": 2.9756355627627213, "grad_norm": 0.15797892212867737, "learning_rate": 8.157757536725243e-07, "loss": 0.5205, "mean_token_accuracy": 0.8361501544713974, "num_tokens": 1032206568.0, "step": 32342 }, { "entropy": 0.6622688695788383, "epoch": 2.9757275691341625, "grad_norm": 0.17230388522148132, "learning_rate": 8.127089275308983e-07, "loss": 0.6567, "mean_token_accuracy": 0.7946532927453518, "num_tokens": 1032239333.0, "step": 32343 }, { "entropy": 0.5866507821483538, "epoch": 2.9758195755056036, "grad_norm": 0.16112500429153442, "learning_rate": 8.096421013892724e-07, "loss": 0.565, "mean_token_accuracy": 0.8281792514026165, "num_tokens": 1032270928.0, "step": 32344 }, { "entropy": 0.4154736869968474, "epoch": 2.975911581877045, "grad_norm": 0.14074759185314178, "learning_rate": 8.065752752476462e-07, "loss": 0.4102, "mean_token_accuracy": 0.8703285306692123, "num_tokens": 1032303696.0, "step": 32345 }, { "entropy": 0.553498150780797, "epoch": 2.9760035882484863, "grad_norm": 0.1710578203201294, "learning_rate": 8.035084491060203e-07, "loss": 0.5381, "mean_token_accuracy": 0.8306807242333889, "num_tokens": 1032335694.0, "step": 32346 }, { "entropy": 0.4920405038865283, "epoch": 2.9760955946199275, "grad_norm": 0.15915876626968384, "learning_rate": 8.004416229643941e-07, "loss": 0.482, "mean_token_accuracy": 0.8481951393187046, "num_tokens": 1032367348.0, "step": 32347 }, { "entropy": 0.4771037846803665, "epoch": 2.9761876009913686, "grad_norm": 0.15849730372428894, "learning_rate": 7.973747968227682e-07, "loss": 0.4688, "mean_token_accuracy": 0.8508323766291142, "num_tokens": 1032398348.0, "step": 32348 }, { "entropy": 0.5231748120859265, "epoch": 2.9762796073628097, "grad_norm": 0.15807032585144043, "learning_rate": 7.943079706811421e-07, "loss": 0.5093, "mean_token_accuracy": 0.8395749814808369, "num_tokens": 1032430517.0, "step": 32349 }, { "entropy": 0.41840339358896017, "epoch": 2.9763716137342513, "grad_norm": 0.14719446003437042, "learning_rate": 7.912411445395162e-07, "loss": 0.4046, "mean_token_accuracy": 0.8665513582527637, "num_tokens": 1032462244.0, "step": 32350 }, { "entropy": 0.5190475266426802, "epoch": 2.9764636201056924, "grad_norm": 0.15744948387145996, "learning_rate": 7.881743183978901e-07, "loss": 0.5089, "mean_token_accuracy": 0.8371450081467628, "num_tokens": 1032493484.0, "step": 32351 }, { "entropy": 0.596458725980483, "epoch": 2.9765556264771336, "grad_norm": 0.1668752282857895, "learning_rate": 7.851074922562641e-07, "loss": 0.5881, "mean_token_accuracy": 0.8150375038385391, "num_tokens": 1032525195.0, "step": 32352 }, { "entropy": 0.6054442403838038, "epoch": 2.9766476328485747, "grad_norm": 0.16586807370185852, "learning_rate": 7.82040666114638e-07, "loss": 0.5933, "mean_token_accuracy": 0.8153080530464649, "num_tokens": 1032557532.0, "step": 32353 }, { "entropy": 0.5443276851437986, "epoch": 2.976739639220016, "grad_norm": 0.16577494144439697, "learning_rate": 7.78973839973012e-07, "loss": 0.5237, "mean_token_accuracy": 0.831793300807476, "num_tokens": 1032588158.0, "step": 32354 }, { "entropy": 0.5097162239253521, "epoch": 2.9768316455914574, "grad_norm": 0.15649476647377014, "learning_rate": 7.75907013831386e-07, "loss": 0.4901, "mean_token_accuracy": 0.8453604020178318, "num_tokens": 1032620505.0, "step": 32355 }, { "entropy": 0.44206675328314304, "epoch": 2.9769236519628985, "grad_norm": 0.14804020524024963, "learning_rate": 7.728401876897599e-07, "loss": 0.4248, "mean_token_accuracy": 0.8610699325799942, "num_tokens": 1032652556.0, "step": 32356 }, { "entropy": 0.45140325417742133, "epoch": 2.9770156583343397, "grad_norm": 0.14476290345191956, "learning_rate": 7.697733615481339e-07, "loss": 0.4444, "mean_token_accuracy": 0.8572501391172409, "num_tokens": 1032685196.0, "step": 32357 }, { "entropy": 0.4684425871819258, "epoch": 2.977107664705781, "grad_norm": 0.15304717421531677, "learning_rate": 7.667065354065078e-07, "loss": 0.4653, "mean_token_accuracy": 0.8512157499790192, "num_tokens": 1032717214.0, "step": 32358 }, { "entropy": 0.46279097348451614, "epoch": 2.977199671077222, "grad_norm": 0.15390850603580475, "learning_rate": 7.636397092648818e-07, "loss": 0.4584, "mean_token_accuracy": 0.8539050109684467, "num_tokens": 1032748877.0, "step": 32359 }, { "entropy": 0.38386787939816713, "epoch": 2.9772916774486635, "grad_norm": 0.13441719114780426, "learning_rate": 7.605728831232558e-07, "loss": 0.3638, "mean_token_accuracy": 0.8778478875756264, "num_tokens": 1032781137.0, "step": 32360 }, { "entropy": 0.5539260469377041, "epoch": 2.9773836838201047, "grad_norm": 0.1609802097082138, "learning_rate": 7.575060569816298e-07, "loss": 0.5508, "mean_token_accuracy": 0.8298937827348709, "num_tokens": 1032812914.0, "step": 32361 }, { "entropy": 0.5146436078939587, "epoch": 2.977475690191546, "grad_norm": 0.15235276520252228, "learning_rate": 7.544392308400038e-07, "loss": 0.5054, "mean_token_accuracy": 0.841616790741682, "num_tokens": 1032845263.0, "step": 32362 }, { "entropy": 0.5955823343247175, "epoch": 2.977567696562987, "grad_norm": 0.17130300402641296, "learning_rate": 7.513724046983777e-07, "loss": 0.5894, "mean_token_accuracy": 0.8142514899373055, "num_tokens": 1032876536.0, "step": 32363 }, { "entropy": 0.44159476459026337, "epoch": 2.977659702934428, "grad_norm": 0.15183141827583313, "learning_rate": 7.483055785567517e-07, "loss": 0.4353, "mean_token_accuracy": 0.8587217628955841, "num_tokens": 1032908170.0, "step": 32364 }, { "entropy": 0.46571092400699854, "epoch": 2.9777517093058696, "grad_norm": 0.1484919637441635, "learning_rate": 7.452387524151256e-07, "loss": 0.4549, "mean_token_accuracy": 0.8555879257619381, "num_tokens": 1032940730.0, "step": 32365 }, { "entropy": 0.5793533176183701, "epoch": 2.9778437156773108, "grad_norm": 0.15906330943107605, "learning_rate": 7.421719262734996e-07, "loss": 0.554, "mean_token_accuracy": 0.826703418046236, "num_tokens": 1032973366.0, "step": 32366 }, { "entropy": 0.4179733913624659, "epoch": 2.977935722048752, "grad_norm": 0.14022445678710938, "learning_rate": 7.391051001318735e-07, "loss": 0.4089, "mean_token_accuracy": 0.8700457476079464, "num_tokens": 1033006086.0, "step": 32367 }, { "entropy": 0.5481031723320484, "epoch": 2.978027728420193, "grad_norm": 0.1660323292016983, "learning_rate": 7.360382739902475e-07, "loss": 0.5303, "mean_token_accuracy": 0.8310101479291916, "num_tokens": 1033037071.0, "step": 32368 }, { "entropy": 0.3996511506848037, "epoch": 2.978119734791634, "grad_norm": 0.13404303789138794, "learning_rate": 7.329714478486214e-07, "loss": 0.3886, "mean_token_accuracy": 0.8794882744550705, "num_tokens": 1033069839.0, "step": 32369 }, { "entropy": 0.5792920328676701, "epoch": 2.9782117411630757, "grad_norm": 0.1672493815422058, "learning_rate": 7.299046217069955e-07, "loss": 0.5622, "mean_token_accuracy": 0.8210929334163666, "num_tokens": 1033100722.0, "step": 32370 }, { "entropy": 0.532009051181376, "epoch": 2.978303747534517, "grad_norm": 0.15936079621315002, "learning_rate": 7.268377955653694e-07, "loss": 0.5169, "mean_token_accuracy": 0.8384346254169941, "num_tokens": 1033131818.0, "step": 32371 }, { "entropy": 0.4865764924325049, "epoch": 2.978395753905958, "grad_norm": 0.15249191224575043, "learning_rate": 7.237709694237434e-07, "loss": 0.4682, "mean_token_accuracy": 0.848790168762207, "num_tokens": 1033163980.0, "step": 32372 }, { "entropy": 0.39257694291882217, "epoch": 2.978487760277399, "grad_norm": 0.1412283480167389, "learning_rate": 7.207041432821174e-07, "loss": 0.3798, "mean_token_accuracy": 0.8746127262711525, "num_tokens": 1033196250.0, "step": 32373 }, { "entropy": 0.5199130759574473, "epoch": 2.9785797666488403, "grad_norm": 0.1583741158246994, "learning_rate": 7.176373171404914e-07, "loss": 0.5063, "mean_token_accuracy": 0.8409878127276897, "num_tokens": 1033227415.0, "step": 32374 }, { "entropy": 0.39308267552405596, "epoch": 2.978671773020282, "grad_norm": 0.14271192252635956, "learning_rate": 7.145704909988653e-07, "loss": 0.3783, "mean_token_accuracy": 0.8743228949606419, "num_tokens": 1033258535.0, "step": 32375 }, { "entropy": 0.6001141089946032, "epoch": 2.978763779391723, "grad_norm": 0.1686936467885971, "learning_rate": 7.115036648572393e-07, "loss": 0.5779, "mean_token_accuracy": 0.8151560761034489, "num_tokens": 1033290337.0, "step": 32376 }, { "entropy": 0.49579619243741035, "epoch": 2.978855785763164, "grad_norm": 0.15801894664764404, "learning_rate": 7.084368387156133e-07, "loss": 0.481, "mean_token_accuracy": 0.8465945944190025, "num_tokens": 1033322072.0, "step": 32377 }, { "entropy": 0.4890263043344021, "epoch": 2.9789477921346053, "grad_norm": 0.15454551577568054, "learning_rate": 7.053700125739872e-07, "loss": 0.4866, "mean_token_accuracy": 0.8471232503652573, "num_tokens": 1033353938.0, "step": 32378 }, { "entropy": 0.5717684382107109, "epoch": 2.9790397985060464, "grad_norm": 0.16571691632270813, "learning_rate": 7.023031864323612e-07, "loss": 0.5684, "mean_token_accuracy": 0.8217038549482822, "num_tokens": 1033385885.0, "step": 32379 }, { "entropy": 0.5796127263456583, "epoch": 2.979131804877488, "grad_norm": 0.16700194776058197, "learning_rate": 6.992363602907351e-07, "loss": 0.5651, "mean_token_accuracy": 0.8254427202045918, "num_tokens": 1033417817.0, "step": 32380 }, { "entropy": 0.49641203135252, "epoch": 2.979223811248929, "grad_norm": 0.14950281381607056, "learning_rate": 6.961695341491092e-07, "loss": 0.4775, "mean_token_accuracy": 0.8464965559542179, "num_tokens": 1033449837.0, "step": 32381 }, { "entropy": 0.46788534335792065, "epoch": 2.9793158176203702, "grad_norm": 0.15077327191829681, "learning_rate": 6.931027080074831e-07, "loss": 0.4534, "mean_token_accuracy": 0.8541533164680004, "num_tokens": 1033481789.0, "step": 32382 }, { "entropy": 0.6074517611414194, "epoch": 2.9794078239918114, "grad_norm": 0.1712934672832489, "learning_rate": 6.900358818658571e-07, "loss": 0.5924, "mean_token_accuracy": 0.8129815980792046, "num_tokens": 1033513977.0, "step": 32383 }, { "entropy": 0.492969511076808, "epoch": 2.9794998303632525, "grad_norm": 0.1518772393465042, "learning_rate": 6.86969055724231e-07, "loss": 0.4823, "mean_token_accuracy": 0.848633885383606, "num_tokens": 1033544915.0, "step": 32384 }, { "entropy": 0.5108314715325832, "epoch": 2.979591836734694, "grad_norm": 0.15716740489006042, "learning_rate": 6.83902229582605e-07, "loss": 0.498, "mean_token_accuracy": 0.8413144275546074, "num_tokens": 1033577544.0, "step": 32385 }, { "entropy": 0.5090573001652956, "epoch": 2.979683843106135, "grad_norm": 0.156625896692276, "learning_rate": 6.808354034409789e-07, "loss": 0.4962, "mean_token_accuracy": 0.8407343812286854, "num_tokens": 1033609447.0, "step": 32386 }, { "entropy": 0.5834165681153536, "epoch": 2.9797758494775763, "grad_norm": 0.16583675146102905, "learning_rate": 6.777685772993529e-07, "loss": 0.5774, "mean_token_accuracy": 0.82062678784132, "num_tokens": 1033641822.0, "step": 32387 }, { "entropy": 0.5313225481659174, "epoch": 2.9798678558490175, "grad_norm": 0.16413050889968872, "learning_rate": 6.747017511577269e-07, "loss": 0.5176, "mean_token_accuracy": 0.8374691531062126, "num_tokens": 1033672817.0, "step": 32388 }, { "entropy": 0.5170269263908267, "epoch": 2.9799598622204586, "grad_norm": 0.15849743783473969, "learning_rate": 6.716349250161008e-07, "loss": 0.5018, "mean_token_accuracy": 0.8384084701538086, "num_tokens": 1033705084.0, "step": 32389 }, { "entropy": 0.4999324092641473, "epoch": 2.9800518685919, "grad_norm": 0.15820729732513428, "learning_rate": 6.685680988744748e-07, "loss": 0.4903, "mean_token_accuracy": 0.8379489034414291, "num_tokens": 1033736897.0, "step": 32390 }, { "entropy": 0.5188646268798038, "epoch": 2.9801438749633413, "grad_norm": 0.15695111453533173, "learning_rate": 6.655012727328488e-07, "loss": 0.5028, "mean_token_accuracy": 0.8427647650241852, "num_tokens": 1033769230.0, "step": 32391 }, { "entropy": 0.5153922635363415, "epoch": 2.9802358813347825, "grad_norm": 0.16262952983379364, "learning_rate": 6.624344465912228e-07, "loss": 0.5049, "mean_token_accuracy": 0.8365371525287628, "num_tokens": 1033801307.0, "step": 32392 }, { "entropy": 0.5108836246654391, "epoch": 2.9803278877062236, "grad_norm": 0.15898142755031586, "learning_rate": 6.593676204495967e-07, "loss": 0.5068, "mean_token_accuracy": 0.8373308144509792, "num_tokens": 1033832879.0, "step": 32393 }, { "entropy": 0.5345505927689373, "epoch": 2.9804198940776647, "grad_norm": 0.1584562361240387, "learning_rate": 6.563007943079707e-07, "loss": 0.5252, "mean_token_accuracy": 0.8317182622849941, "num_tokens": 1033865039.0, "step": 32394 }, { "entropy": 0.47770991176366806, "epoch": 2.9805119004491063, "grad_norm": 0.151068776845932, "learning_rate": 6.532339681663447e-07, "loss": 0.4676, "mean_token_accuracy": 0.8498101457953453, "num_tokens": 1033896436.0, "step": 32395 }, { "entropy": 0.5272120493464172, "epoch": 2.9806039068205474, "grad_norm": 0.16224311292171478, "learning_rate": 6.501671420247187e-07, "loss": 0.5196, "mean_token_accuracy": 0.8370568603277206, "num_tokens": 1033927989.0, "step": 32396 }, { "entropy": 0.5333994266111404, "epoch": 2.9806959131919886, "grad_norm": 0.1563442498445511, "learning_rate": 6.471003158830926e-07, "loss": 0.5154, "mean_token_accuracy": 0.8350666724145412, "num_tokens": 1033960028.0, "step": 32397 }, { "entropy": 0.5128248082473874, "epoch": 2.9807879195634297, "grad_norm": 0.15992765128612518, "learning_rate": 6.440334897414666e-07, "loss": 0.4946, "mean_token_accuracy": 0.842837642878294, "num_tokens": 1033992136.0, "step": 32398 }, { "entropy": 0.5311938747763634, "epoch": 2.980879925934871, "grad_norm": 0.15865273773670197, "learning_rate": 6.409666635998405e-07, "loss": 0.511, "mean_token_accuracy": 0.8365944251418114, "num_tokens": 1034024107.0, "step": 32399 }, { "entropy": 0.49067461118102074, "epoch": 2.9809719323063124, "grad_norm": 0.15559089183807373, "learning_rate": 6.378998374582145e-07, "loss": 0.4775, "mean_token_accuracy": 0.8462906554341316, "num_tokens": 1034056005.0, "step": 32400 }, { "entropy": 0.600898802280426, "epoch": 2.9810639386777535, "grad_norm": 0.172745019197464, "learning_rate": 6.348330113165885e-07, "loss": 0.5984, "mean_token_accuracy": 0.8117482028901577, "num_tokens": 1034088447.0, "step": 32401 }, { "entropy": 0.5015659015625715, "epoch": 2.9811559450491947, "grad_norm": 0.1533370167016983, "learning_rate": 6.317661851749625e-07, "loss": 0.4874, "mean_token_accuracy": 0.8453106135129929, "num_tokens": 1034120670.0, "step": 32402 }, { "entropy": 0.5055651115253568, "epoch": 2.981247951420636, "grad_norm": 0.15512211620807648, "learning_rate": 6.286993590333365e-07, "loss": 0.4915, "mean_token_accuracy": 0.842899739742279, "num_tokens": 1034152995.0, "step": 32403 }, { "entropy": 0.5480817835777998, "epoch": 2.981339957792077, "grad_norm": 0.16276682913303375, "learning_rate": 6.256325328917104e-07, "loss": 0.5283, "mean_token_accuracy": 0.8326586149632931, "num_tokens": 1034183971.0, "step": 32404 }, { "entropy": 0.4380393009632826, "epoch": 2.9814319641635185, "grad_norm": 0.14590735733509064, "learning_rate": 6.225657067500844e-07, "loss": 0.4289, "mean_token_accuracy": 0.8641374632716179, "num_tokens": 1034215734.0, "step": 32405 }, { "entropy": 0.5036380048841238, "epoch": 2.9815239705349597, "grad_norm": 0.15923874080181122, "learning_rate": 6.194988806084583e-07, "loss": 0.4961, "mean_token_accuracy": 0.8413756377995014, "num_tokens": 1034247205.0, "step": 32406 }, { "entropy": 0.5122233163565397, "epoch": 2.981615976906401, "grad_norm": 0.1618775725364685, "learning_rate": 6.164320544668323e-07, "loss": 0.5152, "mean_token_accuracy": 0.8423952460289001, "num_tokens": 1034278415.0, "step": 32407 }, { "entropy": 0.47216995619237423, "epoch": 2.981707983277842, "grad_norm": 0.1492568850517273, "learning_rate": 6.133652283252062e-07, "loss": 0.4619, "mean_token_accuracy": 0.8522838316857815, "num_tokens": 1034311183.0, "step": 32408 }, { "entropy": 0.48691192362457514, "epoch": 2.981799989649283, "grad_norm": 0.15752644836902618, "learning_rate": 6.102984021835802e-07, "loss": 0.4727, "mean_token_accuracy": 0.8498133607208729, "num_tokens": 1034343263.0, "step": 32409 }, { "entropy": 0.4736970430240035, "epoch": 2.9818919960207246, "grad_norm": 0.15401691198349, "learning_rate": 6.072315760419541e-07, "loss": 0.4662, "mean_token_accuracy": 0.853071641176939, "num_tokens": 1034375508.0, "step": 32410 }, { "entropy": 0.5312348743900657, "epoch": 2.9819840023921658, "grad_norm": 0.1606704592704773, "learning_rate": 6.041647499003282e-07, "loss": 0.5186, "mean_token_accuracy": 0.8328997828066349, "num_tokens": 1034407500.0, "step": 32411 }, { "entropy": 0.5021482273004949, "epoch": 2.982076008763607, "grad_norm": 0.16126272082328796, "learning_rate": 6.010979237587022e-07, "loss": 0.4932, "mean_token_accuracy": 0.84629962220788, "num_tokens": 1034439093.0, "step": 32412 }, { "entropy": 0.5436648358590901, "epoch": 2.982168015135048, "grad_norm": 0.1628803163766861, "learning_rate": 5.980310976170761e-07, "loss": 0.5236, "mean_token_accuracy": 0.8311222419142723, "num_tokens": 1034470757.0, "step": 32413 }, { "entropy": 0.46428613690659404, "epoch": 2.982260021506489, "grad_norm": 0.1507827639579773, "learning_rate": 5.949642714754501e-07, "loss": 0.4465, "mean_token_accuracy": 0.856250386685133, "num_tokens": 1034503144.0, "step": 32414 }, { "entropy": 0.5087641859427094, "epoch": 2.9823520278779307, "grad_norm": 0.1608603447675705, "learning_rate": 5.918974453338241e-07, "loss": 0.4995, "mean_token_accuracy": 0.8397073373198509, "num_tokens": 1034534962.0, "step": 32415 }, { "entropy": 0.45786841213703156, "epoch": 2.982444034249372, "grad_norm": 0.1543562263250351, "learning_rate": 5.888306191921981e-07, "loss": 0.4511, "mean_token_accuracy": 0.8567524179816246, "num_tokens": 1034566579.0, "step": 32416 }, { "entropy": 0.5557301663793623, "epoch": 2.982536040620813, "grad_norm": 0.15800222754478455, "learning_rate": 5.85763793050572e-07, "loss": 0.5363, "mean_token_accuracy": 0.8290520198643208, "num_tokens": 1034598242.0, "step": 32417 }, { "entropy": 0.5351392191369087, "epoch": 2.982628046992254, "grad_norm": 0.16277658939361572, "learning_rate": 5.82696966908946e-07, "loss": 0.5289, "mean_token_accuracy": 0.8311499878764153, "num_tokens": 1034630692.0, "step": 32418 }, { "entropy": 0.5112783666700125, "epoch": 2.9827200533636953, "grad_norm": 0.15182967483997345, "learning_rate": 5.796301407673199e-07, "loss": 0.495, "mean_token_accuracy": 0.843654926866293, "num_tokens": 1034662508.0, "step": 32419 }, { "entropy": 0.5833793114870787, "epoch": 2.982812059735137, "grad_norm": 0.1681280881166458, "learning_rate": 5.76563314625694e-07, "loss": 0.5784, "mean_token_accuracy": 0.8179415315389633, "num_tokens": 1034694513.0, "step": 32420 }, { "entropy": 0.47089724033139646, "epoch": 2.982904066106578, "grad_norm": 0.15425701439380646, "learning_rate": 5.734964884840679e-07, "loss": 0.4601, "mean_token_accuracy": 0.8531941697001457, "num_tokens": 1034726573.0, "step": 32421 }, { "entropy": 0.43106127879582345, "epoch": 2.982996072478019, "grad_norm": 0.14276200532913208, "learning_rate": 5.704296623424419e-07, "loss": 0.4154, "mean_token_accuracy": 0.8693778999149799, "num_tokens": 1034758581.0, "step": 32422 }, { "entropy": 0.4958057962357998, "epoch": 2.9830880788494603, "grad_norm": 0.1542145162820816, "learning_rate": 5.673628362008158e-07, "loss": 0.4779, "mean_token_accuracy": 0.8453873321413994, "num_tokens": 1034790381.0, "step": 32423 }, { "entropy": 0.48020518384873867, "epoch": 2.9831800852209014, "grad_norm": 0.1485714614391327, "learning_rate": 5.642960100591898e-07, "loss": 0.4725, "mean_token_accuracy": 0.8514685109257698, "num_tokens": 1034822763.0, "step": 32424 }, { "entropy": 0.5214766198769212, "epoch": 2.983272091592343, "grad_norm": 0.1548001915216446, "learning_rate": 5.612291839175637e-07, "loss": 0.4923, "mean_token_accuracy": 0.8436683192849159, "num_tokens": 1034853649.0, "step": 32425 }, { "entropy": 0.4134130470920354, "epoch": 2.983364097963784, "grad_norm": 0.13942936062812805, "learning_rate": 5.581623577759377e-07, "loss": 0.391, "mean_token_accuracy": 0.8705797269940376, "num_tokens": 1034885289.0, "step": 32426 }, { "entropy": 0.532732049934566, "epoch": 2.9834561043352252, "grad_norm": 0.16073979437351227, "learning_rate": 5.550955316343117e-07, "loss": 0.5191, "mean_token_accuracy": 0.8363544940948486, "num_tokens": 1034917458.0, "step": 32427 }, { "entropy": 0.49507930176332593, "epoch": 2.9835481107066664, "grad_norm": 0.14904631674289703, "learning_rate": 5.520287054926856e-07, "loss": 0.4727, "mean_token_accuracy": 0.8501357398927212, "num_tokens": 1034949579.0, "step": 32428 }, { "entropy": 0.42733982810750604, "epoch": 2.9836401170781075, "grad_norm": 0.14411622285842896, "learning_rate": 5.489618793510596e-07, "loss": 0.4096, "mean_token_accuracy": 0.8714241199195385, "num_tokens": 1034981606.0, "step": 32429 }, { "entropy": 0.4476691447198391, "epoch": 2.983732123449549, "grad_norm": 0.1464494913816452, "learning_rate": 5.458950532094335e-07, "loss": 0.4348, "mean_token_accuracy": 0.8627040199935436, "num_tokens": 1035013326.0, "step": 32430 }, { "entropy": 0.48783194413408637, "epoch": 2.98382412982099, "grad_norm": 0.15200676023960114, "learning_rate": 5.428282270678076e-07, "loss": 0.474, "mean_token_accuracy": 0.8491176925599575, "num_tokens": 1035045652.0, "step": 32431 }, { "entropy": 0.49444226175546646, "epoch": 2.9839161361924313, "grad_norm": 0.1558907926082611, "learning_rate": 5.397614009261815e-07, "loss": 0.4804, "mean_token_accuracy": 0.8438982702791691, "num_tokens": 1035077934.0, "step": 32432 }, { "entropy": 0.5037533710710704, "epoch": 2.9840081425638725, "grad_norm": 0.16043145954608917, "learning_rate": 5.366945747845555e-07, "loss": 0.4918, "mean_token_accuracy": 0.8389142528176308, "num_tokens": 1035109526.0, "step": 32433 }, { "entropy": 0.5275922371074557, "epoch": 2.9841001489353136, "grad_norm": 0.16426421701908112, "learning_rate": 5.336277486429294e-07, "loss": 0.529, "mean_token_accuracy": 0.8329727984964848, "num_tokens": 1035140399.0, "step": 32434 }, { "entropy": 0.48451465368270874, "epoch": 2.984192155306755, "grad_norm": 0.15208663046360016, "learning_rate": 5.305609225013035e-07, "loss": 0.4676, "mean_token_accuracy": 0.8503731414675713, "num_tokens": 1035172707.0, "step": 32435 }, { "entropy": 0.5183189865201712, "epoch": 2.9842841616781963, "grad_norm": 0.15731850266456604, "learning_rate": 5.274940963596774e-07, "loss": 0.5073, "mean_token_accuracy": 0.8438038043677807, "num_tokens": 1035204898.0, "step": 32436 }, { "entropy": 0.5209946222603321, "epoch": 2.9843761680496375, "grad_norm": 0.16736666858196259, "learning_rate": 5.244272702180514e-07, "loss": 0.5097, "mean_token_accuracy": 0.8339290283620358, "num_tokens": 1035236427.0, "step": 32437 }, { "entropy": 0.5579792829230428, "epoch": 2.9844681744210786, "grad_norm": 0.16063867509365082, "learning_rate": 5.213604440764253e-07, "loss": 0.5403, "mean_token_accuracy": 0.8277308791875839, "num_tokens": 1035268424.0, "step": 32438 }, { "entropy": 0.48381583066657186, "epoch": 2.9845601807925197, "grad_norm": 0.15525005757808685, "learning_rate": 5.182936179347993e-07, "loss": 0.467, "mean_token_accuracy": 0.8498439602553844, "num_tokens": 1035300281.0, "step": 32439 }, { "entropy": 0.5619140658527613, "epoch": 2.9846521871639613, "grad_norm": 0.1635187268257141, "learning_rate": 5.152267917931732e-07, "loss": 0.5561, "mean_token_accuracy": 0.8281073607504368, "num_tokens": 1035332677.0, "step": 32440 }, { "entropy": 0.4576850577723235, "epoch": 2.9847441935354024, "grad_norm": 0.15399593114852905, "learning_rate": 5.121599656515473e-07, "loss": 0.4517, "mean_token_accuracy": 0.8561508245766163, "num_tokens": 1035363909.0, "step": 32441 }, { "entropy": 0.4891635235399008, "epoch": 2.9848361999068436, "grad_norm": 0.15664450824260712, "learning_rate": 5.090931395099213e-07, "loss": 0.481, "mean_token_accuracy": 0.8482675403356552, "num_tokens": 1035396418.0, "step": 32442 }, { "entropy": 0.518792262300849, "epoch": 2.9849282062782847, "grad_norm": 0.16215862333774567, "learning_rate": 5.060263133682952e-07, "loss": 0.5108, "mean_token_accuracy": 0.835899256169796, "num_tokens": 1035428123.0, "step": 32443 }, { "entropy": 0.5640861731953919, "epoch": 2.985020212649726, "grad_norm": 0.16569873690605164, "learning_rate": 5.029594872266692e-07, "loss": 0.5422, "mean_token_accuracy": 0.8276932090520859, "num_tokens": 1035459535.0, "step": 32444 }, { "entropy": 0.5352602172642946, "epoch": 2.9851122190211674, "grad_norm": 0.15956901013851166, "learning_rate": 4.998926610850431e-07, "loss": 0.5184, "mean_token_accuracy": 0.8345181979238987, "num_tokens": 1035491888.0, "step": 32445 }, { "entropy": 0.5276532471179962, "epoch": 2.9852042253926085, "grad_norm": 0.15406645834445953, "learning_rate": 4.968258349434171e-07, "loss": 0.5112, "mean_token_accuracy": 0.8392791859805584, "num_tokens": 1035523656.0, "step": 32446 }, { "entropy": 0.4452056121081114, "epoch": 2.9852962317640497, "grad_norm": 0.1429823487997055, "learning_rate": 4.93759008801791e-07, "loss": 0.4356, "mean_token_accuracy": 0.8612748980522156, "num_tokens": 1035556395.0, "step": 32447 }, { "entropy": 0.5504662431776524, "epoch": 2.985388238135491, "grad_norm": 0.16591575741767883, "learning_rate": 4.90692182660165e-07, "loss": 0.5435, "mean_token_accuracy": 0.8289615213871002, "num_tokens": 1035588800.0, "step": 32448 }, { "entropy": 0.5442882813513279, "epoch": 2.985480244506932, "grad_norm": 0.16162005066871643, "learning_rate": 4.876253565185389e-07, "loss": 0.5262, "mean_token_accuracy": 0.831499245017767, "num_tokens": 1035621314.0, "step": 32449 }, { "entropy": 0.5040675206109881, "epoch": 2.9855722508783735, "grad_norm": 0.16049279272556305, "learning_rate": 4.845585303769129e-07, "loss": 0.4915, "mean_token_accuracy": 0.8463453687727451, "num_tokens": 1035652940.0, "step": 32450 }, { "entropy": 0.48174608778208494, "epoch": 2.9856642572498147, "grad_norm": 0.15753601491451263, "learning_rate": 4.81491704235287e-07, "loss": 0.47, "mean_token_accuracy": 0.849089901894331, "num_tokens": 1035684216.0, "step": 32451 }, { "entropy": 0.5451541263610125, "epoch": 2.985756263621256, "grad_norm": 0.16259737312793732, "learning_rate": 4.784248780936609e-07, "loss": 0.5325, "mean_token_accuracy": 0.8334095291793346, "num_tokens": 1035716768.0, "step": 32452 }, { "entropy": 0.4907906934386119, "epoch": 2.985848269992697, "grad_norm": 0.14767985045909882, "learning_rate": 4.753580519520348e-07, "loss": 0.4721, "mean_token_accuracy": 0.8511421009898186, "num_tokens": 1035749107.0, "step": 32453 }, { "entropy": 0.508453257381916, "epoch": 2.985940276364138, "grad_norm": 0.15876604616641998, "learning_rate": 4.722912258104088e-07, "loss": 0.5081, "mean_token_accuracy": 0.836811039596796, "num_tokens": 1035781083.0, "step": 32454 }, { "entropy": 0.5439638067036867, "epoch": 2.9860322827355796, "grad_norm": 0.1715569943189621, "learning_rate": 4.6922439966878274e-07, "loss": 0.5271, "mean_token_accuracy": 0.8363178707659245, "num_tokens": 1035811862.0, "step": 32455 }, { "entropy": 0.5053128153085709, "epoch": 2.9861242891070208, "grad_norm": 0.16296438872814178, "learning_rate": 4.661575735271568e-07, "loss": 0.4931, "mean_token_accuracy": 0.8411299772560596, "num_tokens": 1035843266.0, "step": 32456 }, { "entropy": 0.46998933143913746, "epoch": 2.986216295478462, "grad_norm": 0.1516619622707367, "learning_rate": 4.6309074738553076e-07, "loss": 0.4512, "mean_token_accuracy": 0.8562774658203125, "num_tokens": 1035875356.0, "step": 32457 }, { "entropy": 0.43248677952215075, "epoch": 2.986308301849903, "grad_norm": 0.1472802460193634, "learning_rate": 4.600239212439047e-07, "loss": 0.4293, "mean_token_accuracy": 0.8615469373762608, "num_tokens": 1035907915.0, "step": 32458 }, { "entropy": 0.4088680420536548, "epoch": 2.986400308221344, "grad_norm": 0.1489328294992447, "learning_rate": 4.569570951022787e-07, "loss": 0.3995, "mean_token_accuracy": 0.871172595769167, "num_tokens": 1035940052.0, "step": 32459 }, { "entropy": 0.45934921968728304, "epoch": 2.9864923145927857, "grad_norm": 0.15381614863872528, "learning_rate": 4.5389026896065264e-07, "loss": 0.4563, "mean_token_accuracy": 0.8537452667951584, "num_tokens": 1035972257.0, "step": 32460 }, { "entropy": 0.4884538119658828, "epoch": 2.986584320964227, "grad_norm": 0.14908434450626373, "learning_rate": 4.5082344281902665e-07, "loss": 0.479, "mean_token_accuracy": 0.8489637076854706, "num_tokens": 1036004846.0, "step": 32461 }, { "entropy": 0.4258498589042574, "epoch": 2.986676327335668, "grad_norm": 0.1438973993062973, "learning_rate": 4.477566166774006e-07, "loss": 0.4131, "mean_token_accuracy": 0.8689714558422565, "num_tokens": 1036036631.0, "step": 32462 }, { "entropy": 0.41494948975741863, "epoch": 2.986768333707109, "grad_norm": 0.14181436598300934, "learning_rate": 4.4468979053577457e-07, "loss": 0.4008, "mean_token_accuracy": 0.8724239878356457, "num_tokens": 1036069186.0, "step": 32463 }, { "entropy": 0.5779502540826797, "epoch": 2.9868603400785503, "grad_norm": 0.1675933599472046, "learning_rate": 4.4162296439414853e-07, "loss": 0.5732, "mean_token_accuracy": 0.8168110139667988, "num_tokens": 1036101081.0, "step": 32464 }, { "entropy": 0.5840766374021769, "epoch": 2.986952346449992, "grad_norm": 0.16748476028442383, "learning_rate": 4.385561382525225e-07, "loss": 0.5716, "mean_token_accuracy": 0.8178421184420586, "num_tokens": 1036133502.0, "step": 32465 }, { "entropy": 0.3054589161183685, "epoch": 2.987044352821433, "grad_norm": 0.12545467913150787, "learning_rate": 4.3548931211089645e-07, "loss": 0.2812, "mean_token_accuracy": 0.9048275947570801, "num_tokens": 1036164567.0, "step": 32466 }, { "entropy": 0.45418372098356485, "epoch": 2.987136359192874, "grad_norm": 0.15009424090385437, "learning_rate": 4.324224859692704e-07, "loss": 0.4389, "mean_token_accuracy": 0.8586706891655922, "num_tokens": 1036196328.0, "step": 32467 }, { "entropy": 0.5617285231128335, "epoch": 2.9872283655643153, "grad_norm": 0.1659560203552246, "learning_rate": 4.2935565982764437e-07, "loss": 0.5407, "mean_token_accuracy": 0.8313969410955906, "num_tokens": 1036228637.0, "step": 32468 }, { "entropy": 0.4577325638383627, "epoch": 2.9873203719357564, "grad_norm": 0.14699050784111023, "learning_rate": 4.262888336860183e-07, "loss": 0.4443, "mean_token_accuracy": 0.8584665507078171, "num_tokens": 1036261148.0, "step": 32469 }, { "entropy": 0.4761097077280283, "epoch": 2.987412378307198, "grad_norm": 0.1524362862110138, "learning_rate": 4.232220075443923e-07, "loss": 0.4573, "mean_token_accuracy": 0.8513114601373672, "num_tokens": 1036292977.0, "step": 32470 }, { "entropy": 0.4344371429178864, "epoch": 2.987504384678639, "grad_norm": 0.14225421845912933, "learning_rate": 4.201551814027663e-07, "loss": 0.4255, "mean_token_accuracy": 0.8671648874878883, "num_tokens": 1036325397.0, "step": 32471 }, { "entropy": 0.5290812011808157, "epoch": 2.9875963910500802, "grad_norm": 0.16516035795211792, "learning_rate": 4.1708835526114026e-07, "loss": 0.5211, "mean_token_accuracy": 0.8339022472500801, "num_tokens": 1036356574.0, "step": 32472 }, { "entropy": 0.529133060015738, "epoch": 2.9876883974215214, "grad_norm": 0.15680481493473053, "learning_rate": 4.140215291195142e-07, "loss": 0.5199, "mean_token_accuracy": 0.8331286534667015, "num_tokens": 1036388564.0, "step": 32473 }, { "entropy": 0.6212648991495371, "epoch": 2.9877804037929625, "grad_norm": 0.1682511270046234, "learning_rate": 4.109547029778882e-07, "loss": 0.6104, "mean_token_accuracy": 0.8095633573830128, "num_tokens": 1036420610.0, "step": 32474 }, { "entropy": 0.447754240129143, "epoch": 2.987872410164404, "grad_norm": 0.1482512205839157, "learning_rate": 4.0788787683626214e-07, "loss": 0.4401, "mean_token_accuracy": 0.8587283939123154, "num_tokens": 1036452989.0, "step": 32475 }, { "entropy": 0.46582782082259655, "epoch": 2.987964416535845, "grad_norm": 0.14510758221149445, "learning_rate": 4.048210506946362e-07, "loss": 0.4447, "mean_token_accuracy": 0.8555235005915165, "num_tokens": 1036485299.0, "step": 32476 }, { "entropy": 0.5384462028741837, "epoch": 2.9880564229072863, "grad_norm": 0.1588117927312851, "learning_rate": 4.0175422455301016e-07, "loss": 0.5217, "mean_token_accuracy": 0.8358105197548866, "num_tokens": 1036517073.0, "step": 32477 }, { "entropy": 0.49430576991289854, "epoch": 2.9881484292787275, "grad_norm": 0.15566784143447876, "learning_rate": 3.986873984113841e-07, "loss": 0.4843, "mean_token_accuracy": 0.8454501442611217, "num_tokens": 1036549589.0, "step": 32478 }, { "entropy": 0.41917638247832656, "epoch": 2.9882404356501686, "grad_norm": 0.14956212043762207, "learning_rate": 3.956205722697581e-07, "loss": 0.4103, "mean_token_accuracy": 0.8696881234645844, "num_tokens": 1036581013.0, "step": 32479 }, { "entropy": 0.5485188630409539, "epoch": 2.98833244202161, "grad_norm": 0.1594991832971573, "learning_rate": 3.9255374612813204e-07, "loss": 0.5363, "mean_token_accuracy": 0.8339180424809456, "num_tokens": 1036613325.0, "step": 32480 }, { "entropy": 0.45450872578658164, "epoch": 2.9884244483930513, "grad_norm": 0.14976361393928528, "learning_rate": 3.89486919986506e-07, "loss": 0.4435, "mean_token_accuracy": 0.857601772993803, "num_tokens": 1036645773.0, "step": 32481 }, { "entropy": 0.5655024461448193, "epoch": 2.9885164547644925, "grad_norm": 0.16473664343357086, "learning_rate": 3.8642009384487996e-07, "loss": 0.5559, "mean_token_accuracy": 0.8247174136340618, "num_tokens": 1036678159.0, "step": 32482 }, { "entropy": 0.4739213725551963, "epoch": 2.9886084611359336, "grad_norm": 0.15590094029903412, "learning_rate": 3.833532677032539e-07, "loss": 0.4618, "mean_token_accuracy": 0.8537748456001282, "num_tokens": 1036709610.0, "step": 32483 }, { "entropy": 0.5685183797031641, "epoch": 2.9887004675073747, "grad_norm": 0.16482920944690704, "learning_rate": 3.802864415616279e-07, "loss": 0.5584, "mean_token_accuracy": 0.8289441429078579, "num_tokens": 1036741467.0, "step": 32484 }, { "entropy": 0.5019770488142967, "epoch": 2.9887924738788163, "grad_norm": 0.16034694015979767, "learning_rate": 3.772196154200019e-07, "loss": 0.4964, "mean_token_accuracy": 0.8445442989468575, "num_tokens": 1036773624.0, "step": 32485 }, { "entropy": 0.5086040599271655, "epoch": 2.9888844802502574, "grad_norm": 0.16040977835655212, "learning_rate": 3.7415278927837585e-07, "loss": 0.4923, "mean_token_accuracy": 0.8416010737419128, "num_tokens": 1036805592.0, "step": 32486 }, { "entropy": 0.46376107539981604, "epoch": 2.9889764866216986, "grad_norm": 0.15286992490291595, "learning_rate": 3.710859631367498e-07, "loss": 0.4533, "mean_token_accuracy": 0.857163067907095, "num_tokens": 1036837926.0, "step": 32487 }, { "entropy": 0.4949878789484501, "epoch": 2.9890684929931397, "grad_norm": 0.1534898728132248, "learning_rate": 3.6801913699512377e-07, "loss": 0.4889, "mean_token_accuracy": 0.8476954065263271, "num_tokens": 1036869778.0, "step": 32488 }, { "entropy": 0.38793920748867095, "epoch": 2.989160499364581, "grad_norm": 0.13799548149108887, "learning_rate": 3.649523108534977e-07, "loss": 0.3823, "mean_token_accuracy": 0.8804032988846302, "num_tokens": 1036902247.0, "step": 32489 }, { "entropy": 0.5523587029892951, "epoch": 2.9892525057360224, "grad_norm": 0.1640305519104004, "learning_rate": 3.618854847118717e-07, "loss": 0.5371, "mean_token_accuracy": 0.8294119201600552, "num_tokens": 1036934047.0, "step": 32490 }, { "entropy": 0.56776072550565, "epoch": 2.9893445121074635, "grad_norm": 0.1679437756538391, "learning_rate": 3.588186585702457e-07, "loss": 0.5558, "mean_token_accuracy": 0.8265392407774925, "num_tokens": 1036966435.0, "step": 32491 }, { "entropy": 0.5500362385064363, "epoch": 2.9894365184789047, "grad_norm": 0.16117210686206818, "learning_rate": 3.5575183242861966e-07, "loss": 0.5396, "mean_token_accuracy": 0.8269031532108784, "num_tokens": 1036998511.0, "step": 32492 }, { "entropy": 0.6030830880627036, "epoch": 2.989528524850346, "grad_norm": 0.16925545036792755, "learning_rate": 3.526850062869936e-07, "loss": 0.5945, "mean_token_accuracy": 0.8118065185844898, "num_tokens": 1037030811.0, "step": 32493 }, { "entropy": 0.5552235515788198, "epoch": 2.989620531221787, "grad_norm": 0.1612447053194046, "learning_rate": 3.496181801453676e-07, "loss": 0.5467, "mean_token_accuracy": 0.8284021094441414, "num_tokens": 1037062373.0, "step": 32494 }, { "entropy": 0.5030144779011607, "epoch": 2.9897125375932285, "grad_norm": 0.1611350029706955, "learning_rate": 3.4655135400374153e-07, "loss": 0.4967, "mean_token_accuracy": 0.8448388613760471, "num_tokens": 1037094589.0, "step": 32495 }, { "entropy": 0.5601963207591325, "epoch": 2.9898045439646697, "grad_norm": 0.1629462093114853, "learning_rate": 3.434845278621155e-07, "loss": 0.5435, "mean_token_accuracy": 0.83073665574193, "num_tokens": 1037126387.0, "step": 32496 }, { "entropy": 0.619656153023243, "epoch": 2.989896550336111, "grad_norm": 0.16777384281158447, "learning_rate": 3.4041770172048945e-07, "loss": 0.6115, "mean_token_accuracy": 0.8144576326012611, "num_tokens": 1037157541.0, "step": 32497 }, { "entropy": 0.6053085448220372, "epoch": 2.989988556707552, "grad_norm": 0.1675145924091339, "learning_rate": 3.3735087557886347e-07, "loss": 0.5908, "mean_token_accuracy": 0.8134604878723621, "num_tokens": 1037189513.0, "step": 32498 }, { "entropy": 0.4810337023809552, "epoch": 2.990080563078993, "grad_norm": 0.1516447365283966, "learning_rate": 3.342840494372374e-07, "loss": 0.4684, "mean_token_accuracy": 0.8501156643033028, "num_tokens": 1037222000.0, "step": 32499 }, { "entropy": 0.4512067511677742, "epoch": 2.9901725694504346, "grad_norm": 0.15003550052642822, "learning_rate": 3.312172232956114e-07, "loss": 0.425, "mean_token_accuracy": 0.8621104657649994, "num_tokens": 1037253244.0, "step": 32500 }, { "entropy": 0.5768688470125198, "epoch": 2.9902645758218758, "grad_norm": 0.1649358868598938, "learning_rate": 3.2815039715398534e-07, "loss": 0.5628, "mean_token_accuracy": 0.8213451616466045, "num_tokens": 1037285255.0, "step": 32501 }, { "entropy": 0.4624253618530929, "epoch": 2.990356582193317, "grad_norm": 0.15265107154846191, "learning_rate": 3.2508357101235936e-07, "loss": 0.4559, "mean_token_accuracy": 0.8561736047267914, "num_tokens": 1037317441.0, "step": 32502 }, { "entropy": 0.4578947069821879, "epoch": 2.990448588564758, "grad_norm": 0.14729756116867065, "learning_rate": 3.220167448707333e-07, "loss": 0.4446, "mean_token_accuracy": 0.8589144013822079, "num_tokens": 1037349883.0, "step": 32503 }, { "entropy": 0.43758129701018333, "epoch": 2.990540594936199, "grad_norm": 0.14759521186351776, "learning_rate": 3.189499187291073e-07, "loss": 0.4282, "mean_token_accuracy": 0.8664525113999844, "num_tokens": 1037381508.0, "step": 32504 }, { "entropy": 0.5367978224530816, "epoch": 2.9906326013076407, "grad_norm": 0.16238008439540863, "learning_rate": 3.1588309258748123e-07, "loss": 0.5258, "mean_token_accuracy": 0.8353521674871445, "num_tokens": 1037413828.0, "step": 32505 }, { "entropy": 0.4409590009599924, "epoch": 2.990724607679082, "grad_norm": 0.14758096635341644, "learning_rate": 3.128162664458552e-07, "loss": 0.4247, "mean_token_accuracy": 0.8654706366360188, "num_tokens": 1037445914.0, "step": 32506 }, { "entropy": 0.4018377379979938, "epoch": 2.990816614050523, "grad_norm": 0.14356312155723572, "learning_rate": 3.0974944030422915e-07, "loss": 0.3864, "mean_token_accuracy": 0.876817874610424, "num_tokens": 1037477634.0, "step": 32507 }, { "entropy": 0.5643242616206408, "epoch": 2.990908620421964, "grad_norm": 0.16376373171806335, "learning_rate": 3.066826141626031e-07, "loss": 0.5556, "mean_token_accuracy": 0.8259813115000725, "num_tokens": 1037509874.0, "step": 32508 }, { "entropy": 0.4620575502049178, "epoch": 2.9910006267934053, "grad_norm": 0.15229657292366028, "learning_rate": 3.0361578802097707e-07, "loss": 0.4433, "mean_token_accuracy": 0.8572931326925755, "num_tokens": 1037541413.0, "step": 32509 }, { "entropy": 0.5012321984395385, "epoch": 2.991092633164847, "grad_norm": 0.16120034456253052, "learning_rate": 3.005489618793511e-07, "loss": 0.4894, "mean_token_accuracy": 0.8459660559892654, "num_tokens": 1037572975.0, "step": 32510 }, { "entropy": 0.4926568267401308, "epoch": 2.991184639536288, "grad_norm": 0.15445098280906677, "learning_rate": 2.9748213573772504e-07, "loss": 0.4907, "mean_token_accuracy": 0.8472104854881763, "num_tokens": 1037605405.0, "step": 32511 }, { "entropy": 0.6311904875328764, "epoch": 2.991276645907729, "grad_norm": 0.171850323677063, "learning_rate": 2.9441530959609905e-07, "loss": 0.6332, "mean_token_accuracy": 0.8006501011550426, "num_tokens": 1037637647.0, "step": 32512 }, { "entropy": 0.5601234700297937, "epoch": 2.9913686522791703, "grad_norm": 0.1633949726819992, "learning_rate": 2.91348483454473e-07, "loss": 0.541, "mean_token_accuracy": 0.8293094523251057, "num_tokens": 1037668907.0, "step": 32513 }, { "entropy": 0.5011802716180682, "epoch": 2.9914606586506114, "grad_norm": 0.15292884409427643, "learning_rate": 2.88281657312847e-07, "loss": 0.4823, "mean_token_accuracy": 0.8433573320508003, "num_tokens": 1037701050.0, "step": 32514 }, { "entropy": 0.5212602252140641, "epoch": 2.991552665022053, "grad_norm": 0.1619303673505783, "learning_rate": 2.8521483117122093e-07, "loss": 0.516, "mean_token_accuracy": 0.8377443440258503, "num_tokens": 1037732840.0, "step": 32515 }, { "entropy": 0.4585135008674115, "epoch": 2.991644671393494, "grad_norm": 0.15441235899925232, "learning_rate": 2.821480050295949e-07, "loss": 0.4387, "mean_token_accuracy": 0.8553984314203262, "num_tokens": 1037763465.0, "step": 32516 }, { "entropy": 0.5172540536150336, "epoch": 2.9917366777649352, "grad_norm": 0.15850549936294556, "learning_rate": 2.7908117888796885e-07, "loss": 0.5038, "mean_token_accuracy": 0.8399342969059944, "num_tokens": 1037795388.0, "step": 32517 }, { "entropy": 0.4056778568774462, "epoch": 2.9918286841363764, "grad_norm": 0.13648779690265656, "learning_rate": 2.760143527463428e-07, "loss": 0.3835, "mean_token_accuracy": 0.8746361806988716, "num_tokens": 1037827265.0, "step": 32518 }, { "entropy": 0.458367726765573, "epoch": 2.9919206905078175, "grad_norm": 0.15138812363147736, "learning_rate": 2.7294752660471677e-07, "loss": 0.4449, "mean_token_accuracy": 0.8584590181708336, "num_tokens": 1037859886.0, "step": 32519 }, { "entropy": 0.564876414835453, "epoch": 2.992012696879259, "grad_norm": 0.16065166890621185, "learning_rate": 2.6988070046309073e-07, "loss": 0.5434, "mean_token_accuracy": 0.8245764970779419, "num_tokens": 1037891588.0, "step": 32520 }, { "entropy": 0.4600023290840909, "epoch": 2.9921047032507, "grad_norm": 0.15312615036964417, "learning_rate": 2.668138743214647e-07, "loss": 0.4462, "mean_token_accuracy": 0.8585522919893265, "num_tokens": 1037923188.0, "step": 32521 }, { "entropy": 0.5307360012084246, "epoch": 2.9921967096221413, "grad_norm": 0.1624392867088318, "learning_rate": 2.637470481798387e-07, "loss": 0.5225, "mean_token_accuracy": 0.8326991610229015, "num_tokens": 1037955437.0, "step": 32522 }, { "entropy": 0.5113668564008549, "epoch": 2.9922887159935825, "grad_norm": 0.15242670476436615, "learning_rate": 2.6068022203821266e-07, "loss": 0.5028, "mean_token_accuracy": 0.8414390310645103, "num_tokens": 1037987715.0, "step": 32523 }, { "entropy": 0.4935246976092458, "epoch": 2.9923807223650236, "grad_norm": 0.1616232544183731, "learning_rate": 2.576133958965866e-07, "loss": 0.4859, "mean_token_accuracy": 0.8451517857611179, "num_tokens": 1038019084.0, "step": 32524 }, { "entropy": 0.43808496720157564, "epoch": 2.992472728736465, "grad_norm": 0.14740405976772308, "learning_rate": 2.5454656975496063e-07, "loss": 0.4324, "mean_token_accuracy": 0.861184936016798, "num_tokens": 1038051366.0, "step": 32525 }, { "entropy": 0.4897879003547132, "epoch": 2.9925647351079063, "grad_norm": 0.1518833041191101, "learning_rate": 2.514797436133346e-07, "loss": 0.4746, "mean_token_accuracy": 0.8491738215088844, "num_tokens": 1038083699.0, "step": 32526 }, { "entropy": 0.5617822166532278, "epoch": 2.9926567414793475, "grad_norm": 0.16409268975257874, "learning_rate": 2.4841291747170855e-07, "loss": 0.5431, "mean_token_accuracy": 0.8266457244753838, "num_tokens": 1038115350.0, "step": 32527 }, { "entropy": 0.4918698398396373, "epoch": 2.9927487478507886, "grad_norm": 0.15508981049060822, "learning_rate": 2.453460913300825e-07, "loss": 0.4762, "mean_token_accuracy": 0.8472187221050262, "num_tokens": 1038147146.0, "step": 32528 }, { "entropy": 0.383085492067039, "epoch": 2.9928407542222297, "grad_norm": 0.13845953345298767, "learning_rate": 2.4227926518845647e-07, "loss": 0.3676, "mean_token_accuracy": 0.8817590847611427, "num_tokens": 1038179299.0, "step": 32529 }, { "entropy": 0.42966079618781805, "epoch": 2.9929327605936713, "grad_norm": 0.15027639269828796, "learning_rate": 2.3921243904683043e-07, "loss": 0.423, "mean_token_accuracy": 0.8634446486830711, "num_tokens": 1038211532.0, "step": 32530 }, { "entropy": 0.45595214422792196, "epoch": 2.9930247669651124, "grad_norm": 0.15411965548992157, "learning_rate": 2.361456129052044e-07, "loss": 0.4413, "mean_token_accuracy": 0.8571213334798813, "num_tokens": 1038243025.0, "step": 32531 }, { "entropy": 0.4032047837972641, "epoch": 2.9931167733365536, "grad_norm": 0.14654335379600525, "learning_rate": 2.330787867635784e-07, "loss": 0.3895, "mean_token_accuracy": 0.873693935573101, "num_tokens": 1038273863.0, "step": 32532 }, { "entropy": 0.47856413573026657, "epoch": 2.9932087797079947, "grad_norm": 0.15280979871749878, "learning_rate": 2.3001196062195236e-07, "loss": 0.4706, "mean_token_accuracy": 0.8503470942378044, "num_tokens": 1038306022.0, "step": 32533 }, { "entropy": 0.5457407347857952, "epoch": 2.993300786079436, "grad_norm": 0.1578868329524994, "learning_rate": 2.2694513448032632e-07, "loss": 0.5407, "mean_token_accuracy": 0.8305842652916908, "num_tokens": 1038338364.0, "step": 32534 }, { "entropy": 0.5068913102149963, "epoch": 2.9933927924508774, "grad_norm": 0.1527256965637207, "learning_rate": 2.238783083387003e-07, "loss": 0.4957, "mean_token_accuracy": 0.8445498235523701, "num_tokens": 1038370557.0, "step": 32535 }, { "entropy": 0.4411937119439244, "epoch": 2.9934847988223185, "grad_norm": 0.15043559670448303, "learning_rate": 2.2081148219707426e-07, "loss": 0.4262, "mean_token_accuracy": 0.8611917346715927, "num_tokens": 1038402344.0, "step": 32536 }, { "entropy": 0.5175738674588501, "epoch": 2.9935768051937597, "grad_norm": 0.16315248608589172, "learning_rate": 2.1774465605544822e-07, "loss": 0.4933, "mean_token_accuracy": 0.8400431722402573, "num_tokens": 1038433659.0, "step": 32537 }, { "entropy": 0.5388886630535126, "epoch": 2.993668811565201, "grad_norm": 0.16030704975128174, "learning_rate": 2.1467782991382218e-07, "loss": 0.5181, "mean_token_accuracy": 0.8367697857320309, "num_tokens": 1038466064.0, "step": 32538 }, { "entropy": 0.45815816475078464, "epoch": 2.993760817936642, "grad_norm": 0.14799827337265015, "learning_rate": 2.1161100377219614e-07, "loss": 0.4421, "mean_token_accuracy": 0.8589058183133602, "num_tokens": 1038498336.0, "step": 32539 }, { "entropy": 0.5313301337882876, "epoch": 2.9938528243080835, "grad_norm": 0.15383802354335785, "learning_rate": 2.0854417763057013e-07, "loss": 0.5151, "mean_token_accuracy": 0.8368460200726986, "num_tokens": 1038530828.0, "step": 32540 }, { "entropy": 0.5360145694576204, "epoch": 2.9939448306795247, "grad_norm": 0.15896502137184143, "learning_rate": 2.054773514889441e-07, "loss": 0.5174, "mean_token_accuracy": 0.8343473002314568, "num_tokens": 1038562769.0, "step": 32541 }, { "entropy": 0.4604075066745281, "epoch": 2.994036837050966, "grad_norm": 0.1521497666835785, "learning_rate": 2.024105253473181e-07, "loss": 0.4461, "mean_token_accuracy": 0.8567976802587509, "num_tokens": 1038594720.0, "step": 32542 }, { "entropy": 0.544972438365221, "epoch": 2.994128843422407, "grad_norm": 0.16226300597190857, "learning_rate": 1.9934369920569206e-07, "loss": 0.5359, "mean_token_accuracy": 0.829968772828579, "num_tokens": 1038626766.0, "step": 32543 }, { "entropy": 0.5589906955137849, "epoch": 2.994220849793848, "grad_norm": 0.16654044389724731, "learning_rate": 1.9627687306406602e-07, "loss": 0.5411, "mean_token_accuracy": 0.827381145209074, "num_tokens": 1038658146.0, "step": 32544 }, { "entropy": 0.5228387527167797, "epoch": 2.9943128561652896, "grad_norm": 0.15996070206165314, "learning_rate": 1.9321004692243998e-07, "loss": 0.5136, "mean_token_accuracy": 0.8375005461275578, "num_tokens": 1038690594.0, "step": 32545 }, { "entropy": 0.4629976721480489, "epoch": 2.9944048625367308, "grad_norm": 0.15012411773204803, "learning_rate": 1.9014322078081394e-07, "loss": 0.4534, "mean_token_accuracy": 0.8537956774234772, "num_tokens": 1038723262.0, "step": 32546 }, { "entropy": 0.5279366634786129, "epoch": 2.994496868908172, "grad_norm": 0.15618379414081573, "learning_rate": 1.8707639463918792e-07, "loss": 0.5109, "mean_token_accuracy": 0.8339962363243103, "num_tokens": 1038755259.0, "step": 32547 }, { "entropy": 0.5671944040805101, "epoch": 2.994588875279613, "grad_norm": 0.16662000119686127, "learning_rate": 1.8400956849756188e-07, "loss": 0.5547, "mean_token_accuracy": 0.8262070268392563, "num_tokens": 1038787254.0, "step": 32548 }, { "entropy": 0.5727398842573166, "epoch": 2.994680881651054, "grad_norm": 0.1598084270954132, "learning_rate": 1.8094274235593584e-07, "loss": 0.5602, "mean_token_accuracy": 0.8208267539739609, "num_tokens": 1038819741.0, "step": 32549 }, { "entropy": 0.5299432007595897, "epoch": 2.9947728880224957, "grad_norm": 0.1576143354177475, "learning_rate": 1.7787591621430983e-07, "loss": 0.5263, "mean_token_accuracy": 0.833133514970541, "num_tokens": 1038851516.0, "step": 32550 }, { "entropy": 0.502737844362855, "epoch": 2.994864894393937, "grad_norm": 0.15251940488815308, "learning_rate": 1.748090900726838e-07, "loss": 0.4916, "mean_token_accuracy": 0.8436849191784859, "num_tokens": 1038883793.0, "step": 32551 }, { "entropy": 0.6512576807290316, "epoch": 2.994956900765378, "grad_norm": 0.17518053948879242, "learning_rate": 1.7174226393105775e-07, "loss": 0.641, "mean_token_accuracy": 0.8011804558336735, "num_tokens": 1038915568.0, "step": 32552 }, { "entropy": 0.44325100909918547, "epoch": 2.995048907136819, "grad_norm": 0.14696884155273438, "learning_rate": 1.6867543778943173e-07, "loss": 0.4377, "mean_token_accuracy": 0.8605886623263359, "num_tokens": 1038948336.0, "step": 32553 }, { "entropy": 0.5668432172387838, "epoch": 2.9951409135082603, "grad_norm": 0.16381089389324188, "learning_rate": 1.656086116478057e-07, "loss": 0.5575, "mean_token_accuracy": 0.8242855444550514, "num_tokens": 1038981104.0, "step": 32554 }, { "entropy": 0.5217581456527114, "epoch": 2.995232919879702, "grad_norm": 0.16281262040138245, "learning_rate": 1.6254178550617968e-07, "loss": 0.5136, "mean_token_accuracy": 0.8419105187058449, "num_tokens": 1039012438.0, "step": 32555 }, { "entropy": 0.4782115323469043, "epoch": 2.995324926251143, "grad_norm": 0.15541908144950867, "learning_rate": 1.5947495936455364e-07, "loss": 0.4703, "mean_token_accuracy": 0.8501060754060745, "num_tokens": 1039044326.0, "step": 32556 }, { "entropy": 0.5458064679987729, "epoch": 2.995416932622584, "grad_norm": 0.16566140949726105, "learning_rate": 1.564081332229276e-07, "loss": 0.5314, "mean_token_accuracy": 0.8336336761713028, "num_tokens": 1039075722.0, "step": 32557 }, { "entropy": 0.5797093529254198, "epoch": 2.9955089389940253, "grad_norm": 0.17091773450374603, "learning_rate": 1.5334130708130156e-07, "loss": 0.5666, "mean_token_accuracy": 0.8207139372825623, "num_tokens": 1039107689.0, "step": 32558 }, { "entropy": 0.46307712816633284, "epoch": 2.9956009453654664, "grad_norm": 0.15370526909828186, "learning_rate": 1.5027448093967554e-07, "loss": 0.4548, "mean_token_accuracy": 0.8573250211775303, "num_tokens": 1039139990.0, "step": 32559 }, { "entropy": 0.574143236503005, "epoch": 2.995692951736908, "grad_norm": 0.166622132062912, "learning_rate": 1.4720765479804953e-07, "loss": 0.5601, "mean_token_accuracy": 0.8256207220256329, "num_tokens": 1039172253.0, "step": 32560 }, { "entropy": 0.5849631559103727, "epoch": 2.995784958108349, "grad_norm": 0.16948184370994568, "learning_rate": 1.441408286564235e-07, "loss": 0.5716, "mean_token_accuracy": 0.8230915926396847, "num_tokens": 1039204262.0, "step": 32561 }, { "entropy": 0.5466214530169964, "epoch": 2.9958769644797902, "grad_norm": 0.16961687803268433, "learning_rate": 1.4107400251479745e-07, "loss": 0.5367, "mean_token_accuracy": 0.8291136063635349, "num_tokens": 1039235680.0, "step": 32562 }, { "entropy": 0.49312388175167143, "epoch": 2.9959689708512314, "grad_norm": 0.1580779254436493, "learning_rate": 1.380071763731714e-07, "loss": 0.4844, "mean_token_accuracy": 0.8460257761180401, "num_tokens": 1039267301.0, "step": 32563 }, { "entropy": 0.4128842381760478, "epoch": 2.9960609772226725, "grad_norm": 0.14764712750911713, "learning_rate": 1.3494035023154536e-07, "loss": 0.4181, "mean_token_accuracy": 0.8680311627686024, "num_tokens": 1039299135.0, "step": 32564 }, { "entropy": 0.5731050679460168, "epoch": 2.996152983594114, "grad_norm": 0.1644684225320816, "learning_rate": 1.3187352408991935e-07, "loss": 0.5739, "mean_token_accuracy": 0.8198948614299297, "num_tokens": 1039331572.0, "step": 32565 }, { "entropy": 0.49408612214028835, "epoch": 2.996244989965555, "grad_norm": 0.15806028246879578, "learning_rate": 1.288066979482933e-07, "loss": 0.4838, "mean_token_accuracy": 0.8437324464321136, "num_tokens": 1039363052.0, "step": 32566 }, { "entropy": 0.47649630066007376, "epoch": 2.9963369963369964, "grad_norm": 0.15427705645561218, "learning_rate": 1.257398718066673e-07, "loss": 0.462, "mean_token_accuracy": 0.8526766113936901, "num_tokens": 1039393829.0, "step": 32567 }, { "entropy": 0.4876908613368869, "epoch": 2.9964290027084375, "grad_norm": 0.15040777623653412, "learning_rate": 1.2267304566504126e-07, "loss": 0.4844, "mean_token_accuracy": 0.8466574586927891, "num_tokens": 1039426293.0, "step": 32568 }, { "entropy": 0.4633932542055845, "epoch": 2.9965210090798786, "grad_norm": 0.1544238179922104, "learning_rate": 1.1960621952341521e-07, "loss": 0.4481, "mean_token_accuracy": 0.8561103828251362, "num_tokens": 1039458426.0, "step": 32569 }, { "entropy": 0.4465142614208162, "epoch": 2.99661301545132, "grad_norm": 0.1468755155801773, "learning_rate": 1.165393933817892e-07, "loss": 0.4402, "mean_token_accuracy": 0.8586387187242508, "num_tokens": 1039490155.0, "step": 32570 }, { "entropy": 0.5133038926869631, "epoch": 2.9967050218227613, "grad_norm": 0.15211813151836395, "learning_rate": 1.1347256724016316e-07, "loss": 0.5105, "mean_token_accuracy": 0.8422166705131531, "num_tokens": 1039522619.0, "step": 32571 }, { "entropy": 0.6132980640977621, "epoch": 2.9967970281942025, "grad_norm": 0.176359623670578, "learning_rate": 1.1040574109853713e-07, "loss": 0.6059, "mean_token_accuracy": 0.8085598945617676, "num_tokens": 1039553224.0, "step": 32572 }, { "entropy": 0.5359079893678427, "epoch": 2.9968890345656436, "grad_norm": 0.15525488555431366, "learning_rate": 1.0733891495691109e-07, "loss": 0.5271, "mean_token_accuracy": 0.8354080840945244, "num_tokens": 1039585701.0, "step": 32573 }, { "entropy": 0.5553355626761913, "epoch": 2.9969810409370847, "grad_norm": 0.1667434275150299, "learning_rate": 1.0427208881528506e-07, "loss": 0.544, "mean_token_accuracy": 0.8247694410383701, "num_tokens": 1039617740.0, "step": 32574 }, { "entropy": 0.4849728960543871, "epoch": 2.9970730473085263, "grad_norm": 0.15033572912216187, "learning_rate": 1.0120526267365905e-07, "loss": 0.4578, "mean_token_accuracy": 0.8561784885823727, "num_tokens": 1039649786.0, "step": 32575 }, { "entropy": 0.5201933146454394, "epoch": 2.9971650536799674, "grad_norm": 0.15671683847904205, "learning_rate": 9.813843653203301e-08, "loss": 0.5081, "mean_token_accuracy": 0.8401416651904583, "num_tokens": 1039681812.0, "step": 32576 }, { "entropy": 0.5700886305421591, "epoch": 2.9972570600514086, "grad_norm": 0.16642138361930847, "learning_rate": 9.507161039040697e-08, "loss": 0.5608, "mean_token_accuracy": 0.8212116472423077, "num_tokens": 1039713553.0, "step": 32577 }, { "entropy": 0.4662871566833928, "epoch": 2.9973490664228497, "grad_norm": 0.15317252278327942, "learning_rate": 9.200478424878094e-08, "loss": 0.4538, "mean_token_accuracy": 0.8534101285040379, "num_tokens": 1039745660.0, "step": 32578 }, { "entropy": 0.5439997753128409, "epoch": 2.997441072794291, "grad_norm": 0.16222256422042847, "learning_rate": 8.893795810715491e-08, "loss": 0.5386, "mean_token_accuracy": 0.8300264440476894, "num_tokens": 1039777590.0, "step": 32579 }, { "entropy": 0.4498083684593439, "epoch": 2.9975330791657324, "grad_norm": 0.15002478659152985, "learning_rate": 8.587113196552887e-08, "loss": 0.4417, "mean_token_accuracy": 0.8609254211187363, "num_tokens": 1039809540.0, "step": 32580 }, { "entropy": 0.45930738863535225, "epoch": 2.9976250855371736, "grad_norm": 0.14743363857269287, "learning_rate": 8.280430582390285e-08, "loss": 0.4331, "mean_token_accuracy": 0.8604478724300861, "num_tokens": 1039841038.0, "step": 32581 }, { "entropy": 0.5693882189225405, "epoch": 2.9977170919086147, "grad_norm": 0.15961895883083344, "learning_rate": 7.973747968227682e-08, "loss": 0.562, "mean_token_accuracy": 0.8266643323004246, "num_tokens": 1039873009.0, "step": 32582 }, { "entropy": 0.4707766892388463, "epoch": 2.997809098280056, "grad_norm": 0.152934730052948, "learning_rate": 7.667065354065078e-08, "loss": 0.4599, "mean_token_accuracy": 0.8518671542406082, "num_tokens": 1039905039.0, "step": 32583 }, { "entropy": 0.49732233211398125, "epoch": 2.997901104651497, "grad_norm": 0.15353447198867798, "learning_rate": 7.360382739902476e-08, "loss": 0.4757, "mean_token_accuracy": 0.846423365175724, "num_tokens": 1039936617.0, "step": 32584 }, { "entropy": 0.4879288421943784, "epoch": 2.9979931110229385, "grad_norm": 0.1495877355337143, "learning_rate": 7.053700125739872e-08, "loss": 0.463, "mean_token_accuracy": 0.8504310362040997, "num_tokens": 1039968390.0, "step": 32585 }, { "entropy": 0.43780668172985315, "epoch": 2.9980851173943797, "grad_norm": 0.1481904238462448, "learning_rate": 6.747017511577268e-08, "loss": 0.4267, "mean_token_accuracy": 0.8651520647108555, "num_tokens": 1040001087.0, "step": 32586 }, { "entropy": 0.4674735330045223, "epoch": 2.998177123765821, "grad_norm": 0.1535358875989914, "learning_rate": 6.440334897414666e-08, "loss": 0.4557, "mean_token_accuracy": 0.8541503511369228, "num_tokens": 1040032957.0, "step": 32587 }, { "entropy": 0.3516848888248205, "epoch": 2.998269130137262, "grad_norm": 0.13588255643844604, "learning_rate": 6.133652283252063e-08, "loss": 0.3422, "mean_token_accuracy": 0.8860380575060844, "num_tokens": 1040065282.0, "step": 32588 }, { "entropy": 0.4517837893217802, "epoch": 2.998361136508703, "grad_norm": 0.1485452502965927, "learning_rate": 5.82696966908946e-08, "loss": 0.4365, "mean_token_accuracy": 0.8619481585919857, "num_tokens": 1040096804.0, "step": 32589 }, { "entropy": 0.5070592244155705, "epoch": 2.9984531428801446, "grad_norm": 0.15603210031986237, "learning_rate": 5.5202870549268566e-08, "loss": 0.4958, "mean_token_accuracy": 0.8425775989890099, "num_tokens": 1040129200.0, "step": 32590 }, { "entropy": 0.4931426299735904, "epoch": 2.9985451492515858, "grad_norm": 0.15894587337970734, "learning_rate": 5.213604440764253e-08, "loss": 0.4834, "mean_token_accuracy": 0.8466703593730927, "num_tokens": 1040161118.0, "step": 32591 }, { "entropy": 0.45312025398015976, "epoch": 2.998637155623027, "grad_norm": 0.15387864410877228, "learning_rate": 4.9069218266016505e-08, "loss": 0.4469, "mean_token_accuracy": 0.856114849448204, "num_tokens": 1040192214.0, "step": 32592 }, { "entropy": 0.5182721205055714, "epoch": 2.998729161994468, "grad_norm": 0.15639516711235046, "learning_rate": 4.600239212439047e-08, "loss": 0.5074, "mean_token_accuracy": 0.8423645906150341, "num_tokens": 1040223510.0, "step": 32593 }, { "entropy": 0.5402618023799732, "epoch": 2.998821168365909, "grad_norm": 0.1601385623216629, "learning_rate": 4.293556598276444e-08, "loss": 0.5329, "mean_token_accuracy": 0.8353582993149757, "num_tokens": 1040255651.0, "step": 32594 }, { "entropy": 0.5512095429003239, "epoch": 2.9989131747373508, "grad_norm": 0.16194838285446167, "learning_rate": 3.986873984113841e-08, "loss": 0.5376, "mean_token_accuracy": 0.8279604278504848, "num_tokens": 1040287967.0, "step": 32595 }, { "entropy": 0.510215693153441, "epoch": 2.999005181108792, "grad_norm": 0.1584617644548416, "learning_rate": 3.680191369951238e-08, "loss": 0.5085, "mean_token_accuracy": 0.8395956940948963, "num_tokens": 1040320488.0, "step": 32596 }, { "entropy": 0.4503476994577795, "epoch": 2.999097187480233, "grad_norm": 0.15084485709667206, "learning_rate": 3.373508755788634e-08, "loss": 0.4424, "mean_token_accuracy": 0.8585429899394512, "num_tokens": 1040353256.0, "step": 32597 }, { "entropy": 0.42705095652490854, "epoch": 2.999189193851674, "grad_norm": 0.15003405511379242, "learning_rate": 3.0668261416260314e-08, "loss": 0.4222, "mean_token_accuracy": 0.8653552532196045, "num_tokens": 1040385111.0, "step": 32598 }, { "entropy": 0.5067622396163642, "epoch": 2.9992812002231153, "grad_norm": 0.15833155810832977, "learning_rate": 2.7601435274634283e-08, "loss": 0.4922, "mean_token_accuracy": 0.8449217192828655, "num_tokens": 1040416590.0, "step": 32599 }, { "entropy": 0.4428671661298722, "epoch": 2.999373206594557, "grad_norm": 0.1485234647989273, "learning_rate": 2.4534609133008252e-08, "loss": 0.4283, "mean_token_accuracy": 0.8644893020391464, "num_tokens": 1040448262.0, "step": 32600 }, { "entropy": 0.44809275586158037, "epoch": 2.999465212965998, "grad_norm": 0.150173157453537, "learning_rate": 2.146778299138222e-08, "loss": 0.4399, "mean_token_accuracy": 0.8566832840442657, "num_tokens": 1040479852.0, "step": 32601 }, { "entropy": 0.5706205610185862, "epoch": 2.999557219337439, "grad_norm": 0.16554294526576996, "learning_rate": 1.840095684975619e-08, "loss": 0.558, "mean_token_accuracy": 0.8221446499228477, "num_tokens": 1040511624.0, "step": 32602 }, { "entropy": 0.5464887912385166, "epoch": 2.9996492257088803, "grad_norm": 0.1625102162361145, "learning_rate": 1.5334130708130157e-08, "loss": 0.5331, "mean_token_accuracy": 0.8294104002416134, "num_tokens": 1040543191.0, "step": 32603 }, { "entropy": 0.48829369246959686, "epoch": 2.9997412320803214, "grad_norm": 0.15551809966564178, "learning_rate": 1.2267304566504126e-08, "loss": 0.479, "mean_token_accuracy": 0.8443508818745613, "num_tokens": 1040575295.0, "step": 32604 }, { "entropy": 0.5489434562623501, "epoch": 2.999833238451763, "grad_norm": 0.1569431573152542, "learning_rate": 9.200478424878095e-09, "loss": 0.5319, "mean_token_accuracy": 0.8297187462449074, "num_tokens": 1040607283.0, "step": 32605 }, { "entropy": 0.5856823613867164, "epoch": 2.999925244823204, "grad_norm": 0.17174363136291504, "learning_rate": 6.133652283252063e-09, "loss": 0.5775, "mean_token_accuracy": 0.8155203238129616, "num_tokens": 1040637950.0, "step": 32606 }, { "entropy": 0.5558843291722811, "epoch": 3.0, "grad_norm": 0.1852726936340332, "learning_rate": 3.0668261416260315e-09, "loss": 0.5358, "mean_token_accuracy": 0.8309442034134498, "num_tokens": 1040663286.0, "step": 32607 } ], "logging_steps": 1.0, "max_steps": 32607, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.03191513407551e+19, "train_batch_size": 2, "trial_name": null, "trial_params": null }